{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 544, "global_step": 5438, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.000367816091954023, "grad_norm": 2.7641916275024414, "learning_rate": 0.0, "loss": 7.1805, "num_input_tokens_seen": 4624, "step": 1, "train_runtime": 2.7035, "train_tokens_per_second": 1710.397 }, { "epoch": 0.000735632183908046, "grad_norm": 2.057875156402588, "learning_rate": 4e-05, "loss": 5.892, "num_input_tokens_seen": 12848, "step": 2, "train_runtime": 4.3199, "train_tokens_per_second": 2974.117 }, { "epoch": 0.001103448275862069, "grad_norm": 2.612283706665039, "learning_rate": 8e-05, "loss": 6.9995, "num_input_tokens_seen": 18240, "step": 3, "train_runtime": 5.2159, "train_tokens_per_second": 3496.988 }, { "epoch": 0.001471264367816092, "grad_norm": 3.118577480316162, "learning_rate": 0.00012, "loss": 6.7426, "num_input_tokens_seen": 23120, "step": 4, "train_runtime": 6.0224, "train_tokens_per_second": 3838.994 }, { "epoch": 0.0018390804597701149, "grad_norm": 2.8236703872680664, "learning_rate": 0.00016, "loss": 5.1427, "num_input_tokens_seen": 31184, "step": 5, "train_runtime": 7.2549, "train_tokens_per_second": 4298.314 }, { "epoch": 0.002206896551724138, "grad_norm": 3.1930270195007324, "learning_rate": 0.0002, "loss": 4.6294, "num_input_tokens_seen": 37328, "step": 6, "train_runtime": 8.2321, "train_tokens_per_second": 4534.427 }, { "epoch": 0.002574712643678161, "grad_norm": 3.055657386779785, "learning_rate": 0.00019996318792563962, "loss": 4.1374, "num_input_tokens_seen": 44592, "step": 7, "train_runtime": 9.3409, "train_tokens_per_second": 4773.86 }, { "epoch": 0.002942528735632184, "grad_norm": 2.088937759399414, "learning_rate": 0.00019992637585127923, "loss": 3.3767, "num_input_tokens_seen": 50960, "step": 8, "train_runtime": 10.36, "train_tokens_per_second": 4918.932 }, { "epoch": 0.003310344827586207, "grad_norm": 2.6767897605895996, "learning_rate": 0.00019988956377691884, "loss": 3.3144, "num_input_tokens_seen": 56304, "step": 9, "train_runtime": 11.2362, "train_tokens_per_second": 5010.951 }, { "epoch": 0.0036781609195402297, "grad_norm": 2.8294262886047363, "learning_rate": 0.00019985275170255845, "loss": 2.8192, "num_input_tokens_seen": 60576, "step": 10, "train_runtime": 11.961, "train_tokens_per_second": 5064.469 }, { "epoch": 0.004045977011494253, "grad_norm": 1.635740876197815, "learning_rate": 0.00019981593962819808, "loss": 2.564, "num_input_tokens_seen": 67552, "step": 11, "train_runtime": 13.0349, "train_tokens_per_second": 5182.388 }, { "epoch": 0.004413793103448276, "grad_norm": 1.3069396018981934, "learning_rate": 0.00019977912755383766, "loss": 2.4683, "num_input_tokens_seen": 75648, "step": 12, "train_runtime": 14.261, "train_tokens_per_second": 5304.541 }, { "epoch": 0.0047816091954022985, "grad_norm": 1.1834617853164673, "learning_rate": 0.00019974231547947727, "loss": 2.5426, "num_input_tokens_seen": 80176, "step": 13, "train_runtime": 15.0271, "train_tokens_per_second": 5335.427 }, { "epoch": 0.005149425287356322, "grad_norm": 0.8042702078819275, "learning_rate": 0.00019970550340511688, "loss": 2.2478, "num_input_tokens_seen": 88976, "step": 14, "train_runtime": 16.366, "train_tokens_per_second": 5436.65 }, { "epoch": 0.005517241379310344, "grad_norm": 0.9168936610221863, "learning_rate": 0.0001996686913307565, "loss": 2.4822, "num_input_tokens_seen": 93824, "step": 15, "train_runtime": 17.1795, "train_tokens_per_second": 5461.393 }, { "epoch": 0.005885057471264368, "grad_norm": 0.8179077506065369, "learning_rate": 0.0001996318792563961, "loss": 2.2916, "num_input_tokens_seen": 100336, "step": 16, "train_runtime": 18.1928, "train_tokens_per_second": 5515.154 }, { "epoch": 0.006252873563218391, "grad_norm": 0.748948872089386, "learning_rate": 0.0001995950671820357, "loss": 1.9101, "num_input_tokens_seen": 105328, "step": 17, "train_runtime": 18.9957, "train_tokens_per_second": 5544.827 }, { "epoch": 0.006620689655172414, "grad_norm": 0.6820124387741089, "learning_rate": 0.00019955825510767532, "loss": 2.2968, "num_input_tokens_seen": 110640, "step": 18, "train_runtime": 19.8653, "train_tokens_per_second": 5569.503 }, { "epoch": 0.006988505747126437, "grad_norm": 0.6636161208152771, "learning_rate": 0.00019952144303331495, "loss": 2.2185, "num_input_tokens_seen": 118448, "step": 19, "train_runtime": 21.1195, "train_tokens_per_second": 5608.458 }, { "epoch": 0.0073563218390804595, "grad_norm": 0.6526411175727844, "learning_rate": 0.00019948463095895456, "loss": 2.2731, "num_input_tokens_seen": 125648, "step": 20, "train_runtime": 22.2501, "train_tokens_per_second": 5647.084 }, { "epoch": 0.007724137931034483, "grad_norm": 0.6273838877677917, "learning_rate": 0.00019944781888459417, "loss": 1.9624, "num_input_tokens_seen": 136128, "step": 21, "train_runtime": 24.5859, "train_tokens_per_second": 5536.825 }, { "epoch": 0.008091954022988505, "grad_norm": 0.7814621925354004, "learning_rate": 0.00019941100681023378, "loss": 2.2268, "num_input_tokens_seen": 141008, "step": 22, "train_runtime": 25.4363, "train_tokens_per_second": 5543.573 }, { "epoch": 0.00845977011494253, "grad_norm": 0.6532659530639648, "learning_rate": 0.0001993741947358734, "loss": 2.2661, "num_input_tokens_seen": 148560, "step": 23, "train_runtime": 26.615, "train_tokens_per_second": 5581.812 }, { "epoch": 0.008827586206896552, "grad_norm": 0.7463673949241638, "learning_rate": 0.000199337382661513, "loss": 2.0873, "num_input_tokens_seen": 153424, "step": 24, "train_runtime": 27.4236, "train_tokens_per_second": 5594.593 }, { "epoch": 0.009195402298850575, "grad_norm": 0.7072988748550415, "learning_rate": 0.00019930057058715258, "loss": 2.0608, "num_input_tokens_seen": 158096, "step": 25, "train_runtime": 28.234, "train_tokens_per_second": 5599.498 }, { "epoch": 0.009563218390804597, "grad_norm": 0.7270534634590149, "learning_rate": 0.0001992637585127922, "loss": 2.1637, "num_input_tokens_seen": 162704, "step": 26, "train_runtime": 29.018, "train_tokens_per_second": 5607.012 }, { "epoch": 0.009931034482758621, "grad_norm": 0.7840702533721924, "learning_rate": 0.0001992269464384318, "loss": 2.3241, "num_input_tokens_seen": 167680, "step": 27, "train_runtime": 29.8571, "train_tokens_per_second": 5616.093 }, { "epoch": 0.010298850574712644, "grad_norm": 0.6798800826072693, "learning_rate": 0.00019919013436407143, "loss": 2.3167, "num_input_tokens_seen": 176560, "step": 28, "train_runtime": 31.2144, "train_tokens_per_second": 5656.365 }, { "epoch": 0.010666666666666666, "grad_norm": 0.7969369888305664, "learning_rate": 0.00019915332228971104, "loss": 2.2511, "num_input_tokens_seen": 182032, "step": 29, "train_runtime": 32.0914, "train_tokens_per_second": 5672.299 }, { "epoch": 0.011034482758620689, "grad_norm": 0.6256918907165527, "learning_rate": 0.00019911651021535065, "loss": 2.0108, "num_input_tokens_seen": 187344, "step": 30, "train_runtime": 32.9732, "train_tokens_per_second": 5681.703 }, { "epoch": 0.011402298850574713, "grad_norm": 0.576696515083313, "learning_rate": 0.00019907969814099026, "loss": 2.055, "num_input_tokens_seen": 196384, "step": 31, "train_runtime": 34.9768, "train_tokens_per_second": 5614.7 }, { "epoch": 0.011770114942528736, "grad_norm": 0.7484147548675537, "learning_rate": 0.00019904288606662987, "loss": 2.115, "num_input_tokens_seen": 204208, "step": 32, "train_runtime": 36.2152, "train_tokens_per_second": 5638.743 }, { "epoch": 0.012137931034482758, "grad_norm": 0.6978005170822144, "learning_rate": 0.00019900607399226948, "loss": 2.0565, "num_input_tokens_seen": 209888, "step": 33, "train_runtime": 37.113, "train_tokens_per_second": 5655.372 }, { "epoch": 0.012505747126436782, "grad_norm": 0.7106545567512512, "learning_rate": 0.00019896926191790909, "loss": 1.9952, "num_input_tokens_seen": 216192, "step": 34, "train_runtime": 38.1015, "train_tokens_per_second": 5674.114 }, { "epoch": 0.012873563218390805, "grad_norm": 0.7270675897598267, "learning_rate": 0.0001989324498435487, "loss": 2.1925, "num_input_tokens_seen": 222464, "step": 35, "train_runtime": 39.0922, "train_tokens_per_second": 5690.747 }, { "epoch": 0.013241379310344827, "grad_norm": 0.5558647513389587, "learning_rate": 0.0001988956377691883, "loss": 2.0255, "num_input_tokens_seen": 229888, "step": 36, "train_runtime": 40.2696, "train_tokens_per_second": 5708.723 }, { "epoch": 0.01360919540229885, "grad_norm": 0.6663904190063477, "learning_rate": 0.0001988588256948279, "loss": 2.0809, "num_input_tokens_seen": 235456, "step": 37, "train_runtime": 41.1822, "train_tokens_per_second": 5717.42 }, { "epoch": 0.013977011494252874, "grad_norm": 0.6171004772186279, "learning_rate": 0.00019882201362046752, "loss": 2.0906, "num_input_tokens_seen": 240944, "step": 38, "train_runtime": 42.0899, "train_tokens_per_second": 5724.502 }, { "epoch": 0.014344827586206896, "grad_norm": 0.6836889982223511, "learning_rate": 0.00019878520154610713, "loss": 2.1421, "num_input_tokens_seen": 246128, "step": 39, "train_runtime": 42.9646, "train_tokens_per_second": 5728.628 }, { "epoch": 0.014712643678160919, "grad_norm": 0.6907501816749573, "learning_rate": 0.00019874838947174674, "loss": 2.049, "num_input_tokens_seen": 253152, "step": 40, "train_runtime": 44.0632, "train_tokens_per_second": 5745.199 }, { "epoch": 0.015080459770114943, "grad_norm": 0.791257917881012, "learning_rate": 0.00019871157739738635, "loss": 2.1161, "num_input_tokens_seen": 257744, "step": 41, "train_runtime": 44.852, "train_tokens_per_second": 5746.546 }, { "epoch": 0.015448275862068966, "grad_norm": 0.6082923412322998, "learning_rate": 0.00019867476532302596, "loss": 2.0632, "num_input_tokens_seen": 266240, "step": 42, "train_runtime": 46.1241, "train_tokens_per_second": 5772.257 }, { "epoch": 0.01581609195402299, "grad_norm": 0.660675585269928, "learning_rate": 0.00019863795324866557, "loss": 2.0848, "num_input_tokens_seen": 270912, "step": 43, "train_runtime": 46.9415, "train_tokens_per_second": 5771.27 }, { "epoch": 0.01618390804597701, "grad_norm": 0.7294403910636902, "learning_rate": 0.00019860114117430517, "loss": 2.0272, "num_input_tokens_seen": 275680, "step": 44, "train_runtime": 47.7241, "train_tokens_per_second": 5776.539 }, { "epoch": 0.016551724137931035, "grad_norm": 0.6849520206451416, "learning_rate": 0.0001985643290999448, "loss": 2.0366, "num_input_tokens_seen": 281616, "step": 45, "train_runtime": 48.6737, "train_tokens_per_second": 5785.796 }, { "epoch": 0.01691954022988506, "grad_norm": 0.67539381980896, "learning_rate": 0.00019852751702558442, "loss": 2.1385, "num_input_tokens_seen": 287168, "step": 46, "train_runtime": 49.5918, "train_tokens_per_second": 5790.637 }, { "epoch": 0.01728735632183908, "grad_norm": 0.7245020270347595, "learning_rate": 0.00019849070495122403, "loss": 2.189, "num_input_tokens_seen": 292832, "step": 47, "train_runtime": 50.4942, "train_tokens_per_second": 5799.325 }, { "epoch": 0.017655172413793104, "grad_norm": 0.6003301739692688, "learning_rate": 0.0001984538928768636, "loss": 1.8756, "num_input_tokens_seen": 300880, "step": 48, "train_runtime": 51.7412, "train_tokens_per_second": 5815.098 }, { "epoch": 0.018022988505747125, "grad_norm": 0.758628785610199, "learning_rate": 0.00019841708080250322, "loss": 2.1104, "num_input_tokens_seen": 305552, "step": 49, "train_runtime": 52.5593, "train_tokens_per_second": 5813.476 }, { "epoch": 0.01839080459770115, "grad_norm": 0.6878520846366882, "learning_rate": 0.00019838026872814283, "loss": 1.9863, "num_input_tokens_seen": 310800, "step": 50, "train_runtime": 53.4344, "train_tokens_per_second": 5816.477 }, { "epoch": 0.018758620689655173, "grad_norm": 0.671724259853363, "learning_rate": 0.00019834345665378244, "loss": 2.1907, "num_input_tokens_seen": 316768, "step": 51, "train_runtime": 54.3971, "train_tokens_per_second": 5823.251 }, { "epoch": 0.019126436781609194, "grad_norm": 0.6084379553794861, "learning_rate": 0.00019830664457942205, "loss": 1.9718, "num_input_tokens_seen": 324432, "step": 52, "train_runtime": 55.5928, "train_tokens_per_second": 5835.864 }, { "epoch": 0.01949425287356322, "grad_norm": 0.6924793124198914, "learning_rate": 0.00019826983250506165, "loss": 2.1719, "num_input_tokens_seen": 329984, "step": 53, "train_runtime": 56.4761, "train_tokens_per_second": 5842.892 }, { "epoch": 0.019862068965517243, "grad_norm": 0.7155401706695557, "learning_rate": 0.0001982330204307013, "loss": 2.0417, "num_input_tokens_seen": 336144, "step": 54, "train_runtime": 57.4735, "train_tokens_per_second": 5848.68 }, { "epoch": 0.020229885057471263, "grad_norm": 0.7476499080657959, "learning_rate": 0.0001981962083563409, "loss": 2.0562, "num_input_tokens_seen": 340672, "step": 55, "train_runtime": 58.2548, "train_tokens_per_second": 5847.96 }, { "epoch": 0.020597701149425288, "grad_norm": 0.680925726890564, "learning_rate": 0.0001981593962819805, "loss": 2.0042, "num_input_tokens_seen": 346432, "step": 56, "train_runtime": 59.1757, "train_tokens_per_second": 5854.297 }, { "epoch": 0.020965517241379312, "grad_norm": 0.6965209245681763, "learning_rate": 0.00019812258420762012, "loss": 1.9252, "num_input_tokens_seen": 352000, "step": 57, "train_runtime": 60.0969, "train_tokens_per_second": 5857.208 }, { "epoch": 0.021333333333333333, "grad_norm": 0.7026582956314087, "learning_rate": 0.00019808577213325973, "loss": 1.9766, "num_input_tokens_seen": 359616, "step": 58, "train_runtime": 61.3006, "train_tokens_per_second": 5866.44 }, { "epoch": 0.021701149425287357, "grad_norm": 0.7206132411956787, "learning_rate": 0.00019804896005889934, "loss": 2.1241, "num_input_tokens_seen": 365184, "step": 59, "train_runtime": 62.2128, "train_tokens_per_second": 5869.918 }, { "epoch": 0.022068965517241378, "grad_norm": 0.8915102481842041, "learning_rate": 0.00019801214798453894, "loss": 2.1134, "num_input_tokens_seen": 371232, "step": 60, "train_runtime": 63.179, "train_tokens_per_second": 5875.872 }, { "epoch": 0.022436781609195402, "grad_norm": 0.7137648463249207, "learning_rate": 0.00019797533591017853, "loss": 2.1075, "num_input_tokens_seen": 381120, "step": 61, "train_runtime": 65.413, "train_tokens_per_second": 5826.362 }, { "epoch": 0.022804597701149426, "grad_norm": 0.7164263129234314, "learning_rate": 0.00019793852383581816, "loss": 2.222, "num_input_tokens_seen": 386944, "step": 62, "train_runtime": 66.3496, "train_tokens_per_second": 5831.897 }, { "epoch": 0.023172413793103447, "grad_norm": 0.7986876368522644, "learning_rate": 0.00019790171176145777, "loss": 2.1947, "num_input_tokens_seen": 393200, "step": 63, "train_runtime": 67.3526, "train_tokens_per_second": 5837.933 }, { "epoch": 0.02354022988505747, "grad_norm": 0.6848318576812744, "learning_rate": 0.00019786489968709738, "loss": 2.0857, "num_input_tokens_seen": 399840, "step": 64, "train_runtime": 68.3923, "train_tokens_per_second": 5846.27 }, { "epoch": 0.023908045977011495, "grad_norm": 0.6817879676818848, "learning_rate": 0.000197828087612737, "loss": 2.2208, "num_input_tokens_seen": 405040, "step": 65, "train_runtime": 69.268, "train_tokens_per_second": 5847.432 }, { "epoch": 0.024275862068965516, "grad_norm": 0.6265236735343933, "learning_rate": 0.0001977912755383766, "loss": 2.0757, "num_input_tokens_seen": 412400, "step": 66, "train_runtime": 70.4133, "train_tokens_per_second": 5856.85 }, { "epoch": 0.02464367816091954, "grad_norm": 0.6848111152648926, "learning_rate": 0.0001977544634640162, "loss": 2.108, "num_input_tokens_seen": 418752, "step": 67, "train_runtime": 71.4046, "train_tokens_per_second": 5864.495 }, { "epoch": 0.025011494252873565, "grad_norm": 0.8280056715011597, "learning_rate": 0.00019771765138965582, "loss": 2.1599, "num_input_tokens_seen": 423712, "step": 68, "train_runtime": 72.213, "train_tokens_per_second": 5867.534 }, { "epoch": 0.025379310344827585, "grad_norm": 0.7020395994186401, "learning_rate": 0.00019768083931529542, "loss": 1.9425, "num_input_tokens_seen": 429712, "step": 69, "train_runtime": 73.2099, "train_tokens_per_second": 5869.591 }, { "epoch": 0.02574712643678161, "grad_norm": 0.6710706353187561, "learning_rate": 0.00019764402724093503, "loss": 2.0704, "num_input_tokens_seen": 435968, "step": 70, "train_runtime": 74.201, "train_tokens_per_second": 5875.5 }, { "epoch": 0.026114942528735634, "grad_norm": 0.7658275961875916, "learning_rate": 0.00019760721516657464, "loss": 2.2412, "num_input_tokens_seen": 441104, "step": 71, "train_runtime": 75.0628, "train_tokens_per_second": 5876.468 }, { "epoch": 0.026482758620689655, "grad_norm": 0.7414282560348511, "learning_rate": 0.00019757040309221425, "loss": 1.953, "num_input_tokens_seen": 446656, "step": 72, "train_runtime": 75.9771, "train_tokens_per_second": 5878.826 }, { "epoch": 0.02685057471264368, "grad_norm": 0.6625975966453552, "learning_rate": 0.00019753359101785386, "loss": 1.9609, "num_input_tokens_seen": 451696, "step": 73, "train_runtime": 76.8217, "train_tokens_per_second": 5879.798 }, { "epoch": 0.0272183908045977, "grad_norm": 0.7489330768585205, "learning_rate": 0.00019749677894349347, "loss": 1.977, "num_input_tokens_seen": 456176, "step": 74, "train_runtime": 77.5958, "train_tokens_per_second": 5878.876 }, { "epoch": 0.027586206896551724, "grad_norm": 0.721580982208252, "learning_rate": 0.00019745996686913308, "loss": 2.113, "num_input_tokens_seen": 461136, "step": 75, "train_runtime": 78.4053, "train_tokens_per_second": 5881.442 }, { "epoch": 0.027954022988505748, "grad_norm": 0.6909099817276001, "learning_rate": 0.00019742315479477269, "loss": 1.8897, "num_input_tokens_seen": 465632, "step": 76, "train_runtime": 79.1659, "train_tokens_per_second": 5881.721 }, { "epoch": 0.02832183908045977, "grad_norm": 0.6312218308448792, "learning_rate": 0.0001973863427204123, "loss": 2.0388, "num_input_tokens_seen": 471472, "step": 77, "train_runtime": 80.0953, "train_tokens_per_second": 5886.385 }, { "epoch": 0.028689655172413793, "grad_norm": 0.7163512706756592, "learning_rate": 0.0001973495306460519, "loss": 1.9092, "num_input_tokens_seen": 476880, "step": 78, "train_runtime": 80.9825, "train_tokens_per_second": 5888.683 }, { "epoch": 0.029057471264367817, "grad_norm": 0.6447576880455017, "learning_rate": 0.00019731271857169154, "loss": 2.0245, "num_input_tokens_seen": 486816, "step": 79, "train_runtime": 82.4537, "train_tokens_per_second": 5904.116 }, { "epoch": 0.029425287356321838, "grad_norm": 0.6254683136940002, "learning_rate": 0.00019727590649733115, "loss": 2.0485, "num_input_tokens_seen": 493136, "step": 80, "train_runtime": 83.4795, "train_tokens_per_second": 5907.271 }, { "epoch": 0.029793103448275862, "grad_norm": 0.6712125539779663, "learning_rate": 0.00019723909442297076, "loss": 2.0567, "num_input_tokens_seen": 498016, "step": 81, "train_runtime": 84.3014, "train_tokens_per_second": 5907.567 }, { "epoch": 0.030160919540229886, "grad_norm": 0.7119662761688232, "learning_rate": 0.00019720228234861037, "loss": 1.9589, "num_input_tokens_seen": 504736, "step": 82, "train_runtime": 85.3856, "train_tokens_per_second": 5911.256 }, { "epoch": 0.030528735632183907, "grad_norm": 0.7559812664985657, "learning_rate": 0.00019716547027424998, "loss": 2.3758, "num_input_tokens_seen": 509776, "step": 83, "train_runtime": 86.2249, "train_tokens_per_second": 5912.165 }, { "epoch": 0.03089655172413793, "grad_norm": 0.7353950142860413, "learning_rate": 0.00019712865819988958, "loss": 1.8818, "num_input_tokens_seen": 515584, "step": 84, "train_runtime": 87.1635, "train_tokens_per_second": 5915.134 }, { "epoch": 0.03126436781609195, "grad_norm": 0.676337718963623, "learning_rate": 0.00019709184612552917, "loss": 1.8061, "num_input_tokens_seen": 521408, "step": 85, "train_runtime": 88.1383, "train_tokens_per_second": 5915.793 }, { "epoch": 0.03163218390804598, "grad_norm": 0.6870601177215576, "learning_rate": 0.00019705503405116878, "loss": 1.8463, "num_input_tokens_seen": 527504, "step": 86, "train_runtime": 89.1419, "train_tokens_per_second": 5917.579 }, { "epoch": 0.032, "grad_norm": 0.6499676704406738, "learning_rate": 0.00019701822197680838, "loss": 1.9626, "num_input_tokens_seen": 534000, "step": 87, "train_runtime": 90.2038, "train_tokens_per_second": 5919.928 }, { "epoch": 0.03236781609195402, "grad_norm": 0.7987402081489563, "learning_rate": 0.00019698140990244802, "loss": 2.0343, "num_input_tokens_seen": 539200, "step": 88, "train_runtime": 91.0746, "train_tokens_per_second": 5920.421 }, { "epoch": 0.03273563218390805, "grad_norm": 0.706471860408783, "learning_rate": 0.00019694459782808763, "loss": 2.2647, "num_input_tokens_seen": 545168, "step": 89, "train_runtime": 92.0414, "train_tokens_per_second": 5923.077 }, { "epoch": 0.03310344827586207, "grad_norm": 0.6408177018165588, "learning_rate": 0.00019690778575372724, "loss": 1.9102, "num_input_tokens_seen": 550832, "step": 90, "train_runtime": 92.9689, "train_tokens_per_second": 5924.908 }, { "epoch": 0.03347126436781609, "grad_norm": 0.6255334615707397, "learning_rate": 0.00019687097367936685, "loss": 1.8175, "num_input_tokens_seen": 557872, "step": 91, "train_runtime": 94.6874, "train_tokens_per_second": 5891.721 }, { "epoch": 0.03383908045977012, "grad_norm": 0.7798760533332825, "learning_rate": 0.00019683416160500646, "loss": 2.1608, "num_input_tokens_seen": 562304, "step": 92, "train_runtime": 95.4545, "train_tokens_per_second": 5890.806 }, { "epoch": 0.03420689655172414, "grad_norm": 0.7144827246665955, "learning_rate": 0.00019679734953064606, "loss": 1.9687, "num_input_tokens_seen": 567520, "step": 93, "train_runtime": 96.3045, "train_tokens_per_second": 5892.973 }, { "epoch": 0.03457471264367816, "grad_norm": 0.7443671226501465, "learning_rate": 0.00019676053745628567, "loss": 2.0866, "num_input_tokens_seen": 575472, "step": 94, "train_runtime": 97.564, "train_tokens_per_second": 5898.406 }, { "epoch": 0.03494252873563218, "grad_norm": 0.7238397598266602, "learning_rate": 0.00019672372538192528, "loss": 1.8491, "num_input_tokens_seen": 582480, "step": 95, "train_runtime": 98.6733, "train_tokens_per_second": 5903.114 }, { "epoch": 0.03531034482758621, "grad_norm": 0.6610636115074158, "learning_rate": 0.0001966869133075649, "loss": 1.9805, "num_input_tokens_seen": 587536, "step": 96, "train_runtime": 99.5254, "train_tokens_per_second": 5903.378 }, { "epoch": 0.03567816091954023, "grad_norm": 0.7728227376937866, "learning_rate": 0.0001966501012332045, "loss": 2.0613, "num_input_tokens_seen": 592624, "step": 97, "train_runtime": 100.3693, "train_tokens_per_second": 5904.437 }, { "epoch": 0.03604597701149425, "grad_norm": 0.7076001763343811, "learning_rate": 0.0001966132891588441, "loss": 1.9572, "num_input_tokens_seen": 597536, "step": 98, "train_runtime": 101.2043, "train_tokens_per_second": 5904.255 }, { "epoch": 0.03641379310344828, "grad_norm": 0.7417423129081726, "learning_rate": 0.00019657647708448372, "loss": 2.0314, "num_input_tokens_seen": 601744, "step": 99, "train_runtime": 101.9606, "train_tokens_per_second": 5901.733 }, { "epoch": 0.0367816091954023, "grad_norm": 0.7208441495895386, "learning_rate": 0.00019653966501012333, "loss": 2.0895, "num_input_tokens_seen": 611232, "step": 100, "train_runtime": 103.4121, "train_tokens_per_second": 5910.644 }, { "epoch": 0.03714942528735632, "grad_norm": 0.7312285900115967, "learning_rate": 0.00019650285293576294, "loss": 1.9561, "num_input_tokens_seen": 617136, "step": 101, "train_runtime": 104.3597, "train_tokens_per_second": 5913.55 }, { "epoch": 0.03751724137931035, "grad_norm": 0.7724730372428894, "learning_rate": 0.00019646604086140254, "loss": 1.9849, "num_input_tokens_seen": 621312, "step": 102, "train_runtime": 105.0845, "train_tokens_per_second": 5912.498 }, { "epoch": 0.03788505747126437, "grad_norm": 0.7689005732536316, "learning_rate": 0.00019642922878704215, "loss": 2.0727, "num_input_tokens_seen": 625456, "step": 103, "train_runtime": 105.8097, "train_tokens_per_second": 5911.143 }, { "epoch": 0.03825287356321839, "grad_norm": 0.7934838533401489, "learning_rate": 0.00019639241671268176, "loss": 1.981, "num_input_tokens_seen": 630224, "step": 104, "train_runtime": 106.6147, "train_tokens_per_second": 5911.232 }, { "epoch": 0.038620689655172416, "grad_norm": 0.7310318350791931, "learning_rate": 0.0001963556046383214, "loss": 1.8631, "num_input_tokens_seen": 635408, "step": 105, "train_runtime": 107.4963, "train_tokens_per_second": 5910.973 }, { "epoch": 0.03898850574712644, "grad_norm": 0.7392246127128601, "learning_rate": 0.000196318792563961, "loss": 1.9564, "num_input_tokens_seen": 639856, "step": 106, "train_runtime": 108.2494, "train_tokens_per_second": 5910.943 }, { "epoch": 0.03935632183908046, "grad_norm": 0.8037939071655273, "learning_rate": 0.00019628198048960062, "loss": 2.111, "num_input_tokens_seen": 644816, "step": 107, "train_runtime": 109.1141, "train_tokens_per_second": 5909.557 }, { "epoch": 0.039724137931034485, "grad_norm": 0.7811733484268188, "learning_rate": 0.0001962451684152402, "loss": 1.9755, "num_input_tokens_seen": 648992, "step": 108, "train_runtime": 109.8421, "train_tokens_per_second": 5908.406 }, { "epoch": 0.040091954022988506, "grad_norm": 0.6561762094497681, "learning_rate": 0.0001962083563408798, "loss": 2.0295, "num_input_tokens_seen": 655824, "step": 109, "train_runtime": 110.9528, "train_tokens_per_second": 5910.839 }, { "epoch": 0.04045977011494253, "grad_norm": 0.7730290293693542, "learning_rate": 0.00019617154426651942, "loss": 2.0266, "num_input_tokens_seen": 661232, "step": 110, "train_runtime": 111.8435, "train_tokens_per_second": 5912.118 }, { "epoch": 0.040827586206896554, "grad_norm": 0.7397712469100952, "learning_rate": 0.00019613473219215902, "loss": 1.903, "num_input_tokens_seen": 668048, "step": 111, "train_runtime": 112.9125, "train_tokens_per_second": 5916.509 }, { "epoch": 0.041195402298850575, "grad_norm": 0.775788426399231, "learning_rate": 0.00019609792011779863, "loss": 2.0736, "num_input_tokens_seen": 672672, "step": 112, "train_runtime": 113.6835, "train_tokens_per_second": 5917.059 }, { "epoch": 0.041563218390804596, "grad_norm": 0.7797473669052124, "learning_rate": 0.00019606110804343824, "loss": 1.9446, "num_input_tokens_seen": 678000, "step": 113, "train_runtime": 114.5807, "train_tokens_per_second": 5917.227 }, { "epoch": 0.041931034482758624, "grad_norm": 0.6599826216697693, "learning_rate": 0.00019602429596907788, "loss": 1.8504, "num_input_tokens_seen": 683504, "step": 114, "train_runtime": 115.49, "train_tokens_per_second": 5918.295 }, { "epoch": 0.042298850574712644, "grad_norm": 0.7596398591995239, "learning_rate": 0.0001959874838947175, "loss": 1.9072, "num_input_tokens_seen": 687792, "step": 115, "train_runtime": 116.2558, "train_tokens_per_second": 5916.193 }, { "epoch": 0.042666666666666665, "grad_norm": 0.7828064560890198, "learning_rate": 0.0001959506718203571, "loss": 1.9661, "num_input_tokens_seen": 694304, "step": 116, "train_runtime": 117.278, "train_tokens_per_second": 5920.156 }, { "epoch": 0.04303448275862069, "grad_norm": 0.7471738457679749, "learning_rate": 0.0001959138597459967, "loss": 2.0649, "num_input_tokens_seen": 698976, "step": 117, "train_runtime": 118.0951, "train_tokens_per_second": 5918.756 }, { "epoch": 0.043402298850574714, "grad_norm": 0.8071371912956238, "learning_rate": 0.00019587704767163631, "loss": 2.0733, "num_input_tokens_seen": 704432, "step": 118, "train_runtime": 118.9873, "train_tokens_per_second": 5920.227 }, { "epoch": 0.043770114942528734, "grad_norm": 0.7780758738517761, "learning_rate": 0.00019584023559727592, "loss": 2.0317, "num_input_tokens_seen": 709296, "step": 119, "train_runtime": 119.8229, "train_tokens_per_second": 5919.536 }, { "epoch": 0.044137931034482755, "grad_norm": 0.7223494648933411, "learning_rate": 0.00019580342352291553, "loss": 1.9139, "num_input_tokens_seen": 716320, "step": 120, "train_runtime": 120.9563, "train_tokens_per_second": 5922.14 }, { "epoch": 0.04450574712643678, "grad_norm": 0.7625210285186768, "learning_rate": 0.0001957666114485551, "loss": 1.9894, "num_input_tokens_seen": 720848, "step": 121, "train_runtime": 122.3193, "train_tokens_per_second": 5893.168 }, { "epoch": 0.044873563218390804, "grad_norm": 0.6506988406181335, "learning_rate": 0.00019572979937419475, "loss": 2.0348, "num_input_tokens_seen": 727888, "step": 122, "train_runtime": 123.4414, "train_tokens_per_second": 5896.629 }, { "epoch": 0.045241379310344824, "grad_norm": 0.7588003873825073, "learning_rate": 0.00019569298729983436, "loss": 2.0239, "num_input_tokens_seen": 733184, "step": 123, "train_runtime": 124.3282, "train_tokens_per_second": 5897.164 }, { "epoch": 0.04560919540229885, "grad_norm": 0.7006298303604126, "learning_rate": 0.00019565617522547397, "loss": 2.0033, "num_input_tokens_seen": 738528, "step": 124, "train_runtime": 125.2185, "train_tokens_per_second": 5897.915 }, { "epoch": 0.04597701149425287, "grad_norm": 0.7602880597114563, "learning_rate": 0.00019561936315111358, "loss": 2.1163, "num_input_tokens_seen": 745008, "step": 125, "train_runtime": 126.252, "train_tokens_per_second": 5900.958 }, { "epoch": 0.046344827586206894, "grad_norm": 0.704163134098053, "learning_rate": 0.00019558255107675319, "loss": 1.9013, "num_input_tokens_seen": 750800, "step": 126, "train_runtime": 127.2374, "train_tokens_per_second": 5900.779 }, { "epoch": 0.04671264367816092, "grad_norm": 0.812581479549408, "learning_rate": 0.0001955457390023928, "loss": 1.8615, "num_input_tokens_seen": 756416, "step": 127, "train_runtime": 128.152, "train_tokens_per_second": 5902.491 }, { "epoch": 0.04708045977011494, "grad_norm": 0.7117610573768616, "learning_rate": 0.0001955089269280324, "loss": 1.8595, "num_input_tokens_seen": 766512, "step": 128, "train_runtime": 129.6708, "train_tokens_per_second": 5911.217 }, { "epoch": 0.04744827586206896, "grad_norm": 0.6793472170829773, "learning_rate": 0.000195472114853672, "loss": 1.6775, "num_input_tokens_seen": 771776, "step": 129, "train_runtime": 130.5364, "train_tokens_per_second": 5912.344 }, { "epoch": 0.04781609195402299, "grad_norm": 0.7294008135795593, "learning_rate": 0.00019543530277931162, "loss": 2.1307, "num_input_tokens_seen": 777696, "step": 130, "train_runtime": 131.4895, "train_tokens_per_second": 5914.509 }, { "epoch": 0.04818390804597701, "grad_norm": 0.7181180715560913, "learning_rate": 0.00019539849070495123, "loss": 1.6838, "num_input_tokens_seen": 782928, "step": 131, "train_runtime": 132.3444, "train_tokens_per_second": 5915.836 }, { "epoch": 0.04855172413793103, "grad_norm": 0.824769914150238, "learning_rate": 0.00019536167863059084, "loss": 2.1886, "num_input_tokens_seen": 788032, "step": 132, "train_runtime": 133.2162, "train_tokens_per_second": 5915.437 }, { "epoch": 0.04891954022988506, "grad_norm": 1.0359686613082886, "learning_rate": 0.00019532486655623045, "loss": 2.1412, "num_input_tokens_seen": 792992, "step": 133, "train_runtime": 134.0748, "train_tokens_per_second": 5914.551 }, { "epoch": 0.04928735632183908, "grad_norm": 0.7491018176078796, "learning_rate": 0.00019528805448187006, "loss": 2.0047, "num_input_tokens_seen": 798208, "step": 134, "train_runtime": 134.9399, "train_tokens_per_second": 5915.287 }, { "epoch": 0.0496551724137931, "grad_norm": 0.7163192629814148, "learning_rate": 0.00019525124240750967, "loss": 1.9637, "num_input_tokens_seen": 804240, "step": 135, "train_runtime": 135.9313, "train_tokens_per_second": 5916.517 }, { "epoch": 0.05002298850574713, "grad_norm": 0.7383331060409546, "learning_rate": 0.00019521443033314927, "loss": 1.8713, "num_input_tokens_seen": 809808, "step": 136, "train_runtime": 136.8463, "train_tokens_per_second": 5917.645 }, { "epoch": 0.05039080459770115, "grad_norm": 0.856783390045166, "learning_rate": 0.00019517761825878888, "loss": 2.0877, "num_input_tokens_seen": 814768, "step": 137, "train_runtime": 137.6868, "train_tokens_per_second": 5917.548 }, { "epoch": 0.05075862068965517, "grad_norm": 0.743935763835907, "learning_rate": 0.0001951408061844285, "loss": 2.071, "num_input_tokens_seen": 819120, "step": 138, "train_runtime": 138.428, "train_tokens_per_second": 5917.298 }, { "epoch": 0.0511264367816092, "grad_norm": 0.8687429428100586, "learning_rate": 0.00019510399411006813, "loss": 1.7694, "num_input_tokens_seen": 823904, "step": 139, "train_runtime": 139.2622, "train_tokens_per_second": 5916.206 }, { "epoch": 0.05149425287356322, "grad_norm": 0.8015475273132324, "learning_rate": 0.00019506718203570774, "loss": 2.1534, "num_input_tokens_seen": 829264, "step": 140, "train_runtime": 140.1519, "train_tokens_per_second": 5916.894 }, { "epoch": 0.05186206896551724, "grad_norm": 0.7176015973091125, "learning_rate": 0.00019503036996134735, "loss": 1.8552, "num_input_tokens_seen": 837184, "step": 141, "train_runtime": 141.4017, "train_tokens_per_second": 5920.608 }, { "epoch": 0.05222988505747127, "grad_norm": 0.808400571346283, "learning_rate": 0.00019499355788698695, "loss": 1.8303, "num_input_tokens_seen": 843648, "step": 142, "train_runtime": 142.4251, "train_tokens_per_second": 5923.451 }, { "epoch": 0.05259770114942529, "grad_norm": 0.7893350124359131, "learning_rate": 0.00019495674581262656, "loss": 1.9399, "num_input_tokens_seen": 848464, "step": 143, "train_runtime": 143.254, "train_tokens_per_second": 5922.796 }, { "epoch": 0.05296551724137931, "grad_norm": 0.7189632058143616, "learning_rate": 0.00019491993373826615, "loss": 1.9882, "num_input_tokens_seen": 853712, "step": 144, "train_runtime": 144.1225, "train_tokens_per_second": 5923.517 }, { "epoch": 0.05333333333333334, "grad_norm": 0.7173884510993958, "learning_rate": 0.00019488312166390575, "loss": 1.9626, "num_input_tokens_seen": 862640, "step": 145, "train_runtime": 145.4933, "train_tokens_per_second": 5929.07 }, { "epoch": 0.05370114942528736, "grad_norm": 0.700886070728302, "learning_rate": 0.00019484630958954536, "loss": 2.0403, "num_input_tokens_seen": 868240, "step": 146, "train_runtime": 146.4209, "train_tokens_per_second": 5929.754 }, { "epoch": 0.05406896551724138, "grad_norm": 0.7500973343849182, "learning_rate": 0.00019480949751518497, "loss": 1.9662, "num_input_tokens_seen": 873792, "step": 147, "train_runtime": 147.3459, "train_tokens_per_second": 5930.209 }, { "epoch": 0.0544367816091954, "grad_norm": 0.688825249671936, "learning_rate": 0.0001947726854408246, "loss": 1.9987, "num_input_tokens_seen": 878896, "step": 148, "train_runtime": 148.2093, "train_tokens_per_second": 5930.098 }, { "epoch": 0.05480459770114943, "grad_norm": 0.7477114200592041, "learning_rate": 0.00019473587336646422, "loss": 1.8754, "num_input_tokens_seen": 884880, "step": 149, "train_runtime": 149.1824, "train_tokens_per_second": 5931.532 }, { "epoch": 0.05517241379310345, "grad_norm": 0.6594926118850708, "learning_rate": 0.00019469906129210383, "loss": 1.8852, "num_input_tokens_seen": 892704, "step": 150, "train_runtime": 150.4013, "train_tokens_per_second": 5935.481 }, { "epoch": 0.05554022988505747, "grad_norm": 0.8141273260116577, "learning_rate": 0.00019466224921774343, "loss": 2.0667, "num_input_tokens_seen": 897776, "step": 151, "train_runtime": 151.7296, "train_tokens_per_second": 5916.947 }, { "epoch": 0.055908045977011496, "grad_norm": 0.7371804118156433, "learning_rate": 0.00019462543714338304, "loss": 1.9458, "num_input_tokens_seen": 902800, "step": 152, "train_runtime": 152.5903, "train_tokens_per_second": 5916.497 }, { "epoch": 0.05627586206896552, "grad_norm": 0.8326572775840759, "learning_rate": 0.00019458862506902265, "loss": 1.8437, "num_input_tokens_seen": 908064, "step": 153, "train_runtime": 153.4696, "train_tokens_per_second": 5916.899 }, { "epoch": 0.05664367816091954, "grad_norm": 0.6677982211112976, "learning_rate": 0.00019455181299466226, "loss": 1.8823, "num_input_tokens_seen": 914304, "step": 154, "train_runtime": 154.4962, "train_tokens_per_second": 5917.969 }, { "epoch": 0.057011494252873565, "grad_norm": 0.8135290145874023, "learning_rate": 0.00019451500092030187, "loss": 1.8449, "num_input_tokens_seen": 919136, "step": 155, "train_runtime": 155.2979, "train_tokens_per_second": 5918.536 }, { "epoch": 0.057379310344827586, "grad_norm": 0.846254825592041, "learning_rate": 0.00019447818884594148, "loss": 1.8222, "num_input_tokens_seen": 923792, "step": 156, "train_runtime": 156.0922, "train_tokens_per_second": 5918.246 }, { "epoch": 0.05774712643678161, "grad_norm": 0.7704864740371704, "learning_rate": 0.0001944413767715811, "loss": 2.081, "num_input_tokens_seen": 928592, "step": 157, "train_runtime": 156.9028, "train_tokens_per_second": 5918.261 }, { "epoch": 0.058114942528735634, "grad_norm": 0.7155718803405762, "learning_rate": 0.0001944045646972207, "loss": 1.7299, "num_input_tokens_seen": 933488, "step": 158, "train_runtime": 157.7431, "train_tokens_per_second": 5917.772 }, { "epoch": 0.058482758620689655, "grad_norm": 0.8601603507995605, "learning_rate": 0.0001943677526228603, "loss": 1.9165, "num_input_tokens_seen": 938368, "step": 159, "train_runtime": 158.5841, "train_tokens_per_second": 5917.165 }, { "epoch": 0.058850574712643676, "grad_norm": 0.6630919575691223, "learning_rate": 0.00019433094054849991, "loss": 1.8437, "num_input_tokens_seen": 944416, "step": 160, "train_runtime": 159.5758, "train_tokens_per_second": 5918.292 }, { "epoch": 0.059218390804597704, "grad_norm": 0.7675873041152954, "learning_rate": 0.00019429412847413952, "loss": 1.8833, "num_input_tokens_seen": 950832, "step": 161, "train_runtime": 160.6078, "train_tokens_per_second": 5920.21 }, { "epoch": 0.059586206896551724, "grad_norm": 0.6628847122192383, "learning_rate": 0.00019425731639977913, "loss": 1.8991, "num_input_tokens_seen": 957472, "step": 162, "train_runtime": 161.6768, "train_tokens_per_second": 5922.136 }, { "epoch": 0.059954022988505745, "grad_norm": 0.7538667917251587, "learning_rate": 0.00019422050432541874, "loss": 1.9682, "num_input_tokens_seen": 962592, "step": 163, "train_runtime": 162.527, "train_tokens_per_second": 5922.66 }, { "epoch": 0.06032183908045977, "grad_norm": 0.7532102465629578, "learning_rate": 0.00019418369225105835, "loss": 2.1817, "num_input_tokens_seen": 967392, "step": 164, "train_runtime": 163.3328, "train_tokens_per_second": 5922.827 }, { "epoch": 0.060689655172413794, "grad_norm": 0.7017723321914673, "learning_rate": 0.00019414688017669799, "loss": 1.6279, "num_input_tokens_seen": 977776, "step": 165, "train_runtime": 164.8869, "train_tokens_per_second": 5929.979 }, { "epoch": 0.061057471264367814, "grad_norm": 0.7645009160041809, "learning_rate": 0.0001941100681023376, "loss": 2.0955, "num_input_tokens_seen": 982480, "step": 166, "train_runtime": 165.6833, "train_tokens_per_second": 5929.866 }, { "epoch": 0.06142528735632184, "grad_norm": 0.7056939005851746, "learning_rate": 0.0001940732560279772, "loss": 2.0229, "num_input_tokens_seen": 986656, "step": 167, "train_runtime": 166.4108, "train_tokens_per_second": 5929.038 }, { "epoch": 0.06179310344827586, "grad_norm": 0.6746269464492798, "learning_rate": 0.00019403644395361679, "loss": 1.9518, "num_input_tokens_seen": 992192, "step": 168, "train_runtime": 167.3108, "train_tokens_per_second": 5930.232 }, { "epoch": 0.062160919540229884, "grad_norm": 0.833311915397644, "learning_rate": 0.0001939996318792564, "loss": 2.1163, "num_input_tokens_seen": 998560, "step": 169, "train_runtime": 168.3248, "train_tokens_per_second": 5932.339 }, { "epoch": 0.0625287356321839, "grad_norm": 0.6848273277282715, "learning_rate": 0.000193962819804896, "loss": 1.7791, "num_input_tokens_seen": 1008480, "step": 170, "train_runtime": 169.8266, "train_tokens_per_second": 5938.292 }, { "epoch": 0.06289655172413793, "grad_norm": 0.7359018325805664, "learning_rate": 0.0001939260077305356, "loss": 2.0557, "num_input_tokens_seen": 1013920, "step": 171, "train_runtime": 170.74, "train_tokens_per_second": 5938.385 }, { "epoch": 0.06326436781609196, "grad_norm": 0.7058089375495911, "learning_rate": 0.00019388919565617522, "loss": 1.9924, "num_input_tokens_seen": 1019136, "step": 172, "train_runtime": 171.6074, "train_tokens_per_second": 5938.765 }, { "epoch": 0.06363218390804598, "grad_norm": 0.76641845703125, "learning_rate": 0.00019385238358181483, "loss": 1.9809, "num_input_tokens_seen": 1026608, "step": 173, "train_runtime": 172.7726, "train_tokens_per_second": 5941.96 }, { "epoch": 0.064, "grad_norm": 0.7802574634552002, "learning_rate": 0.00019381557150745447, "loss": 2.0284, "num_input_tokens_seen": 1031312, "step": 174, "train_runtime": 173.5671, "train_tokens_per_second": 5941.865 }, { "epoch": 0.06436781609195402, "grad_norm": 0.6622971892356873, "learning_rate": 0.00019377875943309408, "loss": 1.9194, "num_input_tokens_seen": 1039200, "step": 175, "train_runtime": 174.8053, "train_tokens_per_second": 5944.901 }, { "epoch": 0.06473563218390804, "grad_norm": 0.7032092213630676, "learning_rate": 0.00019374194735873368, "loss": 2.0711, "num_input_tokens_seen": 1046608, "step": 176, "train_runtime": 175.9545, "train_tokens_per_second": 5948.174 }, { "epoch": 0.06510344827586206, "grad_norm": 0.7073813080787659, "learning_rate": 0.0001937051352843733, "loss": 2.0348, "num_input_tokens_seen": 1051536, "step": 177, "train_runtime": 176.7741, "train_tokens_per_second": 5948.474 }, { "epoch": 0.0654712643678161, "grad_norm": 0.8278349041938782, "learning_rate": 0.0001936683232100129, "loss": 2.0159, "num_input_tokens_seen": 1057920, "step": 178, "train_runtime": 177.8032, "train_tokens_per_second": 5949.949 }, { "epoch": 0.06583908045977012, "grad_norm": 0.6394902467727661, "learning_rate": 0.0001936315111356525, "loss": 1.7842, "num_input_tokens_seen": 1065664, "step": 179, "train_runtime": 179.0201, "train_tokens_per_second": 5952.762 }, { "epoch": 0.06620689655172414, "grad_norm": 0.7177083492279053, "learning_rate": 0.00019359469906129212, "loss": 2.049, "num_input_tokens_seen": 1070560, "step": 180, "train_runtime": 179.8403, "train_tokens_per_second": 5952.836 }, { "epoch": 0.06657471264367816, "grad_norm": 0.5524939298629761, "learning_rate": 0.0001935578869869317, "loss": 1.59, "num_input_tokens_seen": 1079584, "step": 181, "train_runtime": 181.7961, "train_tokens_per_second": 5938.432 }, { "epoch": 0.06694252873563218, "grad_norm": 0.650891125202179, "learning_rate": 0.00019352107491257134, "loss": 1.7681, "num_input_tokens_seen": 1085744, "step": 182, "train_runtime": 182.7904, "train_tokens_per_second": 5939.83 }, { "epoch": 0.0673103448275862, "grad_norm": 0.7197988033294678, "learning_rate": 0.00019348426283821095, "loss": 2.0104, "num_input_tokens_seen": 1092928, "step": 183, "train_runtime": 183.9451, "train_tokens_per_second": 5941.598 }, { "epoch": 0.06767816091954024, "grad_norm": 0.7250876426696777, "learning_rate": 0.00019344745076385056, "loss": 2.012, "num_input_tokens_seen": 1098544, "step": 184, "train_runtime": 184.8766, "train_tokens_per_second": 5942.04 }, { "epoch": 0.06804597701149426, "grad_norm": 0.8138119578361511, "learning_rate": 0.00019341063868949016, "loss": 1.8514, "num_input_tokens_seen": 1103024, "step": 185, "train_runtime": 185.6527, "train_tokens_per_second": 5941.331 }, { "epoch": 0.06841379310344828, "grad_norm": 0.7372742295265198, "learning_rate": 0.00019337382661512977, "loss": 2.0076, "num_input_tokens_seen": 1109296, "step": 186, "train_runtime": 186.6716, "train_tokens_per_second": 5942.501 }, { "epoch": 0.0687816091954023, "grad_norm": 0.7455793023109436, "learning_rate": 0.00019333701454076938, "loss": 1.8861, "num_input_tokens_seen": 1115472, "step": 187, "train_runtime": 187.6639, "train_tokens_per_second": 5943.988 }, { "epoch": 0.06914942528735632, "grad_norm": 0.6509843468666077, "learning_rate": 0.000193300202466409, "loss": 1.8759, "num_input_tokens_seen": 1122800, "step": 188, "train_runtime": 188.8104, "train_tokens_per_second": 5946.706 }, { "epoch": 0.06951724137931034, "grad_norm": 0.7092277407646179, "learning_rate": 0.0001932633903920486, "loss": 1.9346, "num_input_tokens_seen": 1128288, "step": 189, "train_runtime": 189.7066, "train_tokens_per_second": 5947.541 }, { "epoch": 0.06988505747126436, "grad_norm": 0.7340949177742004, "learning_rate": 0.0001932265783176882, "loss": 1.9018, "num_input_tokens_seen": 1133280, "step": 190, "train_runtime": 190.5675, "train_tokens_per_second": 5946.87 }, { "epoch": 0.0702528735632184, "grad_norm": 0.7532691359519958, "learning_rate": 0.00019318976624332782, "loss": 1.8199, "num_input_tokens_seen": 1139216, "step": 191, "train_runtime": 191.5455, "train_tokens_per_second": 5947.497 }, { "epoch": 0.07062068965517242, "grad_norm": 0.7443405985832214, "learning_rate": 0.00019315295416896743, "loss": 1.9553, "num_input_tokens_seen": 1145456, "step": 192, "train_runtime": 192.5722, "train_tokens_per_second": 5948.189 }, { "epoch": 0.07098850574712644, "grad_norm": 0.6958128809928894, "learning_rate": 0.00019311614209460704, "loss": 1.9752, "num_input_tokens_seen": 1154736, "step": 193, "train_runtime": 193.9743, "train_tokens_per_second": 5953.035 }, { "epoch": 0.07135632183908046, "grad_norm": 0.7440369129180908, "learning_rate": 0.00019307933002024664, "loss": 1.9428, "num_input_tokens_seen": 1159824, "step": 194, "train_runtime": 194.8327, "train_tokens_per_second": 5952.922 }, { "epoch": 0.07172413793103448, "grad_norm": 0.7526656985282898, "learning_rate": 0.00019304251794588625, "loss": 1.8749, "num_input_tokens_seen": 1165600, "step": 195, "train_runtime": 195.773, "train_tokens_per_second": 5953.833 }, { "epoch": 0.0720919540229885, "grad_norm": 0.6941686272621155, "learning_rate": 0.00019300570587152586, "loss": 1.8185, "num_input_tokens_seen": 1172352, "step": 196, "train_runtime": 196.8749, "train_tokens_per_second": 5954.808 }, { "epoch": 0.07245977011494253, "grad_norm": 0.6862158179283142, "learning_rate": 0.00019296889379716547, "loss": 1.9434, "num_input_tokens_seen": 1178640, "step": 197, "train_runtime": 197.8842, "train_tokens_per_second": 5956.212 }, { "epoch": 0.07282758620689656, "grad_norm": 0.6635754108428955, "learning_rate": 0.00019293208172280508, "loss": 1.8859, "num_input_tokens_seen": 1182816, "step": 198, "train_runtime": 198.6144, "train_tokens_per_second": 5955.338 }, { "epoch": 0.07319540229885058, "grad_norm": 0.7505982518196106, "learning_rate": 0.00019289526964844472, "loss": 2.1551, "num_input_tokens_seen": 1188160, "step": 199, "train_runtime": 199.5198, "train_tokens_per_second": 5955.099 }, { "epoch": 0.0735632183908046, "grad_norm": 0.9316896200180054, "learning_rate": 0.00019285845757408432, "loss": 1.9084, "num_input_tokens_seen": 1192640, "step": 200, "train_runtime": 200.2805, "train_tokens_per_second": 5954.849 }, { "epoch": 0.07393103448275862, "grad_norm": 0.6875803470611572, "learning_rate": 0.00019282164549972393, "loss": 1.9004, "num_input_tokens_seen": 1199184, "step": 201, "train_runtime": 201.3469, "train_tokens_per_second": 5955.812 }, { "epoch": 0.07429885057471264, "grad_norm": 0.7336552739143372, "learning_rate": 0.00019278483342536354, "loss": 2.0354, "num_input_tokens_seen": 1204128, "step": 202, "train_runtime": 202.1979, "train_tokens_per_second": 5955.196 }, { "epoch": 0.07466666666666667, "grad_norm": 0.7187710404396057, "learning_rate": 0.00019274802135100315, "loss": 2.0457, "num_input_tokens_seen": 1210640, "step": 203, "train_runtime": 203.2341, "train_tokens_per_second": 5956.875 }, { "epoch": 0.0750344827586207, "grad_norm": 0.7940569519996643, "learning_rate": 0.00019271120927664273, "loss": 1.814, "num_input_tokens_seen": 1215328, "step": 204, "train_runtime": 204.0195, "train_tokens_per_second": 5956.922 }, { "epoch": 0.07540229885057471, "grad_norm": 0.7493606209754944, "learning_rate": 0.00019267439720228234, "loss": 2.0379, "num_input_tokens_seen": 1220416, "step": 205, "train_runtime": 204.8887, "train_tokens_per_second": 5956.482 }, { "epoch": 0.07577011494252874, "grad_norm": 0.7162241339683533, "learning_rate": 0.00019263758512792195, "loss": 1.8618, "num_input_tokens_seen": 1225584, "step": 206, "train_runtime": 205.754, "train_tokens_per_second": 5956.549 }, { "epoch": 0.07613793103448276, "grad_norm": 0.7061337232589722, "learning_rate": 0.00019260077305356156, "loss": 1.7301, "num_input_tokens_seen": 1234432, "step": 207, "train_runtime": 207.1037, "train_tokens_per_second": 5960.454 }, { "epoch": 0.07650574712643678, "grad_norm": 0.7702038884162903, "learning_rate": 0.0001925639609792012, "loss": 2.174, "num_input_tokens_seen": 1240592, "step": 208, "train_runtime": 208.1051, "train_tokens_per_second": 5961.371 }, { "epoch": 0.07687356321839081, "grad_norm": 0.7636705636978149, "learning_rate": 0.0001925271489048408, "loss": 1.867, "num_input_tokens_seen": 1246032, "step": 209, "train_runtime": 209.0143, "train_tokens_per_second": 5961.467 }, { "epoch": 0.07724137931034483, "grad_norm": 0.8681410551071167, "learning_rate": 0.0001924903368304804, "loss": 1.9139, "num_input_tokens_seen": 1251264, "step": 210, "train_runtime": 209.8934, "train_tokens_per_second": 5961.426 }, { "epoch": 0.07760919540229885, "grad_norm": 0.7371796369552612, "learning_rate": 0.00019245352475612002, "loss": 1.9159, "num_input_tokens_seen": 1256928, "step": 211, "train_runtime": 211.6387, "train_tokens_per_second": 5939.028 }, { "epoch": 0.07797701149425287, "grad_norm": 0.797585666179657, "learning_rate": 0.00019241671268175963, "loss": 2.0173, "num_input_tokens_seen": 1264112, "step": 212, "train_runtime": 212.7609, "train_tokens_per_second": 5941.467 }, { "epoch": 0.0783448275862069, "grad_norm": 0.7724104523658752, "learning_rate": 0.00019237990060739924, "loss": 1.6428, "num_input_tokens_seen": 1268048, "step": 213, "train_runtime": 213.4497, "train_tokens_per_second": 5940.736 }, { "epoch": 0.07871264367816092, "grad_norm": 0.8864970207214355, "learning_rate": 0.00019234308853303885, "loss": 1.7023, "num_input_tokens_seen": 1272768, "step": 214, "train_runtime": 214.2451, "train_tokens_per_second": 5940.71 }, { "epoch": 0.07908045977011494, "grad_norm": 0.7212643027305603, "learning_rate": 0.00019230627645867846, "loss": 1.9303, "num_input_tokens_seen": 1279456, "step": 215, "train_runtime": 215.3088, "train_tokens_per_second": 5942.424 }, { "epoch": 0.07944827586206897, "grad_norm": 0.822053849697113, "learning_rate": 0.00019226946438431807, "loss": 2.0435, "num_input_tokens_seen": 1284064, "step": 216, "train_runtime": 216.1007, "train_tokens_per_second": 5941.972 }, { "epoch": 0.07981609195402299, "grad_norm": 0.8493820428848267, "learning_rate": 0.00019223265230995768, "loss": 1.9627, "num_input_tokens_seen": 1288400, "step": 217, "train_runtime": 216.8378, "train_tokens_per_second": 5941.769 }, { "epoch": 0.08018390804597701, "grad_norm": 0.7004702687263489, "learning_rate": 0.00019219584023559728, "loss": 1.8237, "num_input_tokens_seen": 1295120, "step": 218, "train_runtime": 217.9149, "train_tokens_per_second": 5943.237 }, { "epoch": 0.08055172413793103, "grad_norm": 0.7256537675857544, "learning_rate": 0.0001921590281612369, "loss": 1.7867, "num_input_tokens_seen": 1299584, "step": 219, "train_runtime": 218.6966, "train_tokens_per_second": 5942.407 }, { "epoch": 0.08091954022988505, "grad_norm": 0.710449755191803, "learning_rate": 0.0001921222160868765, "loss": 1.8448, "num_input_tokens_seen": 1305504, "step": 220, "train_runtime": 219.6432, "train_tokens_per_second": 5943.748 }, { "epoch": 0.08128735632183907, "grad_norm": 0.8347249627113342, "learning_rate": 0.0001920854040125161, "loss": 1.7269, "num_input_tokens_seen": 1312032, "step": 221, "train_runtime": 220.6707, "train_tokens_per_second": 5945.656 }, { "epoch": 0.08165517241379311, "grad_norm": 0.6923952698707581, "learning_rate": 0.00019204859193815572, "loss": 1.7396, "num_input_tokens_seen": 1317600, "step": 222, "train_runtime": 221.5963, "train_tokens_per_second": 5945.947 }, { "epoch": 0.08202298850574713, "grad_norm": 0.8048452734947205, "learning_rate": 0.00019201177986379533, "loss": 1.9067, "num_input_tokens_seen": 1322128, "step": 223, "train_runtime": 222.3803, "train_tokens_per_second": 5945.346 }, { "epoch": 0.08239080459770115, "grad_norm": 0.8158103823661804, "learning_rate": 0.00019197496778943494, "loss": 2.1227, "num_input_tokens_seen": 1328480, "step": 224, "train_runtime": 223.4103, "train_tokens_per_second": 5946.369 }, { "epoch": 0.08275862068965517, "grad_norm": 0.7361687421798706, "learning_rate": 0.00019193815571507457, "loss": 1.8807, "num_input_tokens_seen": 1333520, "step": 225, "train_runtime": 224.2625, "train_tokens_per_second": 5946.245 }, { "epoch": 0.08312643678160919, "grad_norm": 0.6840609312057495, "learning_rate": 0.00019190134364071418, "loss": 1.9136, "num_input_tokens_seen": 1339040, "step": 226, "train_runtime": 225.1582, "train_tokens_per_second": 5947.107 }, { "epoch": 0.08349425287356321, "grad_norm": 0.7369843125343323, "learning_rate": 0.00019186453156635376, "loss": 1.9659, "num_input_tokens_seen": 1344880, "step": 227, "train_runtime": 226.1295, "train_tokens_per_second": 5947.389 }, { "epoch": 0.08386206896551725, "grad_norm": 0.785943329334259, "learning_rate": 0.00019182771949199337, "loss": 1.7901, "num_input_tokens_seen": 1349840, "step": 228, "train_runtime": 226.9633, "train_tokens_per_second": 5947.393 }, { "epoch": 0.08422988505747127, "grad_norm": 0.6510745882987976, "learning_rate": 0.00019179090741763298, "loss": 1.8959, "num_input_tokens_seen": 1357520, "step": 229, "train_runtime": 228.1892, "train_tokens_per_second": 5949.098 }, { "epoch": 0.08459770114942529, "grad_norm": 0.847619891166687, "learning_rate": 0.0001917540953432726, "loss": 1.9112, "num_input_tokens_seen": 1362224, "step": 230, "train_runtime": 228.9873, "train_tokens_per_second": 5948.905 }, { "epoch": 0.08496551724137931, "grad_norm": 0.7419125437736511, "learning_rate": 0.0001917172832689122, "loss": 2.0395, "num_input_tokens_seen": 1368336, "step": 231, "train_runtime": 229.9886, "train_tokens_per_second": 5949.581 }, { "epoch": 0.08533333333333333, "grad_norm": 0.7783828973770142, "learning_rate": 0.0001916804711945518, "loss": 1.9454, "num_input_tokens_seen": 1372864, "step": 232, "train_runtime": 230.7706, "train_tokens_per_second": 5949.041 }, { "epoch": 0.08570114942528735, "grad_norm": 0.7647214531898499, "learning_rate": 0.00019164365912019142, "loss": 1.8955, "num_input_tokens_seen": 1377808, "step": 233, "train_runtime": 231.5597, "train_tokens_per_second": 5950.121 }, { "epoch": 0.08606896551724139, "grad_norm": 0.7165390253067017, "learning_rate": 0.00019160684704583105, "loss": 1.9889, "num_input_tokens_seen": 1384784, "step": 234, "train_runtime": 232.6514, "train_tokens_per_second": 5952.185 }, { "epoch": 0.0864367816091954, "grad_norm": 0.8087878823280334, "learning_rate": 0.00019157003497147066, "loss": 1.8181, "num_input_tokens_seen": 1391072, "step": 235, "train_runtime": 233.6636, "train_tokens_per_second": 5953.31 }, { "epoch": 0.08680459770114943, "grad_norm": 0.8888574838638306, "learning_rate": 0.00019153322289711027, "loss": 1.9668, "num_input_tokens_seen": 1396048, "step": 236, "train_runtime": 234.508, "train_tokens_per_second": 5953.094 }, { "epoch": 0.08717241379310345, "grad_norm": 0.9070819616317749, "learning_rate": 0.00019149641082274988, "loss": 1.9223, "num_input_tokens_seen": 1401600, "step": 237, "train_runtime": 235.423, "train_tokens_per_second": 5953.539 }, { "epoch": 0.08754022988505747, "grad_norm": 0.7615693211555481, "learning_rate": 0.0001914595987483895, "loss": 2.067, "num_input_tokens_seen": 1407728, "step": 238, "train_runtime": 236.4278, "train_tokens_per_second": 5954.155 }, { "epoch": 0.08790804597701149, "grad_norm": 0.7873780131340027, "learning_rate": 0.0001914227866740291, "loss": 1.9651, "num_input_tokens_seen": 1413600, "step": 239, "train_runtime": 237.4136, "train_tokens_per_second": 5954.165 }, { "epoch": 0.08827586206896551, "grad_norm": 0.8089304566383362, "learning_rate": 0.0001913859745996687, "loss": 1.7522, "num_input_tokens_seen": 1419696, "step": 240, "train_runtime": 238.4135, "train_tokens_per_second": 5954.763 }, { "epoch": 0.08864367816091955, "grad_norm": 0.7701553106307983, "learning_rate": 0.0001913491625253083, "loss": 1.7723, "num_input_tokens_seen": 1425312, "step": 241, "train_runtime": 239.8515, "train_tokens_per_second": 5942.476 }, { "epoch": 0.08901149425287357, "grad_norm": 0.626757800579071, "learning_rate": 0.00019131235045094792, "loss": 1.8497, "num_input_tokens_seen": 1435088, "step": 242, "train_runtime": 241.3315, "train_tokens_per_second": 5946.543 }, { "epoch": 0.08937931034482759, "grad_norm": 0.8239079713821411, "learning_rate": 0.00019127553837658753, "loss": 1.9828, "num_input_tokens_seen": 1440080, "step": 243, "train_runtime": 242.1764, "train_tokens_per_second": 5946.408 }, { "epoch": 0.08974712643678161, "grad_norm": 0.7541573643684387, "learning_rate": 0.00019123872630222714, "loss": 1.9666, "num_input_tokens_seen": 1445360, "step": 244, "train_runtime": 243.0461, "train_tokens_per_second": 5946.856 }, { "epoch": 0.09011494252873563, "grad_norm": 0.7623248100280762, "learning_rate": 0.00019120191422786675, "loss": 2.2626, "num_input_tokens_seen": 1451968, "step": 245, "train_runtime": 244.1103, "train_tokens_per_second": 5948.001 }, { "epoch": 0.09048275862068965, "grad_norm": 0.6623736619949341, "learning_rate": 0.00019116510215350636, "loss": 1.9304, "num_input_tokens_seen": 1456608, "step": 246, "train_runtime": 244.8875, "train_tokens_per_second": 5948.071 }, { "epoch": 0.09085057471264368, "grad_norm": 0.7321152687072754, "learning_rate": 0.00019112829007914597, "loss": 2.1734, "num_input_tokens_seen": 1460976, "step": 247, "train_runtime": 245.6377, "train_tokens_per_second": 5947.687 }, { "epoch": 0.0912183908045977, "grad_norm": 0.6610857844352722, "learning_rate": 0.00019109147800478558, "loss": 2.0194, "num_input_tokens_seen": 1466416, "step": 248, "train_runtime": 246.5502, "train_tokens_per_second": 5947.737 }, { "epoch": 0.09158620689655173, "grad_norm": 0.7229866981506348, "learning_rate": 0.0001910546659304252, "loss": 2.0629, "num_input_tokens_seen": 1471728, "step": 249, "train_runtime": 247.4438, "train_tokens_per_second": 5947.726 }, { "epoch": 0.09195402298850575, "grad_norm": 0.6359601020812988, "learning_rate": 0.0001910178538560648, "loss": 1.8498, "num_input_tokens_seen": 1477264, "step": 250, "train_runtime": 248.366, "train_tokens_per_second": 5947.932 }, { "epoch": 0.09232183908045977, "grad_norm": 0.7383832335472107, "learning_rate": 0.0001909810417817044, "loss": 2.0568, "num_input_tokens_seen": 1482000, "step": 251, "train_runtime": 249.2068, "train_tokens_per_second": 5946.868 }, { "epoch": 0.09268965517241379, "grad_norm": 0.7328740358352661, "learning_rate": 0.00019094422970734401, "loss": 2.0613, "num_input_tokens_seen": 1486800, "step": 252, "train_runtime": 250.0313, "train_tokens_per_second": 5946.455 }, { "epoch": 0.09305747126436782, "grad_norm": 0.6441663503646851, "learning_rate": 0.00019090741763298362, "loss": 1.7576, "num_input_tokens_seen": 1492976, "step": 253, "train_runtime": 251.0282, "train_tokens_per_second": 5947.444 }, { "epoch": 0.09342528735632184, "grad_norm": 0.721956193447113, "learning_rate": 0.00019087060555862323, "loss": 2.0332, "num_input_tokens_seen": 1499360, "step": 254, "train_runtime": 252.0726, "train_tokens_per_second": 5948.128 }, { "epoch": 0.09379310344827586, "grad_norm": 0.7011234760284424, "learning_rate": 0.00019083379348426284, "loss": 1.9336, "num_input_tokens_seen": 1504304, "step": 255, "train_runtime": 252.9219, "train_tokens_per_second": 5947.701 }, { "epoch": 0.09416091954022988, "grad_norm": 0.7434554100036621, "learning_rate": 0.00019079698140990245, "loss": 1.7389, "num_input_tokens_seen": 1513584, "step": 256, "train_runtime": 254.3211, "train_tokens_per_second": 5951.468 }, { "epoch": 0.0945287356321839, "grad_norm": 0.7105264663696289, "learning_rate": 0.00019076016933554206, "loss": 1.8841, "num_input_tokens_seen": 1520432, "step": 257, "train_runtime": 255.4117, "train_tokens_per_second": 5952.867 }, { "epoch": 0.09489655172413793, "grad_norm": 0.7543395757675171, "learning_rate": 0.00019072335726118167, "loss": 1.7332, "num_input_tokens_seen": 1525280, "step": 258, "train_runtime": 256.2414, "train_tokens_per_second": 5952.512 }, { "epoch": 0.09526436781609196, "grad_norm": 0.7514438033103943, "learning_rate": 0.0001906865451868213, "loss": 1.8843, "num_input_tokens_seen": 1530400, "step": 259, "train_runtime": 257.1177, "train_tokens_per_second": 5952.138 }, { "epoch": 0.09563218390804598, "grad_norm": 0.7670447826385498, "learning_rate": 0.0001906497331124609, "loss": 1.9526, "num_input_tokens_seen": 1535216, "step": 260, "train_runtime": 257.936, "train_tokens_per_second": 5951.927 }, { "epoch": 0.096, "grad_norm": 0.6435094475746155, "learning_rate": 0.00019061292103810052, "loss": 1.9275, "num_input_tokens_seen": 1545712, "step": 261, "train_runtime": 259.5147, "train_tokens_per_second": 5956.164 }, { "epoch": 0.09636781609195402, "grad_norm": 0.8275080919265747, "learning_rate": 0.00019057610896374013, "loss": 1.7604, "num_input_tokens_seen": 1550496, "step": 262, "train_runtime": 260.3058, "train_tokens_per_second": 5956.439 }, { "epoch": 0.09673563218390804, "grad_norm": 0.7310609221458435, "learning_rate": 0.00019053929688937974, "loss": 2.0309, "num_input_tokens_seen": 1555312, "step": 263, "train_runtime": 261.1423, "train_tokens_per_second": 5955.803 }, { "epoch": 0.09710344827586206, "grad_norm": 0.7967656254768372, "learning_rate": 0.00019050248481501932, "loss": 1.7773, "num_input_tokens_seen": 1561456, "step": 264, "train_runtime": 262.1296, "train_tokens_per_second": 5956.809 }, { "epoch": 0.09747126436781609, "grad_norm": 0.73561030626297, "learning_rate": 0.00019046567274065893, "loss": 2.0359, "num_input_tokens_seen": 1566480, "step": 265, "train_runtime": 262.96, "train_tokens_per_second": 5957.105 }, { "epoch": 0.09783908045977012, "grad_norm": 0.8052525520324707, "learning_rate": 0.00019042886066629854, "loss": 1.9693, "num_input_tokens_seen": 1571760, "step": 266, "train_runtime": 263.8268, "train_tokens_per_second": 5957.546 }, { "epoch": 0.09820689655172414, "grad_norm": 0.7762439846992493, "learning_rate": 0.00019039204859193815, "loss": 1.9535, "num_input_tokens_seen": 1577888, "step": 267, "train_runtime": 264.8283, "train_tokens_per_second": 5958.155 }, { "epoch": 0.09857471264367816, "grad_norm": 0.8418145179748535, "learning_rate": 0.00019035523651757778, "loss": 1.8523, "num_input_tokens_seen": 1582432, "step": 268, "train_runtime": 265.5949, "train_tokens_per_second": 5958.066 }, { "epoch": 0.09894252873563218, "grad_norm": 0.7509084343910217, "learning_rate": 0.0001903184244432174, "loss": 1.7253, "num_input_tokens_seen": 1587728, "step": 269, "train_runtime": 266.4938, "train_tokens_per_second": 5957.843 }, { "epoch": 0.0993103448275862, "grad_norm": 0.7126884460449219, "learning_rate": 0.000190281612368857, "loss": 1.8486, "num_input_tokens_seen": 1594560, "step": 270, "train_runtime": 267.5912, "train_tokens_per_second": 5958.939 }, { "epoch": 0.09967816091954022, "grad_norm": 0.737308919429779, "learning_rate": 0.0001902448002944966, "loss": 2.015, "num_input_tokens_seen": 1599696, "step": 271, "train_runtime": 268.9544, "train_tokens_per_second": 5947.834 }, { "epoch": 0.10004597701149426, "grad_norm": 0.760443389415741, "learning_rate": 0.00019020798822013622, "loss": 2.2514, "num_input_tokens_seen": 1605232, "step": 272, "train_runtime": 269.8642, "train_tokens_per_second": 5948.296 }, { "epoch": 0.10041379310344828, "grad_norm": 0.7480552196502686, "learning_rate": 0.00019017117614577583, "loss": 1.7752, "num_input_tokens_seen": 1610304, "step": 273, "train_runtime": 270.7357, "train_tokens_per_second": 5947.882 }, { "epoch": 0.1007816091954023, "grad_norm": 0.6984736323356628, "learning_rate": 0.00019013436407141544, "loss": 1.8319, "num_input_tokens_seen": 1616640, "step": 274, "train_runtime": 271.7384, "train_tokens_per_second": 5949.252 }, { "epoch": 0.10114942528735632, "grad_norm": 0.8335543870925903, "learning_rate": 0.00019009755199705505, "loss": 1.9431, "num_input_tokens_seen": 1622208, "step": 275, "train_runtime": 272.6471, "train_tokens_per_second": 5949.845 }, { "epoch": 0.10151724137931034, "grad_norm": 0.710389256477356, "learning_rate": 0.00019006073992269465, "loss": 1.9058, "num_input_tokens_seen": 1627584, "step": 276, "train_runtime": 273.5563, "train_tokens_per_second": 5949.723 }, { "epoch": 0.10188505747126436, "grad_norm": 0.6866905689239502, "learning_rate": 0.00019002392784833426, "loss": 2.0803, "num_input_tokens_seen": 1633776, "step": 277, "train_runtime": 274.5595, "train_tokens_per_second": 5950.535 }, { "epoch": 0.1022528735632184, "grad_norm": 0.6699697971343994, "learning_rate": 0.00018998711577397387, "loss": 1.7394, "num_input_tokens_seen": 1642944, "step": 278, "train_runtime": 275.9506, "train_tokens_per_second": 5953.761 }, { "epoch": 0.10262068965517242, "grad_norm": 0.7261507511138916, "learning_rate": 0.00018995030369961348, "loss": 1.9211, "num_input_tokens_seen": 1647952, "step": 279, "train_runtime": 276.7905, "train_tokens_per_second": 5953.789 }, { "epoch": 0.10298850574712644, "grad_norm": 0.6739513278007507, "learning_rate": 0.0001899134916252531, "loss": 1.9313, "num_input_tokens_seen": 1653136, "step": 280, "train_runtime": 277.6571, "train_tokens_per_second": 5953.875 }, { "epoch": 0.10335632183908046, "grad_norm": 0.6748112440109253, "learning_rate": 0.0001898766795508927, "loss": 1.8026, "num_input_tokens_seen": 1662784, "step": 281, "train_runtime": 279.1249, "train_tokens_per_second": 5957.132 }, { "epoch": 0.10372413793103448, "grad_norm": 0.7566770315170288, "learning_rate": 0.0001898398674765323, "loss": 1.7318, "num_input_tokens_seen": 1669056, "step": 282, "train_runtime": 280.1709, "train_tokens_per_second": 5957.279 }, { "epoch": 0.1040919540229885, "grad_norm": 0.6678112745285034, "learning_rate": 0.00018980305540217192, "loss": 1.8015, "num_input_tokens_seen": 1677040, "step": 283, "train_runtime": 281.4366, "train_tokens_per_second": 5958.855 }, { "epoch": 0.10445977011494254, "grad_norm": 0.7495002746582031, "learning_rate": 0.00018976624332781153, "loss": 2.0167, "num_input_tokens_seen": 1683840, "step": 284, "train_runtime": 282.5108, "train_tokens_per_second": 5960.268 }, { "epoch": 0.10482758620689656, "grad_norm": 0.7781804800033569, "learning_rate": 0.00018972943125345116, "loss": 1.9407, "num_input_tokens_seen": 1689840, "step": 285, "train_runtime": 283.4778, "train_tokens_per_second": 5961.101 }, { "epoch": 0.10519540229885058, "grad_norm": 0.605254054069519, "learning_rate": 0.00018969261917909077, "loss": 1.8986, "num_input_tokens_seen": 1697088, "step": 286, "train_runtime": 284.5868, "train_tokens_per_second": 5963.341 }, { "epoch": 0.1055632183908046, "grad_norm": 0.7675965428352356, "learning_rate": 0.00018965580710473035, "loss": 2.0143, "num_input_tokens_seen": 1702080, "step": 287, "train_runtime": 285.4211, "train_tokens_per_second": 5963.398 }, { "epoch": 0.10593103448275862, "grad_norm": 0.7370654940605164, "learning_rate": 0.00018961899503036996, "loss": 1.8864, "num_input_tokens_seen": 1708352, "step": 288, "train_runtime": 286.4182, "train_tokens_per_second": 5964.537 }, { "epoch": 0.10629885057471264, "grad_norm": 0.7976446747779846, "learning_rate": 0.00018958218295600957, "loss": 1.9853, "num_input_tokens_seen": 1718384, "step": 289, "train_runtime": 287.9519, "train_tokens_per_second": 5967.608 }, { "epoch": 0.10666666666666667, "grad_norm": 0.7801894545555115, "learning_rate": 0.00018954537088164918, "loss": 1.9481, "num_input_tokens_seen": 1723824, "step": 290, "train_runtime": 288.8585, "train_tokens_per_second": 5967.712 }, { "epoch": 0.1070344827586207, "grad_norm": 0.8280543684959412, "learning_rate": 0.0001895085588072888, "loss": 1.8806, "num_input_tokens_seen": 1730512, "step": 291, "train_runtime": 289.9123, "train_tokens_per_second": 5969.088 }, { "epoch": 0.10740229885057472, "grad_norm": 0.7578046917915344, "learning_rate": 0.0001894717467329284, "loss": 1.8189, "num_input_tokens_seen": 1739856, "step": 292, "train_runtime": 291.3373, "train_tokens_per_second": 5971.963 }, { "epoch": 0.10777011494252874, "grad_norm": 0.7137064933776855, "learning_rate": 0.000189434934658568, "loss": 1.8415, "num_input_tokens_seen": 1744496, "step": 293, "train_runtime": 292.1212, "train_tokens_per_second": 5971.824 }, { "epoch": 0.10813793103448276, "grad_norm": 0.6923521161079407, "learning_rate": 0.00018939812258420764, "loss": 1.9076, "num_input_tokens_seen": 1749936, "step": 294, "train_runtime": 293.0484, "train_tokens_per_second": 5971.492 }, { "epoch": 0.10850574712643678, "grad_norm": 0.8342931866645813, "learning_rate": 0.00018936131050984725, "loss": 1.8256, "num_input_tokens_seen": 1754480, "step": 295, "train_runtime": 293.8334, "train_tokens_per_second": 5971.002 }, { "epoch": 0.1088735632183908, "grad_norm": 0.7755042910575867, "learning_rate": 0.00018932449843548686, "loss": 1.8483, "num_input_tokens_seen": 1760672, "step": 296, "train_runtime": 294.8565, "train_tokens_per_second": 5971.284 }, { "epoch": 0.10924137931034483, "grad_norm": 0.8064647316932678, "learning_rate": 0.00018928768636112647, "loss": 1.9537, "num_input_tokens_seen": 1766752, "step": 297, "train_runtime": 295.8338, "train_tokens_per_second": 5972.11 }, { "epoch": 0.10960919540229885, "grad_norm": 0.6643753051757812, "learning_rate": 0.00018925087428676608, "loss": 1.9009, "num_input_tokens_seen": 1773728, "step": 298, "train_runtime": 296.9491, "train_tokens_per_second": 5973.171 }, { "epoch": 0.10997701149425287, "grad_norm": 0.7302203178405762, "learning_rate": 0.00018921406221240569, "loss": 2.1203, "num_input_tokens_seen": 1779744, "step": 299, "train_runtime": 297.9294, "train_tokens_per_second": 5973.71 }, { "epoch": 0.1103448275862069, "grad_norm": 0.9114261269569397, "learning_rate": 0.00018917725013804527, "loss": 1.9024, "num_input_tokens_seen": 1786064, "step": 300, "train_runtime": 298.9549, "train_tokens_per_second": 5974.36 }, { "epoch": 0.11071264367816092, "grad_norm": 0.6636778712272644, "learning_rate": 0.00018914043806368488, "loss": 1.7655, "num_input_tokens_seen": 1790288, "step": 301, "train_runtime": 300.4691, "train_tokens_per_second": 5958.31 }, { "epoch": 0.11108045977011494, "grad_norm": 0.7007011771202087, "learning_rate": 0.0001891036259893245, "loss": 1.8956, "num_input_tokens_seen": 1797184, "step": 302, "train_runtime": 301.5972, "train_tokens_per_second": 5958.888 }, { "epoch": 0.11144827586206897, "grad_norm": 0.6551647782325745, "learning_rate": 0.00018906681391496412, "loss": 1.8594, "num_input_tokens_seen": 1802448, "step": 303, "train_runtime": 302.5017, "train_tokens_per_second": 5958.472 }, { "epoch": 0.11181609195402299, "grad_norm": 0.7097108960151672, "learning_rate": 0.00018903000184060373, "loss": 1.7435, "num_input_tokens_seen": 1808064, "step": 304, "train_runtime": 303.4323, "train_tokens_per_second": 5958.706 }, { "epoch": 0.11218390804597701, "grad_norm": 0.7346459627151489, "learning_rate": 0.00018899318976624334, "loss": 1.8105, "num_input_tokens_seen": 1816320, "step": 305, "train_runtime": 304.6947, "train_tokens_per_second": 5961.115 }, { "epoch": 0.11255172413793103, "grad_norm": 0.6427913308143616, "learning_rate": 0.00018895637769188295, "loss": 1.7099, "num_input_tokens_seen": 1827840, "step": 306, "train_runtime": 306.3925, "train_tokens_per_second": 5965.68 }, { "epoch": 0.11291954022988505, "grad_norm": 0.7342320680618286, "learning_rate": 0.00018891956561752256, "loss": 1.7789, "num_input_tokens_seen": 1837168, "step": 307, "train_runtime": 307.8332, "train_tokens_per_second": 5968.062 }, { "epoch": 0.11328735632183908, "grad_norm": 0.6813055872917175, "learning_rate": 0.00018888275354316217, "loss": 1.774, "num_input_tokens_seen": 1846208, "step": 308, "train_runtime": 309.2113, "train_tokens_per_second": 5970.7 }, { "epoch": 0.11365517241379311, "grad_norm": 0.7257830500602722, "learning_rate": 0.00018884594146880177, "loss": 1.8381, "num_input_tokens_seen": 1850944, "step": 309, "train_runtime": 310.0094, "train_tokens_per_second": 5970.605 }, { "epoch": 0.11402298850574713, "grad_norm": 0.7832248210906982, "learning_rate": 0.00018880912939444138, "loss": 1.7781, "num_input_tokens_seen": 1857984, "step": 310, "train_runtime": 311.1421, "train_tokens_per_second": 5971.496 }, { "epoch": 0.11439080459770115, "grad_norm": 0.6972246170043945, "learning_rate": 0.000188772317320081, "loss": 1.7533, "num_input_tokens_seen": 1862880, "step": 311, "train_runtime": 311.9947, "train_tokens_per_second": 5970.871 }, { "epoch": 0.11475862068965517, "grad_norm": 0.7305742502212524, "learning_rate": 0.0001887355052457206, "loss": 1.6188, "num_input_tokens_seen": 1868720, "step": 312, "train_runtime": 312.9403, "train_tokens_per_second": 5971.49 }, { "epoch": 0.11512643678160919, "grad_norm": 0.7020468711853027, "learning_rate": 0.0001886986931713602, "loss": 1.7287, "num_input_tokens_seen": 1878432, "step": 313, "train_runtime": 314.4184, "train_tokens_per_second": 5974.307 }, { "epoch": 0.11549425287356321, "grad_norm": 0.6499274969100952, "learning_rate": 0.00018866188109699982, "loss": 1.9282, "num_input_tokens_seen": 1885712, "step": 314, "train_runtime": 315.5883, "train_tokens_per_second": 5975.228 }, { "epoch": 0.11586206896551725, "grad_norm": 0.6274926662445068, "learning_rate": 0.00018862506902263943, "loss": 1.8809, "num_input_tokens_seen": 1890864, "step": 315, "train_runtime": 316.4599, "train_tokens_per_second": 5975.051 }, { "epoch": 0.11622988505747127, "grad_norm": 0.6690942049026489, "learning_rate": 0.00018858825694827904, "loss": 1.8814, "num_input_tokens_seen": 1897008, "step": 316, "train_runtime": 317.4438, "train_tokens_per_second": 5975.886 }, { "epoch": 0.11659770114942529, "grad_norm": 0.6185339689254761, "learning_rate": 0.00018855144487391865, "loss": 1.749, "num_input_tokens_seen": 1903200, "step": 317, "train_runtime": 318.458, "train_tokens_per_second": 5976.298 }, { "epoch": 0.11696551724137931, "grad_norm": 0.7599213123321533, "learning_rate": 0.00018851463279955826, "loss": 1.9214, "num_input_tokens_seen": 1908896, "step": 318, "train_runtime": 319.3718, "train_tokens_per_second": 5977.034 }, { "epoch": 0.11733333333333333, "grad_norm": 0.748734176158905, "learning_rate": 0.0001884778207251979, "loss": 1.6331, "num_input_tokens_seen": 1915056, "step": 319, "train_runtime": 320.3784, "train_tokens_per_second": 5977.482 }, { "epoch": 0.11770114942528735, "grad_norm": 0.6842741370201111, "learning_rate": 0.0001884410086508375, "loss": 1.5177, "num_input_tokens_seen": 1920400, "step": 320, "train_runtime": 321.2694, "train_tokens_per_second": 5977.538 }, { "epoch": 0.11806896551724137, "grad_norm": 0.8277127742767334, "learning_rate": 0.0001884041965764771, "loss": 1.9366, "num_input_tokens_seen": 1926160, "step": 321, "train_runtime": 322.2376, "train_tokens_per_second": 5977.453 }, { "epoch": 0.11843678160919541, "grad_norm": 0.6963765025138855, "learning_rate": 0.00018836738450211672, "loss": 1.8562, "num_input_tokens_seen": 1931856, "step": 322, "train_runtime": 323.1614, "train_tokens_per_second": 5977.991 }, { "epoch": 0.11880459770114943, "grad_norm": 0.8006249070167542, "learning_rate": 0.00018833057242775633, "loss": 1.7196, "num_input_tokens_seen": 1936448, "step": 323, "train_runtime": 323.9565, "train_tokens_per_second": 5977.493 }, { "epoch": 0.11917241379310345, "grad_norm": 0.7537630796432495, "learning_rate": 0.0001882937603533959, "loss": 1.9581, "num_input_tokens_seen": 1942464, "step": 324, "train_runtime": 324.9406, "train_tokens_per_second": 5977.905 }, { "epoch": 0.11954022988505747, "grad_norm": 0.6968724727630615, "learning_rate": 0.00018825694827903552, "loss": 1.8721, "num_input_tokens_seen": 1948464, "step": 325, "train_runtime": 325.9105, "train_tokens_per_second": 5978.525 }, { "epoch": 0.11990804597701149, "grad_norm": 0.6964346766471863, "learning_rate": 0.00018822013620467513, "loss": 1.941, "num_input_tokens_seen": 1954944, "step": 326, "train_runtime": 326.9522, "train_tokens_per_second": 5979.296 }, { "epoch": 0.12027586206896551, "grad_norm": 0.8223045468330383, "learning_rate": 0.00018818332413031474, "loss": 2.0361, "num_input_tokens_seen": 1962848, "step": 327, "train_runtime": 328.1729, "train_tokens_per_second": 5981.14 }, { "epoch": 0.12064367816091955, "grad_norm": 0.7109692692756653, "learning_rate": 0.00018814651205595437, "loss": 1.8854, "num_input_tokens_seen": 1967952, "step": 328, "train_runtime": 329.0374, "train_tokens_per_second": 5980.937 }, { "epoch": 0.12101149425287357, "grad_norm": 0.7180686593055725, "learning_rate": 0.00018810969998159398, "loss": 1.8343, "num_input_tokens_seen": 1972928, "step": 329, "train_runtime": 329.8873, "train_tokens_per_second": 5980.613 }, { "epoch": 0.12137931034482759, "grad_norm": 0.6951878070831299, "learning_rate": 0.0001880728879072336, "loss": 1.8489, "num_input_tokens_seen": 1978048, "step": 330, "train_runtime": 330.7614, "train_tokens_per_second": 5980.287 }, { "epoch": 0.12174712643678161, "grad_norm": 0.7157859802246094, "learning_rate": 0.0001880360758328732, "loss": 1.8287, "num_input_tokens_seen": 1982960, "step": 331, "train_runtime": 332.1025, "train_tokens_per_second": 5970.928 }, { "epoch": 0.12211494252873563, "grad_norm": 0.8075045347213745, "learning_rate": 0.0001879992637585128, "loss": 1.8563, "num_input_tokens_seen": 1987360, "step": 332, "train_runtime": 332.8569, "train_tokens_per_second": 5970.614 }, { "epoch": 0.12248275862068965, "grad_norm": 0.5464359521865845, "learning_rate": 0.00018796245168415242, "loss": 1.5142, "num_input_tokens_seen": 1999376, "step": 333, "train_runtime": 335.0336, "train_tokens_per_second": 5967.687 }, { "epoch": 0.12285057471264368, "grad_norm": 0.7989075779914856, "learning_rate": 0.00018792563960979202, "loss": 2.0805, "num_input_tokens_seen": 2004368, "step": 334, "train_runtime": 335.8894, "train_tokens_per_second": 5967.346 }, { "epoch": 0.1232183908045977, "grad_norm": 0.7454589009284973, "learning_rate": 0.00018788882753543163, "loss": 1.8748, "num_input_tokens_seen": 2008912, "step": 335, "train_runtime": 336.6859, "train_tokens_per_second": 5966.724 }, { "epoch": 0.12358620689655173, "grad_norm": 0.7054830193519592, "learning_rate": 0.00018785201546107124, "loss": 1.8777, "num_input_tokens_seen": 2014752, "step": 336, "train_runtime": 337.6222, "train_tokens_per_second": 5967.475 }, { "epoch": 0.12395402298850575, "grad_norm": 0.6879221796989441, "learning_rate": 0.00018781520338671085, "loss": 1.6602, "num_input_tokens_seen": 2020816, "step": 337, "train_runtime": 338.6147, "train_tokens_per_second": 5967.893 }, { "epoch": 0.12432183908045977, "grad_norm": 0.6789718866348267, "learning_rate": 0.00018777839131235046, "loss": 1.8764, "num_input_tokens_seen": 2027536, "step": 338, "train_runtime": 339.6712, "train_tokens_per_second": 5969.113 }, { "epoch": 0.12468965517241379, "grad_norm": 0.7514356374740601, "learning_rate": 0.00018774157923799007, "loss": 1.7888, "num_input_tokens_seen": 2034096, "step": 339, "train_runtime": 340.7086, "train_tokens_per_second": 5970.192 }, { "epoch": 0.1250574712643678, "grad_norm": 0.7880290150642395, "learning_rate": 0.00018770476716362968, "loss": 1.8084, "num_input_tokens_seen": 2038784, "step": 340, "train_runtime": 341.5257, "train_tokens_per_second": 5969.636 }, { "epoch": 0.12542528735632183, "grad_norm": 0.6867057085037231, "learning_rate": 0.0001876679550892693, "loss": 1.7311, "num_input_tokens_seen": 2043248, "step": 341, "train_runtime": 342.3003, "train_tokens_per_second": 5969.167 }, { "epoch": 0.12579310344827585, "grad_norm": 0.7414432168006897, "learning_rate": 0.0001876311430149089, "loss": 1.8801, "num_input_tokens_seen": 2052016, "step": 342, "train_runtime": 343.6221, "train_tokens_per_second": 5971.723 }, { "epoch": 0.1261609195402299, "grad_norm": 0.7141637206077576, "learning_rate": 0.0001875943309405485, "loss": 1.9534, "num_input_tokens_seen": 2057392, "step": 343, "train_runtime": 344.5139, "train_tokens_per_second": 5971.87 }, { "epoch": 0.12652873563218392, "grad_norm": 0.7349096536636353, "learning_rate": 0.0001875575188661881, "loss": 1.9322, "num_input_tokens_seen": 2062096, "step": 344, "train_runtime": 345.3398, "train_tokens_per_second": 5971.209 }, { "epoch": 0.12689655172413794, "grad_norm": 0.7744662761688232, "learning_rate": 0.00018752070679182775, "loss": 2.0181, "num_input_tokens_seen": 2067424, "step": 345, "train_runtime": 346.1893, "train_tokens_per_second": 5971.947 }, { "epoch": 0.12726436781609196, "grad_norm": 0.7406309843063354, "learning_rate": 0.00018748389471746736, "loss": 1.7036, "num_input_tokens_seen": 2072560, "step": 346, "train_runtime": 347.0615, "train_tokens_per_second": 5971.738 }, { "epoch": 0.12763218390804598, "grad_norm": 0.6880764365196228, "learning_rate": 0.00018744708264310694, "loss": 1.8413, "num_input_tokens_seen": 2077360, "step": 347, "train_runtime": 347.8817, "train_tokens_per_second": 5971.455 }, { "epoch": 0.128, "grad_norm": 0.7967108488082886, "learning_rate": 0.00018741027056874655, "loss": 2.0652, "num_input_tokens_seen": 2082464, "step": 348, "train_runtime": 348.7529, "train_tokens_per_second": 5971.174 }, { "epoch": 0.12836781609195402, "grad_norm": 0.6809425354003906, "learning_rate": 0.00018737345849438616, "loss": 2.0862, "num_input_tokens_seen": 2087648, "step": 349, "train_runtime": 349.6336, "train_tokens_per_second": 5970.959 }, { "epoch": 0.12873563218390804, "grad_norm": 0.7168233394622803, "learning_rate": 0.00018733664642002577, "loss": 2.0956, "num_input_tokens_seen": 2093328, "step": 350, "train_runtime": 350.5688, "train_tokens_per_second": 5971.233 }, { "epoch": 0.12910344827586206, "grad_norm": 0.7352126836776733, "learning_rate": 0.00018729983434566538, "loss": 1.6114, "num_input_tokens_seen": 2098816, "step": 351, "train_runtime": 351.4873, "train_tokens_per_second": 5971.243 }, { "epoch": 0.12947126436781609, "grad_norm": 0.6451615691184998, "learning_rate": 0.00018726302227130498, "loss": 1.6803, "num_input_tokens_seen": 2106368, "step": 352, "train_runtime": 352.6819, "train_tokens_per_second": 5972.43 }, { "epoch": 0.1298390804597701, "grad_norm": 0.744642972946167, "learning_rate": 0.0001872262101969446, "loss": 2.0963, "num_input_tokens_seen": 2111472, "step": 353, "train_runtime": 353.5399, "train_tokens_per_second": 5972.373 }, { "epoch": 0.13020689655172413, "grad_norm": 0.7254801988601685, "learning_rate": 0.00018718939812258423, "loss": 2.0037, "num_input_tokens_seen": 2117248, "step": 354, "train_runtime": 354.4882, "train_tokens_per_second": 5972.69 }, { "epoch": 0.13057471264367815, "grad_norm": 0.6664026975631714, "learning_rate": 0.00018715258604822384, "loss": 1.5922, "num_input_tokens_seen": 2125056, "step": 355, "train_runtime": 355.7031, "train_tokens_per_second": 5974.241 }, { "epoch": 0.1309425287356322, "grad_norm": 0.7322072386741638, "learning_rate": 0.00018711577397386345, "loss": 1.9118, "num_input_tokens_seen": 2133520, "step": 356, "train_runtime": 357.0289, "train_tokens_per_second": 5975.762 }, { "epoch": 0.13131034482758622, "grad_norm": 0.7217851281166077, "learning_rate": 0.00018707896189950306, "loss": 1.6786, "num_input_tokens_seen": 2140592, "step": 357, "train_runtime": 358.1497, "train_tokens_per_second": 5976.809 }, { "epoch": 0.13167816091954024, "grad_norm": 0.7309592366218567, "learning_rate": 0.00018704214982514266, "loss": 1.8584, "num_input_tokens_seen": 2144640, "step": 358, "train_runtime": 358.8743, "train_tokens_per_second": 5976.02 }, { "epoch": 0.13204597701149426, "grad_norm": 0.6250271797180176, "learning_rate": 0.00018700533775078227, "loss": 1.75, "num_input_tokens_seen": 2151248, "step": 359, "train_runtime": 359.9582, "train_tokens_per_second": 5976.383 }, { "epoch": 0.13241379310344828, "grad_norm": 0.5960398316383362, "learning_rate": 0.00018696852567642186, "loss": 1.5959, "num_input_tokens_seen": 2157760, "step": 360, "train_runtime": 360.9964, "train_tokens_per_second": 5977.234 }, { "epoch": 0.1327816091954023, "grad_norm": 0.709035336971283, "learning_rate": 0.00018693171360206146, "loss": 1.9184, "num_input_tokens_seen": 2164032, "step": 361, "train_runtime": 362.5187, "train_tokens_per_second": 5969.436 }, { "epoch": 0.13314942528735632, "grad_norm": 0.6583025455474854, "learning_rate": 0.0001868949015277011, "loss": 1.8613, "num_input_tokens_seen": 2168768, "step": 362, "train_runtime": 363.3445, "train_tokens_per_second": 5968.903 }, { "epoch": 0.13351724137931034, "grad_norm": 0.7209729552268982, "learning_rate": 0.0001868580894533407, "loss": 1.9978, "num_input_tokens_seen": 2175744, "step": 363, "train_runtime": 364.4787, "train_tokens_per_second": 5969.469 }, { "epoch": 0.13388505747126436, "grad_norm": 0.686311662197113, "learning_rate": 0.00018682127737898032, "loss": 1.8192, "num_input_tokens_seen": 2181200, "step": 364, "train_runtime": 365.3909, "train_tokens_per_second": 5969.498 }, { "epoch": 0.13425287356321838, "grad_norm": 0.7123120427131653, "learning_rate": 0.00018678446530461993, "loss": 1.8503, "num_input_tokens_seen": 2187680, "step": 365, "train_runtime": 366.4415, "train_tokens_per_second": 5970.066 }, { "epoch": 0.1346206896551724, "grad_norm": 0.7308655977249146, "learning_rate": 0.00018674765323025954, "loss": 1.8202, "num_input_tokens_seen": 2192928, "step": 366, "train_runtime": 367.3112, "train_tokens_per_second": 5970.218 }, { "epoch": 0.13498850574712642, "grad_norm": 0.7211245894432068, "learning_rate": 0.00018671084115589914, "loss": 1.8473, "num_input_tokens_seen": 2200880, "step": 367, "train_runtime": 368.5491, "train_tokens_per_second": 5971.742 }, { "epoch": 0.13535632183908047, "grad_norm": 0.7467523217201233, "learning_rate": 0.00018667402908153875, "loss": 1.8847, "num_input_tokens_seen": 2206432, "step": 368, "train_runtime": 369.4775, "train_tokens_per_second": 5971.763 }, { "epoch": 0.1357241379310345, "grad_norm": 0.741328239440918, "learning_rate": 0.00018663721700717836, "loss": 1.7566, "num_input_tokens_seen": 2215552, "step": 369, "train_runtime": 370.8853, "train_tokens_per_second": 5973.685 }, { "epoch": 0.13609195402298851, "grad_norm": 0.693181574344635, "learning_rate": 0.00018660040493281797, "loss": 1.7464, "num_input_tokens_seen": 2221344, "step": 370, "train_runtime": 371.8289, "train_tokens_per_second": 5974.102 }, { "epoch": 0.13645977011494254, "grad_norm": 0.7232048511505127, "learning_rate": 0.00018656359285845758, "loss": 1.8445, "num_input_tokens_seen": 2228256, "step": 371, "train_runtime": 372.9361, "train_tokens_per_second": 5974.9 }, { "epoch": 0.13682758620689656, "grad_norm": 0.936562716960907, "learning_rate": 0.0001865267807840972, "loss": 2.0189, "num_input_tokens_seen": 2233728, "step": 372, "train_runtime": 373.851, "train_tokens_per_second": 5974.915 }, { "epoch": 0.13719540229885058, "grad_norm": 0.7300688624382019, "learning_rate": 0.0001864899687097368, "loss": 2.0485, "num_input_tokens_seen": 2239248, "step": 373, "train_runtime": 374.7594, "train_tokens_per_second": 5975.162 }, { "epoch": 0.1375632183908046, "grad_norm": 0.7056641578674316, "learning_rate": 0.0001864531566353764, "loss": 1.9858, "num_input_tokens_seen": 2244416, "step": 374, "train_runtime": 375.6114, "train_tokens_per_second": 5975.367 }, { "epoch": 0.13793103448275862, "grad_norm": 0.7921895980834961, "learning_rate": 0.00018641634456101602, "loss": 1.6793, "num_input_tokens_seen": 2249888, "step": 375, "train_runtime": 376.5335, "train_tokens_per_second": 5975.267 }, { "epoch": 0.13829885057471264, "grad_norm": 0.6739850044250488, "learning_rate": 0.00018637953248665562, "loss": 1.7377, "num_input_tokens_seen": 2258544, "step": 376, "train_runtime": 377.8526, "train_tokens_per_second": 5977.316 }, { "epoch": 0.13866666666666666, "grad_norm": 0.7935346364974976, "learning_rate": 0.00018634272041229523, "loss": 1.8909, "num_input_tokens_seen": 2264816, "step": 377, "train_runtime": 378.8602, "train_tokens_per_second": 5977.973 }, { "epoch": 0.13903448275862068, "grad_norm": 0.6490564346313477, "learning_rate": 0.00018630590833793484, "loss": 1.8605, "num_input_tokens_seen": 2276096, "step": 378, "train_runtime": 380.5525, "train_tokens_per_second": 5981.031 }, { "epoch": 0.1394022988505747, "grad_norm": 0.8517224788665771, "learning_rate": 0.00018626909626357448, "loss": 2.0638, "num_input_tokens_seen": 2281888, "step": 379, "train_runtime": 381.4745, "train_tokens_per_second": 5981.758 }, { "epoch": 0.13977011494252872, "grad_norm": 0.6885678768157959, "learning_rate": 0.0001862322841892141, "loss": 1.8711, "num_input_tokens_seen": 2289072, "step": 380, "train_runtime": 382.6107, "train_tokens_per_second": 5982.77 }, { "epoch": 0.14013793103448277, "grad_norm": 0.6883024573326111, "learning_rate": 0.0001861954721148537, "loss": 1.9096, "num_input_tokens_seen": 2295104, "step": 381, "train_runtime": 383.6013, "train_tokens_per_second": 5983.046 }, { "epoch": 0.1405057471264368, "grad_norm": 0.7881075739860535, "learning_rate": 0.0001861586600404933, "loss": 1.8993, "num_input_tokens_seen": 2299872, "step": 382, "train_runtime": 384.3935, "train_tokens_per_second": 5983.119 }, { "epoch": 0.1408735632183908, "grad_norm": 0.7175195813179016, "learning_rate": 0.0001861218479661329, "loss": 1.9201, "num_input_tokens_seen": 2304720, "step": 383, "train_runtime": 385.2356, "train_tokens_per_second": 5982.624 }, { "epoch": 0.14124137931034483, "grad_norm": 0.7776727676391602, "learning_rate": 0.0001860850358917725, "loss": 1.735, "num_input_tokens_seen": 2309680, "step": 384, "train_runtime": 386.0757, "train_tokens_per_second": 5982.454 }, { "epoch": 0.14160919540229885, "grad_norm": 0.8024613261222839, "learning_rate": 0.0001860482238174121, "loss": 1.8909, "num_input_tokens_seen": 2315600, "step": 385, "train_runtime": 387.064, "train_tokens_per_second": 5982.473 }, { "epoch": 0.14197701149425287, "grad_norm": 0.7118456363677979, "learning_rate": 0.00018601141174305171, "loss": 2.0387, "num_input_tokens_seen": 2321328, "step": 386, "train_runtime": 388.0032, "train_tokens_per_second": 5982.755 }, { "epoch": 0.1423448275862069, "grad_norm": 0.8724689483642578, "learning_rate": 0.00018597459966869132, "loss": 2.1292, "num_input_tokens_seen": 2326464, "step": 387, "train_runtime": 388.875, "train_tokens_per_second": 5982.549 }, { "epoch": 0.14271264367816092, "grad_norm": 0.8295997381210327, "learning_rate": 0.00018593778759433096, "loss": 1.9022, "num_input_tokens_seen": 2332688, "step": 388, "train_runtime": 389.9018, "train_tokens_per_second": 5982.758 }, { "epoch": 0.14308045977011494, "grad_norm": 0.7838996052742004, "learning_rate": 0.00018590097551997057, "loss": 1.7828, "num_input_tokens_seen": 2338704, "step": 389, "train_runtime": 390.8694, "train_tokens_per_second": 5983.339 }, { "epoch": 0.14344827586206896, "grad_norm": 0.7227248549461365, "learning_rate": 0.00018586416344561018, "loss": 1.853, "num_input_tokens_seen": 2344688, "step": 390, "train_runtime": 391.858, "train_tokens_per_second": 5983.515 }, { "epoch": 0.14381609195402298, "grad_norm": 0.6935778260231018, "learning_rate": 0.00018582735137124979, "loss": 2.0029, "num_input_tokens_seen": 2348976, "step": 391, "train_runtime": 393.137, "train_tokens_per_second": 5974.955 }, { "epoch": 0.144183908045977, "grad_norm": 0.7656466960906982, "learning_rate": 0.0001857905392968894, "loss": 1.8044, "num_input_tokens_seen": 2355600, "step": 392, "train_runtime": 394.2132, "train_tokens_per_second": 5975.446 }, { "epoch": 0.14455172413793105, "grad_norm": 0.6530233025550842, "learning_rate": 0.000185753727222529, "loss": 1.7168, "num_input_tokens_seen": 2360704, "step": 393, "train_runtime": 395.0927, "train_tokens_per_second": 5975.064 }, { "epoch": 0.14491954022988507, "grad_norm": 0.8266283869743347, "learning_rate": 0.0001857169151481686, "loss": 1.851, "num_input_tokens_seen": 2365904, "step": 394, "train_runtime": 395.962, "train_tokens_per_second": 5975.079 }, { "epoch": 0.1452873563218391, "grad_norm": 0.7002015709877014, "learning_rate": 0.00018568010307380822, "loss": 1.9675, "num_input_tokens_seen": 2370992, "step": 395, "train_runtime": 396.7961, "train_tokens_per_second": 5975.34 }, { "epoch": 0.1456551724137931, "grad_norm": 0.6839689612388611, "learning_rate": 0.00018564329099944783, "loss": 1.8971, "num_input_tokens_seen": 2376944, "step": 396, "train_runtime": 397.7684, "train_tokens_per_second": 5975.699 }, { "epoch": 0.14602298850574713, "grad_norm": 0.6042901277542114, "learning_rate": 0.00018560647892508744, "loss": 1.7526, "num_input_tokens_seen": 2389056, "step": 397, "train_runtime": 399.5638, "train_tokens_per_second": 5979.16 }, { "epoch": 0.14639080459770115, "grad_norm": 0.7558072805404663, "learning_rate": 0.00018556966685072705, "loss": 2.0548, "num_input_tokens_seen": 2394864, "step": 398, "train_runtime": 400.5058, "train_tokens_per_second": 5979.599 }, { "epoch": 0.14675862068965517, "grad_norm": 0.9416640996932983, "learning_rate": 0.00018553285477636666, "loss": 1.8636, "num_input_tokens_seen": 2400224, "step": 399, "train_runtime": 401.397, "train_tokens_per_second": 5979.676 }, { "epoch": 0.1471264367816092, "grad_norm": 0.8565811514854431, "learning_rate": 0.00018549604270200627, "loss": 2.034, "num_input_tokens_seen": 2404736, "step": 400, "train_runtime": 402.2011, "train_tokens_per_second": 5978.939 }, { "epoch": 0.14749425287356321, "grad_norm": 0.7060405611991882, "learning_rate": 0.00018545923062764587, "loss": 2.0218, "num_input_tokens_seen": 2412416, "step": 401, "train_runtime": 403.3895, "train_tokens_per_second": 5980.364 }, { "epoch": 0.14786206896551723, "grad_norm": 0.6839686036109924, "learning_rate": 0.00018542241855328548, "loss": 1.8888, "num_input_tokens_seen": 2417072, "step": 402, "train_runtime": 404.1697, "train_tokens_per_second": 5980.339 }, { "epoch": 0.14822988505747126, "grad_norm": 0.6669468879699707, "learning_rate": 0.0001853856064789251, "loss": 1.5507, "num_input_tokens_seen": 2427840, "step": 403, "train_runtime": 405.8133, "train_tokens_per_second": 5982.652 }, { "epoch": 0.14859770114942528, "grad_norm": 0.6962823867797852, "learning_rate": 0.0001853487944045647, "loss": 1.9593, "num_input_tokens_seen": 2434480, "step": 404, "train_runtime": 406.8635, "train_tokens_per_second": 5983.53 }, { "epoch": 0.1489655172413793, "grad_norm": 0.834463357925415, "learning_rate": 0.00018531198233020434, "loss": 2.0281, "num_input_tokens_seen": 2439696, "step": 405, "train_runtime": 407.7248, "train_tokens_per_second": 5983.683 }, { "epoch": 0.14933333333333335, "grad_norm": 0.7330803275108337, "learning_rate": 0.00018527517025584395, "loss": 1.9421, "num_input_tokens_seen": 2447360, "step": 406, "train_runtime": 408.9428, "train_tokens_per_second": 5984.603 }, { "epoch": 0.14970114942528737, "grad_norm": 0.793417751789093, "learning_rate": 0.00018523835818148353, "loss": 2.0883, "num_input_tokens_seen": 2452256, "step": 407, "train_runtime": 409.7899, "train_tokens_per_second": 5984.178 }, { "epoch": 0.1500689655172414, "grad_norm": 0.6819415092468262, "learning_rate": 0.00018520154610712314, "loss": 1.8594, "num_input_tokens_seen": 2457360, "step": 408, "train_runtime": 410.6425, "train_tokens_per_second": 5984.183 }, { "epoch": 0.1504367816091954, "grad_norm": 0.6674189567565918, "learning_rate": 0.00018516473403276275, "loss": 1.829, "num_input_tokens_seen": 2463264, "step": 409, "train_runtime": 411.6104, "train_tokens_per_second": 5984.455 }, { "epoch": 0.15080459770114943, "grad_norm": 0.7914707660675049, "learning_rate": 0.00018512792195840235, "loss": 1.8782, "num_input_tokens_seen": 2468912, "step": 410, "train_runtime": 412.518, "train_tokens_per_second": 5984.98 }, { "epoch": 0.15117241379310345, "grad_norm": 0.7480087876319885, "learning_rate": 0.00018509110988404196, "loss": 1.8196, "num_input_tokens_seen": 2474960, "step": 411, "train_runtime": 413.5005, "train_tokens_per_second": 5985.386 }, { "epoch": 0.15154022988505747, "grad_norm": 0.8891626596450806, "learning_rate": 0.00018505429780968157, "loss": 1.9407, "num_input_tokens_seen": 2480304, "step": 412, "train_runtime": 414.3766, "train_tokens_per_second": 5985.628 }, { "epoch": 0.1519080459770115, "grad_norm": 0.7251510620117188, "learning_rate": 0.00018501748573532118, "loss": 1.7448, "num_input_tokens_seen": 2485568, "step": 413, "train_runtime": 415.2665, "train_tokens_per_second": 5985.477 }, { "epoch": 0.1522758620689655, "grad_norm": 0.7945650219917297, "learning_rate": 0.00018498067366096082, "loss": 1.9516, "num_input_tokens_seen": 2493104, "step": 414, "train_runtime": 416.4634, "train_tokens_per_second": 5986.37 }, { "epoch": 0.15264367816091953, "grad_norm": 0.7043851017951965, "learning_rate": 0.00018494386158660043, "loss": 1.9806, "num_input_tokens_seen": 2498912, "step": 415, "train_runtime": 417.4214, "train_tokens_per_second": 5986.545 }, { "epoch": 0.15301149425287355, "grad_norm": 0.6988221406936646, "learning_rate": 0.00018490704951224003, "loss": 1.8911, "num_input_tokens_seen": 2506976, "step": 416, "train_runtime": 418.6712, "train_tokens_per_second": 5987.935 }, { "epoch": 0.15337931034482757, "grad_norm": 0.617727518081665, "learning_rate": 0.00018487023743787964, "loss": 1.6414, "num_input_tokens_seen": 2513920, "step": 417, "train_runtime": 419.7861, "train_tokens_per_second": 5988.574 }, { "epoch": 0.15374712643678162, "grad_norm": 0.7416211366653442, "learning_rate": 0.00018483342536351925, "loss": 1.7568, "num_input_tokens_seen": 2519328, "step": 418, "train_runtime": 420.6898, "train_tokens_per_second": 5988.565 }, { "epoch": 0.15411494252873564, "grad_norm": 0.7337747812271118, "learning_rate": 0.00018479661328915886, "loss": 1.8018, "num_input_tokens_seen": 2524432, "step": 419, "train_runtime": 421.5648, "train_tokens_per_second": 5988.242 }, { "epoch": 0.15448275862068966, "grad_norm": 0.6360253691673279, "learning_rate": 0.00018475980121479844, "loss": 1.7843, "num_input_tokens_seen": 2537488, "step": 420, "train_runtime": 423.4871, "train_tokens_per_second": 5991.89 }, { "epoch": 0.15485057471264368, "grad_norm": 0.7357736825942993, "learning_rate": 0.00018472298914043805, "loss": 1.9194, "num_input_tokens_seen": 2542048, "step": 421, "train_runtime": 424.7362, "train_tokens_per_second": 5985.004 }, { "epoch": 0.1552183908045977, "grad_norm": 0.793707013130188, "learning_rate": 0.0001846861770660777, "loss": 1.849, "num_input_tokens_seen": 2549024, "step": 422, "train_runtime": 425.827, "train_tokens_per_second": 5986.055 }, { "epoch": 0.15558620689655173, "grad_norm": 0.6722812056541443, "learning_rate": 0.0001846493649917173, "loss": 1.7081, "num_input_tokens_seen": 2553696, "step": 423, "train_runtime": 426.6429, "train_tokens_per_second": 5985.559 }, { "epoch": 0.15595402298850575, "grad_norm": 0.6561516523361206, "learning_rate": 0.0001846125529173569, "loss": 1.8133, "num_input_tokens_seen": 2559408, "step": 424, "train_runtime": 427.5789, "train_tokens_per_second": 5985.815 }, { "epoch": 0.15632183908045977, "grad_norm": 0.7355641722679138, "learning_rate": 0.00018457574084299651, "loss": 1.783, "num_input_tokens_seen": 2565840, "step": 425, "train_runtime": 428.609, "train_tokens_per_second": 5986.435 }, { "epoch": 0.1566896551724138, "grad_norm": 0.8073827028274536, "learning_rate": 0.00018453892876863612, "loss": 1.9642, "num_input_tokens_seen": 2571600, "step": 426, "train_runtime": 429.5708, "train_tokens_per_second": 5986.44 }, { "epoch": 0.1570574712643678, "grad_norm": 0.6649340987205505, "learning_rate": 0.00018450211669427573, "loss": 1.9262, "num_input_tokens_seen": 2576816, "step": 427, "train_runtime": 430.4384, "train_tokens_per_second": 5986.491 }, { "epoch": 0.15742528735632183, "grad_norm": 0.6613366603851318, "learning_rate": 0.00018446530461991534, "loss": 1.7773, "num_input_tokens_seen": 2586304, "step": 428, "train_runtime": 431.8826, "train_tokens_per_second": 5988.442 }, { "epoch": 0.15779310344827585, "grad_norm": 0.7264322638511658, "learning_rate": 0.00018442849254555495, "loss": 1.7111, "num_input_tokens_seen": 2592512, "step": 429, "train_runtime": 432.9044, "train_tokens_per_second": 5988.648 }, { "epoch": 0.15816091954022987, "grad_norm": 0.6878933906555176, "learning_rate": 0.00018439168047119456, "loss": 1.997, "num_input_tokens_seen": 2597856, "step": 430, "train_runtime": 433.7964, "train_tokens_per_second": 5988.653 }, { "epoch": 0.15852873563218392, "grad_norm": 0.7570738792419434, "learning_rate": 0.00018435486839683417, "loss": 2.0054, "num_input_tokens_seen": 2603952, "step": 431, "train_runtime": 434.7809, "train_tokens_per_second": 5989.113 }, { "epoch": 0.15889655172413794, "grad_norm": 0.6946471929550171, "learning_rate": 0.00018431805632247378, "loss": 1.9308, "num_input_tokens_seen": 2610672, "step": 432, "train_runtime": 435.8553, "train_tokens_per_second": 5989.768 }, { "epoch": 0.15926436781609196, "grad_norm": 0.7897321581840515, "learning_rate": 0.00018428124424811339, "loss": 2.1253, "num_input_tokens_seen": 2615520, "step": 433, "train_runtime": 436.6891, "train_tokens_per_second": 5989.433 }, { "epoch": 0.15963218390804598, "grad_norm": 0.6874866485595703, "learning_rate": 0.000184244432173753, "loss": 1.8993, "num_input_tokens_seen": 2622336, "step": 434, "train_runtime": 437.7709, "train_tokens_per_second": 5990.202 }, { "epoch": 0.16, "grad_norm": 0.7127911448478699, "learning_rate": 0.0001842076200993926, "loss": 1.9341, "num_input_tokens_seen": 2626576, "step": 435, "train_runtime": 438.5356, "train_tokens_per_second": 5989.424 }, { "epoch": 0.16036781609195402, "grad_norm": 0.7237369418144226, "learning_rate": 0.0001841708080250322, "loss": 1.8596, "num_input_tokens_seen": 2631056, "step": 436, "train_runtime": 439.3382, "train_tokens_per_second": 5988.68 }, { "epoch": 0.16073563218390804, "grad_norm": 0.7314378023147583, "learning_rate": 0.00018413399595067182, "loss": 1.9974, "num_input_tokens_seen": 2636208, "step": 437, "train_runtime": 440.196, "train_tokens_per_second": 5988.714 }, { "epoch": 0.16110344827586207, "grad_norm": 0.6894383430480957, "learning_rate": 0.00018409718387631143, "loss": 1.7693, "num_input_tokens_seen": 2641376, "step": 438, "train_runtime": 441.0401, "train_tokens_per_second": 5988.97 }, { "epoch": 0.1614712643678161, "grad_norm": 0.7083792090415955, "learning_rate": 0.00018406037180195107, "loss": 1.7195, "num_input_tokens_seen": 2646512, "step": 439, "train_runtime": 441.9162, "train_tokens_per_second": 5988.719 }, { "epoch": 0.1618390804597701, "grad_norm": 0.7953554391860962, "learning_rate": 0.00018402355972759068, "loss": 1.851, "num_input_tokens_seen": 2653584, "step": 440, "train_runtime": 443.05, "train_tokens_per_second": 5989.355 }, { "epoch": 0.16220689655172413, "grad_norm": 0.7280542254447937, "learning_rate": 0.00018398674765323028, "loss": 1.7869, "num_input_tokens_seen": 2660112, "step": 441, "train_runtime": 444.088, "train_tokens_per_second": 5990.056 }, { "epoch": 0.16257471264367815, "grad_norm": 0.7719009518623352, "learning_rate": 0.0001839499355788699, "loss": 1.8121, "num_input_tokens_seen": 2666112, "step": 442, "train_runtime": 445.0742, "train_tokens_per_second": 5990.264 }, { "epoch": 0.1629425287356322, "grad_norm": 0.7539399266242981, "learning_rate": 0.00018391312350450947, "loss": 1.6833, "num_input_tokens_seen": 2671152, "step": 443, "train_runtime": 445.9296, "train_tokens_per_second": 5990.075 }, { "epoch": 0.16331034482758622, "grad_norm": 0.7633247375488281, "learning_rate": 0.00018387631143014908, "loss": 1.8458, "num_input_tokens_seen": 2676720, "step": 444, "train_runtime": 446.8475, "train_tokens_per_second": 5990.232 }, { "epoch": 0.16367816091954024, "grad_norm": 0.8550528287887573, "learning_rate": 0.0001838394993557887, "loss": 2.0313, "num_input_tokens_seen": 2681552, "step": 445, "train_runtime": 447.6588, "train_tokens_per_second": 5990.17 }, { "epoch": 0.16404597701149426, "grad_norm": 0.9032266139984131, "learning_rate": 0.0001838026872814283, "loss": 1.9196, "num_input_tokens_seen": 2686128, "step": 446, "train_runtime": 448.4734, "train_tokens_per_second": 5989.492 }, { "epoch": 0.16441379310344828, "grad_norm": 0.7678905129432678, "learning_rate": 0.0001837658752070679, "loss": 1.8884, "num_input_tokens_seen": 2690288, "step": 447, "train_runtime": 449.1985, "train_tokens_per_second": 5989.085 }, { "epoch": 0.1647816091954023, "grad_norm": 0.6993767619132996, "learning_rate": 0.00018372906313270755, "loss": 1.8937, "num_input_tokens_seen": 2695008, "step": 448, "train_runtime": 450.0075, "train_tokens_per_second": 5988.807 }, { "epoch": 0.16514942528735632, "grad_norm": 0.6627291440963745, "learning_rate": 0.00018369225105834716, "loss": 1.9193, "num_input_tokens_seen": 2702896, "step": 449, "train_runtime": 451.234, "train_tokens_per_second": 5990.009 }, { "epoch": 0.16551724137931034, "grad_norm": 0.7582489848136902, "learning_rate": 0.00018365543898398676, "loss": 1.9296, "num_input_tokens_seen": 2708224, "step": 450, "train_runtime": 452.1299, "train_tokens_per_second": 5989.925 }, { "epoch": 0.16588505747126436, "grad_norm": 0.6843869686126709, "learning_rate": 0.00018361862690962637, "loss": 1.717, "num_input_tokens_seen": 2717376, "step": 451, "train_runtime": 453.9767, "train_tokens_per_second": 5985.717 }, { "epoch": 0.16625287356321838, "grad_norm": 0.7444376349449158, "learning_rate": 0.00018358181483526598, "loss": 2.0068, "num_input_tokens_seen": 2722432, "step": 452, "train_runtime": 454.8415, "train_tokens_per_second": 5985.452 }, { "epoch": 0.1666206896551724, "grad_norm": 0.6823301315307617, "learning_rate": 0.0001835450027609056, "loss": 1.9761, "num_input_tokens_seen": 2728016, "step": 453, "train_runtime": 455.7643, "train_tokens_per_second": 5985.585 }, { "epoch": 0.16698850574712643, "grad_norm": 0.7306808829307556, "learning_rate": 0.0001835081906865452, "loss": 1.8948, "num_input_tokens_seen": 2734208, "step": 454, "train_runtime": 456.769, "train_tokens_per_second": 5985.976 }, { "epoch": 0.16735632183908045, "grad_norm": 0.6250959634780884, "learning_rate": 0.0001834713786121848, "loss": 1.8936, "num_input_tokens_seen": 2743024, "step": 455, "train_runtime": 458.1282, "train_tokens_per_second": 5987.459 }, { "epoch": 0.1677241379310345, "grad_norm": 0.7861682772636414, "learning_rate": 0.00018343456653782442, "loss": 1.8531, "num_input_tokens_seen": 2747328, "step": 456, "train_runtime": 458.9087, "train_tokens_per_second": 5986.655 }, { "epoch": 0.16809195402298852, "grad_norm": 0.6755948662757874, "learning_rate": 0.00018339775446346403, "loss": 1.8501, "num_input_tokens_seen": 2754192, "step": 457, "train_runtime": 460.0253, "train_tokens_per_second": 5987.044 }, { "epoch": 0.16845977011494254, "grad_norm": 0.642189621925354, "learning_rate": 0.00018336094238910364, "loss": 1.7918, "num_input_tokens_seen": 2759072, "step": 458, "train_runtime": 460.8482, "train_tokens_per_second": 5986.944 }, { "epoch": 0.16882758620689656, "grad_norm": 0.7578986287117004, "learning_rate": 0.00018332413031474324, "loss": 1.9248, "num_input_tokens_seen": 2765824, "step": 459, "train_runtime": 461.9587, "train_tokens_per_second": 5987.168 }, { "epoch": 0.16919540229885058, "grad_norm": 0.662889838218689, "learning_rate": 0.00018328731824038285, "loss": 1.8313, "num_input_tokens_seen": 2771872, "step": 460, "train_runtime": 462.9587, "train_tokens_per_second": 5987.299 }, { "epoch": 0.1695632183908046, "grad_norm": 0.77558434009552, "learning_rate": 0.00018325050616602246, "loss": 1.8102, "num_input_tokens_seen": 2777584, "step": 461, "train_runtime": 463.8951, "train_tokens_per_second": 5987.527 }, { "epoch": 0.16993103448275862, "grad_norm": 0.709566056728363, "learning_rate": 0.00018321369409166207, "loss": 1.8505, "num_input_tokens_seen": 2784224, "step": 462, "train_runtime": 464.9616, "train_tokens_per_second": 5988.074 }, { "epoch": 0.17029885057471264, "grad_norm": 0.6982594728469849, "learning_rate": 0.00018317688201730168, "loss": 1.9501, "num_input_tokens_seen": 2788768, "step": 463, "train_runtime": 465.7452, "train_tokens_per_second": 5987.754 }, { "epoch": 0.17066666666666666, "grad_norm": 0.7560883164405823, "learning_rate": 0.0001831400699429413, "loss": 1.7646, "num_input_tokens_seen": 2796416, "step": 464, "train_runtime": 466.9698, "train_tokens_per_second": 5988.43 }, { "epoch": 0.17103448275862068, "grad_norm": 0.7397001385688782, "learning_rate": 0.00018310325786858092, "loss": 1.7924, "num_input_tokens_seen": 2801376, "step": 465, "train_runtime": 467.8232, "train_tokens_per_second": 5988.108 }, { "epoch": 0.1714022988505747, "grad_norm": 0.7177740335464478, "learning_rate": 0.00018306644579422053, "loss": 1.861, "num_input_tokens_seen": 2808784, "step": 466, "train_runtime": 468.9776, "train_tokens_per_second": 5989.165 }, { "epoch": 0.17177011494252872, "grad_norm": 0.7760906219482422, "learning_rate": 0.00018302963371986012, "loss": 2.0148, "num_input_tokens_seen": 2814064, "step": 467, "train_runtime": 469.8607, "train_tokens_per_second": 5989.145 }, { "epoch": 0.17213793103448277, "grad_norm": 0.7281026840209961, "learning_rate": 0.00018299282164549972, "loss": 1.9006, "num_input_tokens_seen": 2819952, "step": 468, "train_runtime": 470.8276, "train_tokens_per_second": 5989.351 }, { "epoch": 0.1725057471264368, "grad_norm": 0.7086067795753479, "learning_rate": 0.00018295600957113933, "loss": 1.788, "num_input_tokens_seen": 2825024, "step": 469, "train_runtime": 471.675, "train_tokens_per_second": 5989.344 }, { "epoch": 0.1728735632183908, "grad_norm": 0.6965607404708862, "learning_rate": 0.00018291919749677894, "loss": 1.6768, "num_input_tokens_seen": 2831344, "step": 470, "train_runtime": 472.7036, "train_tokens_per_second": 5989.682 }, { "epoch": 0.17324137931034483, "grad_norm": 0.7752671837806702, "learning_rate": 0.00018288238542241855, "loss": 2.0327, "num_input_tokens_seen": 2835632, "step": 471, "train_runtime": 473.4686, "train_tokens_per_second": 5989.06 }, { "epoch": 0.17360919540229885, "grad_norm": 0.7533464431762695, "learning_rate": 0.00018284557334805816, "loss": 1.8942, "num_input_tokens_seen": 2842752, "step": 472, "train_runtime": 474.5932, "train_tokens_per_second": 5989.871 }, { "epoch": 0.17397701149425288, "grad_norm": 0.7007566690444946, "learning_rate": 0.00018280876127369777, "loss": 1.9851, "num_input_tokens_seen": 2848624, "step": 473, "train_runtime": 475.5724, "train_tokens_per_second": 5989.885 }, { "epoch": 0.1743448275862069, "grad_norm": 0.6253156065940857, "learning_rate": 0.0001827719491993374, "loss": 2.0184, "num_input_tokens_seen": 2856752, "step": 474, "train_runtime": 476.8209, "train_tokens_per_second": 5991.248 }, { "epoch": 0.17471264367816092, "grad_norm": 0.7340561747550964, "learning_rate": 0.00018273513712497701, "loss": 2.0343, "num_input_tokens_seen": 2864240, "step": 475, "train_runtime": 477.9774, "train_tokens_per_second": 5992.417 }, { "epoch": 0.17508045977011494, "grad_norm": 0.7108561992645264, "learning_rate": 0.00018269832505061662, "loss": 1.8435, "num_input_tokens_seen": 2872704, "step": 476, "train_runtime": 479.3059, "train_tokens_per_second": 5993.467 }, { "epoch": 0.17544827586206896, "grad_norm": 0.7289217114448547, "learning_rate": 0.00018266151297625623, "loss": 1.9543, "num_input_tokens_seen": 2877712, "step": 477, "train_runtime": 480.1488, "train_tokens_per_second": 5993.375 }, { "epoch": 0.17581609195402298, "grad_norm": 0.7695021033287048, "learning_rate": 0.00018262470090189584, "loss": 2.0223, "num_input_tokens_seen": 2882560, "step": 478, "train_runtime": 480.9781, "train_tokens_per_second": 5993.121 }, { "epoch": 0.176183908045977, "grad_norm": 0.7470912933349609, "learning_rate": 0.00018258788882753545, "loss": 1.9365, "num_input_tokens_seen": 2887808, "step": 479, "train_runtime": 481.8695, "train_tokens_per_second": 5992.925 }, { "epoch": 0.17655172413793102, "grad_norm": 0.6362117528915405, "learning_rate": 0.00018255107675317503, "loss": 1.9628, "num_input_tokens_seen": 2893648, "step": 480, "train_runtime": 482.8393, "train_tokens_per_second": 5992.984 }, { "epoch": 0.17691954022988507, "grad_norm": 0.7495032548904419, "learning_rate": 0.00018251426467881464, "loss": 1.8733, "num_input_tokens_seen": 2898912, "step": 481, "train_runtime": 484.1694, "train_tokens_per_second": 5987.392 }, { "epoch": 0.1772873563218391, "grad_norm": 0.7536237239837646, "learning_rate": 0.00018247745260445428, "loss": 1.8017, "num_input_tokens_seen": 2905424, "step": 482, "train_runtime": 485.2276, "train_tokens_per_second": 5987.755 }, { "epoch": 0.1776551724137931, "grad_norm": 0.756716251373291, "learning_rate": 0.00018244064053009388, "loss": 1.7773, "num_input_tokens_seen": 2910784, "step": 483, "train_runtime": 486.1397, "train_tokens_per_second": 5987.546 }, { "epoch": 0.17802298850574713, "grad_norm": 0.67543625831604, "learning_rate": 0.0001824038284557335, "loss": 1.8956, "num_input_tokens_seen": 2918240, "step": 484, "train_runtime": 487.3526, "train_tokens_per_second": 5987.944 }, { "epoch": 0.17839080459770115, "grad_norm": 0.7353869676589966, "learning_rate": 0.0001823670163813731, "loss": 2.063, "num_input_tokens_seen": 2923216, "step": 485, "train_runtime": 488.1997, "train_tokens_per_second": 5987.747 }, { "epoch": 0.17875862068965517, "grad_norm": 0.7567138075828552, "learning_rate": 0.0001823302043070127, "loss": 1.8763, "num_input_tokens_seen": 2928080, "step": 486, "train_runtime": 489.0459, "train_tokens_per_second": 5987.332 }, { "epoch": 0.1791264367816092, "grad_norm": 0.6213117837905884, "learning_rate": 0.00018229339223265232, "loss": 1.8701, "num_input_tokens_seen": 2934672, "step": 487, "train_runtime": 490.1448, "train_tokens_per_second": 5987.357 }, { "epoch": 0.17949425287356321, "grad_norm": 0.6765648126602173, "learning_rate": 0.00018225658015829193, "loss": 1.775, "num_input_tokens_seen": 2939760, "step": 488, "train_runtime": 491.0053, "train_tokens_per_second": 5987.226 }, { "epoch": 0.17986206896551724, "grad_norm": 0.6079659461975098, "learning_rate": 0.00018221976808393154, "loss": 1.7171, "num_input_tokens_seen": 2946608, "step": 489, "train_runtime": 492.0979, "train_tokens_per_second": 5987.85 }, { "epoch": 0.18022988505747126, "grad_norm": 0.8331005573272705, "learning_rate": 0.00018218295600957115, "loss": 2.0085, "num_input_tokens_seen": 2951200, "step": 490, "train_runtime": 492.882, "train_tokens_per_second": 5987.64 }, { "epoch": 0.18059770114942528, "grad_norm": 0.7557847499847412, "learning_rate": 0.00018214614393521076, "loss": 1.8781, "num_input_tokens_seen": 2958240, "step": 491, "train_runtime": 493.9884, "train_tokens_per_second": 5988.48 }, { "epoch": 0.1809655172413793, "grad_norm": 0.7792819142341614, "learning_rate": 0.00018210933186085036, "loss": 1.9078, "num_input_tokens_seen": 2963456, "step": 492, "train_runtime": 494.8557, "train_tokens_per_second": 5988.525 }, { "epoch": 0.18133333333333335, "grad_norm": 0.707869291305542, "learning_rate": 0.00018207251978648997, "loss": 1.6466, "num_input_tokens_seen": 2969584, "step": 493, "train_runtime": 495.8812, "train_tokens_per_second": 5988.499 }, { "epoch": 0.18170114942528737, "grad_norm": 0.6605796813964844, "learning_rate": 0.00018203570771212958, "loss": 1.901, "num_input_tokens_seen": 2976560, "step": 494, "train_runtime": 496.9954, "train_tokens_per_second": 5989.11 }, { "epoch": 0.1820689655172414, "grad_norm": 0.7089316844940186, "learning_rate": 0.0001819988956377692, "loss": 1.8349, "num_input_tokens_seen": 2982864, "step": 495, "train_runtime": 498.0108, "train_tokens_per_second": 5989.556 }, { "epoch": 0.1824367816091954, "grad_norm": 0.7388765215873718, "learning_rate": 0.0001819620835634088, "loss": 1.8852, "num_input_tokens_seen": 2988384, "step": 496, "train_runtime": 498.9228, "train_tokens_per_second": 5989.672 }, { "epoch": 0.18280459770114943, "grad_norm": 0.719870924949646, "learning_rate": 0.0001819252714890484, "loss": 1.8616, "num_input_tokens_seen": 2995088, "step": 497, "train_runtime": 499.9974, "train_tokens_per_second": 5990.207 }, { "epoch": 0.18317241379310345, "grad_norm": 0.7674807906150818, "learning_rate": 0.00018188845941468802, "loss": 1.9816, "num_input_tokens_seen": 3000768, "step": 498, "train_runtime": 500.9315, "train_tokens_per_second": 5990.375 }, { "epoch": 0.18354022988505747, "grad_norm": 0.7047696113586426, "learning_rate": 0.00018185164734032765, "loss": 1.9084, "num_input_tokens_seen": 3005760, "step": 499, "train_runtime": 501.7951, "train_tokens_per_second": 5990.015 }, { "epoch": 0.1839080459770115, "grad_norm": 0.7106406688690186, "learning_rate": 0.00018181483526596726, "loss": 1.7949, "num_input_tokens_seen": 3010752, "step": 500, "train_runtime": 502.6392, "train_tokens_per_second": 5989.887 }, { "epoch": 0.1842758620689655, "grad_norm": 0.7400830388069153, "learning_rate": 0.00018177802319160687, "loss": 1.8798, "num_input_tokens_seen": 3015744, "step": 501, "train_runtime": 503.4964, "train_tokens_per_second": 5989.604 }, { "epoch": 0.18464367816091953, "grad_norm": 0.7215652465820312, "learning_rate": 0.00018174121111724648, "loss": 1.7335, "num_input_tokens_seen": 3021968, "step": 502, "train_runtime": 504.5099, "train_tokens_per_second": 5989.908 }, { "epoch": 0.18501149425287355, "grad_norm": 0.6986531615257263, "learning_rate": 0.00018170439904288606, "loss": 1.797, "num_input_tokens_seen": 3027664, "step": 503, "train_runtime": 505.4588, "train_tokens_per_second": 5989.932 }, { "epoch": 0.18537931034482757, "grad_norm": 0.7286319732666016, "learning_rate": 0.00018166758696852567, "loss": 1.8748, "num_input_tokens_seen": 3033808, "step": 504, "train_runtime": 506.4403, "train_tokens_per_second": 5990.455 }, { "epoch": 0.1857471264367816, "grad_norm": 0.8388171195983887, "learning_rate": 0.00018163077489416528, "loss": 1.9862, "num_input_tokens_seen": 3038304, "step": 505, "train_runtime": 507.2061, "train_tokens_per_second": 5990.275 }, { "epoch": 0.18611494252873564, "grad_norm": 0.7551229000091553, "learning_rate": 0.0001815939628198049, "loss": 1.691, "num_input_tokens_seen": 3043040, "step": 506, "train_runtime": 508.0147, "train_tokens_per_second": 5990.063 }, { "epoch": 0.18648275862068966, "grad_norm": 0.736970067024231, "learning_rate": 0.0001815571507454445, "loss": 1.7491, "num_input_tokens_seen": 3048480, "step": 507, "train_runtime": 508.9133, "train_tokens_per_second": 5990.175 }, { "epoch": 0.18685057471264369, "grad_norm": 0.7858811020851135, "learning_rate": 0.00018152033867108413, "loss": 1.8674, "num_input_tokens_seen": 3052992, "step": 508, "train_runtime": 509.718, "train_tokens_per_second": 5989.57 }, { "epoch": 0.1872183908045977, "grad_norm": 0.7412512898445129, "learning_rate": 0.00018148352659672374, "loss": 1.8044, "num_input_tokens_seen": 3060416, "step": 509, "train_runtime": 510.9081, "train_tokens_per_second": 5990.15 }, { "epoch": 0.18758620689655173, "grad_norm": 0.7265469431877136, "learning_rate": 0.00018144671452236335, "loss": 1.8035, "num_input_tokens_seen": 3066096, "step": 510, "train_runtime": 511.8326, "train_tokens_per_second": 5990.427 }, { "epoch": 0.18795402298850575, "grad_norm": 0.8583095669746399, "learning_rate": 0.00018140990244800296, "loss": 1.9065, "num_input_tokens_seen": 3071008, "step": 511, "train_runtime": 513.1792, "train_tokens_per_second": 5984.28 }, { "epoch": 0.18832183908045977, "grad_norm": 0.7504838109016418, "learning_rate": 0.00018137309037364257, "loss": 1.8447, "num_input_tokens_seen": 3075664, "step": 512, "train_runtime": 513.9811, "train_tokens_per_second": 5984.002 }, { "epoch": 0.1886896551724138, "grad_norm": 0.8324645161628723, "learning_rate": 0.00018133627829928218, "loss": 1.8945, "num_input_tokens_seen": 3082672, "step": 513, "train_runtime": 515.13, "train_tokens_per_second": 5984.261 }, { "epoch": 0.1890574712643678, "grad_norm": 0.7464407086372375, "learning_rate": 0.0001812994662249218, "loss": 1.7967, "num_input_tokens_seen": 3087760, "step": 514, "train_runtime": 515.9755, "train_tokens_per_second": 5984.315 }, { "epoch": 0.18942528735632183, "grad_norm": 0.7011414170265198, "learning_rate": 0.0001812626541505614, "loss": 1.7975, "num_input_tokens_seen": 3093904, "step": 515, "train_runtime": 517.0043, "train_tokens_per_second": 5984.291 }, { "epoch": 0.18979310344827585, "grad_norm": 0.7123543620109558, "learning_rate": 0.000181225842076201, "loss": 1.8877, "num_input_tokens_seen": 3098864, "step": 516, "train_runtime": 517.8234, "train_tokens_per_second": 5984.404 }, { "epoch": 0.19016091954022987, "grad_norm": 0.7099828720092773, "learning_rate": 0.00018118903000184061, "loss": 1.738, "num_input_tokens_seen": 3103376, "step": 517, "train_runtime": 518.628, "train_tokens_per_second": 5983.819 }, { "epoch": 0.19052873563218392, "grad_norm": 0.6124518513679504, "learning_rate": 0.00018115221792748022, "loss": 1.7652, "num_input_tokens_seen": 3111616, "step": 518, "train_runtime": 519.9095, "train_tokens_per_second": 5984.919 }, { "epoch": 0.19089655172413794, "grad_norm": 0.7913989424705505, "learning_rate": 0.00018111540585311983, "loss": 1.8922, "num_input_tokens_seen": 3117072, "step": 519, "train_runtime": 520.8267, "train_tokens_per_second": 5984.854 }, { "epoch": 0.19126436781609196, "grad_norm": 0.7353897094726562, "learning_rate": 0.00018107859377875944, "loss": 1.8105, "num_input_tokens_seen": 3125648, "step": 520, "train_runtime": 522.1645, "train_tokens_per_second": 5985.945 }, { "epoch": 0.19163218390804598, "grad_norm": 0.7589907646179199, "learning_rate": 0.00018104178170439905, "loss": 1.8123, "num_input_tokens_seen": 3130208, "step": 521, "train_runtime": 522.9583, "train_tokens_per_second": 5985.579 }, { "epoch": 0.192, "grad_norm": 0.7847319841384888, "learning_rate": 0.00018100496963003866, "loss": 1.9434, "num_input_tokens_seen": 3133936, "step": 522, "train_runtime": 523.6086, "train_tokens_per_second": 5985.265 }, { "epoch": 0.19236781609195402, "grad_norm": 0.7331429719924927, "learning_rate": 0.00018096815755567827, "loss": 1.8921, "num_input_tokens_seen": 3139952, "step": 523, "train_runtime": 524.6068, "train_tokens_per_second": 5985.344 }, { "epoch": 0.19273563218390805, "grad_norm": 0.717780590057373, "learning_rate": 0.00018093134548131788, "loss": 1.9207, "num_input_tokens_seen": 3146464, "step": 524, "train_runtime": 525.6592, "train_tokens_per_second": 5985.749 }, { "epoch": 0.19310344827586207, "grad_norm": 0.7325490117073059, "learning_rate": 0.0001808945334069575, "loss": 2.1358, "num_input_tokens_seen": 3151056, "step": 525, "train_runtime": 526.4328, "train_tokens_per_second": 5985.676 }, { "epoch": 0.1934712643678161, "grad_norm": 0.7939004302024841, "learning_rate": 0.0001808577213325971, "loss": 1.9071, "num_input_tokens_seen": 3155664, "step": 526, "train_runtime": 527.2572, "train_tokens_per_second": 5985.056 }, { "epoch": 0.1938390804597701, "grad_norm": 0.7526847720146179, "learning_rate": 0.0001808209092582367, "loss": 1.7522, "num_input_tokens_seen": 3161520, "step": 527, "train_runtime": 528.2049, "train_tokens_per_second": 5985.405 }, { "epoch": 0.19420689655172413, "grad_norm": 0.7588212490081787, "learning_rate": 0.0001807840971838763, "loss": 1.7751, "num_input_tokens_seen": 3166736, "step": 528, "train_runtime": 529.0726, "train_tokens_per_second": 5985.447 }, { "epoch": 0.19457471264367815, "grad_norm": 0.7636683583259583, "learning_rate": 0.00018074728510951592, "loss": 1.7831, "num_input_tokens_seen": 3174368, "step": 529, "train_runtime": 530.2866, "train_tokens_per_second": 5986.136 }, { "epoch": 0.19494252873563217, "grad_norm": 0.8051586747169495, "learning_rate": 0.00018071047303515553, "loss": 1.848, "num_input_tokens_seen": 3180432, "step": 530, "train_runtime": 531.2842, "train_tokens_per_second": 5986.31 }, { "epoch": 0.19531034482758622, "grad_norm": 0.6396377086639404, "learning_rate": 0.00018067366096079514, "loss": 1.8452, "num_input_tokens_seen": 3188816, "step": 531, "train_runtime": 532.5598, "train_tokens_per_second": 5987.715 }, { "epoch": 0.19567816091954024, "grad_norm": 0.7458609938621521, "learning_rate": 0.00018063684888643475, "loss": 1.9903, "num_input_tokens_seen": 3193312, "step": 532, "train_runtime": 533.3496, "train_tokens_per_second": 5987.277 }, { "epoch": 0.19604597701149426, "grad_norm": 0.739069938659668, "learning_rate": 0.00018060003681207436, "loss": 1.8407, "num_input_tokens_seen": 3200224, "step": 533, "train_runtime": 534.4622, "train_tokens_per_second": 5987.746 }, { "epoch": 0.19641379310344828, "grad_norm": 0.7824617624282837, "learning_rate": 0.000180563224737714, "loss": 1.8743, "num_input_tokens_seen": 3208832, "step": 534, "train_runtime": 535.7856, "train_tokens_per_second": 5989.023 }, { "epoch": 0.1967816091954023, "grad_norm": 0.746059238910675, "learning_rate": 0.0001805264126633536, "loss": 1.719, "num_input_tokens_seen": 3216208, "step": 535, "train_runtime": 536.9608, "train_tokens_per_second": 5989.652 }, { "epoch": 0.19714942528735632, "grad_norm": 0.6949732899665833, "learning_rate": 0.0001804896005889932, "loss": 1.8434, "num_input_tokens_seen": 3226928, "step": 536, "train_runtime": 538.5816, "train_tokens_per_second": 5991.53 }, { "epoch": 0.19751724137931034, "grad_norm": 0.6921513080596924, "learning_rate": 0.00018045278851463282, "loss": 1.6434, "num_input_tokens_seen": 3231440, "step": 537, "train_runtime": 539.3344, "train_tokens_per_second": 5991.533 }, { "epoch": 0.19788505747126436, "grad_norm": 0.7133778929710388, "learning_rate": 0.00018041597644027243, "loss": 1.9168, "num_input_tokens_seen": 3238544, "step": 538, "train_runtime": 540.4574, "train_tokens_per_second": 5992.228 }, { "epoch": 0.19825287356321838, "grad_norm": 0.8469346165657043, "learning_rate": 0.000180379164365912, "loss": 1.8581, "num_input_tokens_seen": 3243568, "step": 539, "train_runtime": 541.3338, "train_tokens_per_second": 5991.807 }, { "epoch": 0.1986206896551724, "grad_norm": 0.7539319396018982, "learning_rate": 0.00018034235229155162, "loss": 1.6721, "num_input_tokens_seen": 3247744, "step": 540, "train_runtime": 542.1184, "train_tokens_per_second": 5990.839 }, { "epoch": 0.19898850574712643, "grad_norm": 0.8973172307014465, "learning_rate": 0.00018030554021719123, "loss": 1.9919, "num_input_tokens_seen": 3251760, "step": 541, "train_runtime": 543.3016, "train_tokens_per_second": 5985.184 }, { "epoch": 0.19935632183908045, "grad_norm": 0.6971712708473206, "learning_rate": 0.00018026872814283086, "loss": 1.9209, "num_input_tokens_seen": 3257168, "step": 542, "train_runtime": 544.1947, "train_tokens_per_second": 5985.299 }, { "epoch": 0.1997241379310345, "grad_norm": 0.7133026123046875, "learning_rate": 0.00018023191606847047, "loss": 1.7659, "num_input_tokens_seen": 3263088, "step": 543, "train_runtime": 545.1676, "train_tokens_per_second": 5985.477 }, { "epoch": 0.20009195402298852, "grad_norm": 0.7758365273475647, "learning_rate": 0.00018019510399411008, "loss": 1.992, "num_input_tokens_seen": 3268144, "step": 544, "train_runtime": 546.0315, "train_tokens_per_second": 5985.267 }, { "epoch": 0.20009195402298852, "eval_loss": 1.8736172914505005, "eval_runtime": 4.8041, "eval_samples_per_second": 208.156, "eval_steps_per_second": 13.114, "num_input_tokens_seen": 3268144, "step": 544 }, { "epoch": 0.20045977011494254, "grad_norm": 0.7243053913116455, "learning_rate": 0.0001801582919197497, "loss": 1.9157, "num_input_tokens_seen": 3275216, "step": 545, "train_runtime": 551.9591, "train_tokens_per_second": 5933.802 }, { "epoch": 0.20082758620689656, "grad_norm": 0.6808502674102783, "learning_rate": 0.0001801214798453893, "loss": 1.6435, "num_input_tokens_seen": 3281888, "step": 546, "train_runtime": 553.0054, "train_tokens_per_second": 5934.64 }, { "epoch": 0.20119540229885058, "grad_norm": 0.7165328860282898, "learning_rate": 0.0001800846677710289, "loss": 1.8499, "num_input_tokens_seen": 3286448, "step": 547, "train_runtime": 553.7982, "train_tokens_per_second": 5934.378 }, { "epoch": 0.2015632183908046, "grad_norm": 0.7008447051048279, "learning_rate": 0.00018004785569666852, "loss": 2.0328, "num_input_tokens_seen": 3291344, "step": 548, "train_runtime": 554.642, "train_tokens_per_second": 5934.178 }, { "epoch": 0.20193103448275862, "grad_norm": 0.6276164650917053, "learning_rate": 0.00018001104362230813, "loss": 1.7145, "num_input_tokens_seen": 3296880, "step": 549, "train_runtime": 555.5703, "train_tokens_per_second": 5934.227 }, { "epoch": 0.20229885057471264, "grad_norm": 0.6550085544586182, "learning_rate": 0.00017997423154794773, "loss": 1.9304, "num_input_tokens_seen": 3303008, "step": 550, "train_runtime": 556.568, "train_tokens_per_second": 5934.599 }, { "epoch": 0.20266666666666666, "grad_norm": 0.6337085962295532, "learning_rate": 0.00017993741947358734, "loss": 1.7112, "num_input_tokens_seen": 3308576, "step": 551, "train_runtime": 557.4912, "train_tokens_per_second": 5934.76 }, { "epoch": 0.20303448275862068, "grad_norm": 0.6780610084533691, "learning_rate": 0.00017990060739922695, "loss": 1.7727, "num_input_tokens_seen": 3313584, "step": 552, "train_runtime": 558.3271, "train_tokens_per_second": 5934.843 }, { "epoch": 0.2034022988505747, "grad_norm": 0.6733942031860352, "learning_rate": 0.00017986379532486656, "loss": 1.9891, "num_input_tokens_seen": 3321920, "step": 553, "train_runtime": 559.6137, "train_tokens_per_second": 5936.095 }, { "epoch": 0.20377011494252872, "grad_norm": 0.7534530758857727, "learning_rate": 0.00017982698325050617, "loss": 2.0452, "num_input_tokens_seen": 3326640, "step": 554, "train_runtime": 560.4157, "train_tokens_per_second": 5936.022 }, { "epoch": 0.20413793103448277, "grad_norm": 0.6698739528656006, "learning_rate": 0.00017979017117614578, "loss": 1.8734, "num_input_tokens_seen": 3332016, "step": 555, "train_runtime": 561.3054, "train_tokens_per_second": 5936.191 }, { "epoch": 0.2045057471264368, "grad_norm": 0.7130821347236633, "learning_rate": 0.0001797533591017854, "loss": 1.9783, "num_input_tokens_seen": 3336976, "step": 556, "train_runtime": 562.1583, "train_tokens_per_second": 5936.008 }, { "epoch": 0.20487356321839081, "grad_norm": 0.682594895362854, "learning_rate": 0.000179716547027425, "loss": 1.6873, "num_input_tokens_seen": 3344016, "step": 557, "train_runtime": 563.2984, "train_tokens_per_second": 5936.491 }, { "epoch": 0.20524137931034483, "grad_norm": 0.7581687569618225, "learning_rate": 0.0001796797349530646, "loss": 1.8726, "num_input_tokens_seen": 3348432, "step": 558, "train_runtime": 564.0586, "train_tokens_per_second": 5936.319 }, { "epoch": 0.20560919540229886, "grad_norm": 0.6403698325157166, "learning_rate": 0.00017964292287870424, "loss": 1.7022, "num_input_tokens_seen": 3356416, "step": 559, "train_runtime": 565.3042, "train_tokens_per_second": 5937.362 }, { "epoch": 0.20597701149425288, "grad_norm": 0.7418535947799683, "learning_rate": 0.00017960611080434385, "loss": 1.8055, "num_input_tokens_seen": 3360304, "step": 560, "train_runtime": 565.9934, "train_tokens_per_second": 5937.002 }, { "epoch": 0.2063448275862069, "grad_norm": 0.6513658761978149, "learning_rate": 0.00017956929872998346, "loss": 1.9174, "num_input_tokens_seen": 3369008, "step": 561, "train_runtime": 567.3447, "train_tokens_per_second": 5938.203 }, { "epoch": 0.20671264367816092, "grad_norm": 0.6533668041229248, "learning_rate": 0.00017953248665562307, "loss": 1.7832, "num_input_tokens_seen": 3382272, "step": 562, "train_runtime": 569.315, "train_tokens_per_second": 5940.95 }, { "epoch": 0.20708045977011494, "grad_norm": 0.7822544574737549, "learning_rate": 0.00017949567458126265, "loss": 1.6444, "num_input_tokens_seen": 3387600, "step": 563, "train_runtime": 570.2116, "train_tokens_per_second": 5940.953 }, { "epoch": 0.20744827586206896, "grad_norm": 0.8226087689399719, "learning_rate": 0.00017945886250690226, "loss": 1.7219, "num_input_tokens_seen": 3394480, "step": 564, "train_runtime": 571.3165, "train_tokens_per_second": 5941.505 }, { "epoch": 0.20781609195402298, "grad_norm": 0.7007325887680054, "learning_rate": 0.00017942205043254187, "loss": 1.8154, "num_input_tokens_seen": 3400144, "step": 565, "train_runtime": 572.2224, "train_tokens_per_second": 5941.997 }, { "epoch": 0.208183908045977, "grad_norm": 0.7794937491416931, "learning_rate": 0.00017938523835818148, "loss": 1.8811, "num_input_tokens_seen": 3406160, "step": 566, "train_runtime": 573.1857, "train_tokens_per_second": 5942.507 }, { "epoch": 0.20855172413793102, "grad_norm": 0.8454579710960388, "learning_rate": 0.00017934842628382109, "loss": 1.9583, "num_input_tokens_seen": 3410656, "step": 567, "train_runtime": 573.9627, "train_tokens_per_second": 5942.295 }, { "epoch": 0.20891954022988507, "grad_norm": 0.7634625434875488, "learning_rate": 0.00017931161420946072, "loss": 1.848, "num_input_tokens_seen": 3415088, "step": 568, "train_runtime": 574.7397, "train_tokens_per_second": 5941.973 }, { "epoch": 0.2092873563218391, "grad_norm": 0.6991872787475586, "learning_rate": 0.00017927480213510033, "loss": 1.9338, "num_input_tokens_seen": 3424400, "step": 569, "train_runtime": 576.1774, "train_tokens_per_second": 5943.308 }, { "epoch": 0.2096551724137931, "grad_norm": 0.6553771495819092, "learning_rate": 0.00017923799006073994, "loss": 1.8144, "num_input_tokens_seen": 3432064, "step": 570, "train_runtime": 577.3636, "train_tokens_per_second": 5944.372 }, { "epoch": 0.21002298850574713, "grad_norm": 0.7230982184410095, "learning_rate": 0.00017920117798637955, "loss": 2.0145, "num_input_tokens_seen": 3440432, "step": 571, "train_runtime": 579.2037, "train_tokens_per_second": 5939.935 }, { "epoch": 0.21039080459770115, "grad_norm": 0.7031193375587463, "learning_rate": 0.00017916436591201916, "loss": 1.9469, "num_input_tokens_seen": 3445792, "step": 572, "train_runtime": 580.1046, "train_tokens_per_second": 5939.95 }, { "epoch": 0.21075862068965517, "grad_norm": 0.7555750608444214, "learning_rate": 0.00017912755383765877, "loss": 1.9087, "num_input_tokens_seen": 3451088, "step": 573, "train_runtime": 580.9869, "train_tokens_per_second": 5940.045 }, { "epoch": 0.2111264367816092, "grad_norm": 0.6957426071166992, "learning_rate": 0.00017909074176329838, "loss": 1.722, "num_input_tokens_seen": 3456240, "step": 574, "train_runtime": 581.8388, "train_tokens_per_second": 5940.202 }, { "epoch": 0.21149425287356322, "grad_norm": 0.8073890209197998, "learning_rate": 0.00017905392968893798, "loss": 2.0494, "num_input_tokens_seen": 3461072, "step": 575, "train_runtime": 582.6506, "train_tokens_per_second": 5940.219 }, { "epoch": 0.21186206896551724, "grad_norm": 0.6882850527763367, "learning_rate": 0.0001790171176145776, "loss": 1.9438, "num_input_tokens_seen": 3466352, "step": 576, "train_runtime": 583.525, "train_tokens_per_second": 5940.366 }, { "epoch": 0.21222988505747126, "grad_norm": 0.6792072653770447, "learning_rate": 0.0001789803055402172, "loss": 1.8989, "num_input_tokens_seen": 3472784, "step": 577, "train_runtime": 584.5789, "train_tokens_per_second": 5940.659 }, { "epoch": 0.21259770114942528, "grad_norm": 0.7088136076927185, "learning_rate": 0.0001789434934658568, "loss": 1.9281, "num_input_tokens_seen": 3477808, "step": 578, "train_runtime": 585.4312, "train_tokens_per_second": 5940.592 }, { "epoch": 0.2129655172413793, "grad_norm": 0.7313692569732666, "learning_rate": 0.00017890668139149642, "loss": 1.7956, "num_input_tokens_seen": 3483072, "step": 579, "train_runtime": 586.3013, "train_tokens_per_second": 5940.754 }, { "epoch": 0.21333333333333335, "grad_norm": 0.7447689771652222, "learning_rate": 0.00017886986931713603, "loss": 1.8087, "num_input_tokens_seen": 3487808, "step": 580, "train_runtime": 587.1009, "train_tokens_per_second": 5940.73 }, { "epoch": 0.21370114942528737, "grad_norm": 0.666411280632019, "learning_rate": 0.00017883305724277564, "loss": 1.8288, "num_input_tokens_seen": 3493264, "step": 581, "train_runtime": 588.0008, "train_tokens_per_second": 5940.917 }, { "epoch": 0.2140689655172414, "grad_norm": 0.6953850984573364, "learning_rate": 0.00017879624516841525, "loss": 1.9789, "num_input_tokens_seen": 3500064, "step": 582, "train_runtime": 589.0704, "train_tokens_per_second": 5941.673 }, { "epoch": 0.2144367816091954, "grad_norm": 0.7432466149330139, "learning_rate": 0.00017875943309405486, "loss": 1.9108, "num_input_tokens_seen": 3504528, "step": 583, "train_runtime": 589.8489, "train_tokens_per_second": 5941.4 }, { "epoch": 0.21480459770114943, "grad_norm": 0.6990666389465332, "learning_rate": 0.00017872262101969446, "loss": 1.8579, "num_input_tokens_seen": 3509536, "step": 584, "train_runtime": 590.6963, "train_tokens_per_second": 5941.354 }, { "epoch": 0.21517241379310345, "grad_norm": 0.7038804888725281, "learning_rate": 0.0001786858089453341, "loss": 1.8356, "num_input_tokens_seen": 3517008, "step": 585, "train_runtime": 591.8795, "train_tokens_per_second": 5942.102 }, { "epoch": 0.21554022988505747, "grad_norm": 0.6550593972206116, "learning_rate": 0.00017864899687097368, "loss": 1.9013, "num_input_tokens_seen": 3525216, "step": 586, "train_runtime": 593.1798, "train_tokens_per_second": 5942.913 }, { "epoch": 0.2159080459770115, "grad_norm": 0.6644894480705261, "learning_rate": 0.0001786121847966133, "loss": 1.9321, "num_input_tokens_seen": 3531472, "step": 587, "train_runtime": 594.2065, "train_tokens_per_second": 5943.173 }, { "epoch": 0.2162758620689655, "grad_norm": 0.7219209671020508, "learning_rate": 0.0001785753727222529, "loss": 1.7653, "num_input_tokens_seen": 3536448, "step": 588, "train_runtime": 595.0394, "train_tokens_per_second": 5943.216 }, { "epoch": 0.21664367816091953, "grad_norm": 0.684423565864563, "learning_rate": 0.0001785385606478925, "loss": 1.8095, "num_input_tokens_seen": 3541744, "step": 589, "train_runtime": 595.922, "train_tokens_per_second": 5943.302 }, { "epoch": 0.21701149425287355, "grad_norm": 0.7029337882995605, "learning_rate": 0.00017850174857353212, "loss": 1.8254, "num_input_tokens_seen": 3547120, "step": 590, "train_runtime": 596.8062, "train_tokens_per_second": 5943.504 }, { "epoch": 0.21737931034482758, "grad_norm": 0.71671462059021, "learning_rate": 0.00017846493649917173, "loss": 1.6723, "num_input_tokens_seen": 3553872, "step": 591, "train_runtime": 597.8796, "train_tokens_per_second": 5944.126 }, { "epoch": 0.2177471264367816, "grad_norm": 0.6957038640975952, "learning_rate": 0.00017842812442481134, "loss": 1.7098, "num_input_tokens_seen": 3561120, "step": 592, "train_runtime": 599.0471, "train_tokens_per_second": 5944.641 }, { "epoch": 0.21811494252873564, "grad_norm": 0.7224963307380676, "learning_rate": 0.00017839131235045094, "loss": 1.9218, "num_input_tokens_seen": 3566112, "step": 593, "train_runtime": 599.8729, "train_tokens_per_second": 5944.779 }, { "epoch": 0.21848275862068967, "grad_norm": 0.6886675357818604, "learning_rate": 0.00017835450027609058, "loss": 1.8008, "num_input_tokens_seen": 3574928, "step": 594, "train_runtime": 601.2434, "train_tokens_per_second": 5945.891 }, { "epoch": 0.2188505747126437, "grad_norm": 0.7517166137695312, "learning_rate": 0.0001783176882017302, "loss": 1.7053, "num_input_tokens_seen": 3579280, "step": 595, "train_runtime": 601.9943, "train_tokens_per_second": 5945.704 }, { "epoch": 0.2192183908045977, "grad_norm": 0.735989511013031, "learning_rate": 0.0001782808761273698, "loss": 1.7164, "num_input_tokens_seen": 3585120, "step": 596, "train_runtime": 602.9376, "train_tokens_per_second": 5946.088 }, { "epoch": 0.21958620689655173, "grad_norm": 0.7238099575042725, "learning_rate": 0.0001782440640530094, "loss": 1.8123, "num_input_tokens_seen": 3592304, "step": 597, "train_runtime": 604.0617, "train_tokens_per_second": 5946.916 }, { "epoch": 0.21995402298850575, "grad_norm": 0.8470680713653564, "learning_rate": 0.00017820725197864902, "loss": 1.9266, "num_input_tokens_seen": 3598336, "step": 598, "train_runtime": 605.0367, "train_tokens_per_second": 5947.302 }, { "epoch": 0.22032183908045977, "grad_norm": 0.7912116050720215, "learning_rate": 0.0001781704399042886, "loss": 1.831, "num_input_tokens_seen": 3602992, "step": 599, "train_runtime": 605.8589, "train_tokens_per_second": 5946.916 }, { "epoch": 0.2206896551724138, "grad_norm": 0.7828996181488037, "learning_rate": 0.0001781336278299282, "loss": 1.8715, "num_input_tokens_seen": 3608048, "step": 600, "train_runtime": 606.7243, "train_tokens_per_second": 5946.767 }, { "epoch": 0.2210574712643678, "grad_norm": 0.7932271957397461, "learning_rate": 0.00017809681575556782, "loss": 2.1117, "num_input_tokens_seen": 3612880, "step": 601, "train_runtime": 608.0032, "train_tokens_per_second": 5942.205 }, { "epoch": 0.22142528735632183, "grad_norm": 0.7785124778747559, "learning_rate": 0.00017806000368120745, "loss": 1.9367, "num_input_tokens_seen": 3618320, "step": 602, "train_runtime": 608.885, "train_tokens_per_second": 5942.534 }, { "epoch": 0.22179310344827585, "grad_norm": 0.8122251629829407, "learning_rate": 0.00017802319160684706, "loss": 1.6962, "num_input_tokens_seen": 3623488, "step": 603, "train_runtime": 609.7605, "train_tokens_per_second": 5942.478 }, { "epoch": 0.22216091954022987, "grad_norm": 0.6948246955871582, "learning_rate": 0.00017798637953248667, "loss": 1.733, "num_input_tokens_seen": 3629104, "step": 604, "train_runtime": 610.6906, "train_tokens_per_second": 5942.623 }, { "epoch": 0.22252873563218392, "grad_norm": 0.7401772141456604, "learning_rate": 0.00017794956745812628, "loss": 2.0811, "num_input_tokens_seen": 3633664, "step": 605, "train_runtime": 611.5031, "train_tokens_per_second": 5942.184 }, { "epoch": 0.22289655172413794, "grad_norm": 0.8130412697792053, "learning_rate": 0.0001779127553837659, "loss": 2.0618, "num_input_tokens_seen": 3638208, "step": 606, "train_runtime": 612.2873, "train_tokens_per_second": 5941.995 }, { "epoch": 0.22326436781609196, "grad_norm": 0.8034175038337708, "learning_rate": 0.0001778759433094055, "loss": 1.8695, "num_input_tokens_seen": 3642576, "step": 607, "train_runtime": 613.0453, "train_tokens_per_second": 5941.773 }, { "epoch": 0.22363218390804598, "grad_norm": 0.7706856727600098, "learning_rate": 0.0001778391312350451, "loss": 1.8332, "num_input_tokens_seen": 3647024, "step": 608, "train_runtime": 613.8286, "train_tokens_per_second": 5941.437 }, { "epoch": 0.224, "grad_norm": 0.8016795516014099, "learning_rate": 0.00017780231916068471, "loss": 1.8524, "num_input_tokens_seen": 3651744, "step": 609, "train_runtime": 614.6363, "train_tokens_per_second": 5941.309 }, { "epoch": 0.22436781609195403, "grad_norm": 0.6998735666275024, "learning_rate": 0.00017776550708632432, "loss": 1.8093, "num_input_tokens_seen": 3658720, "step": 610, "train_runtime": 615.7086, "train_tokens_per_second": 5942.291 }, { "epoch": 0.22473563218390805, "grad_norm": 0.7392911314964294, "learning_rate": 0.00017772869501196393, "loss": 1.9444, "num_input_tokens_seen": 3663408, "step": 611, "train_runtime": 616.5343, "train_tokens_per_second": 5941.937 }, { "epoch": 0.22510344827586207, "grad_norm": 0.7386958599090576, "learning_rate": 0.00017769188293760354, "loss": 1.7245, "num_input_tokens_seen": 3669232, "step": 612, "train_runtime": 617.4985, "train_tokens_per_second": 5942.091 }, { "epoch": 0.2254712643678161, "grad_norm": 0.8053456544876099, "learning_rate": 0.00017765507086324315, "loss": 1.8809, "num_input_tokens_seen": 3675056, "step": 613, "train_runtime": 618.4492, "train_tokens_per_second": 5942.374 }, { "epoch": 0.2258390804597701, "grad_norm": 0.6959522366523743, "learning_rate": 0.00017761825878888276, "loss": 1.7003, "num_input_tokens_seen": 3680336, "step": 614, "train_runtime": 619.3484, "train_tokens_per_second": 5942.271 }, { "epoch": 0.22620689655172413, "grad_norm": 0.8027039766311646, "learning_rate": 0.00017758144671452237, "loss": 1.6945, "num_input_tokens_seen": 3685568, "step": 615, "train_runtime": 620.2209, "train_tokens_per_second": 5942.348 }, { "epoch": 0.22657471264367815, "grad_norm": 0.6943402290344238, "learning_rate": 0.00017754463464016198, "loss": 1.7537, "num_input_tokens_seen": 3691744, "step": 616, "train_runtime": 621.2084, "train_tokens_per_second": 5942.843 }, { "epoch": 0.22694252873563217, "grad_norm": 0.6399091482162476, "learning_rate": 0.00017750782256580158, "loss": 1.6842, "num_input_tokens_seen": 3702768, "step": 617, "train_runtime": 622.8754, "train_tokens_per_second": 5944.637 }, { "epoch": 0.22731034482758622, "grad_norm": 0.7171786427497864, "learning_rate": 0.0001774710104914412, "loss": 1.7311, "num_input_tokens_seen": 3709216, "step": 618, "train_runtime": 623.9598, "train_tokens_per_second": 5944.639 }, { "epoch": 0.22767816091954024, "grad_norm": 0.7073584198951721, "learning_rate": 0.00017743419841708083, "loss": 1.8136, "num_input_tokens_seen": 3714112, "step": 619, "train_runtime": 624.7929, "train_tokens_per_second": 5944.549 }, { "epoch": 0.22804597701149426, "grad_norm": 0.6660651564598083, "learning_rate": 0.00017739738634272044, "loss": 1.8246, "num_input_tokens_seen": 3723104, "step": 620, "train_runtime": 626.1956, "train_tokens_per_second": 5945.593 }, { "epoch": 0.22841379310344828, "grad_norm": 0.7154439091682434, "learning_rate": 0.00017736057426836005, "loss": 1.7245, "num_input_tokens_seen": 3730000, "step": 621, "train_runtime": 627.3042, "train_tokens_per_second": 5946.079 }, { "epoch": 0.2287816091954023, "grad_norm": 0.7616729736328125, "learning_rate": 0.00017732376219399966, "loss": 2.0513, "num_input_tokens_seen": 3736912, "step": 622, "train_runtime": 628.3838, "train_tokens_per_second": 5946.863 }, { "epoch": 0.22914942528735632, "grad_norm": 0.7419039607048035, "learning_rate": 0.00017728695011963924, "loss": 1.7101, "num_input_tokens_seen": 3741840, "step": 623, "train_runtime": 629.1809, "train_tokens_per_second": 5947.161 }, { "epoch": 0.22951724137931034, "grad_norm": 0.710760772228241, "learning_rate": 0.00017725013804527885, "loss": 1.9318, "num_input_tokens_seen": 3747200, "step": 624, "train_runtime": 630.0671, "train_tokens_per_second": 5947.304 }, { "epoch": 0.22988505747126436, "grad_norm": 0.649756908416748, "learning_rate": 0.00017721332597091846, "loss": 2.0162, "num_input_tokens_seen": 3752016, "step": 625, "train_runtime": 630.9201, "train_tokens_per_second": 5946.895 }, { "epoch": 0.23025287356321839, "grad_norm": 0.7205575108528137, "learning_rate": 0.00017717651389655806, "loss": 1.82, "num_input_tokens_seen": 3757104, "step": 626, "train_runtime": 631.7768, "train_tokens_per_second": 5946.885 }, { "epoch": 0.2306206896551724, "grad_norm": 0.7039726376533508, "learning_rate": 0.00017713970182219767, "loss": 1.9755, "num_input_tokens_seen": 3765232, "step": 627, "train_runtime": 633.0555, "train_tokens_per_second": 5947.712 }, { "epoch": 0.23098850574712643, "grad_norm": 0.6161988973617554, "learning_rate": 0.0001771028897478373, "loss": 1.7607, "num_input_tokens_seen": 3771248, "step": 628, "train_runtime": 634.038, "train_tokens_per_second": 5947.984 }, { "epoch": 0.23135632183908045, "grad_norm": 0.6338945031166077, "learning_rate": 0.00017706607767347692, "loss": 1.6776, "num_input_tokens_seen": 3778848, "step": 629, "train_runtime": 635.2454, "train_tokens_per_second": 5948.642 }, { "epoch": 0.2317241379310345, "grad_norm": 0.6846767663955688, "learning_rate": 0.00017702926559911653, "loss": 1.8294, "num_input_tokens_seen": 3783184, "step": 630, "train_runtime": 636.0073, "train_tokens_per_second": 5948.334 }, { "epoch": 0.23209195402298852, "grad_norm": 0.6843883991241455, "learning_rate": 0.00017699245352475614, "loss": 2.0506, "num_input_tokens_seen": 3788352, "step": 631, "train_runtime": 637.3439, "train_tokens_per_second": 5943.968 }, { "epoch": 0.23245977011494254, "grad_norm": 0.632727861404419, "learning_rate": 0.00017695564145039575, "loss": 1.7141, "num_input_tokens_seen": 3794576, "step": 632, "train_runtime": 638.3541, "train_tokens_per_second": 5944.312 }, { "epoch": 0.23282758620689656, "grad_norm": 0.6620173454284668, "learning_rate": 0.00017691882937603535, "loss": 1.793, "num_input_tokens_seen": 3799728, "step": 633, "train_runtime": 639.2227, "train_tokens_per_second": 5944.295 }, { "epoch": 0.23319540229885058, "grad_norm": 0.7021250128746033, "learning_rate": 0.00017688201730167496, "loss": 1.8166, "num_input_tokens_seen": 3804928, "step": 634, "train_runtime": 640.0866, "train_tokens_per_second": 5944.396 }, { "epoch": 0.2335632183908046, "grad_norm": 0.8043453097343445, "learning_rate": 0.00017684520522731457, "loss": 1.7254, "num_input_tokens_seen": 3811344, "step": 635, "train_runtime": 641.1146, "train_tokens_per_second": 5944.871 }, { "epoch": 0.23393103448275862, "grad_norm": 0.7299250364303589, "learning_rate": 0.00017680839315295418, "loss": 1.995, "num_input_tokens_seen": 3818048, "step": 636, "train_runtime": 642.1857, "train_tokens_per_second": 5945.395 }, { "epoch": 0.23429885057471264, "grad_norm": 0.673685610294342, "learning_rate": 0.0001767715810785938, "loss": 1.8463, "num_input_tokens_seen": 3824112, "step": 637, "train_runtime": 643.1493, "train_tokens_per_second": 5945.917 }, { "epoch": 0.23466666666666666, "grad_norm": 0.6168797016143799, "learning_rate": 0.0001767347690042334, "loss": 1.8969, "num_input_tokens_seen": 3832528, "step": 638, "train_runtime": 644.4422, "train_tokens_per_second": 5947.047 }, { "epoch": 0.23503448275862068, "grad_norm": 0.7642756104469299, "learning_rate": 0.000176697956929873, "loss": 2.0022, "num_input_tokens_seen": 3837584, "step": 639, "train_runtime": 645.2897, "train_tokens_per_second": 5947.072 }, { "epoch": 0.2354022988505747, "grad_norm": 0.7426885962486267, "learning_rate": 0.00017666114485551262, "loss": 1.8024, "num_input_tokens_seen": 3843184, "step": 640, "train_runtime": 646.2141, "train_tokens_per_second": 5947.23 }, { "epoch": 0.23577011494252872, "grad_norm": 0.7234979867935181, "learning_rate": 0.00017662433278115223, "loss": 1.7453, "num_input_tokens_seen": 3850192, "step": 641, "train_runtime": 647.366, "train_tokens_per_second": 5947.473 }, { "epoch": 0.23613793103448275, "grad_norm": 0.6388785243034363, "learning_rate": 0.00017658752070679183, "loss": 1.7032, "num_input_tokens_seen": 3858592, "step": 642, "train_runtime": 648.6702, "train_tokens_per_second": 5948.465 }, { "epoch": 0.2365057471264368, "grad_norm": 0.6985915303230286, "learning_rate": 0.00017655070863243144, "loss": 1.8575, "num_input_tokens_seen": 3866288, "step": 643, "train_runtime": 649.8596, "train_tokens_per_second": 5949.42 }, { "epoch": 0.23687356321839081, "grad_norm": 0.674976646900177, "learning_rate": 0.00017651389655807105, "loss": 1.7333, "num_input_tokens_seen": 3873104, "step": 644, "train_runtime": 650.9387, "train_tokens_per_second": 5950.029 }, { "epoch": 0.23724137931034484, "grad_norm": 0.6618773937225342, "learning_rate": 0.0001764770844837107, "loss": 1.7685, "num_input_tokens_seen": 3878384, "step": 645, "train_runtime": 651.8213, "train_tokens_per_second": 5950.073 }, { "epoch": 0.23760919540229886, "grad_norm": 0.7591787576675415, "learning_rate": 0.00017644027240935027, "loss": 1.9053, "num_input_tokens_seen": 3884592, "step": 646, "train_runtime": 652.8453, "train_tokens_per_second": 5950.249 }, { "epoch": 0.23797701149425288, "grad_norm": 0.7597478032112122, "learning_rate": 0.00017640346033498988, "loss": 1.8146, "num_input_tokens_seen": 3889872, "step": 647, "train_runtime": 653.7209, "train_tokens_per_second": 5950.356 }, { "epoch": 0.2383448275862069, "grad_norm": 0.7259320616722107, "learning_rate": 0.0001763666482606295, "loss": 1.8141, "num_input_tokens_seen": 3894512, "step": 648, "train_runtime": 654.5088, "train_tokens_per_second": 5950.282 }, { "epoch": 0.23871264367816092, "grad_norm": 0.713681697845459, "learning_rate": 0.0001763298361862691, "loss": 1.7502, "num_input_tokens_seen": 3900832, "step": 649, "train_runtime": 655.5372, "train_tokens_per_second": 5950.588 }, { "epoch": 0.23908045977011494, "grad_norm": 0.6367166042327881, "learning_rate": 0.0001762930241119087, "loss": 1.7876, "num_input_tokens_seen": 3909696, "step": 650, "train_runtime": 656.901, "train_tokens_per_second": 5951.728 }, { "epoch": 0.23944827586206896, "grad_norm": 0.8463271856307983, "learning_rate": 0.00017625621203754831, "loss": 1.9971, "num_input_tokens_seen": 3914608, "step": 651, "train_runtime": 657.741, "train_tokens_per_second": 5951.595 }, { "epoch": 0.23981609195402298, "grad_norm": 0.7609216570854187, "learning_rate": 0.00017621939996318792, "loss": 1.8, "num_input_tokens_seen": 3923392, "step": 652, "train_runtime": 659.0891, "train_tokens_per_second": 5952.749 }, { "epoch": 0.240183908045977, "grad_norm": 0.8769307136535645, "learning_rate": 0.00017618258788882756, "loss": 1.8835, "num_input_tokens_seen": 3928576, "step": 653, "train_runtime": 659.9505, "train_tokens_per_second": 5952.835 }, { "epoch": 0.24055172413793102, "grad_norm": 0.8489215970039368, "learning_rate": 0.00017614577581446717, "loss": 1.7344, "num_input_tokens_seen": 3933984, "step": 654, "train_runtime": 660.8341, "train_tokens_per_second": 5953.059 }, { "epoch": 0.24091954022988507, "grad_norm": 0.7326881289482117, "learning_rate": 0.00017610896374010678, "loss": 1.7455, "num_input_tokens_seen": 3942272, "step": 655, "train_runtime": 662.1217, "train_tokens_per_second": 5953.999 }, { "epoch": 0.2412873563218391, "grad_norm": 0.8228838443756104, "learning_rate": 0.00017607215166574639, "loss": 1.9441, "num_input_tokens_seen": 3946848, "step": 656, "train_runtime": 662.9264, "train_tokens_per_second": 5953.674 }, { "epoch": 0.2416551724137931, "grad_norm": 0.6861847043037415, "learning_rate": 0.000176035339591386, "loss": 1.7707, "num_input_tokens_seen": 3951456, "step": 657, "train_runtime": 663.7259, "train_tokens_per_second": 5953.446 }, { "epoch": 0.24202298850574713, "grad_norm": 0.6617019176483154, "learning_rate": 0.0001759985275170256, "loss": 1.6957, "num_input_tokens_seen": 3958720, "step": 658, "train_runtime": 664.8682, "train_tokens_per_second": 5954.142 }, { "epoch": 0.24239080459770115, "grad_norm": 0.6823275089263916, "learning_rate": 0.00017596171544266519, "loss": 1.934, "num_input_tokens_seen": 3968432, "step": 659, "train_runtime": 666.3434, "train_tokens_per_second": 5955.535 }, { "epoch": 0.24275862068965517, "grad_norm": 0.7465804219245911, "learning_rate": 0.0001759249033683048, "loss": 1.8067, "num_input_tokens_seen": 3973152, "step": 660, "train_runtime": 667.1499, "train_tokens_per_second": 5955.411 }, { "epoch": 0.2431264367816092, "grad_norm": 0.7939881086349487, "learning_rate": 0.0001758880912939444, "loss": 2.0186, "num_input_tokens_seen": 3978160, "step": 661, "train_runtime": 668.4655, "train_tokens_per_second": 5951.182 }, { "epoch": 0.24349425287356322, "grad_norm": 0.6984440684318542, "learning_rate": 0.00017585127921958404, "loss": 1.667, "num_input_tokens_seen": 3983360, "step": 662, "train_runtime": 669.3371, "train_tokens_per_second": 5951.202 }, { "epoch": 0.24386206896551724, "grad_norm": 0.6744182109832764, "learning_rate": 0.00017581446714522365, "loss": 1.7551, "num_input_tokens_seen": 3988992, "step": 663, "train_runtime": 670.2541, "train_tokens_per_second": 5951.462 }, { "epoch": 0.24422988505747126, "grad_norm": 0.7228152751922607, "learning_rate": 0.00017577765507086326, "loss": 1.6449, "num_input_tokens_seen": 3994160, "step": 664, "train_runtime": 671.132, "train_tokens_per_second": 5951.377 }, { "epoch": 0.24459770114942528, "grad_norm": 0.7169431447982788, "learning_rate": 0.00017574084299650287, "loss": 2.0453, "num_input_tokens_seen": 3999456, "step": 665, "train_runtime": 672.0239, "train_tokens_per_second": 5951.36 }, { "epoch": 0.2449655172413793, "grad_norm": 0.7038352489471436, "learning_rate": 0.00017570403092214247, "loss": 1.8064, "num_input_tokens_seen": 4004864, "step": 666, "train_runtime": 672.9381, "train_tokens_per_second": 5951.311 }, { "epoch": 0.24533333333333332, "grad_norm": 0.6899456977844238, "learning_rate": 0.00017566721884778208, "loss": 1.7173, "num_input_tokens_seen": 4010624, "step": 667, "train_runtime": 673.8709, "train_tokens_per_second": 5951.621 }, { "epoch": 0.24570114942528737, "grad_norm": 0.6827689409255981, "learning_rate": 0.0001756304067734217, "loss": 1.9384, "num_input_tokens_seen": 4016112, "step": 668, "train_runtime": 674.7888, "train_tokens_per_second": 5951.658 }, { "epoch": 0.2460689655172414, "grad_norm": 0.6630880832672119, "learning_rate": 0.0001755935946990613, "loss": 1.7599, "num_input_tokens_seen": 4022160, "step": 669, "train_runtime": 675.7794, "train_tokens_per_second": 5951.883 }, { "epoch": 0.2464367816091954, "grad_norm": 0.7457953095436096, "learning_rate": 0.0001755567826247009, "loss": 1.7006, "num_input_tokens_seen": 4031584, "step": 670, "train_runtime": 677.2077, "train_tokens_per_second": 5953.246 }, { "epoch": 0.24680459770114943, "grad_norm": 0.6746439933776855, "learning_rate": 0.00017551997055034052, "loss": 2.0363, "num_input_tokens_seen": 4036304, "step": 671, "train_runtime": 678.0284, "train_tokens_per_second": 5953.001 }, { "epoch": 0.24717241379310345, "grad_norm": 0.756391167640686, "learning_rate": 0.00017548315847598013, "loss": 1.7493, "num_input_tokens_seen": 4041232, "step": 672, "train_runtime": 678.8637, "train_tokens_per_second": 5952.936 }, { "epoch": 0.24754022988505747, "grad_norm": 0.6909932494163513, "learning_rate": 0.00017544634640161974, "loss": 1.6926, "num_input_tokens_seen": 4046496, "step": 673, "train_runtime": 679.729, "train_tokens_per_second": 5953.102 }, { "epoch": 0.2479080459770115, "grad_norm": 0.7453582286834717, "learning_rate": 0.00017540953432725935, "loss": 1.7609, "num_input_tokens_seen": 4051168, "step": 674, "train_runtime": 680.5451, "train_tokens_per_second": 5952.828 }, { "epoch": 0.2482758620689655, "grad_norm": 0.8183576464653015, "learning_rate": 0.00017537272225289895, "loss": 1.7621, "num_input_tokens_seen": 4055536, "step": 675, "train_runtime": 681.315, "train_tokens_per_second": 5952.513 }, { "epoch": 0.24864367816091953, "grad_norm": 0.6562678217887878, "learning_rate": 0.00017533591017853856, "loss": 1.9175, "num_input_tokens_seen": 4061200, "step": 676, "train_runtime": 682.2424, "train_tokens_per_second": 5952.723 }, { "epoch": 0.24901149425287356, "grad_norm": 0.6592198014259338, "learning_rate": 0.00017529909810417817, "loss": 1.7407, "num_input_tokens_seen": 4067232, "step": 677, "train_runtime": 683.2577, "train_tokens_per_second": 5952.706 }, { "epoch": 0.24937931034482758, "grad_norm": 0.7017592191696167, "learning_rate": 0.00017526228602981778, "loss": 2.0132, "num_input_tokens_seen": 4073168, "step": 678, "train_runtime": 684.2171, "train_tokens_per_second": 5953.034 }, { "epoch": 0.2497471264367816, "grad_norm": 0.7664760947227478, "learning_rate": 0.00017522547395545742, "loss": 1.7824, "num_input_tokens_seen": 4078976, "step": 679, "train_runtime": 685.1825, "train_tokens_per_second": 5953.124 }, { "epoch": 0.2501149425287356, "grad_norm": 0.7167187333106995, "learning_rate": 0.00017518866188109703, "loss": 1.8287, "num_input_tokens_seen": 4084016, "step": 680, "train_runtime": 686.0382, "train_tokens_per_second": 5953.044 }, { "epoch": 0.25048275862068964, "grad_norm": 0.7765895128250122, "learning_rate": 0.00017515184980673664, "loss": 1.8548, "num_input_tokens_seen": 4088368, "step": 681, "train_runtime": 686.8084, "train_tokens_per_second": 5952.705 }, { "epoch": 0.25085057471264366, "grad_norm": 0.7921008467674255, "learning_rate": 0.00017511503773237622, "loss": 1.8748, "num_input_tokens_seen": 4093440, "step": 682, "train_runtime": 687.6535, "train_tokens_per_second": 5952.765 }, { "epoch": 0.2512183908045977, "grad_norm": 0.7032368183135986, "learning_rate": 0.00017507822565801583, "loss": 1.9732, "num_input_tokens_seen": 4098272, "step": 683, "train_runtime": 688.4666, "train_tokens_per_second": 5952.754 }, { "epoch": 0.2515862068965517, "grad_norm": 0.6406055092811584, "learning_rate": 0.00017504141358365543, "loss": 1.7464, "num_input_tokens_seen": 4105584, "step": 684, "train_runtime": 689.6071, "train_tokens_per_second": 5953.512 }, { "epoch": 0.2519540229885057, "grad_norm": 0.7085546851158142, "learning_rate": 0.00017500460150929504, "loss": 1.8475, "num_input_tokens_seen": 4110640, "step": 685, "train_runtime": 690.48, "train_tokens_per_second": 5953.307 }, { "epoch": 0.2523218390804598, "grad_norm": 0.6811719536781311, "learning_rate": 0.00017496778943493465, "loss": 1.9318, "num_input_tokens_seen": 4116544, "step": 686, "train_runtime": 691.4348, "train_tokens_per_second": 5953.625 }, { "epoch": 0.2526896551724138, "grad_norm": 0.8263639211654663, "learning_rate": 0.00017493097736057426, "loss": 1.9458, "num_input_tokens_seen": 4122624, "step": 687, "train_runtime": 692.4211, "train_tokens_per_second": 5953.926 }, { "epoch": 0.25305747126436784, "grad_norm": 0.5855770707130432, "learning_rate": 0.0001748941652862139, "loss": 1.7027, "num_input_tokens_seen": 4130608, "step": 688, "train_runtime": 693.7108, "train_tokens_per_second": 5954.366 }, { "epoch": 0.25342528735632186, "grad_norm": 0.6426771879196167, "learning_rate": 0.0001748573532118535, "loss": 1.7845, "num_input_tokens_seen": 4139504, "step": 689, "train_runtime": 695.0823, "train_tokens_per_second": 5955.416 }, { "epoch": 0.2537931034482759, "grad_norm": 0.6769132018089294, "learning_rate": 0.00017482054113749312, "loss": 1.7137, "num_input_tokens_seen": 4144176, "step": 690, "train_runtime": 695.9074, "train_tokens_per_second": 5955.068 }, { "epoch": 0.2541609195402299, "grad_norm": 0.7636768221855164, "learning_rate": 0.00017478372906313272, "loss": 1.9653, "num_input_tokens_seen": 4151456, "step": 691, "train_runtime": 697.567, "train_tokens_per_second": 5951.337 }, { "epoch": 0.2545287356321839, "grad_norm": 0.796562910079956, "learning_rate": 0.00017474691698877233, "loss": 1.6889, "num_input_tokens_seen": 4156288, "step": 692, "train_runtime": 698.3876, "train_tokens_per_second": 5951.262 }, { "epoch": 0.25489655172413794, "grad_norm": 0.7037853598594666, "learning_rate": 0.00017471010491441194, "loss": 1.65, "num_input_tokens_seen": 4165248, "step": 693, "train_runtime": 699.7729, "train_tokens_per_second": 5952.286 }, { "epoch": 0.25526436781609196, "grad_norm": 0.7308499813079834, "learning_rate": 0.00017467329284005155, "loss": 1.7507, "num_input_tokens_seen": 4170512, "step": 694, "train_runtime": 700.6424, "train_tokens_per_second": 5952.412 }, { "epoch": 0.255632183908046, "grad_norm": 0.7657448649406433, "learning_rate": 0.00017463648076569113, "loss": 1.908, "num_input_tokens_seen": 4175328, "step": 695, "train_runtime": 701.4732, "train_tokens_per_second": 5952.227 }, { "epoch": 0.256, "grad_norm": 0.8205829858779907, "learning_rate": 0.00017459966869133077, "loss": 1.8358, "num_input_tokens_seen": 4180928, "step": 696, "train_runtime": 702.384, "train_tokens_per_second": 5952.482 }, { "epoch": 0.256367816091954, "grad_norm": 0.7902839779853821, "learning_rate": 0.00017456285661697038, "loss": 1.7706, "num_input_tokens_seen": 4186256, "step": 697, "train_runtime": 703.2841, "train_tokens_per_second": 5952.439 }, { "epoch": 0.25673563218390805, "grad_norm": 0.7034733891487122, "learning_rate": 0.00017452604454260999, "loss": 1.7407, "num_input_tokens_seen": 4191856, "step": 698, "train_runtime": 704.2155, "train_tokens_per_second": 5952.519 }, { "epoch": 0.25710344827586207, "grad_norm": 0.6806679368019104, "learning_rate": 0.0001744892324682496, "loss": 1.7302, "num_input_tokens_seen": 4197824, "step": 699, "train_runtime": 705.205, "train_tokens_per_second": 5952.63 }, { "epoch": 0.2574712643678161, "grad_norm": 0.8030396699905396, "learning_rate": 0.0001744524203938892, "loss": 1.9087, "num_input_tokens_seen": 4202304, "step": 700, "train_runtime": 706.0103, "train_tokens_per_second": 5952.185 }, { "epoch": 0.2578390804597701, "grad_norm": 0.7756878137588501, "learning_rate": 0.0001744156083195288, "loss": 1.9351, "num_input_tokens_seen": 4208848, "step": 701, "train_runtime": 707.0844, "train_tokens_per_second": 5952.399 }, { "epoch": 0.25820689655172413, "grad_norm": 0.7415671944618225, "learning_rate": 0.00017437879624516842, "loss": 1.9063, "num_input_tokens_seen": 4213776, "step": 702, "train_runtime": 707.9274, "train_tokens_per_second": 5952.271 }, { "epoch": 0.25857471264367815, "grad_norm": 0.8117818832397461, "learning_rate": 0.00017434198417080803, "loss": 2.0566, "num_input_tokens_seen": 4219024, "step": 703, "train_runtime": 708.8186, "train_tokens_per_second": 5952.191 }, { "epoch": 0.25894252873563217, "grad_norm": 0.6948313117027283, "learning_rate": 0.00017430517209644764, "loss": 1.8695, "num_input_tokens_seen": 4223392, "step": 704, "train_runtime": 709.5814, "train_tokens_per_second": 5951.949 }, { "epoch": 0.2593103448275862, "grad_norm": 0.6284450888633728, "learning_rate": 0.00017426836002208728, "loss": 1.4643, "num_input_tokens_seen": 4228720, "step": 705, "train_runtime": 710.4713, "train_tokens_per_second": 5951.993 }, { "epoch": 0.2596781609195402, "grad_norm": 0.5065260529518127, "learning_rate": 0.00017423154794772686, "loss": 1.4118, "num_input_tokens_seen": 4243920, "step": 706, "train_runtime": 714.2472, "train_tokens_per_second": 5941.809 }, { "epoch": 0.26004597701149423, "grad_norm": 0.6901469230651855, "learning_rate": 0.00017419473587336647, "loss": 1.6742, "num_input_tokens_seen": 4249312, "step": 707, "train_runtime": 715.1463, "train_tokens_per_second": 5941.878 }, { "epoch": 0.26041379310344825, "grad_norm": 0.7213504314422607, "learning_rate": 0.00017415792379900608, "loss": 2.0069, "num_input_tokens_seen": 4253968, "step": 708, "train_runtime": 715.9359, "train_tokens_per_second": 5941.828 }, { "epoch": 0.2607816091954023, "grad_norm": 0.6717199683189392, "learning_rate": 0.00017412111172464568, "loss": 1.6791, "num_input_tokens_seen": 4261216, "step": 709, "train_runtime": 717.1007, "train_tokens_per_second": 5942.284 }, { "epoch": 0.2611494252873563, "grad_norm": 0.6818445920944214, "learning_rate": 0.0001740842996502853, "loss": 1.962, "num_input_tokens_seen": 4265776, "step": 710, "train_runtime": 717.9092, "train_tokens_per_second": 5941.944 }, { "epoch": 0.2615172413793104, "grad_norm": 0.6660798788070679, "learning_rate": 0.0001740474875759249, "loss": 1.8531, "num_input_tokens_seen": 4273168, "step": 711, "train_runtime": 719.0833, "train_tokens_per_second": 5942.521 }, { "epoch": 0.2618850574712644, "grad_norm": 0.656058132648468, "learning_rate": 0.0001740106755015645, "loss": 1.6675, "num_input_tokens_seen": 4281264, "step": 712, "train_runtime": 720.3405, "train_tokens_per_second": 5943.389 }, { "epoch": 0.2622528735632184, "grad_norm": 0.6193675994873047, "learning_rate": 0.00017397386342720415, "loss": 1.793, "num_input_tokens_seen": 4286816, "step": 713, "train_runtime": 721.25, "train_tokens_per_second": 5943.592 }, { "epoch": 0.26262068965517243, "grad_norm": 0.7687742114067078, "learning_rate": 0.00017393705135284376, "loss": 1.7398, "num_input_tokens_seen": 4291392, "step": 714, "train_runtime": 722.0391, "train_tokens_per_second": 5943.434 }, { "epoch": 0.26298850574712646, "grad_norm": 0.6832330226898193, "learning_rate": 0.00017390023927848336, "loss": 1.8785, "num_input_tokens_seen": 4297248, "step": 715, "train_runtime": 722.9793, "train_tokens_per_second": 5943.805 }, { "epoch": 0.2633563218390805, "grad_norm": 0.6707386374473572, "learning_rate": 0.00017386342720412297, "loss": 1.5973, "num_input_tokens_seen": 4301632, "step": 716, "train_runtime": 723.7293, "train_tokens_per_second": 5943.703 }, { "epoch": 0.2637241379310345, "grad_norm": 0.6461231112480164, "learning_rate": 0.00017382661512976258, "loss": 1.7142, "num_input_tokens_seen": 4308608, "step": 717, "train_runtime": 724.8146, "train_tokens_per_second": 5944.428 }, { "epoch": 0.2640919540229885, "grad_norm": 0.7029957175254822, "learning_rate": 0.0001737898030554022, "loss": 1.9736, "num_input_tokens_seen": 4315872, "step": 718, "train_runtime": 725.9703, "train_tokens_per_second": 5944.97 }, { "epoch": 0.26445977011494254, "grad_norm": 0.7732644081115723, "learning_rate": 0.00017375299098104177, "loss": 1.9659, "num_input_tokens_seen": 4321856, "step": 719, "train_runtime": 726.9372, "train_tokens_per_second": 5945.295 }, { "epoch": 0.26482758620689656, "grad_norm": 0.5895112752914429, "learning_rate": 0.00017371617890668138, "loss": 1.5641, "num_input_tokens_seen": 4330720, "step": 720, "train_runtime": 728.3081, "train_tokens_per_second": 5946.274 }, { "epoch": 0.2651954022988506, "grad_norm": 0.7460876107215881, "learning_rate": 0.000173679366832321, "loss": 1.7145, "num_input_tokens_seen": 4336208, "step": 721, "train_runtime": 729.7049, "train_tokens_per_second": 5942.413 }, { "epoch": 0.2655632183908046, "grad_norm": 0.7500301003456116, "learning_rate": 0.00017364255475796063, "loss": 1.9684, "num_input_tokens_seen": 4341056, "step": 722, "train_runtime": 730.5126, "train_tokens_per_second": 5942.479 }, { "epoch": 0.2659310344827586, "grad_norm": 0.808393657207489, "learning_rate": 0.00017360574268360024, "loss": 1.8444, "num_input_tokens_seen": 4346256, "step": 723, "train_runtime": 731.3951, "train_tokens_per_second": 5942.419 }, { "epoch": 0.26629885057471264, "grad_norm": 0.7359159588813782, "learning_rate": 0.00017356893060923984, "loss": 1.9504, "num_input_tokens_seen": 4351632, "step": 724, "train_runtime": 732.3094, "train_tokens_per_second": 5942.341 }, { "epoch": 0.26666666666666666, "grad_norm": 0.715316116809845, "learning_rate": 0.00017353211853487945, "loss": 1.8642, "num_input_tokens_seen": 4356512, "step": 725, "train_runtime": 733.1466, "train_tokens_per_second": 5942.211 }, { "epoch": 0.2670344827586207, "grad_norm": 0.7524330615997314, "learning_rate": 0.00017349530646051906, "loss": 1.9275, "num_input_tokens_seen": 4362688, "step": 726, "train_runtime": 734.1415, "train_tokens_per_second": 5942.571 }, { "epoch": 0.2674022988505747, "grad_norm": 0.6848141551017761, "learning_rate": 0.00017345849438615867, "loss": 1.7619, "num_input_tokens_seen": 4367984, "step": 727, "train_runtime": 735.0438, "train_tokens_per_second": 5942.481 }, { "epoch": 0.2677701149425287, "grad_norm": 0.7257616519927979, "learning_rate": 0.00017342168231179828, "loss": 1.7384, "num_input_tokens_seen": 4374112, "step": 728, "train_runtime": 736.0324, "train_tokens_per_second": 5942.826 }, { "epoch": 0.26813793103448275, "grad_norm": 0.7487912178039551, "learning_rate": 0.0001733848702374379, "loss": 1.8576, "num_input_tokens_seen": 4378880, "step": 729, "train_runtime": 736.8682, "train_tokens_per_second": 5942.555 }, { "epoch": 0.26850574712643677, "grad_norm": 0.7400490045547485, "learning_rate": 0.0001733480581630775, "loss": 1.8275, "num_input_tokens_seen": 4384432, "step": 730, "train_runtime": 737.7872, "train_tokens_per_second": 5942.679 }, { "epoch": 0.2688735632183908, "grad_norm": 0.7326444983482361, "learning_rate": 0.0001733112460887171, "loss": 1.9786, "num_input_tokens_seen": 4388800, "step": 731, "train_runtime": 738.5374, "train_tokens_per_second": 5942.556 }, { "epoch": 0.2692413793103448, "grad_norm": 0.6822432279586792, "learning_rate": 0.00017327443401435672, "loss": 1.7764, "num_input_tokens_seen": 4393968, "step": 732, "train_runtime": 739.4289, "train_tokens_per_second": 5942.381 }, { "epoch": 0.26960919540229883, "grad_norm": 0.7900007367134094, "learning_rate": 0.00017323762193999632, "loss": 1.9678, "num_input_tokens_seen": 4400048, "step": 733, "train_runtime": 740.4284, "train_tokens_per_second": 5942.571 }, { "epoch": 0.26997701149425285, "grad_norm": 0.7073249220848083, "learning_rate": 0.00017320080986563593, "loss": 1.7936, "num_input_tokens_seen": 4404960, "step": 734, "train_runtime": 741.2879, "train_tokens_per_second": 5942.307 }, { "epoch": 0.27034482758620687, "grad_norm": 0.7599587440490723, "learning_rate": 0.00017316399779127554, "loss": 1.8764, "num_input_tokens_seen": 4409920, "step": 735, "train_runtime": 742.1208, "train_tokens_per_second": 5942.321 }, { "epoch": 0.27071264367816095, "grad_norm": 0.7730521559715271, "learning_rate": 0.00017312718571691515, "loss": 1.7448, "num_input_tokens_seen": 4414752, "step": 736, "train_runtime": 742.9667, "train_tokens_per_second": 5942.059 }, { "epoch": 0.27108045977011497, "grad_norm": 0.7778670191764832, "learning_rate": 0.00017309037364255476, "loss": 1.9152, "num_input_tokens_seen": 4420416, "step": 737, "train_runtime": 743.9134, "train_tokens_per_second": 5942.111 }, { "epoch": 0.271448275862069, "grad_norm": 0.7406691312789917, "learning_rate": 0.00017305356156819437, "loss": 1.7868, "num_input_tokens_seen": 4426352, "step": 738, "train_runtime": 744.8944, "train_tokens_per_second": 5942.255 }, { "epoch": 0.271816091954023, "grad_norm": 0.72142094373703, "learning_rate": 0.000173016749493834, "loss": 1.919, "num_input_tokens_seen": 4431264, "step": 739, "train_runtime": 745.7425, "train_tokens_per_second": 5942.084 }, { "epoch": 0.27218390804597703, "grad_norm": 0.7652568221092224, "learning_rate": 0.00017297993741947361, "loss": 1.9263, "num_input_tokens_seen": 4438400, "step": 740, "train_runtime": 746.8502, "train_tokens_per_second": 5942.825 }, { "epoch": 0.27255172413793105, "grad_norm": 0.9410164952278137, "learning_rate": 0.00017294312534511322, "loss": 1.78, "num_input_tokens_seen": 4444064, "step": 741, "train_runtime": 747.7511, "train_tokens_per_second": 5943.24 }, { "epoch": 0.27291954022988507, "grad_norm": 0.7142931818962097, "learning_rate": 0.0001729063132707528, "loss": 1.7084, "num_input_tokens_seen": 4448624, "step": 742, "train_runtime": 748.5382, "train_tokens_per_second": 5943.082 }, { "epoch": 0.2732873563218391, "grad_norm": 0.8017459511756897, "learning_rate": 0.00017286950119639241, "loss": 1.65, "num_input_tokens_seen": 4453440, "step": 743, "train_runtime": 749.3396, "train_tokens_per_second": 5943.153 }, { "epoch": 0.2736551724137931, "grad_norm": 0.7462841272354126, "learning_rate": 0.00017283268912203202, "loss": 1.9961, "num_input_tokens_seen": 4457808, "step": 744, "train_runtime": 750.1167, "train_tokens_per_second": 5942.82 }, { "epoch": 0.27402298850574713, "grad_norm": 0.7649838328361511, "learning_rate": 0.00017279587704767163, "loss": 1.6771, "num_input_tokens_seen": 4463056, "step": 745, "train_runtime": 750.9803, "train_tokens_per_second": 5942.973 }, { "epoch": 0.27439080459770115, "grad_norm": 0.6718977093696594, "learning_rate": 0.00017275906497331124, "loss": 1.7933, "num_input_tokens_seen": 4469776, "step": 746, "train_runtime": 752.0665, "train_tokens_per_second": 5943.326 }, { "epoch": 0.2747586206896552, "grad_norm": 0.6736374497413635, "learning_rate": 0.00017272225289895085, "loss": 1.8177, "num_input_tokens_seen": 4477584, "step": 747, "train_runtime": 753.2957, "train_tokens_per_second": 5943.993 }, { "epoch": 0.2751264367816092, "grad_norm": 0.8791332244873047, "learning_rate": 0.00017268544082459049, "loss": 1.9928, "num_input_tokens_seen": 4485040, "step": 748, "train_runtime": 754.491, "train_tokens_per_second": 5944.458 }, { "epoch": 0.2754942528735632, "grad_norm": 0.7467145323753357, "learning_rate": 0.0001726486287502301, "loss": 1.8763, "num_input_tokens_seen": 4491648, "step": 749, "train_runtime": 755.5528, "train_tokens_per_second": 5944.85 }, { "epoch": 0.27586206896551724, "grad_norm": 0.7980650067329407, "learning_rate": 0.0001726118166758697, "loss": 1.9774, "num_input_tokens_seen": 4495520, "step": 750, "train_runtime": 756.2171, "train_tokens_per_second": 5944.748 }, { "epoch": 0.27622988505747126, "grad_norm": 0.7379633188247681, "learning_rate": 0.0001725750046015093, "loss": 1.7208, "num_input_tokens_seen": 4503536, "step": 751, "train_runtime": 757.961, "train_tokens_per_second": 5941.646 }, { "epoch": 0.2765977011494253, "grad_norm": 0.6900970339775085, "learning_rate": 0.00017253819252714892, "loss": 1.7793, "num_input_tokens_seen": 4508544, "step": 752, "train_runtime": 758.8041, "train_tokens_per_second": 5941.644 }, { "epoch": 0.2769655172413793, "grad_norm": 0.7257111668586731, "learning_rate": 0.00017250138045278853, "loss": 1.8201, "num_input_tokens_seen": 4514080, "step": 753, "train_runtime": 759.7166, "train_tokens_per_second": 5941.795 }, { "epoch": 0.2773333333333333, "grad_norm": 0.7619184255599976, "learning_rate": 0.00017246456837842814, "loss": 1.8787, "num_input_tokens_seen": 4519264, "step": 754, "train_runtime": 760.589, "train_tokens_per_second": 5941.795 }, { "epoch": 0.27770114942528734, "grad_norm": 0.7413751482963562, "learning_rate": 0.00017242775630406772, "loss": 1.6194, "num_input_tokens_seen": 4523792, "step": 755, "train_runtime": 761.3815, "train_tokens_per_second": 5941.558 }, { "epoch": 0.27806896551724136, "grad_norm": 0.7797419428825378, "learning_rate": 0.00017239094422970736, "loss": 1.7882, "num_input_tokens_seen": 4529664, "step": 756, "train_runtime": 762.342, "train_tokens_per_second": 5941.774 }, { "epoch": 0.2784367816091954, "grad_norm": 0.7607048153877258, "learning_rate": 0.00017235413215534697, "loss": 1.812, "num_input_tokens_seen": 4535472, "step": 757, "train_runtime": 763.272, "train_tokens_per_second": 5942.144 }, { "epoch": 0.2788045977011494, "grad_norm": 0.6602902412414551, "learning_rate": 0.00017231732008098657, "loss": 1.7064, "num_input_tokens_seen": 4539904, "step": 758, "train_runtime": 764.0453, "train_tokens_per_second": 5941.931 }, { "epoch": 0.2791724137931034, "grad_norm": 0.7725996971130371, "learning_rate": 0.00017228050800662618, "loss": 1.8908, "num_input_tokens_seen": 4545040, "step": 759, "train_runtime": 764.9229, "train_tokens_per_second": 5941.827 }, { "epoch": 0.27954022988505745, "grad_norm": 0.7709255218505859, "learning_rate": 0.0001722436959322658, "loss": 1.8516, "num_input_tokens_seen": 4550032, "step": 760, "train_runtime": 765.7739, "train_tokens_per_second": 5941.743 }, { "epoch": 0.2799080459770115, "grad_norm": 0.744976282119751, "learning_rate": 0.0001722068838579054, "loss": 1.7581, "num_input_tokens_seen": 4554784, "step": 761, "train_runtime": 766.6043, "train_tokens_per_second": 5941.506 }, { "epoch": 0.28027586206896554, "grad_norm": 0.7730522155761719, "learning_rate": 0.000172170071783545, "loss": 1.7988, "num_input_tokens_seen": 4560528, "step": 762, "train_runtime": 767.5414, "train_tokens_per_second": 5941.736 }, { "epoch": 0.28064367816091956, "grad_norm": 0.7115368247032166, "learning_rate": 0.00017213325970918462, "loss": 1.9102, "num_input_tokens_seen": 4565328, "step": 763, "train_runtime": 768.3794, "train_tokens_per_second": 5941.503 }, { "epoch": 0.2810114942528736, "grad_norm": 0.6897196173667908, "learning_rate": 0.00017209644763482423, "loss": 1.6402, "num_input_tokens_seen": 4571824, "step": 764, "train_runtime": 769.4388, "train_tokens_per_second": 5941.764 }, { "epoch": 0.2813793103448276, "grad_norm": 0.8004782795906067, "learning_rate": 0.00017205963556046384, "loss": 2.0911, "num_input_tokens_seen": 4576768, "step": 765, "train_runtime": 770.2905, "train_tokens_per_second": 5941.613 }, { "epoch": 0.2817471264367816, "grad_norm": 0.7114158272743225, "learning_rate": 0.00017202282348610345, "loss": 1.9612, "num_input_tokens_seen": 4584576, "step": 766, "train_runtime": 771.5067, "train_tokens_per_second": 5942.367 }, { "epoch": 0.28211494252873565, "grad_norm": 0.7624607086181641, "learning_rate": 0.00017198601141174305, "loss": 1.834, "num_input_tokens_seen": 4589968, "step": 767, "train_runtime": 772.4216, "train_tokens_per_second": 5942.309 }, { "epoch": 0.28248275862068967, "grad_norm": 0.7275245785713196, "learning_rate": 0.00017194919933738266, "loss": 1.7461, "num_input_tokens_seen": 4596208, "step": 768, "train_runtime": 773.4588, "train_tokens_per_second": 5942.408 }, { "epoch": 0.2828505747126437, "grad_norm": 0.7166267037391663, "learning_rate": 0.00017191238726302227, "loss": 1.7845, "num_input_tokens_seen": 4601552, "step": 769, "train_runtime": 774.3621, "train_tokens_per_second": 5942.378 }, { "epoch": 0.2832183908045977, "grad_norm": 0.6857694983482361, "learning_rate": 0.00017187557518866188, "loss": 1.8959, "num_input_tokens_seen": 4606320, "step": 770, "train_runtime": 775.2022, "train_tokens_per_second": 5942.088 }, { "epoch": 0.28358620689655173, "grad_norm": 0.7865335941314697, "learning_rate": 0.0001718387631143015, "loss": 1.9186, "num_input_tokens_seen": 4610576, "step": 771, "train_runtime": 775.9339, "train_tokens_per_second": 5941.97 }, { "epoch": 0.28395402298850575, "grad_norm": 0.6964818835258484, "learning_rate": 0.0001718019510399411, "loss": 1.7916, "num_input_tokens_seen": 4619344, "step": 772, "train_runtime": 777.269, "train_tokens_per_second": 5943.044 }, { "epoch": 0.28432183908045977, "grad_norm": 0.7649399042129517, "learning_rate": 0.00017176513896558073, "loss": 1.8707, "num_input_tokens_seen": 4624352, "step": 773, "train_runtime": 778.1065, "train_tokens_per_second": 5943.083 }, { "epoch": 0.2846896551724138, "grad_norm": 0.7283154726028442, "learning_rate": 0.00017172832689122034, "loss": 1.7958, "num_input_tokens_seen": 4634224, "step": 774, "train_runtime": 779.6155, "train_tokens_per_second": 5944.243 }, { "epoch": 0.2850574712643678, "grad_norm": 0.7610809803009033, "learning_rate": 0.00017169151481685995, "loss": 1.8795, "num_input_tokens_seen": 4639072, "step": 775, "train_runtime": 780.4551, "train_tokens_per_second": 5944.06 }, { "epoch": 0.28542528735632183, "grad_norm": 0.7797113060951233, "learning_rate": 0.00017165470274249956, "loss": 1.9561, "num_input_tokens_seen": 4646432, "step": 776, "train_runtime": 781.618, "train_tokens_per_second": 5944.633 }, { "epoch": 0.28579310344827585, "grad_norm": 0.749673068523407, "learning_rate": 0.00017161789066813917, "loss": 1.8177, "num_input_tokens_seen": 4650320, "step": 777, "train_runtime": 782.3051, "train_tokens_per_second": 5944.381 }, { "epoch": 0.2861609195402299, "grad_norm": 0.6641862988471985, "learning_rate": 0.00017158107859377878, "loss": 1.7552, "num_input_tokens_seen": 4656768, "step": 778, "train_runtime": 783.373, "train_tokens_per_second": 5944.509 }, { "epoch": 0.2865287356321839, "grad_norm": 0.7170074582099915, "learning_rate": 0.00017154426651941836, "loss": 1.8002, "num_input_tokens_seen": 4662272, "step": 779, "train_runtime": 784.2918, "train_tokens_per_second": 5944.563 }, { "epoch": 0.2868965517241379, "grad_norm": 0.7169869542121887, "learning_rate": 0.00017150745444505797, "loss": 1.6444, "num_input_tokens_seen": 4666544, "step": 780, "train_runtime": 785.0604, "train_tokens_per_second": 5944.185 }, { "epoch": 0.28726436781609194, "grad_norm": 0.6579683423042297, "learning_rate": 0.00017147064237069758, "loss": 1.6995, "num_input_tokens_seen": 4672016, "step": 781, "train_runtime": 786.4483, "train_tokens_per_second": 5940.653 }, { "epoch": 0.28763218390804596, "grad_norm": 0.7201480269432068, "learning_rate": 0.00017143383029633721, "loss": 1.9416, "num_input_tokens_seen": 4677088, "step": 782, "train_runtime": 787.3115, "train_tokens_per_second": 5940.582 }, { "epoch": 0.288, "grad_norm": 0.7196846604347229, "learning_rate": 0.00017139701822197682, "loss": 1.7708, "num_input_tokens_seen": 4682448, "step": 783, "train_runtime": 788.2175, "train_tokens_per_second": 5940.553 }, { "epoch": 0.288367816091954, "grad_norm": 0.7448524832725525, "learning_rate": 0.00017136020614761643, "loss": 1.9324, "num_input_tokens_seen": 4687888, "step": 784, "train_runtime": 789.1208, "train_tokens_per_second": 5940.647 }, { "epoch": 0.288735632183908, "grad_norm": 0.6804062128067017, "learning_rate": 0.00017132339407325604, "loss": 1.6276, "num_input_tokens_seen": 4692800, "step": 785, "train_runtime": 789.9745, "train_tokens_per_second": 5940.445 }, { "epoch": 0.2891034482758621, "grad_norm": 0.7315980195999146, "learning_rate": 0.00017128658199889565, "loss": 1.7298, "num_input_tokens_seen": 4697968, "step": 786, "train_runtime": 790.835, "train_tokens_per_second": 5940.516 }, { "epoch": 0.2894712643678161, "grad_norm": 0.8079400062561035, "learning_rate": 0.00017124976992453526, "loss": 1.7128, "num_input_tokens_seen": 4704944, "step": 787, "train_runtime": 791.9792, "train_tokens_per_second": 5940.742 }, { "epoch": 0.28983908045977014, "grad_norm": 0.80372554063797, "learning_rate": 0.00017121295785017487, "loss": 1.8274, "num_input_tokens_seen": 4711152, "step": 788, "train_runtime": 792.991, "train_tokens_per_second": 5940.991 }, { "epoch": 0.29020689655172416, "grad_norm": 0.7757269144058228, "learning_rate": 0.00017117614577581448, "loss": 2.0107, "num_input_tokens_seen": 4716448, "step": 789, "train_runtime": 793.8848, "train_tokens_per_second": 5940.973 }, { "epoch": 0.2905747126436782, "grad_norm": 0.712533712387085, "learning_rate": 0.00017113933370145409, "loss": 1.8902, "num_input_tokens_seen": 4724096, "step": 790, "train_runtime": 795.0921, "train_tokens_per_second": 5941.571 }, { "epoch": 0.2909425287356322, "grad_norm": 0.6622461676597595, "learning_rate": 0.0001711025216270937, "loss": 1.8504, "num_input_tokens_seen": 4729712, "step": 791, "train_runtime": 796.0393, "train_tokens_per_second": 5941.556 }, { "epoch": 0.2913103448275862, "grad_norm": 0.8801368474960327, "learning_rate": 0.0001710657095527333, "loss": 2.1268, "num_input_tokens_seen": 4734576, "step": 792, "train_runtime": 796.8737, "train_tokens_per_second": 5941.438 }, { "epoch": 0.29167816091954024, "grad_norm": 0.7598217725753784, "learning_rate": 0.0001710288974783729, "loss": 1.8334, "num_input_tokens_seen": 4740880, "step": 793, "train_runtime": 797.8697, "train_tokens_per_second": 5941.923 }, { "epoch": 0.29204597701149426, "grad_norm": 0.8002123236656189, "learning_rate": 0.00017099208540401252, "loss": 1.8155, "num_input_tokens_seen": 4746560, "step": 794, "train_runtime": 798.8056, "train_tokens_per_second": 5942.071 }, { "epoch": 0.2924137931034483, "grad_norm": 0.87678062915802, "learning_rate": 0.00017095527332965213, "loss": 1.7733, "num_input_tokens_seen": 4754416, "step": 795, "train_runtime": 800.0321, "train_tokens_per_second": 5942.782 }, { "epoch": 0.2927816091954023, "grad_norm": 0.7613138556480408, "learning_rate": 0.00017091846125529174, "loss": 1.7808, "num_input_tokens_seen": 4759264, "step": 796, "train_runtime": 800.8724, "train_tokens_per_second": 5942.599 }, { "epoch": 0.2931494252873563, "grad_norm": 0.6966599822044373, "learning_rate": 0.00017088164918093135, "loss": 1.8375, "num_input_tokens_seen": 4765280, "step": 797, "train_runtime": 801.8498, "train_tokens_per_second": 5942.859 }, { "epoch": 0.29351724137931035, "grad_norm": 0.7675111293792725, "learning_rate": 0.00017084483710657096, "loss": 1.9598, "num_input_tokens_seen": 4770608, "step": 798, "train_runtime": 802.7226, "train_tokens_per_second": 5943.035 }, { "epoch": 0.29388505747126437, "grad_norm": 0.7366241812705994, "learning_rate": 0.0001708080250322106, "loss": 1.6794, "num_input_tokens_seen": 4777328, "step": 799, "train_runtime": 803.8293, "train_tokens_per_second": 5943.212 }, { "epoch": 0.2942528735632184, "grad_norm": 0.812473714351654, "learning_rate": 0.0001707712129578502, "loss": 1.9036, "num_input_tokens_seen": 4782784, "step": 800, "train_runtime": 804.7709, "train_tokens_per_second": 5943.038 }, { "epoch": 0.2946206896551724, "grad_norm": 0.7038021683692932, "learning_rate": 0.0001707344008834898, "loss": 1.8064, "num_input_tokens_seen": 4790080, "step": 801, "train_runtime": 805.9535, "train_tokens_per_second": 5943.37 }, { "epoch": 0.29498850574712643, "grad_norm": 0.6473475098609924, "learning_rate": 0.0001706975888091294, "loss": 1.7695, "num_input_tokens_seen": 4797008, "step": 802, "train_runtime": 807.0647, "train_tokens_per_second": 5943.772 }, { "epoch": 0.29535632183908045, "grad_norm": 0.6907509565353394, "learning_rate": 0.000170660776734769, "loss": 1.7874, "num_input_tokens_seen": 4802064, "step": 803, "train_runtime": 807.8913, "train_tokens_per_second": 5943.948 }, { "epoch": 0.29572413793103447, "grad_norm": 0.7124350666999817, "learning_rate": 0.0001706239646604086, "loss": 1.9215, "num_input_tokens_seen": 4806672, "step": 804, "train_runtime": 808.7056, "train_tokens_per_second": 5943.661 }, { "epoch": 0.2960919540229885, "grad_norm": 0.747387170791626, "learning_rate": 0.00017058715258604822, "loss": 1.916, "num_input_tokens_seen": 4813040, "step": 805, "train_runtime": 809.7316, "train_tokens_per_second": 5943.994 }, { "epoch": 0.2964597701149425, "grad_norm": 0.7358576059341431, "learning_rate": 0.00017055034051168783, "loss": 1.7624, "num_input_tokens_seen": 4818416, "step": 806, "train_runtime": 810.6289, "train_tokens_per_second": 5944.047 }, { "epoch": 0.29682758620689653, "grad_norm": 0.7139478325843811, "learning_rate": 0.00017051352843732744, "loss": 1.8146, "num_input_tokens_seen": 4824656, "step": 807, "train_runtime": 811.6399, "train_tokens_per_second": 5944.33 }, { "epoch": 0.29719540229885055, "grad_norm": 0.7675763964653015, "learning_rate": 0.00017047671636296707, "loss": 2.0133, "num_input_tokens_seen": 4829056, "step": 808, "train_runtime": 812.3882, "train_tokens_per_second": 5944.271 }, { "epoch": 0.2975632183908046, "grad_norm": 0.6864924430847168, "learning_rate": 0.00017043990428860668, "loss": 1.8765, "num_input_tokens_seen": 4833952, "step": 809, "train_runtime": 813.2253, "train_tokens_per_second": 5944.173 }, { "epoch": 0.2979310344827586, "grad_norm": 0.5202162265777588, "learning_rate": 0.0001704030922142463, "loss": 1.4446, "num_input_tokens_seen": 4855168, "step": 810, "train_runtime": 816.3312, "train_tokens_per_second": 5947.547 }, { "epoch": 0.29829885057471267, "grad_norm": 0.7769670486450195, "learning_rate": 0.0001703662801398859, "loss": 1.7737, "num_input_tokens_seen": 4860800, "step": 811, "train_runtime": 817.762, "train_tokens_per_second": 5944.028 }, { "epoch": 0.2986666666666667, "grad_norm": 0.6722753047943115, "learning_rate": 0.0001703294680655255, "loss": 1.867, "num_input_tokens_seen": 4866144, "step": 812, "train_runtime": 818.6679, "train_tokens_per_second": 5943.978 }, { "epoch": 0.2990344827586207, "grad_norm": 0.675029456615448, "learning_rate": 0.00017029265599116512, "loss": 1.6928, "num_input_tokens_seen": 4870896, "step": 813, "train_runtime": 819.4896, "train_tokens_per_second": 5943.817 }, { "epoch": 0.29940229885057473, "grad_norm": 0.716803252696991, "learning_rate": 0.00017025584391680473, "loss": 1.7346, "num_input_tokens_seen": 4878736, "step": 814, "train_runtime": 820.7103, "train_tokens_per_second": 5944.529 }, { "epoch": 0.29977011494252875, "grad_norm": 0.7450390458106995, "learning_rate": 0.0001702190318424443, "loss": 1.7828, "num_input_tokens_seen": 4884576, "step": 815, "train_runtime": 821.6753, "train_tokens_per_second": 5944.655 }, { "epoch": 0.3001379310344828, "grad_norm": 0.6824129223823547, "learning_rate": 0.00017018221976808394, "loss": 1.7726, "num_input_tokens_seen": 4890496, "step": 816, "train_runtime": 822.6567, "train_tokens_per_second": 5944.759 }, { "epoch": 0.3005057471264368, "grad_norm": 0.6666625142097473, "learning_rate": 0.00017014540769372355, "loss": 1.6826, "num_input_tokens_seen": 4902432, "step": 817, "train_runtime": 824.4318, "train_tokens_per_second": 5946.438 }, { "epoch": 0.3008735632183908, "grad_norm": 0.7873861789703369, "learning_rate": 0.00017010859561936316, "loss": 1.749, "num_input_tokens_seen": 4909008, "step": 818, "train_runtime": 825.4817, "train_tokens_per_second": 5946.841 }, { "epoch": 0.30124137931034484, "grad_norm": 0.7500694990158081, "learning_rate": 0.00017007178354500277, "loss": 1.7682, "num_input_tokens_seen": 4918288, "step": 819, "train_runtime": 826.8888, "train_tokens_per_second": 5947.944 }, { "epoch": 0.30160919540229886, "grad_norm": 0.726616621017456, "learning_rate": 0.00017003497147064238, "loss": 1.8452, "num_input_tokens_seen": 4923248, "step": 820, "train_runtime": 827.7506, "train_tokens_per_second": 5947.743 }, { "epoch": 0.3019770114942529, "grad_norm": 0.6488540768623352, "learning_rate": 0.000169998159396282, "loss": 1.7898, "num_input_tokens_seen": 4929840, "step": 821, "train_runtime": 828.7956, "train_tokens_per_second": 5948.198 }, { "epoch": 0.3023448275862069, "grad_norm": 0.6533604860305786, "learning_rate": 0.0001699613473219216, "loss": 1.8328, "num_input_tokens_seen": 4937088, "step": 822, "train_runtime": 829.9508, "train_tokens_per_second": 5948.651 }, { "epoch": 0.3027126436781609, "grad_norm": 0.7379357814788818, "learning_rate": 0.0001699245352475612, "loss": 1.9164, "num_input_tokens_seen": 4944816, "step": 823, "train_runtime": 831.1306, "train_tokens_per_second": 5949.506 }, { "epoch": 0.30308045977011494, "grad_norm": 0.6995763182640076, "learning_rate": 0.00016988772317320082, "loss": 1.731, "num_input_tokens_seen": 4949472, "step": 824, "train_runtime": 831.9533, "train_tokens_per_second": 5949.219 }, { "epoch": 0.30344827586206896, "grad_norm": 0.7361706495285034, "learning_rate": 0.00016985091109884042, "loss": 2.0509, "num_input_tokens_seen": 4954384, "step": 825, "train_runtime": 832.8051, "train_tokens_per_second": 5949.032 }, { "epoch": 0.303816091954023, "grad_norm": 0.6709271669387817, "learning_rate": 0.00016981409902448003, "loss": 1.766, "num_input_tokens_seen": 4960112, "step": 826, "train_runtime": 833.7595, "train_tokens_per_second": 5949.092 }, { "epoch": 0.304183908045977, "grad_norm": 0.6723732352256775, "learning_rate": 0.00016977728695011964, "loss": 1.6995, "num_input_tokens_seen": 4969952, "step": 827, "train_runtime": 835.2765, "train_tokens_per_second": 5950.068 }, { "epoch": 0.304551724137931, "grad_norm": 0.726488471031189, "learning_rate": 0.00016974047487575925, "loss": 1.9395, "num_input_tokens_seen": 4974688, "step": 828, "train_runtime": 836.0869, "train_tokens_per_second": 5949.965 }, { "epoch": 0.30491954022988504, "grad_norm": 0.6773337721824646, "learning_rate": 0.00016970366280139886, "loss": 1.8526, "num_input_tokens_seen": 4979744, "step": 829, "train_runtime": 836.9521, "train_tokens_per_second": 5949.855 }, { "epoch": 0.30528735632183907, "grad_norm": 0.6449316740036011, "learning_rate": 0.00016966685072703847, "loss": 1.7464, "num_input_tokens_seen": 4985424, "step": 830, "train_runtime": 837.8923, "train_tokens_per_second": 5949.958 }, { "epoch": 0.3056551724137931, "grad_norm": 0.6937980055809021, "learning_rate": 0.00016963003865267808, "loss": 1.8806, "num_input_tokens_seen": 4991264, "step": 831, "train_runtime": 838.8458, "train_tokens_per_second": 5950.157 }, { "epoch": 0.3060229885057471, "grad_norm": 0.6817101836204529, "learning_rate": 0.00016959322657831769, "loss": 1.7833, "num_input_tokens_seen": 4996576, "step": 832, "train_runtime": 839.745, "train_tokens_per_second": 5950.111 }, { "epoch": 0.3063908045977011, "grad_norm": 0.7633034586906433, "learning_rate": 0.00016955641450395732, "loss": 1.9476, "num_input_tokens_seen": 5002288, "step": 833, "train_runtime": 840.6896, "train_tokens_per_second": 5950.22 }, { "epoch": 0.30675862068965515, "grad_norm": 0.7699156403541565, "learning_rate": 0.00016951960242959693, "loss": 1.8108, "num_input_tokens_seen": 5006688, "step": 834, "train_runtime": 841.4499, "train_tokens_per_second": 5950.073 }, { "epoch": 0.30712643678160917, "grad_norm": 0.7813035845756531, "learning_rate": 0.00016948279035523654, "loss": 1.882, "num_input_tokens_seen": 5012448, "step": 835, "train_runtime": 842.3948, "train_tokens_per_second": 5950.236 }, { "epoch": 0.30749425287356325, "grad_norm": 0.7035843133926392, "learning_rate": 0.00016944597828087615, "loss": 1.794, "num_input_tokens_seen": 5017168, "step": 836, "train_runtime": 843.2245, "train_tokens_per_second": 5949.979 }, { "epoch": 0.30786206896551727, "grad_norm": 0.6002615690231323, "learning_rate": 0.00016940916620651576, "loss": 1.7264, "num_input_tokens_seen": 5029808, "step": 837, "train_runtime": 845.0832, "train_tokens_per_second": 5951.849 }, { "epoch": 0.3082298850574713, "grad_norm": 0.7122713327407837, "learning_rate": 0.00016937235413215534, "loss": 1.7069, "num_input_tokens_seen": 5035536, "step": 838, "train_runtime": 846.0098, "train_tokens_per_second": 5952.101 }, { "epoch": 0.3085977011494253, "grad_norm": 0.6311381459236145, "learning_rate": 0.00016933554205779495, "loss": 1.7592, "num_input_tokens_seen": 5042128, "step": 839, "train_runtime": 847.0835, "train_tokens_per_second": 5952.338 }, { "epoch": 0.30896551724137933, "grad_norm": 0.7819897532463074, "learning_rate": 0.00016929872998343456, "loss": 1.906, "num_input_tokens_seen": 5047008, "step": 840, "train_runtime": 847.9315, "train_tokens_per_second": 5952.141 }, { "epoch": 0.30933333333333335, "grad_norm": 0.7180947661399841, "learning_rate": 0.00016926191790907417, "loss": 1.6724, "num_input_tokens_seen": 5051680, "step": 841, "train_runtime": 849.2043, "train_tokens_per_second": 5948.722 }, { "epoch": 0.30970114942528737, "grad_norm": 0.6616408824920654, "learning_rate": 0.0001692251058347138, "loss": 1.654, "num_input_tokens_seen": 5057120, "step": 842, "train_runtime": 850.1041, "train_tokens_per_second": 5948.825 }, { "epoch": 0.3100689655172414, "grad_norm": 0.7178268432617188, "learning_rate": 0.0001691882937603534, "loss": 1.5172, "num_input_tokens_seen": 5063904, "step": 843, "train_runtime": 851.211, "train_tokens_per_second": 5949.059 }, { "epoch": 0.3104367816091954, "grad_norm": 0.6756206750869751, "learning_rate": 0.00016915148168599302, "loss": 1.7465, "num_input_tokens_seen": 5070496, "step": 844, "train_runtime": 852.2595, "train_tokens_per_second": 5949.474 }, { "epoch": 0.31080459770114943, "grad_norm": 0.7164249420166016, "learning_rate": 0.00016911466961163263, "loss": 1.7599, "num_input_tokens_seen": 5074640, "step": 845, "train_runtime": 852.9907, "train_tokens_per_second": 5949.233 }, { "epoch": 0.31117241379310345, "grad_norm": 0.6614233255386353, "learning_rate": 0.00016907785753727224, "loss": 1.6321, "num_input_tokens_seen": 5082512, "step": 846, "train_runtime": 854.2473, "train_tokens_per_second": 5949.697 }, { "epoch": 0.3115402298850575, "grad_norm": 0.8350978493690491, "learning_rate": 0.00016904104546291185, "loss": 1.8342, "num_input_tokens_seen": 5088032, "step": 847, "train_runtime": 855.1359, "train_tokens_per_second": 5949.969 }, { "epoch": 0.3119080459770115, "grad_norm": 0.8022600412368774, "learning_rate": 0.00016900423338855146, "loss": 1.7741, "num_input_tokens_seen": 5093280, "step": 848, "train_runtime": 856.0052, "train_tokens_per_second": 5950.058 }, { "epoch": 0.3122758620689655, "grad_norm": 0.7320350408554077, "learning_rate": 0.00016896742131419106, "loss": 1.7976, "num_input_tokens_seen": 5098016, "step": 849, "train_runtime": 856.8151, "train_tokens_per_second": 5949.961 }, { "epoch": 0.31264367816091954, "grad_norm": 0.6889047622680664, "learning_rate": 0.00016893060923983067, "loss": 1.9103, "num_input_tokens_seen": 5107280, "step": 850, "train_runtime": 858.2192, "train_tokens_per_second": 5951.02 }, { "epoch": 0.31301149425287356, "grad_norm": 0.6495490670204163, "learning_rate": 0.00016889379716547028, "loss": 1.7081, "num_input_tokens_seen": 5113680, "step": 851, "train_runtime": 859.2414, "train_tokens_per_second": 5951.389 }, { "epoch": 0.3133793103448276, "grad_norm": 0.7501242756843567, "learning_rate": 0.0001688569850911099, "loss": 1.667, "num_input_tokens_seen": 5124304, "step": 852, "train_runtime": 860.8138, "train_tokens_per_second": 5952.86 }, { "epoch": 0.3137471264367816, "grad_norm": 0.7219048142433167, "learning_rate": 0.0001688201730167495, "loss": 1.7866, "num_input_tokens_seen": 5128912, "step": 853, "train_runtime": 861.5859, "train_tokens_per_second": 5952.873 }, { "epoch": 0.3141149425287356, "grad_norm": 0.7248823046684265, "learning_rate": 0.0001687833609423891, "loss": 1.6947, "num_input_tokens_seen": 5135216, "step": 854, "train_runtime": 862.5766, "train_tokens_per_second": 5953.345 }, { "epoch": 0.31448275862068964, "grad_norm": 0.7637900114059448, "learning_rate": 0.00016874654886802872, "loss": 1.702, "num_input_tokens_seen": 5142848, "step": 855, "train_runtime": 863.7986, "train_tokens_per_second": 5953.758 }, { "epoch": 0.31485057471264366, "grad_norm": 0.7177774906158447, "learning_rate": 0.00016870973679366833, "loss": 1.6115, "num_input_tokens_seen": 5149696, "step": 856, "train_runtime": 864.906, "train_tokens_per_second": 5954.053 }, { "epoch": 0.3152183908045977, "grad_norm": 0.7024462223052979, "learning_rate": 0.00016867292471930794, "loss": 1.7505, "num_input_tokens_seen": 5156448, "step": 857, "train_runtime": 865.9797, "train_tokens_per_second": 5954.467 }, { "epoch": 0.3155862068965517, "grad_norm": 0.746577799320221, "learning_rate": 0.00016863611264494754, "loss": 1.7835, "num_input_tokens_seen": 5166160, "step": 858, "train_runtime": 867.4706, "train_tokens_per_second": 5955.429 }, { "epoch": 0.3159540229885057, "grad_norm": 0.6877517700195312, "learning_rate": 0.00016859930057058718, "loss": 1.8222, "num_input_tokens_seen": 5171568, "step": 859, "train_runtime": 868.361, "train_tokens_per_second": 5955.55 }, { "epoch": 0.31632183908045974, "grad_norm": 0.6079294085502625, "learning_rate": 0.0001685624884962268, "loss": 1.6799, "num_input_tokens_seen": 5179808, "step": 860, "train_runtime": 869.6778, "train_tokens_per_second": 5956.008 }, { "epoch": 0.3166896551724138, "grad_norm": 0.7623908519744873, "learning_rate": 0.0001685256764218664, "loss": 1.9252, "num_input_tokens_seen": 5184240, "step": 861, "train_runtime": 870.4561, "train_tokens_per_second": 5955.774 }, { "epoch": 0.31705747126436784, "grad_norm": 0.7584787011146545, "learning_rate": 0.00016848886434750598, "loss": 1.7388, "num_input_tokens_seen": 5189696, "step": 862, "train_runtime": 871.3552, "train_tokens_per_second": 5955.89 }, { "epoch": 0.31742528735632186, "grad_norm": 0.6920429468154907, "learning_rate": 0.0001684520522731456, "loss": 1.8104, "num_input_tokens_seen": 5195968, "step": 863, "train_runtime": 872.3708, "train_tokens_per_second": 5956.146 }, { "epoch": 0.3177931034482759, "grad_norm": 0.7273485064506531, "learning_rate": 0.0001684152401987852, "loss": 1.8228, "num_input_tokens_seen": 5200336, "step": 864, "train_runtime": 873.164, "train_tokens_per_second": 5955.738 }, { "epoch": 0.3181609195402299, "grad_norm": 0.7210944890975952, "learning_rate": 0.0001683784281244248, "loss": 1.7069, "num_input_tokens_seen": 5206896, "step": 865, "train_runtime": 874.2379, "train_tokens_per_second": 5955.926 }, { "epoch": 0.3185287356321839, "grad_norm": 0.7385914325714111, "learning_rate": 0.00016834161605006442, "loss": 1.8228, "num_input_tokens_seen": 5211792, "step": 866, "train_runtime": 875.0804, "train_tokens_per_second": 5955.787 }, { "epoch": 0.31889655172413794, "grad_norm": 0.7037887573242188, "learning_rate": 0.00016830480397570402, "loss": 1.815, "num_input_tokens_seen": 5216656, "step": 867, "train_runtime": 875.9222, "train_tokens_per_second": 5955.616 }, { "epoch": 0.31926436781609197, "grad_norm": 0.6879228949546814, "learning_rate": 0.00016826799190134366, "loss": 1.9361, "num_input_tokens_seen": 5222384, "step": 868, "train_runtime": 876.8561, "train_tokens_per_second": 5955.805 }, { "epoch": 0.319632183908046, "grad_norm": 0.8687586784362793, "learning_rate": 0.00016823117982698327, "loss": 1.9659, "num_input_tokens_seen": 5226736, "step": 869, "train_runtime": 877.6014, "train_tokens_per_second": 5955.706 }, { "epoch": 0.32, "grad_norm": 0.7334696054458618, "learning_rate": 0.00016819436775262288, "loss": 1.7086, "num_input_tokens_seen": 5232064, "step": 870, "train_runtime": 878.5051, "train_tokens_per_second": 5955.645 }, { "epoch": 0.320367816091954, "grad_norm": 0.7504156827926636, "learning_rate": 0.0001681575556782625, "loss": 1.7866, "num_input_tokens_seen": 5238832, "step": 871, "train_runtime": 880.0728, "train_tokens_per_second": 5952.726 }, { "epoch": 0.32073563218390805, "grad_norm": 0.6457074880599976, "learning_rate": 0.0001681207436039021, "loss": 1.7832, "num_input_tokens_seen": 5243856, "step": 872, "train_runtime": 880.9248, "train_tokens_per_second": 5952.672 }, { "epoch": 0.32110344827586207, "grad_norm": 0.71819007396698, "learning_rate": 0.0001680839315295417, "loss": 1.8124, "num_input_tokens_seen": 5249360, "step": 873, "train_runtime": 881.8479, "train_tokens_per_second": 5952.682 }, { "epoch": 0.3214712643678161, "grad_norm": 0.7726781368255615, "learning_rate": 0.00016804711945518131, "loss": 1.7085, "num_input_tokens_seen": 5254688, "step": 874, "train_runtime": 882.7371, "train_tokens_per_second": 5952.721 }, { "epoch": 0.3218390804597701, "grad_norm": 0.7883817553520203, "learning_rate": 0.0001680103073808209, "loss": 1.8612, "num_input_tokens_seen": 5260144, "step": 875, "train_runtime": 883.652, "train_tokens_per_second": 5952.733 }, { "epoch": 0.32220689655172413, "grad_norm": 0.6984350681304932, "learning_rate": 0.00016797349530646053, "loss": 1.9082, "num_input_tokens_seen": 5266336, "step": 876, "train_runtime": 884.6729, "train_tokens_per_second": 5952.862 }, { "epoch": 0.32257471264367815, "grad_norm": 0.7587144374847412, "learning_rate": 0.00016793668323210014, "loss": 1.7635, "num_input_tokens_seen": 5272704, "step": 877, "train_runtime": 885.7196, "train_tokens_per_second": 5953.017 }, { "epoch": 0.3229425287356322, "grad_norm": 0.7405463457107544, "learning_rate": 0.00016789987115773975, "loss": 1.8575, "num_input_tokens_seen": 5277872, "step": 878, "train_runtime": 886.5928, "train_tokens_per_second": 5952.983 }, { "epoch": 0.3233103448275862, "grad_norm": 0.787229061126709, "learning_rate": 0.00016786305908337936, "loss": 1.8151, "num_input_tokens_seen": 5284176, "step": 879, "train_runtime": 887.6247, "train_tokens_per_second": 5953.165 }, { "epoch": 0.3236781609195402, "grad_norm": 0.7123964428901672, "learning_rate": 0.00016782624700901897, "loss": 1.8004, "num_input_tokens_seen": 5290176, "step": 880, "train_runtime": 888.6192, "train_tokens_per_second": 5953.254 }, { "epoch": 0.32404597701149424, "grad_norm": 0.7722557187080383, "learning_rate": 0.00016778943493465858, "loss": 1.8734, "num_input_tokens_seen": 5295392, "step": 881, "train_runtime": 889.4947, "train_tokens_per_second": 5953.259 }, { "epoch": 0.32441379310344826, "grad_norm": 0.720944344997406, "learning_rate": 0.00016775262286029819, "loss": 1.8406, "num_input_tokens_seen": 5299904, "step": 882, "train_runtime": 890.2712, "train_tokens_per_second": 5953.135 }, { "epoch": 0.3247816091954023, "grad_norm": 0.6755884289741516, "learning_rate": 0.0001677158107859378, "loss": 1.6772, "num_input_tokens_seen": 5304080, "step": 883, "train_runtime": 890.979, "train_tokens_per_second": 5953.092 }, { "epoch": 0.3251494252873563, "grad_norm": 0.7546120285987854, "learning_rate": 0.0001676789987115774, "loss": 1.9367, "num_input_tokens_seen": 5310944, "step": 884, "train_runtime": 892.0462, "train_tokens_per_second": 5953.665 }, { "epoch": 0.3255172413793103, "grad_norm": 0.7448853254318237, "learning_rate": 0.000167642186637217, "loss": 1.6476, "num_input_tokens_seen": 5316112, "step": 885, "train_runtime": 892.9141, "train_tokens_per_second": 5953.666 }, { "epoch": 0.3258850574712644, "grad_norm": 0.7519321441650391, "learning_rate": 0.00016760537456285662, "loss": 1.7657, "num_input_tokens_seen": 5322256, "step": 886, "train_runtime": 893.8944, "train_tokens_per_second": 5954.01 }, { "epoch": 0.3262528735632184, "grad_norm": 0.7763766050338745, "learning_rate": 0.00016756856248849623, "loss": 1.8403, "num_input_tokens_seen": 5327264, "step": 887, "train_runtime": 894.7249, "train_tokens_per_second": 5954.081 }, { "epoch": 0.32662068965517244, "grad_norm": 0.6998291611671448, "learning_rate": 0.00016753175041413584, "loss": 1.7858, "num_input_tokens_seen": 5333024, "step": 888, "train_runtime": 895.6699, "train_tokens_per_second": 5954.229 }, { "epoch": 0.32698850574712646, "grad_norm": 0.6765996217727661, "learning_rate": 0.00016749493833977545, "loss": 1.6686, "num_input_tokens_seen": 5337936, "step": 889, "train_runtime": 896.5134, "train_tokens_per_second": 5954.106 }, { "epoch": 0.3273563218390805, "grad_norm": 0.7559351325035095, "learning_rate": 0.00016745812626541506, "loss": 1.6607, "num_input_tokens_seen": 5345296, "step": 890, "train_runtime": 897.6994, "train_tokens_per_second": 5954.438 }, { "epoch": 0.3277241379310345, "grad_norm": 0.767314076423645, "learning_rate": 0.00016742131419105467, "loss": 1.9345, "num_input_tokens_seen": 5350448, "step": 891, "train_runtime": 898.5485, "train_tokens_per_second": 5954.546 }, { "epoch": 0.3280919540229885, "grad_norm": 0.7825886011123657, "learning_rate": 0.00016738450211669427, "loss": 1.9034, "num_input_tokens_seen": 5355408, "step": 892, "train_runtime": 899.3921, "train_tokens_per_second": 5954.475 }, { "epoch": 0.32845977011494254, "grad_norm": 0.7350146770477295, "learning_rate": 0.0001673476900423339, "loss": 1.7683, "num_input_tokens_seen": 5361728, "step": 893, "train_runtime": 900.3859, "train_tokens_per_second": 5954.922 }, { "epoch": 0.32882758620689656, "grad_norm": 0.6977401971817017, "learning_rate": 0.00016731087796797352, "loss": 1.7708, "num_input_tokens_seen": 5367024, "step": 894, "train_runtime": 901.2762, "train_tokens_per_second": 5954.916 }, { "epoch": 0.3291954022988506, "grad_norm": 0.6419262886047363, "learning_rate": 0.00016727406589361313, "loss": 1.7043, "num_input_tokens_seen": 5374144, "step": 895, "train_runtime": 902.4095, "train_tokens_per_second": 5955.327 }, { "epoch": 0.3295632183908046, "grad_norm": 0.7703659534454346, "learning_rate": 0.00016723725381925274, "loss": 1.6718, "num_input_tokens_seen": 5381264, "step": 896, "train_runtime": 903.5123, "train_tokens_per_second": 5955.939 }, { "epoch": 0.3299310344827586, "grad_norm": 0.732337474822998, "learning_rate": 0.00016720044174489235, "loss": 1.8742, "num_input_tokens_seen": 5386256, "step": 897, "train_runtime": 904.3424, "train_tokens_per_second": 5955.992 }, { "epoch": 0.33029885057471264, "grad_norm": 0.6581416130065918, "learning_rate": 0.00016716362967053193, "loss": 1.7263, "num_input_tokens_seen": 5395312, "step": 898, "train_runtime": 905.7289, "train_tokens_per_second": 5956.873 }, { "epoch": 0.33066666666666666, "grad_norm": 0.781947910785675, "learning_rate": 0.00016712681759617154, "loss": 1.8114, "num_input_tokens_seen": 5400048, "step": 899, "train_runtime": 906.5289, "train_tokens_per_second": 5956.84 }, { "epoch": 0.3310344827586207, "grad_norm": 0.7370207905769348, "learning_rate": 0.00016709000552181115, "loss": 1.7365, "num_input_tokens_seen": 5404992, "step": 900, "train_runtime": 907.3548, "train_tokens_per_second": 5956.867 }, { "epoch": 0.3314022988505747, "grad_norm": 0.680095374584198, "learning_rate": 0.00016705319344745075, "loss": 1.5573, "num_input_tokens_seen": 5410816, "step": 901, "train_runtime": 908.8003, "train_tokens_per_second": 5953.801 }, { "epoch": 0.3317701149425287, "grad_norm": 0.7197843790054321, "learning_rate": 0.0001670163813730904, "loss": 1.7531, "num_input_tokens_seen": 5417584, "step": 902, "train_runtime": 909.8755, "train_tokens_per_second": 5954.203 }, { "epoch": 0.33213793103448275, "grad_norm": 0.7075902223587036, "learning_rate": 0.00016697956929873, "loss": 1.6958, "num_input_tokens_seen": 5422144, "step": 903, "train_runtime": 910.6749, "train_tokens_per_second": 5953.984 }, { "epoch": 0.33250574712643677, "grad_norm": 0.7745205163955688, "learning_rate": 0.0001669427572243696, "loss": 1.7477, "num_input_tokens_seen": 5428128, "step": 904, "train_runtime": 911.651, "train_tokens_per_second": 5954.173 }, { "epoch": 0.3328735632183908, "grad_norm": 0.6813750267028809, "learning_rate": 0.00016690594515000922, "loss": 1.5535, "num_input_tokens_seen": 5432720, "step": 905, "train_runtime": 912.4664, "train_tokens_per_second": 5953.885 }, { "epoch": 0.3332413793103448, "grad_norm": 0.6669746041297913, "learning_rate": 0.00016686913307564883, "loss": 1.8188, "num_input_tokens_seen": 5438880, "step": 906, "train_runtime": 913.4526, "train_tokens_per_second": 5954.2 }, { "epoch": 0.33360919540229883, "grad_norm": 0.7980788350105286, "learning_rate": 0.00016683232100128843, "loss": 1.8031, "num_input_tokens_seen": 5445488, "step": 907, "train_runtime": 914.5392, "train_tokens_per_second": 5954.351 }, { "epoch": 0.33397701149425285, "grad_norm": 0.8281051516532898, "learning_rate": 0.00016679550892692804, "loss": 1.9154, "num_input_tokens_seen": 5450240, "step": 908, "train_runtime": 915.349, "train_tokens_per_second": 5954.275 }, { "epoch": 0.33434482758620687, "grad_norm": 0.8023442625999451, "learning_rate": 0.00016675869685256765, "loss": 1.8548, "num_input_tokens_seen": 5456560, "step": 909, "train_runtime": 916.3711, "train_tokens_per_second": 5954.531 }, { "epoch": 0.3347126436781609, "grad_norm": 0.7418462038040161, "learning_rate": 0.00016672188477820726, "loss": 1.7166, "num_input_tokens_seen": 5463120, "step": 910, "train_runtime": 917.4244, "train_tokens_per_second": 5954.845 }, { "epoch": 0.33508045977011497, "grad_norm": 0.761345624923706, "learning_rate": 0.00016668507270384687, "loss": 1.9705, "num_input_tokens_seen": 5469792, "step": 911, "train_runtime": 918.496, "train_tokens_per_second": 5955.161 }, { "epoch": 0.335448275862069, "grad_norm": 0.7353963255882263, "learning_rate": 0.00016664826062948648, "loss": 1.7924, "num_input_tokens_seen": 5475952, "step": 912, "train_runtime": 919.5159, "train_tokens_per_second": 5955.255 }, { "epoch": 0.335816091954023, "grad_norm": 0.7788954377174377, "learning_rate": 0.0001666114485551261, "loss": 1.6776, "num_input_tokens_seen": 5483680, "step": 913, "train_runtime": 920.729, "train_tokens_per_second": 5955.802 }, { "epoch": 0.33618390804597703, "grad_norm": 0.7629323601722717, "learning_rate": 0.0001665746364807657, "loss": 1.8075, "num_input_tokens_seen": 5491152, "step": 914, "train_runtime": 921.9071, "train_tokens_per_second": 5956.297 }, { "epoch": 0.33655172413793105, "grad_norm": 0.7548069953918457, "learning_rate": 0.0001665378244064053, "loss": 1.8454, "num_input_tokens_seen": 5496560, "step": 915, "train_runtime": 922.7855, "train_tokens_per_second": 5956.487 }, { "epoch": 0.3369195402298851, "grad_norm": 0.7721388936042786, "learning_rate": 0.00016650101233204491, "loss": 1.9724, "num_input_tokens_seen": 5501232, "step": 916, "train_runtime": 923.5841, "train_tokens_per_second": 5956.395 }, { "epoch": 0.3372873563218391, "grad_norm": 0.6715081930160522, "learning_rate": 0.00016646420025768452, "loss": 1.7975, "num_input_tokens_seen": 5509088, "step": 917, "train_runtime": 924.827, "train_tokens_per_second": 5956.885 }, { "epoch": 0.3376551724137931, "grad_norm": 0.7529799342155457, "learning_rate": 0.00016642738818332413, "loss": 1.8351, "num_input_tokens_seen": 5515488, "step": 918, "train_runtime": 925.8782, "train_tokens_per_second": 5957.034 }, { "epoch": 0.33802298850574714, "grad_norm": 0.7663313150405884, "learning_rate": 0.00016639057610896377, "loss": 1.9124, "num_input_tokens_seen": 5523888, "step": 919, "train_runtime": 927.1774, "train_tokens_per_second": 5957.747 }, { "epoch": 0.33839080459770116, "grad_norm": 0.8396819829940796, "learning_rate": 0.00016635376403460338, "loss": 1.933, "num_input_tokens_seen": 5531200, "step": 920, "train_runtime": 928.3283, "train_tokens_per_second": 5958.237 }, { "epoch": 0.3387586206896552, "grad_norm": 0.6740185618400574, "learning_rate": 0.00016631695196024296, "loss": 1.6992, "num_input_tokens_seen": 5537104, "step": 921, "train_runtime": 929.283, "train_tokens_per_second": 5958.469 }, { "epoch": 0.3391264367816092, "grad_norm": 0.6395431756973267, "learning_rate": 0.00016628013988588257, "loss": 1.7998, "num_input_tokens_seen": 5543520, "step": 922, "train_runtime": 930.3256, "train_tokens_per_second": 5958.688 }, { "epoch": 0.3394942528735632, "grad_norm": 0.7490308284759521, "learning_rate": 0.00016624332781152218, "loss": 1.9367, "num_input_tokens_seen": 5547968, "step": 923, "train_runtime": 931.0858, "train_tokens_per_second": 5958.6 }, { "epoch": 0.33986206896551724, "grad_norm": 0.7609663009643555, "learning_rate": 0.00016620651573716179, "loss": 1.846, "num_input_tokens_seen": 5552720, "step": 924, "train_runtime": 931.8949, "train_tokens_per_second": 5958.526 }, { "epoch": 0.34022988505747126, "grad_norm": 0.754848301410675, "learning_rate": 0.0001661697036628014, "loss": 1.8017, "num_input_tokens_seen": 5557760, "step": 925, "train_runtime": 932.7539, "train_tokens_per_second": 5958.442 }, { "epoch": 0.3405977011494253, "grad_norm": 0.7673571109771729, "learning_rate": 0.000166132891588441, "loss": 1.8847, "num_input_tokens_seen": 5562048, "step": 926, "train_runtime": 933.5201, "train_tokens_per_second": 5958.145 }, { "epoch": 0.3409655172413793, "grad_norm": 0.6410609483718872, "learning_rate": 0.0001660960795140806, "loss": 1.7325, "num_input_tokens_seen": 5568832, "step": 927, "train_runtime": 934.607, "train_tokens_per_second": 5958.474 }, { "epoch": 0.3413333333333333, "grad_norm": 0.739958643913269, "learning_rate": 0.00016605926743972025, "loss": 1.8312, "num_input_tokens_seen": 5573952, "step": 928, "train_runtime": 935.4746, "train_tokens_per_second": 5958.422 }, { "epoch": 0.34170114942528734, "grad_norm": 0.8044548630714417, "learning_rate": 0.00016602245536535986, "loss": 2.0177, "num_input_tokens_seen": 5580032, "step": 929, "train_runtime": 936.4628, "train_tokens_per_second": 5958.627 }, { "epoch": 0.34206896551724136, "grad_norm": 0.7180975675582886, "learning_rate": 0.00016598564329099947, "loss": 1.8069, "num_input_tokens_seen": 5584432, "step": 930, "train_runtime": 937.2357, "train_tokens_per_second": 5958.407 }, { "epoch": 0.3424367816091954, "grad_norm": 0.7389205694198608, "learning_rate": 0.00016594883121663908, "loss": 1.9265, "num_input_tokens_seen": 5592256, "step": 931, "train_runtime": 938.9232, "train_tokens_per_second": 5956.032 }, { "epoch": 0.3428045977011494, "grad_norm": 0.7436507344245911, "learning_rate": 0.00016591201914227868, "loss": 1.9659, "num_input_tokens_seen": 5602304, "step": 932, "train_runtime": 940.4709, "train_tokens_per_second": 5956.913 }, { "epoch": 0.3431724137931034, "grad_norm": 0.736650824546814, "learning_rate": 0.0001658752070679183, "loss": 1.6487, "num_input_tokens_seen": 5606864, "step": 933, "train_runtime": 941.2631, "train_tokens_per_second": 5956.744 }, { "epoch": 0.34354022988505745, "grad_norm": 0.77228844165802, "learning_rate": 0.0001658383949935579, "loss": 1.8334, "num_input_tokens_seen": 5612064, "step": 934, "train_runtime": 942.1342, "train_tokens_per_second": 5956.757 }, { "epoch": 0.34390804597701147, "grad_norm": 0.7864047884941101, "learning_rate": 0.00016580158291919748, "loss": 1.8269, "num_input_tokens_seen": 5616816, "step": 935, "train_runtime": 942.9496, "train_tokens_per_second": 5956.645 }, { "epoch": 0.34427586206896554, "grad_norm": 0.7177388668060303, "learning_rate": 0.00016576477084483712, "loss": 1.6359, "num_input_tokens_seen": 5622864, "step": 936, "train_runtime": 943.9504, "train_tokens_per_second": 5956.736 }, { "epoch": 0.34464367816091956, "grad_norm": 0.7560311555862427, "learning_rate": 0.00016572795877047673, "loss": 2.1609, "num_input_tokens_seen": 5627792, "step": 937, "train_runtime": 944.7675, "train_tokens_per_second": 5956.801 }, { "epoch": 0.3450114942528736, "grad_norm": 0.7919855117797852, "learning_rate": 0.00016569114669611634, "loss": 1.908, "num_input_tokens_seen": 5634768, "step": 938, "train_runtime": 945.8646, "train_tokens_per_second": 5957.267 }, { "epoch": 0.3453793103448276, "grad_norm": 0.7530859708786011, "learning_rate": 0.00016565433462175595, "loss": 1.7035, "num_input_tokens_seen": 5640656, "step": 939, "train_runtime": 946.854, "train_tokens_per_second": 5957.261 }, { "epoch": 0.3457471264367816, "grad_norm": 0.7020770907402039, "learning_rate": 0.00016561752254739556, "loss": 1.7462, "num_input_tokens_seen": 5646960, "step": 940, "train_runtime": 947.8881, "train_tokens_per_second": 5957.412 }, { "epoch": 0.34611494252873565, "grad_norm": 0.8409958481788635, "learning_rate": 0.00016558071047303516, "loss": 1.669, "num_input_tokens_seen": 5652736, "step": 941, "train_runtime": 948.8596, "train_tokens_per_second": 5957.4 }, { "epoch": 0.34648275862068967, "grad_norm": 0.7040790915489197, "learning_rate": 0.00016554389839867477, "loss": 1.8176, "num_input_tokens_seen": 5657824, "step": 942, "train_runtime": 949.6983, "train_tokens_per_second": 5957.496 }, { "epoch": 0.3468505747126437, "grad_norm": 0.7028451561927795, "learning_rate": 0.00016550708632431438, "loss": 1.8359, "num_input_tokens_seen": 5663568, "step": 943, "train_runtime": 950.6592, "train_tokens_per_second": 5957.517 }, { "epoch": 0.3472183908045977, "grad_norm": 0.6852657198905945, "learning_rate": 0.000165470274249954, "loss": 1.694, "num_input_tokens_seen": 5669200, "step": 944, "train_runtime": 951.5858, "train_tokens_per_second": 5957.634 }, { "epoch": 0.34758620689655173, "grad_norm": 0.7269863486289978, "learning_rate": 0.0001654334621755936, "loss": 1.6913, "num_input_tokens_seen": 5675344, "step": 945, "train_runtime": 952.5801, "train_tokens_per_second": 5957.865 }, { "epoch": 0.34795402298850575, "grad_norm": 0.7116245031356812, "learning_rate": 0.0001653966501012332, "loss": 1.7932, "num_input_tokens_seen": 5680464, "step": 946, "train_runtime": 953.4462, "train_tokens_per_second": 5957.823 }, { "epoch": 0.34832183908045977, "grad_norm": 0.780099630355835, "learning_rate": 0.00016535983802687282, "loss": 1.8072, "num_input_tokens_seen": 5686448, "step": 947, "train_runtime": 954.415, "train_tokens_per_second": 5958.045 }, { "epoch": 0.3486896551724138, "grad_norm": 0.710581362247467, "learning_rate": 0.00016532302595251243, "loss": 1.5974, "num_input_tokens_seen": 5694752, "step": 948, "train_runtime": 955.6773, "train_tokens_per_second": 5958.865 }, { "epoch": 0.3490574712643678, "grad_norm": 0.7463304400444031, "learning_rate": 0.00016528621387815204, "loss": 1.7301, "num_input_tokens_seen": 5704592, "step": 949, "train_runtime": 957.1568, "train_tokens_per_second": 5959.935 }, { "epoch": 0.34942528735632183, "grad_norm": 0.8333390951156616, "learning_rate": 0.00016524940180379164, "loss": 1.8625, "num_input_tokens_seen": 5713168, "step": 950, "train_runtime": 958.4767, "train_tokens_per_second": 5960.675 }, { "epoch": 0.34979310344827585, "grad_norm": 0.674447238445282, "learning_rate": 0.00016521258972943125, "loss": 1.6663, "num_input_tokens_seen": 5718144, "step": 951, "train_runtime": 959.303, "train_tokens_per_second": 5960.728 }, { "epoch": 0.3501609195402299, "grad_norm": 0.672986626625061, "learning_rate": 0.00016517577765507086, "loss": 1.6585, "num_input_tokens_seen": 5724848, "step": 952, "train_runtime": 960.3875, "train_tokens_per_second": 5960.977 }, { "epoch": 0.3505287356321839, "grad_norm": 0.7748245000839233, "learning_rate": 0.0001651389655807105, "loss": 1.7803, "num_input_tokens_seen": 5729328, "step": 953, "train_runtime": 961.1743, "train_tokens_per_second": 5960.759 }, { "epoch": 0.3508965517241379, "grad_norm": 0.631734311580658, "learning_rate": 0.0001651021535063501, "loss": 1.757, "num_input_tokens_seen": 5737296, "step": 954, "train_runtime": 962.4372, "train_tokens_per_second": 5961.216 }, { "epoch": 0.35126436781609194, "grad_norm": 0.7916156053543091, "learning_rate": 0.00016506534143198972, "loss": 1.9381, "num_input_tokens_seen": 5744896, "step": 955, "train_runtime": 963.6028, "train_tokens_per_second": 5961.892 }, { "epoch": 0.35163218390804596, "grad_norm": 0.6629148721694946, "learning_rate": 0.00016502852935762932, "loss": 1.6705, "num_input_tokens_seen": 5749744, "step": 956, "train_runtime": 964.4178, "train_tokens_per_second": 5961.881 }, { "epoch": 0.352, "grad_norm": 0.6603271961212158, "learning_rate": 0.00016499171728326893, "loss": 1.7175, "num_input_tokens_seen": 5755152, "step": 957, "train_runtime": 965.3238, "train_tokens_per_second": 5961.887 }, { "epoch": 0.352367816091954, "grad_norm": 0.770685613155365, "learning_rate": 0.00016495490520890852, "loss": 1.8274, "num_input_tokens_seen": 5760752, "step": 958, "train_runtime": 966.2246, "train_tokens_per_second": 5962.125 }, { "epoch": 0.352735632183908, "grad_norm": 0.6816652417182922, "learning_rate": 0.00016491809313454812, "loss": 1.834, "num_input_tokens_seen": 5771312, "step": 959, "train_runtime": 967.8065, "train_tokens_per_second": 5963.291 }, { "epoch": 0.35310344827586204, "grad_norm": 0.7133073806762695, "learning_rate": 0.00016488128106018773, "loss": 1.7701, "num_input_tokens_seen": 5776176, "step": 960, "train_runtime": 968.641, "train_tokens_per_second": 5963.175 }, { "epoch": 0.3534712643678161, "grad_norm": 0.678919792175293, "learning_rate": 0.00016484446898582734, "loss": 1.7831, "num_input_tokens_seen": 5782464, "step": 961, "train_runtime": 970.1425, "train_tokens_per_second": 5960.428 }, { "epoch": 0.35383908045977014, "grad_norm": 0.6276996731758118, "learning_rate": 0.00016480765691146698, "loss": 1.7643, "num_input_tokens_seen": 5787088, "step": 962, "train_runtime": 970.9439, "train_tokens_per_second": 5960.27 }, { "epoch": 0.35420689655172416, "grad_norm": 0.7291053533554077, "learning_rate": 0.0001647708448371066, "loss": 1.6757, "num_input_tokens_seen": 5791952, "step": 963, "train_runtime": 971.7866, "train_tokens_per_second": 5960.107 }, { "epoch": 0.3545747126436782, "grad_norm": 0.6977639198303223, "learning_rate": 0.0001647340327627462, "loss": 1.6786, "num_input_tokens_seen": 5800352, "step": 964, "train_runtime": 973.1064, "train_tokens_per_second": 5960.655 }, { "epoch": 0.3549425287356322, "grad_norm": 0.668307900428772, "learning_rate": 0.0001646972206883858, "loss": 1.6556, "num_input_tokens_seen": 5806704, "step": 965, "train_runtime": 974.1432, "train_tokens_per_second": 5960.832 }, { "epoch": 0.3553103448275862, "grad_norm": 0.7223288416862488, "learning_rate": 0.0001646604086140254, "loss": 1.8902, "num_input_tokens_seen": 5812288, "step": 966, "train_runtime": 975.0824, "train_tokens_per_second": 5960.817 }, { "epoch": 0.35567816091954024, "grad_norm": 0.6939303278923035, "learning_rate": 0.00016462359653966502, "loss": 1.9322, "num_input_tokens_seen": 5818080, "step": 967, "train_runtime": 976.059, "train_tokens_per_second": 5960.787 }, { "epoch": 0.35604597701149426, "grad_norm": 0.7478364706039429, "learning_rate": 0.00016458678446530463, "loss": 1.7346, "num_input_tokens_seen": 5823968, "step": 968, "train_runtime": 977.0237, "train_tokens_per_second": 5960.928 }, { "epoch": 0.3564137931034483, "grad_norm": 0.7032122611999512, "learning_rate": 0.00016454997239094424, "loss": 1.9145, "num_input_tokens_seen": 5830320, "step": 969, "train_runtime": 978.0622, "train_tokens_per_second": 5961.093 }, { "epoch": 0.3567816091954023, "grad_norm": 0.6438683271408081, "learning_rate": 0.00016451316031658385, "loss": 1.7318, "num_input_tokens_seen": 5837904, "step": 970, "train_runtime": 979.2637, "train_tokens_per_second": 5961.524 }, { "epoch": 0.3571494252873563, "grad_norm": 0.651461124420166, "learning_rate": 0.00016447634824222346, "loss": 1.7959, "num_input_tokens_seen": 5844608, "step": 971, "train_runtime": 980.3301, "train_tokens_per_second": 5961.878 }, { "epoch": 0.35751724137931035, "grad_norm": 0.7091881036758423, "learning_rate": 0.00016443953616786307, "loss": 1.9192, "num_input_tokens_seen": 5855760, "step": 972, "train_runtime": 982.0103, "train_tokens_per_second": 5963.033 }, { "epoch": 0.35788505747126437, "grad_norm": 0.7543753385543823, "learning_rate": 0.00016440272409350268, "loss": 1.6492, "num_input_tokens_seen": 5862384, "step": 973, "train_runtime": 983.0877, "train_tokens_per_second": 5963.236 }, { "epoch": 0.3582528735632184, "grad_norm": 0.7147246599197388, "learning_rate": 0.00016436591201914228, "loss": 1.8111, "num_input_tokens_seen": 5867616, "step": 974, "train_runtime": 983.9649, "train_tokens_per_second": 5963.237 }, { "epoch": 0.3586206896551724, "grad_norm": 0.6903164386749268, "learning_rate": 0.0001643290999447819, "loss": 1.8092, "num_input_tokens_seen": 5872832, "step": 975, "train_runtime": 984.8438, "train_tokens_per_second": 5963.212 }, { "epoch": 0.35898850574712643, "grad_norm": 0.7116182446479797, "learning_rate": 0.0001642922878704215, "loss": 1.8203, "num_input_tokens_seen": 5879408, "step": 976, "train_runtime": 985.923, "train_tokens_per_second": 5963.354 }, { "epoch": 0.35935632183908045, "grad_norm": 0.7367668151855469, "learning_rate": 0.0001642554757960611, "loss": 1.7829, "num_input_tokens_seen": 5885088, "step": 977, "train_runtime": 986.8655, "train_tokens_per_second": 5963.415 }, { "epoch": 0.35972413793103447, "grad_norm": 0.6934012174606323, "learning_rate": 0.00016421866372170072, "loss": 1.7207, "num_input_tokens_seen": 5890448, "step": 978, "train_runtime": 987.7483, "train_tokens_per_second": 5963.511 }, { "epoch": 0.3600919540229885, "grad_norm": 0.7513874173164368, "learning_rate": 0.00016418185164734036, "loss": 1.721, "num_input_tokens_seen": 5894912, "step": 979, "train_runtime": 988.5242, "train_tokens_per_second": 5963.346 }, { "epoch": 0.3604597701149425, "grad_norm": 0.6775432825088501, "learning_rate": 0.00016414503957297997, "loss": 1.6022, "num_input_tokens_seen": 5902224, "step": 980, "train_runtime": 989.6712, "train_tokens_per_second": 5963.823 }, { "epoch": 0.36082758620689653, "grad_norm": 0.7553426623344421, "learning_rate": 0.00016410822749861955, "loss": 1.6472, "num_input_tokens_seen": 5908128, "step": 981, "train_runtime": 990.6623, "train_tokens_per_second": 5963.816 }, { "epoch": 0.36119540229885055, "grad_norm": 0.700955867767334, "learning_rate": 0.00016407141542425916, "loss": 1.6952, "num_input_tokens_seen": 5914800, "step": 982, "train_runtime": 991.7303, "train_tokens_per_second": 5964.121 }, { "epoch": 0.3615632183908046, "grad_norm": 0.7294247150421143, "learning_rate": 0.00016403460334989876, "loss": 1.8799, "num_input_tokens_seen": 5919712, "step": 983, "train_runtime": 992.5735, "train_tokens_per_second": 5964.004 }, { "epoch": 0.3619310344827586, "grad_norm": 0.7663295269012451, "learning_rate": 0.00016399779127553837, "loss": 1.8785, "num_input_tokens_seen": 5925024, "step": 984, "train_runtime": 993.4661, "train_tokens_per_second": 5963.992 }, { "epoch": 0.3622988505747126, "grad_norm": 0.6929524540901184, "learning_rate": 0.00016396097920117798, "loss": 1.8012, "num_input_tokens_seen": 5934000, "step": 985, "train_runtime": 994.8297, "train_tokens_per_second": 5964.84 }, { "epoch": 0.3626666666666667, "grad_norm": 0.720958948135376, "learning_rate": 0.0001639241671268176, "loss": 1.9708, "num_input_tokens_seen": 5939616, "step": 986, "train_runtime": 995.7591, "train_tokens_per_second": 5964.913 }, { "epoch": 0.3630344827586207, "grad_norm": 0.7467935085296631, "learning_rate": 0.0001638873550524572, "loss": 1.8607, "num_input_tokens_seen": 5945424, "step": 987, "train_runtime": 996.6987, "train_tokens_per_second": 5965.117 }, { "epoch": 0.36340229885057473, "grad_norm": 0.632853090763092, "learning_rate": 0.00016385054297809684, "loss": 1.6344, "num_input_tokens_seen": 5955056, "step": 988, "train_runtime": 998.1631, "train_tokens_per_second": 5966.015 }, { "epoch": 0.36377011494252876, "grad_norm": 0.7575991153717041, "learning_rate": 0.00016381373090373645, "loss": 1.8875, "num_input_tokens_seen": 5960352, "step": 989, "train_runtime": 999.0453, "train_tokens_per_second": 5966.048 }, { "epoch": 0.3641379310344828, "grad_norm": 0.6999156475067139, "learning_rate": 0.00016377691882937605, "loss": 1.8642, "num_input_tokens_seen": 5969136, "step": 990, "train_runtime": 1000.3921, "train_tokens_per_second": 5966.797 }, { "epoch": 0.3645057471264368, "grad_norm": 0.7687408328056335, "learning_rate": 0.00016374010675501566, "loss": 1.6813, "num_input_tokens_seen": 5974336, "step": 991, "train_runtime": 1001.7004, "train_tokens_per_second": 5964.195 }, { "epoch": 0.3648735632183908, "grad_norm": 0.7835000157356262, "learning_rate": 0.00016370329468065527, "loss": 1.8687, "num_input_tokens_seen": 5980176, "step": 992, "train_runtime": 1002.6559, "train_tokens_per_second": 5964.335 }, { "epoch": 0.36524137931034484, "grad_norm": 0.6699005365371704, "learning_rate": 0.00016366648260629488, "loss": 1.7947, "num_input_tokens_seen": 5986688, "step": 993, "train_runtime": 1003.7194, "train_tokens_per_second": 5964.504 }, { "epoch": 0.36560919540229886, "grad_norm": 0.7430959939956665, "learning_rate": 0.00016362967053193446, "loss": 1.8256, "num_input_tokens_seen": 5992688, "step": 994, "train_runtime": 1004.7154, "train_tokens_per_second": 5964.563 }, { "epoch": 0.3659770114942529, "grad_norm": 0.7016071677207947, "learning_rate": 0.00016359285845757407, "loss": 1.9459, "num_input_tokens_seen": 5999520, "step": 995, "train_runtime": 1005.784, "train_tokens_per_second": 5965.019 }, { "epoch": 0.3663448275862069, "grad_norm": 0.8595346212387085, "learning_rate": 0.0001635560463832137, "loss": 1.9452, "num_input_tokens_seen": 6005120, "step": 996, "train_runtime": 1006.6982, "train_tokens_per_second": 5965.164 }, { "epoch": 0.3667126436781609, "grad_norm": 0.8124039769172668, "learning_rate": 0.00016351923430885332, "loss": 1.7245, "num_input_tokens_seen": 6010576, "step": 997, "train_runtime": 1007.621, "train_tokens_per_second": 5965.116 }, { "epoch": 0.36708045977011494, "grad_norm": 0.7314801216125488, "learning_rate": 0.00016348242223449293, "loss": 1.7136, "num_input_tokens_seen": 6021728, "step": 998, "train_runtime": 1009.2858, "train_tokens_per_second": 5966.326 }, { "epoch": 0.36744827586206896, "grad_norm": 0.7391095161437988, "learning_rate": 0.00016344561016013253, "loss": 1.7556, "num_input_tokens_seen": 6026816, "step": 999, "train_runtime": 1010.1599, "train_tokens_per_second": 5966.2 }, { "epoch": 0.367816091954023, "grad_norm": 0.78415846824646, "learning_rate": 0.00016340879808577214, "loss": 1.6615, "num_input_tokens_seen": 6033104, "step": 1000, "train_runtime": 1011.1874, "train_tokens_per_second": 5966.356 }, { "epoch": 0.368183908045977, "grad_norm": 0.7598666548728943, "learning_rate": 0.00016337198601141175, "loss": 1.9224, "num_input_tokens_seen": 6038704, "step": 1001, "train_runtime": 1012.1416, "train_tokens_per_second": 5966.264 }, { "epoch": 0.368551724137931, "grad_norm": 0.7282189726829529, "learning_rate": 0.00016333517393705136, "loss": 1.8227, "num_input_tokens_seen": 6045744, "step": 1002, "train_runtime": 1013.2677, "train_tokens_per_second": 5966.581 }, { "epoch": 0.36891954022988505, "grad_norm": 0.7118775844573975, "learning_rate": 0.00016329836186269097, "loss": 1.6633, "num_input_tokens_seen": 6055312, "step": 1003, "train_runtime": 1014.7263, "train_tokens_per_second": 5967.434 }, { "epoch": 0.36928735632183907, "grad_norm": 0.746175229549408, "learning_rate": 0.00016326154978833058, "loss": 1.7093, "num_input_tokens_seen": 6063968, "step": 1004, "train_runtime": 1016.0781, "train_tokens_per_second": 5968.014 }, { "epoch": 0.3696551724137931, "grad_norm": 0.7311099767684937, "learning_rate": 0.0001632247377139702, "loss": 1.7717, "num_input_tokens_seen": 6071408, "step": 1005, "train_runtime": 1017.2374, "train_tokens_per_second": 5968.526 }, { "epoch": 0.3700229885057471, "grad_norm": 0.6983187794685364, "learning_rate": 0.0001631879256396098, "loss": 1.7268, "num_input_tokens_seen": 6076272, "step": 1006, "train_runtime": 1018.0566, "train_tokens_per_second": 5968.501 }, { "epoch": 0.37039080459770113, "grad_norm": 0.735249400138855, "learning_rate": 0.0001631511135652494, "loss": 1.9884, "num_input_tokens_seen": 6083232, "step": 1007, "train_runtime": 1019.144, "train_tokens_per_second": 5968.962 }, { "epoch": 0.37075862068965515, "grad_norm": 0.7385590076446533, "learning_rate": 0.00016311430149088901, "loss": 1.7056, "num_input_tokens_seen": 6089696, "step": 1008, "train_runtime": 1020.167, "train_tokens_per_second": 5969.313 }, { "epoch": 0.37112643678160917, "grad_norm": 0.8687577843666077, "learning_rate": 0.00016307748941652862, "loss": 1.9122, "num_input_tokens_seen": 6094128, "step": 1009, "train_runtime": 1020.9534, "train_tokens_per_second": 5969.056 }, { "epoch": 0.3714942528735632, "grad_norm": 0.7456827163696289, "learning_rate": 0.00016304067734216823, "loss": 1.748, "num_input_tokens_seen": 6098944, "step": 1010, "train_runtime": 1021.7695, "train_tokens_per_second": 5969.002 }, { "epoch": 0.37186206896551727, "grad_norm": 0.8254635334014893, "learning_rate": 0.00016300386526780784, "loss": 1.744, "num_input_tokens_seen": 6103408, "step": 1011, "train_runtime": 1022.5507, "train_tokens_per_second": 5968.807 }, { "epoch": 0.3722298850574713, "grad_norm": 0.7087537050247192, "learning_rate": 0.00016296705319344745, "loss": 1.818, "num_input_tokens_seen": 6109232, "step": 1012, "train_runtime": 1023.5187, "train_tokens_per_second": 5968.852 }, { "epoch": 0.3725977011494253, "grad_norm": 0.7285974621772766, "learning_rate": 0.00016293024111908709, "loss": 1.841, "num_input_tokens_seen": 6114352, "step": 1013, "train_runtime": 1024.3703, "train_tokens_per_second": 5968.888 }, { "epoch": 0.37296551724137933, "grad_norm": 0.7073532342910767, "learning_rate": 0.0001628934290447267, "loss": 1.905, "num_input_tokens_seen": 6119776, "step": 1014, "train_runtime": 1025.2843, "train_tokens_per_second": 5968.857 }, { "epoch": 0.37333333333333335, "grad_norm": 0.7369471788406372, "learning_rate": 0.0001628566169703663, "loss": 2.0135, "num_input_tokens_seen": 6125360, "step": 1015, "train_runtime": 1026.2065, "train_tokens_per_second": 5968.935 }, { "epoch": 0.37370114942528737, "grad_norm": 0.7469699382781982, "learning_rate": 0.0001628198048960059, "loss": 1.7684, "num_input_tokens_seen": 6131184, "step": 1016, "train_runtime": 1027.1512, "train_tokens_per_second": 5969.115 }, { "epoch": 0.3740689655172414, "grad_norm": 0.7768290042877197, "learning_rate": 0.00016278299282164552, "loss": 1.7137, "num_input_tokens_seen": 6136256, "step": 1017, "train_runtime": 1027.9902, "train_tokens_per_second": 5969.177 }, { "epoch": 0.3744367816091954, "grad_norm": 0.7599640488624573, "learning_rate": 0.0001627461807472851, "loss": 1.8537, "num_input_tokens_seen": 6142896, "step": 1018, "train_runtime": 1029.051, "train_tokens_per_second": 5969.477 }, { "epoch": 0.37480459770114943, "grad_norm": 0.6762050986289978, "learning_rate": 0.0001627093686729247, "loss": 1.6498, "num_input_tokens_seen": 6148720, "step": 1019, "train_runtime": 1030.0245, "train_tokens_per_second": 5969.489 }, { "epoch": 0.37517241379310345, "grad_norm": 0.7139620184898376, "learning_rate": 0.00016267255659856432, "loss": 1.9684, "num_input_tokens_seen": 6154080, "step": 1020, "train_runtime": 1030.8916, "train_tokens_per_second": 5969.668 }, { "epoch": 0.3755402298850575, "grad_norm": 0.7365214228630066, "learning_rate": 0.00016263574452420393, "loss": 1.7081, "num_input_tokens_seen": 6159360, "step": 1021, "train_runtime": 1032.3052, "train_tokens_per_second": 5966.608 }, { "epoch": 0.3759080459770115, "grad_norm": 0.7719625234603882, "learning_rate": 0.00016259893244984357, "loss": 1.7645, "num_input_tokens_seen": 6164704, "step": 1022, "train_runtime": 1033.183, "train_tokens_per_second": 5966.711 }, { "epoch": 0.3762758620689655, "grad_norm": 0.7170722484588623, "learning_rate": 0.00016256212037548317, "loss": 1.727, "num_input_tokens_seen": 6170592, "step": 1023, "train_runtime": 1034.1279, "train_tokens_per_second": 5966.952 }, { "epoch": 0.37664367816091954, "grad_norm": 0.7749509215354919, "learning_rate": 0.00016252530830112278, "loss": 1.9907, "num_input_tokens_seen": 6176160, "step": 1024, "train_runtime": 1035.0477, "train_tokens_per_second": 5967.029 }, { "epoch": 0.37701149425287356, "grad_norm": 0.6887675523757935, "learning_rate": 0.0001624884962267624, "loss": 1.8601, "num_input_tokens_seen": 6181280, "step": 1025, "train_runtime": 1035.9168, "train_tokens_per_second": 5966.966 }, { "epoch": 0.3773793103448276, "grad_norm": 0.7674352526664734, "learning_rate": 0.000162451684152402, "loss": 1.6161, "num_input_tokens_seen": 6187424, "step": 1026, "train_runtime": 1036.888, "train_tokens_per_second": 5967.302 }, { "epoch": 0.3777471264367816, "grad_norm": 0.6757673025131226, "learning_rate": 0.0001624148720780416, "loss": 1.7524, "num_input_tokens_seen": 6193600, "step": 1027, "train_runtime": 1037.9082, "train_tokens_per_second": 5967.387 }, { "epoch": 0.3781149425287356, "grad_norm": 0.6949533820152283, "learning_rate": 0.00016237806000368122, "loss": 1.6835, "num_input_tokens_seen": 6199632, "step": 1028, "train_runtime": 1038.9101, "train_tokens_per_second": 5967.438 }, { "epoch": 0.37848275862068964, "grad_norm": 0.7543976902961731, "learning_rate": 0.00016234124792932083, "loss": 1.6057, "num_input_tokens_seen": 6205520, "step": 1029, "train_runtime": 1039.8887, "train_tokens_per_second": 5967.485 }, { "epoch": 0.37885057471264366, "grad_norm": 0.7911177277565002, "learning_rate": 0.00016230443585496044, "loss": 1.8486, "num_input_tokens_seen": 6211808, "step": 1030, "train_runtime": 1040.9373, "train_tokens_per_second": 5967.514 }, { "epoch": 0.3792183908045977, "grad_norm": 0.7119301557540894, "learning_rate": 0.00016226762378060005, "loss": 1.8367, "num_input_tokens_seen": 6218032, "step": 1031, "train_runtime": 1041.9436, "train_tokens_per_second": 5967.724 }, { "epoch": 0.3795862068965517, "grad_norm": 0.6604345440864563, "learning_rate": 0.00016223081170623965, "loss": 1.6414, "num_input_tokens_seen": 6228688, "step": 1032, "train_runtime": 1043.5337, "train_tokens_per_second": 5968.842 }, { "epoch": 0.3799540229885057, "grad_norm": 0.7565374970436096, "learning_rate": 0.00016219399963187926, "loss": 1.7643, "num_input_tokens_seen": 6234592, "step": 1033, "train_runtime": 1044.5181, "train_tokens_per_second": 5968.869 }, { "epoch": 0.38032183908045974, "grad_norm": 0.6912949085235596, "learning_rate": 0.00016215718755751887, "loss": 1.7294, "num_input_tokens_seen": 6239568, "step": 1034, "train_runtime": 1045.3656, "train_tokens_per_second": 5968.79 }, { "epoch": 0.38068965517241377, "grad_norm": 0.7250675559043884, "learning_rate": 0.00016212037548315848, "loss": 1.8777, "num_input_tokens_seen": 6245168, "step": 1035, "train_runtime": 1046.2958, "train_tokens_per_second": 5968.836 }, { "epoch": 0.38105747126436784, "grad_norm": 0.7936033010482788, "learning_rate": 0.0001620835634087981, "loss": 1.6993, "num_input_tokens_seen": 6249888, "step": 1036, "train_runtime": 1047.0848, "train_tokens_per_second": 5968.846 }, { "epoch": 0.38142528735632186, "grad_norm": 0.7826706767082214, "learning_rate": 0.0001620467513344377, "loss": 1.8342, "num_input_tokens_seen": 6254544, "step": 1037, "train_runtime": 1047.8984, "train_tokens_per_second": 5968.655 }, { "epoch": 0.3817931034482759, "grad_norm": 0.7239696383476257, "learning_rate": 0.0001620099392600773, "loss": 1.8242, "num_input_tokens_seen": 6260256, "step": 1038, "train_runtime": 1048.8168, "train_tokens_per_second": 5968.875 }, { "epoch": 0.3821609195402299, "grad_norm": 0.7919307947158813, "learning_rate": 0.00016197312718571694, "loss": 2.0298, "num_input_tokens_seen": 6265024, "step": 1039, "train_runtime": 1049.6387, "train_tokens_per_second": 5968.744 }, { "epoch": 0.3825287356321839, "grad_norm": 0.7248693704605103, "learning_rate": 0.00016193631511135655, "loss": 1.8705, "num_input_tokens_seen": 6269536, "step": 1040, "train_runtime": 1050.4258, "train_tokens_per_second": 5968.567 }, { "epoch": 0.38289655172413795, "grad_norm": 0.7681882977485657, "learning_rate": 0.00016189950303699613, "loss": 1.8041, "num_input_tokens_seen": 6273520, "step": 1041, "train_runtime": 1051.1485, "train_tokens_per_second": 5968.253 }, { "epoch": 0.38326436781609197, "grad_norm": 0.7542139887809753, "learning_rate": 0.00016186269096263574, "loss": 1.9104, "num_input_tokens_seen": 6279296, "step": 1042, "train_runtime": 1052.0979, "train_tokens_per_second": 5968.357 }, { "epoch": 0.383632183908046, "grad_norm": 0.6792402267456055, "learning_rate": 0.00016182587888827535, "loss": 1.6552, "num_input_tokens_seen": 6284688, "step": 1043, "train_runtime": 1052.9885, "train_tokens_per_second": 5968.43 }, { "epoch": 0.384, "grad_norm": 0.7532481551170349, "learning_rate": 0.00016178906681391496, "loss": 1.8242, "num_input_tokens_seen": 6290480, "step": 1044, "train_runtime": 1053.9224, "train_tokens_per_second": 5968.637 }, { "epoch": 0.38436781609195403, "grad_norm": 0.8112294673919678, "learning_rate": 0.00016175225473955457, "loss": 1.8354, "num_input_tokens_seen": 6295744, "step": 1045, "train_runtime": 1054.7935, "train_tokens_per_second": 5968.698 }, { "epoch": 0.38473563218390805, "grad_norm": 0.7810726165771484, "learning_rate": 0.00016171544266519418, "loss": 1.8834, "num_input_tokens_seen": 6300080, "step": 1046, "train_runtime": 1055.5504, "train_tokens_per_second": 5968.526 }, { "epoch": 0.38510344827586207, "grad_norm": 0.6948085427284241, "learning_rate": 0.0001616786305908338, "loss": 1.6368, "num_input_tokens_seen": 6306080, "step": 1047, "train_runtime": 1056.5191, "train_tokens_per_second": 5968.733 }, { "epoch": 0.3854712643678161, "grad_norm": 0.7175804972648621, "learning_rate": 0.00016164181851647342, "loss": 1.7445, "num_input_tokens_seen": 6310176, "step": 1048, "train_runtime": 1057.2421, "train_tokens_per_second": 5968.525 }, { "epoch": 0.3858390804597701, "grad_norm": 0.6663169860839844, "learning_rate": 0.00016160500644211303, "loss": 1.7449, "num_input_tokens_seen": 6314912, "step": 1049, "train_runtime": 1058.0475, "train_tokens_per_second": 5968.458 }, { "epoch": 0.38620689655172413, "grad_norm": 0.7119675278663635, "learning_rate": 0.00016156819436775264, "loss": 1.6852, "num_input_tokens_seen": 6320112, "step": 1050, "train_runtime": 1058.9321, "train_tokens_per_second": 5968.383 }, { "epoch": 0.38657471264367815, "grad_norm": 0.6928601264953613, "learning_rate": 0.00016153138229339225, "loss": 1.6927, "num_input_tokens_seen": 6328496, "step": 1051, "train_runtime": 1060.7128, "train_tokens_per_second": 5966.267 }, { "epoch": 0.3869425287356322, "grad_norm": 0.6850346922874451, "learning_rate": 0.00016149457021903186, "loss": 1.6651, "num_input_tokens_seen": 6335520, "step": 1052, "train_runtime": 1061.8283, "train_tokens_per_second": 5966.614 }, { "epoch": 0.3873103448275862, "grad_norm": 0.6681268215179443, "learning_rate": 0.00016145775814467147, "loss": 1.6906, "num_input_tokens_seen": 6344368, "step": 1053, "train_runtime": 1063.2088, "train_tokens_per_second": 5967.189 }, { "epoch": 0.3876781609195402, "grad_norm": 0.8159458041191101, "learning_rate": 0.00016142094607031105, "loss": 1.9324, "num_input_tokens_seen": 6350448, "step": 1054, "train_runtime": 1064.1692, "train_tokens_per_second": 5967.517 }, { "epoch": 0.38804597701149424, "grad_norm": 0.8756287097930908, "learning_rate": 0.00016138413399595066, "loss": 1.9897, "num_input_tokens_seen": 6355520, "step": 1055, "train_runtime": 1065.041, "train_tokens_per_second": 5967.394 }, { "epoch": 0.38841379310344826, "grad_norm": 0.7280504107475281, "learning_rate": 0.0001613473219215903, "loss": 1.8268, "num_input_tokens_seen": 6361424, "step": 1056, "train_runtime": 1065.9996, "train_tokens_per_second": 5967.567 }, { "epoch": 0.3887816091954023, "grad_norm": 0.7619026303291321, "learning_rate": 0.0001613105098472299, "loss": 1.7893, "num_input_tokens_seen": 6367280, "step": 1057, "train_runtime": 1066.9694, "train_tokens_per_second": 5967.631 }, { "epoch": 0.3891494252873563, "grad_norm": 0.7361872792243958, "learning_rate": 0.0001612736977728695, "loss": 1.7469, "num_input_tokens_seen": 6371952, "step": 1058, "train_runtime": 1067.7463, "train_tokens_per_second": 5967.665 }, { "epoch": 0.3895172413793103, "grad_norm": 0.7800519466400146, "learning_rate": 0.00016123688569850912, "loss": 1.8479, "num_input_tokens_seen": 6376320, "step": 1059, "train_runtime": 1068.5102, "train_tokens_per_second": 5967.486 }, { "epoch": 0.38988505747126434, "grad_norm": 0.7623835802078247, "learning_rate": 0.00016120007362414873, "loss": 1.9095, "num_input_tokens_seen": 6381056, "step": 1060, "train_runtime": 1069.3484, "train_tokens_per_second": 5967.238 }, { "epoch": 0.3902528735632184, "grad_norm": 0.8020111322402954, "learning_rate": 0.00016116326154978834, "loss": 1.7293, "num_input_tokens_seen": 6386144, "step": 1061, "train_runtime": 1070.2159, "train_tokens_per_second": 5967.155 }, { "epoch": 0.39062068965517244, "grad_norm": 0.7152970433235168, "learning_rate": 0.00016112644947542795, "loss": 1.8283, "num_input_tokens_seen": 6391712, "step": 1062, "train_runtime": 1071.1167, "train_tokens_per_second": 5967.335 }, { "epoch": 0.39098850574712646, "grad_norm": 0.7725966572761536, "learning_rate": 0.00016108963740106756, "loss": 2.0763, "num_input_tokens_seen": 6397264, "step": 1063, "train_runtime": 1072.0502, "train_tokens_per_second": 5967.318 }, { "epoch": 0.3913563218390805, "grad_norm": 0.7412512302398682, "learning_rate": 0.00016105282532670717, "loss": 1.907, "num_input_tokens_seen": 6404256, "step": 1064, "train_runtime": 1073.1526, "train_tokens_per_second": 5967.703 }, { "epoch": 0.3917241379310345, "grad_norm": 0.7671145796775818, "learning_rate": 0.00016101601325234678, "loss": 1.8035, "num_input_tokens_seen": 6411408, "step": 1065, "train_runtime": 1074.269, "train_tokens_per_second": 5968.159 }, { "epoch": 0.3920919540229885, "grad_norm": 0.8039507269859314, "learning_rate": 0.00016097920117798638, "loss": 1.8796, "num_input_tokens_seen": 6417072, "step": 1066, "train_runtime": 1075.2024, "train_tokens_per_second": 5968.246 }, { "epoch": 0.39245977011494254, "grad_norm": 0.7322057485580444, "learning_rate": 0.000160942389103626, "loss": 1.749, "num_input_tokens_seen": 6422688, "step": 1067, "train_runtime": 1076.1319, "train_tokens_per_second": 5968.31 }, { "epoch": 0.39282758620689656, "grad_norm": 0.6617266535758972, "learning_rate": 0.0001609055770292656, "loss": 1.7367, "num_input_tokens_seen": 6427840, "step": 1068, "train_runtime": 1076.9937, "train_tokens_per_second": 5968.317 }, { "epoch": 0.3931954022988506, "grad_norm": 0.7284842729568481, "learning_rate": 0.0001608687649549052, "loss": 1.7965, "num_input_tokens_seen": 6433408, "step": 1069, "train_runtime": 1077.9227, "train_tokens_per_second": 5968.339 }, { "epoch": 0.3935632183908046, "grad_norm": 0.6676843762397766, "learning_rate": 0.00016083195288054482, "loss": 1.8287, "num_input_tokens_seen": 6438688, "step": 1070, "train_runtime": 1078.8253, "train_tokens_per_second": 5968.24 }, { "epoch": 0.3939310344827586, "grad_norm": 0.6924183368682861, "learning_rate": 0.00016079514080618443, "loss": 1.7203, "num_input_tokens_seen": 6444512, "step": 1071, "train_runtime": 1079.7658, "train_tokens_per_second": 5968.435 }, { "epoch": 0.39429885057471264, "grad_norm": 0.6839929223060608, "learning_rate": 0.00016075832873182404, "loss": 1.6592, "num_input_tokens_seen": 6452320, "step": 1072, "train_runtime": 1081.0073, "train_tokens_per_second": 5968.803 }, { "epoch": 0.39466666666666667, "grad_norm": 0.6901578307151794, "learning_rate": 0.00016072151665746367, "loss": 1.6968, "num_input_tokens_seen": 6457808, "step": 1073, "train_runtime": 1081.9116, "train_tokens_per_second": 5968.887 }, { "epoch": 0.3950344827586207, "grad_norm": 0.6019689440727234, "learning_rate": 0.00016068470458310328, "loss": 1.5991, "num_input_tokens_seen": 6466832, "step": 1074, "train_runtime": 1083.3273, "train_tokens_per_second": 5969.416 }, { "epoch": 0.3954022988505747, "grad_norm": 0.7549545168876648, "learning_rate": 0.0001606478925087429, "loss": 1.7192, "num_input_tokens_seen": 6473312, "step": 1075, "train_runtime": 1084.396, "train_tokens_per_second": 5969.509 }, { "epoch": 0.39577011494252873, "grad_norm": 0.6868123412132263, "learning_rate": 0.0001606110804343825, "loss": 1.7076, "num_input_tokens_seen": 6479952, "step": 1076, "train_runtime": 1085.4428, "train_tokens_per_second": 5969.87 }, { "epoch": 0.39613793103448275, "grad_norm": 0.723551332950592, "learning_rate": 0.00016057426836002208, "loss": 1.9025, "num_input_tokens_seen": 6484832, "step": 1077, "train_runtime": 1086.2811, "train_tokens_per_second": 5969.755 }, { "epoch": 0.39650574712643677, "grad_norm": 0.7306846380233765, "learning_rate": 0.0001605374562856617, "loss": 1.8355, "num_input_tokens_seen": 6489952, "step": 1078, "train_runtime": 1087.1472, "train_tokens_per_second": 5969.708 }, { "epoch": 0.3968735632183908, "grad_norm": 0.8239873647689819, "learning_rate": 0.0001605006442113013, "loss": 1.9526, "num_input_tokens_seen": 6495088, "step": 1079, "train_runtime": 1088.0027, "train_tokens_per_second": 5969.735 }, { "epoch": 0.3972413793103448, "grad_norm": 0.6149707436561584, "learning_rate": 0.0001604638321369409, "loss": 1.7006, "num_input_tokens_seen": 6502224, "step": 1080, "train_runtime": 1089.1528, "train_tokens_per_second": 5969.983 }, { "epoch": 0.39760919540229883, "grad_norm": 0.7983827590942383, "learning_rate": 0.00016042702006258052, "loss": 1.6715, "num_input_tokens_seen": 6509520, "step": 1081, "train_runtime": 1090.7871, "train_tokens_per_second": 5967.727 }, { "epoch": 0.39797701149425285, "grad_norm": 0.7142229676246643, "learning_rate": 0.00016039020798822015, "loss": 1.7298, "num_input_tokens_seen": 6515424, "step": 1082, "train_runtime": 1091.7569, "train_tokens_per_second": 5967.834 }, { "epoch": 0.3983448275862069, "grad_norm": 0.6892955899238586, "learning_rate": 0.00016035339591385976, "loss": 1.7871, "num_input_tokens_seen": 6521200, "step": 1083, "train_runtime": 1092.7271, "train_tokens_per_second": 5967.821 }, { "epoch": 0.3987126436781609, "grad_norm": 0.7192055583000183, "learning_rate": 0.00016031658383949937, "loss": 1.8794, "num_input_tokens_seen": 6526944, "step": 1084, "train_runtime": 1093.6546, "train_tokens_per_second": 5968.012 }, { "epoch": 0.3990804597701149, "grad_norm": 0.7291635870933533, "learning_rate": 0.00016027977176513898, "loss": 1.8011, "num_input_tokens_seen": 6532528, "step": 1085, "train_runtime": 1094.5757, "train_tokens_per_second": 5968.091 }, { "epoch": 0.399448275862069, "grad_norm": 0.8123181462287903, "learning_rate": 0.0001602429596907786, "loss": 1.7672, "num_input_tokens_seen": 6538192, "step": 1086, "train_runtime": 1095.4815, "train_tokens_per_second": 5968.327 }, { "epoch": 0.399816091954023, "grad_norm": 0.7394521832466125, "learning_rate": 0.0001602061476164182, "loss": 1.5855, "num_input_tokens_seen": 6543408, "step": 1087, "train_runtime": 1096.3395, "train_tokens_per_second": 5968.414 }, { "epoch": 0.40018390804597703, "grad_norm": 0.7159187197685242, "learning_rate": 0.0001601693355420578, "loss": 1.7338, "num_input_tokens_seen": 6547760, "step": 1088, "train_runtime": 1097.0872, "train_tokens_per_second": 5968.313 }, { "epoch": 0.40018390804597703, "eval_loss": 1.8306975364685059, "eval_runtime": 4.7834, "eval_samples_per_second": 209.057, "eval_steps_per_second": 13.171, "num_input_tokens_seen": 6547760, "step": 1088 }, { "epoch": 0.40055172413793105, "grad_norm": 0.7736802697181702, "learning_rate": 0.00016013252346769742, "loss": 1.8055, "num_input_tokens_seen": 6552768, "step": 1089, "train_runtime": 1102.6923, "train_tokens_per_second": 5942.517 }, { "epoch": 0.4009195402298851, "grad_norm": 0.6520863175392151, "learning_rate": 0.00016009571139333702, "loss": 1.7862, "num_input_tokens_seen": 6564096, "step": 1090, "train_runtime": 1104.3888, "train_tokens_per_second": 5943.646 }, { "epoch": 0.4012873563218391, "grad_norm": 0.7434893250465393, "learning_rate": 0.00016005889931897663, "loss": 1.8366, "num_input_tokens_seen": 6568880, "step": 1091, "train_runtime": 1105.2165, "train_tokens_per_second": 5943.523 }, { "epoch": 0.4016551724137931, "grad_norm": 0.8334950804710388, "learning_rate": 0.00016002208724461624, "loss": 1.8302, "num_input_tokens_seen": 6574672, "step": 1092, "train_runtime": 1106.1654, "train_tokens_per_second": 5943.661 }, { "epoch": 0.40202298850574714, "grad_norm": 0.7248815298080444, "learning_rate": 0.00015998527517025585, "loss": 1.8074, "num_input_tokens_seen": 6580928, "step": 1093, "train_runtime": 1107.199, "train_tokens_per_second": 5943.763 }, { "epoch": 0.40239080459770116, "grad_norm": 0.7552504539489746, "learning_rate": 0.00015994846309589546, "loss": 1.8307, "num_input_tokens_seen": 6586688, "step": 1094, "train_runtime": 1108.1567, "train_tokens_per_second": 5943.824 }, { "epoch": 0.4027586206896552, "grad_norm": 0.769370436668396, "learning_rate": 0.00015991165102153507, "loss": 1.8785, "num_input_tokens_seen": 6591680, "step": 1095, "train_runtime": 1109.0078, "train_tokens_per_second": 5943.764 }, { "epoch": 0.4031264367816092, "grad_norm": 0.7354795932769775, "learning_rate": 0.00015987483894717468, "loss": 1.6408, "num_input_tokens_seen": 6597776, "step": 1096, "train_runtime": 1109.9971, "train_tokens_per_second": 5943.958 }, { "epoch": 0.4034942528735632, "grad_norm": 0.6922746896743774, "learning_rate": 0.0001598380268728143, "loss": 1.5582, "num_input_tokens_seen": 6604368, "step": 1097, "train_runtime": 1111.0385, "train_tokens_per_second": 5944.32 }, { "epoch": 0.40386206896551724, "grad_norm": 0.7460592985153198, "learning_rate": 0.0001598012147984539, "loss": 1.7108, "num_input_tokens_seen": 6611648, "step": 1098, "train_runtime": 1112.1915, "train_tokens_per_second": 5944.703 }, { "epoch": 0.40422988505747126, "grad_norm": 0.7240821123123169, "learning_rate": 0.00015976440272409353, "loss": 1.9362, "num_input_tokens_seen": 6616320, "step": 1099, "train_runtime": 1112.9966, "train_tokens_per_second": 5944.6 }, { "epoch": 0.4045977011494253, "grad_norm": 0.6838738322257996, "learning_rate": 0.00015972759064973314, "loss": 1.7338, "num_input_tokens_seen": 6622736, "step": 1100, "train_runtime": 1114.0388, "train_tokens_per_second": 5944.798 }, { "epoch": 0.4049655172413793, "grad_norm": 0.7672039270401001, "learning_rate": 0.00015969077857537272, "loss": 1.7559, "num_input_tokens_seen": 6628288, "step": 1101, "train_runtime": 1114.9584, "train_tokens_per_second": 5944.875 }, { "epoch": 0.4053333333333333, "grad_norm": 0.6691837310791016, "learning_rate": 0.00015965396650101233, "loss": 1.8892, "num_input_tokens_seen": 6633152, "step": 1102, "train_runtime": 1115.7792, "train_tokens_per_second": 5944.861 }, { "epoch": 0.40570114942528734, "grad_norm": 0.6882882118225098, "learning_rate": 0.00015961715442665194, "loss": 1.5012, "num_input_tokens_seen": 6638368, "step": 1103, "train_runtime": 1116.6535, "train_tokens_per_second": 5944.877 }, { "epoch": 0.40606896551724136, "grad_norm": 0.7536081671714783, "learning_rate": 0.00015958034235229155, "loss": 1.859, "num_input_tokens_seen": 6643360, "step": 1104, "train_runtime": 1117.5014, "train_tokens_per_second": 5944.833 }, { "epoch": 0.4064367816091954, "grad_norm": 0.7524173259735107, "learning_rate": 0.00015954353027793116, "loss": 1.9479, "num_input_tokens_seen": 6649440, "step": 1105, "train_runtime": 1118.4891, "train_tokens_per_second": 5945.02 }, { "epoch": 0.4068045977011494, "grad_norm": 0.7337230443954468, "learning_rate": 0.00015950671820357077, "loss": 1.6217, "num_input_tokens_seen": 6654864, "step": 1106, "train_runtime": 1119.3704, "train_tokens_per_second": 5945.185 }, { "epoch": 0.4071724137931034, "grad_norm": 0.7187566161155701, "learning_rate": 0.00015946990612921038, "loss": 1.8053, "num_input_tokens_seen": 6659904, "step": 1107, "train_runtime": 1120.2256, "train_tokens_per_second": 5945.146 }, { "epoch": 0.40754022988505745, "grad_norm": 0.7533746361732483, "learning_rate": 0.00015943309405485, "loss": 1.9118, "num_input_tokens_seen": 6665152, "step": 1108, "train_runtime": 1121.095, "train_tokens_per_second": 5945.216 }, { "epoch": 0.40790804597701147, "grad_norm": 0.6869662404060364, "learning_rate": 0.00015939628198048962, "loss": 1.7787, "num_input_tokens_seen": 6671776, "step": 1109, "train_runtime": 1122.1691, "train_tokens_per_second": 5945.428 }, { "epoch": 0.40827586206896554, "grad_norm": 0.6175126433372498, "learning_rate": 0.00015935946990612923, "loss": 1.6665, "num_input_tokens_seen": 6678448, "step": 1110, "train_runtime": 1123.2485, "train_tokens_per_second": 5945.655 }, { "epoch": 0.40864367816091957, "grad_norm": 0.6928731799125671, "learning_rate": 0.00015932265783176884, "loss": 1.7474, "num_input_tokens_seen": 6682832, "step": 1111, "train_runtime": 1124.5231, "train_tokens_per_second": 5942.814 }, { "epoch": 0.4090114942528736, "grad_norm": 0.7784749269485474, "learning_rate": 0.00015928584575740845, "loss": 1.7744, "num_input_tokens_seen": 6691584, "step": 1112, "train_runtime": 1125.8423, "train_tokens_per_second": 5943.625 }, { "epoch": 0.4093793103448276, "grad_norm": 0.7535203099250793, "learning_rate": 0.00015924903368304806, "loss": 1.9865, "num_input_tokens_seen": 6696480, "step": 1113, "train_runtime": 1126.6933, "train_tokens_per_second": 5943.481 }, { "epoch": 0.40974712643678163, "grad_norm": 0.742264449596405, "learning_rate": 0.00015921222160868764, "loss": 1.7038, "num_input_tokens_seen": 6703424, "step": 1114, "train_runtime": 1127.7687, "train_tokens_per_second": 5943.971 }, { "epoch": 0.41011494252873565, "grad_norm": 0.6702042818069458, "learning_rate": 0.00015917540953432725, "loss": 1.7514, "num_input_tokens_seen": 6709552, "step": 1115, "train_runtime": 1128.7816, "train_tokens_per_second": 5944.066 }, { "epoch": 0.41048275862068967, "grad_norm": 0.7077691555023193, "learning_rate": 0.00015913859745996688, "loss": 1.6815, "num_input_tokens_seen": 6715024, "step": 1116, "train_runtime": 1129.6984, "train_tokens_per_second": 5944.086 }, { "epoch": 0.4108505747126437, "grad_norm": 0.721027672290802, "learning_rate": 0.0001591017853856065, "loss": 1.8057, "num_input_tokens_seen": 6722704, "step": 1117, "train_runtime": 1130.9179, "train_tokens_per_second": 5944.467 }, { "epoch": 0.4112183908045977, "grad_norm": 0.7421275973320007, "learning_rate": 0.0001590649733112461, "loss": 1.891, "num_input_tokens_seen": 6728304, "step": 1118, "train_runtime": 1131.8472, "train_tokens_per_second": 5944.534 }, { "epoch": 0.41158620689655173, "grad_norm": 0.7358080744743347, "learning_rate": 0.0001590281612368857, "loss": 2.0234, "num_input_tokens_seen": 6732848, "step": 1119, "train_runtime": 1132.641, "train_tokens_per_second": 5944.38 }, { "epoch": 0.41195402298850575, "grad_norm": 0.7264527082443237, "learning_rate": 0.00015899134916252532, "loss": 1.7717, "num_input_tokens_seen": 6739312, "step": 1120, "train_runtime": 1133.6756, "train_tokens_per_second": 5944.656 }, { "epoch": 0.4123218390804598, "grad_norm": 0.7438011169433594, "learning_rate": 0.00015895453708816493, "loss": 1.7899, "num_input_tokens_seen": 6744288, "step": 1121, "train_runtime": 1134.5032, "train_tokens_per_second": 5944.706 }, { "epoch": 0.4126896551724138, "grad_norm": 0.661270797252655, "learning_rate": 0.00015891772501380454, "loss": 1.6328, "num_input_tokens_seen": 6749808, "step": 1122, "train_runtime": 1135.4009, "train_tokens_per_second": 5944.867 }, { "epoch": 0.4130574712643678, "grad_norm": 0.7114384174346924, "learning_rate": 0.00015888091293944415, "loss": 1.8099, "num_input_tokens_seen": 6759184, "step": 1123, "train_runtime": 1136.8282, "train_tokens_per_second": 5945.651 }, { "epoch": 0.41342528735632184, "grad_norm": 0.6370521187782288, "learning_rate": 0.00015884410086508375, "loss": 1.8412, "num_input_tokens_seen": 6766272, "step": 1124, "train_runtime": 1137.9547, "train_tokens_per_second": 5945.994 }, { "epoch": 0.41379310344827586, "grad_norm": 0.7143312096595764, "learning_rate": 0.00015880728879072336, "loss": 1.7608, "num_input_tokens_seen": 6775456, "step": 1125, "train_runtime": 1139.335, "train_tokens_per_second": 5946.851 }, { "epoch": 0.4141609195402299, "grad_norm": 0.7388086915016174, "learning_rate": 0.00015877047671636297, "loss": 1.7346, "num_input_tokens_seen": 6781984, "step": 1126, "train_runtime": 1140.381, "train_tokens_per_second": 5947.121 }, { "epoch": 0.4145287356321839, "grad_norm": 0.7524212002754211, "learning_rate": 0.00015873366464200258, "loss": 1.6919, "num_input_tokens_seen": 6787872, "step": 1127, "train_runtime": 1141.332, "train_tokens_per_second": 5947.325 }, { "epoch": 0.4148965517241379, "grad_norm": 0.7130899429321289, "learning_rate": 0.0001586968525676422, "loss": 1.806, "num_input_tokens_seen": 6793824, "step": 1128, "train_runtime": 1142.2931, "train_tokens_per_second": 5947.531 }, { "epoch": 0.41526436781609194, "grad_norm": 0.7975853681564331, "learning_rate": 0.0001586600404932818, "loss": 1.7579, "num_input_tokens_seen": 6800096, "step": 1129, "train_runtime": 1143.2902, "train_tokens_per_second": 5947.83 }, { "epoch": 0.41563218390804596, "grad_norm": 0.8366739749908447, "learning_rate": 0.0001586232284189214, "loss": 1.8777, "num_input_tokens_seen": 6805184, "step": 1130, "train_runtime": 1144.1525, "train_tokens_per_second": 5947.795 }, { "epoch": 0.416, "grad_norm": 0.7377239465713501, "learning_rate": 0.00015858641634456102, "loss": 1.802, "num_input_tokens_seen": 6811600, "step": 1131, "train_runtime": 1145.2068, "train_tokens_per_second": 5947.922 }, { "epoch": 0.416367816091954, "grad_norm": 0.7626973986625671, "learning_rate": 0.00015854960427020063, "loss": 1.6195, "num_input_tokens_seen": 6817296, "step": 1132, "train_runtime": 1146.1491, "train_tokens_per_second": 5948.001 }, { "epoch": 0.416735632183908, "grad_norm": 0.6945323348045349, "learning_rate": 0.00015851279219584026, "loss": 1.7649, "num_input_tokens_seen": 6822800, "step": 1133, "train_runtime": 1147.0662, "train_tokens_per_second": 5948.044 }, { "epoch": 0.41710344827586204, "grad_norm": 0.7901187539100647, "learning_rate": 0.00015847598012147987, "loss": 1.9968, "num_input_tokens_seen": 6827472, "step": 1134, "train_runtime": 1147.8702, "train_tokens_per_second": 5947.948 }, { "epoch": 0.4174712643678161, "grad_norm": 0.6932904124259949, "learning_rate": 0.00015843916804711948, "loss": 1.5601, "num_input_tokens_seen": 6833984, "step": 1135, "train_runtime": 1148.9271, "train_tokens_per_second": 5948.144 }, { "epoch": 0.41783908045977014, "grad_norm": 0.6883950233459473, "learning_rate": 0.0001584023559727591, "loss": 1.6218, "num_input_tokens_seen": 6842144, "step": 1136, "train_runtime": 1150.2003, "train_tokens_per_second": 5948.654 }, { "epoch": 0.41820689655172416, "grad_norm": 0.7180618643760681, "learning_rate": 0.00015836554389839867, "loss": 1.7734, "num_input_tokens_seen": 6847104, "step": 1137, "train_runtime": 1151.0378, "train_tokens_per_second": 5948.635 }, { "epoch": 0.4185747126436782, "grad_norm": 0.7424864172935486, "learning_rate": 0.00015832873182403828, "loss": 1.6873, "num_input_tokens_seen": 6852384, "step": 1138, "train_runtime": 1151.9092, "train_tokens_per_second": 5948.719 }, { "epoch": 0.4189425287356322, "grad_norm": 0.7944812178611755, "learning_rate": 0.0001582919197496779, "loss": 1.8155, "num_input_tokens_seen": 6856832, "step": 1139, "train_runtime": 1152.6833, "train_tokens_per_second": 5948.583 }, { "epoch": 0.4193103448275862, "grad_norm": 0.6998050212860107, "learning_rate": 0.0001582551076753175, "loss": 1.7667, "num_input_tokens_seen": 6863344, "step": 1140, "train_runtime": 1153.7205, "train_tokens_per_second": 5948.88 }, { "epoch": 0.41967816091954024, "grad_norm": 0.6973651051521301, "learning_rate": 0.0001582182956009571, "loss": 1.7329, "num_input_tokens_seen": 6868304, "step": 1141, "train_runtime": 1155.0697, "train_tokens_per_second": 5946.225 }, { "epoch": 0.42004597701149426, "grad_norm": 0.630289614200592, "learning_rate": 0.00015818148352659674, "loss": 1.6378, "num_input_tokens_seen": 6876000, "step": 1142, "train_runtime": 1156.3029, "train_tokens_per_second": 5946.539 }, { "epoch": 0.4204137931034483, "grad_norm": 0.7176012396812439, "learning_rate": 0.00015814467145223635, "loss": 1.8841, "num_input_tokens_seen": 6880944, "step": 1143, "train_runtime": 1157.1493, "train_tokens_per_second": 5946.462 }, { "epoch": 0.4207816091954023, "grad_norm": 0.745722234249115, "learning_rate": 0.00015810785937787596, "loss": 1.8377, "num_input_tokens_seen": 6886272, "step": 1144, "train_runtime": 1158.0254, "train_tokens_per_second": 5946.564 }, { "epoch": 0.4211494252873563, "grad_norm": 0.7454776167869568, "learning_rate": 0.00015807104730351557, "loss": 1.712, "num_input_tokens_seen": 6892960, "step": 1145, "train_runtime": 1159.0973, "train_tokens_per_second": 5946.835 }, { "epoch": 0.42151724137931035, "grad_norm": 0.7079422473907471, "learning_rate": 0.00015803423522915518, "loss": 1.8538, "num_input_tokens_seen": 6897536, "step": 1146, "train_runtime": 1159.8874, "train_tokens_per_second": 5946.729 }, { "epoch": 0.42188505747126437, "grad_norm": 0.6785594820976257, "learning_rate": 0.00015799742315479479, "loss": 2.0154, "num_input_tokens_seen": 6904400, "step": 1147, "train_runtime": 1160.9871, "train_tokens_per_second": 5947.008 }, { "epoch": 0.4222528735632184, "grad_norm": 0.7744385600090027, "learning_rate": 0.0001579606110804344, "loss": 1.8655, "num_input_tokens_seen": 6909200, "step": 1148, "train_runtime": 1161.8083, "train_tokens_per_second": 5946.936 }, { "epoch": 0.4226206896551724, "grad_norm": 0.7387827634811401, "learning_rate": 0.000157923799006074, "loss": 1.5813, "num_input_tokens_seen": 6917760, "step": 1149, "train_runtime": 1163.1436, "train_tokens_per_second": 5947.469 }, { "epoch": 0.42298850574712643, "grad_norm": 0.7304776310920715, "learning_rate": 0.00015788698693171359, "loss": 1.7869, "num_input_tokens_seen": 6922528, "step": 1150, "train_runtime": 1163.9539, "train_tokens_per_second": 5947.424 }, { "epoch": 0.42335632183908045, "grad_norm": 0.7163875699043274, "learning_rate": 0.00015785017485735322, "loss": 1.7904, "num_input_tokens_seen": 6928816, "step": 1151, "train_runtime": 1164.957, "train_tokens_per_second": 5947.701 }, { "epoch": 0.4237241379310345, "grad_norm": 0.7661460041999817, "learning_rate": 0.00015781336278299283, "loss": 1.7905, "num_input_tokens_seen": 6934768, "step": 1152, "train_runtime": 1165.9195, "train_tokens_per_second": 5947.896 }, { "epoch": 0.4240919540229885, "grad_norm": 0.7766834497451782, "learning_rate": 0.00015777655070863244, "loss": 1.8882, "num_input_tokens_seen": 6941296, "step": 1153, "train_runtime": 1166.9715, "train_tokens_per_second": 5948.128 }, { "epoch": 0.4244597701149425, "grad_norm": 0.7434842586517334, "learning_rate": 0.00015773973863427205, "loss": 1.8711, "num_input_tokens_seen": 6946032, "step": 1154, "train_runtime": 1167.8031, "train_tokens_per_second": 5947.948 }, { "epoch": 0.42482758620689653, "grad_norm": 0.6683353781700134, "learning_rate": 0.00015770292655991166, "loss": 1.728, "num_input_tokens_seen": 6951536, "step": 1155, "train_runtime": 1168.7244, "train_tokens_per_second": 5947.969 }, { "epoch": 0.42519540229885056, "grad_norm": 0.7363720536231995, "learning_rate": 0.00015766611448555127, "loss": 1.9358, "num_input_tokens_seen": 6956624, "step": 1156, "train_runtime": 1169.5912, "train_tokens_per_second": 5947.911 }, { "epoch": 0.4255632183908046, "grad_norm": 0.8716381192207336, "learning_rate": 0.00015762930241119087, "loss": 1.9163, "num_input_tokens_seen": 6961200, "step": 1157, "train_runtime": 1170.3755, "train_tokens_per_second": 5947.835 }, { "epoch": 0.4259310344827586, "grad_norm": 0.7376092076301575, "learning_rate": 0.00015759249033683048, "loss": 1.8922, "num_input_tokens_seen": 6969904, "step": 1158, "train_runtime": 1171.7204, "train_tokens_per_second": 5948.436 }, { "epoch": 0.4262988505747126, "grad_norm": 0.7594170570373535, "learning_rate": 0.00015755567826247012, "loss": 1.7216, "num_input_tokens_seen": 6978448, "step": 1159, "train_runtime": 1173.0555, "train_tokens_per_second": 5948.949 }, { "epoch": 0.4266666666666667, "grad_norm": 0.6948701739311218, "learning_rate": 0.00015751886618810973, "loss": 1.8632, "num_input_tokens_seen": 6983824, "step": 1160, "train_runtime": 1173.9271, "train_tokens_per_second": 5949.112 }, { "epoch": 0.4270344827586207, "grad_norm": 0.7659474015235901, "learning_rate": 0.0001574820541137493, "loss": 1.8775, "num_input_tokens_seen": 6988672, "step": 1161, "train_runtime": 1174.742, "train_tokens_per_second": 5949.112 }, { "epoch": 0.42740229885057474, "grad_norm": 0.7262035608291626, "learning_rate": 0.00015744524203938892, "loss": 1.9307, "num_input_tokens_seen": 6994112, "step": 1162, "train_runtime": 1175.6527, "train_tokens_per_second": 5949.131 }, { "epoch": 0.42777011494252876, "grad_norm": 0.7716181874275208, "learning_rate": 0.00015740842996502853, "loss": 1.7776, "num_input_tokens_seen": 7000016, "step": 1163, "train_runtime": 1176.6114, "train_tokens_per_second": 5949.302 }, { "epoch": 0.4281379310344828, "grad_norm": 0.7339833378791809, "learning_rate": 0.00015737161789066814, "loss": 1.5997, "num_input_tokens_seen": 7004448, "step": 1164, "train_runtime": 1177.3954, "train_tokens_per_second": 5949.104 }, { "epoch": 0.4285057471264368, "grad_norm": 0.7201822996139526, "learning_rate": 0.00015733480581630775, "loss": 1.7873, "num_input_tokens_seen": 7009872, "step": 1165, "train_runtime": 1178.324, "train_tokens_per_second": 5949.019 }, { "epoch": 0.4288735632183908, "grad_norm": 0.6710172295570374, "learning_rate": 0.00015729799374194735, "loss": 1.6479, "num_input_tokens_seen": 7016064, "step": 1166, "train_runtime": 1179.3121, "train_tokens_per_second": 5949.285 }, { "epoch": 0.42924137931034484, "grad_norm": 0.6840474605560303, "learning_rate": 0.00015726118166758696, "loss": 1.7431, "num_input_tokens_seen": 7022592, "step": 1167, "train_runtime": 1180.3673, "train_tokens_per_second": 5949.497 }, { "epoch": 0.42960919540229886, "grad_norm": 0.7766196727752686, "learning_rate": 0.0001572243695932266, "loss": 1.8158, "num_input_tokens_seen": 7027392, "step": 1168, "train_runtime": 1181.1975, "train_tokens_per_second": 5949.379 }, { "epoch": 0.4299770114942529, "grad_norm": 0.7490355968475342, "learning_rate": 0.0001571875575188662, "loss": 1.6519, "num_input_tokens_seen": 7033136, "step": 1169, "train_runtime": 1182.1302, "train_tokens_per_second": 5949.544 }, { "epoch": 0.4303448275862069, "grad_norm": 0.6676395535469055, "learning_rate": 0.00015715074544450582, "loss": 1.723, "num_input_tokens_seen": 7040672, "step": 1170, "train_runtime": 1183.3206, "train_tokens_per_second": 5949.927 }, { "epoch": 0.4307126436781609, "grad_norm": 0.7282621264457703, "learning_rate": 0.00015711393337014543, "loss": 1.6321, "num_input_tokens_seen": 7050512, "step": 1171, "train_runtime": 1185.3117, "train_tokens_per_second": 5948.235 }, { "epoch": 0.43108045977011494, "grad_norm": 0.7242358326911926, "learning_rate": 0.00015707712129578504, "loss": 1.742, "num_input_tokens_seen": 7057584, "step": 1172, "train_runtime": 1186.4304, "train_tokens_per_second": 5948.587 }, { "epoch": 0.43144827586206896, "grad_norm": 0.6883956789970398, "learning_rate": 0.00015704030922142464, "loss": 1.8834, "num_input_tokens_seen": 7062576, "step": 1173, "train_runtime": 1187.2793, "train_tokens_per_second": 5948.538 }, { "epoch": 0.431816091954023, "grad_norm": 0.8219404220581055, "learning_rate": 0.00015700349714706423, "loss": 1.92, "num_input_tokens_seen": 7068176, "step": 1174, "train_runtime": 1188.2348, "train_tokens_per_second": 5948.467 }, { "epoch": 0.432183908045977, "grad_norm": 0.7037672996520996, "learning_rate": 0.00015696668507270383, "loss": 1.6727, "num_input_tokens_seen": 7076592, "step": 1175, "train_runtime": 1189.5587, "train_tokens_per_second": 5948.922 }, { "epoch": 0.432551724137931, "grad_norm": 0.7427977323532104, "learning_rate": 0.00015692987299834347, "loss": 1.9977, "num_input_tokens_seen": 7081856, "step": 1176, "train_runtime": 1190.4593, "train_tokens_per_second": 5948.843 }, { "epoch": 0.43291954022988505, "grad_norm": 0.7989617586135864, "learning_rate": 0.00015689306092398308, "loss": 1.9313, "num_input_tokens_seen": 7086752, "step": 1177, "train_runtime": 1191.2925, "train_tokens_per_second": 5948.792 }, { "epoch": 0.43328735632183907, "grad_norm": 0.6868744492530823, "learning_rate": 0.0001568562488496227, "loss": 1.773, "num_input_tokens_seen": 7093040, "step": 1178, "train_runtime": 1192.3264, "train_tokens_per_second": 5948.908 }, { "epoch": 0.4336551724137931, "grad_norm": 0.6020117402076721, "learning_rate": 0.0001568194367752623, "loss": 1.7855, "num_input_tokens_seen": 7100992, "step": 1179, "train_runtime": 1193.5809, "train_tokens_per_second": 5949.318 }, { "epoch": 0.4340229885057471, "grad_norm": 0.7079392671585083, "learning_rate": 0.0001567826247009019, "loss": 1.794, "num_input_tokens_seen": 7105536, "step": 1180, "train_runtime": 1194.3955, "train_tokens_per_second": 5949.064 }, { "epoch": 0.43439080459770113, "grad_norm": 0.7041069269180298, "learning_rate": 0.00015674581262654152, "loss": 1.563, "num_input_tokens_seen": 7111936, "step": 1181, "train_runtime": 1195.4164, "train_tokens_per_second": 5949.338 }, { "epoch": 0.43475862068965515, "grad_norm": 0.7512297034263611, "learning_rate": 0.00015670900055218112, "loss": 1.9535, "num_input_tokens_seen": 7120448, "step": 1182, "train_runtime": 1196.7516, "train_tokens_per_second": 5949.813 }, { "epoch": 0.43512643678160917, "grad_norm": 0.6693354845046997, "learning_rate": 0.00015667218847782073, "loss": 1.5134, "num_input_tokens_seen": 7124464, "step": 1183, "train_runtime": 1197.4808, "train_tokens_per_second": 5949.543 }, { "epoch": 0.4354942528735632, "grad_norm": 0.6892227530479431, "learning_rate": 0.00015663537640346034, "loss": 1.8114, "num_input_tokens_seen": 7130464, "step": 1184, "train_runtime": 1198.4515, "train_tokens_per_second": 5949.731 }, { "epoch": 0.43586206896551727, "grad_norm": 0.6748680472373962, "learning_rate": 0.00015659856432909995, "loss": 1.6574, "num_input_tokens_seen": 7137408, "step": 1185, "train_runtime": 1199.5737, "train_tokens_per_second": 5949.954 }, { "epoch": 0.4362298850574713, "grad_norm": 0.754496693611145, "learning_rate": 0.00015656175225473956, "loss": 1.7061, "num_input_tokens_seen": 7143168, "step": 1186, "train_runtime": 1200.5203, "train_tokens_per_second": 5950.06 }, { "epoch": 0.4365977011494253, "grad_norm": 0.8417204022407532, "learning_rate": 0.00015652494018037917, "loss": 1.9689, "num_input_tokens_seen": 7149392, "step": 1187, "train_runtime": 1201.5352, "train_tokens_per_second": 5950.214 }, { "epoch": 0.43696551724137933, "grad_norm": 0.7532899379730225, "learning_rate": 0.00015648812810601878, "loss": 1.7614, "num_input_tokens_seen": 7154256, "step": 1188, "train_runtime": 1202.3806, "train_tokens_per_second": 5950.076 }, { "epoch": 0.43733333333333335, "grad_norm": 0.7637757062911987, "learning_rate": 0.00015645131603165839, "loss": 1.7781, "num_input_tokens_seen": 7159488, "step": 1189, "train_runtime": 1203.2554, "train_tokens_per_second": 5950.098 }, { "epoch": 0.4377011494252874, "grad_norm": 0.8735445737838745, "learning_rate": 0.000156414503957298, "loss": 1.8605, "num_input_tokens_seen": 7165008, "step": 1190, "train_runtime": 1204.1588, "train_tokens_per_second": 5950.218 }, { "epoch": 0.4380689655172414, "grad_norm": 0.72004634141922, "learning_rate": 0.0001563776918829376, "loss": 1.6518, "num_input_tokens_seen": 7170848, "step": 1191, "train_runtime": 1205.1289, "train_tokens_per_second": 5950.275 }, { "epoch": 0.4384367816091954, "grad_norm": 0.784618079662323, "learning_rate": 0.0001563408798085772, "loss": 1.715, "num_input_tokens_seen": 7176080, "step": 1192, "train_runtime": 1205.9955, "train_tokens_per_second": 5950.337 }, { "epoch": 0.43880459770114943, "grad_norm": 0.7545187473297119, "learning_rate": 0.00015630406773421685, "loss": 1.8402, "num_input_tokens_seen": 7181872, "step": 1193, "train_runtime": 1206.9579, "train_tokens_per_second": 5950.391 }, { "epoch": 0.43917241379310346, "grad_norm": 0.765870213508606, "learning_rate": 0.00015626725565985646, "loss": 1.826, "num_input_tokens_seen": 7187712, "step": 1194, "train_runtime": 1207.9153, "train_tokens_per_second": 5950.51 }, { "epoch": 0.4395402298850575, "grad_norm": 0.8489959239959717, "learning_rate": 0.00015623044358549607, "loss": 1.6647, "num_input_tokens_seen": 7194144, "step": 1195, "train_runtime": 1208.9361, "train_tokens_per_second": 5950.806 }, { "epoch": 0.4399080459770115, "grad_norm": 0.7975943088531494, "learning_rate": 0.00015619363151113568, "loss": 2.0866, "num_input_tokens_seen": 7198864, "step": 1196, "train_runtime": 1209.7679, "train_tokens_per_second": 5950.616 }, { "epoch": 0.4402758620689655, "grad_norm": 0.7624548077583313, "learning_rate": 0.00015615681943677526, "loss": 1.7441, "num_input_tokens_seen": 7205072, "step": 1197, "train_runtime": 1210.7784, "train_tokens_per_second": 5950.777 }, { "epoch": 0.44064367816091954, "grad_norm": 0.7394261956214905, "learning_rate": 0.00015612000736241487, "loss": 1.7958, "num_input_tokens_seen": 7210240, "step": 1198, "train_runtime": 1211.6565, "train_tokens_per_second": 5950.73 }, { "epoch": 0.44101149425287356, "grad_norm": 0.7611791491508484, "learning_rate": 0.00015608319528805448, "loss": 1.8613, "num_input_tokens_seen": 7215296, "step": 1199, "train_runtime": 1212.5166, "train_tokens_per_second": 5950.678 }, { "epoch": 0.4413793103448276, "grad_norm": 0.6911492943763733, "learning_rate": 0.00015604638321369408, "loss": 1.7601, "num_input_tokens_seen": 7225104, "step": 1200, "train_runtime": 1214.0236, "train_tokens_per_second": 5951.37 }, { "epoch": 0.4417471264367816, "grad_norm": 0.7862719893455505, "learning_rate": 0.0001560095711393337, "loss": 1.753, "num_input_tokens_seen": 7231952, "step": 1201, "train_runtime": 1215.6237, "train_tokens_per_second": 5949.17 }, { "epoch": 0.4421149425287356, "grad_norm": 0.7533947825431824, "learning_rate": 0.00015597275906497333, "loss": 1.8045, "num_input_tokens_seen": 7237680, "step": 1202, "train_runtime": 1216.5692, "train_tokens_per_second": 5949.255 }, { "epoch": 0.44248275862068964, "grad_norm": 0.7339320182800293, "learning_rate": 0.00015593594699061294, "loss": 1.9346, "num_input_tokens_seen": 7243376, "step": 1203, "train_runtime": 1217.5381, "train_tokens_per_second": 5949.199 }, { "epoch": 0.44285057471264366, "grad_norm": 0.6699645519256592, "learning_rate": 0.00015589913491625255, "loss": 1.6096, "num_input_tokens_seen": 7249152, "step": 1204, "train_runtime": 1218.4953, "train_tokens_per_second": 5949.266 }, { "epoch": 0.4432183908045977, "grad_norm": 0.7506150007247925, "learning_rate": 0.00015586232284189216, "loss": 1.7413, "num_input_tokens_seen": 7255808, "step": 1205, "train_runtime": 1219.5746, "train_tokens_per_second": 5949.458 }, { "epoch": 0.4435862068965517, "grad_norm": 0.7534520030021667, "learning_rate": 0.00015582551076753176, "loss": 1.8262, "num_input_tokens_seen": 7260432, "step": 1206, "train_runtime": 1220.3457, "train_tokens_per_second": 5949.488 }, { "epoch": 0.4439540229885057, "grad_norm": 0.7158861756324768, "learning_rate": 0.00015578869869317137, "loss": 1.9487, "num_input_tokens_seen": 7265024, "step": 1207, "train_runtime": 1221.1488, "train_tokens_per_second": 5949.336 }, { "epoch": 0.44432183908045975, "grad_norm": 0.7745321989059448, "learning_rate": 0.00015575188661881098, "loss": 1.7816, "num_input_tokens_seen": 7270432, "step": 1208, "train_runtime": 1222.0681, "train_tokens_per_second": 5949.286 }, { "epoch": 0.44468965517241377, "grad_norm": 0.743904709815979, "learning_rate": 0.0001557150745444506, "loss": 1.8334, "num_input_tokens_seen": 7275296, "step": 1209, "train_runtime": 1222.8908, "train_tokens_per_second": 5949.261 }, { "epoch": 0.44505747126436784, "grad_norm": 0.7275137305259705, "learning_rate": 0.00015567826247009017, "loss": 1.6622, "num_input_tokens_seen": 7281088, "step": 1210, "train_runtime": 1223.8488, "train_tokens_per_second": 5949.336 }, { "epoch": 0.44542528735632186, "grad_norm": 0.7486593723297119, "learning_rate": 0.0001556414503957298, "loss": 1.7694, "num_input_tokens_seen": 7292704, "step": 1211, "train_runtime": 1225.6052, "train_tokens_per_second": 5950.288 }, { "epoch": 0.4457931034482759, "grad_norm": 0.7362422943115234, "learning_rate": 0.00015560463832136942, "loss": 1.8745, "num_input_tokens_seen": 7297536, "step": 1212, "train_runtime": 1226.4411, "train_tokens_per_second": 5950.173 }, { "epoch": 0.4461609195402299, "grad_norm": 0.658754825592041, "learning_rate": 0.00015556782624700903, "loss": 1.6796, "num_input_tokens_seen": 7304240, "step": 1213, "train_runtime": 1227.5015, "train_tokens_per_second": 5950.494 }, { "epoch": 0.4465287356321839, "grad_norm": 0.7258212566375732, "learning_rate": 0.00015553101417264864, "loss": 1.8287, "num_input_tokens_seen": 7310704, "step": 1214, "train_runtime": 1228.5276, "train_tokens_per_second": 5950.786 }, { "epoch": 0.44689655172413795, "grad_norm": 0.8535351753234863, "learning_rate": 0.00015549420209828824, "loss": 1.8639, "num_input_tokens_seen": 7314928, "step": 1215, "train_runtime": 1229.2914, "train_tokens_per_second": 5950.524 }, { "epoch": 0.44726436781609197, "grad_norm": 0.7198713421821594, "learning_rate": 0.00015545739002392785, "loss": 1.7436, "num_input_tokens_seen": 7319600, "step": 1216, "train_runtime": 1230.0666, "train_tokens_per_second": 5950.572 }, { "epoch": 0.447632183908046, "grad_norm": 0.8227468132972717, "learning_rate": 0.00015542057794956746, "loss": 1.8286, "num_input_tokens_seen": 7327216, "step": 1217, "train_runtime": 1231.2571, "train_tokens_per_second": 5951.004 }, { "epoch": 0.448, "grad_norm": 0.7701994776725769, "learning_rate": 0.00015538376587520707, "loss": 1.7154, "num_input_tokens_seen": 7333424, "step": 1218, "train_runtime": 1232.2851, "train_tokens_per_second": 5951.078 }, { "epoch": 0.44836781609195403, "grad_norm": 0.7645250558853149, "learning_rate": 0.0001553469538008467, "loss": 1.6711, "num_input_tokens_seen": 7339216, "step": 1219, "train_runtime": 1233.2616, "train_tokens_per_second": 5951.062 }, { "epoch": 0.44873563218390805, "grad_norm": 0.6568512916564941, "learning_rate": 0.0001553101417264863, "loss": 1.7855, "num_input_tokens_seen": 7347520, "step": 1220, "train_runtime": 1234.5633, "train_tokens_per_second": 5951.513 }, { "epoch": 0.44910344827586207, "grad_norm": 0.7112115621566772, "learning_rate": 0.0001552733296521259, "loss": 1.9502, "num_input_tokens_seen": 7352064, "step": 1221, "train_runtime": 1235.3536, "train_tokens_per_second": 5951.384 }, { "epoch": 0.4494712643678161, "grad_norm": 0.7758644819259644, "learning_rate": 0.0001552365175777655, "loss": 1.874, "num_input_tokens_seen": 7356480, "step": 1222, "train_runtime": 1236.1272, "train_tokens_per_second": 5951.232 }, { "epoch": 0.4498390804597701, "grad_norm": 0.7849825620651245, "learning_rate": 0.00015519970550340512, "loss": 1.7783, "num_input_tokens_seen": 7361136, "step": 1223, "train_runtime": 1236.9524, "train_tokens_per_second": 5951.026 }, { "epoch": 0.45020689655172413, "grad_norm": 0.799024760723114, "learning_rate": 0.00015516289342904472, "loss": 1.7842, "num_input_tokens_seen": 7365520, "step": 1224, "train_runtime": 1237.6999, "train_tokens_per_second": 5950.974 }, { "epoch": 0.45057471264367815, "grad_norm": 0.7010101079940796, "learning_rate": 0.00015512608135468433, "loss": 1.7123, "num_input_tokens_seen": 7375312, "step": 1225, "train_runtime": 1239.2089, "train_tokens_per_second": 5951.629 }, { "epoch": 0.4509425287356322, "grad_norm": 0.7189601063728333, "learning_rate": 0.00015508926928032394, "loss": 1.9222, "num_input_tokens_seen": 7380256, "step": 1226, "train_runtime": 1240.0504, "train_tokens_per_second": 5951.578 }, { "epoch": 0.4513103448275862, "grad_norm": 0.7187652587890625, "learning_rate": 0.00015505245720596355, "loss": 1.6839, "num_input_tokens_seen": 7385632, "step": 1227, "train_runtime": 1240.9305, "train_tokens_per_second": 5951.689 }, { "epoch": 0.4516781609195402, "grad_norm": 0.8691778779029846, "learning_rate": 0.0001550156451316032, "loss": 1.8125, "num_input_tokens_seen": 7390368, "step": 1228, "train_runtime": 1241.7399, "train_tokens_per_second": 5951.623 }, { "epoch": 0.45204597701149424, "grad_norm": 0.7041910886764526, "learning_rate": 0.0001549788330572428, "loss": 1.9237, "num_input_tokens_seen": 7395872, "step": 1229, "train_runtime": 1242.659, "train_tokens_per_second": 5951.65 }, { "epoch": 0.45241379310344826, "grad_norm": 0.7146864533424377, "learning_rate": 0.0001549420209828824, "loss": 1.6705, "num_input_tokens_seen": 7403504, "step": 1230, "train_runtime": 1243.835, "train_tokens_per_second": 5952.159 }, { "epoch": 0.4527816091954023, "grad_norm": 0.7021743655204773, "learning_rate": 0.00015490520890852201, "loss": 1.5599, "num_input_tokens_seen": 7409776, "step": 1231, "train_runtime": 1245.342, "train_tokens_per_second": 5949.993 }, { "epoch": 0.4531494252873563, "grad_norm": 0.7877197265625, "learning_rate": 0.00015486839683416162, "loss": 2.0735, "num_input_tokens_seen": 7414736, "step": 1232, "train_runtime": 1246.1915, "train_tokens_per_second": 5949.917 }, { "epoch": 0.4535172413793103, "grad_norm": 0.8014360070228577, "learning_rate": 0.00015483158475980123, "loss": 1.9159, "num_input_tokens_seen": 7424320, "step": 1233, "train_runtime": 1247.6426, "train_tokens_per_second": 5950.679 }, { "epoch": 0.45388505747126434, "grad_norm": 0.7110464572906494, "learning_rate": 0.0001547947726854408, "loss": 1.8617, "num_input_tokens_seen": 7429328, "step": 1234, "train_runtime": 1248.4905, "train_tokens_per_second": 5950.649 }, { "epoch": 0.4542528735632184, "grad_norm": 0.7932233810424805, "learning_rate": 0.00015475796061108042, "loss": 2.0679, "num_input_tokens_seen": 7433936, "step": 1235, "train_runtime": 1249.2881, "train_tokens_per_second": 5950.538 }, { "epoch": 0.45462068965517244, "grad_norm": 0.641743004322052, "learning_rate": 0.00015472114853672006, "loss": 1.7498, "num_input_tokens_seen": 7441360, "step": 1236, "train_runtime": 1250.4701, "train_tokens_per_second": 5950.85 }, { "epoch": 0.45498850574712646, "grad_norm": 0.6838722825050354, "learning_rate": 0.00015468433646235967, "loss": 1.9534, "num_input_tokens_seen": 7446112, "step": 1237, "train_runtime": 1251.2728, "train_tokens_per_second": 5950.83 }, { "epoch": 0.4553563218390805, "grad_norm": 0.6989526152610779, "learning_rate": 0.00015464752438799928, "loss": 1.7391, "num_input_tokens_seen": 7452720, "step": 1238, "train_runtime": 1252.3217, "train_tokens_per_second": 5951.123 }, { "epoch": 0.4557241379310345, "grad_norm": 0.7069482803344727, "learning_rate": 0.00015461071231363889, "loss": 1.6438, "num_input_tokens_seen": 7460480, "step": 1239, "train_runtime": 1253.5605, "train_tokens_per_second": 5951.432 }, { "epoch": 0.4560919540229885, "grad_norm": 0.8050363063812256, "learning_rate": 0.0001545739002392785, "loss": 1.8958, "num_input_tokens_seen": 7465232, "step": 1240, "train_runtime": 1254.3919, "train_tokens_per_second": 5951.276 }, { "epoch": 0.45645977011494254, "grad_norm": 0.7380297780036926, "learning_rate": 0.0001545370881649181, "loss": 1.8833, "num_input_tokens_seen": 7472992, "step": 1241, "train_runtime": 1255.6188, "train_tokens_per_second": 5951.641 }, { "epoch": 0.45682758620689656, "grad_norm": 0.7242332100868225, "learning_rate": 0.0001545002760905577, "loss": 1.7404, "num_input_tokens_seen": 7477664, "step": 1242, "train_runtime": 1256.4113, "train_tokens_per_second": 5951.605 }, { "epoch": 0.4571954022988506, "grad_norm": 0.7481887936592102, "learning_rate": 0.00015446346401619732, "loss": 2.011, "num_input_tokens_seen": 7482560, "step": 1243, "train_runtime": 1257.2501, "train_tokens_per_second": 5951.529 }, { "epoch": 0.4575632183908046, "grad_norm": 0.6763362288475037, "learning_rate": 0.00015442665194183693, "loss": 1.7012, "num_input_tokens_seen": 7489152, "step": 1244, "train_runtime": 1258.3283, "train_tokens_per_second": 5951.668 }, { "epoch": 0.4579310344827586, "grad_norm": 0.7744765281677246, "learning_rate": 0.00015438983986747654, "loss": 1.8941, "num_input_tokens_seen": 7496928, "step": 1245, "train_runtime": 1259.5245, "train_tokens_per_second": 5952.189 }, { "epoch": 0.45829885057471265, "grad_norm": 0.6633315682411194, "learning_rate": 0.00015435302779311615, "loss": 1.6114, "num_input_tokens_seen": 7503776, "step": 1246, "train_runtime": 1260.6242, "train_tokens_per_second": 5952.429 }, { "epoch": 0.45866666666666667, "grad_norm": 0.7456023097038269, "learning_rate": 0.00015431621571875576, "loss": 1.7191, "num_input_tokens_seen": 7507968, "step": 1247, "train_runtime": 1261.355, "train_tokens_per_second": 5952.304 }, { "epoch": 0.4590344827586207, "grad_norm": 0.7540046572685242, "learning_rate": 0.00015427940364439537, "loss": 1.797, "num_input_tokens_seen": 7512928, "step": 1248, "train_runtime": 1262.2075, "train_tokens_per_second": 5952.213 }, { "epoch": 0.4594022988505747, "grad_norm": 0.6673805713653564, "learning_rate": 0.00015424259157003497, "loss": 1.7042, "num_input_tokens_seen": 7520000, "step": 1249, "train_runtime": 1263.3601, "train_tokens_per_second": 5952.381 }, { "epoch": 0.45977011494252873, "grad_norm": 0.7562255859375, "learning_rate": 0.00015420577949567458, "loss": 1.915, "num_input_tokens_seen": 7526640, "step": 1250, "train_runtime": 1264.4259, "train_tokens_per_second": 5952.615 }, { "epoch": 0.46013793103448275, "grad_norm": 0.7367727160453796, "learning_rate": 0.0001541689674213142, "loss": 1.9246, "num_input_tokens_seen": 7533120, "step": 1251, "train_runtime": 1265.5062, "train_tokens_per_second": 5952.654 }, { "epoch": 0.46050574712643677, "grad_norm": 0.7032127380371094, "learning_rate": 0.0001541321553469538, "loss": 1.7504, "num_input_tokens_seen": 7541296, "step": 1252, "train_runtime": 1266.8118, "train_tokens_per_second": 5952.973 }, { "epoch": 0.4608735632183908, "grad_norm": 0.7035644054412842, "learning_rate": 0.00015409534327259344, "loss": 1.8283, "num_input_tokens_seen": 7546064, "step": 1253, "train_runtime": 1267.6159, "train_tokens_per_second": 5952.958 }, { "epoch": 0.4612413793103448, "grad_norm": 0.7468724250793457, "learning_rate": 0.00015405853119823305, "loss": 1.8595, "num_input_tokens_seen": 7551648, "step": 1254, "train_runtime": 1268.5227, "train_tokens_per_second": 5953.104 }, { "epoch": 0.46160919540229883, "grad_norm": 0.7778677940368652, "learning_rate": 0.00015402171912387265, "loss": 1.8202, "num_input_tokens_seen": 7558864, "step": 1255, "train_runtime": 1269.6841, "train_tokens_per_second": 5953.342 }, { "epoch": 0.46197701149425285, "grad_norm": 0.6948017477989197, "learning_rate": 0.00015398490704951226, "loss": 1.8597, "num_input_tokens_seen": 7563968, "step": 1256, "train_runtime": 1270.5369, "train_tokens_per_second": 5953.364 }, { "epoch": 0.4623448275862069, "grad_norm": 0.7547342777252197, "learning_rate": 0.00015394809497515185, "loss": 1.7094, "num_input_tokens_seen": 7568784, "step": 1257, "train_runtime": 1271.3599, "train_tokens_per_second": 5953.298 }, { "epoch": 0.4627126436781609, "grad_norm": 0.7779310941696167, "learning_rate": 0.00015391128290079145, "loss": 1.8208, "num_input_tokens_seen": 7573456, "step": 1258, "train_runtime": 1272.1845, "train_tokens_per_second": 5953.111 }, { "epoch": 0.4630804597701149, "grad_norm": 0.736392617225647, "learning_rate": 0.00015387447082643106, "loss": 1.6906, "num_input_tokens_seen": 7578064, "step": 1259, "train_runtime": 1272.9577, "train_tokens_per_second": 5953.115 }, { "epoch": 0.463448275862069, "grad_norm": 0.6372681260108948, "learning_rate": 0.00015383765875207067, "loss": 1.8011, "num_input_tokens_seen": 7583200, "step": 1260, "train_runtime": 1273.8091, "train_tokens_per_second": 5953.168 }, { "epoch": 0.463816091954023, "grad_norm": 0.7548249363899231, "learning_rate": 0.00015380084667771028, "loss": 1.9357, "num_input_tokens_seen": 7593792, "step": 1261, "train_runtime": 1275.9045, "train_tokens_per_second": 5951.693 }, { "epoch": 0.46418390804597703, "grad_norm": 0.7687066793441772, "learning_rate": 0.00015376403460334992, "loss": 1.7145, "num_input_tokens_seen": 7600304, "step": 1262, "train_runtime": 1276.9643, "train_tokens_per_second": 5951.853 }, { "epoch": 0.46455172413793105, "grad_norm": 0.6674917936325073, "learning_rate": 0.00015372722252898953, "loss": 1.6502, "num_input_tokens_seen": 7607616, "step": 1263, "train_runtime": 1278.1101, "train_tokens_per_second": 5952.238 }, { "epoch": 0.4649195402298851, "grad_norm": 0.7151092886924744, "learning_rate": 0.00015369041045462913, "loss": 1.8285, "num_input_tokens_seen": 7612368, "step": 1264, "train_runtime": 1278.9395, "train_tokens_per_second": 5952.094 }, { "epoch": 0.4652873563218391, "grad_norm": 0.7578483819961548, "learning_rate": 0.00015365359838026874, "loss": 1.8126, "num_input_tokens_seen": 7617424, "step": 1265, "train_runtime": 1279.8069, "train_tokens_per_second": 5952.011 }, { "epoch": 0.4656551724137931, "grad_norm": 0.7614312767982483, "learning_rate": 0.00015361678630590835, "loss": 1.7758, "num_input_tokens_seen": 7625232, "step": 1266, "train_runtime": 1281.0303, "train_tokens_per_second": 5952.421 }, { "epoch": 0.46602298850574714, "grad_norm": 0.7852227687835693, "learning_rate": 0.00015357997423154796, "loss": 1.5556, "num_input_tokens_seen": 7631440, "step": 1267, "train_runtime": 1282.0452, "train_tokens_per_second": 5952.552 }, { "epoch": 0.46639080459770116, "grad_norm": 0.7623286843299866, "learning_rate": 0.00015354316215718757, "loss": 2.0483, "num_input_tokens_seen": 7636320, "step": 1268, "train_runtime": 1282.8609, "train_tokens_per_second": 5952.57 }, { "epoch": 0.4667586206896552, "grad_norm": 0.7269994616508484, "learning_rate": 0.00015350635008282718, "loss": 1.8532, "num_input_tokens_seen": 7641104, "step": 1269, "train_runtime": 1283.694, "train_tokens_per_second": 5952.434 }, { "epoch": 0.4671264367816092, "grad_norm": 0.7663736343383789, "learning_rate": 0.0001534695380084668, "loss": 1.7431, "num_input_tokens_seen": 7645760, "step": 1270, "train_runtime": 1284.4938, "train_tokens_per_second": 5952.353 }, { "epoch": 0.4674942528735632, "grad_norm": 0.6806995868682861, "learning_rate": 0.0001534327259341064, "loss": 1.7246, "num_input_tokens_seen": 7650608, "step": 1271, "train_runtime": 1285.3396, "train_tokens_per_second": 5952.207 }, { "epoch": 0.46786206896551724, "grad_norm": 0.7199662923812866, "learning_rate": 0.000153395913859746, "loss": 1.7299, "num_input_tokens_seen": 7657392, "step": 1272, "train_runtime": 1286.441, "train_tokens_per_second": 5952.385 }, { "epoch": 0.46822988505747126, "grad_norm": 0.7160378694534302, "learning_rate": 0.00015335910178538561, "loss": 1.7186, "num_input_tokens_seen": 7662368, "step": 1273, "train_runtime": 1287.2697, "train_tokens_per_second": 5952.418 }, { "epoch": 0.4685977011494253, "grad_norm": 0.7738577723503113, "learning_rate": 0.00015332228971102522, "loss": 1.8797, "num_input_tokens_seen": 7667728, "step": 1274, "train_runtime": 1288.1874, "train_tokens_per_second": 5952.339 }, { "epoch": 0.4689655172413793, "grad_norm": 0.8060719966888428, "learning_rate": 0.00015328547763666483, "loss": 1.8157, "num_input_tokens_seen": 7672352, "step": 1275, "train_runtime": 1288.987, "train_tokens_per_second": 5952.234 }, { "epoch": 0.4693333333333333, "grad_norm": 0.7524076700210571, "learning_rate": 0.00015324866556230444, "loss": 1.8068, "num_input_tokens_seen": 7676912, "step": 1276, "train_runtime": 1289.7771, "train_tokens_per_second": 5952.123 }, { "epoch": 0.46970114942528735, "grad_norm": 0.7522364258766174, "learning_rate": 0.00015321185348794405, "loss": 1.6173, "num_input_tokens_seen": 7682224, "step": 1277, "train_runtime": 1290.6579, "train_tokens_per_second": 5952.177 }, { "epoch": 0.47006896551724137, "grad_norm": 0.6947898864746094, "learning_rate": 0.00015317504141358366, "loss": 1.7595, "num_input_tokens_seen": 7689296, "step": 1278, "train_runtime": 1291.8022, "train_tokens_per_second": 5952.379 }, { "epoch": 0.4704367816091954, "grad_norm": 0.7850360870361328, "learning_rate": 0.0001531382293392233, "loss": 1.7286, "num_input_tokens_seen": 7693856, "step": 1279, "train_runtime": 1292.5775, "train_tokens_per_second": 5952.336 }, { "epoch": 0.4708045977011494, "grad_norm": 0.7709944844245911, "learning_rate": 0.00015310141726486288, "loss": 1.9462, "num_input_tokens_seen": 7701376, "step": 1280, "train_runtime": 1293.7759, "train_tokens_per_second": 5952.635 }, { "epoch": 0.47117241379310343, "grad_norm": 0.7349576354026794, "learning_rate": 0.00015306460519050249, "loss": 1.8251, "num_input_tokens_seen": 7707600, "step": 1281, "train_runtime": 1294.793, "train_tokens_per_second": 5952.766 }, { "epoch": 0.47154022988505745, "grad_norm": 0.8141226768493652, "learning_rate": 0.0001530277931161421, "loss": 2.045, "num_input_tokens_seen": 7713360, "step": 1282, "train_runtime": 1295.7657, "train_tokens_per_second": 5952.743 }, { "epoch": 0.47190804597701147, "grad_norm": 0.7103748917579651, "learning_rate": 0.0001529909810417817, "loss": 1.8578, "num_input_tokens_seen": 7718976, "step": 1283, "train_runtime": 1296.7129, "train_tokens_per_second": 5952.725 }, { "epoch": 0.4722758620689655, "grad_norm": 0.7216552495956421, "learning_rate": 0.0001529541689674213, "loss": 1.7909, "num_input_tokens_seen": 7725968, "step": 1284, "train_runtime": 1297.8497, "train_tokens_per_second": 5952.899 }, { "epoch": 0.47264367816091957, "grad_norm": 0.7933657765388489, "learning_rate": 0.00015291735689306092, "loss": 1.6847, "num_input_tokens_seen": 7731856, "step": 1285, "train_runtime": 1298.8148, "train_tokens_per_second": 5953.009 }, { "epoch": 0.4730114942528736, "grad_norm": 0.7735483050346375, "learning_rate": 0.00015288054481870053, "loss": 1.857, "num_input_tokens_seen": 7736144, "step": 1286, "train_runtime": 1299.5438, "train_tokens_per_second": 5952.969 }, { "epoch": 0.4733793103448276, "grad_norm": 0.8700661063194275, "learning_rate": 0.00015284373274434014, "loss": 2.1009, "num_input_tokens_seen": 7740864, "step": 1287, "train_runtime": 1300.3149, "train_tokens_per_second": 5953.069 }, { "epoch": 0.47374712643678163, "grad_norm": 0.7280611991882324, "learning_rate": 0.00015280692066997977, "loss": 1.8547, "num_input_tokens_seen": 7746336, "step": 1288, "train_runtime": 1301.2355, "train_tokens_per_second": 5953.062 }, { "epoch": 0.47411494252873565, "grad_norm": 0.6782256364822388, "learning_rate": 0.00015277010859561938, "loss": 1.6634, "num_input_tokens_seen": 7751888, "step": 1289, "train_runtime": 1302.13, "train_tokens_per_second": 5953.236 }, { "epoch": 0.47448275862068967, "grad_norm": 0.7127692699432373, "learning_rate": 0.000152733296521259, "loss": 1.6083, "num_input_tokens_seen": 7757120, "step": 1290, "train_runtime": 1303.0133, "train_tokens_per_second": 5953.216 }, { "epoch": 0.4748505747126437, "grad_norm": 0.7067503333091736, "learning_rate": 0.0001526964844468986, "loss": 1.7024, "num_input_tokens_seen": 7764352, "step": 1291, "train_runtime": 1304.6325, "train_tokens_per_second": 5951.371 }, { "epoch": 0.4752183908045977, "grad_norm": 0.6711677312850952, "learning_rate": 0.0001526596723725382, "loss": 1.627, "num_input_tokens_seen": 7769200, "step": 1292, "train_runtime": 1305.4533, "train_tokens_per_second": 5951.343 }, { "epoch": 0.47558620689655173, "grad_norm": 0.7733351588249207, "learning_rate": 0.0001526228602981778, "loss": 1.8773, "num_input_tokens_seen": 7773072, "step": 1293, "train_runtime": 1306.1194, "train_tokens_per_second": 5951.272 }, { "epoch": 0.47595402298850575, "grad_norm": 0.6531370282173157, "learning_rate": 0.0001525860482238174, "loss": 1.8501, "num_input_tokens_seen": 7779600, "step": 1294, "train_runtime": 1307.2063, "train_tokens_per_second": 5951.318 }, { "epoch": 0.4763218390804598, "grad_norm": 0.6826766133308411, "learning_rate": 0.000152549236149457, "loss": 1.7617, "num_input_tokens_seen": 7784288, "step": 1295, "train_runtime": 1308.0051, "train_tokens_per_second": 5951.267 }, { "epoch": 0.4766896551724138, "grad_norm": 0.7375050783157349, "learning_rate": 0.00015251242407509665, "loss": 1.6421, "num_input_tokens_seen": 7790512, "step": 1296, "train_runtime": 1309.0152, "train_tokens_per_second": 5951.43 }, { "epoch": 0.4770574712643678, "grad_norm": 0.7035674452781677, "learning_rate": 0.00015247561200073625, "loss": 1.8262, "num_input_tokens_seen": 7796176, "step": 1297, "train_runtime": 1309.9483, "train_tokens_per_second": 5951.514 }, { "epoch": 0.47742528735632184, "grad_norm": 0.7339024543762207, "learning_rate": 0.00015243879992637586, "loss": 1.6042, "num_input_tokens_seen": 7800928, "step": 1298, "train_runtime": 1310.7584, "train_tokens_per_second": 5951.461 }, { "epoch": 0.47779310344827586, "grad_norm": 0.753303587436676, "learning_rate": 0.00015240198785201547, "loss": 1.936, "num_input_tokens_seen": 7807536, "step": 1299, "train_runtime": 1311.8357, "train_tokens_per_second": 5951.611 }, { "epoch": 0.4781609195402299, "grad_norm": 0.6756641864776611, "learning_rate": 0.00015236517577765508, "loss": 1.7588, "num_input_tokens_seen": 7812896, "step": 1300, "train_runtime": 1312.7304, "train_tokens_per_second": 5951.638 }, { "epoch": 0.4785287356321839, "grad_norm": 0.8002522587776184, "learning_rate": 0.0001523283637032947, "loss": 1.8177, "num_input_tokens_seen": 7818576, "step": 1301, "train_runtime": 1313.6618, "train_tokens_per_second": 5951.742 }, { "epoch": 0.4788965517241379, "grad_norm": 0.752668023109436, "learning_rate": 0.0001522915516289343, "loss": 1.6623, "num_input_tokens_seen": 7823008, "step": 1302, "train_runtime": 1314.4388, "train_tokens_per_second": 5951.595 }, { "epoch": 0.47926436781609194, "grad_norm": 0.7155261635780334, "learning_rate": 0.0001522547395545739, "loss": 1.922, "num_input_tokens_seen": 7827744, "step": 1303, "train_runtime": 1315.2469, "train_tokens_per_second": 5951.54 }, { "epoch": 0.47963218390804596, "grad_norm": 0.7759922742843628, "learning_rate": 0.00015221792748021352, "loss": 1.8296, "num_input_tokens_seen": 7834736, "step": 1304, "train_runtime": 1316.3564, "train_tokens_per_second": 5951.835 }, { "epoch": 0.48, "grad_norm": 0.6895577311515808, "learning_rate": 0.00015218111540585313, "loss": 1.57, "num_input_tokens_seen": 7842624, "step": 1305, "train_runtime": 1317.5822, "train_tokens_per_second": 5952.285 }, { "epoch": 0.480367816091954, "grad_norm": 0.8040077686309814, "learning_rate": 0.00015214430333149274, "loss": 1.6446, "num_input_tokens_seen": 7847312, "step": 1306, "train_runtime": 1318.4024, "train_tokens_per_second": 5952.137 }, { "epoch": 0.480735632183908, "grad_norm": 0.7056049704551697, "learning_rate": 0.00015210749125713234, "loss": 1.7206, "num_input_tokens_seen": 7854928, "step": 1307, "train_runtime": 1319.6195, "train_tokens_per_second": 5952.419 }, { "epoch": 0.48110344827586204, "grad_norm": 0.6856859922409058, "learning_rate": 0.00015207067918277195, "loss": 1.8034, "num_input_tokens_seen": 7864432, "step": 1308, "train_runtime": 1321.0915, "train_tokens_per_second": 5952.981 }, { "epoch": 0.48147126436781607, "grad_norm": 0.7165193557739258, "learning_rate": 0.00015203386710841156, "loss": 1.6175, "num_input_tokens_seen": 7870768, "step": 1309, "train_runtime": 1322.1183, "train_tokens_per_second": 5953.149 }, { "epoch": 0.48183908045977014, "grad_norm": 0.7350046634674072, "learning_rate": 0.00015199705503405117, "loss": 1.8635, "num_input_tokens_seen": 7878960, "step": 1310, "train_runtime": 1323.3977, "train_tokens_per_second": 5953.585 }, { "epoch": 0.48220689655172416, "grad_norm": 0.773739218711853, "learning_rate": 0.00015196024295969078, "loss": 1.8664, "num_input_tokens_seen": 7884144, "step": 1311, "train_runtime": 1324.2627, "train_tokens_per_second": 5953.61 }, { "epoch": 0.4825747126436782, "grad_norm": 0.7551418542861938, "learning_rate": 0.0001519234308853304, "loss": 1.9343, "num_input_tokens_seen": 7889232, "step": 1312, "train_runtime": 1325.12, "train_tokens_per_second": 5953.598 }, { "epoch": 0.4829425287356322, "grad_norm": 0.7108722925186157, "learning_rate": 0.00015188661881097002, "loss": 1.5528, "num_input_tokens_seen": 7894256, "step": 1313, "train_runtime": 1325.9796, "train_tokens_per_second": 5953.528 }, { "epoch": 0.4833103448275862, "grad_norm": 0.7087517976760864, "learning_rate": 0.00015184980673660963, "loss": 1.7848, "num_input_tokens_seen": 7898944, "step": 1314, "train_runtime": 1326.7818, "train_tokens_per_second": 5953.461 }, { "epoch": 0.48367816091954025, "grad_norm": 0.6742291450500488, "learning_rate": 0.00015181299466224924, "loss": 1.7007, "num_input_tokens_seen": 7904640, "step": 1315, "train_runtime": 1327.7155, "train_tokens_per_second": 5953.564 }, { "epoch": 0.48404597701149427, "grad_norm": 0.8570288419723511, "learning_rate": 0.00015177618258788885, "loss": 1.642, "num_input_tokens_seen": 7912192, "step": 1316, "train_runtime": 1328.9099, "train_tokens_per_second": 5953.896 }, { "epoch": 0.4844137931034483, "grad_norm": 0.725561797618866, "learning_rate": 0.00015173937051352843, "loss": 1.7728, "num_input_tokens_seen": 7917408, "step": 1317, "train_runtime": 1329.7929, "train_tokens_per_second": 5953.865 }, { "epoch": 0.4847816091954023, "grad_norm": 0.7222111821174622, "learning_rate": 0.00015170255843916804, "loss": 1.8547, "num_input_tokens_seen": 7922656, "step": 1318, "train_runtime": 1330.6758, "train_tokens_per_second": 5953.859 }, { "epoch": 0.48514942528735633, "grad_norm": 0.7159226536750793, "learning_rate": 0.00015166574636480765, "loss": 1.9004, "num_input_tokens_seen": 7927904, "step": 1319, "train_runtime": 1331.5501, "train_tokens_per_second": 5953.891 }, { "epoch": 0.48551724137931035, "grad_norm": 0.8363777995109558, "learning_rate": 0.00015162893429044726, "loss": 1.867, "num_input_tokens_seen": 7933184, "step": 1320, "train_runtime": 1332.4598, "train_tokens_per_second": 5953.789 }, { "epoch": 0.48588505747126437, "grad_norm": 0.7550817131996155, "learning_rate": 0.00015159212221608687, "loss": 1.8652, "num_input_tokens_seen": 7938112, "step": 1321, "train_runtime": 1333.811, "train_tokens_per_second": 5951.452 }, { "epoch": 0.4862528735632184, "grad_norm": 0.7746520042419434, "learning_rate": 0.0001515553101417265, "loss": 2.1084, "num_input_tokens_seen": 7943120, "step": 1322, "train_runtime": 1334.6604, "train_tokens_per_second": 5951.417 }, { "epoch": 0.4866206896551724, "grad_norm": 0.7697386145591736, "learning_rate": 0.0001515184980673661, "loss": 1.8643, "num_input_tokens_seen": 7947568, "step": 1323, "train_runtime": 1335.4402, "train_tokens_per_second": 5951.272 }, { "epoch": 0.48698850574712643, "grad_norm": 0.6934213042259216, "learning_rate": 0.00015148168599300572, "loss": 1.6074, "num_input_tokens_seen": 7954176, "step": 1324, "train_runtime": 1336.5095, "train_tokens_per_second": 5951.455 }, { "epoch": 0.48735632183908045, "grad_norm": 0.7284837365150452, "learning_rate": 0.00015144487391864533, "loss": 1.7163, "num_input_tokens_seen": 7960496, "step": 1325, "train_runtime": 1337.5432, "train_tokens_per_second": 5951.58 }, { "epoch": 0.4877241379310345, "grad_norm": 0.8141064047813416, "learning_rate": 0.00015140806184428494, "loss": 1.9707, "num_input_tokens_seen": 7965568, "step": 1326, "train_runtime": 1338.4014, "train_tokens_per_second": 5951.554 }, { "epoch": 0.4880919540229885, "grad_norm": 0.781174898147583, "learning_rate": 0.00015137124976992455, "loss": 2.0404, "num_input_tokens_seen": 7970704, "step": 1327, "train_runtime": 1339.2559, "train_tokens_per_second": 5951.592 }, { "epoch": 0.4884597701149425, "grad_norm": 0.7122456431388855, "learning_rate": 0.00015133443769556416, "loss": 1.6171, "num_input_tokens_seen": 7976000, "step": 1328, "train_runtime": 1340.1517, "train_tokens_per_second": 5951.565 }, { "epoch": 0.48882758620689654, "grad_norm": 0.7224553227424622, "learning_rate": 0.00015129762562120377, "loss": 1.9309, "num_input_tokens_seen": 7981520, "step": 1329, "train_runtime": 1341.0704, "train_tokens_per_second": 5951.604 }, { "epoch": 0.48919540229885056, "grad_norm": 0.7628961801528931, "learning_rate": 0.00015126081354684338, "loss": 1.8542, "num_input_tokens_seen": 7987776, "step": 1330, "train_runtime": 1342.0553, "train_tokens_per_second": 5951.898 }, { "epoch": 0.4895632183908046, "grad_norm": 0.7004364728927612, "learning_rate": 0.00015122400147248298, "loss": 1.7703, "num_input_tokens_seen": 7994288, "step": 1331, "train_runtime": 1343.0854, "train_tokens_per_second": 5952.181 }, { "epoch": 0.4899310344827586, "grad_norm": 0.80036860704422, "learning_rate": 0.0001511871893981226, "loss": 1.6565, "num_input_tokens_seen": 7999984, "step": 1332, "train_runtime": 1344.0172, "train_tokens_per_second": 5952.293 }, { "epoch": 0.4902988505747126, "grad_norm": 0.7471275329589844, "learning_rate": 0.0001511503773237622, "loss": 1.844, "num_input_tokens_seen": 8005888, "step": 1333, "train_runtime": 1344.9827, "train_tokens_per_second": 5952.41 }, { "epoch": 0.49066666666666664, "grad_norm": 0.6946808099746704, "learning_rate": 0.0001511135652494018, "loss": 1.9624, "num_input_tokens_seen": 8011120, "step": 1334, "train_runtime": 1345.8456, "train_tokens_per_second": 5952.481 }, { "epoch": 0.4910344827586207, "grad_norm": 0.76739102602005, "learning_rate": 0.00015107675317504142, "loss": 2.1191, "num_input_tokens_seen": 8015840, "step": 1335, "train_runtime": 1346.6438, "train_tokens_per_second": 5952.457 }, { "epoch": 0.49140229885057474, "grad_norm": 0.6828115582466125, "learning_rate": 0.00015103994110068103, "loss": 1.679, "num_input_tokens_seen": 8021408, "step": 1336, "train_runtime": 1347.5491, "train_tokens_per_second": 5952.591 }, { "epoch": 0.49177011494252876, "grad_norm": 0.6785314679145813, "learning_rate": 0.00015100312902632064, "loss": 1.8206, "num_input_tokens_seen": 8027680, "step": 1337, "train_runtime": 1348.5725, "train_tokens_per_second": 5952.724 }, { "epoch": 0.4921379310344828, "grad_norm": 0.7338114380836487, "learning_rate": 0.00015096631695196025, "loss": 1.8427, "num_input_tokens_seen": 8031952, "step": 1338, "train_runtime": 1349.3344, "train_tokens_per_second": 5952.529 }, { "epoch": 0.4925057471264368, "grad_norm": 0.7458033561706543, "learning_rate": 0.00015092950487759988, "loss": 1.815, "num_input_tokens_seen": 8038240, "step": 1339, "train_runtime": 1350.3655, "train_tokens_per_second": 5952.64 }, { "epoch": 0.4928735632183908, "grad_norm": 0.8153566122055054, "learning_rate": 0.00015089269280323946, "loss": 1.8637, "num_input_tokens_seen": 8043472, "step": 1340, "train_runtime": 1351.254, "train_tokens_per_second": 5952.598 }, { "epoch": 0.49324137931034484, "grad_norm": 0.850492537021637, "learning_rate": 0.00015085588072887907, "loss": 1.6821, "num_input_tokens_seen": 8052160, "step": 1341, "train_runtime": 1352.6096, "train_tokens_per_second": 5953.055 }, { "epoch": 0.49360919540229886, "grad_norm": 0.7156057953834534, "learning_rate": 0.00015081906865451868, "loss": 1.8425, "num_input_tokens_seen": 8058032, "step": 1342, "train_runtime": 1353.5981, "train_tokens_per_second": 5953.046 }, { "epoch": 0.4939770114942529, "grad_norm": 0.7298743724822998, "learning_rate": 0.0001507822565801583, "loss": 1.9257, "num_input_tokens_seen": 8063792, "step": 1343, "train_runtime": 1354.5703, "train_tokens_per_second": 5953.026 }, { "epoch": 0.4943448275862069, "grad_norm": 0.7520971298217773, "learning_rate": 0.0001507454445057979, "loss": 1.7358, "num_input_tokens_seen": 8072512, "step": 1344, "train_runtime": 1355.8972, "train_tokens_per_second": 5953.631 }, { "epoch": 0.4947126436781609, "grad_norm": 0.7416859269142151, "learning_rate": 0.0001507086324314375, "loss": 1.7749, "num_input_tokens_seen": 8078416, "step": 1345, "train_runtime": 1356.8677, "train_tokens_per_second": 5953.724 }, { "epoch": 0.49508045977011494, "grad_norm": 0.7004967927932739, "learning_rate": 0.00015067182035707712, "loss": 1.7735, "num_input_tokens_seen": 8084160, "step": 1346, "train_runtime": 1357.8386, "train_tokens_per_second": 5953.697 }, { "epoch": 0.49544827586206897, "grad_norm": 0.7175948023796082, "learning_rate": 0.00015063500828271673, "loss": 1.8509, "num_input_tokens_seen": 8089664, "step": 1347, "train_runtime": 1358.7614, "train_tokens_per_second": 5953.705 }, { "epoch": 0.495816091954023, "grad_norm": 0.7371270060539246, "learning_rate": 0.00015059819620835636, "loss": 1.8303, "num_input_tokens_seen": 8094336, "step": 1348, "train_runtime": 1359.5875, "train_tokens_per_second": 5953.523 }, { "epoch": 0.496183908045977, "grad_norm": 0.7381982207298279, "learning_rate": 0.00015056138413399597, "loss": 1.9887, "num_input_tokens_seen": 8099520, "step": 1349, "train_runtime": 1360.4582, "train_tokens_per_second": 5953.523 }, { "epoch": 0.496551724137931, "grad_norm": 0.7753965258598328, "learning_rate": 0.00015052457205963558, "loss": 1.823, "num_input_tokens_seen": 8103952, "step": 1350, "train_runtime": 1361.255, "train_tokens_per_second": 5953.295 }, { "epoch": 0.49691954022988505, "grad_norm": 0.689374566078186, "learning_rate": 0.0001504877599852752, "loss": 1.7141, "num_input_tokens_seen": 8108976, "step": 1351, "train_runtime": 1362.6403, "train_tokens_per_second": 5950.929 }, { "epoch": 0.49728735632183907, "grad_norm": 0.7397502064704895, "learning_rate": 0.0001504509479109148, "loss": 1.7321, "num_input_tokens_seen": 8114048, "step": 1352, "train_runtime": 1363.4943, "train_tokens_per_second": 5950.922 }, { "epoch": 0.4976551724137931, "grad_norm": 0.8675876259803772, "learning_rate": 0.00015041413583655438, "loss": 1.8876, "num_input_tokens_seen": 8118896, "step": 1353, "train_runtime": 1364.3335, "train_tokens_per_second": 5950.815 }, { "epoch": 0.4980229885057471, "grad_norm": 0.6720005869865417, "learning_rate": 0.000150377323762194, "loss": 1.6809, "num_input_tokens_seen": 8126496, "step": 1354, "train_runtime": 1365.5222, "train_tokens_per_second": 5951.2 }, { "epoch": 0.49839080459770113, "grad_norm": 0.743710458278656, "learning_rate": 0.0001503405116878336, "loss": 1.7912, "num_input_tokens_seen": 8132800, "step": 1355, "train_runtime": 1366.5561, "train_tokens_per_second": 5951.311 }, { "epoch": 0.49875862068965515, "grad_norm": 0.5289599895477295, "learning_rate": 0.00015030369961347323, "loss": 1.3647, "num_input_tokens_seen": 8147296, "step": 1356, "train_runtime": 1368.6841, "train_tokens_per_second": 5952.649 }, { "epoch": 0.4991264367816092, "grad_norm": 0.7412967085838318, "learning_rate": 0.00015026688753911284, "loss": 1.6776, "num_input_tokens_seen": 8151552, "step": 1357, "train_runtime": 1369.4391, "train_tokens_per_second": 5952.475 }, { "epoch": 0.4994942528735632, "grad_norm": 0.7483311891555786, "learning_rate": 0.00015023007546475245, "loss": 1.6162, "num_input_tokens_seen": 8158032, "step": 1358, "train_runtime": 1370.4953, "train_tokens_per_second": 5952.616 }, { "epoch": 0.4998620689655172, "grad_norm": 0.7232673168182373, "learning_rate": 0.00015019326339039206, "loss": 1.6481, "num_input_tokens_seen": 8162416, "step": 1359, "train_runtime": 1371.2699, "train_tokens_per_second": 5952.45 }, { "epoch": 0.5002298850574712, "grad_norm": 0.6927854418754578, "learning_rate": 0.00015015645131603167, "loss": 1.6787, "num_input_tokens_seen": 8168432, "step": 1360, "train_runtime": 1372.2369, "train_tokens_per_second": 5952.64 }, { "epoch": 0.5005977011494253, "grad_norm": 0.7753093838691711, "learning_rate": 0.00015011963924167128, "loss": 1.8056, "num_input_tokens_seen": 8173232, "step": 1361, "train_runtime": 1373.0682, "train_tokens_per_second": 5952.532 }, { "epoch": 0.5009655172413793, "grad_norm": 0.8077579736709595, "learning_rate": 0.0001500828271673109, "loss": 1.974, "num_input_tokens_seen": 8179136, "step": 1362, "train_runtime": 1374.0547, "train_tokens_per_second": 5952.555 }, { "epoch": 0.5013333333333333, "grad_norm": 0.8416463136672974, "learning_rate": 0.0001500460150929505, "loss": 1.8059, "num_input_tokens_seen": 8183824, "step": 1363, "train_runtime": 1374.8755, "train_tokens_per_second": 5952.411 }, { "epoch": 0.5017011494252873, "grad_norm": 0.6934306621551514, "learning_rate": 0.0001500092030185901, "loss": 1.6866, "num_input_tokens_seen": 8190320, "step": 1364, "train_runtime": 1375.9421, "train_tokens_per_second": 5952.518 }, { "epoch": 0.5020689655172413, "grad_norm": 0.6957128643989563, "learning_rate": 0.00014997239094422971, "loss": 1.8055, "num_input_tokens_seen": 8195856, "step": 1365, "train_runtime": 1376.8374, "train_tokens_per_second": 5952.668 }, { "epoch": 0.5024367816091954, "grad_norm": 0.681606113910675, "learning_rate": 0.00014993557886986932, "loss": 1.8427, "num_input_tokens_seen": 8201664, "step": 1366, "train_runtime": 1377.8184, "train_tokens_per_second": 5952.645 }, { "epoch": 0.5028045977011494, "grad_norm": 0.7329640984535217, "learning_rate": 0.00014989876679550893, "loss": 1.6902, "num_input_tokens_seen": 8206368, "step": 1367, "train_runtime": 1378.6255, "train_tokens_per_second": 5952.572 }, { "epoch": 0.5031724137931034, "grad_norm": 0.767595648765564, "learning_rate": 0.00014986195472114854, "loss": 1.7588, "num_input_tokens_seen": 8210448, "step": 1368, "train_runtime": 1379.354, "train_tokens_per_second": 5952.387 }, { "epoch": 0.5035402298850574, "grad_norm": 0.7514697909355164, "learning_rate": 0.00014982514264678815, "loss": 1.9968, "num_input_tokens_seen": 8216192, "step": 1369, "train_runtime": 1380.2934, "train_tokens_per_second": 5952.497 }, { "epoch": 0.5039080459770114, "grad_norm": 0.668262779712677, "learning_rate": 0.00014978833057242776, "loss": 1.6642, "num_input_tokens_seen": 8223328, "step": 1370, "train_runtime": 1381.4292, "train_tokens_per_second": 5952.768 }, { "epoch": 0.5042758620689655, "grad_norm": 0.7377183437347412, "learning_rate": 0.00014975151849806737, "loss": 2.0848, "num_input_tokens_seen": 8228240, "step": 1371, "train_runtime": 1382.2631, "train_tokens_per_second": 5952.731 }, { "epoch": 0.5046436781609196, "grad_norm": 0.7200998067855835, "learning_rate": 0.00014971470642370698, "loss": 1.6967, "num_input_tokens_seen": 8235536, "step": 1372, "train_runtime": 1383.4245, "train_tokens_per_second": 5953.007 }, { "epoch": 0.5050114942528736, "grad_norm": 0.8013726472854614, "learning_rate": 0.0001496778943493466, "loss": 1.8624, "num_input_tokens_seen": 8240064, "step": 1373, "train_runtime": 1384.2108, "train_tokens_per_second": 5952.897 }, { "epoch": 0.5053793103448276, "grad_norm": 0.791252851486206, "learning_rate": 0.00014964108227498622, "loss": 1.9451, "num_input_tokens_seen": 8244928, "step": 1374, "train_runtime": 1385.0554, "train_tokens_per_second": 5952.779 }, { "epoch": 0.5057471264367817, "grad_norm": 0.7399970293045044, "learning_rate": 0.00014960427020062583, "loss": 1.5378, "num_input_tokens_seen": 8250576, "step": 1375, "train_runtime": 1385.9858, "train_tokens_per_second": 5952.857 }, { "epoch": 0.5061149425287357, "grad_norm": 0.7669424414634705, "learning_rate": 0.0001495674581262654, "loss": 1.5796, "num_input_tokens_seen": 8258176, "step": 1376, "train_runtime": 1387.1818, "train_tokens_per_second": 5953.204 }, { "epoch": 0.5064827586206897, "grad_norm": 0.7926695346832275, "learning_rate": 0.00014953064605190502, "loss": 1.8736, "num_input_tokens_seen": 8264544, "step": 1377, "train_runtime": 1388.1821, "train_tokens_per_second": 5953.501 }, { "epoch": 0.5068505747126437, "grad_norm": 0.7332091927528381, "learning_rate": 0.00014949383397754463, "loss": 1.6914, "num_input_tokens_seen": 8272928, "step": 1378, "train_runtime": 1389.4938, "train_tokens_per_second": 5953.915 }, { "epoch": 0.5072183908045977, "grad_norm": 0.7481079697608948, "learning_rate": 0.00014945702190318424, "loss": 1.9171, "num_input_tokens_seen": 8279392, "step": 1379, "train_runtime": 1390.5524, "train_tokens_per_second": 5954.031 }, { "epoch": 0.5075862068965518, "grad_norm": 0.857302725315094, "learning_rate": 0.00014942020982882385, "loss": 1.8295, "num_input_tokens_seen": 8285536, "step": 1380, "train_runtime": 1391.5582, "train_tokens_per_second": 5954.143 }, { "epoch": 0.5079540229885058, "grad_norm": 0.7441621422767639, "learning_rate": 0.00014938339775446346, "loss": 1.7978, "num_input_tokens_seen": 8290704, "step": 1381, "train_runtime": 1392.9524, "train_tokens_per_second": 5951.893 }, { "epoch": 0.5083218390804598, "grad_norm": 0.6255395412445068, "learning_rate": 0.0001493465856801031, "loss": 1.6786, "num_input_tokens_seen": 8297440, "step": 1382, "train_runtime": 1394.0449, "train_tokens_per_second": 5952.061 }, { "epoch": 0.5086896551724138, "grad_norm": 0.7366942167282104, "learning_rate": 0.0001493097736057427, "loss": 1.5836, "num_input_tokens_seen": 8305760, "step": 1383, "train_runtime": 1395.3208, "train_tokens_per_second": 5952.581 }, { "epoch": 0.5090574712643678, "grad_norm": 0.7217180728912354, "learning_rate": 0.0001492729615313823, "loss": 1.9036, "num_input_tokens_seen": 8311712, "step": 1384, "train_runtime": 1396.2982, "train_tokens_per_second": 5952.677 }, { "epoch": 0.5094252873563219, "grad_norm": 0.8432775735855103, "learning_rate": 0.00014923614945702192, "loss": 1.8468, "num_input_tokens_seen": 8316960, "step": 1385, "train_runtime": 1397.1639, "train_tokens_per_second": 5952.745 }, { "epoch": 0.5097931034482759, "grad_norm": 0.6771023273468018, "learning_rate": 0.00014919933738266153, "loss": 1.8409, "num_input_tokens_seen": 8324048, "step": 1386, "train_runtime": 1398.2843, "train_tokens_per_second": 5953.044 }, { "epoch": 0.5101609195402299, "grad_norm": 0.6785527467727661, "learning_rate": 0.00014916252530830114, "loss": 1.6691, "num_input_tokens_seen": 8330400, "step": 1387, "train_runtime": 1399.3143, "train_tokens_per_second": 5953.202 }, { "epoch": 0.5105287356321839, "grad_norm": 0.725290834903717, "learning_rate": 0.00014912571323394075, "loss": 1.7793, "num_input_tokens_seen": 8338928, "step": 1388, "train_runtime": 1400.6484, "train_tokens_per_second": 5953.62 }, { "epoch": 0.510896551724138, "grad_norm": 0.7309304475784302, "learning_rate": 0.00014908890115958035, "loss": 1.6867, "num_input_tokens_seen": 8344576, "step": 1389, "train_runtime": 1401.6118, "train_tokens_per_second": 5953.557 }, { "epoch": 0.511264367816092, "grad_norm": 0.7281897664070129, "learning_rate": 0.00014905208908521996, "loss": 1.6497, "num_input_tokens_seen": 8351248, "step": 1390, "train_runtime": 1402.6846, "train_tokens_per_second": 5953.76 }, { "epoch": 0.511632183908046, "grad_norm": 0.7505301237106323, "learning_rate": 0.00014901527701085957, "loss": 1.7723, "num_input_tokens_seen": 8356624, "step": 1391, "train_runtime": 1403.562, "train_tokens_per_second": 5953.869 }, { "epoch": 0.512, "grad_norm": 0.7180195450782776, "learning_rate": 0.00014897846493649918, "loss": 1.6918, "num_input_tokens_seen": 8363600, "step": 1392, "train_runtime": 1404.6948, "train_tokens_per_second": 5954.034 }, { "epoch": 0.512367816091954, "grad_norm": 0.8358976244926453, "learning_rate": 0.0001489416528621388, "loss": 1.9481, "num_input_tokens_seen": 8368768, "step": 1393, "train_runtime": 1405.5573, "train_tokens_per_second": 5954.057 }, { "epoch": 0.512735632183908, "grad_norm": 0.6864331364631653, "learning_rate": 0.0001489048407877784, "loss": 1.8447, "num_input_tokens_seen": 8377136, "step": 1394, "train_runtime": 1406.8409, "train_tokens_per_second": 5954.573 }, { "epoch": 0.5131034482758621, "grad_norm": 0.680988609790802, "learning_rate": 0.000148868028713418, "loss": 1.7178, "num_input_tokens_seen": 8382224, "step": 1395, "train_runtime": 1407.711, "train_tokens_per_second": 5954.506 }, { "epoch": 0.5134712643678161, "grad_norm": 0.6796252131462097, "learning_rate": 0.00014883121663905762, "loss": 1.6514, "num_input_tokens_seen": 8386800, "step": 1396, "train_runtime": 1408.5091, "train_tokens_per_second": 5954.381 }, { "epoch": 0.5138390804597701, "grad_norm": 0.7472183704376221, "learning_rate": 0.00014879440456469723, "loss": 1.6846, "num_input_tokens_seen": 8391968, "step": 1397, "train_runtime": 1409.3813, "train_tokens_per_second": 5954.363 }, { "epoch": 0.5142068965517241, "grad_norm": 0.7881629467010498, "learning_rate": 0.00014875759249033683, "loss": 1.8198, "num_input_tokens_seen": 8398384, "step": 1398, "train_runtime": 1410.4282, "train_tokens_per_second": 5954.493 }, { "epoch": 0.5145747126436782, "grad_norm": 0.7668195962905884, "learning_rate": 0.00014872078041597647, "loss": 1.8793, "num_input_tokens_seen": 8403120, "step": 1399, "train_runtime": 1411.2595, "train_tokens_per_second": 5954.341 }, { "epoch": 0.5149425287356322, "grad_norm": 0.8129005432128906, "learning_rate": 0.00014868396834161605, "loss": 1.8726, "num_input_tokens_seen": 8408352, "step": 1400, "train_runtime": 1412.1596, "train_tokens_per_second": 5954.25 }, { "epoch": 0.5153103448275862, "grad_norm": 0.7139448523521423, "learning_rate": 0.00014864715626725566, "loss": 1.6119, "num_input_tokens_seen": 8413056, "step": 1401, "train_runtime": 1412.9822, "train_tokens_per_second": 5954.113 }, { "epoch": 0.5156781609195402, "grad_norm": 0.5423973798751831, "learning_rate": 0.00014861034419289527, "loss": 1.5718, "num_input_tokens_seen": 8424096, "step": 1402, "train_runtime": 1414.6656, "train_tokens_per_second": 5954.832 }, { "epoch": 0.5160459770114942, "grad_norm": 0.6507823467254639, "learning_rate": 0.00014857353211853488, "loss": 1.7399, "num_input_tokens_seen": 8433392, "step": 1403, "train_runtime": 1416.0559, "train_tokens_per_second": 5955.55 }, { "epoch": 0.5164137931034483, "grad_norm": 0.6087756752967834, "learning_rate": 0.0001485367200441745, "loss": 1.5716, "num_input_tokens_seen": 8440848, "step": 1404, "train_runtime": 1417.2555, "train_tokens_per_second": 5955.77 }, { "epoch": 0.5167816091954023, "grad_norm": 0.7732454538345337, "learning_rate": 0.0001484999079698141, "loss": 1.793, "num_input_tokens_seen": 8446464, "step": 1405, "train_runtime": 1418.1905, "train_tokens_per_second": 5955.803 }, { "epoch": 0.5171494252873563, "grad_norm": 0.718552827835083, "learning_rate": 0.0001484630958954537, "loss": 1.7763, "num_input_tokens_seen": 8451248, "step": 1406, "train_runtime": 1419.0042, "train_tokens_per_second": 5955.76 }, { "epoch": 0.5175172413793103, "grad_norm": 0.7031474113464355, "learning_rate": 0.00014842628382109331, "loss": 1.6331, "num_input_tokens_seen": 8457248, "step": 1407, "train_runtime": 1419.9806, "train_tokens_per_second": 5955.89 }, { "epoch": 0.5178850574712643, "grad_norm": 0.701958954334259, "learning_rate": 0.00014838947174673295, "loss": 1.8663, "num_input_tokens_seen": 8463760, "step": 1408, "train_runtime": 1421.0375, "train_tokens_per_second": 5956.043 }, { "epoch": 0.5182528735632184, "grad_norm": 0.6807476878166199, "learning_rate": 0.00014835265967237256, "loss": 1.7774, "num_input_tokens_seen": 8472128, "step": 1409, "train_runtime": 1422.3573, "train_tokens_per_second": 5956.399 }, { "epoch": 0.5186206896551724, "grad_norm": 0.7757298946380615, "learning_rate": 0.00014831584759801217, "loss": 1.9072, "num_input_tokens_seen": 8477072, "step": 1410, "train_runtime": 1423.2046, "train_tokens_per_second": 5956.327 }, { "epoch": 0.5189885057471264, "grad_norm": 0.6979550123214722, "learning_rate": 0.00014827903552365178, "loss": 1.6075, "num_input_tokens_seen": 8482992, "step": 1411, "train_runtime": 1424.7002, "train_tokens_per_second": 5954.23 }, { "epoch": 0.5193563218390804, "grad_norm": 0.6153293251991272, "learning_rate": 0.00014824222344929139, "loss": 1.5254, "num_input_tokens_seen": 8490352, "step": 1412, "train_runtime": 1425.8888, "train_tokens_per_second": 5954.428 }, { "epoch": 0.5197241379310344, "grad_norm": 0.7379152178764343, "learning_rate": 0.00014820541137493097, "loss": 1.7054, "num_input_tokens_seen": 8496352, "step": 1413, "train_runtime": 1426.8805, "train_tokens_per_second": 5954.495 }, { "epoch": 0.5200919540229885, "grad_norm": 0.6838432550430298, "learning_rate": 0.00014816859930057058, "loss": 1.6971, "num_input_tokens_seen": 8503712, "step": 1414, "train_runtime": 1428.0408, "train_tokens_per_second": 5954.81 }, { "epoch": 0.5204597701149425, "grad_norm": 0.7826948761940002, "learning_rate": 0.00014813178722621019, "loss": 1.9042, "num_input_tokens_seen": 8507872, "step": 1415, "train_runtime": 1428.7718, "train_tokens_per_second": 5954.675 }, { "epoch": 0.5208275862068965, "grad_norm": 0.8368574976921082, "learning_rate": 0.00014809497515184982, "loss": 1.7309, "num_input_tokens_seen": 8512864, "step": 1416, "train_runtime": 1429.6138, "train_tokens_per_second": 5954.66 }, { "epoch": 0.5211954022988505, "grad_norm": 0.7584893107414246, "learning_rate": 0.00014805816307748943, "loss": 1.666, "num_input_tokens_seen": 8521168, "step": 1417, "train_runtime": 1430.9217, "train_tokens_per_second": 5955.021 }, { "epoch": 0.5215632183908046, "grad_norm": 0.7287805676460266, "learning_rate": 0.00014802135100312904, "loss": 1.6451, "num_input_tokens_seen": 8528288, "step": 1418, "train_runtime": 1432.0732, "train_tokens_per_second": 5955.204 }, { "epoch": 0.5219310344827586, "grad_norm": 0.7619727849960327, "learning_rate": 0.00014798453892876865, "loss": 1.6289, "num_input_tokens_seen": 8533984, "step": 1419, "train_runtime": 1433.0352, "train_tokens_per_second": 5955.181 }, { "epoch": 0.5222988505747126, "grad_norm": 0.6437995433807373, "learning_rate": 0.00014794772685440826, "loss": 1.8128, "num_input_tokens_seen": 8542608, "step": 1420, "train_runtime": 1434.3722, "train_tokens_per_second": 5955.642 }, { "epoch": 0.5226666666666666, "grad_norm": 0.7566819787025452, "learning_rate": 0.00014791091478004787, "loss": 1.841, "num_input_tokens_seen": 8547696, "step": 1421, "train_runtime": 1435.2206, "train_tokens_per_second": 5955.667 }, { "epoch": 0.5230344827586207, "grad_norm": 0.8183180689811707, "learning_rate": 0.00014787410270568747, "loss": 1.7804, "num_input_tokens_seen": 8552624, "step": 1422, "train_runtime": 1436.0804, "train_tokens_per_second": 5955.533 }, { "epoch": 0.5234022988505748, "grad_norm": 0.7553067207336426, "learning_rate": 0.00014783729063132708, "loss": 1.8143, "num_input_tokens_seen": 8556944, "step": 1423, "train_runtime": 1436.8532, "train_tokens_per_second": 5955.336 }, { "epoch": 0.5237701149425288, "grad_norm": 0.7072001695632935, "learning_rate": 0.0001478004785569667, "loss": 1.7463, "num_input_tokens_seen": 8562816, "step": 1424, "train_runtime": 1437.8544, "train_tokens_per_second": 5955.273 }, { "epoch": 0.5241379310344828, "grad_norm": 0.8855698704719543, "learning_rate": 0.0001477636664826063, "loss": 1.9317, "num_input_tokens_seen": 8568272, "step": 1425, "train_runtime": 1438.7734, "train_tokens_per_second": 5955.261 }, { "epoch": 0.5245057471264368, "grad_norm": 0.7797963619232178, "learning_rate": 0.0001477268544082459, "loss": 1.7609, "num_input_tokens_seen": 8575680, "step": 1426, "train_runtime": 1439.9866, "train_tokens_per_second": 5955.389 }, { "epoch": 0.5248735632183908, "grad_norm": 0.7859804034233093, "learning_rate": 0.00014769004233388552, "loss": 1.7861, "num_input_tokens_seen": 8580288, "step": 1427, "train_runtime": 1440.7872, "train_tokens_per_second": 5955.278 }, { "epoch": 0.5252413793103449, "grad_norm": 0.8036105036735535, "learning_rate": 0.00014765323025952513, "loss": 1.7659, "num_input_tokens_seen": 8584864, "step": 1428, "train_runtime": 1441.5938, "train_tokens_per_second": 5955.12 }, { "epoch": 0.5256091954022989, "grad_norm": 0.7197122573852539, "learning_rate": 0.00014761641818516474, "loss": 1.6921, "num_input_tokens_seen": 8589312, "step": 1429, "train_runtime": 1442.3718, "train_tokens_per_second": 5954.992 }, { "epoch": 0.5259770114942529, "grad_norm": 0.711627721786499, "learning_rate": 0.00014757960611080435, "loss": 1.7333, "num_input_tokens_seen": 8595312, "step": 1430, "train_runtime": 1443.3454, "train_tokens_per_second": 5955.132 }, { "epoch": 0.5263448275862069, "grad_norm": 0.7196218371391296, "learning_rate": 0.00014754279403644395, "loss": 1.7495, "num_input_tokens_seen": 8599984, "step": 1431, "train_runtime": 1444.1471, "train_tokens_per_second": 5955.061 }, { "epoch": 0.526712643678161, "grad_norm": 0.8260558843612671, "learning_rate": 0.00014750598196208356, "loss": 1.8117, "num_input_tokens_seen": 8605232, "step": 1432, "train_runtime": 1445.0251, "train_tokens_per_second": 5955.074 }, { "epoch": 0.527080459770115, "grad_norm": 0.7250815629959106, "learning_rate": 0.0001474691698877232, "loss": 1.753, "num_input_tokens_seen": 8612912, "step": 1433, "train_runtime": 1446.2358, "train_tokens_per_second": 5955.4 }, { "epoch": 0.527448275862069, "grad_norm": 0.7463332414627075, "learning_rate": 0.0001474323578133628, "loss": 1.8104, "num_input_tokens_seen": 8618336, "step": 1434, "train_runtime": 1447.1439, "train_tokens_per_second": 5955.411 }, { "epoch": 0.527816091954023, "grad_norm": 0.7387081980705261, "learning_rate": 0.00014739554573900242, "loss": 1.6921, "num_input_tokens_seen": 8624736, "step": 1435, "train_runtime": 1448.1832, "train_tokens_per_second": 5955.556 }, { "epoch": 0.528183908045977, "grad_norm": 0.7554429769515991, "learning_rate": 0.000147358733664642, "loss": 1.7071, "num_input_tokens_seen": 8631920, "step": 1436, "train_runtime": 1449.3473, "train_tokens_per_second": 5955.729 }, { "epoch": 0.5285517241379311, "grad_norm": 0.8548153638839722, "learning_rate": 0.0001473219215902816, "loss": 2.0403, "num_input_tokens_seen": 8637696, "step": 1437, "train_runtime": 1450.2901, "train_tokens_per_second": 5955.84 }, { "epoch": 0.5289195402298851, "grad_norm": 0.7452429533004761, "learning_rate": 0.00014728510951592122, "loss": 1.7235, "num_input_tokens_seen": 8642608, "step": 1438, "train_runtime": 1451.1141, "train_tokens_per_second": 5955.843 }, { "epoch": 0.5292873563218391, "grad_norm": 0.7534968256950378, "learning_rate": 0.00014724829744156083, "loss": 1.9277, "num_input_tokens_seen": 8648720, "step": 1439, "train_runtime": 1452.142, "train_tokens_per_second": 5955.836 }, { "epoch": 0.5296551724137931, "grad_norm": 0.7616642713546753, "learning_rate": 0.00014721148536720043, "loss": 1.7343, "num_input_tokens_seen": 8653360, "step": 1440, "train_runtime": 1452.95, "train_tokens_per_second": 5955.718 }, { "epoch": 0.5300229885057471, "grad_norm": 0.6579344868659973, "learning_rate": 0.00014717467329284004, "loss": 1.6678, "num_input_tokens_seen": 8661280, "step": 1441, "train_runtime": 1454.7228, "train_tokens_per_second": 5953.904 }, { "epoch": 0.5303908045977012, "grad_norm": 0.7073023319244385, "learning_rate": 0.00014713786121847968, "loss": 2.0388, "num_input_tokens_seen": 8667312, "step": 1442, "train_runtime": 1455.7077, "train_tokens_per_second": 5954.019 }, { "epoch": 0.5307586206896552, "grad_norm": 0.695111870765686, "learning_rate": 0.0001471010491441193, "loss": 2.0914, "num_input_tokens_seen": 8676160, "step": 1443, "train_runtime": 1457.0471, "train_tokens_per_second": 5954.619 }, { "epoch": 0.5311264367816092, "grad_norm": 0.722130298614502, "learning_rate": 0.0001470642370697589, "loss": 1.5904, "num_input_tokens_seen": 8680816, "step": 1444, "train_runtime": 1457.8518, "train_tokens_per_second": 5954.526 }, { "epoch": 0.5314942528735632, "grad_norm": 0.7415043711662292, "learning_rate": 0.0001470274249953985, "loss": 1.9128, "num_input_tokens_seen": 8686400, "step": 1445, "train_runtime": 1458.7828, "train_tokens_per_second": 5954.553 }, { "epoch": 0.5318620689655172, "grad_norm": 0.8077269196510315, "learning_rate": 0.00014699061292103812, "loss": 1.7098, "num_input_tokens_seen": 8691696, "step": 1446, "train_runtime": 1459.6599, "train_tokens_per_second": 5954.603 }, { "epoch": 0.5322298850574713, "grad_norm": 0.6825448274612427, "learning_rate": 0.00014695380084667772, "loss": 1.83, "num_input_tokens_seen": 8698976, "step": 1447, "train_runtime": 1460.8417, "train_tokens_per_second": 5954.77 }, { "epoch": 0.5325977011494253, "grad_norm": 0.8043240308761597, "learning_rate": 0.00014691698877231733, "loss": 1.6199, "num_input_tokens_seen": 8706016, "step": 1448, "train_runtime": 1461.9492, "train_tokens_per_second": 5955.074 }, { "epoch": 0.5329655172413793, "grad_norm": 0.6993316411972046, "learning_rate": 0.00014688017669795692, "loss": 1.6032, "num_input_tokens_seen": 8711872, "step": 1449, "train_runtime": 1462.9355, "train_tokens_per_second": 5955.062 }, { "epoch": 0.5333333333333333, "grad_norm": 0.6930384635925293, "learning_rate": 0.00014684336462359655, "loss": 1.7395, "num_input_tokens_seen": 8718848, "step": 1450, "train_runtime": 1464.0365, "train_tokens_per_second": 5955.349 }, { "epoch": 0.5337011494252873, "grad_norm": 0.7121605277061462, "learning_rate": 0.00014680655254923616, "loss": 1.7851, "num_input_tokens_seen": 8725440, "step": 1451, "train_runtime": 1465.0913, "train_tokens_per_second": 5955.56 }, { "epoch": 0.5340689655172414, "grad_norm": 0.7211445569992065, "learning_rate": 0.00014676974047487577, "loss": 1.8139, "num_input_tokens_seen": 8730224, "step": 1452, "train_runtime": 1465.9078, "train_tokens_per_second": 5955.507 }, { "epoch": 0.5344367816091954, "grad_norm": 0.7330206632614136, "learning_rate": 0.00014673292840051538, "loss": 1.7346, "num_input_tokens_seen": 8735536, "step": 1453, "train_runtime": 1466.7838, "train_tokens_per_second": 5955.572 }, { "epoch": 0.5348045977011494, "grad_norm": 0.7850086092948914, "learning_rate": 0.000146696116326155, "loss": 1.7919, "num_input_tokens_seen": 8740368, "step": 1454, "train_runtime": 1467.6293, "train_tokens_per_second": 5955.433 }, { "epoch": 0.5351724137931034, "grad_norm": 0.7872830629348755, "learning_rate": 0.0001466593042517946, "loss": 2.0429, "num_input_tokens_seen": 8745520, "step": 1455, "train_runtime": 1468.5106, "train_tokens_per_second": 5955.367 }, { "epoch": 0.5355402298850575, "grad_norm": 0.743243932723999, "learning_rate": 0.0001466224921774342, "loss": 1.9007, "num_input_tokens_seen": 8750992, "step": 1456, "train_runtime": 1469.4036, "train_tokens_per_second": 5955.472 }, { "epoch": 0.5359080459770115, "grad_norm": 0.7098945379257202, "learning_rate": 0.0001465856801030738, "loss": 1.9738, "num_input_tokens_seen": 8756368, "step": 1457, "train_runtime": 1470.3048, "train_tokens_per_second": 5955.478 }, { "epoch": 0.5362758620689655, "grad_norm": 0.7724363207817078, "learning_rate": 0.00014654886802871342, "loss": 1.8807, "num_input_tokens_seen": 8761376, "step": 1458, "train_runtime": 1471.161, "train_tokens_per_second": 5955.416 }, { "epoch": 0.5366436781609195, "grad_norm": 0.7502484321594238, "learning_rate": 0.00014651205595435306, "loss": 1.6915, "num_input_tokens_seen": 8766192, "step": 1459, "train_runtime": 1472.01, "train_tokens_per_second": 5955.253 }, { "epoch": 0.5370114942528735, "grad_norm": 0.6478996276855469, "learning_rate": 0.00014647524387999264, "loss": 1.7703, "num_input_tokens_seen": 8772624, "step": 1460, "train_runtime": 1473.0389, "train_tokens_per_second": 5955.46 }, { "epoch": 0.5373793103448276, "grad_norm": 0.7149221301078796, "learning_rate": 0.00014643843180563225, "loss": 1.6999, "num_input_tokens_seen": 8777968, "step": 1461, "train_runtime": 1473.912, "train_tokens_per_second": 5955.558 }, { "epoch": 0.5377471264367816, "grad_norm": 0.7612764835357666, "learning_rate": 0.00014640161973127186, "loss": 1.7736, "num_input_tokens_seen": 8783584, "step": 1462, "train_runtime": 1474.8196, "train_tokens_per_second": 5955.701 }, { "epoch": 0.5381149425287356, "grad_norm": 0.8812617659568787, "learning_rate": 0.00014636480765691147, "loss": 1.9525, "num_input_tokens_seen": 8789696, "step": 1463, "train_runtime": 1475.7964, "train_tokens_per_second": 5955.9 }, { "epoch": 0.5384827586206896, "grad_norm": 0.7720367312431335, "learning_rate": 0.00014632799558255108, "loss": 1.836, "num_input_tokens_seen": 8796368, "step": 1464, "train_runtime": 1476.8689, "train_tokens_per_second": 5956.093 }, { "epoch": 0.5388505747126436, "grad_norm": 0.802435040473938, "learning_rate": 0.00014629118350819068, "loss": 1.8637, "num_input_tokens_seen": 8804656, "step": 1465, "train_runtime": 1478.1706, "train_tokens_per_second": 5956.454 }, { "epoch": 0.5392183908045977, "grad_norm": 0.7168628573417664, "learning_rate": 0.0001462543714338303, "loss": 1.6763, "num_input_tokens_seen": 8809744, "step": 1466, "train_runtime": 1479.0385, "train_tokens_per_second": 5956.399 }, { "epoch": 0.5395862068965517, "grad_norm": 0.7387890815734863, "learning_rate": 0.0001462175593594699, "loss": 1.7679, "num_input_tokens_seen": 8817200, "step": 1467, "train_runtime": 1480.2136, "train_tokens_per_second": 5956.708 }, { "epoch": 0.5399540229885057, "grad_norm": 0.7312313914299011, "learning_rate": 0.00014618074728510954, "loss": 1.7397, "num_input_tokens_seen": 8822592, "step": 1468, "train_runtime": 1481.1268, "train_tokens_per_second": 5956.676 }, { "epoch": 0.5403218390804597, "grad_norm": 0.7393628358840942, "learning_rate": 0.00014614393521074915, "loss": 1.6317, "num_input_tokens_seen": 8829520, "step": 1469, "train_runtime": 1482.2097, "train_tokens_per_second": 5956.998 }, { "epoch": 0.5406896551724137, "grad_norm": 0.7658875584602356, "learning_rate": 0.00014610712313638876, "loss": 1.7367, "num_input_tokens_seen": 8834592, "step": 1470, "train_runtime": 1483.0665, "train_tokens_per_second": 5956.976 }, { "epoch": 0.5410574712643678, "grad_norm": 0.8385458588600159, "learning_rate": 0.00014607031106202836, "loss": 1.7231, "num_input_tokens_seen": 8839808, "step": 1471, "train_runtime": 1484.4497, "train_tokens_per_second": 5954.939 }, { "epoch": 0.5414252873563219, "grad_norm": 0.8299917578697205, "learning_rate": 0.00014603349898766797, "loss": 1.8165, "num_input_tokens_seen": 8845632, "step": 1472, "train_runtime": 1485.4174, "train_tokens_per_second": 5954.981 }, { "epoch": 0.5417931034482759, "grad_norm": 0.7017998695373535, "learning_rate": 0.00014599668691330756, "loss": 1.7511, "num_input_tokens_seen": 8851744, "step": 1473, "train_runtime": 1486.4067, "train_tokens_per_second": 5955.129 }, { "epoch": 0.5421609195402299, "grad_norm": 0.832878589630127, "learning_rate": 0.00014595987483894716, "loss": 1.9765, "num_input_tokens_seen": 8856320, "step": 1474, "train_runtime": 1487.2134, "train_tokens_per_second": 5954.976 }, { "epoch": 0.542528735632184, "grad_norm": 0.6871554851531982, "learning_rate": 0.00014592306276458677, "loss": 1.6499, "num_input_tokens_seen": 8861040, "step": 1475, "train_runtime": 1488.0334, "train_tokens_per_second": 5954.866 }, { "epoch": 0.542896551724138, "grad_norm": 0.7615302205085754, "learning_rate": 0.0001458862506902264, "loss": 1.7343, "num_input_tokens_seen": 8865904, "step": 1476, "train_runtime": 1488.8609, "train_tokens_per_second": 5954.823 }, { "epoch": 0.543264367816092, "grad_norm": 0.8005667924880981, "learning_rate": 0.00014584943861586602, "loss": 1.9106, "num_input_tokens_seen": 8870800, "step": 1477, "train_runtime": 1489.693, "train_tokens_per_second": 5954.784 }, { "epoch": 0.543632183908046, "grad_norm": 0.8917537331581116, "learning_rate": 0.00014581262654150563, "loss": 1.834, "num_input_tokens_seen": 8879760, "step": 1478, "train_runtime": 1491.0717, "train_tokens_per_second": 5955.287 }, { "epoch": 0.544, "grad_norm": 0.716110110282898, "learning_rate": 0.00014577581446714524, "loss": 1.8432, "num_input_tokens_seen": 8886960, "step": 1479, "train_runtime": 1492.2273, "train_tokens_per_second": 5955.5 }, { "epoch": 0.5443678160919541, "grad_norm": 0.736108660697937, "learning_rate": 0.00014573900239278484, "loss": 1.6274, "num_input_tokens_seen": 8894736, "step": 1480, "train_runtime": 1493.4512, "train_tokens_per_second": 5955.827 }, { "epoch": 0.5447356321839081, "grad_norm": 0.7554885745048523, "learning_rate": 0.00014570219031842445, "loss": 1.8776, "num_input_tokens_seen": 8900208, "step": 1481, "train_runtime": 1494.3712, "train_tokens_per_second": 5955.821 }, { "epoch": 0.5451034482758621, "grad_norm": 0.7288740277290344, "learning_rate": 0.00014566537824406406, "loss": 1.7232, "num_input_tokens_seen": 8906448, "step": 1482, "train_runtime": 1495.3899, "train_tokens_per_second": 5955.937 }, { "epoch": 0.5454712643678161, "grad_norm": 0.6896114349365234, "learning_rate": 0.00014562856616970367, "loss": 1.6443, "num_input_tokens_seen": 8912032, "step": 1483, "train_runtime": 1496.3142, "train_tokens_per_second": 5955.99 }, { "epoch": 0.5458390804597701, "grad_norm": 0.7094660997390747, "learning_rate": 0.00014559175409534328, "loss": 1.6302, "num_input_tokens_seen": 8917136, "step": 1484, "train_runtime": 1497.1773, "train_tokens_per_second": 5955.965 }, { "epoch": 0.5462068965517242, "grad_norm": 0.7645075917243958, "learning_rate": 0.0001455549420209829, "loss": 1.8246, "num_input_tokens_seen": 8925280, "step": 1485, "train_runtime": 1498.4548, "train_tokens_per_second": 5956.323 }, { "epoch": 0.5465747126436782, "grad_norm": 0.7458211183547974, "learning_rate": 0.0001455181299466225, "loss": 1.9777, "num_input_tokens_seen": 8929664, "step": 1486, "train_runtime": 1499.2019, "train_tokens_per_second": 5956.279 }, { "epoch": 0.5469425287356322, "grad_norm": 0.7357628345489502, "learning_rate": 0.0001454813178722621, "loss": 1.7962, "num_input_tokens_seen": 8934400, "step": 1487, "train_runtime": 1500.0131, "train_tokens_per_second": 5956.215 }, { "epoch": 0.5473103448275862, "grad_norm": 0.7921798825263977, "learning_rate": 0.00014544450579790172, "loss": 1.9475, "num_input_tokens_seen": 8939488, "step": 1488, "train_runtime": 1500.8562, "train_tokens_per_second": 5956.259 }, { "epoch": 0.5476781609195402, "grad_norm": 0.6897305846214294, "learning_rate": 0.00014540769372354132, "loss": 1.6873, "num_input_tokens_seen": 8945168, "step": 1489, "train_runtime": 1501.7927, "train_tokens_per_second": 5956.327 }, { "epoch": 0.5480459770114943, "grad_norm": 0.7136052846908569, "learning_rate": 0.00014537088164918093, "loss": 1.7006, "num_input_tokens_seen": 8951696, "step": 1490, "train_runtime": 1502.8463, "train_tokens_per_second": 5956.495 }, { "epoch": 0.5484137931034483, "grad_norm": 0.716546356678009, "learning_rate": 0.00014533406957482054, "loss": 1.8145, "num_input_tokens_seen": 8956768, "step": 1491, "train_runtime": 1503.6865, "train_tokens_per_second": 5956.54 }, { "epoch": 0.5487816091954023, "grad_norm": 0.7017339468002319, "learning_rate": 0.00014529725750046015, "loss": 1.7564, "num_input_tokens_seen": 8962176, "step": 1492, "train_runtime": 1504.5732, "train_tokens_per_second": 5956.623 }, { "epoch": 0.5491494252873563, "grad_norm": 0.7172056436538696, "learning_rate": 0.0001452604454260998, "loss": 1.6274, "num_input_tokens_seen": 8966976, "step": 1493, "train_runtime": 1505.3678, "train_tokens_per_second": 5956.668 }, { "epoch": 0.5495172413793104, "grad_norm": 0.719150960445404, "learning_rate": 0.0001452236333517394, "loss": 1.6852, "num_input_tokens_seen": 8972080, "step": 1494, "train_runtime": 1506.2439, "train_tokens_per_second": 5956.592 }, { "epoch": 0.5498850574712644, "grad_norm": 0.6909351348876953, "learning_rate": 0.000145186821277379, "loss": 1.6893, "num_input_tokens_seen": 8977792, "step": 1495, "train_runtime": 1507.1743, "train_tokens_per_second": 5956.705 }, { "epoch": 0.5502528735632184, "grad_norm": 0.7258477807044983, "learning_rate": 0.0001451500092030186, "loss": 1.8736, "num_input_tokens_seen": 8982656, "step": 1496, "train_runtime": 1507.9864, "train_tokens_per_second": 5956.722 }, { "epoch": 0.5506206896551724, "grad_norm": 0.7304890155792236, "learning_rate": 0.0001451131971286582, "loss": 1.9225, "num_input_tokens_seen": 8988592, "step": 1497, "train_runtime": 1508.9593, "train_tokens_per_second": 5956.816 }, { "epoch": 0.5509885057471264, "grad_norm": 0.7762201428413391, "learning_rate": 0.0001450763850542978, "loss": 1.8553, "num_input_tokens_seen": 8993248, "step": 1498, "train_runtime": 1509.7696, "train_tokens_per_second": 5956.702 }, { "epoch": 0.5513563218390805, "grad_norm": 0.6422848105430603, "learning_rate": 0.00014503957297993741, "loss": 1.7149, "num_input_tokens_seen": 8999744, "step": 1499, "train_runtime": 1510.7929, "train_tokens_per_second": 5956.968 }, { "epoch": 0.5517241379310345, "grad_norm": 0.7266050577163696, "learning_rate": 0.00014500276090557702, "loss": 1.8602, "num_input_tokens_seen": 9004432, "step": 1500, "train_runtime": 1511.6212, "train_tokens_per_second": 5956.805 }, { "epoch": 0.5520919540229885, "grad_norm": 0.721544623374939, "learning_rate": 0.00014496594883121663, "loss": 1.5666, "num_input_tokens_seen": 9009488, "step": 1501, "train_runtime": 1513.0064, "train_tokens_per_second": 5954.693 }, { "epoch": 0.5524597701149425, "grad_norm": 0.8202746510505676, "learning_rate": 0.00014492913675685627, "loss": 1.834, "num_input_tokens_seen": 9014608, "step": 1502, "train_runtime": 1513.855, "train_tokens_per_second": 5954.737 }, { "epoch": 0.5528275862068965, "grad_norm": 0.6941748261451721, "learning_rate": 0.00014489232468249588, "loss": 1.6427, "num_input_tokens_seen": 9020256, "step": 1503, "train_runtime": 1514.786, "train_tokens_per_second": 5954.806 }, { "epoch": 0.5531954022988506, "grad_norm": 0.7136889696121216, "learning_rate": 0.00014485551260813549, "loss": 1.7417, "num_input_tokens_seen": 9026224, "step": 1504, "train_runtime": 1515.7735, "train_tokens_per_second": 5954.863 }, { "epoch": 0.5535632183908046, "grad_norm": 0.7266203761100769, "learning_rate": 0.0001448187005337751, "loss": 1.7972, "num_input_tokens_seen": 9032240, "step": 1505, "train_runtime": 1516.7763, "train_tokens_per_second": 5954.893 }, { "epoch": 0.5539310344827586, "grad_norm": 0.6732388138771057, "learning_rate": 0.0001447818884594147, "loss": 1.7354, "num_input_tokens_seen": 9037376, "step": 1506, "train_runtime": 1517.6366, "train_tokens_per_second": 5954.901 }, { "epoch": 0.5542988505747126, "grad_norm": 0.7037345170974731, "learning_rate": 0.0001447450763850543, "loss": 1.7045, "num_input_tokens_seen": 9045904, "step": 1507, "train_runtime": 1518.9749, "train_tokens_per_second": 5955.269 }, { "epoch": 0.5546666666666666, "grad_norm": 0.7394117712974548, "learning_rate": 0.00014470826431069392, "loss": 1.8442, "num_input_tokens_seen": 9051856, "step": 1508, "train_runtime": 1519.9305, "train_tokens_per_second": 5955.441 }, { "epoch": 0.5550344827586207, "grad_norm": 0.7001480460166931, "learning_rate": 0.0001446714522363335, "loss": 1.7071, "num_input_tokens_seen": 9056784, "step": 1509, "train_runtime": 1520.7739, "train_tokens_per_second": 5955.378 }, { "epoch": 0.5554022988505747, "grad_norm": 0.8510955572128296, "learning_rate": 0.00014463464016197314, "loss": 1.885, "num_input_tokens_seen": 9061984, "step": 1510, "train_runtime": 1521.6431, "train_tokens_per_second": 5955.394 }, { "epoch": 0.5557701149425287, "grad_norm": 0.7102080583572388, "learning_rate": 0.00014459782808761275, "loss": 1.7542, "num_input_tokens_seen": 9067248, "step": 1511, "train_runtime": 1522.52, "train_tokens_per_second": 5955.421 }, { "epoch": 0.5561379310344827, "grad_norm": 0.7432495355606079, "learning_rate": 0.00014456101601325236, "loss": 1.7311, "num_input_tokens_seen": 9074384, "step": 1512, "train_runtime": 1523.6388, "train_tokens_per_second": 5955.732 }, { "epoch": 0.5565057471264367, "grad_norm": 0.7131504416465759, "learning_rate": 0.00014452420393889197, "loss": 1.8028, "num_input_tokens_seen": 9081296, "step": 1513, "train_runtime": 1524.7709, "train_tokens_per_second": 5955.843 }, { "epoch": 0.5568735632183908, "grad_norm": 0.7579213976860046, "learning_rate": 0.00014448739186453157, "loss": 1.7905, "num_input_tokens_seen": 9086800, "step": 1514, "train_runtime": 1525.6932, "train_tokens_per_second": 5955.85 }, { "epoch": 0.5572413793103448, "grad_norm": 0.7163369059562683, "learning_rate": 0.00014445057979017118, "loss": 1.785, "num_input_tokens_seen": 9091984, "step": 1515, "train_runtime": 1526.5762, "train_tokens_per_second": 5955.801 }, { "epoch": 0.5576091954022988, "grad_norm": 0.7238402962684631, "learning_rate": 0.0001444137677158108, "loss": 1.8952, "num_input_tokens_seen": 9096720, "step": 1516, "train_runtime": 1527.403, "train_tokens_per_second": 5955.678 }, { "epoch": 0.5579770114942528, "grad_norm": 0.6420456767082214, "learning_rate": 0.0001443769556414504, "loss": 1.6005, "num_input_tokens_seen": 9103920, "step": 1517, "train_runtime": 1528.547, "train_tokens_per_second": 5955.931 }, { "epoch": 0.5583448275862068, "grad_norm": 0.7540795803070068, "learning_rate": 0.00014434014356709, "loss": 1.764, "num_input_tokens_seen": 9110816, "step": 1518, "train_runtime": 1529.6538, "train_tokens_per_second": 5956.129 }, { "epoch": 0.5587126436781609, "grad_norm": 0.7519972920417786, "learning_rate": 0.00014430333149272962, "loss": 1.6031, "num_input_tokens_seen": 9117616, "step": 1519, "train_runtime": 1530.7302, "train_tokens_per_second": 5956.383 }, { "epoch": 0.5590804597701149, "grad_norm": 0.9189901947975159, "learning_rate": 0.00014426651941836923, "loss": 1.9835, "num_input_tokens_seen": 9122400, "step": 1520, "train_runtime": 1531.5378, "train_tokens_per_second": 5956.366 }, { "epoch": 0.5594482758620689, "grad_norm": 0.7206523418426514, "learning_rate": 0.00014422970734400884, "loss": 1.8126, "num_input_tokens_seen": 9128368, "step": 1521, "train_runtime": 1532.5308, "train_tokens_per_second": 5956.401 }, { "epoch": 0.559816091954023, "grad_norm": 0.7543719410896301, "learning_rate": 0.00014419289526964845, "loss": 1.7646, "num_input_tokens_seen": 9134016, "step": 1522, "train_runtime": 1533.4732, "train_tokens_per_second": 5956.424 }, { "epoch": 0.5601839080459771, "grad_norm": 0.7814950346946716, "learning_rate": 0.00014415608319528805, "loss": 1.8127, "num_input_tokens_seen": 9139088, "step": 1523, "train_runtime": 1534.3196, "train_tokens_per_second": 5956.443 }, { "epoch": 0.5605517241379311, "grad_norm": 0.736058235168457, "learning_rate": 0.00014411927112092766, "loss": 1.7082, "num_input_tokens_seen": 9145120, "step": 1524, "train_runtime": 1535.308, "train_tokens_per_second": 5956.538 }, { "epoch": 0.5609195402298851, "grad_norm": 0.7190161347389221, "learning_rate": 0.00014408245904656727, "loss": 1.8945, "num_input_tokens_seen": 9154080, "step": 1525, "train_runtime": 1536.7074, "train_tokens_per_second": 5956.944 }, { "epoch": 0.5612873563218391, "grad_norm": 0.7549131512641907, "learning_rate": 0.00014404564697220688, "loss": 1.8791, "num_input_tokens_seen": 9159280, "step": 1526, "train_runtime": 1537.5611, "train_tokens_per_second": 5957.018 }, { "epoch": 0.5616551724137931, "grad_norm": 0.6511595249176025, "learning_rate": 0.0001440088348978465, "loss": 1.7814, "num_input_tokens_seen": 9165888, "step": 1527, "train_runtime": 1538.6242, "train_tokens_per_second": 5957.197 }, { "epoch": 0.5620229885057472, "grad_norm": 0.7519131898880005, "learning_rate": 0.00014397202282348613, "loss": 1.6841, "num_input_tokens_seen": 9172544, "step": 1528, "train_runtime": 1539.6694, "train_tokens_per_second": 5957.476 }, { "epoch": 0.5623908045977012, "grad_norm": 0.6885892152786255, "learning_rate": 0.00014393521074912573, "loss": 1.7104, "num_input_tokens_seen": 9178688, "step": 1529, "train_runtime": 1540.6876, "train_tokens_per_second": 5957.527 }, { "epoch": 0.5627586206896552, "grad_norm": 0.7921882271766663, "learning_rate": 0.00014389839867476534, "loss": 1.8299, "num_input_tokens_seen": 9183648, "step": 1530, "train_runtime": 1541.5326, "train_tokens_per_second": 5957.479 }, { "epoch": 0.5631264367816092, "grad_norm": 0.7679993510246277, "learning_rate": 0.00014386158660040495, "loss": 1.5701, "num_input_tokens_seen": 9190976, "step": 1531, "train_runtime": 1543.1608, "train_tokens_per_second": 5955.942 }, { "epoch": 0.5634942528735633, "grad_norm": 0.789773166179657, "learning_rate": 0.00014382477452604453, "loss": 1.9069, "num_input_tokens_seen": 9196048, "step": 1532, "train_runtime": 1544.0384, "train_tokens_per_second": 5955.842 }, { "epoch": 0.5638620689655173, "grad_norm": 0.8108073472976685, "learning_rate": 0.00014378796245168414, "loss": 1.6931, "num_input_tokens_seen": 9201056, "step": 1533, "train_runtime": 1544.874, "train_tokens_per_second": 5955.862 }, { "epoch": 0.5642298850574713, "grad_norm": 0.7268442511558533, "learning_rate": 0.00014375115037732375, "loss": 1.7064, "num_input_tokens_seen": 9206480, "step": 1534, "train_runtime": 1545.7775, "train_tokens_per_second": 5955.889 }, { "epoch": 0.5645977011494253, "grad_norm": 0.6699070930480957, "learning_rate": 0.00014371433830296336, "loss": 1.7518, "num_input_tokens_seen": 9212976, "step": 1535, "train_runtime": 1546.8221, "train_tokens_per_second": 5956.067 }, { "epoch": 0.5649655172413793, "grad_norm": 0.7682430744171143, "learning_rate": 0.000143677526228603, "loss": 1.6584, "num_input_tokens_seen": 9219744, "step": 1536, "train_runtime": 1547.9016, "train_tokens_per_second": 5956.286 }, { "epoch": 0.5653333333333334, "grad_norm": 0.6585272550582886, "learning_rate": 0.0001436407141542426, "loss": 1.738, "num_input_tokens_seen": 9226000, "step": 1537, "train_runtime": 1548.9294, "train_tokens_per_second": 5956.372 }, { "epoch": 0.5657011494252874, "grad_norm": 0.7462416291236877, "learning_rate": 0.00014360390207988221, "loss": 1.605, "num_input_tokens_seen": 9232496, "step": 1538, "train_runtime": 1550.0037, "train_tokens_per_second": 5956.435 }, { "epoch": 0.5660689655172414, "grad_norm": 0.7598044872283936, "learning_rate": 0.00014356709000552182, "loss": 1.6289, "num_input_tokens_seen": 9238400, "step": 1539, "train_runtime": 1550.9758, "train_tokens_per_second": 5956.508 }, { "epoch": 0.5664367816091954, "grad_norm": 0.7205649018287659, "learning_rate": 0.00014353027793116143, "loss": 1.7779, "num_input_tokens_seen": 9243728, "step": 1540, "train_runtime": 1551.8721, "train_tokens_per_second": 5956.501 }, { "epoch": 0.5668045977011494, "grad_norm": 0.6952161192893982, "learning_rate": 0.00014349346585680104, "loss": 1.6689, "num_input_tokens_seen": 9250256, "step": 1541, "train_runtime": 1552.9207, "train_tokens_per_second": 5956.683 }, { "epoch": 0.5671724137931035, "grad_norm": 0.7485373020172119, "learning_rate": 0.00014345665378244065, "loss": 1.8296, "num_input_tokens_seen": 9255984, "step": 1542, "train_runtime": 1553.8545, "train_tokens_per_second": 5956.789 }, { "epoch": 0.5675402298850575, "grad_norm": 0.7204800248146057, "learning_rate": 0.00014341984170808026, "loss": 1.6307, "num_input_tokens_seen": 9260464, "step": 1543, "train_runtime": 1554.6314, "train_tokens_per_second": 5956.694 }, { "epoch": 0.5679080459770115, "grad_norm": 0.7552061676979065, "learning_rate": 0.00014338302963371987, "loss": 1.8105, "num_input_tokens_seen": 9266272, "step": 1544, "train_runtime": 1555.5878, "train_tokens_per_second": 5956.766 }, { "epoch": 0.5682758620689655, "grad_norm": 0.7821717262268066, "learning_rate": 0.00014334621755935948, "loss": 1.9491, "num_input_tokens_seen": 9273712, "step": 1545, "train_runtime": 1556.7733, "train_tokens_per_second": 5957.009 }, { "epoch": 0.5686436781609195, "grad_norm": 0.7952330708503723, "learning_rate": 0.00014330940548499909, "loss": 1.884, "num_input_tokens_seen": 9279344, "step": 1546, "train_runtime": 1557.7073, "train_tokens_per_second": 5957.052 }, { "epoch": 0.5690114942528736, "grad_norm": 0.8070065379142761, "learning_rate": 0.0001432725934106387, "loss": 1.9077, "num_input_tokens_seen": 9283488, "step": 1547, "train_runtime": 1558.4422, "train_tokens_per_second": 5956.902 }, { "epoch": 0.5693793103448276, "grad_norm": 0.77339106798172, "learning_rate": 0.0001432357813362783, "loss": 1.8652, "num_input_tokens_seen": 9288368, "step": 1548, "train_runtime": 1559.2853, "train_tokens_per_second": 5956.811 }, { "epoch": 0.5697471264367816, "grad_norm": 0.7823001146316528, "learning_rate": 0.0001431989692619179, "loss": 1.7667, "num_input_tokens_seen": 9293184, "step": 1549, "train_runtime": 1560.1223, "train_tokens_per_second": 5956.702 }, { "epoch": 0.5701149425287356, "grad_norm": 0.6910526156425476, "learning_rate": 0.00014316215718755752, "loss": 1.5904, "num_input_tokens_seen": 9297824, "step": 1550, "train_runtime": 1560.9223, "train_tokens_per_second": 5956.622 }, { "epoch": 0.5704827586206896, "grad_norm": 0.7571379542350769, "learning_rate": 0.00014312534511319713, "loss": 1.7796, "num_input_tokens_seen": 9304640, "step": 1551, "train_runtime": 1562.0164, "train_tokens_per_second": 5956.813 }, { "epoch": 0.5708505747126437, "grad_norm": 0.7574077844619751, "learning_rate": 0.00014308853303883674, "loss": 1.78, "num_input_tokens_seen": 9309376, "step": 1552, "train_runtime": 1562.8363, "train_tokens_per_second": 5956.719 }, { "epoch": 0.5712183908045977, "grad_norm": 0.659858763217926, "learning_rate": 0.00014305172096447638, "loss": 1.7382, "num_input_tokens_seen": 9315296, "step": 1553, "train_runtime": 1563.8107, "train_tokens_per_second": 5956.793 }, { "epoch": 0.5715862068965517, "grad_norm": 0.7899975776672363, "learning_rate": 0.00014301490889011598, "loss": 1.7475, "num_input_tokens_seen": 9322784, "step": 1554, "train_runtime": 1564.9729, "train_tokens_per_second": 5957.153 }, { "epoch": 0.5719540229885057, "grad_norm": 0.8226660490036011, "learning_rate": 0.0001429780968157556, "loss": 1.781, "num_input_tokens_seen": 9329168, "step": 1555, "train_runtime": 1565.9869, "train_tokens_per_second": 5957.373 }, { "epoch": 0.5723218390804597, "grad_norm": 0.7388761639595032, "learning_rate": 0.00014294128474139517, "loss": 1.7917, "num_input_tokens_seen": 9335648, "step": 1556, "train_runtime": 1567.0516, "train_tokens_per_second": 5957.461 }, { "epoch": 0.5726896551724138, "grad_norm": 0.7576459050178528, "learning_rate": 0.00014290447266703478, "loss": 1.7311, "num_input_tokens_seen": 9342512, "step": 1557, "train_runtime": 1568.1657, "train_tokens_per_second": 5957.605 }, { "epoch": 0.5730574712643678, "grad_norm": 0.6782925724983215, "learning_rate": 0.0001428676605926744, "loss": 1.91, "num_input_tokens_seen": 9348256, "step": 1558, "train_runtime": 1569.1158, "train_tokens_per_second": 5957.658 }, { "epoch": 0.5734252873563218, "grad_norm": 0.7342045903205872, "learning_rate": 0.000142830848518314, "loss": 1.7617, "num_input_tokens_seen": 9360976, "step": 1559, "train_runtime": 1571.017, "train_tokens_per_second": 5958.545 }, { "epoch": 0.5737931034482758, "grad_norm": 0.7207436561584473, "learning_rate": 0.0001427940364439536, "loss": 1.8567, "num_input_tokens_seen": 9370688, "step": 1560, "train_runtime": 1572.4884, "train_tokens_per_second": 5959.146 }, { "epoch": 0.5741609195402299, "grad_norm": 0.7182794809341431, "learning_rate": 0.00014275722436959322, "loss": 1.9529, "num_input_tokens_seen": 9377184, "step": 1561, "train_runtime": 1574.0252, "train_tokens_per_second": 5957.455 }, { "epoch": 0.5745287356321839, "grad_norm": 0.7070382237434387, "learning_rate": 0.00014272041229523286, "loss": 1.6306, "num_input_tokens_seen": 9383136, "step": 1562, "train_runtime": 1575.0102, "train_tokens_per_second": 5957.508 }, { "epoch": 0.5748965517241379, "grad_norm": 0.7206614017486572, "learning_rate": 0.00014268360022087246, "loss": 1.5928, "num_input_tokens_seen": 9388704, "step": 1563, "train_runtime": 1575.9126, "train_tokens_per_second": 5957.63 }, { "epoch": 0.5752643678160919, "grad_norm": 0.7111892700195312, "learning_rate": 0.00014264678814651207, "loss": 1.8206, "num_input_tokens_seen": 9394832, "step": 1564, "train_runtime": 1576.8991, "train_tokens_per_second": 5957.789 }, { "epoch": 0.5756321839080459, "grad_norm": 0.7477349638938904, "learning_rate": 0.00014260997607215168, "loss": 1.7513, "num_input_tokens_seen": 9400608, "step": 1565, "train_runtime": 1577.8661, "train_tokens_per_second": 5957.798 }, { "epoch": 0.576, "grad_norm": 0.8348462581634521, "learning_rate": 0.0001425731639977913, "loss": 1.8731, "num_input_tokens_seen": 9406448, "step": 1566, "train_runtime": 1578.8117, "train_tokens_per_second": 5957.929 }, { "epoch": 0.576367816091954, "grad_norm": 0.7648438811302185, "learning_rate": 0.0001425363519234309, "loss": 1.893, "num_input_tokens_seen": 9411600, "step": 1567, "train_runtime": 1579.6747, "train_tokens_per_second": 5957.936 }, { "epoch": 0.576735632183908, "grad_norm": 0.7014155983924866, "learning_rate": 0.0001424995398490705, "loss": 1.7945, "num_input_tokens_seen": 9417312, "step": 1568, "train_runtime": 1580.6089, "train_tokens_per_second": 5958.028 }, { "epoch": 0.577103448275862, "grad_norm": 0.7736544013023376, "learning_rate": 0.0001424627277747101, "loss": 1.7166, "num_input_tokens_seen": 9422848, "step": 1569, "train_runtime": 1581.532, "train_tokens_per_second": 5958.051 }, { "epoch": 0.577471264367816, "grad_norm": 0.8276627659797668, "learning_rate": 0.00014242591570034973, "loss": 1.6446, "num_input_tokens_seen": 9428288, "step": 1570, "train_runtime": 1582.4178, "train_tokens_per_second": 5958.153 }, { "epoch": 0.5778390804597701, "grad_norm": 0.7937006950378418, "learning_rate": 0.00014238910362598934, "loss": 1.7648, "num_input_tokens_seen": 9433824, "step": 1571, "train_runtime": 1583.3446, "train_tokens_per_second": 5958.162 }, { "epoch": 0.5782068965517242, "grad_norm": 0.743634819984436, "learning_rate": 0.00014235229155162894, "loss": 1.765, "num_input_tokens_seen": 9441504, "step": 1572, "train_runtime": 1584.5482, "train_tokens_per_second": 5958.483 }, { "epoch": 0.5785747126436782, "grad_norm": 0.7494282126426697, "learning_rate": 0.00014231547947726855, "loss": 1.673, "num_input_tokens_seen": 9450128, "step": 1573, "train_runtime": 1585.8436, "train_tokens_per_second": 5959.054 }, { "epoch": 0.5789425287356322, "grad_norm": 0.7202593088150024, "learning_rate": 0.00014227866740290816, "loss": 1.682, "num_input_tokens_seen": 9456912, "step": 1574, "train_runtime": 1586.9365, "train_tokens_per_second": 5959.225 }, { "epoch": 0.5793103448275863, "grad_norm": 0.6323804259300232, "learning_rate": 0.00014224185532854777, "loss": 1.7759, "num_input_tokens_seen": 9466832, "step": 1575, "train_runtime": 1588.4478, "train_tokens_per_second": 5959.8 }, { "epoch": 0.5796781609195403, "grad_norm": 0.5556498169898987, "learning_rate": 0.00014220504325418738, "loss": 1.8375, "num_input_tokens_seen": 9478992, "step": 1576, "train_runtime": 1590.229, "train_tokens_per_second": 5960.772 }, { "epoch": 0.5800459770114943, "grad_norm": 0.740181565284729, "learning_rate": 0.000142168231179827, "loss": 1.5583, "num_input_tokens_seen": 9483216, "step": 1577, "train_runtime": 1590.9894, "train_tokens_per_second": 5960.578 }, { "epoch": 0.5804137931034483, "grad_norm": 0.7218865752220154, "learning_rate": 0.0001421314191054666, "loss": 1.672, "num_input_tokens_seen": 9489568, "step": 1578, "train_runtime": 1592.0334, "train_tokens_per_second": 5960.659 }, { "epoch": 0.5807816091954023, "grad_norm": 0.7338588833808899, "learning_rate": 0.0001420946070311062, "loss": 1.8931, "num_input_tokens_seen": 9496256, "step": 1579, "train_runtime": 1593.1098, "train_tokens_per_second": 5960.83 }, { "epoch": 0.5811494252873564, "grad_norm": 0.7787767052650452, "learning_rate": 0.00014205779495674582, "loss": 1.5449, "num_input_tokens_seen": 9501968, "step": 1580, "train_runtime": 1594.0508, "train_tokens_per_second": 5960.894 }, { "epoch": 0.5815172413793104, "grad_norm": 0.5992093682289124, "learning_rate": 0.00014202098288238542, "loss": 1.5074, "num_input_tokens_seen": 9512912, "step": 1581, "train_runtime": 1595.726, "train_tokens_per_second": 5961.494 }, { "epoch": 0.5818850574712644, "grad_norm": 0.7882895469665527, "learning_rate": 0.00014198417080802503, "loss": 1.8337, "num_input_tokens_seen": 9519696, "step": 1582, "train_runtime": 1596.7808, "train_tokens_per_second": 5961.805 }, { "epoch": 0.5822528735632184, "grad_norm": 0.7843197584152222, "learning_rate": 0.00014194735873366464, "loss": 1.7564, "num_input_tokens_seen": 9528960, "step": 1583, "train_runtime": 1598.1963, "train_tokens_per_second": 5962.322 }, { "epoch": 0.5826206896551724, "grad_norm": 0.6911957263946533, "learning_rate": 0.00014191054665930425, "loss": 1.8201, "num_input_tokens_seen": 9534896, "step": 1584, "train_runtime": 1599.1925, "train_tokens_per_second": 5962.319 }, { "epoch": 0.5829885057471265, "grad_norm": 0.6987912058830261, "learning_rate": 0.00014187373458494386, "loss": 1.7853, "num_input_tokens_seen": 9542608, "step": 1585, "train_runtime": 1600.4144, "train_tokens_per_second": 5962.586 }, { "epoch": 0.5833563218390805, "grad_norm": 0.8136776089668274, "learning_rate": 0.00014183692251058347, "loss": 1.9193, "num_input_tokens_seen": 9546944, "step": 1586, "train_runtime": 1601.1843, "train_tokens_per_second": 5962.427 }, { "epoch": 0.5837241379310345, "grad_norm": 0.6825462579727173, "learning_rate": 0.00014180011043622308, "loss": 1.6683, "num_input_tokens_seen": 9552080, "step": 1587, "train_runtime": 1602.0215, "train_tokens_per_second": 5962.517 }, { "epoch": 0.5840919540229885, "grad_norm": 0.7725069522857666, "learning_rate": 0.00014176329836186271, "loss": 1.5494, "num_input_tokens_seen": 9561296, "step": 1588, "train_runtime": 1603.4466, "train_tokens_per_second": 5962.965 }, { "epoch": 0.5844597701149425, "grad_norm": 0.6888120174407959, "learning_rate": 0.00014172648628750232, "loss": 1.8348, "num_input_tokens_seen": 9566608, "step": 1589, "train_runtime": 1604.3389, "train_tokens_per_second": 5962.96 }, { "epoch": 0.5848275862068966, "grad_norm": 0.6902614831924438, "learning_rate": 0.00014168967421314193, "loss": 1.7664, "num_input_tokens_seen": 9573504, "step": 1590, "train_runtime": 1605.4505, "train_tokens_per_second": 5963.126 }, { "epoch": 0.5851954022988506, "grad_norm": 0.6990094184875488, "learning_rate": 0.00014165286213878154, "loss": 1.8354, "num_input_tokens_seen": 9578512, "step": 1591, "train_runtime": 1606.7769, "train_tokens_per_second": 5961.321 }, { "epoch": 0.5855632183908046, "grad_norm": 0.7648910880088806, "learning_rate": 0.00014161605006442112, "loss": 1.938, "num_input_tokens_seen": 9584144, "step": 1592, "train_runtime": 1607.6993, "train_tokens_per_second": 5961.403 }, { "epoch": 0.5859310344827586, "grad_norm": 0.7185373306274414, "learning_rate": 0.00014157923799006073, "loss": 1.7699, "num_input_tokens_seen": 9589712, "step": 1593, "train_runtime": 1608.6148, "train_tokens_per_second": 5961.472 }, { "epoch": 0.5862988505747126, "grad_norm": 0.7881008982658386, "learning_rate": 0.00014154242591570034, "loss": 1.8258, "num_input_tokens_seen": 9593984, "step": 1594, "train_runtime": 1609.4041, "train_tokens_per_second": 5961.203 }, { "epoch": 0.5866666666666667, "grad_norm": 0.7478007674217224, "learning_rate": 0.00014150561384133995, "loss": 1.8598, "num_input_tokens_seen": 9599808, "step": 1595, "train_runtime": 1610.3605, "train_tokens_per_second": 5961.279 }, { "epoch": 0.5870344827586207, "grad_norm": 0.7251457571983337, "learning_rate": 0.00014146880176697958, "loss": 1.9524, "num_input_tokens_seen": 9606384, "step": 1596, "train_runtime": 1611.4233, "train_tokens_per_second": 5961.428 }, { "epoch": 0.5874022988505747, "grad_norm": 0.6985070705413818, "learning_rate": 0.0001414319896926192, "loss": 1.5909, "num_input_tokens_seen": 9613808, "step": 1597, "train_runtime": 1612.6153, "train_tokens_per_second": 5961.625 }, { "epoch": 0.5877701149425287, "grad_norm": 0.723919689655304, "learning_rate": 0.0001413951776182588, "loss": 1.7206, "num_input_tokens_seen": 9620704, "step": 1598, "train_runtime": 1613.7181, "train_tokens_per_second": 5961.825 }, { "epoch": 0.5881379310344828, "grad_norm": 0.6995579600334167, "learning_rate": 0.0001413583655438984, "loss": 1.8156, "num_input_tokens_seen": 9625760, "step": 1599, "train_runtime": 1614.5891, "train_tokens_per_second": 5961.74 }, { "epoch": 0.5885057471264368, "grad_norm": 0.7042402625083923, "learning_rate": 0.00014132155346953802, "loss": 1.7435, "num_input_tokens_seen": 9633712, "step": 1600, "train_runtime": 1615.8097, "train_tokens_per_second": 5962.158 }, { "epoch": 0.5888735632183908, "grad_norm": 0.7484963536262512, "learning_rate": 0.00014128474139517763, "loss": 1.8737, "num_input_tokens_seen": 9638352, "step": 1601, "train_runtime": 1616.6114, "train_tokens_per_second": 5962.071 }, { "epoch": 0.5892413793103448, "grad_norm": 0.7516323328018188, "learning_rate": 0.00014124792932081724, "loss": 1.7346, "num_input_tokens_seen": 9643600, "step": 1602, "train_runtime": 1617.5021, "train_tokens_per_second": 5962.032 }, { "epoch": 0.5896091954022988, "grad_norm": 0.7752770185470581, "learning_rate": 0.00014121111724645685, "loss": 1.9747, "num_input_tokens_seen": 9650528, "step": 1603, "train_runtime": 1618.6587, "train_tokens_per_second": 5962.052 }, { "epoch": 0.5899770114942529, "grad_norm": 0.7031365036964417, "learning_rate": 0.00014117430517209646, "loss": 1.8129, "num_input_tokens_seen": 9655072, "step": 1604, "train_runtime": 1619.4675, "train_tokens_per_second": 5961.881 }, { "epoch": 0.5903448275862069, "grad_norm": 0.724492073059082, "learning_rate": 0.00014113749309773606, "loss": 1.6754, "num_input_tokens_seen": 9660656, "step": 1605, "train_runtime": 1620.3947, "train_tokens_per_second": 5961.915 }, { "epoch": 0.5907126436781609, "grad_norm": 0.7145460844039917, "learning_rate": 0.00014110068102337567, "loss": 1.6511, "num_input_tokens_seen": 9667888, "step": 1606, "train_runtime": 1621.5382, "train_tokens_per_second": 5962.171 }, { "epoch": 0.5910804597701149, "grad_norm": 0.7644027471542358, "learning_rate": 0.00014106386894901528, "loss": 1.9032, "num_input_tokens_seen": 9673024, "step": 1607, "train_runtime": 1622.3767, "train_tokens_per_second": 5962.255 }, { "epoch": 0.5914482758620689, "grad_norm": 0.7568883299827576, "learning_rate": 0.0001410270568746549, "loss": 1.968, "num_input_tokens_seen": 9678736, "step": 1608, "train_runtime": 1623.2874, "train_tokens_per_second": 5962.429 }, { "epoch": 0.591816091954023, "grad_norm": 0.7393959760665894, "learning_rate": 0.0001409902448002945, "loss": 1.7143, "num_input_tokens_seen": 9684064, "step": 1609, "train_runtime": 1624.2223, "train_tokens_per_second": 5962.278 }, { "epoch": 0.592183908045977, "grad_norm": 0.7215691208839417, "learning_rate": 0.0001409534327259341, "loss": 1.5933, "num_input_tokens_seen": 9689936, "step": 1610, "train_runtime": 1625.2071, "train_tokens_per_second": 5962.278 }, { "epoch": 0.592551724137931, "grad_norm": 0.6725964546203613, "learning_rate": 0.00014091662065157372, "loss": 1.5474, "num_input_tokens_seen": 9697424, "step": 1611, "train_runtime": 1626.3965, "train_tokens_per_second": 5962.521 }, { "epoch": 0.592919540229885, "grad_norm": 0.7662464380264282, "learning_rate": 0.00014087980857721333, "loss": 1.6828, "num_input_tokens_seen": 9704816, "step": 1612, "train_runtime": 1627.5835, "train_tokens_per_second": 5962.715 }, { "epoch": 0.593287356321839, "grad_norm": 0.7117657661437988, "learning_rate": 0.00014084299650285296, "loss": 1.8546, "num_input_tokens_seen": 9711792, "step": 1613, "train_runtime": 1628.678, "train_tokens_per_second": 5962.991 }, { "epoch": 0.5936551724137931, "grad_norm": 0.7615235447883606, "learning_rate": 0.00014080618442849257, "loss": 1.7151, "num_input_tokens_seen": 9718368, "step": 1614, "train_runtime": 1629.7387, "train_tokens_per_second": 5963.145 }, { "epoch": 0.5940229885057471, "grad_norm": 0.7365219593048096, "learning_rate": 0.00014076937235413218, "loss": 1.6078, "num_input_tokens_seen": 9723696, "step": 1615, "train_runtime": 1630.6211, "train_tokens_per_second": 5963.185 }, { "epoch": 0.5943908045977011, "grad_norm": 0.7892609238624573, "learning_rate": 0.00014073256027977176, "loss": 1.7772, "num_input_tokens_seen": 9729600, "step": 1616, "train_runtime": 1631.5826, "train_tokens_per_second": 5963.29 }, { "epoch": 0.5947586206896551, "grad_norm": 0.6700955629348755, "learning_rate": 0.00014069574820541137, "loss": 1.9247, "num_input_tokens_seen": 9735536, "step": 1617, "train_runtime": 1632.5541, "train_tokens_per_second": 5963.377 }, { "epoch": 0.5951264367816091, "grad_norm": 0.7988229990005493, "learning_rate": 0.00014065893613105098, "loss": 1.7863, "num_input_tokens_seen": 9741680, "step": 1618, "train_runtime": 1633.5474, "train_tokens_per_second": 5963.512 }, { "epoch": 0.5954942528735632, "grad_norm": 0.7733209133148193, "learning_rate": 0.0001406221240566906, "loss": 1.6866, "num_input_tokens_seen": 9745968, "step": 1619, "train_runtime": 1634.2738, "train_tokens_per_second": 5963.485 }, { "epoch": 0.5958620689655172, "grad_norm": 0.6917933821678162, "learning_rate": 0.0001405853119823302, "loss": 1.8153, "num_input_tokens_seen": 9751280, "step": 1620, "train_runtime": 1635.1591, "train_tokens_per_second": 5963.505 }, { "epoch": 0.5962298850574712, "grad_norm": 0.6422238349914551, "learning_rate": 0.0001405484999079698, "loss": 1.6872, "num_input_tokens_seen": 9757744, "step": 1621, "train_runtime": 1636.7361, "train_tokens_per_second": 5961.709 }, { "epoch": 0.5965977011494253, "grad_norm": 0.7320050001144409, "learning_rate": 0.00014051168783360944, "loss": 1.7059, "num_input_tokens_seen": 9762208, "step": 1622, "train_runtime": 1637.4913, "train_tokens_per_second": 5961.685 }, { "epoch": 0.5969655172413794, "grad_norm": 0.7011889219284058, "learning_rate": 0.00014047487575924905, "loss": 1.7788, "num_input_tokens_seen": 9770480, "step": 1623, "train_runtime": 1638.7633, "train_tokens_per_second": 5962.106 }, { "epoch": 0.5973333333333334, "grad_norm": 0.763520359992981, "learning_rate": 0.00014043806368488866, "loss": 1.9754, "num_input_tokens_seen": 9777408, "step": 1624, "train_runtime": 1639.8716, "train_tokens_per_second": 5962.301 }, { "epoch": 0.5977011494252874, "grad_norm": 0.6897074580192566, "learning_rate": 0.00014040125161052827, "loss": 1.7607, "num_input_tokens_seen": 9783312, "step": 1625, "train_runtime": 1640.8268, "train_tokens_per_second": 5962.428 }, { "epoch": 0.5980689655172414, "grad_norm": 0.781053364276886, "learning_rate": 0.00014036443953616788, "loss": 1.7596, "num_input_tokens_seen": 9788368, "step": 1626, "train_runtime": 1641.6773, "train_tokens_per_second": 5962.419 }, { "epoch": 0.5984367816091954, "grad_norm": 0.8557214736938477, "learning_rate": 0.0001403276274618075, "loss": 1.7264, "num_input_tokens_seen": 9794640, "step": 1627, "train_runtime": 1642.6856, "train_tokens_per_second": 5962.577 }, { "epoch": 0.5988045977011495, "grad_norm": 0.8663838505744934, "learning_rate": 0.0001402908153874471, "loss": 1.6593, "num_input_tokens_seen": 9800224, "step": 1628, "train_runtime": 1643.6044, "train_tokens_per_second": 5962.642 }, { "epoch": 0.5991724137931035, "grad_norm": 0.7625656723976135, "learning_rate": 0.00014025400331308668, "loss": 1.7317, "num_input_tokens_seen": 9805936, "step": 1629, "train_runtime": 1644.5428, "train_tokens_per_second": 5962.713 }, { "epoch": 0.5995402298850575, "grad_norm": 0.7845171093940735, "learning_rate": 0.00014021719123872631, "loss": 1.9655, "num_input_tokens_seen": 9811808, "step": 1630, "train_runtime": 1645.5052, "train_tokens_per_second": 5962.794 }, { "epoch": 0.5999080459770115, "grad_norm": 0.7410557270050049, "learning_rate": 0.00014018037916436592, "loss": 1.8309, "num_input_tokens_seen": 9816880, "step": 1631, "train_runtime": 1646.3463, "train_tokens_per_second": 5962.828 }, { "epoch": 0.6002758620689655, "grad_norm": 0.7271944880485535, "learning_rate": 0.00014014356709000553, "loss": 1.7485, "num_input_tokens_seen": 9825328, "step": 1632, "train_runtime": 1647.6708, "train_tokens_per_second": 5963.162 }, { "epoch": 0.6002758620689655, "eval_loss": 1.798221468925476, "eval_runtime": 4.7872, "eval_samples_per_second": 208.892, "eval_steps_per_second": 13.16, "num_input_tokens_seen": 9825328, "step": 1632 }, { "epoch": 0.6006436781609196, "grad_norm": 0.7300437688827515, "learning_rate": 0.00014010675501564514, "loss": 1.609, "num_input_tokens_seen": 9832016, "step": 1633, "train_runtime": 1653.5168, "train_tokens_per_second": 5946.124 }, { "epoch": 0.6010114942528736, "grad_norm": 0.7482008934020996, "learning_rate": 0.00014006994294128475, "loss": 1.8593, "num_input_tokens_seen": 9838368, "step": 1634, "train_runtime": 1654.5654, "train_tokens_per_second": 5946.195 }, { "epoch": 0.6013793103448276, "grad_norm": 0.7498264908790588, "learning_rate": 0.00014003313086692436, "loss": 1.8512, "num_input_tokens_seen": 9848592, "step": 1635, "train_runtime": 1656.1239, "train_tokens_per_second": 5946.772 }, { "epoch": 0.6017471264367816, "grad_norm": 0.6734253764152527, "learning_rate": 0.00013999631879256397, "loss": 1.8363, "num_input_tokens_seen": 9856048, "step": 1636, "train_runtime": 1657.2965, "train_tokens_per_second": 5947.064 }, { "epoch": 0.6021149425287357, "grad_norm": 0.7074384093284607, "learning_rate": 0.00013995950671820358, "loss": 1.7518, "num_input_tokens_seen": 9862304, "step": 1637, "train_runtime": 1658.3, "train_tokens_per_second": 5947.237 }, { "epoch": 0.6024827586206897, "grad_norm": 0.6251190900802612, "learning_rate": 0.00013992269464384319, "loss": 1.6581, "num_input_tokens_seen": 9882384, "step": 1638, "train_runtime": 1661.1535, "train_tokens_per_second": 5949.11 }, { "epoch": 0.6028505747126437, "grad_norm": 0.7110159397125244, "learning_rate": 0.0001398858825694828, "loss": 1.9105, "num_input_tokens_seen": 9887760, "step": 1639, "train_runtime": 1662.0336, "train_tokens_per_second": 5949.194 }, { "epoch": 0.6032183908045977, "grad_norm": 0.8627580404281616, "learning_rate": 0.0001398490704951224, "loss": 1.6832, "num_input_tokens_seen": 9893584, "step": 1640, "train_runtime": 1662.9878, "train_tokens_per_second": 5949.282 }, { "epoch": 0.6035862068965517, "grad_norm": 0.7155346274375916, "learning_rate": 0.000139812258420762, "loss": 1.7047, "num_input_tokens_seen": 9898928, "step": 1641, "train_runtime": 1663.8888, "train_tokens_per_second": 5949.273 }, { "epoch": 0.6039540229885058, "grad_norm": 0.8029899001121521, "learning_rate": 0.00013977544634640162, "loss": 2.0038, "num_input_tokens_seen": 9903856, "step": 1642, "train_runtime": 1664.7325, "train_tokens_per_second": 5949.218 }, { "epoch": 0.6043218390804598, "grad_norm": 0.7011070847511292, "learning_rate": 0.00013973863427204123, "loss": 1.7154, "num_input_tokens_seen": 9909568, "step": 1643, "train_runtime": 1665.6688, "train_tokens_per_second": 5949.303 }, { "epoch": 0.6046896551724138, "grad_norm": 0.8248561024665833, "learning_rate": 0.00013970182219768084, "loss": 1.9599, "num_input_tokens_seen": 9916320, "step": 1644, "train_runtime": 1666.7481, "train_tokens_per_second": 5949.501 }, { "epoch": 0.6050574712643678, "grad_norm": 0.692307710647583, "learning_rate": 0.00013966501012332045, "loss": 1.7467, "num_input_tokens_seen": 9922192, "step": 1645, "train_runtime": 1667.7328, "train_tokens_per_second": 5949.51 }, { "epoch": 0.6054252873563218, "grad_norm": 0.7132775783538818, "learning_rate": 0.00013962819804896006, "loss": 1.736, "num_input_tokens_seen": 9935904, "step": 1646, "train_runtime": 1669.7171, "train_tokens_per_second": 5950.651 }, { "epoch": 0.6057931034482759, "grad_norm": 0.7879961133003235, "learning_rate": 0.00013959138597459967, "loss": 1.8888, "num_input_tokens_seen": 9941536, "step": 1647, "train_runtime": 1670.6597, "train_tokens_per_second": 5950.665 }, { "epoch": 0.6061609195402299, "grad_norm": 0.8213357329368591, "learning_rate": 0.0001395545739002393, "loss": 1.8003, "num_input_tokens_seen": 9946304, "step": 1648, "train_runtime": 1671.4905, "train_tokens_per_second": 5950.56 }, { "epoch": 0.6065287356321839, "grad_norm": 0.7963126301765442, "learning_rate": 0.0001395177618258789, "loss": 1.7383, "num_input_tokens_seen": 9951376, "step": 1649, "train_runtime": 1672.3473, "train_tokens_per_second": 5950.544 }, { "epoch": 0.6068965517241379, "grad_norm": 0.7608811855316162, "learning_rate": 0.00013948094975151852, "loss": 1.9336, "num_input_tokens_seen": 9958048, "step": 1650, "train_runtime": 1673.4209, "train_tokens_per_second": 5950.713 }, { "epoch": 0.6072643678160919, "grad_norm": 0.8075297474861145, "learning_rate": 0.00013944413767715813, "loss": 1.8932, "num_input_tokens_seen": 9962608, "step": 1651, "train_runtime": 1674.7239, "train_tokens_per_second": 5948.806 }, { "epoch": 0.607632183908046, "grad_norm": 0.7269268035888672, "learning_rate": 0.0001394073256027977, "loss": 1.7587, "num_input_tokens_seen": 9969648, "step": 1652, "train_runtime": 1675.8584, "train_tokens_per_second": 5948.98 }, { "epoch": 0.608, "grad_norm": 0.7436178922653198, "learning_rate": 0.00013937051352843732, "loss": 1.9583, "num_input_tokens_seen": 9974880, "step": 1653, "train_runtime": 1676.7301, "train_tokens_per_second": 5949.008 }, { "epoch": 0.608367816091954, "grad_norm": 0.6937170028686523, "learning_rate": 0.00013933370145407693, "loss": 1.736, "num_input_tokens_seen": 9980448, "step": 1654, "train_runtime": 1677.6689, "train_tokens_per_second": 5948.998 }, { "epoch": 0.608735632183908, "grad_norm": 0.7714893817901611, "learning_rate": 0.00013929688937971654, "loss": 1.652, "num_input_tokens_seen": 9984864, "step": 1655, "train_runtime": 1678.4509, "train_tokens_per_second": 5948.857 }, { "epoch": 0.609103448275862, "grad_norm": 0.7302749156951904, "learning_rate": 0.00013926007730535617, "loss": 1.8014, "num_input_tokens_seen": 9990048, "step": 1656, "train_runtime": 1679.3369, "train_tokens_per_second": 5948.805 }, { "epoch": 0.6094712643678161, "grad_norm": 0.7291936278343201, "learning_rate": 0.00013922326523099578, "loss": 1.7244, "num_input_tokens_seen": 10000960, "step": 1657, "train_runtime": 1680.9856, "train_tokens_per_second": 5949.462 }, { "epoch": 0.6098390804597701, "grad_norm": 0.7018803954124451, "learning_rate": 0.0001391864531566354, "loss": 1.807, "num_input_tokens_seen": 10006240, "step": 1658, "train_runtime": 1681.8686, "train_tokens_per_second": 5949.478 }, { "epoch": 0.6102068965517241, "grad_norm": 0.7114816904067993, "learning_rate": 0.000139149641082275, "loss": 1.6622, "num_input_tokens_seen": 10012336, "step": 1659, "train_runtime": 1682.859, "train_tokens_per_second": 5949.599 }, { "epoch": 0.6105747126436781, "grad_norm": 0.7551282644271851, "learning_rate": 0.0001391128290079146, "loss": 1.8038, "num_input_tokens_seen": 10017248, "step": 1660, "train_runtime": 1683.6945, "train_tokens_per_second": 5949.564 }, { "epoch": 0.6109425287356322, "grad_norm": 0.7015314102172852, "learning_rate": 0.00013907601693355422, "loss": 1.7449, "num_input_tokens_seen": 10024160, "step": 1661, "train_runtime": 1684.8099, "train_tokens_per_second": 5949.728 }, { "epoch": 0.6113103448275862, "grad_norm": 0.709729790687561, "learning_rate": 0.00013903920485919383, "loss": 1.7064, "num_input_tokens_seen": 10029104, "step": 1662, "train_runtime": 1685.6684, "train_tokens_per_second": 5949.631 }, { "epoch": 0.6116781609195402, "grad_norm": 0.6485025882720947, "learning_rate": 0.00013900239278483343, "loss": 1.7677, "num_input_tokens_seen": 10036672, "step": 1663, "train_runtime": 1686.8448, "train_tokens_per_second": 5949.968 }, { "epoch": 0.6120459770114942, "grad_norm": 0.7688760757446289, "learning_rate": 0.00013896558071047304, "loss": 1.7656, "num_input_tokens_seen": 10041584, "step": 1664, "train_runtime": 1687.697, "train_tokens_per_second": 5949.874 }, { "epoch": 0.6124137931034482, "grad_norm": 0.7552171945571899, "learning_rate": 0.00013892876863611265, "loss": 1.8779, "num_input_tokens_seen": 10048672, "step": 1665, "train_runtime": 1688.8181, "train_tokens_per_second": 5950.121 }, { "epoch": 0.6127816091954023, "grad_norm": 0.770167350769043, "learning_rate": 0.00013889195656175226, "loss": 1.7685, "num_input_tokens_seen": 10054176, "step": 1666, "train_runtime": 1689.7469, "train_tokens_per_second": 5950.108 }, { "epoch": 0.6131494252873563, "grad_norm": 0.6745887398719788, "learning_rate": 0.00013885514448739187, "loss": 1.6688, "num_input_tokens_seen": 10061808, "step": 1667, "train_runtime": 1690.9469, "train_tokens_per_second": 5950.399 }, { "epoch": 0.6135172413793103, "grad_norm": 0.757714569568634, "learning_rate": 0.00013881833241303148, "loss": 1.7799, "num_input_tokens_seen": 10066816, "step": 1668, "train_runtime": 1691.7745, "train_tokens_per_second": 5950.448 }, { "epoch": 0.6138850574712643, "grad_norm": 0.723790168762207, "learning_rate": 0.0001387815203386711, "loss": 1.781, "num_input_tokens_seen": 10072032, "step": 1669, "train_runtime": 1692.6537, "train_tokens_per_second": 5950.439 }, { "epoch": 0.6142528735632183, "grad_norm": 0.8631724715232849, "learning_rate": 0.0001387447082643107, "loss": 1.8296, "num_input_tokens_seen": 10077136, "step": 1670, "train_runtime": 1693.4843, "train_tokens_per_second": 5950.534 }, { "epoch": 0.6146206896551724, "grad_norm": 0.6833540201187134, "learning_rate": 0.0001387078961899503, "loss": 1.7611, "num_input_tokens_seen": 10084496, "step": 1671, "train_runtime": 1694.6263, "train_tokens_per_second": 5950.867 }, { "epoch": 0.6149885057471265, "grad_norm": 0.7217798829078674, "learning_rate": 0.00013867108411558991, "loss": 1.6531, "num_input_tokens_seen": 10089664, "step": 1672, "train_runtime": 1695.4952, "train_tokens_per_second": 5950.866 }, { "epoch": 0.6153563218390805, "grad_norm": 0.7099449634552002, "learning_rate": 0.00013863427204122955, "loss": 1.6828, "num_input_tokens_seen": 10094672, "step": 1673, "train_runtime": 1696.3242, "train_tokens_per_second": 5950.909 }, { "epoch": 0.6157241379310345, "grad_norm": 0.746695339679718, "learning_rate": 0.00013859745996686916, "loss": 1.9705, "num_input_tokens_seen": 10100064, "step": 1674, "train_runtime": 1697.2443, "train_tokens_per_second": 5950.861 }, { "epoch": 0.6160919540229886, "grad_norm": 0.8037787079811096, "learning_rate": 0.00013856064789250874, "loss": 1.9572, "num_input_tokens_seen": 10104512, "step": 1675, "train_runtime": 1698.0032, "train_tokens_per_second": 5950.82 }, { "epoch": 0.6164597701149426, "grad_norm": 0.7081107497215271, "learning_rate": 0.00013852383581814835, "loss": 1.5542, "num_input_tokens_seen": 10114976, "step": 1676, "train_runtime": 1699.5581, "train_tokens_per_second": 5951.533 }, { "epoch": 0.6168275862068966, "grad_norm": 0.7685478329658508, "learning_rate": 0.00013848702374378796, "loss": 1.9161, "num_input_tokens_seen": 10119472, "step": 1677, "train_runtime": 1700.3736, "train_tokens_per_second": 5951.323 }, { "epoch": 0.6171954022988506, "grad_norm": 0.8034707307815552, "learning_rate": 0.00013845021166942757, "loss": 1.8704, "num_input_tokens_seen": 10125040, "step": 1678, "train_runtime": 1701.285, "train_tokens_per_second": 5951.407 }, { "epoch": 0.6175632183908046, "grad_norm": 0.6806014180183411, "learning_rate": 0.00013841339959506718, "loss": 1.7043, "num_input_tokens_seen": 10132832, "step": 1679, "train_runtime": 1702.4977, "train_tokens_per_second": 5951.745 }, { "epoch": 0.6179310344827587, "grad_norm": 0.7518782615661621, "learning_rate": 0.00013837658752070679, "loss": 1.8486, "num_input_tokens_seen": 10138928, "step": 1680, "train_runtime": 1703.4918, "train_tokens_per_second": 5951.85 }, { "epoch": 0.6182988505747127, "grad_norm": 0.7308506369590759, "learning_rate": 0.0001383397754463464, "loss": 1.8203, "num_input_tokens_seen": 10145648, "step": 1681, "train_runtime": 1705.0308, "train_tokens_per_second": 5950.419 }, { "epoch": 0.6186666666666667, "grad_norm": 0.830508828163147, "learning_rate": 0.00013830296337198603, "loss": 1.6679, "num_input_tokens_seen": 10150160, "step": 1682, "train_runtime": 1705.8125, "train_tokens_per_second": 5950.338 }, { "epoch": 0.6190344827586207, "grad_norm": 0.8149420022964478, "learning_rate": 0.00013826615129762564, "loss": 1.8565, "num_input_tokens_seen": 10155296, "step": 1683, "train_runtime": 1706.6886, "train_tokens_per_second": 5950.292 }, { "epoch": 0.6194022988505747, "grad_norm": 0.7269219160079956, "learning_rate": 0.00013822933922326525, "loss": 1.7568, "num_input_tokens_seen": 10160512, "step": 1684, "train_runtime": 1707.5746, "train_tokens_per_second": 5950.26 }, { "epoch": 0.6197701149425288, "grad_norm": 0.7423215508460999, "learning_rate": 0.00013819252714890486, "loss": 1.7513, "num_input_tokens_seen": 10165344, "step": 1685, "train_runtime": 1708.4175, "train_tokens_per_second": 5950.152 }, { "epoch": 0.6201379310344828, "grad_norm": 0.8427226543426514, "learning_rate": 0.00013815571507454447, "loss": 1.9456, "num_input_tokens_seen": 10170464, "step": 1686, "train_runtime": 1709.2529, "train_tokens_per_second": 5950.239 }, { "epoch": 0.6205057471264368, "grad_norm": 0.7710717916488647, "learning_rate": 0.00013811890300018408, "loss": 1.7877, "num_input_tokens_seen": 10174880, "step": 1687, "train_runtime": 1710.0111, "train_tokens_per_second": 5950.184 }, { "epoch": 0.6208735632183908, "grad_norm": 0.7333926558494568, "learning_rate": 0.00013808209092582366, "loss": 1.8212, "num_input_tokens_seen": 10180720, "step": 1688, "train_runtime": 1710.9644, "train_tokens_per_second": 5950.281 }, { "epoch": 0.6212413793103448, "grad_norm": 0.749277651309967, "learning_rate": 0.00013804527885146327, "loss": 1.5334, "num_input_tokens_seen": 10190208, "step": 1689, "train_runtime": 1712.4203, "train_tokens_per_second": 5950.763 }, { "epoch": 0.6216091954022989, "grad_norm": 0.7796466946601868, "learning_rate": 0.0001380084667771029, "loss": 1.6282, "num_input_tokens_seen": 10196304, "step": 1690, "train_runtime": 1713.4181, "train_tokens_per_second": 5950.856 }, { "epoch": 0.6219770114942529, "grad_norm": 0.8130245208740234, "learning_rate": 0.0001379716547027425, "loss": 1.7571, "num_input_tokens_seen": 10201280, "step": 1691, "train_runtime": 1714.253, "train_tokens_per_second": 5950.86 }, { "epoch": 0.6223448275862069, "grad_norm": 0.7046164274215698, "learning_rate": 0.00013793484262838212, "loss": 1.6075, "num_input_tokens_seen": 10206544, "step": 1692, "train_runtime": 1715.0916, "train_tokens_per_second": 5951.02 }, { "epoch": 0.6227126436781609, "grad_norm": 0.7137652039527893, "learning_rate": 0.00013789803055402173, "loss": 1.7459, "num_input_tokens_seen": 10211584, "step": 1693, "train_runtime": 1715.9287, "train_tokens_per_second": 5951.054 }, { "epoch": 0.623080459770115, "grad_norm": 0.7368882894515991, "learning_rate": 0.00013786121847966134, "loss": 1.7421, "num_input_tokens_seen": 10215968, "step": 1694, "train_runtime": 1716.7015, "train_tokens_per_second": 5950.929 }, { "epoch": 0.623448275862069, "grad_norm": 0.7959756851196289, "learning_rate": 0.00013782440640530095, "loss": 2.035, "num_input_tokens_seen": 10221456, "step": 1695, "train_runtime": 1717.6204, "train_tokens_per_second": 5950.94 }, { "epoch": 0.623816091954023, "grad_norm": 0.8156048059463501, "learning_rate": 0.00013778759433094056, "loss": 1.7757, "num_input_tokens_seen": 10229632, "step": 1696, "train_runtime": 1718.8915, "train_tokens_per_second": 5951.296 }, { "epoch": 0.624183908045977, "grad_norm": 0.7234564423561096, "learning_rate": 0.00013775078225658016, "loss": 1.6543, "num_input_tokens_seen": 10235488, "step": 1697, "train_runtime": 1719.8438, "train_tokens_per_second": 5951.406 }, { "epoch": 0.624551724137931, "grad_norm": 0.7619455456733704, "learning_rate": 0.00013771397018221977, "loss": 1.648, "num_input_tokens_seen": 10243344, "step": 1698, "train_runtime": 1721.0519, "train_tokens_per_second": 5951.793 }, { "epoch": 0.624919540229885, "grad_norm": 0.8125543594360352, "learning_rate": 0.00013767715810785938, "loss": 1.99, "num_input_tokens_seen": 10248144, "step": 1699, "train_runtime": 1721.8566, "train_tokens_per_second": 5951.799 }, { "epoch": 0.6252873563218391, "grad_norm": 0.7408743500709534, "learning_rate": 0.000137640346033499, "loss": 1.6796, "num_input_tokens_seen": 10252880, "step": 1700, "train_runtime": 1722.6699, "train_tokens_per_second": 5951.738 }, { "epoch": 0.6256551724137931, "grad_norm": 0.8177375793457031, "learning_rate": 0.0001376035339591386, "loss": 1.7792, "num_input_tokens_seen": 10257168, "step": 1701, "train_runtime": 1723.411, "train_tokens_per_second": 5951.667 }, { "epoch": 0.6260229885057471, "grad_norm": 0.7161668539047241, "learning_rate": 0.0001375667218847782, "loss": 1.6625, "num_input_tokens_seen": 10265856, "step": 1702, "train_runtime": 1724.7605, "train_tokens_per_second": 5952.047 }, { "epoch": 0.6263908045977011, "grad_norm": 0.8035367727279663, "learning_rate": 0.00013752990981041782, "loss": 1.8391, "num_input_tokens_seen": 10271216, "step": 1703, "train_runtime": 1725.6463, "train_tokens_per_second": 5952.098 }, { "epoch": 0.6267586206896552, "grad_norm": 0.7855319976806641, "learning_rate": 0.00013749309773605743, "loss": 1.801, "num_input_tokens_seen": 10277328, "step": 1704, "train_runtime": 1726.6384, "train_tokens_per_second": 5952.218 }, { "epoch": 0.6271264367816092, "grad_norm": 0.7613573670387268, "learning_rate": 0.00013745628566169704, "loss": 1.7867, "num_input_tokens_seen": 10284176, "step": 1705, "train_runtime": 1727.7258, "train_tokens_per_second": 5952.435 }, { "epoch": 0.6274942528735632, "grad_norm": 0.6075987219810486, "learning_rate": 0.00013741947358733664, "loss": 1.5675, "num_input_tokens_seen": 10294688, "step": 1706, "train_runtime": 1729.2841, "train_tokens_per_second": 5953.15 }, { "epoch": 0.6278620689655172, "grad_norm": 0.817808985710144, "learning_rate": 0.00013738266151297625, "loss": 1.8666, "num_input_tokens_seen": 10299344, "step": 1707, "train_runtime": 1730.1032, "train_tokens_per_second": 5953.023 }, { "epoch": 0.6282298850574712, "grad_norm": 0.7143842577934265, "learning_rate": 0.0001373458494386159, "loss": 1.6343, "num_input_tokens_seen": 10305600, "step": 1708, "train_runtime": 1731.1297, "train_tokens_per_second": 5953.107 }, { "epoch": 0.6285977011494253, "grad_norm": 0.7010509967803955, "learning_rate": 0.0001373090373642555, "loss": 1.794, "num_input_tokens_seen": 10310512, "step": 1709, "train_runtime": 1731.968, "train_tokens_per_second": 5953.061 }, { "epoch": 0.6289655172413793, "grad_norm": 0.6494395136833191, "learning_rate": 0.0001372722252898951, "loss": 1.5411, "num_input_tokens_seen": 10316128, "step": 1710, "train_runtime": 1732.884, "train_tokens_per_second": 5953.156 }, { "epoch": 0.6293333333333333, "grad_norm": 0.7045603394508362, "learning_rate": 0.00013723541321553472, "loss": 1.6267, "num_input_tokens_seen": 10321728, "step": 1711, "train_runtime": 1734.3244, "train_tokens_per_second": 5951.44 }, { "epoch": 0.6297011494252873, "grad_norm": 0.7397974133491516, "learning_rate": 0.0001371986011411743, "loss": 1.7847, "num_input_tokens_seen": 10328672, "step": 1712, "train_runtime": 1735.413, "train_tokens_per_second": 5951.708 }, { "epoch": 0.6300689655172413, "grad_norm": 0.7169364094734192, "learning_rate": 0.0001371617890668139, "loss": 1.7564, "num_input_tokens_seen": 10334720, "step": 1713, "train_runtime": 1736.3962, "train_tokens_per_second": 5951.821 }, { "epoch": 0.6304367816091954, "grad_norm": 0.7214260697364807, "learning_rate": 0.00013712497699245352, "loss": 1.7275, "num_input_tokens_seen": 10339904, "step": 1714, "train_runtime": 1737.2741, "train_tokens_per_second": 5951.798 }, { "epoch": 0.6308045977011494, "grad_norm": 0.6682936549186707, "learning_rate": 0.00013708816491809312, "loss": 1.7087, "num_input_tokens_seen": 10346256, "step": 1715, "train_runtime": 1738.3112, "train_tokens_per_second": 5951.901 }, { "epoch": 0.6311724137931034, "grad_norm": 0.7426211833953857, "learning_rate": 0.00013705135284373276, "loss": 1.7421, "num_input_tokens_seen": 10352192, "step": 1716, "train_runtime": 1739.2825, "train_tokens_per_second": 5951.99 }, { "epoch": 0.6315402298850574, "grad_norm": 0.6931152939796448, "learning_rate": 0.00013701454076937237, "loss": 1.6883, "num_input_tokens_seen": 10356544, "step": 1717, "train_runtime": 1740.0553, "train_tokens_per_second": 5951.848 }, { "epoch": 0.6319080459770114, "grad_norm": 0.7280430793762207, "learning_rate": 0.00013697772869501198, "loss": 1.8632, "num_input_tokens_seen": 10363024, "step": 1718, "train_runtime": 1741.0983, "train_tokens_per_second": 5952.004 }, { "epoch": 0.6322758620689655, "grad_norm": 0.6989037394523621, "learning_rate": 0.0001369409166206516, "loss": 1.7903, "num_input_tokens_seen": 10368976, "step": 1719, "train_runtime": 1742.0536, "train_tokens_per_second": 5952.157 }, { "epoch": 0.6326436781609195, "grad_norm": 0.8285207152366638, "learning_rate": 0.0001369041045462912, "loss": 1.876, "num_input_tokens_seen": 10373504, "step": 1720, "train_runtime": 1742.8326, "train_tokens_per_second": 5952.094 }, { "epoch": 0.6330114942528735, "grad_norm": 0.7388542294502258, "learning_rate": 0.0001368672924719308, "loss": 1.8336, "num_input_tokens_seen": 10378272, "step": 1721, "train_runtime": 1743.6549, "train_tokens_per_second": 5952.022 }, { "epoch": 0.6333793103448276, "grad_norm": 0.7335883378982544, "learning_rate": 0.00013683048039757041, "loss": 1.7633, "num_input_tokens_seen": 10384320, "step": 1722, "train_runtime": 1744.6271, "train_tokens_per_second": 5952.172 }, { "epoch": 0.6337471264367817, "grad_norm": 0.7219555377960205, "learning_rate": 0.00013679366832321002, "loss": 1.9432, "num_input_tokens_seen": 10388832, "step": 1723, "train_runtime": 1745.4345, "train_tokens_per_second": 5952.003 }, { "epoch": 0.6341149425287357, "grad_norm": 0.7718085646629333, "learning_rate": 0.00013675685624884963, "loss": 1.6726, "num_input_tokens_seen": 10394112, "step": 1724, "train_runtime": 1746.3262, "train_tokens_per_second": 5951.988 }, { "epoch": 0.6344827586206897, "grad_norm": 0.7376514077186584, "learning_rate": 0.00013672004417448924, "loss": 1.849, "num_input_tokens_seen": 10401728, "step": 1725, "train_runtime": 1747.5016, "train_tokens_per_second": 5952.342 }, { "epoch": 0.6348505747126437, "grad_norm": 0.753606379032135, "learning_rate": 0.00013668323210012885, "loss": 1.5803, "num_input_tokens_seen": 10412208, "step": 1726, "train_runtime": 1749.0547, "train_tokens_per_second": 5953.049 }, { "epoch": 0.6352183908045977, "grad_norm": 0.8534219264984131, "learning_rate": 0.00013664642002576846, "loss": 1.8085, "num_input_tokens_seen": 10419376, "step": 1727, "train_runtime": 1750.2152, "train_tokens_per_second": 5953.197 }, { "epoch": 0.6355862068965518, "grad_norm": 0.6987608671188354, "learning_rate": 0.00013660960795140807, "loss": 1.749, "num_input_tokens_seen": 10427104, "step": 1728, "train_runtime": 1751.4127, "train_tokens_per_second": 5953.539 }, { "epoch": 0.6359540229885058, "grad_norm": 0.8042802810668945, "learning_rate": 0.00013657279587704768, "loss": 1.7879, "num_input_tokens_seen": 10434736, "step": 1729, "train_runtime": 1752.6227, "train_tokens_per_second": 5953.783 }, { "epoch": 0.6363218390804598, "grad_norm": 0.6358485817909241, "learning_rate": 0.00013653598380268728, "loss": 1.5264, "num_input_tokens_seen": 10444912, "step": 1730, "train_runtime": 1754.1559, "train_tokens_per_second": 5954.381 }, { "epoch": 0.6366896551724138, "grad_norm": 0.7460195422172546, "learning_rate": 0.0001364991717283269, "loss": 1.7442, "num_input_tokens_seen": 10450368, "step": 1731, "train_runtime": 1755.0487, "train_tokens_per_second": 5954.46 }, { "epoch": 0.6370574712643678, "grad_norm": 0.7388708591461182, "learning_rate": 0.0001364623596539665, "loss": 1.7638, "num_input_tokens_seen": 10455792, "step": 1732, "train_runtime": 1755.9778, "train_tokens_per_second": 5954.399 }, { "epoch": 0.6374252873563219, "grad_norm": 0.6434199810028076, "learning_rate": 0.00013642554757960614, "loss": 1.6617, "num_input_tokens_seen": 10465408, "step": 1733, "train_runtime": 1757.4856, "train_tokens_per_second": 5954.762 }, { "epoch": 0.6377931034482759, "grad_norm": 0.6927239894866943, "learning_rate": 0.00013638873550524575, "loss": 1.8211, "num_input_tokens_seen": 10472256, "step": 1734, "train_runtime": 1758.5554, "train_tokens_per_second": 5955.033 }, { "epoch": 0.6381609195402299, "grad_norm": 0.7508346438407898, "learning_rate": 0.00013635192343088533, "loss": 1.5389, "num_input_tokens_seen": 10476848, "step": 1735, "train_runtime": 1759.3473, "train_tokens_per_second": 5954.963 }, { "epoch": 0.6385287356321839, "grad_norm": 0.6954201459884644, "learning_rate": 0.00013631511135652494, "loss": 1.749, "num_input_tokens_seen": 10482048, "step": 1736, "train_runtime": 1760.2107, "train_tokens_per_second": 5954.996 }, { "epoch": 0.638896551724138, "grad_norm": 0.7972614169120789, "learning_rate": 0.00013627829928216455, "loss": 1.9329, "num_input_tokens_seen": 10487616, "step": 1737, "train_runtime": 1761.129, "train_tokens_per_second": 5955.053 }, { "epoch": 0.639264367816092, "grad_norm": 0.727857768535614, "learning_rate": 0.00013624148720780416, "loss": 1.7875, "num_input_tokens_seen": 10499600, "step": 1738, "train_runtime": 1762.8783, "train_tokens_per_second": 5955.942 }, { "epoch": 0.639632183908046, "grad_norm": 0.788093626499176, "learning_rate": 0.00013620467513344376, "loss": 1.8738, "num_input_tokens_seen": 10503808, "step": 1739, "train_runtime": 1763.6169, "train_tokens_per_second": 5955.833 }, { "epoch": 0.64, "grad_norm": 0.746026873588562, "learning_rate": 0.00013616786305908337, "loss": 1.5872, "num_input_tokens_seen": 10509504, "step": 1740, "train_runtime": 1764.5378, "train_tokens_per_second": 5955.953 }, { "epoch": 0.640367816091954, "grad_norm": 0.8277755379676819, "learning_rate": 0.00013613105098472298, "loss": 1.9395, "num_input_tokens_seen": 10514608, "step": 1741, "train_runtime": 1765.9185, "train_tokens_per_second": 5954.186 }, { "epoch": 0.640735632183908, "grad_norm": 0.8165010809898376, "learning_rate": 0.00013609423891036262, "loss": 1.8424, "num_input_tokens_seen": 10520272, "step": 1742, "train_runtime": 1766.8628, "train_tokens_per_second": 5954.21 }, { "epoch": 0.6411034482758621, "grad_norm": 0.7696282267570496, "learning_rate": 0.00013605742683600223, "loss": 1.8617, "num_input_tokens_seen": 10525856, "step": 1743, "train_runtime": 1767.7774, "train_tokens_per_second": 5954.288 }, { "epoch": 0.6414712643678161, "grad_norm": 0.7378665804862976, "learning_rate": 0.00013602061476164184, "loss": 1.7307, "num_input_tokens_seen": 10531584, "step": 1744, "train_runtime": 1768.7411, "train_tokens_per_second": 5954.283 }, { "epoch": 0.6418390804597701, "grad_norm": 0.7567402720451355, "learning_rate": 0.00013598380268728145, "loss": 1.7956, "num_input_tokens_seen": 10540384, "step": 1745, "train_runtime": 1770.0833, "train_tokens_per_second": 5954.739 }, { "epoch": 0.6422068965517241, "grad_norm": 0.8224642276763916, "learning_rate": 0.00013594699061292105, "loss": 1.819, "num_input_tokens_seen": 10545552, "step": 1746, "train_runtime": 1770.9408, "train_tokens_per_second": 5954.774 }, { "epoch": 0.6425747126436782, "grad_norm": 0.9020531177520752, "learning_rate": 0.00013591017853856066, "loss": 1.9135, "num_input_tokens_seen": 10550592, "step": 1747, "train_runtime": 1771.8163, "train_tokens_per_second": 5954.676 }, { "epoch": 0.6429425287356322, "grad_norm": 0.7469763159751892, "learning_rate": 0.00013587336646420024, "loss": 1.9463, "num_input_tokens_seen": 10556592, "step": 1748, "train_runtime": 1772.8111, "train_tokens_per_second": 5954.719 }, { "epoch": 0.6433103448275862, "grad_norm": 0.7308046221733093, "learning_rate": 0.00013583655438983985, "loss": 1.9843, "num_input_tokens_seen": 10561792, "step": 1749, "train_runtime": 1773.7013, "train_tokens_per_second": 5954.662 }, { "epoch": 0.6436781609195402, "grad_norm": 0.7411881685256958, "learning_rate": 0.0001357997423154795, "loss": 1.9861, "num_input_tokens_seen": 10566144, "step": 1750, "train_runtime": 1774.4737, "train_tokens_per_second": 5954.523 }, { "epoch": 0.6440459770114942, "grad_norm": 0.7587552070617676, "learning_rate": 0.0001357629302411191, "loss": 1.9987, "num_input_tokens_seen": 10571184, "step": 1751, "train_runtime": 1775.333, "train_tokens_per_second": 5954.48 }, { "epoch": 0.6444137931034483, "grad_norm": 0.7099258303642273, "learning_rate": 0.0001357261181667587, "loss": 1.7047, "num_input_tokens_seen": 10576848, "step": 1752, "train_runtime": 1776.2653, "train_tokens_per_second": 5954.543 }, { "epoch": 0.6447816091954023, "grad_norm": 0.7215557098388672, "learning_rate": 0.00013568930609239832, "loss": 1.7609, "num_input_tokens_seen": 10581920, "step": 1753, "train_runtime": 1777.142, "train_tokens_per_second": 5954.459 }, { "epoch": 0.6451494252873563, "grad_norm": 0.7627148628234863, "learning_rate": 0.00013565249401803793, "loss": 1.8373, "num_input_tokens_seen": 10586704, "step": 1754, "train_runtime": 1777.9699, "train_tokens_per_second": 5954.377 }, { "epoch": 0.6455172413793103, "grad_norm": 0.6375512480735779, "learning_rate": 0.00013561568194367753, "loss": 1.6086, "num_input_tokens_seen": 10594096, "step": 1755, "train_runtime": 1779.1234, "train_tokens_per_second": 5954.672 }, { "epoch": 0.6458850574712643, "grad_norm": 0.7750902771949768, "learning_rate": 0.00013557886986931714, "loss": 1.8008, "num_input_tokens_seen": 10598464, "step": 1756, "train_runtime": 1779.8568, "train_tokens_per_second": 5954.672 }, { "epoch": 0.6462528735632184, "grad_norm": 0.7399452328681946, "learning_rate": 0.00013554205779495675, "loss": 1.716, "num_input_tokens_seen": 10604304, "step": 1757, "train_runtime": 1780.8424, "train_tokens_per_second": 5954.656 }, { "epoch": 0.6466206896551724, "grad_norm": 0.7232922315597534, "learning_rate": 0.00013550524572059636, "loss": 1.6881, "num_input_tokens_seen": 10610480, "step": 1758, "train_runtime": 1781.8633, "train_tokens_per_second": 5954.71 }, { "epoch": 0.6469885057471264, "grad_norm": 0.6953706741333008, "learning_rate": 0.00013546843364623597, "loss": 1.6719, "num_input_tokens_seen": 10616560, "step": 1759, "train_runtime": 1782.8585, "train_tokens_per_second": 5954.797 }, { "epoch": 0.6473563218390804, "grad_norm": 0.714076578617096, "learning_rate": 0.00013543162157187558, "loss": 1.7592, "num_input_tokens_seen": 10623328, "step": 1760, "train_runtime": 1783.9605, "train_tokens_per_second": 5954.912 }, { "epoch": 0.6477241379310344, "grad_norm": 0.7438048720359802, "learning_rate": 0.0001353948094975152, "loss": 1.7207, "num_input_tokens_seen": 10628864, "step": 1761, "train_runtime": 1784.8848, "train_tokens_per_second": 5954.93 }, { "epoch": 0.6480919540229885, "grad_norm": 0.791041374206543, "learning_rate": 0.0001353579974231548, "loss": 1.7115, "num_input_tokens_seen": 10636384, "step": 1762, "train_runtime": 1786.0825, "train_tokens_per_second": 5955.147 }, { "epoch": 0.6484597701149425, "grad_norm": 0.7846536040306091, "learning_rate": 0.0001353211853487944, "loss": 1.8612, "num_input_tokens_seen": 10642704, "step": 1763, "train_runtime": 1787.1234, "train_tokens_per_second": 5955.215 }, { "epoch": 0.6488275862068965, "grad_norm": 0.7329516410827637, "learning_rate": 0.00013528437327443401, "loss": 1.625, "num_input_tokens_seen": 10648160, "step": 1764, "train_runtime": 1788.0154, "train_tokens_per_second": 5955.296 }, { "epoch": 0.6491954022988505, "grad_norm": 0.714447021484375, "learning_rate": 0.00013524756120007362, "loss": 1.766, "num_input_tokens_seen": 10654272, "step": 1765, "train_runtime": 1789.0111, "train_tokens_per_second": 5955.397 }, { "epoch": 0.6495632183908046, "grad_norm": 0.7463008165359497, "learning_rate": 0.00013521074912571323, "loss": 1.8246, "num_input_tokens_seen": 10660864, "step": 1766, "train_runtime": 1790.1083, "train_tokens_per_second": 5955.43 }, { "epoch": 0.6499310344827586, "grad_norm": 0.8064841032028198, "learning_rate": 0.00013517393705135284, "loss": 1.8307, "num_input_tokens_seen": 10665504, "step": 1767, "train_runtime": 1790.9236, "train_tokens_per_second": 5955.309 }, { "epoch": 0.6502988505747126, "grad_norm": 0.7825813293457031, "learning_rate": 0.00013513712497699248, "loss": 1.7428, "num_input_tokens_seen": 10669872, "step": 1768, "train_runtime": 1791.6774, "train_tokens_per_second": 5955.242 }, { "epoch": 0.6506666666666666, "grad_norm": 0.7944249510765076, "learning_rate": 0.00013510031290263209, "loss": 1.8493, "num_input_tokens_seen": 10674368, "step": 1769, "train_runtime": 1792.482, "train_tokens_per_second": 5955.077 }, { "epoch": 0.6510344827586206, "grad_norm": 0.760125994682312, "learning_rate": 0.0001350635008282717, "loss": 1.7274, "num_input_tokens_seen": 10679600, "step": 1770, "train_runtime": 1793.3581, "train_tokens_per_second": 5955.085 }, { "epoch": 0.6514022988505748, "grad_norm": 0.7194905281066895, "learning_rate": 0.0001350266887539113, "loss": 1.7112, "num_input_tokens_seen": 10687776, "step": 1771, "train_runtime": 1795.1084, "train_tokens_per_second": 5953.833 }, { "epoch": 0.6517701149425288, "grad_norm": 0.770473062992096, "learning_rate": 0.00013498987667955089, "loss": 1.6892, "num_input_tokens_seen": 10694480, "step": 1772, "train_runtime": 1796.1946, "train_tokens_per_second": 5953.965 }, { "epoch": 0.6521379310344828, "grad_norm": 0.7285348773002625, "learning_rate": 0.0001349530646051905, "loss": 1.723, "num_input_tokens_seen": 10700432, "step": 1773, "train_runtime": 1797.1615, "train_tokens_per_second": 5954.074 }, { "epoch": 0.6525057471264368, "grad_norm": 0.6952595710754395, "learning_rate": 0.0001349162525308301, "loss": 1.7812, "num_input_tokens_seen": 10705728, "step": 1774, "train_runtime": 1798.0341, "train_tokens_per_second": 5954.129 }, { "epoch": 0.6528735632183909, "grad_norm": 0.7674087285995483, "learning_rate": 0.0001348794404564697, "loss": 1.6874, "num_input_tokens_seen": 10711552, "step": 1775, "train_runtime": 1799.0317, "train_tokens_per_second": 5954.065 }, { "epoch": 0.6532413793103449, "grad_norm": 0.7821603417396545, "learning_rate": 0.00013484262838210935, "loss": 1.7043, "num_input_tokens_seen": 10720400, "step": 1776, "train_runtime": 1800.4336, "train_tokens_per_second": 5954.343 }, { "epoch": 0.6536091954022989, "grad_norm": 0.7462404370307922, "learning_rate": 0.00013480581630774896, "loss": 1.7187, "num_input_tokens_seen": 10725504, "step": 1777, "train_runtime": 1801.2868, "train_tokens_per_second": 5954.357 }, { "epoch": 0.6539770114942529, "grad_norm": 0.7450446486473083, "learning_rate": 0.00013476900423338857, "loss": 1.9282, "num_input_tokens_seen": 10731584, "step": 1778, "train_runtime": 1802.295, "train_tokens_per_second": 5954.399 }, { "epoch": 0.6543448275862069, "grad_norm": 0.7468043565750122, "learning_rate": 0.00013473219215902817, "loss": 1.9602, "num_input_tokens_seen": 10737184, "step": 1779, "train_runtime": 1803.2264, "train_tokens_per_second": 5954.429 }, { "epoch": 0.654712643678161, "grad_norm": 0.6669394969940186, "learning_rate": 0.00013469538008466778, "loss": 1.6997, "num_input_tokens_seen": 10744272, "step": 1780, "train_runtime": 1804.3842, "train_tokens_per_second": 5954.537 }, { "epoch": 0.655080459770115, "grad_norm": 0.7069559097290039, "learning_rate": 0.0001346585680103074, "loss": 1.7087, "num_input_tokens_seen": 10749104, "step": 1781, "train_runtime": 1805.1987, "train_tokens_per_second": 5954.527 }, { "epoch": 0.655448275862069, "grad_norm": 0.725911021232605, "learning_rate": 0.000134621755935947, "loss": 1.6093, "num_input_tokens_seen": 10755392, "step": 1782, "train_runtime": 1806.2113, "train_tokens_per_second": 5954.67 }, { "epoch": 0.655816091954023, "grad_norm": 0.7561075091362, "learning_rate": 0.0001345849438615866, "loss": 1.536, "num_input_tokens_seen": 10762416, "step": 1783, "train_runtime": 1807.3389, "train_tokens_per_second": 5954.841 }, { "epoch": 0.656183908045977, "grad_norm": 0.7972083687782288, "learning_rate": 0.00013454813178722622, "loss": 1.8664, "num_input_tokens_seen": 10766848, "step": 1784, "train_runtime": 1808.094, "train_tokens_per_second": 5954.805 }, { "epoch": 0.6565517241379311, "grad_norm": 0.7465891242027283, "learning_rate": 0.00013451131971286583, "loss": 1.8208, "num_input_tokens_seen": 10772032, "step": 1785, "train_runtime": 1808.9644, "train_tokens_per_second": 5954.806 }, { "epoch": 0.6569195402298851, "grad_norm": 0.7285373210906982, "learning_rate": 0.00013447450763850544, "loss": 1.8164, "num_input_tokens_seen": 10777360, "step": 1786, "train_runtime": 1809.8471, "train_tokens_per_second": 5954.846 }, { "epoch": 0.6572873563218391, "grad_norm": 0.7597459554672241, "learning_rate": 0.00013443769556414505, "loss": 1.5547, "num_input_tokens_seen": 10786320, "step": 1787, "train_runtime": 1811.2173, "train_tokens_per_second": 5955.288 }, { "epoch": 0.6576551724137931, "grad_norm": 0.7373406887054443, "learning_rate": 0.00013440088348978465, "loss": 1.7168, "num_input_tokens_seen": 10791888, "step": 1788, "train_runtime": 1812.1421, "train_tokens_per_second": 5955.321 }, { "epoch": 0.6580229885057471, "grad_norm": 0.8384848237037659, "learning_rate": 0.00013436407141542426, "loss": 1.6351, "num_input_tokens_seen": 10800544, "step": 1789, "train_runtime": 1813.4966, "train_tokens_per_second": 5955.646 }, { "epoch": 0.6583908045977012, "grad_norm": 0.7638373970985413, "learning_rate": 0.00013432725934106387, "loss": 1.6756, "num_input_tokens_seen": 10806704, "step": 1790, "train_runtime": 1814.5051, "train_tokens_per_second": 5955.731 }, { "epoch": 0.6587586206896552, "grad_norm": 0.8199154138565063, "learning_rate": 0.00013429044726670348, "loss": 1.9613, "num_input_tokens_seen": 10811824, "step": 1791, "train_runtime": 1815.3818, "train_tokens_per_second": 5955.675 }, { "epoch": 0.6591264367816092, "grad_norm": 0.6468129754066467, "learning_rate": 0.0001342536351923431, "loss": 1.5419, "num_input_tokens_seen": 10819584, "step": 1792, "train_runtime": 1816.5835, "train_tokens_per_second": 5956.007 }, { "epoch": 0.6594942528735632, "grad_norm": 0.7387782335281372, "learning_rate": 0.00013421682311798273, "loss": 1.7476, "num_input_tokens_seen": 10826496, "step": 1793, "train_runtime": 1817.6847, "train_tokens_per_second": 5956.201 }, { "epoch": 0.6598620689655172, "grad_norm": 0.7090125679969788, "learning_rate": 0.00013418001104362234, "loss": 1.6913, "num_input_tokens_seen": 10835280, "step": 1794, "train_runtime": 1819.0353, "train_tokens_per_second": 5956.608 }, { "epoch": 0.6602298850574713, "grad_norm": 0.6886354088783264, "learning_rate": 0.00013414319896926192, "loss": 1.5162, "num_input_tokens_seen": 10845792, "step": 1795, "train_runtime": 1820.6393, "train_tokens_per_second": 5957.134 }, { "epoch": 0.6605977011494253, "grad_norm": 0.7396478652954102, "learning_rate": 0.00013410638689490153, "loss": 1.7201, "num_input_tokens_seen": 10853200, "step": 1796, "train_runtime": 1821.8114, "train_tokens_per_second": 5957.367 }, { "epoch": 0.6609655172413793, "grad_norm": 0.7231253385543823, "learning_rate": 0.00013406957482054113, "loss": 1.7426, "num_input_tokens_seen": 10858336, "step": 1797, "train_runtime": 1822.6624, "train_tokens_per_second": 5957.404 }, { "epoch": 0.6613333333333333, "grad_norm": 0.7091934084892273, "learning_rate": 0.00013403276274618074, "loss": 1.6118, "num_input_tokens_seen": 10866416, "step": 1798, "train_runtime": 1823.9454, "train_tokens_per_second": 5957.643 }, { "epoch": 0.6617011494252873, "grad_norm": 0.7346258163452148, "learning_rate": 0.00013399595067182035, "loss": 1.8568, "num_input_tokens_seen": 10871264, "step": 1799, "train_runtime": 1824.7824, "train_tokens_per_second": 5957.567 }, { "epoch": 0.6620689655172414, "grad_norm": 0.7573279142379761, "learning_rate": 0.00013395913859745996, "loss": 1.7545, "num_input_tokens_seen": 10875296, "step": 1800, "train_runtime": 1825.5415, "train_tokens_per_second": 5957.299 }, { "epoch": 0.6624367816091954, "grad_norm": 0.7126784324645996, "learning_rate": 0.00013392232652309957, "loss": 1.7663, "num_input_tokens_seen": 10880112, "step": 1801, "train_runtime": 1826.7989, "train_tokens_per_second": 5955.835 }, { "epoch": 0.6628045977011494, "grad_norm": 0.7735157608985901, "learning_rate": 0.0001338855144487392, "loss": 1.7039, "num_input_tokens_seen": 10886160, "step": 1802, "train_runtime": 1827.8044, "train_tokens_per_second": 5955.867 }, { "epoch": 0.6631724137931034, "grad_norm": 0.6788606643676758, "learning_rate": 0.00013384870237437882, "loss": 1.6366, "num_input_tokens_seen": 10891728, "step": 1803, "train_runtime": 1828.7318, "train_tokens_per_second": 5955.891 }, { "epoch": 0.6635402298850575, "grad_norm": 0.7734730243682861, "learning_rate": 0.00013381189030001842, "loss": 1.7109, "num_input_tokens_seen": 10898304, "step": 1804, "train_runtime": 1829.7889, "train_tokens_per_second": 5956.044 }, { "epoch": 0.6639080459770115, "grad_norm": 0.7669985294342041, "learning_rate": 0.00013377507822565803, "loss": 1.8261, "num_input_tokens_seen": 10902800, "step": 1805, "train_runtime": 1830.5775, "train_tokens_per_second": 5955.935 }, { "epoch": 0.6642758620689655, "grad_norm": 0.8388978838920593, "learning_rate": 0.00013373826615129764, "loss": 1.7974, "num_input_tokens_seen": 10909616, "step": 1806, "train_runtime": 1831.6497, "train_tokens_per_second": 5956.169 }, { "epoch": 0.6646436781609195, "grad_norm": 0.7415384650230408, "learning_rate": 0.00013370145407693725, "loss": 1.7101, "num_input_tokens_seen": 10916032, "step": 1807, "train_runtime": 1832.6885, "train_tokens_per_second": 5956.294 }, { "epoch": 0.6650114942528735, "grad_norm": 0.7248274683952332, "learning_rate": 0.00013366464200257683, "loss": 1.8749, "num_input_tokens_seen": 10921952, "step": 1808, "train_runtime": 1833.6336, "train_tokens_per_second": 5956.453 }, { "epoch": 0.6653793103448276, "grad_norm": 0.7237791419029236, "learning_rate": 0.00013362782992821644, "loss": 1.7853, "num_input_tokens_seen": 10927472, "step": 1809, "train_runtime": 1834.5498, "train_tokens_per_second": 5956.487 }, { "epoch": 0.6657471264367816, "grad_norm": 0.7164573669433594, "learning_rate": 0.00013359101785385608, "loss": 1.8934, "num_input_tokens_seen": 10932752, "step": 1810, "train_runtime": 1835.4394, "train_tokens_per_second": 5956.477 }, { "epoch": 0.6661149425287356, "grad_norm": 0.7893067598342896, "learning_rate": 0.00013355420577949569, "loss": 1.6218, "num_input_tokens_seen": 10941600, "step": 1811, "train_runtime": 1836.8188, "train_tokens_per_second": 5956.82 }, { "epoch": 0.6664827586206896, "grad_norm": 0.8066549897193909, "learning_rate": 0.0001335173937051353, "loss": 1.6749, "num_input_tokens_seen": 10946992, "step": 1812, "train_runtime": 1837.7, "train_tokens_per_second": 5956.898 }, { "epoch": 0.6668505747126436, "grad_norm": 0.6956750750541687, "learning_rate": 0.0001334805816307749, "loss": 1.5983, "num_input_tokens_seen": 10953584, "step": 1813, "train_runtime": 1838.7707, "train_tokens_per_second": 5957.015 }, { "epoch": 0.6672183908045977, "grad_norm": 0.7238765954971313, "learning_rate": 0.0001334437695564145, "loss": 1.645, "num_input_tokens_seen": 10958688, "step": 1814, "train_runtime": 1839.6198, "train_tokens_per_second": 5957.04 }, { "epoch": 0.6675862068965517, "grad_norm": 0.8044825792312622, "learning_rate": 0.00013340695748205412, "loss": 1.7582, "num_input_tokens_seen": 10963728, "step": 1815, "train_runtime": 1840.465, "train_tokens_per_second": 5957.042 }, { "epoch": 0.6679540229885057, "grad_norm": 0.7360802888870239, "learning_rate": 0.00013337014540769373, "loss": 1.8713, "num_input_tokens_seen": 10971888, "step": 1816, "train_runtime": 1841.7483, "train_tokens_per_second": 5957.322 }, { "epoch": 0.6683218390804597, "grad_norm": 0.6782446503639221, "learning_rate": 0.00013333333333333334, "loss": 1.6668, "num_input_tokens_seen": 10977072, "step": 1817, "train_runtime": 1842.6362, "train_tokens_per_second": 5957.265 }, { "epoch": 0.6686896551724137, "grad_norm": 0.7192976474761963, "learning_rate": 0.00013329652125897295, "loss": 1.9386, "num_input_tokens_seen": 10982016, "step": 1818, "train_runtime": 1843.4671, "train_tokens_per_second": 5957.262 }, { "epoch": 0.6690574712643678, "grad_norm": 0.7062948346138, "learning_rate": 0.00013325970918461256, "loss": 1.8731, "num_input_tokens_seen": 10987360, "step": 1819, "train_runtime": 1844.3595, "train_tokens_per_second": 5957.277 }, { "epoch": 0.6694252873563218, "grad_norm": 0.7209194302558899, "learning_rate": 0.00013322289711025217, "loss": 1.6957, "num_input_tokens_seen": 10992128, "step": 1820, "train_runtime": 1845.181, "train_tokens_per_second": 5957.209 }, { "epoch": 0.6697931034482759, "grad_norm": 0.7385466694831848, "learning_rate": 0.00013318608503589178, "loss": 1.8945, "num_input_tokens_seen": 10997120, "step": 1821, "train_runtime": 1846.0394, "train_tokens_per_second": 5957.143 }, { "epoch": 0.6701609195402299, "grad_norm": 0.7902348041534424, "learning_rate": 0.00013314927296153138, "loss": 1.6632, "num_input_tokens_seen": 11002160, "step": 1822, "train_runtime": 1846.8926, "train_tokens_per_second": 5957.12 }, { "epoch": 0.670528735632184, "grad_norm": 0.7628754377365112, "learning_rate": 0.000133112460887171, "loss": 1.6967, "num_input_tokens_seen": 11009808, "step": 1823, "train_runtime": 1848.11, "train_tokens_per_second": 5957.334 }, { "epoch": 0.670896551724138, "grad_norm": 0.7581140398979187, "learning_rate": 0.0001330756488128106, "loss": 1.847, "num_input_tokens_seen": 11015088, "step": 1824, "train_runtime": 1849.0022, "train_tokens_per_second": 5957.315 }, { "epoch": 0.671264367816092, "grad_norm": 0.6395372748374939, "learning_rate": 0.0001330388367384502, "loss": 1.7134, "num_input_tokens_seen": 11022160, "step": 1825, "train_runtime": 1850.1106, "train_tokens_per_second": 5957.568 }, { "epoch": 0.671632183908046, "grad_norm": 0.8300169706344604, "learning_rate": 0.00013300202466408982, "loss": 1.8971, "num_input_tokens_seen": 11027040, "step": 1826, "train_runtime": 1850.9352, "train_tokens_per_second": 5957.551 }, { "epoch": 0.672, "grad_norm": 0.7367687225341797, "learning_rate": 0.00013296521258972946, "loss": 1.7755, "num_input_tokens_seen": 11034128, "step": 1827, "train_runtime": 1852.0761, "train_tokens_per_second": 5957.708 }, { "epoch": 0.6723678160919541, "grad_norm": 0.7843712568283081, "learning_rate": 0.00013292840051536906, "loss": 1.7056, "num_input_tokens_seen": 11038624, "step": 1828, "train_runtime": 1852.8793, "train_tokens_per_second": 5957.552 }, { "epoch": 0.6727356321839081, "grad_norm": 0.746307909488678, "learning_rate": 0.00013289158844100867, "loss": 1.8213, "num_input_tokens_seen": 11043632, "step": 1829, "train_runtime": 1853.7329, "train_tokens_per_second": 5957.51 }, { "epoch": 0.6731034482758621, "grad_norm": 0.7821405529975891, "learning_rate": 0.00013285477636664828, "loss": 2.0339, "num_input_tokens_seen": 11048640, "step": 1830, "train_runtime": 1854.5729, "train_tokens_per_second": 5957.512 }, { "epoch": 0.6734712643678161, "grad_norm": 0.7343426942825317, "learning_rate": 0.00013281796429228786, "loss": 1.6836, "num_input_tokens_seen": 11055120, "step": 1831, "train_runtime": 1856.183, "train_tokens_per_second": 5955.835 }, { "epoch": 0.6738390804597701, "grad_norm": 0.7531905770301819, "learning_rate": 0.00013278115221792747, "loss": 1.7754, "num_input_tokens_seen": 11059568, "step": 1832, "train_runtime": 1856.9851, "train_tokens_per_second": 5955.658 }, { "epoch": 0.6742068965517242, "grad_norm": 0.7625032067298889, "learning_rate": 0.00013274434014356708, "loss": 1.8033, "num_input_tokens_seen": 11064608, "step": 1833, "train_runtime": 1857.852, "train_tokens_per_second": 5955.592 }, { "epoch": 0.6745747126436782, "grad_norm": 0.7211398482322693, "learning_rate": 0.0001327075280692067, "loss": 1.9395, "num_input_tokens_seen": 11069888, "step": 1834, "train_runtime": 1858.723, "train_tokens_per_second": 5955.642 }, { "epoch": 0.6749425287356322, "grad_norm": 0.9047591686248779, "learning_rate": 0.0001326707159948463, "loss": 1.8467, "num_input_tokens_seen": 11074624, "step": 1835, "train_runtime": 1859.5346, "train_tokens_per_second": 5955.589 }, { "epoch": 0.6753103448275862, "grad_norm": 0.7916085720062256, "learning_rate": 0.00013263390392048594, "loss": 1.8939, "num_input_tokens_seen": 11079216, "step": 1836, "train_runtime": 1860.3121, "train_tokens_per_second": 5955.569 }, { "epoch": 0.6756781609195402, "grad_norm": 0.8396905660629272, "learning_rate": 0.00013259709184612554, "loss": 1.8422, "num_input_tokens_seen": 11083840, "step": 1837, "train_runtime": 1861.1096, "train_tokens_per_second": 5955.501 }, { "epoch": 0.6760459770114943, "grad_norm": 0.7099091410636902, "learning_rate": 0.00013256027977176515, "loss": 1.7967, "num_input_tokens_seen": 11089040, "step": 1838, "train_runtime": 1862.0071, "train_tokens_per_second": 5955.423 }, { "epoch": 0.6764137931034483, "grad_norm": 0.731762707233429, "learning_rate": 0.00013252346769740476, "loss": 1.6724, "num_input_tokens_seen": 11098848, "step": 1839, "train_runtime": 1863.5256, "train_tokens_per_second": 5955.833 }, { "epoch": 0.6767816091954023, "grad_norm": 0.7560499310493469, "learning_rate": 0.00013248665562304437, "loss": 1.7258, "num_input_tokens_seen": 11105088, "step": 1840, "train_runtime": 1864.5461, "train_tokens_per_second": 5955.92 }, { "epoch": 0.6771494252873563, "grad_norm": 0.7681247591972351, "learning_rate": 0.00013244984354868398, "loss": 1.7083, "num_input_tokens_seen": 11110912, "step": 1841, "train_runtime": 1865.4978, "train_tokens_per_second": 5956.004 }, { "epoch": 0.6775172413793104, "grad_norm": 0.8783697485923767, "learning_rate": 0.0001324130314743236, "loss": 1.8156, "num_input_tokens_seen": 11115904, "step": 1842, "train_runtime": 1866.3432, "train_tokens_per_second": 5955.981 }, { "epoch": 0.6778850574712644, "grad_norm": 0.6927594542503357, "learning_rate": 0.0001323762193999632, "loss": 1.7041, "num_input_tokens_seen": 11120800, "step": 1843, "train_runtime": 1867.2007, "train_tokens_per_second": 5955.868 }, { "epoch": 0.6782528735632184, "grad_norm": 0.7401049733161926, "learning_rate": 0.00013233940732560278, "loss": 1.7515, "num_input_tokens_seen": 11126272, "step": 1844, "train_runtime": 1868.1105, "train_tokens_per_second": 5955.896 }, { "epoch": 0.6786206896551724, "grad_norm": 0.7136857509613037, "learning_rate": 0.00013230259525124242, "loss": 1.7286, "num_input_tokens_seen": 11132528, "step": 1845, "train_runtime": 1869.1201, "train_tokens_per_second": 5956.026 }, { "epoch": 0.6789885057471264, "grad_norm": 0.7986119985580444, "learning_rate": 0.00013226578317688202, "loss": 2.0149, "num_input_tokens_seen": 11139376, "step": 1846, "train_runtime": 1870.2233, "train_tokens_per_second": 5956.174 }, { "epoch": 0.6793563218390805, "grad_norm": 0.7753489017486572, "learning_rate": 0.00013222897110252163, "loss": 1.7657, "num_input_tokens_seen": 11144416, "step": 1847, "train_runtime": 1871.0785, "train_tokens_per_second": 5956.146 }, { "epoch": 0.6797241379310345, "grad_norm": 0.7110564708709717, "learning_rate": 0.00013219215902816124, "loss": 1.6737, "num_input_tokens_seen": 11150544, "step": 1848, "train_runtime": 1872.1052, "train_tokens_per_second": 5956.153 }, { "epoch": 0.6800919540229885, "grad_norm": 0.7208719849586487, "learning_rate": 0.00013215534695380085, "loss": 1.817, "num_input_tokens_seen": 11155776, "step": 1849, "train_runtime": 1872.9985, "train_tokens_per_second": 5956.105 }, { "epoch": 0.6804597701149425, "grad_norm": 0.7724442481994629, "learning_rate": 0.00013211853487944046, "loss": 1.7954, "num_input_tokens_seen": 11161056, "step": 1850, "train_runtime": 1873.8924, "train_tokens_per_second": 5956.082 }, { "epoch": 0.6808275862068965, "grad_norm": 0.7539997100830078, "learning_rate": 0.00013208172280508007, "loss": 1.6489, "num_input_tokens_seen": 11168368, "step": 1851, "train_runtime": 1875.0539, "train_tokens_per_second": 5956.292 }, { "epoch": 0.6811954022988506, "grad_norm": 0.7062416076660156, "learning_rate": 0.00013204491073071968, "loss": 1.4751, "num_input_tokens_seen": 11176256, "step": 1852, "train_runtime": 1876.2653, "train_tokens_per_second": 5956.65 }, { "epoch": 0.6815632183908046, "grad_norm": 0.7522175312042236, "learning_rate": 0.00013200809865635931, "loss": 1.8941, "num_input_tokens_seen": 11182608, "step": 1853, "train_runtime": 1877.2662, "train_tokens_per_second": 5956.858 }, { "epoch": 0.6819310344827586, "grad_norm": 0.7194035649299622, "learning_rate": 0.00013197128658199892, "loss": 1.9232, "num_input_tokens_seen": 11187392, "step": 1854, "train_runtime": 1878.0975, "train_tokens_per_second": 5956.768 }, { "epoch": 0.6822988505747126, "grad_norm": 0.7332926392555237, "learning_rate": 0.0001319344745076385, "loss": 1.6695, "num_input_tokens_seen": 11193280, "step": 1855, "train_runtime": 1879.0632, "train_tokens_per_second": 5956.841 }, { "epoch": 0.6826666666666666, "grad_norm": 0.7417240738868713, "learning_rate": 0.00013189766243327811, "loss": 1.7371, "num_input_tokens_seen": 11198624, "step": 1856, "train_runtime": 1879.9562, "train_tokens_per_second": 5956.854 }, { "epoch": 0.6830344827586207, "grad_norm": 0.7554106712341309, "learning_rate": 0.00013186085035891772, "loss": 1.8963, "num_input_tokens_seen": 11203424, "step": 1857, "train_runtime": 1880.787, "train_tokens_per_second": 5956.774 }, { "epoch": 0.6834022988505747, "grad_norm": 0.7874431014060974, "learning_rate": 0.00013182403828455733, "loss": 1.9356, "num_input_tokens_seen": 11208112, "step": 1858, "train_runtime": 1881.5802, "train_tokens_per_second": 5956.755 }, { "epoch": 0.6837701149425287, "grad_norm": 0.7526617050170898, "learning_rate": 0.00013178722621019694, "loss": 1.6181, "num_input_tokens_seen": 11213488, "step": 1859, "train_runtime": 1882.4626, "train_tokens_per_second": 5956.819 }, { "epoch": 0.6841379310344827, "grad_norm": 0.732140839099884, "learning_rate": 0.00013175041413583655, "loss": 1.6019, "num_input_tokens_seen": 11219840, "step": 1860, "train_runtime": 1883.4777, "train_tokens_per_second": 5956.981 }, { "epoch": 0.6845057471264367, "grad_norm": 0.8277818560600281, "learning_rate": 0.00013171360206147616, "loss": 1.594, "num_input_tokens_seen": 11224816, "step": 1861, "train_runtime": 1884.867, "train_tokens_per_second": 5955.23 }, { "epoch": 0.6848735632183908, "grad_norm": 0.8288012742996216, "learning_rate": 0.0001316767899871158, "loss": 1.6824, "num_input_tokens_seen": 11232544, "step": 1862, "train_runtime": 1886.0893, "train_tokens_per_second": 5955.468 }, { "epoch": 0.6852413793103448, "grad_norm": 0.7560052275657654, "learning_rate": 0.0001316399779127554, "loss": 1.7055, "num_input_tokens_seen": 11238240, "step": 1863, "train_runtime": 1887.0228, "train_tokens_per_second": 5955.54 }, { "epoch": 0.6856091954022988, "grad_norm": 0.6578978896141052, "learning_rate": 0.000131603165838395, "loss": 1.6784, "num_input_tokens_seen": 11247264, "step": 1864, "train_runtime": 1888.3915, "train_tokens_per_second": 5956.002 }, { "epoch": 0.6859770114942528, "grad_norm": 0.7248901724815369, "learning_rate": 0.00013156635376403462, "loss": 1.6512, "num_input_tokens_seen": 11252624, "step": 1865, "train_runtime": 1889.2707, "train_tokens_per_second": 5956.068 }, { "epoch": 0.6863448275862069, "grad_norm": 0.7533191442489624, "learning_rate": 0.00013152954168967423, "loss": 1.9194, "num_input_tokens_seen": 11258496, "step": 1866, "train_runtime": 1890.2607, "train_tokens_per_second": 5956.055 }, { "epoch": 0.6867126436781609, "grad_norm": 0.7918365597724915, "learning_rate": 0.00013149272961531384, "loss": 1.8506, "num_input_tokens_seen": 11263488, "step": 1867, "train_runtime": 1891.1111, "train_tokens_per_second": 5956.016 }, { "epoch": 0.6870804597701149, "grad_norm": 0.7057754397392273, "learning_rate": 0.00013145591754095342, "loss": 1.561, "num_input_tokens_seen": 11270160, "step": 1868, "train_runtime": 1892.1857, "train_tokens_per_second": 5956.16 }, { "epoch": 0.6874482758620689, "grad_norm": 0.8185402750968933, "learning_rate": 0.00013141910546659303, "loss": 2.1177, "num_input_tokens_seen": 11278208, "step": 1869, "train_runtime": 1893.4343, "train_tokens_per_second": 5956.482 }, { "epoch": 0.6878160919540229, "grad_norm": 0.7990933656692505, "learning_rate": 0.00013138229339223267, "loss": 1.7334, "num_input_tokens_seen": 11285120, "step": 1870, "train_runtime": 1894.5252, "train_tokens_per_second": 5956.701 }, { "epoch": 0.6881839080459771, "grad_norm": 0.761961817741394, "learning_rate": 0.00013134548131787227, "loss": 1.6831, "num_input_tokens_seen": 11290672, "step": 1871, "train_runtime": 1895.4421, "train_tokens_per_second": 5956.748 }, { "epoch": 0.6885517241379311, "grad_norm": 0.738158106803894, "learning_rate": 0.00013130866924351188, "loss": 1.8655, "num_input_tokens_seen": 11294960, "step": 1872, "train_runtime": 1896.2095, "train_tokens_per_second": 5956.599 }, { "epoch": 0.6889195402298851, "grad_norm": 0.7615065574645996, "learning_rate": 0.0001312718571691515, "loss": 1.6124, "num_input_tokens_seen": 11300096, "step": 1873, "train_runtime": 1897.0776, "train_tokens_per_second": 5956.581 }, { "epoch": 0.6892873563218391, "grad_norm": 0.6883339285850525, "learning_rate": 0.0001312350450947911, "loss": 1.6175, "num_input_tokens_seen": 11306480, "step": 1874, "train_runtime": 1898.1007, "train_tokens_per_second": 5956.734 }, { "epoch": 0.6896551724137931, "grad_norm": 0.6871680617332458, "learning_rate": 0.0001311982330204307, "loss": 1.6909, "num_input_tokens_seen": 11312192, "step": 1875, "train_runtime": 1899.0291, "train_tokens_per_second": 5956.829 }, { "epoch": 0.6900229885057472, "grad_norm": 0.7546426653862, "learning_rate": 0.00013116142094607032, "loss": 1.8858, "num_input_tokens_seen": 11317920, "step": 1876, "train_runtime": 1899.9744, "train_tokens_per_second": 5956.88 }, { "epoch": 0.6903908045977012, "grad_norm": 0.7262266278266907, "learning_rate": 0.00013112460887170993, "loss": 1.6922, "num_input_tokens_seen": 11325136, "step": 1877, "train_runtime": 1901.1451, "train_tokens_per_second": 5957.008 }, { "epoch": 0.6907586206896552, "grad_norm": 0.7512328624725342, "learning_rate": 0.00013108779679734954, "loss": 1.8147, "num_input_tokens_seen": 11329936, "step": 1878, "train_runtime": 1901.9565, "train_tokens_per_second": 5956.99 }, { "epoch": 0.6911264367816092, "grad_norm": 0.7658445239067078, "learning_rate": 0.00013105098472298915, "loss": 1.7388, "num_input_tokens_seen": 11335920, "step": 1879, "train_runtime": 1902.92, "train_tokens_per_second": 5957.118 }, { "epoch": 0.6914942528735633, "grad_norm": 0.7307431101799011, "learning_rate": 0.00013101417264862875, "loss": 1.8446, "num_input_tokens_seen": 11340384, "step": 1880, "train_runtime": 1903.7032, "train_tokens_per_second": 5957.013 }, { "epoch": 0.6918620689655173, "grad_norm": 0.7976140975952148, "learning_rate": 0.00013097736057426836, "loss": 1.84, "num_input_tokens_seen": 11344672, "step": 1881, "train_runtime": 1904.4681, "train_tokens_per_second": 5956.872 }, { "epoch": 0.6922298850574713, "grad_norm": 0.8744789361953735, "learning_rate": 0.00013094054849990797, "loss": 1.7794, "num_input_tokens_seen": 11350240, "step": 1882, "train_runtime": 1905.4273, "train_tokens_per_second": 5956.795 }, { "epoch": 0.6925977011494253, "grad_norm": 0.6834043264389038, "learning_rate": 0.00013090373642554758, "loss": 1.5589, "num_input_tokens_seen": 11356704, "step": 1883, "train_runtime": 1906.4917, "train_tokens_per_second": 5956.86 }, { "epoch": 0.6929655172413793, "grad_norm": 0.744666337966919, "learning_rate": 0.0001308669243511872, "loss": 1.7072, "num_input_tokens_seen": 11363824, "step": 1884, "train_runtime": 1907.6162, "train_tokens_per_second": 5957.081 }, { "epoch": 0.6933333333333334, "grad_norm": 0.7436920404434204, "learning_rate": 0.0001308301122768268, "loss": 1.8886, "num_input_tokens_seen": 11368656, "step": 1885, "train_runtime": 1908.4117, "train_tokens_per_second": 5957.13 }, { "epoch": 0.6937011494252874, "grad_norm": 0.8020740747451782, "learning_rate": 0.0001307933002024664, "loss": 1.7037, "num_input_tokens_seen": 11376048, "step": 1886, "train_runtime": 1909.57, "train_tokens_per_second": 5957.387 }, { "epoch": 0.6940689655172414, "grad_norm": 0.8908138275146484, "learning_rate": 0.00013075648812810604, "loss": 1.9804, "num_input_tokens_seen": 11380272, "step": 1887, "train_runtime": 1910.3019, "train_tokens_per_second": 5957.316 }, { "epoch": 0.6944367816091954, "grad_norm": 0.664467453956604, "learning_rate": 0.00013071967605374565, "loss": 1.6017, "num_input_tokens_seen": 11386096, "step": 1888, "train_runtime": 1911.2454, "train_tokens_per_second": 5957.422 }, { "epoch": 0.6948045977011494, "grad_norm": 0.7617599368095398, "learning_rate": 0.00013068286397938526, "loss": 1.655, "num_input_tokens_seen": 11392608, "step": 1889, "train_runtime": 1912.2834, "train_tokens_per_second": 5957.594 }, { "epoch": 0.6951724137931035, "grad_norm": 0.7180255055427551, "learning_rate": 0.00013064605190502487, "loss": 1.5084, "num_input_tokens_seen": 11398736, "step": 1890, "train_runtime": 1913.2593, "train_tokens_per_second": 5957.758 }, { "epoch": 0.6955402298850575, "grad_norm": 0.7027455568313599, "learning_rate": 0.00013060923983066445, "loss": 1.5955, "num_input_tokens_seen": 11407920, "step": 1891, "train_runtime": 1915.1687, "train_tokens_per_second": 5956.614 }, { "epoch": 0.6959080459770115, "grad_norm": 0.8807379007339478, "learning_rate": 0.00013057242775630406, "loss": 1.9017, "num_input_tokens_seen": 11415568, "step": 1892, "train_runtime": 1916.3593, "train_tokens_per_second": 5956.904 }, { "epoch": 0.6962758620689655, "grad_norm": 0.7481083273887634, "learning_rate": 0.00013053561568194367, "loss": 1.6372, "num_input_tokens_seen": 11421568, "step": 1893, "train_runtime": 1917.3738, "train_tokens_per_second": 5956.881 }, { "epoch": 0.6966436781609195, "grad_norm": 0.6700345873832703, "learning_rate": 0.00013049880360758328, "loss": 1.6483, "num_input_tokens_seen": 11428208, "step": 1894, "train_runtime": 1918.4374, "train_tokens_per_second": 5957.04 }, { "epoch": 0.6970114942528736, "grad_norm": 0.7736784815788269, "learning_rate": 0.0001304619915332229, "loss": 1.6346, "num_input_tokens_seen": 11434000, "step": 1895, "train_runtime": 1919.3645, "train_tokens_per_second": 5957.18 }, { "epoch": 0.6973793103448276, "grad_norm": 0.7341681122779846, "learning_rate": 0.00013042517945886252, "loss": 1.7157, "num_input_tokens_seen": 11438944, "step": 1896, "train_runtime": 1920.2291, "train_tokens_per_second": 5957.073 }, { "epoch": 0.6977471264367816, "grad_norm": 0.7348836064338684, "learning_rate": 0.00013038836738450213, "loss": 1.5479, "num_input_tokens_seen": 11445344, "step": 1897, "train_runtime": 1921.2621, "train_tokens_per_second": 5957.201 }, { "epoch": 0.6981149425287356, "grad_norm": 0.7838300466537476, "learning_rate": 0.00013035155531014174, "loss": 1.6346, "num_input_tokens_seen": 11451840, "step": 1898, "train_runtime": 1922.2957, "train_tokens_per_second": 5957.377 }, { "epoch": 0.6984827586206896, "grad_norm": 0.7902573943138123, "learning_rate": 0.00013031474323578135, "loss": 1.7418, "num_input_tokens_seen": 11457312, "step": 1899, "train_runtime": 1923.1835, "train_tokens_per_second": 5957.472 }, { "epoch": 0.6988505747126437, "grad_norm": 0.6877724528312683, "learning_rate": 0.00013027793116142096, "loss": 1.6553, "num_input_tokens_seen": 11462464, "step": 1900, "train_runtime": 1924.0756, "train_tokens_per_second": 5957.388 }, { "epoch": 0.6992183908045977, "grad_norm": 0.8958332538604736, "learning_rate": 0.00013024111908706057, "loss": 1.6905, "num_input_tokens_seen": 11467136, "step": 1901, "train_runtime": 1924.875, "train_tokens_per_second": 5957.341 }, { "epoch": 0.6995862068965517, "grad_norm": 0.7542179226875305, "learning_rate": 0.00013020430701270018, "loss": 1.5782, "num_input_tokens_seen": 11471520, "step": 1902, "train_runtime": 1925.6698, "train_tokens_per_second": 5957.158 }, { "epoch": 0.6999540229885057, "grad_norm": 0.7624781727790833, "learning_rate": 0.00013016749493833979, "loss": 1.6267, "num_input_tokens_seen": 11477936, "step": 1903, "train_runtime": 1926.6957, "train_tokens_per_second": 5957.316 }, { "epoch": 0.7003218390804598, "grad_norm": 0.7376978993415833, "learning_rate": 0.00013013068286397937, "loss": 1.686, "num_input_tokens_seen": 11486512, "step": 1904, "train_runtime": 1928.0176, "train_tokens_per_second": 5957.68 }, { "epoch": 0.7006896551724138, "grad_norm": 0.7072744965553284, "learning_rate": 0.000130093870789619, "loss": 1.5617, "num_input_tokens_seen": 11492464, "step": 1905, "train_runtime": 1929.0047, "train_tokens_per_second": 5957.717 }, { "epoch": 0.7010574712643678, "grad_norm": 0.7275297045707703, "learning_rate": 0.0001300570587152586, "loss": 1.8489, "num_input_tokens_seen": 11500048, "step": 1906, "train_runtime": 1930.1843, "train_tokens_per_second": 5958.005 }, { "epoch": 0.7014252873563218, "grad_norm": 0.7295718193054199, "learning_rate": 0.00013002024664089822, "loss": 1.7177, "num_input_tokens_seen": 11508528, "step": 1907, "train_runtime": 1931.491, "train_tokens_per_second": 5958.365 }, { "epoch": 0.7017931034482758, "grad_norm": 0.7888707518577576, "learning_rate": 0.00012998343456653783, "loss": 1.8384, "num_input_tokens_seen": 11513488, "step": 1908, "train_runtime": 1932.342, "train_tokens_per_second": 5958.308 }, { "epoch": 0.7021609195402299, "grad_norm": 0.7353121638298035, "learning_rate": 0.00012994662249217744, "loss": 1.5916, "num_input_tokens_seen": 11519328, "step": 1909, "train_runtime": 1933.2922, "train_tokens_per_second": 5958.4 }, { "epoch": 0.7025287356321839, "grad_norm": 0.7697341442108154, "learning_rate": 0.00012990981041781705, "loss": 1.8178, "num_input_tokens_seen": 11525088, "step": 1910, "train_runtime": 1934.2349, "train_tokens_per_second": 5958.474 }, { "epoch": 0.7028965517241379, "grad_norm": 0.6874209642410278, "learning_rate": 0.00012987299834345666, "loss": 1.944, "num_input_tokens_seen": 11532992, "step": 1911, "train_runtime": 1935.4912, "train_tokens_per_second": 5958.69 }, { "epoch": 0.7032643678160919, "grad_norm": 0.6833820939064026, "learning_rate": 0.00012983618626909627, "loss": 1.4793, "num_input_tokens_seen": 11538496, "step": 1912, "train_runtime": 1936.4092, "train_tokens_per_second": 5958.707 }, { "epoch": 0.7036321839080459, "grad_norm": 0.7527967095375061, "learning_rate": 0.0001297993741947359, "loss": 1.7455, "num_input_tokens_seen": 11544544, "step": 1913, "train_runtime": 1937.3877, "train_tokens_per_second": 5958.82 }, { "epoch": 0.704, "grad_norm": 0.8245985507965088, "learning_rate": 0.00012976256212037548, "loss": 1.6053, "num_input_tokens_seen": 11549968, "step": 1914, "train_runtime": 1938.2868, "train_tokens_per_second": 5958.854 }, { "epoch": 0.704367816091954, "grad_norm": 0.7384008765220642, "learning_rate": 0.0001297257500460151, "loss": 1.8279, "num_input_tokens_seen": 11555328, "step": 1915, "train_runtime": 1939.1646, "train_tokens_per_second": 5958.921 }, { "epoch": 0.704735632183908, "grad_norm": 0.7503043413162231, "learning_rate": 0.0001296889379716547, "loss": 1.792, "num_input_tokens_seen": 11563120, "step": 1916, "train_runtime": 1940.3784, "train_tokens_per_second": 5959.209 }, { "epoch": 0.705103448275862, "grad_norm": 0.6756961345672607, "learning_rate": 0.0001296521258972943, "loss": 1.6234, "num_input_tokens_seen": 11569088, "step": 1917, "train_runtime": 1941.3312, "train_tokens_per_second": 5959.358 }, { "epoch": 0.705471264367816, "grad_norm": 0.792194128036499, "learning_rate": 0.00012961531382293392, "loss": 1.8971, "num_input_tokens_seen": 11574256, "step": 1918, "train_runtime": 1942.2034, "train_tokens_per_second": 5959.343 }, { "epoch": 0.7058390804597701, "grad_norm": 0.6884828209877014, "learning_rate": 0.00012957850174857353, "loss": 1.728, "num_input_tokens_seen": 11582288, "step": 1919, "train_runtime": 1943.4348, "train_tokens_per_second": 5959.7 }, { "epoch": 0.7062068965517241, "grad_norm": 0.6793946027755737, "learning_rate": 0.00012954168967421314, "loss": 1.5603, "num_input_tokens_seen": 11590112, "step": 1920, "train_runtime": 1944.6731, "train_tokens_per_second": 5959.928 }, { "epoch": 0.7065747126436782, "grad_norm": 0.7928634285926819, "learning_rate": 0.00012950487759985275, "loss": 1.7447, "num_input_tokens_seen": 11596208, "step": 1921, "train_runtime": 1946.1896, "train_tokens_per_second": 5958.416 }, { "epoch": 0.7069425287356322, "grad_norm": 0.8594651818275452, "learning_rate": 0.00012946806552549238, "loss": 1.9975, "num_input_tokens_seen": 11601296, "step": 1922, "train_runtime": 1947.0531, "train_tokens_per_second": 5958.387 }, { "epoch": 0.7073103448275863, "grad_norm": 0.8485431671142578, "learning_rate": 0.000129431253451132, "loss": 1.713, "num_input_tokens_seen": 11607616, "step": 1923, "train_runtime": 1948.0885, "train_tokens_per_second": 5958.464 }, { "epoch": 0.7076781609195403, "grad_norm": 0.7600086331367493, "learning_rate": 0.0001293944413767716, "loss": 1.8426, "num_input_tokens_seen": 11612528, "step": 1924, "train_runtime": 1948.9202, "train_tokens_per_second": 5958.442 }, { "epoch": 0.7080459770114943, "grad_norm": 0.8211314678192139, "learning_rate": 0.0001293576293024112, "loss": 1.8949, "num_input_tokens_seen": 11617152, "step": 1925, "train_runtime": 1949.7238, "train_tokens_per_second": 5958.358 }, { "epoch": 0.7084137931034483, "grad_norm": 0.615080714225769, "learning_rate": 0.00012932081722805082, "loss": 1.7059, "num_input_tokens_seen": 11626176, "step": 1926, "train_runtime": 1951.102, "train_tokens_per_second": 5958.774 }, { "epoch": 0.7087816091954023, "grad_norm": 0.7907627820968628, "learning_rate": 0.00012928400515369043, "loss": 1.6856, "num_input_tokens_seen": 11630752, "step": 1927, "train_runtime": 1951.8731, "train_tokens_per_second": 5958.764 }, { "epoch": 0.7091494252873564, "grad_norm": 0.7222896814346313, "learning_rate": 0.00012924719307933, "loss": 1.5589, "num_input_tokens_seen": 11635424, "step": 1928, "train_runtime": 1952.7017, "train_tokens_per_second": 5958.628 }, { "epoch": 0.7095172413793104, "grad_norm": 0.718788743019104, "learning_rate": 0.00012921038100496962, "loss": 1.5662, "num_input_tokens_seen": 11645120, "step": 1929, "train_runtime": 1954.1959, "train_tokens_per_second": 5959.034 }, { "epoch": 0.7098850574712644, "grad_norm": 0.7751200199127197, "learning_rate": 0.00012917356893060925, "loss": 1.6999, "num_input_tokens_seen": 11650368, "step": 1930, "train_runtime": 1955.0553, "train_tokens_per_second": 5959.099 }, { "epoch": 0.7102528735632184, "grad_norm": 0.8169651627540588, "learning_rate": 0.00012913675685624886, "loss": 1.6364, "num_input_tokens_seen": 11655040, "step": 1931, "train_runtime": 1955.8653, "train_tokens_per_second": 5959.02 }, { "epoch": 0.7106206896551724, "grad_norm": 0.6965715885162354, "learning_rate": 0.00012909994478188847, "loss": 1.648, "num_input_tokens_seen": 11662224, "step": 1932, "train_runtime": 1957.0072, "train_tokens_per_second": 5959.214 }, { "epoch": 0.7109885057471265, "grad_norm": 0.8124786615371704, "learning_rate": 0.00012906313270752808, "loss": 1.81, "num_input_tokens_seen": 11668608, "step": 1933, "train_runtime": 1958.0443, "train_tokens_per_second": 5959.318 }, { "epoch": 0.7113563218390805, "grad_norm": 0.7508975863456726, "learning_rate": 0.0001290263206331677, "loss": 1.6221, "num_input_tokens_seen": 11673376, "step": 1934, "train_runtime": 1958.8372, "train_tokens_per_second": 5959.339 }, { "epoch": 0.7117241379310345, "grad_norm": 0.79662024974823, "learning_rate": 0.0001289895085588073, "loss": 1.9828, "num_input_tokens_seen": 11677600, "step": 1935, "train_runtime": 1959.5708, "train_tokens_per_second": 5959.264 }, { "epoch": 0.7120919540229885, "grad_norm": 0.7343766093254089, "learning_rate": 0.0001289526964844469, "loss": 1.4957, "num_input_tokens_seen": 11684336, "step": 1936, "train_runtime": 1960.6409, "train_tokens_per_second": 5959.447 }, { "epoch": 0.7124597701149425, "grad_norm": 0.7641183733940125, "learning_rate": 0.00012891588441008652, "loss": 1.6359, "num_input_tokens_seen": 11689232, "step": 1937, "train_runtime": 1961.4639, "train_tokens_per_second": 5959.443 }, { "epoch": 0.7128275862068966, "grad_norm": 0.7237861752510071, "learning_rate": 0.00012887907233572612, "loss": 1.7829, "num_input_tokens_seen": 11693904, "step": 1938, "train_runtime": 1962.2659, "train_tokens_per_second": 5959.388 }, { "epoch": 0.7131954022988506, "grad_norm": 0.7369078397750854, "learning_rate": 0.00012884226026136573, "loss": 1.6614, "num_input_tokens_seen": 11700976, "step": 1939, "train_runtime": 1963.3925, "train_tokens_per_second": 5959.57 }, { "epoch": 0.7135632183908046, "grad_norm": 0.8303338289260864, "learning_rate": 0.00012880544818700534, "loss": 1.8742, "num_input_tokens_seen": 11706000, "step": 1940, "train_runtime": 1964.2572, "train_tokens_per_second": 5959.505 }, { "epoch": 0.7139310344827586, "grad_norm": 0.8005943298339844, "learning_rate": 0.00012876863611264495, "loss": 1.6352, "num_input_tokens_seen": 11711152, "step": 1941, "train_runtime": 1965.1197, "train_tokens_per_second": 5959.511 }, { "epoch": 0.7142988505747127, "grad_norm": 0.6863134503364563, "learning_rate": 0.00012873182403828456, "loss": 1.7554, "num_input_tokens_seen": 11716992, "step": 1942, "train_runtime": 1966.0904, "train_tokens_per_second": 5959.539 }, { "epoch": 0.7146666666666667, "grad_norm": 0.6974879503250122, "learning_rate": 0.00012869501196392417, "loss": 1.7619, "num_input_tokens_seen": 11725152, "step": 1943, "train_runtime": 1967.3838, "train_tokens_per_second": 5959.768 }, { "epoch": 0.7150344827586207, "grad_norm": 0.6026696562767029, "learning_rate": 0.00012865819988956378, "loss": 1.5532, "num_input_tokens_seen": 11734640, "step": 1944, "train_runtime": 1968.8399, "train_tokens_per_second": 5960.18 }, { "epoch": 0.7154022988505747, "grad_norm": 0.8114022016525269, "learning_rate": 0.00012862138781520339, "loss": 1.9169, "num_input_tokens_seen": 11738784, "step": 1945, "train_runtime": 1969.5843, "train_tokens_per_second": 5960.031 }, { "epoch": 0.7157701149425287, "grad_norm": 0.7067683339118958, "learning_rate": 0.000128584575740843, "loss": 1.7911, "num_input_tokens_seen": 11743680, "step": 1946, "train_runtime": 1970.4193, "train_tokens_per_second": 5959.99 }, { "epoch": 0.7161379310344828, "grad_norm": 0.7846788167953491, "learning_rate": 0.00012854776366648263, "loss": 1.7656, "num_input_tokens_seen": 11749936, "step": 1947, "train_runtime": 1971.4395, "train_tokens_per_second": 5960.079 }, { "epoch": 0.7165057471264368, "grad_norm": 0.7177066802978516, "learning_rate": 0.00012851095159212224, "loss": 1.6964, "num_input_tokens_seen": 11754080, "step": 1948, "train_runtime": 1972.1799, "train_tokens_per_second": 5959.943 }, { "epoch": 0.7168735632183908, "grad_norm": 0.7986196279525757, "learning_rate": 0.00012847413951776185, "loss": 1.952, "num_input_tokens_seen": 11759520, "step": 1949, "train_runtime": 1973.0671, "train_tokens_per_second": 5960.02 }, { "epoch": 0.7172413793103448, "grad_norm": 0.7428293228149414, "learning_rate": 0.00012843732744340146, "loss": 1.4596, "num_input_tokens_seen": 11766064, "step": 1950, "train_runtime": 1974.1306, "train_tokens_per_second": 5960.124 }, { "epoch": 0.7176091954022988, "grad_norm": 0.6595841646194458, "learning_rate": 0.00012840051536904104, "loss": 1.6227, "num_input_tokens_seen": 11773344, "step": 1951, "train_runtime": 1975.7998, "train_tokens_per_second": 5958.774 }, { "epoch": 0.7179770114942529, "grad_norm": 0.6061815023422241, "learning_rate": 0.00012836370329468065, "loss": 1.588, "num_input_tokens_seen": 11780144, "step": 1952, "train_runtime": 1976.9078, "train_tokens_per_second": 5958.874 }, { "epoch": 0.7183448275862069, "grad_norm": 0.6141793727874756, "learning_rate": 0.00012832689122032026, "loss": 1.4424, "num_input_tokens_seen": 11787712, "step": 1953, "train_runtime": 1978.1196, "train_tokens_per_second": 5959.049 }, { "epoch": 0.7187126436781609, "grad_norm": 0.7297881245613098, "learning_rate": 0.00012829007914595987, "loss": 1.8247, "num_input_tokens_seen": 11792032, "step": 1954, "train_runtime": 1978.8867, "train_tokens_per_second": 5958.922 }, { "epoch": 0.7190804597701149, "grad_norm": 0.8033981323242188, "learning_rate": 0.00012825326707159948, "loss": 1.855, "num_input_tokens_seen": 11797456, "step": 1955, "train_runtime": 1979.8012, "train_tokens_per_second": 5958.91 }, { "epoch": 0.7194482758620689, "grad_norm": 0.6842999458312988, "learning_rate": 0.0001282164549972391, "loss": 1.4373, "num_input_tokens_seen": 11803648, "step": 1956, "train_runtime": 1980.7901, "train_tokens_per_second": 5959.061 }, { "epoch": 0.719816091954023, "grad_norm": 0.7530986070632935, "learning_rate": 0.00012817964292287872, "loss": 1.9147, "num_input_tokens_seen": 11808464, "step": 1957, "train_runtime": 1981.5987, "train_tokens_per_second": 5959.059 }, { "epoch": 0.720183908045977, "grad_norm": 0.8145410418510437, "learning_rate": 0.00012814283084851833, "loss": 1.8343, "num_input_tokens_seen": 11813840, "step": 1958, "train_runtime": 1982.4734, "train_tokens_per_second": 5959.142 }, { "epoch": 0.720551724137931, "grad_norm": 0.754804790019989, "learning_rate": 0.00012810601877415794, "loss": 1.6074, "num_input_tokens_seen": 11819872, "step": 1959, "train_runtime": 1983.461, "train_tokens_per_second": 5959.216 }, { "epoch": 0.720919540229885, "grad_norm": 0.6832389831542969, "learning_rate": 0.00012806920669979755, "loss": 1.4985, "num_input_tokens_seen": 11826448, "step": 1960, "train_runtime": 1984.5438, "train_tokens_per_second": 5959.278 }, { "epoch": 0.721287356321839, "grad_norm": 0.8029295206069946, "learning_rate": 0.00012803239462543716, "loss": 1.6099, "num_input_tokens_seen": 11832944, "step": 1961, "train_runtime": 1985.6032, "train_tokens_per_second": 5959.37 }, { "epoch": 0.7216551724137931, "grad_norm": 0.8071450591087341, "learning_rate": 0.00012799558255107676, "loss": 2.0379, "num_input_tokens_seen": 11837680, "step": 1962, "train_runtime": 1986.3993, "train_tokens_per_second": 5959.366 }, { "epoch": 0.7220229885057471, "grad_norm": 0.7568224668502808, "learning_rate": 0.00012795877047671637, "loss": 1.6085, "num_input_tokens_seen": 11842832, "step": 1963, "train_runtime": 1987.2801, "train_tokens_per_second": 5959.317 }, { "epoch": 0.7223908045977011, "grad_norm": 0.7475882768630981, "learning_rate": 0.00012792195840235596, "loss": 1.8751, "num_input_tokens_seen": 11847632, "step": 1964, "train_runtime": 1988.1143, "train_tokens_per_second": 5959.231 }, { "epoch": 0.7227586206896551, "grad_norm": 0.7568109631538391, "learning_rate": 0.0001278851463279956, "loss": 1.6683, "num_input_tokens_seen": 11852496, "step": 1965, "train_runtime": 1988.9588, "train_tokens_per_second": 5959.146 }, { "epoch": 0.7231264367816091, "grad_norm": 0.8110637664794922, "learning_rate": 0.0001278483342536352, "loss": 1.7528, "num_input_tokens_seen": 11857392, "step": 1966, "train_runtime": 1989.7776, "train_tokens_per_second": 5959.154 }, { "epoch": 0.7234942528735632, "grad_norm": 0.7403090596199036, "learning_rate": 0.0001278115221792748, "loss": 1.8209, "num_input_tokens_seen": 11863360, "step": 1967, "train_runtime": 1990.7431, "train_tokens_per_second": 5959.262 }, { "epoch": 0.7238620689655172, "grad_norm": 0.8106614947319031, "learning_rate": 0.00012777471010491442, "loss": 1.817, "num_input_tokens_seen": 11868656, "step": 1968, "train_runtime": 1991.6255, "train_tokens_per_second": 5959.281 }, { "epoch": 0.7242298850574712, "grad_norm": 0.7311268448829651, "learning_rate": 0.00012773789803055403, "loss": 1.5936, "num_input_tokens_seen": 11878192, "step": 1969, "train_runtime": 1993.0743, "train_tokens_per_second": 5959.734 }, { "epoch": 0.7245977011494252, "grad_norm": 0.8467444777488708, "learning_rate": 0.00012770108595619364, "loss": 1.7505, "num_input_tokens_seen": 11883472, "step": 1970, "train_runtime": 1993.959, "train_tokens_per_second": 5959.737 }, { "epoch": 0.7249655172413794, "grad_norm": 0.7418035864830017, "learning_rate": 0.00012766427388183324, "loss": 1.5061, "num_input_tokens_seen": 11893072, "step": 1971, "train_runtime": 1995.438, "train_tokens_per_second": 5960.131 }, { "epoch": 0.7253333333333334, "grad_norm": 0.8001358509063721, "learning_rate": 0.00012762746180747285, "loss": 1.8678, "num_input_tokens_seen": 11897568, "step": 1972, "train_runtime": 1996.224, "train_tokens_per_second": 5960.036 }, { "epoch": 0.7257011494252874, "grad_norm": 0.7486362457275391, "learning_rate": 0.0001275906497331125, "loss": 1.639, "num_input_tokens_seen": 11904384, "step": 1973, "train_runtime": 1997.3442, "train_tokens_per_second": 5960.106 }, { "epoch": 0.7260689655172414, "grad_norm": 0.7364412546157837, "learning_rate": 0.00012755383765875207, "loss": 1.5826, "num_input_tokens_seen": 11909536, "step": 1974, "train_runtime": 1998.2081, "train_tokens_per_second": 5960.108 }, { "epoch": 0.7264367816091954, "grad_norm": 0.9112614393234253, "learning_rate": 0.00012751702558439168, "loss": 1.7799, "num_input_tokens_seen": 11913888, "step": 1975, "train_runtime": 1998.9613, "train_tokens_per_second": 5960.039 }, { "epoch": 0.7268045977011495, "grad_norm": 0.8161247372627258, "learning_rate": 0.0001274802135100313, "loss": 1.8897, "num_input_tokens_seen": 11919296, "step": 1976, "train_runtime": 1999.8523, "train_tokens_per_second": 5960.088 }, { "epoch": 0.7271724137931035, "grad_norm": 0.7600432634353638, "learning_rate": 0.0001274434014356709, "loss": 1.7352, "num_input_tokens_seen": 11926032, "step": 1977, "train_runtime": 2000.9307, "train_tokens_per_second": 5960.242 }, { "epoch": 0.7275402298850575, "grad_norm": 0.7857576608657837, "learning_rate": 0.0001274065893613105, "loss": 2.3608, "num_input_tokens_seen": 11931232, "step": 1978, "train_runtime": 2001.788, "train_tokens_per_second": 5960.288 }, { "epoch": 0.7279080459770115, "grad_norm": 0.8168516755104065, "learning_rate": 0.00012736977728695012, "loss": 1.8073, "num_input_tokens_seen": 11936000, "step": 1979, "train_runtime": 2002.6203, "train_tokens_per_second": 5960.191 }, { "epoch": 0.7282758620689656, "grad_norm": 0.748710572719574, "learning_rate": 0.00012733296521258972, "loss": 1.666, "num_input_tokens_seen": 11941696, "step": 1980, "train_runtime": 2003.548, "train_tokens_per_second": 5960.274 }, { "epoch": 0.7286436781609196, "grad_norm": 0.6982470750808716, "learning_rate": 0.00012729615313822933, "loss": 1.8343, "num_input_tokens_seen": 11948992, "step": 1981, "train_runtime": 2005.1802, "train_tokens_per_second": 5959.061 }, { "epoch": 0.7290114942528736, "grad_norm": 0.9832120537757874, "learning_rate": 0.00012725934106386897, "loss": 1.8208, "num_input_tokens_seen": 11953600, "step": 1982, "train_runtime": 2005.9987, "train_tokens_per_second": 5958.927 }, { "epoch": 0.7293793103448276, "grad_norm": 0.7828192710876465, "learning_rate": 0.00012722252898950858, "loss": 1.613, "num_input_tokens_seen": 11961408, "step": 1983, "train_runtime": 2007.2128, "train_tokens_per_second": 5959.213 }, { "epoch": 0.7297471264367816, "grad_norm": 0.7174785137176514, "learning_rate": 0.0001271857169151482, "loss": 1.7013, "num_input_tokens_seen": 11966896, "step": 1984, "train_runtime": 2008.1356, "train_tokens_per_second": 5959.207 }, { "epoch": 0.7301149425287357, "grad_norm": 0.7602179050445557, "learning_rate": 0.0001271489048407878, "loss": 1.6543, "num_input_tokens_seen": 11972416, "step": 1985, "train_runtime": 2009.0761, "train_tokens_per_second": 5959.165 }, { "epoch": 0.7304827586206897, "grad_norm": 0.8048250675201416, "learning_rate": 0.0001271120927664274, "loss": 1.8423, "num_input_tokens_seen": 11977072, "step": 1986, "train_runtime": 2009.8775, "train_tokens_per_second": 5959.105 }, { "epoch": 0.7308505747126437, "grad_norm": 0.8352282643318176, "learning_rate": 0.000127075280692067, "loss": 1.8687, "num_input_tokens_seen": 11982752, "step": 1987, "train_runtime": 2010.8086, "train_tokens_per_second": 5959.171 }, { "epoch": 0.7312183908045977, "grad_norm": 0.7257148027420044, "learning_rate": 0.0001270384686177066, "loss": 1.8688, "num_input_tokens_seen": 11987664, "step": 1988, "train_runtime": 2011.6541, "train_tokens_per_second": 5959.108 }, { "epoch": 0.7315862068965517, "grad_norm": 0.7688496708869934, "learning_rate": 0.0001270016565433462, "loss": 1.8043, "num_input_tokens_seen": 11992656, "step": 1989, "train_runtime": 2012.5131, "train_tokens_per_second": 5959.045 }, { "epoch": 0.7319540229885058, "grad_norm": 0.7292170524597168, "learning_rate": 0.00012696484446898584, "loss": 2.0214, "num_input_tokens_seen": 12000000, "step": 1990, "train_runtime": 2013.6972, "train_tokens_per_second": 5959.188 }, { "epoch": 0.7323218390804598, "grad_norm": 0.6529267430305481, "learning_rate": 0.00012692803239462545, "loss": 1.6034, "num_input_tokens_seen": 12005648, "step": 1991, "train_runtime": 2014.6269, "train_tokens_per_second": 5959.241 }, { "epoch": 0.7326896551724138, "grad_norm": 0.703542947769165, "learning_rate": 0.00012689122032026506, "loss": 1.8618, "num_input_tokens_seen": 12011552, "step": 1992, "train_runtime": 2015.5873, "train_tokens_per_second": 5959.331 }, { "epoch": 0.7330574712643678, "grad_norm": 0.7824158668518066, "learning_rate": 0.00012685440824590467, "loss": 1.8234, "num_input_tokens_seen": 12016400, "step": 1993, "train_runtime": 2016.4292, "train_tokens_per_second": 5959.247 }, { "epoch": 0.7334252873563218, "grad_norm": 0.7852529883384705, "learning_rate": 0.00012681759617154428, "loss": 1.9107, "num_input_tokens_seen": 12021936, "step": 1994, "train_runtime": 2017.3475, "train_tokens_per_second": 5959.279 }, { "epoch": 0.7337931034482759, "grad_norm": 0.6936224102973938, "learning_rate": 0.00012678078409718389, "loss": 1.9709, "num_input_tokens_seen": 12028400, "step": 1995, "train_runtime": 2018.4101, "train_tokens_per_second": 5959.344 }, { "epoch": 0.7341609195402299, "grad_norm": 0.744227945804596, "learning_rate": 0.0001267439720228235, "loss": 1.6797, "num_input_tokens_seen": 12036320, "step": 1996, "train_runtime": 2019.6516, "train_tokens_per_second": 5959.602 }, { "epoch": 0.7345287356321839, "grad_norm": 0.7873906493186951, "learning_rate": 0.0001267071599484631, "loss": 1.6767, "num_input_tokens_seen": 12041424, "step": 1997, "train_runtime": 2020.49, "train_tokens_per_second": 5959.655 }, { "epoch": 0.7348965517241379, "grad_norm": 0.644244909286499, "learning_rate": 0.0001266703478741027, "loss": 1.7367, "num_input_tokens_seen": 12047792, "step": 1998, "train_runtime": 2021.5059, "train_tokens_per_second": 5959.81 }, { "epoch": 0.735264367816092, "grad_norm": 0.7175727486610413, "learning_rate": 0.00012663353579974232, "loss": 1.847, "num_input_tokens_seen": 12054928, "step": 1999, "train_runtime": 2022.655, "train_tokens_per_second": 5959.953 }, { "epoch": 0.735632183908046, "grad_norm": 0.6197425127029419, "learning_rate": 0.00012659672372538193, "loss": 1.8297, "num_input_tokens_seen": 12061664, "step": 2000, "train_runtime": 2023.742, "train_tokens_per_second": 5960.08 }, { "epoch": 0.736, "grad_norm": 0.7840290069580078, "learning_rate": 0.00012655991165102154, "loss": 1.8551, "num_input_tokens_seen": 12066368, "step": 2001, "train_runtime": 2024.5934, "train_tokens_per_second": 5959.897 }, { "epoch": 0.736367816091954, "grad_norm": 0.6831390857696533, "learning_rate": 0.00012652309957666115, "loss": 1.703, "num_input_tokens_seen": 12072608, "step": 2002, "train_runtime": 2025.605, "train_tokens_per_second": 5960.001 }, { "epoch": 0.736735632183908, "grad_norm": 0.7383309602737427, "learning_rate": 0.00012648628750230076, "loss": 1.7188, "num_input_tokens_seen": 12082176, "step": 2003, "train_runtime": 2027.0885, "train_tokens_per_second": 5960.359 }, { "epoch": 0.737103448275862, "grad_norm": 0.6271421909332275, "learning_rate": 0.00012644947542794037, "loss": 1.5585, "num_input_tokens_seen": 12087824, "step": 2004, "train_runtime": 2028.0339, "train_tokens_per_second": 5960.366 }, { "epoch": 0.7374712643678161, "grad_norm": 0.7438689470291138, "learning_rate": 0.00012641266335357997, "loss": 1.5752, "num_input_tokens_seen": 12094032, "step": 2005, "train_runtime": 2029.0501, "train_tokens_per_second": 5960.44 }, { "epoch": 0.7378390804597701, "grad_norm": 0.7262468934059143, "learning_rate": 0.00012637585127921958, "loss": 1.7402, "num_input_tokens_seen": 12098864, "step": 2006, "train_runtime": 2029.8621, "train_tokens_per_second": 5960.436 }, { "epoch": 0.7382068965517241, "grad_norm": 0.7145463228225708, "learning_rate": 0.00012633903920485922, "loss": 1.8283, "num_input_tokens_seen": 12105168, "step": 2007, "train_runtime": 2030.8815, "train_tokens_per_second": 5960.549 }, { "epoch": 0.7385747126436781, "grad_norm": 0.7067509293556213, "learning_rate": 0.00012630222713049883, "loss": 1.5464, "num_input_tokens_seen": 12113472, "step": 2008, "train_runtime": 2032.185, "train_tokens_per_second": 5960.812 }, { "epoch": 0.7389425287356322, "grad_norm": 0.7784838080406189, "learning_rate": 0.00012626541505613844, "loss": 1.693, "num_input_tokens_seen": 12118912, "step": 2009, "train_runtime": 2033.0862, "train_tokens_per_second": 5960.845 }, { "epoch": 0.7393103448275862, "grad_norm": 0.8181419968605042, "learning_rate": 0.00012622860298177805, "loss": 1.7745, "num_input_tokens_seen": 12123984, "step": 2010, "train_runtime": 2033.9546, "train_tokens_per_second": 5960.794 }, { "epoch": 0.7396781609195402, "grad_norm": 0.7721001505851746, "learning_rate": 0.00012619179090741763, "loss": 1.67, "num_input_tokens_seen": 12128640, "step": 2011, "train_runtime": 2035.2192, "train_tokens_per_second": 5959.378 }, { "epoch": 0.7400459770114942, "grad_norm": 0.8139654994010925, "learning_rate": 0.00012615497883305724, "loss": 1.7246, "num_input_tokens_seen": 12134400, "step": 2012, "train_runtime": 2036.1615, "train_tokens_per_second": 5959.449 }, { "epoch": 0.7404137931034482, "grad_norm": 0.8119025826454163, "learning_rate": 0.00012611816675869685, "loss": 1.9269, "num_input_tokens_seen": 12138720, "step": 2013, "train_runtime": 2036.9013, "train_tokens_per_second": 5959.405 }, { "epoch": 0.7407816091954023, "grad_norm": 0.8293254971504211, "learning_rate": 0.00012608135468433645, "loss": 1.7921, "num_input_tokens_seen": 12143136, "step": 2014, "train_runtime": 2037.6792, "train_tokens_per_second": 5959.297 }, { "epoch": 0.7411494252873563, "grad_norm": 0.7966312766075134, "learning_rate": 0.00012604454260997606, "loss": 1.8548, "num_input_tokens_seen": 12148224, "step": 2015, "train_runtime": 2038.5389, "train_tokens_per_second": 5959.28 }, { "epoch": 0.7415172413793103, "grad_norm": 0.7699953317642212, "learning_rate": 0.0001260077305356157, "loss": 2.0045, "num_input_tokens_seen": 12154496, "step": 2016, "train_runtime": 2039.571, "train_tokens_per_second": 5959.339 }, { "epoch": 0.7418850574712643, "grad_norm": 0.7591118216514587, "learning_rate": 0.0001259709184612553, "loss": 1.8046, "num_input_tokens_seen": 12161296, "step": 2017, "train_runtime": 2040.6988, "train_tokens_per_second": 5959.378 }, { "epoch": 0.7422528735632183, "grad_norm": 0.7616413831710815, "learning_rate": 0.00012593410638689492, "loss": 1.9069, "num_input_tokens_seen": 12167056, "step": 2018, "train_runtime": 2041.6362, "train_tokens_per_second": 5959.463 }, { "epoch": 0.7426206896551724, "grad_norm": 0.7836195230484009, "learning_rate": 0.00012589729431253453, "loss": 1.8534, "num_input_tokens_seen": 12172720, "step": 2019, "train_runtime": 2042.5845, "train_tokens_per_second": 5959.469 }, { "epoch": 0.7429885057471264, "grad_norm": 0.7529764175415039, "learning_rate": 0.00012586048223817413, "loss": 1.7127, "num_input_tokens_seen": 12182560, "step": 2020, "train_runtime": 2044.0916, "train_tokens_per_second": 5959.89 }, { "epoch": 0.7433563218390805, "grad_norm": 0.6801377534866333, "learning_rate": 0.00012582367016381374, "loss": 1.4794, "num_input_tokens_seen": 12191040, "step": 2021, "train_runtime": 2045.3843, "train_tokens_per_second": 5960.269 }, { "epoch": 0.7437241379310345, "grad_norm": 0.721573531627655, "learning_rate": 0.00012578685808945335, "loss": 1.6391, "num_input_tokens_seen": 12197312, "step": 2022, "train_runtime": 2046.4215, "train_tokens_per_second": 5960.313 }, { "epoch": 0.7440919540229886, "grad_norm": 0.6895381808280945, "learning_rate": 0.00012575004601509296, "loss": 1.8129, "num_input_tokens_seen": 12202880, "step": 2023, "train_runtime": 2047.3434, "train_tokens_per_second": 5960.348 }, { "epoch": 0.7444597701149426, "grad_norm": 0.7531507611274719, "learning_rate": 0.00012571323394073254, "loss": 1.721, "num_input_tokens_seen": 12207936, "step": 2024, "train_runtime": 2048.1965, "train_tokens_per_second": 5960.334 }, { "epoch": 0.7448275862068966, "grad_norm": 0.7214846014976501, "learning_rate": 0.00012567642186637218, "loss": 1.7397, "num_input_tokens_seen": 12214976, "step": 2025, "train_runtime": 2049.3395, "train_tokens_per_second": 5960.445 }, { "epoch": 0.7451954022988506, "grad_norm": 0.7114675045013428, "learning_rate": 0.0001256396097920118, "loss": 1.6025, "num_input_tokens_seen": 12221200, "step": 2026, "train_runtime": 2050.3778, "train_tokens_per_second": 5960.462 }, { "epoch": 0.7455632183908046, "grad_norm": 0.8285331130027771, "learning_rate": 0.0001256027977176514, "loss": 1.9333, "num_input_tokens_seen": 12227776, "step": 2027, "train_runtime": 2051.4502, "train_tokens_per_second": 5960.552 }, { "epoch": 0.7459310344827587, "grad_norm": 0.7888330817222595, "learning_rate": 0.000125565985643291, "loss": 2.0145, "num_input_tokens_seen": 12232592, "step": 2028, "train_runtime": 2052.2486, "train_tokens_per_second": 5960.58 }, { "epoch": 0.7462988505747127, "grad_norm": 0.7405606508255005, "learning_rate": 0.00012552917356893061, "loss": 1.6829, "num_input_tokens_seen": 12239440, "step": 2029, "train_runtime": 2053.3713, "train_tokens_per_second": 5960.656 }, { "epoch": 0.7466666666666667, "grad_norm": 0.7686442732810974, "learning_rate": 0.00012549236149457022, "loss": 1.8015, "num_input_tokens_seen": 12244496, "step": 2030, "train_runtime": 2054.2121, "train_tokens_per_second": 5960.677 }, { "epoch": 0.7470344827586207, "grad_norm": 0.8337616324424744, "learning_rate": 0.00012545554942020983, "loss": 1.9287, "num_input_tokens_seen": 12248944, "step": 2031, "train_runtime": 2054.9783, "train_tokens_per_second": 5960.62 }, { "epoch": 0.7474022988505747, "grad_norm": 0.9073026776313782, "learning_rate": 0.00012541873734584944, "loss": 1.8618, "num_input_tokens_seen": 12256256, "step": 2032, "train_runtime": 2056.1338, "train_tokens_per_second": 5960.826 }, { "epoch": 0.7477701149425288, "grad_norm": 0.7766493558883667, "learning_rate": 0.00012538192527148908, "loss": 1.8335, "num_input_tokens_seen": 12260656, "step": 2033, "train_runtime": 2056.889, "train_tokens_per_second": 5960.777 }, { "epoch": 0.7481379310344828, "grad_norm": 0.7368164658546448, "learning_rate": 0.00012534511319712866, "loss": 1.9069, "num_input_tokens_seen": 12266432, "step": 2034, "train_runtime": 2057.8409, "train_tokens_per_second": 5960.826 }, { "epoch": 0.7485057471264368, "grad_norm": 0.7862488031387329, "learning_rate": 0.00012530830112276827, "loss": 1.8104, "num_input_tokens_seen": 12272448, "step": 2035, "train_runtime": 2058.8031, "train_tokens_per_second": 5960.962 }, { "epoch": 0.7488735632183908, "grad_norm": 0.7069132924079895, "learning_rate": 0.00012527148904840788, "loss": 1.715, "num_input_tokens_seen": 12277568, "step": 2036, "train_runtime": 2059.6927, "train_tokens_per_second": 5960.874 }, { "epoch": 0.7492413793103448, "grad_norm": 0.910798192024231, "learning_rate": 0.00012523467697404749, "loss": 1.8036, "num_input_tokens_seen": 12282144, "step": 2037, "train_runtime": 2060.4815, "train_tokens_per_second": 5960.813 }, { "epoch": 0.7496091954022989, "grad_norm": 0.7396913170814514, "learning_rate": 0.0001251978648996871, "loss": 1.6484, "num_input_tokens_seen": 12287152, "step": 2038, "train_runtime": 2061.3257, "train_tokens_per_second": 5960.801 }, { "epoch": 0.7499770114942529, "grad_norm": 0.7725208401679993, "learning_rate": 0.0001251610528253267, "loss": 1.7524, "num_input_tokens_seen": 12293136, "step": 2039, "train_runtime": 2062.3164, "train_tokens_per_second": 5960.839 }, { "epoch": 0.7503448275862069, "grad_norm": 0.6665602922439575, "learning_rate": 0.0001251242407509663, "loss": 1.6469, "num_input_tokens_seen": 12301552, "step": 2040, "train_runtime": 2063.6231, "train_tokens_per_second": 5961.143 }, { "epoch": 0.7507126436781609, "grad_norm": 0.7234289050102234, "learning_rate": 0.00012508742867660592, "loss": 1.5413, "num_input_tokens_seen": 12307536, "step": 2041, "train_runtime": 2065.1515, "train_tokens_per_second": 5959.629 }, { "epoch": 0.751080459770115, "grad_norm": 0.76047283411026, "learning_rate": 0.00012505061660224556, "loss": 1.7646, "num_input_tokens_seen": 12312768, "step": 2042, "train_runtime": 2066.0224, "train_tokens_per_second": 5959.649 }, { "epoch": 0.751448275862069, "grad_norm": 0.7163563966751099, "learning_rate": 0.00012501380452788517, "loss": 1.5964, "num_input_tokens_seen": 12319168, "step": 2043, "train_runtime": 2067.0654, "train_tokens_per_second": 5959.738 }, { "epoch": 0.751816091954023, "grad_norm": 0.8260768055915833, "learning_rate": 0.00012497699245352478, "loss": 1.8702, "num_input_tokens_seen": 12323648, "step": 2044, "train_runtime": 2067.8419, "train_tokens_per_second": 5959.666 }, { "epoch": 0.752183908045977, "grad_norm": 0.6744913458824158, "learning_rate": 0.00012494018037916438, "loss": 1.7112, "num_input_tokens_seen": 12331184, "step": 2045, "train_runtime": 2069.0505, "train_tokens_per_second": 5959.828 }, { "epoch": 0.752551724137931, "grad_norm": 0.7469673156738281, "learning_rate": 0.000124903368304804, "loss": 1.5905, "num_input_tokens_seen": 12338928, "step": 2046, "train_runtime": 2070.2474, "train_tokens_per_second": 5960.122 }, { "epoch": 0.752919540229885, "grad_norm": 0.7135205268859863, "learning_rate": 0.00012486655623044357, "loss": 1.7349, "num_input_tokens_seen": 12343824, "step": 2047, "train_runtime": 2071.0714, "train_tokens_per_second": 5960.115 }, { "epoch": 0.7532873563218391, "grad_norm": 0.7622992396354675, "learning_rate": 0.00012482974415608318, "loss": 1.6711, "num_input_tokens_seen": 12348448, "step": 2048, "train_runtime": 2071.8711, "train_tokens_per_second": 5960.046 }, { "epoch": 0.7536551724137931, "grad_norm": 0.7797056436538696, "learning_rate": 0.0001247929320817228, "loss": 1.8897, "num_input_tokens_seen": 12354400, "step": 2049, "train_runtime": 2072.8584, "train_tokens_per_second": 5960.079 }, { "epoch": 0.7540229885057471, "grad_norm": 0.7252853512763977, "learning_rate": 0.00012475612000736243, "loss": 1.6295, "num_input_tokens_seen": 12360608, "step": 2050, "train_runtime": 2073.8961, "train_tokens_per_second": 5960.09 }, { "epoch": 0.7543908045977011, "grad_norm": 0.6995819807052612, "learning_rate": 0.00012471930793300204, "loss": 1.7527, "num_input_tokens_seen": 12367920, "step": 2051, "train_runtime": 2075.0452, "train_tokens_per_second": 5960.314 }, { "epoch": 0.7547586206896552, "grad_norm": 0.7781098484992981, "learning_rate": 0.00012468249585864165, "loss": 1.687, "num_input_tokens_seen": 12374560, "step": 2052, "train_runtime": 2076.1121, "train_tokens_per_second": 5960.449 }, { "epoch": 0.7551264367816092, "grad_norm": 0.6926596760749817, "learning_rate": 0.00012464568378428126, "loss": 1.6659, "num_input_tokens_seen": 12384880, "step": 2053, "train_runtime": 2077.6468, "train_tokens_per_second": 5961.013 }, { "epoch": 0.7554942528735632, "grad_norm": 0.8198338747024536, "learning_rate": 0.00012460887170992086, "loss": 1.7728, "num_input_tokens_seen": 12392736, "step": 2054, "train_runtime": 2078.8786, "train_tokens_per_second": 5961.26 }, { "epoch": 0.7558620689655172, "grad_norm": 0.7452566027641296, "learning_rate": 0.00012457205963556047, "loss": 1.8164, "num_input_tokens_seen": 12402096, "step": 2055, "train_runtime": 2080.2999, "train_tokens_per_second": 5961.687 }, { "epoch": 0.7562298850574712, "grad_norm": 0.7812275886535645, "learning_rate": 0.00012453524756120008, "loss": 1.7473, "num_input_tokens_seen": 12407424, "step": 2056, "train_runtime": 2081.2145, "train_tokens_per_second": 5961.627 }, { "epoch": 0.7565977011494253, "grad_norm": 0.8216825127601624, "learning_rate": 0.0001244984354868397, "loss": 1.7814, "num_input_tokens_seen": 12414384, "step": 2057, "train_runtime": 2082.3231, "train_tokens_per_second": 5961.795 }, { "epoch": 0.7569655172413793, "grad_norm": 0.7050502896308899, "learning_rate": 0.0001244616234124793, "loss": 1.574, "num_input_tokens_seen": 12423104, "step": 2058, "train_runtime": 2083.6656, "train_tokens_per_second": 5962.139 }, { "epoch": 0.7573333333333333, "grad_norm": 0.7369188070297241, "learning_rate": 0.0001244248113381189, "loss": 1.7756, "num_input_tokens_seen": 12427824, "step": 2059, "train_runtime": 2084.4768, "train_tokens_per_second": 5962.083 }, { "epoch": 0.7577011494252873, "grad_norm": 0.7803534269332886, "learning_rate": 0.00012438799926375852, "loss": 1.8057, "num_input_tokens_seen": 12433264, "step": 2060, "train_runtime": 2085.3858, "train_tokens_per_second": 5962.093 }, { "epoch": 0.7580689655172413, "grad_norm": 0.7051107287406921, "learning_rate": 0.00012435118718939813, "loss": 1.4501, "num_input_tokens_seen": 12441856, "step": 2061, "train_runtime": 2086.6988, "train_tokens_per_second": 5962.459 }, { "epoch": 0.7584367816091954, "grad_norm": 0.8329285383224487, "learning_rate": 0.00012431437511503774, "loss": 1.7789, "num_input_tokens_seen": 12446368, "step": 2062, "train_runtime": 2087.4846, "train_tokens_per_second": 5962.376 }, { "epoch": 0.7588045977011494, "grad_norm": 0.7532010674476624, "learning_rate": 0.00012427756304067734, "loss": 1.5868, "num_input_tokens_seen": 12451728, "step": 2063, "train_runtime": 2088.3826, "train_tokens_per_second": 5962.379 }, { "epoch": 0.7591724137931034, "grad_norm": 0.744062602519989, "learning_rate": 0.00012424075096631695, "loss": 1.7547, "num_input_tokens_seen": 12458624, "step": 2064, "train_runtime": 2089.5056, "train_tokens_per_second": 5962.475 }, { "epoch": 0.7595402298850574, "grad_norm": 0.749465823173523, "learning_rate": 0.00012420393889195656, "loss": 1.7925, "num_input_tokens_seen": 12466032, "step": 2065, "train_runtime": 2090.6747, "train_tokens_per_second": 5962.684 }, { "epoch": 0.7599080459770114, "grad_norm": 0.7444941997528076, "learning_rate": 0.00012416712681759617, "loss": 1.5725, "num_input_tokens_seen": 12472576, "step": 2066, "train_runtime": 2091.7511, "train_tokens_per_second": 5962.744 }, { "epoch": 0.7602758620689655, "grad_norm": 0.7577369809150696, "learning_rate": 0.0001241303147432358, "loss": 1.6854, "num_input_tokens_seen": 12479296, "step": 2067, "train_runtime": 2092.8088, "train_tokens_per_second": 5962.941 }, { "epoch": 0.7606436781609195, "grad_norm": 0.8165404200553894, "learning_rate": 0.00012409350266887542, "loss": 1.6778, "num_input_tokens_seen": 12488464, "step": 2068, "train_runtime": 2094.1946, "train_tokens_per_second": 5963.373 }, { "epoch": 0.7610114942528735, "grad_norm": 0.7348002791404724, "learning_rate": 0.00012405669059451502, "loss": 1.6465, "num_input_tokens_seen": 12493792, "step": 2069, "train_runtime": 2095.1024, "train_tokens_per_second": 5963.332 }, { "epoch": 0.7613793103448275, "grad_norm": 0.8466042280197144, "learning_rate": 0.0001240198785201546, "loss": 1.83, "num_input_tokens_seen": 12498736, "step": 2070, "train_runtime": 2095.9461, "train_tokens_per_second": 5963.291 }, { "epoch": 0.7617471264367817, "grad_norm": 0.7623975276947021, "learning_rate": 0.00012398306644579422, "loss": 1.7275, "num_input_tokens_seen": 12504064, "step": 2071, "train_runtime": 2097.3246, "train_tokens_per_second": 5961.912 }, { "epoch": 0.7621149425287357, "grad_norm": 0.6703829765319824, "learning_rate": 0.00012394625437143382, "loss": 1.5622, "num_input_tokens_seen": 12510992, "step": 2072, "train_runtime": 2098.417, "train_tokens_per_second": 5962.109 }, { "epoch": 0.7624827586206897, "grad_norm": 0.7693400382995605, "learning_rate": 0.00012390944229707343, "loss": 1.9204, "num_input_tokens_seen": 12516480, "step": 2073, "train_runtime": 2099.3181, "train_tokens_per_second": 5962.164 }, { "epoch": 0.7628505747126437, "grad_norm": 0.7057474255561829, "learning_rate": 0.00012387263022271304, "loss": 1.5577, "num_input_tokens_seen": 12520768, "step": 2074, "train_runtime": 2100.0795, "train_tokens_per_second": 5962.045 }, { "epoch": 0.7632183908045977, "grad_norm": 0.6748824119567871, "learning_rate": 0.00012383581814835265, "loss": 1.7114, "num_input_tokens_seen": 12526352, "step": 2075, "train_runtime": 2100.9763, "train_tokens_per_second": 5962.158 }, { "epoch": 0.7635862068965518, "grad_norm": 0.7221955060958862, "learning_rate": 0.0001237990060739923, "loss": 1.6284, "num_input_tokens_seen": 12530928, "step": 2076, "train_runtime": 2101.7524, "train_tokens_per_second": 5962.133 }, { "epoch": 0.7639540229885058, "grad_norm": 0.7431067228317261, "learning_rate": 0.0001237621939996319, "loss": 1.8156, "num_input_tokens_seen": 12536832, "step": 2077, "train_runtime": 2102.7421, "train_tokens_per_second": 5962.135 }, { "epoch": 0.7643218390804598, "grad_norm": 0.6931885480880737, "learning_rate": 0.0001237253819252715, "loss": 1.7219, "num_input_tokens_seen": 12541968, "step": 2078, "train_runtime": 2103.6022, "train_tokens_per_second": 5962.139 }, { "epoch": 0.7646896551724138, "grad_norm": 0.7696422338485718, "learning_rate": 0.0001236885698509111, "loss": 1.7431, "num_input_tokens_seen": 12547920, "step": 2079, "train_runtime": 2104.5984, "train_tokens_per_second": 5962.145 }, { "epoch": 0.7650574712643678, "grad_norm": 0.7124376893043518, "learning_rate": 0.00012365175777655072, "loss": 1.5987, "num_input_tokens_seen": 12554176, "step": 2080, "train_runtime": 2105.6296, "train_tokens_per_second": 5962.196 }, { "epoch": 0.7654252873563219, "grad_norm": 0.7974727749824524, "learning_rate": 0.00012361494570219033, "loss": 1.7726, "num_input_tokens_seen": 12560688, "step": 2081, "train_runtime": 2106.6475, "train_tokens_per_second": 5962.406 }, { "epoch": 0.7657931034482759, "grad_norm": 0.7285959720611572, "learning_rate": 0.00012357813362782994, "loss": 1.5395, "num_input_tokens_seen": 12567616, "step": 2082, "train_runtime": 2107.7777, "train_tokens_per_second": 5962.496 }, { "epoch": 0.7661609195402299, "grad_norm": 0.7363659143447876, "learning_rate": 0.00012354132155346955, "loss": 1.6736, "num_input_tokens_seen": 12574960, "step": 2083, "train_runtime": 2108.932, "train_tokens_per_second": 5962.715 }, { "epoch": 0.7665287356321839, "grad_norm": 0.7323724627494812, "learning_rate": 0.00012350450947910913, "loss": 1.4709, "num_input_tokens_seen": 12585248, "step": 2084, "train_runtime": 2110.4861, "train_tokens_per_second": 5963.199 }, { "epoch": 0.766896551724138, "grad_norm": 0.7748041152954102, "learning_rate": 0.00012346769740474877, "loss": 1.7863, "num_input_tokens_seen": 12591040, "step": 2085, "train_runtime": 2111.4462, "train_tokens_per_second": 5963.23 }, { "epoch": 0.767264367816092, "grad_norm": 0.6988790035247803, "learning_rate": 0.00012343088533038838, "loss": 1.8432, "num_input_tokens_seen": 12599248, "step": 2086, "train_runtime": 2112.7415, "train_tokens_per_second": 5963.459 }, { "epoch": 0.767632183908046, "grad_norm": 0.7449609637260437, "learning_rate": 0.00012339407325602798, "loss": 1.6399, "num_input_tokens_seen": 12606800, "step": 2087, "train_runtime": 2113.916, "train_tokens_per_second": 5963.718 }, { "epoch": 0.768, "grad_norm": 0.9035874605178833, "learning_rate": 0.0001233572611816676, "loss": 1.7134, "num_input_tokens_seen": 12611248, "step": 2088, "train_runtime": 2114.6979, "train_tokens_per_second": 5963.617 }, { "epoch": 0.768367816091954, "grad_norm": 0.7643798589706421, "learning_rate": 0.0001233204491073072, "loss": 1.7322, "num_input_tokens_seen": 12616240, "step": 2089, "train_runtime": 2115.5549, "train_tokens_per_second": 5963.561 }, { "epoch": 0.7687356321839081, "grad_norm": 0.7421737909317017, "learning_rate": 0.0001232836370329468, "loss": 1.7024, "num_input_tokens_seen": 12622592, "step": 2090, "train_runtime": 2116.5657, "train_tokens_per_second": 5963.714 }, { "epoch": 0.7691034482758621, "grad_norm": 0.7030812501907349, "learning_rate": 0.00012324682495858642, "loss": 1.8837, "num_input_tokens_seen": 12629888, "step": 2091, "train_runtime": 2117.6955, "train_tokens_per_second": 5963.977 }, { "epoch": 0.7694712643678161, "grad_norm": 0.7125244140625, "learning_rate": 0.00012321001288422603, "loss": 1.7142, "num_input_tokens_seen": 12634848, "step": 2092, "train_runtime": 2118.5549, "train_tokens_per_second": 5963.899 }, { "epoch": 0.7698390804597701, "grad_norm": 0.7095870971679688, "learning_rate": 0.00012317320080986567, "loss": 1.7827, "num_input_tokens_seen": 12639792, "step": 2093, "train_runtime": 2119.4017, "train_tokens_per_second": 5963.849 }, { "epoch": 0.7702068965517241, "grad_norm": 0.7154878973960876, "learning_rate": 0.00012313638873550525, "loss": 1.809, "num_input_tokens_seen": 12644832, "step": 2094, "train_runtime": 2120.2578, "train_tokens_per_second": 5963.818 }, { "epoch": 0.7705747126436782, "grad_norm": 0.720576822757721, "learning_rate": 0.00012309957666114486, "loss": 1.7733, "num_input_tokens_seen": 12651584, "step": 2095, "train_runtime": 2121.3524, "train_tokens_per_second": 5963.924 }, { "epoch": 0.7709425287356322, "grad_norm": 0.6914993524551392, "learning_rate": 0.00012306276458678446, "loss": 1.7504, "num_input_tokens_seen": 12659728, "step": 2096, "train_runtime": 2122.6242, "train_tokens_per_second": 5964.187 }, { "epoch": 0.7713103448275862, "grad_norm": 0.6382989287376404, "learning_rate": 0.00012302595251242407, "loss": 1.6161, "num_input_tokens_seen": 12667440, "step": 2097, "train_runtime": 2123.7999, "train_tokens_per_second": 5964.517 }, { "epoch": 0.7716781609195402, "grad_norm": 0.7535708546638489, "learning_rate": 0.00012298914043806368, "loss": 1.6673, "num_input_tokens_seen": 12673472, "step": 2098, "train_runtime": 2124.7815, "train_tokens_per_second": 5964.6 }, { "epoch": 0.7720459770114942, "grad_norm": 0.7594273686408997, "learning_rate": 0.0001229523283637033, "loss": 1.6248, "num_input_tokens_seen": 12679872, "step": 2099, "train_runtime": 2125.8015, "train_tokens_per_second": 5964.749 }, { "epoch": 0.7724137931034483, "grad_norm": 0.7400872707366943, "learning_rate": 0.0001229155162893429, "loss": 1.7397, "num_input_tokens_seen": 12686208, "step": 2100, "train_runtime": 2126.8215, "train_tokens_per_second": 5964.867 }, { "epoch": 0.7727816091954023, "grad_norm": 0.7387911677360535, "learning_rate": 0.0001228787042149825, "loss": 1.5423, "num_input_tokens_seen": 12691120, "step": 2101, "train_runtime": 2128.1152, "train_tokens_per_second": 5963.549 }, { "epoch": 0.7731494252873563, "grad_norm": 0.803270161151886, "learning_rate": 0.00012284189214062215, "loss": 1.6986, "num_input_tokens_seen": 12696080, "step": 2102, "train_runtime": 2128.9782, "train_tokens_per_second": 5963.462 }, { "epoch": 0.7735172413793103, "grad_norm": 0.695408046245575, "learning_rate": 0.00012280508006626175, "loss": 1.5859, "num_input_tokens_seen": 12700608, "step": 2103, "train_runtime": 2129.7188, "train_tokens_per_second": 5963.514 }, { "epoch": 0.7738850574712643, "grad_norm": 0.7624605894088745, "learning_rate": 0.00012276826799190136, "loss": 1.6724, "num_input_tokens_seen": 12705856, "step": 2104, "train_runtime": 2130.6006, "train_tokens_per_second": 5963.509 }, { "epoch": 0.7742528735632184, "grad_norm": 0.7603652477264404, "learning_rate": 0.00012273145591754097, "loss": 1.7543, "num_input_tokens_seen": 12712064, "step": 2105, "train_runtime": 2131.6049, "train_tokens_per_second": 5963.612 }, { "epoch": 0.7746206896551724, "grad_norm": 0.6373720169067383, "learning_rate": 0.00012269464384318058, "loss": 1.6929, "num_input_tokens_seen": 12718816, "step": 2106, "train_runtime": 2132.6744, "train_tokens_per_second": 5963.787 }, { "epoch": 0.7749885057471264, "grad_norm": 0.6505287289619446, "learning_rate": 0.00012265783176882016, "loss": 1.5399, "num_input_tokens_seen": 12727232, "step": 2107, "train_runtime": 2133.9805, "train_tokens_per_second": 5964.081 }, { "epoch": 0.7753563218390804, "grad_norm": 0.722303032875061, "learning_rate": 0.00012262101969445977, "loss": 1.7155, "num_input_tokens_seen": 12732752, "step": 2108, "train_runtime": 2134.9092, "train_tokens_per_second": 5964.072 }, { "epoch": 0.7757241379310345, "grad_norm": 0.7534534335136414, "learning_rate": 0.00012258420762009938, "loss": 1.6947, "num_input_tokens_seen": 12737184, "step": 2109, "train_runtime": 2135.6835, "train_tokens_per_second": 5963.985 }, { "epoch": 0.7760919540229885, "grad_norm": 0.6947422623634338, "learning_rate": 0.00012254739554573902, "loss": 1.5609, "num_input_tokens_seen": 12742512, "step": 2110, "train_runtime": 2136.5908, "train_tokens_per_second": 5963.946 }, { "epoch": 0.7764597701149425, "grad_norm": 0.7415337562561035, "learning_rate": 0.00012251058347137863, "loss": 1.729, "num_input_tokens_seen": 12749376, "step": 2111, "train_runtime": 2137.6753, "train_tokens_per_second": 5964.131 }, { "epoch": 0.7768275862068965, "grad_norm": 0.7485516667366028, "learning_rate": 0.00012247377139701823, "loss": 1.7938, "num_input_tokens_seen": 12756128, "step": 2112, "train_runtime": 2138.7622, "train_tokens_per_second": 5964.257 }, { "epoch": 0.7771954022988505, "grad_norm": 0.7775939702987671, "learning_rate": 0.00012243695932265784, "loss": 1.6705, "num_input_tokens_seen": 12763040, "step": 2113, "train_runtime": 2139.8673, "train_tokens_per_second": 5964.407 }, { "epoch": 0.7775632183908046, "grad_norm": 0.7350584268569946, "learning_rate": 0.00012240014724829745, "loss": 1.5915, "num_input_tokens_seen": 12768512, "step": 2114, "train_runtime": 2140.7666, "train_tokens_per_second": 5964.458 }, { "epoch": 0.7779310344827586, "grad_norm": 0.7638656497001648, "learning_rate": 0.00012236333517393706, "loss": 1.7557, "num_input_tokens_seen": 12774624, "step": 2115, "train_runtime": 2141.7513, "train_tokens_per_second": 5964.569 }, { "epoch": 0.7782988505747126, "grad_norm": 0.7217133641242981, "learning_rate": 0.00012232652309957667, "loss": 1.7415, "num_input_tokens_seen": 12781152, "step": 2116, "train_runtime": 2142.8009, "train_tokens_per_second": 5964.694 }, { "epoch": 0.7786666666666666, "grad_norm": 0.8002574443817139, "learning_rate": 0.00012228971102521628, "loss": 1.6022, "num_input_tokens_seen": 12788592, "step": 2117, "train_runtime": 2143.9867, "train_tokens_per_second": 5964.865 }, { "epoch": 0.7790344827586206, "grad_norm": 0.7704402804374695, "learning_rate": 0.0001222528989508559, "loss": 1.7797, "num_input_tokens_seen": 12793296, "step": 2118, "train_runtime": 2144.7906, "train_tokens_per_second": 5964.823 }, { "epoch": 0.7794022988505747, "grad_norm": 0.7450360059738159, "learning_rate": 0.0001222160868764955, "loss": 1.674, "num_input_tokens_seen": 12797744, "step": 2119, "train_runtime": 2145.5677, "train_tokens_per_second": 5964.736 }, { "epoch": 0.7797701149425287, "grad_norm": 0.7535125613212585, "learning_rate": 0.0001221792748021351, "loss": 1.8459, "num_input_tokens_seen": 12805136, "step": 2120, "train_runtime": 2146.7432, "train_tokens_per_second": 5964.913 }, { "epoch": 0.7801379310344828, "grad_norm": 0.7665154933929443, "learning_rate": 0.00012214246272777471, "loss": 1.7696, "num_input_tokens_seen": 12812240, "step": 2121, "train_runtime": 2147.8888, "train_tokens_per_second": 5965.039 }, { "epoch": 0.7805057471264368, "grad_norm": 0.7314074039459229, "learning_rate": 0.00012210565065341432, "loss": 1.7164, "num_input_tokens_seen": 12823360, "step": 2122, "train_runtime": 2149.5374, "train_tokens_per_second": 5965.637 }, { "epoch": 0.7808735632183909, "grad_norm": 0.7371465563774109, "learning_rate": 0.00012206883857905393, "loss": 1.6773, "num_input_tokens_seen": 12828144, "step": 2123, "train_runtime": 2150.375, "train_tokens_per_second": 5965.538 }, { "epoch": 0.7812413793103449, "grad_norm": 0.8078320622444153, "learning_rate": 0.00012203202650469354, "loss": 1.6974, "num_input_tokens_seen": 12835040, "step": 2124, "train_runtime": 2151.477, "train_tokens_per_second": 5965.688 }, { "epoch": 0.7816091954022989, "grad_norm": 0.7091101408004761, "learning_rate": 0.00012199521443033315, "loss": 1.797, "num_input_tokens_seen": 12839616, "step": 2125, "train_runtime": 2152.272, "train_tokens_per_second": 5965.61 }, { "epoch": 0.7819770114942529, "grad_norm": 0.6919854283332825, "learning_rate": 0.00012195840235597276, "loss": 1.6841, "num_input_tokens_seen": 12846720, "step": 2126, "train_runtime": 2153.4085, "train_tokens_per_second": 5965.761 }, { "epoch": 0.7823448275862069, "grad_norm": 0.7704769968986511, "learning_rate": 0.00012192159028161238, "loss": 1.8583, "num_input_tokens_seen": 12851632, "step": 2127, "train_runtime": 2154.2562, "train_tokens_per_second": 5965.693 }, { "epoch": 0.782712643678161, "grad_norm": 0.7886033058166504, "learning_rate": 0.00012188477820725199, "loss": 1.6769, "num_input_tokens_seen": 12859456, "step": 2128, "train_runtime": 2155.4833, "train_tokens_per_second": 5965.927 }, { "epoch": 0.783080459770115, "grad_norm": 0.7637695670127869, "learning_rate": 0.0001218479661328916, "loss": 1.8165, "num_input_tokens_seen": 12866368, "step": 2129, "train_runtime": 2156.5852, "train_tokens_per_second": 5966.084 }, { "epoch": 0.783448275862069, "grad_norm": 0.7374247908592224, "learning_rate": 0.00012181115405853121, "loss": 1.6218, "num_input_tokens_seen": 12871632, "step": 2130, "train_runtime": 2157.4662, "train_tokens_per_second": 5966.087 }, { "epoch": 0.783816091954023, "grad_norm": 0.6884121894836426, "learning_rate": 0.00012177434198417082, "loss": 1.9006, "num_input_tokens_seen": 12878016, "step": 2131, "train_runtime": 2159.0725, "train_tokens_per_second": 5964.606 }, { "epoch": 0.784183908045977, "grad_norm": 0.841325581073761, "learning_rate": 0.00012173752990981043, "loss": 1.7529, "num_input_tokens_seen": 12883808, "step": 2132, "train_runtime": 2160.0043, "train_tokens_per_second": 5964.714 }, { "epoch": 0.7845517241379311, "grad_norm": 0.6641340255737305, "learning_rate": 0.00012170071783545003, "loss": 1.6923, "num_input_tokens_seen": 12891104, "step": 2133, "train_runtime": 2161.1285, "train_tokens_per_second": 5964.987 }, { "epoch": 0.7849195402298851, "grad_norm": 0.8208033442497253, "learning_rate": 0.00012166390576108963, "loss": 1.5294, "num_input_tokens_seen": 12897616, "step": 2134, "train_runtime": 2162.188, "train_tokens_per_second": 5965.076 }, { "epoch": 0.7852873563218391, "grad_norm": 0.7175398468971252, "learning_rate": 0.00012162709368672924, "loss": 1.7781, "num_input_tokens_seen": 12905216, "step": 2135, "train_runtime": 2163.3935, "train_tokens_per_second": 5965.265 }, { "epoch": 0.7856551724137931, "grad_norm": 0.7060106992721558, "learning_rate": 0.00012159028161236887, "loss": 1.5183, "num_input_tokens_seen": 12909872, "step": 2136, "train_runtime": 2164.1901, "train_tokens_per_second": 5965.221 }, { "epoch": 0.7860229885057471, "grad_norm": 0.7808321118354797, "learning_rate": 0.00012155346953800848, "loss": 1.8642, "num_input_tokens_seen": 12915520, "step": 2137, "train_runtime": 2165.1377, "train_tokens_per_second": 5965.219 }, { "epoch": 0.7863908045977012, "grad_norm": 0.7710825800895691, "learning_rate": 0.00012151665746364809, "loss": 1.7373, "num_input_tokens_seen": 12920992, "step": 2138, "train_runtime": 2166.0458, "train_tokens_per_second": 5965.244 }, { "epoch": 0.7867586206896552, "grad_norm": 0.7178471088409424, "learning_rate": 0.00012147984538928769, "loss": 1.6675, "num_input_tokens_seen": 12926112, "step": 2139, "train_runtime": 2166.902, "train_tokens_per_second": 5965.25 }, { "epoch": 0.7871264367816092, "grad_norm": 0.7546533346176147, "learning_rate": 0.0001214430333149273, "loss": 1.7433, "num_input_tokens_seen": 12931424, "step": 2140, "train_runtime": 2167.7763, "train_tokens_per_second": 5965.294 }, { "epoch": 0.7874942528735632, "grad_norm": 0.7169228196144104, "learning_rate": 0.0001214062212405669, "loss": 1.7944, "num_input_tokens_seen": 12939808, "step": 2141, "train_runtime": 2169.0765, "train_tokens_per_second": 5965.584 }, { "epoch": 0.7878620689655172, "grad_norm": 0.7573052644729614, "learning_rate": 0.00012136940916620651, "loss": 1.6879, "num_input_tokens_seen": 12944656, "step": 2142, "train_runtime": 2169.9196, "train_tokens_per_second": 5965.5 }, { "epoch": 0.7882298850574713, "grad_norm": 0.7861320972442627, "learning_rate": 0.00012133259709184612, "loss": 1.8693, "num_input_tokens_seen": 12949776, "step": 2143, "train_runtime": 2170.7861, "train_tokens_per_second": 5965.478 }, { "epoch": 0.7885977011494253, "grad_norm": 0.7815845608711243, "learning_rate": 0.00012129578501748573, "loss": 2.004, "num_input_tokens_seen": 12955040, "step": 2144, "train_runtime": 2171.6736, "train_tokens_per_second": 5965.464 }, { "epoch": 0.7889655172413793, "grad_norm": 0.8198308944702148, "learning_rate": 0.00012125897294312535, "loss": 1.6251, "num_input_tokens_seen": 12963728, "step": 2145, "train_runtime": 2173.0125, "train_tokens_per_second": 5965.786 }, { "epoch": 0.7893333333333333, "grad_norm": 0.769403874874115, "learning_rate": 0.00012122216086876496, "loss": 1.6499, "num_input_tokens_seen": 12971776, "step": 2146, "train_runtime": 2174.2927, "train_tokens_per_second": 5965.975 }, { "epoch": 0.7897011494252874, "grad_norm": 0.7350329160690308, "learning_rate": 0.00012118534879440457, "loss": 1.6657, "num_input_tokens_seen": 12980208, "step": 2147, "train_runtime": 2175.6096, "train_tokens_per_second": 5966.239 }, { "epoch": 0.7900689655172414, "grad_norm": 0.8037062287330627, "learning_rate": 0.00012114853672004418, "loss": 1.7512, "num_input_tokens_seen": 12986576, "step": 2148, "train_runtime": 2176.6467, "train_tokens_per_second": 5966.322 }, { "epoch": 0.7904367816091954, "grad_norm": 0.7732772827148438, "learning_rate": 0.00012111172464568379, "loss": 1.6079, "num_input_tokens_seen": 12991728, "step": 2149, "train_runtime": 2177.5444, "train_tokens_per_second": 5966.229 }, { "epoch": 0.7908045977011494, "grad_norm": 0.7495967149734497, "learning_rate": 0.0001210749125713234, "loss": 1.8363, "num_input_tokens_seen": 12999984, "step": 2150, "train_runtime": 2178.8418, "train_tokens_per_second": 5966.465 }, { "epoch": 0.7911724137931034, "grad_norm": 0.6866952776908875, "learning_rate": 0.00012103810049696301, "loss": 1.7136, "num_input_tokens_seen": 13005744, "step": 2151, "train_runtime": 2179.7851, "train_tokens_per_second": 5966.526 }, { "epoch": 0.7915402298850575, "grad_norm": 0.8390110731124878, "learning_rate": 0.0001210012884226026, "loss": 1.9442, "num_input_tokens_seen": 13012000, "step": 2152, "train_runtime": 2180.795, "train_tokens_per_second": 5966.632 }, { "epoch": 0.7919080459770115, "grad_norm": 0.7232964038848877, "learning_rate": 0.00012096447634824224, "loss": 1.6981, "num_input_tokens_seen": 13019568, "step": 2153, "train_runtime": 2181.999, "train_tokens_per_second": 5966.807 }, { "epoch": 0.7922758620689655, "grad_norm": 0.7241571545600891, "learning_rate": 0.00012092766427388185, "loss": 1.5719, "num_input_tokens_seen": 13030912, "step": 2154, "train_runtime": 2183.6801, "train_tokens_per_second": 5967.409 }, { "epoch": 0.7926436781609195, "grad_norm": 0.7424749732017517, "learning_rate": 0.00012089085219952146, "loss": 1.6579, "num_input_tokens_seen": 13036224, "step": 2155, "train_runtime": 2184.5661, "train_tokens_per_second": 5967.42 }, { "epoch": 0.7930114942528735, "grad_norm": 0.7053840160369873, "learning_rate": 0.00012085404012516107, "loss": 1.8049, "num_input_tokens_seen": 13043360, "step": 2156, "train_runtime": 2185.6927, "train_tokens_per_second": 5967.609 }, { "epoch": 0.7933793103448276, "grad_norm": 0.828298807144165, "learning_rate": 0.00012081722805080067, "loss": 1.8097, "num_input_tokens_seen": 13047968, "step": 2157, "train_runtime": 2186.509, "train_tokens_per_second": 5967.489 }, { "epoch": 0.7937471264367816, "grad_norm": 0.7036006450653076, "learning_rate": 0.00012078041597644027, "loss": 1.9218, "num_input_tokens_seen": 13052880, "step": 2158, "train_runtime": 2187.3554, "train_tokens_per_second": 5967.425 }, { "epoch": 0.7941149425287356, "grad_norm": 0.7244173884391785, "learning_rate": 0.00012074360390207988, "loss": 1.6771, "num_input_tokens_seen": 13060016, "step": 2159, "train_runtime": 2188.4741, "train_tokens_per_second": 5967.636 }, { "epoch": 0.7944827586206896, "grad_norm": 0.780311107635498, "learning_rate": 0.00012070679182771949, "loss": 1.7898, "num_input_tokens_seen": 13065552, "step": 2160, "train_runtime": 2189.3758, "train_tokens_per_second": 5967.706 }, { "epoch": 0.7948505747126436, "grad_norm": 0.770302414894104, "learning_rate": 0.0001206699797533591, "loss": 1.8771, "num_input_tokens_seen": 13070752, "step": 2161, "train_runtime": 2190.7747, "train_tokens_per_second": 5966.269 }, { "epoch": 0.7952183908045977, "grad_norm": 0.7521932125091553, "learning_rate": 0.00012063316767899873, "loss": 1.8639, "num_input_tokens_seen": 13075680, "step": 2162, "train_runtime": 2191.5995, "train_tokens_per_second": 5966.273 }, { "epoch": 0.7955862068965517, "grad_norm": 0.7477977275848389, "learning_rate": 0.00012059635560463833, "loss": 1.6864, "num_input_tokens_seen": 13081232, "step": 2163, "train_runtime": 2192.544, "train_tokens_per_second": 5966.235 }, { "epoch": 0.7959540229885057, "grad_norm": 0.7869067192077637, "learning_rate": 0.00012055954353027794, "loss": 1.6155, "num_input_tokens_seen": 13087344, "step": 2164, "train_runtime": 2193.5473, "train_tokens_per_second": 5966.292 }, { "epoch": 0.7963218390804597, "grad_norm": 0.7853013873100281, "learning_rate": 0.00012052273145591755, "loss": 1.8206, "num_input_tokens_seen": 13094016, "step": 2165, "train_runtime": 2194.6491, "train_tokens_per_second": 5966.337 }, { "epoch": 0.7966896551724137, "grad_norm": 0.7521070241928101, "learning_rate": 0.00012048591938155715, "loss": 1.6824, "num_input_tokens_seen": 13099232, "step": 2166, "train_runtime": 2195.5045, "train_tokens_per_second": 5966.388 }, { "epoch": 0.7970574712643678, "grad_norm": 0.7937947511672974, "learning_rate": 0.00012044910730719676, "loss": 1.7893, "num_input_tokens_seen": 13104288, "step": 2167, "train_runtime": 2196.3591, "train_tokens_per_second": 5966.369 }, { "epoch": 0.7974252873563218, "grad_norm": 0.8112798929214478, "learning_rate": 0.00012041229523283637, "loss": 1.7948, "num_input_tokens_seen": 13112928, "step": 2168, "train_runtime": 2197.6897, "train_tokens_per_second": 5966.688 }, { "epoch": 0.7977931034482758, "grad_norm": 0.6776713728904724, "learning_rate": 0.00012037548315847598, "loss": 1.6845, "num_input_tokens_seen": 13125312, "step": 2169, "train_runtime": 2199.5096, "train_tokens_per_second": 5967.381 }, { "epoch": 0.7981609195402298, "grad_norm": 0.5651150345802307, "learning_rate": 0.0001203386710841156, "loss": 1.5699, "num_input_tokens_seen": 13137456, "step": 2170, "train_runtime": 2201.3142, "train_tokens_per_second": 5968.006 }, { "epoch": 0.798528735632184, "grad_norm": 0.7914756536483765, "learning_rate": 0.00012030185900975521, "loss": 1.7932, "num_input_tokens_seen": 13142816, "step": 2171, "train_runtime": 2202.1938, "train_tokens_per_second": 5968.056 }, { "epoch": 0.798896551724138, "grad_norm": 0.7965108752250671, "learning_rate": 0.00012026504693539482, "loss": 1.6363, "num_input_tokens_seen": 13149216, "step": 2172, "train_runtime": 2203.2465, "train_tokens_per_second": 5968.109 }, { "epoch": 0.799264367816092, "grad_norm": 0.7645534873008728, "learning_rate": 0.00012022823486103443, "loss": 1.7914, "num_input_tokens_seen": 13153952, "step": 2173, "train_runtime": 2204.074, "train_tokens_per_second": 5968.017 }, { "epoch": 0.799632183908046, "grad_norm": 0.8161355257034302, "learning_rate": 0.00012019142278667404, "loss": 1.9488, "num_input_tokens_seen": 13159376, "step": 2174, "train_runtime": 2204.964, "train_tokens_per_second": 5968.068 }, { "epoch": 0.8, "grad_norm": 0.69480299949646, "learning_rate": 0.00012015461071231365, "loss": 1.6936, "num_input_tokens_seen": 13171120, "step": 2175, "train_runtime": 2206.6956, "train_tokens_per_second": 5968.707 }, { "epoch": 0.8003678160919541, "grad_norm": 0.7443561553955078, "learning_rate": 0.00012011779863795324, "loss": 1.7426, "num_input_tokens_seen": 13179040, "step": 2176, "train_runtime": 2207.929, "train_tokens_per_second": 5968.96 }, { "epoch": 0.8003678160919541, "eval_loss": 1.782747507095337, "eval_runtime": 4.7692, "eval_samples_per_second": 209.678, "eval_steps_per_second": 13.21, "num_input_tokens_seen": 13179040, "step": 2176 }, { "epoch": 0.8007356321839081, "grad_norm": 0.7878211140632629, "learning_rate": 0.00012008098656359285, "loss": 1.8395, "num_input_tokens_seen": 13184048, "step": 2177, "train_runtime": 2213.5639, "train_tokens_per_second": 5956.028 }, { "epoch": 0.8011034482758621, "grad_norm": 0.7659966349601746, "learning_rate": 0.00012004417448923246, "loss": 1.727, "num_input_tokens_seen": 13189664, "step": 2178, "train_runtime": 2214.516, "train_tokens_per_second": 5956.003 }, { "epoch": 0.8014712643678161, "grad_norm": 0.7582219243049622, "learning_rate": 0.0001200073624148721, "loss": 1.8222, "num_input_tokens_seen": 13195456, "step": 2179, "train_runtime": 2215.4365, "train_tokens_per_second": 5956.143 }, { "epoch": 0.8018390804597701, "grad_norm": 0.8086379766464233, "learning_rate": 0.0001199705503405117, "loss": 1.637, "num_input_tokens_seen": 13201664, "step": 2180, "train_runtime": 2216.4302, "train_tokens_per_second": 5956.273 }, { "epoch": 0.8022068965517242, "grad_norm": 0.726866602897644, "learning_rate": 0.0001199337382661513, "loss": 1.7879, "num_input_tokens_seen": 13206528, "step": 2181, "train_runtime": 2217.2678, "train_tokens_per_second": 5956.217 }, { "epoch": 0.8025747126436782, "grad_norm": 0.7773523926734924, "learning_rate": 0.00011989692619179091, "loss": 1.6477, "num_input_tokens_seen": 13214272, "step": 2182, "train_runtime": 2218.5035, "train_tokens_per_second": 5956.39 }, { "epoch": 0.8029425287356322, "grad_norm": 0.8535124063491821, "learning_rate": 0.00011986011411743052, "loss": 1.7861, "num_input_tokens_seen": 13218992, "step": 2183, "train_runtime": 2219.3368, "train_tokens_per_second": 5956.28 }, { "epoch": 0.8033103448275862, "grad_norm": 0.7061176896095276, "learning_rate": 0.00011982330204307013, "loss": 1.6619, "num_input_tokens_seen": 13223696, "step": 2184, "train_runtime": 2220.1693, "train_tokens_per_second": 5956.165 }, { "epoch": 0.8036781609195403, "grad_norm": 0.7682154178619385, "learning_rate": 0.00011978648996870974, "loss": 1.6372, "num_input_tokens_seen": 13228752, "step": 2185, "train_runtime": 2221.0482, "train_tokens_per_second": 5956.085 }, { "epoch": 0.8040459770114943, "grad_norm": 0.7980086207389832, "learning_rate": 0.00011974967789434935, "loss": 1.9487, "num_input_tokens_seen": 13235280, "step": 2186, "train_runtime": 2222.1041, "train_tokens_per_second": 5956.192 }, { "epoch": 0.8044137931034483, "grad_norm": 0.7011343836784363, "learning_rate": 0.00011971286581998897, "loss": 1.4009, "num_input_tokens_seen": 13240352, "step": 2187, "train_runtime": 2222.9402, "train_tokens_per_second": 5956.234 }, { "epoch": 0.8047816091954023, "grad_norm": 0.8399803042411804, "learning_rate": 0.00011967605374562858, "loss": 2.0242, "num_input_tokens_seen": 13246960, "step": 2188, "train_runtime": 2224.0106, "train_tokens_per_second": 5956.339 }, { "epoch": 0.8051494252873563, "grad_norm": 0.7678438425064087, "learning_rate": 0.00011963924167126819, "loss": 1.694, "num_input_tokens_seen": 13254576, "step": 2189, "train_runtime": 2225.1893, "train_tokens_per_second": 5956.606 }, { "epoch": 0.8055172413793104, "grad_norm": 0.694980800151825, "learning_rate": 0.0001196024295969078, "loss": 1.6687, "num_input_tokens_seen": 13263024, "step": 2190, "train_runtime": 2226.4744, "train_tokens_per_second": 5956.962 }, { "epoch": 0.8058850574712644, "grad_norm": 0.7804933190345764, "learning_rate": 0.0001195656175225474, "loss": 1.5794, "num_input_tokens_seen": 13267664, "step": 2191, "train_runtime": 2227.7249, "train_tokens_per_second": 5955.701 }, { "epoch": 0.8062528735632184, "grad_norm": 0.8200054168701172, "learning_rate": 0.00011952880544818701, "loss": 1.6344, "num_input_tokens_seen": 13273072, "step": 2192, "train_runtime": 2228.625, "train_tokens_per_second": 5955.723 }, { "epoch": 0.8066206896551724, "grad_norm": 0.754323422908783, "learning_rate": 0.00011949199337382662, "loss": 1.8163, "num_input_tokens_seen": 13278544, "step": 2193, "train_runtime": 2229.5405, "train_tokens_per_second": 5955.731 }, { "epoch": 0.8069885057471264, "grad_norm": 0.7527128458023071, "learning_rate": 0.00011945518129946622, "loss": 1.7368, "num_input_tokens_seen": 13283280, "step": 2194, "train_runtime": 2230.3715, "train_tokens_per_second": 5955.636 }, { "epoch": 0.8073563218390805, "grad_norm": 0.730532705783844, "learning_rate": 0.00011941836922510583, "loss": 1.68, "num_input_tokens_seen": 13288400, "step": 2195, "train_runtime": 2231.2546, "train_tokens_per_second": 5955.573 }, { "epoch": 0.8077241379310345, "grad_norm": 0.7435619831085205, "learning_rate": 0.00011938155715074546, "loss": 1.8355, "num_input_tokens_seen": 13294944, "step": 2196, "train_runtime": 2232.3143, "train_tokens_per_second": 5955.677 }, { "epoch": 0.8080919540229885, "grad_norm": 0.8014752864837646, "learning_rate": 0.00011934474507638507, "loss": 1.9065, "num_input_tokens_seen": 13300240, "step": 2197, "train_runtime": 2233.2014, "train_tokens_per_second": 5955.683 }, { "epoch": 0.8084597701149425, "grad_norm": 0.9064193367958069, "learning_rate": 0.00011930793300202468, "loss": 1.7887, "num_input_tokens_seen": 13305248, "step": 2198, "train_runtime": 2234.0727, "train_tokens_per_second": 5955.602 }, { "epoch": 0.8088275862068965, "grad_norm": 0.7992514371871948, "learning_rate": 0.00011927112092766428, "loss": 1.6639, "num_input_tokens_seen": 13311728, "step": 2199, "train_runtime": 2235.098, "train_tokens_per_second": 5955.769 }, { "epoch": 0.8091954022988506, "grad_norm": 0.7761949896812439, "learning_rate": 0.00011923430885330388, "loss": 1.693, "num_input_tokens_seen": 13316736, "step": 2200, "train_runtime": 2235.9207, "train_tokens_per_second": 5955.818 }, { "epoch": 0.8095632183908046, "grad_norm": 0.754311740398407, "learning_rate": 0.00011919749677894349, "loss": 1.6683, "num_input_tokens_seen": 13322912, "step": 2201, "train_runtime": 2236.9148, "train_tokens_per_second": 5955.932 }, { "epoch": 0.8099310344827586, "grad_norm": 0.7518620491027832, "learning_rate": 0.0001191606847045831, "loss": 1.7392, "num_input_tokens_seen": 13328640, "step": 2202, "train_runtime": 2237.8588, "train_tokens_per_second": 5955.979 }, { "epoch": 0.8102988505747126, "grad_norm": 0.7505711913108826, "learning_rate": 0.00011912387263022271, "loss": 1.6373, "num_input_tokens_seen": 13336416, "step": 2203, "train_runtime": 2239.0681, "train_tokens_per_second": 5956.235 }, { "epoch": 0.8106666666666666, "grad_norm": 0.7444790601730347, "learning_rate": 0.00011908706055586232, "loss": 1.7822, "num_input_tokens_seen": 13342096, "step": 2204, "train_runtime": 2239.9991, "train_tokens_per_second": 5956.295 }, { "epoch": 0.8110344827586207, "grad_norm": 0.8003002405166626, "learning_rate": 0.00011905024848150194, "loss": 1.6414, "num_input_tokens_seen": 13348368, "step": 2205, "train_runtime": 2241.0353, "train_tokens_per_second": 5956.34 }, { "epoch": 0.8114022988505747, "grad_norm": 0.685434877872467, "learning_rate": 0.00011901343640714155, "loss": 1.5408, "num_input_tokens_seen": 13355424, "step": 2206, "train_runtime": 2242.1707, "train_tokens_per_second": 5956.471 }, { "epoch": 0.8117701149425287, "grad_norm": 0.7814292907714844, "learning_rate": 0.00011897662433278116, "loss": 1.731, "num_input_tokens_seen": 13359808, "step": 2207, "train_runtime": 2242.9528, "train_tokens_per_second": 5956.348 }, { "epoch": 0.8121379310344827, "grad_norm": 0.7573452591896057, "learning_rate": 0.00011893981225842077, "loss": 1.7434, "num_input_tokens_seen": 13366848, "step": 2208, "train_runtime": 2244.0741, "train_tokens_per_second": 5956.509 }, { "epoch": 0.8125057471264368, "grad_norm": 0.8169957399368286, "learning_rate": 0.00011890300018406038, "loss": 1.7472, "num_input_tokens_seen": 13371776, "step": 2209, "train_runtime": 2244.9226, "train_tokens_per_second": 5956.453 }, { "epoch": 0.8128735632183908, "grad_norm": 0.735317051410675, "learning_rate": 0.00011886618810969999, "loss": 1.6542, "num_input_tokens_seen": 13377616, "step": 2210, "train_runtime": 2245.904, "train_tokens_per_second": 5956.45 }, { "epoch": 0.8132413793103448, "grad_norm": 0.7750908732414246, "learning_rate": 0.0001188293760353396, "loss": 1.7314, "num_input_tokens_seen": 13383696, "step": 2211, "train_runtime": 2246.8816, "train_tokens_per_second": 5956.565 }, { "epoch": 0.8136091954022988, "grad_norm": 0.6906810402870178, "learning_rate": 0.00011879256396097919, "loss": 1.7276, "num_input_tokens_seen": 13389056, "step": 2212, "train_runtime": 2247.7847, "train_tokens_per_second": 5956.556 }, { "epoch": 0.8139770114942528, "grad_norm": 0.8501411080360413, "learning_rate": 0.00011875575188661883, "loss": 1.6156, "num_input_tokens_seen": 13394256, "step": 2213, "train_runtime": 2248.6531, "train_tokens_per_second": 5956.568 }, { "epoch": 0.8143448275862069, "grad_norm": 0.7399520874023438, "learning_rate": 0.00011871893981225844, "loss": 1.7377, "num_input_tokens_seen": 13400720, "step": 2214, "train_runtime": 2249.7217, "train_tokens_per_second": 5956.612 }, { "epoch": 0.8147126436781609, "grad_norm": 0.7963682413101196, "learning_rate": 0.00011868212773789804, "loss": 1.8527, "num_input_tokens_seen": 13405792, "step": 2215, "train_runtime": 2250.5961, "train_tokens_per_second": 5956.552 }, { "epoch": 0.8150804597701149, "grad_norm": 0.7445478439331055, "learning_rate": 0.00011864531566353765, "loss": 1.6572, "num_input_tokens_seen": 13413312, "step": 2216, "train_runtime": 2251.7895, "train_tokens_per_second": 5956.734 }, { "epoch": 0.8154482758620689, "grad_norm": 0.785130500793457, "learning_rate": 0.00011860850358917725, "loss": 1.6997, "num_input_tokens_seen": 13418192, "step": 2217, "train_runtime": 2252.6025, "train_tokens_per_second": 5956.751 }, { "epoch": 0.8158160919540229, "grad_norm": 0.682814359664917, "learning_rate": 0.00011857169151481686, "loss": 1.7225, "num_input_tokens_seen": 13426336, "step": 2218, "train_runtime": 2253.8897, "train_tokens_per_second": 5956.962 }, { "epoch": 0.816183908045977, "grad_norm": 0.7894740700721741, "learning_rate": 0.00011853487944045647, "loss": 1.7328, "num_input_tokens_seen": 13432064, "step": 2219, "train_runtime": 2254.8597, "train_tokens_per_second": 5956.94 }, { "epoch": 0.8165517241379311, "grad_norm": 0.7319313287734985, "learning_rate": 0.00011849806736609608, "loss": 1.7548, "num_input_tokens_seen": 13436448, "step": 2220, "train_runtime": 2255.6346, "train_tokens_per_second": 5956.837 }, { "epoch": 0.8169195402298851, "grad_norm": 0.7173370718955994, "learning_rate": 0.00011846125529173568, "loss": 1.8158, "num_input_tokens_seen": 13441664, "step": 2221, "train_runtime": 2256.9964, "train_tokens_per_second": 5955.554 }, { "epoch": 0.8172873563218391, "grad_norm": 0.8172082304954529, "learning_rate": 0.00011842444321737532, "loss": 1.9257, "num_input_tokens_seen": 13447024, "step": 2222, "train_runtime": 2257.8857, "train_tokens_per_second": 5955.582 }, { "epoch": 0.8176551724137932, "grad_norm": 0.7469117641448975, "learning_rate": 0.00011838763114301492, "loss": 1.7575, "num_input_tokens_seen": 13451552, "step": 2223, "train_runtime": 2258.6704, "train_tokens_per_second": 5955.518 }, { "epoch": 0.8180229885057472, "grad_norm": 0.7840341329574585, "learning_rate": 0.00011835081906865452, "loss": 1.7328, "num_input_tokens_seen": 13457200, "step": 2224, "train_runtime": 2259.6065, "train_tokens_per_second": 5955.55 }, { "epoch": 0.8183908045977012, "grad_norm": 0.7672483325004578, "learning_rate": 0.00011831400699429413, "loss": 1.6439, "num_input_tokens_seen": 13462816, "step": 2225, "train_runtime": 2260.5386, "train_tokens_per_second": 5955.579 }, { "epoch": 0.8187586206896552, "grad_norm": 0.759892463684082, "learning_rate": 0.00011827719491993374, "loss": 1.4372, "num_input_tokens_seen": 13468272, "step": 2226, "train_runtime": 2261.4324, "train_tokens_per_second": 5955.638 }, { "epoch": 0.8191264367816092, "grad_norm": 0.8722032308578491, "learning_rate": 0.00011824038284557335, "loss": 2.0645, "num_input_tokens_seen": 13472736, "step": 2227, "train_runtime": 2262.2421, "train_tokens_per_second": 5955.479 }, { "epoch": 0.8194942528735633, "grad_norm": 0.7259359359741211, "learning_rate": 0.00011820357077121296, "loss": 1.7829, "num_input_tokens_seen": 13477296, "step": 2228, "train_runtime": 2263.0393, "train_tokens_per_second": 5955.396 }, { "epoch": 0.8198620689655173, "grad_norm": 0.7328168749809265, "learning_rate": 0.00011816675869685257, "loss": 1.7047, "num_input_tokens_seen": 13482432, "step": 2229, "train_runtime": 2263.9055, "train_tokens_per_second": 5955.386 }, { "epoch": 0.8202298850574713, "grad_norm": 0.7600240111351013, "learning_rate": 0.00011812994662249219, "loss": 1.6535, "num_input_tokens_seen": 13489152, "step": 2230, "train_runtime": 2264.9988, "train_tokens_per_second": 5955.479 }, { "epoch": 0.8205977011494253, "grad_norm": 0.6951624751091003, "learning_rate": 0.0001180931345481318, "loss": 1.9195, "num_input_tokens_seen": 13498592, "step": 2231, "train_runtime": 2266.4353, "train_tokens_per_second": 5955.869 }, { "epoch": 0.8209655172413793, "grad_norm": 0.7410976886749268, "learning_rate": 0.00011805632247377141, "loss": 1.601, "num_input_tokens_seen": 13502768, "step": 2232, "train_runtime": 2267.1704, "train_tokens_per_second": 5955.78 }, { "epoch": 0.8213333333333334, "grad_norm": 0.832591712474823, "learning_rate": 0.00011801951039941102, "loss": 1.7121, "num_input_tokens_seen": 13510432, "step": 2233, "train_runtime": 2268.3858, "train_tokens_per_second": 5955.967 }, { "epoch": 0.8217011494252874, "grad_norm": 0.6923752427101135, "learning_rate": 0.00011798269832505063, "loss": 1.7457, "num_input_tokens_seen": 13516208, "step": 2234, "train_runtime": 2269.3369, "train_tokens_per_second": 5956.017 }, { "epoch": 0.8220689655172414, "grad_norm": 0.8069286346435547, "learning_rate": 0.00011794588625069024, "loss": 1.7031, "num_input_tokens_seen": 13520816, "step": 2235, "train_runtime": 2270.1437, "train_tokens_per_second": 5955.93 }, { "epoch": 0.8224367816091954, "grad_norm": 0.7739611268043518, "learning_rate": 0.00011790907417632983, "loss": 1.672, "num_input_tokens_seen": 13530256, "step": 2236, "train_runtime": 2271.5866, "train_tokens_per_second": 5956.302 }, { "epoch": 0.8228045977011494, "grad_norm": 0.7646172642707825, "learning_rate": 0.00011787226210196944, "loss": 1.819, "num_input_tokens_seen": 13535456, "step": 2237, "train_runtime": 2272.4355, "train_tokens_per_second": 5956.365 }, { "epoch": 0.8231724137931035, "grad_norm": 0.7784832715988159, "learning_rate": 0.00011783545002760905, "loss": 1.8317, "num_input_tokens_seen": 13540256, "step": 2238, "train_runtime": 2273.2752, "train_tokens_per_second": 5956.277 }, { "epoch": 0.8235402298850575, "grad_norm": 0.8190975785255432, "learning_rate": 0.00011779863795324869, "loss": 1.6273, "num_input_tokens_seen": 13544976, "step": 2239, "train_runtime": 2274.085, "train_tokens_per_second": 5956.231 }, { "epoch": 0.8239080459770115, "grad_norm": 0.6801204085350037, "learning_rate": 0.0001177618258788883, "loss": 1.7859, "num_input_tokens_seen": 13553088, "step": 2240, "train_runtime": 2275.3514, "train_tokens_per_second": 5956.481 }, { "epoch": 0.8242758620689655, "grad_norm": 0.7675638198852539, "learning_rate": 0.00011772501380452789, "loss": 1.6779, "num_input_tokens_seen": 13559008, "step": 2241, "train_runtime": 2276.3182, "train_tokens_per_second": 5956.552 }, { "epoch": 0.8246436781609195, "grad_norm": 0.7743769884109497, "learning_rate": 0.0001176882017301675, "loss": 1.8434, "num_input_tokens_seen": 13563792, "step": 2242, "train_runtime": 2277.1494, "train_tokens_per_second": 5956.479 }, { "epoch": 0.8250114942528736, "grad_norm": 0.7585687041282654, "learning_rate": 0.00011765138965580711, "loss": 1.6791, "num_input_tokens_seen": 13568608, "step": 2243, "train_runtime": 2277.9643, "train_tokens_per_second": 5956.462 }, { "epoch": 0.8253793103448276, "grad_norm": 0.7414730191230774, "learning_rate": 0.00011761457758144672, "loss": 1.8131, "num_input_tokens_seen": 13573344, "step": 2244, "train_runtime": 2278.7933, "train_tokens_per_second": 5956.374 }, { "epoch": 0.8257471264367816, "grad_norm": 0.7411015629768372, "learning_rate": 0.00011757776550708633, "loss": 1.7384, "num_input_tokens_seen": 13578160, "step": 2245, "train_runtime": 2279.6254, "train_tokens_per_second": 5956.312 }, { "epoch": 0.8261149425287356, "grad_norm": 0.7856464385986328, "learning_rate": 0.00011754095343272593, "loss": 1.6141, "num_input_tokens_seen": 13582832, "step": 2246, "train_runtime": 2280.4167, "train_tokens_per_second": 5956.294 }, { "epoch": 0.8264827586206897, "grad_norm": 0.7507676482200623, "learning_rate": 0.00011750414135836556, "loss": 1.446, "num_input_tokens_seen": 13588448, "step": 2247, "train_runtime": 2281.3449, "train_tokens_per_second": 5956.332 }, { "epoch": 0.8268505747126437, "grad_norm": 0.7500200271606445, "learning_rate": 0.00011746732928400517, "loss": 1.6697, "num_input_tokens_seen": 13595552, "step": 2248, "train_runtime": 2282.4981, "train_tokens_per_second": 5956.435 }, { "epoch": 0.8272183908045977, "grad_norm": 0.7292554974555969, "learning_rate": 0.00011743051720964477, "loss": 1.7127, "num_input_tokens_seen": 13600432, "step": 2249, "train_runtime": 2283.324, "train_tokens_per_second": 5956.418 }, { "epoch": 0.8275862068965517, "grad_norm": 0.7304660677909851, "learning_rate": 0.00011739370513528438, "loss": 1.8134, "num_input_tokens_seen": 13608592, "step": 2250, "train_runtime": 2284.6041, "train_tokens_per_second": 5956.652 }, { "epoch": 0.8279540229885057, "grad_norm": 0.8456048965454102, "learning_rate": 0.00011735689306092399, "loss": 1.7913, "num_input_tokens_seen": 13614080, "step": 2251, "train_runtime": 2286.0618, "train_tokens_per_second": 5955.254 }, { "epoch": 0.8283218390804598, "grad_norm": 0.8031347393989563, "learning_rate": 0.0001173200809865636, "loss": 1.8444, "num_input_tokens_seen": 13619392, "step": 2252, "train_runtime": 2286.9267, "train_tokens_per_second": 5955.325 }, { "epoch": 0.8286896551724138, "grad_norm": 0.6796359419822693, "learning_rate": 0.00011728326891220321, "loss": 1.6246, "num_input_tokens_seen": 13625664, "step": 2253, "train_runtime": 2287.9726, "train_tokens_per_second": 5955.344 }, { "epoch": 0.8290574712643678, "grad_norm": 0.7418872714042664, "learning_rate": 0.0001172464568378428, "loss": 1.8719, "num_input_tokens_seen": 13630944, "step": 2254, "train_runtime": 2288.8573, "train_tokens_per_second": 5955.349 }, { "epoch": 0.8294252873563218, "grad_norm": 0.8159528970718384, "learning_rate": 0.00011720964476348241, "loss": 1.8128, "num_input_tokens_seen": 13637104, "step": 2255, "train_runtime": 2289.8756, "train_tokens_per_second": 5955.391 }, { "epoch": 0.8297931034482758, "grad_norm": 0.7546332478523254, "learning_rate": 0.00011717283268912205, "loss": 1.7945, "num_input_tokens_seen": 13643456, "step": 2256, "train_runtime": 2290.8796, "train_tokens_per_second": 5955.554 }, { "epoch": 0.8301609195402299, "grad_norm": 0.7049574851989746, "learning_rate": 0.00011713602061476166, "loss": 1.6575, "num_input_tokens_seen": 13649984, "step": 2257, "train_runtime": 2291.943, "train_tokens_per_second": 5955.639 }, { "epoch": 0.8305287356321839, "grad_norm": 0.7260283827781677, "learning_rate": 0.00011709920854040127, "loss": 1.5161, "num_input_tokens_seen": 13658080, "step": 2258, "train_runtime": 2293.1947, "train_tokens_per_second": 5955.918 }, { "epoch": 0.8308965517241379, "grad_norm": 0.7271474599838257, "learning_rate": 0.00011706239646604086, "loss": 1.6993, "num_input_tokens_seen": 13664448, "step": 2259, "train_runtime": 2294.2081, "train_tokens_per_second": 5956.063 }, { "epoch": 0.8312643678160919, "grad_norm": 0.8448441028594971, "learning_rate": 0.00011702558439168047, "loss": 1.9481, "num_input_tokens_seen": 13669040, "step": 2260, "train_runtime": 2294.9979, "train_tokens_per_second": 5956.014 }, { "epoch": 0.8316321839080459, "grad_norm": 0.7977505922317505, "learning_rate": 0.00011698877231732008, "loss": 1.7906, "num_input_tokens_seen": 13673200, "step": 2261, "train_runtime": 2295.7282, "train_tokens_per_second": 5955.931 }, { "epoch": 0.832, "grad_norm": 0.7925207614898682, "learning_rate": 0.00011695196024295969, "loss": 1.759, "num_input_tokens_seen": 13679072, "step": 2262, "train_runtime": 2296.687, "train_tokens_per_second": 5956.002 }, { "epoch": 0.832367816091954, "grad_norm": 0.7455686330795288, "learning_rate": 0.0001169151481685993, "loss": 1.7642, "num_input_tokens_seen": 13684400, "step": 2263, "train_runtime": 2297.5834, "train_tokens_per_second": 5955.997 }, { "epoch": 0.832735632183908, "grad_norm": 0.7316351532936096, "learning_rate": 0.00011687833609423891, "loss": 1.7993, "num_input_tokens_seen": 13691344, "step": 2264, "train_runtime": 2298.685, "train_tokens_per_second": 5956.164 }, { "epoch": 0.833103448275862, "grad_norm": 0.6481342911720276, "learning_rate": 0.00011684152401987853, "loss": 1.5944, "num_input_tokens_seen": 13699920, "step": 2265, "train_runtime": 2300.0246, "train_tokens_per_second": 5956.423 }, { "epoch": 0.833471264367816, "grad_norm": 0.75009685754776, "learning_rate": 0.00011680471194551814, "loss": 1.8563, "num_input_tokens_seen": 13707328, "step": 2266, "train_runtime": 2301.2178, "train_tokens_per_second": 5956.554 }, { "epoch": 0.8338390804597701, "grad_norm": 0.7056087255477905, "learning_rate": 0.00011676789987115775, "loss": 1.6878, "num_input_tokens_seen": 13715136, "step": 2267, "train_runtime": 2302.4258, "train_tokens_per_second": 5956.82 }, { "epoch": 0.8342068965517241, "grad_norm": 0.7421260476112366, "learning_rate": 0.00011673108779679736, "loss": 1.7236, "num_input_tokens_seen": 13720928, "step": 2268, "train_runtime": 2303.404, "train_tokens_per_second": 5956.805 }, { "epoch": 0.8345747126436781, "grad_norm": 0.7184244394302368, "learning_rate": 0.00011669427572243697, "loss": 1.7688, "num_input_tokens_seen": 13726288, "step": 2269, "train_runtime": 2304.2831, "train_tokens_per_second": 5956.858 }, { "epoch": 0.8349425287356322, "grad_norm": 0.7536584138870239, "learning_rate": 0.00011665746364807657, "loss": 1.7759, "num_input_tokens_seen": 13730688, "step": 2270, "train_runtime": 2305.0536, "train_tokens_per_second": 5956.776 }, { "epoch": 0.8353103448275863, "grad_norm": 0.6974349021911621, "learning_rate": 0.00011662065157371618, "loss": 1.7523, "num_input_tokens_seen": 13736784, "step": 2271, "train_runtime": 2306.0668, "train_tokens_per_second": 5956.802 }, { "epoch": 0.8356781609195403, "grad_norm": 0.5871516466140747, "learning_rate": 0.00011658383949935578, "loss": 1.4242, "num_input_tokens_seen": 13743200, "step": 2272, "train_runtime": 2307.0906, "train_tokens_per_second": 5956.94 }, { "epoch": 0.8360459770114943, "grad_norm": 0.7451143264770508, "learning_rate": 0.00011654702742499541, "loss": 1.7651, "num_input_tokens_seen": 13750944, "step": 2273, "train_runtime": 2308.2738, "train_tokens_per_second": 5957.241 }, { "epoch": 0.8364137931034483, "grad_norm": 0.7356095910072327, "learning_rate": 0.00011651021535063502, "loss": 1.6545, "num_input_tokens_seen": 13755184, "step": 2274, "train_runtime": 2308.9969, "train_tokens_per_second": 5957.212 }, { "epoch": 0.8367816091954023, "grad_norm": 0.6590993404388428, "learning_rate": 0.00011647340327627463, "loss": 1.7812, "num_input_tokens_seen": 13762272, "step": 2275, "train_runtime": 2310.1032, "train_tokens_per_second": 5957.427 }, { "epoch": 0.8371494252873564, "grad_norm": 0.8147951364517212, "learning_rate": 0.00011643659120191424, "loss": 1.7061, "num_input_tokens_seen": 13766944, "step": 2276, "train_runtime": 2310.9298, "train_tokens_per_second": 5957.318 }, { "epoch": 0.8375172413793104, "grad_norm": 0.7474108934402466, "learning_rate": 0.00011639977912755384, "loss": 1.6041, "num_input_tokens_seen": 13772400, "step": 2277, "train_runtime": 2311.8211, "train_tokens_per_second": 5957.381 }, { "epoch": 0.8378850574712644, "grad_norm": 0.7573875188827515, "learning_rate": 0.00011636296705319345, "loss": 1.6255, "num_input_tokens_seen": 13777168, "step": 2278, "train_runtime": 2312.6582, "train_tokens_per_second": 5957.287 }, { "epoch": 0.8382528735632184, "grad_norm": 0.6747617125511169, "learning_rate": 0.00011632615497883305, "loss": 1.4503, "num_input_tokens_seen": 13783536, "step": 2279, "train_runtime": 2313.6899, "train_tokens_per_second": 5957.383 }, { "epoch": 0.8386206896551724, "grad_norm": 0.7672241926193237, "learning_rate": 0.00011628934290447266, "loss": 1.753, "num_input_tokens_seen": 13789376, "step": 2280, "train_runtime": 2314.6685, "train_tokens_per_second": 5957.387 }, { "epoch": 0.8389885057471265, "grad_norm": 0.6858580112457275, "learning_rate": 0.00011625253083011227, "loss": 1.6245, "num_input_tokens_seen": 13796144, "step": 2281, "train_runtime": 2316.2175, "train_tokens_per_second": 5956.325 }, { "epoch": 0.8393563218390805, "grad_norm": 0.8250431418418884, "learning_rate": 0.0001162157187557519, "loss": 1.9339, "num_input_tokens_seen": 13801184, "step": 2282, "train_runtime": 2317.0649, "train_tokens_per_second": 5956.322 }, { "epoch": 0.8397241379310345, "grad_norm": 0.7551794648170471, "learning_rate": 0.0001161789066813915, "loss": 1.7384, "num_input_tokens_seen": 13808240, "step": 2283, "train_runtime": 2318.209, "train_tokens_per_second": 5956.426 }, { "epoch": 0.8400919540229885, "grad_norm": 0.7227142453193665, "learning_rate": 0.00011614209460703111, "loss": 1.7805, "num_input_tokens_seen": 13813152, "step": 2284, "train_runtime": 2319.0509, "train_tokens_per_second": 5956.381 }, { "epoch": 0.8404597701149426, "grad_norm": 0.7946128845214844, "learning_rate": 0.00011610528253267072, "loss": 1.7317, "num_input_tokens_seen": 13819584, "step": 2285, "train_runtime": 2320.0935, "train_tokens_per_second": 5956.477 }, { "epoch": 0.8408275862068966, "grad_norm": 0.7335671782493591, "learning_rate": 0.00011606847045831033, "loss": 1.7084, "num_input_tokens_seen": 13824816, "step": 2286, "train_runtime": 2320.9688, "train_tokens_per_second": 5956.485 }, { "epoch": 0.8411954022988506, "grad_norm": 0.7103782296180725, "learning_rate": 0.00011603165838394994, "loss": 1.6168, "num_input_tokens_seen": 13832112, "step": 2287, "train_runtime": 2322.1484, "train_tokens_per_second": 5956.601 }, { "epoch": 0.8415632183908046, "grad_norm": 0.7533090114593506, "learning_rate": 0.00011599484630958955, "loss": 1.6981, "num_input_tokens_seen": 13837856, "step": 2288, "train_runtime": 2323.0973, "train_tokens_per_second": 5956.641 }, { "epoch": 0.8419310344827586, "grad_norm": 0.8349571824073792, "learning_rate": 0.00011595803423522916, "loss": 1.9, "num_input_tokens_seen": 13843472, "step": 2289, "train_runtime": 2324.029, "train_tokens_per_second": 5956.669 }, { "epoch": 0.8422988505747127, "grad_norm": 0.7255327701568604, "learning_rate": 0.00011592122216086878, "loss": 1.5794, "num_input_tokens_seen": 13849456, "step": 2290, "train_runtime": 2325.0066, "train_tokens_per_second": 5956.738 }, { "epoch": 0.8426666666666667, "grad_norm": 0.8030518889427185, "learning_rate": 0.00011588441008650839, "loss": 1.6444, "num_input_tokens_seen": 13854176, "step": 2291, "train_runtime": 2325.8038, "train_tokens_per_second": 5956.726 }, { "epoch": 0.8430344827586207, "grad_norm": 0.8301403522491455, "learning_rate": 0.000115847598012148, "loss": 1.7434, "num_input_tokens_seen": 13859040, "step": 2292, "train_runtime": 2326.636, "train_tokens_per_second": 5956.686 }, { "epoch": 0.8434022988505747, "grad_norm": 0.6595023274421692, "learning_rate": 0.0001158107859377876, "loss": 1.6479, "num_input_tokens_seen": 13866160, "step": 2293, "train_runtime": 2327.8028, "train_tokens_per_second": 5956.759 }, { "epoch": 0.8437701149425287, "grad_norm": 0.795469343662262, "learning_rate": 0.00011577397386342721, "loss": 1.8107, "num_input_tokens_seen": 13871104, "step": 2294, "train_runtime": 2328.6431, "train_tokens_per_second": 5956.733 }, { "epoch": 0.8441379310344828, "grad_norm": 0.811279296875, "learning_rate": 0.00011573716178906681, "loss": 1.7903, "num_input_tokens_seen": 13878176, "step": 2295, "train_runtime": 2329.7807, "train_tokens_per_second": 5956.859 }, { "epoch": 0.8445057471264368, "grad_norm": 0.8911852240562439, "learning_rate": 0.00011570034971470642, "loss": 1.7742, "num_input_tokens_seen": 13882512, "step": 2296, "train_runtime": 2330.527, "train_tokens_per_second": 5956.812 }, { "epoch": 0.8448735632183908, "grad_norm": 0.6991628408432007, "learning_rate": 0.00011566353764034603, "loss": 1.6731, "num_input_tokens_seen": 13888736, "step": 2297, "train_runtime": 2331.5644, "train_tokens_per_second": 5956.831 }, { "epoch": 0.8452413793103448, "grad_norm": 0.9091153740882874, "learning_rate": 0.00011562672556598564, "loss": 1.8276, "num_input_tokens_seen": 13893936, "step": 2298, "train_runtime": 2332.4512, "train_tokens_per_second": 5956.796 }, { "epoch": 0.8456091954022988, "grad_norm": 0.7464302182197571, "learning_rate": 0.00011558991349162527, "loss": 1.7393, "num_input_tokens_seen": 13899088, "step": 2299, "train_runtime": 2333.3203, "train_tokens_per_second": 5956.785 }, { "epoch": 0.8459770114942529, "grad_norm": 0.7169905304908752, "learning_rate": 0.00011555310141726488, "loss": 1.5769, "num_input_tokens_seen": 13905344, "step": 2300, "train_runtime": 2334.3444, "train_tokens_per_second": 5956.852 }, { "epoch": 0.8463448275862069, "grad_norm": 0.7689448595046997, "learning_rate": 0.00011551628934290448, "loss": 1.8292, "num_input_tokens_seen": 13911136, "step": 2301, "train_runtime": 2335.3171, "train_tokens_per_second": 5956.851 }, { "epoch": 0.8467126436781609, "grad_norm": 0.8222184777259827, "learning_rate": 0.00011547947726854409, "loss": 1.7091, "num_input_tokens_seen": 13918912, "step": 2302, "train_runtime": 2336.5371, "train_tokens_per_second": 5957.069 }, { "epoch": 0.8470804597701149, "grad_norm": 0.8501462340354919, "learning_rate": 0.0001154426651941837, "loss": 1.9229, "num_input_tokens_seen": 13923424, "step": 2303, "train_runtime": 2337.313, "train_tokens_per_second": 5957.022 }, { "epoch": 0.847448275862069, "grad_norm": 0.7013068199157715, "learning_rate": 0.0001154058531198233, "loss": 1.7237, "num_input_tokens_seen": 13931792, "step": 2304, "train_runtime": 2338.5938, "train_tokens_per_second": 5957.337 }, { "epoch": 0.847816091954023, "grad_norm": 0.8062384724617004, "learning_rate": 0.00011536904104546291, "loss": 1.807, "num_input_tokens_seen": 13937152, "step": 2305, "train_runtime": 2339.4781, "train_tokens_per_second": 5957.377 }, { "epoch": 0.848183908045977, "grad_norm": 0.7189160585403442, "learning_rate": 0.00011533222897110252, "loss": 1.7392, "num_input_tokens_seen": 13943888, "step": 2306, "train_runtime": 2340.5742, "train_tokens_per_second": 5957.465 }, { "epoch": 0.848551724137931, "grad_norm": 0.6561643481254578, "learning_rate": 0.00011529541689674214, "loss": 1.4096, "num_input_tokens_seen": 13952880, "step": 2307, "train_runtime": 2341.9742, "train_tokens_per_second": 5957.743 }, { "epoch": 0.848919540229885, "grad_norm": 0.7770561575889587, "learning_rate": 0.00011525860482238175, "loss": 1.871, "num_input_tokens_seen": 13960736, "step": 2308, "train_runtime": 2343.182, "train_tokens_per_second": 5958.024 }, { "epoch": 0.849287356321839, "grad_norm": 0.7397069334983826, "learning_rate": 0.00011522179274802136, "loss": 1.6995, "num_input_tokens_seen": 13965824, "step": 2309, "train_runtime": 2344.0311, "train_tokens_per_second": 5958.037 }, { "epoch": 0.8496551724137931, "grad_norm": 0.7244512438774109, "learning_rate": 0.00011518498067366097, "loss": 1.7351, "num_input_tokens_seen": 13972160, "step": 2310, "train_runtime": 2345.08, "train_tokens_per_second": 5958.074 }, { "epoch": 0.8500229885057471, "grad_norm": 0.7044952511787415, "learning_rate": 0.00011514816859930058, "loss": 1.5918, "num_input_tokens_seen": 13976992, "step": 2311, "train_runtime": 2346.4082, "train_tokens_per_second": 5956.761 }, { "epoch": 0.8503908045977011, "grad_norm": 0.8645678758621216, "learning_rate": 0.00011511135652494019, "loss": 1.7591, "num_input_tokens_seen": 13984496, "step": 2312, "train_runtime": 2347.5906, "train_tokens_per_second": 5956.957 }, { "epoch": 0.8507586206896551, "grad_norm": 0.8053102493286133, "learning_rate": 0.0001150745444505798, "loss": 1.7409, "num_input_tokens_seen": 13989728, "step": 2313, "train_runtime": 2348.4336, "train_tokens_per_second": 5957.046 }, { "epoch": 0.8511264367816092, "grad_norm": 0.7906848788261414, "learning_rate": 0.00011503773237621939, "loss": 1.9027, "num_input_tokens_seen": 13994512, "step": 2314, "train_runtime": 2349.2617, "train_tokens_per_second": 5956.983 }, { "epoch": 0.8514942528735632, "grad_norm": 0.7035423517227173, "learning_rate": 0.000115000920301859, "loss": 1.6731, "num_input_tokens_seen": 14001200, "step": 2315, "train_runtime": 2350.3109, "train_tokens_per_second": 5957.169 }, { "epoch": 0.8518620689655172, "grad_norm": 0.7528830766677856, "learning_rate": 0.00011496410822749864, "loss": 1.7703, "num_input_tokens_seen": 14006816, "step": 2316, "train_runtime": 2351.2203, "train_tokens_per_second": 5957.254 }, { "epoch": 0.8522298850574712, "grad_norm": 0.8125345706939697, "learning_rate": 0.00011492729615313825, "loss": 1.9351, "num_input_tokens_seen": 14012544, "step": 2317, "train_runtime": 2352.1874, "train_tokens_per_second": 5957.24 }, { "epoch": 0.8525977011494252, "grad_norm": 0.7331763505935669, "learning_rate": 0.00011489048407877786, "loss": 1.6909, "num_input_tokens_seen": 14018704, "step": 2318, "train_runtime": 2353.1836, "train_tokens_per_second": 5957.335 }, { "epoch": 0.8529655172413793, "grad_norm": 0.8239543437957764, "learning_rate": 0.00011485367200441745, "loss": 1.8601, "num_input_tokens_seen": 14023776, "step": 2319, "train_runtime": 2354.0342, "train_tokens_per_second": 5957.337 }, { "epoch": 0.8533333333333334, "grad_norm": 0.8026068210601807, "learning_rate": 0.00011481685993005706, "loss": 2.0051, "num_input_tokens_seen": 14028384, "step": 2320, "train_runtime": 2354.8242, "train_tokens_per_second": 5957.296 }, { "epoch": 0.8537011494252874, "grad_norm": 0.735466718673706, "learning_rate": 0.00011478004785569667, "loss": 1.9317, "num_input_tokens_seen": 14032704, "step": 2321, "train_runtime": 2355.5656, "train_tokens_per_second": 5957.255 }, { "epoch": 0.8540689655172414, "grad_norm": 0.7632676362991333, "learning_rate": 0.00011474323578133628, "loss": 1.8079, "num_input_tokens_seen": 14037520, "step": 2322, "train_runtime": 2356.3887, "train_tokens_per_second": 5957.218 }, { "epoch": 0.8544367816091955, "grad_norm": 0.772436797618866, "learning_rate": 0.00011470642370697589, "loss": 1.6746, "num_input_tokens_seen": 14044416, "step": 2323, "train_runtime": 2357.4883, "train_tokens_per_second": 5957.364 }, { "epoch": 0.8548045977011495, "grad_norm": 0.7564178109169006, "learning_rate": 0.0001146696116326155, "loss": 1.7481, "num_input_tokens_seen": 14050976, "step": 2324, "train_runtime": 2358.5274, "train_tokens_per_second": 5957.521 }, { "epoch": 0.8551724137931035, "grad_norm": 0.7316631078720093, "learning_rate": 0.00011463279955825512, "loss": 1.7135, "num_input_tokens_seen": 14056912, "step": 2325, "train_runtime": 2359.5043, "train_tokens_per_second": 5957.57 }, { "epoch": 0.8555402298850575, "grad_norm": 0.7063326835632324, "learning_rate": 0.00011459598748389473, "loss": 1.6468, "num_input_tokens_seen": 14063232, "step": 2326, "train_runtime": 2360.5351, "train_tokens_per_second": 5957.646 }, { "epoch": 0.8559080459770115, "grad_norm": 0.798062264919281, "learning_rate": 0.00011455917540953434, "loss": 1.6813, "num_input_tokens_seen": 14069808, "step": 2327, "train_runtime": 2361.584, "train_tokens_per_second": 5957.784 }, { "epoch": 0.8562758620689656, "grad_norm": 0.7643727660179138, "learning_rate": 0.00011452236333517394, "loss": 1.8075, "num_input_tokens_seen": 14076032, "step": 2328, "train_runtime": 2362.6133, "train_tokens_per_second": 5957.823 }, { "epoch": 0.8566436781609196, "grad_norm": 0.8581653833389282, "learning_rate": 0.00011448555126081355, "loss": 2.06, "num_input_tokens_seen": 14081008, "step": 2329, "train_runtime": 2363.462, "train_tokens_per_second": 5957.789 }, { "epoch": 0.8570114942528736, "grad_norm": 0.740445077419281, "learning_rate": 0.00011444873918645316, "loss": 1.5826, "num_input_tokens_seen": 14086496, "step": 2330, "train_runtime": 2364.3891, "train_tokens_per_second": 5957.774 }, { "epoch": 0.8573793103448276, "grad_norm": 0.9068762063980103, "learning_rate": 0.00011441192711209277, "loss": 1.8779, "num_input_tokens_seen": 14095328, "step": 2331, "train_runtime": 2365.7936, "train_tokens_per_second": 5957.97 }, { "epoch": 0.8577471264367816, "grad_norm": 0.7269871830940247, "learning_rate": 0.00011437511503773237, "loss": 1.7484, "num_input_tokens_seen": 14100272, "step": 2332, "train_runtime": 2366.6589, "train_tokens_per_second": 5957.881 }, { "epoch": 0.8581149425287357, "grad_norm": 0.8406885862350464, "learning_rate": 0.000114338302963372, "loss": 1.7737, "num_input_tokens_seen": 14104624, "step": 2333, "train_runtime": 2367.4101, "train_tokens_per_second": 5957.829 }, { "epoch": 0.8584827586206897, "grad_norm": 0.7570016384124756, "learning_rate": 0.00011430149088901161, "loss": 1.8276, "num_input_tokens_seen": 14109840, "step": 2334, "train_runtime": 2368.3, "train_tokens_per_second": 5957.792 }, { "epoch": 0.8588505747126437, "grad_norm": 0.7218365669250488, "learning_rate": 0.00011426467881465122, "loss": 1.6123, "num_input_tokens_seen": 14114784, "step": 2335, "train_runtime": 2369.1446, "train_tokens_per_second": 5957.755 }, { "epoch": 0.8592183908045977, "grad_norm": 0.7858163714408875, "learning_rate": 0.00011422786674029083, "loss": 1.8551, "num_input_tokens_seen": 14119504, "step": 2336, "train_runtime": 2369.9484, "train_tokens_per_second": 5957.726 }, { "epoch": 0.8595862068965517, "grad_norm": 0.7593346238136292, "learning_rate": 0.00011419105466593042, "loss": 1.824, "num_input_tokens_seen": 14124144, "step": 2337, "train_runtime": 2370.744, "train_tokens_per_second": 5957.684 }, { "epoch": 0.8599540229885058, "grad_norm": 0.7639790177345276, "learning_rate": 0.00011415424259157003, "loss": 1.7448, "num_input_tokens_seen": 14134080, "step": 2338, "train_runtime": 2372.2227, "train_tokens_per_second": 5958.159 }, { "epoch": 0.8603218390804598, "grad_norm": 0.8189948797225952, "learning_rate": 0.00011411743051720964, "loss": 1.6927, "num_input_tokens_seen": 14138688, "step": 2339, "train_runtime": 2373.0139, "train_tokens_per_second": 5958.114 }, { "epoch": 0.8606896551724138, "grad_norm": 0.7642329335212708, "learning_rate": 0.00011408061844284925, "loss": 1.6876, "num_input_tokens_seen": 14143600, "step": 2340, "train_runtime": 2373.8589, "train_tokens_per_second": 5958.063 }, { "epoch": 0.8610574712643678, "grad_norm": 0.7678464651107788, "learning_rate": 0.00011404380636848886, "loss": 1.6466, "num_input_tokens_seen": 14151440, "step": 2341, "train_runtime": 2375.6137, "train_tokens_per_second": 5956.962 }, { "epoch": 0.8614252873563218, "grad_norm": 0.7687625885009766, "learning_rate": 0.00011400699429412848, "loss": 1.6773, "num_input_tokens_seen": 14157200, "step": 2342, "train_runtime": 2376.5428, "train_tokens_per_second": 5957.057 }, { "epoch": 0.8617931034482759, "grad_norm": 0.761159360408783, "learning_rate": 0.00011397018221976809, "loss": 1.8342, "num_input_tokens_seen": 14164432, "step": 2343, "train_runtime": 2377.7258, "train_tokens_per_second": 5957.134 }, { "epoch": 0.8621609195402299, "grad_norm": 0.791181743144989, "learning_rate": 0.0001139333701454077, "loss": 1.6291, "num_input_tokens_seen": 14172144, "step": 2344, "train_runtime": 2378.9399, "train_tokens_per_second": 5957.336 }, { "epoch": 0.8625287356321839, "grad_norm": 0.8065009117126465, "learning_rate": 0.00011389655807104731, "loss": 1.7938, "num_input_tokens_seen": 14177360, "step": 2345, "train_runtime": 2379.8049, "train_tokens_per_second": 5957.362 }, { "epoch": 0.8628965517241379, "grad_norm": 0.7265875935554504, "learning_rate": 0.00011385974599668692, "loss": 1.5831, "num_input_tokens_seen": 14184240, "step": 2346, "train_runtime": 2380.9087, "train_tokens_per_second": 5957.49 }, { "epoch": 0.863264367816092, "grad_norm": 0.738709032535553, "learning_rate": 0.00011382293392232653, "loss": 1.7015, "num_input_tokens_seen": 14191344, "step": 2347, "train_runtime": 2382.0348, "train_tokens_per_second": 5957.656 }, { "epoch": 0.863632183908046, "grad_norm": 0.8164908289909363, "learning_rate": 0.00011378612184796614, "loss": 1.8793, "num_input_tokens_seen": 14196016, "step": 2348, "train_runtime": 2382.8404, "train_tokens_per_second": 5957.603 }, { "epoch": 0.864, "grad_norm": 0.7305906414985657, "learning_rate": 0.00011374930977360574, "loss": 1.7451, "num_input_tokens_seen": 14203136, "step": 2349, "train_runtime": 2383.9815, "train_tokens_per_second": 5957.737 }, { "epoch": 0.864367816091954, "grad_norm": 0.7419806718826294, "learning_rate": 0.00011371249769924537, "loss": 1.7986, "num_input_tokens_seen": 14210000, "step": 2350, "train_runtime": 2385.0887, "train_tokens_per_second": 5957.85 }, { "epoch": 0.864735632183908, "grad_norm": 0.76914381980896, "learning_rate": 0.00011367568562488498, "loss": 1.497, "num_input_tokens_seen": 14215392, "step": 2351, "train_runtime": 2385.9682, "train_tokens_per_second": 5957.914 }, { "epoch": 0.865103448275862, "grad_norm": 0.8450071215629578, "learning_rate": 0.00011363887355052458, "loss": 1.7459, "num_input_tokens_seen": 14220784, "step": 2352, "train_runtime": 2386.8719, "train_tokens_per_second": 5957.917 }, { "epoch": 0.8654712643678161, "grad_norm": 0.8300321698188782, "learning_rate": 0.0001136020614761642, "loss": 1.8838, "num_input_tokens_seen": 14226304, "step": 2353, "train_runtime": 2387.7914, "train_tokens_per_second": 5957.934 }, { "epoch": 0.8658390804597701, "grad_norm": 0.8601062297821045, "learning_rate": 0.0001135652494018038, "loss": 1.6558, "num_input_tokens_seen": 14230544, "step": 2354, "train_runtime": 2388.568, "train_tokens_per_second": 5957.772 }, { "epoch": 0.8662068965517241, "grad_norm": 0.7347440719604492, "learning_rate": 0.0001135284373274434, "loss": 1.624, "num_input_tokens_seen": 14236096, "step": 2355, "train_runtime": 2389.4757, "train_tokens_per_second": 5957.833 }, { "epoch": 0.8665747126436781, "grad_norm": 0.7797635793685913, "learning_rate": 0.00011349162525308301, "loss": 1.6137, "num_input_tokens_seen": 14242896, "step": 2356, "train_runtime": 2390.5773, "train_tokens_per_second": 5957.932 }, { "epoch": 0.8669425287356322, "grad_norm": 0.7344309687614441, "learning_rate": 0.00011345481317872262, "loss": 1.5892, "num_input_tokens_seen": 14248368, "step": 2357, "train_runtime": 2391.5026, "train_tokens_per_second": 5957.915 }, { "epoch": 0.8673103448275862, "grad_norm": 0.805598795413971, "learning_rate": 0.00011341800110436222, "loss": 1.7587, "num_input_tokens_seen": 14254880, "step": 2358, "train_runtime": 2392.5636, "train_tokens_per_second": 5957.994 }, { "epoch": 0.8676781609195402, "grad_norm": 0.7437198162078857, "learning_rate": 0.00011338118903000186, "loss": 1.6393, "num_input_tokens_seen": 14261696, "step": 2359, "train_runtime": 2393.6655, "train_tokens_per_second": 5958.099 }, { "epoch": 0.8680459770114942, "grad_norm": 0.7576062679290771, "learning_rate": 0.00011334437695564146, "loss": 1.8311, "num_input_tokens_seen": 14267184, "step": 2360, "train_runtime": 2394.5848, "train_tokens_per_second": 5958.103 }, { "epoch": 0.8684137931034482, "grad_norm": 0.7373422980308533, "learning_rate": 0.00011330756488128106, "loss": 1.5635, "num_input_tokens_seen": 14274368, "step": 2361, "train_runtime": 2395.7469, "train_tokens_per_second": 5958.212 }, { "epoch": 0.8687816091954023, "grad_norm": 0.7066559195518494, "learning_rate": 0.00011327075280692067, "loss": 1.5493, "num_input_tokens_seen": 14280560, "step": 2362, "train_runtime": 2396.765, "train_tokens_per_second": 5958.265 }, { "epoch": 0.8691494252873563, "grad_norm": 0.7652391791343689, "learning_rate": 0.00011323394073256028, "loss": 1.6412, "num_input_tokens_seen": 14287344, "step": 2363, "train_runtime": 2397.8573, "train_tokens_per_second": 5958.38 }, { "epoch": 0.8695172413793103, "grad_norm": 0.741844892501831, "learning_rate": 0.00011319712865819989, "loss": 1.8602, "num_input_tokens_seen": 14291920, "step": 2364, "train_runtime": 2398.6533, "train_tokens_per_second": 5958.31 }, { "epoch": 0.8698850574712643, "grad_norm": 0.7472719550132751, "learning_rate": 0.0001131603165838395, "loss": 1.6237, "num_input_tokens_seen": 14296320, "step": 2365, "train_runtime": 2399.4563, "train_tokens_per_second": 5958.15 }, { "epoch": 0.8702528735632183, "grad_norm": 0.7941020727157593, "learning_rate": 0.00011312350450947911, "loss": 1.5408, "num_input_tokens_seen": 14301664, "step": 2366, "train_runtime": 2400.3329, "train_tokens_per_second": 5958.2 }, { "epoch": 0.8706206896551724, "grad_norm": 0.7930315732955933, "learning_rate": 0.00011308669243511873, "loss": 1.7939, "num_input_tokens_seen": 14308320, "step": 2367, "train_runtime": 2401.3987, "train_tokens_per_second": 5958.328 }, { "epoch": 0.8709885057471264, "grad_norm": 0.7866606116294861, "learning_rate": 0.00011304988036075834, "loss": 1.7819, "num_input_tokens_seen": 14313616, "step": 2368, "train_runtime": 2402.2818, "train_tokens_per_second": 5958.342 }, { "epoch": 0.8713563218390804, "grad_norm": 0.7377987504005432, "learning_rate": 0.00011301306828639795, "loss": 1.9263, "num_input_tokens_seen": 14318256, "step": 2369, "train_runtime": 2403.1044, "train_tokens_per_second": 5958.233 }, { "epoch": 0.8717241379310345, "grad_norm": 0.8972067832946777, "learning_rate": 0.00011297625621203756, "loss": 1.8571, "num_input_tokens_seen": 14324752, "step": 2370, "train_runtime": 2404.1569, "train_tokens_per_second": 5958.327 }, { "epoch": 0.8720919540229886, "grad_norm": 0.8178853392601013, "learning_rate": 0.00011293944413767717, "loss": 1.8199, "num_input_tokens_seen": 14330608, "step": 2371, "train_runtime": 2405.6503, "train_tokens_per_second": 5957.062 }, { "epoch": 0.8724597701149426, "grad_norm": 0.7937817573547363, "learning_rate": 0.00011290263206331678, "loss": 1.7461, "num_input_tokens_seen": 14334576, "step": 2372, "train_runtime": 2406.3428, "train_tokens_per_second": 5956.997 }, { "epoch": 0.8728275862068966, "grad_norm": 0.8121699094772339, "learning_rate": 0.00011286581998895637, "loss": 1.8924, "num_input_tokens_seen": 14340080, "step": 2373, "train_runtime": 2407.2598, "train_tokens_per_second": 5957.014 }, { "epoch": 0.8731954022988506, "grad_norm": 0.7203399538993835, "learning_rate": 0.00011282900791459598, "loss": 1.8309, "num_input_tokens_seen": 14345952, "step": 2374, "train_runtime": 2408.2133, "train_tokens_per_second": 5957.094 }, { "epoch": 0.8735632183908046, "grad_norm": 0.7035325169563293, "learning_rate": 0.00011279219584023559, "loss": 1.8768, "num_input_tokens_seen": 14351712, "step": 2375, "train_runtime": 2409.1489, "train_tokens_per_second": 5957.171 }, { "epoch": 0.8739310344827587, "grad_norm": 0.7170698046684265, "learning_rate": 0.00011275538376587523, "loss": 1.7413, "num_input_tokens_seen": 14356368, "step": 2376, "train_runtime": 2409.9492, "train_tokens_per_second": 5957.125 }, { "epoch": 0.8742988505747127, "grad_norm": 0.7655664682388306, "learning_rate": 0.00011271857169151483, "loss": 1.7041, "num_input_tokens_seen": 14364928, "step": 2377, "train_runtime": 2411.2495, "train_tokens_per_second": 5957.462 }, { "epoch": 0.8746666666666667, "grad_norm": 0.8381845951080322, "learning_rate": 0.00011268175961715444, "loss": 1.8072, "num_input_tokens_seen": 14369744, "step": 2378, "train_runtime": 2412.0879, "train_tokens_per_second": 5957.388 }, { "epoch": 0.8750344827586207, "grad_norm": 0.8350390791893005, "learning_rate": 0.00011264494754279404, "loss": 1.7421, "num_input_tokens_seen": 14374976, "step": 2379, "train_runtime": 2412.9783, "train_tokens_per_second": 5957.358 }, { "epoch": 0.8754022988505747, "grad_norm": 0.8463245034217834, "learning_rate": 0.00011260813546843365, "loss": 1.8437, "num_input_tokens_seen": 14379344, "step": 2380, "train_runtime": 2413.7322, "train_tokens_per_second": 5957.307 }, { "epoch": 0.8757701149425288, "grad_norm": 0.755520761013031, "learning_rate": 0.00011257132339407326, "loss": 1.7141, "num_input_tokens_seen": 14385568, "step": 2381, "train_runtime": 2414.7521, "train_tokens_per_second": 5957.368 }, { "epoch": 0.8761379310344828, "grad_norm": 0.7731467485427856, "learning_rate": 0.00011253451131971287, "loss": 1.8212, "num_input_tokens_seen": 14391168, "step": 2382, "train_runtime": 2415.6833, "train_tokens_per_second": 5957.39 }, { "epoch": 0.8765057471264368, "grad_norm": 0.7874716520309448, "learning_rate": 0.00011249769924535247, "loss": 1.7065, "num_input_tokens_seen": 14397504, "step": 2383, "train_runtime": 2416.7038, "train_tokens_per_second": 5957.496 }, { "epoch": 0.8768735632183908, "grad_norm": 0.8985732793807983, "learning_rate": 0.00011246088717099208, "loss": 1.5969, "num_input_tokens_seen": 14404064, "step": 2384, "train_runtime": 2417.7451, "train_tokens_per_second": 5957.644 }, { "epoch": 0.8772413793103448, "grad_norm": 0.7792977094650269, "learning_rate": 0.0001124240750966317, "loss": 1.733, "num_input_tokens_seen": 14409936, "step": 2385, "train_runtime": 2418.6848, "train_tokens_per_second": 5957.757 }, { "epoch": 0.8776091954022989, "grad_norm": 0.7667710185050964, "learning_rate": 0.00011238726302227131, "loss": 1.5803, "num_input_tokens_seen": 14414976, "step": 2386, "train_runtime": 2419.5314, "train_tokens_per_second": 5957.755 }, { "epoch": 0.8779770114942529, "grad_norm": 0.8061090707778931, "learning_rate": 0.00011235045094791092, "loss": 1.667, "num_input_tokens_seen": 14420544, "step": 2387, "train_runtime": 2420.4724, "train_tokens_per_second": 5957.74 }, { "epoch": 0.8783448275862069, "grad_norm": 0.7755416035652161, "learning_rate": 0.00011231363887355053, "loss": 1.5153, "num_input_tokens_seen": 14429792, "step": 2388, "train_runtime": 2421.8919, "train_tokens_per_second": 5958.066 }, { "epoch": 0.8787126436781609, "grad_norm": 0.9299578666687012, "learning_rate": 0.00011227682679919014, "loss": 1.8097, "num_input_tokens_seen": 14435952, "step": 2389, "train_runtime": 2422.8789, "train_tokens_per_second": 5958.181 }, { "epoch": 0.879080459770115, "grad_norm": 0.768943727016449, "learning_rate": 0.00011224001472482975, "loss": 1.6817, "num_input_tokens_seen": 14442832, "step": 2390, "train_runtime": 2424.0186, "train_tokens_per_second": 5958.218 }, { "epoch": 0.879448275862069, "grad_norm": 0.7778789401054382, "learning_rate": 0.00011220320265046936, "loss": 1.6514, "num_input_tokens_seen": 14448576, "step": 2391, "train_runtime": 2424.9572, "train_tokens_per_second": 5958.281 }, { "epoch": 0.879816091954023, "grad_norm": 0.7198776602745056, "learning_rate": 0.00011216639057610895, "loss": 1.731, "num_input_tokens_seen": 14455328, "step": 2392, "train_runtime": 2426.0519, "train_tokens_per_second": 5958.376 }, { "epoch": 0.880183908045977, "grad_norm": 0.7714976668357849, "learning_rate": 0.00011212957850174859, "loss": 1.6643, "num_input_tokens_seen": 14459680, "step": 2393, "train_runtime": 2426.8156, "train_tokens_per_second": 5958.294 }, { "epoch": 0.880551724137931, "grad_norm": 0.7934778332710266, "learning_rate": 0.0001120927664273882, "loss": 1.6422, "num_input_tokens_seen": 14465808, "step": 2394, "train_runtime": 2427.8454, "train_tokens_per_second": 5958.29 }, { "epoch": 0.8809195402298851, "grad_norm": 0.8033345341682434, "learning_rate": 0.00011205595435302781, "loss": 1.8191, "num_input_tokens_seen": 14470528, "step": 2395, "train_runtime": 2428.6475, "train_tokens_per_second": 5958.266 }, { "epoch": 0.8812873563218391, "grad_norm": 0.7819011211395264, "learning_rate": 0.00011201914227866742, "loss": 1.7823, "num_input_tokens_seen": 14475744, "step": 2396, "train_runtime": 2429.5037, "train_tokens_per_second": 5958.313 }, { "epoch": 0.8816551724137931, "grad_norm": 0.785110354423523, "learning_rate": 0.00011198233020430701, "loss": 1.6939, "num_input_tokens_seen": 14480800, "step": 2397, "train_runtime": 2430.3699, "train_tokens_per_second": 5958.27 }, { "epoch": 0.8820229885057471, "grad_norm": 0.7414306998252869, "learning_rate": 0.00011194551812994662, "loss": 1.4956, "num_input_tokens_seen": 14486560, "step": 2398, "train_runtime": 2431.3157, "train_tokens_per_second": 5958.321 }, { "epoch": 0.8823908045977011, "grad_norm": 0.7555763721466064, "learning_rate": 0.00011190870605558623, "loss": 1.6408, "num_input_tokens_seen": 14492176, "step": 2399, "train_runtime": 2432.2672, "train_tokens_per_second": 5958.299 }, { "epoch": 0.8827586206896552, "grad_norm": 0.7565219402313232, "learning_rate": 0.00011187189398122584, "loss": 1.7606, "num_input_tokens_seen": 14497536, "step": 2400, "train_runtime": 2433.1439, "train_tokens_per_second": 5958.355 }, { "epoch": 0.8831264367816092, "grad_norm": 0.6823695302009583, "learning_rate": 0.00011183508190686545, "loss": 1.655, "num_input_tokens_seen": 14505824, "step": 2401, "train_runtime": 2434.8916, "train_tokens_per_second": 5957.483 }, { "epoch": 0.8834942528735632, "grad_norm": 0.7468881607055664, "learning_rate": 0.00011179826983250507, "loss": 1.6549, "num_input_tokens_seen": 14511232, "step": 2402, "train_runtime": 2435.7954, "train_tokens_per_second": 5957.492 }, { "epoch": 0.8838620689655172, "grad_norm": 0.7681131958961487, "learning_rate": 0.00011176145775814468, "loss": 1.9565, "num_input_tokens_seen": 14516672, "step": 2403, "train_runtime": 2436.7088, "train_tokens_per_second": 5957.491 }, { "epoch": 0.8842298850574712, "grad_norm": 0.8144717812538147, "learning_rate": 0.00011172464568378429, "loss": 1.832, "num_input_tokens_seen": 14521648, "step": 2404, "train_runtime": 2437.5255, "train_tokens_per_second": 5957.537 }, { "epoch": 0.8845977011494253, "grad_norm": 0.7495010495185852, "learning_rate": 0.0001116878336094239, "loss": 1.7243, "num_input_tokens_seen": 14527664, "step": 2405, "train_runtime": 2438.5025, "train_tokens_per_second": 5957.617 }, { "epoch": 0.8849655172413793, "grad_norm": 0.8013268709182739, "learning_rate": 0.0001116510215350635, "loss": 1.8182, "num_input_tokens_seen": 14532464, "step": 2406, "train_runtime": 2439.3202, "train_tokens_per_second": 5957.588 }, { "epoch": 0.8853333333333333, "grad_norm": 0.7739303708076477, "learning_rate": 0.00011161420946070311, "loss": 1.7566, "num_input_tokens_seen": 14537136, "step": 2407, "train_runtime": 2440.1492, "train_tokens_per_second": 5957.478 }, { "epoch": 0.8857011494252873, "grad_norm": 0.7692505121231079, "learning_rate": 0.00011157739738634272, "loss": 1.7699, "num_input_tokens_seen": 14541520, "step": 2408, "train_runtime": 2440.9293, "train_tokens_per_second": 5957.37 }, { "epoch": 0.8860689655172413, "grad_norm": 0.7460946440696716, "learning_rate": 0.00011154058531198233, "loss": 1.7378, "num_input_tokens_seen": 14547936, "step": 2409, "train_runtime": 2441.9672, "train_tokens_per_second": 5957.466 }, { "epoch": 0.8864367816091954, "grad_norm": 0.7677419185638428, "learning_rate": 0.00011150377323762195, "loss": 1.7723, "num_input_tokens_seen": 14552560, "step": 2410, "train_runtime": 2442.7658, "train_tokens_per_second": 5957.411 }, { "epoch": 0.8868045977011494, "grad_norm": 0.7308533191680908, "learning_rate": 0.00011146696116326156, "loss": 1.7541, "num_input_tokens_seen": 14557648, "step": 2411, "train_runtime": 2443.6304, "train_tokens_per_second": 5957.385 }, { "epoch": 0.8871724137931034, "grad_norm": 0.7472432851791382, "learning_rate": 0.00011143014908890117, "loss": 1.6611, "num_input_tokens_seen": 14563088, "step": 2412, "train_runtime": 2444.5443, "train_tokens_per_second": 5957.383 }, { "epoch": 0.8875402298850574, "grad_norm": 0.688766598701477, "learning_rate": 0.00011139333701454078, "loss": 1.4676, "num_input_tokens_seen": 14570096, "step": 2413, "train_runtime": 2445.6706, "train_tokens_per_second": 5957.505 }, { "epoch": 0.8879080459770115, "grad_norm": 0.7346517443656921, "learning_rate": 0.00011135652494018039, "loss": 1.4383, "num_input_tokens_seen": 14577840, "step": 2414, "train_runtime": 2446.9046, "train_tokens_per_second": 5957.666 }, { "epoch": 0.8882758620689655, "grad_norm": 0.7357007265090942, "learning_rate": 0.00011131971286581999, "loss": 1.7221, "num_input_tokens_seen": 14586896, "step": 2415, "train_runtime": 2448.3271, "train_tokens_per_second": 5957.903 }, { "epoch": 0.8886436781609195, "grad_norm": 0.702000617980957, "learning_rate": 0.0001112829007914596, "loss": 1.5098, "num_input_tokens_seen": 14591728, "step": 2416, "train_runtime": 2449.156, "train_tokens_per_second": 5957.86 }, { "epoch": 0.8890114942528735, "grad_norm": 0.8758004307746887, "learning_rate": 0.0001112460887170992, "loss": 1.7841, "num_input_tokens_seen": 14596640, "step": 2417, "train_runtime": 2449.9939, "train_tokens_per_second": 5957.827 }, { "epoch": 0.8893793103448275, "grad_norm": 0.7414559125900269, "learning_rate": 0.00011120927664273881, "loss": 1.6884, "num_input_tokens_seen": 14604672, "step": 2418, "train_runtime": 2451.2371, "train_tokens_per_second": 5958.082 }, { "epoch": 0.8897471264367816, "grad_norm": 0.7551974058151245, "learning_rate": 0.00011117246456837845, "loss": 1.7889, "num_input_tokens_seen": 14612896, "step": 2419, "train_runtime": 2452.5476, "train_tokens_per_second": 5958.252 }, { "epoch": 0.8901149425287357, "grad_norm": 0.6946575045585632, "learning_rate": 0.00011113565249401804, "loss": 1.7502, "num_input_tokens_seen": 14618800, "step": 2420, "train_runtime": 2453.5058, "train_tokens_per_second": 5958.331 }, { "epoch": 0.8904827586206897, "grad_norm": 0.7958633303642273, "learning_rate": 0.00011109884041965765, "loss": 1.5836, "num_input_tokens_seen": 14624800, "step": 2421, "train_runtime": 2454.4833, "train_tokens_per_second": 5958.403 }, { "epoch": 0.8908505747126437, "grad_norm": 0.8049613833427429, "learning_rate": 0.00011106202834529726, "loss": 1.5905, "num_input_tokens_seen": 14630272, "step": 2422, "train_runtime": 2455.3924, "train_tokens_per_second": 5958.425 }, { "epoch": 0.8912183908045977, "grad_norm": 0.6941192746162415, "learning_rate": 0.00011102521627093687, "loss": 1.6647, "num_input_tokens_seen": 14637008, "step": 2423, "train_runtime": 2456.4795, "train_tokens_per_second": 5958.53 }, { "epoch": 0.8915862068965518, "grad_norm": 0.823941171169281, "learning_rate": 0.00011098840419657648, "loss": 1.7061, "num_input_tokens_seen": 14641776, "step": 2424, "train_runtime": 2457.301, "train_tokens_per_second": 5958.479 }, { "epoch": 0.8919540229885058, "grad_norm": 0.7627526521682739, "learning_rate": 0.00011095159212221609, "loss": 1.7886, "num_input_tokens_seen": 14648064, "step": 2425, "train_runtime": 2458.3115, "train_tokens_per_second": 5958.587 }, { "epoch": 0.8923218390804598, "grad_norm": 0.7629676461219788, "learning_rate": 0.0001109147800478557, "loss": 1.6886, "num_input_tokens_seen": 14654272, "step": 2426, "train_runtime": 2459.3132, "train_tokens_per_second": 5958.685 }, { "epoch": 0.8926896551724138, "grad_norm": 0.7743751406669617, "learning_rate": 0.00011087796797349532, "loss": 1.8038, "num_input_tokens_seen": 14659632, "step": 2427, "train_runtime": 2460.2118, "train_tokens_per_second": 5958.687 }, { "epoch": 0.8930574712643679, "grad_norm": 0.7945587038993835, "learning_rate": 0.00011084115589913493, "loss": 1.831, "num_input_tokens_seen": 14664736, "step": 2428, "train_runtime": 2461.0645, "train_tokens_per_second": 5958.696 }, { "epoch": 0.8934252873563219, "grad_norm": 0.678333580493927, "learning_rate": 0.00011080434382477454, "loss": 1.6323, "num_input_tokens_seen": 14671424, "step": 2429, "train_runtime": 2462.1298, "train_tokens_per_second": 5958.834 }, { "epoch": 0.8937931034482759, "grad_norm": 0.7958647608757019, "learning_rate": 0.00011076753175041415, "loss": 1.876, "num_input_tokens_seen": 14676416, "step": 2430, "train_runtime": 2462.9747, "train_tokens_per_second": 5958.817 }, { "epoch": 0.8941609195402299, "grad_norm": 0.7031279802322388, "learning_rate": 0.00011073071967605376, "loss": 1.6035, "num_input_tokens_seen": 14681200, "step": 2431, "train_runtime": 2464.2554, "train_tokens_per_second": 5957.662 }, { "epoch": 0.8945287356321839, "grad_norm": 0.7445070147514343, "learning_rate": 0.00011069390760169336, "loss": 1.63, "num_input_tokens_seen": 14685520, "step": 2432, "train_runtime": 2465.0009, "train_tokens_per_second": 5957.612 }, { "epoch": 0.894896551724138, "grad_norm": 0.7040464878082275, "learning_rate": 0.00011065709552733296, "loss": 1.747, "num_input_tokens_seen": 14693952, "step": 2433, "train_runtime": 2466.2999, "train_tokens_per_second": 5957.893 }, { "epoch": 0.895264367816092, "grad_norm": 0.7695351839065552, "learning_rate": 0.00011062028345297257, "loss": 1.7753, "num_input_tokens_seen": 14699936, "step": 2434, "train_runtime": 2467.2791, "train_tokens_per_second": 5957.954 }, { "epoch": 0.895632183908046, "grad_norm": 0.7717336416244507, "learning_rate": 0.00011058347137861218, "loss": 1.709, "num_input_tokens_seen": 14704640, "step": 2435, "train_runtime": 2468.0725, "train_tokens_per_second": 5957.945 }, { "epoch": 0.896, "grad_norm": 0.7537624835968018, "learning_rate": 0.00011054665930425181, "loss": 1.9182, "num_input_tokens_seen": 14710256, "step": 2436, "train_runtime": 2469.0109, "train_tokens_per_second": 5957.955 }, { "epoch": 0.896367816091954, "grad_norm": 0.7601698637008667, "learning_rate": 0.00011050984722989142, "loss": 1.6092, "num_input_tokens_seen": 14714800, "step": 2437, "train_runtime": 2469.8044, "train_tokens_per_second": 5957.881 }, { "epoch": 0.8967356321839081, "grad_norm": 0.8169834017753601, "learning_rate": 0.00011047303515553102, "loss": 1.6737, "num_input_tokens_seen": 14722096, "step": 2438, "train_runtime": 2470.9489, "train_tokens_per_second": 5958.074 }, { "epoch": 0.8971034482758621, "grad_norm": 0.7955383658409119, "learning_rate": 0.00011043622308117063, "loss": 1.8738, "num_input_tokens_seen": 14726544, "step": 2439, "train_runtime": 2471.7285, "train_tokens_per_second": 5957.994 }, { "epoch": 0.8974712643678161, "grad_norm": 0.8970584273338318, "learning_rate": 0.00011039941100681024, "loss": 1.8116, "num_input_tokens_seen": 14731648, "step": 2440, "train_runtime": 2472.5688, "train_tokens_per_second": 5958.034 }, { "epoch": 0.8978390804597701, "grad_norm": 0.7360374927520752, "learning_rate": 0.00011036259893244984, "loss": 1.6655, "num_input_tokens_seen": 14737824, "step": 2441, "train_runtime": 2473.5693, "train_tokens_per_second": 5958.12 }, { "epoch": 0.8982068965517241, "grad_norm": 0.7386136651039124, "learning_rate": 0.00011032578685808945, "loss": 1.6351, "num_input_tokens_seen": 14742608, "step": 2442, "train_runtime": 2474.3955, "train_tokens_per_second": 5958.064 }, { "epoch": 0.8985747126436782, "grad_norm": 0.8073346614837646, "learning_rate": 0.00011028897478372906, "loss": 1.7017, "num_input_tokens_seen": 14747232, "step": 2443, "train_runtime": 2475.2134, "train_tokens_per_second": 5957.964 }, { "epoch": 0.8989425287356322, "grad_norm": 0.8261056542396545, "learning_rate": 0.00011025216270936868, "loss": 1.6188, "num_input_tokens_seen": 14752192, "step": 2444, "train_runtime": 2476.0653, "train_tokens_per_second": 5957.917 }, { "epoch": 0.8993103448275862, "grad_norm": 0.7028419971466064, "learning_rate": 0.0001102153506350083, "loss": 1.7697, "num_input_tokens_seen": 14763296, "step": 2445, "train_runtime": 2477.7281, "train_tokens_per_second": 5958.4 }, { "epoch": 0.8996781609195402, "grad_norm": 0.744083821773529, "learning_rate": 0.0001101785385606479, "loss": 1.7576, "num_input_tokens_seen": 14768912, "step": 2446, "train_runtime": 2478.6675, "train_tokens_per_second": 5958.408 }, { "epoch": 0.9000459770114942, "grad_norm": 0.7346624135971069, "learning_rate": 0.00011014172648628751, "loss": 1.5865, "num_input_tokens_seen": 14774976, "step": 2447, "train_runtime": 2479.6505, "train_tokens_per_second": 5958.491 }, { "epoch": 0.9004137931034483, "grad_norm": 0.7858444452285767, "learning_rate": 0.00011010491441192712, "loss": 1.5247, "num_input_tokens_seen": 14779616, "step": 2448, "train_runtime": 2480.4486, "train_tokens_per_second": 5958.445 }, { "epoch": 0.9007816091954023, "grad_norm": 0.7909073829650879, "learning_rate": 0.00011006810233756673, "loss": 1.7006, "num_input_tokens_seen": 14787680, "step": 2449, "train_runtime": 2481.7272, "train_tokens_per_second": 5958.624 }, { "epoch": 0.9011494252873563, "grad_norm": 0.7249764204025269, "learning_rate": 0.00011003129026320634, "loss": 1.6205, "num_input_tokens_seen": 14793808, "step": 2450, "train_runtime": 2482.7139, "train_tokens_per_second": 5958.724 }, { "epoch": 0.9015172413793103, "grad_norm": 0.7955921292304993, "learning_rate": 0.00010999447818884593, "loss": 1.6391, "num_input_tokens_seen": 14798368, "step": 2451, "train_runtime": 2483.5259, "train_tokens_per_second": 5958.612 }, { "epoch": 0.9018850574712644, "grad_norm": 0.7814099788665771, "learning_rate": 0.00010995766611448554, "loss": 1.7179, "num_input_tokens_seen": 14802720, "step": 2452, "train_runtime": 2484.2533, "train_tokens_per_second": 5958.619 }, { "epoch": 0.9022528735632184, "grad_norm": 0.7550371885299683, "learning_rate": 0.00010992085404012518, "loss": 1.6625, "num_input_tokens_seen": 14807104, "step": 2453, "train_runtime": 2485.0039, "train_tokens_per_second": 5958.584 }, { "epoch": 0.9026206896551724, "grad_norm": 0.8185312747955322, "learning_rate": 0.00010988404196576479, "loss": 1.8029, "num_input_tokens_seen": 14812960, "step": 2454, "train_runtime": 2485.9603, "train_tokens_per_second": 5958.647 }, { "epoch": 0.9029885057471264, "grad_norm": 0.750242292881012, "learning_rate": 0.0001098472298914044, "loss": 1.6578, "num_input_tokens_seen": 14819360, "step": 2455, "train_runtime": 2487.0032, "train_tokens_per_second": 5958.722 }, { "epoch": 0.9033563218390804, "grad_norm": 0.7446937561035156, "learning_rate": 0.000109810417817044, "loss": 1.6746, "num_input_tokens_seen": 14823744, "step": 2456, "train_runtime": 2487.7559, "train_tokens_per_second": 5958.681 }, { "epoch": 0.9037241379310345, "grad_norm": 0.7383763194084167, "learning_rate": 0.0001097736057426836, "loss": 1.8532, "num_input_tokens_seen": 14829248, "step": 2457, "train_runtime": 2488.6704, "train_tokens_per_second": 5958.703 }, { "epoch": 0.9040919540229885, "grad_norm": 0.7755974531173706, "learning_rate": 0.00010973679366832321, "loss": 1.6205, "num_input_tokens_seen": 14834784, "step": 2458, "train_runtime": 2489.6018, "train_tokens_per_second": 5958.698 }, { "epoch": 0.9044597701149425, "grad_norm": 0.7716488838195801, "learning_rate": 0.00010969998159396282, "loss": 1.7038, "num_input_tokens_seen": 14842784, "step": 2459, "train_runtime": 2490.8543, "train_tokens_per_second": 5958.913 }, { "epoch": 0.9048275862068965, "grad_norm": 0.8037108778953552, "learning_rate": 0.00010966316951960243, "loss": 1.7376, "num_input_tokens_seen": 14849024, "step": 2460, "train_runtime": 2491.8881, "train_tokens_per_second": 5958.945 }, { "epoch": 0.9051954022988505, "grad_norm": 0.8002779483795166, "learning_rate": 0.00010962635744524204, "loss": 1.8092, "num_input_tokens_seen": 14853632, "step": 2461, "train_runtime": 2493.2241, "train_tokens_per_second": 5957.6 }, { "epoch": 0.9055632183908046, "grad_norm": 0.7876670956611633, "learning_rate": 0.00010958954537088166, "loss": 1.6983, "num_input_tokens_seen": 14858096, "step": 2462, "train_runtime": 2494.0086, "train_tokens_per_second": 5957.516 }, { "epoch": 0.9059310344827586, "grad_norm": 0.757910430431366, "learning_rate": 0.00010955273329652127, "loss": 1.8157, "num_input_tokens_seen": 14864064, "step": 2463, "train_runtime": 2494.9675, "train_tokens_per_second": 5957.618 }, { "epoch": 0.9062988505747126, "grad_norm": 0.7434114217758179, "learning_rate": 0.00010951592122216088, "loss": 1.7639, "num_input_tokens_seen": 14869760, "step": 2464, "train_runtime": 2495.8865, "train_tokens_per_second": 5957.707 }, { "epoch": 0.9066666666666666, "grad_norm": 0.8509668111801147, "learning_rate": 0.00010947910914780048, "loss": 1.5399, "num_input_tokens_seen": 14875136, "step": 2465, "train_runtime": 2496.7698, "train_tokens_per_second": 5957.752 }, { "epoch": 0.9070344827586206, "grad_norm": 0.7537459135055542, "learning_rate": 0.0001094422970734401, "loss": 1.6189, "num_input_tokens_seen": 14881568, "step": 2466, "train_runtime": 2497.8164, "train_tokens_per_second": 5957.831 }, { "epoch": 0.9074022988505747, "grad_norm": 0.7488567233085632, "learning_rate": 0.0001094054849990797, "loss": 1.6997, "num_input_tokens_seen": 14886736, "step": 2467, "train_runtime": 2498.6681, "train_tokens_per_second": 5957.869 }, { "epoch": 0.9077701149425287, "grad_norm": 0.7168360352516174, "learning_rate": 0.00010936867292471931, "loss": 1.5637, "num_input_tokens_seen": 14895168, "step": 2468, "train_runtime": 2499.9755, "train_tokens_per_second": 5958.126 }, { "epoch": 0.9081379310344827, "grad_norm": 0.8835721611976624, "learning_rate": 0.00010933186085035892, "loss": 1.5412, "num_input_tokens_seen": 14901216, "step": 2469, "train_runtime": 2500.9301, "train_tokens_per_second": 5958.27 }, { "epoch": 0.9085057471264368, "grad_norm": 0.8334879875183105, "learning_rate": 0.00010929504877599854, "loss": 1.7239, "num_input_tokens_seen": 14907168, "step": 2470, "train_runtime": 2501.8822, "train_tokens_per_second": 5958.381 }, { "epoch": 0.9088735632183909, "grad_norm": 0.7692475914955139, "learning_rate": 0.00010925823670163815, "loss": 1.6819, "num_input_tokens_seen": 14913248, "step": 2471, "train_runtime": 2502.8624, "train_tokens_per_second": 5958.477 }, { "epoch": 0.9092413793103449, "grad_norm": 0.7324846386909485, "learning_rate": 0.00010922142462727776, "loss": 1.5419, "num_input_tokens_seen": 14922784, "step": 2472, "train_runtime": 2504.3076, "train_tokens_per_second": 5958.846 }, { "epoch": 0.9096091954022989, "grad_norm": 0.7073541283607483, "learning_rate": 0.00010918461255291737, "loss": 1.6384, "num_input_tokens_seen": 14927600, "step": 2473, "train_runtime": 2505.142, "train_tokens_per_second": 5958.784 }, { "epoch": 0.9099770114942529, "grad_norm": 0.7420263290405273, "learning_rate": 0.00010914780047855698, "loss": 1.5424, "num_input_tokens_seen": 14934224, "step": 2474, "train_runtime": 2506.2225, "train_tokens_per_second": 5958.858 }, { "epoch": 0.9103448275862069, "grad_norm": 0.8375838398933411, "learning_rate": 0.00010911098840419657, "loss": 1.7037, "num_input_tokens_seen": 14944112, "step": 2475, "train_runtime": 2507.7242, "train_tokens_per_second": 5959.233 }, { "epoch": 0.910712643678161, "grad_norm": 0.8070331811904907, "learning_rate": 0.00010907417632983618, "loss": 1.61, "num_input_tokens_seen": 14948992, "step": 2476, "train_runtime": 2508.5655, "train_tokens_per_second": 5959.179 }, { "epoch": 0.911080459770115, "grad_norm": 0.8206854462623596, "learning_rate": 0.00010903736425547579, "loss": 1.8077, "num_input_tokens_seen": 14955056, "step": 2477, "train_runtime": 2509.5547, "train_tokens_per_second": 5959.247 }, { "epoch": 0.911448275862069, "grad_norm": 0.7671430706977844, "learning_rate": 0.0001090005521811154, "loss": 1.7379, "num_input_tokens_seen": 14960496, "step": 2478, "train_runtime": 2510.4661, "train_tokens_per_second": 5959.25 }, { "epoch": 0.911816091954023, "grad_norm": 0.7520632743835449, "learning_rate": 0.00010896374010675504, "loss": 1.8196, "num_input_tokens_seen": 14965536, "step": 2479, "train_runtime": 2511.3209, "train_tokens_per_second": 5959.229 }, { "epoch": 0.912183908045977, "grad_norm": 0.7265950441360474, "learning_rate": 0.00010892692803239463, "loss": 1.8204, "num_input_tokens_seen": 14971360, "step": 2480, "train_runtime": 2512.3068, "train_tokens_per_second": 5959.209 }, { "epoch": 0.9125517241379311, "grad_norm": 0.7691535949707031, "learning_rate": 0.00010889011595803424, "loss": 1.7513, "num_input_tokens_seen": 14976912, "step": 2481, "train_runtime": 2513.2256, "train_tokens_per_second": 5959.239 }, { "epoch": 0.9129195402298851, "grad_norm": 0.7225045561790466, "learning_rate": 0.00010885330388367385, "loss": 1.6484, "num_input_tokens_seen": 14981504, "step": 2482, "train_runtime": 2514.0241, "train_tokens_per_second": 5959.173 }, { "epoch": 0.9132873563218391, "grad_norm": 0.7425840497016907, "learning_rate": 0.00010881649180931346, "loss": 1.6489, "num_input_tokens_seen": 14988048, "step": 2483, "train_runtime": 2515.0688, "train_tokens_per_second": 5959.299 }, { "epoch": 0.9136551724137931, "grad_norm": 0.8102589845657349, "learning_rate": 0.00010877967973495307, "loss": 1.7261, "num_input_tokens_seen": 14994592, "step": 2484, "train_runtime": 2516.1357, "train_tokens_per_second": 5959.373 }, { "epoch": 0.9140229885057471, "grad_norm": 0.7214230895042419, "learning_rate": 0.00010874286766059268, "loss": 1.8313, "num_input_tokens_seen": 15000832, "step": 2485, "train_runtime": 2517.1628, "train_tokens_per_second": 5959.421 }, { "epoch": 0.9143908045977012, "grad_norm": 0.7304913401603699, "learning_rate": 0.00010870605558623228, "loss": 1.556, "num_input_tokens_seen": 15005520, "step": 2486, "train_runtime": 2517.9384, "train_tokens_per_second": 5959.447 }, { "epoch": 0.9147586206896552, "grad_norm": 0.6967540979385376, "learning_rate": 0.00010866924351187191, "loss": 1.6727, "num_input_tokens_seen": 15010464, "step": 2487, "train_runtime": 2518.7942, "train_tokens_per_second": 5959.385 }, { "epoch": 0.9151264367816092, "grad_norm": 0.7573222517967224, "learning_rate": 0.00010863243143751152, "loss": 1.5095, "num_input_tokens_seen": 15018912, "step": 2488, "train_runtime": 2520.0803, "train_tokens_per_second": 5959.696 }, { "epoch": 0.9154942528735632, "grad_norm": 0.7670751810073853, "learning_rate": 0.00010859561936315113, "loss": 1.7261, "num_input_tokens_seen": 15024560, "step": 2489, "train_runtime": 2521.0374, "train_tokens_per_second": 5959.674 }, { "epoch": 0.9158620689655173, "grad_norm": 0.84031081199646, "learning_rate": 0.00010855880728879073, "loss": 1.5813, "num_input_tokens_seen": 15029136, "step": 2490, "train_runtime": 2521.8081, "train_tokens_per_second": 5959.667 }, { "epoch": 0.9162298850574713, "grad_norm": 0.7741042971611023, "learning_rate": 0.00010852199521443034, "loss": 1.7828, "num_input_tokens_seen": 15033648, "step": 2491, "train_runtime": 2523.0778, "train_tokens_per_second": 5958.456 }, { "epoch": 0.9165977011494253, "grad_norm": 0.8092449307441711, "learning_rate": 0.00010848518314006995, "loss": 1.9043, "num_input_tokens_seen": 15039024, "step": 2492, "train_runtime": 2523.9892, "train_tokens_per_second": 5958.434 }, { "epoch": 0.9169655172413793, "grad_norm": 0.7662644982337952, "learning_rate": 0.00010844837106570955, "loss": 1.6079, "num_input_tokens_seen": 15044224, "step": 2493, "train_runtime": 2524.8604, "train_tokens_per_second": 5958.438 }, { "epoch": 0.9173333333333333, "grad_norm": 0.7252683043479919, "learning_rate": 0.00010841155899134916, "loss": 1.6034, "num_input_tokens_seen": 15050160, "step": 2494, "train_runtime": 2525.8624, "train_tokens_per_second": 5958.424 }, { "epoch": 0.9177011494252874, "grad_norm": 0.7052468657493591, "learning_rate": 0.00010837474691698876, "loss": 1.6667, "num_input_tokens_seen": 15056800, "step": 2495, "train_runtime": 2526.9288, "train_tokens_per_second": 5958.538 }, { "epoch": 0.9180689655172414, "grad_norm": 0.74473637342453, "learning_rate": 0.0001083379348426284, "loss": 1.5383, "num_input_tokens_seen": 15067888, "step": 2496, "train_runtime": 2528.5974, "train_tokens_per_second": 5958.991 }, { "epoch": 0.9184367816091954, "grad_norm": 0.7353703379631042, "learning_rate": 0.00010830112276826801, "loss": 1.7424, "num_input_tokens_seen": 15075024, "step": 2497, "train_runtime": 2529.7384, "train_tokens_per_second": 5959.124 }, { "epoch": 0.9188045977011494, "grad_norm": 0.783466637134552, "learning_rate": 0.0001082643106939076, "loss": 1.6509, "num_input_tokens_seen": 15081808, "step": 2498, "train_runtime": 2530.8307, "train_tokens_per_second": 5959.232 }, { "epoch": 0.9191724137931034, "grad_norm": 0.8483232855796814, "learning_rate": 0.00010822749861954721, "loss": 1.7336, "num_input_tokens_seen": 15086432, "step": 2499, "train_runtime": 2531.6031, "train_tokens_per_second": 5959.24 }, { "epoch": 0.9195402298850575, "grad_norm": 0.7204304337501526, "learning_rate": 0.00010819068654518682, "loss": 1.76, "num_input_tokens_seen": 15092640, "step": 2500, "train_runtime": 2532.601, "train_tokens_per_second": 5959.344 }, { "epoch": 0.9199080459770115, "grad_norm": 0.7520074248313904, "learning_rate": 0.00010815387447082643, "loss": 1.6571, "num_input_tokens_seen": 15097792, "step": 2501, "train_runtime": 2533.502, "train_tokens_per_second": 5959.258 }, { "epoch": 0.9202758620689655, "grad_norm": 0.7919902801513672, "learning_rate": 0.00010811706239646604, "loss": 1.7254, "num_input_tokens_seen": 15105648, "step": 2502, "train_runtime": 2534.7225, "train_tokens_per_second": 5959.488 }, { "epoch": 0.9206436781609195, "grad_norm": 0.7878010272979736, "learning_rate": 0.00010808025032210565, "loss": 1.7348, "num_input_tokens_seen": 15112176, "step": 2503, "train_runtime": 2535.7762, "train_tokens_per_second": 5959.586 }, { "epoch": 0.9210114942528735, "grad_norm": 0.7690539956092834, "learning_rate": 0.00010804343824774527, "loss": 1.6653, "num_input_tokens_seen": 15116336, "step": 2504, "train_runtime": 2536.5041, "train_tokens_per_second": 5959.516 }, { "epoch": 0.9213793103448276, "grad_norm": 0.8095653653144836, "learning_rate": 0.00010800662617338488, "loss": 1.8966, "num_input_tokens_seen": 15122656, "step": 2505, "train_runtime": 2537.5224, "train_tokens_per_second": 5959.615 }, { "epoch": 0.9217471264367816, "grad_norm": 0.8052874803543091, "learning_rate": 0.00010796981409902449, "loss": 1.9162, "num_input_tokens_seen": 15127616, "step": 2506, "train_runtime": 2538.3589, "train_tokens_per_second": 5959.605 }, { "epoch": 0.9221149425287356, "grad_norm": 0.7415193319320679, "learning_rate": 0.0001079330020246641, "loss": 1.705, "num_input_tokens_seen": 15134944, "step": 2507, "train_runtime": 2539.5313, "train_tokens_per_second": 5959.739 }, { "epoch": 0.9224827586206896, "grad_norm": 0.7247180938720703, "learning_rate": 0.00010789618995030371, "loss": 1.6762, "num_input_tokens_seen": 15140960, "step": 2508, "train_runtime": 2540.5219, "train_tokens_per_second": 5959.783 }, { "epoch": 0.9228505747126436, "grad_norm": 0.766548752784729, "learning_rate": 0.00010785937787594332, "loss": 1.8025, "num_input_tokens_seen": 15146048, "step": 2509, "train_runtime": 2541.3892, "train_tokens_per_second": 5959.751 }, { "epoch": 0.9232183908045977, "grad_norm": 0.739657461643219, "learning_rate": 0.00010782256580158293, "loss": 1.7365, "num_input_tokens_seen": 15153216, "step": 2510, "train_runtime": 2542.5081, "train_tokens_per_second": 5959.948 }, { "epoch": 0.9235862068965517, "grad_norm": 0.6670482754707336, "learning_rate": 0.00010778575372722252, "loss": 1.6166, "num_input_tokens_seen": 15160480, "step": 2511, "train_runtime": 2543.681, "train_tokens_per_second": 5960.055 }, { "epoch": 0.9239540229885057, "grad_norm": 0.6904467940330505, "learning_rate": 0.00010774894165286213, "loss": 1.6364, "num_input_tokens_seen": 15167984, "step": 2512, "train_runtime": 2544.8931, "train_tokens_per_second": 5960.165 }, { "epoch": 0.9243218390804597, "grad_norm": 0.8197052478790283, "learning_rate": 0.00010771212957850177, "loss": 1.7968, "num_input_tokens_seen": 15172528, "step": 2513, "train_runtime": 2545.6902, "train_tokens_per_second": 5960.084 }, { "epoch": 0.9246896551724137, "grad_norm": 0.6886665225028992, "learning_rate": 0.00010767531750414137, "loss": 1.6555, "num_input_tokens_seen": 15177216, "step": 2514, "train_runtime": 2546.5192, "train_tokens_per_second": 5959.985 }, { "epoch": 0.9250574712643678, "grad_norm": 0.7456634640693665, "learning_rate": 0.00010763850542978098, "loss": 1.6618, "num_input_tokens_seen": 15183760, "step": 2515, "train_runtime": 2547.6056, "train_tokens_per_second": 5960.012 }, { "epoch": 0.9254252873563218, "grad_norm": 0.7432196736335754, "learning_rate": 0.00010760169335542058, "loss": 1.712, "num_input_tokens_seen": 15191632, "step": 2516, "train_runtime": 2548.8417, "train_tokens_per_second": 5960.21 }, { "epoch": 0.9257931034482758, "grad_norm": 0.8311834335327148, "learning_rate": 0.00010756488128106019, "loss": 1.7863, "num_input_tokens_seen": 15196528, "step": 2517, "train_runtime": 2549.6778, "train_tokens_per_second": 5960.176 }, { "epoch": 0.9261609195402298, "grad_norm": 0.7555972337722778, "learning_rate": 0.0001075280692066998, "loss": 1.5738, "num_input_tokens_seen": 15203424, "step": 2518, "train_runtime": 2550.7967, "train_tokens_per_second": 5960.265 }, { "epoch": 0.9265287356321839, "grad_norm": 0.7590003609657288, "learning_rate": 0.0001074912571323394, "loss": 1.6935, "num_input_tokens_seen": 15208048, "step": 2519, "train_runtime": 2551.6065, "train_tokens_per_second": 5960.185 }, { "epoch": 0.926896551724138, "grad_norm": 0.8056831359863281, "learning_rate": 0.00010745444505797901, "loss": 1.6413, "num_input_tokens_seen": 15214736, "step": 2520, "train_runtime": 2552.6474, "train_tokens_per_second": 5960.375 }, { "epoch": 0.927264367816092, "grad_norm": 0.6924358606338501, "learning_rate": 0.00010741763298361862, "loss": 1.5707, "num_input_tokens_seen": 15219408, "step": 2521, "train_runtime": 2553.9364, "train_tokens_per_second": 5959.196 }, { "epoch": 0.927632183908046, "grad_norm": 0.8808372020721436, "learning_rate": 0.00010738082090925825, "loss": 2.0587, "num_input_tokens_seen": 15224624, "step": 2522, "train_runtime": 2554.8269, "train_tokens_per_second": 5959.161 }, { "epoch": 0.928, "grad_norm": 0.6935523152351379, "learning_rate": 0.00010734400883489785, "loss": 1.6628, "num_input_tokens_seen": 15231632, "step": 2523, "train_runtime": 2555.9483, "train_tokens_per_second": 5959.288 }, { "epoch": 0.9283678160919541, "grad_norm": 0.7480493187904358, "learning_rate": 0.00010730719676053746, "loss": 1.8916, "num_input_tokens_seen": 15236144, "step": 2524, "train_runtime": 2556.7367, "train_tokens_per_second": 5959.215 }, { "epoch": 0.9287356321839081, "grad_norm": 0.7940954566001892, "learning_rate": 0.00010727038468617707, "loss": 1.7265, "num_input_tokens_seen": 15241920, "step": 2525, "train_runtime": 2557.6615, "train_tokens_per_second": 5959.319 }, { "epoch": 0.9291034482758621, "grad_norm": 0.75591641664505, "learning_rate": 0.00010723357261181668, "loss": 1.8021, "num_input_tokens_seen": 15248336, "step": 2526, "train_runtime": 2558.7215, "train_tokens_per_second": 5959.357 }, { "epoch": 0.9294712643678161, "grad_norm": 0.765473484992981, "learning_rate": 0.00010719676053745629, "loss": 1.7953, "num_input_tokens_seen": 15252672, "step": 2527, "train_runtime": 2559.4795, "train_tokens_per_second": 5959.287 }, { "epoch": 0.9298390804597702, "grad_norm": 0.7165312170982361, "learning_rate": 0.0001071599484630959, "loss": 1.6301, "num_input_tokens_seen": 15257920, "step": 2528, "train_runtime": 2560.3436, "train_tokens_per_second": 5959.325 }, { "epoch": 0.9302068965517242, "grad_norm": 0.7552527189254761, "learning_rate": 0.0001071231363887355, "loss": 1.706, "num_input_tokens_seen": 15263920, "step": 2529, "train_runtime": 2561.3258, "train_tokens_per_second": 5959.382 }, { "epoch": 0.9305747126436782, "grad_norm": 0.7574245929718018, "learning_rate": 0.00010708632431437513, "loss": 1.7196, "num_input_tokens_seen": 15269488, "step": 2530, "train_runtime": 2562.2662, "train_tokens_per_second": 5959.368 }, { "epoch": 0.9309425287356322, "grad_norm": 0.6877573132514954, "learning_rate": 0.00010704951224001474, "loss": 1.5738, "num_input_tokens_seen": 15280880, "step": 2531, "train_runtime": 2563.952, "train_tokens_per_second": 5959.893 }, { "epoch": 0.9313103448275862, "grad_norm": 0.7410098910331726, "learning_rate": 0.00010701270016565435, "loss": 1.7492, "num_input_tokens_seen": 15286544, "step": 2532, "train_runtime": 2564.8864, "train_tokens_per_second": 5959.93 }, { "epoch": 0.9316781609195403, "grad_norm": 0.7868102192878723, "learning_rate": 0.00010697588809129396, "loss": 1.5289, "num_input_tokens_seen": 15293232, "step": 2533, "train_runtime": 2565.9792, "train_tokens_per_second": 5959.999 }, { "epoch": 0.9320459770114943, "grad_norm": 0.7302942872047424, "learning_rate": 0.00010693907601693357, "loss": 1.7216, "num_input_tokens_seen": 15298320, "step": 2534, "train_runtime": 2566.838, "train_tokens_per_second": 5959.986 }, { "epoch": 0.9324137931034483, "grad_norm": 0.784263014793396, "learning_rate": 0.00010690226394257316, "loss": 1.631, "num_input_tokens_seen": 15304448, "step": 2535, "train_runtime": 2567.844, "train_tokens_per_second": 5960.038 }, { "epoch": 0.9327816091954023, "grad_norm": 0.649817705154419, "learning_rate": 0.00010686545186821277, "loss": 1.6417, "num_input_tokens_seen": 15313776, "step": 2536, "train_runtime": 2569.2711, "train_tokens_per_second": 5960.358 }, { "epoch": 0.9331494252873563, "grad_norm": 0.8143831491470337, "learning_rate": 0.00010682863979385238, "loss": 1.8846, "num_input_tokens_seen": 15318864, "step": 2537, "train_runtime": 2570.1268, "train_tokens_per_second": 5960.353 }, { "epoch": 0.9335172413793104, "grad_norm": 0.7969774007797241, "learning_rate": 0.00010679182771949199, "loss": 1.9373, "num_input_tokens_seen": 15323216, "step": 2538, "train_runtime": 2570.8845, "train_tokens_per_second": 5960.29 }, { "epoch": 0.9338850574712644, "grad_norm": 0.7657924294471741, "learning_rate": 0.00010675501564513162, "loss": 1.7736, "num_input_tokens_seen": 15329536, "step": 2539, "train_runtime": 2571.9303, "train_tokens_per_second": 5960.323 }, { "epoch": 0.9342528735632184, "grad_norm": 0.7626153230667114, "learning_rate": 0.00010671820357077122, "loss": 1.6901, "num_input_tokens_seen": 15333952, "step": 2540, "train_runtime": 2572.6821, "train_tokens_per_second": 5960.298 }, { "epoch": 0.9346206896551724, "grad_norm": 0.7269489765167236, "learning_rate": 0.00010668139149641083, "loss": 1.6146, "num_input_tokens_seen": 15339040, "step": 2541, "train_runtime": 2573.5291, "train_tokens_per_second": 5960.314 }, { "epoch": 0.9349885057471264, "grad_norm": 0.8552651405334473, "learning_rate": 0.00010664457942205044, "loss": 1.6695, "num_input_tokens_seen": 15344752, "step": 2542, "train_runtime": 2574.4773, "train_tokens_per_second": 5960.337 }, { "epoch": 0.9353563218390805, "grad_norm": 0.7995190024375916, "learning_rate": 0.00010660776734769005, "loss": 1.7721, "num_input_tokens_seen": 15350752, "step": 2543, "train_runtime": 2575.4699, "train_tokens_per_second": 5960.369 }, { "epoch": 0.9357241379310345, "grad_norm": 0.7732382416725159, "learning_rate": 0.00010657095527332965, "loss": 1.6626, "num_input_tokens_seen": 15355936, "step": 2544, "train_runtime": 2576.3339, "train_tokens_per_second": 5960.383 }, { "epoch": 0.9360919540229885, "grad_norm": 0.7307212352752686, "learning_rate": 0.00010653414319896926, "loss": 1.5954, "num_input_tokens_seen": 15361296, "step": 2545, "train_runtime": 2577.2339, "train_tokens_per_second": 5960.381 }, { "epoch": 0.9364597701149425, "grad_norm": 0.8574381470680237, "learning_rate": 0.00010649733112460887, "loss": 1.6593, "num_input_tokens_seen": 15367024, "step": 2546, "train_runtime": 2578.1668, "train_tokens_per_second": 5960.446 }, { "epoch": 0.9368275862068965, "grad_norm": 0.7505806088447571, "learning_rate": 0.0001064605190502485, "loss": 1.6593, "num_input_tokens_seen": 15375536, "step": 2547, "train_runtime": 2579.4721, "train_tokens_per_second": 5960.73 }, { "epoch": 0.9371954022988506, "grad_norm": 0.7568456530570984, "learning_rate": 0.0001064237069758881, "loss": 1.7068, "num_input_tokens_seen": 15381616, "step": 2548, "train_runtime": 2580.4523, "train_tokens_per_second": 5960.822 }, { "epoch": 0.9375632183908046, "grad_norm": 0.7760906219482422, "learning_rate": 0.00010638689490152771, "loss": 1.6475, "num_input_tokens_seen": 15388576, "step": 2549, "train_runtime": 2581.5703, "train_tokens_per_second": 5960.936 }, { "epoch": 0.9379310344827586, "grad_norm": 0.6869860291481018, "learning_rate": 0.00010635008282716732, "loss": 1.6367, "num_input_tokens_seen": 15396304, "step": 2550, "train_runtime": 2582.806, "train_tokens_per_second": 5961.076 }, { "epoch": 0.9382988505747126, "grad_norm": 0.748971700668335, "learning_rate": 0.00010631327075280693, "loss": 1.6767, "num_input_tokens_seen": 15401248, "step": 2551, "train_runtime": 2584.1357, "train_tokens_per_second": 5959.922 }, { "epoch": 0.9386666666666666, "grad_norm": 0.8482131958007812, "learning_rate": 0.00010627645867844654, "loss": 1.8888, "num_input_tokens_seen": 15407504, "step": 2552, "train_runtime": 2585.164, "train_tokens_per_second": 5959.972 }, { "epoch": 0.9390344827586207, "grad_norm": 0.7847908139228821, "learning_rate": 0.00010623964660408613, "loss": 1.7463, "num_input_tokens_seen": 15413056, "step": 2553, "train_runtime": 2586.0865, "train_tokens_per_second": 5959.992 }, { "epoch": 0.9394022988505747, "grad_norm": 0.7715175747871399, "learning_rate": 0.00010620283452972574, "loss": 1.745, "num_input_tokens_seen": 15418528, "step": 2554, "train_runtime": 2587.0045, "train_tokens_per_second": 5959.993 }, { "epoch": 0.9397701149425287, "grad_norm": 0.7222607135772705, "learning_rate": 0.00010616602245536535, "loss": 1.6166, "num_input_tokens_seen": 15427568, "step": 2555, "train_runtime": 2588.3731, "train_tokens_per_second": 5960.334 }, { "epoch": 0.9401379310344827, "grad_norm": 0.6869435906410217, "learning_rate": 0.00010612921038100499, "loss": 1.6545, "num_input_tokens_seen": 15434640, "step": 2556, "train_runtime": 2589.5271, "train_tokens_per_second": 5960.409 }, { "epoch": 0.9405057471264368, "grad_norm": 0.7444092035293579, "learning_rate": 0.0001060923983066446, "loss": 1.5973, "num_input_tokens_seen": 15440432, "step": 2557, "train_runtime": 2590.4785, "train_tokens_per_second": 5960.456 }, { "epoch": 0.9408735632183908, "grad_norm": 0.7215439677238464, "learning_rate": 0.00010605558623228419, "loss": 1.5527, "num_input_tokens_seen": 15448832, "step": 2558, "train_runtime": 2591.7811, "train_tokens_per_second": 5960.701 }, { "epoch": 0.9412413793103448, "grad_norm": 0.7285688519477844, "learning_rate": 0.0001060187741579238, "loss": 1.6329, "num_input_tokens_seen": 15457968, "step": 2559, "train_runtime": 2593.2118, "train_tokens_per_second": 5960.935 }, { "epoch": 0.9416091954022988, "grad_norm": 0.7814379930496216, "learning_rate": 0.00010598196208356341, "loss": 1.5189, "num_input_tokens_seen": 15465248, "step": 2560, "train_runtime": 2594.3863, "train_tokens_per_second": 5961.043 }, { "epoch": 0.9419770114942528, "grad_norm": 0.7479436993598938, "learning_rate": 0.00010594515000920302, "loss": 1.5687, "num_input_tokens_seen": 15472720, "step": 2561, "train_runtime": 2595.5634, "train_tokens_per_second": 5961.218 }, { "epoch": 0.9423448275862069, "grad_norm": 0.7916021943092346, "learning_rate": 0.00010590833793484263, "loss": 1.7425, "num_input_tokens_seen": 15478720, "step": 2562, "train_runtime": 2596.5569, "train_tokens_per_second": 5961.248 }, { "epoch": 0.9427126436781609, "grad_norm": 0.8089719414710999, "learning_rate": 0.00010587152586048224, "loss": 1.591, "num_input_tokens_seen": 15487024, "step": 2563, "train_runtime": 2597.8165, "train_tokens_per_second": 5961.554 }, { "epoch": 0.9430804597701149, "grad_norm": 0.7413442730903625, "learning_rate": 0.00010583471378612186, "loss": 1.6217, "num_input_tokens_seen": 15492496, "step": 2564, "train_runtime": 2598.7185, "train_tokens_per_second": 5961.591 }, { "epoch": 0.9434482758620689, "grad_norm": 0.7030351758003235, "learning_rate": 0.00010579790171176147, "loss": 1.7155, "num_input_tokens_seen": 15497616, "step": 2565, "train_runtime": 2599.582, "train_tokens_per_second": 5961.58 }, { "epoch": 0.9438160919540229, "grad_norm": 0.7779426574707031, "learning_rate": 0.00010576108963740108, "loss": 1.8197, "num_input_tokens_seen": 15502256, "step": 2566, "train_runtime": 2600.4029, "train_tokens_per_second": 5961.482 }, { "epoch": 0.944183908045977, "grad_norm": 0.7877058386802673, "learning_rate": 0.00010572427756304069, "loss": 1.5917, "num_input_tokens_seen": 15508352, "step": 2567, "train_runtime": 2601.3946, "train_tokens_per_second": 5961.553 }, { "epoch": 0.944551724137931, "grad_norm": 0.7855427861213684, "learning_rate": 0.0001056874654886803, "loss": 1.7309, "num_input_tokens_seen": 15512912, "step": 2568, "train_runtime": 2602.192, "train_tokens_per_second": 5961.479 }, { "epoch": 0.944919540229885, "grad_norm": 0.7029417753219604, "learning_rate": 0.0001056506534143199, "loss": 1.4136, "num_input_tokens_seen": 15519264, "step": 2569, "train_runtime": 2603.2367, "train_tokens_per_second": 5961.526 }, { "epoch": 0.9452873563218391, "grad_norm": 0.7505778074264526, "learning_rate": 0.00010561384133995951, "loss": 1.8622, "num_input_tokens_seen": 15524224, "step": 2570, "train_runtime": 2604.0883, "train_tokens_per_second": 5961.482 }, { "epoch": 0.9456551724137932, "grad_norm": 0.766185998916626, "learning_rate": 0.00010557702926559911, "loss": 1.7902, "num_input_tokens_seen": 15530688, "step": 2571, "train_runtime": 2605.1302, "train_tokens_per_second": 5961.578 }, { "epoch": 0.9460229885057472, "grad_norm": 0.7540948390960693, "learning_rate": 0.00010554021719123872, "loss": 1.9136, "num_input_tokens_seen": 15535600, "step": 2572, "train_runtime": 2605.9731, "train_tokens_per_second": 5961.535 }, { "epoch": 0.9463908045977012, "grad_norm": 0.780738890171051, "learning_rate": 0.00010550340511687835, "loss": 1.5797, "num_input_tokens_seen": 15542784, "step": 2573, "train_runtime": 2607.086, "train_tokens_per_second": 5961.746 }, { "epoch": 0.9467586206896552, "grad_norm": 0.7569245100021362, "learning_rate": 0.00010546659304251796, "loss": 1.7833, "num_input_tokens_seen": 15548384, "step": 2574, "train_runtime": 2607.9889, "train_tokens_per_second": 5961.829 }, { "epoch": 0.9471264367816092, "grad_norm": 0.8940502405166626, "learning_rate": 0.00010542978096815757, "loss": 1.8966, "num_input_tokens_seen": 15553600, "step": 2575, "train_runtime": 2608.8601, "train_tokens_per_second": 5961.837 }, { "epoch": 0.9474942528735633, "grad_norm": 0.6905773282051086, "learning_rate": 0.00010539296889379717, "loss": 1.5211, "num_input_tokens_seen": 15558704, "step": 2576, "train_runtime": 2609.7297, "train_tokens_per_second": 5961.807 }, { "epoch": 0.9478620689655173, "grad_norm": 0.7449854016304016, "learning_rate": 0.00010535615681943678, "loss": 1.6044, "num_input_tokens_seen": 15565472, "step": 2577, "train_runtime": 2610.818, "train_tokens_per_second": 5961.914 }, { "epoch": 0.9482298850574713, "grad_norm": 0.8156737089157104, "learning_rate": 0.00010531934474507638, "loss": 1.7407, "num_input_tokens_seen": 15572640, "step": 2578, "train_runtime": 2611.9509, "train_tokens_per_second": 5962.072 }, { "epoch": 0.9485977011494253, "grad_norm": 0.7681053876876831, "learning_rate": 0.000105282532670716, "loss": 1.7782, "num_input_tokens_seen": 15578272, "step": 2579, "train_runtime": 2612.8764, "train_tokens_per_second": 5962.116 }, { "epoch": 0.9489655172413793, "grad_norm": 0.6874492764472961, "learning_rate": 0.0001052457205963556, "loss": 1.7121, "num_input_tokens_seen": 15584480, "step": 2580, "train_runtime": 2613.9154, "train_tokens_per_second": 5962.121 }, { "epoch": 0.9493333333333334, "grad_norm": 0.7125325798988342, "learning_rate": 0.00010520890852199521, "loss": 1.6029, "num_input_tokens_seen": 15589136, "step": 2581, "train_runtime": 2615.1887, "train_tokens_per_second": 5960.998 }, { "epoch": 0.9497011494252874, "grad_norm": 0.7656606435775757, "learning_rate": 0.00010517209644763483, "loss": 1.7025, "num_input_tokens_seen": 15596608, "step": 2582, "train_runtime": 2616.3702, "train_tokens_per_second": 5961.162 }, { "epoch": 0.9500689655172414, "grad_norm": 0.7482950091362, "learning_rate": 0.00010513528437327444, "loss": 1.6919, "num_input_tokens_seen": 15602176, "step": 2583, "train_runtime": 2617.2695, "train_tokens_per_second": 5961.242 }, { "epoch": 0.9504367816091954, "grad_norm": 0.7446708679199219, "learning_rate": 0.00010509847229891405, "loss": 1.8587, "num_input_tokens_seen": 15611088, "step": 2584, "train_runtime": 2618.631, "train_tokens_per_second": 5961.546 }, { "epoch": 0.9508045977011494, "grad_norm": 0.7638434767723083, "learning_rate": 0.00010506166022455366, "loss": 1.6756, "num_input_tokens_seen": 15617600, "step": 2585, "train_runtime": 2619.6627, "train_tokens_per_second": 5961.684 }, { "epoch": 0.9511724137931035, "grad_norm": 0.7562476396560669, "learning_rate": 0.00010502484815019327, "loss": 1.7775, "num_input_tokens_seen": 15623888, "step": 2586, "train_runtime": 2620.67, "train_tokens_per_second": 5961.791 }, { "epoch": 0.9515402298850575, "grad_norm": 0.7628239393234253, "learning_rate": 0.00010498803607583288, "loss": 1.7905, "num_input_tokens_seen": 15629280, "step": 2587, "train_runtime": 2621.5858, "train_tokens_per_second": 5961.766 }, { "epoch": 0.9519080459770115, "grad_norm": 0.7623147964477539, "learning_rate": 0.00010495122400147249, "loss": 1.9185, "num_input_tokens_seen": 15635664, "step": 2588, "train_runtime": 2622.6236, "train_tokens_per_second": 5961.841 }, { "epoch": 0.9522758620689655, "grad_norm": 0.7677077651023865, "learning_rate": 0.00010491441192711208, "loss": 1.8309, "num_input_tokens_seen": 15641088, "step": 2589, "train_runtime": 2623.5212, "train_tokens_per_second": 5961.868 }, { "epoch": 0.9526436781609195, "grad_norm": 0.8027551174163818, "learning_rate": 0.00010487759985275172, "loss": 1.6273, "num_input_tokens_seen": 15645856, "step": 2590, "train_runtime": 2624.3256, "train_tokens_per_second": 5961.858 }, { "epoch": 0.9530114942528736, "grad_norm": 0.7034247517585754, "learning_rate": 0.00010484078777839133, "loss": 1.6412, "num_input_tokens_seen": 15650752, "step": 2591, "train_runtime": 2625.1697, "train_tokens_per_second": 5961.806 }, { "epoch": 0.9533793103448276, "grad_norm": 0.6913555860519409, "learning_rate": 0.00010480397570403094, "loss": 1.7685, "num_input_tokens_seen": 15657296, "step": 2592, "train_runtime": 2626.2348, "train_tokens_per_second": 5961.88 }, { "epoch": 0.9537471264367816, "grad_norm": 0.7643256187438965, "learning_rate": 0.00010476716362967054, "loss": 1.8081, "num_input_tokens_seen": 15662176, "step": 2593, "train_runtime": 2627.07, "train_tokens_per_second": 5961.842 }, { "epoch": 0.9541149425287356, "grad_norm": 0.6745730042457581, "learning_rate": 0.00010473035155531014, "loss": 1.794, "num_input_tokens_seen": 15667568, "step": 2594, "train_runtime": 2627.9875, "train_tokens_per_second": 5961.812 }, { "epoch": 0.9544827586206897, "grad_norm": 0.752946138381958, "learning_rate": 0.00010469353948094975, "loss": 1.7325, "num_input_tokens_seen": 15674240, "step": 2595, "train_runtime": 2629.0621, "train_tokens_per_second": 5961.913 }, { "epoch": 0.9548505747126437, "grad_norm": 0.728472888469696, "learning_rate": 0.00010465672740658936, "loss": 1.671, "num_input_tokens_seen": 15680432, "step": 2596, "train_runtime": 2630.0762, "train_tokens_per_second": 5961.969 }, { "epoch": 0.9552183908045977, "grad_norm": 0.7472367882728577, "learning_rate": 0.00010461991533222897, "loss": 1.7573, "num_input_tokens_seen": 15685760, "step": 2597, "train_runtime": 2631.0112, "train_tokens_per_second": 5961.875 }, { "epoch": 0.9555862068965517, "grad_norm": 0.761685311794281, "learning_rate": 0.00010458310325786858, "loss": 1.6944, "num_input_tokens_seen": 15689984, "step": 2598, "train_runtime": 2631.7473, "train_tokens_per_second": 5961.812 }, { "epoch": 0.9559540229885057, "grad_norm": 0.7775751352310181, "learning_rate": 0.0001045462911835082, "loss": 1.8871, "num_input_tokens_seen": 15695344, "step": 2599, "train_runtime": 2632.6248, "train_tokens_per_second": 5961.861 }, { "epoch": 0.9563218390804598, "grad_norm": 0.8221151828765869, "learning_rate": 0.00010450947910914781, "loss": 1.76, "num_input_tokens_seen": 15701760, "step": 2600, "train_runtime": 2633.6754, "train_tokens_per_second": 5961.919 }, { "epoch": 0.9566896551724138, "grad_norm": 0.789374589920044, "learning_rate": 0.00010447266703478742, "loss": 1.8581, "num_input_tokens_seen": 15707440, "step": 2601, "train_runtime": 2634.6263, "train_tokens_per_second": 5961.923 }, { "epoch": 0.9570574712643678, "grad_norm": 0.7307106256484985, "learning_rate": 0.00010443585496042702, "loss": 1.5808, "num_input_tokens_seen": 15714928, "step": 2602, "train_runtime": 2635.8214, "train_tokens_per_second": 5962.061 }, { "epoch": 0.9574252873563218, "grad_norm": 0.7828757166862488, "learning_rate": 0.00010439904288606663, "loss": 1.8317, "num_input_tokens_seen": 15719760, "step": 2603, "train_runtime": 2636.6698, "train_tokens_per_second": 5961.975 }, { "epoch": 0.9577931034482758, "grad_norm": 0.7009854316711426, "learning_rate": 0.00010436223081170624, "loss": 1.642, "num_input_tokens_seen": 15731584, "step": 2604, "train_runtime": 2638.4292, "train_tokens_per_second": 5962.481 }, { "epoch": 0.9581609195402299, "grad_norm": 0.7014610171318054, "learning_rate": 0.00010432541873734585, "loss": 1.6235, "num_input_tokens_seen": 15738656, "step": 2605, "train_runtime": 2639.5492, "train_tokens_per_second": 5962.63 }, { "epoch": 0.9585287356321839, "grad_norm": 0.7427473664283752, "learning_rate": 0.00010428860666298546, "loss": 1.766, "num_input_tokens_seen": 15745216, "step": 2606, "train_runtime": 2640.6051, "train_tokens_per_second": 5962.73 }, { "epoch": 0.9588965517241379, "grad_norm": 0.702900767326355, "learning_rate": 0.00010425179458862508, "loss": 1.5759, "num_input_tokens_seen": 15751648, "step": 2607, "train_runtime": 2641.6432, "train_tokens_per_second": 5962.822 }, { "epoch": 0.9592643678160919, "grad_norm": 0.707489013671875, "learning_rate": 0.00010421498251426469, "loss": 1.5724, "num_input_tokens_seen": 15756784, "step": 2608, "train_runtime": 2642.4985, "train_tokens_per_second": 5962.835 }, { "epoch": 0.9596321839080459, "grad_norm": 0.7865966558456421, "learning_rate": 0.0001041781704399043, "loss": 1.6301, "num_input_tokens_seen": 15764096, "step": 2609, "train_runtime": 2643.6271, "train_tokens_per_second": 5963.056 }, { "epoch": 0.96, "grad_norm": 0.6945360898971558, "learning_rate": 0.00010414135836554391, "loss": 1.5704, "num_input_tokens_seen": 15772304, "step": 2610, "train_runtime": 2644.8831, "train_tokens_per_second": 5963.328 }, { "epoch": 0.960367816091954, "grad_norm": 0.7937390804290771, "learning_rate": 0.00010410454629118352, "loss": 1.7341, "num_input_tokens_seen": 15776912, "step": 2611, "train_runtime": 2646.2467, "train_tokens_per_second": 5961.996 }, { "epoch": 0.960735632183908, "grad_norm": 0.786213755607605, "learning_rate": 0.00010406773421682313, "loss": 1.6778, "num_input_tokens_seen": 15785968, "step": 2612, "train_runtime": 2647.6739, "train_tokens_per_second": 5962.202 }, { "epoch": 0.961103448275862, "grad_norm": 0.7459332346916199, "learning_rate": 0.00010403092214246272, "loss": 1.845, "num_input_tokens_seen": 15790928, "step": 2613, "train_runtime": 2648.5297, "train_tokens_per_second": 5962.149 }, { "epoch": 0.961471264367816, "grad_norm": 0.7828077673912048, "learning_rate": 0.00010399411006810233, "loss": 1.8608, "num_input_tokens_seen": 15796112, "step": 2614, "train_runtime": 2649.4005, "train_tokens_per_second": 5962.146 }, { "epoch": 0.9618390804597701, "grad_norm": 0.7853997945785522, "learning_rate": 0.00010395729799374194, "loss": 1.6777, "num_input_tokens_seen": 15800560, "step": 2615, "train_runtime": 2650.1577, "train_tokens_per_second": 5962.121 }, { "epoch": 0.9622068965517241, "grad_norm": 0.815669059753418, "learning_rate": 0.00010392048591938158, "loss": 1.8344, "num_input_tokens_seen": 15805104, "step": 2616, "train_runtime": 2650.9289, "train_tokens_per_second": 5962.1 }, { "epoch": 0.9625747126436781, "grad_norm": 0.7245709300041199, "learning_rate": 0.00010388367384502119, "loss": 1.7529, "num_input_tokens_seen": 15811808, "step": 2617, "train_runtime": 2652.0078, "train_tokens_per_second": 5962.203 }, { "epoch": 0.9629425287356321, "grad_norm": 0.792323648929596, "learning_rate": 0.00010384686177066078, "loss": 1.704, "num_input_tokens_seen": 15818512, "step": 2618, "train_runtime": 2653.08, "train_tokens_per_second": 5962.32 }, { "epoch": 0.9633103448275863, "grad_norm": 0.880584180355072, "learning_rate": 0.00010381004969630039, "loss": 2.0683, "num_input_tokens_seen": 15822960, "step": 2619, "train_runtime": 2653.8374, "train_tokens_per_second": 5962.294 }, { "epoch": 0.9636781609195403, "grad_norm": 0.7375814318656921, "learning_rate": 0.00010377323762194, "loss": 1.5941, "num_input_tokens_seen": 15831728, "step": 2620, "train_runtime": 2655.1664, "train_tokens_per_second": 5962.612 }, { "epoch": 0.9640459770114943, "grad_norm": 0.7851631045341492, "learning_rate": 0.00010373642554757961, "loss": 1.8205, "num_input_tokens_seen": 15836816, "step": 2621, "train_runtime": 2656.0176, "train_tokens_per_second": 5962.617 }, { "epoch": 0.9644137931034483, "grad_norm": 0.7137867212295532, "learning_rate": 0.00010369961347321922, "loss": 1.6866, "num_input_tokens_seen": 15842976, "step": 2622, "train_runtime": 2656.9987, "train_tokens_per_second": 5962.734 }, { "epoch": 0.9647816091954023, "grad_norm": 0.7727775573730469, "learning_rate": 0.00010366280139885883, "loss": 1.6077, "num_input_tokens_seen": 15850080, "step": 2623, "train_runtime": 2658.1403, "train_tokens_per_second": 5962.846 }, { "epoch": 0.9651494252873564, "grad_norm": 0.7420926690101624, "learning_rate": 0.00010362598932449845, "loss": 1.6499, "num_input_tokens_seen": 15856640, "step": 2624, "train_runtime": 2659.191, "train_tokens_per_second": 5962.956 }, { "epoch": 0.9655172413793104, "grad_norm": 0.7900503277778625, "learning_rate": 0.00010358917725013806, "loss": 1.7608, "num_input_tokens_seen": 15862512, "step": 2625, "train_runtime": 2660.1709, "train_tokens_per_second": 5962.967 }, { "epoch": 0.9658850574712644, "grad_norm": 0.7923082113265991, "learning_rate": 0.00010355236517577767, "loss": 1.8159, "num_input_tokens_seen": 15870880, "step": 2626, "train_runtime": 2661.47, "train_tokens_per_second": 5963.201 }, { "epoch": 0.9662528735632184, "grad_norm": 0.6829389333724976, "learning_rate": 0.00010351555310141727, "loss": 1.691, "num_input_tokens_seen": 15880576, "step": 2627, "train_runtime": 2662.9503, "train_tokens_per_second": 5963.527 }, { "epoch": 0.9666206896551724, "grad_norm": 0.9263708591461182, "learning_rate": 0.00010347874102705688, "loss": 1.6139, "num_input_tokens_seen": 15885968, "step": 2628, "train_runtime": 2663.8306, "train_tokens_per_second": 5963.58 }, { "epoch": 0.9669885057471265, "grad_norm": 0.8506389260292053, "learning_rate": 0.00010344192895269649, "loss": 1.7958, "num_input_tokens_seen": 15891008, "step": 2629, "train_runtime": 2664.6889, "train_tokens_per_second": 5963.551 }, { "epoch": 0.9673563218390805, "grad_norm": 0.7076355218887329, "learning_rate": 0.0001034051168783361, "loss": 1.739, "num_input_tokens_seen": 15896880, "step": 2630, "train_runtime": 2665.6396, "train_tokens_per_second": 5963.627 }, { "epoch": 0.9677241379310345, "grad_norm": 0.7621473670005798, "learning_rate": 0.0001033683048039757, "loss": 1.8364, "num_input_tokens_seen": 15901072, "step": 2631, "train_runtime": 2666.3713, "train_tokens_per_second": 5963.563 }, { "epoch": 0.9680919540229885, "grad_norm": 0.7550080418586731, "learning_rate": 0.0001033314927296153, "loss": 1.6171, "num_input_tokens_seen": 15907152, "step": 2632, "train_runtime": 2667.379, "train_tokens_per_second": 5963.589 }, { "epoch": 0.9684597701149426, "grad_norm": 0.7544217705726624, "learning_rate": 0.00010329468065525494, "loss": 1.8811, "num_input_tokens_seen": 15915200, "step": 2633, "train_runtime": 2668.6381, "train_tokens_per_second": 5963.791 }, { "epoch": 0.9688275862068966, "grad_norm": 0.7832741737365723, "learning_rate": 0.00010325786858089455, "loss": 1.5898, "num_input_tokens_seen": 15921936, "step": 2634, "train_runtime": 2669.7265, "train_tokens_per_second": 5963.883 }, { "epoch": 0.9691954022988506, "grad_norm": 0.6932991147041321, "learning_rate": 0.00010322105650653416, "loss": 1.6538, "num_input_tokens_seen": 15928800, "step": 2635, "train_runtime": 2670.8082, "train_tokens_per_second": 5964.037 }, { "epoch": 0.9695632183908046, "grad_norm": 0.7697433829307556, "learning_rate": 0.00010318424443217375, "loss": 1.5751, "num_input_tokens_seen": 15937376, "step": 2636, "train_runtime": 2672.1255, "train_tokens_per_second": 5964.307 }, { "epoch": 0.9699310344827586, "grad_norm": 0.7205894589424133, "learning_rate": 0.00010314743235781336, "loss": 1.6248, "num_input_tokens_seen": 15943024, "step": 2637, "train_runtime": 2673.0484, "train_tokens_per_second": 5964.36 }, { "epoch": 0.9702988505747127, "grad_norm": 0.7500474452972412, "learning_rate": 0.00010311062028345297, "loss": 1.6561, "num_input_tokens_seen": 15954080, "step": 2638, "train_runtime": 2674.722, "train_tokens_per_second": 5964.762 }, { "epoch": 0.9706666666666667, "grad_norm": 0.7663933038711548, "learning_rate": 0.00010307380820909258, "loss": 1.833, "num_input_tokens_seen": 15959088, "step": 2639, "train_runtime": 2675.5563, "train_tokens_per_second": 5964.774 }, { "epoch": 0.9710344827586207, "grad_norm": 0.7608526945114136, "learning_rate": 0.00010303699613473219, "loss": 1.7386, "num_input_tokens_seen": 15964128, "step": 2640, "train_runtime": 2676.3882, "train_tokens_per_second": 5964.803 }, { "epoch": 0.9714022988505747, "grad_norm": 0.7225230932235718, "learning_rate": 0.0001030001840603718, "loss": 1.6109, "num_input_tokens_seen": 15969472, "step": 2641, "train_runtime": 2677.8067, "train_tokens_per_second": 5963.639 }, { "epoch": 0.9717701149425287, "grad_norm": 0.7210283279418945, "learning_rate": 0.00010296337198601142, "loss": 1.5441, "num_input_tokens_seen": 15974688, "step": 2642, "train_runtime": 2678.6548, "train_tokens_per_second": 5963.698 }, { "epoch": 0.9721379310344828, "grad_norm": 0.7956779599189758, "learning_rate": 0.00010292655991165103, "loss": 1.8876, "num_input_tokens_seen": 15979536, "step": 2643, "train_runtime": 2679.5001, "train_tokens_per_second": 5963.626 }, { "epoch": 0.9725057471264368, "grad_norm": 0.7508404850959778, "learning_rate": 0.00010288974783729064, "loss": 1.6356, "num_input_tokens_seen": 15985264, "step": 2644, "train_runtime": 2680.4414, "train_tokens_per_second": 5963.669 }, { "epoch": 0.9728735632183908, "grad_norm": 0.7549239993095398, "learning_rate": 0.00010285293576293025, "loss": 1.6046, "num_input_tokens_seen": 15989952, "step": 2645, "train_runtime": 2681.2477, "train_tokens_per_second": 5963.624 }, { "epoch": 0.9732413793103448, "grad_norm": 0.8114033341407776, "learning_rate": 0.00010281612368856986, "loss": 1.8563, "num_input_tokens_seen": 15994800, "step": 2646, "train_runtime": 2682.0655, "train_tokens_per_second": 5963.613 }, { "epoch": 0.9736091954022988, "grad_norm": 0.7232359647750854, "learning_rate": 0.00010277931161420947, "loss": 1.6082, "num_input_tokens_seen": 15999632, "step": 2647, "train_runtime": 2682.9083, "train_tokens_per_second": 5963.54 }, { "epoch": 0.9739770114942529, "grad_norm": 0.792028546333313, "learning_rate": 0.00010274249953984907, "loss": 1.7005, "num_input_tokens_seen": 16006224, "step": 2648, "train_runtime": 2683.9871, "train_tokens_per_second": 5963.599 }, { "epoch": 0.9743448275862069, "grad_norm": 0.8042363524436951, "learning_rate": 0.00010270568746548867, "loss": 1.6783, "num_input_tokens_seen": 16011488, "step": 2649, "train_runtime": 2684.8653, "train_tokens_per_second": 5963.609 }, { "epoch": 0.9747126436781609, "grad_norm": 0.7604905962944031, "learning_rate": 0.0001026688753911283, "loss": 1.5909, "num_input_tokens_seen": 16018384, "step": 2650, "train_runtime": 2685.9837, "train_tokens_per_second": 5963.694 }, { "epoch": 0.9750804597701149, "grad_norm": 0.7024556994438171, "learning_rate": 0.00010263206331676791, "loss": 1.609, "num_input_tokens_seen": 16023616, "step": 2651, "train_runtime": 2686.8706, "train_tokens_per_second": 5963.672 }, { "epoch": 0.975448275862069, "grad_norm": 0.7983068227767944, "learning_rate": 0.00010259525124240752, "loss": 1.755, "num_input_tokens_seen": 16028240, "step": 2652, "train_runtime": 2687.6906, "train_tokens_per_second": 5963.573 }, { "epoch": 0.975816091954023, "grad_norm": 0.8283487558364868, "learning_rate": 0.00010255843916804713, "loss": 1.7713, "num_input_tokens_seen": 16036064, "step": 2653, "train_runtime": 2688.9164, "train_tokens_per_second": 5963.764 }, { "epoch": 0.976183908045977, "grad_norm": 0.7740880250930786, "learning_rate": 0.00010252162709368673, "loss": 1.7162, "num_input_tokens_seen": 16040176, "step": 2654, "train_runtime": 2689.6435, "train_tokens_per_second": 5963.681 }, { "epoch": 0.976551724137931, "grad_norm": 0.8273856043815613, "learning_rate": 0.00010248481501932634, "loss": 1.8327, "num_input_tokens_seen": 16045504, "step": 2655, "train_runtime": 2690.5483, "train_tokens_per_second": 5963.656 }, { "epoch": 0.976919540229885, "grad_norm": 0.6738196015357971, "learning_rate": 0.00010244800294496595, "loss": 1.7243, "num_input_tokens_seen": 16050832, "step": 2656, "train_runtime": 2691.4469, "train_tokens_per_second": 5963.644 }, { "epoch": 0.977287356321839, "grad_norm": 0.7211321592330933, "learning_rate": 0.00010241119087060555, "loss": 1.6277, "num_input_tokens_seen": 16058032, "step": 2657, "train_runtime": 2692.5648, "train_tokens_per_second": 5963.842 }, { "epoch": 0.9776551724137931, "grad_norm": 0.8020983934402466, "learning_rate": 0.00010237437879624516, "loss": 1.6528, "num_input_tokens_seen": 16064752, "step": 2658, "train_runtime": 2693.6333, "train_tokens_per_second": 5963.971 }, { "epoch": 0.9780229885057471, "grad_norm": 0.8549041748046875, "learning_rate": 0.00010233756672188479, "loss": 1.7419, "num_input_tokens_seen": 16070624, "step": 2659, "train_runtime": 2694.5931, "train_tokens_per_second": 5964.026 }, { "epoch": 0.9783908045977011, "grad_norm": 0.7465891242027283, "learning_rate": 0.0001023007546475244, "loss": 1.5718, "num_input_tokens_seen": 16079456, "step": 2660, "train_runtime": 2695.9589, "train_tokens_per_second": 5964.281 }, { "epoch": 0.9787586206896551, "grad_norm": 0.734975278377533, "learning_rate": 0.000102263942573164, "loss": 1.5642, "num_input_tokens_seen": 16087600, "step": 2661, "train_runtime": 2697.2296, "train_tokens_per_second": 5964.49 }, { "epoch": 0.9791264367816092, "grad_norm": 0.7577536106109619, "learning_rate": 0.00010222713049880361, "loss": 1.8562, "num_input_tokens_seen": 16093136, "step": 2662, "train_runtime": 2698.1667, "train_tokens_per_second": 5964.471 }, { "epoch": 0.9794942528735632, "grad_norm": 0.7642478942871094, "learning_rate": 0.00010219031842444322, "loss": 1.7886, "num_input_tokens_seen": 16098784, "step": 2663, "train_runtime": 2699.1011, "train_tokens_per_second": 5964.498 }, { "epoch": 0.9798620689655172, "grad_norm": 0.7987829446792603, "learning_rate": 0.00010215350635008283, "loss": 1.8555, "num_input_tokens_seen": 16105008, "step": 2664, "train_runtime": 2700.0877, "train_tokens_per_second": 5964.624 }, { "epoch": 0.9802298850574712, "grad_norm": 0.7660846710205078, "learning_rate": 0.00010211669427572244, "loss": 1.6617, "num_input_tokens_seen": 16112032, "step": 2665, "train_runtime": 2701.2047, "train_tokens_per_second": 5964.758 }, { "epoch": 0.9805977011494252, "grad_norm": 0.7460705041885376, "learning_rate": 0.00010207988220136205, "loss": 1.6483, "num_input_tokens_seen": 16121664, "step": 2666, "train_runtime": 2702.6489, "train_tokens_per_second": 5965.135 }, { "epoch": 0.9809655172413793, "grad_norm": 0.8566172122955322, "learning_rate": 0.00010204307012700167, "loss": 1.7779, "num_input_tokens_seen": 16126672, "step": 2667, "train_runtime": 2703.4859, "train_tokens_per_second": 5965.14 }, { "epoch": 0.9813333333333333, "grad_norm": 0.7617372870445251, "learning_rate": 0.00010200625805264128, "loss": 1.8134, "num_input_tokens_seen": 16131856, "step": 2668, "train_runtime": 2704.3445, "train_tokens_per_second": 5965.163 }, { "epoch": 0.9817011494252874, "grad_norm": 0.8129032254219055, "learning_rate": 0.00010196944597828089, "loss": 1.7059, "num_input_tokens_seen": 16137744, "step": 2669, "train_runtime": 2705.3083, "train_tokens_per_second": 5965.214 }, { "epoch": 0.9820689655172414, "grad_norm": 0.8158069252967834, "learning_rate": 0.0001019326339039205, "loss": 1.9423, "num_input_tokens_seen": 16142352, "step": 2670, "train_runtime": 2706.1306, "train_tokens_per_second": 5965.105 }, { "epoch": 0.9824367816091955, "grad_norm": 0.7910207509994507, "learning_rate": 0.0001018958218295601, "loss": 1.6666, "num_input_tokens_seen": 16147120, "step": 2671, "train_runtime": 2707.498, "train_tokens_per_second": 5963.853 }, { "epoch": 0.9828045977011495, "grad_norm": 0.7697291374206543, "learning_rate": 0.0001018590097551997, "loss": 1.7376, "num_input_tokens_seen": 16152416, "step": 2672, "train_runtime": 2708.3828, "train_tokens_per_second": 5963.86 }, { "epoch": 0.9831724137931035, "grad_norm": 0.7793175578117371, "learning_rate": 0.00010182219768083931, "loss": 1.9242, "num_input_tokens_seen": 16156976, "step": 2673, "train_runtime": 2709.1924, "train_tokens_per_second": 5963.761 }, { "epoch": 0.9835402298850575, "grad_norm": 0.6621190309524536, "learning_rate": 0.00010178538560647892, "loss": 1.5626, "num_input_tokens_seen": 16162528, "step": 2674, "train_runtime": 2710.1155, "train_tokens_per_second": 5963.778 }, { "epoch": 0.9839080459770115, "grad_norm": 0.6125012636184692, "learning_rate": 0.00010174857353211853, "loss": 1.4731, "num_input_tokens_seen": 16174080, "step": 2675, "train_runtime": 2711.8501, "train_tokens_per_second": 5964.223 }, { "epoch": 0.9842758620689656, "grad_norm": 0.6930036544799805, "learning_rate": 0.00010171176145775816, "loss": 1.6377, "num_input_tokens_seen": 16180304, "step": 2676, "train_runtime": 2712.8588, "train_tokens_per_second": 5964.3 }, { "epoch": 0.9846436781609196, "grad_norm": 0.721152126789093, "learning_rate": 0.00010167494938339776, "loss": 1.4922, "num_input_tokens_seen": 16187296, "step": 2677, "train_runtime": 2713.998, "train_tokens_per_second": 5964.373 }, { "epoch": 0.9850114942528736, "grad_norm": 0.6925070881843567, "learning_rate": 0.00010163813730903737, "loss": 1.7035, "num_input_tokens_seen": 16194480, "step": 2678, "train_runtime": 2715.1223, "train_tokens_per_second": 5964.549 }, { "epoch": 0.9853793103448276, "grad_norm": 0.7697952389717102, "learning_rate": 0.00010160132523467698, "loss": 1.8778, "num_input_tokens_seen": 16199648, "step": 2679, "train_runtime": 2715.9948, "train_tokens_per_second": 5964.536 }, { "epoch": 0.9857471264367816, "grad_norm": 0.729809045791626, "learning_rate": 0.00010156451316031659, "loss": 1.5232, "num_input_tokens_seen": 16204992, "step": 2680, "train_runtime": 2716.8803, "train_tokens_per_second": 5964.559 }, { "epoch": 0.9861149425287357, "grad_norm": 0.7619598507881165, "learning_rate": 0.0001015277010859562, "loss": 1.7855, "num_input_tokens_seen": 16211360, "step": 2681, "train_runtime": 2717.9292, "train_tokens_per_second": 5964.6 }, { "epoch": 0.9864827586206897, "grad_norm": 0.7749170064926147, "learning_rate": 0.0001014908890115958, "loss": 1.6563, "num_input_tokens_seen": 16215712, "step": 2682, "train_runtime": 2718.6785, "train_tokens_per_second": 5964.557 }, { "epoch": 0.9868505747126437, "grad_norm": 0.7425233721733093, "learning_rate": 0.00010145407693723541, "loss": 1.7613, "num_input_tokens_seen": 16220592, "step": 2683, "train_runtime": 2719.5123, "train_tokens_per_second": 5964.522 }, { "epoch": 0.9872183908045977, "grad_norm": 0.7368447780609131, "learning_rate": 0.00010141726486287504, "loss": 1.6202, "num_input_tokens_seen": 16228992, "step": 2684, "train_runtime": 2720.8321, "train_tokens_per_second": 5964.716 }, { "epoch": 0.9875862068965517, "grad_norm": 0.7763941287994385, "learning_rate": 0.00010138045278851464, "loss": 1.5027, "num_input_tokens_seen": 16233184, "step": 2685, "train_runtime": 2721.5611, "train_tokens_per_second": 5964.659 }, { "epoch": 0.9879540229885058, "grad_norm": 0.7982324957847595, "learning_rate": 0.00010134364071415425, "loss": 1.7941, "num_input_tokens_seen": 16237728, "step": 2686, "train_runtime": 2722.3496, "train_tokens_per_second": 5964.601 }, { "epoch": 0.9883218390804598, "grad_norm": 0.7863630652427673, "learning_rate": 0.00010130682863979386, "loss": 1.6936, "num_input_tokens_seen": 16243328, "step": 2687, "train_runtime": 2723.2512, "train_tokens_per_second": 5964.682 }, { "epoch": 0.9886896551724138, "grad_norm": 0.8651296496391296, "learning_rate": 0.00010127001656543347, "loss": 1.6675, "num_input_tokens_seen": 16249632, "step": 2688, "train_runtime": 2724.2801, "train_tokens_per_second": 5964.743 }, { "epoch": 0.9890574712643678, "grad_norm": 0.8110333681106567, "learning_rate": 0.00010123320449107308, "loss": 1.6978, "num_input_tokens_seen": 16255552, "step": 2689, "train_runtime": 2725.2265, "train_tokens_per_second": 5964.844 }, { "epoch": 0.9894252873563218, "grad_norm": 0.8143921494483948, "learning_rate": 0.00010119639241671269, "loss": 1.6795, "num_input_tokens_seen": 16260688, "step": 2690, "train_runtime": 2726.1166, "train_tokens_per_second": 5964.781 }, { "epoch": 0.9897931034482759, "grad_norm": 0.7819022536277771, "learning_rate": 0.00010115958034235228, "loss": 1.6987, "num_input_tokens_seen": 16265776, "step": 2691, "train_runtime": 2726.9922, "train_tokens_per_second": 5964.731 }, { "epoch": 0.9901609195402299, "grad_norm": 0.8476383090019226, "learning_rate": 0.00010112276826799189, "loss": 1.8078, "num_input_tokens_seen": 16270096, "step": 2692, "train_runtime": 2727.7609, "train_tokens_per_second": 5964.634 }, { "epoch": 0.9905287356321839, "grad_norm": 0.8257720470428467, "learning_rate": 0.00010108595619363153, "loss": 1.6867, "num_input_tokens_seen": 16276400, "step": 2693, "train_runtime": 2728.7838, "train_tokens_per_second": 5964.709 }, { "epoch": 0.9908965517241379, "grad_norm": 0.8439770936965942, "learning_rate": 0.00010104914411927114, "loss": 1.8791, "num_input_tokens_seen": 16282608, "step": 2694, "train_runtime": 2729.8087, "train_tokens_per_second": 5964.743 }, { "epoch": 0.991264367816092, "grad_norm": 0.8019626140594482, "learning_rate": 0.00010101233204491075, "loss": 1.795, "num_input_tokens_seen": 16288464, "step": 2695, "train_runtime": 2730.7785, "train_tokens_per_second": 5964.769 }, { "epoch": 0.991632183908046, "grad_norm": 0.7709932923316956, "learning_rate": 0.00010097551997055034, "loss": 1.6781, "num_input_tokens_seen": 16293968, "step": 2696, "train_runtime": 2731.6941, "train_tokens_per_second": 5964.785 }, { "epoch": 0.992, "grad_norm": 0.8245759606361389, "learning_rate": 0.00010093870789618995, "loss": 1.8092, "num_input_tokens_seen": 16299040, "step": 2697, "train_runtime": 2732.5401, "train_tokens_per_second": 5964.794 }, { "epoch": 0.992367816091954, "grad_norm": 0.8198642730712891, "learning_rate": 0.00010090189582182956, "loss": 1.8803, "num_input_tokens_seen": 16303984, "step": 2698, "train_runtime": 2733.3877, "train_tokens_per_second": 5964.754 }, { "epoch": 0.992735632183908, "grad_norm": 0.8194162249565125, "learning_rate": 0.00010086508374746917, "loss": 1.6704, "num_input_tokens_seen": 16309616, "step": 2699, "train_runtime": 2734.3186, "train_tokens_per_second": 5964.783 }, { "epoch": 0.993103448275862, "grad_norm": 0.7265117764472961, "learning_rate": 0.00010082827167310878, "loss": 1.633, "num_input_tokens_seen": 16315472, "step": 2700, "train_runtime": 2735.2715, "train_tokens_per_second": 5964.846 }, { "epoch": 0.9934712643678161, "grad_norm": 0.8403815627098083, "learning_rate": 0.00010079145959874839, "loss": 1.6689, "num_input_tokens_seen": 16321440, "step": 2701, "train_runtime": 2736.7195, "train_tokens_per_second": 5963.87 }, { "epoch": 0.9938390804597701, "grad_norm": 0.722404956817627, "learning_rate": 0.00010075464752438801, "loss": 1.6407, "num_input_tokens_seen": 16327072, "step": 2702, "train_runtime": 2737.6809, "train_tokens_per_second": 5963.833 }, { "epoch": 0.9942068965517241, "grad_norm": 0.7589871883392334, "learning_rate": 0.00010071783545002762, "loss": 1.7493, "num_input_tokens_seen": 16332288, "step": 2703, "train_runtime": 2738.5263, "train_tokens_per_second": 5963.897 }, { "epoch": 0.9945747126436781, "grad_norm": 0.707599401473999, "learning_rate": 0.00010068102337566723, "loss": 1.8137, "num_input_tokens_seen": 16337664, "step": 2704, "train_runtime": 2739.43, "train_tokens_per_second": 5963.892 }, { "epoch": 0.9949425287356322, "grad_norm": 0.7044679522514343, "learning_rate": 0.00010064421130130684, "loss": 1.5024, "num_input_tokens_seen": 16347600, "step": 2705, "train_runtime": 2740.9504, "train_tokens_per_second": 5964.209 }, { "epoch": 0.9953103448275862, "grad_norm": 0.7717908620834351, "learning_rate": 0.00010060739922694644, "loss": 1.7201, "num_input_tokens_seen": 16353184, "step": 2706, "train_runtime": 2741.8729, "train_tokens_per_second": 5964.239 }, { "epoch": 0.9956781609195402, "grad_norm": 0.6623258590698242, "learning_rate": 0.00010057058715258605, "loss": 1.714, "num_input_tokens_seen": 16360256, "step": 2707, "train_runtime": 2743.0061, "train_tokens_per_second": 5964.353 }, { "epoch": 0.9960459770114942, "grad_norm": 0.7541612982749939, "learning_rate": 0.00010053377507822566, "loss": 1.7051, "num_input_tokens_seen": 16367104, "step": 2708, "train_runtime": 2744.1124, "train_tokens_per_second": 5964.444 }, { "epoch": 0.9964137931034482, "grad_norm": 0.7169268727302551, "learning_rate": 0.00010049696300386526, "loss": 1.5708, "num_input_tokens_seen": 16372464, "step": 2709, "train_runtime": 2745.0082, "train_tokens_per_second": 5964.45 }, { "epoch": 0.9967816091954023, "grad_norm": 0.822113573551178, "learning_rate": 0.0001004601509295049, "loss": 1.7626, "num_input_tokens_seen": 16377360, "step": 2710, "train_runtime": 2745.8413, "train_tokens_per_second": 5964.423 }, { "epoch": 0.9971494252873563, "grad_norm": 0.807174026966095, "learning_rate": 0.0001004233388551445, "loss": 1.8715, "num_input_tokens_seen": 16383696, "step": 2711, "train_runtime": 2746.8574, "train_tokens_per_second": 5964.524 }, { "epoch": 0.9975172413793103, "grad_norm": 0.7619220018386841, "learning_rate": 0.00010038652678078411, "loss": 1.7394, "num_input_tokens_seen": 16390272, "step": 2712, "train_runtime": 2747.932, "train_tokens_per_second": 5964.584 }, { "epoch": 0.9978850574712643, "grad_norm": 0.7220108509063721, "learning_rate": 0.00010034971470642372, "loss": 1.6763, "num_input_tokens_seen": 16397728, "step": 2713, "train_runtime": 2749.1208, "train_tokens_per_second": 5964.717 }, { "epoch": 0.9982528735632183, "grad_norm": 0.7697573900222778, "learning_rate": 0.00010031290263206332, "loss": 1.8442, "num_input_tokens_seen": 16403408, "step": 2714, "train_runtime": 2750.054, "train_tokens_per_second": 5964.759 }, { "epoch": 0.9986206896551724, "grad_norm": 0.7933111786842346, "learning_rate": 0.00010027609055770292, "loss": 1.7856, "num_input_tokens_seen": 16408192, "step": 2715, "train_runtime": 2750.892, "train_tokens_per_second": 5964.68 }, { "epoch": 0.9989885057471264, "grad_norm": 0.7672939896583557, "learning_rate": 0.00010023927848334253, "loss": 1.541, "num_input_tokens_seen": 16415936, "step": 2716, "train_runtime": 2752.1055, "train_tokens_per_second": 5964.864 }, { "epoch": 0.9993563218390804, "grad_norm": 0.7983112931251526, "learning_rate": 0.00010020246640898214, "loss": 1.8038, "num_input_tokens_seen": 16421248, "step": 2717, "train_runtime": 2752.9986, "train_tokens_per_second": 5964.859 }, { "epoch": 0.9997241379310344, "grad_norm": 0.7845472097396851, "learning_rate": 0.00010016565433462175, "loss": 1.6246, "num_input_tokens_seen": 16426000, "step": 2718, "train_runtime": 2753.821, "train_tokens_per_second": 5964.803 }, { "epoch": 1.0, "grad_norm": 0.9094229936599731, "learning_rate": 0.00010012884226026137, "loss": 1.7112, "num_input_tokens_seen": 16430656, "step": 2719, "train_runtime": 2754.5881, "train_tokens_per_second": 5964.832 }, { "epoch": 1.000367816091954, "grad_norm": 0.7175472974777222, "learning_rate": 0.00010009203018590098, "loss": 1.5703, "num_input_tokens_seen": 16437632, "step": 2720, "train_runtime": 2755.7046, "train_tokens_per_second": 5964.947 }, { "epoch": 1.000367816091954, "eval_loss": 1.7600165605545044, "eval_runtime": 4.7813, "eval_samples_per_second": 209.149, "eval_steps_per_second": 13.176, "num_input_tokens_seen": 16437632, "step": 2720 }, { "epoch": 1.000735632183908, "grad_norm": 0.7592592239379883, "learning_rate": 0.00010005521811154059, "loss": 1.4792, "num_input_tokens_seen": 16442400, "step": 2721, "train_runtime": 2761.2886, "train_tokens_per_second": 5954.611 }, { "epoch": 1.001103448275862, "grad_norm": 0.7093924283981323, "learning_rate": 0.0001000184060371802, "loss": 1.3225, "num_input_tokens_seen": 16447312, "step": 2722, "train_runtime": 2762.1416, "train_tokens_per_second": 5954.551 }, { "epoch": 1.001471264367816, "grad_norm": 0.7133712768554688, "learning_rate": 9.998159396281981e-05, "loss": 1.5349, "num_input_tokens_seen": 16452720, "step": 2723, "train_runtime": 2763.0534, "train_tokens_per_second": 5954.543 }, { "epoch": 1.00183908045977, "grad_norm": 0.7522051334381104, "learning_rate": 9.994478188845942e-05, "loss": 1.7682, "num_input_tokens_seen": 16457680, "step": 2724, "train_runtime": 2763.9061, "train_tokens_per_second": 5954.5 }, { "epoch": 1.0022068965517241, "grad_norm": 0.7381378412246704, "learning_rate": 9.990796981409904e-05, "loss": 1.6991, "num_input_tokens_seen": 16462784, "step": 2725, "train_runtime": 2764.7715, "train_tokens_per_second": 5954.483 }, { "epoch": 1.0025747126436781, "grad_norm": 0.7333172559738159, "learning_rate": 9.987115773973864e-05, "loss": 1.6771, "num_input_tokens_seen": 16468544, "step": 2726, "train_runtime": 2765.7272, "train_tokens_per_second": 5954.508 }, { "epoch": 1.0029425287356322, "grad_norm": 0.8070797920227051, "learning_rate": 9.983434566537824e-05, "loss": 1.5182, "num_input_tokens_seen": 16474976, "step": 2727, "train_runtime": 2766.7678, "train_tokens_per_second": 5954.593 }, { "epoch": 1.0033103448275862, "grad_norm": 0.6627984642982483, "learning_rate": 9.979753359101785e-05, "loss": 1.6668, "num_input_tokens_seen": 16481488, "step": 2728, "train_runtime": 2767.8205, "train_tokens_per_second": 5954.681 }, { "epoch": 1.0036781609195402, "grad_norm": 0.7076670527458191, "learning_rate": 9.976072151665748e-05, "loss": 1.5113, "num_input_tokens_seen": 16486960, "step": 2729, "train_runtime": 2768.7357, "train_tokens_per_second": 5954.689 }, { "epoch": 1.0040459770114942, "grad_norm": 0.7460461854934692, "learning_rate": 9.972390944229709e-05, "loss": 1.5207, "num_input_tokens_seen": 16494864, "step": 2730, "train_runtime": 2769.9809, "train_tokens_per_second": 5954.866 }, { "epoch": 1.0044137931034482, "grad_norm": 0.7616891264915466, "learning_rate": 9.96870973679367e-05, "loss": 1.5562, "num_input_tokens_seen": 16501632, "step": 2731, "train_runtime": 2771.5263, "train_tokens_per_second": 5953.987 }, { "epoch": 1.0047816091954023, "grad_norm": 0.7592271566390991, "learning_rate": 9.965028529357629e-05, "loss": 1.5601, "num_input_tokens_seen": 16506176, "step": 2732, "train_runtime": 2772.3117, "train_tokens_per_second": 5953.939 }, { "epoch": 1.0051494252873563, "grad_norm": 0.9049879908561707, "learning_rate": 9.96134732192159e-05, "loss": 1.757, "num_input_tokens_seen": 16510160, "step": 2733, "train_runtime": 2773.0059, "train_tokens_per_second": 5953.886 }, { "epoch": 1.0055172413793103, "grad_norm": 0.6635333895683289, "learning_rate": 9.957666114485552e-05, "loss": 1.5871, "num_input_tokens_seen": 16518736, "step": 2734, "train_runtime": 2774.3349, "train_tokens_per_second": 5954.125 }, { "epoch": 1.0058850574712643, "grad_norm": 0.861168622970581, "learning_rate": 9.953984907049513e-05, "loss": 1.7289, "num_input_tokens_seen": 16526848, "step": 2735, "train_runtime": 2775.622, "train_tokens_per_second": 5954.286 }, { "epoch": 1.0062528735632184, "grad_norm": 0.8384279012680054, "learning_rate": 9.950303699613474e-05, "loss": 1.4379, "num_input_tokens_seen": 16533408, "step": 2736, "train_runtime": 2776.6356, "train_tokens_per_second": 5954.475 }, { "epoch": 1.0066206896551724, "grad_norm": 0.7553403377532959, "learning_rate": 9.946622492177435e-05, "loss": 1.4498, "num_input_tokens_seen": 16539104, "step": 2737, "train_runtime": 2777.5735, "train_tokens_per_second": 5954.515 }, { "epoch": 1.0069885057471264, "grad_norm": 0.7888177633285522, "learning_rate": 9.942941284741396e-05, "loss": 1.6728, "num_input_tokens_seen": 16544336, "step": 2738, "train_runtime": 2778.4599, "train_tokens_per_second": 5954.499 }, { "epoch": 1.0073563218390804, "grad_norm": 0.7468155026435852, "learning_rate": 9.939260077305357e-05, "loss": 1.577, "num_input_tokens_seen": 16551264, "step": 2739, "train_runtime": 2779.5735, "train_tokens_per_second": 5954.606 }, { "epoch": 1.0077241379310344, "grad_norm": 0.742401659488678, "learning_rate": 9.935578869869317e-05, "loss": 1.5609, "num_input_tokens_seen": 16556080, "step": 2740, "train_runtime": 2780.406, "train_tokens_per_second": 5954.555 }, { "epoch": 1.0080919540229885, "grad_norm": 0.7920041084289551, "learning_rate": 9.931897662433278e-05, "loss": 1.4845, "num_input_tokens_seen": 16561616, "step": 2741, "train_runtime": 2781.3246, "train_tokens_per_second": 5954.579 }, { "epoch": 1.0084597701149425, "grad_norm": 0.8238051533699036, "learning_rate": 9.92821645499724e-05, "loss": 1.7318, "num_input_tokens_seen": 16566832, "step": 2742, "train_runtime": 2782.1996, "train_tokens_per_second": 5954.581 }, { "epoch": 1.0088275862068965, "grad_norm": 0.7177878618240356, "learning_rate": 9.924535247561201e-05, "loss": 1.5797, "num_input_tokens_seen": 16574032, "step": 2743, "train_runtime": 2783.3606, "train_tokens_per_second": 5954.684 }, { "epoch": 1.0091954022988505, "grad_norm": 0.7707662582397461, "learning_rate": 9.920854040125161e-05, "loss": 1.4792, "num_input_tokens_seen": 16582032, "step": 2744, "train_runtime": 2784.6296, "train_tokens_per_second": 5954.843 }, { "epoch": 1.0095632183908045, "grad_norm": 0.7912094593048096, "learning_rate": 9.917172832689122e-05, "loss": 1.7512, "num_input_tokens_seen": 16588464, "step": 2745, "train_runtime": 2785.6728, "train_tokens_per_second": 5954.922 }, { "epoch": 1.0099310344827586, "grad_norm": 0.7886949181556702, "learning_rate": 9.913491625253083e-05, "loss": 1.4886, "num_input_tokens_seen": 16594384, "step": 2746, "train_runtime": 2786.6532, "train_tokens_per_second": 5954.951 }, { "epoch": 1.0102988505747126, "grad_norm": 0.8673503994941711, "learning_rate": 9.909810417817045e-05, "loss": 1.4369, "num_input_tokens_seen": 16602416, "step": 2747, "train_runtime": 2787.922, "train_tokens_per_second": 5955.122 }, { "epoch": 1.0106666666666666, "grad_norm": 0.7904326915740967, "learning_rate": 9.906129210381006e-05, "loss": 1.5817, "num_input_tokens_seen": 16607776, "step": 2748, "train_runtime": 2788.8198, "train_tokens_per_second": 5955.127 }, { "epoch": 1.0110344827586206, "grad_norm": 0.781034529209137, "learning_rate": 9.902448002944967e-05, "loss": 1.5774, "num_input_tokens_seen": 16613664, "step": 2749, "train_runtime": 2789.804, "train_tokens_per_second": 5955.137 }, { "epoch": 1.0114022988505746, "grad_norm": 0.7959015369415283, "learning_rate": 9.898766795508926e-05, "loss": 1.4133, "num_input_tokens_seen": 16619056, "step": 2750, "train_runtime": 2790.7211, "train_tokens_per_second": 5955.112 }, { "epoch": 1.0117701149425287, "grad_norm": 0.7907975912094116, "learning_rate": 9.895085588072889e-05, "loss": 1.4479, "num_input_tokens_seen": 16627856, "step": 2751, "train_runtime": 2792.1191, "train_tokens_per_second": 5955.282 }, { "epoch": 1.0121379310344827, "grad_norm": 0.7597295641899109, "learning_rate": 9.89140438063685e-05, "loss": 1.4861, "num_input_tokens_seen": 16633824, "step": 2752, "train_runtime": 2793.1065, "train_tokens_per_second": 5955.313 }, { "epoch": 1.0125057471264367, "grad_norm": 0.7649272680282593, "learning_rate": 9.88772317320081e-05, "loss": 1.5986, "num_input_tokens_seen": 16638640, "step": 2753, "train_runtime": 2793.9267, "train_tokens_per_second": 5955.289 }, { "epoch": 1.0128735632183907, "grad_norm": 0.8077549934387207, "learning_rate": 9.884041965764771e-05, "loss": 1.4154, "num_input_tokens_seen": 16644992, "step": 2754, "train_runtime": 2794.9765, "train_tokens_per_second": 5955.324 }, { "epoch": 1.0132413793103447, "grad_norm": 0.8183664679527283, "learning_rate": 9.880360758328732e-05, "loss": 1.6345, "num_input_tokens_seen": 16650480, "step": 2755, "train_runtime": 2795.8847, "train_tokens_per_second": 5955.353 }, { "epoch": 1.0136091954022988, "grad_norm": 0.7877675890922546, "learning_rate": 9.876679550892693e-05, "loss": 1.5115, "num_input_tokens_seen": 16655632, "step": 2756, "train_runtime": 2796.7472, "train_tokens_per_second": 5955.359 }, { "epoch": 1.0139770114942528, "grad_norm": 0.7440232038497925, "learning_rate": 9.872998343456654e-05, "loss": 1.399, "num_input_tokens_seen": 16661456, "step": 2757, "train_runtime": 2797.6978, "train_tokens_per_second": 5955.417 }, { "epoch": 1.0143448275862068, "grad_norm": 0.80223548412323, "learning_rate": 9.869317136020615e-05, "loss": 1.558, "num_input_tokens_seen": 16665968, "step": 2758, "train_runtime": 2798.5093, "train_tokens_per_second": 5955.302 }, { "epoch": 1.0147126436781608, "grad_norm": 0.8115981817245483, "learning_rate": 9.865635928584577e-05, "loss": 1.7045, "num_input_tokens_seen": 16671952, "step": 2759, "train_runtime": 2799.4807, "train_tokens_per_second": 5955.373 }, { "epoch": 1.0150804597701149, "grad_norm": 0.8773238062858582, "learning_rate": 9.861954721148538e-05, "loss": 1.437, "num_input_tokens_seen": 16676896, "step": 2760, "train_runtime": 2800.314, "train_tokens_per_second": 5955.366 }, { "epoch": 1.0154482758620689, "grad_norm": 0.7974623441696167, "learning_rate": 9.858273513712499e-05, "loss": 1.6022, "num_input_tokens_seen": 16682224, "step": 2761, "train_runtime": 2801.7062, "train_tokens_per_second": 5954.309 }, { "epoch": 1.015816091954023, "grad_norm": 0.8365609645843506, "learning_rate": 9.854592306276458e-05, "loss": 1.7147, "num_input_tokens_seen": 16688048, "step": 2762, "train_runtime": 2802.6632, "train_tokens_per_second": 5954.354 }, { "epoch": 1.016183908045977, "grad_norm": 0.8881251811981201, "learning_rate": 9.850911098840419e-05, "loss": 1.5766, "num_input_tokens_seen": 16696640, "step": 2763, "train_runtime": 2804.0071, "train_tokens_per_second": 5954.564 }, { "epoch": 1.016551724137931, "grad_norm": 0.806018590927124, "learning_rate": 9.847229891404381e-05, "loss": 1.5516, "num_input_tokens_seen": 16701648, "step": 2764, "train_runtime": 2804.871, "train_tokens_per_second": 5954.516 }, { "epoch": 1.016919540229885, "grad_norm": 0.8690130710601807, "learning_rate": 9.843548683968342e-05, "loss": 1.5414, "num_input_tokens_seen": 16709984, "step": 2765, "train_runtime": 2806.2028, "train_tokens_per_second": 5954.66 }, { "epoch": 1.017287356321839, "grad_norm": 0.844491720199585, "learning_rate": 9.839867476532303e-05, "loss": 1.6738, "num_input_tokens_seen": 16715616, "step": 2766, "train_runtime": 2807.1099, "train_tokens_per_second": 5954.742 }, { "epoch": 1.017655172413793, "grad_norm": 0.8478877544403076, "learning_rate": 9.836186269096264e-05, "loss": 1.5235, "num_input_tokens_seen": 16721456, "step": 2767, "train_runtime": 2808.0622, "train_tokens_per_second": 5954.803 }, { "epoch": 1.018022988505747, "grad_norm": 0.7275803685188293, "learning_rate": 9.832505061660225e-05, "loss": 1.3195, "num_input_tokens_seen": 16730800, "step": 2768, "train_runtime": 2809.4963, "train_tokens_per_second": 5955.089 }, { "epoch": 1.018390804597701, "grad_norm": 0.7914295196533203, "learning_rate": 9.828823854224186e-05, "loss": 1.4319, "num_input_tokens_seen": 16736528, "step": 2769, "train_runtime": 2810.4284, "train_tokens_per_second": 5955.152 }, { "epoch": 1.0187586206896553, "grad_norm": 0.8010337948799133, "learning_rate": 9.825142646788147e-05, "loss": 1.7588, "num_input_tokens_seen": 16741472, "step": 2770, "train_runtime": 2811.2736, "train_tokens_per_second": 5955.12 }, { "epoch": 1.0191264367816093, "grad_norm": 0.8199329376220703, "learning_rate": 9.821461439352108e-05, "loss": 1.5805, "num_input_tokens_seen": 16746400, "step": 2771, "train_runtime": 2812.0898, "train_tokens_per_second": 5955.144 }, { "epoch": 1.0194942528735633, "grad_norm": 0.8445271253585815, "learning_rate": 9.81778023191607e-05, "loss": 1.6346, "num_input_tokens_seen": 16751408, "step": 2772, "train_runtime": 2812.9284, "train_tokens_per_second": 5955.149 }, { "epoch": 1.0198620689655173, "grad_norm": 0.7820270657539368, "learning_rate": 9.814099024480031e-05, "loss": 1.5438, "num_input_tokens_seen": 16758688, "step": 2773, "train_runtime": 2814.1051, "train_tokens_per_second": 5955.246 }, { "epoch": 1.0202298850574714, "grad_norm": 0.9145992398262024, "learning_rate": 9.81041781704399e-05, "loss": 1.5735, "num_input_tokens_seen": 16764672, "step": 2774, "train_runtime": 2815.0655, "train_tokens_per_second": 5955.34 }, { "epoch": 1.0205977011494254, "grad_norm": 0.8045191168785095, "learning_rate": 9.806736609607951e-05, "loss": 1.4078, "num_input_tokens_seen": 16770976, "step": 2775, "train_runtime": 2816.0972, "train_tokens_per_second": 5955.397 }, { "epoch": 1.0209655172413794, "grad_norm": 0.7787489891052246, "learning_rate": 9.803055402171912e-05, "loss": 1.5356, "num_input_tokens_seen": 16775568, "step": 2776, "train_runtime": 2816.8934, "train_tokens_per_second": 5955.344 }, { "epoch": 1.0213333333333334, "grad_norm": 0.8159419298171997, "learning_rate": 9.799374194735874e-05, "loss": 1.5622, "num_input_tokens_seen": 16781136, "step": 2777, "train_runtime": 2817.8314, "train_tokens_per_second": 5955.337 }, { "epoch": 1.0217011494252874, "grad_norm": 0.8529191017150879, "learning_rate": 9.795692987299835e-05, "loss": 1.6036, "num_input_tokens_seen": 16786640, "step": 2778, "train_runtime": 2818.751, "train_tokens_per_second": 5955.347 }, { "epoch": 1.0220689655172415, "grad_norm": 0.8145338296890259, "learning_rate": 9.792011779863796e-05, "loss": 1.553, "num_input_tokens_seen": 16796224, "step": 2779, "train_runtime": 2820.2285, "train_tokens_per_second": 5955.625 }, { "epoch": 1.0224367816091955, "grad_norm": 0.7739707827568054, "learning_rate": 9.788330572427756e-05, "loss": 1.521, "num_input_tokens_seen": 16804816, "step": 2780, "train_runtime": 2821.5699, "train_tokens_per_second": 5955.839 }, { "epoch": 1.0228045977011495, "grad_norm": 0.7659571766853333, "learning_rate": 9.784649364991718e-05, "loss": 1.5963, "num_input_tokens_seen": 16809664, "step": 2781, "train_runtime": 2822.4229, "train_tokens_per_second": 5955.757 }, { "epoch": 1.0231724137931035, "grad_norm": 0.8444596529006958, "learning_rate": 9.780968157555679e-05, "loss": 1.5421, "num_input_tokens_seen": 16817488, "step": 2782, "train_runtime": 2823.6528, "train_tokens_per_second": 5955.933 }, { "epoch": 1.0235402298850576, "grad_norm": 0.8246302008628845, "learning_rate": 9.77728695011964e-05, "loss": 1.6177, "num_input_tokens_seen": 16822448, "step": 2783, "train_runtime": 2824.4988, "train_tokens_per_second": 5955.906 }, { "epoch": 1.0239080459770116, "grad_norm": 0.8348226547241211, "learning_rate": 9.7736057426836e-05, "loss": 1.5066, "num_input_tokens_seen": 16829920, "step": 2784, "train_runtime": 2825.6601, "train_tokens_per_second": 5956.102 }, { "epoch": 1.0242758620689656, "grad_norm": 0.8438899517059326, "learning_rate": 9.769924535247561e-05, "loss": 1.857, "num_input_tokens_seen": 16834944, "step": 2785, "train_runtime": 2826.5049, "train_tokens_per_second": 5956.099 }, { "epoch": 1.0246436781609196, "grad_norm": 0.8158878684043884, "learning_rate": 9.766243327811522e-05, "loss": 1.4434, "num_input_tokens_seen": 16841456, "step": 2786, "train_runtime": 2827.5602, "train_tokens_per_second": 5956.179 }, { "epoch": 1.0250114942528736, "grad_norm": 0.8251202702522278, "learning_rate": 9.762562120375483e-05, "loss": 1.4535, "num_input_tokens_seen": 16847216, "step": 2787, "train_runtime": 2828.521, "train_tokens_per_second": 5956.193 }, { "epoch": 1.0253793103448277, "grad_norm": 0.8166171312332153, "learning_rate": 9.758880912939444e-05, "loss": 1.4599, "num_input_tokens_seen": 16854144, "step": 2788, "train_runtime": 2829.6483, "train_tokens_per_second": 5956.268 }, { "epoch": 1.0257471264367817, "grad_norm": 0.876890242099762, "learning_rate": 9.755199705503406e-05, "loss": 1.4787, "num_input_tokens_seen": 16860768, "step": 2789, "train_runtime": 2830.7132, "train_tokens_per_second": 5956.367 }, { "epoch": 1.0261149425287357, "grad_norm": 0.862595796585083, "learning_rate": 9.751518498067367e-05, "loss": 1.5332, "num_input_tokens_seen": 16866464, "step": 2790, "train_runtime": 2831.6595, "train_tokens_per_second": 5956.388 }, { "epoch": 1.0264827586206897, "grad_norm": 0.8052806854248047, "learning_rate": 9.747837290631328e-05, "loss": 1.6768, "num_input_tokens_seen": 16875152, "step": 2791, "train_runtime": 2833.528, "train_tokens_per_second": 5955.527 }, { "epoch": 1.0268505747126437, "grad_norm": 0.8036222457885742, "learning_rate": 9.744156083195288e-05, "loss": 1.5281, "num_input_tokens_seen": 16880832, "step": 2792, "train_runtime": 2834.4577, "train_tokens_per_second": 5955.577 }, { "epoch": 1.0272183908045978, "grad_norm": 0.861149251461029, "learning_rate": 9.740474875759249e-05, "loss": 1.4774, "num_input_tokens_seen": 16886592, "step": 2793, "train_runtime": 2835.4058, "train_tokens_per_second": 5955.617 }, { "epoch": 1.0275862068965518, "grad_norm": 0.8284410834312439, "learning_rate": 9.736793668323211e-05, "loss": 1.4271, "num_input_tokens_seen": 16892400, "step": 2794, "train_runtime": 2836.3829, "train_tokens_per_second": 5955.613 }, { "epoch": 1.0279540229885058, "grad_norm": 0.9155176281929016, "learning_rate": 9.733112460887172e-05, "loss": 1.4165, "num_input_tokens_seen": 16897248, "step": 2795, "train_runtime": 2837.2065, "train_tokens_per_second": 5955.593 }, { "epoch": 1.0283218390804598, "grad_norm": 0.7975917458534241, "learning_rate": 9.729431253451133e-05, "loss": 1.5142, "num_input_tokens_seen": 16902688, "step": 2796, "train_runtime": 2838.1301, "train_tokens_per_second": 5955.572 }, { "epoch": 1.0286896551724138, "grad_norm": 0.7927860021591187, "learning_rate": 9.725750046015094e-05, "loss": 1.5657, "num_input_tokens_seen": 16907584, "step": 2797, "train_runtime": 2838.9722, "train_tokens_per_second": 5955.53 }, { "epoch": 1.0290574712643679, "grad_norm": 0.7859172821044922, "learning_rate": 9.722068838579054e-05, "loss": 1.4793, "num_input_tokens_seen": 16912688, "step": 2798, "train_runtime": 2839.8292, "train_tokens_per_second": 5955.53 }, { "epoch": 1.0294252873563219, "grad_norm": 0.8089045882225037, "learning_rate": 9.718387631143015e-05, "loss": 1.5247, "num_input_tokens_seen": 16917424, "step": 2799, "train_runtime": 2840.6313, "train_tokens_per_second": 5955.516 }, { "epoch": 1.029793103448276, "grad_norm": 0.8845566511154175, "learning_rate": 9.714706423706976e-05, "loss": 1.638, "num_input_tokens_seen": 16921696, "step": 2800, "train_runtime": 2841.3995, "train_tokens_per_second": 5955.409 }, { "epoch": 1.03016091954023, "grad_norm": 0.8561909198760986, "learning_rate": 9.711025216270937e-05, "loss": 1.4762, "num_input_tokens_seen": 16927200, "step": 2801, "train_runtime": 2842.3262, "train_tokens_per_second": 5955.404 }, { "epoch": 1.030528735632184, "grad_norm": 0.7746861577033997, "learning_rate": 9.707344008834899e-05, "loss": 1.4286, "num_input_tokens_seen": 16932768, "step": 2802, "train_runtime": 2843.2704, "train_tokens_per_second": 5955.384 }, { "epoch": 1.030896551724138, "grad_norm": 0.8497796654701233, "learning_rate": 9.70366280139886e-05, "loss": 1.5589, "num_input_tokens_seen": 16937504, "step": 2803, "train_runtime": 2844.0978, "train_tokens_per_second": 5955.317 }, { "epoch": 1.031264367816092, "grad_norm": 0.8362786173820496, "learning_rate": 9.69998159396282e-05, "loss": 1.549, "num_input_tokens_seen": 16942912, "step": 2804, "train_runtime": 2844.9903, "train_tokens_per_second": 5955.35 }, { "epoch": 1.031632183908046, "grad_norm": 0.7372013926506042, "learning_rate": 9.69630038652678e-05, "loss": 1.2505, "num_input_tokens_seen": 16949232, "step": 2805, "train_runtime": 2846.034, "train_tokens_per_second": 5955.386 }, { "epoch": 1.032, "grad_norm": 0.7864677309989929, "learning_rate": 9.692619179090742e-05, "loss": 1.6084, "num_input_tokens_seen": 16955424, "step": 2806, "train_runtime": 2847.0722, "train_tokens_per_second": 5955.39 }, { "epoch": 1.032367816091954, "grad_norm": 0.7990848422050476, "learning_rate": 9.688937971654704e-05, "loss": 1.6506, "num_input_tokens_seen": 16960784, "step": 2807, "train_runtime": 2847.9678, "train_tokens_per_second": 5955.399 }, { "epoch": 1.032735632183908, "grad_norm": 0.8113677501678467, "learning_rate": 9.685256764218665e-05, "loss": 1.468, "num_input_tokens_seen": 16965648, "step": 2808, "train_runtime": 2848.7954, "train_tokens_per_second": 5955.376 }, { "epoch": 1.033103448275862, "grad_norm": 0.77545166015625, "learning_rate": 9.681575556782626e-05, "loss": 1.5406, "num_input_tokens_seen": 16971888, "step": 2809, "train_runtime": 2849.8163, "train_tokens_per_second": 5955.432 }, { "epoch": 1.0334712643678161, "grad_norm": 0.8232600092887878, "learning_rate": 9.677894349346585e-05, "loss": 1.5528, "num_input_tokens_seen": 16976560, "step": 2810, "train_runtime": 2850.6087, "train_tokens_per_second": 5955.416 }, { "epoch": 1.0338390804597701, "grad_norm": 0.8698176741600037, "learning_rate": 9.674213141910547e-05, "loss": 1.4138, "num_input_tokens_seen": 16984000, "step": 2811, "train_runtime": 2851.7782, "train_tokens_per_second": 5955.582 }, { "epoch": 1.0342068965517242, "grad_norm": 0.8614294528961182, "learning_rate": 9.670531934474508e-05, "loss": 1.4312, "num_input_tokens_seen": 16990272, "step": 2812, "train_runtime": 2852.8114, "train_tokens_per_second": 5955.624 }, { "epoch": 1.0345747126436782, "grad_norm": 0.761712908744812, "learning_rate": 9.666850727038469e-05, "loss": 1.4403, "num_input_tokens_seen": 16996192, "step": 2813, "train_runtime": 2853.8121, "train_tokens_per_second": 5955.61 }, { "epoch": 1.0349425287356322, "grad_norm": 0.8359882235527039, "learning_rate": 9.66316951960243e-05, "loss": 1.5269, "num_input_tokens_seen": 17002048, "step": 2814, "train_runtime": 2854.7539, "train_tokens_per_second": 5955.697 }, { "epoch": 1.0353103448275862, "grad_norm": 0.8140478730201721, "learning_rate": 9.659488312166391e-05, "loss": 1.6261, "num_input_tokens_seen": 17007600, "step": 2815, "train_runtime": 2855.6544, "train_tokens_per_second": 5955.763 }, { "epoch": 1.0356781609195402, "grad_norm": 0.8218773007392883, "learning_rate": 9.655807104730352e-05, "loss": 1.4684, "num_input_tokens_seen": 17012032, "step": 2816, "train_runtime": 2856.4374, "train_tokens_per_second": 5955.682 }, { "epoch": 1.0360459770114943, "grad_norm": 0.8206890821456909, "learning_rate": 9.652125897294313e-05, "loss": 1.3783, "num_input_tokens_seen": 17017472, "step": 2817, "train_runtime": 2857.3232, "train_tokens_per_second": 5955.739 }, { "epoch": 1.0364137931034483, "grad_norm": 0.8729467391967773, "learning_rate": 9.648444689858274e-05, "loss": 1.4988, "num_input_tokens_seen": 17022176, "step": 2818, "train_runtime": 2858.1348, "train_tokens_per_second": 5955.694 }, { "epoch": 1.0367816091954023, "grad_norm": 0.8075752854347229, "learning_rate": 9.644763482422236e-05, "loss": 1.4539, "num_input_tokens_seen": 17028976, "step": 2819, "train_runtime": 2859.2197, "train_tokens_per_second": 5955.812 }, { "epoch": 1.0371494252873563, "grad_norm": 0.8630228042602539, "learning_rate": 9.641082274986197e-05, "loss": 1.4982, "num_input_tokens_seen": 17033536, "step": 2820, "train_runtime": 2860.0137, "train_tokens_per_second": 5955.753 }, { "epoch": 1.0375172413793103, "grad_norm": 0.7630841135978699, "learning_rate": 9.637401067550158e-05, "loss": 1.4693, "num_input_tokens_seen": 17040048, "step": 2821, "train_runtime": 2861.607, "train_tokens_per_second": 5954.713 }, { "epoch": 1.0378850574712644, "grad_norm": 0.7785623073577881, "learning_rate": 9.633719860114117e-05, "loss": 1.4758, "num_input_tokens_seen": 17046880, "step": 2822, "train_runtime": 2862.6959, "train_tokens_per_second": 5954.834 }, { "epoch": 1.0382528735632184, "grad_norm": 0.8043609261512756, "learning_rate": 9.630038652678078e-05, "loss": 1.3458, "num_input_tokens_seen": 17053120, "step": 2823, "train_runtime": 2863.7178, "train_tokens_per_second": 5954.888 }, { "epoch": 1.0386206896551724, "grad_norm": 0.8712300658226013, "learning_rate": 9.62635744524204e-05, "loss": 1.7833, "num_input_tokens_seen": 17057648, "step": 2824, "train_runtime": 2864.5106, "train_tokens_per_second": 5954.821 }, { "epoch": 1.0389885057471264, "grad_norm": 0.8355077505111694, "learning_rate": 9.622676237806001e-05, "loss": 1.7278, "num_input_tokens_seen": 17063216, "step": 2825, "train_runtime": 2865.4378, "train_tokens_per_second": 5954.837 }, { "epoch": 1.0393563218390804, "grad_norm": 0.9312095642089844, "learning_rate": 9.618995030369962e-05, "loss": 1.5908, "num_input_tokens_seen": 17068368, "step": 2826, "train_runtime": 2866.3264, "train_tokens_per_second": 5954.789 }, { "epoch": 1.0397241379310345, "grad_norm": 0.8750326037406921, "learning_rate": 9.615313822933923e-05, "loss": 1.6228, "num_input_tokens_seen": 17073504, "step": 2827, "train_runtime": 2867.2072, "train_tokens_per_second": 5954.751 }, { "epoch": 1.0400919540229885, "grad_norm": 0.8155689239501953, "learning_rate": 9.611632615497884e-05, "loss": 1.4413, "num_input_tokens_seen": 17078464, "step": 2828, "train_runtime": 2868.0506, "train_tokens_per_second": 5954.729 }, { "epoch": 1.0404597701149425, "grad_norm": 0.792161226272583, "learning_rate": 9.607951408061845e-05, "loss": 1.3346, "num_input_tokens_seen": 17090560, "step": 2829, "train_runtime": 2869.8605, "train_tokens_per_second": 5955.189 }, { "epoch": 1.0408275862068965, "grad_norm": 0.849923312664032, "learning_rate": 9.604270200625806e-05, "loss": 1.4588, "num_input_tokens_seen": 17096224, "step": 2830, "train_runtime": 2870.8349, "train_tokens_per_second": 5955.14 }, { "epoch": 1.0411954022988505, "grad_norm": 0.8782142996788025, "learning_rate": 9.600588993189766e-05, "loss": 1.7419, "num_input_tokens_seen": 17101136, "step": 2831, "train_runtime": 2871.6836, "train_tokens_per_second": 5955.091 }, { "epoch": 1.0415632183908046, "grad_norm": 0.8202374577522278, "learning_rate": 9.596907785753729e-05, "loss": 1.3939, "num_input_tokens_seen": 17107552, "step": 2832, "train_runtime": 2872.706, "train_tokens_per_second": 5955.205 }, { "epoch": 1.0419310344827586, "grad_norm": 0.8336490988731384, "learning_rate": 9.593226578317688e-05, "loss": 1.4311, "num_input_tokens_seen": 17114784, "step": 2833, "train_runtime": 2873.8802, "train_tokens_per_second": 5955.288 }, { "epoch": 1.0422988505747126, "grad_norm": 0.8728829026222229, "learning_rate": 9.589545370881649e-05, "loss": 1.4398, "num_input_tokens_seen": 17124224, "step": 2834, "train_runtime": 2875.3225, "train_tokens_per_second": 5955.584 }, { "epoch": 1.0426666666666666, "grad_norm": 0.8830198645591736, "learning_rate": 9.58586416344561e-05, "loss": 1.5632, "num_input_tokens_seen": 17129952, "step": 2835, "train_runtime": 2876.2527, "train_tokens_per_second": 5955.649 }, { "epoch": 1.0430344827586207, "grad_norm": 0.7761485576629639, "learning_rate": 9.582182956009571e-05, "loss": 1.3605, "num_input_tokens_seen": 17136592, "step": 2836, "train_runtime": 2877.3129, "train_tokens_per_second": 5955.762 }, { "epoch": 1.0434022988505747, "grad_norm": 0.8355804681777954, "learning_rate": 9.578501748573533e-05, "loss": 1.4303, "num_input_tokens_seen": 17142304, "step": 2837, "train_runtime": 2878.2516, "train_tokens_per_second": 5955.805 }, { "epoch": 1.0437701149425287, "grad_norm": 0.8488525152206421, "learning_rate": 9.574820541137494e-05, "loss": 1.3209, "num_input_tokens_seen": 17147136, "step": 2838, "train_runtime": 2879.086, "train_tokens_per_second": 5955.757 }, { "epoch": 1.0441379310344827, "grad_norm": 0.8953168988227844, "learning_rate": 9.571139333701455e-05, "loss": 1.4773, "num_input_tokens_seen": 17151696, "step": 2839, "train_runtime": 2879.9045, "train_tokens_per_second": 5955.648 }, { "epoch": 1.0445057471264367, "grad_norm": 0.8682263493537903, "learning_rate": 9.567458126265414e-05, "loss": 1.4159, "num_input_tokens_seen": 17157712, "step": 2840, "train_runtime": 2880.8785, "train_tokens_per_second": 5955.722 }, { "epoch": 1.0448735632183908, "grad_norm": 0.8365000486373901, "learning_rate": 9.563776918829377e-05, "loss": 1.5616, "num_input_tokens_seen": 17163152, "step": 2841, "train_runtime": 2881.8234, "train_tokens_per_second": 5955.657 }, { "epoch": 1.0452413793103448, "grad_norm": 0.8236533403396606, "learning_rate": 9.560095711393338e-05, "loss": 1.5376, "num_input_tokens_seen": 17169200, "step": 2842, "train_runtime": 2882.8304, "train_tokens_per_second": 5955.675 }, { "epoch": 1.0456091954022988, "grad_norm": 0.7440382242202759, "learning_rate": 9.556414503957298e-05, "loss": 1.3429, "num_input_tokens_seen": 17178672, "step": 2843, "train_runtime": 2884.2655, "train_tokens_per_second": 5955.995 }, { "epoch": 1.0459770114942528, "grad_norm": 0.748589038848877, "learning_rate": 9.55273329652126e-05, "loss": 1.3318, "num_input_tokens_seen": 17189872, "step": 2844, "train_runtime": 2885.9277, "train_tokens_per_second": 5956.446 }, { "epoch": 1.0463448275862068, "grad_norm": 0.8263586163520813, "learning_rate": 9.54905208908522e-05, "loss": 1.6037, "num_input_tokens_seen": 17195408, "step": 2845, "train_runtime": 2886.8414, "train_tokens_per_second": 5956.478 }, { "epoch": 1.0467126436781609, "grad_norm": 0.9101609587669373, "learning_rate": 9.545370881649181e-05, "loss": 1.6731, "num_input_tokens_seen": 17201008, "step": 2846, "train_runtime": 2887.7672, "train_tokens_per_second": 5956.508 }, { "epoch": 1.0470804597701149, "grad_norm": 0.70653235912323, "learning_rate": 9.541689674213142e-05, "loss": 1.3396, "num_input_tokens_seen": 17207680, "step": 2847, "train_runtime": 2888.8462, "train_tokens_per_second": 5956.593 }, { "epoch": 1.047448275862069, "grad_norm": 0.8281596899032593, "learning_rate": 9.538008466777103e-05, "loss": 1.4972, "num_input_tokens_seen": 17212960, "step": 2848, "train_runtime": 2889.7149, "train_tokens_per_second": 5956.629 }, { "epoch": 1.047816091954023, "grad_norm": 0.8524518013000488, "learning_rate": 9.534327259341065e-05, "loss": 1.6742, "num_input_tokens_seen": 17218752, "step": 2849, "train_runtime": 2890.6885, "train_tokens_per_second": 5956.627 }, { "epoch": 1.048183908045977, "grad_norm": 0.8830690979957581, "learning_rate": 9.530646051905026e-05, "loss": 1.584, "num_input_tokens_seen": 17226480, "step": 2850, "train_runtime": 2891.9031, "train_tokens_per_second": 5956.797 }, { "epoch": 1.048551724137931, "grad_norm": 0.7999176383018494, "learning_rate": 9.526964844468987e-05, "loss": 1.5444, "num_input_tokens_seen": 17231792, "step": 2851, "train_runtime": 2893.4185, "train_tokens_per_second": 5955.513 }, { "epoch": 1.048919540229885, "grad_norm": 0.8545219898223877, "learning_rate": 9.523283637032946e-05, "loss": 1.451, "num_input_tokens_seen": 17237680, "step": 2852, "train_runtime": 2894.3843, "train_tokens_per_second": 5955.56 }, { "epoch": 1.049287356321839, "grad_norm": 0.8693704009056091, "learning_rate": 9.519602429596907e-05, "loss": 1.5566, "num_input_tokens_seen": 17245776, "step": 2853, "train_runtime": 2895.661, "train_tokens_per_second": 5955.73 }, { "epoch": 1.049655172413793, "grad_norm": 0.8018753528594971, "learning_rate": 9.51592122216087e-05, "loss": 1.5662, "num_input_tokens_seen": 17251968, "step": 2854, "train_runtime": 2896.6672, "train_tokens_per_second": 5955.799 }, { "epoch": 1.050022988505747, "grad_norm": 0.9831026792526245, "learning_rate": 9.51224001472483e-05, "loss": 1.6686, "num_input_tokens_seen": 17257488, "step": 2855, "train_runtime": 2897.5906, "train_tokens_per_second": 5955.806 }, { "epoch": 1.050390804597701, "grad_norm": 0.835200846195221, "learning_rate": 9.508558807288791e-05, "loss": 1.5858, "num_input_tokens_seen": 17267792, "step": 2856, "train_runtime": 2899.1366, "train_tokens_per_second": 5956.184 }, { "epoch": 1.050758620689655, "grad_norm": 0.833871603012085, "learning_rate": 9.504877599852752e-05, "loss": 1.5692, "num_input_tokens_seen": 17273760, "step": 2857, "train_runtime": 2900.1325, "train_tokens_per_second": 5956.197 }, { "epoch": 1.051126436781609, "grad_norm": 0.8666744828224182, "learning_rate": 9.501196392416713e-05, "loss": 1.623, "num_input_tokens_seen": 17279552, "step": 2858, "train_runtime": 2901.0818, "train_tokens_per_second": 5956.244 }, { "epoch": 1.0514942528735631, "grad_norm": 0.8661529421806335, "learning_rate": 9.497515184980674e-05, "loss": 1.4618, "num_input_tokens_seen": 17284240, "step": 2859, "train_runtime": 2901.8634, "train_tokens_per_second": 5956.256 }, { "epoch": 1.0518620689655171, "grad_norm": 0.8447166681289673, "learning_rate": 9.493833977544635e-05, "loss": 1.6758, "num_input_tokens_seen": 17291872, "step": 2860, "train_runtime": 2903.0783, "train_tokens_per_second": 5956.392 }, { "epoch": 1.0522298850574712, "grad_norm": 0.9535942077636719, "learning_rate": 9.490152770108596e-05, "loss": 1.7953, "num_input_tokens_seen": 17296400, "step": 2861, "train_runtime": 2903.8713, "train_tokens_per_second": 5956.324 }, { "epoch": 1.0525977011494252, "grad_norm": 0.8083456158638, "learning_rate": 9.486471562672558e-05, "loss": 1.4004, "num_input_tokens_seen": 17304064, "step": 2862, "train_runtime": 2905.0823, "train_tokens_per_second": 5956.48 }, { "epoch": 1.0529655172413792, "grad_norm": 0.9035588502883911, "learning_rate": 9.482790355236518e-05, "loss": 1.6874, "num_input_tokens_seen": 17310432, "step": 2863, "train_runtime": 2906.1027, "train_tokens_per_second": 5956.58 }, { "epoch": 1.0533333333333332, "grad_norm": 0.8191578388214111, "learning_rate": 9.479109147800479e-05, "loss": 1.4821, "num_input_tokens_seen": 17318768, "step": 2864, "train_runtime": 2907.3731, "train_tokens_per_second": 5956.844 }, { "epoch": 1.0537011494252873, "grad_norm": 0.8769479393959045, "learning_rate": 9.47542794036444e-05, "loss": 1.6053, "num_input_tokens_seen": 17324096, "step": 2865, "train_runtime": 2908.2537, "train_tokens_per_second": 5956.872 }, { "epoch": 1.0540689655172413, "grad_norm": 0.8558223843574524, "learning_rate": 9.4717467329284e-05, "loss": 1.4024, "num_input_tokens_seen": 17329248, "step": 2866, "train_runtime": 2909.119, "train_tokens_per_second": 5956.872 }, { "epoch": 1.0544367816091953, "grad_norm": 0.8265432715415955, "learning_rate": 9.468065525492363e-05, "loss": 1.2791, "num_input_tokens_seen": 17336528, "step": 2867, "train_runtime": 2910.28, "train_tokens_per_second": 5956.997 }, { "epoch": 1.0548045977011493, "grad_norm": 0.8245050311088562, "learning_rate": 9.464384318056323e-05, "loss": 1.3999, "num_input_tokens_seen": 17341328, "step": 2868, "train_runtime": 2911.1046, "train_tokens_per_second": 5956.958 }, { "epoch": 1.0551724137931036, "grad_norm": 0.8065523505210876, "learning_rate": 9.460703110620284e-05, "loss": 1.434, "num_input_tokens_seen": 17346736, "step": 2869, "train_runtime": 2912.0054, "train_tokens_per_second": 5956.972 }, { "epoch": 1.0555402298850574, "grad_norm": 0.7951681613922119, "learning_rate": 9.457021903184244e-05, "loss": 1.3814, "num_input_tokens_seen": 17355136, "step": 2870, "train_runtime": 2913.2957, "train_tokens_per_second": 5957.218 }, { "epoch": 1.0559080459770116, "grad_norm": 0.8782454133033752, "learning_rate": 9.453340695748206e-05, "loss": 1.6197, "num_input_tokens_seen": 17362688, "step": 2871, "train_runtime": 2914.4974, "train_tokens_per_second": 5957.352 }, { "epoch": 1.0562758620689656, "grad_norm": 0.8546891808509827, "learning_rate": 9.449659488312167e-05, "loss": 1.3147, "num_input_tokens_seen": 17369264, "step": 2872, "train_runtime": 2915.5745, "train_tokens_per_second": 5957.407 }, { "epoch": 1.0566436781609196, "grad_norm": 0.917632520198822, "learning_rate": 9.445978280876128e-05, "loss": 1.5459, "num_input_tokens_seen": 17373616, "step": 2873, "train_runtime": 2916.3462, "train_tokens_per_second": 5957.323 }, { "epoch": 1.0570114942528737, "grad_norm": 0.9305850863456726, "learning_rate": 9.442297073440089e-05, "loss": 1.4332, "num_input_tokens_seen": 17380176, "step": 2874, "train_runtime": 2917.3826, "train_tokens_per_second": 5957.455 }, { "epoch": 1.0573793103448277, "grad_norm": 0.7726304531097412, "learning_rate": 9.43861586600405e-05, "loss": 1.3444, "num_input_tokens_seen": 17386288, "step": 2875, "train_runtime": 2918.3697, "train_tokens_per_second": 5957.535 }, { "epoch": 1.0577471264367817, "grad_norm": 0.9169855713844299, "learning_rate": 9.43493465856801e-05, "loss": 1.5653, "num_input_tokens_seen": 17392048, "step": 2876, "train_runtime": 2919.2869, "train_tokens_per_second": 5957.636 }, { "epoch": 1.0581149425287357, "grad_norm": 0.8320531249046326, "learning_rate": 9.431253451131971e-05, "loss": 1.6393, "num_input_tokens_seen": 17397712, "step": 2877, "train_runtime": 2920.2225, "train_tokens_per_second": 5957.667 }, { "epoch": 1.0584827586206897, "grad_norm": 0.9271109104156494, "learning_rate": 9.427572243695932e-05, "loss": 1.5353, "num_input_tokens_seen": 17402736, "step": 2878, "train_runtime": 2921.0878, "train_tokens_per_second": 5957.622 }, { "epoch": 1.0588505747126438, "grad_norm": 0.8818534016609192, "learning_rate": 9.423891036259895e-05, "loss": 1.5844, "num_input_tokens_seen": 17408832, "step": 2879, "train_runtime": 2922.055, "train_tokens_per_second": 5957.736 }, { "epoch": 1.0592183908045978, "grad_norm": 0.8145337104797363, "learning_rate": 9.420209828823855e-05, "loss": 1.6171, "num_input_tokens_seen": 17414528, "step": 2880, "train_runtime": 2922.991, "train_tokens_per_second": 5957.777 }, { "epoch": 1.0595862068965518, "grad_norm": 0.8335985541343689, "learning_rate": 9.416528621387816e-05, "loss": 1.3167, "num_input_tokens_seen": 17423856, "step": 2881, "train_runtime": 2924.8749, "train_tokens_per_second": 5957.129 }, { "epoch": 1.0599540229885058, "grad_norm": 0.9051361083984375, "learning_rate": 9.412847413951776e-05, "loss": 1.5082, "num_input_tokens_seen": 17430576, "step": 2882, "train_runtime": 2925.9497, "train_tokens_per_second": 5957.237 }, { "epoch": 1.0603218390804598, "grad_norm": 0.8853550553321838, "learning_rate": 9.409166206515737e-05, "loss": 1.6005, "num_input_tokens_seen": 17437184, "step": 2883, "train_runtime": 2927.0275, "train_tokens_per_second": 5957.301 }, { "epoch": 1.0606896551724139, "grad_norm": 0.7256721258163452, "learning_rate": 9.405484999079699e-05, "loss": 1.6536, "num_input_tokens_seen": 17445136, "step": 2884, "train_runtime": 2928.2545, "train_tokens_per_second": 5957.52 }, { "epoch": 1.061057471264368, "grad_norm": 0.7858527302742004, "learning_rate": 9.40180379164366e-05, "loss": 1.3077, "num_input_tokens_seen": 17455216, "step": 2885, "train_runtime": 2929.7813, "train_tokens_per_second": 5957.856 }, { "epoch": 1.061425287356322, "grad_norm": 0.829235851764679, "learning_rate": 9.398122584207621e-05, "loss": 1.5469, "num_input_tokens_seen": 17462464, "step": 2886, "train_runtime": 2930.8979, "train_tokens_per_second": 5958.06 }, { "epoch": 1.061793103448276, "grad_norm": 0.9107984900474548, "learning_rate": 9.394441376771582e-05, "loss": 1.5541, "num_input_tokens_seen": 17467936, "step": 2887, "train_runtime": 2931.7968, "train_tokens_per_second": 5958.099 }, { "epoch": 1.06216091954023, "grad_norm": 0.8439177870750427, "learning_rate": 9.390760169335543e-05, "loss": 1.5968, "num_input_tokens_seen": 17473248, "step": 2888, "train_runtime": 2932.6842, "train_tokens_per_second": 5958.108 }, { "epoch": 1.062528735632184, "grad_norm": 0.9255894422531128, "learning_rate": 9.387078961899503e-05, "loss": 1.5437, "num_input_tokens_seen": 17480752, "step": 2889, "train_runtime": 2933.8748, "train_tokens_per_second": 5958.248 }, { "epoch": 1.062896551724138, "grad_norm": 0.9633305072784424, "learning_rate": 9.383397754463464e-05, "loss": 1.2861, "num_input_tokens_seen": 17487552, "step": 2890, "train_runtime": 2934.961, "train_tokens_per_second": 5958.359 }, { "epoch": 1.063264367816092, "grad_norm": 0.9214752316474915, "learning_rate": 9.379716547027425e-05, "loss": 1.5382, "num_input_tokens_seen": 17492384, "step": 2891, "train_runtime": 2935.7757, "train_tokens_per_second": 5958.352 }, { "epoch": 1.063632183908046, "grad_norm": 0.9166814684867859, "learning_rate": 9.376035339591387e-05, "loss": 1.4873, "num_input_tokens_seen": 17498720, "step": 2892, "train_runtime": 2936.8173, "train_tokens_per_second": 5958.396 }, { "epoch": 1.064, "grad_norm": 0.8767185211181641, "learning_rate": 9.372354132155347e-05, "loss": 1.4913, "num_input_tokens_seen": 17503808, "step": 2893, "train_runtime": 2937.7006, "train_tokens_per_second": 5958.336 }, { "epoch": 1.064367816091954, "grad_norm": 0.803009569644928, "learning_rate": 9.368672924719308e-05, "loss": 1.3586, "num_input_tokens_seen": 17508864, "step": 2894, "train_runtime": 2938.5584, "train_tokens_per_second": 5958.317 }, { "epoch": 1.064735632183908, "grad_norm": 0.8554779887199402, "learning_rate": 9.364991717283269e-05, "loss": 1.4783, "num_input_tokens_seen": 17515904, "step": 2895, "train_runtime": 2939.7021, "train_tokens_per_second": 5958.394 }, { "epoch": 1.0651034482758621, "grad_norm": 0.8982095718383789, "learning_rate": 9.36131050984723e-05, "loss": 1.4686, "num_input_tokens_seen": 17522416, "step": 2896, "train_runtime": 2940.7372, "train_tokens_per_second": 5958.511 }, { "epoch": 1.0654712643678161, "grad_norm": 0.9042606353759766, "learning_rate": 9.357629302411192e-05, "loss": 1.4335, "num_input_tokens_seen": 17527904, "step": 2897, "train_runtime": 2941.6553, "train_tokens_per_second": 5958.517 }, { "epoch": 1.0658390804597702, "grad_norm": 0.9136054515838623, "learning_rate": 9.353948094975153e-05, "loss": 1.4951, "num_input_tokens_seen": 17532080, "step": 2898, "train_runtime": 2942.3862, "train_tokens_per_second": 5958.456 }, { "epoch": 1.0662068965517242, "grad_norm": 0.911813497543335, "learning_rate": 9.350266887539114e-05, "loss": 1.6412, "num_input_tokens_seen": 17536800, "step": 2899, "train_runtime": 2943.1875, "train_tokens_per_second": 5958.438 }, { "epoch": 1.0665747126436782, "grad_norm": 0.9023128747940063, "learning_rate": 9.346585680103073e-05, "loss": 1.6356, "num_input_tokens_seen": 17541696, "step": 2900, "train_runtime": 2943.9948, "train_tokens_per_second": 5958.467 }, { "epoch": 1.0669425287356322, "grad_norm": 0.8466926217079163, "learning_rate": 9.342904472667035e-05, "loss": 1.5312, "num_input_tokens_seen": 17546400, "step": 2901, "train_runtime": 2944.7952, "train_tokens_per_second": 5958.445 }, { "epoch": 1.0673103448275862, "grad_norm": 0.9492855072021484, "learning_rate": 9.339223265230996e-05, "loss": 1.6508, "num_input_tokens_seen": 17551696, "step": 2902, "train_runtime": 2945.6983, "train_tokens_per_second": 5958.416 }, { "epoch": 1.0676781609195403, "grad_norm": 0.8984745740890503, "learning_rate": 9.335542057794957e-05, "loss": 1.7771, "num_input_tokens_seen": 17556928, "step": 2903, "train_runtime": 2946.5852, "train_tokens_per_second": 5958.398 }, { "epoch": 1.0680459770114943, "grad_norm": 0.8564352989196777, "learning_rate": 9.331860850358918e-05, "loss": 1.7645, "num_input_tokens_seen": 17562528, "step": 2904, "train_runtime": 2947.5263, "train_tokens_per_second": 5958.396 }, { "epoch": 1.0684137931034483, "grad_norm": 0.8706150650978088, "learning_rate": 9.328179642922879e-05, "loss": 1.3991, "num_input_tokens_seen": 17568528, "step": 2905, "train_runtime": 2948.5063, "train_tokens_per_second": 5958.45 }, { "epoch": 1.0687816091954023, "grad_norm": 0.8660470247268677, "learning_rate": 9.32449843548684e-05, "loss": 1.5146, "num_input_tokens_seen": 17576576, "step": 2906, "train_runtime": 2949.7956, "train_tokens_per_second": 5958.574 }, { "epoch": 1.0691494252873563, "grad_norm": 0.8907226324081421, "learning_rate": 9.320817228050801e-05, "loss": 1.6753, "num_input_tokens_seen": 17581760, "step": 2907, "train_runtime": 2950.6654, "train_tokens_per_second": 5958.575 }, { "epoch": 1.0695172413793104, "grad_norm": 0.852679967880249, "learning_rate": 9.317136020614762e-05, "loss": 1.6204, "num_input_tokens_seen": 17588160, "step": 2908, "train_runtime": 2951.7023, "train_tokens_per_second": 5958.65 }, { "epoch": 1.0698850574712644, "grad_norm": 0.8490344882011414, "learning_rate": 9.313454813178724e-05, "loss": 1.4982, "num_input_tokens_seen": 17593680, "step": 2909, "train_runtime": 2952.6143, "train_tokens_per_second": 5958.679 }, { "epoch": 1.0702528735632184, "grad_norm": 0.7942832708358765, "learning_rate": 9.309773605742685e-05, "loss": 1.5199, "num_input_tokens_seen": 17599296, "step": 2910, "train_runtime": 2953.5516, "train_tokens_per_second": 5958.689 }, { "epoch": 1.0706206896551724, "grad_norm": 0.8734784722328186, "learning_rate": 9.306092398306644e-05, "loss": 1.6302, "num_input_tokens_seen": 17605712, "step": 2911, "train_runtime": 2955.1575, "train_tokens_per_second": 5957.622 }, { "epoch": 1.0709885057471265, "grad_norm": 0.931926429271698, "learning_rate": 9.302411190870605e-05, "loss": 1.5573, "num_input_tokens_seen": 17610128, "step": 2912, "train_runtime": 2955.9247, "train_tokens_per_second": 5957.57 }, { "epoch": 1.0713563218390805, "grad_norm": 0.8316265940666199, "learning_rate": 9.298729983434566e-05, "loss": 1.5155, "num_input_tokens_seen": 17614752, "step": 2913, "train_runtime": 2956.7346, "train_tokens_per_second": 5957.502 }, { "epoch": 1.0717241379310345, "grad_norm": 0.8702672719955444, "learning_rate": 9.295048775998528e-05, "loss": 1.6388, "num_input_tokens_seen": 17620544, "step": 2914, "train_runtime": 2957.7048, "train_tokens_per_second": 5957.506 }, { "epoch": 1.0720919540229885, "grad_norm": 0.787736177444458, "learning_rate": 9.291367568562489e-05, "loss": 1.5138, "num_input_tokens_seen": 17625856, "step": 2915, "train_runtime": 2958.6085, "train_tokens_per_second": 5957.482 }, { "epoch": 1.0724597701149425, "grad_norm": 0.9045817255973816, "learning_rate": 9.28768636112645e-05, "loss": 1.6954, "num_input_tokens_seen": 17630016, "step": 2916, "train_runtime": 2959.3474, "train_tokens_per_second": 5957.4 }, { "epoch": 1.0728275862068966, "grad_norm": 0.870911180973053, "learning_rate": 9.284005153690411e-05, "loss": 1.5238, "num_input_tokens_seen": 17635552, "step": 2917, "train_runtime": 2960.2592, "train_tokens_per_second": 5957.435 }, { "epoch": 1.0731954022988506, "grad_norm": 0.8109344840049744, "learning_rate": 9.280323946254372e-05, "loss": 1.4472, "num_input_tokens_seen": 17642512, "step": 2918, "train_runtime": 2961.3719, "train_tokens_per_second": 5957.547 }, { "epoch": 1.0735632183908046, "grad_norm": 0.7967440485954285, "learning_rate": 9.276642738818333e-05, "loss": 1.6803, "num_input_tokens_seen": 17650800, "step": 2919, "train_runtime": 2962.6772, "train_tokens_per_second": 5957.72 }, { "epoch": 1.0739310344827586, "grad_norm": 0.8106200695037842, "learning_rate": 9.272961531382294e-05, "loss": 1.7842, "num_input_tokens_seen": 17657008, "step": 2920, "train_runtime": 2963.6979, "train_tokens_per_second": 5957.762 }, { "epoch": 1.0742988505747126, "grad_norm": 0.9413151144981384, "learning_rate": 9.269280323946255e-05, "loss": 1.7005, "num_input_tokens_seen": 17662768, "step": 2921, "train_runtime": 2964.6769, "train_tokens_per_second": 5957.738 }, { "epoch": 1.0746666666666667, "grad_norm": 0.7692528963088989, "learning_rate": 9.265599116510217e-05, "loss": 1.5331, "num_input_tokens_seen": 17672560, "step": 2922, "train_runtime": 2966.1636, "train_tokens_per_second": 5958.053 }, { "epoch": 1.0750344827586207, "grad_norm": 0.8859119415283203, "learning_rate": 9.261917909074176e-05, "loss": 1.5103, "num_input_tokens_seen": 17679808, "step": 2923, "train_runtime": 2967.326, "train_tokens_per_second": 5958.162 }, { "epoch": 1.0754022988505747, "grad_norm": 0.7270735502243042, "learning_rate": 9.258236701638137e-05, "loss": 1.3398, "num_input_tokens_seen": 17687920, "step": 2924, "train_runtime": 2968.5694, "train_tokens_per_second": 5958.399 }, { "epoch": 1.0757701149425287, "grad_norm": 0.8331897854804993, "learning_rate": 9.254555494202098e-05, "loss": 1.5113, "num_input_tokens_seen": 17694368, "step": 2925, "train_runtime": 2969.625, "train_tokens_per_second": 5958.452 }, { "epoch": 1.0761379310344827, "grad_norm": 0.8930321931838989, "learning_rate": 9.250874286766059e-05, "loss": 1.557, "num_input_tokens_seen": 17699200, "step": 2926, "train_runtime": 2970.4514, "train_tokens_per_second": 5958.421 }, { "epoch": 1.0765057471264368, "grad_norm": 0.7647495865821838, "learning_rate": 9.247193079330021e-05, "loss": 1.524, "num_input_tokens_seen": 17706496, "step": 2927, "train_runtime": 2971.6297, "train_tokens_per_second": 5958.514 }, { "epoch": 1.0768735632183908, "grad_norm": 0.9093469381332397, "learning_rate": 9.243511871893982e-05, "loss": 1.7038, "num_input_tokens_seen": 17711680, "step": 2928, "train_runtime": 2972.4818, "train_tokens_per_second": 5958.549 }, { "epoch": 1.0772413793103448, "grad_norm": 0.8546137809753418, "learning_rate": 9.239830664457943e-05, "loss": 1.4754, "num_input_tokens_seen": 17718112, "step": 2929, "train_runtime": 2973.5264, "train_tokens_per_second": 5958.619 }, { "epoch": 1.0776091954022988, "grad_norm": 0.8514943718910217, "learning_rate": 9.236149457021903e-05, "loss": 1.5458, "num_input_tokens_seen": 17723344, "step": 2930, "train_runtime": 2974.4143, "train_tokens_per_second": 5958.6 }, { "epoch": 1.0779770114942528, "grad_norm": 0.8585690259933472, "learning_rate": 9.232468249585865e-05, "loss": 1.6278, "num_input_tokens_seen": 17728336, "step": 2931, "train_runtime": 2975.2664, "train_tokens_per_second": 5958.571 }, { "epoch": 1.0783448275862069, "grad_norm": 0.8574824929237366, "learning_rate": 9.228787042149826e-05, "loss": 1.5328, "num_input_tokens_seen": 17732896, "step": 2932, "train_runtime": 2976.0594, "train_tokens_per_second": 5958.516 }, { "epoch": 1.0787126436781609, "grad_norm": 0.8984758257865906, "learning_rate": 9.225105834713787e-05, "loss": 1.5984, "num_input_tokens_seen": 17737872, "step": 2933, "train_runtime": 2976.9175, "train_tokens_per_second": 5958.469 }, { "epoch": 1.079080459770115, "grad_norm": 0.838237464427948, "learning_rate": 9.221424627277748e-05, "loss": 1.5525, "num_input_tokens_seen": 17743424, "step": 2934, "train_runtime": 2977.8497, "train_tokens_per_second": 5958.469 }, { "epoch": 1.079448275862069, "grad_norm": 0.7374897003173828, "learning_rate": 9.217743419841708e-05, "loss": 1.5435, "num_input_tokens_seen": 17755552, "step": 2935, "train_runtime": 2979.6565, "train_tokens_per_second": 5958.926 }, { "epoch": 1.079816091954023, "grad_norm": 0.8529292941093445, "learning_rate": 9.214062212405669e-05, "loss": 1.7153, "num_input_tokens_seen": 17760400, "step": 2936, "train_runtime": 2980.4792, "train_tokens_per_second": 5958.908 }, { "epoch": 1.080183908045977, "grad_norm": 0.883734405040741, "learning_rate": 9.21038100496963e-05, "loss": 1.5194, "num_input_tokens_seen": 17766592, "step": 2937, "train_runtime": 2981.4836, "train_tokens_per_second": 5958.977 }, { "epoch": 1.080551724137931, "grad_norm": 0.8351326584815979, "learning_rate": 9.206699797533591e-05, "loss": 1.4836, "num_input_tokens_seen": 17771872, "step": 2938, "train_runtime": 2982.3758, "train_tokens_per_second": 5958.965 }, { "epoch": 1.080919540229885, "grad_norm": 0.8073239922523499, "learning_rate": 9.203018590097553e-05, "loss": 1.8301, "num_input_tokens_seen": 17780256, "step": 2939, "train_runtime": 2983.6916, "train_tokens_per_second": 5959.147 }, { "epoch": 1.081287356321839, "grad_norm": 0.8248845338821411, "learning_rate": 9.199337382661514e-05, "loss": 1.3707, "num_input_tokens_seen": 17786048, "step": 2940, "train_runtime": 2984.6693, "train_tokens_per_second": 5959.135 }, { "epoch": 1.081655172413793, "grad_norm": 0.8870813846588135, "learning_rate": 9.195656175225474e-05, "loss": 1.5967, "num_input_tokens_seen": 17791904, "step": 2941, "train_runtime": 2986.1007, "train_tokens_per_second": 5958.24 }, { "epoch": 1.082022988505747, "grad_norm": 0.8500445485115051, "learning_rate": 9.191974967789435e-05, "loss": 1.5112, "num_input_tokens_seen": 17798736, "step": 2942, "train_runtime": 2987.217, "train_tokens_per_second": 5958.3 }, { "epoch": 1.082390804597701, "grad_norm": 0.8376680612564087, "learning_rate": 9.188293760353396e-05, "loss": 1.3358, "num_input_tokens_seen": 17803552, "step": 2943, "train_runtime": 2988.0105, "train_tokens_per_second": 5958.33 }, { "epoch": 1.0827586206896551, "grad_norm": 0.8387786746025085, "learning_rate": 9.184612552917358e-05, "loss": 1.4408, "num_input_tokens_seen": 17809504, "step": 2944, "train_runtime": 2989.0129, "train_tokens_per_second": 5958.323 }, { "epoch": 1.0831264367816091, "grad_norm": 0.8747749924659729, "learning_rate": 9.180931345481319e-05, "loss": 1.393, "num_input_tokens_seen": 17817632, "step": 2945, "train_runtime": 2990.2632, "train_tokens_per_second": 5958.55 }, { "epoch": 1.0834942528735632, "grad_norm": 0.8513575792312622, "learning_rate": 9.17725013804528e-05, "loss": 1.4491, "num_input_tokens_seen": 17821616, "step": 2946, "train_runtime": 2990.9583, "train_tokens_per_second": 5958.497 }, { "epoch": 1.0838620689655172, "grad_norm": 0.880194365978241, "learning_rate": 9.17356893060924e-05, "loss": 1.4038, "num_input_tokens_seen": 17827616, "step": 2947, "train_runtime": 2991.9216, "train_tokens_per_second": 5958.584 }, { "epoch": 1.0842298850574712, "grad_norm": 0.8144898414611816, "learning_rate": 9.169887723173201e-05, "loss": 1.4403, "num_input_tokens_seen": 17832624, "step": 2948, "train_runtime": 2992.7686, "train_tokens_per_second": 5958.571 }, { "epoch": 1.0845977011494252, "grad_norm": 0.8111633062362671, "learning_rate": 9.166206515737162e-05, "loss": 1.5983, "num_input_tokens_seen": 17838656, "step": 2949, "train_runtime": 2993.7544, "train_tokens_per_second": 5958.624 }, { "epoch": 1.0849655172413792, "grad_norm": 0.8911537528038025, "learning_rate": 9.162525308301123e-05, "loss": 1.4741, "num_input_tokens_seen": 17843664, "step": 2950, "train_runtime": 2994.6191, "train_tokens_per_second": 5958.576 }, { "epoch": 1.0853333333333333, "grad_norm": 0.8204982876777649, "learning_rate": 9.158844100865084e-05, "loss": 1.5058, "num_input_tokens_seen": 17850000, "step": 2951, "train_runtime": 2995.6509, "train_tokens_per_second": 5958.638 }, { "epoch": 1.0857011494252873, "grad_norm": 0.8104643821716309, "learning_rate": 9.155162893429046e-05, "loss": 1.3813, "num_input_tokens_seen": 17854416, "step": 2952, "train_runtime": 2996.4252, "train_tokens_per_second": 5958.572 }, { "epoch": 1.0860689655172413, "grad_norm": 0.9006640911102295, "learning_rate": 9.151481685993006e-05, "loss": 1.6387, "num_input_tokens_seen": 17858816, "step": 2953, "train_runtime": 2997.1766, "train_tokens_per_second": 5958.546 }, { "epoch": 1.0864367816091953, "grad_norm": 0.9306876063346863, "learning_rate": 9.147800478556967e-05, "loss": 1.6943, "num_input_tokens_seen": 17863440, "step": 2954, "train_runtime": 2998.0012, "train_tokens_per_second": 5958.45 }, { "epoch": 1.0868045977011493, "grad_norm": 0.8869686126708984, "learning_rate": 9.144119271120928e-05, "loss": 1.4693, "num_input_tokens_seen": 17868048, "step": 2955, "train_runtime": 2998.7885, "train_tokens_per_second": 5958.422 }, { "epoch": 1.0871724137931034, "grad_norm": 0.8355336785316467, "learning_rate": 9.140438063684888e-05, "loss": 1.5594, "num_input_tokens_seen": 17874000, "step": 2956, "train_runtime": 2999.75, "train_tokens_per_second": 5958.497 }, { "epoch": 1.0875402298850574, "grad_norm": 0.8136854767799377, "learning_rate": 9.136756856248851e-05, "loss": 1.5336, "num_input_tokens_seen": 17880208, "step": 2957, "train_runtime": 3000.7445, "train_tokens_per_second": 5958.591 }, { "epoch": 1.0879080459770114, "grad_norm": 0.9275166988372803, "learning_rate": 9.133075648812812e-05, "loss": 1.4834, "num_input_tokens_seen": 17885648, "step": 2958, "train_runtime": 3001.6511, "train_tokens_per_second": 5958.603 }, { "epoch": 1.0882758620689654, "grad_norm": 0.8196326494216919, "learning_rate": 9.129394441376772e-05, "loss": 1.436, "num_input_tokens_seen": 17890336, "step": 2959, "train_runtime": 3002.4504, "train_tokens_per_second": 5958.578 }, { "epoch": 1.0886436781609194, "grad_norm": 0.8501957654953003, "learning_rate": 9.125713233940732e-05, "loss": 1.5597, "num_input_tokens_seen": 17895296, "step": 2960, "train_runtime": 3003.3011, "train_tokens_per_second": 5958.542 }, { "epoch": 1.0890114942528735, "grad_norm": 0.8026125431060791, "learning_rate": 9.122032026504694e-05, "loss": 1.3948, "num_input_tokens_seen": 17906000, "step": 2961, "train_runtime": 3004.8807, "train_tokens_per_second": 5958.972 }, { "epoch": 1.0893793103448275, "grad_norm": 0.7974033951759338, "learning_rate": 9.118350819068655e-05, "loss": 1.4652, "num_input_tokens_seen": 17911408, "step": 2962, "train_runtime": 3005.7712, "train_tokens_per_second": 5959.006 }, { "epoch": 1.0897471264367815, "grad_norm": 0.8387789130210876, "learning_rate": 9.114669611632616e-05, "loss": 1.4444, "num_input_tokens_seen": 17918560, "step": 2963, "train_runtime": 3006.8978, "train_tokens_per_second": 5959.152 }, { "epoch": 1.0901149425287355, "grad_norm": 0.985151469707489, "learning_rate": 9.110988404196577e-05, "loss": 1.5851, "num_input_tokens_seen": 17923040, "step": 2964, "train_runtime": 3007.6736, "train_tokens_per_second": 5959.104 }, { "epoch": 1.0904827586206896, "grad_norm": 0.8931572437286377, "learning_rate": 9.107307196760538e-05, "loss": 1.7873, "num_input_tokens_seen": 17928576, "step": 2965, "train_runtime": 3008.5685, "train_tokens_per_second": 5959.172 }, { "epoch": 1.0908505747126438, "grad_norm": 0.9616334438323975, "learning_rate": 9.103625989324499e-05, "loss": 1.6359, "num_input_tokens_seen": 17933616, "step": 2966, "train_runtime": 3009.4456, "train_tokens_per_second": 5959.109 }, { "epoch": 1.0912183908045976, "grad_norm": 0.7934318780899048, "learning_rate": 9.09994478188846e-05, "loss": 1.3704, "num_input_tokens_seen": 17942480, "step": 2967, "train_runtime": 3010.8455, "train_tokens_per_second": 5959.283 }, { "epoch": 1.0915862068965518, "grad_norm": 0.8664103746414185, "learning_rate": 9.09626357445242e-05, "loss": 1.6176, "num_input_tokens_seen": 17948304, "step": 2968, "train_runtime": 3011.807, "train_tokens_per_second": 5959.314 }, { "epoch": 1.0919540229885056, "grad_norm": 0.9133998155593872, "learning_rate": 9.092582367016383e-05, "loss": 1.4887, "num_input_tokens_seen": 17952752, "step": 2969, "train_runtime": 3012.5809, "train_tokens_per_second": 5959.26 }, { "epoch": 1.0923218390804599, "grad_norm": 0.8783140182495117, "learning_rate": 9.088901159580344e-05, "loss": 1.616, "num_input_tokens_seen": 17960112, "step": 2970, "train_runtime": 3013.7252, "train_tokens_per_second": 5959.439 }, { "epoch": 1.0926896551724137, "grad_norm": 0.8942212462425232, "learning_rate": 9.085219952144303e-05, "loss": 1.4825, "num_input_tokens_seen": 17965824, "step": 2971, "train_runtime": 3015.1425, "train_tokens_per_second": 5958.532 }, { "epoch": 1.093057471264368, "grad_norm": 0.7843309640884399, "learning_rate": 9.081538744708264e-05, "loss": 1.4653, "num_input_tokens_seen": 17970208, "step": 2972, "train_runtime": 3015.9106, "train_tokens_per_second": 5958.468 }, { "epoch": 1.093425287356322, "grad_norm": 0.9128292798995972, "learning_rate": 9.077857537272225e-05, "loss": 1.6371, "num_input_tokens_seen": 17976752, "step": 2973, "train_runtime": 3016.949, "train_tokens_per_second": 5958.587 }, { "epoch": 1.093793103448276, "grad_norm": 1.0340237617492676, "learning_rate": 9.074176329836187e-05, "loss": 1.7085, "num_input_tokens_seen": 17980912, "step": 2974, "train_runtime": 3017.6938, "train_tokens_per_second": 5958.494 }, { "epoch": 1.09416091954023, "grad_norm": 0.8621233105659485, "learning_rate": 9.070495122400148e-05, "loss": 1.4981, "num_input_tokens_seen": 17987008, "step": 2975, "train_runtime": 3018.674, "train_tokens_per_second": 5958.579 }, { "epoch": 1.094528735632184, "grad_norm": 0.8423202037811279, "learning_rate": 9.066813914964109e-05, "loss": 1.5849, "num_input_tokens_seen": 17992016, "step": 2976, "train_runtime": 3019.5218, "train_tokens_per_second": 5958.565 }, { "epoch": 1.094896551724138, "grad_norm": 0.7866690754890442, "learning_rate": 9.06313270752807e-05, "loss": 1.4619, "num_input_tokens_seen": 18000224, "step": 2977, "train_runtime": 3020.7904, "train_tokens_per_second": 5958.78 }, { "epoch": 1.095264367816092, "grad_norm": 0.8846787810325623, "learning_rate": 9.059451500092031e-05, "loss": 1.5359, "num_input_tokens_seen": 18005392, "step": 2978, "train_runtime": 3021.6689, "train_tokens_per_second": 5958.757 }, { "epoch": 1.095632183908046, "grad_norm": 0.828133761882782, "learning_rate": 9.055770292655992e-05, "loss": 1.5276, "num_input_tokens_seen": 18010320, "step": 2979, "train_runtime": 3022.5141, "train_tokens_per_second": 5958.722 }, { "epoch": 1.096, "grad_norm": 0.8812045454978943, "learning_rate": 9.052089085219952e-05, "loss": 1.5074, "num_input_tokens_seen": 18017584, "step": 2980, "train_runtime": 3023.6751, "train_tokens_per_second": 5958.836 }, { "epoch": 1.096367816091954, "grad_norm": 0.8940513134002686, "learning_rate": 9.048407877783913e-05, "loss": 1.5522, "num_input_tokens_seen": 18022608, "step": 2981, "train_runtime": 3024.5424, "train_tokens_per_second": 5958.788 }, { "epoch": 1.0967356321839081, "grad_norm": 0.8666152954101562, "learning_rate": 9.044726670347876e-05, "loss": 1.5509, "num_input_tokens_seen": 18028928, "step": 2982, "train_runtime": 3025.5508, "train_tokens_per_second": 5958.891 }, { "epoch": 1.0971034482758621, "grad_norm": 0.8712942004203796, "learning_rate": 9.041045462911835e-05, "loss": 1.5397, "num_input_tokens_seen": 18035504, "step": 2983, "train_runtime": 3026.588, "train_tokens_per_second": 5959.022 }, { "epoch": 1.0974712643678162, "grad_norm": 0.9157382845878601, "learning_rate": 9.037364255475796e-05, "loss": 1.8303, "num_input_tokens_seen": 18040240, "step": 2984, "train_runtime": 3027.4164, "train_tokens_per_second": 5958.956 }, { "epoch": 1.0978390804597702, "grad_norm": 0.82842618227005, "learning_rate": 9.033683048039757e-05, "loss": 1.3537, "num_input_tokens_seen": 18045536, "step": 2985, "train_runtime": 3028.285, "train_tokens_per_second": 5958.995 }, { "epoch": 1.0982068965517242, "grad_norm": 0.9429721832275391, "learning_rate": 9.030001840603718e-05, "loss": 1.5187, "num_input_tokens_seen": 18050976, "step": 2986, "train_runtime": 3029.195, "train_tokens_per_second": 5959.001 }, { "epoch": 1.0985747126436782, "grad_norm": 0.8951818346977234, "learning_rate": 9.02632063316768e-05, "loss": 1.5894, "num_input_tokens_seen": 18055808, "step": 2987, "train_runtime": 3030.02, "train_tokens_per_second": 5958.973 }, { "epoch": 1.0989425287356323, "grad_norm": 0.8807364702224731, "learning_rate": 9.022639425731641e-05, "loss": 1.4075, "num_input_tokens_seen": 18065120, "step": 2988, "train_runtime": 3031.451, "train_tokens_per_second": 5959.232 }, { "epoch": 1.0993103448275863, "grad_norm": 0.7793266773223877, "learning_rate": 9.0189582182956e-05, "loss": 1.4457, "num_input_tokens_seen": 18072064, "step": 2989, "train_runtime": 3032.5382, "train_tokens_per_second": 5959.386 }, { "epoch": 1.0996781609195403, "grad_norm": 0.8729456067085266, "learning_rate": 9.015277010859561e-05, "loss": 1.252, "num_input_tokens_seen": 18078096, "step": 2990, "train_runtime": 3033.5385, "train_tokens_per_second": 5959.409 }, { "epoch": 1.1000459770114943, "grad_norm": 0.910948634147644, "learning_rate": 9.011595803423524e-05, "loss": 1.7483, "num_input_tokens_seen": 18083808, "step": 2991, "train_runtime": 3034.4897, "train_tokens_per_second": 5959.423 }, { "epoch": 1.1004137931034483, "grad_norm": 0.9213285446166992, "learning_rate": 9.007914595987485e-05, "loss": 1.5399, "num_input_tokens_seen": 18089536, "step": 2992, "train_runtime": 3035.4227, "train_tokens_per_second": 5959.478 }, { "epoch": 1.1007816091954024, "grad_norm": 0.9003654718399048, "learning_rate": 9.004233388551445e-05, "loss": 1.4829, "num_input_tokens_seen": 18094192, "step": 2993, "train_runtime": 3036.24, "train_tokens_per_second": 5959.408 }, { "epoch": 1.1011494252873564, "grad_norm": 0.9667969942092896, "learning_rate": 9.000552181115406e-05, "loss": 1.6512, "num_input_tokens_seen": 18098800, "step": 2994, "train_runtime": 3037.0656, "train_tokens_per_second": 5959.305 }, { "epoch": 1.1015172413793104, "grad_norm": 0.9871839880943298, "learning_rate": 8.996870973679367e-05, "loss": 1.6106, "num_input_tokens_seen": 18103152, "step": 2995, "train_runtime": 3037.8376, "train_tokens_per_second": 5959.223 }, { "epoch": 1.1018850574712644, "grad_norm": 0.8530781865119934, "learning_rate": 8.993189766243328e-05, "loss": 1.5053, "num_input_tokens_seen": 18109392, "step": 2996, "train_runtime": 3038.8737, "train_tokens_per_second": 5959.245 }, { "epoch": 1.1022528735632184, "grad_norm": 0.8576104640960693, "learning_rate": 8.989508558807289e-05, "loss": 1.4783, "num_input_tokens_seen": 18116496, "step": 2997, "train_runtime": 3039.9885, "train_tokens_per_second": 5959.396 }, { "epoch": 1.1026206896551725, "grad_norm": 0.8468632698059082, "learning_rate": 8.98582735137125e-05, "loss": 1.3525, "num_input_tokens_seen": 18124240, "step": 2998, "train_runtime": 3041.2022, "train_tokens_per_second": 5959.564 }, { "epoch": 1.1029885057471265, "grad_norm": 0.9965177774429321, "learning_rate": 8.982146143935212e-05, "loss": 1.8205, "num_input_tokens_seen": 18129376, "step": 2999, "train_runtime": 3042.0615, "train_tokens_per_second": 5959.569 }, { "epoch": 1.1033563218390805, "grad_norm": 0.9205605387687683, "learning_rate": 8.978464936499173e-05, "loss": 1.6064, "num_input_tokens_seen": 18135536, "step": 3000, "train_runtime": 3043.0537, "train_tokens_per_second": 5959.65 }, { "epoch": 1.1037241379310345, "grad_norm": 0.8596298098564148, "learning_rate": 8.974783729063133e-05, "loss": 1.5547, "num_input_tokens_seen": 18141376, "step": 3001, "train_runtime": 3044.6021, "train_tokens_per_second": 5958.538 }, { "epoch": 1.1040919540229885, "grad_norm": 0.8226555585861206, "learning_rate": 8.971102521627093e-05, "loss": 1.4079, "num_input_tokens_seen": 18148256, "step": 3002, "train_runtime": 3045.6737, "train_tokens_per_second": 5958.7 }, { "epoch": 1.1044597701149426, "grad_norm": 0.9377200603485107, "learning_rate": 8.967421314191054e-05, "loss": 1.7866, "num_input_tokens_seen": 18153024, "step": 3003, "train_runtime": 3046.4845, "train_tokens_per_second": 5958.679 }, { "epoch": 1.1048275862068966, "grad_norm": 0.8783935904502869, "learning_rate": 8.963740106755017e-05, "loss": 1.5966, "num_input_tokens_seen": 18157280, "step": 3004, "train_runtime": 3047.2454, "train_tokens_per_second": 5958.588 }, { "epoch": 1.1051954022988506, "grad_norm": 0.9163652658462524, "learning_rate": 8.960058899318977e-05, "loss": 1.5184, "num_input_tokens_seen": 18163904, "step": 3005, "train_runtime": 3048.3181, "train_tokens_per_second": 5958.664 }, { "epoch": 1.1055632183908046, "grad_norm": 1.082741618156433, "learning_rate": 8.956377691882938e-05, "loss": 1.6069, "num_input_tokens_seen": 18168864, "step": 3006, "train_runtime": 3049.1353, "train_tokens_per_second": 5958.694 }, { "epoch": 1.1059310344827586, "grad_norm": 0.8877405524253845, "learning_rate": 8.952696484446899e-05, "loss": 1.5197, "num_input_tokens_seen": 18174928, "step": 3007, "train_runtime": 3050.1246, "train_tokens_per_second": 5958.749 }, { "epoch": 1.1062988505747127, "grad_norm": 0.8235839009284973, "learning_rate": 8.94901527701086e-05, "loss": 1.3557, "num_input_tokens_seen": 18180848, "step": 3008, "train_runtime": 3051.0925, "train_tokens_per_second": 5958.799 }, { "epoch": 1.1066666666666667, "grad_norm": 0.8531637191772461, "learning_rate": 8.945334069574821e-05, "loss": 1.5207, "num_input_tokens_seen": 18185808, "step": 3009, "train_runtime": 3051.9449, "train_tokens_per_second": 5958.76 }, { "epoch": 1.1070344827586207, "grad_norm": 0.8883745670318604, "learning_rate": 8.941652862138782e-05, "loss": 1.5447, "num_input_tokens_seen": 18192848, "step": 3010, "train_runtime": 3053.0583, "train_tokens_per_second": 5958.893 }, { "epoch": 1.1074022988505747, "grad_norm": 0.8320760726928711, "learning_rate": 8.937971654702743e-05, "loss": 1.5523, "num_input_tokens_seen": 18198352, "step": 3011, "train_runtime": 3053.9784, "train_tokens_per_second": 5958.9 }, { "epoch": 1.1077701149425287, "grad_norm": 0.9060353636741638, "learning_rate": 8.934290447266705e-05, "loss": 1.714, "num_input_tokens_seen": 18203760, "step": 3012, "train_runtime": 3054.8674, "train_tokens_per_second": 5958.936 }, { "epoch": 1.1081379310344828, "grad_norm": 0.8698820471763611, "learning_rate": 8.930609239830665e-05, "loss": 1.6191, "num_input_tokens_seen": 18208160, "step": 3013, "train_runtime": 3055.6204, "train_tokens_per_second": 5958.908 }, { "epoch": 1.1085057471264368, "grad_norm": 0.8704214096069336, "learning_rate": 8.926928032394625e-05, "loss": 1.5446, "num_input_tokens_seen": 18213296, "step": 3014, "train_runtime": 3056.5084, "train_tokens_per_second": 5958.857 }, { "epoch": 1.1088735632183908, "grad_norm": 0.9200130701065063, "learning_rate": 8.923246824958586e-05, "loss": 1.7013, "num_input_tokens_seen": 18220064, "step": 3015, "train_runtime": 3057.5694, "train_tokens_per_second": 5959.003 }, { "epoch": 1.1092413793103448, "grad_norm": 0.9000295996665955, "learning_rate": 8.919565617522547e-05, "loss": 1.6061, "num_input_tokens_seen": 18225168, "step": 3016, "train_runtime": 3058.437, "train_tokens_per_second": 5958.981 }, { "epoch": 1.1096091954022989, "grad_norm": 0.8831059336662292, "learning_rate": 8.91588441008651e-05, "loss": 1.5282, "num_input_tokens_seen": 18229792, "step": 3017, "train_runtime": 3059.2271, "train_tokens_per_second": 5958.954 }, { "epoch": 1.1099770114942529, "grad_norm": 0.9208916425704956, "learning_rate": 8.91220320265047e-05, "loss": 1.5004, "num_input_tokens_seen": 18235072, "step": 3018, "train_runtime": 3060.1189, "train_tokens_per_second": 5958.942 }, { "epoch": 1.110344827586207, "grad_norm": 0.9301306009292603, "learning_rate": 8.90852199521443e-05, "loss": 1.5404, "num_input_tokens_seen": 18240272, "step": 3019, "train_runtime": 3060.9837, "train_tokens_per_second": 5958.958 }, { "epoch": 1.110712643678161, "grad_norm": 0.9371606707572937, "learning_rate": 8.904840787778391e-05, "loss": 1.473, "num_input_tokens_seen": 18244656, "step": 3020, "train_runtime": 3061.743, "train_tokens_per_second": 5958.912 }, { "epoch": 1.111080459770115, "grad_norm": 0.9736334681510925, "learning_rate": 8.901159580342353e-05, "loss": 1.7267, "num_input_tokens_seen": 18248960, "step": 3021, "train_runtime": 3062.4934, "train_tokens_per_second": 5958.857 }, { "epoch": 1.111448275862069, "grad_norm": 0.9131522178649902, "learning_rate": 8.897478372906314e-05, "loss": 1.4589, "num_input_tokens_seen": 18254336, "step": 3022, "train_runtime": 3063.3766, "train_tokens_per_second": 5958.894 }, { "epoch": 1.111816091954023, "grad_norm": 0.8836458921432495, "learning_rate": 8.893797165470275e-05, "loss": 1.4484, "num_input_tokens_seen": 18260448, "step": 3023, "train_runtime": 3064.3996, "train_tokens_per_second": 5958.899 }, { "epoch": 1.112183908045977, "grad_norm": 0.7740640044212341, "learning_rate": 8.890115958034236e-05, "loss": 1.2408, "num_input_tokens_seen": 18268336, "step": 3024, "train_runtime": 3065.6354, "train_tokens_per_second": 5959.07 }, { "epoch": 1.112551724137931, "grad_norm": 0.9201357364654541, "learning_rate": 8.886434750598197e-05, "loss": 1.601, "num_input_tokens_seen": 18273840, "step": 3025, "train_runtime": 3066.5541, "train_tokens_per_second": 5959.08 }, { "epoch": 1.112919540229885, "grad_norm": 0.9534704089164734, "learning_rate": 8.882753543162157e-05, "loss": 1.4226, "num_input_tokens_seen": 18281136, "step": 3026, "train_runtime": 3067.7171, "train_tokens_per_second": 5959.199 }, { "epoch": 1.113287356321839, "grad_norm": 0.8194193243980408, "learning_rate": 8.879072335726118e-05, "loss": 1.5194, "num_input_tokens_seen": 18286432, "step": 3027, "train_runtime": 3068.6197, "train_tokens_per_second": 5959.172 }, { "epoch": 1.113655172413793, "grad_norm": 0.8776971697807312, "learning_rate": 8.875391128290079e-05, "loss": 1.4382, "num_input_tokens_seen": 18290496, "step": 3028, "train_runtime": 3069.352, "train_tokens_per_second": 5959.074 }, { "epoch": 1.114022988505747, "grad_norm": 0.9225988388061523, "learning_rate": 8.871709920854041e-05, "loss": 1.5206, "num_input_tokens_seen": 18295312, "step": 3029, "train_runtime": 3070.1649, "train_tokens_per_second": 5959.065 }, { "epoch": 1.1143908045977011, "grad_norm": 0.9015832543373108, "learning_rate": 8.868028713418002e-05, "loss": 1.3392, "num_input_tokens_seen": 18301984, "step": 3030, "train_runtime": 3071.234, "train_tokens_per_second": 5959.163 }, { "epoch": 1.1147586206896551, "grad_norm": 0.8528132438659668, "learning_rate": 8.864347505981962e-05, "loss": 1.4663, "num_input_tokens_seen": 18308896, "step": 3031, "train_runtime": 3072.8792, "train_tokens_per_second": 5958.222 }, { "epoch": 1.1151264367816092, "grad_norm": 0.917464017868042, "learning_rate": 8.860666298545923e-05, "loss": 1.6639, "num_input_tokens_seen": 18313856, "step": 3032, "train_runtime": 3073.7292, "train_tokens_per_second": 5958.188 }, { "epoch": 1.1154942528735632, "grad_norm": 0.8733834624290466, "learning_rate": 8.856985091109884e-05, "loss": 1.358, "num_input_tokens_seen": 18321152, "step": 3033, "train_runtime": 3074.8862, "train_tokens_per_second": 5958.319 }, { "epoch": 1.1158620689655172, "grad_norm": 0.9368665218353271, "learning_rate": 8.853303883673846e-05, "loss": 1.6856, "num_input_tokens_seen": 18327664, "step": 3034, "train_runtime": 3075.9424, "train_tokens_per_second": 5958.39 }, { "epoch": 1.1162298850574712, "grad_norm": 0.9064751267433167, "learning_rate": 8.849622676237807e-05, "loss": 1.5717, "num_input_tokens_seen": 18332560, "step": 3035, "train_runtime": 3076.7861, "train_tokens_per_second": 5958.347 }, { "epoch": 1.1165977011494252, "grad_norm": 0.967047393321991, "learning_rate": 8.845941468801768e-05, "loss": 1.6726, "num_input_tokens_seen": 18337856, "step": 3036, "train_runtime": 3077.68, "train_tokens_per_second": 5958.337 }, { "epoch": 1.1169655172413793, "grad_norm": 0.8143070340156555, "learning_rate": 8.842260261365729e-05, "loss": 1.6144, "num_input_tokens_seen": 18346224, "step": 3037, "train_runtime": 3078.9906, "train_tokens_per_second": 5958.519 }, { "epoch": 1.1173333333333333, "grad_norm": 0.8116313815116882, "learning_rate": 8.83857905392969e-05, "loss": 1.3194, "num_input_tokens_seen": 18352256, "step": 3038, "train_runtime": 3079.9892, "train_tokens_per_second": 5958.546 }, { "epoch": 1.1177011494252873, "grad_norm": 0.9737692475318909, "learning_rate": 8.83489784649365e-05, "loss": 1.5578, "num_input_tokens_seen": 18358192, "step": 3039, "train_runtime": 3080.9501, "train_tokens_per_second": 5958.614 }, { "epoch": 1.1180689655172413, "grad_norm": 0.8553847670555115, "learning_rate": 8.831216639057611e-05, "loss": 1.6262, "num_input_tokens_seen": 18363520, "step": 3040, "train_runtime": 3081.8439, "train_tokens_per_second": 5958.615 }, { "epoch": 1.1184367816091954, "grad_norm": 0.9897530674934387, "learning_rate": 8.827535431621572e-05, "loss": 1.6128, "num_input_tokens_seen": 18369920, "step": 3041, "train_runtime": 3082.9058, "train_tokens_per_second": 5958.638 }, { "epoch": 1.1188045977011494, "grad_norm": 0.8073896765708923, "learning_rate": 8.823854224185534e-05, "loss": 1.5645, "num_input_tokens_seen": 18376160, "step": 3042, "train_runtime": 3083.9242, "train_tokens_per_second": 5958.694 }, { "epoch": 1.1191724137931034, "grad_norm": 0.8492890000343323, "learning_rate": 8.820173016749494e-05, "loss": 1.5328, "num_input_tokens_seen": 18382176, "step": 3043, "train_runtime": 3084.9289, "train_tokens_per_second": 5958.703 }, { "epoch": 1.1195402298850574, "grad_norm": 0.7779625654220581, "learning_rate": 8.816491809313455e-05, "loss": 1.3965, "num_input_tokens_seen": 18390832, "step": 3044, "train_runtime": 3086.228, "train_tokens_per_second": 5959.0 }, { "epoch": 1.1199080459770114, "grad_norm": 1.0160466432571411, "learning_rate": 8.812810601877416e-05, "loss": 1.6625, "num_input_tokens_seen": 18396944, "step": 3045, "train_runtime": 3087.2136, "train_tokens_per_second": 5959.077 }, { "epoch": 1.1202758620689655, "grad_norm": 0.9516376852989197, "learning_rate": 8.809129394441378e-05, "loss": 1.7415, "num_input_tokens_seen": 18402048, "step": 3046, "train_runtime": 3088.0721, "train_tokens_per_second": 5959.073 }, { "epoch": 1.1206436781609195, "grad_norm": 0.9396638870239258, "learning_rate": 8.805448187005339e-05, "loss": 1.5369, "num_input_tokens_seen": 18406912, "step": 3047, "train_runtime": 3088.9072, "train_tokens_per_second": 5959.037 }, { "epoch": 1.1210114942528735, "grad_norm": 0.8862414956092834, "learning_rate": 8.8017669795693e-05, "loss": 1.5418, "num_input_tokens_seen": 18413600, "step": 3048, "train_runtime": 3089.9803, "train_tokens_per_second": 5959.132 }, { "epoch": 1.1213793103448275, "grad_norm": 0.9260058999061584, "learning_rate": 8.798085772133259e-05, "loss": 1.3787, "num_input_tokens_seen": 18420528, "step": 3049, "train_runtime": 3091.0747, "train_tokens_per_second": 5959.263 }, { "epoch": 1.1217471264367815, "grad_norm": 0.985962450504303, "learning_rate": 8.79440456469722e-05, "loss": 1.4664, "num_input_tokens_seen": 18425632, "step": 3050, "train_runtime": 3091.9215, "train_tokens_per_second": 5959.282 }, { "epoch": 1.1221149425287356, "grad_norm": 0.8389951586723328, "learning_rate": 8.790723357261182e-05, "loss": 1.5398, "num_input_tokens_seen": 18431968, "step": 3051, "train_runtime": 3092.9666, "train_tokens_per_second": 5959.317 }, { "epoch": 1.1224827586206896, "grad_norm": 0.9752079844474792, "learning_rate": 8.787042149825143e-05, "loss": 1.468, "num_input_tokens_seen": 18437408, "step": 3052, "train_runtime": 3093.8553, "train_tokens_per_second": 5959.363 }, { "epoch": 1.1228505747126436, "grad_norm": 0.8355587720870972, "learning_rate": 8.783360942389104e-05, "loss": 1.4026, "num_input_tokens_seen": 18441968, "step": 3053, "train_runtime": 3094.6498, "train_tokens_per_second": 5959.307 }, { "epoch": 1.1232183908045976, "grad_norm": 0.8331617116928101, "learning_rate": 8.779679734953065e-05, "loss": 1.3438, "num_input_tokens_seen": 18448224, "step": 3054, "train_runtime": 3095.6563, "train_tokens_per_second": 5959.39 }, { "epoch": 1.1235862068965516, "grad_norm": 0.8518046736717224, "learning_rate": 8.775998527517026e-05, "loss": 1.5592, "num_input_tokens_seen": 18453248, "step": 3055, "train_runtime": 3096.5024, "train_tokens_per_second": 5959.384 }, { "epoch": 1.1239540229885057, "grad_norm": 0.8022720217704773, "learning_rate": 8.772317320080987e-05, "loss": 1.502, "num_input_tokens_seen": 18460208, "step": 3056, "train_runtime": 3097.6209, "train_tokens_per_second": 5959.479 }, { "epoch": 1.1243218390804597, "grad_norm": 0.9089572429656982, "learning_rate": 8.768636112644948e-05, "loss": 1.5555, "num_input_tokens_seen": 18466528, "step": 3057, "train_runtime": 3098.6671, "train_tokens_per_second": 5959.507 }, { "epoch": 1.1246896551724137, "grad_norm": 0.9539327025413513, "learning_rate": 8.764954905208909e-05, "loss": 1.5741, "num_input_tokens_seen": 18471792, "step": 3058, "train_runtime": 3099.5244, "train_tokens_per_second": 5959.557 }, { "epoch": 1.1250574712643677, "grad_norm": 0.8519731163978577, "learning_rate": 8.761273697772871e-05, "loss": 1.4594, "num_input_tokens_seen": 18477232, "step": 3059, "train_runtime": 3100.4002, "train_tokens_per_second": 5959.628 }, { "epoch": 1.1254252873563217, "grad_norm": 0.8022516369819641, "learning_rate": 8.757592490336832e-05, "loss": 1.3109, "num_input_tokens_seen": 18483440, "step": 3060, "train_runtime": 3101.4069, "train_tokens_per_second": 5959.695 }, { "epoch": 1.1257931034482758, "grad_norm": 0.9718914031982422, "learning_rate": 8.753911282900791e-05, "loss": 1.5463, "num_input_tokens_seen": 18488432, "step": 3061, "train_runtime": 3102.7425, "train_tokens_per_second": 5958.739 }, { "epoch": 1.1261609195402298, "grad_norm": 0.8494237065315247, "learning_rate": 8.750230075464752e-05, "loss": 1.3881, "num_input_tokens_seen": 18495840, "step": 3062, "train_runtime": 3103.8886, "train_tokens_per_second": 5958.925 }, { "epoch": 1.126528735632184, "grad_norm": 0.9133712649345398, "learning_rate": 8.746548868028713e-05, "loss": 1.6853, "num_input_tokens_seen": 18500224, "step": 3063, "train_runtime": 3104.6616, "train_tokens_per_second": 5958.854 }, { "epoch": 1.1268965517241378, "grad_norm": 0.8555759191513062, "learning_rate": 8.742867660592675e-05, "loss": 1.4305, "num_input_tokens_seen": 18510464, "step": 3064, "train_runtime": 3106.2024, "train_tokens_per_second": 5959.194 }, { "epoch": 1.127264367816092, "grad_norm": 0.855987548828125, "learning_rate": 8.739186453156636e-05, "loss": 1.4913, "num_input_tokens_seen": 18517760, "step": 3065, "train_runtime": 3107.3419, "train_tokens_per_second": 5959.357 }, { "epoch": 1.1276321839080459, "grad_norm": 0.8938915729522705, "learning_rate": 8.735505245720597e-05, "loss": 1.5961, "num_input_tokens_seen": 18523232, "step": 3066, "train_runtime": 3108.2338, "train_tokens_per_second": 5959.407 }, { "epoch": 1.1280000000000001, "grad_norm": 0.9515122771263123, "learning_rate": 8.731824038284557e-05, "loss": 1.5187, "num_input_tokens_seen": 18528368, "step": 3067, "train_runtime": 3109.1039, "train_tokens_per_second": 5959.392 }, { "epoch": 1.128367816091954, "grad_norm": 0.8911998867988586, "learning_rate": 8.728142830848519e-05, "loss": 1.4074, "num_input_tokens_seen": 18535184, "step": 3068, "train_runtime": 3110.2233, "train_tokens_per_second": 5959.438 }, { "epoch": 1.1287356321839082, "grad_norm": 0.7230700850486755, "learning_rate": 8.72446162341248e-05, "loss": 1.4812, "num_input_tokens_seen": 18543296, "step": 3069, "train_runtime": 3111.4991, "train_tokens_per_second": 5959.602 }, { "epoch": 1.129103448275862, "grad_norm": 0.8507945537567139, "learning_rate": 8.72078041597644e-05, "loss": 1.5413, "num_input_tokens_seen": 18549344, "step": 3070, "train_runtime": 3112.4812, "train_tokens_per_second": 5959.665 }, { "epoch": 1.1294712643678162, "grad_norm": 0.9214749932289124, "learning_rate": 8.717099208540402e-05, "loss": 1.6366, "num_input_tokens_seen": 18557104, "step": 3071, "train_runtime": 3113.7089, "train_tokens_per_second": 5959.807 }, { "epoch": 1.12983908045977, "grad_norm": 0.859377920627594, "learning_rate": 8.713418001104364e-05, "loss": 1.4259, "num_input_tokens_seen": 18565088, "step": 3072, "train_runtime": 3114.9288, "train_tokens_per_second": 5960.036 }, { "epoch": 1.1302068965517242, "grad_norm": 0.8506039977073669, "learning_rate": 8.709736793668323e-05, "loss": 1.3779, "num_input_tokens_seen": 18571024, "step": 3073, "train_runtime": 3115.9378, "train_tokens_per_second": 5960.011 }, { "epoch": 1.130574712643678, "grad_norm": 0.8265760540962219, "learning_rate": 8.706055586232284e-05, "loss": 1.4175, "num_input_tokens_seen": 18578112, "step": 3074, "train_runtime": 3117.0484, "train_tokens_per_second": 5960.161 }, { "epoch": 1.1309425287356323, "grad_norm": 0.8889214992523193, "learning_rate": 8.702374378796245e-05, "loss": 1.6282, "num_input_tokens_seen": 18582896, "step": 3075, "train_runtime": 3117.8764, "train_tokens_per_second": 5960.113 }, { "epoch": 1.1313103448275863, "grad_norm": 0.9217056632041931, "learning_rate": 8.698693171360207e-05, "loss": 1.6716, "num_input_tokens_seen": 18587984, "step": 3076, "train_runtime": 3118.7364, "train_tokens_per_second": 5960.101 }, { "epoch": 1.1316781609195403, "grad_norm": 0.8785937428474426, "learning_rate": 8.695011963924168e-05, "loss": 1.5235, "num_input_tokens_seen": 18592608, "step": 3077, "train_runtime": 3119.5382, "train_tokens_per_second": 5960.051 }, { "epoch": 1.1320459770114943, "grad_norm": 1.0107359886169434, "learning_rate": 8.691330756488129e-05, "loss": 1.6961, "num_input_tokens_seen": 18598448, "step": 3078, "train_runtime": 3120.4902, "train_tokens_per_second": 5960.105 }, { "epoch": 1.1324137931034484, "grad_norm": 0.879207193851471, "learning_rate": 8.687649549052089e-05, "loss": 1.52, "num_input_tokens_seen": 18604912, "step": 3079, "train_runtime": 3121.5146, "train_tokens_per_second": 5960.219 }, { "epoch": 1.1327816091954024, "grad_norm": 0.8674408197402954, "learning_rate": 8.68396834161605e-05, "loss": 1.7051, "num_input_tokens_seen": 18610064, "step": 3080, "train_runtime": 3122.3931, "train_tokens_per_second": 5960.193 }, { "epoch": 1.1331494252873564, "grad_norm": 0.8419400453567505, "learning_rate": 8.680287134180012e-05, "loss": 1.3253, "num_input_tokens_seen": 18617360, "step": 3081, "train_runtime": 3123.5533, "train_tokens_per_second": 5960.314 }, { "epoch": 1.1335172413793104, "grad_norm": 0.8395043611526489, "learning_rate": 8.676605926743973e-05, "loss": 1.6573, "num_input_tokens_seen": 18622208, "step": 3082, "train_runtime": 3124.361, "train_tokens_per_second": 5960.325 }, { "epoch": 1.1338850574712644, "grad_norm": 0.9543777704238892, "learning_rate": 8.672924719307934e-05, "loss": 1.5714, "num_input_tokens_seen": 18626672, "step": 3083, "train_runtime": 3125.1369, "train_tokens_per_second": 5960.274 }, { "epoch": 1.1342528735632185, "grad_norm": 0.9389495849609375, "learning_rate": 8.669243511871894e-05, "loss": 1.5084, "num_input_tokens_seen": 18632048, "step": 3084, "train_runtime": 3126.0345, "train_tokens_per_second": 5960.282 }, { "epoch": 1.1346206896551725, "grad_norm": 0.9204221367835999, "learning_rate": 8.665562304435855e-05, "loss": 1.5885, "num_input_tokens_seen": 18637168, "step": 3085, "train_runtime": 3126.9033, "train_tokens_per_second": 5960.264 }, { "epoch": 1.1349885057471265, "grad_norm": 0.8767832517623901, "learning_rate": 8.661881096999816e-05, "loss": 1.5201, "num_input_tokens_seen": 18642944, "step": 3086, "train_runtime": 3127.852, "train_tokens_per_second": 5960.302 }, { "epoch": 1.1353563218390805, "grad_norm": 0.8895378708839417, "learning_rate": 8.658199889563777e-05, "loss": 1.4989, "num_input_tokens_seen": 18649344, "step": 3087, "train_runtime": 3128.9034, "train_tokens_per_second": 5960.345 }, { "epoch": 1.1357241379310345, "grad_norm": 0.9417483806610107, "learning_rate": 8.654518682127738e-05, "loss": 1.6446, "num_input_tokens_seen": 18654544, "step": 3088, "train_runtime": 3129.7597, "train_tokens_per_second": 5960.376 }, { "epoch": 1.1360919540229886, "grad_norm": 0.8545156121253967, "learning_rate": 8.6508374746917e-05, "loss": 1.563, "num_input_tokens_seen": 18661552, "step": 3089, "train_runtime": 3130.8734, "train_tokens_per_second": 5960.494 }, { "epoch": 1.1364597701149426, "grad_norm": 0.8982740044593811, "learning_rate": 8.647156267255661e-05, "loss": 1.5316, "num_input_tokens_seen": 18667072, "step": 3090, "train_runtime": 3131.7973, "train_tokens_per_second": 5960.498 }, { "epoch": 1.1368275862068966, "grad_norm": 0.8665157556533813, "learning_rate": 8.643475059819621e-05, "loss": 1.4421, "num_input_tokens_seen": 18671808, "step": 3091, "train_runtime": 3133.1126, "train_tokens_per_second": 5959.508 }, { "epoch": 1.1371954022988506, "grad_norm": 0.8474888205528259, "learning_rate": 8.639793852383582e-05, "loss": 1.4779, "num_input_tokens_seen": 18676992, "step": 3092, "train_runtime": 3133.9834, "train_tokens_per_second": 5959.506 }, { "epoch": 1.1375632183908047, "grad_norm": 0.8338071703910828, "learning_rate": 8.636112644947542e-05, "loss": 1.3291, "num_input_tokens_seen": 18681648, "step": 3093, "train_runtime": 3134.7528, "train_tokens_per_second": 5959.528 }, { "epoch": 1.1379310344827587, "grad_norm": 0.8999766111373901, "learning_rate": 8.632431437511505e-05, "loss": 1.6534, "num_input_tokens_seen": 18688048, "step": 3094, "train_runtime": 3135.7675, "train_tokens_per_second": 5959.641 }, { "epoch": 1.1382988505747127, "grad_norm": 0.883551836013794, "learning_rate": 8.628750230075466e-05, "loss": 1.6511, "num_input_tokens_seen": 18694448, "step": 3095, "train_runtime": 3136.7852, "train_tokens_per_second": 5959.748 }, { "epoch": 1.1386666666666667, "grad_norm": 0.811758279800415, "learning_rate": 8.625069022639426e-05, "loss": 1.4676, "num_input_tokens_seen": 18701344, "step": 3096, "train_runtime": 3137.8786, "train_tokens_per_second": 5959.868 }, { "epoch": 1.1390344827586207, "grad_norm": 0.9775203466415405, "learning_rate": 8.621387815203386e-05, "loss": 1.7071, "num_input_tokens_seen": 18706864, "step": 3097, "train_runtime": 3138.8017, "train_tokens_per_second": 5959.874 }, { "epoch": 1.1394022988505748, "grad_norm": 0.8970943689346313, "learning_rate": 8.617706607767348e-05, "loss": 1.6993, "num_input_tokens_seen": 18711936, "step": 3098, "train_runtime": 3139.6758, "train_tokens_per_second": 5959.831 }, { "epoch": 1.1397701149425288, "grad_norm": 0.7886869311332703, "learning_rate": 8.614025400331309e-05, "loss": 1.4806, "num_input_tokens_seen": 18717632, "step": 3099, "train_runtime": 3140.638, "train_tokens_per_second": 5959.818 }, { "epoch": 1.1401379310344828, "grad_norm": 0.8983283638954163, "learning_rate": 8.61034419289527e-05, "loss": 1.5685, "num_input_tokens_seen": 18726480, "step": 3100, "train_runtime": 3142.012, "train_tokens_per_second": 5960.028 }, { "epoch": 1.1405057471264368, "grad_norm": 0.8518079519271851, "learning_rate": 8.606662985459231e-05, "loss": 1.7461, "num_input_tokens_seen": 18731840, "step": 3101, "train_runtime": 3142.9133, "train_tokens_per_second": 5960.024 }, { "epoch": 1.1408735632183908, "grad_norm": 0.8501981496810913, "learning_rate": 8.602981778023192e-05, "loss": 1.5845, "num_input_tokens_seen": 18739376, "step": 3102, "train_runtime": 3144.1044, "train_tokens_per_second": 5960.163 }, { "epoch": 1.1412413793103449, "grad_norm": 0.9013225436210632, "learning_rate": 8.599300570587153e-05, "loss": 1.5989, "num_input_tokens_seen": 18745408, "step": 3103, "train_runtime": 3145.0857, "train_tokens_per_second": 5960.222 }, { "epoch": 1.1416091954022989, "grad_norm": 0.8777236938476562, "learning_rate": 8.595619363151114e-05, "loss": 1.4751, "num_input_tokens_seen": 18755712, "step": 3104, "train_runtime": 3146.634, "train_tokens_per_second": 5960.563 }, { "epoch": 1.141977011494253, "grad_norm": 0.823156476020813, "learning_rate": 8.591938155715074e-05, "loss": 1.3572, "num_input_tokens_seen": 18762976, "step": 3105, "train_runtime": 3147.7945, "train_tokens_per_second": 5960.674 }, { "epoch": 1.142344827586207, "grad_norm": 0.8540163636207581, "learning_rate": 8.588256948279037e-05, "loss": 1.5428, "num_input_tokens_seen": 18768480, "step": 3106, "train_runtime": 3148.703, "train_tokens_per_second": 5960.702 }, { "epoch": 1.142712643678161, "grad_norm": 0.8515554070472717, "learning_rate": 8.584575740842998e-05, "loss": 1.443, "num_input_tokens_seen": 18775968, "step": 3107, "train_runtime": 3149.8812, "train_tokens_per_second": 5960.85 }, { "epoch": 1.143080459770115, "grad_norm": 0.8569208383560181, "learning_rate": 8.580894533406959e-05, "loss": 1.2434, "num_input_tokens_seen": 18783760, "step": 3108, "train_runtime": 3151.0979, "train_tokens_per_second": 5961.021 }, { "epoch": 1.143448275862069, "grad_norm": 0.9443128108978271, "learning_rate": 8.577213325970918e-05, "loss": 1.726, "num_input_tokens_seen": 18788480, "step": 3109, "train_runtime": 3151.8997, "train_tokens_per_second": 5961.002 }, { "epoch": 1.143816091954023, "grad_norm": 0.9418705105781555, "learning_rate": 8.573532118534879e-05, "loss": 1.5209, "num_input_tokens_seen": 18796000, "step": 3110, "train_runtime": 3153.0583, "train_tokens_per_second": 5961.197 }, { "epoch": 1.144183908045977, "grad_norm": 0.8473823666572571, "learning_rate": 8.569850911098841e-05, "loss": 1.366, "num_input_tokens_seen": 18802192, "step": 3111, "train_runtime": 3154.0444, "train_tokens_per_second": 5961.296 }, { "epoch": 1.144551724137931, "grad_norm": 0.9196009039878845, "learning_rate": 8.566169703662802e-05, "loss": 1.4962, "num_input_tokens_seen": 18808256, "step": 3112, "train_runtime": 3155.0268, "train_tokens_per_second": 5961.362 }, { "epoch": 1.144919540229885, "grad_norm": 0.815726101398468, "learning_rate": 8.562488496226763e-05, "loss": 1.4066, "num_input_tokens_seen": 18815168, "step": 3113, "train_runtime": 3156.1286, "train_tokens_per_second": 5961.471 }, { "epoch": 1.145287356321839, "grad_norm": 0.8924869894981384, "learning_rate": 8.558807288790724e-05, "loss": 1.4688, "num_input_tokens_seen": 18820592, "step": 3114, "train_runtime": 3157.0382, "train_tokens_per_second": 5961.471 }, { "epoch": 1.145655172413793, "grad_norm": 0.941137969493866, "learning_rate": 8.555126081354685e-05, "loss": 1.6636, "num_input_tokens_seen": 18825520, "step": 3115, "train_runtime": 3157.8432, "train_tokens_per_second": 5961.512 }, { "epoch": 1.1460229885057471, "grad_norm": 0.813913106918335, "learning_rate": 8.551444873918646e-05, "loss": 1.4553, "num_input_tokens_seen": 18832304, "step": 3116, "train_runtime": 3158.9251, "train_tokens_per_second": 5961.618 }, { "epoch": 1.1463908045977012, "grad_norm": 0.8313441872596741, "learning_rate": 8.547763666482607e-05, "loss": 1.3608, "num_input_tokens_seen": 18840832, "step": 3117, "train_runtime": 3160.2374, "train_tokens_per_second": 5961.841 }, { "epoch": 1.1467586206896552, "grad_norm": 0.8408114314079285, "learning_rate": 8.544082459046567e-05, "loss": 1.6147, "num_input_tokens_seen": 18847872, "step": 3118, "train_runtime": 3161.354, "train_tokens_per_second": 5961.962 }, { "epoch": 1.1471264367816092, "grad_norm": 0.8338990211486816, "learning_rate": 8.54040125161053e-05, "loss": 1.4175, "num_input_tokens_seen": 18860704, "step": 3119, "train_runtime": 3163.2252, "train_tokens_per_second": 5962.492 }, { "epoch": 1.1474942528735632, "grad_norm": 0.9207831621170044, "learning_rate": 8.53672004417449e-05, "loss": 1.6247, "num_input_tokens_seen": 18865440, "step": 3120, "train_runtime": 3164.0165, "train_tokens_per_second": 5962.497 }, { "epoch": 1.1478620689655172, "grad_norm": 0.9662007689476013, "learning_rate": 8.53303883673845e-05, "loss": 1.5092, "num_input_tokens_seen": 18871680, "step": 3121, "train_runtime": 3165.5231, "train_tokens_per_second": 5961.631 }, { "epoch": 1.1482298850574713, "grad_norm": 0.8944664597511292, "learning_rate": 8.529357629302411e-05, "loss": 1.6469, "num_input_tokens_seen": 18877072, "step": 3122, "train_runtime": 3166.422, "train_tokens_per_second": 5961.641 }, { "epoch": 1.1485977011494253, "grad_norm": 0.9483094215393066, "learning_rate": 8.525676421866372e-05, "loss": 1.4102, "num_input_tokens_seen": 18882896, "step": 3123, "train_runtime": 3167.3902, "train_tokens_per_second": 5961.658 }, { "epoch": 1.1489655172413793, "grad_norm": 0.8910855650901794, "learning_rate": 8.521995214430334e-05, "loss": 1.6446, "num_input_tokens_seen": 18887904, "step": 3124, "train_runtime": 3168.2024, "train_tokens_per_second": 5961.71 }, { "epoch": 1.1493333333333333, "grad_norm": 0.9108201265335083, "learning_rate": 8.518314006994295e-05, "loss": 1.4592, "num_input_tokens_seen": 18892576, "step": 3125, "train_runtime": 3169.0123, "train_tokens_per_second": 5961.661 }, { "epoch": 1.1497011494252873, "grad_norm": 0.9536663889884949, "learning_rate": 8.514632799558256e-05, "loss": 1.8689, "num_input_tokens_seen": 18897296, "step": 3126, "train_runtime": 3169.8089, "train_tokens_per_second": 5961.651 }, { "epoch": 1.1500689655172414, "grad_norm": 0.9189017415046692, "learning_rate": 8.510951592122215e-05, "loss": 1.6326, "num_input_tokens_seen": 18901744, "step": 3127, "train_runtime": 3170.5744, "train_tokens_per_second": 5961.615 }, { "epoch": 1.1504367816091954, "grad_norm": 0.9252599477767944, "learning_rate": 8.507270384686178e-05, "loss": 1.6476, "num_input_tokens_seen": 18907872, "step": 3128, "train_runtime": 3171.563, "train_tokens_per_second": 5961.689 }, { "epoch": 1.1508045977011494, "grad_norm": 0.9546104073524475, "learning_rate": 8.503589177250139e-05, "loss": 1.642, "num_input_tokens_seen": 18912256, "step": 3129, "train_runtime": 3172.3325, "train_tokens_per_second": 5961.625 }, { "epoch": 1.1511724137931034, "grad_norm": 0.9089950919151306, "learning_rate": 8.4999079698141e-05, "loss": 1.4078, "num_input_tokens_seen": 18918768, "step": 3130, "train_runtime": 3173.3796, "train_tokens_per_second": 5961.71 }, { "epoch": 1.1515402298850574, "grad_norm": 0.8216732740402222, "learning_rate": 8.49622676237806e-05, "loss": 1.389, "num_input_tokens_seen": 18924704, "step": 3131, "train_runtime": 3174.3663, "train_tokens_per_second": 5961.727 }, { "epoch": 1.1519080459770115, "grad_norm": 0.9450916647911072, "learning_rate": 8.492545554942021e-05, "loss": 1.6209, "num_input_tokens_seen": 18931856, "step": 3132, "train_runtime": 3175.4872, "train_tokens_per_second": 5961.874 }, { "epoch": 1.1522758620689655, "grad_norm": 0.981218159198761, "learning_rate": 8.488864347505982e-05, "loss": 1.6775, "num_input_tokens_seen": 18935984, "step": 3133, "train_runtime": 3176.2149, "train_tokens_per_second": 5961.808 }, { "epoch": 1.1526436781609195, "grad_norm": 0.8865116238594055, "learning_rate": 8.485183140069943e-05, "loss": 1.4935, "num_input_tokens_seen": 18940912, "step": 3134, "train_runtime": 3177.0573, "train_tokens_per_second": 5961.779 }, { "epoch": 1.1530114942528735, "grad_norm": 0.886468768119812, "learning_rate": 8.481501932633904e-05, "loss": 1.4288, "num_input_tokens_seen": 18947968, "step": 3135, "train_runtime": 3178.223, "train_tokens_per_second": 5961.812 }, { "epoch": 1.1533793103448275, "grad_norm": 0.8873666524887085, "learning_rate": 8.477820725197866e-05, "loss": 1.5069, "num_input_tokens_seen": 18954272, "step": 3136, "train_runtime": 3179.2383, "train_tokens_per_second": 5961.891 }, { "epoch": 1.1537471264367816, "grad_norm": 0.8816490173339844, "learning_rate": 8.474139517761827e-05, "loss": 1.5566, "num_input_tokens_seen": 18959072, "step": 3137, "train_runtime": 3180.0629, "train_tokens_per_second": 5961.854 }, { "epoch": 1.1541149425287356, "grad_norm": 0.8619621992111206, "learning_rate": 8.470458310325788e-05, "loss": 1.3632, "num_input_tokens_seen": 18965120, "step": 3138, "train_runtime": 3181.0442, "train_tokens_per_second": 5961.916 }, { "epoch": 1.1544827586206896, "grad_norm": 0.8746305108070374, "learning_rate": 8.466777102889747e-05, "loss": 1.5181, "num_input_tokens_seen": 18971600, "step": 3139, "train_runtime": 3182.1005, "train_tokens_per_second": 5961.974 }, { "epoch": 1.1548505747126436, "grad_norm": 0.9130301475524902, "learning_rate": 8.463095895453708e-05, "loss": 1.5407, "num_input_tokens_seen": 18979152, "step": 3140, "train_runtime": 3183.3141, "train_tokens_per_second": 5962.073 }, { "epoch": 1.1552183908045977, "grad_norm": 0.8017939925193787, "learning_rate": 8.45941468801767e-05, "loss": 1.3054, "num_input_tokens_seen": 18984144, "step": 3141, "train_runtime": 3184.177, "train_tokens_per_second": 5962.025 }, { "epoch": 1.1555862068965517, "grad_norm": 0.8778960704803467, "learning_rate": 8.455733480581631e-05, "loss": 1.3331, "num_input_tokens_seen": 18992688, "step": 3142, "train_runtime": 3185.455, "train_tokens_per_second": 5962.316 }, { "epoch": 1.1559540229885057, "grad_norm": 0.8500275611877441, "learning_rate": 8.452052273145592e-05, "loss": 1.6502, "num_input_tokens_seen": 19000688, "step": 3143, "train_runtime": 3186.7304, "train_tokens_per_second": 5962.44 }, { "epoch": 1.1563218390804597, "grad_norm": 0.8706491589546204, "learning_rate": 8.448371065709553e-05, "loss": 1.4937, "num_input_tokens_seen": 19006160, "step": 3144, "train_runtime": 3187.6366, "train_tokens_per_second": 5962.461 }, { "epoch": 1.1566896551724137, "grad_norm": 0.9586254954338074, "learning_rate": 8.444689858273514e-05, "loss": 1.5329, "num_input_tokens_seen": 19010720, "step": 3145, "train_runtime": 3188.4048, "train_tokens_per_second": 5962.455 }, { "epoch": 1.1570574712643678, "grad_norm": 0.9184359908103943, "learning_rate": 8.441008650837475e-05, "loss": 1.5607, "num_input_tokens_seen": 19015600, "step": 3146, "train_runtime": 3189.2566, "train_tokens_per_second": 5962.393 }, { "epoch": 1.1574252873563218, "grad_norm": 0.8390594124794006, "learning_rate": 8.437327443401436e-05, "loss": 1.5284, "num_input_tokens_seen": 19021344, "step": 3147, "train_runtime": 3190.2046, "train_tokens_per_second": 5962.421 }, { "epoch": 1.1577931034482758, "grad_norm": 0.8031556606292725, "learning_rate": 8.433646235965397e-05, "loss": 1.3581, "num_input_tokens_seen": 19027728, "step": 3148, "train_runtime": 3191.2515, "train_tokens_per_second": 5962.466 }, { "epoch": 1.1581609195402298, "grad_norm": 0.9039313197135925, "learning_rate": 8.429965028529359e-05, "loss": 1.5429, "num_input_tokens_seen": 19033504, "step": 3149, "train_runtime": 3192.2037, "train_tokens_per_second": 5962.497 }, { "epoch": 1.1585287356321838, "grad_norm": 0.8582308292388916, "learning_rate": 8.42628382109332e-05, "loss": 1.5543, "num_input_tokens_seen": 19039424, "step": 3150, "train_runtime": 3193.2031, "train_tokens_per_second": 5962.485 }, { "epoch": 1.1588965517241379, "grad_norm": 0.8679171204566956, "learning_rate": 8.42260261365728e-05, "loss": 1.4109, "num_input_tokens_seen": 19043952, "step": 3151, "train_runtime": 3194.4529, "train_tokens_per_second": 5961.569 }, { "epoch": 1.1592643678160919, "grad_norm": 0.9401488304138184, "learning_rate": 8.41892140622124e-05, "loss": 1.6853, "num_input_tokens_seen": 19048688, "step": 3152, "train_runtime": 3195.279, "train_tokens_per_second": 5961.51 }, { "epoch": 1.159632183908046, "grad_norm": 0.8548392653465271, "learning_rate": 8.415240198785201e-05, "loss": 1.4421, "num_input_tokens_seen": 19059408, "step": 3153, "train_runtime": 3196.884, "train_tokens_per_second": 5961.87 }, { "epoch": 1.16, "grad_norm": 0.8348060250282288, "learning_rate": 8.411558991349163e-05, "loss": 1.3781, "num_input_tokens_seen": 19066320, "step": 3154, "train_runtime": 3197.9739, "train_tokens_per_second": 5962.0 }, { "epoch": 1.160367816091954, "grad_norm": 0.9685162305831909, "learning_rate": 8.407877783913124e-05, "loss": 1.6644, "num_input_tokens_seen": 19071120, "step": 3155, "train_runtime": 3198.7732, "train_tokens_per_second": 5962.011 }, { "epoch": 1.160735632183908, "grad_norm": 0.9082851409912109, "learning_rate": 8.404196576477085e-05, "loss": 1.5741, "num_input_tokens_seen": 19076144, "step": 3156, "train_runtime": 3199.6468, "train_tokens_per_second": 5961.953 }, { "epoch": 1.161103448275862, "grad_norm": 1.0296233892440796, "learning_rate": 8.400515369041045e-05, "loss": 1.7934, "num_input_tokens_seen": 19081152, "step": 3157, "train_runtime": 3200.4857, "train_tokens_per_second": 5961.955 }, { "epoch": 1.161471264367816, "grad_norm": 0.889957845211029, "learning_rate": 8.396834161605007e-05, "loss": 1.5453, "num_input_tokens_seen": 19089360, "step": 3158, "train_runtime": 3201.7662, "train_tokens_per_second": 5962.134 }, { "epoch": 1.16183908045977, "grad_norm": 0.9897533655166626, "learning_rate": 8.393152954168968e-05, "loss": 1.7264, "num_input_tokens_seen": 19094000, "step": 3159, "train_runtime": 3202.5681, "train_tokens_per_second": 5962.09 }, { "epoch": 1.162206896551724, "grad_norm": 0.8841046094894409, "learning_rate": 8.389471746732929e-05, "loss": 1.4584, "num_input_tokens_seen": 19099952, "step": 3160, "train_runtime": 3203.5003, "train_tokens_per_second": 5962.213 }, { "epoch": 1.162574712643678, "grad_norm": 0.9966636896133423, "learning_rate": 8.38579053929689e-05, "loss": 1.6434, "num_input_tokens_seen": 19104688, "step": 3161, "train_runtime": 3204.3033, "train_tokens_per_second": 5962.197 }, { "epoch": 1.1629425287356323, "grad_norm": 0.8869330883026123, "learning_rate": 8.38210933186085e-05, "loss": 1.3995, "num_input_tokens_seen": 19109680, "step": 3162, "train_runtime": 3205.1452, "train_tokens_per_second": 5962.188 }, { "epoch": 1.163310344827586, "grad_norm": 0.9175199866294861, "learning_rate": 8.378428124424811e-05, "loss": 1.4857, "num_input_tokens_seen": 19118912, "step": 3163, "train_runtime": 3206.5578, "train_tokens_per_second": 5962.441 }, { "epoch": 1.1636781609195403, "grad_norm": 0.9480499625205994, "learning_rate": 8.374746916988772e-05, "loss": 1.4935, "num_input_tokens_seen": 19125344, "step": 3164, "train_runtime": 3207.5855, "train_tokens_per_second": 5962.536 }, { "epoch": 1.1640459770114941, "grad_norm": 0.942071259021759, "learning_rate": 8.371065709552733e-05, "loss": 1.6727, "num_input_tokens_seen": 19131088, "step": 3165, "train_runtime": 3208.5089, "train_tokens_per_second": 5962.61 }, { "epoch": 1.1644137931034484, "grad_norm": 0.8933213949203491, "learning_rate": 8.367384502116696e-05, "loss": 1.4635, "num_input_tokens_seen": 19140320, "step": 3166, "train_runtime": 3209.9195, "train_tokens_per_second": 5962.866 }, { "epoch": 1.1647816091954022, "grad_norm": 0.9491671323776245, "learning_rate": 8.363703294680656e-05, "loss": 1.4727, "num_input_tokens_seen": 19147488, "step": 3167, "train_runtime": 3211.0507, "train_tokens_per_second": 5962.998 }, { "epoch": 1.1651494252873564, "grad_norm": 0.8721309900283813, "learning_rate": 8.360022087244617e-05, "loss": 1.4922, "num_input_tokens_seen": 19153360, "step": 3168, "train_runtime": 3212.0189, "train_tokens_per_second": 5963.028 }, { "epoch": 1.1655172413793102, "grad_norm": 0.9578979015350342, "learning_rate": 8.356340879808577e-05, "loss": 1.7023, "num_input_tokens_seen": 19157600, "step": 3169, "train_runtime": 3212.7606, "train_tokens_per_second": 5962.971 }, { "epoch": 1.1658850574712645, "grad_norm": 0.8974698781967163, "learning_rate": 8.352659672372538e-05, "loss": 1.5144, "num_input_tokens_seen": 19163920, "step": 3170, "train_runtime": 3213.7974, "train_tokens_per_second": 5963.014 }, { "epoch": 1.1662528735632183, "grad_norm": 0.9205195307731628, "learning_rate": 8.3489784649365e-05, "loss": 1.6333, "num_input_tokens_seen": 19171120, "step": 3171, "train_runtime": 3214.94, "train_tokens_per_second": 5963.135 }, { "epoch": 1.1666206896551725, "grad_norm": 0.9501519799232483, "learning_rate": 8.345297257500461e-05, "loss": 1.458, "num_input_tokens_seen": 19175200, "step": 3172, "train_runtime": 3215.6434, "train_tokens_per_second": 5963.099 }, { "epoch": 1.1669885057471263, "grad_norm": 0.9079390168190002, "learning_rate": 8.341616050064422e-05, "loss": 1.4757, "num_input_tokens_seen": 19180704, "step": 3173, "train_runtime": 3216.5616, "train_tokens_per_second": 5963.108 }, { "epoch": 1.1673563218390806, "grad_norm": 0.9358499050140381, "learning_rate": 8.337934842628383e-05, "loss": 1.5204, "num_input_tokens_seen": 19186880, "step": 3174, "train_runtime": 3217.54, "train_tokens_per_second": 5963.214 }, { "epoch": 1.1677241379310346, "grad_norm": 1.000985026359558, "learning_rate": 8.334253635192344e-05, "loss": 1.5279, "num_input_tokens_seen": 19193456, "step": 3175, "train_runtime": 3218.5911, "train_tokens_per_second": 5963.31 }, { "epoch": 1.1680919540229886, "grad_norm": 0.9262905716896057, "learning_rate": 8.330572427756304e-05, "loss": 1.4546, "num_input_tokens_seen": 19200192, "step": 3176, "train_runtime": 3219.6651, "train_tokens_per_second": 5963.413 }, { "epoch": 1.1684597701149426, "grad_norm": 0.8638454079627991, "learning_rate": 8.326891220320265e-05, "loss": 1.5662, "num_input_tokens_seen": 19206608, "step": 3177, "train_runtime": 3220.7204, "train_tokens_per_second": 5963.451 }, { "epoch": 1.1688275862068966, "grad_norm": 0.8458003401756287, "learning_rate": 8.323210012884226e-05, "loss": 1.5592, "num_input_tokens_seen": 19213984, "step": 3178, "train_runtime": 3221.9136, "train_tokens_per_second": 5963.532 }, { "epoch": 1.1691954022988507, "grad_norm": 0.9439873099327087, "learning_rate": 8.319528805448188e-05, "loss": 1.6025, "num_input_tokens_seen": 19218848, "step": 3179, "train_runtime": 3222.7549, "train_tokens_per_second": 5963.484 }, { "epoch": 1.1695632183908047, "grad_norm": 0.9297096729278564, "learning_rate": 8.315847598012148e-05, "loss": 1.5777, "num_input_tokens_seen": 19223664, "step": 3180, "train_runtime": 3223.5674, "train_tokens_per_second": 5963.475 }, { "epoch": 1.1699310344827587, "grad_norm": 0.901832640171051, "learning_rate": 8.312166390576109e-05, "loss": 1.6016, "num_input_tokens_seen": 19228240, "step": 3181, "train_runtime": 3224.915, "train_tokens_per_second": 5962.402 }, { "epoch": 1.1702988505747127, "grad_norm": 0.8717474937438965, "learning_rate": 8.30848518314007e-05, "loss": 1.5431, "num_input_tokens_seen": 19232912, "step": 3182, "train_runtime": 3225.7097, "train_tokens_per_second": 5962.382 }, { "epoch": 1.1706666666666667, "grad_norm": 1.0567877292633057, "learning_rate": 8.30480397570403e-05, "loss": 1.6796, "num_input_tokens_seen": 19237280, "step": 3183, "train_runtime": 3226.4629, "train_tokens_per_second": 5962.343 }, { "epoch": 1.1710344827586208, "grad_norm": 0.858303964138031, "learning_rate": 8.301122768267993e-05, "loss": 1.5896, "num_input_tokens_seen": 19244224, "step": 3184, "train_runtime": 3227.5823, "train_tokens_per_second": 5962.427 }, { "epoch": 1.1714022988505748, "grad_norm": 0.8872172236442566, "learning_rate": 8.297441560831954e-05, "loss": 1.3913, "num_input_tokens_seen": 19250880, "step": 3185, "train_runtime": 3228.666, "train_tokens_per_second": 5962.487 }, { "epoch": 1.1717701149425288, "grad_norm": 0.9927968978881836, "learning_rate": 8.293760353395915e-05, "loss": 1.6915, "num_input_tokens_seen": 19257008, "step": 3186, "train_runtime": 3229.6287, "train_tokens_per_second": 5962.607 }, { "epoch": 1.1721379310344828, "grad_norm": 0.8749542832374573, "learning_rate": 8.290079145959874e-05, "loss": 1.4406, "num_input_tokens_seen": 19261680, "step": 3187, "train_runtime": 3230.4144, "train_tokens_per_second": 5962.603 }, { "epoch": 1.1725057471264368, "grad_norm": 0.9581989049911499, "learning_rate": 8.286397938523836e-05, "loss": 1.6091, "num_input_tokens_seen": 19266368, "step": 3188, "train_runtime": 3231.2113, "train_tokens_per_second": 5962.584 }, { "epoch": 1.1728735632183909, "grad_norm": 0.8969200849533081, "learning_rate": 8.282716731087797e-05, "loss": 1.4148, "num_input_tokens_seen": 19271840, "step": 3189, "train_runtime": 3232.1195, "train_tokens_per_second": 5962.601 }, { "epoch": 1.173241379310345, "grad_norm": 0.9299541711807251, "learning_rate": 8.279035523651758e-05, "loss": 1.5344, "num_input_tokens_seen": 19276944, "step": 3190, "train_runtime": 3232.9493, "train_tokens_per_second": 5962.65 }, { "epoch": 1.173609195402299, "grad_norm": 0.9658132791519165, "learning_rate": 8.275354316215719e-05, "loss": 1.5201, "num_input_tokens_seen": 19282224, "step": 3191, "train_runtime": 3233.8342, "train_tokens_per_second": 5962.651 }, { "epoch": 1.173977011494253, "grad_norm": 0.793863832950592, "learning_rate": 8.27167310877968e-05, "loss": 1.5155, "num_input_tokens_seen": 19291488, "step": 3192, "train_runtime": 3235.261, "train_tokens_per_second": 5962.885 }, { "epoch": 1.174344827586207, "grad_norm": 0.9790344834327698, "learning_rate": 8.267991901343641e-05, "loss": 1.6852, "num_input_tokens_seen": 19296368, "step": 3193, "train_runtime": 3236.0983, "train_tokens_per_second": 5962.85 }, { "epoch": 1.174712643678161, "grad_norm": 0.9354575276374817, "learning_rate": 8.264310693907602e-05, "loss": 1.4438, "num_input_tokens_seen": 19302384, "step": 3194, "train_runtime": 3237.0986, "train_tokens_per_second": 5962.866 }, { "epoch": 1.175080459770115, "grad_norm": 0.9277665019035339, "learning_rate": 8.260629486471563e-05, "loss": 1.5758, "num_input_tokens_seen": 19308688, "step": 3195, "train_runtime": 3238.1108, "train_tokens_per_second": 5962.948 }, { "epoch": 1.175448275862069, "grad_norm": 1.0496010780334473, "learning_rate": 8.256948279035525e-05, "loss": 1.5927, "num_input_tokens_seen": 19314320, "step": 3196, "train_runtime": 3239.0348, "train_tokens_per_second": 5962.986 }, { "epoch": 1.175816091954023, "grad_norm": 1.0036723613739014, "learning_rate": 8.253267071599486e-05, "loss": 1.6877, "num_input_tokens_seen": 19321664, "step": 3197, "train_runtime": 3240.2072, "train_tokens_per_second": 5963.095 }, { "epoch": 1.176183908045977, "grad_norm": 0.9577779769897461, "learning_rate": 8.249585864163447e-05, "loss": 1.5991, "num_input_tokens_seen": 19326288, "step": 3198, "train_runtime": 3240.9967, "train_tokens_per_second": 5963.069 }, { "epoch": 1.176551724137931, "grad_norm": 0.858090341091156, "learning_rate": 8.245904656727406e-05, "loss": 1.3665, "num_input_tokens_seen": 19335088, "step": 3199, "train_runtime": 3242.3459, "train_tokens_per_second": 5963.302 }, { "epoch": 1.176919540229885, "grad_norm": 1.0612149238586426, "learning_rate": 8.242223449291367e-05, "loss": 1.8193, "num_input_tokens_seen": 19339920, "step": 3200, "train_runtime": 3243.1453, "train_tokens_per_second": 5963.322 }, { "epoch": 1.1772873563218391, "grad_norm": 1.0048408508300781, "learning_rate": 8.23854224185533e-05, "loss": 1.5437, "num_input_tokens_seen": 19345280, "step": 3201, "train_runtime": 3244.0508, "train_tokens_per_second": 5963.31 }, { "epoch": 1.1776551724137931, "grad_norm": 0.8895339369773865, "learning_rate": 8.23486103441929e-05, "loss": 1.5368, "num_input_tokens_seen": 19351056, "step": 3202, "train_runtime": 3245.0114, "train_tokens_per_second": 5963.325 }, { "epoch": 1.1780229885057472, "grad_norm": 0.8810693025588989, "learning_rate": 8.231179826983251e-05, "loss": 1.4941, "num_input_tokens_seen": 19355200, "step": 3203, "train_runtime": 3245.7372, "train_tokens_per_second": 5963.268 }, { "epoch": 1.1783908045977012, "grad_norm": 0.8693225979804993, "learning_rate": 8.227498619547212e-05, "loss": 1.4464, "num_input_tokens_seen": 19362144, "step": 3204, "train_runtime": 3246.8661, "train_tokens_per_second": 5963.333 }, { "epoch": 1.1787586206896552, "grad_norm": 1.0319263935089111, "learning_rate": 8.223817412111173e-05, "loss": 1.6708, "num_input_tokens_seen": 19366688, "step": 3205, "train_runtime": 3247.6717, "train_tokens_per_second": 5963.253 }, { "epoch": 1.1791264367816092, "grad_norm": 0.9654633402824402, "learning_rate": 8.220136204675134e-05, "loss": 1.6914, "num_input_tokens_seen": 19371632, "step": 3206, "train_runtime": 3248.5143, "train_tokens_per_second": 5963.228 }, { "epoch": 1.1794942528735632, "grad_norm": 0.9302749633789062, "learning_rate": 8.216454997239095e-05, "loss": 1.3702, "num_input_tokens_seen": 19379280, "step": 3207, "train_runtime": 3249.7281, "train_tokens_per_second": 5963.354 }, { "epoch": 1.1798620689655173, "grad_norm": 0.8170776963233948, "learning_rate": 8.212773789803056e-05, "loss": 1.5267, "num_input_tokens_seen": 19385744, "step": 3208, "train_runtime": 3250.7753, "train_tokens_per_second": 5963.422 }, { "epoch": 1.1802298850574713, "grad_norm": 0.913048505783081, "learning_rate": 8.209092582367018e-05, "loss": 1.5624, "num_input_tokens_seen": 19391312, "step": 3209, "train_runtime": 3251.6913, "train_tokens_per_second": 5963.454 }, { "epoch": 1.1805977011494253, "grad_norm": 0.9876195788383484, "learning_rate": 8.205411374930977e-05, "loss": 1.4671, "num_input_tokens_seen": 19397440, "step": 3210, "train_runtime": 3252.6969, "train_tokens_per_second": 5963.494 }, { "epoch": 1.1809655172413793, "grad_norm": 0.9700420498847961, "learning_rate": 8.201730167494938e-05, "loss": 1.6127, "num_input_tokens_seen": 19401920, "step": 3211, "train_runtime": 3253.9817, "train_tokens_per_second": 5962.517 }, { "epoch": 1.1813333333333333, "grad_norm": 0.740075945854187, "learning_rate": 8.198048960058899e-05, "loss": 1.4049, "num_input_tokens_seen": 19417392, "step": 3212, "train_runtime": 3256.2541, "train_tokens_per_second": 5963.107 }, { "epoch": 1.1817011494252874, "grad_norm": 0.8618344664573669, "learning_rate": 8.19436775262286e-05, "loss": 1.2838, "num_input_tokens_seen": 19423792, "step": 3213, "train_runtime": 3257.2924, "train_tokens_per_second": 5963.171 }, { "epoch": 1.1820689655172414, "grad_norm": 0.9339157342910767, "learning_rate": 8.190686545186822e-05, "loss": 1.653, "num_input_tokens_seen": 19428576, "step": 3214, "train_runtime": 3258.1024, "train_tokens_per_second": 5963.157 }, { "epoch": 1.1824367816091954, "grad_norm": 0.9181302785873413, "learning_rate": 8.187005337750783e-05, "loss": 1.5645, "num_input_tokens_seen": 19433568, "step": 3215, "train_runtime": 3258.9489, "train_tokens_per_second": 5963.14 }, { "epoch": 1.1828045977011494, "grad_norm": 0.8672519326210022, "learning_rate": 8.183324130314744e-05, "loss": 1.827, "num_input_tokens_seen": 19438432, "step": 3216, "train_runtime": 3259.7928, "train_tokens_per_second": 5963.088 }, { "epoch": 1.1831724137931035, "grad_norm": 0.9546900987625122, "learning_rate": 8.179642922878704e-05, "loss": 1.7126, "num_input_tokens_seen": 19443616, "step": 3217, "train_runtime": 3260.6545, "train_tokens_per_second": 5963.102 }, { "epoch": 1.1835402298850575, "grad_norm": 0.8584520816802979, "learning_rate": 8.175961715442666e-05, "loss": 1.4794, "num_input_tokens_seen": 19449088, "step": 3218, "train_runtime": 3261.566, "train_tokens_per_second": 5963.113 }, { "epoch": 1.1839080459770115, "grad_norm": 0.8948041796684265, "learning_rate": 8.172280508006627e-05, "loss": 1.3936, "num_input_tokens_seen": 19454400, "step": 3219, "train_runtime": 3262.4634, "train_tokens_per_second": 5963.101 }, { "epoch": 1.1842758620689655, "grad_norm": 0.9261506199836731, "learning_rate": 8.168599300570588e-05, "loss": 1.4926, "num_input_tokens_seen": 19459792, "step": 3220, "train_runtime": 3263.3702, "train_tokens_per_second": 5963.097 }, { "epoch": 1.1846436781609195, "grad_norm": 0.9783214926719666, "learning_rate": 8.164918093134548e-05, "loss": 1.5295, "num_input_tokens_seen": 19463936, "step": 3221, "train_runtime": 3264.0771, "train_tokens_per_second": 5963.075 }, { "epoch": 1.1850114942528736, "grad_norm": 0.94748854637146, "learning_rate": 8.16123688569851e-05, "loss": 1.4914, "num_input_tokens_seen": 19469328, "step": 3222, "train_runtime": 3264.9636, "train_tokens_per_second": 5963.107 }, { "epoch": 1.1853793103448276, "grad_norm": 0.90382319688797, "learning_rate": 8.15755567826247e-05, "loss": 1.5486, "num_input_tokens_seen": 19474400, "step": 3223, "train_runtime": 3265.7988, "train_tokens_per_second": 5963.135 }, { "epoch": 1.1857471264367816, "grad_norm": 0.9176757335662842, "learning_rate": 8.153874470826431e-05, "loss": 1.6369, "num_input_tokens_seen": 19478688, "step": 3224, "train_runtime": 3266.5381, "train_tokens_per_second": 5963.098 }, { "epoch": 1.1861149425287356, "grad_norm": 0.8889284133911133, "learning_rate": 8.150193263390392e-05, "loss": 1.5167, "num_input_tokens_seen": 19484944, "step": 3225, "train_runtime": 3267.5445, "train_tokens_per_second": 5963.176 }, { "epoch": 1.1864827586206896, "grad_norm": 0.879899263381958, "learning_rate": 8.146512055954354e-05, "loss": 1.3931, "num_input_tokens_seen": 19490464, "step": 3226, "train_runtime": 3268.4559, "train_tokens_per_second": 5963.202 }, { "epoch": 1.1868505747126437, "grad_norm": 0.9044172763824463, "learning_rate": 8.142830848518315e-05, "loss": 1.4089, "num_input_tokens_seen": 19498000, "step": 3227, "train_runtime": 3269.6555, "train_tokens_per_second": 5963.319 }, { "epoch": 1.1872183908045977, "grad_norm": 1.0018138885498047, "learning_rate": 8.139149641082276e-05, "loss": 1.7576, "num_input_tokens_seen": 19503024, "step": 3228, "train_runtime": 3270.5075, "train_tokens_per_second": 5963.302 }, { "epoch": 1.1875862068965517, "grad_norm": 0.9552081227302551, "learning_rate": 8.135468433646236e-05, "loss": 1.5552, "num_input_tokens_seen": 19508976, "step": 3229, "train_runtime": 3271.4854, "train_tokens_per_second": 5963.339 }, { "epoch": 1.1879540229885057, "grad_norm": 1.0562891960144043, "learning_rate": 8.131787226210196e-05, "loss": 1.4937, "num_input_tokens_seen": 19514976, "step": 3230, "train_runtime": 3272.4508, "train_tokens_per_second": 5963.413 }, { "epoch": 1.1883218390804597, "grad_norm": 0.9812391400337219, "learning_rate": 8.128106018774159e-05, "loss": 1.5314, "num_input_tokens_seen": 19521616, "step": 3231, "train_runtime": 3273.5187, "train_tokens_per_second": 5963.496 }, { "epoch": 1.1886896551724138, "grad_norm": 0.9129152297973633, "learning_rate": 8.12442481133812e-05, "loss": 1.6085, "num_input_tokens_seen": 19526848, "step": 3232, "train_runtime": 3274.3969, "train_tokens_per_second": 5963.495 }, { "epoch": 1.1890574712643678, "grad_norm": 0.8810139894485474, "learning_rate": 8.12074360390208e-05, "loss": 1.4567, "num_input_tokens_seen": 19533104, "step": 3233, "train_runtime": 3275.4096, "train_tokens_per_second": 5963.561 }, { "epoch": 1.1894252873563218, "grad_norm": 0.9950277209281921, "learning_rate": 8.117062396466041e-05, "loss": 1.6301, "num_input_tokens_seen": 19538112, "step": 3234, "train_runtime": 3276.2541, "train_tokens_per_second": 5963.552 }, { "epoch": 1.1897931034482758, "grad_norm": 0.8755245208740234, "learning_rate": 8.113381189030002e-05, "loss": 1.5151, "num_input_tokens_seen": 19546416, "step": 3235, "train_runtime": 3277.5565, "train_tokens_per_second": 5963.716 }, { "epoch": 1.1901609195402298, "grad_norm": 0.8667770624160767, "learning_rate": 8.109699981593963e-05, "loss": 1.5022, "num_input_tokens_seen": 19553776, "step": 3236, "train_runtime": 3278.7231, "train_tokens_per_second": 5963.839 }, { "epoch": 1.1905287356321839, "grad_norm": 0.7814840078353882, "learning_rate": 8.106018774157924e-05, "loss": 1.4018, "num_input_tokens_seen": 19563984, "step": 3237, "train_runtime": 3280.2633, "train_tokens_per_second": 5964.15 }, { "epoch": 1.1908965517241379, "grad_norm": 0.8585484623908997, "learning_rate": 8.102337566721885e-05, "loss": 1.442, "num_input_tokens_seen": 19569968, "step": 3238, "train_runtime": 3281.2562, "train_tokens_per_second": 5964.169 }, { "epoch": 1.191264367816092, "grad_norm": 0.8789281249046326, "learning_rate": 8.098656359285847e-05, "loss": 1.5233, "num_input_tokens_seen": 19575920, "step": 3239, "train_runtime": 3282.2032, "train_tokens_per_second": 5964.262 }, { "epoch": 1.191632183908046, "grad_norm": 0.9377002716064453, "learning_rate": 8.094975151849807e-05, "loss": 1.4642, "num_input_tokens_seen": 19581824, "step": 3240, "train_runtime": 3283.145, "train_tokens_per_second": 5964.349 }, { "epoch": 1.192, "grad_norm": 0.8184657096862793, "learning_rate": 8.091293944413768e-05, "loss": 1.409, "num_input_tokens_seen": 19592800, "step": 3241, "train_runtime": 3285.2853, "train_tokens_per_second": 5963.805 }, { "epoch": 1.192367816091954, "grad_norm": 0.8313052654266357, "learning_rate": 8.087612736977729e-05, "loss": 1.3468, "num_input_tokens_seen": 19599104, "step": 3242, "train_runtime": 3286.3025, "train_tokens_per_second": 5963.877 }, { "epoch": 1.192735632183908, "grad_norm": 0.9750943779945374, "learning_rate": 8.08393152954169e-05, "loss": 1.6016, "num_input_tokens_seen": 19603888, "step": 3243, "train_runtime": 3287.1299, "train_tokens_per_second": 5963.831 }, { "epoch": 1.193103448275862, "grad_norm": 1.0952489376068115, "learning_rate": 8.080250322105652e-05, "loss": 1.7258, "num_input_tokens_seen": 19608896, "step": 3244, "train_runtime": 3287.9824, "train_tokens_per_second": 5963.808 }, { "epoch": 1.193471264367816, "grad_norm": 0.8855782747268677, "learning_rate": 8.076569114669613e-05, "loss": 1.4628, "num_input_tokens_seen": 19614032, "step": 3245, "train_runtime": 3288.8643, "train_tokens_per_second": 5963.77 }, { "epoch": 1.19383908045977, "grad_norm": 0.9466802477836609, "learning_rate": 8.072887907233573e-05, "loss": 1.5911, "num_input_tokens_seen": 19619216, "step": 3246, "train_runtime": 3289.7111, "train_tokens_per_second": 5963.811 }, { "epoch": 1.194206896551724, "grad_norm": 0.7806699275970459, "learning_rate": 8.069206699797533e-05, "loss": 1.504, "num_input_tokens_seen": 19629616, "step": 3247, "train_runtime": 3291.2818, "train_tokens_per_second": 5964.125 }, { "epoch": 1.194574712643678, "grad_norm": 0.9241046905517578, "learning_rate": 8.065525492361495e-05, "loss": 1.2138, "num_input_tokens_seen": 19635968, "step": 3248, "train_runtime": 3292.2749, "train_tokens_per_second": 5964.255 }, { "epoch": 1.1949425287356321, "grad_norm": 0.8583694696426392, "learning_rate": 8.061844284925456e-05, "loss": 1.4875, "num_input_tokens_seen": 19643200, "step": 3249, "train_runtime": 3293.4371, "train_tokens_per_second": 5964.347 }, { "epoch": 1.1953103448275861, "grad_norm": 0.8644989728927612, "learning_rate": 8.058163077489417e-05, "loss": 1.325, "num_input_tokens_seen": 19648400, "step": 3250, "train_runtime": 3294.3087, "train_tokens_per_second": 5964.347 }, { "epoch": 1.1956781609195402, "grad_norm": 0.8890516757965088, "learning_rate": 8.054481870053378e-05, "loss": 1.5347, "num_input_tokens_seen": 19652848, "step": 3251, "train_runtime": 3295.1421, "train_tokens_per_second": 5964.188 }, { "epoch": 1.1960459770114942, "grad_norm": 0.7363216280937195, "learning_rate": 8.050800662617339e-05, "loss": 1.3499, "num_input_tokens_seen": 19660448, "step": 3252, "train_runtime": 3296.3192, "train_tokens_per_second": 5964.364 }, { "epoch": 1.1964137931034482, "grad_norm": 0.7804744839668274, "learning_rate": 8.0471194551813e-05, "loss": 1.3208, "num_input_tokens_seen": 19670288, "step": 3253, "train_runtime": 3297.8119, "train_tokens_per_second": 5964.648 }, { "epoch": 1.1967816091954022, "grad_norm": 0.9398249983787537, "learning_rate": 8.04343824774526e-05, "loss": 1.5689, "num_input_tokens_seen": 19675264, "step": 3254, "train_runtime": 3298.6672, "train_tokens_per_second": 5964.61 }, { "epoch": 1.1971494252873562, "grad_norm": 0.9330623149871826, "learning_rate": 8.039757040309221e-05, "loss": 1.4018, "num_input_tokens_seen": 19680784, "step": 3255, "train_runtime": 3299.5956, "train_tokens_per_second": 5964.605 }, { "epoch": 1.1975172413793103, "grad_norm": 0.814540445804596, "learning_rate": 8.036075832873184e-05, "loss": 1.4019, "num_input_tokens_seen": 19686688, "step": 3256, "train_runtime": 3300.5579, "train_tokens_per_second": 5964.655 }, { "epoch": 1.1978850574712643, "grad_norm": 0.9622266888618469, "learning_rate": 8.032394625437145e-05, "loss": 1.61, "num_input_tokens_seen": 19695456, "step": 3257, "train_runtime": 3301.9167, "train_tokens_per_second": 5964.856 }, { "epoch": 1.1982528735632183, "grad_norm": 0.8945811986923218, "learning_rate": 8.028713418001104e-05, "loss": 1.5055, "num_input_tokens_seen": 19701760, "step": 3258, "train_runtime": 3302.9329, "train_tokens_per_second": 5964.929 }, { "epoch": 1.1986206896551723, "grad_norm": 0.8919451832771301, "learning_rate": 8.025032210565065e-05, "loss": 1.5532, "num_input_tokens_seen": 19706656, "step": 3259, "train_runtime": 3303.7726, "train_tokens_per_second": 5964.895 }, { "epoch": 1.1989885057471263, "grad_norm": 1.008229374885559, "learning_rate": 8.021351003129026e-05, "loss": 1.5664, "num_input_tokens_seen": 19711552, "step": 3260, "train_runtime": 3304.6106, "train_tokens_per_second": 5964.864 }, { "epoch": 1.1993563218390804, "grad_norm": 0.8970891237258911, "learning_rate": 8.017669795692988e-05, "loss": 1.3042, "num_input_tokens_seen": 19716848, "step": 3261, "train_runtime": 3305.4942, "train_tokens_per_second": 5964.871 }, { "epoch": 1.1997241379310344, "grad_norm": 1.038142442703247, "learning_rate": 8.013988588256949e-05, "loss": 1.4882, "num_input_tokens_seen": 19723552, "step": 3262, "train_runtime": 3306.5639, "train_tokens_per_second": 5964.969 }, { "epoch": 1.2000919540229886, "grad_norm": 0.958101212978363, "learning_rate": 8.01030738082091e-05, "loss": 1.3517, "num_input_tokens_seen": 19731712, "step": 3263, "train_runtime": 3307.8666, "train_tokens_per_second": 5965.087 }, { "epoch": 1.2004597701149424, "grad_norm": 0.9111717343330383, "learning_rate": 8.006626173384871e-05, "loss": 1.5232, "num_input_tokens_seen": 19737856, "step": 3264, "train_runtime": 3308.8761, "train_tokens_per_second": 5965.124 }, { "epoch": 1.2004597701149424, "eval_loss": 1.7738701105117798, "eval_runtime": 4.7827, "eval_samples_per_second": 209.086, "eval_steps_per_second": 13.172, "num_input_tokens_seen": 19737856, "step": 3264 }, { "epoch": 1.2008275862068967, "grad_norm": 0.9947562217712402, "learning_rate": 8.002944965948832e-05, "loss": 1.4272, "num_input_tokens_seen": 19746112, "step": 3265, "train_runtime": 3314.9412, "train_tokens_per_second": 5956.701 }, { "epoch": 1.2011954022988505, "grad_norm": 0.9012897610664368, "learning_rate": 7.999263758512793e-05, "loss": 1.4079, "num_input_tokens_seen": 19751040, "step": 3266, "train_runtime": 3315.7739, "train_tokens_per_second": 5956.691 }, { "epoch": 1.2015632183908047, "grad_norm": 0.9524996280670166, "learning_rate": 7.995582551076753e-05, "loss": 1.2747, "num_input_tokens_seen": 19756960, "step": 3267, "train_runtime": 3316.745, "train_tokens_per_second": 5956.732 }, { "epoch": 1.2019310344827585, "grad_norm": 0.9411486387252808, "learning_rate": 7.991901343640714e-05, "loss": 1.647, "num_input_tokens_seen": 19761968, "step": 3268, "train_runtime": 3317.5922, "train_tokens_per_second": 5956.72 }, { "epoch": 1.2022988505747128, "grad_norm": 0.9171606302261353, "learning_rate": 7.988220136204677e-05, "loss": 1.5055, "num_input_tokens_seen": 19766992, "step": 3269, "train_runtime": 3318.4479, "train_tokens_per_second": 5956.698 }, { "epoch": 1.2026666666666666, "grad_norm": 0.9037192463874817, "learning_rate": 7.984538928768636e-05, "loss": 1.4344, "num_input_tokens_seen": 19772752, "step": 3270, "train_runtime": 3319.3973, "train_tokens_per_second": 5956.73 }, { "epoch": 1.2030344827586208, "grad_norm": 0.9305993318557739, "learning_rate": 7.980857721332597e-05, "loss": 1.505, "num_input_tokens_seen": 19778768, "step": 3271, "train_runtime": 3320.9448, "train_tokens_per_second": 5955.765 }, { "epoch": 1.2034022988505746, "grad_norm": 0.8040859699249268, "learning_rate": 7.977176513896558e-05, "loss": 1.1875, "num_input_tokens_seen": 19786816, "step": 3272, "train_runtime": 3322.1963, "train_tokens_per_second": 5955.944 }, { "epoch": 1.2037701149425288, "grad_norm": 0.8995404839515686, "learning_rate": 7.973495306460519e-05, "loss": 1.4169, "num_input_tokens_seen": 19792960, "step": 3273, "train_runtime": 3323.216, "train_tokens_per_second": 5955.965 }, { "epoch": 1.2041379310344829, "grad_norm": 0.9982839822769165, "learning_rate": 7.969814099024481e-05, "loss": 1.4051, "num_input_tokens_seen": 19797424, "step": 3274, "train_runtime": 3324.0011, "train_tokens_per_second": 5955.902 }, { "epoch": 1.2045057471264369, "grad_norm": 0.9728823304176331, "learning_rate": 7.966132891588442e-05, "loss": 1.5025, "num_input_tokens_seen": 19802656, "step": 3275, "train_runtime": 3324.8707, "train_tokens_per_second": 5955.918 }, { "epoch": 1.204873563218391, "grad_norm": 0.9772136211395264, "learning_rate": 7.962451684152403e-05, "loss": 1.4994, "num_input_tokens_seen": 19808768, "step": 3276, "train_runtime": 3325.8597, "train_tokens_per_second": 5955.984 }, { "epoch": 1.205241379310345, "grad_norm": 0.9749705791473389, "learning_rate": 7.958770476716362e-05, "loss": 1.6572, "num_input_tokens_seen": 19813712, "step": 3277, "train_runtime": 3326.6962, "train_tokens_per_second": 5955.973 }, { "epoch": 1.205609195402299, "grad_norm": 0.993110179901123, "learning_rate": 7.955089269280325e-05, "loss": 1.719, "num_input_tokens_seen": 19820544, "step": 3278, "train_runtime": 3327.792, "train_tokens_per_second": 5956.064 }, { "epoch": 1.205977011494253, "grad_norm": 1.0478558540344238, "learning_rate": 7.951408061844285e-05, "loss": 1.5923, "num_input_tokens_seen": 19826768, "step": 3279, "train_runtime": 3328.8087, "train_tokens_per_second": 5956.115 }, { "epoch": 1.206344827586207, "grad_norm": 0.8239120244979858, "learning_rate": 7.947726854408246e-05, "loss": 1.4741, "num_input_tokens_seen": 19834864, "step": 3280, "train_runtime": 3330.076, "train_tokens_per_second": 5956.28 }, { "epoch": 1.206712643678161, "grad_norm": 0.9192394614219666, "learning_rate": 7.944045646972207e-05, "loss": 1.4886, "num_input_tokens_seen": 19841392, "step": 3281, "train_runtime": 3331.1417, "train_tokens_per_second": 5956.334 }, { "epoch": 1.207080459770115, "grad_norm": 0.863332211971283, "learning_rate": 7.940364439536168e-05, "loss": 1.434, "num_input_tokens_seen": 19847728, "step": 3282, "train_runtime": 3332.1769, "train_tokens_per_second": 5956.385 }, { "epoch": 1.207448275862069, "grad_norm": 0.8875561356544495, "learning_rate": 7.936683232100129e-05, "loss": 1.4211, "num_input_tokens_seen": 19855440, "step": 3283, "train_runtime": 3333.3986, "train_tokens_per_second": 5956.515 }, { "epoch": 1.207816091954023, "grad_norm": 0.9878827333450317, "learning_rate": 7.93300202466409e-05, "loss": 1.6643, "num_input_tokens_seen": 19862496, "step": 3284, "train_runtime": 3334.5049, "train_tokens_per_second": 5956.655 }, { "epoch": 1.208183908045977, "grad_norm": 0.9605018496513367, "learning_rate": 7.929320817228051e-05, "loss": 1.507, "num_input_tokens_seen": 19869072, "step": 3285, "train_runtime": 3335.5712, "train_tokens_per_second": 5956.723 }, { "epoch": 1.208551724137931, "grad_norm": 0.8948702216148376, "learning_rate": 7.925639609792013e-05, "loss": 1.7011, "num_input_tokens_seen": 19875024, "step": 3286, "train_runtime": 3336.538, "train_tokens_per_second": 5956.78 }, { "epoch": 1.2089195402298851, "grad_norm": 0.91116863489151, "learning_rate": 7.921958402355974e-05, "loss": 1.5206, "num_input_tokens_seen": 19880000, "step": 3287, "train_runtime": 3337.3888, "train_tokens_per_second": 5956.753 }, { "epoch": 1.2092873563218391, "grad_norm": 0.9455022811889648, "learning_rate": 7.918277194919933e-05, "loss": 1.5129, "num_input_tokens_seen": 19887952, "step": 3288, "train_runtime": 3338.6477, "train_tokens_per_second": 5956.888 }, { "epoch": 1.2096551724137932, "grad_norm": 0.9699750542640686, "learning_rate": 7.914595987483894e-05, "loss": 1.4118, "num_input_tokens_seen": 19894016, "step": 3289, "train_runtime": 3339.6358, "train_tokens_per_second": 5956.942 }, { "epoch": 1.2100229885057472, "grad_norm": 0.9239062666893005, "learning_rate": 7.910914780047855e-05, "loss": 1.6096, "num_input_tokens_seen": 19899472, "step": 3290, "train_runtime": 3340.5408, "train_tokens_per_second": 5956.961 }, { "epoch": 1.2103908045977012, "grad_norm": 0.9467385411262512, "learning_rate": 7.907233572611818e-05, "loss": 1.4547, "num_input_tokens_seen": 19906336, "step": 3291, "train_runtime": 3341.6436, "train_tokens_per_second": 5957.049 }, { "epoch": 1.2107586206896552, "grad_norm": 0.9696337580680847, "learning_rate": 7.903552365175778e-05, "loss": 1.4063, "num_input_tokens_seen": 19912016, "step": 3292, "train_runtime": 3342.558, "train_tokens_per_second": 5957.119 }, { "epoch": 1.2111264367816093, "grad_norm": 0.8752827048301697, "learning_rate": 7.899871157739739e-05, "loss": 1.5106, "num_input_tokens_seen": 19917504, "step": 3293, "train_runtime": 3343.4682, "train_tokens_per_second": 5957.139 }, { "epoch": 1.2114942528735633, "grad_norm": 0.923297643661499, "learning_rate": 7.8961899503037e-05, "loss": 1.6722, "num_input_tokens_seen": 19922128, "step": 3294, "train_runtime": 3344.2603, "train_tokens_per_second": 5957.11 }, { "epoch": 1.2118620689655173, "grad_norm": 1.0017191171646118, "learning_rate": 7.892508742867661e-05, "loss": 1.5588, "num_input_tokens_seen": 19929072, "step": 3295, "train_runtime": 3345.3518, "train_tokens_per_second": 5957.242 }, { "epoch": 1.2122298850574713, "grad_norm": 0.9738130569458008, "learning_rate": 7.888827535431622e-05, "loss": 1.7527, "num_input_tokens_seen": 19933536, "step": 3296, "train_runtime": 3346.1158, "train_tokens_per_second": 5957.216 }, { "epoch": 1.2125977011494253, "grad_norm": 0.9487571120262146, "learning_rate": 7.885146327995583e-05, "loss": 1.3576, "num_input_tokens_seen": 19938496, "step": 3297, "train_runtime": 3346.9599, "train_tokens_per_second": 5957.196 }, { "epoch": 1.2129655172413794, "grad_norm": 0.9088518619537354, "learning_rate": 7.881465120559544e-05, "loss": 1.635, "num_input_tokens_seen": 19943104, "step": 3298, "train_runtime": 3347.7464, "train_tokens_per_second": 5957.173 }, { "epoch": 1.2133333333333334, "grad_norm": 1.029585599899292, "learning_rate": 7.877783913123506e-05, "loss": 1.3664, "num_input_tokens_seen": 19948304, "step": 3299, "train_runtime": 3348.6192, "train_tokens_per_second": 5957.173 }, { "epoch": 1.2137011494252874, "grad_norm": 0.9265835881233215, "learning_rate": 7.874102705687466e-05, "loss": 1.6813, "num_input_tokens_seen": 19954368, "step": 3300, "train_runtime": 3349.6059, "train_tokens_per_second": 5957.229 }, { "epoch": 1.2140689655172414, "grad_norm": 0.877527117729187, "learning_rate": 7.870421498251426e-05, "loss": 1.4318, "num_input_tokens_seen": 19960304, "step": 3301, "train_runtime": 3351.1194, "train_tokens_per_second": 5956.309 }, { "epoch": 1.2144367816091954, "grad_norm": 0.9234224557876587, "learning_rate": 7.866740290815387e-05, "loss": 1.6335, "num_input_tokens_seen": 19965232, "step": 3302, "train_runtime": 3351.962, "train_tokens_per_second": 5956.282 }, { "epoch": 1.2148045977011495, "grad_norm": 0.9050441384315491, "learning_rate": 7.863059083379348e-05, "loss": 1.6388, "num_input_tokens_seen": 19972032, "step": 3303, "train_runtime": 3353.0618, "train_tokens_per_second": 5956.357 }, { "epoch": 1.2151724137931035, "grad_norm": 0.9452304840087891, "learning_rate": 7.85937787594331e-05, "loss": 1.4423, "num_input_tokens_seen": 19977728, "step": 3304, "train_runtime": 3353.9726, "train_tokens_per_second": 5956.437 }, { "epoch": 1.2155402298850575, "grad_norm": 0.9913032650947571, "learning_rate": 7.855696668507271e-05, "loss": 1.5538, "num_input_tokens_seen": 19983664, "step": 3305, "train_runtime": 3354.9354, "train_tokens_per_second": 5956.497 }, { "epoch": 1.2159080459770115, "grad_norm": 0.9770853519439697, "learning_rate": 7.852015461071232e-05, "loss": 1.506, "num_input_tokens_seen": 19989632, "step": 3306, "train_runtime": 3355.9187, "train_tokens_per_second": 5956.53 }, { "epoch": 1.2162758620689655, "grad_norm": 0.8538823127746582, "learning_rate": 7.848334253635192e-05, "loss": 1.5763, "num_input_tokens_seen": 19997840, "step": 3307, "train_runtime": 3357.1881, "train_tokens_per_second": 5956.723 }, { "epoch": 1.2166436781609196, "grad_norm": 0.895853579044342, "learning_rate": 7.844653046199154e-05, "loss": 1.271, "num_input_tokens_seen": 20003536, "step": 3308, "train_runtime": 3358.1215, "train_tokens_per_second": 5956.764 }, { "epoch": 1.2170114942528736, "grad_norm": 0.9088481068611145, "learning_rate": 7.840971838763115e-05, "loss": 1.5255, "num_input_tokens_seen": 20009440, "step": 3309, "train_runtime": 3359.1074, "train_tokens_per_second": 5956.773 }, { "epoch": 1.2173793103448276, "grad_norm": 0.8840969204902649, "learning_rate": 7.837290631327076e-05, "loss": 1.3131, "num_input_tokens_seen": 20015936, "step": 3310, "train_runtime": 3360.1347, "train_tokens_per_second": 5956.885 }, { "epoch": 1.2177471264367816, "grad_norm": 0.9156765341758728, "learning_rate": 7.833609423891037e-05, "loss": 1.5565, "num_input_tokens_seen": 20021232, "step": 3311, "train_runtime": 3361.0099, "train_tokens_per_second": 5956.91 }, { "epoch": 1.2181149425287356, "grad_norm": 0.9763259887695312, "learning_rate": 7.829928216454998e-05, "loss": 1.5611, "num_input_tokens_seen": 20026320, "step": 3312, "train_runtime": 3361.8524, "train_tokens_per_second": 5956.93 }, { "epoch": 1.2184827586206897, "grad_norm": 0.9076117277145386, "learning_rate": 7.826247009018958e-05, "loss": 1.5586, "num_input_tokens_seen": 20032352, "step": 3313, "train_runtime": 3362.8099, "train_tokens_per_second": 5957.028 }, { "epoch": 1.2188505747126437, "grad_norm": 0.9422586560249329, "learning_rate": 7.822565801582919e-05, "loss": 1.7319, "num_input_tokens_seen": 20038032, "step": 3314, "train_runtime": 3363.7472, "train_tokens_per_second": 5957.056 }, { "epoch": 1.2192183908045977, "grad_norm": 0.915673553943634, "learning_rate": 7.81888459414688e-05, "loss": 1.6474, "num_input_tokens_seen": 20044608, "step": 3315, "train_runtime": 3364.8075, "train_tokens_per_second": 5957.134 }, { "epoch": 1.2195862068965517, "grad_norm": 0.9027487635612488, "learning_rate": 7.815203386710842e-05, "loss": 1.5432, "num_input_tokens_seen": 20049632, "step": 3316, "train_runtime": 3365.6536, "train_tokens_per_second": 5957.129 }, { "epoch": 1.2199540229885057, "grad_norm": 0.9269093871116638, "learning_rate": 7.811522179274803e-05, "loss": 1.4685, "num_input_tokens_seen": 20057664, "step": 3317, "train_runtime": 3366.924, "train_tokens_per_second": 5957.267 }, { "epoch": 1.2203218390804598, "grad_norm": 0.9414156079292297, "learning_rate": 7.807840971838763e-05, "loss": 1.3832, "num_input_tokens_seen": 20061456, "step": 3318, "train_runtime": 3367.6103, "train_tokens_per_second": 5957.179 }, { "epoch": 1.2206896551724138, "grad_norm": 0.9017217755317688, "learning_rate": 7.804159764402724e-05, "loss": 1.3757, "num_input_tokens_seen": 20067840, "step": 3319, "train_runtime": 3368.6296, "train_tokens_per_second": 5957.271 }, { "epoch": 1.2210574712643678, "grad_norm": 0.8100501894950867, "learning_rate": 7.800478556966685e-05, "loss": 1.4528, "num_input_tokens_seen": 20074448, "step": 3320, "train_runtime": 3369.6969, "train_tokens_per_second": 5957.345 }, { "epoch": 1.2214252873563218, "grad_norm": 0.9677010774612427, "learning_rate": 7.796797349530647e-05, "loss": 1.6126, "num_input_tokens_seen": 20080608, "step": 3321, "train_runtime": 3370.6894, "train_tokens_per_second": 5957.419 }, { "epoch": 1.2217931034482759, "grad_norm": 0.9213995933532715, "learning_rate": 7.793116142094608e-05, "loss": 1.4875, "num_input_tokens_seen": 20086320, "step": 3322, "train_runtime": 3371.654, "train_tokens_per_second": 5957.409 }, { "epoch": 1.2221609195402299, "grad_norm": 0.862701416015625, "learning_rate": 7.789434934658569e-05, "loss": 1.3909, "num_input_tokens_seen": 20092064, "step": 3323, "train_runtime": 3372.6159, "train_tokens_per_second": 5957.412 }, { "epoch": 1.222528735632184, "grad_norm": 0.9248855710029602, "learning_rate": 7.78575372722253e-05, "loss": 1.5429, "num_input_tokens_seen": 20097008, "step": 3324, "train_runtime": 3373.4714, "train_tokens_per_second": 5957.367 }, { "epoch": 1.222896551724138, "grad_norm": 0.8546602129936218, "learning_rate": 7.78207251978649e-05, "loss": 1.5184, "num_input_tokens_seen": 20105024, "step": 3325, "train_runtime": 3374.714, "train_tokens_per_second": 5957.549 }, { "epoch": 1.223264367816092, "grad_norm": 0.9670182466506958, "learning_rate": 7.778391312350451e-05, "loss": 1.48, "num_input_tokens_seen": 20110864, "step": 3326, "train_runtime": 3375.6595, "train_tokens_per_second": 5957.61 }, { "epoch": 1.223632183908046, "grad_norm": 0.929133951663971, "learning_rate": 7.774710104914412e-05, "loss": 1.5064, "num_input_tokens_seen": 20117952, "step": 3327, "train_runtime": 3376.7944, "train_tokens_per_second": 5957.707 }, { "epoch": 1.224, "grad_norm": 0.7855772972106934, "learning_rate": 7.771028897478373e-05, "loss": 1.4014, "num_input_tokens_seen": 20126416, "step": 3328, "train_runtime": 3378.1162, "train_tokens_per_second": 5957.881 }, { "epoch": 1.224367816091954, "grad_norm": 0.9452453851699829, "learning_rate": 7.767347690042335e-05, "loss": 1.415, "num_input_tokens_seen": 20133056, "step": 3329, "train_runtime": 3379.1673, "train_tokens_per_second": 5957.993 }, { "epoch": 1.224735632183908, "grad_norm": 0.8732830286026001, "learning_rate": 7.763666482606295e-05, "loss": 1.4347, "num_input_tokens_seen": 20140016, "step": 3330, "train_runtime": 3380.2947, "train_tokens_per_second": 5958.065 }, { "epoch": 1.225103448275862, "grad_norm": 0.8743560910224915, "learning_rate": 7.759985275170256e-05, "loss": 1.613, "num_input_tokens_seen": 20145344, "step": 3331, "train_runtime": 3381.6724, "train_tokens_per_second": 5957.213 }, { "epoch": 1.225471264367816, "grad_norm": 0.9391189813613892, "learning_rate": 7.756304067734217e-05, "loss": 1.4375, "num_input_tokens_seen": 20153328, "step": 3332, "train_runtime": 3382.9303, "train_tokens_per_second": 5957.358 }, { "epoch": 1.22583908045977, "grad_norm": 0.9103835821151733, "learning_rate": 7.752622860298178e-05, "loss": 1.3814, "num_input_tokens_seen": 20159488, "step": 3333, "train_runtime": 3383.9495, "train_tokens_per_second": 5957.384 }, { "epoch": 1.226206896551724, "grad_norm": 0.9309260845184326, "learning_rate": 7.74894165286214e-05, "loss": 1.5395, "num_input_tokens_seen": 20164928, "step": 3334, "train_runtime": 3384.8435, "train_tokens_per_second": 5957.418 }, { "epoch": 1.2265747126436781, "grad_norm": 0.8227443695068359, "learning_rate": 7.745260445426101e-05, "loss": 1.306, "num_input_tokens_seen": 20172464, "step": 3335, "train_runtime": 3386.0466, "train_tokens_per_second": 5957.527 }, { "epoch": 1.2269425287356321, "grad_norm": 0.9939490556716919, "learning_rate": 7.741579237990062e-05, "loss": 1.6273, "num_input_tokens_seen": 20177472, "step": 3336, "train_runtime": 3386.8994, "train_tokens_per_second": 5957.506 }, { "epoch": 1.2273103448275862, "grad_norm": 0.9474799633026123, "learning_rate": 7.737898030554021e-05, "loss": 1.497, "num_input_tokens_seen": 20182352, "step": 3337, "train_runtime": 3387.7387, "train_tokens_per_second": 5957.47 }, { "epoch": 1.2276781609195402, "grad_norm": 0.8516086935997009, "learning_rate": 7.734216823117983e-05, "loss": 1.5328, "num_input_tokens_seen": 20188432, "step": 3338, "train_runtime": 3388.7228, "train_tokens_per_second": 5957.534 }, { "epoch": 1.2280459770114942, "grad_norm": 0.8753452301025391, "learning_rate": 7.730535615681944e-05, "loss": 1.5309, "num_input_tokens_seen": 20194128, "step": 3339, "train_runtime": 3389.6455, "train_tokens_per_second": 5957.593 }, { "epoch": 1.2284137931034482, "grad_norm": 0.9226855635643005, "learning_rate": 7.726854408245905e-05, "loss": 1.46, "num_input_tokens_seen": 20200960, "step": 3340, "train_runtime": 3390.7216, "train_tokens_per_second": 5957.717 }, { "epoch": 1.2287816091954022, "grad_norm": 0.8776497840881348, "learning_rate": 7.723173200809866e-05, "loss": 1.4609, "num_input_tokens_seen": 20208640, "step": 3341, "train_runtime": 3391.9078, "train_tokens_per_second": 5957.898 }, { "epoch": 1.2291494252873563, "grad_norm": 0.895530641078949, "learning_rate": 7.719491993373827e-05, "loss": 1.4375, "num_input_tokens_seen": 20214448, "step": 3342, "train_runtime": 3392.8552, "train_tokens_per_second": 5957.946 }, { "epoch": 1.2295172413793103, "grad_norm": 0.9471902847290039, "learning_rate": 7.715810785937788e-05, "loss": 1.6677, "num_input_tokens_seen": 20219600, "step": 3343, "train_runtime": 3393.7461, "train_tokens_per_second": 5957.9 }, { "epoch": 1.2298850574712643, "grad_norm": 0.8841742873191833, "learning_rate": 7.712129578501749e-05, "loss": 1.5955, "num_input_tokens_seen": 20224944, "step": 3344, "train_runtime": 3394.6294, "train_tokens_per_second": 5957.924 }, { "epoch": 1.2302528735632183, "grad_norm": 0.9034956097602844, "learning_rate": 7.70844837106571e-05, "loss": 1.5876, "num_input_tokens_seen": 20229824, "step": 3345, "train_runtime": 3395.4545, "train_tokens_per_second": 5957.913 }, { "epoch": 1.2306206896551724, "grad_norm": 0.9193718433380127, "learning_rate": 7.704767163629672e-05, "loss": 1.4901, "num_input_tokens_seen": 20235920, "step": 3346, "train_runtime": 3396.4454, "train_tokens_per_second": 5957.97 }, { "epoch": 1.2309885057471264, "grad_norm": 0.9795694947242737, "learning_rate": 7.701085956193633e-05, "loss": 1.628, "num_input_tokens_seen": 20240736, "step": 3347, "train_runtime": 3397.2627, "train_tokens_per_second": 5957.954 }, { "epoch": 1.2313563218390804, "grad_norm": 0.9909173250198364, "learning_rate": 7.697404748757592e-05, "loss": 1.55, "num_input_tokens_seen": 20246336, "step": 3348, "train_runtime": 3398.174, "train_tokens_per_second": 5958.005 }, { "epoch": 1.2317241379310344, "grad_norm": 0.9607061147689819, "learning_rate": 7.693723541321553e-05, "loss": 1.6975, "num_input_tokens_seen": 20252016, "step": 3349, "train_runtime": 3399.0909, "train_tokens_per_second": 5958.068 }, { "epoch": 1.2320919540229884, "grad_norm": 0.9655289053916931, "learning_rate": 7.690042333885514e-05, "loss": 1.4483, "num_input_tokens_seen": 20256976, "step": 3350, "train_runtime": 3399.9044, "train_tokens_per_second": 5958.102 }, { "epoch": 1.2324597701149425, "grad_norm": 0.9344881176948547, "learning_rate": 7.686361126449476e-05, "loss": 1.6377, "num_input_tokens_seen": 20262368, "step": 3351, "train_runtime": 3400.7954, "train_tokens_per_second": 5958.126 }, { "epoch": 1.2328275862068965, "grad_norm": 0.988397479057312, "learning_rate": 7.682679919013437e-05, "loss": 1.5678, "num_input_tokens_seen": 20267104, "step": 3352, "train_runtime": 3401.5778, "train_tokens_per_second": 5958.148 }, { "epoch": 1.2331954022988505, "grad_norm": 0.9660370945930481, "learning_rate": 7.678998711577398e-05, "loss": 1.7162, "num_input_tokens_seen": 20272720, "step": 3353, "train_runtime": 3402.4825, "train_tokens_per_second": 5958.214 }, { "epoch": 1.2335632183908045, "grad_norm": 0.774196982383728, "learning_rate": 7.675317504141359e-05, "loss": 1.535, "num_input_tokens_seen": 20279856, "step": 3354, "train_runtime": 3403.62, "train_tokens_per_second": 5958.32 }, { "epoch": 1.2339310344827585, "grad_norm": 0.8448355793952942, "learning_rate": 7.67163629670532e-05, "loss": 1.3612, "num_input_tokens_seen": 20284512, "step": 3355, "train_runtime": 3404.4459, "train_tokens_per_second": 5958.242 }, { "epoch": 1.2342988505747126, "grad_norm": 0.8992934823036194, "learning_rate": 7.667955089269281e-05, "loss": 1.5434, "num_input_tokens_seen": 20289232, "step": 3356, "train_runtime": 3405.2756, "train_tokens_per_second": 5958.176 }, { "epoch": 1.2346666666666666, "grad_norm": 1.0435458421707153, "learning_rate": 7.664273881833242e-05, "loss": 1.4346, "num_input_tokens_seen": 20293312, "step": 3357, "train_runtime": 3406.0082, "train_tokens_per_second": 5958.093 }, { "epoch": 1.2350344827586206, "grad_norm": 0.9971229434013367, "learning_rate": 7.660592674397203e-05, "loss": 1.715, "num_input_tokens_seen": 20297872, "step": 3358, "train_runtime": 3406.8209, "train_tokens_per_second": 5958.01 }, { "epoch": 1.2354022988505746, "grad_norm": 0.9586120843887329, "learning_rate": 7.656911466961165e-05, "loss": 1.5779, "num_input_tokens_seen": 20303328, "step": 3359, "train_runtime": 3407.7414, "train_tokens_per_second": 5958.001 }, { "epoch": 1.2357701149425286, "grad_norm": 0.9365577101707458, "learning_rate": 7.653230259525124e-05, "loss": 1.3955, "num_input_tokens_seen": 20307904, "step": 3360, "train_runtime": 3408.5291, "train_tokens_per_second": 5957.967 }, { "epoch": 1.2361379310344827, "grad_norm": 0.8653137683868408, "learning_rate": 7.649549052089085e-05, "loss": 1.5332, "num_input_tokens_seen": 20313024, "step": 3361, "train_runtime": 3409.9399, "train_tokens_per_second": 5957.004 }, { "epoch": 1.236505747126437, "grad_norm": 0.9239800572395325, "learning_rate": 7.645867844653046e-05, "loss": 1.5335, "num_input_tokens_seen": 20318320, "step": 3362, "train_runtime": 3410.8195, "train_tokens_per_second": 5957.02 }, { "epoch": 1.2368735632183907, "grad_norm": 0.923174262046814, "learning_rate": 7.642186637217007e-05, "loss": 1.6279, "num_input_tokens_seen": 20323024, "step": 3363, "train_runtime": 3411.6414, "train_tokens_per_second": 5956.964 }, { "epoch": 1.237241379310345, "grad_norm": 0.973044753074646, "learning_rate": 7.638505429780969e-05, "loss": 1.527, "num_input_tokens_seen": 20329472, "step": 3364, "train_runtime": 3412.6722, "train_tokens_per_second": 5957.054 }, { "epoch": 1.2376091954022987, "grad_norm": 0.8200168609619141, "learning_rate": 7.63482422234493e-05, "loss": 1.4998, "num_input_tokens_seen": 20336240, "step": 3365, "train_runtime": 3413.7453, "train_tokens_per_second": 5957.164 }, { "epoch": 1.237977011494253, "grad_norm": 0.9200677871704102, "learning_rate": 7.63114301490889e-05, "loss": 1.4429, "num_input_tokens_seen": 20345504, "step": 3366, "train_runtime": 3415.1698, "train_tokens_per_second": 5957.392 }, { "epoch": 1.2383448275862068, "grad_norm": 0.936782717704773, "learning_rate": 7.62746180747285e-05, "loss": 1.5116, "num_input_tokens_seen": 20350368, "step": 3367, "train_runtime": 3415.9867, "train_tokens_per_second": 5957.391 }, { "epoch": 1.238712643678161, "grad_norm": 0.8578950762748718, "learning_rate": 7.623780600036813e-05, "loss": 1.621, "num_input_tokens_seen": 20357280, "step": 3368, "train_runtime": 3417.0924, "train_tokens_per_second": 5957.486 }, { "epoch": 1.2390804597701148, "grad_norm": 0.9597526788711548, "learning_rate": 7.620099392600774e-05, "loss": 1.6272, "num_input_tokens_seen": 20361760, "step": 3369, "train_runtime": 3417.8722, "train_tokens_per_second": 5957.437 }, { "epoch": 1.239448275862069, "grad_norm": 0.9248815178871155, "learning_rate": 7.616418185164735e-05, "loss": 1.4413, "num_input_tokens_seen": 20367568, "step": 3370, "train_runtime": 3418.8229, "train_tokens_per_second": 5957.48 }, { "epoch": 1.2398160919540229, "grad_norm": 0.9244171380996704, "learning_rate": 7.612736977728695e-05, "loss": 1.3942, "num_input_tokens_seen": 20378224, "step": 3371, "train_runtime": 3420.4181, "train_tokens_per_second": 5957.817 }, { "epoch": 1.2401839080459771, "grad_norm": 1.0480886697769165, "learning_rate": 7.609055770292656e-05, "loss": 1.5966, "num_input_tokens_seen": 20386944, "step": 3372, "train_runtime": 3421.7675, "train_tokens_per_second": 5958.016 }, { "epoch": 1.240551724137931, "grad_norm": 0.8595100045204163, "learning_rate": 7.605374562856617e-05, "loss": 1.4655, "num_input_tokens_seen": 20393376, "step": 3373, "train_runtime": 3422.7904, "train_tokens_per_second": 5958.114 }, { "epoch": 1.2409195402298852, "grad_norm": 0.8628688454627991, "learning_rate": 7.601693355420578e-05, "loss": 1.3638, "num_input_tokens_seen": 20399552, "step": 3374, "train_runtime": 3423.7885, "train_tokens_per_second": 5958.181 }, { "epoch": 1.2412873563218392, "grad_norm": 1.0187793970108032, "learning_rate": 7.598012147984539e-05, "loss": 1.515, "num_input_tokens_seen": 20405296, "step": 3375, "train_runtime": 3424.7322, "train_tokens_per_second": 5958.217 }, { "epoch": 1.2416551724137932, "grad_norm": 0.9930346012115479, "learning_rate": 7.594330940548501e-05, "loss": 1.5144, "num_input_tokens_seen": 20412224, "step": 3376, "train_runtime": 3425.8343, "train_tokens_per_second": 5958.322 }, { "epoch": 1.2420229885057472, "grad_norm": 1.0066184997558594, "learning_rate": 7.590649733112462e-05, "loss": 1.5928, "num_input_tokens_seen": 20417072, "step": 3377, "train_runtime": 3426.6405, "train_tokens_per_second": 5958.335 }, { "epoch": 1.2423908045977012, "grad_norm": 0.9400173425674438, "learning_rate": 7.586968525676422e-05, "loss": 1.3556, "num_input_tokens_seen": 20422576, "step": 3378, "train_runtime": 3427.5715, "train_tokens_per_second": 5958.322 }, { "epoch": 1.2427586206896553, "grad_norm": 0.9621667265892029, "learning_rate": 7.583287318240383e-05, "loss": 1.4669, "num_input_tokens_seen": 20427552, "step": 3379, "train_runtime": 3428.426, "train_tokens_per_second": 5958.289 }, { "epoch": 1.2431264367816093, "grad_norm": 0.9765159487724304, "learning_rate": 7.579606110804343e-05, "loss": 1.3966, "num_input_tokens_seen": 20433408, "step": 3380, "train_runtime": 3429.3912, "train_tokens_per_second": 5958.319 }, { "epoch": 1.2434942528735633, "grad_norm": 1.0458918809890747, "learning_rate": 7.575924903368306e-05, "loss": 1.4234, "num_input_tokens_seen": 20441296, "step": 3381, "train_runtime": 3430.6439, "train_tokens_per_second": 5958.443 }, { "epoch": 1.2438620689655173, "grad_norm": 1.007415533065796, "learning_rate": 7.572243695932267e-05, "loss": 1.6186, "num_input_tokens_seen": 20447840, "step": 3382, "train_runtime": 3431.6697, "train_tokens_per_second": 5958.569 }, { "epoch": 1.2442298850574713, "grad_norm": 0.8871510624885559, "learning_rate": 7.568562488496227e-05, "loss": 1.4455, "num_input_tokens_seen": 20453056, "step": 3383, "train_runtime": 3432.5466, "train_tokens_per_second": 5958.566 }, { "epoch": 1.2445977011494254, "grad_norm": 1.016754150390625, "learning_rate": 7.564881281060188e-05, "loss": 1.6171, "num_input_tokens_seen": 20457344, "step": 3384, "train_runtime": 3433.3161, "train_tokens_per_second": 5958.48 }, { "epoch": 1.2449655172413794, "grad_norm": 0.9223800897598267, "learning_rate": 7.561200073624149e-05, "loss": 1.5945, "num_input_tokens_seen": 20463504, "step": 3385, "train_runtime": 3434.3293, "train_tokens_per_second": 5958.515 }, { "epoch": 1.2453333333333334, "grad_norm": 0.9652520418167114, "learning_rate": 7.55751886618811e-05, "loss": 1.7901, "num_input_tokens_seen": 20468960, "step": 3386, "train_runtime": 3435.2045, "train_tokens_per_second": 5958.586 }, { "epoch": 1.2457011494252874, "grad_norm": 0.9440248012542725, "learning_rate": 7.553837658752071e-05, "loss": 1.5111, "num_input_tokens_seen": 20475712, "step": 3387, "train_runtime": 3436.3015, "train_tokens_per_second": 5958.648 }, { "epoch": 1.2460689655172414, "grad_norm": 0.993414044380188, "learning_rate": 7.550156451316032e-05, "loss": 1.4885, "num_input_tokens_seen": 20480352, "step": 3388, "train_runtime": 3437.0984, "train_tokens_per_second": 5958.617 }, { "epoch": 1.2464367816091955, "grad_norm": 0.8374962210655212, "learning_rate": 7.546475243879994e-05, "loss": 1.4917, "num_input_tokens_seen": 20488464, "step": 3389, "train_runtime": 3438.3627, "train_tokens_per_second": 5958.785 }, { "epoch": 1.2468045977011495, "grad_norm": 0.9228314757347107, "learning_rate": 7.542794036443954e-05, "loss": 1.5263, "num_input_tokens_seen": 20494704, "step": 3390, "train_runtime": 3439.4022, "train_tokens_per_second": 5958.798 }, { "epoch": 1.2471724137931035, "grad_norm": 0.8830683827400208, "learning_rate": 7.539112829007915e-05, "loss": 1.3694, "num_input_tokens_seen": 20500816, "step": 3391, "train_runtime": 3440.9345, "train_tokens_per_second": 5957.921 }, { "epoch": 1.2475402298850575, "grad_norm": 0.9051899313926697, "learning_rate": 7.535431621571875e-05, "loss": 1.5687, "num_input_tokens_seen": 20505360, "step": 3392, "train_runtime": 3441.6919, "train_tokens_per_second": 5957.93 }, { "epoch": 1.2479080459770115, "grad_norm": 0.9094662070274353, "learning_rate": 7.531750414135836e-05, "loss": 1.5989, "num_input_tokens_seen": 20511072, "step": 3393, "train_runtime": 3442.6438, "train_tokens_per_second": 5957.942 }, { "epoch": 1.2482758620689656, "grad_norm": 0.8545249104499817, "learning_rate": 7.528069206699799e-05, "loss": 1.5699, "num_input_tokens_seen": 20516688, "step": 3394, "train_runtime": 3443.5733, "train_tokens_per_second": 5957.965 }, { "epoch": 1.2486436781609196, "grad_norm": 0.8795822858810425, "learning_rate": 7.52438799926376e-05, "loss": 1.3246, "num_input_tokens_seen": 20527056, "step": 3395, "train_runtime": 3445.1291, "train_tokens_per_second": 5958.283 }, { "epoch": 1.2490114942528736, "grad_norm": 0.90467369556427, "learning_rate": 7.520706791827719e-05, "loss": 1.4496, "num_input_tokens_seen": 20532960, "step": 3396, "train_runtime": 3446.0976, "train_tokens_per_second": 5958.322 }, { "epoch": 1.2493793103448276, "grad_norm": 0.9017558097839355, "learning_rate": 7.51702558439168e-05, "loss": 1.6023, "num_input_tokens_seen": 20538544, "step": 3397, "train_runtime": 3447.0216, "train_tokens_per_second": 5958.345 }, { "epoch": 1.2497471264367817, "grad_norm": 0.9395778179168701, "learning_rate": 7.513344376955642e-05, "loss": 1.4888, "num_input_tokens_seen": 20544720, "step": 3398, "train_runtime": 3448.0379, "train_tokens_per_second": 5958.38 }, { "epoch": 1.2501149425287357, "grad_norm": 0.8570054173469543, "learning_rate": 7.509663169519603e-05, "loss": 1.5549, "num_input_tokens_seen": 20551024, "step": 3399, "train_runtime": 3449.0756, "train_tokens_per_second": 5958.415 }, { "epoch": 1.2504827586206897, "grad_norm": 0.9774261713027954, "learning_rate": 7.505981962083564e-05, "loss": 1.5408, "num_input_tokens_seen": 20556384, "step": 3400, "train_runtime": 3449.9732, "train_tokens_per_second": 5958.418 }, { "epoch": 1.2508505747126437, "grad_norm": 0.9991695284843445, "learning_rate": 7.502300754647525e-05, "loss": 1.7331, "num_input_tokens_seen": 20561056, "step": 3401, "train_runtime": 3450.791, "train_tokens_per_second": 5958.36 }, { "epoch": 1.2512183908045977, "grad_norm": 0.8814098238945007, "learning_rate": 7.498619547211486e-05, "loss": 1.3809, "num_input_tokens_seen": 20566096, "step": 3402, "train_runtime": 3451.658, "train_tokens_per_second": 5958.324 }, { "epoch": 1.2515862068965518, "grad_norm": 0.9068689942359924, "learning_rate": 7.494938339775447e-05, "loss": 1.4501, "num_input_tokens_seen": 20571120, "step": 3403, "train_runtime": 3452.5325, "train_tokens_per_second": 5958.27 }, { "epoch": 1.2519540229885058, "grad_norm": 0.8637279272079468, "learning_rate": 7.491257132339407e-05, "loss": 1.3187, "num_input_tokens_seen": 20577696, "step": 3404, "train_runtime": 3453.6066, "train_tokens_per_second": 5958.321 }, { "epoch": 1.2523218390804598, "grad_norm": 0.9304091334342957, "learning_rate": 7.487575924903368e-05, "loss": 1.4497, "num_input_tokens_seen": 20582352, "step": 3405, "train_runtime": 3454.3986, "train_tokens_per_second": 5958.303 }, { "epoch": 1.2526896551724138, "grad_norm": 0.9637987017631531, "learning_rate": 7.48389471746733e-05, "loss": 1.4554, "num_input_tokens_seen": 20587408, "step": 3406, "train_runtime": 3455.2257, "train_tokens_per_second": 5958.34 }, { "epoch": 1.2530574712643678, "grad_norm": 0.9325391054153442, "learning_rate": 7.480213510031291e-05, "loss": 1.5294, "num_input_tokens_seen": 20593744, "step": 3407, "train_runtime": 3456.2635, "train_tokens_per_second": 5958.384 }, { "epoch": 1.2534252873563219, "grad_norm": 0.9130005240440369, "learning_rate": 7.476532302595251e-05, "loss": 1.5144, "num_input_tokens_seen": 20601584, "step": 3408, "train_runtime": 3457.487, "train_tokens_per_second": 5958.543 }, { "epoch": 1.2537931034482759, "grad_norm": 0.9999523162841797, "learning_rate": 7.472851095159212e-05, "loss": 1.5391, "num_input_tokens_seen": 20608688, "step": 3409, "train_runtime": 3458.6463, "train_tokens_per_second": 5958.6 }, { "epoch": 1.25416091954023, "grad_norm": 0.9348831176757812, "learning_rate": 7.469169887723173e-05, "loss": 1.5043, "num_input_tokens_seen": 20613488, "step": 3410, "train_runtime": 3459.4778, "train_tokens_per_second": 5958.555 }, { "epoch": 1.254528735632184, "grad_norm": 0.971004843711853, "learning_rate": 7.465488680287135e-05, "loss": 1.4837, "num_input_tokens_seen": 20620208, "step": 3411, "train_runtime": 3460.5527, "train_tokens_per_second": 5958.646 }, { "epoch": 1.254896551724138, "grad_norm": 0.7924219965934753, "learning_rate": 7.461807472851096e-05, "loss": 1.3498, "num_input_tokens_seen": 20630672, "step": 3412, "train_runtime": 3462.1553, "train_tokens_per_second": 5958.91 }, { "epoch": 1.255264367816092, "grad_norm": 0.8895764350891113, "learning_rate": 7.458126265415057e-05, "loss": 1.4805, "num_input_tokens_seen": 20635568, "step": 3413, "train_runtime": 3462.9937, "train_tokens_per_second": 5958.881 }, { "epoch": 1.255632183908046, "grad_norm": 0.9732569456100464, "learning_rate": 7.454445057979018e-05, "loss": 1.478, "num_input_tokens_seen": 20642944, "step": 3414, "train_runtime": 3464.1752, "train_tokens_per_second": 5958.978 }, { "epoch": 1.256, "grad_norm": 0.9345213174819946, "learning_rate": 7.450763850542979e-05, "loss": 1.5453, "num_input_tokens_seen": 20649632, "step": 3415, "train_runtime": 3465.2542, "train_tokens_per_second": 5959.053 }, { "epoch": 1.256367816091954, "grad_norm": 0.9068306684494019, "learning_rate": 7.44708264310694e-05, "loss": 1.5485, "num_input_tokens_seen": 20655520, "step": 3416, "train_runtime": 3466.2388, "train_tokens_per_second": 5959.059 }, { "epoch": 1.256735632183908, "grad_norm": 0.9697032570838928, "learning_rate": 7.4434014356709e-05, "loss": 1.6231, "num_input_tokens_seen": 20661120, "step": 3417, "train_runtime": 3467.1546, "train_tokens_per_second": 5959.1 }, { "epoch": 1.257103448275862, "grad_norm": 0.9295088648796082, "learning_rate": 7.439720228234861e-05, "loss": 1.4801, "num_input_tokens_seen": 20667168, "step": 3418, "train_runtime": 3468.1497, "train_tokens_per_second": 5959.134 }, { "epoch": 1.257471264367816, "grad_norm": 0.9032222628593445, "learning_rate": 7.436039020798824e-05, "loss": 1.5464, "num_input_tokens_seen": 20674848, "step": 3419, "train_runtime": 3469.3797, "train_tokens_per_second": 5959.235 }, { "epoch": 1.25783908045977, "grad_norm": 0.858242928981781, "learning_rate": 7.432357813362783e-05, "loss": 1.4403, "num_input_tokens_seen": 20683024, "step": 3420, "train_runtime": 3470.6399, "train_tokens_per_second": 5959.427 }, { "epoch": 1.2582068965517241, "grad_norm": 0.8810915350914001, "learning_rate": 7.428676605926744e-05, "loss": 1.4443, "num_input_tokens_seen": 20690544, "step": 3421, "train_runtime": 3472.3821, "train_tokens_per_second": 5958.602 }, { "epoch": 1.2585747126436782, "grad_norm": 0.9798994660377502, "learning_rate": 7.424995398490705e-05, "loss": 1.5493, "num_input_tokens_seen": 20696432, "step": 3422, "train_runtime": 3473.3663, "train_tokens_per_second": 5958.609 }, { "epoch": 1.2589425287356322, "grad_norm": 0.9870070815086365, "learning_rate": 7.421314191054666e-05, "loss": 1.5475, "num_input_tokens_seen": 20701104, "step": 3423, "train_runtime": 3474.1488, "train_tokens_per_second": 5958.612 }, { "epoch": 1.2593103448275862, "grad_norm": 0.860073983669281, "learning_rate": 7.417632983618628e-05, "loss": 1.7247, "num_input_tokens_seen": 20708016, "step": 3424, "train_runtime": 3475.2452, "train_tokens_per_second": 5958.721 }, { "epoch": 1.2596781609195402, "grad_norm": 0.8881399035453796, "learning_rate": 7.413951776182589e-05, "loss": 1.541, "num_input_tokens_seen": 20714336, "step": 3425, "train_runtime": 3476.2573, "train_tokens_per_second": 5958.804 }, { "epoch": 1.2600459770114942, "grad_norm": 0.9642382264137268, "learning_rate": 7.410270568746548e-05, "loss": 1.6147, "num_input_tokens_seen": 20719104, "step": 3426, "train_runtime": 3477.0588, "train_tokens_per_second": 5958.802 }, { "epoch": 1.2604137931034483, "grad_norm": 1.0019463300704956, "learning_rate": 7.406589361310509e-05, "loss": 1.2902, "num_input_tokens_seen": 20725072, "step": 3427, "train_runtime": 3478.0528, "train_tokens_per_second": 5958.815 }, { "epoch": 1.2607816091954023, "grad_norm": 0.9634602665901184, "learning_rate": 7.402908153874472e-05, "loss": 1.4813, "num_input_tokens_seen": 20730192, "step": 3428, "train_runtime": 3478.9122, "train_tokens_per_second": 5958.814 }, { "epoch": 1.2611494252873563, "grad_norm": 0.8677273988723755, "learning_rate": 7.399226946438432e-05, "loss": 1.3573, "num_input_tokens_seen": 20734928, "step": 3429, "train_runtime": 3479.7197, "train_tokens_per_second": 5958.793 }, { "epoch": 1.2615172413793103, "grad_norm": 0.9803272485733032, "learning_rate": 7.395545739002393e-05, "loss": 1.5141, "num_input_tokens_seen": 20741504, "step": 3430, "train_runtime": 3480.7922, "train_tokens_per_second": 5958.846 }, { "epoch": 1.2618850574712643, "grad_norm": 0.8590312004089355, "learning_rate": 7.391864531566354e-05, "loss": 1.4631, "num_input_tokens_seen": 20752000, "step": 3431, "train_runtime": 3482.3606, "train_tokens_per_second": 5959.176 }, { "epoch": 1.2622528735632184, "grad_norm": 0.8663723468780518, "learning_rate": 7.388183324130315e-05, "loss": 1.5808, "num_input_tokens_seen": 20758336, "step": 3432, "train_runtime": 3483.3858, "train_tokens_per_second": 5959.241 }, { "epoch": 1.2626206896551724, "grad_norm": 0.9491639733314514, "learning_rate": 7.384502116694276e-05, "loss": 1.7055, "num_input_tokens_seen": 20762832, "step": 3433, "train_runtime": 3484.198, "train_tokens_per_second": 5959.142 }, { "epoch": 1.2629885057471264, "grad_norm": 0.9592745304107666, "learning_rate": 7.380820909258237e-05, "loss": 1.4115, "num_input_tokens_seen": 20771984, "step": 3434, "train_runtime": 3485.5973, "train_tokens_per_second": 5959.376 }, { "epoch": 1.2633563218390804, "grad_norm": 0.9008318185806274, "learning_rate": 7.377139701822198e-05, "loss": 1.5551, "num_input_tokens_seen": 20777104, "step": 3435, "train_runtime": 3486.4667, "train_tokens_per_second": 5959.358 }, { "epoch": 1.2637241379310344, "grad_norm": 0.8908724784851074, "learning_rate": 7.37345849438616e-05, "loss": 1.5219, "num_input_tokens_seen": 20786704, "step": 3436, "train_runtime": 3487.9341, "train_tokens_per_second": 5959.603 }, { "epoch": 1.2640919540229885, "grad_norm": 0.897625744342804, "learning_rate": 7.369777286950121e-05, "loss": 1.5056, "num_input_tokens_seen": 20793200, "step": 3437, "train_runtime": 3488.964, "train_tokens_per_second": 5959.706 }, { "epoch": 1.2644597701149425, "grad_norm": 0.8837428689002991, "learning_rate": 7.36609607951408e-05, "loss": 1.4936, "num_input_tokens_seen": 20798320, "step": 3438, "train_runtime": 3489.8056, "train_tokens_per_second": 5959.736 }, { "epoch": 1.2648275862068965, "grad_norm": 1.0072245597839355, "learning_rate": 7.362414872078041e-05, "loss": 1.7243, "num_input_tokens_seen": 20803824, "step": 3439, "train_runtime": 3490.7263, "train_tokens_per_second": 5959.741 }, { "epoch": 1.2651954022988505, "grad_norm": 0.9121684432029724, "learning_rate": 7.358733664642002e-05, "loss": 1.575, "num_input_tokens_seen": 20808688, "step": 3440, "train_runtime": 3491.5431, "train_tokens_per_second": 5959.74 }, { "epoch": 1.2655632183908045, "grad_norm": 0.9595100283622742, "learning_rate": 7.355052457205964e-05, "loss": 1.5143, "num_input_tokens_seen": 20814464, "step": 3441, "train_runtime": 3492.4923, "train_tokens_per_second": 5959.774 }, { "epoch": 1.2659310344827586, "grad_norm": 0.8965319991111755, "learning_rate": 7.351371249769925e-05, "loss": 1.4442, "num_input_tokens_seen": 20819808, "step": 3442, "train_runtime": 3493.3964, "train_tokens_per_second": 5959.761 }, { "epoch": 1.2662988505747126, "grad_norm": 0.9464142322540283, "learning_rate": 7.347690042333886e-05, "loss": 1.4589, "num_input_tokens_seen": 20825200, "step": 3443, "train_runtime": 3494.3, "train_tokens_per_second": 5959.763 }, { "epoch": 1.2666666666666666, "grad_norm": 0.9292598366737366, "learning_rate": 7.344008834897846e-05, "loss": 1.6559, "num_input_tokens_seen": 20830144, "step": 3444, "train_runtime": 3495.1356, "train_tokens_per_second": 5959.753 }, { "epoch": 1.2670344827586206, "grad_norm": 0.9456391930580139, "learning_rate": 7.340327627461808e-05, "loss": 1.5098, "num_input_tokens_seen": 20836368, "step": 3445, "train_runtime": 3496.1673, "train_tokens_per_second": 5959.774 }, { "epoch": 1.2674022988505746, "grad_norm": 1.042541265487671, "learning_rate": 7.336646420025769e-05, "loss": 1.6533, "num_input_tokens_seen": 20842288, "step": 3446, "train_runtime": 3497.1368, "train_tokens_per_second": 5959.815 }, { "epoch": 1.2677701149425287, "grad_norm": 0.9033098220825195, "learning_rate": 7.33296521258973e-05, "loss": 1.3759, "num_input_tokens_seen": 20849552, "step": 3447, "train_runtime": 3498.2954, "train_tokens_per_second": 5959.917 }, { "epoch": 1.2681379310344827, "grad_norm": 0.9085573554039001, "learning_rate": 7.32928400515369e-05, "loss": 1.6693, "num_input_tokens_seen": 20854976, "step": 3448, "train_runtime": 3499.2044, "train_tokens_per_second": 5959.919 }, { "epoch": 1.2685057471264367, "grad_norm": 0.9716749787330627, "learning_rate": 7.325602797717653e-05, "loss": 1.574, "num_input_tokens_seen": 20859904, "step": 3449, "train_runtime": 3500.0589, "train_tokens_per_second": 5959.872 }, { "epoch": 1.2688735632183907, "grad_norm": 0.9181057810783386, "learning_rate": 7.321921590281612e-05, "loss": 1.7126, "num_input_tokens_seen": 20864576, "step": 3450, "train_runtime": 3500.8574, "train_tokens_per_second": 5959.848 }, { "epoch": 1.2692413793103448, "grad_norm": 1.051499366760254, "learning_rate": 7.318240382845573e-05, "loss": 1.5253, "num_input_tokens_seen": 20871136, "step": 3451, "train_runtime": 3502.4196, "train_tokens_per_second": 5959.062 }, { "epoch": 1.2696091954022988, "grad_norm": 0.9745582342147827, "learning_rate": 7.314559175409534e-05, "loss": 1.6499, "num_input_tokens_seen": 20875504, "step": 3452, "train_runtime": 3503.1881, "train_tokens_per_second": 5959.002 }, { "epoch": 1.2699770114942528, "grad_norm": 0.9093972444534302, "learning_rate": 7.310877967973495e-05, "loss": 1.4549, "num_input_tokens_seen": 20880944, "step": 3453, "train_runtime": 3504.0929, "train_tokens_per_second": 5959.016 }, { "epoch": 1.2703448275862068, "grad_norm": 0.9666886329650879, "learning_rate": 7.307196760537457e-05, "loss": 1.4058, "num_input_tokens_seen": 20885584, "step": 3454, "train_runtime": 3504.8889, "train_tokens_per_second": 5958.986 }, { "epoch": 1.270712643678161, "grad_norm": 0.9249492287635803, "learning_rate": 7.303515553101418e-05, "loss": 1.5741, "num_input_tokens_seen": 20891040, "step": 3455, "train_runtime": 3505.7531, "train_tokens_per_second": 5959.073 }, { "epoch": 1.2710804597701149, "grad_norm": 1.0086640119552612, "learning_rate": 7.299834345665378e-05, "loss": 1.7149, "num_input_tokens_seen": 20897104, "step": 3456, "train_runtime": 3506.7526, "train_tokens_per_second": 5959.104 }, { "epoch": 1.271448275862069, "grad_norm": 0.9152526259422302, "learning_rate": 7.296153138229339e-05, "loss": 1.7083, "num_input_tokens_seen": 20904032, "step": 3457, "train_runtime": 3507.8665, "train_tokens_per_second": 5959.187 }, { "epoch": 1.271816091954023, "grad_norm": 0.8748776316642761, "learning_rate": 7.292471930793301e-05, "loss": 1.4562, "num_input_tokens_seen": 20909312, "step": 3458, "train_runtime": 3508.7692, "train_tokens_per_second": 5959.159 }, { "epoch": 1.2721839080459771, "grad_norm": 0.9453015327453613, "learning_rate": 7.288790723357262e-05, "loss": 1.5359, "num_input_tokens_seen": 20914256, "step": 3459, "train_runtime": 3509.6246, "train_tokens_per_second": 5959.115 }, { "epoch": 1.272551724137931, "grad_norm": 1.0185391902923584, "learning_rate": 7.285109515921223e-05, "loss": 1.6629, "num_input_tokens_seen": 20920272, "step": 3460, "train_runtime": 3510.6149, "train_tokens_per_second": 5959.148 }, { "epoch": 1.2729195402298852, "grad_norm": 0.9400529265403748, "learning_rate": 7.281428308485184e-05, "loss": 1.6218, "num_input_tokens_seen": 20925696, "step": 3461, "train_runtime": 3511.5017, "train_tokens_per_second": 5959.187 }, { "epoch": 1.273287356321839, "grad_norm": 0.952666163444519, "learning_rate": 7.277747101049144e-05, "loss": 1.7327, "num_input_tokens_seen": 20931264, "step": 3462, "train_runtime": 3512.448, "train_tokens_per_second": 5959.167 }, { "epoch": 1.2736551724137932, "grad_norm": 0.9980821013450623, "learning_rate": 7.274065893613105e-05, "loss": 1.4684, "num_input_tokens_seen": 20938320, "step": 3463, "train_runtime": 3513.5918, "train_tokens_per_second": 5959.235 }, { "epoch": 1.274022988505747, "grad_norm": 1.0049513578414917, "learning_rate": 7.270384686177066e-05, "loss": 1.6166, "num_input_tokens_seen": 20943104, "step": 3464, "train_runtime": 3514.4011, "train_tokens_per_second": 5959.224 }, { "epoch": 1.2743908045977013, "grad_norm": 0.9411967992782593, "learning_rate": 7.266703478741027e-05, "loss": 1.512, "num_input_tokens_seen": 20950160, "step": 3465, "train_runtime": 3515.544, "train_tokens_per_second": 5959.294 }, { "epoch": 1.274758620689655, "grad_norm": 0.9308216571807861, "learning_rate": 7.26302227130499e-05, "loss": 1.4355, "num_input_tokens_seen": 20957040, "step": 3466, "train_runtime": 3516.6574, "train_tokens_per_second": 5959.364 }, { "epoch": 1.2751264367816093, "grad_norm": 0.9101845622062683, "learning_rate": 7.25934106386895e-05, "loss": 1.6134, "num_input_tokens_seen": 20961440, "step": 3467, "train_runtime": 3517.4303, "train_tokens_per_second": 5959.305 }, { "epoch": 1.275494252873563, "grad_norm": 0.9455374479293823, "learning_rate": 7.25565985643291e-05, "loss": 1.5917, "num_input_tokens_seen": 20966928, "step": 3468, "train_runtime": 3518.3414, "train_tokens_per_second": 5959.322 }, { "epoch": 1.2758620689655173, "grad_norm": 0.9727440476417542, "learning_rate": 7.251978648996871e-05, "loss": 1.5776, "num_input_tokens_seen": 20972080, "step": 3469, "train_runtime": 3519.1991, "train_tokens_per_second": 5959.333 }, { "epoch": 1.2762298850574711, "grad_norm": 0.8744324445724487, "learning_rate": 7.248297441560832e-05, "loss": 1.5142, "num_input_tokens_seen": 20977840, "step": 3470, "train_runtime": 3520.1655, "train_tokens_per_second": 5959.334 }, { "epoch": 1.2765977011494254, "grad_norm": 0.8911353945732117, "learning_rate": 7.244616234124794e-05, "loss": 1.5853, "num_input_tokens_seen": 20982480, "step": 3471, "train_runtime": 3520.9811, "train_tokens_per_second": 5959.271 }, { "epoch": 1.2769655172413792, "grad_norm": 0.9117625951766968, "learning_rate": 7.240935026688755e-05, "loss": 1.4741, "num_input_tokens_seen": 20987744, "step": 3472, "train_runtime": 3521.8771, "train_tokens_per_second": 5959.249 }, { "epoch": 1.2773333333333334, "grad_norm": 0.8872541785240173, "learning_rate": 7.237253819252716e-05, "loss": 1.5719, "num_input_tokens_seen": 20995120, "step": 3473, "train_runtime": 3523.045, "train_tokens_per_second": 5959.367 }, { "epoch": 1.2777011494252872, "grad_norm": 0.9287063479423523, "learning_rate": 7.233572611816675e-05, "loss": 1.4267, "num_input_tokens_seen": 21001024, "step": 3474, "train_runtime": 3524.0067, "train_tokens_per_second": 5959.417 }, { "epoch": 1.2780689655172415, "grad_norm": 0.9828014373779297, "learning_rate": 7.229891404380637e-05, "loss": 1.5215, "num_input_tokens_seen": 21006048, "step": 3475, "train_runtime": 3524.8425, "train_tokens_per_second": 5959.429 }, { "epoch": 1.2784367816091953, "grad_norm": 0.9956949353218079, "learning_rate": 7.226210196944598e-05, "loss": 1.6499, "num_input_tokens_seen": 21012960, "step": 3476, "train_runtime": 3525.9487, "train_tokens_per_second": 5959.52 }, { "epoch": 1.2788045977011495, "grad_norm": 0.9091798663139343, "learning_rate": 7.222528989508559e-05, "loss": 1.4731, "num_input_tokens_seen": 21020512, "step": 3477, "train_runtime": 3527.1463, "train_tokens_per_second": 5959.637 }, { "epoch": 1.2791724137931033, "grad_norm": 0.9619956612586975, "learning_rate": 7.21884778207252e-05, "loss": 1.6646, "num_input_tokens_seen": 21025312, "step": 3478, "train_runtime": 3527.9797, "train_tokens_per_second": 5959.59 }, { "epoch": 1.2795402298850576, "grad_norm": 0.918745219707489, "learning_rate": 7.215166574636481e-05, "loss": 1.3209, "num_input_tokens_seen": 21035952, "step": 3479, "train_runtime": 3529.6097, "train_tokens_per_second": 5959.852 }, { "epoch": 1.2799080459770116, "grad_norm": 1.0378994941711426, "learning_rate": 7.211485367200442e-05, "loss": 1.6537, "num_input_tokens_seen": 21042192, "step": 3480, "train_runtime": 3530.663, "train_tokens_per_second": 5959.842 }, { "epoch": 1.2802758620689656, "grad_norm": 1.0207245349884033, "learning_rate": 7.207804159764403e-05, "loss": 1.7408, "num_input_tokens_seen": 21047824, "step": 3481, "train_runtime": 3532.0461, "train_tokens_per_second": 5959.102 }, { "epoch": 1.2806436781609196, "grad_norm": 1.0150294303894043, "learning_rate": 7.204122952328364e-05, "loss": 1.5718, "num_input_tokens_seen": 21053152, "step": 3482, "train_runtime": 3532.9196, "train_tokens_per_second": 5959.137 }, { "epoch": 1.2810114942528736, "grad_norm": 0.902804434299469, "learning_rate": 7.200441744892324e-05, "loss": 1.6311, "num_input_tokens_seen": 21058336, "step": 3483, "train_runtime": 3533.8037, "train_tokens_per_second": 5959.113 }, { "epoch": 1.2813793103448277, "grad_norm": 0.9312765598297119, "learning_rate": 7.196760537456287e-05, "loss": 1.6575, "num_input_tokens_seen": 21064336, "step": 3484, "train_runtime": 3534.7939, "train_tokens_per_second": 5959.141 }, { "epoch": 1.2817471264367817, "grad_norm": 1.087038278579712, "learning_rate": 7.193079330020248e-05, "loss": 1.7055, "num_input_tokens_seen": 21070368, "step": 3485, "train_runtime": 3535.7822, "train_tokens_per_second": 5959.182 }, { "epoch": 1.2821149425287357, "grad_norm": 1.0413316488265991, "learning_rate": 7.189398122584207e-05, "loss": 1.6932, "num_input_tokens_seen": 21074656, "step": 3486, "train_runtime": 3536.548, "train_tokens_per_second": 5959.104 }, { "epoch": 1.2824827586206897, "grad_norm": 0.7907637357711792, "learning_rate": 7.185716915148168e-05, "loss": 1.4059, "num_input_tokens_seen": 21083600, "step": 3487, "train_runtime": 3537.9358, "train_tokens_per_second": 5959.294 }, { "epoch": 1.2828505747126437, "grad_norm": 1.0019232034683228, "learning_rate": 7.18203570771213e-05, "loss": 1.6671, "num_input_tokens_seen": 21088480, "step": 3488, "train_runtime": 3538.7802, "train_tokens_per_second": 5959.251 }, { "epoch": 1.2832183908045978, "grad_norm": 0.7934490442276001, "learning_rate": 7.178354500276091e-05, "loss": 1.2534, "num_input_tokens_seen": 21095824, "step": 3489, "train_runtime": 3539.9356, "train_tokens_per_second": 5959.381 }, { "epoch": 1.2835862068965518, "grad_norm": 1.109464168548584, "learning_rate": 7.174673292840052e-05, "loss": 1.5836, "num_input_tokens_seen": 21099856, "step": 3490, "train_runtime": 3540.6874, "train_tokens_per_second": 5959.254 }, { "epoch": 1.2839540229885058, "grad_norm": 0.9460877180099487, "learning_rate": 7.170992085404013e-05, "loss": 1.4744, "num_input_tokens_seen": 21105232, "step": 3491, "train_runtime": 3541.5702, "train_tokens_per_second": 5959.287 }, { "epoch": 1.2843218390804598, "grad_norm": 0.8960955142974854, "learning_rate": 7.167310877967974e-05, "loss": 1.501, "num_input_tokens_seen": 21110128, "step": 3492, "train_runtime": 3542.4076, "train_tokens_per_second": 5959.26 }, { "epoch": 1.2846896551724138, "grad_norm": 0.9716125130653381, "learning_rate": 7.163629670531935e-05, "loss": 1.7261, "num_input_tokens_seen": 21114464, "step": 3493, "train_runtime": 3543.149, "train_tokens_per_second": 5959.237 }, { "epoch": 1.2850574712643679, "grad_norm": 1.0320979356765747, "learning_rate": 7.159948463095896e-05, "loss": 1.4786, "num_input_tokens_seen": 21121264, "step": 3494, "train_runtime": 3544.2466, "train_tokens_per_second": 5959.31 }, { "epoch": 1.2854252873563219, "grad_norm": 0.9457396864891052, "learning_rate": 7.156267255659857e-05, "loss": 1.5681, "num_input_tokens_seen": 21126672, "step": 3495, "train_runtime": 3545.141, "train_tokens_per_second": 5959.332 }, { "epoch": 1.285793103448276, "grad_norm": 0.9831223487854004, "learning_rate": 7.152586048223819e-05, "loss": 1.6491, "num_input_tokens_seen": 21131536, "step": 3496, "train_runtime": 3545.9768, "train_tokens_per_second": 5959.299 }, { "epoch": 1.28616091954023, "grad_norm": 0.9211698770523071, "learning_rate": 7.14890484078778e-05, "loss": 1.442, "num_input_tokens_seen": 21135856, "step": 3497, "train_runtime": 3546.747, "train_tokens_per_second": 5959.223 }, { "epoch": 1.286528735632184, "grad_norm": 0.8640750050544739, "learning_rate": 7.145223633351739e-05, "loss": 1.5376, "num_input_tokens_seen": 21141888, "step": 3498, "train_runtime": 3547.7259, "train_tokens_per_second": 5959.279 }, { "epoch": 1.286896551724138, "grad_norm": 1.0163702964782715, "learning_rate": 7.1415424259157e-05, "loss": 1.5638, "num_input_tokens_seen": 21151488, "step": 3499, "train_runtime": 3549.2009, "train_tokens_per_second": 5959.507 }, { "epoch": 1.287264367816092, "grad_norm": 0.9114499688148499, "learning_rate": 7.137861218479661e-05, "loss": 1.4073, "num_input_tokens_seen": 21159776, "step": 3500, "train_runtime": 3550.4654, "train_tokens_per_second": 5959.719 }, { "epoch": 1.287632183908046, "grad_norm": 0.9567367434501648, "learning_rate": 7.134180011043623e-05, "loss": 1.657, "num_input_tokens_seen": 21164480, "step": 3501, "train_runtime": 3551.3179, "train_tokens_per_second": 5959.613 }, { "epoch": 1.288, "grad_norm": 1.1022112369537354, "learning_rate": 7.130498803607584e-05, "loss": 1.7188, "num_input_tokens_seen": 21169872, "step": 3502, "train_runtime": 3552.225, "train_tokens_per_second": 5959.609 }, { "epoch": 1.288367816091954, "grad_norm": 0.853762686252594, "learning_rate": 7.126817596171545e-05, "loss": 1.3639, "num_input_tokens_seen": 21177264, "step": 3503, "train_runtime": 3553.3811, "train_tokens_per_second": 5959.75 }, { "epoch": 1.288735632183908, "grad_norm": 0.8977413773536682, "learning_rate": 7.123136388735505e-05, "loss": 1.5133, "num_input_tokens_seen": 21182400, "step": 3504, "train_runtime": 3554.2484, "train_tokens_per_second": 5959.741 }, { "epoch": 1.289103448275862, "grad_norm": 0.9821711778640747, "learning_rate": 7.119455181299467e-05, "loss": 1.4526, "num_input_tokens_seen": 21189088, "step": 3505, "train_runtime": 3555.3378, "train_tokens_per_second": 5959.796 }, { "epoch": 1.2894712643678161, "grad_norm": 0.9481285810470581, "learning_rate": 7.115773973863428e-05, "loss": 1.557, "num_input_tokens_seen": 21194432, "step": 3506, "train_runtime": 3556.2483, "train_tokens_per_second": 5959.773 }, { "epoch": 1.2898390804597701, "grad_norm": 0.9218729138374329, "learning_rate": 7.112092766427389e-05, "loss": 1.5139, "num_input_tokens_seen": 21199632, "step": 3507, "train_runtime": 3557.1185, "train_tokens_per_second": 5959.777 }, { "epoch": 1.2902068965517242, "grad_norm": 0.944381058216095, "learning_rate": 7.10841155899135e-05, "loss": 1.3236, "num_input_tokens_seen": 21205104, "step": 3508, "train_runtime": 3558.0168, "train_tokens_per_second": 5959.81 }, { "epoch": 1.2905747126436782, "grad_norm": 0.8969419598579407, "learning_rate": 7.10473035155531e-05, "loss": 1.4088, "num_input_tokens_seen": 21210944, "step": 3509, "train_runtime": 3558.986, "train_tokens_per_second": 5959.828 }, { "epoch": 1.2909425287356322, "grad_norm": 0.8900802135467529, "learning_rate": 7.101049144119271e-05, "loss": 1.4862, "num_input_tokens_seen": 21216640, "step": 3510, "train_runtime": 3559.9216, "train_tokens_per_second": 5959.862 }, { "epoch": 1.2913103448275862, "grad_norm": 0.9737229943275452, "learning_rate": 7.097367936683232e-05, "loss": 1.6753, "num_input_tokens_seen": 21221936, "step": 3511, "train_runtime": 3561.2479, "train_tokens_per_second": 5959.129 }, { "epoch": 1.2916781609195402, "grad_norm": 0.8889402747154236, "learning_rate": 7.093686729247193e-05, "loss": 1.5952, "num_input_tokens_seen": 21226496, "step": 3512, "train_runtime": 3562.0607, "train_tokens_per_second": 5959.049 }, { "epoch": 1.2920459770114943, "grad_norm": 0.9297152757644653, "learning_rate": 7.090005521811154e-05, "loss": 1.3997, "num_input_tokens_seen": 21232624, "step": 3513, "train_runtime": 3563.0666, "train_tokens_per_second": 5959.087 }, { "epoch": 1.2924137931034483, "grad_norm": 0.9345740675926208, "learning_rate": 7.086324314375116e-05, "loss": 1.6513, "num_input_tokens_seen": 21237888, "step": 3514, "train_runtime": 3563.9465, "train_tokens_per_second": 5959.093 }, { "epoch": 1.2927816091954023, "grad_norm": 0.9662009477615356, "learning_rate": 7.082643106939077e-05, "loss": 1.5845, "num_input_tokens_seen": 21242752, "step": 3515, "train_runtime": 3564.7677, "train_tokens_per_second": 5959.085 }, { "epoch": 1.2931494252873563, "grad_norm": 1.0016788244247437, "learning_rate": 7.078961899503037e-05, "loss": 1.5019, "num_input_tokens_seen": 21247344, "step": 3516, "train_runtime": 3565.5388, "train_tokens_per_second": 5959.084 }, { "epoch": 1.2935172413793103, "grad_norm": 0.8903211355209351, "learning_rate": 7.075280692066997e-05, "loss": 1.4587, "num_input_tokens_seen": 21252992, "step": 3517, "train_runtime": 3566.4798, "train_tokens_per_second": 5959.095 }, { "epoch": 1.2938850574712644, "grad_norm": 0.9020424485206604, "learning_rate": 7.07159948463096e-05, "loss": 1.4961, "num_input_tokens_seen": 21260016, "step": 3518, "train_runtime": 3567.6081, "train_tokens_per_second": 5959.179 }, { "epoch": 1.2942528735632184, "grad_norm": 0.9242357611656189, "learning_rate": 7.06791827719492e-05, "loss": 1.35, "num_input_tokens_seen": 21264944, "step": 3519, "train_runtime": 3568.4149, "train_tokens_per_second": 5959.213 }, { "epoch": 1.2946206896551724, "grad_norm": 0.8996397852897644, "learning_rate": 7.064237069758881e-05, "loss": 1.4686, "num_input_tokens_seen": 21275280, "step": 3520, "train_runtime": 3569.9883, "train_tokens_per_second": 5959.482 }, { "epoch": 1.2949885057471264, "grad_norm": 0.9285815358161926, "learning_rate": 7.060555862322842e-05, "loss": 1.5583, "num_input_tokens_seen": 21280704, "step": 3521, "train_runtime": 3570.8902, "train_tokens_per_second": 5959.495 }, { "epoch": 1.2953563218390804, "grad_norm": 0.8893944621086121, "learning_rate": 7.056874654886803e-05, "loss": 1.4772, "num_input_tokens_seen": 21285840, "step": 3522, "train_runtime": 3571.7523, "train_tokens_per_second": 5959.495 }, { "epoch": 1.2957241379310345, "grad_norm": 0.8923265933990479, "learning_rate": 7.053193447450764e-05, "loss": 1.3956, "num_input_tokens_seen": 21293792, "step": 3523, "train_runtime": 3573.0056, "train_tokens_per_second": 5959.63 }, { "epoch": 1.2960919540229885, "grad_norm": 0.9582086801528931, "learning_rate": 7.049512240014725e-05, "loss": 1.4337, "num_input_tokens_seen": 21298336, "step": 3524, "train_runtime": 3573.7804, "train_tokens_per_second": 5959.61 }, { "epoch": 1.2964597701149425, "grad_norm": 1.0114604234695435, "learning_rate": 7.045831032578686e-05, "loss": 1.5049, "num_input_tokens_seen": 21305840, "step": 3525, "train_runtime": 3574.9771, "train_tokens_per_second": 5959.714 }, { "epoch": 1.2968275862068965, "grad_norm": 0.9581440687179565, "learning_rate": 7.042149825142648e-05, "loss": 1.4544, "num_input_tokens_seen": 21310928, "step": 3526, "train_runtime": 3575.8364, "train_tokens_per_second": 5959.704 }, { "epoch": 1.2971954022988506, "grad_norm": 0.9656909704208374, "learning_rate": 7.038468617706609e-05, "loss": 1.6463, "num_input_tokens_seen": 21316368, "step": 3527, "train_runtime": 3576.7285, "train_tokens_per_second": 5959.739 }, { "epoch": 1.2975632183908046, "grad_norm": 0.9722489714622498, "learning_rate": 7.034787410270569e-05, "loss": 1.5223, "num_input_tokens_seen": 21322768, "step": 3528, "train_runtime": 3577.7989, "train_tokens_per_second": 5959.745 }, { "epoch": 1.2979310344827586, "grad_norm": 0.8741322159767151, "learning_rate": 7.03110620283453e-05, "loss": 1.6018, "num_input_tokens_seen": 21329264, "step": 3529, "train_runtime": 3578.8231, "train_tokens_per_second": 5959.854 }, { "epoch": 1.2982988505747126, "grad_norm": 0.8774896264076233, "learning_rate": 7.02742499539849e-05, "loss": 1.4221, "num_input_tokens_seen": 21334624, "step": 3530, "train_runtime": 3579.7039, "train_tokens_per_second": 5959.885 }, { "epoch": 1.2986666666666666, "grad_norm": 0.90668123960495, "learning_rate": 7.023743787962453e-05, "loss": 1.5109, "num_input_tokens_seen": 21339280, "step": 3531, "train_runtime": 3580.5292, "train_tokens_per_second": 5959.812 }, { "epoch": 1.2990344827586207, "grad_norm": 0.9371986985206604, "learning_rate": 7.020062580526413e-05, "loss": 1.4348, "num_input_tokens_seen": 21344512, "step": 3532, "train_runtime": 3581.4091, "train_tokens_per_second": 5959.808 }, { "epoch": 1.2994022988505747, "grad_norm": 0.9359028935432434, "learning_rate": 7.016381373090374e-05, "loss": 1.4243, "num_input_tokens_seen": 21349568, "step": 3533, "train_runtime": 3582.2542, "train_tokens_per_second": 5959.814 }, { "epoch": 1.2997701149425287, "grad_norm": 0.8446172475814819, "learning_rate": 7.012700165654334e-05, "loss": 1.4644, "num_input_tokens_seen": 21355136, "step": 3534, "train_runtime": 3583.1495, "train_tokens_per_second": 5959.879 }, { "epoch": 1.3001379310344827, "grad_norm": 0.8675487637519836, "learning_rate": 7.009018958218296e-05, "loss": 1.615, "num_input_tokens_seen": 21362800, "step": 3535, "train_runtime": 3584.3378, "train_tokens_per_second": 5960.041 }, { "epoch": 1.3005057471264367, "grad_norm": 0.9997730255126953, "learning_rate": 7.005337750782257e-05, "loss": 1.3972, "num_input_tokens_seen": 21368544, "step": 3536, "train_runtime": 3585.2875, "train_tokens_per_second": 5960.064 }, { "epoch": 1.3008735632183908, "grad_norm": 0.9834737777709961, "learning_rate": 7.001656543346218e-05, "loss": 1.6383, "num_input_tokens_seen": 21373328, "step": 3537, "train_runtime": 3586.0836, "train_tokens_per_second": 5960.075 }, { "epoch": 1.3012413793103448, "grad_norm": 0.8357015252113342, "learning_rate": 6.997975335910179e-05, "loss": 1.5022, "num_input_tokens_seen": 21381664, "step": 3538, "train_runtime": 3587.3661, "train_tokens_per_second": 5960.268 }, { "epoch": 1.3016091954022988, "grad_norm": 0.9906278848648071, "learning_rate": 6.99429412847414e-05, "loss": 1.4367, "num_input_tokens_seen": 21388976, "step": 3539, "train_runtime": 3588.5247, "train_tokens_per_second": 5960.381 }, { "epoch": 1.3019770114942528, "grad_norm": 0.891708493232727, "learning_rate": 6.9906129210381e-05, "loss": 1.4701, "num_input_tokens_seen": 21398160, "step": 3540, "train_runtime": 3589.9164, "train_tokens_per_second": 5960.629 }, { "epoch": 1.3023448275862068, "grad_norm": 0.919964611530304, "learning_rate": 6.986931713602061e-05, "loss": 1.3759, "num_input_tokens_seen": 21403472, "step": 3541, "train_runtime": 3591.2842, "train_tokens_per_second": 5959.838 }, { "epoch": 1.3027126436781609, "grad_norm": 0.8878598809242249, "learning_rate": 6.983250506166022e-05, "loss": 1.7194, "num_input_tokens_seen": 21410896, "step": 3542, "train_runtime": 3592.4723, "train_tokens_per_second": 5959.933 }, { "epoch": 1.3030804597701149, "grad_norm": 0.9878170490264893, "learning_rate": 6.979569298729983e-05, "loss": 1.7097, "num_input_tokens_seen": 21415712, "step": 3543, "train_runtime": 3593.3105, "train_tokens_per_second": 5959.884 }, { "epoch": 1.303448275862069, "grad_norm": 1.0171282291412354, "learning_rate": 6.975888091293946e-05, "loss": 1.4019, "num_input_tokens_seen": 21420080, "step": 3544, "train_runtime": 3594.0673, "train_tokens_per_second": 5959.844 }, { "epoch": 1.303816091954023, "grad_norm": 1.0764694213867188, "learning_rate": 6.972206883857906e-05, "loss": 1.673, "num_input_tokens_seen": 21426192, "step": 3545, "train_runtime": 3595.0949, "train_tokens_per_second": 5959.84 }, { "epoch": 1.304183908045977, "grad_norm": 0.8542464971542358, "learning_rate": 6.968525676421866e-05, "loss": 1.3304, "num_input_tokens_seen": 21441504, "step": 3546, "train_runtime": 3597.304, "train_tokens_per_second": 5960.437 }, { "epoch": 1.304551724137931, "grad_norm": 0.9444261789321899, "learning_rate": 6.964844468985827e-05, "loss": 1.6947, "num_input_tokens_seen": 21445888, "step": 3547, "train_runtime": 3598.0759, "train_tokens_per_second": 5960.377 }, { "epoch": 1.304919540229885, "grad_norm": 0.958427369594574, "learning_rate": 6.961163261549789e-05, "loss": 1.3635, "num_input_tokens_seen": 21454608, "step": 3548, "train_runtime": 3599.4016, "train_tokens_per_second": 5960.604 }, { "epoch": 1.305287356321839, "grad_norm": 0.8953106999397278, "learning_rate": 6.95748205411375e-05, "loss": 1.4, "num_input_tokens_seen": 21461008, "step": 3549, "train_runtime": 3600.4181, "train_tokens_per_second": 5960.699 }, { "epoch": 1.305655172413793, "grad_norm": 1.0188813209533691, "learning_rate": 6.953800846677711e-05, "loss": 1.3752, "num_input_tokens_seen": 21467920, "step": 3550, "train_runtime": 3601.531, "train_tokens_per_second": 5960.776 }, { "epoch": 1.306022988505747, "grad_norm": 0.9171669483184814, "learning_rate": 6.950119639241672e-05, "loss": 1.5849, "num_input_tokens_seen": 21472416, "step": 3551, "train_runtime": 3602.3119, "train_tokens_per_second": 5960.732 }, { "epoch": 1.306390804597701, "grad_norm": 0.9831543564796448, "learning_rate": 6.946438431805633e-05, "loss": 1.5002, "num_input_tokens_seen": 21479040, "step": 3552, "train_runtime": 3603.3969, "train_tokens_per_second": 5960.775 }, { "epoch": 1.306758620689655, "grad_norm": 0.8366644978523254, "learning_rate": 6.942757224369594e-05, "loss": 1.5185, "num_input_tokens_seen": 21486784, "step": 3553, "train_runtime": 3604.6106, "train_tokens_per_second": 5960.917 }, { "epoch": 1.3071264367816091, "grad_norm": 0.9007189273834229, "learning_rate": 6.939076016933554e-05, "loss": 1.5416, "num_input_tokens_seen": 21491760, "step": 3554, "train_runtime": 3605.4519, "train_tokens_per_second": 5960.906 }, { "epoch": 1.3074942528735631, "grad_norm": 0.952498733997345, "learning_rate": 6.935394809497515e-05, "loss": 1.5592, "num_input_tokens_seen": 21496864, "step": 3555, "train_runtime": 3606.2789, "train_tokens_per_second": 5960.954 }, { "epoch": 1.3078620689655174, "grad_norm": 0.9148018956184387, "learning_rate": 6.931713602061478e-05, "loss": 1.3999, "num_input_tokens_seen": 21502640, "step": 3556, "train_runtime": 3607.232, "train_tokens_per_second": 5960.981 }, { "epoch": 1.3082298850574712, "grad_norm": 0.9440029263496399, "learning_rate": 6.928032394625437e-05, "loss": 1.5397, "num_input_tokens_seen": 21508736, "step": 3557, "train_runtime": 3608.2219, "train_tokens_per_second": 5961.035 }, { "epoch": 1.3085977011494254, "grad_norm": 0.9105268120765686, "learning_rate": 6.924351187189398e-05, "loss": 1.4166, "num_input_tokens_seen": 21515088, "step": 3558, "train_runtime": 3609.2621, "train_tokens_per_second": 5961.077 }, { "epoch": 1.3089655172413792, "grad_norm": 0.9310047626495361, "learning_rate": 6.920669979753359e-05, "loss": 1.3953, "num_input_tokens_seen": 21521600, "step": 3559, "train_runtime": 3610.2941, "train_tokens_per_second": 5961.176 }, { "epoch": 1.3093333333333335, "grad_norm": 0.9549909234046936, "learning_rate": 6.91698877231732e-05, "loss": 1.5641, "num_input_tokens_seen": 21526384, "step": 3560, "train_runtime": 3611.108, "train_tokens_per_second": 5961.158 }, { "epoch": 1.3097011494252873, "grad_norm": 0.9676443338394165, "learning_rate": 6.913307564881282e-05, "loss": 1.6549, "num_input_tokens_seen": 21530768, "step": 3561, "train_runtime": 3611.8932, "train_tokens_per_second": 5961.075 }, { "epoch": 1.3100689655172415, "grad_norm": 0.9232891201972961, "learning_rate": 6.909626357445243e-05, "loss": 1.5543, "num_input_tokens_seen": 21536848, "step": 3562, "train_runtime": 3612.9044, "train_tokens_per_second": 5961.09 }, { "epoch": 1.3104367816091953, "grad_norm": 0.9708718657493591, "learning_rate": 6.905945150009204e-05, "loss": 1.4952, "num_input_tokens_seen": 21541200, "step": 3563, "train_runtime": 3613.6287, "train_tokens_per_second": 5961.099 }, { "epoch": 1.3108045977011495, "grad_norm": 1.0027772188186646, "learning_rate": 6.902263942573163e-05, "loss": 1.5742, "num_input_tokens_seen": 21548128, "step": 3564, "train_runtime": 3614.73, "train_tokens_per_second": 5961.2 }, { "epoch": 1.3111724137931033, "grad_norm": 0.9488890171051025, "learning_rate": 6.898582735137126e-05, "loss": 1.4745, "num_input_tokens_seen": 21553184, "step": 3565, "train_runtime": 3615.5819, "train_tokens_per_second": 5961.194 }, { "epoch": 1.3115402298850576, "grad_norm": 0.9458577632904053, "learning_rate": 6.894901527701086e-05, "loss": 1.3461, "num_input_tokens_seen": 21558848, "step": 3566, "train_runtime": 3616.5211, "train_tokens_per_second": 5961.212 }, { "epoch": 1.3119080459770114, "grad_norm": 0.9157336354255676, "learning_rate": 6.891220320265047e-05, "loss": 1.5361, "num_input_tokens_seen": 21565360, "step": 3567, "train_runtime": 3617.5474, "train_tokens_per_second": 5961.321 }, { "epoch": 1.3122758620689656, "grad_norm": 0.9321467280387878, "learning_rate": 6.887539112829008e-05, "loss": 1.44, "num_input_tokens_seen": 21570304, "step": 3568, "train_runtime": 3618.3744, "train_tokens_per_second": 5961.324 }, { "epoch": 1.3126436781609194, "grad_norm": 0.9249515533447266, "learning_rate": 6.883857905392969e-05, "loss": 1.6631, "num_input_tokens_seen": 21575376, "step": 3569, "train_runtime": 3619.2504, "train_tokens_per_second": 5961.283 }, { "epoch": 1.3130114942528737, "grad_norm": 0.9264847636222839, "learning_rate": 6.88017669795693e-05, "loss": 1.4589, "num_input_tokens_seen": 21582656, "step": 3570, "train_runtime": 3620.4294, "train_tokens_per_second": 5961.353 }, { "epoch": 1.3133793103448275, "grad_norm": 0.9606678485870361, "learning_rate": 6.876495490520891e-05, "loss": 1.5251, "num_input_tokens_seen": 21590016, "step": 3571, "train_runtime": 3622.0933, "train_tokens_per_second": 5960.646 }, { "epoch": 1.3137471264367817, "grad_norm": 0.955280065536499, "learning_rate": 6.872814283084852e-05, "loss": 1.4844, "num_input_tokens_seen": 21595504, "step": 3572, "train_runtime": 3623.0297, "train_tokens_per_second": 5960.62 }, { "epoch": 1.3141149425287355, "grad_norm": 0.8960136771202087, "learning_rate": 6.869133075648813e-05, "loss": 1.3609, "num_input_tokens_seen": 21602656, "step": 3573, "train_runtime": 3624.1575, "train_tokens_per_second": 5960.739 }, { "epoch": 1.3144827586206898, "grad_norm": 0.9145007729530334, "learning_rate": 6.865451868212775e-05, "loss": 1.6295, "num_input_tokens_seen": 21608560, "step": 3574, "train_runtime": 3625.1404, "train_tokens_per_second": 5960.751 }, { "epoch": 1.3148505747126435, "grad_norm": 0.9274311661720276, "learning_rate": 6.861770660776736e-05, "loss": 1.4616, "num_input_tokens_seen": 21615232, "step": 3575, "train_runtime": 3626.2065, "train_tokens_per_second": 5960.839 }, { "epoch": 1.3152183908045978, "grad_norm": 1.1087721586227417, "learning_rate": 6.858089453340695e-05, "loss": 1.4991, "num_input_tokens_seen": 21620384, "step": 3576, "train_runtime": 3627.0383, "train_tokens_per_second": 5960.892 }, { "epoch": 1.3155862068965516, "grad_norm": 0.8783528208732605, "learning_rate": 6.854408245904656e-05, "loss": 1.353, "num_input_tokens_seen": 21626992, "step": 3577, "train_runtime": 3628.088, "train_tokens_per_second": 5960.989 }, { "epoch": 1.3159540229885058, "grad_norm": 0.9759103059768677, "learning_rate": 6.850727038468618e-05, "loss": 1.6281, "num_input_tokens_seen": 21631824, "step": 3578, "train_runtime": 3628.9008, "train_tokens_per_second": 5960.985 }, { "epoch": 1.3163218390804596, "grad_norm": 1.032320261001587, "learning_rate": 6.84704583103258e-05, "loss": 1.6755, "num_input_tokens_seen": 21636400, "step": 3579, "train_runtime": 3629.6803, "train_tokens_per_second": 5960.966 }, { "epoch": 1.3166896551724139, "grad_norm": 0.9147163033485413, "learning_rate": 6.84336462359654e-05, "loss": 1.4719, "num_input_tokens_seen": 21642672, "step": 3580, "train_runtime": 3630.7085, "train_tokens_per_second": 5961.005 }, { "epoch": 1.317057471264368, "grad_norm": 1.004988431930542, "learning_rate": 6.839683416160501e-05, "loss": 1.4274, "num_input_tokens_seen": 21649264, "step": 3581, "train_runtime": 3631.7982, "train_tokens_per_second": 5961.032 }, { "epoch": 1.317425287356322, "grad_norm": 1.0151127576828003, "learning_rate": 6.836002208724462e-05, "loss": 1.5953, "num_input_tokens_seen": 21654624, "step": 3582, "train_runtime": 3632.6852, "train_tokens_per_second": 5961.052 }, { "epoch": 1.317793103448276, "grad_norm": 0.9770903587341309, "learning_rate": 6.832321001288423e-05, "loss": 1.4601, "num_input_tokens_seen": 21660352, "step": 3583, "train_runtime": 3633.6143, "train_tokens_per_second": 5961.104 }, { "epoch": 1.31816091954023, "grad_norm": 0.9266052842140198, "learning_rate": 6.828639793852384e-05, "loss": 1.4973, "num_input_tokens_seen": 21665968, "step": 3584, "train_runtime": 3634.5462, "train_tokens_per_second": 5961.121 }, { "epoch": 1.318528735632184, "grad_norm": 0.8691406846046448, "learning_rate": 6.824958586416345e-05, "loss": 1.7214, "num_input_tokens_seen": 21672448, "step": 3585, "train_runtime": 3635.6006, "train_tokens_per_second": 5961.174 }, { "epoch": 1.318896551724138, "grad_norm": 0.9937482476234436, "learning_rate": 6.821277378980307e-05, "loss": 1.3971, "num_input_tokens_seen": 21677744, "step": 3586, "train_runtime": 3636.491, "train_tokens_per_second": 5961.171 }, { "epoch": 1.319264367816092, "grad_norm": 1.1415114402770996, "learning_rate": 6.817596171544266e-05, "loss": 1.6211, "num_input_tokens_seen": 21687312, "step": 3587, "train_runtime": 3637.94, "train_tokens_per_second": 5961.427 }, { "epoch": 1.319632183908046, "grad_norm": 0.9889041185379028, "learning_rate": 6.813914964108227e-05, "loss": 1.4436, "num_input_tokens_seen": 21692496, "step": 3588, "train_runtime": 3638.7972, "train_tokens_per_second": 5961.447 }, { "epoch": 1.32, "grad_norm": 1.045847773551941, "learning_rate": 6.810233756672188e-05, "loss": 1.5134, "num_input_tokens_seen": 21697328, "step": 3589, "train_runtime": 3639.6186, "train_tokens_per_second": 5961.429 }, { "epoch": 1.320367816091954, "grad_norm": 0.9165908694267273, "learning_rate": 6.806552549236149e-05, "loss": 1.5225, "num_input_tokens_seen": 21702928, "step": 3590, "train_runtime": 3640.5434, "train_tokens_per_second": 5961.453 }, { "epoch": 1.320735632183908, "grad_norm": 1.0751782655715942, "learning_rate": 6.802871341800111e-05, "loss": 1.4756, "num_input_tokens_seen": 21711568, "step": 3591, "train_runtime": 3641.8795, "train_tokens_per_second": 5961.638 }, { "epoch": 1.3211034482758621, "grad_norm": 1.0258948802947998, "learning_rate": 6.799190134364072e-05, "loss": 1.6299, "num_input_tokens_seen": 21716240, "step": 3592, "train_runtime": 3642.6783, "train_tokens_per_second": 5961.613 }, { "epoch": 1.3214712643678161, "grad_norm": 0.9881296753883362, "learning_rate": 6.795508926928033e-05, "loss": 1.4815, "num_input_tokens_seen": 21721840, "step": 3593, "train_runtime": 3643.6003, "train_tokens_per_second": 5961.642 }, { "epoch": 1.3218390804597702, "grad_norm": 0.9271832704544067, "learning_rate": 6.791827719491993e-05, "loss": 1.4684, "num_input_tokens_seen": 21727680, "step": 3594, "train_runtime": 3644.5697, "train_tokens_per_second": 5961.659 }, { "epoch": 1.3222068965517242, "grad_norm": 0.9892234802246094, "learning_rate": 6.788146512055955e-05, "loss": 1.6203, "num_input_tokens_seen": 21732800, "step": 3595, "train_runtime": 3645.4517, "train_tokens_per_second": 5961.621 }, { "epoch": 1.3225747126436782, "grad_norm": 0.9278784990310669, "learning_rate": 6.784465304619916e-05, "loss": 1.247, "num_input_tokens_seen": 21739424, "step": 3596, "train_runtime": 3646.5055, "train_tokens_per_second": 5961.714 }, { "epoch": 1.3229425287356322, "grad_norm": 0.9651308059692383, "learning_rate": 6.780784097183877e-05, "loss": 1.6359, "num_input_tokens_seen": 21744560, "step": 3597, "train_runtime": 3647.3596, "train_tokens_per_second": 5961.726 }, { "epoch": 1.3233103448275862, "grad_norm": 0.9792284369468689, "learning_rate": 6.777102889747838e-05, "loss": 1.6924, "num_input_tokens_seen": 21751584, "step": 3598, "train_runtime": 3648.48, "train_tokens_per_second": 5961.821 }, { "epoch": 1.3236781609195403, "grad_norm": 0.9538254141807556, "learning_rate": 6.773421682311798e-05, "loss": 1.4251, "num_input_tokens_seen": 21760896, "step": 3599, "train_runtime": 3649.9267, "train_tokens_per_second": 5962.009 }, { "epoch": 1.3240459770114943, "grad_norm": 1.0540046691894531, "learning_rate": 6.76974047487576e-05, "loss": 1.6302, "num_input_tokens_seen": 21765760, "step": 3600, "train_runtime": 3650.7609, "train_tokens_per_second": 5961.979 }, { "epoch": 1.3244137931034483, "grad_norm": 0.9055759310722351, "learning_rate": 6.76605926743972e-05, "loss": 1.3623, "num_input_tokens_seen": 21772736, "step": 3601, "train_runtime": 3652.7763, "train_tokens_per_second": 5960.599 }, { "epoch": 1.3247816091954023, "grad_norm": 0.9791301488876343, "learning_rate": 6.762378060003681e-05, "loss": 1.7489, "num_input_tokens_seen": 21778256, "step": 3602, "train_runtime": 3653.6762, "train_tokens_per_second": 5960.642 }, { "epoch": 1.3251494252873564, "grad_norm": 0.946537971496582, "learning_rate": 6.758696852567642e-05, "loss": 1.5355, "num_input_tokens_seen": 21786032, "step": 3603, "train_runtime": 3654.9051, "train_tokens_per_second": 5960.765 }, { "epoch": 1.3255172413793104, "grad_norm": 0.9573668837547302, "learning_rate": 6.755015645131604e-05, "loss": 1.4401, "num_input_tokens_seen": 21792608, "step": 3604, "train_runtime": 3655.953, "train_tokens_per_second": 5960.856 }, { "epoch": 1.3258850574712644, "grad_norm": 0.9119144678115845, "learning_rate": 6.751334437695565e-05, "loss": 1.5431, "num_input_tokens_seen": 21797040, "step": 3605, "train_runtime": 3656.7146, "train_tokens_per_second": 5960.826 }, { "epoch": 1.3262528735632184, "grad_norm": 1.127028465270996, "learning_rate": 6.747653230259525e-05, "loss": 1.8795, "num_input_tokens_seen": 21801888, "step": 3606, "train_runtime": 3657.5562, "train_tokens_per_second": 5960.78 }, { "epoch": 1.3266206896551724, "grad_norm": 0.8924864530563354, "learning_rate": 6.743972022823486e-05, "loss": 1.215, "num_input_tokens_seen": 21809920, "step": 3607, "train_runtime": 3658.8111, "train_tokens_per_second": 5960.931 }, { "epoch": 1.3269885057471265, "grad_norm": 0.9637953042984009, "learning_rate": 6.740290815387448e-05, "loss": 1.5693, "num_input_tokens_seen": 21817840, "step": 3608, "train_runtime": 3660.027, "train_tokens_per_second": 5961.114 }, { "epoch": 1.3273563218390805, "grad_norm": 0.8713181614875793, "learning_rate": 6.736609607951409e-05, "loss": 1.5456, "num_input_tokens_seen": 21824704, "step": 3609, "train_runtime": 3661.1169, "train_tokens_per_second": 5961.215 }, { "epoch": 1.3277241379310345, "grad_norm": 1.0000393390655518, "learning_rate": 6.73292840051537e-05, "loss": 1.6462, "num_input_tokens_seen": 21829360, "step": 3610, "train_runtime": 3661.9209, "train_tokens_per_second": 5961.177 }, { "epoch": 1.3280919540229885, "grad_norm": 0.9577270746231079, "learning_rate": 6.72924719307933e-05, "loss": 1.7021, "num_input_tokens_seen": 21834288, "step": 3611, "train_runtime": 3662.7712, "train_tokens_per_second": 5961.139 }, { "epoch": 1.3284597701149425, "grad_norm": 1.1305314302444458, "learning_rate": 6.725565985643291e-05, "loss": 1.5471, "num_input_tokens_seen": 21839920, "step": 3612, "train_runtime": 3663.7165, "train_tokens_per_second": 5961.138 }, { "epoch": 1.3288275862068966, "grad_norm": 0.913192868232727, "learning_rate": 6.721884778207252e-05, "loss": 1.5525, "num_input_tokens_seen": 21845136, "step": 3613, "train_runtime": 3664.6009, "train_tokens_per_second": 5961.123 }, { "epoch": 1.3291954022988506, "grad_norm": 0.9686322808265686, "learning_rate": 6.718203570771213e-05, "loss": 1.4421, "num_input_tokens_seen": 21851216, "step": 3614, "train_runtime": 3665.5821, "train_tokens_per_second": 5961.186 }, { "epoch": 1.3295632183908046, "grad_norm": 1.0518219470977783, "learning_rate": 6.714522363335174e-05, "loss": 1.7396, "num_input_tokens_seen": 21856368, "step": 3615, "train_runtime": 3666.4401, "train_tokens_per_second": 5961.196 }, { "epoch": 1.3299310344827586, "grad_norm": 0.9622789621353149, "learning_rate": 6.710841155899136e-05, "loss": 1.5931, "num_input_tokens_seen": 21861296, "step": 3616, "train_runtime": 3667.2578, "train_tokens_per_second": 5961.211 }, { "epoch": 1.3302988505747126, "grad_norm": 0.851626992225647, "learning_rate": 6.707159948463096e-05, "loss": 1.4147, "num_input_tokens_seen": 21868416, "step": 3617, "train_runtime": 3668.383, "train_tokens_per_second": 5961.323 }, { "epoch": 1.3306666666666667, "grad_norm": 0.9522973299026489, "learning_rate": 6.703478741027057e-05, "loss": 1.5486, "num_input_tokens_seen": 21874544, "step": 3618, "train_runtime": 3669.3964, "train_tokens_per_second": 5961.347 }, { "epoch": 1.3310344827586207, "grad_norm": 0.9630358219146729, "learning_rate": 6.699797533591018e-05, "loss": 1.6862, "num_input_tokens_seen": 21878960, "step": 3619, "train_runtime": 3670.15, "train_tokens_per_second": 5961.326 }, { "epoch": 1.3314022988505747, "grad_norm": 0.8978569507598877, "learning_rate": 6.696116326154979e-05, "loss": 1.4714, "num_input_tokens_seen": 21884256, "step": 3620, "train_runtime": 3671.0358, "train_tokens_per_second": 5961.33 }, { "epoch": 1.3317701149425287, "grad_norm": 0.8899297714233398, "learning_rate": 6.692435118718941e-05, "loss": 1.4217, "num_input_tokens_seen": 21889280, "step": 3621, "train_runtime": 3671.8648, "train_tokens_per_second": 5961.352 }, { "epoch": 1.3321379310344827, "grad_norm": 0.9578220844268799, "learning_rate": 6.688753911282902e-05, "loss": 1.5489, "num_input_tokens_seen": 21894656, "step": 3622, "train_runtime": 3672.8062, "train_tokens_per_second": 5961.288 }, { "epoch": 1.3325057471264368, "grad_norm": 0.9276697039604187, "learning_rate": 6.685072703846863e-05, "loss": 1.4861, "num_input_tokens_seen": 21899376, "step": 3623, "train_runtime": 3673.6428, "train_tokens_per_second": 5961.215 }, { "epoch": 1.3328735632183908, "grad_norm": 0.9538954496383667, "learning_rate": 6.681391496410822e-05, "loss": 1.5598, "num_input_tokens_seen": 21905024, "step": 3624, "train_runtime": 3674.5517, "train_tokens_per_second": 5961.278 }, { "epoch": 1.3332413793103448, "grad_norm": 0.9099012613296509, "learning_rate": 6.677710288974784e-05, "loss": 1.5987, "num_input_tokens_seen": 21913040, "step": 3625, "train_runtime": 3675.7981, "train_tokens_per_second": 5961.437 }, { "epoch": 1.3336091954022988, "grad_norm": 0.9048240184783936, "learning_rate": 6.674029081538745e-05, "loss": 1.6086, "num_input_tokens_seen": 21917856, "step": 3626, "train_runtime": 3676.6371, "train_tokens_per_second": 5961.387 }, { "epoch": 1.3339770114942529, "grad_norm": 0.9351340532302856, "learning_rate": 6.670347874102706e-05, "loss": 1.4364, "num_input_tokens_seen": 21922560, "step": 3627, "train_runtime": 3677.4437, "train_tokens_per_second": 5961.358 }, { "epoch": 1.3343448275862069, "grad_norm": 0.9369754791259766, "learning_rate": 6.666666666666667e-05, "loss": 1.355, "num_input_tokens_seen": 21930080, "step": 3628, "train_runtime": 3678.6422, "train_tokens_per_second": 5961.46 }, { "epoch": 1.334712643678161, "grad_norm": 0.967265248298645, "learning_rate": 6.662985459230628e-05, "loss": 1.4384, "num_input_tokens_seen": 21935488, "step": 3629, "train_runtime": 3679.5302, "train_tokens_per_second": 5961.492 }, { "epoch": 1.335080459770115, "grad_norm": 0.872542679309845, "learning_rate": 6.659304251794589e-05, "loss": 1.335, "num_input_tokens_seen": 21941504, "step": 3630, "train_runtime": 3680.5227, "train_tokens_per_second": 5961.518 }, { "epoch": 1.335448275862069, "grad_norm": 0.922120213508606, "learning_rate": 6.65562304435855e-05, "loss": 1.7397, "num_input_tokens_seen": 21946352, "step": 3631, "train_runtime": 3681.9045, "train_tokens_per_second": 5960.598 }, { "epoch": 1.335816091954023, "grad_norm": 0.9233165979385376, "learning_rate": 6.65194183692251e-05, "loss": 1.5473, "num_input_tokens_seen": 21953792, "step": 3632, "train_runtime": 3683.0954, "train_tokens_per_second": 5960.691 }, { "epoch": 1.336183908045977, "grad_norm": 0.9813206791877747, "learning_rate": 6.648260629486473e-05, "loss": 1.7812, "num_input_tokens_seen": 21958320, "step": 3633, "train_runtime": 3683.9002, "train_tokens_per_second": 5960.618 }, { "epoch": 1.336551724137931, "grad_norm": 0.874936580657959, "learning_rate": 6.644579422050434e-05, "loss": 1.3367, "num_input_tokens_seen": 21966848, "step": 3634, "train_runtime": 3685.2231, "train_tokens_per_second": 5960.792 }, { "epoch": 1.336919540229885, "grad_norm": 0.8871551156044006, "learning_rate": 6.640898214614393e-05, "loss": 1.4398, "num_input_tokens_seen": 21974352, "step": 3635, "train_runtime": 3686.3878, "train_tokens_per_second": 5960.944 }, { "epoch": 1.337287356321839, "grad_norm": 0.8556391596794128, "learning_rate": 6.637217007178354e-05, "loss": 1.4947, "num_input_tokens_seen": 21979328, "step": 3636, "train_runtime": 3687.2122, "train_tokens_per_second": 5960.961 }, { "epoch": 1.337655172413793, "grad_norm": 1.025610089302063, "learning_rate": 6.633535799742315e-05, "loss": 1.7505, "num_input_tokens_seen": 21985808, "step": 3637, "train_runtime": 3688.2614, "train_tokens_per_second": 5961.022 }, { "epoch": 1.338022988505747, "grad_norm": 0.9810093641281128, "learning_rate": 6.629854592306277e-05, "loss": 1.4707, "num_input_tokens_seen": 21992528, "step": 3638, "train_runtime": 3689.3316, "train_tokens_per_second": 5961.114 }, { "epoch": 1.338390804597701, "grad_norm": 0.9924654364585876, "learning_rate": 6.626173384870238e-05, "loss": 1.5178, "num_input_tokens_seen": 21998448, "step": 3639, "train_runtime": 3690.3049, "train_tokens_per_second": 5961.147 }, { "epoch": 1.3387586206896551, "grad_norm": 0.8719496130943298, "learning_rate": 6.622492177434199e-05, "loss": 1.3504, "num_input_tokens_seen": 22005936, "step": 3640, "train_runtime": 3691.4745, "train_tokens_per_second": 5961.286 }, { "epoch": 1.3391264367816091, "grad_norm": 0.8840570449829102, "learning_rate": 6.61881096999816e-05, "loss": 1.6397, "num_input_tokens_seen": 22014256, "step": 3641, "train_runtime": 3692.7687, "train_tokens_per_second": 5961.45 }, { "epoch": 1.3394942528735632, "grad_norm": 0.9345259666442871, "learning_rate": 6.615129762562121e-05, "loss": 1.6824, "num_input_tokens_seen": 22021760, "step": 3642, "train_runtime": 3693.9247, "train_tokens_per_second": 5961.616 }, { "epoch": 1.3398620689655172, "grad_norm": 0.8800603747367859, "learning_rate": 6.611448555126082e-05, "loss": 1.4757, "num_input_tokens_seen": 22027232, "step": 3643, "train_runtime": 3694.8251, "train_tokens_per_second": 5961.644 }, { "epoch": 1.3402298850574712, "grad_norm": 1.0404003858566284, "learning_rate": 6.607767347690043e-05, "loss": 1.6164, "num_input_tokens_seen": 22031760, "step": 3644, "train_runtime": 3695.6109, "train_tokens_per_second": 5961.602 }, { "epoch": 1.3405977011494252, "grad_norm": 0.9096168875694275, "learning_rate": 6.604086140254003e-05, "loss": 1.6111, "num_input_tokens_seen": 22038224, "step": 3645, "train_runtime": 3696.6572, "train_tokens_per_second": 5961.663 }, { "epoch": 1.3409655172413792, "grad_norm": 0.8191343545913696, "learning_rate": 6.600404932817966e-05, "loss": 1.525, "num_input_tokens_seen": 22047168, "step": 3646, "train_runtime": 3698.0279, "train_tokens_per_second": 5961.872 }, { "epoch": 1.3413333333333333, "grad_norm": 0.922600269317627, "learning_rate": 6.596723725381925e-05, "loss": 1.4622, "num_input_tokens_seen": 22051824, "step": 3647, "train_runtime": 3698.817, "train_tokens_per_second": 5961.859 }, { "epoch": 1.3417011494252873, "grad_norm": 0.8109387755393982, "learning_rate": 6.593042517945886e-05, "loss": 1.4115, "num_input_tokens_seen": 22060576, "step": 3648, "train_runtime": 3700.1939, "train_tokens_per_second": 5962.005 }, { "epoch": 1.3420689655172413, "grad_norm": 0.9020803570747375, "learning_rate": 6.589361310509847e-05, "loss": 1.3771, "num_input_tokens_seen": 22066608, "step": 3649, "train_runtime": 3701.1871, "train_tokens_per_second": 5962.035 }, { "epoch": 1.3424367816091953, "grad_norm": 1.0523520708084106, "learning_rate": 6.585680103073808e-05, "loss": 1.6008, "num_input_tokens_seen": 22071136, "step": 3650, "train_runtime": 3701.9872, "train_tokens_per_second": 5961.97 }, { "epoch": 1.3428045977011493, "grad_norm": 0.9008994698524475, "learning_rate": 6.58199889563777e-05, "loss": 1.4083, "num_input_tokens_seen": 22076624, "step": 3651, "train_runtime": 3702.898, "train_tokens_per_second": 5961.985 }, { "epoch": 1.3431724137931034, "grad_norm": 0.9648478031158447, "learning_rate": 6.578317688201731e-05, "loss": 1.6224, "num_input_tokens_seen": 22083296, "step": 3652, "train_runtime": 3703.9538, "train_tokens_per_second": 5962.087 }, { "epoch": 1.3435402298850574, "grad_norm": 0.9025352001190186, "learning_rate": 6.574636480765692e-05, "loss": 1.3237, "num_input_tokens_seen": 22091472, "step": 3653, "train_runtime": 3705.2242, "train_tokens_per_second": 5962.25 }, { "epoch": 1.3439080459770114, "grad_norm": 0.9065526127815247, "learning_rate": 6.570955273329651e-05, "loss": 1.4691, "num_input_tokens_seen": 22096976, "step": 3654, "train_runtime": 3706.1286, "train_tokens_per_second": 5962.28 }, { "epoch": 1.3442758620689657, "grad_norm": 0.9897463321685791, "learning_rate": 6.567274065893614e-05, "loss": 1.5573, "num_input_tokens_seen": 22101488, "step": 3655, "train_runtime": 3706.9331, "train_tokens_per_second": 5962.203 }, { "epoch": 1.3446436781609195, "grad_norm": 0.9158437848091125, "learning_rate": 6.563592858457575e-05, "loss": 1.1949, "num_input_tokens_seen": 22113408, "step": 3656, "train_runtime": 3708.7042, "train_tokens_per_second": 5962.57 }, { "epoch": 1.3450114942528737, "grad_norm": 0.9928573966026306, "learning_rate": 6.559911651021535e-05, "loss": 1.3919, "num_input_tokens_seen": 22123456, "step": 3657, "train_runtime": 3710.2097, "train_tokens_per_second": 5962.859 }, { "epoch": 1.3453793103448275, "grad_norm": 0.8950387239456177, "learning_rate": 6.556230443585496e-05, "loss": 1.6679, "num_input_tokens_seen": 22128816, "step": 3658, "train_runtime": 3711.1151, "train_tokens_per_second": 5962.848 }, { "epoch": 1.3457471264367817, "grad_norm": 1.1250476837158203, "learning_rate": 6.552549236149457e-05, "loss": 1.6202, "num_input_tokens_seen": 22134496, "step": 3659, "train_runtime": 3712.0539, "train_tokens_per_second": 5962.87 }, { "epoch": 1.3461149425287355, "grad_norm": 0.9576421976089478, "learning_rate": 6.548868028713418e-05, "loss": 1.4687, "num_input_tokens_seen": 22141824, "step": 3660, "train_runtime": 3713.2448, "train_tokens_per_second": 5962.931 }, { "epoch": 1.3464827586206898, "grad_norm": 0.9883807301521301, "learning_rate": 6.545186821277379e-05, "loss": 1.6294, "num_input_tokens_seen": 22146944, "step": 3661, "train_runtime": 3714.6739, "train_tokens_per_second": 5962.016 }, { "epoch": 1.3468505747126436, "grad_norm": 0.9688007235527039, "learning_rate": 6.54150561384134e-05, "loss": 1.7011, "num_input_tokens_seen": 22151952, "step": 3662, "train_runtime": 3715.5222, "train_tokens_per_second": 5962.002 }, { "epoch": 1.3472183908045978, "grad_norm": 0.9309114217758179, "learning_rate": 6.537824406405302e-05, "loss": 1.5218, "num_input_tokens_seen": 22157680, "step": 3663, "train_runtime": 3716.4592, "train_tokens_per_second": 5962.04 }, { "epoch": 1.3475862068965516, "grad_norm": 0.9676522016525269, "learning_rate": 6.534143198969263e-05, "loss": 1.4096, "num_input_tokens_seen": 22162240, "step": 3664, "train_runtime": 3717.1989, "train_tokens_per_second": 5962.081 }, { "epoch": 1.3479540229885059, "grad_norm": 1.0314520597457886, "learning_rate": 6.530461991533223e-05, "loss": 1.6148, "num_input_tokens_seen": 22167472, "step": 3665, "train_runtime": 3718.059, "train_tokens_per_second": 5962.109 }, { "epoch": 1.3483218390804597, "grad_norm": 0.9597965478897095, "learning_rate": 6.526780784097183e-05, "loss": 1.7207, "num_input_tokens_seen": 22173968, "step": 3666, "train_runtime": 3719.1156, "train_tokens_per_second": 5962.162 }, { "epoch": 1.348689655172414, "grad_norm": 1.004009485244751, "learning_rate": 6.523099576661144e-05, "loss": 1.3832, "num_input_tokens_seen": 22178624, "step": 3667, "train_runtime": 3719.9082, "train_tokens_per_second": 5962.143 }, { "epoch": 1.3490574712643677, "grad_norm": 0.955319881439209, "learning_rate": 6.519418369225107e-05, "loss": 1.6779, "num_input_tokens_seen": 22183008, "step": 3668, "train_runtime": 3720.6684, "train_tokens_per_second": 5962.103 }, { "epoch": 1.349425287356322, "grad_norm": 0.9129797220230103, "learning_rate": 6.515737161789068e-05, "loss": 1.4714, "num_input_tokens_seen": 22194640, "step": 3669, "train_runtime": 3722.4084, "train_tokens_per_second": 5962.441 }, { "epoch": 1.3497931034482757, "grad_norm": 0.8621333241462708, "learning_rate": 6.512055954353028e-05, "loss": 1.4761, "num_input_tokens_seen": 22202496, "step": 3670, "train_runtime": 3723.6421, "train_tokens_per_second": 5962.575 }, { "epoch": 1.35016091954023, "grad_norm": 0.9802247285842896, "learning_rate": 6.508374746916989e-05, "loss": 1.6187, "num_input_tokens_seen": 22206960, "step": 3671, "train_runtime": 3724.4325, "train_tokens_per_second": 5962.508 }, { "epoch": 1.3505287356321838, "grad_norm": 0.9478545188903809, "learning_rate": 6.50469353948095e-05, "loss": 1.4785, "num_input_tokens_seen": 22213264, "step": 3672, "train_runtime": 3725.4422, "train_tokens_per_second": 5962.585 }, { "epoch": 1.350896551724138, "grad_norm": 1.021788477897644, "learning_rate": 6.501012332044911e-05, "loss": 1.5397, "num_input_tokens_seen": 22217888, "step": 3673, "train_runtime": 3726.2641, "train_tokens_per_second": 5962.51 }, { "epoch": 1.3512643678160918, "grad_norm": 0.9838345646858215, "learning_rate": 6.497331124608872e-05, "loss": 1.53, "num_input_tokens_seen": 22223344, "step": 3674, "train_runtime": 3727.183, "train_tokens_per_second": 5962.504 }, { "epoch": 1.351632183908046, "grad_norm": 0.9164777398109436, "learning_rate": 6.493649917172833e-05, "loss": 1.4674, "num_input_tokens_seen": 22228560, "step": 3675, "train_runtime": 3728.0481, "train_tokens_per_second": 5962.52 }, { "epoch": 1.3519999999999999, "grad_norm": 0.8565971851348877, "learning_rate": 6.489968709736795e-05, "loss": 1.4083, "num_input_tokens_seen": 22236192, "step": 3676, "train_runtime": 3729.2419, "train_tokens_per_second": 5962.657 }, { "epoch": 1.3523678160919541, "grad_norm": 0.9358131289482117, "learning_rate": 6.486287502300755e-05, "loss": 1.5632, "num_input_tokens_seen": 22241488, "step": 3677, "train_runtime": 3730.1418, "train_tokens_per_second": 5962.639 }, { "epoch": 1.352735632183908, "grad_norm": 0.945747971534729, "learning_rate": 6.482606294864716e-05, "loss": 1.4429, "num_input_tokens_seen": 22248832, "step": 3678, "train_runtime": 3731.2897, "train_tokens_per_second": 5962.773 }, { "epoch": 1.3531034482758622, "grad_norm": 0.9707575440406799, "learning_rate": 6.478925087428676e-05, "loss": 1.6877, "num_input_tokens_seen": 22259072, "step": 3679, "train_runtime": 3732.8159, "train_tokens_per_second": 5963.078 }, { "epoch": 1.3534712643678162, "grad_norm": 0.870474100112915, "learning_rate": 6.475243879992637e-05, "loss": 1.4871, "num_input_tokens_seen": 22267280, "step": 3680, "train_runtime": 3734.0859, "train_tokens_per_second": 5963.248 }, { "epoch": 1.3538390804597702, "grad_norm": 0.8968935012817383, "learning_rate": 6.4715626725566e-05, "loss": 1.5029, "num_input_tokens_seen": 22272032, "step": 3681, "train_runtime": 3734.9229, "train_tokens_per_second": 5963.184 }, { "epoch": 1.3542068965517242, "grad_norm": 1.1222615242004395, "learning_rate": 6.46788146512056e-05, "loss": 1.6715, "num_input_tokens_seen": 22278448, "step": 3682, "train_runtime": 3735.9483, "train_tokens_per_second": 5963.265 }, { "epoch": 1.3545747126436782, "grad_norm": 0.9637027382850647, "learning_rate": 6.464200257684521e-05, "loss": 1.6128, "num_input_tokens_seen": 22283280, "step": 3683, "train_runtime": 3736.7621, "train_tokens_per_second": 5963.259 }, { "epoch": 1.3549425287356323, "grad_norm": 0.9350388050079346, "learning_rate": 6.460519050248481e-05, "loss": 1.6421, "num_input_tokens_seen": 22289696, "step": 3684, "train_runtime": 3737.8179, "train_tokens_per_second": 5963.291 }, { "epoch": 1.3553103448275863, "grad_norm": 0.9158656597137451, "learning_rate": 6.456837842812443e-05, "loss": 1.6688, "num_input_tokens_seen": 22296272, "step": 3685, "train_runtime": 3738.9153, "train_tokens_per_second": 5963.3 }, { "epoch": 1.3556781609195403, "grad_norm": 0.8514031767845154, "learning_rate": 6.453156635376404e-05, "loss": 1.4368, "num_input_tokens_seen": 22305472, "step": 3686, "train_runtime": 3740.3086, "train_tokens_per_second": 5963.538 }, { "epoch": 1.3560459770114943, "grad_norm": 0.9319664239883423, "learning_rate": 6.449475427940365e-05, "loss": 1.6136, "num_input_tokens_seen": 22311664, "step": 3687, "train_runtime": 3741.2943, "train_tokens_per_second": 5963.622 }, { "epoch": 1.3564137931034483, "grad_norm": 0.914702832698822, "learning_rate": 6.445794220504326e-05, "loss": 1.5977, "num_input_tokens_seen": 22317712, "step": 3688, "train_runtime": 3742.3073, "train_tokens_per_second": 5963.624 }, { "epoch": 1.3567816091954024, "grad_norm": 0.7683727145195007, "learning_rate": 6.442113013068287e-05, "loss": 1.2976, "num_input_tokens_seen": 22329168, "step": 3689, "train_runtime": 3744.0179, "train_tokens_per_second": 5963.959 }, { "epoch": 1.3571494252873564, "grad_norm": 0.9728146195411682, "learning_rate": 6.438431805632248e-05, "loss": 1.4736, "num_input_tokens_seen": 22334752, "step": 3690, "train_runtime": 3744.9788, "train_tokens_per_second": 5963.92 }, { "epoch": 1.3575172413793104, "grad_norm": 0.8961226940155029, "learning_rate": 6.434750598196208e-05, "loss": 1.4565, "num_input_tokens_seen": 22339472, "step": 3691, "train_runtime": 3746.2865, "train_tokens_per_second": 5963.098 }, { "epoch": 1.3578850574712644, "grad_norm": 0.9248019456863403, "learning_rate": 6.431069390760169e-05, "loss": 1.4495, "num_input_tokens_seen": 22345936, "step": 3692, "train_runtime": 3747.3179, "train_tokens_per_second": 5963.181 }, { "epoch": 1.3582528735632184, "grad_norm": 0.9686160683631897, "learning_rate": 6.427388183324132e-05, "loss": 1.4975, "num_input_tokens_seen": 22353504, "step": 3693, "train_runtime": 3748.5248, "train_tokens_per_second": 5963.28 }, { "epoch": 1.3586206896551725, "grad_norm": 0.9702744483947754, "learning_rate": 6.423706975888092e-05, "loss": 1.717, "num_input_tokens_seen": 22359664, "step": 3694, "train_runtime": 3749.5168, "train_tokens_per_second": 5963.345 }, { "epoch": 1.3589885057471265, "grad_norm": 0.8716999888420105, "learning_rate": 6.420025768452052e-05, "loss": 1.3682, "num_input_tokens_seen": 22369984, "step": 3695, "train_runtime": 3751.1082, "train_tokens_per_second": 5963.567 }, { "epoch": 1.3593563218390805, "grad_norm": 0.9872491359710693, "learning_rate": 6.416344561016013e-05, "loss": 1.5221, "num_input_tokens_seen": 22376240, "step": 3696, "train_runtime": 3752.1485, "train_tokens_per_second": 5963.581 }, { "epoch": 1.3597241379310345, "grad_norm": 0.9793648719787598, "learning_rate": 6.412663353579974e-05, "loss": 1.2984, "num_input_tokens_seen": 22383072, "step": 3697, "train_runtime": 3753.2558, "train_tokens_per_second": 5963.641 }, { "epoch": 1.3600919540229885, "grad_norm": 0.9976056814193726, "learning_rate": 6.408982146143936e-05, "loss": 1.6703, "num_input_tokens_seen": 22388144, "step": 3698, "train_runtime": 3754.1147, "train_tokens_per_second": 5963.628 }, { "epoch": 1.3604597701149426, "grad_norm": 0.8496326804161072, "learning_rate": 6.405300938707897e-05, "loss": 1.3574, "num_input_tokens_seen": 22393616, "step": 3699, "train_runtime": 3755.0069, "train_tokens_per_second": 5963.668 }, { "epoch": 1.3608275862068966, "grad_norm": 0.9885788559913635, "learning_rate": 6.401619731271858e-05, "loss": 1.3272, "num_input_tokens_seen": 22399840, "step": 3700, "train_runtime": 3756.0195, "train_tokens_per_second": 5963.718 }, { "epoch": 1.3611954022988506, "grad_norm": 0.9272667765617371, "learning_rate": 6.397938523835819e-05, "loss": 1.7168, "num_input_tokens_seen": 22407200, "step": 3701, "train_runtime": 3757.164, "train_tokens_per_second": 5963.86 }, { "epoch": 1.3615632183908046, "grad_norm": 0.9542990922927856, "learning_rate": 6.39425731639978e-05, "loss": 1.4067, "num_input_tokens_seen": 22412464, "step": 3702, "train_runtime": 3758.0576, "train_tokens_per_second": 5963.843 }, { "epoch": 1.3619310344827587, "grad_norm": 0.8829864263534546, "learning_rate": 6.39057610896374e-05, "loss": 1.3871, "num_input_tokens_seen": 22418432, "step": 3703, "train_runtime": 3759.024, "train_tokens_per_second": 5963.897 }, { "epoch": 1.3622988505747127, "grad_norm": 0.9515782594680786, "learning_rate": 6.386894901527701e-05, "loss": 1.3696, "num_input_tokens_seen": 22427488, "step": 3704, "train_runtime": 3760.3897, "train_tokens_per_second": 5964.139 }, { "epoch": 1.3626666666666667, "grad_norm": 0.9590629935264587, "learning_rate": 6.383213694091662e-05, "loss": 1.4148, "num_input_tokens_seen": 22432688, "step": 3705, "train_runtime": 3761.2764, "train_tokens_per_second": 5964.116 }, { "epoch": 1.3630344827586207, "grad_norm": 0.9900871515274048, "learning_rate": 6.379532486655624e-05, "loss": 1.7678, "num_input_tokens_seen": 22438384, "step": 3706, "train_runtime": 3762.2145, "train_tokens_per_second": 5964.143 }, { "epoch": 1.3634022988505747, "grad_norm": 0.9610579013824463, "learning_rate": 6.375851279219584e-05, "loss": 1.595, "num_input_tokens_seen": 22443296, "step": 3707, "train_runtime": 3763.0421, "train_tokens_per_second": 5964.136 }, { "epoch": 1.3637701149425288, "grad_norm": 1.0513726472854614, "learning_rate": 6.372170071783545e-05, "loss": 1.475, "num_input_tokens_seen": 22448768, "step": 3708, "train_runtime": 3763.971, "train_tokens_per_second": 5964.118 }, { "epoch": 1.3641379310344828, "grad_norm": 0.9578030109405518, "learning_rate": 6.368488864347506e-05, "loss": 1.4103, "num_input_tokens_seen": 22454512, "step": 3709, "train_runtime": 3764.9307, "train_tokens_per_second": 5964.124 }, { "epoch": 1.3645057471264368, "grad_norm": 1.000126600265503, "learning_rate": 6.364807656911467e-05, "loss": 1.5431, "num_input_tokens_seen": 22460944, "step": 3710, "train_runtime": 3765.9901, "train_tokens_per_second": 5964.154 }, { "epoch": 1.3648735632183908, "grad_norm": 0.9518430829048157, "learning_rate": 6.361126449475429e-05, "loss": 1.7073, "num_input_tokens_seen": 22465600, "step": 3711, "train_runtime": 3766.7729, "train_tokens_per_second": 5964.15 }, { "epoch": 1.3652413793103448, "grad_norm": 0.9710787534713745, "learning_rate": 6.35744524203939e-05, "loss": 1.4007, "num_input_tokens_seen": 22472816, "step": 3712, "train_runtime": 3767.905, "train_tokens_per_second": 5964.273 }, { "epoch": 1.3656091954022989, "grad_norm": 1.0492024421691895, "learning_rate": 6.35376403460335e-05, "loss": 1.6356, "num_input_tokens_seen": 22479712, "step": 3713, "train_runtime": 3768.991, "train_tokens_per_second": 5964.385 }, { "epoch": 1.3659770114942529, "grad_norm": 0.9096162915229797, "learning_rate": 6.35008282716731e-05, "loss": 1.3954, "num_input_tokens_seen": 22484544, "step": 3714, "train_runtime": 3769.8286, "train_tokens_per_second": 5964.341 }, { "epoch": 1.366344827586207, "grad_norm": 0.9547939300537109, "learning_rate": 6.346401619731272e-05, "loss": 1.5207, "num_input_tokens_seen": 22489792, "step": 3715, "train_runtime": 3770.7095, "train_tokens_per_second": 5964.34 }, { "epoch": 1.366712643678161, "grad_norm": 0.9628258347511292, "learning_rate": 6.342720412295233e-05, "loss": 1.5337, "num_input_tokens_seen": 22495216, "step": 3716, "train_runtime": 3771.6426, "train_tokens_per_second": 5964.302 }, { "epoch": 1.367080459770115, "grad_norm": 0.9746856093406677, "learning_rate": 6.339039204859194e-05, "loss": 1.6134, "num_input_tokens_seen": 22499936, "step": 3717, "train_runtime": 3772.4733, "train_tokens_per_second": 5964.24 }, { "epoch": 1.367448275862069, "grad_norm": 0.9883073568344116, "learning_rate": 6.335357997423155e-05, "loss": 1.4514, "num_input_tokens_seen": 22506736, "step": 3718, "train_runtime": 3773.5581, "train_tokens_per_second": 5964.327 }, { "epoch": 1.367816091954023, "grad_norm": 1.0037277936935425, "learning_rate": 6.331676789987116e-05, "loss": 1.6926, "num_input_tokens_seen": 22513664, "step": 3719, "train_runtime": 3774.6735, "train_tokens_per_second": 5964.4 }, { "epoch": 1.368183908045977, "grad_norm": 0.8952387571334839, "learning_rate": 6.327995582551077e-05, "loss": 1.3581, "num_input_tokens_seen": 22519008, "step": 3720, "train_runtime": 3775.5473, "train_tokens_per_second": 5964.435 }, { "epoch": 1.368551724137931, "grad_norm": 0.9532164335250854, "learning_rate": 6.324314375115038e-05, "loss": 1.5126, "num_input_tokens_seen": 22523840, "step": 3721, "train_runtime": 3776.924, "train_tokens_per_second": 5963.541 }, { "epoch": 1.368919540229885, "grad_norm": 0.9461865425109863, "learning_rate": 6.320633167678999e-05, "loss": 1.7382, "num_input_tokens_seen": 22529616, "step": 3722, "train_runtime": 3777.9044, "train_tokens_per_second": 5963.522 }, { "epoch": 1.369287356321839, "grad_norm": 0.9506685733795166, "learning_rate": 6.316951960242961e-05, "loss": 1.6842, "num_input_tokens_seen": 22534864, "step": 3723, "train_runtime": 3778.8041, "train_tokens_per_second": 5963.491 }, { "epoch": 1.369655172413793, "grad_norm": 0.8528960347175598, "learning_rate": 6.313270752806922e-05, "loss": 1.5325, "num_input_tokens_seen": 22541376, "step": 3724, "train_runtime": 3779.8939, "train_tokens_per_second": 5963.494 }, { "epoch": 1.370022988505747, "grad_norm": 0.8038332462310791, "learning_rate": 6.309589545370881e-05, "loss": 1.5505, "num_input_tokens_seen": 22549648, "step": 3725, "train_runtime": 3781.1884, "train_tokens_per_second": 5963.64 }, { "epoch": 1.3703908045977011, "grad_norm": 0.9963042140007019, "learning_rate": 6.305908337934842e-05, "loss": 1.6605, "num_input_tokens_seen": 22553616, "step": 3726, "train_runtime": 3781.8811, "train_tokens_per_second": 5963.597 }, { "epoch": 1.3707586206896551, "grad_norm": 0.8822771310806274, "learning_rate": 6.302227130498803e-05, "loss": 1.3603, "num_input_tokens_seen": 22558448, "step": 3727, "train_runtime": 3782.7202, "train_tokens_per_second": 5963.552 }, { "epoch": 1.3711264367816092, "grad_norm": 0.8757033348083496, "learning_rate": 6.298545923062765e-05, "loss": 1.2826, "num_input_tokens_seen": 22564800, "step": 3728, "train_runtime": 3783.745, "train_tokens_per_second": 5963.615 }, { "epoch": 1.3714942528735632, "grad_norm": 0.9956175684928894, "learning_rate": 6.294864715626726e-05, "loss": 1.548, "num_input_tokens_seen": 22569344, "step": 3729, "train_runtime": 3784.5373, "train_tokens_per_second": 5963.568 }, { "epoch": 1.3718620689655172, "grad_norm": 1.0362850427627563, "learning_rate": 6.291183508190687e-05, "loss": 1.5132, "num_input_tokens_seen": 22576592, "step": 3730, "train_runtime": 3785.6673, "train_tokens_per_second": 5963.702 }, { "epoch": 1.3722298850574712, "grad_norm": 0.9091210961341858, "learning_rate": 6.287502300754648e-05, "loss": 1.4306, "num_input_tokens_seen": 22584384, "step": 3731, "train_runtime": 3786.8804, "train_tokens_per_second": 5963.849 }, { "epoch": 1.3725977011494253, "grad_norm": 1.0187913179397583, "learning_rate": 6.283821093318609e-05, "loss": 1.6564, "num_input_tokens_seen": 22591088, "step": 3732, "train_runtime": 3787.9616, "train_tokens_per_second": 5963.917 }, { "epoch": 1.3729655172413793, "grad_norm": 0.9769201278686523, "learning_rate": 6.28013988588257e-05, "loss": 1.4914, "num_input_tokens_seen": 22596080, "step": 3733, "train_runtime": 3788.8281, "train_tokens_per_second": 5963.87 }, { "epoch": 1.3733333333333333, "grad_norm": 1.039028525352478, "learning_rate": 6.276458678446531e-05, "loss": 1.6656, "num_input_tokens_seen": 22600944, "step": 3734, "train_runtime": 3789.6701, "train_tokens_per_second": 5963.829 }, { "epoch": 1.3737011494252873, "grad_norm": 0.8745564222335815, "learning_rate": 6.272777471010492e-05, "loss": 1.4106, "num_input_tokens_seen": 22610016, "step": 3735, "train_runtime": 3791.0464, "train_tokens_per_second": 5964.057 }, { "epoch": 1.3740689655172413, "grad_norm": 0.9492440223693848, "learning_rate": 6.269096263574454e-05, "loss": 1.4987, "num_input_tokens_seen": 22616496, "step": 3736, "train_runtime": 3792.1119, "train_tokens_per_second": 5964.09 }, { "epoch": 1.3744367816091954, "grad_norm": 1.0139230489730835, "learning_rate": 6.265415056138413e-05, "loss": 1.5855, "num_input_tokens_seen": 22621088, "step": 3737, "train_runtime": 3792.9052, "train_tokens_per_second": 5964.053 }, { "epoch": 1.3748045977011494, "grad_norm": 1.0495636463165283, "learning_rate": 6.261733848702374e-05, "loss": 1.5869, "num_input_tokens_seen": 22625648, "step": 3738, "train_runtime": 3793.6646, "train_tokens_per_second": 5964.061 }, { "epoch": 1.3751724137931034, "grad_norm": 0.938824474811554, "learning_rate": 6.258052641266335e-05, "loss": 1.5636, "num_input_tokens_seen": 22630816, "step": 3739, "train_runtime": 3794.4998, "train_tokens_per_second": 5964.111 }, { "epoch": 1.3755402298850574, "grad_norm": 0.9487571716308594, "learning_rate": 6.254371433830296e-05, "loss": 1.3919, "num_input_tokens_seen": 22638208, "step": 3740, "train_runtime": 3795.6587, "train_tokens_per_second": 5964.237 }, { "epoch": 1.3759080459770114, "grad_norm": 1.2077070474624634, "learning_rate": 6.250690226394258e-05, "loss": 1.3998, "num_input_tokens_seen": 22643920, "step": 3741, "train_runtime": 3796.6168, "train_tokens_per_second": 5964.236 }, { "epoch": 1.3762758620689655, "grad_norm": 0.8746975064277649, "learning_rate": 6.247009018958219e-05, "loss": 1.4574, "num_input_tokens_seen": 22648192, "step": 3742, "train_runtime": 3797.3543, "train_tokens_per_second": 5964.203 }, { "epoch": 1.3766436781609195, "grad_norm": 0.910503625869751, "learning_rate": 6.243327811522179e-05, "loss": 1.2189, "num_input_tokens_seen": 22654592, "step": 3743, "train_runtime": 3798.3986, "train_tokens_per_second": 5964.248 }, { "epoch": 1.3770114942528735, "grad_norm": 1.0025415420532227, "learning_rate": 6.23964660408614e-05, "loss": 1.4245, "num_input_tokens_seen": 22659616, "step": 3744, "train_runtime": 3799.2432, "train_tokens_per_second": 5964.245 }, { "epoch": 1.3773793103448275, "grad_norm": 0.8953913450241089, "learning_rate": 6.235965396650102e-05, "loss": 1.432, "num_input_tokens_seen": 22665488, "step": 3745, "train_runtime": 3800.1936, "train_tokens_per_second": 5964.298 }, { "epoch": 1.3777471264367815, "grad_norm": 0.893984854221344, "learning_rate": 6.232284189214063e-05, "loss": 1.4849, "num_input_tokens_seen": 22671952, "step": 3746, "train_runtime": 3801.2172, "train_tokens_per_second": 5964.393 }, { "epoch": 1.3781149425287356, "grad_norm": 0.8688514232635498, "learning_rate": 6.228602981778024e-05, "loss": 1.3543, "num_input_tokens_seen": 22680576, "step": 3747, "train_runtime": 3802.5607, "train_tokens_per_second": 5964.553 }, { "epoch": 1.3784827586206896, "grad_norm": 0.9506460428237915, "learning_rate": 6.224921774341985e-05, "loss": 1.5756, "num_input_tokens_seen": 22685200, "step": 3748, "train_runtime": 3803.3845, "train_tokens_per_second": 5964.477 }, { "epoch": 1.3788505747126436, "grad_norm": 1.0392670631408691, "learning_rate": 6.221240566905945e-05, "loss": 1.4427, "num_input_tokens_seen": 22694224, "step": 3749, "train_runtime": 3804.787, "train_tokens_per_second": 5964.65 }, { "epoch": 1.3792183908045976, "grad_norm": 0.888479471206665, "learning_rate": 6.217559359469906e-05, "loss": 1.4515, "num_input_tokens_seen": 22700784, "step": 3750, "train_runtime": 3805.8518, "train_tokens_per_second": 5964.705 }, { "epoch": 1.3795862068965516, "grad_norm": 0.9241269826889038, "learning_rate": 6.213878152033867e-05, "loss": 1.5077, "num_input_tokens_seen": 22706096, "step": 3751, "train_runtime": 3807.3533, "train_tokens_per_second": 5963.748 }, { "epoch": 1.3799540229885057, "grad_norm": 0.9859208464622498, "learning_rate": 6.210196944597828e-05, "loss": 1.5239, "num_input_tokens_seen": 22710528, "step": 3752, "train_runtime": 3808.1141, "train_tokens_per_second": 5963.721 }, { "epoch": 1.3803218390804597, "grad_norm": 0.9163882732391357, "learning_rate": 6.20651573716179e-05, "loss": 1.5234, "num_input_tokens_seen": 22715776, "step": 3753, "train_runtime": 3808.9773, "train_tokens_per_second": 5963.747 }, { "epoch": 1.3806896551724137, "grad_norm": 0.9750805497169495, "learning_rate": 6.202834529725751e-05, "loss": 1.5073, "num_input_tokens_seen": 22722672, "step": 3754, "train_runtime": 3810.0805, "train_tokens_per_second": 5963.83 }, { "epoch": 1.3810574712643677, "grad_norm": 0.9713814854621887, "learning_rate": 6.199153322289711e-05, "loss": 1.4555, "num_input_tokens_seen": 22729888, "step": 3755, "train_runtime": 3811.2371, "train_tokens_per_second": 5963.913 }, { "epoch": 1.381425287356322, "grad_norm": 0.9078335165977478, "learning_rate": 6.195472114853672e-05, "loss": 1.4817, "num_input_tokens_seen": 22736288, "step": 3756, "train_runtime": 3812.2592, "train_tokens_per_second": 5963.993 }, { "epoch": 1.3817931034482758, "grad_norm": 0.9787589311599731, "learning_rate": 6.191790907417633e-05, "loss": 1.5476, "num_input_tokens_seen": 22740816, "step": 3757, "train_runtime": 3813.0684, "train_tokens_per_second": 5963.915 }, { "epoch": 1.38216091954023, "grad_norm": 1.0089010000228882, "learning_rate": 6.188109699981595e-05, "loss": 1.5927, "num_input_tokens_seen": 22746560, "step": 3758, "train_runtime": 3814.0428, "train_tokens_per_second": 5963.897 }, { "epoch": 1.3825287356321838, "grad_norm": 0.9962058067321777, "learning_rate": 6.184428492545556e-05, "loss": 1.3135, "num_input_tokens_seen": 22751584, "step": 3759, "train_runtime": 3814.8893, "train_tokens_per_second": 5963.891 }, { "epoch": 1.382896551724138, "grad_norm": 1.0328810214996338, "learning_rate": 6.180747285109517e-05, "loss": 1.6177, "num_input_tokens_seen": 22757520, "step": 3760, "train_runtime": 3815.8668, "train_tokens_per_second": 5963.919 }, { "epoch": 1.3832643678160919, "grad_norm": 1.1473071575164795, "learning_rate": 6.177066077673477e-05, "loss": 1.6739, "num_input_tokens_seen": 22761824, "step": 3761, "train_runtime": 3816.6343, "train_tokens_per_second": 5963.847 }, { "epoch": 1.383632183908046, "grad_norm": 1.0062990188598633, "learning_rate": 6.173384870237438e-05, "loss": 1.7144, "num_input_tokens_seen": 22768272, "step": 3762, "train_runtime": 3817.6882, "train_tokens_per_second": 5963.89 }, { "epoch": 1.384, "grad_norm": 0.9547836184501648, "learning_rate": 6.169703662801399e-05, "loss": 1.439, "num_input_tokens_seen": 22775728, "step": 3763, "train_runtime": 3818.8529, "train_tokens_per_second": 5964.023 }, { "epoch": 1.3843678160919541, "grad_norm": 0.9581781029701233, "learning_rate": 6.16602245536536e-05, "loss": 1.5565, "num_input_tokens_seen": 22781584, "step": 3764, "train_runtime": 3819.8387, "train_tokens_per_second": 5964.017 }, { "epoch": 1.384735632183908, "grad_norm": 0.9812362194061279, "learning_rate": 6.162341247929321e-05, "loss": 1.4536, "num_input_tokens_seen": 22787184, "step": 3765, "train_runtime": 3820.7584, "train_tokens_per_second": 5964.047 }, { "epoch": 1.3851034482758622, "grad_norm": 0.9955962896347046, "learning_rate": 6.158660040493283e-05, "loss": 1.5392, "num_input_tokens_seen": 22792768, "step": 3766, "train_runtime": 3821.6751, "train_tokens_per_second": 5964.078 }, { "epoch": 1.385471264367816, "grad_norm": 0.9818433523178101, "learning_rate": 6.154978833057243e-05, "loss": 1.5408, "num_input_tokens_seen": 22797616, "step": 3767, "train_runtime": 3822.5145, "train_tokens_per_second": 5964.036 }, { "epoch": 1.3858390804597702, "grad_norm": 0.9573441743850708, "learning_rate": 6.151297625621204e-05, "loss": 1.5261, "num_input_tokens_seen": 22802896, "step": 3768, "train_runtime": 3823.4131, "train_tokens_per_second": 5964.016 }, { "epoch": 1.386206896551724, "grad_norm": 1.0647966861724854, "learning_rate": 6.147616418185165e-05, "loss": 1.5025, "num_input_tokens_seen": 22809168, "step": 3769, "train_runtime": 3824.4262, "train_tokens_per_second": 5964.076 }, { "epoch": 1.3865747126436783, "grad_norm": 0.9207072854042053, "learning_rate": 6.143935210749125e-05, "loss": 1.3226, "num_input_tokens_seen": 22816768, "step": 3770, "train_runtime": 3825.6089, "train_tokens_per_second": 5964.219 }, { "epoch": 1.386942528735632, "grad_norm": 0.9285719990730286, "learning_rate": 6.140254003313088e-05, "loss": 1.5345, "num_input_tokens_seen": 22821360, "step": 3771, "train_runtime": 3826.4205, "train_tokens_per_second": 5964.154 }, { "epoch": 1.3873103448275863, "grad_norm": 0.9359105229377747, "learning_rate": 6.136572795877049e-05, "loss": 1.5052, "num_input_tokens_seen": 22826032, "step": 3772, "train_runtime": 3827.2038, "train_tokens_per_second": 5964.154 }, { "epoch": 1.38767816091954, "grad_norm": 0.9463181495666504, "learning_rate": 6.132891588441008e-05, "loss": 1.5824, "num_input_tokens_seen": 22831456, "step": 3773, "train_runtime": 3828.1096, "train_tokens_per_second": 5964.159 }, { "epoch": 1.3880459770114943, "grad_norm": 1.0038729906082153, "learning_rate": 6.129210381004969e-05, "loss": 1.7986, "num_input_tokens_seen": 22837248, "step": 3774, "train_runtime": 3829.0618, "train_tokens_per_second": 5964.189 }, { "epoch": 1.3884137931034481, "grad_norm": 1.0014309883117676, "learning_rate": 6.125529173568931e-05, "loss": 1.3315, "num_input_tokens_seen": 22843824, "step": 3775, "train_runtime": 3830.1297, "train_tokens_per_second": 5964.243 }, { "epoch": 1.3887816091954024, "grad_norm": 1.010796308517456, "learning_rate": 6.121847966132892e-05, "loss": 1.6359, "num_input_tokens_seen": 22848416, "step": 3776, "train_runtime": 3830.9322, "train_tokens_per_second": 5964.192 }, { "epoch": 1.3891494252873562, "grad_norm": 0.8719692826271057, "learning_rate": 6.118166758696853e-05, "loss": 1.2227, "num_input_tokens_seen": 22855392, "step": 3777, "train_runtime": 3832.0296, "train_tokens_per_second": 5964.305 }, { "epoch": 1.3895172413793104, "grad_norm": 0.9220796823501587, "learning_rate": 6.114485551260814e-05, "loss": 1.6286, "num_input_tokens_seen": 22860992, "step": 3778, "train_runtime": 3832.9503, "train_tokens_per_second": 5964.333 }, { "epoch": 1.3898850574712642, "grad_norm": 0.8386502861976624, "learning_rate": 6.110804343824775e-05, "loss": 1.5701, "num_input_tokens_seen": 22868720, "step": 3779, "train_runtime": 3834.156, "train_tokens_per_second": 5964.473 }, { "epoch": 1.3902528735632185, "grad_norm": 1.0410337448120117, "learning_rate": 6.107123136388736e-05, "loss": 1.4751, "num_input_tokens_seen": 22874128, "step": 3780, "train_runtime": 3835.0712, "train_tokens_per_second": 5964.46 }, { "epoch": 1.3906206896551725, "grad_norm": 0.9953624606132507, "learning_rate": 6.1034419289526966e-05, "loss": 1.531, "num_input_tokens_seen": 22879664, "step": 3781, "train_runtime": 3836.4798, "train_tokens_per_second": 5963.713 }, { "epoch": 1.3909885057471265, "grad_norm": 0.9081664085388184, "learning_rate": 6.0997607215166575e-05, "loss": 1.5514, "num_input_tokens_seen": 22886384, "step": 3782, "train_runtime": 3837.5811, "train_tokens_per_second": 5963.753 }, { "epoch": 1.3913563218390805, "grad_norm": 0.9312737584114075, "learning_rate": 6.096079514080619e-05, "loss": 1.5961, "num_input_tokens_seen": 22891680, "step": 3783, "train_runtime": 3838.4725, "train_tokens_per_second": 5963.747 }, { "epoch": 1.3917241379310346, "grad_norm": 0.9960929751396179, "learning_rate": 6.09239830664458e-05, "loss": 1.4714, "num_input_tokens_seen": 22896640, "step": 3784, "train_runtime": 3839.3212, "train_tokens_per_second": 5963.721 }, { "epoch": 1.3920919540229886, "grad_norm": 0.9982829093933105, "learning_rate": 6.088717099208541e-05, "loss": 1.5787, "num_input_tokens_seen": 22902176, "step": 3785, "train_runtime": 3840.227, "train_tokens_per_second": 5963.756 }, { "epoch": 1.3924597701149426, "grad_norm": 0.9263778924942017, "learning_rate": 6.085035891772502e-05, "loss": 1.271, "num_input_tokens_seen": 22909008, "step": 3786, "train_runtime": 3841.3466, "train_tokens_per_second": 5963.796 }, { "epoch": 1.3928275862068966, "grad_norm": 1.0715011358261108, "learning_rate": 6.081354684336462e-05, "loss": 1.7286, "num_input_tokens_seen": 22914048, "step": 3787, "train_runtime": 3842.2085, "train_tokens_per_second": 5963.77 }, { "epoch": 1.3931954022988506, "grad_norm": 0.9937467575073242, "learning_rate": 6.077673476900424e-05, "loss": 1.5261, "num_input_tokens_seen": 22918096, "step": 3788, "train_runtime": 3842.9174, "train_tokens_per_second": 5963.723 }, { "epoch": 1.3935632183908047, "grad_norm": 0.957568347454071, "learning_rate": 6.0739922694643844e-05, "loss": 1.3541, "num_input_tokens_seen": 22925840, "step": 3789, "train_runtime": 3844.1151, "train_tokens_per_second": 5963.88 }, { "epoch": 1.3939310344827587, "grad_norm": 1.0398995876312256, "learning_rate": 6.070311062028345e-05, "loss": 1.4543, "num_input_tokens_seen": 22930800, "step": 3790, "train_runtime": 3844.9689, "train_tokens_per_second": 5963.845 }, { "epoch": 1.3942988505747127, "grad_norm": 0.8865105509757996, "learning_rate": 6.066629854592306e-05, "loss": 1.4975, "num_input_tokens_seen": 22937376, "step": 3791, "train_runtime": 3846.0368, "train_tokens_per_second": 5963.899 }, { "epoch": 1.3946666666666667, "grad_norm": 0.9229094386100769, "learning_rate": 6.062948647156268e-05, "loss": 1.395, "num_input_tokens_seen": 22946304, "step": 3792, "train_runtime": 3847.4191, "train_tokens_per_second": 5964.077 }, { "epoch": 1.3950344827586207, "grad_norm": 0.9891628623008728, "learning_rate": 6.0592674397202286e-05, "loss": 1.4104, "num_input_tokens_seen": 22951600, "step": 3793, "train_runtime": 3848.2947, "train_tokens_per_second": 5964.096 }, { "epoch": 1.3954022988505748, "grad_norm": 0.8762285709381104, "learning_rate": 6.0555862322841895e-05, "loss": 1.5228, "num_input_tokens_seen": 22957424, "step": 3794, "train_runtime": 3849.2556, "train_tokens_per_second": 5964.12 }, { "epoch": 1.3957701149425288, "grad_norm": 0.8926065564155579, "learning_rate": 6.0519050248481504e-05, "loss": 1.3875, "num_input_tokens_seen": 22965360, "step": 3795, "train_runtime": 3850.4955, "train_tokens_per_second": 5964.261 }, { "epoch": 1.3961379310344828, "grad_norm": 1.046146035194397, "learning_rate": 6.048223817412112e-05, "loss": 1.6837, "num_input_tokens_seen": 22971984, "step": 3796, "train_runtime": 3851.5765, "train_tokens_per_second": 5964.307 }, { "epoch": 1.3965057471264368, "grad_norm": 0.9228570461273193, "learning_rate": 6.044542609976073e-05, "loss": 1.543, "num_input_tokens_seen": 22978080, "step": 3797, "train_runtime": 3852.5518, "train_tokens_per_second": 5964.379 }, { "epoch": 1.3968735632183908, "grad_norm": 0.9805880784988403, "learning_rate": 6.040861402540034e-05, "loss": 1.6692, "num_input_tokens_seen": 22983472, "step": 3798, "train_runtime": 3853.4308, "train_tokens_per_second": 5964.418 }, { "epoch": 1.3972413793103449, "grad_norm": 1.104706048965454, "learning_rate": 6.037180195103994e-05, "loss": 1.6094, "num_input_tokens_seen": 22990816, "step": 3799, "train_runtime": 3854.6019, "train_tokens_per_second": 5964.511 }, { "epoch": 1.3976091954022989, "grad_norm": 0.9283113479614258, "learning_rate": 6.033498987667955e-05, "loss": 1.3129, "num_input_tokens_seen": 22996432, "step": 3800, "train_runtime": 3855.5216, "train_tokens_per_second": 5964.545 }, { "epoch": 1.397977011494253, "grad_norm": 0.8897649049758911, "learning_rate": 6.0298177802319164e-05, "loss": 1.225, "num_input_tokens_seen": 23007296, "step": 3801, "train_runtime": 3857.1737, "train_tokens_per_second": 5964.807 }, { "epoch": 1.398344827586207, "grad_norm": 0.9260315299034119, "learning_rate": 6.026136572795877e-05, "loss": 1.3904, "num_input_tokens_seen": 23013584, "step": 3802, "train_runtime": 3858.2205, "train_tokens_per_second": 5964.818 }, { "epoch": 1.398712643678161, "grad_norm": 0.9527813196182251, "learning_rate": 6.022455365359838e-05, "loss": 1.552, "num_input_tokens_seen": 23017776, "step": 3803, "train_runtime": 3858.9784, "train_tokens_per_second": 5964.733 }, { "epoch": 1.399080459770115, "grad_norm": 0.9974001049995422, "learning_rate": 6.018774157923799e-05, "loss": 1.5802, "num_input_tokens_seen": 23023056, "step": 3804, "train_runtime": 3859.8617, "train_tokens_per_second": 5964.736 }, { "epoch": 1.399448275862069, "grad_norm": 0.9293568134307861, "learning_rate": 6.0150929504877606e-05, "loss": 1.4446, "num_input_tokens_seen": 23028912, "step": 3805, "train_runtime": 3860.8209, "train_tokens_per_second": 5964.771 }, { "epoch": 1.399816091954023, "grad_norm": 0.9839887022972107, "learning_rate": 6.0114117430517215e-05, "loss": 1.525, "num_input_tokens_seen": 23033072, "step": 3806, "train_runtime": 3861.5858, "train_tokens_per_second": 5964.667 }, { "epoch": 1.400183908045977, "grad_norm": 0.9744802117347717, "learning_rate": 6.0077305356156824e-05, "loss": 1.5001, "num_input_tokens_seen": 23038432, "step": 3807, "train_runtime": 3862.4497, "train_tokens_per_second": 5964.72 }, { "epoch": 1.400551724137931, "grad_norm": 0.9339486360549927, "learning_rate": 6.0040493281796426e-05, "loss": 1.5087, "num_input_tokens_seen": 23043248, "step": 3808, "train_runtime": 3863.2824, "train_tokens_per_second": 5964.681 }, { "epoch": 1.400551724137931, "eval_loss": 1.762308955192566, "eval_runtime": 4.783, "eval_samples_per_second": 209.072, "eval_steps_per_second": 13.172, "num_input_tokens_seen": 23043248, "step": 3808 }, { "epoch": 1.400919540229885, "grad_norm": 0.9982841610908508, "learning_rate": 6.000368120743605e-05, "loss": 1.5034, "num_input_tokens_seen": 23053232, "step": 3809, "train_runtime": 3869.574, "train_tokens_per_second": 5957.563 }, { "epoch": 1.401287356321839, "grad_norm": 1.0063250064849854, "learning_rate": 5.996686913307565e-05, "loss": 1.6184, "num_input_tokens_seen": 23057872, "step": 3810, "train_runtime": 3870.3639, "train_tokens_per_second": 5957.546 }, { "epoch": 1.4016551724137931, "grad_norm": 0.9848638772964478, "learning_rate": 5.993005705871526e-05, "loss": 1.4884, "num_input_tokens_seen": 23062704, "step": 3811, "train_runtime": 3871.6846, "train_tokens_per_second": 5956.762 }, { "epoch": 1.4020229885057471, "grad_norm": 0.9566230773925781, "learning_rate": 5.989324498435487e-05, "loss": 1.665, "num_input_tokens_seen": 23067440, "step": 3812, "train_runtime": 3872.4944, "train_tokens_per_second": 5956.739 }, { "epoch": 1.4023908045977012, "grad_norm": 1.0285876989364624, "learning_rate": 5.9856432909994484e-05, "loss": 1.7322, "num_input_tokens_seen": 23072864, "step": 3813, "train_runtime": 3873.3823, "train_tokens_per_second": 5956.774 }, { "epoch": 1.4027586206896552, "grad_norm": 1.0430469512939453, "learning_rate": 5.981962083563409e-05, "loss": 1.7483, "num_input_tokens_seen": 23077632, "step": 3814, "train_runtime": 3874.1922, "train_tokens_per_second": 5956.76 }, { "epoch": 1.4031264367816092, "grad_norm": 1.0014046430587769, "learning_rate": 5.97828087612737e-05, "loss": 1.6424, "num_input_tokens_seen": 23082896, "step": 3815, "train_runtime": 3875.0743, "train_tokens_per_second": 5956.762 }, { "epoch": 1.4034942528735632, "grad_norm": 1.055223822593689, "learning_rate": 5.974599668691331e-05, "loss": 1.6634, "num_input_tokens_seen": 23088544, "step": 3816, "train_runtime": 3876.0102, "train_tokens_per_second": 5956.781 }, { "epoch": 1.4038620689655172, "grad_norm": 1.0828168392181396, "learning_rate": 5.970918461255291e-05, "loss": 1.3683, "num_input_tokens_seen": 23094048, "step": 3817, "train_runtime": 3876.9499, "train_tokens_per_second": 5956.757 }, { "epoch": 1.4042298850574713, "grad_norm": 1.054440975189209, "learning_rate": 5.9672372538192536e-05, "loss": 1.4349, "num_input_tokens_seen": 23099184, "step": 3818, "train_runtime": 3877.8099, "train_tokens_per_second": 5956.76 }, { "epoch": 1.4045977011494253, "grad_norm": 1.0225321054458618, "learning_rate": 5.963556046383214e-05, "loss": 1.5644, "num_input_tokens_seen": 23103584, "step": 3819, "train_runtime": 3878.583, "train_tokens_per_second": 5956.707 }, { "epoch": 1.4049655172413793, "grad_norm": 1.0918307304382324, "learning_rate": 5.9598748389471747e-05, "loss": 1.5909, "num_input_tokens_seen": 23108672, "step": 3820, "train_runtime": 3879.4368, "train_tokens_per_second": 5956.708 }, { "epoch": 1.4053333333333333, "grad_norm": 0.8967226147651672, "learning_rate": 5.9561936315111355e-05, "loss": 1.3601, "num_input_tokens_seen": 23118160, "step": 3821, "train_runtime": 3880.9012, "train_tokens_per_second": 5956.905 }, { "epoch": 1.4057011494252873, "grad_norm": 0.9362155795097351, "learning_rate": 5.952512424075097e-05, "loss": 1.4752, "num_input_tokens_seen": 23127648, "step": 3822, "train_runtime": 3882.3632, "train_tokens_per_second": 5957.106 }, { "epoch": 1.4060689655172414, "grad_norm": 1.0105961561203003, "learning_rate": 5.948831216639058e-05, "loss": 1.4078, "num_input_tokens_seen": 23132624, "step": 3823, "train_runtime": 3883.208, "train_tokens_per_second": 5957.091 }, { "epoch": 1.4064367816091954, "grad_norm": 0.9605310559272766, "learning_rate": 5.945150009203019e-05, "loss": 1.5139, "num_input_tokens_seen": 23137968, "step": 3824, "train_runtime": 3884.1071, "train_tokens_per_second": 5957.088 }, { "epoch": 1.4068045977011494, "grad_norm": 0.9292888641357422, "learning_rate": 5.94146880176698e-05, "loss": 1.7353, "num_input_tokens_seen": 23142672, "step": 3825, "train_runtime": 3884.926, "train_tokens_per_second": 5957.043 }, { "epoch": 1.4071724137931034, "grad_norm": 1.0281490087509155, "learning_rate": 5.9377875943309413e-05, "loss": 1.6638, "num_input_tokens_seen": 23147952, "step": 3826, "train_runtime": 3885.8256, "train_tokens_per_second": 5957.023 }, { "epoch": 1.4075402298850574, "grad_norm": 1.0020662546157837, "learning_rate": 5.934106386894902e-05, "loss": 1.7889, "num_input_tokens_seen": 23152432, "step": 3827, "train_runtime": 3886.5937, "train_tokens_per_second": 5956.998 }, { "epoch": 1.4079080459770115, "grad_norm": 0.9764525890350342, "learning_rate": 5.9304251794588624e-05, "loss": 1.3644, "num_input_tokens_seen": 23160048, "step": 3828, "train_runtime": 3887.8057, "train_tokens_per_second": 5957.1 }, { "epoch": 1.4082758620689655, "grad_norm": 0.9640796184539795, "learning_rate": 5.926743972022823e-05, "loss": 1.6267, "num_input_tokens_seen": 23168208, "step": 3829, "train_runtime": 3889.0765, "train_tokens_per_second": 5957.252 }, { "epoch": 1.4086436781609195, "grad_norm": 1.030874490737915, "learning_rate": 5.923062764586784e-05, "loss": 1.6074, "num_input_tokens_seen": 23174080, "step": 3830, "train_runtime": 3890.0517, "train_tokens_per_second": 5957.268 }, { "epoch": 1.4090114942528735, "grad_norm": 0.8311935067176819, "learning_rate": 5.919381557150746e-05, "loss": 1.4108, "num_input_tokens_seen": 23184736, "step": 3831, "train_runtime": 3891.6405, "train_tokens_per_second": 5957.574 }, { "epoch": 1.4093793103448276, "grad_norm": 0.9829455018043518, "learning_rate": 5.915700349714707e-05, "loss": 1.6012, "num_input_tokens_seen": 23190080, "step": 3832, "train_runtime": 3892.5102, "train_tokens_per_second": 5957.616 }, { "epoch": 1.4097471264367816, "grad_norm": 0.9618329405784607, "learning_rate": 5.9120191422786676e-05, "loss": 1.5514, "num_input_tokens_seen": 23197360, "step": 3833, "train_runtime": 3893.6569, "train_tokens_per_second": 5957.731 }, { "epoch": 1.4101149425287356, "grad_norm": 0.9474486112594604, "learning_rate": 5.9083379348426285e-05, "loss": 1.5553, "num_input_tokens_seen": 23202336, "step": 3834, "train_runtime": 3894.5055, "train_tokens_per_second": 5957.71 }, { "epoch": 1.4104827586206896, "grad_norm": 0.9888517260551453, "learning_rate": 5.90465672740659e-05, "loss": 1.4854, "num_input_tokens_seen": 23207424, "step": 3835, "train_runtime": 3895.346, "train_tokens_per_second": 5957.731 }, { "epoch": 1.4108505747126436, "grad_norm": 0.9446732401847839, "learning_rate": 5.900975519970551e-05, "loss": 1.5645, "num_input_tokens_seen": 23213904, "step": 3836, "train_runtime": 3896.4324, "train_tokens_per_second": 5957.733 }, { "epoch": 1.4112183908045977, "grad_norm": 0.9339814186096191, "learning_rate": 5.897294312534512e-05, "loss": 1.4718, "num_input_tokens_seen": 23219184, "step": 3837, "train_runtime": 3897.3091, "train_tokens_per_second": 5957.748 }, { "epoch": 1.4115862068965517, "grad_norm": 1.0465707778930664, "learning_rate": 5.893613105098472e-05, "loss": 1.5653, "num_input_tokens_seen": 23224288, "step": 3838, "train_runtime": 3898.161, "train_tokens_per_second": 5957.755 }, { "epoch": 1.4119540229885057, "grad_norm": 0.9296630024909973, "learning_rate": 5.889931897662434e-05, "loss": 1.6597, "num_input_tokens_seen": 23228992, "step": 3839, "train_runtime": 3898.99, "train_tokens_per_second": 5957.695 }, { "epoch": 1.4123218390804597, "grad_norm": 0.9607882499694824, "learning_rate": 5.8862506902263945e-05, "loss": 1.5334, "num_input_tokens_seen": 23236160, "step": 3840, "train_runtime": 3900.1417, "train_tokens_per_second": 5957.773 }, { "epoch": 1.4126896551724137, "grad_norm": 0.9619476795196533, "learning_rate": 5.8825694827903554e-05, "loss": 1.4458, "num_input_tokens_seen": 23241232, "step": 3841, "train_runtime": 3901.4996, "train_tokens_per_second": 5957.0 }, { "epoch": 1.4130574712643678, "grad_norm": 0.9586007595062256, "learning_rate": 5.878888275354316e-05, "loss": 1.5467, "num_input_tokens_seen": 23247328, "step": 3842, "train_runtime": 3902.4774, "train_tokens_per_second": 5957.069 }, { "epoch": 1.4134252873563218, "grad_norm": 0.9935484528541565, "learning_rate": 5.875207067918278e-05, "loss": 1.5199, "num_input_tokens_seen": 23253312, "step": 3843, "train_runtime": 3903.4533, "train_tokens_per_second": 5957.113 }, { "epoch": 1.4137931034482758, "grad_norm": 0.9330466389656067, "learning_rate": 5.871525860482239e-05, "loss": 1.455, "num_input_tokens_seen": 23260080, "step": 3844, "train_runtime": 3904.5295, "train_tokens_per_second": 5957.204 }, { "epoch": 1.4141609195402298, "grad_norm": 0.9788523316383362, "learning_rate": 5.8678446530461996e-05, "loss": 1.5322, "num_input_tokens_seen": 23264768, "step": 3845, "train_runtime": 3905.3446, "train_tokens_per_second": 5957.161 }, { "epoch": 1.4145287356321838, "grad_norm": 0.9855858683586121, "learning_rate": 5.8641634456101605e-05, "loss": 1.6398, "num_input_tokens_seen": 23270192, "step": 3846, "train_runtime": 3906.2588, "train_tokens_per_second": 5957.156 }, { "epoch": 1.4148965517241379, "grad_norm": 0.9445512294769287, "learning_rate": 5.860482238174121e-05, "loss": 1.4612, "num_input_tokens_seen": 23274672, "step": 3847, "train_runtime": 3907.0612, "train_tokens_per_second": 5957.079 }, { "epoch": 1.4152643678160919, "grad_norm": 0.9998615980148315, "learning_rate": 5.856801030738083e-05, "loss": 1.4926, "num_input_tokens_seen": 23280144, "step": 3848, "train_runtime": 3907.9501, "train_tokens_per_second": 5957.124 }, { "epoch": 1.415632183908046, "grad_norm": 1.034893274307251, "learning_rate": 5.853119823302043e-05, "loss": 1.4794, "num_input_tokens_seen": 23287024, "step": 3849, "train_runtime": 3909.03, "train_tokens_per_second": 5957.238 }, { "epoch": 1.416, "grad_norm": 0.9571827054023743, "learning_rate": 5.849438615866004e-05, "loss": 1.662, "num_input_tokens_seen": 23293760, "step": 3850, "train_runtime": 3910.1194, "train_tokens_per_second": 5957.301 }, { "epoch": 1.416367816091954, "grad_norm": 0.951391875743866, "learning_rate": 5.845757408429965e-05, "loss": 1.4558, "num_input_tokens_seen": 23299232, "step": 3851, "train_runtime": 3911.0287, "train_tokens_per_second": 5957.316 }, { "epoch": 1.416735632183908, "grad_norm": 1.0006654262542725, "learning_rate": 5.8420762009939265e-05, "loss": 1.4558, "num_input_tokens_seen": 23303216, "step": 3852, "train_runtime": 3911.7532, "train_tokens_per_second": 5957.231 }, { "epoch": 1.417103448275862, "grad_norm": 1.0957709550857544, "learning_rate": 5.8383949935578874e-05, "loss": 1.6442, "num_input_tokens_seen": 23307824, "step": 3853, "train_runtime": 3912.5467, "train_tokens_per_second": 5957.2 }, { "epoch": 1.417471264367816, "grad_norm": 0.957355797290802, "learning_rate": 5.834713786121848e-05, "loss": 1.5419, "num_input_tokens_seen": 23312144, "step": 3854, "train_runtime": 3913.3081, "train_tokens_per_second": 5957.145 }, { "epoch": 1.4178390804597703, "grad_norm": 0.8509191274642944, "learning_rate": 5.831032578685809e-05, "loss": 1.4699, "num_input_tokens_seen": 23318800, "step": 3855, "train_runtime": 3914.351, "train_tokens_per_second": 5957.258 }, { "epoch": 1.418206896551724, "grad_norm": 1.0836807489395142, "learning_rate": 5.827351371249771e-05, "loss": 1.5796, "num_input_tokens_seen": 23323488, "step": 3856, "train_runtime": 3915.1682, "train_tokens_per_second": 5957.212 }, { "epoch": 1.4185747126436783, "grad_norm": 1.02164626121521, "learning_rate": 5.8236701638137316e-05, "loss": 1.7552, "num_input_tokens_seen": 23328480, "step": 3857, "train_runtime": 3916.0216, "train_tokens_per_second": 5957.189 }, { "epoch": 1.418942528735632, "grad_norm": 1.0840938091278076, "learning_rate": 5.819988956377692e-05, "loss": 1.9078, "num_input_tokens_seen": 23334000, "step": 3858, "train_runtime": 3916.9267, "train_tokens_per_second": 5957.222 }, { "epoch": 1.4193103448275863, "grad_norm": 0.9423296451568604, "learning_rate": 5.816307748941653e-05, "loss": 1.441, "num_input_tokens_seen": 23338752, "step": 3859, "train_runtime": 3917.7444, "train_tokens_per_second": 5957.191 }, { "epoch": 1.4196781609195401, "grad_norm": 0.9281581044197083, "learning_rate": 5.8126265415056136e-05, "loss": 1.3866, "num_input_tokens_seen": 23344160, "step": 3860, "train_runtime": 3918.6296, "train_tokens_per_second": 5957.226 }, { "epoch": 1.4200459770114944, "grad_norm": 1.0541623830795288, "learning_rate": 5.808945334069575e-05, "loss": 1.5146, "num_input_tokens_seen": 23349264, "step": 3861, "train_runtime": 3919.4916, "train_tokens_per_second": 5957.218 }, { "epoch": 1.4204137931034482, "grad_norm": 0.9313670992851257, "learning_rate": 5.805264126633536e-05, "loss": 1.4677, "num_input_tokens_seen": 23354464, "step": 3862, "train_runtime": 3920.3386, "train_tokens_per_second": 5957.257 }, { "epoch": 1.4207816091954024, "grad_norm": 1.0147207975387573, "learning_rate": 5.801582919197497e-05, "loss": 1.6991, "num_input_tokens_seen": 23359408, "step": 3863, "train_runtime": 3921.1478, "train_tokens_per_second": 5957.288 }, { "epoch": 1.4211494252873562, "grad_norm": 0.9353586435317993, "learning_rate": 5.797901711761458e-05, "loss": 1.685, "num_input_tokens_seen": 23364432, "step": 3864, "train_runtime": 3921.9993, "train_tokens_per_second": 5957.276 }, { "epoch": 1.4215172413793105, "grad_norm": 1.0175602436065674, "learning_rate": 5.7942205043254194e-05, "loss": 1.4763, "num_input_tokens_seen": 23368880, "step": 3865, "train_runtime": 3922.8016, "train_tokens_per_second": 5957.191 }, { "epoch": 1.4218850574712643, "grad_norm": 0.7078250050544739, "learning_rate": 5.79053929688938e-05, "loss": 1.3493, "num_input_tokens_seen": 23381696, "step": 3866, "train_runtime": 3924.6875, "train_tokens_per_second": 5957.594 }, { "epoch": 1.4222528735632185, "grad_norm": 0.9604660868644714, "learning_rate": 5.7868580894533405e-05, "loss": 1.5835, "num_input_tokens_seen": 23388480, "step": 3867, "train_runtime": 3925.7763, "train_tokens_per_second": 5957.67 }, { "epoch": 1.4226206896551723, "grad_norm": 1.0410925149917603, "learning_rate": 5.7831768820173014e-05, "loss": 1.4953, "num_input_tokens_seen": 23394224, "step": 3868, "train_runtime": 3926.7134, "train_tokens_per_second": 5957.711 }, { "epoch": 1.4229885057471265, "grad_norm": 1.0154757499694824, "learning_rate": 5.7794956745812637e-05, "loss": 1.4721, "num_input_tokens_seen": 23399056, "step": 3869, "train_runtime": 3927.538, "train_tokens_per_second": 5957.69 }, { "epoch": 1.4233563218390803, "grad_norm": 1.0183285474777222, "learning_rate": 5.775814467145224e-05, "loss": 1.6538, "num_input_tokens_seen": 23403488, "step": 3870, "train_runtime": 3928.3073, "train_tokens_per_second": 5957.652 }, { "epoch": 1.4237241379310346, "grad_norm": 0.8870113492012024, "learning_rate": 5.772133259709185e-05, "loss": 1.3219, "num_input_tokens_seen": 23412752, "step": 3871, "train_runtime": 3930.1993, "train_tokens_per_second": 5957.141 }, { "epoch": 1.4240919540229884, "grad_norm": 0.9855868220329285, "learning_rate": 5.7684520522731456e-05, "loss": 1.4956, "num_input_tokens_seen": 23417376, "step": 3872, "train_runtime": 3931.0125, "train_tokens_per_second": 5957.085 }, { "epoch": 1.4244597701149426, "grad_norm": 1.0047303438186646, "learning_rate": 5.764770844837107e-05, "loss": 1.4862, "num_input_tokens_seen": 23424688, "step": 3873, "train_runtime": 3932.1756, "train_tokens_per_second": 5957.183 }, { "epoch": 1.4248275862068964, "grad_norm": 0.9415448307991028, "learning_rate": 5.761089637401068e-05, "loss": 1.5932, "num_input_tokens_seen": 23429312, "step": 3874, "train_runtime": 3932.9722, "train_tokens_per_second": 5957.152 }, { "epoch": 1.4251954022988507, "grad_norm": 0.948373556137085, "learning_rate": 5.757408429965029e-05, "loss": 1.565, "num_input_tokens_seen": 23436512, "step": 3875, "train_runtime": 3934.1334, "train_tokens_per_second": 5957.223 }, { "epoch": 1.4255632183908045, "grad_norm": 0.9539574980735779, "learning_rate": 5.75372722252899e-05, "loss": 1.6299, "num_input_tokens_seen": 23441472, "step": 3876, "train_runtime": 3934.963, "train_tokens_per_second": 5957.228 }, { "epoch": 1.4259310344827587, "grad_norm": 1.014194130897522, "learning_rate": 5.75004601509295e-05, "loss": 1.574, "num_input_tokens_seen": 23447888, "step": 3877, "train_runtime": 3935.9843, "train_tokens_per_second": 5957.312 }, { "epoch": 1.4262988505747125, "grad_norm": 0.9765027165412903, "learning_rate": 5.746364807656912e-05, "loss": 1.5121, "num_input_tokens_seen": 23454160, "step": 3878, "train_runtime": 3937.0199, "train_tokens_per_second": 5957.338 }, { "epoch": 1.4266666666666667, "grad_norm": 0.9368051290512085, "learning_rate": 5.7426836002208725e-05, "loss": 1.4899, "num_input_tokens_seen": 23459936, "step": 3879, "train_runtime": 3937.9919, "train_tokens_per_second": 5957.335 }, { "epoch": 1.4270344827586208, "grad_norm": 0.9212564826011658, "learning_rate": 5.7390023927848334e-05, "loss": 1.3824, "num_input_tokens_seen": 23466496, "step": 3880, "train_runtime": 3939.064, "train_tokens_per_second": 5957.379 }, { "epoch": 1.4274022988505748, "grad_norm": 1.0353937149047852, "learning_rate": 5.735321185348794e-05, "loss": 1.6984, "num_input_tokens_seen": 23471824, "step": 3881, "train_runtime": 3939.9433, "train_tokens_per_second": 5957.401 }, { "epoch": 1.4277701149425288, "grad_norm": 0.9657158851623535, "learning_rate": 5.731639977912756e-05, "loss": 1.3684, "num_input_tokens_seen": 23476624, "step": 3882, "train_runtime": 3940.7634, "train_tokens_per_second": 5957.38 }, { "epoch": 1.4281379310344828, "grad_norm": 0.8945689797401428, "learning_rate": 5.727958770476717e-05, "loss": 1.4206, "num_input_tokens_seen": 23481728, "step": 3883, "train_runtime": 3941.5979, "train_tokens_per_second": 5957.413 }, { "epoch": 1.4285057471264369, "grad_norm": 0.9939314126968384, "learning_rate": 5.724277563040678e-05, "loss": 1.4417, "num_input_tokens_seen": 23490016, "step": 3884, "train_runtime": 3942.9102, "train_tokens_per_second": 5957.533 }, { "epoch": 1.4288735632183909, "grad_norm": 0.9665780663490295, "learning_rate": 5.7205963556046386e-05, "loss": 1.6332, "num_input_tokens_seen": 23495936, "step": 3885, "train_runtime": 3943.8607, "train_tokens_per_second": 5957.598 }, { "epoch": 1.429241379310345, "grad_norm": 0.913955569267273, "learning_rate": 5.7169151481686e-05, "loss": 1.5729, "num_input_tokens_seen": 23504432, "step": 3886, "train_runtime": 3945.1835, "train_tokens_per_second": 5957.754 }, { "epoch": 1.429609195402299, "grad_norm": 1.0110636949539185, "learning_rate": 5.713233940732561e-05, "loss": 1.7369, "num_input_tokens_seen": 23509408, "step": 3887, "train_runtime": 3946.0357, "train_tokens_per_second": 5957.728 }, { "epoch": 1.429977011494253, "grad_norm": 0.9137610793113708, "learning_rate": 5.709552733296521e-05, "loss": 1.5215, "num_input_tokens_seen": 23515664, "step": 3888, "train_runtime": 3947.0532, "train_tokens_per_second": 5957.777 }, { "epoch": 1.430344827586207, "grad_norm": 0.9536697864532471, "learning_rate": 5.705871525860482e-05, "loss": 1.4227, "num_input_tokens_seen": 23520624, "step": 3889, "train_runtime": 3947.8823, "train_tokens_per_second": 5957.783 }, { "epoch": 1.430712643678161, "grad_norm": 0.8703693151473999, "learning_rate": 5.702190318424443e-05, "loss": 1.4911, "num_input_tokens_seen": 23527328, "step": 3890, "train_runtime": 3948.9175, "train_tokens_per_second": 5957.918 }, { "epoch": 1.431080459770115, "grad_norm": 0.878696084022522, "learning_rate": 5.6985091109884046e-05, "loss": 1.5087, "num_input_tokens_seen": 23532896, "step": 3891, "train_runtime": 3949.8306, "train_tokens_per_second": 5957.951 }, { "epoch": 1.431448275862069, "grad_norm": 1.0287691354751587, "learning_rate": 5.6948279035523655e-05, "loss": 1.4682, "num_input_tokens_seen": 23542352, "step": 3892, "train_runtime": 3951.2423, "train_tokens_per_second": 5958.215 }, { "epoch": 1.431816091954023, "grad_norm": 0.9357215762138367, "learning_rate": 5.6911466961163263e-05, "loss": 1.628, "num_input_tokens_seen": 23547104, "step": 3893, "train_runtime": 3952.0493, "train_tokens_per_second": 5958.201 }, { "epoch": 1.432183908045977, "grad_norm": 0.9912281632423401, "learning_rate": 5.687465488680287e-05, "loss": 1.6233, "num_input_tokens_seen": 23553072, "step": 3894, "train_runtime": 3953.003, "train_tokens_per_second": 5958.273 }, { "epoch": 1.432551724137931, "grad_norm": 0.9902219772338867, "learning_rate": 5.683784281244249e-05, "loss": 1.587, "num_input_tokens_seen": 23557856, "step": 3895, "train_runtime": 3953.8029, "train_tokens_per_second": 5958.278 }, { "epoch": 1.432919540229885, "grad_norm": 1.0217221975326538, "learning_rate": 5.68010307380821e-05, "loss": 1.8398, "num_input_tokens_seen": 23562656, "step": 3896, "train_runtime": 3954.6292, "train_tokens_per_second": 5958.247 }, { "epoch": 1.4332873563218391, "grad_norm": 0.9312261343002319, "learning_rate": 5.67642186637217e-05, "loss": 1.7105, "num_input_tokens_seen": 23569664, "step": 3897, "train_runtime": 3955.761, "train_tokens_per_second": 5958.313 }, { "epoch": 1.4336551724137931, "grad_norm": 0.9893278479576111, "learning_rate": 5.672740658936131e-05, "loss": 1.5993, "num_input_tokens_seen": 23574384, "step": 3898, "train_runtime": 3956.5777, "train_tokens_per_second": 5958.277 }, { "epoch": 1.4340229885057472, "grad_norm": 0.9132021069526672, "learning_rate": 5.669059451500093e-05, "loss": 1.4003, "num_input_tokens_seen": 23579392, "step": 3899, "train_runtime": 3957.3917, "train_tokens_per_second": 5958.316 }, { "epoch": 1.4343908045977012, "grad_norm": 0.996238648891449, "learning_rate": 5.665378244064053e-05, "loss": 1.5099, "num_input_tokens_seen": 23584816, "step": 3900, "train_runtime": 3958.2583, "train_tokens_per_second": 5958.382 }, { "epoch": 1.4347586206896552, "grad_norm": 0.9297142624855042, "learning_rate": 5.661697036628014e-05, "loss": 1.4056, "num_input_tokens_seen": 23590544, "step": 3901, "train_runtime": 3959.6809, "train_tokens_per_second": 5957.688 }, { "epoch": 1.4351264367816092, "grad_norm": 0.9852582812309265, "learning_rate": 5.658015829191975e-05, "loss": 1.6708, "num_input_tokens_seen": 23596016, "step": 3902, "train_runtime": 3960.5906, "train_tokens_per_second": 5957.701 }, { "epoch": 1.4354942528735632, "grad_norm": 0.9678986668586731, "learning_rate": 5.6543346217559366e-05, "loss": 1.3661, "num_input_tokens_seen": 23602144, "step": 3903, "train_runtime": 3961.595, "train_tokens_per_second": 5957.738 }, { "epoch": 1.4358620689655173, "grad_norm": 0.9360491633415222, "learning_rate": 5.6506534143198975e-05, "loss": 1.6038, "num_input_tokens_seen": 23607216, "step": 3904, "train_runtime": 3962.4478, "train_tokens_per_second": 5957.736 }, { "epoch": 1.4362298850574713, "grad_norm": 0.921673059463501, "learning_rate": 5.6469722068838584e-05, "loss": 1.5799, "num_input_tokens_seen": 23614592, "step": 3905, "train_runtime": 3963.5808, "train_tokens_per_second": 5957.893 }, { "epoch": 1.4365977011494253, "grad_norm": 1.0383217334747314, "learning_rate": 5.6432909994478186e-05, "loss": 1.6317, "num_input_tokens_seen": 23621648, "step": 3906, "train_runtime": 3964.7094, "train_tokens_per_second": 5957.977 }, { "epoch": 1.4369655172413793, "grad_norm": 0.9556329250335693, "learning_rate": 5.6396097920117795e-05, "loss": 1.4928, "num_input_tokens_seen": 23626624, "step": 3907, "train_runtime": 3965.5508, "train_tokens_per_second": 5957.968 }, { "epoch": 1.4373333333333334, "grad_norm": 0.9423363208770752, "learning_rate": 5.635928584575742e-05, "loss": 1.4834, "num_input_tokens_seen": 23631792, "step": 3908, "train_runtime": 3966.422, "train_tokens_per_second": 5957.962 }, { "epoch": 1.4377011494252874, "grad_norm": 0.9611340165138245, "learning_rate": 5.632247377139702e-05, "loss": 1.5116, "num_input_tokens_seen": 23636320, "step": 3909, "train_runtime": 3967.2077, "train_tokens_per_second": 5957.923 }, { "epoch": 1.4380689655172414, "grad_norm": 0.9286181330680847, "learning_rate": 5.628566169703663e-05, "loss": 1.4953, "num_input_tokens_seen": 23642144, "step": 3910, "train_runtime": 3968.1666, "train_tokens_per_second": 5957.951 }, { "epoch": 1.4384367816091954, "grad_norm": 1.0016546249389648, "learning_rate": 5.624884962267624e-05, "loss": 1.4092, "num_input_tokens_seen": 23646368, "step": 3911, "train_runtime": 3968.8987, "train_tokens_per_second": 5957.917 }, { "epoch": 1.4388045977011494, "grad_norm": 0.929370105266571, "learning_rate": 5.621203754831585e-05, "loss": 1.4827, "num_input_tokens_seen": 23652128, "step": 3912, "train_runtime": 3969.8477, "train_tokens_per_second": 5957.943 }, { "epoch": 1.4391724137931035, "grad_norm": 0.9945060610771179, "learning_rate": 5.617522547395546e-05, "loss": 1.2793, "num_input_tokens_seen": 23657120, "step": 3913, "train_runtime": 3970.6861, "train_tokens_per_second": 5957.943 }, { "epoch": 1.4395402298850575, "grad_norm": 1.0037338733673096, "learning_rate": 5.613841339959507e-05, "loss": 1.5655, "num_input_tokens_seen": 23662656, "step": 3914, "train_runtime": 3971.5749, "train_tokens_per_second": 5958.003 }, { "epoch": 1.4399080459770115, "grad_norm": 0.9895558953285217, "learning_rate": 5.610160132523468e-05, "loss": 1.4959, "num_input_tokens_seen": 23667504, "step": 3915, "train_runtime": 3972.3952, "train_tokens_per_second": 5957.993 }, { "epoch": 1.4402758620689655, "grad_norm": 0.9794352054595947, "learning_rate": 5.6064789250874295e-05, "loss": 1.4233, "num_input_tokens_seen": 23672416, "step": 3916, "train_runtime": 3973.2274, "train_tokens_per_second": 5957.982 }, { "epoch": 1.4406436781609195, "grad_norm": 1.0201325416564941, "learning_rate": 5.6027977176513904e-05, "loss": 1.4731, "num_input_tokens_seen": 23676880, "step": 3917, "train_runtime": 3974.0054, "train_tokens_per_second": 5957.939 }, { "epoch": 1.4410114942528736, "grad_norm": 1.0298972129821777, "learning_rate": 5.5991165102153506e-05, "loss": 1.6392, "num_input_tokens_seen": 23681776, "step": 3918, "train_runtime": 3974.8313, "train_tokens_per_second": 5957.932 }, { "epoch": 1.4413793103448276, "grad_norm": 0.9182288646697998, "learning_rate": 5.5954353027793115e-05, "loss": 1.298, "num_input_tokens_seen": 23688976, "step": 3919, "train_runtime": 3975.9796, "train_tokens_per_second": 5958.023 }, { "epoch": 1.4417471264367816, "grad_norm": 0.9700836539268494, "learning_rate": 5.5917540953432724e-05, "loss": 1.4472, "num_input_tokens_seen": 23693808, "step": 3920, "train_runtime": 3976.807, "train_tokens_per_second": 5957.998 }, { "epoch": 1.4421149425287356, "grad_norm": 0.9916850924491882, "learning_rate": 5.588072887907234e-05, "loss": 1.4742, "num_input_tokens_seen": 23702576, "step": 3921, "train_runtime": 3978.1476, "train_tokens_per_second": 5958.194 }, { "epoch": 1.4424827586206896, "grad_norm": 0.9078749418258667, "learning_rate": 5.584391680471195e-05, "loss": 1.3597, "num_input_tokens_seen": 23707856, "step": 3922, "train_runtime": 3979.0346, "train_tokens_per_second": 5958.193 }, { "epoch": 1.4428505747126437, "grad_norm": 1.0607084035873413, "learning_rate": 5.580710473035156e-05, "loss": 1.6505, "num_input_tokens_seen": 23712576, "step": 3923, "train_runtime": 3979.8481, "train_tokens_per_second": 5958.161 }, { "epoch": 1.4432183908045977, "grad_norm": 0.9192100167274475, "learning_rate": 5.5770292655991166e-05, "loss": 1.3215, "num_input_tokens_seen": 23718112, "step": 3924, "train_runtime": 3980.7565, "train_tokens_per_second": 5958.192 }, { "epoch": 1.4435862068965517, "grad_norm": 1.0487370491027832, "learning_rate": 5.573348058163078e-05, "loss": 1.5791, "num_input_tokens_seen": 23722816, "step": 3925, "train_runtime": 3981.5574, "train_tokens_per_second": 5958.175 }, { "epoch": 1.4439540229885057, "grad_norm": 1.0452100038528442, "learning_rate": 5.569666850727039e-05, "loss": 1.7352, "num_input_tokens_seen": 23729184, "step": 3926, "train_runtime": 3982.5871, "train_tokens_per_second": 5958.234 }, { "epoch": 1.4443218390804597, "grad_norm": 1.0129988193511963, "learning_rate": 5.565985643290999e-05, "loss": 1.6463, "num_input_tokens_seen": 23734000, "step": 3927, "train_runtime": 3983.3857, "train_tokens_per_second": 5958.248 }, { "epoch": 1.4446896551724138, "grad_norm": 0.9765925407409668, "learning_rate": 5.56230443585496e-05, "loss": 1.4746, "num_input_tokens_seen": 23739488, "step": 3928, "train_runtime": 3984.2667, "train_tokens_per_second": 5958.308 }, { "epoch": 1.4450574712643678, "grad_norm": 0.902500331401825, "learning_rate": 5.5586232284189224e-05, "loss": 1.6207, "num_input_tokens_seen": 23744640, "step": 3929, "train_runtime": 3985.1347, "train_tokens_per_second": 5958.303 }, { "epoch": 1.4454252873563218, "grad_norm": 0.9580575823783875, "learning_rate": 5.5549420209828826e-05, "loss": 1.3617, "num_input_tokens_seen": 23753776, "step": 3930, "train_runtime": 3986.4911, "train_tokens_per_second": 5958.567 }, { "epoch": 1.4457931034482758, "grad_norm": 0.9147399663925171, "learning_rate": 5.5512608135468435e-05, "loss": 1.4165, "num_input_tokens_seen": 23760080, "step": 3931, "train_runtime": 3987.9724, "train_tokens_per_second": 5957.935 }, { "epoch": 1.4461609195402298, "grad_norm": 0.8609374165534973, "learning_rate": 5.5475796061108044e-05, "loss": 1.4154, "num_input_tokens_seen": 23765296, "step": 3932, "train_runtime": 3988.8481, "train_tokens_per_second": 5957.935 }, { "epoch": 1.4465287356321839, "grad_norm": 0.9341060519218445, "learning_rate": 5.543898398674766e-05, "loss": 1.4064, "num_input_tokens_seen": 23771616, "step": 3933, "train_runtime": 3989.8857, "train_tokens_per_second": 5957.969 }, { "epoch": 1.446896551724138, "grad_norm": 0.9795817732810974, "learning_rate": 5.540217191238727e-05, "loss": 1.7441, "num_input_tokens_seen": 23776336, "step": 3934, "train_runtime": 3990.6981, "train_tokens_per_second": 5957.939 }, { "epoch": 1.447264367816092, "grad_norm": 1.0131844282150269, "learning_rate": 5.536535983802688e-05, "loss": 1.5081, "num_input_tokens_seen": 23782736, "step": 3935, "train_runtime": 3991.7219, "train_tokens_per_second": 5958.014 }, { "epoch": 1.447632183908046, "grad_norm": 0.8310518860816956, "learning_rate": 5.532854776366648e-05, "loss": 1.4058, "num_input_tokens_seen": 23788448, "step": 3936, "train_runtime": 3992.6285, "train_tokens_per_second": 5958.092 }, { "epoch": 1.448, "grad_norm": 1.0397616624832153, "learning_rate": 5.529173568930609e-05, "loss": 1.5659, "num_input_tokens_seen": 23794400, "step": 3937, "train_runtime": 3993.5751, "train_tokens_per_second": 5958.17 }, { "epoch": 1.448367816091954, "grad_norm": 1.0304861068725586, "learning_rate": 5.525492361494571e-05, "loss": 1.5069, "num_input_tokens_seen": 23799424, "step": 3938, "train_runtime": 3994.4241, "train_tokens_per_second": 5958.161 }, { "epoch": 1.448735632183908, "grad_norm": 0.9898491501808167, "learning_rate": 5.521811154058531e-05, "loss": 1.5935, "num_input_tokens_seen": 23804160, "step": 3939, "train_runtime": 3995.2412, "train_tokens_per_second": 5958.128 }, { "epoch": 1.449103448275862, "grad_norm": 0.9128115773200989, "learning_rate": 5.518129946622492e-05, "loss": 1.4474, "num_input_tokens_seen": 23810656, "step": 3940, "train_runtime": 3996.2863, "train_tokens_per_second": 5958.196 }, { "epoch": 1.449471264367816, "grad_norm": 1.0561201572418213, "learning_rate": 5.514448739186453e-05, "loss": 1.3838, "num_input_tokens_seen": 23816976, "step": 3941, "train_runtime": 3997.3115, "train_tokens_per_second": 5958.249 }, { "epoch": 1.44983908045977, "grad_norm": 1.0236408710479736, "learning_rate": 5.510767531750415e-05, "loss": 1.5291, "num_input_tokens_seen": 23822160, "step": 3942, "train_runtime": 3998.1788, "train_tokens_per_second": 5958.253 }, { "epoch": 1.450206896551724, "grad_norm": 0.9636337161064148, "learning_rate": 5.5070863243143756e-05, "loss": 1.5549, "num_input_tokens_seen": 23829696, "step": 3943, "train_runtime": 3999.3635, "train_tokens_per_second": 5958.372 }, { "epoch": 1.450574712643678, "grad_norm": 0.8566339015960693, "learning_rate": 5.5034051168783364e-05, "loss": 1.382, "num_input_tokens_seen": 23835232, "step": 3944, "train_runtime": 4000.2786, "train_tokens_per_second": 5958.393 }, { "epoch": 1.4509425287356321, "grad_norm": 0.9837653040885925, "learning_rate": 5.4997239094422967e-05, "loss": 1.5552, "num_input_tokens_seen": 23840704, "step": 3945, "train_runtime": 4001.186, "train_tokens_per_second": 5958.409 }, { "epoch": 1.4513103448275861, "grad_norm": 0.9445203542709351, "learning_rate": 5.496042702006259e-05, "loss": 1.5177, "num_input_tokens_seen": 23845520, "step": 3946, "train_runtime": 4002.022, "train_tokens_per_second": 5958.368 }, { "epoch": 1.4516781609195402, "grad_norm": 0.9818313121795654, "learning_rate": 5.49236149457022e-05, "loss": 1.5207, "num_input_tokens_seen": 23850720, "step": 3947, "train_runtime": 4002.8686, "train_tokens_per_second": 5958.407 }, { "epoch": 1.4520459770114942, "grad_norm": 1.0295852422714233, "learning_rate": 5.48868028713418e-05, "loss": 1.5124, "num_input_tokens_seen": 23856064, "step": 3948, "train_runtime": 4003.78, "train_tokens_per_second": 5958.385 }, { "epoch": 1.4524137931034482, "grad_norm": 1.0007249116897583, "learning_rate": 5.484999079698141e-05, "loss": 1.5903, "num_input_tokens_seen": 23861344, "step": 3949, "train_runtime": 4004.6662, "train_tokens_per_second": 5958.385 }, { "epoch": 1.4527816091954022, "grad_norm": 0.9333604574203491, "learning_rate": 5.481317872262102e-05, "loss": 1.4851, "num_input_tokens_seen": 23868768, "step": 3950, "train_runtime": 4005.8037, "train_tokens_per_second": 5958.547 }, { "epoch": 1.4531494252873562, "grad_norm": 0.9393358826637268, "learning_rate": 5.4776366648260633e-05, "loss": 1.5632, "num_input_tokens_seen": 23874336, "step": 3951, "train_runtime": 4006.6983, "train_tokens_per_second": 5958.606 }, { "epoch": 1.4535172413793103, "grad_norm": 0.9209961295127869, "learning_rate": 5.473955457390024e-05, "loss": 1.6251, "num_input_tokens_seen": 23879888, "step": 3952, "train_runtime": 4007.5863, "train_tokens_per_second": 5958.671 }, { "epoch": 1.4538850574712643, "grad_norm": 1.0529483556747437, "learning_rate": 5.470274249953985e-05, "loss": 1.5663, "num_input_tokens_seen": 23885008, "step": 3953, "train_runtime": 4008.458, "train_tokens_per_second": 5958.652 }, { "epoch": 1.4542528735632185, "grad_norm": 0.9830681681632996, "learning_rate": 5.466593042517946e-05, "loss": 1.5933, "num_input_tokens_seen": 23890208, "step": 3954, "train_runtime": 4009.3302, "train_tokens_per_second": 5958.653 }, { "epoch": 1.4546206896551723, "grad_norm": 0.9561806917190552, "learning_rate": 5.4629118350819076e-05, "loss": 1.6661, "num_input_tokens_seen": 23895904, "step": 3955, "train_runtime": 4010.2585, "train_tokens_per_second": 5958.694 }, { "epoch": 1.4549885057471266, "grad_norm": 1.0198067426681519, "learning_rate": 5.4592306276458685e-05, "loss": 1.1809, "num_input_tokens_seen": 23901312, "step": 3956, "train_runtime": 4011.1577, "train_tokens_per_second": 5958.707 }, { "epoch": 1.4553563218390804, "grad_norm": 0.9848325848579407, "learning_rate": 5.455549420209829e-05, "loss": 1.7004, "num_input_tokens_seen": 23906176, "step": 3957, "train_runtime": 4011.9873, "train_tokens_per_second": 5958.687 }, { "epoch": 1.4557241379310346, "grad_norm": 0.9442578554153442, "learning_rate": 5.4518682127737896e-05, "loss": 1.5273, "num_input_tokens_seen": 23911280, "step": 3958, "train_runtime": 4012.8615, "train_tokens_per_second": 5958.661 }, { "epoch": 1.4560919540229884, "grad_norm": 0.969097912311554, "learning_rate": 5.448187005337752e-05, "loss": 1.6106, "num_input_tokens_seen": 23916688, "step": 3959, "train_runtime": 4013.7588, "train_tokens_per_second": 5958.676 }, { "epoch": 1.4564597701149427, "grad_norm": 0.9606767296791077, "learning_rate": 5.444505797901712e-05, "loss": 1.3795, "num_input_tokens_seen": 23925536, "step": 3960, "train_runtime": 4015.1427, "train_tokens_per_second": 5958.826 }, { "epoch": 1.4568275862068965, "grad_norm": 0.9321314096450806, "learning_rate": 5.440824590465673e-05, "loss": 1.4685, "num_input_tokens_seen": 23932160, "step": 3961, "train_runtime": 4016.6968, "train_tokens_per_second": 5958.169 }, { "epoch": 1.4571954022988507, "grad_norm": 0.9932836890220642, "learning_rate": 5.437143383029634e-05, "loss": 1.5359, "num_input_tokens_seen": 23937536, "step": 3962, "train_runtime": 4017.5924, "train_tokens_per_second": 5958.179 }, { "epoch": 1.4575632183908045, "grad_norm": 1.011725664138794, "learning_rate": 5.4334621755935954e-05, "loss": 1.5599, "num_input_tokens_seen": 23942208, "step": 3963, "train_runtime": 4018.3864, "train_tokens_per_second": 5958.165 }, { "epoch": 1.4579310344827587, "grad_norm": 0.9977604746818542, "learning_rate": 5.429780968157556e-05, "loss": 1.4931, "num_input_tokens_seen": 23946976, "step": 3964, "train_runtime": 4019.2157, "train_tokens_per_second": 5958.122 }, { "epoch": 1.4582988505747125, "grad_norm": 0.9668065309524536, "learning_rate": 5.426099760721517e-05, "loss": 1.7853, "num_input_tokens_seen": 23953120, "step": 3965, "train_runtime": 4020.2037, "train_tokens_per_second": 5958.186 }, { "epoch": 1.4586666666666668, "grad_norm": 1.0396864414215088, "learning_rate": 5.4224185532854774e-05, "loss": 1.4023, "num_input_tokens_seen": 23960480, "step": 3966, "train_runtime": 4021.3462, "train_tokens_per_second": 5958.323 }, { "epoch": 1.4590344827586206, "grad_norm": 0.8447195291519165, "learning_rate": 5.418737345849438e-05, "loss": 1.3982, "num_input_tokens_seen": 23967216, "step": 3967, "train_runtime": 4022.42, "train_tokens_per_second": 5958.407 }, { "epoch": 1.4594022988505748, "grad_norm": 1.0791133642196655, "learning_rate": 5.4150561384134005e-05, "loss": 1.502, "num_input_tokens_seen": 23974928, "step": 3968, "train_runtime": 4023.6332, "train_tokens_per_second": 5958.527 }, { "epoch": 1.4597701149425286, "grad_norm": 1.0344927310943604, "learning_rate": 5.411374930977361e-05, "loss": 1.4992, "num_input_tokens_seen": 23982032, "step": 3969, "train_runtime": 4024.7424, "train_tokens_per_second": 5958.65 }, { "epoch": 1.4601379310344829, "grad_norm": 1.0100144147872925, "learning_rate": 5.4076937235413216e-05, "loss": 1.562, "num_input_tokens_seen": 23989600, "step": 3970, "train_runtime": 4025.922, "train_tokens_per_second": 5958.784 }, { "epoch": 1.4605057471264367, "grad_norm": 1.0503922700881958, "learning_rate": 5.4040125161052825e-05, "loss": 1.5329, "num_input_tokens_seen": 23996992, "step": 3971, "train_runtime": 4027.0618, "train_tokens_per_second": 5958.933 }, { "epoch": 1.460873563218391, "grad_norm": 0.9958587288856506, "learning_rate": 5.400331308669244e-05, "loss": 1.498, "num_input_tokens_seen": 24002832, "step": 3972, "train_runtime": 4028.0027, "train_tokens_per_second": 5958.991 }, { "epoch": 1.4612413793103447, "grad_norm": 1.0499320030212402, "learning_rate": 5.396650101233205e-05, "loss": 1.4402, "num_input_tokens_seen": 24008864, "step": 3973, "train_runtime": 4028.9593, "train_tokens_per_second": 5959.073 }, { "epoch": 1.461609195402299, "grad_norm": 0.980239748954773, "learning_rate": 5.392968893797166e-05, "loss": 1.3266, "num_input_tokens_seen": 24014368, "step": 3974, "train_runtime": 4029.8671, "train_tokens_per_second": 5959.097 }, { "epoch": 1.4619770114942527, "grad_norm": 1.0136046409606934, "learning_rate": 5.389287686361126e-05, "loss": 1.5789, "num_input_tokens_seen": 24019376, "step": 3975, "train_runtime": 4030.7019, "train_tokens_per_second": 5959.105 }, { "epoch": 1.462344827586207, "grad_norm": 1.0189021825790405, "learning_rate": 5.385606478925088e-05, "loss": 1.5808, "num_input_tokens_seen": 24024016, "step": 3976, "train_runtime": 4031.4968, "train_tokens_per_second": 5959.081 }, { "epoch": 1.4627126436781608, "grad_norm": 0.9636145830154419, "learning_rate": 5.381925271489049e-05, "loss": 1.5115, "num_input_tokens_seen": 24028480, "step": 3977, "train_runtime": 4032.2736, "train_tokens_per_second": 5959.04 }, { "epoch": 1.463080459770115, "grad_norm": 1.0247414112091064, "learning_rate": 5.3782440640530094e-05, "loss": 1.5167, "num_input_tokens_seen": 24033184, "step": 3978, "train_runtime": 4033.0716, "train_tokens_per_second": 5959.027 }, { "epoch": 1.463448275862069, "grad_norm": 1.0392184257507324, "learning_rate": 5.37456285661697e-05, "loss": 1.4035, "num_input_tokens_seen": 24037664, "step": 3979, "train_runtime": 4033.842, "train_tokens_per_second": 5959.0 }, { "epoch": 1.463816091954023, "grad_norm": 1.0267279148101807, "learning_rate": 5.370881649180931e-05, "loss": 1.6334, "num_input_tokens_seen": 24043504, "step": 3980, "train_runtime": 4034.7993, "train_tokens_per_second": 5959.034 }, { "epoch": 1.464183908045977, "grad_norm": 0.9114202260971069, "learning_rate": 5.367200441744893e-05, "loss": 1.4836, "num_input_tokens_seen": 24049296, "step": 3981, "train_runtime": 4035.7378, "train_tokens_per_second": 5959.083 }, { "epoch": 1.464551724137931, "grad_norm": 0.9234261512756348, "learning_rate": 5.3635192343088536e-05, "loss": 1.2929, "num_input_tokens_seen": 24057264, "step": 3982, "train_runtime": 4036.9513, "train_tokens_per_second": 5959.265 }, { "epoch": 1.4649195402298851, "grad_norm": 0.9922747015953064, "learning_rate": 5.3598380268728145e-05, "loss": 1.4076, "num_input_tokens_seen": 24061936, "step": 3983, "train_runtime": 4037.7658, "train_tokens_per_second": 5959.22 }, { "epoch": 1.4652873563218392, "grad_norm": 1.0076498985290527, "learning_rate": 5.356156819436775e-05, "loss": 1.5843, "num_input_tokens_seen": 24067104, "step": 3984, "train_runtime": 4038.6409, "train_tokens_per_second": 5959.209 }, { "epoch": 1.4656551724137932, "grad_norm": 1.0241613388061523, "learning_rate": 5.352475612000737e-05, "loss": 1.5223, "num_input_tokens_seen": 24072576, "step": 3985, "train_runtime": 4039.5324, "train_tokens_per_second": 5959.248 }, { "epoch": 1.4660229885057472, "grad_norm": 0.9356365203857422, "learning_rate": 5.348794404564698e-05, "loss": 1.4281, "num_input_tokens_seen": 24078368, "step": 3986, "train_runtime": 4040.4765, "train_tokens_per_second": 5959.289 }, { "epoch": 1.4663908045977012, "grad_norm": 0.9243559241294861, "learning_rate": 5.345113197128658e-05, "loss": 1.4318, "num_input_tokens_seen": 24084576, "step": 3987, "train_runtime": 4041.4565, "train_tokens_per_second": 5959.38 }, { "epoch": 1.4667586206896552, "grad_norm": 0.8942695260047913, "learning_rate": 5.341431989692619e-05, "loss": 1.3723, "num_input_tokens_seen": 24091280, "step": 3988, "train_runtime": 4042.5297, "train_tokens_per_second": 5959.457 }, { "epoch": 1.4671264367816093, "grad_norm": 1.0101655721664429, "learning_rate": 5.337750782256581e-05, "loss": 1.6068, "num_input_tokens_seen": 24096192, "step": 3989, "train_runtime": 4043.3485, "train_tokens_per_second": 5959.465 }, { "epoch": 1.4674942528735633, "grad_norm": 0.9235145449638367, "learning_rate": 5.3340695748205414e-05, "loss": 1.5572, "num_input_tokens_seen": 24100816, "step": 3990, "train_runtime": 4044.1371, "train_tokens_per_second": 5959.446 }, { "epoch": 1.4678620689655173, "grad_norm": 1.0393980741500854, "learning_rate": 5.330388367384502e-05, "loss": 1.4833, "num_input_tokens_seen": 24108800, "step": 3991, "train_runtime": 4045.8696, "train_tokens_per_second": 5958.867 }, { "epoch": 1.4682298850574713, "grad_norm": 0.9173269867897034, "learning_rate": 5.326707159948463e-05, "loss": 1.4363, "num_input_tokens_seen": 24114816, "step": 3992, "train_runtime": 4046.8569, "train_tokens_per_second": 5958.9 }, { "epoch": 1.4685977011494253, "grad_norm": 0.9402369856834412, "learning_rate": 5.323025952512425e-05, "loss": 1.5039, "num_input_tokens_seen": 24120784, "step": 3993, "train_runtime": 4047.8128, "train_tokens_per_second": 5958.967 }, { "epoch": 1.4689655172413794, "grad_norm": 1.1363598108291626, "learning_rate": 5.3193447450763856e-05, "loss": 1.7887, "num_input_tokens_seen": 24125072, "step": 3994, "train_runtime": 4048.5535, "train_tokens_per_second": 5958.936 }, { "epoch": 1.4693333333333334, "grad_norm": 0.9854596257209778, "learning_rate": 5.3156635376403465e-05, "loss": 1.6261, "num_input_tokens_seen": 24130384, "step": 3995, "train_runtime": 4049.4271, "train_tokens_per_second": 5958.962 }, { "epoch": 1.4697011494252874, "grad_norm": 1.0667961835861206, "learning_rate": 5.311982330204307e-05, "loss": 1.5302, "num_input_tokens_seen": 24135776, "step": 3996, "train_runtime": 4050.3218, "train_tokens_per_second": 5958.977 }, { "epoch": 1.4700689655172414, "grad_norm": 1.052289605140686, "learning_rate": 5.3083011227682676e-05, "loss": 1.682, "num_input_tokens_seen": 24140496, "step": 3997, "train_runtime": 4051.1089, "train_tokens_per_second": 5958.985 }, { "epoch": 1.4704367816091954, "grad_norm": 1.0311145782470703, "learning_rate": 5.30461991533223e-05, "loss": 1.6228, "num_input_tokens_seen": 24144832, "step": 3998, "train_runtime": 4051.8618, "train_tokens_per_second": 5958.947 }, { "epoch": 1.4708045977011495, "grad_norm": 1.0431197881698608, "learning_rate": 5.30093870789619e-05, "loss": 1.4621, "num_input_tokens_seen": 24152464, "step": 3999, "train_runtime": 4053.0928, "train_tokens_per_second": 5959.021 }, { "epoch": 1.4711724137931035, "grad_norm": 0.9911890625953674, "learning_rate": 5.297257500460151e-05, "loss": 1.5715, "num_input_tokens_seen": 24160880, "step": 4000, "train_runtime": 4054.3684, "train_tokens_per_second": 5959.222 }, { "epoch": 1.4715402298850575, "grad_norm": 0.91972815990448, "learning_rate": 5.293576293024112e-05, "loss": 1.3507, "num_input_tokens_seen": 24169168, "step": 4001, "train_runtime": 4055.6576, "train_tokens_per_second": 5959.371 }, { "epoch": 1.4719080459770115, "grad_norm": 0.998271644115448, "learning_rate": 5.2898950855880734e-05, "loss": 1.5106, "num_input_tokens_seen": 24174256, "step": 4002, "train_runtime": 4056.51, "train_tokens_per_second": 5959.373 }, { "epoch": 1.4722758620689655, "grad_norm": 0.8969280123710632, "learning_rate": 5.286213878152034e-05, "loss": 1.4304, "num_input_tokens_seen": 24182336, "step": 4003, "train_runtime": 4057.7493, "train_tokens_per_second": 5959.544 }, { "epoch": 1.4726436781609196, "grad_norm": 1.0865023136138916, "learning_rate": 5.282532670715995e-05, "loss": 1.5719, "num_input_tokens_seen": 24186992, "step": 4004, "train_runtime": 4058.5463, "train_tokens_per_second": 5959.521 }, { "epoch": 1.4730114942528736, "grad_norm": 0.9584881067276001, "learning_rate": 5.2788514632799554e-05, "loss": 1.5604, "num_input_tokens_seen": 24193616, "step": 4005, "train_runtime": 4059.6164, "train_tokens_per_second": 5959.582 }, { "epoch": 1.4733793103448276, "grad_norm": 0.956598699092865, "learning_rate": 5.275170255843918e-05, "loss": 1.6063, "num_input_tokens_seen": 24199376, "step": 4006, "train_runtime": 4060.5674, "train_tokens_per_second": 5959.605 }, { "epoch": 1.4737471264367816, "grad_norm": 0.9755147695541382, "learning_rate": 5.2714890484078786e-05, "loss": 1.3879, "num_input_tokens_seen": 24207920, "step": 4007, "train_runtime": 4061.8704, "train_tokens_per_second": 5959.796 }, { "epoch": 1.4741149425287357, "grad_norm": 0.900531530380249, "learning_rate": 5.267807840971839e-05, "loss": 1.3409, "num_input_tokens_seen": 24216720, "step": 4008, "train_runtime": 4063.2073, "train_tokens_per_second": 5960.001 }, { "epoch": 1.4744827586206897, "grad_norm": 1.003485083580017, "learning_rate": 5.2641266335358e-05, "loss": 1.4971, "num_input_tokens_seen": 24229248, "step": 4009, "train_runtime": 4065.0502, "train_tokens_per_second": 5960.381 }, { "epoch": 1.4748505747126437, "grad_norm": 1.0460050106048584, "learning_rate": 5.2604454260997606e-05, "loss": 1.4891, "num_input_tokens_seen": 24235264, "step": 4010, "train_runtime": 4066.005, "train_tokens_per_second": 5960.461 }, { "epoch": 1.4752183908045977, "grad_norm": 0.9604606032371521, "learning_rate": 5.256764218663722e-05, "loss": 1.4463, "num_input_tokens_seen": 24239808, "step": 4011, "train_runtime": 4066.7945, "train_tokens_per_second": 5960.421 }, { "epoch": 1.4755862068965517, "grad_norm": 0.9596603512763977, "learning_rate": 5.253083011227683e-05, "loss": 1.4025, "num_input_tokens_seen": 24246096, "step": 4012, "train_runtime": 4067.7933, "train_tokens_per_second": 5960.504 }, { "epoch": 1.4759540229885058, "grad_norm": 0.9584473967552185, "learning_rate": 5.249401803791644e-05, "loss": 1.3761, "num_input_tokens_seen": 24250160, "step": 4013, "train_runtime": 4068.4905, "train_tokens_per_second": 5960.481 }, { "epoch": 1.4763218390804598, "grad_norm": 1.0671095848083496, "learning_rate": 5.245720596355604e-05, "loss": 1.5959, "num_input_tokens_seen": 24256480, "step": 4014, "train_runtime": 4069.528, "train_tokens_per_second": 5960.514 }, { "epoch": 1.4766896551724138, "grad_norm": 0.9837397933006287, "learning_rate": 5.2420393889195664e-05, "loss": 1.5743, "num_input_tokens_seen": 24262560, "step": 4015, "train_runtime": 4070.4795, "train_tokens_per_second": 5960.615 }, { "epoch": 1.4770574712643678, "grad_norm": 0.9995848536491394, "learning_rate": 5.238358181483527e-05, "loss": 1.4061, "num_input_tokens_seen": 24267104, "step": 4016, "train_runtime": 4071.2706, "train_tokens_per_second": 5960.573 }, { "epoch": 1.4774252873563218, "grad_norm": 0.9571737051010132, "learning_rate": 5.2346769740474875e-05, "loss": 1.4699, "num_input_tokens_seen": 24274896, "step": 4017, "train_runtime": 4072.5066, "train_tokens_per_second": 5960.677 }, { "epoch": 1.4777931034482759, "grad_norm": 0.9793049693107605, "learning_rate": 5.2309957666114483e-05, "loss": 1.4763, "num_input_tokens_seen": 24280256, "step": 4018, "train_runtime": 4073.408, "train_tokens_per_second": 5960.674 }, { "epoch": 1.4781609195402299, "grad_norm": 0.876334011554718, "learning_rate": 5.22731455917541e-05, "loss": 1.4638, "num_input_tokens_seen": 24287520, "step": 4019, "train_runtime": 4074.54, "train_tokens_per_second": 5960.8 }, { "epoch": 1.478528735632184, "grad_norm": 0.9345941543579102, "learning_rate": 5.223633351739371e-05, "loss": 1.3881, "num_input_tokens_seen": 24291872, "step": 4020, "train_runtime": 4075.3064, "train_tokens_per_second": 5960.747 }, { "epoch": 1.478896551724138, "grad_norm": 0.9565058350563049, "learning_rate": 5.219952144303332e-05, "loss": 1.4838, "num_input_tokens_seen": 24297856, "step": 4021, "train_runtime": 4076.7539, "train_tokens_per_second": 5960.099 }, { "epoch": 1.479264367816092, "grad_norm": 0.6849691867828369, "learning_rate": 5.2162709368672926e-05, "loss": 1.1094, "num_input_tokens_seen": 24319344, "step": 4022, "train_runtime": 4079.7715, "train_tokens_per_second": 5960.957 }, { "epoch": 1.479632183908046, "grad_norm": 0.9383494853973389, "learning_rate": 5.212589729431254e-05, "loss": 1.3657, "num_input_tokens_seen": 24326480, "step": 4023, "train_runtime": 4080.8851, "train_tokens_per_second": 5961.079 }, { "epoch": 1.48, "grad_norm": 0.9587903022766113, "learning_rate": 5.208908521995215e-05, "loss": 1.5376, "num_input_tokens_seen": 24333040, "step": 4024, "train_runtime": 4081.9149, "train_tokens_per_second": 5961.183 }, { "epoch": 1.480367816091954, "grad_norm": 0.9399529099464417, "learning_rate": 5.205227314559176e-05, "loss": 1.3645, "num_input_tokens_seen": 24339872, "step": 4025, "train_runtime": 4082.9763, "train_tokens_per_second": 5961.306 }, { "epoch": 1.480735632183908, "grad_norm": 0.9669511318206787, "learning_rate": 5.201546107123136e-05, "loss": 1.6092, "num_input_tokens_seen": 24345856, "step": 4026, "train_runtime": 4083.9317, "train_tokens_per_second": 5961.377 }, { "epoch": 1.481103448275862, "grad_norm": 1.1014961004257202, "learning_rate": 5.197864899687097e-05, "loss": 1.557, "num_input_tokens_seen": 24353664, "step": 4027, "train_runtime": 4085.172, "train_tokens_per_second": 5961.478 }, { "epoch": 1.481471264367816, "grad_norm": 1.007810115814209, "learning_rate": 5.194183692251059e-05, "loss": 1.4677, "num_input_tokens_seen": 24359168, "step": 4028, "train_runtime": 4086.0586, "train_tokens_per_second": 5961.532 }, { "epoch": 1.48183908045977, "grad_norm": 1.085648775100708, "learning_rate": 5.1905024848150195e-05, "loss": 1.6783, "num_input_tokens_seen": 24365088, "step": 4029, "train_runtime": 4086.9885, "train_tokens_per_second": 5961.624 }, { "epoch": 1.482206896551724, "grad_norm": 1.0785069465637207, "learning_rate": 5.1868212773789804e-05, "loss": 1.6227, "num_input_tokens_seen": 24369328, "step": 4030, "train_runtime": 4087.7473, "train_tokens_per_second": 5961.554 }, { "epoch": 1.4825747126436781, "grad_norm": 1.0458329916000366, "learning_rate": 5.183140069942941e-05, "loss": 1.4058, "num_input_tokens_seen": 24374352, "step": 4031, "train_runtime": 4088.5752, "train_tokens_per_second": 5961.576 }, { "epoch": 1.4829425287356321, "grad_norm": 1.00020170211792, "learning_rate": 5.179458862506903e-05, "loss": 1.5499, "num_input_tokens_seen": 24379344, "step": 4032, "train_runtime": 4089.3924, "train_tokens_per_second": 5961.605 }, { "epoch": 1.4833103448275862, "grad_norm": 0.91293865442276, "learning_rate": 5.175777655070864e-05, "loss": 1.4224, "num_input_tokens_seen": 24385840, "step": 4033, "train_runtime": 4090.4516, "train_tokens_per_second": 5961.65 }, { "epoch": 1.4836781609195402, "grad_norm": 1.145096778869629, "learning_rate": 5.1720964476348246e-05, "loss": 1.7098, "num_input_tokens_seen": 24391520, "step": 4034, "train_runtime": 4091.4016, "train_tokens_per_second": 5961.654 }, { "epoch": 1.4840459770114942, "grad_norm": 0.781602680683136, "learning_rate": 5.168415240198785e-05, "loss": 1.2461, "num_input_tokens_seen": 24399008, "step": 4035, "train_runtime": 4092.5895, "train_tokens_per_second": 5961.753 }, { "epoch": 1.4844137931034482, "grad_norm": 1.0057408809661865, "learning_rate": 5.164734032762747e-05, "loss": 1.5055, "num_input_tokens_seen": 24404448, "step": 4036, "train_runtime": 4093.507, "train_tokens_per_second": 5961.746 }, { "epoch": 1.4847816091954023, "grad_norm": 0.9656437039375305, "learning_rate": 5.161052825326708e-05, "loss": 1.5091, "num_input_tokens_seen": 24411280, "step": 4037, "train_runtime": 4094.5885, "train_tokens_per_second": 5961.84 }, { "epoch": 1.4851494252873563, "grad_norm": 0.9602141976356506, "learning_rate": 5.157371617890668e-05, "loss": 1.3938, "num_input_tokens_seen": 24418800, "step": 4038, "train_runtime": 4095.7714, "train_tokens_per_second": 5961.954 }, { "epoch": 1.4855172413793103, "grad_norm": 0.9323406219482422, "learning_rate": 5.153690410454629e-05, "loss": 1.6365, "num_input_tokens_seen": 24424000, "step": 4039, "train_runtime": 4096.6273, "train_tokens_per_second": 5961.978 }, { "epoch": 1.4858850574712643, "grad_norm": 1.044651746749878, "learning_rate": 5.15000920301859e-05, "loss": 1.6499, "num_input_tokens_seen": 24428048, "step": 4040, "train_runtime": 4097.3468, "train_tokens_per_second": 5961.919 }, { "epoch": 1.4862528735632183, "grad_norm": 0.9557268619537354, "learning_rate": 5.1463279955825515e-05, "loss": 1.4491, "num_input_tokens_seen": 24432688, "step": 4041, "train_runtime": 4098.1433, "train_tokens_per_second": 5961.892 }, { "epoch": 1.4866206896551724, "grad_norm": 0.930274486541748, "learning_rate": 5.1426467881465124e-05, "loss": 1.4152, "num_input_tokens_seen": 24437936, "step": 4042, "train_runtime": 4099.0031, "train_tokens_per_second": 5961.922 }, { "epoch": 1.4869885057471264, "grad_norm": 0.9440920352935791, "learning_rate": 5.138965580710473e-05, "loss": 1.2971, "num_input_tokens_seen": 24443600, "step": 4043, "train_runtime": 4099.9281, "train_tokens_per_second": 5961.958 }, { "epoch": 1.4873563218390804, "grad_norm": 1.0481032133102417, "learning_rate": 5.1352843732744335e-05, "loss": 1.4669, "num_input_tokens_seen": 24448512, "step": 4044, "train_runtime": 4100.7674, "train_tokens_per_second": 5961.936 }, { "epoch": 1.4877241379310344, "grad_norm": 1.0776386260986328, "learning_rate": 5.131603165838396e-05, "loss": 1.7256, "num_input_tokens_seen": 24452720, "step": 4045, "train_runtime": 4101.5358, "train_tokens_per_second": 5961.845 }, { "epoch": 1.4880919540229884, "grad_norm": 0.9875791668891907, "learning_rate": 5.1279219584023566e-05, "loss": 1.4522, "num_input_tokens_seen": 24458512, "step": 4046, "train_runtime": 4102.4779, "train_tokens_per_second": 5961.888 }, { "epoch": 1.4884597701149425, "grad_norm": 0.948467493057251, "learning_rate": 5.124240750966317e-05, "loss": 1.3109, "num_input_tokens_seen": 24464672, "step": 4047, "train_runtime": 4103.4725, "train_tokens_per_second": 5961.944 }, { "epoch": 1.4888275862068965, "grad_norm": 1.076884388923645, "learning_rate": 5.120559543530278e-05, "loss": 1.6678, "num_input_tokens_seen": 24470768, "step": 4048, "train_runtime": 4104.4708, "train_tokens_per_second": 5961.979 }, { "epoch": 1.4891954022988505, "grad_norm": 0.9881492853164673, "learning_rate": 5.116878336094239e-05, "loss": 1.4313, "num_input_tokens_seen": 24478768, "step": 4049, "train_runtime": 4105.7322, "train_tokens_per_second": 5962.096 }, { "epoch": 1.4895632183908045, "grad_norm": 0.906985878944397, "learning_rate": 5.1131971286582e-05, "loss": 1.481, "num_input_tokens_seen": 24484000, "step": 4050, "train_runtime": 4106.5983, "train_tokens_per_second": 5962.112 }, { "epoch": 1.4899310344827585, "grad_norm": 0.8949291110038757, "learning_rate": 5.109515921222161e-05, "loss": 1.31, "num_input_tokens_seen": 24492896, "step": 4051, "train_runtime": 4108.5125, "train_tokens_per_second": 5961.5 }, { "epoch": 1.4902988505747126, "grad_norm": 1.043642282485962, "learning_rate": 5.105834713786122e-05, "loss": 1.4841, "num_input_tokens_seen": 24497888, "step": 4052, "train_runtime": 4109.3588, "train_tokens_per_second": 5961.487 }, { "epoch": 1.4906666666666666, "grad_norm": 1.0845096111297607, "learning_rate": 5.1021535063500835e-05, "loss": 1.608, "num_input_tokens_seen": 24502560, "step": 4053, "train_runtime": 4110.1501, "train_tokens_per_second": 5961.476 }, { "epoch": 1.4910344827586206, "grad_norm": 1.0524910688400269, "learning_rate": 5.0984722989140444e-05, "loss": 1.6301, "num_input_tokens_seen": 24508064, "step": 4054, "train_runtime": 4111.0458, "train_tokens_per_second": 5961.516 }, { "epoch": 1.4914022988505748, "grad_norm": 1.0239331722259521, "learning_rate": 5.094791091478005e-05, "loss": 1.5205, "num_input_tokens_seen": 24512144, "step": 4055, "train_runtime": 4111.7427, "train_tokens_per_second": 5961.498 }, { "epoch": 1.4917701149425286, "grad_norm": 0.9673982858657837, "learning_rate": 5.0911098840419655e-05, "loss": 1.5423, "num_input_tokens_seen": 24519920, "step": 4056, "train_runtime": 4112.9593, "train_tokens_per_second": 5961.625 }, { "epoch": 1.492137931034483, "grad_norm": 1.0554982423782349, "learning_rate": 5.0874286766059264e-05, "loss": 1.5934, "num_input_tokens_seen": 24525360, "step": 4057, "train_runtime": 4113.8594, "train_tokens_per_second": 5961.643 }, { "epoch": 1.4925057471264367, "grad_norm": 0.95525723695755, "learning_rate": 5.083747469169888e-05, "loss": 1.4316, "num_input_tokens_seen": 24530736, "step": 4058, "train_runtime": 4114.7572, "train_tokens_per_second": 5961.648 }, { "epoch": 1.492873563218391, "grad_norm": 0.934636116027832, "learning_rate": 5.080066261733849e-05, "loss": 1.6114, "num_input_tokens_seen": 24537056, "step": 4059, "train_runtime": 4115.7718, "train_tokens_per_second": 5961.714 }, { "epoch": 1.4932413793103447, "grad_norm": 1.023818850517273, "learning_rate": 5.07638505429781e-05, "loss": 1.5031, "num_input_tokens_seen": 24541808, "step": 4060, "train_runtime": 4116.5724, "train_tokens_per_second": 5961.709 }, { "epoch": 1.493609195402299, "grad_norm": 0.9134024381637573, "learning_rate": 5.0727038468617706e-05, "loss": 1.721, "num_input_tokens_seen": 24549264, "step": 4061, "train_runtime": 4117.7379, "train_tokens_per_second": 5961.833 }, { "epoch": 1.4939770114942528, "grad_norm": 0.988197386264801, "learning_rate": 5.069022639425732e-05, "loss": 1.475, "num_input_tokens_seen": 24554176, "step": 4062, "train_runtime": 4118.5675, "train_tokens_per_second": 5961.824 }, { "epoch": 1.494344827586207, "grad_norm": 1.0888458490371704, "learning_rate": 5.065341431989693e-05, "loss": 1.5108, "num_input_tokens_seen": 24558320, "step": 4063, "train_runtime": 4119.2937, "train_tokens_per_second": 5961.779 }, { "epoch": 1.4947126436781608, "grad_norm": 0.9004330635070801, "learning_rate": 5.061660224553654e-05, "loss": 1.5406, "num_input_tokens_seen": 24564784, "step": 4064, "train_runtime": 4120.3084, "train_tokens_per_second": 5961.88 }, { "epoch": 1.495080459770115, "grad_norm": 0.9852762222290039, "learning_rate": 5.057979017117614e-05, "loss": 1.577, "num_input_tokens_seen": 24569744, "step": 4065, "train_runtime": 4121.1456, "train_tokens_per_second": 5961.872 }, { "epoch": 1.4954482758620689, "grad_norm": 1.106040120124817, "learning_rate": 5.0542978096815764e-05, "loss": 1.6727, "num_input_tokens_seen": 24574416, "step": 4066, "train_runtime": 4121.9589, "train_tokens_per_second": 5961.829 }, { "epoch": 1.495816091954023, "grad_norm": 0.972218930721283, "learning_rate": 5.050616602245537e-05, "loss": 1.4289, "num_input_tokens_seen": 24581744, "step": 4067, "train_runtime": 4123.1106, "train_tokens_per_second": 5961.941 }, { "epoch": 1.496183908045977, "grad_norm": 0.9878373146057129, "learning_rate": 5.0469353948094975e-05, "loss": 1.6709, "num_input_tokens_seen": 24587936, "step": 4068, "train_runtime": 4124.0833, "train_tokens_per_second": 5962.037 }, { "epoch": 1.4965517241379311, "grad_norm": 0.9404173493385315, "learning_rate": 5.0432541873734584e-05, "loss": 1.522, "num_input_tokens_seen": 24593008, "step": 4069, "train_runtime": 4124.9337, "train_tokens_per_second": 5962.037 }, { "epoch": 1.496919540229885, "grad_norm": 1.0829967260360718, "learning_rate": 5.039572979937419e-05, "loss": 1.5438, "num_input_tokens_seen": 24597488, "step": 4070, "train_runtime": 4125.6955, "train_tokens_per_second": 5962.022 }, { "epoch": 1.4972873563218392, "grad_norm": 0.8731368184089661, "learning_rate": 5.035891772501381e-05, "loss": 1.3352, "num_input_tokens_seen": 24608784, "step": 4071, "train_runtime": 4127.3506, "train_tokens_per_second": 5962.368 }, { "epoch": 1.497655172413793, "grad_norm": 1.0104687213897705, "learning_rate": 5.032210565065342e-05, "loss": 1.4738, "num_input_tokens_seen": 24616208, "step": 4072, "train_runtime": 4128.5454, "train_tokens_per_second": 5962.441 }, { "epoch": 1.4980229885057472, "grad_norm": 1.0959763526916504, "learning_rate": 5.028529357629303e-05, "loss": 1.8198, "num_input_tokens_seen": 24620720, "step": 4073, "train_runtime": 4129.3171, "train_tokens_per_second": 5962.419 }, { "epoch": 1.498390804597701, "grad_norm": 0.8429267406463623, "learning_rate": 5.024848150193263e-05, "loss": 1.4432, "num_input_tokens_seen": 24628336, "step": 4074, "train_runtime": 4130.4818, "train_tokens_per_second": 5962.582 }, { "epoch": 1.4987586206896553, "grad_norm": 1.0586172342300415, "learning_rate": 5.021166942757225e-05, "loss": 1.5656, "num_input_tokens_seen": 24632240, "step": 4075, "train_runtime": 4131.1707, "train_tokens_per_second": 5962.533 }, { "epoch": 1.499126436781609, "grad_norm": 0.8929089307785034, "learning_rate": 5.017485735321186e-05, "loss": 1.4776, "num_input_tokens_seen": 24641392, "step": 4076, "train_runtime": 4132.5523, "train_tokens_per_second": 5962.754 }, { "epoch": 1.4994942528735633, "grad_norm": 1.0645390748977661, "learning_rate": 5.013804527885146e-05, "loss": 1.3586, "num_input_tokens_seen": 24649328, "step": 4077, "train_runtime": 4133.7655, "train_tokens_per_second": 5962.924 }, { "epoch": 1.499862068965517, "grad_norm": 1.0506035089492798, "learning_rate": 5.010123320449107e-05, "loss": 1.7051, "num_input_tokens_seen": 24655008, "step": 4078, "train_runtime": 4134.7006, "train_tokens_per_second": 5962.949 }, { "epoch": 1.5002298850574713, "grad_norm": 0.9689409732818604, "learning_rate": 5.006442113013069e-05, "loss": 1.4383, "num_input_tokens_seen": 24661296, "step": 4079, "train_runtime": 4135.6891, "train_tokens_per_second": 5963.044 }, { "epoch": 1.5005977011494251, "grad_norm": 0.9953100085258484, "learning_rate": 5.0027609055770296e-05, "loss": 1.619, "num_input_tokens_seen": 24666128, "step": 4080, "train_runtime": 4136.5049, "train_tokens_per_second": 5963.036 }, { "epoch": 1.5009655172413794, "grad_norm": 0.9611397981643677, "learning_rate": 4.9990796981409905e-05, "loss": 1.4576, "num_input_tokens_seen": 24671568, "step": 4081, "train_runtime": 4137.916, "train_tokens_per_second": 5962.317 }, { "epoch": 1.5013333333333332, "grad_norm": 0.9430239200592041, "learning_rate": 4.995398490704952e-05, "loss": 1.3471, "num_input_tokens_seen": 24680624, "step": 4082, "train_runtime": 4139.2854, "train_tokens_per_second": 5962.533 }, { "epoch": 1.5017011494252874, "grad_norm": 1.0238491296768188, "learning_rate": 4.991717283268912e-05, "loss": 1.7808, "num_input_tokens_seen": 24686096, "step": 4083, "train_runtime": 4140.1816, "train_tokens_per_second": 5962.564 }, { "epoch": 1.5020689655172412, "grad_norm": 0.9407117366790771, "learning_rate": 4.988036075832874e-05, "loss": 1.3638, "num_input_tokens_seen": 24691264, "step": 4084, "train_runtime": 4141.0517, "train_tokens_per_second": 5962.559 }, { "epoch": 1.5024367816091955, "grad_norm": 0.9622142910957336, "learning_rate": 4.984354868396835e-05, "loss": 1.4942, "num_input_tokens_seen": 24695904, "step": 4085, "train_runtime": 4141.8608, "train_tokens_per_second": 5962.514 }, { "epoch": 1.5028045977011493, "grad_norm": 1.085375189781189, "learning_rate": 4.980673660960795e-05, "loss": 1.7551, "num_input_tokens_seen": 24701328, "step": 4086, "train_runtime": 4142.7468, "train_tokens_per_second": 5962.548 }, { "epoch": 1.5031724137931035, "grad_norm": 0.9670528173446655, "learning_rate": 4.9769924535247565e-05, "loss": 1.3634, "num_input_tokens_seen": 24709632, "step": 4087, "train_runtime": 4144.0106, "train_tokens_per_second": 5962.734 }, { "epoch": 1.5035402298850573, "grad_norm": 1.0086263418197632, "learning_rate": 4.9733112460887174e-05, "loss": 1.5774, "num_input_tokens_seen": 24715024, "step": 4088, "train_runtime": 4144.8817, "train_tokens_per_second": 5962.782 }, { "epoch": 1.5039080459770116, "grad_norm": 0.9485494494438171, "learning_rate": 4.969630038652678e-05, "loss": 1.5046, "num_input_tokens_seen": 24721136, "step": 4089, "train_runtime": 4145.8708, "train_tokens_per_second": 5962.833 }, { "epoch": 1.5042758620689654, "grad_norm": 0.8939463496208191, "learning_rate": 4.965948831216639e-05, "loss": 1.5576, "num_input_tokens_seen": 24726976, "step": 4090, "train_runtime": 4146.8093, "train_tokens_per_second": 5962.892 }, { "epoch": 1.5046436781609196, "grad_norm": 1.0472095012664795, "learning_rate": 4.962267623780601e-05, "loss": 1.4858, "num_input_tokens_seen": 24732192, "step": 4091, "train_runtime": 4147.6751, "train_tokens_per_second": 5962.905 }, { "epoch": 1.5050114942528736, "grad_norm": 0.9629560708999634, "learning_rate": 4.958586416344561e-05, "loss": 1.5479, "num_input_tokens_seen": 24737472, "step": 4092, "train_runtime": 4148.5413, "train_tokens_per_second": 5962.933 }, { "epoch": 1.5053793103448276, "grad_norm": 1.1243983507156372, "learning_rate": 4.9549052089085225e-05, "loss": 1.7423, "num_input_tokens_seen": 24741792, "step": 4093, "train_runtime": 4149.2838, "train_tokens_per_second": 5962.907 }, { "epoch": 1.5057471264367817, "grad_norm": 0.9103943705558777, "learning_rate": 4.9512240014724834e-05, "loss": 1.5661, "num_input_tokens_seen": 24746432, "step": 4094, "train_runtime": 4150.055, "train_tokens_per_second": 5962.917 }, { "epoch": 1.5061149425287357, "grad_norm": 1.1104499101638794, "learning_rate": 4.947542794036444e-05, "loss": 1.4933, "num_input_tokens_seen": 24751216, "step": 4095, "train_runtime": 4150.8667, "train_tokens_per_second": 5962.903 }, { "epoch": 1.5064827586206897, "grad_norm": 1.0149651765823364, "learning_rate": 4.943861586600405e-05, "loss": 1.5268, "num_input_tokens_seen": 24755840, "step": 4096, "train_runtime": 4151.6817, "train_tokens_per_second": 5962.846 }, { "epoch": 1.5068505747126437, "grad_norm": 0.89632648229599, "learning_rate": 4.940180379164366e-05, "loss": 1.5609, "num_input_tokens_seen": 24763888, "step": 4097, "train_runtime": 4152.9465, "train_tokens_per_second": 5962.968 }, { "epoch": 1.5072183908045977, "grad_norm": 0.9414806365966797, "learning_rate": 4.936499171728327e-05, "loss": 1.7155, "num_input_tokens_seen": 24769216, "step": 4098, "train_runtime": 4153.8057, "train_tokens_per_second": 5963.018 }, { "epoch": 1.5075862068965518, "grad_norm": 0.9200591444969177, "learning_rate": 4.9328179642922885e-05, "loss": 1.3421, "num_input_tokens_seen": 24775600, "step": 4099, "train_runtime": 4154.8403, "train_tokens_per_second": 5963.069 }, { "epoch": 1.5079540229885058, "grad_norm": 1.033595323562622, "learning_rate": 4.9291367568562494e-05, "loss": 1.4535, "num_input_tokens_seen": 24782208, "step": 4100, "train_runtime": 4155.9004, "train_tokens_per_second": 5963.138 }, { "epoch": 1.5083218390804598, "grad_norm": 0.9664585590362549, "learning_rate": 4.9254555494202096e-05, "loss": 1.4396, "num_input_tokens_seen": 24789632, "step": 4101, "train_runtime": 4157.0715, "train_tokens_per_second": 5963.244 }, { "epoch": 1.5086896551724138, "grad_norm": 0.9104776978492737, "learning_rate": 4.921774341984171e-05, "loss": 1.4124, "num_input_tokens_seen": 24797296, "step": 4102, "train_runtime": 4158.2672, "train_tokens_per_second": 5963.372 }, { "epoch": 1.5090574712643678, "grad_norm": 0.8871594071388245, "learning_rate": 4.918093134548132e-05, "loss": 1.4965, "num_input_tokens_seen": 24804656, "step": 4103, "train_runtime": 4159.4018, "train_tokens_per_second": 5963.515 }, { "epoch": 1.5094252873563219, "grad_norm": 0.889460027217865, "learning_rate": 4.914411927112093e-05, "loss": 1.4599, "num_input_tokens_seen": 24811328, "step": 4104, "train_runtime": 4160.4737, "train_tokens_per_second": 5963.582 }, { "epoch": 1.5097931034482759, "grad_norm": 1.0685147047042847, "learning_rate": 4.910730719676054e-05, "loss": 1.6426, "num_input_tokens_seen": 24818272, "step": 4105, "train_runtime": 4161.5735, "train_tokens_per_second": 5963.675 }, { "epoch": 1.51016091954023, "grad_norm": 1.033657431602478, "learning_rate": 4.9070495122400154e-05, "loss": 1.6988, "num_input_tokens_seen": 24823200, "step": 4106, "train_runtime": 4162.4215, "train_tokens_per_second": 5963.644 }, { "epoch": 1.510528735632184, "grad_norm": 1.0012242794036865, "learning_rate": 4.9033683048039756e-05, "loss": 1.6408, "num_input_tokens_seen": 24829312, "step": 4107, "train_runtime": 4163.4148, "train_tokens_per_second": 5963.689 }, { "epoch": 1.510896551724138, "grad_norm": 1.0517055988311768, "learning_rate": 4.899687097367937e-05, "loss": 1.7441, "num_input_tokens_seen": 24834848, "step": 4108, "train_runtime": 4164.3306, "train_tokens_per_second": 5963.707 }, { "epoch": 1.511264367816092, "grad_norm": 1.0701045989990234, "learning_rate": 4.896005889931898e-05, "loss": 1.5684, "num_input_tokens_seen": 24840112, "step": 4109, "train_runtime": 4165.1928, "train_tokens_per_second": 5963.736 }, { "epoch": 1.511632183908046, "grad_norm": 0.8956212401390076, "learning_rate": 4.892324682495859e-05, "loss": 1.3929, "num_input_tokens_seen": 24846560, "step": 4110, "train_runtime": 4166.2165, "train_tokens_per_second": 5963.819 }, { "epoch": 1.512, "grad_norm": 0.8714888095855713, "learning_rate": 4.88864347505982e-05, "loss": 1.1294, "num_input_tokens_seen": 24856336, "step": 4111, "train_runtime": 4168.1964, "train_tokens_per_second": 5963.331 }, { "epoch": 1.512367816091954, "grad_norm": 0.9745454788208008, "learning_rate": 4.884962267623781e-05, "loss": 1.5583, "num_input_tokens_seen": 24860560, "step": 4112, "train_runtime": 4168.9591, "train_tokens_per_second": 5963.254 }, { "epoch": 1.512735632183908, "grad_norm": 0.9520863890647888, "learning_rate": 4.8812810601877416e-05, "loss": 1.3723, "num_input_tokens_seen": 24868544, "step": 4113, "train_runtime": 4170.1785, "train_tokens_per_second": 5963.424 }, { "epoch": 1.513103448275862, "grad_norm": 0.9671286940574646, "learning_rate": 4.877599852751703e-05, "loss": 1.6032, "num_input_tokens_seen": 24873488, "step": 4114, "train_runtime": 4171.0224, "train_tokens_per_second": 5963.403 }, { "epoch": 1.513471264367816, "grad_norm": 0.8513003587722778, "learning_rate": 4.873918645315664e-05, "loss": 1.5025, "num_input_tokens_seen": 24882528, "step": 4115, "train_runtime": 4172.3907, "train_tokens_per_second": 5963.614 }, { "epoch": 1.5138390804597701, "grad_norm": 1.0138033628463745, "learning_rate": 4.870237437879624e-05, "loss": 1.4907, "num_input_tokens_seen": 24887248, "step": 4116, "train_runtime": 4173.2136, "train_tokens_per_second": 5963.569 }, { "epoch": 1.5142068965517241, "grad_norm": 0.950100302696228, "learning_rate": 4.866556230443586e-05, "loss": 1.6034, "num_input_tokens_seen": 24892720, "step": 4117, "train_runtime": 4174.104, "train_tokens_per_second": 5963.608 }, { "epoch": 1.5145747126436782, "grad_norm": 1.117335557937622, "learning_rate": 4.862875023007547e-05, "loss": 1.688, "num_input_tokens_seen": 24897776, "step": 4118, "train_runtime": 4174.9498, "train_tokens_per_second": 5963.611 }, { "epoch": 1.5149425287356322, "grad_norm": 1.0012331008911133, "learning_rate": 4.8591938155715076e-05, "loss": 1.5859, "num_input_tokens_seen": 24902304, "step": 4119, "train_runtime": 4175.7303, "train_tokens_per_second": 5963.581 }, { "epoch": 1.5153103448275862, "grad_norm": 0.9911288022994995, "learning_rate": 4.8555126081354685e-05, "loss": 1.7102, "num_input_tokens_seen": 24907216, "step": 4120, "train_runtime": 4176.5505, "train_tokens_per_second": 5963.586 }, { "epoch": 1.5156781609195402, "grad_norm": 1.0760222673416138, "learning_rate": 4.85183140069943e-05, "loss": 1.6123, "num_input_tokens_seen": 24912816, "step": 4121, "train_runtime": 4177.4426, "train_tokens_per_second": 5963.653 }, { "epoch": 1.5160459770114942, "grad_norm": 0.9216646552085876, "learning_rate": 4.84815019326339e-05, "loss": 1.6326, "num_input_tokens_seen": 24920096, "step": 4122, "train_runtime": 4178.5865, "train_tokens_per_second": 5963.762 }, { "epoch": 1.5164137931034483, "grad_norm": 0.9923339486122131, "learning_rate": 4.844468985827352e-05, "loss": 1.4925, "num_input_tokens_seen": 24924960, "step": 4123, "train_runtime": 4179.4155, "train_tokens_per_second": 5963.743 }, { "epoch": 1.5167816091954023, "grad_norm": 1.0101779699325562, "learning_rate": 4.840787778391313e-05, "loss": 1.5584, "num_input_tokens_seen": 24929744, "step": 4124, "train_runtime": 4180.2393, "train_tokens_per_second": 5963.712 }, { "epoch": 1.5171494252873563, "grad_norm": 1.010554552078247, "learning_rate": 4.8371065709552737e-05, "loss": 1.5622, "num_input_tokens_seen": 24935744, "step": 4125, "train_runtime": 4181.2202, "train_tokens_per_second": 5963.748 }, { "epoch": 1.5175172413793103, "grad_norm": 0.9562215209007263, "learning_rate": 4.8334253635192345e-05, "loss": 1.5257, "num_input_tokens_seen": 24941504, "step": 4126, "train_runtime": 4182.1862, "train_tokens_per_second": 5963.748 }, { "epoch": 1.5178850574712643, "grad_norm": 0.8532366156578064, "learning_rate": 4.8297441560831954e-05, "loss": 1.3883, "num_input_tokens_seen": 24948640, "step": 4127, "train_runtime": 4183.3082, "train_tokens_per_second": 5963.854 }, { "epoch": 1.5182528735632184, "grad_norm": 0.9355764389038086, "learning_rate": 4.826062948647156e-05, "loss": 1.4522, "num_input_tokens_seen": 24955776, "step": 4128, "train_runtime": 4184.4569, "train_tokens_per_second": 5963.922 }, { "epoch": 1.5186206896551724, "grad_norm": 0.9794521331787109, "learning_rate": 4.822381741211118e-05, "loss": 1.5783, "num_input_tokens_seen": 24963456, "step": 4129, "train_runtime": 4185.6409, "train_tokens_per_second": 5964.07 }, { "epoch": 1.5189885057471264, "grad_norm": 0.9304761290550232, "learning_rate": 4.818700533775079e-05, "loss": 1.3663, "num_input_tokens_seen": 24969200, "step": 4130, "train_runtime": 4186.5793, "train_tokens_per_second": 5964.105 }, { "epoch": 1.5193563218390804, "grad_norm": 1.066969394683838, "learning_rate": 4.815019326339039e-05, "loss": 1.4422, "num_input_tokens_seen": 24973392, "step": 4131, "train_runtime": 4187.3061, "train_tokens_per_second": 5964.071 }, { "epoch": 1.5197241379310344, "grad_norm": 1.0843766927719116, "learning_rate": 4.8113381189030006e-05, "loss": 1.6431, "num_input_tokens_seen": 24977712, "step": 4132, "train_runtime": 4188.0839, "train_tokens_per_second": 5963.995 }, { "epoch": 1.5200919540229885, "grad_norm": 1.0205549001693726, "learning_rate": 4.8076569114669614e-05, "loss": 1.6441, "num_input_tokens_seen": 24984640, "step": 4133, "train_runtime": 4189.1809, "train_tokens_per_second": 5964.087 }, { "epoch": 1.5204597701149425, "grad_norm": 0.9489389657974243, "learning_rate": 4.803975704030922e-05, "loss": 1.5125, "num_input_tokens_seen": 24991376, "step": 4134, "train_runtime": 4190.2574, "train_tokens_per_second": 5964.163 }, { "epoch": 1.5208275862068965, "grad_norm": 1.0028316974639893, "learning_rate": 4.800294496594883e-05, "loss": 1.4758, "num_input_tokens_seen": 24998704, "step": 4135, "train_runtime": 4191.4033, "train_tokens_per_second": 5964.28 }, { "epoch": 1.5211954022988505, "grad_norm": 1.1025384664535522, "learning_rate": 4.796613289158844e-05, "loss": 1.4589, "num_input_tokens_seen": 25005824, "step": 4136, "train_runtime": 4192.5139, "train_tokens_per_second": 5964.399 }, { "epoch": 1.5215632183908046, "grad_norm": 1.0178321599960327, "learning_rate": 4.792932081722805e-05, "loss": 1.6515, "num_input_tokens_seen": 25012192, "step": 4137, "train_runtime": 4193.5443, "train_tokens_per_second": 5964.452 }, { "epoch": 1.5219310344827586, "grad_norm": 0.9515804052352905, "learning_rate": 4.7892508742867666e-05, "loss": 1.4498, "num_input_tokens_seen": 25016480, "step": 4138, "train_runtime": 4194.3014, "train_tokens_per_second": 5964.397 }, { "epoch": 1.5222988505747126, "grad_norm": 0.8750317692756653, "learning_rate": 4.7855696668507275e-05, "loss": 1.4558, "num_input_tokens_seen": 25024096, "step": 4139, "train_runtime": 4195.5012, "train_tokens_per_second": 5964.507 }, { "epoch": 1.5226666666666666, "grad_norm": 1.0486810207366943, "learning_rate": 4.7818884594146883e-05, "loss": 1.5602, "num_input_tokens_seen": 25030112, "step": 4140, "train_runtime": 4196.4868, "train_tokens_per_second": 5964.54 }, { "epoch": 1.5230344827586206, "grad_norm": 1.0021171569824219, "learning_rate": 4.778207251978649e-05, "loss": 1.6507, "num_input_tokens_seen": 25034240, "step": 4141, "train_runtime": 4197.825, "train_tokens_per_second": 5963.622 }, { "epoch": 1.5234022988505749, "grad_norm": 0.9792951345443726, "learning_rate": 4.77452604454261e-05, "loss": 1.6869, "num_input_tokens_seen": 25040016, "step": 4142, "train_runtime": 4198.7976, "train_tokens_per_second": 5963.616 }, { "epoch": 1.5237701149425287, "grad_norm": 1.01872980594635, "learning_rate": 4.770844837106571e-05, "loss": 1.5767, "num_input_tokens_seen": 25045520, "step": 4143, "train_runtime": 4199.7403, "train_tokens_per_second": 5963.588 }, { "epoch": 1.524137931034483, "grad_norm": 0.9187114238739014, "learning_rate": 4.7671636296705326e-05, "loss": 1.4714, "num_input_tokens_seen": 25050400, "step": 4144, "train_runtime": 4200.5766, "train_tokens_per_second": 5963.562 }, { "epoch": 1.5245057471264367, "grad_norm": 0.9544577598571777, "learning_rate": 4.7634824222344935e-05, "loss": 1.4923, "num_input_tokens_seen": 25057056, "step": 4145, "train_runtime": 4201.6359, "train_tokens_per_second": 5963.643 }, { "epoch": 1.524873563218391, "grad_norm": 0.9472795724868774, "learning_rate": 4.759801214798454e-05, "loss": 1.5866, "num_input_tokens_seen": 25061824, "step": 4146, "train_runtime": 4202.4383, "train_tokens_per_second": 5963.639 }, { "epoch": 1.5252413793103448, "grad_norm": 1.027949571609497, "learning_rate": 4.756120007362415e-05, "loss": 1.4579, "num_input_tokens_seen": 25068048, "step": 4147, "train_runtime": 4203.4057, "train_tokens_per_second": 5963.747 }, { "epoch": 1.525609195402299, "grad_norm": 0.9217515587806702, "learning_rate": 4.752438799926376e-05, "loss": 1.473, "num_input_tokens_seen": 25073872, "step": 4148, "train_runtime": 4204.349, "train_tokens_per_second": 5963.794 }, { "epoch": 1.5259770114942528, "grad_norm": 1.0180093050003052, "learning_rate": 4.748757592490337e-05, "loss": 1.6773, "num_input_tokens_seen": 25080192, "step": 4149, "train_runtime": 4205.356, "train_tokens_per_second": 5963.869 }, { "epoch": 1.526344827586207, "grad_norm": 0.9596949219703674, "learning_rate": 4.745076385054298e-05, "loss": 1.456, "num_input_tokens_seen": 25086128, "step": 4150, "train_runtime": 4206.3394, "train_tokens_per_second": 5963.886 }, { "epoch": 1.5267126436781608, "grad_norm": 0.9876999855041504, "learning_rate": 4.741395177618259e-05, "loss": 1.6332, "num_input_tokens_seen": 25090896, "step": 4151, "train_runtime": 4207.1435, "train_tokens_per_second": 5963.879 }, { "epoch": 1.527080459770115, "grad_norm": 1.0236774682998657, "learning_rate": 4.73771397018222e-05, "loss": 1.6292, "num_input_tokens_seen": 25095936, "step": 4152, "train_runtime": 4207.9994, "train_tokens_per_second": 5963.864 }, { "epoch": 1.5274482758620689, "grad_norm": 0.8478060960769653, "learning_rate": 4.734032762746181e-05, "loss": 1.4633, "num_input_tokens_seen": 25102512, "step": 4153, "train_runtime": 4209.0723, "train_tokens_per_second": 5963.906 }, { "epoch": 1.5278160919540231, "grad_norm": 0.9411160945892334, "learning_rate": 4.730351555310142e-05, "loss": 1.4515, "num_input_tokens_seen": 25109568, "step": 4154, "train_runtime": 4210.1801, "train_tokens_per_second": 5964.013 }, { "epoch": 1.528183908045977, "grad_norm": 1.0756803750991821, "learning_rate": 4.726670347874103e-05, "loss": 1.7328, "num_input_tokens_seen": 25115968, "step": 4155, "train_runtime": 4211.1894, "train_tokens_per_second": 5964.103 }, { "epoch": 1.5285517241379312, "grad_norm": 1.0040136575698853, "learning_rate": 4.722989140438064e-05, "loss": 1.6318, "num_input_tokens_seen": 25123168, "step": 4156, "train_runtime": 4212.3299, "train_tokens_per_second": 5964.198 }, { "epoch": 1.528919540229885, "grad_norm": 0.9725233912467957, "learning_rate": 4.719307933002025e-05, "loss": 1.5209, "num_input_tokens_seen": 25127792, "step": 4157, "train_runtime": 4213.1147, "train_tokens_per_second": 5964.184 }, { "epoch": 1.5292873563218392, "grad_norm": 0.8511664271354675, "learning_rate": 4.715626725565986e-05, "loss": 1.3947, "num_input_tokens_seen": 25135232, "step": 4158, "train_runtime": 4214.2871, "train_tokens_per_second": 5964.29 }, { "epoch": 1.529655172413793, "grad_norm": 1.1127713918685913, "learning_rate": 4.711945518129947e-05, "loss": 1.6247, "num_input_tokens_seen": 25141536, "step": 4159, "train_runtime": 4215.2878, "train_tokens_per_second": 5964.37 }, { "epoch": 1.5300229885057473, "grad_norm": 0.9434221982955933, "learning_rate": 4.708264310693908e-05, "loss": 1.5217, "num_input_tokens_seen": 25147536, "step": 4160, "train_runtime": 4216.2439, "train_tokens_per_second": 5964.441 }, { "epoch": 1.530390804597701, "grad_norm": 1.0339033603668213, "learning_rate": 4.7045831032578684e-05, "loss": 1.4969, "num_input_tokens_seen": 25152688, "step": 4161, "train_runtime": 4217.0872, "train_tokens_per_second": 5964.469 }, { "epoch": 1.5307586206896553, "grad_norm": 1.085526704788208, "learning_rate": 4.70090189582183e-05, "loss": 1.4692, "num_input_tokens_seen": 25157856, "step": 4162, "train_runtime": 4217.9258, "train_tokens_per_second": 5964.509 }, { "epoch": 1.531126436781609, "grad_norm": 1.0283817052841187, "learning_rate": 4.697220688385791e-05, "loss": 1.4176, "num_input_tokens_seen": 25163376, "step": 4163, "train_runtime": 4218.8127, "train_tokens_per_second": 5964.563 }, { "epoch": 1.5314942528735633, "grad_norm": 1.0186675786972046, "learning_rate": 4.693539480949752e-05, "loss": 1.5648, "num_input_tokens_seen": 25168752, "step": 4164, "train_runtime": 4219.7008, "train_tokens_per_second": 5964.582 }, { "epoch": 1.5318620689655171, "grad_norm": 0.9804777503013611, "learning_rate": 4.6898582735137126e-05, "loss": 1.5878, "num_input_tokens_seen": 25174736, "step": 4165, "train_runtime": 4220.6685, "train_tokens_per_second": 5964.632 }, { "epoch": 1.5322298850574714, "grad_norm": 0.9473086595535278, "learning_rate": 4.6861770660776735e-05, "loss": 1.6777, "num_input_tokens_seen": 25179776, "step": 4166, "train_runtime": 4221.5182, "train_tokens_per_second": 5964.626 }, { "epoch": 1.5325977011494252, "grad_norm": 0.9539825320243835, "learning_rate": 4.6824958586416344e-05, "loss": 1.2358, "num_input_tokens_seen": 25185168, "step": 4167, "train_runtime": 4222.4028, "train_tokens_per_second": 5964.653 }, { "epoch": 1.5329655172413794, "grad_norm": 0.9325450658798218, "learning_rate": 4.678814651205596e-05, "loss": 1.4247, "num_input_tokens_seen": 25189824, "step": 4168, "train_runtime": 4223.1948, "train_tokens_per_second": 5964.637 }, { "epoch": 1.5333333333333332, "grad_norm": 1.0673909187316895, "learning_rate": 4.675133443769557e-05, "loss": 1.3801, "num_input_tokens_seen": 25197040, "step": 4169, "train_runtime": 4224.3212, "train_tokens_per_second": 5964.755 }, { "epoch": 1.5337011494252875, "grad_norm": 1.0286864042282104, "learning_rate": 4.671452236333518e-05, "loss": 1.4338, "num_input_tokens_seen": 25202352, "step": 4170, "train_runtime": 4225.2072, "train_tokens_per_second": 5964.761 }, { "epoch": 1.5340689655172413, "grad_norm": 0.949355959892273, "learning_rate": 4.6677710288974786e-05, "loss": 1.4864, "num_input_tokens_seen": 25207040, "step": 4171, "train_runtime": 4226.5611, "train_tokens_per_second": 5963.96 }, { "epoch": 1.5344367816091955, "grad_norm": 1.077665090560913, "learning_rate": 4.6640898214614395e-05, "loss": 1.5227, "num_input_tokens_seen": 25213952, "step": 4172, "train_runtime": 4227.6524, "train_tokens_per_second": 5964.055 }, { "epoch": 1.5348045977011493, "grad_norm": 0.9799932241439819, "learning_rate": 4.6604086140254004e-05, "loss": 1.5721, "num_input_tokens_seen": 25219760, "step": 4173, "train_runtime": 4228.6, "train_tokens_per_second": 5964.092 }, { "epoch": 1.5351724137931035, "grad_norm": 1.0068010091781616, "learning_rate": 4.656727406589362e-05, "loss": 1.4747, "num_input_tokens_seen": 25226000, "step": 4174, "train_runtime": 4229.6066, "train_tokens_per_second": 5964.148 }, { "epoch": 1.5355402298850573, "grad_norm": 0.9431117177009583, "learning_rate": 4.653046199153322e-05, "loss": 1.3369, "num_input_tokens_seen": 25235328, "step": 4175, "train_runtime": 4231.0229, "train_tokens_per_second": 5964.356 }, { "epoch": 1.5359080459770116, "grad_norm": 0.9573741555213928, "learning_rate": 4.649364991717283e-05, "loss": 1.3994, "num_input_tokens_seen": 25241616, "step": 4176, "train_runtime": 4232.0425, "train_tokens_per_second": 5964.405 }, { "epoch": 1.5362758620689654, "grad_norm": 0.9425127506256104, "learning_rate": 4.6456837842812446e-05, "loss": 1.601, "num_input_tokens_seen": 25246608, "step": 4177, "train_runtime": 4232.8678, "train_tokens_per_second": 5964.422 }, { "epoch": 1.5366436781609196, "grad_norm": 0.9227352738380432, "learning_rate": 4.6420025768452055e-05, "loss": 1.5689, "num_input_tokens_seen": 25252000, "step": 4178, "train_runtime": 4233.7557, "train_tokens_per_second": 5964.444 }, { "epoch": 1.5370114942528734, "grad_norm": 1.0466983318328857, "learning_rate": 4.6383213694091664e-05, "loss": 1.6838, "num_input_tokens_seen": 25257392, "step": 4179, "train_runtime": 4234.633, "train_tokens_per_second": 5964.482 }, { "epoch": 1.5373793103448277, "grad_norm": 1.0222901105880737, "learning_rate": 4.634640161973127e-05, "loss": 1.5077, "num_input_tokens_seen": 25263824, "step": 4180, "train_runtime": 4235.6714, "train_tokens_per_second": 5964.538 }, { "epoch": 1.5377471264367815, "grad_norm": 0.9365169405937195, "learning_rate": 4.630958954537088e-05, "loss": 1.3421, "num_input_tokens_seen": 25268720, "step": 4181, "train_runtime": 4236.5145, "train_tokens_per_second": 5964.507 }, { "epoch": 1.5381149425287357, "grad_norm": 1.005853295326233, "learning_rate": 4.627277747101049e-05, "loss": 1.4659, "num_input_tokens_seen": 25274592, "step": 4182, "train_runtime": 4237.4889, "train_tokens_per_second": 5964.521 }, { "epoch": 1.5384827586206895, "grad_norm": 0.9372466206550598, "learning_rate": 4.6235965396650106e-05, "loss": 1.3908, "num_input_tokens_seen": 25282816, "step": 4183, "train_runtime": 4238.7576, "train_tokens_per_second": 5964.676 }, { "epoch": 1.5388505747126437, "grad_norm": 0.9906845092773438, "learning_rate": 4.6199153322289715e-05, "loss": 1.6273, "num_input_tokens_seen": 25287360, "step": 4184, "train_runtime": 4239.5462, "train_tokens_per_second": 5964.638 }, { "epoch": 1.5392183908045975, "grad_norm": 0.9468985795974731, "learning_rate": 4.6162341247929324e-05, "loss": 1.603, "num_input_tokens_seen": 25292432, "step": 4185, "train_runtime": 4240.4134, "train_tokens_per_second": 5964.615 }, { "epoch": 1.5395862068965518, "grad_norm": 0.9000393152236938, "learning_rate": 4.612552917356893e-05, "loss": 1.3251, "num_input_tokens_seen": 25299840, "step": 4186, "train_runtime": 4241.5485, "train_tokens_per_second": 5964.765 }, { "epoch": 1.5399540229885056, "grad_norm": 1.0468236207962036, "learning_rate": 4.608871709920854e-05, "loss": 1.5165, "num_input_tokens_seen": 25306208, "step": 4187, "train_runtime": 4242.5796, "train_tokens_per_second": 5964.816 }, { "epoch": 1.5403218390804598, "grad_norm": 0.9615391492843628, "learning_rate": 4.605190502484815e-05, "loss": 1.4022, "num_input_tokens_seen": 25313952, "step": 4188, "train_runtime": 4243.7995, "train_tokens_per_second": 5964.926 }, { "epoch": 1.5406896551724136, "grad_norm": 0.9920722842216492, "learning_rate": 4.601509295048777e-05, "loss": 1.3898, "num_input_tokens_seen": 25321264, "step": 4189, "train_runtime": 4244.9596, "train_tokens_per_second": 5965.019 }, { "epoch": 1.5410574712643679, "grad_norm": 1.0014163255691528, "learning_rate": 4.597828087612737e-05, "loss": 1.6046, "num_input_tokens_seen": 25326144, "step": 4190, "train_runtime": 4245.7742, "train_tokens_per_second": 5965.024 }, { "epoch": 1.541425287356322, "grad_norm": 1.0710721015930176, "learning_rate": 4.594146880176698e-05, "loss": 1.6376, "num_input_tokens_seen": 25331040, "step": 4191, "train_runtime": 4246.5845, "train_tokens_per_second": 5965.038 }, { "epoch": 1.541793103448276, "grad_norm": 0.9985161423683167, "learning_rate": 4.590465672740659e-05, "loss": 1.4707, "num_input_tokens_seen": 25336752, "step": 4192, "train_runtime": 4247.544, "train_tokens_per_second": 5965.036 }, { "epoch": 1.54216091954023, "grad_norm": 0.871497631072998, "learning_rate": 4.58678446530462e-05, "loss": 1.327, "num_input_tokens_seen": 25344096, "step": 4193, "train_runtime": 4248.7113, "train_tokens_per_second": 5965.125 }, { "epoch": 1.542528735632184, "grad_norm": 1.0417569875717163, "learning_rate": 4.583103257868581e-05, "loss": 1.8051, "num_input_tokens_seen": 25349008, "step": 4194, "train_runtime": 4249.5687, "train_tokens_per_second": 5965.078 }, { "epoch": 1.542896551724138, "grad_norm": 0.8819166421890259, "learning_rate": 4.579422050432542e-05, "loss": 1.3929, "num_input_tokens_seen": 25354656, "step": 4195, "train_runtime": 4250.4892, "train_tokens_per_second": 5965.115 }, { "epoch": 1.543264367816092, "grad_norm": 0.9865065217018127, "learning_rate": 4.575740842996503e-05, "loss": 1.5959, "num_input_tokens_seen": 25359984, "step": 4196, "train_runtime": 4251.367, "train_tokens_per_second": 5965.136 }, { "epoch": 1.543632183908046, "grad_norm": 1.061691403388977, "learning_rate": 4.572059635560464e-05, "loss": 1.4419, "num_input_tokens_seen": 25365984, "step": 4197, "train_runtime": 4252.3376, "train_tokens_per_second": 5965.186 }, { "epoch": 1.544, "grad_norm": 0.995140016078949, "learning_rate": 4.5683784281244253e-05, "loss": 1.692, "num_input_tokens_seen": 25371152, "step": 4198, "train_runtime": 4253.1952, "train_tokens_per_second": 5965.198 }, { "epoch": 1.544367816091954, "grad_norm": 1.0438783168792725, "learning_rate": 4.564697220688386e-05, "loss": 1.4333, "num_input_tokens_seen": 25376464, "step": 4199, "train_runtime": 4254.0914, "train_tokens_per_second": 5965.19 }, { "epoch": 1.544735632183908, "grad_norm": 1.0793952941894531, "learning_rate": 4.561016013252347e-05, "loss": 1.6111, "num_input_tokens_seen": 25381264, "step": 4200, "train_runtime": 4254.9234, "train_tokens_per_second": 5965.152 }, { "epoch": 1.545103448275862, "grad_norm": 0.8983263969421387, "learning_rate": 4.557334805816308e-05, "loss": 1.3303, "num_input_tokens_seen": 25388560, "step": 4201, "train_runtime": 4256.6089, "train_tokens_per_second": 5964.504 }, { "epoch": 1.5454712643678161, "grad_norm": 1.0643035173416138, "learning_rate": 4.553653598380269e-05, "loss": 1.8699, "num_input_tokens_seen": 25393488, "step": 4202, "train_runtime": 4257.4344, "train_tokens_per_second": 5964.505 }, { "epoch": 1.5458390804597701, "grad_norm": 1.009087324142456, "learning_rate": 4.54997239094423e-05, "loss": 1.4647, "num_input_tokens_seen": 25398352, "step": 4203, "train_runtime": 4258.266, "train_tokens_per_second": 5964.482 }, { "epoch": 1.5462068965517242, "grad_norm": 1.0162410736083984, "learning_rate": 4.5462911835081914e-05, "loss": 1.5835, "num_input_tokens_seen": 25402864, "step": 4204, "train_runtime": 4259.0376, "train_tokens_per_second": 5964.461 }, { "epoch": 1.5465747126436782, "grad_norm": 0.8939027786254883, "learning_rate": 4.5426099760721516e-05, "loss": 1.4868, "num_input_tokens_seen": 25409664, "step": 4205, "train_runtime": 4260.1181, "train_tokens_per_second": 5964.544 }, { "epoch": 1.5469425287356322, "grad_norm": 0.9433472752571106, "learning_rate": 4.5389287686361125e-05, "loss": 1.4043, "num_input_tokens_seen": 25415472, "step": 4206, "train_runtime": 4261.0676, "train_tokens_per_second": 5964.578 }, { "epoch": 1.5473103448275862, "grad_norm": 1.017948865890503, "learning_rate": 4.535247561200074e-05, "loss": 1.6007, "num_input_tokens_seen": 25422096, "step": 4207, "train_runtime": 4262.1359, "train_tokens_per_second": 5964.638 }, { "epoch": 1.5476781609195402, "grad_norm": 1.0156141519546509, "learning_rate": 4.531566353764035e-05, "loss": 1.4328, "num_input_tokens_seen": 25429008, "step": 4208, "train_runtime": 4263.2514, "train_tokens_per_second": 5964.698 }, { "epoch": 1.5480459770114943, "grad_norm": 1.0091875791549683, "learning_rate": 4.527885146327996e-05, "loss": 1.5701, "num_input_tokens_seen": 25433552, "step": 4209, "train_runtime": 4264.0407, "train_tokens_per_second": 5964.66 }, { "epoch": 1.5484137931034483, "grad_norm": 1.064543604850769, "learning_rate": 4.524203938891957e-05, "loss": 1.5772, "num_input_tokens_seen": 25438416, "step": 4210, "train_runtime": 4264.8918, "train_tokens_per_second": 5964.61 }, { "epoch": 1.5487816091954023, "grad_norm": 0.87115079164505, "learning_rate": 4.5205227314559176e-05, "loss": 1.4506, "num_input_tokens_seen": 25445584, "step": 4211, "train_runtime": 4266.028, "train_tokens_per_second": 5964.702 }, { "epoch": 1.5491494252873563, "grad_norm": 1.1344107389450073, "learning_rate": 4.5168415240198785e-05, "loss": 1.6297, "num_input_tokens_seen": 25453632, "step": 4212, "train_runtime": 4267.2692, "train_tokens_per_second": 5964.853 }, { "epoch": 1.5495172413793104, "grad_norm": 1.004704475402832, "learning_rate": 4.51316031658384e-05, "loss": 1.598, "num_input_tokens_seen": 25459328, "step": 4213, "train_runtime": 4268.207, "train_tokens_per_second": 5964.877 }, { "epoch": 1.5498850574712644, "grad_norm": 0.9495462775230408, "learning_rate": 4.5094791091478e-05, "loss": 1.4677, "num_input_tokens_seen": 25466512, "step": 4214, "train_runtime": 4269.3573, "train_tokens_per_second": 5964.952 }, { "epoch": 1.5502528735632184, "grad_norm": 1.073548674583435, "learning_rate": 4.505797901711762e-05, "loss": 1.6857, "num_input_tokens_seen": 25471200, "step": 4215, "train_runtime": 4270.1647, "train_tokens_per_second": 5964.922 }, { "epoch": 1.5506206896551724, "grad_norm": 0.9707559943199158, "learning_rate": 4.502116694275723e-05, "loss": 1.3454, "num_input_tokens_seen": 25478144, "step": 4216, "train_runtime": 4271.2747, "train_tokens_per_second": 5964.998 }, { "epoch": 1.5509885057471264, "grad_norm": 0.9022209644317627, "learning_rate": 4.4984354868396836e-05, "loss": 1.3278, "num_input_tokens_seen": 25482480, "step": 4217, "train_runtime": 4272.03, "train_tokens_per_second": 5964.958 }, { "epoch": 1.5513563218390805, "grad_norm": 0.9404050707817078, "learning_rate": 4.4947542794036445e-05, "loss": 1.5802, "num_input_tokens_seen": 25487120, "step": 4218, "train_runtime": 4272.8469, "train_tokens_per_second": 5964.904 }, { "epoch": 1.5517241379310345, "grad_norm": 1.0079388618469238, "learning_rate": 4.491073071967606e-05, "loss": 1.6163, "num_input_tokens_seen": 25491840, "step": 4219, "train_runtime": 4273.669, "train_tokens_per_second": 5964.861 }, { "epoch": 1.5520919540229885, "grad_norm": 0.9895066022872925, "learning_rate": 4.487391864531566e-05, "loss": 1.4185, "num_input_tokens_seen": 25500432, "step": 4220, "train_runtime": 4274.984, "train_tokens_per_second": 5965.036 }, { "epoch": 1.5524597701149425, "grad_norm": 0.8870865702629089, "learning_rate": 4.483710657095527e-05, "loss": 1.4676, "num_input_tokens_seen": 25505568, "step": 4221, "train_runtime": 4275.8602, "train_tokens_per_second": 5965.015 }, { "epoch": 1.5528275862068965, "grad_norm": 0.9963148832321167, "learning_rate": 4.480029449659489e-05, "loss": 1.5035, "num_input_tokens_seen": 25512480, "step": 4222, "train_runtime": 4276.9646, "train_tokens_per_second": 5965.09 }, { "epoch": 1.5531954022988506, "grad_norm": 1.0009320974349976, "learning_rate": 4.4763482422234496e-05, "loss": 1.4106, "num_input_tokens_seen": 25517120, "step": 4223, "train_runtime": 4277.7604, "train_tokens_per_second": 5965.065 }, { "epoch": 1.5535632183908046, "grad_norm": 0.9632704257965088, "learning_rate": 4.4726670347874105e-05, "loss": 1.513, "num_input_tokens_seen": 25522368, "step": 4224, "train_runtime": 4278.6413, "train_tokens_per_second": 5965.064 }, { "epoch": 1.5539310344827586, "grad_norm": 0.9824567437171936, "learning_rate": 4.4689858273513714e-05, "loss": 1.609, "num_input_tokens_seen": 25529312, "step": 4225, "train_runtime": 4279.6985, "train_tokens_per_second": 5965.213 }, { "epoch": 1.5542988505747126, "grad_norm": 0.9744192361831665, "learning_rate": 4.465304619915332e-05, "loss": 1.4286, "num_input_tokens_seen": 25534416, "step": 4226, "train_runtime": 4280.5279, "train_tokens_per_second": 5965.249 }, { "epoch": 1.5546666666666666, "grad_norm": 0.9338300824165344, "learning_rate": 4.461623412479293e-05, "loss": 1.246, "num_input_tokens_seen": 25541056, "step": 4227, "train_runtime": 4281.5844, "train_tokens_per_second": 5965.328 }, { "epoch": 1.5550344827586207, "grad_norm": 0.9846093058586121, "learning_rate": 4.457942205043255e-05, "loss": 1.5499, "num_input_tokens_seen": 25546512, "step": 4228, "train_runtime": 4282.4988, "train_tokens_per_second": 5965.329 }, { "epoch": 1.5554022988505747, "grad_norm": 1.0264620780944824, "learning_rate": 4.454260997607215e-05, "loss": 1.5117, "num_input_tokens_seen": 25553536, "step": 4229, "train_runtime": 4283.6258, "train_tokens_per_second": 5965.399 }, { "epoch": 1.5557701149425287, "grad_norm": 0.9882364273071289, "learning_rate": 4.4505797901711765e-05, "loss": 1.4894, "num_input_tokens_seen": 25559968, "step": 4230, "train_runtime": 4284.6592, "train_tokens_per_second": 5965.461 }, { "epoch": 1.5561379310344827, "grad_norm": 0.9190003275871277, "learning_rate": 4.4468985827351374e-05, "loss": 1.5542, "num_input_tokens_seen": 25566528, "step": 4231, "train_runtime": 4286.2509, "train_tokens_per_second": 5964.776 }, { "epoch": 1.5565057471264367, "grad_norm": 1.0381605625152588, "learning_rate": 4.443217375299098e-05, "loss": 1.5309, "num_input_tokens_seen": 25570944, "step": 4232, "train_runtime": 4287.0307, "train_tokens_per_second": 5964.721 }, { "epoch": 1.5568735632183908, "grad_norm": 0.8768330812454224, "learning_rate": 4.439536167863059e-05, "loss": 1.4222, "num_input_tokens_seen": 25578896, "step": 4233, "train_runtime": 4288.2464, "train_tokens_per_second": 5964.885 }, { "epoch": 1.5572413793103448, "grad_norm": 0.9919173121452332, "learning_rate": 4.435854960427021e-05, "loss": 1.7583, "num_input_tokens_seen": 25584544, "step": 4234, "train_runtime": 4289.1658, "train_tokens_per_second": 5964.923 }, { "epoch": 1.5576091954022988, "grad_norm": 1.0327153205871582, "learning_rate": 4.432173752990981e-05, "loss": 1.8772, "num_input_tokens_seen": 25590336, "step": 4235, "train_runtime": 4290.1098, "train_tokens_per_second": 5964.961 }, { "epoch": 1.5579770114942528, "grad_norm": 0.9097049832344055, "learning_rate": 4.428492545554942e-05, "loss": 1.496, "num_input_tokens_seen": 25595232, "step": 4236, "train_runtime": 4290.95, "train_tokens_per_second": 5964.934 }, { "epoch": 1.5583448275862068, "grad_norm": 0.9581717252731323, "learning_rate": 4.4248113381189034e-05, "loss": 1.6014, "num_input_tokens_seen": 25600032, "step": 4237, "train_runtime": 4291.7589, "train_tokens_per_second": 5964.928 }, { "epoch": 1.5587126436781609, "grad_norm": 1.0112465620040894, "learning_rate": 4.421130130682864e-05, "loss": 1.64, "num_input_tokens_seen": 25607088, "step": 4238, "train_runtime": 4292.9047, "train_tokens_per_second": 5964.979 }, { "epoch": 1.559080459770115, "grad_norm": 1.033936619758606, "learning_rate": 4.417448923246825e-05, "loss": 1.6785, "num_input_tokens_seen": 25612768, "step": 4239, "train_runtime": 4293.8363, "train_tokens_per_second": 5965.008 }, { "epoch": 1.559448275862069, "grad_norm": 1.0251233577728271, "learning_rate": 4.413767715810786e-05, "loss": 1.6126, "num_input_tokens_seen": 25617856, "step": 4240, "train_runtime": 4294.6895, "train_tokens_per_second": 5965.008 }, { "epoch": 1.5598160919540232, "grad_norm": 0.9828919768333435, "learning_rate": 4.410086508374747e-05, "loss": 1.5709, "num_input_tokens_seen": 25626496, "step": 4241, "train_runtime": 4296.0255, "train_tokens_per_second": 5965.164 }, { "epoch": 1.560183908045977, "grad_norm": 0.9944127202033997, "learning_rate": 4.406405300938708e-05, "loss": 1.6536, "num_input_tokens_seen": 25633008, "step": 4242, "train_runtime": 4297.0788, "train_tokens_per_second": 5965.217 }, { "epoch": 1.5605517241379312, "grad_norm": 0.9649595618247986, "learning_rate": 4.4027240935026694e-05, "loss": 1.5619, "num_input_tokens_seen": 25639280, "step": 4243, "train_runtime": 4298.0853, "train_tokens_per_second": 5965.279 }, { "epoch": 1.560919540229885, "grad_norm": 0.9769201278686523, "learning_rate": 4.3990428860666296e-05, "loss": 1.6019, "num_input_tokens_seen": 25644464, "step": 4244, "train_runtime": 4298.985, "train_tokens_per_second": 5965.237 }, { "epoch": 1.5612873563218392, "grad_norm": 0.988795280456543, "learning_rate": 4.395361678630591e-05, "loss": 1.5341, "num_input_tokens_seen": 25653104, "step": 4245, "train_runtime": 4300.3246, "train_tokens_per_second": 5965.388 }, { "epoch": 1.561655172413793, "grad_norm": 0.9538114070892334, "learning_rate": 4.391680471194552e-05, "loss": 1.4543, "num_input_tokens_seen": 25658112, "step": 4246, "train_runtime": 4301.1773, "train_tokens_per_second": 5965.37 }, { "epoch": 1.5620229885057473, "grad_norm": 0.9469668865203857, "learning_rate": 4.387999263758513e-05, "loss": 1.5033, "num_input_tokens_seen": 25664080, "step": 4247, "train_runtime": 4302.1476, "train_tokens_per_second": 5965.411 }, { "epoch": 1.562390804597701, "grad_norm": 1.0212516784667969, "learning_rate": 4.384318056322474e-05, "loss": 1.5974, "num_input_tokens_seen": 25670224, "step": 4248, "train_runtime": 4303.1535, "train_tokens_per_second": 5965.445 }, { "epoch": 1.5627586206896553, "grad_norm": 0.9424988627433777, "learning_rate": 4.3806368488864354e-05, "loss": 1.4809, "num_input_tokens_seen": 25674640, "step": 4249, "train_runtime": 4303.9045, "train_tokens_per_second": 5965.43 }, { "epoch": 1.5631264367816091, "grad_norm": 1.0168170928955078, "learning_rate": 4.3769556414503956e-05, "loss": 1.3401, "num_input_tokens_seen": 25680512, "step": 4250, "train_runtime": 4304.8691, "train_tokens_per_second": 5965.457 }, { "epoch": 1.5634942528735634, "grad_norm": 1.0160890817642212, "learning_rate": 4.3732744340143565e-05, "loss": 1.437, "num_input_tokens_seen": 25686464, "step": 4251, "train_runtime": 4305.8784, "train_tokens_per_second": 5965.441 }, { "epoch": 1.5638620689655172, "grad_norm": 0.8786030411720276, "learning_rate": 4.369593226578318e-05, "loss": 1.4234, "num_input_tokens_seen": 25691472, "step": 4252, "train_runtime": 4306.7413, "train_tokens_per_second": 5965.409 }, { "epoch": 1.5642298850574714, "grad_norm": 0.9332633018493652, "learning_rate": 4.365912019142278e-05, "loss": 1.4067, "num_input_tokens_seen": 25696992, "step": 4253, "train_runtime": 4307.6637, "train_tokens_per_second": 5965.413 }, { "epoch": 1.5645977011494252, "grad_norm": 0.9453607797622681, "learning_rate": 4.36223081170624e-05, "loss": 1.4662, "num_input_tokens_seen": 25702944, "step": 4254, "train_runtime": 4308.6278, "train_tokens_per_second": 5965.459 }, { "epoch": 1.5649655172413794, "grad_norm": 0.9211291670799255, "learning_rate": 4.358549604270201e-05, "loss": 1.5416, "num_input_tokens_seen": 25707792, "step": 4255, "train_runtime": 4309.4616, "train_tokens_per_second": 5965.43 }, { "epoch": 1.5653333333333332, "grad_norm": 0.9791601896286011, "learning_rate": 4.354868396834162e-05, "loss": 1.3551, "num_input_tokens_seen": 25715904, "step": 4256, "train_runtime": 4310.7334, "train_tokens_per_second": 5965.552 }, { "epoch": 1.5657011494252875, "grad_norm": 0.8566781878471375, "learning_rate": 4.3511871893981226e-05, "loss": 1.5358, "num_input_tokens_seen": 25722720, "step": 4257, "train_runtime": 4311.8114, "train_tokens_per_second": 5965.641 }, { "epoch": 1.5660689655172413, "grad_norm": 1.0267621278762817, "learning_rate": 4.347505981962084e-05, "loss": 1.4572, "num_input_tokens_seen": 25727872, "step": 4258, "train_runtime": 4312.6577, "train_tokens_per_second": 5965.665 }, { "epoch": 1.5664367816091955, "grad_norm": 1.033227562904358, "learning_rate": 4.343824774526044e-05, "loss": 1.6288, "num_input_tokens_seen": 25734224, "step": 4259, "train_runtime": 4313.693, "train_tokens_per_second": 5965.706 }, { "epoch": 1.5668045977011493, "grad_norm": 0.9439014792442322, "learning_rate": 4.340143567090006e-05, "loss": 1.339, "num_input_tokens_seen": 25741552, "step": 4260, "train_runtime": 4314.8433, "train_tokens_per_second": 5965.814 }, { "epoch": 1.5671724137931036, "grad_norm": 1.0122768878936768, "learning_rate": 4.336462359653967e-05, "loss": 1.4836, "num_input_tokens_seen": 25746400, "step": 4261, "train_runtime": 4316.1658, "train_tokens_per_second": 5965.109 }, { "epoch": 1.5675402298850574, "grad_norm": 0.8594652414321899, "learning_rate": 4.332781152217928e-05, "loss": 1.2932, "num_input_tokens_seen": 25758032, "step": 4262, "train_runtime": 4317.8807, "train_tokens_per_second": 5965.434 }, { "epoch": 1.5679080459770116, "grad_norm": 1.067428469657898, "learning_rate": 4.3290999447818886e-05, "loss": 1.7333, "num_input_tokens_seen": 25763504, "step": 4263, "train_runtime": 4318.7712, "train_tokens_per_second": 5965.471 }, { "epoch": 1.5682758620689654, "grad_norm": 0.9325382113456726, "learning_rate": 4.32541873734585e-05, "loss": 1.463, "num_input_tokens_seen": 25769344, "step": 4264, "train_runtime": 4319.7442, "train_tokens_per_second": 5965.479 }, { "epoch": 1.5686436781609197, "grad_norm": 1.0096169710159302, "learning_rate": 4.3217375299098103e-05, "loss": 1.5472, "num_input_tokens_seen": 25774464, "step": 4265, "train_runtime": 4320.6261, "train_tokens_per_second": 5965.447 }, { "epoch": 1.5690114942528735, "grad_norm": 1.001533031463623, "learning_rate": 4.318056322473771e-05, "loss": 1.453, "num_input_tokens_seen": 25780464, "step": 4266, "train_runtime": 4321.592, "train_tokens_per_second": 5965.502 }, { "epoch": 1.5693793103448277, "grad_norm": 1.0608218908309937, "learning_rate": 4.314375115037733e-05, "loss": 1.6735, "num_input_tokens_seen": 25787728, "step": 4267, "train_runtime": 4322.7169, "train_tokens_per_second": 5965.63 }, { "epoch": 1.5697471264367815, "grad_norm": 0.9219775795936584, "learning_rate": 4.310693907601693e-05, "loss": 1.483, "num_input_tokens_seen": 25794048, "step": 4268, "train_runtime": 4323.7428, "train_tokens_per_second": 5965.676 }, { "epoch": 1.5701149425287357, "grad_norm": 1.0273150205612183, "learning_rate": 4.3070127001656546e-05, "loss": 1.543, "num_input_tokens_seen": 25802944, "step": 4269, "train_runtime": 4325.1424, "train_tokens_per_second": 5965.802 }, { "epoch": 1.5704827586206895, "grad_norm": 0.9345740079879761, "learning_rate": 4.3033314927296155e-05, "loss": 1.4351, "num_input_tokens_seen": 25807984, "step": 4270, "train_runtime": 4326.0009, "train_tokens_per_second": 5965.783 }, { "epoch": 1.5708505747126438, "grad_norm": 1.0006455183029175, "learning_rate": 4.2996502852935764e-05, "loss": 1.7909, "num_input_tokens_seen": 25813376, "step": 4271, "train_runtime": 4326.8726, "train_tokens_per_second": 5965.828 }, { "epoch": 1.5712183908045976, "grad_norm": 0.9771626591682434, "learning_rate": 4.295969077857537e-05, "loss": 1.4778, "num_input_tokens_seen": 25818656, "step": 4272, "train_runtime": 4327.756, "train_tokens_per_second": 5965.83 }, { "epoch": 1.5715862068965518, "grad_norm": 1.0043179988861084, "learning_rate": 4.292287870421499e-05, "loss": 1.7215, "num_input_tokens_seen": 25823616, "step": 4273, "train_runtime": 4328.5939, "train_tokens_per_second": 5965.821 }, { "epoch": 1.5719540229885056, "grad_norm": 0.9097915887832642, "learning_rate": 4.288606662985459e-05, "loss": 1.4548, "num_input_tokens_seen": 25828752, "step": 4274, "train_runtime": 4329.4571, "train_tokens_per_second": 5965.818 }, { "epoch": 1.5723218390804599, "grad_norm": 0.9500516653060913, "learning_rate": 4.2849254555494206e-05, "loss": 1.4368, "num_input_tokens_seen": 25837152, "step": 4275, "train_runtime": 4330.76, "train_tokens_per_second": 5965.963 }, { "epoch": 1.5726896551724137, "grad_norm": 1.1244925260543823, "learning_rate": 4.2812442481133815e-05, "loss": 1.515, "num_input_tokens_seen": 25843536, "step": 4276, "train_runtime": 4331.7862, "train_tokens_per_second": 5966.023 }, { "epoch": 1.573057471264368, "grad_norm": 1.040409803390503, "learning_rate": 4.2775630406773424e-05, "loss": 1.452, "num_input_tokens_seen": 25849664, "step": 4277, "train_runtime": 4332.7847, "train_tokens_per_second": 5966.062 }, { "epoch": 1.5734252873563217, "grad_norm": 0.8676648736000061, "learning_rate": 4.273881833241303e-05, "loss": 1.3851, "num_input_tokens_seen": 25856576, "step": 4278, "train_runtime": 4333.874, "train_tokens_per_second": 5966.158 }, { "epoch": 1.573793103448276, "grad_norm": 1.0687546730041504, "learning_rate": 4.270200625805265e-05, "loss": 1.7076, "num_input_tokens_seen": 25861776, "step": 4279, "train_runtime": 4334.7414, "train_tokens_per_second": 5966.163 }, { "epoch": 1.5741609195402297, "grad_norm": 0.9815601110458374, "learning_rate": 4.266519418369225e-05, "loss": 1.5391, "num_input_tokens_seen": 25866592, "step": 4280, "train_runtime": 4335.5616, "train_tokens_per_second": 5966.146 }, { "epoch": 1.574528735632184, "grad_norm": 1.0182512998580933, "learning_rate": 4.262838210933186e-05, "loss": 1.5775, "num_input_tokens_seen": 25871296, "step": 4281, "train_runtime": 4336.3506, "train_tokens_per_second": 5966.145 }, { "epoch": 1.5748965517241378, "grad_norm": 0.8868687152862549, "learning_rate": 4.2591570034971475e-05, "loss": 1.5942, "num_input_tokens_seen": 25876944, "step": 4282, "train_runtime": 4337.2856, "train_tokens_per_second": 5966.161 }, { "epoch": 1.575264367816092, "grad_norm": 0.9742661714553833, "learning_rate": 4.255475796061108e-05, "loss": 1.3796, "num_input_tokens_seen": 25883456, "step": 4283, "train_runtime": 4338.3362, "train_tokens_per_second": 5966.217 }, { "epoch": 1.5756321839080458, "grad_norm": 0.7727472186088562, "learning_rate": 4.251794588625069e-05, "loss": 1.2235, "num_input_tokens_seen": 25896320, "step": 4284, "train_runtime": 4340.2435, "train_tokens_per_second": 5966.559 }, { "epoch": 1.576, "grad_norm": 0.965480625629425, "learning_rate": 4.24811338118903e-05, "loss": 1.4692, "num_input_tokens_seen": 25901920, "step": 4285, "train_runtime": 4341.1553, "train_tokens_per_second": 5966.596 }, { "epoch": 1.5763678160919539, "grad_norm": 0.9831876754760742, "learning_rate": 4.244432173752991e-05, "loss": 1.5166, "num_input_tokens_seen": 25907888, "step": 4286, "train_runtime": 4342.1182, "train_tokens_per_second": 5966.647 }, { "epoch": 1.576735632183908, "grad_norm": 1.0034735202789307, "learning_rate": 4.240750966316952e-05, "loss": 1.4433, "num_input_tokens_seen": 25913952, "step": 4287, "train_runtime": 4343.0958, "train_tokens_per_second": 5966.701 }, { "epoch": 1.577103448275862, "grad_norm": 1.0129915475845337, "learning_rate": 4.2370697588809135e-05, "loss": 1.8215, "num_input_tokens_seen": 25918448, "step": 4288, "train_runtime": 4343.8725, "train_tokens_per_second": 5966.669 }, { "epoch": 1.5774712643678162, "grad_norm": 1.0383774042129517, "learning_rate": 4.233388551444874e-05, "loss": 1.4937, "num_input_tokens_seen": 25926240, "step": 4289, "train_runtime": 4345.0854, "train_tokens_per_second": 5966.796 }, { "epoch": 1.57783908045977, "grad_norm": 0.9382445812225342, "learning_rate": 4.229707344008835e-05, "loss": 1.4022, "num_input_tokens_seen": 25933040, "step": 4290, "train_runtime": 4346.1712, "train_tokens_per_second": 5966.87 }, { "epoch": 1.5782068965517242, "grad_norm": 0.9903818964958191, "learning_rate": 4.226026136572796e-05, "loss": 1.5088, "num_input_tokens_seen": 25939168, "step": 4291, "train_runtime": 4347.6853, "train_tokens_per_second": 5966.202 }, { "epoch": 1.5785747126436782, "grad_norm": 1.0315245389938354, "learning_rate": 4.222344929136757e-05, "loss": 1.6216, "num_input_tokens_seen": 25949840, "step": 4292, "train_runtime": 4349.293, "train_tokens_per_second": 5966.45 }, { "epoch": 1.5789425287356322, "grad_norm": 0.9897589087486267, "learning_rate": 4.218663721700718e-05, "loss": 1.5035, "num_input_tokens_seen": 25954160, "step": 4293, "train_runtime": 4350.0654, "train_tokens_per_second": 5966.384 }, { "epoch": 1.5793103448275863, "grad_norm": 0.9769780039787292, "learning_rate": 4.2149825142646795e-05, "loss": 1.4296, "num_input_tokens_seen": 25960448, "step": 4294, "train_runtime": 4351.068, "train_tokens_per_second": 5966.454 }, { "epoch": 1.5796781609195403, "grad_norm": 0.9172228574752808, "learning_rate": 4.21130130682864e-05, "loss": 1.6009, "num_input_tokens_seen": 25966768, "step": 4295, "train_runtime": 4352.0773, "train_tokens_per_second": 5966.523 }, { "epoch": 1.5800459770114943, "grad_norm": 1.1289092302322388, "learning_rate": 4.2076200993926006e-05, "loss": 1.8916, "num_input_tokens_seen": 25972256, "step": 4296, "train_runtime": 4352.9901, "train_tokens_per_second": 5966.532 }, { "epoch": 1.5804137931034483, "grad_norm": 0.957542359828949, "learning_rate": 4.203938891956562e-05, "loss": 1.4331, "num_input_tokens_seen": 25978112, "step": 4297, "train_runtime": 4353.9408, "train_tokens_per_second": 5966.574 }, { "epoch": 1.5807816091954023, "grad_norm": 0.9918944239616394, "learning_rate": 4.2002576845205224e-05, "loss": 1.407, "num_input_tokens_seen": 25984496, "step": 4298, "train_runtime": 4354.9649, "train_tokens_per_second": 5966.637 }, { "epoch": 1.5811494252873564, "grad_norm": 0.9517878293991089, "learning_rate": 4.196576477084484e-05, "loss": 1.5335, "num_input_tokens_seen": 25989456, "step": 4299, "train_runtime": 4355.7986, "train_tokens_per_second": 5966.634 }, { "epoch": 1.5815172413793104, "grad_norm": 0.9874196648597717, "learning_rate": 4.192895269648445e-05, "loss": 1.6057, "num_input_tokens_seen": 25994224, "step": 4300, "train_runtime": 4356.6078, "train_tokens_per_second": 5966.62 }, { "epoch": 1.5818850574712644, "grad_norm": 0.8222333788871765, "learning_rate": 4.189214062212406e-05, "loss": 1.3939, "num_input_tokens_seen": 26008416, "step": 4301, "train_runtime": 4358.6572, "train_tokens_per_second": 5967.071 }, { "epoch": 1.5822528735632184, "grad_norm": 0.9964632987976074, "learning_rate": 4.1855328547763666e-05, "loss": 1.3196, "num_input_tokens_seen": 26013424, "step": 4302, "train_runtime": 4359.4984, "train_tokens_per_second": 5967.068 }, { "epoch": 1.5826206896551724, "grad_norm": 0.9242708683013916, "learning_rate": 4.181851647340328e-05, "loss": 1.4558, "num_input_tokens_seen": 26018000, "step": 4303, "train_runtime": 4360.2835, "train_tokens_per_second": 5967.043 }, { "epoch": 1.5829885057471265, "grad_norm": 1.0612273216247559, "learning_rate": 4.1781704399042884e-05, "loss": 1.4975, "num_input_tokens_seen": 26023120, "step": 4304, "train_runtime": 4361.1436, "train_tokens_per_second": 5967.04 }, { "epoch": 1.5833563218390805, "grad_norm": 0.9777734279632568, "learning_rate": 4.17448923246825e-05, "loss": 1.5889, "num_input_tokens_seen": 26029648, "step": 4305, "train_runtime": 4362.1909, "train_tokens_per_second": 5967.104 }, { "epoch": 1.5837241379310345, "grad_norm": 0.9828711152076721, "learning_rate": 4.170808025032211e-05, "loss": 1.5231, "num_input_tokens_seen": 26038448, "step": 4306, "train_runtime": 4363.5325, "train_tokens_per_second": 5967.286 }, { "epoch": 1.5840919540229885, "grad_norm": 0.9952308535575867, "learning_rate": 4.167126817596172e-05, "loss": 1.6852, "num_input_tokens_seen": 26044128, "step": 4307, "train_runtime": 4364.4738, "train_tokens_per_second": 5967.301 }, { "epoch": 1.5844597701149425, "grad_norm": 0.88361656665802, "learning_rate": 4.1634456101601326e-05, "loss": 1.4891, "num_input_tokens_seen": 26051328, "step": 4308, "train_runtime": 4365.6289, "train_tokens_per_second": 5967.371 }, { "epoch": 1.5848275862068966, "grad_norm": 0.9838547706604004, "learning_rate": 4.159764402724094e-05, "loss": 1.5035, "num_input_tokens_seen": 26056832, "step": 4309, "train_runtime": 4366.542, "train_tokens_per_second": 5967.384 }, { "epoch": 1.5851954022988506, "grad_norm": 0.992989182472229, "learning_rate": 4.1560831952880544e-05, "loss": 1.6844, "num_input_tokens_seen": 26061696, "step": 4310, "train_runtime": 4367.3527, "train_tokens_per_second": 5967.39 }, { "epoch": 1.5855632183908046, "grad_norm": 0.8714199662208557, "learning_rate": 4.152401987852015e-05, "loss": 1.454, "num_input_tokens_seen": 26067264, "step": 4311, "train_runtime": 4368.3079, "train_tokens_per_second": 5967.36 }, { "epoch": 1.5859310344827586, "grad_norm": 0.8716127276420593, "learning_rate": 4.148720780415977e-05, "loss": 1.5206, "num_input_tokens_seen": 26075472, "step": 4312, "train_runtime": 4369.5835, "train_tokens_per_second": 5967.496 }, { "epoch": 1.5862988505747126, "grad_norm": 0.8958300352096558, "learning_rate": 4.145039572979937e-05, "loss": 1.2265, "num_input_tokens_seen": 26080688, "step": 4313, "train_runtime": 4370.462, "train_tokens_per_second": 5967.49 }, { "epoch": 1.5866666666666667, "grad_norm": 0.9490132331848145, "learning_rate": 4.1413583655438987e-05, "loss": 1.3134, "num_input_tokens_seen": 26085712, "step": 4314, "train_runtime": 4371.3159, "train_tokens_per_second": 5967.474 }, { "epoch": 1.5870344827586207, "grad_norm": 0.9401388168334961, "learning_rate": 4.1376771581078595e-05, "loss": 1.4178, "num_input_tokens_seen": 26092368, "step": 4315, "train_runtime": 4372.3947, "train_tokens_per_second": 5967.523 }, { "epoch": 1.5874022988505747, "grad_norm": 0.8958325386047363, "learning_rate": 4.1339959506718204e-05, "loss": 1.3569, "num_input_tokens_seen": 26099904, "step": 4316, "train_runtime": 4373.5888, "train_tokens_per_second": 5967.617 }, { "epoch": 1.5877701149425287, "grad_norm": 0.9853538274765015, "learning_rate": 4.130314743235781e-05, "loss": 1.5538, "num_input_tokens_seen": 26104656, "step": 4317, "train_runtime": 4374.4115, "train_tokens_per_second": 5967.581 }, { "epoch": 1.5881379310344828, "grad_norm": 0.9488229155540466, "learning_rate": 4.126633535799743e-05, "loss": 1.4395, "num_input_tokens_seen": 26111120, "step": 4318, "train_runtime": 4375.4668, "train_tokens_per_second": 5967.619 }, { "epoch": 1.5885057471264368, "grad_norm": 1.0154321193695068, "learning_rate": 4.122952328363703e-05, "loss": 1.5689, "num_input_tokens_seen": 26116320, "step": 4319, "train_runtime": 4376.3522, "train_tokens_per_second": 5967.6 }, { "epoch": 1.5888735632183908, "grad_norm": 1.0700663328170776, "learning_rate": 4.119271120927665e-05, "loss": 1.7247, "num_input_tokens_seen": 26121520, "step": 4320, "train_runtime": 4377.2232, "train_tokens_per_second": 5967.601 }, { "epoch": 1.5892413793103448, "grad_norm": 0.9283444881439209, "learning_rate": 4.1155899134916256e-05, "loss": 1.3292, "num_input_tokens_seen": 26128608, "step": 4321, "train_runtime": 4378.8542, "train_tokens_per_second": 5966.997 }, { "epoch": 1.5896091954022988, "grad_norm": 1.0338287353515625, "learning_rate": 4.1119087060555864e-05, "loss": 1.5759, "num_input_tokens_seen": 26134784, "step": 4322, "train_runtime": 4379.8632, "train_tokens_per_second": 5967.032 }, { "epoch": 1.5899770114942529, "grad_norm": 0.9672470092773438, "learning_rate": 4.108227498619547e-05, "loss": 1.5717, "num_input_tokens_seen": 26139024, "step": 4323, "train_runtime": 4380.6215, "train_tokens_per_second": 5966.967 }, { "epoch": 1.5903448275862069, "grad_norm": 0.9788838028907776, "learning_rate": 4.104546291183509e-05, "loss": 1.3699, "num_input_tokens_seen": 26144496, "step": 4324, "train_runtime": 4381.5088, "train_tokens_per_second": 5967.008 }, { "epoch": 1.590712643678161, "grad_norm": 0.9931208491325378, "learning_rate": 4.100865083747469e-05, "loss": 1.5796, "num_input_tokens_seen": 26151552, "step": 4325, "train_runtime": 4382.622, "train_tokens_per_second": 5967.102 }, { "epoch": 1.591080459770115, "grad_norm": 1.1408939361572266, "learning_rate": 4.09718387631143e-05, "loss": 1.6329, "num_input_tokens_seen": 26158528, "step": 4326, "train_runtime": 4383.756, "train_tokens_per_second": 5967.15 }, { "epoch": 1.591448275862069, "grad_norm": 1.0218188762664795, "learning_rate": 4.0935026688753916e-05, "loss": 1.539, "num_input_tokens_seen": 26163248, "step": 4327, "train_runtime": 4384.5794, "train_tokens_per_second": 5967.106 }, { "epoch": 1.591816091954023, "grad_norm": 0.9635866284370422, "learning_rate": 4.089821461439352e-05, "loss": 1.4762, "num_input_tokens_seen": 26168000, "step": 4328, "train_runtime": 4385.3741, "train_tokens_per_second": 5967.108 }, { "epoch": 1.592183908045977, "grad_norm": 0.9733908772468567, "learning_rate": 4.0861402540033134e-05, "loss": 1.4928, "num_input_tokens_seen": 26172752, "step": 4329, "train_runtime": 4386.182, "train_tokens_per_second": 5967.092 }, { "epoch": 1.592551724137931, "grad_norm": 0.98436439037323, "learning_rate": 4.082459046567274e-05, "loss": 1.5519, "num_input_tokens_seen": 26177696, "step": 4330, "train_runtime": 4387.0449, "train_tokens_per_second": 5967.045 }, { "epoch": 1.592919540229885, "grad_norm": 1.0157173871994019, "learning_rate": 4.078777839131235e-05, "loss": 1.638, "num_input_tokens_seen": 26184416, "step": 4331, "train_runtime": 4388.1043, "train_tokens_per_second": 5967.136 }, { "epoch": 1.593287356321839, "grad_norm": 1.0790306329727173, "learning_rate": 4.075096631695196e-05, "loss": 1.4374, "num_input_tokens_seen": 26191984, "step": 4332, "train_runtime": 4389.295, "train_tokens_per_second": 5967.242 }, { "epoch": 1.593655172413793, "grad_norm": 0.8191881775856018, "learning_rate": 4.0714154242591576e-05, "loss": 1.3121, "num_input_tokens_seen": 26201536, "step": 4333, "train_runtime": 4390.744, "train_tokens_per_second": 5967.448 }, { "epoch": 1.594022988505747, "grad_norm": 0.9245478510856628, "learning_rate": 4.067734216823118e-05, "loss": 1.3724, "num_input_tokens_seen": 26205680, "step": 4334, "train_runtime": 4391.4851, "train_tokens_per_second": 5967.384 }, { "epoch": 1.594390804597701, "grad_norm": 1.0320152044296265, "learning_rate": 4.0640530093870794e-05, "loss": 1.6407, "num_input_tokens_seen": 26210688, "step": 4335, "train_runtime": 4392.3413, "train_tokens_per_second": 5967.361 }, { "epoch": 1.5947586206896551, "grad_norm": 0.9842714667320251, "learning_rate": 4.06037180195104e-05, "loss": 1.5017, "num_input_tokens_seen": 26216512, "step": 4336, "train_runtime": 4393.309, "train_tokens_per_second": 5967.373 }, { "epoch": 1.5951264367816091, "grad_norm": 0.9979831576347351, "learning_rate": 4.056690594515001e-05, "loss": 1.4886, "num_input_tokens_seen": 26222208, "step": 4337, "train_runtime": 4394.2404, "train_tokens_per_second": 5967.404 }, { "epoch": 1.5954942528735632, "grad_norm": 1.0059894323349, "learning_rate": 4.053009387078962e-05, "loss": 1.4552, "num_input_tokens_seen": 26228032, "step": 4338, "train_runtime": 4395.1846, "train_tokens_per_second": 5967.447 }, { "epoch": 1.5958620689655172, "grad_norm": 1.0417289733886719, "learning_rate": 4.0493281796429236e-05, "loss": 1.5313, "num_input_tokens_seen": 26232816, "step": 4339, "train_runtime": 4395.9948, "train_tokens_per_second": 5967.436 }, { "epoch": 1.5962298850574712, "grad_norm": 1.0718395709991455, "learning_rate": 4.045646972206884e-05, "loss": 1.5523, "num_input_tokens_seen": 26237952, "step": 4340, "train_runtime": 4396.8543, "train_tokens_per_second": 5967.437 }, { "epoch": 1.5965977011494252, "grad_norm": 1.0831660032272339, "learning_rate": 4.041965764770845e-05, "loss": 1.5731, "num_input_tokens_seen": 26243200, "step": 4341, "train_runtime": 4397.7618, "train_tokens_per_second": 5967.399 }, { "epoch": 1.5969655172413795, "grad_norm": 1.0683315992355347, "learning_rate": 4.038284557334806e-05, "loss": 1.3889, "num_input_tokens_seen": 26250416, "step": 4342, "train_runtime": 4398.9218, "train_tokens_per_second": 5967.466 }, { "epoch": 1.5973333333333333, "grad_norm": 0.9711940884590149, "learning_rate": 4.0346033498987665e-05, "loss": 1.4773, "num_input_tokens_seen": 26255104, "step": 4343, "train_runtime": 4399.7449, "train_tokens_per_second": 5967.415 }, { "epoch": 1.5977011494252875, "grad_norm": 1.040043830871582, "learning_rate": 4.030922142462728e-05, "loss": 1.4573, "num_input_tokens_seen": 26262064, "step": 4344, "train_runtime": 4400.8555, "train_tokens_per_second": 5967.491 }, { "epoch": 1.5980689655172413, "grad_norm": 0.9906898140907288, "learning_rate": 4.027240935026689e-05, "loss": 1.5405, "num_input_tokens_seen": 26269952, "step": 4345, "train_runtime": 4402.0723, "train_tokens_per_second": 5967.633 }, { "epoch": 1.5984367816091956, "grad_norm": 0.9680057168006897, "learning_rate": 4.02355972759065e-05, "loss": 1.5904, "num_input_tokens_seen": 26274912, "step": 4346, "train_runtime": 4402.9058, "train_tokens_per_second": 5967.63 }, { "epoch": 1.5988045977011494, "grad_norm": 0.9311021566390991, "learning_rate": 4.019878520154611e-05, "loss": 1.4334, "num_input_tokens_seen": 26280448, "step": 4347, "train_runtime": 4403.861, "train_tokens_per_second": 5967.592 }, { "epoch": 1.5991724137931036, "grad_norm": 1.0014636516571045, "learning_rate": 4.016197312718572e-05, "loss": 1.5175, "num_input_tokens_seen": 26288048, "step": 4348, "train_runtime": 4405.0279, "train_tokens_per_second": 5967.737 }, { "epoch": 1.5995402298850574, "grad_norm": 0.8882377743721008, "learning_rate": 4.0125161052825325e-05, "loss": 1.4356, "num_input_tokens_seen": 26294880, "step": 4349, "train_runtime": 4406.1179, "train_tokens_per_second": 5967.811 }, { "epoch": 1.5999080459770116, "grad_norm": 1.0775160789489746, "learning_rate": 4.008834897846494e-05, "loss": 1.6759, "num_input_tokens_seen": 26300256, "step": 4350, "train_runtime": 4407.019, "train_tokens_per_second": 5967.811 }, { "epoch": 1.6002758620689654, "grad_norm": 1.0069363117218018, "learning_rate": 4.005153690410455e-05, "loss": 1.486, "num_input_tokens_seen": 26305344, "step": 4351, "train_runtime": 4408.368, "train_tokens_per_second": 5967.139 }, { "epoch": 1.6006436781609197, "grad_norm": 1.0245729684829712, "learning_rate": 4.001472482974416e-05, "loss": 1.4882, "num_input_tokens_seen": 26310064, "step": 4352, "train_runtime": 4409.1846, "train_tokens_per_second": 5967.104 }, { "epoch": 1.6006436781609197, "eval_loss": 1.755459189414978, "eval_runtime": 4.7855, "eval_samples_per_second": 208.966, "eval_steps_per_second": 13.165, "num_input_tokens_seen": 26310064, "step": 4352 }, { "epoch": 1.6010114942528735, "grad_norm": 1.0545986890792847, "learning_rate": 3.997791275538377e-05, "loss": 1.4745, "num_input_tokens_seen": 26315584, "step": 4353, "train_runtime": 4414.9009, "train_tokens_per_second": 5960.628 }, { "epoch": 1.6013793103448277, "grad_norm": 1.0666497945785522, "learning_rate": 3.994110068102338e-05, "loss": 1.6229, "num_input_tokens_seen": 26320656, "step": 4354, "train_runtime": 4415.7601, "train_tokens_per_second": 5960.617 }, { "epoch": 1.6017471264367815, "grad_norm": 1.0167460441589355, "learning_rate": 3.9904288606662985e-05, "loss": 1.4698, "num_input_tokens_seen": 26326384, "step": 4355, "train_runtime": 4416.6835, "train_tokens_per_second": 5960.668 }, { "epoch": 1.6021149425287358, "grad_norm": 1.0352330207824707, "learning_rate": 3.9867476532302594e-05, "loss": 1.564, "num_input_tokens_seen": 26332000, "step": 4356, "train_runtime": 4417.6168, "train_tokens_per_second": 5960.68 }, { "epoch": 1.6024827586206896, "grad_norm": 0.9572430849075317, "learning_rate": 3.983066445794221e-05, "loss": 1.5439, "num_input_tokens_seen": 26339232, "step": 4357, "train_runtime": 4418.7487, "train_tokens_per_second": 5960.79 }, { "epoch": 1.6028505747126438, "grad_norm": 1.1000181436538696, "learning_rate": 3.979385238358181e-05, "loss": 1.5571, "num_input_tokens_seen": 26349952, "step": 4358, "train_runtime": 4420.3504, "train_tokens_per_second": 5961.055 }, { "epoch": 1.6032183908045976, "grad_norm": 1.0398907661437988, "learning_rate": 3.975704030922143e-05, "loss": 1.5054, "num_input_tokens_seen": 26357280, "step": 4359, "train_runtime": 4421.5014, "train_tokens_per_second": 5961.161 }, { "epoch": 1.6035862068965518, "grad_norm": 1.129089593887329, "learning_rate": 3.9720228234861036e-05, "loss": 1.7235, "num_input_tokens_seen": 26361408, "step": 4360, "train_runtime": 4422.2285, "train_tokens_per_second": 5961.114 }, { "epoch": 1.6039540229885056, "grad_norm": 0.9978166818618774, "learning_rate": 3.9683416160500645e-05, "loss": 1.3892, "num_input_tokens_seen": 26367840, "step": 4361, "train_runtime": 4423.2869, "train_tokens_per_second": 5961.142 }, { "epoch": 1.6043218390804599, "grad_norm": 1.0726642608642578, "learning_rate": 3.9646604086140254e-05, "loss": 1.5379, "num_input_tokens_seen": 26373296, "step": 4362, "train_runtime": 4424.1787, "train_tokens_per_second": 5961.173 }, { "epoch": 1.6046896551724137, "grad_norm": 1.0192846059799194, "learning_rate": 3.960979201177987e-05, "loss": 1.4906, "num_input_tokens_seen": 26378176, "step": 4363, "train_runtime": 4424.9928, "train_tokens_per_second": 5961.179 }, { "epoch": 1.605057471264368, "grad_norm": 0.9348970055580139, "learning_rate": 3.957297993741947e-05, "loss": 1.4609, "num_input_tokens_seen": 26384576, "step": 4364, "train_runtime": 4425.9962, "train_tokens_per_second": 5961.274 }, { "epoch": 1.6054252873563217, "grad_norm": 0.99070805311203, "learning_rate": 3.953616786305909e-05, "loss": 1.4948, "num_input_tokens_seen": 26389632, "step": 4365, "train_runtime": 4426.8532, "train_tokens_per_second": 5961.262 }, { "epoch": 1.605793103448276, "grad_norm": 1.0859571695327759, "learning_rate": 3.9499355788698696e-05, "loss": 1.5446, "num_input_tokens_seen": 26394400, "step": 4366, "train_runtime": 4427.6819, "train_tokens_per_second": 5961.223 }, { "epoch": 1.6061609195402298, "grad_norm": 1.0329722166061401, "learning_rate": 3.9462543714338305e-05, "loss": 1.6001, "num_input_tokens_seen": 26398832, "step": 4367, "train_runtime": 4428.4557, "train_tokens_per_second": 5961.182 }, { "epoch": 1.606528735632184, "grad_norm": 1.043910026550293, "learning_rate": 3.9425731639977914e-05, "loss": 1.4536, "num_input_tokens_seen": 26404128, "step": 4368, "train_runtime": 4429.3586, "train_tokens_per_second": 5961.163 }, { "epoch": 1.6068965517241378, "grad_norm": 0.9209439754486084, "learning_rate": 3.938891956561753e-05, "loss": 1.6301, "num_input_tokens_seen": 26410192, "step": 4369, "train_runtime": 4430.3523, "train_tokens_per_second": 5961.195 }, { "epoch": 1.607264367816092, "grad_norm": 1.0413321256637573, "learning_rate": 3.935210749125713e-05, "loss": 1.564, "num_input_tokens_seen": 26417152, "step": 4370, "train_runtime": 4431.4692, "train_tokens_per_second": 5961.263 }, { "epoch": 1.6076321839080459, "grad_norm": 0.9783403277397156, "learning_rate": 3.931529541689674e-05, "loss": 1.2865, "num_input_tokens_seen": 26423168, "step": 4371, "train_runtime": 4432.4636, "train_tokens_per_second": 5961.283 }, { "epoch": 1.608, "grad_norm": 1.0528738498687744, "learning_rate": 3.9278483342536357e-05, "loss": 1.5607, "num_input_tokens_seen": 26430544, "step": 4372, "train_runtime": 4433.6012, "train_tokens_per_second": 5961.417 }, { "epoch": 1.608367816091954, "grad_norm": 0.9902295470237732, "learning_rate": 3.924167126817596e-05, "loss": 1.4594, "num_input_tokens_seen": 26434800, "step": 4373, "train_runtime": 4434.3693, "train_tokens_per_second": 5961.344 }, { "epoch": 1.6087356321839081, "grad_norm": 0.9916370511054993, "learning_rate": 3.9204859193815574e-05, "loss": 1.4159, "num_input_tokens_seen": 26439504, "step": 4374, "train_runtime": 4435.1964, "train_tokens_per_second": 5961.293 }, { "epoch": 1.609103448275862, "grad_norm": 0.9547199606895447, "learning_rate": 3.916804711945518e-05, "loss": 1.5048, "num_input_tokens_seen": 26445376, "step": 4375, "train_runtime": 4436.1658, "train_tokens_per_second": 5961.314 }, { "epoch": 1.6094712643678162, "grad_norm": 1.04433274269104, "learning_rate": 3.913123504509479e-05, "loss": 1.5698, "num_input_tokens_seen": 26451664, "step": 4376, "train_runtime": 4437.177, "train_tokens_per_second": 5961.372 }, { "epoch": 1.60983908045977, "grad_norm": 1.0016043186187744, "learning_rate": 3.90944229707344e-05, "loss": 1.4724, "num_input_tokens_seen": 26457664, "step": 4377, "train_runtime": 4438.1569, "train_tokens_per_second": 5961.408 }, { "epoch": 1.6102068965517242, "grad_norm": 0.9706348180770874, "learning_rate": 3.905761089637402e-05, "loss": 1.5244, "num_input_tokens_seen": 26462336, "step": 4378, "train_runtime": 4438.9356, "train_tokens_per_second": 5961.415 }, { "epoch": 1.610574712643678, "grad_norm": 0.967286229133606, "learning_rate": 3.902079882201362e-05, "loss": 1.5636, "num_input_tokens_seen": 26467328, "step": 4379, "train_runtime": 4439.7835, "train_tokens_per_second": 5961.401 }, { "epoch": 1.6109425287356323, "grad_norm": 1.0006687641143799, "learning_rate": 3.8983986747653234e-05, "loss": 1.4439, "num_input_tokens_seen": 26472336, "step": 4380, "train_runtime": 4440.6076, "train_tokens_per_second": 5961.422 }, { "epoch": 1.611310344827586, "grad_norm": 0.9450172781944275, "learning_rate": 3.894717467329284e-05, "loss": 1.4469, "num_input_tokens_seen": 26477408, "step": 4381, "train_runtime": 4442.0079, "train_tokens_per_second": 5960.685 }, { "epoch": 1.6116781609195403, "grad_norm": 0.9812448024749756, "learning_rate": 3.891036259893245e-05, "loss": 1.5535, "num_input_tokens_seen": 26482336, "step": 4382, "train_runtime": 4442.853, "train_tokens_per_second": 5960.66 }, { "epoch": 1.612045977011494, "grad_norm": 1.051989197731018, "learning_rate": 3.887355052457206e-05, "loss": 1.3843, "num_input_tokens_seen": 26487920, "step": 4383, "train_runtime": 4443.7582, "train_tokens_per_second": 5960.702 }, { "epoch": 1.6124137931034483, "grad_norm": 1.1212756633758545, "learning_rate": 3.883673845021168e-05, "loss": 1.6682, "num_input_tokens_seen": 26493056, "step": 4384, "train_runtime": 4444.6101, "train_tokens_per_second": 5960.715 }, { "epoch": 1.6127816091954021, "grad_norm": 0.9472477436065674, "learning_rate": 3.879992637585128e-05, "loss": 1.5529, "num_input_tokens_seen": 26499776, "step": 4385, "train_runtime": 4445.6682, "train_tokens_per_second": 5960.808 }, { "epoch": 1.6131494252873564, "grad_norm": 0.9102217555046082, "learning_rate": 3.876311430149089e-05, "loss": 1.4751, "num_input_tokens_seen": 26509616, "step": 4386, "train_runtime": 4447.1771, "train_tokens_per_second": 5960.998 }, { "epoch": 1.6135172413793102, "grad_norm": 1.003507375717163, "learning_rate": 3.8726302227130503e-05, "loss": 1.2815, "num_input_tokens_seen": 26516128, "step": 4387, "train_runtime": 4448.2193, "train_tokens_per_second": 5961.066 }, { "epoch": 1.6138850574712644, "grad_norm": 0.974827229976654, "learning_rate": 3.8689490152770106e-05, "loss": 1.4255, "num_input_tokens_seen": 26522032, "step": 4388, "train_runtime": 4449.1929, "train_tokens_per_second": 5961.088 }, { "epoch": 1.6142528735632182, "grad_norm": 1.0163264274597168, "learning_rate": 3.865267807840972e-05, "loss": 1.5271, "num_input_tokens_seen": 26528032, "step": 4389, "train_runtime": 4450.1648, "train_tokens_per_second": 5961.135 }, { "epoch": 1.6146206896551725, "grad_norm": 0.9294977784156799, "learning_rate": 3.861586600404933e-05, "loss": 1.3502, "num_input_tokens_seen": 26533104, "step": 4390, "train_runtime": 4451.0193, "train_tokens_per_second": 5961.13 }, { "epoch": 1.6149885057471265, "grad_norm": 1.1055110692977905, "learning_rate": 3.857905392968894e-05, "loss": 1.3525, "num_input_tokens_seen": 26539488, "step": 4391, "train_runtime": 4452.0468, "train_tokens_per_second": 5961.188 }, { "epoch": 1.6153563218390805, "grad_norm": 1.035902500152588, "learning_rate": 3.854224185532855e-05, "loss": 1.401, "num_input_tokens_seen": 26545024, "step": 4392, "train_runtime": 4452.9484, "train_tokens_per_second": 5961.224 }, { "epoch": 1.6157241379310345, "grad_norm": 0.9403799772262573, "learning_rate": 3.8505429780968164e-05, "loss": 1.412, "num_input_tokens_seen": 26551744, "step": 4393, "train_runtime": 4454.0344, "train_tokens_per_second": 5961.279 }, { "epoch": 1.6160919540229886, "grad_norm": 1.0154902935028076, "learning_rate": 3.8468617706607766e-05, "loss": 1.5268, "num_input_tokens_seen": 26556768, "step": 4394, "train_runtime": 4454.8986, "train_tokens_per_second": 5961.251 }, { "epoch": 1.6164597701149426, "grad_norm": 0.8746429085731506, "learning_rate": 3.843180563224738e-05, "loss": 1.4239, "num_input_tokens_seen": 26563600, "step": 4395, "train_runtime": 4456.0022, "train_tokens_per_second": 5961.308 }, { "epoch": 1.6168275862068966, "grad_norm": 0.9715175032615662, "learning_rate": 3.839499355788699e-05, "loss": 1.5218, "num_input_tokens_seen": 26568880, "step": 4396, "train_runtime": 4456.8982, "train_tokens_per_second": 5961.294 }, { "epoch": 1.6171954022988506, "grad_norm": 0.9170100688934326, "learning_rate": 3.83581814835266e-05, "loss": 1.4938, "num_input_tokens_seen": 26576752, "step": 4397, "train_runtime": 4458.1607, "train_tokens_per_second": 5961.371 }, { "epoch": 1.6175632183908046, "grad_norm": 0.9837867617607117, "learning_rate": 3.832136940916621e-05, "loss": 1.5362, "num_input_tokens_seen": 26583680, "step": 4398, "train_runtime": 4459.2703, "train_tokens_per_second": 5961.442 }, { "epoch": 1.6179310344827587, "grad_norm": 1.02565336227417, "learning_rate": 3.8284557334805824e-05, "loss": 1.5985, "num_input_tokens_seen": 26589088, "step": 4399, "train_runtime": 4460.1741, "train_tokens_per_second": 5961.446 }, { "epoch": 1.6182988505747127, "grad_norm": 0.9038709998130798, "learning_rate": 3.8247745260445426e-05, "loss": 1.3906, "num_input_tokens_seen": 26596448, "step": 4400, "train_runtime": 4461.3159, "train_tokens_per_second": 5961.57 }, { "epoch": 1.6186666666666667, "grad_norm": 0.9837738871574402, "learning_rate": 3.8210933186085035e-05, "loss": 1.5132, "num_input_tokens_seen": 26603360, "step": 4401, "train_runtime": 4462.4194, "train_tokens_per_second": 5961.645 }, { "epoch": 1.6190344827586207, "grad_norm": 1.008815050125122, "learning_rate": 3.817412111172465e-05, "loss": 1.6265, "num_input_tokens_seen": 26608272, "step": 4402, "train_runtime": 4463.2544, "train_tokens_per_second": 5961.63 }, { "epoch": 1.6194022988505747, "grad_norm": 0.9824703335762024, "learning_rate": 3.813730903736425e-05, "loss": 1.5987, "num_input_tokens_seen": 26613584, "step": 4403, "train_runtime": 4464.121, "train_tokens_per_second": 5961.663 }, { "epoch": 1.6197701149425288, "grad_norm": 0.9766114950180054, "learning_rate": 3.810049696300387e-05, "loss": 1.5593, "num_input_tokens_seen": 26621856, "step": 4404, "train_runtime": 4465.3987, "train_tokens_per_second": 5961.809 }, { "epoch": 1.6201379310344828, "grad_norm": 0.9039485454559326, "learning_rate": 3.806368488864348e-05, "loss": 1.3344, "num_input_tokens_seen": 26628944, "step": 4405, "train_runtime": 4466.5147, "train_tokens_per_second": 5961.907 }, { "epoch": 1.6205057471264368, "grad_norm": 0.9576097726821899, "learning_rate": 3.8026872814283086e-05, "loss": 1.5583, "num_input_tokens_seen": 26635552, "step": 4406, "train_runtime": 4467.5474, "train_tokens_per_second": 5962.008 }, { "epoch": 1.6208735632183908, "grad_norm": 0.9713906645774841, "learning_rate": 3.7990060739922695e-05, "loss": 1.3574, "num_input_tokens_seen": 26645104, "step": 4407, "train_runtime": 4468.9825, "train_tokens_per_second": 5962.231 }, { "epoch": 1.6212413793103448, "grad_norm": 0.9580845236778259, "learning_rate": 3.795324866556231e-05, "loss": 1.69, "num_input_tokens_seen": 26650544, "step": 4408, "train_runtime": 4469.8951, "train_tokens_per_second": 5962.23 }, { "epoch": 1.6216091954022989, "grad_norm": 1.071306824684143, "learning_rate": 3.791643659120191e-05, "loss": 1.7586, "num_input_tokens_seen": 26655168, "step": 4409, "train_runtime": 4470.6849, "train_tokens_per_second": 5962.211 }, { "epoch": 1.6219770114942529, "grad_norm": 0.9921271204948425, "learning_rate": 3.787962451684153e-05, "loss": 1.4606, "num_input_tokens_seen": 26661200, "step": 4410, "train_runtime": 4471.6953, "train_tokens_per_second": 5962.213 }, { "epoch": 1.622344827586207, "grad_norm": 0.8845428228378296, "learning_rate": 3.784281244248114e-05, "loss": 1.405, "num_input_tokens_seen": 26665904, "step": 4411, "train_runtime": 4473.0522, "train_tokens_per_second": 5961.456 }, { "epoch": 1.622712643678161, "grad_norm": 1.1096715927124023, "learning_rate": 3.7806000368120746e-05, "loss": 1.7312, "num_input_tokens_seen": 26672224, "step": 4412, "train_runtime": 4474.0865, "train_tokens_per_second": 5961.49 }, { "epoch": 1.623080459770115, "grad_norm": 0.9747064709663391, "learning_rate": 3.7769188293760355e-05, "loss": 1.4633, "num_input_tokens_seen": 26677312, "step": 4413, "train_runtime": 4474.9548, "train_tokens_per_second": 5961.471 }, { "epoch": 1.623448275862069, "grad_norm": 1.0329118967056274, "learning_rate": 3.773237621939997e-05, "loss": 1.4654, "num_input_tokens_seen": 26682768, "step": 4414, "train_runtime": 4475.8597, "train_tokens_per_second": 5961.484 }, { "epoch": 1.623816091954023, "grad_norm": 1.0991086959838867, "learning_rate": 3.769556414503957e-05, "loss": 1.6239, "num_input_tokens_seen": 26688336, "step": 4415, "train_runtime": 4476.7963, "train_tokens_per_second": 5961.481 }, { "epoch": 1.624183908045977, "grad_norm": 0.9764090776443481, "learning_rate": 3.765875207067918e-05, "loss": 1.4923, "num_input_tokens_seen": 26693968, "step": 4416, "train_runtime": 4477.7572, "train_tokens_per_second": 5961.459 }, { "epoch": 1.624551724137931, "grad_norm": 0.9504784941673279, "learning_rate": 3.76219399963188e-05, "loss": 1.3885, "num_input_tokens_seen": 26699808, "step": 4417, "train_runtime": 4478.7185, "train_tokens_per_second": 5961.484 }, { "epoch": 1.624919540229885, "grad_norm": 1.0261403322219849, "learning_rate": 3.75851279219584e-05, "loss": 1.626, "num_input_tokens_seen": 26705376, "step": 4418, "train_runtime": 4479.6485, "train_tokens_per_second": 5961.489 }, { "epoch": 1.625287356321839, "grad_norm": 0.905576765537262, "learning_rate": 3.7548315847598015e-05, "loss": 1.3979, "num_input_tokens_seen": 26713312, "step": 4419, "train_runtime": 4480.8761, "train_tokens_per_second": 5961.627 }, { "epoch": 1.625655172413793, "grad_norm": 0.9249241352081299, "learning_rate": 3.7511503773237624e-05, "loss": 1.4806, "num_input_tokens_seen": 26719728, "step": 4420, "train_runtime": 4481.8908, "train_tokens_per_second": 5961.709 }, { "epoch": 1.6260229885057471, "grad_norm": 0.9380692839622498, "learning_rate": 3.747469169887723e-05, "loss": 1.3959, "num_input_tokens_seen": 26725760, "step": 4421, "train_runtime": 4482.8828, "train_tokens_per_second": 5961.735 }, { "epoch": 1.6263908045977011, "grad_norm": 0.9099374413490295, "learning_rate": 3.743787962451684e-05, "loss": 1.3663, "num_input_tokens_seen": 26732608, "step": 4422, "train_runtime": 4483.9632, "train_tokens_per_second": 5961.826 }, { "epoch": 1.6267586206896552, "grad_norm": 1.0278503894805908, "learning_rate": 3.740106755015646e-05, "loss": 1.5807, "num_input_tokens_seen": 26737728, "step": 4423, "train_runtime": 4484.8464, "train_tokens_per_second": 5961.794 }, { "epoch": 1.6271264367816092, "grad_norm": 0.9729159474372864, "learning_rate": 3.736425547579606e-05, "loss": 1.3266, "num_input_tokens_seen": 26744544, "step": 4424, "train_runtime": 4485.9447, "train_tokens_per_second": 5961.853 }, { "epoch": 1.6274942528735632, "grad_norm": 1.0604205131530762, "learning_rate": 3.7327443401435675e-05, "loss": 1.6733, "num_input_tokens_seen": 26750528, "step": 4425, "train_runtime": 4486.9039, "train_tokens_per_second": 5961.912 }, { "epoch": 1.6278620689655172, "grad_norm": 1.0183029174804688, "learning_rate": 3.7290631327075284e-05, "loss": 1.5815, "num_input_tokens_seen": 26756368, "step": 4426, "train_runtime": 4487.845, "train_tokens_per_second": 5961.963 }, { "epoch": 1.6282298850574712, "grad_norm": 0.9771733283996582, "learning_rate": 3.725381925271489e-05, "loss": 1.5414, "num_input_tokens_seen": 26761904, "step": 4427, "train_runtime": 4488.7939, "train_tokens_per_second": 5961.936 }, { "epoch": 1.6285977011494253, "grad_norm": 1.031917929649353, "learning_rate": 3.72170071783545e-05, "loss": 1.5621, "num_input_tokens_seen": 26768304, "step": 4428, "train_runtime": 4489.8412, "train_tokens_per_second": 5961.971 }, { "epoch": 1.6289655172413793, "grad_norm": 0.8578279614448547, "learning_rate": 3.718019510399412e-05, "loss": 1.3516, "num_input_tokens_seen": 26778048, "step": 4429, "train_runtime": 4491.3178, "train_tokens_per_second": 5962.181 }, { "epoch": 1.6293333333333333, "grad_norm": 0.9770480990409851, "learning_rate": 3.714338302963372e-05, "loss": 1.669, "num_input_tokens_seen": 26782928, "step": 4430, "train_runtime": 4492.1658, "train_tokens_per_second": 5962.141 }, { "epoch": 1.6297011494252873, "grad_norm": 0.9898492097854614, "learning_rate": 3.710657095527333e-05, "loss": 1.4968, "num_input_tokens_seen": 26788032, "step": 4431, "train_runtime": 4493.0261, "train_tokens_per_second": 5962.136 }, { "epoch": 1.6300689655172413, "grad_norm": 0.9755603671073914, "learning_rate": 3.7069758880912944e-05, "loss": 1.4318, "num_input_tokens_seen": 26794080, "step": 4432, "train_runtime": 4494.015, "train_tokens_per_second": 5962.17 }, { "epoch": 1.6304367816091954, "grad_norm": 0.9433183073997498, "learning_rate": 3.7032946806552546e-05, "loss": 1.5087, "num_input_tokens_seen": 26801088, "step": 4433, "train_runtime": 4495.1198, "train_tokens_per_second": 5962.263 }, { "epoch": 1.6308045977011494, "grad_norm": 1.0346920490264893, "learning_rate": 3.699613473219216e-05, "loss": 1.4415, "num_input_tokens_seen": 26806352, "step": 4434, "train_runtime": 4496.0123, "train_tokens_per_second": 5962.251 }, { "epoch": 1.6311724137931034, "grad_norm": 1.0566402673721313, "learning_rate": 3.695932265783177e-05, "loss": 1.506, "num_input_tokens_seen": 26811504, "step": 4435, "train_runtime": 4496.8711, "train_tokens_per_second": 5962.258 }, { "epoch": 1.6315402298850574, "grad_norm": 1.0768990516662598, "learning_rate": 3.692251058347138e-05, "loss": 1.796, "num_input_tokens_seen": 26815888, "step": 4436, "train_runtime": 4497.6445, "train_tokens_per_second": 5962.207 }, { "epoch": 1.6319080459770114, "grad_norm": 0.9810062050819397, "learning_rate": 3.688569850911099e-05, "loss": 1.4282, "num_input_tokens_seen": 26821120, "step": 4437, "train_runtime": 4498.4858, "train_tokens_per_second": 5962.255 }, { "epoch": 1.6322758620689655, "grad_norm": 1.186820387840271, "learning_rate": 3.6848886434750604e-05, "loss": 1.6454, "num_input_tokens_seen": 26827920, "step": 4438, "train_runtime": 4499.5946, "train_tokens_per_second": 5962.297 }, { "epoch": 1.6326436781609195, "grad_norm": 1.0648199319839478, "learning_rate": 3.6812074360390207e-05, "loss": 1.5711, "num_input_tokens_seen": 26832544, "step": 4439, "train_runtime": 4500.3915, "train_tokens_per_second": 5962.269 }, { "epoch": 1.6330114942528735, "grad_norm": 1.0071207284927368, "learning_rate": 3.677526228602982e-05, "loss": 1.5084, "num_input_tokens_seen": 26838240, "step": 4440, "train_runtime": 4501.3225, "train_tokens_per_second": 5962.301 }, { "epoch": 1.6333793103448278, "grad_norm": 1.106308102607727, "learning_rate": 3.673845021166943e-05, "loss": 1.5581, "num_input_tokens_seen": 26843200, "step": 4441, "train_runtime": 4502.6366, "train_tokens_per_second": 5961.663 }, { "epoch": 1.6337471264367815, "grad_norm": 1.0576567649841309, "learning_rate": 3.670163813730904e-05, "loss": 1.5525, "num_input_tokens_seen": 26849088, "step": 4442, "train_runtime": 4503.5946, "train_tokens_per_second": 5961.702 }, { "epoch": 1.6341149425287358, "grad_norm": 1.1532714366912842, "learning_rate": 3.666482606294865e-05, "loss": 1.6447, "num_input_tokens_seen": 26853984, "step": 4443, "train_runtime": 4504.4195, "train_tokens_per_second": 5961.697 }, { "epoch": 1.6344827586206896, "grad_norm": 1.0651657581329346, "learning_rate": 3.6628013988588265e-05, "loss": 1.6349, "num_input_tokens_seen": 26859424, "step": 4444, "train_runtime": 4505.332, "train_tokens_per_second": 5961.697 }, { "epoch": 1.6348505747126438, "grad_norm": 1.020686388015747, "learning_rate": 3.659120191422787e-05, "loss": 1.4747, "num_input_tokens_seen": 26864080, "step": 4445, "train_runtime": 4506.1518, "train_tokens_per_second": 5961.646 }, { "epoch": 1.6352183908045976, "grad_norm": 0.9999488592147827, "learning_rate": 3.6554389839867476e-05, "loss": 1.5482, "num_input_tokens_seen": 26869824, "step": 4446, "train_runtime": 4507.0848, "train_tokens_per_second": 5961.686 }, { "epoch": 1.6355862068965519, "grad_norm": 0.9598243832588196, "learning_rate": 3.651757776550709e-05, "loss": 1.4257, "num_input_tokens_seen": 26875136, "step": 4447, "train_runtime": 4507.9572, "train_tokens_per_second": 5961.711 }, { "epoch": 1.6359540229885057, "grad_norm": 0.9431926012039185, "learning_rate": 3.648076569114669e-05, "loss": 1.6416, "num_input_tokens_seen": 26879744, "step": 4448, "train_runtime": 4508.7289, "train_tokens_per_second": 5961.712 }, { "epoch": 1.63632183908046, "grad_norm": 1.0127543210983276, "learning_rate": 3.644395361678631e-05, "loss": 1.5172, "num_input_tokens_seen": 26885392, "step": 4449, "train_runtime": 4509.6398, "train_tokens_per_second": 5961.76 }, { "epoch": 1.6366896551724137, "grad_norm": 0.9811985492706299, "learning_rate": 3.640714154242592e-05, "loss": 1.4665, "num_input_tokens_seen": 26891120, "step": 4450, "train_runtime": 4510.5923, "train_tokens_per_second": 5961.771 }, { "epoch": 1.637057471264368, "grad_norm": 0.9507855772972107, "learning_rate": 3.637032946806553e-05, "loss": 1.5199, "num_input_tokens_seen": 26895392, "step": 4451, "train_runtime": 4511.3329, "train_tokens_per_second": 5961.74 }, { "epoch": 1.6374252873563218, "grad_norm": 0.9510373473167419, "learning_rate": 3.6333517393705136e-05, "loss": 1.5625, "num_input_tokens_seen": 26900480, "step": 4452, "train_runtime": 4512.205, "train_tokens_per_second": 5961.715 }, { "epoch": 1.637793103448276, "grad_norm": 1.1824833154678345, "learning_rate": 3.629670531934475e-05, "loss": 1.5046, "num_input_tokens_seen": 26904640, "step": 4453, "train_runtime": 4512.9334, "train_tokens_per_second": 5961.674 }, { "epoch": 1.6381609195402298, "grad_norm": 1.1188271045684814, "learning_rate": 3.6259893244984353e-05, "loss": 1.5253, "num_input_tokens_seen": 26910416, "step": 4454, "train_runtime": 4513.8995, "train_tokens_per_second": 5961.678 }, { "epoch": 1.638528735632184, "grad_norm": 0.9652191400527954, "learning_rate": 3.622308117062397e-05, "loss": 1.5941, "num_input_tokens_seen": 26915776, "step": 4455, "train_runtime": 4514.803, "train_tokens_per_second": 5961.672 }, { "epoch": 1.6388965517241378, "grad_norm": 0.9670843482017517, "learning_rate": 3.618626909626358e-05, "loss": 1.4658, "num_input_tokens_seen": 26920672, "step": 4456, "train_runtime": 4515.6342, "train_tokens_per_second": 5961.659 }, { "epoch": 1.639264367816092, "grad_norm": 0.9543077945709229, "learning_rate": 3.614945702190319e-05, "loss": 1.5206, "num_input_tokens_seen": 26927616, "step": 4457, "train_runtime": 4516.7216, "train_tokens_per_second": 5961.761 }, { "epoch": 1.6396321839080459, "grad_norm": 0.9574422836303711, "learning_rate": 3.6112644947542796e-05, "loss": 1.4938, "num_input_tokens_seen": 26933504, "step": 4458, "train_runtime": 4517.6965, "train_tokens_per_second": 5961.778 }, { "epoch": 1.6400000000000001, "grad_norm": 1.0249989032745361, "learning_rate": 3.6075832873182405e-05, "loss": 1.3922, "num_input_tokens_seen": 26938912, "step": 4459, "train_runtime": 4518.5855, "train_tokens_per_second": 5961.802 }, { "epoch": 1.640367816091954, "grad_norm": 1.000575304031372, "learning_rate": 3.6039020798822014e-05, "loss": 1.6231, "num_input_tokens_seen": 26944336, "step": 4460, "train_runtime": 4519.4899, "train_tokens_per_second": 5961.809 }, { "epoch": 1.6407356321839082, "grad_norm": 0.9081759452819824, "learning_rate": 3.600220872446162e-05, "loss": 1.4537, "num_input_tokens_seen": 26949728, "step": 4461, "train_runtime": 4520.3946, "train_tokens_per_second": 5961.809 }, { "epoch": 1.641103448275862, "grad_norm": 1.0230835676193237, "learning_rate": 3.596539665010124e-05, "loss": 1.4631, "num_input_tokens_seen": 26956144, "step": 4462, "train_runtime": 4521.432, "train_tokens_per_second": 5961.86 }, { "epoch": 1.6414712643678162, "grad_norm": 1.0817731618881226, "learning_rate": 3.592858457574084e-05, "loss": 1.5918, "num_input_tokens_seen": 26960384, "step": 4463, "train_runtime": 4522.1782, "train_tokens_per_second": 5961.814 }, { "epoch": 1.64183908045977, "grad_norm": 1.0232770442962646, "learning_rate": 3.5891772501380456e-05, "loss": 1.562, "num_input_tokens_seen": 26967840, "step": 4464, "train_runtime": 4523.3499, "train_tokens_per_second": 5961.918 }, { "epoch": 1.6422068965517242, "grad_norm": 0.9815859198570251, "learning_rate": 3.5854960427020065e-05, "loss": 1.3634, "num_input_tokens_seen": 26974320, "step": 4465, "train_runtime": 4524.3783, "train_tokens_per_second": 5961.995 }, { "epoch": 1.642574712643678, "grad_norm": 1.0082767009735107, "learning_rate": 3.5818148352659674e-05, "loss": 1.4737, "num_input_tokens_seen": 26980528, "step": 4466, "train_runtime": 4525.3892, "train_tokens_per_second": 5962.035 }, { "epoch": 1.6429425287356323, "grad_norm": 1.064754605293274, "learning_rate": 3.578133627829928e-05, "loss": 1.6101, "num_input_tokens_seen": 26985024, "step": 4467, "train_runtime": 4526.1731, "train_tokens_per_second": 5961.996 }, { "epoch": 1.643310344827586, "grad_norm": 0.9956942200660706, "learning_rate": 3.57445242039389e-05, "loss": 1.6064, "num_input_tokens_seen": 26989680, "step": 4468, "train_runtime": 4526.9933, "train_tokens_per_second": 5961.944 }, { "epoch": 1.6436781609195403, "grad_norm": 1.0067864656448364, "learning_rate": 3.57077121295785e-05, "loss": 1.4774, "num_input_tokens_seen": 26994688, "step": 4469, "train_runtime": 4527.8574, "train_tokens_per_second": 5961.912 }, { "epoch": 1.6440459770114941, "grad_norm": 1.0546534061431885, "learning_rate": 3.5670900055218116e-05, "loss": 1.6702, "num_input_tokens_seen": 26999616, "step": 4470, "train_runtime": 4528.7021, "train_tokens_per_second": 5961.888 }, { "epoch": 1.6444137931034484, "grad_norm": 0.8732433319091797, "learning_rate": 3.5634087980857725e-05, "loss": 1.5471, "num_input_tokens_seen": 27006048, "step": 4471, "train_runtime": 4530.2771, "train_tokens_per_second": 5961.235 }, { "epoch": 1.6447816091954022, "grad_norm": 1.0325344800949097, "learning_rate": 3.5597275906497334e-05, "loss": 1.5864, "num_input_tokens_seen": 27010912, "step": 4472, "train_runtime": 4531.0977, "train_tokens_per_second": 5961.229 }, { "epoch": 1.6451494252873564, "grad_norm": 1.0923030376434326, "learning_rate": 3.556046383213694e-05, "loss": 1.7019, "num_input_tokens_seen": 27016160, "step": 4473, "train_runtime": 4531.967, "train_tokens_per_second": 5961.244 }, { "epoch": 1.6455172413793102, "grad_norm": 1.070400357246399, "learning_rate": 3.552365175777655e-05, "loss": 1.5514, "num_input_tokens_seen": 27020352, "step": 4474, "train_runtime": 4532.7047, "train_tokens_per_second": 5961.198 }, { "epoch": 1.6458850574712645, "grad_norm": 0.8958239555358887, "learning_rate": 3.548683968341616e-05, "loss": 1.7059, "num_input_tokens_seen": 27029008, "step": 4475, "train_runtime": 4534.0454, "train_tokens_per_second": 5961.345 }, { "epoch": 1.6462528735632183, "grad_norm": 0.9670495390892029, "learning_rate": 3.545002760905577e-05, "loss": 1.355, "num_input_tokens_seen": 27037936, "step": 4476, "train_runtime": 4535.3878, "train_tokens_per_second": 5961.549 }, { "epoch": 1.6466206896551725, "grad_norm": 0.9604555368423462, "learning_rate": 3.5413215534695385e-05, "loss": 1.5953, "num_input_tokens_seen": 27043152, "step": 4477, "train_runtime": 4536.2709, "train_tokens_per_second": 5961.538 }, { "epoch": 1.6469885057471263, "grad_norm": 1.004197597503662, "learning_rate": 3.537640346033499e-05, "loss": 1.6387, "num_input_tokens_seen": 27050720, "step": 4478, "train_runtime": 4537.4482, "train_tokens_per_second": 5961.659 }, { "epoch": 1.6473563218390805, "grad_norm": 1.1304956674575806, "learning_rate": 3.53395913859746e-05, "loss": 1.6723, "num_input_tokens_seen": 27056592, "step": 4479, "train_runtime": 4538.415, "train_tokens_per_second": 5961.683 }, { "epoch": 1.6477241379310343, "grad_norm": 1.074472188949585, "learning_rate": 3.530277931161421e-05, "loss": 1.732, "num_input_tokens_seen": 27061808, "step": 4480, "train_runtime": 4539.2692, "train_tokens_per_second": 5961.71 }, { "epoch": 1.6480919540229886, "grad_norm": 1.0209598541259766, "learning_rate": 3.526596723725382e-05, "loss": 1.6028, "num_input_tokens_seen": 27067696, "step": 4481, "train_runtime": 4540.2666, "train_tokens_per_second": 5961.697 }, { "epoch": 1.6484597701149424, "grad_norm": 0.9989323616027832, "learning_rate": 3.522915516289343e-05, "loss": 1.6453, "num_input_tokens_seen": 27072864, "step": 4482, "train_runtime": 4541.1432, "train_tokens_per_second": 5961.685 }, { "epoch": 1.6488275862068966, "grad_norm": 0.9564641118049622, "learning_rate": 3.5192343088533045e-05, "loss": 1.5845, "num_input_tokens_seen": 27077872, "step": 4483, "train_runtime": 4542.0138, "train_tokens_per_second": 5961.645 }, { "epoch": 1.6491954022988504, "grad_norm": 0.9396659135818481, "learning_rate": 3.515553101417265e-05, "loss": 1.3699, "num_input_tokens_seen": 27084944, "step": 4484, "train_runtime": 4543.1406, "train_tokens_per_second": 5961.723 }, { "epoch": 1.6495632183908047, "grad_norm": 1.0293605327606201, "learning_rate": 3.511871893981226e-05, "loss": 1.3618, "num_input_tokens_seen": 27091280, "step": 4485, "train_runtime": 4544.1504, "train_tokens_per_second": 5961.792 }, { "epoch": 1.6499310344827585, "grad_norm": 0.9557163119316101, "learning_rate": 3.508190686545187e-05, "loss": 1.5235, "num_input_tokens_seen": 27097024, "step": 4486, "train_runtime": 4545.1248, "train_tokens_per_second": 5961.778 }, { "epoch": 1.6502988505747127, "grad_norm": 1.0445588827133179, "learning_rate": 3.504509479109148e-05, "loss": 1.4695, "num_input_tokens_seen": 27104592, "step": 4487, "train_runtime": 4546.2893, "train_tokens_per_second": 5961.915 }, { "epoch": 1.6506666666666665, "grad_norm": 0.9958745837211609, "learning_rate": 3.500828271673109e-05, "loss": 1.4353, "num_input_tokens_seen": 27109936, "step": 4488, "train_runtime": 4547.1857, "train_tokens_per_second": 5961.915 }, { "epoch": 1.6510344827586207, "grad_norm": 0.9378944039344788, "learning_rate": 3.49714706423707e-05, "loss": 1.4088, "num_input_tokens_seen": 27118448, "step": 4489, "train_runtime": 4548.4777, "train_tokens_per_second": 5962.093 }, { "epoch": 1.6514022988505748, "grad_norm": 0.9922360777854919, "learning_rate": 3.493465856801031e-05, "loss": 1.6083, "num_input_tokens_seen": 27123120, "step": 4490, "train_runtime": 4549.3064, "train_tokens_per_second": 5962.034 }, { "epoch": 1.6517701149425288, "grad_norm": 1.0193889141082764, "learning_rate": 3.4897846493649916e-05, "loss": 1.5953, "num_input_tokens_seen": 27128992, "step": 4491, "train_runtime": 4550.2775, "train_tokens_per_second": 5962.052 }, { "epoch": 1.6521379310344828, "grad_norm": 0.9122409224510193, "learning_rate": 3.486103441928953e-05, "loss": 1.4181, "num_input_tokens_seen": 27135408, "step": 4492, "train_runtime": 4551.3094, "train_tokens_per_second": 5962.11 }, { "epoch": 1.6525057471264368, "grad_norm": 1.0294233560562134, "learning_rate": 3.4824222344929134e-05, "loss": 1.491, "num_input_tokens_seen": 27143440, "step": 4493, "train_runtime": 4552.5664, "train_tokens_per_second": 5962.228 }, { "epoch": 1.6528735632183909, "grad_norm": 1.0201284885406494, "learning_rate": 3.478741027056875e-05, "loss": 1.6388, "num_input_tokens_seen": 27150048, "step": 4494, "train_runtime": 4553.6193, "train_tokens_per_second": 5962.301 }, { "epoch": 1.6532413793103449, "grad_norm": 0.9764149785041809, "learning_rate": 3.475059819620836e-05, "loss": 1.7102, "num_input_tokens_seen": 27155840, "step": 4495, "train_runtime": 4554.5587, "train_tokens_per_second": 5962.343 }, { "epoch": 1.653609195402299, "grad_norm": 0.9833749532699585, "learning_rate": 3.471378612184797e-05, "loss": 1.3359, "num_input_tokens_seen": 27161280, "step": 4496, "train_runtime": 4555.4584, "train_tokens_per_second": 5962.359 }, { "epoch": 1.653977011494253, "grad_norm": 1.1207014322280884, "learning_rate": 3.4676974047487576e-05, "loss": 1.737, "num_input_tokens_seen": 27165648, "step": 4497, "train_runtime": 4556.2126, "train_tokens_per_second": 5962.331 }, { "epoch": 1.654344827586207, "grad_norm": 0.9498369097709656, "learning_rate": 3.4640161973127185e-05, "loss": 1.5512, "num_input_tokens_seen": 27172608, "step": 4498, "train_runtime": 4557.3334, "train_tokens_per_second": 5962.392 }, { "epoch": 1.654712643678161, "grad_norm": 1.1282031536102295, "learning_rate": 3.4603349898766794e-05, "loss": 1.5794, "num_input_tokens_seen": 27178400, "step": 4499, "train_runtime": 4558.2715, "train_tokens_per_second": 5962.435 }, { "epoch": 1.655080459770115, "grad_norm": 0.8588025569915771, "learning_rate": 3.456653782440641e-05, "loss": 1.3368, "num_input_tokens_seen": 27185744, "step": 4500, "train_runtime": 4559.3953, "train_tokens_per_second": 5962.577 }, { "epoch": 1.655448275862069, "grad_norm": 0.8851767182350159, "learning_rate": 3.452972575004602e-05, "loss": 1.5944, "num_input_tokens_seen": 27193744, "step": 4501, "train_runtime": 4561.202, "train_tokens_per_second": 5961.969 }, { "epoch": 1.655816091954023, "grad_norm": 0.9626141786575317, "learning_rate": 3.449291367568563e-05, "loss": 1.452, "num_input_tokens_seen": 27198736, "step": 4502, "train_runtime": 4562.0731, "train_tokens_per_second": 5961.925 }, { "epoch": 1.656183908045977, "grad_norm": 1.0072157382965088, "learning_rate": 3.445610160132524e-05, "loss": 1.4744, "num_input_tokens_seen": 27205296, "step": 4503, "train_runtime": 4563.1053, "train_tokens_per_second": 5962.014 }, { "epoch": 1.656551724137931, "grad_norm": 0.9441608786582947, "learning_rate": 3.4419289526964846e-05, "loss": 1.5023, "num_input_tokens_seen": 27211696, "step": 4504, "train_runtime": 4564.164, "train_tokens_per_second": 5962.033 }, { "epoch": 1.656919540229885, "grad_norm": 1.0220075845718384, "learning_rate": 3.4382477452604454e-05, "loss": 1.4444, "num_input_tokens_seen": 27217408, "step": 4505, "train_runtime": 4565.1009, "train_tokens_per_second": 5962.061 }, { "epoch": 1.657287356321839, "grad_norm": 1.0067750215530396, "learning_rate": 3.434566537824406e-05, "loss": 1.6475, "num_input_tokens_seen": 27225088, "step": 4506, "train_runtime": 4566.3162, "train_tokens_per_second": 5962.156 }, { "epoch": 1.6576551724137931, "grad_norm": 0.9772936105728149, "learning_rate": 3.430885330388368e-05, "loss": 1.4659, "num_input_tokens_seen": 27230080, "step": 4507, "train_runtime": 4567.1652, "train_tokens_per_second": 5962.14 }, { "epoch": 1.6580229885057471, "grad_norm": 0.877511739730835, "learning_rate": 3.427204122952328e-05, "loss": 1.3628, "num_input_tokens_seen": 27237840, "step": 4508, "train_runtime": 4568.3647, "train_tokens_per_second": 5962.274 }, { "epoch": 1.6583908045977012, "grad_norm": 1.0704823732376099, "learning_rate": 3.42352291551629e-05, "loss": 1.4692, "num_input_tokens_seen": 27242032, "step": 4509, "train_runtime": 4569.13, "train_tokens_per_second": 5962.192 }, { "epoch": 1.6587586206896552, "grad_norm": 0.9791299700737, "learning_rate": 3.4198417080802506e-05, "loss": 1.459, "num_input_tokens_seen": 27248640, "step": 4510, "train_runtime": 4570.1798, "train_tokens_per_second": 5962.269 }, { "epoch": 1.6591264367816092, "grad_norm": 1.028090000152588, "learning_rate": 3.4161605006442115e-05, "loss": 1.5709, "num_input_tokens_seen": 27253840, "step": 4511, "train_runtime": 4571.0393, "train_tokens_per_second": 5962.285 }, { "epoch": 1.6594942528735632, "grad_norm": 1.0077334642410278, "learning_rate": 3.4124792932081723e-05, "loss": 1.5776, "num_input_tokens_seen": 27259248, "step": 4512, "train_runtime": 4571.9551, "train_tokens_per_second": 5962.274 }, { "epoch": 1.6598620689655172, "grad_norm": 1.001970887184143, "learning_rate": 3.408798085772133e-05, "loss": 1.5236, "num_input_tokens_seen": 27264400, "step": 4513, "train_runtime": 4572.8161, "train_tokens_per_second": 5962.278 }, { "epoch": 1.6602298850574713, "grad_norm": 0.9177581667900085, "learning_rate": 3.405116878336094e-05, "loss": 1.5772, "num_input_tokens_seen": 27270816, "step": 4514, "train_runtime": 4573.86, "train_tokens_per_second": 5962.32 }, { "epoch": 1.6605977011494253, "grad_norm": 1.0000431537628174, "learning_rate": 3.401435670900056e-05, "loss": 1.5973, "num_input_tokens_seen": 27276368, "step": 4515, "train_runtime": 4574.785, "train_tokens_per_second": 5962.328 }, { "epoch": 1.6609655172413793, "grad_norm": 0.948546290397644, "learning_rate": 3.3977544634640166e-05, "loss": 1.5555, "num_input_tokens_seen": 27285008, "step": 4516, "train_runtime": 4576.1336, "train_tokens_per_second": 5962.459 }, { "epoch": 1.6613333333333333, "grad_norm": 0.9299002289772034, "learning_rate": 3.3940732560279775e-05, "loss": 1.1601, "num_input_tokens_seen": 27294912, "step": 4517, "train_runtime": 4577.6202, "train_tokens_per_second": 5962.686 }, { "epoch": 1.6617011494252873, "grad_norm": 1.0480867624282837, "learning_rate": 3.3903920485919384e-05, "loss": 1.6586, "num_input_tokens_seen": 27300704, "step": 4518, "train_runtime": 4578.5851, "train_tokens_per_second": 5962.695 }, { "epoch": 1.6620689655172414, "grad_norm": 1.0556780099868774, "learning_rate": 3.386710841155899e-05, "loss": 1.6269, "num_input_tokens_seen": 27306944, "step": 4519, "train_runtime": 4579.6053, "train_tokens_per_second": 5962.729 }, { "epoch": 1.6624367816091954, "grad_norm": 0.9771064519882202, "learning_rate": 3.38302963371986e-05, "loss": 1.44, "num_input_tokens_seen": 27313024, "step": 4520, "train_runtime": 4580.5616, "train_tokens_per_second": 5962.811 }, { "epoch": 1.6628045977011494, "grad_norm": 1.0678390264511108, "learning_rate": 3.379348426283821e-05, "loss": 1.6643, "num_input_tokens_seen": 27317760, "step": 4521, "train_runtime": 4581.369, "train_tokens_per_second": 5962.794 }, { "epoch": 1.6631724137931034, "grad_norm": 1.0714067220687866, "learning_rate": 3.3756672188477826e-05, "loss": 1.5341, "num_input_tokens_seen": 27324032, "step": 4522, "train_runtime": 4582.3807, "train_tokens_per_second": 5962.846 }, { "epoch": 1.6635402298850575, "grad_norm": 1.062416911125183, "learning_rate": 3.371986011411743e-05, "loss": 1.4978, "num_input_tokens_seen": 27330608, "step": 4523, "train_runtime": 4583.4693, "train_tokens_per_second": 5962.865 }, { "epoch": 1.6639080459770115, "grad_norm": 1.0742371082305908, "learning_rate": 3.3683048039757044e-05, "loss": 1.7435, "num_input_tokens_seen": 27336736, "step": 4524, "train_runtime": 4584.4696, "train_tokens_per_second": 5962.9 }, { "epoch": 1.6642758620689655, "grad_norm": 0.9882484078407288, "learning_rate": 3.364623596539665e-05, "loss": 1.4981, "num_input_tokens_seen": 27342064, "step": 4525, "train_runtime": 4585.3458, "train_tokens_per_second": 5962.923 }, { "epoch": 1.6646436781609195, "grad_norm": 1.0915501117706299, "learning_rate": 3.360942389103626e-05, "loss": 1.5119, "num_input_tokens_seen": 27347328, "step": 4526, "train_runtime": 4586.2256, "train_tokens_per_second": 5962.927 }, { "epoch": 1.6650114942528735, "grad_norm": 0.9395991563796997, "learning_rate": 3.357261181667587e-05, "loss": 1.4777, "num_input_tokens_seen": 27354368, "step": 4527, "train_runtime": 4587.3364, "train_tokens_per_second": 5963.018 }, { "epoch": 1.6653793103448276, "grad_norm": 1.0218963623046875, "learning_rate": 3.353579974231548e-05, "loss": 1.5474, "num_input_tokens_seen": 27359200, "step": 4528, "train_runtime": 4588.1598, "train_tokens_per_second": 5963.001 }, { "epoch": 1.6657471264367816, "grad_norm": 1.0213508605957031, "learning_rate": 3.349898766795509e-05, "loss": 1.5227, "num_input_tokens_seen": 27363600, "step": 4529, "train_runtime": 4588.9332, "train_tokens_per_second": 5962.955 }, { "epoch": 1.6661149425287356, "grad_norm": 0.9922882914543152, "learning_rate": 3.3462175593594704e-05, "loss": 1.2771, "num_input_tokens_seen": 27369536, "step": 4530, "train_runtime": 4589.9048, "train_tokens_per_second": 5962.986 }, { "epoch": 1.6664827586206896, "grad_norm": 1.1102005243301392, "learning_rate": 3.342536351923431e-05, "loss": 1.6434, "num_input_tokens_seen": 27376640, "step": 4531, "train_runtime": 4591.5539, "train_tokens_per_second": 5962.391 }, { "epoch": 1.6668505747126436, "grad_norm": 0.9789210557937622, "learning_rate": 3.338855144487392e-05, "loss": 1.6367, "num_input_tokens_seen": 27382944, "step": 4532, "train_runtime": 4592.5938, "train_tokens_per_second": 5962.414 }, { "epoch": 1.6672183908045977, "grad_norm": 0.9995959401130676, "learning_rate": 3.335173937051353e-05, "loss": 1.5033, "num_input_tokens_seen": 27388912, "step": 4533, "train_runtime": 4593.5537, "train_tokens_per_second": 5962.467 }, { "epoch": 1.6675862068965517, "grad_norm": 0.8130632042884827, "learning_rate": 3.331492729615314e-05, "loss": 1.4627, "num_input_tokens_seen": 27398048, "step": 4534, "train_runtime": 4594.9871, "train_tokens_per_second": 5962.595 }, { "epoch": 1.6679540229885057, "grad_norm": 1.0611449480056763, "learning_rate": 3.327811522179275e-05, "loss": 1.6465, "num_input_tokens_seen": 27402848, "step": 4535, "train_runtime": 4595.8179, "train_tokens_per_second": 5962.562 }, { "epoch": 1.6683218390804597, "grad_norm": 0.9352962970733643, "learning_rate": 3.3241303147432364e-05, "loss": 1.3001, "num_input_tokens_seen": 27410640, "step": 4536, "train_runtime": 4597.0483, "train_tokens_per_second": 5962.661 }, { "epoch": 1.6686896551724137, "grad_norm": 1.0341665744781494, "learning_rate": 3.3204491073071966e-05, "loss": 1.489, "num_input_tokens_seen": 27415680, "step": 4537, "train_runtime": 4597.902, "train_tokens_per_second": 5962.65 }, { "epoch": 1.6690574712643678, "grad_norm": 0.9031906723976135, "learning_rate": 3.3167678998711575e-05, "loss": 1.3862, "num_input_tokens_seen": 27427280, "step": 4538, "train_runtime": 4599.6234, "train_tokens_per_second": 5962.94 }, { "epoch": 1.6694252873563218, "grad_norm": 1.0327389240264893, "learning_rate": 3.313086692435119e-05, "loss": 1.4689, "num_input_tokens_seen": 27432752, "step": 4539, "train_runtime": 4600.5086, "train_tokens_per_second": 5962.982 }, { "epoch": 1.669793103448276, "grad_norm": 1.150347113609314, "learning_rate": 3.30940548499908e-05, "loss": 1.6378, "num_input_tokens_seen": 27438048, "step": 4540, "train_runtime": 4601.3783, "train_tokens_per_second": 5963.006 }, { "epoch": 1.6701609195402298, "grad_norm": 1.0720256567001343, "learning_rate": 3.305724277563041e-05, "loss": 1.7241, "num_input_tokens_seen": 27442720, "step": 4541, "train_runtime": 4602.1848, "train_tokens_per_second": 5962.977 }, { "epoch": 1.670528735632184, "grad_norm": 1.027369499206543, "learning_rate": 3.302043070127002e-05, "loss": 1.364, "num_input_tokens_seen": 27450256, "step": 4542, "train_runtime": 4603.3852, "train_tokens_per_second": 5963.059 }, { "epoch": 1.6708965517241379, "grad_norm": 0.9748852252960205, "learning_rate": 3.2983618626909626e-05, "loss": 1.424, "num_input_tokens_seen": 27458032, "step": 4543, "train_runtime": 4604.6186, "train_tokens_per_second": 5963.15 }, { "epoch": 1.6712643678160921, "grad_norm": 0.936853289604187, "learning_rate": 3.2946806552549235e-05, "loss": 1.477, "num_input_tokens_seen": 27465344, "step": 4544, "train_runtime": 4605.7982, "train_tokens_per_second": 5963.211 }, { "epoch": 1.671632183908046, "grad_norm": 0.9770433902740479, "learning_rate": 3.290999447818885e-05, "loss": 1.4245, "num_input_tokens_seen": 27470656, "step": 4545, "train_runtime": 4606.681, "train_tokens_per_second": 5963.221 }, { "epoch": 1.6720000000000002, "grad_norm": 0.9963710308074951, "learning_rate": 3.287318240382846e-05, "loss": 1.4901, "num_input_tokens_seen": 27476336, "step": 4546, "train_runtime": 4607.6258, "train_tokens_per_second": 5963.231 }, { "epoch": 1.672367816091954, "grad_norm": 1.0379221439361572, "learning_rate": 3.283637032946807e-05, "loss": 1.634, "num_input_tokens_seen": 27481456, "step": 4547, "train_runtime": 4608.5017, "train_tokens_per_second": 5963.208 }, { "epoch": 1.6727356321839082, "grad_norm": 1.0403231382369995, "learning_rate": 3.279955825510768e-05, "loss": 1.5957, "num_input_tokens_seen": 27486112, "step": 4548, "train_runtime": 4609.2827, "train_tokens_per_second": 5963.208 }, { "epoch": 1.673103448275862, "grad_norm": 1.0611093044281006, "learning_rate": 3.2762746180747286e-05, "loss": 1.6517, "num_input_tokens_seen": 27491552, "step": 4549, "train_runtime": 4610.1888, "train_tokens_per_second": 5963.216 }, { "epoch": 1.6734712643678162, "grad_norm": 1.013532042503357, "learning_rate": 3.2725934106386895e-05, "loss": 1.4266, "num_input_tokens_seen": 27497776, "step": 4550, "train_runtime": 4611.1924, "train_tokens_per_second": 5963.268 }, { "epoch": 1.67383908045977, "grad_norm": 0.9836187362670898, "learning_rate": 3.268912203202651e-05, "loss": 1.486, "num_input_tokens_seen": 27506032, "step": 4551, "train_runtime": 4612.4686, "train_tokens_per_second": 5963.408 }, { "epoch": 1.6742068965517243, "grad_norm": 0.9497100710868835, "learning_rate": 3.265230995766611e-05, "loss": 1.6527, "num_input_tokens_seen": 27514528, "step": 4552, "train_runtime": 4613.7966, "train_tokens_per_second": 5963.533 }, { "epoch": 1.674574712643678, "grad_norm": 0.9267294406890869, "learning_rate": 3.261549788330572e-05, "loss": 1.3514, "num_input_tokens_seen": 27521008, "step": 4553, "train_runtime": 4614.8389, "train_tokens_per_second": 5963.59 }, { "epoch": 1.6749425287356323, "grad_norm": 0.9495742917060852, "learning_rate": 3.257868580894534e-05, "loss": 1.4508, "num_input_tokens_seen": 27527216, "step": 4554, "train_runtime": 4615.8481, "train_tokens_per_second": 5963.631 }, { "epoch": 1.6753103448275861, "grad_norm": 0.9232713580131531, "learning_rate": 3.2541873734584946e-05, "loss": 1.4087, "num_input_tokens_seen": 27532752, "step": 4555, "train_runtime": 4616.7654, "train_tokens_per_second": 5963.645 }, { "epoch": 1.6756781609195404, "grad_norm": 0.9398287534713745, "learning_rate": 3.2505061660224555e-05, "loss": 1.34, "num_input_tokens_seen": 27537792, "step": 4556, "train_runtime": 4617.6334, "train_tokens_per_second": 5963.616 }, { "epoch": 1.6760459770114942, "grad_norm": 0.9533345103263855, "learning_rate": 3.2468249585864164e-05, "loss": 1.3681, "num_input_tokens_seen": 27545008, "step": 4557, "train_runtime": 4618.7945, "train_tokens_per_second": 5963.679 }, { "epoch": 1.6764137931034484, "grad_norm": 0.9850859045982361, "learning_rate": 3.243143751150377e-05, "loss": 1.4773, "num_input_tokens_seen": 27550256, "step": 4558, "train_runtime": 4619.6806, "train_tokens_per_second": 5963.671 }, { "epoch": 1.6767816091954022, "grad_norm": 1.0518481731414795, "learning_rate": 3.239462543714338e-05, "loss": 1.5096, "num_input_tokens_seen": 27554992, "step": 4559, "train_runtime": 4620.482, "train_tokens_per_second": 5963.662 }, { "epoch": 1.6771494252873564, "grad_norm": 0.9615206718444824, "learning_rate": 3.2357813362783e-05, "loss": 1.3367, "num_input_tokens_seen": 27569408, "step": 4560, "train_runtime": 4622.5843, "train_tokens_per_second": 5964.068 }, { "epoch": 1.6775172413793102, "grad_norm": 1.047471046447754, "learning_rate": 3.2321001288422607e-05, "loss": 1.6531, "num_input_tokens_seen": 27574208, "step": 4561, "train_runtime": 4623.8667, "train_tokens_per_second": 5963.452 }, { "epoch": 1.6778850574712645, "grad_norm": 0.9237154126167297, "learning_rate": 3.2284189214062215e-05, "loss": 1.3022, "num_input_tokens_seen": 27579520, "step": 4562, "train_runtime": 4624.7637, "train_tokens_per_second": 5963.444 }, { "epoch": 1.6782528735632183, "grad_norm": 1.0633589029312134, "learning_rate": 3.2247377139701824e-05, "loss": 1.6763, "num_input_tokens_seen": 27585184, "step": 4563, "train_runtime": 4625.699, "train_tokens_per_second": 5963.463 }, { "epoch": 1.6786206896551725, "grad_norm": 0.9793161749839783, "learning_rate": 3.221056506534143e-05, "loss": 1.4456, "num_input_tokens_seen": 27590432, "step": 4564, "train_runtime": 4626.5867, "train_tokens_per_second": 5963.453 }, { "epoch": 1.6789885057471263, "grad_norm": 0.9934513568878174, "learning_rate": 3.217375299098104e-05, "loss": 1.3779, "num_input_tokens_seen": 27596944, "step": 4565, "train_runtime": 4627.6444, "train_tokens_per_second": 5963.497 }, { "epoch": 1.6793563218390806, "grad_norm": 1.0272324085235596, "learning_rate": 3.213694091662066e-05, "loss": 1.6104, "num_input_tokens_seen": 27601360, "step": 4566, "train_runtime": 4628.407, "train_tokens_per_second": 5963.469 }, { "epoch": 1.6797241379310344, "grad_norm": 1.1488995552062988, "learning_rate": 3.210012884226026e-05, "loss": 1.7001, "num_input_tokens_seen": 27606032, "step": 4567, "train_runtime": 4629.2018, "train_tokens_per_second": 5963.454 }, { "epoch": 1.6800919540229886, "grad_norm": 1.0806998014450073, "learning_rate": 3.206331676789987e-05, "loss": 1.4357, "num_input_tokens_seen": 27610368, "step": 4568, "train_runtime": 4629.9715, "train_tokens_per_second": 5963.399 }, { "epoch": 1.6804597701149424, "grad_norm": 0.9658429622650146, "learning_rate": 3.2026504693539484e-05, "loss": 1.4371, "num_input_tokens_seen": 27618576, "step": 4569, "train_runtime": 4631.2459, "train_tokens_per_second": 5963.53 }, { "epoch": 1.6808275862068967, "grad_norm": 1.0064529180526733, "learning_rate": 3.198969261917909e-05, "loss": 1.6742, "num_input_tokens_seen": 27624656, "step": 4570, "train_runtime": 4632.2573, "train_tokens_per_second": 5963.541 }, { "epoch": 1.6811954022988504, "grad_norm": 0.9576125741004944, "learning_rate": 3.19528805448187e-05, "loss": 1.4484, "num_input_tokens_seen": 27630400, "step": 4571, "train_runtime": 4633.2039, "train_tokens_per_second": 5963.562 }, { "epoch": 1.6815632183908047, "grad_norm": 0.9752952456474304, "learning_rate": 3.191606847045831e-05, "loss": 1.3325, "num_input_tokens_seen": 27637360, "step": 4572, "train_runtime": 4634.2836, "train_tokens_per_second": 5963.675 }, { "epoch": 1.6819310344827585, "grad_norm": 0.9824012517929077, "learning_rate": 3.187925639609792e-05, "loss": 1.5745, "num_input_tokens_seen": 27643104, "step": 4573, "train_runtime": 4635.23, "train_tokens_per_second": 5963.696 }, { "epoch": 1.6822988505747127, "grad_norm": 0.9704250693321228, "learning_rate": 3.184244432173753e-05, "loss": 1.5435, "num_input_tokens_seen": 27648240, "step": 4574, "train_runtime": 4636.0737, "train_tokens_per_second": 5963.719 }, { "epoch": 1.6826666666666665, "grad_norm": 0.8644093871116638, "learning_rate": 3.1805632247377145e-05, "loss": 1.3439, "num_input_tokens_seen": 27658352, "step": 4575, "train_runtime": 4637.6061, "train_tokens_per_second": 5963.929 }, { "epoch": 1.6830344827586208, "grad_norm": 0.9795041084289551, "learning_rate": 3.176882017301675e-05, "loss": 1.2999, "num_input_tokens_seen": 27667440, "step": 4576, "train_runtime": 4638.9711, "train_tokens_per_second": 5964.133 }, { "epoch": 1.6834022988505746, "grad_norm": 1.0225485563278198, "learning_rate": 3.173200809865636e-05, "loss": 1.5607, "num_input_tokens_seen": 27672688, "step": 4577, "train_runtime": 4639.8534, "train_tokens_per_second": 5964.13 }, { "epoch": 1.6837701149425288, "grad_norm": 0.9260286688804626, "learning_rate": 3.169519602429597e-05, "loss": 1.5856, "num_input_tokens_seen": 27677312, "step": 4578, "train_runtime": 4640.6708, "train_tokens_per_second": 5964.076 }, { "epoch": 1.6841379310344826, "grad_norm": 0.9811348915100098, "learning_rate": 3.165838394993558e-05, "loss": 1.4791, "num_input_tokens_seen": 27685008, "step": 4579, "train_runtime": 4641.8866, "train_tokens_per_second": 5964.172 }, { "epoch": 1.6845057471264369, "grad_norm": 0.9541542530059814, "learning_rate": 3.162157187557519e-05, "loss": 1.5143, "num_input_tokens_seen": 27692064, "step": 4580, "train_runtime": 4643.023, "train_tokens_per_second": 5964.231 }, { "epoch": 1.6848735632183907, "grad_norm": 1.0133819580078125, "learning_rate": 3.1584759801214805e-05, "loss": 1.3716, "num_input_tokens_seen": 27699904, "step": 4581, "train_runtime": 4644.245, "train_tokens_per_second": 5964.35 }, { "epoch": 1.685241379310345, "grad_norm": 0.9617471694946289, "learning_rate": 3.154794772685441e-05, "loss": 1.6089, "num_input_tokens_seen": 27705440, "step": 4582, "train_runtime": 4645.173, "train_tokens_per_second": 5964.351 }, { "epoch": 1.6856091954022987, "grad_norm": 0.9849011301994324, "learning_rate": 3.1511135652494016e-05, "loss": 1.2325, "num_input_tokens_seen": 27711296, "step": 4583, "train_runtime": 4646.139, "train_tokens_per_second": 5964.371 }, { "epoch": 1.685977011494253, "grad_norm": 1.1416987180709839, "learning_rate": 3.147432357813363e-05, "loss": 1.7682, "num_input_tokens_seen": 27716736, "step": 4584, "train_runtime": 4647.0316, "train_tokens_per_second": 5964.396 }, { "epoch": 1.6863448275862067, "grad_norm": 1.0593440532684326, "learning_rate": 3.143751150377324e-05, "loss": 1.3654, "num_input_tokens_seen": 27721952, "step": 4585, "train_runtime": 4647.8933, "train_tokens_per_second": 5964.412 }, { "epoch": 1.686712643678161, "grad_norm": 1.015592336654663, "learning_rate": 3.140069942941285e-05, "loss": 1.3702, "num_input_tokens_seen": 27729296, "step": 4586, "train_runtime": 4649.0441, "train_tokens_per_second": 5964.516 }, { "epoch": 1.6870804597701148, "grad_norm": 0.995673418045044, "learning_rate": 3.136388735505246e-05, "loss": 1.5328, "num_input_tokens_seen": 27734256, "step": 4587, "train_runtime": 4649.887, "train_tokens_per_second": 5964.501 }, { "epoch": 1.687448275862069, "grad_norm": 0.9884728193283081, "learning_rate": 3.132707528069207e-05, "loss": 1.381, "num_input_tokens_seen": 27739616, "step": 4588, "train_runtime": 4650.7772, "train_tokens_per_second": 5964.512 }, { "epoch": 1.6878160919540228, "grad_norm": 1.022894024848938, "learning_rate": 3.1290263206331676e-05, "loss": 1.4292, "num_input_tokens_seen": 27745376, "step": 4589, "train_runtime": 4651.7295, "train_tokens_per_second": 5964.529 }, { "epoch": 1.688183908045977, "grad_norm": 0.9556910991668701, "learning_rate": 3.125345113197129e-05, "loss": 1.4345, "num_input_tokens_seen": 27750096, "step": 4590, "train_runtime": 4652.547, "train_tokens_per_second": 5964.496 }, { "epoch": 1.688551724137931, "grad_norm": 1.0383857488632202, "learning_rate": 3.1216639057610894e-05, "loss": 1.5837, "num_input_tokens_seen": 27755584, "step": 4591, "train_runtime": 4653.9462, "train_tokens_per_second": 5963.882 }, { "epoch": 1.688919540229885, "grad_norm": 1.0677129030227661, "learning_rate": 3.117982698325051e-05, "loss": 1.3866, "num_input_tokens_seen": 27760912, "step": 4592, "train_runtime": 4654.8228, "train_tokens_per_second": 5963.903 }, { "epoch": 1.6892873563218391, "grad_norm": 1.0819765329360962, "learning_rate": 3.114301490889012e-05, "loss": 1.6699, "num_input_tokens_seen": 27766544, "step": 4593, "train_runtime": 4655.741, "train_tokens_per_second": 5963.937 }, { "epoch": 1.6896551724137931, "grad_norm": 1.055228352546692, "learning_rate": 3.110620283452973e-05, "loss": 1.4852, "num_input_tokens_seen": 27772272, "step": 4594, "train_runtime": 4656.7158, "train_tokens_per_second": 5963.918 }, { "epoch": 1.6900229885057472, "grad_norm": 1.12703275680542, "learning_rate": 3.1069390760169336e-05, "loss": 1.3859, "num_input_tokens_seen": 27776720, "step": 4595, "train_runtime": 4657.4677, "train_tokens_per_second": 5963.91 }, { "epoch": 1.6903908045977012, "grad_norm": 1.071090579032898, "learning_rate": 3.103257868580895e-05, "loss": 1.6972, "num_input_tokens_seen": 27782896, "step": 4596, "train_runtime": 4658.474, "train_tokens_per_second": 5963.948 }, { "epoch": 1.6907586206896552, "grad_norm": 0.9115914106369019, "learning_rate": 3.0995766611448554e-05, "loss": 1.3728, "num_input_tokens_seen": 27790224, "step": 4597, "train_runtime": 4659.6279, "train_tokens_per_second": 5964.044 }, { "epoch": 1.6911264367816092, "grad_norm": 0.994540810585022, "learning_rate": 3.095895453708816e-05, "loss": 1.4326, "num_input_tokens_seen": 27797280, "step": 4598, "train_runtime": 4660.7469, "train_tokens_per_second": 5964.126 }, { "epoch": 1.6914942528735633, "grad_norm": 0.9558801651000977, "learning_rate": 3.092214246272778e-05, "loss": 1.3787, "num_input_tokens_seen": 27804352, "step": 4599, "train_runtime": 4661.8694, "train_tokens_per_second": 5964.207 }, { "epoch": 1.6918620689655173, "grad_norm": 0.9633522629737854, "learning_rate": 3.088533038836739e-05, "loss": 1.5573, "num_input_tokens_seen": 27810672, "step": 4600, "train_runtime": 4662.8929, "train_tokens_per_second": 5964.253 }, { "epoch": 1.6922298850574713, "grad_norm": 1.0789103507995605, "learning_rate": 3.0848518314006996e-05, "loss": 1.6742, "num_input_tokens_seen": 27817584, "step": 4601, "train_runtime": 4663.9774, "train_tokens_per_second": 5964.348 }, { "epoch": 1.6925977011494253, "grad_norm": 0.9825541973114014, "learning_rate": 3.0811706239646605e-05, "loss": 1.4961, "num_input_tokens_seen": 27822640, "step": 4602, "train_runtime": 4664.8262, "train_tokens_per_second": 5964.347 }, { "epoch": 1.6929655172413793, "grad_norm": 1.253936529159546, "learning_rate": 3.0774894165286214e-05, "loss": 1.4032, "num_input_tokens_seen": 27829040, "step": 4603, "train_runtime": 4665.8794, "train_tokens_per_second": 5964.372 }, { "epoch": 1.6933333333333334, "grad_norm": 0.9411514401435852, "learning_rate": 3.073808209092582e-05, "loss": 1.5212, "num_input_tokens_seen": 27834480, "step": 4604, "train_runtime": 4666.7749, "train_tokens_per_second": 5964.393 }, { "epoch": 1.6937011494252874, "grad_norm": 0.9370007514953613, "learning_rate": 3.070127001656544e-05, "loss": 1.3163, "num_input_tokens_seen": 27841168, "step": 4605, "train_runtime": 4667.8657, "train_tokens_per_second": 5964.432 }, { "epoch": 1.6940689655172414, "grad_norm": 0.9840338230133057, "learning_rate": 3.066445794220504e-05, "loss": 1.4556, "num_input_tokens_seen": 27847216, "step": 4606, "train_runtime": 4668.8424, "train_tokens_per_second": 5964.48 }, { "epoch": 1.6944367816091954, "grad_norm": 1.042328953742981, "learning_rate": 3.0627645867844656e-05, "loss": 1.7598, "num_input_tokens_seen": 27852688, "step": 4607, "train_runtime": 4669.751, "train_tokens_per_second": 5964.491 }, { "epoch": 1.6948045977011494, "grad_norm": 0.9465333819389343, "learning_rate": 3.0590833793484265e-05, "loss": 1.446, "num_input_tokens_seen": 27859136, "step": 4608, "train_runtime": 4670.7797, "train_tokens_per_second": 5964.558 }, { "epoch": 1.6951724137931035, "grad_norm": 0.8988509774208069, "learning_rate": 3.0554021719123874e-05, "loss": 1.5137, "num_input_tokens_seen": 27866720, "step": 4609, "train_runtime": 4671.9727, "train_tokens_per_second": 5964.658 }, { "epoch": 1.6955402298850575, "grad_norm": 1.0273783206939697, "learning_rate": 3.0517209644763483e-05, "loss": 1.6119, "num_input_tokens_seen": 27871344, "step": 4610, "train_runtime": 4672.7671, "train_tokens_per_second": 5964.634 }, { "epoch": 1.6959080459770115, "grad_norm": 1.0789744853973389, "learning_rate": 3.0480397570403095e-05, "loss": 1.6015, "num_input_tokens_seen": 27876304, "step": 4611, "train_runtime": 4673.6332, "train_tokens_per_second": 5964.59 }, { "epoch": 1.6962758620689655, "grad_norm": 1.0871307849884033, "learning_rate": 3.0443585496042704e-05, "loss": 1.5275, "num_input_tokens_seen": 27883824, "step": 4612, "train_runtime": 4674.8223, "train_tokens_per_second": 5964.681 }, { "epoch": 1.6966436781609195, "grad_norm": 1.0001200437545776, "learning_rate": 3.040677342168231e-05, "loss": 1.502, "num_input_tokens_seen": 27888192, "step": 4613, "train_runtime": 4675.5861, "train_tokens_per_second": 5964.641 }, { "epoch": 1.6970114942528736, "grad_norm": 0.9980902671813965, "learning_rate": 3.0369961347321922e-05, "loss": 1.5381, "num_input_tokens_seen": 27895008, "step": 4614, "train_runtime": 4676.6711, "train_tokens_per_second": 5964.715 }, { "epoch": 1.6973793103448276, "grad_norm": 1.0284391641616821, "learning_rate": 3.033314927296153e-05, "loss": 1.5916, "num_input_tokens_seen": 27899840, "step": 4615, "train_runtime": 4677.4828, "train_tokens_per_second": 5964.713 }, { "epoch": 1.6977471264367816, "grad_norm": 0.9810758233070374, "learning_rate": 3.0296337198601143e-05, "loss": 1.3792, "num_input_tokens_seen": 27906496, "step": 4616, "train_runtime": 4678.5449, "train_tokens_per_second": 5964.781 }, { "epoch": 1.6981149425287356, "grad_norm": 1.088984489440918, "learning_rate": 3.0259525124240752e-05, "loss": 1.7894, "num_input_tokens_seen": 27911424, "step": 4617, "train_runtime": 4679.3707, "train_tokens_per_second": 5964.782 }, { "epoch": 1.6984827586206896, "grad_norm": 1.0045228004455566, "learning_rate": 3.0222713049880364e-05, "loss": 1.5744, "num_input_tokens_seen": 27916288, "step": 4618, "train_runtime": 4680.2149, "train_tokens_per_second": 5964.745 }, { "epoch": 1.6988505747126437, "grad_norm": 0.9596930742263794, "learning_rate": 3.018590097551997e-05, "loss": 1.4039, "num_input_tokens_seen": 27922000, "step": 4619, "train_runtime": 4681.1671, "train_tokens_per_second": 5964.752 }, { "epoch": 1.6992183908045977, "grad_norm": 0.8283352255821228, "learning_rate": 3.0149088901159582e-05, "loss": 1.1706, "num_input_tokens_seen": 27933088, "step": 4620, "train_runtime": 4682.8063, "train_tokens_per_second": 5965.032 }, { "epoch": 1.6995862068965517, "grad_norm": 1.0603177547454834, "learning_rate": 3.011227682679919e-05, "loss": 1.5413, "num_input_tokens_seen": 27939200, "step": 4621, "train_runtime": 4684.2644, "train_tokens_per_second": 5964.48 }, { "epoch": 1.6999540229885057, "grad_norm": 0.9649791121482849, "learning_rate": 3.0075464752438803e-05, "loss": 1.2902, "num_input_tokens_seen": 27945216, "step": 4622, "train_runtime": 4685.2435, "train_tokens_per_second": 5964.517 }, { "epoch": 1.7003218390804598, "grad_norm": 1.0330976247787476, "learning_rate": 3.0038652678078412e-05, "loss": 1.5685, "num_input_tokens_seen": 27951184, "step": 4623, "train_runtime": 4686.2282, "train_tokens_per_second": 5964.538 }, { "epoch": 1.7006896551724138, "grad_norm": 1.0130820274353027, "learning_rate": 3.0001840603718024e-05, "loss": 1.6268, "num_input_tokens_seen": 27957472, "step": 4624, "train_runtime": 4687.2379, "train_tokens_per_second": 5964.594 }, { "epoch": 1.7010574712643678, "grad_norm": 1.0403722524642944, "learning_rate": 2.996502852935763e-05, "loss": 1.3725, "num_input_tokens_seen": 27963168, "step": 4625, "train_runtime": 4688.1637, "train_tokens_per_second": 5964.631 }, { "epoch": 1.7014252873563218, "grad_norm": 1.084006667137146, "learning_rate": 2.9928216454997242e-05, "loss": 1.5613, "num_input_tokens_seen": 27967504, "step": 4626, "train_runtime": 4688.9311, "train_tokens_per_second": 5964.58 }, { "epoch": 1.7017931034482758, "grad_norm": 0.9584836959838867, "learning_rate": 2.989140438063685e-05, "loss": 1.3322, "num_input_tokens_seen": 27972864, "step": 4627, "train_runtime": 4689.8415, "train_tokens_per_second": 5964.565 }, { "epoch": 1.7021609195402299, "grad_norm": 1.0244557857513428, "learning_rate": 2.9854592306276457e-05, "loss": 1.682, "num_input_tokens_seen": 27978160, "step": 4628, "train_runtime": 4690.7345, "train_tokens_per_second": 5964.558 }, { "epoch": 1.7025287356321839, "grad_norm": 0.9913014769554138, "learning_rate": 2.981778023191607e-05, "loss": 1.418, "num_input_tokens_seen": 27983312, "step": 4629, "train_runtime": 4691.5947, "train_tokens_per_second": 5964.563 }, { "epoch": 1.702896551724138, "grad_norm": 1.0452675819396973, "learning_rate": 2.9780968157555678e-05, "loss": 1.6439, "num_input_tokens_seen": 27987968, "step": 4630, "train_runtime": 4692.4013, "train_tokens_per_second": 5964.53 }, { "epoch": 1.703264367816092, "grad_norm": 0.9283667802810669, "learning_rate": 2.974415608319529e-05, "loss": 1.3235, "num_input_tokens_seen": 27992736, "step": 4631, "train_runtime": 4693.2164, "train_tokens_per_second": 5964.51 }, { "epoch": 1.703632183908046, "grad_norm": 0.9419856071472168, "learning_rate": 2.97073440088349e-05, "loss": 1.3919, "num_input_tokens_seen": 27999280, "step": 4632, "train_runtime": 4694.2743, "train_tokens_per_second": 5964.56 }, { "epoch": 1.704, "grad_norm": 1.0104327201843262, "learning_rate": 2.967053193447451e-05, "loss": 1.4808, "num_input_tokens_seen": 28006560, "step": 4633, "train_runtime": 4695.4532, "train_tokens_per_second": 5964.613 }, { "epoch": 1.704367816091954, "grad_norm": 0.9505506157875061, "learning_rate": 2.9633719860114117e-05, "loss": 1.3957, "num_input_tokens_seen": 28012672, "step": 4634, "train_runtime": 4696.4422, "train_tokens_per_second": 5964.658 }, { "epoch": 1.704735632183908, "grad_norm": 1.0302808284759521, "learning_rate": 2.959690778575373e-05, "loss": 1.6753, "num_input_tokens_seen": 28018208, "step": 4635, "train_runtime": 4697.3881, "train_tokens_per_second": 5964.636 }, { "epoch": 1.705103448275862, "grad_norm": 1.0058319568634033, "learning_rate": 2.9560095711393338e-05, "loss": 1.5491, "num_input_tokens_seen": 28022896, "step": 4636, "train_runtime": 4698.1957, "train_tokens_per_second": 5964.608 }, { "epoch": 1.705471264367816, "grad_norm": 0.9292551875114441, "learning_rate": 2.952328363703295e-05, "loss": 1.5156, "num_input_tokens_seen": 28028400, "step": 4637, "train_runtime": 4699.1131, "train_tokens_per_second": 5964.615 }, { "epoch": 1.70583908045977, "grad_norm": 1.0408554077148438, "learning_rate": 2.948647156267256e-05, "loss": 1.5696, "num_input_tokens_seen": 28033040, "step": 4638, "train_runtime": 4699.9117, "train_tokens_per_second": 5964.589 }, { "epoch": 1.706206896551724, "grad_norm": 0.992240846157074, "learning_rate": 2.944965948831217e-05, "loss": 1.6072, "num_input_tokens_seen": 28038896, "step": 4639, "train_runtime": 4700.8625, "train_tokens_per_second": 5964.628 }, { "epoch": 1.706574712643678, "grad_norm": 0.9619226455688477, "learning_rate": 2.9412847413951777e-05, "loss": 1.4376, "num_input_tokens_seen": 28045584, "step": 4640, "train_runtime": 4701.9366, "train_tokens_per_second": 5964.688 }, { "epoch": 1.7069425287356323, "grad_norm": 0.9967951774597168, "learning_rate": 2.937603533959139e-05, "loss": 1.5017, "num_input_tokens_seen": 28050160, "step": 4641, "train_runtime": 4702.7025, "train_tokens_per_second": 5964.689 }, { "epoch": 1.7073103448275861, "grad_norm": 0.9876623749732971, "learning_rate": 2.9339223265230998e-05, "loss": 1.557, "num_input_tokens_seen": 28055232, "step": 4642, "train_runtime": 4703.5717, "train_tokens_per_second": 5964.666 }, { "epoch": 1.7076781609195404, "grad_norm": 0.9602704048156738, "learning_rate": 2.9302411190870603e-05, "loss": 1.3624, "num_input_tokens_seen": 28061936, "step": 4643, "train_runtime": 4704.6463, "train_tokens_per_second": 5964.728 }, { "epoch": 1.7080459770114942, "grad_norm": 1.025449275970459, "learning_rate": 2.9265599116510216e-05, "loss": 1.5564, "num_input_tokens_seen": 28068672, "step": 4644, "train_runtime": 4705.7051, "train_tokens_per_second": 5964.817 }, { "epoch": 1.7084137931034484, "grad_norm": 0.983074963092804, "learning_rate": 2.9228787042149825e-05, "loss": 1.6266, "num_input_tokens_seen": 28074144, "step": 4645, "train_runtime": 4706.614, "train_tokens_per_second": 5964.828 }, { "epoch": 1.7087816091954022, "grad_norm": 1.0376065969467163, "learning_rate": 2.9191974967789437e-05, "loss": 1.7139, "num_input_tokens_seen": 28079168, "step": 4646, "train_runtime": 4707.4639, "train_tokens_per_second": 5964.819 }, { "epoch": 1.7091494252873565, "grad_norm": 1.0465658903121948, "learning_rate": 2.9155162893429046e-05, "loss": 1.5849, "num_input_tokens_seen": 28084592, "step": 4647, "train_runtime": 4708.3744, "train_tokens_per_second": 5964.817 }, { "epoch": 1.7095172413793103, "grad_norm": 0.9902276992797852, "learning_rate": 2.9118350819068658e-05, "loss": 1.4385, "num_input_tokens_seen": 28088752, "step": 4648, "train_runtime": 4709.0813, "train_tokens_per_second": 5964.805 }, { "epoch": 1.7098850574712645, "grad_norm": 1.0716465711593628, "learning_rate": 2.9081538744708264e-05, "loss": 1.6299, "num_input_tokens_seen": 28093872, "step": 4649, "train_runtime": 4709.9453, "train_tokens_per_second": 5964.798 }, { "epoch": 1.7102528735632183, "grad_norm": 0.9719383716583252, "learning_rate": 2.9044726670347876e-05, "loss": 1.5073, "num_input_tokens_seen": 28100368, "step": 4650, "train_runtime": 4711.0004, "train_tokens_per_second": 5964.841 }, { "epoch": 1.7106206896551726, "grad_norm": 0.7893573641777039, "learning_rate": 2.9007914595987485e-05, "loss": 1.3181, "num_input_tokens_seen": 28110960, "step": 4651, "train_runtime": 4713.0737, "train_tokens_per_second": 5964.464 }, { "epoch": 1.7109885057471264, "grad_norm": 0.9521739482879639, "learning_rate": 2.8971102521627097e-05, "loss": 1.3179, "num_input_tokens_seen": 28116720, "step": 4652, "train_runtime": 4714.0191, "train_tokens_per_second": 5964.49 }, { "epoch": 1.7113563218390806, "grad_norm": 0.9731817245483398, "learning_rate": 2.8934290447266703e-05, "loss": 1.4212, "num_input_tokens_seen": 28123008, "step": 4653, "train_runtime": 4715.0562, "train_tokens_per_second": 5964.512 }, { "epoch": 1.7117241379310344, "grad_norm": 0.9910678863525391, "learning_rate": 2.8897478372906318e-05, "loss": 1.4926, "num_input_tokens_seen": 28130192, "step": 4654, "train_runtime": 4716.2194, "train_tokens_per_second": 5964.564 }, { "epoch": 1.7120919540229886, "grad_norm": 1.0696122646331787, "learning_rate": 2.8860666298545924e-05, "loss": 1.4922, "num_input_tokens_seen": 28137040, "step": 4655, "train_runtime": 4717.3046, "train_tokens_per_second": 5964.643 }, { "epoch": 1.7124597701149424, "grad_norm": 1.0817041397094727, "learning_rate": 2.8823854224185536e-05, "loss": 1.4757, "num_input_tokens_seen": 28141776, "step": 4656, "train_runtime": 4718.1018, "train_tokens_per_second": 5964.639 }, { "epoch": 1.7128275862068967, "grad_norm": 1.0063755512237549, "learning_rate": 2.8787042149825145e-05, "loss": 1.4174, "num_input_tokens_seen": 28150544, "step": 4657, "train_runtime": 4719.4416, "train_tokens_per_second": 5964.804 }, { "epoch": 1.7131954022988505, "grad_norm": 1.0067154169082642, "learning_rate": 2.875023007546475e-05, "loss": 1.4901, "num_input_tokens_seen": 28155488, "step": 4658, "train_runtime": 4720.2856, "train_tokens_per_second": 5964.785 }, { "epoch": 1.7135632183908047, "grad_norm": 1.0253180265426636, "learning_rate": 2.8713418001104363e-05, "loss": 1.4496, "num_input_tokens_seen": 28163168, "step": 4659, "train_runtime": 4721.4569, "train_tokens_per_second": 5964.932 }, { "epoch": 1.7139310344827585, "grad_norm": 0.9907005429267883, "learning_rate": 2.867660592674397e-05, "loss": 1.5636, "num_input_tokens_seen": 28168448, "step": 4660, "train_runtime": 4722.3326, "train_tokens_per_second": 5964.944 }, { "epoch": 1.7142988505747128, "grad_norm": 0.9704107642173767, "learning_rate": 2.8639793852383584e-05, "loss": 1.348, "num_input_tokens_seen": 28177408, "step": 4661, "train_runtime": 4723.705, "train_tokens_per_second": 5965.107 }, { "epoch": 1.7146666666666666, "grad_norm": 1.0285683870315552, "learning_rate": 2.8602981778023193e-05, "loss": 1.5931, "num_input_tokens_seen": 28184288, "step": 4662, "train_runtime": 4724.8051, "train_tokens_per_second": 5965.175 }, { "epoch": 1.7150344827586208, "grad_norm": 0.9361411929130554, "learning_rate": 2.8566169703662805e-05, "loss": 1.4663, "num_input_tokens_seen": 28191536, "step": 4663, "train_runtime": 4725.941, "train_tokens_per_second": 5965.275 }, { "epoch": 1.7154022988505746, "grad_norm": 1.0544816255569458, "learning_rate": 2.852935762930241e-05, "loss": 1.6253, "num_input_tokens_seen": 28196080, "step": 4664, "train_runtime": 4726.7401, "train_tokens_per_second": 5965.228 }, { "epoch": 1.7157701149425288, "grad_norm": 1.0819185972213745, "learning_rate": 2.8492545554942023e-05, "loss": 1.6852, "num_input_tokens_seen": 28200656, "step": 4665, "train_runtime": 4727.541, "train_tokens_per_second": 5965.185 }, { "epoch": 1.7161379310344826, "grad_norm": 0.9444822072982788, "learning_rate": 2.8455733480581632e-05, "loss": 1.506, "num_input_tokens_seen": 28208128, "step": 4666, "train_runtime": 4728.731, "train_tokens_per_second": 5965.264 }, { "epoch": 1.7165057471264369, "grad_norm": 1.2216205596923828, "learning_rate": 2.8418921406221244e-05, "loss": 1.6304, "num_input_tokens_seen": 28213872, "step": 4667, "train_runtime": 4729.6887, "train_tokens_per_second": 5965.27 }, { "epoch": 1.7168735632183907, "grad_norm": 0.9831274151802063, "learning_rate": 2.838210933186085e-05, "loss": 1.4768, "num_input_tokens_seen": 28220176, "step": 4668, "train_runtime": 4730.7036, "train_tokens_per_second": 5965.323 }, { "epoch": 1.717241379310345, "grad_norm": 1.070762038230896, "learning_rate": 2.8345297257500465e-05, "loss": 1.3823, "num_input_tokens_seen": 28226944, "step": 4669, "train_runtime": 4731.798, "train_tokens_per_second": 5965.374 }, { "epoch": 1.7176091954022987, "grad_norm": 0.9777244329452515, "learning_rate": 2.830848518314007e-05, "loss": 1.711, "num_input_tokens_seen": 28232320, "step": 4670, "train_runtime": 4732.6719, "train_tokens_per_second": 5965.408 }, { "epoch": 1.717977011494253, "grad_norm": 1.0839136838912964, "learning_rate": 2.8271673108779683e-05, "loss": 1.5984, "num_input_tokens_seen": 28237984, "step": 4671, "train_runtime": 4733.6058, "train_tokens_per_second": 5965.428 }, { "epoch": 1.7183448275862068, "grad_norm": 0.9616579413414001, "learning_rate": 2.8234861034419292e-05, "loss": 1.1284, "num_input_tokens_seen": 28245312, "step": 4672, "train_runtime": 4734.782, "train_tokens_per_second": 5965.494 }, { "epoch": 1.718712643678161, "grad_norm": 1.0128158330917358, "learning_rate": 2.8198048960058897e-05, "loss": 1.4396, "num_input_tokens_seen": 28250544, "step": 4673, "train_runtime": 4735.6455, "train_tokens_per_second": 5965.511 }, { "epoch": 1.7190804597701148, "grad_norm": 1.0112683773040771, "learning_rate": 2.816123688569851e-05, "loss": 1.467, "num_input_tokens_seen": 28255760, "step": 4674, "train_runtime": 4736.5468, "train_tokens_per_second": 5965.477 }, { "epoch": 1.719448275862069, "grad_norm": 0.9474003314971924, "learning_rate": 2.812442481133812e-05, "loss": 1.3938, "num_input_tokens_seen": 28261984, "step": 4675, "train_runtime": 4737.5505, "train_tokens_per_second": 5965.527 }, { "epoch": 1.7198160919540229, "grad_norm": 1.0330866575241089, "learning_rate": 2.808761273697773e-05, "loss": 1.5392, "num_input_tokens_seen": 28267120, "step": 4676, "train_runtime": 4738.4271, "train_tokens_per_second": 5965.507 }, { "epoch": 1.720183908045977, "grad_norm": 1.1261749267578125, "learning_rate": 2.805080066261734e-05, "loss": 1.7794, "num_input_tokens_seen": 28273200, "step": 4677, "train_runtime": 4739.4305, "train_tokens_per_second": 5965.527 }, { "epoch": 1.720551724137931, "grad_norm": 0.9648178219795227, "learning_rate": 2.8013988588256952e-05, "loss": 1.3757, "num_input_tokens_seen": 28280048, "step": 4678, "train_runtime": 4740.548, "train_tokens_per_second": 5965.565 }, { "epoch": 1.7209195402298851, "grad_norm": 1.0651392936706543, "learning_rate": 2.7977176513896557e-05, "loss": 1.7287, "num_input_tokens_seen": 28284960, "step": 4679, "train_runtime": 4741.3716, "train_tokens_per_second": 5965.565 }, { "epoch": 1.721287356321839, "grad_norm": 0.9519479870796204, "learning_rate": 2.794036443953617e-05, "loss": 1.4971, "num_input_tokens_seen": 28292464, "step": 4680, "train_runtime": 4742.5646, "train_tokens_per_second": 5965.646 }, { "epoch": 1.7216551724137932, "grad_norm": 0.9936322569847107, "learning_rate": 2.790355236517578e-05, "loss": 1.5905, "num_input_tokens_seen": 28297920, "step": 4681, "train_runtime": 4744.0386, "train_tokens_per_second": 5964.943 }, { "epoch": 1.722022988505747, "grad_norm": 0.9680910110473633, "learning_rate": 2.786674029081539e-05, "loss": 1.4007, "num_input_tokens_seen": 28302400, "step": 4682, "train_runtime": 4744.8219, "train_tokens_per_second": 5964.902 }, { "epoch": 1.7223908045977012, "grad_norm": 1.003828525543213, "learning_rate": 2.7829928216454996e-05, "loss": 1.4056, "num_input_tokens_seen": 28307376, "step": 4683, "train_runtime": 4745.6753, "train_tokens_per_second": 5964.878 }, { "epoch": 1.722758620689655, "grad_norm": 1.0208098888397217, "learning_rate": 2.7793116142094612e-05, "loss": 1.5971, "num_input_tokens_seen": 28313248, "step": 4684, "train_runtime": 4746.6515, "train_tokens_per_second": 5964.889 }, { "epoch": 1.7231264367816093, "grad_norm": 1.088664174079895, "learning_rate": 2.7756304067734218e-05, "loss": 1.5996, "num_input_tokens_seen": 28319312, "step": 4685, "train_runtime": 4747.6485, "train_tokens_per_second": 5964.913 }, { "epoch": 1.723494252873563, "grad_norm": 0.9208300113677979, "learning_rate": 2.771949199337383e-05, "loss": 1.3616, "num_input_tokens_seen": 28326848, "step": 4686, "train_runtime": 4748.859, "train_tokens_per_second": 5964.98 }, { "epoch": 1.7238620689655173, "grad_norm": 1.0395221710205078, "learning_rate": 2.768267991901344e-05, "loss": 1.391, "num_input_tokens_seen": 28334336, "step": 4687, "train_runtime": 4750.0355, "train_tokens_per_second": 5965.079 }, { "epoch": 1.724229885057471, "grad_norm": 1.0180349349975586, "learning_rate": 2.7645867844653044e-05, "loss": 1.5954, "num_input_tokens_seen": 28341184, "step": 4688, "train_runtime": 4751.1313, "train_tokens_per_second": 5965.144 }, { "epoch": 1.7245977011494253, "grad_norm": 0.9864228367805481, "learning_rate": 2.7609055770292657e-05, "loss": 1.4096, "num_input_tokens_seen": 28347024, "step": 4689, "train_runtime": 4752.0875, "train_tokens_per_second": 5965.173 }, { "epoch": 1.7249655172413794, "grad_norm": 1.024919867515564, "learning_rate": 2.7572243695932265e-05, "loss": 1.5929, "num_input_tokens_seen": 28351904, "step": 4690, "train_runtime": 4752.8925, "train_tokens_per_second": 5965.189 }, { "epoch": 1.7253333333333334, "grad_norm": 1.0786160230636597, "learning_rate": 2.7535431621571878e-05, "loss": 1.4965, "num_input_tokens_seen": 28359904, "step": 4691, "train_runtime": 4754.1516, "train_tokens_per_second": 5965.292 }, { "epoch": 1.7257011494252874, "grad_norm": 0.9984427094459534, "learning_rate": 2.7498619547211483e-05, "loss": 1.5075, "num_input_tokens_seen": 28364992, "step": 4692, "train_runtime": 4755.0029, "train_tokens_per_second": 5965.294 }, { "epoch": 1.7260689655172414, "grad_norm": 0.9112803339958191, "learning_rate": 2.74618074728511e-05, "loss": 1.288, "num_input_tokens_seen": 28375504, "step": 4693, "train_runtime": 4756.5792, "train_tokens_per_second": 5965.528 }, { "epoch": 1.7264367816091954, "grad_norm": 0.9645473957061768, "learning_rate": 2.7424995398490704e-05, "loss": 1.4539, "num_input_tokens_seen": 28380624, "step": 4694, "train_runtime": 4757.4552, "train_tokens_per_second": 5965.505 }, { "epoch": 1.7268045977011495, "grad_norm": 1.0410685539245605, "learning_rate": 2.7388183324130317e-05, "loss": 1.7913, "num_input_tokens_seen": 28385808, "step": 4695, "train_runtime": 4758.3265, "train_tokens_per_second": 5965.502 }, { "epoch": 1.7271724137931035, "grad_norm": 0.9809327125549316, "learning_rate": 2.7351371249769926e-05, "loss": 1.4374, "num_input_tokens_seen": 28391280, "step": 4696, "train_runtime": 4759.2339, "train_tokens_per_second": 5965.515 }, { "epoch": 1.7275402298850575, "grad_norm": 1.0407499074935913, "learning_rate": 2.7314559175409538e-05, "loss": 1.6229, "num_input_tokens_seen": 28397584, "step": 4697, "train_runtime": 4760.2809, "train_tokens_per_second": 5965.527 }, { "epoch": 1.7279080459770115, "grad_norm": 0.9742929935455322, "learning_rate": 2.7277747101049143e-05, "loss": 1.4711, "num_input_tokens_seen": 28403488, "step": 4698, "train_runtime": 4761.2597, "train_tokens_per_second": 5965.541 }, { "epoch": 1.7282758620689656, "grad_norm": 1.065129280090332, "learning_rate": 2.724093502668876e-05, "loss": 1.6719, "num_input_tokens_seen": 28408624, "step": 4699, "train_runtime": 4762.123, "train_tokens_per_second": 5965.538 }, { "epoch": 1.7286436781609196, "grad_norm": 1.0128817558288574, "learning_rate": 2.7204122952328365e-05, "loss": 1.5271, "num_input_tokens_seen": 28414128, "step": 4700, "train_runtime": 4763.0537, "train_tokens_per_second": 5965.528 }, { "epoch": 1.7290114942528736, "grad_norm": 1.002425193786621, "learning_rate": 2.7167310877967977e-05, "loss": 1.5294, "num_input_tokens_seen": 28419408, "step": 4701, "train_runtime": 4763.9028, "train_tokens_per_second": 5965.573 }, { "epoch": 1.7293793103448276, "grad_norm": 1.0439168214797974, "learning_rate": 2.7130498803607586e-05, "loss": 1.3572, "num_input_tokens_seen": 28426880, "step": 4702, "train_runtime": 4765.0851, "train_tokens_per_second": 5965.66 }, { "epoch": 1.7297471264367816, "grad_norm": 0.9425588846206665, "learning_rate": 2.709368672924719e-05, "loss": 1.5627, "num_input_tokens_seen": 28433504, "step": 4703, "train_runtime": 4766.1329, "train_tokens_per_second": 5965.739 }, { "epoch": 1.7301149425287357, "grad_norm": 1.1186126470565796, "learning_rate": 2.7056874654886804e-05, "loss": 1.7109, "num_input_tokens_seen": 28438720, "step": 4704, "train_runtime": 4766.9853, "train_tokens_per_second": 5965.766 }, { "epoch": 1.7304827586206897, "grad_norm": 0.8971080183982849, "learning_rate": 2.7020062580526412e-05, "loss": 1.4155, "num_input_tokens_seen": 28445984, "step": 4705, "train_runtime": 4768.1134, "train_tokens_per_second": 5965.878 }, { "epoch": 1.7308505747126437, "grad_norm": 1.0290093421936035, "learning_rate": 2.6983250506166025e-05, "loss": 1.6032, "num_input_tokens_seen": 28451472, "step": 4706, "train_runtime": 4769.0112, "train_tokens_per_second": 5965.906 }, { "epoch": 1.7312183908045977, "grad_norm": 1.020194411277771, "learning_rate": 2.694643843180563e-05, "loss": 1.5013, "num_input_tokens_seen": 28456336, "step": 4707, "train_runtime": 4769.8552, "train_tokens_per_second": 5965.87 }, { "epoch": 1.7315862068965517, "grad_norm": 0.9831212759017944, "learning_rate": 2.6909626357445246e-05, "loss": 1.5739, "num_input_tokens_seen": 28461552, "step": 4708, "train_runtime": 4770.7213, "train_tokens_per_second": 5965.88 }, { "epoch": 1.7319540229885058, "grad_norm": 1.0328938961029053, "learning_rate": 2.687281428308485e-05, "loss": 1.56, "num_input_tokens_seen": 28469680, "step": 4709, "train_runtime": 4771.9758, "train_tokens_per_second": 5966.015 }, { "epoch": 1.7323218390804598, "grad_norm": 1.0327404737472534, "learning_rate": 2.6836002208724464e-05, "loss": 1.479, "num_input_tokens_seen": 28476016, "step": 4710, "train_runtime": 4772.9924, "train_tokens_per_second": 5966.072 }, { "epoch": 1.7326896551724138, "grad_norm": 0.9637169241905212, "learning_rate": 2.6799190134364073e-05, "loss": 1.3993, "num_input_tokens_seen": 28480672, "step": 4711, "train_runtime": 4774.3143, "train_tokens_per_second": 5965.395 }, { "epoch": 1.7330574712643678, "grad_norm": 0.97785884141922, "learning_rate": 2.6762378060003685e-05, "loss": 1.36, "num_input_tokens_seen": 28489792, "step": 4712, "train_runtime": 4775.7287, "train_tokens_per_second": 5965.538 }, { "epoch": 1.7334252873563218, "grad_norm": 1.0487269163131714, "learning_rate": 2.672556598564329e-05, "loss": 1.5209, "num_input_tokens_seen": 28495680, "step": 4713, "train_runtime": 4776.6925, "train_tokens_per_second": 5965.567 }, { "epoch": 1.7337931034482759, "grad_norm": 0.9517030119895935, "learning_rate": 2.6688753911282906e-05, "loss": 1.412, "num_input_tokens_seen": 28499952, "step": 4714, "train_runtime": 4777.4332, "train_tokens_per_second": 5965.536 }, { "epoch": 1.7341609195402299, "grad_norm": 0.9899877309799194, "learning_rate": 2.665194183692251e-05, "loss": 1.3717, "num_input_tokens_seen": 28506128, "step": 4715, "train_runtime": 4778.4215, "train_tokens_per_second": 5965.595 }, { "epoch": 1.734528735632184, "grad_norm": 1.0582808256149292, "learning_rate": 2.6615129762562124e-05, "loss": 1.6263, "num_input_tokens_seen": 28513168, "step": 4716, "train_runtime": 4779.5335, "train_tokens_per_second": 5965.68 }, { "epoch": 1.734896551724138, "grad_norm": 0.9215847849845886, "learning_rate": 2.6578317688201733e-05, "loss": 1.1623, "num_input_tokens_seen": 28520000, "step": 4717, "train_runtime": 4780.6031, "train_tokens_per_second": 5965.775 }, { "epoch": 1.735264367816092, "grad_norm": 1.154850959777832, "learning_rate": 2.6541505613841338e-05, "loss": 1.7994, "num_input_tokens_seen": 28526688, "step": 4718, "train_runtime": 4781.7226, "train_tokens_per_second": 5965.776 }, { "epoch": 1.735632183908046, "grad_norm": 0.7254742383956909, "learning_rate": 2.650469353948095e-05, "loss": 1.1917, "num_input_tokens_seen": 28541424, "step": 4719, "train_runtime": 4783.8707, "train_tokens_per_second": 5966.178 }, { "epoch": 1.736, "grad_norm": 0.9757923483848572, "learning_rate": 2.646788146512056e-05, "loss": 1.4235, "num_input_tokens_seen": 28546768, "step": 4720, "train_runtime": 4784.771, "train_tokens_per_second": 5966.172 }, { "epoch": 1.736367816091954, "grad_norm": 1.0379769802093506, "learning_rate": 2.643106939076017e-05, "loss": 1.4071, "num_input_tokens_seen": 28550944, "step": 4721, "train_runtime": 4785.531, "train_tokens_per_second": 5966.097 }, { "epoch": 1.736735632183908, "grad_norm": 1.041725516319275, "learning_rate": 2.6394257316399777e-05, "loss": 1.4824, "num_input_tokens_seen": 28557264, "step": 4722, "train_runtime": 4786.5502, "train_tokens_per_second": 5966.147 }, { "epoch": 1.737103448275862, "grad_norm": 0.9187132120132446, "learning_rate": 2.6357445242039393e-05, "loss": 1.4692, "num_input_tokens_seen": 28562800, "step": 4723, "train_runtime": 4787.4731, "train_tokens_per_second": 5966.154 }, { "epoch": 1.737471264367816, "grad_norm": 1.0748697519302368, "learning_rate": 2.6320633167679e-05, "loss": 1.54, "num_input_tokens_seen": 28567200, "step": 4724, "train_runtime": 4788.2434, "train_tokens_per_second": 5966.113 }, { "epoch": 1.73783908045977, "grad_norm": 1.0062446594238281, "learning_rate": 2.628382109331861e-05, "loss": 1.6539, "num_input_tokens_seen": 28572352, "step": 4725, "train_runtime": 4789.1026, "train_tokens_per_second": 5966.118 }, { "epoch": 1.7382068965517241, "grad_norm": 1.0973478555679321, "learning_rate": 2.624700901895822e-05, "loss": 1.6675, "num_input_tokens_seen": 28577824, "step": 4726, "train_runtime": 4790.0021, "train_tokens_per_second": 5966.14 }, { "epoch": 1.7385747126436781, "grad_norm": 1.0328434705734253, "learning_rate": 2.6210196944597832e-05, "loss": 1.514, "num_input_tokens_seen": 28586240, "step": 4727, "train_runtime": 4791.3075, "train_tokens_per_second": 5966.271 }, { "epoch": 1.7389425287356322, "grad_norm": 1.0493148565292358, "learning_rate": 2.6173384870237437e-05, "loss": 1.5932, "num_input_tokens_seen": 28593248, "step": 4728, "train_runtime": 4792.4231, "train_tokens_per_second": 5966.345 }, { "epoch": 1.7393103448275862, "grad_norm": 0.9841045141220093, "learning_rate": 2.613657279587705e-05, "loss": 1.397, "num_input_tokens_seen": 28599184, "step": 4729, "train_runtime": 4793.4131, "train_tokens_per_second": 5966.351 }, { "epoch": 1.7396781609195402, "grad_norm": 1.0101946592330933, "learning_rate": 2.609976072151666e-05, "loss": 1.5192, "num_input_tokens_seen": 28604144, "step": 4730, "train_runtime": 4794.2402, "train_tokens_per_second": 5966.356 }, { "epoch": 1.7400459770114942, "grad_norm": 1.1683965921401978, "learning_rate": 2.606294864715627e-05, "loss": 1.7244, "num_input_tokens_seen": 28609184, "step": 4731, "train_runtime": 4795.1084, "train_tokens_per_second": 5966.327 }, { "epoch": 1.7404137931034482, "grad_norm": 1.0627989768981934, "learning_rate": 2.602613657279588e-05, "loss": 1.5207, "num_input_tokens_seen": 28614256, "step": 4732, "train_runtime": 4795.9651, "train_tokens_per_second": 5966.319 }, { "epoch": 1.7407816091954023, "grad_norm": 1.1456577777862549, "learning_rate": 2.5989324498435485e-05, "loss": 1.4358, "num_input_tokens_seen": 28619984, "step": 4733, "train_runtime": 4796.8959, "train_tokens_per_second": 5966.355 }, { "epoch": 1.7411494252873563, "grad_norm": 1.0102976560592651, "learning_rate": 2.5952512424075097e-05, "loss": 1.4043, "num_input_tokens_seen": 28626640, "step": 4734, "train_runtime": 4797.9706, "train_tokens_per_second": 5966.406 }, { "epoch": 1.7415172413793103, "grad_norm": 1.0463898181915283, "learning_rate": 2.5915700349714706e-05, "loss": 1.6174, "num_input_tokens_seen": 28631824, "step": 4735, "train_runtime": 4798.835, "train_tokens_per_second": 5966.411 }, { "epoch": 1.7418850574712643, "grad_norm": 1.050277590751648, "learning_rate": 2.587888827535432e-05, "loss": 1.4079, "num_input_tokens_seen": 28637296, "step": 4736, "train_runtime": 4799.7242, "train_tokens_per_second": 5966.446 }, { "epoch": 1.7422528735632183, "grad_norm": 1.0384160280227661, "learning_rate": 2.5842076200993924e-05, "loss": 1.5397, "num_input_tokens_seen": 28645440, "step": 4737, "train_runtime": 4801.0199, "train_tokens_per_second": 5966.532 }, { "epoch": 1.7426206896551724, "grad_norm": 1.1893243789672852, "learning_rate": 2.580526412663354e-05, "loss": 1.5227, "num_input_tokens_seen": 28650368, "step": 4738, "train_runtime": 4801.8614, "train_tokens_per_second": 5966.513 }, { "epoch": 1.7429885057471264, "grad_norm": 1.1832375526428223, "learning_rate": 2.5768452052273145e-05, "loss": 1.6056, "num_input_tokens_seen": 28657424, "step": 4739, "train_runtime": 4802.9949, "train_tokens_per_second": 5966.574 }, { "epoch": 1.7433563218390806, "grad_norm": 1.0431658029556274, "learning_rate": 2.5731639977912758e-05, "loss": 1.6738, "num_input_tokens_seen": 28663664, "step": 4740, "train_runtime": 4803.9938, "train_tokens_per_second": 5966.632 }, { "epoch": 1.7437241379310344, "grad_norm": 1.0423671007156372, "learning_rate": 2.5694827903552366e-05, "loss": 1.5012, "num_input_tokens_seen": 28668144, "step": 4741, "train_runtime": 4805.2544, "train_tokens_per_second": 5965.999 }, { "epoch": 1.7440919540229887, "grad_norm": 1.0289225578308105, "learning_rate": 2.565801582919198e-05, "loss": 1.4479, "num_input_tokens_seen": 28675248, "step": 4742, "train_runtime": 4806.4085, "train_tokens_per_second": 5966.045 }, { "epoch": 1.7444597701149425, "grad_norm": 0.9507474303245544, "learning_rate": 2.5621203754831584e-05, "loss": 1.4761, "num_input_tokens_seen": 28683248, "step": 4743, "train_runtime": 4807.648, "train_tokens_per_second": 5966.171 }, { "epoch": 1.7448275862068967, "grad_norm": 0.9714196920394897, "learning_rate": 2.5584391680471196e-05, "loss": 1.5067, "num_input_tokens_seen": 28687888, "step": 4744, "train_runtime": 4808.4446, "train_tokens_per_second": 5966.147 }, { "epoch": 1.7451954022988505, "grad_norm": 1.0843784809112549, "learning_rate": 2.5547579606110805e-05, "loss": 1.2733, "num_input_tokens_seen": 28696432, "step": 4745, "train_runtime": 4809.7729, "train_tokens_per_second": 5966.276 }, { "epoch": 1.7455632183908047, "grad_norm": 1.058371663093567, "learning_rate": 2.5510767531750418e-05, "loss": 1.6213, "num_input_tokens_seen": 28701408, "step": 4746, "train_runtime": 4810.6161, "train_tokens_per_second": 5966.264 }, { "epoch": 1.7459310344827585, "grad_norm": 0.9698977470397949, "learning_rate": 2.5473955457390027e-05, "loss": 1.4538, "num_input_tokens_seen": 28706176, "step": 4747, "train_runtime": 4811.4419, "train_tokens_per_second": 5966.231 }, { "epoch": 1.7462988505747128, "grad_norm": 0.9774466156959534, "learning_rate": 2.5437143383029632e-05, "loss": 1.4971, "num_input_tokens_seen": 28712144, "step": 4748, "train_runtime": 4812.3784, "train_tokens_per_second": 5966.311 }, { "epoch": 1.7466666666666666, "grad_norm": 0.934420108795166, "learning_rate": 2.5400331308669244e-05, "loss": 1.3411, "num_input_tokens_seen": 28719840, "step": 4749, "train_runtime": 4813.5892, "train_tokens_per_second": 5966.409 }, { "epoch": 1.7470344827586208, "grad_norm": 0.8894535899162292, "learning_rate": 2.5363519234308853e-05, "loss": 1.3336, "num_input_tokens_seen": 28729344, "step": 4750, "train_runtime": 4815.0344, "train_tokens_per_second": 5966.592 }, { "epoch": 1.7474022988505746, "grad_norm": 1.0110523700714111, "learning_rate": 2.5326707159948466e-05, "loss": 1.3918, "num_input_tokens_seen": 28734800, "step": 4751, "train_runtime": 4815.9794, "train_tokens_per_second": 5966.554 }, { "epoch": 1.7477701149425289, "grad_norm": 1.0272303819656372, "learning_rate": 2.528989508558807e-05, "loss": 1.3874, "num_input_tokens_seen": 28741744, "step": 4752, "train_runtime": 4817.0988, "train_tokens_per_second": 5966.609 }, { "epoch": 1.7481379310344827, "grad_norm": 1.0168406963348389, "learning_rate": 2.5253083011227687e-05, "loss": 1.5772, "num_input_tokens_seen": 28746208, "step": 4753, "train_runtime": 4817.8578, "train_tokens_per_second": 5966.595 }, { "epoch": 1.748505747126437, "grad_norm": 1.0032830238342285, "learning_rate": 2.5216270936867292e-05, "loss": 1.3717, "num_input_tokens_seen": 28751616, "step": 4754, "train_runtime": 4818.7577, "train_tokens_per_second": 5966.603 }, { "epoch": 1.7488735632183907, "grad_norm": 0.9939249753952026, "learning_rate": 2.5179458862506904e-05, "loss": 1.6187, "num_input_tokens_seen": 28756896, "step": 4755, "train_runtime": 4819.6627, "train_tokens_per_second": 5966.579 }, { "epoch": 1.749241379310345, "grad_norm": 1.1142992973327637, "learning_rate": 2.5142646788146513e-05, "loss": 1.4498, "num_input_tokens_seen": 28764800, "step": 4756, "train_runtime": 4820.9015, "train_tokens_per_second": 5966.685 }, { "epoch": 1.7496091954022988, "grad_norm": 0.944139838218689, "learning_rate": 2.5105834713786126e-05, "loss": 1.5494, "num_input_tokens_seen": 28772304, "step": 4757, "train_runtime": 4822.0737, "train_tokens_per_second": 5966.791 }, { "epoch": 1.749977011494253, "grad_norm": 1.033401608467102, "learning_rate": 2.506902263942573e-05, "loss": 1.5243, "num_input_tokens_seen": 28777536, "step": 4758, "train_runtime": 4822.9721, "train_tokens_per_second": 5966.764 }, { "epoch": 1.7503448275862068, "grad_norm": 1.0464811325073242, "learning_rate": 2.5032210565065343e-05, "loss": 1.4168, "num_input_tokens_seen": 28783520, "step": 4759, "train_runtime": 4823.9558, "train_tokens_per_second": 5966.788 }, { "epoch": 1.750712643678161, "grad_norm": 1.0507761240005493, "learning_rate": 2.4995398490704952e-05, "loss": 1.5518, "num_input_tokens_seen": 28788192, "step": 4760, "train_runtime": 4824.781, "train_tokens_per_second": 5966.735 }, { "epoch": 1.7510804597701148, "grad_norm": 1.004483699798584, "learning_rate": 2.495858641634456e-05, "loss": 1.4975, "num_input_tokens_seen": 28793664, "step": 4761, "train_runtime": 4825.6882, "train_tokens_per_second": 5966.748 }, { "epoch": 1.751448275862069, "grad_norm": 1.0057058334350586, "learning_rate": 2.4921774341984173e-05, "loss": 1.6755, "num_input_tokens_seen": 28799536, "step": 4762, "train_runtime": 4826.6641, "train_tokens_per_second": 5966.758 }, { "epoch": 1.7518160919540229, "grad_norm": 1.0779151916503906, "learning_rate": 2.4884962267623782e-05, "loss": 1.5761, "num_input_tokens_seen": 28804432, "step": 4763, "train_runtime": 4827.5009, "train_tokens_per_second": 5966.738 }, { "epoch": 1.7521839080459771, "grad_norm": 1.0455926656723022, "learning_rate": 2.484815019326339e-05, "loss": 1.6414, "num_input_tokens_seen": 28812624, "step": 4764, "train_runtime": 4828.7923, "train_tokens_per_second": 5966.839 }, { "epoch": 1.752551724137931, "grad_norm": 0.9676247835159302, "learning_rate": 2.4811338118903004e-05, "loss": 1.4324, "num_input_tokens_seen": 28819024, "step": 4765, "train_runtime": 4829.8394, "train_tokens_per_second": 5966.87 }, { "epoch": 1.7529195402298852, "grad_norm": 1.0028635263442993, "learning_rate": 2.4774526044542612e-05, "loss": 1.6043, "num_input_tokens_seen": 28823984, "step": 4766, "train_runtime": 4830.6841, "train_tokens_per_second": 5966.853 }, { "epoch": 1.753287356321839, "grad_norm": 1.0500530004501343, "learning_rate": 2.473771397018222e-05, "loss": 1.4025, "num_input_tokens_seen": 28832064, "step": 4767, "train_runtime": 4831.9186, "train_tokens_per_second": 5967.001 }, { "epoch": 1.7536551724137932, "grad_norm": 1.0421392917633057, "learning_rate": 2.470090189582183e-05, "loss": 1.6018, "num_input_tokens_seen": 28838304, "step": 4768, "train_runtime": 4832.9508, "train_tokens_per_second": 5967.018 }, { "epoch": 1.754022988505747, "grad_norm": 1.1408933401107788, "learning_rate": 2.4664089821461443e-05, "loss": 1.72, "num_input_tokens_seen": 28842976, "step": 4769, "train_runtime": 4833.7403, "train_tokens_per_second": 5967.01 }, { "epoch": 1.7543908045977012, "grad_norm": 0.9642238020896912, "learning_rate": 2.4627277747101048e-05, "loss": 1.5639, "num_input_tokens_seen": 28851456, "step": 4770, "train_runtime": 4835.0521, "train_tokens_per_second": 5967.145 }, { "epoch": 1.754758620689655, "grad_norm": 1.0812686681747437, "learning_rate": 2.459046567274066e-05, "loss": 1.4493, "num_input_tokens_seen": 28856544, "step": 4771, "train_runtime": 4836.5241, "train_tokens_per_second": 5966.381 }, { "epoch": 1.7551264367816093, "grad_norm": 1.0130112171173096, "learning_rate": 2.455365359838027e-05, "loss": 1.5043, "num_input_tokens_seen": 28861360, "step": 4772, "train_runtime": 4837.3546, "train_tokens_per_second": 5966.352 }, { "epoch": 1.755494252873563, "grad_norm": 0.991884171962738, "learning_rate": 2.4516841524019878e-05, "loss": 1.3684, "num_input_tokens_seen": 28867664, "step": 4773, "train_runtime": 4838.3821, "train_tokens_per_second": 5966.388 }, { "epoch": 1.7558620689655173, "grad_norm": 0.9944646954536438, "learning_rate": 2.448002944965949e-05, "loss": 1.5666, "num_input_tokens_seen": 28874464, "step": 4774, "train_runtime": 4839.4788, "train_tokens_per_second": 5966.441 }, { "epoch": 1.7562298850574711, "grad_norm": 1.0106456279754639, "learning_rate": 2.44432173752991e-05, "loss": 1.4483, "num_input_tokens_seen": 28881728, "step": 4775, "train_runtime": 4840.6374, "train_tokens_per_second": 5966.513 }, { "epoch": 1.7565977011494254, "grad_norm": 1.0139954090118408, "learning_rate": 2.4406405300938708e-05, "loss": 1.498, "num_input_tokens_seen": 28888144, "step": 4776, "train_runtime": 4841.6522, "train_tokens_per_second": 5966.588 }, { "epoch": 1.7569655172413792, "grad_norm": 0.9798570871353149, "learning_rate": 2.436959322657832e-05, "loss": 1.6253, "num_input_tokens_seen": 28894688, "step": 4777, "train_runtime": 4842.7185, "train_tokens_per_second": 5966.626 }, { "epoch": 1.7573333333333334, "grad_norm": 0.9457206726074219, "learning_rate": 2.433278115221793e-05, "loss": 1.5637, "num_input_tokens_seen": 28901152, "step": 4778, "train_runtime": 4843.7467, "train_tokens_per_second": 5966.694 }, { "epoch": 1.7577011494252872, "grad_norm": 1.0914689302444458, "learning_rate": 2.4295969077857538e-05, "loss": 1.592, "num_input_tokens_seen": 28906304, "step": 4779, "train_runtime": 4844.6162, "train_tokens_per_second": 5966.686 }, { "epoch": 1.7580689655172415, "grad_norm": 1.1174763441085815, "learning_rate": 2.425915700349715e-05, "loss": 1.4404, "num_input_tokens_seen": 28913104, "step": 4780, "train_runtime": 4845.7408, "train_tokens_per_second": 5966.705 }, { "epoch": 1.7584367816091953, "grad_norm": 1.1484270095825195, "learning_rate": 2.422234492913676e-05, "loss": 1.712, "num_input_tokens_seen": 28918976, "step": 4781, "train_runtime": 4846.6932, "train_tokens_per_second": 5966.744 }, { "epoch": 1.7588045977011495, "grad_norm": 1.011078953742981, "learning_rate": 2.4185532854776368e-05, "loss": 1.5001, "num_input_tokens_seen": 28927472, "step": 4782, "train_runtime": 4848.0154, "train_tokens_per_second": 5966.869 }, { "epoch": 1.7591724137931033, "grad_norm": 1.0478185415267944, "learning_rate": 2.4148720780415977e-05, "loss": 1.6283, "num_input_tokens_seen": 28932432, "step": 4783, "train_runtime": 4848.8425, "train_tokens_per_second": 5966.874 }, { "epoch": 1.7595402298850575, "grad_norm": 1.0241420269012451, "learning_rate": 2.411190870605559e-05, "loss": 1.4226, "num_input_tokens_seen": 28937888, "step": 4784, "train_runtime": 4849.7451, "train_tokens_per_second": 5966.888 }, { "epoch": 1.7599080459770113, "grad_norm": 1.0115891695022583, "learning_rate": 2.4075096631695195e-05, "loss": 1.3334, "num_input_tokens_seen": 28944144, "step": 4785, "train_runtime": 4850.758, "train_tokens_per_second": 5966.932 }, { "epoch": 1.7602758620689656, "grad_norm": 0.9646759629249573, "learning_rate": 2.4038284557334807e-05, "loss": 1.321, "num_input_tokens_seen": 28948752, "step": 4786, "train_runtime": 4851.5707, "train_tokens_per_second": 5966.882 }, { "epoch": 1.7606436781609194, "grad_norm": 1.011519193649292, "learning_rate": 2.4001472482974416e-05, "loss": 1.4329, "num_input_tokens_seen": 28953104, "step": 4787, "train_runtime": 4852.3417, "train_tokens_per_second": 5966.831 }, { "epoch": 1.7610114942528736, "grad_norm": 0.9330379962921143, "learning_rate": 2.3964660408614025e-05, "loss": 1.3982, "num_input_tokens_seen": 28958624, "step": 4788, "train_runtime": 4853.2508, "train_tokens_per_second": 5966.851 }, { "epoch": 1.7613793103448274, "grad_norm": 0.9441887736320496, "learning_rate": 2.3927848334253637e-05, "loss": 1.4537, "num_input_tokens_seen": 28963872, "step": 4789, "train_runtime": 4854.1286, "train_tokens_per_second": 5966.853 }, { "epoch": 1.7617471264367817, "grad_norm": 0.9717675447463989, "learning_rate": 2.3891036259893246e-05, "loss": 1.4119, "num_input_tokens_seen": 28968928, "step": 4790, "train_runtime": 4854.9596, "train_tokens_per_second": 5966.873 }, { "epoch": 1.7621149425287357, "grad_norm": 1.0108474493026733, "learning_rate": 2.3854224185532855e-05, "loss": 1.4986, "num_input_tokens_seen": 28975440, "step": 4791, "train_runtime": 4855.9965, "train_tokens_per_second": 5966.94 }, { "epoch": 1.7624827586206897, "grad_norm": 0.8929666876792908, "learning_rate": 2.3817412111172467e-05, "loss": 1.3344, "num_input_tokens_seen": 28982496, "step": 4792, "train_runtime": 4857.1093, "train_tokens_per_second": 5967.026 }, { "epoch": 1.7628505747126437, "grad_norm": 1.0070686340332031, "learning_rate": 2.3780600036812076e-05, "loss": 1.5368, "num_input_tokens_seen": 28987520, "step": 4793, "train_runtime": 4857.9572, "train_tokens_per_second": 5967.018 }, { "epoch": 1.7632183908045977, "grad_norm": 1.1040626764297485, "learning_rate": 2.3743787962451685e-05, "loss": 1.6217, "num_input_tokens_seen": 28992832, "step": 4794, "train_runtime": 4858.8325, "train_tokens_per_second": 5967.037 }, { "epoch": 1.7635862068965518, "grad_norm": 1.103492021560669, "learning_rate": 2.3706975888091294e-05, "loss": 1.4166, "num_input_tokens_seen": 28998112, "step": 4795, "train_runtime": 4859.6795, "train_tokens_per_second": 5967.083 }, { "epoch": 1.7639540229885058, "grad_norm": 1.0375038385391235, "learning_rate": 2.3670163813730906e-05, "loss": 1.6313, "num_input_tokens_seen": 29003408, "step": 4796, "train_runtime": 4860.5591, "train_tokens_per_second": 5967.093 }, { "epoch": 1.7643218390804598, "grad_norm": 1.0778006315231323, "learning_rate": 2.3633351739370515e-05, "loss": 1.7406, "num_input_tokens_seen": 29007696, "step": 4797, "train_runtime": 4861.2996, "train_tokens_per_second": 5967.066 }, { "epoch": 1.7646896551724138, "grad_norm": 0.9532221555709839, "learning_rate": 2.3596539665010124e-05, "loss": 1.5471, "num_input_tokens_seen": 29013392, "step": 4798, "train_runtime": 4862.2653, "train_tokens_per_second": 5967.052 }, { "epoch": 1.7650574712643678, "grad_norm": 1.0531294345855713, "learning_rate": 2.3559727590649736e-05, "loss": 1.4915, "num_input_tokens_seen": 29018992, "step": 4799, "train_runtime": 4863.1879, "train_tokens_per_second": 5967.072 }, { "epoch": 1.7654252873563219, "grad_norm": 1.0663352012634277, "learning_rate": 2.3522915516289342e-05, "loss": 1.4718, "num_input_tokens_seen": 29024624, "step": 4800, "train_runtime": 4864.1242, "train_tokens_per_second": 5967.081 }, { "epoch": 1.765793103448276, "grad_norm": 1.0736812353134155, "learning_rate": 2.3486103441928954e-05, "loss": 1.5117, "num_input_tokens_seen": 29030784, "step": 4801, "train_runtime": 4865.6616, "train_tokens_per_second": 5966.462 }, { "epoch": 1.76616091954023, "grad_norm": 1.0155384540557861, "learning_rate": 2.3449291367568563e-05, "loss": 1.5503, "num_input_tokens_seen": 29035952, "step": 4802, "train_runtime": 4866.5211, "train_tokens_per_second": 5966.47 }, { "epoch": 1.766528735632184, "grad_norm": 0.9911293983459473, "learning_rate": 2.3412479293208172e-05, "loss": 1.7012, "num_input_tokens_seen": 29041440, "step": 4803, "train_runtime": 4867.4131, "train_tokens_per_second": 5966.504 }, { "epoch": 1.766896551724138, "grad_norm": 1.0082165002822876, "learning_rate": 2.3375667218847784e-05, "loss": 1.5463, "num_input_tokens_seen": 29047696, "step": 4804, "train_runtime": 4868.4224, "train_tokens_per_second": 5966.552 }, { "epoch": 1.767264367816092, "grad_norm": 1.087516188621521, "learning_rate": 2.3338855144487393e-05, "loss": 1.4284, "num_input_tokens_seen": 29051888, "step": 4805, "train_runtime": 4869.1614, "train_tokens_per_second": 5966.508 }, { "epoch": 1.767632183908046, "grad_norm": 1.0501154661178589, "learning_rate": 2.3302043070127002e-05, "loss": 1.3063, "num_input_tokens_seen": 29057280, "step": 4806, "train_runtime": 4870.059, "train_tokens_per_second": 5966.515 }, { "epoch": 1.768, "grad_norm": 0.9493128061294556, "learning_rate": 2.326523099576661e-05, "loss": 1.3305, "num_input_tokens_seen": 29067952, "step": 4807, "train_runtime": 4871.6684, "train_tokens_per_second": 5966.734 }, { "epoch": 1.768367816091954, "grad_norm": 1.1272931098937988, "learning_rate": 2.3228418921406223e-05, "loss": 1.7959, "num_input_tokens_seen": 29073728, "step": 4808, "train_runtime": 4872.6124, "train_tokens_per_second": 5966.764 }, { "epoch": 1.768735632183908, "grad_norm": 1.021295428276062, "learning_rate": 2.3191606847045832e-05, "loss": 1.5178, "num_input_tokens_seen": 29078656, "step": 4809, "train_runtime": 4873.4601, "train_tokens_per_second": 5966.737 }, { "epoch": 1.769103448275862, "grad_norm": 0.9110109806060791, "learning_rate": 2.315479477268544e-05, "loss": 1.4342, "num_input_tokens_seen": 29084832, "step": 4810, "train_runtime": 4874.4722, "train_tokens_per_second": 5966.765 }, { "epoch": 1.769471264367816, "grad_norm": 1.0035239458084106, "learning_rate": 2.3117982698325053e-05, "loss": 1.585, "num_input_tokens_seen": 29089328, "step": 4811, "train_runtime": 4875.2478, "train_tokens_per_second": 5966.738 }, { "epoch": 1.7698390804597701, "grad_norm": 0.9894155859947205, "learning_rate": 2.3081170623964662e-05, "loss": 1.4294, "num_input_tokens_seen": 29095456, "step": 4812, "train_runtime": 4876.2421, "train_tokens_per_second": 5966.778 }, { "epoch": 1.7702068965517241, "grad_norm": 0.9737396240234375, "learning_rate": 2.304435854960427e-05, "loss": 1.5051, "num_input_tokens_seen": 29101040, "step": 4813, "train_runtime": 4877.1553, "train_tokens_per_second": 5966.806 }, { "epoch": 1.7705747126436782, "grad_norm": 0.9453579783439636, "learning_rate": 2.3007546475243883e-05, "loss": 1.4653, "num_input_tokens_seen": 29109968, "step": 4814, "train_runtime": 4878.5028, "train_tokens_per_second": 5966.988 }, { "epoch": 1.7709425287356322, "grad_norm": 0.9606562256813049, "learning_rate": 2.297073440088349e-05, "loss": 1.5069, "num_input_tokens_seen": 29116928, "step": 4815, "train_runtime": 4879.6255, "train_tokens_per_second": 5967.042 }, { "epoch": 1.7713103448275862, "grad_norm": 1.0943264961242676, "learning_rate": 2.29339223265231e-05, "loss": 1.5241, "num_input_tokens_seen": 29121520, "step": 4816, "train_runtime": 4880.4226, "train_tokens_per_second": 5967.008 }, { "epoch": 1.7716781609195402, "grad_norm": 1.014162302017212, "learning_rate": 2.289711025216271e-05, "loss": 1.5497, "num_input_tokens_seen": 29125952, "step": 4817, "train_runtime": 4881.2056, "train_tokens_per_second": 5966.959 }, { "epoch": 1.7720459770114942, "grad_norm": 0.9894721508026123, "learning_rate": 2.286029817780232e-05, "loss": 1.4047, "num_input_tokens_seen": 29130480, "step": 4818, "train_runtime": 4881.9937, "train_tokens_per_second": 5966.923 }, { "epoch": 1.7724137931034483, "grad_norm": 0.9608563780784607, "learning_rate": 2.282348610344193e-05, "loss": 1.4861, "num_input_tokens_seen": 29135968, "step": 4819, "train_runtime": 4882.8846, "train_tokens_per_second": 5966.958 }, { "epoch": 1.7727816091954023, "grad_norm": 1.1403229236602783, "learning_rate": 2.278667402908154e-05, "loss": 1.4569, "num_input_tokens_seen": 29140704, "step": 4820, "train_runtime": 4883.6855, "train_tokens_per_second": 5966.949 }, { "epoch": 1.7731494252873563, "grad_norm": 1.0871057510375977, "learning_rate": 2.274986195472115e-05, "loss": 1.6215, "num_input_tokens_seen": 29145136, "step": 4821, "train_runtime": 4884.487, "train_tokens_per_second": 5966.878 }, { "epoch": 1.7735172413793103, "grad_norm": 0.9230962991714478, "learning_rate": 2.2713049880360758e-05, "loss": 1.4355, "num_input_tokens_seen": 29152336, "step": 4822, "train_runtime": 4885.6285, "train_tokens_per_second": 5966.957 }, { "epoch": 1.7738850574712643, "grad_norm": 0.9452508091926575, "learning_rate": 2.267623780600037e-05, "loss": 1.428, "num_input_tokens_seen": 29157696, "step": 4823, "train_runtime": 4886.5157, "train_tokens_per_second": 5966.971 }, { "epoch": 1.7742528735632184, "grad_norm": 1.0570164918899536, "learning_rate": 2.263942573163998e-05, "loss": 1.5498, "num_input_tokens_seen": 29163760, "step": 4824, "train_runtime": 4887.494, "train_tokens_per_second": 5967.017 }, { "epoch": 1.7746206896551724, "grad_norm": 0.952113151550293, "learning_rate": 2.2602613657279588e-05, "loss": 1.3292, "num_input_tokens_seen": 29170272, "step": 4825, "train_runtime": 4888.5315, "train_tokens_per_second": 5967.083 }, { "epoch": 1.7749885057471264, "grad_norm": 0.9960702061653137, "learning_rate": 2.25658015829192e-05, "loss": 1.448, "num_input_tokens_seen": 29176720, "step": 4826, "train_runtime": 4889.5676, "train_tokens_per_second": 5967.137 }, { "epoch": 1.7753563218390804, "grad_norm": 1.0668630599975586, "learning_rate": 2.252898950855881e-05, "loss": 1.4394, "num_input_tokens_seen": 29182928, "step": 4827, "train_runtime": 4890.573, "train_tokens_per_second": 5967.18 }, { "epoch": 1.7757241379310345, "grad_norm": 0.9461020231246948, "learning_rate": 2.2492177434198418e-05, "loss": 1.5087, "num_input_tokens_seen": 29188096, "step": 4828, "train_runtime": 4891.4342, "train_tokens_per_second": 5967.186 }, { "epoch": 1.7760919540229885, "grad_norm": 0.9859970211982727, "learning_rate": 2.245536535983803e-05, "loss": 1.4893, "num_input_tokens_seen": 29194112, "step": 4829, "train_runtime": 4892.4234, "train_tokens_per_second": 5967.209 }, { "epoch": 1.7764597701149425, "grad_norm": 1.0894885063171387, "learning_rate": 2.2418553285477636e-05, "loss": 1.542, "num_input_tokens_seen": 29200160, "step": 4830, "train_runtime": 4893.384, "train_tokens_per_second": 5967.273 }, { "epoch": 1.7768275862068965, "grad_norm": 1.0765576362609863, "learning_rate": 2.2381741211117248e-05, "loss": 1.6309, "num_input_tokens_seen": 29205088, "step": 4831, "train_runtime": 4894.7037, "train_tokens_per_second": 5966.671 }, { "epoch": 1.7771954022988505, "grad_norm": 1.0274276733398438, "learning_rate": 2.2344929136756857e-05, "loss": 1.5739, "num_input_tokens_seen": 29210896, "step": 4832, "train_runtime": 4895.6499, "train_tokens_per_second": 5966.704 }, { "epoch": 1.7775632183908046, "grad_norm": 1.1504994630813599, "learning_rate": 2.2308117062396466e-05, "loss": 1.4678, "num_input_tokens_seen": 29216224, "step": 4833, "train_runtime": 4896.5272, "train_tokens_per_second": 5966.724 }, { "epoch": 1.7779310344827586, "grad_norm": 1.0065832138061523, "learning_rate": 2.2271304988036075e-05, "loss": 1.585, "num_input_tokens_seen": 29221440, "step": 4834, "train_runtime": 4897.4184, "train_tokens_per_second": 5966.703 }, { "epoch": 1.7782988505747126, "grad_norm": 1.0450266599655151, "learning_rate": 2.2234492913675687e-05, "loss": 1.5991, "num_input_tokens_seen": 29227648, "step": 4835, "train_runtime": 4898.4592, "train_tokens_per_second": 5966.702 }, { "epoch": 1.7786666666666666, "grad_norm": 0.8858741521835327, "learning_rate": 2.2197680839315296e-05, "loss": 1.3514, "num_input_tokens_seen": 29236688, "step": 4836, "train_runtime": 4899.8325, "train_tokens_per_second": 5966.875 }, { "epoch": 1.7790344827586206, "grad_norm": 1.0070812702178955, "learning_rate": 2.2160868764954905e-05, "loss": 1.5729, "num_input_tokens_seen": 29241776, "step": 4837, "train_runtime": 4900.6922, "train_tokens_per_second": 5966.866 }, { "epoch": 1.7794022988505747, "grad_norm": 0.9339779019355774, "learning_rate": 2.2124056690594517e-05, "loss": 1.3212, "num_input_tokens_seen": 29247008, "step": 4838, "train_runtime": 4901.5648, "train_tokens_per_second": 5966.872 }, { "epoch": 1.7797701149425287, "grad_norm": 1.102351188659668, "learning_rate": 2.2087244616234126e-05, "loss": 1.9419, "num_input_tokens_seen": 29251728, "step": 4839, "train_runtime": 4902.3962, "train_tokens_per_second": 5966.823 }, { "epoch": 1.7801379310344827, "grad_norm": 0.961283802986145, "learning_rate": 2.2050432541873735e-05, "loss": 1.3867, "num_input_tokens_seen": 29256288, "step": 4840, "train_runtime": 4903.185, "train_tokens_per_second": 5966.793 }, { "epoch": 1.780505747126437, "grad_norm": 1.037157416343689, "learning_rate": 2.2013620467513347e-05, "loss": 1.6612, "num_input_tokens_seen": 29261680, "step": 4841, "train_runtime": 4904.0736, "train_tokens_per_second": 5966.811 }, { "epoch": 1.7808735632183907, "grad_norm": 1.0962274074554443, "learning_rate": 2.1976808393152956e-05, "loss": 1.6382, "num_input_tokens_seen": 29266512, "step": 4842, "train_runtime": 4904.9043, "train_tokens_per_second": 5966.786 }, { "epoch": 1.781241379310345, "grad_norm": 1.1156631708145142, "learning_rate": 2.1939996318792565e-05, "loss": 1.5553, "num_input_tokens_seen": 29271504, "step": 4843, "train_runtime": 4905.7548, "train_tokens_per_second": 5966.769 }, { "epoch": 1.7816091954022988, "grad_norm": 0.9504975080490112, "learning_rate": 2.1903184244432177e-05, "loss": 1.5963, "num_input_tokens_seen": 29278896, "step": 4844, "train_runtime": 4906.9192, "train_tokens_per_second": 5966.859 }, { "epoch": 1.781977011494253, "grad_norm": 0.9749406576156616, "learning_rate": 2.1866372170071783e-05, "loss": 1.5224, "num_input_tokens_seen": 29283696, "step": 4845, "train_runtime": 4907.7565, "train_tokens_per_second": 5966.819 }, { "epoch": 1.7823448275862068, "grad_norm": 1.0290385484695435, "learning_rate": 2.182956009571139e-05, "loss": 1.5321, "num_input_tokens_seen": 29288256, "step": 4846, "train_runtime": 4908.553, "train_tokens_per_second": 5966.78 }, { "epoch": 1.782712643678161, "grad_norm": 1.05253267288208, "learning_rate": 2.1792748021351004e-05, "loss": 1.5027, "num_input_tokens_seen": 29295424, "step": 4847, "train_runtime": 4909.667, "train_tokens_per_second": 5966.886 }, { "epoch": 1.7830804597701149, "grad_norm": 0.9805688261985779, "learning_rate": 2.1755935946990613e-05, "loss": 1.6608, "num_input_tokens_seen": 29300176, "step": 4848, "train_runtime": 4910.4863, "train_tokens_per_second": 5966.858 }, { "epoch": 1.783448275862069, "grad_norm": 1.0403445959091187, "learning_rate": 2.171912387263022e-05, "loss": 1.6362, "num_input_tokens_seen": 29305040, "step": 4849, "train_runtime": 4911.3193, "train_tokens_per_second": 5966.837 }, { "epoch": 1.783816091954023, "grad_norm": 0.9725497364997864, "learning_rate": 2.1682311798269834e-05, "loss": 1.4648, "num_input_tokens_seen": 29312720, "step": 4850, "train_runtime": 4912.5235, "train_tokens_per_second": 5966.937 }, { "epoch": 1.7841839080459772, "grad_norm": 1.0356947183609009, "learning_rate": 2.1645499723909443e-05, "loss": 1.3962, "num_input_tokens_seen": 29316992, "step": 4851, "train_runtime": 4913.2914, "train_tokens_per_second": 5966.874 }, { "epoch": 1.784551724137931, "grad_norm": 0.8753128051757812, "learning_rate": 2.1608687649549052e-05, "loss": 1.438, "num_input_tokens_seen": 29325200, "step": 4852, "train_runtime": 4914.5591, "train_tokens_per_second": 5967.005 }, { "epoch": 1.7849195402298852, "grad_norm": 1.0391000509262085, "learning_rate": 2.1571875575188664e-05, "loss": 1.5341, "num_input_tokens_seen": 29329904, "step": 4853, "train_runtime": 4915.3783, "train_tokens_per_second": 5966.968 }, { "epoch": 1.785287356321839, "grad_norm": 0.9996411800384521, "learning_rate": 2.1535063500828273e-05, "loss": 1.4621, "num_input_tokens_seen": 29335248, "step": 4854, "train_runtime": 4916.2539, "train_tokens_per_second": 5966.992 }, { "epoch": 1.7856551724137932, "grad_norm": 1.1347910165786743, "learning_rate": 2.1498251426467882e-05, "loss": 1.6497, "num_input_tokens_seen": 29340016, "step": 4855, "train_runtime": 4917.076, "train_tokens_per_second": 5966.964 }, { "epoch": 1.786022988505747, "grad_norm": 1.0457426309585571, "learning_rate": 2.1461439352107494e-05, "loss": 1.7235, "num_input_tokens_seen": 29345408, "step": 4856, "train_runtime": 4917.9835, "train_tokens_per_second": 5966.959 }, { "epoch": 1.7863908045977013, "grad_norm": 0.764273464679718, "learning_rate": 2.1424627277747103e-05, "loss": 1.4666, "num_input_tokens_seen": 29357040, "step": 4857, "train_runtime": 4919.7168, "train_tokens_per_second": 5967.221 }, { "epoch": 1.786758620689655, "grad_norm": 0.9954184293746948, "learning_rate": 2.1387815203386712e-05, "loss": 1.42, "num_input_tokens_seen": 29363696, "step": 4858, "train_runtime": 4920.8014, "train_tokens_per_second": 5967.259 }, { "epoch": 1.7871264367816093, "grad_norm": 0.96946781873703, "learning_rate": 2.1351003129026324e-05, "loss": 1.4562, "num_input_tokens_seen": 29368816, "step": 4859, "train_runtime": 4921.6507, "train_tokens_per_second": 5967.269 }, { "epoch": 1.7874942528735631, "grad_norm": 1.0975924730300903, "learning_rate": 2.131419105466593e-05, "loss": 1.6143, "num_input_tokens_seen": 29373392, "step": 4860, "train_runtime": 4922.4649, "train_tokens_per_second": 5967.212 }, { "epoch": 1.7878620689655174, "grad_norm": 1.04430091381073, "learning_rate": 2.127737898030554e-05, "loss": 1.7536, "num_input_tokens_seen": 29378240, "step": 4861, "train_runtime": 4923.7817, "train_tokens_per_second": 5966.601 }, { "epoch": 1.7882298850574712, "grad_norm": 0.9940053820610046, "learning_rate": 2.124056690594515e-05, "loss": 1.3992, "num_input_tokens_seen": 29385072, "step": 4862, "train_runtime": 4924.8707, "train_tokens_per_second": 5966.669 }, { "epoch": 1.7885977011494254, "grad_norm": 1.0616343021392822, "learning_rate": 2.120375483158476e-05, "loss": 1.5123, "num_input_tokens_seen": 29390512, "step": 4863, "train_runtime": 4925.7738, "train_tokens_per_second": 5966.679 }, { "epoch": 1.7889655172413792, "grad_norm": 1.0299736261367798, "learning_rate": 2.116694275722437e-05, "loss": 1.3869, "num_input_tokens_seen": 29396112, "step": 4864, "train_runtime": 4926.6776, "train_tokens_per_second": 5966.721 }, { "epoch": 1.7893333333333334, "grad_norm": 1.010871410369873, "learning_rate": 2.113013068286398e-05, "loss": 1.4701, "num_input_tokens_seen": 29401568, "step": 4865, "train_runtime": 4927.5734, "train_tokens_per_second": 5966.744 }, { "epoch": 1.7897011494252872, "grad_norm": 1.0078232288360596, "learning_rate": 2.109331860850359e-05, "loss": 1.675, "num_input_tokens_seen": 29406912, "step": 4866, "train_runtime": 4928.4472, "train_tokens_per_second": 5966.77 }, { "epoch": 1.7900689655172415, "grad_norm": 1.0409224033355713, "learning_rate": 2.10565065341432e-05, "loss": 1.6477, "num_input_tokens_seen": 29414128, "step": 4867, "train_runtime": 4929.6125, "train_tokens_per_second": 5966.824 }, { "epoch": 1.7904367816091953, "grad_norm": 1.0885225534439087, "learning_rate": 2.101969445978281e-05, "loss": 1.6365, "num_input_tokens_seen": 29419104, "step": 4868, "train_runtime": 4930.4379, "train_tokens_per_second": 5966.834 }, { "epoch": 1.7908045977011495, "grad_norm": 1.1059404611587524, "learning_rate": 2.098288238542242e-05, "loss": 1.4918, "num_input_tokens_seen": 29424800, "step": 4869, "train_runtime": 4931.4029, "train_tokens_per_second": 5966.821 }, { "epoch": 1.7911724137931033, "grad_norm": 1.0508280992507935, "learning_rate": 2.094607031106203e-05, "loss": 1.7301, "num_input_tokens_seen": 29430720, "step": 4870, "train_runtime": 4932.345, "train_tokens_per_second": 5966.882 }, { "epoch": 1.7915402298850576, "grad_norm": 1.060753345489502, "learning_rate": 2.090925823670164e-05, "loss": 1.5117, "num_input_tokens_seen": 29436736, "step": 4871, "train_runtime": 4933.3426, "train_tokens_per_second": 5966.895 }, { "epoch": 1.7919080459770114, "grad_norm": 1.097510814666748, "learning_rate": 2.087244616234125e-05, "loss": 1.4251, "num_input_tokens_seen": 29442992, "step": 4872, "train_runtime": 4934.3538, "train_tokens_per_second": 5966.94 }, { "epoch": 1.7922758620689656, "grad_norm": 1.0107671022415161, "learning_rate": 2.083563408798086e-05, "loss": 1.3961, "num_input_tokens_seen": 29449536, "step": 4873, "train_runtime": 4935.4079, "train_tokens_per_second": 5966.991 }, { "epoch": 1.7926436781609194, "grad_norm": 1.034067153930664, "learning_rate": 2.079882201362047e-05, "loss": 1.6524, "num_input_tokens_seen": 29455280, "step": 4874, "train_runtime": 4936.3636, "train_tokens_per_second": 5967.0 }, { "epoch": 1.7930114942528736, "grad_norm": 1.1237860918045044, "learning_rate": 2.0762009939260077e-05, "loss": 1.5278, "num_input_tokens_seen": 29460208, "step": 4875, "train_runtime": 4937.2136, "train_tokens_per_second": 5966.971 }, { "epoch": 1.7933793103448274, "grad_norm": 1.0731533765792847, "learning_rate": 2.0725197864899685e-05, "loss": 1.4303, "num_input_tokens_seen": 29465712, "step": 4876, "train_runtime": 4938.1468, "train_tokens_per_second": 5966.957 }, { "epoch": 1.7937471264367817, "grad_norm": 0.9860634803771973, "learning_rate": 2.0688385790539298e-05, "loss": 1.6109, "num_input_tokens_seen": 29470576, "step": 4877, "train_runtime": 4938.9784, "train_tokens_per_second": 5966.938 }, { "epoch": 1.7941149425287355, "grad_norm": 1.0423297882080078, "learning_rate": 2.0651573716178907e-05, "loss": 1.3816, "num_input_tokens_seen": 29477376, "step": 4878, "train_runtime": 4940.0849, "train_tokens_per_second": 5966.978 }, { "epoch": 1.7944827586206897, "grad_norm": 0.9954624772071838, "learning_rate": 2.0614761641818516e-05, "loss": 1.5698, "num_input_tokens_seen": 29483520, "step": 4879, "train_runtime": 4941.1123, "train_tokens_per_second": 5966.98 }, { "epoch": 1.7948505747126435, "grad_norm": 1.064196228981018, "learning_rate": 2.0577949567458128e-05, "loss": 1.5358, "num_input_tokens_seen": 29488608, "step": 4880, "train_runtime": 4941.9799, "train_tokens_per_second": 5966.962 }, { "epoch": 1.7952183908045978, "grad_norm": 1.0329298973083496, "learning_rate": 2.0541137493097737e-05, "loss": 1.4956, "num_input_tokens_seen": 29494544, "step": 4881, "train_runtime": 4942.9524, "train_tokens_per_second": 5966.989 }, { "epoch": 1.7955862068965516, "grad_norm": 1.177534818649292, "learning_rate": 2.0504325418737346e-05, "loss": 1.8409, "num_input_tokens_seen": 29499264, "step": 4882, "train_runtime": 4943.761, "train_tokens_per_second": 5966.968 }, { "epoch": 1.7959540229885058, "grad_norm": 1.0485416650772095, "learning_rate": 2.0467513344376958e-05, "loss": 1.4265, "num_input_tokens_seen": 29504288, "step": 4883, "train_runtime": 4944.6175, "train_tokens_per_second": 5966.951 }, { "epoch": 1.7963218390804596, "grad_norm": 0.9922838807106018, "learning_rate": 2.0430701270016567e-05, "loss": 1.5442, "num_input_tokens_seen": 29510000, "step": 4884, "train_runtime": 4945.5612, "train_tokens_per_second": 5966.967 }, { "epoch": 1.7966896551724139, "grad_norm": 1.1228270530700684, "learning_rate": 2.0393889195656176e-05, "loss": 1.5242, "num_input_tokens_seen": 29516288, "step": 4885, "train_runtime": 4946.5663, "train_tokens_per_second": 5967.026 }, { "epoch": 1.7970574712643677, "grad_norm": 0.959301769733429, "learning_rate": 2.0357077121295788e-05, "loss": 1.4251, "num_input_tokens_seen": 29520640, "step": 4886, "train_runtime": 4947.3123, "train_tokens_per_second": 5967.006 }, { "epoch": 1.797425287356322, "grad_norm": 1.0731889009475708, "learning_rate": 2.0320265046935397e-05, "loss": 1.8014, "num_input_tokens_seen": 29525312, "step": 4887, "train_runtime": 4948.1407, "train_tokens_per_second": 5966.951 }, { "epoch": 1.7977931034482757, "grad_norm": 1.0586031675338745, "learning_rate": 2.0283452972575006e-05, "loss": 1.5994, "num_input_tokens_seen": 29532176, "step": 4888, "train_runtime": 4949.2349, "train_tokens_per_second": 5967.018 }, { "epoch": 1.79816091954023, "grad_norm": 1.127091407775879, "learning_rate": 2.0246640898214618e-05, "loss": 1.6764, "num_input_tokens_seen": 29538368, "step": 4889, "train_runtime": 4950.2623, "train_tokens_per_second": 5967.031 }, { "epoch": 1.798528735632184, "grad_norm": 0.9802016615867615, "learning_rate": 2.0209828823854223e-05, "loss": 1.4589, "num_input_tokens_seen": 29545776, "step": 4890, "train_runtime": 4951.4202, "train_tokens_per_second": 5967.132 }, { "epoch": 1.798896551724138, "grad_norm": 0.9854152798652649, "learning_rate": 2.0173016749493832e-05, "loss": 1.5698, "num_input_tokens_seen": 29550576, "step": 4891, "train_runtime": 4952.7294, "train_tokens_per_second": 5966.523 }, { "epoch": 1.799264367816092, "grad_norm": 1.0517677068710327, "learning_rate": 2.0136204675133445e-05, "loss": 1.2653, "num_input_tokens_seen": 29556544, "step": 4892, "train_runtime": 4953.6982, "train_tokens_per_second": 5966.561 }, { "epoch": 1.799632183908046, "grad_norm": 1.0668220520019531, "learning_rate": 2.0099392600773054e-05, "loss": 1.5209, "num_input_tokens_seen": 29566608, "step": 4893, "train_runtime": 4955.1926, "train_tokens_per_second": 5966.793 }, { "epoch": 1.8, "grad_norm": 1.0575467348098755, "learning_rate": 2.0062580526412662e-05, "loss": 1.4832, "num_input_tokens_seen": 29572256, "step": 4894, "train_runtime": 4956.1134, "train_tokens_per_second": 5966.824 }, { "epoch": 1.800367816091954, "grad_norm": 1.0190519094467163, "learning_rate": 2.0025768452052275e-05, "loss": 1.4475, "num_input_tokens_seen": 29577856, "step": 4895, "train_runtime": 4957.0745, "train_tokens_per_second": 5966.797 }, { "epoch": 1.800735632183908, "grad_norm": 0.9429070353507996, "learning_rate": 1.9988956377691884e-05, "loss": 1.3044, "num_input_tokens_seen": 29584496, "step": 4896, "train_runtime": 4958.1786, "train_tokens_per_second": 5966.807 }, { "epoch": 1.800735632183908, "eval_loss": 1.7461637258529663, "eval_runtime": 4.7811, "eval_samples_per_second": 209.158, "eval_steps_per_second": 13.177, "num_input_tokens_seen": 29584496, "step": 4896 }, { "epoch": 1.801103448275862, "grad_norm": 1.1192717552185059, "learning_rate": 1.9952144303331493e-05, "loss": 1.6999, "num_input_tokens_seen": 29588800, "step": 4897, "train_runtime": 4963.7078, "train_tokens_per_second": 5961.028 }, { "epoch": 1.8014712643678161, "grad_norm": 1.0206178426742554, "learning_rate": 1.9915332228971105e-05, "loss": 1.4832, "num_input_tokens_seen": 29594000, "step": 4898, "train_runtime": 4964.5758, "train_tokens_per_second": 5961.033 }, { "epoch": 1.8018390804597701, "grad_norm": 1.058915615081787, "learning_rate": 1.9878520154610714e-05, "loss": 1.5559, "num_input_tokens_seen": 29602016, "step": 4899, "train_runtime": 4965.8222, "train_tokens_per_second": 5961.151 }, { "epoch": 1.8022068965517242, "grad_norm": 1.0015265941619873, "learning_rate": 1.9841708080250323e-05, "loss": 1.3341, "num_input_tokens_seen": 29609232, "step": 4900, "train_runtime": 4966.9688, "train_tokens_per_second": 5961.228 }, { "epoch": 1.8025747126436782, "grad_norm": 1.034872055053711, "learning_rate": 1.9804896005889935e-05, "loss": 1.4087, "num_input_tokens_seen": 29615632, "step": 4901, "train_runtime": 4968.0165, "train_tokens_per_second": 5961.259 }, { "epoch": 1.8029425287356322, "grad_norm": 0.9960013031959534, "learning_rate": 1.9768083931529544e-05, "loss": 1.5575, "num_input_tokens_seen": 29621152, "step": 4902, "train_runtime": 4968.9369, "train_tokens_per_second": 5961.265 }, { "epoch": 1.8033103448275862, "grad_norm": 1.0279793739318848, "learning_rate": 1.9731271857169153e-05, "loss": 1.4925, "num_input_tokens_seen": 29627232, "step": 4903, "train_runtime": 4969.9196, "train_tokens_per_second": 5961.31 }, { "epoch": 1.8036781609195403, "grad_norm": 1.1436517238616943, "learning_rate": 1.9694459782808765e-05, "loss": 1.6609, "num_input_tokens_seen": 29633072, "step": 4904, "train_runtime": 4970.8903, "train_tokens_per_second": 5961.321 }, { "epoch": 1.8040459770114943, "grad_norm": 1.0318900346755981, "learning_rate": 1.965764770844837e-05, "loss": 1.4023, "num_input_tokens_seen": 29640416, "step": 4905, "train_runtime": 4972.0698, "train_tokens_per_second": 5961.384 }, { "epoch": 1.8044137931034483, "grad_norm": 0.9956551194190979, "learning_rate": 1.962083563408798e-05, "loss": 1.4185, "num_input_tokens_seen": 29645680, "step": 4906, "train_runtime": 4972.9504, "train_tokens_per_second": 5961.387 }, { "epoch": 1.8047816091954023, "grad_norm": 1.0204379558563232, "learning_rate": 1.958402355972759e-05, "loss": 1.4424, "num_input_tokens_seen": 29652608, "step": 4907, "train_runtime": 4974.0547, "train_tokens_per_second": 5961.456 }, { "epoch": 1.8051494252873563, "grad_norm": 0.9458982944488525, "learning_rate": 1.95472114853672e-05, "loss": 1.5268, "num_input_tokens_seen": 29659936, "step": 4908, "train_runtime": 4975.2291, "train_tokens_per_second": 5961.522 }, { "epoch": 1.8055172413793104, "grad_norm": 0.9880759119987488, "learning_rate": 1.951039941100681e-05, "loss": 1.4263, "num_input_tokens_seen": 29668608, "step": 4909, "train_runtime": 4976.5683, "train_tokens_per_second": 5961.66 }, { "epoch": 1.8058850574712644, "grad_norm": 1.0818374156951904, "learning_rate": 1.947358733664642e-05, "loss": 1.5683, "num_input_tokens_seen": 29672544, "step": 4910, "train_runtime": 4977.2607, "train_tokens_per_second": 5961.621 }, { "epoch": 1.8062528735632184, "grad_norm": 0.9811917543411255, "learning_rate": 1.943677526228603e-05, "loss": 1.4595, "num_input_tokens_seen": 29678064, "step": 4911, "train_runtime": 4978.1486, "train_tokens_per_second": 5961.667 }, { "epoch": 1.8066206896551724, "grad_norm": 1.09088933467865, "learning_rate": 1.939996318792564e-05, "loss": 1.3414, "num_input_tokens_seen": 29682560, "step": 4912, "train_runtime": 4978.9376, "train_tokens_per_second": 5961.625 }, { "epoch": 1.8069885057471264, "grad_norm": 0.9992160201072693, "learning_rate": 1.9363151113565252e-05, "loss": 1.4584, "num_input_tokens_seen": 29687968, "step": 4913, "train_runtime": 4979.7978, "train_tokens_per_second": 5961.681 }, { "epoch": 1.8073563218390805, "grad_norm": 0.9398074746131897, "learning_rate": 1.932633903920486e-05, "loss": 1.3795, "num_input_tokens_seen": 29697072, "step": 4914, "train_runtime": 4981.1889, "train_tokens_per_second": 5961.844 }, { "epoch": 1.8077241379310345, "grad_norm": 0.9479207992553711, "learning_rate": 1.928952696484447e-05, "loss": 1.5688, "num_input_tokens_seen": 29704032, "step": 4915, "train_runtime": 4982.315, "train_tokens_per_second": 5961.894 }, { "epoch": 1.8080919540229885, "grad_norm": 1.0464063882827759, "learning_rate": 1.9252714890484082e-05, "loss": 1.3561, "num_input_tokens_seen": 29711520, "step": 4916, "train_runtime": 4983.522, "train_tokens_per_second": 5961.952 }, { "epoch": 1.8084597701149425, "grad_norm": 0.9227623343467712, "learning_rate": 1.921590281612369e-05, "loss": 1.4569, "num_input_tokens_seen": 29719200, "step": 4917, "train_runtime": 4984.7303, "train_tokens_per_second": 5962.048 }, { "epoch": 1.8088275862068965, "grad_norm": 0.999740719795227, "learning_rate": 1.91790907417633e-05, "loss": 1.1996, "num_input_tokens_seen": 29726256, "step": 4918, "train_runtime": 4985.8429, "train_tokens_per_second": 5962.132 }, { "epoch": 1.8091954022988506, "grad_norm": 0.9896454811096191, "learning_rate": 1.9142278667402912e-05, "loss": 1.5592, "num_input_tokens_seen": 29730624, "step": 4919, "train_runtime": 4986.6278, "train_tokens_per_second": 5962.07 }, { "epoch": 1.8095632183908046, "grad_norm": 1.013528823852539, "learning_rate": 1.9105466593042517e-05, "loss": 1.5625, "num_input_tokens_seen": 29735712, "step": 4920, "train_runtime": 4987.4896, "train_tokens_per_second": 5962.06 }, { "epoch": 1.8099310344827586, "grad_norm": 1.0473814010620117, "learning_rate": 1.9068654518682126e-05, "loss": 1.4979, "num_input_tokens_seen": 29742608, "step": 4921, "train_runtime": 4989.1729, "train_tokens_per_second": 5961.431 }, { "epoch": 1.8102988505747126, "grad_norm": 1.0424458980560303, "learning_rate": 1.903184244432174e-05, "loss": 1.504, "num_input_tokens_seen": 29747888, "step": 4922, "train_runtime": 4990.0563, "train_tokens_per_second": 5961.433 }, { "epoch": 1.8106666666666666, "grad_norm": 1.1431024074554443, "learning_rate": 1.8995030369961347e-05, "loss": 1.6549, "num_input_tokens_seen": 29753744, "step": 4923, "train_runtime": 4991.0235, "train_tokens_per_second": 5961.451 }, { "epoch": 1.8110344827586207, "grad_norm": 1.0633981227874756, "learning_rate": 1.8958218295600956e-05, "loss": 1.2825, "num_input_tokens_seen": 29760976, "step": 4924, "train_runtime": 4992.156, "train_tokens_per_second": 5961.548 }, { "epoch": 1.8114022988505747, "grad_norm": 0.9903343915939331, "learning_rate": 1.892140622124057e-05, "loss": 1.456, "num_input_tokens_seen": 29768960, "step": 4925, "train_runtime": 4993.4291, "train_tokens_per_second": 5961.627 }, { "epoch": 1.8117701149425287, "grad_norm": 1.053836464881897, "learning_rate": 1.8884594146880177e-05, "loss": 1.5849, "num_input_tokens_seen": 29773296, "step": 4926, "train_runtime": 4994.2032, "train_tokens_per_second": 5961.571 }, { "epoch": 1.8121379310344827, "grad_norm": 1.002320408821106, "learning_rate": 1.8847782072519786e-05, "loss": 1.3932, "num_input_tokens_seen": 29778848, "step": 4927, "train_runtime": 4995.1133, "train_tokens_per_second": 5961.596 }, { "epoch": 1.8125057471264368, "grad_norm": 1.0374735593795776, "learning_rate": 1.88109699981594e-05, "loss": 1.7077, "num_input_tokens_seen": 29783552, "step": 4928, "train_runtime": 4995.9102, "train_tokens_per_second": 5961.587 }, { "epoch": 1.8128735632183908, "grad_norm": 1.0954574346542358, "learning_rate": 1.8774157923799008e-05, "loss": 1.5615, "num_input_tokens_seen": 29789984, "step": 4929, "train_runtime": 4996.958, "train_tokens_per_second": 5961.624 }, { "epoch": 1.8132413793103448, "grad_norm": 1.0004336833953857, "learning_rate": 1.8737345849438616e-05, "loss": 1.4386, "num_input_tokens_seen": 29795024, "step": 4930, "train_runtime": 4997.791, "train_tokens_per_second": 5961.639 }, { "epoch": 1.8136091954022988, "grad_norm": 0.9620081186294556, "learning_rate": 1.870053377507823e-05, "loss": 1.6004, "num_input_tokens_seen": 29800288, "step": 4931, "train_runtime": 4998.6833, "train_tokens_per_second": 5961.628 }, { "epoch": 1.8139770114942528, "grad_norm": 0.9992434978485107, "learning_rate": 1.8663721700717838e-05, "loss": 1.385, "num_input_tokens_seen": 29805904, "step": 4932, "train_runtime": 4999.6132, "train_tokens_per_second": 5961.642 }, { "epoch": 1.8143448275862069, "grad_norm": 0.947857677936554, "learning_rate": 1.8626909626357447e-05, "loss": 1.3974, "num_input_tokens_seen": 29811360, "step": 4933, "train_runtime": 5000.5313, "train_tokens_per_second": 5961.638 }, { "epoch": 1.8147126436781609, "grad_norm": 0.9161631464958191, "learning_rate": 1.859009755199706e-05, "loss": 1.3631, "num_input_tokens_seen": 29816976, "step": 4934, "train_runtime": 5001.4925, "train_tokens_per_second": 5961.616 }, { "epoch": 1.815080459770115, "grad_norm": 1.0192244052886963, "learning_rate": 1.8553285477636664e-05, "loss": 1.5762, "num_input_tokens_seen": 29824928, "step": 4935, "train_runtime": 5002.7636, "train_tokens_per_second": 5961.69 }, { "epoch": 1.815448275862069, "grad_norm": 0.9719940423965454, "learning_rate": 1.8516473403276273e-05, "loss": 1.551, "num_input_tokens_seen": 29829552, "step": 4936, "train_runtime": 5003.5594, "train_tokens_per_second": 5961.666 }, { "epoch": 1.815816091954023, "grad_norm": 1.1043134927749634, "learning_rate": 1.8479661328915885e-05, "loss": 1.5287, "num_input_tokens_seen": 29835040, "step": 4937, "train_runtime": 5004.4571, "train_tokens_per_second": 5961.694 }, { "epoch": 1.816183908045977, "grad_norm": 0.9655507802963257, "learning_rate": 1.8442849254555494e-05, "loss": 1.5159, "num_input_tokens_seen": 29841312, "step": 4938, "train_runtime": 5005.4723, "train_tokens_per_second": 5961.738 }, { "epoch": 1.816551724137931, "grad_norm": 0.9759043455123901, "learning_rate": 1.8406037180195103e-05, "loss": 1.6169, "num_input_tokens_seen": 29847280, "step": 4939, "train_runtime": 5006.4614, "train_tokens_per_second": 5961.752 }, { "epoch": 1.8169195402298852, "grad_norm": 0.897058367729187, "learning_rate": 1.8369225105834716e-05, "loss": 1.425, "num_input_tokens_seen": 29854144, "step": 4940, "train_runtime": 5007.5836, "train_tokens_per_second": 5961.786 }, { "epoch": 1.817287356321839, "grad_norm": 0.9897091388702393, "learning_rate": 1.8332413031474324e-05, "loss": 1.5767, "num_input_tokens_seen": 29860864, "step": 4941, "train_runtime": 5008.6566, "train_tokens_per_second": 5961.851 }, { "epoch": 1.8176551724137933, "grad_norm": 1.0577644109725952, "learning_rate": 1.8295600957113933e-05, "loss": 1.5974, "num_input_tokens_seen": 29865312, "step": 4942, "train_runtime": 5009.4388, "train_tokens_per_second": 5961.808 }, { "epoch": 1.818022988505747, "grad_norm": 1.2485471963882446, "learning_rate": 1.8258788882753546e-05, "loss": 1.608, "num_input_tokens_seen": 29869232, "step": 4943, "train_runtime": 5010.1373, "train_tokens_per_second": 5961.759 }, { "epoch": 1.8183908045977013, "grad_norm": 1.029123067855835, "learning_rate": 1.8221976808393154e-05, "loss": 1.4635, "num_input_tokens_seen": 29875728, "step": 4944, "train_runtime": 5011.191, "train_tokens_per_second": 5961.802 }, { "epoch": 1.818758620689655, "grad_norm": 0.9065240025520325, "learning_rate": 1.8185164734032763e-05, "loss": 1.3109, "num_input_tokens_seen": 29881136, "step": 4945, "train_runtime": 5012.0734, "train_tokens_per_second": 5961.831 }, { "epoch": 1.8191264367816093, "grad_norm": 1.0743343830108643, "learning_rate": 1.8148352659672376e-05, "loss": 1.5482, "num_input_tokens_seen": 29886016, "step": 4946, "train_runtime": 5012.9138, "train_tokens_per_second": 5961.805 }, { "epoch": 1.8194942528735631, "grad_norm": 0.9645093083381653, "learning_rate": 1.8111540585311985e-05, "loss": 1.548, "num_input_tokens_seen": 29893232, "step": 4947, "train_runtime": 5014.0596, "train_tokens_per_second": 5961.882 }, { "epoch": 1.8198620689655174, "grad_norm": 0.9978023767471313, "learning_rate": 1.8074728510951593e-05, "loss": 1.6379, "num_input_tokens_seen": 29898624, "step": 4948, "train_runtime": 5014.9542, "train_tokens_per_second": 5961.894 }, { "epoch": 1.8202298850574712, "grad_norm": 0.9754540920257568, "learning_rate": 1.8037916436591202e-05, "loss": 1.2603, "num_input_tokens_seen": 29906288, "step": 4949, "train_runtime": 5016.1689, "train_tokens_per_second": 5961.978 }, { "epoch": 1.8205977011494254, "grad_norm": 0.9246507287025452, "learning_rate": 1.800110436223081e-05, "loss": 1.376, "num_input_tokens_seen": 29912096, "step": 4950, "train_runtime": 5017.1188, "train_tokens_per_second": 5962.007 }, { "epoch": 1.8209655172413792, "grad_norm": 1.0795091390609741, "learning_rate": 1.796429228787042e-05, "loss": 1.5992, "num_input_tokens_seen": 29917424, "step": 4951, "train_runtime": 5018.515, "train_tokens_per_second": 5961.41 }, { "epoch": 1.8213333333333335, "grad_norm": 1.0177384614944458, "learning_rate": 1.7927480213510032e-05, "loss": 1.4097, "num_input_tokens_seen": 29925680, "step": 4952, "train_runtime": 5019.7827, "train_tokens_per_second": 5961.549 }, { "epoch": 1.8217011494252873, "grad_norm": 1.0944467782974243, "learning_rate": 1.789066813914964e-05, "loss": 1.5994, "num_input_tokens_seen": 29930848, "step": 4953, "train_runtime": 5020.6447, "train_tokens_per_second": 5961.555 }, { "epoch": 1.8220689655172415, "grad_norm": 0.9916122555732727, "learning_rate": 1.785385606478925e-05, "loss": 1.3572, "num_input_tokens_seen": 29937488, "step": 4954, "train_runtime": 5021.7292, "train_tokens_per_second": 5961.59 }, { "epoch": 1.8224367816091953, "grad_norm": 1.0126090049743652, "learning_rate": 1.7817043990428862e-05, "loss": 1.2591, "num_input_tokens_seen": 29943824, "step": 4955, "train_runtime": 5022.7418, "train_tokens_per_second": 5961.649 }, { "epoch": 1.8228045977011496, "grad_norm": 1.036719799041748, "learning_rate": 1.778023191606847e-05, "loss": 1.3511, "num_input_tokens_seen": 29951008, "step": 4956, "train_runtime": 5023.8881, "train_tokens_per_second": 5961.719 }, { "epoch": 1.8231724137931034, "grad_norm": 0.9798049330711365, "learning_rate": 1.774341984170808e-05, "loss": 1.5379, "num_input_tokens_seen": 29957632, "step": 4957, "train_runtime": 5024.9772, "train_tokens_per_second": 5961.745 }, { "epoch": 1.8235402298850576, "grad_norm": 1.064881682395935, "learning_rate": 1.7706607767347693e-05, "loss": 1.6163, "num_input_tokens_seen": 29963792, "step": 4958, "train_runtime": 5025.9822, "train_tokens_per_second": 5961.778 }, { "epoch": 1.8239080459770114, "grad_norm": 1.0115530490875244, "learning_rate": 1.76697956929873e-05, "loss": 1.4527, "num_input_tokens_seen": 29972816, "step": 4959, "train_runtime": 5027.369, "train_tokens_per_second": 5961.929 }, { "epoch": 1.8242758620689656, "grad_norm": 0.9694092273712158, "learning_rate": 1.763298361862691e-05, "loss": 1.3431, "num_input_tokens_seen": 29977584, "step": 4960, "train_runtime": 5028.1884, "train_tokens_per_second": 5961.905 }, { "epoch": 1.8246436781609194, "grad_norm": 1.1495500802993774, "learning_rate": 1.7596171544266523e-05, "loss": 1.554, "num_input_tokens_seen": 29982912, "step": 4961, "train_runtime": 5029.0776, "train_tokens_per_second": 5961.911 }, { "epoch": 1.8250114942528737, "grad_norm": 1.0569508075714111, "learning_rate": 1.755935946990613e-05, "loss": 1.6111, "num_input_tokens_seen": 29989872, "step": 4962, "train_runtime": 5030.2012, "train_tokens_per_second": 5961.963 }, { "epoch": 1.8253793103448275, "grad_norm": 1.0188040733337402, "learning_rate": 1.752254739554574e-05, "loss": 1.5268, "num_input_tokens_seen": 29994704, "step": 4963, "train_runtime": 5031.0167, "train_tokens_per_second": 5961.957 }, { "epoch": 1.8257471264367817, "grad_norm": 1.0134364366531372, "learning_rate": 1.748573532118535e-05, "loss": 1.61, "num_input_tokens_seen": 29999552, "step": 4964, "train_runtime": 5031.8552, "train_tokens_per_second": 5961.927 }, { "epoch": 1.8261149425287355, "grad_norm": 1.0191245079040527, "learning_rate": 1.7448923246824958e-05, "loss": 1.5768, "num_input_tokens_seen": 30005648, "step": 4965, "train_runtime": 5032.8494, "train_tokens_per_second": 5961.96 }, { "epoch": 1.8264827586206898, "grad_norm": 1.0314635038375854, "learning_rate": 1.7412111172464567e-05, "loss": 1.631, "num_input_tokens_seen": 30010848, "step": 4966, "train_runtime": 5033.7288, "train_tokens_per_second": 5961.952 }, { "epoch": 1.8268505747126436, "grad_norm": 0.9666833281517029, "learning_rate": 1.737529909810418e-05, "loss": 1.5824, "num_input_tokens_seen": 30016016, "step": 4967, "train_runtime": 5034.6143, "train_tokens_per_second": 5961.93 }, { "epoch": 1.8272183908045978, "grad_norm": 1.0156227350234985, "learning_rate": 1.7338487023743788e-05, "loss": 1.7048, "num_input_tokens_seen": 30021456, "step": 4968, "train_runtime": 5035.5245, "train_tokens_per_second": 5961.932 }, { "epoch": 1.8275862068965516, "grad_norm": 0.9774816036224365, "learning_rate": 1.7301674949383397e-05, "loss": 1.5288, "num_input_tokens_seen": 30027440, "step": 4969, "train_runtime": 5036.4996, "train_tokens_per_second": 5961.966 }, { "epoch": 1.8279540229885058, "grad_norm": 1.05318284034729, "learning_rate": 1.726486287502301e-05, "loss": 1.741, "num_input_tokens_seen": 30032416, "step": 4970, "train_runtime": 5037.334, "train_tokens_per_second": 5961.966 }, { "epoch": 1.8283218390804596, "grad_norm": 1.029547095298767, "learning_rate": 1.722805080066262e-05, "loss": 1.4505, "num_input_tokens_seen": 30036864, "step": 4971, "train_runtime": 5038.109, "train_tokens_per_second": 5961.932 }, { "epoch": 1.8286896551724139, "grad_norm": 1.095587968826294, "learning_rate": 1.7191238726302227e-05, "loss": 1.731, "num_input_tokens_seen": 30042736, "step": 4972, "train_runtime": 5039.0994, "train_tokens_per_second": 5961.926 }, { "epoch": 1.8290574712643677, "grad_norm": 0.8790012001991272, "learning_rate": 1.715442665194184e-05, "loss": 1.1759, "num_input_tokens_seen": 30049328, "step": 4973, "train_runtime": 5040.157, "train_tokens_per_second": 5961.983 }, { "epoch": 1.829425287356322, "grad_norm": 1.0671660900115967, "learning_rate": 1.711761457758145e-05, "loss": 1.5747, "num_input_tokens_seen": 30054112, "step": 4974, "train_runtime": 5040.9681, "train_tokens_per_second": 5961.972 }, { "epoch": 1.8297931034482757, "grad_norm": 1.0995584726333618, "learning_rate": 1.7080802503221057e-05, "loss": 1.6804, "num_input_tokens_seen": 30059504, "step": 4975, "train_runtime": 5041.8852, "train_tokens_per_second": 5961.957 }, { "epoch": 1.83016091954023, "grad_norm": 1.0045770406723022, "learning_rate": 1.7043990428860666e-05, "loss": 1.5507, "num_input_tokens_seen": 30065088, "step": 4976, "train_runtime": 5042.8229, "train_tokens_per_second": 5961.956 }, { "epoch": 1.8305287356321838, "grad_norm": 1.0075474977493286, "learning_rate": 1.700717835450028e-05, "loss": 1.5872, "num_input_tokens_seen": 30069680, "step": 4977, "train_runtime": 5043.639, "train_tokens_per_second": 5961.902 }, { "epoch": 1.830896551724138, "grad_norm": 0.8998899459838867, "learning_rate": 1.6970366280139887e-05, "loss": 1.3291, "num_input_tokens_seen": 30076896, "step": 4978, "train_runtime": 5044.7999, "train_tokens_per_second": 5961.96 }, { "epoch": 1.8312643678160918, "grad_norm": 0.924291729927063, "learning_rate": 1.6933554205779496e-05, "loss": 1.4414, "num_input_tokens_seen": 30082960, "step": 4979, "train_runtime": 5045.8099, "train_tokens_per_second": 5961.969 }, { "epoch": 1.831632183908046, "grad_norm": 1.105634093284607, "learning_rate": 1.6896742131419105e-05, "loss": 1.4625, "num_input_tokens_seen": 30088720, "step": 4980, "train_runtime": 5046.7596, "train_tokens_per_second": 5961.988 }, { "epoch": 1.8319999999999999, "grad_norm": 1.005671739578247, "learning_rate": 1.6859930057058714e-05, "loss": 1.4213, "num_input_tokens_seen": 30098528, "step": 4981, "train_runtime": 5048.746, "train_tokens_per_second": 5961.585 }, { "epoch": 1.832367816091954, "grad_norm": 1.0299687385559082, "learning_rate": 1.6823117982698326e-05, "loss": 1.4318, "num_input_tokens_seen": 30107072, "step": 4982, "train_runtime": 5050.0456, "train_tokens_per_second": 5961.743 }, { "epoch": 1.832735632183908, "grad_norm": 0.9860517382621765, "learning_rate": 1.6786305908337935e-05, "loss": 1.6479, "num_input_tokens_seen": 30112096, "step": 4983, "train_runtime": 5050.9068, "train_tokens_per_second": 5961.721 }, { "epoch": 1.8331034482758621, "grad_norm": 1.0216484069824219, "learning_rate": 1.6749493833977544e-05, "loss": 1.5473, "num_input_tokens_seen": 30116768, "step": 4984, "train_runtime": 5051.728, "train_tokens_per_second": 5961.676 }, { "epoch": 1.833471264367816, "grad_norm": 0.98443603515625, "learning_rate": 1.6712681759617156e-05, "loss": 1.5211, "num_input_tokens_seen": 30121824, "step": 4985, "train_runtime": 5052.5704, "train_tokens_per_second": 5961.683 }, { "epoch": 1.8338390804597702, "grad_norm": 0.9827259182929993, "learning_rate": 1.6675869685256765e-05, "loss": 1.4428, "num_input_tokens_seen": 30129152, "step": 4986, "train_runtime": 5053.7553, "train_tokens_per_second": 5961.735 }, { "epoch": 1.834206896551724, "grad_norm": 0.9716022610664368, "learning_rate": 1.6639057610896374e-05, "loss": 1.4764, "num_input_tokens_seen": 30135536, "step": 4987, "train_runtime": 5054.7983, "train_tokens_per_second": 5961.768 }, { "epoch": 1.8345747126436782, "grad_norm": 1.008683204650879, "learning_rate": 1.6602245536535983e-05, "loss": 1.6244, "num_input_tokens_seen": 30140416, "step": 4988, "train_runtime": 5055.622, "train_tokens_per_second": 5961.762 }, { "epoch": 1.8349425287356322, "grad_norm": 1.0419566631317139, "learning_rate": 1.6565433462175595e-05, "loss": 1.577, "num_input_tokens_seen": 30145088, "step": 4989, "train_runtime": 5056.4486, "train_tokens_per_second": 5961.712 }, { "epoch": 1.8353103448275863, "grad_norm": 0.9477977752685547, "learning_rate": 1.6528621387815204e-05, "loss": 1.3136, "num_input_tokens_seen": 30154208, "step": 4990, "train_runtime": 5057.8425, "train_tokens_per_second": 5961.872 }, { "epoch": 1.8356781609195403, "grad_norm": 1.0180165767669678, "learning_rate": 1.6491809313454813e-05, "loss": 1.4604, "num_input_tokens_seen": 30161744, "step": 4991, "train_runtime": 5059.0286, "train_tokens_per_second": 5961.964 }, { "epoch": 1.8360459770114943, "grad_norm": 0.9779078960418701, "learning_rate": 1.6454997239094425e-05, "loss": 1.3226, "num_input_tokens_seen": 30167488, "step": 4992, "train_runtime": 5059.9687, "train_tokens_per_second": 5961.991 }, { "epoch": 1.8364137931034483, "grad_norm": 1.0453846454620361, "learning_rate": 1.6418185164734034e-05, "loss": 1.5109, "num_input_tokens_seen": 30171808, "step": 4993, "train_runtime": 5060.7563, "train_tokens_per_second": 5961.917 }, { "epoch": 1.8367816091954023, "grad_norm": 0.980159342288971, "learning_rate": 1.6381373090373643e-05, "loss": 1.4922, "num_input_tokens_seen": 30176816, "step": 4994, "train_runtime": 5061.5947, "train_tokens_per_second": 5961.919 }, { "epoch": 1.8371494252873564, "grad_norm": 0.9506115913391113, "learning_rate": 1.6344561016013255e-05, "loss": 1.2191, "num_input_tokens_seen": 30184688, "step": 4995, "train_runtime": 5062.8234, "train_tokens_per_second": 5962.027 }, { "epoch": 1.8375172413793104, "grad_norm": 1.0737897157669067, "learning_rate": 1.630774894165286e-05, "loss": 1.4525, "num_input_tokens_seen": 30188896, "step": 4996, "train_runtime": 5063.5629, "train_tokens_per_second": 5961.987 }, { "epoch": 1.8378850574712644, "grad_norm": 1.061200499534607, "learning_rate": 1.6270936867292473e-05, "loss": 1.6259, "num_input_tokens_seen": 30199760, "step": 4997, "train_runtime": 5065.1752, "train_tokens_per_second": 5962.234 }, { "epoch": 1.8382528735632184, "grad_norm": 1.0682674646377563, "learning_rate": 1.6234124792932082e-05, "loss": 1.6091, "num_input_tokens_seen": 30204752, "step": 4998, "train_runtime": 5066.0282, "train_tokens_per_second": 5962.215 }, { "epoch": 1.8386206896551724, "grad_norm": 1.0308079719543457, "learning_rate": 1.619731271857169e-05, "loss": 1.4901, "num_input_tokens_seen": 30209232, "step": 4999, "train_runtime": 5066.8397, "train_tokens_per_second": 5962.145 }, { "epoch": 1.8389885057471265, "grad_norm": 1.0160410404205322, "learning_rate": 1.6160500644211303e-05, "loss": 1.5683, "num_input_tokens_seen": 30214560, "step": 5000, "train_runtime": 5067.7383, "train_tokens_per_second": 5962.139 }, { "epoch": 1.8393563218390805, "grad_norm": 1.0536404848098755, "learning_rate": 1.6123688569850912e-05, "loss": 1.2674, "num_input_tokens_seen": 30222432, "step": 5001, "train_runtime": 5068.9546, "train_tokens_per_second": 5962.261 }, { "epoch": 1.8397241379310345, "grad_norm": 1.0723559856414795, "learning_rate": 1.608687649549052e-05, "loss": 1.6385, "num_input_tokens_seen": 30227088, "step": 5002, "train_runtime": 5069.7547, "train_tokens_per_second": 5962.239 }, { "epoch": 1.8400919540229885, "grad_norm": 1.0325651168823242, "learning_rate": 1.605006442113013e-05, "loss": 1.4342, "num_input_tokens_seen": 30232656, "step": 5003, "train_runtime": 5070.6568, "train_tokens_per_second": 5962.276 }, { "epoch": 1.8404597701149426, "grad_norm": 1.0740904808044434, "learning_rate": 1.6013252346769742e-05, "loss": 1.4162, "num_input_tokens_seen": 30237584, "step": 5004, "train_runtime": 5071.4831, "train_tokens_per_second": 5962.276 }, { "epoch": 1.8408275862068966, "grad_norm": 0.9917394518852234, "learning_rate": 1.597644027240935e-05, "loss": 1.4873, "num_input_tokens_seen": 30243040, "step": 5005, "train_runtime": 5072.3909, "train_tokens_per_second": 5962.285 }, { "epoch": 1.8411954022988506, "grad_norm": 1.0606144666671753, "learning_rate": 1.593962819804896e-05, "loss": 1.486, "num_input_tokens_seen": 30249472, "step": 5006, "train_runtime": 5073.4178, "train_tokens_per_second": 5962.346 }, { "epoch": 1.8415632183908046, "grad_norm": 1.0541677474975586, "learning_rate": 1.5902816123688572e-05, "loss": 1.5326, "num_input_tokens_seen": 30255744, "step": 5007, "train_runtime": 5074.4427, "train_tokens_per_second": 5962.378 }, { "epoch": 1.8419310344827586, "grad_norm": 1.1358091831207275, "learning_rate": 1.586600404932818e-05, "loss": 1.7369, "num_input_tokens_seen": 30260496, "step": 5008, "train_runtime": 5075.2593, "train_tokens_per_second": 5962.355 }, { "epoch": 1.8422988505747127, "grad_norm": 1.0278191566467285, "learning_rate": 1.582919197496779e-05, "loss": 1.4993, "num_input_tokens_seen": 30265968, "step": 5009, "train_runtime": 5076.1591, "train_tokens_per_second": 5962.376 }, { "epoch": 1.8426666666666667, "grad_norm": 0.9608697295188904, "learning_rate": 1.5792379900607402e-05, "loss": 1.4283, "num_input_tokens_seen": 30274544, "step": 5010, "train_runtime": 5077.5133, "train_tokens_per_second": 5962.475 }, { "epoch": 1.8430344827586207, "grad_norm": 0.9913397431373596, "learning_rate": 1.5755567826247008e-05, "loss": 1.753, "num_input_tokens_seen": 30279616, "step": 5011, "train_runtime": 5078.8607, "train_tokens_per_second": 5961.891 }, { "epoch": 1.8434022988505747, "grad_norm": 0.9961228966712952, "learning_rate": 1.571875575188662e-05, "loss": 1.3563, "num_input_tokens_seen": 30284304, "step": 5012, "train_runtime": 5079.6395, "train_tokens_per_second": 5961.9 }, { "epoch": 1.8437701149425287, "grad_norm": 1.109960913658142, "learning_rate": 1.568194367752623e-05, "loss": 1.5663, "num_input_tokens_seen": 30292736, "step": 5013, "train_runtime": 5080.9552, "train_tokens_per_second": 5962.016 }, { "epoch": 1.8441379310344828, "grad_norm": 0.9731327891349792, "learning_rate": 1.5645131603165838e-05, "loss": 1.5068, "num_input_tokens_seen": 30298528, "step": 5014, "train_runtime": 5081.8938, "train_tokens_per_second": 5962.055 }, { "epoch": 1.8445057471264368, "grad_norm": 0.9294212460517883, "learning_rate": 1.5608319528805447e-05, "loss": 1.2195, "num_input_tokens_seen": 30307088, "step": 5015, "train_runtime": 5083.1898, "train_tokens_per_second": 5962.218 }, { "epoch": 1.8448735632183908, "grad_norm": 0.99272620677948, "learning_rate": 1.557150745444506e-05, "loss": 1.5177, "num_input_tokens_seen": 30312224, "step": 5016, "train_runtime": 5084.0713, "train_tokens_per_second": 5962.195 }, { "epoch": 1.8452413793103448, "grad_norm": 0.9845655560493469, "learning_rate": 1.5534695380084668e-05, "loss": 1.4629, "num_input_tokens_seen": 30321664, "step": 5017, "train_runtime": 5085.525, "train_tokens_per_second": 5962.347 }, { "epoch": 1.8456091954022988, "grad_norm": 1.1305726766586304, "learning_rate": 1.5497883305724277e-05, "loss": 1.715, "num_input_tokens_seen": 30327088, "step": 5018, "train_runtime": 5086.4389, "train_tokens_per_second": 5962.342 }, { "epoch": 1.8459770114942529, "grad_norm": 1.0919382572174072, "learning_rate": 1.546107123136389e-05, "loss": 1.8685, "num_input_tokens_seen": 30332208, "step": 5019, "train_runtime": 5087.3037, "train_tokens_per_second": 5962.335 }, { "epoch": 1.8463448275862069, "grad_norm": 1.0870243310928345, "learning_rate": 1.5424259157003498e-05, "loss": 1.6012, "num_input_tokens_seen": 30336976, "step": 5020, "train_runtime": 5088.1072, "train_tokens_per_second": 5962.33 }, { "epoch": 1.846712643678161, "grad_norm": 1.0127289295196533, "learning_rate": 1.5387447082643107e-05, "loss": 1.7094, "num_input_tokens_seen": 30342320, "step": 5021, "train_runtime": 5088.988, "train_tokens_per_second": 5962.348 }, { "epoch": 1.847080459770115, "grad_norm": 1.0184253454208374, "learning_rate": 1.535063500828272e-05, "loss": 1.4599, "num_input_tokens_seen": 30347568, "step": 5022, "train_runtime": 5089.8803, "train_tokens_per_second": 5962.334 }, { "epoch": 1.847448275862069, "grad_norm": 0.9991694688796997, "learning_rate": 1.5313822933922328e-05, "loss": 1.527, "num_input_tokens_seen": 30352848, "step": 5023, "train_runtime": 5090.7557, "train_tokens_per_second": 5962.346 }, { "epoch": 1.847816091954023, "grad_norm": 0.9224336743354797, "learning_rate": 1.5277010859561937e-05, "loss": 1.4338, "num_input_tokens_seen": 30359504, "step": 5024, "train_runtime": 5091.8406, "train_tokens_per_second": 5962.383 }, { "epoch": 1.848183908045977, "grad_norm": 1.082759976387024, "learning_rate": 1.5240198785201548e-05, "loss": 1.7668, "num_input_tokens_seen": 30364144, "step": 5025, "train_runtime": 5092.6448, "train_tokens_per_second": 5962.353 }, { "epoch": 1.848551724137931, "grad_norm": 1.0988906621932983, "learning_rate": 1.5203386710841155e-05, "loss": 1.463, "num_input_tokens_seen": 30369920, "step": 5026, "train_runtime": 5093.6022, "train_tokens_per_second": 5962.366 }, { "epoch": 1.848919540229885, "grad_norm": 0.898306131362915, "learning_rate": 1.5166574636480765e-05, "loss": 1.5303, "num_input_tokens_seen": 30377904, "step": 5027, "train_runtime": 5094.8497, "train_tokens_per_second": 5962.473 }, { "epoch": 1.849287356321839, "grad_norm": 0.9081872701644897, "learning_rate": 1.5129762562120376e-05, "loss": 1.3248, "num_input_tokens_seen": 30384624, "step": 5028, "train_runtime": 5095.9105, "train_tokens_per_second": 5962.551 }, { "epoch": 1.849655172413793, "grad_norm": 1.063267707824707, "learning_rate": 1.5092950487759985e-05, "loss": 1.4219, "num_input_tokens_seen": 30392544, "step": 5029, "train_runtime": 5097.1409, "train_tokens_per_second": 5962.665 }, { "epoch": 1.850022988505747, "grad_norm": 0.9911524653434753, "learning_rate": 1.5056138413399595e-05, "loss": 1.4586, "num_input_tokens_seen": 30399056, "step": 5030, "train_runtime": 5098.1995, "train_tokens_per_second": 5962.704 }, { "epoch": 1.850390804597701, "grad_norm": 0.95414799451828, "learning_rate": 1.5019326339039206e-05, "loss": 1.3232, "num_input_tokens_seen": 30405504, "step": 5031, "train_runtime": 5099.2523, "train_tokens_per_second": 5962.738 }, { "epoch": 1.8507586206896551, "grad_norm": 0.9188612103462219, "learning_rate": 1.4982514264678815e-05, "loss": 1.6327, "num_input_tokens_seen": 30411536, "step": 5032, "train_runtime": 5100.2201, "train_tokens_per_second": 5962.789 }, { "epoch": 1.8511264367816092, "grad_norm": 0.9932575821876526, "learning_rate": 1.4945702190318426e-05, "loss": 1.4435, "num_input_tokens_seen": 30417168, "step": 5033, "train_runtime": 5101.1551, "train_tokens_per_second": 5962.8 }, { "epoch": 1.8514942528735632, "grad_norm": 0.9736252427101135, "learning_rate": 1.4908890115958034e-05, "loss": 1.4467, "num_input_tokens_seen": 30424160, "step": 5034, "train_runtime": 5102.2557, "train_tokens_per_second": 5962.884 }, { "epoch": 1.8518620689655172, "grad_norm": 1.0463744401931763, "learning_rate": 1.4872078041597645e-05, "loss": 1.4632, "num_input_tokens_seen": 30429904, "step": 5035, "train_runtime": 5103.166, "train_tokens_per_second": 5962.946 }, { "epoch": 1.8522298850574712, "grad_norm": 1.0465551614761353, "learning_rate": 1.4835265967237256e-05, "loss": 1.5998, "num_input_tokens_seen": 30434656, "step": 5036, "train_runtime": 5104.0026, "train_tokens_per_second": 5962.9 }, { "epoch": 1.8525977011494252, "grad_norm": 1.0173680782318115, "learning_rate": 1.4798453892876864e-05, "loss": 1.5473, "num_input_tokens_seen": 30441760, "step": 5037, "train_runtime": 5105.1223, "train_tokens_per_second": 5962.983 }, { "epoch": 1.8529655172413793, "grad_norm": 0.9877189993858337, "learning_rate": 1.4761641818516475e-05, "loss": 1.2774, "num_input_tokens_seen": 30449424, "step": 5038, "train_runtime": 5106.3205, "train_tokens_per_second": 5963.085 }, { "epoch": 1.8533333333333335, "grad_norm": 1.026616096496582, "learning_rate": 1.4724829744156086e-05, "loss": 1.6398, "num_input_tokens_seen": 30455664, "step": 5039, "train_runtime": 5107.3267, "train_tokens_per_second": 5963.132 }, { "epoch": 1.8537011494252873, "grad_norm": 1.1925349235534668, "learning_rate": 1.4688017669795695e-05, "loss": 1.7049, "num_input_tokens_seen": 30460944, "step": 5040, "train_runtime": 5108.1895, "train_tokens_per_second": 5963.159 }, { "epoch": 1.8540689655172415, "grad_norm": 1.0198228359222412, "learning_rate": 1.4651205595435302e-05, "loss": 1.656, "num_input_tokens_seen": 30466032, "step": 5041, "train_runtime": 5109.6124, "train_tokens_per_second": 5962.494 }, { "epoch": 1.8544367816091953, "grad_norm": 1.084392786026001, "learning_rate": 1.4614393521074912e-05, "loss": 1.6761, "num_input_tokens_seen": 30470192, "step": 5042, "train_runtime": 5110.3422, "train_tokens_per_second": 5962.456 }, { "epoch": 1.8548045977011496, "grad_norm": 1.002570390701294, "learning_rate": 1.4577581446714523e-05, "loss": 1.5013, "num_input_tokens_seen": 30476192, "step": 5043, "train_runtime": 5111.3153, "train_tokens_per_second": 5962.495 }, { "epoch": 1.8551724137931034, "grad_norm": 1.031084418296814, "learning_rate": 1.4540769372354132e-05, "loss": 1.5598, "num_input_tokens_seen": 30483056, "step": 5044, "train_runtime": 5112.397, "train_tokens_per_second": 5962.576 }, { "epoch": 1.8555402298850576, "grad_norm": 0.9973475933074951, "learning_rate": 1.4503957297993742e-05, "loss": 1.617, "num_input_tokens_seen": 30487616, "step": 5045, "train_runtime": 5113.1713, "train_tokens_per_second": 5962.565 }, { "epoch": 1.8559080459770114, "grad_norm": 0.9751969575881958, "learning_rate": 1.4467145223633351e-05, "loss": 1.5653, "num_input_tokens_seen": 30492896, "step": 5046, "train_runtime": 5114.0419, "train_tokens_per_second": 5962.582 }, { "epoch": 1.8562758620689657, "grad_norm": 1.0036165714263916, "learning_rate": 1.4430333149272962e-05, "loss": 1.7789, "num_input_tokens_seen": 30497696, "step": 5047, "train_runtime": 5114.8702, "train_tokens_per_second": 5962.555 }, { "epoch": 1.8566436781609195, "grad_norm": 1.0237960815429688, "learning_rate": 1.4393521074912572e-05, "loss": 1.5519, "num_input_tokens_seen": 30506880, "step": 5048, "train_runtime": 5116.2788, "train_tokens_per_second": 5962.709 }, { "epoch": 1.8570114942528737, "grad_norm": 0.950262188911438, "learning_rate": 1.4356709000552181e-05, "loss": 1.417, "num_input_tokens_seen": 30515168, "step": 5049, "train_runtime": 5117.5645, "train_tokens_per_second": 5962.83 }, { "epoch": 1.8573793103448275, "grad_norm": 1.030007243156433, "learning_rate": 1.4319896926191792e-05, "loss": 1.4578, "num_input_tokens_seen": 30521376, "step": 5050, "train_runtime": 5118.5796, "train_tokens_per_second": 5962.86 }, { "epoch": 1.8577471264367817, "grad_norm": 0.986011266708374, "learning_rate": 1.4283084851831403e-05, "loss": 1.4901, "num_input_tokens_seen": 30526560, "step": 5051, "train_runtime": 5119.4287, "train_tokens_per_second": 5962.884 }, { "epoch": 1.8581149425287355, "grad_norm": 0.9912033081054688, "learning_rate": 1.4246272777471011e-05, "loss": 1.5228, "num_input_tokens_seen": 30531920, "step": 5052, "train_runtime": 5120.3288, "train_tokens_per_second": 5962.883 }, { "epoch": 1.8584827586206898, "grad_norm": 1.0162124633789062, "learning_rate": 1.4209460703110622e-05, "loss": 1.5007, "num_input_tokens_seen": 30540928, "step": 5053, "train_runtime": 5121.7022, "train_tokens_per_second": 5963.042 }, { "epoch": 1.8588505747126436, "grad_norm": 1.0581971406936646, "learning_rate": 1.4172648628750233e-05, "loss": 1.4919, "num_input_tokens_seen": 30546448, "step": 5054, "train_runtime": 5122.6102, "train_tokens_per_second": 5963.063 }, { "epoch": 1.8592183908045978, "grad_norm": 1.0529959201812744, "learning_rate": 1.4135836554389841e-05, "loss": 1.5747, "num_input_tokens_seen": 30551360, "step": 5055, "train_runtime": 5123.4277, "train_tokens_per_second": 5963.07 }, { "epoch": 1.8595862068965516, "grad_norm": 1.065110445022583, "learning_rate": 1.4099024480029449e-05, "loss": 1.6546, "num_input_tokens_seen": 30557280, "step": 5056, "train_runtime": 5124.3956, "train_tokens_per_second": 5963.099 }, { "epoch": 1.8599540229885059, "grad_norm": 0.9212146997451782, "learning_rate": 1.406221240566906e-05, "loss": 1.2735, "num_input_tokens_seen": 30563264, "step": 5057, "train_runtime": 5125.3742, "train_tokens_per_second": 5963.128 }, { "epoch": 1.8603218390804597, "grad_norm": 0.9818912148475647, "learning_rate": 1.402540033130867e-05, "loss": 1.4226, "num_input_tokens_seen": 30568752, "step": 5058, "train_runtime": 5126.2659, "train_tokens_per_second": 5963.162 }, { "epoch": 1.860689655172414, "grad_norm": 1.0723986625671387, "learning_rate": 1.3988588256948279e-05, "loss": 1.4278, "num_input_tokens_seen": 30574272, "step": 5059, "train_runtime": 5127.1939, "train_tokens_per_second": 5963.159 }, { "epoch": 1.8610574712643677, "grad_norm": 0.98280268907547, "learning_rate": 1.395177618258789e-05, "loss": 1.2585, "num_input_tokens_seen": 30580224, "step": 5060, "train_runtime": 5128.1961, "train_tokens_per_second": 5963.154 }, { "epoch": 1.861425287356322, "grad_norm": 0.9946303367614746, "learning_rate": 1.3914964108227498e-05, "loss": 1.6314, "num_input_tokens_seen": 30585248, "step": 5061, "train_runtime": 5129.0636, "train_tokens_per_second": 5963.125 }, { "epoch": 1.8617931034482758, "grad_norm": 1.0140941143035889, "learning_rate": 1.3878152033867109e-05, "loss": 1.568, "num_input_tokens_seen": 30589872, "step": 5062, "train_runtime": 5129.8829, "train_tokens_per_second": 5963.074 }, { "epoch": 1.86216091954023, "grad_norm": 0.9778771996498108, "learning_rate": 1.384133995950672e-05, "loss": 1.4906, "num_input_tokens_seen": 30594432, "step": 5063, "train_runtime": 5130.6869, "train_tokens_per_second": 5963.028 }, { "epoch": 1.8625287356321838, "grad_norm": 0.9767743945121765, "learning_rate": 1.3804527885146328e-05, "loss": 1.4655, "num_input_tokens_seen": 30600496, "step": 5064, "train_runtime": 5131.6727, "train_tokens_per_second": 5963.065 }, { "epoch": 1.862896551724138, "grad_norm": 0.9685781598091125, "learning_rate": 1.3767715810785939e-05, "loss": 1.4346, "num_input_tokens_seen": 30605856, "step": 5065, "train_runtime": 5132.5409, "train_tokens_per_second": 5963.1 }, { "epoch": 1.8632643678160918, "grad_norm": 1.0256255865097046, "learning_rate": 1.373090373642555e-05, "loss": 1.4224, "num_input_tokens_seen": 30611072, "step": 5066, "train_runtime": 5133.395, "train_tokens_per_second": 5963.124 }, { "epoch": 1.863632183908046, "grad_norm": 0.9459775686264038, "learning_rate": 1.3694091662065158e-05, "loss": 1.3028, "num_input_tokens_seen": 30619168, "step": 5067, "train_runtime": 5134.6519, "train_tokens_per_second": 5963.241 }, { "epoch": 1.8639999999999999, "grad_norm": 1.0559552907943726, "learning_rate": 1.3657279587704769e-05, "loss": 1.6466, "num_input_tokens_seen": 30624000, "step": 5068, "train_runtime": 5135.4798, "train_tokens_per_second": 5963.221 }, { "epoch": 1.8643678160919541, "grad_norm": 1.0232208967208862, "learning_rate": 1.362046751334438e-05, "loss": 1.5455, "num_input_tokens_seen": 30628736, "step": 5069, "train_runtime": 5136.2864, "train_tokens_per_second": 5963.206 }, { "epoch": 1.864735632183908, "grad_norm": 1.013243317604065, "learning_rate": 1.3583655438983988e-05, "loss": 1.6172, "num_input_tokens_seen": 30633520, "step": 5070, "train_runtime": 5137.1024, "train_tokens_per_second": 5963.19 }, { "epoch": 1.8651034482758622, "grad_norm": 1.057968020439148, "learning_rate": 1.3546843364623596e-05, "loss": 1.5438, "num_input_tokens_seen": 30639328, "step": 5071, "train_runtime": 5138.6041, "train_tokens_per_second": 5962.578 }, { "epoch": 1.865471264367816, "grad_norm": 0.9944549202919006, "learning_rate": 1.3510031290263206e-05, "loss": 1.3446, "num_input_tokens_seen": 30647536, "step": 5072, "train_runtime": 5139.8809, "train_tokens_per_second": 5962.694 }, { "epoch": 1.8658390804597702, "grad_norm": 1.0087077617645264, "learning_rate": 1.3473219215902815e-05, "loss": 1.5324, "num_input_tokens_seen": 30652400, "step": 5073, "train_runtime": 5140.7054, "train_tokens_per_second": 5962.684 }, { "epoch": 1.866206896551724, "grad_norm": 0.9828615784645081, "learning_rate": 1.3436407141542426e-05, "loss": 1.5487, "num_input_tokens_seen": 30657328, "step": 5074, "train_runtime": 5141.5239, "train_tokens_per_second": 5962.693 }, { "epoch": 1.8665747126436782, "grad_norm": 1.0491549968719482, "learning_rate": 1.3399595067182036e-05, "loss": 1.6233, "num_input_tokens_seen": 30662384, "step": 5075, "train_runtime": 5142.3783, "train_tokens_per_second": 5962.685 }, { "epoch": 1.866942528735632, "grad_norm": 1.046576976776123, "learning_rate": 1.3362782992821645e-05, "loss": 1.5585, "num_input_tokens_seen": 30667424, "step": 5076, "train_runtime": 5143.2315, "train_tokens_per_second": 5962.676 }, { "epoch": 1.8673103448275863, "grad_norm": 0.9875950813293457, "learning_rate": 1.3325970918461256e-05, "loss": 1.3376, "num_input_tokens_seen": 30672544, "step": 5077, "train_runtime": 5144.1033, "train_tokens_per_second": 5962.661 }, { "epoch": 1.86767816091954, "grad_norm": 1.1327226161956787, "learning_rate": 1.3289158844100866e-05, "loss": 1.5743, "num_input_tokens_seen": 30678240, "step": 5078, "train_runtime": 5145.0381, "train_tokens_per_second": 5962.685 }, { "epoch": 1.8680459770114943, "grad_norm": 1.0779470205307007, "learning_rate": 1.3252346769740475e-05, "loss": 1.6379, "num_input_tokens_seen": 30683408, "step": 5079, "train_runtime": 5145.8942, "train_tokens_per_second": 5962.697 }, { "epoch": 1.8684137931034481, "grad_norm": 0.964714765548706, "learning_rate": 1.3215534695380086e-05, "loss": 1.3875, "num_input_tokens_seen": 30688256, "step": 5080, "train_runtime": 5146.728, "train_tokens_per_second": 5962.673 }, { "epoch": 1.8687816091954024, "grad_norm": 1.1236010789871216, "learning_rate": 1.3178722621019696e-05, "loss": 1.6559, "num_input_tokens_seen": 30693008, "step": 5081, "train_runtime": 5147.5356, "train_tokens_per_second": 5962.661 }, { "epoch": 1.8691494252873562, "grad_norm": 1.012908935546875, "learning_rate": 1.3141910546659305e-05, "loss": 1.6738, "num_input_tokens_seen": 30699792, "step": 5082, "train_runtime": 5148.6036, "train_tokens_per_second": 5962.741 }, { "epoch": 1.8695172413793104, "grad_norm": 1.034468650817871, "learning_rate": 1.3105098472298916e-05, "loss": 1.5693, "num_input_tokens_seen": 30704672, "step": 5083, "train_runtime": 5149.42, "train_tokens_per_second": 5962.744 }, { "epoch": 1.8698850574712642, "grad_norm": 1.038994312286377, "learning_rate": 1.3068286397938525e-05, "loss": 1.7106, "num_input_tokens_seen": 30709232, "step": 5084, "train_runtime": 5150.1949, "train_tokens_per_second": 5962.732 }, { "epoch": 1.8702528735632185, "grad_norm": 1.0251950025558472, "learning_rate": 1.3031474323578135e-05, "loss": 1.5251, "num_input_tokens_seen": 30714336, "step": 5085, "train_runtime": 5151.0501, "train_tokens_per_second": 5962.733 }, { "epoch": 1.8706206896551723, "grad_norm": 1.024907112121582, "learning_rate": 1.2994662249217743e-05, "loss": 1.4149, "num_input_tokens_seen": 30721744, "step": 5086, "train_runtime": 5152.236, "train_tokens_per_second": 5962.798 }, { "epoch": 1.8709885057471265, "grad_norm": 1.0257986783981323, "learning_rate": 1.2957850174857353e-05, "loss": 1.3384, "num_input_tokens_seen": 30728912, "step": 5087, "train_runtime": 5153.402, "train_tokens_per_second": 5962.84 }, { "epoch": 1.8713563218390803, "grad_norm": 0.9821317195892334, "learning_rate": 1.2921038100496962e-05, "loss": 1.3058, "num_input_tokens_seen": 30735760, "step": 5088, "train_runtime": 5154.5118, "train_tokens_per_second": 5962.885 }, { "epoch": 1.8717241379310345, "grad_norm": 1.106223225593567, "learning_rate": 1.2884226026136573e-05, "loss": 1.6508, "num_input_tokens_seen": 30742496, "step": 5089, "train_runtime": 5155.5644, "train_tokens_per_second": 5962.974 }, { "epoch": 1.8720919540229886, "grad_norm": 1.1005597114562988, "learning_rate": 1.2847413951776183e-05, "loss": 1.3574, "num_input_tokens_seen": 30749168, "step": 5090, "train_runtime": 5156.644, "train_tokens_per_second": 5963.019 }, { "epoch": 1.8724597701149426, "grad_norm": 1.0167715549468994, "learning_rate": 1.2810601877415792e-05, "loss": 1.3957, "num_input_tokens_seen": 30756192, "step": 5091, "train_runtime": 5157.7636, "train_tokens_per_second": 5963.087 }, { "epoch": 1.8728275862068966, "grad_norm": 1.0534465312957764, "learning_rate": 1.2773789803055403e-05, "loss": 1.6777, "num_input_tokens_seen": 30762048, "step": 5092, "train_runtime": 5158.7233, "train_tokens_per_second": 5963.113 }, { "epoch": 1.8731954022988506, "grad_norm": 1.136102557182312, "learning_rate": 1.2736977728695013e-05, "loss": 1.724, "num_input_tokens_seen": 30766560, "step": 5093, "train_runtime": 5159.5324, "train_tokens_per_second": 5963.052 }, { "epoch": 1.8735632183908046, "grad_norm": 0.9724223017692566, "learning_rate": 1.2700165654334622e-05, "loss": 1.3868, "num_input_tokens_seen": 30771536, "step": 5094, "train_runtime": 5160.3963, "train_tokens_per_second": 5963.018 }, { "epoch": 1.8739310344827587, "grad_norm": 1.020814299583435, "learning_rate": 1.2663353579974233e-05, "loss": 1.5598, "num_input_tokens_seen": 30777840, "step": 5095, "train_runtime": 5161.3988, "train_tokens_per_second": 5963.081 }, { "epoch": 1.8742988505747127, "grad_norm": 1.0722523927688599, "learning_rate": 1.2626541505613843e-05, "loss": 1.5814, "num_input_tokens_seen": 30783184, "step": 5096, "train_runtime": 5162.2725, "train_tokens_per_second": 5963.107 }, { "epoch": 1.8746666666666667, "grad_norm": 1.038047432899475, "learning_rate": 1.2589729431253452e-05, "loss": 1.4757, "num_input_tokens_seen": 30788912, "step": 5097, "train_runtime": 5163.2417, "train_tokens_per_second": 5963.097 }, { "epoch": 1.8750344827586207, "grad_norm": 1.0603339672088623, "learning_rate": 1.2552917356893063e-05, "loss": 1.5563, "num_input_tokens_seen": 30794864, "step": 5098, "train_runtime": 5164.2116, "train_tokens_per_second": 5963.13 }, { "epoch": 1.8754022988505747, "grad_norm": 0.9655351042747498, "learning_rate": 1.2516105282532672e-05, "loss": 1.4097, "num_input_tokens_seen": 30802736, "step": 5099, "train_runtime": 5165.4285, "train_tokens_per_second": 5963.249 }, { "epoch": 1.8757701149425288, "grad_norm": 0.9132452011108398, "learning_rate": 1.247929320817228e-05, "loss": 1.3708, "num_input_tokens_seen": 30811360, "step": 5100, "train_runtime": 5166.7524, "train_tokens_per_second": 5963.39 }, { "epoch": 1.8761379310344828, "grad_norm": 1.0230684280395508, "learning_rate": 1.2442481133811891e-05, "loss": 1.4089, "num_input_tokens_seen": 30818352, "step": 5101, "train_runtime": 5168.4608, "train_tokens_per_second": 5962.772 }, { "epoch": 1.8765057471264368, "grad_norm": 1.0087424516677856, "learning_rate": 1.2405669059451502e-05, "loss": 1.3587, "num_input_tokens_seen": 30824672, "step": 5102, "train_runtime": 5169.4818, "train_tokens_per_second": 5962.817 }, { "epoch": 1.8768735632183908, "grad_norm": 1.0149543285369873, "learning_rate": 1.236885698509111e-05, "loss": 1.5482, "num_input_tokens_seen": 30829328, "step": 5103, "train_runtime": 5170.3068, "train_tokens_per_second": 5962.766 }, { "epoch": 1.8772413793103448, "grad_norm": 0.9287912845611572, "learning_rate": 1.2332044910730721e-05, "loss": 1.3568, "num_input_tokens_seen": 30838224, "step": 5104, "train_runtime": 5171.6861, "train_tokens_per_second": 5962.896 }, { "epoch": 1.8776091954022989, "grad_norm": 1.0355212688446045, "learning_rate": 1.229523283637033e-05, "loss": 1.3621, "num_input_tokens_seen": 30845760, "step": 5105, "train_runtime": 5172.853, "train_tokens_per_second": 5963.007 }, { "epoch": 1.877977011494253, "grad_norm": 1.085738182067871, "learning_rate": 1.2258420762009939e-05, "loss": 1.7144, "num_input_tokens_seen": 30851264, "step": 5106, "train_runtime": 5173.7704, "train_tokens_per_second": 5963.014 }, { "epoch": 1.878344827586207, "grad_norm": 1.158015489578247, "learning_rate": 1.222160868764955e-05, "loss": 1.4586, "num_input_tokens_seen": 30858160, "step": 5107, "train_runtime": 5174.8826, "train_tokens_per_second": 5963.065 }, { "epoch": 1.878712643678161, "grad_norm": 1.06531822681427, "learning_rate": 1.218479661328916e-05, "loss": 1.5691, "num_input_tokens_seen": 30863520, "step": 5108, "train_runtime": 5175.7685, "train_tokens_per_second": 5963.08 }, { "epoch": 1.879080459770115, "grad_norm": 0.9724718332290649, "learning_rate": 1.2147984538928769e-05, "loss": 1.4844, "num_input_tokens_seen": 30870320, "step": 5109, "train_runtime": 5176.8622, "train_tokens_per_second": 5963.133 }, { "epoch": 1.879448275862069, "grad_norm": 1.0280042886734009, "learning_rate": 1.211117246456838e-05, "loss": 1.5261, "num_input_tokens_seen": 30875648, "step": 5110, "train_runtime": 5177.756, "train_tokens_per_second": 5963.133 }, { "epoch": 1.879816091954023, "grad_norm": 1.0828311443328857, "learning_rate": 1.2074360390207989e-05, "loss": 1.3906, "num_input_tokens_seen": 30880576, "step": 5111, "train_runtime": 5178.5765, "train_tokens_per_second": 5963.14 }, { "epoch": 1.880183908045977, "grad_norm": 1.0483033657073975, "learning_rate": 1.2037548315847597e-05, "loss": 1.7721, "num_input_tokens_seen": 30884864, "step": 5112, "train_runtime": 5179.3431, "train_tokens_per_second": 5963.085 }, { "epoch": 1.880551724137931, "grad_norm": 0.9692808389663696, "learning_rate": 1.2000736241487208e-05, "loss": 1.4897, "num_input_tokens_seen": 30890224, "step": 5113, "train_runtime": 5180.2285, "train_tokens_per_second": 5963.101 }, { "epoch": 1.880919540229885, "grad_norm": 1.1231056451797485, "learning_rate": 1.1963924167126819e-05, "loss": 1.7476, "num_input_tokens_seen": 30894416, "step": 5114, "train_runtime": 5180.9853, "train_tokens_per_second": 5963.039 }, { "epoch": 1.881287356321839, "grad_norm": 0.9407712817192078, "learning_rate": 1.1927112092766428e-05, "loss": 1.4063, "num_input_tokens_seen": 30902528, "step": 5115, "train_runtime": 5182.2622, "train_tokens_per_second": 5963.135 }, { "epoch": 1.881655172413793, "grad_norm": 1.0812958478927612, "learning_rate": 1.1890300018406038e-05, "loss": 1.5708, "num_input_tokens_seen": 30909312, "step": 5116, "train_runtime": 5183.342, "train_tokens_per_second": 5963.201 }, { "epoch": 1.8820229885057471, "grad_norm": 0.99626624584198, "learning_rate": 1.1853487944045647e-05, "loss": 1.4375, "num_input_tokens_seen": 30915328, "step": 5117, "train_runtime": 5184.3239, "train_tokens_per_second": 5963.232 }, { "epoch": 1.8823908045977011, "grad_norm": 0.9325799345970154, "learning_rate": 1.1816675869685258e-05, "loss": 1.5727, "num_input_tokens_seen": 30921824, "step": 5118, "train_runtime": 5185.3516, "train_tokens_per_second": 5963.303 }, { "epoch": 1.8827586206896552, "grad_norm": 1.0887229442596436, "learning_rate": 1.1779863795324868e-05, "loss": 1.6099, "num_input_tokens_seen": 30926448, "step": 5119, "train_runtime": 5186.14, "train_tokens_per_second": 5963.288 }, { "epoch": 1.8831264367816092, "grad_norm": 0.9841151237487793, "learning_rate": 1.1743051720964477e-05, "loss": 1.4023, "num_input_tokens_seen": 30934400, "step": 5120, "train_runtime": 5187.385, "train_tokens_per_second": 5963.39 }, { "epoch": 1.8834942528735632, "grad_norm": 1.0270477533340454, "learning_rate": 1.1706239646604086e-05, "loss": 1.6605, "num_input_tokens_seen": 30940272, "step": 5121, "train_runtime": 5188.3421, "train_tokens_per_second": 5963.422 }, { "epoch": 1.8838620689655172, "grad_norm": 0.9291617274284363, "learning_rate": 1.1669427572243697e-05, "loss": 1.6315, "num_input_tokens_seen": 30947440, "step": 5122, "train_runtime": 5189.443, "train_tokens_per_second": 5963.538 }, { "epoch": 1.8842298850574712, "grad_norm": 1.0358939170837402, "learning_rate": 1.1632615497883305e-05, "loss": 1.5352, "num_input_tokens_seen": 30953536, "step": 5123, "train_runtime": 5190.4202, "train_tokens_per_second": 5963.59 }, { "epoch": 1.8845977011494253, "grad_norm": 1.0341215133666992, "learning_rate": 1.1595803423522916e-05, "loss": 1.4522, "num_input_tokens_seen": 30959968, "step": 5124, "train_runtime": 5191.4722, "train_tokens_per_second": 5963.62 }, { "epoch": 1.8849655172413793, "grad_norm": 1.081660509109497, "learning_rate": 1.1558991349162527e-05, "loss": 1.4329, "num_input_tokens_seen": 30965424, "step": 5125, "train_runtime": 5192.3878, "train_tokens_per_second": 5963.619 }, { "epoch": 1.8853333333333333, "grad_norm": 0.9941276907920837, "learning_rate": 1.1522179274802136e-05, "loss": 1.5152, "num_input_tokens_seen": 30969504, "step": 5126, "train_runtime": 5193.1151, "train_tokens_per_second": 5963.57 }, { "epoch": 1.8857011494252873, "grad_norm": 0.9303632378578186, "learning_rate": 1.1485367200441744e-05, "loss": 1.3556, "num_input_tokens_seen": 30977888, "step": 5127, "train_runtime": 5194.4158, "train_tokens_per_second": 5963.691 }, { "epoch": 1.8860689655172413, "grad_norm": 1.0067976713180542, "learning_rate": 1.1448555126081355e-05, "loss": 1.3019, "num_input_tokens_seen": 30983568, "step": 5128, "train_runtime": 5195.3456, "train_tokens_per_second": 5963.716 }, { "epoch": 1.8864367816091954, "grad_norm": 1.1567789316177368, "learning_rate": 1.1411743051720966e-05, "loss": 1.7082, "num_input_tokens_seen": 30989088, "step": 5129, "train_runtime": 5196.2779, "train_tokens_per_second": 5963.709 }, { "epoch": 1.8868045977011494, "grad_norm": 1.0901026725769043, "learning_rate": 1.1374930977360574e-05, "loss": 1.7373, "num_input_tokens_seen": 30993632, "step": 5130, "train_runtime": 5197.0676, "train_tokens_per_second": 5963.677 }, { "epoch": 1.8871724137931034, "grad_norm": 1.068395972251892, "learning_rate": 1.1338118903000185e-05, "loss": 1.4796, "num_input_tokens_seen": 31000272, "step": 5131, "train_runtime": 5198.7044, "train_tokens_per_second": 5963.076 }, { "epoch": 1.8875402298850574, "grad_norm": 0.9585198760032654, "learning_rate": 1.1301306828639794e-05, "loss": 1.4375, "num_input_tokens_seen": 31010048, "step": 5132, "train_runtime": 5200.1892, "train_tokens_per_second": 5963.254 }, { "epoch": 1.8879080459770115, "grad_norm": 0.9547199606895447, "learning_rate": 1.1264494754279405e-05, "loss": 1.3827, "num_input_tokens_seen": 31015504, "step": 5133, "train_runtime": 5201.1071, "train_tokens_per_second": 5963.25 }, { "epoch": 1.8882758620689655, "grad_norm": 1.1191118955612183, "learning_rate": 1.1227682679919015e-05, "loss": 1.562, "num_input_tokens_seen": 31021152, "step": 5134, "train_runtime": 5202.0602, "train_tokens_per_second": 5963.244 }, { "epoch": 1.8886436781609195, "grad_norm": 0.9584413766860962, "learning_rate": 1.1190870605558624e-05, "loss": 1.324, "num_input_tokens_seen": 31025824, "step": 5135, "train_runtime": 5202.8468, "train_tokens_per_second": 5963.24 }, { "epoch": 1.8890114942528735, "grad_norm": 0.9913816452026367, "learning_rate": 1.1154058531198233e-05, "loss": 1.3563, "num_input_tokens_seen": 31030080, "step": 5136, "train_runtime": 5203.5844, "train_tokens_per_second": 5963.213 }, { "epoch": 1.8893793103448275, "grad_norm": 1.0783475637435913, "learning_rate": 1.1117246456837843e-05, "loss": 1.5492, "num_input_tokens_seen": 31035488, "step": 5137, "train_runtime": 5204.4588, "train_tokens_per_second": 5963.25 }, { "epoch": 1.8897471264367816, "grad_norm": 1.1071451902389526, "learning_rate": 1.1080434382477452e-05, "loss": 1.6794, "num_input_tokens_seen": 31040272, "step": 5138, "train_runtime": 5205.2863, "train_tokens_per_second": 5963.221 }, { "epoch": 1.8901149425287356, "grad_norm": 1.0222585201263428, "learning_rate": 1.1043622308117063e-05, "loss": 1.6259, "num_input_tokens_seen": 31046256, "step": 5139, "train_runtime": 5206.258, "train_tokens_per_second": 5963.257 }, { "epoch": 1.8904827586206898, "grad_norm": 1.0303621292114258, "learning_rate": 1.1006810233756674e-05, "loss": 1.4607, "num_input_tokens_seen": 31052672, "step": 5140, "train_runtime": 5207.3154, "train_tokens_per_second": 5963.278 }, { "epoch": 1.8908505747126436, "grad_norm": 1.0179482698440552, "learning_rate": 1.0969998159396282e-05, "loss": 1.5509, "num_input_tokens_seen": 31058288, "step": 5141, "train_runtime": 5208.2364, "train_tokens_per_second": 5963.302 }, { "epoch": 1.8912183908045979, "grad_norm": 1.0750333070755005, "learning_rate": 1.0933186085035891e-05, "loss": 1.4189, "num_input_tokens_seen": 31064480, "step": 5142, "train_runtime": 5209.2428, "train_tokens_per_second": 5963.339 }, { "epoch": 1.8915862068965517, "grad_norm": 1.103312611579895, "learning_rate": 1.0896374010675502e-05, "loss": 1.5595, "num_input_tokens_seen": 31068832, "step": 5143, "train_runtime": 5210.0232, "train_tokens_per_second": 5963.281 }, { "epoch": 1.891954022988506, "grad_norm": 0.8550114631652832, "learning_rate": 1.085956193631511e-05, "loss": 1.2791, "num_input_tokens_seen": 31075232, "step": 5144, "train_runtime": 5211.0595, "train_tokens_per_second": 5963.323 }, { "epoch": 1.8923218390804597, "grad_norm": 1.001771092414856, "learning_rate": 1.0822749861954721e-05, "loss": 1.4215, "num_input_tokens_seen": 31083056, "step": 5145, "train_runtime": 5212.265, "train_tokens_per_second": 5963.445 }, { "epoch": 1.892689655172414, "grad_norm": 1.0242040157318115, "learning_rate": 1.0785937787594332e-05, "loss": 1.6836, "num_input_tokens_seen": 31089024, "step": 5146, "train_runtime": 5213.2311, "train_tokens_per_second": 5963.485 }, { "epoch": 1.8930574712643677, "grad_norm": 1.105438232421875, "learning_rate": 1.0749125713233941e-05, "loss": 1.5183, "num_input_tokens_seen": 31095232, "step": 5147, "train_runtime": 5214.2046, "train_tokens_per_second": 5963.562 }, { "epoch": 1.893425287356322, "grad_norm": 1.0332019329071045, "learning_rate": 1.0712313638873551e-05, "loss": 1.6151, "num_input_tokens_seen": 31100480, "step": 5148, "train_runtime": 5215.0946, "train_tokens_per_second": 5963.551 }, { "epoch": 1.8937931034482758, "grad_norm": 1.1260578632354736, "learning_rate": 1.0675501564513162e-05, "loss": 1.4997, "num_input_tokens_seen": 31106176, "step": 5149, "train_runtime": 5216.0286, "train_tokens_per_second": 5963.575 }, { "epoch": 1.89416091954023, "grad_norm": 1.1261924505233765, "learning_rate": 1.063868949015277e-05, "loss": 1.594, "num_input_tokens_seen": 31110480, "step": 5150, "train_runtime": 5216.7977, "train_tokens_per_second": 5963.521 }, { "epoch": 1.8945287356321838, "grad_norm": 0.9641284942626953, "learning_rate": 1.060187741579238e-05, "loss": 1.4913, "num_input_tokens_seen": 31115440, "step": 5151, "train_runtime": 5217.6397, "train_tokens_per_second": 5963.509 }, { "epoch": 1.894896551724138, "grad_norm": 0.9839797616004944, "learning_rate": 1.056506534143199e-05, "loss": 1.556, "num_input_tokens_seen": 31121200, "step": 5152, "train_runtime": 5218.5865, "train_tokens_per_second": 5963.531 }, { "epoch": 1.8952643678160919, "grad_norm": 0.9305192232131958, "learning_rate": 1.05282532670716e-05, "loss": 1.2631, "num_input_tokens_seen": 31126784, "step": 5153, "train_runtime": 5219.516, "train_tokens_per_second": 5963.538 }, { "epoch": 1.895632183908046, "grad_norm": 0.9300264716148376, "learning_rate": 1.049144119271121e-05, "loss": 1.5224, "num_input_tokens_seen": 31131792, "step": 5154, "train_runtime": 5220.3817, "train_tokens_per_second": 5963.509 }, { "epoch": 1.896, "grad_norm": 0.9646492004394531, "learning_rate": 1.045462911835082e-05, "loss": 1.546, "num_input_tokens_seen": 31137872, "step": 5155, "train_runtime": 5221.3764, "train_tokens_per_second": 5963.537 }, { "epoch": 1.8963678160919542, "grad_norm": 0.958551824092865, "learning_rate": 1.041781704399043e-05, "loss": 1.3527, "num_input_tokens_seen": 31144128, "step": 5156, "train_runtime": 5222.3764, "train_tokens_per_second": 5963.593 }, { "epoch": 1.896735632183908, "grad_norm": 1.0264830589294434, "learning_rate": 1.0381004969630038e-05, "loss": 1.6428, "num_input_tokens_seen": 31149536, "step": 5157, "train_runtime": 5223.2814, "train_tokens_per_second": 5963.595 }, { "epoch": 1.8971034482758622, "grad_norm": 0.9699311852455139, "learning_rate": 1.0344192895269649e-05, "loss": 1.4691, "num_input_tokens_seen": 31156208, "step": 5158, "train_runtime": 5224.3513, "train_tokens_per_second": 5963.651 }, { "epoch": 1.897471264367816, "grad_norm": 0.9945620894432068, "learning_rate": 1.0307380820909258e-05, "loss": 1.5895, "num_input_tokens_seen": 31161248, "step": 5159, "train_runtime": 5225.1883, "train_tokens_per_second": 5963.66 }, { "epoch": 1.8978390804597702, "grad_norm": 0.953173041343689, "learning_rate": 1.0270568746548868e-05, "loss": 1.5288, "num_input_tokens_seen": 31166720, "step": 5160, "train_runtime": 5226.1059, "train_tokens_per_second": 5963.66 }, { "epoch": 1.898206896551724, "grad_norm": 0.8694062829017639, "learning_rate": 1.0233756672188479e-05, "loss": 1.4781, "num_input_tokens_seen": 31173360, "step": 5161, "train_runtime": 5227.6412, "train_tokens_per_second": 5963.179 }, { "epoch": 1.8985747126436783, "grad_norm": 1.0044862031936646, "learning_rate": 1.0196944597828088e-05, "loss": 1.4316, "num_input_tokens_seen": 31179296, "step": 5162, "train_runtime": 5228.5806, "train_tokens_per_second": 5963.243 }, { "epoch": 1.898942528735632, "grad_norm": 1.098825454711914, "learning_rate": 1.0160132523467698e-05, "loss": 1.4944, "num_input_tokens_seen": 31184288, "step": 5163, "train_runtime": 5229.4351, "train_tokens_per_second": 5963.223 }, { "epoch": 1.8993103448275863, "grad_norm": 1.1091935634613037, "learning_rate": 1.0123320449107309e-05, "loss": 1.4743, "num_input_tokens_seen": 31189440, "step": 5164, "train_runtime": 5230.2784, "train_tokens_per_second": 5963.247 }, { "epoch": 1.8996781609195401, "grad_norm": 0.9583799242973328, "learning_rate": 1.0086508374746916e-05, "loss": 1.355, "num_input_tokens_seen": 31194624, "step": 5165, "train_runtime": 5231.1459, "train_tokens_per_second": 5963.249 }, { "epoch": 1.9000459770114944, "grad_norm": 1.2292479276657104, "learning_rate": 1.0049696300386527e-05, "loss": 1.6079, "num_input_tokens_seen": 31202016, "step": 5166, "train_runtime": 5232.3001, "train_tokens_per_second": 5963.346 }, { "epoch": 1.9004137931034482, "grad_norm": 1.0354876518249512, "learning_rate": 1.0012884226026137e-05, "loss": 1.4838, "num_input_tokens_seen": 31207936, "step": 5167, "train_runtime": 5233.2551, "train_tokens_per_second": 5963.389 }, { "epoch": 1.9007816091954024, "grad_norm": 0.9916900396347046, "learning_rate": 9.976072151665746e-06, "loss": 1.2896, "num_input_tokens_seen": 31218368, "step": 5168, "train_runtime": 5234.8604, "train_tokens_per_second": 5963.553 }, { "epoch": 1.9011494252873562, "grad_norm": 1.0767730474472046, "learning_rate": 9.939260077305357e-06, "loss": 1.2717, "num_input_tokens_seen": 31226064, "step": 5169, "train_runtime": 5236.0753, "train_tokens_per_second": 5963.639 }, { "epoch": 1.9015172413793104, "grad_norm": 0.9991474747657776, "learning_rate": 9.902448002944967e-06, "loss": 1.3001, "num_input_tokens_seen": 31231104, "step": 5170, "train_runtime": 5236.9048, "train_tokens_per_second": 5963.657 }, { "epoch": 1.9018850574712642, "grad_norm": 1.0238171815872192, "learning_rate": 9.865635928584576e-06, "loss": 1.6231, "num_input_tokens_seen": 31235952, "step": 5171, "train_runtime": 5237.7384, "train_tokens_per_second": 5963.633 }, { "epoch": 1.9022528735632185, "grad_norm": 1.0991358757019043, "learning_rate": 9.828823854224185e-06, "loss": 1.7272, "num_input_tokens_seen": 31240192, "step": 5172, "train_runtime": 5238.4881, "train_tokens_per_second": 5963.589 }, { "epoch": 1.9026206896551723, "grad_norm": 0.9541977643966675, "learning_rate": 9.792011779863796e-06, "loss": 1.61, "num_input_tokens_seen": 31245392, "step": 5173, "train_runtime": 5239.3567, "train_tokens_per_second": 5963.593 }, { "epoch": 1.9029885057471265, "grad_norm": 1.1026161909103394, "learning_rate": 9.755199705503405e-06, "loss": 1.3701, "num_input_tokens_seen": 31252752, "step": 5174, "train_runtime": 5240.54, "train_tokens_per_second": 5963.651 }, { "epoch": 1.9033563218390803, "grad_norm": 1.078701376914978, "learning_rate": 9.718387631143015e-06, "loss": 1.4136, "num_input_tokens_seen": 31259136, "step": 5175, "train_runtime": 5241.5806, "train_tokens_per_second": 5963.685 }, { "epoch": 1.9037241379310346, "grad_norm": 0.9863090515136719, "learning_rate": 9.681575556782626e-06, "loss": 1.4909, "num_input_tokens_seen": 31264528, "step": 5176, "train_runtime": 5242.4533, "train_tokens_per_second": 5963.721 }, { "epoch": 1.9040919540229884, "grad_norm": 1.059182047843933, "learning_rate": 9.644763482422235e-06, "loss": 1.6034, "num_input_tokens_seen": 31271536, "step": 5177, "train_runtime": 5243.5402, "train_tokens_per_second": 5963.821 }, { "epoch": 1.9044597701149426, "grad_norm": 0.9668793678283691, "learning_rate": 9.607951408061845e-06, "loss": 1.498, "num_input_tokens_seen": 31277888, "step": 5178, "train_runtime": 5244.5722, "train_tokens_per_second": 5963.859 }, { "epoch": 1.9048275862068964, "grad_norm": 0.8954527378082275, "learning_rate": 9.571139333701456e-06, "loss": 1.2766, "num_input_tokens_seen": 31283296, "step": 5179, "train_runtime": 5245.4754, "train_tokens_per_second": 5963.863 }, { "epoch": 1.9051954022988506, "grad_norm": 0.9767663478851318, "learning_rate": 9.534327259341063e-06, "loss": 1.4348, "num_input_tokens_seen": 31290528, "step": 5180, "train_runtime": 5246.6416, "train_tokens_per_second": 5963.916 }, { "epoch": 1.9055632183908044, "grad_norm": 0.9650322794914246, "learning_rate": 9.497515184980674e-06, "loss": 1.4885, "num_input_tokens_seen": 31296688, "step": 5181, "train_runtime": 5247.6372, "train_tokens_per_second": 5963.958 }, { "epoch": 1.9059310344827587, "grad_norm": 1.0090296268463135, "learning_rate": 9.460703110620284e-06, "loss": 1.3792, "num_input_tokens_seen": 31302496, "step": 5182, "train_runtime": 5248.6318, "train_tokens_per_second": 5963.934 }, { "epoch": 1.9062988505747125, "grad_norm": 0.9824272990226746, "learning_rate": 9.423891036259893e-06, "loss": 1.5411, "num_input_tokens_seen": 31306976, "step": 5183, "train_runtime": 5249.3936, "train_tokens_per_second": 5963.922 }, { "epoch": 1.9066666666666667, "grad_norm": 0.999448299407959, "learning_rate": 9.387078961899504e-06, "loss": 1.6293, "num_input_tokens_seen": 31312288, "step": 5184, "train_runtime": 5250.2777, "train_tokens_per_second": 5963.93 }, { "epoch": 1.9070344827586205, "grad_norm": 0.9954407215118408, "learning_rate": 9.350266887539114e-06, "loss": 1.3755, "num_input_tokens_seen": 31317840, "step": 5185, "train_runtime": 5251.1845, "train_tokens_per_second": 5963.957 }, { "epoch": 1.9074022988505748, "grad_norm": 1.073150634765625, "learning_rate": 9.313454813178723e-06, "loss": 1.6224, "num_input_tokens_seen": 31322272, "step": 5186, "train_runtime": 5251.9603, "train_tokens_per_second": 5963.92 }, { "epoch": 1.9077701149425286, "grad_norm": 1.0602670907974243, "learning_rate": 9.276642738818332e-06, "loss": 1.4079, "num_input_tokens_seen": 31327888, "step": 5187, "train_runtime": 5252.9206, "train_tokens_per_second": 5963.899 }, { "epoch": 1.9081379310344828, "grad_norm": 1.0609350204467773, "learning_rate": 9.239830664457943e-06, "loss": 1.475, "num_input_tokens_seen": 31332544, "step": 5188, "train_runtime": 5253.7163, "train_tokens_per_second": 5963.882 }, { "epoch": 1.9085057471264368, "grad_norm": 0.9889388084411621, "learning_rate": 9.203018590097552e-06, "loss": 1.367, "num_input_tokens_seen": 31337504, "step": 5189, "train_runtime": 5254.5457, "train_tokens_per_second": 5963.885 }, { "epoch": 1.9088735632183909, "grad_norm": 0.9926358461380005, "learning_rate": 9.166206515737162e-06, "loss": 1.3965, "num_input_tokens_seen": 31345360, "step": 5190, "train_runtime": 5255.7574, "train_tokens_per_second": 5964.004 }, { "epoch": 1.9092413793103449, "grad_norm": 1.0332140922546387, "learning_rate": 9.129394441376773e-06, "loss": 1.4543, "num_input_tokens_seen": 31350352, "step": 5191, "train_runtime": 5257.0693, "train_tokens_per_second": 5963.466 }, { "epoch": 1.909609195402299, "grad_norm": 0.9564376473426819, "learning_rate": 9.092582367016382e-06, "loss": 1.6294, "num_input_tokens_seen": 31356528, "step": 5192, "train_runtime": 5258.0999, "train_tokens_per_second": 5963.471 }, { "epoch": 1.909977011494253, "grad_norm": 1.043769121170044, "learning_rate": 9.055770292655992e-06, "loss": 1.4124, "num_input_tokens_seen": 31364288, "step": 5193, "train_runtime": 5259.3107, "train_tokens_per_second": 5963.574 }, { "epoch": 1.910344827586207, "grad_norm": 1.0887336730957031, "learning_rate": 9.018958218295601e-06, "loss": 1.6384, "num_input_tokens_seen": 31370832, "step": 5194, "train_runtime": 5260.3615, "train_tokens_per_second": 5963.627 }, { "epoch": 1.910712643678161, "grad_norm": 0.9897884726524353, "learning_rate": 8.98214614393521e-06, "loss": 1.6019, "num_input_tokens_seen": 31375632, "step": 5195, "train_runtime": 5261.1987, "train_tokens_per_second": 5963.59 }, { "epoch": 1.911080459770115, "grad_norm": 1.119964361190796, "learning_rate": 8.94533406957482e-06, "loss": 1.4412, "num_input_tokens_seen": 31380384, "step": 5196, "train_runtime": 5262.0319, "train_tokens_per_second": 5963.549 }, { "epoch": 1.911448275862069, "grad_norm": 1.0215885639190674, "learning_rate": 8.908521995214431e-06, "loss": 1.3712, "num_input_tokens_seen": 31387552, "step": 5197, "train_runtime": 5263.1631, "train_tokens_per_second": 5963.629 }, { "epoch": 1.911816091954023, "grad_norm": 1.0042119026184082, "learning_rate": 8.87170992085404e-06, "loss": 1.546, "num_input_tokens_seen": 31393088, "step": 5198, "train_runtime": 5264.082, "train_tokens_per_second": 5963.64 }, { "epoch": 1.912183908045977, "grad_norm": 0.9443457126617432, "learning_rate": 8.83489784649365e-06, "loss": 1.6105, "num_input_tokens_seen": 31400144, "step": 5199, "train_runtime": 5265.2117, "train_tokens_per_second": 5963.7 }, { "epoch": 1.912551724137931, "grad_norm": 0.7088549733161926, "learning_rate": 8.798085772133261e-06, "loss": 1.0782, "num_input_tokens_seen": 31416256, "step": 5200, "train_runtime": 5267.5304, "train_tokens_per_second": 5964.134 }, { "epoch": 1.912919540229885, "grad_norm": 0.9911025762557983, "learning_rate": 8.76127369777287e-06, "loss": 1.4901, "num_input_tokens_seen": 31422016, "step": 5201, "train_runtime": 5268.4789, "train_tokens_per_second": 5964.153 }, { "epoch": 1.913287356321839, "grad_norm": 0.9640730619430542, "learning_rate": 8.724461623412479e-06, "loss": 1.4643, "num_input_tokens_seen": 31427824, "step": 5202, "train_runtime": 5269.4289, "train_tokens_per_second": 5964.18 }, { "epoch": 1.9136551724137931, "grad_norm": 0.970166802406311, "learning_rate": 8.68764954905209e-06, "loss": 1.4615, "num_input_tokens_seen": 31433904, "step": 5203, "train_runtime": 5270.4451, "train_tokens_per_second": 5964.184 }, { "epoch": 1.9140229885057471, "grad_norm": 1.080848217010498, "learning_rate": 8.650837474691699e-06, "loss": 1.5406, "num_input_tokens_seen": 31439952, "step": 5204, "train_runtime": 5271.4238, "train_tokens_per_second": 5964.224 }, { "epoch": 1.9143908045977012, "grad_norm": 0.9751112461090088, "learning_rate": 8.61402540033131e-06, "loss": 1.5039, "num_input_tokens_seen": 31446912, "step": 5205, "train_runtime": 5272.5104, "train_tokens_per_second": 5964.315 }, { "epoch": 1.9147586206896552, "grad_norm": 1.0692551136016846, "learning_rate": 8.57721332597092e-06, "loss": 1.6031, "num_input_tokens_seen": 31451504, "step": 5206, "train_runtime": 5273.2933, "train_tokens_per_second": 5964.3 }, { "epoch": 1.9151264367816092, "grad_norm": 1.0313695669174194, "learning_rate": 8.540401251610529e-06, "loss": 1.5916, "num_input_tokens_seen": 31456528, "step": 5207, "train_runtime": 5274.1527, "train_tokens_per_second": 5964.281 }, { "epoch": 1.9154942528735632, "grad_norm": 1.0278955698013306, "learning_rate": 8.50358917725014e-06, "loss": 1.4985, "num_input_tokens_seen": 31461456, "step": 5208, "train_runtime": 5275.007, "train_tokens_per_second": 5964.249 }, { "epoch": 1.9158620689655173, "grad_norm": 0.9766169190406799, "learning_rate": 8.466777102889748e-06, "loss": 1.4472, "num_input_tokens_seen": 31466720, "step": 5209, "train_runtime": 5275.8893, "train_tokens_per_second": 5964.249 }, { "epoch": 1.9162298850574713, "grad_norm": 1.1143441200256348, "learning_rate": 8.429965028529357e-06, "loss": 1.537, "num_input_tokens_seen": 31471712, "step": 5210, "train_runtime": 5276.741, "train_tokens_per_second": 5964.233 }, { "epoch": 1.9165977011494253, "grad_norm": 0.9699863791465759, "learning_rate": 8.393152954168968e-06, "loss": 1.5436, "num_input_tokens_seen": 31477680, "step": 5211, "train_runtime": 5277.7127, "train_tokens_per_second": 5964.266 }, { "epoch": 1.9169655172413793, "grad_norm": 1.1384267807006836, "learning_rate": 8.356340879808578e-06, "loss": 1.438, "num_input_tokens_seen": 31487840, "step": 5212, "train_runtime": 5279.2373, "train_tokens_per_second": 5964.468 }, { "epoch": 1.9173333333333333, "grad_norm": 1.039361596107483, "learning_rate": 8.319528805448187e-06, "loss": 1.5273, "num_input_tokens_seen": 31492272, "step": 5213, "train_runtime": 5280.0139, "train_tokens_per_second": 5964.43 }, { "epoch": 1.9177011494252874, "grad_norm": 1.2111543416976929, "learning_rate": 8.282716731087798e-06, "loss": 1.6289, "num_input_tokens_seen": 31497696, "step": 5214, "train_runtime": 5280.9006, "train_tokens_per_second": 5964.455 }, { "epoch": 1.9180689655172414, "grad_norm": 1.0253822803497314, "learning_rate": 8.245904656727407e-06, "loss": 1.5035, "num_input_tokens_seen": 31502496, "step": 5215, "train_runtime": 5281.7188, "train_tokens_per_second": 5964.44 }, { "epoch": 1.9184367816091954, "grad_norm": 1.0145090818405151, "learning_rate": 8.209092582367017e-06, "loss": 1.4359, "num_input_tokens_seen": 31508688, "step": 5216, "train_runtime": 5282.7161, "train_tokens_per_second": 5964.486 }, { "epoch": 1.9188045977011494, "grad_norm": 1.071014404296875, "learning_rate": 8.172280508006628e-06, "loss": 1.5631, "num_input_tokens_seen": 31513632, "step": 5217, "train_runtime": 5283.5637, "train_tokens_per_second": 5964.465 }, { "epoch": 1.9191724137931034, "grad_norm": 1.0823394060134888, "learning_rate": 8.135468433646237e-06, "loss": 1.334, "num_input_tokens_seen": 31519808, "step": 5218, "train_runtime": 5284.5715, "train_tokens_per_second": 5964.496 }, { "epoch": 1.9195402298850575, "grad_norm": 0.9998838901519775, "learning_rate": 8.098656359285846e-06, "loss": 1.4185, "num_input_tokens_seen": 31526208, "step": 5219, "train_runtime": 5285.6075, "train_tokens_per_second": 5964.538 }, { "epoch": 1.9199080459770115, "grad_norm": 1.0125830173492432, "learning_rate": 8.061844284925456e-06, "loss": 1.2764, "num_input_tokens_seen": 31535088, "step": 5220, "train_runtime": 5286.9402, "train_tokens_per_second": 5964.714 }, { "epoch": 1.9202758620689655, "grad_norm": 1.0879446268081665, "learning_rate": 8.025032210565065e-06, "loss": 1.2968, "num_input_tokens_seen": 31542240, "step": 5221, "train_runtime": 5288.5831, "train_tokens_per_second": 5964.214 }, { "epoch": 1.9206436781609195, "grad_norm": 1.0482430458068848, "learning_rate": 7.988220136204676e-06, "loss": 1.5569, "num_input_tokens_seen": 31546688, "step": 5222, "train_runtime": 5289.3382, "train_tokens_per_second": 5964.203 }, { "epoch": 1.9210114942528735, "grad_norm": 1.0618278980255127, "learning_rate": 7.951408061844286e-06, "loss": 1.649, "num_input_tokens_seen": 31551264, "step": 5223, "train_runtime": 5290.1443, "train_tokens_per_second": 5964.159 }, { "epoch": 1.9213793103448276, "grad_norm": 0.9304054379463196, "learning_rate": 7.914595987483895e-06, "loss": 1.364, "num_input_tokens_seen": 31557488, "step": 5224, "train_runtime": 5291.1563, "train_tokens_per_second": 5964.195 }, { "epoch": 1.9217471264367816, "grad_norm": 1.078218936920166, "learning_rate": 7.877783913123504e-06, "loss": 1.5614, "num_input_tokens_seen": 31562144, "step": 5225, "train_runtime": 5291.9591, "train_tokens_per_second": 5964.17 }, { "epoch": 1.9221149425287356, "grad_norm": 1.0731745958328247, "learning_rate": 7.840971838763115e-06, "loss": 1.4664, "num_input_tokens_seen": 31566320, "step": 5226, "train_runtime": 5292.6876, "train_tokens_per_second": 5964.138 }, { "epoch": 1.9224827586206896, "grad_norm": 1.0793852806091309, "learning_rate": 7.804159764402723e-06, "loss": 1.7021, "num_input_tokens_seen": 31571936, "step": 5227, "train_runtime": 5293.6037, "train_tokens_per_second": 5964.167 }, { "epoch": 1.9228505747126436, "grad_norm": 1.0043725967407227, "learning_rate": 7.767347690042334e-06, "loss": 1.6227, "num_input_tokens_seen": 31577456, "step": 5228, "train_runtime": 5294.53, "train_tokens_per_second": 5964.166 }, { "epoch": 1.9232183908045977, "grad_norm": 0.981519341468811, "learning_rate": 7.730535615681945e-06, "loss": 1.5114, "num_input_tokens_seen": 31582368, "step": 5229, "train_runtime": 5295.3563, "train_tokens_per_second": 5964.163 }, { "epoch": 1.9235862068965517, "grad_norm": 1.0342694520950317, "learning_rate": 7.693723541321553e-06, "loss": 1.3978, "num_input_tokens_seen": 31590080, "step": 5230, "train_runtime": 5296.5787, "train_tokens_per_second": 5964.242 }, { "epoch": 1.9239540229885057, "grad_norm": 1.0602362155914307, "learning_rate": 7.656911466961164e-06, "loss": 1.349, "num_input_tokens_seen": 31594880, "step": 5231, "train_runtime": 5297.4254, "train_tokens_per_second": 5964.195 }, { "epoch": 1.9243218390804597, "grad_norm": 1.0674331188201904, "learning_rate": 7.620099392600774e-06, "loss": 1.5256, "num_input_tokens_seen": 31599808, "step": 5232, "train_runtime": 5298.2491, "train_tokens_per_second": 5964.198 }, { "epoch": 1.9246896551724137, "grad_norm": 1.0152877569198608, "learning_rate": 7.583287318240383e-06, "loss": 1.2964, "num_input_tokens_seen": 31604352, "step": 5233, "train_runtime": 5299.0243, "train_tokens_per_second": 5964.183 }, { "epoch": 1.9250574712643678, "grad_norm": 0.9840177893638611, "learning_rate": 7.5464752438799924e-06, "loss": 1.3441, "num_input_tokens_seen": 31610992, "step": 5234, "train_runtime": 5300.1224, "train_tokens_per_second": 5964.2 }, { "epoch": 1.9254252873563218, "grad_norm": 1.013264775276184, "learning_rate": 7.509663169519603e-06, "loss": 1.4727, "num_input_tokens_seen": 31615696, "step": 5235, "train_runtime": 5300.9426, "train_tokens_per_second": 5964.165 }, { "epoch": 1.9257931034482758, "grad_norm": 1.1546998023986816, "learning_rate": 7.472851095159213e-06, "loss": 1.64, "num_input_tokens_seen": 31621616, "step": 5236, "train_runtime": 5301.9207, "train_tokens_per_second": 5964.181 }, { "epoch": 1.9261609195402298, "grad_norm": 0.9697108268737793, "learning_rate": 7.4360390207988225e-06, "loss": 1.4139, "num_input_tokens_seen": 31628096, "step": 5237, "train_runtime": 5302.9564, "train_tokens_per_second": 5964.238 }, { "epoch": 1.9265287356321839, "grad_norm": 1.0260202884674072, "learning_rate": 7.399226946438432e-06, "loss": 1.6004, "num_input_tokens_seen": 31634080, "step": 5238, "train_runtime": 5303.9133, "train_tokens_per_second": 5964.291 }, { "epoch": 1.926896551724138, "grad_norm": 0.9902703166007996, "learning_rate": 7.362414872078043e-06, "loss": 1.49, "num_input_tokens_seen": 31639872, "step": 5239, "train_runtime": 5304.8456, "train_tokens_per_second": 5964.334 }, { "epoch": 1.927264367816092, "grad_norm": 0.937769889831543, "learning_rate": 7.325602797717651e-06, "loss": 1.4061, "num_input_tokens_seen": 31648176, "step": 5240, "train_runtime": 5306.1174, "train_tokens_per_second": 5964.47 }, { "epoch": 1.9276321839080461, "grad_norm": 1.0571717023849487, "learning_rate": 7.2887907233572615e-06, "loss": 1.7377, "num_input_tokens_seen": 31653968, "step": 5241, "train_runtime": 5307.0924, "train_tokens_per_second": 5964.465 }, { "epoch": 1.928, "grad_norm": 1.071352481842041, "learning_rate": 7.251978648996871e-06, "loss": 1.6941, "num_input_tokens_seen": 31660288, "step": 5242, "train_runtime": 5308.1041, "train_tokens_per_second": 5964.519 }, { "epoch": 1.9283678160919542, "grad_norm": 1.121132493019104, "learning_rate": 7.215166574636481e-06, "loss": 1.5137, "num_input_tokens_seen": 31664544, "step": 5243, "train_runtime": 5308.8404, "train_tokens_per_second": 5964.494 }, { "epoch": 1.928735632183908, "grad_norm": 0.9838693141937256, "learning_rate": 7.178354500276091e-06, "loss": 1.7087, "num_input_tokens_seen": 31670320, "step": 5244, "train_runtime": 5309.7679, "train_tokens_per_second": 5964.539 }, { "epoch": 1.9291034482758622, "grad_norm": 0.9813634753227234, "learning_rate": 7.141542425915701e-06, "loss": 1.397, "num_input_tokens_seen": 31675680, "step": 5245, "train_runtime": 5310.6475, "train_tokens_per_second": 5964.561 }, { "epoch": 1.929471264367816, "grad_norm": 1.0224682092666626, "learning_rate": 7.104730351555311e-06, "loss": 1.5231, "num_input_tokens_seen": 31683088, "step": 5246, "train_runtime": 5311.8091, "train_tokens_per_second": 5964.651 }, { "epoch": 1.9298390804597703, "grad_norm": 0.9386256337165833, "learning_rate": 7.067918277194921e-06, "loss": 1.3935, "num_input_tokens_seen": 31688896, "step": 5247, "train_runtime": 5312.7325, "train_tokens_per_second": 5964.708 }, { "epoch": 1.930206896551724, "grad_norm": 0.9824444651603699, "learning_rate": 7.03110620283453e-06, "loss": 1.3528, "num_input_tokens_seen": 31695344, "step": 5248, "train_runtime": 5313.7785, "train_tokens_per_second": 5964.747 }, { "epoch": 1.9305747126436783, "grad_norm": 0.9770721793174744, "learning_rate": 6.994294128474139e-06, "loss": 1.473, "num_input_tokens_seen": 31701120, "step": 5249, "train_runtime": 5314.7302, "train_tokens_per_second": 5964.766 }, { "epoch": 1.930942528735632, "grad_norm": 1.138535976409912, "learning_rate": 6.957482054113749e-06, "loss": 1.4634, "num_input_tokens_seen": 31706480, "step": 5250, "train_runtime": 5315.6273, "train_tokens_per_second": 5964.767 }, { "epoch": 1.9313103448275863, "grad_norm": 1.027065396308899, "learning_rate": 6.92066997975336e-06, "loss": 1.5138, "num_input_tokens_seen": 31712736, "step": 5251, "train_runtime": 5317.2325, "train_tokens_per_second": 5964.143 }, { "epoch": 1.9316781609195401, "grad_norm": 1.0368155241012573, "learning_rate": 6.8838579053929694e-06, "loss": 1.4688, "num_input_tokens_seen": 31719072, "step": 5252, "train_runtime": 5318.2804, "train_tokens_per_second": 5964.159 }, { "epoch": 1.9320459770114944, "grad_norm": 1.1307930946350098, "learning_rate": 6.847045831032579e-06, "loss": 1.6219, "num_input_tokens_seen": 31724384, "step": 5253, "train_runtime": 5319.1655, "train_tokens_per_second": 5964.166 }, { "epoch": 1.9324137931034482, "grad_norm": 0.9835103154182434, "learning_rate": 6.81023375667219e-06, "loss": 1.5351, "num_input_tokens_seen": 31728976, "step": 5254, "train_runtime": 5319.9565, "train_tokens_per_second": 5964.142 }, { "epoch": 1.9327816091954024, "grad_norm": 0.9250811338424683, "learning_rate": 6.773421682311798e-06, "loss": 1.313, "num_input_tokens_seen": 31734976, "step": 5255, "train_runtime": 5320.9232, "train_tokens_per_second": 5964.186 }, { "epoch": 1.9331494252873562, "grad_norm": 1.0666043758392334, "learning_rate": 6.7366096079514075e-06, "loss": 1.5281, "num_input_tokens_seen": 31740400, "step": 5256, "train_runtime": 5321.8069, "train_tokens_per_second": 5964.215 }, { "epoch": 1.9335172413793105, "grad_norm": 1.0790902376174927, "learning_rate": 6.699797533591018e-06, "loss": 1.6425, "num_input_tokens_seen": 31746528, "step": 5257, "train_runtime": 5322.8096, "train_tokens_per_second": 5964.243 }, { "epoch": 1.9338850574712643, "grad_norm": 1.0127862691879272, "learning_rate": 6.662985459230628e-06, "loss": 1.4918, "num_input_tokens_seen": 31750864, "step": 5258, "train_runtime": 5323.5557, "train_tokens_per_second": 5964.221 }, { "epoch": 1.9342528735632185, "grad_norm": 1.0982059240341187, "learning_rate": 6.626173384870238e-06, "loss": 1.5349, "num_input_tokens_seen": 31757632, "step": 5259, "train_runtime": 5324.6389, "train_tokens_per_second": 5964.279 }, { "epoch": 1.9346206896551723, "grad_norm": 1.0924607515335083, "learning_rate": 6.589361310509848e-06, "loss": 1.4036, "num_input_tokens_seen": 31765440, "step": 5260, "train_runtime": 5325.8407, "train_tokens_per_second": 5964.399 }, { "epoch": 1.9349885057471266, "grad_norm": 1.1054469347000122, "learning_rate": 6.552549236149458e-06, "loss": 1.658, "num_input_tokens_seen": 31769776, "step": 5261, "train_runtime": 5326.5955, "train_tokens_per_second": 5964.368 }, { "epoch": 1.9353563218390804, "grad_norm": 0.9382045269012451, "learning_rate": 6.515737161789068e-06, "loss": 1.4855, "num_input_tokens_seen": 31774304, "step": 5262, "train_runtime": 5327.4098, "train_tokens_per_second": 5964.306 }, { "epoch": 1.9357241379310346, "grad_norm": 0.95528644323349, "learning_rate": 6.4789250874286766e-06, "loss": 1.2951, "num_input_tokens_seen": 31780224, "step": 5263, "train_runtime": 5328.3698, "train_tokens_per_second": 5964.343 }, { "epoch": 1.9360919540229884, "grad_norm": 0.9378964304924011, "learning_rate": 6.442113013068286e-06, "loss": 1.4056, "num_input_tokens_seen": 31784480, "step": 5264, "train_runtime": 5329.1146, "train_tokens_per_second": 5964.308 }, { "epoch": 1.9364597701149426, "grad_norm": 1.047817587852478, "learning_rate": 6.405300938707896e-06, "loss": 1.3752, "num_input_tokens_seen": 31789520, "step": 5265, "train_runtime": 5329.9458, "train_tokens_per_second": 5964.323 }, { "epoch": 1.9368275862068964, "grad_norm": 1.0981109142303467, "learning_rate": 6.368488864347507e-06, "loss": 1.5143, "num_input_tokens_seen": 31793520, "step": 5266, "train_runtime": 5330.6386, "train_tokens_per_second": 5964.298 }, { "epoch": 1.9371954022988507, "grad_norm": 0.9980946779251099, "learning_rate": 6.331676789987116e-06, "loss": 1.2403, "num_input_tokens_seen": 31798512, "step": 5267, "train_runtime": 5331.4758, "train_tokens_per_second": 5964.298 }, { "epoch": 1.9375632183908045, "grad_norm": 0.9951990842819214, "learning_rate": 6.294864715626726e-06, "loss": 1.4614, "num_input_tokens_seen": 31804736, "step": 5268, "train_runtime": 5332.508, "train_tokens_per_second": 5964.311 }, { "epoch": 1.9379310344827587, "grad_norm": 1.0398674011230469, "learning_rate": 6.258052641266336e-06, "loss": 1.2538, "num_input_tokens_seen": 31813264, "step": 5269, "train_runtime": 5333.8399, "train_tokens_per_second": 5964.42 }, { "epoch": 1.9382988505747125, "grad_norm": 0.9988831281661987, "learning_rate": 6.221240566905946e-06, "loss": 1.4653, "num_input_tokens_seen": 31817824, "step": 5270, "train_runtime": 5334.627, "train_tokens_per_second": 5964.395 }, { "epoch": 1.9386666666666668, "grad_norm": 1.0581578016281128, "learning_rate": 6.184428492545555e-06, "loss": 1.7029, "num_input_tokens_seen": 31822528, "step": 5271, "train_runtime": 5335.446, "train_tokens_per_second": 5964.361 }, { "epoch": 1.9390344827586206, "grad_norm": 0.9771072864532471, "learning_rate": 6.147616418185165e-06, "loss": 1.2942, "num_input_tokens_seen": 31830192, "step": 5272, "train_runtime": 5336.665, "train_tokens_per_second": 5964.435 }, { "epoch": 1.9394022988505748, "grad_norm": 1.0883715152740479, "learning_rate": 6.110804343824775e-06, "loss": 1.4369, "num_input_tokens_seen": 31839120, "step": 5273, "train_runtime": 5338.0342, "train_tokens_per_second": 5964.578 }, { "epoch": 1.9397701149425286, "grad_norm": 1.0530915260314941, "learning_rate": 6.0739922694643846e-06, "loss": 1.4179, "num_input_tokens_seen": 31845488, "step": 5274, "train_runtime": 5339.0807, "train_tokens_per_second": 5964.601 }, { "epoch": 1.9401379310344828, "grad_norm": 0.9308196306228638, "learning_rate": 6.037180195103994e-06, "loss": 1.4165, "num_input_tokens_seen": 31853248, "step": 5275, "train_runtime": 5340.2969, "train_tokens_per_second": 5964.696 }, { "epoch": 1.9405057471264366, "grad_norm": 1.0790725946426392, "learning_rate": 6.000368120743604e-06, "loss": 1.4623, "num_input_tokens_seen": 31860864, "step": 5276, "train_runtime": 5341.4885, "train_tokens_per_second": 5964.791 }, { "epoch": 1.9408735632183909, "grad_norm": 1.0767091512680054, "learning_rate": 5.963556046383214e-06, "loss": 1.409, "num_input_tokens_seen": 31865472, "step": 5277, "train_runtime": 5342.2757, "train_tokens_per_second": 5964.775 }, { "epoch": 1.9412413793103447, "grad_norm": 0.9972087740898132, "learning_rate": 5.9267439720228235e-06, "loss": 1.392, "num_input_tokens_seen": 31870384, "step": 5278, "train_runtime": 5343.111, "train_tokens_per_second": 5964.762 }, { "epoch": 1.941609195402299, "grad_norm": 1.0063000917434692, "learning_rate": 5.889931897662434e-06, "loss": 1.3924, "num_input_tokens_seen": 31875392, "step": 5279, "train_runtime": 5343.9673, "train_tokens_per_second": 5964.743 }, { "epoch": 1.9419770114942527, "grad_norm": 1.0639219284057617, "learning_rate": 5.853119823302043e-06, "loss": 1.5586, "num_input_tokens_seen": 31880208, "step": 5280, "train_runtime": 5344.7643, "train_tokens_per_second": 5964.755 }, { "epoch": 1.942344827586207, "grad_norm": 1.0319242477416992, "learning_rate": 5.816307748941653e-06, "loss": 1.3954, "num_input_tokens_seen": 31887952, "step": 5281, "train_runtime": 5346.5403, "train_tokens_per_second": 5964.222 }, { "epoch": 1.9427126436781608, "grad_norm": 1.0243401527404785, "learning_rate": 5.779495674581263e-06, "loss": 1.4722, "num_input_tokens_seen": 31895024, "step": 5282, "train_runtime": 5347.6663, "train_tokens_per_second": 5964.288 }, { "epoch": 1.943080459770115, "grad_norm": 0.9136255383491516, "learning_rate": 5.742683600220872e-06, "loss": 1.4453, "num_input_tokens_seen": 31901216, "step": 5283, "train_runtime": 5348.6577, "train_tokens_per_second": 5964.341 }, { "epoch": 1.9434482758620688, "grad_norm": 1.0555051565170288, "learning_rate": 5.705871525860483e-06, "loss": 1.5629, "num_input_tokens_seen": 31907056, "step": 5284, "train_runtime": 5349.6089, "train_tokens_per_second": 5964.372 }, { "epoch": 1.943816091954023, "grad_norm": 0.9248809218406677, "learning_rate": 5.6690594515000925e-06, "loss": 1.313, "num_input_tokens_seen": 31913520, "step": 5285, "train_runtime": 5350.6509, "train_tokens_per_second": 5964.418 }, { "epoch": 1.9441839080459768, "grad_norm": 0.9594218134880066, "learning_rate": 5.632247377139702e-06, "loss": 1.4998, "num_input_tokens_seen": 31920576, "step": 5286, "train_runtime": 5351.7527, "train_tokens_per_second": 5964.509 }, { "epoch": 1.944551724137931, "grad_norm": 0.8581014275550842, "learning_rate": 5.595435302779312e-06, "loss": 1.3114, "num_input_tokens_seen": 31928128, "step": 5287, "train_runtime": 5352.9601, "train_tokens_per_second": 5964.574 }, { "epoch": 1.944919540229885, "grad_norm": 1.2395435571670532, "learning_rate": 5.558623228418922e-06, "loss": 1.6761, "num_input_tokens_seen": 31932400, "step": 5288, "train_runtime": 5353.7024, "train_tokens_per_second": 5964.545 }, { "epoch": 1.9452873563218391, "grad_norm": 1.0082666873931885, "learning_rate": 5.5218111540585315e-06, "loss": 1.556, "num_input_tokens_seen": 31940480, "step": 5289, "train_runtime": 5354.9502, "train_tokens_per_second": 5964.664 }, { "epoch": 1.9456551724137932, "grad_norm": 1.0668951272964478, "learning_rate": 5.484999079698141e-06, "loss": 1.5841, "num_input_tokens_seen": 31950640, "step": 5290, "train_runtime": 5356.5053, "train_tokens_per_second": 5964.829 }, { "epoch": 1.9460229885057472, "grad_norm": 1.0597999095916748, "learning_rate": 5.448187005337751e-06, "loss": 1.3845, "num_input_tokens_seen": 31955376, "step": 5291, "train_runtime": 5357.3224, "train_tokens_per_second": 5964.804 }, { "epoch": 1.9463908045977012, "grad_norm": 1.0465960502624512, "learning_rate": 5.411374930977361e-06, "loss": 1.4331, "num_input_tokens_seen": 31959424, "step": 5292, "train_runtime": 5358.019, "train_tokens_per_second": 5964.784 }, { "epoch": 1.9467586206896552, "grad_norm": 1.035742163658142, "learning_rate": 5.3745628566169704e-06, "loss": 1.5636, "num_input_tokens_seen": 31966240, "step": 5293, "train_runtime": 5359.1134, "train_tokens_per_second": 5964.837 }, { "epoch": 1.9471264367816092, "grad_norm": 1.0233871936798096, "learning_rate": 5.337750782256581e-06, "loss": 1.5166, "num_input_tokens_seen": 31972032, "step": 5294, "train_runtime": 5360.0589, "train_tokens_per_second": 5964.866 }, { "epoch": 1.9474942528735633, "grad_norm": 1.0100815296173096, "learning_rate": 5.30093870789619e-06, "loss": 1.4645, "num_input_tokens_seen": 31978544, "step": 5295, "train_runtime": 5361.0804, "train_tokens_per_second": 5964.944 }, { "epoch": 1.9478620689655173, "grad_norm": 0.9109177589416504, "learning_rate": 5.2641266335358e-06, "loss": 1.3745, "num_input_tokens_seen": 31984224, "step": 5296, "train_runtime": 5362.008, "train_tokens_per_second": 5964.971 }, { "epoch": 1.9482298850574713, "grad_norm": 1.0548319816589355, "learning_rate": 5.22731455917541e-06, "loss": 1.4834, "num_input_tokens_seen": 31988656, "step": 5297, "train_runtime": 5362.7867, "train_tokens_per_second": 5964.932 }, { "epoch": 1.9485977011494253, "grad_norm": 1.040931224822998, "learning_rate": 5.190502484815019e-06, "loss": 1.5954, "num_input_tokens_seen": 31993616, "step": 5298, "train_runtime": 5363.6256, "train_tokens_per_second": 5964.923 }, { "epoch": 1.9489655172413793, "grad_norm": 0.9623754620552063, "learning_rate": 5.153690410454629e-06, "loss": 1.4927, "num_input_tokens_seen": 32002272, "step": 5299, "train_runtime": 5364.9954, "train_tokens_per_second": 5965.014 }, { "epoch": 1.9493333333333334, "grad_norm": 1.096806526184082, "learning_rate": 5.1168783360942395e-06, "loss": 1.667, "num_input_tokens_seen": 32006736, "step": 5300, "train_runtime": 5365.7505, "train_tokens_per_second": 5965.006 }, { "epoch": 1.9497011494252874, "grad_norm": 0.9942008256912231, "learning_rate": 5.080066261733849e-06, "loss": 1.4233, "num_input_tokens_seen": 32011440, "step": 5301, "train_runtime": 5366.5594, "train_tokens_per_second": 5964.984 }, { "epoch": 1.9500689655172414, "grad_norm": 1.0310285091400146, "learning_rate": 5.043254187373458e-06, "loss": 1.5672, "num_input_tokens_seen": 32015680, "step": 5302, "train_runtime": 5367.3184, "train_tokens_per_second": 5964.93 }, { "epoch": 1.9504367816091954, "grad_norm": 1.0258104801177979, "learning_rate": 5.006442113013069e-06, "loss": 1.5451, "num_input_tokens_seen": 32021808, "step": 5303, "train_runtime": 5368.3281, "train_tokens_per_second": 5964.95 }, { "epoch": 1.9508045977011494, "grad_norm": 1.0516815185546875, "learning_rate": 4.969630038652678e-06, "loss": 1.6127, "num_input_tokens_seen": 32026464, "step": 5304, "train_runtime": 5369.1231, "train_tokens_per_second": 5964.934 }, { "epoch": 1.9511724137931035, "grad_norm": 1.090609073638916, "learning_rate": 4.932817964292288e-06, "loss": 1.7142, "num_input_tokens_seen": 32031472, "step": 5305, "train_runtime": 5369.9618, "train_tokens_per_second": 5964.935 }, { "epoch": 1.9515402298850575, "grad_norm": 0.8959497809410095, "learning_rate": 4.896005889931898e-06, "loss": 1.3462, "num_input_tokens_seen": 32036928, "step": 5306, "train_runtime": 5370.8535, "train_tokens_per_second": 5964.96 }, { "epoch": 1.9519080459770115, "grad_norm": 0.9927746653556824, "learning_rate": 4.859193815571508e-06, "loss": 1.5212, "num_input_tokens_seen": 32041824, "step": 5307, "train_runtime": 5371.6925, "train_tokens_per_second": 5964.94 }, { "epoch": 1.9522758620689655, "grad_norm": 0.9697750210762024, "learning_rate": 4.822381741211117e-06, "loss": 1.4346, "num_input_tokens_seen": 32048928, "step": 5308, "train_runtime": 5372.8131, "train_tokens_per_second": 5965.018 }, { "epoch": 1.9526436781609195, "grad_norm": 1.0766029357910156, "learning_rate": 4.785569666850728e-06, "loss": 1.4846, "num_input_tokens_seen": 32054736, "step": 5309, "train_runtime": 5373.7493, "train_tokens_per_second": 5965.06 }, { "epoch": 1.9530114942528736, "grad_norm": 0.9555527567863464, "learning_rate": 4.748757592490337e-06, "loss": 1.5427, "num_input_tokens_seen": 32061536, "step": 5310, "train_runtime": 5374.8473, "train_tokens_per_second": 5965.106 }, { "epoch": 1.9533793103448276, "grad_norm": 1.0309621095657349, "learning_rate": 4.711945518129947e-06, "loss": 1.5572, "num_input_tokens_seen": 32066240, "step": 5311, "train_runtime": 5376.2125, "train_tokens_per_second": 5964.467 }, { "epoch": 1.9537471264367816, "grad_norm": 0.986017107963562, "learning_rate": 4.675133443769557e-06, "loss": 1.4435, "num_input_tokens_seen": 32073840, "step": 5312, "train_runtime": 5377.4049, "train_tokens_per_second": 5964.557 }, { "epoch": 1.9541149425287356, "grad_norm": 1.0569292306900024, "learning_rate": 4.638321369409166e-06, "loss": 1.7579, "num_input_tokens_seen": 32078640, "step": 5313, "train_runtime": 5378.236, "train_tokens_per_second": 5964.528 }, { "epoch": 1.9544827586206897, "grad_norm": 0.9573275446891785, "learning_rate": 4.601509295048776e-06, "loss": 1.4357, "num_input_tokens_seen": 32082832, "step": 5314, "train_runtime": 5378.9793, "train_tokens_per_second": 5964.483 }, { "epoch": 1.9548505747126437, "grad_norm": 1.1017218828201294, "learning_rate": 4.564697220688386e-06, "loss": 1.7869, "num_input_tokens_seen": 32087696, "step": 5315, "train_runtime": 5379.8218, "train_tokens_per_second": 5964.453 }, { "epoch": 1.9552183908045977, "grad_norm": 0.9713738560676575, "learning_rate": 4.527885146327996e-06, "loss": 1.6279, "num_input_tokens_seen": 32095840, "step": 5316, "train_runtime": 5381.1109, "train_tokens_per_second": 5964.538 }, { "epoch": 1.9555862068965517, "grad_norm": 1.0966476202011108, "learning_rate": 4.491073071967605e-06, "loss": 1.4297, "num_input_tokens_seen": 32101472, "step": 5317, "train_runtime": 5382.0202, "train_tokens_per_second": 5964.577 }, { "epoch": 1.9559540229885057, "grad_norm": 0.9543721675872803, "learning_rate": 4.454260997607216e-06, "loss": 1.3416, "num_input_tokens_seen": 32108688, "step": 5318, "train_runtime": 5383.1491, "train_tokens_per_second": 5964.666 }, { "epoch": 1.9563218390804598, "grad_norm": 1.0037769079208374, "learning_rate": 4.417448923246825e-06, "loss": 1.5395, "num_input_tokens_seen": 32115984, "step": 5319, "train_runtime": 5384.3019, "train_tokens_per_second": 5964.744 }, { "epoch": 1.9566896551724138, "grad_norm": 0.9767951369285583, "learning_rate": 4.380636848886435e-06, "loss": 1.4984, "num_input_tokens_seen": 32121456, "step": 5320, "train_runtime": 5385.2202, "train_tokens_per_second": 5964.743 }, { "epoch": 1.9570574712643678, "grad_norm": 1.0521577596664429, "learning_rate": 4.343824774526045e-06, "loss": 1.6567, "num_input_tokens_seen": 32128112, "step": 5321, "train_runtime": 5386.3056, "train_tokens_per_second": 5964.777 }, { "epoch": 1.9574252873563218, "grad_norm": 1.0742543935775757, "learning_rate": 4.307012700165655e-06, "loss": 1.4182, "num_input_tokens_seen": 32133200, "step": 5322, "train_runtime": 5387.1552, "train_tokens_per_second": 5964.781 }, { "epoch": 1.9577931034482758, "grad_norm": 0.9935344457626343, "learning_rate": 4.270200625805264e-06, "loss": 1.3829, "num_input_tokens_seen": 32140416, "step": 5323, "train_runtime": 5388.2863, "train_tokens_per_second": 5964.868 }, { "epoch": 1.9581609195402299, "grad_norm": 1.0693191289901733, "learning_rate": 4.233388551444874e-06, "loss": 1.4094, "num_input_tokens_seen": 32145296, "step": 5324, "train_runtime": 5389.1319, "train_tokens_per_second": 5964.837 }, { "epoch": 1.9585287356321839, "grad_norm": 1.1128088235855103, "learning_rate": 4.196576477084484e-06, "loss": 1.5803, "num_input_tokens_seen": 32149504, "step": 5325, "train_runtime": 5389.8676, "train_tokens_per_second": 5964.804 }, { "epoch": 1.958896551724138, "grad_norm": 1.1361160278320312, "learning_rate": 4.1597644027240935e-06, "loss": 1.6932, "num_input_tokens_seen": 32154224, "step": 5326, "train_runtime": 5390.6935, "train_tokens_per_second": 5964.766 }, { "epoch": 1.959264367816092, "grad_norm": 1.0320876836776733, "learning_rate": 4.122952328363703e-06, "loss": 1.4487, "num_input_tokens_seen": 32166464, "step": 5327, "train_runtime": 5392.4932, "train_tokens_per_second": 5965.045 }, { "epoch": 1.959632183908046, "grad_norm": 1.0516407489776611, "learning_rate": 4.086140254003314e-06, "loss": 1.693, "num_input_tokens_seen": 32172288, "step": 5328, "train_runtime": 5393.4447, "train_tokens_per_second": 5965.072 }, { "epoch": 1.96, "grad_norm": 0.9320648312568665, "learning_rate": 4.049328179642923e-06, "loss": 1.3479, "num_input_tokens_seen": 32181808, "step": 5329, "train_runtime": 5394.8944, "train_tokens_per_second": 5965.234 }, { "epoch": 1.960367816091954, "grad_norm": 0.9066106677055359, "learning_rate": 4.0125161052825325e-06, "loss": 1.3445, "num_input_tokens_seen": 32188576, "step": 5330, "train_runtime": 5396.0185, "train_tokens_per_second": 5965.246 }, { "epoch": 1.960735632183908, "grad_norm": 0.9577798247337341, "learning_rate": 3.975704030922143e-06, "loss": 1.4834, "num_input_tokens_seen": 32203488, "step": 5331, "train_runtime": 5398.1948, "train_tokens_per_second": 5965.603 }, { "epoch": 1.961103448275862, "grad_norm": 0.9157636165618896, "learning_rate": 3.938891956561752e-06, "loss": 1.2181, "num_input_tokens_seen": 32213120, "step": 5332, "train_runtime": 5399.6511, "train_tokens_per_second": 5965.778 }, { "epoch": 1.961471264367816, "grad_norm": 1.0202064514160156, "learning_rate": 3.902079882201362e-06, "loss": 1.619, "num_input_tokens_seen": 32218208, "step": 5333, "train_runtime": 5400.4967, "train_tokens_per_second": 5965.786 }, { "epoch": 1.96183908045977, "grad_norm": 0.9759100675582886, "learning_rate": 3.865267807840972e-06, "loss": 1.5136, "num_input_tokens_seen": 32226928, "step": 5334, "train_runtime": 5401.8401, "train_tokens_per_second": 5965.917 }, { "epoch": 1.962206896551724, "grad_norm": 1.0097498893737793, "learning_rate": 3.828455733480582e-06, "loss": 1.615, "num_input_tokens_seen": 32232112, "step": 5335, "train_runtime": 5402.7104, "train_tokens_per_second": 5965.915 }, { "epoch": 1.962574712643678, "grad_norm": 0.9370710849761963, "learning_rate": 3.7916436591201913e-06, "loss": 1.2833, "num_input_tokens_seen": 32239552, "step": 5336, "train_runtime": 5403.8691, "train_tokens_per_second": 5966.013 }, { "epoch": 1.9629425287356321, "grad_norm": 0.9166112542152405, "learning_rate": 3.7548315847598015e-06, "loss": 1.4053, "num_input_tokens_seen": 32245984, "step": 5337, "train_runtime": 5404.9143, "train_tokens_per_second": 5966.049 }, { "epoch": 1.9633103448275864, "grad_norm": 1.098130226135254, "learning_rate": 3.7180195103994113e-06, "loss": 1.6172, "num_input_tokens_seen": 32252976, "step": 5338, "train_runtime": 5406.0157, "train_tokens_per_second": 5966.127 }, { "epoch": 1.9636781609195402, "grad_norm": 1.1313691139221191, "learning_rate": 3.6812074360390214e-06, "loss": 1.604, "num_input_tokens_seen": 32259328, "step": 5339, "train_runtime": 5407.0206, "train_tokens_per_second": 5966.193 }, { "epoch": 1.9640459770114944, "grad_norm": 0.8854979872703552, "learning_rate": 3.6443953616786307e-06, "loss": 1.3713, "num_input_tokens_seen": 32265920, "step": 5340, "train_runtime": 5408.0631, "train_tokens_per_second": 5966.262 }, { "epoch": 1.9644137931034482, "grad_norm": 1.0324574708938599, "learning_rate": 3.6075832873182405e-06, "loss": 1.4795, "num_input_tokens_seen": 32271088, "step": 5341, "train_runtime": 5409.4578, "train_tokens_per_second": 5965.679 }, { "epoch": 1.9647816091954025, "grad_norm": 0.948697566986084, "learning_rate": 3.5707712129578506e-06, "loss": 1.4571, "num_input_tokens_seen": 32279936, "step": 5342, "train_runtime": 5410.8085, "train_tokens_per_second": 5965.825 }, { "epoch": 1.9651494252873563, "grad_norm": 0.945921778678894, "learning_rate": 3.5339591385974604e-06, "loss": 1.3578, "num_input_tokens_seen": 32286848, "step": 5343, "train_runtime": 5411.8957, "train_tokens_per_second": 5965.904 }, { "epoch": 1.9655172413793105, "grad_norm": 1.049149990081787, "learning_rate": 3.4971470642370697e-06, "loss": 1.3977, "num_input_tokens_seen": 32292528, "step": 5344, "train_runtime": 5412.8039, "train_tokens_per_second": 5965.952 }, { "epoch": 1.9658850574712643, "grad_norm": 1.106776237487793, "learning_rate": 3.46033498987668e-06, "loss": 1.7396, "num_input_tokens_seen": 32298688, "step": 5345, "train_runtime": 5413.8333, "train_tokens_per_second": 5965.955 }, { "epoch": 1.9662528735632185, "grad_norm": 1.051772117614746, "learning_rate": 3.4235229155162896e-06, "loss": 1.5489, "num_input_tokens_seen": 32303648, "step": 5346, "train_runtime": 5414.6424, "train_tokens_per_second": 5965.98 }, { "epoch": 1.9666206896551723, "grad_norm": 0.9481874108314514, "learning_rate": 3.386710841155899e-06, "loss": 1.5319, "num_input_tokens_seen": 32308880, "step": 5347, "train_runtime": 5415.5453, "train_tokens_per_second": 5965.951 }, { "epoch": 1.9669885057471266, "grad_norm": 0.8972981572151184, "learning_rate": 3.349898766795509e-06, "loss": 1.3542, "num_input_tokens_seen": 32318624, "step": 5348, "train_runtime": 5417.0419, "train_tokens_per_second": 5966.102 }, { "epoch": 1.9673563218390804, "grad_norm": 1.0520169734954834, "learning_rate": 3.313086692435119e-06, "loss": 1.5498, "num_input_tokens_seen": 32323728, "step": 5349, "train_runtime": 5417.8956, "train_tokens_per_second": 5966.104 }, { "epoch": 1.9677241379310346, "grad_norm": 0.9874334931373596, "learning_rate": 3.276274618074729e-06, "loss": 1.4794, "num_input_tokens_seen": 32329168, "step": 5350, "train_runtime": 5418.8042, "train_tokens_per_second": 5966.107 }, { "epoch": 1.9680919540229884, "grad_norm": 1.0940510034561157, "learning_rate": 3.2394625437143383e-06, "loss": 1.4545, "num_input_tokens_seen": 32335024, "step": 5351, "train_runtime": 5419.78, "train_tokens_per_second": 5966.114 }, { "epoch": 1.9684597701149427, "grad_norm": 1.0374449491500854, "learning_rate": 3.202650469353948e-06, "loss": 1.641, "num_input_tokens_seen": 32339888, "step": 5352, "train_runtime": 5420.6193, "train_tokens_per_second": 5966.087 }, { "epoch": 1.9688275862068965, "grad_norm": 1.0712896585464478, "learning_rate": 3.165838394993558e-06, "loss": 1.3483, "num_input_tokens_seen": 32345616, "step": 5353, "train_runtime": 5421.584, "train_tokens_per_second": 5966.082 }, { "epoch": 1.9691954022988507, "grad_norm": 0.9663326144218445, "learning_rate": 3.129026320633168e-06, "loss": 1.3515, "num_input_tokens_seen": 32353664, "step": 5354, "train_runtime": 5422.7933, "train_tokens_per_second": 5966.236 }, { "epoch": 1.9695632183908045, "grad_norm": 1.0441182851791382, "learning_rate": 3.0922142462727777e-06, "loss": 1.6059, "num_input_tokens_seen": 32359360, "step": 5355, "train_runtime": 5423.7113, "train_tokens_per_second": 5966.276 }, { "epoch": 1.9699310344827587, "grad_norm": 0.9823611974716187, "learning_rate": 3.0554021719123874e-06, "loss": 1.3778, "num_input_tokens_seen": 32365040, "step": 5356, "train_runtime": 5424.6475, "train_tokens_per_second": 5966.294 }, { "epoch": 1.9702988505747125, "grad_norm": 1.0174914598464966, "learning_rate": 3.018590097551997e-06, "loss": 1.4918, "num_input_tokens_seen": 32370224, "step": 5357, "train_runtime": 5425.5185, "train_tokens_per_second": 5966.291 }, { "epoch": 1.9706666666666668, "grad_norm": 1.0235735177993774, "learning_rate": 2.981778023191607e-06, "loss": 1.4855, "num_input_tokens_seen": 32375056, "step": 5358, "train_runtime": 5426.3197, "train_tokens_per_second": 5966.301 }, { "epoch": 1.9710344827586206, "grad_norm": 1.0242557525634766, "learning_rate": 2.944965948831217e-06, "loss": 1.4203, "num_input_tokens_seen": 32379888, "step": 5359, "train_runtime": 5427.1579, "train_tokens_per_second": 5966.27 }, { "epoch": 1.9714022988505748, "grad_norm": 1.0372973680496216, "learning_rate": 2.9081538744708264e-06, "loss": 1.397, "num_input_tokens_seen": 32384272, "step": 5360, "train_runtime": 5427.9331, "train_tokens_per_second": 5966.225 }, { "epoch": 1.9717701149425286, "grad_norm": 0.9870122075080872, "learning_rate": 2.871341800110436e-06, "loss": 1.3466, "num_input_tokens_seen": 32389568, "step": 5361, "train_runtime": 5428.8289, "train_tokens_per_second": 5966.216 }, { "epoch": 1.9721379310344829, "grad_norm": 0.935351550579071, "learning_rate": 2.8345297257500463e-06, "loss": 1.4078, "num_input_tokens_seen": 32396880, "step": 5362, "train_runtime": 5429.9827, "train_tokens_per_second": 5966.295 }, { "epoch": 1.9725057471264367, "grad_norm": 1.0815507173538208, "learning_rate": 2.797717651389656e-06, "loss": 1.5521, "num_input_tokens_seen": 32402464, "step": 5363, "train_runtime": 5430.9015, "train_tokens_per_second": 5966.314 }, { "epoch": 1.972873563218391, "grad_norm": 0.942524254322052, "learning_rate": 2.7609055770292657e-06, "loss": 1.3315, "num_input_tokens_seen": 32412512, "step": 5364, "train_runtime": 5432.4128, "train_tokens_per_second": 5966.504 }, { "epoch": 1.9732413793103447, "grad_norm": 0.9533636569976807, "learning_rate": 2.7240935026688755e-06, "loss": 1.2837, "num_input_tokens_seen": 32417232, "step": 5365, "train_runtime": 5433.2341, "train_tokens_per_second": 5966.471 }, { "epoch": 1.973609195402299, "grad_norm": 0.9564442038536072, "learning_rate": 2.6872814283084852e-06, "loss": 1.4282, "num_input_tokens_seen": 32425984, "step": 5366, "train_runtime": 5434.5632, "train_tokens_per_second": 5966.622 }, { "epoch": 1.9739770114942528, "grad_norm": 1.1184884309768677, "learning_rate": 2.650469353948095e-06, "loss": 1.4477, "num_input_tokens_seen": 32436000, "step": 5367, "train_runtime": 5436.0869, "train_tokens_per_second": 5966.792 }, { "epoch": 1.974344827586207, "grad_norm": 0.9816742539405823, "learning_rate": 2.613657279587705e-06, "loss": 1.3507, "num_input_tokens_seen": 32443200, "step": 5368, "train_runtime": 5437.2264, "train_tokens_per_second": 5966.866 }, { "epoch": 1.9747126436781608, "grad_norm": 1.0354766845703125, "learning_rate": 2.5768452052273144e-06, "loss": 1.5121, "num_input_tokens_seen": 32448656, "step": 5369, "train_runtime": 5438.1423, "train_tokens_per_second": 5966.864 }, { "epoch": 1.975080459770115, "grad_norm": 0.990043044090271, "learning_rate": 2.5400331308669246e-06, "loss": 1.5338, "num_input_tokens_seen": 32454816, "step": 5370, "train_runtime": 5439.1369, "train_tokens_per_second": 5966.906 }, { "epoch": 1.9754482758620688, "grad_norm": 0.9449595212936401, "learning_rate": 2.5032210565065343e-06, "loss": 1.469, "num_input_tokens_seen": 32460880, "step": 5371, "train_runtime": 5440.6079, "train_tokens_per_second": 5966.407 }, { "epoch": 1.975816091954023, "grad_norm": 1.0524660348892212, "learning_rate": 2.466408982146144e-06, "loss": 1.4156, "num_input_tokens_seen": 32467184, "step": 5372, "train_runtime": 5441.6133, "train_tokens_per_second": 5966.463 }, { "epoch": 1.9761839080459769, "grad_norm": 0.998673677444458, "learning_rate": 2.429596907785754e-06, "loss": 1.7635, "num_input_tokens_seen": 32472544, "step": 5373, "train_runtime": 5442.5043, "train_tokens_per_second": 5966.471 }, { "epoch": 1.9765517241379311, "grad_norm": 0.969534158706665, "learning_rate": 2.392784833425364e-06, "loss": 1.4915, "num_input_tokens_seen": 32479248, "step": 5374, "train_runtime": 5443.5556, "train_tokens_per_second": 5966.55 }, { "epoch": 1.976919540229885, "grad_norm": 0.9665586948394775, "learning_rate": 2.3559727590649733e-06, "loss": 1.4788, "num_input_tokens_seen": 32487584, "step": 5375, "train_runtime": 5444.8847, "train_tokens_per_second": 5966.625 }, { "epoch": 1.9772873563218392, "grad_norm": 0.9553905129432678, "learning_rate": 2.319160684704583e-06, "loss": 1.3564, "num_input_tokens_seen": 32492544, "step": 5376, "train_runtime": 5445.7375, "train_tokens_per_second": 5966.601 }, { "epoch": 1.977655172413793, "grad_norm": 1.0792388916015625, "learning_rate": 2.282348610344193e-06, "loss": 1.5903, "num_input_tokens_seen": 32497712, "step": 5377, "train_runtime": 5446.6038, "train_tokens_per_second": 5966.601 }, { "epoch": 1.9780229885057472, "grad_norm": 1.0385632514953613, "learning_rate": 2.2455365359838025e-06, "loss": 1.329, "num_input_tokens_seen": 32504880, "step": 5378, "train_runtime": 5447.7461, "train_tokens_per_second": 5966.666 }, { "epoch": 1.978390804597701, "grad_norm": 0.908355176448822, "learning_rate": 2.2087244616234127e-06, "loss": 1.2065, "num_input_tokens_seen": 32513696, "step": 5379, "train_runtime": 5449.1411, "train_tokens_per_second": 5966.756 }, { "epoch": 1.9787586206896552, "grad_norm": 0.9959275722503662, "learning_rate": 2.1719123872630224e-06, "loss": 1.6937, "num_input_tokens_seen": 32517760, "step": 5380, "train_runtime": 5449.837, "train_tokens_per_second": 5966.74 }, { "epoch": 1.979126436781609, "grad_norm": 1.0768471956253052, "learning_rate": 2.135100312902632e-06, "loss": 1.5575, "num_input_tokens_seen": 32522544, "step": 5381, "train_runtime": 5450.6656, "train_tokens_per_second": 5966.711 }, { "epoch": 1.9794942528735633, "grad_norm": 0.9211650490760803, "learning_rate": 2.098288238542242e-06, "loss": 1.3118, "num_input_tokens_seen": 32532800, "step": 5382, "train_runtime": 5452.2013, "train_tokens_per_second": 5966.911 }, { "epoch": 1.979862068965517, "grad_norm": 0.986584484577179, "learning_rate": 2.0614761641818516e-06, "loss": 1.4974, "num_input_tokens_seen": 32538448, "step": 5383, "train_runtime": 5453.122, "train_tokens_per_second": 5966.939 }, { "epoch": 1.9802298850574713, "grad_norm": 1.0325545072555542, "learning_rate": 2.0246640898214614e-06, "loss": 1.3793, "num_input_tokens_seen": 32544624, "step": 5384, "train_runtime": 5454.1293, "train_tokens_per_second": 5966.97 }, { "epoch": 1.9805977011494251, "grad_norm": 0.9728584885597229, "learning_rate": 1.9878520154610715e-06, "loss": 1.4634, "num_input_tokens_seen": 32550976, "step": 5385, "train_runtime": 5455.1562, "train_tokens_per_second": 5967.011 }, { "epoch": 1.9809655172413794, "grad_norm": 1.024316430091858, "learning_rate": 1.951039941100681e-06, "loss": 1.35, "num_input_tokens_seen": 32556688, "step": 5386, "train_runtime": 5456.1093, "train_tokens_per_second": 5967.015 }, { "epoch": 1.9813333333333332, "grad_norm": 1.017407774925232, "learning_rate": 1.914227866740291e-06, "loss": 1.4562, "num_input_tokens_seen": 32562032, "step": 5387, "train_runtime": 5456.993, "train_tokens_per_second": 5967.028 }, { "epoch": 1.9817011494252874, "grad_norm": 0.994735836982727, "learning_rate": 1.8774157923799008e-06, "loss": 1.6563, "num_input_tokens_seen": 32566448, "step": 5388, "train_runtime": 5457.7637, "train_tokens_per_second": 5966.995 }, { "epoch": 1.9820689655172414, "grad_norm": 1.0104857683181763, "learning_rate": 1.8406037180195107e-06, "loss": 1.5782, "num_input_tokens_seen": 32573168, "step": 5389, "train_runtime": 5458.8495, "train_tokens_per_second": 5967.039 }, { "epoch": 1.9824367816091955, "grad_norm": 0.9368088245391846, "learning_rate": 1.8037916436591202e-06, "loss": 1.3141, "num_input_tokens_seen": 32583120, "step": 5390, "train_runtime": 5460.3467, "train_tokens_per_second": 5967.226 }, { "epoch": 1.9828045977011495, "grad_norm": 0.9728841185569763, "learning_rate": 1.7669795692987302e-06, "loss": 1.5194, "num_input_tokens_seen": 32588016, "step": 5391, "train_runtime": 5461.188, "train_tokens_per_second": 5967.203 }, { "epoch": 1.9831724137931035, "grad_norm": 1.044521689414978, "learning_rate": 1.73016749493834e-06, "loss": 1.5423, "num_input_tokens_seen": 32592896, "step": 5392, "train_runtime": 5462.0224, "train_tokens_per_second": 5967.185 }, { "epoch": 1.9835402298850575, "grad_norm": 1.0784873962402344, "learning_rate": 1.6933554205779495e-06, "loss": 1.4701, "num_input_tokens_seen": 32598208, "step": 5393, "train_runtime": 5462.9158, "train_tokens_per_second": 5967.181 }, { "epoch": 1.9839080459770115, "grad_norm": 1.1091370582580566, "learning_rate": 1.6565433462175594e-06, "loss": 1.5639, "num_input_tokens_seen": 32604960, "step": 5394, "train_runtime": 5464.0048, "train_tokens_per_second": 5967.228 }, { "epoch": 1.9842758620689656, "grad_norm": 0.967035710811615, "learning_rate": 1.6197312718571691e-06, "loss": 1.6944, "num_input_tokens_seen": 32610848, "step": 5395, "train_runtime": 5464.9607, "train_tokens_per_second": 5967.261 }, { "epoch": 1.9846436781609196, "grad_norm": 1.0483430624008179, "learning_rate": 1.582919197496779e-06, "loss": 1.6001, "num_input_tokens_seen": 32615088, "step": 5396, "train_runtime": 5465.7188, "train_tokens_per_second": 5967.209 }, { "epoch": 1.9850114942528736, "grad_norm": 1.045504093170166, "learning_rate": 1.5461071231363888e-06, "loss": 1.5257, "num_input_tokens_seen": 32620736, "step": 5397, "train_runtime": 5466.6494, "train_tokens_per_second": 5967.227 }, { "epoch": 1.9853793103448276, "grad_norm": 1.0130599737167358, "learning_rate": 1.5092950487759986e-06, "loss": 1.4876, "num_input_tokens_seen": 32627744, "step": 5398, "train_runtime": 5467.7756, "train_tokens_per_second": 5967.279 }, { "epoch": 1.9857471264367816, "grad_norm": 0.8777824640274048, "learning_rate": 1.4724829744156085e-06, "loss": 1.1176, "num_input_tokens_seen": 32635632, "step": 5399, "train_runtime": 5469.035, "train_tokens_per_second": 5967.347 }, { "epoch": 1.9861149425287357, "grad_norm": 0.7812280058860779, "learning_rate": 1.435670900055218e-06, "loss": 1.2394, "num_input_tokens_seen": 32645344, "step": 5400, "train_runtime": 5470.4902, "train_tokens_per_second": 5967.535 }, { "epoch": 1.9864827586206897, "grad_norm": 1.1060978174209595, "learning_rate": 1.398858825694828e-06, "loss": 1.5318, "num_input_tokens_seen": 32649856, "step": 5401, "train_runtime": 5471.7562, "train_tokens_per_second": 5966.979 }, { "epoch": 1.9868505747126437, "grad_norm": 1.0044702291488647, "learning_rate": 1.3620467513344377e-06, "loss": 1.5481, "num_input_tokens_seen": 32659792, "step": 5402, "train_runtime": 5473.265, "train_tokens_per_second": 5967.15 }, { "epoch": 1.9872183908045977, "grad_norm": 1.1206163167953491, "learning_rate": 1.3252346769740475e-06, "loss": 1.4078, "num_input_tokens_seen": 32665104, "step": 5403, "train_runtime": 5474.1586, "train_tokens_per_second": 5967.146 }, { "epoch": 1.9875862068965517, "grad_norm": 1.097223162651062, "learning_rate": 1.2884226026136572e-06, "loss": 1.602, "num_input_tokens_seen": 32669152, "step": 5404, "train_runtime": 5474.8887, "train_tokens_per_second": 5967.09 }, { "epoch": 1.9879540229885058, "grad_norm": 1.0463114976882935, "learning_rate": 1.2516105282532672e-06, "loss": 1.6595, "num_input_tokens_seen": 32673568, "step": 5405, "train_runtime": 5475.6598, "train_tokens_per_second": 5967.056 }, { "epoch": 1.9883218390804598, "grad_norm": 1.0015771389007568, "learning_rate": 1.214798453892877e-06, "loss": 1.434, "num_input_tokens_seen": 32678272, "step": 5406, "train_runtime": 5476.4832, "train_tokens_per_second": 5967.018 }, { "epoch": 1.9886896551724138, "grad_norm": 1.1400842666625977, "learning_rate": 1.1779863795324866e-06, "loss": 1.4002, "num_input_tokens_seen": 32683376, "step": 5407, "train_runtime": 5477.3249, "train_tokens_per_second": 5967.033 }, { "epoch": 1.9890574712643678, "grad_norm": 1.0390219688415527, "learning_rate": 1.1411743051720966e-06, "loss": 1.5986, "num_input_tokens_seen": 32689328, "step": 5408, "train_runtime": 5478.2892, "train_tokens_per_second": 5967.069 }, { "epoch": 1.9894252873563218, "grad_norm": 0.9824442267417908, "learning_rate": 1.1043622308117063e-06, "loss": 1.6095, "num_input_tokens_seen": 32695088, "step": 5409, "train_runtime": 5479.2359, "train_tokens_per_second": 5967.089 }, { "epoch": 1.9897931034482759, "grad_norm": 0.9292029142379761, "learning_rate": 1.067550156451316e-06, "loss": 1.3702, "num_input_tokens_seen": 32705024, "step": 5410, "train_runtime": 5480.7403, "train_tokens_per_second": 5967.264 }, { "epoch": 1.99016091954023, "grad_norm": 1.1019560098648071, "learning_rate": 1.0307380820909258e-06, "loss": 1.4871, "num_input_tokens_seen": 32710576, "step": 5411, "train_runtime": 5481.6498, "train_tokens_per_second": 5967.287 }, { "epoch": 1.990528735632184, "grad_norm": 0.961487352848053, "learning_rate": 9.939260077305358e-07, "loss": 1.4016, "num_input_tokens_seen": 32716944, "step": 5412, "train_runtime": 5482.6761, "train_tokens_per_second": 5967.331 }, { "epoch": 1.990896551724138, "grad_norm": 0.9317049384117126, "learning_rate": 9.571139333701455e-07, "loss": 1.3659, "num_input_tokens_seen": 32724928, "step": 5413, "train_runtime": 5483.9384, "train_tokens_per_second": 5967.414 }, { "epoch": 1.991264367816092, "grad_norm": 0.9792227745056152, "learning_rate": 9.203018590097554e-07, "loss": 1.6279, "num_input_tokens_seen": 32730464, "step": 5414, "train_runtime": 5484.8508, "train_tokens_per_second": 5967.43 }, { "epoch": 1.991632183908046, "grad_norm": 0.9332373142242432, "learning_rate": 8.834897846493651e-07, "loss": 1.3293, "num_input_tokens_seen": 32736400, "step": 5415, "train_runtime": 5485.8182, "train_tokens_per_second": 5967.46 }, { "epoch": 1.992, "grad_norm": 0.9401854276657104, "learning_rate": 8.466777102889747e-07, "loss": 1.4474, "num_input_tokens_seen": 32745760, "step": 5416, "train_runtime": 5487.2357, "train_tokens_per_second": 5967.624 }, { "epoch": 1.992367816091954, "grad_norm": 1.0248979330062866, "learning_rate": 8.098656359285846e-07, "loss": 1.5212, "num_input_tokens_seen": 32751344, "step": 5417, "train_runtime": 5488.1559, "train_tokens_per_second": 5967.641 }, { "epoch": 1.992735632183908, "grad_norm": 0.9462123513221741, "learning_rate": 7.730535615681944e-07, "loss": 1.5531, "num_input_tokens_seen": 32756352, "step": 5418, "train_runtime": 5488.9709, "train_tokens_per_second": 5967.667 }, { "epoch": 1.993103448275862, "grad_norm": 0.9655794501304626, "learning_rate": 7.362414872078043e-07, "loss": 1.4801, "num_input_tokens_seen": 32761440, "step": 5419, "train_runtime": 5489.8388, "train_tokens_per_second": 5967.651 }, { "epoch": 1.993471264367816, "grad_norm": 0.9820994138717651, "learning_rate": 6.99429412847414e-07, "loss": 1.3995, "num_input_tokens_seen": 32766944, "step": 5420, "train_runtime": 5490.7655, "train_tokens_per_second": 5967.646 }, { "epoch": 1.99383908045977, "grad_norm": 1.161966323852539, "learning_rate": 6.626173384870237e-07, "loss": 1.645, "num_input_tokens_seen": 32774704, "step": 5421, "train_runtime": 5491.9682, "train_tokens_per_second": 5967.752 }, { "epoch": 1.9942068965517241, "grad_norm": 1.0541167259216309, "learning_rate": 6.258052641266336e-07, "loss": 1.4254, "num_input_tokens_seen": 32779696, "step": 5422, "train_runtime": 5492.8143, "train_tokens_per_second": 5967.741 }, { "epoch": 1.9945747126436781, "grad_norm": 1.0184603929519653, "learning_rate": 5.889931897662433e-07, "loss": 1.4754, "num_input_tokens_seen": 32785536, "step": 5423, "train_runtime": 5493.7647, "train_tokens_per_second": 5967.772 }, { "epoch": 1.9949425287356322, "grad_norm": 1.1059820652008057, "learning_rate": 5.521811154058532e-07, "loss": 1.3308, "num_input_tokens_seen": 32793536, "step": 5424, "train_runtime": 5495.0017, "train_tokens_per_second": 5967.885 }, { "epoch": 1.9953103448275862, "grad_norm": 0.8938537836074829, "learning_rate": 5.153690410454629e-07, "loss": 1.3523, "num_input_tokens_seen": 32801824, "step": 5425, "train_runtime": 5496.3196, "train_tokens_per_second": 5967.962 }, { "epoch": 1.9956781609195402, "grad_norm": 0.9378447532653809, "learning_rate": 4.785569666850728e-07, "loss": 1.6491, "num_input_tokens_seen": 32808880, "step": 5426, "train_runtime": 5497.4354, "train_tokens_per_second": 5968.034 }, { "epoch": 1.9960459770114942, "grad_norm": 0.9492788314819336, "learning_rate": 4.4174489232468255e-07, "loss": 1.352, "num_input_tokens_seen": 32815856, "step": 5427, "train_runtime": 5498.5434, "train_tokens_per_second": 5968.1 }, { "epoch": 1.9964137931034482, "grad_norm": 1.075098991394043, "learning_rate": 4.049328179642923e-07, "loss": 1.4486, "num_input_tokens_seen": 32821664, "step": 5428, "train_runtime": 5499.5237, "train_tokens_per_second": 5968.092 }, { "epoch": 1.9967816091954023, "grad_norm": 0.9548684358596802, "learning_rate": 3.6812074360390213e-07, "loss": 1.4292, "num_input_tokens_seen": 32827536, "step": 5429, "train_runtime": 5500.4718, "train_tokens_per_second": 5968.131 }, { "epoch": 1.9971494252873563, "grad_norm": 1.0021536350250244, "learning_rate": 3.3130866924351187e-07, "loss": 1.6485, "num_input_tokens_seen": 32832544, "step": 5430, "train_runtime": 5501.3226, "train_tokens_per_second": 5968.118 }, { "epoch": 1.9975172413793103, "grad_norm": 1.0741565227508545, "learning_rate": 2.9449659488312166e-07, "loss": 1.6941, "num_input_tokens_seen": 32837200, "step": 5431, "train_runtime": 5502.7376, "train_tokens_per_second": 5967.43 }, { "epoch": 1.9978850574712643, "grad_norm": 0.9878013730049133, "learning_rate": 2.5768452052273145e-07, "loss": 1.3869, "num_input_tokens_seen": 32842496, "step": 5432, "train_runtime": 5503.6287, "train_tokens_per_second": 5967.426 }, { "epoch": 1.9982528735632183, "grad_norm": 1.0719490051269531, "learning_rate": 2.2087244616234127e-07, "loss": 1.4274, "num_input_tokens_seen": 32847632, "step": 5433, "train_runtime": 5504.505, "train_tokens_per_second": 5967.409 }, { "epoch": 1.9986206896551724, "grad_norm": 1.1153154373168945, "learning_rate": 1.8406037180195107e-07, "loss": 1.4851, "num_input_tokens_seen": 32852816, "step": 5434, "train_runtime": 5505.3723, "train_tokens_per_second": 5967.41 }, { "epoch": 1.9989885057471264, "grad_norm": 1.0122332572937012, "learning_rate": 1.4724829744156083e-07, "loss": 1.3487, "num_input_tokens_seen": 32858576, "step": 5435, "train_runtime": 5506.3153, "train_tokens_per_second": 5967.435 }, { "epoch": 1.9993563218390804, "grad_norm": 0.9718579649925232, "learning_rate": 1.1043622308117064e-07, "loss": 1.5405, "num_input_tokens_seen": 32864720, "step": 5436, "train_runtime": 5507.3259, "train_tokens_per_second": 5967.455 }, { "epoch": 1.9997241379310344, "grad_norm": 0.9767136573791504, "learning_rate": 7.362414872078042e-08, "loss": 1.4336, "num_input_tokens_seen": 32870096, "step": 5437, "train_runtime": 5508.209, "train_tokens_per_second": 5967.474 }, { "epoch": 2.0, "grad_norm": 1.1507837772369385, "learning_rate": 3.681207436039021e-08, "loss": 1.6856, "num_input_tokens_seen": 32874336, "step": 5438, "train_runtime": 5508.9238, "train_tokens_per_second": 5967.47 } ], "logging_steps": 1, "max_steps": 5438, "num_input_tokens_seen": 32874336, "num_train_epochs": 2, "save_steps": 30, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.402614311610581e+18, "train_batch_size": 16, "trial_name": null, "trial_params": null }