{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 59, "global_step": 586, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.003418803418803419, "grad_norm": 0.7900828123092651, "learning_rate": 0.0, "loss": 1.4756, "num_input_tokens_seen": 16096, "step": 1, "train_runtime": 4.4851, "train_tokens_per_second": 3588.771 }, { "epoch": 0.006837606837606838, "grad_norm": 0.8550273180007935, "learning_rate": 4e-05, "loss": 1.4762, "num_input_tokens_seen": 31264, "step": 2, "train_runtime": 6.6431, "train_tokens_per_second": 4706.205 }, { "epoch": 0.010256410256410256, "grad_norm": 0.7560146450996399, "learning_rate": 8e-05, "loss": 1.3375, "num_input_tokens_seen": 45584, "step": 3, "train_runtime": 8.7724, "train_tokens_per_second": 5196.291 }, { "epoch": 0.013675213675213675, "grad_norm": 0.6870028376579285, "learning_rate": 0.00012, "loss": 1.0514, "num_input_tokens_seen": 75072, "step": 4, "train_runtime": 13.0746, "train_tokens_per_second": 5741.815 }, { "epoch": 0.017094017094017096, "grad_norm": 1.0243306159973145, "learning_rate": 0.00016, "loss": 1.1457, "num_input_tokens_seen": 93296, "step": 5, "train_runtime": 15.6571, "train_tokens_per_second": 5958.706 }, { "epoch": 0.020512820512820513, "grad_norm": 0.9480018019676208, "learning_rate": 0.0002, "loss": 0.8195, "num_input_tokens_seen": 108880, "step": 6, "train_runtime": 17.9212, "train_tokens_per_second": 6075.488 }, { "epoch": 0.023931623931623933, "grad_norm": 0.6540018320083618, "learning_rate": 0.00019965576592082616, "loss": 0.6109, "num_input_tokens_seen": 124688, "step": 7, "train_runtime": 20.1568, "train_tokens_per_second": 6185.907 }, { "epoch": 0.02735042735042735, "grad_norm": 0.28220847249031067, "learning_rate": 0.00019931153184165235, "loss": 0.5465, "num_input_tokens_seen": 141552, "step": 8, "train_runtime": 22.5656, "train_tokens_per_second": 6272.909 }, { "epoch": 0.03076923076923077, "grad_norm": 0.18244771659374237, "learning_rate": 0.0001989672977624785, "loss": 0.4196, "num_input_tokens_seen": 156656, "step": 9, "train_runtime": 24.7703, "train_tokens_per_second": 6324.342 }, { "epoch": 0.03418803418803419, "grad_norm": 0.19386130571365356, "learning_rate": 0.00019862306368330465, "loss": 0.4848, "num_input_tokens_seen": 175424, "step": 10, "train_runtime": 27.4449, "train_tokens_per_second": 6391.856 }, { "epoch": 0.037606837606837605, "grad_norm": 0.21845291554927826, "learning_rate": 0.0001982788296041308, "loss": 0.4163, "num_input_tokens_seen": 191904, "step": 11, "train_runtime": 29.8233, "train_tokens_per_second": 6434.711 }, { "epoch": 0.041025641025641026, "grad_norm": 0.2227926403284073, "learning_rate": 0.000197934595524957, "loss": 0.5241, "num_input_tokens_seen": 204480, "step": 12, "train_runtime": 31.6741, "train_tokens_per_second": 6455.753 }, { "epoch": 0.044444444444444446, "grad_norm": 0.14958512783050537, "learning_rate": 0.00019759036144578314, "loss": 0.3789, "num_input_tokens_seen": 222928, "step": 13, "train_runtime": 34.2727, "train_tokens_per_second": 6504.542 }, { "epoch": 0.04786324786324787, "grad_norm": 0.12511517107486725, "learning_rate": 0.0001972461273666093, "loss": 0.4255, "num_input_tokens_seen": 243248, "step": 14, "train_runtime": 37.1309, "train_tokens_per_second": 6551.089 }, { "epoch": 0.05128205128205128, "grad_norm": 0.12351791560649872, "learning_rate": 0.00019690189328743548, "loss": 0.4773, "num_input_tokens_seen": 259984, "step": 15, "train_runtime": 39.5774, "train_tokens_per_second": 6569.005 }, { "epoch": 0.0547008547008547, "grad_norm": 0.15381421148777008, "learning_rate": 0.00019655765920826164, "loss": 0.572, "num_input_tokens_seen": 273488, "step": 16, "train_runtime": 41.5599, "train_tokens_per_second": 6580.574 }, { "epoch": 0.05811965811965812, "grad_norm": 0.12012167274951935, "learning_rate": 0.0001962134251290878, "loss": 0.4824, "num_input_tokens_seen": 289072, "step": 17, "train_runtime": 43.7917, "train_tokens_per_second": 6601.074 }, { "epoch": 0.06153846153846154, "grad_norm": 0.12363950163125992, "learning_rate": 0.00019586919104991394, "loss": 0.4198, "num_input_tokens_seen": 303408, "step": 18, "train_runtime": 45.8994, "train_tokens_per_second": 6610.276 }, { "epoch": 0.06495726495726496, "grad_norm": 0.13709434866905212, "learning_rate": 0.00019552495697074013, "loss": 0.5045, "num_input_tokens_seen": 321088, "step": 19, "train_runtime": 48.4273, "train_tokens_per_second": 6630.309 }, { "epoch": 0.06837606837606838, "grad_norm": 0.11719892919063568, "learning_rate": 0.00019518072289156628, "loss": 0.444, "num_input_tokens_seen": 339024, "step": 20, "train_runtime": 51.0105, "train_tokens_per_second": 6646.155 }, { "epoch": 0.07179487179487179, "grad_norm": 0.1195915937423706, "learning_rate": 0.00019483648881239243, "loss": 0.4404, "num_input_tokens_seen": 355648, "step": 21, "train_runtime": 53.4008, "train_tokens_per_second": 6659.98 }, { "epoch": 0.07521367521367521, "grad_norm": 0.12735435366630554, "learning_rate": 0.0001944922547332186, "loss": 0.4253, "num_input_tokens_seen": 377104, "step": 22, "train_runtime": 58.0087, "train_tokens_per_second": 6500.816 }, { "epoch": 0.07863247863247863, "grad_norm": 0.13012833893299103, "learning_rate": 0.00019414802065404477, "loss": 0.4549, "num_input_tokens_seen": 388496, "step": 23, "train_runtime": 59.7134, "train_tokens_per_second": 6506.008 }, { "epoch": 0.08205128205128205, "grad_norm": 0.1187860295176506, "learning_rate": 0.00019380378657487093, "loss": 0.4447, "num_input_tokens_seen": 405136, "step": 24, "train_runtime": 62.1253, "train_tokens_per_second": 6521.268 }, { "epoch": 0.08547008547008547, "grad_norm": 0.12317577004432678, "learning_rate": 0.0001934595524956971, "loss": 0.4326, "num_input_tokens_seen": 421088, "step": 25, "train_runtime": 64.4069, "train_tokens_per_second": 6537.935 }, { "epoch": 0.08888888888888889, "grad_norm": 0.12564784288406372, "learning_rate": 0.00019311531841652323, "loss": 0.4521, "num_input_tokens_seen": 435328, "step": 26, "train_runtime": 66.5043, "train_tokens_per_second": 6545.86 }, { "epoch": 0.09230769230769231, "grad_norm": 0.10685139149427414, "learning_rate": 0.00019277108433734942, "loss": 0.4642, "num_input_tokens_seen": 451968, "step": 27, "train_runtime": 68.9138, "train_tokens_per_second": 6558.455 }, { "epoch": 0.09572649572649573, "grad_norm": 0.11094007641077042, "learning_rate": 0.00019242685025817557, "loss": 0.4877, "num_input_tokens_seen": 464928, "step": 28, "train_runtime": 70.8316, "train_tokens_per_second": 6563.853 }, { "epoch": 0.09914529914529914, "grad_norm": 0.1094178631901741, "learning_rate": 0.00019208261617900175, "loss": 0.5, "num_input_tokens_seen": 479280, "step": 29, "train_runtime": 72.9759, "train_tokens_per_second": 6567.645 }, { "epoch": 0.10256410256410256, "grad_norm": 0.09002909064292908, "learning_rate": 0.00019173838209982788, "loss": 0.3389, "num_input_tokens_seen": 496320, "step": 30, "train_runtime": 75.4421, "train_tokens_per_second": 6578.822 }, { "epoch": 0.10598290598290598, "grad_norm": 0.10585018992424011, "learning_rate": 0.00019139414802065406, "loss": 0.4548, "num_input_tokens_seen": 511296, "step": 31, "train_runtime": 78.2326, "train_tokens_per_second": 6535.59 }, { "epoch": 0.1094017094017094, "grad_norm": 0.09583117812871933, "learning_rate": 0.00019104991394148021, "loss": 0.4003, "num_input_tokens_seen": 529008, "step": 32, "train_runtime": 80.7656, "train_tokens_per_second": 6549.918 }, { "epoch": 0.11282051282051282, "grad_norm": 0.1044701486825943, "learning_rate": 0.0001907056798623064, "loss": 0.4673, "num_input_tokens_seen": 544384, "step": 33, "train_runtime": 83.0622, "train_tokens_per_second": 6553.935 }, { "epoch": 0.11623931623931624, "grad_norm": 0.10936785489320755, "learning_rate": 0.00019036144578313252, "loss": 0.4197, "num_input_tokens_seen": 562096, "step": 34, "train_runtime": 85.6158, "train_tokens_per_second": 6565.333 }, { "epoch": 0.11965811965811966, "grad_norm": 0.08397576957941055, "learning_rate": 0.0001900172117039587, "loss": 0.3889, "num_input_tokens_seen": 580704, "step": 35, "train_runtime": 88.3072, "train_tokens_per_second": 6575.955 }, { "epoch": 0.12307692307692308, "grad_norm": 0.10643361508846283, "learning_rate": 0.00018967297762478486, "loss": 0.474, "num_input_tokens_seen": 596128, "step": 36, "train_runtime": 90.568, "train_tokens_per_second": 6582.102 }, { "epoch": 0.1264957264957265, "grad_norm": 0.11568325012922287, "learning_rate": 0.00018932874354561104, "loss": 0.4805, "num_input_tokens_seen": 609488, "step": 37, "train_runtime": 92.5585, "train_tokens_per_second": 6584.897 }, { "epoch": 0.12991452991452992, "grad_norm": 0.1005433201789856, "learning_rate": 0.00018898450946643717, "loss": 0.3679, "num_input_tokens_seen": 624592, "step": 38, "train_runtime": 94.7955, "train_tokens_per_second": 6588.837 }, { "epoch": 0.13333333333333333, "grad_norm": 0.0977381095290184, "learning_rate": 0.00018864027538726335, "loss": 0.4141, "num_input_tokens_seen": 639840, "step": 39, "train_runtime": 97.0423, "train_tokens_per_second": 6593.411 }, { "epoch": 0.13675213675213677, "grad_norm": 0.11257043480873108, "learning_rate": 0.0001882960413080895, "loss": 0.5211, "num_input_tokens_seen": 652048, "step": 40, "train_runtime": 98.9078, "train_tokens_per_second": 6592.481 }, { "epoch": 0.14017094017094017, "grad_norm": 0.10306330025196075, "learning_rate": 0.00018795180722891569, "loss": 0.3752, "num_input_tokens_seen": 670112, "step": 41, "train_runtime": 101.5158, "train_tokens_per_second": 6601.063 }, { "epoch": 0.14358974358974358, "grad_norm": 0.07424470037221909, "learning_rate": 0.00018760757314974184, "loss": 0.2781, "num_input_tokens_seen": 705168, "step": 42, "train_runtime": 106.5454, "train_tokens_per_second": 6618.476 }, { "epoch": 0.147008547008547, "grad_norm": 0.09572459757328033, "learning_rate": 0.000187263339070568, "loss": 0.5014, "num_input_tokens_seen": 720320, "step": 43, "train_runtime": 108.8037, "train_tokens_per_second": 6620.362 }, { "epoch": 0.15042735042735042, "grad_norm": 0.09543762356042862, "learning_rate": 0.00018691910499139415, "loss": 0.4411, "num_input_tokens_seen": 736032, "step": 44, "train_runtime": 111.1227, "train_tokens_per_second": 6623.596 }, { "epoch": 0.15384615384615385, "grad_norm": 0.09599870443344116, "learning_rate": 0.00018657487091222033, "loss": 0.3435, "num_input_tokens_seen": 750576, "step": 45, "train_runtime": 113.3125, "train_tokens_per_second": 6623.948 }, { "epoch": 0.15726495726495726, "grad_norm": 0.0982552245259285, "learning_rate": 0.00018623063683304649, "loss": 0.5206, "num_input_tokens_seen": 768944, "step": 46, "train_runtime": 115.975, "train_tokens_per_second": 6630.256 }, { "epoch": 0.1606837606837607, "grad_norm": 0.10187075287103653, "learning_rate": 0.00018588640275387264, "loss": 0.4408, "num_input_tokens_seen": 784144, "step": 47, "train_runtime": 118.2082, "train_tokens_per_second": 6633.584 }, { "epoch": 0.1641025641025641, "grad_norm": 0.0859491378068924, "learning_rate": 0.0001855421686746988, "loss": 0.4154, "num_input_tokens_seen": 804272, "step": 48, "train_runtime": 121.1095, "train_tokens_per_second": 6640.864 }, { "epoch": 0.1675213675213675, "grad_norm": 0.08325184136629105, "learning_rate": 0.00018519793459552498, "loss": 0.4557, "num_input_tokens_seen": 818224, "step": 49, "train_runtime": 123.1709, "train_tokens_per_second": 6642.997 }, { "epoch": 0.17094017094017094, "grad_norm": 0.09160371869802475, "learning_rate": 0.00018485370051635113, "loss": 0.3976, "num_input_tokens_seen": 837600, "step": 50, "train_runtime": 125.9707, "train_tokens_per_second": 6649.167 }, { "epoch": 0.17435897435897435, "grad_norm": 0.08669862151145935, "learning_rate": 0.00018450946643717729, "loss": 0.4597, "num_input_tokens_seen": 855360, "step": 51, "train_runtime": 128.5702, "train_tokens_per_second": 6652.866 }, { "epoch": 0.17777777777777778, "grad_norm": 0.10008913278579712, "learning_rate": 0.00018416523235800344, "loss": 0.4608, "num_input_tokens_seen": 869472, "step": 52, "train_runtime": 130.6754, "train_tokens_per_second": 6653.679 }, { "epoch": 0.1811965811965812, "grad_norm": 0.08692440390586853, "learning_rate": 0.00018382099827882962, "loss": 0.4229, "num_input_tokens_seen": 887936, "step": 53, "train_runtime": 133.3545, "train_tokens_per_second": 6658.462 }, { "epoch": 0.18461538461538463, "grad_norm": 0.12537947297096252, "learning_rate": 0.00018347676419965578, "loss": 0.5767, "num_input_tokens_seen": 902240, "step": 54, "train_runtime": 135.5092, "train_tokens_per_second": 6658.146 }, { "epoch": 0.18803418803418803, "grad_norm": 0.08537557721138, "learning_rate": 0.00018313253012048193, "loss": 0.4519, "num_input_tokens_seen": 920688, "step": 55, "train_runtime": 138.1817, "train_tokens_per_second": 6662.881 }, { "epoch": 0.19145299145299147, "grad_norm": 0.09388847649097443, "learning_rate": 0.00018278829604130808, "loss": 0.4083, "num_input_tokens_seen": 937024, "step": 56, "train_runtime": 140.574, "train_tokens_per_second": 6665.697 }, { "epoch": 0.19487179487179487, "grad_norm": 0.12476610392332077, "learning_rate": 0.00018244406196213427, "loss": 0.457, "num_input_tokens_seen": 949568, "step": 57, "train_runtime": 142.4521, "train_tokens_per_second": 6665.875 }, { "epoch": 0.19829059829059828, "grad_norm": 0.11227541416883469, "learning_rate": 0.00018209982788296042, "loss": 0.4666, "num_input_tokens_seen": 964000, "step": 58, "train_runtime": 144.5997, "train_tokens_per_second": 6666.681 }, { "epoch": 0.20170940170940171, "grad_norm": 0.10149527341127396, "learning_rate": 0.0001817555938037866, "loss": 0.473, "num_input_tokens_seen": 976560, "step": 59, "train_runtime": 146.4793, "train_tokens_per_second": 6666.883 }, { "epoch": 0.20170940170940171, "eval_loss": 0.4301406145095825, "eval_runtime": 11.8663, "eval_samples_per_second": 84.104, "eval_steps_per_second": 5.309, "num_input_tokens_seen": 976560, "step": 59 }, { "epoch": 0.20512820512820512, "grad_norm": 0.0855872854590416, "learning_rate": 0.00018141135972461273, "loss": 0.4248, "num_input_tokens_seen": 992944, "step": 60, "train_runtime": 160.7566, "train_tokens_per_second": 6176.693 }, { "epoch": 0.20854700854700856, "grad_norm": 0.11866864562034607, "learning_rate": 0.0001810671256454389, "loss": 0.537, "num_input_tokens_seen": 1005920, "step": 61, "train_runtime": 163.2145, "train_tokens_per_second": 6163.179 }, { "epoch": 0.21196581196581196, "grad_norm": 0.0955129861831665, "learning_rate": 0.00018072289156626507, "loss": 0.3983, "num_input_tokens_seen": 1022704, "step": 62, "train_runtime": 165.6518, "train_tokens_per_second": 6173.817 }, { "epoch": 0.2153846153846154, "grad_norm": 0.11176180094480515, "learning_rate": 0.00018037865748709125, "loss": 0.4392, "num_input_tokens_seen": 1038928, "step": 63, "train_runtime": 168.0352, "train_tokens_per_second": 6182.8 }, { "epoch": 0.2188034188034188, "grad_norm": 0.08749086409807205, "learning_rate": 0.00018003442340791737, "loss": 0.412, "num_input_tokens_seen": 1057504, "step": 64, "train_runtime": 170.7322, "train_tokens_per_second": 6193.934 }, { "epoch": 0.2222222222222222, "grad_norm": 0.10065372288227081, "learning_rate": 0.00017969018932874356, "loss": 0.4496, "num_input_tokens_seen": 1071952, "step": 65, "train_runtime": 172.8869, "train_tokens_per_second": 6200.307 }, { "epoch": 0.22564102564102564, "grad_norm": 0.09161035716533661, "learning_rate": 0.0001793459552495697, "loss": 0.4995, "num_input_tokens_seen": 1091408, "step": 66, "train_runtime": 175.7012, "train_tokens_per_second": 6211.727 }, { "epoch": 0.22905982905982905, "grad_norm": 0.08862069249153137, "learning_rate": 0.0001790017211703959, "loss": 0.4157, "num_input_tokens_seen": 1107040, "step": 67, "train_runtime": 178.0171, "train_tokens_per_second": 6218.728 }, { "epoch": 0.23247863247863249, "grad_norm": 0.09428606927394867, "learning_rate": 0.00017865748709122202, "loss": 0.4845, "num_input_tokens_seen": 1121712, "step": 68, "train_runtime": 180.2346, "train_tokens_per_second": 6223.624 }, { "epoch": 0.2358974358974359, "grad_norm": 0.1100679412484169, "learning_rate": 0.0001783132530120482, "loss": 0.4706, "num_input_tokens_seen": 1135664, "step": 69, "train_runtime": 182.3342, "train_tokens_per_second": 6228.477 }, { "epoch": 0.23931623931623933, "grad_norm": 0.10081252455711365, "learning_rate": 0.00017796901893287436, "loss": 0.4073, "num_input_tokens_seen": 1154224, "step": 70, "train_runtime": 185.0219, "train_tokens_per_second": 6238.31 }, { "epoch": 0.24273504273504273, "grad_norm": 0.08933307230472565, "learning_rate": 0.00017762478485370054, "loss": 0.4457, "num_input_tokens_seen": 1171424, "step": 71, "train_runtime": 187.5554, "train_tokens_per_second": 6245.75 }, { "epoch": 0.24615384615384617, "grad_norm": 0.0866895243525505, "learning_rate": 0.00017728055077452666, "loss": 0.3439, "num_input_tokens_seen": 1189504, "step": 72, "train_runtime": 190.1853, "train_tokens_per_second": 6254.449 }, { "epoch": 0.24957264957264957, "grad_norm": 0.09268927574157715, "learning_rate": 0.00017693631669535285, "loss": 0.4454, "num_input_tokens_seen": 1207600, "step": 73, "train_runtime": 192.8217, "train_tokens_per_second": 6262.782 }, { "epoch": 0.252991452991453, "grad_norm": 0.08207046240568161, "learning_rate": 0.000176592082616179, "loss": 0.4721, "num_input_tokens_seen": 1227552, "step": 74, "train_runtime": 195.7293, "train_tokens_per_second": 6271.682 }, { "epoch": 0.2564102564102564, "grad_norm": 0.08926599472761154, "learning_rate": 0.00017624784853700518, "loss": 0.5064, "num_input_tokens_seen": 1245984, "step": 75, "train_runtime": 198.439, "train_tokens_per_second": 6278.928 }, { "epoch": 0.25982905982905985, "grad_norm": 0.10555540025234222, "learning_rate": 0.00017590361445783134, "loss": 0.4264, "num_input_tokens_seen": 1259536, "step": 76, "train_runtime": 200.4904, "train_tokens_per_second": 6282.277 }, { "epoch": 0.26324786324786326, "grad_norm": 0.09617225080728531, "learning_rate": 0.0001755593803786575, "loss": 0.4686, "num_input_tokens_seen": 1278768, "step": 77, "train_runtime": 203.2722, "train_tokens_per_second": 6290.914 }, { "epoch": 0.26666666666666666, "grad_norm": 0.12434384226799011, "learning_rate": 0.00017521514629948364, "loss": 0.5939, "num_input_tokens_seen": 1292928, "step": 78, "train_runtime": 205.3845, "train_tokens_per_second": 6295.159 }, { "epoch": 0.27008547008547007, "grad_norm": 0.1012965589761734, "learning_rate": 0.00017487091222030983, "loss": 0.403, "num_input_tokens_seen": 1310160, "step": 79, "train_runtime": 207.8738, "train_tokens_per_second": 6302.671 }, { "epoch": 0.27350427350427353, "grad_norm": 0.08980307728052139, "learning_rate": 0.00017452667814113598, "loss": 0.3688, "num_input_tokens_seen": 1328608, "step": 80, "train_runtime": 210.5562, "train_tokens_per_second": 6309.993 }, { "epoch": 0.27692307692307694, "grad_norm": 0.09891822189092636, "learning_rate": 0.00017418244406196214, "loss": 0.4751, "num_input_tokens_seen": 1346016, "step": 81, "train_runtime": 213.0979, "train_tokens_per_second": 6316.422 }, { "epoch": 0.28034188034188035, "grad_norm": 0.10093598067760468, "learning_rate": 0.0001738382099827883, "loss": 0.5395, "num_input_tokens_seen": 1359184, "step": 82, "train_runtime": 215.139, "train_tokens_per_second": 6317.702 }, { "epoch": 0.28376068376068375, "grad_norm": 0.09215115010738373, "learning_rate": 0.00017349397590361447, "loss": 0.4067, "num_input_tokens_seen": 1374384, "step": 83, "train_runtime": 217.3721, "train_tokens_per_second": 6322.726 }, { "epoch": 0.28717948717948716, "grad_norm": 0.09286817163228989, "learning_rate": 0.00017314974182444063, "loss": 0.4327, "num_input_tokens_seen": 1395312, "step": 84, "train_runtime": 220.3981, "train_tokens_per_second": 6330.871 }, { "epoch": 0.2905982905982906, "grad_norm": 0.10269108414649963, "learning_rate": 0.00017280550774526678, "loss": 0.4137, "num_input_tokens_seen": 1410480, "step": 85, "train_runtime": 222.6432, "train_tokens_per_second": 6335.159 }, { "epoch": 0.294017094017094, "grad_norm": 0.11593605577945709, "learning_rate": 0.00017246127366609296, "loss": 0.488, "num_input_tokens_seen": 1423008, "step": 86, "train_runtime": 224.5645, "train_tokens_per_second": 6336.746 }, { "epoch": 0.29743589743589743, "grad_norm": 0.09121434390544891, "learning_rate": 0.00017211703958691912, "loss": 0.4372, "num_input_tokens_seen": 1443008, "step": 87, "train_runtime": 227.4516, "train_tokens_per_second": 6344.241 }, { "epoch": 0.30085470085470084, "grad_norm": 0.11658863723278046, "learning_rate": 0.00017177280550774527, "loss": 0.4129, "num_input_tokens_seen": 1457936, "step": 88, "train_runtime": 229.6543, "train_tokens_per_second": 6348.393 }, { "epoch": 0.30427350427350425, "grad_norm": 0.1077234074473381, "learning_rate": 0.00017142857142857143, "loss": 0.4311, "num_input_tokens_seen": 1471536, "step": 89, "train_runtime": 231.6871, "train_tokens_per_second": 6351.395 }, { "epoch": 0.3076923076923077, "grad_norm": 0.10258413106203079, "learning_rate": 0.0001710843373493976, "loss": 0.4856, "num_input_tokens_seen": 1486080, "step": 90, "train_runtime": 233.8589, "train_tokens_per_second": 6354.6 }, { "epoch": 0.3111111111111111, "grad_norm": 0.09048861265182495, "learning_rate": 0.00017074010327022376, "loss": 0.4573, "num_input_tokens_seen": 1501360, "step": 91, "train_runtime": 236.6697, "train_tokens_per_second": 6343.694 }, { "epoch": 0.3145299145299145, "grad_norm": 0.09616488963365555, "learning_rate": 0.00017039586919104992, "loss": 0.3533, "num_input_tokens_seen": 1521744, "step": 92, "train_runtime": 239.5612, "train_tokens_per_second": 6352.215 }, { "epoch": 0.31794871794871793, "grad_norm": 0.10119186341762543, "learning_rate": 0.00017005163511187607, "loss": 0.4687, "num_input_tokens_seen": 1538640, "step": 93, "train_runtime": 242.0203, "train_tokens_per_second": 6357.484 }, { "epoch": 0.3213675213675214, "grad_norm": 0.103726826608181, "learning_rate": 0.00016970740103270225, "loss": 0.43, "num_input_tokens_seen": 1553200, "step": 94, "train_runtime": 244.1818, "train_tokens_per_second": 6360.835 }, { "epoch": 0.3247863247863248, "grad_norm": 0.09369926899671555, "learning_rate": 0.0001693631669535284, "loss": 0.4155, "num_input_tokens_seen": 1571952, "step": 95, "train_runtime": 246.9205, "train_tokens_per_second": 6366.227 }, { "epoch": 0.3282051282051282, "grad_norm": 0.09061973541975021, "learning_rate": 0.0001690189328743546, "loss": 0.4044, "num_input_tokens_seen": 1584416, "step": 96, "train_runtime": 248.812, "train_tokens_per_second": 6367.924 }, { "epoch": 0.3316239316239316, "grad_norm": 0.08632508665323257, "learning_rate": 0.00016867469879518074, "loss": 0.405, "num_input_tokens_seen": 1604672, "step": 97, "train_runtime": 251.7603, "train_tokens_per_second": 6373.808 }, { "epoch": 0.335042735042735, "grad_norm": 0.08924511075019836, "learning_rate": 0.0001683304647160069, "loss": 0.4357, "num_input_tokens_seen": 1622608, "step": 98, "train_runtime": 254.3946, "train_tokens_per_second": 6378.311 }, { "epoch": 0.3384615384615385, "grad_norm": 0.10018568485975266, "learning_rate": 0.00016798623063683305, "loss": 0.4007, "num_input_tokens_seen": 1636752, "step": 99, "train_runtime": 256.4999, "train_tokens_per_second": 6381.101 }, { "epoch": 0.3418803418803419, "grad_norm": 0.08820787072181702, "learning_rate": 0.00016764199655765923, "loss": 0.3778, "num_input_tokens_seen": 1649408, "step": 100, "train_runtime": 258.3868, "train_tokens_per_second": 6383.484 }, { "epoch": 0.3452991452991453, "grad_norm": 0.10735058784484863, "learning_rate": 0.0001672977624784854, "loss": 0.5828, "num_input_tokens_seen": 1665776, "step": 101, "train_runtime": 260.7883, "train_tokens_per_second": 6387.466 }, { "epoch": 0.3487179487179487, "grad_norm": 0.09399764984846115, "learning_rate": 0.00016695352839931154, "loss": 0.4238, "num_input_tokens_seen": 1688816, "step": 102, "train_runtime": 264.0814, "train_tokens_per_second": 6395.059 }, { "epoch": 0.35213675213675216, "grad_norm": 0.0975056141614914, "learning_rate": 0.0001666092943201377, "loss": 0.4374, "num_input_tokens_seen": 1703456, "step": 103, "train_runtime": 266.2978, "train_tokens_per_second": 6396.807 }, { "epoch": 0.35555555555555557, "grad_norm": 0.09030232578516006, "learning_rate": 0.00016626506024096388, "loss": 0.448, "num_input_tokens_seen": 1724528, "step": 104, "train_runtime": 269.3165, "train_tokens_per_second": 6403.35 }, { "epoch": 0.358974358974359, "grad_norm": 0.10417474806308746, "learning_rate": 0.00016592082616179003, "loss": 0.4109, "num_input_tokens_seen": 1740768, "step": 105, "train_runtime": 271.6966, "train_tokens_per_second": 6407.029 }, { "epoch": 0.3623931623931624, "grad_norm": 0.10844124108552933, "learning_rate": 0.00016557659208261619, "loss": 0.4165, "num_input_tokens_seen": 1753632, "step": 106, "train_runtime": 273.6236, "train_tokens_per_second": 6408.921 }, { "epoch": 0.3658119658119658, "grad_norm": 0.08827276527881622, "learning_rate": 0.00016523235800344234, "loss": 0.4233, "num_input_tokens_seen": 1768480, "step": 107, "train_runtime": 275.8419, "train_tokens_per_second": 6411.209 }, { "epoch": 0.36923076923076925, "grad_norm": 0.10917767882347107, "learning_rate": 0.00016488812392426852, "loss": 0.4624, "num_input_tokens_seen": 1782800, "step": 108, "train_runtime": 277.9694, "train_tokens_per_second": 6413.656 }, { "epoch": 0.37264957264957266, "grad_norm": 0.10163897275924683, "learning_rate": 0.00016454388984509468, "loss": 0.4553, "num_input_tokens_seen": 1799008, "step": 109, "train_runtime": 280.3434, "train_tokens_per_second": 6417.158 }, { "epoch": 0.37606837606837606, "grad_norm": 0.10832331329584122, "learning_rate": 0.00016419965576592083, "loss": 0.359, "num_input_tokens_seen": 1811792, "step": 110, "train_runtime": 282.2797, "train_tokens_per_second": 6418.429 }, { "epoch": 0.37948717948717947, "grad_norm": 0.08609069138765335, "learning_rate": 0.00016385542168674699, "loss": 0.4809, "num_input_tokens_seen": 1828512, "step": 111, "train_runtime": 284.7476, "train_tokens_per_second": 6421.518 }, { "epoch": 0.38290598290598293, "grad_norm": 0.11904721707105637, "learning_rate": 0.00016351118760757317, "loss": 0.4375, "num_input_tokens_seen": 1849616, "step": 112, "train_runtime": 287.8004, "train_tokens_per_second": 6426.732 }, { "epoch": 0.38632478632478634, "grad_norm": 0.09531164169311523, "learning_rate": 0.00016316695352839932, "loss": 0.4484, "num_input_tokens_seen": 1866480, "step": 113, "train_runtime": 290.2693, "train_tokens_per_second": 6430.167 }, { "epoch": 0.38974358974358975, "grad_norm": 0.13019715249538422, "learning_rate": 0.0001628227194492255, "loss": 0.4285, "num_input_tokens_seen": 1881008, "step": 114, "train_runtime": 292.3998, "train_tokens_per_second": 6433.0 }, { "epoch": 0.39316239316239315, "grad_norm": 0.1122983917593956, "learning_rate": 0.00016247848537005163, "loss": 0.5555, "num_input_tokens_seen": 1893264, "step": 115, "train_runtime": 294.2603, "train_tokens_per_second": 6433.977 }, { "epoch": 0.39658119658119656, "grad_norm": 0.0886179730296135, "learning_rate": 0.0001621342512908778, "loss": 0.4052, "num_input_tokens_seen": 1911168, "step": 116, "train_runtime": 296.8399, "train_tokens_per_second": 6438.379 }, { "epoch": 0.4, "grad_norm": 0.11588186770677567, "learning_rate": 0.00016179001721170397, "loss": 0.4881, "num_input_tokens_seen": 1922320, "step": 117, "train_runtime": 298.5272, "train_tokens_per_second": 6439.346 }, { "epoch": 0.40341880341880343, "grad_norm": 0.09329588711261749, "learning_rate": 0.00016144578313253015, "loss": 0.392, "num_input_tokens_seen": 1935888, "step": 118, "train_runtime": 300.5442, "train_tokens_per_second": 6441.276 }, { "epoch": 0.40341880341880343, "eval_loss": 0.4257439076900482, "eval_runtime": 11.8891, "eval_samples_per_second": 83.943, "eval_steps_per_second": 5.299, "num_input_tokens_seen": 1935888, "step": 118 }, { "epoch": 0.40683760683760684, "grad_norm": 0.09967512637376785, "learning_rate": 0.00016110154905335628, "loss": 0.4716, "num_input_tokens_seen": 1949360, "step": 119, "train_runtime": 314.4663, "train_tokens_per_second": 6198.947 }, { "epoch": 0.41025641025641024, "grad_norm": 0.08704519271850586, "learning_rate": 0.00016075731497418246, "loss": 0.3573, "num_input_tokens_seen": 1965152, "step": 120, "train_runtime": 316.7907, "train_tokens_per_second": 6203.314 }, { "epoch": 0.41367521367521365, "grad_norm": 0.09572669863700867, "learning_rate": 0.0001604130808950086, "loss": 0.3742, "num_input_tokens_seen": 1981632, "step": 121, "train_runtime": 319.7181, "train_tokens_per_second": 6198.06 }, { "epoch": 0.4170940170940171, "grad_norm": 0.09697537869215012, "learning_rate": 0.0001600688468158348, "loss": 0.4811, "num_input_tokens_seen": 1999488, "step": 122, "train_runtime": 322.3203, "train_tokens_per_second": 6203.42 }, { "epoch": 0.4205128205128205, "grad_norm": 0.10042616724967957, "learning_rate": 0.00015972461273666092, "loss": 0.4146, "num_input_tokens_seen": 2015360, "step": 123, "train_runtime": 324.66, "train_tokens_per_second": 6207.601 }, { "epoch": 0.4239316239316239, "grad_norm": 0.09732874482870102, "learning_rate": 0.0001593803786574871, "loss": 0.3647, "num_input_tokens_seen": 2029840, "step": 124, "train_runtime": 326.8173, "train_tokens_per_second": 6210.931 }, { "epoch": 0.42735042735042733, "grad_norm": 0.0899026021361351, "learning_rate": 0.00015903614457831326, "loss": 0.3614, "num_input_tokens_seen": 2043888, "step": 125, "train_runtime": 328.9033, "train_tokens_per_second": 6214.251 }, { "epoch": 0.4307692307692308, "grad_norm": 0.1127215027809143, "learning_rate": 0.00015869191049913944, "loss": 0.521, "num_input_tokens_seen": 2056784, "step": 126, "train_runtime": 330.847, "train_tokens_per_second": 6216.723 }, { "epoch": 0.4341880341880342, "grad_norm": 0.10900437831878662, "learning_rate": 0.00015834767641996557, "loss": 0.5004, "num_input_tokens_seen": 2073152, "step": 127, "train_runtime": 333.236, "train_tokens_per_second": 6221.272 }, { "epoch": 0.4376068376068376, "grad_norm": 0.10284293442964554, "learning_rate": 0.00015800344234079175, "loss": 0.4758, "num_input_tokens_seen": 2086832, "step": 128, "train_runtime": 335.3261, "train_tokens_per_second": 6223.291 }, { "epoch": 0.441025641025641, "grad_norm": 0.08526846766471863, "learning_rate": 0.0001576592082616179, "loss": 0.3601, "num_input_tokens_seen": 2102704, "step": 129, "train_runtime": 337.6773, "train_tokens_per_second": 6226.962 }, { "epoch": 0.4444444444444444, "grad_norm": 0.0935521200299263, "learning_rate": 0.00015731497418244408, "loss": 0.4191, "num_input_tokens_seen": 2120672, "step": 130, "train_runtime": 340.2901, "train_tokens_per_second": 6231.953 }, { "epoch": 0.4478632478632479, "grad_norm": 0.09808618575334549, "learning_rate": 0.00015697074010327024, "loss": 0.432, "num_input_tokens_seen": 2134528, "step": 131, "train_runtime": 342.374, "train_tokens_per_second": 6234.492 }, { "epoch": 0.4512820512820513, "grad_norm": 0.08662474900484085, "learning_rate": 0.0001566265060240964, "loss": 0.4311, "num_input_tokens_seen": 2150768, "step": 132, "train_runtime": 344.7887, "train_tokens_per_second": 6237.931 }, { "epoch": 0.4547008547008547, "grad_norm": 0.09085840731859207, "learning_rate": 0.00015628227194492255, "loss": 0.4223, "num_input_tokens_seen": 2171536, "step": 133, "train_runtime": 347.7754, "train_tokens_per_second": 6244.076 }, { "epoch": 0.4581196581196581, "grad_norm": 0.1134534478187561, "learning_rate": 0.00015593803786574873, "loss": 0.4995, "num_input_tokens_seen": 2187392, "step": 134, "train_runtime": 350.1232, "train_tokens_per_second": 6247.493 }, { "epoch": 0.46153846153846156, "grad_norm": 0.0914321318268776, "learning_rate": 0.00015559380378657488, "loss": 0.3414, "num_input_tokens_seen": 2208736, "step": 135, "train_runtime": 353.1913, "train_tokens_per_second": 6253.653 }, { "epoch": 0.46495726495726497, "grad_norm": 0.09697174280881882, "learning_rate": 0.00015524956970740104, "loss": 0.4192, "num_input_tokens_seen": 2221520, "step": 136, "train_runtime": 355.1021, "train_tokens_per_second": 6256.004 }, { "epoch": 0.4683760683760684, "grad_norm": 0.09903775900602341, "learning_rate": 0.0001549053356282272, "loss": 0.4107, "num_input_tokens_seen": 2234736, "step": 137, "train_runtime": 357.0576, "train_tokens_per_second": 6258.755 }, { "epoch": 0.4717948717948718, "grad_norm": 0.10500401258468628, "learning_rate": 0.00015456110154905337, "loss": 0.4507, "num_input_tokens_seen": 2246432, "step": 138, "train_runtime": 358.8165, "train_tokens_per_second": 6260.671 }, { "epoch": 0.4752136752136752, "grad_norm": 0.10770396888256073, "learning_rate": 0.00015421686746987953, "loss": 0.4844, "num_input_tokens_seen": 2264496, "step": 139, "train_runtime": 361.4046, "train_tokens_per_second": 6265.82 }, { "epoch": 0.47863247863247865, "grad_norm": 0.09635472297668457, "learning_rate": 0.00015387263339070568, "loss": 0.3587, "num_input_tokens_seen": 2279664, "step": 140, "train_runtime": 363.662, "train_tokens_per_second": 6268.634 }, { "epoch": 0.48205128205128206, "grad_norm": 0.10260126739740372, "learning_rate": 0.00015352839931153184, "loss": 0.4402, "num_input_tokens_seen": 2294976, "step": 141, "train_runtime": 365.9416, "train_tokens_per_second": 6271.427 }, { "epoch": 0.48547008547008547, "grad_norm": 0.11078032851219177, "learning_rate": 0.00015318416523235802, "loss": 0.4819, "num_input_tokens_seen": 2310256, "step": 142, "train_runtime": 368.2151, "train_tokens_per_second": 6274.202 }, { "epoch": 0.4888888888888889, "grad_norm": 0.08946855366230011, "learning_rate": 0.00015283993115318417, "loss": 0.3455, "num_input_tokens_seen": 2332160, "step": 143, "train_runtime": 371.3782, "train_tokens_per_second": 6279.745 }, { "epoch": 0.49230769230769234, "grad_norm": 0.089847132563591, "learning_rate": 0.00015249569707401033, "loss": 0.3624, "num_input_tokens_seen": 2346720, "step": 144, "train_runtime": 373.5395, "train_tokens_per_second": 6282.389 }, { "epoch": 0.49572649572649574, "grad_norm": 0.10344398766756058, "learning_rate": 0.00015215146299483648, "loss": 0.4373, "num_input_tokens_seen": 2360992, "step": 145, "train_runtime": 375.6328, "train_tokens_per_second": 6285.372 }, { "epoch": 0.49914529914529915, "grad_norm": 0.10121628642082214, "learning_rate": 0.00015180722891566266, "loss": 0.4471, "num_input_tokens_seen": 2375680, "step": 146, "train_runtime": 377.7982, "train_tokens_per_second": 6288.226 }, { "epoch": 0.5025641025641026, "grad_norm": 0.08698102086782455, "learning_rate": 0.00015146299483648882, "loss": 0.3908, "num_input_tokens_seen": 2397024, "step": 147, "train_runtime": 380.8567, "train_tokens_per_second": 6293.768 }, { "epoch": 0.505982905982906, "grad_norm": 0.08766576647758484, "learning_rate": 0.000151118760757315, "loss": 0.3881, "num_input_tokens_seen": 2414128, "step": 148, "train_runtime": 383.3371, "train_tokens_per_second": 6297.663 }, { "epoch": 0.5094017094017094, "grad_norm": 0.10594574362039566, "learning_rate": 0.00015077452667814113, "loss": 0.3554, "num_input_tokens_seen": 2430736, "step": 149, "train_runtime": 385.7797, "train_tokens_per_second": 6300.84 }, { "epoch": 0.5128205128205128, "grad_norm": 0.10977370291948318, "learning_rate": 0.0001504302925989673, "loss": 0.4906, "num_input_tokens_seen": 2449856, "step": 150, "train_runtime": 388.5377, "train_tokens_per_second": 6305.324 }, { "epoch": 0.5162393162393163, "grad_norm": 0.09074017405509949, "learning_rate": 0.00015008605851979346, "loss": 0.4157, "num_input_tokens_seen": 2467024, "step": 151, "train_runtime": 391.5399, "train_tokens_per_second": 6300.824 }, { "epoch": 0.5196581196581197, "grad_norm": 0.08705534040927887, "learning_rate": 0.00014974182444061964, "loss": 0.3707, "num_input_tokens_seen": 2485488, "step": 152, "train_runtime": 394.1859, "train_tokens_per_second": 6305.37 }, { "epoch": 0.5230769230769231, "grad_norm": 0.09123992174863815, "learning_rate": 0.00014939759036144577, "loss": 0.4008, "num_input_tokens_seen": 2501296, "step": 153, "train_runtime": 396.5327, "train_tokens_per_second": 6307.918 }, { "epoch": 0.5264957264957265, "grad_norm": 0.07104610651731491, "learning_rate": 0.00014905335628227195, "loss": 0.3379, "num_input_tokens_seen": 2529040, "step": 154, "train_runtime": 400.4284, "train_tokens_per_second": 6315.835 }, { "epoch": 0.5299145299145299, "grad_norm": 0.11433000862598419, "learning_rate": 0.0001487091222030981, "loss": 0.5056, "num_input_tokens_seen": 2544496, "step": 155, "train_runtime": 402.6965, "train_tokens_per_second": 6318.645 }, { "epoch": 0.5333333333333333, "grad_norm": 0.12911392748355865, "learning_rate": 0.0001483648881239243, "loss": 0.4726, "num_input_tokens_seen": 2558704, "step": 156, "train_runtime": 404.78, "train_tokens_per_second": 6321.221 }, { "epoch": 0.5367521367521367, "grad_norm": 0.11388979107141495, "learning_rate": 0.00014802065404475042, "loss": 0.44, "num_input_tokens_seen": 2571648, "step": 157, "train_runtime": 406.7058, "train_tokens_per_second": 6323.115 }, { "epoch": 0.5401709401709401, "grad_norm": 0.1020691767334938, "learning_rate": 0.0001476764199655766, "loss": 0.5144, "num_input_tokens_seen": 2585280, "step": 158, "train_runtime": 408.7686, "train_tokens_per_second": 6324.556 }, { "epoch": 0.5435897435897435, "grad_norm": 0.11266439408063889, "learning_rate": 0.00014733218588640275, "loss": 0.4898, "num_input_tokens_seen": 2602560, "step": 159, "train_runtime": 411.2897, "train_tokens_per_second": 6327.802 }, { "epoch": 0.5470085470085471, "grad_norm": 0.09511423856019974, "learning_rate": 0.00014698795180722893, "loss": 0.4601, "num_input_tokens_seen": 2617520, "step": 160, "train_runtime": 413.5019, "train_tokens_per_second": 6330.127 }, { "epoch": 0.5504273504273505, "grad_norm": 0.08593633025884628, "learning_rate": 0.0001466437177280551, "loss": 0.3578, "num_input_tokens_seen": 2638032, "step": 161, "train_runtime": 416.4729, "train_tokens_per_second": 6334.222 }, { "epoch": 0.5538461538461539, "grad_norm": 0.10547275096178055, "learning_rate": 0.00014629948364888124, "loss": 0.4053, "num_input_tokens_seen": 2652912, "step": 162, "train_runtime": 418.6689, "train_tokens_per_second": 6336.54 }, { "epoch": 0.5572649572649573, "grad_norm": 0.11780176311731339, "learning_rate": 0.0001459552495697074, "loss": 0.4034, "num_input_tokens_seen": 2664944, "step": 163, "train_runtime": 420.4837, "train_tokens_per_second": 6337.806 }, { "epoch": 0.5606837606837607, "grad_norm": 0.098305843770504, "learning_rate": 0.00014561101549053358, "loss": 0.4804, "num_input_tokens_seen": 2680720, "step": 164, "train_runtime": 422.8103, "train_tokens_per_second": 6340.243 }, { "epoch": 0.5641025641025641, "grad_norm": 0.08514019846916199, "learning_rate": 0.00014526678141135973, "loss": 0.4623, "num_input_tokens_seen": 2693696, "step": 165, "train_runtime": 424.733, "train_tokens_per_second": 6342.093 }, { "epoch": 0.5675213675213675, "grad_norm": 0.10156818479299545, "learning_rate": 0.0001449225473321859, "loss": 0.4374, "num_input_tokens_seen": 2706672, "step": 166, "train_runtime": 426.6739, "train_tokens_per_second": 6343.655 }, { "epoch": 0.5709401709401709, "grad_norm": 0.09817566722631454, "learning_rate": 0.00014457831325301204, "loss": 0.3713, "num_input_tokens_seen": 2717856, "step": 167, "train_runtime": 428.3605, "train_tokens_per_second": 6344.787 }, { "epoch": 0.5743589743589743, "grad_norm": 0.08898711949586868, "learning_rate": 0.00014423407917383822, "loss": 0.3958, "num_input_tokens_seen": 2738048, "step": 168, "train_runtime": 431.2652, "train_tokens_per_second": 6348.873 }, { "epoch": 0.5777777777777777, "grad_norm": 0.10815781354904175, "learning_rate": 0.00014388984509466438, "loss": 0.4212, "num_input_tokens_seen": 2751264, "step": 169, "train_runtime": 433.2567, "train_tokens_per_second": 6350.193 }, { "epoch": 0.5811965811965812, "grad_norm": 0.0858953520655632, "learning_rate": 0.00014354561101549053, "loss": 0.4252, "num_input_tokens_seen": 2768352, "step": 170, "train_runtime": 435.7397, "train_tokens_per_second": 6353.224 }, { "epoch": 0.5846153846153846, "grad_norm": 0.1065724790096283, "learning_rate": 0.0001432013769363167, "loss": 0.4376, "num_input_tokens_seen": 2783696, "step": 171, "train_runtime": 438.0174, "train_tokens_per_second": 6355.217 }, { "epoch": 0.588034188034188, "grad_norm": 0.0936359241604805, "learning_rate": 0.00014285714285714287, "loss": 0.4641, "num_input_tokens_seen": 2797712, "step": 172, "train_runtime": 440.1373, "train_tokens_per_second": 6356.452 }, { "epoch": 0.5914529914529915, "grad_norm": 0.10138653963804245, "learning_rate": 0.00014251290877796902, "loss": 0.4442, "num_input_tokens_seen": 2812432, "step": 173, "train_runtime": 442.3579, "train_tokens_per_second": 6357.821 }, { "epoch": 0.5948717948717949, "grad_norm": 0.10231815278530121, "learning_rate": 0.00014216867469879518, "loss": 0.4113, "num_input_tokens_seen": 2824544, "step": 174, "train_runtime": 444.2041, "train_tokens_per_second": 6358.663 }, { "epoch": 0.5982905982905983, "grad_norm": 0.10455156117677689, "learning_rate": 0.00014182444061962136, "loss": 0.5237, "num_input_tokens_seen": 2841296, "step": 175, "train_runtime": 446.6226, "train_tokens_per_second": 6361.738 }, { "epoch": 0.6017094017094017, "grad_norm": 0.09039057046175003, "learning_rate": 0.0001414802065404475, "loss": 0.4316, "num_input_tokens_seen": 2854304, "step": 176, "train_runtime": 448.5655, "train_tokens_per_second": 6363.182 }, { "epoch": 0.6051282051282051, "grad_norm": 0.09800916165113449, "learning_rate": 0.00014113597246127367, "loss": 0.4883, "num_input_tokens_seen": 2871312, "step": 177, "train_runtime": 451.0616, "train_tokens_per_second": 6365.676 }, { "epoch": 0.6051282051282051, "eval_loss": 0.4250277280807495, "eval_runtime": 11.8943, "eval_samples_per_second": 83.906, "eval_steps_per_second": 5.297, "num_input_tokens_seen": 2871312, "step": 177 }, { "epoch": 0.6085470085470085, "grad_norm": 0.1056000217795372, "learning_rate": 0.00014079173838209982, "loss": 0.3984, "num_input_tokens_seen": 2882896, "step": 178, "train_runtime": 464.7282, "train_tokens_per_second": 6203.403 }, { "epoch": 0.611965811965812, "grad_norm": 0.10022575408220291, "learning_rate": 0.000140447504302926, "loss": 0.3613, "num_input_tokens_seen": 2897328, "step": 179, "train_runtime": 466.8908, "train_tokens_per_second": 6205.58 }, { "epoch": 0.6153846153846154, "grad_norm": 0.10060451924800873, "learning_rate": 0.00014010327022375216, "loss": 0.505, "num_input_tokens_seen": 2910544, "step": 180, "train_runtime": 468.834, "train_tokens_per_second": 6208.049 }, { "epoch": 0.6188034188034188, "grad_norm": 0.10652410238981247, "learning_rate": 0.00013975903614457834, "loss": 0.456, "num_input_tokens_seen": 2921712, "step": 181, "train_runtime": 471.0911, "train_tokens_per_second": 6202.01 }, { "epoch": 0.6222222222222222, "grad_norm": 0.1084052249789238, "learning_rate": 0.00013941480206540447, "loss": 0.3833, "num_input_tokens_seen": 2932832, "step": 182, "train_runtime": 472.7877, "train_tokens_per_second": 6203.274 }, { "epoch": 0.6256410256410256, "grad_norm": 0.09704000502824783, "learning_rate": 0.00013907056798623065, "loss": 0.4889, "num_input_tokens_seen": 2947600, "step": 183, "train_runtime": 474.9298, "train_tokens_per_second": 6206.391 }, { "epoch": 0.629059829059829, "grad_norm": 0.09996459633111954, "learning_rate": 0.0001387263339070568, "loss": 0.3787, "num_input_tokens_seen": 2963088, "step": 184, "train_runtime": 477.2542, "train_tokens_per_second": 6208.616 }, { "epoch": 0.6324786324786325, "grad_norm": 0.09264053404331207, "learning_rate": 0.00013838209982788298, "loss": 0.3498, "num_input_tokens_seen": 2975088, "step": 185, "train_runtime": 479.0775, "train_tokens_per_second": 6210.035 }, { "epoch": 0.6358974358974359, "grad_norm": 0.09588699042797089, "learning_rate": 0.00013803786574870914, "loss": 0.485, "num_input_tokens_seen": 2988944, "step": 186, "train_runtime": 481.1581, "train_tokens_per_second": 6211.978 }, { "epoch": 0.6393162393162393, "grad_norm": 0.09032841771841049, "learning_rate": 0.0001376936316695353, "loss": 0.4083, "num_input_tokens_seen": 3006016, "step": 187, "train_runtime": 483.6506, "train_tokens_per_second": 6215.264 }, { "epoch": 0.6427350427350428, "grad_norm": 0.11055252701044083, "learning_rate": 0.00013734939759036145, "loss": 0.4339, "num_input_tokens_seen": 3018096, "step": 188, "train_runtime": 485.4309, "train_tokens_per_second": 6217.355 }, { "epoch": 0.6461538461538462, "grad_norm": 0.12127861380577087, "learning_rate": 0.00013700516351118763, "loss": 0.4601, "num_input_tokens_seen": 3031280, "step": 189, "train_runtime": 487.4282, "train_tokens_per_second": 6218.926 }, { "epoch": 0.6495726495726496, "grad_norm": 0.10579859465360641, "learning_rate": 0.00013666092943201378, "loss": 0.4519, "num_input_tokens_seen": 3046560, "step": 190, "train_runtime": 489.6819, "train_tokens_per_second": 6221.508 }, { "epoch": 0.652991452991453, "grad_norm": 0.1086781919002533, "learning_rate": 0.00013631669535283994, "loss": 0.4843, "num_input_tokens_seen": 3061024, "step": 191, "train_runtime": 491.8462, "train_tokens_per_second": 6223.539 }, { "epoch": 0.6564102564102564, "grad_norm": 0.09214667230844498, "learning_rate": 0.0001359724612736661, "loss": 0.43, "num_input_tokens_seen": 3076848, "step": 192, "train_runtime": 494.2062, "train_tokens_per_second": 6225.839 }, { "epoch": 0.6598290598290598, "grad_norm": 0.11928390711545944, "learning_rate": 0.00013562822719449227, "loss": 0.5062, "num_input_tokens_seen": 3092208, "step": 193, "train_runtime": 496.4458, "train_tokens_per_second": 6228.692 }, { "epoch": 0.6632478632478632, "grad_norm": 0.09398146718740463, "learning_rate": 0.00013528399311531843, "loss": 0.372, "num_input_tokens_seen": 3103168, "step": 194, "train_runtime": 498.1054, "train_tokens_per_second": 6229.943 }, { "epoch": 0.6666666666666666, "grad_norm": 0.08932854235172272, "learning_rate": 0.00013493975903614458, "loss": 0.4515, "num_input_tokens_seen": 3120512, "step": 195, "train_runtime": 500.6536, "train_tokens_per_second": 6232.877 }, { "epoch": 0.67008547008547, "grad_norm": 0.09448716044425964, "learning_rate": 0.00013459552495697074, "loss": 0.4346, "num_input_tokens_seen": 3136544, "step": 196, "train_runtime": 503.0211, "train_tokens_per_second": 6235.412 }, { "epoch": 0.6735042735042736, "grad_norm": 0.09740068763494492, "learning_rate": 0.00013425129087779692, "loss": 0.3846, "num_input_tokens_seen": 3152720, "step": 197, "train_runtime": 505.3917, "train_tokens_per_second": 6238.172 }, { "epoch": 0.676923076923077, "grad_norm": 0.10378974676132202, "learning_rate": 0.00013390705679862307, "loss": 0.4808, "num_input_tokens_seen": 3167392, "step": 198, "train_runtime": 507.5697, "train_tokens_per_second": 6240.31 }, { "epoch": 0.6803418803418804, "grad_norm": 0.08869824558496475, "learning_rate": 0.00013356282271944923, "loss": 0.387, "num_input_tokens_seen": 3186496, "step": 199, "train_runtime": 510.3483, "train_tokens_per_second": 6243.767 }, { "epoch": 0.6837606837606838, "grad_norm": 0.09974192827939987, "learning_rate": 0.00013321858864027538, "loss": 0.4512, "num_input_tokens_seen": 3205344, "step": 200, "train_runtime": 513.0801, "train_tokens_per_second": 6247.259 }, { "epoch": 0.6871794871794872, "grad_norm": 0.08839447796344757, "learning_rate": 0.00013287435456110156, "loss": 0.4027, "num_input_tokens_seen": 3222720, "step": 201, "train_runtime": 515.6265, "train_tokens_per_second": 6250.106 }, { "epoch": 0.6905982905982906, "grad_norm": 0.07892576605081558, "learning_rate": 0.00013253012048192772, "loss": 0.3836, "num_input_tokens_seen": 3247392, "step": 202, "train_runtime": 519.1427, "train_tokens_per_second": 6255.297 }, { "epoch": 0.694017094017094, "grad_norm": 0.09967231005430222, "learning_rate": 0.0001321858864027539, "loss": 0.6602, "num_input_tokens_seen": 3263344, "step": 203, "train_runtime": 521.4876, "train_tokens_per_second": 6257.76 }, { "epoch": 0.6974358974358974, "grad_norm": 0.09928127378225327, "learning_rate": 0.00013184165232358003, "loss": 0.3557, "num_input_tokens_seen": 3275472, "step": 204, "train_runtime": 523.3642, "train_tokens_per_second": 6258.494 }, { "epoch": 0.7008547008547008, "grad_norm": 0.10789816826581955, "learning_rate": 0.0001314974182444062, "loss": 0.3937, "num_input_tokens_seen": 3293904, "step": 205, "train_runtime": 526.0362, "train_tokens_per_second": 6261.744 }, { "epoch": 0.7042735042735043, "grad_norm": 0.10802796483039856, "learning_rate": 0.00013115318416523236, "loss": 0.4472, "num_input_tokens_seen": 3309584, "step": 206, "train_runtime": 528.3293, "train_tokens_per_second": 6264.245 }, { "epoch": 0.7076923076923077, "grad_norm": 0.09764997661113739, "learning_rate": 0.00013080895008605854, "loss": 0.457, "num_input_tokens_seen": 3323776, "step": 207, "train_runtime": 530.4461, "train_tokens_per_second": 6266.002 }, { "epoch": 0.7111111111111111, "grad_norm": 0.10141371190547943, "learning_rate": 0.00013046471600688467, "loss": 0.4036, "num_input_tokens_seen": 3339600, "step": 208, "train_runtime": 532.7571, "train_tokens_per_second": 6268.523 }, { "epoch": 0.7145299145299145, "grad_norm": 0.11183507740497589, "learning_rate": 0.00013012048192771085, "loss": 0.4412, "num_input_tokens_seen": 3353280, "step": 209, "train_runtime": 534.8217, "train_tokens_per_second": 6269.902 }, { "epoch": 0.717948717948718, "grad_norm": 0.1051330491900444, "learning_rate": 0.000129776247848537, "loss": 0.4337, "num_input_tokens_seen": 3369296, "step": 210, "train_runtime": 537.1671, "train_tokens_per_second": 6272.342 }, { "epoch": 0.7213675213675214, "grad_norm": 0.10551027208566666, "learning_rate": 0.0001294320137693632, "loss": 0.4042, "num_input_tokens_seen": 3384000, "step": 211, "train_runtime": 539.924, "train_tokens_per_second": 6267.548 }, { "epoch": 0.7247863247863248, "grad_norm": 0.10018742829561234, "learning_rate": 0.00012908777969018932, "loss": 0.4694, "num_input_tokens_seen": 3399088, "step": 212, "train_runtime": 542.1589, "train_tokens_per_second": 6269.542 }, { "epoch": 0.7282051282051282, "grad_norm": 0.12323636561632156, "learning_rate": 0.0001287435456110155, "loss": 0.4411, "num_input_tokens_seen": 3411392, "step": 213, "train_runtime": 544.0078, "train_tokens_per_second": 6270.851 }, { "epoch": 0.7316239316239316, "grad_norm": 0.11548493057489395, "learning_rate": 0.00012839931153184165, "loss": 0.5167, "num_input_tokens_seen": 3428416, "step": 214, "train_runtime": 546.4748, "train_tokens_per_second": 6273.695 }, { "epoch": 0.7350427350427351, "grad_norm": 0.0862911120057106, "learning_rate": 0.00012805507745266783, "loss": 0.3712, "num_input_tokens_seen": 3459568, "step": 215, "train_runtime": 553.9819, "train_tokens_per_second": 6244.912 }, { "epoch": 0.7384615384615385, "grad_norm": 0.1001635193824768, "learning_rate": 0.00012771084337349396, "loss": 0.394, "num_input_tokens_seen": 3474128, "step": 216, "train_runtime": 556.1513, "train_tokens_per_second": 6246.732 }, { "epoch": 0.7418803418803419, "grad_norm": 0.10096625983715057, "learning_rate": 0.00012736660929432014, "loss": 0.4354, "num_input_tokens_seen": 3488032, "step": 217, "train_runtime": 558.2102, "train_tokens_per_second": 6248.6 }, { "epoch": 0.7452991452991453, "grad_norm": 0.10238556563854218, "learning_rate": 0.0001270223752151463, "loss": 0.4276, "num_input_tokens_seen": 3504688, "step": 218, "train_runtime": 560.6522, "train_tokens_per_second": 6251.091 }, { "epoch": 0.7487179487179487, "grad_norm": 0.09864645451307297, "learning_rate": 0.00012667814113597248, "loss": 0.4098, "num_input_tokens_seen": 3521088, "step": 219, "train_runtime": 563.1091, "train_tokens_per_second": 6252.941 }, { "epoch": 0.7521367521367521, "grad_norm": 0.10077870637178421, "learning_rate": 0.00012633390705679863, "loss": 0.4802, "num_input_tokens_seen": 3537040, "step": 220, "train_runtime": 565.4347, "train_tokens_per_second": 6255.435 }, { "epoch": 0.7555555555555555, "grad_norm": 0.10053377598524094, "learning_rate": 0.0001259896729776248, "loss": 0.4794, "num_input_tokens_seen": 3551456, "step": 221, "train_runtime": 567.5603, "train_tokens_per_second": 6257.407 }, { "epoch": 0.7589743589743589, "grad_norm": 0.10047437995672226, "learning_rate": 0.00012564543889845094, "loss": 0.4938, "num_input_tokens_seen": 3567616, "step": 222, "train_runtime": 569.9285, "train_tokens_per_second": 6259.761 }, { "epoch": 0.7623931623931623, "grad_norm": 0.07970099151134491, "learning_rate": 0.00012530120481927712, "loss": 0.3474, "num_input_tokens_seen": 3588144, "step": 223, "train_runtime": 572.8933, "train_tokens_per_second": 6263.198 }, { "epoch": 0.7658119658119659, "grad_norm": 0.10995665192604065, "learning_rate": 0.00012495697074010328, "loss": 0.3795, "num_input_tokens_seen": 3600144, "step": 224, "train_runtime": 574.6969, "train_tokens_per_second": 6264.422 }, { "epoch": 0.7692307692307693, "grad_norm": 0.12067970633506775, "learning_rate": 0.00012461273666092943, "loss": 0.4804, "num_input_tokens_seen": 3621280, "step": 225, "train_runtime": 577.7205, "train_tokens_per_second": 6268.222 }, { "epoch": 0.7726495726495727, "grad_norm": 0.11939004063606262, "learning_rate": 0.0001242685025817556, "loss": 0.4533, "num_input_tokens_seen": 3634160, "step": 226, "train_runtime": 579.6747, "train_tokens_per_second": 6269.31 }, { "epoch": 0.7760683760683761, "grad_norm": 0.10946697741746902, "learning_rate": 0.00012392426850258177, "loss": 0.4324, "num_input_tokens_seen": 3645536, "step": 227, "train_runtime": 581.3907, "train_tokens_per_second": 6270.372 }, { "epoch": 0.7794871794871795, "grad_norm": 0.09853693842887878, "learning_rate": 0.00012358003442340792, "loss": 0.4728, "num_input_tokens_seen": 3660048, "step": 228, "train_runtime": 583.5443, "train_tokens_per_second": 6272.1 }, { "epoch": 0.7829059829059829, "grad_norm": 0.1062566265463829, "learning_rate": 0.00012323580034423408, "loss": 0.5393, "num_input_tokens_seen": 3672816, "step": 229, "train_runtime": 585.4621, "train_tokens_per_second": 6273.363 }, { "epoch": 0.7863247863247863, "grad_norm": 0.09363020956516266, "learning_rate": 0.00012289156626506023, "loss": 0.4152, "num_input_tokens_seen": 3696128, "step": 230, "train_runtime": 588.8137, "train_tokens_per_second": 6277.245 }, { "epoch": 0.7897435897435897, "grad_norm": 0.09704622626304626, "learning_rate": 0.00012254733218588641, "loss": 0.5139, "num_input_tokens_seen": 3710160, "step": 231, "train_runtime": 590.8993, "train_tokens_per_second": 6278.836 }, { "epoch": 0.7931623931623931, "grad_norm": 0.09564655274152756, "learning_rate": 0.00012220309810671257, "loss": 0.4335, "num_input_tokens_seen": 3723536, "step": 232, "train_runtime": 592.9271, "train_tokens_per_second": 6279.922 }, { "epoch": 0.7965811965811965, "grad_norm": 0.08687002956867218, "learning_rate": 0.00012185886402753872, "loss": 0.3445, "num_input_tokens_seen": 3738592, "step": 233, "train_runtime": 595.173, "train_tokens_per_second": 6281.522 }, { "epoch": 0.8, "grad_norm": 0.09096026420593262, "learning_rate": 0.00012151462994836489, "loss": 0.5372, "num_input_tokens_seen": 3755936, "step": 234, "train_runtime": 597.7017, "train_tokens_per_second": 6283.964 }, { "epoch": 0.8034188034188035, "grad_norm": 0.09353629499673843, "learning_rate": 0.00012117039586919106, "loss": 0.3614, "num_input_tokens_seen": 3770768, "step": 235, "train_runtime": 599.8797, "train_tokens_per_second": 6285.873 }, { "epoch": 0.8068376068376069, "grad_norm": 0.0944899320602417, "learning_rate": 0.00012082616179001723, "loss": 0.3849, "num_input_tokens_seen": 3795312, "step": 236, "train_runtime": 603.3944, "train_tokens_per_second": 6289.935 }, { "epoch": 0.8068376068376069, "eval_loss": 0.42357537150382996, "eval_runtime": 11.8678, "eval_samples_per_second": 84.093, "eval_steps_per_second": 5.308, "num_input_tokens_seen": 3795312, "step": 236 }, { "epoch": 0.8102564102564103, "grad_norm": 0.10128959268331528, "learning_rate": 0.0001204819277108434, "loss": 0.4026, "num_input_tokens_seen": 3806656, "step": 237, "train_runtime": 616.9818, "train_tokens_per_second": 6169.803 }, { "epoch": 0.8136752136752137, "grad_norm": 0.09387616068124771, "learning_rate": 0.00012013769363166954, "loss": 0.4182, "num_input_tokens_seen": 3822144, "step": 238, "train_runtime": 619.269, "train_tokens_per_second": 6172.026 }, { "epoch": 0.8170940170940171, "grad_norm": 0.09902401268482208, "learning_rate": 0.0001197934595524957, "loss": 0.4232, "num_input_tokens_seen": 3842016, "step": 239, "train_runtime": 622.1266, "train_tokens_per_second": 6175.617 }, { "epoch": 0.8205128205128205, "grad_norm": 0.09925245493650436, "learning_rate": 0.00011944922547332187, "loss": 0.4478, "num_input_tokens_seen": 3854752, "step": 240, "train_runtime": 624.0402, "train_tokens_per_second": 6177.089 }, { "epoch": 0.8239316239316239, "grad_norm": 0.11560021340847015, "learning_rate": 0.00011910499139414804, "loss": 0.4808, "num_input_tokens_seen": 3866496, "step": 241, "train_runtime": 626.2473, "train_tokens_per_second": 6174.072 }, { "epoch": 0.8273504273504273, "grad_norm": 0.08798137307167053, "learning_rate": 0.00011876075731497418, "loss": 0.4486, "num_input_tokens_seen": 3885600, "step": 242, "train_runtime": 629.0654, "train_tokens_per_second": 6176.782 }, { "epoch": 0.8307692307692308, "grad_norm": 0.09302930533885956, "learning_rate": 0.00011841652323580035, "loss": 0.436, "num_input_tokens_seen": 3905008, "step": 243, "train_runtime": 631.8771, "train_tokens_per_second": 6180.012 }, { "epoch": 0.8341880341880342, "grad_norm": 0.1044159084558487, "learning_rate": 0.00011807228915662652, "loss": 0.4986, "num_input_tokens_seen": 3917472, "step": 244, "train_runtime": 633.7768, "train_tokens_per_second": 6181.154 }, { "epoch": 0.8376068376068376, "grad_norm": 0.10373450815677643, "learning_rate": 0.00011772805507745268, "loss": 0.5037, "num_input_tokens_seen": 3933664, "step": 245, "train_runtime": 636.199, "train_tokens_per_second": 6183.072 }, { "epoch": 0.841025641025641, "grad_norm": 0.08972188085317612, "learning_rate": 0.00011738382099827883, "loss": 0.4908, "num_input_tokens_seen": 3952288, "step": 246, "train_runtime": 638.8866, "train_tokens_per_second": 6186.212 }, { "epoch": 0.8444444444444444, "grad_norm": 0.0838053897023201, "learning_rate": 0.000117039586919105, "loss": 0.3793, "num_input_tokens_seen": 3970672, "step": 247, "train_runtime": 641.5476, "train_tokens_per_second": 6189.209 }, { "epoch": 0.8478632478632478, "grad_norm": 0.06703872978687286, "learning_rate": 0.00011669535283993116, "loss": 0.3059, "num_input_tokens_seen": 3999184, "step": 248, "train_runtime": 645.5767, "train_tokens_per_second": 6194.747 }, { "epoch": 0.8512820512820513, "grad_norm": 0.08314735442399979, "learning_rate": 0.00011635111876075733, "loss": 0.4058, "num_input_tokens_seen": 4013280, "step": 249, "train_runtime": 647.6748, "train_tokens_per_second": 6196.443 }, { "epoch": 0.8547008547008547, "grad_norm": 0.08154241740703583, "learning_rate": 0.00011600688468158347, "loss": 0.3805, "num_input_tokens_seen": 4031920, "step": 250, "train_runtime": 650.4038, "train_tokens_per_second": 6199.102 }, { "epoch": 0.8581196581196581, "grad_norm": 0.09133270382881165, "learning_rate": 0.00011566265060240964, "loss": 0.3681, "num_input_tokens_seen": 4053744, "step": 251, "train_runtime": 653.5797, "train_tokens_per_second": 6202.371 }, { "epoch": 0.8615384615384616, "grad_norm": 0.10926900058984756, "learning_rate": 0.0001153184165232358, "loss": 0.4441, "num_input_tokens_seen": 4065536, "step": 252, "train_runtime": 655.3821, "train_tokens_per_second": 6203.307 }, { "epoch": 0.864957264957265, "grad_norm": 0.08510483056306839, "learning_rate": 0.00011497418244406197, "loss": 0.4944, "num_input_tokens_seen": 4083376, "step": 253, "train_runtime": 657.9531, "train_tokens_per_second": 6206.181 }, { "epoch": 0.8683760683760684, "grad_norm": 0.09709641337394714, "learning_rate": 0.00011462994836488814, "loss": 0.481, "num_input_tokens_seen": 4098848, "step": 254, "train_runtime": 660.2372, "train_tokens_per_second": 6208.145 }, { "epoch": 0.8717948717948718, "grad_norm": 0.08926745504140854, "learning_rate": 0.00011428571428571428, "loss": 0.4043, "num_input_tokens_seen": 4113904, "step": 255, "train_runtime": 662.4724, "train_tokens_per_second": 6209.925 }, { "epoch": 0.8752136752136752, "grad_norm": 0.09374278038740158, "learning_rate": 0.00011394148020654045, "loss": 0.4502, "num_input_tokens_seen": 4131168, "step": 256, "train_runtime": 664.9653, "train_tokens_per_second": 6212.607 }, { "epoch": 0.8786324786324786, "grad_norm": 0.09459812939167023, "learning_rate": 0.00011359724612736662, "loss": 0.4439, "num_input_tokens_seen": 4149904, "step": 257, "train_runtime": 667.6682, "train_tokens_per_second": 6215.519 }, { "epoch": 0.882051282051282, "grad_norm": 0.1052205041050911, "learning_rate": 0.00011325301204819279, "loss": 0.4385, "num_input_tokens_seen": 4166832, "step": 258, "train_runtime": 670.0958, "train_tokens_per_second": 6218.263 }, { "epoch": 0.8854700854700854, "grad_norm": 0.09694038331508636, "learning_rate": 0.00011290877796901893, "loss": 0.375, "num_input_tokens_seen": 4184976, "step": 259, "train_runtime": 672.74, "train_tokens_per_second": 6220.793 }, { "epoch": 0.8888888888888888, "grad_norm": 0.11208639293909073, "learning_rate": 0.0001125645438898451, "loss": 0.4517, "num_input_tokens_seen": 4199888, "step": 260, "train_runtime": 674.9288, "train_tokens_per_second": 6222.713 }, { "epoch": 0.8923076923076924, "grad_norm": 0.09207024425268173, "learning_rate": 0.00011222030981067126, "loss": 0.4132, "num_input_tokens_seen": 4215664, "step": 261, "train_runtime": 677.2813, "train_tokens_per_second": 6224.392 }, { "epoch": 0.8957264957264958, "grad_norm": 0.0904022753238678, "learning_rate": 0.00011187607573149743, "loss": 0.3322, "num_input_tokens_seen": 4230080, "step": 262, "train_runtime": 679.4101, "train_tokens_per_second": 6226.107 }, { "epoch": 0.8991452991452992, "grad_norm": 0.12087982147932053, "learning_rate": 0.00011153184165232357, "loss": 0.4281, "num_input_tokens_seen": 4241440, "step": 263, "train_runtime": 681.1509, "train_tokens_per_second": 6226.873 }, { "epoch": 0.9025641025641026, "grad_norm": 0.12484072893857956, "learning_rate": 0.00011118760757314974, "loss": 0.5186, "num_input_tokens_seen": 4252976, "step": 264, "train_runtime": 682.9063, "train_tokens_per_second": 6227.759 }, { "epoch": 0.905982905982906, "grad_norm": 0.08252517133951187, "learning_rate": 0.00011084337349397591, "loss": 0.4049, "num_input_tokens_seen": 4269312, "step": 265, "train_runtime": 685.2856, "train_tokens_per_second": 6229.975 }, { "epoch": 0.9094017094017094, "grad_norm": 0.11546450853347778, "learning_rate": 0.00011049913941480208, "loss": 0.4628, "num_input_tokens_seen": 4284544, "step": 266, "train_runtime": 687.5331, "train_tokens_per_second": 6231.764 }, { "epoch": 0.9128205128205128, "grad_norm": 0.11925678700208664, "learning_rate": 0.00011015490533562822, "loss": 0.4275, "num_input_tokens_seen": 4296208, "step": 267, "train_runtime": 689.3281, "train_tokens_per_second": 6232.457 }, { "epoch": 0.9162393162393162, "grad_norm": 0.09587883204221725, "learning_rate": 0.00010981067125645439, "loss": 0.4098, "num_input_tokens_seen": 4313872, "step": 268, "train_runtime": 691.9285, "train_tokens_per_second": 6234.563 }, { "epoch": 0.9196581196581196, "grad_norm": 0.08406773209571838, "learning_rate": 0.00010946643717728055, "loss": 0.3972, "num_input_tokens_seen": 4335664, "step": 269, "train_runtime": 695.0743, "train_tokens_per_second": 6237.699 }, { "epoch": 0.9230769230769231, "grad_norm": 0.1020239070057869, "learning_rate": 0.00010912220309810672, "loss": 0.3777, "num_input_tokens_seen": 4353360, "step": 270, "train_runtime": 697.6355, "train_tokens_per_second": 6240.165 }, { "epoch": 0.9264957264957265, "grad_norm": 0.11209993064403534, "learning_rate": 0.00010877796901893289, "loss": 0.4114, "num_input_tokens_seen": 4374544, "step": 271, "train_runtime": 701.2128, "train_tokens_per_second": 6238.54 }, { "epoch": 0.9299145299145299, "grad_norm": 0.11567652225494385, "learning_rate": 0.00010843373493975903, "loss": 0.4051, "num_input_tokens_seen": 4391456, "step": 272, "train_runtime": 703.6794, "train_tokens_per_second": 6240.706 }, { "epoch": 0.9333333333333333, "grad_norm": 0.11092627048492432, "learning_rate": 0.0001080895008605852, "loss": 0.4194, "num_input_tokens_seen": 4404608, "step": 273, "train_runtime": 705.6779, "train_tokens_per_second": 6241.669 }, { "epoch": 0.9367521367521368, "grad_norm": 0.10917766392230988, "learning_rate": 0.00010774526678141137, "loss": 0.4475, "num_input_tokens_seen": 4416592, "step": 274, "train_runtime": 707.4805, "train_tokens_per_second": 6242.705 }, { "epoch": 0.9401709401709402, "grad_norm": 0.09348605573177338, "learning_rate": 0.00010740103270223754, "loss": 0.4913, "num_input_tokens_seen": 4433728, "step": 275, "train_runtime": 709.9546, "train_tokens_per_second": 6245.086 }, { "epoch": 0.9435897435897436, "grad_norm": 0.10354448109865189, "learning_rate": 0.00010705679862306368, "loss": 0.4018, "num_input_tokens_seen": 4448224, "step": 276, "train_runtime": 712.1021, "train_tokens_per_second": 6246.61 }, { "epoch": 0.947008547008547, "grad_norm": 0.09892738610506058, "learning_rate": 0.00010671256454388984, "loss": 0.4477, "num_input_tokens_seen": 4467024, "step": 277, "train_runtime": 714.8588, "train_tokens_per_second": 6248.82 }, { "epoch": 0.9504273504273504, "grad_norm": 0.11075231432914734, "learning_rate": 0.00010636833046471601, "loss": 0.3678, "num_input_tokens_seen": 4481232, "step": 278, "train_runtime": 716.9881, "train_tokens_per_second": 6250.078 }, { "epoch": 0.9538461538461539, "grad_norm": 0.10120780020952225, "learning_rate": 0.00010602409638554218, "loss": 0.4281, "num_input_tokens_seen": 4500528, "step": 279, "train_runtime": 719.7698, "train_tokens_per_second": 6252.733 }, { "epoch": 0.9572649572649573, "grad_norm": 0.09937260299921036, "learning_rate": 0.00010567986230636832, "loss": 0.3882, "num_input_tokens_seen": 4525136, "step": 280, "train_runtime": 723.3072, "train_tokens_per_second": 6256.175 }, { "epoch": 0.9606837606837607, "grad_norm": 0.08478062599897385, "learning_rate": 0.00010533562822719449, "loss": 0.3849, "num_input_tokens_seen": 4541200, "step": 281, "train_runtime": 725.6747, "train_tokens_per_second": 6257.9 }, { "epoch": 0.9641025641025641, "grad_norm": 0.09681829810142517, "learning_rate": 0.00010499139414802066, "loss": 0.3051, "num_input_tokens_seen": 4578816, "step": 282, "train_runtime": 731.2044, "train_tokens_per_second": 6262.019 }, { "epoch": 0.9675213675213675, "grad_norm": 0.09028521925210953, "learning_rate": 0.00010464716006884682, "loss": 0.4796, "num_input_tokens_seen": 4596608, "step": 283, "train_runtime": 733.7729, "train_tokens_per_second": 6264.347 }, { "epoch": 0.9709401709401709, "grad_norm": 0.09063593298196793, "learning_rate": 0.00010430292598967298, "loss": 0.347, "num_input_tokens_seen": 4607632, "step": 284, "train_runtime": 735.4673, "train_tokens_per_second": 6264.904 }, { "epoch": 0.9743589743589743, "grad_norm": 0.09063643962144852, "learning_rate": 0.00010395869191049913, "loss": 0.2912, "num_input_tokens_seen": 4631200, "step": 285, "train_runtime": 738.8336, "train_tokens_per_second": 6268.258 }, { "epoch": 0.9777777777777777, "grad_norm": 0.11136946082115173, "learning_rate": 0.0001036144578313253, "loss": 0.4875, "num_input_tokens_seen": 4645856, "step": 286, "train_runtime": 741.0112, "train_tokens_per_second": 6269.616 }, { "epoch": 0.9811965811965812, "grad_norm": 0.09543482214212418, "learning_rate": 0.00010327022375215147, "loss": 0.4009, "num_input_tokens_seen": 4662528, "step": 287, "train_runtime": 743.4774, "train_tokens_per_second": 6271.244 }, { "epoch": 0.9846153846153847, "grad_norm": 0.11340586096048355, "learning_rate": 0.00010292598967297764, "loss": 0.4523, "num_input_tokens_seen": 4677744, "step": 288, "train_runtime": 745.7291, "train_tokens_per_second": 6272.712 }, { "epoch": 0.9880341880341881, "grad_norm": 0.09249569475650787, "learning_rate": 0.00010258175559380379, "loss": 0.3638, "num_input_tokens_seen": 4694512, "step": 289, "train_runtime": 748.2102, "train_tokens_per_second": 6274.323 }, { "epoch": 0.9914529914529915, "grad_norm": 0.11417587846517563, "learning_rate": 0.00010223752151462995, "loss": 0.513, "num_input_tokens_seen": 4710224, "step": 290, "train_runtime": 750.5071, "train_tokens_per_second": 6276.055 }, { "epoch": 0.9948717948717949, "grad_norm": 0.09056784212589264, "learning_rate": 0.00010189328743545611, "loss": 0.4324, "num_input_tokens_seen": 4727296, "step": 291, "train_runtime": 752.9922, "train_tokens_per_second": 6278.014 }, { "epoch": 0.9982905982905983, "grad_norm": 0.09821169078350067, "learning_rate": 0.00010154905335628228, "loss": 0.3605, "num_input_tokens_seen": 4741520, "step": 292, "train_runtime": 755.0666, "train_tokens_per_second": 6279.605 }, { "epoch": 1.0, "grad_norm": 0.13449996709823608, "learning_rate": 0.00010120481927710844, "loss": 0.3949, "num_input_tokens_seen": 4751278, "step": 293, "train_runtime": 756.491, "train_tokens_per_second": 6280.68 }, { "epoch": 1.0034188034188034, "grad_norm": 0.09440767765045166, "learning_rate": 0.0001008605851979346, "loss": 0.3857, "num_input_tokens_seen": 4764718, "step": 294, "train_runtime": 758.5245, "train_tokens_per_second": 6281.561 }, { "epoch": 1.0068376068376068, "grad_norm": 0.08331061899662018, "learning_rate": 0.00010051635111876076, "loss": 0.3654, "num_input_tokens_seen": 4782670, "step": 295, "train_runtime": 761.0921, "train_tokens_per_second": 6283.957 }, { "epoch": 1.0068376068376068, "eval_loss": 0.421943724155426, "eval_runtime": 11.8792, "eval_samples_per_second": 84.013, "eval_steps_per_second": 5.303, "num_input_tokens_seen": 4782670, "step": 295 }, { "epoch": 1.0102564102564102, "grad_norm": 0.09061148762702942, "learning_rate": 0.00010017211703958693, "loss": 0.3673, "num_input_tokens_seen": 4795310, "step": 296, "train_runtime": 774.907, "train_tokens_per_second": 6188.239 }, { "epoch": 1.0136752136752136, "grad_norm": 0.09946513175964355, "learning_rate": 9.982788296041308e-05, "loss": 0.3978, "num_input_tokens_seen": 4810798, "step": 297, "train_runtime": 777.235, "train_tokens_per_second": 6189.631 }, { "epoch": 1.017094017094017, "grad_norm": 0.10077892988920212, "learning_rate": 9.948364888123925e-05, "loss": 0.3721, "num_input_tokens_seen": 4821918, "step": 298, "train_runtime": 778.9429, "train_tokens_per_second": 6190.336 }, { "epoch": 1.0205128205128204, "grad_norm": 0.09540440887212753, "learning_rate": 9.91394148020654e-05, "loss": 0.4804, "num_input_tokens_seen": 4839806, "step": 299, "train_runtime": 781.5496, "train_tokens_per_second": 6192.577 }, { "epoch": 1.0239316239316238, "grad_norm": 0.09200432151556015, "learning_rate": 9.879518072289157e-05, "loss": 0.4185, "num_input_tokens_seen": 4855374, "step": 300, "train_runtime": 783.8509, "train_tokens_per_second": 6194.257 }, { "epoch": 1.0273504273504273, "grad_norm": 0.09225641936063766, "learning_rate": 9.845094664371774e-05, "loss": 0.3448, "num_input_tokens_seen": 4875646, "step": 301, "train_runtime": 787.3218, "train_tokens_per_second": 6192.698 }, { "epoch": 1.0307692307692307, "grad_norm": 0.09093517065048218, "learning_rate": 9.81067125645439e-05, "loss": 0.3735, "num_input_tokens_seen": 4889006, "step": 302, "train_runtime": 789.3263, "train_tokens_per_second": 6193.897 }, { "epoch": 1.0341880341880343, "grad_norm": 0.1052882969379425, "learning_rate": 9.776247848537006e-05, "loss": 0.4364, "num_input_tokens_seen": 4902686, "step": 303, "train_runtime": 791.403, "train_tokens_per_second": 6194.93 }, { "epoch": 1.0376068376068377, "grad_norm": 0.09175313264131546, "learning_rate": 9.741824440619622e-05, "loss": 0.4034, "num_input_tokens_seen": 4922078, "step": 304, "train_runtime": 794.1808, "train_tokens_per_second": 6197.679 }, { "epoch": 1.041025641025641, "grad_norm": 0.09906546771526337, "learning_rate": 9.707401032702239e-05, "loss": 0.448, "num_input_tokens_seen": 4943358, "step": 305, "train_runtime": 797.2477, "train_tokens_per_second": 6200.53 }, { "epoch": 1.0444444444444445, "grad_norm": 0.10816071182489395, "learning_rate": 9.672977624784855e-05, "loss": 0.3971, "num_input_tokens_seen": 4956078, "step": 306, "train_runtime": 799.1676, "train_tokens_per_second": 6201.55 }, { "epoch": 1.047863247863248, "grad_norm": 0.09161638468503952, "learning_rate": 9.638554216867471e-05, "loss": 0.3514, "num_input_tokens_seen": 4981710, "step": 307, "train_runtime": 802.8012, "train_tokens_per_second": 6205.409 }, { "epoch": 1.0512820512820513, "grad_norm": 0.09889056533575058, "learning_rate": 9.604130808950088e-05, "loss": 0.3105, "num_input_tokens_seen": 5001214, "step": 308, "train_runtime": 805.5994, "train_tokens_per_second": 6208.066 }, { "epoch": 1.0547008547008547, "grad_norm": 0.1137273982167244, "learning_rate": 9.569707401032703e-05, "loss": 0.3571, "num_input_tokens_seen": 5017694, "step": 309, "train_runtime": 808.0045, "train_tokens_per_second": 6209.982 }, { "epoch": 1.0581196581196581, "grad_norm": 0.09778351336717606, "learning_rate": 9.53528399311532e-05, "loss": 0.3879, "num_input_tokens_seen": 5035758, "step": 310, "train_runtime": 810.6114, "train_tokens_per_second": 6212.296 }, { "epoch": 1.0615384615384615, "grad_norm": 0.1118144690990448, "learning_rate": 9.500860585197935e-05, "loss": 0.3965, "num_input_tokens_seen": 5052750, "step": 311, "train_runtime": 813.0944, "train_tokens_per_second": 6214.223 }, { "epoch": 1.064957264957265, "grad_norm": 0.11538024991750717, "learning_rate": 9.466437177280552e-05, "loss": 0.4422, "num_input_tokens_seen": 5067630, "step": 312, "train_runtime": 815.286, "train_tokens_per_second": 6215.77 }, { "epoch": 1.0683760683760684, "grad_norm": 0.10927511751651764, "learning_rate": 9.432013769363168e-05, "loss": 0.4174, "num_input_tokens_seen": 5083150, "step": 313, "train_runtime": 817.5852, "train_tokens_per_second": 6217.272 }, { "epoch": 1.0717948717948718, "grad_norm": 0.10767415165901184, "learning_rate": 9.397590361445784e-05, "loss": 0.3619, "num_input_tokens_seen": 5104078, "step": 314, "train_runtime": 820.6095, "train_tokens_per_second": 6219.862 }, { "epoch": 1.0752136752136752, "grad_norm": 0.10561515390872955, "learning_rate": 9.3631669535284e-05, "loss": 0.4125, "num_input_tokens_seen": 5118014, "step": 315, "train_runtime": 822.6736, "train_tokens_per_second": 6221.197 }, { "epoch": 1.0786324786324786, "grad_norm": 0.10327659547328949, "learning_rate": 9.328743545611017e-05, "loss": 0.4252, "num_input_tokens_seen": 5137150, "step": 316, "train_runtime": 825.4032, "train_tokens_per_second": 6223.807 }, { "epoch": 1.082051282051282, "grad_norm": 0.1158551275730133, "learning_rate": 9.294320137693632e-05, "loss": 0.3862, "num_input_tokens_seen": 5152190, "step": 317, "train_runtime": 827.6678, "train_tokens_per_second": 6224.949 }, { "epoch": 1.0854700854700854, "grad_norm": 0.11891324818134308, "learning_rate": 9.259896729776249e-05, "loss": 0.4514, "num_input_tokens_seen": 5165790, "step": 318, "train_runtime": 829.6973, "train_tokens_per_second": 6226.114 }, { "epoch": 1.0888888888888888, "grad_norm": 0.09706568717956543, "learning_rate": 9.225473321858864e-05, "loss": 0.4038, "num_input_tokens_seen": 5187630, "step": 319, "train_runtime": 832.8397, "train_tokens_per_second": 6228.846 }, { "epoch": 1.0923076923076924, "grad_norm": 0.1240311861038208, "learning_rate": 9.191049913941481e-05, "loss": 0.4434, "num_input_tokens_seen": 5201454, "step": 320, "train_runtime": 834.8979, "train_tokens_per_second": 6230.048 }, { "epoch": 1.0957264957264958, "grad_norm": 0.10608533769845963, "learning_rate": 9.156626506024096e-05, "loss": 0.3612, "num_input_tokens_seen": 5217502, "step": 321, "train_runtime": 837.243, "train_tokens_per_second": 6231.766 }, { "epoch": 1.0991452991452992, "grad_norm": 0.11198005080223083, "learning_rate": 9.122203098106713e-05, "loss": 0.3461, "num_input_tokens_seen": 5233502, "step": 322, "train_runtime": 839.607, "train_tokens_per_second": 6233.276 }, { "epoch": 1.1025641025641026, "grad_norm": 0.11071202903985977, "learning_rate": 9.08777969018933e-05, "loss": 0.3657, "num_input_tokens_seen": 5247166, "step": 323, "train_runtime": 841.6904, "train_tokens_per_second": 6234.081 }, { "epoch": 1.105982905982906, "grad_norm": 0.128941148519516, "learning_rate": 9.053356282271946e-05, "loss": 0.3202, "num_input_tokens_seen": 5264302, "step": 324, "train_runtime": 844.1905, "train_tokens_per_second": 6235.917 }, { "epoch": 1.1094017094017095, "grad_norm": 0.10935687273740768, "learning_rate": 9.018932874354562e-05, "loss": 0.3335, "num_input_tokens_seen": 5285150, "step": 325, "train_runtime": 847.1788, "train_tokens_per_second": 6238.53 }, { "epoch": 1.1128205128205129, "grad_norm": 0.11587445437908173, "learning_rate": 8.984509466437178e-05, "loss": 0.3548, "num_input_tokens_seen": 5303454, "step": 326, "train_runtime": 849.8521, "train_tokens_per_second": 6240.443 }, { "epoch": 1.1162393162393163, "grad_norm": 0.14800626039505005, "learning_rate": 8.950086058519795e-05, "loss": 0.4223, "num_input_tokens_seen": 5313854, "step": 327, "train_runtime": 851.4701, "train_tokens_per_second": 6240.8 }, { "epoch": 1.1196581196581197, "grad_norm": 0.12176591157913208, "learning_rate": 8.91566265060241e-05, "loss": 0.3805, "num_input_tokens_seen": 5327342, "step": 328, "train_runtime": 853.4843, "train_tokens_per_second": 6241.875 }, { "epoch": 1.123076923076923, "grad_norm": 0.1277189403772354, "learning_rate": 8.881239242685027e-05, "loss": 0.4071, "num_input_tokens_seen": 5343678, "step": 329, "train_runtime": 855.8801, "train_tokens_per_second": 6243.489 }, { "epoch": 1.1264957264957265, "grad_norm": 0.10131321847438812, "learning_rate": 8.846815834767642e-05, "loss": 0.2666, "num_input_tokens_seen": 5364910, "step": 330, "train_runtime": 858.9596, "train_tokens_per_second": 6245.823 }, { "epoch": 1.12991452991453, "grad_norm": 0.12116528302431107, "learning_rate": 8.812392426850259e-05, "loss": 0.4034, "num_input_tokens_seen": 5379150, "step": 331, "train_runtime": 861.6047, "train_tokens_per_second": 6243.176 }, { "epoch": 1.1333333333333333, "grad_norm": 0.13882531225681305, "learning_rate": 8.777969018932875e-05, "loss": 0.3558, "num_input_tokens_seen": 5392910, "step": 332, "train_runtime": 863.675, "train_tokens_per_second": 6244.142 }, { "epoch": 1.1367521367521367, "grad_norm": 0.10566709190607071, "learning_rate": 8.743545611015491e-05, "loss": 0.3374, "num_input_tokens_seen": 5410798, "step": 333, "train_runtime": 866.263, "train_tokens_per_second": 6246.137 }, { "epoch": 1.1401709401709401, "grad_norm": 0.1450272500514984, "learning_rate": 8.709122203098107e-05, "loss": 0.3957, "num_input_tokens_seen": 5425198, "step": 334, "train_runtime": 868.4297, "train_tokens_per_second": 6247.136 }, { "epoch": 1.1435897435897435, "grad_norm": 0.13562506437301636, "learning_rate": 8.674698795180724e-05, "loss": 0.4037, "num_input_tokens_seen": 5439374, "step": 335, "train_runtime": 870.5364, "train_tokens_per_second": 6248.301 }, { "epoch": 1.147008547008547, "grad_norm": 0.12343757599592209, "learning_rate": 8.640275387263339e-05, "loss": 0.4106, "num_input_tokens_seen": 5456574, "step": 336, "train_runtime": 873.0308, "train_tokens_per_second": 6250.151 }, { "epoch": 1.1504273504273503, "grad_norm": 0.12856614589691162, "learning_rate": 8.605851979345956e-05, "loss": 0.4445, "num_input_tokens_seen": 5475102, "step": 337, "train_runtime": 875.7122, "train_tokens_per_second": 6252.17 }, { "epoch": 1.1538461538461537, "grad_norm": 0.13173913955688477, "learning_rate": 8.571428571428571e-05, "loss": 0.412, "num_input_tokens_seen": 5488254, "step": 338, "train_runtime": 877.6958, "train_tokens_per_second": 6253.025 }, { "epoch": 1.1572649572649572, "grad_norm": 0.13166651129722595, "learning_rate": 8.537005163511188e-05, "loss": 0.3414, "num_input_tokens_seen": 5503694, "step": 339, "train_runtime": 879.9753, "train_tokens_per_second": 6254.373 }, { "epoch": 1.1606837606837608, "grad_norm": 0.14514580368995667, "learning_rate": 8.502581755593804e-05, "loss": 0.4121, "num_input_tokens_seen": 5518158, "step": 340, "train_runtime": 882.0821, "train_tokens_per_second": 6255.833 }, { "epoch": 1.1641025641025642, "grad_norm": 0.13414417207241058, "learning_rate": 8.46815834767642e-05, "loss": 0.3738, "num_input_tokens_seen": 5531150, "step": 341, "train_runtime": 884.0358, "train_tokens_per_second": 6256.704 }, { "epoch": 1.1675213675213676, "grad_norm": 0.13111338019371033, "learning_rate": 8.433734939759037e-05, "loss": 0.4629, "num_input_tokens_seen": 5547870, "step": 342, "train_runtime": 886.4774, "train_tokens_per_second": 6258.332 }, { "epoch": 1.170940170940171, "grad_norm": 0.13821318745613098, "learning_rate": 8.399311531841653e-05, "loss": 0.3793, "num_input_tokens_seen": 5560814, "step": 343, "train_runtime": 888.4364, "train_tokens_per_second": 6259.102 }, { "epoch": 1.1743589743589744, "grad_norm": 0.133073627948761, "learning_rate": 8.36488812392427e-05, "loss": 0.3765, "num_input_tokens_seen": 5573470, "step": 344, "train_runtime": 890.3654, "train_tokens_per_second": 6259.756 }, { "epoch": 1.1777777777777778, "grad_norm": 0.14837369322776794, "learning_rate": 8.330464716006885e-05, "loss": 0.4345, "num_input_tokens_seen": 5589358, "step": 345, "train_runtime": 892.7259, "train_tokens_per_second": 6261.001 }, { "epoch": 1.1811965811965812, "grad_norm": 0.11554093658924103, "learning_rate": 8.296041308089502e-05, "loss": 0.3454, "num_input_tokens_seen": 5608286, "step": 346, "train_runtime": 895.4735, "train_tokens_per_second": 6262.928 }, { "epoch": 1.1846153846153846, "grad_norm": 0.13670602440834045, "learning_rate": 8.261617900172117e-05, "loss": 0.3641, "num_input_tokens_seen": 5624222, "step": 347, "train_runtime": 897.8188, "train_tokens_per_second": 6264.317 }, { "epoch": 1.188034188034188, "grad_norm": 0.11645640432834625, "learning_rate": 8.227194492254734e-05, "loss": 0.3086, "num_input_tokens_seen": 5644302, "step": 348, "train_runtime": 900.68, "train_tokens_per_second": 6266.711 }, { "epoch": 1.1914529914529914, "grad_norm": 0.13790756464004517, "learning_rate": 8.192771084337349e-05, "loss": 0.3614, "num_input_tokens_seen": 5660814, "step": 349, "train_runtime": 903.1107, "train_tokens_per_second": 6268.129 }, { "epoch": 1.1948717948717948, "grad_norm": 0.12048908323049545, "learning_rate": 8.158347676419966e-05, "loss": 0.3175, "num_input_tokens_seen": 5678238, "step": 350, "train_runtime": 905.6459, "train_tokens_per_second": 6269.822 }, { "epoch": 1.1982905982905983, "grad_norm": 0.1469748467206955, "learning_rate": 8.123924268502582e-05, "loss": 0.402, "num_input_tokens_seen": 5690766, "step": 351, "train_runtime": 907.5181, "train_tokens_per_second": 6270.692 }, { "epoch": 1.2017094017094017, "grad_norm": 0.15761221945285797, "learning_rate": 8.089500860585198e-05, "loss": 0.4114, "num_input_tokens_seen": 5704126, "step": 352, "train_runtime": 909.528, "train_tokens_per_second": 6271.523 }, { "epoch": 1.205128205128205, "grad_norm": 0.12943622469902039, "learning_rate": 8.055077452667814e-05, "loss": 0.3823, "num_input_tokens_seen": 5721070, "step": 353, "train_runtime": 912.0326, "train_tokens_per_second": 6272.879 }, { "epoch": 1.2085470085470085, "grad_norm": 0.14878448843955994, "learning_rate": 8.02065404475043e-05, "loss": 0.4004, "num_input_tokens_seen": 5738638, "step": 354, "train_runtime": 914.5921, "train_tokens_per_second": 6274.532 }, { "epoch": 1.2085470085470085, "eval_loss": 0.4262903034687042, "eval_runtime": 11.8731, "eval_samples_per_second": 84.056, "eval_steps_per_second": 5.306, "num_input_tokens_seen": 5738638, "step": 354 }, { "epoch": 1.2119658119658119, "grad_norm": 0.15027886629104614, "learning_rate": 7.986230636833046e-05, "loss": 0.352, "num_input_tokens_seen": 5755054, "step": 355, "train_runtime": 928.8681, "train_tokens_per_second": 6195.771 }, { "epoch": 1.2153846153846155, "grad_norm": 0.13495990633964539, "learning_rate": 7.951807228915663e-05, "loss": 0.3563, "num_input_tokens_seen": 5767742, "step": 356, "train_runtime": 930.7674, "train_tokens_per_second": 6196.76 }, { "epoch": 1.218803418803419, "grad_norm": 0.1535864919424057, "learning_rate": 7.917383820998278e-05, "loss": 0.3608, "num_input_tokens_seen": 5787614, "step": 357, "train_runtime": 933.6119, "train_tokens_per_second": 6199.164 }, { "epoch": 1.2222222222222223, "grad_norm": 0.13963304460048676, "learning_rate": 7.882960413080895e-05, "loss": 0.4206, "num_input_tokens_seen": 5802558, "step": 358, "train_runtime": 935.8349, "train_tokens_per_second": 6200.407 }, { "epoch": 1.2256410256410257, "grad_norm": 0.163704514503479, "learning_rate": 7.848537005163512e-05, "loss": 0.391, "num_input_tokens_seen": 5816382, "step": 359, "train_runtime": 937.9276, "train_tokens_per_second": 6201.312 }, { "epoch": 1.2290598290598291, "grad_norm": 0.14221028983592987, "learning_rate": 7.814113597246127e-05, "loss": 0.3529, "num_input_tokens_seen": 5833550, "step": 360, "train_runtime": 940.4404, "train_tokens_per_second": 6202.998 }, { "epoch": 1.2324786324786325, "grad_norm": 0.14981484413146973, "learning_rate": 7.779690189328744e-05, "loss": 0.4097, "num_input_tokens_seen": 5847742, "step": 361, "train_runtime": 943.0512, "train_tokens_per_second": 6200.874 }, { "epoch": 1.235897435897436, "grad_norm": 0.15353192389011383, "learning_rate": 7.74526678141136e-05, "loss": 0.4207, "num_input_tokens_seen": 5861422, "step": 362, "train_runtime": 945.0925, "train_tokens_per_second": 6201.956 }, { "epoch": 1.2393162393162394, "grad_norm": 0.1498330533504486, "learning_rate": 7.710843373493976e-05, "loss": 0.4371, "num_input_tokens_seen": 5879550, "step": 363, "train_runtime": 947.7032, "train_tokens_per_second": 6203.999 }, { "epoch": 1.2427350427350428, "grad_norm": 0.16379210352897644, "learning_rate": 7.676419965576592e-05, "loss": 0.4001, "num_input_tokens_seen": 5890414, "step": 364, "train_runtime": 949.3619, "train_tokens_per_second": 6204.603 }, { "epoch": 1.2461538461538462, "grad_norm": 0.14771924912929535, "learning_rate": 7.641996557659209e-05, "loss": 0.4091, "num_input_tokens_seen": 5903870, "step": 365, "train_runtime": 951.3898, "train_tokens_per_second": 6205.522 }, { "epoch": 1.2495726495726496, "grad_norm": 0.1314336210489273, "learning_rate": 7.607573149741824e-05, "loss": 0.3686, "num_input_tokens_seen": 5922702, "step": 366, "train_runtime": 954.0994, "train_tokens_per_second": 6207.636 }, { "epoch": 1.252991452991453, "grad_norm": 0.14639326930046082, "learning_rate": 7.573149741824441e-05, "loss": 0.391, "num_input_tokens_seen": 5943566, "step": 367, "train_runtime": 957.0573, "train_tokens_per_second": 6210.251 }, { "epoch": 1.2564102564102564, "grad_norm": 0.14717791974544525, "learning_rate": 7.538726333907056e-05, "loss": 0.4646, "num_input_tokens_seen": 5960878, "step": 368, "train_runtime": 959.6021, "train_tokens_per_second": 6211.823 }, { "epoch": 1.2598290598290598, "grad_norm": 0.14937731623649597, "learning_rate": 7.504302925989673e-05, "loss": 0.448, "num_input_tokens_seen": 5976654, "step": 369, "train_runtime": 961.9381, "train_tokens_per_second": 6213.138 }, { "epoch": 1.2632478632478632, "grad_norm": 0.15321378409862518, "learning_rate": 7.469879518072289e-05, "loss": 0.4242, "num_input_tokens_seen": 5989406, "step": 370, "train_runtime": 963.873, "train_tokens_per_second": 6213.896 }, { "epoch": 1.2666666666666666, "grad_norm": 0.13933706283569336, "learning_rate": 7.435456110154905e-05, "loss": 0.4543, "num_input_tokens_seen": 6007710, "step": 371, "train_runtime": 966.5773, "train_tokens_per_second": 6215.447 }, { "epoch": 1.27008547008547, "grad_norm": 0.1422203630208969, "learning_rate": 7.401032702237521e-05, "loss": 0.3656, "num_input_tokens_seen": 6021982, "step": 372, "train_runtime": 968.6875, "train_tokens_per_second": 6216.641 }, { "epoch": 1.2735042735042734, "grad_norm": 0.15311431884765625, "learning_rate": 7.366609294320138e-05, "loss": 0.5369, "num_input_tokens_seen": 6036606, "step": 373, "train_runtime": 970.8599, "train_tokens_per_second": 6217.793 }, { "epoch": 1.2769230769230768, "grad_norm": 0.15368784964084625, "learning_rate": 7.332185886402754e-05, "loss": 0.4691, "num_input_tokens_seen": 6050686, "step": 374, "train_runtime": 972.9604, "train_tokens_per_second": 6218.841 }, { "epoch": 1.2803418803418802, "grad_norm": 0.128590390086174, "learning_rate": 7.29776247848537e-05, "loss": 0.3645, "num_input_tokens_seen": 6071006, "step": 375, "train_runtime": 975.8603, "train_tokens_per_second": 6221.183 }, { "epoch": 1.2837606837606836, "grad_norm": 0.16918911039829254, "learning_rate": 7.263339070567987e-05, "loss": 0.4516, "num_input_tokens_seen": 6083838, "step": 376, "train_runtime": 977.7866, "train_tokens_per_second": 6222.051 }, { "epoch": 1.287179487179487, "grad_norm": 0.1317807137966156, "learning_rate": 7.228915662650602e-05, "loss": 0.3979, "num_input_tokens_seen": 6103870, "step": 377, "train_runtime": 980.6218, "train_tokens_per_second": 6224.489 }, { "epoch": 1.2905982905982907, "grad_norm": 0.15844884514808655, "learning_rate": 7.194492254733219e-05, "loss": 0.4077, "num_input_tokens_seen": 6119342, "step": 378, "train_runtime": 982.9217, "train_tokens_per_second": 6225.666 }, { "epoch": 1.294017094017094, "grad_norm": 0.13094189763069153, "learning_rate": 7.160068846815836e-05, "loss": 0.3317, "num_input_tokens_seen": 6135582, "step": 379, "train_runtime": 985.318, "train_tokens_per_second": 6227.007 }, { "epoch": 1.2974358974358975, "grad_norm": 0.1428907960653305, "learning_rate": 7.125645438898451e-05, "loss": 0.3667, "num_input_tokens_seen": 6153166, "step": 380, "train_runtime": 987.8695, "train_tokens_per_second": 6228.724 }, { "epoch": 1.300854700854701, "grad_norm": 0.1479697972536087, "learning_rate": 7.091222030981068e-05, "loss": 0.4703, "num_input_tokens_seen": 6167790, "step": 381, "train_runtime": 990.0311, "train_tokens_per_second": 6229.895 }, { "epoch": 1.3042735042735043, "grad_norm": 0.1379973441362381, "learning_rate": 7.056798623063683e-05, "loss": 0.305, "num_input_tokens_seen": 6188846, "step": 382, "train_runtime": 993.0644, "train_tokens_per_second": 6232.069 }, { "epoch": 1.3076923076923077, "grad_norm": 0.15161173045635223, "learning_rate": 7.0223752151463e-05, "loss": 0.3361, "num_input_tokens_seen": 6202542, "step": 383, "train_runtime": 995.1105, "train_tokens_per_second": 6233.018 }, { "epoch": 1.3111111111111111, "grad_norm": 0.14290477335453033, "learning_rate": 6.987951807228917e-05, "loss": 0.3268, "num_input_tokens_seen": 6220366, "step": 384, "train_runtime": 997.717, "train_tokens_per_second": 6234.599 }, { "epoch": 1.3145299145299145, "grad_norm": 0.1553800255060196, "learning_rate": 6.953528399311532e-05, "loss": 0.4104, "num_input_tokens_seen": 6237422, "step": 385, "train_runtime": 1000.1787, "train_tokens_per_second": 6236.307 }, { "epoch": 1.317948717948718, "grad_norm": 0.15926386415958405, "learning_rate": 6.919104991394149e-05, "loss": 0.3809, "num_input_tokens_seen": 6249070, "step": 386, "train_runtime": 1001.9601, "train_tokens_per_second": 6236.845 }, { "epoch": 1.3213675213675213, "grad_norm": 0.15950970351696014, "learning_rate": 6.884681583476765e-05, "loss": 0.3429, "num_input_tokens_seen": 6265198, "step": 387, "train_runtime": 1004.333, "train_tokens_per_second": 6238.168 }, { "epoch": 1.3247863247863247, "grad_norm": 0.15029311180114746, "learning_rate": 6.850258175559381e-05, "loss": 0.3975, "num_input_tokens_seen": 6281966, "step": 388, "train_runtime": 1006.7802, "train_tokens_per_second": 6239.66 }, { "epoch": 1.3282051282051281, "grad_norm": 0.16369454562664032, "learning_rate": 6.815834767641997e-05, "loss": 0.3495, "num_input_tokens_seen": 6298718, "step": 389, "train_runtime": 1009.2265, "train_tokens_per_second": 6241.134 }, { "epoch": 1.3316239316239316, "grad_norm": 0.1701713353395462, "learning_rate": 6.781411359724614e-05, "loss": 0.4102, "num_input_tokens_seen": 6312510, "step": 390, "train_runtime": 1011.2977, "train_tokens_per_second": 6241.99 }, { "epoch": 1.335042735042735, "grad_norm": 0.15310458838939667, "learning_rate": 6.746987951807229e-05, "loss": 0.3758, "num_input_tokens_seen": 6329998, "step": 391, "train_runtime": 1014.3612, "train_tokens_per_second": 6240.379 }, { "epoch": 1.3384615384615386, "grad_norm": 0.1793118566274643, "learning_rate": 6.712564543889846e-05, "loss": 0.4579, "num_input_tokens_seen": 6344158, "step": 392, "train_runtime": 1016.4559, "train_tokens_per_second": 6241.449 }, { "epoch": 1.341880341880342, "grad_norm": 0.1364370435476303, "learning_rate": 6.678141135972461e-05, "loss": 0.3032, "num_input_tokens_seen": 6362286, "step": 393, "train_runtime": 1019.0898, "train_tokens_per_second": 6243.106 }, { "epoch": 1.3452991452991454, "grad_norm": 0.19111692905426025, "learning_rate": 6.643717728055078e-05, "loss": 0.3836, "num_input_tokens_seen": 6374334, "step": 394, "train_runtime": 1020.8971, "train_tokens_per_second": 6243.856 }, { "epoch": 1.3487179487179488, "grad_norm": 0.13976141810417175, "learning_rate": 6.609294320137695e-05, "loss": 0.3489, "num_input_tokens_seen": 6392286, "step": 395, "train_runtime": 1023.5184, "train_tokens_per_second": 6245.404 }, { "epoch": 1.3521367521367522, "grad_norm": 0.1717049479484558, "learning_rate": 6.57487091222031e-05, "loss": 0.4546, "num_input_tokens_seen": 6407102, "step": 396, "train_runtime": 1025.7201, "train_tokens_per_second": 6246.443 }, { "epoch": 1.3555555555555556, "grad_norm": 0.15389494597911835, "learning_rate": 6.540447504302927e-05, "loss": 0.3984, "num_input_tokens_seen": 6424190, "step": 397, "train_runtime": 1028.1999, "train_tokens_per_second": 6247.997 }, { "epoch": 1.358974358974359, "grad_norm": 0.15128876268863678, "learning_rate": 6.506024096385543e-05, "loss": 0.4107, "num_input_tokens_seen": 6438926, "step": 398, "train_runtime": 1030.39, "train_tokens_per_second": 6249.018 }, { "epoch": 1.3623931623931624, "grad_norm": 0.1720062643289566, "learning_rate": 6.47160068846816e-05, "loss": 0.4398, "num_input_tokens_seen": 6454206, "step": 399, "train_runtime": 1032.6825, "train_tokens_per_second": 6249.942 }, { "epoch": 1.3658119658119658, "grad_norm": 0.16892306506633759, "learning_rate": 6.437177280550775e-05, "loss": 0.4768, "num_input_tokens_seen": 6470446, "step": 400, "train_runtime": 1035.0677, "train_tokens_per_second": 6251.23 }, { "epoch": 1.3692307692307693, "grad_norm": 0.16459856927394867, "learning_rate": 6.402753872633392e-05, "loss": 0.394, "num_input_tokens_seen": 6485566, "step": 401, "train_runtime": 1037.3161, "train_tokens_per_second": 6252.256 }, { "epoch": 1.3726495726495727, "grad_norm": 0.146686390042305, "learning_rate": 6.368330464716007e-05, "loss": 0.4074, "num_input_tokens_seen": 6500878, "step": 402, "train_runtime": 1039.5797, "train_tokens_per_second": 6253.371 }, { "epoch": 1.376068376068376, "grad_norm": 0.13347510993480682, "learning_rate": 6.333907056798624e-05, "loss": 0.3718, "num_input_tokens_seen": 6527726, "step": 403, "train_runtime": 1043.3774, "train_tokens_per_second": 6256.342 }, { "epoch": 1.3794871794871795, "grad_norm": 0.15149444341659546, "learning_rate": 6.29948364888124e-05, "loss": 0.4889, "num_input_tokens_seen": 6549054, "step": 404, "train_runtime": 1046.4485, "train_tokens_per_second": 6258.363 }, { "epoch": 1.3829059829059829, "grad_norm": 0.15119557082653046, "learning_rate": 6.265060240963856e-05, "loss": 0.3562, "num_input_tokens_seen": 6565374, "step": 405, "train_runtime": 1048.8497, "train_tokens_per_second": 6259.595 }, { "epoch": 1.3863247863247863, "grad_norm": 0.1899130493402481, "learning_rate": 6.230636833046472e-05, "loss": 0.4359, "num_input_tokens_seen": 6577854, "step": 406, "train_runtime": 1050.7387, "train_tokens_per_second": 6260.219 }, { "epoch": 1.3897435897435897, "grad_norm": 0.15261997282505035, "learning_rate": 6.196213425129088e-05, "loss": 0.3755, "num_input_tokens_seen": 6595182, "step": 407, "train_runtime": 1053.2481, "train_tokens_per_second": 6261.755 }, { "epoch": 1.393162393162393, "grad_norm": 0.1569528728723526, "learning_rate": 6.161790017211704e-05, "loss": 0.4357, "num_input_tokens_seen": 6609166, "step": 408, "train_runtime": 1055.3193, "train_tokens_per_second": 6262.717 }, { "epoch": 1.3965811965811965, "grad_norm": 0.15785826742649078, "learning_rate": 6.127366609294321e-05, "loss": 0.3605, "num_input_tokens_seen": 6622254, "step": 409, "train_runtime": 1057.2748, "train_tokens_per_second": 6263.513 }, { "epoch": 1.4, "grad_norm": 0.1593894064426422, "learning_rate": 6.092943201376936e-05, "loss": 0.461, "num_input_tokens_seen": 6637758, "step": 410, "train_runtime": 1059.5389, "train_tokens_per_second": 6264.761 }, { "epoch": 1.4034188034188033, "grad_norm": 0.1655980795621872, "learning_rate": 6.058519793459553e-05, "loss": 0.3856, "num_input_tokens_seen": 6653086, "step": 411, "train_runtime": 1061.8036, "train_tokens_per_second": 6265.835 }, { "epoch": 1.4068376068376067, "grad_norm": 0.16413439810276031, "learning_rate": 6.02409638554217e-05, "loss": 0.3601, "num_input_tokens_seen": 6671230, "step": 412, "train_runtime": 1064.4168, "train_tokens_per_second": 6267.498 }, { "epoch": 1.4102564102564101, "grad_norm": 0.17654147744178772, "learning_rate": 5.989672977624785e-05, "loss": 0.4383, "num_input_tokens_seen": 6685294, "step": 413, "train_runtime": 1066.4829, "train_tokens_per_second": 6268.543 }, { "epoch": 1.4102564102564101, "eval_loss": 0.42687925696372986, "eval_runtime": 11.8448, "eval_samples_per_second": 84.257, "eval_steps_per_second": 5.319, "num_input_tokens_seen": 6685294, "step": 413 }, { "epoch": 1.4136752136752135, "grad_norm": 0.14143113791942596, "learning_rate": 5.955249569707402e-05, "loss": 0.3417, "num_input_tokens_seen": 6706110, "step": 414, "train_runtime": 1081.3024, "train_tokens_per_second": 6201.882 }, { "epoch": 1.4170940170940172, "grad_norm": 0.17738325893878937, "learning_rate": 5.9208261617900174e-05, "loss": 0.4049, "num_input_tokens_seen": 6719390, "step": 415, "train_runtime": 1083.3114, "train_tokens_per_second": 6202.64 }, { "epoch": 1.4205128205128206, "grad_norm": 0.15967565774917603, "learning_rate": 5.886402753872634e-05, "loss": 0.322, "num_input_tokens_seen": 6732926, "step": 416, "train_runtime": 1085.3328, "train_tokens_per_second": 6203.559 }, { "epoch": 1.423931623931624, "grad_norm": 0.17965038120746613, "learning_rate": 5.85197934595525e-05, "loss": 0.4321, "num_input_tokens_seen": 6748014, "step": 417, "train_runtime": 1087.5395, "train_tokens_per_second": 6204.845 }, { "epoch": 1.4273504273504274, "grad_norm": 0.17158453166484833, "learning_rate": 5.8175559380378665e-05, "loss": 0.3844, "num_input_tokens_seen": 6762782, "step": 418, "train_runtime": 1089.7402, "train_tokens_per_second": 6205.866 }, { "epoch": 1.4307692307692308, "grad_norm": 0.17010599374771118, "learning_rate": 5.783132530120482e-05, "loss": 0.3944, "num_input_tokens_seen": 6775838, "step": 419, "train_runtime": 1091.687, "train_tokens_per_second": 6206.759 }, { "epoch": 1.4341880341880342, "grad_norm": 0.14824308454990387, "learning_rate": 5.748709122203099e-05, "loss": 0.3437, "num_input_tokens_seen": 6794014, "step": 420, "train_runtime": 1094.3074, "train_tokens_per_second": 6208.506 }, { "epoch": 1.4376068376068376, "grad_norm": 0.1721956878900528, "learning_rate": 5.714285714285714e-05, "loss": 0.3813, "num_input_tokens_seen": 6809502, "step": 421, "train_runtime": 1097.1486, "train_tokens_per_second": 6206.545 }, { "epoch": 1.441025641025641, "grad_norm": 0.17868974804878235, "learning_rate": 5.679862306368331e-05, "loss": 0.439, "num_input_tokens_seen": 6823038, "step": 422, "train_runtime": 1099.1662, "train_tokens_per_second": 6207.467 }, { "epoch": 1.4444444444444444, "grad_norm": 0.15935160219669342, "learning_rate": 5.6454388984509464e-05, "loss": 0.387, "num_input_tokens_seen": 6841582, "step": 423, "train_runtime": 1101.8557, "train_tokens_per_second": 6209.145 }, { "epoch": 1.4478632478632478, "grad_norm": 0.1758459508419037, "learning_rate": 5.611015490533563e-05, "loss": 0.5356, "num_input_tokens_seen": 6855310, "step": 424, "train_runtime": 1103.8914, "train_tokens_per_second": 6210.131 }, { "epoch": 1.4512820512820512, "grad_norm": 0.16828133165836334, "learning_rate": 5.576592082616179e-05, "loss": 0.3835, "num_input_tokens_seen": 6875486, "step": 425, "train_runtime": 1106.7831, "train_tokens_per_second": 6212.135 }, { "epoch": 1.4547008547008546, "grad_norm": 0.16434825956821442, "learning_rate": 5.5421686746987955e-05, "loss": 0.3765, "num_input_tokens_seen": 6889502, "step": 426, "train_runtime": 1108.8374, "train_tokens_per_second": 6213.266 }, { "epoch": 1.458119658119658, "grad_norm": 0.16002990305423737, "learning_rate": 5.507745266781411e-05, "loss": 0.4121, "num_input_tokens_seen": 6908046, "step": 427, "train_runtime": 1111.5373, "train_tokens_per_second": 6214.858 }, { "epoch": 1.4615384615384617, "grad_norm": 0.17183275520801544, "learning_rate": 5.473321858864028e-05, "loss": 0.439, "num_input_tokens_seen": 6924190, "step": 428, "train_runtime": 1113.8957, "train_tokens_per_second": 6216.192 }, { "epoch": 1.464957264957265, "grad_norm": 0.18027374148368835, "learning_rate": 5.4388984509466445e-05, "loss": 0.4895, "num_input_tokens_seen": 6939070, "step": 429, "train_runtime": 1116.1017, "train_tokens_per_second": 6217.238 }, { "epoch": 1.4683760683760685, "grad_norm": 0.15044456720352173, "learning_rate": 5.40447504302926e-05, "loss": 0.4429, "num_input_tokens_seen": 6956478, "step": 430, "train_runtime": 1118.6746, "train_tokens_per_second": 6218.5 }, { "epoch": 1.471794871794872, "grad_norm": 0.15003447234630585, "learning_rate": 5.370051635111877e-05, "loss": 0.5628, "num_input_tokens_seen": 6973246, "step": 431, "train_runtime": 1121.1665, "train_tokens_per_second": 6219.635 }, { "epoch": 1.4752136752136753, "grad_norm": 0.1591937392950058, "learning_rate": 5.335628227194492e-05, "loss": 0.3721, "num_input_tokens_seen": 6986990, "step": 432, "train_runtime": 1123.2293, "train_tokens_per_second": 6220.448 }, { "epoch": 1.4786324786324787, "grad_norm": 0.18640592694282532, "learning_rate": 5.301204819277109e-05, "loss": 0.3516, "num_input_tokens_seen": 7001950, "step": 433, "train_runtime": 1125.4499, "train_tokens_per_second": 6221.468 }, { "epoch": 1.4820512820512821, "grad_norm": 0.17443552613258362, "learning_rate": 5.2667814113597244e-05, "loss": 0.4784, "num_input_tokens_seen": 7016318, "step": 434, "train_runtime": 1127.6255, "train_tokens_per_second": 6222.206 }, { "epoch": 1.4854700854700855, "grad_norm": 0.1685023009777069, "learning_rate": 5.232358003442341e-05, "loss": 0.4227, "num_input_tokens_seen": 7029358, "step": 435, "train_runtime": 1129.5922, "train_tokens_per_second": 6222.916 }, { "epoch": 1.488888888888889, "grad_norm": 0.17190369963645935, "learning_rate": 5.197934595524957e-05, "loss": 0.3718, "num_input_tokens_seen": 7046350, "step": 436, "train_runtime": 1132.1043, "train_tokens_per_second": 6224.117 }, { "epoch": 1.4923076923076923, "grad_norm": 0.16871225833892822, "learning_rate": 5.1635111876075735e-05, "loss": 0.4095, "num_input_tokens_seen": 7060286, "step": 437, "train_runtime": 1134.2429, "train_tokens_per_second": 6224.669 }, { "epoch": 1.4957264957264957, "grad_norm": 0.15742996335029602, "learning_rate": 5.1290877796901896e-05, "loss": 0.3377, "num_input_tokens_seen": 7077550, "step": 438, "train_runtime": 1136.7468, "train_tokens_per_second": 6226.145 }, { "epoch": 1.4991452991452991, "grad_norm": 0.1806265264749527, "learning_rate": 5.094664371772806e-05, "loss": 0.4356, "num_input_tokens_seen": 7096110, "step": 439, "train_runtime": 1139.4331, "train_tokens_per_second": 6227.755 }, { "epoch": 1.5025641025641026, "grad_norm": 0.1986326277256012, "learning_rate": 5.060240963855422e-05, "loss": 0.421, "num_input_tokens_seen": 7110462, "step": 440, "train_runtime": 1141.5636, "train_tokens_per_second": 6228.704 }, { "epoch": 1.505982905982906, "grad_norm": 0.18825186789035797, "learning_rate": 5.025817555938038e-05, "loss": 0.3866, "num_input_tokens_seen": 7123438, "step": 441, "train_runtime": 1143.5279, "train_tokens_per_second": 6229.352 }, { "epoch": 1.5094017094017094, "grad_norm": 0.15836316347122192, "learning_rate": 4.991394148020654e-05, "loss": 0.3759, "num_input_tokens_seen": 7139678, "step": 442, "train_runtime": 1145.9334, "train_tokens_per_second": 6230.448 }, { "epoch": 1.5128205128205128, "grad_norm": 0.1643362194299698, "learning_rate": 4.95697074010327e-05, "loss": 0.3715, "num_input_tokens_seen": 7152798, "step": 443, "train_runtime": 1147.927, "train_tokens_per_second": 6231.056 }, { "epoch": 1.5162393162393162, "grad_norm": 0.18112708628177643, "learning_rate": 4.922547332185887e-05, "loss": 0.5004, "num_input_tokens_seen": 7166718, "step": 444, "train_runtime": 1149.9906, "train_tokens_per_second": 6231.98 }, { "epoch": 1.5196581196581196, "grad_norm": 0.17923805117607117, "learning_rate": 4.888123924268503e-05, "loss": 0.3967, "num_input_tokens_seen": 7180718, "step": 445, "train_runtime": 1152.0495, "train_tokens_per_second": 6232.994 }, { "epoch": 1.523076923076923, "grad_norm": 0.15098166465759277, "learning_rate": 4.853700516351119e-05, "loss": 0.379, "num_input_tokens_seen": 7198382, "step": 446, "train_runtime": 1154.5661, "train_tokens_per_second": 6234.708 }, { "epoch": 1.5264957264957264, "grad_norm": 0.17328427731990814, "learning_rate": 4.8192771084337354e-05, "loss": 0.3807, "num_input_tokens_seen": 7213006, "step": 447, "train_runtime": 1156.7041, "train_tokens_per_second": 6235.827 }, { "epoch": 1.5299145299145298, "grad_norm": 0.13623268902301788, "learning_rate": 4.7848537005163515e-05, "loss": 0.3011, "num_input_tokens_seen": 7243582, "step": 448, "train_runtime": 1161.0841, "train_tokens_per_second": 6238.637 }, { "epoch": 1.5333333333333332, "grad_norm": 0.23146113753318787, "learning_rate": 4.7504302925989676e-05, "loss": 0.4946, "num_input_tokens_seen": 7257710, "step": 449, "train_runtime": 1163.1872, "train_tokens_per_second": 6239.503 }, { "epoch": 1.5367521367521366, "grad_norm": 0.1464138627052307, "learning_rate": 4.716006884681584e-05, "loss": 0.3956, "num_input_tokens_seen": 7275646, "step": 450, "train_runtime": 1165.763, "train_tokens_per_second": 6241.102 }, { "epoch": 1.54017094017094, "grad_norm": 0.13081535696983337, "learning_rate": 4.6815834767642e-05, "loss": 0.351, "num_input_tokens_seen": 7295710, "step": 451, "train_runtime": 1169.156, "train_tokens_per_second": 6240.151 }, { "epoch": 1.5435897435897434, "grad_norm": 0.16835983097553253, "learning_rate": 4.647160068846816e-05, "loss": 0.4823, "num_input_tokens_seen": 7314574, "step": 452, "train_runtime": 1171.8934, "train_tokens_per_second": 6241.672 }, { "epoch": 1.547008547008547, "grad_norm": 0.12163835763931274, "learning_rate": 4.612736660929432e-05, "loss": 0.2982, "num_input_tokens_seen": 7343022, "step": 453, "train_runtime": 1175.8796, "train_tokens_per_second": 6244.706 }, { "epoch": 1.5504273504273505, "grad_norm": 0.14073219895362854, "learning_rate": 4.578313253012048e-05, "loss": 0.2964, "num_input_tokens_seen": 7363630, "step": 454, "train_runtime": 1178.8416, "train_tokens_per_second": 6246.497 }, { "epoch": 1.5538461538461539, "grad_norm": 0.1757187843322754, "learning_rate": 4.543889845094665e-05, "loss": 0.4486, "num_input_tokens_seen": 7378830, "step": 455, "train_runtime": 1181.0635, "train_tokens_per_second": 6247.615 }, { "epoch": 1.5572649572649573, "grad_norm": 0.16719017922878265, "learning_rate": 4.509466437177281e-05, "loss": 0.342, "num_input_tokens_seen": 7396958, "step": 456, "train_runtime": 1183.6752, "train_tokens_per_second": 6249.145 }, { "epoch": 1.5606837606837607, "grad_norm": 0.15160873532295227, "learning_rate": 4.475043029259897e-05, "loss": 0.3305, "num_input_tokens_seen": 7419918, "step": 457, "train_runtime": 1186.9428, "train_tokens_per_second": 6251.285 }, { "epoch": 1.564102564102564, "grad_norm": 0.16827233135700226, "learning_rate": 4.4406196213425134e-05, "loss": 0.3478, "num_input_tokens_seen": 7438590, "step": 458, "train_runtime": 1189.6616, "train_tokens_per_second": 6252.694 }, { "epoch": 1.5675213675213675, "grad_norm": 0.15692555904388428, "learning_rate": 4.4061962134251295e-05, "loss": 0.3317, "num_input_tokens_seen": 7457614, "step": 459, "train_runtime": 1192.4245, "train_tokens_per_second": 6254.16 }, { "epoch": 1.570940170940171, "grad_norm": 0.16111750900745392, "learning_rate": 4.371772805507746e-05, "loss": 0.3559, "num_input_tokens_seen": 7478254, "step": 460, "train_runtime": 1195.4195, "train_tokens_per_second": 6255.757 }, { "epoch": 1.5743589743589743, "grad_norm": 0.1745642125606537, "learning_rate": 4.337349397590362e-05, "loss": 0.3515, "num_input_tokens_seen": 7491422, "step": 461, "train_runtime": 1197.3704, "train_tokens_per_second": 6256.562 }, { "epoch": 1.5777777777777777, "grad_norm": 0.1923861801624298, "learning_rate": 4.302925989672978e-05, "loss": 0.4927, "num_input_tokens_seen": 7508174, "step": 462, "train_runtime": 1199.809, "train_tokens_per_second": 6257.808 }, { "epoch": 1.5811965811965814, "grad_norm": 0.19131140410900116, "learning_rate": 4.268502581755594e-05, "loss": 0.4331, "num_input_tokens_seen": 7520590, "step": 463, "train_runtime": 1201.6752, "train_tokens_per_second": 6258.422 }, { "epoch": 1.5846153846153848, "grad_norm": 0.16123589873313904, "learning_rate": 4.23407917383821e-05, "loss": 0.3504, "num_input_tokens_seen": 7534430, "step": 464, "train_runtime": 1203.7756, "train_tokens_per_second": 6258.999 }, { "epoch": 1.5880341880341882, "grad_norm": 0.1816190630197525, "learning_rate": 4.199655765920826e-05, "loss": 0.349, "num_input_tokens_seen": 7550974, "step": 465, "train_runtime": 1206.2032, "train_tokens_per_second": 6260.117 }, { "epoch": 1.5914529914529916, "grad_norm": 0.1618788093328476, "learning_rate": 4.1652323580034424e-05, "loss": 0.3963, "num_input_tokens_seen": 7568494, "step": 466, "train_runtime": 1208.719, "train_tokens_per_second": 6261.583 }, { "epoch": 1.594871794871795, "grad_norm": 0.1682547926902771, "learning_rate": 4.1308089500860585e-05, "loss": 0.4128, "num_input_tokens_seen": 7584510, "step": 467, "train_runtime": 1211.076, "train_tokens_per_second": 6262.621 }, { "epoch": 1.5982905982905984, "grad_norm": 0.17071352899074554, "learning_rate": 4.0963855421686746e-05, "loss": 0.4007, "num_input_tokens_seen": 7601806, "step": 468, "train_runtime": 1213.648, "train_tokens_per_second": 6263.6 }, { "epoch": 1.6017094017094018, "grad_norm": 0.19961658120155334, "learning_rate": 4.061962134251291e-05, "loss": 0.3831, "num_input_tokens_seen": 7615134, "step": 469, "train_runtime": 1215.6143, "train_tokens_per_second": 6264.433 }, { "epoch": 1.6051282051282052, "grad_norm": 0.15891629457473755, "learning_rate": 4.027538726333907e-05, "loss": 0.3579, "num_input_tokens_seen": 7632446, "step": 470, "train_runtime": 1218.1415, "train_tokens_per_second": 6265.648 }, { "epoch": 1.6085470085470086, "grad_norm": 0.18139025568962097, "learning_rate": 3.993115318416523e-05, "loss": 0.4023, "num_input_tokens_seen": 7647038, "step": 471, "train_runtime": 1220.3009, "train_tokens_per_second": 6266.519 }, { "epoch": 1.611965811965812, "grad_norm": 0.1726229041814804, "learning_rate": 3.958691910499139e-05, "loss": 0.3495, "num_input_tokens_seen": 7664846, "step": 472, "train_runtime": 1222.889, "train_tokens_per_second": 6267.818 }, { "epoch": 1.611965811965812, "eval_loss": 0.4264853894710541, "eval_runtime": 11.8946, "eval_samples_per_second": 83.904, "eval_steps_per_second": 5.297, "num_input_tokens_seen": 7664846, "step": 472 }, { "epoch": 1.6153846153846154, "grad_norm": 0.2046596258878708, "learning_rate": 3.924268502581756e-05, "loss": 0.4611, "num_input_tokens_seen": 7678558, "step": 473, "train_runtime": 1236.8201, "train_tokens_per_second": 6208.306 }, { "epoch": 1.6188034188034188, "grad_norm": 0.18339784443378448, "learning_rate": 3.889845094664372e-05, "loss": 0.4687, "num_input_tokens_seen": 7692542, "step": 474, "train_runtime": 1238.9304, "train_tokens_per_second": 6209.019 }, { "epoch": 1.6222222222222222, "grad_norm": 0.15463566780090332, "learning_rate": 3.855421686746988e-05, "loss": 0.3533, "num_input_tokens_seen": 7706094, "step": 475, "train_runtime": 1240.9949, "train_tokens_per_second": 6209.61 }, { "epoch": 1.6256410256410256, "grad_norm": 0.18534722924232483, "learning_rate": 3.820998278829604e-05, "loss": 0.429, "num_input_tokens_seen": 7723006, "step": 476, "train_runtime": 1243.4537, "train_tokens_per_second": 6210.932 }, { "epoch": 1.629059829059829, "grad_norm": 0.16153299808502197, "learning_rate": 3.7865748709122204e-05, "loss": 0.368, "num_input_tokens_seen": 7739230, "step": 477, "train_runtime": 1245.8498, "train_tokens_per_second": 6212.009 }, { "epoch": 1.6324786324786325, "grad_norm": 0.18664556741714478, "learning_rate": 3.7521514629948365e-05, "loss": 0.3884, "num_input_tokens_seen": 7753966, "step": 478, "train_runtime": 1248.0407, "train_tokens_per_second": 6212.911 }, { "epoch": 1.6358974358974359, "grad_norm": 0.14830684661865234, "learning_rate": 3.717728055077453e-05, "loss": 0.3094, "num_input_tokens_seen": 7771758, "step": 479, "train_runtime": 1250.6256, "train_tokens_per_second": 6214.296 }, { "epoch": 1.6393162393162393, "grad_norm": 0.1431615799665451, "learning_rate": 3.683304647160069e-05, "loss": 0.3434, "num_input_tokens_seen": 7788030, "step": 480, "train_runtime": 1253.0226, "train_tokens_per_second": 6215.395 }, { "epoch": 1.6427350427350427, "grad_norm": 0.17345507442951202, "learning_rate": 3.648881239242685e-05, "loss": 0.4109, "num_input_tokens_seen": 7805374, "step": 481, "train_runtime": 1256.1793, "train_tokens_per_second": 6213.583 }, { "epoch": 1.646153846153846, "grad_norm": 0.18331271409988403, "learning_rate": 3.614457831325301e-05, "loss": 0.483, "num_input_tokens_seen": 7821278, "step": 482, "train_runtime": 1258.5131, "train_tokens_per_second": 6214.697 }, { "epoch": 1.6495726495726495, "grad_norm": 0.14575603604316711, "learning_rate": 3.580034423407918e-05, "loss": 0.3499, "num_input_tokens_seen": 7838750, "step": 483, "train_runtime": 1261.0972, "train_tokens_per_second": 6215.817 }, { "epoch": 1.652991452991453, "grad_norm": 0.16931626200675964, "learning_rate": 3.545611015490534e-05, "loss": 0.364, "num_input_tokens_seen": 7855742, "step": 484, "train_runtime": 1263.5759, "train_tokens_per_second": 6217.072 }, { "epoch": 1.6564102564102563, "grad_norm": 0.17259550094604492, "learning_rate": 3.51118760757315e-05, "loss": 0.4564, "num_input_tokens_seen": 7874494, "step": 485, "train_runtime": 1266.3175, "train_tokens_per_second": 6218.42 }, { "epoch": 1.6598290598290597, "grad_norm": 0.17083777487277985, "learning_rate": 3.476764199655766e-05, "loss": 0.3809, "num_input_tokens_seen": 7890430, "step": 486, "train_runtime": 1268.6327, "train_tokens_per_second": 6219.633 }, { "epoch": 1.6632478632478631, "grad_norm": 0.1671985685825348, "learning_rate": 3.442340791738382e-05, "loss": 0.3755, "num_input_tokens_seen": 7906142, "step": 487, "train_runtime": 1270.96, "train_tokens_per_second": 6220.606 }, { "epoch": 1.6666666666666665, "grad_norm": 0.18116803467273712, "learning_rate": 3.4079173838209984e-05, "loss": 0.3913, "num_input_tokens_seen": 7922366, "step": 488, "train_runtime": 1273.3633, "train_tokens_per_second": 6221.607 }, { "epoch": 1.67008547008547, "grad_norm": 0.18932628631591797, "learning_rate": 3.3734939759036146e-05, "loss": 0.4293, "num_input_tokens_seen": 7934942, "step": 489, "train_runtime": 1275.2793, "train_tokens_per_second": 6222.121 }, { "epoch": 1.6735042735042736, "grad_norm": 0.17077142000198364, "learning_rate": 3.339070567986231e-05, "loss": 0.3818, "num_input_tokens_seen": 7951486, "step": 490, "train_runtime": 1277.6946, "train_tokens_per_second": 6223.307 }, { "epoch": 1.676923076923077, "grad_norm": 0.1565760374069214, "learning_rate": 3.3046471600688475e-05, "loss": 0.4047, "num_input_tokens_seen": 7970478, "step": 491, "train_runtime": 1280.4332, "train_tokens_per_second": 6224.829 }, { "epoch": 1.6803418803418804, "grad_norm": 0.17805105447769165, "learning_rate": 3.2702237521514636e-05, "loss": 0.3757, "num_input_tokens_seen": 7984814, "step": 492, "train_runtime": 1282.5395, "train_tokens_per_second": 6225.784 }, { "epoch": 1.6837606837606838, "grad_norm": 0.19390779733657837, "learning_rate": 3.23580034423408e-05, "loss": 0.3895, "num_input_tokens_seen": 7998286, "step": 493, "train_runtime": 1284.5377, "train_tokens_per_second": 6226.587 }, { "epoch": 1.6871794871794872, "grad_norm": 0.16203835606575012, "learning_rate": 3.201376936316696e-05, "loss": 0.3933, "num_input_tokens_seen": 8022334, "step": 494, "train_runtime": 1287.9546, "train_tokens_per_second": 6228.74 }, { "epoch": 1.6905982905982906, "grad_norm": 0.164924755692482, "learning_rate": 3.166953528399312e-05, "loss": 0.367, "num_input_tokens_seen": 8043294, "step": 495, "train_runtime": 1290.9515, "train_tokens_per_second": 6230.516 }, { "epoch": 1.694017094017094, "grad_norm": 0.187575563788414, "learning_rate": 3.132530120481928e-05, "loss": 0.4334, "num_input_tokens_seen": 8057310, "step": 496, "train_runtime": 1293.0552, "train_tokens_per_second": 6231.219 }, { "epoch": 1.6974358974358974, "grad_norm": 0.1323373168706894, "learning_rate": 3.098106712564544e-05, "loss": 0.3116, "num_input_tokens_seen": 8083774, "step": 497, "train_runtime": 1296.8416, "train_tokens_per_second": 6233.432 }, { "epoch": 1.7008547008547008, "grad_norm": 0.20211701095104218, "learning_rate": 3.0636833046471604e-05, "loss": 0.4324, "num_input_tokens_seen": 8097038, "step": 498, "train_runtime": 1298.8399, "train_tokens_per_second": 6234.054 }, { "epoch": 1.7042735042735044, "grad_norm": 0.17863459885120392, "learning_rate": 3.0292598967297765e-05, "loss": 0.2992, "num_input_tokens_seen": 8114750, "step": 499, "train_runtime": 1301.44, "train_tokens_per_second": 6235.208 }, { "epoch": 1.7076923076923078, "grad_norm": 0.19749584794044495, "learning_rate": 2.9948364888123926e-05, "loss": 0.4242, "num_input_tokens_seen": 8126750, "step": 500, "train_runtime": 1303.2477, "train_tokens_per_second": 6235.768 }, { "epoch": 1.7111111111111112, "grad_norm": 0.171902135014534, "learning_rate": 2.9604130808950087e-05, "loss": 0.3748, "num_input_tokens_seen": 8144766, "step": 501, "train_runtime": 1305.8965, "train_tokens_per_second": 6236.915 }, { "epoch": 1.7145299145299147, "grad_norm": 0.15472909808158875, "learning_rate": 2.925989672977625e-05, "loss": 0.3657, "num_input_tokens_seen": 8164254, "step": 502, "train_runtime": 1308.7049, "train_tokens_per_second": 6238.423 }, { "epoch": 1.717948717948718, "grad_norm": 0.1825917810201645, "learning_rate": 2.891566265060241e-05, "loss": 0.3551, "num_input_tokens_seen": 8178510, "step": 503, "train_runtime": 1310.798, "train_tokens_per_second": 6239.337 }, { "epoch": 1.7213675213675215, "grad_norm": 0.1650628000497818, "learning_rate": 2.857142857142857e-05, "loss": 0.3871, "num_input_tokens_seen": 8196702, "step": 504, "train_runtime": 1313.4498, "train_tokens_per_second": 6240.59 }, { "epoch": 1.7247863247863249, "grad_norm": 0.17389492690563202, "learning_rate": 2.8227194492254732e-05, "loss": 0.3691, "num_input_tokens_seen": 8216254, "step": 505, "train_runtime": 1316.2774, "train_tokens_per_second": 6242.038 }, { "epoch": 1.7282051282051283, "grad_norm": 0.17346595227718353, "learning_rate": 2.7882960413080893e-05, "loss": 0.4057, "num_input_tokens_seen": 8233758, "step": 506, "train_runtime": 1318.8695, "train_tokens_per_second": 6243.042 }, { "epoch": 1.7316239316239317, "grad_norm": 0.15873438119888306, "learning_rate": 2.7538726333907055e-05, "loss": 0.332, "num_input_tokens_seen": 8247550, "step": 507, "train_runtime": 1320.9274, "train_tokens_per_second": 6243.757 }, { "epoch": 1.735042735042735, "grad_norm": 0.17913693189620972, "learning_rate": 2.7194492254733223e-05, "loss": 0.3435, "num_input_tokens_seen": 8263054, "step": 508, "train_runtime": 1323.2116, "train_tokens_per_second": 6244.696 }, { "epoch": 1.7384615384615385, "grad_norm": 0.15651476383209229, "learning_rate": 2.6850258175559384e-05, "loss": 0.3343, "num_input_tokens_seen": 8278046, "step": 509, "train_runtime": 1325.4232, "train_tokens_per_second": 6245.587 }, { "epoch": 1.741880341880342, "grad_norm": 0.17296011745929718, "learning_rate": 2.6506024096385545e-05, "loss": 0.4069, "num_input_tokens_seen": 8295214, "step": 510, "train_runtime": 1327.9451, "train_tokens_per_second": 6246.654 }, { "epoch": 1.7452991452991453, "grad_norm": 0.18028153479099274, "learning_rate": 2.6161790017211706e-05, "loss": 0.3585, "num_input_tokens_seen": 8312942, "step": 511, "train_runtime": 1331.0641, "train_tokens_per_second": 6245.336 }, { "epoch": 1.7487179487179487, "grad_norm": 0.18217986822128296, "learning_rate": 2.5817555938037867e-05, "loss": 0.3445, "num_input_tokens_seen": 8329982, "step": 512, "train_runtime": 1333.576, "train_tokens_per_second": 6246.35 }, { "epoch": 1.7521367521367521, "grad_norm": 0.17503562569618225, "learning_rate": 2.547332185886403e-05, "loss": 0.3677, "num_input_tokens_seen": 8341998, "step": 513, "train_runtime": 1335.4087, "train_tokens_per_second": 6246.775 }, { "epoch": 1.7555555555555555, "grad_norm": 0.12160934507846832, "learning_rate": 2.512908777969019e-05, "loss": 0.282, "num_input_tokens_seen": 8371790, "step": 514, "train_runtime": 1339.6445, "train_tokens_per_second": 6249.262 }, { "epoch": 1.758974358974359, "grad_norm": 0.1700914204120636, "learning_rate": 2.478485370051635e-05, "loss": 0.4006, "num_input_tokens_seen": 8390766, "step": 515, "train_runtime": 1342.3857, "train_tokens_per_second": 6250.637 }, { "epoch": 1.7623931623931623, "grad_norm": 0.18512286245822906, "learning_rate": 2.4440619621342516e-05, "loss": 0.4371, "num_input_tokens_seen": 8401710, "step": 516, "train_runtime": 1344.1099, "train_tokens_per_second": 6250.761 }, { "epoch": 1.7658119658119658, "grad_norm": 0.1791275441646576, "learning_rate": 2.4096385542168677e-05, "loss": 0.3738, "num_input_tokens_seen": 8418446, "step": 517, "train_runtime": 1346.5498, "train_tokens_per_second": 6251.864 }, { "epoch": 1.7692307692307692, "grad_norm": 0.18900056183338165, "learning_rate": 2.3752151462994838e-05, "loss": 0.4529, "num_input_tokens_seen": 8430590, "step": 518, "train_runtime": 1348.3721, "train_tokens_per_second": 6252.421 }, { "epoch": 1.7726495726495726, "grad_norm": 0.1776425540447235, "learning_rate": 2.3407917383821e-05, "loss": 0.3513, "num_input_tokens_seen": 8450318, "step": 519, "train_runtime": 1351.2218, "train_tokens_per_second": 6253.835 }, { "epoch": 1.776068376068376, "grad_norm": 0.18933919072151184, "learning_rate": 2.306368330464716e-05, "loss": 0.3775, "num_input_tokens_seen": 8464190, "step": 520, "train_runtime": 1353.2852, "train_tokens_per_second": 6254.55 }, { "epoch": 1.7794871794871794, "grad_norm": 0.1620868742465973, "learning_rate": 2.2719449225473325e-05, "loss": 0.4034, "num_input_tokens_seen": 8483038, "step": 521, "train_runtime": 1356.0363, "train_tokens_per_second": 6255.76 }, { "epoch": 1.7829059829059828, "grad_norm": 0.16931356489658356, "learning_rate": 2.2375215146299486e-05, "loss": 0.3733, "num_input_tokens_seen": 8499278, "step": 522, "train_runtime": 1358.4322, "train_tokens_per_second": 6256.682 }, { "epoch": 1.7863247863247862, "grad_norm": 0.1474018692970276, "learning_rate": 2.2030981067125648e-05, "loss": 0.3131, "num_input_tokens_seen": 8518766, "step": 523, "train_runtime": 1361.2451, "train_tokens_per_second": 6258.069 }, { "epoch": 1.7897435897435896, "grad_norm": 0.16736820340156555, "learning_rate": 2.168674698795181e-05, "loss": 0.3634, "num_input_tokens_seen": 8534430, "step": 524, "train_runtime": 1363.5049, "train_tokens_per_second": 6259.186 }, { "epoch": 1.793162393162393, "grad_norm": 0.17213431000709534, "learning_rate": 2.134251290877797e-05, "loss": 0.3632, "num_input_tokens_seen": 8546862, "step": 525, "train_runtime": 1365.3454, "train_tokens_per_second": 6259.853 }, { "epoch": 1.7965811965811964, "grad_norm": 0.19592760503292084, "learning_rate": 2.099827882960413e-05, "loss": 0.381, "num_input_tokens_seen": 8561358, "step": 526, "train_runtime": 1367.5092, "train_tokens_per_second": 6260.549 }, { "epoch": 1.8, "grad_norm": 0.1715427190065384, "learning_rate": 2.0654044750430293e-05, "loss": 0.4199, "num_input_tokens_seen": 8581310, "step": 527, "train_runtime": 1370.3773, "train_tokens_per_second": 6262.005 }, { "epoch": 1.8034188034188035, "grad_norm": 0.194061741232872, "learning_rate": 2.0309810671256454e-05, "loss": 0.3965, "num_input_tokens_seen": 8592766, "step": 528, "train_runtime": 1372.1254, "train_tokens_per_second": 6262.376 }, { "epoch": 1.8068376068376069, "grad_norm": 0.1930086761713028, "learning_rate": 1.9965576592082615e-05, "loss": 0.3976, "num_input_tokens_seen": 8607166, "step": 529, "train_runtime": 1374.2507, "train_tokens_per_second": 6263.17 }, { "epoch": 1.8102564102564103, "grad_norm": 0.16003040969371796, "learning_rate": 1.962134251290878e-05, "loss": 0.3367, "num_input_tokens_seen": 8622478, "step": 530, "train_runtime": 1376.5089, "train_tokens_per_second": 6264.019 }, { "epoch": 1.8136752136752137, "grad_norm": 0.19035999476909637, "learning_rate": 1.927710843373494e-05, "loss": 0.5509, "num_input_tokens_seen": 8637918, "step": 531, "train_runtime": 1378.7679, "train_tokens_per_second": 6264.954 }, { "epoch": 1.8136752136752137, "eval_loss": 0.4248267114162445, "eval_runtime": 11.8853, "eval_samples_per_second": 83.969, "eval_steps_per_second": 5.301, "num_input_tokens_seen": 8637918, "step": 531 }, { "epoch": 1.817094017094017, "grad_norm": 0.17047119140625, "learning_rate": 1.8932874354561102e-05, "loss": 0.3973, "num_input_tokens_seen": 8656606, "step": 532, "train_runtime": 1393.3816, "train_tokens_per_second": 6212.66 }, { "epoch": 1.8205128205128205, "grad_norm": 0.1665705293416977, "learning_rate": 1.8588640275387263e-05, "loss": 0.4401, "num_input_tokens_seen": 8675454, "step": 533, "train_runtime": 1396.1479, "train_tokens_per_second": 6213.85 }, { "epoch": 1.823931623931624, "grad_norm": 0.18982985615730286, "learning_rate": 1.8244406196213425e-05, "loss": 0.4021, "num_input_tokens_seen": 8690142, "step": 534, "train_runtime": 1398.3083, "train_tokens_per_second": 6214.754 }, { "epoch": 1.8273504273504273, "grad_norm": 0.16096247732639313, "learning_rate": 1.790017211703959e-05, "loss": 0.4033, "num_input_tokens_seen": 8706558, "step": 535, "train_runtime": 1400.6804, "train_tokens_per_second": 6215.949 }, { "epoch": 1.830769230769231, "grad_norm": 0.1925681084394455, "learning_rate": 1.755593803786575e-05, "loss": 0.4394, "num_input_tokens_seen": 8722270, "step": 536, "train_runtime": 1402.9974, "train_tokens_per_second": 6216.882 }, { "epoch": 1.8341880341880343, "grad_norm": 0.18180759251117706, "learning_rate": 1.721170395869191e-05, "loss": 0.4643, "num_input_tokens_seen": 8737982, "step": 537, "train_runtime": 1405.3075, "train_tokens_per_second": 6217.844 }, { "epoch": 1.8376068376068377, "grad_norm": 0.1800447255373001, "learning_rate": 1.6867469879518073e-05, "loss": 0.6214, "num_input_tokens_seen": 8753838, "step": 538, "train_runtime": 1407.6382, "train_tokens_per_second": 6218.812 }, { "epoch": 1.8410256410256411, "grad_norm": 0.18196427822113037, "learning_rate": 1.6523235800344237e-05, "loss": 0.3515, "num_input_tokens_seen": 8767294, "step": 539, "train_runtime": 1409.6646, "train_tokens_per_second": 6219.418 }, { "epoch": 1.8444444444444446, "grad_norm": 0.1552770733833313, "learning_rate": 1.61790017211704e-05, "loss": 0.3492, "num_input_tokens_seen": 8790974, "step": 540, "train_runtime": 1413.0808, "train_tokens_per_second": 6221.14 }, { "epoch": 1.847863247863248, "grad_norm": 0.17243799567222595, "learning_rate": 1.583476764199656e-05, "loss": 0.4604, "num_input_tokens_seen": 8802782, "step": 541, "train_runtime": 1415.3829, "train_tokens_per_second": 6219.364 }, { "epoch": 1.8512820512820514, "grad_norm": 0.1819770187139511, "learning_rate": 1.549053356282272e-05, "loss": 0.4274, "num_input_tokens_seen": 8818334, "step": 542, "train_runtime": 1417.6847, "train_tokens_per_second": 6220.237 }, { "epoch": 1.8547008547008548, "grad_norm": 0.17073139548301697, "learning_rate": 1.5146299483648882e-05, "loss": 0.4203, "num_input_tokens_seen": 8837166, "step": 543, "train_runtime": 1420.4111, "train_tokens_per_second": 6221.555 }, { "epoch": 1.8581196581196582, "grad_norm": 0.1646145135164261, "learning_rate": 1.4802065404475044e-05, "loss": 0.3531, "num_input_tokens_seen": 8854318, "step": 544, "train_runtime": 1422.8958, "train_tokens_per_second": 6222.745 }, { "epoch": 1.8615384615384616, "grad_norm": 0.21891261637210846, "learning_rate": 1.4457831325301205e-05, "loss": 0.4048, "num_input_tokens_seen": 8867102, "step": 545, "train_runtime": 1424.813, "train_tokens_per_second": 6223.345 }, { "epoch": 1.864957264957265, "grad_norm": 0.2045115977525711, "learning_rate": 1.4113597246127366e-05, "loss": 0.5021, "num_input_tokens_seen": 8880990, "step": 546, "train_runtime": 1426.8816, "train_tokens_per_second": 6224.055 }, { "epoch": 1.8683760683760684, "grad_norm": 0.18179452419281006, "learning_rate": 1.3769363166953527e-05, "loss": 0.4367, "num_input_tokens_seen": 8895422, "step": 547, "train_runtime": 1429.0398, "train_tokens_per_second": 6224.754 }, { "epoch": 1.8717948717948718, "grad_norm": 0.1890801042318344, "learning_rate": 1.3425129087779692e-05, "loss": 0.3696, "num_input_tokens_seen": 8908718, "step": 548, "train_runtime": 1431.0057, "train_tokens_per_second": 6225.495 }, { "epoch": 1.8752136752136752, "grad_norm": 0.1882188469171524, "learning_rate": 1.3080895008605853e-05, "loss": 0.4208, "num_input_tokens_seen": 8923086, "step": 549, "train_runtime": 1433.137, "train_tokens_per_second": 6226.262 }, { "epoch": 1.8786324786324786, "grad_norm": 0.168639674782753, "learning_rate": 1.2736660929432014e-05, "loss": 0.3938, "num_input_tokens_seen": 8941022, "step": 550, "train_runtime": 1435.7111, "train_tokens_per_second": 6227.591 }, { "epoch": 1.882051282051282, "grad_norm": 0.21191436052322388, "learning_rate": 1.2392426850258176e-05, "loss": 0.3797, "num_input_tokens_seen": 8951518, "step": 551, "train_runtime": 1437.3232, "train_tokens_per_second": 6227.909 }, { "epoch": 1.8854700854700854, "grad_norm": 0.17271479964256287, "learning_rate": 1.2048192771084338e-05, "loss": 0.3924, "num_input_tokens_seen": 8967406, "step": 552, "train_runtime": 1439.697, "train_tokens_per_second": 6228.676 }, { "epoch": 1.8888888888888888, "grad_norm": 0.17815494537353516, "learning_rate": 1.17039586919105e-05, "loss": 0.3984, "num_input_tokens_seen": 8980910, "step": 553, "train_runtime": 1441.6466, "train_tokens_per_second": 6229.619 }, { "epoch": 1.8923076923076922, "grad_norm": 0.18840882182121277, "learning_rate": 1.1359724612736663e-05, "loss": 0.4698, "num_input_tokens_seen": 8996702, "step": 554, "train_runtime": 1444.0033, "train_tokens_per_second": 6230.389 }, { "epoch": 1.8957264957264957, "grad_norm": 0.17246229946613312, "learning_rate": 1.1015490533562824e-05, "loss": 0.3294, "num_input_tokens_seen": 9014414, "step": 555, "train_runtime": 1446.5743, "train_tokens_per_second": 6231.56 }, { "epoch": 1.899145299145299, "grad_norm": 0.20323026180267334, "learning_rate": 1.0671256454388985e-05, "loss": 0.4267, "num_input_tokens_seen": 9031550, "step": 556, "train_runtime": 1449.0794, "train_tokens_per_second": 6232.612 }, { "epoch": 1.9025641025641025, "grad_norm": 0.17592619359493256, "learning_rate": 1.0327022375215146e-05, "loss": 0.3815, "num_input_tokens_seen": 9048238, "step": 557, "train_runtime": 1451.4988, "train_tokens_per_second": 6233.721 }, { "epoch": 1.9059829059829059, "grad_norm": 0.16363990306854248, "learning_rate": 9.982788296041308e-06, "loss": 0.3811, "num_input_tokens_seen": 9066494, "step": 558, "train_runtime": 1454.1349, "train_tokens_per_second": 6234.975 }, { "epoch": 1.9094017094017093, "grad_norm": 0.1940564066171646, "learning_rate": 9.63855421686747e-06, "loss": 0.3237, "num_input_tokens_seen": 9079822, "step": 559, "train_runtime": 1456.1609, "train_tokens_per_second": 6235.453 }, { "epoch": 1.9128205128205127, "grad_norm": 0.2036203294992447, "learning_rate": 9.294320137693632e-06, "loss": 0.4353, "num_input_tokens_seen": 9091598, "step": 560, "train_runtime": 1457.9853, "train_tokens_per_second": 6235.727 }, { "epoch": 1.916239316239316, "grad_norm": 0.18901148438453674, "learning_rate": 8.950086058519795e-06, "loss": 0.4001, "num_input_tokens_seen": 9104990, "step": 561, "train_runtime": 1460.0107, "train_tokens_per_second": 6236.249 }, { "epoch": 1.9196581196581195, "grad_norm": 0.18928927183151245, "learning_rate": 8.605851979345956e-06, "loss": 0.3813, "num_input_tokens_seen": 9119310, "step": 562, "train_runtime": 1462.1634, "train_tokens_per_second": 6236.861 }, { "epoch": 1.9230769230769231, "grad_norm": 0.1698116660118103, "learning_rate": 8.261617900172119e-06, "loss": 0.3993, "num_input_tokens_seen": 9134702, "step": 563, "train_runtime": 1464.4317, "train_tokens_per_second": 6237.711 }, { "epoch": 1.9264957264957265, "grad_norm": 0.1814728081226349, "learning_rate": 7.91738382099828e-06, "loss": 0.4208, "num_input_tokens_seen": 9147822, "step": 564, "train_runtime": 1466.388, "train_tokens_per_second": 6238.336 }, { "epoch": 1.92991452991453, "grad_norm": 0.18567024171352386, "learning_rate": 7.573149741824441e-06, "loss": 0.4371, "num_input_tokens_seen": 9164110, "step": 565, "train_runtime": 1468.7747, "train_tokens_per_second": 6239.289 }, { "epoch": 1.9333333333333333, "grad_norm": 0.2137572318315506, "learning_rate": 7.228915662650602e-06, "loss": 0.3899, "num_input_tokens_seen": 9174894, "step": 566, "train_runtime": 1470.4523, "train_tokens_per_second": 6239.505 }, { "epoch": 1.9367521367521368, "grad_norm": 0.15320739150047302, "learning_rate": 6.884681583476764e-06, "loss": 0.3531, "num_input_tokens_seen": 9191886, "step": 567, "train_runtime": 1472.9549, "train_tokens_per_second": 6240.44 }, { "epoch": 1.9401709401709402, "grad_norm": 0.21417830884456635, "learning_rate": 6.5404475043029266e-06, "loss": 0.4213, "num_input_tokens_seen": 9203742, "step": 568, "train_runtime": 1474.745, "train_tokens_per_second": 6240.904 }, { "epoch": 1.9435897435897436, "grad_norm": 0.1843339502811432, "learning_rate": 6.196213425129088e-06, "loss": 0.374, "num_input_tokens_seen": 9216110, "step": 569, "train_runtime": 1476.6219, "train_tokens_per_second": 6241.347 }, { "epoch": 1.947008547008547, "grad_norm": 0.16858874261379242, "learning_rate": 5.85197934595525e-06, "loss": 0.3967, "num_input_tokens_seen": 9232750, "step": 570, "train_runtime": 1479.0428, "train_tokens_per_second": 6242.382 }, { "epoch": 1.9504273504273504, "grad_norm": 0.21565116941928864, "learning_rate": 5.507745266781412e-06, "loss": 0.4639, "num_input_tokens_seen": 9244110, "step": 571, "train_runtime": 1481.2963, "train_tokens_per_second": 6240.554 }, { "epoch": 1.953846153846154, "grad_norm": 0.17212358117103577, "learning_rate": 5.163511187607573e-06, "loss": 0.4541, "num_input_tokens_seen": 9260670, "step": 572, "train_runtime": 1483.7253, "train_tokens_per_second": 6241.499 }, { "epoch": 1.9572649572649574, "grad_norm": 0.16098545491695404, "learning_rate": 4.819277108433735e-06, "loss": 0.3808, "num_input_tokens_seen": 9277182, "step": 573, "train_runtime": 1486.1266, "train_tokens_per_second": 6242.525 }, { "epoch": 1.9606837606837608, "grad_norm": 0.1885039359331131, "learning_rate": 4.475043029259897e-06, "loss": 0.4711, "num_input_tokens_seen": 9291486, "step": 574, "train_runtime": 1488.2625, "train_tokens_per_second": 6243.177 }, { "epoch": 1.9641025641025642, "grad_norm": 0.17435158789157867, "learning_rate": 4.130808950086059e-06, "loss": 0.3834, "num_input_tokens_seen": 9307182, "step": 575, "train_runtime": 1490.6012, "train_tokens_per_second": 6243.911 }, { "epoch": 1.9675213675213676, "grad_norm": 0.17134054005146027, "learning_rate": 3.7865748709122206e-06, "loss": 0.3521, "num_input_tokens_seen": 9324318, "step": 576, "train_runtime": 1493.1064, "train_tokens_per_second": 6244.912 }, { "epoch": 1.970940170940171, "grad_norm": 0.18249361217021942, "learning_rate": 3.442340791738382e-06, "loss": 0.3362, "num_input_tokens_seen": 9338622, "step": 577, "train_runtime": 1495.2539, "train_tokens_per_second": 6245.509 }, { "epoch": 1.9743589743589745, "grad_norm": 0.17978602647781372, "learning_rate": 3.098106712564544e-06, "loss": 0.4274, "num_input_tokens_seen": 9353918, "step": 578, "train_runtime": 1497.5034, "train_tokens_per_second": 6246.342 }, { "epoch": 1.9777777777777779, "grad_norm": 0.14672812819480896, "learning_rate": 2.753872633390706e-06, "loss": 0.314, "num_input_tokens_seen": 9390878, "step": 579, "train_runtime": 1502.7758, "train_tokens_per_second": 6249.021 }, { "epoch": 1.9811965811965813, "grad_norm": 0.19798055291175842, "learning_rate": 2.4096385542168676e-06, "loss": 0.4314, "num_input_tokens_seen": 9404654, "step": 580, "train_runtime": 1504.8242, "train_tokens_per_second": 6249.67 }, { "epoch": 1.9846153846153847, "grad_norm": 0.1839577704668045, "learning_rate": 2.0654044750430297e-06, "loss": 0.346, "num_input_tokens_seen": 9421838, "step": 581, "train_runtime": 1507.3329, "train_tokens_per_second": 6250.668 }, { "epoch": 1.988034188034188, "grad_norm": 0.1459440439939499, "learning_rate": 1.721170395869191e-06, "loss": 0.302, "num_input_tokens_seen": 9450766, "step": 582, "train_runtime": 1511.4289, "train_tokens_per_second": 6252.868 }, { "epoch": 1.9914529914529915, "grad_norm": 0.1679002195596695, "learning_rate": 1.376936316695353e-06, "loss": 0.3794, "num_input_tokens_seen": 9467966, "step": 583, "train_runtime": 1513.9495, "train_tokens_per_second": 6253.819 }, { "epoch": 1.994871794871795, "grad_norm": 0.18191100656986237, "learning_rate": 1.0327022375215148e-06, "loss": 0.4131, "num_input_tokens_seen": 9482622, "step": 584, "train_runtime": 1516.0908, "train_tokens_per_second": 6254.653 }, { "epoch": 1.9982905982905983, "grad_norm": 0.17011763155460358, "learning_rate": 6.884681583476765e-07, "loss": 0.3366, "num_input_tokens_seen": 9497966, "step": 585, "train_runtime": 1518.3683, "train_tokens_per_second": 6255.377 }, { "epoch": 2.0, "grad_norm": 0.23105928301811218, "learning_rate": 3.4423407917383825e-07, "loss": 0.3455, "num_input_tokens_seen": 9505226, "step": 586, "train_runtime": 1519.4393, "train_tokens_per_second": 6255.746 } ], "logging_steps": 1, "max_steps": 586, "num_input_tokens_seen": 9505226, "num_train_epochs": 2, "save_steps": 30, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.055493629648671e+17, "train_batch_size": 16, "trial_name": null, "trial_params": null }