Qwen2.5-7B-Instruct-Code-Unsloth / trainer_state.json
FormlessAI's picture
Upload folder using huggingface_hub
628acd2 verified
Raw
History Blame Contribute Delete
173 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 59,
"global_step": 586,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.003418803418803419,
"grad_norm": 0.7900828123092651,
"learning_rate": 0.0,
"loss": 1.4756,
"num_input_tokens_seen": 16096,
"step": 1,
"train_runtime": 4.4851,
"train_tokens_per_second": 3588.771
},
{
"epoch": 0.006837606837606838,
"grad_norm": 0.8550273180007935,
"learning_rate": 4e-05,
"loss": 1.4762,
"num_input_tokens_seen": 31264,
"step": 2,
"train_runtime": 6.6431,
"train_tokens_per_second": 4706.205
},
{
"epoch": 0.010256410256410256,
"grad_norm": 0.7560146450996399,
"learning_rate": 8e-05,
"loss": 1.3375,
"num_input_tokens_seen": 45584,
"step": 3,
"train_runtime": 8.7724,
"train_tokens_per_second": 5196.291
},
{
"epoch": 0.013675213675213675,
"grad_norm": 0.6870028376579285,
"learning_rate": 0.00012,
"loss": 1.0514,
"num_input_tokens_seen": 75072,
"step": 4,
"train_runtime": 13.0746,
"train_tokens_per_second": 5741.815
},
{
"epoch": 0.017094017094017096,
"grad_norm": 1.0243306159973145,
"learning_rate": 0.00016,
"loss": 1.1457,
"num_input_tokens_seen": 93296,
"step": 5,
"train_runtime": 15.6571,
"train_tokens_per_second": 5958.706
},
{
"epoch": 0.020512820512820513,
"grad_norm": 0.9480018019676208,
"learning_rate": 0.0002,
"loss": 0.8195,
"num_input_tokens_seen": 108880,
"step": 6,
"train_runtime": 17.9212,
"train_tokens_per_second": 6075.488
},
{
"epoch": 0.023931623931623933,
"grad_norm": 0.6540018320083618,
"learning_rate": 0.00019965576592082616,
"loss": 0.6109,
"num_input_tokens_seen": 124688,
"step": 7,
"train_runtime": 20.1568,
"train_tokens_per_second": 6185.907
},
{
"epoch": 0.02735042735042735,
"grad_norm": 0.28220847249031067,
"learning_rate": 0.00019931153184165235,
"loss": 0.5465,
"num_input_tokens_seen": 141552,
"step": 8,
"train_runtime": 22.5656,
"train_tokens_per_second": 6272.909
},
{
"epoch": 0.03076923076923077,
"grad_norm": 0.18244771659374237,
"learning_rate": 0.0001989672977624785,
"loss": 0.4196,
"num_input_tokens_seen": 156656,
"step": 9,
"train_runtime": 24.7703,
"train_tokens_per_second": 6324.342
},
{
"epoch": 0.03418803418803419,
"grad_norm": 0.19386130571365356,
"learning_rate": 0.00019862306368330465,
"loss": 0.4848,
"num_input_tokens_seen": 175424,
"step": 10,
"train_runtime": 27.4449,
"train_tokens_per_second": 6391.856
},
{
"epoch": 0.037606837606837605,
"grad_norm": 0.21845291554927826,
"learning_rate": 0.0001982788296041308,
"loss": 0.4163,
"num_input_tokens_seen": 191904,
"step": 11,
"train_runtime": 29.8233,
"train_tokens_per_second": 6434.711
},
{
"epoch": 0.041025641025641026,
"grad_norm": 0.2227926403284073,
"learning_rate": 0.000197934595524957,
"loss": 0.5241,
"num_input_tokens_seen": 204480,
"step": 12,
"train_runtime": 31.6741,
"train_tokens_per_second": 6455.753
},
{
"epoch": 0.044444444444444446,
"grad_norm": 0.14958512783050537,
"learning_rate": 0.00019759036144578314,
"loss": 0.3789,
"num_input_tokens_seen": 222928,
"step": 13,
"train_runtime": 34.2727,
"train_tokens_per_second": 6504.542
},
{
"epoch": 0.04786324786324787,
"grad_norm": 0.12511517107486725,
"learning_rate": 0.0001972461273666093,
"loss": 0.4255,
"num_input_tokens_seen": 243248,
"step": 14,
"train_runtime": 37.1309,
"train_tokens_per_second": 6551.089
},
{
"epoch": 0.05128205128205128,
"grad_norm": 0.12351791560649872,
"learning_rate": 0.00019690189328743548,
"loss": 0.4773,
"num_input_tokens_seen": 259984,
"step": 15,
"train_runtime": 39.5774,
"train_tokens_per_second": 6569.005
},
{
"epoch": 0.0547008547008547,
"grad_norm": 0.15381421148777008,
"learning_rate": 0.00019655765920826164,
"loss": 0.572,
"num_input_tokens_seen": 273488,
"step": 16,
"train_runtime": 41.5599,
"train_tokens_per_second": 6580.574
},
{
"epoch": 0.05811965811965812,
"grad_norm": 0.12012167274951935,
"learning_rate": 0.0001962134251290878,
"loss": 0.4824,
"num_input_tokens_seen": 289072,
"step": 17,
"train_runtime": 43.7917,
"train_tokens_per_second": 6601.074
},
{
"epoch": 0.06153846153846154,
"grad_norm": 0.12363950163125992,
"learning_rate": 0.00019586919104991394,
"loss": 0.4198,
"num_input_tokens_seen": 303408,
"step": 18,
"train_runtime": 45.8994,
"train_tokens_per_second": 6610.276
},
{
"epoch": 0.06495726495726496,
"grad_norm": 0.13709434866905212,
"learning_rate": 0.00019552495697074013,
"loss": 0.5045,
"num_input_tokens_seen": 321088,
"step": 19,
"train_runtime": 48.4273,
"train_tokens_per_second": 6630.309
},
{
"epoch": 0.06837606837606838,
"grad_norm": 0.11719892919063568,
"learning_rate": 0.00019518072289156628,
"loss": 0.444,
"num_input_tokens_seen": 339024,
"step": 20,
"train_runtime": 51.0105,
"train_tokens_per_second": 6646.155
},
{
"epoch": 0.07179487179487179,
"grad_norm": 0.1195915937423706,
"learning_rate": 0.00019483648881239243,
"loss": 0.4404,
"num_input_tokens_seen": 355648,
"step": 21,
"train_runtime": 53.4008,
"train_tokens_per_second": 6659.98
},
{
"epoch": 0.07521367521367521,
"grad_norm": 0.12735435366630554,
"learning_rate": 0.0001944922547332186,
"loss": 0.4253,
"num_input_tokens_seen": 377104,
"step": 22,
"train_runtime": 58.0087,
"train_tokens_per_second": 6500.816
},
{
"epoch": 0.07863247863247863,
"grad_norm": 0.13012833893299103,
"learning_rate": 0.00019414802065404477,
"loss": 0.4549,
"num_input_tokens_seen": 388496,
"step": 23,
"train_runtime": 59.7134,
"train_tokens_per_second": 6506.008
},
{
"epoch": 0.08205128205128205,
"grad_norm": 0.1187860295176506,
"learning_rate": 0.00019380378657487093,
"loss": 0.4447,
"num_input_tokens_seen": 405136,
"step": 24,
"train_runtime": 62.1253,
"train_tokens_per_second": 6521.268
},
{
"epoch": 0.08547008547008547,
"grad_norm": 0.12317577004432678,
"learning_rate": 0.0001934595524956971,
"loss": 0.4326,
"num_input_tokens_seen": 421088,
"step": 25,
"train_runtime": 64.4069,
"train_tokens_per_second": 6537.935
},
{
"epoch": 0.08888888888888889,
"grad_norm": 0.12564784288406372,
"learning_rate": 0.00019311531841652323,
"loss": 0.4521,
"num_input_tokens_seen": 435328,
"step": 26,
"train_runtime": 66.5043,
"train_tokens_per_second": 6545.86
},
{
"epoch": 0.09230769230769231,
"grad_norm": 0.10685139149427414,
"learning_rate": 0.00019277108433734942,
"loss": 0.4642,
"num_input_tokens_seen": 451968,
"step": 27,
"train_runtime": 68.9138,
"train_tokens_per_second": 6558.455
},
{
"epoch": 0.09572649572649573,
"grad_norm": 0.11094007641077042,
"learning_rate": 0.00019242685025817557,
"loss": 0.4877,
"num_input_tokens_seen": 464928,
"step": 28,
"train_runtime": 70.8316,
"train_tokens_per_second": 6563.853
},
{
"epoch": 0.09914529914529914,
"grad_norm": 0.1094178631901741,
"learning_rate": 0.00019208261617900175,
"loss": 0.5,
"num_input_tokens_seen": 479280,
"step": 29,
"train_runtime": 72.9759,
"train_tokens_per_second": 6567.645
},
{
"epoch": 0.10256410256410256,
"grad_norm": 0.09002909064292908,
"learning_rate": 0.00019173838209982788,
"loss": 0.3389,
"num_input_tokens_seen": 496320,
"step": 30,
"train_runtime": 75.4421,
"train_tokens_per_second": 6578.822
},
{
"epoch": 0.10598290598290598,
"grad_norm": 0.10585018992424011,
"learning_rate": 0.00019139414802065406,
"loss": 0.4548,
"num_input_tokens_seen": 511296,
"step": 31,
"train_runtime": 78.2326,
"train_tokens_per_second": 6535.59
},
{
"epoch": 0.1094017094017094,
"grad_norm": 0.09583117812871933,
"learning_rate": 0.00019104991394148021,
"loss": 0.4003,
"num_input_tokens_seen": 529008,
"step": 32,
"train_runtime": 80.7656,
"train_tokens_per_second": 6549.918
},
{
"epoch": 0.11282051282051282,
"grad_norm": 0.1044701486825943,
"learning_rate": 0.0001907056798623064,
"loss": 0.4673,
"num_input_tokens_seen": 544384,
"step": 33,
"train_runtime": 83.0622,
"train_tokens_per_second": 6553.935
},
{
"epoch": 0.11623931623931624,
"grad_norm": 0.10936785489320755,
"learning_rate": 0.00019036144578313252,
"loss": 0.4197,
"num_input_tokens_seen": 562096,
"step": 34,
"train_runtime": 85.6158,
"train_tokens_per_second": 6565.333
},
{
"epoch": 0.11965811965811966,
"grad_norm": 0.08397576957941055,
"learning_rate": 0.0001900172117039587,
"loss": 0.3889,
"num_input_tokens_seen": 580704,
"step": 35,
"train_runtime": 88.3072,
"train_tokens_per_second": 6575.955
},
{
"epoch": 0.12307692307692308,
"grad_norm": 0.10643361508846283,
"learning_rate": 0.00018967297762478486,
"loss": 0.474,
"num_input_tokens_seen": 596128,
"step": 36,
"train_runtime": 90.568,
"train_tokens_per_second": 6582.102
},
{
"epoch": 0.1264957264957265,
"grad_norm": 0.11568325012922287,
"learning_rate": 0.00018932874354561104,
"loss": 0.4805,
"num_input_tokens_seen": 609488,
"step": 37,
"train_runtime": 92.5585,
"train_tokens_per_second": 6584.897
},
{
"epoch": 0.12991452991452992,
"grad_norm": 0.1005433201789856,
"learning_rate": 0.00018898450946643717,
"loss": 0.3679,
"num_input_tokens_seen": 624592,
"step": 38,
"train_runtime": 94.7955,
"train_tokens_per_second": 6588.837
},
{
"epoch": 0.13333333333333333,
"grad_norm": 0.0977381095290184,
"learning_rate": 0.00018864027538726335,
"loss": 0.4141,
"num_input_tokens_seen": 639840,
"step": 39,
"train_runtime": 97.0423,
"train_tokens_per_second": 6593.411
},
{
"epoch": 0.13675213675213677,
"grad_norm": 0.11257043480873108,
"learning_rate": 0.0001882960413080895,
"loss": 0.5211,
"num_input_tokens_seen": 652048,
"step": 40,
"train_runtime": 98.9078,
"train_tokens_per_second": 6592.481
},
{
"epoch": 0.14017094017094017,
"grad_norm": 0.10306330025196075,
"learning_rate": 0.00018795180722891569,
"loss": 0.3752,
"num_input_tokens_seen": 670112,
"step": 41,
"train_runtime": 101.5158,
"train_tokens_per_second": 6601.063
},
{
"epoch": 0.14358974358974358,
"grad_norm": 0.07424470037221909,
"learning_rate": 0.00018760757314974184,
"loss": 0.2781,
"num_input_tokens_seen": 705168,
"step": 42,
"train_runtime": 106.5454,
"train_tokens_per_second": 6618.476
},
{
"epoch": 0.147008547008547,
"grad_norm": 0.09572459757328033,
"learning_rate": 0.000187263339070568,
"loss": 0.5014,
"num_input_tokens_seen": 720320,
"step": 43,
"train_runtime": 108.8037,
"train_tokens_per_second": 6620.362
},
{
"epoch": 0.15042735042735042,
"grad_norm": 0.09543762356042862,
"learning_rate": 0.00018691910499139415,
"loss": 0.4411,
"num_input_tokens_seen": 736032,
"step": 44,
"train_runtime": 111.1227,
"train_tokens_per_second": 6623.596
},
{
"epoch": 0.15384615384615385,
"grad_norm": 0.09599870443344116,
"learning_rate": 0.00018657487091222033,
"loss": 0.3435,
"num_input_tokens_seen": 750576,
"step": 45,
"train_runtime": 113.3125,
"train_tokens_per_second": 6623.948
},
{
"epoch": 0.15726495726495726,
"grad_norm": 0.0982552245259285,
"learning_rate": 0.00018623063683304649,
"loss": 0.5206,
"num_input_tokens_seen": 768944,
"step": 46,
"train_runtime": 115.975,
"train_tokens_per_second": 6630.256
},
{
"epoch": 0.1606837606837607,
"grad_norm": 0.10187075287103653,
"learning_rate": 0.00018588640275387264,
"loss": 0.4408,
"num_input_tokens_seen": 784144,
"step": 47,
"train_runtime": 118.2082,
"train_tokens_per_second": 6633.584
},
{
"epoch": 0.1641025641025641,
"grad_norm": 0.0859491378068924,
"learning_rate": 0.0001855421686746988,
"loss": 0.4154,
"num_input_tokens_seen": 804272,
"step": 48,
"train_runtime": 121.1095,
"train_tokens_per_second": 6640.864
},
{
"epoch": 0.1675213675213675,
"grad_norm": 0.08325184136629105,
"learning_rate": 0.00018519793459552498,
"loss": 0.4557,
"num_input_tokens_seen": 818224,
"step": 49,
"train_runtime": 123.1709,
"train_tokens_per_second": 6642.997
},
{
"epoch": 0.17094017094017094,
"grad_norm": 0.09160371869802475,
"learning_rate": 0.00018485370051635113,
"loss": 0.3976,
"num_input_tokens_seen": 837600,
"step": 50,
"train_runtime": 125.9707,
"train_tokens_per_second": 6649.167
},
{
"epoch": 0.17435897435897435,
"grad_norm": 0.08669862151145935,
"learning_rate": 0.00018450946643717729,
"loss": 0.4597,
"num_input_tokens_seen": 855360,
"step": 51,
"train_runtime": 128.5702,
"train_tokens_per_second": 6652.866
},
{
"epoch": 0.17777777777777778,
"grad_norm": 0.10008913278579712,
"learning_rate": 0.00018416523235800344,
"loss": 0.4608,
"num_input_tokens_seen": 869472,
"step": 52,
"train_runtime": 130.6754,
"train_tokens_per_second": 6653.679
},
{
"epoch": 0.1811965811965812,
"grad_norm": 0.08692440390586853,
"learning_rate": 0.00018382099827882962,
"loss": 0.4229,
"num_input_tokens_seen": 887936,
"step": 53,
"train_runtime": 133.3545,
"train_tokens_per_second": 6658.462
},
{
"epoch": 0.18461538461538463,
"grad_norm": 0.12537947297096252,
"learning_rate": 0.00018347676419965578,
"loss": 0.5767,
"num_input_tokens_seen": 902240,
"step": 54,
"train_runtime": 135.5092,
"train_tokens_per_second": 6658.146
},
{
"epoch": 0.18803418803418803,
"grad_norm": 0.08537557721138,
"learning_rate": 0.00018313253012048193,
"loss": 0.4519,
"num_input_tokens_seen": 920688,
"step": 55,
"train_runtime": 138.1817,
"train_tokens_per_second": 6662.881
},
{
"epoch": 0.19145299145299147,
"grad_norm": 0.09388847649097443,
"learning_rate": 0.00018278829604130808,
"loss": 0.4083,
"num_input_tokens_seen": 937024,
"step": 56,
"train_runtime": 140.574,
"train_tokens_per_second": 6665.697
},
{
"epoch": 0.19487179487179487,
"grad_norm": 0.12476610392332077,
"learning_rate": 0.00018244406196213427,
"loss": 0.457,
"num_input_tokens_seen": 949568,
"step": 57,
"train_runtime": 142.4521,
"train_tokens_per_second": 6665.875
},
{
"epoch": 0.19829059829059828,
"grad_norm": 0.11227541416883469,
"learning_rate": 0.00018209982788296042,
"loss": 0.4666,
"num_input_tokens_seen": 964000,
"step": 58,
"train_runtime": 144.5997,
"train_tokens_per_second": 6666.681
},
{
"epoch": 0.20170940170940171,
"grad_norm": 0.10149527341127396,
"learning_rate": 0.0001817555938037866,
"loss": 0.473,
"num_input_tokens_seen": 976560,
"step": 59,
"train_runtime": 146.4793,
"train_tokens_per_second": 6666.883
},
{
"epoch": 0.20170940170940171,
"eval_loss": 0.4301406145095825,
"eval_runtime": 11.8663,
"eval_samples_per_second": 84.104,
"eval_steps_per_second": 5.309,
"num_input_tokens_seen": 976560,
"step": 59
},
{
"epoch": 0.20512820512820512,
"grad_norm": 0.0855872854590416,
"learning_rate": 0.00018141135972461273,
"loss": 0.4248,
"num_input_tokens_seen": 992944,
"step": 60,
"train_runtime": 160.7566,
"train_tokens_per_second": 6176.693
},
{
"epoch": 0.20854700854700856,
"grad_norm": 0.11866864562034607,
"learning_rate": 0.0001810671256454389,
"loss": 0.537,
"num_input_tokens_seen": 1005920,
"step": 61,
"train_runtime": 163.2145,
"train_tokens_per_second": 6163.179
},
{
"epoch": 0.21196581196581196,
"grad_norm": 0.0955129861831665,
"learning_rate": 0.00018072289156626507,
"loss": 0.3983,
"num_input_tokens_seen": 1022704,
"step": 62,
"train_runtime": 165.6518,
"train_tokens_per_second": 6173.817
},
{
"epoch": 0.2153846153846154,
"grad_norm": 0.11176180094480515,
"learning_rate": 0.00018037865748709125,
"loss": 0.4392,
"num_input_tokens_seen": 1038928,
"step": 63,
"train_runtime": 168.0352,
"train_tokens_per_second": 6182.8
},
{
"epoch": 0.2188034188034188,
"grad_norm": 0.08749086409807205,
"learning_rate": 0.00018003442340791737,
"loss": 0.412,
"num_input_tokens_seen": 1057504,
"step": 64,
"train_runtime": 170.7322,
"train_tokens_per_second": 6193.934
},
{
"epoch": 0.2222222222222222,
"grad_norm": 0.10065372288227081,
"learning_rate": 0.00017969018932874356,
"loss": 0.4496,
"num_input_tokens_seen": 1071952,
"step": 65,
"train_runtime": 172.8869,
"train_tokens_per_second": 6200.307
},
{
"epoch": 0.22564102564102564,
"grad_norm": 0.09161035716533661,
"learning_rate": 0.0001793459552495697,
"loss": 0.4995,
"num_input_tokens_seen": 1091408,
"step": 66,
"train_runtime": 175.7012,
"train_tokens_per_second": 6211.727
},
{
"epoch": 0.22905982905982905,
"grad_norm": 0.08862069249153137,
"learning_rate": 0.0001790017211703959,
"loss": 0.4157,
"num_input_tokens_seen": 1107040,
"step": 67,
"train_runtime": 178.0171,
"train_tokens_per_second": 6218.728
},
{
"epoch": 0.23247863247863249,
"grad_norm": 0.09428606927394867,
"learning_rate": 0.00017865748709122202,
"loss": 0.4845,
"num_input_tokens_seen": 1121712,
"step": 68,
"train_runtime": 180.2346,
"train_tokens_per_second": 6223.624
},
{
"epoch": 0.2358974358974359,
"grad_norm": 0.1100679412484169,
"learning_rate": 0.0001783132530120482,
"loss": 0.4706,
"num_input_tokens_seen": 1135664,
"step": 69,
"train_runtime": 182.3342,
"train_tokens_per_second": 6228.477
},
{
"epoch": 0.23931623931623933,
"grad_norm": 0.10081252455711365,
"learning_rate": 0.00017796901893287436,
"loss": 0.4073,
"num_input_tokens_seen": 1154224,
"step": 70,
"train_runtime": 185.0219,
"train_tokens_per_second": 6238.31
},
{
"epoch": 0.24273504273504273,
"grad_norm": 0.08933307230472565,
"learning_rate": 0.00017762478485370054,
"loss": 0.4457,
"num_input_tokens_seen": 1171424,
"step": 71,
"train_runtime": 187.5554,
"train_tokens_per_second": 6245.75
},
{
"epoch": 0.24615384615384617,
"grad_norm": 0.0866895243525505,
"learning_rate": 0.00017728055077452666,
"loss": 0.3439,
"num_input_tokens_seen": 1189504,
"step": 72,
"train_runtime": 190.1853,
"train_tokens_per_second": 6254.449
},
{
"epoch": 0.24957264957264957,
"grad_norm": 0.09268927574157715,
"learning_rate": 0.00017693631669535285,
"loss": 0.4454,
"num_input_tokens_seen": 1207600,
"step": 73,
"train_runtime": 192.8217,
"train_tokens_per_second": 6262.782
},
{
"epoch": 0.252991452991453,
"grad_norm": 0.08207046240568161,
"learning_rate": 0.000176592082616179,
"loss": 0.4721,
"num_input_tokens_seen": 1227552,
"step": 74,
"train_runtime": 195.7293,
"train_tokens_per_second": 6271.682
},
{
"epoch": 0.2564102564102564,
"grad_norm": 0.08926599472761154,
"learning_rate": 0.00017624784853700518,
"loss": 0.5064,
"num_input_tokens_seen": 1245984,
"step": 75,
"train_runtime": 198.439,
"train_tokens_per_second": 6278.928
},
{
"epoch": 0.25982905982905985,
"grad_norm": 0.10555540025234222,
"learning_rate": 0.00017590361445783134,
"loss": 0.4264,
"num_input_tokens_seen": 1259536,
"step": 76,
"train_runtime": 200.4904,
"train_tokens_per_second": 6282.277
},
{
"epoch": 0.26324786324786326,
"grad_norm": 0.09617225080728531,
"learning_rate": 0.0001755593803786575,
"loss": 0.4686,
"num_input_tokens_seen": 1278768,
"step": 77,
"train_runtime": 203.2722,
"train_tokens_per_second": 6290.914
},
{
"epoch": 0.26666666666666666,
"grad_norm": 0.12434384226799011,
"learning_rate": 0.00017521514629948364,
"loss": 0.5939,
"num_input_tokens_seen": 1292928,
"step": 78,
"train_runtime": 205.3845,
"train_tokens_per_second": 6295.159
},
{
"epoch": 0.27008547008547007,
"grad_norm": 0.1012965589761734,
"learning_rate": 0.00017487091222030983,
"loss": 0.403,
"num_input_tokens_seen": 1310160,
"step": 79,
"train_runtime": 207.8738,
"train_tokens_per_second": 6302.671
},
{
"epoch": 0.27350427350427353,
"grad_norm": 0.08980307728052139,
"learning_rate": 0.00017452667814113598,
"loss": 0.3688,
"num_input_tokens_seen": 1328608,
"step": 80,
"train_runtime": 210.5562,
"train_tokens_per_second": 6309.993
},
{
"epoch": 0.27692307692307694,
"grad_norm": 0.09891822189092636,
"learning_rate": 0.00017418244406196214,
"loss": 0.4751,
"num_input_tokens_seen": 1346016,
"step": 81,
"train_runtime": 213.0979,
"train_tokens_per_second": 6316.422
},
{
"epoch": 0.28034188034188035,
"grad_norm": 0.10093598067760468,
"learning_rate": 0.0001738382099827883,
"loss": 0.5395,
"num_input_tokens_seen": 1359184,
"step": 82,
"train_runtime": 215.139,
"train_tokens_per_second": 6317.702
},
{
"epoch": 0.28376068376068375,
"grad_norm": 0.09215115010738373,
"learning_rate": 0.00017349397590361447,
"loss": 0.4067,
"num_input_tokens_seen": 1374384,
"step": 83,
"train_runtime": 217.3721,
"train_tokens_per_second": 6322.726
},
{
"epoch": 0.28717948717948716,
"grad_norm": 0.09286817163228989,
"learning_rate": 0.00017314974182444063,
"loss": 0.4327,
"num_input_tokens_seen": 1395312,
"step": 84,
"train_runtime": 220.3981,
"train_tokens_per_second": 6330.871
},
{
"epoch": 0.2905982905982906,
"grad_norm": 0.10269108414649963,
"learning_rate": 0.00017280550774526678,
"loss": 0.4137,
"num_input_tokens_seen": 1410480,
"step": 85,
"train_runtime": 222.6432,
"train_tokens_per_second": 6335.159
},
{
"epoch": 0.294017094017094,
"grad_norm": 0.11593605577945709,
"learning_rate": 0.00017246127366609296,
"loss": 0.488,
"num_input_tokens_seen": 1423008,
"step": 86,
"train_runtime": 224.5645,
"train_tokens_per_second": 6336.746
},
{
"epoch": 0.29743589743589743,
"grad_norm": 0.09121434390544891,
"learning_rate": 0.00017211703958691912,
"loss": 0.4372,
"num_input_tokens_seen": 1443008,
"step": 87,
"train_runtime": 227.4516,
"train_tokens_per_second": 6344.241
},
{
"epoch": 0.30085470085470084,
"grad_norm": 0.11658863723278046,
"learning_rate": 0.00017177280550774527,
"loss": 0.4129,
"num_input_tokens_seen": 1457936,
"step": 88,
"train_runtime": 229.6543,
"train_tokens_per_second": 6348.393
},
{
"epoch": 0.30427350427350425,
"grad_norm": 0.1077234074473381,
"learning_rate": 0.00017142857142857143,
"loss": 0.4311,
"num_input_tokens_seen": 1471536,
"step": 89,
"train_runtime": 231.6871,
"train_tokens_per_second": 6351.395
},
{
"epoch": 0.3076923076923077,
"grad_norm": 0.10258413106203079,
"learning_rate": 0.0001710843373493976,
"loss": 0.4856,
"num_input_tokens_seen": 1486080,
"step": 90,
"train_runtime": 233.8589,
"train_tokens_per_second": 6354.6
},
{
"epoch": 0.3111111111111111,
"grad_norm": 0.09048861265182495,
"learning_rate": 0.00017074010327022376,
"loss": 0.4573,
"num_input_tokens_seen": 1501360,
"step": 91,
"train_runtime": 236.6697,
"train_tokens_per_second": 6343.694
},
{
"epoch": 0.3145299145299145,
"grad_norm": 0.09616488963365555,
"learning_rate": 0.00017039586919104992,
"loss": 0.3533,
"num_input_tokens_seen": 1521744,
"step": 92,
"train_runtime": 239.5612,
"train_tokens_per_second": 6352.215
},
{
"epoch": 0.31794871794871793,
"grad_norm": 0.10119186341762543,
"learning_rate": 0.00017005163511187607,
"loss": 0.4687,
"num_input_tokens_seen": 1538640,
"step": 93,
"train_runtime": 242.0203,
"train_tokens_per_second": 6357.484
},
{
"epoch": 0.3213675213675214,
"grad_norm": 0.103726826608181,
"learning_rate": 0.00016970740103270225,
"loss": 0.43,
"num_input_tokens_seen": 1553200,
"step": 94,
"train_runtime": 244.1818,
"train_tokens_per_second": 6360.835
},
{
"epoch": 0.3247863247863248,
"grad_norm": 0.09369926899671555,
"learning_rate": 0.0001693631669535284,
"loss": 0.4155,
"num_input_tokens_seen": 1571952,
"step": 95,
"train_runtime": 246.9205,
"train_tokens_per_second": 6366.227
},
{
"epoch": 0.3282051282051282,
"grad_norm": 0.09061973541975021,
"learning_rate": 0.0001690189328743546,
"loss": 0.4044,
"num_input_tokens_seen": 1584416,
"step": 96,
"train_runtime": 248.812,
"train_tokens_per_second": 6367.924
},
{
"epoch": 0.3316239316239316,
"grad_norm": 0.08632508665323257,
"learning_rate": 0.00016867469879518074,
"loss": 0.405,
"num_input_tokens_seen": 1604672,
"step": 97,
"train_runtime": 251.7603,
"train_tokens_per_second": 6373.808
},
{
"epoch": 0.335042735042735,
"grad_norm": 0.08924511075019836,
"learning_rate": 0.0001683304647160069,
"loss": 0.4357,
"num_input_tokens_seen": 1622608,
"step": 98,
"train_runtime": 254.3946,
"train_tokens_per_second": 6378.311
},
{
"epoch": 0.3384615384615385,
"grad_norm": 0.10018568485975266,
"learning_rate": 0.00016798623063683305,
"loss": 0.4007,
"num_input_tokens_seen": 1636752,
"step": 99,
"train_runtime": 256.4999,
"train_tokens_per_second": 6381.101
},
{
"epoch": 0.3418803418803419,
"grad_norm": 0.08820787072181702,
"learning_rate": 0.00016764199655765923,
"loss": 0.3778,
"num_input_tokens_seen": 1649408,
"step": 100,
"train_runtime": 258.3868,
"train_tokens_per_second": 6383.484
},
{
"epoch": 0.3452991452991453,
"grad_norm": 0.10735058784484863,
"learning_rate": 0.0001672977624784854,
"loss": 0.5828,
"num_input_tokens_seen": 1665776,
"step": 101,
"train_runtime": 260.7883,
"train_tokens_per_second": 6387.466
},
{
"epoch": 0.3487179487179487,
"grad_norm": 0.09399764984846115,
"learning_rate": 0.00016695352839931154,
"loss": 0.4238,
"num_input_tokens_seen": 1688816,
"step": 102,
"train_runtime": 264.0814,
"train_tokens_per_second": 6395.059
},
{
"epoch": 0.35213675213675216,
"grad_norm": 0.0975056141614914,
"learning_rate": 0.0001666092943201377,
"loss": 0.4374,
"num_input_tokens_seen": 1703456,
"step": 103,
"train_runtime": 266.2978,
"train_tokens_per_second": 6396.807
},
{
"epoch": 0.35555555555555557,
"grad_norm": 0.09030232578516006,
"learning_rate": 0.00016626506024096388,
"loss": 0.448,
"num_input_tokens_seen": 1724528,
"step": 104,
"train_runtime": 269.3165,
"train_tokens_per_second": 6403.35
},
{
"epoch": 0.358974358974359,
"grad_norm": 0.10417474806308746,
"learning_rate": 0.00016592082616179003,
"loss": 0.4109,
"num_input_tokens_seen": 1740768,
"step": 105,
"train_runtime": 271.6966,
"train_tokens_per_second": 6407.029
},
{
"epoch": 0.3623931623931624,
"grad_norm": 0.10844124108552933,
"learning_rate": 0.00016557659208261619,
"loss": 0.4165,
"num_input_tokens_seen": 1753632,
"step": 106,
"train_runtime": 273.6236,
"train_tokens_per_second": 6408.921
},
{
"epoch": 0.3658119658119658,
"grad_norm": 0.08827276527881622,
"learning_rate": 0.00016523235800344234,
"loss": 0.4233,
"num_input_tokens_seen": 1768480,
"step": 107,
"train_runtime": 275.8419,
"train_tokens_per_second": 6411.209
},
{
"epoch": 0.36923076923076925,
"grad_norm": 0.10917767882347107,
"learning_rate": 0.00016488812392426852,
"loss": 0.4624,
"num_input_tokens_seen": 1782800,
"step": 108,
"train_runtime": 277.9694,
"train_tokens_per_second": 6413.656
},
{
"epoch": 0.37264957264957266,
"grad_norm": 0.10163897275924683,
"learning_rate": 0.00016454388984509468,
"loss": 0.4553,
"num_input_tokens_seen": 1799008,
"step": 109,
"train_runtime": 280.3434,
"train_tokens_per_second": 6417.158
},
{
"epoch": 0.37606837606837606,
"grad_norm": 0.10832331329584122,
"learning_rate": 0.00016419965576592083,
"loss": 0.359,
"num_input_tokens_seen": 1811792,
"step": 110,
"train_runtime": 282.2797,
"train_tokens_per_second": 6418.429
},
{
"epoch": 0.37948717948717947,
"grad_norm": 0.08609069138765335,
"learning_rate": 0.00016385542168674699,
"loss": 0.4809,
"num_input_tokens_seen": 1828512,
"step": 111,
"train_runtime": 284.7476,
"train_tokens_per_second": 6421.518
},
{
"epoch": 0.38290598290598293,
"grad_norm": 0.11904721707105637,
"learning_rate": 0.00016351118760757317,
"loss": 0.4375,
"num_input_tokens_seen": 1849616,
"step": 112,
"train_runtime": 287.8004,
"train_tokens_per_second": 6426.732
},
{
"epoch": 0.38632478632478634,
"grad_norm": 0.09531164169311523,
"learning_rate": 0.00016316695352839932,
"loss": 0.4484,
"num_input_tokens_seen": 1866480,
"step": 113,
"train_runtime": 290.2693,
"train_tokens_per_second": 6430.167
},
{
"epoch": 0.38974358974358975,
"grad_norm": 0.13019715249538422,
"learning_rate": 0.0001628227194492255,
"loss": 0.4285,
"num_input_tokens_seen": 1881008,
"step": 114,
"train_runtime": 292.3998,
"train_tokens_per_second": 6433.0
},
{
"epoch": 0.39316239316239315,
"grad_norm": 0.1122983917593956,
"learning_rate": 0.00016247848537005163,
"loss": 0.5555,
"num_input_tokens_seen": 1893264,
"step": 115,
"train_runtime": 294.2603,
"train_tokens_per_second": 6433.977
},
{
"epoch": 0.39658119658119656,
"grad_norm": 0.0886179730296135,
"learning_rate": 0.0001621342512908778,
"loss": 0.4052,
"num_input_tokens_seen": 1911168,
"step": 116,
"train_runtime": 296.8399,
"train_tokens_per_second": 6438.379
},
{
"epoch": 0.4,
"grad_norm": 0.11588186770677567,
"learning_rate": 0.00016179001721170397,
"loss": 0.4881,
"num_input_tokens_seen": 1922320,
"step": 117,
"train_runtime": 298.5272,
"train_tokens_per_second": 6439.346
},
{
"epoch": 0.40341880341880343,
"grad_norm": 0.09329588711261749,
"learning_rate": 0.00016144578313253015,
"loss": 0.392,
"num_input_tokens_seen": 1935888,
"step": 118,
"train_runtime": 300.5442,
"train_tokens_per_second": 6441.276
},
{
"epoch": 0.40341880341880343,
"eval_loss": 0.4257439076900482,
"eval_runtime": 11.8891,
"eval_samples_per_second": 83.943,
"eval_steps_per_second": 5.299,
"num_input_tokens_seen": 1935888,
"step": 118
},
{
"epoch": 0.40683760683760684,
"grad_norm": 0.09967512637376785,
"learning_rate": 0.00016110154905335628,
"loss": 0.4716,
"num_input_tokens_seen": 1949360,
"step": 119,
"train_runtime": 314.4663,
"train_tokens_per_second": 6198.947
},
{
"epoch": 0.41025641025641024,
"grad_norm": 0.08704519271850586,
"learning_rate": 0.00016075731497418246,
"loss": 0.3573,
"num_input_tokens_seen": 1965152,
"step": 120,
"train_runtime": 316.7907,
"train_tokens_per_second": 6203.314
},
{
"epoch": 0.41367521367521365,
"grad_norm": 0.09572669863700867,
"learning_rate": 0.0001604130808950086,
"loss": 0.3742,
"num_input_tokens_seen": 1981632,
"step": 121,
"train_runtime": 319.7181,
"train_tokens_per_second": 6198.06
},
{
"epoch": 0.4170940170940171,
"grad_norm": 0.09697537869215012,
"learning_rate": 0.0001600688468158348,
"loss": 0.4811,
"num_input_tokens_seen": 1999488,
"step": 122,
"train_runtime": 322.3203,
"train_tokens_per_second": 6203.42
},
{
"epoch": 0.4205128205128205,
"grad_norm": 0.10042616724967957,
"learning_rate": 0.00015972461273666092,
"loss": 0.4146,
"num_input_tokens_seen": 2015360,
"step": 123,
"train_runtime": 324.66,
"train_tokens_per_second": 6207.601
},
{
"epoch": 0.4239316239316239,
"grad_norm": 0.09732874482870102,
"learning_rate": 0.0001593803786574871,
"loss": 0.3647,
"num_input_tokens_seen": 2029840,
"step": 124,
"train_runtime": 326.8173,
"train_tokens_per_second": 6210.931
},
{
"epoch": 0.42735042735042733,
"grad_norm": 0.0899026021361351,
"learning_rate": 0.00015903614457831326,
"loss": 0.3614,
"num_input_tokens_seen": 2043888,
"step": 125,
"train_runtime": 328.9033,
"train_tokens_per_second": 6214.251
},
{
"epoch": 0.4307692307692308,
"grad_norm": 0.1127215027809143,
"learning_rate": 0.00015869191049913944,
"loss": 0.521,
"num_input_tokens_seen": 2056784,
"step": 126,
"train_runtime": 330.847,
"train_tokens_per_second": 6216.723
},
{
"epoch": 0.4341880341880342,
"grad_norm": 0.10900437831878662,
"learning_rate": 0.00015834767641996557,
"loss": 0.5004,
"num_input_tokens_seen": 2073152,
"step": 127,
"train_runtime": 333.236,
"train_tokens_per_second": 6221.272
},
{
"epoch": 0.4376068376068376,
"grad_norm": 0.10284293442964554,
"learning_rate": 0.00015800344234079175,
"loss": 0.4758,
"num_input_tokens_seen": 2086832,
"step": 128,
"train_runtime": 335.3261,
"train_tokens_per_second": 6223.291
},
{
"epoch": 0.441025641025641,
"grad_norm": 0.08526846766471863,
"learning_rate": 0.0001576592082616179,
"loss": 0.3601,
"num_input_tokens_seen": 2102704,
"step": 129,
"train_runtime": 337.6773,
"train_tokens_per_second": 6226.962
},
{
"epoch": 0.4444444444444444,
"grad_norm": 0.0935521200299263,
"learning_rate": 0.00015731497418244408,
"loss": 0.4191,
"num_input_tokens_seen": 2120672,
"step": 130,
"train_runtime": 340.2901,
"train_tokens_per_second": 6231.953
},
{
"epoch": 0.4478632478632479,
"grad_norm": 0.09808618575334549,
"learning_rate": 0.00015697074010327024,
"loss": 0.432,
"num_input_tokens_seen": 2134528,
"step": 131,
"train_runtime": 342.374,
"train_tokens_per_second": 6234.492
},
{
"epoch": 0.4512820512820513,
"grad_norm": 0.08662474900484085,
"learning_rate": 0.0001566265060240964,
"loss": 0.4311,
"num_input_tokens_seen": 2150768,
"step": 132,
"train_runtime": 344.7887,
"train_tokens_per_second": 6237.931
},
{
"epoch": 0.4547008547008547,
"grad_norm": 0.09085840731859207,
"learning_rate": 0.00015628227194492255,
"loss": 0.4223,
"num_input_tokens_seen": 2171536,
"step": 133,
"train_runtime": 347.7754,
"train_tokens_per_second": 6244.076
},
{
"epoch": 0.4581196581196581,
"grad_norm": 0.1134534478187561,
"learning_rate": 0.00015593803786574873,
"loss": 0.4995,
"num_input_tokens_seen": 2187392,
"step": 134,
"train_runtime": 350.1232,
"train_tokens_per_second": 6247.493
},
{
"epoch": 0.46153846153846156,
"grad_norm": 0.0914321318268776,
"learning_rate": 0.00015559380378657488,
"loss": 0.3414,
"num_input_tokens_seen": 2208736,
"step": 135,
"train_runtime": 353.1913,
"train_tokens_per_second": 6253.653
},
{
"epoch": 0.46495726495726497,
"grad_norm": 0.09697174280881882,
"learning_rate": 0.00015524956970740104,
"loss": 0.4192,
"num_input_tokens_seen": 2221520,
"step": 136,
"train_runtime": 355.1021,
"train_tokens_per_second": 6256.004
},
{
"epoch": 0.4683760683760684,
"grad_norm": 0.09903775900602341,
"learning_rate": 0.0001549053356282272,
"loss": 0.4107,
"num_input_tokens_seen": 2234736,
"step": 137,
"train_runtime": 357.0576,
"train_tokens_per_second": 6258.755
},
{
"epoch": 0.4717948717948718,
"grad_norm": 0.10500401258468628,
"learning_rate": 0.00015456110154905337,
"loss": 0.4507,
"num_input_tokens_seen": 2246432,
"step": 138,
"train_runtime": 358.8165,
"train_tokens_per_second": 6260.671
},
{
"epoch": 0.4752136752136752,
"grad_norm": 0.10770396888256073,
"learning_rate": 0.00015421686746987953,
"loss": 0.4844,
"num_input_tokens_seen": 2264496,
"step": 139,
"train_runtime": 361.4046,
"train_tokens_per_second": 6265.82
},
{
"epoch": 0.47863247863247865,
"grad_norm": 0.09635472297668457,
"learning_rate": 0.00015387263339070568,
"loss": 0.3587,
"num_input_tokens_seen": 2279664,
"step": 140,
"train_runtime": 363.662,
"train_tokens_per_second": 6268.634
},
{
"epoch": 0.48205128205128206,
"grad_norm": 0.10260126739740372,
"learning_rate": 0.00015352839931153184,
"loss": 0.4402,
"num_input_tokens_seen": 2294976,
"step": 141,
"train_runtime": 365.9416,
"train_tokens_per_second": 6271.427
},
{
"epoch": 0.48547008547008547,
"grad_norm": 0.11078032851219177,
"learning_rate": 0.00015318416523235802,
"loss": 0.4819,
"num_input_tokens_seen": 2310256,
"step": 142,
"train_runtime": 368.2151,
"train_tokens_per_second": 6274.202
},
{
"epoch": 0.4888888888888889,
"grad_norm": 0.08946855366230011,
"learning_rate": 0.00015283993115318417,
"loss": 0.3455,
"num_input_tokens_seen": 2332160,
"step": 143,
"train_runtime": 371.3782,
"train_tokens_per_second": 6279.745
},
{
"epoch": 0.49230769230769234,
"grad_norm": 0.089847132563591,
"learning_rate": 0.00015249569707401033,
"loss": 0.3624,
"num_input_tokens_seen": 2346720,
"step": 144,
"train_runtime": 373.5395,
"train_tokens_per_second": 6282.389
},
{
"epoch": 0.49572649572649574,
"grad_norm": 0.10344398766756058,
"learning_rate": 0.00015215146299483648,
"loss": 0.4373,
"num_input_tokens_seen": 2360992,
"step": 145,
"train_runtime": 375.6328,
"train_tokens_per_second": 6285.372
},
{
"epoch": 0.49914529914529915,
"grad_norm": 0.10121628642082214,
"learning_rate": 0.00015180722891566266,
"loss": 0.4471,
"num_input_tokens_seen": 2375680,
"step": 146,
"train_runtime": 377.7982,
"train_tokens_per_second": 6288.226
},
{
"epoch": 0.5025641025641026,
"grad_norm": 0.08698102086782455,
"learning_rate": 0.00015146299483648882,
"loss": 0.3908,
"num_input_tokens_seen": 2397024,
"step": 147,
"train_runtime": 380.8567,
"train_tokens_per_second": 6293.768
},
{
"epoch": 0.505982905982906,
"grad_norm": 0.08766576647758484,
"learning_rate": 0.000151118760757315,
"loss": 0.3881,
"num_input_tokens_seen": 2414128,
"step": 148,
"train_runtime": 383.3371,
"train_tokens_per_second": 6297.663
},
{
"epoch": 0.5094017094017094,
"grad_norm": 0.10594574362039566,
"learning_rate": 0.00015077452667814113,
"loss": 0.3554,
"num_input_tokens_seen": 2430736,
"step": 149,
"train_runtime": 385.7797,
"train_tokens_per_second": 6300.84
},
{
"epoch": 0.5128205128205128,
"grad_norm": 0.10977370291948318,
"learning_rate": 0.0001504302925989673,
"loss": 0.4906,
"num_input_tokens_seen": 2449856,
"step": 150,
"train_runtime": 388.5377,
"train_tokens_per_second": 6305.324
},
{
"epoch": 0.5162393162393163,
"grad_norm": 0.09074017405509949,
"learning_rate": 0.00015008605851979346,
"loss": 0.4157,
"num_input_tokens_seen": 2467024,
"step": 151,
"train_runtime": 391.5399,
"train_tokens_per_second": 6300.824
},
{
"epoch": 0.5196581196581197,
"grad_norm": 0.08705534040927887,
"learning_rate": 0.00014974182444061964,
"loss": 0.3707,
"num_input_tokens_seen": 2485488,
"step": 152,
"train_runtime": 394.1859,
"train_tokens_per_second": 6305.37
},
{
"epoch": 0.5230769230769231,
"grad_norm": 0.09123992174863815,
"learning_rate": 0.00014939759036144577,
"loss": 0.4008,
"num_input_tokens_seen": 2501296,
"step": 153,
"train_runtime": 396.5327,
"train_tokens_per_second": 6307.918
},
{
"epoch": 0.5264957264957265,
"grad_norm": 0.07104610651731491,
"learning_rate": 0.00014905335628227195,
"loss": 0.3379,
"num_input_tokens_seen": 2529040,
"step": 154,
"train_runtime": 400.4284,
"train_tokens_per_second": 6315.835
},
{
"epoch": 0.5299145299145299,
"grad_norm": 0.11433000862598419,
"learning_rate": 0.0001487091222030981,
"loss": 0.5056,
"num_input_tokens_seen": 2544496,
"step": 155,
"train_runtime": 402.6965,
"train_tokens_per_second": 6318.645
},
{
"epoch": 0.5333333333333333,
"grad_norm": 0.12911392748355865,
"learning_rate": 0.0001483648881239243,
"loss": 0.4726,
"num_input_tokens_seen": 2558704,
"step": 156,
"train_runtime": 404.78,
"train_tokens_per_second": 6321.221
},
{
"epoch": 0.5367521367521367,
"grad_norm": 0.11388979107141495,
"learning_rate": 0.00014802065404475042,
"loss": 0.44,
"num_input_tokens_seen": 2571648,
"step": 157,
"train_runtime": 406.7058,
"train_tokens_per_second": 6323.115
},
{
"epoch": 0.5401709401709401,
"grad_norm": 0.1020691767334938,
"learning_rate": 0.0001476764199655766,
"loss": 0.5144,
"num_input_tokens_seen": 2585280,
"step": 158,
"train_runtime": 408.7686,
"train_tokens_per_second": 6324.556
},
{
"epoch": 0.5435897435897435,
"grad_norm": 0.11266439408063889,
"learning_rate": 0.00014733218588640275,
"loss": 0.4898,
"num_input_tokens_seen": 2602560,
"step": 159,
"train_runtime": 411.2897,
"train_tokens_per_second": 6327.802
},
{
"epoch": 0.5470085470085471,
"grad_norm": 0.09511423856019974,
"learning_rate": 0.00014698795180722893,
"loss": 0.4601,
"num_input_tokens_seen": 2617520,
"step": 160,
"train_runtime": 413.5019,
"train_tokens_per_second": 6330.127
},
{
"epoch": 0.5504273504273505,
"grad_norm": 0.08593633025884628,
"learning_rate": 0.0001466437177280551,
"loss": 0.3578,
"num_input_tokens_seen": 2638032,
"step": 161,
"train_runtime": 416.4729,
"train_tokens_per_second": 6334.222
},
{
"epoch": 0.5538461538461539,
"grad_norm": 0.10547275096178055,
"learning_rate": 0.00014629948364888124,
"loss": 0.4053,
"num_input_tokens_seen": 2652912,
"step": 162,
"train_runtime": 418.6689,
"train_tokens_per_second": 6336.54
},
{
"epoch": 0.5572649572649573,
"grad_norm": 0.11780176311731339,
"learning_rate": 0.0001459552495697074,
"loss": 0.4034,
"num_input_tokens_seen": 2664944,
"step": 163,
"train_runtime": 420.4837,
"train_tokens_per_second": 6337.806
},
{
"epoch": 0.5606837606837607,
"grad_norm": 0.098305843770504,
"learning_rate": 0.00014561101549053358,
"loss": 0.4804,
"num_input_tokens_seen": 2680720,
"step": 164,
"train_runtime": 422.8103,
"train_tokens_per_second": 6340.243
},
{
"epoch": 0.5641025641025641,
"grad_norm": 0.08514019846916199,
"learning_rate": 0.00014526678141135973,
"loss": 0.4623,
"num_input_tokens_seen": 2693696,
"step": 165,
"train_runtime": 424.733,
"train_tokens_per_second": 6342.093
},
{
"epoch": 0.5675213675213675,
"grad_norm": 0.10156818479299545,
"learning_rate": 0.0001449225473321859,
"loss": 0.4374,
"num_input_tokens_seen": 2706672,
"step": 166,
"train_runtime": 426.6739,
"train_tokens_per_second": 6343.655
},
{
"epoch": 0.5709401709401709,
"grad_norm": 0.09817566722631454,
"learning_rate": 0.00014457831325301204,
"loss": 0.3713,
"num_input_tokens_seen": 2717856,
"step": 167,
"train_runtime": 428.3605,
"train_tokens_per_second": 6344.787
},
{
"epoch": 0.5743589743589743,
"grad_norm": 0.08898711949586868,
"learning_rate": 0.00014423407917383822,
"loss": 0.3958,
"num_input_tokens_seen": 2738048,
"step": 168,
"train_runtime": 431.2652,
"train_tokens_per_second": 6348.873
},
{
"epoch": 0.5777777777777777,
"grad_norm": 0.10815781354904175,
"learning_rate": 0.00014388984509466438,
"loss": 0.4212,
"num_input_tokens_seen": 2751264,
"step": 169,
"train_runtime": 433.2567,
"train_tokens_per_second": 6350.193
},
{
"epoch": 0.5811965811965812,
"grad_norm": 0.0858953520655632,
"learning_rate": 0.00014354561101549053,
"loss": 0.4252,
"num_input_tokens_seen": 2768352,
"step": 170,
"train_runtime": 435.7397,
"train_tokens_per_second": 6353.224
},
{
"epoch": 0.5846153846153846,
"grad_norm": 0.1065724790096283,
"learning_rate": 0.0001432013769363167,
"loss": 0.4376,
"num_input_tokens_seen": 2783696,
"step": 171,
"train_runtime": 438.0174,
"train_tokens_per_second": 6355.217
},
{
"epoch": 0.588034188034188,
"grad_norm": 0.0936359241604805,
"learning_rate": 0.00014285714285714287,
"loss": 0.4641,
"num_input_tokens_seen": 2797712,
"step": 172,
"train_runtime": 440.1373,
"train_tokens_per_second": 6356.452
},
{
"epoch": 0.5914529914529915,
"grad_norm": 0.10138653963804245,
"learning_rate": 0.00014251290877796902,
"loss": 0.4442,
"num_input_tokens_seen": 2812432,
"step": 173,
"train_runtime": 442.3579,
"train_tokens_per_second": 6357.821
},
{
"epoch": 0.5948717948717949,
"grad_norm": 0.10231815278530121,
"learning_rate": 0.00014216867469879518,
"loss": 0.4113,
"num_input_tokens_seen": 2824544,
"step": 174,
"train_runtime": 444.2041,
"train_tokens_per_second": 6358.663
},
{
"epoch": 0.5982905982905983,
"grad_norm": 0.10455156117677689,
"learning_rate": 0.00014182444061962136,
"loss": 0.5237,
"num_input_tokens_seen": 2841296,
"step": 175,
"train_runtime": 446.6226,
"train_tokens_per_second": 6361.738
},
{
"epoch": 0.6017094017094017,
"grad_norm": 0.09039057046175003,
"learning_rate": 0.0001414802065404475,
"loss": 0.4316,
"num_input_tokens_seen": 2854304,
"step": 176,
"train_runtime": 448.5655,
"train_tokens_per_second": 6363.182
},
{
"epoch": 0.6051282051282051,
"grad_norm": 0.09800916165113449,
"learning_rate": 0.00014113597246127367,
"loss": 0.4883,
"num_input_tokens_seen": 2871312,
"step": 177,
"train_runtime": 451.0616,
"train_tokens_per_second": 6365.676
},
{
"epoch": 0.6051282051282051,
"eval_loss": 0.4250277280807495,
"eval_runtime": 11.8943,
"eval_samples_per_second": 83.906,
"eval_steps_per_second": 5.297,
"num_input_tokens_seen": 2871312,
"step": 177
},
{
"epoch": 0.6085470085470085,
"grad_norm": 0.1056000217795372,
"learning_rate": 0.00014079173838209982,
"loss": 0.3984,
"num_input_tokens_seen": 2882896,
"step": 178,
"train_runtime": 464.7282,
"train_tokens_per_second": 6203.403
},
{
"epoch": 0.611965811965812,
"grad_norm": 0.10022575408220291,
"learning_rate": 0.000140447504302926,
"loss": 0.3613,
"num_input_tokens_seen": 2897328,
"step": 179,
"train_runtime": 466.8908,
"train_tokens_per_second": 6205.58
},
{
"epoch": 0.6153846153846154,
"grad_norm": 0.10060451924800873,
"learning_rate": 0.00014010327022375216,
"loss": 0.505,
"num_input_tokens_seen": 2910544,
"step": 180,
"train_runtime": 468.834,
"train_tokens_per_second": 6208.049
},
{
"epoch": 0.6188034188034188,
"grad_norm": 0.10652410238981247,
"learning_rate": 0.00013975903614457834,
"loss": 0.456,
"num_input_tokens_seen": 2921712,
"step": 181,
"train_runtime": 471.0911,
"train_tokens_per_second": 6202.01
},
{
"epoch": 0.6222222222222222,
"grad_norm": 0.1084052249789238,
"learning_rate": 0.00013941480206540447,
"loss": 0.3833,
"num_input_tokens_seen": 2932832,
"step": 182,
"train_runtime": 472.7877,
"train_tokens_per_second": 6203.274
},
{
"epoch": 0.6256410256410256,
"grad_norm": 0.09704000502824783,
"learning_rate": 0.00013907056798623065,
"loss": 0.4889,
"num_input_tokens_seen": 2947600,
"step": 183,
"train_runtime": 474.9298,
"train_tokens_per_second": 6206.391
},
{
"epoch": 0.629059829059829,
"grad_norm": 0.09996459633111954,
"learning_rate": 0.0001387263339070568,
"loss": 0.3787,
"num_input_tokens_seen": 2963088,
"step": 184,
"train_runtime": 477.2542,
"train_tokens_per_second": 6208.616
},
{
"epoch": 0.6324786324786325,
"grad_norm": 0.09264053404331207,
"learning_rate": 0.00013838209982788298,
"loss": 0.3498,
"num_input_tokens_seen": 2975088,
"step": 185,
"train_runtime": 479.0775,
"train_tokens_per_second": 6210.035
},
{
"epoch": 0.6358974358974359,
"grad_norm": 0.09588699042797089,
"learning_rate": 0.00013803786574870914,
"loss": 0.485,
"num_input_tokens_seen": 2988944,
"step": 186,
"train_runtime": 481.1581,
"train_tokens_per_second": 6211.978
},
{
"epoch": 0.6393162393162393,
"grad_norm": 0.09032841771841049,
"learning_rate": 0.0001376936316695353,
"loss": 0.4083,
"num_input_tokens_seen": 3006016,
"step": 187,
"train_runtime": 483.6506,
"train_tokens_per_second": 6215.264
},
{
"epoch": 0.6427350427350428,
"grad_norm": 0.11055252701044083,
"learning_rate": 0.00013734939759036145,
"loss": 0.4339,
"num_input_tokens_seen": 3018096,
"step": 188,
"train_runtime": 485.4309,
"train_tokens_per_second": 6217.355
},
{
"epoch": 0.6461538461538462,
"grad_norm": 0.12127861380577087,
"learning_rate": 0.00013700516351118763,
"loss": 0.4601,
"num_input_tokens_seen": 3031280,
"step": 189,
"train_runtime": 487.4282,
"train_tokens_per_second": 6218.926
},
{
"epoch": 0.6495726495726496,
"grad_norm": 0.10579859465360641,
"learning_rate": 0.00013666092943201378,
"loss": 0.4519,
"num_input_tokens_seen": 3046560,
"step": 190,
"train_runtime": 489.6819,
"train_tokens_per_second": 6221.508
},
{
"epoch": 0.652991452991453,
"grad_norm": 0.1086781919002533,
"learning_rate": 0.00013631669535283994,
"loss": 0.4843,
"num_input_tokens_seen": 3061024,
"step": 191,
"train_runtime": 491.8462,
"train_tokens_per_second": 6223.539
},
{
"epoch": 0.6564102564102564,
"grad_norm": 0.09214667230844498,
"learning_rate": 0.0001359724612736661,
"loss": 0.43,
"num_input_tokens_seen": 3076848,
"step": 192,
"train_runtime": 494.2062,
"train_tokens_per_second": 6225.839
},
{
"epoch": 0.6598290598290598,
"grad_norm": 0.11928390711545944,
"learning_rate": 0.00013562822719449227,
"loss": 0.5062,
"num_input_tokens_seen": 3092208,
"step": 193,
"train_runtime": 496.4458,
"train_tokens_per_second": 6228.692
},
{
"epoch": 0.6632478632478632,
"grad_norm": 0.09398146718740463,
"learning_rate": 0.00013528399311531843,
"loss": 0.372,
"num_input_tokens_seen": 3103168,
"step": 194,
"train_runtime": 498.1054,
"train_tokens_per_second": 6229.943
},
{
"epoch": 0.6666666666666666,
"grad_norm": 0.08932854235172272,
"learning_rate": 0.00013493975903614458,
"loss": 0.4515,
"num_input_tokens_seen": 3120512,
"step": 195,
"train_runtime": 500.6536,
"train_tokens_per_second": 6232.877
},
{
"epoch": 0.67008547008547,
"grad_norm": 0.09448716044425964,
"learning_rate": 0.00013459552495697074,
"loss": 0.4346,
"num_input_tokens_seen": 3136544,
"step": 196,
"train_runtime": 503.0211,
"train_tokens_per_second": 6235.412
},
{
"epoch": 0.6735042735042736,
"grad_norm": 0.09740068763494492,
"learning_rate": 0.00013425129087779692,
"loss": 0.3846,
"num_input_tokens_seen": 3152720,
"step": 197,
"train_runtime": 505.3917,
"train_tokens_per_second": 6238.172
},
{
"epoch": 0.676923076923077,
"grad_norm": 0.10378974676132202,
"learning_rate": 0.00013390705679862307,
"loss": 0.4808,
"num_input_tokens_seen": 3167392,
"step": 198,
"train_runtime": 507.5697,
"train_tokens_per_second": 6240.31
},
{
"epoch": 0.6803418803418804,
"grad_norm": 0.08869824558496475,
"learning_rate": 0.00013356282271944923,
"loss": 0.387,
"num_input_tokens_seen": 3186496,
"step": 199,
"train_runtime": 510.3483,
"train_tokens_per_second": 6243.767
},
{
"epoch": 0.6837606837606838,
"grad_norm": 0.09974192827939987,
"learning_rate": 0.00013321858864027538,
"loss": 0.4512,
"num_input_tokens_seen": 3205344,
"step": 200,
"train_runtime": 513.0801,
"train_tokens_per_second": 6247.259
},
{
"epoch": 0.6871794871794872,
"grad_norm": 0.08839447796344757,
"learning_rate": 0.00013287435456110156,
"loss": 0.4027,
"num_input_tokens_seen": 3222720,
"step": 201,
"train_runtime": 515.6265,
"train_tokens_per_second": 6250.106
},
{
"epoch": 0.6905982905982906,
"grad_norm": 0.07892576605081558,
"learning_rate": 0.00013253012048192772,
"loss": 0.3836,
"num_input_tokens_seen": 3247392,
"step": 202,
"train_runtime": 519.1427,
"train_tokens_per_second": 6255.297
},
{
"epoch": 0.694017094017094,
"grad_norm": 0.09967231005430222,
"learning_rate": 0.0001321858864027539,
"loss": 0.6602,
"num_input_tokens_seen": 3263344,
"step": 203,
"train_runtime": 521.4876,
"train_tokens_per_second": 6257.76
},
{
"epoch": 0.6974358974358974,
"grad_norm": 0.09928127378225327,
"learning_rate": 0.00013184165232358003,
"loss": 0.3557,
"num_input_tokens_seen": 3275472,
"step": 204,
"train_runtime": 523.3642,
"train_tokens_per_second": 6258.494
},
{
"epoch": 0.7008547008547008,
"grad_norm": 0.10789816826581955,
"learning_rate": 0.0001314974182444062,
"loss": 0.3937,
"num_input_tokens_seen": 3293904,
"step": 205,
"train_runtime": 526.0362,
"train_tokens_per_second": 6261.744
},
{
"epoch": 0.7042735042735043,
"grad_norm": 0.10802796483039856,
"learning_rate": 0.00013115318416523236,
"loss": 0.4472,
"num_input_tokens_seen": 3309584,
"step": 206,
"train_runtime": 528.3293,
"train_tokens_per_second": 6264.245
},
{
"epoch": 0.7076923076923077,
"grad_norm": 0.09764997661113739,
"learning_rate": 0.00013080895008605854,
"loss": 0.457,
"num_input_tokens_seen": 3323776,
"step": 207,
"train_runtime": 530.4461,
"train_tokens_per_second": 6266.002
},
{
"epoch": 0.7111111111111111,
"grad_norm": 0.10141371190547943,
"learning_rate": 0.00013046471600688467,
"loss": 0.4036,
"num_input_tokens_seen": 3339600,
"step": 208,
"train_runtime": 532.7571,
"train_tokens_per_second": 6268.523
},
{
"epoch": 0.7145299145299145,
"grad_norm": 0.11183507740497589,
"learning_rate": 0.00013012048192771085,
"loss": 0.4412,
"num_input_tokens_seen": 3353280,
"step": 209,
"train_runtime": 534.8217,
"train_tokens_per_second": 6269.902
},
{
"epoch": 0.717948717948718,
"grad_norm": 0.1051330491900444,
"learning_rate": 0.000129776247848537,
"loss": 0.4337,
"num_input_tokens_seen": 3369296,
"step": 210,
"train_runtime": 537.1671,
"train_tokens_per_second": 6272.342
},
{
"epoch": 0.7213675213675214,
"grad_norm": 0.10551027208566666,
"learning_rate": 0.0001294320137693632,
"loss": 0.4042,
"num_input_tokens_seen": 3384000,
"step": 211,
"train_runtime": 539.924,
"train_tokens_per_second": 6267.548
},
{
"epoch": 0.7247863247863248,
"grad_norm": 0.10018742829561234,
"learning_rate": 0.00012908777969018932,
"loss": 0.4694,
"num_input_tokens_seen": 3399088,
"step": 212,
"train_runtime": 542.1589,
"train_tokens_per_second": 6269.542
},
{
"epoch": 0.7282051282051282,
"grad_norm": 0.12323636561632156,
"learning_rate": 0.0001287435456110155,
"loss": 0.4411,
"num_input_tokens_seen": 3411392,
"step": 213,
"train_runtime": 544.0078,
"train_tokens_per_second": 6270.851
},
{
"epoch": 0.7316239316239316,
"grad_norm": 0.11548493057489395,
"learning_rate": 0.00012839931153184165,
"loss": 0.5167,
"num_input_tokens_seen": 3428416,
"step": 214,
"train_runtime": 546.4748,
"train_tokens_per_second": 6273.695
},
{
"epoch": 0.7350427350427351,
"grad_norm": 0.0862911120057106,
"learning_rate": 0.00012805507745266783,
"loss": 0.3712,
"num_input_tokens_seen": 3459568,
"step": 215,
"train_runtime": 553.9819,
"train_tokens_per_second": 6244.912
},
{
"epoch": 0.7384615384615385,
"grad_norm": 0.1001635193824768,
"learning_rate": 0.00012771084337349396,
"loss": 0.394,
"num_input_tokens_seen": 3474128,
"step": 216,
"train_runtime": 556.1513,
"train_tokens_per_second": 6246.732
},
{
"epoch": 0.7418803418803419,
"grad_norm": 0.10096625983715057,
"learning_rate": 0.00012736660929432014,
"loss": 0.4354,
"num_input_tokens_seen": 3488032,
"step": 217,
"train_runtime": 558.2102,
"train_tokens_per_second": 6248.6
},
{
"epoch": 0.7452991452991453,
"grad_norm": 0.10238556563854218,
"learning_rate": 0.0001270223752151463,
"loss": 0.4276,
"num_input_tokens_seen": 3504688,
"step": 218,
"train_runtime": 560.6522,
"train_tokens_per_second": 6251.091
},
{
"epoch": 0.7487179487179487,
"grad_norm": 0.09864645451307297,
"learning_rate": 0.00012667814113597248,
"loss": 0.4098,
"num_input_tokens_seen": 3521088,
"step": 219,
"train_runtime": 563.1091,
"train_tokens_per_second": 6252.941
},
{
"epoch": 0.7521367521367521,
"grad_norm": 0.10077870637178421,
"learning_rate": 0.00012633390705679863,
"loss": 0.4802,
"num_input_tokens_seen": 3537040,
"step": 220,
"train_runtime": 565.4347,
"train_tokens_per_second": 6255.435
},
{
"epoch": 0.7555555555555555,
"grad_norm": 0.10053377598524094,
"learning_rate": 0.0001259896729776248,
"loss": 0.4794,
"num_input_tokens_seen": 3551456,
"step": 221,
"train_runtime": 567.5603,
"train_tokens_per_second": 6257.407
},
{
"epoch": 0.7589743589743589,
"grad_norm": 0.10047437995672226,
"learning_rate": 0.00012564543889845094,
"loss": 0.4938,
"num_input_tokens_seen": 3567616,
"step": 222,
"train_runtime": 569.9285,
"train_tokens_per_second": 6259.761
},
{
"epoch": 0.7623931623931623,
"grad_norm": 0.07970099151134491,
"learning_rate": 0.00012530120481927712,
"loss": 0.3474,
"num_input_tokens_seen": 3588144,
"step": 223,
"train_runtime": 572.8933,
"train_tokens_per_second": 6263.198
},
{
"epoch": 0.7658119658119659,
"grad_norm": 0.10995665192604065,
"learning_rate": 0.00012495697074010328,
"loss": 0.3795,
"num_input_tokens_seen": 3600144,
"step": 224,
"train_runtime": 574.6969,
"train_tokens_per_second": 6264.422
},
{
"epoch": 0.7692307692307693,
"grad_norm": 0.12067970633506775,
"learning_rate": 0.00012461273666092943,
"loss": 0.4804,
"num_input_tokens_seen": 3621280,
"step": 225,
"train_runtime": 577.7205,
"train_tokens_per_second": 6268.222
},
{
"epoch": 0.7726495726495727,
"grad_norm": 0.11939004063606262,
"learning_rate": 0.0001242685025817556,
"loss": 0.4533,
"num_input_tokens_seen": 3634160,
"step": 226,
"train_runtime": 579.6747,
"train_tokens_per_second": 6269.31
},
{
"epoch": 0.7760683760683761,
"grad_norm": 0.10946697741746902,
"learning_rate": 0.00012392426850258177,
"loss": 0.4324,
"num_input_tokens_seen": 3645536,
"step": 227,
"train_runtime": 581.3907,
"train_tokens_per_second": 6270.372
},
{
"epoch": 0.7794871794871795,
"grad_norm": 0.09853693842887878,
"learning_rate": 0.00012358003442340792,
"loss": 0.4728,
"num_input_tokens_seen": 3660048,
"step": 228,
"train_runtime": 583.5443,
"train_tokens_per_second": 6272.1
},
{
"epoch": 0.7829059829059829,
"grad_norm": 0.1062566265463829,
"learning_rate": 0.00012323580034423408,
"loss": 0.5393,
"num_input_tokens_seen": 3672816,
"step": 229,
"train_runtime": 585.4621,
"train_tokens_per_second": 6273.363
},
{
"epoch": 0.7863247863247863,
"grad_norm": 0.09363020956516266,
"learning_rate": 0.00012289156626506023,
"loss": 0.4152,
"num_input_tokens_seen": 3696128,
"step": 230,
"train_runtime": 588.8137,
"train_tokens_per_second": 6277.245
},
{
"epoch": 0.7897435897435897,
"grad_norm": 0.09704622626304626,
"learning_rate": 0.00012254733218588641,
"loss": 0.5139,
"num_input_tokens_seen": 3710160,
"step": 231,
"train_runtime": 590.8993,
"train_tokens_per_second": 6278.836
},
{
"epoch": 0.7931623931623931,
"grad_norm": 0.09564655274152756,
"learning_rate": 0.00012220309810671257,
"loss": 0.4335,
"num_input_tokens_seen": 3723536,
"step": 232,
"train_runtime": 592.9271,
"train_tokens_per_second": 6279.922
},
{
"epoch": 0.7965811965811965,
"grad_norm": 0.08687002956867218,
"learning_rate": 0.00012185886402753872,
"loss": 0.3445,
"num_input_tokens_seen": 3738592,
"step": 233,
"train_runtime": 595.173,
"train_tokens_per_second": 6281.522
},
{
"epoch": 0.8,
"grad_norm": 0.09096026420593262,
"learning_rate": 0.00012151462994836489,
"loss": 0.5372,
"num_input_tokens_seen": 3755936,
"step": 234,
"train_runtime": 597.7017,
"train_tokens_per_second": 6283.964
},
{
"epoch": 0.8034188034188035,
"grad_norm": 0.09353629499673843,
"learning_rate": 0.00012117039586919106,
"loss": 0.3614,
"num_input_tokens_seen": 3770768,
"step": 235,
"train_runtime": 599.8797,
"train_tokens_per_second": 6285.873
},
{
"epoch": 0.8068376068376069,
"grad_norm": 0.0944899320602417,
"learning_rate": 0.00012082616179001723,
"loss": 0.3849,
"num_input_tokens_seen": 3795312,
"step": 236,
"train_runtime": 603.3944,
"train_tokens_per_second": 6289.935
},
{
"epoch": 0.8068376068376069,
"eval_loss": 0.42357537150382996,
"eval_runtime": 11.8678,
"eval_samples_per_second": 84.093,
"eval_steps_per_second": 5.308,
"num_input_tokens_seen": 3795312,
"step": 236
},
{
"epoch": 0.8102564102564103,
"grad_norm": 0.10128959268331528,
"learning_rate": 0.0001204819277108434,
"loss": 0.4026,
"num_input_tokens_seen": 3806656,
"step": 237,
"train_runtime": 616.9818,
"train_tokens_per_second": 6169.803
},
{
"epoch": 0.8136752136752137,
"grad_norm": 0.09387616068124771,
"learning_rate": 0.00012013769363166954,
"loss": 0.4182,
"num_input_tokens_seen": 3822144,
"step": 238,
"train_runtime": 619.269,
"train_tokens_per_second": 6172.026
},
{
"epoch": 0.8170940170940171,
"grad_norm": 0.09902401268482208,
"learning_rate": 0.0001197934595524957,
"loss": 0.4232,
"num_input_tokens_seen": 3842016,
"step": 239,
"train_runtime": 622.1266,
"train_tokens_per_second": 6175.617
},
{
"epoch": 0.8205128205128205,
"grad_norm": 0.09925245493650436,
"learning_rate": 0.00011944922547332187,
"loss": 0.4478,
"num_input_tokens_seen": 3854752,
"step": 240,
"train_runtime": 624.0402,
"train_tokens_per_second": 6177.089
},
{
"epoch": 0.8239316239316239,
"grad_norm": 0.11560021340847015,
"learning_rate": 0.00011910499139414804,
"loss": 0.4808,
"num_input_tokens_seen": 3866496,
"step": 241,
"train_runtime": 626.2473,
"train_tokens_per_second": 6174.072
},
{
"epoch": 0.8273504273504273,
"grad_norm": 0.08798137307167053,
"learning_rate": 0.00011876075731497418,
"loss": 0.4486,
"num_input_tokens_seen": 3885600,
"step": 242,
"train_runtime": 629.0654,
"train_tokens_per_second": 6176.782
},
{
"epoch": 0.8307692307692308,
"grad_norm": 0.09302930533885956,
"learning_rate": 0.00011841652323580035,
"loss": 0.436,
"num_input_tokens_seen": 3905008,
"step": 243,
"train_runtime": 631.8771,
"train_tokens_per_second": 6180.012
},
{
"epoch": 0.8341880341880342,
"grad_norm": 0.1044159084558487,
"learning_rate": 0.00011807228915662652,
"loss": 0.4986,
"num_input_tokens_seen": 3917472,
"step": 244,
"train_runtime": 633.7768,
"train_tokens_per_second": 6181.154
},
{
"epoch": 0.8376068376068376,
"grad_norm": 0.10373450815677643,
"learning_rate": 0.00011772805507745268,
"loss": 0.5037,
"num_input_tokens_seen": 3933664,
"step": 245,
"train_runtime": 636.199,
"train_tokens_per_second": 6183.072
},
{
"epoch": 0.841025641025641,
"grad_norm": 0.08972188085317612,
"learning_rate": 0.00011738382099827883,
"loss": 0.4908,
"num_input_tokens_seen": 3952288,
"step": 246,
"train_runtime": 638.8866,
"train_tokens_per_second": 6186.212
},
{
"epoch": 0.8444444444444444,
"grad_norm": 0.0838053897023201,
"learning_rate": 0.000117039586919105,
"loss": 0.3793,
"num_input_tokens_seen": 3970672,
"step": 247,
"train_runtime": 641.5476,
"train_tokens_per_second": 6189.209
},
{
"epoch": 0.8478632478632478,
"grad_norm": 0.06703872978687286,
"learning_rate": 0.00011669535283993116,
"loss": 0.3059,
"num_input_tokens_seen": 3999184,
"step": 248,
"train_runtime": 645.5767,
"train_tokens_per_second": 6194.747
},
{
"epoch": 0.8512820512820513,
"grad_norm": 0.08314735442399979,
"learning_rate": 0.00011635111876075733,
"loss": 0.4058,
"num_input_tokens_seen": 4013280,
"step": 249,
"train_runtime": 647.6748,
"train_tokens_per_second": 6196.443
},
{
"epoch": 0.8547008547008547,
"grad_norm": 0.08154241740703583,
"learning_rate": 0.00011600688468158347,
"loss": 0.3805,
"num_input_tokens_seen": 4031920,
"step": 250,
"train_runtime": 650.4038,
"train_tokens_per_second": 6199.102
},
{
"epoch": 0.8581196581196581,
"grad_norm": 0.09133270382881165,
"learning_rate": 0.00011566265060240964,
"loss": 0.3681,
"num_input_tokens_seen": 4053744,
"step": 251,
"train_runtime": 653.5797,
"train_tokens_per_second": 6202.371
},
{
"epoch": 0.8615384615384616,
"grad_norm": 0.10926900058984756,
"learning_rate": 0.0001153184165232358,
"loss": 0.4441,
"num_input_tokens_seen": 4065536,
"step": 252,
"train_runtime": 655.3821,
"train_tokens_per_second": 6203.307
},
{
"epoch": 0.864957264957265,
"grad_norm": 0.08510483056306839,
"learning_rate": 0.00011497418244406197,
"loss": 0.4944,
"num_input_tokens_seen": 4083376,
"step": 253,
"train_runtime": 657.9531,
"train_tokens_per_second": 6206.181
},
{
"epoch": 0.8683760683760684,
"grad_norm": 0.09709641337394714,
"learning_rate": 0.00011462994836488814,
"loss": 0.481,
"num_input_tokens_seen": 4098848,
"step": 254,
"train_runtime": 660.2372,
"train_tokens_per_second": 6208.145
},
{
"epoch": 0.8717948717948718,
"grad_norm": 0.08926745504140854,
"learning_rate": 0.00011428571428571428,
"loss": 0.4043,
"num_input_tokens_seen": 4113904,
"step": 255,
"train_runtime": 662.4724,
"train_tokens_per_second": 6209.925
},
{
"epoch": 0.8752136752136752,
"grad_norm": 0.09374278038740158,
"learning_rate": 0.00011394148020654045,
"loss": 0.4502,
"num_input_tokens_seen": 4131168,
"step": 256,
"train_runtime": 664.9653,
"train_tokens_per_second": 6212.607
},
{
"epoch": 0.8786324786324786,
"grad_norm": 0.09459812939167023,
"learning_rate": 0.00011359724612736662,
"loss": 0.4439,
"num_input_tokens_seen": 4149904,
"step": 257,
"train_runtime": 667.6682,
"train_tokens_per_second": 6215.519
},
{
"epoch": 0.882051282051282,
"grad_norm": 0.1052205041050911,
"learning_rate": 0.00011325301204819279,
"loss": 0.4385,
"num_input_tokens_seen": 4166832,
"step": 258,
"train_runtime": 670.0958,
"train_tokens_per_second": 6218.263
},
{
"epoch": 0.8854700854700854,
"grad_norm": 0.09694038331508636,
"learning_rate": 0.00011290877796901893,
"loss": 0.375,
"num_input_tokens_seen": 4184976,
"step": 259,
"train_runtime": 672.74,
"train_tokens_per_second": 6220.793
},
{
"epoch": 0.8888888888888888,
"grad_norm": 0.11208639293909073,
"learning_rate": 0.0001125645438898451,
"loss": 0.4517,
"num_input_tokens_seen": 4199888,
"step": 260,
"train_runtime": 674.9288,
"train_tokens_per_second": 6222.713
},
{
"epoch": 0.8923076923076924,
"grad_norm": 0.09207024425268173,
"learning_rate": 0.00011222030981067126,
"loss": 0.4132,
"num_input_tokens_seen": 4215664,
"step": 261,
"train_runtime": 677.2813,
"train_tokens_per_second": 6224.392
},
{
"epoch": 0.8957264957264958,
"grad_norm": 0.0904022753238678,
"learning_rate": 0.00011187607573149743,
"loss": 0.3322,
"num_input_tokens_seen": 4230080,
"step": 262,
"train_runtime": 679.4101,
"train_tokens_per_second": 6226.107
},
{
"epoch": 0.8991452991452992,
"grad_norm": 0.12087982147932053,
"learning_rate": 0.00011153184165232357,
"loss": 0.4281,
"num_input_tokens_seen": 4241440,
"step": 263,
"train_runtime": 681.1509,
"train_tokens_per_second": 6226.873
},
{
"epoch": 0.9025641025641026,
"grad_norm": 0.12484072893857956,
"learning_rate": 0.00011118760757314974,
"loss": 0.5186,
"num_input_tokens_seen": 4252976,
"step": 264,
"train_runtime": 682.9063,
"train_tokens_per_second": 6227.759
},
{
"epoch": 0.905982905982906,
"grad_norm": 0.08252517133951187,
"learning_rate": 0.00011084337349397591,
"loss": 0.4049,
"num_input_tokens_seen": 4269312,
"step": 265,
"train_runtime": 685.2856,
"train_tokens_per_second": 6229.975
},
{
"epoch": 0.9094017094017094,
"grad_norm": 0.11546450853347778,
"learning_rate": 0.00011049913941480208,
"loss": 0.4628,
"num_input_tokens_seen": 4284544,
"step": 266,
"train_runtime": 687.5331,
"train_tokens_per_second": 6231.764
},
{
"epoch": 0.9128205128205128,
"grad_norm": 0.11925678700208664,
"learning_rate": 0.00011015490533562822,
"loss": 0.4275,
"num_input_tokens_seen": 4296208,
"step": 267,
"train_runtime": 689.3281,
"train_tokens_per_second": 6232.457
},
{
"epoch": 0.9162393162393162,
"grad_norm": 0.09587883204221725,
"learning_rate": 0.00010981067125645439,
"loss": 0.4098,
"num_input_tokens_seen": 4313872,
"step": 268,
"train_runtime": 691.9285,
"train_tokens_per_second": 6234.563
},
{
"epoch": 0.9196581196581196,
"grad_norm": 0.08406773209571838,
"learning_rate": 0.00010946643717728055,
"loss": 0.3972,
"num_input_tokens_seen": 4335664,
"step": 269,
"train_runtime": 695.0743,
"train_tokens_per_second": 6237.699
},
{
"epoch": 0.9230769230769231,
"grad_norm": 0.1020239070057869,
"learning_rate": 0.00010912220309810672,
"loss": 0.3777,
"num_input_tokens_seen": 4353360,
"step": 270,
"train_runtime": 697.6355,
"train_tokens_per_second": 6240.165
},
{
"epoch": 0.9264957264957265,
"grad_norm": 0.11209993064403534,
"learning_rate": 0.00010877796901893289,
"loss": 0.4114,
"num_input_tokens_seen": 4374544,
"step": 271,
"train_runtime": 701.2128,
"train_tokens_per_second": 6238.54
},
{
"epoch": 0.9299145299145299,
"grad_norm": 0.11567652225494385,
"learning_rate": 0.00010843373493975903,
"loss": 0.4051,
"num_input_tokens_seen": 4391456,
"step": 272,
"train_runtime": 703.6794,
"train_tokens_per_second": 6240.706
},
{
"epoch": 0.9333333333333333,
"grad_norm": 0.11092627048492432,
"learning_rate": 0.0001080895008605852,
"loss": 0.4194,
"num_input_tokens_seen": 4404608,
"step": 273,
"train_runtime": 705.6779,
"train_tokens_per_second": 6241.669
},
{
"epoch": 0.9367521367521368,
"grad_norm": 0.10917766392230988,
"learning_rate": 0.00010774526678141137,
"loss": 0.4475,
"num_input_tokens_seen": 4416592,
"step": 274,
"train_runtime": 707.4805,
"train_tokens_per_second": 6242.705
},
{
"epoch": 0.9401709401709402,
"grad_norm": 0.09348605573177338,
"learning_rate": 0.00010740103270223754,
"loss": 0.4913,
"num_input_tokens_seen": 4433728,
"step": 275,
"train_runtime": 709.9546,
"train_tokens_per_second": 6245.086
},
{
"epoch": 0.9435897435897436,
"grad_norm": 0.10354448109865189,
"learning_rate": 0.00010705679862306368,
"loss": 0.4018,
"num_input_tokens_seen": 4448224,
"step": 276,
"train_runtime": 712.1021,
"train_tokens_per_second": 6246.61
},
{
"epoch": 0.947008547008547,
"grad_norm": 0.09892738610506058,
"learning_rate": 0.00010671256454388984,
"loss": 0.4477,
"num_input_tokens_seen": 4467024,
"step": 277,
"train_runtime": 714.8588,
"train_tokens_per_second": 6248.82
},
{
"epoch": 0.9504273504273504,
"grad_norm": 0.11075231432914734,
"learning_rate": 0.00010636833046471601,
"loss": 0.3678,
"num_input_tokens_seen": 4481232,
"step": 278,
"train_runtime": 716.9881,
"train_tokens_per_second": 6250.078
},
{
"epoch": 0.9538461538461539,
"grad_norm": 0.10120780020952225,
"learning_rate": 0.00010602409638554218,
"loss": 0.4281,
"num_input_tokens_seen": 4500528,
"step": 279,
"train_runtime": 719.7698,
"train_tokens_per_second": 6252.733
},
{
"epoch": 0.9572649572649573,
"grad_norm": 0.09937260299921036,
"learning_rate": 0.00010567986230636832,
"loss": 0.3882,
"num_input_tokens_seen": 4525136,
"step": 280,
"train_runtime": 723.3072,
"train_tokens_per_second": 6256.175
},
{
"epoch": 0.9606837606837607,
"grad_norm": 0.08478062599897385,
"learning_rate": 0.00010533562822719449,
"loss": 0.3849,
"num_input_tokens_seen": 4541200,
"step": 281,
"train_runtime": 725.6747,
"train_tokens_per_second": 6257.9
},
{
"epoch": 0.9641025641025641,
"grad_norm": 0.09681829810142517,
"learning_rate": 0.00010499139414802066,
"loss": 0.3051,
"num_input_tokens_seen": 4578816,
"step": 282,
"train_runtime": 731.2044,
"train_tokens_per_second": 6262.019
},
{
"epoch": 0.9675213675213675,
"grad_norm": 0.09028521925210953,
"learning_rate": 0.00010464716006884682,
"loss": 0.4796,
"num_input_tokens_seen": 4596608,
"step": 283,
"train_runtime": 733.7729,
"train_tokens_per_second": 6264.347
},
{
"epoch": 0.9709401709401709,
"grad_norm": 0.09063593298196793,
"learning_rate": 0.00010430292598967298,
"loss": 0.347,
"num_input_tokens_seen": 4607632,
"step": 284,
"train_runtime": 735.4673,
"train_tokens_per_second": 6264.904
},
{
"epoch": 0.9743589743589743,
"grad_norm": 0.09063643962144852,
"learning_rate": 0.00010395869191049913,
"loss": 0.2912,
"num_input_tokens_seen": 4631200,
"step": 285,
"train_runtime": 738.8336,
"train_tokens_per_second": 6268.258
},
{
"epoch": 0.9777777777777777,
"grad_norm": 0.11136946082115173,
"learning_rate": 0.0001036144578313253,
"loss": 0.4875,
"num_input_tokens_seen": 4645856,
"step": 286,
"train_runtime": 741.0112,
"train_tokens_per_second": 6269.616
},
{
"epoch": 0.9811965811965812,
"grad_norm": 0.09543482214212418,
"learning_rate": 0.00010327022375215147,
"loss": 0.4009,
"num_input_tokens_seen": 4662528,
"step": 287,
"train_runtime": 743.4774,
"train_tokens_per_second": 6271.244
},
{
"epoch": 0.9846153846153847,
"grad_norm": 0.11340586096048355,
"learning_rate": 0.00010292598967297764,
"loss": 0.4523,
"num_input_tokens_seen": 4677744,
"step": 288,
"train_runtime": 745.7291,
"train_tokens_per_second": 6272.712
},
{
"epoch": 0.9880341880341881,
"grad_norm": 0.09249569475650787,
"learning_rate": 0.00010258175559380379,
"loss": 0.3638,
"num_input_tokens_seen": 4694512,
"step": 289,
"train_runtime": 748.2102,
"train_tokens_per_second": 6274.323
},
{
"epoch": 0.9914529914529915,
"grad_norm": 0.11417587846517563,
"learning_rate": 0.00010223752151462995,
"loss": 0.513,
"num_input_tokens_seen": 4710224,
"step": 290,
"train_runtime": 750.5071,
"train_tokens_per_second": 6276.055
},
{
"epoch": 0.9948717948717949,
"grad_norm": 0.09056784212589264,
"learning_rate": 0.00010189328743545611,
"loss": 0.4324,
"num_input_tokens_seen": 4727296,
"step": 291,
"train_runtime": 752.9922,
"train_tokens_per_second": 6278.014
},
{
"epoch": 0.9982905982905983,
"grad_norm": 0.09821169078350067,
"learning_rate": 0.00010154905335628228,
"loss": 0.3605,
"num_input_tokens_seen": 4741520,
"step": 292,
"train_runtime": 755.0666,
"train_tokens_per_second": 6279.605
},
{
"epoch": 1.0,
"grad_norm": 0.13449996709823608,
"learning_rate": 0.00010120481927710844,
"loss": 0.3949,
"num_input_tokens_seen": 4751278,
"step": 293,
"train_runtime": 756.491,
"train_tokens_per_second": 6280.68
},
{
"epoch": 1.0034188034188034,
"grad_norm": 0.09440767765045166,
"learning_rate": 0.0001008605851979346,
"loss": 0.3857,
"num_input_tokens_seen": 4764718,
"step": 294,
"train_runtime": 758.5245,
"train_tokens_per_second": 6281.561
},
{
"epoch": 1.0068376068376068,
"grad_norm": 0.08331061899662018,
"learning_rate": 0.00010051635111876076,
"loss": 0.3654,
"num_input_tokens_seen": 4782670,
"step": 295,
"train_runtime": 761.0921,
"train_tokens_per_second": 6283.957
},
{
"epoch": 1.0068376068376068,
"eval_loss": 0.421943724155426,
"eval_runtime": 11.8792,
"eval_samples_per_second": 84.013,
"eval_steps_per_second": 5.303,
"num_input_tokens_seen": 4782670,
"step": 295
},
{
"epoch": 1.0102564102564102,
"grad_norm": 0.09061148762702942,
"learning_rate": 0.00010017211703958693,
"loss": 0.3673,
"num_input_tokens_seen": 4795310,
"step": 296,
"train_runtime": 774.907,
"train_tokens_per_second": 6188.239
},
{
"epoch": 1.0136752136752136,
"grad_norm": 0.09946513175964355,
"learning_rate": 9.982788296041308e-05,
"loss": 0.3978,
"num_input_tokens_seen": 4810798,
"step": 297,
"train_runtime": 777.235,
"train_tokens_per_second": 6189.631
},
{
"epoch": 1.017094017094017,
"grad_norm": 0.10077892988920212,
"learning_rate": 9.948364888123925e-05,
"loss": 0.3721,
"num_input_tokens_seen": 4821918,
"step": 298,
"train_runtime": 778.9429,
"train_tokens_per_second": 6190.336
},
{
"epoch": 1.0205128205128204,
"grad_norm": 0.09540440887212753,
"learning_rate": 9.91394148020654e-05,
"loss": 0.4804,
"num_input_tokens_seen": 4839806,
"step": 299,
"train_runtime": 781.5496,
"train_tokens_per_second": 6192.577
},
{
"epoch": 1.0239316239316238,
"grad_norm": 0.09200432151556015,
"learning_rate": 9.879518072289157e-05,
"loss": 0.4185,
"num_input_tokens_seen": 4855374,
"step": 300,
"train_runtime": 783.8509,
"train_tokens_per_second": 6194.257
},
{
"epoch": 1.0273504273504273,
"grad_norm": 0.09225641936063766,
"learning_rate": 9.845094664371774e-05,
"loss": 0.3448,
"num_input_tokens_seen": 4875646,
"step": 301,
"train_runtime": 787.3218,
"train_tokens_per_second": 6192.698
},
{
"epoch": 1.0307692307692307,
"grad_norm": 0.09093517065048218,
"learning_rate": 9.81067125645439e-05,
"loss": 0.3735,
"num_input_tokens_seen": 4889006,
"step": 302,
"train_runtime": 789.3263,
"train_tokens_per_second": 6193.897
},
{
"epoch": 1.0341880341880343,
"grad_norm": 0.1052882969379425,
"learning_rate": 9.776247848537006e-05,
"loss": 0.4364,
"num_input_tokens_seen": 4902686,
"step": 303,
"train_runtime": 791.403,
"train_tokens_per_second": 6194.93
},
{
"epoch": 1.0376068376068377,
"grad_norm": 0.09175313264131546,
"learning_rate": 9.741824440619622e-05,
"loss": 0.4034,
"num_input_tokens_seen": 4922078,
"step": 304,
"train_runtime": 794.1808,
"train_tokens_per_second": 6197.679
},
{
"epoch": 1.041025641025641,
"grad_norm": 0.09906546771526337,
"learning_rate": 9.707401032702239e-05,
"loss": 0.448,
"num_input_tokens_seen": 4943358,
"step": 305,
"train_runtime": 797.2477,
"train_tokens_per_second": 6200.53
},
{
"epoch": 1.0444444444444445,
"grad_norm": 0.10816071182489395,
"learning_rate": 9.672977624784855e-05,
"loss": 0.3971,
"num_input_tokens_seen": 4956078,
"step": 306,
"train_runtime": 799.1676,
"train_tokens_per_second": 6201.55
},
{
"epoch": 1.047863247863248,
"grad_norm": 0.09161638468503952,
"learning_rate": 9.638554216867471e-05,
"loss": 0.3514,
"num_input_tokens_seen": 4981710,
"step": 307,
"train_runtime": 802.8012,
"train_tokens_per_second": 6205.409
},
{
"epoch": 1.0512820512820513,
"grad_norm": 0.09889056533575058,
"learning_rate": 9.604130808950088e-05,
"loss": 0.3105,
"num_input_tokens_seen": 5001214,
"step": 308,
"train_runtime": 805.5994,
"train_tokens_per_second": 6208.066
},
{
"epoch": 1.0547008547008547,
"grad_norm": 0.1137273982167244,
"learning_rate": 9.569707401032703e-05,
"loss": 0.3571,
"num_input_tokens_seen": 5017694,
"step": 309,
"train_runtime": 808.0045,
"train_tokens_per_second": 6209.982
},
{
"epoch": 1.0581196581196581,
"grad_norm": 0.09778351336717606,
"learning_rate": 9.53528399311532e-05,
"loss": 0.3879,
"num_input_tokens_seen": 5035758,
"step": 310,
"train_runtime": 810.6114,
"train_tokens_per_second": 6212.296
},
{
"epoch": 1.0615384615384615,
"grad_norm": 0.1118144690990448,
"learning_rate": 9.500860585197935e-05,
"loss": 0.3965,
"num_input_tokens_seen": 5052750,
"step": 311,
"train_runtime": 813.0944,
"train_tokens_per_second": 6214.223
},
{
"epoch": 1.064957264957265,
"grad_norm": 0.11538024991750717,
"learning_rate": 9.466437177280552e-05,
"loss": 0.4422,
"num_input_tokens_seen": 5067630,
"step": 312,
"train_runtime": 815.286,
"train_tokens_per_second": 6215.77
},
{
"epoch": 1.0683760683760684,
"grad_norm": 0.10927511751651764,
"learning_rate": 9.432013769363168e-05,
"loss": 0.4174,
"num_input_tokens_seen": 5083150,
"step": 313,
"train_runtime": 817.5852,
"train_tokens_per_second": 6217.272
},
{
"epoch": 1.0717948717948718,
"grad_norm": 0.10767415165901184,
"learning_rate": 9.397590361445784e-05,
"loss": 0.3619,
"num_input_tokens_seen": 5104078,
"step": 314,
"train_runtime": 820.6095,
"train_tokens_per_second": 6219.862
},
{
"epoch": 1.0752136752136752,
"grad_norm": 0.10561515390872955,
"learning_rate": 9.3631669535284e-05,
"loss": 0.4125,
"num_input_tokens_seen": 5118014,
"step": 315,
"train_runtime": 822.6736,
"train_tokens_per_second": 6221.197
},
{
"epoch": 1.0786324786324786,
"grad_norm": 0.10327659547328949,
"learning_rate": 9.328743545611017e-05,
"loss": 0.4252,
"num_input_tokens_seen": 5137150,
"step": 316,
"train_runtime": 825.4032,
"train_tokens_per_second": 6223.807
},
{
"epoch": 1.082051282051282,
"grad_norm": 0.1158551275730133,
"learning_rate": 9.294320137693632e-05,
"loss": 0.3862,
"num_input_tokens_seen": 5152190,
"step": 317,
"train_runtime": 827.6678,
"train_tokens_per_second": 6224.949
},
{
"epoch": 1.0854700854700854,
"grad_norm": 0.11891324818134308,
"learning_rate": 9.259896729776249e-05,
"loss": 0.4514,
"num_input_tokens_seen": 5165790,
"step": 318,
"train_runtime": 829.6973,
"train_tokens_per_second": 6226.114
},
{
"epoch": 1.0888888888888888,
"grad_norm": 0.09706568717956543,
"learning_rate": 9.225473321858864e-05,
"loss": 0.4038,
"num_input_tokens_seen": 5187630,
"step": 319,
"train_runtime": 832.8397,
"train_tokens_per_second": 6228.846
},
{
"epoch": 1.0923076923076924,
"grad_norm": 0.1240311861038208,
"learning_rate": 9.191049913941481e-05,
"loss": 0.4434,
"num_input_tokens_seen": 5201454,
"step": 320,
"train_runtime": 834.8979,
"train_tokens_per_second": 6230.048
},
{
"epoch": 1.0957264957264958,
"grad_norm": 0.10608533769845963,
"learning_rate": 9.156626506024096e-05,
"loss": 0.3612,
"num_input_tokens_seen": 5217502,
"step": 321,
"train_runtime": 837.243,
"train_tokens_per_second": 6231.766
},
{
"epoch": 1.0991452991452992,
"grad_norm": 0.11198005080223083,
"learning_rate": 9.122203098106713e-05,
"loss": 0.3461,
"num_input_tokens_seen": 5233502,
"step": 322,
"train_runtime": 839.607,
"train_tokens_per_second": 6233.276
},
{
"epoch": 1.1025641025641026,
"grad_norm": 0.11071202903985977,
"learning_rate": 9.08777969018933e-05,
"loss": 0.3657,
"num_input_tokens_seen": 5247166,
"step": 323,
"train_runtime": 841.6904,
"train_tokens_per_second": 6234.081
},
{
"epoch": 1.105982905982906,
"grad_norm": 0.128941148519516,
"learning_rate": 9.053356282271946e-05,
"loss": 0.3202,
"num_input_tokens_seen": 5264302,
"step": 324,
"train_runtime": 844.1905,
"train_tokens_per_second": 6235.917
},
{
"epoch": 1.1094017094017095,
"grad_norm": 0.10935687273740768,
"learning_rate": 9.018932874354562e-05,
"loss": 0.3335,
"num_input_tokens_seen": 5285150,
"step": 325,
"train_runtime": 847.1788,
"train_tokens_per_second": 6238.53
},
{
"epoch": 1.1128205128205129,
"grad_norm": 0.11587445437908173,
"learning_rate": 8.984509466437178e-05,
"loss": 0.3548,
"num_input_tokens_seen": 5303454,
"step": 326,
"train_runtime": 849.8521,
"train_tokens_per_second": 6240.443
},
{
"epoch": 1.1162393162393163,
"grad_norm": 0.14800626039505005,
"learning_rate": 8.950086058519795e-05,
"loss": 0.4223,
"num_input_tokens_seen": 5313854,
"step": 327,
"train_runtime": 851.4701,
"train_tokens_per_second": 6240.8
},
{
"epoch": 1.1196581196581197,
"grad_norm": 0.12176591157913208,
"learning_rate": 8.91566265060241e-05,
"loss": 0.3805,
"num_input_tokens_seen": 5327342,
"step": 328,
"train_runtime": 853.4843,
"train_tokens_per_second": 6241.875
},
{
"epoch": 1.123076923076923,
"grad_norm": 0.1277189403772354,
"learning_rate": 8.881239242685027e-05,
"loss": 0.4071,
"num_input_tokens_seen": 5343678,
"step": 329,
"train_runtime": 855.8801,
"train_tokens_per_second": 6243.489
},
{
"epoch": 1.1264957264957265,
"grad_norm": 0.10131321847438812,
"learning_rate": 8.846815834767642e-05,
"loss": 0.2666,
"num_input_tokens_seen": 5364910,
"step": 330,
"train_runtime": 858.9596,
"train_tokens_per_second": 6245.823
},
{
"epoch": 1.12991452991453,
"grad_norm": 0.12116528302431107,
"learning_rate": 8.812392426850259e-05,
"loss": 0.4034,
"num_input_tokens_seen": 5379150,
"step": 331,
"train_runtime": 861.6047,
"train_tokens_per_second": 6243.176
},
{
"epoch": 1.1333333333333333,
"grad_norm": 0.13882531225681305,
"learning_rate": 8.777969018932875e-05,
"loss": 0.3558,
"num_input_tokens_seen": 5392910,
"step": 332,
"train_runtime": 863.675,
"train_tokens_per_second": 6244.142
},
{
"epoch": 1.1367521367521367,
"grad_norm": 0.10566709190607071,
"learning_rate": 8.743545611015491e-05,
"loss": 0.3374,
"num_input_tokens_seen": 5410798,
"step": 333,
"train_runtime": 866.263,
"train_tokens_per_second": 6246.137
},
{
"epoch": 1.1401709401709401,
"grad_norm": 0.1450272500514984,
"learning_rate": 8.709122203098107e-05,
"loss": 0.3957,
"num_input_tokens_seen": 5425198,
"step": 334,
"train_runtime": 868.4297,
"train_tokens_per_second": 6247.136
},
{
"epoch": 1.1435897435897435,
"grad_norm": 0.13562506437301636,
"learning_rate": 8.674698795180724e-05,
"loss": 0.4037,
"num_input_tokens_seen": 5439374,
"step": 335,
"train_runtime": 870.5364,
"train_tokens_per_second": 6248.301
},
{
"epoch": 1.147008547008547,
"grad_norm": 0.12343757599592209,
"learning_rate": 8.640275387263339e-05,
"loss": 0.4106,
"num_input_tokens_seen": 5456574,
"step": 336,
"train_runtime": 873.0308,
"train_tokens_per_second": 6250.151
},
{
"epoch": 1.1504273504273503,
"grad_norm": 0.12856614589691162,
"learning_rate": 8.605851979345956e-05,
"loss": 0.4445,
"num_input_tokens_seen": 5475102,
"step": 337,
"train_runtime": 875.7122,
"train_tokens_per_second": 6252.17
},
{
"epoch": 1.1538461538461537,
"grad_norm": 0.13173913955688477,
"learning_rate": 8.571428571428571e-05,
"loss": 0.412,
"num_input_tokens_seen": 5488254,
"step": 338,
"train_runtime": 877.6958,
"train_tokens_per_second": 6253.025
},
{
"epoch": 1.1572649572649572,
"grad_norm": 0.13166651129722595,
"learning_rate": 8.537005163511188e-05,
"loss": 0.3414,
"num_input_tokens_seen": 5503694,
"step": 339,
"train_runtime": 879.9753,
"train_tokens_per_second": 6254.373
},
{
"epoch": 1.1606837606837608,
"grad_norm": 0.14514580368995667,
"learning_rate": 8.502581755593804e-05,
"loss": 0.4121,
"num_input_tokens_seen": 5518158,
"step": 340,
"train_runtime": 882.0821,
"train_tokens_per_second": 6255.833
},
{
"epoch": 1.1641025641025642,
"grad_norm": 0.13414417207241058,
"learning_rate": 8.46815834767642e-05,
"loss": 0.3738,
"num_input_tokens_seen": 5531150,
"step": 341,
"train_runtime": 884.0358,
"train_tokens_per_second": 6256.704
},
{
"epoch": 1.1675213675213676,
"grad_norm": 0.13111338019371033,
"learning_rate": 8.433734939759037e-05,
"loss": 0.4629,
"num_input_tokens_seen": 5547870,
"step": 342,
"train_runtime": 886.4774,
"train_tokens_per_second": 6258.332
},
{
"epoch": 1.170940170940171,
"grad_norm": 0.13821318745613098,
"learning_rate": 8.399311531841653e-05,
"loss": 0.3793,
"num_input_tokens_seen": 5560814,
"step": 343,
"train_runtime": 888.4364,
"train_tokens_per_second": 6259.102
},
{
"epoch": 1.1743589743589744,
"grad_norm": 0.133073627948761,
"learning_rate": 8.36488812392427e-05,
"loss": 0.3765,
"num_input_tokens_seen": 5573470,
"step": 344,
"train_runtime": 890.3654,
"train_tokens_per_second": 6259.756
},
{
"epoch": 1.1777777777777778,
"grad_norm": 0.14837369322776794,
"learning_rate": 8.330464716006885e-05,
"loss": 0.4345,
"num_input_tokens_seen": 5589358,
"step": 345,
"train_runtime": 892.7259,
"train_tokens_per_second": 6261.001
},
{
"epoch": 1.1811965811965812,
"grad_norm": 0.11554093658924103,
"learning_rate": 8.296041308089502e-05,
"loss": 0.3454,
"num_input_tokens_seen": 5608286,
"step": 346,
"train_runtime": 895.4735,
"train_tokens_per_second": 6262.928
},
{
"epoch": 1.1846153846153846,
"grad_norm": 0.13670602440834045,
"learning_rate": 8.261617900172117e-05,
"loss": 0.3641,
"num_input_tokens_seen": 5624222,
"step": 347,
"train_runtime": 897.8188,
"train_tokens_per_second": 6264.317
},
{
"epoch": 1.188034188034188,
"grad_norm": 0.11645640432834625,
"learning_rate": 8.227194492254734e-05,
"loss": 0.3086,
"num_input_tokens_seen": 5644302,
"step": 348,
"train_runtime": 900.68,
"train_tokens_per_second": 6266.711
},
{
"epoch": 1.1914529914529914,
"grad_norm": 0.13790756464004517,
"learning_rate": 8.192771084337349e-05,
"loss": 0.3614,
"num_input_tokens_seen": 5660814,
"step": 349,
"train_runtime": 903.1107,
"train_tokens_per_second": 6268.129
},
{
"epoch": 1.1948717948717948,
"grad_norm": 0.12048908323049545,
"learning_rate": 8.158347676419966e-05,
"loss": 0.3175,
"num_input_tokens_seen": 5678238,
"step": 350,
"train_runtime": 905.6459,
"train_tokens_per_second": 6269.822
},
{
"epoch": 1.1982905982905983,
"grad_norm": 0.1469748467206955,
"learning_rate": 8.123924268502582e-05,
"loss": 0.402,
"num_input_tokens_seen": 5690766,
"step": 351,
"train_runtime": 907.5181,
"train_tokens_per_second": 6270.692
},
{
"epoch": 1.2017094017094017,
"grad_norm": 0.15761221945285797,
"learning_rate": 8.089500860585198e-05,
"loss": 0.4114,
"num_input_tokens_seen": 5704126,
"step": 352,
"train_runtime": 909.528,
"train_tokens_per_second": 6271.523
},
{
"epoch": 1.205128205128205,
"grad_norm": 0.12943622469902039,
"learning_rate": 8.055077452667814e-05,
"loss": 0.3823,
"num_input_tokens_seen": 5721070,
"step": 353,
"train_runtime": 912.0326,
"train_tokens_per_second": 6272.879
},
{
"epoch": 1.2085470085470085,
"grad_norm": 0.14878448843955994,
"learning_rate": 8.02065404475043e-05,
"loss": 0.4004,
"num_input_tokens_seen": 5738638,
"step": 354,
"train_runtime": 914.5921,
"train_tokens_per_second": 6274.532
},
{
"epoch": 1.2085470085470085,
"eval_loss": 0.4262903034687042,
"eval_runtime": 11.8731,
"eval_samples_per_second": 84.056,
"eval_steps_per_second": 5.306,
"num_input_tokens_seen": 5738638,
"step": 354
},
{
"epoch": 1.2119658119658119,
"grad_norm": 0.15027886629104614,
"learning_rate": 7.986230636833046e-05,
"loss": 0.352,
"num_input_tokens_seen": 5755054,
"step": 355,
"train_runtime": 928.8681,
"train_tokens_per_second": 6195.771
},
{
"epoch": 1.2153846153846155,
"grad_norm": 0.13495990633964539,
"learning_rate": 7.951807228915663e-05,
"loss": 0.3563,
"num_input_tokens_seen": 5767742,
"step": 356,
"train_runtime": 930.7674,
"train_tokens_per_second": 6196.76
},
{
"epoch": 1.218803418803419,
"grad_norm": 0.1535864919424057,
"learning_rate": 7.917383820998278e-05,
"loss": 0.3608,
"num_input_tokens_seen": 5787614,
"step": 357,
"train_runtime": 933.6119,
"train_tokens_per_second": 6199.164
},
{
"epoch": 1.2222222222222223,
"grad_norm": 0.13963304460048676,
"learning_rate": 7.882960413080895e-05,
"loss": 0.4206,
"num_input_tokens_seen": 5802558,
"step": 358,
"train_runtime": 935.8349,
"train_tokens_per_second": 6200.407
},
{
"epoch": 1.2256410256410257,
"grad_norm": 0.163704514503479,
"learning_rate": 7.848537005163512e-05,
"loss": 0.391,
"num_input_tokens_seen": 5816382,
"step": 359,
"train_runtime": 937.9276,
"train_tokens_per_second": 6201.312
},
{
"epoch": 1.2290598290598291,
"grad_norm": 0.14221028983592987,
"learning_rate": 7.814113597246127e-05,
"loss": 0.3529,
"num_input_tokens_seen": 5833550,
"step": 360,
"train_runtime": 940.4404,
"train_tokens_per_second": 6202.998
},
{
"epoch": 1.2324786324786325,
"grad_norm": 0.14981484413146973,
"learning_rate": 7.779690189328744e-05,
"loss": 0.4097,
"num_input_tokens_seen": 5847742,
"step": 361,
"train_runtime": 943.0512,
"train_tokens_per_second": 6200.874
},
{
"epoch": 1.235897435897436,
"grad_norm": 0.15353192389011383,
"learning_rate": 7.74526678141136e-05,
"loss": 0.4207,
"num_input_tokens_seen": 5861422,
"step": 362,
"train_runtime": 945.0925,
"train_tokens_per_second": 6201.956
},
{
"epoch": 1.2393162393162394,
"grad_norm": 0.1498330533504486,
"learning_rate": 7.710843373493976e-05,
"loss": 0.4371,
"num_input_tokens_seen": 5879550,
"step": 363,
"train_runtime": 947.7032,
"train_tokens_per_second": 6203.999
},
{
"epoch": 1.2427350427350428,
"grad_norm": 0.16379210352897644,
"learning_rate": 7.676419965576592e-05,
"loss": 0.4001,
"num_input_tokens_seen": 5890414,
"step": 364,
"train_runtime": 949.3619,
"train_tokens_per_second": 6204.603
},
{
"epoch": 1.2461538461538462,
"grad_norm": 0.14771924912929535,
"learning_rate": 7.641996557659209e-05,
"loss": 0.4091,
"num_input_tokens_seen": 5903870,
"step": 365,
"train_runtime": 951.3898,
"train_tokens_per_second": 6205.522
},
{
"epoch": 1.2495726495726496,
"grad_norm": 0.1314336210489273,
"learning_rate": 7.607573149741824e-05,
"loss": 0.3686,
"num_input_tokens_seen": 5922702,
"step": 366,
"train_runtime": 954.0994,
"train_tokens_per_second": 6207.636
},
{
"epoch": 1.252991452991453,
"grad_norm": 0.14639326930046082,
"learning_rate": 7.573149741824441e-05,
"loss": 0.391,
"num_input_tokens_seen": 5943566,
"step": 367,
"train_runtime": 957.0573,
"train_tokens_per_second": 6210.251
},
{
"epoch": 1.2564102564102564,
"grad_norm": 0.14717791974544525,
"learning_rate": 7.538726333907056e-05,
"loss": 0.4646,
"num_input_tokens_seen": 5960878,
"step": 368,
"train_runtime": 959.6021,
"train_tokens_per_second": 6211.823
},
{
"epoch": 1.2598290598290598,
"grad_norm": 0.14937731623649597,
"learning_rate": 7.504302925989673e-05,
"loss": 0.448,
"num_input_tokens_seen": 5976654,
"step": 369,
"train_runtime": 961.9381,
"train_tokens_per_second": 6213.138
},
{
"epoch": 1.2632478632478632,
"grad_norm": 0.15321378409862518,
"learning_rate": 7.469879518072289e-05,
"loss": 0.4242,
"num_input_tokens_seen": 5989406,
"step": 370,
"train_runtime": 963.873,
"train_tokens_per_second": 6213.896
},
{
"epoch": 1.2666666666666666,
"grad_norm": 0.13933706283569336,
"learning_rate": 7.435456110154905e-05,
"loss": 0.4543,
"num_input_tokens_seen": 6007710,
"step": 371,
"train_runtime": 966.5773,
"train_tokens_per_second": 6215.447
},
{
"epoch": 1.27008547008547,
"grad_norm": 0.1422203630208969,
"learning_rate": 7.401032702237521e-05,
"loss": 0.3656,
"num_input_tokens_seen": 6021982,
"step": 372,
"train_runtime": 968.6875,
"train_tokens_per_second": 6216.641
},
{
"epoch": 1.2735042735042734,
"grad_norm": 0.15311431884765625,
"learning_rate": 7.366609294320138e-05,
"loss": 0.5369,
"num_input_tokens_seen": 6036606,
"step": 373,
"train_runtime": 970.8599,
"train_tokens_per_second": 6217.793
},
{
"epoch": 1.2769230769230768,
"grad_norm": 0.15368784964084625,
"learning_rate": 7.332185886402754e-05,
"loss": 0.4691,
"num_input_tokens_seen": 6050686,
"step": 374,
"train_runtime": 972.9604,
"train_tokens_per_second": 6218.841
},
{
"epoch": 1.2803418803418802,
"grad_norm": 0.128590390086174,
"learning_rate": 7.29776247848537e-05,
"loss": 0.3645,
"num_input_tokens_seen": 6071006,
"step": 375,
"train_runtime": 975.8603,
"train_tokens_per_second": 6221.183
},
{
"epoch": 1.2837606837606836,
"grad_norm": 0.16918911039829254,
"learning_rate": 7.263339070567987e-05,
"loss": 0.4516,
"num_input_tokens_seen": 6083838,
"step": 376,
"train_runtime": 977.7866,
"train_tokens_per_second": 6222.051
},
{
"epoch": 1.287179487179487,
"grad_norm": 0.1317807137966156,
"learning_rate": 7.228915662650602e-05,
"loss": 0.3979,
"num_input_tokens_seen": 6103870,
"step": 377,
"train_runtime": 980.6218,
"train_tokens_per_second": 6224.489
},
{
"epoch": 1.2905982905982907,
"grad_norm": 0.15844884514808655,
"learning_rate": 7.194492254733219e-05,
"loss": 0.4077,
"num_input_tokens_seen": 6119342,
"step": 378,
"train_runtime": 982.9217,
"train_tokens_per_second": 6225.666
},
{
"epoch": 1.294017094017094,
"grad_norm": 0.13094189763069153,
"learning_rate": 7.160068846815836e-05,
"loss": 0.3317,
"num_input_tokens_seen": 6135582,
"step": 379,
"train_runtime": 985.318,
"train_tokens_per_second": 6227.007
},
{
"epoch": 1.2974358974358975,
"grad_norm": 0.1428907960653305,
"learning_rate": 7.125645438898451e-05,
"loss": 0.3667,
"num_input_tokens_seen": 6153166,
"step": 380,
"train_runtime": 987.8695,
"train_tokens_per_second": 6228.724
},
{
"epoch": 1.300854700854701,
"grad_norm": 0.1479697972536087,
"learning_rate": 7.091222030981068e-05,
"loss": 0.4703,
"num_input_tokens_seen": 6167790,
"step": 381,
"train_runtime": 990.0311,
"train_tokens_per_second": 6229.895
},
{
"epoch": 1.3042735042735043,
"grad_norm": 0.1379973441362381,
"learning_rate": 7.056798623063683e-05,
"loss": 0.305,
"num_input_tokens_seen": 6188846,
"step": 382,
"train_runtime": 993.0644,
"train_tokens_per_second": 6232.069
},
{
"epoch": 1.3076923076923077,
"grad_norm": 0.15161173045635223,
"learning_rate": 7.0223752151463e-05,
"loss": 0.3361,
"num_input_tokens_seen": 6202542,
"step": 383,
"train_runtime": 995.1105,
"train_tokens_per_second": 6233.018
},
{
"epoch": 1.3111111111111111,
"grad_norm": 0.14290477335453033,
"learning_rate": 6.987951807228917e-05,
"loss": 0.3268,
"num_input_tokens_seen": 6220366,
"step": 384,
"train_runtime": 997.717,
"train_tokens_per_second": 6234.599
},
{
"epoch": 1.3145299145299145,
"grad_norm": 0.1553800255060196,
"learning_rate": 6.953528399311532e-05,
"loss": 0.4104,
"num_input_tokens_seen": 6237422,
"step": 385,
"train_runtime": 1000.1787,
"train_tokens_per_second": 6236.307
},
{
"epoch": 1.317948717948718,
"grad_norm": 0.15926386415958405,
"learning_rate": 6.919104991394149e-05,
"loss": 0.3809,
"num_input_tokens_seen": 6249070,
"step": 386,
"train_runtime": 1001.9601,
"train_tokens_per_second": 6236.845
},
{
"epoch": 1.3213675213675213,
"grad_norm": 0.15950970351696014,
"learning_rate": 6.884681583476765e-05,
"loss": 0.3429,
"num_input_tokens_seen": 6265198,
"step": 387,
"train_runtime": 1004.333,
"train_tokens_per_second": 6238.168
},
{
"epoch": 1.3247863247863247,
"grad_norm": 0.15029311180114746,
"learning_rate": 6.850258175559381e-05,
"loss": 0.3975,
"num_input_tokens_seen": 6281966,
"step": 388,
"train_runtime": 1006.7802,
"train_tokens_per_second": 6239.66
},
{
"epoch": 1.3282051282051281,
"grad_norm": 0.16369454562664032,
"learning_rate": 6.815834767641997e-05,
"loss": 0.3495,
"num_input_tokens_seen": 6298718,
"step": 389,
"train_runtime": 1009.2265,
"train_tokens_per_second": 6241.134
},
{
"epoch": 1.3316239316239316,
"grad_norm": 0.1701713353395462,
"learning_rate": 6.781411359724614e-05,
"loss": 0.4102,
"num_input_tokens_seen": 6312510,
"step": 390,
"train_runtime": 1011.2977,
"train_tokens_per_second": 6241.99
},
{
"epoch": 1.335042735042735,
"grad_norm": 0.15310458838939667,
"learning_rate": 6.746987951807229e-05,
"loss": 0.3758,
"num_input_tokens_seen": 6329998,
"step": 391,
"train_runtime": 1014.3612,
"train_tokens_per_second": 6240.379
},
{
"epoch": 1.3384615384615386,
"grad_norm": 0.1793118566274643,
"learning_rate": 6.712564543889846e-05,
"loss": 0.4579,
"num_input_tokens_seen": 6344158,
"step": 392,
"train_runtime": 1016.4559,
"train_tokens_per_second": 6241.449
},
{
"epoch": 1.341880341880342,
"grad_norm": 0.1364370435476303,
"learning_rate": 6.678141135972461e-05,
"loss": 0.3032,
"num_input_tokens_seen": 6362286,
"step": 393,
"train_runtime": 1019.0898,
"train_tokens_per_second": 6243.106
},
{
"epoch": 1.3452991452991454,
"grad_norm": 0.19111692905426025,
"learning_rate": 6.643717728055078e-05,
"loss": 0.3836,
"num_input_tokens_seen": 6374334,
"step": 394,
"train_runtime": 1020.8971,
"train_tokens_per_second": 6243.856
},
{
"epoch": 1.3487179487179488,
"grad_norm": 0.13976141810417175,
"learning_rate": 6.609294320137695e-05,
"loss": 0.3489,
"num_input_tokens_seen": 6392286,
"step": 395,
"train_runtime": 1023.5184,
"train_tokens_per_second": 6245.404
},
{
"epoch": 1.3521367521367522,
"grad_norm": 0.1717049479484558,
"learning_rate": 6.57487091222031e-05,
"loss": 0.4546,
"num_input_tokens_seen": 6407102,
"step": 396,
"train_runtime": 1025.7201,
"train_tokens_per_second": 6246.443
},
{
"epoch": 1.3555555555555556,
"grad_norm": 0.15389494597911835,
"learning_rate": 6.540447504302927e-05,
"loss": 0.3984,
"num_input_tokens_seen": 6424190,
"step": 397,
"train_runtime": 1028.1999,
"train_tokens_per_second": 6247.997
},
{
"epoch": 1.358974358974359,
"grad_norm": 0.15128876268863678,
"learning_rate": 6.506024096385543e-05,
"loss": 0.4107,
"num_input_tokens_seen": 6438926,
"step": 398,
"train_runtime": 1030.39,
"train_tokens_per_second": 6249.018
},
{
"epoch": 1.3623931623931624,
"grad_norm": 0.1720062643289566,
"learning_rate": 6.47160068846816e-05,
"loss": 0.4398,
"num_input_tokens_seen": 6454206,
"step": 399,
"train_runtime": 1032.6825,
"train_tokens_per_second": 6249.942
},
{
"epoch": 1.3658119658119658,
"grad_norm": 0.16892306506633759,
"learning_rate": 6.437177280550775e-05,
"loss": 0.4768,
"num_input_tokens_seen": 6470446,
"step": 400,
"train_runtime": 1035.0677,
"train_tokens_per_second": 6251.23
},
{
"epoch": 1.3692307692307693,
"grad_norm": 0.16459856927394867,
"learning_rate": 6.402753872633392e-05,
"loss": 0.394,
"num_input_tokens_seen": 6485566,
"step": 401,
"train_runtime": 1037.3161,
"train_tokens_per_second": 6252.256
},
{
"epoch": 1.3726495726495727,
"grad_norm": 0.146686390042305,
"learning_rate": 6.368330464716007e-05,
"loss": 0.4074,
"num_input_tokens_seen": 6500878,
"step": 402,
"train_runtime": 1039.5797,
"train_tokens_per_second": 6253.371
},
{
"epoch": 1.376068376068376,
"grad_norm": 0.13347510993480682,
"learning_rate": 6.333907056798624e-05,
"loss": 0.3718,
"num_input_tokens_seen": 6527726,
"step": 403,
"train_runtime": 1043.3774,
"train_tokens_per_second": 6256.342
},
{
"epoch": 1.3794871794871795,
"grad_norm": 0.15149444341659546,
"learning_rate": 6.29948364888124e-05,
"loss": 0.4889,
"num_input_tokens_seen": 6549054,
"step": 404,
"train_runtime": 1046.4485,
"train_tokens_per_second": 6258.363
},
{
"epoch": 1.3829059829059829,
"grad_norm": 0.15119557082653046,
"learning_rate": 6.265060240963856e-05,
"loss": 0.3562,
"num_input_tokens_seen": 6565374,
"step": 405,
"train_runtime": 1048.8497,
"train_tokens_per_second": 6259.595
},
{
"epoch": 1.3863247863247863,
"grad_norm": 0.1899130493402481,
"learning_rate": 6.230636833046472e-05,
"loss": 0.4359,
"num_input_tokens_seen": 6577854,
"step": 406,
"train_runtime": 1050.7387,
"train_tokens_per_second": 6260.219
},
{
"epoch": 1.3897435897435897,
"grad_norm": 0.15261997282505035,
"learning_rate": 6.196213425129088e-05,
"loss": 0.3755,
"num_input_tokens_seen": 6595182,
"step": 407,
"train_runtime": 1053.2481,
"train_tokens_per_second": 6261.755
},
{
"epoch": 1.393162393162393,
"grad_norm": 0.1569528728723526,
"learning_rate": 6.161790017211704e-05,
"loss": 0.4357,
"num_input_tokens_seen": 6609166,
"step": 408,
"train_runtime": 1055.3193,
"train_tokens_per_second": 6262.717
},
{
"epoch": 1.3965811965811965,
"grad_norm": 0.15785826742649078,
"learning_rate": 6.127366609294321e-05,
"loss": 0.3605,
"num_input_tokens_seen": 6622254,
"step": 409,
"train_runtime": 1057.2748,
"train_tokens_per_second": 6263.513
},
{
"epoch": 1.4,
"grad_norm": 0.1593894064426422,
"learning_rate": 6.092943201376936e-05,
"loss": 0.461,
"num_input_tokens_seen": 6637758,
"step": 410,
"train_runtime": 1059.5389,
"train_tokens_per_second": 6264.761
},
{
"epoch": 1.4034188034188033,
"grad_norm": 0.1655980795621872,
"learning_rate": 6.058519793459553e-05,
"loss": 0.3856,
"num_input_tokens_seen": 6653086,
"step": 411,
"train_runtime": 1061.8036,
"train_tokens_per_second": 6265.835
},
{
"epoch": 1.4068376068376067,
"grad_norm": 0.16413439810276031,
"learning_rate": 6.02409638554217e-05,
"loss": 0.3601,
"num_input_tokens_seen": 6671230,
"step": 412,
"train_runtime": 1064.4168,
"train_tokens_per_second": 6267.498
},
{
"epoch": 1.4102564102564101,
"grad_norm": 0.17654147744178772,
"learning_rate": 5.989672977624785e-05,
"loss": 0.4383,
"num_input_tokens_seen": 6685294,
"step": 413,
"train_runtime": 1066.4829,
"train_tokens_per_second": 6268.543
},
{
"epoch": 1.4102564102564101,
"eval_loss": 0.42687925696372986,
"eval_runtime": 11.8448,
"eval_samples_per_second": 84.257,
"eval_steps_per_second": 5.319,
"num_input_tokens_seen": 6685294,
"step": 413
},
{
"epoch": 1.4136752136752135,
"grad_norm": 0.14143113791942596,
"learning_rate": 5.955249569707402e-05,
"loss": 0.3417,
"num_input_tokens_seen": 6706110,
"step": 414,
"train_runtime": 1081.3024,
"train_tokens_per_second": 6201.882
},
{
"epoch": 1.4170940170940172,
"grad_norm": 0.17738325893878937,
"learning_rate": 5.9208261617900174e-05,
"loss": 0.4049,
"num_input_tokens_seen": 6719390,
"step": 415,
"train_runtime": 1083.3114,
"train_tokens_per_second": 6202.64
},
{
"epoch": 1.4205128205128206,
"grad_norm": 0.15967565774917603,
"learning_rate": 5.886402753872634e-05,
"loss": 0.322,
"num_input_tokens_seen": 6732926,
"step": 416,
"train_runtime": 1085.3328,
"train_tokens_per_second": 6203.559
},
{
"epoch": 1.423931623931624,
"grad_norm": 0.17965038120746613,
"learning_rate": 5.85197934595525e-05,
"loss": 0.4321,
"num_input_tokens_seen": 6748014,
"step": 417,
"train_runtime": 1087.5395,
"train_tokens_per_second": 6204.845
},
{
"epoch": 1.4273504273504274,
"grad_norm": 0.17158453166484833,
"learning_rate": 5.8175559380378665e-05,
"loss": 0.3844,
"num_input_tokens_seen": 6762782,
"step": 418,
"train_runtime": 1089.7402,
"train_tokens_per_second": 6205.866
},
{
"epoch": 1.4307692307692308,
"grad_norm": 0.17010599374771118,
"learning_rate": 5.783132530120482e-05,
"loss": 0.3944,
"num_input_tokens_seen": 6775838,
"step": 419,
"train_runtime": 1091.687,
"train_tokens_per_second": 6206.759
},
{
"epoch": 1.4341880341880342,
"grad_norm": 0.14824308454990387,
"learning_rate": 5.748709122203099e-05,
"loss": 0.3437,
"num_input_tokens_seen": 6794014,
"step": 420,
"train_runtime": 1094.3074,
"train_tokens_per_second": 6208.506
},
{
"epoch": 1.4376068376068376,
"grad_norm": 0.1721956878900528,
"learning_rate": 5.714285714285714e-05,
"loss": 0.3813,
"num_input_tokens_seen": 6809502,
"step": 421,
"train_runtime": 1097.1486,
"train_tokens_per_second": 6206.545
},
{
"epoch": 1.441025641025641,
"grad_norm": 0.17868974804878235,
"learning_rate": 5.679862306368331e-05,
"loss": 0.439,
"num_input_tokens_seen": 6823038,
"step": 422,
"train_runtime": 1099.1662,
"train_tokens_per_second": 6207.467
},
{
"epoch": 1.4444444444444444,
"grad_norm": 0.15935160219669342,
"learning_rate": 5.6454388984509464e-05,
"loss": 0.387,
"num_input_tokens_seen": 6841582,
"step": 423,
"train_runtime": 1101.8557,
"train_tokens_per_second": 6209.145
},
{
"epoch": 1.4478632478632478,
"grad_norm": 0.1758459508419037,
"learning_rate": 5.611015490533563e-05,
"loss": 0.5356,
"num_input_tokens_seen": 6855310,
"step": 424,
"train_runtime": 1103.8914,
"train_tokens_per_second": 6210.131
},
{
"epoch": 1.4512820512820512,
"grad_norm": 0.16828133165836334,
"learning_rate": 5.576592082616179e-05,
"loss": 0.3835,
"num_input_tokens_seen": 6875486,
"step": 425,
"train_runtime": 1106.7831,
"train_tokens_per_second": 6212.135
},
{
"epoch": 1.4547008547008546,
"grad_norm": 0.16434825956821442,
"learning_rate": 5.5421686746987955e-05,
"loss": 0.3765,
"num_input_tokens_seen": 6889502,
"step": 426,
"train_runtime": 1108.8374,
"train_tokens_per_second": 6213.266
},
{
"epoch": 1.458119658119658,
"grad_norm": 0.16002990305423737,
"learning_rate": 5.507745266781411e-05,
"loss": 0.4121,
"num_input_tokens_seen": 6908046,
"step": 427,
"train_runtime": 1111.5373,
"train_tokens_per_second": 6214.858
},
{
"epoch": 1.4615384615384617,
"grad_norm": 0.17183275520801544,
"learning_rate": 5.473321858864028e-05,
"loss": 0.439,
"num_input_tokens_seen": 6924190,
"step": 428,
"train_runtime": 1113.8957,
"train_tokens_per_second": 6216.192
},
{
"epoch": 1.464957264957265,
"grad_norm": 0.18027374148368835,
"learning_rate": 5.4388984509466445e-05,
"loss": 0.4895,
"num_input_tokens_seen": 6939070,
"step": 429,
"train_runtime": 1116.1017,
"train_tokens_per_second": 6217.238
},
{
"epoch": 1.4683760683760685,
"grad_norm": 0.15044456720352173,
"learning_rate": 5.40447504302926e-05,
"loss": 0.4429,
"num_input_tokens_seen": 6956478,
"step": 430,
"train_runtime": 1118.6746,
"train_tokens_per_second": 6218.5
},
{
"epoch": 1.471794871794872,
"grad_norm": 0.15003447234630585,
"learning_rate": 5.370051635111877e-05,
"loss": 0.5628,
"num_input_tokens_seen": 6973246,
"step": 431,
"train_runtime": 1121.1665,
"train_tokens_per_second": 6219.635
},
{
"epoch": 1.4752136752136753,
"grad_norm": 0.1591937392950058,
"learning_rate": 5.335628227194492e-05,
"loss": 0.3721,
"num_input_tokens_seen": 6986990,
"step": 432,
"train_runtime": 1123.2293,
"train_tokens_per_second": 6220.448
},
{
"epoch": 1.4786324786324787,
"grad_norm": 0.18640592694282532,
"learning_rate": 5.301204819277109e-05,
"loss": 0.3516,
"num_input_tokens_seen": 7001950,
"step": 433,
"train_runtime": 1125.4499,
"train_tokens_per_second": 6221.468
},
{
"epoch": 1.4820512820512821,
"grad_norm": 0.17443552613258362,
"learning_rate": 5.2667814113597244e-05,
"loss": 0.4784,
"num_input_tokens_seen": 7016318,
"step": 434,
"train_runtime": 1127.6255,
"train_tokens_per_second": 6222.206
},
{
"epoch": 1.4854700854700855,
"grad_norm": 0.1685023009777069,
"learning_rate": 5.232358003442341e-05,
"loss": 0.4227,
"num_input_tokens_seen": 7029358,
"step": 435,
"train_runtime": 1129.5922,
"train_tokens_per_second": 6222.916
},
{
"epoch": 1.488888888888889,
"grad_norm": 0.17190369963645935,
"learning_rate": 5.197934595524957e-05,
"loss": 0.3718,
"num_input_tokens_seen": 7046350,
"step": 436,
"train_runtime": 1132.1043,
"train_tokens_per_second": 6224.117
},
{
"epoch": 1.4923076923076923,
"grad_norm": 0.16871225833892822,
"learning_rate": 5.1635111876075735e-05,
"loss": 0.4095,
"num_input_tokens_seen": 7060286,
"step": 437,
"train_runtime": 1134.2429,
"train_tokens_per_second": 6224.669
},
{
"epoch": 1.4957264957264957,
"grad_norm": 0.15742996335029602,
"learning_rate": 5.1290877796901896e-05,
"loss": 0.3377,
"num_input_tokens_seen": 7077550,
"step": 438,
"train_runtime": 1136.7468,
"train_tokens_per_second": 6226.145
},
{
"epoch": 1.4991452991452991,
"grad_norm": 0.1806265264749527,
"learning_rate": 5.094664371772806e-05,
"loss": 0.4356,
"num_input_tokens_seen": 7096110,
"step": 439,
"train_runtime": 1139.4331,
"train_tokens_per_second": 6227.755
},
{
"epoch": 1.5025641025641026,
"grad_norm": 0.1986326277256012,
"learning_rate": 5.060240963855422e-05,
"loss": 0.421,
"num_input_tokens_seen": 7110462,
"step": 440,
"train_runtime": 1141.5636,
"train_tokens_per_second": 6228.704
},
{
"epoch": 1.505982905982906,
"grad_norm": 0.18825186789035797,
"learning_rate": 5.025817555938038e-05,
"loss": 0.3866,
"num_input_tokens_seen": 7123438,
"step": 441,
"train_runtime": 1143.5279,
"train_tokens_per_second": 6229.352
},
{
"epoch": 1.5094017094017094,
"grad_norm": 0.15836316347122192,
"learning_rate": 4.991394148020654e-05,
"loss": 0.3759,
"num_input_tokens_seen": 7139678,
"step": 442,
"train_runtime": 1145.9334,
"train_tokens_per_second": 6230.448
},
{
"epoch": 1.5128205128205128,
"grad_norm": 0.1643362194299698,
"learning_rate": 4.95697074010327e-05,
"loss": 0.3715,
"num_input_tokens_seen": 7152798,
"step": 443,
"train_runtime": 1147.927,
"train_tokens_per_second": 6231.056
},
{
"epoch": 1.5162393162393162,
"grad_norm": 0.18112708628177643,
"learning_rate": 4.922547332185887e-05,
"loss": 0.5004,
"num_input_tokens_seen": 7166718,
"step": 444,
"train_runtime": 1149.9906,
"train_tokens_per_second": 6231.98
},
{
"epoch": 1.5196581196581196,
"grad_norm": 0.17923805117607117,
"learning_rate": 4.888123924268503e-05,
"loss": 0.3967,
"num_input_tokens_seen": 7180718,
"step": 445,
"train_runtime": 1152.0495,
"train_tokens_per_second": 6232.994
},
{
"epoch": 1.523076923076923,
"grad_norm": 0.15098166465759277,
"learning_rate": 4.853700516351119e-05,
"loss": 0.379,
"num_input_tokens_seen": 7198382,
"step": 446,
"train_runtime": 1154.5661,
"train_tokens_per_second": 6234.708
},
{
"epoch": 1.5264957264957264,
"grad_norm": 0.17328427731990814,
"learning_rate": 4.8192771084337354e-05,
"loss": 0.3807,
"num_input_tokens_seen": 7213006,
"step": 447,
"train_runtime": 1156.7041,
"train_tokens_per_second": 6235.827
},
{
"epoch": 1.5299145299145298,
"grad_norm": 0.13623268902301788,
"learning_rate": 4.7848537005163515e-05,
"loss": 0.3011,
"num_input_tokens_seen": 7243582,
"step": 448,
"train_runtime": 1161.0841,
"train_tokens_per_second": 6238.637
},
{
"epoch": 1.5333333333333332,
"grad_norm": 0.23146113753318787,
"learning_rate": 4.7504302925989676e-05,
"loss": 0.4946,
"num_input_tokens_seen": 7257710,
"step": 449,
"train_runtime": 1163.1872,
"train_tokens_per_second": 6239.503
},
{
"epoch": 1.5367521367521366,
"grad_norm": 0.1464138627052307,
"learning_rate": 4.716006884681584e-05,
"loss": 0.3956,
"num_input_tokens_seen": 7275646,
"step": 450,
"train_runtime": 1165.763,
"train_tokens_per_second": 6241.102
},
{
"epoch": 1.54017094017094,
"grad_norm": 0.13081535696983337,
"learning_rate": 4.6815834767642e-05,
"loss": 0.351,
"num_input_tokens_seen": 7295710,
"step": 451,
"train_runtime": 1169.156,
"train_tokens_per_second": 6240.151
},
{
"epoch": 1.5435897435897434,
"grad_norm": 0.16835983097553253,
"learning_rate": 4.647160068846816e-05,
"loss": 0.4823,
"num_input_tokens_seen": 7314574,
"step": 452,
"train_runtime": 1171.8934,
"train_tokens_per_second": 6241.672
},
{
"epoch": 1.547008547008547,
"grad_norm": 0.12163835763931274,
"learning_rate": 4.612736660929432e-05,
"loss": 0.2982,
"num_input_tokens_seen": 7343022,
"step": 453,
"train_runtime": 1175.8796,
"train_tokens_per_second": 6244.706
},
{
"epoch": 1.5504273504273505,
"grad_norm": 0.14073219895362854,
"learning_rate": 4.578313253012048e-05,
"loss": 0.2964,
"num_input_tokens_seen": 7363630,
"step": 454,
"train_runtime": 1178.8416,
"train_tokens_per_second": 6246.497
},
{
"epoch": 1.5538461538461539,
"grad_norm": 0.1757187843322754,
"learning_rate": 4.543889845094665e-05,
"loss": 0.4486,
"num_input_tokens_seen": 7378830,
"step": 455,
"train_runtime": 1181.0635,
"train_tokens_per_second": 6247.615
},
{
"epoch": 1.5572649572649573,
"grad_norm": 0.16719017922878265,
"learning_rate": 4.509466437177281e-05,
"loss": 0.342,
"num_input_tokens_seen": 7396958,
"step": 456,
"train_runtime": 1183.6752,
"train_tokens_per_second": 6249.145
},
{
"epoch": 1.5606837606837607,
"grad_norm": 0.15160873532295227,
"learning_rate": 4.475043029259897e-05,
"loss": 0.3305,
"num_input_tokens_seen": 7419918,
"step": 457,
"train_runtime": 1186.9428,
"train_tokens_per_second": 6251.285
},
{
"epoch": 1.564102564102564,
"grad_norm": 0.16827233135700226,
"learning_rate": 4.4406196213425134e-05,
"loss": 0.3478,
"num_input_tokens_seen": 7438590,
"step": 458,
"train_runtime": 1189.6616,
"train_tokens_per_second": 6252.694
},
{
"epoch": 1.5675213675213675,
"grad_norm": 0.15692555904388428,
"learning_rate": 4.4061962134251295e-05,
"loss": 0.3317,
"num_input_tokens_seen": 7457614,
"step": 459,
"train_runtime": 1192.4245,
"train_tokens_per_second": 6254.16
},
{
"epoch": 1.570940170940171,
"grad_norm": 0.16111750900745392,
"learning_rate": 4.371772805507746e-05,
"loss": 0.3559,
"num_input_tokens_seen": 7478254,
"step": 460,
"train_runtime": 1195.4195,
"train_tokens_per_second": 6255.757
},
{
"epoch": 1.5743589743589743,
"grad_norm": 0.1745642125606537,
"learning_rate": 4.337349397590362e-05,
"loss": 0.3515,
"num_input_tokens_seen": 7491422,
"step": 461,
"train_runtime": 1197.3704,
"train_tokens_per_second": 6256.562
},
{
"epoch": 1.5777777777777777,
"grad_norm": 0.1923861801624298,
"learning_rate": 4.302925989672978e-05,
"loss": 0.4927,
"num_input_tokens_seen": 7508174,
"step": 462,
"train_runtime": 1199.809,
"train_tokens_per_second": 6257.808
},
{
"epoch": 1.5811965811965814,
"grad_norm": 0.19131140410900116,
"learning_rate": 4.268502581755594e-05,
"loss": 0.4331,
"num_input_tokens_seen": 7520590,
"step": 463,
"train_runtime": 1201.6752,
"train_tokens_per_second": 6258.422
},
{
"epoch": 1.5846153846153848,
"grad_norm": 0.16123589873313904,
"learning_rate": 4.23407917383821e-05,
"loss": 0.3504,
"num_input_tokens_seen": 7534430,
"step": 464,
"train_runtime": 1203.7756,
"train_tokens_per_second": 6258.999
},
{
"epoch": 1.5880341880341882,
"grad_norm": 0.1816190630197525,
"learning_rate": 4.199655765920826e-05,
"loss": 0.349,
"num_input_tokens_seen": 7550974,
"step": 465,
"train_runtime": 1206.2032,
"train_tokens_per_second": 6260.117
},
{
"epoch": 1.5914529914529916,
"grad_norm": 0.1618788093328476,
"learning_rate": 4.1652323580034424e-05,
"loss": 0.3963,
"num_input_tokens_seen": 7568494,
"step": 466,
"train_runtime": 1208.719,
"train_tokens_per_second": 6261.583
},
{
"epoch": 1.594871794871795,
"grad_norm": 0.1682547926902771,
"learning_rate": 4.1308089500860585e-05,
"loss": 0.4128,
"num_input_tokens_seen": 7584510,
"step": 467,
"train_runtime": 1211.076,
"train_tokens_per_second": 6262.621
},
{
"epoch": 1.5982905982905984,
"grad_norm": 0.17071352899074554,
"learning_rate": 4.0963855421686746e-05,
"loss": 0.4007,
"num_input_tokens_seen": 7601806,
"step": 468,
"train_runtime": 1213.648,
"train_tokens_per_second": 6263.6
},
{
"epoch": 1.6017094017094018,
"grad_norm": 0.19961658120155334,
"learning_rate": 4.061962134251291e-05,
"loss": 0.3831,
"num_input_tokens_seen": 7615134,
"step": 469,
"train_runtime": 1215.6143,
"train_tokens_per_second": 6264.433
},
{
"epoch": 1.6051282051282052,
"grad_norm": 0.15891629457473755,
"learning_rate": 4.027538726333907e-05,
"loss": 0.3579,
"num_input_tokens_seen": 7632446,
"step": 470,
"train_runtime": 1218.1415,
"train_tokens_per_second": 6265.648
},
{
"epoch": 1.6085470085470086,
"grad_norm": 0.18139025568962097,
"learning_rate": 3.993115318416523e-05,
"loss": 0.4023,
"num_input_tokens_seen": 7647038,
"step": 471,
"train_runtime": 1220.3009,
"train_tokens_per_second": 6266.519
},
{
"epoch": 1.611965811965812,
"grad_norm": 0.1726229041814804,
"learning_rate": 3.958691910499139e-05,
"loss": 0.3495,
"num_input_tokens_seen": 7664846,
"step": 472,
"train_runtime": 1222.889,
"train_tokens_per_second": 6267.818
},
{
"epoch": 1.611965811965812,
"eval_loss": 0.4264853894710541,
"eval_runtime": 11.8946,
"eval_samples_per_second": 83.904,
"eval_steps_per_second": 5.297,
"num_input_tokens_seen": 7664846,
"step": 472
},
{
"epoch": 1.6153846153846154,
"grad_norm": 0.2046596258878708,
"learning_rate": 3.924268502581756e-05,
"loss": 0.4611,
"num_input_tokens_seen": 7678558,
"step": 473,
"train_runtime": 1236.8201,
"train_tokens_per_second": 6208.306
},
{
"epoch": 1.6188034188034188,
"grad_norm": 0.18339784443378448,
"learning_rate": 3.889845094664372e-05,
"loss": 0.4687,
"num_input_tokens_seen": 7692542,
"step": 474,
"train_runtime": 1238.9304,
"train_tokens_per_second": 6209.019
},
{
"epoch": 1.6222222222222222,
"grad_norm": 0.15463566780090332,
"learning_rate": 3.855421686746988e-05,
"loss": 0.3533,
"num_input_tokens_seen": 7706094,
"step": 475,
"train_runtime": 1240.9949,
"train_tokens_per_second": 6209.61
},
{
"epoch": 1.6256410256410256,
"grad_norm": 0.18534722924232483,
"learning_rate": 3.820998278829604e-05,
"loss": 0.429,
"num_input_tokens_seen": 7723006,
"step": 476,
"train_runtime": 1243.4537,
"train_tokens_per_second": 6210.932
},
{
"epoch": 1.629059829059829,
"grad_norm": 0.16153299808502197,
"learning_rate": 3.7865748709122204e-05,
"loss": 0.368,
"num_input_tokens_seen": 7739230,
"step": 477,
"train_runtime": 1245.8498,
"train_tokens_per_second": 6212.009
},
{
"epoch": 1.6324786324786325,
"grad_norm": 0.18664556741714478,
"learning_rate": 3.7521514629948365e-05,
"loss": 0.3884,
"num_input_tokens_seen": 7753966,
"step": 478,
"train_runtime": 1248.0407,
"train_tokens_per_second": 6212.911
},
{
"epoch": 1.6358974358974359,
"grad_norm": 0.14830684661865234,
"learning_rate": 3.717728055077453e-05,
"loss": 0.3094,
"num_input_tokens_seen": 7771758,
"step": 479,
"train_runtime": 1250.6256,
"train_tokens_per_second": 6214.296
},
{
"epoch": 1.6393162393162393,
"grad_norm": 0.1431615799665451,
"learning_rate": 3.683304647160069e-05,
"loss": 0.3434,
"num_input_tokens_seen": 7788030,
"step": 480,
"train_runtime": 1253.0226,
"train_tokens_per_second": 6215.395
},
{
"epoch": 1.6427350427350427,
"grad_norm": 0.17345507442951202,
"learning_rate": 3.648881239242685e-05,
"loss": 0.4109,
"num_input_tokens_seen": 7805374,
"step": 481,
"train_runtime": 1256.1793,
"train_tokens_per_second": 6213.583
},
{
"epoch": 1.646153846153846,
"grad_norm": 0.18331271409988403,
"learning_rate": 3.614457831325301e-05,
"loss": 0.483,
"num_input_tokens_seen": 7821278,
"step": 482,
"train_runtime": 1258.5131,
"train_tokens_per_second": 6214.697
},
{
"epoch": 1.6495726495726495,
"grad_norm": 0.14575603604316711,
"learning_rate": 3.580034423407918e-05,
"loss": 0.3499,
"num_input_tokens_seen": 7838750,
"step": 483,
"train_runtime": 1261.0972,
"train_tokens_per_second": 6215.817
},
{
"epoch": 1.652991452991453,
"grad_norm": 0.16931626200675964,
"learning_rate": 3.545611015490534e-05,
"loss": 0.364,
"num_input_tokens_seen": 7855742,
"step": 484,
"train_runtime": 1263.5759,
"train_tokens_per_second": 6217.072
},
{
"epoch": 1.6564102564102563,
"grad_norm": 0.17259550094604492,
"learning_rate": 3.51118760757315e-05,
"loss": 0.4564,
"num_input_tokens_seen": 7874494,
"step": 485,
"train_runtime": 1266.3175,
"train_tokens_per_second": 6218.42
},
{
"epoch": 1.6598290598290597,
"grad_norm": 0.17083777487277985,
"learning_rate": 3.476764199655766e-05,
"loss": 0.3809,
"num_input_tokens_seen": 7890430,
"step": 486,
"train_runtime": 1268.6327,
"train_tokens_per_second": 6219.633
},
{
"epoch": 1.6632478632478631,
"grad_norm": 0.1671985685825348,
"learning_rate": 3.442340791738382e-05,
"loss": 0.3755,
"num_input_tokens_seen": 7906142,
"step": 487,
"train_runtime": 1270.96,
"train_tokens_per_second": 6220.606
},
{
"epoch": 1.6666666666666665,
"grad_norm": 0.18116803467273712,
"learning_rate": 3.4079173838209984e-05,
"loss": 0.3913,
"num_input_tokens_seen": 7922366,
"step": 488,
"train_runtime": 1273.3633,
"train_tokens_per_second": 6221.607
},
{
"epoch": 1.67008547008547,
"grad_norm": 0.18932628631591797,
"learning_rate": 3.3734939759036146e-05,
"loss": 0.4293,
"num_input_tokens_seen": 7934942,
"step": 489,
"train_runtime": 1275.2793,
"train_tokens_per_second": 6222.121
},
{
"epoch": 1.6735042735042736,
"grad_norm": 0.17077142000198364,
"learning_rate": 3.339070567986231e-05,
"loss": 0.3818,
"num_input_tokens_seen": 7951486,
"step": 490,
"train_runtime": 1277.6946,
"train_tokens_per_second": 6223.307
},
{
"epoch": 1.676923076923077,
"grad_norm": 0.1565760374069214,
"learning_rate": 3.3046471600688475e-05,
"loss": 0.4047,
"num_input_tokens_seen": 7970478,
"step": 491,
"train_runtime": 1280.4332,
"train_tokens_per_second": 6224.829
},
{
"epoch": 1.6803418803418804,
"grad_norm": 0.17805105447769165,
"learning_rate": 3.2702237521514636e-05,
"loss": 0.3757,
"num_input_tokens_seen": 7984814,
"step": 492,
"train_runtime": 1282.5395,
"train_tokens_per_second": 6225.784
},
{
"epoch": 1.6837606837606838,
"grad_norm": 0.19390779733657837,
"learning_rate": 3.23580034423408e-05,
"loss": 0.3895,
"num_input_tokens_seen": 7998286,
"step": 493,
"train_runtime": 1284.5377,
"train_tokens_per_second": 6226.587
},
{
"epoch": 1.6871794871794872,
"grad_norm": 0.16203835606575012,
"learning_rate": 3.201376936316696e-05,
"loss": 0.3933,
"num_input_tokens_seen": 8022334,
"step": 494,
"train_runtime": 1287.9546,
"train_tokens_per_second": 6228.74
},
{
"epoch": 1.6905982905982906,
"grad_norm": 0.164924755692482,
"learning_rate": 3.166953528399312e-05,
"loss": 0.367,
"num_input_tokens_seen": 8043294,
"step": 495,
"train_runtime": 1290.9515,
"train_tokens_per_second": 6230.516
},
{
"epoch": 1.694017094017094,
"grad_norm": 0.187575563788414,
"learning_rate": 3.132530120481928e-05,
"loss": 0.4334,
"num_input_tokens_seen": 8057310,
"step": 496,
"train_runtime": 1293.0552,
"train_tokens_per_second": 6231.219
},
{
"epoch": 1.6974358974358974,
"grad_norm": 0.1323373168706894,
"learning_rate": 3.098106712564544e-05,
"loss": 0.3116,
"num_input_tokens_seen": 8083774,
"step": 497,
"train_runtime": 1296.8416,
"train_tokens_per_second": 6233.432
},
{
"epoch": 1.7008547008547008,
"grad_norm": 0.20211701095104218,
"learning_rate": 3.0636833046471604e-05,
"loss": 0.4324,
"num_input_tokens_seen": 8097038,
"step": 498,
"train_runtime": 1298.8399,
"train_tokens_per_second": 6234.054
},
{
"epoch": 1.7042735042735044,
"grad_norm": 0.17863459885120392,
"learning_rate": 3.0292598967297765e-05,
"loss": 0.2992,
"num_input_tokens_seen": 8114750,
"step": 499,
"train_runtime": 1301.44,
"train_tokens_per_second": 6235.208
},
{
"epoch": 1.7076923076923078,
"grad_norm": 0.19749584794044495,
"learning_rate": 2.9948364888123926e-05,
"loss": 0.4242,
"num_input_tokens_seen": 8126750,
"step": 500,
"train_runtime": 1303.2477,
"train_tokens_per_second": 6235.768
},
{
"epoch": 1.7111111111111112,
"grad_norm": 0.171902135014534,
"learning_rate": 2.9604130808950087e-05,
"loss": 0.3748,
"num_input_tokens_seen": 8144766,
"step": 501,
"train_runtime": 1305.8965,
"train_tokens_per_second": 6236.915
},
{
"epoch": 1.7145299145299147,
"grad_norm": 0.15472909808158875,
"learning_rate": 2.925989672977625e-05,
"loss": 0.3657,
"num_input_tokens_seen": 8164254,
"step": 502,
"train_runtime": 1308.7049,
"train_tokens_per_second": 6238.423
},
{
"epoch": 1.717948717948718,
"grad_norm": 0.1825917810201645,
"learning_rate": 2.891566265060241e-05,
"loss": 0.3551,
"num_input_tokens_seen": 8178510,
"step": 503,
"train_runtime": 1310.798,
"train_tokens_per_second": 6239.337
},
{
"epoch": 1.7213675213675215,
"grad_norm": 0.1650628000497818,
"learning_rate": 2.857142857142857e-05,
"loss": 0.3871,
"num_input_tokens_seen": 8196702,
"step": 504,
"train_runtime": 1313.4498,
"train_tokens_per_second": 6240.59
},
{
"epoch": 1.7247863247863249,
"grad_norm": 0.17389492690563202,
"learning_rate": 2.8227194492254732e-05,
"loss": 0.3691,
"num_input_tokens_seen": 8216254,
"step": 505,
"train_runtime": 1316.2774,
"train_tokens_per_second": 6242.038
},
{
"epoch": 1.7282051282051283,
"grad_norm": 0.17346595227718353,
"learning_rate": 2.7882960413080893e-05,
"loss": 0.4057,
"num_input_tokens_seen": 8233758,
"step": 506,
"train_runtime": 1318.8695,
"train_tokens_per_second": 6243.042
},
{
"epoch": 1.7316239316239317,
"grad_norm": 0.15873438119888306,
"learning_rate": 2.7538726333907055e-05,
"loss": 0.332,
"num_input_tokens_seen": 8247550,
"step": 507,
"train_runtime": 1320.9274,
"train_tokens_per_second": 6243.757
},
{
"epoch": 1.735042735042735,
"grad_norm": 0.17913693189620972,
"learning_rate": 2.7194492254733223e-05,
"loss": 0.3435,
"num_input_tokens_seen": 8263054,
"step": 508,
"train_runtime": 1323.2116,
"train_tokens_per_second": 6244.696
},
{
"epoch": 1.7384615384615385,
"grad_norm": 0.15651476383209229,
"learning_rate": 2.6850258175559384e-05,
"loss": 0.3343,
"num_input_tokens_seen": 8278046,
"step": 509,
"train_runtime": 1325.4232,
"train_tokens_per_second": 6245.587
},
{
"epoch": 1.741880341880342,
"grad_norm": 0.17296011745929718,
"learning_rate": 2.6506024096385545e-05,
"loss": 0.4069,
"num_input_tokens_seen": 8295214,
"step": 510,
"train_runtime": 1327.9451,
"train_tokens_per_second": 6246.654
},
{
"epoch": 1.7452991452991453,
"grad_norm": 0.18028153479099274,
"learning_rate": 2.6161790017211706e-05,
"loss": 0.3585,
"num_input_tokens_seen": 8312942,
"step": 511,
"train_runtime": 1331.0641,
"train_tokens_per_second": 6245.336
},
{
"epoch": 1.7487179487179487,
"grad_norm": 0.18217986822128296,
"learning_rate": 2.5817555938037867e-05,
"loss": 0.3445,
"num_input_tokens_seen": 8329982,
"step": 512,
"train_runtime": 1333.576,
"train_tokens_per_second": 6246.35
},
{
"epoch": 1.7521367521367521,
"grad_norm": 0.17503562569618225,
"learning_rate": 2.547332185886403e-05,
"loss": 0.3677,
"num_input_tokens_seen": 8341998,
"step": 513,
"train_runtime": 1335.4087,
"train_tokens_per_second": 6246.775
},
{
"epoch": 1.7555555555555555,
"grad_norm": 0.12160934507846832,
"learning_rate": 2.512908777969019e-05,
"loss": 0.282,
"num_input_tokens_seen": 8371790,
"step": 514,
"train_runtime": 1339.6445,
"train_tokens_per_second": 6249.262
},
{
"epoch": 1.758974358974359,
"grad_norm": 0.1700914204120636,
"learning_rate": 2.478485370051635e-05,
"loss": 0.4006,
"num_input_tokens_seen": 8390766,
"step": 515,
"train_runtime": 1342.3857,
"train_tokens_per_second": 6250.637
},
{
"epoch": 1.7623931623931623,
"grad_norm": 0.18512286245822906,
"learning_rate": 2.4440619621342516e-05,
"loss": 0.4371,
"num_input_tokens_seen": 8401710,
"step": 516,
"train_runtime": 1344.1099,
"train_tokens_per_second": 6250.761
},
{
"epoch": 1.7658119658119658,
"grad_norm": 0.1791275441646576,
"learning_rate": 2.4096385542168677e-05,
"loss": 0.3738,
"num_input_tokens_seen": 8418446,
"step": 517,
"train_runtime": 1346.5498,
"train_tokens_per_second": 6251.864
},
{
"epoch": 1.7692307692307692,
"grad_norm": 0.18900056183338165,
"learning_rate": 2.3752151462994838e-05,
"loss": 0.4529,
"num_input_tokens_seen": 8430590,
"step": 518,
"train_runtime": 1348.3721,
"train_tokens_per_second": 6252.421
},
{
"epoch": 1.7726495726495726,
"grad_norm": 0.1776425540447235,
"learning_rate": 2.3407917383821e-05,
"loss": 0.3513,
"num_input_tokens_seen": 8450318,
"step": 519,
"train_runtime": 1351.2218,
"train_tokens_per_second": 6253.835
},
{
"epoch": 1.776068376068376,
"grad_norm": 0.18933919072151184,
"learning_rate": 2.306368330464716e-05,
"loss": 0.3775,
"num_input_tokens_seen": 8464190,
"step": 520,
"train_runtime": 1353.2852,
"train_tokens_per_second": 6254.55
},
{
"epoch": 1.7794871794871794,
"grad_norm": 0.1620868742465973,
"learning_rate": 2.2719449225473325e-05,
"loss": 0.4034,
"num_input_tokens_seen": 8483038,
"step": 521,
"train_runtime": 1356.0363,
"train_tokens_per_second": 6255.76
},
{
"epoch": 1.7829059829059828,
"grad_norm": 0.16931356489658356,
"learning_rate": 2.2375215146299486e-05,
"loss": 0.3733,
"num_input_tokens_seen": 8499278,
"step": 522,
"train_runtime": 1358.4322,
"train_tokens_per_second": 6256.682
},
{
"epoch": 1.7863247863247862,
"grad_norm": 0.1474018692970276,
"learning_rate": 2.2030981067125648e-05,
"loss": 0.3131,
"num_input_tokens_seen": 8518766,
"step": 523,
"train_runtime": 1361.2451,
"train_tokens_per_second": 6258.069
},
{
"epoch": 1.7897435897435896,
"grad_norm": 0.16736820340156555,
"learning_rate": 2.168674698795181e-05,
"loss": 0.3634,
"num_input_tokens_seen": 8534430,
"step": 524,
"train_runtime": 1363.5049,
"train_tokens_per_second": 6259.186
},
{
"epoch": 1.793162393162393,
"grad_norm": 0.17213431000709534,
"learning_rate": 2.134251290877797e-05,
"loss": 0.3632,
"num_input_tokens_seen": 8546862,
"step": 525,
"train_runtime": 1365.3454,
"train_tokens_per_second": 6259.853
},
{
"epoch": 1.7965811965811964,
"grad_norm": 0.19592760503292084,
"learning_rate": 2.099827882960413e-05,
"loss": 0.381,
"num_input_tokens_seen": 8561358,
"step": 526,
"train_runtime": 1367.5092,
"train_tokens_per_second": 6260.549
},
{
"epoch": 1.8,
"grad_norm": 0.1715427190065384,
"learning_rate": 2.0654044750430293e-05,
"loss": 0.4199,
"num_input_tokens_seen": 8581310,
"step": 527,
"train_runtime": 1370.3773,
"train_tokens_per_second": 6262.005
},
{
"epoch": 1.8034188034188035,
"grad_norm": 0.194061741232872,
"learning_rate": 2.0309810671256454e-05,
"loss": 0.3965,
"num_input_tokens_seen": 8592766,
"step": 528,
"train_runtime": 1372.1254,
"train_tokens_per_second": 6262.376
},
{
"epoch": 1.8068376068376069,
"grad_norm": 0.1930086761713028,
"learning_rate": 1.9965576592082615e-05,
"loss": 0.3976,
"num_input_tokens_seen": 8607166,
"step": 529,
"train_runtime": 1374.2507,
"train_tokens_per_second": 6263.17
},
{
"epoch": 1.8102564102564103,
"grad_norm": 0.16003040969371796,
"learning_rate": 1.962134251290878e-05,
"loss": 0.3367,
"num_input_tokens_seen": 8622478,
"step": 530,
"train_runtime": 1376.5089,
"train_tokens_per_second": 6264.019
},
{
"epoch": 1.8136752136752137,
"grad_norm": 0.19035999476909637,
"learning_rate": 1.927710843373494e-05,
"loss": 0.5509,
"num_input_tokens_seen": 8637918,
"step": 531,
"train_runtime": 1378.7679,
"train_tokens_per_second": 6264.954
},
{
"epoch": 1.8136752136752137,
"eval_loss": 0.4248267114162445,
"eval_runtime": 11.8853,
"eval_samples_per_second": 83.969,
"eval_steps_per_second": 5.301,
"num_input_tokens_seen": 8637918,
"step": 531
},
{
"epoch": 1.817094017094017,
"grad_norm": 0.17047119140625,
"learning_rate": 1.8932874354561102e-05,
"loss": 0.3973,
"num_input_tokens_seen": 8656606,
"step": 532,
"train_runtime": 1393.3816,
"train_tokens_per_second": 6212.66
},
{
"epoch": 1.8205128205128205,
"grad_norm": 0.1665705293416977,
"learning_rate": 1.8588640275387263e-05,
"loss": 0.4401,
"num_input_tokens_seen": 8675454,
"step": 533,
"train_runtime": 1396.1479,
"train_tokens_per_second": 6213.85
},
{
"epoch": 1.823931623931624,
"grad_norm": 0.18982985615730286,
"learning_rate": 1.8244406196213425e-05,
"loss": 0.4021,
"num_input_tokens_seen": 8690142,
"step": 534,
"train_runtime": 1398.3083,
"train_tokens_per_second": 6214.754
},
{
"epoch": 1.8273504273504273,
"grad_norm": 0.16096247732639313,
"learning_rate": 1.790017211703959e-05,
"loss": 0.4033,
"num_input_tokens_seen": 8706558,
"step": 535,
"train_runtime": 1400.6804,
"train_tokens_per_second": 6215.949
},
{
"epoch": 1.830769230769231,
"grad_norm": 0.1925681084394455,
"learning_rate": 1.755593803786575e-05,
"loss": 0.4394,
"num_input_tokens_seen": 8722270,
"step": 536,
"train_runtime": 1402.9974,
"train_tokens_per_second": 6216.882
},
{
"epoch": 1.8341880341880343,
"grad_norm": 0.18180759251117706,
"learning_rate": 1.721170395869191e-05,
"loss": 0.4643,
"num_input_tokens_seen": 8737982,
"step": 537,
"train_runtime": 1405.3075,
"train_tokens_per_second": 6217.844
},
{
"epoch": 1.8376068376068377,
"grad_norm": 0.1800447255373001,
"learning_rate": 1.6867469879518073e-05,
"loss": 0.6214,
"num_input_tokens_seen": 8753838,
"step": 538,
"train_runtime": 1407.6382,
"train_tokens_per_second": 6218.812
},
{
"epoch": 1.8410256410256411,
"grad_norm": 0.18196427822113037,
"learning_rate": 1.6523235800344237e-05,
"loss": 0.3515,
"num_input_tokens_seen": 8767294,
"step": 539,
"train_runtime": 1409.6646,
"train_tokens_per_second": 6219.418
},
{
"epoch": 1.8444444444444446,
"grad_norm": 0.1552770733833313,
"learning_rate": 1.61790017211704e-05,
"loss": 0.3492,
"num_input_tokens_seen": 8790974,
"step": 540,
"train_runtime": 1413.0808,
"train_tokens_per_second": 6221.14
},
{
"epoch": 1.847863247863248,
"grad_norm": 0.17243799567222595,
"learning_rate": 1.583476764199656e-05,
"loss": 0.4604,
"num_input_tokens_seen": 8802782,
"step": 541,
"train_runtime": 1415.3829,
"train_tokens_per_second": 6219.364
},
{
"epoch": 1.8512820512820514,
"grad_norm": 0.1819770187139511,
"learning_rate": 1.549053356282272e-05,
"loss": 0.4274,
"num_input_tokens_seen": 8818334,
"step": 542,
"train_runtime": 1417.6847,
"train_tokens_per_second": 6220.237
},
{
"epoch": 1.8547008547008548,
"grad_norm": 0.17073139548301697,
"learning_rate": 1.5146299483648882e-05,
"loss": 0.4203,
"num_input_tokens_seen": 8837166,
"step": 543,
"train_runtime": 1420.4111,
"train_tokens_per_second": 6221.555
},
{
"epoch": 1.8581196581196582,
"grad_norm": 0.1646145135164261,
"learning_rate": 1.4802065404475044e-05,
"loss": 0.3531,
"num_input_tokens_seen": 8854318,
"step": 544,
"train_runtime": 1422.8958,
"train_tokens_per_second": 6222.745
},
{
"epoch": 1.8615384615384616,
"grad_norm": 0.21891261637210846,
"learning_rate": 1.4457831325301205e-05,
"loss": 0.4048,
"num_input_tokens_seen": 8867102,
"step": 545,
"train_runtime": 1424.813,
"train_tokens_per_second": 6223.345
},
{
"epoch": 1.864957264957265,
"grad_norm": 0.2045115977525711,
"learning_rate": 1.4113597246127366e-05,
"loss": 0.5021,
"num_input_tokens_seen": 8880990,
"step": 546,
"train_runtime": 1426.8816,
"train_tokens_per_second": 6224.055
},
{
"epoch": 1.8683760683760684,
"grad_norm": 0.18179452419281006,
"learning_rate": 1.3769363166953527e-05,
"loss": 0.4367,
"num_input_tokens_seen": 8895422,
"step": 547,
"train_runtime": 1429.0398,
"train_tokens_per_second": 6224.754
},
{
"epoch": 1.8717948717948718,
"grad_norm": 0.1890801042318344,
"learning_rate": 1.3425129087779692e-05,
"loss": 0.3696,
"num_input_tokens_seen": 8908718,
"step": 548,
"train_runtime": 1431.0057,
"train_tokens_per_second": 6225.495
},
{
"epoch": 1.8752136752136752,
"grad_norm": 0.1882188469171524,
"learning_rate": 1.3080895008605853e-05,
"loss": 0.4208,
"num_input_tokens_seen": 8923086,
"step": 549,
"train_runtime": 1433.137,
"train_tokens_per_second": 6226.262
},
{
"epoch": 1.8786324786324786,
"grad_norm": 0.168639674782753,
"learning_rate": 1.2736660929432014e-05,
"loss": 0.3938,
"num_input_tokens_seen": 8941022,
"step": 550,
"train_runtime": 1435.7111,
"train_tokens_per_second": 6227.591
},
{
"epoch": 1.882051282051282,
"grad_norm": 0.21191436052322388,
"learning_rate": 1.2392426850258176e-05,
"loss": 0.3797,
"num_input_tokens_seen": 8951518,
"step": 551,
"train_runtime": 1437.3232,
"train_tokens_per_second": 6227.909
},
{
"epoch": 1.8854700854700854,
"grad_norm": 0.17271479964256287,
"learning_rate": 1.2048192771084338e-05,
"loss": 0.3924,
"num_input_tokens_seen": 8967406,
"step": 552,
"train_runtime": 1439.697,
"train_tokens_per_second": 6228.676
},
{
"epoch": 1.8888888888888888,
"grad_norm": 0.17815494537353516,
"learning_rate": 1.17039586919105e-05,
"loss": 0.3984,
"num_input_tokens_seen": 8980910,
"step": 553,
"train_runtime": 1441.6466,
"train_tokens_per_second": 6229.619
},
{
"epoch": 1.8923076923076922,
"grad_norm": 0.18840882182121277,
"learning_rate": 1.1359724612736663e-05,
"loss": 0.4698,
"num_input_tokens_seen": 8996702,
"step": 554,
"train_runtime": 1444.0033,
"train_tokens_per_second": 6230.389
},
{
"epoch": 1.8957264957264957,
"grad_norm": 0.17246229946613312,
"learning_rate": 1.1015490533562824e-05,
"loss": 0.3294,
"num_input_tokens_seen": 9014414,
"step": 555,
"train_runtime": 1446.5743,
"train_tokens_per_second": 6231.56
},
{
"epoch": 1.899145299145299,
"grad_norm": 0.20323026180267334,
"learning_rate": 1.0671256454388985e-05,
"loss": 0.4267,
"num_input_tokens_seen": 9031550,
"step": 556,
"train_runtime": 1449.0794,
"train_tokens_per_second": 6232.612
},
{
"epoch": 1.9025641025641025,
"grad_norm": 0.17592619359493256,
"learning_rate": 1.0327022375215146e-05,
"loss": 0.3815,
"num_input_tokens_seen": 9048238,
"step": 557,
"train_runtime": 1451.4988,
"train_tokens_per_second": 6233.721
},
{
"epoch": 1.9059829059829059,
"grad_norm": 0.16363990306854248,
"learning_rate": 9.982788296041308e-06,
"loss": 0.3811,
"num_input_tokens_seen": 9066494,
"step": 558,
"train_runtime": 1454.1349,
"train_tokens_per_second": 6234.975
},
{
"epoch": 1.9094017094017093,
"grad_norm": 0.1940564066171646,
"learning_rate": 9.63855421686747e-06,
"loss": 0.3237,
"num_input_tokens_seen": 9079822,
"step": 559,
"train_runtime": 1456.1609,
"train_tokens_per_second": 6235.453
},
{
"epoch": 1.9128205128205127,
"grad_norm": 0.2036203294992447,
"learning_rate": 9.294320137693632e-06,
"loss": 0.4353,
"num_input_tokens_seen": 9091598,
"step": 560,
"train_runtime": 1457.9853,
"train_tokens_per_second": 6235.727
},
{
"epoch": 1.916239316239316,
"grad_norm": 0.18901148438453674,
"learning_rate": 8.950086058519795e-06,
"loss": 0.4001,
"num_input_tokens_seen": 9104990,
"step": 561,
"train_runtime": 1460.0107,
"train_tokens_per_second": 6236.249
},
{
"epoch": 1.9196581196581195,
"grad_norm": 0.18928927183151245,
"learning_rate": 8.605851979345956e-06,
"loss": 0.3813,
"num_input_tokens_seen": 9119310,
"step": 562,
"train_runtime": 1462.1634,
"train_tokens_per_second": 6236.861
},
{
"epoch": 1.9230769230769231,
"grad_norm": 0.1698116660118103,
"learning_rate": 8.261617900172119e-06,
"loss": 0.3993,
"num_input_tokens_seen": 9134702,
"step": 563,
"train_runtime": 1464.4317,
"train_tokens_per_second": 6237.711
},
{
"epoch": 1.9264957264957265,
"grad_norm": 0.1814728081226349,
"learning_rate": 7.91738382099828e-06,
"loss": 0.4208,
"num_input_tokens_seen": 9147822,
"step": 564,
"train_runtime": 1466.388,
"train_tokens_per_second": 6238.336
},
{
"epoch": 1.92991452991453,
"grad_norm": 0.18567024171352386,
"learning_rate": 7.573149741824441e-06,
"loss": 0.4371,
"num_input_tokens_seen": 9164110,
"step": 565,
"train_runtime": 1468.7747,
"train_tokens_per_second": 6239.289
},
{
"epoch": 1.9333333333333333,
"grad_norm": 0.2137572318315506,
"learning_rate": 7.228915662650602e-06,
"loss": 0.3899,
"num_input_tokens_seen": 9174894,
"step": 566,
"train_runtime": 1470.4523,
"train_tokens_per_second": 6239.505
},
{
"epoch": 1.9367521367521368,
"grad_norm": 0.15320739150047302,
"learning_rate": 6.884681583476764e-06,
"loss": 0.3531,
"num_input_tokens_seen": 9191886,
"step": 567,
"train_runtime": 1472.9549,
"train_tokens_per_second": 6240.44
},
{
"epoch": 1.9401709401709402,
"grad_norm": 0.21417830884456635,
"learning_rate": 6.5404475043029266e-06,
"loss": 0.4213,
"num_input_tokens_seen": 9203742,
"step": 568,
"train_runtime": 1474.745,
"train_tokens_per_second": 6240.904
},
{
"epoch": 1.9435897435897436,
"grad_norm": 0.1843339502811432,
"learning_rate": 6.196213425129088e-06,
"loss": 0.374,
"num_input_tokens_seen": 9216110,
"step": 569,
"train_runtime": 1476.6219,
"train_tokens_per_second": 6241.347
},
{
"epoch": 1.947008547008547,
"grad_norm": 0.16858874261379242,
"learning_rate": 5.85197934595525e-06,
"loss": 0.3967,
"num_input_tokens_seen": 9232750,
"step": 570,
"train_runtime": 1479.0428,
"train_tokens_per_second": 6242.382
},
{
"epoch": 1.9504273504273504,
"grad_norm": 0.21565116941928864,
"learning_rate": 5.507745266781412e-06,
"loss": 0.4639,
"num_input_tokens_seen": 9244110,
"step": 571,
"train_runtime": 1481.2963,
"train_tokens_per_second": 6240.554
},
{
"epoch": 1.953846153846154,
"grad_norm": 0.17212358117103577,
"learning_rate": 5.163511187607573e-06,
"loss": 0.4541,
"num_input_tokens_seen": 9260670,
"step": 572,
"train_runtime": 1483.7253,
"train_tokens_per_second": 6241.499
},
{
"epoch": 1.9572649572649574,
"grad_norm": 0.16098545491695404,
"learning_rate": 4.819277108433735e-06,
"loss": 0.3808,
"num_input_tokens_seen": 9277182,
"step": 573,
"train_runtime": 1486.1266,
"train_tokens_per_second": 6242.525
},
{
"epoch": 1.9606837606837608,
"grad_norm": 0.1885039359331131,
"learning_rate": 4.475043029259897e-06,
"loss": 0.4711,
"num_input_tokens_seen": 9291486,
"step": 574,
"train_runtime": 1488.2625,
"train_tokens_per_second": 6243.177
},
{
"epoch": 1.9641025641025642,
"grad_norm": 0.17435158789157867,
"learning_rate": 4.130808950086059e-06,
"loss": 0.3834,
"num_input_tokens_seen": 9307182,
"step": 575,
"train_runtime": 1490.6012,
"train_tokens_per_second": 6243.911
},
{
"epoch": 1.9675213675213676,
"grad_norm": 0.17134054005146027,
"learning_rate": 3.7865748709122206e-06,
"loss": 0.3521,
"num_input_tokens_seen": 9324318,
"step": 576,
"train_runtime": 1493.1064,
"train_tokens_per_second": 6244.912
},
{
"epoch": 1.970940170940171,
"grad_norm": 0.18249361217021942,
"learning_rate": 3.442340791738382e-06,
"loss": 0.3362,
"num_input_tokens_seen": 9338622,
"step": 577,
"train_runtime": 1495.2539,
"train_tokens_per_second": 6245.509
},
{
"epoch": 1.9743589743589745,
"grad_norm": 0.17978602647781372,
"learning_rate": 3.098106712564544e-06,
"loss": 0.4274,
"num_input_tokens_seen": 9353918,
"step": 578,
"train_runtime": 1497.5034,
"train_tokens_per_second": 6246.342
},
{
"epoch": 1.9777777777777779,
"grad_norm": 0.14672812819480896,
"learning_rate": 2.753872633390706e-06,
"loss": 0.314,
"num_input_tokens_seen": 9390878,
"step": 579,
"train_runtime": 1502.7758,
"train_tokens_per_second": 6249.021
},
{
"epoch": 1.9811965811965813,
"grad_norm": 0.19798055291175842,
"learning_rate": 2.4096385542168676e-06,
"loss": 0.4314,
"num_input_tokens_seen": 9404654,
"step": 580,
"train_runtime": 1504.8242,
"train_tokens_per_second": 6249.67
},
{
"epoch": 1.9846153846153847,
"grad_norm": 0.1839577704668045,
"learning_rate": 2.0654044750430297e-06,
"loss": 0.346,
"num_input_tokens_seen": 9421838,
"step": 581,
"train_runtime": 1507.3329,
"train_tokens_per_second": 6250.668
},
{
"epoch": 1.988034188034188,
"grad_norm": 0.1459440439939499,
"learning_rate": 1.721170395869191e-06,
"loss": 0.302,
"num_input_tokens_seen": 9450766,
"step": 582,
"train_runtime": 1511.4289,
"train_tokens_per_second": 6252.868
},
{
"epoch": 1.9914529914529915,
"grad_norm": 0.1679002195596695,
"learning_rate": 1.376936316695353e-06,
"loss": 0.3794,
"num_input_tokens_seen": 9467966,
"step": 583,
"train_runtime": 1513.9495,
"train_tokens_per_second": 6253.819
},
{
"epoch": 1.994871794871795,
"grad_norm": 0.18191100656986237,
"learning_rate": 1.0327022375215148e-06,
"loss": 0.4131,
"num_input_tokens_seen": 9482622,
"step": 584,
"train_runtime": 1516.0908,
"train_tokens_per_second": 6254.653
},
{
"epoch": 1.9982905982905983,
"grad_norm": 0.17011763155460358,
"learning_rate": 6.884681583476765e-07,
"loss": 0.3366,
"num_input_tokens_seen": 9497966,
"step": 585,
"train_runtime": 1518.3683,
"train_tokens_per_second": 6255.377
},
{
"epoch": 2.0,
"grad_norm": 0.23105928301811218,
"learning_rate": 3.4423407917383825e-07,
"loss": 0.3455,
"num_input_tokens_seen": 9505226,
"step": 586,
"train_runtime": 1519.4393,
"train_tokens_per_second": 6255.746
}
],
"logging_steps": 1,
"max_steps": 586,
"num_input_tokens_seen": 9505226,
"num_train_epochs": 2,
"save_steps": 30,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 4.055493629648671e+17,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}