Qwen3-32B-Code-Unsloth / trainer_state.json
FormlessAI's picture
Upload folder using huggingface_hub
1fb2460 verified
Raw
History Blame Contribute Delete
343 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 117,
"global_step": 1170,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0017094017094017094,
"grad_norm": 0.4250143766403198,
"learning_rate": 0.0,
"loss": 1.518,
"num_input_tokens_seen": 6088,
"step": 1,
"train_runtime": 6.2191,
"train_tokens_per_second": 978.921
},
{
"epoch": 0.003418803418803419,
"grad_norm": 0.42283380031585693,
"learning_rate": 4e-05,
"loss": 1.4678,
"num_input_tokens_seen": 11808,
"step": 2,
"train_runtime": 9.8285,
"train_tokens_per_second": 1201.403
},
{
"epoch": 0.005128205128205128,
"grad_norm": 0.40052852034568787,
"learning_rate": 8e-05,
"loss": 1.3678,
"num_input_tokens_seen": 18304,
"step": 3,
"train_runtime": 13.9109,
"train_tokens_per_second": 1315.798
},
{
"epoch": 0.006837606837606838,
"grad_norm": 0.6133590340614319,
"learning_rate": 0.00012,
"loss": 1.5195,
"num_input_tokens_seen": 23752,
"step": 4,
"train_runtime": 17.5271,
"train_tokens_per_second": 1355.159
},
{
"epoch": 0.008547008547008548,
"grad_norm": 0.5969431400299072,
"learning_rate": 0.00016,
"loss": 0.9666,
"num_input_tokens_seen": 30536,
"step": 5,
"train_runtime": 21.9024,
"train_tokens_per_second": 1394.188
},
{
"epoch": 0.010256410256410256,
"grad_norm": 0.780890703201294,
"learning_rate": 0.0002,
"loss": 0.816,
"num_input_tokens_seen": 35152,
"step": 6,
"train_runtime": 25.0032,
"train_tokens_per_second": 1405.901
},
{
"epoch": 0.011965811965811967,
"grad_norm": 0.2505766451358795,
"learning_rate": 0.00019982832618025754,
"loss": 0.4829,
"num_input_tokens_seen": 45688,
"step": 7,
"train_runtime": 33.1628,
"train_tokens_per_second": 1377.688
},
{
"epoch": 0.013675213675213675,
"grad_norm": 0.22040167450904846,
"learning_rate": 0.00019965665236051504,
"loss": 0.3633,
"num_input_tokens_seen": 55504,
"step": 8,
"train_runtime": 39.2433,
"train_tokens_per_second": 1414.355
},
{
"epoch": 0.015384615384615385,
"grad_norm": 0.18094895780086517,
"learning_rate": 0.00019948497854077254,
"loss": 0.4153,
"num_input_tokens_seen": 62664,
"step": 9,
"train_runtime": 43.8042,
"train_tokens_per_second": 1430.547
},
{
"epoch": 0.017094017094017096,
"grad_norm": 0.19979114830493927,
"learning_rate": 0.00019931330472103005,
"loss": 0.4687,
"num_input_tokens_seen": 69264,
"step": 10,
"train_runtime": 48.0067,
"train_tokens_per_second": 1442.8
},
{
"epoch": 0.018803418803418803,
"grad_norm": 0.13777591288089752,
"learning_rate": 0.00019914163090128758,
"loss": 0.3691,
"num_input_tokens_seen": 76296,
"step": 11,
"train_runtime": 52.4921,
"train_tokens_per_second": 1453.476
},
{
"epoch": 0.020512820512820513,
"grad_norm": 0.18852345645427704,
"learning_rate": 0.00019896995708154508,
"loss": 0.4321,
"num_input_tokens_seen": 81088,
"step": 12,
"train_runtime": 55.6144,
"train_tokens_per_second": 1458.039
},
{
"epoch": 0.022222222222222223,
"grad_norm": 0.161995068192482,
"learning_rate": 0.00019879828326180258,
"loss": 0.3859,
"num_input_tokens_seen": 86336,
"step": 13,
"train_runtime": 59.0226,
"train_tokens_per_second": 1462.761
},
{
"epoch": 0.023931623931623933,
"grad_norm": 0.17920617759227753,
"learning_rate": 0.00019862660944206008,
"loss": 0.4851,
"num_input_tokens_seen": 92520,
"step": 14,
"train_runtime": 63.0338,
"train_tokens_per_second": 1467.785
},
{
"epoch": 0.02564102564102564,
"grad_norm": 0.18425999581813812,
"learning_rate": 0.0001984549356223176,
"loss": 0.4319,
"num_input_tokens_seen": 99352,
"step": 15,
"train_runtime": 67.3828,
"train_tokens_per_second": 1474.441
},
{
"epoch": 0.02735042735042735,
"grad_norm": 0.1532442718744278,
"learning_rate": 0.00019828326180257511,
"loss": 0.5035,
"num_input_tokens_seen": 105464,
"step": 16,
"train_runtime": 71.3114,
"train_tokens_per_second": 1478.922
},
{
"epoch": 0.02905982905982906,
"grad_norm": 0.1138884648680687,
"learning_rate": 0.00019811158798283262,
"loss": 0.3167,
"num_input_tokens_seen": 113576,
"step": 17,
"train_runtime": 76.3581,
"train_tokens_per_second": 1487.412
},
{
"epoch": 0.03076923076923077,
"grad_norm": 0.1539948731660843,
"learning_rate": 0.00019793991416309015,
"loss": 0.4765,
"num_input_tokens_seen": 118448,
"step": 18,
"train_runtime": 79.6038,
"train_tokens_per_second": 1487.97
},
{
"epoch": 0.03247863247863248,
"grad_norm": 0.11567585170269012,
"learning_rate": 0.00019776824034334765,
"loss": 0.423,
"num_input_tokens_seen": 126120,
"step": 19,
"train_runtime": 84.4957,
"train_tokens_per_second": 1492.621
},
{
"epoch": 0.03418803418803419,
"grad_norm": 0.1400221586227417,
"learning_rate": 0.00019759656652360515,
"loss": 0.4563,
"num_input_tokens_seen": 132752,
"step": 20,
"train_runtime": 88.698,
"train_tokens_per_second": 1496.674
},
{
"epoch": 0.035897435897435895,
"grad_norm": 0.13252879679203033,
"learning_rate": 0.00019742489270386265,
"loss": 0.3811,
"num_input_tokens_seen": 139568,
"step": 21,
"train_runtime": 92.9809,
"train_tokens_per_second": 1501.039
},
{
"epoch": 0.037606837606837605,
"grad_norm": 0.11468011885881424,
"learning_rate": 0.00019725321888412018,
"loss": 0.3752,
"num_input_tokens_seen": 144896,
"step": 22,
"train_runtime": 96.4953,
"train_tokens_per_second": 1501.586
},
{
"epoch": 0.039316239316239315,
"grad_norm": 0.1273491531610489,
"learning_rate": 0.00019708154506437769,
"loss": 0.5735,
"num_input_tokens_seen": 149888,
"step": 23,
"train_runtime": 99.8529,
"train_tokens_per_second": 1501.089
},
{
"epoch": 0.041025641025641026,
"grad_norm": 0.115237295627594,
"learning_rate": 0.00019690987124463521,
"loss": 0.3692,
"num_input_tokens_seen": 155416,
"step": 24,
"train_runtime": 103.4634,
"train_tokens_per_second": 1502.135
},
{
"epoch": 0.042735042735042736,
"grad_norm": 0.11244790256023407,
"learning_rate": 0.00019673819742489272,
"loss": 0.362,
"num_input_tokens_seen": 162096,
"step": 25,
"train_runtime": 107.7741,
"train_tokens_per_second": 1504.035
},
{
"epoch": 0.044444444444444446,
"grad_norm": 0.1112871989607811,
"learning_rate": 0.00019656652360515022,
"loss": 0.3231,
"num_input_tokens_seen": 169184,
"step": 26,
"train_runtime": 112.2991,
"train_tokens_per_second": 1506.549
},
{
"epoch": 0.046153846153846156,
"grad_norm": 0.10700014233589172,
"learning_rate": 0.00019639484978540775,
"loss": 0.4011,
"num_input_tokens_seen": 176064,
"step": 27,
"train_runtime": 116.6504,
"train_tokens_per_second": 1509.33
},
{
"epoch": 0.04786324786324787,
"grad_norm": 0.09945544600486755,
"learning_rate": 0.00019622317596566525,
"loss": 0.4002,
"num_input_tokens_seen": 183784,
"step": 28,
"train_runtime": 121.5197,
"train_tokens_per_second": 1512.38
},
{
"epoch": 0.04957264957264957,
"grad_norm": 0.11044273525476456,
"learning_rate": 0.00019605150214592275,
"loss": 0.5269,
"num_input_tokens_seen": 190200,
"step": 29,
"train_runtime": 125.6386,
"train_tokens_per_second": 1513.866
},
{
"epoch": 0.05128205128205128,
"grad_norm": 0.09791948646306992,
"learning_rate": 0.00019587982832618026,
"loss": 0.4054,
"num_input_tokens_seen": 197152,
"step": 30,
"train_runtime": 129.9816,
"train_tokens_per_second": 1516.769
},
{
"epoch": 0.05299145299145299,
"grad_norm": 0.09980098158121109,
"learning_rate": 0.00019570815450643779,
"loss": 0.5087,
"num_input_tokens_seen": 202824,
"step": 31,
"train_runtime": 137.1025,
"train_tokens_per_second": 1479.361
},
{
"epoch": 0.0547008547008547,
"grad_norm": 0.12963376939296722,
"learning_rate": 0.0001955364806866953,
"loss": 0.5493,
"num_input_tokens_seen": 207640,
"step": 32,
"train_runtime": 140.4253,
"train_tokens_per_second": 1478.651
},
{
"epoch": 0.05641025641025641,
"grad_norm": 0.0860801488161087,
"learning_rate": 0.0001953648068669528,
"loss": 0.3875,
"num_input_tokens_seen": 214648,
"step": 33,
"train_runtime": 144.9087,
"train_tokens_per_second": 1481.264
},
{
"epoch": 0.05811965811965812,
"grad_norm": 0.11512323468923569,
"learning_rate": 0.00019519313304721032,
"loss": 0.5298,
"num_input_tokens_seen": 220632,
"step": 34,
"train_runtime": 148.7677,
"train_tokens_per_second": 1483.064
},
{
"epoch": 0.05982905982905983,
"grad_norm": 0.09134849905967712,
"learning_rate": 0.00019502145922746782,
"loss": 0.3995,
"num_input_tokens_seen": 225952,
"step": 35,
"train_runtime": 152.2771,
"train_tokens_per_second": 1483.821
},
{
"epoch": 0.06153846153846154,
"grad_norm": 0.08371111750602722,
"learning_rate": 0.00019484978540772535,
"loss": 0.3972,
"num_input_tokens_seen": 231512,
"step": 36,
"train_runtime": 155.8719,
"train_tokens_per_second": 1485.271
},
{
"epoch": 0.06324786324786325,
"grad_norm": 0.10832574218511581,
"learning_rate": 0.00019467811158798283,
"loss": 0.6165,
"num_input_tokens_seen": 237608,
"step": 37,
"train_runtime": 159.803,
"train_tokens_per_second": 1486.88
},
{
"epoch": 0.06495726495726496,
"grad_norm": 0.08655951172113419,
"learning_rate": 0.00019450643776824036,
"loss": 0.3368,
"num_input_tokens_seen": 245056,
"step": 38,
"train_runtime": 164.5499,
"train_tokens_per_second": 1489.25
},
{
"epoch": 0.06666666666666667,
"grad_norm": 0.1013326346874237,
"learning_rate": 0.00019433476394849786,
"loss": 0.4206,
"num_input_tokens_seen": 250840,
"step": 39,
"train_runtime": 168.3364,
"train_tokens_per_second": 1490.111
},
{
"epoch": 0.06837606837606838,
"grad_norm": 0.09398815035820007,
"learning_rate": 0.0001941630901287554,
"loss": 0.4084,
"num_input_tokens_seen": 258976,
"step": 40,
"train_runtime": 173.4242,
"train_tokens_per_second": 1493.309
},
{
"epoch": 0.07008547008547009,
"grad_norm": 0.09392287582159042,
"learning_rate": 0.00019399141630901286,
"loss": 0.4611,
"num_input_tokens_seen": 266368,
"step": 41,
"train_runtime": 178.0545,
"train_tokens_per_second": 1495.992
},
{
"epoch": 0.07179487179487179,
"grad_norm": 0.09110905230045319,
"learning_rate": 0.0001938197424892704,
"loss": 0.3737,
"num_input_tokens_seen": 272608,
"step": 42,
"train_runtime": 182.0937,
"train_tokens_per_second": 1497.075
},
{
"epoch": 0.0735042735042735,
"grad_norm": 0.12417464703321457,
"learning_rate": 0.00019364806866952792,
"loss": 0.3449,
"num_input_tokens_seen": 281928,
"step": 43,
"train_runtime": 187.7546,
"train_tokens_per_second": 1501.577
},
{
"epoch": 0.07521367521367521,
"grad_norm": 0.08885443955659866,
"learning_rate": 0.00019347639484978542,
"loss": 0.3705,
"num_input_tokens_seen": 287584,
"step": 44,
"train_runtime": 191.4739,
"train_tokens_per_second": 1501.949
},
{
"epoch": 0.07692307692307693,
"grad_norm": 0.101967953145504,
"learning_rate": 0.00019330472103004293,
"loss": 0.3949,
"num_input_tokens_seen": 291480,
"step": 45,
"train_runtime": 194.2615,
"train_tokens_per_second": 1500.452
},
{
"epoch": 0.07863247863247863,
"grad_norm": 0.09961338341236115,
"learning_rate": 0.00019313304721030043,
"loss": 0.4503,
"num_input_tokens_seen": 297024,
"step": 46,
"train_runtime": 197.902,
"train_tokens_per_second": 1500.864
},
{
"epoch": 0.08034188034188035,
"grad_norm": 0.0889606773853302,
"learning_rate": 0.00019296137339055796,
"loss": 0.4031,
"num_input_tokens_seen": 303648,
"step": 47,
"train_runtime": 202.0341,
"train_tokens_per_second": 1502.954
},
{
"epoch": 0.08205128205128205,
"grad_norm": 0.09531895071268082,
"learning_rate": 0.00019278969957081546,
"loss": 0.4417,
"num_input_tokens_seen": 309056,
"step": 48,
"train_runtime": 205.5638,
"train_tokens_per_second": 1503.456
},
{
"epoch": 0.08376068376068375,
"grad_norm": 0.08631931990385056,
"learning_rate": 0.00019261802575107296,
"loss": 0.4553,
"num_input_tokens_seen": 316400,
"step": 49,
"train_runtime": 210.172,
"train_tokens_per_second": 1505.434
},
{
"epoch": 0.08547008547008547,
"grad_norm": 0.08847703784704208,
"learning_rate": 0.00019244635193133047,
"loss": 0.3219,
"num_input_tokens_seen": 323200,
"step": 50,
"train_runtime": 214.5176,
"train_tokens_per_second": 1506.636
},
{
"epoch": 0.08717948717948718,
"grad_norm": 0.11054311692714691,
"learning_rate": 0.000192274678111588,
"loss": 0.4683,
"num_input_tokens_seen": 328312,
"step": 51,
"train_runtime": 217.9764,
"train_tokens_per_second": 1506.181
},
{
"epoch": 0.08888888888888889,
"grad_norm": 0.09251222759485245,
"learning_rate": 0.00019210300429184553,
"loss": 0.4102,
"num_input_tokens_seen": 333800,
"step": 52,
"train_runtime": 221.5458,
"train_tokens_per_second": 1506.686
},
{
"epoch": 0.0905982905982906,
"grad_norm": 0.0774988904595375,
"learning_rate": 0.000191931330472103,
"loss": 0.3548,
"num_input_tokens_seen": 342048,
"step": 53,
"train_runtime": 226.7275,
"train_tokens_per_second": 1508.631
},
{
"epoch": 0.09230769230769231,
"grad_norm": 0.12202516943216324,
"learning_rate": 0.00019175965665236053,
"loss": 0.5613,
"num_input_tokens_seen": 347624,
"step": 54,
"train_runtime": 230.3617,
"train_tokens_per_second": 1509.035
},
{
"epoch": 0.09401709401709402,
"grad_norm": 0.10605426132678986,
"learning_rate": 0.00019158798283261803,
"loss": 0.4176,
"num_input_tokens_seen": 352416,
"step": 55,
"train_runtime": 233.4925,
"train_tokens_per_second": 1509.325
},
{
"epoch": 0.09572649572649573,
"grad_norm": 0.11558322608470917,
"learning_rate": 0.00019141630901287556,
"loss": 0.4917,
"num_input_tokens_seen": 357896,
"step": 56,
"train_runtime": 237.0248,
"train_tokens_per_second": 1509.952
},
{
"epoch": 0.09743589743589744,
"grad_norm": 0.09910829365253448,
"learning_rate": 0.00019124463519313304,
"loss": 0.4792,
"num_input_tokens_seen": 364720,
"step": 57,
"train_runtime": 241.3172,
"train_tokens_per_second": 1511.371
},
{
"epoch": 0.09914529914529914,
"grad_norm": 0.1221349686384201,
"learning_rate": 0.00019107296137339057,
"loss": 0.4691,
"num_input_tokens_seen": 369984,
"step": 58,
"train_runtime": 244.7282,
"train_tokens_per_second": 1511.816
},
{
"epoch": 0.10085470085470086,
"grad_norm": 0.08596599102020264,
"learning_rate": 0.00019090128755364807,
"loss": 0.3253,
"num_input_tokens_seen": 376832,
"step": 59,
"train_runtime": 249.045,
"train_tokens_per_second": 1513.108
},
{
"epoch": 0.10256410256410256,
"grad_norm": 0.10098423808813095,
"learning_rate": 0.0001907296137339056,
"loss": 0.3785,
"num_input_tokens_seen": 383320,
"step": 60,
"train_runtime": 253.2014,
"train_tokens_per_second": 1513.894
},
{
"epoch": 0.10427350427350428,
"grad_norm": 0.10320388525724411,
"learning_rate": 0.0001905579399141631,
"loss": 0.4157,
"num_input_tokens_seen": 388816,
"step": 61,
"train_runtime": 258.8284,
"train_tokens_per_second": 1502.215
},
{
"epoch": 0.10598290598290598,
"grad_norm": 0.1285121887922287,
"learning_rate": 0.0001903862660944206,
"loss": 0.4692,
"num_input_tokens_seen": 394272,
"step": 62,
"train_runtime": 262.3864,
"train_tokens_per_second": 1502.639
},
{
"epoch": 0.1076923076923077,
"grad_norm": 0.09725423902273178,
"learning_rate": 0.00019021459227467813,
"loss": 0.3565,
"num_input_tokens_seen": 401608,
"step": 63,
"train_runtime": 267.0812,
"train_tokens_per_second": 1503.692
},
{
"epoch": 0.1094017094017094,
"grad_norm": 0.09742418676614761,
"learning_rate": 0.00019004291845493563,
"loss": 0.4284,
"num_input_tokens_seen": 406744,
"step": 64,
"train_runtime": 270.5234,
"train_tokens_per_second": 1503.545
},
{
"epoch": 0.1111111111111111,
"grad_norm": 0.10458344221115112,
"learning_rate": 0.00018987124463519314,
"loss": 0.4902,
"num_input_tokens_seen": 412400,
"step": 65,
"train_runtime": 274.2503,
"train_tokens_per_second": 1503.736
},
{
"epoch": 0.11282051282051282,
"grad_norm": 0.10790280252695084,
"learning_rate": 0.00018969957081545064,
"loss": 0.3972,
"num_input_tokens_seen": 418328,
"step": 66,
"train_runtime": 278.0127,
"train_tokens_per_second": 1504.708
},
{
"epoch": 0.11452991452991453,
"grad_norm": 0.11004123091697693,
"learning_rate": 0.00018952789699570817,
"loss": 0.5001,
"num_input_tokens_seen": 423608,
"step": 67,
"train_runtime": 281.5247,
"train_tokens_per_second": 1504.692
},
{
"epoch": 0.11623931623931624,
"grad_norm": 0.09410227090120316,
"learning_rate": 0.00018935622317596567,
"loss": 0.3218,
"num_input_tokens_seen": 430864,
"step": 68,
"train_runtime": 286.005,
"train_tokens_per_second": 1506.491
},
{
"epoch": 0.11794871794871795,
"grad_norm": 0.08077986538410187,
"learning_rate": 0.00018918454935622317,
"loss": 0.4251,
"num_input_tokens_seen": 438136,
"step": 69,
"train_runtime": 290.6532,
"train_tokens_per_second": 1507.418
},
{
"epoch": 0.11965811965811966,
"grad_norm": 0.09709861129522324,
"learning_rate": 0.0001890128755364807,
"loss": 0.305,
"num_input_tokens_seen": 444304,
"step": 70,
"train_runtime": 294.7262,
"train_tokens_per_second": 1507.514
},
{
"epoch": 0.12136752136752137,
"grad_norm": 0.07995827496051788,
"learning_rate": 0.0001888412017167382,
"loss": 0.3157,
"num_input_tokens_seen": 449944,
"step": 71,
"train_runtime": 298.499,
"train_tokens_per_second": 1507.355
},
{
"epoch": 0.12307692307692308,
"grad_norm": 0.11763301491737366,
"learning_rate": 0.00018866952789699574,
"loss": 0.614,
"num_input_tokens_seen": 456280,
"step": 72,
"train_runtime": 302.4916,
"train_tokens_per_second": 1508.406
},
{
"epoch": 0.12478632478632479,
"grad_norm": 0.13120430707931519,
"learning_rate": 0.0001884978540772532,
"loss": 0.429,
"num_input_tokens_seen": 461752,
"step": 73,
"train_runtime": 306.0652,
"train_tokens_per_second": 1508.672
},
{
"epoch": 0.1264957264957265,
"grad_norm": 0.11087733507156372,
"learning_rate": 0.00018832618025751074,
"loss": 0.4589,
"num_input_tokens_seen": 467256,
"step": 74,
"train_runtime": 309.6589,
"train_tokens_per_second": 1508.938
},
{
"epoch": 0.1282051282051282,
"grad_norm": 0.08506280928850174,
"learning_rate": 0.00018815450643776824,
"loss": 0.3565,
"num_input_tokens_seen": 472728,
"step": 75,
"train_runtime": 313.2853,
"train_tokens_per_second": 1508.938
},
{
"epoch": 0.12991452991452992,
"grad_norm": 0.09503644704818726,
"learning_rate": 0.00018798283261802577,
"loss": 0.3387,
"num_input_tokens_seen": 478992,
"step": 76,
"train_runtime": 317.1949,
"train_tokens_per_second": 1510.087
},
{
"epoch": 0.13162393162393163,
"grad_norm": 0.08575405180454254,
"learning_rate": 0.00018781115879828325,
"loss": 0.3635,
"num_input_tokens_seen": 485832,
"step": 77,
"train_runtime": 321.5107,
"train_tokens_per_second": 1511.091
},
{
"epoch": 0.13333333333333333,
"grad_norm": 0.10871604830026627,
"learning_rate": 0.00018763948497854078,
"loss": 0.4296,
"num_input_tokens_seen": 490928,
"step": 78,
"train_runtime": 324.876,
"train_tokens_per_second": 1511.124
},
{
"epoch": 0.13504273504273503,
"grad_norm": 0.1150660291314125,
"learning_rate": 0.0001874678111587983,
"loss": 0.4239,
"num_input_tokens_seen": 495328,
"step": 79,
"train_runtime": 327.8846,
"train_tokens_per_second": 1510.678
},
{
"epoch": 0.13675213675213677,
"grad_norm": 0.09480957686901093,
"learning_rate": 0.0001872961373390558,
"loss": 0.5293,
"num_input_tokens_seen": 500544,
"step": 80,
"train_runtime": 331.3228,
"train_tokens_per_second": 1510.744
},
{
"epoch": 0.13846153846153847,
"grad_norm": 0.10827576369047165,
"learning_rate": 0.0001871244635193133,
"loss": 0.3564,
"num_input_tokens_seen": 508392,
"step": 81,
"train_runtime": 336.1583,
"train_tokens_per_second": 1512.359
},
{
"epoch": 0.14017094017094017,
"grad_norm": 0.11873910576105118,
"learning_rate": 0.0001869527896995708,
"loss": 0.3257,
"num_input_tokens_seen": 513256,
"step": 82,
"train_runtime": 339.3559,
"train_tokens_per_second": 1512.442
},
{
"epoch": 0.14188034188034188,
"grad_norm": 0.0916254073381424,
"learning_rate": 0.00018678111587982834,
"loss": 0.4016,
"num_input_tokens_seen": 521168,
"step": 83,
"train_runtime": 344.2306,
"train_tokens_per_second": 1514.008
},
{
"epoch": 0.14358974358974358,
"grad_norm": 0.08179375529289246,
"learning_rate": 0.00018660944206008584,
"loss": 0.1876,
"num_input_tokens_seen": 535992,
"step": 84,
"train_runtime": 356.5513,
"train_tokens_per_second": 1503.268
},
{
"epoch": 0.1452991452991453,
"grad_norm": 0.10662805289030075,
"learning_rate": 0.00018643776824034335,
"loss": 0.4497,
"num_input_tokens_seen": 540728,
"step": 85,
"train_runtime": 359.8356,
"train_tokens_per_second": 1502.708
},
{
"epoch": 0.147008547008547,
"grad_norm": 0.09463411569595337,
"learning_rate": 0.00018626609442060085,
"loss": 0.5027,
"num_input_tokens_seen": 547776,
"step": 86,
"train_runtime": 364.3736,
"train_tokens_per_second": 1503.336
},
{
"epoch": 0.14871794871794872,
"grad_norm": 0.12029843032360077,
"learning_rate": 0.00018609442060085838,
"loss": 0.4105,
"num_input_tokens_seen": 552712,
"step": 87,
"train_runtime": 367.7054,
"train_tokens_per_second": 1503.138
},
{
"epoch": 0.15042735042735042,
"grad_norm": 0.08062440901994705,
"learning_rate": 0.0001859227467811159,
"loss": 0.418,
"num_input_tokens_seen": 559664,
"step": 88,
"train_runtime": 372.2417,
"train_tokens_per_second": 1503.496
},
{
"epoch": 0.15213675213675212,
"grad_norm": 0.10988523811101913,
"learning_rate": 0.00018575107296137338,
"loss": 0.4045,
"num_input_tokens_seen": 564984,
"step": 89,
"train_runtime": 375.6853,
"train_tokens_per_second": 1503.876
},
{
"epoch": 0.15384615384615385,
"grad_norm": 0.08529689162969589,
"learning_rate": 0.0001855793991416309,
"loss": 0.2621,
"num_input_tokens_seen": 570904,
"step": 90,
"train_runtime": 379.4257,
"train_tokens_per_second": 1504.653
},
{
"epoch": 0.15555555555555556,
"grad_norm": 0.0883374810218811,
"learning_rate": 0.00018540772532188842,
"loss": 0.4192,
"num_input_tokens_seen": 578592,
"step": 91,
"train_runtime": 386.3897,
"train_tokens_per_second": 1497.431
},
{
"epoch": 0.15726495726495726,
"grad_norm": 0.09064248204231262,
"learning_rate": 0.00018523605150214595,
"loss": 0.587,
"num_input_tokens_seen": 585320,
"step": 92,
"train_runtime": 390.6938,
"train_tokens_per_second": 1498.155
},
{
"epoch": 0.15897435897435896,
"grad_norm": 0.0960068479180336,
"learning_rate": 0.00018506437768240342,
"loss": 0.4497,
"num_input_tokens_seen": 591128,
"step": 93,
"train_runtime": 394.5866,
"train_tokens_per_second": 1498.095
},
{
"epoch": 0.1606837606837607,
"grad_norm": 0.08961305022239685,
"learning_rate": 0.00018489270386266095,
"loss": 0.3829,
"num_input_tokens_seen": 597296,
"step": 94,
"train_runtime": 398.5175,
"train_tokens_per_second": 1498.795
},
{
"epoch": 0.1623931623931624,
"grad_norm": 0.07730946689844131,
"learning_rate": 0.00018472103004291848,
"loss": 0.3776,
"num_input_tokens_seen": 604664,
"step": 95,
"train_runtime": 403.2132,
"train_tokens_per_second": 1499.613
},
{
"epoch": 0.1641025641025641,
"grad_norm": 0.07900130748748779,
"learning_rate": 0.00018454935622317598,
"loss": 0.4371,
"num_input_tokens_seen": 612288,
"step": 96,
"train_runtime": 407.9353,
"train_tokens_per_second": 1500.944
},
{
"epoch": 0.1658119658119658,
"grad_norm": 0.08631894737482071,
"learning_rate": 0.00018437768240343348,
"loss": 0.4397,
"num_input_tokens_seen": 619168,
"step": 97,
"train_runtime": 412.3324,
"train_tokens_per_second": 1501.623
},
{
"epoch": 0.1675213675213675,
"grad_norm": 0.10031551122665405,
"learning_rate": 0.000184206008583691,
"loss": 0.4387,
"num_input_tokens_seen": 624400,
"step": 98,
"train_runtime": 415.8434,
"train_tokens_per_second": 1501.527
},
{
"epoch": 0.16923076923076924,
"grad_norm": 0.07904055714607239,
"learning_rate": 0.00018403433476394852,
"loss": 0.3353,
"num_input_tokens_seen": 632536,
"step": 99,
"train_runtime": 420.8949,
"train_tokens_per_second": 1502.836
},
{
"epoch": 0.17094017094017094,
"grad_norm": 0.11156652867794037,
"learning_rate": 0.00018386266094420602,
"loss": 0.4099,
"num_input_tokens_seen": 638680,
"step": 100,
"train_runtime": 424.9889,
"train_tokens_per_second": 1502.816
},
{
"epoch": 0.17264957264957265,
"grad_norm": 0.08511320501565933,
"learning_rate": 0.00018369098712446352,
"loss": 0.4528,
"num_input_tokens_seen": 644608,
"step": 101,
"train_runtime": 428.8153,
"train_tokens_per_second": 1503.23
},
{
"epoch": 0.17435897435897435,
"grad_norm": 0.0914352536201477,
"learning_rate": 0.00018351931330472102,
"loss": 0.4464,
"num_input_tokens_seen": 653032,
"step": 102,
"train_runtime": 434.0457,
"train_tokens_per_second": 1504.524
},
{
"epoch": 0.17606837606837608,
"grad_norm": 0.0785689502954483,
"learning_rate": 0.00018334763948497855,
"loss": 0.353,
"num_input_tokens_seen": 659008,
"step": 103,
"train_runtime": 437.8871,
"train_tokens_per_second": 1504.973
},
{
"epoch": 0.17777777777777778,
"grad_norm": 0.0988244116306305,
"learning_rate": 0.00018317596566523608,
"loss": 0.552,
"num_input_tokens_seen": 664320,
"step": 104,
"train_runtime": 441.435,
"train_tokens_per_second": 1504.91
},
{
"epoch": 0.1794871794871795,
"grad_norm": 0.0942261815071106,
"learning_rate": 0.00018300429184549356,
"loss": 0.4421,
"num_input_tokens_seen": 670136,
"step": 105,
"train_runtime": 445.279,
"train_tokens_per_second": 1504.98
},
{
"epoch": 0.1811965811965812,
"grad_norm": 0.08600349724292755,
"learning_rate": 0.0001828326180257511,
"loss": 0.3713,
"num_input_tokens_seen": 677616,
"step": 106,
"train_runtime": 450.0186,
"train_tokens_per_second": 1505.751
},
{
"epoch": 0.1829059829059829,
"grad_norm": 0.104121632874012,
"learning_rate": 0.0001826609442060086,
"loss": 0.5,
"num_input_tokens_seen": 682872,
"step": 107,
"train_runtime": 453.5698,
"train_tokens_per_second": 1505.55
},
{
"epoch": 0.18461538461538463,
"grad_norm": 0.09976616501808167,
"learning_rate": 0.00018248927038626612,
"loss": 0.5722,
"num_input_tokens_seen": 688880,
"step": 108,
"train_runtime": 457.5283,
"train_tokens_per_second": 1505.656
},
{
"epoch": 0.18632478632478633,
"grad_norm": 0.09686106443405151,
"learning_rate": 0.00018231759656652362,
"loss": 0.3717,
"num_input_tokens_seen": 694384,
"step": 109,
"train_runtime": 461.1352,
"train_tokens_per_second": 1505.814
},
{
"epoch": 0.18803418803418803,
"grad_norm": 0.08702944964170456,
"learning_rate": 0.00018214592274678112,
"loss": 0.4682,
"num_input_tokens_seen": 702888,
"step": 110,
"train_runtime": 466.3341,
"train_tokens_per_second": 1507.263
},
{
"epoch": 0.18974358974358974,
"grad_norm": 0.0813233032822609,
"learning_rate": 0.00018197424892703863,
"loss": 0.3174,
"num_input_tokens_seen": 708344,
"step": 111,
"train_runtime": 469.8961,
"train_tokens_per_second": 1507.448
},
{
"epoch": 0.19145299145299147,
"grad_norm": 0.07839726656675339,
"learning_rate": 0.00018180257510729616,
"loss": 0.4506,
"num_input_tokens_seen": 716048,
"step": 112,
"train_runtime": 474.733,
"train_tokens_per_second": 1508.317
},
{
"epoch": 0.19316239316239317,
"grad_norm": 0.10011430829763412,
"learning_rate": 0.00018163090128755366,
"loss": 0.4048,
"num_input_tokens_seen": 720496,
"step": 113,
"train_runtime": 477.7631,
"train_tokens_per_second": 1508.061
},
{
"epoch": 0.19487179487179487,
"grad_norm": 0.11349597573280334,
"learning_rate": 0.00018145922746781116,
"loss": 0.4511,
"num_input_tokens_seen": 726112,
"step": 114,
"train_runtime": 481.4317,
"train_tokens_per_second": 1508.235
},
{
"epoch": 0.19658119658119658,
"grad_norm": 0.099846251308918,
"learning_rate": 0.0001812875536480687,
"loss": 0.4463,
"num_input_tokens_seen": 732528,
"step": 115,
"train_runtime": 485.6263,
"train_tokens_per_second": 1508.419
},
{
"epoch": 0.19829059829059828,
"grad_norm": 0.08845727145671844,
"learning_rate": 0.0001811158798283262,
"loss": 0.4187,
"num_input_tokens_seen": 738224,
"step": 116,
"train_runtime": 489.3463,
"train_tokens_per_second": 1508.592
},
{
"epoch": 0.2,
"grad_norm": 0.08002110570669174,
"learning_rate": 0.0001809442060085837,
"loss": 0.3403,
"num_input_tokens_seen": 744104,
"step": 117,
"train_runtime": 493.2012,
"train_tokens_per_second": 1508.723
},
{
"epoch": 0.2,
"eval_loss": 0.40587517619132996,
"eval_runtime": 40.1503,
"eval_samples_per_second": 24.857,
"eval_steps_per_second": 3.113,
"num_input_tokens_seen": 744104,
"step": 117
},
{
"epoch": 0.20170940170940171,
"grad_norm": 0.09665407240390778,
"learning_rate": 0.0001807725321888412,
"loss": 0.5484,
"num_input_tokens_seen": 748408,
"step": 118,
"train_runtime": 536.2984,
"train_tokens_per_second": 1395.507
},
{
"epoch": 0.20341880341880342,
"grad_norm": 0.073427215218544,
"learning_rate": 0.00018060085836909873,
"loss": 0.4037,
"num_input_tokens_seen": 754976,
"step": 119,
"train_runtime": 540.4931,
"train_tokens_per_second": 1396.828
},
{
"epoch": 0.20512820512820512,
"grad_norm": 0.07861398160457611,
"learning_rate": 0.00018042918454935623,
"loss": 0.4175,
"num_input_tokens_seen": 761608,
"step": 120,
"train_runtime": 544.7639,
"train_tokens_per_second": 1398.051
},
{
"epoch": 0.20683760683760682,
"grad_norm": 0.08523395657539368,
"learning_rate": 0.00018025751072961373,
"loss": 0.4514,
"num_input_tokens_seen": 766696,
"step": 121,
"train_runtime": 550.2584,
"train_tokens_per_second": 1393.338
},
{
"epoch": 0.20854700854700856,
"grad_norm": 0.10175268352031708,
"learning_rate": 0.00018008583690987126,
"loss": 0.5498,
"num_input_tokens_seen": 771816,
"step": 122,
"train_runtime": 553.5915,
"train_tokens_per_second": 1394.198
},
{
"epoch": 0.21025641025641026,
"grad_norm": 0.07897434383630753,
"learning_rate": 0.00017991416309012876,
"loss": 0.3669,
"num_input_tokens_seen": 779816,
"step": 123,
"train_runtime": 558.5531,
"train_tokens_per_second": 1396.136
},
{
"epoch": 0.21196581196581196,
"grad_norm": 0.10032803565263748,
"learning_rate": 0.0001797424892703863,
"loss": 0.3945,
"num_input_tokens_seen": 784600,
"step": 124,
"train_runtime": 561.7266,
"train_tokens_per_second": 1396.765
},
{
"epoch": 0.21367521367521367,
"grad_norm": 0.10458017885684967,
"learning_rate": 0.0001795708154506438,
"loss": 0.4762,
"num_input_tokens_seen": 790456,
"step": 125,
"train_runtime": 565.5377,
"train_tokens_per_second": 1397.707
},
{
"epoch": 0.2153846153846154,
"grad_norm": 0.09089679270982742,
"learning_rate": 0.0001793991416309013,
"loss": 0.3702,
"num_input_tokens_seen": 796736,
"step": 126,
"train_runtime": 569.5205,
"train_tokens_per_second": 1398.959
},
{
"epoch": 0.2170940170940171,
"grad_norm": 0.06831668317317963,
"learning_rate": 0.0001792274678111588,
"loss": 0.3713,
"num_input_tokens_seen": 804176,
"step": 127,
"train_runtime": 574.2202,
"train_tokens_per_second": 1400.466
},
{
"epoch": 0.2188034188034188,
"grad_norm": 0.083027184009552,
"learning_rate": 0.00017905579399141633,
"loss": 0.4235,
"num_input_tokens_seen": 809584,
"step": 128,
"train_runtime": 577.782,
"train_tokens_per_second": 1401.193
},
{
"epoch": 0.2205128205128205,
"grad_norm": 0.11360776424407959,
"learning_rate": 0.00017888412017167383,
"loss": 0.4361,
"num_input_tokens_seen": 814840,
"step": 129,
"train_runtime": 581.233,
"train_tokens_per_second": 1401.916
},
{
"epoch": 0.2222222222222222,
"grad_norm": 0.08979545533657074,
"learning_rate": 0.00017871244635193133,
"loss": 0.4393,
"num_input_tokens_seen": 821288,
"step": 130,
"train_runtime": 585.3382,
"train_tokens_per_second": 1403.1
},
{
"epoch": 0.22393162393162394,
"grad_norm": 0.08497156947851181,
"learning_rate": 0.00017854077253218886,
"loss": 0.5048,
"num_input_tokens_seen": 827120,
"step": 131,
"train_runtime": 589.1115,
"train_tokens_per_second": 1404.013
},
{
"epoch": 0.22564102564102564,
"grad_norm": 0.0827530175447464,
"learning_rate": 0.00017836909871244637,
"loss": 0.4593,
"num_input_tokens_seen": 834872,
"step": 132,
"train_runtime": 594.0487,
"train_tokens_per_second": 1405.393
},
{
"epoch": 0.22735042735042735,
"grad_norm": 0.08185572922229767,
"learning_rate": 0.00017819742489270387,
"loss": 0.4384,
"num_input_tokens_seen": 842384,
"step": 133,
"train_runtime": 598.7695,
"train_tokens_per_second": 1406.859
},
{
"epoch": 0.22905982905982905,
"grad_norm": 0.07782582938671112,
"learning_rate": 0.00017802575107296137,
"loss": 0.3566,
"num_input_tokens_seen": 848280,
"step": 134,
"train_runtime": 602.5201,
"train_tokens_per_second": 1407.887
},
{
"epoch": 0.23076923076923078,
"grad_norm": 0.08689026534557343,
"learning_rate": 0.0001778540772532189,
"loss": 0.4375,
"num_input_tokens_seen": 853712,
"step": 135,
"train_runtime": 606.0639,
"train_tokens_per_second": 1408.617
},
{
"epoch": 0.23247863247863249,
"grad_norm": 0.08213752508163452,
"learning_rate": 0.0001776824034334764,
"loss": 0.4607,
"num_input_tokens_seen": 860096,
"step": 136,
"train_runtime": 610.1344,
"train_tokens_per_second": 1409.683
},
{
"epoch": 0.2341880341880342,
"grad_norm": 0.10310304164886475,
"learning_rate": 0.0001775107296137339,
"loss": 0.5032,
"num_input_tokens_seen": 865432,
"step": 137,
"train_runtime": 613.6063,
"train_tokens_per_second": 1410.403
},
{
"epoch": 0.2358974358974359,
"grad_norm": 0.09156456589698792,
"learning_rate": 0.0001773390557939914,
"loss": 0.3892,
"num_input_tokens_seen": 871368,
"step": 138,
"train_runtime": 617.5677,
"train_tokens_per_second": 1410.968
},
{
"epoch": 0.2376068376068376,
"grad_norm": 0.091376394033432,
"learning_rate": 0.00017716738197424894,
"loss": 0.3485,
"num_input_tokens_seen": 878000,
"step": 139,
"train_runtime": 621.9067,
"train_tokens_per_second": 1411.787
},
{
"epoch": 0.23931623931623933,
"grad_norm": 0.08833985775709152,
"learning_rate": 0.00017699570815450647,
"loss": 0.4308,
"num_input_tokens_seen": 884944,
"step": 140,
"train_runtime": 626.1591,
"train_tokens_per_second": 1413.289
},
{
"epoch": 0.24102564102564103,
"grad_norm": 0.077347531914711,
"learning_rate": 0.00017682403433476397,
"loss": 0.4437,
"num_input_tokens_seen": 892048,
"step": 141,
"train_runtime": 630.5956,
"train_tokens_per_second": 1414.612
},
{
"epoch": 0.24273504273504273,
"grad_norm": 0.08778735250234604,
"learning_rate": 0.00017665236051502147,
"loss": 0.4004,
"num_input_tokens_seen": 899272,
"step": 142,
"train_runtime": 635.1106,
"train_tokens_per_second": 1415.93
},
{
"epoch": 0.24444444444444444,
"grad_norm": 0.07579584419727325,
"learning_rate": 0.00017648068669527897,
"loss": 0.3275,
"num_input_tokens_seen": 905736,
"step": 143,
"train_runtime": 639.1325,
"train_tokens_per_second": 1417.133
},
{
"epoch": 0.24615384615384617,
"grad_norm": 0.09621628373861313,
"learning_rate": 0.0001763090128755365,
"loss": 0.3186,
"num_input_tokens_seen": 911992,
"step": 144,
"train_runtime": 643.0987,
"train_tokens_per_second": 1418.121
},
{
"epoch": 0.24786324786324787,
"grad_norm": 0.08134900778532028,
"learning_rate": 0.000176137339055794,
"loss": 0.4076,
"num_input_tokens_seen": 919056,
"step": 145,
"train_runtime": 647.5843,
"train_tokens_per_second": 1419.207
},
{
"epoch": 0.24957264957264957,
"grad_norm": 0.08956107497215271,
"learning_rate": 0.0001759656652360515,
"loss": 0.442,
"num_input_tokens_seen": 926560,
"step": 146,
"train_runtime": 652.2666,
"train_tokens_per_second": 1420.523
},
{
"epoch": 0.2512820512820513,
"grad_norm": 0.09825581312179565,
"learning_rate": 0.000175793991416309,
"loss": 0.4903,
"num_input_tokens_seen": 932616,
"step": 147,
"train_runtime": 656.1634,
"train_tokens_per_second": 1421.317
},
{
"epoch": 0.252991452991453,
"grad_norm": 0.0692400187253952,
"learning_rate": 0.00017562231759656654,
"loss": 0.4363,
"num_input_tokens_seen": 943096,
"step": 148,
"train_runtime": 662.5318,
"train_tokens_per_second": 1423.473
},
{
"epoch": 0.2547008547008547,
"grad_norm": 0.08518907427787781,
"learning_rate": 0.00017545064377682404,
"loss": 0.507,
"num_input_tokens_seen": 949704,
"step": 149,
"train_runtime": 666.7,
"train_tokens_per_second": 1424.485
},
{
"epoch": 0.2564102564102564,
"grad_norm": 0.07248781621456146,
"learning_rate": 0.00017527896995708154,
"loss": 0.4597,
"num_input_tokens_seen": 958480,
"step": 150,
"train_runtime": 672.0909,
"train_tokens_per_second": 1426.117
},
{
"epoch": 0.25811965811965815,
"grad_norm": 0.08344928175210953,
"learning_rate": 0.00017510729613733907,
"loss": 0.4066,
"num_input_tokens_seen": 962848,
"step": 151,
"train_runtime": 677.1767,
"train_tokens_per_second": 1421.856
},
{
"epoch": 0.25982905982905985,
"grad_norm": 0.08732214570045471,
"learning_rate": 0.00017493562231759658,
"loss": 0.4012,
"num_input_tokens_seen": 969200,
"step": 152,
"train_runtime": 681.1815,
"train_tokens_per_second": 1422.822
},
{
"epoch": 0.26153846153846155,
"grad_norm": 0.0862775668501854,
"learning_rate": 0.00017476394849785408,
"loss": 0.4044,
"num_input_tokens_seen": 977976,
"step": 153,
"train_runtime": 686.6033,
"train_tokens_per_second": 1424.368
},
{
"epoch": 0.26324786324786326,
"grad_norm": 0.09334586560726166,
"learning_rate": 0.00017459227467811158,
"loss": 0.4974,
"num_input_tokens_seen": 982864,
"step": 154,
"train_runtime": 689.9455,
"train_tokens_per_second": 1424.553
},
{
"epoch": 0.26495726495726496,
"grad_norm": 0.09835942089557648,
"learning_rate": 0.0001744206008583691,
"loss": 0.4172,
"num_input_tokens_seen": 987816,
"step": 155,
"train_runtime": 693.2463,
"train_tokens_per_second": 1424.913
},
{
"epoch": 0.26666666666666666,
"grad_norm": 0.09492865204811096,
"learning_rate": 0.0001742489270386266,
"loss": 0.6536,
"num_input_tokens_seen": 995184,
"step": 156,
"train_runtime": 697.9501,
"train_tokens_per_second": 1425.867
},
{
"epoch": 0.26837606837606837,
"grad_norm": 0.11019627749919891,
"learning_rate": 0.00017407725321888414,
"loss": 0.3825,
"num_input_tokens_seen": 1001744,
"step": 157,
"train_runtime": 702.1512,
"train_tokens_per_second": 1426.678
},
{
"epoch": 0.27008547008547007,
"grad_norm": 0.07688013464212418,
"learning_rate": 0.00017390557939914164,
"loss": 0.3832,
"num_input_tokens_seen": 1009000,
"step": 158,
"train_runtime": 706.7516,
"train_tokens_per_second": 1427.659
},
{
"epoch": 0.2717948717948718,
"grad_norm": 0.07811388373374939,
"learning_rate": 0.00017373390557939915,
"loss": 0.3388,
"num_input_tokens_seen": 1016968,
"step": 159,
"train_runtime": 711.6447,
"train_tokens_per_second": 1429.039
},
{
"epoch": 0.27350427350427353,
"grad_norm": 0.08074574917554855,
"learning_rate": 0.00017356223175965668,
"loss": 0.3884,
"num_input_tokens_seen": 1023360,
"step": 160,
"train_runtime": 715.701,
"train_tokens_per_second": 1429.871
},
{
"epoch": 0.27521367521367524,
"grad_norm": 0.08296569436788559,
"learning_rate": 0.00017339055793991418,
"loss": 0.4869,
"num_input_tokens_seen": 1030056,
"step": 161,
"train_runtime": 719.8879,
"train_tokens_per_second": 1430.856
},
{
"epoch": 0.27692307692307694,
"grad_norm": 0.08286713808774948,
"learning_rate": 0.00017321888412017168,
"loss": 0.4112,
"num_input_tokens_seen": 1035944,
"step": 162,
"train_runtime": 723.7165,
"train_tokens_per_second": 1431.422
},
{
"epoch": 0.27863247863247864,
"grad_norm": 0.08952026814222336,
"learning_rate": 0.00017304721030042918,
"loss": 0.5178,
"num_input_tokens_seen": 1041072,
"step": 163,
"train_runtime": 727.2547,
"train_tokens_per_second": 1431.509
},
{
"epoch": 0.28034188034188035,
"grad_norm": 0.08672165125608444,
"learning_rate": 0.0001728755364806867,
"loss": 0.5141,
"num_input_tokens_seen": 1046504,
"step": 164,
"train_runtime": 730.8063,
"train_tokens_per_second": 1431.985
},
{
"epoch": 0.28205128205128205,
"grad_norm": 0.07433119416236877,
"learning_rate": 0.00017270386266094421,
"loss": 0.3705,
"num_input_tokens_seen": 1053320,
"step": 165,
"train_runtime": 735.1927,
"train_tokens_per_second": 1432.713
},
{
"epoch": 0.28376068376068375,
"grad_norm": 0.09836415946483612,
"learning_rate": 0.00017253218884120172,
"loss": 0.4012,
"num_input_tokens_seen": 1058256,
"step": 166,
"train_runtime": 738.4481,
"train_tokens_per_second": 1433.081
},
{
"epoch": 0.28547008547008546,
"grad_norm": 0.07832959294319153,
"learning_rate": 0.00017236051502145925,
"loss": 0.4682,
"num_input_tokens_seen": 1066112,
"step": 167,
"train_runtime": 743.4085,
"train_tokens_per_second": 1434.086
},
{
"epoch": 0.28717948717948716,
"grad_norm": 0.08503518998622894,
"learning_rate": 0.00017218884120171675,
"loss": 0.3681,
"num_input_tokens_seen": 1072952,
"step": 168,
"train_runtime": 747.782,
"train_tokens_per_second": 1434.846
},
{
"epoch": 0.28888888888888886,
"grad_norm": 0.09327785670757294,
"learning_rate": 0.00017201716738197428,
"loss": 0.4025,
"num_input_tokens_seen": 1077256,
"step": 169,
"train_runtime": 750.8076,
"train_tokens_per_second": 1434.796
},
{
"epoch": 0.2905982905982906,
"grad_norm": 0.09186345338821411,
"learning_rate": 0.00017184549356223175,
"loss": 0.3879,
"num_input_tokens_seen": 1084024,
"step": 170,
"train_runtime": 755.0495,
"train_tokens_per_second": 1435.699
},
{
"epoch": 0.2923076923076923,
"grad_norm": 0.10323686897754669,
"learning_rate": 0.00017167381974248928,
"loss": 0.4933,
"num_input_tokens_seen": 1088616,
"step": 171,
"train_runtime": 758.2012,
"train_tokens_per_second": 1435.788
},
{
"epoch": 0.294017094017094,
"grad_norm": 0.09350578486919403,
"learning_rate": 0.00017150214592274679,
"loss": 0.4143,
"num_input_tokens_seen": 1093688,
"step": 172,
"train_runtime": 761.4934,
"train_tokens_per_second": 1436.241
},
{
"epoch": 0.29572649572649573,
"grad_norm": 0.08342265337705612,
"learning_rate": 0.00017133047210300431,
"loss": 0.5081,
"num_input_tokens_seen": 1102040,
"step": 173,
"train_runtime": 766.6178,
"train_tokens_per_second": 1437.535
},
{
"epoch": 0.29743589743589743,
"grad_norm": 0.08377649635076523,
"learning_rate": 0.0001711587982832618,
"loss": 0.3301,
"num_input_tokens_seen": 1108952,
"step": 174,
"train_runtime": 771.0497,
"train_tokens_per_second": 1438.237
},
{
"epoch": 0.29914529914529914,
"grad_norm": 0.0985167846083641,
"learning_rate": 0.00017098712446351932,
"loss": 0.4349,
"num_input_tokens_seen": 1114632,
"step": 175,
"train_runtime": 774.8477,
"train_tokens_per_second": 1438.518
},
{
"epoch": 0.30085470085470084,
"grad_norm": 0.08420700579881668,
"learning_rate": 0.00017081545064377685,
"loss": 0.3511,
"num_input_tokens_seen": 1120864,
"step": 176,
"train_runtime": 778.8626,
"train_tokens_per_second": 1439.104
},
{
"epoch": 0.30256410256410254,
"grad_norm": 0.09592931717634201,
"learning_rate": 0.00017064377682403435,
"loss": 0.41,
"num_input_tokens_seen": 1125952,
"step": 177,
"train_runtime": 782.2927,
"train_tokens_per_second": 1439.298
},
{
"epoch": 0.30427350427350425,
"grad_norm": 0.1051315888762474,
"learning_rate": 0.00017047210300429185,
"loss": 0.4207,
"num_input_tokens_seen": 1131248,
"step": 178,
"train_runtime": 785.7848,
"train_tokens_per_second": 1439.641
},
{
"epoch": 0.305982905982906,
"grad_norm": 0.08925200253725052,
"learning_rate": 0.00017030042918454936,
"loss": 0.4633,
"num_input_tokens_seen": 1136936,
"step": 179,
"train_runtime": 789.5893,
"train_tokens_per_second": 1439.908
},
{
"epoch": 0.3076923076923077,
"grad_norm": 0.0915122926235199,
"learning_rate": 0.00017012875536480689,
"loss": 0.4684,
"num_input_tokens_seen": 1142672,
"step": 180,
"train_runtime": 793.454,
"train_tokens_per_second": 1440.124
},
{
"epoch": 0.3094017094017094,
"grad_norm": 0.08007518202066422,
"learning_rate": 0.0001699570815450644,
"loss": 0.3796,
"num_input_tokens_seen": 1148560,
"step": 181,
"train_runtime": 799.6238,
"train_tokens_per_second": 1436.375
},
{
"epoch": 0.3111111111111111,
"grad_norm": 0.07503318041563034,
"learning_rate": 0.0001697854077253219,
"loss": 0.4707,
"num_input_tokens_seen": 1154464,
"step": 182,
"train_runtime": 803.5538,
"train_tokens_per_second": 1436.698
},
{
"epoch": 0.3128205128205128,
"grad_norm": 0.08250313997268677,
"learning_rate": 0.0001696137339055794,
"loss": 0.353,
"num_input_tokens_seen": 1160784,
"step": 183,
"train_runtime": 807.6568,
"train_tokens_per_second": 1437.224
},
{
"epoch": 0.3145299145299145,
"grad_norm": 0.08271831274032593,
"learning_rate": 0.00016944206008583692,
"loss": 0.3339,
"num_input_tokens_seen": 1168784,
"step": 184,
"train_runtime": 812.761,
"train_tokens_per_second": 1438.042
},
{
"epoch": 0.3162393162393162,
"grad_norm": 0.0855436846613884,
"learning_rate": 0.00016927038626609445,
"loss": 0.4262,
"num_input_tokens_seen": 1174328,
"step": 185,
"train_runtime": 816.4748,
"train_tokens_per_second": 1438.291
},
{
"epoch": 0.31794871794871793,
"grad_norm": 0.0945754274725914,
"learning_rate": 0.00016909871244635193,
"loss": 0.4788,
"num_input_tokens_seen": 1181472,
"step": 186,
"train_runtime": 820.9842,
"train_tokens_per_second": 1439.092
},
{
"epoch": 0.31965811965811963,
"grad_norm": 0.08868105709552765,
"learning_rate": 0.00016892703862660946,
"loss": 0.3443,
"num_input_tokens_seen": 1186512,
"step": 187,
"train_runtime": 824.2996,
"train_tokens_per_second": 1439.418
},
{
"epoch": 0.3213675213675214,
"grad_norm": 0.08292389661073685,
"learning_rate": 0.00016875536480686696,
"loss": 0.4366,
"num_input_tokens_seen": 1193368,
"step": 188,
"train_runtime": 828.6712,
"train_tokens_per_second": 1440.098
},
{
"epoch": 0.3230769230769231,
"grad_norm": 0.08975725620985031,
"learning_rate": 0.0001685836909871245,
"loss": 0.4329,
"num_input_tokens_seen": 1199040,
"step": 189,
"train_runtime": 832.4326,
"train_tokens_per_second": 1440.405
},
{
"epoch": 0.3247863247863248,
"grad_norm": 0.0817112997174263,
"learning_rate": 0.00016841201716738196,
"loss": 0.3662,
"num_input_tokens_seen": 1206688,
"step": 190,
"train_runtime": 837.2183,
"train_tokens_per_second": 1441.306
},
{
"epoch": 0.3264957264957265,
"grad_norm": 0.07979970425367355,
"learning_rate": 0.0001682403433476395,
"loss": 0.398,
"num_input_tokens_seen": 1212200,
"step": 191,
"train_runtime": 840.9362,
"train_tokens_per_second": 1441.489
},
{
"epoch": 0.3282051282051282,
"grad_norm": 0.07939396798610687,
"learning_rate": 0.000168068669527897,
"loss": 0.3686,
"num_input_tokens_seen": 1216776,
"step": 192,
"train_runtime": 843.9694,
"train_tokens_per_second": 1441.73
},
{
"epoch": 0.3299145299145299,
"grad_norm": 0.07741633802652359,
"learning_rate": 0.00016789699570815452,
"loss": 0.425,
"num_input_tokens_seen": 1226144,
"step": 193,
"train_runtime": 849.6943,
"train_tokens_per_second": 1443.041
},
{
"epoch": 0.3316239316239316,
"grad_norm": 0.09136336296796799,
"learning_rate": 0.00016772532188841203,
"loss": 0.3931,
"num_input_tokens_seen": 1231528,
"step": 194,
"train_runtime": 853.2848,
"train_tokens_per_second": 1443.279
},
{
"epoch": 0.3333333333333333,
"grad_norm": 0.08121038973331451,
"learning_rate": 0.00016755364806866953,
"loss": 0.463,
"num_input_tokens_seen": 1238208,
"step": 195,
"train_runtime": 857.5308,
"train_tokens_per_second": 1443.923
},
{
"epoch": 0.335042735042735,
"grad_norm": 0.07446426898241043,
"learning_rate": 0.00016738197424892706,
"loss": 0.3814,
"num_input_tokens_seen": 1246368,
"step": 196,
"train_runtime": 862.7002,
"train_tokens_per_second": 1444.729
},
{
"epoch": 0.3367521367521368,
"grad_norm": 0.08591346442699432,
"learning_rate": 0.00016721030042918456,
"loss": 0.4053,
"num_input_tokens_seen": 1253176,
"step": 197,
"train_runtime": 867.0626,
"train_tokens_per_second": 1445.312
},
{
"epoch": 0.3384615384615385,
"grad_norm": 0.0990113615989685,
"learning_rate": 0.00016703862660944206,
"loss": 0.3617,
"num_input_tokens_seen": 1257328,
"step": 198,
"train_runtime": 869.9717,
"train_tokens_per_second": 1445.252
},
{
"epoch": 0.3401709401709402,
"grad_norm": 0.08174863457679749,
"learning_rate": 0.00016686695278969957,
"loss": 0.2952,
"num_input_tokens_seen": 1262752,
"step": 199,
"train_runtime": 873.6148,
"train_tokens_per_second": 1445.433
},
{
"epoch": 0.3418803418803419,
"grad_norm": 0.0933527871966362,
"learning_rate": 0.0001666952789699571,
"loss": 0.4163,
"num_input_tokens_seen": 1268184,
"step": 200,
"train_runtime": 877.2752,
"train_tokens_per_second": 1445.594
},
{
"epoch": 0.3435897435897436,
"grad_norm": 0.1140134260058403,
"learning_rate": 0.0001665236051502146,
"loss": 0.4031,
"num_input_tokens_seen": 1272472,
"step": 201,
"train_runtime": 880.2048,
"train_tokens_per_second": 1445.654
},
{
"epoch": 0.3452991452991453,
"grad_norm": 0.08693648129701614,
"learning_rate": 0.0001663519313304721,
"loss": 0.6282,
"num_input_tokens_seen": 1281824,
"step": 202,
"train_runtime": 886.0089,
"train_tokens_per_second": 1446.739
},
{
"epoch": 0.347008547008547,
"grad_norm": 0.07994189858436584,
"learning_rate": 0.00016618025751072963,
"loss": 0.4113,
"num_input_tokens_seen": 1289504,
"step": 203,
"train_runtime": 890.7326,
"train_tokens_per_second": 1447.689
},
{
"epoch": 0.3487179487179487,
"grad_norm": 0.09394797682762146,
"learning_rate": 0.00016600858369098713,
"loss": 0.4092,
"num_input_tokens_seen": 1297680,
"step": 204,
"train_runtime": 895.8276,
"train_tokens_per_second": 1448.582
},
{
"epoch": 0.3504273504273504,
"grad_norm": 0.1045864149928093,
"learning_rate": 0.00016583690987124466,
"loss": 0.4665,
"num_input_tokens_seen": 1303120,
"step": 205,
"train_runtime": 899.4257,
"train_tokens_per_second": 1448.836
},
{
"epoch": 0.35213675213675216,
"grad_norm": 0.09909515082836151,
"learning_rate": 0.00016566523605150214,
"loss": 0.3833,
"num_input_tokens_seen": 1308704,
"step": 206,
"train_runtime": 903.0277,
"train_tokens_per_second": 1449.24
},
{
"epoch": 0.35384615384615387,
"grad_norm": 0.09417211264371872,
"learning_rate": 0.00016549356223175967,
"loss": 0.4637,
"num_input_tokens_seen": 1318024,
"step": 207,
"train_runtime": 908.7522,
"train_tokens_per_second": 1450.367
},
{
"epoch": 0.35555555555555557,
"grad_norm": 0.08689752966165543,
"learning_rate": 0.00016532188841201717,
"loss": 0.3688,
"num_input_tokens_seen": 1323376,
"step": 208,
"train_runtime": 912.3212,
"train_tokens_per_second": 1450.559
},
{
"epoch": 0.3572649572649573,
"grad_norm": 0.10346587747335434,
"learning_rate": 0.0001651502145922747,
"loss": 0.417,
"num_input_tokens_seen": 1329344,
"step": 209,
"train_runtime": 916.1738,
"train_tokens_per_second": 1450.974
},
{
"epoch": 0.358974358974359,
"grad_norm": 0.08489441126585007,
"learning_rate": 0.00016497854077253217,
"loss": 0.3553,
"num_input_tokens_seen": 1335584,
"step": 210,
"train_runtime": 920.2847,
"train_tokens_per_second": 1451.273
},
{
"epoch": 0.3606837606837607,
"grad_norm": 0.10042458772659302,
"learning_rate": 0.0001648068669527897,
"loss": 0.4154,
"num_input_tokens_seen": 1340328,
"step": 211,
"train_runtime": 925.545,
"train_tokens_per_second": 1448.15
},
{
"epoch": 0.3623931623931624,
"grad_norm": 0.10793930292129517,
"learning_rate": 0.00016463519313304723,
"loss": 0.3644,
"num_input_tokens_seen": 1345400,
"step": 212,
"train_runtime": 928.914,
"train_tokens_per_second": 1448.358
},
{
"epoch": 0.3641025641025641,
"grad_norm": 0.08157683908939362,
"learning_rate": 0.00016446351931330473,
"loss": 0.3851,
"num_input_tokens_seen": 1352168,
"step": 213,
"train_runtime": 933.2462,
"train_tokens_per_second": 1448.887
},
{
"epoch": 0.3658119658119658,
"grad_norm": 0.08290579169988632,
"learning_rate": 0.00016429184549356224,
"loss": 0.4271,
"num_input_tokens_seen": 1357488,
"step": 214,
"train_runtime": 936.7821,
"train_tokens_per_second": 1449.097
},
{
"epoch": 0.36752136752136755,
"grad_norm": 0.09265032410621643,
"learning_rate": 0.00016412017167381974,
"loss": 0.3743,
"num_input_tokens_seen": 1363552,
"step": 215,
"train_runtime": 940.8128,
"train_tokens_per_second": 1449.334
},
{
"epoch": 0.36923076923076925,
"grad_norm": 0.11796024441719055,
"learning_rate": 0.00016394849785407727,
"loss": 0.5261,
"num_input_tokens_seen": 1368296,
"step": 216,
"train_runtime": 943.9494,
"train_tokens_per_second": 1449.544
},
{
"epoch": 0.37094017094017095,
"grad_norm": 0.08797245472669601,
"learning_rate": 0.00016377682403433477,
"loss": 0.4256,
"num_input_tokens_seen": 1374640,
"step": 217,
"train_runtime": 947.9289,
"train_tokens_per_second": 1450.151
},
{
"epoch": 0.37264957264957266,
"grad_norm": 0.09329722076654434,
"learning_rate": 0.00016360515021459227,
"loss": 0.4461,
"num_input_tokens_seen": 1379760,
"step": 218,
"train_runtime": 951.2715,
"train_tokens_per_second": 1450.438
},
{
"epoch": 0.37435897435897436,
"grad_norm": 0.09663166105747223,
"learning_rate": 0.00016343347639484978,
"loss": 0.3487,
"num_input_tokens_seen": 1384368,
"step": 219,
"train_runtime": 954.3992,
"train_tokens_per_second": 1450.513
},
{
"epoch": 0.37606837606837606,
"grad_norm": 0.07949472963809967,
"learning_rate": 0.0001632618025751073,
"loss": 0.3311,
"num_input_tokens_seen": 1389488,
"step": 220,
"train_runtime": 957.768,
"train_tokens_per_second": 1450.756
},
{
"epoch": 0.37777777777777777,
"grad_norm": 0.07584179192781448,
"learning_rate": 0.00016309012875536483,
"loss": 0.524,
"num_input_tokens_seen": 1396320,
"step": 221,
"train_runtime": 962.0694,
"train_tokens_per_second": 1451.371
},
{
"epoch": 0.37948717948717947,
"grad_norm": 0.08242885023355484,
"learning_rate": 0.0001629184549356223,
"loss": 0.4083,
"num_input_tokens_seen": 1403024,
"step": 222,
"train_runtime": 966.312,
"train_tokens_per_second": 1451.937
},
{
"epoch": 0.3811965811965812,
"grad_norm": 0.08721666783094406,
"learning_rate": 0.00016274678111587984,
"loss": 0.4642,
"num_input_tokens_seen": 1413336,
"step": 223,
"train_runtime": 972.5941,
"train_tokens_per_second": 1453.161
},
{
"epoch": 0.38290598290598293,
"grad_norm": 0.08998598903417587,
"learning_rate": 0.00016257510729613734,
"loss": 0.3536,
"num_input_tokens_seen": 1418664,
"step": 224,
"train_runtime": 976.0647,
"train_tokens_per_second": 1453.453
},
{
"epoch": 0.38461538461538464,
"grad_norm": 0.09844992309808731,
"learning_rate": 0.00016240343347639487,
"loss": 0.4508,
"num_input_tokens_seen": 1424488,
"step": 225,
"train_runtime": 979.8777,
"train_tokens_per_second": 1453.741
},
{
"epoch": 0.38632478632478634,
"grad_norm": 0.0743747279047966,
"learning_rate": 0.00016223175965665235,
"loss": 0.4139,
"num_input_tokens_seen": 1430656,
"step": 226,
"train_runtime": 983.8135,
"train_tokens_per_second": 1454.194
},
{
"epoch": 0.38803418803418804,
"grad_norm": 0.09330051392316818,
"learning_rate": 0.00016206008583690988,
"loss": 0.3968,
"num_input_tokens_seen": 1436704,
"step": 227,
"train_runtime": 987.722,
"train_tokens_per_second": 1454.563
},
{
"epoch": 0.38974358974358975,
"grad_norm": 0.08090078085660934,
"learning_rate": 0.00016188841201716738,
"loss": 0.4065,
"num_input_tokens_seen": 1442192,
"step": 228,
"train_runtime": 991.2265,
"train_tokens_per_second": 1454.957
},
{
"epoch": 0.39145299145299145,
"grad_norm": 0.09302696585655212,
"learning_rate": 0.0001617167381974249,
"loss": 0.5249,
"num_input_tokens_seen": 1446968,
"step": 229,
"train_runtime": 994.4101,
"train_tokens_per_second": 1455.102
},
{
"epoch": 0.39316239316239315,
"grad_norm": 0.09254134446382523,
"learning_rate": 0.0001615450643776824,
"loss": 0.492,
"num_input_tokens_seen": 1451760,
"step": 230,
"train_runtime": 997.6396,
"train_tokens_per_second": 1455.195
},
{
"epoch": 0.39487179487179486,
"grad_norm": 0.07806482911109924,
"learning_rate": 0.0001613733905579399,
"loss": 0.3763,
"num_input_tokens_seen": 1458224,
"step": 231,
"train_runtime": 1001.7272,
"train_tokens_per_second": 1455.71
},
{
"epoch": 0.39658119658119656,
"grad_norm": 0.09533582627773285,
"learning_rate": 0.00016120171673819744,
"loss": 0.3539,
"num_input_tokens_seen": 1466568,
"step": 232,
"train_runtime": 1006.8859,
"train_tokens_per_second": 1456.538
},
{
"epoch": 0.39829059829059826,
"grad_norm": 0.08084721863269806,
"learning_rate": 0.00016103004291845494,
"loss": 0.3963,
"num_input_tokens_seen": 1471888,
"step": 233,
"train_runtime": 1010.3453,
"train_tokens_per_second": 1456.817
},
{
"epoch": 0.4,
"grad_norm": 0.11491655558347702,
"learning_rate": 0.00016085836909871245,
"loss": 0.5211,
"num_input_tokens_seen": 1475936,
"step": 234,
"train_runtime": 1013.2193,
"train_tokens_per_second": 1456.68
},
{
"epoch": 0.4,
"eval_loss": 0.40096667408943176,
"eval_runtime": 39.8121,
"eval_samples_per_second": 25.068,
"eval_steps_per_second": 3.14,
"num_input_tokens_seen": 1475936,
"step": 234
},
{
"epoch": 0.4017094017094017,
"grad_norm": 0.09031600505113602,
"learning_rate": 0.00016068669527896995,
"loss": 0.3919,
"num_input_tokens_seen": 1480152,
"step": 235,
"train_runtime": 1055.9664,
"train_tokens_per_second": 1401.704
},
{
"epoch": 0.40341880341880343,
"grad_norm": 0.07933737337589264,
"learning_rate": 0.00016051502145922748,
"loss": 0.3459,
"num_input_tokens_seen": 1487376,
"step": 236,
"train_runtime": 1060.4849,
"train_tokens_per_second": 1402.543
},
{
"epoch": 0.40512820512820513,
"grad_norm": 0.10257117450237274,
"learning_rate": 0.00016034334763948498,
"loss": 0.4875,
"num_input_tokens_seen": 1491480,
"step": 237,
"train_runtime": 1063.2453,
"train_tokens_per_second": 1402.762
},
{
"epoch": 0.40683760683760684,
"grad_norm": 0.07746583223342896,
"learning_rate": 0.00016017167381974248,
"loss": 0.4194,
"num_input_tokens_seen": 1498224,
"step": 238,
"train_runtime": 1067.6608,
"train_tokens_per_second": 1403.277
},
{
"epoch": 0.40854700854700854,
"grad_norm": 0.08215701580047607,
"learning_rate": 0.00016,
"loss": 0.3321,
"num_input_tokens_seen": 1505016,
"step": 239,
"train_runtime": 1071.959,
"train_tokens_per_second": 1403.986
},
{
"epoch": 0.41025641025641024,
"grad_norm": 0.08626586198806763,
"learning_rate": 0.00015982832618025752,
"loss": 0.352,
"num_input_tokens_seen": 1510872,
"step": 240,
"train_runtime": 1075.7766,
"train_tokens_per_second": 1404.448
},
{
"epoch": 0.41196581196581195,
"grad_norm": 0.07768667489290237,
"learning_rate": 0.00015965665236051504,
"loss": 0.3635,
"num_input_tokens_seen": 1518680,
"step": 241,
"train_runtime": 1083.0754,
"train_tokens_per_second": 1402.192
},
{
"epoch": 0.41367521367521365,
"grad_norm": 0.09436383098363876,
"learning_rate": 0.00015948497854077255,
"loss": 0.3873,
"num_input_tokens_seen": 1523408,
"step": 242,
"train_runtime": 1086.2718,
"train_tokens_per_second": 1402.419
},
{
"epoch": 0.4153846153846154,
"grad_norm": 0.10022980719804764,
"learning_rate": 0.00015931330472103005,
"loss": 0.4982,
"num_input_tokens_seen": 1527088,
"step": 243,
"train_runtime": 1088.8585,
"train_tokens_per_second": 1402.467
},
{
"epoch": 0.4170940170940171,
"grad_norm": 0.07399852573871613,
"learning_rate": 0.00015914163090128755,
"loss": 0.428,
"num_input_tokens_seen": 1537712,
"step": 244,
"train_runtime": 1095.1717,
"train_tokens_per_second": 1404.083
},
{
"epoch": 0.4188034188034188,
"grad_norm": 0.09640722721815109,
"learning_rate": 0.00015896995708154508,
"loss": 0.4273,
"num_input_tokens_seen": 1544256,
"step": 245,
"train_runtime": 1099.4433,
"train_tokens_per_second": 1404.58
},
{
"epoch": 0.4205128205128205,
"grad_norm": 0.08752251416444778,
"learning_rate": 0.00015879828326180258,
"loss": 0.3741,
"num_input_tokens_seen": 1549216,
"step": 246,
"train_runtime": 1102.808,
"train_tokens_per_second": 1404.792
},
{
"epoch": 0.4222222222222222,
"grad_norm": 0.09055118262767792,
"learning_rate": 0.00015862660944206009,
"loss": 0.3215,
"num_input_tokens_seen": 1553936,
"step": 247,
"train_runtime": 1106.0798,
"train_tokens_per_second": 1404.904
},
{
"epoch": 0.4239316239316239,
"grad_norm": 0.09065423905849457,
"learning_rate": 0.00015845493562231762,
"loss": 0.3577,
"num_input_tokens_seen": 1559952,
"step": 248,
"train_runtime": 1110.0108,
"train_tokens_per_second": 1405.349
},
{
"epoch": 0.4256410256410256,
"grad_norm": 0.07726360857486725,
"learning_rate": 0.00015828326180257512,
"loss": 0.3056,
"num_input_tokens_seen": 1565544,
"step": 249,
"train_runtime": 1113.7626,
"train_tokens_per_second": 1405.635
},
{
"epoch": 0.42735042735042733,
"grad_norm": 0.11181222647428513,
"learning_rate": 0.00015811158798283262,
"loss": 0.4,
"num_input_tokens_seen": 1570120,
"step": 250,
"train_runtime": 1116.8239,
"train_tokens_per_second": 1405.88
},
{
"epoch": 0.42905982905982903,
"grad_norm": 0.09931083768606186,
"learning_rate": 0.00015793991416309012,
"loss": 0.4628,
"num_input_tokens_seen": 1576664,
"step": 251,
"train_runtime": 1120.9296,
"train_tokens_per_second": 1406.568
},
{
"epoch": 0.4307692307692308,
"grad_norm": 0.1047554761171341,
"learning_rate": 0.00015776824034334765,
"loss": 0.5433,
"num_input_tokens_seen": 1580232,
"step": 252,
"train_runtime": 1123.4358,
"train_tokens_per_second": 1406.606
},
{
"epoch": 0.4324786324786325,
"grad_norm": 0.09181802719831467,
"learning_rate": 0.00015759656652360515,
"loss": 0.5485,
"num_input_tokens_seen": 1587000,
"step": 253,
"train_runtime": 1127.7713,
"train_tokens_per_second": 1407.2
},
{
"epoch": 0.4341880341880342,
"grad_norm": 0.08955714106559753,
"learning_rate": 0.00015742489270386266,
"loss": 0.3696,
"num_input_tokens_seen": 1592184,
"step": 254,
"train_runtime": 1131.1496,
"train_tokens_per_second": 1407.58
},
{
"epoch": 0.4358974358974359,
"grad_norm": 0.08395666629076004,
"learning_rate": 0.00015725321888412016,
"loss": 0.3811,
"num_input_tokens_seen": 1597400,
"step": 255,
"train_runtime": 1134.6396,
"train_tokens_per_second": 1407.848
},
{
"epoch": 0.4376068376068376,
"grad_norm": 0.08952012658119202,
"learning_rate": 0.0001570815450643777,
"loss": 0.5207,
"num_input_tokens_seen": 1603560,
"step": 256,
"train_runtime": 1138.5956,
"train_tokens_per_second": 1408.367
},
{
"epoch": 0.4393162393162393,
"grad_norm": 0.07518703490495682,
"learning_rate": 0.00015690987124463522,
"loss": 0.341,
"num_input_tokens_seen": 1609952,
"step": 257,
"train_runtime": 1142.6858,
"train_tokens_per_second": 1408.919
},
{
"epoch": 0.441025641025641,
"grad_norm": 0.08981534093618393,
"learning_rate": 0.00015673819742489272,
"loss": 0.3535,
"num_input_tokens_seen": 1614952,
"step": 258,
"train_runtime": 1146.1364,
"train_tokens_per_second": 1409.04
},
{
"epoch": 0.4427350427350427,
"grad_norm": 0.09569933265447617,
"learning_rate": 0.00015656652360515022,
"loss": 0.4656,
"num_input_tokens_seen": 1621848,
"step": 259,
"train_runtime": 1150.5402,
"train_tokens_per_second": 1409.64
},
{
"epoch": 0.4444444444444444,
"grad_norm": 0.0871426984667778,
"learning_rate": 0.00015639484978540773,
"loss": 0.3592,
"num_input_tokens_seen": 1629144,
"step": 260,
"train_runtime": 1155.1465,
"train_tokens_per_second": 1410.335
},
{
"epoch": 0.4461538461538462,
"grad_norm": 0.07977623492479324,
"learning_rate": 0.00015622317596566525,
"loss": 0.4316,
"num_input_tokens_seen": 1635464,
"step": 261,
"train_runtime": 1159.1609,
"train_tokens_per_second": 1410.903
},
{
"epoch": 0.4478632478632479,
"grad_norm": 0.10125043988227844,
"learning_rate": 0.00015605150214592276,
"loss": 0.3631,
"num_input_tokens_seen": 1640440,
"step": 262,
"train_runtime": 1162.4822,
"train_tokens_per_second": 1411.153
},
{
"epoch": 0.4495726495726496,
"grad_norm": 0.0801963284611702,
"learning_rate": 0.00015587982832618026,
"loss": 0.3788,
"num_input_tokens_seen": 1647488,
"step": 263,
"train_runtime": 1167.0278,
"train_tokens_per_second": 1411.696
},
{
"epoch": 0.4512820512820513,
"grad_norm": 0.07716058194637299,
"learning_rate": 0.0001557081545064378,
"loss": 0.4523,
"num_input_tokens_seen": 1653720,
"step": 264,
"train_runtime": 1170.999,
"train_tokens_per_second": 1412.23
},
{
"epoch": 0.452991452991453,
"grad_norm": 0.07113456726074219,
"learning_rate": 0.0001555364806866953,
"loss": 0.4483,
"num_input_tokens_seen": 1662984,
"step": 265,
"train_runtime": 1176.6605,
"train_tokens_per_second": 1413.308
},
{
"epoch": 0.4547008547008547,
"grad_norm": 0.08501028269529343,
"learning_rate": 0.0001553648068669528,
"loss": 0.3744,
"num_input_tokens_seen": 1669240,
"step": 266,
"train_runtime": 1180.5615,
"train_tokens_per_second": 1413.937
},
{
"epoch": 0.4564102564102564,
"grad_norm": 0.12146402895450592,
"learning_rate": 0.0001551931330472103,
"loss": 0.5228,
"num_input_tokens_seen": 1674392,
"step": 267,
"train_runtime": 1183.9915,
"train_tokens_per_second": 1414.193
},
{
"epoch": 0.4581196581196581,
"grad_norm": 0.08500533550977707,
"learning_rate": 0.00015502145922746783,
"loss": 0.4029,
"num_input_tokens_seen": 1680704,
"step": 268,
"train_runtime": 1188.0637,
"train_tokens_per_second": 1414.658
},
{
"epoch": 0.4598290598290598,
"grad_norm": 0.08828039467334747,
"learning_rate": 0.00015484978540772533,
"loss": 0.3817,
"num_input_tokens_seen": 1688032,
"step": 269,
"train_runtime": 1192.6736,
"train_tokens_per_second": 1415.334
},
{
"epoch": 0.46153846153846156,
"grad_norm": 0.09044201672077179,
"learning_rate": 0.00015467811158798283,
"loss": 0.2898,
"num_input_tokens_seen": 1695632,
"step": 270,
"train_runtime": 1197.4796,
"train_tokens_per_second": 1416.001
},
{
"epoch": 0.46324786324786327,
"grad_norm": 0.08178558945655823,
"learning_rate": 0.00015450643776824033,
"loss": 0.3721,
"num_input_tokens_seen": 1701256,
"step": 271,
"train_runtime": 1203.6359,
"train_tokens_per_second": 1413.431
},
{
"epoch": 0.46495726495726497,
"grad_norm": 0.08540398627519608,
"learning_rate": 0.00015433476394849786,
"loss": 0.4181,
"num_input_tokens_seen": 1706352,
"step": 272,
"train_runtime": 1206.9569,
"train_tokens_per_second": 1413.764
},
{
"epoch": 0.4666666666666667,
"grad_norm": 0.08019081503152847,
"learning_rate": 0.0001541630901287554,
"loss": 0.3428,
"num_input_tokens_seen": 1711728,
"step": 273,
"train_runtime": 1210.514,
"train_tokens_per_second": 1414.051
},
{
"epoch": 0.4683760683760684,
"grad_norm": 0.09295406192541122,
"learning_rate": 0.0001539914163090129,
"loss": 0.4543,
"num_input_tokens_seen": 1716512,
"step": 274,
"train_runtime": 1213.6938,
"train_tokens_per_second": 1414.287
},
{
"epoch": 0.4700854700854701,
"grad_norm": 0.07860468327999115,
"learning_rate": 0.0001538197424892704,
"loss": 0.4592,
"num_input_tokens_seen": 1722200,
"step": 275,
"train_runtime": 1217.3819,
"train_tokens_per_second": 1414.675
},
{
"epoch": 0.4717948717948718,
"grad_norm": 0.08995640277862549,
"learning_rate": 0.0001536480686695279,
"loss": 0.3845,
"num_input_tokens_seen": 1726088,
"step": 276,
"train_runtime": 1220.143,
"train_tokens_per_second": 1414.66
},
{
"epoch": 0.4735042735042735,
"grad_norm": 0.08785276114940643,
"learning_rate": 0.00015347639484978543,
"loss": 0.4225,
"num_input_tokens_seen": 1733392,
"step": 277,
"train_runtime": 1224.7221,
"train_tokens_per_second": 1415.335
},
{
"epoch": 0.4752136752136752,
"grad_norm": 0.0918450802564621,
"learning_rate": 0.00015330472103004293,
"loss": 0.4922,
"num_input_tokens_seen": 1739624,
"step": 278,
"train_runtime": 1228.6485,
"train_tokens_per_second": 1415.884
},
{
"epoch": 0.47692307692307695,
"grad_norm": 0.07409488409757614,
"learning_rate": 0.00015313304721030043,
"loss": 0.3089,
"num_input_tokens_seen": 1745512,
"step": 279,
"train_runtime": 1232.4839,
"train_tokens_per_second": 1416.255
},
{
"epoch": 0.47863247863247865,
"grad_norm": 0.08338349312543869,
"learning_rate": 0.00015296137339055794,
"loss": 0.3837,
"num_input_tokens_seen": 1751352,
"step": 280,
"train_runtime": 1236.2127,
"train_tokens_per_second": 1416.708
},
{
"epoch": 0.48034188034188036,
"grad_norm": 0.08887634426355362,
"learning_rate": 0.00015278969957081546,
"loss": 0.4143,
"num_input_tokens_seen": 1757360,
"step": 281,
"train_runtime": 1240.1646,
"train_tokens_per_second": 1417.038
},
{
"epoch": 0.48205128205128206,
"grad_norm": 0.08524525165557861,
"learning_rate": 0.00015261802575107297,
"loss": 0.4217,
"num_input_tokens_seen": 1762880,
"step": 282,
"train_runtime": 1243.7701,
"train_tokens_per_second": 1417.368
},
{
"epoch": 0.48376068376068376,
"grad_norm": 0.08796384930610657,
"learning_rate": 0.00015244635193133047,
"loss": 0.5087,
"num_input_tokens_seen": 1768064,
"step": 283,
"train_runtime": 1247.2163,
"train_tokens_per_second": 1417.608
},
{
"epoch": 0.48547008547008547,
"grad_norm": 0.08289546519517899,
"learning_rate": 0.000152274678111588,
"loss": 0.3867,
"num_input_tokens_seen": 1774344,
"step": 284,
"train_runtime": 1251.4095,
"train_tokens_per_second": 1417.876
},
{
"epoch": 0.48717948717948717,
"grad_norm": 0.09948357194662094,
"learning_rate": 0.0001521030042918455,
"loss": 0.4324,
"num_input_tokens_seen": 1779720,
"step": 285,
"train_runtime": 1255.0103,
"train_tokens_per_second": 1418.092
},
{
"epoch": 0.4888888888888889,
"grad_norm": 0.08023009449243546,
"learning_rate": 0.000151931330472103,
"loss": 0.2635,
"num_input_tokens_seen": 1789384,
"step": 286,
"train_runtime": 1260.9634,
"train_tokens_per_second": 1419.061
},
{
"epoch": 0.4905982905982906,
"grad_norm": 0.08087978512048721,
"learning_rate": 0.0001517596566523605,
"loss": 0.3492,
"num_input_tokens_seen": 1794880,
"step": 287,
"train_runtime": 1264.6081,
"train_tokens_per_second": 1419.317
},
{
"epoch": 0.49230769230769234,
"grad_norm": 0.07231873273849487,
"learning_rate": 0.00015158798283261804,
"loss": 0.3468,
"num_input_tokens_seen": 1800104,
"step": 288,
"train_runtime": 1268.0921,
"train_tokens_per_second": 1419.537
},
{
"epoch": 0.49401709401709404,
"grad_norm": 0.07424788177013397,
"learning_rate": 0.00015141630901287554,
"loss": 0.3704,
"num_input_tokens_seen": 1805928,
"step": 289,
"train_runtime": 1271.8437,
"train_tokens_per_second": 1419.929
},
{
"epoch": 0.49572649572649574,
"grad_norm": 0.09837713837623596,
"learning_rate": 0.00015124463519313307,
"loss": 0.45,
"num_input_tokens_seen": 1810824,
"step": 290,
"train_runtime": 1275.0248,
"train_tokens_per_second": 1420.227
},
{
"epoch": 0.49743589743589745,
"grad_norm": 0.08725966513156891,
"learning_rate": 0.00015107296137339057,
"loss": 0.4393,
"num_input_tokens_seen": 1815928,
"step": 291,
"train_runtime": 1278.4107,
"train_tokens_per_second": 1420.457
},
{
"epoch": 0.49914529914529915,
"grad_norm": 0.08219818770885468,
"learning_rate": 0.00015090128755364807,
"loss": 0.4083,
"num_input_tokens_seen": 1822272,
"step": 292,
"train_runtime": 1282.5809,
"train_tokens_per_second": 1420.785
},
{
"epoch": 0.5008547008547009,
"grad_norm": 0.08088050782680511,
"learning_rate": 0.0001507296137339056,
"loss": 0.3627,
"num_input_tokens_seen": 1828008,
"step": 293,
"train_runtime": 1286.3907,
"train_tokens_per_second": 1421.036
},
{
"epoch": 0.5025641025641026,
"grad_norm": 0.07896595448255539,
"learning_rate": 0.0001505579399141631,
"loss": 0.3942,
"num_input_tokens_seen": 1836360,
"step": 294,
"train_runtime": 1291.5001,
"train_tokens_per_second": 1421.881
},
{
"epoch": 0.5042735042735043,
"grad_norm": 0.09844955801963806,
"learning_rate": 0.0001503862660944206,
"loss": 0.4604,
"num_input_tokens_seen": 1843848,
"step": 295,
"train_runtime": 1296.2401,
"train_tokens_per_second": 1422.459
},
{
"epoch": 0.505982905982906,
"grad_norm": 0.07079170644283295,
"learning_rate": 0.0001502145922746781,
"loss": 0.2805,
"num_input_tokens_seen": 1851360,
"step": 296,
"train_runtime": 1300.9484,
"train_tokens_per_second": 1423.085
},
{
"epoch": 0.5076923076923077,
"grad_norm": 0.09218448400497437,
"learning_rate": 0.00015004291845493564,
"loss": 0.3511,
"num_input_tokens_seen": 1855936,
"step": 297,
"train_runtime": 1304.0647,
"train_tokens_per_second": 1423.193
},
{
"epoch": 0.5094017094017094,
"grad_norm": 0.09190265834331512,
"learning_rate": 0.00014987124463519314,
"loss": 0.3471,
"num_input_tokens_seen": 1863072,
"step": 298,
"train_runtime": 1308.6096,
"train_tokens_per_second": 1423.703
},
{
"epoch": 0.5111111111111111,
"grad_norm": 0.09502872824668884,
"learning_rate": 0.00014969957081545064,
"loss": 0.4892,
"num_input_tokens_seen": 1869608,
"step": 299,
"train_runtime": 1312.7245,
"train_tokens_per_second": 1424.22
},
{
"epoch": 0.5128205128205128,
"grad_norm": 0.10176997631788254,
"learning_rate": 0.00014952789699570817,
"loss": 0.4568,
"num_input_tokens_seen": 1875904,
"step": 300,
"train_runtime": 1316.7069,
"train_tokens_per_second": 1424.694
},
{
"epoch": 0.5145299145299145,
"grad_norm": 0.10159771889448166,
"learning_rate": 0.00014935622317596567,
"loss": 0.3938,
"num_input_tokens_seen": 1880448,
"step": 301,
"train_runtime": 1321.8403,
"train_tokens_per_second": 1422.599
},
{
"epoch": 0.5162393162393163,
"grad_norm": 0.07759668678045273,
"learning_rate": 0.0001491845493562232,
"loss": 0.4137,
"num_input_tokens_seen": 1888856,
"step": 302,
"train_runtime": 1327.1569,
"train_tokens_per_second": 1423.235
},
{
"epoch": 0.517948717948718,
"grad_norm": 0.06867683678865433,
"learning_rate": 0.00014901287553648068,
"loss": 0.3298,
"num_input_tokens_seen": 1895272,
"step": 303,
"train_runtime": 1331.3216,
"train_tokens_per_second": 1423.602
},
{
"epoch": 0.5196581196581197,
"grad_norm": 0.09469713270664215,
"learning_rate": 0.0001488412017167382,
"loss": 0.3788,
"num_input_tokens_seen": 1901800,
"step": 304,
"train_runtime": 1335.4905,
"train_tokens_per_second": 1424.046
},
{
"epoch": 0.5213675213675214,
"grad_norm": 0.07816332578659058,
"learning_rate": 0.0001486695278969957,
"loss": 0.428,
"num_input_tokens_seen": 1908632,
"step": 305,
"train_runtime": 1339.8213,
"train_tokens_per_second": 1424.542
},
{
"epoch": 0.5230769230769231,
"grad_norm": 0.08694681525230408,
"learning_rate": 0.00014849785407725324,
"loss": 0.3145,
"num_input_tokens_seen": 1913720,
"step": 306,
"train_runtime": 1343.2127,
"train_tokens_per_second": 1424.733
},
{
"epoch": 0.5247863247863248,
"grad_norm": 0.053747374564409256,
"learning_rate": 0.00014832618025751072,
"loss": 0.3026,
"num_input_tokens_seen": 1927400,
"step": 307,
"train_runtime": 1351.386,
"train_tokens_per_second": 1426.239
},
{
"epoch": 0.5264957264957265,
"grad_norm": 0.09011126309633255,
"learning_rate": 0.00014815450643776825,
"loss": 0.3607,
"num_input_tokens_seen": 1933544,
"step": 308,
"train_runtime": 1355.3093,
"train_tokens_per_second": 1426.644
},
{
"epoch": 0.5282051282051282,
"grad_norm": 0.08776524662971497,
"learning_rate": 0.00014798283261802578,
"loss": 0.4278,
"num_input_tokens_seen": 1938896,
"step": 309,
"train_runtime": 1358.8461,
"train_tokens_per_second": 1426.869
},
{
"epoch": 0.5299145299145299,
"grad_norm": 0.10794860124588013,
"learning_rate": 0.00014781115879828328,
"loss": 0.5204,
"num_input_tokens_seen": 1945288,
"step": 310,
"train_runtime": 1363.0326,
"train_tokens_per_second": 1427.176
},
{
"epoch": 0.5316239316239316,
"grad_norm": 0.08652819693088531,
"learning_rate": 0.00014763948497854078,
"loss": 0.3907,
"num_input_tokens_seen": 1951448,
"step": 311,
"train_runtime": 1366.9784,
"train_tokens_per_second": 1427.563
},
{
"epoch": 0.5333333333333333,
"grad_norm": 0.10126706957817078,
"learning_rate": 0.00014746781115879828,
"loss": 0.4945,
"num_input_tokens_seen": 1956456,
"step": 312,
"train_runtime": 1370.372,
"train_tokens_per_second": 1427.682
},
{
"epoch": 0.535042735042735,
"grad_norm": 0.10532712191343307,
"learning_rate": 0.0001472961373390558,
"loss": 0.4276,
"num_input_tokens_seen": 1961216,
"step": 313,
"train_runtime": 1373.4969,
"train_tokens_per_second": 1427.9
},
{
"epoch": 0.5367521367521367,
"grad_norm": 0.09144797176122665,
"learning_rate": 0.00014712446351931331,
"loss": 0.4097,
"num_input_tokens_seen": 1967176,
"step": 314,
"train_runtime": 1377.3529,
"train_tokens_per_second": 1428.229
},
{
"epoch": 0.5384615384615384,
"grad_norm": 0.07700413465499878,
"learning_rate": 0.00014695278969957082,
"loss": 0.5064,
"num_input_tokens_seen": 1973824,
"step": 315,
"train_runtime": 1381.6847,
"train_tokens_per_second": 1428.563
},
{
"epoch": 0.5401709401709401,
"grad_norm": 0.10635288059711456,
"learning_rate": 0.00014678111587982832,
"loss": 0.464,
"num_input_tokens_seen": 1978280,
"step": 316,
"train_runtime": 1384.7125,
"train_tokens_per_second": 1428.658
},
{
"epoch": 0.5418803418803418,
"grad_norm": 0.1100783571600914,
"learning_rate": 0.00014660944206008585,
"loss": 0.4738,
"num_input_tokens_seen": 1984584,
"step": 317,
"train_runtime": 1388.7531,
"train_tokens_per_second": 1429.04
},
{
"epoch": 0.5435897435897435,
"grad_norm": 0.09916520863771439,
"learning_rate": 0.00014643776824034338,
"loss": 0.4941,
"num_input_tokens_seen": 1990456,
"step": 318,
"train_runtime": 1392.6048,
"train_tokens_per_second": 1429.304
},
{
"epoch": 0.5452991452991452,
"grad_norm": 0.11754505336284637,
"learning_rate": 0.00014626609442060085,
"loss": 0.4537,
"num_input_tokens_seen": 1996424,
"step": 319,
"train_runtime": 1396.5367,
"train_tokens_per_second": 1429.554
},
{
"epoch": 0.5470085470085471,
"grad_norm": 0.09356576949357986,
"learning_rate": 0.00014609442060085838,
"loss": 0.3945,
"num_input_tokens_seen": 2002712,
"step": 320,
"train_runtime": 1400.5323,
"train_tokens_per_second": 1429.965
},
{
"epoch": 0.5487179487179488,
"grad_norm": 0.08926735818386078,
"learning_rate": 0.00014592274678111588,
"loss": 0.34,
"num_input_tokens_seen": 2010392,
"step": 321,
"train_runtime": 1405.3404,
"train_tokens_per_second": 1430.537
},
{
"epoch": 0.5504273504273505,
"grad_norm": 0.0716586783528328,
"learning_rate": 0.00014575107296137341,
"loss": 0.3498,
"num_input_tokens_seen": 2018112,
"step": 322,
"train_runtime": 1410.1769,
"train_tokens_per_second": 1431.106
},
{
"epoch": 0.5521367521367522,
"grad_norm": 0.08030697703361511,
"learning_rate": 0.0001455793991416309,
"loss": 0.4488,
"num_input_tokens_seen": 2024360,
"step": 323,
"train_runtime": 1414.2132,
"train_tokens_per_second": 1431.439
},
{
"epoch": 0.5538461538461539,
"grad_norm": 0.08266004920005798,
"learning_rate": 0.00014540772532188842,
"loss": 0.3271,
"num_input_tokens_seen": 2029784,
"step": 324,
"train_runtime": 1417.8782,
"train_tokens_per_second": 1431.564
},
{
"epoch": 0.5555555555555556,
"grad_norm": 0.0910225510597229,
"learning_rate": 0.00014523605150214592,
"loss": 0.3246,
"num_input_tokens_seen": 2035024,
"step": 325,
"train_runtime": 1421.4156,
"train_tokens_per_second": 1431.688
},
{
"epoch": 0.5572649572649573,
"grad_norm": 0.10865269601345062,
"learning_rate": 0.00014506437768240345,
"loss": 0.4211,
"num_input_tokens_seen": 2039312,
"step": 326,
"train_runtime": 1424.3146,
"train_tokens_per_second": 1431.785
},
{
"epoch": 0.558974358974359,
"grad_norm": 0.0958554595708847,
"learning_rate": 0.00014489270386266095,
"loss": 0.4778,
"num_input_tokens_seen": 2046432,
"step": 327,
"train_runtime": 1428.8104,
"train_tokens_per_second": 1432.263
},
{
"epoch": 0.5606837606837607,
"grad_norm": 0.09468738734722137,
"learning_rate": 0.00014472103004291846,
"loss": 0.4299,
"num_input_tokens_seen": 2051776,
"step": 328,
"train_runtime": 1432.395,
"train_tokens_per_second": 1432.409
},
{
"epoch": 0.5623931623931624,
"grad_norm": 0.06919053196907043,
"learning_rate": 0.00014454935622317599,
"loss": 0.3952,
"num_input_tokens_seen": 2057712,
"step": 329,
"train_runtime": 1436.3095,
"train_tokens_per_second": 1432.638
},
{
"epoch": 0.5641025641025641,
"grad_norm": 0.08503609895706177,
"learning_rate": 0.0001443776824034335,
"loss": 0.49,
"num_input_tokens_seen": 2061968,
"step": 330,
"train_runtime": 1439.2203,
"train_tokens_per_second": 1432.698
},
{
"epoch": 0.5658119658119658,
"grad_norm": 0.08844102919101715,
"learning_rate": 0.000144206008583691,
"loss": 0.4348,
"num_input_tokens_seen": 2067504,
"step": 331,
"train_runtime": 1444.8321,
"train_tokens_per_second": 1430.965
},
{
"epoch": 0.5675213675213675,
"grad_norm": 0.08457052707672119,
"learning_rate": 0.0001440343347639485,
"loss": 0.4158,
"num_input_tokens_seen": 2072688,
"step": 332,
"train_runtime": 1448.2405,
"train_tokens_per_second": 1431.177
},
{
"epoch": 0.5692307692307692,
"grad_norm": 0.08367235213518143,
"learning_rate": 0.00014386266094420602,
"loss": 0.331,
"num_input_tokens_seen": 2077200,
"step": 333,
"train_runtime": 1451.3343,
"train_tokens_per_second": 1431.235
},
{
"epoch": 0.5709401709401709,
"grad_norm": 0.09541928768157959,
"learning_rate": 0.00014369098712446352,
"loss": 0.3559,
"num_input_tokens_seen": 2081992,
"step": 334,
"train_runtime": 1454.5461,
"train_tokens_per_second": 1431.369
},
{
"epoch": 0.5726495726495726,
"grad_norm": 0.08940909057855606,
"learning_rate": 0.00014351931330472103,
"loss": 0.3756,
"num_input_tokens_seen": 2087928,
"step": 335,
"train_runtime": 1458.4391,
"train_tokens_per_second": 1431.618
},
{
"epoch": 0.5743589743589743,
"grad_norm": 0.07144365459680557,
"learning_rate": 0.00014334763948497856,
"loss": 0.3767,
"num_input_tokens_seen": 2096776,
"step": 336,
"train_runtime": 1463.9741,
"train_tokens_per_second": 1432.249
},
{
"epoch": 0.576068376068376,
"grad_norm": 0.1072118952870369,
"learning_rate": 0.00014317596566523606,
"loss": 0.4711,
"num_input_tokens_seen": 2100736,
"step": 337,
"train_runtime": 1466.8178,
"train_tokens_per_second": 1432.172
},
{
"epoch": 0.5777777777777777,
"grad_norm": 0.09300663322210312,
"learning_rate": 0.0001430042918454936,
"loss": 0.3452,
"num_input_tokens_seen": 2107160,
"step": 338,
"train_runtime": 1471.0439,
"train_tokens_per_second": 1432.425
},
{
"epoch": 0.5794871794871795,
"grad_norm": 0.07325253635644913,
"learning_rate": 0.00014283261802575106,
"loss": 0.4553,
"num_input_tokens_seen": 2113784,
"step": 339,
"train_runtime": 1475.4308,
"train_tokens_per_second": 1432.655
},
{
"epoch": 0.5811965811965812,
"grad_norm": 0.07705891877412796,
"learning_rate": 0.0001426609442060086,
"loss": 0.3485,
"num_input_tokens_seen": 2120384,
"step": 340,
"train_runtime": 1479.6085,
"train_tokens_per_second": 1433.071
},
{
"epoch": 0.582905982905983,
"grad_norm": 0.08625199645757675,
"learning_rate": 0.0001424892703862661,
"loss": 0.4506,
"num_input_tokens_seen": 2126768,
"step": 341,
"train_runtime": 1483.7964,
"train_tokens_per_second": 1433.329
},
{
"epoch": 0.5846153846153846,
"grad_norm": 0.0800558477640152,
"learning_rate": 0.00014231759656652362,
"loss": 0.3653,
"num_input_tokens_seen": 2132224,
"step": 342,
"train_runtime": 1487.3113,
"train_tokens_per_second": 1433.61
},
{
"epoch": 0.5863247863247864,
"grad_norm": 0.08397111296653748,
"learning_rate": 0.0001421459227467811,
"loss": 0.4463,
"num_input_tokens_seen": 2137720,
"step": 343,
"train_runtime": 1490.9075,
"train_tokens_per_second": 1433.838
},
{
"epoch": 0.588034188034188,
"grad_norm": 0.07987198978662491,
"learning_rate": 0.00014197424892703863,
"loss": 0.4335,
"num_input_tokens_seen": 2143688,
"step": 344,
"train_runtime": 1494.8312,
"train_tokens_per_second": 1434.067
},
{
"epoch": 0.5897435897435898,
"grad_norm": 0.08058437705039978,
"learning_rate": 0.00014180257510729616,
"loss": 0.4047,
"num_input_tokens_seen": 2149424,
"step": 345,
"train_runtime": 1498.5271,
"train_tokens_per_second": 1434.358
},
{
"epoch": 0.5914529914529915,
"grad_norm": 0.08178169280290604,
"learning_rate": 0.00014163090128755366,
"loss": 0.4263,
"num_input_tokens_seen": 2154792,
"step": 346,
"train_runtime": 1502.107,
"train_tokens_per_second": 1434.513
},
{
"epoch": 0.5931623931623932,
"grad_norm": 0.09406203776597977,
"learning_rate": 0.00014145922746781116,
"loss": 0.3642,
"num_input_tokens_seen": 2159888,
"step": 347,
"train_runtime": 1505.4719,
"train_tokens_per_second": 1434.692
},
{
"epoch": 0.5948717948717949,
"grad_norm": 0.08521080017089844,
"learning_rate": 0.00014128755364806867,
"loss": 0.4245,
"num_input_tokens_seen": 2164880,
"step": 348,
"train_runtime": 1508.7988,
"train_tokens_per_second": 1434.837
},
{
"epoch": 0.5965811965811966,
"grad_norm": 0.09558600187301636,
"learning_rate": 0.0001411158798283262,
"loss": 0.5506,
"num_input_tokens_seen": 2169712,
"step": 349,
"train_runtime": 1512.0048,
"train_tokens_per_second": 1434.99
},
{
"epoch": 0.5982905982905983,
"grad_norm": 0.09704317897558212,
"learning_rate": 0.0001409442060085837,
"loss": 0.4522,
"num_input_tokens_seen": 2176688,
"step": 350,
"train_runtime": 1516.4757,
"train_tokens_per_second": 1435.36
},
{
"epoch": 0.6,
"grad_norm": 0.07796601951122284,
"learning_rate": 0.0001407725321888412,
"loss": 0.3903,
"num_input_tokens_seen": 2182704,
"step": 351,
"train_runtime": 1520.4129,
"train_tokens_per_second": 1435.599
},
{
"epoch": 0.6,
"eval_loss": 0.39889562129974365,
"eval_runtime": 40.1503,
"eval_samples_per_second": 24.857,
"eval_steps_per_second": 3.113,
"num_input_tokens_seen": 2182704,
"step": 351
},
{
"epoch": 0.6017094017094017,
"grad_norm": 0.09079721570014954,
"learning_rate": 0.0001406008583690987,
"loss": 0.4283,
"num_input_tokens_seen": 2188192,
"step": 352,
"train_runtime": 1564.2922,
"train_tokens_per_second": 1398.838
},
{
"epoch": 0.6034188034188034,
"grad_norm": 0.0738375186920166,
"learning_rate": 0.00014042918454935623,
"loss": 0.4441,
"num_input_tokens_seen": 2196224,
"step": 353,
"train_runtime": 1569.3087,
"train_tokens_per_second": 1399.485
},
{
"epoch": 0.6051282051282051,
"grad_norm": 0.09894047677516937,
"learning_rate": 0.00014025751072961376,
"loss": 0.5074,
"num_input_tokens_seen": 2200912,
"step": 354,
"train_runtime": 1572.4562,
"train_tokens_per_second": 1399.665
},
{
"epoch": 0.6068376068376068,
"grad_norm": 0.07697256654500961,
"learning_rate": 0.00014008583690987124,
"loss": 0.3198,
"num_input_tokens_seen": 2206576,
"step": 355,
"train_runtime": 1576.2927,
"train_tokens_per_second": 1399.852
},
{
"epoch": 0.6085470085470085,
"grad_norm": 0.10991324484348297,
"learning_rate": 0.00013991416309012877,
"loss": 0.444,
"num_input_tokens_seen": 2210776,
"step": 356,
"train_runtime": 1579.1755,
"train_tokens_per_second": 1399.956
},
{
"epoch": 0.6102564102564103,
"grad_norm": 0.09266971796751022,
"learning_rate": 0.00013974248927038627,
"loss": 0.3746,
"num_input_tokens_seen": 2215184,
"step": 357,
"train_runtime": 1582.2121,
"train_tokens_per_second": 1400.055
},
{
"epoch": 0.611965811965812,
"grad_norm": 0.07689535617828369,
"learning_rate": 0.0001395708154506438,
"loss": 0.3114,
"num_input_tokens_seen": 2221480,
"step": 358,
"train_runtime": 1586.3483,
"train_tokens_per_second": 1400.373
},
{
"epoch": 0.6136752136752137,
"grad_norm": 0.09256884455680847,
"learning_rate": 0.00013939914163090127,
"loss": 0.5355,
"num_input_tokens_seen": 2227224,
"step": 359,
"train_runtime": 1590.0739,
"train_tokens_per_second": 1400.705
},
{
"epoch": 0.6153846153846154,
"grad_norm": 0.10408233106136322,
"learning_rate": 0.0001392274678111588,
"loss": 0.4115,
"num_input_tokens_seen": 2232224,
"step": 360,
"train_runtime": 1593.3627,
"train_tokens_per_second": 1400.952
},
{
"epoch": 0.6170940170940171,
"grad_norm": 0.0907105803489685,
"learning_rate": 0.0001390557939914163,
"loss": 0.3445,
"num_input_tokens_seen": 2236584,
"step": 361,
"train_runtime": 1598.5561,
"train_tokens_per_second": 1399.128
},
{
"epoch": 0.6188034188034188,
"grad_norm": 0.0865362212061882,
"learning_rate": 0.00013888412017167383,
"loss": 0.4831,
"num_input_tokens_seen": 2241096,
"step": 362,
"train_runtime": 1601.6168,
"train_tokens_per_second": 1399.271
},
{
"epoch": 0.6205128205128205,
"grad_norm": 0.09336186200380325,
"learning_rate": 0.00013871244635193134,
"loss": 0.3674,
"num_input_tokens_seen": 2245488,
"step": 363,
"train_runtime": 1604.583,
"train_tokens_per_second": 1399.422
},
{
"epoch": 0.6222222222222222,
"grad_norm": 0.09631265699863434,
"learning_rate": 0.00013854077253218884,
"loss": 0.3435,
"num_input_tokens_seen": 2250184,
"step": 364,
"train_runtime": 1607.6918,
"train_tokens_per_second": 1399.636
},
{
"epoch": 0.6239316239316239,
"grad_norm": 0.10324070602655411,
"learning_rate": 0.00013836909871244637,
"loss": 0.4786,
"num_input_tokens_seen": 2255360,
"step": 365,
"train_runtime": 1611.2468,
"train_tokens_per_second": 1399.761
},
{
"epoch": 0.6256410256410256,
"grad_norm": 0.08939824253320694,
"learning_rate": 0.00013819742489270387,
"loss": 0.4553,
"num_input_tokens_seen": 2261184,
"step": 366,
"train_runtime": 1615.0109,
"train_tokens_per_second": 1400.105
},
{
"epoch": 0.6273504273504273,
"grad_norm": 0.09298057854175568,
"learning_rate": 0.00013802575107296137,
"loss": 0.3719,
"num_input_tokens_seen": 2267688,
"step": 367,
"train_runtime": 1619.2073,
"train_tokens_per_second": 1400.493
},
{
"epoch": 0.629059829059829,
"grad_norm": 0.09285794943571091,
"learning_rate": 0.00013785407725321888,
"loss": 0.3364,
"num_input_tokens_seen": 2272200,
"step": 368,
"train_runtime": 1622.2382,
"train_tokens_per_second": 1400.657
},
{
"epoch": 0.6307692307692307,
"grad_norm": 0.08546578139066696,
"learning_rate": 0.0001376824034334764,
"loss": 0.3205,
"num_input_tokens_seen": 2276488,
"step": 369,
"train_runtime": 1625.2365,
"train_tokens_per_second": 1400.712
},
{
"epoch": 0.6324786324786325,
"grad_norm": 0.08365242183208466,
"learning_rate": 0.0001375107296137339,
"loss": 0.3349,
"num_input_tokens_seen": 2281184,
"step": 370,
"train_runtime": 1628.4726,
"train_tokens_per_second": 1400.812
},
{
"epoch": 0.6341880341880342,
"grad_norm": 0.07910430431365967,
"learning_rate": 0.0001373390557939914,
"loss": 0.3611,
"num_input_tokens_seen": 2286696,
"step": 371,
"train_runtime": 1632.1432,
"train_tokens_per_second": 1401.039
},
{
"epoch": 0.6358974358974359,
"grad_norm": 0.0918528288602829,
"learning_rate": 0.00013716738197424894,
"loss": 0.5565,
"num_input_tokens_seen": 2291648,
"step": 372,
"train_runtime": 1635.5649,
"train_tokens_per_second": 1401.136
},
{
"epoch": 0.6376068376068376,
"grad_norm": 0.07989461719989777,
"learning_rate": 0.00013699570815450644,
"loss": 0.4643,
"num_input_tokens_seen": 2298904,
"step": 373,
"train_runtime": 1640.2116,
"train_tokens_per_second": 1401.59
},
{
"epoch": 0.6393162393162393,
"grad_norm": 0.09709218889474869,
"learning_rate": 0.00013682403433476397,
"loss": 0.2924,
"num_input_tokens_seen": 2304656,
"step": 374,
"train_runtime": 1644.0348,
"train_tokens_per_second": 1401.829
},
{
"epoch": 0.6410256410256411,
"grad_norm": 0.08683669567108154,
"learning_rate": 0.00013665236051502147,
"loss": 0.399,
"num_input_tokens_seen": 2309560,
"step": 375,
"train_runtime": 1647.3687,
"train_tokens_per_second": 1401.969
},
{
"epoch": 0.6427350427350428,
"grad_norm": 0.09597049653530121,
"learning_rate": 0.00013648068669527898,
"loss": 0.4146,
"num_input_tokens_seen": 2314304,
"step": 376,
"train_runtime": 1650.5219,
"train_tokens_per_second": 1402.165
},
{
"epoch": 0.6444444444444445,
"grad_norm": 0.10446120798587799,
"learning_rate": 0.00013630901287553648,
"loss": 0.4616,
"num_input_tokens_seen": 2319912,
"step": 377,
"train_runtime": 1654.2418,
"train_tokens_per_second": 1402.402
},
{
"epoch": 0.6461538461538462,
"grad_norm": 0.10042799264192581,
"learning_rate": 0.000136137339055794,
"loss": 0.4273,
"num_input_tokens_seen": 2324896,
"step": 378,
"train_runtime": 1657.6904,
"train_tokens_per_second": 1402.491
},
{
"epoch": 0.6478632478632479,
"grad_norm": 0.09080878645181656,
"learning_rate": 0.0001359656652360515,
"loss": 0.371,
"num_input_tokens_seen": 2329696,
"step": 379,
"train_runtime": 1660.9598,
"train_tokens_per_second": 1402.62
},
{
"epoch": 0.6495726495726496,
"grad_norm": 0.09960087388753891,
"learning_rate": 0.000135793991416309,
"loss": 0.478,
"num_input_tokens_seen": 2335952,
"step": 380,
"train_runtime": 1665.0537,
"train_tokens_per_second": 1402.929
},
{
"epoch": 0.6512820512820513,
"grad_norm": 0.09628906100988388,
"learning_rate": 0.00013562231759656654,
"loss": 0.5056,
"num_input_tokens_seen": 2341424,
"step": 381,
"train_runtime": 1668.6974,
"train_tokens_per_second": 1403.145
},
{
"epoch": 0.652991452991453,
"grad_norm": 0.09442561119794846,
"learning_rate": 0.00013545064377682404,
"loss": 0.4214,
"num_input_tokens_seen": 2346280,
"step": 382,
"train_runtime": 1671.9888,
"train_tokens_per_second": 1403.287
},
{
"epoch": 0.6547008547008547,
"grad_norm": 0.08291413635015488,
"learning_rate": 0.00013527896995708155,
"loss": 0.3663,
"num_input_tokens_seen": 2351856,
"step": 383,
"train_runtime": 1675.6596,
"train_tokens_per_second": 1403.54
},
{
"epoch": 0.6564102564102564,
"grad_norm": 0.08272901922464371,
"learning_rate": 0.00013510729613733905,
"loss": 0.4371,
"num_input_tokens_seen": 2358488,
"step": 384,
"train_runtime": 1679.9498,
"train_tokens_per_second": 1403.904
},
{
"epoch": 0.6581196581196581,
"grad_norm": 0.09740111231803894,
"learning_rate": 0.00013493562231759658,
"loss": 0.4235,
"num_input_tokens_seen": 2363344,
"step": 385,
"train_runtime": 1683.3637,
"train_tokens_per_second": 1403.941
},
{
"epoch": 0.6598290598290598,
"grad_norm": 0.10885223746299744,
"learning_rate": 0.00013476394849785408,
"loss": 0.5086,
"num_input_tokens_seen": 2369912,
"step": 386,
"train_runtime": 1687.682,
"train_tokens_per_second": 1404.241
},
{
"epoch": 0.6615384615384615,
"grad_norm": 0.08678839355707169,
"learning_rate": 0.00013459227467811158,
"loss": 0.2697,
"num_input_tokens_seen": 2374184,
"step": 387,
"train_runtime": 1690.6282,
"train_tokens_per_second": 1404.321
},
{
"epoch": 0.6632478632478632,
"grad_norm": 0.08202622830867767,
"learning_rate": 0.00013442060085836909,
"loss": 0.4109,
"num_input_tokens_seen": 2379040,
"step": 388,
"train_runtime": 1693.9423,
"train_tokens_per_second": 1404.44
},
{
"epoch": 0.6649572649572649,
"grad_norm": 0.08018656075000763,
"learning_rate": 0.00013424892703862662,
"loss": 0.4139,
"num_input_tokens_seen": 2387224,
"step": 389,
"train_runtime": 1699.0756,
"train_tokens_per_second": 1405.013
},
{
"epoch": 0.6666666666666666,
"grad_norm": 0.08134426176548004,
"learning_rate": 0.00013407725321888414,
"loss": 0.4374,
"num_input_tokens_seen": 2392080,
"step": 390,
"train_runtime": 1702.3937,
"train_tokens_per_second": 1405.127
},
{
"epoch": 0.6683760683760683,
"grad_norm": 0.07251180708408356,
"learning_rate": 0.00013390557939914165,
"loss": 0.3994,
"num_input_tokens_seen": 2398128,
"step": 391,
"train_runtime": 1708.3925,
"train_tokens_per_second": 1403.734
},
{
"epoch": 0.67008547008547,
"grad_norm": 0.08818169683218002,
"learning_rate": 0.00013373390557939915,
"loss": 0.4005,
"num_input_tokens_seen": 2404440,
"step": 392,
"train_runtime": 1712.4305,
"train_tokens_per_second": 1404.11
},
{
"epoch": 0.6717948717948717,
"grad_norm": 0.0823337659239769,
"learning_rate": 0.00013356223175965665,
"loss": 0.3136,
"num_input_tokens_seen": 2412128,
"step": 393,
"train_runtime": 1717.3418,
"train_tokens_per_second": 1404.571
},
{
"epoch": 0.6735042735042736,
"grad_norm": 0.09980267286300659,
"learning_rate": 0.00013339055793991418,
"loss": 0.4452,
"num_input_tokens_seen": 2416536,
"step": 394,
"train_runtime": 1720.4905,
"train_tokens_per_second": 1404.562
},
{
"epoch": 0.6752136752136753,
"grad_norm": 0.08660242706537247,
"learning_rate": 0.00013321888412017168,
"loss": 0.4983,
"num_input_tokens_seen": 2421080,
"step": 395,
"train_runtime": 1723.5853,
"train_tokens_per_second": 1404.677
},
{
"epoch": 0.676923076923077,
"grad_norm": 0.10475271195173264,
"learning_rate": 0.00013304721030042919,
"loss": 0.4383,
"num_input_tokens_seen": 2427376,
"step": 396,
"train_runtime": 1727.6892,
"train_tokens_per_second": 1404.984
},
{
"epoch": 0.6786324786324787,
"grad_norm": 0.08192956447601318,
"learning_rate": 0.0001328755364806867,
"loss": 0.3392,
"num_input_tokens_seen": 2435120,
"step": 397,
"train_runtime": 1732.6657,
"train_tokens_per_second": 1405.418
},
{
"epoch": 0.6803418803418804,
"grad_norm": 0.07553105801343918,
"learning_rate": 0.00013270386266094422,
"loss": 0.383,
"num_input_tokens_seen": 2442576,
"step": 398,
"train_runtime": 1737.418,
"train_tokens_per_second": 1405.866
},
{
"epoch": 0.6820512820512821,
"grad_norm": 0.1032620221376419,
"learning_rate": 0.00013253218884120172,
"loss": 0.4186,
"num_input_tokens_seen": 2448784,
"step": 399,
"train_runtime": 1741.4935,
"train_tokens_per_second": 1406.14
},
{
"epoch": 0.6837606837606838,
"grad_norm": 0.10456489771604538,
"learning_rate": 0.00013236051502145922,
"loss": 0.4697,
"num_input_tokens_seen": 2455504,
"step": 400,
"train_runtime": 1745.7367,
"train_tokens_per_second": 1406.572
},
{
"epoch": 0.6854700854700855,
"grad_norm": 0.09265512973070145,
"learning_rate": 0.00013218884120171675,
"loss": 0.4487,
"num_input_tokens_seen": 2461560,
"step": 401,
"train_runtime": 1749.5632,
"train_tokens_per_second": 1406.957
},
{
"epoch": 0.6871794871794872,
"grad_norm": 0.07256102561950684,
"learning_rate": 0.00013201716738197425,
"loss": 0.3153,
"num_input_tokens_seen": 2468800,
"step": 402,
"train_runtime": 1754.2231,
"train_tokens_per_second": 1407.347
},
{
"epoch": 0.6888888888888889,
"grad_norm": 0.07364867627620697,
"learning_rate": 0.00013184549356223176,
"loss": 0.3433,
"num_input_tokens_seen": 2477720,
"step": 403,
"train_runtime": 1759.7128,
"train_tokens_per_second": 1408.025
},
{
"epoch": 0.6905982905982906,
"grad_norm": 0.08628483861684799,
"learning_rate": 0.00013167381974248926,
"loss": 0.3985,
"num_input_tokens_seen": 2486192,
"step": 404,
"train_runtime": 1765.0347,
"train_tokens_per_second": 1408.58
},
{
"epoch": 0.6923076923076923,
"grad_norm": 0.08556502312421799,
"learning_rate": 0.0001315021459227468,
"loss": 0.3041,
"num_input_tokens_seen": 2492480,
"step": 405,
"train_runtime": 1769.0985,
"train_tokens_per_second": 1408.898
},
{
"epoch": 0.694017094017094,
"grad_norm": 0.10038785636425018,
"learning_rate": 0.0001313304721030043,
"loss": 0.9755,
"num_input_tokens_seen": 2498112,
"step": 406,
"train_runtime": 1772.8297,
"train_tokens_per_second": 1409.11
},
{
"epoch": 0.6957264957264957,
"grad_norm": 0.09080588072538376,
"learning_rate": 0.00013115879828326182,
"loss": 0.3674,
"num_input_tokens_seen": 2502984,
"step": 407,
"train_runtime": 1776.2479,
"train_tokens_per_second": 1409.141
},
{
"epoch": 0.6974358974358974,
"grad_norm": 0.08220319449901581,
"learning_rate": 0.00013098712446351932,
"loss": 0.3126,
"num_input_tokens_seen": 2507112,
"step": 408,
"train_runtime": 1779.1809,
"train_tokens_per_second": 1409.138
},
{
"epoch": 0.6991452991452991,
"grad_norm": 0.11195231974124908,
"learning_rate": 0.00013081545064377683,
"loss": 0.3934,
"num_input_tokens_seen": 2515928,
"step": 409,
"train_runtime": 1784.7765,
"train_tokens_per_second": 1409.66
},
{
"epoch": 0.7008547008547008,
"grad_norm": 0.09571472555398941,
"learning_rate": 0.00013064377682403435,
"loss": 0.3706,
"num_input_tokens_seen": 2521944,
"step": 410,
"train_runtime": 1788.7202,
"train_tokens_per_second": 1409.915
},
{
"epoch": 0.7025641025641025,
"grad_norm": 0.09179401397705078,
"learning_rate": 0.00013047210300429186,
"loss": 0.2979,
"num_input_tokens_seen": 2526848,
"step": 411,
"train_runtime": 1792.0136,
"train_tokens_per_second": 1410.061
},
{
"epoch": 0.7042735042735043,
"grad_norm": 0.09440741688013077,
"learning_rate": 0.00013030042918454936,
"loss": 0.5097,
"num_input_tokens_seen": 2533784,
"step": 412,
"train_runtime": 1796.3941,
"train_tokens_per_second": 1410.483
},
{
"epoch": 0.705982905982906,
"grad_norm": 0.11012144386768341,
"learning_rate": 0.00013012875536480686,
"loss": 0.385,
"num_input_tokens_seen": 2538112,
"step": 413,
"train_runtime": 1799.4714,
"train_tokens_per_second": 1410.476
},
{
"epoch": 0.7076923076923077,
"grad_norm": 0.08006038516759872,
"learning_rate": 0.0001299570815450644,
"loss": 0.4715,
"num_input_tokens_seen": 2544952,
"step": 414,
"train_runtime": 1803.9087,
"train_tokens_per_second": 1410.799
},
{
"epoch": 0.7094017094017094,
"grad_norm": 0.0850716233253479,
"learning_rate": 0.0001297854077253219,
"loss": 0.3632,
"num_input_tokens_seen": 2550800,
"step": 415,
"train_runtime": 1807.7422,
"train_tokens_per_second": 1411.042
},
{
"epoch": 0.7111111111111111,
"grad_norm": 0.08932614326477051,
"learning_rate": 0.0001296137339055794,
"loss": 0.4279,
"num_input_tokens_seen": 2557144,
"step": 416,
"train_runtime": 1811.9042,
"train_tokens_per_second": 1411.302
},
{
"epoch": 0.7128205128205128,
"grad_norm": 0.08836366981267929,
"learning_rate": 0.00012944206008583693,
"loss": 0.404,
"num_input_tokens_seen": 2562936,
"step": 417,
"train_runtime": 1815.6127,
"train_tokens_per_second": 1411.609
},
{
"epoch": 0.7145299145299145,
"grad_norm": 0.08833774924278259,
"learning_rate": 0.00012927038626609443,
"loss": 0.4296,
"num_input_tokens_seen": 2567728,
"step": 418,
"train_runtime": 1818.8812,
"train_tokens_per_second": 1411.707
},
{
"epoch": 0.7162393162393162,
"grad_norm": 0.0948844775557518,
"learning_rate": 0.00012909871244635193,
"loss": 0.398,
"num_input_tokens_seen": 2573784,
"step": 419,
"train_runtime": 1822.8202,
"train_tokens_per_second": 1411.979
},
{
"epoch": 0.717948717948718,
"grad_norm": 0.08557496964931488,
"learning_rate": 0.00012892703862660943,
"loss": 0.4048,
"num_input_tokens_seen": 2580104,
"step": 420,
"train_runtime": 1826.9724,
"train_tokens_per_second": 1412.229
},
{
"epoch": 0.7196581196581197,
"grad_norm": 0.10961645841598511,
"learning_rate": 0.00012875536480686696,
"loss": 0.3888,
"num_input_tokens_seen": 2586304,
"step": 421,
"train_runtime": 1833.0299,
"train_tokens_per_second": 1410.945
},
{
"epoch": 0.7213675213675214,
"grad_norm": 0.09428433328866959,
"learning_rate": 0.00012858369098712446,
"loss": 0.3787,
"num_input_tokens_seen": 2591328,
"step": 422,
"train_runtime": 1836.3708,
"train_tokens_per_second": 1411.114
},
{
"epoch": 0.7230769230769231,
"grad_norm": 0.07983230799436569,
"learning_rate": 0.000128412017167382,
"loss": 0.4333,
"num_input_tokens_seen": 2597392,
"step": 423,
"train_runtime": 1840.3075,
"train_tokens_per_second": 1411.39
},
{
"epoch": 0.7247863247863248,
"grad_norm": 0.09758428484201431,
"learning_rate": 0.0001282403433476395,
"loss": 0.4846,
"num_input_tokens_seen": 2603632,
"step": 424,
"train_runtime": 1844.4191,
"train_tokens_per_second": 1411.627
},
{
"epoch": 0.7264957264957265,
"grad_norm": 0.11297962069511414,
"learning_rate": 0.000128068669527897,
"loss": 0.4252,
"num_input_tokens_seen": 2609304,
"step": 425,
"train_runtime": 1848.0395,
"train_tokens_per_second": 1411.931
},
{
"epoch": 0.7282051282051282,
"grad_norm": 0.10584045201539993,
"learning_rate": 0.00012789699570815453,
"loss": 0.3543,
"num_input_tokens_seen": 2613512,
"step": 426,
"train_runtime": 1850.9158,
"train_tokens_per_second": 1412.01
},
{
"epoch": 0.7299145299145299,
"grad_norm": 0.10154668241739273,
"learning_rate": 0.00012772532188841203,
"loss": 0.546,
"num_input_tokens_seen": 2618824,
"step": 427,
"train_runtime": 1854.4991,
"train_tokens_per_second": 1412.146
},
{
"epoch": 0.7316239316239316,
"grad_norm": 0.10194077342748642,
"learning_rate": 0.00012755364806866953,
"loss": 0.4355,
"num_input_tokens_seen": 2626440,
"step": 428,
"train_runtime": 1859.1535,
"train_tokens_per_second": 1412.707
},
{
"epoch": 0.7333333333333333,
"grad_norm": 0.059250883758068085,
"learning_rate": 0.00012738197424892704,
"loss": 0.3542,
"num_input_tokens_seen": 2640696,
"step": 429,
"train_runtime": 1867.9636,
"train_tokens_per_second": 1413.676
},
{
"epoch": 0.7350427350427351,
"grad_norm": 0.09271879494190216,
"learning_rate": 0.00012721030042918456,
"loss": 0.3714,
"num_input_tokens_seen": 2645552,
"step": 430,
"train_runtime": 1871.1549,
"train_tokens_per_second": 1413.861
},
{
"epoch": 0.7367521367521368,
"grad_norm": 0.10251565277576447,
"learning_rate": 0.00012703862660944207,
"loss": 0.402,
"num_input_tokens_seen": 2650008,
"step": 431,
"train_runtime": 1874.2478,
"train_tokens_per_second": 1413.905
},
{
"epoch": 0.7384615384615385,
"grad_norm": 0.08104413002729416,
"learning_rate": 0.00012686695278969957,
"loss": 0.3586,
"num_input_tokens_seen": 2657184,
"step": 432,
"train_runtime": 1878.7478,
"train_tokens_per_second": 1414.338
},
{
"epoch": 0.7401709401709402,
"grad_norm": 0.08250881731510162,
"learning_rate": 0.0001266952789699571,
"loss": 0.4122,
"num_input_tokens_seen": 2662408,
"step": 433,
"train_runtime": 1882.2806,
"train_tokens_per_second": 1414.459
},
{
"epoch": 0.7418803418803419,
"grad_norm": 0.08179739117622375,
"learning_rate": 0.0001265236051502146,
"loss": 0.3988,
"num_input_tokens_seen": 2668632,
"step": 434,
"train_runtime": 1886.2827,
"train_tokens_per_second": 1414.757
},
{
"epoch": 0.7435897435897436,
"grad_norm": 0.09739404171705246,
"learning_rate": 0.00012635193133047213,
"loss": 0.4507,
"num_input_tokens_seen": 2675376,
"step": 435,
"train_runtime": 1890.5915,
"train_tokens_per_second": 1415.1
},
{
"epoch": 0.7452991452991453,
"grad_norm": 0.08292689919471741,
"learning_rate": 0.0001261802575107296,
"loss": 0.344,
"num_input_tokens_seen": 2681072,
"step": 436,
"train_runtime": 1894.2808,
"train_tokens_per_second": 1415.351
},
{
"epoch": 0.747008547008547,
"grad_norm": 0.10009622573852539,
"learning_rate": 0.00012600858369098714,
"loss": 0.4121,
"num_input_tokens_seen": 2687664,
"step": 437,
"train_runtime": 1898.7144,
"train_tokens_per_second": 1415.518
},
{
"epoch": 0.7487179487179487,
"grad_norm": 0.08162456750869751,
"learning_rate": 0.00012583690987124464,
"loss": 0.38,
"num_input_tokens_seen": 2692888,
"step": 438,
"train_runtime": 1902.2857,
"train_tokens_per_second": 1415.607
},
{
"epoch": 0.7504273504273504,
"grad_norm": 0.10055331140756607,
"learning_rate": 0.00012566523605150217,
"loss": 0.5579,
"num_input_tokens_seen": 2698192,
"step": 439,
"train_runtime": 1905.8783,
"train_tokens_per_second": 1415.721
},
{
"epoch": 0.7521367521367521,
"grad_norm": 0.08599859476089478,
"learning_rate": 0.00012549356223175964,
"loss": 0.4105,
"num_input_tokens_seen": 2706400,
"step": 440,
"train_runtime": 1911.01,
"train_tokens_per_second": 1416.214
},
{
"epoch": 0.7538461538461538,
"grad_norm": 0.10321099311113358,
"learning_rate": 0.00012532188841201717,
"loss": 0.5507,
"num_input_tokens_seen": 2711248,
"step": 441,
"train_runtime": 1914.2832,
"train_tokens_per_second": 1416.325
},
{
"epoch": 0.7555555555555555,
"grad_norm": 0.08138895779848099,
"learning_rate": 0.0001251502145922747,
"loss": 0.3421,
"num_input_tokens_seen": 2717984,
"step": 442,
"train_runtime": 1918.6058,
"train_tokens_per_second": 1416.645
},
{
"epoch": 0.7572649572649572,
"grad_norm": 0.09042924642562866,
"learning_rate": 0.0001249785407725322,
"loss": 0.4009,
"num_input_tokens_seen": 2724304,
"step": 443,
"train_runtime": 1922.6265,
"train_tokens_per_second": 1416.97
},
{
"epoch": 0.7589743589743589,
"grad_norm": 0.08353422582149506,
"learning_rate": 0.0001248068669527897,
"loss": 0.5339,
"num_input_tokens_seen": 2730536,
"step": 444,
"train_runtime": 1926.6415,
"train_tokens_per_second": 1417.252
},
{
"epoch": 0.7606837606837606,
"grad_norm": 0.08057735860347748,
"learning_rate": 0.0001246351931330472,
"loss": 0.2139,
"num_input_tokens_seen": 2739592,
"step": 445,
"train_runtime": 1932.3746,
"train_tokens_per_second": 1417.733
},
{
"epoch": 0.7623931623931623,
"grad_norm": 0.08368086814880371,
"learning_rate": 0.00012446351931330474,
"loss": 0.4547,
"num_input_tokens_seen": 2746472,
"step": 446,
"train_runtime": 1936.8148,
"train_tokens_per_second": 1418.035
},
{
"epoch": 0.764102564102564,
"grad_norm": 0.09206908941268921,
"learning_rate": 0.00012429184549356224,
"loss": 0.364,
"num_input_tokens_seen": 2752544,
"step": 447,
"train_runtime": 1940.8003,
"train_tokens_per_second": 1418.252
},
{
"epoch": 0.7658119658119659,
"grad_norm": 0.09689074009656906,
"learning_rate": 0.00012412017167381974,
"loss": 0.3698,
"num_input_tokens_seen": 2756232,
"step": 448,
"train_runtime": 1943.3995,
"train_tokens_per_second": 1418.253
},
{
"epoch": 0.7675213675213676,
"grad_norm": 0.11510168761014938,
"learning_rate": 0.00012394849785407725,
"loss": 0.4782,
"num_input_tokens_seen": 2763704,
"step": 449,
"train_runtime": 1948.0738,
"train_tokens_per_second": 1418.685
},
{
"epoch": 0.7692307692307693,
"grad_norm": 0.10438208281993866,
"learning_rate": 0.00012377682403433477,
"loss": 0.4068,
"num_input_tokens_seen": 2771048,
"step": 450,
"train_runtime": 1952.7876,
"train_tokens_per_second": 1419.022
},
{
"epoch": 0.770940170940171,
"grad_norm": 0.09076783806085587,
"learning_rate": 0.0001236051502145923,
"loss": 0.4336,
"num_input_tokens_seen": 2776848,
"step": 451,
"train_runtime": 1958.6056,
"train_tokens_per_second": 1417.768
},
{
"epoch": 0.7726495726495727,
"grad_norm": 0.09839843213558197,
"learning_rate": 0.00012343347639484978,
"loss": 0.4169,
"num_input_tokens_seen": 2781392,
"step": 452,
"train_runtime": 1961.7188,
"train_tokens_per_second": 1417.834
},
{
"epoch": 0.7743589743589744,
"grad_norm": 0.11131442338228226,
"learning_rate": 0.0001232618025751073,
"loss": 0.3881,
"num_input_tokens_seen": 2785736,
"step": 453,
"train_runtime": 1964.6246,
"train_tokens_per_second": 1417.948
},
{
"epoch": 0.7760683760683761,
"grad_norm": 0.09070441126823425,
"learning_rate": 0.0001230901287553648,
"loss": 0.399,
"num_input_tokens_seen": 2790968,
"step": 454,
"train_runtime": 1968.1511,
"train_tokens_per_second": 1418.066
},
{
"epoch": 0.7777777777777778,
"grad_norm": 0.09357093274593353,
"learning_rate": 0.00012291845493562234,
"loss": 0.4989,
"num_input_tokens_seen": 2795968,
"step": 455,
"train_runtime": 1971.5124,
"train_tokens_per_second": 1418.184
},
{
"epoch": 0.7794871794871795,
"grad_norm": 0.08152603358030319,
"learning_rate": 0.00012274678111587982,
"loss": 0.397,
"num_input_tokens_seen": 2801968,
"step": 456,
"train_runtime": 1975.4058,
"train_tokens_per_second": 1418.427
},
{
"epoch": 0.7811965811965812,
"grad_norm": 0.08832139521837234,
"learning_rate": 0.00012257510729613735,
"loss": 0.4593,
"num_input_tokens_seen": 2806896,
"step": 457,
"train_runtime": 1978.6286,
"train_tokens_per_second": 1418.607
},
{
"epoch": 0.7829059829059829,
"grad_norm": 0.09871666878461838,
"learning_rate": 0.00012240343347639485,
"loss": 0.5688,
"num_input_tokens_seen": 2811904,
"step": 458,
"train_runtime": 1981.985,
"train_tokens_per_second": 1418.731
},
{
"epoch": 0.7846153846153846,
"grad_norm": 0.08846089243888855,
"learning_rate": 0.00012223175965665238,
"loss": 0.3872,
"num_input_tokens_seen": 2817760,
"step": 459,
"train_runtime": 1985.7982,
"train_tokens_per_second": 1418.956
},
{
"epoch": 0.7863247863247863,
"grad_norm": 0.07381941378116608,
"learning_rate": 0.0001220600858369099,
"loss": 0.397,
"num_input_tokens_seen": 2828936,
"step": 460,
"train_runtime": 1992.6291,
"train_tokens_per_second": 1419.7
},
{
"epoch": 0.788034188034188,
"grad_norm": 0.0786755383014679,
"learning_rate": 0.00012188841201716738,
"loss": 0.3676,
"num_input_tokens_seen": 2834352,
"step": 461,
"train_runtime": 1996.1137,
"train_tokens_per_second": 1419.935
},
{
"epoch": 0.7897435897435897,
"grad_norm": 0.09888231754302979,
"learning_rate": 0.00012171673819742491,
"loss": 0.6124,
"num_input_tokens_seen": 2839672,
"step": 462,
"train_runtime": 1999.6256,
"train_tokens_per_second": 1420.102
},
{
"epoch": 0.7914529914529914,
"grad_norm": 0.07366322726011276,
"learning_rate": 0.0001215450643776824,
"loss": 0.3307,
"num_input_tokens_seen": 2845376,
"step": 463,
"train_runtime": 2003.3598,
"train_tokens_per_second": 1420.302
},
{
"epoch": 0.7931623931623931,
"grad_norm": 0.10405825823545456,
"learning_rate": 0.00012137339055793993,
"loss": 0.5077,
"num_input_tokens_seen": 2850056,
"step": 464,
"train_runtime": 2006.5829,
"train_tokens_per_second": 1420.353
},
{
"epoch": 0.7948717948717948,
"grad_norm": 0.0754900574684143,
"learning_rate": 0.00012120171673819742,
"loss": 0.2874,
"num_input_tokens_seen": 2856648,
"step": 465,
"train_runtime": 2010.8653,
"train_tokens_per_second": 1420.606
},
{
"epoch": 0.7965811965811965,
"grad_norm": 0.08353781700134277,
"learning_rate": 0.00012103004291845495,
"loss": 0.3667,
"num_input_tokens_seen": 2862632,
"step": 466,
"train_runtime": 2014.8034,
"train_tokens_per_second": 1420.8
},
{
"epoch": 0.7982905982905983,
"grad_norm": 0.07881499826908112,
"learning_rate": 0.00012085836909871244,
"loss": 0.6024,
"num_input_tokens_seen": 2870288,
"step": 467,
"train_runtime": 2019.6398,
"train_tokens_per_second": 1421.188
},
{
"epoch": 0.8,
"grad_norm": 0.08371937274932861,
"learning_rate": 0.00012068669527896997,
"loss": 0.3757,
"num_input_tokens_seen": 2876552,
"step": 468,
"train_runtime": 2023.5632,
"train_tokens_per_second": 1421.528
},
{
"epoch": 0.8,
"eval_loss": 0.3975943326950073,
"eval_runtime": 40.2348,
"eval_samples_per_second": 24.804,
"eval_steps_per_second": 3.107,
"num_input_tokens_seen": 2876552,
"step": 468
},
{
"epoch": 0.8017094017094017,
"grad_norm": 0.09587102383375168,
"learning_rate": 0.00012051502145922748,
"loss": 0.4033,
"num_input_tokens_seen": 2880952,
"step": 469,
"train_runtime": 2066.7148,
"train_tokens_per_second": 1393.977
},
{
"epoch": 0.8034188034188035,
"grad_norm": 0.07546790689229965,
"learning_rate": 0.00012034334763948498,
"loss": 0.295,
"num_input_tokens_seen": 2888184,
"step": 470,
"train_runtime": 2071.1851,
"train_tokens_per_second": 1394.46
},
{
"epoch": 0.8051282051282052,
"grad_norm": 0.10362780094146729,
"learning_rate": 0.0001201716738197425,
"loss": 0.3668,
"num_input_tokens_seen": 2899416,
"step": 471,
"train_runtime": 2078.0557,
"train_tokens_per_second": 1395.254
},
{
"epoch": 0.8068376068376069,
"grad_norm": 0.07979272305965424,
"learning_rate": 0.00012,
"loss": 0.3491,
"num_input_tokens_seen": 2904592,
"step": 472,
"train_runtime": 2081.4118,
"train_tokens_per_second": 1395.491
},
{
"epoch": 0.8085470085470086,
"grad_norm": 0.08196493983268738,
"learning_rate": 0.00011982832618025752,
"loss": 0.3491,
"num_input_tokens_seen": 2909616,
"step": 473,
"train_runtime": 2084.8475,
"train_tokens_per_second": 1395.601
},
{
"epoch": 0.8102564102564103,
"grad_norm": 0.10573233664035797,
"learning_rate": 0.00011965665236051502,
"loss": 0.4396,
"num_input_tokens_seen": 2913824,
"step": 474,
"train_runtime": 2087.7209,
"train_tokens_per_second": 1395.696
},
{
"epoch": 0.811965811965812,
"grad_norm": 0.11220520734786987,
"learning_rate": 0.00011948497854077254,
"loss": 0.4309,
"num_input_tokens_seen": 2920208,
"step": 475,
"train_runtime": 2091.7609,
"train_tokens_per_second": 1396.052
},
{
"epoch": 0.8136752136752137,
"grad_norm": 0.07423815131187439,
"learning_rate": 0.00011931330472103004,
"loss": 0.338,
"num_input_tokens_seen": 2926144,
"step": 476,
"train_runtime": 2095.6855,
"train_tokens_per_second": 1396.271
},
{
"epoch": 0.8153846153846154,
"grad_norm": 0.07826936990022659,
"learning_rate": 0.00011914163090128756,
"loss": 0.3758,
"num_input_tokens_seen": 2933112,
"step": 477,
"train_runtime": 2100.1257,
"train_tokens_per_second": 1396.636
},
{
"epoch": 0.8170940170940171,
"grad_norm": 0.10059487074613571,
"learning_rate": 0.00011896995708154509,
"loss": 0.4095,
"num_input_tokens_seen": 2940512,
"step": 478,
"train_runtime": 2104.7295,
"train_tokens_per_second": 1397.097
},
{
"epoch": 0.8188034188034188,
"grad_norm": 0.10775360465049744,
"learning_rate": 0.00011879828326180257,
"loss": 0.4641,
"num_input_tokens_seen": 2946016,
"step": 479,
"train_runtime": 2108.2514,
"train_tokens_per_second": 1397.374
},
{
"epoch": 0.8205128205128205,
"grad_norm": 0.08371871709823608,
"learning_rate": 0.0001186266094420601,
"loss": 0.4006,
"num_input_tokens_seen": 2950256,
"step": 480,
"train_runtime": 2111.2163,
"train_tokens_per_second": 1397.42
},
{
"epoch": 0.8222222222222222,
"grad_norm": 0.09858489036560059,
"learning_rate": 0.00011845493562231759,
"loss": 0.4827,
"num_input_tokens_seen": 2954528,
"step": 481,
"train_runtime": 2116.2112,
"train_tokens_per_second": 1396.14
},
{
"epoch": 0.8239316239316239,
"grad_norm": 0.10172171145677567,
"learning_rate": 0.00011828326180257512,
"loss": 0.4265,
"num_input_tokens_seen": 2959568,
"step": 482,
"train_runtime": 2119.6177,
"train_tokens_per_second": 1396.274
},
{
"epoch": 0.8256410256410256,
"grad_norm": 0.07476787269115448,
"learning_rate": 0.00011811158798283261,
"loss": 0.426,
"num_input_tokens_seen": 2969808,
"step": 483,
"train_runtime": 2125.8709,
"train_tokens_per_second": 1396.984
},
{
"epoch": 0.8273504273504273,
"grad_norm": 0.1218891367316246,
"learning_rate": 0.00011793991416309014,
"loss": 0.4376,
"num_input_tokens_seen": 2975584,
"step": 484,
"train_runtime": 2129.7262,
"train_tokens_per_second": 1397.167
},
{
"epoch": 0.8290598290598291,
"grad_norm": 0.09157467633485794,
"learning_rate": 0.00011776824034334764,
"loss": 0.4647,
"num_input_tokens_seen": 2983568,
"step": 485,
"train_runtime": 2134.8436,
"train_tokens_per_second": 1397.558
},
{
"epoch": 0.8307692307692308,
"grad_norm": 0.08052816987037659,
"learning_rate": 0.00011759656652360516,
"loss": 0.34,
"num_input_tokens_seen": 2990136,
"step": 486,
"train_runtime": 2139.0965,
"train_tokens_per_second": 1397.85
},
{
"epoch": 0.8324786324786325,
"grad_norm": 0.09681648761034012,
"learning_rate": 0.00011742489270386267,
"loss": 0.5222,
"num_input_tokens_seen": 2995648,
"step": 487,
"train_runtime": 2142.6907,
"train_tokens_per_second": 1398.078
},
{
"epoch": 0.8341880341880342,
"grad_norm": 0.09712634235620499,
"learning_rate": 0.00011725321888412018,
"loss": 0.4272,
"num_input_tokens_seen": 2999936,
"step": 488,
"train_runtime": 2145.6273,
"train_tokens_per_second": 1398.163
},
{
"epoch": 0.8358974358974359,
"grad_norm": 0.08245320618152618,
"learning_rate": 0.00011708154506437769,
"loss": 0.4377,
"num_input_tokens_seen": 3006392,
"step": 489,
"train_runtime": 2149.8266,
"train_tokens_per_second": 1398.435
},
{
"epoch": 0.8376068376068376,
"grad_norm": 0.09992548078298569,
"learning_rate": 0.0001169098712446352,
"loss": 0.4934,
"num_input_tokens_seen": 3012312,
"step": 490,
"train_runtime": 2153.6393,
"train_tokens_per_second": 1398.708
},
{
"epoch": 0.8393162393162393,
"grad_norm": 0.08246449381113052,
"learning_rate": 0.00011673819742489271,
"loss": 0.4387,
"num_input_tokens_seen": 3019104,
"step": 491,
"train_runtime": 2158.108,
"train_tokens_per_second": 1398.959
},
{
"epoch": 0.841025641025641,
"grad_norm": 0.08337292075157166,
"learning_rate": 0.00011656652360515021,
"loss": 0.4912,
"num_input_tokens_seen": 3025664,
"step": 492,
"train_runtime": 2162.3996,
"train_tokens_per_second": 1399.216
},
{
"epoch": 0.8427350427350427,
"grad_norm": 0.06182870268821716,
"learning_rate": 0.00011639484978540773,
"loss": 0.3326,
"num_input_tokens_seen": 3033776,
"step": 493,
"train_runtime": 2167.5232,
"train_tokens_per_second": 1399.651
},
{
"epoch": 0.8444444444444444,
"grad_norm": 0.09150062501430511,
"learning_rate": 0.00011622317596566523,
"loss": 0.4187,
"num_input_tokens_seen": 3038744,
"step": 494,
"train_runtime": 2170.893,
"train_tokens_per_second": 1399.767
},
{
"epoch": 0.8461538461538461,
"grad_norm": 0.06586892902851105,
"learning_rate": 0.00011605150214592275,
"loss": 0.271,
"num_input_tokens_seen": 3046920,
"step": 495,
"train_runtime": 2176.1904,
"train_tokens_per_second": 1400.116
},
{
"epoch": 0.8478632478632478,
"grad_norm": 0.0771869495511055,
"learning_rate": 0.00011587982832618028,
"loss": 0.3341,
"num_input_tokens_seen": 3057816,
"step": 496,
"train_runtime": 2182.8707,
"train_tokens_per_second": 1400.823
},
{
"epoch": 0.8495726495726496,
"grad_norm": 0.07207699120044708,
"learning_rate": 0.00011570815450643777,
"loss": 0.3464,
"num_input_tokens_seen": 3064472,
"step": 497,
"train_runtime": 2187.2355,
"train_tokens_per_second": 1401.071
},
{
"epoch": 0.8512820512820513,
"grad_norm": 0.087531179189682,
"learning_rate": 0.0001155364806866953,
"loss": 0.4572,
"num_input_tokens_seen": 3069264,
"step": 498,
"train_runtime": 2190.4257,
"train_tokens_per_second": 1401.218
},
{
"epoch": 0.852991452991453,
"grad_norm": 0.07901884615421295,
"learning_rate": 0.00011536480686695278,
"loss": 0.3738,
"num_input_tokens_seen": 3075112,
"step": 499,
"train_runtime": 2194.3188,
"train_tokens_per_second": 1401.397
},
{
"epoch": 0.8547008547008547,
"grad_norm": 0.0702543780207634,
"learning_rate": 0.00011519313304721031,
"loss": 0.3385,
"num_input_tokens_seen": 3081824,
"step": 500,
"train_runtime": 2198.62,
"train_tokens_per_second": 1401.708
},
{
"epoch": 0.8564102564102564,
"grad_norm": 0.06980577856302261,
"learning_rate": 0.00011502145922746782,
"loss": 0.3095,
"num_input_tokens_seen": 3090464,
"step": 501,
"train_runtime": 2203.9777,
"train_tokens_per_second": 1402.221
},
{
"epoch": 0.8581196581196581,
"grad_norm": 0.08610618114471436,
"learning_rate": 0.00011484978540772533,
"loss": 0.3978,
"num_input_tokens_seen": 3096072,
"step": 502,
"train_runtime": 2207.7148,
"train_tokens_per_second": 1402.388
},
{
"epoch": 0.8598290598290599,
"grad_norm": 0.09656289964914322,
"learning_rate": 0.00011467811158798283,
"loss": 0.4409,
"num_input_tokens_seen": 3100552,
"step": 503,
"train_runtime": 2210.8981,
"train_tokens_per_second": 1402.395
},
{
"epoch": 0.8615384615384616,
"grad_norm": 0.09101828932762146,
"learning_rate": 0.00011450643776824035,
"loss": 0.3892,
"num_input_tokens_seen": 3105368,
"step": 504,
"train_runtime": 2214.1665,
"train_tokens_per_second": 1402.5
},
{
"epoch": 0.8632478632478633,
"grad_norm": 0.08322126418352127,
"learning_rate": 0.00011433476394849787,
"loss": 0.4806,
"num_input_tokens_seen": 3112744,
"step": 505,
"train_runtime": 2218.8487,
"train_tokens_per_second": 1402.864
},
{
"epoch": 0.864957264957265,
"grad_norm": 0.07923685014247894,
"learning_rate": 0.00011416309012875537,
"loss": 0.4667,
"num_input_tokens_seen": 3119008,
"step": 506,
"train_runtime": 2222.9295,
"train_tokens_per_second": 1403.107
},
{
"epoch": 0.8666666666666667,
"grad_norm": 0.08297446370124817,
"learning_rate": 0.00011399141630901288,
"loss": 0.4381,
"num_input_tokens_seen": 3126120,
"step": 507,
"train_runtime": 2227.4066,
"train_tokens_per_second": 1403.48
},
{
"epoch": 0.8683760683760684,
"grad_norm": 0.09984984993934631,
"learning_rate": 0.00011381974248927039,
"loss": 0.5017,
"num_input_tokens_seen": 3131432,
"step": 508,
"train_runtime": 2230.9301,
"train_tokens_per_second": 1403.644
},
{
"epoch": 0.8700854700854701,
"grad_norm": 0.07992815226316452,
"learning_rate": 0.0001136480686695279,
"loss": 0.3426,
"num_input_tokens_seen": 3137440,
"step": 509,
"train_runtime": 2234.8499,
"train_tokens_per_second": 1403.871
},
{
"epoch": 0.8717948717948718,
"grad_norm": 0.09450999647378922,
"learning_rate": 0.0001134763948497854,
"loss": 0.417,
"num_input_tokens_seen": 3142752,
"step": 510,
"train_runtime": 2238.3582,
"train_tokens_per_second": 1404.043
},
{
"epoch": 0.8735042735042735,
"grad_norm": 0.09634573012590408,
"learning_rate": 0.00011330472103004292,
"loss": 0.4263,
"num_input_tokens_seen": 3147904,
"step": 511,
"train_runtime": 2244.2827,
"train_tokens_per_second": 1402.633
},
{
"epoch": 0.8752136752136752,
"grad_norm": 0.08692895621061325,
"learning_rate": 0.00011313304721030042,
"loss": 0.4547,
"num_input_tokens_seen": 3155136,
"step": 512,
"train_runtime": 2248.902,
"train_tokens_per_second": 1402.967
},
{
"epoch": 0.8769230769230769,
"grad_norm": 0.09777207672595978,
"learning_rate": 0.00011296137339055794,
"loss": 0.391,
"num_input_tokens_seen": 3161728,
"step": 513,
"train_runtime": 2253.1795,
"train_tokens_per_second": 1403.23
},
{
"epoch": 0.8786324786324786,
"grad_norm": 0.06957412511110306,
"learning_rate": 0.00011278969957081547,
"loss": 0.4446,
"num_input_tokens_seen": 3168800,
"step": 514,
"train_runtime": 2257.7407,
"train_tokens_per_second": 1403.527
},
{
"epoch": 0.8803418803418803,
"grad_norm": 0.09542404860258102,
"learning_rate": 0.00011261802575107297,
"loss": 0.4259,
"num_input_tokens_seen": 3175224,
"step": 515,
"train_runtime": 2261.9216,
"train_tokens_per_second": 1403.773
},
{
"epoch": 0.882051282051282,
"grad_norm": 0.08433569967746735,
"learning_rate": 0.00011244635193133049,
"loss": 0.3827,
"num_input_tokens_seen": 3181096,
"step": 516,
"train_runtime": 2265.8164,
"train_tokens_per_second": 1403.951
},
{
"epoch": 0.8837606837606837,
"grad_norm": 0.06952463835477829,
"learning_rate": 0.00011227467811158799,
"loss": 0.282,
"num_input_tokens_seen": 3186880,
"step": 517,
"train_runtime": 2269.6547,
"train_tokens_per_second": 1404.125
},
{
"epoch": 0.8854700854700854,
"grad_norm": 0.12418562173843384,
"learning_rate": 0.0001121030042918455,
"loss": 0.3922,
"num_input_tokens_seen": 3194480,
"step": 518,
"train_runtime": 2274.5284,
"train_tokens_per_second": 1404.458
},
{
"epoch": 0.8871794871794871,
"grad_norm": 0.10115774720907211,
"learning_rate": 0.00011193133047210301,
"loss": 0.4714,
"num_input_tokens_seen": 3200424,
"step": 519,
"train_runtime": 2278.4811,
"train_tokens_per_second": 1404.631
},
{
"epoch": 0.8888888888888888,
"grad_norm": 0.09031491726636887,
"learning_rate": 0.00011175965665236052,
"loss": 0.4023,
"num_input_tokens_seen": 3205768,
"step": 520,
"train_runtime": 2282.1166,
"train_tokens_per_second": 1404.735
},
{
"epoch": 0.8905982905982905,
"grad_norm": 0.08610999584197998,
"learning_rate": 0.00011158798283261803,
"loss": 0.3608,
"num_input_tokens_seen": 3212416,
"step": 521,
"train_runtime": 2286.4575,
"train_tokens_per_second": 1404.975
},
{
"epoch": 0.8923076923076924,
"grad_norm": 0.0851425752043724,
"learning_rate": 0.00011141630901287554,
"loss": 0.4337,
"num_input_tokens_seen": 3217720,
"step": 522,
"train_runtime": 2290.031,
"train_tokens_per_second": 1405.099
},
{
"epoch": 0.8940170940170941,
"grad_norm": 0.07973898947238922,
"learning_rate": 0.00011124463519313306,
"loss": 0.3752,
"num_input_tokens_seen": 3222528,
"step": 523,
"train_runtime": 2293.2223,
"train_tokens_per_second": 1405.24
},
{
"epoch": 0.8957264957264958,
"grad_norm": 0.0735258162021637,
"learning_rate": 0.00011107296137339056,
"loss": 0.2528,
"num_input_tokens_seen": 3228424,
"step": 524,
"train_runtime": 2297.1669,
"train_tokens_per_second": 1405.394
},
{
"epoch": 0.8974358974358975,
"grad_norm": 0.08155602961778641,
"learning_rate": 0.00011090128755364808,
"loss": 0.3476,
"num_input_tokens_seen": 3233072,
"step": 525,
"train_runtime": 2300.3205,
"train_tokens_per_second": 1405.488
},
{
"epoch": 0.8991452991452992,
"grad_norm": 0.12425163388252258,
"learning_rate": 0.00011072961373390558,
"loss": 0.4724,
"num_input_tokens_seen": 3237264,
"step": 526,
"train_runtime": 2303.2241,
"train_tokens_per_second": 1405.536
},
{
"epoch": 0.9008547008547009,
"grad_norm": 0.10108618438243866,
"learning_rate": 0.0001105579399141631,
"loss": 0.4843,
"num_input_tokens_seen": 3241480,
"step": 527,
"train_runtime": 2306.1928,
"train_tokens_per_second": 1405.555
},
{
"epoch": 0.9025641025641026,
"grad_norm": 0.10584156215190887,
"learning_rate": 0.0001103862660944206,
"loss": 0.4872,
"num_input_tokens_seen": 3246152,
"step": 528,
"train_runtime": 2309.4182,
"train_tokens_per_second": 1405.615
},
{
"epoch": 0.9042735042735043,
"grad_norm": 0.07442856580018997,
"learning_rate": 0.00011021459227467811,
"loss": 0.3933,
"num_input_tokens_seen": 3253160,
"step": 529,
"train_runtime": 2313.9463,
"train_tokens_per_second": 1405.893
},
{
"epoch": 0.905982905982906,
"grad_norm": 0.08017449080944061,
"learning_rate": 0.00011004291845493561,
"loss": 0.3851,
"num_input_tokens_seen": 3260120,
"step": 530,
"train_runtime": 2318.4343,
"train_tokens_per_second": 1406.173
},
{
"epoch": 0.9076923076923077,
"grad_norm": 0.08193705230951309,
"learning_rate": 0.00010987124463519314,
"loss": 0.4319,
"num_input_tokens_seen": 3265248,
"step": 531,
"train_runtime": 2321.9214,
"train_tokens_per_second": 1406.27
},
{
"epoch": 0.9094017094017094,
"grad_norm": 0.10451549291610718,
"learning_rate": 0.00010969957081545066,
"loss": 0.468,
"num_input_tokens_seen": 3271504,
"step": 532,
"train_runtime": 2325.9367,
"train_tokens_per_second": 1406.532
},
{
"epoch": 0.9111111111111111,
"grad_norm": 0.08480311930179596,
"learning_rate": 0.00010952789699570816,
"loss": 0.3204,
"num_input_tokens_seen": 3277336,
"step": 533,
"train_runtime": 2329.8184,
"train_tokens_per_second": 1406.692
},
{
"epoch": 0.9128205128205128,
"grad_norm": 0.11771999299526215,
"learning_rate": 0.00010935622317596568,
"loss": 0.4402,
"num_input_tokens_seen": 3281200,
"step": 534,
"train_runtime": 2332.5771,
"train_tokens_per_second": 1406.684
},
{
"epoch": 0.9145299145299145,
"grad_norm": 0.09482161700725555,
"learning_rate": 0.00010918454935622318,
"loss": 0.4203,
"num_input_tokens_seen": 3288080,
"step": 535,
"train_runtime": 2336.9908,
"train_tokens_per_second": 1406.972
},
{
"epoch": 0.9162393162393162,
"grad_norm": 0.08046115934848785,
"learning_rate": 0.0001090128755364807,
"loss": 0.3672,
"num_input_tokens_seen": 3295160,
"step": 536,
"train_runtime": 2341.5133,
"train_tokens_per_second": 1407.278
},
{
"epoch": 0.9179487179487179,
"grad_norm": 0.0700264498591423,
"learning_rate": 0.0001088412017167382,
"loss": 0.4366,
"num_input_tokens_seen": 3304208,
"step": 537,
"train_runtime": 2347.0429,
"train_tokens_per_second": 1407.817
},
{
"epoch": 0.9196581196581196,
"grad_norm": 0.0773264542222023,
"learning_rate": 0.00010866952789699572,
"loss": 0.3111,
"num_input_tokens_seen": 3311160,
"step": 538,
"train_runtime": 2351.412,
"train_tokens_per_second": 1408.158
},
{
"epoch": 0.9213675213675213,
"grad_norm": 0.09096362441778183,
"learning_rate": 0.00010849785407725322,
"loss": 0.3933,
"num_input_tokens_seen": 3315912,
"step": 539,
"train_runtime": 2354.6076,
"train_tokens_per_second": 1408.265
},
{
"epoch": 0.9230769230769231,
"grad_norm": 0.07224144041538239,
"learning_rate": 0.00010832618025751073,
"loss": 0.3323,
"num_input_tokens_seen": 3324072,
"step": 540,
"train_runtime": 2359.683,
"train_tokens_per_second": 1408.694
},
{
"epoch": 0.9247863247863248,
"grad_norm": 0.0825057327747345,
"learning_rate": 0.00010815450643776825,
"loss": 0.3806,
"num_input_tokens_seen": 3328808,
"step": 541,
"train_runtime": 2364.9808,
"train_tokens_per_second": 1407.541
},
{
"epoch": 0.9264957264957265,
"grad_norm": 0.09786176681518555,
"learning_rate": 0.00010798283261802575,
"loss": 0.3953,
"num_input_tokens_seen": 3339576,
"step": 542,
"train_runtime": 2371.5338,
"train_tokens_per_second": 1408.192
},
{
"epoch": 0.9282051282051282,
"grad_norm": 0.08032157272100449,
"learning_rate": 0.00010781115879828327,
"loss": 0.3554,
"num_input_tokens_seen": 3346712,
"step": 543,
"train_runtime": 2376.1571,
"train_tokens_per_second": 1408.456
},
{
"epoch": 0.9299145299145299,
"grad_norm": 0.07897566258907318,
"learning_rate": 0.00010763948497854077,
"loss": 0.4126,
"num_input_tokens_seen": 3352832,
"step": 544,
"train_runtime": 2380.1411,
"train_tokens_per_second": 1408.669
},
{
"epoch": 0.9316239316239316,
"grad_norm": 0.09934298694133759,
"learning_rate": 0.0001074678111587983,
"loss": 0.402,
"num_input_tokens_seen": 3357992,
"step": 545,
"train_runtime": 2383.715,
"train_tokens_per_second": 1408.722
},
{
"epoch": 0.9333333333333333,
"grad_norm": 0.11830101907253265,
"learning_rate": 0.00010729613733905579,
"loss": 0.3796,
"num_input_tokens_seen": 3363672,
"step": 546,
"train_runtime": 2387.4938,
"train_tokens_per_second": 1408.871
},
{
"epoch": 0.935042735042735,
"grad_norm": 0.09613929688930511,
"learning_rate": 0.00010712446351931332,
"loss": 0.4991,
"num_input_tokens_seen": 3368520,
"step": 547,
"train_runtime": 2390.7547,
"train_tokens_per_second": 1408.978
},
{
"epoch": 0.9367521367521368,
"grad_norm": 0.08919502049684525,
"learning_rate": 0.0001069527896995708,
"loss": 0.3698,
"num_input_tokens_seen": 3373184,
"step": 548,
"train_runtime": 2393.9857,
"train_tokens_per_second": 1409.024
},
{
"epoch": 0.9384615384615385,
"grad_norm": 0.09076035767793655,
"learning_rate": 0.00010678111587982834,
"loss": 0.541,
"num_input_tokens_seen": 3378288,
"step": 549,
"train_runtime": 2397.3665,
"train_tokens_per_second": 1409.166
},
{
"epoch": 0.9401709401709402,
"grad_norm": 0.07492446899414062,
"learning_rate": 0.00010660944206008585,
"loss": 0.4197,
"num_input_tokens_seen": 3385600,
"step": 550,
"train_runtime": 2402.0343,
"train_tokens_per_second": 1409.472
},
{
"epoch": 0.9418803418803419,
"grad_norm": 0.09239984303712845,
"learning_rate": 0.00010643776824034335,
"loss": 0.4034,
"num_input_tokens_seen": 3390528,
"step": 551,
"train_runtime": 2405.2548,
"train_tokens_per_second": 1409.634
},
{
"epoch": 0.9435897435897436,
"grad_norm": 0.0913330614566803,
"learning_rate": 0.00010626609442060087,
"loss": 0.3552,
"num_input_tokens_seen": 3396984,
"step": 552,
"train_runtime": 2409.3976,
"train_tokens_per_second": 1409.889
},
{
"epoch": 0.9452991452991453,
"grad_norm": 0.07622038573026657,
"learning_rate": 0.00010609442060085837,
"loss": 0.4532,
"num_input_tokens_seen": 3404064,
"step": 553,
"train_runtime": 2413.8636,
"train_tokens_per_second": 1410.214
},
{
"epoch": 0.947008547008547,
"grad_norm": 0.08276895433664322,
"learning_rate": 0.00010592274678111589,
"loss": 0.4015,
"num_input_tokens_seen": 3411192,
"step": 554,
"train_runtime": 2418.3946,
"train_tokens_per_second": 1410.519
},
{
"epoch": 0.9487179487179487,
"grad_norm": 0.11180777847766876,
"learning_rate": 0.00010575107296137339,
"loss": 0.3798,
"num_input_tokens_seen": 3416296,
"step": 555,
"train_runtime": 2421.8251,
"train_tokens_per_second": 1410.629
},
{
"epoch": 0.9504273504273504,
"grad_norm": 0.08645719289779663,
"learning_rate": 0.0001055793991416309,
"loss": 0.3381,
"num_input_tokens_seen": 3422928,
"step": 556,
"train_runtime": 2426.0854,
"train_tokens_per_second": 1410.885
},
{
"epoch": 0.9521367521367521,
"grad_norm": 0.0832013487815857,
"learning_rate": 0.00010540772532188841,
"loss": 0.4564,
"num_input_tokens_seen": 3429968,
"step": 557,
"train_runtime": 2430.5605,
"train_tokens_per_second": 1411.184
},
{
"epoch": 0.9538461538461539,
"grad_norm": 0.0959947481751442,
"learning_rate": 0.00010523605150214593,
"loss": 0.3677,
"num_input_tokens_seen": 3436672,
"step": 558,
"train_runtime": 2434.8462,
"train_tokens_per_second": 1411.453
},
{
"epoch": 0.9555555555555556,
"grad_norm": 0.11064450442790985,
"learning_rate": 0.00010506437768240344,
"loss": 0.4121,
"num_input_tokens_seen": 3445016,
"step": 559,
"train_runtime": 2439.9861,
"train_tokens_per_second": 1411.9
},
{
"epoch": 0.9572649572649573,
"grad_norm": 0.0816698893904686,
"learning_rate": 0.00010489270386266094,
"loss": 0.3565,
"num_input_tokens_seen": 3452888,
"step": 560,
"train_runtime": 2444.9883,
"train_tokens_per_second": 1412.231
},
{
"epoch": 0.958974358974359,
"grad_norm": 0.07744520902633667,
"learning_rate": 0.00010472103004291847,
"loss": 0.3107,
"num_input_tokens_seen": 3458640,
"step": 561,
"train_runtime": 2448.7297,
"train_tokens_per_second": 1412.422
},
{
"epoch": 0.9606837606837607,
"grad_norm": 0.08622029423713684,
"learning_rate": 0.00010454935622317596,
"loss": 0.4368,
"num_input_tokens_seen": 3465472,
"step": 562,
"train_runtime": 2453.114,
"train_tokens_per_second": 1412.683
},
{
"epoch": 0.9623931623931624,
"grad_norm": 0.13964629173278809,
"learning_rate": 0.00010437768240343349,
"loss": 0.3164,
"num_input_tokens_seen": 3469568,
"step": 563,
"train_runtime": 2456.0226,
"train_tokens_per_second": 1412.678
},
{
"epoch": 0.9641025641025641,
"grad_norm": 0.07157761603593826,
"learning_rate": 0.00010420600858369098,
"loss": 0.2602,
"num_input_tokens_seen": 3488040,
"step": 564,
"train_runtime": 2474.1915,
"train_tokens_per_second": 1409.77
},
{
"epoch": 0.9658119658119658,
"grad_norm": 0.08262784779071808,
"learning_rate": 0.00010403433476394851,
"loss": 0.5607,
"num_input_tokens_seen": 3493808,
"step": 565,
"train_runtime": 2478.017,
"train_tokens_per_second": 1409.921
},
{
"epoch": 0.9675213675213675,
"grad_norm": 0.07769016921520233,
"learning_rate": 0.000103862660944206,
"loss": 0.3689,
"num_input_tokens_seen": 3501520,
"step": 566,
"train_runtime": 2482.9061,
"train_tokens_per_second": 1410.251
},
{
"epoch": 0.9692307692307692,
"grad_norm": 0.08556525409221649,
"learning_rate": 0.00010369098712446353,
"loss": 0.3556,
"num_input_tokens_seen": 3505560,
"step": 567,
"train_runtime": 2485.7706,
"train_tokens_per_second": 1410.251
},
{
"epoch": 0.9709401709401709,
"grad_norm": 0.07327679544687271,
"learning_rate": 0.00010351931330472104,
"loss": 0.3068,
"num_input_tokens_seen": 3510384,
"step": 568,
"train_runtime": 2489.0695,
"train_tokens_per_second": 1410.32
},
{
"epoch": 0.9726495726495726,
"grad_norm": 0.0801009014248848,
"learning_rate": 0.00010334763948497855,
"loss": 0.3229,
"num_input_tokens_seen": 3517104,
"step": 569,
"train_runtime": 2493.3461,
"train_tokens_per_second": 1410.596
},
{
"epoch": 0.9743589743589743,
"grad_norm": 0.06246993690729141,
"learning_rate": 0.00010317596566523606,
"loss": 0.2222,
"num_input_tokens_seen": 3526656,
"step": 570,
"train_runtime": 2499.1803,
"train_tokens_per_second": 1411.125
},
{
"epoch": 0.976068376068376,
"grad_norm": 0.1202109083533287,
"learning_rate": 0.00010300429184549356,
"loss": 0.5679,
"num_input_tokens_seen": 3531512,
"step": 571,
"train_runtime": 2504.4144,
"train_tokens_per_second": 1410.115
},
{
"epoch": 0.9777777777777777,
"grad_norm": 0.08485902100801468,
"learning_rate": 0.00010283261802575108,
"loss": 0.3944,
"num_input_tokens_seen": 3538680,
"step": 572,
"train_runtime": 2508.9249,
"train_tokens_per_second": 1410.437
},
{
"epoch": 0.9794871794871794,
"grad_norm": 0.07959533482789993,
"learning_rate": 0.00010266094420600858,
"loss": 0.4062,
"num_input_tokens_seen": 3546464,
"step": 573,
"train_runtime": 2513.8989,
"train_tokens_per_second": 1410.742
},
{
"epoch": 0.9811965811965812,
"grad_norm": 0.09233636409044266,
"learning_rate": 0.0001024892703862661,
"loss": 0.3835,
"num_input_tokens_seen": 3552456,
"step": 574,
"train_runtime": 2517.8592,
"train_tokens_per_second": 1410.903
},
{
"epoch": 0.9829059829059829,
"grad_norm": 0.09226620197296143,
"learning_rate": 0.0001023175965665236,
"loss": 0.406,
"num_input_tokens_seen": 3558408,
"step": 575,
"train_runtime": 2521.7196,
"train_tokens_per_second": 1411.104
},
{
"epoch": 0.9846153846153847,
"grad_norm": 0.09293176978826523,
"learning_rate": 0.00010214592274678112,
"loss": 0.4517,
"num_input_tokens_seen": 3562888,
"step": 576,
"train_runtime": 2524.8827,
"train_tokens_per_second": 1411.11
},
{
"epoch": 0.9863247863247864,
"grad_norm": 0.09278377890586853,
"learning_rate": 0.00010197424892703865,
"loss": 0.3824,
"num_input_tokens_seen": 3569056,
"step": 577,
"train_runtime": 2528.8642,
"train_tokens_per_second": 1411.328
},
{
"epoch": 0.9880341880341881,
"grad_norm": 0.08279518783092499,
"learning_rate": 0.00010180257510729614,
"loss": 0.3324,
"num_input_tokens_seen": 3575144,
"step": 578,
"train_runtime": 2532.8766,
"train_tokens_per_second": 1411.496
},
{
"epoch": 0.9897435897435898,
"grad_norm": 0.10000254958868027,
"learning_rate": 0.00010163090128755366,
"loss": 0.5108,
"num_input_tokens_seen": 3581656,
"step": 579,
"train_runtime": 2537.0696,
"train_tokens_per_second": 1411.729
},
{
"epoch": 0.9914529914529915,
"grad_norm": 0.08659250289201736,
"learning_rate": 0.00010145922746781115,
"loss": 0.4577,
"num_input_tokens_seen": 3587680,
"step": 580,
"train_runtime": 2541.0662,
"train_tokens_per_second": 1411.88
},
{
"epoch": 0.9931623931623932,
"grad_norm": 0.07771515846252441,
"learning_rate": 0.00010128755364806868,
"loss": 0.4422,
"num_input_tokens_seen": 3593504,
"step": 581,
"train_runtime": 2544.9092,
"train_tokens_per_second": 1412.036
},
{
"epoch": 0.9948717948717949,
"grad_norm": 0.07676418870687485,
"learning_rate": 0.00010111587982832617,
"loss": 0.3758,
"num_input_tokens_seen": 3600384,
"step": 582,
"train_runtime": 2549.2938,
"train_tokens_per_second": 1412.306
},
{
"epoch": 0.9965811965811966,
"grad_norm": 0.08909256011247635,
"learning_rate": 0.0001009442060085837,
"loss": 0.3669,
"num_input_tokens_seen": 3605464,
"step": 583,
"train_runtime": 2552.6971,
"train_tokens_per_second": 1412.414
},
{
"epoch": 0.9982905982905983,
"grad_norm": 0.08806303888559341,
"learning_rate": 0.00010077253218884119,
"loss": 0.3305,
"num_input_tokens_seen": 3611536,
"step": 584,
"train_runtime": 2556.5698,
"train_tokens_per_second": 1412.649
},
{
"epoch": 1.0,
"grad_norm": 0.08583690226078033,
"learning_rate": 0.00010060085836909872,
"loss": 0.3828,
"num_input_tokens_seen": 3618422,
"step": 585,
"train_runtime": 2560.9505,
"train_tokens_per_second": 1412.921
},
{
"epoch": 1.0,
"eval_loss": 0.39605432748794556,
"eval_runtime": 40.3316,
"eval_samples_per_second": 24.745,
"eval_steps_per_second": 3.099,
"num_input_tokens_seen": 3618422,
"step": 585
},
{
"epoch": 1.0017094017094017,
"grad_norm": 0.08948741853237152,
"learning_rate": 0.00010042918454935624,
"loss": 0.3274,
"num_input_tokens_seen": 3622718,
"step": 586,
"train_runtime": 2604.2915,
"train_tokens_per_second": 1391.057
},
{
"epoch": 1.0034188034188034,
"grad_norm": 0.08865802735090256,
"learning_rate": 0.00010025751072961374,
"loss": 0.3752,
"num_input_tokens_seen": 3628366,
"step": 587,
"train_runtime": 2608.0141,
"train_tokens_per_second": 1391.237
},
{
"epoch": 1.005128205128205,
"grad_norm": 0.08882749825716019,
"learning_rate": 0.00010008583690987125,
"loss": 0.3247,
"num_input_tokens_seen": 3634422,
"step": 588,
"train_runtime": 2611.9678,
"train_tokens_per_second": 1391.45
},
{
"epoch": 1.0068376068376068,
"grad_norm": 0.07764381170272827,
"learning_rate": 9.991416309012877e-05,
"loss": 0.3212,
"num_input_tokens_seen": 3642062,
"step": 589,
"train_runtime": 2616.7435,
"train_tokens_per_second": 1391.83
},
{
"epoch": 1.0085470085470085,
"grad_norm": 0.07668716460466385,
"learning_rate": 9.974248927038627e-05,
"loss": 0.2789,
"num_input_tokens_seen": 3647678,
"step": 590,
"train_runtime": 2620.4702,
"train_tokens_per_second": 1391.994
},
{
"epoch": 1.0102564102564102,
"grad_norm": 0.08743472397327423,
"learning_rate": 9.957081545064379e-05,
"loss": 0.4002,
"num_input_tokens_seen": 3652086,
"step": 591,
"train_runtime": 2623.6804,
"train_tokens_per_second": 1391.971
},
{
"epoch": 1.011965811965812,
"grad_norm": 0.0788293108344078,
"learning_rate": 9.939914163090129e-05,
"loss": 0.3955,
"num_input_tokens_seen": 3658766,
"step": 592,
"train_runtime": 2627.9769,
"train_tokens_per_second": 1392.237
},
{
"epoch": 1.0136752136752136,
"grad_norm": 0.08279833942651749,
"learning_rate": 9.92274678111588e-05,
"loss": 0.3241,
"num_input_tokens_seen": 3663790,
"step": 593,
"train_runtime": 2631.3729,
"train_tokens_per_second": 1392.349
},
{
"epoch": 1.0153846153846153,
"grad_norm": 0.09472624957561493,
"learning_rate": 9.905579399141631e-05,
"loss": 0.319,
"num_input_tokens_seen": 3667814,
"step": 594,
"train_runtime": 2634.1893,
"train_tokens_per_second": 1392.388
},
{
"epoch": 1.017094017094017,
"grad_norm": 0.0776962861418724,
"learning_rate": 9.888412017167382e-05,
"loss": 0.3256,
"num_input_tokens_seen": 3673086,
"step": 595,
"train_runtime": 2637.6636,
"train_tokens_per_second": 1392.553
},
{
"epoch": 1.0188034188034187,
"grad_norm": 0.08131415396928787,
"learning_rate": 9.871244635193133e-05,
"loss": 0.4514,
"num_input_tokens_seen": 3679750,
"step": 596,
"train_runtime": 2642.0566,
"train_tokens_per_second": 1392.76
},
{
"epoch": 1.0205128205128204,
"grad_norm": 0.08639644086360931,
"learning_rate": 9.854077253218884e-05,
"loss": 0.4259,
"num_input_tokens_seen": 3686286,
"step": 597,
"train_runtime": 2646.3002,
"train_tokens_per_second": 1392.996
},
{
"epoch": 1.0222222222222221,
"grad_norm": 0.07753600180149078,
"learning_rate": 9.836909871244636e-05,
"loss": 0.345,
"num_input_tokens_seen": 3692046,
"step": 598,
"train_runtime": 2650.0207,
"train_tokens_per_second": 1393.214
},
{
"epoch": 1.0239316239316238,
"grad_norm": 0.1012101024389267,
"learning_rate": 9.819742489270387e-05,
"loss": 0.43,
"num_input_tokens_seen": 3698230,
"step": 599,
"train_runtime": 2654.0616,
"train_tokens_per_second": 1393.423
},
{
"epoch": 1.0256410256410255,
"grad_norm": 0.08087831735610962,
"learning_rate": 9.802575107296138e-05,
"loss": 0.2885,
"num_input_tokens_seen": 3705894,
"step": 600,
"train_runtime": 2658.9893,
"train_tokens_per_second": 1393.723
},
{
"epoch": 1.0273504273504273,
"grad_norm": 0.09200716018676758,
"learning_rate": 9.785407725321889e-05,
"loss": 0.3635,
"num_input_tokens_seen": 3712206,
"step": 601,
"train_runtime": 2665.0844,
"train_tokens_per_second": 1392.904
},
{
"epoch": 1.029059829059829,
"grad_norm": 0.08871855586767197,
"learning_rate": 9.76824034334764e-05,
"loss": 0.3291,
"num_input_tokens_seen": 3718302,
"step": 602,
"train_runtime": 2669.0702,
"train_tokens_per_second": 1393.108
},
{
"epoch": 1.0307692307692307,
"grad_norm": 0.08718711137771606,
"learning_rate": 9.751072961373391e-05,
"loss": 0.343,
"num_input_tokens_seen": 3722894,
"step": 603,
"train_runtime": 2672.2548,
"train_tokens_per_second": 1393.166
},
{
"epoch": 1.0324786324786326,
"grad_norm": 0.1148778423666954,
"learning_rate": 9.733905579399141e-05,
"loss": 0.46,
"num_input_tokens_seen": 3728318,
"step": 604,
"train_runtime": 2675.8538,
"train_tokens_per_second": 1393.319
},
{
"epoch": 1.0341880341880343,
"grad_norm": 0.09517476707696915,
"learning_rate": 9.716738197424893e-05,
"loss": 0.3318,
"num_input_tokens_seen": 3733382,
"step": 605,
"train_runtime": 2679.2474,
"train_tokens_per_second": 1393.444
},
{
"epoch": 1.035897435897436,
"grad_norm": 0.08098772168159485,
"learning_rate": 9.699570815450643e-05,
"loss": 0.4015,
"num_input_tokens_seen": 3740134,
"step": 606,
"train_runtime": 2683.621,
"train_tokens_per_second": 1393.689
},
{
"epoch": 1.0376068376068377,
"grad_norm": 0.08234472572803497,
"learning_rate": 9.682403433476396e-05,
"loss": 0.3397,
"num_input_tokens_seen": 3748294,
"step": 607,
"train_runtime": 2688.737,
"train_tokens_per_second": 1394.072
},
{
"epoch": 1.0393162393162394,
"grad_norm": 0.09244134277105331,
"learning_rate": 9.665236051502146e-05,
"loss": 0.4135,
"num_input_tokens_seen": 3757438,
"step": 608,
"train_runtime": 2694.5363,
"train_tokens_per_second": 1394.466
},
{
"epoch": 1.041025641025641,
"grad_norm": 0.10387304425239563,
"learning_rate": 9.648068669527898e-05,
"loss": 0.3957,
"num_input_tokens_seen": 3764318,
"step": 609,
"train_runtime": 2699.0049,
"train_tokens_per_second": 1394.706
},
{
"epoch": 1.0427350427350428,
"grad_norm": 0.10354664921760559,
"learning_rate": 9.630901287553648e-05,
"loss": 0.3482,
"num_input_tokens_seen": 3768958,
"step": 610,
"train_runtime": 2702.2905,
"train_tokens_per_second": 1394.727
},
{
"epoch": 1.0444444444444445,
"grad_norm": 0.09723416715860367,
"learning_rate": 9.6137339055794e-05,
"loss": 0.3646,
"num_input_tokens_seen": 3774318,
"step": 611,
"train_runtime": 2705.8739,
"train_tokens_per_second": 1394.861
},
{
"epoch": 1.0461538461538462,
"grad_norm": 0.12522576749324799,
"learning_rate": 9.59656652360515e-05,
"loss": 0.4124,
"num_input_tokens_seen": 3778782,
"step": 612,
"train_runtime": 2708.8626,
"train_tokens_per_second": 1394.97
},
{
"epoch": 1.047863247863248,
"grad_norm": 0.07524297386407852,
"learning_rate": 9.579399141630902e-05,
"loss": 0.2649,
"num_input_tokens_seen": 3791542,
"step": 613,
"train_runtime": 2716.6371,
"train_tokens_per_second": 1395.675
},
{
"epoch": 1.0495726495726496,
"grad_norm": 0.09840003401041031,
"learning_rate": 9.562231759656652e-05,
"loss": 0.2911,
"num_input_tokens_seen": 3798062,
"step": 614,
"train_runtime": 2720.7491,
"train_tokens_per_second": 1395.962
},
{
"epoch": 1.0512820512820513,
"grad_norm": 0.08430645614862442,
"learning_rate": 9.545064377682403e-05,
"loss": 0.2807,
"num_input_tokens_seen": 3805886,
"step": 615,
"train_runtime": 2725.6421,
"train_tokens_per_second": 1396.326
},
{
"epoch": 1.052991452991453,
"grad_norm": 0.09602045267820358,
"learning_rate": 9.527896995708155e-05,
"loss": 0.3352,
"num_input_tokens_seen": 3812678,
"step": 616,
"train_runtime": 2729.9694,
"train_tokens_per_second": 1396.601
},
{
"epoch": 1.0547008547008547,
"grad_norm": 0.11685816943645477,
"learning_rate": 9.510729613733907e-05,
"loss": 0.3145,
"num_input_tokens_seen": 3817918,
"step": 617,
"train_runtime": 2733.4384,
"train_tokens_per_second": 1396.746
},
{
"epoch": 1.0564102564102564,
"grad_norm": 0.10211452841758728,
"learning_rate": 9.493562231759657e-05,
"loss": 0.4132,
"num_input_tokens_seen": 3823910,
"step": 618,
"train_runtime": 2737.3388,
"train_tokens_per_second": 1396.944
},
{
"epoch": 1.0581196581196581,
"grad_norm": 0.08317096531391144,
"learning_rate": 9.476394849785408e-05,
"loss": 0.3044,
"num_input_tokens_seen": 3831590,
"step": 619,
"train_runtime": 2742.2732,
"train_tokens_per_second": 1397.231
},
{
"epoch": 1.0598290598290598,
"grad_norm": 0.10162318497896194,
"learning_rate": 9.459227467811159e-05,
"loss": 0.3509,
"num_input_tokens_seen": 3838574,
"step": 620,
"train_runtime": 2746.7086,
"train_tokens_per_second": 1397.518
},
{
"epoch": 1.0615384615384615,
"grad_norm": 0.11026163399219513,
"learning_rate": 9.44206008583691e-05,
"loss": 0.3539,
"num_input_tokens_seen": 3845406,
"step": 621,
"train_runtime": 2750.9862,
"train_tokens_per_second": 1397.828
},
{
"epoch": 1.0632478632478632,
"grad_norm": 0.10371764004230499,
"learning_rate": 9.42489270386266e-05,
"loss": 0.3829,
"num_input_tokens_seen": 3851846,
"step": 622,
"train_runtime": 2755.1883,
"train_tokens_per_second": 1398.034
},
{
"epoch": 1.064957264957265,
"grad_norm": 0.12548448145389557,
"learning_rate": 9.407725321888412e-05,
"loss": 0.4213,
"num_input_tokens_seen": 3857550,
"step": 623,
"train_runtime": 2758.8716,
"train_tokens_per_second": 1398.235
},
{
"epoch": 1.0666666666666667,
"grad_norm": 0.10498113930225372,
"learning_rate": 9.390557939914162e-05,
"loss": 0.4485,
"num_input_tokens_seen": 3863470,
"step": 624,
"train_runtime": 2762.81,
"train_tokens_per_second": 1398.384
},
{
"epoch": 1.0683760683760684,
"grad_norm": 0.1048503890633583,
"learning_rate": 9.373390557939915e-05,
"loss": 0.3127,
"num_input_tokens_seen": 3869654,
"step": 625,
"train_runtime": 2766.7958,
"train_tokens_per_second": 1398.605
},
{
"epoch": 1.07008547008547,
"grad_norm": 0.09524165093898773,
"learning_rate": 9.356223175965666e-05,
"loss": 0.3127,
"num_input_tokens_seen": 3878486,
"step": 626,
"train_runtime": 2772.2649,
"train_tokens_per_second": 1399.032
},
{
"epoch": 1.0717948717948718,
"grad_norm": 0.10186054557561874,
"learning_rate": 9.339055793991417e-05,
"loss": 0.3342,
"num_input_tokens_seen": 3883590,
"step": 627,
"train_runtime": 2775.6835,
"train_tokens_per_second": 1399.147
},
{
"epoch": 1.0735042735042735,
"grad_norm": 0.09904703497886658,
"learning_rate": 9.321888412017167e-05,
"loss": 0.3603,
"num_input_tokens_seen": 3890358,
"step": 628,
"train_runtime": 2780.0801,
"train_tokens_per_second": 1399.369
},
{
"epoch": 1.0752136752136752,
"grad_norm": 0.11625757068395615,
"learning_rate": 9.304721030042919e-05,
"loss": 0.4212,
"num_input_tokens_seen": 3895574,
"step": 629,
"train_runtime": 2783.6001,
"train_tokens_per_second": 1399.473
},
{
"epoch": 1.0769230769230769,
"grad_norm": 0.09834125638008118,
"learning_rate": 9.287553648068669e-05,
"loss": 0.3934,
"num_input_tokens_seen": 3903326,
"step": 630,
"train_runtime": 2788.4609,
"train_tokens_per_second": 1399.814
},
{
"epoch": 1.0786324786324786,
"grad_norm": 0.11049104481935501,
"learning_rate": 9.270386266094421e-05,
"loss": 0.3621,
"num_input_tokens_seen": 3909342,
"step": 631,
"train_runtime": 2794.4207,
"train_tokens_per_second": 1398.981
},
{
"epoch": 1.0803418803418803,
"grad_norm": 0.1120554581284523,
"learning_rate": 9.253218884120171e-05,
"loss": 0.3118,
"num_input_tokens_seen": 3914966,
"step": 632,
"train_runtime": 2798.1277,
"train_tokens_per_second": 1399.138
},
{
"epoch": 1.082051282051282,
"grad_norm": 0.11459173262119293,
"learning_rate": 9.236051502145924e-05,
"loss": 0.3686,
"num_input_tokens_seen": 3921462,
"step": 633,
"train_runtime": 2802.3884,
"train_tokens_per_second": 1399.328
},
{
"epoch": 1.0837606837606837,
"grad_norm": 0.11084756255149841,
"learning_rate": 9.218884120171674e-05,
"loss": 0.3529,
"num_input_tokens_seen": 3927558,
"step": 634,
"train_runtime": 2806.299,
"train_tokens_per_second": 1399.551
},
{
"epoch": 1.0854700854700854,
"grad_norm": 0.12373020499944687,
"learning_rate": 9.201716738197426e-05,
"loss": 0.4522,
"num_input_tokens_seen": 3932094,
"step": 635,
"train_runtime": 2809.3759,
"train_tokens_per_second": 1399.633
},
{
"epoch": 1.087179487179487,
"grad_norm": 0.08477049320936203,
"learning_rate": 9.184549356223176e-05,
"loss": 0.3035,
"num_input_tokens_seen": 3941230,
"step": 636,
"train_runtime": 2815.0844,
"train_tokens_per_second": 1400.04
},
{
"epoch": 1.0888888888888888,
"grad_norm": 0.1090676486492157,
"learning_rate": 9.167381974248928e-05,
"loss": 0.4409,
"num_input_tokens_seen": 3947470,
"step": 637,
"train_runtime": 2819.144,
"train_tokens_per_second": 1400.237
},
{
"epoch": 1.0905982905982905,
"grad_norm": 0.12120052427053452,
"learning_rate": 9.150214592274678e-05,
"loss": 0.4599,
"num_input_tokens_seen": 3953878,
"step": 638,
"train_runtime": 2823.1637,
"train_tokens_per_second": 1400.513
},
{
"epoch": 1.0923076923076924,
"grad_norm": 0.11783261597156525,
"learning_rate": 9.13304721030043e-05,
"loss": 0.3354,
"num_input_tokens_seen": 3958406,
"step": 639,
"train_runtime": 2826.2247,
"train_tokens_per_second": 1400.598
},
{
"epoch": 1.0940170940170941,
"grad_norm": 0.09893219918012619,
"learning_rate": 9.115879828326181e-05,
"loss": 0.2526,
"num_input_tokens_seen": 3964966,
"step": 640,
"train_runtime": 2830.4214,
"train_tokens_per_second": 1400.839
},
{
"epoch": 1.0957264957264958,
"grad_norm": 0.12095890194177628,
"learning_rate": 9.098712446351931e-05,
"loss": 0.3913,
"num_input_tokens_seen": 3971974,
"step": 641,
"train_runtime": 2834.9317,
"train_tokens_per_second": 1401.083
},
{
"epoch": 1.0974358974358975,
"grad_norm": 0.10970400273799896,
"learning_rate": 9.081545064377683e-05,
"loss": 0.2948,
"num_input_tokens_seen": 3977078,
"step": 642,
"train_runtime": 2838.3405,
"train_tokens_per_second": 1401.198
},
{
"epoch": 1.0991452991452992,
"grad_norm": 0.11889484524726868,
"learning_rate": 9.064377682403434e-05,
"loss": 0.335,
"num_input_tokens_seen": 3984550,
"step": 643,
"train_runtime": 2842.9124,
"train_tokens_per_second": 1401.573
},
{
"epoch": 1.100854700854701,
"grad_norm": 0.09870035946369171,
"learning_rate": 9.047210300429185e-05,
"loss": 0.2858,
"num_input_tokens_seen": 3991398,
"step": 644,
"train_runtime": 2847.409,
"train_tokens_per_second": 1401.765
},
{
"epoch": 1.1025641025641026,
"grad_norm": 0.13711033761501312,
"learning_rate": 9.030042918454936e-05,
"loss": 0.3647,
"num_input_tokens_seen": 3995926,
"step": 645,
"train_runtime": 2850.5247,
"train_tokens_per_second": 1401.821
},
{
"epoch": 1.1042735042735043,
"grad_norm": 0.10438720136880875,
"learning_rate": 9.012875536480687e-05,
"loss": 0.2409,
"num_input_tokens_seen": 4003198,
"step": 646,
"train_runtime": 2855.1319,
"train_tokens_per_second": 1402.106
},
{
"epoch": 1.105982905982906,
"grad_norm": 0.15836024284362793,
"learning_rate": 8.995708154506438e-05,
"loss": 0.3368,
"num_input_tokens_seen": 4008270,
"step": 647,
"train_runtime": 2858.5235,
"train_tokens_per_second": 1402.217
},
{
"epoch": 1.1076923076923078,
"grad_norm": 0.10418689996004105,
"learning_rate": 8.97854077253219e-05,
"loss": 0.3241,
"num_input_tokens_seen": 4014838,
"step": 648,
"train_runtime": 2862.7868,
"train_tokens_per_second": 1402.423
},
{
"epoch": 1.1094017094017095,
"grad_norm": 0.1044258251786232,
"learning_rate": 8.96137339055794e-05,
"loss": 0.2804,
"num_input_tokens_seen": 4022990,
"step": 649,
"train_runtime": 2867.905,
"train_tokens_per_second": 1402.763
},
{
"epoch": 1.1111111111111112,
"grad_norm": 0.10561820864677429,
"learning_rate": 8.944206008583692e-05,
"loss": 0.2887,
"num_input_tokens_seen": 4030286,
"step": 650,
"train_runtime": 2872.5702,
"train_tokens_per_second": 1403.024
},
{
"epoch": 1.1128205128205129,
"grad_norm": 0.11144879460334778,
"learning_rate": 8.927038626609443e-05,
"loss": 0.3114,
"num_input_tokens_seen": 4036790,
"step": 651,
"train_runtime": 2876.8141,
"train_tokens_per_second": 1403.215
},
{
"epoch": 1.1145299145299146,
"grad_norm": 0.14294514060020447,
"learning_rate": 8.909871244635193e-05,
"loss": 0.3772,
"num_input_tokens_seen": 4040950,
"step": 652,
"train_runtime": 2879.6357,
"train_tokens_per_second": 1403.285
},
{
"epoch": 1.1162393162393163,
"grad_norm": 0.1573735773563385,
"learning_rate": 8.892703862660945e-05,
"loss": 0.3632,
"num_input_tokens_seen": 4045150,
"step": 653,
"train_runtime": 2882.5288,
"train_tokens_per_second": 1403.334
},
{
"epoch": 1.117948717948718,
"grad_norm": 0.12260954082012177,
"learning_rate": 8.875536480686695e-05,
"loss": 0.3622,
"num_input_tokens_seen": 4051350,
"step": 654,
"train_runtime": 2886.5663,
"train_tokens_per_second": 1403.519
},
{
"epoch": 1.1196581196581197,
"grad_norm": 0.12595947086811066,
"learning_rate": 8.858369098712447e-05,
"loss": 0.3106,
"num_input_tokens_seen": 4055846,
"step": 655,
"train_runtime": 2889.7758,
"train_tokens_per_second": 1403.516
},
{
"epoch": 1.1213675213675214,
"grad_norm": 0.10922437906265259,
"learning_rate": 8.841201716738198e-05,
"loss": 0.3463,
"num_input_tokens_seen": 4064006,
"step": 656,
"train_runtime": 2894.9551,
"train_tokens_per_second": 1403.824
},
{
"epoch": 1.123076923076923,
"grad_norm": 0.13162162899971008,
"learning_rate": 8.824034334763949e-05,
"loss": 0.3693,
"num_input_tokens_seen": 4069158,
"step": 657,
"train_runtime": 2898.4174,
"train_tokens_per_second": 1403.924
},
{
"epoch": 1.1247863247863248,
"grad_norm": 0.09306973218917847,
"learning_rate": 8.8068669527897e-05,
"loss": 0.2135,
"num_input_tokens_seen": 4075910,
"step": 658,
"train_runtime": 2902.7564,
"train_tokens_per_second": 1404.152
},
{
"epoch": 1.1264957264957265,
"grad_norm": 0.11251482367515564,
"learning_rate": 8.78969957081545e-05,
"loss": 0.2678,
"num_input_tokens_seen": 4083350,
"step": 659,
"train_runtime": 2907.453,
"train_tokens_per_second": 1404.442
},
{
"epoch": 1.1282051282051282,
"grad_norm": 0.11792943626642227,
"learning_rate": 8.772532188841202e-05,
"loss": 0.3796,
"num_input_tokens_seen": 4088502,
"step": 660,
"train_runtime": 2910.9225,
"train_tokens_per_second": 1404.538
},
{
"epoch": 1.12991452991453,
"grad_norm": 0.13532239198684692,
"learning_rate": 8.755364806866954e-05,
"loss": 0.3234,
"num_input_tokens_seen": 4094158,
"step": 661,
"train_runtime": 2916.6295,
"train_tokens_per_second": 1403.729
},
{
"epoch": 1.1316239316239316,
"grad_norm": 0.1649348884820938,
"learning_rate": 8.738197424892704e-05,
"loss": 0.2733,
"num_input_tokens_seen": 4100614,
"step": 662,
"train_runtime": 2920.8065,
"train_tokens_per_second": 1403.932
},
{
"epoch": 1.1333333333333333,
"grad_norm": 0.12547938525676727,
"learning_rate": 8.721030042918455e-05,
"loss": 0.3671,
"num_input_tokens_seen": 4104630,
"step": 663,
"train_runtime": 2923.6894,
"train_tokens_per_second": 1403.921
},
{
"epoch": 1.135042735042735,
"grad_norm": 0.1248277947306633,
"learning_rate": 8.703862660944207e-05,
"loss": 0.3165,
"num_input_tokens_seen": 4111406,
"step": 664,
"train_runtime": 2928.0537,
"train_tokens_per_second": 1404.143
},
{
"epoch": 1.1367521367521367,
"grad_norm": 0.10170157998800278,
"learning_rate": 8.686695278969957e-05,
"loss": 0.2983,
"num_input_tokens_seen": 4119070,
"step": 665,
"train_runtime": 2932.9305,
"train_tokens_per_second": 1404.421
},
{
"epoch": 1.1384615384615384,
"grad_norm": 0.12390810996294022,
"learning_rate": 8.669527896995709e-05,
"loss": 0.3526,
"num_input_tokens_seen": 4124734,
"step": 666,
"train_runtime": 2936.6426,
"train_tokens_per_second": 1404.575
},
{
"epoch": 1.1401709401709401,
"grad_norm": 0.1411864310503006,
"learning_rate": 8.652360515021459e-05,
"loss": 0.3677,
"num_input_tokens_seen": 4129230,
"step": 667,
"train_runtime": 2939.7387,
"train_tokens_per_second": 1404.625
},
{
"epoch": 1.1418803418803418,
"grad_norm": 0.15506789088249207,
"learning_rate": 8.635193133047211e-05,
"loss": 0.4179,
"num_input_tokens_seen": 4134566,
"step": 668,
"train_runtime": 2943.2748,
"train_tokens_per_second": 1404.75
},
{
"epoch": 1.1435897435897435,
"grad_norm": 0.12583504617214203,
"learning_rate": 8.618025751072962e-05,
"loss": 0.335,
"num_input_tokens_seen": 4139998,
"step": 669,
"train_runtime": 2946.9935,
"train_tokens_per_second": 1404.821
},
{
"epoch": 1.1452991452991452,
"grad_norm": 0.1164029911160469,
"learning_rate": 8.600858369098714e-05,
"loss": 0.3436,
"num_input_tokens_seen": 4145854,
"step": 670,
"train_runtime": 2950.7518,
"train_tokens_per_second": 1405.016
},
{
"epoch": 1.147008547008547,
"grad_norm": 0.11394175887107849,
"learning_rate": 8.583690987124464e-05,
"loss": 0.3931,
"num_input_tokens_seen": 4154062,
"step": 671,
"train_runtime": 2955.921,
"train_tokens_per_second": 1405.336
},
{
"epoch": 1.1487179487179486,
"grad_norm": 0.1256456822156906,
"learning_rate": 8.566523605150216e-05,
"loss": 0.3797,
"num_input_tokens_seen": 4159086,
"step": 672,
"train_runtime": 2959.2691,
"train_tokens_per_second": 1405.444
},
{
"epoch": 1.1504273504273503,
"grad_norm": 0.11079292744398117,
"learning_rate": 8.549356223175966e-05,
"loss": 0.3967,
"num_input_tokens_seen": 4167806,
"step": 673,
"train_runtime": 2964.6253,
"train_tokens_per_second": 1405.846
},
{
"epoch": 1.152136752136752,
"grad_norm": 0.11943069845438004,
"learning_rate": 8.532188841201718e-05,
"loss": 0.4008,
"num_input_tokens_seen": 4173558,
"step": 674,
"train_runtime": 2968.3878,
"train_tokens_per_second": 1406.002
},
{
"epoch": 1.1538461538461537,
"grad_norm": 0.1307218074798584,
"learning_rate": 8.515021459227468e-05,
"loss": 0.3377,
"num_input_tokens_seen": 4178718,
"step": 675,
"train_runtime": 2971.9038,
"train_tokens_per_second": 1406.074
},
{
"epoch": 1.1555555555555554,
"grad_norm": 0.11272697895765305,
"learning_rate": 8.49785407725322e-05,
"loss": 0.3091,
"num_input_tokens_seen": 4185366,
"step": 676,
"train_runtime": 2976.1919,
"train_tokens_per_second": 1406.282
},
{
"epoch": 1.1572649572649572,
"grad_norm": 0.12259600311517715,
"learning_rate": 8.48068669527897e-05,
"loss": 0.2661,
"num_input_tokens_seen": 4190998,
"step": 677,
"train_runtime": 2979.8773,
"train_tokens_per_second": 1406.433
},
{
"epoch": 1.1589743589743589,
"grad_norm": 0.1330793797969818,
"learning_rate": 8.463519313304723e-05,
"loss": 0.3186,
"num_input_tokens_seen": 4196758,
"step": 678,
"train_runtime": 2983.6254,
"train_tokens_per_second": 1406.597
},
{
"epoch": 1.1606837606837608,
"grad_norm": 0.13795171678066254,
"learning_rate": 8.446351931330473e-05,
"loss": 0.4127,
"num_input_tokens_seen": 4202318,
"step": 679,
"train_runtime": 2987.2952,
"train_tokens_per_second": 1406.73
},
{
"epoch": 1.1623931623931625,
"grad_norm": 0.1282401978969574,
"learning_rate": 8.429184549356224e-05,
"loss": 0.3593,
"num_input_tokens_seen": 4207182,
"step": 680,
"train_runtime": 2990.5405,
"train_tokens_per_second": 1406.83
},
{
"epoch": 1.1641025641025642,
"grad_norm": 0.12769852578639984,
"learning_rate": 8.412017167381975e-05,
"loss": 0.3226,
"num_input_tokens_seen": 4212214,
"step": 681,
"train_runtime": 2993.9992,
"train_tokens_per_second": 1406.885
},
{
"epoch": 1.165811965811966,
"grad_norm": 0.11880778521299362,
"learning_rate": 8.394849785407726e-05,
"loss": 0.3876,
"num_input_tokens_seen": 4218710,
"step": 682,
"train_runtime": 2998.2223,
"train_tokens_per_second": 1407.07
},
{
"epoch": 1.1675213675213676,
"grad_norm": 0.12354989349842072,
"learning_rate": 8.377682403433476e-05,
"loss": 0.4613,
"num_input_tokens_seen": 4224726,
"step": 683,
"train_runtime": 3002.1266,
"train_tokens_per_second": 1407.244
},
{
"epoch": 1.1692307692307693,
"grad_norm": 0.1455572098493576,
"learning_rate": 8.360515021459228e-05,
"loss": 0.4111,
"num_input_tokens_seen": 4230606,
"step": 684,
"train_runtime": 3005.9145,
"train_tokens_per_second": 1407.427
},
{
"epoch": 1.170940170940171,
"grad_norm": 0.1312953233718872,
"learning_rate": 8.343347639484978e-05,
"loss": 0.2817,
"num_input_tokens_seen": 4234918,
"step": 685,
"train_runtime": 3008.9265,
"train_tokens_per_second": 1407.451
},
{
"epoch": 1.1726495726495727,
"grad_norm": 0.11988040059804916,
"learning_rate": 8.32618025751073e-05,
"loss": 0.3142,
"num_input_tokens_seen": 4239622,
"step": 686,
"train_runtime": 3012.0648,
"train_tokens_per_second": 1407.547
},
{
"epoch": 1.1743589743589744,
"grad_norm": 0.12248189002275467,
"learning_rate": 8.309012875536481e-05,
"loss": 0.3699,
"num_input_tokens_seen": 4246046,
"step": 687,
"train_runtime": 3016.2638,
"train_tokens_per_second": 1407.717
},
{
"epoch": 1.176068376068376,
"grad_norm": 0.13097332417964935,
"learning_rate": 8.291845493562233e-05,
"loss": 0.4192,
"num_input_tokens_seen": 4252182,
"step": 688,
"train_runtime": 3020.2889,
"train_tokens_per_second": 1407.873
},
{
"epoch": 1.1777777777777778,
"grad_norm": 0.1253839135169983,
"learning_rate": 8.274678111587983e-05,
"loss": 0.33,
"num_input_tokens_seen": 4258126,
"step": 689,
"train_runtime": 3024.21,
"train_tokens_per_second": 1408.013
},
{
"epoch": 1.1794871794871795,
"grad_norm": 0.11824435740709305,
"learning_rate": 8.257510729613735e-05,
"loss": 0.3657,
"num_input_tokens_seen": 4263766,
"step": 690,
"train_runtime": 3027.9432,
"train_tokens_per_second": 1408.139
},
{
"epoch": 1.1811965811965812,
"grad_norm": 0.10008279979228973,
"learning_rate": 8.240343347639485e-05,
"loss": 0.2639,
"num_input_tokens_seen": 4271606,
"step": 691,
"train_runtime": 3035.004,
"train_tokens_per_second": 1407.447
},
{
"epoch": 1.182905982905983,
"grad_norm": 0.13148897886276245,
"learning_rate": 8.223175965665237e-05,
"loss": 0.3419,
"num_input_tokens_seen": 4277814,
"step": 692,
"train_runtime": 3039.0799,
"train_tokens_per_second": 1407.602
},
{
"epoch": 1.1846153846153846,
"grad_norm": 0.12744757533073425,
"learning_rate": 8.206008583690987e-05,
"loss": 0.3128,
"num_input_tokens_seen": 4284254,
"step": 693,
"train_runtime": 3043.1921,
"train_tokens_per_second": 1407.816
},
{
"epoch": 1.1863247863247863,
"grad_norm": 0.10180284082889557,
"learning_rate": 8.188841201716739e-05,
"loss": 0.2579,
"num_input_tokens_seen": 4292718,
"step": 694,
"train_runtime": 3048.4277,
"train_tokens_per_second": 1408.174
},
{
"epoch": 1.188034188034188,
"grad_norm": 0.11092183738946915,
"learning_rate": 8.171673819742489e-05,
"loss": 0.2859,
"num_input_tokens_seen": 4299326,
"step": 695,
"train_runtime": 3052.7332,
"train_tokens_per_second": 1408.353
},
{
"epoch": 1.1897435897435897,
"grad_norm": 0.11507410556077957,
"learning_rate": 8.154506437768242e-05,
"loss": 0.2612,
"num_input_tokens_seen": 4305558,
"step": 696,
"train_runtime": 3056.7517,
"train_tokens_per_second": 1408.54
},
{
"epoch": 1.1914529914529914,
"grad_norm": 0.12987719476222992,
"learning_rate": 8.137339055793992e-05,
"loss": 0.348,
"num_input_tokens_seen": 4312030,
"step": 697,
"train_runtime": 3060.9536,
"train_tokens_per_second": 1408.721
},
{
"epoch": 1.1931623931623931,
"grad_norm": 0.13223910331726074,
"learning_rate": 8.120171673819744e-05,
"loss": 0.2785,
"num_input_tokens_seen": 4316510,
"step": 698,
"train_runtime": 3064.0436,
"train_tokens_per_second": 1408.763
},
{
"epoch": 1.1948717948717948,
"grad_norm": 0.11111994832754135,
"learning_rate": 8.103004291845494e-05,
"loss": 0.2969,
"num_input_tokens_seen": 4324606,
"step": 699,
"train_runtime": 3069.1412,
"train_tokens_per_second": 1409.061
},
{
"epoch": 1.1965811965811965,
"grad_norm": 0.1413484662771225,
"learning_rate": 8.085836909871245e-05,
"loss": 0.3364,
"num_input_tokens_seen": 4329830,
"step": 700,
"train_runtime": 3072.6351,
"train_tokens_per_second": 1409.159
},
{
"epoch": 1.1982905982905983,
"grad_norm": 0.1474023163318634,
"learning_rate": 8.068669527896996e-05,
"loss": 0.3746,
"num_input_tokens_seen": 4334662,
"step": 701,
"train_runtime": 3075.8988,
"train_tokens_per_second": 1409.234
},
{
"epoch": 1.2,
"grad_norm": 0.13913953304290771,
"learning_rate": 8.051502145922747e-05,
"loss": 0.3741,
"num_input_tokens_seen": 4340158,
"step": 702,
"train_runtime": 3079.5939,
"train_tokens_per_second": 1409.328
},
{
"epoch": 1.2,
"eval_loss": 0.4070233404636383,
"eval_runtime": 40.246,
"eval_samples_per_second": 24.798,
"eval_steps_per_second": 3.106,
"num_input_tokens_seen": 4340158,
"step": 702
},
{
"epoch": 1.2017094017094017,
"grad_norm": 0.15744465589523315,
"learning_rate": 8.034334763948497e-05,
"loss": 0.3205,
"num_input_tokens_seen": 4344510,
"step": 703,
"train_runtime": 3122.7838,
"train_tokens_per_second": 1391.23
},
{
"epoch": 1.2034188034188034,
"grad_norm": 0.10824355483055115,
"learning_rate": 8.017167381974249e-05,
"loss": 0.3016,
"num_input_tokens_seen": 4351566,
"step": 704,
"train_runtime": 3127.2592,
"train_tokens_per_second": 1391.495
},
{
"epoch": 1.205128205128205,
"grad_norm": 0.14710809290409088,
"learning_rate": 8e-05,
"loss": 0.4078,
"num_input_tokens_seen": 4357350,
"step": 705,
"train_runtime": 3131.0621,
"train_tokens_per_second": 1391.652
},
{
"epoch": 1.2068376068376068,
"grad_norm": 0.1302827000617981,
"learning_rate": 7.982832618025752e-05,
"loss": 0.3591,
"num_input_tokens_seen": 4363374,
"step": 706,
"train_runtime": 3135.006,
"train_tokens_per_second": 1391.823
},
{
"epoch": 1.2085470085470085,
"grad_norm": 0.12259086221456528,
"learning_rate": 7.965665236051502e-05,
"loss": 0.3385,
"num_input_tokens_seen": 4369726,
"step": 707,
"train_runtime": 3139.1212,
"train_tokens_per_second": 1392.022
},
{
"epoch": 1.2102564102564102,
"grad_norm": 0.14181672036647797,
"learning_rate": 7.948497854077254e-05,
"loss": 0.3,
"num_input_tokens_seen": 4375566,
"step": 708,
"train_runtime": 3142.8713,
"train_tokens_per_second": 1392.219
},
{
"epoch": 1.2119658119658119,
"grad_norm": 0.1263398677110672,
"learning_rate": 7.931330472103004e-05,
"loss": 0.326,
"num_input_tokens_seen": 4382422,
"step": 709,
"train_runtime": 3147.2669,
"train_tokens_per_second": 1392.453
},
{
"epoch": 1.2136752136752136,
"grad_norm": 0.13287968933582306,
"learning_rate": 7.914163090128756e-05,
"loss": 0.3703,
"num_input_tokens_seen": 4387598,
"step": 710,
"train_runtime": 3150.6679,
"train_tokens_per_second": 1392.593
},
{
"epoch": 1.2153846153846155,
"grad_norm": 0.1080661490559578,
"learning_rate": 7.896995708154506e-05,
"loss": 0.2662,
"num_input_tokens_seen": 4393070,
"step": 711,
"train_runtime": 3154.3344,
"train_tokens_per_second": 1392.709
},
{
"epoch": 1.2170940170940172,
"grad_norm": 0.15643350780010223,
"learning_rate": 7.879828326180258e-05,
"loss": 0.3682,
"num_input_tokens_seen": 4400974,
"step": 712,
"train_runtime": 3159.2844,
"train_tokens_per_second": 1393.029
},
{
"epoch": 1.218803418803419,
"grad_norm": 0.13371539115905762,
"learning_rate": 7.862660944206008e-05,
"loss": 0.2962,
"num_input_tokens_seen": 4407534,
"step": 713,
"train_runtime": 3163.505,
"train_tokens_per_second": 1393.244
},
{
"epoch": 1.2205128205128206,
"grad_norm": 0.12932796776294708,
"learning_rate": 7.845493562231761e-05,
"loss": 0.4288,
"num_input_tokens_seen": 4414006,
"step": 714,
"train_runtime": 3167.7424,
"train_tokens_per_second": 1393.423
},
{
"epoch": 1.2222222222222223,
"grad_norm": 0.13061010837554932,
"learning_rate": 7.828326180257511e-05,
"loss": 0.3212,
"num_input_tokens_seen": 4419822,
"step": 715,
"train_runtime": 3171.4916,
"train_tokens_per_second": 1393.61
},
{
"epoch": 1.223931623931624,
"grad_norm": 0.15035027265548706,
"learning_rate": 7.811158798283263e-05,
"loss": 0.3392,
"num_input_tokens_seen": 4424894,
"step": 716,
"train_runtime": 3174.9326,
"train_tokens_per_second": 1393.697
},
{
"epoch": 1.2256410256410257,
"grad_norm": 0.13823997974395752,
"learning_rate": 7.793991416309013e-05,
"loss": 0.3443,
"num_input_tokens_seen": 4429934,
"step": 717,
"train_runtime": 3178.3439,
"train_tokens_per_second": 1393.787
},
{
"epoch": 1.2273504273504274,
"grad_norm": 0.12821649014949799,
"learning_rate": 7.776824034334765e-05,
"loss": 0.3079,
"num_input_tokens_seen": 4437350,
"step": 718,
"train_runtime": 3182.9631,
"train_tokens_per_second": 1394.094
},
{
"epoch": 1.2290598290598291,
"grad_norm": 0.15762051939964294,
"learning_rate": 7.759656652360515e-05,
"loss": 0.3233,
"num_input_tokens_seen": 4443350,
"step": 719,
"train_runtime": 3186.8324,
"train_tokens_per_second": 1394.284
},
{
"epoch": 1.2307692307692308,
"grad_norm": 0.12094758450984955,
"learning_rate": 7.742489270386266e-05,
"loss": 0.3412,
"num_input_tokens_seen": 4450358,
"step": 720,
"train_runtime": 3191.2311,
"train_tokens_per_second": 1394.558
},
{
"epoch": 1.2324786324786325,
"grad_norm": 0.14245277643203735,
"learning_rate": 7.725321888412017e-05,
"loss": 0.3852,
"num_input_tokens_seen": 4455006,
"step": 721,
"train_runtime": 3196.5176,
"train_tokens_per_second": 1393.706
},
{
"epoch": 1.2341880341880342,
"grad_norm": 0.12726493179798126,
"learning_rate": 7.70815450643777e-05,
"loss": 0.3124,
"num_input_tokens_seen": 4460062,
"step": 722,
"train_runtime": 3199.9064,
"train_tokens_per_second": 1393.81
},
{
"epoch": 1.235897435897436,
"grad_norm": 0.1353270411491394,
"learning_rate": 7.69098712446352e-05,
"loss": 0.4404,
"num_input_tokens_seen": 4465926,
"step": 723,
"train_runtime": 3203.6787,
"train_tokens_per_second": 1393.999
},
{
"epoch": 1.2376068376068377,
"grad_norm": 0.12000975012779236,
"learning_rate": 7.673819742489271e-05,
"loss": 0.415,
"num_input_tokens_seen": 4473902,
"step": 724,
"train_runtime": 3208.6199,
"train_tokens_per_second": 1394.338
},
{
"epoch": 1.2393162393162394,
"grad_norm": 0.14204196631908417,
"learning_rate": 7.656652360515022e-05,
"loss": 0.3714,
"num_input_tokens_seen": 4479870,
"step": 725,
"train_runtime": 3212.4525,
"train_tokens_per_second": 1394.533
},
{
"epoch": 1.241025641025641,
"grad_norm": 0.15379798412322998,
"learning_rate": 7.639484978540773e-05,
"loss": 0.3517,
"num_input_tokens_seen": 4484942,
"step": 726,
"train_runtime": 3215.8195,
"train_tokens_per_second": 1394.65
},
{
"epoch": 1.2427350427350428,
"grad_norm": 0.14596928656101227,
"learning_rate": 7.622317596566523e-05,
"loss": 0.3631,
"num_input_tokens_seen": 4489038,
"step": 727,
"train_runtime": 3218.5973,
"train_tokens_per_second": 1394.719
},
{
"epoch": 1.2444444444444445,
"grad_norm": 0.13844047486782074,
"learning_rate": 7.605150214592275e-05,
"loss": 0.3868,
"num_input_tokens_seen": 4494750,
"step": 728,
"train_runtime": 3222.3484,
"train_tokens_per_second": 1394.868
},
{
"epoch": 1.2461538461538462,
"grad_norm": 0.13620500266551971,
"learning_rate": 7.587982832618025e-05,
"loss": 0.3273,
"num_input_tokens_seen": 4499982,
"step": 729,
"train_runtime": 3225.86,
"train_tokens_per_second": 1394.971
},
{
"epoch": 1.2478632478632479,
"grad_norm": 0.11844179034233093,
"learning_rate": 7.570815450643777e-05,
"loss": 0.3236,
"num_input_tokens_seen": 4508150,
"step": 730,
"train_runtime": 3230.9631,
"train_tokens_per_second": 1395.296
},
{
"epoch": 1.2495726495726496,
"grad_norm": 0.12672026455402374,
"learning_rate": 7.553648068669528e-05,
"loss": 0.3344,
"num_input_tokens_seen": 4514606,
"step": 731,
"train_runtime": 3235.0964,
"train_tokens_per_second": 1395.509
},
{
"epoch": 1.2512820512820513,
"grad_norm": 0.13571657240390778,
"learning_rate": 7.53648068669528e-05,
"loss": 0.4214,
"num_input_tokens_seen": 4523526,
"step": 732,
"train_runtime": 3240.687,
"train_tokens_per_second": 1395.854
},
{
"epoch": 1.252991452991453,
"grad_norm": 0.14158177375793457,
"learning_rate": 7.51931330472103e-05,
"loss": 0.257,
"num_input_tokens_seen": 4528758,
"step": 733,
"train_runtime": 3244.1781,
"train_tokens_per_second": 1395.965
},
{
"epoch": 1.2547008547008547,
"grad_norm": 0.12700851261615753,
"learning_rate": 7.502145922746782e-05,
"loss": 0.4369,
"num_input_tokens_seen": 4535382,
"step": 734,
"train_runtime": 3248.4052,
"train_tokens_per_second": 1396.187
},
{
"epoch": 1.2564102564102564,
"grad_norm": 0.1430508941411972,
"learning_rate": 7.484978540772532e-05,
"loss": 0.3833,
"num_input_tokens_seen": 4541614,
"step": 735,
"train_runtime": 3252.4598,
"train_tokens_per_second": 1396.363
},
{
"epoch": 1.258119658119658,
"grad_norm": 0.12764482200145721,
"learning_rate": 7.467811158798284e-05,
"loss": 0.4148,
"num_input_tokens_seen": 4548046,
"step": 736,
"train_runtime": 3256.6496,
"train_tokens_per_second": 1396.541
},
{
"epoch": 1.2598290598290598,
"grad_norm": 0.13472262024879456,
"learning_rate": 7.450643776824034e-05,
"loss": 0.3777,
"num_input_tokens_seen": 4553950,
"step": 737,
"train_runtime": 3260.4005,
"train_tokens_per_second": 1396.746
},
{
"epoch": 1.2615384615384615,
"grad_norm": 0.1314297914505005,
"learning_rate": 7.433476394849786e-05,
"loss": 0.4397,
"num_input_tokens_seen": 4558846,
"step": 738,
"train_runtime": 3263.7018,
"train_tokens_per_second": 1396.833
},
{
"epoch": 1.2632478632478632,
"grad_norm": 0.14270712435245514,
"learning_rate": 7.416309012875536e-05,
"loss": 0.3093,
"num_input_tokens_seen": 4563726,
"step": 739,
"train_runtime": 3266.9431,
"train_tokens_per_second": 1396.941
},
{
"epoch": 1.264957264957265,
"grad_norm": 0.1482027918100357,
"learning_rate": 7.399141630901289e-05,
"loss": 0.4741,
"num_input_tokens_seen": 4571278,
"step": 740,
"train_runtime": 3271.6203,
"train_tokens_per_second": 1397.252
},
{
"epoch": 1.2666666666666666,
"grad_norm": 0.12276957184076309,
"learning_rate": 7.381974248927039e-05,
"loss": 0.3511,
"num_input_tokens_seen": 4577710,
"step": 741,
"train_runtime": 3275.6213,
"train_tokens_per_second": 1397.509
},
{
"epoch": 1.2683760683760683,
"grad_norm": 0.13464733958244324,
"learning_rate": 7.36480686695279e-05,
"loss": 0.3685,
"num_input_tokens_seen": 4583294,
"step": 742,
"train_runtime": 3279.1819,
"train_tokens_per_second": 1397.694
},
{
"epoch": 1.27008547008547,
"grad_norm": 0.12158236652612686,
"learning_rate": 7.347639484978541e-05,
"loss": 0.2883,
"num_input_tokens_seen": 4588590,
"step": 743,
"train_runtime": 3282.5387,
"train_tokens_per_second": 1397.878
},
{
"epoch": 1.2717948717948717,
"grad_norm": 0.13294081389904022,
"learning_rate": 7.330472103004292e-05,
"loss": 0.437,
"num_input_tokens_seen": 4595566,
"step": 744,
"train_runtime": 3286.9142,
"train_tokens_per_second": 1398.14
},
{
"epoch": 1.2735042735042734,
"grad_norm": 0.1501665860414505,
"learning_rate": 7.313304721030043e-05,
"loss": 0.5661,
"num_input_tokens_seen": 4599918,
"step": 745,
"train_runtime": 3289.8586,
"train_tokens_per_second": 1398.211
},
{
"epoch": 1.2752136752136751,
"grad_norm": 0.14475314319133759,
"learning_rate": 7.296137339055794e-05,
"loss": 0.4791,
"num_input_tokens_seen": 4605942,
"step": 746,
"train_runtime": 3293.6594,
"train_tokens_per_second": 1398.427
},
{
"epoch": 1.2769230769230768,
"grad_norm": 0.12351132929325104,
"learning_rate": 7.278969957081544e-05,
"loss": 0.3623,
"num_input_tokens_seen": 4611150,
"step": 747,
"train_runtime": 3297.0543,
"train_tokens_per_second": 1398.567
},
{
"epoch": 1.2786324786324785,
"grad_norm": 0.13310228288173676,
"learning_rate": 7.261802575107296e-05,
"loss": 0.3743,
"num_input_tokens_seen": 4616758,
"step": 748,
"train_runtime": 3300.7146,
"train_tokens_per_second": 1398.715
},
{
"epoch": 1.2803418803418802,
"grad_norm": 0.09973648190498352,
"learning_rate": 7.244635193133048e-05,
"loss": 0.2891,
"num_input_tokens_seen": 4626662,
"step": 749,
"train_runtime": 3306.7934,
"train_tokens_per_second": 1399.139
},
{
"epoch": 1.282051282051282,
"grad_norm": 0.14369341731071472,
"learning_rate": 7.227467811158799e-05,
"loss": 0.3285,
"num_input_tokens_seen": 4631822,
"step": 750,
"train_runtime": 3310.203,
"train_tokens_per_second": 1399.256
},
{
"epoch": 1.2837606837606836,
"grad_norm": 0.1476762741804123,
"learning_rate": 7.21030042918455e-05,
"loss": 0.4658,
"num_input_tokens_seen": 4636590,
"step": 751,
"train_runtime": 3315.5788,
"train_tokens_per_second": 1398.426
},
{
"epoch": 1.2854700854700853,
"grad_norm": 0.11374587565660477,
"learning_rate": 7.193133047210301e-05,
"loss": 0.3681,
"num_input_tokens_seen": 4644318,
"step": 752,
"train_runtime": 3320.3931,
"train_tokens_per_second": 1398.725
},
{
"epoch": 1.287179487179487,
"grad_norm": 0.11597425490617752,
"learning_rate": 7.175965665236051e-05,
"loss": 0.357,
"num_input_tokens_seen": 4650038,
"step": 753,
"train_runtime": 3324.1736,
"train_tokens_per_second": 1398.855
},
{
"epoch": 1.2888888888888888,
"grad_norm": 0.13681602478027344,
"learning_rate": 7.158798283261803e-05,
"loss": 0.3438,
"num_input_tokens_seen": 4657070,
"step": 754,
"train_runtime": 3328.6588,
"train_tokens_per_second": 1399.083
},
{
"epoch": 1.2905982905982907,
"grad_norm": 0.13616129755973816,
"learning_rate": 7.141630901287553e-05,
"loss": 0.3903,
"num_input_tokens_seen": 4662454,
"step": 755,
"train_runtime": 3332.1591,
"train_tokens_per_second": 1399.229
},
{
"epoch": 1.2923076923076924,
"grad_norm": 0.11485311388969421,
"learning_rate": 7.124463519313305e-05,
"loss": 0.2805,
"num_input_tokens_seen": 4668550,
"step": 756,
"train_runtime": 3336.0659,
"train_tokens_per_second": 1399.418
},
{
"epoch": 1.294017094017094,
"grad_norm": 0.10654192417860031,
"learning_rate": 7.107296137339055e-05,
"loss": 0.3048,
"num_input_tokens_seen": 4674622,
"step": 757,
"train_runtime": 3339.9603,
"train_tokens_per_second": 1399.604
},
{
"epoch": 1.2957264957264958,
"grad_norm": 0.11485373228788376,
"learning_rate": 7.090128755364808e-05,
"loss": 0.3378,
"num_input_tokens_seen": 4681182,
"step": 758,
"train_runtime": 3344.152,
"train_tokens_per_second": 1399.811
},
{
"epoch": 1.2974358974358975,
"grad_norm": 0.12688450515270233,
"learning_rate": 7.072961373390558e-05,
"loss": 0.3171,
"num_input_tokens_seen": 4688046,
"step": 759,
"train_runtime": 3348.539,
"train_tokens_per_second": 1400.027
},
{
"epoch": 1.2991452991452992,
"grad_norm": 0.14865227043628693,
"learning_rate": 7.05579399141631e-05,
"loss": 0.4053,
"num_input_tokens_seen": 4693070,
"step": 760,
"train_runtime": 3351.8787,
"train_tokens_per_second": 1400.131
},
{
"epoch": 1.300854700854701,
"grad_norm": 0.11336711049079895,
"learning_rate": 7.03862660944206e-05,
"loss": 0.4168,
"num_input_tokens_seen": 4700366,
"step": 761,
"train_runtime": 3356.4783,
"train_tokens_per_second": 1400.386
},
{
"epoch": 1.3025641025641026,
"grad_norm": 0.12746818363666534,
"learning_rate": 7.021459227467812e-05,
"loss": 0.3034,
"num_input_tokens_seen": 4705990,
"step": 762,
"train_runtime": 3360.1127,
"train_tokens_per_second": 1400.545
},
{
"epoch": 1.3042735042735043,
"grad_norm": 0.12251978367567062,
"learning_rate": 7.004291845493562e-05,
"loss": 0.2748,
"num_input_tokens_seen": 4714262,
"step": 763,
"train_runtime": 3365.1365,
"train_tokens_per_second": 1400.913
},
{
"epoch": 1.305982905982906,
"grad_norm": 0.13442695140838623,
"learning_rate": 6.987124463519313e-05,
"loss": 0.295,
"num_input_tokens_seen": 4719134,
"step": 764,
"train_runtime": 3368.3798,
"train_tokens_per_second": 1401.01
},
{
"epoch": 1.3076923076923077,
"grad_norm": 0.12905444204807281,
"learning_rate": 6.969957081545064e-05,
"loss": 0.3244,
"num_input_tokens_seen": 4725510,
"step": 765,
"train_runtime": 3372.4643,
"train_tokens_per_second": 1401.204
},
{
"epoch": 1.3094017094017094,
"grad_norm": 0.11190018802881241,
"learning_rate": 6.952789699570815e-05,
"loss": 0.3076,
"num_input_tokens_seen": 4733854,
"step": 766,
"train_runtime": 3377.5045,
"train_tokens_per_second": 1401.583
},
{
"epoch": 1.3111111111111111,
"grad_norm": 0.17238380014896393,
"learning_rate": 6.935622317596567e-05,
"loss": 0.2737,
"num_input_tokens_seen": 4739286,
"step": 767,
"train_runtime": 3381.0372,
"train_tokens_per_second": 1401.725
},
{
"epoch": 1.3128205128205128,
"grad_norm": 0.17607900500297546,
"learning_rate": 6.918454935622318e-05,
"loss": 0.3432,
"num_input_tokens_seen": 4745774,
"step": 768,
"train_runtime": 3385.2278,
"train_tokens_per_second": 1401.907
},
{
"epoch": 1.3145299145299145,
"grad_norm": 0.1317862719297409,
"learning_rate": 6.901287553648069e-05,
"loss": 0.3515,
"num_input_tokens_seen": 4752102,
"step": 769,
"train_runtime": 3389.3012,
"train_tokens_per_second": 1402.089
},
{
"epoch": 1.3162393162393162,
"grad_norm": 0.14107532799243927,
"learning_rate": 6.88412017167382e-05,
"loss": 0.3412,
"num_input_tokens_seen": 4756838,
"step": 770,
"train_runtime": 3392.4585,
"train_tokens_per_second": 1402.18
},
{
"epoch": 1.317948717948718,
"grad_norm": 0.13236303627490997,
"learning_rate": 6.86695278969957e-05,
"loss": 0.3439,
"num_input_tokens_seen": 4762030,
"step": 771,
"train_runtime": 3395.9367,
"train_tokens_per_second": 1402.273
},
{
"epoch": 1.3196581196581196,
"grad_norm": 0.1498628854751587,
"learning_rate": 6.849785407725322e-05,
"loss": 0.3687,
"num_input_tokens_seen": 4768278,
"step": 772,
"train_runtime": 3400.0481,
"train_tokens_per_second": 1402.415
},
{
"epoch": 1.3213675213675213,
"grad_norm": 0.14370892941951752,
"learning_rate": 6.832618025751074e-05,
"loss": 0.2666,
"num_input_tokens_seen": 4774286,
"step": 773,
"train_runtime": 3403.935,
"train_tokens_per_second": 1402.578
},
{
"epoch": 1.323076923076923,
"grad_norm": 0.10908810794353485,
"learning_rate": 6.815450643776824e-05,
"loss": 0.3024,
"num_input_tokens_seen": 4782158,
"step": 774,
"train_runtime": 3408.873,
"train_tokens_per_second": 1402.856
},
{
"epoch": 1.3247863247863247,
"grad_norm": 0.14470210671424866,
"learning_rate": 6.798283261802576e-05,
"loss": 0.4275,
"num_input_tokens_seen": 4787766,
"step": 775,
"train_runtime": 3412.4916,
"train_tokens_per_second": 1403.012
},
{
"epoch": 1.3264957264957264,
"grad_norm": 0.13045263290405273,
"learning_rate": 6.781115879828327e-05,
"loss": 0.2805,
"num_input_tokens_seen": 4793574,
"step": 776,
"train_runtime": 3416.2588,
"train_tokens_per_second": 1403.165
},
{
"epoch": 1.3282051282051281,
"grad_norm": 0.13219225406646729,
"learning_rate": 6.763948497854077e-05,
"loss": 0.3582,
"num_input_tokens_seen": 4799806,
"step": 777,
"train_runtime": 3420.2931,
"train_tokens_per_second": 1403.332
},
{
"epoch": 1.3299145299145299,
"grad_norm": 0.1638411432504654,
"learning_rate": 6.746781115879829e-05,
"loss": 0.4126,
"num_input_tokens_seen": 4804742,
"step": 778,
"train_runtime": 3423.6145,
"train_tokens_per_second": 1403.412
},
{
"epoch": 1.3316239316239316,
"grad_norm": 0.14201755821704865,
"learning_rate": 6.729613733905579e-05,
"loss": 0.3419,
"num_input_tokens_seen": 4810782,
"step": 779,
"train_runtime": 3427.5338,
"train_tokens_per_second": 1403.57
},
{
"epoch": 1.3333333333333333,
"grad_norm": 0.15089352428913116,
"learning_rate": 6.712446351931331e-05,
"loss": 0.2885,
"num_input_tokens_seen": 4817070,
"step": 780,
"train_runtime": 3431.5635,
"train_tokens_per_second": 1403.754
},
{
"epoch": 1.335042735042735,
"grad_norm": 0.13004031777381897,
"learning_rate": 6.695278969957082e-05,
"loss": 0.3854,
"num_input_tokens_seen": 4823494,
"step": 781,
"train_runtime": 3437.7554,
"train_tokens_per_second": 1403.094
},
{
"epoch": 1.3367521367521369,
"grad_norm": 0.15346503257751465,
"learning_rate": 6.678111587982833e-05,
"loss": 0.4984,
"num_input_tokens_seen": 4830086,
"step": 782,
"train_runtime": 3442.0415,
"train_tokens_per_second": 1403.262
},
{
"epoch": 1.3384615384615386,
"grad_norm": 0.14129255712032318,
"learning_rate": 6.660944206008584e-05,
"loss": 0.2954,
"num_input_tokens_seen": 4834182,
"step": 783,
"train_runtime": 3444.8732,
"train_tokens_per_second": 1403.298
},
{
"epoch": 1.3401709401709403,
"grad_norm": 0.11984660476446152,
"learning_rate": 6.643776824034334e-05,
"loss": 0.3082,
"num_input_tokens_seen": 4840982,
"step": 784,
"train_runtime": 3449.1751,
"train_tokens_per_second": 1403.519
},
{
"epoch": 1.341880341880342,
"grad_norm": 0.09363918751478195,
"learning_rate": 6.626609442060086e-05,
"loss": 0.2449,
"num_input_tokens_seen": 4848502,
"step": 785,
"train_runtime": 3453.9244,
"train_tokens_per_second": 1403.766
},
{
"epoch": 1.3435897435897437,
"grad_norm": 0.1427582949399948,
"learning_rate": 6.609442060085838e-05,
"loss": 0.3177,
"num_input_tokens_seen": 4852918,
"step": 786,
"train_runtime": 3456.9516,
"train_tokens_per_second": 1403.814
},
{
"epoch": 1.3452991452991454,
"grad_norm": 0.17200025916099548,
"learning_rate": 6.592274678111588e-05,
"loss": 0.3403,
"num_input_tokens_seen": 4857702,
"step": 787,
"train_runtime": 3460.13,
"train_tokens_per_second": 1403.907
},
{
"epoch": 1.347008547008547,
"grad_norm": 0.11825034767389297,
"learning_rate": 6.57510729613734e-05,
"loss": 0.3184,
"num_input_tokens_seen": 4865798,
"step": 788,
"train_runtime": 3465.1861,
"train_tokens_per_second": 1404.195
},
{
"epoch": 1.3487179487179488,
"grad_norm": 0.12618689239025116,
"learning_rate": 6.557939914163091e-05,
"loss": 0.3325,
"num_input_tokens_seen": 4872190,
"step": 789,
"train_runtime": 3469.3589,
"train_tokens_per_second": 1404.349
},
{
"epoch": 1.3504273504273505,
"grad_norm": 0.152120903134346,
"learning_rate": 6.540772532188841e-05,
"loss": 0.4916,
"num_input_tokens_seen": 4879126,
"step": 790,
"train_runtime": 3473.7659,
"train_tokens_per_second": 1404.564
},
{
"epoch": 1.3521367521367522,
"grad_norm": 0.18881268799304962,
"learning_rate": 6.523605150214593e-05,
"loss": 0.3321,
"num_input_tokens_seen": 4885526,
"step": 791,
"train_runtime": 3477.8095,
"train_tokens_per_second": 1404.771
},
{
"epoch": 1.353846153846154,
"grad_norm": 0.11601816117763519,
"learning_rate": 6.506437768240343e-05,
"loss": 0.3422,
"num_input_tokens_seen": 4892726,
"step": 792,
"train_runtime": 3482.3464,
"train_tokens_per_second": 1405.008
},
{
"epoch": 1.3555555555555556,
"grad_norm": 0.14055293798446655,
"learning_rate": 6.489270386266095e-05,
"loss": 0.3659,
"num_input_tokens_seen": 4898358,
"step": 793,
"train_runtime": 3485.9704,
"train_tokens_per_second": 1405.163
},
{
"epoch": 1.3572649572649573,
"grad_norm": 0.13708831369876862,
"learning_rate": 6.472103004291846e-05,
"loss": 0.3883,
"num_input_tokens_seen": 4903222,
"step": 794,
"train_runtime": 3489.2494,
"train_tokens_per_second": 1405.237
},
{
"epoch": 1.358974358974359,
"grad_norm": 0.1181880459189415,
"learning_rate": 6.454935622317597e-05,
"loss": 0.3499,
"num_input_tokens_seen": 4909550,
"step": 795,
"train_runtime": 3493.3108,
"train_tokens_per_second": 1405.415
},
{
"epoch": 1.3606837606837607,
"grad_norm": 0.1416664868593216,
"learning_rate": 6.437768240343348e-05,
"loss": 0.3251,
"num_input_tokens_seen": 4914894,
"step": 796,
"train_runtime": 3496.8801,
"train_tokens_per_second": 1405.508
},
{
"epoch": 1.3623931623931624,
"grad_norm": 0.14663483202457428,
"learning_rate": 6.4206008583691e-05,
"loss": 0.4227,
"num_input_tokens_seen": 4921046,
"step": 797,
"train_runtime": 3500.8366,
"train_tokens_per_second": 1405.677
},
{
"epoch": 1.3641025641025641,
"grad_norm": 0.1496182233095169,
"learning_rate": 6.40343347639485e-05,
"loss": 0.4552,
"num_input_tokens_seen": 4927342,
"step": 798,
"train_runtime": 3504.826,
"train_tokens_per_second": 1405.874
},
{
"epoch": 1.3658119658119658,
"grad_norm": 0.15900661051273346,
"learning_rate": 6.386266094420602e-05,
"loss": 0.3935,
"num_input_tokens_seen": 4933422,
"step": 799,
"train_runtime": 3508.8577,
"train_tokens_per_second": 1405.991
},
{
"epoch": 1.3675213675213675,
"grad_norm": 0.16213171184062958,
"learning_rate": 6.369098712446352e-05,
"loss": 0.3777,
"num_input_tokens_seen": 4937910,
"step": 800,
"train_runtime": 3511.8753,
"train_tokens_per_second": 1406.061
},
{
"epoch": 1.3692307692307693,
"grad_norm": 0.1332091987133026,
"learning_rate": 6.351931330472103e-05,
"loss": 0.3411,
"num_input_tokens_seen": 4945310,
"step": 801,
"train_runtime": 3516.581,
"train_tokens_per_second": 1406.284
},
{
"epoch": 1.370940170940171,
"grad_norm": 0.12687839567661285,
"learning_rate": 6.334763948497855e-05,
"loss": 0.3497,
"num_input_tokens_seen": 4952318,
"step": 802,
"train_runtime": 3521.058,
"train_tokens_per_second": 1406.486
},
{
"epoch": 1.3726495726495727,
"grad_norm": 0.13601604104042053,
"learning_rate": 6.317596566523607e-05,
"loss": 0.3821,
"num_input_tokens_seen": 4957638,
"step": 803,
"train_runtime": 3524.6153,
"train_tokens_per_second": 1406.576
},
{
"epoch": 1.3743589743589744,
"grad_norm": 0.12945939600467682,
"learning_rate": 6.300429184549357e-05,
"loss": 0.3478,
"num_input_tokens_seen": 4964622,
"step": 804,
"train_runtime": 3529.0468,
"train_tokens_per_second": 1406.788
},
{
"epoch": 1.376068376068376,
"grad_norm": 0.13379725813865662,
"learning_rate": 6.283261802575108e-05,
"loss": 0.3145,
"num_input_tokens_seen": 4975366,
"step": 805,
"train_runtime": 3535.554,
"train_tokens_per_second": 1407.238
},
{
"epoch": 1.3777777777777778,
"grad_norm": 0.12784002721309662,
"learning_rate": 6.266094420600859e-05,
"loss": 0.3537,
"num_input_tokens_seen": 4984470,
"step": 806,
"train_runtime": 3541.2817,
"train_tokens_per_second": 1407.533
},
{
"epoch": 1.3794871794871795,
"grad_norm": 0.1543240249156952,
"learning_rate": 6.24892703862661e-05,
"loss": 0.5405,
"num_input_tokens_seen": 4990494,
"step": 807,
"train_runtime": 3545.1709,
"train_tokens_per_second": 1407.688
},
{
"epoch": 1.3811965811965812,
"grad_norm": 0.14580953121185303,
"learning_rate": 6.23175965665236e-05,
"loss": 0.3638,
"num_input_tokens_seen": 4996022,
"step": 808,
"train_runtime": 3548.7602,
"train_tokens_per_second": 1407.822
},
{
"epoch": 1.3829059829059829,
"grad_norm": 0.13987824320793152,
"learning_rate": 6.214592274678112e-05,
"loss": 0.2967,
"num_input_tokens_seen": 5003358,
"step": 809,
"train_runtime": 3553.3322,
"train_tokens_per_second": 1408.075
},
{
"epoch": 1.3846153846153846,
"grad_norm": 0.15021635591983795,
"learning_rate": 6.197424892703862e-05,
"loss": 0.3521,
"num_input_tokens_seen": 5009470,
"step": 810,
"train_runtime": 3557.3125,
"train_tokens_per_second": 1408.218
},
{
"epoch": 1.3863247863247863,
"grad_norm": 0.17432373762130737,
"learning_rate": 6.180257510729615e-05,
"loss": 0.4223,
"num_input_tokens_seen": 5013910,
"step": 811,
"train_runtime": 3562.3066,
"train_tokens_per_second": 1407.49
},
{
"epoch": 1.388034188034188,
"grad_norm": 0.12946096062660217,
"learning_rate": 6.163090128755365e-05,
"loss": 0.3144,
"num_input_tokens_seen": 5020934,
"step": 812,
"train_runtime": 3566.7167,
"train_tokens_per_second": 1407.719
},
{
"epoch": 1.3897435897435897,
"grad_norm": 0.14947237074375153,
"learning_rate": 6.145922746781117e-05,
"loss": 0.3538,
"num_input_tokens_seen": 5026366,
"step": 813,
"train_runtime": 3570.2494,
"train_tokens_per_second": 1407.847
},
{
"epoch": 1.3914529914529914,
"grad_norm": 0.16150113940238953,
"learning_rate": 6.128755364806867e-05,
"loss": 0.4022,
"num_input_tokens_seen": 5032670,
"step": 814,
"train_runtime": 3574.3152,
"train_tokens_per_second": 1408.01
},
{
"epoch": 1.393162393162393,
"grad_norm": 0.13235805928707123,
"learning_rate": 6.111587982832619e-05,
"loss": 0.4002,
"num_input_tokens_seen": 5038006,
"step": 815,
"train_runtime": 3577.9246,
"train_tokens_per_second": 1408.081
},
{
"epoch": 1.3948717948717948,
"grad_norm": 0.13235850632190704,
"learning_rate": 6.094420600858369e-05,
"loss": 0.3106,
"num_input_tokens_seen": 5042966,
"step": 816,
"train_runtime": 3581.2275,
"train_tokens_per_second": 1408.167
},
{
"epoch": 1.3965811965811965,
"grad_norm": 0.12829095125198364,
"learning_rate": 6.07725321888412e-05,
"loss": 0.3089,
"num_input_tokens_seen": 5048478,
"step": 817,
"train_runtime": 3584.7901,
"train_tokens_per_second": 1408.305
},
{
"epoch": 1.3982905982905982,
"grad_norm": 0.128507599234581,
"learning_rate": 6.060085836909871e-05,
"loss": 0.3642,
"num_input_tokens_seen": 5054262,
"step": 818,
"train_runtime": 3588.5263,
"train_tokens_per_second": 1408.451
},
{
"epoch": 1.4,
"grad_norm": 0.1573978215456009,
"learning_rate": 6.042918454935622e-05,
"loss": 0.4736,
"num_input_tokens_seen": 5059318,
"step": 819,
"train_runtime": 3591.913,
"train_tokens_per_second": 1408.53
},
{
"epoch": 1.4,
"eval_loss": 0.40713953971862793,
"eval_runtime": 39.9732,
"eval_samples_per_second": 24.967,
"eval_steps_per_second": 3.127,
"num_input_tokens_seen": 5059318,
"step": 819
},
{
"epoch": 1.4017094017094016,
"grad_norm": 0.14844471216201782,
"learning_rate": 6.025751072961374e-05,
"loss": 0.357,
"num_input_tokens_seen": 5065662,
"step": 820,
"train_runtime": 3635.9646,
"train_tokens_per_second": 1393.21
},
{
"epoch": 1.4034188034188033,
"grad_norm": 0.1275315284729004,
"learning_rate": 6.008583690987125e-05,
"loss": 0.3142,
"num_input_tokens_seen": 5072030,
"step": 821,
"train_runtime": 3639.9817,
"train_tokens_per_second": 1393.422
},
{
"epoch": 1.405128205128205,
"grad_norm": 0.1327238231897354,
"learning_rate": 5.991416309012876e-05,
"loss": 0.3219,
"num_input_tokens_seen": 5077102,
"step": 822,
"train_runtime": 3643.3247,
"train_tokens_per_second": 1393.535
},
{
"epoch": 1.4068376068376067,
"grad_norm": 0.1424541175365448,
"learning_rate": 5.974248927038627e-05,
"loss": 0.3149,
"num_input_tokens_seen": 5084094,
"step": 823,
"train_runtime": 3647.8224,
"train_tokens_per_second": 1393.734
},
{
"epoch": 1.4085470085470084,
"grad_norm": 0.1389557421207428,
"learning_rate": 5.957081545064378e-05,
"loss": 0.388,
"num_input_tokens_seen": 5089366,
"step": 824,
"train_runtime": 3651.3158,
"train_tokens_per_second": 1393.844
},
{
"epoch": 1.4102564102564101,
"grad_norm": 0.16298536956310272,
"learning_rate": 5.939914163090129e-05,
"loss": 0.4075,
"num_input_tokens_seen": 5094734,
"step": 825,
"train_runtime": 3654.7291,
"train_tokens_per_second": 1394.011
},
{
"epoch": 1.4119658119658118,
"grad_norm": 0.12247509509325027,
"learning_rate": 5.9227467811158796e-05,
"loss": 0.3127,
"num_input_tokens_seen": 5102198,
"step": 826,
"train_runtime": 3659.4415,
"train_tokens_per_second": 1394.256
},
{
"epoch": 1.4136752136752135,
"grad_norm": 0.15482676029205322,
"learning_rate": 5.9055793991416305e-05,
"loss": 0.3002,
"num_input_tokens_seen": 5111134,
"step": 827,
"train_runtime": 3665.0056,
"train_tokens_per_second": 1394.577
},
{
"epoch": 1.4153846153846155,
"grad_norm": 0.14611922204494476,
"learning_rate": 5.888412017167382e-05,
"loss": 0.352,
"num_input_tokens_seen": 5115230,
"step": 828,
"train_runtime": 3667.7611,
"train_tokens_per_second": 1394.646
},
{
"epoch": 1.4170940170940172,
"grad_norm": 0.17032893002033234,
"learning_rate": 5.871244635193134e-05,
"loss": 0.3732,
"num_input_tokens_seen": 5120990,
"step": 829,
"train_runtime": 3671.46,
"train_tokens_per_second": 1394.81
},
{
"epoch": 1.4188034188034189,
"grad_norm": 0.13741740584373474,
"learning_rate": 5.8540772532188846e-05,
"loss": 0.2781,
"num_input_tokens_seen": 5126070,
"step": 830,
"train_runtime": 3674.8572,
"train_tokens_per_second": 1394.903
},
{
"epoch": 1.4205128205128206,
"grad_norm": 0.1337319314479828,
"learning_rate": 5.8369098712446355e-05,
"loss": 0.2903,
"num_input_tokens_seen": 5131270,
"step": 831,
"train_runtime": 3678.3235,
"train_tokens_per_second": 1395.002
},
{
"epoch": 1.4222222222222223,
"grad_norm": 0.14914950728416443,
"learning_rate": 5.8197424892703864e-05,
"loss": 0.3417,
"num_input_tokens_seen": 5136918,
"step": 832,
"train_runtime": 3682.0496,
"train_tokens_per_second": 1395.125
},
{
"epoch": 1.423931623931624,
"grad_norm": 0.162494957447052,
"learning_rate": 5.8025751072961374e-05,
"loss": 0.423,
"num_input_tokens_seen": 5142158,
"step": 833,
"train_runtime": 3685.5503,
"train_tokens_per_second": 1395.221
},
{
"epoch": 1.4256410256410257,
"grad_norm": 0.14546248316764832,
"learning_rate": 5.785407725321888e-05,
"loss": 0.3648,
"num_input_tokens_seen": 5148094,
"step": 834,
"train_runtime": 3689.3363,
"train_tokens_per_second": 1395.398
},
{
"epoch": 1.4273504273504274,
"grad_norm": 0.15214349329471588,
"learning_rate": 5.768240343347639e-05,
"loss": 0.3288,
"num_input_tokens_seen": 5152742,
"step": 835,
"train_runtime": 3692.4044,
"train_tokens_per_second": 1395.498
},
{
"epoch": 1.429059829059829,
"grad_norm": 0.13268783688545227,
"learning_rate": 5.751072961373391e-05,
"loss": 0.3101,
"num_input_tokens_seen": 5158358,
"step": 836,
"train_runtime": 3696.043,
"train_tokens_per_second": 1395.643
},
{
"epoch": 1.4307692307692308,
"grad_norm": 0.1861671358346939,
"learning_rate": 5.733905579399142e-05,
"loss": 0.4137,
"num_input_tokens_seen": 5163294,
"step": 837,
"train_runtime": 3699.3676,
"train_tokens_per_second": 1395.723
},
{
"epoch": 1.4324786324786325,
"grad_norm": 0.13023094832897186,
"learning_rate": 5.716738197424893e-05,
"loss": 0.3631,
"num_input_tokens_seen": 5168686,
"step": 838,
"train_runtime": 3702.9614,
"train_tokens_per_second": 1395.825
},
{
"epoch": 1.4341880341880342,
"grad_norm": 0.11844179034233093,
"learning_rate": 5.699570815450644e-05,
"loss": 0.2492,
"num_input_tokens_seen": 5177182,
"step": 839,
"train_runtime": 3708.2961,
"train_tokens_per_second": 1396.108
},
{
"epoch": 1.435897435897436,
"grad_norm": 0.15760420262813568,
"learning_rate": 5.682403433476395e-05,
"loss": 0.3296,
"num_input_tokens_seen": 5181222,
"step": 840,
"train_runtime": 3711.0998,
"train_tokens_per_second": 1396.142
},
{
"epoch": 1.4376068376068376,
"grad_norm": 0.1670273393392563,
"learning_rate": 5.665236051502146e-05,
"loss": 0.3472,
"num_input_tokens_seen": 5188286,
"step": 841,
"train_runtime": 3717.6952,
"train_tokens_per_second": 1395.565
},
{
"epoch": 1.4393162393162393,
"grad_norm": 0.16332553327083588,
"learning_rate": 5.648068669527897e-05,
"loss": 0.3388,
"num_input_tokens_seen": 5192998,
"step": 842,
"train_runtime": 3720.9156,
"train_tokens_per_second": 1395.624
},
{
"epoch": 1.441025641025641,
"grad_norm": 0.15031462907791138,
"learning_rate": 5.6309012875536485e-05,
"loss": 0.4377,
"num_input_tokens_seen": 5198462,
"step": 843,
"train_runtime": 3724.5247,
"train_tokens_per_second": 1395.738
},
{
"epoch": 1.4427350427350427,
"grad_norm": 0.13682641088962555,
"learning_rate": 5.6137339055793995e-05,
"loss": 0.2486,
"num_input_tokens_seen": 5202982,
"step": 844,
"train_runtime": 3727.5494,
"train_tokens_per_second": 1395.818
},
{
"epoch": 1.4444444444444444,
"grad_norm": 0.1407112032175064,
"learning_rate": 5.5965665236051504e-05,
"loss": 0.3894,
"num_input_tokens_seen": 5211254,
"step": 845,
"train_runtime": 3732.8344,
"train_tokens_per_second": 1396.058
},
{
"epoch": 1.4461538461538461,
"grad_norm": 0.16395379602909088,
"learning_rate": 5.579399141630901e-05,
"loss": 0.5773,
"num_input_tokens_seen": 5216782,
"step": 846,
"train_runtime": 3736.5208,
"train_tokens_per_second": 1396.16
},
{
"epoch": 1.4478632478632478,
"grad_norm": 0.13352353870868683,
"learning_rate": 5.562231759656653e-05,
"loss": 0.3843,
"num_input_tokens_seen": 5222070,
"step": 847,
"train_runtime": 3740.0075,
"train_tokens_per_second": 1396.273
},
{
"epoch": 1.4495726495726495,
"grad_norm": 0.1692342758178711,
"learning_rate": 5.545064377682404e-05,
"loss": 0.4467,
"num_input_tokens_seen": 5227246,
"step": 848,
"train_runtime": 3743.4389,
"train_tokens_per_second": 1396.375
},
{
"epoch": 1.4512820512820512,
"grad_norm": 0.15134482085704803,
"learning_rate": 5.527896995708155e-05,
"loss": 0.241,
"num_input_tokens_seen": 5235518,
"step": 849,
"train_runtime": 3748.4958,
"train_tokens_per_second": 1396.698
},
{
"epoch": 1.452991452991453,
"grad_norm": 0.14503733813762665,
"learning_rate": 5.5107296137339056e-05,
"loss": 0.3709,
"num_input_tokens_seen": 5240966,
"step": 850,
"train_runtime": 3752.1211,
"train_tokens_per_second": 1396.801
},
{
"epoch": 1.4547008547008546,
"grad_norm": 0.1375107765197754,
"learning_rate": 5.493562231759657e-05,
"loss": 0.2942,
"num_input_tokens_seen": 5245934,
"step": 851,
"train_runtime": 3755.3802,
"train_tokens_per_second": 1396.912
},
{
"epoch": 1.4564102564102563,
"grad_norm": 0.122276172041893,
"learning_rate": 5.476394849785408e-05,
"loss": 0.3244,
"num_input_tokens_seen": 5253238,
"step": 852,
"train_runtime": 3759.9878,
"train_tokens_per_second": 1397.142
},
{
"epoch": 1.458119658119658,
"grad_norm": 0.15556900203227997,
"learning_rate": 5.459227467811159e-05,
"loss": 0.3869,
"num_input_tokens_seen": 5259758,
"step": 853,
"train_runtime": 3764.1834,
"train_tokens_per_second": 1397.317
},
{
"epoch": 1.4598290598290597,
"grad_norm": 0.14983288943767548,
"learning_rate": 5.44206008583691e-05,
"loss": 0.385,
"num_input_tokens_seen": 5265518,
"step": 854,
"train_runtime": 3767.8711,
"train_tokens_per_second": 1397.478
},
{
"epoch": 1.4615384615384617,
"grad_norm": 0.1455240398645401,
"learning_rate": 5.424892703862661e-05,
"loss": 0.4104,
"num_input_tokens_seen": 5272654,
"step": 855,
"train_runtime": 3772.3838,
"train_tokens_per_second": 1397.698
},
{
"epoch": 1.4632478632478634,
"grad_norm": 0.19445322453975677,
"learning_rate": 5.4077253218884125e-05,
"loss": 0.4355,
"num_input_tokens_seen": 5279846,
"step": 856,
"train_runtime": 3776.8801,
"train_tokens_per_second": 1397.938
},
{
"epoch": 1.464957264957265,
"grad_norm": 0.15882650017738342,
"learning_rate": 5.3905579399141634e-05,
"loss": 0.4704,
"num_input_tokens_seen": 5284854,
"step": 857,
"train_runtime": 3780.1753,
"train_tokens_per_second": 1398.045
},
{
"epoch": 1.4666666666666668,
"grad_norm": 0.14064083993434906,
"learning_rate": 5.373390557939915e-05,
"loss": 0.4001,
"num_input_tokens_seen": 5290262,
"step": 858,
"train_runtime": 3783.6813,
"train_tokens_per_second": 1398.179
},
{
"epoch": 1.4683760683760685,
"grad_norm": 0.13175015151500702,
"learning_rate": 5.356223175965666e-05,
"loss": 0.4009,
"num_input_tokens_seen": 5299142,
"step": 859,
"train_runtime": 3789.1831,
"train_tokens_per_second": 1398.492
},
{
"epoch": 1.4700854700854702,
"grad_norm": 0.12459183484315872,
"learning_rate": 5.339055793991417e-05,
"loss": 0.5154,
"num_input_tokens_seen": 5305334,
"step": 860,
"train_runtime": 3793.1945,
"train_tokens_per_second": 1398.645
},
{
"epoch": 1.471794871794872,
"grad_norm": 0.13496418297290802,
"learning_rate": 5.321888412017168e-05,
"loss": 0.5302,
"num_input_tokens_seen": 5312582,
"step": 861,
"train_runtime": 3797.8243,
"train_tokens_per_second": 1398.849
},
{
"epoch": 1.4735042735042736,
"grad_norm": 0.12612996995449066,
"learning_rate": 5.3047210300429186e-05,
"loss": 0.3437,
"num_input_tokens_seen": 5318646,
"step": 862,
"train_runtime": 3801.9229,
"train_tokens_per_second": 1398.936
},
{
"epoch": 1.4752136752136753,
"grad_norm": 0.15236078202724457,
"learning_rate": 5.2875536480686695e-05,
"loss": 0.3329,
"num_input_tokens_seen": 5323214,
"step": 863,
"train_runtime": 3804.9799,
"train_tokens_per_second": 1399.012
},
{
"epoch": 1.476923076923077,
"grad_norm": 0.14306163787841797,
"learning_rate": 5.2703862660944205e-05,
"loss": 0.3123,
"num_input_tokens_seen": 5328902,
"step": 864,
"train_runtime": 3808.7041,
"train_tokens_per_second": 1399.138
},
{
"epoch": 1.4786324786324787,
"grad_norm": 0.1255759447813034,
"learning_rate": 5.253218884120172e-05,
"loss": 0.2965,
"num_input_tokens_seen": 5334094,
"step": 865,
"train_runtime": 3812.1793,
"train_tokens_per_second": 1399.224
},
{
"epoch": 1.4803418803418804,
"grad_norm": 0.15679959952831268,
"learning_rate": 5.2360515021459236e-05,
"loss": 0.5092,
"num_input_tokens_seen": 5339710,
"step": 866,
"train_runtime": 3815.8784,
"train_tokens_per_second": 1399.34
},
{
"epoch": 1.4820512820512821,
"grad_norm": 0.14153476059436798,
"learning_rate": 5.2188841201716746e-05,
"loss": 0.3473,
"num_input_tokens_seen": 5346190,
"step": 867,
"train_runtime": 3819.9095,
"train_tokens_per_second": 1399.559
},
{
"epoch": 1.4837606837606838,
"grad_norm": 0.13382677733898163,
"learning_rate": 5.2017167381974255e-05,
"loss": 0.3588,
"num_input_tokens_seen": 5352462,
"step": 868,
"train_runtime": 3824.0287,
"train_tokens_per_second": 1399.692
},
{
"epoch": 1.4854700854700855,
"grad_norm": 0.16382722556591034,
"learning_rate": 5.1845493562231764e-05,
"loss": 0.3964,
"num_input_tokens_seen": 5356254,
"step": 869,
"train_runtime": 3826.6221,
"train_tokens_per_second": 1399.734
},
{
"epoch": 1.4871794871794872,
"grad_norm": 0.14120569825172424,
"learning_rate": 5.167381974248927e-05,
"loss": 0.3463,
"num_input_tokens_seen": 5363590,
"step": 870,
"train_runtime": 3831.2189,
"train_tokens_per_second": 1399.97
},
{
"epoch": 1.488888888888889,
"grad_norm": 0.16003507375717163,
"learning_rate": 5.150214592274678e-05,
"loss": 0.3489,
"num_input_tokens_seen": 5368462,
"step": 871,
"train_runtime": 3836.5884,
"train_tokens_per_second": 1399.28
},
{
"epoch": 1.4905982905982906,
"grad_norm": 0.1279754787683487,
"learning_rate": 5.133047210300429e-05,
"loss": 0.341,
"num_input_tokens_seen": 5373550,
"step": 872,
"train_runtime": 3840.064,
"train_tokens_per_second": 1399.339
},
{
"epoch": 1.4923076923076923,
"grad_norm": 0.16718865931034088,
"learning_rate": 5.11587982832618e-05,
"loss": 0.3997,
"num_input_tokens_seen": 5379134,
"step": 873,
"train_runtime": 3843.6488,
"train_tokens_per_second": 1399.486
},
{
"epoch": 1.494017094017094,
"grad_norm": 0.12986551225185394,
"learning_rate": 5.098712446351932e-05,
"loss": 0.3132,
"num_input_tokens_seen": 5388758,
"step": 874,
"train_runtime": 3849.7111,
"train_tokens_per_second": 1399.782
},
{
"epoch": 1.4957264957264957,
"grad_norm": 0.1360234171152115,
"learning_rate": 5.081545064377683e-05,
"loss": 0.2856,
"num_input_tokens_seen": 5393182,
"step": 875,
"train_runtime": 3852.7029,
"train_tokens_per_second": 1399.844
},
{
"epoch": 1.4974358974358974,
"grad_norm": 0.17069897055625916,
"learning_rate": 5.064377682403434e-05,
"loss": 0.4769,
"num_input_tokens_seen": 5398094,
"step": 876,
"train_runtime": 3856.0373,
"train_tokens_per_second": 1399.907
},
{
"epoch": 1.4991452991452991,
"grad_norm": 0.15237049758434296,
"learning_rate": 5.047210300429185e-05,
"loss": 0.3108,
"num_input_tokens_seen": 5406302,
"step": 877,
"train_runtime": 3861.1411,
"train_tokens_per_second": 1400.182
},
{
"epoch": 1.5008547008547009,
"grad_norm": 0.18374916911125183,
"learning_rate": 5.030042918454936e-05,
"loss": 0.3626,
"num_input_tokens_seen": 5410838,
"step": 878,
"train_runtime": 3864.2838,
"train_tokens_per_second": 1400.218
},
{
"epoch": 1.5025641025641026,
"grad_norm": 0.15585371851921082,
"learning_rate": 5.012875536480687e-05,
"loss": 0.3773,
"num_input_tokens_seen": 5417318,
"step": 879,
"train_runtime": 3868.4233,
"train_tokens_per_second": 1400.394
},
{
"epoch": 1.5042735042735043,
"grad_norm": 0.18755033612251282,
"learning_rate": 4.9957081545064385e-05,
"loss": 0.4022,
"num_input_tokens_seen": 5421910,
"step": 880,
"train_runtime": 3871.5671,
"train_tokens_per_second": 1400.443
},
{
"epoch": 1.505982905982906,
"grad_norm": 0.1306111067533493,
"learning_rate": 4.9785407725321894e-05,
"loss": 0.2989,
"num_input_tokens_seen": 5427630,
"step": 881,
"train_runtime": 3875.3642,
"train_tokens_per_second": 1400.547
},
{
"epoch": 1.5076923076923077,
"grad_norm": 0.14471091330051422,
"learning_rate": 4.96137339055794e-05,
"loss": 0.3487,
"num_input_tokens_seen": 5434654,
"step": 882,
"train_runtime": 3879.7092,
"train_tokens_per_second": 1400.789
},
{
"epoch": 1.5094017094017094,
"grad_norm": 0.1394500881433487,
"learning_rate": 4.944206008583691e-05,
"loss": 0.3425,
"num_input_tokens_seen": 5441006,
"step": 883,
"train_runtime": 3883.8235,
"train_tokens_per_second": 1400.941
},
{
"epoch": 1.511111111111111,
"grad_norm": 0.1315561830997467,
"learning_rate": 4.927038626609442e-05,
"loss": 0.2697,
"num_input_tokens_seen": 5445926,
"step": 884,
"train_runtime": 3887.1139,
"train_tokens_per_second": 1401.02
},
{
"epoch": 1.5128205128205128,
"grad_norm": 0.14249852299690247,
"learning_rate": 4.909871244635194e-05,
"loss": 0.3622,
"num_input_tokens_seen": 5452246,
"step": 885,
"train_runtime": 3891.1997,
"train_tokens_per_second": 1401.174
},
{
"epoch": 1.5145299145299145,
"grad_norm": 0.16895607113838196,
"learning_rate": 4.8927038626609446e-05,
"loss": 0.4891,
"num_input_tokens_seen": 5456854,
"step": 886,
"train_runtime": 3894.3609,
"train_tokens_per_second": 1401.219
},
{
"epoch": 1.5162393162393162,
"grad_norm": 0.1550210863351822,
"learning_rate": 4.8755364806866956e-05,
"loss": 0.4051,
"num_input_tokens_seen": 5463430,
"step": 887,
"train_runtime": 3898.5586,
"train_tokens_per_second": 1401.397
},
{
"epoch": 1.5179487179487179,
"grad_norm": 0.1588016301393509,
"learning_rate": 4.8583690987124465e-05,
"loss": 0.3086,
"num_input_tokens_seen": 5468830,
"step": 888,
"train_runtime": 3902.1609,
"train_tokens_per_second": 1401.488
},
{
"epoch": 1.5196581196581196,
"grad_norm": 0.1528807431459427,
"learning_rate": 4.841201716738198e-05,
"loss": 0.384,
"num_input_tokens_seen": 5474166,
"step": 889,
"train_runtime": 3905.7353,
"train_tokens_per_second": 1401.571
},
{
"epoch": 1.5213675213675213,
"grad_norm": 0.1336115598678589,
"learning_rate": 4.824034334763949e-05,
"loss": 0.337,
"num_input_tokens_seen": 5480990,
"step": 890,
"train_runtime": 3910.1338,
"train_tokens_per_second": 1401.74
},
{
"epoch": 1.523076923076923,
"grad_norm": 0.14113153517246246,
"learning_rate": 4.8068669527897e-05,
"loss": 0.3582,
"num_input_tokens_seen": 5487366,
"step": 891,
"train_runtime": 3914.2226,
"train_tokens_per_second": 1401.904
},
{
"epoch": 1.5247863247863247,
"grad_norm": 0.14740779995918274,
"learning_rate": 4.789699570815451e-05,
"loss": 0.3241,
"num_input_tokens_seen": 5491782,
"step": 892,
"train_runtime": 3917.2888,
"train_tokens_per_second": 1401.934
},
{
"epoch": 1.5264957264957264,
"grad_norm": 0.1684054136276245,
"learning_rate": 4.772532188841202e-05,
"loss": 0.3419,
"num_input_tokens_seen": 5498598,
"step": 893,
"train_runtime": 3921.6413,
"train_tokens_per_second": 1402.116
},
{
"epoch": 1.528205128205128,
"grad_norm": 0.1600559949874878,
"learning_rate": 4.755364806866953e-05,
"loss": 0.3971,
"num_input_tokens_seen": 5504558,
"step": 894,
"train_runtime": 3925.5164,
"train_tokens_per_second": 1402.251
},
{
"epoch": 1.5299145299145298,
"grad_norm": 0.16193747520446777,
"learning_rate": 4.738197424892704e-05,
"loss": 0.1982,
"num_input_tokens_seen": 5518366,
"step": 895,
"train_runtime": 3933.7663,
"train_tokens_per_second": 1402.82
},
{
"epoch": 1.5316239316239315,
"grad_norm": 0.1655426323413849,
"learning_rate": 4.721030042918455e-05,
"loss": 0.4295,
"num_input_tokens_seen": 5523782,
"step": 896,
"train_runtime": 3937.3438,
"train_tokens_per_second": 1402.921
},
{
"epoch": 1.5333333333333332,
"grad_norm": 0.18400371074676514,
"learning_rate": 4.703862660944206e-05,
"loss": 0.4301,
"num_input_tokens_seen": 5529142,
"step": 897,
"train_runtime": 3940.9012,
"train_tokens_per_second": 1403.015
},
{
"epoch": 1.535042735042735,
"grad_norm": 0.1289558857679367,
"learning_rate": 4.6866952789699576e-05,
"loss": 0.2999,
"num_input_tokens_seen": 5536438,
"step": 898,
"train_runtime": 3945.5414,
"train_tokens_per_second": 1403.214
},
{
"epoch": 1.5367521367521366,
"grad_norm": 0.13847073912620544,
"learning_rate": 4.6695278969957086e-05,
"loss": 0.4114,
"num_input_tokens_seen": 5544542,
"step": 899,
"train_runtime": 3950.6248,
"train_tokens_per_second": 1403.46
},
{
"epoch": 1.5384615384615383,
"grad_norm": 0.130548357963562,
"learning_rate": 4.6523605150214595e-05,
"loss": 0.3208,
"num_input_tokens_seen": 5551966,
"step": 900,
"train_runtime": 3955.355,
"train_tokens_per_second": 1403.658
},
{
"epoch": 1.54017094017094,
"grad_norm": 0.12483415752649307,
"learning_rate": 4.6351931330472104e-05,
"loss": 0.3094,
"num_input_tokens_seen": 5559310,
"step": 901,
"train_runtime": 3962.2691,
"train_tokens_per_second": 1403.062
},
{
"epoch": 1.5418803418803417,
"grad_norm": 0.1626817137002945,
"learning_rate": 4.618025751072962e-05,
"loss": 0.5097,
"num_input_tokens_seen": 5566126,
"step": 902,
"train_runtime": 3966.5485,
"train_tokens_per_second": 1403.267
},
{
"epoch": 1.5435897435897434,
"grad_norm": 0.12783609330654144,
"learning_rate": 4.600858369098713e-05,
"loss": 0.376,
"num_input_tokens_seen": 5573526,
"step": 903,
"train_runtime": 3971.1289,
"train_tokens_per_second": 1403.512
},
{
"epoch": 1.5452991452991451,
"grad_norm": 0.12774644792079926,
"learning_rate": 4.583690987124464e-05,
"loss": 0.3011,
"num_input_tokens_seen": 5579950,
"step": 904,
"train_runtime": 3975.2459,
"train_tokens_per_second": 1403.674
},
{
"epoch": 1.547008547008547,
"grad_norm": 0.13785552978515625,
"learning_rate": 4.566523605150215e-05,
"loss": 0.2532,
"num_input_tokens_seen": 5592222,
"step": 905,
"train_runtime": 3982.6088,
"train_tokens_per_second": 1404.161
},
{
"epoch": 1.5487179487179488,
"grad_norm": 0.10258350521326065,
"learning_rate": 4.5493562231759656e-05,
"loss": 0.2478,
"num_input_tokens_seen": 5601822,
"step": 906,
"train_runtime": 3988.4826,
"train_tokens_per_second": 1404.5
},
{
"epoch": 1.5504273504273505,
"grad_norm": 0.14077666401863098,
"learning_rate": 4.532188841201717e-05,
"loss": 0.2856,
"num_input_tokens_seen": 5606942,
"step": 907,
"train_runtime": 3991.8287,
"train_tokens_per_second": 1404.605
},
{
"epoch": 1.5521367521367522,
"grad_norm": 0.15848904848098755,
"learning_rate": 4.515021459227468e-05,
"loss": 0.4184,
"num_input_tokens_seen": 5611870,
"step": 908,
"train_runtime": 3995.0262,
"train_tokens_per_second": 1404.714
},
{
"epoch": 1.5538461538461539,
"grad_norm": 0.14436501264572144,
"learning_rate": 4.497854077253219e-05,
"loss": 0.3977,
"num_input_tokens_seen": 5618398,
"step": 909,
"train_runtime": 3999.2042,
"train_tokens_per_second": 1404.879
},
{
"epoch": 1.5555555555555556,
"grad_norm": 0.13145920634269714,
"learning_rate": 4.48068669527897e-05,
"loss": 0.3204,
"num_input_tokens_seen": 5627286,
"step": 910,
"train_runtime": 4004.6715,
"train_tokens_per_second": 1405.18
},
{
"epoch": 1.5572649572649573,
"grad_norm": 0.15464188158512115,
"learning_rate": 4.4635193133047216e-05,
"loss": 0.2961,
"num_input_tokens_seen": 5631254,
"step": 911,
"train_runtime": 4007.4026,
"train_tokens_per_second": 1405.213
},
{
"epoch": 1.558974358974359,
"grad_norm": 0.15370634198188782,
"learning_rate": 4.4463519313304725e-05,
"loss": 0.3432,
"num_input_tokens_seen": 5638078,
"step": 912,
"train_runtime": 4011.673,
"train_tokens_per_second": 1405.418
},
{
"epoch": 1.5606837606837607,
"grad_norm": 0.11987742781639099,
"learning_rate": 4.4291845493562234e-05,
"loss": 0.2736,
"num_input_tokens_seen": 5647550,
"step": 913,
"train_runtime": 4017.4402,
"train_tokens_per_second": 1405.758
},
{
"epoch": 1.5623931623931624,
"grad_norm": 0.1432374119758606,
"learning_rate": 4.412017167381974e-05,
"loss": 0.3456,
"num_input_tokens_seen": 5654566,
"step": 914,
"train_runtime": 4021.8492,
"train_tokens_per_second": 1405.962
},
{
"epoch": 1.564102564102564,
"grad_norm": 0.14146411418914795,
"learning_rate": 4.394849785407725e-05,
"loss": 0.2831,
"num_input_tokens_seen": 5661366,
"step": 915,
"train_runtime": 4026.1282,
"train_tokens_per_second": 1406.156
},
{
"epoch": 1.5658119658119658,
"grad_norm": 0.1362568885087967,
"learning_rate": 4.377682403433477e-05,
"loss": 0.3261,
"num_input_tokens_seen": 5667022,
"step": 916,
"train_runtime": 4029.7803,
"train_tokens_per_second": 1406.286
},
{
"epoch": 1.5675213675213675,
"grad_norm": 0.13071489334106445,
"learning_rate": 4.360515021459228e-05,
"loss": 0.264,
"num_input_tokens_seen": 5674158,
"step": 917,
"train_runtime": 4034.3501,
"train_tokens_per_second": 1406.461
},
{
"epoch": 1.5692307692307692,
"grad_norm": 0.1308346837759018,
"learning_rate": 4.3433476394849786e-05,
"loss": 0.2655,
"num_input_tokens_seen": 5681038,
"step": 918,
"train_runtime": 4038.6578,
"train_tokens_per_second": 1406.665
},
{
"epoch": 1.570940170940171,
"grad_norm": 0.14354775846004486,
"learning_rate": 4.3261802575107296e-05,
"loss": 0.3548,
"num_input_tokens_seen": 5689142,
"step": 919,
"train_runtime": 4043.681,
"train_tokens_per_second": 1406.922
},
{
"epoch": 1.5726495726495726,
"grad_norm": 0.14994634687900543,
"learning_rate": 4.309012875536481e-05,
"loss": 0.3652,
"num_input_tokens_seen": 5694430,
"step": 920,
"train_runtime": 4047.0891,
"train_tokens_per_second": 1407.043
},
{
"epoch": 1.5743589743589743,
"grad_norm": 0.14056207239627838,
"learning_rate": 4.291845493562232e-05,
"loss": 0.2809,
"num_input_tokens_seen": 5699694,
"step": 921,
"train_runtime": 4050.4592,
"train_tokens_per_second": 1407.172
},
{
"epoch": 1.576068376068376,
"grad_norm": 0.1594097912311554,
"learning_rate": 4.274678111587983e-05,
"loss": 0.4683,
"num_input_tokens_seen": 5706182,
"step": 922,
"train_runtime": 4054.6337,
"train_tokens_per_second": 1407.324
},
{
"epoch": 1.5777777777777777,
"grad_norm": 0.16299133002758026,
"learning_rate": 4.257510729613734e-05,
"loss": 0.4031,
"num_input_tokens_seen": 5711566,
"step": 923,
"train_runtime": 4058.0973,
"train_tokens_per_second": 1407.449
},
{
"epoch": 1.5794871794871796,
"grad_norm": 0.18204393982887268,
"learning_rate": 4.240343347639485e-05,
"loss": 0.4191,
"num_input_tokens_seen": 5717422,
"step": 924,
"train_runtime": 4061.8526,
"train_tokens_per_second": 1407.59
},
{
"epoch": 1.5811965811965814,
"grad_norm": 0.16016630828380585,
"learning_rate": 4.2231759656652364e-05,
"loss": 0.3527,
"num_input_tokens_seen": 5721734,
"step": 925,
"train_runtime": 4064.8253,
"train_tokens_per_second": 1407.621
},
{
"epoch": 1.582905982905983,
"grad_norm": 0.15261352062225342,
"learning_rate": 4.206008583690987e-05,
"loss": 0.2939,
"num_input_tokens_seen": 5726726,
"step": 926,
"train_runtime": 4068.1454,
"train_tokens_per_second": 1407.699
},
{
"epoch": 1.5846153846153848,
"grad_norm": 0.14059829711914062,
"learning_rate": 4.188841201716738e-05,
"loss": 0.345,
"num_input_tokens_seen": 5732878,
"step": 927,
"train_runtime": 4072.1298,
"train_tokens_per_second": 1407.833
},
{
"epoch": 1.5863247863247865,
"grad_norm": 0.15168927609920502,
"learning_rate": 4.171673819742489e-05,
"loss": 0.2833,
"num_input_tokens_seen": 5738606,
"step": 928,
"train_runtime": 4075.9083,
"train_tokens_per_second": 1407.933
},
{
"epoch": 1.5880341880341882,
"grad_norm": 0.14608868956565857,
"learning_rate": 4.154506437768241e-05,
"loss": 0.3264,
"num_input_tokens_seen": 5744222,
"step": 929,
"train_runtime": 4079.5662,
"train_tokens_per_second": 1408.047
},
{
"epoch": 1.5897435897435899,
"grad_norm": 0.13235428929328918,
"learning_rate": 4.1373390557939917e-05,
"loss": 0.3547,
"num_input_tokens_seen": 5751422,
"step": 930,
"train_runtime": 4084.0105,
"train_tokens_per_second": 1408.278
},
{
"epoch": 1.5914529914529916,
"grad_norm": 0.15778063237667084,
"learning_rate": 4.1201716738197426e-05,
"loss": 0.3659,
"num_input_tokens_seen": 5757270,
"step": 931,
"train_runtime": 4089.841,
"train_tokens_per_second": 1407.7
},
{
"epoch": 1.5931623931623933,
"grad_norm": 0.14234130084514618,
"learning_rate": 4.1030042918454935e-05,
"loss": 0.3474,
"num_input_tokens_seen": 5763062,
"step": 932,
"train_runtime": 4093.5857,
"train_tokens_per_second": 1407.827
},
{
"epoch": 1.594871794871795,
"grad_norm": 0.15950438380241394,
"learning_rate": 4.0858369098712444e-05,
"loss": 0.3991,
"num_input_tokens_seen": 5769542,
"step": 933,
"train_runtime": 4097.7094,
"train_tokens_per_second": 1407.992
},
{
"epoch": 1.5965811965811967,
"grad_norm": 0.15297670662403107,
"learning_rate": 4.068669527896996e-05,
"loss": 0.4014,
"num_input_tokens_seen": 5777038,
"step": 934,
"train_runtime": 4102.3551,
"train_tokens_per_second": 1408.225
},
{
"epoch": 1.5982905982905984,
"grad_norm": 0.14198969304561615,
"learning_rate": 4.051502145922747e-05,
"loss": 0.324,
"num_input_tokens_seen": 5783518,
"step": 935,
"train_runtime": 4106.4425,
"train_tokens_per_second": 1408.401
},
{
"epoch": 1.6,
"grad_norm": 0.18063846230506897,
"learning_rate": 4.034334763948498e-05,
"loss": 0.2441,
"num_input_tokens_seen": 5789382,
"step": 936,
"train_runtime": 4110.1508,
"train_tokens_per_second": 1408.557
},
{
"epoch": 1.6,
"eval_loss": 0.4057992100715637,
"eval_runtime": 39.8829,
"eval_samples_per_second": 25.023,
"eval_steps_per_second": 3.134,
"num_input_tokens_seen": 5789382,
"step": 936
},
{
"epoch": 1.6017094017094018,
"grad_norm": 0.17349766194820404,
"learning_rate": 4.017167381974249e-05,
"loss": 0.4031,
"num_input_tokens_seen": 5793958,
"step": 937,
"train_runtime": 4153.1322,
"train_tokens_per_second": 1395.082
},
{
"epoch": 1.6034188034188035,
"grad_norm": 0.14728385210037231,
"learning_rate": 4e-05,
"loss": 0.3286,
"num_input_tokens_seen": 5801366,
"step": 938,
"train_runtime": 4157.8001,
"train_tokens_per_second": 1395.297
},
{
"epoch": 1.6051282051282052,
"grad_norm": 0.15259931981563568,
"learning_rate": 3.982832618025751e-05,
"loss": 0.3429,
"num_input_tokens_seen": 5807702,
"step": 939,
"train_runtime": 4161.8686,
"train_tokens_per_second": 1395.455
},
{
"epoch": 1.606837606837607,
"grad_norm": 0.15199637413024902,
"learning_rate": 3.965665236051502e-05,
"loss": 0.3543,
"num_input_tokens_seen": 5814662,
"step": 940,
"train_runtime": 4166.1977,
"train_tokens_per_second": 1395.676
},
{
"epoch": 1.6085470085470086,
"grad_norm": 0.16361570358276367,
"learning_rate": 3.948497854077253e-05,
"loss": 0.367,
"num_input_tokens_seen": 5819478,
"step": 941,
"train_runtime": 4169.3434,
"train_tokens_per_second": 1395.778
},
{
"epoch": 1.6102564102564103,
"grad_norm": 0.1512775421142578,
"learning_rate": 3.931330472103004e-05,
"loss": 0.338,
"num_input_tokens_seen": 5826830,
"step": 942,
"train_runtime": 4173.9012,
"train_tokens_per_second": 1396.015
},
{
"epoch": 1.611965811965812,
"grad_norm": 0.1339310258626938,
"learning_rate": 3.9141630901287556e-05,
"loss": 0.3077,
"num_input_tokens_seen": 5833174,
"step": 943,
"train_runtime": 4178.0154,
"train_tokens_per_second": 1396.159
},
{
"epoch": 1.6136752136752137,
"grad_norm": 0.17570827901363373,
"learning_rate": 3.8969957081545065e-05,
"loss": 0.3698,
"num_input_tokens_seen": 5837766,
"step": 944,
"train_runtime": 4181.1294,
"train_tokens_per_second": 1396.217
},
{
"epoch": 1.6153846153846154,
"grad_norm": 0.1571483314037323,
"learning_rate": 3.8798283261802574e-05,
"loss": 0.4129,
"num_input_tokens_seen": 5843358,
"step": 945,
"train_runtime": 4184.7637,
"train_tokens_per_second": 1396.341
},
{
"epoch": 1.6170940170940171,
"grad_norm": 0.1724429428577423,
"learning_rate": 3.862660944206008e-05,
"loss": 0.4613,
"num_input_tokens_seen": 5849022,
"step": 946,
"train_runtime": 4188.4421,
"train_tokens_per_second": 1396.467
},
{
"epoch": 1.6188034188034188,
"grad_norm": 0.1553131341934204,
"learning_rate": 3.84549356223176e-05,
"loss": 0.3879,
"num_input_tokens_seen": 5854078,
"step": 947,
"train_runtime": 4191.7577,
"train_tokens_per_second": 1396.569
},
{
"epoch": 1.6205128205128205,
"grad_norm": 0.12425386160612106,
"learning_rate": 3.828326180257511e-05,
"loss": 0.2773,
"num_input_tokens_seen": 5861006,
"step": 948,
"train_runtime": 4196.1024,
"train_tokens_per_second": 1396.774
},
{
"epoch": 1.6222222222222222,
"grad_norm": 0.14096501469612122,
"learning_rate": 3.811158798283262e-05,
"loss": 0.34,
"num_input_tokens_seen": 5865774,
"step": 949,
"train_runtime": 4199.3625,
"train_tokens_per_second": 1396.825
},
{
"epoch": 1.623931623931624,
"grad_norm": 0.1395706981420517,
"learning_rate": 3.7939914163090127e-05,
"loss": 0.3407,
"num_input_tokens_seen": 5871974,
"step": 950,
"train_runtime": 4203.3207,
"train_tokens_per_second": 1396.985
},
{
"epoch": 1.6256410256410256,
"grad_norm": 0.17341846227645874,
"learning_rate": 3.776824034334764e-05,
"loss": 0.4103,
"num_input_tokens_seen": 5877782,
"step": 951,
"train_runtime": 4207.092,
"train_tokens_per_second": 1397.113
},
{
"epoch": 1.6273504273504273,
"grad_norm": 0.13125059008598328,
"learning_rate": 3.759656652360515e-05,
"loss": 0.2613,
"num_input_tokens_seen": 5884166,
"step": 952,
"train_runtime": 4211.2144,
"train_tokens_per_second": 1397.261
},
{
"epoch": 1.629059829059829,
"grad_norm": 0.15653657913208008,
"learning_rate": 3.742489270386266e-05,
"loss": 0.348,
"num_input_tokens_seen": 5890622,
"step": 953,
"train_runtime": 4215.4326,
"train_tokens_per_second": 1397.394
},
{
"epoch": 1.6307692307692307,
"grad_norm": 0.16723714768886566,
"learning_rate": 3.725321888412017e-05,
"loss": 0.4219,
"num_input_tokens_seen": 5895502,
"step": 954,
"train_runtime": 4218.7165,
"train_tokens_per_second": 1397.463
},
{
"epoch": 1.6324786324786325,
"grad_norm": 0.146444633603096,
"learning_rate": 3.708154506437768e-05,
"loss": 0.2672,
"num_input_tokens_seen": 5901414,
"step": 955,
"train_runtime": 4222.6691,
"train_tokens_per_second": 1397.555
},
{
"epoch": 1.6341880341880342,
"grad_norm": 0.11249315738677979,
"learning_rate": 3.6909871244635195e-05,
"loss": 0.2149,
"num_input_tokens_seen": 5909254,
"step": 956,
"train_runtime": 4227.5922,
"train_tokens_per_second": 1397.782
},
{
"epoch": 1.6358974358974359,
"grad_norm": 0.14980441331863403,
"learning_rate": 3.6738197424892704e-05,
"loss": 0.3522,
"num_input_tokens_seen": 5914310,
"step": 957,
"train_runtime": 4231.0393,
"train_tokens_per_second": 1397.839
},
{
"epoch": 1.6376068376068376,
"grad_norm": 0.13074517250061035,
"learning_rate": 3.656652360515021e-05,
"loss": 0.2345,
"num_input_tokens_seen": 5921494,
"step": 958,
"train_runtime": 4235.5622,
"train_tokens_per_second": 1398.042
},
{
"epoch": 1.6393162393162393,
"grad_norm": 0.14216265082359314,
"learning_rate": 3.639484978540772e-05,
"loss": 0.3773,
"num_input_tokens_seen": 5927062,
"step": 959,
"train_runtime": 4239.1985,
"train_tokens_per_second": 1398.156
},
{
"epoch": 1.641025641025641,
"grad_norm": 0.16056610643863678,
"learning_rate": 3.622317596566524e-05,
"loss": 0.3857,
"num_input_tokens_seen": 5934134,
"step": 960,
"train_runtime": 4243.7395,
"train_tokens_per_second": 1398.327
},
{
"epoch": 1.6427350427350427,
"grad_norm": 0.1462031453847885,
"learning_rate": 3.605150214592275e-05,
"loss": 0.3269,
"num_input_tokens_seen": 5939398,
"step": 961,
"train_runtime": 4249.3319,
"train_tokens_per_second": 1397.725
},
{
"epoch": 1.6444444444444444,
"grad_norm": 0.1907830536365509,
"learning_rate": 3.587982832618026e-05,
"loss": 0.5159,
"num_input_tokens_seen": 5944502,
"step": 962,
"train_runtime": 4252.8018,
"train_tokens_per_second": 1397.785
},
{
"epoch": 1.646153846153846,
"grad_norm": 0.16608525812625885,
"learning_rate": 3.5708154506437766e-05,
"loss": 0.3244,
"num_input_tokens_seen": 5950342,
"step": 963,
"train_runtime": 4256.5589,
"train_tokens_per_second": 1397.923
},
{
"epoch": 1.6478632478632478,
"grad_norm": 0.14312684535980225,
"learning_rate": 3.5536480686695275e-05,
"loss": 0.3154,
"num_input_tokens_seen": 5955310,
"step": 964,
"train_runtime": 4259.9178,
"train_tokens_per_second": 1397.987
},
{
"epoch": 1.6495726495726495,
"grad_norm": 0.12518402934074402,
"learning_rate": 3.536480686695279e-05,
"loss": 0.3291,
"num_input_tokens_seen": 5965774,
"step": 965,
"train_runtime": 4266.2276,
"train_tokens_per_second": 1398.372
},
{
"epoch": 1.6512820512820512,
"grad_norm": 0.13345399498939514,
"learning_rate": 3.51931330472103e-05,
"loss": 0.3288,
"num_input_tokens_seen": 5973430,
"step": 966,
"train_runtime": 4271.1227,
"train_tokens_per_second": 1398.562
},
{
"epoch": 1.652991452991453,
"grad_norm": 0.14265747368335724,
"learning_rate": 3.502145922746781e-05,
"loss": 0.3364,
"num_input_tokens_seen": 5978654,
"step": 967,
"train_runtime": 4274.6629,
"train_tokens_per_second": 1398.626
},
{
"epoch": 1.6547008547008546,
"grad_norm": 0.16501638293266296,
"learning_rate": 3.484978540772532e-05,
"loss": 0.3486,
"num_input_tokens_seen": 5983806,
"step": 968,
"train_runtime": 4278.033,
"train_tokens_per_second": 1398.728
},
{
"epoch": 1.6564102564102563,
"grad_norm": 0.1431581974029541,
"learning_rate": 3.4678111587982834e-05,
"loss": 0.3881,
"num_input_tokens_seen": 5993574,
"step": 969,
"train_runtime": 4284.1459,
"train_tokens_per_second": 1399.013
},
{
"epoch": 1.658119658119658,
"grad_norm": 0.14108191430568695,
"learning_rate": 3.450643776824034e-05,
"loss": 0.3189,
"num_input_tokens_seen": 6000262,
"step": 970,
"train_runtime": 4288.3925,
"train_tokens_per_second": 1399.187
},
{
"epoch": 1.6598290598290597,
"grad_norm": 0.16081646084785461,
"learning_rate": 3.433476394849785e-05,
"loss": 0.3586,
"num_input_tokens_seen": 6005062,
"step": 971,
"train_runtime": 4291.5438,
"train_tokens_per_second": 1399.278
},
{
"epoch": 1.6615384615384614,
"grad_norm": 0.16049602627754211,
"learning_rate": 3.416309012875537e-05,
"loss": 0.3027,
"num_input_tokens_seen": 6009998,
"step": 972,
"train_runtime": 4294.9154,
"train_tokens_per_second": 1399.329
},
{
"epoch": 1.6632478632478631,
"grad_norm": 0.14511296153068542,
"learning_rate": 3.399141630901288e-05,
"loss": 0.358,
"num_input_tokens_seen": 6017742,
"step": 973,
"train_runtime": 4299.8283,
"train_tokens_per_second": 1399.531
},
{
"epoch": 1.6649572649572648,
"grad_norm": 0.1554926484823227,
"learning_rate": 3.381974248927039e-05,
"loss": 0.3312,
"num_input_tokens_seen": 6024430,
"step": 974,
"train_runtime": 4304.1438,
"train_tokens_per_second": 1399.681
},
{
"epoch": 1.6666666666666665,
"grad_norm": 0.163766011595726,
"learning_rate": 3.3648068669527896e-05,
"loss": 0.38,
"num_input_tokens_seen": 6030750,
"step": 975,
"train_runtime": 4308.2834,
"train_tokens_per_second": 1399.803
},
{
"epoch": 1.6683760683760682,
"grad_norm": 0.18036513030529022,
"learning_rate": 3.347639484978541e-05,
"loss": 0.4304,
"num_input_tokens_seen": 6035278,
"step": 976,
"train_runtime": 4311.3418,
"train_tokens_per_second": 1399.861
},
{
"epoch": 1.67008547008547,
"grad_norm": 0.16275691986083984,
"learning_rate": 3.330472103004292e-05,
"loss": 0.3478,
"num_input_tokens_seen": 6041366,
"step": 977,
"train_runtime": 4315.3401,
"train_tokens_per_second": 1399.974
},
{
"epoch": 1.6717948717948716,
"grad_norm": 0.13549788296222687,
"learning_rate": 3.313304721030043e-05,
"loss": 0.3254,
"num_input_tokens_seen": 6047142,
"step": 978,
"train_runtime": 4319.1359,
"train_tokens_per_second": 1400.081
},
{
"epoch": 1.6735042735042736,
"grad_norm": 0.15927636623382568,
"learning_rate": 3.296137339055794e-05,
"loss": 0.3495,
"num_input_tokens_seen": 6053086,
"step": 979,
"train_runtime": 4322.9032,
"train_tokens_per_second": 1400.236
},
{
"epoch": 1.6752136752136753,
"grad_norm": 0.14179955422878265,
"learning_rate": 3.2789699570815455e-05,
"loss": 0.3902,
"num_input_tokens_seen": 6060382,
"step": 980,
"train_runtime": 4327.5542,
"train_tokens_per_second": 1400.417
},
{
"epoch": 1.676923076923077,
"grad_norm": 0.13718022406101227,
"learning_rate": 3.2618025751072964e-05,
"loss": 0.325,
"num_input_tokens_seen": 6067214,
"step": 981,
"train_runtime": 4331.8978,
"train_tokens_per_second": 1400.59
},
{
"epoch": 1.6786324786324787,
"grad_norm": 0.14240792393684387,
"learning_rate": 3.2446351931330473e-05,
"loss": 0.3153,
"num_input_tokens_seen": 6072542,
"step": 982,
"train_runtime": 4335.4612,
"train_tokens_per_second": 1400.668
},
{
"epoch": 1.6803418803418804,
"grad_norm": 0.17063497006893158,
"learning_rate": 3.227467811158798e-05,
"loss": 0.3474,
"num_input_tokens_seen": 6077822,
"step": 983,
"train_runtime": 4339.0337,
"train_tokens_per_second": 1400.732
},
{
"epoch": 1.682051282051282,
"grad_norm": 0.1793319284915924,
"learning_rate": 3.21030042918455e-05,
"loss": 0.3506,
"num_input_tokens_seen": 6082414,
"step": 984,
"train_runtime": 4342.1991,
"train_tokens_per_second": 1400.768
},
{
"epoch": 1.6837606837606838,
"grad_norm": 0.15594610571861267,
"learning_rate": 3.193133047210301e-05,
"loss": 0.3521,
"num_input_tokens_seen": 6088374,
"step": 985,
"train_runtime": 4346.1065,
"train_tokens_per_second": 1400.88
},
{
"epoch": 1.6854700854700855,
"grad_norm": 0.1668577343225479,
"learning_rate": 3.175965665236052e-05,
"loss": 0.3075,
"num_input_tokens_seen": 6099598,
"step": 986,
"train_runtime": 4353.0219,
"train_tokens_per_second": 1401.233
},
{
"epoch": 1.6871794871794872,
"grad_norm": 0.15573537349700928,
"learning_rate": 3.158798283261803e-05,
"loss": 0.3101,
"num_input_tokens_seen": 6106238,
"step": 987,
"train_runtime": 4357.3365,
"train_tokens_per_second": 1401.369
},
{
"epoch": 1.6888888888888889,
"grad_norm": 0.1659414917230606,
"learning_rate": 3.141630901287554e-05,
"loss": 0.3679,
"num_input_tokens_seen": 6112990,
"step": 988,
"train_runtime": 4361.6346,
"train_tokens_per_second": 1401.536
},
{
"epoch": 1.6905982905982906,
"grad_norm": 0.13771456480026245,
"learning_rate": 3.124463519313305e-05,
"loss": 0.2698,
"num_input_tokens_seen": 6121190,
"step": 989,
"train_runtime": 4366.785,
"train_tokens_per_second": 1401.761
},
{
"epoch": 1.6923076923076923,
"grad_norm": 0.17398853600025177,
"learning_rate": 3.107296137339056e-05,
"loss": 0.3585,
"num_input_tokens_seen": 6126838,
"step": 990,
"train_runtime": 4370.4426,
"train_tokens_per_second": 1401.88
},
{
"epoch": 1.694017094017094,
"grad_norm": 0.16992250084877014,
"learning_rate": 3.0901287553648076e-05,
"loss": 0.3688,
"num_input_tokens_seen": 6132214,
"step": 991,
"train_runtime": 4376.044,
"train_tokens_per_second": 1401.315
},
{
"epoch": 1.6957264957264957,
"grad_norm": 0.14736062288284302,
"learning_rate": 3.0729613733905585e-05,
"loss": 0.4102,
"num_input_tokens_seen": 6139086,
"step": 992,
"train_runtime": 4380.4121,
"train_tokens_per_second": 1401.486
},
{
"epoch": 1.6974358974358974,
"grad_norm": 0.09231652319431305,
"learning_rate": 3.0557939914163094e-05,
"loss": 0.1844,
"num_input_tokens_seen": 6149238,
"step": 993,
"train_runtime": 4386.5474,
"train_tokens_per_second": 1401.84
},
{
"epoch": 1.699145299145299,
"grad_norm": 0.17811483144760132,
"learning_rate": 3.03862660944206e-05,
"loss": 0.4097,
"num_input_tokens_seen": 6154366,
"step": 994,
"train_runtime": 4389.9507,
"train_tokens_per_second": 1401.921
},
{
"epoch": 1.7008547008547008,
"grad_norm": 0.15624217689037323,
"learning_rate": 3.021459227467811e-05,
"loss": 0.3516,
"num_input_tokens_seen": 6159286,
"step": 995,
"train_runtime": 4393.3511,
"train_tokens_per_second": 1401.956
},
{
"epoch": 1.7025641025641025,
"grad_norm": 0.1756419837474823,
"learning_rate": 3.0042918454935625e-05,
"loss": 0.3392,
"num_input_tokens_seen": 6164166,
"step": 996,
"train_runtime": 4396.6508,
"train_tokens_per_second": 1402.014
},
{
"epoch": 1.7042735042735044,
"grad_norm": 0.11751808226108551,
"learning_rate": 2.9871244635193134e-05,
"loss": 0.2156,
"num_input_tokens_seen": 6172630,
"step": 997,
"train_runtime": 4401.9216,
"train_tokens_per_second": 1402.258
},
{
"epoch": 1.7059829059829061,
"grad_norm": 0.1824459284543991,
"learning_rate": 2.9699570815450643e-05,
"loss": 0.3685,
"num_input_tokens_seen": 6177326,
"step": 998,
"train_runtime": 4405.0787,
"train_tokens_per_second": 1402.319
},
{
"epoch": 1.7076923076923078,
"grad_norm": 0.15616580843925476,
"learning_rate": 2.9527896995708153e-05,
"loss": 0.3737,
"num_input_tokens_seen": 6182622,
"step": 999,
"train_runtime": 4408.5719,
"train_tokens_per_second": 1402.409
},
{
"epoch": 1.7094017094017095,
"grad_norm": 0.1718655824661255,
"learning_rate": 2.935622317596567e-05,
"loss": 0.4426,
"num_input_tokens_seen": 6189630,
"step": 1000,
"train_runtime": 4412.9794,
"train_tokens_per_second": 1402.597
},
{
"epoch": 1.7111111111111112,
"grad_norm": 0.14478078484535217,
"learning_rate": 2.9184549356223178e-05,
"loss": 0.2377,
"num_input_tokens_seen": 6196462,
"step": 1001,
"train_runtime": 4417.29,
"train_tokens_per_second": 1402.775
},
{
"epoch": 1.712820512820513,
"grad_norm": 0.14062879979610443,
"learning_rate": 2.9012875536480687e-05,
"loss": 0.2676,
"num_input_tokens_seen": 6204102,
"step": 1002,
"train_runtime": 4422.1082,
"train_tokens_per_second": 1402.974
},
{
"epoch": 1.7145299145299147,
"grad_norm": 0.13248053193092346,
"learning_rate": 2.8841201716738196e-05,
"loss": 0.3631,
"num_input_tokens_seen": 6210486,
"step": 1003,
"train_runtime": 4426.2686,
"train_tokens_per_second": 1403.097
},
{
"epoch": 1.7162393162393164,
"grad_norm": 0.1455918848514557,
"learning_rate": 2.866952789699571e-05,
"loss": 0.3268,
"num_input_tokens_seen": 6216734,
"step": 1004,
"train_runtime": 4430.3644,
"train_tokens_per_second": 1403.211
},
{
"epoch": 1.717948717948718,
"grad_norm": 0.16086509823799133,
"learning_rate": 2.849785407725322e-05,
"loss": 0.2984,
"num_input_tokens_seen": 6221590,
"step": 1005,
"train_runtime": 4433.6172,
"train_tokens_per_second": 1403.276
},
{
"epoch": 1.7196581196581198,
"grad_norm": 0.24680602550506592,
"learning_rate": 2.832618025751073e-05,
"loss": 0.3334,
"num_input_tokens_seen": 6229086,
"step": 1006,
"train_runtime": 4438.3525,
"train_tokens_per_second": 1403.468
},
{
"epoch": 1.7213675213675215,
"grad_norm": 0.15239591896533966,
"learning_rate": 2.8154506437768243e-05,
"loss": 0.3622,
"num_input_tokens_seen": 6235030,
"step": 1007,
"train_runtime": 4442.1313,
"train_tokens_per_second": 1403.612
},
{
"epoch": 1.7230769230769232,
"grad_norm": 0.18432646989822388,
"learning_rate": 2.7982832618025752e-05,
"loss": 0.4047,
"num_input_tokens_seen": 6240934,
"step": 1008,
"train_runtime": 4446.0001,
"train_tokens_per_second": 1403.719
},
{
"epoch": 1.7247863247863249,
"grad_norm": 0.15836463868618011,
"learning_rate": 2.7811158798283264e-05,
"loss": 0.3048,
"num_input_tokens_seen": 6249862,
"step": 1009,
"train_runtime": 4451.485,
"train_tokens_per_second": 1403.995
},
{
"epoch": 1.7264957264957266,
"grad_norm": 0.15719516575336456,
"learning_rate": 2.7639484978540774e-05,
"loss": 0.3226,
"num_input_tokens_seen": 6257486,
"step": 1010,
"train_runtime": 4456.2732,
"train_tokens_per_second": 1404.197
},
{
"epoch": 1.7282051282051283,
"grad_norm": 0.15233346819877625,
"learning_rate": 2.7467811158798286e-05,
"loss": 0.3904,
"num_input_tokens_seen": 6263398,
"step": 1011,
"train_runtime": 4460.0746,
"train_tokens_per_second": 1404.326
},
{
"epoch": 1.72991452991453,
"grad_norm": 0.16483135521411896,
"learning_rate": 2.7296137339055795e-05,
"loss": 0.3194,
"num_input_tokens_seen": 6267510,
"step": 1012,
"train_runtime": 4462.9455,
"train_tokens_per_second": 1404.344
},
{
"epoch": 1.7316239316239317,
"grad_norm": 0.12890520691871643,
"learning_rate": 2.7124463519313304e-05,
"loss": 0.278,
"num_input_tokens_seen": 6274342,
"step": 1013,
"train_runtime": 4467.431,
"train_tokens_per_second": 1404.463
},
{
"epoch": 1.7333333333333334,
"grad_norm": 0.14849728345870972,
"learning_rate": 2.6952789699570817e-05,
"loss": 0.3502,
"num_input_tokens_seen": 6279782,
"step": 1014,
"train_runtime": 4471.0355,
"train_tokens_per_second": 1404.548
},
{
"epoch": 1.735042735042735,
"grad_norm": 0.15156908333301544,
"learning_rate": 2.678111587982833e-05,
"loss": 0.2686,
"num_input_tokens_seen": 6286150,
"step": 1015,
"train_runtime": 4475.1422,
"train_tokens_per_second": 1404.682
},
{
"epoch": 1.7367521367521368,
"grad_norm": 0.167219877243042,
"learning_rate": 2.660944206008584e-05,
"loss": 0.3783,
"num_input_tokens_seen": 6291254,
"step": 1016,
"train_runtime": 4478.5112,
"train_tokens_per_second": 1404.765
},
{
"epoch": 1.7384615384615385,
"grad_norm": 0.11013533920049667,
"learning_rate": 2.6437768240343348e-05,
"loss": 0.2325,
"num_input_tokens_seen": 6297734,
"step": 1017,
"train_runtime": 4482.7092,
"train_tokens_per_second": 1404.895
},
{
"epoch": 1.7401709401709402,
"grad_norm": 0.14911878108978271,
"learning_rate": 2.626609442060086e-05,
"loss": 0.3542,
"num_input_tokens_seen": 6304838,
"step": 1018,
"train_runtime": 4487.1017,
"train_tokens_per_second": 1405.103
},
{
"epoch": 1.741880341880342,
"grad_norm": 0.15777182579040527,
"learning_rate": 2.6094420600858373e-05,
"loss": 0.399,
"num_input_tokens_seen": 6310614,
"step": 1019,
"train_runtime": 4490.9301,
"train_tokens_per_second": 1405.191
},
{
"epoch": 1.7435897435897436,
"grad_norm": 0.13833945989608765,
"learning_rate": 2.5922746781115882e-05,
"loss": 0.337,
"num_input_tokens_seen": 6318622,
"step": 1020,
"train_runtime": 4495.9494,
"train_tokens_per_second": 1405.403
},
{
"epoch": 1.7452991452991453,
"grad_norm": 0.1786230504512787,
"learning_rate": 2.575107296137339e-05,
"loss": 0.331,
"num_input_tokens_seen": 6324174,
"step": 1021,
"train_runtime": 4501.5449,
"train_tokens_per_second": 1404.89
},
{
"epoch": 1.747008547008547,
"grad_norm": 0.12603215873241425,
"learning_rate": 2.55793991416309e-05,
"loss": 0.2773,
"num_input_tokens_seen": 6332590,
"step": 1022,
"train_runtime": 4506.7954,
"train_tokens_per_second": 1405.12
},
{
"epoch": 1.7487179487179487,
"grad_norm": 0.18076284229755402,
"learning_rate": 2.5407725321888416e-05,
"loss": 0.3666,
"num_input_tokens_seen": 6337286,
"step": 1023,
"train_runtime": 4509.9478,
"train_tokens_per_second": 1405.179
},
{
"epoch": 1.7504273504273504,
"grad_norm": 0.15938463807106018,
"learning_rate": 2.5236051502145925e-05,
"loss": 0.3929,
"num_input_tokens_seen": 6342718,
"step": 1024,
"train_runtime": 4513.6662,
"train_tokens_per_second": 1405.225
},
{
"epoch": 1.7521367521367521,
"grad_norm": 0.14623907208442688,
"learning_rate": 2.5064377682403434e-05,
"loss": 0.2741,
"num_input_tokens_seen": 6347494,
"step": 1025,
"train_runtime": 4516.821,
"train_tokens_per_second": 1405.301
},
{
"epoch": 1.7538461538461538,
"grad_norm": 0.13452006876468658,
"learning_rate": 2.4892703862660947e-05,
"loss": 0.3146,
"num_input_tokens_seen": 6353366,
"step": 1026,
"train_runtime": 4520.7165,
"train_tokens_per_second": 1405.389
},
{
"epoch": 1.7555555555555555,
"grad_norm": 0.09792611002922058,
"learning_rate": 2.4721030042918456e-05,
"loss": 0.24,
"num_input_tokens_seen": 6368022,
"step": 1027,
"train_runtime": 4529.5761,
"train_tokens_per_second": 1405.876
},
{
"epoch": 1.7572649572649572,
"grad_norm": 0.1469515562057495,
"learning_rate": 2.454935622317597e-05,
"loss": 0.2991,
"num_input_tokens_seen": 6373742,
"step": 1028,
"train_runtime": 4533.4245,
"train_tokens_per_second": 1405.944
},
{
"epoch": 1.758974358974359,
"grad_norm": 0.14302274584770203,
"learning_rate": 2.4377682403433478e-05,
"loss": 0.4099,
"num_input_tokens_seen": 6380934,
"step": 1029,
"train_runtime": 4538.0583,
"train_tokens_per_second": 1406.093
},
{
"epoch": 1.7606837606837606,
"grad_norm": 0.1585194617509842,
"learning_rate": 2.420600858369099e-05,
"loss": 0.3884,
"num_input_tokens_seen": 6384662,
"step": 1030,
"train_runtime": 4540.8411,
"train_tokens_per_second": 1406.053
},
{
"epoch": 1.7623931623931623,
"grad_norm": 0.16706667840480804,
"learning_rate": 2.40343347639485e-05,
"loss": 0.3835,
"num_input_tokens_seen": 6389966,
"step": 1031,
"train_runtime": 4544.4381,
"train_tokens_per_second": 1406.107
},
{
"epoch": 1.764102564102564,
"grad_norm": 0.15659315884113312,
"learning_rate": 2.386266094420601e-05,
"loss": 0.3452,
"num_input_tokens_seen": 6395846,
"step": 1032,
"train_runtime": 4548.2609,
"train_tokens_per_second": 1406.218
},
{
"epoch": 1.7658119658119658,
"grad_norm": 0.15282271802425385,
"learning_rate": 2.369098712446352e-05,
"loss": 0.3265,
"num_input_tokens_seen": 6402358,
"step": 1033,
"train_runtime": 4552.448,
"train_tokens_per_second": 1406.355
},
{
"epoch": 1.7675213675213675,
"grad_norm": 0.15687775611877441,
"learning_rate": 2.351931330472103e-05,
"loss": 0.3049,
"num_input_tokens_seen": 6407302,
"step": 1034,
"train_runtime": 4555.7062,
"train_tokens_per_second": 1406.434
},
{
"epoch": 1.7692307692307692,
"grad_norm": 0.17506225407123566,
"learning_rate": 2.3347639484978543e-05,
"loss": 0.477,
"num_input_tokens_seen": 6411742,
"step": 1035,
"train_runtime": 4558.7076,
"train_tokens_per_second": 1406.482
},
{
"epoch": 1.7709401709401709,
"grad_norm": 0.16328084468841553,
"learning_rate": 2.3175965665236052e-05,
"loss": 0.3114,
"num_input_tokens_seen": 6419462,
"step": 1036,
"train_runtime": 4563.6036,
"train_tokens_per_second": 1406.665
},
{
"epoch": 1.7726495726495726,
"grad_norm": 0.20261751115322113,
"learning_rate": 2.3004291845493564e-05,
"loss": 0.2963,
"num_input_tokens_seen": 6426198,
"step": 1037,
"train_runtime": 4567.8768,
"train_tokens_per_second": 1406.824
},
{
"epoch": 1.7743589743589743,
"grad_norm": 0.15363574028015137,
"learning_rate": 2.2832618025751074e-05,
"loss": 0.3716,
"num_input_tokens_seen": 6432110,
"step": 1038,
"train_runtime": 4571.7893,
"train_tokens_per_second": 1406.913
},
{
"epoch": 1.776068376068376,
"grad_norm": 0.16166916489601135,
"learning_rate": 2.2660944206008586e-05,
"loss": 0.3069,
"num_input_tokens_seen": 6436894,
"step": 1039,
"train_runtime": 4575.0332,
"train_tokens_per_second": 1406.961
},
{
"epoch": 1.7777777777777777,
"grad_norm": 0.13780422508716583,
"learning_rate": 2.2489270386266095e-05,
"loss": 0.32,
"num_input_tokens_seen": 6442478,
"step": 1040,
"train_runtime": 4578.7364,
"train_tokens_per_second": 1407.043
},
{
"epoch": 1.7794871794871794,
"grad_norm": 0.13809658586978912,
"learning_rate": 2.2317596566523608e-05,
"loss": 0.3943,
"num_input_tokens_seen": 6452022,
"step": 1041,
"train_runtime": 4584.5201,
"train_tokens_per_second": 1407.349
},
{
"epoch": 1.781196581196581,
"grad_norm": 0.1384420543909073,
"learning_rate": 2.2145922746781117e-05,
"loss": 0.3566,
"num_input_tokens_seen": 6457366,
"step": 1042,
"train_runtime": 4588.1267,
"train_tokens_per_second": 1407.408
},
{
"epoch": 1.7829059829059828,
"grad_norm": 0.14281603693962097,
"learning_rate": 2.1974248927038626e-05,
"loss": 0.29,
"num_input_tokens_seen": 6463758,
"step": 1043,
"train_runtime": 4592.2407,
"train_tokens_per_second": 1407.539
},
{
"epoch": 1.7846153846153845,
"grad_norm": 0.1341668963432312,
"learning_rate": 2.180257510729614e-05,
"loss": 0.3113,
"num_input_tokens_seen": 6470814,
"step": 1044,
"train_runtime": 4596.7241,
"train_tokens_per_second": 1407.701
},
{
"epoch": 1.7863247863247862,
"grad_norm": 0.12165071070194244,
"learning_rate": 2.1630901287553648e-05,
"loss": 0.2428,
"num_input_tokens_seen": 6478470,
"step": 1045,
"train_runtime": 4601.6129,
"train_tokens_per_second": 1407.869
},
{
"epoch": 1.788034188034188,
"grad_norm": 0.12957434356212616,
"learning_rate": 2.145922746781116e-05,
"loss": 0.3294,
"num_input_tokens_seen": 6485742,
"step": 1046,
"train_runtime": 4606.2305,
"train_tokens_per_second": 1408.037
},
{
"epoch": 1.7897435897435896,
"grad_norm": 0.15326030552387238,
"learning_rate": 2.128755364806867e-05,
"loss": 0.2989,
"num_input_tokens_seen": 6490534,
"step": 1047,
"train_runtime": 4609.394,
"train_tokens_per_second": 1408.11
},
{
"epoch": 1.7914529914529913,
"grad_norm": 0.1443042904138565,
"learning_rate": 2.1115879828326182e-05,
"loss": 0.321,
"num_input_tokens_seen": 6496446,
"step": 1048,
"train_runtime": 4613.259,
"train_tokens_per_second": 1408.212
},
{
"epoch": 1.793162393162393,
"grad_norm": 0.14335471391677856,
"learning_rate": 2.094420600858369e-05,
"loss": 0.3075,
"num_input_tokens_seen": 6500918,
"step": 1049,
"train_runtime": 4616.2414,
"train_tokens_per_second": 1408.271
},
{
"epoch": 1.7948717948717947,
"grad_norm": 0.14600598812103271,
"learning_rate": 2.0772532188841204e-05,
"loss": 0.2909,
"num_input_tokens_seen": 6507990,
"step": 1050,
"train_runtime": 4620.7168,
"train_tokens_per_second": 1408.437
},
{
"epoch": 1.7965811965811964,
"grad_norm": 0.18093526363372803,
"learning_rate": 2.0600858369098713e-05,
"loss": 0.3847,
"num_input_tokens_seen": 6512422,
"step": 1051,
"train_runtime": 4625.7264,
"train_tokens_per_second": 1407.87
},
{
"epoch": 1.7982905982905983,
"grad_norm": 0.16364380717277527,
"learning_rate": 2.0429184549356222e-05,
"loss": 0.4275,
"num_input_tokens_seen": 6518614,
"step": 1052,
"train_runtime": 4629.7613,
"train_tokens_per_second": 1407.981
},
{
"epoch": 1.8,
"grad_norm": 0.1316070705652237,
"learning_rate": 2.0257510729613735e-05,
"loss": 0.3271,
"num_input_tokens_seen": 6526590,
"step": 1053,
"train_runtime": 4634.7196,
"train_tokens_per_second": 1408.195
},
{
"epoch": 1.8,
"eval_loss": 0.404507040977478,
"eval_runtime": 40.0997,
"eval_samples_per_second": 24.888,
"eval_steps_per_second": 3.117,
"num_input_tokens_seen": 6526590,
"step": 1053
},
{
"epoch": 1.8017094017094017,
"grad_norm": 0.15155088901519775,
"learning_rate": 2.0085836909871244e-05,
"loss": 0.332,
"num_input_tokens_seen": 6531142,
"step": 1054,
"train_runtime": 4677.9352,
"train_tokens_per_second": 1396.159
},
{
"epoch": 1.8034188034188035,
"grad_norm": 0.16894248127937317,
"learning_rate": 1.9914163090128756e-05,
"loss": 0.3468,
"num_input_tokens_seen": 6535878,
"step": 1055,
"train_runtime": 4681.1277,
"train_tokens_per_second": 1396.219
},
{
"epoch": 1.8051282051282052,
"grad_norm": 0.16134795546531677,
"learning_rate": 1.9742489270386265e-05,
"loss": 0.4106,
"num_input_tokens_seen": 6540734,
"step": 1056,
"train_runtime": 4684.3719,
"train_tokens_per_second": 1396.288
},
{
"epoch": 1.8068376068376069,
"grad_norm": 0.15336063504219055,
"learning_rate": 1.9570815450643778e-05,
"loss": 0.3094,
"num_input_tokens_seen": 6546686,
"step": 1057,
"train_runtime": 4688.2462,
"train_tokens_per_second": 1396.404
},
{
"epoch": 1.8085470085470086,
"grad_norm": 0.14268825948238373,
"learning_rate": 1.9399141630901287e-05,
"loss": 0.273,
"num_input_tokens_seen": 6551342,
"step": 1058,
"train_runtime": 4691.4225,
"train_tokens_per_second": 1396.451
},
{
"epoch": 1.8102564102564103,
"grad_norm": 0.14494940638542175,
"learning_rate": 1.92274678111588e-05,
"loss": 0.3132,
"num_input_tokens_seen": 6557974,
"step": 1059,
"train_runtime": 4695.6758,
"train_tokens_per_second": 1396.599
},
{
"epoch": 1.811965811965812,
"grad_norm": 0.18244661390781403,
"learning_rate": 1.905579399141631e-05,
"loss": 0.5737,
"num_input_tokens_seen": 6562998,
"step": 1060,
"train_runtime": 4698.9602,
"train_tokens_per_second": 1396.692
},
{
"epoch": 1.8136752136752137,
"grad_norm": 0.1533288210630417,
"learning_rate": 1.888412017167382e-05,
"loss": 0.441,
"num_input_tokens_seen": 6569270,
"step": 1061,
"train_runtime": 4702.9527,
"train_tokens_per_second": 1396.839
},
{
"epoch": 1.8153846153846154,
"grad_norm": 0.17031623423099518,
"learning_rate": 1.871244635193133e-05,
"loss": 0.3263,
"num_input_tokens_seen": 6576398,
"step": 1062,
"train_runtime": 4707.3688,
"train_tokens_per_second": 1397.043
},
{
"epoch": 1.817094017094017,
"grad_norm": 0.15098752081394196,
"learning_rate": 1.854077253218884e-05,
"loss": 0.3944,
"num_input_tokens_seen": 6583126,
"step": 1063,
"train_runtime": 4711.6687,
"train_tokens_per_second": 1397.196
},
{
"epoch": 1.8188034188034188,
"grad_norm": 0.14613556861877441,
"learning_rate": 1.8369098712446352e-05,
"loss": 0.3597,
"num_input_tokens_seen": 6588926,
"step": 1064,
"train_runtime": 4715.3802,
"train_tokens_per_second": 1397.327
},
{
"epoch": 1.8205128205128205,
"grad_norm": 0.14206819236278534,
"learning_rate": 1.819742489270386e-05,
"loss": 0.4242,
"num_input_tokens_seen": 6596990,
"step": 1065,
"train_runtime": 4720.4135,
"train_tokens_per_second": 1397.545
},
{
"epoch": 1.8222222222222222,
"grad_norm": 0.140799418091774,
"learning_rate": 1.8025751072961374e-05,
"loss": 0.3399,
"num_input_tokens_seen": 6602190,
"step": 1066,
"train_runtime": 4723.9657,
"train_tokens_per_second": 1397.595
},
{
"epoch": 1.823931623931624,
"grad_norm": 0.19462433457374573,
"learning_rate": 1.7854077253218883e-05,
"loss": 0.3512,
"num_input_tokens_seen": 6607014,
"step": 1067,
"train_runtime": 4727.1472,
"train_tokens_per_second": 1397.675
},
{
"epoch": 1.8256410256410256,
"grad_norm": 0.13291078805923462,
"learning_rate": 1.7682403433476395e-05,
"loss": 0.3843,
"num_input_tokens_seen": 6613678,
"step": 1068,
"train_runtime": 4731.4386,
"train_tokens_per_second": 1397.815
},
{
"epoch": 1.8273504273504273,
"grad_norm": 0.15383653342723846,
"learning_rate": 1.7510729613733905e-05,
"loss": 0.3471,
"num_input_tokens_seen": 6618774,
"step": 1069,
"train_runtime": 4734.8385,
"train_tokens_per_second": 1397.888
},
{
"epoch": 1.8290598290598292,
"grad_norm": 0.1934920996427536,
"learning_rate": 1.7339055793991417e-05,
"loss": 0.4046,
"num_input_tokens_seen": 6623158,
"step": 1070,
"train_runtime": 4737.8828,
"train_tokens_per_second": 1397.915
},
{
"epoch": 1.830769230769231,
"grad_norm": 0.14363759756088257,
"learning_rate": 1.7167381974248926e-05,
"loss": 0.3881,
"num_input_tokens_seen": 6629886,
"step": 1071,
"train_runtime": 4742.2138,
"train_tokens_per_second": 1398.057
},
{
"epoch": 1.8324786324786326,
"grad_norm": 0.16139546036720276,
"learning_rate": 1.699570815450644e-05,
"loss": 0.4487,
"num_input_tokens_seen": 6636854,
"step": 1072,
"train_runtime": 4746.7336,
"train_tokens_per_second": 1398.194
},
{
"epoch": 1.8341880341880343,
"grad_norm": 0.1400468498468399,
"learning_rate": 1.6824034334763948e-05,
"loss": 0.3305,
"num_input_tokens_seen": 6642486,
"step": 1073,
"train_runtime": 4750.5141,
"train_tokens_per_second": 1398.267
},
{
"epoch": 1.835897435897436,
"grad_norm": 0.13978594541549683,
"learning_rate": 1.665236051502146e-05,
"loss": 0.6809,
"num_input_tokens_seen": 6649566,
"step": 1074,
"train_runtime": 4755.0422,
"train_tokens_per_second": 1398.424
},
{
"epoch": 1.8376068376068377,
"grad_norm": 0.1702847182750702,
"learning_rate": 1.648068669527897e-05,
"loss": 0.4449,
"num_input_tokens_seen": 6655126,
"step": 1075,
"train_runtime": 4758.7098,
"train_tokens_per_second": 1398.515
},
{
"epoch": 1.8393162393162394,
"grad_norm": 0.17050866782665253,
"learning_rate": 1.6309012875536482e-05,
"loss": 0.3379,
"num_input_tokens_seen": 6659030,
"step": 1076,
"train_runtime": 4761.477,
"train_tokens_per_second": 1398.522
},
{
"epoch": 1.8410256410256411,
"grad_norm": 0.13685175776481628,
"learning_rate": 1.613733905579399e-05,
"loss": 0.278,
"num_input_tokens_seen": 6665878,
"step": 1077,
"train_runtime": 4765.8908,
"train_tokens_per_second": 1398.664
},
{
"epoch": 1.8427350427350428,
"grad_norm": 0.15728789567947388,
"learning_rate": 1.5965665236051504e-05,
"loss": 0.4222,
"num_input_tokens_seen": 6673366,
"step": 1078,
"train_runtime": 4770.5968,
"train_tokens_per_second": 1398.853
},
{
"epoch": 1.8444444444444446,
"grad_norm": 0.1324002593755722,
"learning_rate": 1.5793991416309016e-05,
"loss": 0.2461,
"num_input_tokens_seen": 6683390,
"step": 1079,
"train_runtime": 4776.8061,
"train_tokens_per_second": 1399.134
},
{
"epoch": 1.8461538461538463,
"grad_norm": 0.16516079008579254,
"learning_rate": 1.5622317596566525e-05,
"loss": 0.4134,
"num_input_tokens_seen": 6688182,
"step": 1080,
"train_runtime": 4780.0471,
"train_tokens_per_second": 1399.187
},
{
"epoch": 1.847863247863248,
"grad_norm": 0.15185537934303284,
"learning_rate": 1.5450643776824038e-05,
"loss": 0.4063,
"num_input_tokens_seen": 6693006,
"step": 1081,
"train_runtime": 4785.5138,
"train_tokens_per_second": 1398.597
},
{
"epoch": 1.8495726495726497,
"grad_norm": 0.15653982758522034,
"learning_rate": 1.5278969957081547e-05,
"loss": 0.3766,
"num_input_tokens_seen": 6698870,
"step": 1082,
"train_runtime": 4789.2559,
"train_tokens_per_second": 1398.729
},
{
"epoch": 1.8512820512820514,
"grad_norm": 0.1651298999786377,
"learning_rate": 1.5107296137339055e-05,
"loss": 0.3813,
"num_input_tokens_seen": 6704446,
"step": 1083,
"train_runtime": 4792.9155,
"train_tokens_per_second": 1398.824
},
{
"epoch": 1.852991452991453,
"grad_norm": 0.13992318511009216,
"learning_rate": 1.4935622317596567e-05,
"loss": 0.3536,
"num_input_tokens_seen": 6712214,
"step": 1084,
"train_runtime": 4797.8044,
"train_tokens_per_second": 1399.018
},
{
"epoch": 1.8547008547008548,
"grad_norm": 0.18008194863796234,
"learning_rate": 1.4763948497854076e-05,
"loss": 0.4277,
"num_input_tokens_seen": 6718494,
"step": 1085,
"train_runtime": 4801.9402,
"train_tokens_per_second": 1399.121
},
{
"epoch": 1.8564102564102565,
"grad_norm": 0.14547497034072876,
"learning_rate": 1.4592274678111589e-05,
"loss": 0.3601,
"num_input_tokens_seen": 6725166,
"step": 1086,
"train_runtime": 4806.2732,
"train_tokens_per_second": 1399.248
},
{
"epoch": 1.8581196581196582,
"grad_norm": 0.16261422634124756,
"learning_rate": 1.4420600858369098e-05,
"loss": 0.2693,
"num_input_tokens_seen": 6730998,
"step": 1087,
"train_runtime": 4810.0482,
"train_tokens_per_second": 1399.362
},
{
"epoch": 1.8598290598290599,
"grad_norm": 0.18159757554531097,
"learning_rate": 1.424892703862661e-05,
"loss": 0.3637,
"num_input_tokens_seen": 6736422,
"step": 1088,
"train_runtime": 4813.51,
"train_tokens_per_second": 1399.482
},
{
"epoch": 1.8615384615384616,
"grad_norm": 0.17222821712493896,
"learning_rate": 1.4077253218884121e-05,
"loss": 0.3602,
"num_input_tokens_seen": 6740854,
"step": 1089,
"train_runtime": 4816.5377,
"train_tokens_per_second": 1399.523
},
{
"epoch": 1.8632478632478633,
"grad_norm": 0.2024536430835724,
"learning_rate": 1.3905579399141632e-05,
"loss": 0.4612,
"num_input_tokens_seen": 6746086,
"step": 1090,
"train_runtime": 4820.0103,
"train_tokens_per_second": 1399.6
},
{
"epoch": 1.864957264957265,
"grad_norm": 0.17339684069156647,
"learning_rate": 1.3733905579399143e-05,
"loss": 0.3912,
"num_input_tokens_seen": 6751998,
"step": 1091,
"train_runtime": 4823.8611,
"train_tokens_per_second": 1399.708
},
{
"epoch": 1.8666666666666667,
"grad_norm": 0.15908282995224,
"learning_rate": 1.3562231759656652e-05,
"loss": 0.4084,
"num_input_tokens_seen": 6757014,
"step": 1092,
"train_runtime": 4827.2695,
"train_tokens_per_second": 1399.759
},
{
"epoch": 1.8683760683760684,
"grad_norm": 0.15388384461402893,
"learning_rate": 1.3390557939914165e-05,
"loss": 0.3886,
"num_input_tokens_seen": 6763046,
"step": 1093,
"train_runtime": 4831.1646,
"train_tokens_per_second": 1399.879
},
{
"epoch": 1.87008547008547,
"grad_norm": 0.159906804561615,
"learning_rate": 1.3218884120171674e-05,
"loss": 0.3046,
"num_input_tokens_seen": 6767926,
"step": 1094,
"train_runtime": 4834.4979,
"train_tokens_per_second": 1399.923
},
{
"epoch": 1.8717948717948718,
"grad_norm": 0.14533422887325287,
"learning_rate": 1.3047210300429186e-05,
"loss": 0.3364,
"num_input_tokens_seen": 6773470,
"step": 1095,
"train_runtime": 4838.153,
"train_tokens_per_second": 1400.012
},
{
"epoch": 1.8735042735042735,
"grad_norm": 0.1425410658121109,
"learning_rate": 1.2875536480686696e-05,
"loss": 0.34,
"num_input_tokens_seen": 6780046,
"step": 1096,
"train_runtime": 4842.3489,
"train_tokens_per_second": 1400.156
},
{
"epoch": 1.8752136752136752,
"grad_norm": 0.17550382018089294,
"learning_rate": 1.2703862660944208e-05,
"loss": 0.3715,
"num_input_tokens_seen": 6784934,
"step": 1097,
"train_runtime": 4845.5655,
"train_tokens_per_second": 1400.236
},
{
"epoch": 1.876923076923077,
"grad_norm": 0.14778852462768555,
"learning_rate": 1.2532188841201717e-05,
"loss": 0.3221,
"num_input_tokens_seen": 6792326,
"step": 1098,
"train_runtime": 4850.2742,
"train_tokens_per_second": 1400.4
},
{
"epoch": 1.8786324786324786,
"grad_norm": 0.16497938334941864,
"learning_rate": 1.2360515021459228e-05,
"loss": 0.4165,
"num_input_tokens_seen": 6798566,
"step": 1099,
"train_runtime": 4854.305,
"train_tokens_per_second": 1400.523
},
{
"epoch": 1.8803418803418803,
"grad_norm": 0.197905495762825,
"learning_rate": 1.2188841201716739e-05,
"loss": 0.3145,
"num_input_tokens_seen": 6802638,
"step": 1100,
"train_runtime": 4857.1375,
"train_tokens_per_second": 1400.545
},
{
"epoch": 1.882051282051282,
"grad_norm": 0.17154602706432343,
"learning_rate": 1.201716738197425e-05,
"loss": 0.3308,
"num_input_tokens_seen": 6807246,
"step": 1101,
"train_runtime": 4860.2531,
"train_tokens_per_second": 1400.595
},
{
"epoch": 1.8837606837606837,
"grad_norm": 0.16185066103935242,
"learning_rate": 1.184549356223176e-05,
"loss": 0.4201,
"num_input_tokens_seen": 6813470,
"step": 1102,
"train_runtime": 4864.2681,
"train_tokens_per_second": 1400.718
},
{
"epoch": 1.8854700854700854,
"grad_norm": 0.14669010043144226,
"learning_rate": 1.1673819742489271e-05,
"loss": 0.277,
"num_input_tokens_seen": 6819462,
"step": 1103,
"train_runtime": 4868.1501,
"train_tokens_per_second": 1400.832
},
{
"epoch": 1.8871794871794871,
"grad_norm": 0.14133639633655548,
"learning_rate": 1.1502145922746782e-05,
"loss": 0.2909,
"num_input_tokens_seen": 6825846,
"step": 1104,
"train_runtime": 4872.1267,
"train_tokens_per_second": 1400.999
},
{
"epoch": 1.8888888888888888,
"grad_norm": 0.15974490344524384,
"learning_rate": 1.1330472103004293e-05,
"loss": 0.409,
"num_input_tokens_seen": 6830438,
"step": 1105,
"train_runtime": 4875.179,
"train_tokens_per_second": 1401.064
},
{
"epoch": 1.8905982905982905,
"grad_norm": 0.14427092671394348,
"learning_rate": 1.1158798283261804e-05,
"loss": 0.3139,
"num_input_tokens_seen": 6837246,
"step": 1106,
"train_runtime": 4879.5448,
"train_tokens_per_second": 1401.206
},
{
"epoch": 1.8923076923076922,
"grad_norm": 0.1914999932050705,
"learning_rate": 1.0987124463519313e-05,
"loss": 0.5047,
"num_input_tokens_seen": 6842374,
"step": 1107,
"train_runtime": 4882.9114,
"train_tokens_per_second": 1401.29
},
{
"epoch": 1.894017094017094,
"grad_norm": 0.1484641432762146,
"learning_rate": 1.0815450643776824e-05,
"loss": 0.3216,
"num_input_tokens_seen": 6850582,
"step": 1108,
"train_runtime": 4888.0245,
"train_tokens_per_second": 1401.503
},
{
"epoch": 1.8957264957264957,
"grad_norm": 0.14059650897979736,
"learning_rate": 1.0643776824034335e-05,
"loss": 0.2703,
"num_input_tokens_seen": 6856102,
"step": 1109,
"train_runtime": 4891.5942,
"train_tokens_per_second": 1401.609
},
{
"epoch": 1.8974358974358974,
"grad_norm": 0.20912344753742218,
"learning_rate": 1.0472103004291846e-05,
"loss": 0.3141,
"num_input_tokens_seen": 6862710,
"step": 1110,
"train_runtime": 4895.7904,
"train_tokens_per_second": 1401.757
},
{
"epoch": 1.899145299145299,
"grad_norm": 0.1622704267501831,
"learning_rate": 1.0300429184549356e-05,
"loss": 0.3853,
"num_input_tokens_seen": 6869022,
"step": 1111,
"train_runtime": 4901.9521,
"train_tokens_per_second": 1401.283
},
{
"epoch": 1.9008547008547008,
"grad_norm": 0.1645922064781189,
"learning_rate": 1.0128755364806867e-05,
"loss": 0.3398,
"num_input_tokens_seen": 6874726,
"step": 1112,
"train_runtime": 4905.6953,
"train_tokens_per_second": 1401.376
},
{
"epoch": 1.9025641025641025,
"grad_norm": 0.1458289623260498,
"learning_rate": 9.957081545064378e-06,
"loss": 0.317,
"num_input_tokens_seen": 6881630,
"step": 1113,
"train_runtime": 4910.1371,
"train_tokens_per_second": 1401.515
},
{
"epoch": 1.9042735042735042,
"grad_norm": 0.12950517237186432,
"learning_rate": 9.785407725321889e-06,
"loss": 0.3292,
"num_input_tokens_seen": 6889566,
"step": 1114,
"train_runtime": 4915.0767,
"train_tokens_per_second": 1401.721
},
{
"epoch": 1.9059829059829059,
"grad_norm": 0.17092257738113403,
"learning_rate": 9.6137339055794e-06,
"loss": 0.3772,
"num_input_tokens_seen": 6897254,
"step": 1115,
"train_runtime": 4919.8978,
"train_tokens_per_second": 1401.91
},
{
"epoch": 1.9076923076923076,
"grad_norm": 0.15210705995559692,
"learning_rate": 9.44206008583691e-06,
"loss": 0.2851,
"num_input_tokens_seen": 6903030,
"step": 1116,
"train_runtime": 4923.6154,
"train_tokens_per_second": 1402.025
},
{
"epoch": 1.9094017094017093,
"grad_norm": 0.17195074260234833,
"learning_rate": 9.27038626609442e-06,
"loss": 0.3031,
"num_input_tokens_seen": 6908182,
"step": 1117,
"train_runtime": 4926.9947,
"train_tokens_per_second": 1402.109
},
{
"epoch": 1.911111111111111,
"grad_norm": 0.1584848016500473,
"learning_rate": 9.09871244635193e-06,
"loss": 0.3616,
"num_input_tokens_seen": 6913494,
"step": 1118,
"train_runtime": 4930.5631,
"train_tokens_per_second": 1402.171
},
{
"epoch": 1.9128205128205127,
"grad_norm": 0.1975264549255371,
"learning_rate": 8.927038626609441e-06,
"loss": 0.4163,
"num_input_tokens_seen": 6918062,
"step": 1119,
"train_runtime": 4933.5796,
"train_tokens_per_second": 1402.24
},
{
"epoch": 1.9145299145299144,
"grad_norm": 0.16457124054431915,
"learning_rate": 8.755364806866952e-06,
"loss": 0.3484,
"num_input_tokens_seen": 6924510,
"step": 1120,
"train_runtime": 4937.7657,
"train_tokens_per_second": 1402.357
},
{
"epoch": 1.916239316239316,
"grad_norm": 0.17964407801628113,
"learning_rate": 8.583690987124463e-06,
"loss": 0.3722,
"num_input_tokens_seen": 6929198,
"step": 1121,
"train_runtime": 4940.9815,
"train_tokens_per_second": 1402.393
},
{
"epoch": 1.9179487179487178,
"grad_norm": 0.1665036529302597,
"learning_rate": 8.412017167381974e-06,
"loss": 0.3422,
"num_input_tokens_seen": 6934638,
"step": 1122,
"train_runtime": 4944.5768,
"train_tokens_per_second": 1402.474
},
{
"epoch": 1.9196581196581195,
"grad_norm": 0.15092073380947113,
"learning_rate": 8.240343347639485e-06,
"loss": 0.3241,
"num_input_tokens_seen": 6939854,
"step": 1123,
"train_runtime": 4948.0723,
"train_tokens_per_second": 1402.537
},
{
"epoch": 1.9213675213675212,
"grad_norm": 0.14096640050411224,
"learning_rate": 8.068669527896996e-06,
"loss": 0.3273,
"num_input_tokens_seen": 6946214,
"step": 1124,
"train_runtime": 4952.1614,
"train_tokens_per_second": 1402.663
},
{
"epoch": 1.9230769230769231,
"grad_norm": 0.1625843495130539,
"learning_rate": 7.896995708154508e-06,
"loss": 0.3869,
"num_input_tokens_seen": 6951950,
"step": 1125,
"train_runtime": 4955.9684,
"train_tokens_per_second": 1402.743
},
{
"epoch": 1.9247863247863248,
"grad_norm": 0.17909951508045197,
"learning_rate": 7.725321888412019e-06,
"loss": 0.3497,
"num_input_tokens_seen": 6957638,
"step": 1126,
"train_runtime": 4959.737,
"train_tokens_per_second": 1402.824
},
{
"epoch": 1.9264957264957265,
"grad_norm": 0.17353759706020355,
"learning_rate": 7.553648068669527e-06,
"loss": 0.3897,
"num_input_tokens_seen": 6962374,
"step": 1127,
"train_runtime": 4962.8962,
"train_tokens_per_second": 1402.885
},
{
"epoch": 1.9282051282051282,
"grad_norm": 0.15928848087787628,
"learning_rate": 7.381974248927038e-06,
"loss": 0.3673,
"num_input_tokens_seen": 6969438,
"step": 1128,
"train_runtime": 4967.3831,
"train_tokens_per_second": 1403.04
},
{
"epoch": 1.92991452991453,
"grad_norm": 0.1764049082994461,
"learning_rate": 7.210300429184549e-06,
"loss": 0.4195,
"num_input_tokens_seen": 6974686,
"step": 1129,
"train_runtime": 4970.8962,
"train_tokens_per_second": 1403.104
},
{
"epoch": 1.9316239316239316,
"grad_norm": 0.16329072415828705,
"learning_rate": 7.038626609442061e-06,
"loss": 0.4364,
"num_input_tokens_seen": 6978790,
"step": 1130,
"train_runtime": 4973.7668,
"train_tokens_per_second": 1403.12
},
{
"epoch": 1.9333333333333333,
"grad_norm": 0.1772487908601761,
"learning_rate": 6.8669527896995715e-06,
"loss": 0.2383,
"num_input_tokens_seen": 6983270,
"step": 1131,
"train_runtime": 4976.8686,
"train_tokens_per_second": 1403.145
},
{
"epoch": 1.935042735042735,
"grad_norm": 0.14440268278121948,
"learning_rate": 6.695278969957082e-06,
"loss": 0.3158,
"num_input_tokens_seen": 6990422,
"step": 1132,
"train_runtime": 4981.4235,
"train_tokens_per_second": 1403.298
},
{
"epoch": 1.9367521367521368,
"grad_norm": 0.12382279336452484,
"learning_rate": 6.523605150214593e-06,
"loss": 0.2929,
"num_input_tokens_seen": 6996510,
"step": 1133,
"train_runtime": 4985.3586,
"train_tokens_per_second": 1403.412
},
{
"epoch": 1.9384615384615385,
"grad_norm": 0.1855405867099762,
"learning_rate": 6.351931330472104e-06,
"loss": 0.3417,
"num_input_tokens_seen": 7001694,
"step": 1134,
"train_runtime": 4988.8358,
"train_tokens_per_second": 1403.473
},
{
"epoch": 1.9401709401709402,
"grad_norm": 0.17923769354820251,
"learning_rate": 6.180257510729614e-06,
"loss": 0.4127,
"num_input_tokens_seen": 7006406,
"step": 1135,
"train_runtime": 4992.0156,
"train_tokens_per_second": 1403.522
},
{
"epoch": 1.9418803418803419,
"grad_norm": 0.16682113707065582,
"learning_rate": 6.008583690987125e-06,
"loss": 0.3125,
"num_input_tokens_seen": 7011622,
"step": 1136,
"train_runtime": 4995.5472,
"train_tokens_per_second": 1403.574
},
{
"epoch": 1.9435897435897436,
"grad_norm": 0.15530408918857574,
"learning_rate": 5.836909871244636e-06,
"loss": 0.3365,
"num_input_tokens_seen": 7016462,
"step": 1137,
"train_runtime": 4998.7709,
"train_tokens_per_second": 1403.637
},
{
"epoch": 1.9452991452991453,
"grad_norm": 0.13905546069145203,
"learning_rate": 5.6652360515021465e-06,
"loss": 0.3441,
"num_input_tokens_seen": 7024086,
"step": 1138,
"train_runtime": 5003.5809,
"train_tokens_per_second": 1403.812
},
{
"epoch": 1.947008547008547,
"grad_norm": 0.16939112544059753,
"learning_rate": 5.4935622317596565e-06,
"loss": 0.3539,
"num_input_tokens_seen": 7028750,
"step": 1139,
"train_runtime": 5006.7812,
"train_tokens_per_second": 1403.846
},
{
"epoch": 1.9487179487179487,
"grad_norm": 0.15002712607383728,
"learning_rate": 5.321888412017167e-06,
"loss": 0.3174,
"num_input_tokens_seen": 7033710,
"step": 1140,
"train_runtime": 5010.1585,
"train_tokens_per_second": 1403.89
},
{
"epoch": 1.9504273504273504,
"grad_norm": 0.18167702853679657,
"learning_rate": 5.150214592274678e-06,
"loss": 0.4735,
"num_input_tokens_seen": 7038134,
"step": 1141,
"train_runtime": 5015.1806,
"train_tokens_per_second": 1403.366
},
{
"epoch": 1.952136752136752,
"grad_norm": 0.19326065480709076,
"learning_rate": 4.978540772532189e-06,
"loss": 0.4024,
"num_input_tokens_seen": 7045182,
"step": 1142,
"train_runtime": 5019.6695,
"train_tokens_per_second": 1403.515
},
{
"epoch": 1.953846153846154,
"grad_norm": 0.15256325900554657,
"learning_rate": 4.8068669527897e-06,
"loss": 0.4067,
"num_input_tokens_seen": 7051910,
"step": 1143,
"train_runtime": 5024.001,
"train_tokens_per_second": 1403.644
},
{
"epoch": 1.9555555555555557,
"grad_norm": 0.14433787763118744,
"learning_rate": 4.63519313304721e-06,
"loss": 0.3536,
"num_input_tokens_seen": 7057862,
"step": 1144,
"train_runtime": 5027.9685,
"train_tokens_per_second": 1403.72
},
{
"epoch": 1.9572649572649574,
"grad_norm": 0.13618534803390503,
"learning_rate": 4.463519313304721e-06,
"loss": 0.3097,
"num_input_tokens_seen": 7065950,
"step": 1145,
"train_runtime": 5033.0872,
"train_tokens_per_second": 1403.9
},
{
"epoch": 1.9589743589743591,
"grad_norm": 0.18025486171245575,
"learning_rate": 4.2918454935622316e-06,
"loss": 0.5036,
"num_input_tokens_seen": 7070798,
"step": 1146,
"train_runtime": 5036.3826,
"train_tokens_per_second": 1403.944
},
{
"epoch": 1.9606837606837608,
"grad_norm": 0.14855344593524933,
"learning_rate": 4.120171673819742e-06,
"loss": 0.358,
"num_input_tokens_seen": 7076262,
"step": 1147,
"train_runtime": 5039.9834,
"train_tokens_per_second": 1404.025
},
{
"epoch": 1.9623931623931625,
"grad_norm": 0.14267109334468842,
"learning_rate": 3.948497854077254e-06,
"loss": 0.314,
"num_input_tokens_seen": 7082518,
"step": 1148,
"train_runtime": 5044.05,
"train_tokens_per_second": 1404.133
},
{
"epoch": 1.9641025641025642,
"grad_norm": 0.14983952045440674,
"learning_rate": 3.7768240343347637e-06,
"loss": 0.3844,
"num_input_tokens_seen": 7088558,
"step": 1149,
"train_runtime": 5047.9368,
"train_tokens_per_second": 1404.249
},
{
"epoch": 1.965811965811966,
"grad_norm": 0.1477644294500351,
"learning_rate": 3.6051502145922745e-06,
"loss": 0.2836,
"num_input_tokens_seen": 7095926,
"step": 1150,
"train_runtime": 5052.6961,
"train_tokens_per_second": 1404.384
},
{
"epoch": 1.9675213675213676,
"grad_norm": 0.17511659860610962,
"learning_rate": 3.4334763948497858e-06,
"loss": 0.3682,
"num_input_tokens_seen": 7100846,
"step": 1151,
"train_runtime": 5056.0814,
"train_tokens_per_second": 1404.417
},
{
"epoch": 1.9692307692307693,
"grad_norm": 0.15633749961853027,
"learning_rate": 3.2618025751072966e-06,
"loss": 0.2592,
"num_input_tokens_seen": 7105150,
"step": 1152,
"train_runtime": 5059.0018,
"train_tokens_per_second": 1404.457
},
{
"epoch": 1.970940170940171,
"grad_norm": 0.15015672147274017,
"learning_rate": 3.090128755364807e-06,
"loss": 0.3362,
"num_input_tokens_seen": 7112038,
"step": 1153,
"train_runtime": 5063.4562,
"train_tokens_per_second": 1404.582
},
{
"epoch": 1.9726495726495727,
"grad_norm": 0.14071433246135712,
"learning_rate": 2.918454935622318e-06,
"loss": 0.2969,
"num_input_tokens_seen": 7118214,
"step": 1154,
"train_runtime": 5067.4234,
"train_tokens_per_second": 1404.701
},
{
"epoch": 1.9743589743589745,
"grad_norm": 0.16674835979938507,
"learning_rate": 2.7467811158798283e-06,
"loss": 0.4497,
"num_input_tokens_seen": 7124414,
"step": 1155,
"train_runtime": 5071.4815,
"train_tokens_per_second": 1404.799
},
{
"epoch": 1.9760683760683762,
"grad_norm": 0.16165152192115784,
"learning_rate": 2.575107296137339e-06,
"loss": 0.3373,
"num_input_tokens_seen": 7128862,
"step": 1156,
"train_runtime": 5074.4614,
"train_tokens_per_second": 1404.851
},
{
"epoch": 1.9777777777777779,
"grad_norm": 0.17277656495571136,
"learning_rate": 2.40343347639485e-06,
"loss": 0.2393,
"num_input_tokens_seen": 7146230,
"step": 1157,
"train_runtime": 5084.9281,
"train_tokens_per_second": 1405.375
},
{
"epoch": 1.9794871794871796,
"grad_norm": 0.17875243723392487,
"learning_rate": 2.2317596566523604e-06,
"loss": 0.4351,
"num_input_tokens_seen": 7152230,
"step": 1158,
"train_runtime": 5088.821,
"train_tokens_per_second": 1405.479
},
{
"epoch": 1.9811965811965813,
"grad_norm": 0.15034790337085724,
"learning_rate": 2.060085836909871e-06,
"loss": 0.337,
"num_input_tokens_seen": 7157270,
"step": 1159,
"train_runtime": 5092.1754,
"train_tokens_per_second": 1405.543
},
{
"epoch": 1.982905982905983,
"grad_norm": 0.15507899224758148,
"learning_rate": 1.8884120171673818e-06,
"loss": 0.3092,
"num_input_tokens_seen": 7162982,
"step": 1160,
"train_runtime": 5095.8972,
"train_tokens_per_second": 1405.637
},
{
"epoch": 1.9846153846153847,
"grad_norm": 0.14410509169101715,
"learning_rate": 1.7167381974248929e-06,
"loss": 0.3034,
"num_input_tokens_seen": 7169934,
"step": 1161,
"train_runtime": 5100.2993,
"train_tokens_per_second": 1405.787
},
{
"epoch": 1.9863247863247864,
"grad_norm": 0.1652487963438034,
"learning_rate": 1.5450643776824035e-06,
"loss": 0.3926,
"num_input_tokens_seen": 7175958,
"step": 1162,
"train_runtime": 5104.1999,
"train_tokens_per_second": 1405.893
},
{
"epoch": 1.988034188034188,
"grad_norm": 0.12866978347301483,
"learning_rate": 1.3733905579399141e-06,
"loss": 0.216,
"num_input_tokens_seen": 7192558,
"step": 1163,
"train_runtime": 5113.9801,
"train_tokens_per_second": 1406.45
},
{
"epoch": 1.9897435897435898,
"grad_norm": 0.1544247269630432,
"learning_rate": 1.201716738197425e-06,
"loss": 0.3591,
"num_input_tokens_seen": 7198806,
"step": 1164,
"train_runtime": 5117.9515,
"train_tokens_per_second": 1406.58
},
{
"epoch": 1.9914529914529915,
"grad_norm": 0.14498887956142426,
"learning_rate": 1.0300429184549356e-06,
"loss": 0.3196,
"num_input_tokens_seen": 7205486,
"step": 1165,
"train_runtime": 5122.3014,
"train_tokens_per_second": 1406.689
},
{
"epoch": 1.9931623931623932,
"grad_norm": 0.1625777930021286,
"learning_rate": 8.583690987124464e-07,
"loss": 0.3314,
"num_input_tokens_seen": 7210694,
"step": 1166,
"train_runtime": 5125.7917,
"train_tokens_per_second": 1406.747
},
{
"epoch": 1.994871794871795,
"grad_norm": 0.16056707501411438,
"learning_rate": 6.866952789699571e-07,
"loss": 0.4212,
"num_input_tokens_seen": 7216110,
"step": 1167,
"train_runtime": 5129.3371,
"train_tokens_per_second": 1406.831
},
{
"epoch": 1.9965811965811966,
"grad_norm": 0.17116740345954895,
"learning_rate": 5.150214592274678e-07,
"loss": 0.3152,
"num_input_tokens_seen": 7222086,
"step": 1168,
"train_runtime": 5133.2419,
"train_tokens_per_second": 1406.925
},
{
"epoch": 1.9982905982905983,
"grad_norm": 0.13754986226558685,
"learning_rate": 3.4334763948497853e-07,
"loss": 0.3062,
"num_input_tokens_seen": 7228470,
"step": 1169,
"train_runtime": 5137.3693,
"train_tokens_per_second": 1407.037
},
{
"epoch": 2.0,
"grad_norm": 0.1478198617696762,
"learning_rate": 1.7167381974248927e-07,
"loss": 0.3072,
"num_input_tokens_seen": 7234780,
"step": 1170,
"train_runtime": 5141.5156,
"train_tokens_per_second": 1407.13
},
{
"epoch": 2.0,
"eval_loss": 0.40483909845352173,
"eval_runtime": 40.6231,
"eval_samples_per_second": 24.567,
"eval_steps_per_second": 3.077,
"num_input_tokens_seen": 7234780,
"step": 1170
}
],
"logging_steps": 1,
"max_steps": 1170,
"num_input_tokens_seen": 7234780,
"num_train_epochs": 2,
"save_steps": 30,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.400044806730752e+18,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}