FormlessAI's picture
Upload folder using huggingface_hub
23b12a4 verified
Raw
History Blame Contribute Delete
458 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 156,
"global_step": 1556,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0006428801028608164,
"grad_norm": 1.4815346002578735,
"learning_rate": 0.0,
"loss": 3.0354,
"num_input_tokens_seen": 58240,
"step": 1,
"train_runtime": 14.0904,
"train_tokens_per_second": 4133.31
},
{
"epoch": 0.0012857602057216328,
"grad_norm": 1.3779746294021606,
"learning_rate": 4e-05,
"loss": 2.9584,
"num_input_tokens_seen": 102384,
"step": 2,
"train_runtime": 20.0807,
"train_tokens_per_second": 5098.638
},
{
"epoch": 0.0019286403085824494,
"grad_norm": 1.3874965906143188,
"learning_rate": 8e-05,
"loss": 3.1628,
"num_input_tokens_seen": 164480,
"step": 3,
"train_runtime": 29.0202,
"train_tokens_per_second": 5667.774
},
{
"epoch": 0.0025715204114432656,
"grad_norm": 1.467178225517273,
"learning_rate": 0.00012,
"loss": 2.8477,
"num_input_tokens_seen": 227360,
"step": 4,
"train_runtime": 37.6089,
"train_tokens_per_second": 6045.37
},
{
"epoch": 0.0032144005143040825,
"grad_norm": 1.5457735061645508,
"learning_rate": 0.00016,
"loss": 2.7233,
"num_input_tokens_seen": 264512,
"step": 5,
"train_runtime": 42.7595,
"train_tokens_per_second": 6186.034
},
{
"epoch": 0.003857280617164899,
"grad_norm": 1.178829312324524,
"learning_rate": 0.0002,
"loss": 2.1801,
"num_input_tokens_seen": 309424,
"step": 6,
"train_runtime": 48.9842,
"train_tokens_per_second": 6316.809
},
{
"epoch": 0.004500160720025715,
"grad_norm": 0.8789910078048706,
"learning_rate": 0.00019987105093488073,
"loss": 1.8974,
"num_input_tokens_seen": 402160,
"step": 7,
"train_runtime": 61.7856,
"train_tokens_per_second": 6508.96
},
{
"epoch": 0.005143040822886531,
"grad_norm": 0.673732578754425,
"learning_rate": 0.00019974210186976145,
"loss": 1.7119,
"num_input_tokens_seen": 438624,
"step": 8,
"train_runtime": 66.8435,
"train_tokens_per_second": 6561.957
},
{
"epoch": 0.0057859209257473485,
"grad_norm": 0.521441638469696,
"learning_rate": 0.00019961315280464216,
"loss": 1.4815,
"num_input_tokens_seen": 486400,
"step": 9,
"train_runtime": 73.4648,
"train_tokens_per_second": 6620.858
},
{
"epoch": 0.006428801028608165,
"grad_norm": 0.6127826571464539,
"learning_rate": 0.0001994842037395229,
"loss": 1.5544,
"num_input_tokens_seen": 542512,
"step": 10,
"train_runtime": 81.1977,
"train_tokens_per_second": 6681.374
},
{
"epoch": 0.007071681131468981,
"grad_norm": 0.640856146812439,
"learning_rate": 0.0001993552546744036,
"loss": 1.4353,
"num_input_tokens_seen": 588752,
"step": 11,
"train_runtime": 87.6246,
"train_tokens_per_second": 6719.029
},
{
"epoch": 0.007714561234329798,
"grad_norm": 0.48673883080482483,
"learning_rate": 0.00019922630560928435,
"loss": 1.3777,
"num_input_tokens_seen": 652208,
"step": 12,
"train_runtime": 96.4514,
"train_tokens_per_second": 6762.039
},
{
"epoch": 0.008357441337190614,
"grad_norm": 0.7254194021224976,
"learning_rate": 0.00019909735654416506,
"loss": 1.534,
"num_input_tokens_seen": 713088,
"step": 13,
"train_runtime": 104.9169,
"train_tokens_per_second": 6796.692
},
{
"epoch": 0.00900032144005143,
"grad_norm": 0.43824103474617004,
"learning_rate": 0.00019896840747904578,
"loss": 1.3674,
"num_input_tokens_seen": 755024,
"step": 14,
"train_runtime": 110.719,
"train_tokens_per_second": 6819.28
},
{
"epoch": 0.009643201542912247,
"grad_norm": 0.3844089210033417,
"learning_rate": 0.0001988394584139265,
"loss": 1.3111,
"num_input_tokens_seen": 804912,
"step": 15,
"train_runtime": 117.6264,
"train_tokens_per_second": 6842.954
},
{
"epoch": 0.010286081645773062,
"grad_norm": 0.35496699810028076,
"learning_rate": 0.00019871050934880725,
"loss": 1.2114,
"num_input_tokens_seen": 873424,
"step": 16,
"train_runtime": 127.1638,
"train_tokens_per_second": 6868.496
},
{
"epoch": 0.01092896174863388,
"grad_norm": 0.43963053822517395,
"learning_rate": 0.00019858156028368796,
"loss": 1.1994,
"num_input_tokens_seen": 907520,
"step": 17,
"train_runtime": 131.9627,
"train_tokens_per_second": 6877.095
},
{
"epoch": 0.011571841851494697,
"grad_norm": 0.33540457487106323,
"learning_rate": 0.00019845261121856868,
"loss": 1.254,
"num_input_tokens_seen": 952896,
"step": 18,
"train_runtime": 138.2745,
"train_tokens_per_second": 6891.337
},
{
"epoch": 0.012214721954355513,
"grad_norm": 0.2950117588043213,
"learning_rate": 0.0001983236621534494,
"loss": 1.1624,
"num_input_tokens_seen": 1005344,
"step": 19,
"train_runtime": 145.6011,
"train_tokens_per_second": 6904.781
},
{
"epoch": 0.01285760205721633,
"grad_norm": 0.2870226502418518,
"learning_rate": 0.00019819471308833012,
"loss": 1.1386,
"num_input_tokens_seen": 1040544,
"step": 20,
"train_runtime": 150.5659,
"train_tokens_per_second": 6910.886
},
{
"epoch": 0.013500482160077145,
"grad_norm": 0.27605196833610535,
"learning_rate": 0.00019806576402321084,
"loss": 1.2057,
"num_input_tokens_seen": 1080432,
"step": 21,
"train_runtime": 156.1378,
"train_tokens_per_second": 6919.735
},
{
"epoch": 0.014143362262937963,
"grad_norm": 0.29624828696250916,
"learning_rate": 0.00019793681495809155,
"loss": 1.2303,
"num_input_tokens_seen": 1148496,
"step": 22,
"train_runtime": 165.7289,
"train_tokens_per_second": 6929.969
},
{
"epoch": 0.014786242365798778,
"grad_norm": 0.2731878459453583,
"learning_rate": 0.0001978078658929723,
"loss": 1.0739,
"num_input_tokens_seen": 1189760,
"step": 23,
"train_runtime": 171.4728,
"train_tokens_per_second": 6938.478
},
{
"epoch": 0.015429122468659595,
"grad_norm": 0.33944907784461975,
"learning_rate": 0.000197678916827853,
"loss": 1.0303,
"num_input_tokens_seen": 1226432,
"step": 24,
"train_runtime": 176.634,
"train_tokens_per_second": 6943.352
},
{
"epoch": 0.016072002571520413,
"grad_norm": 0.2622462511062622,
"learning_rate": 0.00019754996776273374,
"loss": 1.3015,
"num_input_tokens_seen": 1266848,
"step": 25,
"train_runtime": 182.3158,
"train_tokens_per_second": 6948.647
},
{
"epoch": 0.01671488267438123,
"grad_norm": 0.24616512656211853,
"learning_rate": 0.00019742101869761445,
"loss": 1.1244,
"num_input_tokens_seen": 1323584,
"step": 26,
"train_runtime": 190.2408,
"train_tokens_per_second": 6957.415
},
{
"epoch": 0.017357762777242044,
"grad_norm": 0.23589050769805908,
"learning_rate": 0.00019729206963249517,
"loss": 1.1235,
"num_input_tokens_seen": 1361104,
"step": 27,
"train_runtime": 195.5135,
"train_tokens_per_second": 6961.687
},
{
"epoch": 0.01800064288010286,
"grad_norm": 0.23991915583610535,
"learning_rate": 0.0001971631205673759,
"loss": 1.1462,
"num_input_tokens_seen": 1398528,
"step": 28,
"train_runtime": 200.794,
"train_tokens_per_second": 6964.989
},
{
"epoch": 0.01864352298296368,
"grad_norm": 0.2634638547897339,
"learning_rate": 0.00019703417150225663,
"loss": 1.2721,
"num_input_tokens_seen": 1435776,
"step": 29,
"train_runtime": 206.0467,
"train_tokens_per_second": 6968.207
},
{
"epoch": 0.019286403085824494,
"grad_norm": 0.19377130270004272,
"learning_rate": 0.00019690522243713733,
"loss": 1.1832,
"num_input_tokens_seen": 1478496,
"step": 30,
"train_runtime": 212.0993,
"train_tokens_per_second": 6970.772
},
{
"epoch": 0.01992928318868531,
"grad_norm": 0.18850353360176086,
"learning_rate": 0.00019677627337201807,
"loss": 1.0619,
"num_input_tokens_seen": 1532256,
"step": 31,
"train_runtime": 220.2613,
"train_tokens_per_second": 6956.537
},
{
"epoch": 0.020572163291546125,
"grad_norm": 0.17500188946723938,
"learning_rate": 0.0001966473243068988,
"loss": 1.1776,
"num_input_tokens_seen": 1579456,
"step": 32,
"train_runtime": 226.8725,
"train_tokens_per_second": 6961.867
},
{
"epoch": 0.021215043394406944,
"grad_norm": 0.21095849573612213,
"learning_rate": 0.0001965183752417795,
"loss": 1.1431,
"num_input_tokens_seen": 1624896,
"step": 33,
"train_runtime": 233.2234,
"train_tokens_per_second": 6967.124
},
{
"epoch": 0.02185792349726776,
"grad_norm": 0.18223783373832703,
"learning_rate": 0.00019638942617666023,
"loss": 1.1791,
"num_input_tokens_seen": 1669808,
"step": 34,
"train_runtime": 239.4782,
"train_tokens_per_second": 6972.692
},
{
"epoch": 0.022500803600128575,
"grad_norm": 0.21014757454395294,
"learning_rate": 0.00019626047711154094,
"loss": 1.1142,
"num_input_tokens_seen": 1738240,
"step": 35,
"train_runtime": 249.0199,
"train_tokens_per_second": 6980.327
},
{
"epoch": 0.023143683702989394,
"grad_norm": 0.19807523488998413,
"learning_rate": 0.0001961315280464217,
"loss": 1.2255,
"num_input_tokens_seen": 1788656,
"step": 36,
"train_runtime": 256.0945,
"train_tokens_per_second": 6984.36
},
{
"epoch": 0.02378656380585021,
"grad_norm": 0.2257339507341385,
"learning_rate": 0.00019600257898130238,
"loss": 1.1833,
"num_input_tokens_seen": 1830592,
"step": 37,
"train_runtime": 262.0096,
"train_tokens_per_second": 6986.737
},
{
"epoch": 0.024429443908711025,
"grad_norm": 0.16706082224845886,
"learning_rate": 0.00019587362991618313,
"loss": 1.0836,
"num_input_tokens_seen": 1889488,
"step": 38,
"train_runtime": 270.2441,
"train_tokens_per_second": 6991.783
},
{
"epoch": 0.02507232401157184,
"grad_norm": 0.17788530886173248,
"learning_rate": 0.00019574468085106384,
"loss": 1.1416,
"num_input_tokens_seen": 1926928,
"step": 39,
"train_runtime": 275.5398,
"train_tokens_per_second": 6993.283
},
{
"epoch": 0.02571520411443266,
"grad_norm": 0.20560547709465027,
"learning_rate": 0.00019561573178594456,
"loss": 1.1354,
"num_input_tokens_seen": 1975616,
"step": 40,
"train_runtime": 282.4472,
"train_tokens_per_second": 6994.638
},
{
"epoch": 0.026358084217293475,
"grad_norm": 0.18634942173957825,
"learning_rate": 0.00019548678272082528,
"loss": 1.1416,
"num_input_tokens_seen": 2020672,
"step": 41,
"train_runtime": 288.8056,
"train_tokens_per_second": 6996.65
},
{
"epoch": 0.02700096432015429,
"grad_norm": 0.2036864012479782,
"learning_rate": 0.00019535783365570602,
"loss": 1.0778,
"num_input_tokens_seen": 2059120,
"step": 42,
"train_runtime": 294.2046,
"train_tokens_per_second": 6998.94
},
{
"epoch": 0.027643844423015106,
"grad_norm": 0.15779554843902588,
"learning_rate": 0.00019522888459058672,
"loss": 1.0298,
"num_input_tokens_seen": 2113040,
"step": 43,
"train_runtime": 301.7907,
"train_tokens_per_second": 7001.675
},
{
"epoch": 0.028286724525875925,
"grad_norm": 0.1940307766199112,
"learning_rate": 0.00019509993552546746,
"loss": 1.2145,
"num_input_tokens_seen": 2168464,
"step": 44,
"train_runtime": 309.5156,
"train_tokens_per_second": 7005.992
},
{
"epoch": 0.02892960462873674,
"grad_norm": 0.1537512242794037,
"learning_rate": 0.00019497098646034818,
"loss": 1.0519,
"num_input_tokens_seen": 2221904,
"step": 45,
"train_runtime": 317.0459,
"train_tokens_per_second": 7008.147
},
{
"epoch": 0.029572484731597556,
"grad_norm": 0.16348929703235626,
"learning_rate": 0.0001948420373952289,
"loss": 1.1651,
"num_input_tokens_seen": 2261088,
"step": 46,
"train_runtime": 322.608,
"train_tokens_per_second": 7008.778
},
{
"epoch": 0.030215364834458372,
"grad_norm": 0.1592399775981903,
"learning_rate": 0.00019471308833010962,
"loss": 1.0866,
"num_input_tokens_seen": 2301040,
"step": 47,
"train_runtime": 328.2327,
"train_tokens_per_second": 7010.392
},
{
"epoch": 0.03085824493731919,
"grad_norm": 0.15753492712974548,
"learning_rate": 0.00019458413926499033,
"loss": 1.2199,
"num_input_tokens_seen": 2340080,
"step": 48,
"train_runtime": 333.7329,
"train_tokens_per_second": 7011.835
},
{
"epoch": 0.03150112504018,
"grad_norm": 0.16081875562667847,
"learning_rate": 0.00019445519019987105,
"loss": 1.0763,
"num_input_tokens_seen": 2385008,
"step": 49,
"train_runtime": 340.0525,
"train_tokens_per_second": 7013.647
},
{
"epoch": 0.032144005143040826,
"grad_norm": 0.18117882311344147,
"learning_rate": 0.00019432624113475177,
"loss": 1.1252,
"num_input_tokens_seen": 2424432,
"step": 50,
"train_runtime": 345.6231,
"train_tokens_per_second": 7014.671
},
{
"epoch": 0.03278688524590164,
"grad_norm": 0.196014404296875,
"learning_rate": 0.00019419729206963251,
"loss": 1.1195,
"num_input_tokens_seen": 2483664,
"step": 51,
"train_runtime": 353.9289,
"train_tokens_per_second": 7017.409
},
{
"epoch": 0.03342976534876246,
"grad_norm": 0.17965562641620636,
"learning_rate": 0.00019406834300451323,
"loss": 1.1258,
"num_input_tokens_seen": 2518352,
"step": 52,
"train_runtime": 358.8626,
"train_tokens_per_second": 7017.594
},
{
"epoch": 0.03407264545162327,
"grad_norm": 0.1602979451417923,
"learning_rate": 0.00019393939393939395,
"loss": 1.0905,
"num_input_tokens_seen": 2576704,
"step": 53,
"train_runtime": 367.0539,
"train_tokens_per_second": 7019.961
},
{
"epoch": 0.03471552555448409,
"grad_norm": 0.17046068608760834,
"learning_rate": 0.00019381044487427467,
"loss": 1.1841,
"num_input_tokens_seen": 2616624,
"step": 54,
"train_runtime": 372.6815,
"train_tokens_per_second": 7021.074
},
{
"epoch": 0.0353584056573449,
"grad_norm": 0.15942060947418213,
"learning_rate": 0.0001936814958091554,
"loss": 1.0914,
"num_input_tokens_seen": 2671344,
"step": 55,
"train_runtime": 380.3215,
"train_tokens_per_second": 7023.911
},
{
"epoch": 0.03600128576020572,
"grad_norm": 0.17654664814472198,
"learning_rate": 0.0001935525467440361,
"loss": 1.0943,
"num_input_tokens_seen": 2715520,
"step": 56,
"train_runtime": 386.5062,
"train_tokens_per_second": 7025.813
},
{
"epoch": 0.03664416586306654,
"grad_norm": 0.23010510206222534,
"learning_rate": 0.00019342359767891685,
"loss": 1.1784,
"num_input_tokens_seen": 2762960,
"step": 57,
"train_runtime": 393.1797,
"train_tokens_per_second": 7027.219
},
{
"epoch": 0.03728704596592736,
"grad_norm": 0.17523719370365143,
"learning_rate": 0.00019329464861379757,
"loss": 1.1282,
"num_input_tokens_seen": 2816064,
"step": 58,
"train_runtime": 400.6116,
"train_tokens_per_second": 7029.413
},
{
"epoch": 0.03792992606878817,
"grad_norm": 0.21163171529769897,
"learning_rate": 0.0001931656995486783,
"loss": 1.0851,
"num_input_tokens_seen": 2855264,
"step": 59,
"train_runtime": 406.1575,
"train_tokens_per_second": 7029.942
},
{
"epoch": 0.03857280617164899,
"grad_norm": 0.25337469577789307,
"learning_rate": 0.000193036750483559,
"loss": 1.2117,
"num_input_tokens_seen": 2904656,
"step": 60,
"train_runtime": 413.1009,
"train_tokens_per_second": 7031.348
},
{
"epoch": 0.0392156862745098,
"grad_norm": 0.19712360203266144,
"learning_rate": 0.00019290780141843972,
"loss": 1.2204,
"num_input_tokens_seen": 2971088,
"step": 61,
"train_runtime": 422.9897,
"train_tokens_per_second": 7024.019
},
{
"epoch": 0.03985856637737062,
"grad_norm": 0.19821137189865112,
"learning_rate": 0.00019277885235332044,
"loss": 1.0626,
"num_input_tokens_seen": 3013552,
"step": 62,
"train_runtime": 428.9561,
"train_tokens_per_second": 7025.315
},
{
"epoch": 0.040501446480231434,
"grad_norm": 0.17856234312057495,
"learning_rate": 0.00019264990328820116,
"loss": 1.0619,
"num_input_tokens_seen": 3059952,
"step": 63,
"train_runtime": 435.4318,
"train_tokens_per_second": 7027.397
},
{
"epoch": 0.04114432658309225,
"grad_norm": 0.18660882115364075,
"learning_rate": 0.0001925209542230819,
"loss": 1.0679,
"num_input_tokens_seen": 3107920,
"step": 64,
"train_runtime": 442.1457,
"train_tokens_per_second": 7029.175
},
{
"epoch": 0.04178720668595307,
"grad_norm": 0.1943148672580719,
"learning_rate": 0.0001923920051579626,
"loss": 1.1859,
"num_input_tokens_seen": 3155936,
"step": 65,
"train_runtime": 448.9004,
"train_tokens_per_second": 7030.371
},
{
"epoch": 0.04243008678881389,
"grad_norm": 0.18507765233516693,
"learning_rate": 0.00019226305609284334,
"loss": 1.0599,
"num_input_tokens_seen": 3190864,
"step": 66,
"train_runtime": 453.8531,
"train_tokens_per_second": 7030.609
},
{
"epoch": 0.043072966891674704,
"grad_norm": 0.17876607179641724,
"learning_rate": 0.00019213410702772406,
"loss": 1.1394,
"num_input_tokens_seen": 3233616,
"step": 67,
"train_runtime": 459.8348,
"train_tokens_per_second": 7032.126
},
{
"epoch": 0.04371584699453552,
"grad_norm": 0.19422762095928192,
"learning_rate": 0.00019200515796260478,
"loss": 1.0683,
"num_input_tokens_seen": 3303616,
"step": 68,
"train_runtime": 469.6416,
"train_tokens_per_second": 7034.334
},
{
"epoch": 0.044358727097396335,
"grad_norm": 0.2042950987815857,
"learning_rate": 0.0001918762088974855,
"loss": 1.1002,
"num_input_tokens_seen": 3353936,
"step": 69,
"train_runtime": 476.682,
"train_tokens_per_second": 7036.003
},
{
"epoch": 0.04500160720025715,
"grad_norm": 0.18014422059059143,
"learning_rate": 0.00019174725983236624,
"loss": 0.9397,
"num_input_tokens_seen": 3398368,
"step": 70,
"train_runtime": 482.9344,
"train_tokens_per_second": 7036.915
},
{
"epoch": 0.045644487303117966,
"grad_norm": 0.16590985655784607,
"learning_rate": 0.00019161831076724693,
"loss": 1.0775,
"num_input_tokens_seen": 3444640,
"step": 71,
"train_runtime": 489.4489,
"train_tokens_per_second": 7037.793
},
{
"epoch": 0.04628736740597879,
"grad_norm": 0.19661296904087067,
"learning_rate": 0.00019148936170212768,
"loss": 1.1763,
"num_input_tokens_seen": 3486768,
"step": 72,
"train_runtime": 495.3941,
"train_tokens_per_second": 7038.372
},
{
"epoch": 0.046930247508839604,
"grad_norm": 0.18453364074230194,
"learning_rate": 0.0001913604126370084,
"loss": 1.0713,
"num_input_tokens_seen": 3540944,
"step": 73,
"train_runtime": 502.9706,
"train_tokens_per_second": 7040.062
},
{
"epoch": 0.04757312761170042,
"grad_norm": 0.1981048732995987,
"learning_rate": 0.0001912314635718891,
"loss": 1.1318,
"num_input_tokens_seen": 3600416,
"step": 74,
"train_runtime": 511.3315,
"train_tokens_per_second": 7041.255
},
{
"epoch": 0.048216007714561235,
"grad_norm": 0.19020932912826538,
"learning_rate": 0.00019110251450676983,
"loss": 1.1775,
"num_input_tokens_seen": 3643216,
"step": 75,
"train_runtime": 517.3293,
"train_tokens_per_second": 7042.354
},
{
"epoch": 0.04885888781742205,
"grad_norm": 0.19130156934261322,
"learning_rate": 0.00019097356544165055,
"loss": 1.0635,
"num_input_tokens_seen": 3690592,
"step": 76,
"train_runtime": 523.9724,
"train_tokens_per_second": 7043.485
},
{
"epoch": 0.049501767920282866,
"grad_norm": 0.191071018576622,
"learning_rate": 0.0001908446163765313,
"loss": 1.2032,
"num_input_tokens_seen": 3743680,
"step": 77,
"train_runtime": 531.4274,
"train_tokens_per_second": 7044.575
},
{
"epoch": 0.05014464802314368,
"grad_norm": 0.19254839420318604,
"learning_rate": 0.00019071566731141199,
"loss": 1.0561,
"num_input_tokens_seen": 3788096,
"step": 78,
"train_runtime": 537.6994,
"train_tokens_per_second": 7045.007
},
{
"epoch": 0.0507875281260045,
"grad_norm": 0.21967262029647827,
"learning_rate": 0.00019058671824629273,
"loss": 1.0789,
"num_input_tokens_seen": 3824128,
"step": 79,
"train_runtime": 542.7932,
"train_tokens_per_second": 7045.276
},
{
"epoch": 0.05143040822886532,
"grad_norm": 0.1794055998325348,
"learning_rate": 0.00019045776918117345,
"loss": 1.1144,
"num_input_tokens_seen": 3869600,
"step": 80,
"train_runtime": 549.2268,
"train_tokens_per_second": 7045.541
},
{
"epoch": 0.052073288331726135,
"grad_norm": 0.22182276844978333,
"learning_rate": 0.00019032882011605417,
"loss": 1.0452,
"num_input_tokens_seen": 3930416,
"step": 81,
"train_runtime": 557.7179,
"train_tokens_per_second": 7047.319
},
{
"epoch": 0.05271616843458695,
"grad_norm": 0.1964883953332901,
"learning_rate": 0.00019019987105093489,
"loss": 1.1264,
"num_input_tokens_seen": 3994528,
"step": 82,
"train_runtime": 566.7719,
"train_tokens_per_second": 7047.859
},
{
"epoch": 0.053359048537447766,
"grad_norm": 0.18389713764190674,
"learning_rate": 0.00019007092198581563,
"loss": 1.1044,
"num_input_tokens_seen": 4025760,
"step": 83,
"train_runtime": 571.2105,
"train_tokens_per_second": 7047.769
},
{
"epoch": 0.05400192864030858,
"grad_norm": 0.21487605571746826,
"learning_rate": 0.00018994197292069632,
"loss": 1.0369,
"num_input_tokens_seen": 4073840,
"step": 84,
"train_runtime": 577.9687,
"train_tokens_per_second": 7048.548
},
{
"epoch": 0.0546448087431694,
"grad_norm": 0.21032066643238068,
"learning_rate": 0.00018981302385557707,
"loss": 1.0615,
"num_input_tokens_seen": 4108976,
"step": 85,
"train_runtime": 582.9533,
"train_tokens_per_second": 7048.551
},
{
"epoch": 0.05528768884603021,
"grad_norm": 0.19567039608955383,
"learning_rate": 0.00018968407479045778,
"loss": 0.9216,
"num_input_tokens_seen": 4164832,
"step": 86,
"train_runtime": 590.7405,
"train_tokens_per_second": 7050.188
},
{
"epoch": 0.055930568948891035,
"grad_norm": 0.2140112817287445,
"learning_rate": 0.00018955512572533848,
"loss": 1.1268,
"num_input_tokens_seen": 4223920,
"step": 87,
"train_runtime": 599.009,
"train_tokens_per_second": 7051.513
},
{
"epoch": 0.05657344905175185,
"grad_norm": 0.2232234627008438,
"learning_rate": 0.00018942617666021922,
"loss": 1.1666,
"num_input_tokens_seen": 4257440,
"step": 88,
"train_runtime": 603.7538,
"train_tokens_per_second": 7051.616
},
{
"epoch": 0.057216329154612666,
"grad_norm": 0.20844654738903046,
"learning_rate": 0.00018929722759509994,
"loss": 0.9959,
"num_input_tokens_seen": 4291488,
"step": 89,
"train_runtime": 608.6239,
"train_tokens_per_second": 7051.133
},
{
"epoch": 0.05785920925747348,
"grad_norm": 0.21762102842330933,
"learning_rate": 0.00018916827852998066,
"loss": 1.0791,
"num_input_tokens_seen": 4350704,
"step": 90,
"train_runtime": 616.9377,
"train_tokens_per_second": 7052.097
},
{
"epoch": 0.0585020893603343,
"grad_norm": 0.2169635146856308,
"learning_rate": 0.00018903932946486138,
"loss": 1.169,
"num_input_tokens_seen": 4390512,
"step": 91,
"train_runtime": 623.0766,
"train_tokens_per_second": 7046.505
},
{
"epoch": 0.05914496946319511,
"grad_norm": 0.19721537828445435,
"learning_rate": 0.00018891038039974212,
"loss": 1.0508,
"num_input_tokens_seen": 4441920,
"step": 92,
"train_runtime": 630.2606,
"train_tokens_per_second": 7047.751
},
{
"epoch": 0.05978784956605593,
"grad_norm": 0.23010528087615967,
"learning_rate": 0.00018878143133462284,
"loss": 0.9817,
"num_input_tokens_seen": 4486672,
"step": 93,
"train_runtime": 636.5612,
"train_tokens_per_second": 7048.297
},
{
"epoch": 0.060430729668916744,
"grad_norm": 0.19669458270072937,
"learning_rate": 0.00018865248226950356,
"loss": 1.0702,
"num_input_tokens_seen": 4538384,
"step": 94,
"train_runtime": 643.8004,
"train_tokens_per_second": 7049.365
},
{
"epoch": 0.061073609771777566,
"grad_norm": 0.33032017946243286,
"learning_rate": 0.00018852353320438427,
"loss": 1.0299,
"num_input_tokens_seen": 4589312,
"step": 95,
"train_runtime": 651.0321,
"train_tokens_per_second": 7049.287
},
{
"epoch": 0.06171648987463838,
"grad_norm": 0.18110264837741852,
"learning_rate": 0.00018839458413926502,
"loss": 0.9553,
"num_input_tokens_seen": 4626080,
"step": 96,
"train_runtime": 656.2234,
"train_tokens_per_second": 7049.55
},
{
"epoch": 0.0623593699774992,
"grad_norm": 0.2149723619222641,
"learning_rate": 0.0001882656350741457,
"loss": 1.1532,
"num_input_tokens_seen": 4668624,
"step": 97,
"train_runtime": 662.2157,
"train_tokens_per_second": 7050.005
},
{
"epoch": 0.06300225008036,
"grad_norm": 0.21420878171920776,
"learning_rate": 0.00018813668600902646,
"loss": 1.1092,
"num_input_tokens_seen": 4724240,
"step": 98,
"train_runtime": 670.094,
"train_tokens_per_second": 7050.115
},
{
"epoch": 0.06364513018322084,
"grad_norm": 0.21070437133312225,
"learning_rate": 0.00018800773694390717,
"loss": 0.9589,
"num_input_tokens_seen": 4795776,
"step": 99,
"train_runtime": 680.0991,
"train_tokens_per_second": 7051.584
},
{
"epoch": 0.06428801028608165,
"grad_norm": 0.19431836903095245,
"learning_rate": 0.0001878787878787879,
"loss": 1.0636,
"num_input_tokens_seen": 4851008,
"step": 100,
"train_runtime": 687.8429,
"train_tokens_per_second": 7052.494
},
{
"epoch": 0.06493089038894247,
"grad_norm": 0.20360679924488068,
"learning_rate": 0.0001877498388136686,
"loss": 1.1182,
"num_input_tokens_seen": 4891088,
"step": 101,
"train_runtime": 693.4719,
"train_tokens_per_second": 7053.044
},
{
"epoch": 0.06557377049180328,
"grad_norm": 0.21350686252117157,
"learning_rate": 0.00018762088974854933,
"loss": 1.0525,
"num_input_tokens_seen": 4952416,
"step": 102,
"train_runtime": 702.1041,
"train_tokens_per_second": 7053.678
},
{
"epoch": 0.0662166505946641,
"grad_norm": 0.2190914750099182,
"learning_rate": 0.00018749194068343005,
"loss": 1.0602,
"num_input_tokens_seen": 5000400,
"step": 103,
"train_runtime": 708.8252,
"train_tokens_per_second": 7054.489
},
{
"epoch": 0.06685953069752491,
"grad_norm": 0.21608233451843262,
"learning_rate": 0.00018736299161831077,
"loss": 1.1176,
"num_input_tokens_seen": 5048592,
"step": 104,
"train_runtime": 715.5961,
"train_tokens_per_second": 7055.086
},
{
"epoch": 0.06750241080038573,
"grad_norm": 0.21670708060264587,
"learning_rate": 0.0001872340425531915,
"loss": 1.1591,
"num_input_tokens_seen": 5081664,
"step": 105,
"train_runtime": 720.3252,
"train_tokens_per_second": 7054.68
},
{
"epoch": 0.06814529090324654,
"grad_norm": 0.20723669230937958,
"learning_rate": 0.0001871050934880722,
"loss": 1.0741,
"num_input_tokens_seen": 5133264,
"step": 106,
"train_runtime": 727.5521,
"train_tokens_per_second": 7055.528
},
{
"epoch": 0.06878817100610736,
"grad_norm": 0.22334900498390198,
"learning_rate": 0.00018697614442295295,
"loss": 1.2012,
"num_input_tokens_seen": 5180464,
"step": 107,
"train_runtime": 734.1803,
"train_tokens_per_second": 7056.12
},
{
"epoch": 0.06943105110896818,
"grad_norm": 0.19817394018173218,
"learning_rate": 0.00018684719535783366,
"loss": 1.0348,
"num_input_tokens_seen": 5227712,
"step": 108,
"train_runtime": 740.8405,
"train_tokens_per_second": 7056.461
},
{
"epoch": 0.07007393121182899,
"grad_norm": 0.22613032162189484,
"learning_rate": 0.00018671824629271438,
"loss": 1.0507,
"num_input_tokens_seen": 5297424,
"step": 109,
"train_runtime": 750.5378,
"train_tokens_per_second": 7058.171
},
{
"epoch": 0.0707168113146898,
"grad_norm": 0.19790789484977722,
"learning_rate": 0.0001865892972275951,
"loss": 1.1512,
"num_input_tokens_seen": 5353920,
"step": 110,
"train_runtime": 758.4763,
"train_tokens_per_second": 7058.783
},
{
"epoch": 0.07135969141755062,
"grad_norm": 0.19805489480495453,
"learning_rate": 0.00018646034816247585,
"loss": 1.0392,
"num_input_tokens_seen": 5387872,
"step": 111,
"train_runtime": 763.2666,
"train_tokens_per_second": 7058.965
},
{
"epoch": 0.07200257152041144,
"grad_norm": 0.21664251387119293,
"learning_rate": 0.00018633139909735656,
"loss": 1.0399,
"num_input_tokens_seen": 5431632,
"step": 112,
"train_runtime": 769.3579,
"train_tokens_per_second": 7059.954
},
{
"epoch": 0.07264545162327225,
"grad_norm": 0.21840597689151764,
"learning_rate": 0.00018620245003223728,
"loss": 1.0969,
"num_input_tokens_seen": 5478704,
"step": 113,
"train_runtime": 775.8252,
"train_tokens_per_second": 7061.776
},
{
"epoch": 0.07328833172613308,
"grad_norm": 0.1976010650396347,
"learning_rate": 0.000186073500967118,
"loss": 0.9954,
"num_input_tokens_seen": 5528176,
"step": 114,
"train_runtime": 782.6383,
"train_tokens_per_second": 7063.513
},
{
"epoch": 0.0739312118289939,
"grad_norm": 0.19003896415233612,
"learning_rate": 0.00018594455190199872,
"loss": 1.0055,
"num_input_tokens_seen": 5593040,
"step": 115,
"train_runtime": 791.6683,
"train_tokens_per_second": 7064.878
},
{
"epoch": 0.07457409193185471,
"grad_norm": 0.1933498978614807,
"learning_rate": 0.00018581560283687944,
"loss": 1.0906,
"num_input_tokens_seen": 5633680,
"step": 116,
"train_runtime": 797.3292,
"train_tokens_per_second": 7065.689
},
{
"epoch": 0.07521697203471553,
"grad_norm": 0.2050444781780243,
"learning_rate": 0.00018568665377176016,
"loss": 0.9672,
"num_input_tokens_seen": 5683744,
"step": 117,
"train_runtime": 804.286,
"train_tokens_per_second": 7066.819
},
{
"epoch": 0.07585985213757634,
"grad_norm": 0.20085984468460083,
"learning_rate": 0.0001855577047066409,
"loss": 1.0086,
"num_input_tokens_seen": 5718912,
"step": 118,
"train_runtime": 809.2226,
"train_tokens_per_second": 7067.168
},
{
"epoch": 0.07650273224043716,
"grad_norm": 0.2239076942205429,
"learning_rate": 0.0001854287556415216,
"loss": 1.0371,
"num_input_tokens_seen": 5787328,
"step": 119,
"train_runtime": 818.7746,
"train_tokens_per_second": 7068.28
},
{
"epoch": 0.07714561234329798,
"grad_norm": 0.2009563148021698,
"learning_rate": 0.00018529980657640234,
"loss": 1.1895,
"num_input_tokens_seen": 5823296,
"step": 120,
"train_runtime": 823.7933,
"train_tokens_per_second": 7068.88
},
{
"epoch": 0.07778849244615879,
"grad_norm": 0.24800238013267517,
"learning_rate": 0.00018517085751128305,
"loss": 1.0178,
"num_input_tokens_seen": 5891968,
"step": 121,
"train_runtime": 833.7905,
"train_tokens_per_second": 7066.485
},
{
"epoch": 0.0784313725490196,
"grad_norm": 0.20752151310443878,
"learning_rate": 0.00018504190844616377,
"loss": 1.1151,
"num_input_tokens_seen": 5945280,
"step": 122,
"train_runtime": 841.1288,
"train_tokens_per_second": 7068.216
},
{
"epoch": 0.07907425265188042,
"grad_norm": 0.22319258749485016,
"learning_rate": 0.0001849129593810445,
"loss": 0.9032,
"num_input_tokens_seen": 5991152,
"step": 123,
"train_runtime": 847.4512,
"train_tokens_per_second": 7069.613
},
{
"epoch": 0.07971713275474124,
"grad_norm": 0.23252902925014496,
"learning_rate": 0.00018478401031592524,
"loss": 1.1092,
"num_input_tokens_seen": 6027488,
"step": 124,
"train_runtime": 852.5296,
"train_tokens_per_second": 7070.122
},
{
"epoch": 0.08036001285760205,
"grad_norm": 0.2191491425037384,
"learning_rate": 0.00018465506125080593,
"loss": 1.1129,
"num_input_tokens_seen": 6064384,
"step": 125,
"train_runtime": 857.6884,
"train_tokens_per_second": 7070.614
},
{
"epoch": 0.08100289296046287,
"grad_norm": 0.2259877622127533,
"learning_rate": 0.00018452611218568667,
"loss": 1.1156,
"num_input_tokens_seen": 6157600,
"step": 126,
"train_runtime": 870.549,
"train_tokens_per_second": 7073.238
},
{
"epoch": 0.08164577306332368,
"grad_norm": 0.22781765460968018,
"learning_rate": 0.0001843971631205674,
"loss": 1.1326,
"num_input_tokens_seen": 6197904,
"step": 127,
"train_runtime": 876.1256,
"train_tokens_per_second": 7074.218
},
{
"epoch": 0.0822886531661845,
"grad_norm": 0.1966547816991806,
"learning_rate": 0.0001842682140554481,
"loss": 1.0326,
"num_input_tokens_seen": 6242368,
"step": 128,
"train_runtime": 882.251,
"train_tokens_per_second": 7075.501
},
{
"epoch": 0.08293153326904533,
"grad_norm": 0.22219525277614594,
"learning_rate": 0.00018413926499032883,
"loss": 1.0803,
"num_input_tokens_seen": 6306416,
"step": 129,
"train_runtime": 891.1022,
"train_tokens_per_second": 7077.096
},
{
"epoch": 0.08357441337190614,
"grad_norm": 0.1935926377773285,
"learning_rate": 0.00018401031592520954,
"loss": 1.1262,
"num_input_tokens_seen": 6356528,
"step": 130,
"train_runtime": 897.9981,
"train_tokens_per_second": 7078.554
},
{
"epoch": 0.08421729347476696,
"grad_norm": 0.2209094762802124,
"learning_rate": 0.00018388136686009026,
"loss": 1.163,
"num_input_tokens_seen": 6422768,
"step": 131,
"train_runtime": 907.1079,
"train_tokens_per_second": 7080.49
},
{
"epoch": 0.08486017357762778,
"grad_norm": 0.223740816116333,
"learning_rate": 0.00018375241779497098,
"loss": 1.1249,
"num_input_tokens_seen": 6464640,
"step": 132,
"train_runtime": 912.8481,
"train_tokens_per_second": 7081.835
},
{
"epoch": 0.08550305368048859,
"grad_norm": 0.2206628918647766,
"learning_rate": 0.00018362346872985173,
"loss": 1.0312,
"num_input_tokens_seen": 6500848,
"step": 133,
"train_runtime": 917.9064,
"train_tokens_per_second": 7082.256
},
{
"epoch": 0.08614593378334941,
"grad_norm": 0.23904292285442352,
"learning_rate": 0.00018349451966473244,
"loss": 1.1285,
"num_input_tokens_seen": 6553072,
"step": 134,
"train_runtime": 925.0205,
"train_tokens_per_second": 7084.245
},
{
"epoch": 0.08678881388621022,
"grad_norm": 0.21213850378990173,
"learning_rate": 0.00018336557059961316,
"loss": 0.9785,
"num_input_tokens_seen": 6593648,
"step": 135,
"train_runtime": 930.6399,
"train_tokens_per_second": 7085.069
},
{
"epoch": 0.08743169398907104,
"grad_norm": 0.25068166851997375,
"learning_rate": 0.00018323662153449388,
"loss": 0.9906,
"num_input_tokens_seen": 6655792,
"step": 136,
"train_runtime": 939.2004,
"train_tokens_per_second": 7086.658
},
{
"epoch": 0.08807457409193185,
"grad_norm": 0.2144203633069992,
"learning_rate": 0.00018310767246937463,
"loss": 1.1189,
"num_input_tokens_seen": 6701456,
"step": 137,
"train_runtime": 945.4803,
"train_tokens_per_second": 7087.885
},
{
"epoch": 0.08871745419479267,
"grad_norm": 0.219550222158432,
"learning_rate": 0.00018297872340425532,
"loss": 0.969,
"num_input_tokens_seen": 6757216,
"step": 138,
"train_runtime": 953.1781,
"train_tokens_per_second": 7089.143
},
{
"epoch": 0.08936033429765348,
"grad_norm": 0.2444351464509964,
"learning_rate": 0.00018284977433913606,
"loss": 1.1312,
"num_input_tokens_seen": 6801888,
"step": 139,
"train_runtime": 959.3814,
"train_tokens_per_second": 7089.869
},
{
"epoch": 0.0900032144005143,
"grad_norm": 0.1964501291513443,
"learning_rate": 0.00018272082527401678,
"loss": 1.0268,
"num_input_tokens_seen": 6866432,
"step": 140,
"train_runtime": 968.3634,
"train_tokens_per_second": 7090.759
},
{
"epoch": 0.09064609450337512,
"grad_norm": 0.2163739949464798,
"learning_rate": 0.00018259187620889747,
"loss": 0.9358,
"num_input_tokens_seen": 6911232,
"step": 141,
"train_runtime": 974.5993,
"train_tokens_per_second": 7091.357
},
{
"epoch": 0.09128897460623593,
"grad_norm": 0.25095582008361816,
"learning_rate": 0.00018246292714377822,
"loss": 1.0278,
"num_input_tokens_seen": 6968496,
"step": 142,
"train_runtime": 982.5023,
"train_tokens_per_second": 7092.6
},
{
"epoch": 0.09193185470909675,
"grad_norm": 0.2552036941051483,
"learning_rate": 0.00018233397807865893,
"loss": 1.2132,
"num_input_tokens_seen": 7001616,
"step": 143,
"train_runtime": 987.1499,
"train_tokens_per_second": 7092.759
},
{
"epoch": 0.09257473481195758,
"grad_norm": 0.2304268479347229,
"learning_rate": 0.00018220502901353965,
"loss": 1.087,
"num_input_tokens_seen": 7039440,
"step": 144,
"train_runtime": 992.4368,
"train_tokens_per_second": 7093.086
},
{
"epoch": 0.09321761491481839,
"grad_norm": 0.24973514676094055,
"learning_rate": 0.00018207607994842037,
"loss": 1.0373,
"num_input_tokens_seen": 7090448,
"step": 145,
"train_runtime": 999.5329,
"train_tokens_per_second": 7093.761
},
{
"epoch": 0.09386049501767921,
"grad_norm": 0.24035415053367615,
"learning_rate": 0.00018194713088330112,
"loss": 0.9661,
"num_input_tokens_seen": 7132352,
"step": 146,
"train_runtime": 1005.376,
"train_tokens_per_second": 7094.213
},
{
"epoch": 0.09450337512054002,
"grad_norm": 0.2570725977420807,
"learning_rate": 0.00018181818181818183,
"loss": 1.0897,
"num_input_tokens_seen": 7178112,
"step": 147,
"train_runtime": 1011.7434,
"train_tokens_per_second": 7094.795
},
{
"epoch": 0.09514625522340084,
"grad_norm": 0.2333613485097885,
"learning_rate": 0.00018168923275306255,
"loss": 1.1247,
"num_input_tokens_seen": 7213856,
"step": 148,
"train_runtime": 1016.7771,
"train_tokens_per_second": 7094.825
},
{
"epoch": 0.09578913532626165,
"grad_norm": 0.2136976569890976,
"learning_rate": 0.00018156028368794327,
"loss": 1.0022,
"num_input_tokens_seen": 7257296,
"step": 149,
"train_runtime": 1022.8844,
"train_tokens_per_second": 7094.933
},
{
"epoch": 0.09643201542912247,
"grad_norm": 0.23702369630336761,
"learning_rate": 0.000181431334622824,
"loss": 1.2264,
"num_input_tokens_seen": 7302064,
"step": 150,
"train_runtime": 1029.1706,
"train_tokens_per_second": 7095.096
},
{
"epoch": 0.09707489553198329,
"grad_norm": 0.2674248218536377,
"learning_rate": 0.0001813023855577047,
"loss": 1.0873,
"num_input_tokens_seen": 7351824,
"step": 151,
"train_runtime": 1036.6946,
"train_tokens_per_second": 7091.601
},
{
"epoch": 0.0977177756348441,
"grad_norm": 0.21677564084529877,
"learning_rate": 0.00018117343649258545,
"loss": 1.087,
"num_input_tokens_seen": 7413824,
"step": 152,
"train_runtime": 1045.3339,
"train_tokens_per_second": 7092.302
},
{
"epoch": 0.09836065573770492,
"grad_norm": 0.2248373031616211,
"learning_rate": 0.00018104448742746617,
"loss": 1.0474,
"num_input_tokens_seen": 7454160,
"step": 153,
"train_runtime": 1050.9856,
"train_tokens_per_second": 7092.542
},
{
"epoch": 0.09900353584056573,
"grad_norm": 0.22680656611919403,
"learning_rate": 0.0001809155383623469,
"loss": 1.087,
"num_input_tokens_seen": 7493616,
"step": 154,
"train_runtime": 1056.5707,
"train_tokens_per_second": 7092.394
},
{
"epoch": 0.09964641594342655,
"grad_norm": 0.19268976151943207,
"learning_rate": 0.0001807865892972276,
"loss": 0.8812,
"num_input_tokens_seen": 7538000,
"step": 155,
"train_runtime": 1062.8564,
"train_tokens_per_second": 7092.21
},
{
"epoch": 0.10028929604628736,
"grad_norm": 0.22635945677757263,
"learning_rate": 0.00018065764023210832,
"loss": 1.0733,
"num_input_tokens_seen": 7581424,
"step": 156,
"train_runtime": 1068.9436,
"train_tokens_per_second": 7092.445
},
{
"epoch": 0.10028929604628736,
"eval_loss": 1.0724854469299316,
"eval_runtime": 39.9606,
"eval_samples_per_second": 24.875,
"eval_steps_per_second": 1.577,
"num_input_tokens_seen": 7581424,
"step": 156
},
{
"epoch": 0.10093217614914818,
"grad_norm": 0.1949465125799179,
"learning_rate": 0.00018052869116698904,
"loss": 1.0841,
"num_input_tokens_seen": 7627072,
"step": 157,
"train_runtime": 1115.3292,
"train_tokens_per_second": 6838.404
},
{
"epoch": 0.101575056252009,
"grad_norm": 0.22935912013053894,
"learning_rate": 0.00018039974210186976,
"loss": 1.0461,
"num_input_tokens_seen": 7661936,
"step": 158,
"train_runtime": 1120.2715,
"train_tokens_per_second": 6839.357
},
{
"epoch": 0.10221793635486982,
"grad_norm": 0.1948421150445938,
"learning_rate": 0.0001802707930367505,
"loss": 1.1345,
"num_input_tokens_seen": 7713968,
"step": 159,
"train_runtime": 1127.5172,
"train_tokens_per_second": 6841.552
},
{
"epoch": 0.10286081645773064,
"grad_norm": 0.212183877825737,
"learning_rate": 0.0001801418439716312,
"loss": 1.0388,
"num_input_tokens_seen": 7752976,
"step": 160,
"train_runtime": 1132.9323,
"train_tokens_per_second": 6843.283
},
{
"epoch": 0.10350369656059145,
"grad_norm": 0.21781344711780548,
"learning_rate": 0.00018001289490651194,
"loss": 1.0323,
"num_input_tokens_seen": 7791104,
"step": 161,
"train_runtime": 1138.279,
"train_tokens_per_second": 6844.635
},
{
"epoch": 0.10414657666345227,
"grad_norm": 0.24289098381996155,
"learning_rate": 0.00017988394584139266,
"loss": 0.9597,
"num_input_tokens_seen": 7843168,
"step": 162,
"train_runtime": 1145.4597,
"train_tokens_per_second": 6847.179
},
{
"epoch": 0.10478945676631309,
"grad_norm": 0.22889725863933563,
"learning_rate": 0.00017975499677627338,
"loss": 1.0462,
"num_input_tokens_seen": 7888016,
"step": 163,
"train_runtime": 1151.7079,
"train_tokens_per_second": 6848.973
},
{
"epoch": 0.1054323368691739,
"grad_norm": 0.2221020758152008,
"learning_rate": 0.0001796260477111541,
"loss": 1.0538,
"num_input_tokens_seen": 7942304,
"step": 164,
"train_runtime": 1159.2432,
"train_tokens_per_second": 6851.284
},
{
"epoch": 0.10607521697203472,
"grad_norm": 0.19479186832904816,
"learning_rate": 0.00017949709864603484,
"loss": 0.9074,
"num_input_tokens_seen": 7980496,
"step": 165,
"train_runtime": 1164.6073,
"train_tokens_per_second": 6852.521
},
{
"epoch": 0.10671809707489553,
"grad_norm": 0.2103356570005417,
"learning_rate": 0.00017936814958091553,
"loss": 0.9725,
"num_input_tokens_seen": 8031264,
"step": 166,
"train_runtime": 1171.6399,
"train_tokens_per_second": 6854.721
},
{
"epoch": 0.10736097717775635,
"grad_norm": 0.2254662811756134,
"learning_rate": 0.00017923920051579628,
"loss": 1.018,
"num_input_tokens_seen": 8074720,
"step": 167,
"train_runtime": 1177.7123,
"train_tokens_per_second": 6856.276
},
{
"epoch": 0.10800385728061716,
"grad_norm": 0.23099878430366516,
"learning_rate": 0.000179110251450677,
"loss": 0.9887,
"num_input_tokens_seen": 8117776,
"step": 168,
"train_runtime": 1183.679,
"train_tokens_per_second": 6858.089
},
{
"epoch": 0.10864673738347798,
"grad_norm": 0.22438518702983856,
"learning_rate": 0.00017898130238555771,
"loss": 1.0775,
"num_input_tokens_seen": 8183888,
"step": 169,
"train_runtime": 1192.8273,
"train_tokens_per_second": 6860.916
},
{
"epoch": 0.1092896174863388,
"grad_norm": 0.2522250711917877,
"learning_rate": 0.00017885235332043843,
"loss": 1.1234,
"num_input_tokens_seen": 8243600,
"step": 170,
"train_runtime": 1201.0972,
"train_tokens_per_second": 6863.391
},
{
"epoch": 0.10993249758919961,
"grad_norm": 0.23084506392478943,
"learning_rate": 0.00017872340425531915,
"loss": 1.1419,
"num_input_tokens_seen": 8315104,
"step": 171,
"train_runtime": 1211.0141,
"train_tokens_per_second": 6866.232
},
{
"epoch": 0.11057537769206043,
"grad_norm": 0.21146203577518463,
"learning_rate": 0.0001785944551901999,
"loss": 0.9589,
"num_input_tokens_seen": 8361632,
"step": 172,
"train_runtime": 1217.4549,
"train_tokens_per_second": 6868.125
},
{
"epoch": 0.11121825779492124,
"grad_norm": 0.2073734998703003,
"learning_rate": 0.0001784655061250806,
"loss": 1.0018,
"num_input_tokens_seen": 8398272,
"step": 173,
"train_runtime": 1222.5503,
"train_tokens_per_second": 6869.47
},
{
"epoch": 0.11186113789778207,
"grad_norm": 0.23064003884792328,
"learning_rate": 0.00017833655705996133,
"loss": 1.0175,
"num_input_tokens_seen": 8436592,
"step": 174,
"train_runtime": 1227.8678,
"train_tokens_per_second": 6870.928
},
{
"epoch": 0.11250401800064289,
"grad_norm": 0.2068207710981369,
"learning_rate": 0.00017820760799484205,
"loss": 0.9224,
"num_input_tokens_seen": 8486672,
"step": 175,
"train_runtime": 1234.8255,
"train_tokens_per_second": 6872.77
},
{
"epoch": 0.1131468981035037,
"grad_norm": 0.21776925027370453,
"learning_rate": 0.00017807865892972277,
"loss": 1.0478,
"num_input_tokens_seen": 8573280,
"step": 176,
"train_runtime": 1246.8789,
"train_tokens_per_second": 6875.792
},
{
"epoch": 0.11378977820636452,
"grad_norm": 0.2205696552991867,
"learning_rate": 0.00017794970986460349,
"loss": 0.993,
"num_input_tokens_seen": 8631824,
"step": 177,
"train_runtime": 1255.0271,
"train_tokens_per_second": 6877.799
},
{
"epoch": 0.11443265830922533,
"grad_norm": 0.22359175980091095,
"learning_rate": 0.00017782076079948423,
"loss": 1.0263,
"num_input_tokens_seen": 8669328,
"step": 178,
"train_runtime": 1260.2564,
"train_tokens_per_second": 6879.019
},
{
"epoch": 0.11507553841208615,
"grad_norm": 0.21172000467777252,
"learning_rate": 0.00017769181173436492,
"loss": 0.916,
"num_input_tokens_seen": 8708768,
"step": 179,
"train_runtime": 1265.7239,
"train_tokens_per_second": 6880.464
},
{
"epoch": 0.11571841851494696,
"grad_norm": 0.2595050036907196,
"learning_rate": 0.00017756286266924567,
"loss": 1.174,
"num_input_tokens_seen": 8761984,
"step": 180,
"train_runtime": 1273.0455,
"train_tokens_per_second": 6882.695
},
{
"epoch": 0.11636129861780778,
"grad_norm": 0.21484827995300293,
"learning_rate": 0.00017743391360412639,
"loss": 1.0035,
"num_input_tokens_seen": 8804384,
"step": 181,
"train_runtime": 1279.4701,
"train_tokens_per_second": 6881.274
},
{
"epoch": 0.1170041787206686,
"grad_norm": 0.21428106725215912,
"learning_rate": 0.00017730496453900708,
"loss": 0.8851,
"num_input_tokens_seen": 8861280,
"step": 182,
"train_runtime": 1287.2763,
"train_tokens_per_second": 6883.743
},
{
"epoch": 0.11764705882352941,
"grad_norm": 0.20558470487594604,
"learning_rate": 0.00017717601547388782,
"loss": 1.0338,
"num_input_tokens_seen": 8918064,
"step": 183,
"train_runtime": 1295.0934,
"train_tokens_per_second": 6886.039
},
{
"epoch": 0.11828993892639023,
"grad_norm": 0.21777905523777008,
"learning_rate": 0.00017704706640876854,
"loss": 0.9756,
"num_input_tokens_seen": 8960192,
"step": 184,
"train_runtime": 1300.9164,
"train_tokens_per_second": 6887.6
},
{
"epoch": 0.11893281902925104,
"grad_norm": 0.21575364470481873,
"learning_rate": 0.00017691811734364926,
"loss": 1.0877,
"num_input_tokens_seen": 8998128,
"step": 185,
"train_runtime": 1306.1898,
"train_tokens_per_second": 6888.837
},
{
"epoch": 0.11957569913211186,
"grad_norm": 0.2269899994134903,
"learning_rate": 0.00017678916827852998,
"loss": 1.0258,
"num_input_tokens_seen": 9055952,
"step": 186,
"train_runtime": 1314.1654,
"train_tokens_per_second": 6891.029
},
{
"epoch": 0.12021857923497267,
"grad_norm": 0.24424798786640167,
"learning_rate": 0.00017666021921341072,
"loss": 1.0449,
"num_input_tokens_seen": 9116272,
"step": 187,
"train_runtime": 1322.4634,
"train_tokens_per_second": 6893.402
},
{
"epoch": 0.12086145933783349,
"grad_norm": 0.22270651161670685,
"learning_rate": 0.00017653127014829144,
"loss": 1.0173,
"num_input_tokens_seen": 9164416,
"step": 188,
"train_runtime": 1329.1451,
"train_tokens_per_second": 6894.97
},
{
"epoch": 0.12150433944069432,
"grad_norm": 0.2047732174396515,
"learning_rate": 0.00017640232108317216,
"loss": 0.9592,
"num_input_tokens_seen": 9195696,
"step": 189,
"train_runtime": 1333.5875,
"train_tokens_per_second": 6895.457
},
{
"epoch": 0.12214721954355513,
"grad_norm": 0.24051836133003235,
"learning_rate": 0.00017627337201805288,
"loss": 1.0174,
"num_input_tokens_seen": 9251120,
"step": 190,
"train_runtime": 1341.2546,
"train_tokens_per_second": 6897.363
},
{
"epoch": 0.12279009964641595,
"grad_norm": 0.23167778551578522,
"learning_rate": 0.0001761444229529336,
"loss": 1.145,
"num_input_tokens_seen": 9311872,
"step": 191,
"train_runtime": 1349.7292,
"train_tokens_per_second": 6899.067
},
{
"epoch": 0.12343297974927676,
"grad_norm": 0.22334854304790497,
"learning_rate": 0.0001760154738878143,
"loss": 1.0342,
"num_input_tokens_seen": 9344960,
"step": 192,
"train_runtime": 1354.3406,
"train_tokens_per_second": 6900.007
},
{
"epoch": 0.12407585985213758,
"grad_norm": 0.21167592704296112,
"learning_rate": 0.00017588652482269506,
"loss": 1.0305,
"num_input_tokens_seen": 9406096,
"step": 193,
"train_runtime": 1362.8133,
"train_tokens_per_second": 6901.969
},
{
"epoch": 0.1247187399549984,
"grad_norm": 0.2151985913515091,
"learning_rate": 0.00017575757575757578,
"loss": 1.0412,
"num_input_tokens_seen": 9475040,
"step": 194,
"train_runtime": 1372.3769,
"train_tokens_per_second": 6904.109
},
{
"epoch": 0.1253616200578592,
"grad_norm": 0.22665420174598694,
"learning_rate": 0.00017562862669245647,
"loss": 1.1126,
"num_input_tokens_seen": 9530432,
"step": 195,
"train_runtime": 1380.1019,
"train_tokens_per_second": 6905.6
},
{
"epoch": 0.12600450016072,
"grad_norm": 0.2426138073205948,
"learning_rate": 0.0001754996776273372,
"loss": 1.0301,
"num_input_tokens_seen": 9595536,
"step": 196,
"train_runtime": 1389.1031,
"train_tokens_per_second": 6907.721
},
{
"epoch": 0.12664738026358086,
"grad_norm": 0.28386926651000977,
"learning_rate": 0.00017537072856221793,
"loss": 0.9756,
"num_input_tokens_seen": 9633680,
"step": 197,
"train_runtime": 1394.4152,
"train_tokens_per_second": 6908.76
},
{
"epoch": 0.12729026036644167,
"grad_norm": 0.21381893754005432,
"learning_rate": 0.00017524177949709865,
"loss": 1.0494,
"num_input_tokens_seen": 9704480,
"step": 198,
"train_runtime": 1404.1835,
"train_tokens_per_second": 6911.119
},
{
"epoch": 0.1279331404693025,
"grad_norm": 0.23659008741378784,
"learning_rate": 0.00017511283043197937,
"loss": 1.0873,
"num_input_tokens_seen": 9762144,
"step": 199,
"train_runtime": 1412.2135,
"train_tokens_per_second": 6912.654
},
{
"epoch": 0.1285760205721633,
"grad_norm": 0.25226446986198425,
"learning_rate": 0.0001749838813668601,
"loss": 1.0107,
"num_input_tokens_seen": 9803008,
"step": 200,
"train_runtime": 1417.8691,
"train_tokens_per_second": 6913.902
},
{
"epoch": 0.12921890067502412,
"grad_norm": 0.2516157925128937,
"learning_rate": 0.0001748549323017408,
"loss": 1.0264,
"num_input_tokens_seen": 9844768,
"step": 201,
"train_runtime": 1423.6304,
"train_tokens_per_second": 6915.255
},
{
"epoch": 0.12986178077788493,
"grad_norm": 0.24535000324249268,
"learning_rate": 0.00017472598323662155,
"loss": 1.0769,
"num_input_tokens_seen": 9926304,
"step": 202,
"train_runtime": 1434.9118,
"train_tokens_per_second": 6917.71
},
{
"epoch": 0.13050466088074575,
"grad_norm": 0.22521895170211792,
"learning_rate": 0.00017459703417150227,
"loss": 0.9298,
"num_input_tokens_seen": 9964880,
"step": 203,
"train_runtime": 1440.226,
"train_tokens_per_second": 6918.97
},
{
"epoch": 0.13114754098360656,
"grad_norm": 0.22114278376102448,
"learning_rate": 0.00017446808510638298,
"loss": 1.0312,
"num_input_tokens_seen": 10016000,
"step": 204,
"train_runtime": 1447.364,
"train_tokens_per_second": 6920.166
},
{
"epoch": 0.13179042108646738,
"grad_norm": 0.25172755122184753,
"learning_rate": 0.0001743391360412637,
"loss": 0.9959,
"num_input_tokens_seen": 10066848,
"step": 205,
"train_runtime": 1454.362,
"train_tokens_per_second": 6921.831
},
{
"epoch": 0.1324333011893282,
"grad_norm": 0.21752239763736725,
"learning_rate": 0.00017421018697614445,
"loss": 1.0253,
"num_input_tokens_seen": 10121968,
"step": 206,
"train_runtime": 1461.9531,
"train_tokens_per_second": 6923.593
},
{
"epoch": 0.133076181292189,
"grad_norm": 0.2266158163547516,
"learning_rate": 0.00017408123791102517,
"loss": 1.0936,
"num_input_tokens_seen": 10168336,
"step": 207,
"train_runtime": 1468.3641,
"train_tokens_per_second": 6924.942
},
{
"epoch": 0.13371906139504983,
"grad_norm": 0.25873246788978577,
"learning_rate": 0.00017395228884590588,
"loss": 1.038,
"num_input_tokens_seen": 10203984,
"step": 208,
"train_runtime": 1473.3039,
"train_tokens_per_second": 6925.919
},
{
"epoch": 0.13436194149791064,
"grad_norm": 0.21677619218826294,
"learning_rate": 0.0001738233397807866,
"loss": 1.0556,
"num_input_tokens_seen": 10246608,
"step": 209,
"train_runtime": 1479.2216,
"train_tokens_per_second": 6927.027
},
{
"epoch": 0.13500482160077146,
"grad_norm": 0.22836393117904663,
"learning_rate": 0.00017369439071566732,
"loss": 0.9201,
"num_input_tokens_seen": 10277088,
"step": 210,
"train_runtime": 1483.493,
"train_tokens_per_second": 6927.628
},
{
"epoch": 0.13564770170363227,
"grad_norm": 0.24446630477905273,
"learning_rate": 0.00017356544165054804,
"loss": 0.9526,
"num_input_tokens_seen": 10320416,
"step": 211,
"train_runtime": 1489.9864,
"train_tokens_per_second": 6926.517
},
{
"epoch": 0.1362905818064931,
"grad_norm": 0.2546757757663727,
"learning_rate": 0.00017343649258542876,
"loss": 1.109,
"num_input_tokens_seen": 10357904,
"step": 212,
"train_runtime": 1495.1661,
"train_tokens_per_second": 6927.594
},
{
"epoch": 0.1369334619093539,
"grad_norm": 0.20647278428077698,
"learning_rate": 0.0001733075435203095,
"loss": 1.0048,
"num_input_tokens_seen": 10414032,
"step": 213,
"train_runtime": 1502.9339,
"train_tokens_per_second": 6929.135
},
{
"epoch": 0.13757634201221472,
"grad_norm": 0.21804779767990112,
"learning_rate": 0.0001731785944551902,
"loss": 0.8408,
"num_input_tokens_seen": 10461408,
"step": 214,
"train_runtime": 1509.429,
"train_tokens_per_second": 6930.706
},
{
"epoch": 0.13821922211507554,
"grad_norm": 0.20865757763385773,
"learning_rate": 0.00017304964539007094,
"loss": 1.0862,
"num_input_tokens_seen": 10504464,
"step": 215,
"train_runtime": 1515.3812,
"train_tokens_per_second": 6931.895
},
{
"epoch": 0.13886210221793635,
"grad_norm": 0.3014566898345947,
"learning_rate": 0.00017292069632495166,
"loss": 1.0654,
"num_input_tokens_seen": 10569680,
"step": 216,
"train_runtime": 1524.3124,
"train_tokens_per_second": 6934.064
},
{
"epoch": 0.13950498232079717,
"grad_norm": 0.2809727191925049,
"learning_rate": 0.00017279174725983237,
"loss": 1.0455,
"num_input_tokens_seen": 10619856,
"step": 217,
"train_runtime": 1531.2676,
"train_tokens_per_second": 6935.336
},
{
"epoch": 0.14014786242365798,
"grad_norm": 0.22862663865089417,
"learning_rate": 0.0001726627981947131,
"loss": 0.9765,
"num_input_tokens_seen": 10677552,
"step": 218,
"train_runtime": 1539.2513,
"train_tokens_per_second": 6936.848
},
{
"epoch": 0.1407907425265188,
"grad_norm": 0.21180987358093262,
"learning_rate": 0.00017253384912959384,
"loss": 0.9582,
"num_input_tokens_seen": 10729824,
"step": 219,
"train_runtime": 1546.5127,
"train_tokens_per_second": 6938.077
},
{
"epoch": 0.1414336226293796,
"grad_norm": 0.2360568344593048,
"learning_rate": 0.00017240490006447453,
"loss": 1.0123,
"num_input_tokens_seen": 10786064,
"step": 220,
"train_runtime": 1554.3812,
"train_tokens_per_second": 6939.137
},
{
"epoch": 0.14207650273224043,
"grad_norm": 0.2420787811279297,
"learning_rate": 0.00017227595099935527,
"loss": 1.0137,
"num_input_tokens_seen": 10816624,
"step": 221,
"train_runtime": 1558.7253,
"train_tokens_per_second": 6939.404
},
{
"epoch": 0.14271938283510124,
"grad_norm": 0.21091967821121216,
"learning_rate": 0.000172147001934236,
"loss": 1.0136,
"num_input_tokens_seen": 10863712,
"step": 222,
"train_runtime": 1565.3264,
"train_tokens_per_second": 6940.222
},
{
"epoch": 0.14336226293796206,
"grad_norm": 0.2029949128627777,
"learning_rate": 0.0001720180528691167,
"loss": 0.9917,
"num_input_tokens_seen": 10921872,
"step": 223,
"train_runtime": 1573.4217,
"train_tokens_per_second": 6941.478
},
{
"epoch": 0.14400514304082287,
"grad_norm": 0.23956239223480225,
"learning_rate": 0.00017188910380399743,
"loss": 0.9445,
"num_input_tokens_seen": 10966448,
"step": 224,
"train_runtime": 1579.6133,
"train_tokens_per_second": 6942.489
},
{
"epoch": 0.1446480231436837,
"grad_norm": 0.21189863979816437,
"learning_rate": 0.00017176015473887815,
"loss": 1.0501,
"num_input_tokens_seen": 11014368,
"step": 225,
"train_runtime": 1586.2995,
"train_tokens_per_second": 6943.435
},
{
"epoch": 0.1452909032465445,
"grad_norm": 0.22365020215511322,
"learning_rate": 0.00017163120567375886,
"loss": 1.0064,
"num_input_tokens_seen": 11062784,
"step": 226,
"train_runtime": 1593.0071,
"train_tokens_per_second": 6944.592
},
{
"epoch": 0.14593378334940535,
"grad_norm": 0.22429963946342468,
"learning_rate": 0.00017150225660863958,
"loss": 1.0248,
"num_input_tokens_seen": 11103616,
"step": 227,
"train_runtime": 1598.7121,
"train_tokens_per_second": 6945.351
},
{
"epoch": 0.14657666345226616,
"grad_norm": 0.20400308072566986,
"learning_rate": 0.00017137330754352033,
"loss": 0.963,
"num_input_tokens_seen": 11138032,
"step": 228,
"train_runtime": 1603.5508,
"train_tokens_per_second": 6945.855
},
{
"epoch": 0.14721954355512698,
"grad_norm": 0.22514568269252777,
"learning_rate": 0.00017124435847840105,
"loss": 0.9966,
"num_input_tokens_seen": 11178224,
"step": 229,
"train_runtime": 1609.1071,
"train_tokens_per_second": 6946.849
},
{
"epoch": 0.1478624236579878,
"grad_norm": 0.21329401433467865,
"learning_rate": 0.00017111540941328176,
"loss": 0.9087,
"num_input_tokens_seen": 11219712,
"step": 230,
"train_runtime": 1614.89,
"train_tokens_per_second": 6947.663
},
{
"epoch": 0.1485053037608486,
"grad_norm": 0.23918579518795013,
"learning_rate": 0.00017098646034816248,
"loss": 0.9757,
"num_input_tokens_seen": 11269872,
"step": 231,
"train_runtime": 1621.7982,
"train_tokens_per_second": 6948.998
},
{
"epoch": 0.14914818386370943,
"grad_norm": 0.2166871875524521,
"learning_rate": 0.00017085751128304323,
"loss": 1.1711,
"num_input_tokens_seen": 11319904,
"step": 232,
"train_runtime": 1628.7208,
"train_tokens_per_second": 6950.181
},
{
"epoch": 0.14979106396657024,
"grad_norm": 0.25991290807724,
"learning_rate": 0.00017072856221792392,
"loss": 0.9433,
"num_input_tokens_seen": 11354720,
"step": 233,
"train_runtime": 1633.5841,
"train_tokens_per_second": 6950.802
},
{
"epoch": 0.15043394406943106,
"grad_norm": 0.23324406147003174,
"learning_rate": 0.00017059961315280466,
"loss": 1.0064,
"num_input_tokens_seen": 11405392,
"step": 234,
"train_runtime": 1640.5727,
"train_tokens_per_second": 6952.079
},
{
"epoch": 0.15107682417229187,
"grad_norm": 0.2757960557937622,
"learning_rate": 0.00017047066408768538,
"loss": 1.0475,
"num_input_tokens_seen": 11468880,
"step": 235,
"train_runtime": 1649.396,
"train_tokens_per_second": 6953.382
},
{
"epoch": 0.1517197042751527,
"grad_norm": 0.19429758191108704,
"learning_rate": 0.00017034171502256607,
"loss": 0.8813,
"num_input_tokens_seen": 11504256,
"step": 236,
"train_runtime": 1654.3414,
"train_tokens_per_second": 6953.979
},
{
"epoch": 0.1523625843780135,
"grad_norm": 0.21211576461791992,
"learning_rate": 0.00017021276595744682,
"loss": 1.0322,
"num_input_tokens_seen": 11561280,
"step": 237,
"train_runtime": 1662.2186,
"train_tokens_per_second": 6955.33
},
{
"epoch": 0.15300546448087432,
"grad_norm": 0.22346429526805878,
"learning_rate": 0.00017008381689232754,
"loss": 1.0374,
"num_input_tokens_seen": 11595856,
"step": 238,
"train_runtime": 1667.077,
"train_tokens_per_second": 6955.801
},
{
"epoch": 0.15364834458373514,
"grad_norm": 0.2228838950395584,
"learning_rate": 0.00016995486782720825,
"loss": 1.0827,
"num_input_tokens_seen": 11657568,
"step": 239,
"train_runtime": 1675.586,
"train_tokens_per_second": 6957.308
},
{
"epoch": 0.15429122468659595,
"grad_norm": 0.2152034342288971,
"learning_rate": 0.00016982591876208897,
"loss": 0.9675,
"num_input_tokens_seen": 11706000,
"step": 240,
"train_runtime": 1682.2153,
"train_tokens_per_second": 6958.681
},
{
"epoch": 0.15493410478945677,
"grad_norm": 0.2260894626379013,
"learning_rate": 0.00016969696969696972,
"loss": 1.0304,
"num_input_tokens_seen": 11741536,
"step": 241,
"train_runtime": 1687.6844,
"train_tokens_per_second": 6957.187
},
{
"epoch": 0.15557698489231758,
"grad_norm": 0.23029419779777527,
"learning_rate": 0.0001695680206318504,
"loss": 0.9199,
"num_input_tokens_seen": 11781760,
"step": 242,
"train_runtime": 1693.2406,
"train_tokens_per_second": 6958.113
},
{
"epoch": 0.1562198649951784,
"grad_norm": 0.22995297610759735,
"learning_rate": 0.00016943907156673115,
"loss": 1.0472,
"num_input_tokens_seen": 11817488,
"step": 243,
"train_runtime": 1698.2011,
"train_tokens_per_second": 6958.827
},
{
"epoch": 0.1568627450980392,
"grad_norm": 0.22286485135555267,
"learning_rate": 0.00016931012250161187,
"loss": 1.0351,
"num_input_tokens_seen": 11871216,
"step": 244,
"train_runtime": 1705.5842,
"train_tokens_per_second": 6960.205
},
{
"epoch": 0.15750562520090003,
"grad_norm": 0.22770291566848755,
"learning_rate": 0.0001691811734364926,
"loss": 1.0394,
"num_input_tokens_seen": 11923056,
"step": 245,
"train_runtime": 1712.7388,
"train_tokens_per_second": 6961.398
},
{
"epoch": 0.15814850530376084,
"grad_norm": 0.22315266728401184,
"learning_rate": 0.0001690522243713733,
"loss": 1.1564,
"num_input_tokens_seen": 11965232,
"step": 246,
"train_runtime": 1718.5507,
"train_tokens_per_second": 6962.397
},
{
"epoch": 0.15879138540662166,
"grad_norm": 0.15868711471557617,
"learning_rate": 0.00016892327530625405,
"loss": 0.6357,
"num_input_tokens_seen": 12029632,
"step": 247,
"train_runtime": 1727.516,
"train_tokens_per_second": 6963.543
},
{
"epoch": 0.15943426550948248,
"grad_norm": 0.25372278690338135,
"learning_rate": 0.00016879432624113477,
"loss": 1.0601,
"num_input_tokens_seen": 12072080,
"step": 248,
"train_runtime": 1733.3318,
"train_tokens_per_second": 6964.668
},
{
"epoch": 0.1600771456123433,
"grad_norm": 0.22227583825588226,
"learning_rate": 0.00016866537717601546,
"loss": 1.0248,
"num_input_tokens_seen": 12108464,
"step": 249,
"train_runtime": 1738.3796,
"train_tokens_per_second": 6965.374
},
{
"epoch": 0.1607200257152041,
"grad_norm": 0.2230069488286972,
"learning_rate": 0.0001685364281108962,
"loss": 0.9572,
"num_input_tokens_seen": 12160512,
"step": 250,
"train_runtime": 1745.61,
"train_tokens_per_second": 6966.339
},
{
"epoch": 0.16136290581806492,
"grad_norm": 0.23262253403663635,
"learning_rate": 0.00016840747904577693,
"loss": 1.1385,
"num_input_tokens_seen": 12203120,
"step": 251,
"train_runtime": 1751.4966,
"train_tokens_per_second": 6967.253
},
{
"epoch": 0.16200578592092574,
"grad_norm": 0.23355282843112946,
"learning_rate": 0.00016827852998065764,
"loss": 0.9223,
"num_input_tokens_seen": 12264608,
"step": 252,
"train_runtime": 1760.0334,
"train_tokens_per_second": 6968.395
},
{
"epoch": 0.16264866602378655,
"grad_norm": 0.2217501848936081,
"learning_rate": 0.00016814958091553836,
"loss": 1.0235,
"num_input_tokens_seen": 12327648,
"step": 253,
"train_runtime": 1768.8714,
"train_tokens_per_second": 6969.217
},
{
"epoch": 0.16329154612664737,
"grad_norm": 0.222650945186615,
"learning_rate": 0.0001680206318504191,
"loss": 0.9988,
"num_input_tokens_seen": 12388624,
"step": 254,
"train_runtime": 1777.4265,
"train_tokens_per_second": 6969.978
},
{
"epoch": 0.16393442622950818,
"grad_norm": 0.22060762345790863,
"learning_rate": 0.0001678916827852998,
"loss": 1.0221,
"num_input_tokens_seen": 12465440,
"step": 255,
"train_runtime": 1788.246,
"train_tokens_per_second": 6970.763
},
{
"epoch": 0.164577306332369,
"grad_norm": 0.21604016423225403,
"learning_rate": 0.00016776273372018054,
"loss": 0.9783,
"num_input_tokens_seen": 12517344,
"step": 256,
"train_runtime": 1795.5256,
"train_tokens_per_second": 6971.409
},
{
"epoch": 0.16522018643522984,
"grad_norm": 0.2075498253107071,
"learning_rate": 0.00016763378465506126,
"loss": 1.0503,
"num_input_tokens_seen": 12565440,
"step": 257,
"train_runtime": 1802.277,
"train_tokens_per_second": 6971.981
},
{
"epoch": 0.16586306653809066,
"grad_norm": 0.2417847365140915,
"learning_rate": 0.00016750483558994198,
"loss": 1.0369,
"num_input_tokens_seen": 12611408,
"step": 258,
"train_runtime": 1808.6976,
"train_tokens_per_second": 6972.646
},
{
"epoch": 0.16650594664095147,
"grad_norm": 0.2209647297859192,
"learning_rate": 0.0001673758865248227,
"loss": 1.0149,
"num_input_tokens_seen": 12650032,
"step": 259,
"train_runtime": 1814.1769,
"train_tokens_per_second": 6972.877
},
{
"epoch": 0.1671488267438123,
"grad_norm": 0.2291407436132431,
"learning_rate": 0.00016724693745970344,
"loss": 1.1034,
"num_input_tokens_seen": 12712656,
"step": 260,
"train_runtime": 1823.0164,
"train_tokens_per_second": 6973.418
},
{
"epoch": 0.1677917068466731,
"grad_norm": 0.21010412275791168,
"learning_rate": 0.00016711798839458413,
"loss": 1.0496,
"num_input_tokens_seen": 12750384,
"step": 261,
"train_runtime": 1828.4006,
"train_tokens_per_second": 6973.518
},
{
"epoch": 0.16843458694953392,
"grad_norm": 0.2299986481666565,
"learning_rate": 0.00016698903932946488,
"loss": 1.053,
"num_input_tokens_seen": 12788976,
"step": 262,
"train_runtime": 1833.8738,
"train_tokens_per_second": 6973.749
},
{
"epoch": 0.16907746705239474,
"grad_norm": 0.21923059225082397,
"learning_rate": 0.0001668600902643456,
"loss": 1.0072,
"num_input_tokens_seen": 12836720,
"step": 263,
"train_runtime": 1840.6434,
"train_tokens_per_second": 6974.039
},
{
"epoch": 0.16972034715525555,
"grad_norm": 0.2251053899526596,
"learning_rate": 0.00016673114119922632,
"loss": 0.9474,
"num_input_tokens_seen": 12893312,
"step": 264,
"train_runtime": 1848.5649,
"train_tokens_per_second": 6974.768
},
{
"epoch": 0.17036322725811637,
"grad_norm": 0.2260395586490631,
"learning_rate": 0.00016660219213410703,
"loss": 0.9149,
"num_input_tokens_seen": 12926224,
"step": 265,
"train_runtime": 1853.2179,
"train_tokens_per_second": 6975.016
},
{
"epoch": 0.17100610736097718,
"grad_norm": 0.21920432150363922,
"learning_rate": 0.00016647324306898775,
"loss": 0.9037,
"num_input_tokens_seen": 12966480,
"step": 266,
"train_runtime": 1858.9134,
"train_tokens_per_second": 6975.301
},
{
"epoch": 0.171648987463838,
"grad_norm": 0.20153847336769104,
"learning_rate": 0.0001663442940038685,
"loss": 0.9807,
"num_input_tokens_seen": 13004816,
"step": 267,
"train_runtime": 1864.2918,
"train_tokens_per_second": 6975.741
},
{
"epoch": 0.17229186756669881,
"grad_norm": 0.2206585705280304,
"learning_rate": 0.0001662153449387492,
"loss": 0.8857,
"num_input_tokens_seen": 13045632,
"step": 268,
"train_runtime": 1869.9874,
"train_tokens_per_second": 6976.321
},
{
"epoch": 0.17293474766955963,
"grad_norm": 0.21724189817905426,
"learning_rate": 0.00016608639587362993,
"loss": 1.0563,
"num_input_tokens_seen": 13085504,
"step": 269,
"train_runtime": 1875.625,
"train_tokens_per_second": 6976.61
},
{
"epoch": 0.17357762777242045,
"grad_norm": 0.22223103046417236,
"learning_rate": 0.00016595744680851065,
"loss": 1.0327,
"num_input_tokens_seen": 13128048,
"step": 270,
"train_runtime": 1881.5955,
"train_tokens_per_second": 6977.083
},
{
"epoch": 0.17422050787528126,
"grad_norm": 0.2211606651544571,
"learning_rate": 0.00016582849774339137,
"loss": 0.9248,
"num_input_tokens_seen": 13179008,
"step": 271,
"train_runtime": 1889.3405,
"train_tokens_per_second": 6975.454
},
{
"epoch": 0.17486338797814208,
"grad_norm": 0.223886638879776,
"learning_rate": 0.0001656995486782721,
"loss": 1.0344,
"num_input_tokens_seen": 13219472,
"step": 272,
"train_runtime": 1895.0504,
"train_tokens_per_second": 6975.789
},
{
"epoch": 0.1755062680810029,
"grad_norm": 0.22049862146377563,
"learning_rate": 0.00016557059961315283,
"loss": 1.0321,
"num_input_tokens_seen": 13266560,
"step": 273,
"train_runtime": 1901.6853,
"train_tokens_per_second": 6976.212
},
{
"epoch": 0.1761491481838637,
"grad_norm": 0.21115176379680634,
"learning_rate": 0.00016544165054803352,
"loss": 0.9625,
"num_input_tokens_seen": 13303536,
"step": 274,
"train_runtime": 1906.9531,
"train_tokens_per_second": 6976.331
},
{
"epoch": 0.17679202828672452,
"grad_norm": 0.2265198975801468,
"learning_rate": 0.00016531270148291427,
"loss": 1.063,
"num_input_tokens_seen": 13344512,
"step": 275,
"train_runtime": 1912.7241,
"train_tokens_per_second": 6976.705
},
{
"epoch": 0.17743490838958534,
"grad_norm": 0.22062142193317413,
"learning_rate": 0.000165183752417795,
"loss": 1.0361,
"num_input_tokens_seen": 13390368,
"step": 276,
"train_runtime": 1919.1466,
"train_tokens_per_second": 6977.251
},
{
"epoch": 0.17807778849244615,
"grad_norm": 0.21890532970428467,
"learning_rate": 0.00016505480335267568,
"loss": 1.0226,
"num_input_tokens_seen": 13439984,
"step": 277,
"train_runtime": 1926.079,
"train_tokens_per_second": 6977.899
},
{
"epoch": 0.17872066859530697,
"grad_norm": 0.19763115048408508,
"learning_rate": 0.00016492585428755642,
"loss": 1.0388,
"num_input_tokens_seen": 13506464,
"step": 278,
"train_runtime": 1935.4136,
"train_tokens_per_second": 6978.593
},
{
"epoch": 0.17936354869816779,
"grad_norm": 0.2263236939907074,
"learning_rate": 0.00016479690522243714,
"loss": 1.0409,
"num_input_tokens_seen": 13548112,
"step": 279,
"train_runtime": 1941.2548,
"train_tokens_per_second": 6979.049
},
{
"epoch": 0.1800064288010286,
"grad_norm": 0.20944298803806305,
"learning_rate": 0.00016466795615731786,
"loss": 1.0429,
"num_input_tokens_seen": 13593520,
"step": 280,
"train_runtime": 1947.5837,
"train_tokens_per_second": 6979.685
},
{
"epoch": 0.18064930890388942,
"grad_norm": 0.20669174194335938,
"learning_rate": 0.00016453900709219858,
"loss": 1.0351,
"num_input_tokens_seen": 13633696,
"step": 281,
"train_runtime": 1953.2138,
"train_tokens_per_second": 6980.135
},
{
"epoch": 0.18129218900675023,
"grad_norm": 0.22448189556598663,
"learning_rate": 0.00016441005802707932,
"loss": 1.0267,
"num_input_tokens_seen": 13680928,
"step": 282,
"train_runtime": 1959.8731,
"train_tokens_per_second": 6980.517
},
{
"epoch": 0.18193506910961105,
"grad_norm": 0.23241977393627167,
"learning_rate": 0.00016428110896196004,
"loss": 0.9453,
"num_input_tokens_seen": 13730304,
"step": 283,
"train_runtime": 1966.8014,
"train_tokens_per_second": 6981.032
},
{
"epoch": 0.18257794921247186,
"grad_norm": 0.23002482950687408,
"learning_rate": 0.00016415215989684076,
"loss": 0.9982,
"num_input_tokens_seen": 13783552,
"step": 284,
"train_runtime": 1974.272,
"train_tokens_per_second": 6981.587
},
{
"epoch": 0.18322082931533268,
"grad_norm": 0.22926917672157288,
"learning_rate": 0.00016402321083172148,
"loss": 1.1197,
"num_input_tokens_seen": 13836400,
"step": 285,
"train_runtime": 1981.6555,
"train_tokens_per_second": 6982.243
},
{
"epoch": 0.1838637094181935,
"grad_norm": 0.20413215458393097,
"learning_rate": 0.0001638942617666022,
"loss": 0.955,
"num_input_tokens_seen": 13893248,
"step": 286,
"train_runtime": 1989.6672,
"train_tokens_per_second": 6982.699
},
{
"epoch": 0.18450658952105434,
"grad_norm": 0.2088879644870758,
"learning_rate": 0.00016376531270148291,
"loss": 0.8842,
"num_input_tokens_seen": 13938304,
"step": 287,
"train_runtime": 1995.9845,
"train_tokens_per_second": 6983.173
},
{
"epoch": 0.18514946962391515,
"grad_norm": 0.21762271225452423,
"learning_rate": 0.00016363636363636366,
"loss": 1.0652,
"num_input_tokens_seen": 13976848,
"step": 288,
"train_runtime": 2001.3961,
"train_tokens_per_second": 6983.549
},
{
"epoch": 0.18579234972677597,
"grad_norm": 0.2539909780025482,
"learning_rate": 0.00016350741457124438,
"loss": 1.0878,
"num_input_tokens_seen": 14025536,
"step": 289,
"train_runtime": 2008.2605,
"train_tokens_per_second": 6983.923
},
{
"epoch": 0.18643522982963678,
"grad_norm": 0.21907879412174225,
"learning_rate": 0.00016337846550612507,
"loss": 1.0875,
"num_input_tokens_seen": 14060912,
"step": 290,
"train_runtime": 2013.3476,
"train_tokens_per_second": 6983.847
},
{
"epoch": 0.1870781099324976,
"grad_norm": 0.2488570660352707,
"learning_rate": 0.0001632495164410058,
"loss": 1.009,
"num_input_tokens_seen": 14118128,
"step": 291,
"train_runtime": 2021.445,
"train_tokens_per_second": 6984.176
},
{
"epoch": 0.18772099003535841,
"grad_norm": 0.2508719265460968,
"learning_rate": 0.00016312056737588653,
"loss": 0.9741,
"num_input_tokens_seen": 14149312,
"step": 292,
"train_runtime": 2025.9095,
"train_tokens_per_second": 6984.178
},
{
"epoch": 0.18836387013821923,
"grad_norm": 0.2172834575176239,
"learning_rate": 0.00016299161831076725,
"loss": 1.0391,
"num_input_tokens_seen": 14218928,
"step": 293,
"train_runtime": 2035.6049,
"train_tokens_per_second": 6985.112
},
{
"epoch": 0.18900675024108005,
"grad_norm": 0.213466614484787,
"learning_rate": 0.00016286266924564797,
"loss": 1.0612,
"num_input_tokens_seen": 14255008,
"step": 294,
"train_runtime": 2040.7249,
"train_tokens_per_second": 6985.267
},
{
"epoch": 0.18964963034394086,
"grad_norm": 0.21678265929222107,
"learning_rate": 0.0001627337201805287,
"loss": 0.9694,
"num_input_tokens_seen": 14288208,
"step": 295,
"train_runtime": 2045.4091,
"train_tokens_per_second": 6985.501
},
{
"epoch": 0.19029251044680168,
"grad_norm": 0.21735024452209473,
"learning_rate": 0.0001626047711154094,
"loss": 0.9697,
"num_input_tokens_seen": 14336704,
"step": 296,
"train_runtime": 2052.1745,
"train_tokens_per_second": 6986.104
},
{
"epoch": 0.1909353905496625,
"grad_norm": 0.2252785861492157,
"learning_rate": 0.00016247582205029015,
"loss": 0.9943,
"num_input_tokens_seen": 14376112,
"step": 297,
"train_runtime": 2057.6427,
"train_tokens_per_second": 6986.69
},
{
"epoch": 0.1915782706525233,
"grad_norm": 0.22839459776878357,
"learning_rate": 0.00016234687298517087,
"loss": 0.9697,
"num_input_tokens_seen": 14417840,
"step": 298,
"train_runtime": 2063.4637,
"train_tokens_per_second": 6987.203
},
{
"epoch": 0.19222115075538412,
"grad_norm": 0.2202254831790924,
"learning_rate": 0.00016221792392005159,
"loss": 0.9729,
"num_input_tokens_seen": 14470960,
"step": 299,
"train_runtime": 2070.8486,
"train_tokens_per_second": 6987.937
},
{
"epoch": 0.19286403085824494,
"grad_norm": 0.21936999261379242,
"learning_rate": 0.0001620889748549323,
"loss": 0.9936,
"num_input_tokens_seen": 14510896,
"step": 300,
"train_runtime": 2076.5004,
"train_tokens_per_second": 6988.15
},
{
"epoch": 0.19350691096110575,
"grad_norm": 0.21325935423374176,
"learning_rate": 0.00016196002578981305,
"loss": 1.1782,
"num_input_tokens_seen": 14559328,
"step": 301,
"train_runtime": 2083.8514,
"train_tokens_per_second": 6986.74
},
{
"epoch": 0.19414979106396657,
"grad_norm": 0.2144458293914795,
"learning_rate": 0.00016183107672469374,
"loss": 1.0087,
"num_input_tokens_seen": 14601008,
"step": 302,
"train_runtime": 2089.7659,
"train_tokens_per_second": 6986.911
},
{
"epoch": 0.19479267116682739,
"grad_norm": 0.22481171786785126,
"learning_rate": 0.00016170212765957446,
"loss": 0.8639,
"num_input_tokens_seen": 14647408,
"step": 303,
"train_runtime": 2096.2153,
"train_tokens_per_second": 6987.549
},
{
"epoch": 0.1954355512696882,
"grad_norm": 0.212294340133667,
"learning_rate": 0.0001615731785944552,
"loss": 0.984,
"num_input_tokens_seen": 14691920,
"step": 304,
"train_runtime": 2102.516,
"train_tokens_per_second": 6987.78
},
{
"epoch": 0.19607843137254902,
"grad_norm": 0.237873375415802,
"learning_rate": 0.00016144422952933592,
"loss": 0.9527,
"num_input_tokens_seen": 14739696,
"step": 305,
"train_runtime": 2109.2496,
"train_tokens_per_second": 6988.123
},
{
"epoch": 0.19672131147540983,
"grad_norm": 0.2184976041316986,
"learning_rate": 0.00016131528046421664,
"loss": 1.0345,
"num_input_tokens_seen": 14780704,
"step": 306,
"train_runtime": 2115.0693,
"train_tokens_per_second": 6988.284
},
{
"epoch": 0.19736419157827065,
"grad_norm": 0.22368647158145905,
"learning_rate": 0.00016118633139909736,
"loss": 1.0269,
"num_input_tokens_seen": 14815456,
"step": 307,
"train_runtime": 2120.0285,
"train_tokens_per_second": 6988.329
},
{
"epoch": 0.19800707168113146,
"grad_norm": 0.22638754546642303,
"learning_rate": 0.0001610573823339781,
"loss": 1.0508,
"num_input_tokens_seen": 14859568,
"step": 308,
"train_runtime": 2126.1887,
"train_tokens_per_second": 6988.828
},
{
"epoch": 0.19864995178399228,
"grad_norm": 0.22508348524570465,
"learning_rate": 0.0001609284332688588,
"loss": 1.1461,
"num_input_tokens_seen": 14893728,
"step": 309,
"train_runtime": 2131.0369,
"train_tokens_per_second": 6988.958
},
{
"epoch": 0.1992928318868531,
"grad_norm": 0.21122296154499054,
"learning_rate": 0.00016079948420373954,
"loss": 1.0852,
"num_input_tokens_seen": 14937536,
"step": 310,
"train_runtime": 2137.149,
"train_tokens_per_second": 6989.469
},
{
"epoch": 0.1999357119897139,
"grad_norm": 0.2315026819705963,
"learning_rate": 0.00016067053513862026,
"loss": 1.0333,
"num_input_tokens_seen": 14984160,
"step": 311,
"train_runtime": 2143.6598,
"train_tokens_per_second": 6989.99
},
{
"epoch": 0.20057859209257473,
"grad_norm": 0.23183020949363708,
"learning_rate": 0.00016054158607350098,
"loss": 0.933,
"num_input_tokens_seen": 15023328,
"step": 312,
"train_runtime": 2149.2207,
"train_tokens_per_second": 6990.128
},
{
"epoch": 0.20057859209257473,
"eval_loss": 1.0449717044830322,
"eval_runtime": 39.9901,
"eval_samples_per_second": 24.856,
"eval_steps_per_second": 1.575,
"num_input_tokens_seen": 15023328,
"step": 312
},
{
"epoch": 0.20122147219543554,
"grad_norm": 0.2052253782749176,
"learning_rate": 0.0001604126370083817,
"loss": 1.088,
"num_input_tokens_seen": 15064848,
"step": 313,
"train_runtime": 2195.0514,
"train_tokens_per_second": 6863.096
},
{
"epoch": 0.20186435229829636,
"grad_norm": 0.2076413780450821,
"learning_rate": 0.00016028368794326244,
"loss": 0.9505,
"num_input_tokens_seen": 15107216,
"step": 314,
"train_runtime": 2201.0734,
"train_tokens_per_second": 6863.567
},
{
"epoch": 0.20250723240115717,
"grad_norm": 0.22141262888908386,
"learning_rate": 0.00016015473887814313,
"loss": 1.0592,
"num_input_tokens_seen": 15167120,
"step": 315,
"train_runtime": 2209.4569,
"train_tokens_per_second": 6864.637
},
{
"epoch": 0.203150112504018,
"grad_norm": 0.23321790993213654,
"learning_rate": 0.00016002578981302387,
"loss": 1.1055,
"num_input_tokens_seen": 15213584,
"step": 316,
"train_runtime": 2216.0238,
"train_tokens_per_second": 6865.262
},
{
"epoch": 0.2037929926068788,
"grad_norm": 0.199346125125885,
"learning_rate": 0.0001598968407479046,
"loss": 0.9193,
"num_input_tokens_seen": 15251280,
"step": 317,
"train_runtime": 2221.3256,
"train_tokens_per_second": 6865.846
},
{
"epoch": 0.20443587270973965,
"grad_norm": 0.20624004304409027,
"learning_rate": 0.0001597678916827853,
"loss": 0.9764,
"num_input_tokens_seen": 15291984,
"step": 318,
"train_runtime": 2227.0722,
"train_tokens_per_second": 6866.407
},
{
"epoch": 0.20507875281260046,
"grad_norm": 0.21078018844127655,
"learning_rate": 0.00015963894261766603,
"loss": 1.0383,
"num_input_tokens_seen": 15368032,
"step": 319,
"train_runtime": 2237.8039,
"train_tokens_per_second": 6867.461
},
{
"epoch": 0.20572163291546128,
"grad_norm": 0.224661186337471,
"learning_rate": 0.00015950999355254675,
"loss": 1.1089,
"num_input_tokens_seen": 15415200,
"step": 320,
"train_runtime": 2244.409,
"train_tokens_per_second": 6868.267
},
{
"epoch": 0.2063645130183221,
"grad_norm": 0.22397011518478394,
"learning_rate": 0.00015938104448742747,
"loss": 0.8939,
"num_input_tokens_seen": 15466512,
"step": 321,
"train_runtime": 2251.6208,
"train_tokens_per_second": 6869.057
},
{
"epoch": 0.2070073931211829,
"grad_norm": 0.2197643667459488,
"learning_rate": 0.00015925209542230818,
"loss": 0.9243,
"num_input_tokens_seen": 15508848,
"step": 322,
"train_runtime": 2257.5953,
"train_tokens_per_second": 6869.632
},
{
"epoch": 0.20765027322404372,
"grad_norm": 0.2126566618680954,
"learning_rate": 0.00015912314635718893,
"loss": 1.0816,
"num_input_tokens_seen": 15569040,
"step": 323,
"train_runtime": 2266.0805,
"train_tokens_per_second": 6870.471
},
{
"epoch": 0.20829315332690454,
"grad_norm": 0.22825764119625092,
"learning_rate": 0.00015899419729206965,
"loss": 1.0619,
"num_input_tokens_seen": 15624560,
"step": 324,
"train_runtime": 2273.8965,
"train_tokens_per_second": 6871.271
},
{
"epoch": 0.20893603342976536,
"grad_norm": 0.23155193030834198,
"learning_rate": 0.00015886524822695037,
"loss": 1.1336,
"num_input_tokens_seen": 15676384,
"step": 325,
"train_runtime": 2281.1802,
"train_tokens_per_second": 6872.05
},
{
"epoch": 0.20957891353262617,
"grad_norm": 0.2167881578207016,
"learning_rate": 0.00015873629916183108,
"loss": 0.9745,
"num_input_tokens_seen": 15715376,
"step": 326,
"train_runtime": 2286.7205,
"train_tokens_per_second": 6872.452
},
{
"epoch": 0.210221793635487,
"grad_norm": 0.22079265117645264,
"learning_rate": 0.00015860735009671183,
"loss": 1.0279,
"num_input_tokens_seen": 15755296,
"step": 327,
"train_runtime": 2292.4006,
"train_tokens_per_second": 6872.837
},
{
"epoch": 0.2108646737383478,
"grad_norm": 0.20521511137485504,
"learning_rate": 0.00015847840103159252,
"loss": 0.9797,
"num_input_tokens_seen": 15796304,
"step": 328,
"train_runtime": 2298.1842,
"train_tokens_per_second": 6873.385
},
{
"epoch": 0.21150755384120862,
"grad_norm": 0.20652268826961517,
"learning_rate": 0.00015834945196647326,
"loss": 1.0131,
"num_input_tokens_seen": 15861888,
"step": 329,
"train_runtime": 2307.3506,
"train_tokens_per_second": 6874.503
},
{
"epoch": 0.21215043394406943,
"grad_norm": 0.2393670231103897,
"learning_rate": 0.00015822050290135398,
"loss": 1.0919,
"num_input_tokens_seen": 15918912,
"step": 330,
"train_runtime": 2315.3599,
"train_tokens_per_second": 6875.351
},
{
"epoch": 0.21279331404693025,
"grad_norm": 0.22710706293582916,
"learning_rate": 0.00015809155383623467,
"loss": 0.8762,
"num_input_tokens_seen": 15964208,
"step": 331,
"train_runtime": 2322.1834,
"train_tokens_per_second": 6874.654
},
{
"epoch": 0.21343619414979106,
"grad_norm": 0.2203913927078247,
"learning_rate": 0.00015796260477111542,
"loss": 0.9199,
"num_input_tokens_seen": 16005184,
"step": 332,
"train_runtime": 2327.9642,
"train_tokens_per_second": 6875.185
},
{
"epoch": 0.21407907425265188,
"grad_norm": 0.21308915317058563,
"learning_rate": 0.00015783365570599614,
"loss": 1.072,
"num_input_tokens_seen": 16059904,
"step": 333,
"train_runtime": 2335.62,
"train_tokens_per_second": 6876.077
},
{
"epoch": 0.2147219543555127,
"grad_norm": 0.20549263060092926,
"learning_rate": 0.00015770470664087686,
"loss": 0.8769,
"num_input_tokens_seen": 16107120,
"step": 334,
"train_runtime": 2342.2351,
"train_tokens_per_second": 6876.816
},
{
"epoch": 0.2153648344583735,
"grad_norm": 0.2424677014350891,
"learning_rate": 0.00015757575757575757,
"loss": 0.9632,
"num_input_tokens_seen": 16167296,
"step": 335,
"train_runtime": 2350.7127,
"train_tokens_per_second": 6877.615
},
{
"epoch": 0.21600771456123433,
"grad_norm": 0.2267872840166092,
"learning_rate": 0.00015744680851063832,
"loss": 1.0203,
"num_input_tokens_seen": 16204688,
"step": 336,
"train_runtime": 2355.9807,
"train_tokens_per_second": 6878.107
},
{
"epoch": 0.21665059466409514,
"grad_norm": 0.22265243530273438,
"learning_rate": 0.000157317859445519,
"loss": 0.944,
"num_input_tokens_seen": 16260720,
"step": 337,
"train_runtime": 2363.8103,
"train_tokens_per_second": 6879.029
},
{
"epoch": 0.21729347476695596,
"grad_norm": 0.21381650865077972,
"learning_rate": 0.00015718891038039975,
"loss": 0.9924,
"num_input_tokens_seen": 16311056,
"step": 338,
"train_runtime": 2370.8636,
"train_tokens_per_second": 6879.795
},
{
"epoch": 0.21793635486981677,
"grad_norm": 0.22315365076065063,
"learning_rate": 0.00015705996131528047,
"loss": 0.9271,
"num_input_tokens_seen": 16373312,
"step": 339,
"train_runtime": 2379.5316,
"train_tokens_per_second": 6880.897
},
{
"epoch": 0.2185792349726776,
"grad_norm": 0.20747241377830505,
"learning_rate": 0.0001569310122501612,
"loss": 0.9806,
"num_input_tokens_seen": 16460896,
"step": 340,
"train_runtime": 2391.8054,
"train_tokens_per_second": 6882.205
},
{
"epoch": 0.2192221150755384,
"grad_norm": 0.22228913009166718,
"learning_rate": 0.0001568020631850419,
"loss": 0.9529,
"num_input_tokens_seen": 16500624,
"step": 341,
"train_runtime": 2397.4202,
"train_tokens_per_second": 6882.658
},
{
"epoch": 0.21986499517839922,
"grad_norm": 0.22346661984920502,
"learning_rate": 0.00015667311411992265,
"loss": 1.0819,
"num_input_tokens_seen": 16562912,
"step": 342,
"train_runtime": 2406.137,
"train_tokens_per_second": 6883.611
},
{
"epoch": 0.22050787528126004,
"grad_norm": 0.21236997842788696,
"learning_rate": 0.00015654416505480337,
"loss": 1.0681,
"num_input_tokens_seen": 16641856,
"step": 343,
"train_runtime": 2417.3084,
"train_tokens_per_second": 6884.457
},
{
"epoch": 0.22115075538412085,
"grad_norm": 0.22987902164459229,
"learning_rate": 0.00015641521598968406,
"loss": 0.9596,
"num_input_tokens_seen": 16680544,
"step": 344,
"train_runtime": 2422.7728,
"train_tokens_per_second": 6884.898
},
{
"epoch": 0.22179363548698167,
"grad_norm": 0.2243010699748993,
"learning_rate": 0.0001562862669245648,
"loss": 1.0497,
"num_input_tokens_seen": 16731376,
"step": 345,
"train_runtime": 2429.8931,
"train_tokens_per_second": 6885.643
},
{
"epoch": 0.22243651558984248,
"grad_norm": 0.20788230001926422,
"learning_rate": 0.00015615731785944553,
"loss": 1.0496,
"num_input_tokens_seen": 16777760,
"step": 346,
"train_runtime": 2436.3871,
"train_tokens_per_second": 6886.328
},
{
"epoch": 0.2230793956927033,
"grad_norm": 0.20559217035770416,
"learning_rate": 0.00015602836879432625,
"loss": 1.0781,
"num_input_tokens_seen": 16820112,
"step": 347,
"train_runtime": 2442.3361,
"train_tokens_per_second": 6886.895
},
{
"epoch": 0.22372227579556414,
"grad_norm": 0.22564542293548584,
"learning_rate": 0.00015589941972920696,
"loss": 0.9787,
"num_input_tokens_seen": 16862384,
"step": 348,
"train_runtime": 2448.2489,
"train_tokens_per_second": 6887.529
},
{
"epoch": 0.22436515589842496,
"grad_norm": 0.20842592418193817,
"learning_rate": 0.0001557704706640877,
"loss": 0.9991,
"num_input_tokens_seen": 16904848,
"step": 349,
"train_runtime": 2454.2617,
"train_tokens_per_second": 6887.957
},
{
"epoch": 0.22500803600128577,
"grad_norm": 0.2145644873380661,
"learning_rate": 0.0001556415215989684,
"loss": 1.1338,
"num_input_tokens_seen": 16962400,
"step": 350,
"train_runtime": 2462.3222,
"train_tokens_per_second": 6888.782
},
{
"epoch": 0.2256509161041466,
"grad_norm": 0.22125239670276642,
"learning_rate": 0.00015551257253384914,
"loss": 0.9465,
"num_input_tokens_seen": 17031360,
"step": 351,
"train_runtime": 2471.9125,
"train_tokens_per_second": 6889.953
},
{
"epoch": 0.2262937962070074,
"grad_norm": 0.22434987127780914,
"learning_rate": 0.00015538362346872986,
"loss": 1.0576,
"num_input_tokens_seen": 17070768,
"step": 352,
"train_runtime": 2477.4513,
"train_tokens_per_second": 6890.456
},
{
"epoch": 0.22693667630986822,
"grad_norm": 0.2168796807527542,
"learning_rate": 0.00015525467440361058,
"loss": 0.9702,
"num_input_tokens_seen": 17133312,
"step": 353,
"train_runtime": 2486.2278,
"train_tokens_per_second": 6891.288
},
{
"epoch": 0.22757955641272903,
"grad_norm": 0.2135160118341446,
"learning_rate": 0.0001551257253384913,
"loss": 0.9385,
"num_input_tokens_seen": 17209040,
"step": 354,
"train_runtime": 2496.8564,
"train_tokens_per_second": 6892.283
},
{
"epoch": 0.22822243651558985,
"grad_norm": 0.20850864052772522,
"learning_rate": 0.00015499677627337204,
"loss": 1.0142,
"num_input_tokens_seen": 17249168,
"step": 355,
"train_runtime": 2502.4956,
"train_tokens_per_second": 6892.786
},
{
"epoch": 0.22886531661845066,
"grad_norm": 0.22662048041820526,
"learning_rate": 0.00015486782720825274,
"loss": 1.101,
"num_input_tokens_seen": 17286880,
"step": 356,
"train_runtime": 2507.7503,
"train_tokens_per_second": 6893.382
},
{
"epoch": 0.22950819672131148,
"grad_norm": 0.25150901079177856,
"learning_rate": 0.00015473887814313345,
"loss": 1.0504,
"num_input_tokens_seen": 17336416,
"step": 357,
"train_runtime": 2514.6955,
"train_tokens_per_second": 6894.042
},
{
"epoch": 0.2301510768241723,
"grad_norm": 0.22188004851341248,
"learning_rate": 0.0001546099290780142,
"loss": 0.9251,
"num_input_tokens_seen": 17372624,
"step": 358,
"train_runtime": 2519.8241,
"train_tokens_per_second": 6894.38
},
{
"epoch": 0.2307939569270331,
"grad_norm": 0.2283482849597931,
"learning_rate": 0.00015448098001289492,
"loss": 0.9696,
"num_input_tokens_seen": 17405232,
"step": 359,
"train_runtime": 2524.4397,
"train_tokens_per_second": 6894.691
},
{
"epoch": 0.23143683702989393,
"grad_norm": 0.23135900497436523,
"learning_rate": 0.00015435203094777563,
"loss": 1.0346,
"num_input_tokens_seen": 17464912,
"step": 360,
"train_runtime": 2532.7593,
"train_tokens_per_second": 6895.607
},
{
"epoch": 0.23207971713275474,
"grad_norm": 0.20459306240081787,
"learning_rate": 0.00015422308188265635,
"loss": 0.9895,
"num_input_tokens_seen": 17504080,
"step": 361,
"train_runtime": 2538.8167,
"train_tokens_per_second": 6894.582
},
{
"epoch": 0.23272259723561556,
"grad_norm": 0.23917587101459503,
"learning_rate": 0.00015409413281753707,
"loss": 1.1129,
"num_input_tokens_seen": 17550544,
"step": 362,
"train_runtime": 2545.3315,
"train_tokens_per_second": 6895.19
},
{
"epoch": 0.23336547733847637,
"grad_norm": 0.21495625376701355,
"learning_rate": 0.0001539651837524178,
"loss": 0.9594,
"num_input_tokens_seen": 17597312,
"step": 363,
"train_runtime": 2551.871,
"train_tokens_per_second": 6895.847
},
{
"epoch": 0.2340083574413372,
"grad_norm": 0.21964554488658905,
"learning_rate": 0.00015383623468729853,
"loss": 0.9654,
"num_input_tokens_seen": 17638976,
"step": 364,
"train_runtime": 2557.6614,
"train_tokens_per_second": 6896.525
},
{
"epoch": 0.234651237544198,
"grad_norm": 0.20798838138580322,
"learning_rate": 0.00015370728562217925,
"loss": 1.0088,
"num_input_tokens_seen": 17681408,
"step": 365,
"train_runtime": 2563.5782,
"train_tokens_per_second": 6897.16
},
{
"epoch": 0.23529411764705882,
"grad_norm": 0.2274344116449356,
"learning_rate": 0.00015357833655705997,
"loss": 1.0474,
"num_input_tokens_seen": 17721088,
"step": 366,
"train_runtime": 2569.1892,
"train_tokens_per_second": 6897.541
},
{
"epoch": 0.23593699774991964,
"grad_norm": 0.21265920996665955,
"learning_rate": 0.0001534493874919407,
"loss": 1.0855,
"num_input_tokens_seen": 17774192,
"step": 367,
"train_runtime": 2576.6447,
"train_tokens_per_second": 6898.193
},
{
"epoch": 0.23657987785278045,
"grad_norm": 0.20594769716262817,
"learning_rate": 0.00015332043842682143,
"loss": 1.0002,
"num_input_tokens_seen": 17806736,
"step": 368,
"train_runtime": 2581.2698,
"train_tokens_per_second": 6898.44
},
{
"epoch": 0.23722275795564127,
"grad_norm": 0.23406660556793213,
"learning_rate": 0.00015319148936170213,
"loss": 0.9609,
"num_input_tokens_seen": 17851600,
"step": 369,
"train_runtime": 2587.5545,
"train_tokens_per_second": 6899.024
},
{
"epoch": 0.23786563805850208,
"grad_norm": 0.2062958925962448,
"learning_rate": 0.00015306254029658287,
"loss": 0.9404,
"num_input_tokens_seen": 17900896,
"step": 370,
"train_runtime": 2594.5321,
"train_tokens_per_second": 6899.47
},
{
"epoch": 0.2385085181613629,
"grad_norm": 0.21552585065364838,
"learning_rate": 0.0001529335912314636,
"loss": 1.0565,
"num_input_tokens_seen": 17944608,
"step": 371,
"train_runtime": 2600.689,
"train_tokens_per_second": 6899.944
},
{
"epoch": 0.2391513982642237,
"grad_norm": 0.2339625358581543,
"learning_rate": 0.00015280464216634428,
"loss": 1.0835,
"num_input_tokens_seen": 17997248,
"step": 372,
"train_runtime": 2608.1398,
"train_tokens_per_second": 6900.415
},
{
"epoch": 0.23979427836708453,
"grad_norm": 0.20932239294052124,
"learning_rate": 0.00015267569310122502,
"loss": 0.8882,
"num_input_tokens_seen": 18038784,
"step": 373,
"train_runtime": 2614.0203,
"train_tokens_per_second": 6900.782
},
{
"epoch": 0.24043715846994534,
"grad_norm": 0.21244873106479645,
"learning_rate": 0.00015254674403610574,
"loss": 1.1622,
"num_input_tokens_seen": 18100272,
"step": 374,
"train_runtime": 2622.6304,
"train_tokens_per_second": 6901.572
},
{
"epoch": 0.24108003857280616,
"grad_norm": 0.2197032868862152,
"learning_rate": 0.00015241779497098646,
"loss": 1.0074,
"num_input_tokens_seen": 18139376,
"step": 375,
"train_runtime": 2628.1043,
"train_tokens_per_second": 6902.076
},
{
"epoch": 0.24172291867566698,
"grad_norm": 0.2254268378019333,
"learning_rate": 0.00015228884590586718,
"loss": 1.1203,
"num_input_tokens_seen": 18183152,
"step": 376,
"train_runtime": 2634.2959,
"train_tokens_per_second": 6902.471
},
{
"epoch": 0.2423657987785278,
"grad_norm": 0.22068928182125092,
"learning_rate": 0.00015215989684074792,
"loss": 1.0726,
"num_input_tokens_seen": 18246832,
"step": 377,
"train_runtime": 2643.2335,
"train_tokens_per_second": 6903.224
},
{
"epoch": 0.24300867888138863,
"grad_norm": 0.2326030731201172,
"learning_rate": 0.00015203094777562864,
"loss": 1.037,
"num_input_tokens_seen": 18294272,
"step": 378,
"train_runtime": 2649.8373,
"train_tokens_per_second": 6903.923
},
{
"epoch": 0.24365155898424945,
"grad_norm": 0.20725147426128387,
"learning_rate": 0.00015190199871050936,
"loss": 1.0334,
"num_input_tokens_seen": 18358048,
"step": 379,
"train_runtime": 2658.7607,
"train_tokens_per_second": 6904.739
},
{
"epoch": 0.24429443908711027,
"grad_norm": 0.22106829285621643,
"learning_rate": 0.00015177304964539008,
"loss": 0.919,
"num_input_tokens_seen": 18415040,
"step": 380,
"train_runtime": 2666.8029,
"train_tokens_per_second": 6905.287
},
{
"epoch": 0.24493731918997108,
"grad_norm": 0.21206669509410858,
"learning_rate": 0.0001516441005802708,
"loss": 1.0846,
"num_input_tokens_seen": 18457616,
"step": 381,
"train_runtime": 2672.8188,
"train_tokens_per_second": 6905.674
},
{
"epoch": 0.2455801992928319,
"grad_norm": 0.2023545801639557,
"learning_rate": 0.00015151515151515152,
"loss": 1.0256,
"num_input_tokens_seen": 18501568,
"step": 382,
"train_runtime": 2678.9798,
"train_tokens_per_second": 6906.199
},
{
"epoch": 0.2462230793956927,
"grad_norm": 0.22866152226924896,
"learning_rate": 0.00015138620245003226,
"loss": 1.0998,
"num_input_tokens_seen": 18549424,
"step": 383,
"train_runtime": 2685.7401,
"train_tokens_per_second": 6906.634
},
{
"epoch": 0.24686595949855353,
"grad_norm": 0.20636679232120514,
"learning_rate": 0.00015125725338491298,
"loss": 1.0465,
"num_input_tokens_seen": 18586848,
"step": 384,
"train_runtime": 2691.0114,
"train_tokens_per_second": 6907.012
},
{
"epoch": 0.24750883960141434,
"grad_norm": 0.23085221648216248,
"learning_rate": 0.00015112830431979367,
"loss": 1.0254,
"num_input_tokens_seen": 18626480,
"step": 385,
"train_runtime": 2696.519,
"train_tokens_per_second": 6907.602
},
{
"epoch": 0.24815171970427516,
"grad_norm": 0.22030708193778992,
"learning_rate": 0.00015099935525467441,
"loss": 1.0352,
"num_input_tokens_seen": 18689568,
"step": 386,
"train_runtime": 2705.3041,
"train_tokens_per_second": 6908.491
},
{
"epoch": 0.24879459980713597,
"grad_norm": 0.22935743629932404,
"learning_rate": 0.00015087040618955513,
"loss": 1.146,
"num_input_tokens_seen": 18726704,
"step": 387,
"train_runtime": 2710.5029,
"train_tokens_per_second": 6908.941
},
{
"epoch": 0.2494374799099968,
"grad_norm": 0.20517560839653015,
"learning_rate": 0.00015074145712443585,
"loss": 1.022,
"num_input_tokens_seen": 18766496,
"step": 388,
"train_runtime": 2716.0753,
"train_tokens_per_second": 6909.417
},
{
"epoch": 0.2500803600128576,
"grad_norm": 0.22025009989738464,
"learning_rate": 0.00015061250805931657,
"loss": 0.9693,
"num_input_tokens_seen": 18816080,
"step": 389,
"train_runtime": 2722.9496,
"train_tokens_per_second": 6910.183
},
{
"epoch": 0.2507232401157184,
"grad_norm": 0.21232417225837708,
"learning_rate": 0.00015048355899419731,
"loss": 1.2909,
"num_input_tokens_seen": 18882448,
"step": 390,
"train_runtime": 2732.2319,
"train_tokens_per_second": 6910.998
},
{
"epoch": 0.25136612021857924,
"grad_norm": 0.23262064158916473,
"learning_rate": 0.000150354609929078,
"loss": 1.0109,
"num_input_tokens_seen": 18914880,
"step": 391,
"train_runtime": 2737.3571,
"train_tokens_per_second": 6909.906
},
{
"epoch": 0.25200900032144,
"grad_norm": 0.22956109046936035,
"learning_rate": 0.00015022566086395875,
"loss": 1.0905,
"num_input_tokens_seen": 18956000,
"step": 392,
"train_runtime": 2743.0989,
"train_tokens_per_second": 6910.433
},
{
"epoch": 0.25265188042430087,
"grad_norm": 0.22758060693740845,
"learning_rate": 0.00015009671179883947,
"loss": 0.8537,
"num_input_tokens_seen": 18994240,
"step": 393,
"train_runtime": 2748.4514,
"train_tokens_per_second": 6910.888
},
{
"epoch": 0.2532947605271617,
"grad_norm": 0.23041218519210815,
"learning_rate": 0.0001499677627337202,
"loss": 1.0148,
"num_input_tokens_seen": 19043488,
"step": 394,
"train_runtime": 2755.3445,
"train_tokens_per_second": 6911.473
},
{
"epoch": 0.2539376406300225,
"grad_norm": 0.22266460955142975,
"learning_rate": 0.0001498388136686009,
"loss": 0.9664,
"num_input_tokens_seen": 19104592,
"step": 395,
"train_runtime": 2763.8353,
"train_tokens_per_second": 6912.348
},
{
"epoch": 0.25458052073288334,
"grad_norm": 0.21018558740615845,
"learning_rate": 0.00014970986460348165,
"loss": 0.96,
"num_input_tokens_seen": 19162144,
"step": 396,
"train_runtime": 2771.8439,
"train_tokens_per_second": 6913.14
},
{
"epoch": 0.25522340083574413,
"grad_norm": 0.2324586659669876,
"learning_rate": 0.00014958091553836234,
"loss": 0.9965,
"num_input_tokens_seen": 19213072,
"step": 397,
"train_runtime": 2778.8865,
"train_tokens_per_second": 6913.946
},
{
"epoch": 0.255866280938605,
"grad_norm": 0.22461821138858795,
"learning_rate": 0.00014945196647324306,
"loss": 1.0135,
"num_input_tokens_seen": 19264752,
"step": 398,
"train_runtime": 2786.0111,
"train_tokens_per_second": 6914.815
},
{
"epoch": 0.25650916104146576,
"grad_norm": 0.21653743088245392,
"learning_rate": 0.0001493230174081238,
"loss": 0.9953,
"num_input_tokens_seen": 19314720,
"step": 399,
"train_runtime": 2792.9395,
"train_tokens_per_second": 6915.552
},
{
"epoch": 0.2571520411443266,
"grad_norm": 0.1964331865310669,
"learning_rate": 0.00014919406834300452,
"loss": 1.0134,
"num_input_tokens_seen": 19372448,
"step": 400,
"train_runtime": 2800.9649,
"train_tokens_per_second": 6916.348
},
{
"epoch": 0.2577949212471874,
"grad_norm": 0.22261105477809906,
"learning_rate": 0.00014906511927788524,
"loss": 0.8945,
"num_input_tokens_seen": 19419152,
"step": 401,
"train_runtime": 2807.4236,
"train_tokens_per_second": 6917.072
},
{
"epoch": 0.25843780135004824,
"grad_norm": 0.21433231234550476,
"learning_rate": 0.00014893617021276596,
"loss": 0.9175,
"num_input_tokens_seen": 19473936,
"step": 402,
"train_runtime": 2814.9768,
"train_tokens_per_second": 6917.974
},
{
"epoch": 0.259080681452909,
"grad_norm": 0.20293863117694855,
"learning_rate": 0.0001488072211476467,
"loss": 1.085,
"num_input_tokens_seen": 19520528,
"step": 403,
"train_runtime": 2821.3854,
"train_tokens_per_second": 6918.774
},
{
"epoch": 0.25972356155576987,
"grad_norm": 0.2340640276670456,
"learning_rate": 0.0001486782720825274,
"loss": 0.9965,
"num_input_tokens_seen": 19573120,
"step": 404,
"train_runtime": 2828.5815,
"train_tokens_per_second": 6919.765
},
{
"epoch": 0.26036644165863065,
"grad_norm": 0.22344012558460236,
"learning_rate": 0.00014854932301740814,
"loss": 0.9849,
"num_input_tokens_seen": 19623328,
"step": 405,
"train_runtime": 2835.5013,
"train_tokens_per_second": 6920.585
},
{
"epoch": 0.2610093217614915,
"grad_norm": 0.1989823281764984,
"learning_rate": 0.00014842037395228886,
"loss": 1.0261,
"num_input_tokens_seen": 19663536,
"step": 406,
"train_runtime": 2841.0622,
"train_tokens_per_second": 6921.192
},
{
"epoch": 0.2616522018643523,
"grad_norm": 0.25294196605682373,
"learning_rate": 0.00014829142488716958,
"loss": 1.0592,
"num_input_tokens_seen": 19716272,
"step": 407,
"train_runtime": 2848.3461,
"train_tokens_per_second": 6922.007
},
{
"epoch": 0.26229508196721313,
"grad_norm": 0.19655641913414001,
"learning_rate": 0.0001481624758220503,
"loss": 1.0594,
"num_input_tokens_seen": 19757136,
"step": 408,
"train_runtime": 2854.032,
"train_tokens_per_second": 6922.535
},
{
"epoch": 0.2629379620700739,
"grad_norm": 0.2105259895324707,
"learning_rate": 0.00014803352675693104,
"loss": 0.9865,
"num_input_tokens_seen": 19798336,
"step": 409,
"train_runtime": 2859.7906,
"train_tokens_per_second": 6923.002
},
{
"epoch": 0.26358084217293476,
"grad_norm": 0.23902744054794312,
"learning_rate": 0.00014790457769181173,
"loss": 0.9191,
"num_input_tokens_seen": 19835600,
"step": 410,
"train_runtime": 2864.9574,
"train_tokens_per_second": 6923.523
},
{
"epoch": 0.26422372227579555,
"grad_norm": 0.20994171500205994,
"learning_rate": 0.00014777562862669245,
"loss": 1.0072,
"num_input_tokens_seen": 19888144,
"step": 411,
"train_runtime": 2872.2647,
"train_tokens_per_second": 6924.203
},
{
"epoch": 0.2648666023786564,
"grad_norm": 0.2297692447900772,
"learning_rate": 0.0001476466795615732,
"loss": 0.892,
"num_input_tokens_seen": 19919472,
"step": 412,
"train_runtime": 2876.6558,
"train_tokens_per_second": 6924.524
},
{
"epoch": 0.2655094824815172,
"grad_norm": 0.23039385676383972,
"learning_rate": 0.00014751773049645389,
"loss": 0.9413,
"num_input_tokens_seen": 19970784,
"step": 413,
"train_runtime": 2883.6897,
"train_tokens_per_second": 6925.427
},
{
"epoch": 0.266152362584378,
"grad_norm": 0.22210006415843964,
"learning_rate": 0.00014738878143133463,
"loss": 1.0716,
"num_input_tokens_seen": 20016944,
"step": 414,
"train_runtime": 2890.0507,
"train_tokens_per_second": 6926.157
},
{
"epoch": 0.2667952426872388,
"grad_norm": 0.21822607517242432,
"learning_rate": 0.00014725983236621535,
"loss": 1.063,
"num_input_tokens_seen": 20073952,
"step": 415,
"train_runtime": 2897.8885,
"train_tokens_per_second": 6927.096
},
{
"epoch": 0.26743812279009965,
"grad_norm": 0.226910799741745,
"learning_rate": 0.00014713088330109607,
"loss": 1.0704,
"num_input_tokens_seen": 20148912,
"step": 416,
"train_runtime": 2908.257,
"train_tokens_per_second": 6928.174
},
{
"epoch": 0.26808100289296044,
"grad_norm": 0.20137490332126617,
"learning_rate": 0.00014700193423597678,
"loss": 0.9697,
"num_input_tokens_seen": 20206416,
"step": 417,
"train_runtime": 2916.1441,
"train_tokens_per_second": 6929.155
},
{
"epoch": 0.2687238829958213,
"grad_norm": 0.21282772719860077,
"learning_rate": 0.00014687298517085753,
"loss": 0.9607,
"num_input_tokens_seen": 20248576,
"step": 418,
"train_runtime": 2921.9462,
"train_tokens_per_second": 6929.825
},
{
"epoch": 0.26936676309868207,
"grad_norm": 0.21868926286697388,
"learning_rate": 0.00014674403610573825,
"loss": 0.9257,
"num_input_tokens_seen": 20293872,
"step": 419,
"train_runtime": 2928.1578,
"train_tokens_per_second": 6930.594
},
{
"epoch": 0.2700096432015429,
"grad_norm": 0.19923853874206543,
"learning_rate": 0.00014661508704061897,
"loss": 1.0378,
"num_input_tokens_seen": 20332000,
"step": 420,
"train_runtime": 2933.4328,
"train_tokens_per_second": 6931.129
},
{
"epoch": 0.2706525233044037,
"grad_norm": 0.2215918004512787,
"learning_rate": 0.00014648613797549968,
"loss": 1.0737,
"num_input_tokens_seen": 20383904,
"step": 421,
"train_runtime": 2941.1143,
"train_tokens_per_second": 6930.674
},
{
"epoch": 0.27129540340726455,
"grad_norm": 0.21484601497650146,
"learning_rate": 0.0001463571889103804,
"loss": 0.9174,
"num_input_tokens_seen": 20462464,
"step": 422,
"train_runtime": 2951.9415,
"train_tokens_per_second": 6931.866
},
{
"epoch": 0.2719382835101254,
"grad_norm": 0.24356883764266968,
"learning_rate": 0.00014622823984526112,
"loss": 1.0667,
"num_input_tokens_seen": 20516160,
"step": 423,
"train_runtime": 2959.3036,
"train_tokens_per_second": 6932.766
},
{
"epoch": 0.2725811636129862,
"grad_norm": 0.22561974823474884,
"learning_rate": 0.00014609929078014187,
"loss": 1.0216,
"num_input_tokens_seen": 20555504,
"step": 424,
"train_runtime": 2964.7521,
"train_tokens_per_second": 6933.296
},
{
"epoch": 0.273224043715847,
"grad_norm": 0.22649145126342773,
"learning_rate": 0.00014597034171502258,
"loss": 0.99,
"num_input_tokens_seen": 20635824,
"step": 425,
"train_runtime": 2975.8312,
"train_tokens_per_second": 6934.474
},
{
"epoch": 0.2738669238187078,
"grad_norm": 0.2253292202949524,
"learning_rate": 0.00014584139264990328,
"loss": 1.0371,
"num_input_tokens_seen": 20675360,
"step": 426,
"train_runtime": 2981.2815,
"train_tokens_per_second": 6935.058
},
{
"epoch": 0.27450980392156865,
"grad_norm": 0.21163207292556763,
"learning_rate": 0.00014571244358478402,
"loss": 0.9201,
"num_input_tokens_seen": 20721296,
"step": 427,
"train_runtime": 2987.6584,
"train_tokens_per_second": 6935.631
},
{
"epoch": 0.27515268402442944,
"grad_norm": 0.21027563512325287,
"learning_rate": 0.00014558349451966474,
"loss": 0.9869,
"num_input_tokens_seen": 20756176,
"step": 428,
"train_runtime": 2992.5875,
"train_tokens_per_second": 6935.863
},
{
"epoch": 0.2757955641272903,
"grad_norm": 0.2262483835220337,
"learning_rate": 0.00014545454545454546,
"loss": 0.9857,
"num_input_tokens_seen": 20795920,
"step": 429,
"train_runtime": 2998.1707,
"train_tokens_per_second": 6936.203
},
{
"epoch": 0.27643844423015107,
"grad_norm": 0.20631232857704163,
"learning_rate": 0.00014532559638942617,
"loss": 0.8497,
"num_input_tokens_seen": 20833296,
"step": 430,
"train_runtime": 3003.4181,
"train_tokens_per_second": 6936.529
},
{
"epoch": 0.2770813243330119,
"grad_norm": 0.20906981825828552,
"learning_rate": 0.00014519664732430692,
"loss": 0.9911,
"num_input_tokens_seen": 20881552,
"step": 431,
"train_runtime": 3010.1323,
"train_tokens_per_second": 6937.088
},
{
"epoch": 0.2777242044358727,
"grad_norm": 0.1900017410516739,
"learning_rate": 0.0001450676982591876,
"loss": 0.9406,
"num_input_tokens_seen": 20920416,
"step": 432,
"train_runtime": 3015.588,
"train_tokens_per_second": 6937.425
},
{
"epoch": 0.27836708453873354,
"grad_norm": 0.23332680761814117,
"learning_rate": 0.00014493874919406836,
"loss": 0.9818,
"num_input_tokens_seen": 20958432,
"step": 433,
"train_runtime": 3020.9117,
"train_tokens_per_second": 6937.784
},
{
"epoch": 0.27900996464159433,
"grad_norm": 0.20991705358028412,
"learning_rate": 0.00014480980012894907,
"loss": 0.9668,
"num_input_tokens_seen": 21000656,
"step": 434,
"train_runtime": 3026.8788,
"train_tokens_per_second": 6938.057
},
{
"epoch": 0.2796528447444552,
"grad_norm": 0.23032096028327942,
"learning_rate": 0.0001446808510638298,
"loss": 0.9968,
"num_input_tokens_seen": 21036128,
"step": 435,
"train_runtime": 3031.9131,
"train_tokens_per_second": 6938.236
},
{
"epoch": 0.28029572484731596,
"grad_norm": 0.20887252688407898,
"learning_rate": 0.0001445519019987105,
"loss": 0.928,
"num_input_tokens_seen": 21075744,
"step": 436,
"train_runtime": 3037.5307,
"train_tokens_per_second": 6938.446
},
{
"epoch": 0.2809386049501768,
"grad_norm": 0.22414767742156982,
"learning_rate": 0.00014442295293359126,
"loss": 0.9507,
"num_input_tokens_seen": 21130784,
"step": 437,
"train_runtime": 3045.287,
"train_tokens_per_second": 6938.848
},
{
"epoch": 0.2815814850530376,
"grad_norm": 0.22513002157211304,
"learning_rate": 0.00014429400386847197,
"loss": 1.0848,
"num_input_tokens_seen": 21180912,
"step": 438,
"train_runtime": 3052.2626,
"train_tokens_per_second": 6939.413
},
{
"epoch": 0.28222436515589844,
"grad_norm": 0.21031957864761353,
"learning_rate": 0.00014416505480335266,
"loss": 0.9672,
"num_input_tokens_seen": 21221936,
"step": 439,
"train_runtime": 3058.0003,
"train_tokens_per_second": 6939.808
},
{
"epoch": 0.2828672452587592,
"grad_norm": 0.2110009789466858,
"learning_rate": 0.0001440361057382334,
"loss": 0.9508,
"num_input_tokens_seen": 21256336,
"step": 440,
"train_runtime": 3062.9106,
"train_tokens_per_second": 6939.914
},
{
"epoch": 0.28351012536162007,
"grad_norm": 0.2163558304309845,
"learning_rate": 0.00014390715667311413,
"loss": 0.9935,
"num_input_tokens_seen": 21293856,
"step": 441,
"train_runtime": 3068.2246,
"train_tokens_per_second": 6940.123
},
{
"epoch": 0.28415300546448086,
"grad_norm": 0.2277555614709854,
"learning_rate": 0.00014377820760799485,
"loss": 0.9512,
"num_input_tokens_seen": 21326368,
"step": 442,
"train_runtime": 3072.8392,
"train_tokens_per_second": 6940.281
},
{
"epoch": 0.2847958855673417,
"grad_norm": 0.228995680809021,
"learning_rate": 0.00014364925854287556,
"loss": 0.9446,
"num_input_tokens_seen": 21373968,
"step": 443,
"train_runtime": 3079.4766,
"train_tokens_per_second": 6940.78
},
{
"epoch": 0.2854387656702025,
"grad_norm": 0.21971489489078522,
"learning_rate": 0.0001435203094777563,
"loss": 1.0327,
"num_input_tokens_seen": 21422752,
"step": 444,
"train_runtime": 3086.3349,
"train_tokens_per_second": 6941.162
},
{
"epoch": 0.28608164577306333,
"grad_norm": 0.22412551939487457,
"learning_rate": 0.000143391360412637,
"loss": 1.0243,
"num_input_tokens_seen": 21460832,
"step": 445,
"train_runtime": 3091.6768,
"train_tokens_per_second": 6941.486
},
{
"epoch": 0.2867245258759241,
"grad_norm": 0.23160946369171143,
"learning_rate": 0.00014326241134751775,
"loss": 1.0057,
"num_input_tokens_seen": 21503984,
"step": 446,
"train_runtime": 3097.7463,
"train_tokens_per_second": 6941.816
},
{
"epoch": 0.28736740597878496,
"grad_norm": 0.2109261304140091,
"learning_rate": 0.00014313346228239846,
"loss": 0.9851,
"num_input_tokens_seen": 21548880,
"step": 447,
"train_runtime": 3104.093,
"train_tokens_per_second": 6942.086
},
{
"epoch": 0.28801028608164575,
"grad_norm": 0.22187648713588715,
"learning_rate": 0.00014300451321727918,
"loss": 0.8728,
"num_input_tokens_seen": 21596320,
"step": 448,
"train_runtime": 3110.7629,
"train_tokens_per_second": 6942.451
},
{
"epoch": 0.2886531661845066,
"grad_norm": 0.23777811229228973,
"learning_rate": 0.0001428755641521599,
"loss": 1.1549,
"num_input_tokens_seen": 21641584,
"step": 449,
"train_runtime": 3117.1594,
"train_tokens_per_second": 6942.726
},
{
"epoch": 0.2892960462873674,
"grad_norm": 0.22787660360336304,
"learning_rate": 0.00014274661508704065,
"loss": 1.0658,
"num_input_tokens_seen": 21699088,
"step": 450,
"train_runtime": 3125.1717,
"train_tokens_per_second": 6943.327
},
{
"epoch": 0.2899389263902282,
"grad_norm": 0.23120397329330444,
"learning_rate": 0.00014261766602192134,
"loss": 1.0974,
"num_input_tokens_seen": 21743200,
"step": 451,
"train_runtime": 3131.8371,
"train_tokens_per_second": 6942.634
},
{
"epoch": 0.290581806493089,
"grad_norm": 0.20242908596992493,
"learning_rate": 0.00014248871695680205,
"loss": 0.853,
"num_input_tokens_seen": 21782304,
"step": 452,
"train_runtime": 3137.3582,
"train_tokens_per_second": 6942.881
},
{
"epoch": 0.29122468659594986,
"grad_norm": 0.20652198791503906,
"learning_rate": 0.0001423597678916828,
"loss": 0.9178,
"num_input_tokens_seen": 21833456,
"step": 453,
"train_runtime": 3144.5316,
"train_tokens_per_second": 6943.309
},
{
"epoch": 0.2918675666988107,
"grad_norm": 0.21495656669139862,
"learning_rate": 0.00014223081882656352,
"loss": 0.8723,
"num_input_tokens_seen": 21880688,
"step": 454,
"train_runtime": 3151.1193,
"train_tokens_per_second": 6943.783
},
{
"epoch": 0.2925104468016715,
"grad_norm": 0.20841602981090546,
"learning_rate": 0.00014210186976144424,
"loss": 0.9809,
"num_input_tokens_seen": 21929696,
"step": 455,
"train_runtime": 3158.045,
"train_tokens_per_second": 6944.073
},
{
"epoch": 0.29315332690453233,
"grad_norm": 0.2267104536294937,
"learning_rate": 0.00014197292069632495,
"loss": 1.0488,
"num_input_tokens_seen": 22003776,
"step": 456,
"train_runtime": 3168.4062,
"train_tokens_per_second": 6944.746
},
{
"epoch": 0.2937962070073931,
"grad_norm": 0.22157594561576843,
"learning_rate": 0.00014184397163120567,
"loss": 0.9029,
"num_input_tokens_seen": 22049024,
"step": 457,
"train_runtime": 3174.7818,
"train_tokens_per_second": 6945.052
},
{
"epoch": 0.29443908711025396,
"grad_norm": 0.21928298473358154,
"learning_rate": 0.0001417150225660864,
"loss": 0.9906,
"num_input_tokens_seen": 22092448,
"step": 458,
"train_runtime": 3180.8825,
"train_tokens_per_second": 6945.383
},
{
"epoch": 0.29508196721311475,
"grad_norm": 0.23455502092838287,
"learning_rate": 0.00014158607350096714,
"loss": 0.9531,
"num_input_tokens_seen": 22130688,
"step": 459,
"train_runtime": 3186.288,
"train_tokens_per_second": 6945.602
},
{
"epoch": 0.2957248473159756,
"grad_norm": 0.24930107593536377,
"learning_rate": 0.00014145712443584785,
"loss": 1.0249,
"num_input_tokens_seen": 22206608,
"step": 460,
"train_runtime": 3196.925,
"train_tokens_per_second": 6946.24
},
{
"epoch": 0.2963677274188364,
"grad_norm": 0.2500987648963928,
"learning_rate": 0.00014132817537072857,
"loss": 0.9792,
"num_input_tokens_seen": 22240000,
"step": 461,
"train_runtime": 3201.6743,
"train_tokens_per_second": 6946.366
},
{
"epoch": 0.2970106075216972,
"grad_norm": 0.2103571742773056,
"learning_rate": 0.0001411992263056093,
"loss": 0.9678,
"num_input_tokens_seen": 22294912,
"step": 462,
"train_runtime": 3209.4273,
"train_tokens_per_second": 6946.695
},
{
"epoch": 0.297653487624558,
"grad_norm": 0.21802906692028046,
"learning_rate": 0.00014107027724049004,
"loss": 1.0285,
"num_input_tokens_seen": 22332432,
"step": 463,
"train_runtime": 3214.7693,
"train_tokens_per_second": 6946.823
},
{
"epoch": 0.29829636772741885,
"grad_norm": 0.2042447030544281,
"learning_rate": 0.00014094132817537073,
"loss": 0.9883,
"num_input_tokens_seen": 22366544,
"step": 464,
"train_runtime": 3219.6424,
"train_tokens_per_second": 6946.903
},
{
"epoch": 0.29893924783027964,
"grad_norm": 0.2040151059627533,
"learning_rate": 0.00014081237911025144,
"loss": 0.9602,
"num_input_tokens_seen": 22401552,
"step": 465,
"train_runtime": 3224.6289,
"train_tokens_per_second": 6947.017
},
{
"epoch": 0.2995821279331405,
"grad_norm": 0.2195388823747635,
"learning_rate": 0.0001406834300451322,
"loss": 1.0522,
"num_input_tokens_seen": 22472880,
"step": 466,
"train_runtime": 3234.6144,
"train_tokens_per_second": 6947.623
},
{
"epoch": 0.3002250080360013,
"grad_norm": 0.2215881049633026,
"learning_rate": 0.00014055448098001288,
"loss": 0.9738,
"num_input_tokens_seen": 22532464,
"step": 467,
"train_runtime": 3243.0088,
"train_tokens_per_second": 6948.012
},
{
"epoch": 0.3008678881388621,
"grad_norm": 0.2088415026664734,
"learning_rate": 0.00014042553191489363,
"loss": 1.0041,
"num_input_tokens_seen": 22579504,
"step": 468,
"train_runtime": 3249.5829,
"train_tokens_per_second": 6948.431
},
{
"epoch": 0.3008678881388621,
"eval_loss": 1.0304499864578247,
"eval_runtime": 40.087,
"eval_samples_per_second": 24.796,
"eval_steps_per_second": 1.572,
"num_input_tokens_seen": 22579504,
"step": 468
},
{
"epoch": 0.3015107682417229,
"grad_norm": 0.22007477283477783,
"learning_rate": 0.00014029658284977434,
"loss": 0.8784,
"num_input_tokens_seen": 22638304,
"step": 469,
"train_runtime": 3297.9748,
"train_tokens_per_second": 6864.305
},
{
"epoch": 0.30215364834458375,
"grad_norm": 0.21239815652370453,
"learning_rate": 0.00014016763378465506,
"loss": 1.0087,
"num_input_tokens_seen": 22720144,
"step": 470,
"train_runtime": 3309.4305,
"train_tokens_per_second": 6865.273
},
{
"epoch": 0.30279652844744454,
"grad_norm": 0.21392999589443207,
"learning_rate": 0.00014003868471953578,
"loss": 0.9459,
"num_input_tokens_seen": 22758576,
"step": 471,
"train_runtime": 3314.8836,
"train_tokens_per_second": 6865.573
},
{
"epoch": 0.3034394085503054,
"grad_norm": 0.24180610477924347,
"learning_rate": 0.00013990973565441653,
"loss": 0.9437,
"num_input_tokens_seen": 22814256,
"step": 472,
"train_runtime": 3322.696,
"train_tokens_per_second": 6866.188
},
{
"epoch": 0.30408228865316617,
"grad_norm": 0.22510194778442383,
"learning_rate": 0.00013978078658929722,
"loss": 0.9329,
"num_input_tokens_seen": 22866640,
"step": 473,
"train_runtime": 3330.041,
"train_tokens_per_second": 6866.774
},
{
"epoch": 0.304725168756027,
"grad_norm": 0.2063971608877182,
"learning_rate": 0.00013965183752417796,
"loss": 0.9578,
"num_input_tokens_seen": 22902608,
"step": 474,
"train_runtime": 3335.1437,
"train_tokens_per_second": 6867.053
},
{
"epoch": 0.3053680488588878,
"grad_norm": 0.22402247786521912,
"learning_rate": 0.00013952288845905868,
"loss": 1.0159,
"num_input_tokens_seen": 22968496,
"step": 475,
"train_runtime": 3344.4383,
"train_tokens_per_second": 6867.669
},
{
"epoch": 0.30601092896174864,
"grad_norm": 0.24827386438846588,
"learning_rate": 0.0001393939393939394,
"loss": 0.987,
"num_input_tokens_seen": 22997648,
"step": 476,
"train_runtime": 3348.5796,
"train_tokens_per_second": 6867.882
},
{
"epoch": 0.30665380906460943,
"grad_norm": 0.21244807541370392,
"learning_rate": 0.00013926499032882012,
"loss": 1.0285,
"num_input_tokens_seen": 23042048,
"step": 477,
"train_runtime": 3354.8491,
"train_tokens_per_second": 6868.281
},
{
"epoch": 0.30729668916747027,
"grad_norm": 0.23184971511363983,
"learning_rate": 0.00013913604126370086,
"loss": 1.1143,
"num_input_tokens_seen": 23084368,
"step": 478,
"train_runtime": 3360.8138,
"train_tokens_per_second": 6868.684
},
{
"epoch": 0.30793956927033106,
"grad_norm": 0.23399090766906738,
"learning_rate": 0.00013900709219858158,
"loss": 1.0699,
"num_input_tokens_seen": 23129632,
"step": 479,
"train_runtime": 3367.1699,
"train_tokens_per_second": 6869.161
},
{
"epoch": 0.3085824493731919,
"grad_norm": 0.2339830994606018,
"learning_rate": 0.00013887814313346227,
"loss": 0.9267,
"num_input_tokens_seen": 23166080,
"step": 480,
"train_runtime": 3372.3301,
"train_tokens_per_second": 6869.458
},
{
"epoch": 0.3092253294760527,
"grad_norm": 0.21304185688495636,
"learning_rate": 0.00013874919406834302,
"loss": 1.0969,
"num_input_tokens_seen": 23205632,
"step": 481,
"train_runtime": 3378.4889,
"train_tokens_per_second": 6868.642
},
{
"epoch": 0.30986820957891353,
"grad_norm": 0.21676377952098846,
"learning_rate": 0.00013862024500322373,
"loss": 1.054,
"num_input_tokens_seen": 23263680,
"step": 482,
"train_runtime": 3386.5884,
"train_tokens_per_second": 6869.356
},
{
"epoch": 0.3105110896817743,
"grad_norm": 0.20853395760059357,
"learning_rate": 0.00013849129593810445,
"loss": 0.9668,
"num_input_tokens_seen": 23314128,
"step": 483,
"train_runtime": 3393.6327,
"train_tokens_per_second": 6869.962
},
{
"epoch": 0.31115396978463516,
"grad_norm": 0.20457607507705688,
"learning_rate": 0.00013836234687298517,
"loss": 1.1696,
"num_input_tokens_seen": 23372528,
"step": 484,
"train_runtime": 3401.8284,
"train_tokens_per_second": 6870.578
},
{
"epoch": 0.311796849887496,
"grad_norm": 0.2261870801448822,
"learning_rate": 0.00013823339780786592,
"loss": 1.0568,
"num_input_tokens_seen": 23415520,
"step": 485,
"train_runtime": 3407.7745,
"train_tokens_per_second": 6871.206
},
{
"epoch": 0.3124397299903568,
"grad_norm": 0.2235896736383438,
"learning_rate": 0.0001381044487427466,
"loss": 0.9828,
"num_input_tokens_seen": 23469776,
"step": 486,
"train_runtime": 3415.3123,
"train_tokens_per_second": 6871.927
},
{
"epoch": 0.31308261009321764,
"grad_norm": 0.20803005993366241,
"learning_rate": 0.00013797549967762735,
"loss": 0.9982,
"num_input_tokens_seen": 23524704,
"step": 487,
"train_runtime": 3422.985,
"train_tokens_per_second": 6872.57
},
{
"epoch": 0.3137254901960784,
"grad_norm": 0.21710795164108276,
"learning_rate": 0.00013784655061250807,
"loss": 1.0199,
"num_input_tokens_seen": 23574352,
"step": 488,
"train_runtime": 3429.8894,
"train_tokens_per_second": 6873.211
},
{
"epoch": 0.31436837029893927,
"grad_norm": 0.20312581956386566,
"learning_rate": 0.0001377176015473888,
"loss": 0.8987,
"num_input_tokens_seen": 23627760,
"step": 489,
"train_runtime": 3437.2668,
"train_tokens_per_second": 6873.997
},
{
"epoch": 0.31501125040180006,
"grad_norm": 0.20755556225776672,
"learning_rate": 0.0001375886524822695,
"loss": 0.9631,
"num_input_tokens_seen": 23663664,
"step": 490,
"train_runtime": 3442.3155,
"train_tokens_per_second": 6874.345
},
{
"epoch": 0.3156541305046609,
"grad_norm": 0.23552921414375305,
"learning_rate": 0.00013745970341715025,
"loss": 1.0089,
"num_input_tokens_seen": 23715280,
"step": 491,
"train_runtime": 3449.4922,
"train_tokens_per_second": 6875.006
},
{
"epoch": 0.3162970106075217,
"grad_norm": 0.22361139953136444,
"learning_rate": 0.00013733075435203094,
"loss": 1.0316,
"num_input_tokens_seen": 23755296,
"step": 492,
"train_runtime": 3455.0373,
"train_tokens_per_second": 6875.554
},
{
"epoch": 0.31693989071038253,
"grad_norm": 0.22092361748218536,
"learning_rate": 0.00013720180528691166,
"loss": 0.9885,
"num_input_tokens_seen": 23809776,
"step": 493,
"train_runtime": 3462.606,
"train_tokens_per_second": 6876.259
},
{
"epoch": 0.3175827708132433,
"grad_norm": 0.2110934853553772,
"learning_rate": 0.0001370728562217924,
"loss": 0.9728,
"num_input_tokens_seen": 23846256,
"step": 494,
"train_runtime": 3467.7687,
"train_tokens_per_second": 6876.542
},
{
"epoch": 0.31822565091610416,
"grad_norm": 0.22661617398262024,
"learning_rate": 0.00013694390715667312,
"loss": 0.9672,
"num_input_tokens_seen": 23881296,
"step": 495,
"train_runtime": 3472.6479,
"train_tokens_per_second": 6876.97
},
{
"epoch": 0.31886853101896495,
"grad_norm": 0.21662630140781403,
"learning_rate": 0.00013681495809155384,
"loss": 1.0207,
"num_input_tokens_seen": 23922768,
"step": 496,
"train_runtime": 3478.4065,
"train_tokens_per_second": 6877.508
},
{
"epoch": 0.3195114111218258,
"grad_norm": 0.21633575856685638,
"learning_rate": 0.00013668600902643456,
"loss": 0.9655,
"num_input_tokens_seen": 23968688,
"step": 497,
"train_runtime": 3484.7432,
"train_tokens_per_second": 6878.179
},
{
"epoch": 0.3201542912246866,
"grad_norm": 0.22479382157325745,
"learning_rate": 0.0001365570599613153,
"loss": 1.0251,
"num_input_tokens_seen": 24019088,
"step": 498,
"train_runtime": 3491.7117,
"train_tokens_per_second": 6878.886
},
{
"epoch": 0.3207971713275474,
"grad_norm": 0.23307350277900696,
"learning_rate": 0.000136428110896196,
"loss": 1.005,
"num_input_tokens_seen": 24097408,
"step": 499,
"train_runtime": 3502.5666,
"train_tokens_per_second": 6879.929
},
{
"epoch": 0.3214400514304082,
"grad_norm": 0.23394767940044403,
"learning_rate": 0.00013629916183107674,
"loss": 0.9901,
"num_input_tokens_seen": 24135088,
"step": 500,
"train_runtime": 3507.8283,
"train_tokens_per_second": 6880.35
},
{
"epoch": 0.32208293153326906,
"grad_norm": 0.21206118166446686,
"learning_rate": 0.00013617021276595746,
"loss": 1.0684,
"num_input_tokens_seen": 24179280,
"step": 501,
"train_runtime": 3513.9813,
"train_tokens_per_second": 6880.879
},
{
"epoch": 0.32272581163612984,
"grad_norm": 0.21079224348068237,
"learning_rate": 0.00013604126370083818,
"loss": 0.9874,
"num_input_tokens_seen": 24220336,
"step": 502,
"train_runtime": 3519.7213,
"train_tokens_per_second": 6881.322
},
{
"epoch": 0.3233686917389907,
"grad_norm": 0.20273390412330627,
"learning_rate": 0.0001359123146357189,
"loss": 1.0484,
"num_input_tokens_seen": 24262736,
"step": 503,
"train_runtime": 3525.6356,
"train_tokens_per_second": 6881.805
},
{
"epoch": 0.3240115718418515,
"grad_norm": 0.20427271723747253,
"learning_rate": 0.00013578336557059964,
"loss": 0.9679,
"num_input_tokens_seen": 24308064,
"step": 504,
"train_runtime": 3531.8857,
"train_tokens_per_second": 6882.461
},
{
"epoch": 0.3246544519447123,
"grad_norm": 0.2109527736902237,
"learning_rate": 0.00013565441650548033,
"loss": 0.9445,
"num_input_tokens_seen": 24345008,
"step": 505,
"train_runtime": 3537.0403,
"train_tokens_per_second": 6882.875
},
{
"epoch": 0.3252973320475731,
"grad_norm": 0.2220373898744583,
"learning_rate": 0.00013552546744036105,
"loss": 1.0339,
"num_input_tokens_seen": 24382368,
"step": 506,
"train_runtime": 3542.2658,
"train_tokens_per_second": 6883.269
},
{
"epoch": 0.32594021215043395,
"grad_norm": 0.21177394688129425,
"learning_rate": 0.0001353965183752418,
"loss": 1.0558,
"num_input_tokens_seen": 24424272,
"step": 507,
"train_runtime": 3548.0552,
"train_tokens_per_second": 6883.848
},
{
"epoch": 0.32658309225329474,
"grad_norm": 0.2130356878042221,
"learning_rate": 0.0001352675693101225,
"loss": 0.9415,
"num_input_tokens_seen": 24497040,
"step": 508,
"train_runtime": 3558.1332,
"train_tokens_per_second": 6884.801
},
{
"epoch": 0.3272259723561556,
"grad_norm": 0.21283923089504242,
"learning_rate": 0.00013513862024500323,
"loss": 1.0213,
"num_input_tokens_seen": 24538912,
"step": 509,
"train_runtime": 3563.9332,
"train_tokens_per_second": 6885.346
},
{
"epoch": 0.32786885245901637,
"grad_norm": 0.23125970363616943,
"learning_rate": 0.00013500967117988395,
"loss": 1.0807,
"num_input_tokens_seen": 24586896,
"step": 510,
"train_runtime": 3570.5716,
"train_tokens_per_second": 6885.983
},
{
"epoch": 0.3285117325618772,
"grad_norm": 0.20956462621688843,
"learning_rate": 0.00013488072211476467,
"loss": 0.9554,
"num_input_tokens_seen": 24636288,
"step": 511,
"train_runtime": 3577.9296,
"train_tokens_per_second": 6885.627
},
{
"epoch": 0.329154612664738,
"grad_norm": 0.20466941595077515,
"learning_rate": 0.00013475177304964539,
"loss": 0.9407,
"num_input_tokens_seen": 24700208,
"step": 512,
"train_runtime": 3586.7348,
"train_tokens_per_second": 6886.544
},
{
"epoch": 0.32979749276759884,
"grad_norm": 0.21156948804855347,
"learning_rate": 0.00013462282398452613,
"loss": 1.0416,
"num_input_tokens_seen": 24767520,
"step": 513,
"train_runtime": 3596.058,
"train_tokens_per_second": 6887.408
},
{
"epoch": 0.3304403728704597,
"grad_norm": 0.21754856407642365,
"learning_rate": 0.00013449387491940685,
"loss": 0.9787,
"num_input_tokens_seen": 24809824,
"step": 514,
"train_runtime": 3601.8511,
"train_tokens_per_second": 6888.076
},
{
"epoch": 0.3310832529733205,
"grad_norm": 0.20795920491218567,
"learning_rate": 0.00013436492585428757,
"loss": 0.8816,
"num_input_tokens_seen": 24859872,
"step": 515,
"train_runtime": 3608.7952,
"train_tokens_per_second": 6888.69
},
{
"epoch": 0.3317261330761813,
"grad_norm": 0.22304174304008484,
"learning_rate": 0.00013423597678916829,
"loss": 0.9804,
"num_input_tokens_seen": 24893568,
"step": 516,
"train_runtime": 3613.4725,
"train_tokens_per_second": 6889.099
},
{
"epoch": 0.3323690131790421,
"grad_norm": 0.22424030303955078,
"learning_rate": 0.000134107027724049,
"loss": 1.058,
"num_input_tokens_seen": 24947216,
"step": 517,
"train_runtime": 3620.8973,
"train_tokens_per_second": 6889.788
},
{
"epoch": 0.33301189328190295,
"grad_norm": 0.2329922467470169,
"learning_rate": 0.00013397807865892972,
"loss": 0.9558,
"num_input_tokens_seen": 25002624,
"step": 518,
"train_runtime": 3628.6094,
"train_tokens_per_second": 6890.415
},
{
"epoch": 0.33365477338476374,
"grad_norm": 0.2094709426164627,
"learning_rate": 0.00013384912959381044,
"loss": 1.1208,
"num_input_tokens_seen": 25052704,
"step": 519,
"train_runtime": 3635.5352,
"train_tokens_per_second": 6891.064
},
{
"epoch": 0.3342976534876246,
"grad_norm": 0.2430083155632019,
"learning_rate": 0.00013372018052869119,
"loss": 1.0242,
"num_input_tokens_seen": 25096752,
"step": 520,
"train_runtime": 3641.648,
"train_tokens_per_second": 6891.592
},
{
"epoch": 0.33494053359048537,
"grad_norm": 0.22180068492889404,
"learning_rate": 0.00013359123146357188,
"loss": 0.9733,
"num_input_tokens_seen": 25143664,
"step": 521,
"train_runtime": 3648.0565,
"train_tokens_per_second": 6892.345
},
{
"epoch": 0.3355834136933462,
"grad_norm": 0.2066153585910797,
"learning_rate": 0.00013346228239845262,
"loss": 0.9317,
"num_input_tokens_seen": 25205920,
"step": 522,
"train_runtime": 3656.7402,
"train_tokens_per_second": 6893.003
},
{
"epoch": 0.336226293796207,
"grad_norm": 0.24886547029018402,
"learning_rate": 0.00013333333333333334,
"loss": 1.0372,
"num_input_tokens_seen": 25243200,
"step": 523,
"train_runtime": 3661.941,
"train_tokens_per_second": 6893.393
},
{
"epoch": 0.33686917389906784,
"grad_norm": 0.21790605783462524,
"learning_rate": 0.00013320438426821406,
"loss": 0.9581,
"num_input_tokens_seen": 25303376,
"step": 524,
"train_runtime": 3670.3457,
"train_tokens_per_second": 6894.004
},
{
"epoch": 0.33751205400192863,
"grad_norm": 0.2200934737920761,
"learning_rate": 0.00013307543520309478,
"loss": 0.9435,
"num_input_tokens_seen": 25353728,
"step": 525,
"train_runtime": 3677.2854,
"train_tokens_per_second": 6894.686
},
{
"epoch": 0.3381549341047895,
"grad_norm": 0.20982544124126434,
"learning_rate": 0.00013294648613797552,
"loss": 0.9352,
"num_input_tokens_seen": 25394720,
"step": 526,
"train_runtime": 3682.9962,
"train_tokens_per_second": 6895.125
},
{
"epoch": 0.33879781420765026,
"grad_norm": 0.22811082005500793,
"learning_rate": 0.0001328175370728562,
"loss": 1.0701,
"num_input_tokens_seen": 25434592,
"step": 527,
"train_runtime": 3688.5184,
"train_tokens_per_second": 6895.612
},
{
"epoch": 0.3394406943105111,
"grad_norm": 0.2045535147190094,
"learning_rate": 0.00013268858800773696,
"loss": 1.0568,
"num_input_tokens_seen": 25479168,
"step": 528,
"train_runtime": 3694.6898,
"train_tokens_per_second": 6896.159
},
{
"epoch": 0.3400835744133719,
"grad_norm": 0.22363616526126862,
"learning_rate": 0.00013255963894261768,
"loss": 1.0645,
"num_input_tokens_seen": 25542432,
"step": 529,
"train_runtime": 3703.4384,
"train_tokens_per_second": 6896.951
},
{
"epoch": 0.34072645451623274,
"grad_norm": 0.21083000302314758,
"learning_rate": 0.0001324306898774984,
"loss": 0.8455,
"num_input_tokens_seen": 25583328,
"step": 530,
"train_runtime": 3709.103,
"train_tokens_per_second": 6897.443
},
{
"epoch": 0.3413693346190935,
"grad_norm": 0.2215147763490677,
"learning_rate": 0.0001323017408123791,
"loss": 1.0028,
"num_input_tokens_seen": 25624320,
"step": 531,
"train_runtime": 3714.8407,
"train_tokens_per_second": 6897.825
},
{
"epoch": 0.34201221472195437,
"grad_norm": 0.2467392385005951,
"learning_rate": 0.00013217279174725983,
"loss": 0.9723,
"num_input_tokens_seen": 25682048,
"step": 532,
"train_runtime": 3722.9065,
"train_tokens_per_second": 6898.386
},
{
"epoch": 0.34265509482481515,
"grad_norm": 0.24092997610569,
"learning_rate": 0.00013204384268214058,
"loss": 0.8117,
"num_input_tokens_seen": 25724176,
"step": 533,
"train_runtime": 3728.829,
"train_tokens_per_second": 6898.728
},
{
"epoch": 0.343297974927676,
"grad_norm": 0.22751258313655853,
"learning_rate": 0.00013191489361702127,
"loss": 0.9201,
"num_input_tokens_seen": 25770528,
"step": 534,
"train_runtime": 3735.3326,
"train_tokens_per_second": 6899.125
},
{
"epoch": 0.3439408550305368,
"grad_norm": 0.2548338770866394,
"learning_rate": 0.000131785944551902,
"loss": 1.087,
"num_input_tokens_seen": 25820896,
"step": 535,
"train_runtime": 3742.4211,
"train_tokens_per_second": 6899.516
},
{
"epoch": 0.34458373513339763,
"grad_norm": 0.2448054552078247,
"learning_rate": 0.00013165699548678273,
"loss": 0.9634,
"num_input_tokens_seen": 25859488,
"step": 536,
"train_runtime": 3747.8476,
"train_tokens_per_second": 6899.824
},
{
"epoch": 0.3452266152362584,
"grad_norm": 0.22934119403362274,
"learning_rate": 0.00013152804642166345,
"loss": 1.0141,
"num_input_tokens_seen": 25909280,
"step": 537,
"train_runtime": 3754.7496,
"train_tokens_per_second": 6900.402
},
{
"epoch": 0.34586949533911926,
"grad_norm": 0.24733909964561462,
"learning_rate": 0.00013139909735654417,
"loss": 1.0,
"num_input_tokens_seen": 25953088,
"step": 538,
"train_runtime": 3760.8823,
"train_tokens_per_second": 6900.798
},
{
"epoch": 0.34651237544198005,
"grad_norm": 0.23463451862335205,
"learning_rate": 0.0001312701482914249,
"loss": 0.9776,
"num_input_tokens_seen": 26013008,
"step": 539,
"train_runtime": 3769.2386,
"train_tokens_per_second": 6901.396
},
{
"epoch": 0.3471552555448409,
"grad_norm": 0.2205786406993866,
"learning_rate": 0.0001311411992263056,
"loss": 0.9417,
"num_input_tokens_seen": 26060880,
"step": 540,
"train_runtime": 3775.9441,
"train_tokens_per_second": 6901.818
},
{
"epoch": 0.3477981356477017,
"grad_norm": 0.24714644253253937,
"learning_rate": 0.00013101225016118635,
"loss": 1.079,
"num_input_tokens_seen": 26099840,
"step": 541,
"train_runtime": 3781.9194,
"train_tokens_per_second": 6901.215
},
{
"epoch": 0.3484410157505625,
"grad_norm": 0.21026214957237244,
"learning_rate": 0.00013088330109606707,
"loss": 0.9243,
"num_input_tokens_seen": 26132576,
"step": 542,
"train_runtime": 3786.5674,
"train_tokens_per_second": 6901.389
},
{
"epoch": 0.3490838958534233,
"grad_norm": 0.21683214604854584,
"learning_rate": 0.00013075435203094778,
"loss": 1.0338,
"num_input_tokens_seen": 26188816,
"step": 543,
"train_runtime": 3794.4579,
"train_tokens_per_second": 6901.86
},
{
"epoch": 0.34972677595628415,
"grad_norm": 0.23099243640899658,
"learning_rate": 0.0001306254029658285,
"loss": 0.9737,
"num_input_tokens_seen": 26243056,
"step": 544,
"train_runtime": 3802.0591,
"train_tokens_per_second": 6902.327
},
{
"epoch": 0.350369656059145,
"grad_norm": 0.22725285589694977,
"learning_rate": 0.00013049645390070925,
"loss": 0.959,
"num_input_tokens_seen": 26294640,
"step": 545,
"train_runtime": 3809.2339,
"train_tokens_per_second": 6902.868
},
{
"epoch": 0.3510125361620058,
"grad_norm": 0.2573927342891693,
"learning_rate": 0.00013036750483558994,
"loss": 0.9467,
"num_input_tokens_seen": 26336240,
"step": 546,
"train_runtime": 3815.0662,
"train_tokens_per_second": 6903.22
},
{
"epoch": 0.3516554162648666,
"grad_norm": 0.22747130692005157,
"learning_rate": 0.00013023855577047066,
"loss": 0.9114,
"num_input_tokens_seen": 26387344,
"step": 547,
"train_runtime": 3822.2615,
"train_tokens_per_second": 6903.595
},
{
"epoch": 0.3522982963677274,
"grad_norm": 0.22548294067382812,
"learning_rate": 0.0001301096067053514,
"loss": 0.9211,
"num_input_tokens_seen": 26430704,
"step": 548,
"train_runtime": 3828.3276,
"train_tokens_per_second": 6903.982
},
{
"epoch": 0.35294117647058826,
"grad_norm": 0.21985627710819244,
"learning_rate": 0.00012998065764023212,
"loss": 1.0221,
"num_input_tokens_seen": 26490432,
"step": 549,
"train_runtime": 3836.6822,
"train_tokens_per_second": 6904.516
},
{
"epoch": 0.35358405657344905,
"grad_norm": 0.21374687552452087,
"learning_rate": 0.00012985170857511284,
"loss": 1.0297,
"num_input_tokens_seen": 26535888,
"step": 550,
"train_runtime": 3843.0736,
"train_tokens_per_second": 6904.861
},
{
"epoch": 0.3542269366763099,
"grad_norm": 0.243165522813797,
"learning_rate": 0.00012972275950999356,
"loss": 1.1353,
"num_input_tokens_seen": 26566720,
"step": 551,
"train_runtime": 3847.4679,
"train_tokens_per_second": 6904.988
},
{
"epoch": 0.3548698167791707,
"grad_norm": 0.24455544352531433,
"learning_rate": 0.00012959381044487427,
"loss": 1.0217,
"num_input_tokens_seen": 26606912,
"step": 552,
"train_runtime": 3853.1324,
"train_tokens_per_second": 6905.268
},
{
"epoch": 0.3555126968820315,
"grad_norm": 0.22101067006587982,
"learning_rate": 0.000129464861379755,
"loss": 0.9031,
"num_input_tokens_seen": 26642352,
"step": 553,
"train_runtime": 3858.1639,
"train_tokens_per_second": 6905.448
},
{
"epoch": 0.3561555769848923,
"grad_norm": 0.20512044429779053,
"learning_rate": 0.00012933591231463574,
"loss": 1.0668,
"num_input_tokens_seen": 26681264,
"step": 554,
"train_runtime": 3863.6705,
"train_tokens_per_second": 6905.678
},
{
"epoch": 0.35679845708775315,
"grad_norm": 0.2276490330696106,
"learning_rate": 0.00012920696324951646,
"loss": 1.0823,
"num_input_tokens_seen": 26730576,
"step": 555,
"train_runtime": 3870.5592,
"train_tokens_per_second": 6906.128
},
{
"epoch": 0.35744133719061394,
"grad_norm": 0.23173771798610687,
"learning_rate": 0.00012907801418439717,
"loss": 1.0071,
"num_input_tokens_seen": 26781632,
"step": 556,
"train_runtime": 3877.726,
"train_tokens_per_second": 6906.53
},
{
"epoch": 0.3580842172934748,
"grad_norm": 0.21714136004447937,
"learning_rate": 0.0001289490651192779,
"loss": 0.9671,
"num_input_tokens_seen": 26844144,
"step": 557,
"train_runtime": 3886.4338,
"train_tokens_per_second": 6907.14
},
{
"epoch": 0.35872709739633557,
"grad_norm": 0.2281978577375412,
"learning_rate": 0.00012882011605415864,
"loss": 0.8735,
"num_input_tokens_seen": 26882384,
"step": 558,
"train_runtime": 3891.8083,
"train_tokens_per_second": 6907.428
},
{
"epoch": 0.3593699774991964,
"grad_norm": 0.2230071723461151,
"learning_rate": 0.00012869116698903933,
"loss": 1.1621,
"num_input_tokens_seen": 26924112,
"step": 559,
"train_runtime": 3897.6836,
"train_tokens_per_second": 6907.721
},
{
"epoch": 0.3600128576020572,
"grad_norm": 0.21923069655895233,
"learning_rate": 0.00012856221792392005,
"loss": 1.0041,
"num_input_tokens_seen": 26954864,
"step": 560,
"train_runtime": 3902.0753,
"train_tokens_per_second": 6907.828
},
{
"epoch": 0.36065573770491804,
"grad_norm": 0.21977007389068604,
"learning_rate": 0.0001284332688588008,
"loss": 0.9363,
"num_input_tokens_seen": 27009328,
"step": 561,
"train_runtime": 3909.7824,
"train_tokens_per_second": 6908.141
},
{
"epoch": 0.36129861780777883,
"grad_norm": 0.2261383831501007,
"learning_rate": 0.00012830431979368148,
"loss": 0.9468,
"num_input_tokens_seen": 27050640,
"step": 562,
"train_runtime": 3915.6115,
"train_tokens_per_second": 6908.408
},
{
"epoch": 0.3619414979106397,
"grad_norm": 0.22950001060962677,
"learning_rate": 0.00012817537072856223,
"loss": 0.9635,
"num_input_tokens_seen": 27107952,
"step": 563,
"train_runtime": 3923.6042,
"train_tokens_per_second": 6908.942
},
{
"epoch": 0.36258437801350046,
"grad_norm": 0.20494036376476288,
"learning_rate": 0.00012804642166344295,
"loss": 0.9518,
"num_input_tokens_seen": 27149680,
"step": 564,
"train_runtime": 3929.5027,
"train_tokens_per_second": 6909.19
},
{
"epoch": 0.3632272581163613,
"grad_norm": 0.2079777717590332,
"learning_rate": 0.00012791747259832366,
"loss": 0.9171,
"num_input_tokens_seen": 27204672,
"step": 565,
"train_runtime": 3937.259,
"train_tokens_per_second": 6909.546
},
{
"epoch": 0.3638701382192221,
"grad_norm": 0.22996214032173157,
"learning_rate": 0.00012778852353320438,
"loss": 1.1146,
"num_input_tokens_seen": 27257552,
"step": 566,
"train_runtime": 3944.6632,
"train_tokens_per_second": 6909.982
},
{
"epoch": 0.36451301832208294,
"grad_norm": 0.22713743150234222,
"learning_rate": 0.00012765957446808513,
"loss": 0.9419,
"num_input_tokens_seen": 27297616,
"step": 567,
"train_runtime": 3950.3514,
"train_tokens_per_second": 6910.174
},
{
"epoch": 0.3651558984249437,
"grad_norm": 0.22290444374084473,
"learning_rate": 0.00012753062540296582,
"loss": 0.9696,
"num_input_tokens_seen": 27354432,
"step": 568,
"train_runtime": 3958.3118,
"train_tokens_per_second": 6910.631
},
{
"epoch": 0.36579877852780457,
"grad_norm": 0.2305925339460373,
"learning_rate": 0.00012740167633784656,
"loss": 0.9383,
"num_input_tokens_seen": 27388640,
"step": 569,
"train_runtime": 3963.1821,
"train_tokens_per_second": 6910.77
},
{
"epoch": 0.36644165863066536,
"grad_norm": 0.2095453143119812,
"learning_rate": 0.00012727272727272728,
"loss": 0.9092,
"num_input_tokens_seen": 27426656,
"step": 570,
"train_runtime": 3968.5432,
"train_tokens_per_second": 6911.014
},
{
"epoch": 0.3670845387335262,
"grad_norm": 0.2165188491344452,
"learning_rate": 0.000127143778207608,
"loss": 0.86,
"num_input_tokens_seen": 27469616,
"step": 571,
"train_runtime": 3975.127,
"train_tokens_per_second": 6910.374
},
{
"epoch": 0.367727418836387,
"grad_norm": 0.21359601616859436,
"learning_rate": 0.00012701482914248872,
"loss": 0.9545,
"num_input_tokens_seen": 27509728,
"step": 572,
"train_runtime": 3980.7541,
"train_tokens_per_second": 6910.683
},
{
"epoch": 0.36837029893924783,
"grad_norm": 0.21762266755104065,
"learning_rate": 0.00012688588007736944,
"loss": 1.1062,
"num_input_tokens_seen": 27559888,
"step": 573,
"train_runtime": 3987.8327,
"train_tokens_per_second": 6910.994
},
{
"epoch": 0.3690131790421087,
"grad_norm": 0.22264431416988373,
"learning_rate": 0.00012675693101225018,
"loss": 0.939,
"num_input_tokens_seen": 27619392,
"step": 574,
"train_runtime": 3996.2479,
"train_tokens_per_second": 6911.331
},
{
"epoch": 0.36965605914496946,
"grad_norm": 0.21523094177246094,
"learning_rate": 0.00012662798194713087,
"loss": 1.0106,
"num_input_tokens_seen": 27660256,
"step": 575,
"train_runtime": 4001.9951,
"train_tokens_per_second": 6911.617
},
{
"epoch": 0.3702989392478303,
"grad_norm": 0.20433154702186584,
"learning_rate": 0.00012649903288201162,
"loss": 0.8952,
"num_input_tokens_seen": 27711360,
"step": 576,
"train_runtime": 4009.176,
"train_tokens_per_second": 6911.984
},
{
"epoch": 0.3709418193506911,
"grad_norm": 0.21504226326942444,
"learning_rate": 0.00012637008381689234,
"loss": 0.9748,
"num_input_tokens_seen": 27785872,
"step": 577,
"train_runtime": 4019.6649,
"train_tokens_per_second": 6912.485
},
{
"epoch": 0.37158469945355194,
"grad_norm": 0.22260011732578278,
"learning_rate": 0.00012624113475177305,
"loss": 1.0449,
"num_input_tokens_seen": 27831328,
"step": 578,
"train_runtime": 4026.0195,
"train_tokens_per_second": 6912.865
},
{
"epoch": 0.3722275795564127,
"grad_norm": 0.21825265884399414,
"learning_rate": 0.00012611218568665377,
"loss": 0.8929,
"num_input_tokens_seen": 27858000,
"step": 579,
"train_runtime": 4029.8615,
"train_tokens_per_second": 6912.893
},
{
"epoch": 0.37287045965927357,
"grad_norm": 0.21789203584194183,
"learning_rate": 0.00012598323662153452,
"loss": 1.1042,
"num_input_tokens_seen": 27905360,
"step": 580,
"train_runtime": 4036.5269,
"train_tokens_per_second": 6913.21
},
{
"epoch": 0.37351333976213436,
"grad_norm": 0.2369895726442337,
"learning_rate": 0.0001258542875564152,
"loss": 0.9221,
"num_input_tokens_seen": 27939744,
"step": 581,
"train_runtime": 4041.3997,
"train_tokens_per_second": 6913.383
},
{
"epoch": 0.3741562198649952,
"grad_norm": 0.21872176229953766,
"learning_rate": 0.00012572533849129595,
"loss": 1.0185,
"num_input_tokens_seen": 27982016,
"step": 582,
"train_runtime": 4047.3382,
"train_tokens_per_second": 6913.684
},
{
"epoch": 0.374799099967856,
"grad_norm": 0.22556743025779724,
"learning_rate": 0.00012559638942617667,
"loss": 1.0568,
"num_input_tokens_seen": 28026144,
"step": 583,
"train_runtime": 4053.5359,
"train_tokens_per_second": 6913.999
},
{
"epoch": 0.37544198007071683,
"grad_norm": 0.20244669914245605,
"learning_rate": 0.0001254674403610574,
"loss": 1.2114,
"num_input_tokens_seen": 28096992,
"step": 584,
"train_runtime": 4063.4542,
"train_tokens_per_second": 6914.558
},
{
"epoch": 0.3760848601735776,
"grad_norm": 0.17933306097984314,
"learning_rate": 0.0001253384912959381,
"loss": 0.9909,
"num_input_tokens_seen": 28145312,
"step": 585,
"train_runtime": 4070.2961,
"train_tokens_per_second": 6914.807
},
{
"epoch": 0.37672774027643846,
"grad_norm": 0.21245713531970978,
"learning_rate": 0.00012520954223081883,
"loss": 1.0352,
"num_input_tokens_seen": 28188176,
"step": 586,
"train_runtime": 4076.3544,
"train_tokens_per_second": 6915.045
},
{
"epoch": 0.37737062037929925,
"grad_norm": 0.21566520631313324,
"learning_rate": 0.00012508059316569954,
"loss": 0.9848,
"num_input_tokens_seen": 28224368,
"step": 587,
"train_runtime": 4081.4827,
"train_tokens_per_second": 6915.224
},
{
"epoch": 0.3780135004821601,
"grad_norm": 0.22781872749328613,
"learning_rate": 0.00012495164410058026,
"loss": 1.1376,
"num_input_tokens_seen": 28286320,
"step": 588,
"train_runtime": 4090.184,
"train_tokens_per_second": 6915.66
},
{
"epoch": 0.3786563805850209,
"grad_norm": 0.20224601030349731,
"learning_rate": 0.000124822695035461,
"loss": 1.0087,
"num_input_tokens_seen": 28334400,
"step": 589,
"train_runtime": 4096.9721,
"train_tokens_per_second": 6915.937
},
{
"epoch": 0.3792992606878817,
"grad_norm": 0.21622709929943085,
"learning_rate": 0.00012469374597034173,
"loss": 1.0467,
"num_input_tokens_seen": 28411456,
"step": 590,
"train_runtime": 4107.7924,
"train_tokens_per_second": 6916.478
},
{
"epoch": 0.3799421407907425,
"grad_norm": 0.2303570955991745,
"learning_rate": 0.00012456479690522244,
"loss": 0.894,
"num_input_tokens_seen": 28487168,
"step": 591,
"train_runtime": 4118.4367,
"train_tokens_per_second": 6916.986
},
{
"epoch": 0.38058502089360335,
"grad_norm": 0.23342084884643555,
"learning_rate": 0.00012443584784010316,
"loss": 0.9435,
"num_input_tokens_seen": 28544832,
"step": 592,
"train_runtime": 4126.5979,
"train_tokens_per_second": 6917.28
},
{
"epoch": 0.38122790099646414,
"grad_norm": 0.22476206719875336,
"learning_rate": 0.0001243068987749839,
"loss": 0.9244,
"num_input_tokens_seen": 28571696,
"step": 593,
"train_runtime": 4130.4665,
"train_tokens_per_second": 6917.305
},
{
"epoch": 0.381870781099325,
"grad_norm": 0.23770561814308167,
"learning_rate": 0.0001241779497098646,
"loss": 0.952,
"num_input_tokens_seen": 28610848,
"step": 594,
"train_runtime": 4136.0008,
"train_tokens_per_second": 6917.515
},
{
"epoch": 0.3825136612021858,
"grad_norm": 0.2344546765089035,
"learning_rate": 0.00012404900064474534,
"loss": 0.9873,
"num_input_tokens_seen": 28661696,
"step": 595,
"train_runtime": 4143.1852,
"train_tokens_per_second": 6917.793
},
{
"epoch": 0.3831565413050466,
"grad_norm": 0.2203758805990219,
"learning_rate": 0.00012392005157962606,
"loss": 0.9037,
"num_input_tokens_seen": 28702016,
"step": 596,
"train_runtime": 4148.8302,
"train_tokens_per_second": 6918.098
},
{
"epoch": 0.3837994214079074,
"grad_norm": 0.23991960287094116,
"learning_rate": 0.00012379110251450678,
"loss": 1.0986,
"num_input_tokens_seen": 28750608,
"step": 597,
"train_runtime": 4155.6771,
"train_tokens_per_second": 6918.393
},
{
"epoch": 0.38444230151076825,
"grad_norm": 0.2651250958442688,
"learning_rate": 0.0001236621534493875,
"loss": 1.0733,
"num_input_tokens_seen": 28802192,
"step": 598,
"train_runtime": 4162.9186,
"train_tokens_per_second": 6918.75
},
{
"epoch": 0.38508518161362904,
"grad_norm": 0.19469523429870605,
"learning_rate": 0.00012353320438426824,
"loss": 0.8291,
"num_input_tokens_seen": 28836496,
"step": 599,
"train_runtime": 4167.7908,
"train_tokens_per_second": 6918.892
},
{
"epoch": 0.3857280617164899,
"grad_norm": 0.21888983249664307,
"learning_rate": 0.00012340425531914893,
"loss": 0.9539,
"num_input_tokens_seen": 28889152,
"step": 600,
"train_runtime": 4175.156,
"train_tokens_per_second": 6919.299
},
{
"epoch": 0.38637094181935067,
"grad_norm": 0.21506822109222412,
"learning_rate": 0.00012327530625402965,
"loss": 1.0613,
"num_input_tokens_seen": 28954208,
"step": 601,
"train_runtime": 4184.9056,
"train_tokens_per_second": 6918.724
},
{
"epoch": 0.3870138219222115,
"grad_norm": 0.20702601969242096,
"learning_rate": 0.0001231463571889104,
"loss": 1.0223,
"num_input_tokens_seen": 28990576,
"step": 602,
"train_runtime": 4190.0373,
"train_tokens_per_second": 6918.93
},
{
"epoch": 0.3876567020250723,
"grad_norm": 0.21783804893493652,
"learning_rate": 0.0001230174081237911,
"loss": 1.1475,
"num_input_tokens_seen": 29044912,
"step": 603,
"train_runtime": 4197.6381,
"train_tokens_per_second": 6919.346
},
{
"epoch": 0.38829958212793314,
"grad_norm": 0.2323097288608551,
"learning_rate": 0.00012288845905867183,
"loss": 0.9286,
"num_input_tokens_seen": 29102384,
"step": 604,
"train_runtime": 4205.7063,
"train_tokens_per_second": 6919.738
},
{
"epoch": 0.388942462230794,
"grad_norm": 0.23841801285743713,
"learning_rate": 0.00012275950999355255,
"loss": 1.0584,
"num_input_tokens_seen": 29164656,
"step": 605,
"train_runtime": 4214.5376,
"train_tokens_per_second": 6920.013
},
{
"epoch": 0.38958534233365477,
"grad_norm": 0.20748752355575562,
"learning_rate": 0.00012263056092843327,
"loss": 1.0395,
"num_input_tokens_seen": 29225600,
"step": 606,
"train_runtime": 4223.1606,
"train_tokens_per_second": 6920.315
},
{
"epoch": 0.3902282224365156,
"grad_norm": 0.2151229828596115,
"learning_rate": 0.000122501611863314,
"loss": 1.0344,
"num_input_tokens_seen": 29262288,
"step": 607,
"train_runtime": 4228.3802,
"train_tokens_per_second": 6920.449
},
{
"epoch": 0.3908711025393764,
"grad_norm": 0.21405351161956787,
"learning_rate": 0.00012237266279819473,
"loss": 0.9952,
"num_input_tokens_seen": 29308352,
"step": 608,
"train_runtime": 4234.8569,
"train_tokens_per_second": 6920.742
},
{
"epoch": 0.39151398264223725,
"grad_norm": 0.23500262200832367,
"learning_rate": 0.00012224371373307545,
"loss": 1.0545,
"num_input_tokens_seen": 29358352,
"step": 609,
"train_runtime": 4241.8241,
"train_tokens_per_second": 6921.162
},
{
"epoch": 0.39215686274509803,
"grad_norm": 0.2577454745769501,
"learning_rate": 0.00012211476466795617,
"loss": 1.0378,
"num_input_tokens_seen": 29394896,
"step": 610,
"train_runtime": 4246.9734,
"train_tokens_per_second": 6921.375
},
{
"epoch": 0.3927997428479589,
"grad_norm": 0.2507747411727905,
"learning_rate": 0.00012198581560283689,
"loss": 0.9745,
"num_input_tokens_seen": 29475024,
"step": 611,
"train_runtime": 4258.173,
"train_tokens_per_second": 6921.988
},
{
"epoch": 0.39344262295081966,
"grad_norm": 0.20818312466144562,
"learning_rate": 0.00012185686653771762,
"loss": 1.0457,
"num_input_tokens_seen": 29524560,
"step": 612,
"train_runtime": 4265.1329,
"train_tokens_per_second": 6922.307
},
{
"epoch": 0.3940855030536805,
"grad_norm": 0.20738723874092102,
"learning_rate": 0.00012172791747259832,
"loss": 0.9007,
"num_input_tokens_seen": 29557488,
"step": 613,
"train_runtime": 4269.8032,
"train_tokens_per_second": 6922.447
},
{
"epoch": 0.3947283831565413,
"grad_norm": 0.23783709108829498,
"learning_rate": 0.00012159896840747904,
"loss": 0.9693,
"num_input_tokens_seen": 29606720,
"step": 614,
"train_runtime": 4276.6802,
"train_tokens_per_second": 6922.828
},
{
"epoch": 0.39537126325940214,
"grad_norm": 0.2414642572402954,
"learning_rate": 0.00012147001934235977,
"loss": 0.9164,
"num_input_tokens_seen": 29659248,
"step": 615,
"train_runtime": 4284.0389,
"train_tokens_per_second": 6923.198
},
{
"epoch": 0.3960141433622629,
"grad_norm": 0.2816667854785919,
"learning_rate": 0.00012134107027724049,
"loss": 1.08,
"num_input_tokens_seen": 29692640,
"step": 616,
"train_runtime": 4288.753,
"train_tokens_per_second": 6923.374
},
{
"epoch": 0.39665702346512377,
"grad_norm": 0.22061841189861298,
"learning_rate": 0.00012121212121212122,
"loss": 0.942,
"num_input_tokens_seen": 29749232,
"step": 617,
"train_runtime": 4296.6122,
"train_tokens_per_second": 6923.881
},
{
"epoch": 0.39729990356798456,
"grad_norm": 0.22501406073570251,
"learning_rate": 0.00012108317214700193,
"loss": 0.9142,
"num_input_tokens_seen": 29782464,
"step": 618,
"train_runtime": 4301.2713,
"train_tokens_per_second": 6924.107
},
{
"epoch": 0.3979427836708454,
"grad_norm": 0.22138579189777374,
"learning_rate": 0.00012095422308188267,
"loss": 1.0032,
"num_input_tokens_seen": 29827024,
"step": 619,
"train_runtime": 4307.5291,
"train_tokens_per_second": 6924.393
},
{
"epoch": 0.3985856637737062,
"grad_norm": 0.23382511734962463,
"learning_rate": 0.00012082527401676338,
"loss": 0.9978,
"num_input_tokens_seen": 29871056,
"step": 620,
"train_runtime": 4313.6531,
"train_tokens_per_second": 6924.77
},
{
"epoch": 0.39922854387656703,
"grad_norm": 0.2238994836807251,
"learning_rate": 0.00012069632495164411,
"loss": 1.2913,
"num_input_tokens_seen": 29931440,
"step": 621,
"train_runtime": 4321.992,
"train_tokens_per_second": 6925.381
},
{
"epoch": 0.3998714239794278,
"grad_norm": 0.21180926263332367,
"learning_rate": 0.00012056737588652483,
"loss": 0.955,
"num_input_tokens_seen": 29969744,
"step": 622,
"train_runtime": 4327.3136,
"train_tokens_per_second": 6925.716
},
{
"epoch": 0.40051430408228866,
"grad_norm": 0.23319873213768005,
"learning_rate": 0.00012043842682140556,
"loss": 1.0568,
"num_input_tokens_seen": 30001616,
"step": 623,
"train_runtime": 4331.7652,
"train_tokens_per_second": 6925.956
},
{
"epoch": 0.40115718418514945,
"grad_norm": 0.22872281074523926,
"learning_rate": 0.00012030947775628628,
"loss": 1.0755,
"num_input_tokens_seen": 30061664,
"step": 624,
"train_runtime": 4340.096,
"train_tokens_per_second": 6926.498
},
{
"epoch": 0.40115718418514945,
"eval_loss": 1.0195001363754272,
"eval_runtime": 39.6587,
"eval_samples_per_second": 25.064,
"eval_steps_per_second": 1.589,
"num_input_tokens_seen": 30061664,
"step": 624
},
{
"epoch": 0.4018000642880103,
"grad_norm": 0.21049852669239044,
"learning_rate": 0.00012018052869116701,
"loss": 0.9652,
"num_input_tokens_seen": 30099536,
"step": 625,
"train_runtime": 4385.0645,
"train_tokens_per_second": 6864.103
},
{
"epoch": 0.4024429443908711,
"grad_norm": 0.21458666026592255,
"learning_rate": 0.00012005157962604771,
"loss": 0.9631,
"num_input_tokens_seen": 30156400,
"step": 626,
"train_runtime": 4392.9933,
"train_tokens_per_second": 6864.659
},
{
"epoch": 0.4030858244937319,
"grad_norm": 0.21649177372455597,
"learning_rate": 0.00011992263056092843,
"loss": 0.9611,
"num_input_tokens_seen": 30199968,
"step": 627,
"train_runtime": 4399.0421,
"train_tokens_per_second": 6865.124
},
{
"epoch": 0.4037287045965927,
"grad_norm": 0.2240186184644699,
"learning_rate": 0.00011979368149580916,
"loss": 0.931,
"num_input_tokens_seen": 30233536,
"step": 628,
"train_runtime": 4403.7362,
"train_tokens_per_second": 6865.428
},
{
"epoch": 0.40437158469945356,
"grad_norm": 0.1959734410047531,
"learning_rate": 0.00011966473243068988,
"loss": 0.9257,
"num_input_tokens_seen": 30280816,
"step": 629,
"train_runtime": 4410.2782,
"train_tokens_per_second": 6865.965
},
{
"epoch": 0.40501446480231434,
"grad_norm": 0.22301970422267914,
"learning_rate": 0.00011953578336557061,
"loss": 1.0331,
"num_input_tokens_seen": 30319856,
"step": 630,
"train_runtime": 4415.7542,
"train_tokens_per_second": 6866.292
},
{
"epoch": 0.4056573449051752,
"grad_norm": 0.21817179024219513,
"learning_rate": 0.00011940683430045132,
"loss": 0.9312,
"num_input_tokens_seen": 30366832,
"step": 631,
"train_runtime": 4422.9045,
"train_tokens_per_second": 6865.812
},
{
"epoch": 0.406300225008036,
"grad_norm": 0.21276038885116577,
"learning_rate": 0.00011927788523533205,
"loss": 1.0818,
"num_input_tokens_seen": 30411472,
"step": 632,
"train_runtime": 4429.0946,
"train_tokens_per_second": 6866.295
},
{
"epoch": 0.4069431051108968,
"grad_norm": 0.20637577772140503,
"learning_rate": 0.00011914893617021277,
"loss": 1.0118,
"num_input_tokens_seen": 30450272,
"step": 633,
"train_runtime": 4434.5087,
"train_tokens_per_second": 6866.662
},
{
"epoch": 0.4075859852137576,
"grad_norm": 0.21434983611106873,
"learning_rate": 0.0001190199871050935,
"loss": 0.9965,
"num_input_tokens_seen": 30497536,
"step": 634,
"train_runtime": 4441.0991,
"train_tokens_per_second": 6867.115
},
{
"epoch": 0.40822886531661845,
"grad_norm": 0.21265575289726257,
"learning_rate": 0.00011889103803997422,
"loss": 0.9129,
"num_input_tokens_seen": 30555504,
"step": 635,
"train_runtime": 4449.2162,
"train_tokens_per_second": 6867.615
},
{
"epoch": 0.4088717454194793,
"grad_norm": 0.22651416063308716,
"learning_rate": 0.00011876208897485495,
"loss": 0.9242,
"num_input_tokens_seen": 30595360,
"step": 636,
"train_runtime": 4454.752,
"train_tokens_per_second": 6868.028
},
{
"epoch": 0.4095146255223401,
"grad_norm": 0.20967771112918854,
"learning_rate": 0.00011863313990973565,
"loss": 0.9452,
"num_input_tokens_seen": 30627360,
"step": 637,
"train_runtime": 4459.2199,
"train_tokens_per_second": 6868.322
},
{
"epoch": 0.4101575056252009,
"grad_norm": 0.19460758566856384,
"learning_rate": 0.0001185041908446164,
"loss": 0.7967,
"num_input_tokens_seen": 30675744,
"step": 638,
"train_runtime": 4465.9439,
"train_tokens_per_second": 6868.815
},
{
"epoch": 0.4108003857280617,
"grad_norm": 0.21010765433311462,
"learning_rate": 0.0001183752417794971,
"loss": 0.9081,
"num_input_tokens_seen": 30708240,
"step": 639,
"train_runtime": 4470.5297,
"train_tokens_per_second": 6869.038
},
{
"epoch": 0.41144326583092256,
"grad_norm": 0.23160742223262787,
"learning_rate": 0.00011824629271437782,
"loss": 1.072,
"num_input_tokens_seen": 30756592,
"step": 640,
"train_runtime": 4477.2619,
"train_tokens_per_second": 6869.509
},
{
"epoch": 0.41208614593378334,
"grad_norm": 0.22536088526248932,
"learning_rate": 0.00011811734364925855,
"loss": 1.0498,
"num_input_tokens_seen": 30808704,
"step": 641,
"train_runtime": 4484.5345,
"train_tokens_per_second": 6869.989
},
{
"epoch": 0.4127290260366442,
"grad_norm": 0.21694333851337433,
"learning_rate": 0.00011798839458413926,
"loss": 0.9911,
"num_input_tokens_seen": 30850400,
"step": 642,
"train_runtime": 4490.3558,
"train_tokens_per_second": 6870.369
},
{
"epoch": 0.413371906139505,
"grad_norm": 0.22314226627349854,
"learning_rate": 0.00011785944551901999,
"loss": 1.0367,
"num_input_tokens_seen": 30909184,
"step": 643,
"train_runtime": 4498.5039,
"train_tokens_per_second": 6870.992
},
{
"epoch": 0.4140147862423658,
"grad_norm": 0.21192863583564758,
"learning_rate": 0.00011773049645390071,
"loss": 0.9676,
"num_input_tokens_seen": 30964544,
"step": 644,
"train_runtime": 4506.3238,
"train_tokens_per_second": 6871.354
},
{
"epoch": 0.4146576663452266,
"grad_norm": 0.21439877152442932,
"learning_rate": 0.00011760154738878144,
"loss": 0.9365,
"num_input_tokens_seen": 31015952,
"step": 645,
"train_runtime": 4513.4906,
"train_tokens_per_second": 6871.833
},
{
"epoch": 0.41530054644808745,
"grad_norm": 0.22022485733032227,
"learning_rate": 0.00011747259832366216,
"loss": 1.0268,
"num_input_tokens_seen": 31076064,
"step": 646,
"train_runtime": 4522.0091,
"train_tokens_per_second": 6872.181
},
{
"epoch": 0.41594342655094824,
"grad_norm": 0.22051121294498444,
"learning_rate": 0.00011734364925854289,
"loss": 0.9622,
"num_input_tokens_seen": 31123008,
"step": 647,
"train_runtime": 4528.5517,
"train_tokens_per_second": 6872.618
},
{
"epoch": 0.4165863066538091,
"grad_norm": 0.22413188219070435,
"learning_rate": 0.00011721470019342359,
"loss": 0.9393,
"num_input_tokens_seen": 31158768,
"step": 648,
"train_runtime": 4533.6072,
"train_tokens_per_second": 6872.842
},
{
"epoch": 0.41722918675666987,
"grad_norm": 0.21698571741580963,
"learning_rate": 0.00011708575112830434,
"loss": 0.9853,
"num_input_tokens_seen": 31196608,
"step": 649,
"train_runtime": 4538.8981,
"train_tokens_per_second": 6873.168
},
{
"epoch": 0.4178720668595307,
"grad_norm": 0.22137726843357086,
"learning_rate": 0.00011695680206318504,
"loss": 1.027,
"num_input_tokens_seen": 31238256,
"step": 650,
"train_runtime": 4544.6888,
"train_tokens_per_second": 6873.574
},
{
"epoch": 0.4185149469623915,
"grad_norm": 0.2062436044216156,
"learning_rate": 0.00011682785299806577,
"loss": 1.0151,
"num_input_tokens_seen": 31283008,
"step": 651,
"train_runtime": 4550.8603,
"train_tokens_per_second": 6874.087
},
{
"epoch": 0.41915782706525234,
"grad_norm": 0.21680644154548645,
"learning_rate": 0.00011669890393294649,
"loss": 1.0544,
"num_input_tokens_seen": 31321264,
"step": 652,
"train_runtime": 4556.2232,
"train_tokens_per_second": 6874.392
},
{
"epoch": 0.41980070716811313,
"grad_norm": 0.20638515055179596,
"learning_rate": 0.00011656995486782722,
"loss": 0.9003,
"num_input_tokens_seen": 31356928,
"step": 653,
"train_runtime": 4561.2955,
"train_tokens_per_second": 6874.566
},
{
"epoch": 0.420443587270974,
"grad_norm": 0.20695024728775024,
"learning_rate": 0.00011644100580270794,
"loss": 0.9458,
"num_input_tokens_seen": 31394000,
"step": 654,
"train_runtime": 4566.543,
"train_tokens_per_second": 6874.785
},
{
"epoch": 0.42108646737383476,
"grad_norm": 0.20706257224082947,
"learning_rate": 0.00011631205673758865,
"loss": 1.0082,
"num_input_tokens_seen": 31430544,
"step": 655,
"train_runtime": 4571.683,
"train_tokens_per_second": 6875.049
},
{
"epoch": 0.4217293474766956,
"grad_norm": 0.23636630177497864,
"learning_rate": 0.00011618310767246938,
"loss": 1.0523,
"num_input_tokens_seen": 31476864,
"step": 656,
"train_runtime": 4578.185,
"train_tokens_per_second": 6875.402
},
{
"epoch": 0.4223722275795564,
"grad_norm": 0.2097059190273285,
"learning_rate": 0.0001160541586073501,
"loss": 0.8199,
"num_input_tokens_seen": 31526576,
"step": 657,
"train_runtime": 4585.1503,
"train_tokens_per_second": 6875.8
},
{
"epoch": 0.42301510768241724,
"grad_norm": 0.22159291803836823,
"learning_rate": 0.00011592520954223083,
"loss": 0.9934,
"num_input_tokens_seen": 31566736,
"step": 658,
"train_runtime": 4590.7784,
"train_tokens_per_second": 6876.118
},
{
"epoch": 0.423657987785278,
"grad_norm": 0.2194710522890091,
"learning_rate": 0.00011579626047711155,
"loss": 0.9837,
"num_input_tokens_seen": 31604992,
"step": 659,
"train_runtime": 4596.148,
"train_tokens_per_second": 6876.409
},
{
"epoch": 0.42430086788813887,
"grad_norm": 0.2124231904745102,
"learning_rate": 0.00011566731141199228,
"loss": 0.9482,
"num_input_tokens_seen": 31641088,
"step": 660,
"train_runtime": 4601.1459,
"train_tokens_per_second": 6876.784
},
{
"epoch": 0.42494374799099965,
"grad_norm": 0.2047438621520996,
"learning_rate": 0.00011553836234687298,
"loss": 0.8637,
"num_input_tokens_seen": 31685744,
"step": 661,
"train_runtime": 4607.9012,
"train_tokens_per_second": 6876.394
},
{
"epoch": 0.4255866280938605,
"grad_norm": 0.23964186012744904,
"learning_rate": 0.00011540941328175371,
"loss": 1.0124,
"num_input_tokens_seen": 31718608,
"step": 662,
"train_runtime": 4612.5423,
"train_tokens_per_second": 6876.6
},
{
"epoch": 0.4262295081967213,
"grad_norm": 0.22414755821228027,
"learning_rate": 0.00011528046421663443,
"loss": 1.0236,
"num_input_tokens_seen": 31773472,
"step": 663,
"train_runtime": 4620.2165,
"train_tokens_per_second": 6877.053
},
{
"epoch": 0.42687238829958213,
"grad_norm": 0.20792655646800995,
"learning_rate": 0.00011515151515151516,
"loss": 1.0071,
"num_input_tokens_seen": 31831120,
"step": 664,
"train_runtime": 4628.3237,
"train_tokens_per_second": 6877.462
},
{
"epoch": 0.42751526840244297,
"grad_norm": 0.22675418853759766,
"learning_rate": 0.00011502256608639588,
"loss": 0.9932,
"num_input_tokens_seen": 31870400,
"step": 665,
"train_runtime": 4633.8504,
"train_tokens_per_second": 6877.736
},
{
"epoch": 0.42815814850530376,
"grad_norm": 0.20541276037693024,
"learning_rate": 0.00011489361702127661,
"loss": 0.9302,
"num_input_tokens_seen": 31921072,
"step": 666,
"train_runtime": 4640.9182,
"train_tokens_per_second": 6878.18
},
{
"epoch": 0.4288010286081646,
"grad_norm": 0.20797085762023926,
"learning_rate": 0.00011476466795615732,
"loss": 0.9894,
"num_input_tokens_seen": 31959600,
"step": 667,
"train_runtime": 4646.3473,
"train_tokens_per_second": 6878.435
},
{
"epoch": 0.4294439087110254,
"grad_norm": 0.22054386138916016,
"learning_rate": 0.00011463571889103804,
"loss": 0.8813,
"num_input_tokens_seen": 32003888,
"step": 668,
"train_runtime": 4652.5271,
"train_tokens_per_second": 6878.818
},
{
"epoch": 0.43008678881388623,
"grad_norm": 0.2270301729440689,
"learning_rate": 0.00011450676982591877,
"loss": 1.0675,
"num_input_tokens_seen": 32054864,
"step": 669,
"train_runtime": 4659.6237,
"train_tokens_per_second": 6879.282
},
{
"epoch": 0.430729668916747,
"grad_norm": 0.2037355899810791,
"learning_rate": 0.00011437782076079949,
"loss": 0.9287,
"num_input_tokens_seen": 32096768,
"step": 670,
"train_runtime": 4665.4868,
"train_tokens_per_second": 6879.618
},
{
"epoch": 0.43137254901960786,
"grad_norm": 0.2622132897377014,
"learning_rate": 0.00011424887169568022,
"loss": 0.9492,
"num_input_tokens_seen": 32134112,
"step": 671,
"train_runtime": 4670.6869,
"train_tokens_per_second": 6879.954
},
{
"epoch": 0.43201542912246865,
"grad_norm": 0.1913800835609436,
"learning_rate": 0.00011411992263056092,
"loss": 0.9271,
"num_input_tokens_seen": 32173216,
"step": 672,
"train_runtime": 4676.1106,
"train_tokens_per_second": 6880.337
},
{
"epoch": 0.4326583092253295,
"grad_norm": 0.2154611498117447,
"learning_rate": 0.00011399097356544165,
"loss": 0.9622,
"num_input_tokens_seen": 32215968,
"step": 673,
"train_runtime": 4682.0757,
"train_tokens_per_second": 6880.702
},
{
"epoch": 0.4333011893281903,
"grad_norm": 0.22015735507011414,
"learning_rate": 0.00011386202450032237,
"loss": 1.0512,
"num_input_tokens_seen": 32255728,
"step": 674,
"train_runtime": 4687.6013,
"train_tokens_per_second": 6881.073
},
{
"epoch": 0.4339440694310511,
"grad_norm": 0.16371029615402222,
"learning_rate": 0.0001137330754352031,
"loss": 0.6272,
"num_input_tokens_seen": 32320576,
"step": 675,
"train_runtime": 4696.653,
"train_tokens_per_second": 6881.619
},
{
"epoch": 0.4345869495339119,
"grad_norm": 0.22172540426254272,
"learning_rate": 0.00011360412637008382,
"loss": 0.9891,
"num_input_tokens_seen": 32362384,
"step": 676,
"train_runtime": 4702.4813,
"train_tokens_per_second": 6881.98
},
{
"epoch": 0.43522982963677276,
"grad_norm": 0.22036395967006683,
"learning_rate": 0.00011347517730496455,
"loss": 1.0239,
"num_input_tokens_seen": 32400048,
"step": 677,
"train_runtime": 4707.7622,
"train_tokens_per_second": 6882.261
},
{
"epoch": 0.43587270973963355,
"grad_norm": 0.22396039962768555,
"learning_rate": 0.00011334622823984526,
"loss": 1.0223,
"num_input_tokens_seen": 32446432,
"step": 678,
"train_runtime": 4714.1851,
"train_tokens_per_second": 6882.723
},
{
"epoch": 0.4365155898424944,
"grad_norm": 0.23210053145885468,
"learning_rate": 0.000113217279174726,
"loss": 0.9947,
"num_input_tokens_seen": 32499440,
"step": 679,
"train_runtime": 4721.5273,
"train_tokens_per_second": 6883.247
},
{
"epoch": 0.4371584699453552,
"grad_norm": 0.22264118492603302,
"learning_rate": 0.00011308833010960671,
"loss": 0.9648,
"num_input_tokens_seen": 32542192,
"step": 680,
"train_runtime": 4727.528,
"train_tokens_per_second": 6883.554
},
{
"epoch": 0.437801350048216,
"grad_norm": 0.23207049071788788,
"learning_rate": 0.00011295938104448743,
"loss": 1.039,
"num_input_tokens_seen": 32576320,
"step": 681,
"train_runtime": 4732.3421,
"train_tokens_per_second": 6883.763
},
{
"epoch": 0.4384442301510768,
"grad_norm": 0.20451678335666656,
"learning_rate": 0.00011283043197936816,
"loss": 0.86,
"num_input_tokens_seen": 32639232,
"step": 682,
"train_runtime": 4741.1386,
"train_tokens_per_second": 6884.26
},
{
"epoch": 0.43908711025393765,
"grad_norm": 0.21010853350162506,
"learning_rate": 0.00011270148291424886,
"loss": 0.949,
"num_input_tokens_seen": 32688096,
"step": 683,
"train_runtime": 4747.9314,
"train_tokens_per_second": 6884.703
},
{
"epoch": 0.43972999035679844,
"grad_norm": 0.229692742228508,
"learning_rate": 0.00011257253384912961,
"loss": 1.0432,
"num_input_tokens_seen": 32752512,
"step": 684,
"train_runtime": 4756.8786,
"train_tokens_per_second": 6885.295
},
{
"epoch": 0.4403728704596593,
"grad_norm": 0.21229156851768494,
"learning_rate": 0.00011244358478401031,
"loss": 0.9829,
"num_input_tokens_seen": 32799184,
"step": 685,
"train_runtime": 4763.3748,
"train_tokens_per_second": 6885.703
},
{
"epoch": 0.44101575056252007,
"grad_norm": 0.2042849361896515,
"learning_rate": 0.00011231463571889104,
"loss": 1.1422,
"num_input_tokens_seen": 32851248,
"step": 686,
"train_runtime": 4770.5849,
"train_tokens_per_second": 6886.21
},
{
"epoch": 0.4416586306653809,
"grad_norm": 0.22981370985507965,
"learning_rate": 0.00011218568665377176,
"loss": 1.1633,
"num_input_tokens_seen": 32918608,
"step": 687,
"train_runtime": 4779.9642,
"train_tokens_per_second": 6886.79
},
{
"epoch": 0.4423015107682417,
"grad_norm": 0.2342732697725296,
"learning_rate": 0.0001120567375886525,
"loss": 0.9755,
"num_input_tokens_seen": 32955376,
"step": 688,
"train_runtime": 4785.1234,
"train_tokens_per_second": 6887.048
},
{
"epoch": 0.44294439087110254,
"grad_norm": 0.2190224826335907,
"learning_rate": 0.00011192778852353321,
"loss": 0.9443,
"num_input_tokens_seen": 33001280,
"step": 689,
"train_runtime": 4791.5486,
"train_tokens_per_second": 6887.393
},
{
"epoch": 0.44358727097396333,
"grad_norm": 0.20389577746391296,
"learning_rate": 0.00011179883945841394,
"loss": 0.9415,
"num_input_tokens_seen": 33060048,
"step": 690,
"train_runtime": 4799.7228,
"train_tokens_per_second": 6887.908
},
{
"epoch": 0.4442301510768242,
"grad_norm": 0.2384883016347885,
"learning_rate": 0.00011166989039329465,
"loss": 0.9189,
"num_input_tokens_seen": 33100688,
"step": 691,
"train_runtime": 4805.9254,
"train_tokens_per_second": 6887.474
},
{
"epoch": 0.44487303117968496,
"grad_norm": 0.2082808017730713,
"learning_rate": 0.00011154094132817538,
"loss": 0.8782,
"num_input_tokens_seen": 33152336,
"step": 692,
"train_runtime": 4813.1569,
"train_tokens_per_second": 6887.857
},
{
"epoch": 0.4455159112825458,
"grad_norm": 0.2516237497329712,
"learning_rate": 0.0001114119922630561,
"loss": 0.9324,
"num_input_tokens_seen": 33189920,
"step": 693,
"train_runtime": 4818.4834,
"train_tokens_per_second": 6888.043
},
{
"epoch": 0.4461587913854066,
"grad_norm": 0.23709340393543243,
"learning_rate": 0.0001112830431979368,
"loss": 0.9557,
"num_input_tokens_seen": 33260768,
"step": 694,
"train_runtime": 4828.4263,
"train_tokens_per_second": 6888.532
},
{
"epoch": 0.44680167148826744,
"grad_norm": 0.20567552745342255,
"learning_rate": 0.00011115409413281755,
"loss": 0.9644,
"num_input_tokens_seen": 33324816,
"step": 695,
"train_runtime": 4837.3309,
"train_tokens_per_second": 6889.092
},
{
"epoch": 0.4474445515911283,
"grad_norm": 0.23268231749534607,
"learning_rate": 0.00011102514506769825,
"loss": 1.1173,
"num_input_tokens_seen": 33360608,
"step": 696,
"train_runtime": 4842.3614,
"train_tokens_per_second": 6889.326
},
{
"epoch": 0.44808743169398907,
"grad_norm": 0.21495988965034485,
"learning_rate": 0.00011089619600257898,
"loss": 0.8198,
"num_input_tokens_seen": 33417952,
"step": 697,
"train_runtime": 4850.2634,
"train_tokens_per_second": 6889.925
},
{
"epoch": 0.4487303117968499,
"grad_norm": 0.21632738411426544,
"learning_rate": 0.0001107672469374597,
"loss": 0.9627,
"num_input_tokens_seen": 33459424,
"step": 698,
"train_runtime": 4856.0055,
"train_tokens_per_second": 6890.318
},
{
"epoch": 0.4493731918997107,
"grad_norm": 0.21286652982234955,
"learning_rate": 0.00011063829787234043,
"loss": 0.9581,
"num_input_tokens_seen": 33514128,
"step": 699,
"train_runtime": 4863.6708,
"train_tokens_per_second": 6890.706
},
{
"epoch": 0.45001607200257154,
"grad_norm": 0.20469930768013,
"learning_rate": 0.00011050934880722115,
"loss": 0.8758,
"num_input_tokens_seen": 33571600,
"step": 700,
"train_runtime": 4871.7374,
"train_tokens_per_second": 6891.094
},
{
"epoch": 0.45065895210543233,
"grad_norm": 0.22726038098335266,
"learning_rate": 0.00011038039974210188,
"loss": 1.0946,
"num_input_tokens_seen": 33617424,
"step": 701,
"train_runtime": 4878.1349,
"train_tokens_per_second": 6891.45
},
{
"epoch": 0.4513018322082932,
"grad_norm": 0.22706422209739685,
"learning_rate": 0.00011025145067698259,
"loss": 0.9967,
"num_input_tokens_seen": 33659984,
"step": 702,
"train_runtime": 4884.0638,
"train_tokens_per_second": 6891.799
},
{
"epoch": 0.45194471231115396,
"grad_norm": 0.2139998823404312,
"learning_rate": 0.00011012250161186332,
"loss": 0.9974,
"num_input_tokens_seen": 33711920,
"step": 703,
"train_runtime": 4891.2803,
"train_tokens_per_second": 6892.249
},
{
"epoch": 0.4525875924140148,
"grad_norm": 0.1970311999320984,
"learning_rate": 0.00010999355254674404,
"loss": 0.9625,
"num_input_tokens_seen": 33759344,
"step": 704,
"train_runtime": 4897.9042,
"train_tokens_per_second": 6892.61
},
{
"epoch": 0.4532304725168756,
"grad_norm": 0.22025848925113678,
"learning_rate": 0.00010986460348162477,
"loss": 1.1195,
"num_input_tokens_seen": 33799712,
"step": 705,
"train_runtime": 4903.5939,
"train_tokens_per_second": 6892.845
},
{
"epoch": 0.45387335261973644,
"grad_norm": 0.2358890026807785,
"learning_rate": 0.00010973565441650549,
"loss": 0.9897,
"num_input_tokens_seen": 33846080,
"step": 706,
"train_runtime": 4910.1395,
"train_tokens_per_second": 6893.099
},
{
"epoch": 0.4545162327225972,
"grad_norm": 0.2292589545249939,
"learning_rate": 0.00010960670535138622,
"loss": 1.0153,
"num_input_tokens_seen": 33887872,
"step": 707,
"train_runtime": 4915.9598,
"train_tokens_per_second": 6893.44
},
{
"epoch": 0.45515911282545807,
"grad_norm": 0.2088674008846283,
"learning_rate": 0.00010947775628626692,
"loss": 0.9935,
"num_input_tokens_seen": 33929488,
"step": 708,
"train_runtime": 4921.7787,
"train_tokens_per_second": 6893.745
},
{
"epoch": 0.45580199292831886,
"grad_norm": 0.2125674933195114,
"learning_rate": 0.00010934880722114764,
"loss": 0.918,
"num_input_tokens_seen": 33965600,
"step": 709,
"train_runtime": 4926.8406,
"train_tokens_per_second": 6893.992
},
{
"epoch": 0.4564448730311797,
"grad_norm": 0.21705789864063263,
"learning_rate": 0.00010921985815602837,
"loss": 0.9987,
"num_input_tokens_seen": 34018016,
"step": 710,
"train_runtime": 4934.1229,
"train_tokens_per_second": 6894.44
},
{
"epoch": 0.4570877531340405,
"grad_norm": 0.22935166954994202,
"learning_rate": 0.00010909090909090909,
"loss": 0.9295,
"num_input_tokens_seen": 34076464,
"step": 711,
"train_runtime": 4942.3293,
"train_tokens_per_second": 6894.819
},
{
"epoch": 0.45773063323690133,
"grad_norm": 0.21767853200435638,
"learning_rate": 0.00010896196002578982,
"loss": 0.967,
"num_input_tokens_seen": 34118112,
"step": 712,
"train_runtime": 4948.1513,
"train_tokens_per_second": 6895.123
},
{
"epoch": 0.4583735133397621,
"grad_norm": 0.23016303777694702,
"learning_rate": 0.00010883301096067053,
"loss": 0.9883,
"num_input_tokens_seen": 34161248,
"step": 713,
"train_runtime": 4954.2205,
"train_tokens_per_second": 6895.383
},
{
"epoch": 0.45901639344262296,
"grad_norm": 0.20562049746513367,
"learning_rate": 0.00010870406189555127,
"loss": 0.9099,
"num_input_tokens_seen": 34220720,
"step": 714,
"train_runtime": 4962.5412,
"train_tokens_per_second": 6895.806
},
{
"epoch": 0.45965927354548375,
"grad_norm": 0.22300930321216583,
"learning_rate": 0.00010857511283043198,
"loss": 0.9613,
"num_input_tokens_seen": 34274288,
"step": 715,
"train_runtime": 4970.0724,
"train_tokens_per_second": 6896.135
},
{
"epoch": 0.4603021536483446,
"grad_norm": 0.21331855654716492,
"learning_rate": 0.00010844616376531271,
"loss": 0.9472,
"num_input_tokens_seen": 34320880,
"step": 716,
"train_runtime": 4976.636,
"train_tokens_per_second": 6896.402
},
{
"epoch": 0.4609450337512054,
"grad_norm": 0.21685561537742615,
"learning_rate": 0.00010831721470019343,
"loss": 1.0051,
"num_input_tokens_seen": 34376192,
"step": 717,
"train_runtime": 4984.3693,
"train_tokens_per_second": 6896.799
},
{
"epoch": 0.4615879138540662,
"grad_norm": 0.23412403464317322,
"learning_rate": 0.00010818826563507416,
"loss": 1.0075,
"num_input_tokens_seen": 34430176,
"step": 718,
"train_runtime": 4991.9671,
"train_tokens_per_second": 6897.116
},
{
"epoch": 0.462230793956927,
"grad_norm": 0.22776493430137634,
"learning_rate": 0.00010805931656995488,
"loss": 1.0074,
"num_input_tokens_seen": 34486272,
"step": 719,
"train_runtime": 4999.8436,
"train_tokens_per_second": 6897.47
},
{
"epoch": 0.46287367405978785,
"grad_norm": 0.21548962593078613,
"learning_rate": 0.00010793036750483561,
"loss": 0.9424,
"num_input_tokens_seen": 34556976,
"step": 720,
"train_runtime": 5009.7319,
"train_tokens_per_second": 6897.969
},
{
"epoch": 0.46351655416264864,
"grad_norm": 0.2266944944858551,
"learning_rate": 0.00010780141843971631,
"loss": 1.0024,
"num_input_tokens_seen": 34598672,
"step": 721,
"train_runtime": 5016.1173,
"train_tokens_per_second": 6897.501
},
{
"epoch": 0.4641594342655095,
"grad_norm": 0.23636233806610107,
"learning_rate": 0.00010767246937459703,
"loss": 1.0415,
"num_input_tokens_seen": 34637408,
"step": 722,
"train_runtime": 5021.57,
"train_tokens_per_second": 6897.725
},
{
"epoch": 0.4648023143683703,
"grad_norm": 0.21734626591205597,
"learning_rate": 0.00010754352030947776,
"loss": 0.9927,
"num_input_tokens_seen": 34677456,
"step": 723,
"train_runtime": 5027.186,
"train_tokens_per_second": 6897.985
},
{
"epoch": 0.4654451944712311,
"grad_norm": 0.19954009354114532,
"learning_rate": 0.00010741457124435847,
"loss": 1.0602,
"num_input_tokens_seen": 34722688,
"step": 724,
"train_runtime": 5033.5411,
"train_tokens_per_second": 6898.262
},
{
"epoch": 0.46608807457409196,
"grad_norm": 0.2060932070016861,
"learning_rate": 0.00010728562217923921,
"loss": 0.8783,
"num_input_tokens_seen": 34774800,
"step": 725,
"train_runtime": 5040.8584,
"train_tokens_per_second": 6898.587
},
{
"epoch": 0.46673095467695275,
"grad_norm": 0.2004295140504837,
"learning_rate": 0.00010715667311411992,
"loss": 0.8934,
"num_input_tokens_seen": 34810768,
"step": 726,
"train_runtime": 5045.9606,
"train_tokens_per_second": 6898.74
},
{
"epoch": 0.4673738347798136,
"grad_norm": 0.20946674048900604,
"learning_rate": 0.00010702772404900065,
"loss": 0.827,
"num_input_tokens_seen": 34863024,
"step": 727,
"train_runtime": 5053.2176,
"train_tokens_per_second": 6899.173
},
{
"epoch": 0.4680167148826744,
"grad_norm": 0.20330943167209625,
"learning_rate": 0.00010689877498388137,
"loss": 1.0435,
"num_input_tokens_seen": 34902256,
"step": 728,
"train_runtime": 5058.7326,
"train_tokens_per_second": 6899.407
},
{
"epoch": 0.4686595949855352,
"grad_norm": 0.21033909916877747,
"learning_rate": 0.0001067698259187621,
"loss": 0.9367,
"num_input_tokens_seen": 34961184,
"step": 729,
"train_runtime": 5067.0185,
"train_tokens_per_second": 6899.755
},
{
"epoch": 0.469302475088396,
"grad_norm": 0.21685197949409485,
"learning_rate": 0.00010664087685364282,
"loss": 1.0288,
"num_input_tokens_seen": 35004000,
"step": 730,
"train_runtime": 5073.0146,
"train_tokens_per_second": 6900.039
},
{
"epoch": 0.46994535519125685,
"grad_norm": 0.20428651571273804,
"learning_rate": 0.00010651192778852355,
"loss": 0.9739,
"num_input_tokens_seen": 35044128,
"step": 731,
"train_runtime": 5078.6457,
"train_tokens_per_second": 6900.29
},
{
"epoch": 0.47058823529411764,
"grad_norm": 0.20795543491840363,
"learning_rate": 0.00010638297872340425,
"loss": 0.9113,
"num_input_tokens_seen": 35076784,
"step": 732,
"train_runtime": 5083.3209,
"train_tokens_per_second": 6900.368
},
{
"epoch": 0.4712311153969785,
"grad_norm": 0.2232762724161148,
"learning_rate": 0.00010625402965828499,
"loss": 0.8051,
"num_input_tokens_seen": 35115712,
"step": 733,
"train_runtime": 5088.7741,
"train_tokens_per_second": 6900.623
},
{
"epoch": 0.47187399549983927,
"grad_norm": 0.2067340910434723,
"learning_rate": 0.0001061250805931657,
"loss": 0.9404,
"num_input_tokens_seen": 35148368,
"step": 734,
"train_runtime": 5093.3669,
"train_tokens_per_second": 6900.812
},
{
"epoch": 0.4725168756027001,
"grad_norm": 0.21283183991909027,
"learning_rate": 0.00010599613152804642,
"loss": 0.9125,
"num_input_tokens_seen": 35185088,
"step": 735,
"train_runtime": 5098.5136,
"train_tokens_per_second": 6901.048
},
{
"epoch": 0.4731597557055609,
"grad_norm": 0.22728654742240906,
"learning_rate": 0.00010586718246292715,
"loss": 1.0397,
"num_input_tokens_seen": 35232928,
"step": 736,
"train_runtime": 5105.159,
"train_tokens_per_second": 6901.436
},
{
"epoch": 0.47380263580842175,
"grad_norm": 0.22465203702449799,
"learning_rate": 0.00010573823339780786,
"loss": 0.9188,
"num_input_tokens_seen": 35280848,
"step": 737,
"train_runtime": 5111.7911,
"train_tokens_per_second": 6901.856
},
{
"epoch": 0.47444551591128253,
"grad_norm": 0.21893534064292908,
"learning_rate": 0.00010560928433268859,
"loss": 1.0128,
"num_input_tokens_seen": 35339920,
"step": 738,
"train_runtime": 5120.1115,
"train_tokens_per_second": 6902.178
},
{
"epoch": 0.4750883960141434,
"grad_norm": 0.22276096045970917,
"learning_rate": 0.00010548033526756931,
"loss": 0.9431,
"num_input_tokens_seen": 35388384,
"step": 739,
"train_runtime": 5126.8792,
"train_tokens_per_second": 6902.52
},
{
"epoch": 0.47573127611700416,
"grad_norm": 0.21816401183605194,
"learning_rate": 0.00010535138620245004,
"loss": 1.0065,
"num_input_tokens_seen": 35431600,
"step": 740,
"train_runtime": 5132.9116,
"train_tokens_per_second": 6902.827
},
{
"epoch": 0.476374156219865,
"grad_norm": 0.2419298142194748,
"learning_rate": 0.00010522243713733076,
"loss": 1.009,
"num_input_tokens_seen": 35486368,
"step": 741,
"train_runtime": 5140.5982,
"train_tokens_per_second": 6903.159
},
{
"epoch": 0.4770170363227258,
"grad_norm": 0.2303159534931183,
"learning_rate": 0.00010509348807221149,
"loss": 1.0134,
"num_input_tokens_seen": 35520352,
"step": 742,
"train_runtime": 5145.3929,
"train_tokens_per_second": 6903.331
},
{
"epoch": 0.47765991642558664,
"grad_norm": 0.21811984479427338,
"learning_rate": 0.0001049645390070922,
"loss": 0.8346,
"num_input_tokens_seen": 35557856,
"step": 743,
"train_runtime": 5150.6741,
"train_tokens_per_second": 6903.534
},
{
"epoch": 0.4783027965284474,
"grad_norm": 0.22950100898742676,
"learning_rate": 0.00010483558994197294,
"loss": 0.9851,
"num_input_tokens_seen": 35603856,
"step": 744,
"train_runtime": 5157.1004,
"train_tokens_per_second": 6903.852
},
{
"epoch": 0.47894567663130827,
"grad_norm": 0.22559398412704468,
"learning_rate": 0.00010470664087685364,
"loss": 0.9259,
"num_input_tokens_seen": 35647760,
"step": 745,
"train_runtime": 5163.2802,
"train_tokens_per_second": 6904.092
},
{
"epoch": 0.47958855673416906,
"grad_norm": 0.2145167589187622,
"learning_rate": 0.00010457769181173438,
"loss": 0.9911,
"num_input_tokens_seen": 35698448,
"step": 746,
"train_runtime": 5170.3491,
"train_tokens_per_second": 6904.456
},
{
"epoch": 0.4802314368370299,
"grad_norm": 0.20136818289756775,
"learning_rate": 0.0001044487427466151,
"loss": 0.8966,
"num_input_tokens_seen": 35744928,
"step": 747,
"train_runtime": 5176.8823,
"train_tokens_per_second": 6904.721
},
{
"epoch": 0.4808743169398907,
"grad_norm": 0.2237679660320282,
"learning_rate": 0.0001043197936814958,
"loss": 0.8031,
"num_input_tokens_seen": 35782080,
"step": 748,
"train_runtime": 5182.113,
"train_tokens_per_second": 6904.921
},
{
"epoch": 0.48151719704275153,
"grad_norm": 0.22918713092803955,
"learning_rate": 0.00010419084461637654,
"loss": 0.898,
"num_input_tokens_seen": 35823216,
"step": 749,
"train_runtime": 5187.9503,
"train_tokens_per_second": 6905.081
},
{
"epoch": 0.4821600771456123,
"grad_norm": 0.21593888103961945,
"learning_rate": 0.00010406189555125725,
"loss": 0.9395,
"num_input_tokens_seen": 35862640,
"step": 750,
"train_runtime": 5193.54,
"train_tokens_per_second": 6905.24
},
{
"epoch": 0.48280295724847316,
"grad_norm": 0.24713970720767975,
"learning_rate": 0.00010393294648613798,
"loss": 0.9388,
"num_input_tokens_seen": 35913136,
"step": 751,
"train_runtime": 5201.1565,
"train_tokens_per_second": 6904.837
},
{
"epoch": 0.48344583735133395,
"grad_norm": 0.21903486549854279,
"learning_rate": 0.0001038039974210187,
"loss": 1.0879,
"num_input_tokens_seen": 35988592,
"step": 752,
"train_runtime": 5211.7508,
"train_tokens_per_second": 6905.279
},
{
"epoch": 0.4840887174541948,
"grad_norm": 0.21665923297405243,
"learning_rate": 0.00010367504835589943,
"loss": 1.2186,
"num_input_tokens_seen": 36034608,
"step": 753,
"train_runtime": 5218.1905,
"train_tokens_per_second": 6905.575
},
{
"epoch": 0.4847315975570556,
"grad_norm": 0.23793700337409973,
"learning_rate": 0.00010354609929078013,
"loss": 0.9369,
"num_input_tokens_seen": 36084560,
"step": 754,
"train_runtime": 5225.0719,
"train_tokens_per_second": 6906.041
},
{
"epoch": 0.4853744776599164,
"grad_norm": 0.22704121470451355,
"learning_rate": 0.00010341715022566088,
"loss": 1.0209,
"num_input_tokens_seen": 36123968,
"step": 755,
"train_runtime": 5230.5664,
"train_tokens_per_second": 6906.32
},
{
"epoch": 0.48601735776277727,
"grad_norm": 0.21854600310325623,
"learning_rate": 0.00010328820116054158,
"loss": 0.9209,
"num_input_tokens_seen": 36160400,
"step": 756,
"train_runtime": 5235.7065,
"train_tokens_per_second": 6906.499
},
{
"epoch": 0.48666023786563806,
"grad_norm": 0.21820661425590515,
"learning_rate": 0.00010315925209542232,
"loss": 0.8536,
"num_input_tokens_seen": 36201760,
"step": 757,
"train_runtime": 5241.4811,
"train_tokens_per_second": 6906.781
},
{
"epoch": 0.4873031179684989,
"grad_norm": 0.2267056107521057,
"learning_rate": 0.00010303030303030303,
"loss": 1.039,
"num_input_tokens_seen": 36241792,
"step": 758,
"train_runtime": 5247.1175,
"train_tokens_per_second": 6906.991
},
{
"epoch": 0.4879459980713597,
"grad_norm": 0.21134983003139496,
"learning_rate": 0.00010290135396518377,
"loss": 0.9895,
"num_input_tokens_seen": 36283280,
"step": 759,
"train_runtime": 5252.9079,
"train_tokens_per_second": 6907.275
},
{
"epoch": 0.48858887817422053,
"grad_norm": 0.2200525552034378,
"learning_rate": 0.00010277240490006448,
"loss": 1.0206,
"num_input_tokens_seen": 36322064,
"step": 760,
"train_runtime": 5258.4012,
"train_tokens_per_second": 6907.435
},
{
"epoch": 0.4892317582770813,
"grad_norm": 0.2264779657125473,
"learning_rate": 0.00010264345583494522,
"loss": 0.9971,
"num_input_tokens_seen": 36358512,
"step": 761,
"train_runtime": 5263.5554,
"train_tokens_per_second": 6907.596
},
{
"epoch": 0.48987463837994216,
"grad_norm": 0.20705893635749817,
"learning_rate": 0.00010251450676982592,
"loss": 0.8841,
"num_input_tokens_seen": 36395296,
"step": 762,
"train_runtime": 5268.7278,
"train_tokens_per_second": 6907.796
},
{
"epoch": 0.49051751848280295,
"grad_norm": 0.21519790589809418,
"learning_rate": 0.00010238555770470664,
"loss": 0.8807,
"num_input_tokens_seen": 36449152,
"step": 763,
"train_runtime": 5276.297,
"train_tokens_per_second": 6908.093
},
{
"epoch": 0.4911603985856638,
"grad_norm": 0.19477756321430206,
"learning_rate": 0.00010225660863958737,
"loss": 1.0622,
"num_input_tokens_seen": 36529264,
"step": 764,
"train_runtime": 5287.6156,
"train_tokens_per_second": 6908.457
},
{
"epoch": 0.4918032786885246,
"grad_norm": 0.22233176231384277,
"learning_rate": 0.00010212765957446809,
"loss": 1.0275,
"num_input_tokens_seen": 36579232,
"step": 765,
"train_runtime": 5294.6526,
"train_tokens_per_second": 6908.712
},
{
"epoch": 0.4924461587913854,
"grad_norm": 0.20059292018413544,
"learning_rate": 0.00010199871050934882,
"loss": 0.9885,
"num_input_tokens_seen": 36654368,
"step": 766,
"train_runtime": 5305.214,
"train_tokens_per_second": 6909.121
},
{
"epoch": 0.4930890388942462,
"grad_norm": 0.2213578075170517,
"learning_rate": 0.00010186976144422952,
"loss": 1.066,
"num_input_tokens_seen": 36694352,
"step": 767,
"train_runtime": 5310.8501,
"train_tokens_per_second": 6909.318
},
{
"epoch": 0.49373191899710706,
"grad_norm": 0.21473011374473572,
"learning_rate": 0.00010174081237911026,
"loss": 1.0383,
"num_input_tokens_seen": 36753792,
"step": 768,
"train_runtime": 5319.2558,
"train_tokens_per_second": 6909.574
},
{
"epoch": 0.49437479909996784,
"grad_norm": 0.22463928163051605,
"learning_rate": 0.00010161186331399097,
"loss": 0.9858,
"num_input_tokens_seen": 36822496,
"step": 769,
"train_runtime": 5328.9486,
"train_tokens_per_second": 6909.899
},
{
"epoch": 0.4950176792028287,
"grad_norm": 0.2096138745546341,
"learning_rate": 0.0001014829142488717,
"loss": 0.856,
"num_input_tokens_seen": 36871792,
"step": 770,
"train_runtime": 5335.831,
"train_tokens_per_second": 6910.225
},
{
"epoch": 0.4956605593056895,
"grad_norm": 0.2219269871711731,
"learning_rate": 0.00010135396518375242,
"loss": 0.8585,
"num_input_tokens_seen": 36914608,
"step": 771,
"train_runtime": 5341.8262,
"train_tokens_per_second": 6910.485
},
{
"epoch": 0.4963034394085503,
"grad_norm": 0.19027844071388245,
"learning_rate": 0.00010122501611863316,
"loss": 0.9252,
"num_input_tokens_seen": 36966544,
"step": 772,
"train_runtime": 5349.0613,
"train_tokens_per_second": 6910.847
},
{
"epoch": 0.4969463195114111,
"grad_norm": 0.23160985112190247,
"learning_rate": 0.00010109606705351386,
"loss": 1.0037,
"num_input_tokens_seen": 37004928,
"step": 773,
"train_runtime": 5354.4843,
"train_tokens_per_second": 6911.016
},
{
"epoch": 0.49758919961427195,
"grad_norm": 0.2228197604417801,
"learning_rate": 0.0001009671179883946,
"loss": 0.9763,
"num_input_tokens_seen": 37045872,
"step": 774,
"train_runtime": 5360.271,
"train_tokens_per_second": 6911.194
},
{
"epoch": 0.49823207971713274,
"grad_norm": 0.2354273945093155,
"learning_rate": 0.00010083816892327531,
"loss": 1.0797,
"num_input_tokens_seen": 37115744,
"step": 775,
"train_runtime": 5370.0681,
"train_tokens_per_second": 6911.596
},
{
"epoch": 0.4988749598199936,
"grad_norm": 0.22572071850299835,
"learning_rate": 0.00010070921985815603,
"loss": 0.9801,
"num_input_tokens_seen": 37167536,
"step": 776,
"train_runtime": 5377.3506,
"train_tokens_per_second": 6911.868
},
{
"epoch": 0.49951783992285437,
"grad_norm": 0.22266492247581482,
"learning_rate": 0.00010058027079303676,
"loss": 1.0543,
"num_input_tokens_seen": 37222160,
"step": 777,
"train_runtime": 5385.0841,
"train_tokens_per_second": 6912.085
},
{
"epoch": 0.5001607200257152,
"grad_norm": 0.21932601928710938,
"learning_rate": 0.00010045132172791746,
"loss": 0.9456,
"num_input_tokens_seen": 37267312,
"step": 778,
"train_runtime": 5391.4001,
"train_tokens_per_second": 6912.363
},
{
"epoch": 0.500803600128576,
"grad_norm": 0.22067613899707794,
"learning_rate": 0.00010032237266279821,
"loss": 0.979,
"num_input_tokens_seen": 37312176,
"step": 779,
"train_runtime": 5397.7267,
"train_tokens_per_second": 6912.572
},
{
"epoch": 0.5014464802314368,
"grad_norm": 0.22810345888137817,
"learning_rate": 0.00010019342359767891,
"loss": 1.0039,
"num_input_tokens_seen": 37372080,
"step": 780,
"train_runtime": 5406.202,
"train_tokens_per_second": 6912.816
},
{
"epoch": 0.5014464802314368,
"eval_loss": 1.0119534730911255,
"eval_runtime": 40.1144,
"eval_samples_per_second": 24.779,
"eval_steps_per_second": 1.571,
"num_input_tokens_seen": 37372080,
"step": 780
},
{
"epoch": 0.5020893603342976,
"grad_norm": 0.2170599102973938,
"learning_rate": 0.00010006447453255965,
"loss": 0.9351,
"num_input_tokens_seen": 37405264,
"step": 781,
"train_runtime": 5451.6653,
"train_tokens_per_second": 6861.255
},
{
"epoch": 0.5027322404371585,
"grad_norm": 0.21231862902641296,
"learning_rate": 9.993552546744036e-05,
"loss": 0.9615,
"num_input_tokens_seen": 37447872,
"step": 782,
"train_runtime": 5457.6793,
"train_tokens_per_second": 6861.501
},
{
"epoch": 0.5033751205400193,
"grad_norm": 0.2113790363073349,
"learning_rate": 9.980657640232108e-05,
"loss": 1.0439,
"num_input_tokens_seen": 37488944,
"step": 783,
"train_runtime": 5463.5208,
"train_tokens_per_second": 6861.682
},
{
"epoch": 0.50401800064288,
"grad_norm": 0.2181268185377121,
"learning_rate": 9.96776273372018e-05,
"loss": 1.0294,
"num_input_tokens_seen": 37556592,
"step": 784,
"train_runtime": 5473.0127,
"train_tokens_per_second": 6862.142
},
{
"epoch": 0.5046608807457409,
"grad_norm": 0.2144027054309845,
"learning_rate": 9.954867827208253e-05,
"loss": 0.9804,
"num_input_tokens_seen": 37592480,
"step": 785,
"train_runtime": 5478.0658,
"train_tokens_per_second": 6862.364
},
{
"epoch": 0.5053037608486017,
"grad_norm": 0.2277204841375351,
"learning_rate": 9.941972920696325e-05,
"loss": 1.0026,
"num_input_tokens_seen": 37631008,
"step": 786,
"train_runtime": 5483.4784,
"train_tokens_per_second": 6862.616
},
{
"epoch": 0.5059466409514626,
"grad_norm": 0.2240583598613739,
"learning_rate": 9.929078014184398e-05,
"loss": 0.9938,
"num_input_tokens_seen": 37670928,
"step": 787,
"train_runtime": 5489.1164,
"train_tokens_per_second": 6862.84
},
{
"epoch": 0.5065895210543234,
"grad_norm": 0.2214142084121704,
"learning_rate": 9.91618310767247e-05,
"loss": 0.9126,
"num_input_tokens_seen": 37706112,
"step": 788,
"train_runtime": 5494.179,
"train_tokens_per_second": 6862.92
},
{
"epoch": 0.5072324011571842,
"grad_norm": 0.27018073201179504,
"learning_rate": 9.903288201160542e-05,
"loss": 1.1332,
"num_input_tokens_seen": 37774016,
"step": 789,
"train_runtime": 5503.7935,
"train_tokens_per_second": 6863.269
},
{
"epoch": 0.507875281260045,
"grad_norm": 0.2212986946105957,
"learning_rate": 9.890393294648615e-05,
"loss": 1.0088,
"num_input_tokens_seen": 37829152,
"step": 790,
"train_runtime": 5511.5653,
"train_tokens_per_second": 6863.595
},
{
"epoch": 0.5085181613629058,
"grad_norm": 0.2240961641073227,
"learning_rate": 9.877498388136687e-05,
"loss": 1.0432,
"num_input_tokens_seen": 37897120,
"step": 791,
"train_runtime": 5521.1096,
"train_tokens_per_second": 6864.04
},
{
"epoch": 0.5091610414657667,
"grad_norm": 0.22257636487483978,
"learning_rate": 9.864603481624759e-05,
"loss": 0.8842,
"num_input_tokens_seen": 37958560,
"step": 792,
"train_runtime": 5529.7519,
"train_tokens_per_second": 6864.424
},
{
"epoch": 0.5098039215686274,
"grad_norm": 0.22161521017551422,
"learning_rate": 9.851708575112832e-05,
"loss": 0.9624,
"num_input_tokens_seen": 37996224,
"step": 793,
"train_runtime": 5535.1111,
"train_tokens_per_second": 6864.582
},
{
"epoch": 0.5104468016714883,
"grad_norm": 0.22766484320163727,
"learning_rate": 9.838813668600904e-05,
"loss": 1.0029,
"num_input_tokens_seen": 38037360,
"step": 794,
"train_runtime": 5540.9151,
"train_tokens_per_second": 6864.816
},
{
"epoch": 0.5110896817743491,
"grad_norm": 0.20991362631320953,
"learning_rate": 9.825918762088975e-05,
"loss": 0.985,
"num_input_tokens_seen": 38071184,
"step": 795,
"train_runtime": 5545.7174,
"train_tokens_per_second": 6864.97
},
{
"epoch": 0.51173256187721,
"grad_norm": 0.20548021793365479,
"learning_rate": 9.813023855577047e-05,
"loss": 0.9304,
"num_input_tokens_seen": 38114448,
"step": 796,
"train_runtime": 5551.8401,
"train_tokens_per_second": 6865.192
},
{
"epoch": 0.5123754419800707,
"grad_norm": 0.21104614436626434,
"learning_rate": 9.800128949065119e-05,
"loss": 0.9289,
"num_input_tokens_seen": 38169520,
"step": 797,
"train_runtime": 5559.6111,
"train_tokens_per_second": 6865.502
},
{
"epoch": 0.5130183220829315,
"grad_norm": 0.261750191450119,
"learning_rate": 9.787234042553192e-05,
"loss": 1.0508,
"num_input_tokens_seen": 38217456,
"step": 798,
"train_runtime": 5566.3756,
"train_tokens_per_second": 6865.77
},
{
"epoch": 0.5136612021857924,
"grad_norm": 0.21956448256969452,
"learning_rate": 9.774339136041264e-05,
"loss": 1.0698,
"num_input_tokens_seen": 38264448,
"step": 799,
"train_runtime": 5572.9589,
"train_tokens_per_second": 6866.092
},
{
"epoch": 0.5143040822886532,
"grad_norm": 0.21060562133789062,
"learning_rate": 9.761444229529336e-05,
"loss": 0.9054,
"num_input_tokens_seen": 38323808,
"step": 800,
"train_runtime": 5581.3308,
"train_tokens_per_second": 6866.428
},
{
"epoch": 0.5149469623915139,
"grad_norm": 0.21071135997772217,
"learning_rate": 9.748549323017409e-05,
"loss": 0.8784,
"num_input_tokens_seen": 38387104,
"step": 801,
"train_runtime": 5590.2262,
"train_tokens_per_second": 6866.825
},
{
"epoch": 0.5155898424943748,
"grad_norm": 0.21163177490234375,
"learning_rate": 9.735654416505481e-05,
"loss": 0.9145,
"num_input_tokens_seen": 38431408,
"step": 802,
"train_runtime": 5596.5181,
"train_tokens_per_second": 6867.021
},
{
"epoch": 0.5162327225972356,
"grad_norm": 0.22283923625946045,
"learning_rate": 9.722759509993553e-05,
"loss": 0.958,
"num_input_tokens_seen": 38494624,
"step": 803,
"train_runtime": 5605.4124,
"train_tokens_per_second": 6867.403
},
{
"epoch": 0.5168756027000965,
"grad_norm": 0.22431445121765137,
"learning_rate": 9.709864603481626e-05,
"loss": 1.0125,
"num_input_tokens_seen": 38539232,
"step": 804,
"train_runtime": 5611.6718,
"train_tokens_per_second": 6867.692
},
{
"epoch": 0.5175184828029572,
"grad_norm": 0.23587460815906525,
"learning_rate": 9.696969696969698e-05,
"loss": 1.0458,
"num_input_tokens_seen": 38576064,
"step": 805,
"train_runtime": 5616.914,
"train_tokens_per_second": 6867.84
},
{
"epoch": 0.518161362905818,
"grad_norm": 0.207449272274971,
"learning_rate": 9.68407479045777e-05,
"loss": 1.0524,
"num_input_tokens_seen": 38632640,
"step": 806,
"train_runtime": 5624.8634,
"train_tokens_per_second": 6868.192
},
{
"epoch": 0.5188042430086789,
"grad_norm": 0.21176041662693024,
"learning_rate": 9.671179883945843e-05,
"loss": 0.9592,
"num_input_tokens_seen": 38682864,
"step": 807,
"train_runtime": 5631.9549,
"train_tokens_per_second": 6868.461
},
{
"epoch": 0.5194471231115397,
"grad_norm": 0.21222098171710968,
"learning_rate": 9.658284977433914e-05,
"loss": 0.9656,
"num_input_tokens_seen": 38726928,
"step": 808,
"train_runtime": 5638.1731,
"train_tokens_per_second": 6868.701
},
{
"epoch": 0.5200900032144005,
"grad_norm": 0.2217748910188675,
"learning_rate": 9.645390070921986e-05,
"loss": 1.1452,
"num_input_tokens_seen": 38768208,
"step": 809,
"train_runtime": 5643.9671,
"train_tokens_per_second": 6868.964
},
{
"epoch": 0.5207328833172613,
"grad_norm": 0.2218509018421173,
"learning_rate": 9.632495164410058e-05,
"loss": 1.0318,
"num_input_tokens_seen": 38814848,
"step": 810,
"train_runtime": 5650.5568,
"train_tokens_per_second": 6869.208
},
{
"epoch": 0.5213757634201222,
"grad_norm": 0.21409547328948975,
"learning_rate": 9.61960025789813e-05,
"loss": 1.0752,
"num_input_tokens_seen": 38852192,
"step": 811,
"train_runtime": 5656.3876,
"train_tokens_per_second": 6868.729
},
{
"epoch": 0.522018643522983,
"grad_norm": 0.2177419811487198,
"learning_rate": 9.606705351386203e-05,
"loss": 0.9027,
"num_input_tokens_seen": 38899840,
"step": 812,
"train_runtime": 5663.0105,
"train_tokens_per_second": 6869.11
},
{
"epoch": 0.5226615236258437,
"grad_norm": 0.20673255622386932,
"learning_rate": 9.593810444874275e-05,
"loss": 0.9976,
"num_input_tokens_seen": 38941680,
"step": 813,
"train_runtime": 5668.9566,
"train_tokens_per_second": 6869.285
},
{
"epoch": 0.5233044037287046,
"grad_norm": 0.22064630687236786,
"learning_rate": 9.580915538362347e-05,
"loss": 1.053,
"num_input_tokens_seen": 38995920,
"step": 814,
"train_runtime": 5676.6459,
"train_tokens_per_second": 6869.535
},
{
"epoch": 0.5239472838315654,
"grad_norm": 0.19912369549274445,
"learning_rate": 9.56802063185042e-05,
"loss": 0.9567,
"num_input_tokens_seen": 39033728,
"step": 815,
"train_runtime": 5681.9727,
"train_tokens_per_second": 6869.749
},
{
"epoch": 0.5245901639344263,
"grad_norm": 0.2328333854675293,
"learning_rate": 9.555125725338492e-05,
"loss": 0.9518,
"num_input_tokens_seen": 39066896,
"step": 816,
"train_runtime": 5686.6796,
"train_tokens_per_second": 6869.896
},
{
"epoch": 0.5252330440372871,
"grad_norm": 0.2665647268295288,
"learning_rate": 9.542230818826565e-05,
"loss": 0.9155,
"num_input_tokens_seen": 39112144,
"step": 817,
"train_runtime": 5693.0716,
"train_tokens_per_second": 6870.13
},
{
"epoch": 0.5258759241401478,
"grad_norm": 0.21602346003055573,
"learning_rate": 9.529335912314637e-05,
"loss": 0.9097,
"num_input_tokens_seen": 39169712,
"step": 818,
"train_runtime": 5701.2268,
"train_tokens_per_second": 6870.401
},
{
"epoch": 0.5265188042430087,
"grad_norm": 0.21335062384605408,
"learning_rate": 9.516441005802708e-05,
"loss": 0.9175,
"num_input_tokens_seen": 39226352,
"step": 819,
"train_runtime": 5709.206,
"train_tokens_per_second": 6870.719
},
{
"epoch": 0.5271616843458695,
"grad_norm": 0.21426311135292053,
"learning_rate": 9.503546099290782e-05,
"loss": 1.0489,
"num_input_tokens_seen": 39276496,
"step": 820,
"train_runtime": 5716.279,
"train_tokens_per_second": 6870.99
},
{
"epoch": 0.5278045644487304,
"grad_norm": 0.22840139269828796,
"learning_rate": 9.490651192778853e-05,
"loss": 0.9286,
"num_input_tokens_seen": 39316784,
"step": 821,
"train_runtime": 5721.9319,
"train_tokens_per_second": 6871.243
},
{
"epoch": 0.5284474445515911,
"grad_norm": 0.22848589718341827,
"learning_rate": 9.477756286266924e-05,
"loss": 0.9535,
"num_input_tokens_seen": 39354496,
"step": 822,
"train_runtime": 5727.2483,
"train_tokens_per_second": 6871.449
},
{
"epoch": 0.5290903246544519,
"grad_norm": 0.21826131641864777,
"learning_rate": 9.464861379754997e-05,
"loss": 1.0541,
"num_input_tokens_seen": 39409184,
"step": 823,
"train_runtime": 5734.924,
"train_tokens_per_second": 6871.788
},
{
"epoch": 0.5297332047573128,
"grad_norm": 0.21087752282619476,
"learning_rate": 9.451966473243069e-05,
"loss": 1.0101,
"num_input_tokens_seen": 39446544,
"step": 824,
"train_runtime": 5740.2346,
"train_tokens_per_second": 6871.939
},
{
"epoch": 0.5303760848601736,
"grad_norm": 0.2084406465291977,
"learning_rate": 9.439071566731142e-05,
"loss": 0.8512,
"num_input_tokens_seen": 39491200,
"step": 825,
"train_runtime": 5746.5125,
"train_tokens_per_second": 6872.203
},
{
"epoch": 0.5310189649630344,
"grad_norm": 0.21428586542606354,
"learning_rate": 9.426176660219214e-05,
"loss": 0.9252,
"num_input_tokens_seen": 39526512,
"step": 826,
"train_runtime": 5751.5278,
"train_tokens_per_second": 6872.35
},
{
"epoch": 0.5316618450658952,
"grad_norm": 0.21495121717453003,
"learning_rate": 9.413281753707286e-05,
"loss": 0.9177,
"num_input_tokens_seen": 39582784,
"step": 827,
"train_runtime": 5759.4735,
"train_tokens_per_second": 6872.639
},
{
"epoch": 0.532304725168756,
"grad_norm": 0.23897185921669006,
"learning_rate": 9.400386847195359e-05,
"loss": 0.9302,
"num_input_tokens_seen": 39632240,
"step": 828,
"train_runtime": 5766.4408,
"train_tokens_per_second": 6872.912
},
{
"epoch": 0.5329476052716169,
"grad_norm": 0.21306166052818298,
"learning_rate": 9.38749194068343e-05,
"loss": 0.9407,
"num_input_tokens_seen": 39679152,
"step": 829,
"train_runtime": 5773.0632,
"train_tokens_per_second": 6873.154
},
{
"epoch": 0.5335904853744776,
"grad_norm": 0.24286721646785736,
"learning_rate": 9.374597034171502e-05,
"loss": 0.87,
"num_input_tokens_seen": 39729280,
"step": 830,
"train_runtime": 5780.0687,
"train_tokens_per_second": 6873.496
},
{
"epoch": 0.5342333654773385,
"grad_norm": 0.21733801066875458,
"learning_rate": 9.361702127659576e-05,
"loss": 1.0095,
"num_input_tokens_seen": 39769760,
"step": 831,
"train_runtime": 5785.7904,
"train_tokens_per_second": 6873.695
},
{
"epoch": 0.5348762455801993,
"grad_norm": 0.19941464066505432,
"learning_rate": 9.348807221147647e-05,
"loss": 0.8936,
"num_input_tokens_seen": 39811328,
"step": 832,
"train_runtime": 5791.6483,
"train_tokens_per_second": 6873.92
},
{
"epoch": 0.5355191256830601,
"grad_norm": 0.22359183430671692,
"learning_rate": 9.335912314635719e-05,
"loss": 1.0963,
"num_input_tokens_seen": 39847168,
"step": 833,
"train_runtime": 5796.7331,
"train_tokens_per_second": 6874.073
},
{
"epoch": 0.5361620057859209,
"grad_norm": 0.23717975616455078,
"learning_rate": 9.323017408123792e-05,
"loss": 0.9002,
"num_input_tokens_seen": 39909168,
"step": 834,
"train_runtime": 5805.3823,
"train_tokens_per_second": 6874.512
},
{
"epoch": 0.5368048858887817,
"grad_norm": 0.21464844048023224,
"learning_rate": 9.310122501611864e-05,
"loss": 0.9609,
"num_input_tokens_seen": 39953264,
"step": 835,
"train_runtime": 5811.6133,
"train_tokens_per_second": 6874.729
},
{
"epoch": 0.5374477659916426,
"grad_norm": 0.20704124867916107,
"learning_rate": 9.297227595099936e-05,
"loss": 0.9292,
"num_input_tokens_seen": 40025024,
"step": 836,
"train_runtime": 5821.7066,
"train_tokens_per_second": 6875.136
},
{
"epoch": 0.5380906460945034,
"grad_norm": 0.2311316728591919,
"learning_rate": 9.284332688588008e-05,
"loss": 1.0163,
"num_input_tokens_seen": 40068128,
"step": 837,
"train_runtime": 5827.7726,
"train_tokens_per_second": 6875.376
},
{
"epoch": 0.5387335261973641,
"grad_norm": 0.20525947213172913,
"learning_rate": 9.27143778207608e-05,
"loss": 0.8296,
"num_input_tokens_seen": 40106032,
"step": 838,
"train_runtime": 5833.108,
"train_tokens_per_second": 6875.585
},
{
"epoch": 0.539376406300225,
"grad_norm": 0.22608095407485962,
"learning_rate": 9.258542875564153e-05,
"loss": 0.9444,
"num_input_tokens_seen": 40150368,
"step": 839,
"train_runtime": 5839.3826,
"train_tokens_per_second": 6875.79
},
{
"epoch": 0.5400192864030858,
"grad_norm": 0.21035784482955933,
"learning_rate": 9.245647969052225e-05,
"loss": 0.9388,
"num_input_tokens_seen": 40202592,
"step": 840,
"train_runtime": 5846.7137,
"train_tokens_per_second": 6876.101
},
{
"epoch": 0.5406621665059467,
"grad_norm": 0.2148246020078659,
"learning_rate": 9.232753062540296e-05,
"loss": 0.9992,
"num_input_tokens_seen": 40260592,
"step": 841,
"train_runtime": 5855.3499,
"train_tokens_per_second": 6875.864
},
{
"epoch": 0.5413050466088074,
"grad_norm": 0.20591579377651215,
"learning_rate": 9.21985815602837e-05,
"loss": 1.0278,
"num_input_tokens_seen": 40296272,
"step": 842,
"train_runtime": 5860.3641,
"train_tokens_per_second": 6876.07
},
{
"epoch": 0.5419479267116682,
"grad_norm": 0.19806860387325287,
"learning_rate": 9.206963249516441e-05,
"loss": 0.941,
"num_input_tokens_seen": 40331984,
"step": 843,
"train_runtime": 5865.4433,
"train_tokens_per_second": 6876.204
},
{
"epoch": 0.5425908068145291,
"grad_norm": 0.2135857492685318,
"learning_rate": 9.194068343004513e-05,
"loss": 0.9578,
"num_input_tokens_seen": 40367648,
"step": 844,
"train_runtime": 5870.5212,
"train_tokens_per_second": 6876.331
},
{
"epoch": 0.5432336869173899,
"grad_norm": 0.20810310542583466,
"learning_rate": 9.181173436492586e-05,
"loss": 0.9486,
"num_input_tokens_seen": 40428800,
"step": 845,
"train_runtime": 5879.0687,
"train_tokens_per_second": 6876.735
},
{
"epoch": 0.5438765670202508,
"grad_norm": 0.2066211998462677,
"learning_rate": 9.168278529980658e-05,
"loss": 0.9881,
"num_input_tokens_seen": 40481600,
"step": 846,
"train_runtime": 5886.4452,
"train_tokens_per_second": 6877.088
},
{
"epoch": 0.5445194471231115,
"grad_norm": 0.22638893127441406,
"learning_rate": 9.155383623468731e-05,
"loss": 1.0343,
"num_input_tokens_seen": 40518064,
"step": 847,
"train_runtime": 5891.6303,
"train_tokens_per_second": 6877.224
},
{
"epoch": 0.5451623272259724,
"grad_norm": 0.2309054434299469,
"learning_rate": 9.142488716956803e-05,
"loss": 0.8937,
"num_input_tokens_seen": 40580432,
"step": 848,
"train_runtime": 5900.405,
"train_tokens_per_second": 6877.567
},
{
"epoch": 0.5458052073288332,
"grad_norm": 0.21096345782279968,
"learning_rate": 9.129593810444874e-05,
"loss": 0.9058,
"num_input_tokens_seen": 40636384,
"step": 849,
"train_runtime": 5908.2116,
"train_tokens_per_second": 6877.95
},
{
"epoch": 0.546448087431694,
"grad_norm": 0.23349037766456604,
"learning_rate": 9.116698903932947e-05,
"loss": 1.0517,
"num_input_tokens_seen": 40700768,
"step": 850,
"train_runtime": 5917.2501,
"train_tokens_per_second": 6878.325
},
{
"epoch": 0.5470909675345548,
"grad_norm": 0.24514555931091309,
"learning_rate": 9.103803997421019e-05,
"loss": 0.9398,
"num_input_tokens_seen": 40762272,
"step": 851,
"train_runtime": 5925.9076,
"train_tokens_per_second": 6878.655
},
{
"epoch": 0.5477338476374156,
"grad_norm": 0.2217293083667755,
"learning_rate": 9.090909090909092e-05,
"loss": 1.0893,
"num_input_tokens_seen": 40803104,
"step": 852,
"train_runtime": 5931.6651,
"train_tokens_per_second": 6878.862
},
{
"epoch": 0.5483767277402765,
"grad_norm": 0.21611201763153076,
"learning_rate": 9.078014184397164e-05,
"loss": 0.9538,
"num_input_tokens_seen": 40844208,
"step": 853,
"train_runtime": 5937.4707,
"train_tokens_per_second": 6879.058
},
{
"epoch": 0.5490196078431373,
"grad_norm": 0.21386729180812836,
"learning_rate": 9.065119277885235e-05,
"loss": 1.022,
"num_input_tokens_seen": 40903888,
"step": 854,
"train_runtime": 5945.8847,
"train_tokens_per_second": 6879.361
},
{
"epoch": 0.549662487945998,
"grad_norm": 0.22319400310516357,
"learning_rate": 9.052224371373309e-05,
"loss": 0.9228,
"num_input_tokens_seen": 40961344,
"step": 855,
"train_runtime": 5953.914,
"train_tokens_per_second": 6879.734
},
{
"epoch": 0.5503053680488589,
"grad_norm": 0.22674967348575592,
"learning_rate": 9.03932946486138e-05,
"loss": 0.9645,
"num_input_tokens_seen": 41008160,
"step": 856,
"train_runtime": 5960.523,
"train_tokens_per_second": 6879.96
},
{
"epoch": 0.5509482481517197,
"grad_norm": 0.23880483210086823,
"learning_rate": 9.026434558349452e-05,
"loss": 0.8906,
"num_input_tokens_seen": 41042464,
"step": 857,
"train_runtime": 5965.3763,
"train_tokens_per_second": 6880.113
},
{
"epoch": 0.5515911282545806,
"grad_norm": 0.21060539782047272,
"learning_rate": 9.013539651837525e-05,
"loss": 1.0402,
"num_input_tokens_seen": 41082064,
"step": 858,
"train_runtime": 5970.9961,
"train_tokens_per_second": 6880.27
},
{
"epoch": 0.5522340083574413,
"grad_norm": 0.2186761349439621,
"learning_rate": 9.000644745325597e-05,
"loss": 0.95,
"num_input_tokens_seen": 41123552,
"step": 859,
"train_runtime": 5976.8549,
"train_tokens_per_second": 6880.467
},
{
"epoch": 0.5528768884603021,
"grad_norm": 0.2016412615776062,
"learning_rate": 8.987749838813669e-05,
"loss": 0.9186,
"num_input_tokens_seen": 41168240,
"step": 860,
"train_runtime": 5983.0983,
"train_tokens_per_second": 6880.756
},
{
"epoch": 0.553519768563163,
"grad_norm": 0.21804280579090118,
"learning_rate": 8.974854932301742e-05,
"loss": 0.9289,
"num_input_tokens_seen": 41234384,
"step": 861,
"train_runtime": 5992.3826,
"train_tokens_per_second": 6881.133
},
{
"epoch": 0.5541626486660238,
"grad_norm": 0.21665385365486145,
"learning_rate": 8.961960025789814e-05,
"loss": 0.9558,
"num_input_tokens_seen": 41272016,
"step": 862,
"train_runtime": 5997.6849,
"train_tokens_per_second": 6881.324
},
{
"epoch": 0.5548055287688846,
"grad_norm": 0.2189703732728958,
"learning_rate": 8.949065119277886e-05,
"loss": 0.9443,
"num_input_tokens_seen": 41320896,
"step": 863,
"train_runtime": 6004.5713,
"train_tokens_per_second": 6881.573
},
{
"epoch": 0.5554484088717454,
"grad_norm": 0.2256087064743042,
"learning_rate": 8.936170212765958e-05,
"loss": 0.9379,
"num_input_tokens_seen": 41367872,
"step": 864,
"train_runtime": 6011.1948,
"train_tokens_per_second": 6881.805
},
{
"epoch": 0.5560912889746062,
"grad_norm": 0.22272774577140808,
"learning_rate": 8.92327530625403e-05,
"loss": 0.9655,
"num_input_tokens_seen": 41413008,
"step": 865,
"train_runtime": 6017.569,
"train_tokens_per_second": 6882.016
},
{
"epoch": 0.5567341690774671,
"grad_norm": 0.2210770696401596,
"learning_rate": 8.910380399742103e-05,
"loss": 0.9604,
"num_input_tokens_seen": 41457152,
"step": 866,
"train_runtime": 6023.8013,
"train_tokens_per_second": 6882.224
},
{
"epoch": 0.5573770491803278,
"grad_norm": 0.21450798213481903,
"learning_rate": 8.897485493230174e-05,
"loss": 1.0894,
"num_input_tokens_seen": 41521120,
"step": 867,
"train_runtime": 6032.7832,
"train_tokens_per_second": 6882.581
},
{
"epoch": 0.5580199292831887,
"grad_norm": 0.23895588517189026,
"learning_rate": 8.884590586718246e-05,
"loss": 0.8939,
"num_input_tokens_seen": 41581344,
"step": 868,
"train_runtime": 6041.1988,
"train_tokens_per_second": 6882.962
},
{
"epoch": 0.5586628093860495,
"grad_norm": 0.23894917964935303,
"learning_rate": 8.871695680206319e-05,
"loss": 0.9768,
"num_input_tokens_seen": 41618224,
"step": 869,
"train_runtime": 6046.4132,
"train_tokens_per_second": 6883.126
},
{
"epoch": 0.5593056894889104,
"grad_norm": 0.23007355630397797,
"learning_rate": 8.858800773694391e-05,
"loss": 0.9947,
"num_input_tokens_seen": 41655376,
"step": 870,
"train_runtime": 6051.6787,
"train_tokens_per_second": 6883.276
},
{
"epoch": 0.5599485695917711,
"grad_norm": 0.22590278089046478,
"learning_rate": 8.845905867182463e-05,
"loss": 0.8208,
"num_input_tokens_seen": 41687184,
"step": 871,
"train_runtime": 6056.7009,
"train_tokens_per_second": 6882.82
},
{
"epoch": 0.5605914496946319,
"grad_norm": 0.2513355016708374,
"learning_rate": 8.833010960670536e-05,
"loss": 1.1157,
"num_input_tokens_seen": 41779632,
"step": 872,
"train_runtime": 6069.7172,
"train_tokens_per_second": 6883.291
},
{
"epoch": 0.5612343297974928,
"grad_norm": 0.21992050111293793,
"learning_rate": 8.820116054158608e-05,
"loss": 1.0661,
"num_input_tokens_seen": 41819712,
"step": 873,
"train_runtime": 6075.3753,
"train_tokens_per_second": 6883.478
},
{
"epoch": 0.5618772099003536,
"grad_norm": 0.20959214866161346,
"learning_rate": 8.80722114764668e-05,
"loss": 1.1405,
"num_input_tokens_seen": 41864224,
"step": 874,
"train_runtime": 6081.6646,
"train_tokens_per_second": 6883.679
},
{
"epoch": 0.5625200900032143,
"grad_norm": 0.21922095119953156,
"learning_rate": 8.794326241134753e-05,
"loss": 0.9449,
"num_input_tokens_seen": 41895120,
"step": 875,
"train_runtime": 6086.082,
"train_tokens_per_second": 6883.759
},
{
"epoch": 0.5631629701060752,
"grad_norm": 0.2277074009180069,
"learning_rate": 8.781431334622823e-05,
"loss": 0.9949,
"num_input_tokens_seen": 41938720,
"step": 876,
"train_runtime": 6092.2718,
"train_tokens_per_second": 6883.921
},
{
"epoch": 0.563805850208936,
"grad_norm": 0.23298637568950653,
"learning_rate": 8.768536428110897e-05,
"loss": 1.0172,
"num_input_tokens_seen": 41987904,
"step": 877,
"train_runtime": 6099.2057,
"train_tokens_per_second": 6884.159
},
{
"epoch": 0.5644487303117969,
"grad_norm": 0.21925728023052216,
"learning_rate": 8.755641521598968e-05,
"loss": 0.9435,
"num_input_tokens_seen": 42027456,
"step": 878,
"train_runtime": 6104.797,
"train_tokens_per_second": 6884.333
},
{
"epoch": 0.5650916104146577,
"grad_norm": 0.2143392413854599,
"learning_rate": 8.74274661508704e-05,
"loss": 0.992,
"num_input_tokens_seen": 42088400,
"step": 879,
"train_runtime": 6113.3262,
"train_tokens_per_second": 6884.697
},
{
"epoch": 0.5657344905175185,
"grad_norm": 0.2037908136844635,
"learning_rate": 8.729851708575113e-05,
"loss": 0.8212,
"num_input_tokens_seen": 42121408,
"step": 880,
"train_runtime": 6118.001,
"train_tokens_per_second": 6884.832
},
{
"epoch": 0.5663773706203793,
"grad_norm": 0.21776051819324493,
"learning_rate": 8.716956802063185e-05,
"loss": 1.0319,
"num_input_tokens_seen": 42167056,
"step": 881,
"train_runtime": 6124.4423,
"train_tokens_per_second": 6885.044
},
{
"epoch": 0.5670202507232401,
"grad_norm": 0.1910998821258545,
"learning_rate": 8.704061895551258e-05,
"loss": 1.0724,
"num_input_tokens_seen": 42207408,
"step": 882,
"train_runtime": 6130.0885,
"train_tokens_per_second": 6885.285
},
{
"epoch": 0.567663130826101,
"grad_norm": 0.21779921650886536,
"learning_rate": 8.69116698903933e-05,
"loss": 0.9752,
"num_input_tokens_seen": 42249360,
"step": 883,
"train_runtime": 6136.0045,
"train_tokens_per_second": 6885.484
},
{
"epoch": 0.5683060109289617,
"grad_norm": 0.2009030431509018,
"learning_rate": 8.678272082527402e-05,
"loss": 0.9272,
"num_input_tokens_seen": 42307536,
"step": 884,
"train_runtime": 6144.1609,
"train_tokens_per_second": 6885.812
},
{
"epoch": 0.5689488910318226,
"grad_norm": 0.20714476704597473,
"learning_rate": 8.665377176015475e-05,
"loss": 0.9203,
"num_input_tokens_seen": 42365472,
"step": 885,
"train_runtime": 6152.2851,
"train_tokens_per_second": 6886.136
},
{
"epoch": 0.5695917711346834,
"grad_norm": 0.22802214324474335,
"learning_rate": 8.652482269503547e-05,
"loss": 1.0257,
"num_input_tokens_seen": 42429312,
"step": 886,
"train_runtime": 6161.2401,
"train_tokens_per_second": 6886.489
},
{
"epoch": 0.5702346512375442,
"grad_norm": 0.24137407541275024,
"learning_rate": 8.639587362991619e-05,
"loss": 1.0293,
"num_input_tokens_seen": 42468416,
"step": 887,
"train_runtime": 6166.8111,
"train_tokens_per_second": 6886.609
},
{
"epoch": 0.570877531340405,
"grad_norm": 0.23040415346622467,
"learning_rate": 8.626692456479692e-05,
"loss": 0.8444,
"num_input_tokens_seen": 42520688,
"step": 888,
"train_runtime": 6174.1119,
"train_tokens_per_second": 6886.932
},
{
"epoch": 0.5715204114432658,
"grad_norm": 0.19980192184448242,
"learning_rate": 8.613797549967764e-05,
"loss": 0.8182,
"num_input_tokens_seen": 42572048,
"step": 889,
"train_runtime": 6181.3308,
"train_tokens_per_second": 6887.198
},
{
"epoch": 0.5721632915461267,
"grad_norm": 0.22542989253997803,
"learning_rate": 8.600902643455835e-05,
"loss": 1.0732,
"num_input_tokens_seen": 42609424,
"step": 890,
"train_runtime": 6186.6135,
"train_tokens_per_second": 6887.358
},
{
"epoch": 0.5728061716489875,
"grad_norm": 0.23115967214107513,
"learning_rate": 8.588007736943907e-05,
"loss": 0.9204,
"num_input_tokens_seen": 42643936,
"step": 891,
"train_runtime": 6191.4711,
"train_tokens_per_second": 6887.529
},
{
"epoch": 0.5734490517518482,
"grad_norm": 0.23263217508792877,
"learning_rate": 8.575112830431979e-05,
"loss": 0.9213,
"num_input_tokens_seen": 42688720,
"step": 892,
"train_runtime": 6197.6985,
"train_tokens_per_second": 6887.834
},
{
"epoch": 0.5740919318547091,
"grad_norm": 0.22807829082012177,
"learning_rate": 8.562217923920052e-05,
"loss": 1.0849,
"num_input_tokens_seen": 42732496,
"step": 893,
"train_runtime": 6203.7686,
"train_tokens_per_second": 6888.151
},
{
"epoch": 0.5747348119575699,
"grad_norm": 0.21378318965435028,
"learning_rate": 8.549323017408124e-05,
"loss": 0.8884,
"num_input_tokens_seen": 42779216,
"step": 894,
"train_runtime": 6210.2206,
"train_tokens_per_second": 6888.518
},
{
"epoch": 0.5753776920604308,
"grad_norm": 0.20278410613536835,
"learning_rate": 8.536428110896196e-05,
"loss": 0.9375,
"num_input_tokens_seen": 42819792,
"step": 895,
"train_runtime": 6215.8757,
"train_tokens_per_second": 6888.779
},
{
"epoch": 0.5760205721632915,
"grad_norm": 0.20692852139472961,
"learning_rate": 8.523533204384269e-05,
"loss": 0.9632,
"num_input_tokens_seen": 42878464,
"step": 896,
"train_runtime": 6224.1169,
"train_tokens_per_second": 6889.084
},
{
"epoch": 0.5766634522661523,
"grad_norm": 0.2214338183403015,
"learning_rate": 8.510638297872341e-05,
"loss": 1.0123,
"num_input_tokens_seen": 42932576,
"step": 897,
"train_runtime": 6231.7369,
"train_tokens_per_second": 6889.344
},
{
"epoch": 0.5773063323690132,
"grad_norm": 0.2511458992958069,
"learning_rate": 8.497743391360413e-05,
"loss": 0.8736,
"num_input_tokens_seen": 43004368,
"step": 898,
"train_runtime": 6241.8144,
"train_tokens_per_second": 6889.722
},
{
"epoch": 0.577949212471874,
"grad_norm": 0.21616335213184357,
"learning_rate": 8.484848484848486e-05,
"loss": 0.8995,
"num_input_tokens_seen": 43039600,
"step": 899,
"train_runtime": 6246.7721,
"train_tokens_per_second": 6889.894
},
{
"epoch": 0.5785920925747348,
"grad_norm": 0.22274382412433624,
"learning_rate": 8.471953578336558e-05,
"loss": 1.0423,
"num_input_tokens_seen": 43085184,
"step": 900,
"train_runtime": 6253.1468,
"train_tokens_per_second": 6890.16
},
{
"epoch": 0.5792349726775956,
"grad_norm": 0.22178566455841064,
"learning_rate": 8.45905867182463e-05,
"loss": 0.9354,
"num_input_tokens_seen": 43164352,
"step": 901,
"train_runtime": 6264.699,
"train_tokens_per_second": 6890.092
},
{
"epoch": 0.5798778527804564,
"grad_norm": 0.22248417139053345,
"learning_rate": 8.446163765312703e-05,
"loss": 1.0238,
"num_input_tokens_seen": 43196160,
"step": 902,
"train_runtime": 6269.2226,
"train_tokens_per_second": 6890.194
},
{
"epoch": 0.5805207328833173,
"grad_norm": 0.20994658768177032,
"learning_rate": 8.433268858800773e-05,
"loss": 1.0422,
"num_input_tokens_seen": 43258992,
"step": 903,
"train_runtime": 6278.1231,
"train_tokens_per_second": 6890.434
},
{
"epoch": 0.581163612986178,
"grad_norm": 0.23427492380142212,
"learning_rate": 8.420373952288846e-05,
"loss": 0.9556,
"num_input_tokens_seen": 43328208,
"step": 904,
"train_runtime": 6287.8019,
"train_tokens_per_second": 6890.835
},
{
"epoch": 0.5818064930890389,
"grad_norm": 0.24690331518650055,
"learning_rate": 8.407479045776918e-05,
"loss": 0.9847,
"num_input_tokens_seen": 43381440,
"step": 905,
"train_runtime": 6295.28,
"train_tokens_per_second": 6891.106
},
{
"epoch": 0.5824493731918997,
"grad_norm": 0.1973118931055069,
"learning_rate": 8.39458413926499e-05,
"loss": 0.8898,
"num_input_tokens_seen": 43428560,
"step": 906,
"train_runtime": 6301.8974,
"train_tokens_per_second": 6891.347
},
{
"epoch": 0.5830922532947606,
"grad_norm": 0.2366381287574768,
"learning_rate": 8.381689232753063e-05,
"loss": 0.9489,
"num_input_tokens_seen": 43467968,
"step": 907,
"train_runtime": 6307.4496,
"train_tokens_per_second": 6891.528
},
{
"epoch": 0.5837351333976214,
"grad_norm": 0.23190288245677948,
"learning_rate": 8.368794326241135e-05,
"loss": 0.8342,
"num_input_tokens_seen": 43531200,
"step": 908,
"train_runtime": 6316.3141,
"train_tokens_per_second": 6891.868
},
{
"epoch": 0.5843780135004821,
"grad_norm": 0.23574669659137726,
"learning_rate": 8.355899419729207e-05,
"loss": 1.1343,
"num_input_tokens_seen": 43599280,
"step": 909,
"train_runtime": 6325.8663,
"train_tokens_per_second": 6892.223
},
{
"epoch": 0.585020893603343,
"grad_norm": 0.21268287301063538,
"learning_rate": 8.34300451321728e-05,
"loss": 0.8419,
"num_input_tokens_seen": 43637872,
"step": 910,
"train_runtime": 6331.2741,
"train_tokens_per_second": 6892.431
},
{
"epoch": 0.5856637737062038,
"grad_norm": 0.2215997725725174,
"learning_rate": 8.330109606705352e-05,
"loss": 1.0209,
"num_input_tokens_seen": 43689440,
"step": 911,
"train_runtime": 6338.5247,
"train_tokens_per_second": 6892.683
},
{
"epoch": 0.5863066538090647,
"grad_norm": 0.21488438546657562,
"learning_rate": 8.317214700193425e-05,
"loss": 0.86,
"num_input_tokens_seen": 43746672,
"step": 912,
"train_runtime": 6346.582,
"train_tokens_per_second": 6892.95
},
{
"epoch": 0.5869495339119254,
"grad_norm": 0.23541532456874847,
"learning_rate": 8.304319793681497e-05,
"loss": 0.9567,
"num_input_tokens_seen": 43817744,
"step": 913,
"train_runtime": 6356.4817,
"train_tokens_per_second": 6893.396
},
{
"epoch": 0.5875924140147862,
"grad_norm": 0.22803905606269836,
"learning_rate": 8.291424887169568e-05,
"loss": 1.1268,
"num_input_tokens_seen": 43851520,
"step": 914,
"train_runtime": 6361.3016,
"train_tokens_per_second": 6893.482
},
{
"epoch": 0.5882352941176471,
"grad_norm": 0.21955518424510956,
"learning_rate": 8.278529980657642e-05,
"loss": 0.9847,
"num_input_tokens_seen": 43895232,
"step": 915,
"train_runtime": 6367.4054,
"train_tokens_per_second": 6893.739
},
{
"epoch": 0.5888781742205079,
"grad_norm": 0.20941504836082458,
"learning_rate": 8.265635074145713e-05,
"loss": 0.9002,
"num_input_tokens_seen": 43933248,
"step": 916,
"train_runtime": 6372.7546,
"train_tokens_per_second": 6893.918
},
{
"epoch": 0.5895210543233687,
"grad_norm": 0.2331460863351822,
"learning_rate": 8.252740167633784e-05,
"loss": 0.9279,
"num_input_tokens_seen": 43976928,
"step": 917,
"train_runtime": 6378.8552,
"train_tokens_per_second": 6894.173
},
{
"epoch": 0.5901639344262295,
"grad_norm": 0.21849630773067474,
"learning_rate": 8.239845261121857e-05,
"loss": 0.9592,
"num_input_tokens_seen": 44037440,
"step": 918,
"train_runtime": 6387.3069,
"train_tokens_per_second": 6894.524
},
{
"epoch": 0.5908068145290903,
"grad_norm": 0.20870837569236755,
"learning_rate": 8.226950354609929e-05,
"loss": 0.934,
"num_input_tokens_seen": 44071488,
"step": 919,
"train_runtime": 6392.1384,
"train_tokens_per_second": 6894.639
},
{
"epoch": 0.5914496946319512,
"grad_norm": 0.2119072824716568,
"learning_rate": 8.214055448098002e-05,
"loss": 0.8326,
"num_input_tokens_seen": 44101040,
"step": 920,
"train_runtime": 6396.3504,
"train_tokens_per_second": 6894.719
},
{
"epoch": 0.5920925747348119,
"grad_norm": 0.23690038919448853,
"learning_rate": 8.201160541586074e-05,
"loss": 1.0202,
"num_input_tokens_seen": 44157248,
"step": 921,
"train_runtime": 6404.3079,
"train_tokens_per_second": 6894.929
},
{
"epoch": 0.5927354548376728,
"grad_norm": 0.22710008919239044,
"learning_rate": 8.188265635074146e-05,
"loss": 1.0342,
"num_input_tokens_seen": 44224064,
"step": 922,
"train_runtime": 6413.7279,
"train_tokens_per_second": 6895.22
},
{
"epoch": 0.5933783349405336,
"grad_norm": 0.2313239574432373,
"learning_rate": 8.175370728562219e-05,
"loss": 0.8901,
"num_input_tokens_seen": 44274672,
"step": 923,
"train_runtime": 6420.8058,
"train_tokens_per_second": 6895.501
},
{
"epoch": 0.5940212150433944,
"grad_norm": 0.22043012082576752,
"learning_rate": 8.16247582205029e-05,
"loss": 1.0042,
"num_input_tokens_seen": 44318736,
"step": 924,
"train_runtime": 6427.0153,
"train_tokens_per_second": 6895.695
},
{
"epoch": 0.5946640951462552,
"grad_norm": 0.2008189857006073,
"learning_rate": 8.149580915538362e-05,
"loss": 0.9335,
"num_input_tokens_seen": 44358256,
"step": 925,
"train_runtime": 6432.5716,
"train_tokens_per_second": 6895.882
},
{
"epoch": 0.595306975249116,
"grad_norm": 0.1697245091199875,
"learning_rate": 8.136686009026436e-05,
"loss": 0.7817,
"num_input_tokens_seen": 44434544,
"step": 926,
"train_runtime": 6443.2477,
"train_tokens_per_second": 6896.296
},
{
"epoch": 0.5959498553519769,
"grad_norm": 0.21377557516098022,
"learning_rate": 8.123791102514507e-05,
"loss": 0.8774,
"num_input_tokens_seen": 44492352,
"step": 927,
"train_runtime": 6451.3472,
"train_tokens_per_second": 6896.599
},
{
"epoch": 0.5965927354548377,
"grad_norm": 0.21762780845165253,
"learning_rate": 8.110896196002579e-05,
"loss": 1.0206,
"num_input_tokens_seen": 44523424,
"step": 928,
"train_runtime": 6455.7713,
"train_tokens_per_second": 6896.685
},
{
"epoch": 0.5972356155576984,
"grad_norm": 0.22104495763778687,
"learning_rate": 8.098001289490652e-05,
"loss": 1.0388,
"num_input_tokens_seen": 44569904,
"step": 929,
"train_runtime": 6462.3358,
"train_tokens_per_second": 6896.872
},
{
"epoch": 0.5978784956605593,
"grad_norm": 0.23265767097473145,
"learning_rate": 8.085106382978723e-05,
"loss": 0.9364,
"num_input_tokens_seen": 44644992,
"step": 930,
"train_runtime": 6472.904,
"train_tokens_per_second": 6897.212
},
{
"epoch": 0.5985213757634201,
"grad_norm": 0.23737984895706177,
"learning_rate": 8.072211476466796e-05,
"loss": 0.9437,
"num_input_tokens_seen": 44683088,
"step": 931,
"train_runtime": 6478.8445,
"train_tokens_per_second": 6896.768
},
{
"epoch": 0.599164255866281,
"grad_norm": 0.23196366429328918,
"learning_rate": 8.059316569954868e-05,
"loss": 0.9364,
"num_input_tokens_seen": 44731184,
"step": 932,
"train_runtime": 6485.6032,
"train_tokens_per_second": 6896.997
},
{
"epoch": 0.5998071359691417,
"grad_norm": 0.20719966292381287,
"learning_rate": 8.04642166344294e-05,
"loss": 0.9187,
"num_input_tokens_seen": 44782240,
"step": 933,
"train_runtime": 6492.7686,
"train_tokens_per_second": 6897.249
},
{
"epoch": 0.6004500160720025,
"grad_norm": 0.2094103842973709,
"learning_rate": 8.033526756931013e-05,
"loss": 0.945,
"num_input_tokens_seen": 44833904,
"step": 934,
"train_runtime": 6500.0655,
"train_tokens_per_second": 6897.454
},
{
"epoch": 0.6010928961748634,
"grad_norm": 0.23072101175785065,
"learning_rate": 8.020631850419085e-05,
"loss": 0.9558,
"num_input_tokens_seen": 44872496,
"step": 935,
"train_runtime": 6505.5009,
"train_tokens_per_second": 6897.623
},
{
"epoch": 0.6017357762777242,
"grad_norm": 0.23481076955795288,
"learning_rate": 8.007736943907156e-05,
"loss": 0.9275,
"num_input_tokens_seen": 44909856,
"step": 936,
"train_runtime": 6510.7323,
"train_tokens_per_second": 6897.819
},
{
"epoch": 0.6017357762777242,
"eval_loss": 1.0076556205749512,
"eval_runtime": 40.0319,
"eval_samples_per_second": 24.83,
"eval_steps_per_second": 1.574,
"num_input_tokens_seen": 44909856,
"step": 936
},
{
"epoch": 0.6023786563805851,
"grad_norm": 0.2573668360710144,
"learning_rate": 7.99484203739523e-05,
"loss": 0.941,
"num_input_tokens_seen": 44964080,
"step": 937,
"train_runtime": 6558.4171,
"train_tokens_per_second": 6855.935
},
{
"epoch": 0.6030215364834458,
"grad_norm": 0.2350708395242691,
"learning_rate": 7.981947130883301e-05,
"loss": 1.0511,
"num_input_tokens_seen": 45013536,
"step": 938,
"train_runtime": 6565.4248,
"train_tokens_per_second": 6856.15
},
{
"epoch": 0.6036644165863067,
"grad_norm": 0.22017408907413483,
"learning_rate": 7.969052224371373e-05,
"loss": 1.0908,
"num_input_tokens_seen": 45062928,
"step": 939,
"train_runtime": 6572.3543,
"train_tokens_per_second": 6856.436
},
{
"epoch": 0.6043072966891675,
"grad_norm": 0.19787846505641937,
"learning_rate": 7.956157317859446e-05,
"loss": 0.8993,
"num_input_tokens_seen": 45108224,
"step": 940,
"train_runtime": 6578.7161,
"train_tokens_per_second": 6856.691
},
{
"epoch": 0.6049501767920283,
"grad_norm": 0.21461884677410126,
"learning_rate": 7.943262411347518e-05,
"loss": 0.833,
"num_input_tokens_seen": 45151552,
"step": 941,
"train_runtime": 6584.7583,
"train_tokens_per_second": 6856.979
},
{
"epoch": 0.6055930568948891,
"grad_norm": 0.2068055421113968,
"learning_rate": 7.930367504835591e-05,
"loss": 1.0113,
"num_input_tokens_seen": 45207248,
"step": 942,
"train_runtime": 6592.6019,
"train_tokens_per_second": 6857.27
},
{
"epoch": 0.6062359369977499,
"grad_norm": 0.22537890076637268,
"learning_rate": 7.917472598323663e-05,
"loss": 1.0316,
"num_input_tokens_seen": 45246032,
"step": 943,
"train_runtime": 6598.0453,
"train_tokens_per_second": 6857.49
},
{
"epoch": 0.6068788171006108,
"grad_norm": 0.2297266274690628,
"learning_rate": 7.904577691811734e-05,
"loss": 0.9796,
"num_input_tokens_seen": 45285568,
"step": 944,
"train_runtime": 6603.5907,
"train_tokens_per_second": 6857.719
},
{
"epoch": 0.6075216972034716,
"grad_norm": 0.2185073047876358,
"learning_rate": 7.891682785299807e-05,
"loss": 1.025,
"num_input_tokens_seen": 45349424,
"step": 945,
"train_runtime": 6612.5255,
"train_tokens_per_second": 6858.11
},
{
"epoch": 0.6081645773063323,
"grad_norm": 0.20334357023239136,
"learning_rate": 7.878787878787879e-05,
"loss": 0.9352,
"num_input_tokens_seen": 45382528,
"step": 946,
"train_runtime": 6617.202,
"train_tokens_per_second": 6858.265
},
{
"epoch": 0.6088074574091932,
"grad_norm": 0.22521203756332397,
"learning_rate": 7.86589297227595e-05,
"loss": 0.9307,
"num_input_tokens_seen": 45434592,
"step": 947,
"train_runtime": 6624.4965,
"train_tokens_per_second": 6858.573
},
{
"epoch": 0.609450337512054,
"grad_norm": 0.21149739623069763,
"learning_rate": 7.852998065764024e-05,
"loss": 1.0105,
"num_input_tokens_seen": 45490192,
"step": 948,
"train_runtime": 6632.1883,
"train_tokens_per_second": 6859.002
},
{
"epoch": 0.6100932176149149,
"grad_norm": 0.21434244513511658,
"learning_rate": 7.840103159252095e-05,
"loss": 0.9318,
"num_input_tokens_seen": 45542496,
"step": 949,
"train_runtime": 6639.4349,
"train_tokens_per_second": 6859.393
},
{
"epoch": 0.6107360977177756,
"grad_norm": 0.19788849353790283,
"learning_rate": 7.827208252740169e-05,
"loss": 0.9998,
"num_input_tokens_seen": 45587712,
"step": 950,
"train_runtime": 6645.7335,
"train_tokens_per_second": 6859.696
},
{
"epoch": 0.6113789778206364,
"grad_norm": 0.24048268795013428,
"learning_rate": 7.81431334622824e-05,
"loss": 0.9126,
"num_input_tokens_seen": 45626816,
"step": 951,
"train_runtime": 6651.1735,
"train_tokens_per_second": 6859.965
},
{
"epoch": 0.6120218579234973,
"grad_norm": 0.2160108983516693,
"learning_rate": 7.801418439716312e-05,
"loss": 1.0111,
"num_input_tokens_seen": 45672320,
"step": 952,
"train_runtime": 6657.4991,
"train_tokens_per_second": 6860.282
},
{
"epoch": 0.6126647380263581,
"grad_norm": 0.2314816117286682,
"learning_rate": 7.788523533204385e-05,
"loss": 1.0468,
"num_input_tokens_seen": 45720000,
"step": 953,
"train_runtime": 6664.057,
"train_tokens_per_second": 6860.686
},
{
"epoch": 0.6133076181292189,
"grad_norm": 0.22002699971199036,
"learning_rate": 7.775628626692457e-05,
"loss": 1.0283,
"num_input_tokens_seen": 45752288,
"step": 954,
"train_runtime": 6668.585,
"train_tokens_per_second": 6860.869
},
{
"epoch": 0.6139504982320797,
"grad_norm": 0.2057672142982483,
"learning_rate": 7.762733720180529e-05,
"loss": 0.9906,
"num_input_tokens_seen": 45787136,
"step": 955,
"train_runtime": 6673.4818,
"train_tokens_per_second": 6861.056
},
{
"epoch": 0.6145933783349405,
"grad_norm": 0.22810469567775726,
"learning_rate": 7.749838813668602e-05,
"loss": 1.0197,
"num_input_tokens_seen": 45832416,
"step": 956,
"train_runtime": 6679.7842,
"train_tokens_per_second": 6861.362
},
{
"epoch": 0.6152362584378014,
"grad_norm": 0.2123366743326187,
"learning_rate": 7.736943907156673e-05,
"loss": 0.9164,
"num_input_tokens_seen": 45872960,
"step": 957,
"train_runtime": 6685.4446,
"train_tokens_per_second": 6861.617
},
{
"epoch": 0.6158791385406621,
"grad_norm": 0.19447851181030273,
"learning_rate": 7.724049000644746e-05,
"loss": 0.9516,
"num_input_tokens_seen": 45910544,
"step": 958,
"train_runtime": 6690.7329,
"train_tokens_per_second": 6861.811
},
{
"epoch": 0.616522018643523,
"grad_norm": 0.22850489616394043,
"learning_rate": 7.711154094132818e-05,
"loss": 1.0786,
"num_input_tokens_seen": 45960944,
"step": 959,
"train_runtime": 6697.7183,
"train_tokens_per_second": 6862.179
},
{
"epoch": 0.6171648987463838,
"grad_norm": 0.21646857261657715,
"learning_rate": 7.69825918762089e-05,
"loss": 0.9976,
"num_input_tokens_seen": 46010656,
"step": 960,
"train_runtime": 6704.5387,
"train_tokens_per_second": 6862.613
},
{
"epoch": 0.6178077788492446,
"grad_norm": 0.2174510955810547,
"learning_rate": 7.685364281108963e-05,
"loss": 0.9598,
"num_input_tokens_seen": 46054448,
"step": 961,
"train_runtime": 6711.1106,
"train_tokens_per_second": 6862.418
},
{
"epoch": 0.6184506589521054,
"grad_norm": 0.20922686159610748,
"learning_rate": 7.672469374597034e-05,
"loss": 0.8961,
"num_input_tokens_seen": 46090672,
"step": 962,
"train_runtime": 6716.1748,
"train_tokens_per_second": 6862.637
},
{
"epoch": 0.6190935390549662,
"grad_norm": 0.22034646570682526,
"learning_rate": 7.659574468085106e-05,
"loss": 1.0259,
"num_input_tokens_seen": 46126704,
"step": 963,
"train_runtime": 6721.2076,
"train_tokens_per_second": 6862.86
},
{
"epoch": 0.6197364191578271,
"grad_norm": 0.22129416465759277,
"learning_rate": 7.64667956157318e-05,
"loss": 0.9486,
"num_input_tokens_seen": 46176464,
"step": 964,
"train_runtime": 6728.1278,
"train_tokens_per_second": 6863.197
},
{
"epoch": 0.6203792992606879,
"grad_norm": 0.21850019693374634,
"learning_rate": 7.633784655061251e-05,
"loss": 0.965,
"num_input_tokens_seen": 46221184,
"step": 965,
"train_runtime": 6734.3203,
"train_tokens_per_second": 6863.526
},
{
"epoch": 0.6210221793635486,
"grad_norm": 0.2046729326248169,
"learning_rate": 7.620889748549323e-05,
"loss": 0.9319,
"num_input_tokens_seen": 46265680,
"step": 966,
"train_runtime": 6740.5364,
"train_tokens_per_second": 6863.798
},
{
"epoch": 0.6216650594664095,
"grad_norm": 0.21326079964637756,
"learning_rate": 7.607994842037396e-05,
"loss": 0.9574,
"num_input_tokens_seen": 46301680,
"step": 967,
"train_runtime": 6745.584,
"train_tokens_per_second": 6863.999
},
{
"epoch": 0.6223079395692703,
"grad_norm": 0.213593527674675,
"learning_rate": 7.595099935525468e-05,
"loss": 0.9439,
"num_input_tokens_seen": 46350304,
"step": 968,
"train_runtime": 6752.2772,
"train_tokens_per_second": 6864.396
},
{
"epoch": 0.6229508196721312,
"grad_norm": 0.21795116364955902,
"learning_rate": 7.58220502901354e-05,
"loss": 0.86,
"num_input_tokens_seen": 46390528,
"step": 969,
"train_runtime": 6757.8381,
"train_tokens_per_second": 6864.7
},
{
"epoch": 0.623593699774992,
"grad_norm": 0.20645615458488464,
"learning_rate": 7.569310122501613e-05,
"loss": 0.8959,
"num_input_tokens_seen": 46450176,
"step": 970,
"train_runtime": 6766.119,
"train_tokens_per_second": 6865.114
},
{
"epoch": 0.6242365798778527,
"grad_norm": 0.21638134121894836,
"learning_rate": 7.556415215989683e-05,
"loss": 1.0205,
"num_input_tokens_seen": 46488288,
"step": 971,
"train_runtime": 6771.3952,
"train_tokens_per_second": 6865.393
},
{
"epoch": 0.6248794599807136,
"grad_norm": 0.21955394744873047,
"learning_rate": 7.543520309477757e-05,
"loss": 0.9762,
"num_input_tokens_seen": 46531296,
"step": 972,
"train_runtime": 6777.3266,
"train_tokens_per_second": 6865.73
},
{
"epoch": 0.6255223400835744,
"grad_norm": 0.23245960474014282,
"learning_rate": 7.530625402965828e-05,
"loss": 0.917,
"num_input_tokens_seen": 46565248,
"step": 973,
"train_runtime": 6782.116,
"train_tokens_per_second": 6865.888
},
{
"epoch": 0.6261652201864353,
"grad_norm": 0.20442916452884674,
"learning_rate": 7.5177304964539e-05,
"loss": 0.8955,
"num_input_tokens_seen": 46611184,
"step": 974,
"train_runtime": 6788.4548,
"train_tokens_per_second": 6866.244
},
{
"epoch": 0.626808100289296,
"grad_norm": 0.22477011382579803,
"learning_rate": 7.504835589941973e-05,
"loss": 0.9841,
"num_input_tokens_seen": 46654144,
"step": 975,
"train_runtime": 6794.4059,
"train_tokens_per_second": 6866.552
},
{
"epoch": 0.6274509803921569,
"grad_norm": 0.219425231218338,
"learning_rate": 7.491940683430045e-05,
"loss": 1.0111,
"num_input_tokens_seen": 46716160,
"step": 976,
"train_runtime": 6802.9733,
"train_tokens_per_second": 6867.021
},
{
"epoch": 0.6280938604950177,
"grad_norm": 0.2272089719772339,
"learning_rate": 7.479045776918117e-05,
"loss": 0.9653,
"num_input_tokens_seen": 46761376,
"step": 977,
"train_runtime": 6809.176,
"train_tokens_per_second": 6867.406
},
{
"epoch": 0.6287367405978785,
"grad_norm": 0.2164466679096222,
"learning_rate": 7.46615087040619e-05,
"loss": 0.9439,
"num_input_tokens_seen": 46797264,
"step": 978,
"train_runtime": 6814.1155,
"train_tokens_per_second": 6867.695
},
{
"epoch": 0.6293796207007393,
"grad_norm": 0.21363511681556702,
"learning_rate": 7.453255963894262e-05,
"loss": 0.9783,
"num_input_tokens_seen": 46834144,
"step": 979,
"train_runtime": 6819.2729,
"train_tokens_per_second": 6867.909
},
{
"epoch": 0.6300225008036001,
"grad_norm": 0.2254478931427002,
"learning_rate": 7.440361057382335e-05,
"loss": 1.0318,
"num_input_tokens_seen": 46880720,
"step": 980,
"train_runtime": 6825.6472,
"train_tokens_per_second": 6868.319
},
{
"epoch": 0.630665380906461,
"grad_norm": 0.22620360553264618,
"learning_rate": 7.427466150870407e-05,
"loss": 0.9323,
"num_input_tokens_seen": 46917472,
"step": 981,
"train_runtime": 6830.7439,
"train_tokens_per_second": 6868.574
},
{
"epoch": 0.6313082610093218,
"grad_norm": 0.21192996203899384,
"learning_rate": 7.414571244358479e-05,
"loss": 0.8626,
"num_input_tokens_seen": 46978192,
"step": 982,
"train_runtime": 6839.1256,
"train_tokens_per_second": 6869.035
},
{
"epoch": 0.6319511411121825,
"grad_norm": 0.22016724944114685,
"learning_rate": 7.401676337846552e-05,
"loss": 0.9411,
"num_input_tokens_seen": 47047760,
"step": 983,
"train_runtime": 6848.6862,
"train_tokens_per_second": 6869.604
},
{
"epoch": 0.6325940212150434,
"grad_norm": 0.24845948815345764,
"learning_rate": 7.388781431334622e-05,
"loss": 1.0784,
"num_input_tokens_seen": 47098816,
"step": 984,
"train_runtime": 6855.6941,
"train_tokens_per_second": 6870.029
},
{
"epoch": 0.6332369013179042,
"grad_norm": 0.2411433309316635,
"learning_rate": 7.375886524822694e-05,
"loss": 0.9888,
"num_input_tokens_seen": 47154208,
"step": 985,
"train_runtime": 6863.351,
"train_tokens_per_second": 6870.435
},
{
"epoch": 0.6338797814207651,
"grad_norm": 0.22008250653743744,
"learning_rate": 7.362991618310767e-05,
"loss": 0.9903,
"num_input_tokens_seen": 47198608,
"step": 986,
"train_runtime": 6869.4842,
"train_tokens_per_second": 6870.764
},
{
"epoch": 0.6345226615236258,
"grad_norm": 0.23359744250774384,
"learning_rate": 7.350096711798839e-05,
"loss": 1.0394,
"num_input_tokens_seen": 47235120,
"step": 987,
"train_runtime": 6874.5459,
"train_tokens_per_second": 6871.017
},
{
"epoch": 0.6351655416264866,
"grad_norm": 0.21749937534332275,
"learning_rate": 7.337201805286912e-05,
"loss": 0.9307,
"num_input_tokens_seen": 47277952,
"step": 988,
"train_runtime": 6880.4288,
"train_tokens_per_second": 6871.367
},
{
"epoch": 0.6358084217293475,
"grad_norm": 0.23919233679771423,
"learning_rate": 7.324306898774984e-05,
"loss": 0.9935,
"num_input_tokens_seen": 47332336,
"step": 989,
"train_runtime": 6887.9261,
"train_tokens_per_second": 6871.783
},
{
"epoch": 0.6364513018322083,
"grad_norm": 0.22570660710334778,
"learning_rate": 7.311411992263056e-05,
"loss": 0.9237,
"num_input_tokens_seen": 47368256,
"step": 990,
"train_runtime": 6893.0199,
"train_tokens_per_second": 6871.916
},
{
"epoch": 0.6370941819350691,
"grad_norm": 0.23035700619220734,
"learning_rate": 7.298517085751129e-05,
"loss": 1.0694,
"num_input_tokens_seen": 47402480,
"step": 991,
"train_runtime": 6898.3258,
"train_tokens_per_second": 6871.592
},
{
"epoch": 0.6377370620379299,
"grad_norm": 0.24699033796787262,
"learning_rate": 7.285622179239201e-05,
"loss": 0.997,
"num_input_tokens_seen": 47478224,
"step": 992,
"train_runtime": 6908.8665,
"train_tokens_per_second": 6872.071
},
{
"epoch": 0.6383799421407907,
"grad_norm": 0.20100495219230652,
"learning_rate": 7.272727272727273e-05,
"loss": 0.8458,
"num_input_tokens_seen": 47516640,
"step": 993,
"train_runtime": 6914.2512,
"train_tokens_per_second": 6872.276
},
{
"epoch": 0.6390228222436516,
"grad_norm": 0.20696420967578888,
"learning_rate": 7.259832366215346e-05,
"loss": 0.9597,
"num_input_tokens_seen": 47558624,
"step": 994,
"train_runtime": 6920.1393,
"train_tokens_per_second": 6872.495
},
{
"epoch": 0.6396657023465123,
"grad_norm": 0.23742607235908508,
"learning_rate": 7.246937459703418e-05,
"loss": 0.9151,
"num_input_tokens_seen": 47629440,
"step": 995,
"train_runtime": 6930.0426,
"train_tokens_per_second": 6872.893
},
{
"epoch": 0.6403085824493732,
"grad_norm": 0.21890178322792053,
"learning_rate": 7.23404255319149e-05,
"loss": 0.8402,
"num_input_tokens_seen": 47668032,
"step": 996,
"train_runtime": 6935.4916,
"train_tokens_per_second": 6873.057
},
{
"epoch": 0.640951462552234,
"grad_norm": 0.21457263827323914,
"learning_rate": 7.221147646679563e-05,
"loss": 0.9283,
"num_input_tokens_seen": 47727584,
"step": 997,
"train_runtime": 6943.8296,
"train_tokens_per_second": 6873.381
},
{
"epoch": 0.6415943426550949,
"grad_norm": 0.24617235362529755,
"learning_rate": 7.208252740167633e-05,
"loss": 1.0306,
"num_input_tokens_seen": 47766352,
"step": 998,
"train_runtime": 6949.2829,
"train_tokens_per_second": 6873.566
},
{
"epoch": 0.6422372227579557,
"grad_norm": 0.21127833425998688,
"learning_rate": 7.195357833655706e-05,
"loss": 0.9085,
"num_input_tokens_seen": 47815232,
"step": 999,
"train_runtime": 6956.0924,
"train_tokens_per_second": 6873.864
},
{
"epoch": 0.6428801028608164,
"grad_norm": 0.22037668526172638,
"learning_rate": 7.182462927143778e-05,
"loss": 1.0263,
"num_input_tokens_seen": 47858784,
"step": 1000,
"train_runtime": 6962.152,
"train_tokens_per_second": 6874.137
},
{
"epoch": 0.6435229829636773,
"grad_norm": 0.2265874296426773,
"learning_rate": 7.16956802063185e-05,
"loss": 1.0295,
"num_input_tokens_seen": 47933472,
"step": 1001,
"train_runtime": 6972.5362,
"train_tokens_per_second": 6874.611
},
{
"epoch": 0.6441658630665381,
"grad_norm": 0.22066611051559448,
"learning_rate": 7.156673114119923e-05,
"loss": 0.9419,
"num_input_tokens_seen": 47997584,
"step": 1002,
"train_runtime": 6981.3745,
"train_tokens_per_second": 6875.091
},
{
"epoch": 0.644808743169399,
"grad_norm": 0.2365170419216156,
"learning_rate": 7.143778207607995e-05,
"loss": 0.8646,
"num_input_tokens_seen": 48063616,
"step": 1003,
"train_runtime": 6990.5257,
"train_tokens_per_second": 6875.537
},
{
"epoch": 0.6454516232722597,
"grad_norm": 0.19993442296981812,
"learning_rate": 7.130883301096067e-05,
"loss": 0.8968,
"num_input_tokens_seen": 48127984,
"step": 1004,
"train_runtime": 6999.4566,
"train_tokens_per_second": 6875.96
},
{
"epoch": 0.6460945033751205,
"grad_norm": 0.21699395775794983,
"learning_rate": 7.11798839458414e-05,
"loss": 0.9993,
"num_input_tokens_seen": 48180272,
"step": 1005,
"train_runtime": 7006.6964,
"train_tokens_per_second": 6876.318
},
{
"epoch": 0.6467373834779814,
"grad_norm": 0.2222331166267395,
"learning_rate": 7.105093488072212e-05,
"loss": 0.9866,
"num_input_tokens_seen": 48244928,
"step": 1006,
"train_runtime": 7015.6856,
"train_tokens_per_second": 6876.723
},
{
"epoch": 0.6473802635808422,
"grad_norm": 0.20489053428173065,
"learning_rate": 7.092198581560284e-05,
"loss": 0.8411,
"num_input_tokens_seen": 48295296,
"step": 1007,
"train_runtime": 7022.675,
"train_tokens_per_second": 6877.051
},
{
"epoch": 0.648023143683703,
"grad_norm": 0.2395627647638321,
"learning_rate": 7.079303675048357e-05,
"loss": 1.0088,
"num_input_tokens_seen": 48326816,
"step": 1008,
"train_runtime": 7027.137,
"train_tokens_per_second": 6877.17
},
{
"epoch": 0.6486660237865638,
"grad_norm": 0.22366495430469513,
"learning_rate": 7.066408768536429e-05,
"loss": 1.0026,
"num_input_tokens_seen": 48363488,
"step": 1009,
"train_runtime": 7032.2438,
"train_tokens_per_second": 6877.391
},
{
"epoch": 0.6493089038894246,
"grad_norm": 0.23582132160663605,
"learning_rate": 7.053513862024502e-05,
"loss": 0.9802,
"num_input_tokens_seen": 48429872,
"step": 1010,
"train_runtime": 7041.4949,
"train_tokens_per_second": 6877.783
},
{
"epoch": 0.6499517839922855,
"grad_norm": 0.23157043755054474,
"learning_rate": 7.040618955512572e-05,
"loss": 1.0195,
"num_input_tokens_seen": 48491216,
"step": 1011,
"train_runtime": 7050.0327,
"train_tokens_per_second": 6878.155
},
{
"epoch": 0.6505946640951462,
"grad_norm": 0.22757606208324432,
"learning_rate": 7.027724049000644e-05,
"loss": 0.9446,
"num_input_tokens_seen": 48536352,
"step": 1012,
"train_runtime": 7056.2998,
"train_tokens_per_second": 6878.442
},
{
"epoch": 0.6512375441980071,
"grad_norm": 0.22248154878616333,
"learning_rate": 7.014829142488717e-05,
"loss": 0.9717,
"num_input_tokens_seen": 48578576,
"step": 1013,
"train_runtime": 7062.133,
"train_tokens_per_second": 6878.74
},
{
"epoch": 0.6518804243008679,
"grad_norm": 0.23368652164936066,
"learning_rate": 7.001934235976789e-05,
"loss": 0.9362,
"num_input_tokens_seen": 48636000,
"step": 1014,
"train_runtime": 7070.1159,
"train_tokens_per_second": 6879.095
},
{
"epoch": 0.6525233044037287,
"grad_norm": 0.21449260413646698,
"learning_rate": 6.989039329464861e-05,
"loss": 0.901,
"num_input_tokens_seen": 48669152,
"step": 1015,
"train_runtime": 7074.7527,
"train_tokens_per_second": 6879.273
},
{
"epoch": 0.6531661845065895,
"grad_norm": 0.2274601012468338,
"learning_rate": 6.976144422952934e-05,
"loss": 0.9272,
"num_input_tokens_seen": 48704112,
"step": 1016,
"train_runtime": 7079.616,
"train_tokens_per_second": 6879.485
},
{
"epoch": 0.6538090646094503,
"grad_norm": 0.2232244312763214,
"learning_rate": 6.963249516441006e-05,
"loss": 1.0063,
"num_input_tokens_seen": 48765600,
"step": 1017,
"train_runtime": 7088.0798,
"train_tokens_per_second": 6879.945
},
{
"epoch": 0.6544519447123112,
"grad_norm": 0.2260793298482895,
"learning_rate": 6.950354609929079e-05,
"loss": 0.8803,
"num_input_tokens_seen": 48806128,
"step": 1018,
"train_runtime": 7093.6664,
"train_tokens_per_second": 6880.24
},
{
"epoch": 0.655094824815172,
"grad_norm": 0.23438192903995514,
"learning_rate": 6.937459703417151e-05,
"loss": 1.0313,
"num_input_tokens_seen": 48849328,
"step": 1019,
"train_runtime": 7099.6643,
"train_tokens_per_second": 6880.512
},
{
"epoch": 0.6557377049180327,
"grad_norm": 0.23910987377166748,
"learning_rate": 6.924564796905223e-05,
"loss": 0.9334,
"num_input_tokens_seen": 48891040,
"step": 1020,
"train_runtime": 7105.4233,
"train_tokens_per_second": 6880.806
},
{
"epoch": 0.6563805850208936,
"grad_norm": 0.2428818792104721,
"learning_rate": 6.911669890393296e-05,
"loss": 1.0331,
"num_input_tokens_seen": 48953104,
"step": 1021,
"train_runtime": 7114.4728,
"train_tokens_per_second": 6880.777
},
{
"epoch": 0.6570234651237544,
"grad_norm": 0.24574337899684906,
"learning_rate": 6.898774983881368e-05,
"loss": 1.0121,
"num_input_tokens_seen": 48992464,
"step": 1022,
"train_runtime": 7119.9009,
"train_tokens_per_second": 6881.06
},
{
"epoch": 0.6576663452266153,
"grad_norm": 0.24428240954875946,
"learning_rate": 6.88588007736944e-05,
"loss": 1.0972,
"num_input_tokens_seen": 49039008,
"step": 1023,
"train_runtime": 7126.2761,
"train_tokens_per_second": 6881.435
},
{
"epoch": 0.658309225329476,
"grad_norm": 0.2183476835489273,
"learning_rate": 6.872985170857513e-05,
"loss": 0.9851,
"num_input_tokens_seen": 49085344,
"step": 1024,
"train_runtime": 7132.642,
"train_tokens_per_second": 6881.79
},
{
"epoch": 0.6589521054323368,
"grad_norm": 0.24681338667869568,
"learning_rate": 6.860090264345583e-05,
"loss": 0.9841,
"num_input_tokens_seen": 49150688,
"step": 1025,
"train_runtime": 7141.7025,
"train_tokens_per_second": 6882.209
},
{
"epoch": 0.6595949855351977,
"grad_norm": 0.21444672346115112,
"learning_rate": 6.847195357833656e-05,
"loss": 0.9491,
"num_input_tokens_seen": 49191440,
"step": 1026,
"train_runtime": 7147.3276,
"train_tokens_per_second": 6882.494
},
{
"epoch": 0.6602378656380585,
"grad_norm": 0.21985282003879547,
"learning_rate": 6.834300451321728e-05,
"loss": 0.9602,
"num_input_tokens_seen": 49248928,
"step": 1027,
"train_runtime": 7155.1844,
"train_tokens_per_second": 6882.971
},
{
"epoch": 0.6608807457409194,
"grad_norm": 0.24706678092479706,
"learning_rate": 6.8214055448098e-05,
"loss": 1.0032,
"num_input_tokens_seen": 49306448,
"step": 1028,
"train_runtime": 7163.1356,
"train_tokens_per_second": 6883.361
},
{
"epoch": 0.6615236258437801,
"grad_norm": 0.22101391851902008,
"learning_rate": 6.808510638297873e-05,
"loss": 1.0164,
"num_input_tokens_seen": 49353728,
"step": 1029,
"train_runtime": 7169.5972,
"train_tokens_per_second": 6883.752
},
{
"epoch": 0.662166505946641,
"grad_norm": 0.21555444598197937,
"learning_rate": 6.795615731785945e-05,
"loss": 0.8685,
"num_input_tokens_seen": 49414256,
"step": 1030,
"train_runtime": 7177.9909,
"train_tokens_per_second": 6884.135
},
{
"epoch": 0.6628093860495018,
"grad_norm": 0.23320741951465607,
"learning_rate": 6.782720825274017e-05,
"loss": 1.0389,
"num_input_tokens_seen": 49487152,
"step": 1031,
"train_runtime": 7188.0883,
"train_tokens_per_second": 6884.605
},
{
"epoch": 0.6634522661523626,
"grad_norm": 0.23155942559242249,
"learning_rate": 6.76982591876209e-05,
"loss": 0.9408,
"num_input_tokens_seen": 49526848,
"step": 1032,
"train_runtime": 7193.6458,
"train_tokens_per_second": 6884.805
},
{
"epoch": 0.6640951462552234,
"grad_norm": 0.2161242812871933,
"learning_rate": 6.756931012250162e-05,
"loss": 0.9456,
"num_input_tokens_seen": 49585168,
"step": 1033,
"train_runtime": 7201.6963,
"train_tokens_per_second": 6885.207
},
{
"epoch": 0.6647380263580842,
"grad_norm": 0.20924127101898193,
"learning_rate": 6.744036105738233e-05,
"loss": 0.9401,
"num_input_tokens_seen": 49632320,
"step": 1034,
"train_runtime": 7208.1656,
"train_tokens_per_second": 6885.569
},
{
"epoch": 0.665380906460945,
"grad_norm": 0.21134765446186066,
"learning_rate": 6.731141199226307e-05,
"loss": 1.0104,
"num_input_tokens_seen": 49682064,
"step": 1035,
"train_runtime": 7215.068,
"train_tokens_per_second": 6885.876
},
{
"epoch": 0.6660237865638059,
"grad_norm": 0.21447201073169708,
"learning_rate": 6.718246292714378e-05,
"loss": 0.9398,
"num_input_tokens_seen": 49729392,
"step": 1036,
"train_runtime": 7221.566,
"train_tokens_per_second": 6886.234
},
{
"epoch": 0.6666666666666666,
"grad_norm": 0.22306424379348755,
"learning_rate": 6.70535138620245e-05,
"loss": 0.9365,
"num_input_tokens_seen": 49793296,
"step": 1037,
"train_runtime": 7230.3142,
"train_tokens_per_second": 6886.74
},
{
"epoch": 0.6673095467695275,
"grad_norm": 0.2094729244709015,
"learning_rate": 6.692456479690522e-05,
"loss": 0.992,
"num_input_tokens_seen": 49836256,
"step": 1038,
"train_runtime": 7236.29,
"train_tokens_per_second": 6886.99
},
{
"epoch": 0.6679524268723883,
"grad_norm": 0.21107782423496246,
"learning_rate": 6.679561573178594e-05,
"loss": 0.9429,
"num_input_tokens_seen": 49899120,
"step": 1039,
"train_runtime": 7244.9437,
"train_tokens_per_second": 6887.441
},
{
"epoch": 0.6685953069752492,
"grad_norm": 0.2193991243839264,
"learning_rate": 6.666666666666667e-05,
"loss": 0.875,
"num_input_tokens_seen": 49970224,
"step": 1040,
"train_runtime": 7254.7327,
"train_tokens_per_second": 6887.948
},
{
"epoch": 0.6692381870781099,
"grad_norm": 0.20523865520954132,
"learning_rate": 6.653771760154739e-05,
"loss": 0.9484,
"num_input_tokens_seen": 50030208,
"step": 1041,
"train_runtime": 7263.034,
"train_tokens_per_second": 6888.335
},
{
"epoch": 0.6698810671809707,
"grad_norm": 0.242182657122612,
"learning_rate": 6.64087685364281e-05,
"loss": 0.9938,
"num_input_tokens_seen": 50109888,
"step": 1042,
"train_runtime": 7274.1431,
"train_tokens_per_second": 6888.769
},
{
"epoch": 0.6705239472838316,
"grad_norm": 0.21813493967056274,
"learning_rate": 6.627981947130884e-05,
"loss": 1.0141,
"num_input_tokens_seen": 50173184,
"step": 1043,
"train_runtime": 7282.8986,
"train_tokens_per_second": 6889.178
},
{
"epoch": 0.6711668273866924,
"grad_norm": 0.2105100452899933,
"learning_rate": 6.615087040618956e-05,
"loss": 0.8706,
"num_input_tokens_seen": 50229232,
"step": 1044,
"train_runtime": 7290.7196,
"train_tokens_per_second": 6889.475
},
{
"epoch": 0.6718097074895532,
"grad_norm": 0.21437270939350128,
"learning_rate": 6.602192134107029e-05,
"loss": 1.0573,
"num_input_tokens_seen": 50277392,
"step": 1045,
"train_runtime": 7297.3971,
"train_tokens_per_second": 6889.771
},
{
"epoch": 0.672452587592414,
"grad_norm": 0.24188022315502167,
"learning_rate": 6.5892972275951e-05,
"loss": 0.984,
"num_input_tokens_seen": 50334688,
"step": 1046,
"train_runtime": 7305.3843,
"train_tokens_per_second": 6890.081
},
{
"epoch": 0.6730954676952748,
"grad_norm": 0.2214278280735016,
"learning_rate": 6.576402321083172e-05,
"loss": 0.9764,
"num_input_tokens_seen": 50380240,
"step": 1047,
"train_runtime": 7311.6909,
"train_tokens_per_second": 6890.368
},
{
"epoch": 0.6737383477981357,
"grad_norm": 0.20579014718532562,
"learning_rate": 6.563507414571246e-05,
"loss": 1.1293,
"num_input_tokens_seen": 50424352,
"step": 1048,
"train_runtime": 7317.8961,
"train_tokens_per_second": 6890.553
},
{
"epoch": 0.6743812279009964,
"grad_norm": 0.21741363406181335,
"learning_rate": 6.550612508059317e-05,
"loss": 0.9443,
"num_input_tokens_seen": 50467216,
"step": 1049,
"train_runtime": 7323.8851,
"train_tokens_per_second": 6890.771
},
{
"epoch": 0.6750241080038573,
"grad_norm": 0.2026466727256775,
"learning_rate": 6.537717601547389e-05,
"loss": 0.854,
"num_input_tokens_seen": 50501040,
"step": 1050,
"train_runtime": 7328.7043,
"train_tokens_per_second": 6890.855
},
{
"epoch": 0.6756669881067181,
"grad_norm": 0.18450354039669037,
"learning_rate": 6.524822695035462e-05,
"loss": 0.8429,
"num_input_tokens_seen": 50542768,
"step": 1051,
"train_runtime": 7335.0852,
"train_tokens_per_second": 6890.55
},
{
"epoch": 0.676309868209579,
"grad_norm": 0.2224583476781845,
"learning_rate": 6.511927788523533e-05,
"loss": 0.9466,
"num_input_tokens_seen": 50632528,
"step": 1052,
"train_runtime": 7347.6703,
"train_tokens_per_second": 6890.963
},
{
"epoch": 0.6769527483124397,
"grad_norm": 0.20810087025165558,
"learning_rate": 6.499032882011606e-05,
"loss": 0.875,
"num_input_tokens_seen": 50685568,
"step": 1053,
"train_runtime": 7355.0956,
"train_tokens_per_second": 6891.218
},
{
"epoch": 0.6775956284153005,
"grad_norm": 0.2427845001220703,
"learning_rate": 6.486137975499678e-05,
"loss": 1.0109,
"num_input_tokens_seen": 50744800,
"step": 1054,
"train_runtime": 7363.4158,
"train_tokens_per_second": 6891.476
},
{
"epoch": 0.6782385085181614,
"grad_norm": 0.2223530411720276,
"learning_rate": 6.47324306898775e-05,
"loss": 0.7355,
"num_input_tokens_seen": 50788688,
"step": 1055,
"train_runtime": 7369.5565,
"train_tokens_per_second": 6891.689
},
{
"epoch": 0.6788813886210222,
"grad_norm": 0.2333330661058426,
"learning_rate": 6.460348162475823e-05,
"loss": 0.9833,
"num_input_tokens_seen": 50832736,
"step": 1056,
"train_runtime": 7375.7831,
"train_tokens_per_second": 6891.843
},
{
"epoch": 0.6795242687238829,
"grad_norm": 0.21342216432094574,
"learning_rate": 6.447453255963895e-05,
"loss": 0.8388,
"num_input_tokens_seen": 50879456,
"step": 1057,
"train_runtime": 7382.3467,
"train_tokens_per_second": 6892.044
},
{
"epoch": 0.6801671488267438,
"grad_norm": 0.2341690957546234,
"learning_rate": 6.434558349451966e-05,
"loss": 0.9347,
"num_input_tokens_seen": 50934720,
"step": 1058,
"train_runtime": 7390.0582,
"train_tokens_per_second": 6892.33
},
{
"epoch": 0.6808100289296046,
"grad_norm": 0.2247081845998764,
"learning_rate": 6.42166344294004e-05,
"loss": 0.8637,
"num_input_tokens_seen": 50990400,
"step": 1059,
"train_runtime": 7397.8508,
"train_tokens_per_second": 6892.596
},
{
"epoch": 0.6814529090324655,
"grad_norm": 0.23331518471240997,
"learning_rate": 6.408768536428111e-05,
"loss": 1.1459,
"num_input_tokens_seen": 51031360,
"step": 1060,
"train_runtime": 7403.6192,
"train_tokens_per_second": 6892.759
},
{
"epoch": 0.6820957891353263,
"grad_norm": 0.2078360766172409,
"learning_rate": 6.395873629916183e-05,
"loss": 0.8934,
"num_input_tokens_seen": 51068048,
"step": 1061,
"train_runtime": 7408.8002,
"train_tokens_per_second": 6892.89
},
{
"epoch": 0.682738669238187,
"grad_norm": 0.24373888969421387,
"learning_rate": 6.382978723404256e-05,
"loss": 0.9581,
"num_input_tokens_seen": 51104944,
"step": 1062,
"train_runtime": 7414.0038,
"train_tokens_per_second": 6893.029
},
{
"epoch": 0.6833815493410479,
"grad_norm": 0.2216201275587082,
"learning_rate": 6.370083816892328e-05,
"loss": 1.0246,
"num_input_tokens_seen": 51153904,
"step": 1063,
"train_runtime": 7420.8674,
"train_tokens_per_second": 6893.251
},
{
"epoch": 0.6840244294439087,
"grad_norm": 0.25028952956199646,
"learning_rate": 6.3571889103804e-05,
"loss": 1.2053,
"num_input_tokens_seen": 51212272,
"step": 1064,
"train_runtime": 7429.1124,
"train_tokens_per_second": 6893.458
},
{
"epoch": 0.6846673095467696,
"grad_norm": 0.1991652399301529,
"learning_rate": 6.344294003868472e-05,
"loss": 0.8922,
"num_input_tokens_seen": 51249952,
"step": 1065,
"train_runtime": 7434.4247,
"train_tokens_per_second": 6893.6
},
{
"epoch": 0.6853101896496303,
"grad_norm": 0.22701826691627502,
"learning_rate": 6.331399097356544e-05,
"loss": 0.9936,
"num_input_tokens_seen": 51302224,
"step": 1066,
"train_runtime": 7441.7003,
"train_tokens_per_second": 6893.885
},
{
"epoch": 0.6859530697524912,
"grad_norm": 0.21672441065311432,
"learning_rate": 6.318504190844617e-05,
"loss": 1.0611,
"num_input_tokens_seen": 51367808,
"step": 1067,
"train_runtime": 7450.9283,
"train_tokens_per_second": 6894.149
},
{
"epoch": 0.686595949855352,
"grad_norm": 0.22594638168811798,
"learning_rate": 6.305609284332689e-05,
"loss": 0.93,
"num_input_tokens_seen": 51436192,
"step": 1068,
"train_runtime": 7460.4525,
"train_tokens_per_second": 6894.514
},
{
"epoch": 0.6872388299582128,
"grad_norm": 0.22045005857944489,
"learning_rate": 6.29271437782076e-05,
"loss": 0.9998,
"num_input_tokens_seen": 51487824,
"step": 1069,
"train_runtime": 7467.708,
"train_tokens_per_second": 6894.729
},
{
"epoch": 0.6878817100610736,
"grad_norm": 0.2007933109998703,
"learning_rate": 6.279819471308834e-05,
"loss": 0.959,
"num_input_tokens_seen": 51533248,
"step": 1070,
"train_runtime": 7474.0741,
"train_tokens_per_second": 6894.934
},
{
"epoch": 0.6885245901639344,
"grad_norm": 0.2333477884531021,
"learning_rate": 6.266924564796905e-05,
"loss": 1.0436,
"num_input_tokens_seen": 51590096,
"step": 1071,
"train_runtime": 7482.0555,
"train_tokens_per_second": 6895.177
},
{
"epoch": 0.6891674702667953,
"grad_norm": 0.2452705204486847,
"learning_rate": 6.254029658284977e-05,
"loss": 1.1345,
"num_input_tokens_seen": 51660640,
"step": 1072,
"train_runtime": 7491.8973,
"train_tokens_per_second": 6895.535
},
{
"epoch": 0.6898103503696561,
"grad_norm": 0.2273714393377304,
"learning_rate": 6.24113475177305e-05,
"loss": 0.9046,
"num_input_tokens_seen": 51722848,
"step": 1073,
"train_runtime": 7500.6012,
"train_tokens_per_second": 6895.827
},
{
"epoch": 0.6904532304725168,
"grad_norm": 0.22089748084545135,
"learning_rate": 6.228239845261122e-05,
"loss": 0.9745,
"num_input_tokens_seen": 51760048,
"step": 1074,
"train_runtime": 7505.8386,
"train_tokens_per_second": 6895.971
},
{
"epoch": 0.6910961105753777,
"grad_norm": 0.20138859748840332,
"learning_rate": 6.215344938749195e-05,
"loss": 0.8623,
"num_input_tokens_seen": 51805552,
"step": 1075,
"train_runtime": 7512.2247,
"train_tokens_per_second": 6896.166
},
{
"epoch": 0.6917389906782385,
"grad_norm": 0.20670074224472046,
"learning_rate": 6.202450032237267e-05,
"loss": 0.9809,
"num_input_tokens_seen": 51870080,
"step": 1076,
"train_runtime": 7521.3065,
"train_tokens_per_second": 6896.419
},
{
"epoch": 0.6923818707810994,
"grad_norm": 0.22219733893871307,
"learning_rate": 6.189555125725339e-05,
"loss": 0.9614,
"num_input_tokens_seen": 51916400,
"step": 1077,
"train_runtime": 7527.8271,
"train_tokens_per_second": 6896.598
},
{
"epoch": 0.6930247508839601,
"grad_norm": 0.2168516218662262,
"learning_rate": 6.176660219213412e-05,
"loss": 0.9194,
"num_input_tokens_seen": 51950992,
"step": 1078,
"train_runtime": 7532.7731,
"train_tokens_per_second": 6896.662
},
{
"epoch": 0.6936676309868209,
"grad_norm": 0.2015160173177719,
"learning_rate": 6.163765312701483e-05,
"loss": 0.891,
"num_input_tokens_seen": 51983408,
"step": 1079,
"train_runtime": 7537.4038,
"train_tokens_per_second": 6896.726
},
{
"epoch": 0.6943105110896818,
"grad_norm": 0.21054089069366455,
"learning_rate": 6.150870406189554e-05,
"loss": 0.9726,
"num_input_tokens_seen": 52063120,
"step": 1080,
"train_runtime": 7548.7363,
"train_tokens_per_second": 6896.932
},
{
"epoch": 0.6949533911925426,
"grad_norm": 0.2329845428466797,
"learning_rate": 6.137975499677628e-05,
"loss": 1.0234,
"num_input_tokens_seen": 52108432,
"step": 1081,
"train_runtime": 7555.6633,
"train_tokens_per_second": 6896.606
},
{
"epoch": 0.6955962712954034,
"grad_norm": 0.24675798416137695,
"learning_rate": 6.1250805931657e-05,
"loss": 1.0005,
"num_input_tokens_seen": 52164368,
"step": 1082,
"train_runtime": 7563.4869,
"train_tokens_per_second": 6896.868
},
{
"epoch": 0.6962391513982642,
"grad_norm": 0.21558962762355804,
"learning_rate": 6.112185686653773e-05,
"loss": 0.961,
"num_input_tokens_seen": 52213952,
"step": 1083,
"train_runtime": 7570.4103,
"train_tokens_per_second": 6897.11
},
{
"epoch": 0.696882031501125,
"grad_norm": 0.21725592017173767,
"learning_rate": 6.0992907801418444e-05,
"loss": 0.9962,
"num_input_tokens_seen": 52275392,
"step": 1084,
"train_runtime": 7578.9986,
"train_tokens_per_second": 6897.401
},
{
"epoch": 0.6975249116039859,
"grad_norm": 0.20202240347862244,
"learning_rate": 6.086395873629916e-05,
"loss": 0.8846,
"num_input_tokens_seen": 52326960,
"step": 1085,
"train_runtime": 7586.2257,
"train_tokens_per_second": 6897.628
},
{
"epoch": 0.6981677917068466,
"grad_norm": 0.24250298738479614,
"learning_rate": 6.0735009671179887e-05,
"loss": 0.9109,
"num_input_tokens_seen": 52357504,
"step": 1086,
"train_runtime": 7590.5452,
"train_tokens_per_second": 6897.726
},
{
"epoch": 0.6988106718097075,
"grad_norm": 0.21728849411010742,
"learning_rate": 6.060606060606061e-05,
"loss": 0.9872,
"num_input_tokens_seen": 52401488,
"step": 1087,
"train_runtime": 7596.6765,
"train_tokens_per_second": 6897.949
},
{
"epoch": 0.6994535519125683,
"grad_norm": 0.20992811024188995,
"learning_rate": 6.0477111540941336e-05,
"loss": 0.9504,
"num_input_tokens_seen": 52467152,
"step": 1088,
"train_runtime": 7605.7442,
"train_tokens_per_second": 6898.359
},
{
"epoch": 0.7000964320154291,
"grad_norm": 0.20924942195415497,
"learning_rate": 6.0348162475822054e-05,
"loss": 1.0382,
"num_input_tokens_seen": 52521776,
"step": 1089,
"train_runtime": 7613.3461,
"train_tokens_per_second": 6898.645
},
{
"epoch": 0.70073931211829,
"grad_norm": 0.23880977928638458,
"learning_rate": 6.021921341070278e-05,
"loss": 1.0625,
"num_input_tokens_seen": 52560640,
"step": 1090,
"train_runtime": 7618.7656,
"train_tokens_per_second": 6898.839
},
{
"epoch": 0.7013821922211507,
"grad_norm": 0.22585086524486542,
"learning_rate": 6.0090264345583504e-05,
"loss": 0.9023,
"num_input_tokens_seen": 52595664,
"step": 1091,
"train_runtime": 7623.6886,
"train_tokens_per_second": 6898.979
},
{
"epoch": 0.7020250723240116,
"grad_norm": 0.2203749567270279,
"learning_rate": 5.9961315280464216e-05,
"loss": 0.9401,
"num_input_tokens_seen": 52628416,
"step": 1092,
"train_runtime": 7628.3522,
"train_tokens_per_second": 6899.054
},
{
"epoch": 0.7020250723240116,
"eval_loss": 1.002116084098816,
"eval_runtime": 39.9717,
"eval_samples_per_second": 24.868,
"eval_steps_per_second": 1.576,
"num_input_tokens_seen": 52628416,
"step": 1092
},
{
"epoch": 0.7026679524268724,
"grad_norm": 0.20180866122245789,
"learning_rate": 5.983236621534494e-05,
"loss": 0.8595,
"num_input_tokens_seen": 52685664,
"step": 1093,
"train_runtime": 7676.3331,
"train_tokens_per_second": 6863.39
},
{
"epoch": 0.7033108325297333,
"grad_norm": 0.21487735211849213,
"learning_rate": 5.970341715022566e-05,
"loss": 0.9204,
"num_input_tokens_seen": 52728496,
"step": 1094,
"train_runtime": 7682.3441,
"train_tokens_per_second": 6863.595
},
{
"epoch": 0.703953712632594,
"grad_norm": 0.21911489963531494,
"learning_rate": 5.9574468085106384e-05,
"loss": 0.8805,
"num_input_tokens_seen": 52793232,
"step": 1095,
"train_runtime": 7691.3798,
"train_tokens_per_second": 6863.948
},
{
"epoch": 0.7045965927354548,
"grad_norm": 0.21352975070476532,
"learning_rate": 5.944551901998711e-05,
"loss": 0.9869,
"num_input_tokens_seen": 52845856,
"step": 1096,
"train_runtime": 7698.7181,
"train_tokens_per_second": 6864.241
},
{
"epoch": 0.7052394728383157,
"grad_norm": 0.22658900916576385,
"learning_rate": 5.9316569954867827e-05,
"loss": 0.8745,
"num_input_tokens_seen": 52907328,
"step": 1097,
"train_runtime": 7707.3226,
"train_tokens_per_second": 6864.553
},
{
"epoch": 0.7058823529411765,
"grad_norm": 0.21794851124286652,
"learning_rate": 5.918762088974855e-05,
"loss": 0.9739,
"num_input_tokens_seen": 52945344,
"step": 1098,
"train_runtime": 7712.6946,
"train_tokens_per_second": 6864.701
},
{
"epoch": 0.7065252330440372,
"grad_norm": 0.22467251121997833,
"learning_rate": 5.9058671824629276e-05,
"loss": 0.9488,
"num_input_tokens_seen": 52998032,
"step": 1099,
"train_runtime": 7720.1682,
"train_tokens_per_second": 6864.881
},
{
"epoch": 0.7071681131468981,
"grad_norm": 0.23567631840705872,
"learning_rate": 5.8929722759509994e-05,
"loss": 1.0229,
"num_input_tokens_seen": 53048416,
"step": 1100,
"train_runtime": 7727.1563,
"train_tokens_per_second": 6865.193
},
{
"epoch": 0.7078109932497589,
"grad_norm": 0.22417950630187988,
"learning_rate": 5.880077369439072e-05,
"loss": 0.8845,
"num_input_tokens_seen": 53087632,
"step": 1101,
"train_runtime": 7732.6797,
"train_tokens_per_second": 6865.36
},
{
"epoch": 0.7084538733526198,
"grad_norm": 0.23154444992542267,
"learning_rate": 5.8671824629271444e-05,
"loss": 0.9673,
"num_input_tokens_seen": 53131856,
"step": 1102,
"train_runtime": 7738.8958,
"train_tokens_per_second": 6865.56
},
{
"epoch": 0.7090967534554805,
"grad_norm": 0.22846034169197083,
"learning_rate": 5.854287556415217e-05,
"loss": 0.9304,
"num_input_tokens_seen": 53194192,
"step": 1103,
"train_runtime": 7747.5318,
"train_tokens_per_second": 6865.953
},
{
"epoch": 0.7097396335583414,
"grad_norm": 0.22535398602485657,
"learning_rate": 5.841392649903289e-05,
"loss": 0.9926,
"num_input_tokens_seen": 53237296,
"step": 1104,
"train_runtime": 7753.5662,
"train_tokens_per_second": 6866.169
},
{
"epoch": 0.7103825136612022,
"grad_norm": 0.21644599735736847,
"learning_rate": 5.828497743391361e-05,
"loss": 0.8929,
"num_input_tokens_seen": 53293872,
"step": 1105,
"train_runtime": 7761.4556,
"train_tokens_per_second": 6866.479
},
{
"epoch": 0.711025393764063,
"grad_norm": 0.2133343517780304,
"learning_rate": 5.8156028368794324e-05,
"loss": 1.0127,
"num_input_tokens_seen": 53336256,
"step": 1106,
"train_runtime": 7767.4386,
"train_tokens_per_second": 6866.647
},
{
"epoch": 0.7116682738669238,
"grad_norm": 0.21515777707099915,
"learning_rate": 5.802707930367505e-05,
"loss": 1.0408,
"num_input_tokens_seen": 53374128,
"step": 1107,
"train_runtime": 7772.794,
"train_tokens_per_second": 6866.788
},
{
"epoch": 0.7123111539697846,
"grad_norm": 0.223897784948349,
"learning_rate": 5.789813023855577e-05,
"loss": 1.0293,
"num_input_tokens_seen": 53418320,
"step": 1108,
"train_runtime": 7779.0117,
"train_tokens_per_second": 6866.98
},
{
"epoch": 0.7129540340726455,
"grad_norm": 0.23518460988998413,
"learning_rate": 5.776918117343649e-05,
"loss": 0.9154,
"num_input_tokens_seen": 53474272,
"step": 1109,
"train_runtime": 7786.7968,
"train_tokens_per_second": 6867.3
},
{
"epoch": 0.7135969141755063,
"grad_norm": 0.24510706961154938,
"learning_rate": 5.7640232108317216e-05,
"loss": 0.9749,
"num_input_tokens_seen": 53510944,
"step": 1110,
"train_runtime": 7791.917,
"train_tokens_per_second": 6867.494
},
{
"epoch": 0.714239794278367,
"grad_norm": 0.22904647886753082,
"learning_rate": 5.751128304319794e-05,
"loss": 0.9732,
"num_input_tokens_seen": 53566928,
"step": 1111,
"train_runtime": 7800.2156,
"train_tokens_per_second": 6867.365
},
{
"epoch": 0.7148826743812279,
"grad_norm": 0.24273896217346191,
"learning_rate": 5.738233397807866e-05,
"loss": 0.9793,
"num_input_tokens_seen": 53626144,
"step": 1112,
"train_runtime": 7808.4556,
"train_tokens_per_second": 6867.702
},
{
"epoch": 0.7155255544840887,
"grad_norm": 0.23252332210540771,
"learning_rate": 5.7253384912959384e-05,
"loss": 0.9698,
"num_input_tokens_seen": 53662896,
"step": 1113,
"train_runtime": 7813.5812,
"train_tokens_per_second": 6867.9
},
{
"epoch": 0.7161684345869496,
"grad_norm": 0.21385739743709564,
"learning_rate": 5.712443584784011e-05,
"loss": 0.9627,
"num_input_tokens_seen": 53702752,
"step": 1114,
"train_runtime": 7819.1534,
"train_tokens_per_second": 6868.103
},
{
"epoch": 0.7168113146898103,
"grad_norm": 0.22277802228927612,
"learning_rate": 5.699548678272083e-05,
"loss": 0.9046,
"num_input_tokens_seen": 53753744,
"step": 1115,
"train_runtime": 7826.2367,
"train_tokens_per_second": 6868.403
},
{
"epoch": 0.7174541947926711,
"grad_norm": 0.24389879405498505,
"learning_rate": 5.686653771760155e-05,
"loss": 0.9821,
"num_input_tokens_seen": 53797728,
"step": 1116,
"train_runtime": 7832.3144,
"train_tokens_per_second": 6868.689
},
{
"epoch": 0.718097074895532,
"grad_norm": 0.22600604593753815,
"learning_rate": 5.673758865248228e-05,
"loss": 0.9745,
"num_input_tokens_seen": 53832608,
"step": 1117,
"train_runtime": 7837.1799,
"train_tokens_per_second": 6868.875
},
{
"epoch": 0.7187399549983928,
"grad_norm": 0.22461646795272827,
"learning_rate": 5.6608639587363e-05,
"loss": 0.966,
"num_input_tokens_seen": 53870880,
"step": 1118,
"train_runtime": 7842.5366,
"train_tokens_per_second": 6869.063
},
{
"epoch": 0.7193828351012537,
"grad_norm": 0.2225736677646637,
"learning_rate": 5.647969052224371e-05,
"loss": 0.9372,
"num_input_tokens_seen": 53912432,
"step": 1119,
"train_runtime": 7848.3282,
"train_tokens_per_second": 6869.289
},
{
"epoch": 0.7200257152041144,
"grad_norm": 0.20642247796058655,
"learning_rate": 5.635074145712443e-05,
"loss": 0.9846,
"num_input_tokens_seen": 53955376,
"step": 1120,
"train_runtime": 7854.2753,
"train_tokens_per_second": 6869.555
},
{
"epoch": 0.7206685953069752,
"grad_norm": 0.20037145912647247,
"learning_rate": 5.6221792392005156e-05,
"loss": 0.9248,
"num_input_tokens_seen": 54010848,
"step": 1121,
"train_runtime": 7861.9353,
"train_tokens_per_second": 6869.918
},
{
"epoch": 0.7213114754098361,
"grad_norm": 0.21794676780700684,
"learning_rate": 5.609284332688588e-05,
"loss": 0.8596,
"num_input_tokens_seen": 54044656,
"step": 1122,
"train_runtime": 7866.6604,
"train_tokens_per_second": 6870.089
},
{
"epoch": 0.7219543555126969,
"grad_norm": 0.23393063247203827,
"learning_rate": 5.5963894261766606e-05,
"loss": 1.0028,
"num_input_tokens_seen": 54100128,
"step": 1123,
"train_runtime": 7874.2817,
"train_tokens_per_second": 6870.484
},
{
"epoch": 0.7225972356155577,
"grad_norm": 0.22931329905986786,
"learning_rate": 5.5834945196647324e-05,
"loss": 1.0313,
"num_input_tokens_seen": 54153344,
"step": 1124,
"train_runtime": 7881.6167,
"train_tokens_per_second": 6870.842
},
{
"epoch": 0.7232401157184185,
"grad_norm": 0.22053447365760803,
"learning_rate": 5.570599613152805e-05,
"loss": 0.861,
"num_input_tokens_seen": 54222704,
"step": 1125,
"train_runtime": 7891.1353,
"train_tokens_per_second": 6871.344
},
{
"epoch": 0.7238829958212794,
"grad_norm": 0.22127224504947662,
"learning_rate": 5.5577047066408774e-05,
"loss": 0.8733,
"num_input_tokens_seen": 54263936,
"step": 1126,
"train_runtime": 7896.8263,
"train_tokens_per_second": 6871.613
},
{
"epoch": 0.7245258759241402,
"grad_norm": 0.20868195593357086,
"learning_rate": 5.544809800128949e-05,
"loss": 1.0278,
"num_input_tokens_seen": 54308544,
"step": 1127,
"train_runtime": 7903.0171,
"train_tokens_per_second": 6871.875
},
{
"epoch": 0.7251687560270009,
"grad_norm": 0.2393093705177307,
"learning_rate": 5.531914893617022e-05,
"loss": 1.0157,
"num_input_tokens_seen": 54355248,
"step": 1128,
"train_runtime": 7909.4817,
"train_tokens_per_second": 6872.163
},
{
"epoch": 0.7258116361298618,
"grad_norm": 0.24080771207809448,
"learning_rate": 5.519019987105094e-05,
"loss": 0.948,
"num_input_tokens_seen": 54398944,
"step": 1129,
"train_runtime": 7915.4679,
"train_tokens_per_second": 6872.486
},
{
"epoch": 0.7264545162327226,
"grad_norm": 0.22321158647537231,
"learning_rate": 5.506125080593166e-05,
"loss": 0.9862,
"num_input_tokens_seen": 54439088,
"step": 1130,
"train_runtime": 7921.003,
"train_tokens_per_second": 6872.752
},
{
"epoch": 0.7270973963355835,
"grad_norm": 0.2523844838142395,
"learning_rate": 5.4932301740812385e-05,
"loss": 0.9001,
"num_input_tokens_seen": 54505696,
"step": 1131,
"train_runtime": 7930.1312,
"train_tokens_per_second": 6873.24
},
{
"epoch": 0.7277402764384442,
"grad_norm": 0.22878628969192505,
"learning_rate": 5.480335267569311e-05,
"loss": 0.9857,
"num_input_tokens_seen": 54556000,
"step": 1132,
"train_runtime": 7937.1096,
"train_tokens_per_second": 6873.535
},
{
"epoch": 0.728383156541305,
"grad_norm": 0.2232838124036789,
"learning_rate": 5.467440361057382e-05,
"loss": 0.943,
"num_input_tokens_seen": 54593344,
"step": 1133,
"train_runtime": 7942.2821,
"train_tokens_per_second": 6873.76
},
{
"epoch": 0.7290260366441659,
"grad_norm": 0.23237422108650208,
"learning_rate": 5.4545454545454546e-05,
"loss": 1.0123,
"num_input_tokens_seen": 54646032,
"step": 1134,
"train_runtime": 7949.4332,
"train_tokens_per_second": 6874.205
},
{
"epoch": 0.7296689167470267,
"grad_norm": 0.21997365355491638,
"learning_rate": 5.4416505480335264e-05,
"loss": 0.8986,
"num_input_tokens_seen": 54695088,
"step": 1135,
"train_runtime": 7956.23,
"train_tokens_per_second": 6874.498
},
{
"epoch": 0.7303117968498875,
"grad_norm": 0.23271259665489197,
"learning_rate": 5.428755641521599e-05,
"loss": 0.8801,
"num_input_tokens_seen": 54752464,
"step": 1136,
"train_runtime": 7964.1444,
"train_tokens_per_second": 6874.871
},
{
"epoch": 0.7309546769527483,
"grad_norm": 0.24548843502998352,
"learning_rate": 5.4158607350096714e-05,
"loss": 0.9257,
"num_input_tokens_seen": 54792336,
"step": 1137,
"train_runtime": 7969.6902,
"train_tokens_per_second": 6875.09
},
{
"epoch": 0.7315975570556091,
"grad_norm": 0.2421896904706955,
"learning_rate": 5.402965828497744e-05,
"loss": 1.0737,
"num_input_tokens_seen": 54834752,
"step": 1138,
"train_runtime": 7975.5384,
"train_tokens_per_second": 6875.367
},
{
"epoch": 0.73224043715847,
"grad_norm": 0.23351521790027618,
"learning_rate": 5.390070921985816e-05,
"loss": 0.9608,
"num_input_tokens_seen": 54886640,
"step": 1139,
"train_runtime": 7982.717,
"train_tokens_per_second": 6875.684
},
{
"epoch": 0.7328833172613307,
"grad_norm": 0.23344506323337555,
"learning_rate": 5.377176015473888e-05,
"loss": 0.9816,
"num_input_tokens_seen": 54954016,
"step": 1140,
"train_runtime": 7991.9968,
"train_tokens_per_second": 6876.131
},
{
"epoch": 0.7335261973641916,
"grad_norm": 0.23483243584632874,
"learning_rate": 5.364281108961961e-05,
"loss": 1.0239,
"num_input_tokens_seen": 55011264,
"step": 1141,
"train_runtime": 8000.4982,
"train_tokens_per_second": 6875.98
},
{
"epoch": 0.7341690774670524,
"grad_norm": 0.2115328162908554,
"learning_rate": 5.3513862024500325e-05,
"loss": 0.9455,
"num_input_tokens_seen": 55064576,
"step": 1142,
"train_runtime": 8007.8404,
"train_tokens_per_second": 6876.333
},
{
"epoch": 0.7348119575699132,
"grad_norm": 0.23102976381778717,
"learning_rate": 5.338491295938105e-05,
"loss": 1.0438,
"num_input_tokens_seen": 55113792,
"step": 1143,
"train_runtime": 8014.6035,
"train_tokens_per_second": 6876.671
},
{
"epoch": 0.735454837672774,
"grad_norm": 0.2138880044221878,
"learning_rate": 5.3255963894261775e-05,
"loss": 1.0519,
"num_input_tokens_seen": 55160768,
"step": 1144,
"train_runtime": 8021.058,
"train_tokens_per_second": 6876.994
},
{
"epoch": 0.7360977177756348,
"grad_norm": 0.22077840566635132,
"learning_rate": 5.312701482914249e-05,
"loss": 0.999,
"num_input_tokens_seen": 55207872,
"step": 1145,
"train_runtime": 8027.5436,
"train_tokens_per_second": 6877.306
},
{
"epoch": 0.7367405978784957,
"grad_norm": 0.22485333681106567,
"learning_rate": 5.299806576402321e-05,
"loss": 0.9196,
"num_input_tokens_seen": 55258304,
"step": 1146,
"train_runtime": 8034.4365,
"train_tokens_per_second": 6877.683
},
{
"epoch": 0.7373834779813565,
"grad_norm": 0.22138972580432892,
"learning_rate": 5.286911669890393e-05,
"loss": 0.9889,
"num_input_tokens_seen": 55313520,
"step": 1147,
"train_runtime": 8042.0983,
"train_tokens_per_second": 6877.996
},
{
"epoch": 0.7380263580842173,
"grad_norm": 0.23767682909965515,
"learning_rate": 5.2740167633784654e-05,
"loss": 0.9317,
"num_input_tokens_seen": 55366688,
"step": 1148,
"train_runtime": 8049.4084,
"train_tokens_per_second": 6878.355
},
{
"epoch": 0.7386692381870781,
"grad_norm": 0.21733619272708893,
"learning_rate": 5.261121856866538e-05,
"loss": 1.0789,
"num_input_tokens_seen": 55407632,
"step": 1149,
"train_runtime": 8055.0656,
"train_tokens_per_second": 6878.607
},
{
"epoch": 0.7393121182899389,
"grad_norm": 0.23163765668869019,
"learning_rate": 5.24822695035461e-05,
"loss": 1.0057,
"num_input_tokens_seen": 55460928,
"step": 1150,
"train_runtime": 8062.3716,
"train_tokens_per_second": 6878.984
},
{
"epoch": 0.7399549983927998,
"grad_norm": 0.21014994382858276,
"learning_rate": 5.235332043842682e-05,
"loss": 0.9287,
"num_input_tokens_seen": 55505344,
"step": 1151,
"train_runtime": 8068.5377,
"train_tokens_per_second": 6879.232
},
{
"epoch": 0.7405978784956606,
"grad_norm": 0.225826233625412,
"learning_rate": 5.222437137330755e-05,
"loss": 0.9094,
"num_input_tokens_seen": 55542640,
"step": 1152,
"train_runtime": 8073.7681,
"train_tokens_per_second": 6879.395
},
{
"epoch": 0.7412407585985213,
"grad_norm": 0.20695921778678894,
"learning_rate": 5.209542230818827e-05,
"loss": 0.9438,
"num_input_tokens_seen": 55584288,
"step": 1153,
"train_runtime": 8079.5894,
"train_tokens_per_second": 6879.593
},
{
"epoch": 0.7418836387013822,
"grad_norm": 0.23178590834140778,
"learning_rate": 5.196647324306899e-05,
"loss": 0.9829,
"num_input_tokens_seen": 55639888,
"step": 1154,
"train_runtime": 8087.3713,
"train_tokens_per_second": 6879.848
},
{
"epoch": 0.742526518804243,
"grad_norm": 0.22732076048851013,
"learning_rate": 5.1837524177949715e-05,
"loss": 1.0151,
"num_input_tokens_seen": 55680480,
"step": 1155,
"train_runtime": 8093.0698,
"train_tokens_per_second": 6880.02
},
{
"epoch": 0.7431693989071039,
"grad_norm": 0.2244046926498413,
"learning_rate": 5.170857511283044e-05,
"loss": 1.0104,
"num_input_tokens_seen": 55723328,
"step": 1156,
"train_runtime": 8099.1214,
"train_tokens_per_second": 6880.17
},
{
"epoch": 0.7438122790099646,
"grad_norm": 0.23200780153274536,
"learning_rate": 5.157962604771116e-05,
"loss": 1.0062,
"num_input_tokens_seen": 55768816,
"step": 1157,
"train_runtime": 8105.5226,
"train_tokens_per_second": 6880.348
},
{
"epoch": 0.7444551591128254,
"grad_norm": 0.21963828802108765,
"learning_rate": 5.145067698259188e-05,
"loss": 0.9265,
"num_input_tokens_seen": 55835024,
"step": 1158,
"train_runtime": 8114.7836,
"train_tokens_per_second": 6880.655
},
{
"epoch": 0.7450980392156863,
"grad_norm": 0.20844990015029907,
"learning_rate": 5.132172791747261e-05,
"loss": 0.9126,
"num_input_tokens_seen": 55879152,
"step": 1159,
"train_runtime": 8120.9672,
"train_tokens_per_second": 6880.849
},
{
"epoch": 0.7457409193185471,
"grad_norm": 0.2319706231355667,
"learning_rate": 5.119277885235332e-05,
"loss": 1.1053,
"num_input_tokens_seen": 55932224,
"step": 1160,
"train_runtime": 8128.4026,
"train_tokens_per_second": 6881.084
},
{
"epoch": 0.7463837994214079,
"grad_norm": 0.2260400801897049,
"learning_rate": 5.1063829787234044e-05,
"loss": 0.9339,
"num_input_tokens_seen": 55985392,
"step": 1161,
"train_runtime": 8135.8349,
"train_tokens_per_second": 6881.333
},
{
"epoch": 0.7470266795242687,
"grad_norm": 0.2468838393688202,
"learning_rate": 5.093488072211476e-05,
"loss": 0.9742,
"num_input_tokens_seen": 56028096,
"step": 1162,
"train_runtime": 8141.77,
"train_tokens_per_second": 6881.562
},
{
"epoch": 0.7476695596271296,
"grad_norm": 0.23743107914924622,
"learning_rate": 5.080593165699549e-05,
"loss": 0.9592,
"num_input_tokens_seen": 56083904,
"step": 1163,
"train_runtime": 8149.5139,
"train_tokens_per_second": 6881.871
},
{
"epoch": 0.7483124397299904,
"grad_norm": 0.230645552277565,
"learning_rate": 5.067698259187621e-05,
"loss": 0.9732,
"num_input_tokens_seen": 56116832,
"step": 1164,
"train_runtime": 8154.1629,
"train_tokens_per_second": 6881.986
},
{
"epoch": 0.7489553198328511,
"grad_norm": 0.21561990678310394,
"learning_rate": 5.054803352675693e-05,
"loss": 0.9405,
"num_input_tokens_seen": 56161920,
"step": 1165,
"train_runtime": 8160.4444,
"train_tokens_per_second": 6882.213
},
{
"epoch": 0.749598199935712,
"grad_norm": 0.2270730882883072,
"learning_rate": 5.0419084461637655e-05,
"loss": 1.0281,
"num_input_tokens_seen": 56211712,
"step": 1166,
"train_runtime": 8167.4132,
"train_tokens_per_second": 6882.438
},
{
"epoch": 0.7502410800385728,
"grad_norm": 0.23744960129261017,
"learning_rate": 5.029013539651838e-05,
"loss": 0.9077,
"num_input_tokens_seen": 56250912,
"step": 1167,
"train_runtime": 8172.9494,
"train_tokens_per_second": 6882.572
},
{
"epoch": 0.7508839601414337,
"grad_norm": 0.24074719846248627,
"learning_rate": 5.0161186331399105e-05,
"loss": 1.0299,
"num_input_tokens_seen": 56320176,
"step": 1168,
"train_runtime": 8182.589,
"train_tokens_per_second": 6882.929
},
{
"epoch": 0.7515268402442944,
"grad_norm": 0.2285345196723938,
"learning_rate": 5.003223726627982e-05,
"loss": 1.0016,
"num_input_tokens_seen": 56372112,
"step": 1169,
"train_runtime": 8189.9035,
"train_tokens_per_second": 6883.123
},
{
"epoch": 0.7521697203471552,
"grad_norm": 0.24572432041168213,
"learning_rate": 4.990328820116054e-05,
"loss": 0.883,
"num_input_tokens_seen": 56428272,
"step": 1170,
"train_runtime": 8197.7663,
"train_tokens_per_second": 6883.372
},
{
"epoch": 0.7528126004500161,
"grad_norm": 0.22612586617469788,
"learning_rate": 4.9774339136041266e-05,
"loss": 0.8977,
"num_input_tokens_seen": 56501376,
"step": 1171,
"train_runtime": 8208.6044,
"train_tokens_per_second": 6883.189
},
{
"epoch": 0.7534554805528769,
"grad_norm": 0.23137860000133514,
"learning_rate": 4.964539007092199e-05,
"loss": 1.0062,
"num_input_tokens_seen": 56557344,
"step": 1172,
"train_runtime": 8216.4609,
"train_tokens_per_second": 6883.419
},
{
"epoch": 0.7540983606557377,
"grad_norm": 0.21029794216156006,
"learning_rate": 4.951644100580271e-05,
"loss": 0.925,
"num_input_tokens_seen": 56603296,
"step": 1173,
"train_runtime": 8222.8421,
"train_tokens_per_second": 6883.666
},
{
"epoch": 0.7547412407585985,
"grad_norm": 0.2205536663532257,
"learning_rate": 4.9387491940683434e-05,
"loss": 0.9305,
"num_input_tokens_seen": 56658960,
"step": 1174,
"train_runtime": 8230.6725,
"train_tokens_per_second": 6883.88
},
{
"epoch": 0.7553841208614593,
"grad_norm": 0.22032520174980164,
"learning_rate": 4.925854287556416e-05,
"loss": 0.9456,
"num_input_tokens_seen": 56695088,
"step": 1175,
"train_runtime": 8235.7777,
"train_tokens_per_second": 6883.999
},
{
"epoch": 0.7560270009643202,
"grad_norm": 0.22646676003932953,
"learning_rate": 4.912959381044488e-05,
"loss": 1.0539,
"num_input_tokens_seen": 56740304,
"step": 1176,
"train_runtime": 8242.1556,
"train_tokens_per_second": 6884.158
},
{
"epoch": 0.7566698810671809,
"grad_norm": 0.24559547007083893,
"learning_rate": 4.9000644745325595e-05,
"loss": 0.988,
"num_input_tokens_seen": 56798672,
"step": 1177,
"train_runtime": 8250.314,
"train_tokens_per_second": 6884.425
},
{
"epoch": 0.7573127611700418,
"grad_norm": 0.21654796600341797,
"learning_rate": 4.887169568020632e-05,
"loss": 0.9943,
"num_input_tokens_seen": 56843280,
"step": 1178,
"train_runtime": 8256.5134,
"train_tokens_per_second": 6884.659
},
{
"epoch": 0.7579556412729026,
"grad_norm": 0.2150622457265854,
"learning_rate": 4.8742746615087045e-05,
"loss": 0.9943,
"num_input_tokens_seen": 56898112,
"step": 1179,
"train_runtime": 8264.2324,
"train_tokens_per_second": 6884.864
},
{
"epoch": 0.7585985213757634,
"grad_norm": 0.22791166603565216,
"learning_rate": 4.861379754996776e-05,
"loss": 0.9494,
"num_input_tokens_seen": 56950448,
"step": 1180,
"train_runtime": 8271.587,
"train_tokens_per_second": 6885.069
},
{
"epoch": 0.7592414014786243,
"grad_norm": 0.21735823154449463,
"learning_rate": 4.848484848484849e-05,
"loss": 0.9485,
"num_input_tokens_seen": 56979856,
"step": 1181,
"train_runtime": 8275.7774,
"train_tokens_per_second": 6885.136
},
{
"epoch": 0.759884281581485,
"grad_norm": 0.22657233476638794,
"learning_rate": 4.835589941972921e-05,
"loss": 0.9565,
"num_input_tokens_seen": 57036800,
"step": 1182,
"train_runtime": 8283.7895,
"train_tokens_per_second": 6885.351
},
{
"epoch": 0.7605271616843459,
"grad_norm": 0.21392716467380524,
"learning_rate": 4.822695035460993e-05,
"loss": 1.0406,
"num_input_tokens_seen": 57084048,
"step": 1183,
"train_runtime": 8290.4276,
"train_tokens_per_second": 6885.537
},
{
"epoch": 0.7611700417872067,
"grad_norm": 0.2238176167011261,
"learning_rate": 4.809800128949065e-05,
"loss": 1.0245,
"num_input_tokens_seen": 57143824,
"step": 1184,
"train_runtime": 8298.876,
"train_tokens_per_second": 6885.731
},
{
"epoch": 0.7618129218900676,
"grad_norm": 0.21898095309734344,
"learning_rate": 4.7969052224371374e-05,
"loss": 1.0304,
"num_input_tokens_seen": 57183152,
"step": 1185,
"train_runtime": 8304.3882,
"train_tokens_per_second": 6885.896
},
{
"epoch": 0.7624558019929283,
"grad_norm": 0.2068723440170288,
"learning_rate": 4.78401031592521e-05,
"loss": 0.9284,
"num_input_tokens_seen": 57222176,
"step": 1186,
"train_runtime": 8309.9032,
"train_tokens_per_second": 6886.022
},
{
"epoch": 0.7630986820957891,
"grad_norm": 0.22520464658737183,
"learning_rate": 4.7711154094132824e-05,
"loss": 0.9208,
"num_input_tokens_seen": 57264864,
"step": 1187,
"train_runtime": 8315.896,
"train_tokens_per_second": 6886.193
},
{
"epoch": 0.76374156219865,
"grad_norm": 0.22291500866413116,
"learning_rate": 4.758220502901354e-05,
"loss": 0.9927,
"num_input_tokens_seen": 57305552,
"step": 1188,
"train_runtime": 8321.6354,
"train_tokens_per_second": 6886.333
},
{
"epoch": 0.7643844423015108,
"grad_norm": 0.23212119936943054,
"learning_rate": 4.745325596389427e-05,
"loss": 0.9143,
"num_input_tokens_seen": 57345392,
"step": 1189,
"train_runtime": 8327.2897,
"train_tokens_per_second": 6886.441
},
{
"epoch": 0.7650273224043715,
"grad_norm": 0.24220021069049835,
"learning_rate": 4.7324306898774985e-05,
"loss": 0.9725,
"num_input_tokens_seen": 57401472,
"step": 1190,
"train_runtime": 8335.2033,
"train_tokens_per_second": 6886.631
},
{
"epoch": 0.7656702025072324,
"grad_norm": 0.22186042368412018,
"learning_rate": 4.719535783365571e-05,
"loss": 0.9678,
"num_input_tokens_seen": 57442512,
"step": 1191,
"train_runtime": 8340.9492,
"train_tokens_per_second": 6886.808
},
{
"epoch": 0.7663130826100932,
"grad_norm": 0.23403644561767578,
"learning_rate": 4.706640876853643e-05,
"loss": 0.9648,
"num_input_tokens_seen": 57483120,
"step": 1192,
"train_runtime": 8346.684,
"train_tokens_per_second": 6886.941
},
{
"epoch": 0.7669559627129541,
"grad_norm": 0.22645071148872375,
"learning_rate": 4.693745970341715e-05,
"loss": 0.9198,
"num_input_tokens_seen": 57525104,
"step": 1193,
"train_runtime": 8352.5785,
"train_tokens_per_second": 6887.107
},
{
"epoch": 0.7675988428158148,
"grad_norm": 0.2159106433391571,
"learning_rate": 4.680851063829788e-05,
"loss": 0.9795,
"num_input_tokens_seen": 57565168,
"step": 1194,
"train_runtime": 8358.1865,
"train_tokens_per_second": 6887.28
},
{
"epoch": 0.7682417229186757,
"grad_norm": 0.22750870883464813,
"learning_rate": 4.6679561573178596e-05,
"loss": 0.8687,
"num_input_tokens_seen": 57614672,
"step": 1195,
"train_runtime": 8365.1418,
"train_tokens_per_second": 6887.471
},
{
"epoch": 0.7688846030215365,
"grad_norm": 0.21381807327270508,
"learning_rate": 4.655061250805932e-05,
"loss": 1.0295,
"num_input_tokens_seen": 57658208,
"step": 1196,
"train_runtime": 8371.2702,
"train_tokens_per_second": 6887.63
},
{
"epoch": 0.7695274831243973,
"grad_norm": 0.2144988477230072,
"learning_rate": 4.642166344294004e-05,
"loss": 0.9495,
"num_input_tokens_seen": 57712400,
"step": 1197,
"train_runtime": 8378.8176,
"train_tokens_per_second": 6887.893
},
{
"epoch": 0.7701703632272581,
"grad_norm": 0.23491157591342926,
"learning_rate": 4.6292714377820764e-05,
"loss": 1.0421,
"num_input_tokens_seen": 57762512,
"step": 1198,
"train_runtime": 8385.8252,
"train_tokens_per_second": 6888.113
},
{
"epoch": 0.7708132433301189,
"grad_norm": 0.2191002517938614,
"learning_rate": 4.616376531270148e-05,
"loss": 0.9837,
"num_input_tokens_seen": 57801200,
"step": 1199,
"train_runtime": 8391.2734,
"train_tokens_per_second": 6888.251
},
{
"epoch": 0.7714561234329798,
"grad_norm": 0.24052459001541138,
"learning_rate": 4.603481624758221e-05,
"loss": 0.9505,
"num_input_tokens_seen": 57848416,
"step": 1200,
"train_runtime": 8397.9153,
"train_tokens_per_second": 6888.426
},
{
"epoch": 0.7720990035358406,
"grad_norm": 0.21337009966373444,
"learning_rate": 4.590586718246293e-05,
"loss": 1.0245,
"num_input_tokens_seen": 57912256,
"step": 1201,
"train_runtime": 8407.4519,
"train_tokens_per_second": 6888.205
},
{
"epoch": 0.7727418836387013,
"grad_norm": 0.2229907065629959,
"learning_rate": 4.5776918117343656e-05,
"loss": 1.0446,
"num_input_tokens_seen": 57950320,
"step": 1202,
"train_runtime": 8412.8371,
"train_tokens_per_second": 6888.321
},
{
"epoch": 0.7733847637415622,
"grad_norm": 0.21816016733646393,
"learning_rate": 4.564796905222437e-05,
"loss": 0.9966,
"num_input_tokens_seen": 58008464,
"step": 1203,
"train_runtime": 8421.0592,
"train_tokens_per_second": 6888.5
},
{
"epoch": 0.774027643844423,
"grad_norm": 0.2395995855331421,
"learning_rate": 4.551901998710509e-05,
"loss": 0.9236,
"num_input_tokens_seen": 58046464,
"step": 1204,
"train_runtime": 8426.4054,
"train_tokens_per_second": 6888.639
},
{
"epoch": 0.7746705239472839,
"grad_norm": 0.22368338704109192,
"learning_rate": 4.539007092198582e-05,
"loss": 0.9081,
"num_input_tokens_seen": 58099648,
"step": 1205,
"train_runtime": 8433.8425,
"train_tokens_per_second": 6888.87
},
{
"epoch": 0.7753134040501446,
"grad_norm": 0.2314455807209015,
"learning_rate": 4.526112185686654e-05,
"loss": 1.0343,
"num_input_tokens_seen": 58145440,
"step": 1206,
"train_runtime": 8440.2523,
"train_tokens_per_second": 6889.064
},
{
"epoch": 0.7759562841530054,
"grad_norm": 0.22723662853240967,
"learning_rate": 4.513217279174726e-05,
"loss": 0.9582,
"num_input_tokens_seen": 58191472,
"step": 1207,
"train_runtime": 8446.7219,
"train_tokens_per_second": 6889.237
},
{
"epoch": 0.7765991642558663,
"grad_norm": 0.21512675285339355,
"learning_rate": 4.5003223726627986e-05,
"loss": 0.9875,
"num_input_tokens_seen": 58242688,
"step": 1208,
"train_runtime": 8453.9052,
"train_tokens_per_second": 6889.442
},
{
"epoch": 0.7772420443587271,
"grad_norm": 0.21539998054504395,
"learning_rate": 4.487427466150871e-05,
"loss": 0.9029,
"num_input_tokens_seen": 58292320,
"step": 1209,
"train_runtime": 8460.89,
"train_tokens_per_second": 6889.62
},
{
"epoch": 0.777884924461588,
"grad_norm": 0.2292962372303009,
"learning_rate": 4.474532559638943e-05,
"loss": 0.9405,
"num_input_tokens_seen": 58335520,
"step": 1210,
"train_runtime": 8466.9635,
"train_tokens_per_second": 6889.781
},
{
"epoch": 0.7785278045644487,
"grad_norm": 0.22950732707977295,
"learning_rate": 4.461637653127015e-05,
"loss": 0.9055,
"num_input_tokens_seen": 58409648,
"step": 1211,
"train_runtime": 8477.3793,
"train_tokens_per_second": 6890.06
},
{
"epoch": 0.7791706846673095,
"grad_norm": 0.2094380408525467,
"learning_rate": 4.448742746615087e-05,
"loss": 1.0754,
"num_input_tokens_seen": 58446592,
"step": 1212,
"train_runtime": 8482.5952,
"train_tokens_per_second": 6890.178
},
{
"epoch": 0.7798135647701704,
"grad_norm": 0.21322154998779297,
"learning_rate": 4.4358478401031597e-05,
"loss": 0.9984,
"num_input_tokens_seen": 58523840,
"step": 1213,
"train_runtime": 8493.4865,
"train_tokens_per_second": 6890.438
},
{
"epoch": 0.7804564448730312,
"grad_norm": 0.2207326591014862,
"learning_rate": 4.4229529335912315e-05,
"loss": 0.9486,
"num_input_tokens_seen": 58565120,
"step": 1214,
"train_runtime": 8499.3099,
"train_tokens_per_second": 6890.574
},
{
"epoch": 0.781099324975892,
"grad_norm": 0.22177189588546753,
"learning_rate": 4.410058027079304e-05,
"loss": 1.0167,
"num_input_tokens_seen": 58601776,
"step": 1215,
"train_runtime": 8504.5197,
"train_tokens_per_second": 6890.663
},
{
"epoch": 0.7817422050787528,
"grad_norm": 0.23585543036460876,
"learning_rate": 4.3971631205673764e-05,
"loss": 1.004,
"num_input_tokens_seen": 58648016,
"step": 1216,
"train_runtime": 8511.012,
"train_tokens_per_second": 6890.839
},
{
"epoch": 0.7823850851816136,
"grad_norm": 0.22136184573173523,
"learning_rate": 4.384268214055448e-05,
"loss": 0.982,
"num_input_tokens_seen": 58688384,
"step": 1217,
"train_runtime": 8516.686,
"train_tokens_per_second": 6890.988
},
{
"epoch": 0.7830279652844745,
"grad_norm": 0.25705647468566895,
"learning_rate": 4.37137330754352e-05,
"loss": 0.9643,
"num_input_tokens_seen": 58736880,
"step": 1218,
"train_runtime": 8523.4446,
"train_tokens_per_second": 6891.214
},
{
"epoch": 0.7836708453873352,
"grad_norm": 0.21513555943965912,
"learning_rate": 4.3584784010315926e-05,
"loss": 0.9442,
"num_input_tokens_seen": 58786448,
"step": 1219,
"train_runtime": 8530.4163,
"train_tokens_per_second": 6891.393
},
{
"epoch": 0.7843137254901961,
"grad_norm": 0.21693727374076843,
"learning_rate": 4.345583494519665e-05,
"loss": 0.9013,
"num_input_tokens_seen": 58826464,
"step": 1220,
"train_runtime": 8536.0745,
"train_tokens_per_second": 6891.512
},
{
"epoch": 0.7849566055930569,
"grad_norm": 0.22054851055145264,
"learning_rate": 4.3326885880077375e-05,
"loss": 0.8901,
"num_input_tokens_seen": 58875904,
"step": 1221,
"train_runtime": 8543.0507,
"train_tokens_per_second": 6891.672
},
{
"epoch": 0.7855994856959178,
"grad_norm": 0.2086583971977234,
"learning_rate": 4.3197936814958094e-05,
"loss": 0.939,
"num_input_tokens_seen": 58917904,
"step": 1222,
"train_runtime": 8548.9468,
"train_tokens_per_second": 6891.832
},
{
"epoch": 0.7862423657987785,
"grad_norm": 0.22025592625141144,
"learning_rate": 4.306898774983882e-05,
"loss": 0.9353,
"num_input_tokens_seen": 58968256,
"step": 1223,
"train_runtime": 8556.0367,
"train_tokens_per_second": 6892.006
},
{
"epoch": 0.7868852459016393,
"grad_norm": 0.22146140038967133,
"learning_rate": 4.2940038684719537e-05,
"loss": 0.8715,
"num_input_tokens_seen": 59012672,
"step": 1224,
"train_runtime": 8562.2887,
"train_tokens_per_second": 6892.161
},
{
"epoch": 0.7875281260045002,
"grad_norm": 0.21178406476974487,
"learning_rate": 4.281108961960026e-05,
"loss": 0.9546,
"num_input_tokens_seen": 59060096,
"step": 1225,
"train_runtime": 8568.9631,
"train_tokens_per_second": 6892.327
},
{
"epoch": 0.788171006107361,
"grad_norm": 0.236673966050148,
"learning_rate": 4.268214055448098e-05,
"loss": 0.976,
"num_input_tokens_seen": 59099840,
"step": 1226,
"train_runtime": 8574.612,
"train_tokens_per_second": 6892.421
},
{
"epoch": 0.7888138862102217,
"grad_norm": 0.23856617510318756,
"learning_rate": 4.2553191489361704e-05,
"loss": 0.8789,
"num_input_tokens_seen": 59146000,
"step": 1227,
"train_runtime": 8581.1157,
"train_tokens_per_second": 6892.577
},
{
"epoch": 0.7894567663130826,
"grad_norm": 0.22620564699172974,
"learning_rate": 4.242424242424243e-05,
"loss": 0.9081,
"num_input_tokens_seen": 59180640,
"step": 1228,
"train_runtime": 8586.0547,
"train_tokens_per_second": 6892.647
},
{
"epoch": 0.7900996464159434,
"grad_norm": 0.2247392237186432,
"learning_rate": 4.229529335912315e-05,
"loss": 0.9257,
"num_input_tokens_seen": 59242176,
"step": 1229,
"train_runtime": 8594.7528,
"train_tokens_per_second": 6892.831
},
{
"epoch": 0.7907425265188043,
"grad_norm": 0.2251686453819275,
"learning_rate": 4.2166344294003866e-05,
"loss": 0.9371,
"num_input_tokens_seen": 59288336,
"step": 1230,
"train_runtime": 8601.2625,
"train_tokens_per_second": 6892.981
},
{
"epoch": 0.791385406621665,
"grad_norm": 0.21998196840286255,
"learning_rate": 4.203739522888459e-05,
"loss": 0.8956,
"num_input_tokens_seen": 59337408,
"step": 1231,
"train_runtime": 8608.7066,
"train_tokens_per_second": 6892.72
},
{
"epoch": 0.7920282867245259,
"grad_norm": 0.21279209852218628,
"learning_rate": 4.1908446163765315e-05,
"loss": 0.862,
"num_input_tokens_seen": 59381904,
"step": 1232,
"train_runtime": 8614.9445,
"train_tokens_per_second": 6892.895
},
{
"epoch": 0.7926711668273867,
"grad_norm": 0.2197798490524292,
"learning_rate": 4.1779497098646034e-05,
"loss": 0.9011,
"num_input_tokens_seen": 59422240,
"step": 1233,
"train_runtime": 8620.6309,
"train_tokens_per_second": 6893.027
},
{
"epoch": 0.7933140469302475,
"grad_norm": 0.21757225692272186,
"learning_rate": 4.165054803352676e-05,
"loss": 0.97,
"num_input_tokens_seen": 59478848,
"step": 1234,
"train_runtime": 8628.5712,
"train_tokens_per_second": 6893.244
},
{
"epoch": 0.7939569270331083,
"grad_norm": 0.21754653751850128,
"learning_rate": 4.152159896840748e-05,
"loss": 0.863,
"num_input_tokens_seen": 59522960,
"step": 1235,
"train_runtime": 8634.7754,
"train_tokens_per_second": 6893.4
},
{
"epoch": 0.7945998071359691,
"grad_norm": 0.2172289490699768,
"learning_rate": 4.139264990328821e-05,
"loss": 0.9865,
"num_input_tokens_seen": 59562832,
"step": 1236,
"train_runtime": 8640.4108,
"train_tokens_per_second": 6893.518
},
{
"epoch": 0.79524268723883,
"grad_norm": 0.21205008029937744,
"learning_rate": 4.126370083816892e-05,
"loss": 0.8675,
"num_input_tokens_seen": 59600784,
"step": 1237,
"train_runtime": 8645.7572,
"train_tokens_per_second": 6893.645
},
{
"epoch": 0.7958855673416908,
"grad_norm": 0.22735366225242615,
"learning_rate": 4.1134751773049644e-05,
"loss": 0.9441,
"num_input_tokens_seen": 59636464,
"step": 1238,
"train_runtime": 8650.8144,
"train_tokens_per_second": 6893.74
},
{
"epoch": 0.7965284474445516,
"grad_norm": 0.23327912390232086,
"learning_rate": 4.100580270793037e-05,
"loss": 0.9658,
"num_input_tokens_seen": 59675792,
"step": 1239,
"train_runtime": 8656.3391,
"train_tokens_per_second": 6893.883
},
{
"epoch": 0.7971713275474124,
"grad_norm": 0.22936224937438965,
"learning_rate": 4.0876853642811094e-05,
"loss": 0.9035,
"num_input_tokens_seen": 59713312,
"step": 1240,
"train_runtime": 8661.6216,
"train_tokens_per_second": 6894.011
},
{
"epoch": 0.7978142076502732,
"grad_norm": 0.3092407286167145,
"learning_rate": 4.074790457769181e-05,
"loss": 0.9441,
"num_input_tokens_seen": 59750992,
"step": 1241,
"train_runtime": 8666.9545,
"train_tokens_per_second": 6894.116
},
{
"epoch": 0.7984570877531341,
"grad_norm": 0.2089376598596573,
"learning_rate": 4.061895551257254e-05,
"loss": 0.9926,
"num_input_tokens_seen": 59800864,
"step": 1242,
"train_runtime": 8673.9447,
"train_tokens_per_second": 6894.31
},
{
"epoch": 0.7990999678559949,
"grad_norm": 0.22079479694366455,
"learning_rate": 4.049000644745326e-05,
"loss": 0.8473,
"num_input_tokens_seen": 59834160,
"step": 1243,
"train_runtime": 8678.6795,
"train_tokens_per_second": 6894.385
},
{
"epoch": 0.7997428479588556,
"grad_norm": 0.21040008962154388,
"learning_rate": 4.036105738233398e-05,
"loss": 0.915,
"num_input_tokens_seen": 59872256,
"step": 1244,
"train_runtime": 8684.0907,
"train_tokens_per_second": 6894.476
},
{
"epoch": 0.8003857280617165,
"grad_norm": 0.2410404533147812,
"learning_rate": 4.02321083172147e-05,
"loss": 1.0353,
"num_input_tokens_seen": 59923728,
"step": 1245,
"train_runtime": 8691.3682,
"train_tokens_per_second": 6894.625
},
{
"epoch": 0.8010286081645773,
"grad_norm": 0.23142696917057037,
"learning_rate": 4.010315925209542e-05,
"loss": 0.8739,
"num_input_tokens_seen": 59959872,
"step": 1246,
"train_runtime": 8696.5196,
"train_tokens_per_second": 6894.698
},
{
"epoch": 0.8016714882674382,
"grad_norm": 0.2280237376689911,
"learning_rate": 3.997421018697615e-05,
"loss": 1.0204,
"num_input_tokens_seen": 60011952,
"step": 1247,
"train_runtime": 8703.7998,
"train_tokens_per_second": 6894.914
},
{
"epoch": 0.8023143683702989,
"grad_norm": 0.21406146883964539,
"learning_rate": 3.9845261121856866e-05,
"loss": 0.9072,
"num_input_tokens_seen": 60061136,
"step": 1248,
"train_runtime": 8710.6904,
"train_tokens_per_second": 6895.106
},
{
"epoch": 0.8023143683702989,
"eval_loss": 0.9978415369987488,
"eval_runtime": 40.0681,
"eval_samples_per_second": 24.808,
"eval_steps_per_second": 1.572,
"num_input_tokens_seen": 60061136,
"step": 1248
},
{
"epoch": 0.8029572484731597,
"grad_norm": 0.24779734015464783,
"learning_rate": 3.971631205673759e-05,
"loss": 0.9878,
"num_input_tokens_seen": 60104144,
"step": 1249,
"train_runtime": 8756.8321,
"train_tokens_per_second": 6863.686
},
{
"epoch": 0.8036001285760206,
"grad_norm": 0.2491709291934967,
"learning_rate": 3.9587362991618316e-05,
"loss": 0.9887,
"num_input_tokens_seen": 60145840,
"step": 1250,
"train_runtime": 8762.7546,
"train_tokens_per_second": 6863.805
},
{
"epoch": 0.8042430086788814,
"grad_norm": 0.2274121791124344,
"learning_rate": 3.9458413926499034e-05,
"loss": 0.8389,
"num_input_tokens_seen": 60193536,
"step": 1251,
"train_runtime": 8769.4626,
"train_tokens_per_second": 6863.994
},
{
"epoch": 0.8048858887817422,
"grad_norm": 0.21966342628002167,
"learning_rate": 3.932946486137975e-05,
"loss": 0.8693,
"num_input_tokens_seen": 60243184,
"step": 1252,
"train_runtime": 8776.4333,
"train_tokens_per_second": 6864.199
},
{
"epoch": 0.805528768884603,
"grad_norm": 0.23420031368732452,
"learning_rate": 3.920051579626048e-05,
"loss": 0.9123,
"num_input_tokens_seen": 60272752,
"step": 1253,
"train_runtime": 8780.6698,
"train_tokens_per_second": 6864.254
},
{
"epoch": 0.8061716489874639,
"grad_norm": 0.22144600749015808,
"learning_rate": 3.90715667311412e-05,
"loss": 0.9243,
"num_input_tokens_seen": 60316464,
"step": 1254,
"train_runtime": 8786.8427,
"train_tokens_per_second": 6864.407
},
{
"epoch": 0.8068145290903247,
"grad_norm": 0.22973129153251648,
"learning_rate": 3.894261766602193e-05,
"loss": 0.8757,
"num_input_tokens_seen": 60370112,
"step": 1255,
"train_runtime": 8794.3484,
"train_tokens_per_second": 6864.649
},
{
"epoch": 0.8074574091931854,
"grad_norm": 0.21880486607551575,
"learning_rate": 3.8813668600902645e-05,
"loss": 0.9781,
"num_input_tokens_seen": 60426192,
"step": 1256,
"train_runtime": 8802.1636,
"train_tokens_per_second": 6864.925
},
{
"epoch": 0.8081002892960463,
"grad_norm": 0.23579160869121552,
"learning_rate": 3.868471953578336e-05,
"loss": 0.9731,
"num_input_tokens_seen": 60469616,
"step": 1257,
"train_runtime": 8808.3158,
"train_tokens_per_second": 6865.06
},
{
"epoch": 0.8087431693989071,
"grad_norm": 0.23246201872825623,
"learning_rate": 3.855577047066409e-05,
"loss": 0.9306,
"num_input_tokens_seen": 60512592,
"step": 1258,
"train_runtime": 8814.3148,
"train_tokens_per_second": 6865.263
},
{
"epoch": 0.809386049501768,
"grad_norm": 0.2275032103061676,
"learning_rate": 3.842682140554481e-05,
"loss": 0.9319,
"num_input_tokens_seen": 60574896,
"step": 1259,
"train_runtime": 8823.0076,
"train_tokens_per_second": 6865.561
},
{
"epoch": 0.8100289296046287,
"grad_norm": 0.22882547974586487,
"learning_rate": 3.829787234042553e-05,
"loss": 1.0166,
"num_input_tokens_seen": 60622112,
"step": 1260,
"train_runtime": 8829.6587,
"train_tokens_per_second": 6865.737
},
{
"epoch": 0.8106718097074895,
"grad_norm": 0.24896188080310822,
"learning_rate": 3.8168923275306256e-05,
"loss": 1.0336,
"num_input_tokens_seen": 60673776,
"step": 1261,
"train_runtime": 8837.388,
"train_tokens_per_second": 6865.578
},
{
"epoch": 0.8113146898103504,
"grad_norm": 0.24217981100082397,
"learning_rate": 3.803997421018698e-05,
"loss": 1.0291,
"num_input_tokens_seen": 60719712,
"step": 1262,
"train_runtime": 8843.8394,
"train_tokens_per_second": 6865.764
},
{
"epoch": 0.8119575699132112,
"grad_norm": 0.24342891573905945,
"learning_rate": 3.79110251450677e-05,
"loss": 0.8978,
"num_input_tokens_seen": 60759008,
"step": 1263,
"train_runtime": 8849.3883,
"train_tokens_per_second": 6865.899
},
{
"epoch": 0.812600450016072,
"grad_norm": 0.21937716007232666,
"learning_rate": 3.778207607994842e-05,
"loss": 0.9114,
"num_input_tokens_seen": 60793760,
"step": 1264,
"train_runtime": 8854.3231,
"train_tokens_per_second": 6865.997
},
{
"epoch": 0.8132433301189328,
"grad_norm": 0.22124840319156647,
"learning_rate": 3.765312701482914e-05,
"loss": 0.8901,
"num_input_tokens_seen": 60842800,
"step": 1265,
"train_runtime": 8861.218,
"train_tokens_per_second": 6866.189
},
{
"epoch": 0.8138862102217936,
"grad_norm": 0.24157920479774475,
"learning_rate": 3.752417794970987e-05,
"loss": 1.0071,
"num_input_tokens_seen": 60885248,
"step": 1266,
"train_runtime": 8867.1823,
"train_tokens_per_second": 6866.358
},
{
"epoch": 0.8145290903246545,
"grad_norm": 0.21528279781341553,
"learning_rate": 3.7395228884590585e-05,
"loss": 0.925,
"num_input_tokens_seen": 60937568,
"step": 1267,
"train_runtime": 8874.5446,
"train_tokens_per_second": 6866.557
},
{
"epoch": 0.8151719704275152,
"grad_norm": 0.28632667660713196,
"learning_rate": 3.726627981947131e-05,
"loss": 0.9065,
"num_input_tokens_seen": 60974000,
"step": 1268,
"train_runtime": 8879.6749,
"train_tokens_per_second": 6866.693
},
{
"epoch": 0.8158148505303761,
"grad_norm": 0.21082501113414764,
"learning_rate": 3.7137330754352035e-05,
"loss": 0.8591,
"num_input_tokens_seen": 61010336,
"step": 1269,
"train_runtime": 8884.8106,
"train_tokens_per_second": 6866.813
},
{
"epoch": 0.8164577306332369,
"grad_norm": 0.2408752143383026,
"learning_rate": 3.700838168923276e-05,
"loss": 0.9138,
"num_input_tokens_seen": 61060768,
"step": 1270,
"train_runtime": 8891.9102,
"train_tokens_per_second": 6867.002
},
{
"epoch": 0.8171006107360977,
"grad_norm": 0.2305835634469986,
"learning_rate": 3.687943262411347e-05,
"loss": 0.8796,
"num_input_tokens_seen": 61095104,
"step": 1271,
"train_runtime": 8896.7968,
"train_tokens_per_second": 6867.09
},
{
"epoch": 0.8177434908389586,
"grad_norm": 0.2463512271642685,
"learning_rate": 3.6750483558994196e-05,
"loss": 0.9345,
"num_input_tokens_seen": 61136608,
"step": 1272,
"train_runtime": 8902.6282,
"train_tokens_per_second": 6867.254
},
{
"epoch": 0.8183863709418193,
"grad_norm": 0.22142194211483002,
"learning_rate": 3.662153449387492e-05,
"loss": 0.9516,
"num_input_tokens_seen": 61183712,
"step": 1273,
"train_runtime": 8909.2587,
"train_tokens_per_second": 6867.43
},
{
"epoch": 0.8190292510446802,
"grad_norm": 0.22028407454490662,
"learning_rate": 3.6492585428755646e-05,
"loss": 0.9311,
"num_input_tokens_seen": 61260576,
"step": 1274,
"train_runtime": 8920.0131,
"train_tokens_per_second": 6867.768
},
{
"epoch": 0.819672131147541,
"grad_norm": 0.21425789594650269,
"learning_rate": 3.6363636363636364e-05,
"loss": 1.0058,
"num_input_tokens_seen": 61301920,
"step": 1275,
"train_runtime": 8925.9034,
"train_tokens_per_second": 6867.867
},
{
"epoch": 0.8203150112504018,
"grad_norm": 0.24809955060482025,
"learning_rate": 3.623468729851709e-05,
"loss": 1.0607,
"num_input_tokens_seen": 61362656,
"step": 1276,
"train_runtime": 8934.4359,
"train_tokens_per_second": 6868.106
},
{
"epoch": 0.8209578913532626,
"grad_norm": 0.20570631325244904,
"learning_rate": 3.6105738233397814e-05,
"loss": 0.903,
"num_input_tokens_seen": 61408960,
"step": 1277,
"train_runtime": 8940.9874,
"train_tokens_per_second": 6868.253
},
{
"epoch": 0.8216007714561234,
"grad_norm": 0.234993577003479,
"learning_rate": 3.597678916827853e-05,
"loss": 1.0065,
"num_input_tokens_seen": 61457568,
"step": 1278,
"train_runtime": 8947.87,
"train_tokens_per_second": 6868.402
},
{
"epoch": 0.8222436515589843,
"grad_norm": 0.21434393525123596,
"learning_rate": 3.584784010315925e-05,
"loss": 0.9359,
"num_input_tokens_seen": 61494944,
"step": 1279,
"train_runtime": 8953.174,
"train_tokens_per_second": 6868.508
},
{
"epoch": 0.8228865316618451,
"grad_norm": 0.23359251022338867,
"learning_rate": 3.5718891038039975e-05,
"loss": 0.9728,
"num_input_tokens_seen": 61549936,
"step": 1280,
"train_runtime": 8960.8875,
"train_tokens_per_second": 6868.732
},
{
"epoch": 0.8235294117647058,
"grad_norm": 0.23295457661151886,
"learning_rate": 3.55899419729207e-05,
"loss": 0.9831,
"num_input_tokens_seen": 61597104,
"step": 1281,
"train_runtime": 8967.5677,
"train_tokens_per_second": 6868.875
},
{
"epoch": 0.8241722918675667,
"grad_norm": 0.23427145183086395,
"learning_rate": 3.546099290780142e-05,
"loss": 0.9904,
"num_input_tokens_seen": 61649024,
"step": 1282,
"train_runtime": 8974.8213,
"train_tokens_per_second": 6869.109
},
{
"epoch": 0.8248151719704275,
"grad_norm": 0.25249189138412476,
"learning_rate": 3.533204384268214e-05,
"loss": 1.3934,
"num_input_tokens_seen": 61705136,
"step": 1283,
"train_runtime": 8982.6911,
"train_tokens_per_second": 6869.337
},
{
"epoch": 0.8254580520732884,
"grad_norm": 0.22632817924022675,
"learning_rate": 3.520309477756286e-05,
"loss": 0.9095,
"num_input_tokens_seen": 61776336,
"step": 1284,
"train_runtime": 8992.6871,
"train_tokens_per_second": 6869.619
},
{
"epoch": 0.8261009321761491,
"grad_norm": 0.22133934497833252,
"learning_rate": 3.5074145712443586e-05,
"loss": 0.9181,
"num_input_tokens_seen": 61814624,
"step": 1285,
"train_runtime": 8998.1163,
"train_tokens_per_second": 6869.729
},
{
"epoch": 0.82674381227901,
"grad_norm": 0.21737878024578094,
"learning_rate": 3.4945196647324304e-05,
"loss": 0.992,
"num_input_tokens_seen": 61885232,
"step": 1286,
"train_runtime": 9007.9965,
"train_tokens_per_second": 6870.033
},
{
"epoch": 0.8273866923818708,
"grad_norm": 0.24849003553390503,
"learning_rate": 3.481624758220503e-05,
"loss": 1.1027,
"num_input_tokens_seen": 61920896,
"step": 1287,
"train_runtime": 9013.0615,
"train_tokens_per_second": 6870.129
},
{
"epoch": 0.8280295724847316,
"grad_norm": 0.21847772598266602,
"learning_rate": 3.4687298517085754e-05,
"loss": 0.9722,
"num_input_tokens_seen": 61973696,
"step": 1288,
"train_runtime": 9020.5141,
"train_tokens_per_second": 6870.306
},
{
"epoch": 0.8286724525875924,
"grad_norm": 0.22305962443351746,
"learning_rate": 3.455834945196648e-05,
"loss": 1.0413,
"num_input_tokens_seen": 62009824,
"step": 1289,
"train_runtime": 9025.6725,
"train_tokens_per_second": 6870.383
},
{
"epoch": 0.8293153326904532,
"grad_norm": 0.21231709420681,
"learning_rate": 3.44294003868472e-05,
"loss": 0.8639,
"num_input_tokens_seen": 62091072,
"step": 1290,
"train_runtime": 9037.0685,
"train_tokens_per_second": 6870.709
},
{
"epoch": 0.829958212793314,
"grad_norm": 0.21660618484020233,
"learning_rate": 3.4300451321727915e-05,
"loss": 0.914,
"num_input_tokens_seen": 62127408,
"step": 1291,
"train_runtime": 9042.7565,
"train_tokens_per_second": 6870.406
},
{
"epoch": 0.8306010928961749,
"grad_norm": 0.2337297797203064,
"learning_rate": 3.417150225660864e-05,
"loss": 0.9785,
"num_input_tokens_seen": 62184736,
"step": 1292,
"train_runtime": 9050.7518,
"train_tokens_per_second": 6870.671
},
{
"epoch": 0.8312439729990356,
"grad_norm": 0.23421838879585266,
"learning_rate": 3.4042553191489365e-05,
"loss": 1.07,
"num_input_tokens_seen": 62217472,
"step": 1293,
"train_runtime": 9055.4066,
"train_tokens_per_second": 6870.754
},
{
"epoch": 0.8318868531018965,
"grad_norm": 0.23266111314296722,
"learning_rate": 3.391360412637008e-05,
"loss": 0.9908,
"num_input_tokens_seen": 62260736,
"step": 1294,
"train_runtime": 9061.4565,
"train_tokens_per_second": 6870.941
},
{
"epoch": 0.8325297332047573,
"grad_norm": 0.2197062373161316,
"learning_rate": 3.378465506125081e-05,
"loss": 0.9503,
"num_input_tokens_seen": 62299360,
"step": 1295,
"train_runtime": 9066.9208,
"train_tokens_per_second": 6871.06
},
{
"epoch": 0.8331726133076182,
"grad_norm": 0.21622958779335022,
"learning_rate": 3.365570599613153e-05,
"loss": 0.9882,
"num_input_tokens_seen": 62338960,
"step": 1296,
"train_runtime": 9072.4918,
"train_tokens_per_second": 6871.206
},
{
"epoch": 0.8338154934104789,
"grad_norm": 0.21843262016773224,
"learning_rate": 3.352675693101225e-05,
"loss": 0.9831,
"num_input_tokens_seen": 62378832,
"step": 1297,
"train_runtime": 9078.1235,
"train_tokens_per_second": 6871.335
},
{
"epoch": 0.8344583735133397,
"grad_norm": 0.22889907658100128,
"learning_rate": 3.339780786589297e-05,
"loss": 0.8782,
"num_input_tokens_seen": 62420640,
"step": 1298,
"train_runtime": 9083.9834,
"train_tokens_per_second": 6871.505
},
{
"epoch": 0.8351012536162006,
"grad_norm": 0.23234236240386963,
"learning_rate": 3.3268858800773694e-05,
"loss": 0.8964,
"num_input_tokens_seen": 62468304,
"step": 1299,
"train_runtime": 9090.7185,
"train_tokens_per_second": 6871.658
},
{
"epoch": 0.8357441337190614,
"grad_norm": 0.210599884390831,
"learning_rate": 3.313990973565442e-05,
"loss": 0.9152,
"num_input_tokens_seen": 62512080,
"step": 1300,
"train_runtime": 9096.8766,
"train_tokens_per_second": 6871.818
},
{
"epoch": 0.8363870138219223,
"grad_norm": 0.2227179855108261,
"learning_rate": 3.3010960670535144e-05,
"loss": 0.9977,
"num_input_tokens_seen": 62551312,
"step": 1301,
"train_runtime": 9102.3838,
"train_tokens_per_second": 6871.97
},
{
"epoch": 0.837029893924783,
"grad_norm": 0.2382332682609558,
"learning_rate": 3.288201160541586e-05,
"loss": 0.937,
"num_input_tokens_seen": 62600304,
"step": 1302,
"train_runtime": 9109.25,
"train_tokens_per_second": 6872.169
},
{
"epoch": 0.8376727740276438,
"grad_norm": 0.20747257769107819,
"learning_rate": 3.275306254029659e-05,
"loss": 1.0066,
"num_input_tokens_seen": 62653216,
"step": 1303,
"train_runtime": 9116.6433,
"train_tokens_per_second": 6872.4
},
{
"epoch": 0.8383156541305047,
"grad_norm": 0.20847642421722412,
"learning_rate": 3.262411347517731e-05,
"loss": 0.9644,
"num_input_tokens_seen": 62696416,
"step": 1304,
"train_runtime": 9122.7469,
"train_tokens_per_second": 6872.537
},
{
"epoch": 0.8389585342333655,
"grad_norm": 0.22569946944713593,
"learning_rate": 3.249516441005803e-05,
"loss": 0.9966,
"num_input_tokens_seen": 62734384,
"step": 1305,
"train_runtime": 9128.136,
"train_tokens_per_second": 6872.639
},
{
"epoch": 0.8396014143362263,
"grad_norm": 0.21350441873073578,
"learning_rate": 3.236621534493875e-05,
"loss": 0.8312,
"num_input_tokens_seen": 62784304,
"step": 1306,
"train_runtime": 9135.2632,
"train_tokens_per_second": 6872.742
},
{
"epoch": 0.8402442944390871,
"grad_norm": 0.2505035698413849,
"learning_rate": 3.223726627981947e-05,
"loss": 0.7903,
"num_input_tokens_seen": 62827200,
"step": 1307,
"train_runtime": 9141.2689,
"train_tokens_per_second": 6872.919
},
{
"epoch": 0.840887174541948,
"grad_norm": 0.22541561722755432,
"learning_rate": 3.21083172147002e-05,
"loss": 0.958,
"num_input_tokens_seen": 62877392,
"step": 1308,
"train_runtime": 9148.37,
"train_tokens_per_second": 6873.07
},
{
"epoch": 0.8415300546448088,
"grad_norm": 0.2288602888584137,
"learning_rate": 3.1979368149580916e-05,
"loss": 0.939,
"num_input_tokens_seen": 62934912,
"step": 1309,
"train_runtime": 9156.462,
"train_tokens_per_second": 6873.278
},
{
"epoch": 0.8421729347476695,
"grad_norm": 0.21767346560955048,
"learning_rate": 3.185041908446164e-05,
"loss": 0.8732,
"num_input_tokens_seen": 62972032,
"step": 1310,
"train_runtime": 9161.7436,
"train_tokens_per_second": 6873.368
},
{
"epoch": 0.8428158148505304,
"grad_norm": 0.23855219781398773,
"learning_rate": 3.172147001934236e-05,
"loss": 0.9919,
"num_input_tokens_seen": 63013904,
"step": 1311,
"train_runtime": 9167.6385,
"train_tokens_per_second": 6873.515
},
{
"epoch": 0.8434586949533912,
"grad_norm": 0.22057105600833893,
"learning_rate": 3.1592520954223084e-05,
"loss": 0.8627,
"num_input_tokens_seen": 63077488,
"step": 1312,
"train_runtime": 9176.5594,
"train_tokens_per_second": 6873.762
},
{
"epoch": 0.844101575056252,
"grad_norm": 0.2043379843235016,
"learning_rate": 3.14635718891038e-05,
"loss": 0.8982,
"num_input_tokens_seen": 63126688,
"step": 1313,
"train_runtime": 9183.4801,
"train_tokens_per_second": 6873.94
},
{
"epoch": 0.8447444551591128,
"grad_norm": 0.20252691209316254,
"learning_rate": 3.133462282398453e-05,
"loss": 0.8743,
"num_input_tokens_seen": 63165360,
"step": 1314,
"train_runtime": 9188.9999,
"train_tokens_per_second": 6874.019
},
{
"epoch": 0.8453873352619736,
"grad_norm": 0.24319347739219666,
"learning_rate": 3.120567375886525e-05,
"loss": 1.0114,
"num_input_tokens_seen": 63205120,
"step": 1315,
"train_runtime": 9194.6333,
"train_tokens_per_second": 6874.132
},
{
"epoch": 0.8460302153648345,
"grad_norm": 0.24205361306667328,
"learning_rate": 3.107672469374598e-05,
"loss": 0.9002,
"num_input_tokens_seen": 63253072,
"step": 1316,
"train_runtime": 9201.357,
"train_tokens_per_second": 6874.32
},
{
"epoch": 0.8466730954676953,
"grad_norm": 0.22536036372184753,
"learning_rate": 3.0947775628626695e-05,
"loss": 0.9127,
"num_input_tokens_seen": 63294464,
"step": 1317,
"train_runtime": 9207.1647,
"train_tokens_per_second": 6874.479
},
{
"epoch": 0.847315975570556,
"grad_norm": 0.2225712686777115,
"learning_rate": 3.081882656350741e-05,
"loss": 1.092,
"num_input_tokens_seen": 63341584,
"step": 1318,
"train_runtime": 9213.7477,
"train_tokens_per_second": 6874.682
},
{
"epoch": 0.8479588556734169,
"grad_norm": 0.2246129810810089,
"learning_rate": 3.068987749838814e-05,
"loss": 0.9754,
"num_input_tokens_seen": 63383728,
"step": 1319,
"train_runtime": 9219.7143,
"train_tokens_per_second": 6874.804
},
{
"epoch": 0.8486017357762777,
"grad_norm": 0.22739674150943756,
"learning_rate": 3.056092843326886e-05,
"loss": 0.8704,
"num_input_tokens_seen": 63431200,
"step": 1320,
"train_runtime": 9226.3672,
"train_tokens_per_second": 6874.992
},
{
"epoch": 0.8492446158791386,
"grad_norm": 0.23638106882572174,
"learning_rate": 3.043197936814958e-05,
"loss": 0.9812,
"num_input_tokens_seen": 63468624,
"step": 1321,
"train_runtime": 9232.2044,
"train_tokens_per_second": 6874.699
},
{
"epoch": 0.8498874959819993,
"grad_norm": 0.2244069129228592,
"learning_rate": 3.0303030303030306e-05,
"loss": 0.9947,
"num_input_tokens_seen": 63519392,
"step": 1322,
"train_runtime": 9239.3341,
"train_tokens_per_second": 6874.889
},
{
"epoch": 0.8505303760848602,
"grad_norm": 0.21489335596561432,
"learning_rate": 3.0174081237911027e-05,
"loss": 0.8827,
"num_input_tokens_seen": 63558224,
"step": 1323,
"train_runtime": 9244.8389,
"train_tokens_per_second": 6874.995
},
{
"epoch": 0.851173256187721,
"grad_norm": 0.2280271053314209,
"learning_rate": 3.0045132172791752e-05,
"loss": 0.9427,
"num_input_tokens_seen": 63611792,
"step": 1324,
"train_runtime": 9252.3795,
"train_tokens_per_second": 6875.182
},
{
"epoch": 0.8518161362905818,
"grad_norm": 0.2121179848909378,
"learning_rate": 2.991618310767247e-05,
"loss": 0.9785,
"num_input_tokens_seen": 63668368,
"step": 1325,
"train_runtime": 9260.2535,
"train_tokens_per_second": 6875.445
},
{
"epoch": 0.8524590163934426,
"grad_norm": 0.2208545058965683,
"learning_rate": 2.9787234042553192e-05,
"loss": 0.8791,
"num_input_tokens_seen": 63708352,
"step": 1326,
"train_runtime": 9265.9015,
"train_tokens_per_second": 6875.57
},
{
"epoch": 0.8531018964963034,
"grad_norm": 0.2271835207939148,
"learning_rate": 2.9658284977433913e-05,
"loss": 0.9281,
"num_input_tokens_seen": 63749152,
"step": 1327,
"train_runtime": 9271.6298,
"train_tokens_per_second": 6875.722
},
{
"epoch": 0.8537447765991643,
"grad_norm": 0.2530703842639923,
"learning_rate": 2.9529335912314638e-05,
"loss": 1.0096,
"num_input_tokens_seen": 63798240,
"step": 1328,
"train_runtime": 9278.5301,
"train_tokens_per_second": 6875.899
},
{
"epoch": 0.8543876567020251,
"grad_norm": 0.2180684357881546,
"learning_rate": 2.940038684719536e-05,
"loss": 0.8982,
"num_input_tokens_seen": 63854480,
"step": 1329,
"train_runtime": 9286.4279,
"train_tokens_per_second": 6876.108
},
{
"epoch": 0.8550305368048859,
"grad_norm": 0.2329641580581665,
"learning_rate": 2.9271437782076085e-05,
"loss": 1.056,
"num_input_tokens_seen": 63919616,
"step": 1330,
"train_runtime": 9295.4858,
"train_tokens_per_second": 6876.415
},
{
"epoch": 0.8556734169077467,
"grad_norm": 0.24323369562625885,
"learning_rate": 2.9142488716956806e-05,
"loss": 0.9347,
"num_input_tokens_seen": 63953392,
"step": 1331,
"train_runtime": 9300.3106,
"train_tokens_per_second": 6876.479
},
{
"epoch": 0.8563162970106075,
"grad_norm": 0.23381201922893524,
"learning_rate": 2.9013539651837524e-05,
"loss": 1.0158,
"num_input_tokens_seen": 64022416,
"step": 1332,
"train_runtime": 9309.9939,
"train_tokens_per_second": 6876.741
},
{
"epoch": 0.8569591771134684,
"grad_norm": 0.20569060742855072,
"learning_rate": 2.8884590586718246e-05,
"loss": 0.9542,
"num_input_tokens_seen": 64084016,
"step": 1333,
"train_runtime": 9318.5868,
"train_tokens_per_second": 6877.01
},
{
"epoch": 0.8576020572163292,
"grad_norm": 0.2487626075744629,
"learning_rate": 2.875564152159897e-05,
"loss": 0.8908,
"num_input_tokens_seen": 64142288,
"step": 1334,
"train_runtime": 9326.7236,
"train_tokens_per_second": 6877.258
},
{
"epoch": 0.8582449373191899,
"grad_norm": 0.21883252263069153,
"learning_rate": 2.8626692456479692e-05,
"loss": 1.0138,
"num_input_tokens_seen": 64191808,
"step": 1335,
"train_runtime": 9333.6551,
"train_tokens_per_second": 6877.457
},
{
"epoch": 0.8588878174220508,
"grad_norm": 0.22027264535427094,
"learning_rate": 2.8497743391360414e-05,
"loss": 0.7875,
"num_input_tokens_seen": 64250336,
"step": 1336,
"train_runtime": 9341.8962,
"train_tokens_per_second": 6877.655
},
{
"epoch": 0.8595306975249116,
"grad_norm": 0.21138998866081238,
"learning_rate": 2.836879432624114e-05,
"loss": 0.9741,
"num_input_tokens_seen": 64310224,
"step": 1337,
"train_runtime": 9350.3003,
"train_tokens_per_second": 6877.878
},
{
"epoch": 0.8601735776277725,
"grad_norm": 0.22284504771232605,
"learning_rate": 2.8239845261121857e-05,
"loss": 1.0089,
"num_input_tokens_seen": 64343168,
"step": 1338,
"train_runtime": 9354.9833,
"train_tokens_per_second": 6877.956
},
{
"epoch": 0.8608164577306332,
"grad_norm": 0.21529455482959747,
"learning_rate": 2.8110896196002578e-05,
"loss": 0.966,
"num_input_tokens_seen": 64389136,
"step": 1339,
"train_runtime": 9361.4442,
"train_tokens_per_second": 6878.12
},
{
"epoch": 0.861459337833494,
"grad_norm": 0.2132706642150879,
"learning_rate": 2.7981947130883303e-05,
"loss": 0.8745,
"num_input_tokens_seen": 64432304,
"step": 1340,
"train_runtime": 9367.5306,
"train_tokens_per_second": 6878.259
},
{
"epoch": 0.8621022179363549,
"grad_norm": 0.23623524606227875,
"learning_rate": 2.7852998065764025e-05,
"loss": 0.9538,
"num_input_tokens_seen": 64474288,
"step": 1341,
"train_runtime": 9373.4733,
"train_tokens_per_second": 6878.378
},
{
"epoch": 0.8627450980392157,
"grad_norm": 0.22249281406402588,
"learning_rate": 2.7724049000644746e-05,
"loss": 0.8987,
"num_input_tokens_seen": 64514576,
"step": 1342,
"train_runtime": 9379.1133,
"train_tokens_per_second": 6878.537
},
{
"epoch": 0.8633879781420765,
"grad_norm": 0.23305073380470276,
"learning_rate": 2.759509993552547e-05,
"loss": 0.8426,
"num_input_tokens_seen": 64556816,
"step": 1343,
"train_runtime": 9385.0941,
"train_tokens_per_second": 6878.654
},
{
"epoch": 0.8640308582449373,
"grad_norm": 0.2223258912563324,
"learning_rate": 2.7466150870406193e-05,
"loss": 1.0508,
"num_input_tokens_seen": 64602640,
"step": 1344,
"train_runtime": 9391.5157,
"train_tokens_per_second": 6878.83
},
{
"epoch": 0.8646737383477981,
"grad_norm": 0.2066197246313095,
"learning_rate": 2.733720180528691e-05,
"loss": 0.914,
"num_input_tokens_seen": 64662432,
"step": 1345,
"train_runtime": 9399.9503,
"train_tokens_per_second": 6879.019
},
{
"epoch": 0.865316618450659,
"grad_norm": 0.23025156557559967,
"learning_rate": 2.7208252740167632e-05,
"loss": 1.0049,
"num_input_tokens_seen": 64716896,
"step": 1346,
"train_runtime": 9407.5761,
"train_tokens_per_second": 6879.232
},
{
"epoch": 0.8659594985535197,
"grad_norm": 0.20561859011650085,
"learning_rate": 2.7079303675048357e-05,
"loss": 0.8103,
"num_input_tokens_seen": 64759664,
"step": 1347,
"train_runtime": 9413.5949,
"train_tokens_per_second": 6879.377
},
{
"epoch": 0.8666023786563806,
"grad_norm": 0.24761579930782318,
"learning_rate": 2.695035460992908e-05,
"loss": 1.0608,
"num_input_tokens_seen": 64801808,
"step": 1348,
"train_runtime": 9419.5286,
"train_tokens_per_second": 6879.517
},
{
"epoch": 0.8672452587592414,
"grad_norm": 0.23833587765693665,
"learning_rate": 2.6821405544809803e-05,
"loss": 1.0325,
"num_input_tokens_seen": 64856656,
"step": 1349,
"train_runtime": 9427.206,
"train_tokens_per_second": 6879.733
},
{
"epoch": 0.8678881388621023,
"grad_norm": 0.24994045495986938,
"learning_rate": 2.6692456479690525e-05,
"loss": 1.0294,
"num_input_tokens_seen": 64891456,
"step": 1350,
"train_runtime": 9432.1515,
"train_tokens_per_second": 6879.815
},
{
"epoch": 0.868531018964963,
"grad_norm": 0.2241462916135788,
"learning_rate": 2.6563507414571247e-05,
"loss": 1.2096,
"num_input_tokens_seen": 64944320,
"step": 1351,
"train_runtime": 9440.0687,
"train_tokens_per_second": 6879.645
},
{
"epoch": 0.8691738990678238,
"grad_norm": 0.21827709674835205,
"learning_rate": 2.6434558349451965e-05,
"loss": 0.9132,
"num_input_tokens_seen": 65016704,
"step": 1352,
"train_runtime": 9450.2725,
"train_tokens_per_second": 6879.876
},
{
"epoch": 0.8698167791706847,
"grad_norm": 0.2271472066640854,
"learning_rate": 2.630560928433269e-05,
"loss": 0.9197,
"num_input_tokens_seen": 65057376,
"step": 1353,
"train_runtime": 9455.9918,
"train_tokens_per_second": 6880.016
},
{
"epoch": 0.8704596592735455,
"grad_norm": 0.22219029068946838,
"learning_rate": 2.617666021921341e-05,
"loss": 0.9124,
"num_input_tokens_seen": 65093680,
"step": 1354,
"train_runtime": 9461.1493,
"train_tokens_per_second": 6880.103
},
{
"epoch": 0.8711025393764062,
"grad_norm": 0.24440434575080872,
"learning_rate": 2.6047711154094136e-05,
"loss": 1.0075,
"num_input_tokens_seen": 65138896,
"step": 1355,
"train_runtime": 9467.5476,
"train_tokens_per_second": 6880.229
},
{
"epoch": 0.8717454194792671,
"grad_norm": 0.21005411446094513,
"learning_rate": 2.5918762088974857e-05,
"loss": 0.9593,
"num_input_tokens_seen": 65177488,
"step": 1356,
"train_runtime": 9472.9808,
"train_tokens_per_second": 6880.357
},
{
"epoch": 0.8723882995821279,
"grad_norm": 0.2265816330909729,
"learning_rate": 2.578981302385558e-05,
"loss": 0.8899,
"num_input_tokens_seen": 65212144,
"step": 1357,
"train_runtime": 9477.8714,
"train_tokens_per_second": 6880.463
},
{
"epoch": 0.8730311796849888,
"grad_norm": 0.22339262068271637,
"learning_rate": 2.5660863958736304e-05,
"loss": 0.9877,
"num_input_tokens_seen": 65256048,
"step": 1358,
"train_runtime": 9484.0266,
"train_tokens_per_second": 6880.627
},
{
"epoch": 0.8736740597878495,
"grad_norm": 0.2420601099729538,
"learning_rate": 2.5531914893617022e-05,
"loss": 0.9584,
"num_input_tokens_seen": 65311952,
"step": 1359,
"train_runtime": 9491.8732,
"train_tokens_per_second": 6880.829
},
{
"epoch": 0.8743169398907104,
"grad_norm": 0.20226748287677765,
"learning_rate": 2.5402965828497744e-05,
"loss": 0.8146,
"num_input_tokens_seen": 65372576,
"step": 1360,
"train_runtime": 9500.4272,
"train_tokens_per_second": 6881.014
},
{
"epoch": 0.8749598199935712,
"grad_norm": 0.21576273441314697,
"learning_rate": 2.5274016763378465e-05,
"loss": 0.8867,
"num_input_tokens_seen": 65412800,
"step": 1361,
"train_runtime": 9506.0663,
"train_tokens_per_second": 6881.164
},
{
"epoch": 0.875602700096432,
"grad_norm": 0.22144931554794312,
"learning_rate": 2.514506769825919e-05,
"loss": 0.9981,
"num_input_tokens_seen": 65458672,
"step": 1362,
"train_runtime": 9512.5325,
"train_tokens_per_second": 6881.309
},
{
"epoch": 0.8762455801992929,
"grad_norm": 0.2183014303445816,
"learning_rate": 2.501611863313991e-05,
"loss": 0.9481,
"num_input_tokens_seen": 65510736,
"step": 1363,
"train_runtime": 9519.8042,
"train_tokens_per_second": 6881.521
},
{
"epoch": 0.8768884603021536,
"grad_norm": 0.22006624937057495,
"learning_rate": 2.4887169568020633e-05,
"loss": 1.0402,
"num_input_tokens_seen": 65559648,
"step": 1364,
"train_runtime": 9526.6833,
"train_tokens_per_second": 6881.687
},
{
"epoch": 0.8775313404050145,
"grad_norm": 0.2272113561630249,
"learning_rate": 2.4758220502901354e-05,
"loss": 0.9189,
"num_input_tokens_seen": 65606816,
"step": 1365,
"train_runtime": 9533.3266,
"train_tokens_per_second": 6881.839
},
{
"epoch": 0.8781742205078753,
"grad_norm": 0.24562184512615204,
"learning_rate": 2.462927143778208e-05,
"loss": 0.9158,
"num_input_tokens_seen": 65670256,
"step": 1366,
"train_runtime": 9542.221,
"train_tokens_per_second": 6882.072
},
{
"epoch": 0.8788171006107361,
"grad_norm": 0.23116691410541534,
"learning_rate": 2.4500322372662797e-05,
"loss": 0.899,
"num_input_tokens_seen": 65724288,
"step": 1367,
"train_runtime": 9549.829,
"train_tokens_per_second": 6882.248
},
{
"epoch": 0.8794599807135969,
"grad_norm": 0.2198581099510193,
"learning_rate": 2.4371373307543522e-05,
"loss": 1.0382,
"num_input_tokens_seen": 65770288,
"step": 1368,
"train_runtime": 9556.201,
"train_tokens_per_second": 6882.472
},
{
"epoch": 0.8801028608164577,
"grad_norm": 0.19544394314289093,
"learning_rate": 2.4242424242424244e-05,
"loss": 0.8376,
"num_input_tokens_seen": 65807296,
"step": 1369,
"train_runtime": 9561.4451,
"train_tokens_per_second": 6882.568
},
{
"epoch": 0.8807457409193186,
"grad_norm": 0.17657072842121124,
"learning_rate": 2.4113475177304965e-05,
"loss": 1.138,
"num_input_tokens_seen": 65864880,
"step": 1370,
"train_runtime": 9569.4964,
"train_tokens_per_second": 6882.795
},
{
"epoch": 0.8813886210221794,
"grad_norm": 0.23098967969417572,
"learning_rate": 2.3984526112185687e-05,
"loss": 0.9083,
"num_input_tokens_seen": 65929424,
"step": 1371,
"train_runtime": 9578.5577,
"train_tokens_per_second": 6883.022
},
{
"epoch": 0.8820315011250401,
"grad_norm": 0.2079899162054062,
"learning_rate": 2.3855577047066412e-05,
"loss": 0.893,
"num_input_tokens_seen": 65964688,
"step": 1372,
"train_runtime": 9583.6065,
"train_tokens_per_second": 6883.076
},
{
"epoch": 0.882674381227901,
"grad_norm": 0.22222909331321716,
"learning_rate": 2.3726627981947133e-05,
"loss": 0.9877,
"num_input_tokens_seen": 66011776,
"step": 1373,
"train_runtime": 9590.2359,
"train_tokens_per_second": 6883.228
},
{
"epoch": 0.8833172613307618,
"grad_norm": 0.24297206103801727,
"learning_rate": 2.3597678916827855e-05,
"loss": 0.9199,
"num_input_tokens_seen": 66052704,
"step": 1374,
"train_runtime": 9596.0189,
"train_tokens_per_second": 6883.344
},
{
"epoch": 0.8839601414336227,
"grad_norm": 0.23367612063884735,
"learning_rate": 2.3468729851708576e-05,
"loss": 0.9687,
"num_input_tokens_seen": 66112288,
"step": 1375,
"train_runtime": 9604.3258,
"train_tokens_per_second": 6883.595
},
{
"epoch": 0.8846030215364834,
"grad_norm": 0.2388744354248047,
"learning_rate": 2.3339780786589298e-05,
"loss": 0.9275,
"num_input_tokens_seen": 66164032,
"step": 1376,
"train_runtime": 9611.5218,
"train_tokens_per_second": 6883.825
},
{
"epoch": 0.8852459016393442,
"grad_norm": 0.23560196161270142,
"learning_rate": 2.321083172147002e-05,
"loss": 1.0068,
"num_input_tokens_seen": 66213504,
"step": 1377,
"train_runtime": 9618.4361,
"train_tokens_per_second": 6884.02
},
{
"epoch": 0.8858887817422051,
"grad_norm": 0.23844046890735626,
"learning_rate": 2.308188265635074e-05,
"loss": 1.0219,
"num_input_tokens_seen": 66253168,
"step": 1378,
"train_runtime": 9624.0025,
"train_tokens_per_second": 6884.159
},
{
"epoch": 0.8865316618450659,
"grad_norm": 0.23521339893341064,
"learning_rate": 2.2952933591231466e-05,
"loss": 0.9633,
"num_input_tokens_seen": 66290672,
"step": 1379,
"train_runtime": 9629.2576,
"train_tokens_per_second": 6884.297
},
{
"epoch": 0.8871745419479267,
"grad_norm": 0.21503745019435883,
"learning_rate": 2.2823984526112184e-05,
"loss": 0.9616,
"num_input_tokens_seen": 66347552,
"step": 1380,
"train_runtime": 9637.1794,
"train_tokens_per_second": 6884.541
},
{
"epoch": 0.8878174220507875,
"grad_norm": 0.20514243841171265,
"learning_rate": 2.269503546099291e-05,
"loss": 0.8724,
"num_input_tokens_seen": 66382528,
"step": 1381,
"train_runtime": 9642.5803,
"train_tokens_per_second": 6884.312
},
{
"epoch": 0.8884603021536484,
"grad_norm": 0.22188791632652283,
"learning_rate": 2.256608639587363e-05,
"loss": 0.8934,
"num_input_tokens_seen": 66415904,
"step": 1382,
"train_runtime": 9647.2729,
"train_tokens_per_second": 6884.423
},
{
"epoch": 0.8891031822565092,
"grad_norm": 0.2151537835597992,
"learning_rate": 2.2437137330754355e-05,
"loss": 0.9754,
"num_input_tokens_seen": 66460144,
"step": 1383,
"train_runtime": 9653.4033,
"train_tokens_per_second": 6884.633
},
{
"epoch": 0.8897460623593699,
"grad_norm": 0.22987443208694458,
"learning_rate": 2.2308188265635073e-05,
"loss": 0.9966,
"num_input_tokens_seen": 66514928,
"step": 1384,
"train_runtime": 9661.0146,
"train_tokens_per_second": 6884.88
},
{
"epoch": 0.8903889424622308,
"grad_norm": 0.2253212034702301,
"learning_rate": 2.2179239200515798e-05,
"loss": 0.9591,
"num_input_tokens_seen": 66549040,
"step": 1385,
"train_runtime": 9665.8434,
"train_tokens_per_second": 6884.97
},
{
"epoch": 0.8910318225650916,
"grad_norm": 0.21320044994354248,
"learning_rate": 2.205029013539652e-05,
"loss": 0.9533,
"num_input_tokens_seen": 66583696,
"step": 1386,
"train_runtime": 9670.7834,
"train_tokens_per_second": 6885.036
},
{
"epoch": 0.8916747026679525,
"grad_norm": 0.23471881449222565,
"learning_rate": 2.192134107027724e-05,
"loss": 0.9836,
"num_input_tokens_seen": 66653536,
"step": 1387,
"train_runtime": 9680.6401,
"train_tokens_per_second": 6885.241
},
{
"epoch": 0.8923175827708132,
"grad_norm": 0.2249496728181839,
"learning_rate": 2.1792392005157963e-05,
"loss": 0.87,
"num_input_tokens_seen": 66723344,
"step": 1388,
"train_runtime": 9690.4412,
"train_tokens_per_second": 6885.48
},
{
"epoch": 0.892960462873674,
"grad_norm": 0.2176201492547989,
"learning_rate": 2.1663442940038688e-05,
"loss": 0.8927,
"num_input_tokens_seen": 66757584,
"step": 1389,
"train_runtime": 9695.3021,
"train_tokens_per_second": 6885.56
},
{
"epoch": 0.8936033429765349,
"grad_norm": 0.23144999146461487,
"learning_rate": 2.153449387491941e-05,
"loss": 0.9819,
"num_input_tokens_seen": 66797680,
"step": 1390,
"train_runtime": 9701.0265,
"train_tokens_per_second": 6885.63
},
{
"epoch": 0.8942462230793957,
"grad_norm": 0.22405368089675903,
"learning_rate": 2.140554480980013e-05,
"loss": 0.9472,
"num_input_tokens_seen": 66856720,
"step": 1391,
"train_runtime": 9709.2408,
"train_tokens_per_second": 6885.885
},
{
"epoch": 0.8948891031822566,
"grad_norm": 0.2517498731613159,
"learning_rate": 2.1276595744680852e-05,
"loss": 0.94,
"num_input_tokens_seen": 66897904,
"step": 1392,
"train_runtime": 9715.0173,
"train_tokens_per_second": 6886.03
},
{
"epoch": 0.8955319832851173,
"grad_norm": 0.22383905947208405,
"learning_rate": 2.1147646679561574e-05,
"loss": 0.9274,
"num_input_tokens_seen": 66959696,
"step": 1393,
"train_runtime": 9723.6455,
"train_tokens_per_second": 6886.275
},
{
"epoch": 0.8961748633879781,
"grad_norm": 0.21671845018863678,
"learning_rate": 2.1018697614442295e-05,
"loss": 1.0021,
"num_input_tokens_seen": 67030720,
"step": 1394,
"train_runtime": 9733.6024,
"train_tokens_per_second": 6886.527
},
{
"epoch": 0.896817743490839,
"grad_norm": 0.22518201172351837,
"learning_rate": 2.0889748549323017e-05,
"loss": 1.0131,
"num_input_tokens_seen": 67063200,
"step": 1395,
"train_runtime": 9738.2374,
"train_tokens_per_second": 6886.585
},
{
"epoch": 0.8974606235936998,
"grad_norm": 0.22435115277767181,
"learning_rate": 2.076079948420374e-05,
"loss": 0.9225,
"num_input_tokens_seen": 67100304,
"step": 1396,
"train_runtime": 9743.4768,
"train_tokens_per_second": 6886.69
},
{
"epoch": 0.8981035036965606,
"grad_norm": 0.21497158706188202,
"learning_rate": 2.063185041908446e-05,
"loss": 0.9231,
"num_input_tokens_seen": 67137808,
"step": 1397,
"train_runtime": 9748.7727,
"train_tokens_per_second": 6886.796
},
{
"epoch": 0.8987463837994214,
"grad_norm": 0.23121468722820282,
"learning_rate": 2.0502901353965185e-05,
"loss": 1.0326,
"num_input_tokens_seen": 67179600,
"step": 1398,
"train_runtime": 9754.6238,
"train_tokens_per_second": 6886.949
},
{
"epoch": 0.8993892639022822,
"grad_norm": 0.22834500670433044,
"learning_rate": 2.0373952288845906e-05,
"loss": 0.925,
"num_input_tokens_seen": 67238208,
"step": 1399,
"train_runtime": 9762.8304,
"train_tokens_per_second": 6887.163
},
{
"epoch": 0.9000321440051431,
"grad_norm": 0.21778346598148346,
"learning_rate": 2.024500322372663e-05,
"loss": 0.9272,
"num_input_tokens_seen": 67284880,
"step": 1400,
"train_runtime": 9769.3547,
"train_tokens_per_second": 6887.341
},
{
"epoch": 0.9006750241080038,
"grad_norm": 0.22009389102458954,
"learning_rate": 2.011605415860735e-05,
"loss": 0.925,
"num_input_tokens_seen": 67327776,
"step": 1401,
"train_runtime": 9775.3488,
"train_tokens_per_second": 6887.506
},
{
"epoch": 0.9013179042108647,
"grad_norm": 0.22195357084274292,
"learning_rate": 1.9987105093488074e-05,
"loss": 0.856,
"num_input_tokens_seen": 67371792,
"step": 1402,
"train_runtime": 9781.5289,
"train_tokens_per_second": 6887.655
},
{
"epoch": 0.9019607843137255,
"grad_norm": 0.22993923723697662,
"learning_rate": 1.9858156028368796e-05,
"loss": 0.9366,
"num_input_tokens_seen": 67412240,
"step": 1403,
"train_runtime": 9787.2214,
"train_tokens_per_second": 6887.781
},
{
"epoch": 0.9026036644165863,
"grad_norm": 0.22455386817455292,
"learning_rate": 1.9729206963249517e-05,
"loss": 1.0493,
"num_input_tokens_seen": 67454384,
"step": 1404,
"train_runtime": 9793.153,
"train_tokens_per_second": 6887.913
},
{
"epoch": 0.9026036644165863,
"eval_loss": 0.9950572848320007,
"eval_runtime": 40.0596,
"eval_samples_per_second": 24.813,
"eval_steps_per_second": 1.573,
"num_input_tokens_seen": 67454384,
"step": 1404
},
{
"epoch": 0.9032465445194471,
"grad_norm": 0.22418317198753357,
"learning_rate": 1.960025789813024e-05,
"loss": 0.9479,
"num_input_tokens_seen": 67489760,
"step": 1405,
"train_runtime": 9838.2156,
"train_tokens_per_second": 6859.959
},
{
"epoch": 0.9038894246223079,
"grad_norm": 0.2270124852657318,
"learning_rate": 1.9471308833010964e-05,
"loss": 0.9602,
"num_input_tokens_seen": 67524768,
"step": 1406,
"train_runtime": 9843.1519,
"train_tokens_per_second": 6860.076
},
{
"epoch": 0.9045323047251688,
"grad_norm": 0.22935500741004944,
"learning_rate": 1.934235976789168e-05,
"loss": 0.8195,
"num_input_tokens_seen": 67566512,
"step": 1407,
"train_runtime": 9849.0337,
"train_tokens_per_second": 6860.217
},
{
"epoch": 0.9051751848280296,
"grad_norm": 0.21343062818050385,
"learning_rate": 1.9213410702772407e-05,
"loss": 0.9033,
"num_input_tokens_seen": 67605264,
"step": 1408,
"train_runtime": 9854.4877,
"train_tokens_per_second": 6860.353
},
{
"epoch": 0.9058180649308903,
"grad_norm": 0.21292684972286224,
"learning_rate": 1.9084461637653128e-05,
"loss": 0.852,
"num_input_tokens_seen": 67641856,
"step": 1409,
"train_runtime": 9859.7137,
"train_tokens_per_second": 6860.428
},
{
"epoch": 0.9064609450337512,
"grad_norm": 0.23036617040634155,
"learning_rate": 1.895551257253385e-05,
"loss": 0.964,
"num_input_tokens_seen": 67693248,
"step": 1410,
"train_runtime": 9866.908,
"train_tokens_per_second": 6860.634
},
{
"epoch": 0.907103825136612,
"grad_norm": 0.21956272423267365,
"learning_rate": 1.882656350741457e-05,
"loss": 0.9122,
"num_input_tokens_seen": 67732784,
"step": 1411,
"train_runtime": 9873.0284,
"train_tokens_per_second": 6860.386
},
{
"epoch": 0.9077467052394729,
"grad_norm": 0.23881959915161133,
"learning_rate": 1.8697614442295293e-05,
"loss": 0.9352,
"num_input_tokens_seen": 67764784,
"step": 1412,
"train_runtime": 9877.5822,
"train_tokens_per_second": 6860.463
},
{
"epoch": 0.9083895853423336,
"grad_norm": 0.2238263487815857,
"learning_rate": 1.8568665377176018e-05,
"loss": 0.9374,
"num_input_tokens_seen": 67802224,
"step": 1413,
"train_runtime": 9882.8779,
"train_tokens_per_second": 6860.575
},
{
"epoch": 0.9090324654451944,
"grad_norm": 0.21705101430416107,
"learning_rate": 1.8439716312056736e-05,
"loss": 0.9895,
"num_input_tokens_seen": 67836496,
"step": 1414,
"train_runtime": 9887.76,
"train_tokens_per_second": 6860.654
},
{
"epoch": 0.9096753455480553,
"grad_norm": 0.22904640436172485,
"learning_rate": 1.831076724693746e-05,
"loss": 0.9624,
"num_input_tokens_seen": 67885632,
"step": 1415,
"train_runtime": 9894.6359,
"train_tokens_per_second": 6860.852
},
{
"epoch": 0.9103182256509161,
"grad_norm": 0.24583081901073456,
"learning_rate": 1.8181818181818182e-05,
"loss": 0.9797,
"num_input_tokens_seen": 67927120,
"step": 1416,
"train_runtime": 9900.4602,
"train_tokens_per_second": 6861.006
},
{
"epoch": 0.9109611057537769,
"grad_norm": 0.2447551190853119,
"learning_rate": 1.8052869116698907e-05,
"loss": 0.942,
"num_input_tokens_seen": 67979584,
"step": 1417,
"train_runtime": 9907.8027,
"train_tokens_per_second": 6861.217
},
{
"epoch": 0.9116039858566377,
"grad_norm": 0.2340712547302246,
"learning_rate": 1.7923920051579625e-05,
"loss": 0.9678,
"num_input_tokens_seen": 68036032,
"step": 1418,
"train_runtime": 9915.6772,
"train_tokens_per_second": 6861.461
},
{
"epoch": 0.9122468659594986,
"grad_norm": 0.22300267219543457,
"learning_rate": 1.779497098646035e-05,
"loss": 0.9238,
"num_input_tokens_seen": 68083520,
"step": 1419,
"train_runtime": 9922.2805,
"train_tokens_per_second": 6861.681
},
{
"epoch": 0.9128897460623594,
"grad_norm": 0.24390143156051636,
"learning_rate": 1.766602192134107e-05,
"loss": 1.028,
"num_input_tokens_seen": 68124336,
"step": 1420,
"train_runtime": 9927.9689,
"train_tokens_per_second": 6861.86
},
{
"epoch": 0.9135326261652202,
"grad_norm": 0.21573801338672638,
"learning_rate": 1.7537072856221793e-05,
"loss": 0.9566,
"num_input_tokens_seen": 68187888,
"step": 1421,
"train_runtime": 9936.769,
"train_tokens_per_second": 6862.179
},
{
"epoch": 0.914175506268081,
"grad_norm": 0.2340092808008194,
"learning_rate": 1.7408123791102515e-05,
"loss": 1.0308,
"num_input_tokens_seen": 68220832,
"step": 1422,
"train_runtime": 9941.4125,
"train_tokens_per_second": 6862.288
},
{
"epoch": 0.9148183863709418,
"grad_norm": 0.22807711362838745,
"learning_rate": 1.727917472598324e-05,
"loss": 0.9513,
"num_input_tokens_seen": 68255328,
"step": 1423,
"train_runtime": 9946.2544,
"train_tokens_per_second": 6862.415
},
{
"epoch": 0.9154612664738027,
"grad_norm": 0.2519054114818573,
"learning_rate": 1.7150225660863958e-05,
"loss": 0.9472,
"num_input_tokens_seen": 68301776,
"step": 1424,
"train_runtime": 9952.7263,
"train_tokens_per_second": 6862.62
},
{
"epoch": 0.9161041465766635,
"grad_norm": 0.22526559233665466,
"learning_rate": 1.7021276595744682e-05,
"loss": 1.0598,
"num_input_tokens_seen": 68357584,
"step": 1425,
"train_runtime": 9960.4084,
"train_tokens_per_second": 6862.93
},
{
"epoch": 0.9167470266795242,
"grad_norm": 0.24125026166439056,
"learning_rate": 1.6892327530625404e-05,
"loss": 0.9811,
"num_input_tokens_seen": 68409632,
"step": 1426,
"train_runtime": 9967.6863,
"train_tokens_per_second": 6863.141
},
{
"epoch": 0.9173899067823851,
"grad_norm": 0.22700725495815277,
"learning_rate": 1.6763378465506125e-05,
"loss": 0.9205,
"num_input_tokens_seen": 68451088,
"step": 1427,
"train_runtime": 9973.4835,
"train_tokens_per_second": 6863.308
},
{
"epoch": 0.9180327868852459,
"grad_norm": 0.21550695598125458,
"learning_rate": 1.6634429400386847e-05,
"loss": 0.8762,
"num_input_tokens_seen": 68486848,
"step": 1428,
"train_runtime": 9978.5488,
"train_tokens_per_second": 6863.408
},
{
"epoch": 0.9186756669881068,
"grad_norm": 0.2375817447900772,
"learning_rate": 1.6505480335267572e-05,
"loss": 0.9705,
"num_input_tokens_seen": 68525520,
"step": 1429,
"train_runtime": 9983.9807,
"train_tokens_per_second": 6863.547
},
{
"epoch": 0.9193185470909675,
"grad_norm": 0.22618383169174194,
"learning_rate": 1.6376531270148293e-05,
"loss": 0.9702,
"num_input_tokens_seen": 68580896,
"step": 1430,
"train_runtime": 9991.6454,
"train_tokens_per_second": 6863.824
},
{
"epoch": 0.9199614271938283,
"grad_norm": 0.2312181442975998,
"learning_rate": 1.6247582205029015e-05,
"loss": 1.0483,
"num_input_tokens_seen": 68618928,
"step": 1431,
"train_runtime": 9996.9384,
"train_tokens_per_second": 6863.994
},
{
"epoch": 0.9206043072966892,
"grad_norm": 0.21677947044372559,
"learning_rate": 1.6118633139909736e-05,
"loss": 1.0033,
"num_input_tokens_seen": 68659440,
"step": 1432,
"train_runtime": 10002.5622,
"train_tokens_per_second": 6864.185
},
{
"epoch": 0.92124718739955,
"grad_norm": 0.24624547362327576,
"learning_rate": 1.5989684074790458e-05,
"loss": 0.9439,
"num_input_tokens_seen": 68698576,
"step": 1433,
"train_runtime": 10008.0086,
"train_tokens_per_second": 6864.36
},
{
"epoch": 0.9218900675024108,
"grad_norm": 0.22636933624744415,
"learning_rate": 1.586073500967118e-05,
"loss": 0.974,
"num_input_tokens_seen": 68743168,
"step": 1434,
"train_runtime": 10014.2353,
"train_tokens_per_second": 6864.545
},
{
"epoch": 0.9225329476052716,
"grad_norm": 0.20989619195461273,
"learning_rate": 1.57317859445519e-05,
"loss": 0.849,
"num_input_tokens_seen": 68799680,
"step": 1435,
"train_runtime": 10022.0254,
"train_tokens_per_second": 6864.848
},
{
"epoch": 0.9231758277081324,
"grad_norm": 0.2507398724555969,
"learning_rate": 1.5602836879432626e-05,
"loss": 0.9745,
"num_input_tokens_seen": 68857664,
"step": 1436,
"train_runtime": 10030.1234,
"train_tokens_per_second": 6865.086
},
{
"epoch": 0.9238187078109933,
"grad_norm": 0.23638993501663208,
"learning_rate": 1.5473887814313347e-05,
"loss": 0.9524,
"num_input_tokens_seen": 68910064,
"step": 1437,
"train_runtime": 10037.4646,
"train_tokens_per_second": 6865.286
},
{
"epoch": 0.924461587913854,
"grad_norm": 0.2204284518957138,
"learning_rate": 1.534493874919407e-05,
"loss": 0.9532,
"num_input_tokens_seen": 68958096,
"step": 1438,
"train_runtime": 10044.1591,
"train_tokens_per_second": 6865.492
},
{
"epoch": 0.9251044680167149,
"grad_norm": 0.23989911377429962,
"learning_rate": 1.521598968407479e-05,
"loss": 1.0243,
"num_input_tokens_seen": 69016288,
"step": 1439,
"train_runtime": 10052.3433,
"train_tokens_per_second": 6865.692
},
{
"epoch": 0.9257473481195757,
"grad_norm": 0.22689130902290344,
"learning_rate": 1.5087040618955514e-05,
"loss": 1.0335,
"num_input_tokens_seen": 69060416,
"step": 1440,
"train_runtime": 10058.4885,
"train_tokens_per_second": 6865.884
},
{
"epoch": 0.9263902282224366,
"grad_norm": 0.20910261571407318,
"learning_rate": 1.4958091553836235e-05,
"loss": 0.8844,
"num_input_tokens_seen": 69107248,
"step": 1441,
"train_runtime": 10065.6688,
"train_tokens_per_second": 6865.639
},
{
"epoch": 0.9270331083252973,
"grad_norm": 0.22202737629413605,
"learning_rate": 1.4829142488716957e-05,
"loss": 0.9544,
"num_input_tokens_seen": 69150096,
"step": 1442,
"train_runtime": 10071.7232,
"train_tokens_per_second": 6865.766
},
{
"epoch": 0.9276759884281581,
"grad_norm": 0.22584928572177887,
"learning_rate": 1.470019342359768e-05,
"loss": 0.8774,
"num_input_tokens_seen": 69198752,
"step": 1443,
"train_runtime": 10078.513,
"train_tokens_per_second": 6865.968
},
{
"epoch": 0.928318868531019,
"grad_norm": 0.23412150144577026,
"learning_rate": 1.4571244358478403e-05,
"loss": 1.0116,
"num_input_tokens_seen": 69244912,
"step": 1444,
"train_runtime": 10084.9759,
"train_tokens_per_second": 6866.146
},
{
"epoch": 0.9289617486338798,
"grad_norm": 0.22440744936466217,
"learning_rate": 1.4442295293359123e-05,
"loss": 0.9491,
"num_input_tokens_seen": 69280640,
"step": 1445,
"train_runtime": 10089.9793,
"train_tokens_per_second": 6866.282
},
{
"epoch": 0.9296046287367405,
"grad_norm": 0.23212245106697083,
"learning_rate": 1.4313346228239846e-05,
"loss": 0.8358,
"num_input_tokens_seen": 69321088,
"step": 1446,
"train_runtime": 10095.6451,
"train_tokens_per_second": 6866.435
},
{
"epoch": 0.9302475088396014,
"grad_norm": 0.2366316169500351,
"learning_rate": 1.418439716312057e-05,
"loss": 0.9141,
"num_input_tokens_seen": 69359888,
"step": 1447,
"train_runtime": 10101.1143,
"train_tokens_per_second": 6866.558
},
{
"epoch": 0.9308903889424622,
"grad_norm": 0.23429423570632935,
"learning_rate": 1.4055448098001289e-05,
"loss": 1.0872,
"num_input_tokens_seen": 69410992,
"step": 1448,
"train_runtime": 10108.2195,
"train_tokens_per_second": 6866.787
},
{
"epoch": 0.9315332690453231,
"grad_norm": 0.23109328746795654,
"learning_rate": 1.3926499032882012e-05,
"loss": 0.9236,
"num_input_tokens_seen": 69456560,
"step": 1449,
"train_runtime": 10114.5869,
"train_tokens_per_second": 6866.97
},
{
"epoch": 0.9321761491481839,
"grad_norm": 0.22933979332447052,
"learning_rate": 1.3797549967762736e-05,
"loss": 0.9109,
"num_input_tokens_seen": 69498112,
"step": 1450,
"train_runtime": 10120.4153,
"train_tokens_per_second": 6867.121
},
{
"epoch": 0.9328190292510447,
"grad_norm": 0.22896629571914673,
"learning_rate": 1.3668600902643455e-05,
"loss": 0.9436,
"num_input_tokens_seen": 69552464,
"step": 1451,
"train_runtime": 10128.0301,
"train_tokens_per_second": 6867.324
},
{
"epoch": 0.9334619093539055,
"grad_norm": 0.2261325716972351,
"learning_rate": 1.3539651837524179e-05,
"loss": 0.859,
"num_input_tokens_seen": 69604752,
"step": 1452,
"train_runtime": 10135.2972,
"train_tokens_per_second": 6867.559
},
{
"epoch": 0.9341047894567663,
"grad_norm": 0.23998339474201202,
"learning_rate": 1.3410702772404902e-05,
"loss": 0.9361,
"num_input_tokens_seen": 69666048,
"step": 1453,
"train_runtime": 10143.7979,
"train_tokens_per_second": 6867.847
},
{
"epoch": 0.9347476695596272,
"grad_norm": 0.2145000845193863,
"learning_rate": 1.3281753707285623e-05,
"loss": 0.8499,
"num_input_tokens_seen": 69726352,
"step": 1454,
"train_runtime": 10152.1929,
"train_tokens_per_second": 6868.107
},
{
"epoch": 0.9353905496624879,
"grad_norm": 0.2282804548740387,
"learning_rate": 1.3152804642166345e-05,
"loss": 0.9619,
"num_input_tokens_seen": 69777712,
"step": 1455,
"train_runtime": 10159.3382,
"train_tokens_per_second": 6868.332
},
{
"epoch": 0.9360334297653488,
"grad_norm": 0.21795395016670227,
"learning_rate": 1.3023855577047068e-05,
"loss": 0.9902,
"num_input_tokens_seen": 69859472,
"step": 1456,
"train_runtime": 10170.8258,
"train_tokens_per_second": 6868.614
},
{
"epoch": 0.9366763098682096,
"grad_norm": 0.2481180876493454,
"learning_rate": 1.289490651192779e-05,
"loss": 1.0054,
"num_input_tokens_seen": 69904928,
"step": 1457,
"train_runtime": 10177.1651,
"train_tokens_per_second": 6868.802
},
{
"epoch": 0.9373191899710704,
"grad_norm": 0.23332452774047852,
"learning_rate": 1.2765957446808511e-05,
"loss": 0.9111,
"num_input_tokens_seen": 69946176,
"step": 1458,
"train_runtime": 10182.9769,
"train_tokens_per_second": 6868.932
},
{
"epoch": 0.9379620700739312,
"grad_norm": 0.23579373955726624,
"learning_rate": 1.2637008381689233e-05,
"loss": 1.0746,
"num_input_tokens_seen": 69985952,
"step": 1459,
"train_runtime": 10188.603,
"train_tokens_per_second": 6869.043
},
{
"epoch": 0.938604950176792,
"grad_norm": 0.25695693492889404,
"learning_rate": 1.2508059316569956e-05,
"loss": 0.888,
"num_input_tokens_seen": 70016992,
"step": 1460,
"train_runtime": 10193.0063,
"train_tokens_per_second": 6869.121
},
{
"epoch": 0.9392478302796529,
"grad_norm": 0.21970728039741516,
"learning_rate": 1.2379110251450677e-05,
"loss": 1.016,
"num_input_tokens_seen": 70063872,
"step": 1461,
"train_runtime": 10199.6083,
"train_tokens_per_second": 6869.271
},
{
"epoch": 0.9398907103825137,
"grad_norm": 0.21850202977657318,
"learning_rate": 1.2250161186331399e-05,
"loss": 0.8753,
"num_input_tokens_seen": 70116928,
"step": 1462,
"train_runtime": 10207.0556,
"train_tokens_per_second": 6869.457
},
{
"epoch": 0.9405335904853744,
"grad_norm": 0.2183936983346939,
"learning_rate": 1.2121212121212122e-05,
"loss": 0.8533,
"num_input_tokens_seen": 70168576,
"step": 1463,
"train_runtime": 10214.2898,
"train_tokens_per_second": 6869.648
},
{
"epoch": 0.9411764705882353,
"grad_norm": 0.22495919466018677,
"learning_rate": 1.1992263056092843e-05,
"loss": 0.8346,
"num_input_tokens_seen": 70227952,
"step": 1464,
"train_runtime": 10222.7241,
"train_tokens_per_second": 6869.788
},
{
"epoch": 0.9418193506910961,
"grad_norm": 0.22515498101711273,
"learning_rate": 1.1863313990973567e-05,
"loss": 1.0316,
"num_input_tokens_seen": 70300208,
"step": 1465,
"train_runtime": 10232.815,
"train_tokens_per_second": 6870.075
},
{
"epoch": 0.942462230793957,
"grad_norm": 0.20822781324386597,
"learning_rate": 1.1734364925854288e-05,
"loss": 0.8258,
"num_input_tokens_seen": 70337472,
"step": 1466,
"train_runtime": 10238.1087,
"train_tokens_per_second": 6870.163
},
{
"epoch": 0.9431051108968177,
"grad_norm": 0.23032674193382263,
"learning_rate": 1.160541586073501e-05,
"loss": 0.9532,
"num_input_tokens_seen": 70369504,
"step": 1467,
"train_runtime": 10242.6604,
"train_tokens_per_second": 6870.237
},
{
"epoch": 0.9437479909996785,
"grad_norm": 0.20609726011753082,
"learning_rate": 1.1476466795615733e-05,
"loss": 0.7868,
"num_input_tokens_seen": 70413344,
"step": 1468,
"train_runtime": 10248.8547,
"train_tokens_per_second": 6870.362
},
{
"epoch": 0.9443908711025394,
"grad_norm": 0.23372110724449158,
"learning_rate": 1.1347517730496454e-05,
"loss": 0.8516,
"num_input_tokens_seen": 70469104,
"step": 1469,
"train_runtime": 10256.6888,
"train_tokens_per_second": 6870.551
},
{
"epoch": 0.9450337512054002,
"grad_norm": 0.22682523727416992,
"learning_rate": 1.1218568665377178e-05,
"loss": 0.9136,
"num_input_tokens_seen": 70511488,
"step": 1470,
"train_runtime": 10262.6499,
"train_tokens_per_second": 6870.69
},
{
"epoch": 0.945676631308261,
"grad_norm": 0.2447620928287506,
"learning_rate": 1.1089619600257899e-05,
"loss": 0.8358,
"num_input_tokens_seen": 70573376,
"step": 1471,
"train_runtime": 10271.8891,
"train_tokens_per_second": 6870.535
},
{
"epoch": 0.9463195114111218,
"grad_norm": 0.2190268188714981,
"learning_rate": 1.096067053513862e-05,
"loss": 0.9806,
"num_input_tokens_seen": 70626032,
"step": 1472,
"train_runtime": 10279.2403,
"train_tokens_per_second": 6870.744
},
{
"epoch": 0.9469623915139826,
"grad_norm": 0.22610507905483246,
"learning_rate": 1.0831721470019344e-05,
"loss": 1.0947,
"num_input_tokens_seen": 70670400,
"step": 1473,
"train_runtime": 10285.4855,
"train_tokens_per_second": 6870.886
},
{
"epoch": 0.9476052716168435,
"grad_norm": 0.24609413743019104,
"learning_rate": 1.0702772404900065e-05,
"loss": 0.9695,
"num_input_tokens_seen": 70721200,
"step": 1474,
"train_runtime": 10292.5271,
"train_tokens_per_second": 6871.121
},
{
"epoch": 0.9482481517197042,
"grad_norm": 0.2186412215232849,
"learning_rate": 1.0573823339780787e-05,
"loss": 0.8916,
"num_input_tokens_seen": 70773392,
"step": 1475,
"train_runtime": 10299.743,
"train_tokens_per_second": 6871.375
},
{
"epoch": 0.9488910318225651,
"grad_norm": 0.22198593616485596,
"learning_rate": 1.0444874274661508e-05,
"loss": 0.9986,
"num_input_tokens_seen": 70817312,
"step": 1476,
"train_runtime": 10305.8674,
"train_tokens_per_second": 6871.553
},
{
"epoch": 0.9495339119254259,
"grad_norm": 0.22311225533485413,
"learning_rate": 1.031592520954223e-05,
"loss": 0.9174,
"num_input_tokens_seen": 70855552,
"step": 1477,
"train_runtime": 10311.2514,
"train_tokens_per_second": 6871.673
},
{
"epoch": 0.9501767920282868,
"grad_norm": 0.22305837273597717,
"learning_rate": 1.0186976144422953e-05,
"loss": 1.0409,
"num_input_tokens_seen": 70897120,
"step": 1478,
"train_runtime": 10317.0953,
"train_tokens_per_second": 6871.81
},
{
"epoch": 0.9508196721311475,
"grad_norm": 0.21804772317409515,
"learning_rate": 1.0058027079303675e-05,
"loss": 0.9187,
"num_input_tokens_seen": 70947872,
"step": 1479,
"train_runtime": 10324.2218,
"train_tokens_per_second": 6871.983
},
{
"epoch": 0.9514625522340083,
"grad_norm": 0.24226270616054535,
"learning_rate": 9.929078014184398e-06,
"loss": 0.9696,
"num_input_tokens_seen": 71005248,
"step": 1480,
"train_runtime": 10332.2825,
"train_tokens_per_second": 6872.174
},
{
"epoch": 0.9521054323368692,
"grad_norm": 0.21511489152908325,
"learning_rate": 9.80012894906512e-06,
"loss": 0.9717,
"num_input_tokens_seen": 71047280,
"step": 1481,
"train_runtime": 10338.2265,
"train_tokens_per_second": 6872.289
},
{
"epoch": 0.95274831243973,
"grad_norm": 0.23640964925289154,
"learning_rate": 9.67117988394584e-06,
"loss": 0.9809,
"num_input_tokens_seen": 71087584,
"step": 1482,
"train_runtime": 10343.9144,
"train_tokens_per_second": 6872.406
},
{
"epoch": 0.9533911925425909,
"grad_norm": 0.21565860509872437,
"learning_rate": 9.542230818826564e-06,
"loss": 0.8432,
"num_input_tokens_seen": 71154064,
"step": 1483,
"train_runtime": 10353.2251,
"train_tokens_per_second": 6872.647
},
{
"epoch": 0.9540340726454516,
"grad_norm": 0.21562111377716064,
"learning_rate": 9.413281753707286e-06,
"loss": 0.894,
"num_input_tokens_seen": 71194080,
"step": 1484,
"train_runtime": 10358.8752,
"train_tokens_per_second": 6872.762
},
{
"epoch": 0.9546769527483124,
"grad_norm": 0.22925646603107452,
"learning_rate": 9.284332688588009e-06,
"loss": 1.0213,
"num_input_tokens_seen": 71237424,
"step": 1485,
"train_runtime": 10364.9791,
"train_tokens_per_second": 6872.896
},
{
"epoch": 0.9553198328511733,
"grad_norm": 0.2211703509092331,
"learning_rate": 9.15538362346873e-06,
"loss": 0.9599,
"num_input_tokens_seen": 71294800,
"step": 1486,
"train_runtime": 10373.0981,
"train_tokens_per_second": 6873.048
},
{
"epoch": 0.9559627129540341,
"grad_norm": 0.2549663782119751,
"learning_rate": 9.026434558349453e-06,
"loss": 0.9073,
"num_input_tokens_seen": 71360176,
"step": 1487,
"train_runtime": 10382.2284,
"train_tokens_per_second": 6873.301
},
{
"epoch": 0.9566055930568949,
"grad_norm": 0.22406437993049622,
"learning_rate": 8.897485493230175e-06,
"loss": 0.9863,
"num_input_tokens_seen": 71400816,
"step": 1488,
"train_runtime": 10387.957,
"train_tokens_per_second": 6873.422
},
{
"epoch": 0.9572484731597557,
"grad_norm": 0.2288341373205185,
"learning_rate": 8.768536428110897e-06,
"loss": 0.9861,
"num_input_tokens_seen": 71438720,
"step": 1489,
"train_runtime": 10393.2868,
"train_tokens_per_second": 6873.545
},
{
"epoch": 0.9578913532626165,
"grad_norm": 0.20654594898223877,
"learning_rate": 8.63958736299162e-06,
"loss": 0.7846,
"num_input_tokens_seen": 71475296,
"step": 1490,
"train_runtime": 10398.4555,
"train_tokens_per_second": 6873.645
},
{
"epoch": 0.9585342333654774,
"grad_norm": 0.2258782833814621,
"learning_rate": 8.510638297872341e-06,
"loss": 1.0008,
"num_input_tokens_seen": 71518512,
"step": 1491,
"train_runtime": 10404.5551,
"train_tokens_per_second": 6873.769
},
{
"epoch": 0.9591771134683381,
"grad_norm": 0.217194065451622,
"learning_rate": 8.381689232753063e-06,
"loss": 0.9591,
"num_input_tokens_seen": 71558352,
"step": 1492,
"train_runtime": 10410.1906,
"train_tokens_per_second": 6873.875
},
{
"epoch": 0.959819993571199,
"grad_norm": 0.21820807456970215,
"learning_rate": 8.252740167633786e-06,
"loss": 0.9159,
"num_input_tokens_seen": 71616752,
"step": 1493,
"train_runtime": 10418.4046,
"train_tokens_per_second": 6874.061
},
{
"epoch": 0.9604628736740598,
"grad_norm": 0.22350728511810303,
"learning_rate": 8.123791102514507e-06,
"loss": 0.8806,
"num_input_tokens_seen": 71675872,
"step": 1494,
"train_runtime": 10426.7534,
"train_tokens_per_second": 6874.227
},
{
"epoch": 0.9611057537769206,
"grad_norm": 0.23393666744232178,
"learning_rate": 7.994842037395229e-06,
"loss": 1.0436,
"num_input_tokens_seen": 71720592,
"step": 1495,
"train_runtime": 10433.0466,
"train_tokens_per_second": 6874.367
},
{
"epoch": 0.9617486338797814,
"grad_norm": 0.2220027595758438,
"learning_rate": 7.86589297227595e-06,
"loss": 1.0807,
"num_input_tokens_seen": 71764048,
"step": 1496,
"train_runtime": 10439.1482,
"train_tokens_per_second": 6874.512
},
{
"epoch": 0.9623915139826422,
"grad_norm": 0.227558434009552,
"learning_rate": 7.736943907156674e-06,
"loss": 0.9828,
"num_input_tokens_seen": 71808592,
"step": 1497,
"train_runtime": 10445.3874,
"train_tokens_per_second": 6874.67
},
{
"epoch": 0.9630343940855031,
"grad_norm": 0.2309248149394989,
"learning_rate": 7.607994842037395e-06,
"loss": 0.9937,
"num_input_tokens_seen": 71858480,
"step": 1498,
"train_runtime": 10452.4313,
"train_tokens_per_second": 6874.81
},
{
"epoch": 0.9636772741883639,
"grad_norm": 0.24256859719753265,
"learning_rate": 7.4790457769181176e-06,
"loss": 1.0748,
"num_input_tokens_seen": 71904512,
"step": 1499,
"train_runtime": 10458.8953,
"train_tokens_per_second": 6874.962
},
{
"epoch": 0.9643201542912246,
"grad_norm": 0.21975061297416687,
"learning_rate": 7.35009671179884e-06,
"loss": 0.9066,
"num_input_tokens_seen": 71952672,
"step": 1500,
"train_runtime": 10465.6379,
"train_tokens_per_second": 6875.135
},
{
"epoch": 0.9649630343940855,
"grad_norm": 0.23950344324111938,
"learning_rate": 7.2211476466795614e-06,
"loss": 1.0634,
"num_input_tokens_seen": 71994464,
"step": 1501,
"train_runtime": 10472.0515,
"train_tokens_per_second": 6874.915
},
{
"epoch": 0.9656059144969463,
"grad_norm": 0.2366107702255249,
"learning_rate": 7.092198581560285e-06,
"loss": 1.0483,
"num_input_tokens_seen": 72044336,
"step": 1502,
"train_runtime": 10479.0377,
"train_tokens_per_second": 6875.091
},
{
"epoch": 0.9662487945998072,
"grad_norm": 0.20939429104328156,
"learning_rate": 6.963249516441006e-06,
"loss": 0.9134,
"num_input_tokens_seen": 72096384,
"step": 1503,
"train_runtime": 10486.3482,
"train_tokens_per_second": 6875.261
},
{
"epoch": 0.9668916747026679,
"grad_norm": 0.24359357357025146,
"learning_rate": 6.834300451321728e-06,
"loss": 1.0708,
"num_input_tokens_seen": 72152000,
"step": 1504,
"train_runtime": 10494.2042,
"train_tokens_per_second": 6875.414
},
{
"epoch": 0.9675345548055287,
"grad_norm": 0.22651512920856476,
"learning_rate": 6.705351386202451e-06,
"loss": 0.9473,
"num_input_tokens_seen": 72203584,
"step": 1505,
"train_runtime": 10501.4323,
"train_tokens_per_second": 6875.594
},
{
"epoch": 0.9681774349083896,
"grad_norm": 0.2099381536245346,
"learning_rate": 6.576402321083172e-06,
"loss": 0.8985,
"num_input_tokens_seen": 72250368,
"step": 1506,
"train_runtime": 10508.0099,
"train_tokens_per_second": 6875.742
},
{
"epoch": 0.9688203150112504,
"grad_norm": 0.21460288763046265,
"learning_rate": 6.447453255963895e-06,
"loss": 0.8075,
"num_input_tokens_seen": 72301424,
"step": 1507,
"train_runtime": 10515.1925,
"train_tokens_per_second": 6875.901
},
{
"epoch": 0.9694631951141112,
"grad_norm": 0.22760364413261414,
"learning_rate": 6.318504190844616e-06,
"loss": 1.0461,
"num_input_tokens_seen": 72363488,
"step": 1508,
"train_runtime": 10523.9695,
"train_tokens_per_second": 6876.064
},
{
"epoch": 0.970106075216972,
"grad_norm": 0.24012909829616547,
"learning_rate": 6.189555125725339e-06,
"loss": 0.9455,
"num_input_tokens_seen": 72414944,
"step": 1509,
"train_runtime": 10531.2007,
"train_tokens_per_second": 6876.229
},
{
"epoch": 0.9707489553198329,
"grad_norm": 0.21027275919914246,
"learning_rate": 6.060606060606061e-06,
"loss": 0.9407,
"num_input_tokens_seen": 72449424,
"step": 1510,
"train_runtime": 10536.112,
"train_tokens_per_second": 6876.296
},
{
"epoch": 0.9713918354226937,
"grad_norm": 0.22606825828552246,
"learning_rate": 5.931656995486783e-06,
"loss": 0.8168,
"num_input_tokens_seen": 72508240,
"step": 1511,
"train_runtime": 10544.438,
"train_tokens_per_second": 6876.444
},
{
"epoch": 0.9720347155255545,
"grad_norm": 0.2204393595457077,
"learning_rate": 5.802707930367505e-06,
"loss": 0.9256,
"num_input_tokens_seen": 72548032,
"step": 1512,
"train_runtime": 10550.0785,
"train_tokens_per_second": 6876.54
},
{
"epoch": 0.9726775956284153,
"grad_norm": 0.23502115905284882,
"learning_rate": 5.673758865248227e-06,
"loss": 0.9147,
"num_input_tokens_seen": 72584416,
"step": 1513,
"train_runtime": 10555.2719,
"train_tokens_per_second": 6876.603
},
{
"epoch": 0.9733204757312761,
"grad_norm": 0.21649810671806335,
"learning_rate": 5.5448098001289496e-06,
"loss": 0.849,
"num_input_tokens_seen": 72646048,
"step": 1514,
"train_runtime": 10563.968,
"train_tokens_per_second": 6876.777
},
{
"epoch": 0.973963355834137,
"grad_norm": 0.22711792588233948,
"learning_rate": 5.415860735009672e-06,
"loss": 0.9796,
"num_input_tokens_seen": 72690720,
"step": 1515,
"train_runtime": 10570.2401,
"train_tokens_per_second": 6876.922
},
{
"epoch": 0.9746062359369978,
"grad_norm": 0.2364644706249237,
"learning_rate": 5.2869116698903934e-06,
"loss": 0.9632,
"num_input_tokens_seen": 72759216,
"step": 1516,
"train_runtime": 10579.834,
"train_tokens_per_second": 6877.16
},
{
"epoch": 0.9752491160398585,
"grad_norm": 0.22103801369667053,
"learning_rate": 5.157962604771115e-06,
"loss": 1.0121,
"num_input_tokens_seen": 72798032,
"step": 1517,
"train_runtime": 10585.3058,
"train_tokens_per_second": 6877.272
},
{
"epoch": 0.9758919961427194,
"grad_norm": 0.22890672087669373,
"learning_rate": 5.029013539651837e-06,
"loss": 1.0232,
"num_input_tokens_seen": 72837680,
"step": 1518,
"train_runtime": 10590.9089,
"train_tokens_per_second": 6877.378
},
{
"epoch": 0.9765348762455802,
"grad_norm": 0.22934086620807648,
"learning_rate": 4.90006447453256e-06,
"loss": 0.9378,
"num_input_tokens_seen": 72874688,
"step": 1519,
"train_runtime": 10596.0774,
"train_tokens_per_second": 6877.516
},
{
"epoch": 0.9771777563484411,
"grad_norm": 0.23011226952075958,
"learning_rate": 4.771115409413282e-06,
"loss": 0.9678,
"num_input_tokens_seen": 72936256,
"step": 1520,
"train_runtime": 10604.6406,
"train_tokens_per_second": 6877.768
},
{
"epoch": 0.9778206364513018,
"grad_norm": 0.24541643261909485,
"learning_rate": 4.642166344294004e-06,
"loss": 0.8654,
"num_input_tokens_seen": 73006592,
"step": 1521,
"train_runtime": 10614.4594,
"train_tokens_per_second": 6878.032
},
{
"epoch": 0.9784635165541626,
"grad_norm": 0.22993628680706024,
"learning_rate": 4.513217279174727e-06,
"loss": 0.8861,
"num_input_tokens_seen": 73054544,
"step": 1522,
"train_runtime": 10621.2121,
"train_tokens_per_second": 6878.174
},
{
"epoch": 0.9791063966570235,
"grad_norm": 0.22999486327171326,
"learning_rate": 4.384268214055448e-06,
"loss": 0.9199,
"num_input_tokens_seen": 73105040,
"step": 1523,
"train_runtime": 10628.2805,
"train_tokens_per_second": 6878.351
},
{
"epoch": 0.9797492767598843,
"grad_norm": 0.21587304770946503,
"learning_rate": 4.255319148936171e-06,
"loss": 0.9214,
"num_input_tokens_seen": 73143792,
"step": 1524,
"train_runtime": 10633.7179,
"train_tokens_per_second": 6878.478
},
{
"epoch": 0.9803921568627451,
"grad_norm": 0.2139047533273697,
"learning_rate": 4.126370083816893e-06,
"loss": 0.934,
"num_input_tokens_seen": 73182944,
"step": 1525,
"train_runtime": 10639.2884,
"train_tokens_per_second": 6878.556
},
{
"epoch": 0.9810350369656059,
"grad_norm": 0.22586394846439362,
"learning_rate": 3.9974210186976145e-06,
"loss": 0.8524,
"num_input_tokens_seen": 73212320,
"step": 1526,
"train_runtime": 10643.4687,
"train_tokens_per_second": 6878.615
},
{
"epoch": 0.9816779170684667,
"grad_norm": 0.2351096123456955,
"learning_rate": 3.868471953578337e-06,
"loss": 1.0184,
"num_input_tokens_seen": 73250352,
"step": 1527,
"train_runtime": 10648.8122,
"train_tokens_per_second": 6878.735
},
{
"epoch": 0.9823207971713276,
"grad_norm": 0.23118098080158234,
"learning_rate": 3.7395228884590588e-06,
"loss": 0.9452,
"num_input_tokens_seen": 73296496,
"step": 1528,
"train_runtime": 10655.2604,
"train_tokens_per_second": 6878.902
},
{
"epoch": 0.9829636772741883,
"grad_norm": 0.22116637229919434,
"learning_rate": 3.6105738233397807e-06,
"loss": 0.8709,
"num_input_tokens_seen": 73337840,
"step": 1529,
"train_runtime": 10661.0594,
"train_tokens_per_second": 6879.039
},
{
"epoch": 0.9836065573770492,
"grad_norm": 0.21791870892047882,
"learning_rate": 3.481624758220503e-06,
"loss": 0.9545,
"num_input_tokens_seen": 73379968,
"step": 1530,
"train_runtime": 10667.0265,
"train_tokens_per_second": 6879.14
},
{
"epoch": 0.98424943747991,
"grad_norm": 0.24784664809703827,
"learning_rate": 3.3526756931012254e-06,
"loss": 0.8842,
"num_input_tokens_seen": 73410880,
"step": 1531,
"train_runtime": 10671.9405,
"train_tokens_per_second": 6878.869
},
{
"epoch": 0.9848923175827708,
"grad_norm": 0.24023281037807465,
"learning_rate": 3.2237266279819474e-06,
"loss": 0.969,
"num_input_tokens_seen": 73447616,
"step": 1532,
"train_runtime": 10677.1333,
"train_tokens_per_second": 6878.964
},
{
"epoch": 0.9855351976856316,
"grad_norm": 0.22703370451927185,
"learning_rate": 3.0947775628626693e-06,
"loss": 0.8778,
"num_input_tokens_seen": 73491600,
"step": 1533,
"train_runtime": 10683.2916,
"train_tokens_per_second": 6879.116
},
{
"epoch": 0.9861780777884924,
"grad_norm": 0.2379906177520752,
"learning_rate": 2.9658284977433917e-06,
"loss": 0.9919,
"num_input_tokens_seen": 73531328,
"step": 1534,
"train_runtime": 10688.8868,
"train_tokens_per_second": 6879.232
},
{
"epoch": 0.9868209578913533,
"grad_norm": 0.2339247614145279,
"learning_rate": 2.8368794326241136e-06,
"loss": 1.0197,
"num_input_tokens_seen": 73580624,
"step": 1535,
"train_runtime": 10695.8355,
"train_tokens_per_second": 6879.371
},
{
"epoch": 0.9874638379942141,
"grad_norm": 0.2211606651544571,
"learning_rate": 2.707930367504836e-06,
"loss": 1.2567,
"num_input_tokens_seen": 73629520,
"step": 1536,
"train_runtime": 10702.7009,
"train_tokens_per_second": 6879.527
},
{
"epoch": 0.9881067180970748,
"grad_norm": 0.23319384455680847,
"learning_rate": 2.5789813023855575e-06,
"loss": 0.9055,
"num_input_tokens_seen": 73671728,
"step": 1537,
"train_runtime": 10708.6418,
"train_tokens_per_second": 6879.652
},
{
"epoch": 0.9887495981999357,
"grad_norm": 0.23008319735527039,
"learning_rate": 2.45003223726628e-06,
"loss": 0.9364,
"num_input_tokens_seen": 73723088,
"step": 1538,
"train_runtime": 10715.8183,
"train_tokens_per_second": 6879.837
},
{
"epoch": 0.9893924783027965,
"grad_norm": 0.22150327265262604,
"learning_rate": 2.321083172147002e-06,
"loss": 1.0242,
"num_input_tokens_seen": 73777696,
"step": 1539,
"train_runtime": 10723.5459,
"train_tokens_per_second": 6879.972
},
{
"epoch": 0.9900353584056574,
"grad_norm": 0.21783533692359924,
"learning_rate": 2.192134107027724e-06,
"loss": 1.0637,
"num_input_tokens_seen": 73831504,
"step": 1540,
"train_runtime": 10731.0934,
"train_tokens_per_second": 6880.147
},
{
"epoch": 0.9906782385085182,
"grad_norm": 0.22133003175258636,
"learning_rate": 2.0631850419084465e-06,
"loss": 1.0165,
"num_input_tokens_seen": 73875968,
"step": 1541,
"train_runtime": 10737.3327,
"train_tokens_per_second": 6880.291
},
{
"epoch": 0.991321118611379,
"grad_norm": 0.25689297914505005,
"learning_rate": 1.9342359767891684e-06,
"loss": 1.6965,
"num_input_tokens_seen": 73934464,
"step": 1542,
"train_runtime": 10745.5214,
"train_tokens_per_second": 6880.491
},
{
"epoch": 0.9919639987142398,
"grad_norm": 0.23742981255054474,
"learning_rate": 1.8052869116698904e-06,
"loss": 0.9891,
"num_input_tokens_seen": 73993488,
"step": 1543,
"train_runtime": 10753.8618,
"train_tokens_per_second": 6880.643
},
{
"epoch": 0.9926068788171006,
"grad_norm": 0.25090768933296204,
"learning_rate": 1.6763378465506127e-06,
"loss": 1.0532,
"num_input_tokens_seen": 74044432,
"step": 1544,
"train_runtime": 10761.0324,
"train_tokens_per_second": 6880.793
},
{
"epoch": 0.9932497589199615,
"grad_norm": 0.23686262965202332,
"learning_rate": 1.5473887814313347e-06,
"loss": 1.0108,
"num_input_tokens_seen": 74094208,
"step": 1545,
"train_runtime": 10768.0263,
"train_tokens_per_second": 6880.946
},
{
"epoch": 0.9938926390228222,
"grad_norm": 0.22799675166606903,
"learning_rate": 1.4184397163120568e-06,
"loss": 1.1222,
"num_input_tokens_seen": 74133760,
"step": 1546,
"train_runtime": 10773.6342,
"train_tokens_per_second": 6881.036
},
{
"epoch": 0.994535519125683,
"grad_norm": 0.22108574211597443,
"learning_rate": 1.2894906511927787e-06,
"loss": 0.8359,
"num_input_tokens_seen": 74183040,
"step": 1547,
"train_runtime": 10780.5602,
"train_tokens_per_second": 6881.186
},
{
"epoch": 0.9951783992285439,
"grad_norm": 0.24408769607543945,
"learning_rate": 1.160541586073501e-06,
"loss": 0.9974,
"num_input_tokens_seen": 74223408,
"step": 1548,
"train_runtime": 10786.2555,
"train_tokens_per_second": 6881.295
},
{
"epoch": 0.9958212793314047,
"grad_norm": 0.25479939579963684,
"learning_rate": 1.0315925209542232e-06,
"loss": 0.9484,
"num_input_tokens_seen": 74261936,
"step": 1549,
"train_runtime": 10791.6911,
"train_tokens_per_second": 6881.399
},
{
"epoch": 0.9964641594342655,
"grad_norm": 0.25188323855400085,
"learning_rate": 9.026434558349452e-07,
"loss": 0.9854,
"num_input_tokens_seen": 74305648,
"step": 1550,
"train_runtime": 10797.8713,
"train_tokens_per_second": 6881.509
},
{
"epoch": 0.9971070395371263,
"grad_norm": 0.23725450038909912,
"learning_rate": 7.736943907156673e-07,
"loss": 0.9761,
"num_input_tokens_seen": 74354912,
"step": 1551,
"train_runtime": 10804.7577,
"train_tokens_per_second": 6881.682
},
{
"epoch": 0.9977499196399872,
"grad_norm": 0.2294706404209137,
"learning_rate": 6.447453255963894e-07,
"loss": 0.903,
"num_input_tokens_seen": 74397344,
"step": 1552,
"train_runtime": 10810.7407,
"train_tokens_per_second": 6881.799
},
{
"epoch": 0.998392799742848,
"grad_norm": 0.2335725575685501,
"learning_rate": 5.157962604771116e-07,
"loss": 1.0615,
"num_input_tokens_seen": 74451520,
"step": 1553,
"train_runtime": 10818.4341,
"train_tokens_per_second": 6881.913
},
{
"epoch": 0.9990356798457087,
"grad_norm": 0.22153763473033905,
"learning_rate": 3.8684719535783366e-07,
"loss": 0.9205,
"num_input_tokens_seen": 74490944,
"step": 1554,
"train_runtime": 10824.0166,
"train_tokens_per_second": 6882.006
},
{
"epoch": 0.9996785599485696,
"grad_norm": 0.22652824223041534,
"learning_rate": 2.578981302385558e-07,
"loss": 0.8884,
"num_input_tokens_seen": 74553376,
"step": 1555,
"train_runtime": 10832.8456,
"train_tokens_per_second": 6882.16
},
{
"epoch": 1.0,
"grad_norm": 0.353055864572525,
"learning_rate": 1.289490651192779e-07,
"loss": 0.9193,
"num_input_tokens_seen": 74567527,
"step": 1556,
"train_runtime": 10834.9152,
"train_tokens_per_second": 6882.151
}
],
"logging_steps": 1,
"max_steps": 1556,
"num_input_tokens_seen": 74567527,
"num_train_epochs": 1,
"save_steps": 30,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 3.1814933251156285e+18,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}