FormlessAI's picture
Upload folder using huggingface_hub
b029e87 verified
Raw
History Blame Contribute Delete
230 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 78,
"global_step": 778,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0012857602057216328,
"grad_norm": 59.91437911987305,
"learning_rate": 0.0,
"loss": 2.8221,
"num_input_tokens_seen": 135296,
"step": 1,
"train_runtime": 22.8878,
"train_tokens_per_second": 5911.283
},
{
"epoch": 0.0025715204114432656,
"grad_norm": 54.928260803222656,
"learning_rate": 4.000000000000001e-06,
"loss": 2.8194,
"num_input_tokens_seen": 295488,
"step": 2,
"train_runtime": 38.3163,
"train_tokens_per_second": 7711.806
},
{
"epoch": 0.003857280617164899,
"grad_norm": 46.19917297363281,
"learning_rate": 8.000000000000001e-06,
"loss": 2.5824,
"num_input_tokens_seen": 390880,
"step": 3,
"train_runtime": 46.3319,
"train_tokens_per_second": 8436.522
},
{
"epoch": 0.005143040822886531,
"grad_norm": 29.48894691467285,
"learning_rate": 1.2e-05,
"loss": 2.1127,
"num_input_tokens_seen": 527584,
"step": 4,
"train_runtime": 58.9913,
"train_tokens_per_second": 8943.425
},
{
"epoch": 0.006428801028608165,
"grad_norm": 12.14394474029541,
"learning_rate": 1.6000000000000003e-05,
"loss": 1.7084,
"num_input_tokens_seen": 644736,
"step": 5,
"train_runtime": 69.2931,
"train_tokens_per_second": 9304.479
},
{
"epoch": 0.007714561234329798,
"grad_norm": 9.809494018554688,
"learning_rate": 2e-05,
"loss": 1.681,
"num_input_tokens_seen": 777056,
"step": 6,
"train_runtime": 81.2029,
"train_tokens_per_second": 9569.309
},
{
"epoch": 0.00900032144005143,
"grad_norm": 8.21720027923584,
"learning_rate": 1.997412677878396e-05,
"loss": 1.6744,
"num_input_tokens_seen": 910560,
"step": 7,
"train_runtime": 93.321,
"train_tokens_per_second": 9757.29
},
{
"epoch": 0.010286081645773062,
"grad_norm": 7.667925834655762,
"learning_rate": 1.994825355756792e-05,
"loss": 1.4179,
"num_input_tokens_seen": 1062912,
"step": 8,
"train_runtime": 107.311,
"train_tokens_per_second": 9904.967
},
{
"epoch": 0.011571841851494697,
"grad_norm": 6.243086814880371,
"learning_rate": 1.9922380336351877e-05,
"loss": 1.3252,
"num_input_tokens_seen": 1152448,
"step": 9,
"train_runtime": 114.8712,
"train_tokens_per_second": 10032.519
},
{
"epoch": 0.01285760205721633,
"grad_norm": 4.096212863922119,
"learning_rate": 1.9896507115135837e-05,
"loss": 1.2179,
"num_input_tokens_seen": 1251424,
"step": 10,
"train_runtime": 123.394,
"train_tokens_per_second": 10141.69
},
{
"epoch": 0.014143362262937963,
"grad_norm": 3.7918293476104736,
"learning_rate": 1.9870633893919795e-05,
"loss": 1.3145,
"num_input_tokens_seen": 1401632,
"step": 11,
"train_runtime": 137.3677,
"train_tokens_per_second": 10203.506
},
{
"epoch": 0.015429122468659595,
"grad_norm": 2.6636881828308105,
"learning_rate": 1.9844760672703752e-05,
"loss": 1.1167,
"num_input_tokens_seen": 1485088,
"step": 12,
"train_runtime": 144.3866,
"train_tokens_per_second": 10285.495
},
{
"epoch": 0.01671488267438123,
"grad_norm": 3.1536850929260254,
"learning_rate": 1.9818887451487713e-05,
"loss": 1.2975,
"num_input_tokens_seen": 1599424,
"step": 13,
"train_runtime": 154.4368,
"train_tokens_per_second": 10356.492
},
{
"epoch": 0.01800064288010286,
"grad_norm": 2.806964874267578,
"learning_rate": 1.979301423027167e-05,
"loss": 1.2166,
"num_input_tokens_seen": 1688192,
"step": 14,
"train_runtime": 161.9986,
"train_tokens_per_second": 10421.031
},
{
"epoch": 0.019286403085824494,
"grad_norm": 2.8832125663757324,
"learning_rate": 1.9767141009055627e-05,
"loss": 1.3103,
"num_input_tokens_seen": 1779040,
"step": 15,
"train_runtime": 169.8234,
"train_tokens_per_second": 10475.825
},
{
"epoch": 0.020572163291546125,
"grad_norm": 2.3326032161712646,
"learning_rate": 1.9741267787839588e-05,
"loss": 1.1936,
"num_input_tokens_seen": 1898976,
"step": 16,
"train_runtime": 180.4047,
"train_tokens_per_second": 10526.202
},
{
"epoch": 0.02185792349726776,
"grad_norm": 2.495771646499634,
"learning_rate": 1.971539456662355e-05,
"loss": 1.238,
"num_input_tokens_seen": 2002496,
"step": 17,
"train_runtime": 189.3388,
"train_tokens_per_second": 10576.258
},
{
"epoch": 0.023143683702989394,
"grad_norm": 2.3127689361572266,
"learning_rate": 1.9689521345407506e-05,
"loss": 1.2386,
"num_input_tokens_seen": 2148032,
"step": 18,
"train_runtime": 202.5493,
"train_tokens_per_second": 10604.983
},
{
"epoch": 0.024429443908711025,
"grad_norm": 2.1507444381713867,
"learning_rate": 1.9663648124191463e-05,
"loss": 1.1955,
"num_input_tokens_seen": 2273632,
"step": 19,
"train_runtime": 214.0022,
"train_tokens_per_second": 10624.337
},
{
"epoch": 0.02571520411443266,
"grad_norm": 2.7235100269317627,
"learning_rate": 1.963777490297542e-05,
"loss": 1.2066,
"num_input_tokens_seen": 2383520,
"step": 20,
"train_runtime": 223.8834,
"train_tokens_per_second": 10646.255
},
{
"epoch": 0.02700096432015429,
"grad_norm": 2.299577236175537,
"learning_rate": 1.961190168175938e-05,
"loss": 1.1685,
"num_input_tokens_seen": 2483456,
"step": 21,
"train_runtime": 232.4787,
"train_tokens_per_second": 10682.509
},
{
"epoch": 0.028286724525875925,
"grad_norm": 2.1814215183258057,
"learning_rate": 1.9586028460543338e-05,
"loss": 1.1816,
"num_input_tokens_seen": 2628480,
"step": 22,
"train_runtime": 245.7507,
"train_tokens_per_second": 10695.718
},
{
"epoch": 0.029572484731597556,
"grad_norm": 1.9551724195480347,
"learning_rate": 1.95601552393273e-05,
"loss": 1.1728,
"num_input_tokens_seen": 2741984,
"step": 23,
"train_runtime": 255.7533,
"train_tokens_per_second": 10721.207
},
{
"epoch": 0.03085824493731919,
"grad_norm": 1.9535983800888062,
"learning_rate": 1.9534282018111256e-05,
"loss": 1.2263,
"num_input_tokens_seen": 2827744,
"step": 24,
"train_runtime": 263.0783,
"train_tokens_per_second": 10748.679
},
{
"epoch": 0.032144005143040826,
"grad_norm": 2.2656548023223877,
"learning_rate": 1.9508408796895217e-05,
"loss": 1.1648,
"num_input_tokens_seen": 2926304,
"step": 25,
"train_runtime": 271.5983,
"train_tokens_per_second": 10774.384
},
{
"epoch": 0.03342976534876246,
"grad_norm": 2.323800563812256,
"learning_rate": 1.9482535575679174e-05,
"loss": 1.1831,
"num_input_tokens_seen": 3039168,
"step": 26,
"train_runtime": 281.843,
"train_tokens_per_second": 10783.195
},
{
"epoch": 0.03471552555448409,
"grad_norm": 1.9560903310775757,
"learning_rate": 1.945666235446313e-05,
"loss": 1.2156,
"num_input_tokens_seen": 3162080,
"step": 27,
"train_runtime": 293.1326,
"train_tokens_per_second": 10787.199
},
{
"epoch": 0.03600128576020572,
"grad_norm": 1.7636638879776,
"learning_rate": 1.943078913324709e-05,
"loss": 1.1564,
"num_input_tokens_seen": 3277408,
"step": 28,
"train_runtime": 303.3144,
"train_tokens_per_second": 10805.316
},
{
"epoch": 0.03728704596592736,
"grad_norm": 1.9402304887771606,
"learning_rate": 1.940491591203105e-05,
"loss": 1.2378,
"num_input_tokens_seen": 3393408,
"step": 29,
"train_runtime": 313.5538,
"train_tokens_per_second": 10822.41
},
{
"epoch": 0.03857280617164899,
"grad_norm": 2.0136935710906982,
"learning_rate": 1.937904269081501e-05,
"loss": 1.2205,
"num_input_tokens_seen": 3493664,
"step": 30,
"train_runtime": 322.3163,
"train_tokens_per_second": 10839.242
},
{
"epoch": 0.03985856637737062,
"grad_norm": 2.0718331336975098,
"learning_rate": 1.9353169469598967e-05,
"loss": 1.2168,
"num_input_tokens_seen": 3632128,
"step": 31,
"train_runtime": 351.6221,
"train_tokens_per_second": 10329.636
},
{
"epoch": 0.04114432658309225,
"grad_norm": 1.8790080547332764,
"learning_rate": 1.9327296248382924e-05,
"loss": 1.1357,
"num_input_tokens_seen": 3740256,
"step": 32,
"train_runtime": 360.9507,
"train_tokens_per_second": 10362.236
},
{
"epoch": 0.04243008678881389,
"grad_norm": 1.775802731513977,
"learning_rate": 1.9301423027166882e-05,
"loss": 1.1974,
"num_input_tokens_seen": 3836320,
"step": 33,
"train_runtime": 369.242,
"train_tokens_per_second": 10389.716
},
{
"epoch": 0.04371584699453552,
"grad_norm": 1.7465744018554688,
"learning_rate": 1.9275549805950842e-05,
"loss": 1.1552,
"num_input_tokens_seen": 3973216,
"step": 34,
"train_runtime": 381.9458,
"train_tokens_per_second": 10402.566
},
{
"epoch": 0.04500160720025715,
"grad_norm": 1.946832299232483,
"learning_rate": 1.9249676584734803e-05,
"loss": 1.0835,
"num_input_tokens_seen": 4098496,
"step": 35,
"train_runtime": 393.2749,
"train_tokens_per_second": 10421.453
},
{
"epoch": 0.04628736740597879,
"grad_norm": 1.8845430612564087,
"learning_rate": 1.922380336351876e-05,
"loss": 1.2099,
"num_input_tokens_seen": 4211328,
"step": 36,
"train_runtime": 403.0748,
"train_tokens_per_second": 10448.006
},
{
"epoch": 0.04757312761170042,
"grad_norm": 1.9792522192001343,
"learning_rate": 1.9197930142302718e-05,
"loss": 1.1743,
"num_input_tokens_seen": 4354368,
"step": 37,
"train_runtime": 416.1989,
"train_tokens_per_second": 10462.229
},
{
"epoch": 0.04885888781742205,
"grad_norm": 1.7486963272094727,
"learning_rate": 1.9172056921086678e-05,
"loss": 1.1916,
"num_input_tokens_seen": 4459872,
"step": 38,
"train_runtime": 425.2452,
"train_tokens_per_second": 10487.765
},
{
"epoch": 0.05014464802314368,
"grad_norm": 1.8029528856277466,
"learning_rate": 1.9146183699870636e-05,
"loss": 1.2058,
"num_input_tokens_seen": 4586752,
"step": 39,
"train_runtime": 436.5305,
"train_tokens_per_second": 10507.289
},
{
"epoch": 0.05143040822886532,
"grad_norm": 1.6773114204406738,
"learning_rate": 1.9120310478654593e-05,
"loss": 1.171,
"num_input_tokens_seen": 4679744,
"step": 40,
"train_runtime": 444.5403,
"train_tokens_per_second": 10527.152
},
{
"epoch": 0.05271616843458695,
"grad_norm": 2.0230824947357178,
"learning_rate": 1.909443725743855e-05,
"loss": 1.1621,
"num_input_tokens_seen": 4834496,
"step": 41,
"train_runtime": 459.2262,
"train_tokens_per_second": 10527.482
},
{
"epoch": 0.05400192864030858,
"grad_norm": 1.7988804578781128,
"learning_rate": 1.906856403622251e-05,
"loss": 1.1448,
"num_input_tokens_seen": 4924224,
"step": 42,
"train_runtime": 466.8323,
"train_tokens_per_second": 10548.165
},
{
"epoch": 0.05528768884603021,
"grad_norm": 1.8624871969223022,
"learning_rate": 1.904269081500647e-05,
"loss": 1.0607,
"num_input_tokens_seen": 5027584,
"step": 43,
"train_runtime": 475.733,
"train_tokens_per_second": 10568.078
},
{
"epoch": 0.05657344905175185,
"grad_norm": 1.902448296546936,
"learning_rate": 1.901681759379043e-05,
"loss": 1.2209,
"num_input_tokens_seen": 5147008,
"step": 44,
"train_runtime": 486.1981,
"train_tokens_per_second": 10586.237
},
{
"epoch": 0.05785920925747348,
"grad_norm": 1.875640869140625,
"learning_rate": 1.8990944372574386e-05,
"loss": 1.1073,
"num_input_tokens_seen": 5265504,
"step": 45,
"train_runtime": 497.0036,
"train_tokens_per_second": 10594.498
},
{
"epoch": 0.05914496946319511,
"grad_norm": 1.8521565198898315,
"learning_rate": 1.8965071151358347e-05,
"loss": 1.1615,
"num_input_tokens_seen": 5367456,
"step": 46,
"train_runtime": 505.7756,
"train_tokens_per_second": 10612.328
},
{
"epoch": 0.060430729668916744,
"grad_norm": 1.8101763725280762,
"learning_rate": 1.8939197930142304e-05,
"loss": 1.0999,
"num_input_tokens_seen": 5491136,
"step": 47,
"train_runtime": 516.6042,
"train_tokens_per_second": 10629.291
},
{
"epoch": 0.06171648987463838,
"grad_norm": 1.81596040725708,
"learning_rate": 1.8913324708926265e-05,
"loss": 1.0616,
"num_input_tokens_seen": 5608224,
"step": 48,
"train_runtime": 527.1638,
"train_tokens_per_second": 10638.484
},
{
"epoch": 0.06300225008036,
"grad_norm": 1.988157868385315,
"learning_rate": 1.8887451487710222e-05,
"loss": 1.2014,
"num_input_tokens_seen": 5729248,
"step": 49,
"train_runtime": 538.0492,
"train_tokens_per_second": 10648.187
},
{
"epoch": 0.06428801028608165,
"grad_norm": 1.8147128820419312,
"learning_rate": 1.886157826649418e-05,
"loss": 1.0791,
"num_input_tokens_seen": 5888672,
"step": 50,
"train_runtime": 552.8286,
"train_tokens_per_second": 10651.895
},
{
"epoch": 0.06557377049180328,
"grad_norm": 1.8205593824386597,
"learning_rate": 1.883570504527814e-05,
"loss": 1.1579,
"num_input_tokens_seen": 6022656,
"step": 51,
"train_runtime": 565.0367,
"train_tokens_per_second": 10658.875
},
{
"epoch": 0.06685953069752491,
"grad_norm": 1.8702155351638794,
"learning_rate": 1.8809831824062097e-05,
"loss": 1.1736,
"num_input_tokens_seen": 6122848,
"step": 52,
"train_runtime": 573.6417,
"train_tokens_per_second": 10673.646
},
{
"epoch": 0.06814529090324654,
"grad_norm": 2.053255796432495,
"learning_rate": 1.8783958602846054e-05,
"loss": 1.1884,
"num_input_tokens_seen": 6219968,
"step": 53,
"train_runtime": 581.9801,
"train_tokens_per_second": 10687.596
},
{
"epoch": 0.06943105110896818,
"grad_norm": 1.8326001167297363,
"learning_rate": 1.8758085381630015e-05,
"loss": 1.1875,
"num_input_tokens_seen": 6330400,
"step": 54,
"train_runtime": 591.5047,
"train_tokens_per_second": 10702.198
},
{
"epoch": 0.0707168113146898,
"grad_norm": 1.9650863409042358,
"learning_rate": 1.8732212160413976e-05,
"loss": 1.1747,
"num_input_tokens_seen": 6500608,
"step": 55,
"train_runtime": 607.6429,
"train_tokens_per_second": 10698.072
},
{
"epoch": 0.07200257152041144,
"grad_norm": 1.8934389352798462,
"learning_rate": 1.8706338939197933e-05,
"loss": 1.1195,
"num_input_tokens_seen": 6600288,
"step": 56,
"train_runtime": 616.1735,
"train_tokens_per_second": 10711.735
},
{
"epoch": 0.07328833172613308,
"grad_norm": 1.8143988847732544,
"learning_rate": 1.868046571798189e-05,
"loss": 1.1152,
"num_input_tokens_seen": 6713184,
"step": 57,
"train_runtime": 625.8716,
"train_tokens_per_second": 10726.135
},
{
"epoch": 0.07457409193185471,
"grad_norm": 1.8745934963226318,
"learning_rate": 1.8654592496765847e-05,
"loss": 1.1131,
"num_input_tokens_seen": 6854400,
"step": 58,
"train_runtime": 638.8924,
"train_tokens_per_second": 10728.567
},
{
"epoch": 0.07585985213757634,
"grad_norm": 1.8524185419082642,
"learning_rate": 1.8628719275549808e-05,
"loss": 1.0552,
"num_input_tokens_seen": 6951744,
"step": 59,
"train_runtime": 647.376,
"train_tokens_per_second": 10738.341
},
{
"epoch": 0.07714561234329798,
"grad_norm": 1.8481533527374268,
"learning_rate": 1.8602846054333765e-05,
"loss": 1.1928,
"num_input_tokens_seen": 7081184,
"step": 60,
"train_runtime": 659.3929,
"train_tokens_per_second": 10738.945
},
{
"epoch": 0.0784313725490196,
"grad_norm": 1.8214608430862427,
"learning_rate": 1.8576972833117726e-05,
"loss": 1.1535,
"num_input_tokens_seen": 7226528,
"step": 61,
"train_runtime": 688.7221,
"train_tokens_per_second": 10492.661
},
{
"epoch": 0.07971713275474124,
"grad_norm": 1.8268235921859741,
"learning_rate": 1.8551099611901683e-05,
"loss": 1.0817,
"num_input_tokens_seen": 7317344,
"step": 62,
"train_runtime": 696.3751,
"train_tokens_per_second": 10507.762
},
{
"epoch": 0.08100289296046287,
"grad_norm": 1.8014057874679565,
"learning_rate": 1.8525226390685644e-05,
"loss": 1.1799,
"num_input_tokens_seen": 7473824,
"step": 63,
"train_runtime": 711.0738,
"train_tokens_per_second": 10510.616
},
{
"epoch": 0.0822886531661845,
"grad_norm": 1.826602816581726,
"learning_rate": 1.84993531694696e-05,
"loss": 1.1546,
"num_input_tokens_seen": 7575392,
"step": 64,
"train_runtime": 719.8185,
"train_tokens_per_second": 10524.031
},
{
"epoch": 0.08357441337190614,
"grad_norm": 1.7211124897003174,
"learning_rate": 1.847347994825356e-05,
"loss": 1.1899,
"num_input_tokens_seen": 7723680,
"step": 65,
"train_runtime": 733.4703,
"train_tokens_per_second": 10530.324
},
{
"epoch": 0.08486017357762778,
"grad_norm": 1.7656164169311523,
"learning_rate": 1.8447606727037516e-05,
"loss": 1.2178,
"num_input_tokens_seen": 7850144,
"step": 66,
"train_runtime": 745.1189,
"train_tokens_per_second": 10535.425
},
{
"epoch": 0.08614593378334941,
"grad_norm": 1.8083853721618652,
"learning_rate": 1.8421733505821476e-05,
"loss": 1.1542,
"num_input_tokens_seen": 7950752,
"step": 67,
"train_runtime": 753.8917,
"train_tokens_per_second": 10546.278
},
{
"epoch": 0.08743169398907104,
"grad_norm": 1.7961894273757935,
"learning_rate": 1.8395860284605437e-05,
"loss": 1.044,
"num_input_tokens_seen": 8080160,
"step": 68,
"train_runtime": 765.8094,
"train_tokens_per_second": 10551.138
},
{
"epoch": 0.08871745419479267,
"grad_norm": 1.994905710220337,
"learning_rate": 1.8369987063389394e-05,
"loss": 1.1235,
"num_input_tokens_seen": 8218784,
"step": 69,
"train_runtime": 778.4148,
"train_tokens_per_second": 10558.36
},
{
"epoch": 0.0900032144005143,
"grad_norm": 1.9451382160186768,
"learning_rate": 1.834411384217335e-05,
"loss": 1.1517,
"num_input_tokens_seen": 8333600,
"step": 70,
"train_runtime": 788.6364,
"train_tokens_per_second": 10567.1
},
{
"epoch": 0.09128897460623593,
"grad_norm": 1.8312456607818604,
"learning_rate": 1.8318240620957312e-05,
"loss": 1.0547,
"num_input_tokens_seen": 8460128,
"step": 71,
"train_runtime": 799.7803,
"train_tokens_per_second": 10578.065
},
{
"epoch": 0.09257473481195758,
"grad_norm": 1.9686640501022339,
"learning_rate": 1.829236739974127e-05,
"loss": 1.2261,
"num_input_tokens_seen": 8536256,
"step": 72,
"train_runtime": 806.2621,
"train_tokens_per_second": 10587.446
},
{
"epoch": 0.09386049501767921,
"grad_norm": 1.8814424276351929,
"learning_rate": 1.8266494178525227e-05,
"loss": 1.0726,
"num_input_tokens_seen": 8641280,
"step": 73,
"train_runtime": 815.3389,
"train_tokens_per_second": 10598.39
},
{
"epoch": 0.09514625522340084,
"grad_norm": 1.9460242986679077,
"learning_rate": 1.8240620957309187e-05,
"loss": 1.1726,
"num_input_tokens_seen": 8743456,
"step": 74,
"train_runtime": 824.1743,
"train_tokens_per_second": 10608.746
},
{
"epoch": 0.09643201542912247,
"grad_norm": 2.0222864151000977,
"learning_rate": 1.8214747736093145e-05,
"loss": 1.1902,
"num_input_tokens_seen": 8850720,
"step": 75,
"train_runtime": 833.6218,
"train_tokens_per_second": 10617.189
},
{
"epoch": 0.0977177756348441,
"grad_norm": 1.943700909614563,
"learning_rate": 1.8188874514877105e-05,
"loss": 1.1683,
"num_input_tokens_seen": 8990112,
"step": 76,
"train_runtime": 846.3567,
"train_tokens_per_second": 10622.131
},
{
"epoch": 0.09900353584056573,
"grad_norm": 2.1447455883026123,
"learning_rate": 1.8163001293661063e-05,
"loss": 1.1458,
"num_input_tokens_seen": 9074080,
"step": 77,
"train_runtime": 853.5667,
"train_tokens_per_second": 10630.78
},
{
"epoch": 0.10028929604628736,
"grad_norm": 2.0305962562561035,
"learning_rate": 1.813712807244502e-05,
"loss": 1.0369,
"num_input_tokens_seen": 9180160,
"step": 78,
"train_runtime": 862.9817,
"train_tokens_per_second": 10637.723
},
{
"epoch": 0.10028929604628736,
"eval_loss": 1.1576727628707886,
"eval_runtime": 23.0724,
"eval_samples_per_second": 43.082,
"eval_steps_per_second": 1.387,
"num_input_tokens_seen": 9180160,
"step": 78
},
{
"epoch": 0.101575056252009,
"grad_norm": 1.998412847518921,
"learning_rate": 1.8111254851228977e-05,
"loss": 1.145,
"num_input_tokens_seen": 9270560,
"step": 79,
"train_runtime": 893.8501,
"train_tokens_per_second": 10371.492
},
{
"epoch": 0.10286081645773064,
"grad_norm": 1.8889389038085938,
"learning_rate": 1.8085381630012938e-05,
"loss": 1.1677,
"num_input_tokens_seen": 9389504,
"step": 80,
"train_runtime": 904.2477,
"train_tokens_per_second": 10383.774
},
{
"epoch": 0.10414657666345227,
"grad_norm": 1.8141217231750488,
"learning_rate": 1.80595084087969e-05,
"loss": 1.0648,
"num_input_tokens_seen": 9498464,
"step": 81,
"train_runtime": 913.7098,
"train_tokens_per_second": 10395.494
},
{
"epoch": 0.1054323368691739,
"grad_norm": 1.8328213691711426,
"learning_rate": 1.8033635187580856e-05,
"loss": 1.1208,
"num_input_tokens_seen": 9619936,
"step": 82,
"train_runtime": 924.4896,
"train_tokens_per_second": 10405.672
},
{
"epoch": 0.10671809707489553,
"grad_norm": 1.795311689376831,
"learning_rate": 1.8007761966364813e-05,
"loss": 1.0181,
"num_input_tokens_seen": 9726976,
"step": 83,
"train_runtime": 933.8495,
"train_tokens_per_second": 10416.0
},
{
"epoch": 0.10800385728061716,
"grad_norm": 1.8454675674438477,
"learning_rate": 1.7981888745148774e-05,
"loss": 1.0702,
"num_input_tokens_seen": 9828896,
"step": 84,
"train_runtime": 942.6626,
"train_tokens_per_second": 10426.738
},
{
"epoch": 0.1092896174863388,
"grad_norm": 1.9122002124786377,
"learning_rate": 1.795601552393273e-05,
"loss": 1.184,
"num_input_tokens_seen": 10007680,
"step": 85,
"train_runtime": 960.0623,
"train_tokens_per_second": 10423.99
},
{
"epoch": 0.11057537769206043,
"grad_norm": 1.873637318611145,
"learning_rate": 1.7930142302716688e-05,
"loss": 1.1323,
"num_input_tokens_seen": 10161088,
"step": 86,
"train_runtime": 974.6068,
"train_tokens_per_second": 10425.833
},
{
"epoch": 0.11186113789778207,
"grad_norm": 1.7707033157348633,
"learning_rate": 1.790426908150065e-05,
"loss": 1.0968,
"num_input_tokens_seen": 10247072,
"step": 87,
"train_runtime": 981.9572,
"train_tokens_per_second": 10435.355
},
{
"epoch": 0.1131468981035037,
"grad_norm": 1.7864853143692017,
"learning_rate": 1.7878395860284606e-05,
"loss": 1.0646,
"num_input_tokens_seen": 10438112,
"step": 88,
"train_runtime": 1000.9105,
"train_tokens_per_second": 10428.617
},
{
"epoch": 0.11443265830922533,
"grad_norm": 1.8133771419525146,
"learning_rate": 1.7852522639068567e-05,
"loss": 1.0905,
"num_input_tokens_seen": 10559456,
"step": 89,
"train_runtime": 1012.136,
"train_tokens_per_second": 10432.843
},
{
"epoch": 0.11571841851494696,
"grad_norm": 1.854591965675354,
"learning_rate": 1.7826649417852524e-05,
"loss": 1.1079,
"num_input_tokens_seen": 10675840,
"step": 90,
"train_runtime": 1022.5885,
"train_tokens_per_second": 10440.015
},
{
"epoch": 0.1170041787206686,
"grad_norm": 1.7617478370666504,
"learning_rate": 1.780077619663648e-05,
"loss": 1.0203,
"num_input_tokens_seen": 10791936,
"step": 91,
"train_runtime": 1048.7392,
"train_tokens_per_second": 10290.39
},
{
"epoch": 0.11828993892639023,
"grad_norm": 1.9446653127670288,
"learning_rate": 1.7774902975420442e-05,
"loss": 1.097,
"num_input_tokens_seen": 10917536,
"step": 92,
"train_runtime": 1059.9578,
"train_tokens_per_second": 10299.972
},
{
"epoch": 0.11957569913211186,
"grad_norm": 1.8482822179794312,
"learning_rate": 1.7749029754204403e-05,
"loss": 1.1365,
"num_input_tokens_seen": 11021824,
"step": 93,
"train_runtime": 1069.2663,
"train_tokens_per_second": 10307.838
},
{
"epoch": 0.12086145933783349,
"grad_norm": 1.8727803230285645,
"learning_rate": 1.772315653298836e-05,
"loss": 1.1018,
"num_input_tokens_seen": 11159872,
"step": 94,
"train_runtime": 1081.6899,
"train_tokens_per_second": 10317.071
},
{
"epoch": 0.12214721954355513,
"grad_norm": 1.779184341430664,
"learning_rate": 1.7697283311772317e-05,
"loss": 1.0668,
"num_input_tokens_seen": 11258336,
"step": 95,
"train_runtime": 1090.2473,
"train_tokens_per_second": 10326.406
},
{
"epoch": 0.12343297974927676,
"grad_norm": 1.8586459159851074,
"learning_rate": 1.7671410090556274e-05,
"loss": 1.1594,
"num_input_tokens_seen": 11381312,
"step": 96,
"train_runtime": 1101.6291,
"train_tokens_per_second": 10331.347
},
{
"epoch": 0.1247187399549984,
"grad_norm": 1.8665542602539062,
"learning_rate": 1.7645536869340235e-05,
"loss": 1.108,
"num_input_tokens_seen": 11554048,
"step": 97,
"train_runtime": 1118.3041,
"train_tokens_per_second": 10331.759
},
{
"epoch": 0.12600450016072,
"grad_norm": 1.8169111013412476,
"learning_rate": 1.7619663648124192e-05,
"loss": 1.1525,
"num_input_tokens_seen": 11717152,
"step": 98,
"train_runtime": 1134.1337,
"train_tokens_per_second": 10331.367
},
{
"epoch": 0.12729026036644167,
"grad_norm": 1.9255194664001465,
"learning_rate": 1.759379042690815e-05,
"loss": 1.0878,
"num_input_tokens_seen": 11854432,
"step": 99,
"train_runtime": 1146.8016,
"train_tokens_per_second": 10336.951
},
{
"epoch": 0.1285760205721633,
"grad_norm": 1.9415030479431152,
"learning_rate": 1.756791720569211e-05,
"loss": 1.1299,
"num_input_tokens_seen": 11979232,
"step": 100,
"train_runtime": 1158.3947,
"train_tokens_per_second": 10341.235
},
{
"epoch": 0.12986178077788493,
"grad_norm": 1.9196245670318604,
"learning_rate": 1.754204398447607e-05,
"loss": 1.124,
"num_input_tokens_seen": 12144416,
"step": 101,
"train_runtime": 1173.9193,
"train_tokens_per_second": 10345.188
},
{
"epoch": 0.13114754098360656,
"grad_norm": 1.8218384981155396,
"learning_rate": 1.7516170763260028e-05,
"loss": 1.0596,
"num_input_tokens_seen": 12261408,
"step": 102,
"train_runtime": 1184.2447,
"train_tokens_per_second": 10353.779
},
{
"epoch": 0.1324333011893282,
"grad_norm": 1.86562979221344,
"learning_rate": 1.7490297542043985e-05,
"loss": 1.0873,
"num_input_tokens_seen": 12384448,
"step": 103,
"train_runtime": 1194.8569,
"train_tokens_per_second": 10364.796
},
{
"epoch": 0.13371906139504983,
"grad_norm": 1.9434869289398193,
"learning_rate": 1.7464424320827943e-05,
"loss": 1.1354,
"num_input_tokens_seen": 12476352,
"step": 104,
"train_runtime": 1202.6401,
"train_tokens_per_second": 10374.136
},
{
"epoch": 0.13500482160077146,
"grad_norm": 1.9082143306732178,
"learning_rate": 1.7438551099611903e-05,
"loss": 1.0588,
"num_input_tokens_seen": 12562464,
"step": 105,
"train_runtime": 1209.8616,
"train_tokens_per_second": 10383.39
},
{
"epoch": 0.1362905818064931,
"grad_norm": 1.7863415479660034,
"learning_rate": 1.7412677878395864e-05,
"loss": 1.1061,
"num_input_tokens_seen": 12654304,
"step": 106,
"train_runtime": 1217.5491,
"train_tokens_per_second": 10393.26
},
{
"epoch": 0.13757634201221472,
"grad_norm": 1.872205138206482,
"learning_rate": 1.738680465717982e-05,
"loss": 0.9919,
"num_input_tokens_seen": 12782144,
"step": 107,
"train_runtime": 1229.0168,
"train_tokens_per_second": 10400.3
},
{
"epoch": 0.13886210221793635,
"grad_norm": 2.2330684661865234,
"learning_rate": 1.736093143596378e-05,
"loss": 1.1528,
"num_input_tokens_seen": 12899840,
"step": 108,
"train_runtime": 1239.2467,
"train_tokens_per_second": 10409.421
},
{
"epoch": 0.14014786242365798,
"grad_norm": 2.096357822418213,
"learning_rate": 1.733505821474774e-05,
"loss": 1.0917,
"num_input_tokens_seen": 13043392,
"step": 109,
"train_runtime": 1252.1584,
"train_tokens_per_second": 10416.727
},
{
"epoch": 0.1414336226293796,
"grad_norm": 1.9565867185592651,
"learning_rate": 1.7309184993531696e-05,
"loss": 1.0547,
"num_input_tokens_seen": 13188448,
"step": 110,
"train_runtime": 1265.437,
"train_tokens_per_second": 10422.05
},
{
"epoch": 0.14271938283510124,
"grad_norm": 1.9779455661773682,
"learning_rate": 1.7283311772315654e-05,
"loss": 1.0885,
"num_input_tokens_seen": 13275616,
"step": 111,
"train_runtime": 1272.8268,
"train_tokens_per_second": 10430.026
},
{
"epoch": 0.14400514304082287,
"grad_norm": 1.8848296403884888,
"learning_rate": 1.725743855109961e-05,
"loss": 1.0563,
"num_input_tokens_seen": 13401984,
"step": 112,
"train_runtime": 1284.164,
"train_tokens_per_second": 10436.35
},
{
"epoch": 0.1452909032465445,
"grad_norm": 1.8709964752197266,
"learning_rate": 1.723156532988357e-05,
"loss": 1.1049,
"num_input_tokens_seen": 13516096,
"step": 113,
"train_runtime": 1294.3698,
"train_tokens_per_second": 10442.221
},
{
"epoch": 0.14657666345226616,
"grad_norm": 1.7715637683868408,
"learning_rate": 1.7205692108667532e-05,
"loss": 1.0666,
"num_input_tokens_seen": 13608128,
"step": 114,
"train_runtime": 1302.3125,
"train_tokens_per_second": 10449.203
},
{
"epoch": 0.1478624236579878,
"grad_norm": 1.7707303762435913,
"learning_rate": 1.717981888745149e-05,
"loss": 1.035,
"num_input_tokens_seen": 13708288,
"step": 115,
"train_runtime": 1310.8819,
"train_tokens_per_second": 10457.302
},
{
"epoch": 0.14914818386370943,
"grad_norm": 2.0213918685913086,
"learning_rate": 1.7153945666235447e-05,
"loss": 1.1718,
"num_input_tokens_seen": 13832640,
"step": 116,
"train_runtime": 1321.8066,
"train_tokens_per_second": 10464.95
},
{
"epoch": 0.15043394406943106,
"grad_norm": 1.9812514781951904,
"learning_rate": 1.7128072445019407e-05,
"loss": 1.0449,
"num_input_tokens_seen": 13942400,
"step": 117,
"train_runtime": 1331.2362,
"train_tokens_per_second": 10473.273
},
{
"epoch": 0.1517197042751527,
"grad_norm": 1.8844302892684937,
"learning_rate": 1.7102199223803365e-05,
"loss": 1.045,
"num_input_tokens_seen": 14069888,
"step": 118,
"train_runtime": 1342.8933,
"train_tokens_per_second": 10477.294
},
{
"epoch": 0.15300546448087432,
"grad_norm": 1.816438913345337,
"learning_rate": 1.7076326002587325e-05,
"loss": 1.1185,
"num_input_tokens_seen": 14175328,
"step": 119,
"train_runtime": 1352.3432,
"train_tokens_per_second": 10482.049
},
{
"epoch": 0.15429122468659595,
"grad_norm": 1.8164008855819702,
"learning_rate": 1.7050452781371283e-05,
"loss": 1.1141,
"num_input_tokens_seen": 14316736,
"step": 120,
"train_runtime": 1365.1583,
"train_tokens_per_second": 10487.235
},
{
"epoch": 0.15557698489231758,
"grad_norm": 1.9856698513031006,
"learning_rate": 1.702457956015524e-05,
"loss": 1.0548,
"num_input_tokens_seen": 14398720,
"step": 121,
"train_runtime": 1388.1489,
"train_tokens_per_second": 10372.605
},
{
"epoch": 0.1568627450980392,
"grad_norm": 1.7079716920852661,
"learning_rate": 1.69987063389392e-05,
"loss": 1.1154,
"num_input_tokens_seen": 14510944,
"step": 122,
"train_runtime": 1398.0002,
"train_tokens_per_second": 10379.787
},
{
"epoch": 0.15814850530376084,
"grad_norm": 2.0213663578033447,
"learning_rate": 1.6972833117723158e-05,
"loss": 1.1813,
"num_input_tokens_seen": 14627488,
"step": 123,
"train_runtime": 1408.2243,
"train_tokens_per_second": 10387.186
},
{
"epoch": 0.15943426550948248,
"grad_norm": 1.5762097835540771,
"learning_rate": 1.6946959896507115e-05,
"loss": 0.8798,
"num_input_tokens_seen": 14765056,
"step": 124,
"train_runtime": 1420.9688,
"train_tokens_per_second": 10390.838
},
{
"epoch": 0.1607200257152041,
"grad_norm": 1.9591020345687866,
"learning_rate": 1.6921086675291072e-05,
"loss": 1.0846,
"num_input_tokens_seen": 14870688,
"step": 125,
"train_runtime": 1430.1584,
"train_tokens_per_second": 10397.931
},
{
"epoch": 0.16200578592092574,
"grad_norm": 1.9856301546096802,
"learning_rate": 1.6895213454075033e-05,
"loss": 1.1124,
"num_input_tokens_seen": 15003424,
"step": 126,
"train_runtime": 1442.2654,
"train_tokens_per_second": 10402.679
},
{
"epoch": 0.16329154612664737,
"grad_norm": 1.8877084255218506,
"learning_rate": 1.6869340232858994e-05,
"loss": 1.102,
"num_input_tokens_seen": 15167424,
"step": 127,
"train_runtime": 1457.8734,
"train_tokens_per_second": 10403.801
},
{
"epoch": 0.164577306332369,
"grad_norm": 1.8509068489074707,
"learning_rate": 1.684346701164295e-05,
"loss": 1.0739,
"num_input_tokens_seen": 15348224,
"step": 128,
"train_runtime": 1475.0417,
"train_tokens_per_second": 10405.282
},
{
"epoch": 0.16586306653809066,
"grad_norm": 1.9316065311431885,
"learning_rate": 1.6817593790426908e-05,
"loss": 1.1319,
"num_input_tokens_seen": 15459680,
"step": 129,
"train_runtime": 1484.5083,
"train_tokens_per_second": 10414.007
},
{
"epoch": 0.1671488267438123,
"grad_norm": 1.8838239908218384,
"learning_rate": 1.679172056921087e-05,
"loss": 1.1425,
"num_input_tokens_seen": 15599488,
"step": 130,
"train_runtime": 1497.2084,
"train_tokens_per_second": 10419.049
},
{
"epoch": 0.16843458694953392,
"grad_norm": 1.910106897354126,
"learning_rate": 1.6765847347994826e-05,
"loss": 1.1367,
"num_input_tokens_seen": 15693728,
"step": 131,
"train_runtime": 1505.1617,
"train_tokens_per_second": 10426.606
},
{
"epoch": 0.16972034715525555,
"grad_norm": 1.8794375658035278,
"learning_rate": 1.6739974126778787e-05,
"loss": 1.0579,
"num_input_tokens_seen": 15827776,
"step": 132,
"train_runtime": 1517.1331,
"train_tokens_per_second": 10432.688
},
{
"epoch": 0.17100610736097718,
"grad_norm": 1.9578567743301392,
"learning_rate": 1.6714100905562744e-05,
"loss": 0.9833,
"num_input_tokens_seen": 15915456,
"step": 133,
"train_runtime": 1524.5049,
"train_tokens_per_second": 10439.754
},
{
"epoch": 0.17229186756669881,
"grad_norm": 1.8861867189407349,
"learning_rate": 1.66882276843467e-05,
"loss": 1.0137,
"num_input_tokens_seen": 16006112,
"step": 134,
"train_runtime": 1532.0904,
"train_tokens_per_second": 10447.237
},
{
"epoch": 0.17357762777242045,
"grad_norm": 1.8860288858413696,
"learning_rate": 1.6662354463130662e-05,
"loss": 1.1243,
"num_input_tokens_seen": 16105472,
"step": 135,
"train_runtime": 1540.4944,
"train_tokens_per_second": 10454.742
},
{
"epoch": 0.17486338797814208,
"grad_norm": 1.7597628831863403,
"learning_rate": 1.663648124191462e-05,
"loss": 1.065,
"num_input_tokens_seen": 16227296,
"step": 136,
"train_runtime": 1551.1796,
"train_tokens_per_second": 10461.262
},
{
"epoch": 0.1761491481838637,
"grad_norm": 1.8316805362701416,
"learning_rate": 1.6610608020698577e-05,
"loss": 1.0799,
"num_input_tokens_seen": 16327072,
"step": 137,
"train_runtime": 1559.8785,
"train_tokens_per_second": 10466.887
},
{
"epoch": 0.17743490838958534,
"grad_norm": 1.965746283531189,
"learning_rate": 1.6584734799482537e-05,
"loss": 1.1353,
"num_input_tokens_seen": 16424576,
"step": 138,
"train_runtime": 1568.1636,
"train_tokens_per_second": 10473.764
},
{
"epoch": 0.17872066859530697,
"grad_norm": 1.7702914476394653,
"learning_rate": 1.6558861578266498e-05,
"loss": 1.1117,
"num_input_tokens_seen": 16573120,
"step": 139,
"train_runtime": 1581.7542,
"train_tokens_per_second": 10477.684
},
{
"epoch": 0.1800064288010286,
"grad_norm": 1.8150639533996582,
"learning_rate": 1.6532988357050455e-05,
"loss": 1.129,
"num_input_tokens_seen": 16669440,
"step": 140,
"train_runtime": 1589.8087,
"train_tokens_per_second": 10485.186
},
{
"epoch": 0.18129218900675023,
"grad_norm": 1.8353360891342163,
"learning_rate": 1.6507115135834412e-05,
"loss": 1.1148,
"num_input_tokens_seen": 16771040,
"step": 141,
"train_runtime": 1598.5428,
"train_tokens_per_second": 10491.455
},
{
"epoch": 0.18257794921247186,
"grad_norm": 2.064567804336548,
"learning_rate": 1.648124191461837e-05,
"loss": 1.0626,
"num_input_tokens_seen": 16902048,
"step": 142,
"train_runtime": 1609.9524,
"train_tokens_per_second": 10498.477
},
{
"epoch": 0.1838637094181935,
"grad_norm": 1.8049488067626953,
"learning_rate": 1.645536869340233e-05,
"loss": 1.1076,
"num_input_tokens_seen": 17043808,
"step": 143,
"train_runtime": 1622.5917,
"train_tokens_per_second": 10504.064
},
{
"epoch": 0.18514946962391515,
"grad_norm": 1.751596212387085,
"learning_rate": 1.6429495472186288e-05,
"loss": 1.0649,
"num_input_tokens_seen": 17140096,
"step": 144,
"train_runtime": 1630.7355,
"train_tokens_per_second": 10510.653
},
{
"epoch": 0.18643522982963678,
"grad_norm": 1.855686068534851,
"learning_rate": 1.6403622250970248e-05,
"loss": 1.1758,
"num_input_tokens_seen": 17238624,
"step": 145,
"train_runtime": 1639.2446,
"train_tokens_per_second": 10516.2
},
{
"epoch": 0.18772099003535841,
"grad_norm": 1.9099684953689575,
"learning_rate": 1.6377749029754206e-05,
"loss": 1.0719,
"num_input_tokens_seen": 17360128,
"step": 146,
"train_runtime": 1650.2244,
"train_tokens_per_second": 10519.859
},
{
"epoch": 0.18900675024108005,
"grad_norm": 1.8072643280029297,
"learning_rate": 1.6351875808538166e-05,
"loss": 1.1247,
"num_input_tokens_seen": 17494240,
"step": 147,
"train_runtime": 1662.4473,
"train_tokens_per_second": 10523.185
},
{
"epoch": 0.19029251044680168,
"grad_norm": 1.864859938621521,
"learning_rate": 1.6326002587322123e-05,
"loss": 1.0562,
"num_input_tokens_seen": 17584160,
"step": 148,
"train_runtime": 1670.1325,
"train_tokens_per_second": 10528.602
},
{
"epoch": 0.1915782706525233,
"grad_norm": 1.8772127628326416,
"learning_rate": 1.630012936610608e-05,
"loss": 1.0535,
"num_input_tokens_seen": 17670144,
"step": 149,
"train_runtime": 1677.3621,
"train_tokens_per_second": 10534.484
},
{
"epoch": 0.19286403085824494,
"grad_norm": 1.7363184690475464,
"learning_rate": 1.6274256144890038e-05,
"loss": 1.0541,
"num_input_tokens_seen": 17771456,
"step": 150,
"train_runtime": 1686.1324,
"train_tokens_per_second": 10539.775
},
{
"epoch": 0.19414979106396657,
"grad_norm": 1.9292726516723633,
"learning_rate": 1.6248382923674e-05,
"loss": 1.186,
"num_input_tokens_seen": 17875200,
"step": 151,
"train_runtime": 1711.1828,
"train_tokens_per_second": 10446.108
},
{
"epoch": 0.1954355512696882,
"grad_norm": 1.8201920986175537,
"learning_rate": 1.622250970245796e-05,
"loss": 1.0198,
"num_input_tokens_seen": 17978048,
"step": 152,
"train_runtime": 1719.8774,
"train_tokens_per_second": 10453.098
},
{
"epoch": 0.19672131147540983,
"grad_norm": 1.9103111028671265,
"learning_rate": 1.6196636481241917e-05,
"loss": 1.0822,
"num_input_tokens_seen": 18092224,
"step": 153,
"train_runtime": 1730.076,
"train_tokens_per_second": 10457.473
},
{
"epoch": 0.19800707168113146,
"grad_norm": 1.990533709526062,
"learning_rate": 1.6170763260025874e-05,
"loss": 1.1262,
"num_input_tokens_seen": 18180064,
"step": 154,
"train_runtime": 1737.4747,
"train_tokens_per_second": 10463.499
},
{
"epoch": 0.1992928318868531,
"grad_norm": 1.7888742685317993,
"learning_rate": 1.6144890038809835e-05,
"loss": 1.1955,
"num_input_tokens_seen": 18265056,
"step": 155,
"train_runtime": 1744.6485,
"train_tokens_per_second": 10469.19
},
{
"epoch": 0.20057859209257473,
"grad_norm": 1.7337497472763062,
"learning_rate": 1.6119016817593792e-05,
"loss": 1.0541,
"num_input_tokens_seen": 18367328,
"step": 156,
"train_runtime": 1753.372,
"train_tokens_per_second": 10475.431
},
{
"epoch": 0.20057859209257473,
"eval_loss": 1.1330561637878418,
"eval_runtime": 22.3584,
"eval_samples_per_second": 44.458,
"eval_steps_per_second": 1.431,
"num_input_tokens_seen": 18367328,
"step": 156
},
{
"epoch": 0.20186435229829636,
"grad_norm": 1.760105848312378,
"learning_rate": 1.609314359637775e-05,
"loss": 1.092,
"num_input_tokens_seen": 18469024,
"step": 157,
"train_runtime": 1784.5882,
"train_tokens_per_second": 10349.179
},
{
"epoch": 0.203150112504018,
"grad_norm": 2.001173496246338,
"learning_rate": 1.606727037516171e-05,
"loss": 1.15,
"num_input_tokens_seen": 18603648,
"step": 158,
"train_runtime": 1796.907,
"train_tokens_per_second": 10353.15
},
{
"epoch": 0.20443587270973965,
"grad_norm": 1.806795358657837,
"learning_rate": 1.6041397153945667e-05,
"loss": 1.024,
"num_input_tokens_seen": 18693536,
"step": 159,
"train_runtime": 1804.6539,
"train_tokens_per_second": 10358.516
},
{
"epoch": 0.20572163291546128,
"grad_norm": 1.9059035778045654,
"learning_rate": 1.6015523932729628e-05,
"loss": 1.1534,
"num_input_tokens_seen": 18854592,
"step": 160,
"train_runtime": 1819.9574,
"train_tokens_per_second": 10359.908
},
{
"epoch": 0.2070073931211829,
"grad_norm": 1.902287483215332,
"learning_rate": 1.5989650711513585e-05,
"loss": 0.9808,
"num_input_tokens_seen": 18972384,
"step": 161,
"train_runtime": 1830.4631,
"train_tokens_per_second": 10364.8
},
{
"epoch": 0.20829315332690454,
"grad_norm": 1.9465879201889038,
"learning_rate": 1.5963777490297542e-05,
"loss": 1.1595,
"num_input_tokens_seen": 19119424,
"step": 162,
"train_runtime": 1844.4228,
"train_tokens_per_second": 10366.075
},
{
"epoch": 0.20957891353262617,
"grad_norm": 1.8765859603881836,
"learning_rate": 1.59379042690815e-05,
"loss": 1.1413,
"num_input_tokens_seen": 19229984,
"step": 163,
"train_runtime": 1854.1827,
"train_tokens_per_second": 10371.138
},
{
"epoch": 0.2108646737383478,
"grad_norm": 1.9399867057800293,
"learning_rate": 1.591203104786546e-05,
"loss": 1.0859,
"num_input_tokens_seen": 19334016,
"step": 164,
"train_runtime": 1863.2733,
"train_tokens_per_second": 10376.372
},
{
"epoch": 0.21215043394406943,
"grad_norm": 1.999969244003296,
"learning_rate": 1.588615782664942e-05,
"loss": 1.1394,
"num_input_tokens_seen": 19501312,
"step": 165,
"train_runtime": 1879.0538,
"train_tokens_per_second": 10378.261
},
{
"epoch": 0.21343619414979106,
"grad_norm": 1.8910810947418213,
"learning_rate": 1.5860284605433378e-05,
"loss": 0.9774,
"num_input_tokens_seen": 19602976,
"step": 166,
"train_runtime": 1887.7727,
"train_tokens_per_second": 10384.182
},
{
"epoch": 0.2147219543555127,
"grad_norm": 1.824230432510376,
"learning_rate": 1.5834411384217335e-05,
"loss": 1.0689,
"num_input_tokens_seen": 19727904,
"step": 167,
"train_runtime": 1898.9411,
"train_tokens_per_second": 10388.897
},
{
"epoch": 0.21600771456123433,
"grad_norm": 1.9098621606826782,
"learning_rate": 1.5808538163001296e-05,
"loss": 1.069,
"num_input_tokens_seen": 19844096,
"step": 168,
"train_runtime": 1909.7001,
"train_tokens_per_second": 10391.211
},
{
"epoch": 0.21729347476695596,
"grad_norm": 1.773947834968567,
"learning_rate": 1.5782664941785253e-05,
"loss": 1.0426,
"num_input_tokens_seen": 19969248,
"step": 169,
"train_runtime": 1920.8606,
"train_tokens_per_second": 10395.99
},
{
"epoch": 0.2185792349726776,
"grad_norm": 1.7338457107543945,
"learning_rate": 1.575679172056921e-05,
"loss": 1.0428,
"num_input_tokens_seen": 20165376,
"step": 170,
"train_runtime": 1940.1892,
"train_tokens_per_second": 10393.51
},
{
"epoch": 0.21986499517839922,
"grad_norm": 1.7944598197937012,
"learning_rate": 1.573091849935317e-05,
"loss": 1.1008,
"num_input_tokens_seen": 20282464,
"step": 171,
"train_runtime": 1950.6375,
"train_tokens_per_second": 10397.864
},
{
"epoch": 0.22115075538412085,
"grad_norm": 1.7881031036376953,
"learning_rate": 1.570504527813713e-05,
"loss": 1.0998,
"num_input_tokens_seen": 20414304,
"step": 172,
"train_runtime": 1962.9682,
"train_tokens_per_second": 10399.712
},
{
"epoch": 0.22243651558984248,
"grad_norm": 1.8311177492141724,
"learning_rate": 1.567917205692109e-05,
"loss": 1.1359,
"num_input_tokens_seen": 20524000,
"step": 173,
"train_runtime": 1972.6273,
"train_tokens_per_second": 10404.398
},
{
"epoch": 0.22372227579556414,
"grad_norm": 1.774649739265442,
"learning_rate": 1.5653298835705046e-05,
"loss": 1.1199,
"num_input_tokens_seen": 20615872,
"step": 174,
"train_runtime": 1980.5452,
"train_tokens_per_second": 10409.191
},
{
"epoch": 0.22500803600128577,
"grad_norm": 1.8202511072158813,
"learning_rate": 1.5627425614489004e-05,
"loss": 1.1552,
"num_input_tokens_seen": 20737184,
"step": 175,
"train_runtime": 1991.4125,
"train_tokens_per_second": 10413.304
},
{
"epoch": 0.2262937962070074,
"grad_norm": 1.8184281587600708,
"learning_rate": 1.5601552393272964e-05,
"loss": 1.0945,
"num_input_tokens_seen": 20871712,
"step": 176,
"train_runtime": 2003.8054,
"train_tokens_per_second": 10416.038
},
{
"epoch": 0.22757955641272903,
"grad_norm": 2.0196473598480225,
"learning_rate": 1.5575679172056925e-05,
"loss": 1.0248,
"num_input_tokens_seen": 21029760,
"step": 177,
"train_runtime": 2018.6807,
"train_tokens_per_second": 10417.576
},
{
"epoch": 0.22886531661845066,
"grad_norm": 1.8468624353408813,
"learning_rate": 1.5549805950840882e-05,
"loss": 1.1439,
"num_input_tokens_seen": 21118112,
"step": 178,
"train_runtime": 2026.2014,
"train_tokens_per_second": 10422.514
},
{
"epoch": 0.2301510768241723,
"grad_norm": 2.0327556133270264,
"learning_rate": 1.552393272962484e-05,
"loss": 1.0553,
"num_input_tokens_seen": 21217408,
"step": 179,
"train_runtime": 2034.8324,
"train_tokens_per_second": 10427.104
},
{
"epoch": 0.23143683702989393,
"grad_norm": 1.9502851963043213,
"learning_rate": 1.5498059508408797e-05,
"loss": 1.0866,
"num_input_tokens_seen": 21328928,
"step": 180,
"train_runtime": 2044.8024,
"train_tokens_per_second": 10430.802
},
{
"epoch": 0.23272259723561556,
"grad_norm": 1.8489340543746948,
"learning_rate": 1.5472186287192757e-05,
"loss": 1.1345,
"num_input_tokens_seen": 21433248,
"step": 181,
"train_runtime": 2072.5697,
"train_tokens_per_second": 10341.388
},
{
"epoch": 0.2340083574413372,
"grad_norm": 2.063244104385376,
"learning_rate": 1.5446313065976715e-05,
"loss": 1.0425,
"num_input_tokens_seen": 21543552,
"step": 182,
"train_runtime": 2082.003,
"train_tokens_per_second": 10347.513
},
{
"epoch": 0.23529411764705882,
"grad_norm": 1.8250895738601685,
"learning_rate": 1.5420439844760672e-05,
"loss": 1.1022,
"num_input_tokens_seen": 21631584,
"step": 183,
"train_runtime": 2089.5086,
"train_tokens_per_second": 10352.474
},
{
"epoch": 0.23657987785278045,
"grad_norm": 1.8058557510375977,
"learning_rate": 1.5394566623544633e-05,
"loss": 1.1283,
"num_input_tokens_seen": 21732768,
"step": 184,
"train_runtime": 2098.3876,
"train_tokens_per_second": 10356.889
},
{
"epoch": 0.23786563805850208,
"grad_norm": 1.8823782205581665,
"learning_rate": 1.5368693402328593e-05,
"loss": 1.0454,
"num_input_tokens_seen": 21847392,
"step": 185,
"train_runtime": 2108.5281,
"train_tokens_per_second": 10361.442
},
{
"epoch": 0.2391513982642237,
"grad_norm": 1.9651679992675781,
"learning_rate": 1.534282018111255e-05,
"loss": 1.1543,
"num_input_tokens_seen": 21969408,
"step": 186,
"train_runtime": 2119.7121,
"train_tokens_per_second": 10364.336
},
{
"epoch": 0.24043715846994534,
"grad_norm": 1.9040675163269043,
"learning_rate": 1.5316946959896508e-05,
"loss": 1.1195,
"num_input_tokens_seen": 22082176,
"step": 187,
"train_runtime": 2129.7977,
"train_tokens_per_second": 10368.204
},
{
"epoch": 0.24172291867566698,
"grad_norm": 1.8690330982208252,
"learning_rate": 1.5291073738680465e-05,
"loss": 1.1459,
"num_input_tokens_seen": 22172480,
"step": 188,
"train_runtime": 2137.5122,
"train_tokens_per_second": 10373.031
},
{
"epoch": 0.24300867888138863,
"grad_norm": 1.873816967010498,
"learning_rate": 1.5265200517464426e-05,
"loss": 1.1256,
"num_input_tokens_seen": 22305728,
"step": 189,
"train_runtime": 2149.436,
"train_tokens_per_second": 10377.479
},
{
"epoch": 0.24429443908711027,
"grad_norm": 1.936040997505188,
"learning_rate": 1.5239327296248385e-05,
"loss": 1.0522,
"num_input_tokens_seen": 22460672,
"step": 190,
"train_runtime": 2163.9753,
"train_tokens_per_second": 10379.357
},
{
"epoch": 0.2455801992928319,
"grad_norm": 1.8445260524749756,
"learning_rate": 1.5213454075032344e-05,
"loss": 1.1412,
"num_input_tokens_seen": 22556352,
"step": 191,
"train_runtime": 2172.3429,
"train_tokens_per_second": 10383.421
},
{
"epoch": 0.24686595949855353,
"grad_norm": 1.9163671731948853,
"learning_rate": 1.5187580853816301e-05,
"loss": 1.1672,
"num_input_tokens_seen": 22662624,
"step": 192,
"train_runtime": 2181.6935,
"train_tokens_per_second": 10387.63
},
{
"epoch": 0.24815171970427516,
"grad_norm": 2.0177226066589355,
"learning_rate": 1.516170763260026e-05,
"loss": 1.1193,
"num_input_tokens_seen": 22789664,
"step": 193,
"train_runtime": 2193.5134,
"train_tokens_per_second": 10389.571
},
{
"epoch": 0.2494374799099968,
"grad_norm": 1.8356866836547852,
"learning_rate": 1.5135834411384219e-05,
"loss": 1.1705,
"num_input_tokens_seen": 22878816,
"step": 194,
"train_runtime": 2201.1512,
"train_tokens_per_second": 10394.023
},
{
"epoch": 0.2507232401157184,
"grad_norm": 1.9464590549468994,
"learning_rate": 1.5109961190168176e-05,
"loss": 1.2413,
"num_input_tokens_seen": 23036256,
"step": 195,
"train_runtime": 2216.0262,
"train_tokens_per_second": 10395.299
},
{
"epoch": 0.25200900032144,
"grad_norm": 1.9846364259719849,
"learning_rate": 1.5084087968952135e-05,
"loss": 1.1349,
"num_input_tokens_seen": 23113184,
"step": 196,
"train_runtime": 2222.6223,
"train_tokens_per_second": 10399.061
},
{
"epoch": 0.2532947605271617,
"grad_norm": 1.921323537826538,
"learning_rate": 1.5058214747736096e-05,
"loss": 1.0196,
"num_input_tokens_seen": 23227616,
"step": 197,
"train_runtime": 2232.9722,
"train_tokens_per_second": 10402.107
},
{
"epoch": 0.25458052073288334,
"grad_norm": 1.7825725078582764,
"learning_rate": 1.5032341526520053e-05,
"loss": 1.0327,
"num_input_tokens_seen": 23394208,
"step": 198,
"train_runtime": 2249.1819,
"train_tokens_per_second": 10401.208
},
{
"epoch": 0.255866280938605,
"grad_norm": 2.1068551540374756,
"learning_rate": 1.5006468305304012e-05,
"loss": 1.0875,
"num_input_tokens_seen": 23528416,
"step": 199,
"train_runtime": 2261.1565,
"train_tokens_per_second": 10405.479
},
{
"epoch": 0.2571520411443266,
"grad_norm": 1.8937175273895264,
"learning_rate": 1.498059508408797e-05,
"loss": 1.0898,
"num_input_tokens_seen": 23670240,
"step": 200,
"train_runtime": 2274.3795,
"train_tokens_per_second": 10407.34
},
{
"epoch": 0.25843780135004824,
"grad_norm": 1.8117809295654297,
"learning_rate": 1.4954721862871928e-05,
"loss": 0.98,
"num_input_tokens_seen": 23795712,
"step": 201,
"train_runtime": 2285.6253,
"train_tokens_per_second": 10411.029
},
{
"epoch": 0.25972356155576987,
"grad_norm": 1.9877797365188599,
"learning_rate": 1.4928848641655887e-05,
"loss": 1.1332,
"num_input_tokens_seen": 23913248,
"step": 202,
"train_runtime": 2295.9518,
"train_tokens_per_second": 10415.396
},
{
"epoch": 0.2610093217614915,
"grad_norm": 1.832665205001831,
"learning_rate": 1.4902975420439846e-05,
"loss": 1.0939,
"num_input_tokens_seen": 24017152,
"step": 203,
"train_runtime": 2305.1109,
"train_tokens_per_second": 10419.088
},
{
"epoch": 0.26229508196721313,
"grad_norm": 1.8349584341049194,
"learning_rate": 1.4877102199223805e-05,
"loss": 1.1451,
"num_input_tokens_seen": 24132384,
"step": 204,
"train_runtime": 2315.2627,
"train_tokens_per_second": 10423.173
},
{
"epoch": 0.26358084217293476,
"grad_norm": 1.8495604991912842,
"learning_rate": 1.4851228978007764e-05,
"loss": 1.0344,
"num_input_tokens_seen": 24217024,
"step": 205,
"train_runtime": 2322.5078,
"train_tokens_per_second": 10427.101
},
{
"epoch": 0.2648666023786564,
"grad_norm": 1.7923839092254639,
"learning_rate": 1.4825355756791721e-05,
"loss": 1.0408,
"num_input_tokens_seen": 24329984,
"step": 206,
"train_runtime": 2332.827,
"train_tokens_per_second": 10429.399
},
{
"epoch": 0.266152362584378,
"grad_norm": 1.8214589357376099,
"learning_rate": 1.479948253557568e-05,
"loss": 1.091,
"num_input_tokens_seen": 24451776,
"step": 207,
"train_runtime": 2343.5108,
"train_tokens_per_second": 10433.823
},
{
"epoch": 0.26743812279009965,
"grad_norm": 1.9028258323669434,
"learning_rate": 1.4773609314359637e-05,
"loss": 1.1523,
"num_input_tokens_seen": 24630016,
"step": 208,
"train_runtime": 2360.69,
"train_tokens_per_second": 10433.397
},
{
"epoch": 0.2687238829958213,
"grad_norm": 1.80238676071167,
"learning_rate": 1.4747736093143598e-05,
"loss": 1.0408,
"num_input_tokens_seen": 24752800,
"step": 209,
"train_runtime": 2371.5796,
"train_tokens_per_second": 10437.263
},
{
"epoch": 0.2700096432015429,
"grad_norm": 1.8515748977661133,
"learning_rate": 1.4721862871927557e-05,
"loss": 1.0605,
"num_input_tokens_seen": 24844864,
"step": 210,
"train_runtime": 2379.4213,
"train_tokens_per_second": 10441.557
},
{
"epoch": 0.27129540340726455,
"grad_norm": 1.831057071685791,
"learning_rate": 1.4695989650711514e-05,
"loss": 1.074,
"num_input_tokens_seen": 25002304,
"step": 211,
"train_runtime": 2412.4948,
"train_tokens_per_second": 10363.672
},
{
"epoch": 0.2725811636129862,
"grad_norm": 2.014904260635376,
"learning_rate": 1.4670116429495473e-05,
"loss": 1.1354,
"num_input_tokens_seen": 25133536,
"step": 212,
"train_runtime": 2424.3186,
"train_tokens_per_second": 10367.258
},
{
"epoch": 0.2738669238187078,
"grad_norm": 1.9899771213531494,
"learning_rate": 1.4644243208279432e-05,
"loss": 1.0888,
"num_input_tokens_seen": 25302464,
"step": 213,
"train_runtime": 2440.569,
"train_tokens_per_second": 10367.445
},
{
"epoch": 0.27515268402442944,
"grad_norm": 1.9485491514205933,
"learning_rate": 1.461836998706339e-05,
"loss": 1.0257,
"num_input_tokens_seen": 25400640,
"step": 214,
"train_runtime": 2449.2043,
"train_tokens_per_second": 10370.976
},
{
"epoch": 0.27643844423015107,
"grad_norm": 1.7471483945846558,
"learning_rate": 1.4592496765847349e-05,
"loss": 0.9967,
"num_input_tokens_seen": 25491296,
"step": 215,
"train_runtime": 2456.9876,
"train_tokens_per_second": 10375.02
},
{
"epoch": 0.2777242044358727,
"grad_norm": 1.8240132331848145,
"learning_rate": 1.456662354463131e-05,
"loss": 1.0384,
"num_input_tokens_seen": 25584320,
"step": 216,
"train_runtime": 2464.9704,
"train_tokens_per_second": 10379.159
},
{
"epoch": 0.27900996464159433,
"grad_norm": 1.8008581399917603,
"learning_rate": 1.4540750323415266e-05,
"loss": 1.0473,
"num_input_tokens_seen": 25675328,
"step": 217,
"train_runtime": 2472.784,
"train_tokens_per_second": 10383.166
},
{
"epoch": 0.28029572484731596,
"grad_norm": 1.8560556173324585,
"learning_rate": 1.4514877102199225e-05,
"loss": 1.0333,
"num_input_tokens_seen": 25761216,
"step": 218,
"train_runtime": 2480.13,
"train_tokens_per_second": 10387.043
},
{
"epoch": 0.2815814850530376,
"grad_norm": 1.9014114141464233,
"learning_rate": 1.4489003880983183e-05,
"loss": 1.1028,
"num_input_tokens_seen": 25890592,
"step": 219,
"train_runtime": 2491.8423,
"train_tokens_per_second": 10390.141
},
{
"epoch": 0.2828672452587592,
"grad_norm": 1.8335984945297241,
"learning_rate": 1.4463130659767142e-05,
"loss": 1.045,
"num_input_tokens_seen": 25970880,
"step": 220,
"train_runtime": 2498.6975,
"train_tokens_per_second": 10393.767
},
{
"epoch": 0.28415300546448086,
"grad_norm": 1.9171757698059082,
"learning_rate": 1.44372574385511e-05,
"loss": 1.074,
"num_input_tokens_seen": 26051808,
"step": 221,
"train_runtime": 2505.5849,
"train_tokens_per_second": 10397.496
},
{
"epoch": 0.2854387656702025,
"grad_norm": 1.849561333656311,
"learning_rate": 1.4411384217335061e-05,
"loss": 1.0662,
"num_input_tokens_seen": 26163232,
"step": 222,
"train_runtime": 2515.3859,
"train_tokens_per_second": 10401.28
},
{
"epoch": 0.2867245258759241,
"grad_norm": 1.886615514755249,
"learning_rate": 1.4385510996119019e-05,
"loss": 1.1053,
"num_input_tokens_seen": 26257664,
"step": 223,
"train_runtime": 2523.536,
"train_tokens_per_second": 10405.108
},
{
"epoch": 0.28801028608164575,
"grad_norm": 1.7920629978179932,
"learning_rate": 1.4359637774902977e-05,
"loss": 1.0041,
"num_input_tokens_seen": 26368288,
"step": 224,
"train_runtime": 2533.3464,
"train_tokens_per_second": 10408.481
},
{
"epoch": 0.2892960462873674,
"grad_norm": 1.9786632061004639,
"learning_rate": 1.4333764553686935e-05,
"loss": 1.1993,
"num_input_tokens_seen": 26482400,
"step": 225,
"train_runtime": 2543.3441,
"train_tokens_per_second": 10412.433
},
{
"epoch": 0.290581806493089,
"grad_norm": 1.9302722215652466,
"learning_rate": 1.4307891332470894e-05,
"loss": 1.0486,
"num_input_tokens_seen": 26580512,
"step": 226,
"train_runtime": 2551.839,
"train_tokens_per_second": 10416.218
},
{
"epoch": 0.2918675666988107,
"grad_norm": 1.7275605201721191,
"learning_rate": 1.4282018111254851e-05,
"loss": 0.9721,
"num_input_tokens_seen": 26699392,
"step": 227,
"train_runtime": 2562.4385,
"train_tokens_per_second": 10419.525
},
{
"epoch": 0.29315332690453233,
"grad_norm": 1.8996021747589111,
"learning_rate": 1.425614489003881e-05,
"loss": 1.0883,
"num_input_tokens_seen": 26856992,
"step": 228,
"train_runtime": 2577.1118,
"train_tokens_per_second": 10421.353
},
{
"epoch": 0.29443908711025396,
"grad_norm": 1.8853155374526978,
"learning_rate": 1.423027166882277e-05,
"loss": 1.0271,
"num_input_tokens_seen": 26964960,
"step": 229,
"train_runtime": 2586.5183,
"train_tokens_per_second": 10425.196
},
{
"epoch": 0.2957248473159756,
"grad_norm": 1.9568660259246826,
"learning_rate": 1.4204398447606728e-05,
"loss": 1.0765,
"num_input_tokens_seen": 27099008,
"step": 230,
"train_runtime": 2599.0806,
"train_tokens_per_second": 10426.382
},
{
"epoch": 0.2970106075216972,
"grad_norm": 1.8366093635559082,
"learning_rate": 1.4178525226390687e-05,
"loss": 1.0547,
"num_input_tokens_seen": 27213760,
"step": 231,
"train_runtime": 2609.5848,
"train_tokens_per_second": 10428.387
},
{
"epoch": 0.29829636772741885,
"grad_norm": 1.8327536582946777,
"learning_rate": 1.4152652005174646e-05,
"loss": 1.0903,
"num_input_tokens_seen": 27297344,
"step": 232,
"train_runtime": 2616.7236,
"train_tokens_per_second": 10431.879
},
{
"epoch": 0.2995821279331405,
"grad_norm": 1.8904881477355957,
"learning_rate": 1.4126778783958603e-05,
"loss": 1.0861,
"num_input_tokens_seen": 27426688,
"step": 233,
"train_runtime": 2628.7609,
"train_tokens_per_second": 10433.314
},
{
"epoch": 0.3008678881388621,
"grad_norm": 1.99700927734375,
"learning_rate": 1.4100905562742562e-05,
"loss": 1.0771,
"num_input_tokens_seen": 27563648,
"step": 234,
"train_runtime": 2641.4168,
"train_tokens_per_second": 10435.176
},
{
"epoch": 0.3008678881388621,
"eval_loss": 1.1202009916305542,
"eval_runtime": 22.3846,
"eval_samples_per_second": 44.406,
"eval_steps_per_second": 1.43,
"num_input_tokens_seen": 27563648,
"step": 234
},
{
"epoch": 0.30215364834458375,
"grad_norm": 1.886243462562561,
"learning_rate": 1.4075032341526523e-05,
"loss": 1.0186,
"num_input_tokens_seen": 27753376,
"step": 235,
"train_runtime": 2682.2789,
"train_tokens_per_second": 10346.939
},
{
"epoch": 0.3034394085503054,
"grad_norm": 1.8130700588226318,
"learning_rate": 1.404915912031048e-05,
"loss": 1.0335,
"num_input_tokens_seen": 27868672,
"step": 236,
"train_runtime": 2692.3246,
"train_tokens_per_second": 10351.156
},
{
"epoch": 0.304725168756027,
"grad_norm": 1.870937466621399,
"learning_rate": 1.4023285899094439e-05,
"loss": 1.036,
"num_input_tokens_seen": 27970848,
"step": 237,
"train_runtime": 2701.1905,
"train_tokens_per_second": 10355.008
},
{
"epoch": 0.30601092896174864,
"grad_norm": 1.9421213865280151,
"learning_rate": 1.3997412677878396e-05,
"loss": 1.0861,
"num_input_tokens_seen": 28103104,
"step": 238,
"train_runtime": 2713.4976,
"train_tokens_per_second": 10356.783
},
{
"epoch": 0.30729668916747027,
"grad_norm": 2.0607948303222656,
"learning_rate": 1.3971539456662355e-05,
"loss": 1.1563,
"num_input_tokens_seen": 28200704,
"step": 239,
"train_runtime": 2721.862,
"train_tokens_per_second": 10360.813
},
{
"epoch": 0.3085824493731919,
"grad_norm": 1.9641258716583252,
"learning_rate": 1.3945666235446314e-05,
"loss": 1.0857,
"num_input_tokens_seen": 28301088,
"step": 240,
"train_runtime": 2730.5823,
"train_tokens_per_second": 10364.488
},
{
"epoch": 0.30986820957891353,
"grad_norm": 1.7765169143676758,
"learning_rate": 1.3919793014230271e-05,
"loss": 1.17,
"num_input_tokens_seen": 28407104,
"step": 241,
"train_runtime": 2757.845,
"train_tokens_per_second": 10300.472
},
{
"epoch": 0.31115396978463516,
"grad_norm": 1.8327834606170654,
"learning_rate": 1.3893919793014232e-05,
"loss": 1.1576,
"num_input_tokens_seen": 28551616,
"step": 242,
"train_runtime": 2770.8246,
"train_tokens_per_second": 10304.375
},
{
"epoch": 0.3124397299903568,
"grad_norm": 1.8959366083145142,
"learning_rate": 1.3868046571798191e-05,
"loss": 1.1029,
"num_input_tokens_seen": 28676992,
"step": 243,
"train_runtime": 2781.7813,
"train_tokens_per_second": 10308.859
},
{
"epoch": 0.3137254901960784,
"grad_norm": 1.906044840812683,
"learning_rate": 1.3842173350582148e-05,
"loss": 1.0936,
"num_input_tokens_seen": 28808192,
"step": 244,
"train_runtime": 2793.4191,
"train_tokens_per_second": 10312.879
},
{
"epoch": 0.31501125040180006,
"grad_norm": 1.6482162475585938,
"learning_rate": 1.3816300129366107e-05,
"loss": 1.0089,
"num_input_tokens_seen": 28911680,
"step": 245,
"train_runtime": 2802.3761,
"train_tokens_per_second": 10316.845
},
{
"epoch": 0.3162970106075217,
"grad_norm": 2.033006191253662,
"learning_rate": 1.3790426908150065e-05,
"loss": 1.1089,
"num_input_tokens_seen": 29016864,
"step": 246,
"train_runtime": 2811.4614,
"train_tokens_per_second": 10320.919
},
{
"epoch": 0.3175827708132433,
"grad_norm": 1.7948728799819946,
"learning_rate": 1.3764553686934023e-05,
"loss": 1.0618,
"num_input_tokens_seen": 29131168,
"step": 247,
"train_runtime": 2821.6622,
"train_tokens_per_second": 10324.116
},
{
"epoch": 0.31886853101896495,
"grad_norm": 1.90618097782135,
"learning_rate": 1.3738680465717984e-05,
"loss": 1.0781,
"num_input_tokens_seen": 29220064,
"step": 248,
"train_runtime": 2829.145,
"train_tokens_per_second": 10328.231
},
{
"epoch": 0.3201542912246866,
"grad_norm": 1.9356735944747925,
"learning_rate": 1.3712807244501941e-05,
"loss": 1.081,
"num_input_tokens_seen": 29327360,
"step": 249,
"train_runtime": 2838.3079,
"train_tokens_per_second": 10332.691
},
{
"epoch": 0.3214400514304082,
"grad_norm": 1.9027749300003052,
"learning_rate": 1.36869340232859e-05,
"loss": 1.0783,
"num_input_tokens_seen": 29460416,
"step": 250,
"train_runtime": 2850.5438,
"train_tokens_per_second": 10335.016
},
{
"epoch": 0.32272581163612984,
"grad_norm": 1.9512473344802856,
"learning_rate": 1.366106080206986e-05,
"loss": 1.1187,
"num_input_tokens_seen": 29560960,
"step": 251,
"train_runtime": 2859.2337,
"train_tokens_per_second": 10338.77
},
{
"epoch": 0.3240115718418515,
"grad_norm": 1.8211243152618408,
"learning_rate": 1.3635187580853817e-05,
"loss": 1.0958,
"num_input_tokens_seen": 29663328,
"step": 252,
"train_runtime": 2868.0908,
"train_tokens_per_second": 10342.535
},
{
"epoch": 0.3252973320475731,
"grad_norm": 1.9262733459472656,
"learning_rate": 1.3609314359637776e-05,
"loss": 1.0872,
"num_input_tokens_seen": 29746208,
"step": 253,
"train_runtime": 2875.16,
"train_tokens_per_second": 10345.931
},
{
"epoch": 0.32658309225329474,
"grad_norm": 1.8188444375991821,
"learning_rate": 1.3583441138421733e-05,
"loss": 1.0855,
"num_input_tokens_seen": 29894432,
"step": 254,
"train_runtime": 2888.8665,
"train_tokens_per_second": 10348.153
},
{
"epoch": 0.32786885245901637,
"grad_norm": 1.9136427640914917,
"learning_rate": 1.3557567917205693e-05,
"loss": 1.1348,
"num_input_tokens_seen": 29994112,
"step": 255,
"train_runtime": 2897.5218,
"train_tokens_per_second": 10351.643
},
{
"epoch": 0.329154612664738,
"grad_norm": 1.8818548917770386,
"learning_rate": 1.3531694695989652e-05,
"loss": 1.0323,
"num_input_tokens_seen": 30130016,
"step": 256,
"train_runtime": 2910.0743,
"train_tokens_per_second": 10353.693
},
{
"epoch": 0.3304403728704597,
"grad_norm": 1.8252167701721191,
"learning_rate": 1.350582147477361e-05,
"loss": 1.1093,
"num_input_tokens_seen": 30265760,
"step": 257,
"train_runtime": 2922.5727,
"train_tokens_per_second": 10355.862
},
{
"epoch": 0.3317261330761813,
"grad_norm": 1.7374950647354126,
"learning_rate": 1.3479948253557569e-05,
"loss": 1.0167,
"num_input_tokens_seen": 30376608,
"step": 258,
"train_runtime": 2932.2957,
"train_tokens_per_second": 10359.326
},
{
"epoch": 0.33301189328190295,
"grad_norm": 1.8809834718704224,
"learning_rate": 1.3454075032341528e-05,
"loss": 1.0811,
"num_input_tokens_seen": 30516832,
"step": 259,
"train_runtime": 2945.3073,
"train_tokens_per_second": 10361.171
},
{
"epoch": 0.3342976534876246,
"grad_norm": 1.8606772422790527,
"learning_rate": 1.3428201811125485e-05,
"loss": 1.1816,
"num_input_tokens_seen": 30630464,
"step": 260,
"train_runtime": 2955.2838,
"train_tokens_per_second": 10364.644
},
{
"epoch": 0.3355834136933462,
"grad_norm": 1.841683030128479,
"learning_rate": 1.3402328589909446e-05,
"loss": 1.0374,
"num_input_tokens_seen": 30773344,
"step": 261,
"train_runtime": 2968.6865,
"train_tokens_per_second": 10365.98
},
{
"epoch": 0.33686917389906784,
"grad_norm": 1.9608851671218872,
"learning_rate": 1.3376455368693405e-05,
"loss": 1.075,
"num_input_tokens_seen": 30899296,
"step": 262,
"train_runtime": 2980.4948,
"train_tokens_per_second": 10367.17
},
{
"epoch": 0.3381549341047895,
"grad_norm": 1.9880949258804321,
"learning_rate": 1.3350582147477362e-05,
"loss": 1.0203,
"num_input_tokens_seen": 31000256,
"step": 263,
"train_runtime": 2989.2311,
"train_tokens_per_second": 10370.645
},
{
"epoch": 0.3394406943105111,
"grad_norm": 1.9502097368240356,
"learning_rate": 1.332470892626132e-05,
"loss": 1.1464,
"num_input_tokens_seen": 31104768,
"step": 264,
"train_runtime": 2998.2398,
"train_tokens_per_second": 10374.343
},
{
"epoch": 0.34072645451623274,
"grad_norm": 1.934061050415039,
"learning_rate": 1.3298835705045278e-05,
"loss": 1.0263,
"num_input_tokens_seen": 31232832,
"step": 265,
"train_runtime": 3009.8265,
"train_tokens_per_second": 10376.954
},
{
"epoch": 0.34201221472195437,
"grad_norm": 1.8722063302993774,
"learning_rate": 1.3272962483829237e-05,
"loss": 1.0799,
"num_input_tokens_seen": 31351872,
"step": 266,
"train_runtime": 3020.55,
"train_tokens_per_second": 10379.524
},
{
"epoch": 0.343297974927676,
"grad_norm": 1.941330909729004,
"learning_rate": 1.3247089262613198e-05,
"loss": 0.9481,
"num_input_tokens_seen": 31458432,
"step": 267,
"train_runtime": 3029.8631,
"train_tokens_per_second": 10382.79
},
{
"epoch": 0.34458373513339763,
"grad_norm": 2.109315872192383,
"learning_rate": 1.3221216041397157e-05,
"loss": 1.1085,
"num_input_tokens_seen": 31566048,
"step": 268,
"train_runtime": 3039.2325,
"train_tokens_per_second": 10386.191
},
{
"epoch": 0.34586949533911926,
"grad_norm": 1.9429577589035034,
"learning_rate": 1.3195342820181114e-05,
"loss": 1.1085,
"num_input_tokens_seen": 31679008,
"step": 269,
"train_runtime": 3049.0419,
"train_tokens_per_second": 10389.824
},
{
"epoch": 0.3471552555448409,
"grad_norm": 1.8708595037460327,
"learning_rate": 1.3169469598965073e-05,
"loss": 1.0415,
"num_input_tokens_seen": 31805376,
"step": 270,
"train_runtime": 3060.3402,
"train_tokens_per_second": 10392.758
},
{
"epoch": 0.3484410157505625,
"grad_norm": 1.890461802482605,
"learning_rate": 1.314359637774903e-05,
"loss": 1.0917,
"num_input_tokens_seen": 31887200,
"step": 271,
"train_runtime": 3085.3071,
"train_tokens_per_second": 10335.179
},
{
"epoch": 0.34972677595628415,
"grad_norm": 1.8630510568618774,
"learning_rate": 1.3117723156532989e-05,
"loss": 1.0943,
"num_input_tokens_seen": 32037536,
"step": 272,
"train_runtime": 3098.8904,
"train_tokens_per_second": 10338.39
},
{
"epoch": 0.3510125361620058,
"grad_norm": 1.9622751474380493,
"learning_rate": 1.3091849935316946e-05,
"loss": 1.0348,
"num_input_tokens_seen": 32152288,
"step": 273,
"train_runtime": 3108.918,
"train_tokens_per_second": 10341.954
},
{
"epoch": 0.3522982963677274,
"grad_norm": 1.8532695770263672,
"learning_rate": 1.3065976714100907e-05,
"loss": 0.9972,
"num_input_tokens_seen": 32254592,
"step": 274,
"train_runtime": 3117.7914,
"train_tokens_per_second": 10345.333
},
{
"epoch": 0.35358405657344905,
"grad_norm": 1.8529016971588135,
"learning_rate": 1.3040103492884866e-05,
"loss": 1.1095,
"num_input_tokens_seen": 32377696,
"step": 275,
"train_runtime": 3128.8339,
"train_tokens_per_second": 10348.167
},
{
"epoch": 0.3548698167791707,
"grad_norm": 1.9654872417449951,
"learning_rate": 1.3014230271668823e-05,
"loss": 1.1777,
"num_input_tokens_seen": 32464224,
"step": 276,
"train_runtime": 3136.2376,
"train_tokens_per_second": 10351.328
},
{
"epoch": 0.3561555769848923,
"grad_norm": 1.9332945346832275,
"learning_rate": 1.2988357050452782e-05,
"loss": 1.0694,
"num_input_tokens_seen": 32543360,
"step": 277,
"train_runtime": 3142.9151,
"train_tokens_per_second": 10354.515
},
{
"epoch": 0.35744133719061394,
"grad_norm": 2.014310121536255,
"learning_rate": 1.2962483829236741e-05,
"loss": 1.1293,
"num_input_tokens_seen": 32652000,
"step": 278,
"train_runtime": 3152.361,
"train_tokens_per_second": 10357.951
},
{
"epoch": 0.35872709739633557,
"grad_norm": 1.9047924280166626,
"learning_rate": 1.2936610608020698e-05,
"loss": 1.0027,
"num_input_tokens_seen": 32764256,
"step": 279,
"train_runtime": 3162.2615,
"train_tokens_per_second": 10361.021
},
{
"epoch": 0.3600128576020572,
"grad_norm": 1.825059413909912,
"learning_rate": 1.2910737386804659e-05,
"loss": 1.1741,
"num_input_tokens_seen": 32843744,
"step": 280,
"train_runtime": 3168.977,
"train_tokens_per_second": 10364.147
},
{
"epoch": 0.36129861780777883,
"grad_norm": 1.831803321838379,
"learning_rate": 1.2884864165588618e-05,
"loss": 1.022,
"num_input_tokens_seen": 32964992,
"step": 281,
"train_runtime": 3179.9785,
"train_tokens_per_second": 10366.42
},
{
"epoch": 0.36258437801350046,
"grad_norm": 1.70236074924469,
"learning_rate": 1.2858990944372575e-05,
"loss": 1.0487,
"num_input_tokens_seen": 33080992,
"step": 282,
"train_runtime": 3190.2018,
"train_tokens_per_second": 10369.561
},
{
"epoch": 0.3638701382192221,
"grad_norm": 1.796125888824463,
"learning_rate": 1.2833117723156534e-05,
"loss": 1.0899,
"num_input_tokens_seen": 33226368,
"step": 283,
"train_runtime": 3203.4864,
"train_tokens_per_second": 10371.94
},
{
"epoch": 0.3651558984249437,
"grad_norm": 1.8778120279312134,
"learning_rate": 1.2807244501940492e-05,
"loss": 1.0362,
"num_input_tokens_seen": 33339552,
"step": 284,
"train_runtime": 3213.4705,
"train_tokens_per_second": 10374.937
},
{
"epoch": 0.36644165863066536,
"grad_norm": 1.868843913078308,
"learning_rate": 1.278137128072445e-05,
"loss": 1.0095,
"num_input_tokens_seen": 33425280,
"step": 285,
"train_runtime": 3220.8266,
"train_tokens_per_second": 10377.858
},
{
"epoch": 0.367727418836387,
"grad_norm": 1.8552757501602173,
"learning_rate": 1.275549805950841e-05,
"loss": 0.9967,
"num_input_tokens_seen": 33519872,
"step": 286,
"train_runtime": 3228.9988,
"train_tokens_per_second": 10380.887
},
{
"epoch": 0.3690131790421087,
"grad_norm": 1.8477954864501953,
"learning_rate": 1.272962483829237e-05,
"loss": 1.1182,
"num_input_tokens_seen": 33670336,
"step": 287,
"train_runtime": 3243.1369,
"train_tokens_per_second": 10382.027
},
{
"epoch": 0.3702989392478303,
"grad_norm": 1.7322572469711304,
"learning_rate": 1.2703751617076327e-05,
"loss": 1.0259,
"num_input_tokens_seen": 33777152,
"step": 288,
"train_runtime": 3252.4159,
"train_tokens_per_second": 10385.25
},
{
"epoch": 0.37158469945355194,
"grad_norm": 1.8179206848144531,
"learning_rate": 1.2677878395860286e-05,
"loss": 1.095,
"num_input_tokens_seen": 33933760,
"step": 289,
"train_runtime": 3267.0848,
"train_tokens_per_second": 10386.556
},
{
"epoch": 0.37287045965927357,
"grad_norm": 1.927725076675415,
"learning_rate": 1.2652005174644244e-05,
"loss": 1.0971,
"num_input_tokens_seen": 34016064,
"step": 290,
"train_runtime": 3274.2027,
"train_tokens_per_second": 10389.114
},
{
"epoch": 0.3741562198649952,
"grad_norm": 1.8900138139724731,
"learning_rate": 1.2626131953428203e-05,
"loss": 1.0385,
"num_input_tokens_seen": 34105728,
"step": 291,
"train_runtime": 3281.9209,
"train_tokens_per_second": 10392.002
},
{
"epoch": 0.37544198007071683,
"grad_norm": 1.8767197132110596,
"learning_rate": 1.260025873221216e-05,
"loss": 1.2325,
"num_input_tokens_seen": 34257888,
"step": 292,
"train_runtime": 3296.0865,
"train_tokens_per_second": 10393.504
},
{
"epoch": 0.37672774027643846,
"grad_norm": 1.6599918603897095,
"learning_rate": 1.257438551099612e-05,
"loss": 1.0944,
"num_input_tokens_seen": 34370272,
"step": 293,
"train_runtime": 3305.9389,
"train_tokens_per_second": 10396.524
},
{
"epoch": 0.3780135004821601,
"grad_norm": 1.9018691778182983,
"learning_rate": 1.254851228978008e-05,
"loss": 1.1485,
"num_input_tokens_seen": 34497536,
"step": 294,
"train_runtime": 3317.4286,
"train_tokens_per_second": 10398.878
},
{
"epoch": 0.3792992606878817,
"grad_norm": 1.9373286962509155,
"learning_rate": 1.2522639068564037e-05,
"loss": 1.1207,
"num_input_tokens_seen": 34655552,
"step": 295,
"train_runtime": 3332.4647,
"train_tokens_per_second": 10399.376
},
{
"epoch": 0.38058502089360335,
"grad_norm": 1.9912974834442139,
"learning_rate": 1.2496765847347996e-05,
"loss": 1.0018,
"num_input_tokens_seen": 34850176,
"step": 296,
"train_runtime": 3351.492,
"train_tokens_per_second": 10398.406
},
{
"epoch": 0.381870781099325,
"grad_norm": 2.001157760620117,
"learning_rate": 1.2470892626131955e-05,
"loss": 1.0122,
"num_input_tokens_seen": 34929440,
"step": 297,
"train_runtime": 3358.2119,
"train_tokens_per_second": 10401.202
},
{
"epoch": 0.3831565413050466,
"grad_norm": 1.9736489057540894,
"learning_rate": 1.2445019404915912e-05,
"loss": 1.0287,
"num_input_tokens_seen": 35043488,
"step": 298,
"train_runtime": 3368.304,
"train_tokens_per_second": 10403.897
},
{
"epoch": 0.38444230151076825,
"grad_norm": 2.0292022228240967,
"learning_rate": 1.2419146183699871e-05,
"loss": 1.1769,
"num_input_tokens_seen": 35170560,
"step": 299,
"train_runtime": 3379.6518,
"train_tokens_per_second": 10406.563
},
{
"epoch": 0.3857280617164899,
"grad_norm": 1.7314234972000122,
"learning_rate": 1.2393272962483832e-05,
"loss": 0.97,
"num_input_tokens_seen": 35281056,
"step": 300,
"train_runtime": 3389.3149,
"train_tokens_per_second": 10409.495
},
{
"epoch": 0.3870138219222115,
"grad_norm": 2.0191800594329834,
"learning_rate": 1.2367399741267789e-05,
"loss": 1.1325,
"num_input_tokens_seen": 35388672,
"step": 301,
"train_runtime": 3417.1135,
"train_tokens_per_second": 10356.306
},
{
"epoch": 0.38829958212793314,
"grad_norm": 1.8068965673446655,
"learning_rate": 1.2341526520051748e-05,
"loss": 1.1311,
"num_input_tokens_seen": 35523712,
"step": 302,
"train_runtime": 3429.3021,
"train_tokens_per_second": 10358.875
},
{
"epoch": 0.38958534233365477,
"grad_norm": 1.8851860761642456,
"learning_rate": 1.2315653298835705e-05,
"loss": 1.1328,
"num_input_tokens_seen": 35691712,
"step": 303,
"train_runtime": 3445.5901,
"train_tokens_per_second": 10358.665
},
{
"epoch": 0.3908711025393764,
"grad_norm": 2.3786840438842773,
"learning_rate": 1.2289780077619664e-05,
"loss": 1.1061,
"num_input_tokens_seen": 35780768,
"step": 304,
"train_runtime": 3453.2825,
"train_tokens_per_second": 10361.379
},
{
"epoch": 0.39215686274509803,
"grad_norm": 1.793230414390564,
"learning_rate": 1.2263906856403623e-05,
"loss": 1.1275,
"num_input_tokens_seen": 35888608,
"step": 305,
"train_runtime": 3462.6599,
"train_tokens_per_second": 10364.462
},
{
"epoch": 0.39344262295081966,
"grad_norm": 1.8552781343460083,
"learning_rate": 1.2238033635187584e-05,
"loss": 1.1033,
"num_input_tokens_seen": 36048640,
"step": 306,
"train_runtime": 3477.6998,
"train_tokens_per_second": 10365.656
},
{
"epoch": 0.3947283831565413,
"grad_norm": 1.8553136587142944,
"learning_rate": 1.2212160413971541e-05,
"loss": 1.0171,
"num_input_tokens_seen": 36150336,
"step": 307,
"train_runtime": 3486.8518,
"train_tokens_per_second": 10367.615
},
{
"epoch": 0.3960141433622629,
"grad_norm": 1.8456462621688843,
"learning_rate": 1.21862871927555e-05,
"loss": 1.0815,
"num_input_tokens_seen": 36262560,
"step": 308,
"train_runtime": 3496.9741,
"train_tokens_per_second": 10369.696
},
{
"epoch": 0.39729990356798456,
"grad_norm": 2.0002105236053467,
"learning_rate": 1.2160413971539457e-05,
"loss": 1.0209,
"num_input_tokens_seen": 36364320,
"step": 309,
"train_runtime": 3506.0556,
"train_tokens_per_second": 10371.86
},
{
"epoch": 0.3985856637737062,
"grad_norm": 1.8822708129882812,
"learning_rate": 1.2134540750323416e-05,
"loss": 1.1019,
"num_input_tokens_seen": 36472480,
"step": 310,
"train_runtime": 3515.5179,
"train_tokens_per_second": 10374.71
},
{
"epoch": 0.3998714239794278,
"grad_norm": 1.954473614692688,
"learning_rate": 1.2108667529107373e-05,
"loss": 1.2242,
"num_input_tokens_seen": 36585792,
"step": 311,
"train_runtime": 3525.5023,
"train_tokens_per_second": 10377.469
},
{
"epoch": 0.40115718418514945,
"grad_norm": 1.8884960412979126,
"learning_rate": 1.2082794307891334e-05,
"loss": 1.1584,
"num_input_tokens_seen": 36700448,
"step": 312,
"train_runtime": 3536.0058,
"train_tokens_per_second": 10379.069
},
{
"epoch": 0.40115718418514945,
"eval_loss": 1.112414836883545,
"eval_runtime": 22.4354,
"eval_samples_per_second": 44.305,
"eval_steps_per_second": 1.426,
"num_input_tokens_seen": 36700448,
"step": 312
},
{
"epoch": 0.4024429443908711,
"grad_norm": 1.7745190858840942,
"learning_rate": 1.2056921086675293e-05,
"loss": 1.0609,
"num_input_tokens_seen": 36819552,
"step": 313,
"train_runtime": 3569.0494,
"train_tokens_per_second": 10316.347
},
{
"epoch": 0.4037287045965927,
"grad_norm": 1.9588580131530762,
"learning_rate": 1.2031047865459252e-05,
"loss": 1.0342,
"num_input_tokens_seen": 36901792,
"step": 314,
"train_runtime": 3576.0188,
"train_tokens_per_second": 10319.239
},
{
"epoch": 0.40501446480231434,
"grad_norm": 1.886616826057434,
"learning_rate": 1.200517464424321e-05,
"loss": 1.0539,
"num_input_tokens_seen": 37002112,
"step": 315,
"train_runtime": 3584.6465,
"train_tokens_per_second": 10322.388
},
{
"epoch": 0.406300225008036,
"grad_norm": 1.9062621593475342,
"learning_rate": 1.1979301423027168e-05,
"loss": 1.0985,
"num_input_tokens_seen": 37111936,
"step": 316,
"train_runtime": 3594.3563,
"train_tokens_per_second": 10325.058
},
{
"epoch": 0.4075859852137576,
"grad_norm": 2.068682909011841,
"learning_rate": 1.1953428201811125e-05,
"loss": 1.097,
"num_input_tokens_seen": 37218208,
"step": 317,
"train_runtime": 3603.7296,
"train_tokens_per_second": 10327.692
},
{
"epoch": 0.4088717454194793,
"grad_norm": 1.958736538887024,
"learning_rate": 1.1927554980595084e-05,
"loss": 0.9942,
"num_input_tokens_seen": 37345632,
"step": 318,
"train_runtime": 3615.4338,
"train_tokens_per_second": 10329.502
},
{
"epoch": 0.4101575056252009,
"grad_norm": 1.8023805618286133,
"learning_rate": 1.1901681759379045e-05,
"loss": 0.9653,
"num_input_tokens_seen": 37443360,
"step": 319,
"train_runtime": 3623.7748,
"train_tokens_per_second": 10332.695
},
{
"epoch": 0.41144326583092256,
"grad_norm": 1.9169106483459473,
"learning_rate": 1.1875808538163002e-05,
"loss": 1.0838,
"num_input_tokens_seen": 37545600,
"step": 320,
"train_runtime": 3632.642,
"train_tokens_per_second": 10335.618
},
{
"epoch": 0.4127290260366442,
"grad_norm": 1.8038839101791382,
"learning_rate": 1.1849935316946961e-05,
"loss": 1.1069,
"num_input_tokens_seen": 37666080,
"step": 321,
"train_runtime": 3643.3493,
"train_tokens_per_second": 10338.311
},
{
"epoch": 0.4140147862423658,
"grad_norm": 1.7721644639968872,
"learning_rate": 1.1824062095730919e-05,
"loss": 1.0839,
"num_input_tokens_seen": 37822144,
"step": 322,
"train_runtime": 3657.9869,
"train_tokens_per_second": 10339.606
},
{
"epoch": 0.41530054644808745,
"grad_norm": 1.9049701690673828,
"learning_rate": 1.1798188874514877e-05,
"loss": 1.0799,
"num_input_tokens_seen": 37966560,
"step": 323,
"train_runtime": 3671.372,
"train_tokens_per_second": 10341.246
},
{
"epoch": 0.4165863066538091,
"grad_norm": 1.980131983757019,
"learning_rate": 1.1772315653298836e-05,
"loss": 1.0307,
"num_input_tokens_seen": 38062112,
"step": 324,
"train_runtime": 3679.5815,
"train_tokens_per_second": 10344.141
},
{
"epoch": 0.4178720668595307,
"grad_norm": 1.9756392240524292,
"learning_rate": 1.1746442432082797e-05,
"loss": 1.1018,
"num_input_tokens_seen": 38150848,
"step": 325,
"train_runtime": 3687.0852,
"train_tokens_per_second": 10347.157
},
{
"epoch": 0.41915782706525234,
"grad_norm": 1.896883249282837,
"learning_rate": 1.1720569210866754e-05,
"loss": 1.1311,
"num_input_tokens_seen": 38241536,
"step": 326,
"train_runtime": 3694.6877,
"train_tokens_per_second": 10350.411
},
{
"epoch": 0.420443587270974,
"grad_norm": 1.739008903503418,
"learning_rate": 1.1694695989650713e-05,
"loss": 1.0084,
"num_input_tokens_seen": 38318656,
"step": 327,
"train_runtime": 3701.2278,
"train_tokens_per_second": 10352.958
},
{
"epoch": 0.4217293474766956,
"grad_norm": 1.8083174228668213,
"learning_rate": 1.166882276843467e-05,
"loss": 1.123,
"num_input_tokens_seen": 38417472,
"step": 328,
"train_runtime": 3709.7971,
"train_tokens_per_second": 10355.68
},
{
"epoch": 0.42301510768241724,
"grad_norm": 1.8054888248443604,
"learning_rate": 1.164294954721863e-05,
"loss": 0.9772,
"num_input_tokens_seen": 38536576,
"step": 329,
"train_runtime": 3720.5243,
"train_tokens_per_second": 10357.835
},
{
"epoch": 0.42430086788813887,
"grad_norm": 1.8551595211029053,
"learning_rate": 1.1617076326002587e-05,
"loss": 1.0588,
"num_input_tokens_seen": 38623488,
"step": 330,
"train_runtime": 3727.8728,
"train_tokens_per_second": 10360.731
},
{
"epoch": 0.4255866280938605,
"grad_norm": 1.9173765182495117,
"learning_rate": 1.1591203104786546e-05,
"loss": 1.0059,
"num_input_tokens_seen": 38708384,
"step": 331,
"train_runtime": 3752.9725,
"train_tokens_per_second": 10314.06
},
{
"epoch": 0.42687238829958213,
"grad_norm": 1.9079426527023315,
"learning_rate": 1.1565329883570506e-05,
"loss": 1.1054,
"num_input_tokens_seen": 38843744,
"step": 332,
"train_runtime": 3765.4725,
"train_tokens_per_second": 10315.769
},
{
"epoch": 0.42815814850530376,
"grad_norm": 1.8765593767166138,
"learning_rate": 1.1539456662354465e-05,
"loss": 1.0543,
"num_input_tokens_seen": 38952768,
"step": 333,
"train_runtime": 3774.9835,
"train_tokens_per_second": 10318.659
},
{
"epoch": 0.4294439087110254,
"grad_norm": 1.9778969287872314,
"learning_rate": 1.1513583441138423e-05,
"loss": 1.0328,
"num_input_tokens_seen": 39051136,
"step": 334,
"train_runtime": 3783.4403,
"train_tokens_per_second": 10321.594
},
{
"epoch": 0.430729668916747,
"grad_norm": 1.9157649278640747,
"learning_rate": 1.1487710219922382e-05,
"loss": 1.0765,
"num_input_tokens_seen": 39151392,
"step": 335,
"train_runtime": 3792.1825,
"train_tokens_per_second": 10324.237
},
{
"epoch": 0.43201542912246865,
"grad_norm": 1.9655895233154297,
"learning_rate": 1.1461836998706339e-05,
"loss": 1.0175,
"num_input_tokens_seen": 39247360,
"step": 336,
"train_runtime": 3800.3977,
"train_tokens_per_second": 10327.172
},
{
"epoch": 0.4333011893281903,
"grad_norm": 1.8738690614700317,
"learning_rate": 1.1435963777490298e-05,
"loss": 1.103,
"num_input_tokens_seen": 39336896,
"step": 337,
"train_runtime": 3808.0625,
"train_tokens_per_second": 10329.898
},
{
"epoch": 0.4345869495339119,
"grad_norm": 1.6234264373779297,
"learning_rate": 1.1410090556274259e-05,
"loss": 0.8555,
"num_input_tokens_seen": 39482304,
"step": 338,
"train_runtime": 3821.6722,
"train_tokens_per_second": 10331.159
},
{
"epoch": 0.43587270973963355,
"grad_norm": 1.8462566137313843,
"learning_rate": 1.1384217335058216e-05,
"loss": 1.1103,
"num_input_tokens_seen": 39575136,
"step": 339,
"train_runtime": 3829.6789,
"train_tokens_per_second": 10333.8
},
{
"epoch": 0.4371584699453552,
"grad_norm": 1.850907325744629,
"learning_rate": 1.1358344113842175e-05,
"loss": 1.0596,
"num_input_tokens_seen": 39689024,
"step": 340,
"train_runtime": 3839.7717,
"train_tokens_per_second": 10336.298
},
{
"epoch": 0.4384442301510768,
"grad_norm": 1.863982915878296,
"learning_rate": 1.1332470892626132e-05,
"loss": 1.0263,
"num_input_tokens_seen": 39816832,
"step": 341,
"train_runtime": 3851.71,
"train_tokens_per_second": 10337.443
},
{
"epoch": 0.43972999035679844,
"grad_norm": 1.933987021446228,
"learning_rate": 1.1306597671410091e-05,
"loss": 1.0908,
"num_input_tokens_seen": 39960768,
"step": 342,
"train_runtime": 3865.0922,
"train_tokens_per_second": 10338.891
},
{
"epoch": 0.44101575056252007,
"grad_norm": 1.8219382762908936,
"learning_rate": 1.128072445019405e-05,
"loss": 1.1551,
"num_input_tokens_seen": 40086912,
"step": 343,
"train_runtime": 3876.2397,
"train_tokens_per_second": 10341.701
},
{
"epoch": 0.4423015107682417,
"grad_norm": 1.9455715417861938,
"learning_rate": 1.1254851228978007e-05,
"loss": 1.1734,
"num_input_tokens_seen": 40207200,
"step": 344,
"train_runtime": 3887.3565,
"train_tokens_per_second": 10343.07
},
{
"epoch": 0.44358727097396333,
"grad_norm": 1.81923246383667,
"learning_rate": 1.1228978007761968e-05,
"loss": 1.0239,
"num_input_tokens_seen": 40346560,
"step": 345,
"train_runtime": 3900.1116,
"train_tokens_per_second": 10344.976
},
{
"epoch": 0.44487303117968496,
"grad_norm": 1.9423332214355469,
"learning_rate": 1.1203104786545927e-05,
"loss": 0.9855,
"num_input_tokens_seen": 40449888,
"step": 346,
"train_runtime": 3909.0681,
"train_tokens_per_second": 10347.706
},
{
"epoch": 0.4461587913854066,
"grad_norm": 1.9526299238204956,
"learning_rate": 1.1177231565329884e-05,
"loss": 1.0271,
"num_input_tokens_seen": 40586752,
"step": 347,
"train_runtime": 3921.8977,
"train_tokens_per_second": 10348.753
},
{
"epoch": 0.4474445515911283,
"grad_norm": 1.8065625429153442,
"learning_rate": 1.1151358344113843e-05,
"loss": 1.1239,
"num_input_tokens_seen": 40696608,
"step": 348,
"train_runtime": 3931.7547,
"train_tokens_per_second": 10350.749
},
{
"epoch": 0.4487303117968499,
"grad_norm": 1.6349153518676758,
"learning_rate": 1.11254851228978e-05,
"loss": 0.9781,
"num_input_tokens_seen": 40814656,
"step": 349,
"train_runtime": 3942.1447,
"train_tokens_per_second": 10353.414
},
{
"epoch": 0.45001607200257154,
"grad_norm": 1.7468831539154053,
"learning_rate": 1.109961190168176e-05,
"loss": 1.0172,
"num_input_tokens_seen": 40974816,
"step": 350,
"train_runtime": 3957.5232,
"train_tokens_per_second": 10353.651
},
{
"epoch": 0.4513018322082932,
"grad_norm": 1.9717236757278442,
"learning_rate": 1.107373868046572e-05,
"loss": 1.1383,
"num_input_tokens_seen": 41075776,
"step": 351,
"train_runtime": 3966.3179,
"train_tokens_per_second": 10356.148
},
{
"epoch": 0.4525875924140148,
"grad_norm": 1.715475082397461,
"learning_rate": 1.1047865459249679e-05,
"loss": 1.0579,
"num_input_tokens_seen": 41192352,
"step": 352,
"train_runtime": 3976.6366,
"train_tokens_per_second": 10358.591
},
{
"epoch": 0.45387335261973644,
"grad_norm": 1.936943769454956,
"learning_rate": 1.1021992238033636e-05,
"loss": 1.1545,
"num_input_tokens_seen": 41296928,
"step": 353,
"train_runtime": 3985.9231,
"train_tokens_per_second": 10360.694
},
{
"epoch": 0.45515911282545807,
"grad_norm": 1.7825515270233154,
"learning_rate": 1.0996119016817595e-05,
"loss": 1.0933,
"num_input_tokens_seen": 41390336,
"step": 354,
"train_runtime": 3993.8858,
"train_tokens_per_second": 10363.425
},
{
"epoch": 0.4564448730311797,
"grad_norm": 1.7963905334472656,
"learning_rate": 1.0970245795601552e-05,
"loss": 1.0372,
"num_input_tokens_seen": 41491968,
"step": 355,
"train_runtime": 4002.6542,
"train_tokens_per_second": 10366.114
},
{
"epoch": 0.45773063323690133,
"grad_norm": 1.836431860923767,
"learning_rate": 1.0944372574385511e-05,
"loss": 1.0373,
"num_input_tokens_seen": 41613888,
"step": 356,
"train_runtime": 4013.7789,
"train_tokens_per_second": 10367.758
},
{
"epoch": 0.45901639344262296,
"grad_norm": 1.9172090291976929,
"learning_rate": 1.0918499353169469e-05,
"loss": 1.0329,
"num_input_tokens_seen": 41745664,
"step": 357,
"train_runtime": 4025.8189,
"train_tokens_per_second": 10369.484
},
{
"epoch": 0.4603021536483446,
"grad_norm": 1.8832635879516602,
"learning_rate": 1.089262613195343e-05,
"loss": 1.0411,
"num_input_tokens_seen": 41879264,
"step": 358,
"train_runtime": 4038.136,
"train_tokens_per_second": 10370.939
},
{
"epoch": 0.4615879138540662,
"grad_norm": 1.8881222009658813,
"learning_rate": 1.0866752910737388e-05,
"loss": 1.1016,
"num_input_tokens_seen": 42019424,
"step": 359,
"train_runtime": 4050.808,
"train_tokens_per_second": 10373.097
},
{
"epoch": 0.46287367405978785,
"grad_norm": 1.8251198530197144,
"learning_rate": 1.0840879689521346e-05,
"loss": 1.0582,
"num_input_tokens_seen": 42184096,
"step": 360,
"train_runtime": 4066.1572,
"train_tokens_per_second": 10374.438
},
{
"epoch": 0.4641594342655095,
"grad_norm": 1.8713456392288208,
"learning_rate": 1.0815006468305305e-05,
"loss": 1.111,
"num_input_tokens_seen": 42279968,
"step": 361,
"train_runtime": 4091.1662,
"train_tokens_per_second": 10334.454
},
{
"epoch": 0.4654451944712311,
"grad_norm": 1.8834689855575562,
"learning_rate": 1.0789133247089263e-05,
"loss": 1.1313,
"num_input_tokens_seen": 42376320,
"step": 362,
"train_runtime": 4099.4271,
"train_tokens_per_second": 10337.132
},
{
"epoch": 0.46673095467695275,
"grad_norm": 1.9569921493530273,
"learning_rate": 1.076326002587322e-05,
"loss": 0.9795,
"num_input_tokens_seen": 42480736,
"step": 363,
"train_runtime": 4108.5761,
"train_tokens_per_second": 10339.528
},
{
"epoch": 0.4680167148826744,
"grad_norm": 1.9009162187576294,
"learning_rate": 1.0737386804657181e-05,
"loss": 1.028,
"num_input_tokens_seen": 42588928,
"step": 364,
"train_runtime": 4117.995,
"train_tokens_per_second": 10342.151
},
{
"epoch": 0.469302475088396,
"grad_norm": 1.9303570985794067,
"learning_rate": 1.071151358344114e-05,
"loss": 1.0805,
"num_input_tokens_seen": 42702336,
"step": 365,
"train_runtime": 4127.9119,
"train_tokens_per_second": 10344.779
},
{
"epoch": 0.47058823529411764,
"grad_norm": 1.8810940980911255,
"learning_rate": 1.0685640362225098e-05,
"loss": 1.0237,
"num_input_tokens_seen": 42778176,
"step": 366,
"train_runtime": 4134.3506,
"train_tokens_per_second": 10347.012
},
{
"epoch": 0.47187399549983927,
"grad_norm": 1.7211192846298218,
"learning_rate": 1.0659767141009057e-05,
"loss": 0.9568,
"num_input_tokens_seen": 42865536,
"step": 367,
"train_runtime": 4141.8091,
"train_tokens_per_second": 10349.472
},
{
"epoch": 0.4731597557055609,
"grad_norm": 1.7768193483352661,
"learning_rate": 1.0633893919793014e-05,
"loss": 1.0588,
"num_input_tokens_seen": 42971392,
"step": 368,
"train_runtime": 4151.0681,
"train_tokens_per_second": 10351.888
},
{
"epoch": 0.47444551591128253,
"grad_norm": 1.8423272371292114,
"learning_rate": 1.0608020698576973e-05,
"loss": 1.0675,
"num_input_tokens_seen": 43112160,
"step": 369,
"train_runtime": 4164.273,
"train_tokens_per_second": 10352.866
},
{
"epoch": 0.47573127611700416,
"grad_norm": 1.7994762659072876,
"learning_rate": 1.0582147477360933e-05,
"loss": 1.0544,
"num_input_tokens_seen": 43221728,
"step": 370,
"train_runtime": 4173.8176,
"train_tokens_per_second": 10355.443
},
{
"epoch": 0.4770170363227258,
"grad_norm": 1.8866075277328491,
"learning_rate": 1.0556274256144892e-05,
"loss": 1.1007,
"num_input_tokens_seen": 43330080,
"step": 371,
"train_runtime": 4183.4643,
"train_tokens_per_second": 10357.464
},
{
"epoch": 0.4783027965284474,
"grad_norm": 1.8547290563583374,
"learning_rate": 1.053040103492885e-05,
"loss": 0.9975,
"num_input_tokens_seen": 43423392,
"step": 372,
"train_runtime": 4191.3728,
"train_tokens_per_second": 10360.184
},
{
"epoch": 0.47958855673416906,
"grad_norm": 2.1289970874786377,
"learning_rate": 1.0504527813712809e-05,
"loss": 1.0475,
"num_input_tokens_seen": 43536064,
"step": 373,
"train_runtime": 4201.1006,
"train_tokens_per_second": 10363.014
},
{
"epoch": 0.4808743169398907,
"grad_norm": 1.9905496835708618,
"learning_rate": 1.0478654592496766e-05,
"loss": 0.9375,
"num_input_tokens_seen": 43635072,
"step": 374,
"train_runtime": 4209.5792,
"train_tokens_per_second": 10365.661
},
{
"epoch": 0.4821600771456123,
"grad_norm": 1.791810393333435,
"learning_rate": 1.0452781371280725e-05,
"loss": 1.0144,
"num_input_tokens_seen": 43724256,
"step": 375,
"train_runtime": 4217.1636,
"train_tokens_per_second": 10368.167
},
{
"epoch": 0.48344583735133395,
"grad_norm": 1.828808307647705,
"learning_rate": 1.0426908150064682e-05,
"loss": 1.1086,
"num_input_tokens_seen": 43903168,
"step": 376,
"train_runtime": 4234.1848,
"train_tokens_per_second": 10368.742
},
{
"epoch": 0.4847315975570556,
"grad_norm": 2.0768697261810303,
"learning_rate": 1.0401034928848643e-05,
"loss": 1.1689,
"num_input_tokens_seen": 44021952,
"step": 377,
"train_runtime": 4244.5157,
"train_tokens_per_second": 10371.49
},
{
"epoch": 0.48601735776277727,
"grad_norm": 1.960158109664917,
"learning_rate": 1.0375161707632602e-05,
"loss": 1.061,
"num_input_tokens_seen": 44108640,
"step": 378,
"train_runtime": 4251.8678,
"train_tokens_per_second": 10373.944
},
{
"epoch": 0.4873031179684989,
"grad_norm": 1.9121805429458618,
"learning_rate": 1.034928848641656e-05,
"loss": 1.0433,
"num_input_tokens_seen": 44203648,
"step": 379,
"train_runtime": 4260.0015,
"train_tokens_per_second": 10376.44
},
{
"epoch": 0.48858887817422053,
"grad_norm": 1.8849984407424927,
"learning_rate": 1.0323415265200518e-05,
"loss": 1.1013,
"num_input_tokens_seen": 44291008,
"step": 380,
"train_runtime": 4267.4727,
"train_tokens_per_second": 10378.744
},
{
"epoch": 0.48987463837994216,
"grad_norm": 1.863187313079834,
"learning_rate": 1.0297542043984477e-05,
"loss": 1.028,
"num_input_tokens_seen": 44377920,
"step": 381,
"train_runtime": 4274.8697,
"train_tokens_per_second": 10381.116
},
{
"epoch": 0.4911603985856638,
"grad_norm": 1.8333090543746948,
"learning_rate": 1.0271668822768434e-05,
"loss": 1.075,
"num_input_tokens_seen": 44581920,
"step": 382,
"train_runtime": 4294.9622,
"train_tokens_per_second": 10380.049
},
{
"epoch": 0.4924461587913854,
"grad_norm": 1.873062252998352,
"learning_rate": 1.0245795601552395e-05,
"loss": 1.1039,
"num_input_tokens_seen": 44754688,
"step": 383,
"train_runtime": 4311.2726,
"train_tokens_per_second": 10380.853
},
{
"epoch": 0.49373191899710706,
"grad_norm": 1.9315266609191895,
"learning_rate": 1.0219922380336354e-05,
"loss": 1.145,
"num_input_tokens_seen": 44880224,
"step": 384,
"train_runtime": 4323.0272,
"train_tokens_per_second": 10381.666
},
{
"epoch": 0.4950176792028287,
"grad_norm": 1.731623888015747,
"learning_rate": 1.0194049159120311e-05,
"loss": 1.0024,
"num_input_tokens_seen": 45029664,
"step": 385,
"train_runtime": 4336.9208,
"train_tokens_per_second": 10382.865
},
{
"epoch": 0.4963034394085503,
"grad_norm": 1.618575096130371,
"learning_rate": 1.016817593790427e-05,
"loss": 0.9817,
"num_input_tokens_seen": 45129600,
"step": 386,
"train_runtime": 4345.5214,
"train_tokens_per_second": 10385.313
},
{
"epoch": 0.49758919961427195,
"grad_norm": 1.8326330184936523,
"learning_rate": 1.0142302716688227e-05,
"loss": 1.0646,
"num_input_tokens_seen": 45219104,
"step": 387,
"train_runtime": 4353.1201,
"train_tokens_per_second": 10387.746
},
{
"epoch": 0.4988749598199936,
"grad_norm": 1.9410369396209717,
"learning_rate": 1.0116429495472186e-05,
"loss": 1.1241,
"num_input_tokens_seen": 45380032,
"step": 388,
"train_runtime": 4368.2134,
"train_tokens_per_second": 10388.694
},
{
"epoch": 0.5001607200257152,
"grad_norm": 2.0092506408691406,
"learning_rate": 1.0090556274256145e-05,
"loss": 1.0946,
"num_input_tokens_seen": 45512480,
"step": 389,
"train_runtime": 4380.1221,
"train_tokens_per_second": 10390.687
},
{
"epoch": 0.5014464802314368,
"grad_norm": 2.0018155574798584,
"learning_rate": 1.0064683053040106e-05,
"loss": 1.0753,
"num_input_tokens_seen": 45640032,
"step": 390,
"train_runtime": 4391.8578,
"train_tokens_per_second": 10391.965
},
{
"epoch": 0.5014464802314368,
"eval_loss": 1.1071221828460693,
"eval_runtime": 22.1149,
"eval_samples_per_second": 44.947,
"eval_steps_per_second": 1.447,
"num_input_tokens_seen": 45640032,
"step": 390
},
{
"epoch": 0.5027322404371585,
"grad_norm": 1.8650777339935303,
"learning_rate": 1.0038809831824063e-05,
"loss": 1.036,
"num_input_tokens_seen": 45720768,
"step": 391,
"train_runtime": 4437.5417,
"train_tokens_per_second": 10303.175
},
{
"epoch": 0.50401800064288,
"grad_norm": 1.9369052648544312,
"learning_rate": 1.0012936610608022e-05,
"loss": 1.1169,
"num_input_tokens_seen": 45842240,
"step": 392,
"train_runtime": 4448.5568,
"train_tokens_per_second": 10304.969
},
{
"epoch": 0.5053037608486017,
"grad_norm": 1.8346235752105713,
"learning_rate": 9.98706338939198e-06,
"loss": 1.0749,
"num_input_tokens_seen": 45918976,
"step": 393,
"train_runtime": 4454.9464,
"train_tokens_per_second": 10307.414
},
{
"epoch": 0.5065895210543234,
"grad_norm": 2.0440127849578857,
"learning_rate": 9.961190168175938e-06,
"loss": 1.0516,
"num_input_tokens_seen": 45999104,
"step": 394,
"train_runtime": 4461.6884,
"train_tokens_per_second": 10309.798
},
{
"epoch": 0.507875281260045,
"grad_norm": 3.248145341873169,
"learning_rate": 9.935316946959897e-06,
"loss": 1.1728,
"num_input_tokens_seen": 46154144,
"step": 395,
"train_runtime": 4476.3079,
"train_tokens_per_second": 10310.762
},
{
"epoch": 0.5091610414657667,
"grad_norm": 1.918129801750183,
"learning_rate": 9.909443725743856e-06,
"loss": 1.0521,
"num_input_tokens_seen": 46325344,
"step": 396,
"train_runtime": 4492.8544,
"train_tokens_per_second": 10310.894
},
{
"epoch": 0.5104468016714883,
"grad_norm": 1.8980101346969604,
"learning_rate": 9.883570504527814e-06,
"loss": 1.0749,
"num_input_tokens_seen": 46411072,
"step": 397,
"train_runtime": 4500.1395,
"train_tokens_per_second": 10313.252
},
{
"epoch": 0.51173256187721,
"grad_norm": 1.7899583578109741,
"learning_rate": 9.857697283311774e-06,
"loss": 1.0462,
"num_input_tokens_seen": 46509216,
"step": 398,
"train_runtime": 4508.575,
"train_tokens_per_second": 10315.724
},
{
"epoch": 0.5130183220829315,
"grad_norm": 1.8656114339828491,
"learning_rate": 9.831824062095732e-06,
"loss": 1.0682,
"num_input_tokens_seen": 46644160,
"step": 399,
"train_runtime": 4520.8245,
"train_tokens_per_second": 10317.622
},
{
"epoch": 0.5143040822886532,
"grad_norm": 1.847536325454712,
"learning_rate": 9.80595084087969e-06,
"loss": 1.0864,
"num_input_tokens_seen": 46783808,
"step": 400,
"train_runtime": 4533.3771,
"train_tokens_per_second": 10319.858
},
{
"epoch": 0.5155898424943748,
"grad_norm": 1.8390229940414429,
"learning_rate": 9.78007761966365e-06,
"loss": 0.9831,
"num_input_tokens_seen": 46926240,
"step": 401,
"train_runtime": 4546.39,
"train_tokens_per_second": 10321.649
},
{
"epoch": 0.5168756027000965,
"grad_norm": 1.8536787033081055,
"learning_rate": 9.754204398447608e-06,
"loss": 1.0727,
"num_input_tokens_seen": 47071040,
"step": 402,
"train_runtime": 4559.4688,
"train_tokens_per_second": 10323.799
},
{
"epoch": 0.518161362905818,
"grad_norm": 1.8034573793411255,
"learning_rate": 9.728331177231566e-06,
"loss": 1.1378,
"num_input_tokens_seen": 47179744,
"step": 403,
"train_runtime": 4569.0897,
"train_tokens_per_second": 10325.852
},
{
"epoch": 0.5194471231115397,
"grad_norm": 1.8764989376068115,
"learning_rate": 9.702457956015525e-06,
"loss": 1.0454,
"num_input_tokens_seen": 47293760,
"step": 404,
"train_runtime": 4579.0502,
"train_tokens_per_second": 10328.29
},
{
"epoch": 0.5207328833172613,
"grad_norm": 1.9220011234283447,
"learning_rate": 9.676584734799484e-06,
"loss": 1.1761,
"num_input_tokens_seen": 47392832,
"step": 405,
"train_runtime": 4587.61,
"train_tokens_per_second": 10330.615
},
{
"epoch": 0.522018643522983,
"grad_norm": 1.879625916481018,
"learning_rate": 9.650711513583441e-06,
"loss": 1.0923,
"num_input_tokens_seen": 47487712,
"step": 406,
"train_runtime": 4595.7576,
"train_tokens_per_second": 10332.945
},
{
"epoch": 0.5233044037287046,
"grad_norm": 1.839417815208435,
"learning_rate": 9.624838292367402e-06,
"loss": 1.1236,
"num_input_tokens_seen": 47620096,
"step": 407,
"train_runtime": 4607.8581,
"train_tokens_per_second": 10334.541
},
{
"epoch": 0.5245901639344263,
"grad_norm": 1.8451459407806396,
"learning_rate": 9.598965071151359e-06,
"loss": 1.0462,
"num_input_tokens_seen": 47700000,
"step": 408,
"train_runtime": 4614.6366,
"train_tokens_per_second": 10336.675
},
{
"epoch": 0.5258759241401478,
"grad_norm": 1.9718786478042603,
"learning_rate": 9.573091849935318e-06,
"loss": 0.9997,
"num_input_tokens_seen": 47834944,
"step": 409,
"train_runtime": 4626.8909,
"train_tokens_per_second": 10338.464
},
{
"epoch": 0.5271616843458695,
"grad_norm": 1.9811155796051025,
"learning_rate": 9.547218628719275e-06,
"loss": 1.0761,
"num_input_tokens_seen": 47968160,
"step": 410,
"train_runtime": 4639.1336,
"train_tokens_per_second": 10339.896
},
{
"epoch": 0.5284474445515911,
"grad_norm": 1.8997541666030884,
"learning_rate": 9.521345407503236e-06,
"loss": 1.027,
"num_input_tokens_seen": 48059648,
"step": 411,
"train_runtime": 4646.969,
"train_tokens_per_second": 10342.149
},
{
"epoch": 0.5297332047573128,
"grad_norm": 1.8173083066940308,
"learning_rate": 9.495472186287193e-06,
"loss": 1.1339,
"num_input_tokens_seen": 48181504,
"step": 412,
"train_runtime": 4658.0106,
"train_tokens_per_second": 10343.794
},
{
"epoch": 0.5310189649630344,
"grad_norm": 1.7731293439865112,
"learning_rate": 9.469598965071152e-06,
"loss": 0.9738,
"num_input_tokens_seen": 48280416,
"step": 413,
"train_runtime": 4666.5826,
"train_tokens_per_second": 10345.99
},
{
"epoch": 0.532304725168756,
"grad_norm": 1.9140669107437134,
"learning_rate": 9.443725743855111e-06,
"loss": 1.0163,
"num_input_tokens_seen": 48409600,
"step": 414,
"train_runtime": 4678.3897,
"train_tokens_per_second": 10347.492
},
{
"epoch": 0.5335904853744776,
"grad_norm": 1.872811198234558,
"learning_rate": 9.41785252263907e-06,
"loss": 0.9948,
"num_input_tokens_seen": 48530944,
"step": 415,
"train_runtime": 4689.1516,
"train_tokens_per_second": 10349.622
},
{
"epoch": 0.5348762455801993,
"grad_norm": 1.7188026905059814,
"learning_rate": 9.391979301423027e-06,
"loss": 1.0364,
"num_input_tokens_seen": 48621344,
"step": 416,
"train_runtime": 4696.9538,
"train_tokens_per_second": 10351.676
},
{
"epoch": 0.5361620057859209,
"grad_norm": 1.9433099031448364,
"learning_rate": 9.366106080206988e-06,
"loss": 1.0985,
"num_input_tokens_seen": 48730336,
"step": 417,
"train_runtime": 4706.5206,
"train_tokens_per_second": 10353.792
},
{
"epoch": 0.5374477659916426,
"grad_norm": 1.8120436668395996,
"learning_rate": 9.340232858990945e-06,
"loss": 1.0375,
"num_input_tokens_seen": 48876416,
"step": 418,
"train_runtime": 4720.1751,
"train_tokens_per_second": 10354.789
},
{
"epoch": 0.5387335261973641,
"grad_norm": 1.8917372226715088,
"learning_rate": 9.314359637774904e-06,
"loss": 1.0179,
"num_input_tokens_seen": 48968384,
"step": 419,
"train_runtime": 4728.029,
"train_tokens_per_second": 10357.04
},
{
"epoch": 0.5400192864030858,
"grad_norm": 1.9676231145858765,
"learning_rate": 9.288486416558863e-06,
"loss": 1.0241,
"num_input_tokens_seen": 49076928,
"step": 420,
"train_runtime": 4737.4729,
"train_tokens_per_second": 10359.305
},
{
"epoch": 0.5413050466088074,
"grad_norm": 1.799108862876892,
"learning_rate": 9.262613195342822e-06,
"loss": 1.1027,
"num_input_tokens_seen": 49202080,
"step": 421,
"train_runtime": 4765.3676,
"train_tokens_per_second": 10324.928
},
{
"epoch": 0.5425908068145291,
"grad_norm": 1.6937819719314575,
"learning_rate": 9.23673997412678e-06,
"loss": 1.0448,
"num_input_tokens_seen": 49279744,
"step": 422,
"train_runtime": 4772.0012,
"train_tokens_per_second": 10326.851
},
{
"epoch": 0.5438765670202508,
"grad_norm": 1.8214465379714966,
"learning_rate": 9.210866752910738e-06,
"loss": 1.0483,
"num_input_tokens_seen": 49426304,
"step": 423,
"train_runtime": 4785.0768,
"train_tokens_per_second": 10329.26
},
{
"epoch": 0.5451623272259724,
"grad_norm": 2.017838954925537,
"learning_rate": 9.184993531694697e-06,
"loss": 1.0529,
"num_input_tokens_seen": 49552544,
"step": 424,
"train_runtime": 4796.8995,
"train_tokens_per_second": 10330.119
},
{
"epoch": 0.546448087431694,
"grad_norm": 1.8154163360595703,
"learning_rate": 9.159120310478656e-06,
"loss": 1.0638,
"num_input_tokens_seen": 49681152,
"step": 425,
"train_runtime": 4808.5011,
"train_tokens_per_second": 10331.941
},
{
"epoch": 0.5477338476374156,
"grad_norm": 2.039503574371338,
"learning_rate": 9.133247089262613e-06,
"loss": 1.1204,
"num_input_tokens_seen": 49810272,
"step": 426,
"train_runtime": 4820.4338,
"train_tokens_per_second": 10333.151
},
{
"epoch": 0.5490196078431373,
"grad_norm": 1.8751721382141113,
"learning_rate": 9.107373868046572e-06,
"loss": 1.0905,
"num_input_tokens_seen": 49931552,
"step": 427,
"train_runtime": 4831.6448,
"train_tokens_per_second": 10334.276
},
{
"epoch": 0.5503053680488589,
"grad_norm": 1.9049893617630005,
"learning_rate": 9.081500646830531e-06,
"loss": 1.0296,
"num_input_tokens_seen": 50054880,
"step": 428,
"train_runtime": 4842.7281,
"train_tokens_per_second": 10336.091
},
{
"epoch": 0.5515911282545806,
"grad_norm": 1.743492603302002,
"learning_rate": 9.055627425614489e-06,
"loss": 1.0613,
"num_input_tokens_seen": 50135776,
"step": 429,
"train_runtime": 4849.6827,
"train_tokens_per_second": 10337.95
},
{
"epoch": 0.5528768884603021,
"grad_norm": 1.752612590789795,
"learning_rate": 9.02975420439845e-06,
"loss": 1.0087,
"num_input_tokens_seen": 50233920,
"step": 430,
"train_runtime": 4858.229,
"train_tokens_per_second": 10339.965
},
{
"epoch": 0.5541626486660238,
"grad_norm": 1.793007493019104,
"learning_rate": 9.003880983182406e-06,
"loss": 1.0386,
"num_input_tokens_seen": 50364480,
"step": 431,
"train_runtime": 4870.2509,
"train_tokens_per_second": 10341.249
},
{
"epoch": 0.5554484088717454,
"grad_norm": 1.8837916851043701,
"learning_rate": 8.978007761966365e-06,
"loss": 1.0343,
"num_input_tokens_seen": 50477568,
"step": 432,
"train_runtime": 4880.2122,
"train_tokens_per_second": 10343.314
},
{
"epoch": 0.5567341690774671,
"grad_norm": 1.8399786949157715,
"learning_rate": 8.952134540750324e-06,
"loss": 1.0474,
"num_input_tokens_seen": 50587904,
"step": 433,
"train_runtime": 4889.8391,
"train_tokens_per_second": 10345.515
},
{
"epoch": 0.5580199292831887,
"grad_norm": 1.9835869073867798,
"learning_rate": 8.926261319534283e-06,
"loss": 1.0986,
"num_input_tokens_seen": 50748288,
"step": 434,
"train_runtime": 4904.8056,
"train_tokens_per_second": 10346.646
},
{
"epoch": 0.5593056894889104,
"grad_norm": 2.022273540496826,
"learning_rate": 8.90038809831824e-06,
"loss": 1.078,
"num_input_tokens_seen": 50829376,
"step": 435,
"train_runtime": 4911.6238,
"train_tokens_per_second": 10348.793
},
{
"epoch": 0.5605914496946319,
"grad_norm": 1.9517446756362915,
"learning_rate": 8.874514877102201e-06,
"loss": 1.0425,
"num_input_tokens_seen": 50990240,
"step": 436,
"train_runtime": 4927.2726,
"train_tokens_per_second": 10348.573
},
{
"epoch": 0.5618772099003536,
"grad_norm": 1.8184734582901,
"learning_rate": 8.848641655886159e-06,
"loss": 1.201,
"num_input_tokens_seen": 51092736,
"step": 437,
"train_runtime": 4936.1299,
"train_tokens_per_second": 10350.768
},
{
"epoch": 0.5631629701060752,
"grad_norm": 1.876457929611206,
"learning_rate": 8.822768434670118e-06,
"loss": 1.0678,
"num_input_tokens_seen": 51179680,
"step": 438,
"train_runtime": 4943.6088,
"train_tokens_per_second": 10352.696
},
{
"epoch": 0.5644487303117969,
"grad_norm": 1.8654677867889404,
"learning_rate": 8.796895213454075e-06,
"loss": 1.0735,
"num_input_tokens_seen": 51292160,
"step": 439,
"train_runtime": 4953.7338,
"train_tokens_per_second": 10354.242
},
{
"epoch": 0.5657344905175185,
"grad_norm": 1.7864034175872803,
"learning_rate": 8.771021992238035e-06,
"loss": 1.0005,
"num_input_tokens_seen": 51402400,
"step": 440,
"train_runtime": 4963.8198,
"train_tokens_per_second": 10355.412
},
{
"epoch": 0.5670202507232401,
"grad_norm": 1.8480334281921387,
"learning_rate": 8.745148771021993e-06,
"loss": 1.146,
"num_input_tokens_seen": 51503840,
"step": 441,
"train_runtime": 4972.6909,
"train_tokens_per_second": 10357.338
},
{
"epoch": 0.5683060109289617,
"grad_norm": 1.8786932229995728,
"learning_rate": 8.719275549805952e-06,
"loss": 1.032,
"num_input_tokens_seen": 51625920,
"step": 442,
"train_runtime": 4983.5486,
"train_tokens_per_second": 10359.269
},
{
"epoch": 0.5695917711346834,
"grad_norm": 1.8805335760116577,
"learning_rate": 8.69340232858991e-06,
"loss": 1.0604,
"num_input_tokens_seen": 51766848,
"step": 443,
"train_runtime": 4996.6032,
"train_tokens_per_second": 10360.408
},
{
"epoch": 0.570877531340405,
"grad_norm": 2.044856548309326,
"learning_rate": 8.66752910737387e-06,
"loss": 1.0327,
"num_input_tokens_seen": 51885568,
"step": 444,
"train_runtime": 5007.1763,
"train_tokens_per_second": 10362.241
},
{
"epoch": 0.5721632915461267,
"grad_norm": 1.7294365167617798,
"learning_rate": 8.641655886157827e-06,
"loss": 1.0273,
"num_input_tokens_seen": 51987968,
"step": 445,
"train_runtime": 5016.2418,
"train_tokens_per_second": 10363.928
},
{
"epoch": 0.5734490517518482,
"grad_norm": 1.9049499034881592,
"learning_rate": 8.615782664941786e-06,
"loss": 1.0087,
"num_input_tokens_seen": 52075232,
"step": 446,
"train_runtime": 5023.7352,
"train_tokens_per_second": 10365.839
},
{
"epoch": 0.5747348119575699,
"grad_norm": 1.995016098022461,
"learning_rate": 8.589909443725745e-06,
"loss": 1.082,
"num_input_tokens_seen": 52181120,
"step": 447,
"train_runtime": 5033.0217,
"train_tokens_per_second": 10367.752
},
{
"epoch": 0.5760205721632915,
"grad_norm": 1.8061517477035522,
"learning_rate": 8.564036222509704e-06,
"loss": 1.0338,
"num_input_tokens_seen": 52312864,
"step": 448,
"train_runtime": 5045.4751,
"train_tokens_per_second": 10368.273
},
{
"epoch": 0.5773063323690132,
"grad_norm": 1.906706690788269,
"learning_rate": 8.538163001293663e-06,
"loss": 1.0313,
"num_input_tokens_seen": 52492128,
"step": 449,
"train_runtime": 5062.8483,
"train_tokens_per_second": 10368.102
},
{
"epoch": 0.5785920925747348,
"grad_norm": 1.9607821702957153,
"learning_rate": 8.51228978007762e-06,
"loss": 1.0598,
"num_input_tokens_seen": 52580800,
"step": 450,
"train_runtime": 5070.3956,
"train_tokens_per_second": 10370.157
},
{
"epoch": 0.5798778527804564,
"grad_norm": 1.8769546747207642,
"learning_rate": 8.486416558861579e-06,
"loss": 1.0721,
"num_input_tokens_seen": 52715552,
"step": 451,
"train_runtime": 5099.7454,
"train_tokens_per_second": 10336.899
},
{
"epoch": 0.581163612986178,
"grad_norm": 1.8132247924804688,
"learning_rate": 8.460543337645536e-06,
"loss": 1.0979,
"num_input_tokens_seen": 52884896,
"step": 452,
"train_runtime": 5115.8206,
"train_tokens_per_second": 10337.52
},
{
"epoch": 0.5824493731918997,
"grad_norm": 1.8635915517807007,
"learning_rate": 8.434670116429497e-06,
"loss": 1.0368,
"num_input_tokens_seen": 53008224,
"step": 453,
"train_runtime": 5126.8881,
"train_tokens_per_second": 10339.259
},
{
"epoch": 0.5837351333976214,
"grad_norm": 1.903838038444519,
"learning_rate": 8.408796895213454e-06,
"loss": 0.9926,
"num_input_tokens_seen": 53141920,
"step": 454,
"train_runtime": 5138.9508,
"train_tokens_per_second": 10341.006
},
{
"epoch": 0.585020893603343,
"grad_norm": 1.836340069770813,
"learning_rate": 8.382923673997413e-06,
"loss": 1.0946,
"num_input_tokens_seen": 53272960,
"step": 455,
"train_runtime": 5150.7368,
"train_tokens_per_second": 10342.784
},
{
"epoch": 0.5863066538090647,
"grad_norm": 1.8196651935577393,
"learning_rate": 8.357050452781372e-06,
"loss": 1.0399,
"num_input_tokens_seen": 53416992,
"step": 456,
"train_runtime": 5163.847,
"train_tokens_per_second": 10344.418
},
{
"epoch": 0.5875924140147862,
"grad_norm": 1.8723372220993042,
"learning_rate": 8.331177231565331e-06,
"loss": 1.1476,
"num_input_tokens_seen": 53533632,
"step": 457,
"train_runtime": 5174.1711,
"train_tokens_per_second": 10346.32
},
{
"epoch": 0.5888781742205079,
"grad_norm": 1.8454405069351196,
"learning_rate": 8.305304010349288e-06,
"loss": 1.031,
"num_input_tokens_seen": 53631552,
"step": 458,
"train_runtime": 5182.534,
"train_tokens_per_second": 10348.519
},
{
"epoch": 0.5901639344262295,
"grad_norm": 1.9296767711639404,
"learning_rate": 8.279430789133249e-06,
"loss": 1.036,
"num_input_tokens_seen": 53754528,
"step": 459,
"train_runtime": 5193.4642,
"train_tokens_per_second": 10350.419
},
{
"epoch": 0.5914496946319512,
"grad_norm": 1.8463411331176758,
"learning_rate": 8.253557567917206e-06,
"loss": 0.9773,
"num_input_tokens_seen": 53828992,
"step": 460,
"train_runtime": 5199.7389,
"train_tokens_per_second": 10352.249
},
{
"epoch": 0.5927354548376728,
"grad_norm": 1.9723373651504517,
"learning_rate": 8.227684346701165e-06,
"loss": 1.1172,
"num_input_tokens_seen": 54010208,
"step": 461,
"train_runtime": 5217.2951,
"train_tokens_per_second": 10352.147
},
{
"epoch": 0.5940212150433944,
"grad_norm": 1.9189200401306152,
"learning_rate": 8.201811125485124e-06,
"loss": 1.0317,
"num_input_tokens_seen": 54134656,
"step": 462,
"train_runtime": 5228.207,
"train_tokens_per_second": 10354.344
},
{
"epoch": 0.595306975249116,
"grad_norm": 1.6208829879760742,
"learning_rate": 8.175937904269083e-06,
"loss": 0.9256,
"num_input_tokens_seen": 54268224,
"step": 463,
"train_runtime": 5240.6612,
"train_tokens_per_second": 10355.225
},
{
"epoch": 0.5965927354548377,
"grad_norm": 1.9756633043289185,
"learning_rate": 8.15006468305304e-06,
"loss": 1.0466,
"num_input_tokens_seen": 54384544,
"step": 464,
"train_runtime": 5251.3101,
"train_tokens_per_second": 10356.376
},
{
"epoch": 0.5978784956605593,
"grad_norm": 1.8915356397628784,
"learning_rate": 8.124191461837e-06,
"loss": 1.0826,
"num_input_tokens_seen": 54546208,
"step": 465,
"train_runtime": 5266.7741,
"train_tokens_per_second": 10356.664
},
{
"epoch": 0.599164255866281,
"grad_norm": 1.9341920614242554,
"learning_rate": 8.098318240620958e-06,
"loss": 1.0257,
"num_input_tokens_seen": 54644864,
"step": 466,
"train_runtime": 5275.3751,
"train_tokens_per_second": 10358.479
},
{
"epoch": 0.6004500160720025,
"grad_norm": 1.772900104522705,
"learning_rate": 8.072445019404917e-06,
"loss": 1.0155,
"num_input_tokens_seen": 54775808,
"step": 467,
"train_runtime": 5287.3482,
"train_tokens_per_second": 10359.788
},
{
"epoch": 0.6017357762777242,
"grad_norm": 1.8051958084106445,
"learning_rate": 8.046571798188875e-06,
"loss": 1.0296,
"num_input_tokens_seen": 54865024,
"step": 468,
"train_runtime": 5294.9344,
"train_tokens_per_second": 10361.795
},
{
"epoch": 0.6017357762777242,
"eval_loss": 1.104156732559204,
"eval_runtime": 22.4988,
"eval_samples_per_second": 44.18,
"eval_steps_per_second": 1.422,
"num_input_tokens_seen": 54865024,
"step": 468
},
{
"epoch": 0.6030215364834458,
"grad_norm": 1.9409384727478027,
"learning_rate": 8.020698576972833e-06,
"loss": 1.0859,
"num_input_tokens_seen": 55004192,
"step": 469,
"train_runtime": 5330.358,
"train_tokens_per_second": 10319.043
},
{
"epoch": 0.6043072966891675,
"grad_norm": 1.7463427782058716,
"learning_rate": 7.994825355756792e-06,
"loss": 1.0851,
"num_input_tokens_seen": 55115104,
"step": 470,
"train_runtime": 5340.0483,
"train_tokens_per_second": 10321.087
},
{
"epoch": 0.6055930568948891,
"grad_norm": 1.958573579788208,
"learning_rate": 7.96895213454075e-06,
"loss": 1.0175,
"num_input_tokens_seen": 55232576,
"step": 471,
"train_runtime": 5350.618,
"train_tokens_per_second": 10322.654
},
{
"epoch": 0.6068788171006108,
"grad_norm": 1.8370342254638672,
"learning_rate": 7.94307891332471e-06,
"loss": 1.0919,
"num_input_tokens_seen": 55327584,
"step": 472,
"train_runtime": 5358.7331,
"train_tokens_per_second": 10324.751
},
{
"epoch": 0.6081645773063323,
"grad_norm": 1.8849748373031616,
"learning_rate": 7.917205692108668e-06,
"loss": 1.061,
"num_input_tokens_seen": 55460224,
"step": 473,
"train_runtime": 5371.0369,
"train_tokens_per_second": 10325.795
},
{
"epoch": 0.609450337512054,
"grad_norm": 1.8478233814239502,
"learning_rate": 7.891332470892627e-06,
"loss": 1.0702,
"num_input_tokens_seen": 55603200,
"step": 474,
"train_runtime": 5384.0612,
"train_tokens_per_second": 10327.371
},
{
"epoch": 0.6107360977177756,
"grad_norm": 1.7144081592559814,
"learning_rate": 7.865459249676586e-06,
"loss": 1.0623,
"num_input_tokens_seen": 55715008,
"step": 475,
"train_runtime": 5393.8386,
"train_tokens_per_second": 10329.38
},
{
"epoch": 0.6120218579234973,
"grad_norm": 1.895750641822815,
"learning_rate": 7.839586028460545e-06,
"loss": 1.0541,
"num_input_tokens_seen": 55814400,
"step": 476,
"train_runtime": 5402.4312,
"train_tokens_per_second": 10331.349
},
{
"epoch": 0.6133076181292189,
"grad_norm": 1.997480034828186,
"learning_rate": 7.813712807244502e-06,
"loss": 1.1358,
"num_input_tokens_seen": 55905248,
"step": 477,
"train_runtime": 5410.2074,
"train_tokens_per_second": 10333.291
},
{
"epoch": 0.6145933783349405,
"grad_norm": 1.9574437141418457,
"learning_rate": 7.787839586028462e-06,
"loss": 1.0872,
"num_input_tokens_seen": 55996224,
"step": 478,
"train_runtime": 5418.1887,
"train_tokens_per_second": 10334.86
},
{
"epoch": 0.6158791385406621,
"grad_norm": 1.738667607307434,
"learning_rate": 7.76196636481242e-06,
"loss": 1.0266,
"num_input_tokens_seen": 56089024,
"step": 479,
"train_runtime": 5426.2457,
"train_tokens_per_second": 10336.617
},
{
"epoch": 0.6171648987463838,
"grad_norm": 1.8634562492370605,
"learning_rate": 7.736093143596379e-06,
"loss": 1.1175,
"num_input_tokens_seen": 56203232,
"step": 480,
"train_runtime": 5436.2029,
"train_tokens_per_second": 10338.693
},
{
"epoch": 0.6184506589521054,
"grad_norm": 1.8316950798034668,
"learning_rate": 7.710219922380336e-06,
"loss": 0.9945,
"num_input_tokens_seen": 56293504,
"step": 481,
"train_runtime": 5460.5999,
"train_tokens_per_second": 10309.033
},
{
"epoch": 0.6197364191578271,
"grad_norm": 1.9369782209396362,
"learning_rate": 7.684346701164297e-06,
"loss": 1.082,
"num_input_tokens_seen": 56402752,
"step": 482,
"train_runtime": 5470.187,
"train_tokens_per_second": 10310.937
},
{
"epoch": 0.6210221793635486,
"grad_norm": 1.7741248607635498,
"learning_rate": 7.658473479948254e-06,
"loss": 1.0357,
"num_input_tokens_seen": 56505376,
"step": 483,
"train_runtime": 5479.036,
"train_tokens_per_second": 10313.014
},
{
"epoch": 0.6223079395692703,
"grad_norm": 1.9275310039520264,
"learning_rate": 7.632600258732213e-06,
"loss": 1.0627,
"num_input_tokens_seen": 56607264,
"step": 484,
"train_runtime": 5487.9536,
"train_tokens_per_second": 10314.822
},
{
"epoch": 0.623593699774992,
"grad_norm": 1.8197015523910522,
"learning_rate": 7.606727037516172e-06,
"loss": 0.966,
"num_input_tokens_seen": 56736576,
"step": 485,
"train_runtime": 5500.0845,
"train_tokens_per_second": 10315.583
},
{
"epoch": 0.6248794599807136,
"grad_norm": 1.7420237064361572,
"learning_rate": 7.58085381630013e-06,
"loss": 1.0898,
"num_input_tokens_seen": 56832608,
"step": 486,
"train_runtime": 5508.3187,
"train_tokens_per_second": 10317.596
},
{
"epoch": 0.6261652201864353,
"grad_norm": 1.7904372215270996,
"learning_rate": 7.554980595084088e-06,
"loss": 0.9849,
"num_input_tokens_seen": 56918528,
"step": 487,
"train_runtime": 5515.7042,
"train_tokens_per_second": 10319.358
},
{
"epoch": 0.6274509803921569,
"grad_norm": 1.901534914970398,
"learning_rate": 7.529107373868048e-06,
"loss": 1.0978,
"num_input_tokens_seen": 57060512,
"step": 488,
"train_runtime": 5528.8699,
"train_tokens_per_second": 10320.466
},
{
"epoch": 0.6287367405978785,
"grad_norm": 1.8489160537719727,
"learning_rate": 7.503234152652006e-06,
"loss": 1.0536,
"num_input_tokens_seen": 57153408,
"step": 489,
"train_runtime": 5536.9185,
"train_tokens_per_second": 10322.241
},
{
"epoch": 0.6300225008036001,
"grad_norm": 1.8837651014328003,
"learning_rate": 7.477360931435964e-06,
"loss": 1.0979,
"num_input_tokens_seen": 57244704,
"step": 490,
"train_runtime": 5544.8307,
"train_tokens_per_second": 10323.977
},
{
"epoch": 0.6313082610093218,
"grad_norm": 1.9377018213272095,
"learning_rate": 7.451487710219923e-06,
"loss": 0.9867,
"num_input_tokens_seen": 57382048,
"step": 491,
"train_runtime": 5557.3194,
"train_tokens_per_second": 10325.49
},
{
"epoch": 0.6325940212150434,
"grad_norm": 1.971827507019043,
"learning_rate": 7.425614489003882e-06,
"loss": 1.1096,
"num_input_tokens_seen": 57526912,
"step": 492,
"train_runtime": 5570.7926,
"train_tokens_per_second": 10326.522
},
{
"epoch": 0.6338797814207651,
"grad_norm": 1.8177952766418457,
"learning_rate": 7.39974126778784e-06,
"loss": 1.0804,
"num_input_tokens_seen": 57651648,
"step": 493,
"train_runtime": 5582.2541,
"train_tokens_per_second": 10327.665
},
{
"epoch": 0.6351655416264866,
"grad_norm": 1.9560736417770386,
"learning_rate": 7.373868046571799e-06,
"loss": 1.0818,
"num_input_tokens_seen": 57742848,
"step": 494,
"train_runtime": 5590.0563,
"train_tokens_per_second": 10329.565
},
{
"epoch": 0.6364513018322083,
"grad_norm": 2.095134735107422,
"learning_rate": 7.347994825355757e-06,
"loss": 1.051,
"num_input_tokens_seen": 57848384,
"step": 495,
"train_runtime": 5599.5099,
"train_tokens_per_second": 10330.973
},
{
"epoch": 0.6377370620379299,
"grad_norm": 2.0076119899749756,
"learning_rate": 7.322121604139716e-06,
"loss": 1.1306,
"num_input_tokens_seen": 57996032,
"step": 496,
"train_runtime": 5613.6125,
"train_tokens_per_second": 10331.321
},
{
"epoch": 0.6390228222436516,
"grad_norm": 1.7557566165924072,
"learning_rate": 7.296248382923674e-06,
"loss": 0.9975,
"num_input_tokens_seen": 58088800,
"step": 497,
"train_runtime": 5621.5772,
"train_tokens_per_second": 10333.185
},
{
"epoch": 0.6403085824493732,
"grad_norm": 1.983188271522522,
"learning_rate": 7.270375161707633e-06,
"loss": 0.9731,
"num_input_tokens_seen": 58211040,
"step": 498,
"train_runtime": 5632.8912,
"train_tokens_per_second": 10334.132
},
{
"epoch": 0.6415943426550949,
"grad_norm": 1.955208659172058,
"learning_rate": 7.244501940491591e-06,
"loss": 1.0637,
"num_input_tokens_seen": 58334432,
"step": 499,
"train_runtime": 5644.1895,
"train_tokens_per_second": 10335.307
},
{
"epoch": 0.6428801028608164,
"grad_norm": 1.839125156402588,
"learning_rate": 7.21862871927555e-06,
"loss": 1.0653,
"num_input_tokens_seen": 58444576,
"step": 500,
"train_runtime": 5653.6395,
"train_tokens_per_second": 10337.514
},
{
"epoch": 0.6441658630665381,
"grad_norm": 1.8079696893692017,
"learning_rate": 7.192755498059509e-06,
"loss": 1.0928,
"num_input_tokens_seen": 58603360,
"step": 501,
"train_runtime": 5668.8043,
"train_tokens_per_second": 10337.87
},
{
"epoch": 0.6454516232722597,
"grad_norm": 1.7496858835220337,
"learning_rate": 7.166882276843467e-06,
"loss": 0.9713,
"num_input_tokens_seen": 58771264,
"step": 502,
"train_runtime": 5684.7051,
"train_tokens_per_second": 10338.49
},
{
"epoch": 0.6467373834779814,
"grad_norm": 2.015773057937622,
"learning_rate": 7.1410090556274255e-06,
"loss": 1.0992,
"num_input_tokens_seen": 58931392,
"step": 503,
"train_runtime": 5699.5505,
"train_tokens_per_second": 10339.656
},
{
"epoch": 0.648023143683703,
"grad_norm": 1.7812045812606812,
"learning_rate": 7.115135834411385e-06,
"loss": 1.0177,
"num_input_tokens_seen": 59031904,
"step": 504,
"train_runtime": 5708.5567,
"train_tokens_per_second": 10340.951
},
{
"epoch": 0.6493089038894246,
"grad_norm": 2.226012945175171,
"learning_rate": 7.089262613195343e-06,
"loss": 1.0775,
"num_input_tokens_seen": 59170880,
"step": 505,
"train_runtime": 5721.3851,
"train_tokens_per_second": 10342.055
},
{
"epoch": 0.6505946640951462,
"grad_norm": 1.7196251153945923,
"learning_rate": 7.0633893919793015e-06,
"loss": 1.0867,
"num_input_tokens_seen": 59305920,
"step": 506,
"train_runtime": 5733.791,
"train_tokens_per_second": 10343.23
},
{
"epoch": 0.6518804243008679,
"grad_norm": 2.0985634326934814,
"learning_rate": 7.037516170763261e-06,
"loss": 1.0544,
"num_input_tokens_seen": 59429280,
"step": 507,
"train_runtime": 5744.9517,
"train_tokens_per_second": 10344.609
},
{
"epoch": 0.6531661845065895,
"grad_norm": 1.983805775642395,
"learning_rate": 7.0116429495472195e-06,
"loss": 0.9989,
"num_input_tokens_seen": 59511424,
"step": 508,
"train_runtime": 5751.8269,
"train_tokens_per_second": 10346.525
},
{
"epoch": 0.6544519447123112,
"grad_norm": 1.8357391357421875,
"learning_rate": 6.985769728331178e-06,
"loss": 1.0282,
"num_input_tokens_seen": 59629280,
"step": 509,
"train_runtime": 5762.4785,
"train_tokens_per_second": 10347.853
},
{
"epoch": 0.6557377049180327,
"grad_norm": 1.8154447078704834,
"learning_rate": 6.959896507115136e-06,
"loss": 1.0676,
"num_input_tokens_seen": 59728704,
"step": 510,
"train_runtime": 5771.0809,
"train_tokens_per_second": 10349.656
},
{
"epoch": 0.6570234651237544,
"grad_norm": 1.966147541999817,
"learning_rate": 6.9340232858990955e-06,
"loss": 1.1222,
"num_input_tokens_seen": 59858304,
"step": 511,
"train_runtime": 5799.4165,
"train_tokens_per_second": 10321.436
},
{
"epoch": 0.658309225329476,
"grad_norm": 1.942854404449463,
"learning_rate": 6.908150064683054e-06,
"loss": 1.1369,
"num_input_tokens_seen": 59962496,
"step": 512,
"train_runtime": 5808.3201,
"train_tokens_per_second": 10323.552
},
{
"epoch": 0.6595949855351977,
"grad_norm": 2.0717549324035645,
"learning_rate": 6.882276843467012e-06,
"loss": 1.0623,
"num_input_tokens_seen": 60104320,
"step": 513,
"train_runtime": 5821.4241,
"train_tokens_per_second": 10324.676
},
{
"epoch": 0.6608807457409194,
"grad_norm": 2.0552477836608887,
"learning_rate": 6.856403622250971e-06,
"loss": 1.079,
"num_input_tokens_seen": 60239488,
"step": 514,
"train_runtime": 5833.6761,
"train_tokens_per_second": 10326.163
},
{
"epoch": 0.662166505946641,
"grad_norm": 1.8785006999969482,
"learning_rate": 6.83053040103493e-06,
"loss": 1.0287,
"num_input_tokens_seen": 60372960,
"step": 515,
"train_runtime": 5846.0146,
"train_tokens_per_second": 10327.2
},
{
"epoch": 0.6634522661523626,
"grad_norm": 2.1240034103393555,
"learning_rate": 6.804657179818888e-06,
"loss": 1.093,
"num_input_tokens_seen": 60524480,
"step": 516,
"train_runtime": 5860.475,
"train_tokens_per_second": 10327.572
},
{
"epoch": 0.6647380263580842,
"grad_norm": 1.815077304840088,
"learning_rate": 6.778783958602847e-06,
"loss": 1.0346,
"num_input_tokens_seen": 60655744,
"step": 517,
"train_runtime": 5872.4212,
"train_tokens_per_second": 10328.916
},
{
"epoch": 0.6660237865638059,
"grad_norm": 1.8126624822616577,
"learning_rate": 6.752910737386805e-06,
"loss": 1.0734,
"num_input_tokens_seen": 60770176,
"step": 518,
"train_runtime": 5882.5093,
"train_tokens_per_second": 10330.655
},
{
"epoch": 0.6673095467695275,
"grad_norm": 1.7896870374679565,
"learning_rate": 6.727037516170764e-06,
"loss": 1.0592,
"num_input_tokens_seen": 60889088,
"step": 519,
"train_runtime": 5892.9745,
"train_tokens_per_second": 10332.488
},
{
"epoch": 0.6685953069752492,
"grad_norm": 1.8001877069473267,
"learning_rate": 6.701164294954723e-06,
"loss": 0.9968,
"num_input_tokens_seen": 61065792,
"step": 520,
"train_runtime": 5909.8573,
"train_tokens_per_second": 10332.871
},
{
"epoch": 0.6698810671809707,
"grad_norm": 1.8801597356796265,
"learning_rate": 6.675291073738681e-06,
"loss": 1.0645,
"num_input_tokens_seen": 61235808,
"step": 521,
"train_runtime": 5926.3712,
"train_tokens_per_second": 10332.766
},
{
"epoch": 0.6711668273866924,
"grad_norm": 1.8804895877838135,
"learning_rate": 6.649417852522639e-06,
"loss": 1.0528,
"num_input_tokens_seen": 61393632,
"step": 522,
"train_runtime": 5940.9242,
"train_tokens_per_second": 10334.02
},
{
"epoch": 0.672452587592414,
"grad_norm": 1.9801836013793945,
"learning_rate": 6.623544631306599e-06,
"loss": 1.1185,
"num_input_tokens_seen": 61529632,
"step": 523,
"train_runtime": 5953.2464,
"train_tokens_per_second": 10335.475
},
{
"epoch": 0.6737383477981357,
"grad_norm": 1.8925362825393677,
"learning_rate": 6.597671410090557e-06,
"loss": 1.1512,
"num_input_tokens_seen": 61631840,
"step": 524,
"train_runtime": 5962.0027,
"train_tokens_per_second": 10337.439
},
{
"epoch": 0.6750241080038573,
"grad_norm": 1.7096664905548096,
"learning_rate": 6.571798188874515e-06,
"loss": 1.0007,
"num_input_tokens_seen": 61719392,
"step": 525,
"train_runtime": 5969.4912,
"train_tokens_per_second": 10339.138
},
{
"epoch": 0.676309868209579,
"grad_norm": 1.7562854290008545,
"learning_rate": 6.545924967658473e-06,
"loss": 0.9808,
"num_input_tokens_seen": 61904448,
"step": 526,
"train_runtime": 5987.4689,
"train_tokens_per_second": 10339.001
},
{
"epoch": 0.6775956284153005,
"grad_norm": 1.9827765226364136,
"learning_rate": 6.520051746442433e-06,
"loss": 1.0306,
"num_input_tokens_seen": 62045888,
"step": 527,
"train_runtime": 6000.3698,
"train_tokens_per_second": 10340.344
},
{
"epoch": 0.6788813886210222,
"grad_norm": 1.9799909591674805,
"learning_rate": 6.494178525226391e-06,
"loss": 0.9475,
"num_input_tokens_seen": 62144736,
"step": 528,
"train_runtime": 6008.9407,
"train_tokens_per_second": 10342.045
},
{
"epoch": 0.6801671488267438,
"grad_norm": 1.928503155708313,
"learning_rate": 6.468305304010349e-06,
"loss": 0.973,
"num_input_tokens_seen": 62266400,
"step": 529,
"train_runtime": 6019.7454,
"train_tokens_per_second": 10343.693
},
{
"epoch": 0.6814529090324655,
"grad_norm": 1.9949895143508911,
"learning_rate": 6.442432082794309e-06,
"loss": 1.1023,
"num_input_tokens_seen": 62377888,
"step": 530,
"train_runtime": 6029.3488,
"train_tokens_per_second": 10345.709
},
{
"epoch": 0.682738669238187,
"grad_norm": 1.8765671253204346,
"learning_rate": 6.416558861578267e-06,
"loss": 1.0263,
"num_input_tokens_seen": 62462016,
"step": 531,
"train_runtime": 6036.392,
"train_tokens_per_second": 10347.574
},
{
"epoch": 0.6840244294439087,
"grad_norm": 1.9741531610488892,
"learning_rate": 6.390685640362225e-06,
"loss": 1.2246,
"num_input_tokens_seen": 62610176,
"step": 532,
"train_runtime": 6050.1111,
"train_tokens_per_second": 10348.599
},
{
"epoch": 0.6853101896496303,
"grad_norm": 1.8716306686401367,
"learning_rate": 6.364812419146185e-06,
"loss": 1.0364,
"num_input_tokens_seen": 62709280,
"step": 533,
"train_runtime": 6058.5723,
"train_tokens_per_second": 10350.505
},
{
"epoch": 0.686595949855352,
"grad_norm": 1.8738210201263428,
"learning_rate": 6.338939197930143e-06,
"loss": 1.0923,
"num_input_tokens_seen": 62874912,
"step": 534,
"train_runtime": 6074.0138,
"train_tokens_per_second": 10351.46
},
{
"epoch": 0.6878817100610736,
"grad_norm": 1.8222072124481201,
"learning_rate": 6.313065976714101e-06,
"loss": 1.0699,
"num_input_tokens_seen": 62994208,
"step": 535,
"train_runtime": 6084.6192,
"train_tokens_per_second": 10353.024
},
{
"epoch": 0.6891674702667953,
"grad_norm": 1.8478925228118896,
"learning_rate": 6.28719275549806e-06,
"loss": 1.1806,
"num_input_tokens_seen": 63145056,
"step": 536,
"train_runtime": 6098.4851,
"train_tokens_per_second": 10354.22
},
{
"epoch": 0.6904532304725168,
"grad_norm": 2.016186475753784,
"learning_rate": 6.261319534282018e-06,
"loss": 1.0304,
"num_input_tokens_seen": 63269120,
"step": 537,
"train_runtime": 6110.0516,
"train_tokens_per_second": 10354.924
},
{
"epoch": 0.6917389906782385,
"grad_norm": 1.8224762678146362,
"learning_rate": 6.235446313065977e-06,
"loss": 1.0067,
"num_input_tokens_seen": 63415744,
"step": 538,
"train_runtime": 6123.7782,
"train_tokens_per_second": 10355.657
},
{
"epoch": 0.6930247508839601,
"grad_norm": 1.7332342863082886,
"learning_rate": 6.2095730918499354e-06,
"loss": 1.0274,
"num_input_tokens_seen": 63508160,
"step": 539,
"train_runtime": 6131.7391,
"train_tokens_per_second": 10357.283
},
{
"epoch": 0.6943105110896818,
"grad_norm": 1.7827410697937012,
"learning_rate": 6.183699870633894e-06,
"loss": 1.0193,
"num_input_tokens_seen": 63661440,
"step": 540,
"train_runtime": 6146.5269,
"train_tokens_per_second": 10357.303
},
{
"epoch": 0.6955962712954034,
"grad_norm": 2.020627498626709,
"learning_rate": 6.1578266494178525e-06,
"loss": 1.0964,
"num_input_tokens_seen": 63780032,
"step": 541,
"train_runtime": 6173.4887,
"train_tokens_per_second": 10331.279
},
{
"epoch": 0.696882031501125,
"grad_norm": 1.7501956224441528,
"learning_rate": 6.1319534282018115e-06,
"loss": 1.0793,
"num_input_tokens_seen": 63918880,
"step": 542,
"train_runtime": 6185.9809,
"train_tokens_per_second": 10332.861
},
{
"epoch": 0.6981677917068466,
"grad_norm": 1.8000164031982422,
"learning_rate": 6.1060802069857704e-06,
"loss": 0.9915,
"num_input_tokens_seen": 64021696,
"step": 543,
"train_runtime": 6194.7919,
"train_tokens_per_second": 10334.761
},
{
"epoch": 0.6994535519125683,
"grad_norm": 1.771580696105957,
"learning_rate": 6.0802069857697286e-06,
"loss": 1.0623,
"num_input_tokens_seen": 64140384,
"step": 544,
"train_runtime": 6205.2559,
"train_tokens_per_second": 10336.461
},
{
"epoch": 0.70073931211829,
"grad_norm": 1.9515384435653687,
"learning_rate": 6.054333764553687e-06,
"loss": 1.1481,
"num_input_tokens_seen": 64242624,
"step": 545,
"train_runtime": 6214.1214,
"train_tokens_per_second": 10338.167
},
{
"epoch": 0.7020250723240116,
"grad_norm": 1.8691986799240112,
"learning_rate": 6.0284605433376465e-06,
"loss": 1.0209,
"num_input_tokens_seen": 64314496,
"step": 546,
"train_runtime": 6220.1913,
"train_tokens_per_second": 10339.633
},
{
"epoch": 0.7020250723240116,
"eval_loss": 1.102497935295105,
"eval_runtime": 22.3274,
"eval_samples_per_second": 44.519,
"eval_steps_per_second": 1.433,
"num_input_tokens_seen": 64314496,
"step": 546
},
{
"epoch": 0.7033108325297333,
"grad_norm": 1.691506266593933,
"learning_rate": 6.002587322121605e-06,
"loss": 0.9789,
"num_input_tokens_seen": 64429248,
"step": 547,
"train_runtime": 6252.5897,
"train_tokens_per_second": 10304.41
},
{
"epoch": 0.7045965927354548,
"grad_norm": 1.7860418558120728,
"learning_rate": 5.976714100905563e-06,
"loss": 1.0317,
"num_input_tokens_seen": 64559776,
"step": 548,
"train_runtime": 6264.281,
"train_tokens_per_second": 10306.015
},
{
"epoch": 0.7058823529411765,
"grad_norm": 2.1169979572296143,
"learning_rate": 5.9508408796895225e-06,
"loss": 1.0426,
"num_input_tokens_seen": 64683264,
"step": 549,
"train_runtime": 6275.2924,
"train_tokens_per_second": 10307.61
},
{
"epoch": 0.7071681131468981,
"grad_norm": 1.937103271484375,
"learning_rate": 5.924967658473481e-06,
"loss": 1.0845,
"num_input_tokens_seen": 64821728,
"step": 550,
"train_runtime": 6288.0189,
"train_tokens_per_second": 10308.768
},
{
"epoch": 0.7084538733526198,
"grad_norm": 1.8114924430847168,
"learning_rate": 5.899094437257439e-06,
"loss": 1.0205,
"num_input_tokens_seen": 64920384,
"step": 551,
"train_runtime": 6296.4281,
"train_tokens_per_second": 10310.669
},
{
"epoch": 0.7097396335583414,
"grad_norm": 1.9015802145004272,
"learning_rate": 5.8732212160413986e-06,
"loss": 1.0589,
"num_input_tokens_seen": 65041088,
"step": 552,
"train_runtime": 6307.1492,
"train_tokens_per_second": 10312.28
},
{
"epoch": 0.711025393764063,
"grad_norm": 1.871267318725586,
"learning_rate": 5.847347994825357e-06,
"loss": 1.0599,
"num_input_tokens_seen": 65166368,
"step": 553,
"train_runtime": 6318.2983,
"train_tokens_per_second": 10313.911
},
{
"epoch": 0.7123111539697846,
"grad_norm": 1.7762296199798584,
"learning_rate": 5.821474773609315e-06,
"loss": 1.1277,
"num_input_tokens_seen": 65256192,
"step": 554,
"train_runtime": 6326.0044,
"train_tokens_per_second": 10315.546
},
{
"epoch": 0.7135969141755063,
"grad_norm": 2.015854835510254,
"learning_rate": 5.795601552393273e-06,
"loss": 1.048,
"num_input_tokens_seen": 65379488,
"step": 555,
"train_runtime": 6337.3792,
"train_tokens_per_second": 10316.487
},
{
"epoch": 0.7148826743812279,
"grad_norm": 1.9349653720855713,
"learning_rate": 5.769728331177233e-06,
"loss": 1.0893,
"num_input_tokens_seen": 65530368,
"step": 556,
"train_runtime": 6351.5436,
"train_tokens_per_second": 10317.235
},
{
"epoch": 0.7161684345869496,
"grad_norm": 1.8240134716033936,
"learning_rate": 5.743855109961191e-06,
"loss": 1.0671,
"num_input_tokens_seen": 65613952,
"step": 557,
"train_runtime": 6358.6261,
"train_tokens_per_second": 10318.888
},
{
"epoch": 0.7174541947926711,
"grad_norm": 1.8752096891403198,
"learning_rate": 5.717981888745149e-06,
"loss": 1.0451,
"num_input_tokens_seen": 65725792,
"step": 558,
"train_runtime": 6368.3372,
"train_tokens_per_second": 10320.715
},
{
"epoch": 0.7187399549983928,
"grad_norm": 1.9915884733200073,
"learning_rate": 5.692108667529108e-06,
"loss": 1.0574,
"num_input_tokens_seen": 65807680,
"step": 559,
"train_runtime": 6375.3518,
"train_tokens_per_second": 10322.204
},
{
"epoch": 0.7200257152041144,
"grad_norm": 1.7847318649291992,
"learning_rate": 5.666235446313066e-06,
"loss": 1.061,
"num_input_tokens_seen": 65905312,
"step": 560,
"train_runtime": 6383.8117,
"train_tokens_per_second": 10323.818
},
{
"epoch": 0.7213114754098361,
"grad_norm": 1.7851864099502563,
"learning_rate": 5.640362225097025e-06,
"loss": 0.9781,
"num_input_tokens_seen": 66025056,
"step": 561,
"train_runtime": 6394.6288,
"train_tokens_per_second": 10325.08
},
{
"epoch": 0.7225972356155577,
"grad_norm": 2.038956642150879,
"learning_rate": 5.614489003880984e-06,
"loss": 1.1079,
"num_input_tokens_seen": 66161536,
"step": 562,
"train_runtime": 6406.936,
"train_tokens_per_second": 10326.549
},
{
"epoch": 0.7238829958212794,
"grad_norm": 1.8547343015670776,
"learning_rate": 5.588615782664942e-06,
"loss": 0.9582,
"num_input_tokens_seen": 66301920,
"step": 563,
"train_runtime": 6419.8653,
"train_tokens_per_second": 10327.619
},
{
"epoch": 0.7251687560270009,
"grad_norm": 1.8734216690063477,
"learning_rate": 5.5627425614489e-06,
"loss": 1.1257,
"num_input_tokens_seen": 66416448,
"step": 564,
"train_runtime": 6430.0471,
"train_tokens_per_second": 10329.076
},
{
"epoch": 0.7264545162327226,
"grad_norm": 1.9347343444824219,
"learning_rate": 5.53686934023286e-06,
"loss": 1.0665,
"num_input_tokens_seen": 66504544,
"step": 565,
"train_runtime": 6437.5545,
"train_tokens_per_second": 10330.715
},
{
"epoch": 0.7277402764384442,
"grad_norm": 1.8810735940933228,
"learning_rate": 5.510996119016818e-06,
"loss": 1.0375,
"num_input_tokens_seen": 66656448,
"step": 566,
"train_runtime": 6451.7561,
"train_tokens_per_second": 10331.52
},
{
"epoch": 0.7290260366441659,
"grad_norm": 1.837829351425171,
"learning_rate": 5.485122897800776e-06,
"loss": 1.0713,
"num_input_tokens_seen": 66759904,
"step": 567,
"train_runtime": 6460.6494,
"train_tokens_per_second": 10333.312
},
{
"epoch": 0.7303117968498875,
"grad_norm": 1.9980813264846802,
"learning_rate": 5.459249676584734e-06,
"loss": 0.9986,
"num_input_tokens_seen": 66894848,
"step": 568,
"train_runtime": 6473.0889,
"train_tokens_per_second": 10334.301
},
{
"epoch": 0.7315975570556091,
"grad_norm": 1.976579189300537,
"learning_rate": 5.433376455368694e-06,
"loss": 1.1012,
"num_input_tokens_seen": 66996128,
"step": 569,
"train_runtime": 6481.9025,
"train_tokens_per_second": 10335.874
},
{
"epoch": 0.7328833172613307,
"grad_norm": 1.903847336769104,
"learning_rate": 5.407503234152652e-06,
"loss": 1.0675,
"num_input_tokens_seen": 67141920,
"step": 570,
"train_runtime": 6495.5236,
"train_tokens_per_second": 10336.645
},
{
"epoch": 0.7341690774670524,
"grad_norm": 1.9221888780593872,
"learning_rate": 5.38163001293661e-06,
"loss": 1.0781,
"num_input_tokens_seen": 67290336,
"step": 571,
"train_runtime": 6525.8926,
"train_tokens_per_second": 10311.285
},
{
"epoch": 0.735454837672774,
"grad_norm": 1.808961033821106,
"learning_rate": 5.35575679172057e-06,
"loss": 1.1462,
"num_input_tokens_seen": 67395424,
"step": 572,
"train_runtime": 6534.8507,
"train_tokens_per_second": 10313.231
},
{
"epoch": 0.7367405978784957,
"grad_norm": 1.8847907781600952,
"learning_rate": 5.329883570504528e-06,
"loss": 1.0736,
"num_input_tokens_seen": 67521888,
"step": 573,
"train_runtime": 6545.9199,
"train_tokens_per_second": 10315.111
},
{
"epoch": 0.7380263580842173,
"grad_norm": 1.8549025058746338,
"learning_rate": 5.304010349288486e-06,
"loss": 1.0503,
"num_input_tokens_seen": 67665568,
"step": 574,
"train_runtime": 6559.1726,
"train_tokens_per_second": 10316.174
},
{
"epoch": 0.7393121182899389,
"grad_norm": 1.9307861328125,
"learning_rate": 5.278137128072446e-06,
"loss": 1.1438,
"num_input_tokens_seen": 67774688,
"step": 575,
"train_runtime": 6568.6043,
"train_tokens_per_second": 10317.974
},
{
"epoch": 0.7405978784956606,
"grad_norm": 1.9152367115020752,
"learning_rate": 5.252263906856404e-06,
"loss": 1.0097,
"num_input_tokens_seen": 67861824,
"step": 576,
"train_runtime": 6575.9557,
"train_tokens_per_second": 10319.69
},
{
"epoch": 0.7418836387013822,
"grad_norm": 1.8602268695831299,
"learning_rate": 5.2263906856403625e-06,
"loss": 1.0663,
"num_input_tokens_seen": 67982592,
"step": 577,
"train_runtime": 6586.8236,
"train_tokens_per_second": 10320.998
},
{
"epoch": 0.7431693989071039,
"grad_norm": 1.928527593612671,
"learning_rate": 5.200517464424321e-06,
"loss": 1.1119,
"num_input_tokens_seen": 68088704,
"step": 578,
"train_runtime": 6595.9873,
"train_tokens_per_second": 10322.746
},
{
"epoch": 0.7444551591128254,
"grad_norm": 2.0047895908355713,
"learning_rate": 5.17464424320828e-06,
"loss": 1.0698,
"num_input_tokens_seen": 68230048,
"step": 579,
"train_runtime": 6608.8637,
"train_tokens_per_second": 10324.021
},
{
"epoch": 0.7457409193185471,
"grad_norm": 1.8268404006958008,
"learning_rate": 5.1487710219922385e-06,
"loss": 1.0993,
"num_input_tokens_seen": 68349472,
"step": 580,
"train_runtime": 6619.3705,
"train_tokens_per_second": 10325.676
},
{
"epoch": 0.7470266795242687,
"grad_norm": 2.0684757232666016,
"learning_rate": 5.1228978007761975e-06,
"loss": 1.0588,
"num_input_tokens_seen": 68470720,
"step": 581,
"train_runtime": 6630.3909,
"train_tokens_per_second": 10326.8
},
{
"epoch": 0.7483124397299904,
"grad_norm": 1.9927403926849365,
"learning_rate": 5.0970245795601556e-06,
"loss": 1.0661,
"num_input_tokens_seen": 68583616,
"step": 582,
"train_runtime": 6640.5867,
"train_tokens_per_second": 10327.945
},
{
"epoch": 0.749598199935712,
"grad_norm": 1.9514095783233643,
"learning_rate": 5.071151358344114e-06,
"loss": 1.0833,
"num_input_tokens_seen": 68700480,
"step": 583,
"train_runtime": 6650.9406,
"train_tokens_per_second": 10329.438
},
{
"epoch": 0.7508839601414337,
"grad_norm": 2.018437623977661,
"learning_rate": 5.045278137128073e-06,
"loss": 1.0668,
"num_input_tokens_seen": 68822336,
"step": 584,
"train_runtime": 6661.8349,
"train_tokens_per_second": 10330.838
},
{
"epoch": 0.7521697203471552,
"grad_norm": 1.8875172138214111,
"learning_rate": 5.019404915912032e-06,
"loss": 1.0462,
"num_input_tokens_seen": 68951936,
"step": 585,
"train_runtime": 6673.1759,
"train_tokens_per_second": 10332.702
},
{
"epoch": 0.7534554805528769,
"grad_norm": 1.818596363067627,
"learning_rate": 4.99353169469599e-06,
"loss": 1.04,
"num_input_tokens_seen": 69135360,
"step": 586,
"train_runtime": 6690.4234,
"train_tokens_per_second": 10333.48
},
{
"epoch": 0.7547412407585985,
"grad_norm": 1.750368595123291,
"learning_rate": 4.967658473479949e-06,
"loss": 1.0268,
"num_input_tokens_seen": 69267744,
"step": 587,
"train_runtime": 6702.7098,
"train_tokens_per_second": 10334.29
},
{
"epoch": 0.7560270009643202,
"grad_norm": 1.8207074403762817,
"learning_rate": 4.941785252263907e-06,
"loss": 1.0989,
"num_input_tokens_seen": 69370016,
"step": 588,
"train_runtime": 6711.6974,
"train_tokens_per_second": 10335.689
},
{
"epoch": 0.7573127611700418,
"grad_norm": 1.9229310750961304,
"learning_rate": 4.915912031047866e-06,
"loss": 1.1032,
"num_input_tokens_seen": 69495744,
"step": 589,
"train_runtime": 6722.8508,
"train_tokens_per_second": 10337.243
},
{
"epoch": 0.7585985213757634,
"grad_norm": 1.8761484622955322,
"learning_rate": 4.890038809831825e-06,
"loss": 1.0723,
"num_input_tokens_seen": 69637824,
"step": 590,
"train_runtime": 6735.7596,
"train_tokens_per_second": 10338.526
},
{
"epoch": 0.759884281581485,
"grad_norm": 1.9209434986114502,
"learning_rate": 4.864165588615783e-06,
"loss": 1.0539,
"num_input_tokens_seen": 69746688,
"step": 591,
"train_runtime": 6745.3898,
"train_tokens_per_second": 10339.905
},
{
"epoch": 0.7611700417872067,
"grad_norm": 1.8482396602630615,
"learning_rate": 4.838292367399742e-06,
"loss": 1.1362,
"num_input_tokens_seen": 69896288,
"step": 592,
"train_runtime": 6759.169,
"train_tokens_per_second": 10340.959
},
{
"epoch": 0.7624558019929283,
"grad_norm": 1.7221297025680542,
"learning_rate": 4.812419146183701e-06,
"loss": 1.0768,
"num_input_tokens_seen": 69981248,
"step": 593,
"train_runtime": 6766.3944,
"train_tokens_per_second": 10342.473
},
{
"epoch": 0.76374156219865,
"grad_norm": 1.803056240081787,
"learning_rate": 4.786545924967659e-06,
"loss": 1.0445,
"num_input_tokens_seen": 70077920,
"step": 594,
"train_runtime": 6774.6332,
"train_tokens_per_second": 10344.165
},
{
"epoch": 0.7650273224043715,
"grad_norm": 2.036080837249756,
"learning_rate": 4.760672703751618e-06,
"loss": 1.0569,
"num_input_tokens_seen": 70207136,
"step": 595,
"train_runtime": 6786.3397,
"train_tokens_per_second": 10345.361
},
{
"epoch": 0.7663130826100932,
"grad_norm": 1.8578526973724365,
"learning_rate": 4.734799482535576e-06,
"loss": 1.0575,
"num_input_tokens_seen": 70295488,
"step": 596,
"train_runtime": 6793.831,
"train_tokens_per_second": 10346.959
},
{
"epoch": 0.7675988428158148,
"grad_norm": 1.8725582361221313,
"learning_rate": 4.708926261319535e-06,
"loss": 1.0409,
"num_input_tokens_seen": 70387808,
"step": 597,
"train_runtime": 6801.6342,
"train_tokens_per_second": 10348.661
},
{
"epoch": 0.7688846030215365,
"grad_norm": 1.8751484155654907,
"learning_rate": 4.683053040103494e-06,
"loss": 1.0569,
"num_input_tokens_seen": 70502912,
"step": 598,
"train_runtime": 6811.7789,
"train_tokens_per_second": 10350.147
},
{
"epoch": 0.7701703632272581,
"grad_norm": 1.832022786140442,
"learning_rate": 4.657179818887452e-06,
"loss": 1.0852,
"num_input_tokens_seen": 70629696,
"step": 599,
"train_runtime": 6822.8214,
"train_tokens_per_second": 10351.978
},
{
"epoch": 0.7714561234329798,
"grad_norm": 1.9740808010101318,
"learning_rate": 4.631306597671411e-06,
"loss": 1.0614,
"num_input_tokens_seen": 70732640,
"step": 600,
"train_runtime": 6831.678,
"train_tokens_per_second": 10353.626
},
{
"epoch": 0.7727418836387013,
"grad_norm": 1.9888503551483154,
"learning_rate": 4.605433376455369e-06,
"loss": 1.1406,
"num_input_tokens_seen": 70851840,
"step": 601,
"train_runtime": 6859.0779,
"train_tokens_per_second": 10329.645
},
{
"epoch": 0.774027643844423,
"grad_norm": 2.011823892593384,
"learning_rate": 4.579560155239328e-06,
"loss": 1.0582,
"num_input_tokens_seen": 70977120,
"step": 602,
"train_runtime": 6870.6102,
"train_tokens_per_second": 10330.541
},
{
"epoch": 0.7753134040501446,
"grad_norm": 1.8113346099853516,
"learning_rate": 4.553686934023286e-06,
"loss": 1.0753,
"num_input_tokens_seen": 71089760,
"step": 603,
"train_runtime": 6880.2562,
"train_tokens_per_second": 10332.429
},
{
"epoch": 0.7765991642558663,
"grad_norm": 1.8886075019836426,
"learning_rate": 4.527813712807244e-06,
"loss": 1.067,
"num_input_tokens_seen": 71200000,
"step": 604,
"train_runtime": 6889.8418,
"train_tokens_per_second": 10334.054
},
{
"epoch": 0.777884924461588,
"grad_norm": 1.803390622138977,
"learning_rate": 4.501940491591203e-06,
"loss": 1.0229,
"num_input_tokens_seen": 71313984,
"step": 605,
"train_runtime": 6899.7826,
"train_tokens_per_second": 10335.686
},
{
"epoch": 0.7791706846673095,
"grad_norm": 1.9048407077789307,
"learning_rate": 4.476067270375162e-06,
"loss": 1.1005,
"num_input_tokens_seen": 71454176,
"step": 606,
"train_runtime": 6912.9278,
"train_tokens_per_second": 10336.312
},
{
"epoch": 0.7804564448730312,
"grad_norm": 1.7786400318145752,
"learning_rate": 4.45019404915912e-06,
"loss": 1.0786,
"num_input_tokens_seen": 71608032,
"step": 607,
"train_runtime": 6927.2874,
"train_tokens_per_second": 10337.096
},
{
"epoch": 0.7817422050787528,
"grad_norm": 1.9795823097229004,
"learning_rate": 4.424320827943079e-06,
"loss": 1.1182,
"num_input_tokens_seen": 71703232,
"step": 608,
"train_runtime": 6935.3945,
"train_tokens_per_second": 10338.739
},
{
"epoch": 0.7830279652844745,
"grad_norm": 2.045689821243286,
"learning_rate": 4.398447606727037e-06,
"loss": 1.0731,
"num_input_tokens_seen": 71800608,
"step": 609,
"train_runtime": 6943.76,
"train_tokens_per_second": 10340.307
},
{
"epoch": 0.7843137254901961,
"grad_norm": 1.9164133071899414,
"learning_rate": 4.372574385510996e-06,
"loss": 1.0076,
"num_input_tokens_seen": 71902688,
"step": 610,
"train_runtime": 6952.5948,
"train_tokens_per_second": 10341.849
},
{
"epoch": 0.7855994856959178,
"grad_norm": 1.7875125408172607,
"learning_rate": 4.346701164294955e-06,
"loss": 1.0059,
"num_input_tokens_seen": 71999488,
"step": 611,
"train_runtime": 6960.8799,
"train_tokens_per_second": 10343.446
},
{
"epoch": 0.7868852459016393,
"grad_norm": 1.7959182262420654,
"learning_rate": 4.3208279430789134e-06,
"loss": 1.001,
"num_input_tokens_seen": 72127648,
"step": 612,
"train_runtime": 6972.1724,
"train_tokens_per_second": 10345.075
},
{
"epoch": 0.788171006107361,
"grad_norm": 1.9085074663162231,
"learning_rate": 4.294954721862872e-06,
"loss": 1.0613,
"num_input_tokens_seen": 72236512,
"step": 613,
"train_runtime": 6981.6576,
"train_tokens_per_second": 10346.613
},
{
"epoch": 0.7894567663130826,
"grad_norm": 1.923269271850586,
"learning_rate": 4.269081500646831e-06,
"loss": 1.0021,
"num_input_tokens_seen": 72331104,
"step": 614,
"train_runtime": 6989.7253,
"train_tokens_per_second": 10348.204
},
{
"epoch": 0.7907425265188043,
"grad_norm": 1.7725319862365723,
"learning_rate": 4.2432082794307895e-06,
"loss": 1.0252,
"num_input_tokens_seen": 72470080,
"step": 615,
"train_runtime": 7002.3646,
"train_tokens_per_second": 10349.373
},
{
"epoch": 0.7920282867245259,
"grad_norm": 1.854164958000183,
"learning_rate": 4.2173350582147484e-06,
"loss": 0.9617,
"num_input_tokens_seen": 72587776,
"step": 616,
"train_runtime": 7012.7177,
"train_tokens_per_second": 10350.877
},
{
"epoch": 0.7933140469302475,
"grad_norm": 1.8561328649520874,
"learning_rate": 4.1914618369987065e-06,
"loss": 1.0435,
"num_input_tokens_seen": 72709504,
"step": 617,
"train_runtime": 7023.2797,
"train_tokens_per_second": 10352.642
},
{
"epoch": 0.7945998071359691,
"grad_norm": 1.8203593492507935,
"learning_rate": 4.1655886157826655e-06,
"loss": 1.0132,
"num_input_tokens_seen": 72799776,
"step": 618,
"train_runtime": 7030.8864,
"train_tokens_per_second": 10354.281
},
{
"epoch": 0.7958855673416908,
"grad_norm": 1.8547409772872925,
"learning_rate": 4.1397153945666245e-06,
"loss": 0.9842,
"num_input_tokens_seen": 72879840,
"step": 619,
"train_runtime": 7037.5273,
"train_tokens_per_second": 10355.887
},
{
"epoch": 0.7971713275474124,
"grad_norm": 1.9788426160812378,
"learning_rate": 4.113842173350583e-06,
"loss": 1.0385,
"num_input_tokens_seen": 72971616,
"step": 620,
"train_runtime": 7045.2634,
"train_tokens_per_second": 10357.543
},
{
"epoch": 0.7984570877531341,
"grad_norm": 1.8518086671829224,
"learning_rate": 4.0879689521345415e-06,
"loss": 1.0729,
"num_input_tokens_seen": 73071392,
"step": 621,
"train_runtime": 7053.7889,
"train_tokens_per_second": 10359.169
},
{
"epoch": 0.7997428479588556,
"grad_norm": 1.7593944072723389,
"learning_rate": 4.0620957309185e-06,
"loss": 0.9755,
"num_input_tokens_seen": 73155936,
"step": 622,
"train_runtime": 7060.9396,
"train_tokens_per_second": 10360.652
},
{
"epoch": 0.8010286081645773,
"grad_norm": 1.8963724374771118,
"learning_rate": 4.036222509702459e-06,
"loss": 1.0652,
"num_input_tokens_seen": 73269600,
"step": 623,
"train_runtime": 7071.1619,
"train_tokens_per_second": 10361.748
},
{
"epoch": 0.8023143683702989,
"grad_norm": 1.8380028009414673,
"learning_rate": 4.010349288486417e-06,
"loss": 1.0608,
"num_input_tokens_seen": 73394752,
"step": 624,
"train_runtime": 7082.1878,
"train_tokens_per_second": 10363.288
},
{
"epoch": 0.8023143683702989,
"eval_loss": 1.1012874841690063,
"eval_runtime": 22.0115,
"eval_samples_per_second": 45.158,
"eval_steps_per_second": 1.454,
"num_input_tokens_seen": 73394752,
"step": 624
},
{
"epoch": 0.8036001285760206,
"grad_norm": 1.9703397750854492,
"learning_rate": 3.984476067270375e-06,
"loss": 1.0863,
"num_input_tokens_seen": 73490912,
"step": 625,
"train_runtime": 7112.3423,
"train_tokens_per_second": 10332.87
},
{
"epoch": 0.8048858887817422,
"grad_norm": 1.7578519582748413,
"learning_rate": 3.958602846054334e-06,
"loss": 0.9404,
"num_input_tokens_seen": 73610944,
"step": 626,
"train_runtime": 7122.7514,
"train_tokens_per_second": 10334.622
},
{
"epoch": 0.8061716489874639,
"grad_norm": 1.903511881828308,
"learning_rate": 3.932729624838293e-06,
"loss": 1.0024,
"num_input_tokens_seen": 73704576,
"step": 627,
"train_runtime": 7130.9357,
"train_tokens_per_second": 10335.891
},
{
"epoch": 0.8074574091931854,
"grad_norm": 1.7375211715698242,
"learning_rate": 3.906856403622251e-06,
"loss": 1.026,
"num_input_tokens_seen": 73846848,
"step": 628,
"train_runtime": 7143.4942,
"train_tokens_per_second": 10337.637
},
{
"epoch": 0.8087431693989071,
"grad_norm": 1.864484429359436,
"learning_rate": 3.88098318240621e-06,
"loss": 1.065,
"num_input_tokens_seen": 73957984,
"step": 629,
"train_runtime": 7153.3216,
"train_tokens_per_second": 10338.971
},
{
"epoch": 0.8100289296046287,
"grad_norm": 1.851105809211731,
"learning_rate": 3.855109961190168e-06,
"loss": 1.0817,
"num_input_tokens_seen": 74102016,
"step": 630,
"train_runtime": 7166.4684,
"train_tokens_per_second": 10340.102
},
{
"epoch": 0.8113146898103504,
"grad_norm": 2.0116357803344727,
"learning_rate": 3.829236739974127e-06,
"loss": 1.1515,
"num_input_tokens_seen": 74214208,
"step": 631,
"train_runtime": 7192.7679,
"train_tokens_per_second": 10317.893
},
{
"epoch": 0.812600450016072,
"grad_norm": 1.927558422088623,
"learning_rate": 3.803363518758086e-06,
"loss": 1.0052,
"num_input_tokens_seen": 74299168,
"step": 632,
"train_runtime": 7199.9125,
"train_tokens_per_second": 10319.454
},
{
"epoch": 0.8138862102217936,
"grad_norm": 1.961654543876648,
"learning_rate": 3.777490297542044e-06,
"loss": 1.0519,
"num_input_tokens_seen": 74418176,
"step": 633,
"train_runtime": 7210.5863,
"train_tokens_per_second": 10320.683
},
{
"epoch": 0.8151719704275152,
"grad_norm": 1.8367573022842407,
"learning_rate": 3.751617076326003e-06,
"loss": 1.011,
"num_input_tokens_seen": 74533024,
"step": 634,
"train_runtime": 7220.8171,
"train_tokens_per_second": 10321.965
},
{
"epoch": 0.8164577306332369,
"grad_norm": 1.8445461988449097,
"learning_rate": 3.7257438551099615e-06,
"loss": 0.9722,
"num_input_tokens_seen": 74639200,
"step": 635,
"train_runtime": 7230.1938,
"train_tokens_per_second": 10323.264
},
{
"epoch": 0.8177434908389586,
"grad_norm": 1.9773858785629272,
"learning_rate": 3.69987063389392e-06,
"loss": 0.9934,
"num_input_tokens_seen": 74718656,
"step": 636,
"train_runtime": 7236.8882,
"train_tokens_per_second": 10324.694
},
{
"epoch": 0.8190292510446802,
"grad_norm": 1.880348801612854,
"learning_rate": 3.6739974126778786e-06,
"loss": 1.0368,
"num_input_tokens_seen": 74883680,
"step": 637,
"train_runtime": 7252.295,
"train_tokens_per_second": 10325.515
},
{
"epoch": 0.8203150112504018,
"grad_norm": 1.939626932144165,
"learning_rate": 3.648124191461837e-06,
"loss": 1.135,
"num_input_tokens_seen": 75006080,
"step": 638,
"train_runtime": 7263.2834,
"train_tokens_per_second": 10326.746
},
{
"epoch": 0.8216007714561234,
"grad_norm": 1.7646300792694092,
"learning_rate": 3.6222509702457957e-06,
"loss": 1.0535,
"num_input_tokens_seen": 75128000,
"step": 639,
"train_runtime": 7274.1683,
"train_tokens_per_second": 10328.054
},
{
"epoch": 0.8228865316618451,
"grad_norm": 2.0148706436157227,
"learning_rate": 3.5963777490297546e-06,
"loss": 1.0519,
"num_input_tokens_seen": 75233216,
"step": 640,
"train_runtime": 7283.2614,
"train_tokens_per_second": 10329.605
},
{
"epoch": 0.8241722918675667,
"grad_norm": 1.9275726079940796,
"learning_rate": 3.5705045278137127e-06,
"loss": 1.0881,
"num_input_tokens_seen": 75367840,
"step": 641,
"train_runtime": 7295.2124,
"train_tokens_per_second": 10331.137
},
{
"epoch": 0.8254580520732884,
"grad_norm": 2.142881393432617,
"learning_rate": 3.5446313065976717e-06,
"loss": 1.2726,
"num_input_tokens_seen": 75526528,
"step": 642,
"train_runtime": 7309.8561,
"train_tokens_per_second": 10332.15
},
{
"epoch": 0.82674381227901,
"grad_norm": 1.8535045385360718,
"learning_rate": 3.5187580853816307e-06,
"loss": 1.0476,
"num_input_tokens_seen": 75662336,
"step": 643,
"train_runtime": 7322.2115,
"train_tokens_per_second": 10333.263
},
{
"epoch": 0.8280295724847316,
"grad_norm": 1.9154276847839355,
"learning_rate": 3.492884864165589e-06,
"loss": 1.131,
"num_input_tokens_seen": 75779040,
"step": 644,
"train_runtime": 7332.6834,
"train_tokens_per_second": 10334.421
},
{
"epoch": 0.8293153326904532,
"grad_norm": 1.8441919088363647,
"learning_rate": 3.4670116429495478e-06,
"loss": 1.049,
"num_input_tokens_seen": 75923360,
"step": 645,
"train_runtime": 7346.1516,
"train_tokens_per_second": 10335.12
},
{
"epoch": 0.8306010928961749,
"grad_norm": 2.044139862060547,
"learning_rate": 3.441138421733506e-06,
"loss": 1.0502,
"num_input_tokens_seen": 76033984,
"step": 646,
"train_runtime": 7355.8474,
"train_tokens_per_second": 10336.536
},
{
"epoch": 0.8318868531018965,
"grad_norm": 1.9089950323104858,
"learning_rate": 3.415265200517465e-06,
"loss": 1.1316,
"num_input_tokens_seen": 76122944,
"step": 647,
"train_runtime": 7363.3482,
"train_tokens_per_second": 10338.088
},
{
"epoch": 0.8331726133076182,
"grad_norm": 1.77204430103302,
"learning_rate": 3.3893919793014234e-06,
"loss": 1.0729,
"num_input_tokens_seen": 76216608,
"step": 648,
"train_runtime": 7371.305,
"train_tokens_per_second": 10339.636
},
{
"epoch": 0.8344583735133397,
"grad_norm": 1.8178905248641968,
"learning_rate": 3.363518758085382e-06,
"loss": 1.0451,
"num_input_tokens_seen": 76310720,
"step": 649,
"train_runtime": 7379.274,
"train_tokens_per_second": 10341.223
},
{
"epoch": 0.8357441337190614,
"grad_norm": 1.819828748703003,
"learning_rate": 3.3376455368693404e-06,
"loss": 1.0011,
"num_input_tokens_seen": 76423424,
"step": 650,
"train_runtime": 7389.1813,
"train_tokens_per_second": 10342.611
},
{
"epoch": 0.837029893924783,
"grad_norm": 1.8803701400756836,
"learning_rate": 3.3117723156532994e-06,
"loss": 1.0684,
"num_input_tokens_seen": 76528768,
"step": 651,
"train_runtime": 7398.2156,
"train_tokens_per_second": 10344.22
},
{
"epoch": 0.8383156541305047,
"grad_norm": 1.7649791240692139,
"learning_rate": 3.2858990944372575e-06,
"loss": 1.0853,
"num_input_tokens_seen": 76637184,
"step": 652,
"train_runtime": 7407.6495,
"train_tokens_per_second": 10345.682
},
{
"epoch": 0.8396014143362263,
"grad_norm": 1.8651745319366455,
"learning_rate": 3.2600258732212165e-06,
"loss": 1.016,
"num_input_tokens_seen": 76752288,
"step": 653,
"train_runtime": 7418.1044,
"train_tokens_per_second": 10346.617
},
{
"epoch": 0.840887174541948,
"grad_norm": 2.0024538040161133,
"learning_rate": 3.2341526520051746e-06,
"loss": 0.9789,
"num_input_tokens_seen": 76872672,
"step": 654,
"train_runtime": 7428.7756,
"train_tokens_per_second": 10347.96
},
{
"epoch": 0.8421729347476695,
"grad_norm": 1.891562581062317,
"learning_rate": 3.2082794307891336e-06,
"loss": 0.9911,
"num_input_tokens_seen": 76990624,
"step": 655,
"train_runtime": 7439.4116,
"train_tokens_per_second": 10349.021
},
{
"epoch": 0.8434586949533912,
"grad_norm": 1.8575772047042847,
"learning_rate": 3.1824062095730925e-06,
"loss": 1.0312,
"num_input_tokens_seen": 77120544,
"step": 656,
"train_runtime": 7451.122,
"train_tokens_per_second": 10350.192
},
{
"epoch": 0.8447444551591128,
"grad_norm": 1.7141671180725098,
"learning_rate": 3.1565329883570506e-06,
"loss": 0.9903,
"num_input_tokens_seen": 77225280,
"step": 657,
"train_runtime": 7460.2728,
"train_tokens_per_second": 10351.536
},
{
"epoch": 0.8460302153648345,
"grad_norm": 2.0042834281921387,
"learning_rate": 3.130659767141009e-06,
"loss": 1.0529,
"num_input_tokens_seen": 77332128,
"step": 658,
"train_runtime": 7469.5149,
"train_tokens_per_second": 10353.032
},
{
"epoch": 0.847315975570556,
"grad_norm": 1.9022477865219116,
"learning_rate": 3.1047865459249677e-06,
"loss": 1.0931,
"num_input_tokens_seen": 77443168,
"step": 659,
"train_runtime": 7479.2157,
"train_tokens_per_second": 10354.45
},
{
"epoch": 0.8486017357762777,
"grad_norm": 1.873485803604126,
"learning_rate": 3.0789133247089263e-06,
"loss": 1.026,
"num_input_tokens_seen": 77537376,
"step": 660,
"train_runtime": 7487.2839,
"train_tokens_per_second": 10355.875
},
{
"epoch": 0.8498874959819993,
"grad_norm": 1.8651823997497559,
"learning_rate": 3.0530401034928852e-06,
"loss": 1.0775,
"num_input_tokens_seen": 77650464,
"step": 661,
"train_runtime": 7514.0471,
"train_tokens_per_second": 10334.04
},
{
"epoch": 0.851173256187721,
"grad_norm": 1.8203614950180054,
"learning_rate": 3.0271668822768433e-06,
"loss": 1.0082,
"num_input_tokens_seen": 77754656,
"step": 662,
"train_runtime": 7523.1298,
"train_tokens_per_second": 10335.413
},
{
"epoch": 0.8524590163934426,
"grad_norm": 1.87871515750885,
"learning_rate": 3.0012936610608023e-06,
"loss": 1.0285,
"num_input_tokens_seen": 77863392,
"step": 663,
"train_runtime": 7532.441,
"train_tokens_per_second": 10337.073
},
{
"epoch": 0.8537447765991643,
"grad_norm": 1.8229897022247314,
"learning_rate": 2.9754204398447613e-06,
"loss": 1.0719,
"num_input_tokens_seen": 77968736,
"step": 664,
"train_runtime": 7541.5876,
"train_tokens_per_second": 10338.504
},
{
"epoch": 0.8550305368048859,
"grad_norm": 1.788649320602417,
"learning_rate": 2.9495472186287194e-06,
"loss": 1.0702,
"num_input_tokens_seen": 78116000,
"step": 665,
"train_runtime": 7555.0918,
"train_tokens_per_second": 10339.517
},
{
"epoch": 0.8563162970106075,
"grad_norm": 1.9688736200332642,
"learning_rate": 2.9236739974126783e-06,
"loss": 1.0683,
"num_input_tokens_seen": 78252000,
"step": 666,
"train_runtime": 7567.7838,
"train_tokens_per_second": 10340.147
},
{
"epoch": 0.8576020572163292,
"grad_norm": 1.8758140802383423,
"learning_rate": 2.8978007761966365e-06,
"loss": 1.0176,
"num_input_tokens_seen": 78400896,
"step": 667,
"train_runtime": 7581.1157,
"train_tokens_per_second": 10341.604
},
{
"epoch": 0.8588878174220508,
"grad_norm": 1.8528767824172974,
"learning_rate": 2.8719275549805954e-06,
"loss": 1.0088,
"num_input_tokens_seen": 78535872,
"step": 668,
"train_runtime": 7593.4775,
"train_tokens_per_second": 10342.544
},
{
"epoch": 0.8601735776277725,
"grad_norm": 1.8127259016036987,
"learning_rate": 2.846054333764554e-06,
"loss": 1.1,
"num_input_tokens_seen": 78643040,
"step": 669,
"train_runtime": 7602.9127,
"train_tokens_per_second": 10343.804
},
{
"epoch": 0.861459337833494,
"grad_norm": 1.833497405052185,
"learning_rate": 2.8201811125485125e-06,
"loss": 1.0125,
"num_input_tokens_seen": 78758208,
"step": 670,
"train_runtime": 7612.996,
"train_tokens_per_second": 10345.232
},
{
"epoch": 0.8627450980392157,
"grad_norm": 1.9422428607940674,
"learning_rate": 2.794307891332471e-06,
"loss": 1.034,
"num_input_tokens_seen": 78856224,
"step": 671,
"train_runtime": 7621.3865,
"train_tokens_per_second": 10346.703
},
{
"epoch": 0.8640308582449373,
"grad_norm": 1.9948776960372925,
"learning_rate": 2.76843467011643e-06,
"loss": 1.0527,
"num_input_tokens_seen": 78963072,
"step": 672,
"train_runtime": 7630.5085,
"train_tokens_per_second": 10348.337
},
{
"epoch": 0.865316618450659,
"grad_norm": 1.8143967390060425,
"learning_rate": 2.742561448900388e-06,
"loss": 1.0609,
"num_input_tokens_seen": 79109120,
"step": 673,
"train_runtime": 7643.9846,
"train_tokens_per_second": 10349.199
},
{
"epoch": 0.8666023786563806,
"grad_norm": 1.855102777481079,
"learning_rate": 2.716688227684347e-06,
"loss": 1.0352,
"num_input_tokens_seen": 79207456,
"step": 674,
"train_runtime": 7652.3254,
"train_tokens_per_second": 10350.769
},
{
"epoch": 0.8678881388621023,
"grad_norm": 2.0813863277435303,
"learning_rate": 2.690815006468305e-06,
"loss": 1.1286,
"num_input_tokens_seen": 79317120,
"step": 675,
"train_runtime": 7661.9866,
"train_tokens_per_second": 10352.031
},
{
"epoch": 0.8691738990678238,
"grad_norm": 1.8220653533935547,
"learning_rate": 2.664941785252264e-06,
"loss": 1.1715,
"num_input_tokens_seen": 79483744,
"step": 676,
"train_runtime": 7677.6815,
"train_tokens_per_second": 10352.571
},
{
"epoch": 0.8704596592735455,
"grad_norm": 1.8896037340164185,
"learning_rate": 2.639068564036223e-06,
"loss": 1.0194,
"num_input_tokens_seen": 79569024,
"step": 677,
"train_runtime": 7684.8538,
"train_tokens_per_second": 10354.006
},
{
"epoch": 0.8717454194792671,
"grad_norm": 1.8855335712432861,
"learning_rate": 2.6131953428201812e-06,
"loss": 1.0903,
"num_input_tokens_seen": 79665344,
"step": 678,
"train_runtime": 7693.2234,
"train_tokens_per_second": 10355.262
},
{
"epoch": 0.8730311796849888,
"grad_norm": 1.8641669750213623,
"learning_rate": 2.58732212160414e-06,
"loss": 1.0381,
"num_input_tokens_seen": 79761120,
"step": 679,
"train_runtime": 7701.3015,
"train_tokens_per_second": 10356.836
},
{
"epoch": 0.8743169398907104,
"grad_norm": 1.8233321905136108,
"learning_rate": 2.5614489003880987e-06,
"loss": 0.983,
"num_input_tokens_seen": 79924640,
"step": 680,
"train_runtime": 7716.5881,
"train_tokens_per_second": 10357.51
},
{
"epoch": 0.875602700096432,
"grad_norm": 1.8468879461288452,
"learning_rate": 2.535575679172057e-06,
"loss": 1.039,
"num_input_tokens_seen": 80021344,
"step": 681,
"train_runtime": 7724.808,
"train_tokens_per_second": 10359.007
},
{
"epoch": 0.8768884603021536,
"grad_norm": 1.7861686944961548,
"learning_rate": 2.509702457956016e-06,
"loss": 1.0949,
"num_input_tokens_seen": 80140384,
"step": 682,
"train_runtime": 7735.3252,
"train_tokens_per_second": 10360.312
},
{
"epoch": 0.8781742205078753,
"grad_norm": 1.9106656312942505,
"learning_rate": 2.4838292367399743e-06,
"loss": 1.0139,
"num_input_tokens_seen": 80283136,
"step": 683,
"train_runtime": 7748.4471,
"train_tokens_per_second": 10361.19
},
{
"epoch": 0.8794599807135969,
"grad_norm": 1.7842717170715332,
"learning_rate": 2.457956015523933e-06,
"loss": 1.0803,
"num_input_tokens_seen": 80407520,
"step": 684,
"train_runtime": 7759.5573,
"train_tokens_per_second": 10362.385
},
{
"epoch": 0.8807457409193186,
"grad_norm": 1.6155146360397339,
"learning_rate": 2.4320827943078914e-06,
"loss": 1.0904,
"num_input_tokens_seen": 80521312,
"step": 685,
"train_runtime": 7769.6839,
"train_tokens_per_second": 10363.525
},
{
"epoch": 0.8820315011250401,
"grad_norm": 1.9151482582092285,
"learning_rate": 2.4062095730918504e-06,
"loss": 0.9985,
"num_input_tokens_seen": 80650112,
"step": 686,
"train_runtime": 7781.5312,
"train_tokens_per_second": 10364.299
},
{
"epoch": 0.8833172613307618,
"grad_norm": 1.882094144821167,
"learning_rate": 2.380336351875809e-06,
"loss": 1.0523,
"num_input_tokens_seen": 80751584,
"step": 687,
"train_runtime": 7790.3656,
"train_tokens_per_second": 10365.571
},
{
"epoch": 0.8846030215364834,
"grad_norm": 1.9243850708007812,
"learning_rate": 2.3544631306597675e-06,
"loss": 1.0447,
"num_input_tokens_seen": 80893472,
"step": 688,
"train_runtime": 7803.0693,
"train_tokens_per_second": 10366.879
},
{
"epoch": 0.8858887817422051,
"grad_norm": 1.9028187990188599,
"learning_rate": 2.328589909443726e-06,
"loss": 1.124,
"num_input_tokens_seen": 81008832,
"step": 689,
"train_runtime": 7813.0316,
"train_tokens_per_second": 10368.425
},
{
"epoch": 0.8871745419479267,
"grad_norm": 1.9224538803100586,
"learning_rate": 2.3027166882276845e-06,
"loss": 1.0497,
"num_input_tokens_seen": 81122272,
"step": 690,
"train_runtime": 7823.0001,
"train_tokens_per_second": 10369.714
},
{
"epoch": 0.8884603021536484,
"grad_norm": 1.7827943563461304,
"learning_rate": 2.276843467011643e-06,
"loss": 0.9838,
"num_input_tokens_seen": 81199616,
"step": 691,
"train_runtime": 7846.4547,
"train_tokens_per_second": 10348.574
},
{
"epoch": 0.8897460623593699,
"grad_norm": 1.9258924722671509,
"learning_rate": 2.2509702457956016e-06,
"loss": 1.0869,
"num_input_tokens_seen": 81317440,
"step": 692,
"train_runtime": 7856.7474,
"train_tokens_per_second": 10350.013
},
{
"epoch": 0.8910318225650916,
"grad_norm": 1.7988842725753784,
"learning_rate": 2.22509702457956e-06,
"loss": 1.0551,
"num_input_tokens_seen": 81392096,
"step": 693,
"train_runtime": 7863.0317,
"train_tokens_per_second": 10351.236
},
{
"epoch": 0.8923175827708132,
"grad_norm": 1.9783662557601929,
"learning_rate": 2.1992238033635187e-06,
"loss": 1.0206,
"num_input_tokens_seen": 81586720,
"step": 694,
"train_runtime": 7881.7563,
"train_tokens_per_second": 10351.338
},
{
"epoch": 0.8936033429765349,
"grad_norm": 1.8867701292037964,
"learning_rate": 2.1733505821474777e-06,
"loss": 1.021,
"num_input_tokens_seen": 81666304,
"step": 695,
"train_runtime": 7888.4054,
"train_tokens_per_second": 10352.701
},
{
"epoch": 0.8948891031822566,
"grad_norm": 1.9221513271331787,
"learning_rate": 2.147477360931436e-06,
"loss": 1.0316,
"num_input_tokens_seen": 81798240,
"step": 696,
"train_runtime": 7900.2219,
"train_tokens_per_second": 10353.917
},
{
"epoch": 0.8961748633879781,
"grad_norm": 1.837570309638977,
"learning_rate": 2.1216041397153947e-06,
"loss": 1.0778,
"num_input_tokens_seen": 81969408,
"step": 697,
"train_runtime": 7916.1174,
"train_tokens_per_second": 10354.749
},
{
"epoch": 0.8974606235936998,
"grad_norm": 1.9242483377456665,
"learning_rate": 2.0957309184993533e-06,
"loss": 1.0736,
"num_input_tokens_seen": 82059968,
"step": 698,
"train_runtime": 7923.8396,
"train_tokens_per_second": 10356.086
},
{
"epoch": 0.8987463837994214,
"grad_norm": 1.8562523126602173,
"learning_rate": 2.0698576972833122e-06,
"loss": 1.0715,
"num_input_tokens_seen": 82150944,
"step": 699,
"train_runtime": 7931.5687,
"train_tokens_per_second": 10357.465
},
{
"epoch": 0.9000321440051431,
"grad_norm": 1.8766613006591797,
"learning_rate": 2.0439844760672708e-06,
"loss": 1.0177,
"num_input_tokens_seen": 82278976,
"step": 700,
"train_runtime": 7942.9729,
"train_tokens_per_second": 10358.713
},
{
"epoch": 0.9013179042108647,
"grad_norm": 1.8400506973266602,
"learning_rate": 2.0181112548512293e-06,
"loss": 0.9974,
"num_input_tokens_seen": 82380256,
"step": 701,
"train_runtime": 7951.654,
"train_tokens_per_second": 10360.141
},
{
"epoch": 0.9026036644165863,
"grad_norm": 1.869764804840088,
"learning_rate": 1.9922380336351874e-06,
"loss": 1.1055,
"num_input_tokens_seen": 82467136,
"step": 702,
"train_runtime": 7959.0198,
"train_tokens_per_second": 10361.469
},
{
"epoch": 0.9026036644165863,
"eval_loss": 1.1008806228637695,
"eval_runtime": 21.9435,
"eval_samples_per_second": 45.298,
"eval_steps_per_second": 1.458,
"num_input_tokens_seen": 82467136,
"step": 702
},
{
"epoch": 0.9038894246223079,
"grad_norm": 1.8863102197647095,
"learning_rate": 1.9663648124191464e-06,
"loss": 1.0474,
"num_input_tokens_seen": 82549824,
"step": 703,
"train_runtime": 7987.8517,
"train_tokens_per_second": 10334.421
},
{
"epoch": 0.9051751848280296,
"grad_norm": 1.9096331596374512,
"learning_rate": 1.940491591203105e-06,
"loss": 0.9695,
"num_input_tokens_seen": 82644544,
"step": 704,
"train_runtime": 7995.9308,
"train_tokens_per_second": 10335.825
},
{
"epoch": 0.9064609450337512,
"grad_norm": 1.917685627937317,
"learning_rate": 1.9146183699870635e-06,
"loss": 1.0134,
"num_input_tokens_seen": 82744352,
"step": 705,
"train_runtime": 8004.4871,
"train_tokens_per_second": 10337.246
},
{
"epoch": 0.9077467052394729,
"grad_norm": 1.8343957662582397,
"learning_rate": 1.888745148771022e-06,
"loss": 1.0128,
"num_input_tokens_seen": 82828832,
"step": 706,
"train_runtime": 8011.5724,
"train_tokens_per_second": 10338.649
},
{
"epoch": 0.9090324654451944,
"grad_norm": 1.8960968255996704,
"learning_rate": 1.8628719275549808e-06,
"loss": 1.0537,
"num_input_tokens_seen": 82904896,
"step": 707,
"train_runtime": 8017.8668,
"train_tokens_per_second": 10340.019
},
{
"epoch": 0.9103182256509161,
"grad_norm": 1.9157270193099976,
"learning_rate": 1.8369987063389393e-06,
"loss": 1.0718,
"num_input_tokens_seen": 83015168,
"step": 708,
"train_runtime": 8027.3151,
"train_tokens_per_second": 10341.586
},
{
"epoch": 0.9116039858566377,
"grad_norm": 1.9855552911758423,
"learning_rate": 1.8111254851228978e-06,
"loss": 1.0452,
"num_input_tokens_seen": 83164288,
"step": 709,
"train_runtime": 8041.0658,
"train_tokens_per_second": 10342.446
},
{
"epoch": 0.9128897460623594,
"grad_norm": 1.8479399681091309,
"learning_rate": 1.7852522639068564e-06,
"loss": 1.0732,
"num_input_tokens_seen": 83269312,
"step": 710,
"train_runtime": 8050.0869,
"train_tokens_per_second": 10343.902
},
{
"epoch": 0.914175506268081,
"grad_norm": 1.8165806531906128,
"learning_rate": 1.7593790426908153e-06,
"loss": 1.0951,
"num_input_tokens_seen": 83382816,
"step": 711,
"train_runtime": 8060.1786,
"train_tokens_per_second": 10345.033
},
{
"epoch": 0.9154612664738027,
"grad_norm": 1.933991551399231,
"learning_rate": 1.7335058214747739e-06,
"loss": 1.0493,
"num_input_tokens_seen": 83479968,
"step": 712,
"train_runtime": 8068.5568,
"train_tokens_per_second": 10346.332
},
{
"epoch": 0.9167470266795242,
"grad_norm": 1.9237388372421265,
"learning_rate": 1.7076326002587324e-06,
"loss": 1.129,
"num_input_tokens_seen": 83614112,
"step": 713,
"train_runtime": 8080.647,
"train_tokens_per_second": 10347.453
},
{
"epoch": 0.9180327868852459,
"grad_norm": 1.7912081480026245,
"learning_rate": 1.681759379042691e-06,
"loss": 0.9808,
"num_input_tokens_seen": 83697376,
"step": 714,
"train_runtime": 8087.6795,
"train_tokens_per_second": 10348.75
},
{
"epoch": 0.9193185470909675,
"grad_norm": 1.951076865196228,
"learning_rate": 1.6558861578266497e-06,
"loss": 1.0593,
"num_input_tokens_seen": 83815040,
"step": 715,
"train_runtime": 8098.1807,
"train_tokens_per_second": 10349.86
},
{
"epoch": 0.9206043072966892,
"grad_norm": 1.97995924949646,
"learning_rate": 1.6300129366106082e-06,
"loss": 1.1155,
"num_input_tokens_seen": 83897792,
"step": 716,
"train_runtime": 8105.0892,
"train_tokens_per_second": 10351.248
},
{
"epoch": 0.9218900675024108,
"grad_norm": 1.942265510559082,
"learning_rate": 1.6041397153945668e-06,
"loss": 1.0594,
"num_input_tokens_seen": 83994528,
"step": 717,
"train_runtime": 8113.4146,
"train_tokens_per_second": 10352.55
},
{
"epoch": 0.9231758277081324,
"grad_norm": 1.8772202730178833,
"learning_rate": 1.5782664941785253e-06,
"loss": 1.0071,
"num_input_tokens_seen": 84138560,
"step": 718,
"train_runtime": 8126.2707,
"train_tokens_per_second": 10353.896
},
{
"epoch": 0.924461587913854,
"grad_norm": 1.8658959865570068,
"learning_rate": 1.5523932729624839e-06,
"loss": 1.042,
"num_input_tokens_seen": 84260672,
"step": 719,
"train_runtime": 8137.107,
"train_tokens_per_second": 10355.114
},
{
"epoch": 0.9257473481195757,
"grad_norm": 2.0019772052764893,
"learning_rate": 1.5265200517464426e-06,
"loss": 1.1432,
"num_input_tokens_seen": 84396768,
"step": 720,
"train_runtime": 8149.6434,
"train_tokens_per_second": 10355.885
},
{
"epoch": 0.9270331083252973,
"grad_norm": 1.8118327856063843,
"learning_rate": 1.5006468305304011e-06,
"loss": 1.0152,
"num_input_tokens_seen": 84505152,
"step": 721,
"train_runtime": 8175.6795,
"train_tokens_per_second": 10336.163
},
{
"epoch": 0.928318868531019,
"grad_norm": 1.8588857650756836,
"learning_rate": 1.4747736093143597e-06,
"loss": 1.0345,
"num_input_tokens_seen": 84622880,
"step": 722,
"train_runtime": 8185.9126,
"train_tokens_per_second": 10337.623
},
{
"epoch": 0.9296046287367405,
"grad_norm": 1.9721977710723877,
"learning_rate": 1.4489003880983182e-06,
"loss": 0.9971,
"num_input_tokens_seen": 84703392,
"step": 723,
"train_runtime": 8192.5908,
"train_tokens_per_second": 10339.024
},
{
"epoch": 0.9308903889424622,
"grad_norm": 1.8980185985565186,
"learning_rate": 1.423027166882277e-06,
"loss": 1.1035,
"num_input_tokens_seen": 84808768,
"step": 724,
"train_runtime": 8201.5607,
"train_tokens_per_second": 10340.565
},
{
"epoch": 0.9321761491481839,
"grad_norm": 1.9349688291549683,
"learning_rate": 1.3971539456662355e-06,
"loss": 1.0111,
"num_input_tokens_seen": 84913856,
"step": 725,
"train_runtime": 8210.5039,
"train_tokens_per_second": 10342.1
},
{
"epoch": 0.9334619093539055,
"grad_norm": 1.8501139879226685,
"learning_rate": 1.371280724450194e-06,
"loss": 1.0002,
"num_input_tokens_seen": 85059104,
"step": 726,
"train_runtime": 8223.8201,
"train_tokens_per_second": 10343.016
},
{
"epoch": 0.9347476695596272,
"grad_norm": 1.839609146118164,
"learning_rate": 1.3454075032341526e-06,
"loss": 1.0067,
"num_input_tokens_seen": 85222624,
"step": 727,
"train_runtime": 8239.0013,
"train_tokens_per_second": 10343.805
},
{
"epoch": 0.9360334297653488,
"grad_norm": 1.8927664756774902,
"learning_rate": 1.3195342820181116e-06,
"loss": 1.0748,
"num_input_tokens_seen": 85403168,
"step": 728,
"train_runtime": 8256.2939,
"train_tokens_per_second": 10344.008
},
{
"epoch": 0.9373191899710704,
"grad_norm": 1.9910334348678589,
"learning_rate": 1.29366106080207e-06,
"loss": 1.065,
"num_input_tokens_seen": 85504928,
"step": 729,
"train_runtime": 8265.046,
"train_tokens_per_second": 10345.366
},
{
"epoch": 0.938604950176792,
"grad_norm": 2.0429680347442627,
"learning_rate": 1.2677878395860284e-06,
"loss": 1.0859,
"num_input_tokens_seen": 85584480,
"step": 730,
"train_runtime": 8271.7915,
"train_tokens_per_second": 10346.547
},
{
"epoch": 0.9398907103825137,
"grad_norm": 1.899824619293213,
"learning_rate": 1.2419146183699872e-06,
"loss": 1.0421,
"num_input_tokens_seen": 85722336,
"step": 731,
"train_runtime": 8284.1914,
"train_tokens_per_second": 10347.701
},
{
"epoch": 0.9411764705882353,
"grad_norm": 1.7903647422790527,
"learning_rate": 1.2160413971539457e-06,
"loss": 0.9449,
"num_input_tokens_seen": 85865184,
"step": 732,
"train_runtime": 8297.6936,
"train_tokens_per_second": 10348.078
},
{
"epoch": 0.942462230793957,
"grad_norm": 1.8359401226043701,
"learning_rate": 1.1901681759379045e-06,
"loss": 1.0292,
"num_input_tokens_seen": 85976832,
"step": 733,
"train_runtime": 8307.6144,
"train_tokens_per_second": 10349.16
},
{
"epoch": 0.9437479909996785,
"grad_norm": 1.7849318981170654,
"learning_rate": 1.164294954721863e-06,
"loss": 0.9646,
"num_input_tokens_seen": 86061920,
"step": 734,
"train_runtime": 8314.8905,
"train_tokens_per_second": 10350.337
},
{
"epoch": 0.9450337512054002,
"grad_norm": 1.92512845993042,
"learning_rate": 1.1384217335058215e-06,
"loss": 0.9865,
"num_input_tokens_seen": 86189248,
"step": 735,
"train_runtime": 8326.2348,
"train_tokens_per_second": 10351.527
},
{
"epoch": 0.9463195114111218,
"grad_norm": 1.8651082515716553,
"learning_rate": 1.11254851228978e-06,
"loss": 1.0223,
"num_input_tokens_seen": 86316320,
"step": 736,
"train_runtime": 8337.4327,
"train_tokens_per_second": 10352.866
},
{
"epoch": 0.9476052716168435,
"grad_norm": 2.024437189102173,
"learning_rate": 1.0866752910737388e-06,
"loss": 1.1516,
"num_input_tokens_seen": 86437952,
"step": 737,
"train_runtime": 8348.1965,
"train_tokens_per_second": 10354.087
},
{
"epoch": 0.9488910318225651,
"grad_norm": 1.9123945236206055,
"learning_rate": 1.0608020698576974e-06,
"loss": 1.049,
"num_input_tokens_seen": 86553120,
"step": 738,
"train_runtime": 8358.151,
"train_tokens_per_second": 10355.534
},
{
"epoch": 0.9501767920282868,
"grad_norm": 1.8395739793777466,
"learning_rate": 1.0349288486416561e-06,
"loss": 1.095,
"num_input_tokens_seen": 86637792,
"step": 739,
"train_runtime": 8365.3725,
"train_tokens_per_second": 10356.717
},
{
"epoch": 0.9514625522340083,
"grad_norm": 1.8441441059112549,
"learning_rate": 1.0090556274256147e-06,
"loss": 1.0399,
"num_input_tokens_seen": 86779232,
"step": 740,
"train_runtime": 8378.4531,
"train_tokens_per_second": 10357.429
},
{
"epoch": 0.95274831243973,
"grad_norm": 1.9400453567504883,
"learning_rate": 9.831824062095732e-07,
"loss": 1.0772,
"num_input_tokens_seen": 86871712,
"step": 741,
"train_runtime": 8386.2953,
"train_tokens_per_second": 10358.771
},
{
"epoch": 0.9540340726454516,
"grad_norm": 1.7376289367675781,
"learning_rate": 9.573091849935317e-07,
"loss": 0.9707,
"num_input_tokens_seen": 87009664,
"step": 742,
"train_runtime": 8398.846,
"train_tokens_per_second": 10359.717
},
{
"epoch": 0.9553198328511733,
"grad_norm": 1.8850547075271606,
"learning_rate": 9.314359637774904e-07,
"loss": 1.0961,
"num_input_tokens_seen": 87136544,
"step": 743,
"train_runtime": 8410.4197,
"train_tokens_per_second": 10360.546
},
{
"epoch": 0.9566055930568949,
"grad_norm": 1.964850664138794,
"learning_rate": 9.055627425614489e-07,
"loss": 1.0545,
"num_input_tokens_seen": 87257664,
"step": 744,
"train_runtime": 8421.013,
"train_tokens_per_second": 10361.896
},
{
"epoch": 0.9578913532626165,
"grad_norm": 1.853871464729309,
"learning_rate": 8.796895213454077e-07,
"loss": 0.9811,
"num_input_tokens_seen": 87335232,
"step": 745,
"train_runtime": 8427.4933,
"train_tokens_per_second": 10363.133
},
{
"epoch": 0.9591771134683381,
"grad_norm": 1.8630493879318237,
"learning_rate": 8.538163001293662e-07,
"loss": 1.0717,
"num_input_tokens_seen": 87423904,
"step": 746,
"train_runtime": 8434.9496,
"train_tokens_per_second": 10364.484
},
{
"epoch": 0.9604628736740598,
"grad_norm": 1.965602159500122,
"learning_rate": 8.279430789133249e-07,
"loss": 1.0034,
"num_input_tokens_seen": 87578368,
"step": 747,
"train_runtime": 8449.1667,
"train_tokens_per_second": 10365.326
},
{
"epoch": 0.9617486338797814,
"grad_norm": 2.018232822418213,
"learning_rate": 8.020698576972834e-07,
"loss": 1.1624,
"num_input_tokens_seen": 87677056,
"step": 748,
"train_runtime": 8457.5855,
"train_tokens_per_second": 10366.677
},
{
"epoch": 0.9630343940855031,
"grad_norm": 1.9769020080566406,
"learning_rate": 7.761966364812419e-07,
"loss": 1.0854,
"num_input_tokens_seen": 87789760,
"step": 749,
"train_runtime": 8467.576,
"train_tokens_per_second": 10367.756
},
{
"epoch": 0.9643201542912246,
"grad_norm": 1.8354781866073608,
"learning_rate": 7.503234152652006e-07,
"loss": 1.0912,
"num_input_tokens_seen": 87898272,
"step": 750,
"train_runtime": 8476.9893,
"train_tokens_per_second": 10369.044
},
{
"epoch": 0.9656059144969463,
"grad_norm": 1.9885339736938477,
"learning_rate": 7.244501940491591e-07,
"loss": 1.1578,
"num_input_tokens_seen": 88005184,
"step": 751,
"train_runtime": 8502.9158,
"train_tokens_per_second": 10350.001
},
{
"epoch": 0.9668916747026679,
"grad_norm": 1.799993872642517,
"learning_rate": 6.985769728331178e-07,
"loss": 1.0968,
"num_input_tokens_seen": 88145856,
"step": 752,
"train_runtime": 8515.7908,
"train_tokens_per_second": 10350.871
},
{
"epoch": 0.9681774349083896,
"grad_norm": 1.7286502122879028,
"learning_rate": 6.727037516170763e-07,
"loss": 1.0199,
"num_input_tokens_seen": 88253472,
"step": 753,
"train_runtime": 8525.1284,
"train_tokens_per_second": 10352.157
},
{
"epoch": 0.9694631951141112,
"grad_norm": 1.8545376062393188,
"learning_rate": 6.46830530401035e-07,
"loss": 1.0294,
"num_input_tokens_seen": 88410112,
"step": 754,
"train_runtime": 8540.0868,
"train_tokens_per_second": 10352.367
},
{
"epoch": 0.9707489553198329,
"grad_norm": 1.7983657121658325,
"learning_rate": 6.209573091849936e-07,
"loss": 1.0312,
"num_input_tokens_seen": 88517184,
"step": 755,
"train_runtime": 8549.4704,
"train_tokens_per_second": 10353.528
},
{
"epoch": 0.9720347155255545,
"grad_norm": 1.9300833940505981,
"learning_rate": 5.950840879689522e-07,
"loss": 0.9773,
"num_input_tokens_seen": 88644960,
"step": 756,
"train_runtime": 8561.4036,
"train_tokens_per_second": 10354.022
},
{
"epoch": 0.9733204757312761,
"grad_norm": 1.8282893896102905,
"learning_rate": 5.692108667529108e-07,
"loss": 0.9824,
"num_input_tokens_seen": 88763680,
"step": 757,
"train_runtime": 8572.4426,
"train_tokens_per_second": 10354.538
},
{
"epoch": 0.9746062359369978,
"grad_norm": 2.0415329933166504,
"learning_rate": 5.433376455368694e-07,
"loss": 1.0697,
"num_input_tokens_seen": 88915392,
"step": 758,
"train_runtime": 8586.3403,
"train_tokens_per_second": 10355.447
},
{
"epoch": 0.9758919961427194,
"grad_norm": 1.8638561964035034,
"learning_rate": 5.174644243208281e-07,
"loss": 1.1258,
"num_input_tokens_seen": 89018304,
"step": 759,
"train_runtime": 8595.2138,
"train_tokens_per_second": 10356.729
},
{
"epoch": 0.9771777563484411,
"grad_norm": 1.989698886871338,
"learning_rate": 4.915912031047866e-07,
"loss": 1.0544,
"num_input_tokens_seen": 89134688,
"step": 760,
"train_runtime": 8605.465,
"train_tokens_per_second": 10357.916
},
{
"epoch": 0.9784635165541626,
"grad_norm": 1.9920203685760498,
"learning_rate": 4.657179818887452e-07,
"loss": 0.9777,
"num_input_tokens_seen": 89292992,
"step": 761,
"train_runtime": 8620.2862,
"train_tokens_per_second": 10358.472
},
{
"epoch": 0.9797492767598843,
"grad_norm": 1.792285680770874,
"learning_rate": 4.3984476067270383e-07,
"loss": 1.011,
"num_input_tokens_seen": 89397312,
"step": 762,
"train_runtime": 8629.3843,
"train_tokens_per_second": 10359.64
},
{
"epoch": 0.9810350369656059,
"grad_norm": 1.7668837308883667,
"learning_rate": 4.139715394566624e-07,
"loss": 1.0001,
"num_input_tokens_seen": 89473952,
"step": 763,
"train_runtime": 8635.848,
"train_tokens_per_second": 10360.76
},
{
"epoch": 0.9823207971713276,
"grad_norm": 2.0289688110351562,
"learning_rate": 3.8809831824062096e-07,
"loss": 1.0785,
"num_input_tokens_seen": 89572416,
"step": 764,
"train_runtime": 8644.254,
"train_tokens_per_second": 10362.076
},
{
"epoch": 0.9836065573770492,
"grad_norm": 1.9272173643112183,
"learning_rate": 3.6222509702457956e-07,
"loss": 1.0206,
"num_input_tokens_seen": 89671456,
"step": 765,
"train_runtime": 8652.7996,
"train_tokens_per_second": 10363.288
},
{
"epoch": 0.9848923175827708,
"grad_norm": 2.0589964389801025,
"learning_rate": 3.3635187580853815e-07,
"loss": 1.029,
"num_input_tokens_seen": 89745216,
"step": 766,
"train_runtime": 8659.0809,
"train_tokens_per_second": 10364.289
},
{
"epoch": 0.9861780777884924,
"grad_norm": 1.846987247467041,
"learning_rate": 3.104786545924968e-07,
"loss": 1.0234,
"num_input_tokens_seen": 89840896,
"step": 767,
"train_runtime": 8667.3147,
"train_tokens_per_second": 10365.482
},
{
"epoch": 0.9874638379942141,
"grad_norm": 1.9260659217834473,
"learning_rate": 2.846054333764554e-07,
"loss": 1.2661,
"num_input_tokens_seen": 89958592,
"step": 768,
"train_runtime": 8677.7751,
"train_tokens_per_second": 10366.55
},
{
"epoch": 0.9887495981999357,
"grad_norm": 1.8034597635269165,
"learning_rate": 2.5873221216041403e-07,
"loss": 1.016,
"num_input_tokens_seen": 90066944,
"step": 769,
"train_runtime": 8687.2356,
"train_tokens_per_second": 10367.734
},
{
"epoch": 0.9900353584056574,
"grad_norm": 1.848668098449707,
"learning_rate": 2.328589909443726e-07,
"loss": 1.1509,
"num_input_tokens_seen": 90199456,
"step": 770,
"train_runtime": 8699.3479,
"train_tokens_per_second": 10368.531
},
{
"epoch": 0.991321118611379,
"grad_norm": 1.843025803565979,
"learning_rate": 2.069857697283312e-07,
"loss": 1.4619,
"num_input_tokens_seen": 90314368,
"step": 771,
"train_runtime": 8709.3929,
"train_tokens_per_second": 10369.766
},
{
"epoch": 0.9926068788171006,
"grad_norm": 1.9316155910491943,
"learning_rate": 1.8111254851228978e-07,
"loss": 1.1308,
"num_input_tokens_seen": 90455488,
"step": 772,
"train_runtime": 8722.3601,
"train_tokens_per_second": 10370.529
},
{
"epoch": 0.9938926390228222,
"grad_norm": 1.8842840194702148,
"learning_rate": 1.552393272962484e-07,
"loss": 1.181,
"num_input_tokens_seen": 90566848,
"step": 773,
"train_runtime": 8732.2133,
"train_tokens_per_second": 10371.58
},
{
"epoch": 0.9951783992285439,
"grad_norm": 1.918171763420105,
"learning_rate": 1.2936610608020701e-07,
"loss": 1.0189,
"num_input_tokens_seen": 90670336,
"step": 774,
"train_runtime": 8741.1414,
"train_tokens_per_second": 10372.826
},
{
"epoch": 0.9964641594342655,
"grad_norm": 2.0272796154022217,
"learning_rate": 1.034928848641656e-07,
"loss": 1.0934,
"num_input_tokens_seen": 90764096,
"step": 775,
"train_runtime": 8749.2474,
"train_tokens_per_second": 10373.932
},
{
"epoch": 0.9977499196399872,
"grad_norm": 1.906491994857788,
"learning_rate": 7.76196636481242e-08,
"loss": 1.0435,
"num_input_tokens_seen": 90880416,
"step": 776,
"train_runtime": 8759.5236,
"train_tokens_per_second": 10375.041
},
{
"epoch": 0.9990356798457087,
"grad_norm": 1.8904526233673096,
"learning_rate": 5.17464424320828e-08,
"loss": 1.0791,
"num_input_tokens_seen": 91001792,
"step": 777,
"train_runtime": 8770.7656,
"train_tokens_per_second": 10375.581
},
{
"epoch": 1.0,
"grad_norm": 2.2318460941314697,
"learning_rate": 2.58732212160414e-08,
"loss": 0.9926,
"num_input_tokens_seen": 91103430,
"step": 778,
"train_runtime": 8781.8231,
"train_tokens_per_second": 10374.091
}
],
"logging_steps": 1,
"max_steps": 778,
"num_input_tokens_seen": 91103430,
"num_train_epochs": 1,
"save_steps": 30,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.5167484420599808e+18,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}