deskull's picture
Upload genome_sequence BERT large model (60k steps, eval_loss 6.37)
bd2f975 verified
Raw
History Blame Contribute Delete
235 kB
{
"best_metric": 6.367209434509277,
"best_model_checkpoint": "learning_source_20260316/genome_sequence/bert-output/genome_sequence-large/checkpoint-55000",
"epoch": 535.6726178924898,
"eval_steps": 100,
"global_step": 60000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.22179096201829776,
"grad_norm": 1.0070414543151855,
"learning_rate": 3e-06,
"loss": 8.0811,
"step": 100
},
{
"epoch": 0.22179096201829776,
"eval_loss": 7.71008825302124,
"eval_runtime": 187.0287,
"eval_samples_per_second": 53.468,
"eval_steps_per_second": 6.683,
"step": 100
},
{
"epoch": 0.4435819240365955,
"grad_norm": 0.8634200692176819,
"learning_rate": 6e-06,
"loss": 7.5417,
"step": 200
},
{
"epoch": 0.4435819240365955,
"eval_loss": 7.327251434326172,
"eval_runtime": 187.1689,
"eval_samples_per_second": 53.428,
"eval_steps_per_second": 6.678,
"step": 200
},
{
"epoch": 0.6653728860548933,
"grad_norm": 0.34057387709617615,
"learning_rate": 5.989966555183947e-06,
"loss": 7.2586,
"step": 300
},
{
"epoch": 0.6653728860548933,
"eval_loss": 7.16713285446167,
"eval_runtime": 186.9919,
"eval_samples_per_second": 53.478,
"eval_steps_per_second": 6.685,
"step": 300
},
{
"epoch": 0.887163848073191,
"grad_norm": 0.21436895430088043,
"learning_rate": 5.979933110367893e-06,
"loss": 7.1622,
"step": 400
},
{
"epoch": 0.887163848073191,
"eval_loss": 7.128611087799072,
"eval_runtime": 186.9143,
"eval_samples_per_second": 53.5,
"eval_steps_per_second": 6.688,
"step": 400
},
{
"epoch": 1.1089548100914888,
"grad_norm": 0.9315573573112488,
"learning_rate": 5.96989966555184e-06,
"loss": 7.1284,
"step": 500
},
{
"epoch": 1.1089548100914888,
"eval_loss": 7.088557243347168,
"eval_runtime": 187.062,
"eval_samples_per_second": 53.458,
"eval_steps_per_second": 6.682,
"step": 500
},
{
"epoch": 1.3307457721097866,
"grad_norm": 2.157287359237671,
"learning_rate": 5.959866220735786e-06,
"loss": 7.0934,
"step": 600
},
{
"epoch": 1.3307457721097866,
"eval_loss": 7.06817102432251,
"eval_runtime": 187.1579,
"eval_samples_per_second": 53.431,
"eval_steps_per_second": 6.679,
"step": 600
},
{
"epoch": 1.5525367341280842,
"grad_norm": 0.6227704286575317,
"learning_rate": 5.949832775919732e-06,
"loss": 7.0745,
"step": 700
},
{
"epoch": 1.5525367341280842,
"eval_loss": 7.053982734680176,
"eval_runtime": 187.1727,
"eval_samples_per_second": 53.427,
"eval_steps_per_second": 6.678,
"step": 700
},
{
"epoch": 1.774327696146382,
"grad_norm": 0.2588270902633667,
"learning_rate": 5.939799331103679e-06,
"loss": 7.0637,
"step": 800
},
{
"epoch": 1.774327696146382,
"eval_loss": 7.0445451736450195,
"eval_runtime": 187.2068,
"eval_samples_per_second": 53.417,
"eval_steps_per_second": 6.677,
"step": 800
},
{
"epoch": 1.9961186581646797,
"grad_norm": 0.23316305875778198,
"learning_rate": 5.929765886287626e-06,
"loss": 7.0551,
"step": 900
},
{
"epoch": 1.9961186581646797,
"eval_loss": 7.040402889251709,
"eval_runtime": 187.2019,
"eval_samples_per_second": 53.418,
"eval_steps_per_second": 6.677,
"step": 900
},
{
"epoch": 2.2179096201829775,
"grad_norm": 0.3035018742084503,
"learning_rate": 5.919732441471572e-06,
"loss": 7.047,
"step": 1000
},
{
"epoch": 2.2179096201829775,
"eval_loss": 7.034200191497803,
"eval_runtime": 187.0513,
"eval_samples_per_second": 53.461,
"eval_steps_per_second": 6.683,
"step": 1000
},
{
"epoch": 2.4397005822012754,
"grad_norm": 0.17462466657161713,
"learning_rate": 5.9096989966555185e-06,
"loss": 7.0445,
"step": 1100
},
{
"epoch": 2.4397005822012754,
"eval_loss": 7.031188488006592,
"eval_runtime": 187.3229,
"eval_samples_per_second": 53.384,
"eval_steps_per_second": 6.673,
"step": 1100
},
{
"epoch": 2.6614915442195732,
"grad_norm": 0.33147501945495605,
"learning_rate": 5.899665551839465e-06,
"loss": 7.0413,
"step": 1200
},
{
"epoch": 2.6614915442195732,
"eval_loss": 7.028659343719482,
"eval_runtime": 187.313,
"eval_samples_per_second": 53.387,
"eval_steps_per_second": 6.673,
"step": 1200
},
{
"epoch": 2.8832825062378706,
"grad_norm": 1.94842529296875,
"learning_rate": 5.889632107023412e-06,
"loss": 7.0407,
"step": 1300
},
{
"epoch": 2.8832825062378706,
"eval_loss": 7.033056259155273,
"eval_runtime": 187.18,
"eval_samples_per_second": 53.425,
"eval_steps_per_second": 6.678,
"step": 1300
},
{
"epoch": 3.1050734682561685,
"grad_norm": 0.31123045086860657,
"learning_rate": 5.879598662207358e-06,
"loss": 7.0399,
"step": 1400
},
{
"epoch": 3.1050734682561685,
"eval_loss": 7.026875019073486,
"eval_runtime": 194.8815,
"eval_samples_per_second": 51.313,
"eval_steps_per_second": 6.414,
"step": 1400
},
{
"epoch": 3.3268644302744663,
"grad_norm": 0.6879256367683411,
"learning_rate": 5.869565217391305e-06,
"loss": 7.0354,
"step": 1500
},
{
"epoch": 3.3268644302744663,
"eval_loss": 7.0256500244140625,
"eval_runtime": 186.9583,
"eval_samples_per_second": 53.488,
"eval_steps_per_second": 6.686,
"step": 1500
},
{
"epoch": 3.548655392292764,
"grad_norm": 0.6064356565475464,
"learning_rate": 5.8595317725752514e-06,
"loss": 7.0339,
"step": 1600
},
{
"epoch": 3.548655392292764,
"eval_loss": 7.025866985321045,
"eval_runtime": 187.1435,
"eval_samples_per_second": 53.435,
"eval_steps_per_second": 6.679,
"step": 1600
},
{
"epoch": 3.770446354311062,
"grad_norm": 0.7898679971694946,
"learning_rate": 5.849498327759197e-06,
"loss": 7.0324,
"step": 1700
},
{
"epoch": 3.770446354311062,
"eval_loss": 7.0187907218933105,
"eval_runtime": 187.196,
"eval_samples_per_second": 53.42,
"eval_steps_per_second": 6.677,
"step": 1700
},
{
"epoch": 3.9922373163293594,
"grad_norm": 0.9011751413345337,
"learning_rate": 5.839464882943144e-06,
"loss": 7.028,
"step": 1800
},
{
"epoch": 3.9922373163293594,
"eval_loss": 7.006008625030518,
"eval_runtime": 187.3528,
"eval_samples_per_second": 53.375,
"eval_steps_per_second": 6.672,
"step": 1800
},
{
"epoch": 4.214028278347658,
"grad_norm": 1.6079226732254028,
"learning_rate": 5.829431438127091e-06,
"loss": 7.011,
"step": 1900
},
{
"epoch": 4.214028278347658,
"eval_loss": 6.987495422363281,
"eval_runtime": 187.4062,
"eval_samples_per_second": 53.36,
"eval_steps_per_second": 6.67,
"step": 1900
},
{
"epoch": 4.435819240365955,
"grad_norm": 1.481960415840149,
"learning_rate": 5.819397993311037e-06,
"loss": 6.9459,
"step": 2000
},
{
"epoch": 4.435819240365955,
"eval_loss": 6.7907280921936035,
"eval_runtime": 187.5173,
"eval_samples_per_second": 53.328,
"eval_steps_per_second": 6.666,
"step": 2000
},
{
"epoch": 4.6576102023842525,
"grad_norm": 1.2325085401535034,
"learning_rate": 5.8093645484949836e-06,
"loss": 6.7706,
"step": 2100
},
{
"epoch": 4.6576102023842525,
"eval_loss": 6.649820327758789,
"eval_runtime": 187.8681,
"eval_samples_per_second": 53.229,
"eval_steps_per_second": 6.654,
"step": 2100
},
{
"epoch": 4.879401164402551,
"grad_norm": 0.5991578698158264,
"learning_rate": 5.79933110367893e-06,
"loss": 6.6775,
"step": 2200
},
{
"epoch": 4.879401164402551,
"eval_loss": 6.594548225402832,
"eval_runtime": 187.9284,
"eval_samples_per_second": 53.212,
"eval_steps_per_second": 6.651,
"step": 2200
},
{
"epoch": 5.101192126420848,
"grad_norm": 0.5165764093399048,
"learning_rate": 5.789297658862876e-06,
"loss": 6.6216,
"step": 2300
},
{
"epoch": 5.101192126420848,
"eval_loss": 6.557372570037842,
"eval_runtime": 187.4192,
"eval_samples_per_second": 53.356,
"eval_steps_per_second": 6.67,
"step": 2300
},
{
"epoch": 5.3229830884391465,
"grad_norm": 0.9580274820327759,
"learning_rate": 5.779264214046823e-06,
"loss": 6.5874,
"step": 2400
},
{
"epoch": 5.3229830884391465,
"eval_loss": 6.537918567657471,
"eval_runtime": 187.5204,
"eval_samples_per_second": 53.328,
"eval_steps_per_second": 6.666,
"step": 2400
},
{
"epoch": 5.544774050457444,
"grad_norm": 1.0393297672271729,
"learning_rate": 5.76923076923077e-06,
"loss": 6.5652,
"step": 2500
},
{
"epoch": 5.544774050457444,
"eval_loss": 6.521939754486084,
"eval_runtime": 187.4537,
"eval_samples_per_second": 53.347,
"eval_steps_per_second": 6.668,
"step": 2500
},
{
"epoch": 5.766565012475741,
"grad_norm": 0.9627366662025452,
"learning_rate": 5.759197324414716e-06,
"loss": 6.5446,
"step": 2600
},
{
"epoch": 5.766565012475741,
"eval_loss": 6.509204387664795,
"eval_runtime": 187.6214,
"eval_samples_per_second": 53.299,
"eval_steps_per_second": 6.662,
"step": 2600
},
{
"epoch": 5.98835597449404,
"grad_norm": 0.6260984539985657,
"learning_rate": 5.7491638795986624e-06,
"loss": 6.5315,
"step": 2700
},
{
"epoch": 5.98835597449404,
"eval_loss": 6.503715515136719,
"eval_runtime": 187.5274,
"eval_samples_per_second": 53.326,
"eval_steps_per_second": 6.666,
"step": 2700
},
{
"epoch": 6.210146936512337,
"grad_norm": 1.0884116888046265,
"learning_rate": 5.739130434782609e-06,
"loss": 6.5202,
"step": 2800
},
{
"epoch": 6.210146936512337,
"eval_loss": 6.498012065887451,
"eval_runtime": 187.9298,
"eval_samples_per_second": 53.211,
"eval_steps_per_second": 6.651,
"step": 2800
},
{
"epoch": 6.431937898530635,
"grad_norm": 2.436113119125366,
"learning_rate": 5.729096989966555e-06,
"loss": 6.5118,
"step": 2900
},
{
"epoch": 6.431937898530635,
"eval_loss": 6.493314266204834,
"eval_runtime": 187.7394,
"eval_samples_per_second": 53.265,
"eval_steps_per_second": 6.658,
"step": 2900
},
{
"epoch": 6.653728860548933,
"grad_norm": 0.5587801337242126,
"learning_rate": 5.719063545150502e-06,
"loss": 6.5023,
"step": 3000
},
{
"epoch": 6.653728860548933,
"eval_loss": 6.485339641571045,
"eval_runtime": 187.7624,
"eval_samples_per_second": 53.259,
"eval_steps_per_second": 6.657,
"step": 3000
},
{
"epoch": 6.87551982256723,
"grad_norm": 0.7650394439697266,
"learning_rate": 5.709030100334449e-06,
"loss": 6.4958,
"step": 3100
},
{
"epoch": 6.87551982256723,
"eval_loss": 6.47775411605835,
"eval_runtime": 187.7412,
"eval_samples_per_second": 53.265,
"eval_steps_per_second": 6.658,
"step": 3100
},
{
"epoch": 7.097310784585528,
"grad_norm": 0.8987262845039368,
"learning_rate": 5.698996655518395e-06,
"loss": 6.4903,
"step": 3200
},
{
"epoch": 7.097310784585528,
"eval_loss": 6.474526405334473,
"eval_runtime": 187.4357,
"eval_samples_per_second": 53.352,
"eval_steps_per_second": 6.669,
"step": 3200
},
{
"epoch": 7.319101746603826,
"grad_norm": 1.3211281299591064,
"learning_rate": 5.688963210702341e-06,
"loss": 6.4853,
"step": 3300
},
{
"epoch": 7.319101746603826,
"eval_loss": 6.471477508544922,
"eval_runtime": 184.369,
"eval_samples_per_second": 54.239,
"eval_steps_per_second": 6.78,
"step": 3300
},
{
"epoch": 7.540892708622124,
"grad_norm": 0.45453569293022156,
"learning_rate": 5.678929765886288e-06,
"loss": 6.4787,
"step": 3400
},
{
"epoch": 7.540892708622124,
"eval_loss": 6.467108249664307,
"eval_runtime": 187.6686,
"eval_samples_per_second": 53.285,
"eval_steps_per_second": 6.661,
"step": 3400
},
{
"epoch": 7.762683670640421,
"grad_norm": 1.5148217678070068,
"learning_rate": 5.668896321070235e-06,
"loss": 6.4758,
"step": 3500
},
{
"epoch": 7.762683670640421,
"eval_loss": 6.464193820953369,
"eval_runtime": 187.269,
"eval_samples_per_second": 53.399,
"eval_steps_per_second": 6.675,
"step": 3500
},
{
"epoch": 7.984474632658719,
"grad_norm": 0.7506269216537476,
"learning_rate": 5.658862876254181e-06,
"loss": 6.4727,
"step": 3600
},
{
"epoch": 7.984474632658719,
"eval_loss": 6.461331367492676,
"eval_runtime": 187.3466,
"eval_samples_per_second": 53.377,
"eval_steps_per_second": 6.672,
"step": 3600
},
{
"epoch": 8.206265594677017,
"grad_norm": 0.7681010961532593,
"learning_rate": 5.6488294314381275e-06,
"loss": 6.4678,
"step": 3700
},
{
"epoch": 8.206265594677017,
"eval_loss": 6.460472583770752,
"eval_runtime": 187.6598,
"eval_samples_per_second": 53.288,
"eval_steps_per_second": 6.661,
"step": 3700
},
{
"epoch": 8.428056556695315,
"grad_norm": 1.467830777168274,
"learning_rate": 5.638795986622074e-06,
"loss": 6.4643,
"step": 3800
},
{
"epoch": 8.428056556695315,
"eval_loss": 6.454957485198975,
"eval_runtime": 187.5697,
"eval_samples_per_second": 53.314,
"eval_steps_per_second": 6.664,
"step": 3800
},
{
"epoch": 8.649847518713612,
"grad_norm": 1.0356554985046387,
"learning_rate": 5.62876254180602e-06,
"loss": 6.459,
"step": 3900
},
{
"epoch": 8.649847518713612,
"eval_loss": 6.457272052764893,
"eval_runtime": 187.6233,
"eval_samples_per_second": 53.298,
"eval_steps_per_second": 6.662,
"step": 3900
},
{
"epoch": 8.87163848073191,
"grad_norm": 1.155139446258545,
"learning_rate": 5.618729096989967e-06,
"loss": 6.4574,
"step": 4000
},
{
"epoch": 8.87163848073191,
"eval_loss": 6.452768802642822,
"eval_runtime": 187.5301,
"eval_samples_per_second": 53.325,
"eval_steps_per_second": 6.666,
"step": 4000
},
{
"epoch": 9.093429442750208,
"grad_norm": 1.3142337799072266,
"learning_rate": 5.608695652173914e-06,
"loss": 6.4542,
"step": 4100
},
{
"epoch": 9.093429442750208,
"eval_loss": 6.4489216804504395,
"eval_runtime": 187.5651,
"eval_samples_per_second": 53.315,
"eval_steps_per_second": 6.664,
"step": 4100
},
{
"epoch": 9.315220404768505,
"grad_norm": 1.0297998189926147,
"learning_rate": 5.59866220735786e-06,
"loss": 6.4502,
"step": 4200
},
{
"epoch": 9.315220404768505,
"eval_loss": 6.446488857269287,
"eval_runtime": 187.6096,
"eval_samples_per_second": 53.302,
"eval_steps_per_second": 6.663,
"step": 4200
},
{
"epoch": 9.537011366786803,
"grad_norm": 1.2892968654632568,
"learning_rate": 5.588628762541806e-06,
"loss": 6.4486,
"step": 4300
},
{
"epoch": 9.537011366786803,
"eval_loss": 6.445422649383545,
"eval_runtime": 187.752,
"eval_samples_per_second": 53.262,
"eval_steps_per_second": 6.658,
"step": 4300
},
{
"epoch": 9.758802328805102,
"grad_norm": 0.5449041724205017,
"learning_rate": 5.578595317725753e-06,
"loss": 6.4454,
"step": 4400
},
{
"epoch": 9.758802328805102,
"eval_loss": 6.443131446838379,
"eval_runtime": 187.7716,
"eval_samples_per_second": 53.256,
"eval_steps_per_second": 6.657,
"step": 4400
},
{
"epoch": 9.9805932908234,
"grad_norm": 1.4572607278823853,
"learning_rate": 5.568561872909699e-06,
"loss": 6.4393,
"step": 4500
},
{
"epoch": 9.9805932908234,
"eval_loss": 6.443836688995361,
"eval_runtime": 187.7389,
"eval_samples_per_second": 53.265,
"eval_steps_per_second": 6.658,
"step": 4500
},
{
"epoch": 10.202384252841696,
"grad_norm": 0.9354243278503418,
"learning_rate": 5.558528428093646e-06,
"loss": 6.4402,
"step": 4600
},
{
"epoch": 10.202384252841696,
"eval_loss": 6.441638946533203,
"eval_runtime": 187.5818,
"eval_samples_per_second": 53.31,
"eval_steps_per_second": 6.664,
"step": 4600
},
{
"epoch": 10.424175214859995,
"grad_norm": 0.7258580327033997,
"learning_rate": 5.548494983277593e-06,
"loss": 6.4396,
"step": 4700
},
{
"epoch": 10.424175214859995,
"eval_loss": 6.438319206237793,
"eval_runtime": 187.6587,
"eval_samples_per_second": 53.288,
"eval_steps_per_second": 6.661,
"step": 4700
},
{
"epoch": 10.645966176878293,
"grad_norm": 1.2118555307388306,
"learning_rate": 5.5384615384615385e-06,
"loss": 6.4367,
"step": 4800
},
{
"epoch": 10.645966176878293,
"eval_loss": 6.441310882568359,
"eval_runtime": 187.6565,
"eval_samples_per_second": 53.289,
"eval_steps_per_second": 6.661,
"step": 4800
},
{
"epoch": 10.86775713889659,
"grad_norm": 1.159846305847168,
"learning_rate": 5.528428093645485e-06,
"loss": 6.4326,
"step": 4900
},
{
"epoch": 10.86775713889659,
"eval_loss": 6.43587589263916,
"eval_runtime": 187.6574,
"eval_samples_per_second": 53.289,
"eval_steps_per_second": 6.661,
"step": 4900
},
{
"epoch": 11.089548100914888,
"grad_norm": 0.7025282382965088,
"learning_rate": 5.518394648829432e-06,
"loss": 6.4308,
"step": 5000
},
{
"epoch": 11.089548100914888,
"eval_loss": 6.433752536773682,
"eval_runtime": 187.5262,
"eval_samples_per_second": 53.326,
"eval_steps_per_second": 6.666,
"step": 5000
},
{
"epoch": 11.311339062933186,
"grad_norm": 0.7697749137878418,
"learning_rate": 5.508361204013378e-06,
"loss": 6.4301,
"step": 5100
},
{
"epoch": 11.311339062933186,
"eval_loss": 6.435794353485107,
"eval_runtime": 187.6165,
"eval_samples_per_second": 53.3,
"eval_steps_per_second": 6.663,
"step": 5100
},
{
"epoch": 11.533130024951483,
"grad_norm": 1.069169044494629,
"learning_rate": 5.498327759197324e-06,
"loss": 6.4282,
"step": 5200
},
{
"epoch": 11.533130024951483,
"eval_loss": 6.428864479064941,
"eval_runtime": 187.7174,
"eval_samples_per_second": 53.272,
"eval_steps_per_second": 6.659,
"step": 5200
},
{
"epoch": 11.75492098696978,
"grad_norm": 0.7605268955230713,
"learning_rate": 5.488294314381271e-06,
"loss": 6.427,
"step": 5300
},
{
"epoch": 11.75492098696978,
"eval_loss": 6.429623603820801,
"eval_runtime": 187.7429,
"eval_samples_per_second": 53.264,
"eval_steps_per_second": 6.658,
"step": 5300
},
{
"epoch": 11.97671194898808,
"grad_norm": 1.2731574773788452,
"learning_rate": 5.478260869565217e-06,
"loss": 6.4248,
"step": 5400
},
{
"epoch": 11.97671194898808,
"eval_loss": 6.4345574378967285,
"eval_runtime": 187.759,
"eval_samples_per_second": 53.26,
"eval_steps_per_second": 6.657,
"step": 5400
},
{
"epoch": 12.198502911006376,
"grad_norm": 0.501266360282898,
"learning_rate": 5.468227424749163e-06,
"loss": 6.4238,
"step": 5500
},
{
"epoch": 12.198502911006376,
"eval_loss": 6.431957244873047,
"eval_runtime": 187.6761,
"eval_samples_per_second": 53.283,
"eval_steps_per_second": 6.66,
"step": 5500
},
{
"epoch": 12.420293873024674,
"grad_norm": 1.1356490850448608,
"learning_rate": 5.45819397993311e-06,
"loss": 6.4206,
"step": 5600
},
{
"epoch": 12.420293873024674,
"eval_loss": 6.427853107452393,
"eval_runtime": 187.6504,
"eval_samples_per_second": 53.291,
"eval_steps_per_second": 6.661,
"step": 5600
},
{
"epoch": 12.642084835042972,
"grad_norm": 0.8015862107276917,
"learning_rate": 5.448160535117057e-06,
"loss": 6.4211,
"step": 5700
},
{
"epoch": 12.642084835042972,
"eval_loss": 6.431809425354004,
"eval_runtime": 187.7474,
"eval_samples_per_second": 53.263,
"eval_steps_per_second": 6.658,
"step": 5700
},
{
"epoch": 12.86387579706127,
"grad_norm": 0.4582173228263855,
"learning_rate": 5.438127090301003e-06,
"loss": 6.4194,
"step": 5800
},
{
"epoch": 12.86387579706127,
"eval_loss": 6.428267478942871,
"eval_runtime": 187.7371,
"eval_samples_per_second": 53.266,
"eval_steps_per_second": 6.658,
"step": 5800
},
{
"epoch": 13.085666759079567,
"grad_norm": 0.5481283068656921,
"learning_rate": 5.4280936454849495e-06,
"loss": 6.4158,
"step": 5900
},
{
"epoch": 13.085666759079567,
"eval_loss": 6.426946640014648,
"eval_runtime": 187.6213,
"eval_samples_per_second": 53.299,
"eval_steps_per_second": 6.662,
"step": 5900
},
{
"epoch": 13.307457721097865,
"grad_norm": 0.7986653447151184,
"learning_rate": 5.418060200668896e-06,
"loss": 6.4177,
"step": 6000
},
{
"epoch": 13.307457721097865,
"eval_loss": 6.428122043609619,
"eval_runtime": 187.2985,
"eval_samples_per_second": 53.391,
"eval_steps_per_second": 6.674,
"step": 6000
},
{
"epoch": 13.529248683116164,
"grad_norm": 0.9855276346206665,
"learning_rate": 5.408026755852843e-06,
"loss": 6.4158,
"step": 6100
},
{
"epoch": 13.529248683116164,
"eval_loss": 6.425644397735596,
"eval_runtime": 187.3504,
"eval_samples_per_second": 53.376,
"eval_steps_per_second": 6.672,
"step": 6100
},
{
"epoch": 13.75103964513446,
"grad_norm": 0.674077570438385,
"learning_rate": 5.397993311036789e-06,
"loss": 6.4144,
"step": 6200
},
{
"epoch": 13.75103964513446,
"eval_loss": 6.425694465637207,
"eval_runtime": 187.5833,
"eval_samples_per_second": 53.31,
"eval_steps_per_second": 6.664,
"step": 6200
},
{
"epoch": 13.972830607152758,
"grad_norm": 0.9573073387145996,
"learning_rate": 5.387959866220736e-06,
"loss": 6.4145,
"step": 6300
},
{
"epoch": 13.972830607152758,
"eval_loss": 6.426056385040283,
"eval_runtime": 187.6486,
"eval_samples_per_second": 53.291,
"eval_steps_per_second": 6.661,
"step": 6300
},
{
"epoch": 14.194621569171057,
"grad_norm": 1.219962239265442,
"learning_rate": 5.3779264214046825e-06,
"loss": 6.4108,
"step": 6400
},
{
"epoch": 14.194621569171057,
"eval_loss": 6.422914981842041,
"eval_runtime": 187.3992,
"eval_samples_per_second": 53.362,
"eval_steps_per_second": 6.67,
"step": 6400
},
{
"epoch": 14.416412531189353,
"grad_norm": 0.7925574779510498,
"learning_rate": 5.367892976588628e-06,
"loss": 6.4109,
"step": 6500
},
{
"epoch": 14.416412531189353,
"eval_loss": 6.424429893493652,
"eval_runtime": 187.4044,
"eval_samples_per_second": 53.361,
"eval_steps_per_second": 6.67,
"step": 6500
},
{
"epoch": 14.638203493207651,
"grad_norm": 0.6920539736747742,
"learning_rate": 5.357859531772575e-06,
"loss": 6.4111,
"step": 6600
},
{
"epoch": 14.638203493207651,
"eval_loss": 6.425134181976318,
"eval_runtime": 187.6179,
"eval_samples_per_second": 53.3,
"eval_steps_per_second": 6.662,
"step": 6600
},
{
"epoch": 14.85999445522595,
"grad_norm": 0.731540322303772,
"learning_rate": 5.347826086956522e-06,
"loss": 6.4102,
"step": 6700
},
{
"epoch": 14.85999445522595,
"eval_loss": 6.428023338317871,
"eval_runtime": 187.5914,
"eval_samples_per_second": 53.307,
"eval_steps_per_second": 6.663,
"step": 6700
},
{
"epoch": 15.081785417244248,
"grad_norm": 0.9497311115264893,
"learning_rate": 5.337792642140468e-06,
"loss": 6.4083,
"step": 6800
},
{
"epoch": 15.081785417244248,
"eval_loss": 6.423036098480225,
"eval_runtime": 187.4236,
"eval_samples_per_second": 53.355,
"eval_steps_per_second": 6.669,
"step": 6800
},
{
"epoch": 15.303576379262545,
"grad_norm": 0.6871623396873474,
"learning_rate": 5.327759197324415e-06,
"loss": 6.4075,
"step": 6900
},
{
"epoch": 15.303576379262545,
"eval_loss": 6.425256729125977,
"eval_runtime": 187.5086,
"eval_samples_per_second": 53.331,
"eval_steps_per_second": 6.666,
"step": 6900
},
{
"epoch": 15.525367341280843,
"grad_norm": 0.5820502042770386,
"learning_rate": 5.317725752508361e-06,
"loss": 6.4066,
"step": 7000
},
{
"epoch": 15.525367341280843,
"eval_loss": 6.425621509552002,
"eval_runtime": 187.786,
"eval_samples_per_second": 53.252,
"eval_steps_per_second": 6.657,
"step": 7000
},
{
"epoch": 15.747158303299141,
"grad_norm": 1.0221792459487915,
"learning_rate": 5.307692307692307e-06,
"loss": 6.4074,
"step": 7100
},
{
"epoch": 15.747158303299141,
"eval_loss": 6.419933319091797,
"eval_runtime": 187.8686,
"eval_samples_per_second": 53.229,
"eval_steps_per_second": 6.654,
"step": 7100
},
{
"epoch": 15.968949265317438,
"grad_norm": 0.5439109802246094,
"learning_rate": 5.297658862876254e-06,
"loss": 6.4051,
"step": 7200
},
{
"epoch": 15.968949265317438,
"eval_loss": 6.417891025543213,
"eval_runtime": 187.9103,
"eval_samples_per_second": 53.217,
"eval_steps_per_second": 6.652,
"step": 7200
},
{
"epoch": 16.190740227335738,
"grad_norm": 0.48691362142562866,
"learning_rate": 5.287625418060201e-06,
"loss": 6.4048,
"step": 7300
},
{
"epoch": 16.190740227335738,
"eval_loss": 6.4206414222717285,
"eval_runtime": 187.7538,
"eval_samples_per_second": 53.261,
"eval_steps_per_second": 6.658,
"step": 7300
},
{
"epoch": 16.412531189354034,
"grad_norm": 0.4550572633743286,
"learning_rate": 5.277591973244147e-06,
"loss": 6.4042,
"step": 7400
},
{
"epoch": 16.412531189354034,
"eval_loss": 6.424399375915527,
"eval_runtime": 187.7838,
"eval_samples_per_second": 53.253,
"eval_steps_per_second": 6.657,
"step": 7400
},
{
"epoch": 16.63432215137233,
"grad_norm": 0.9620975852012634,
"learning_rate": 5.2675585284280935e-06,
"loss": 6.4028,
"step": 7500
},
{
"epoch": 16.63432215137233,
"eval_loss": 6.422457695007324,
"eval_runtime": 187.7527,
"eval_samples_per_second": 53.262,
"eval_steps_per_second": 6.658,
"step": 7500
},
{
"epoch": 16.85611311339063,
"grad_norm": 0.5464668273925781,
"learning_rate": 5.25752508361204e-06,
"loss": 6.4028,
"step": 7600
},
{
"epoch": 16.85611311339063,
"eval_loss": 6.416252136230469,
"eval_runtime": 187.8194,
"eval_samples_per_second": 53.243,
"eval_steps_per_second": 6.655,
"step": 7600
},
{
"epoch": 17.077904075408927,
"grad_norm": 0.9427766799926758,
"learning_rate": 5.247491638795986e-06,
"loss": 6.4017,
"step": 7700
},
{
"epoch": 17.077904075408927,
"eval_loss": 6.420745372772217,
"eval_runtime": 187.3478,
"eval_samples_per_second": 53.377,
"eval_steps_per_second": 6.672,
"step": 7700
},
{
"epoch": 17.299695037427224,
"grad_norm": 0.6187496185302734,
"learning_rate": 5.237458193979933e-06,
"loss": 6.4029,
"step": 7800
},
{
"epoch": 17.299695037427224,
"eval_loss": 6.418467044830322,
"eval_runtime": 187.4874,
"eval_samples_per_second": 53.337,
"eval_steps_per_second": 6.667,
"step": 7800
},
{
"epoch": 17.521485999445524,
"grad_norm": 1.0530321598052979,
"learning_rate": 5.22742474916388e-06,
"loss": 6.4007,
"step": 7900
},
{
"epoch": 17.521485999445524,
"eval_loss": 6.421618938446045,
"eval_runtime": 187.6722,
"eval_samples_per_second": 53.284,
"eval_steps_per_second": 6.661,
"step": 7900
},
{
"epoch": 17.74327696146382,
"grad_norm": 0.5843673944473267,
"learning_rate": 5.2173913043478265e-06,
"loss": 6.3996,
"step": 8000
},
{
"epoch": 17.74327696146382,
"eval_loss": 6.414370059967041,
"eval_runtime": 187.7088,
"eval_samples_per_second": 53.274,
"eval_steps_per_second": 6.659,
"step": 8000
},
{
"epoch": 35.99805932908234,
"grad_norm": 0.7473396062850952,
"learning_rate": 5.207357859531772e-06,
"loss": 6.3985,
"step": 8100
},
{
"epoch": 35.99805932908234,
"eval_loss": 6.4200849533081055,
"eval_runtime": 175.8905,
"eval_samples_per_second": 56.854,
"eval_steps_per_second": 3.553,
"step": 8100
},
{
"epoch": 36.44164125311894,
"grad_norm": 1.399119257926941,
"learning_rate": 5.197324414715719e-06,
"loss": 6.3988,
"step": 8200
},
{
"epoch": 36.44164125311894,
"eval_loss": 6.415561676025391,
"eval_runtime": 175.9246,
"eval_samples_per_second": 56.843,
"eval_steps_per_second": 3.553,
"step": 8200
},
{
"epoch": 36.88522317715553,
"grad_norm": 0.7817428112030029,
"learning_rate": 5.187290969899666e-06,
"loss": 6.3974,
"step": 8300
},
{
"epoch": 36.88522317715553,
"eval_loss": 6.418274402618408,
"eval_runtime": 175.9184,
"eval_samples_per_second": 56.845,
"eval_steps_per_second": 3.553,
"step": 8300
},
{
"epoch": 37.328805101192124,
"grad_norm": 0.43301448225975037,
"learning_rate": 5.177257525083612e-06,
"loss": 6.3975,
"step": 8400
},
{
"epoch": 37.328805101192124,
"eval_loss": 6.416856288909912,
"eval_runtime": 175.9451,
"eval_samples_per_second": 56.836,
"eval_steps_per_second": 3.552,
"step": 8400
},
{
"epoch": 37.772387025228724,
"grad_norm": 0.7033133506774902,
"learning_rate": 5.167224080267559e-06,
"loss": 6.398,
"step": 8500
},
{
"epoch": 37.772387025228724,
"eval_loss": 6.419331073760986,
"eval_runtime": 175.9226,
"eval_samples_per_second": 56.843,
"eval_steps_per_second": 3.553,
"step": 8500
},
{
"epoch": 38.21596894926532,
"grad_norm": 0.5272181630134583,
"learning_rate": 5.157190635451505e-06,
"loss": 6.3974,
"step": 8600
},
{
"epoch": 38.21596894926532,
"eval_loss": 6.415123462677002,
"eval_runtime": 177.1859,
"eval_samples_per_second": 56.438,
"eval_steps_per_second": 3.527,
"step": 8600
},
{
"epoch": 38.65955087330191,
"grad_norm": 0.21561351418495178,
"learning_rate": 5.147157190635451e-06,
"loss": 6.3959,
"step": 8700
},
{
"epoch": 38.65955087330191,
"eval_loss": 6.416403770446777,
"eval_runtime": 175.9188,
"eval_samples_per_second": 56.844,
"eval_steps_per_second": 3.553,
"step": 8700
},
{
"epoch": 39.10313279733851,
"grad_norm": 0.43310365080833435,
"learning_rate": 5.137123745819398e-06,
"loss": 6.3961,
"step": 8800
},
{
"epoch": 39.10313279733851,
"eval_loss": 6.419050693511963,
"eval_runtime": 176.1984,
"eval_samples_per_second": 56.754,
"eval_steps_per_second": 3.547,
"step": 8800
},
{
"epoch": 39.5467147213751,
"grad_norm": 0.37988752126693726,
"learning_rate": 5.127090301003345e-06,
"loss": 6.3963,
"step": 8900
},
{
"epoch": 39.5467147213751,
"eval_loss": 6.4194416999816895,
"eval_runtime": 177.1378,
"eval_samples_per_second": 56.453,
"eval_steps_per_second": 3.528,
"step": 8900
},
{
"epoch": 39.990296645411696,
"grad_norm": 0.5972484350204468,
"learning_rate": 5.117056856187291e-06,
"loss": 6.3957,
"step": 9000
},
{
"epoch": 39.990296645411696,
"eval_loss": 6.413427829742432,
"eval_runtime": 177.3512,
"eval_samples_per_second": 56.385,
"eval_steps_per_second": 3.524,
"step": 9000
},
{
"epoch": 40.4338785694483,
"grad_norm": 0.6110886931419373,
"learning_rate": 5.1070234113712375e-06,
"loss": 6.3956,
"step": 9100
},
{
"epoch": 40.4338785694483,
"eval_loss": 6.413400650024414,
"eval_runtime": 177.2258,
"eval_samples_per_second": 56.425,
"eval_steps_per_second": 3.527,
"step": 9100
},
{
"epoch": 40.87746049348489,
"grad_norm": 0.45949310064315796,
"learning_rate": 5.096989966555184e-06,
"loss": 6.3938,
"step": 9200
},
{
"epoch": 40.87746049348489,
"eval_loss": 6.4161882400512695,
"eval_runtime": 176.173,
"eval_samples_per_second": 56.762,
"eval_steps_per_second": 3.548,
"step": 9200
},
{
"epoch": 41.32104241752148,
"grad_norm": 0.2691323459148407,
"learning_rate": 5.08695652173913e-06,
"loss": 6.3943,
"step": 9300
},
{
"epoch": 41.32104241752148,
"eval_loss": 6.41210412979126,
"eval_runtime": 177.2828,
"eval_samples_per_second": 56.407,
"eval_steps_per_second": 3.525,
"step": 9300
},
{
"epoch": 41.76462434155808,
"grad_norm": 0.6407902836799622,
"learning_rate": 5.076923076923077e-06,
"loss": 6.3939,
"step": 9400
},
{
"epoch": 41.76462434155808,
"eval_loss": 6.41355562210083,
"eval_runtime": 177.2932,
"eval_samples_per_second": 56.404,
"eval_steps_per_second": 3.525,
"step": 9400
},
{
"epoch": 42.208206265594676,
"grad_norm": 0.3573991656303406,
"learning_rate": 5.066889632107024e-06,
"loss": 6.3938,
"step": 9500
},
{
"epoch": 42.208206265594676,
"eval_loss": 6.415012836456299,
"eval_runtime": 176.0231,
"eval_samples_per_second": 56.811,
"eval_steps_per_second": 3.551,
"step": 9500
},
{
"epoch": 42.651788189631276,
"grad_norm": 0.5135132074356079,
"learning_rate": 5.05685618729097e-06,
"loss": 6.3933,
"step": 9600
},
{
"epoch": 42.651788189631276,
"eval_loss": 6.413679122924805,
"eval_runtime": 176.0231,
"eval_samples_per_second": 56.811,
"eval_steps_per_second": 3.551,
"step": 9600
},
{
"epoch": 43.09537011366787,
"grad_norm": 0.6957016587257385,
"learning_rate": 5.046822742474916e-06,
"loss": 6.393,
"step": 9700
},
{
"epoch": 43.09537011366787,
"eval_loss": 6.414681434631348,
"eval_runtime": 176.1102,
"eval_samples_per_second": 56.783,
"eval_steps_per_second": 3.549,
"step": 9700
},
{
"epoch": 43.53895203770446,
"grad_norm": 0.6068916916847229,
"learning_rate": 5.036789297658863e-06,
"loss": 6.3921,
"step": 9800
},
{
"epoch": 43.53895203770446,
"eval_loss": 6.4130144119262695,
"eval_runtime": 176.7572,
"eval_samples_per_second": 56.575,
"eval_steps_per_second": 3.536,
"step": 9800
},
{
"epoch": 43.98253396174106,
"grad_norm": 0.5968314409255981,
"learning_rate": 5.02675585284281e-06,
"loss": 6.3925,
"step": 9900
},
{
"epoch": 43.98253396174106,
"eval_loss": 6.410362720489502,
"eval_runtime": 176.0642,
"eval_samples_per_second": 56.797,
"eval_steps_per_second": 3.55,
"step": 9900
},
{
"epoch": 44.426115885777655,
"grad_norm": 0.4509466886520386,
"learning_rate": 5.016722408026756e-06,
"loss": 6.391,
"step": 10000
},
{
"epoch": 44.426115885777655,
"eval_loss": 6.412291526794434,
"eval_runtime": 176.0769,
"eval_samples_per_second": 56.793,
"eval_steps_per_second": 3.55,
"step": 10000
},
{
"epoch": 90.17099135063206,
"grad_norm": 0.6186116337776184,
"learning_rate": 5.0066889632107026e-06,
"loss": 6.391,
"step": 10100
},
{
"epoch": 90.17099135063206,
"eval_loss": 6.412010192871094,
"eval_runtime": 89.0077,
"eval_samples_per_second": 112.35,
"eval_steps_per_second": 3.517,
"step": 10100
},
{
"epoch": 91.05810601020183,
"grad_norm": 0.5779035687446594,
"learning_rate": 4.996655518394649e-06,
"loss": 6.3897,
"step": 10200
},
{
"epoch": 91.05810601020183,
"eval_loss": 6.411357879638672,
"eval_runtime": 88.2289,
"eval_samples_per_second": 113.342,
"eval_steps_per_second": 3.548,
"step": 10200
},
{
"epoch": 91.94522066977157,
"grad_norm": 0.4683433473110199,
"learning_rate": 4.986622073578595e-06,
"loss": 6.3909,
"step": 10300
},
{
"epoch": 91.94522066977157,
"eval_loss": 6.40939998626709,
"eval_runtime": 88.21,
"eval_samples_per_second": 113.366,
"eval_steps_per_second": 3.548,
"step": 10300
},
{
"epoch": 92.83233532934132,
"grad_norm": 0.32136374711990356,
"learning_rate": 4.976588628762542e-06,
"loss": 6.3902,
"step": 10400
},
{
"epoch": 92.83233532934132,
"eval_loss": 6.409432888031006,
"eval_runtime": 88.5101,
"eval_samples_per_second": 112.982,
"eval_steps_per_second": 3.536,
"step": 10400
},
{
"epoch": 93.71944998891107,
"grad_norm": 0.536392092704773,
"learning_rate": 4.966555183946489e-06,
"loss": 6.3899,
"step": 10500
},
{
"epoch": 93.71944998891107,
"eval_loss": 6.4088335037231445,
"eval_runtime": 88.2323,
"eval_samples_per_second": 113.337,
"eval_steps_per_second": 3.547,
"step": 10500
},
{
"epoch": 94.60656464848081,
"grad_norm": 0.36826851963996887,
"learning_rate": 4.956521739130435e-06,
"loss": 6.3894,
"step": 10600
},
{
"epoch": 94.60656464848081,
"eval_loss": 6.412118434906006,
"eval_runtime": 89.0058,
"eval_samples_per_second": 112.352,
"eval_steps_per_second": 3.517,
"step": 10600
},
{
"epoch": 95.49367930805056,
"grad_norm": 0.37616053223609924,
"learning_rate": 4.9464882943143815e-06,
"loss": 6.3882,
"step": 10700
},
{
"epoch": 95.49367930805056,
"eval_loss": 6.4095306396484375,
"eval_runtime": 88.2076,
"eval_samples_per_second": 113.369,
"eval_steps_per_second": 3.548,
"step": 10700
},
{
"epoch": 96.38079396762032,
"grad_norm": 0.5474613904953003,
"learning_rate": 4.936454849498328e-06,
"loss": 6.3889,
"step": 10800
},
{
"epoch": 96.38079396762032,
"eval_loss": 6.411876678466797,
"eval_runtime": 88.2153,
"eval_samples_per_second": 113.359,
"eval_steps_per_second": 3.548,
"step": 10800
},
{
"epoch": 97.26790862719007,
"grad_norm": 0.5602962970733643,
"learning_rate": 4.926421404682274e-06,
"loss": 6.3891,
"step": 10900
},
{
"epoch": 97.26790862719007,
"eval_loss": 6.408635139465332,
"eval_runtime": 88.9688,
"eval_samples_per_second": 112.399,
"eval_steps_per_second": 3.518,
"step": 10900
},
{
"epoch": 98.15502328675981,
"grad_norm": 0.46944743394851685,
"learning_rate": 4.916387959866221e-06,
"loss": 6.388,
"step": 11000
},
{
"epoch": 98.15502328675981,
"eval_loss": 6.408023834228516,
"eval_runtime": 89.0299,
"eval_samples_per_second": 112.322,
"eval_steps_per_second": 3.516,
"step": 11000
},
{
"epoch": 99.04213794632956,
"grad_norm": 0.5612199306488037,
"learning_rate": 4.906354515050168e-06,
"loss": 6.388,
"step": 11100
},
{
"epoch": 99.04213794632956,
"eval_loss": 6.408627510070801,
"eval_runtime": 89.0002,
"eval_samples_per_second": 112.359,
"eval_steps_per_second": 3.517,
"step": 11100
},
{
"epoch": 99.92925260589931,
"grad_norm": 0.5043811798095703,
"learning_rate": 4.8963210702341136e-06,
"loss": 6.3866,
"step": 11200
},
{
"epoch": 99.92925260589931,
"eval_loss": 6.4089789390563965,
"eval_runtime": 89.0751,
"eval_samples_per_second": 112.265,
"eval_steps_per_second": 3.514,
"step": 11200
},
{
"epoch": 100.81636726546907,
"grad_norm": 0.5718743205070496,
"learning_rate": 4.88628762541806e-06,
"loss": 6.3872,
"step": 11300
},
{
"epoch": 100.81636726546907,
"eval_loss": 6.405999183654785,
"eval_runtime": 88.2069,
"eval_samples_per_second": 113.37,
"eval_steps_per_second": 3.548,
"step": 11300
},
{
"epoch": 101.70348192503882,
"grad_norm": 0.5030497312545776,
"learning_rate": 4.876254180602007e-06,
"loss": 6.3869,
"step": 11400
},
{
"epoch": 101.70348192503882,
"eval_loss": 6.408895969390869,
"eval_runtime": 88.2117,
"eval_samples_per_second": 113.364,
"eval_steps_per_second": 3.548,
"step": 11400
},
{
"epoch": 102.59059658460856,
"grad_norm": 0.3895309269428253,
"learning_rate": 4.866220735785953e-06,
"loss": 6.3866,
"step": 11500
},
{
"epoch": 102.59059658460856,
"eval_loss": 6.408517360687256,
"eval_runtime": 88.1944,
"eval_samples_per_second": 113.386,
"eval_steps_per_second": 3.549,
"step": 11500
},
{
"epoch": 103.47771124417831,
"grad_norm": 0.3549971282482147,
"learning_rate": 4.8561872909699e-06,
"loss": 6.3865,
"step": 11600
},
{
"epoch": 103.47771124417831,
"eval_loss": 6.409358501434326,
"eval_runtime": 88.1985,
"eval_samples_per_second": 113.381,
"eval_steps_per_second": 3.549,
"step": 11600
},
{
"epoch": 104.36482590374806,
"grad_norm": 0.3515787720680237,
"learning_rate": 4.8461538461538465e-06,
"loss": 6.3861,
"step": 11700
},
{
"epoch": 104.36482590374806,
"eval_loss": 6.409560203552246,
"eval_runtime": 88.565,
"eval_samples_per_second": 112.911,
"eval_steps_per_second": 3.534,
"step": 11700
},
{
"epoch": 105.2519405633178,
"grad_norm": 0.5682891011238098,
"learning_rate": 4.8361204013377925e-06,
"loss": 6.3863,
"step": 11800
},
{
"epoch": 105.2519405633178,
"eval_loss": 6.405972480773926,
"eval_runtime": 89.025,
"eval_samples_per_second": 112.328,
"eval_steps_per_second": 3.516,
"step": 11800
},
{
"epoch": 106.13905522288756,
"grad_norm": 0.3571348488330841,
"learning_rate": 4.826086956521739e-06,
"loss": 6.385,
"step": 11900
},
{
"epoch": 106.13905522288756,
"eval_loss": 6.399210453033447,
"eval_runtime": 88.4184,
"eval_samples_per_second": 113.099,
"eval_steps_per_second": 3.54,
"step": 11900
},
{
"epoch": 107.02616988245731,
"grad_norm": 0.4465329647064209,
"learning_rate": 4.816053511705686e-06,
"loss": 6.3854,
"step": 12000
},
{
"epoch": 107.02616988245731,
"eval_loss": 6.4048357009887695,
"eval_runtime": 88.2058,
"eval_samples_per_second": 113.371,
"eval_steps_per_second": 3.549,
"step": 12000
},
{
"epoch": 107.91328454202706,
"grad_norm": 0.3734528422355652,
"learning_rate": 4.806020066889633e-06,
"loss": 6.3857,
"step": 12100
},
{
"epoch": 107.91328454202706,
"eval_loss": 6.401259422302246,
"eval_runtime": 88.9844,
"eval_samples_per_second": 112.379,
"eval_steps_per_second": 3.517,
"step": 12100
},
{
"epoch": 108.8003992015968,
"grad_norm": 0.48566725850105286,
"learning_rate": 4.795986622073579e-06,
"loss": 6.3849,
"step": 12200
},
{
"epoch": 108.8003992015968,
"eval_loss": 6.406267166137695,
"eval_runtime": 89.0118,
"eval_samples_per_second": 112.345,
"eval_steps_per_second": 3.516,
"step": 12200
},
{
"epoch": 109.68751386116655,
"grad_norm": 0.35902583599090576,
"learning_rate": 4.785953177257525e-06,
"loss": 6.3846,
"step": 12300
},
{
"epoch": 109.68751386116655,
"eval_loss": 6.407033443450928,
"eval_runtime": 88.9668,
"eval_samples_per_second": 112.401,
"eval_steps_per_second": 3.518,
"step": 12300
},
{
"epoch": 110.57462852073631,
"grad_norm": 0.6619898676872253,
"learning_rate": 4.775919732441472e-06,
"loss": 6.3849,
"step": 12400
},
{
"epoch": 110.57462852073631,
"eval_loss": 6.399672031402588,
"eval_runtime": 88.1986,
"eval_samples_per_second": 113.381,
"eval_steps_per_second": 3.549,
"step": 12400
},
{
"epoch": 111.46174318030606,
"grad_norm": 0.4180016815662384,
"learning_rate": 4.765886287625418e-06,
"loss": 6.3834,
"step": 12500
},
{
"epoch": 111.46174318030606,
"eval_loss": 6.401187419891357,
"eval_runtime": 88.2008,
"eval_samples_per_second": 113.378,
"eval_steps_per_second": 3.549,
"step": 12500
},
{
"epoch": 112.3488578398758,
"grad_norm": 0.4805915951728821,
"learning_rate": 4.755852842809365e-06,
"loss": 6.3847,
"step": 12600
},
{
"epoch": 112.3488578398758,
"eval_loss": 6.398319721221924,
"eval_runtime": 88.2116,
"eval_samples_per_second": 113.364,
"eval_steps_per_second": 3.548,
"step": 12600
},
{
"epoch": 113.23597249944555,
"grad_norm": 0.5308820009231567,
"learning_rate": 4.745819397993312e-06,
"loss": 6.3833,
"step": 12700
},
{
"epoch": 113.23597249944555,
"eval_loss": 6.403678894042969,
"eval_runtime": 89.0114,
"eval_samples_per_second": 112.345,
"eval_steps_per_second": 3.516,
"step": 12700
},
{
"epoch": 114.1230871590153,
"grad_norm": 0.48248058557510376,
"learning_rate": 4.7357859531772575e-06,
"loss": 6.3829,
"step": 12800
},
{
"epoch": 114.1230871590153,
"eval_loss": 6.405944347381592,
"eval_runtime": 88.9912,
"eval_samples_per_second": 112.371,
"eval_steps_per_second": 3.517,
"step": 12800
},
{
"epoch": 115.01020181858505,
"grad_norm": 0.3773874044418335,
"learning_rate": 4.725752508361204e-06,
"loss": 6.3829,
"step": 12900
},
{
"epoch": 115.01020181858505,
"eval_loss": 6.401638031005859,
"eval_runtime": 89.0327,
"eval_samples_per_second": 112.318,
"eval_steps_per_second": 3.516,
"step": 12900
},
{
"epoch": 115.8973164781548,
"grad_norm": 0.3370400369167328,
"learning_rate": 4.715719063545151e-06,
"loss": 6.383,
"step": 13000
},
{
"epoch": 115.8973164781548,
"eval_loss": 6.406683921813965,
"eval_runtime": 88.2165,
"eval_samples_per_second": 113.357,
"eval_steps_per_second": 3.548,
"step": 13000
},
{
"epoch": 116.78443113772455,
"grad_norm": 0.30239006876945496,
"learning_rate": 4.705685618729097e-06,
"loss": 6.3824,
"step": 13100
},
{
"epoch": 116.78443113772455,
"eval_loss": 6.402139663696289,
"eval_runtime": 88.197,
"eval_samples_per_second": 113.382,
"eval_steps_per_second": 3.549,
"step": 13100
},
{
"epoch": 117.6715457972943,
"grad_norm": 0.5257315039634705,
"learning_rate": 4.695652173913044e-06,
"loss": 6.3825,
"step": 13200
},
{
"epoch": 117.6715457972943,
"eval_loss": 6.398579120635986,
"eval_runtime": 88.1944,
"eval_samples_per_second": 113.386,
"eval_steps_per_second": 3.549,
"step": 13200
},
{
"epoch": 118.55866045686405,
"grad_norm": 0.32334333658218384,
"learning_rate": 4.6856187290969905e-06,
"loss": 6.3822,
"step": 13300
},
{
"epoch": 118.55866045686405,
"eval_loss": 6.406438827514648,
"eval_runtime": 88.2027,
"eval_samples_per_second": 113.375,
"eval_steps_per_second": 3.549,
"step": 13300
},
{
"epoch": 119.4457751164338,
"grad_norm": 0.34099674224853516,
"learning_rate": 4.675585284280936e-06,
"loss": 6.3817,
"step": 13400
},
{
"epoch": 119.4457751164338,
"eval_loss": 6.404513835906982,
"eval_runtime": 88.1855,
"eval_samples_per_second": 113.397,
"eval_steps_per_second": 3.549,
"step": 13400
},
{
"epoch": 120.33288977600355,
"grad_norm": 0.3633241653442383,
"learning_rate": 4.665551839464883e-06,
"loss": 6.3817,
"step": 13500
},
{
"epoch": 120.33288977600355,
"eval_loss": 6.398531913757324,
"eval_runtime": 88.9997,
"eval_samples_per_second": 112.36,
"eval_steps_per_second": 3.517,
"step": 13500
},
{
"epoch": 121.2200044355733,
"grad_norm": 0.28118014335632324,
"learning_rate": 4.65551839464883e-06,
"loss": 6.3818,
"step": 13600
},
{
"epoch": 121.2200044355733,
"eval_loss": 6.400463104248047,
"eval_runtime": 88.2057,
"eval_samples_per_second": 113.371,
"eval_steps_per_second": 3.549,
"step": 13600
},
{
"epoch": 122.10711909514305,
"grad_norm": 0.3721919655799866,
"learning_rate": 4.645484949832776e-06,
"loss": 6.3812,
"step": 13700
},
{
"epoch": 122.10711909514305,
"eval_loss": 6.405807971954346,
"eval_runtime": 88.4667,
"eval_samples_per_second": 113.037,
"eval_steps_per_second": 3.538,
"step": 13700
},
{
"epoch": 122.9942337547128,
"grad_norm": 0.3147549033164978,
"learning_rate": 4.635451505016723e-06,
"loss": 6.3814,
"step": 13800
},
{
"epoch": 122.9942337547128,
"eval_loss": 6.402772426605225,
"eval_runtime": 89.0204,
"eval_samples_per_second": 112.334,
"eval_steps_per_second": 3.516,
"step": 13800
},
{
"epoch": 123.88134841428254,
"grad_norm": 0.21372230350971222,
"learning_rate": 4.625418060200669e-06,
"loss": 6.3804,
"step": 13900
},
{
"epoch": 123.88134841428254,
"eval_loss": 6.403747081756592,
"eval_runtime": 88.2131,
"eval_samples_per_second": 113.362,
"eval_steps_per_second": 3.548,
"step": 13900
},
{
"epoch": 124.76846307385229,
"grad_norm": 0.3438258767127991,
"learning_rate": 4.615384615384616e-06,
"loss": 6.3814,
"step": 14000
},
{
"epoch": 124.76846307385229,
"eval_loss": 6.397274494171143,
"eval_runtime": 88.1984,
"eval_samples_per_second": 113.381,
"eval_steps_per_second": 3.549,
"step": 14000
},
{
"epoch": 125.65557773342205,
"grad_norm": 0.22329987585544586,
"learning_rate": 4.605351170568562e-06,
"loss": 6.3806,
"step": 14100
},
{
"epoch": 125.65557773342205,
"eval_loss": 6.4013991355896,
"eval_runtime": 88.1883,
"eval_samples_per_second": 113.394,
"eval_steps_per_second": 3.549,
"step": 14100
},
{
"epoch": 126.5426923929918,
"grad_norm": 0.4979691803455353,
"learning_rate": 4.595317725752509e-06,
"loss": 6.3806,
"step": 14200
},
{
"epoch": 126.5426923929918,
"eval_loss": 6.398404121398926,
"eval_runtime": 88.1886,
"eval_samples_per_second": 113.393,
"eval_steps_per_second": 3.549,
"step": 14200
},
{
"epoch": 127.42980705256154,
"grad_norm": 0.3812222182750702,
"learning_rate": 4.585284280936456e-06,
"loss": 6.3797,
"step": 14300
},
{
"epoch": 127.42980705256154,
"eval_loss": 6.403315544128418,
"eval_runtime": 88.1816,
"eval_samples_per_second": 113.402,
"eval_steps_per_second": 3.549,
"step": 14300
},
{
"epoch": 128.3169217121313,
"grad_norm": 0.33830001950263977,
"learning_rate": 4.5752508361204015e-06,
"loss": 6.38,
"step": 14400
},
{
"epoch": 128.3169217121313,
"eval_loss": 6.399970054626465,
"eval_runtime": 88.3617,
"eval_samples_per_second": 113.171,
"eval_steps_per_second": 3.542,
"step": 14400
},
{
"epoch": 129.20403637170105,
"grad_norm": 0.41163602471351624,
"learning_rate": 4.565217391304348e-06,
"loss": 6.3801,
"step": 14500
},
{
"epoch": 129.20403637170105,
"eval_loss": 6.398497581481934,
"eval_runtime": 88.9909,
"eval_samples_per_second": 112.371,
"eval_steps_per_second": 3.517,
"step": 14500
},
{
"epoch": 130.09115103127078,
"grad_norm": 0.3605528771877289,
"learning_rate": 4.555183946488295e-06,
"loss": 6.3795,
"step": 14600
},
{
"epoch": 130.09115103127078,
"eval_loss": 6.401362419128418,
"eval_runtime": 88.9771,
"eval_samples_per_second": 112.388,
"eval_steps_per_second": 3.518,
"step": 14600
},
{
"epoch": 130.97826569084054,
"grad_norm": 0.2761962115764618,
"learning_rate": 4.545150501672241e-06,
"loss": 6.38,
"step": 14700
},
{
"epoch": 130.97826569084054,
"eval_loss": 6.400545120239258,
"eval_runtime": 88.9856,
"eval_samples_per_second": 112.378,
"eval_steps_per_second": 3.517,
"step": 14700
},
{
"epoch": 131.86538035041028,
"grad_norm": 0.365429162979126,
"learning_rate": 4.535117056856188e-06,
"loss": 6.3792,
"step": 14800
},
{
"epoch": 131.86538035041028,
"eval_loss": 6.398355484008789,
"eval_runtime": 88.1678,
"eval_samples_per_second": 113.42,
"eval_steps_per_second": 3.55,
"step": 14800
},
{
"epoch": 132.75249500998004,
"grad_norm": 0.38731637597084045,
"learning_rate": 4.5250836120401345e-06,
"loss": 6.3786,
"step": 14900
},
{
"epoch": 132.75249500998004,
"eval_loss": 6.404902458190918,
"eval_runtime": 88.9734,
"eval_samples_per_second": 112.393,
"eval_steps_per_second": 3.518,
"step": 14900
},
{
"epoch": 133.6396096695498,
"grad_norm": 0.4588160514831543,
"learning_rate": 4.51505016722408e-06,
"loss": 6.3786,
"step": 15000
},
{
"epoch": 133.6396096695498,
"eval_loss": 6.4006571769714355,
"eval_runtime": 88.1689,
"eval_samples_per_second": 113.419,
"eval_steps_per_second": 3.55,
"step": 15000
},
{
"epoch": 134.52672432911953,
"grad_norm": 0.36677706241607666,
"learning_rate": 4.505016722408027e-06,
"loss": 6.3781,
"step": 15100
},
{
"epoch": 134.52672432911953,
"eval_loss": 6.399155616760254,
"eval_runtime": 88.1918,
"eval_samples_per_second": 113.389,
"eval_steps_per_second": 3.549,
"step": 15100
},
{
"epoch": 135.4138389886893,
"grad_norm": 0.45701250433921814,
"learning_rate": 4.494983277591973e-06,
"loss": 6.3784,
"step": 15200
},
{
"epoch": 135.4138389886893,
"eval_loss": 6.398295879364014,
"eval_runtime": 88.4103,
"eval_samples_per_second": 113.109,
"eval_steps_per_second": 3.54,
"step": 15200
},
{
"epoch": 136.30095364825902,
"grad_norm": 0.325771689414978,
"learning_rate": 4.48494983277592e-06,
"loss": 6.3782,
"step": 15300
},
{
"epoch": 136.30095364825902,
"eval_loss": 6.395936489105225,
"eval_runtime": 88.9861,
"eval_samples_per_second": 112.377,
"eval_steps_per_second": 3.517,
"step": 15300
},
{
"epoch": 137.1880683078288,
"grad_norm": 0.4405640959739685,
"learning_rate": 4.474916387959866e-06,
"loss": 6.3787,
"step": 15400
},
{
"epoch": 137.1880683078288,
"eval_loss": 6.403024196624756,
"eval_runtime": 89.0043,
"eval_samples_per_second": 112.354,
"eval_steps_per_second": 3.517,
"step": 15400
},
{
"epoch": 138.07518296739855,
"grad_norm": 0.38074126839637756,
"learning_rate": 4.4648829431438125e-06,
"loss": 6.3784,
"step": 15500
},
{
"epoch": 138.07518296739855,
"eval_loss": 6.396382808685303,
"eval_runtime": 89.0099,
"eval_samples_per_second": 112.347,
"eval_steps_per_second": 3.516,
"step": 15500
},
{
"epoch": 138.96229762696828,
"grad_norm": 0.3605077862739563,
"learning_rate": 4.454849498327759e-06,
"loss": 6.3776,
"step": 15600
},
{
"epoch": 138.96229762696828,
"eval_loss": 6.398861885070801,
"eval_runtime": 88.1985,
"eval_samples_per_second": 113.381,
"eval_steps_per_second": 3.549,
"step": 15600
},
{
"epoch": 139.84941228653804,
"grad_norm": 0.3661845028400421,
"learning_rate": 4.444816053511705e-06,
"loss": 6.3783,
"step": 15700
},
{
"epoch": 139.84941228653804,
"eval_loss": 6.395369529724121,
"eval_runtime": 88.2035,
"eval_samples_per_second": 113.374,
"eval_steps_per_second": 3.549,
"step": 15700
},
{
"epoch": 140.73652694610777,
"grad_norm": 0.30928805470466614,
"learning_rate": 4.434782608695652e-06,
"loss": 6.3774,
"step": 15800
},
{
"epoch": 140.73652694610777,
"eval_loss": 6.397764682769775,
"eval_runtime": 88.2064,
"eval_samples_per_second": 113.37,
"eval_steps_per_second": 3.548,
"step": 15800
},
{
"epoch": 141.62364160567753,
"grad_norm": 0.2911752462387085,
"learning_rate": 4.424749163879599e-06,
"loss": 6.3774,
"step": 15900
},
{
"epoch": 141.62364160567753,
"eval_loss": 6.392827033996582,
"eval_runtime": 88.2018,
"eval_samples_per_second": 113.376,
"eval_steps_per_second": 3.549,
"step": 15900
},
{
"epoch": 142.5107562652473,
"grad_norm": 0.36379653215408325,
"learning_rate": 4.414715719063545e-06,
"loss": 6.3769,
"step": 16000
},
{
"epoch": 142.5107562652473,
"eval_loss": 6.394837379455566,
"eval_runtime": 88.1516,
"eval_samples_per_second": 113.441,
"eval_steps_per_second": 3.551,
"step": 16000
},
{
"epoch": 143.39787092481703,
"grad_norm": 0.3171352744102478,
"learning_rate": 4.404682274247491e-06,
"loss": 6.3775,
"step": 16100
},
{
"epoch": 143.39787092481703,
"eval_loss": 6.400154113769531,
"eval_runtime": 89.0041,
"eval_samples_per_second": 112.354,
"eval_steps_per_second": 3.517,
"step": 16100
},
{
"epoch": 144.2849855843868,
"grad_norm": 0.28629449009895325,
"learning_rate": 4.394648829431438e-06,
"loss": 6.3759,
"step": 16200
},
{
"epoch": 144.2849855843868,
"eval_loss": 6.39397668838501,
"eval_runtime": 88.9886,
"eval_samples_per_second": 112.374,
"eval_steps_per_second": 3.517,
"step": 16200
},
{
"epoch": 145.17210024395652,
"grad_norm": 0.20145787298679352,
"learning_rate": 4.384615384615384e-06,
"loss": 6.3771,
"step": 16300
},
{
"epoch": 145.17210024395652,
"eval_loss": 6.394731521606445,
"eval_runtime": 88.9884,
"eval_samples_per_second": 112.374,
"eval_steps_per_second": 3.517,
"step": 16300
},
{
"epoch": 146.05921490352628,
"grad_norm": 0.3465804159641266,
"learning_rate": 4.374581939799331e-06,
"loss": 6.3773,
"step": 16400
},
{
"epoch": 146.05921490352628,
"eval_loss": 6.397264003753662,
"eval_runtime": 88.9701,
"eval_samples_per_second": 112.397,
"eval_steps_per_second": 3.518,
"step": 16400
},
{
"epoch": 146.94632956309604,
"grad_norm": 0.37951675057411194,
"learning_rate": 4.364548494983278e-06,
"loss": 6.3765,
"step": 16500
},
{
"epoch": 146.94632956309604,
"eval_loss": 6.393067359924316,
"eval_runtime": 88.2113,
"eval_samples_per_second": 113.364,
"eval_steps_per_second": 3.548,
"step": 16500
},
{
"epoch": 147.83344422266578,
"grad_norm": 0.28946706652641296,
"learning_rate": 4.354515050167224e-06,
"loss": 6.3766,
"step": 16600
},
{
"epoch": 147.83344422266578,
"eval_loss": 6.395288467407227,
"eval_runtime": 88.2164,
"eval_samples_per_second": 113.358,
"eval_steps_per_second": 3.548,
"step": 16600
},
{
"epoch": 148.72055888223554,
"grad_norm": 0.33570635318756104,
"learning_rate": 4.34448160535117e-06,
"loss": 6.3766,
"step": 16700
},
{
"epoch": 148.72055888223554,
"eval_loss": 6.3955864906311035,
"eval_runtime": 88.202,
"eval_samples_per_second": 113.376,
"eval_steps_per_second": 3.549,
"step": 16700
},
{
"epoch": 149.60767354180527,
"grad_norm": 0.2830164134502411,
"learning_rate": 4.334448160535117e-06,
"loss": 6.3765,
"step": 16800
},
{
"epoch": 149.60767354180527,
"eval_loss": 6.393207550048828,
"eval_runtime": 88.1971,
"eval_samples_per_second": 113.382,
"eval_steps_per_second": 3.549,
"step": 16800
},
{
"epoch": 150.49478820137503,
"grad_norm": 0.3951200544834137,
"learning_rate": 4.324414715719064e-06,
"loss": 6.3754,
"step": 16900
},
{
"epoch": 150.49478820137503,
"eval_loss": 6.3931732177734375,
"eval_runtime": 88.1964,
"eval_samples_per_second": 113.383,
"eval_steps_per_second": 3.549,
"step": 16900
},
{
"epoch": 151.3819028609448,
"grad_norm": 0.40401121973991394,
"learning_rate": 4.31438127090301e-06,
"loss": 6.3767,
"step": 17000
},
{
"epoch": 151.3819028609448,
"eval_loss": 6.395325183868408,
"eval_runtime": 89.0101,
"eval_samples_per_second": 112.347,
"eval_steps_per_second": 3.516,
"step": 17000
},
{
"epoch": 152.26901752051452,
"grad_norm": 0.35907265543937683,
"learning_rate": 4.3043478260869565e-06,
"loss": 6.3756,
"step": 17100
},
{
"epoch": 152.26901752051452,
"eval_loss": 6.391872882843018,
"eval_runtime": 88.9952,
"eval_samples_per_second": 112.366,
"eval_steps_per_second": 3.517,
"step": 17100
},
{
"epoch": 153.15613218008428,
"grad_norm": 0.20859681069850922,
"learning_rate": 4.294314381270903e-06,
"loss": 6.376,
"step": 17200
},
{
"epoch": 153.15613218008428,
"eval_loss": 6.389963150024414,
"eval_runtime": 95.4338,
"eval_samples_per_second": 104.785,
"eval_steps_per_second": 3.28,
"step": 17200
},
{
"epoch": 154.04324683965402,
"grad_norm": 0.23594261705875397,
"learning_rate": 4.284280936454849e-06,
"loss": 6.3755,
"step": 17300
},
{
"epoch": 154.04324683965402,
"eval_loss": 6.392347812652588,
"eval_runtime": 88.9816,
"eval_samples_per_second": 112.383,
"eval_steps_per_second": 3.518,
"step": 17300
},
{
"epoch": 154.93036149922378,
"grad_norm": 0.38356783986091614,
"learning_rate": 4.274247491638796e-06,
"loss": 6.3754,
"step": 17400
},
{
"epoch": 154.93036149922378,
"eval_loss": 6.3949875831604,
"eval_runtime": 88.1932,
"eval_samples_per_second": 113.387,
"eval_steps_per_second": 3.549,
"step": 17400
},
{
"epoch": 155.8174761587935,
"grad_norm": 0.48420754075050354,
"learning_rate": 4.264214046822743e-06,
"loss": 6.3755,
"step": 17500
},
{
"epoch": 155.8174761587935,
"eval_loss": 6.391012668609619,
"eval_runtime": 88.1801,
"eval_samples_per_second": 113.404,
"eval_steps_per_second": 3.55,
"step": 17500
},
{
"epoch": 156.70459081836327,
"grad_norm": 0.2329307347536087,
"learning_rate": 4.254180602006689e-06,
"loss": 6.3749,
"step": 17600
},
{
"epoch": 156.70459081836327,
"eval_loss": 6.396329879760742,
"eval_runtime": 88.202,
"eval_samples_per_second": 113.376,
"eval_steps_per_second": 3.549,
"step": 17600
},
{
"epoch": 157.59170547793303,
"grad_norm": 0.3357428312301636,
"learning_rate": 4.244147157190635e-06,
"loss": 6.3742,
"step": 17700
},
{
"epoch": 157.59170547793303,
"eval_loss": 6.396499156951904,
"eval_runtime": 88.2077,
"eval_samples_per_second": 113.369,
"eval_steps_per_second": 3.548,
"step": 17700
},
{
"epoch": 158.47882013750277,
"grad_norm": 0.34573179483413696,
"learning_rate": 4.234113712374582e-06,
"loss": 6.3751,
"step": 17800
},
{
"epoch": 158.47882013750277,
"eval_loss": 6.397115707397461,
"eval_runtime": 89.0011,
"eval_samples_per_second": 112.358,
"eval_steps_per_second": 3.517,
"step": 17800
},
{
"epoch": 159.36593479707253,
"grad_norm": 0.2784799039363861,
"learning_rate": 4.224080267558528e-06,
"loss": 6.3746,
"step": 17900
},
{
"epoch": 159.36593479707253,
"eval_loss": 6.3902907371521,
"eval_runtime": 88.9792,
"eval_samples_per_second": 112.386,
"eval_steps_per_second": 3.518,
"step": 17900
},
{
"epoch": 160.25304945664226,
"grad_norm": 0.3247807025909424,
"learning_rate": 4.214046822742475e-06,
"loss": 6.3752,
"step": 18000
},
{
"epoch": 160.25304945664226,
"eval_loss": 6.3876519203186035,
"eval_runtime": 88.2968,
"eval_samples_per_second": 113.254,
"eval_steps_per_second": 3.545,
"step": 18000
},
{
"epoch": 161.14016411621202,
"grad_norm": 0.34148281812667847,
"learning_rate": 4.2040133779264216e-06,
"loss": 6.3743,
"step": 18100
},
{
"epoch": 161.14016411621202,
"eval_loss": 6.394918918609619,
"eval_runtime": 88.2131,
"eval_samples_per_second": 113.362,
"eval_steps_per_second": 3.548,
"step": 18100
},
{
"epoch": 162.02727877578178,
"grad_norm": 0.26453569531440735,
"learning_rate": 4.1939799331103675e-06,
"loss": 6.3745,
"step": 18200
},
{
"epoch": 162.02727877578178,
"eval_loss": 6.392609596252441,
"eval_runtime": 88.4146,
"eval_samples_per_second": 113.104,
"eval_steps_per_second": 3.54,
"step": 18200
},
{
"epoch": 162.9143934353515,
"grad_norm": 0.3914986848831177,
"learning_rate": 4.183946488294314e-06,
"loss": 6.373,
"step": 18300
},
{
"epoch": 162.9143934353515,
"eval_loss": 6.394564628601074,
"eval_runtime": 89.0398,
"eval_samples_per_second": 112.309,
"eval_steps_per_second": 3.515,
"step": 18300
},
{
"epoch": 163.80150809492127,
"grad_norm": 0.28945302963256836,
"learning_rate": 4.173913043478261e-06,
"loss": 6.3742,
"step": 18400
},
{
"epoch": 163.80150809492127,
"eval_loss": 6.388834476470947,
"eval_runtime": 88.9988,
"eval_samples_per_second": 112.361,
"eval_steps_per_second": 3.517,
"step": 18400
},
{
"epoch": 164.688622754491,
"grad_norm": 0.3480592370033264,
"learning_rate": 4.163879598662208e-06,
"loss": 6.3744,
"step": 18500
},
{
"epoch": 164.688622754491,
"eval_loss": 6.389362335205078,
"eval_runtime": 88.197,
"eval_samples_per_second": 113.383,
"eval_steps_per_second": 3.549,
"step": 18500
},
{
"epoch": 165.57573741406077,
"grad_norm": 0.3804326355457306,
"learning_rate": 4.153846153846154e-06,
"loss": 6.3738,
"step": 18600
},
{
"epoch": 165.57573741406077,
"eval_loss": 6.391166687011719,
"eval_runtime": 88.1914,
"eval_samples_per_second": 113.39,
"eval_steps_per_second": 3.549,
"step": 18600
},
{
"epoch": 166.46285207363053,
"grad_norm": 0.3824601471424103,
"learning_rate": 4.1438127090301005e-06,
"loss": 6.3739,
"step": 18700
},
{
"epoch": 166.46285207363053,
"eval_loss": 6.391639709472656,
"eval_runtime": 89.0022,
"eval_samples_per_second": 112.357,
"eval_steps_per_second": 3.517,
"step": 18700
},
{
"epoch": 167.34996673320026,
"grad_norm": 0.5406671762466431,
"learning_rate": 4.133779264214047e-06,
"loss": 6.3745,
"step": 18800
},
{
"epoch": 167.34996673320026,
"eval_loss": 6.395472049713135,
"eval_runtime": 89.0201,
"eval_samples_per_second": 112.334,
"eval_steps_per_second": 3.516,
"step": 18800
},
{
"epoch": 168.23708139277002,
"grad_norm": 0.2246076464653015,
"learning_rate": 4.123745819397993e-06,
"loss": 6.3732,
"step": 18900
},
{
"epoch": 168.23708139277002,
"eval_loss": 6.391103744506836,
"eval_runtime": 89.0121,
"eval_samples_per_second": 112.344,
"eval_steps_per_second": 3.516,
"step": 18900
},
{
"epoch": 169.12419605233976,
"grad_norm": 0.2771269977092743,
"learning_rate": 4.11371237458194e-06,
"loss": 6.3734,
"step": 19000
},
{
"epoch": 169.12419605233976,
"eval_loss": 6.390963077545166,
"eval_runtime": 88.1853,
"eval_samples_per_second": 113.398,
"eval_steps_per_second": 3.549,
"step": 19000
},
{
"epoch": 170.01131071190952,
"grad_norm": 0.2982538640499115,
"learning_rate": 4.103678929765887e-06,
"loss": 6.3746,
"step": 19100
},
{
"epoch": 170.01131071190952,
"eval_loss": 6.398984432220459,
"eval_runtime": 88.1945,
"eval_samples_per_second": 113.386,
"eval_steps_per_second": 3.549,
"step": 19100
},
{
"epoch": 170.89842537147928,
"grad_norm": 0.22554722428321838,
"learning_rate": 4.0936454849498326e-06,
"loss": 6.3732,
"step": 19200
},
{
"epoch": 170.89842537147928,
"eval_loss": 6.391036033630371,
"eval_runtime": 88.1888,
"eval_samples_per_second": 113.393,
"eval_steps_per_second": 3.549,
"step": 19200
},
{
"epoch": 171.785540031049,
"grad_norm": 0.3837653398513794,
"learning_rate": 4.083612040133779e-06,
"loss": 6.374,
"step": 19300
},
{
"epoch": 171.785540031049,
"eval_loss": 6.392332553863525,
"eval_runtime": 88.1841,
"eval_samples_per_second": 113.399,
"eval_steps_per_second": 3.549,
"step": 19300
},
{
"epoch": 172.67265469061877,
"grad_norm": 0.4505990445613861,
"learning_rate": 4.073578595317726e-06,
"loss": 6.3736,
"step": 19400
},
{
"epoch": 172.67265469061877,
"eval_loss": 6.393078327178955,
"eval_runtime": 88.1837,
"eval_samples_per_second": 113.4,
"eval_steps_per_second": 3.549,
"step": 19400
},
{
"epoch": 173.5597693501885,
"grad_norm": 0.2350095808506012,
"learning_rate": 4.063545150501672e-06,
"loss": 6.3729,
"step": 19500
},
{
"epoch": 173.5597693501885,
"eval_loss": 6.391619682312012,
"eval_runtime": 88.1784,
"eval_samples_per_second": 113.406,
"eval_steps_per_second": 3.55,
"step": 19500
},
{
"epoch": 174.44688400975826,
"grad_norm": 0.36420518159866333,
"learning_rate": 4.053511705685619e-06,
"loss": 6.373,
"step": 19600
},
{
"epoch": 174.44688400975826,
"eval_loss": 6.386290550231934,
"eval_runtime": 88.1738,
"eval_samples_per_second": 113.412,
"eval_steps_per_second": 3.55,
"step": 19600
},
{
"epoch": 175.333998669328,
"grad_norm": 0.4323490560054779,
"learning_rate": 4.0434782608695655e-06,
"loss": 6.3731,
"step": 19700
},
{
"epoch": 175.333998669328,
"eval_loss": 6.385765075683594,
"eval_runtime": 89.0281,
"eval_samples_per_second": 112.324,
"eval_steps_per_second": 3.516,
"step": 19700
},
{
"epoch": 176.22111332889776,
"grad_norm": 0.37750956416130066,
"learning_rate": 4.0334448160535115e-06,
"loss": 6.373,
"step": 19800
},
{
"epoch": 176.22111332889776,
"eval_loss": 6.3935017585754395,
"eval_runtime": 88.1584,
"eval_samples_per_second": 113.432,
"eval_steps_per_second": 3.55,
"step": 19800
},
{
"epoch": 177.10822798846752,
"grad_norm": 0.28360995650291443,
"learning_rate": 4.023411371237458e-06,
"loss": 6.3736,
"step": 19900
},
{
"epoch": 177.10822798846752,
"eval_loss": 6.388575077056885,
"eval_runtime": 88.1723,
"eval_samples_per_second": 113.414,
"eval_steps_per_second": 3.55,
"step": 19900
},
{
"epoch": 177.99534264803725,
"grad_norm": 0.2375970482826233,
"learning_rate": 4.013377926421405e-06,
"loss": 6.3722,
"step": 20000
},
{
"epoch": 177.99534264803725,
"eval_loss": 6.387614727020264,
"eval_runtime": 88.1835,
"eval_samples_per_second": 113.4,
"eval_steps_per_second": 3.549,
"step": 20000
},
{
"epoch": 178.882457307607,
"grad_norm": 0.2644791901111603,
"learning_rate": 4.003344481605351e-06,
"loss": 6.3732,
"step": 20100
},
{
"epoch": 178.882457307607,
"eval_loss": 6.388434410095215,
"eval_runtime": 88.9803,
"eval_samples_per_second": 112.384,
"eval_steps_per_second": 3.518,
"step": 20100
},
{
"epoch": 179.76957196717674,
"grad_norm": 0.3010362386703491,
"learning_rate": 3.993311036789298e-06,
"loss": 6.3723,
"step": 20200
},
{
"epoch": 179.76957196717674,
"eval_loss": 6.388959884643555,
"eval_runtime": 88.7132,
"eval_samples_per_second": 112.723,
"eval_steps_per_second": 3.528,
"step": 20200
},
{
"epoch": 180.6566866267465,
"grad_norm": 0.33606797456741333,
"learning_rate": 3.9832775919732444e-06,
"loss": 6.3728,
"step": 20300
},
{
"epoch": 180.6566866267465,
"eval_loss": 6.3911051750183105,
"eval_runtime": 88.163,
"eval_samples_per_second": 113.426,
"eval_steps_per_second": 3.55,
"step": 20300
},
{
"epoch": 181.54380128631627,
"grad_norm": 0.2511981725692749,
"learning_rate": 3.97324414715719e-06,
"loss": 6.3715,
"step": 20400
},
{
"epoch": 181.54380128631627,
"eval_loss": 6.390799045562744,
"eval_runtime": 88.9917,
"eval_samples_per_second": 112.37,
"eval_steps_per_second": 3.517,
"step": 20400
},
{
"epoch": 182.430915945886,
"grad_norm": 0.4115006923675537,
"learning_rate": 3.963210702341137e-06,
"loss": 6.3722,
"step": 20500
},
{
"epoch": 182.430915945886,
"eval_loss": 6.391343116760254,
"eval_runtime": 89.0042,
"eval_samples_per_second": 112.354,
"eval_steps_per_second": 3.517,
"step": 20500
},
{
"epoch": 183.31803060545576,
"grad_norm": 0.37600409984588623,
"learning_rate": 3.953177257525084e-06,
"loss": 6.3732,
"step": 20600
},
{
"epoch": 183.31803060545576,
"eval_loss": 6.3869404792785645,
"eval_runtime": 88.1885,
"eval_samples_per_second": 113.393,
"eval_steps_per_second": 3.549,
"step": 20600
},
{
"epoch": 184.2051452650255,
"grad_norm": 0.2008831650018692,
"learning_rate": 3.943143812709031e-06,
"loss": 6.3717,
"step": 20700
},
{
"epoch": 184.2051452650255,
"eval_loss": 6.388400077819824,
"eval_runtime": 89.0024,
"eval_samples_per_second": 112.357,
"eval_steps_per_second": 3.517,
"step": 20700
},
{
"epoch": 185.09225992459525,
"grad_norm": 0.2809048891067505,
"learning_rate": 3.9331103678929765e-06,
"loss": 6.3716,
"step": 20800
},
{
"epoch": 185.09225992459525,
"eval_loss": 6.388489723205566,
"eval_runtime": 89.025,
"eval_samples_per_second": 112.328,
"eval_steps_per_second": 3.516,
"step": 20800
},
{
"epoch": 185.97937458416501,
"grad_norm": 0.3136514127254486,
"learning_rate": 3.923076923076923e-06,
"loss": 6.3722,
"step": 20900
},
{
"epoch": 185.97937458416501,
"eval_loss": 6.38933801651001,
"eval_runtime": 88.1827,
"eval_samples_per_second": 113.401,
"eval_steps_per_second": 3.549,
"step": 20900
},
{
"epoch": 186.86648924373475,
"grad_norm": 0.3162117004394531,
"learning_rate": 3.91304347826087e-06,
"loss": 6.371,
"step": 21000
},
{
"epoch": 186.86648924373475,
"eval_loss": 6.390033721923828,
"eval_runtime": 88.1889,
"eval_samples_per_second": 113.393,
"eval_steps_per_second": 3.549,
"step": 21000
},
{
"epoch": 187.7536039033045,
"grad_norm": 0.23877596855163574,
"learning_rate": 3.903010033444816e-06,
"loss": 6.3721,
"step": 21100
},
{
"epoch": 187.7536039033045,
"eval_loss": 6.386390686035156,
"eval_runtime": 88.199,
"eval_samples_per_second": 113.38,
"eval_steps_per_second": 3.549,
"step": 21100
},
{
"epoch": 188.64071856287424,
"grad_norm": 0.2724982500076294,
"learning_rate": 3.892976588628763e-06,
"loss": 6.3721,
"step": 21200
},
{
"epoch": 188.64071856287424,
"eval_loss": 6.392521858215332,
"eval_runtime": 88.1971,
"eval_samples_per_second": 113.382,
"eval_steps_per_second": 3.549,
"step": 21200
},
{
"epoch": 189.527833222444,
"grad_norm": 0.3006499707698822,
"learning_rate": 3.8829431438127095e-06,
"loss": 6.3718,
"step": 21300
},
{
"epoch": 189.527833222444,
"eval_loss": 6.38844633102417,
"eval_runtime": 89.0375,
"eval_samples_per_second": 112.312,
"eval_steps_per_second": 3.515,
"step": 21300
},
{
"epoch": 190.41494788201376,
"grad_norm": 0.23349860310554504,
"learning_rate": 3.8729096989966554e-06,
"loss": 6.3721,
"step": 21400
},
{
"epoch": 190.41494788201376,
"eval_loss": 6.385097503662109,
"eval_runtime": 89.0004,
"eval_samples_per_second": 112.359,
"eval_steps_per_second": 3.517,
"step": 21400
},
{
"epoch": 191.3020625415835,
"grad_norm": 0.23078705370426178,
"learning_rate": 3.862876254180602e-06,
"loss": 6.371,
"step": 21500
},
{
"epoch": 191.3020625415835,
"eval_loss": 6.389979839324951,
"eval_runtime": 88.1937,
"eval_samples_per_second": 113.387,
"eval_steps_per_second": 3.549,
"step": 21500
},
{
"epoch": 192.18917720115326,
"grad_norm": 0.22322630882263184,
"learning_rate": 3.852842809364549e-06,
"loss": 6.3725,
"step": 21600
},
{
"epoch": 192.18917720115326,
"eval_loss": 6.38612699508667,
"eval_runtime": 89.0235,
"eval_samples_per_second": 112.33,
"eval_steps_per_second": 3.516,
"step": 21600
},
{
"epoch": 193.076291860723,
"grad_norm": 0.34750744700431824,
"learning_rate": 3.842809364548495e-06,
"loss": 6.3708,
"step": 21700
},
{
"epoch": 193.076291860723,
"eval_loss": 6.3872575759887695,
"eval_runtime": 88.1897,
"eval_samples_per_second": 113.392,
"eval_steps_per_second": 3.549,
"step": 21700
},
{
"epoch": 193.96340652029275,
"grad_norm": 0.22122953832149506,
"learning_rate": 3.832775919732442e-06,
"loss": 6.372,
"step": 21800
},
{
"epoch": 193.96340652029275,
"eval_loss": 6.389639854431152,
"eval_runtime": 88.1935,
"eval_samples_per_second": 113.387,
"eval_steps_per_second": 3.549,
"step": 21800
},
{
"epoch": 194.8505211798625,
"grad_norm": 0.20957332849502563,
"learning_rate": 3.822742474916388e-06,
"loss": 6.3723,
"step": 21900
},
{
"epoch": 194.8505211798625,
"eval_loss": 6.3914899826049805,
"eval_runtime": 88.631,
"eval_samples_per_second": 112.827,
"eval_steps_per_second": 3.531,
"step": 21900
},
{
"epoch": 195.73763583943224,
"grad_norm": 0.24526910483837128,
"learning_rate": 3.8127090301003347e-06,
"loss": 6.3713,
"step": 22000
},
{
"epoch": 195.73763583943224,
"eval_loss": 6.390371799468994,
"eval_runtime": 88.1852,
"eval_samples_per_second": 113.398,
"eval_steps_per_second": 3.549,
"step": 22000
},
{
"epoch": 196.624750499002,
"grad_norm": 0.28146272897720337,
"learning_rate": 3.802675585284281e-06,
"loss": 6.3711,
"step": 22100
},
{
"epoch": 196.624750499002,
"eval_loss": 6.388413906097412,
"eval_runtime": 88.1826,
"eval_samples_per_second": 113.401,
"eval_steps_per_second": 3.549,
"step": 22100
},
{
"epoch": 197.51186515857174,
"grad_norm": 0.42305833101272583,
"learning_rate": 3.792642140468228e-06,
"loss": 6.3712,
"step": 22200
},
{
"epoch": 197.51186515857174,
"eval_loss": 6.388478755950928,
"eval_runtime": 88.9985,
"eval_samples_per_second": 112.361,
"eval_steps_per_second": 3.517,
"step": 22200
},
{
"epoch": 198.3989798181415,
"grad_norm": 0.2139986753463745,
"learning_rate": 3.782608695652174e-06,
"loss": 6.3705,
"step": 22300
},
{
"epoch": 198.3989798181415,
"eval_loss": 6.390077114105225,
"eval_runtime": 88.9954,
"eval_samples_per_second": 112.365,
"eval_steps_per_second": 3.517,
"step": 22300
},
{
"epoch": 199.28609447771123,
"grad_norm": 0.28066742420196533,
"learning_rate": 3.7725752508361205e-06,
"loss": 6.3712,
"step": 22400
},
{
"epoch": 199.28609447771123,
"eval_loss": 6.386248588562012,
"eval_runtime": 88.1802,
"eval_samples_per_second": 113.404,
"eval_steps_per_second": 3.55,
"step": 22400
},
{
"epoch": 200.173209137281,
"grad_norm": 0.30369654297828674,
"learning_rate": 3.7625418060200673e-06,
"loss": 6.3703,
"step": 22500
},
{
"epoch": 200.173209137281,
"eval_loss": 6.390934944152832,
"eval_runtime": 88.9996,
"eval_samples_per_second": 112.36,
"eval_steps_per_second": 3.517,
"step": 22500
},
{
"epoch": 201.06032379685075,
"grad_norm": 0.2702006995677948,
"learning_rate": 3.7525083612040136e-06,
"loss": 6.3711,
"step": 22600
},
{
"epoch": 201.06032379685075,
"eval_loss": 6.38742208480835,
"eval_runtime": 88.1934,
"eval_samples_per_second": 113.387,
"eval_steps_per_second": 3.549,
"step": 22600
},
{
"epoch": 201.94743845642049,
"grad_norm": 0.2468644678592682,
"learning_rate": 3.74247491638796e-06,
"loss": 6.3717,
"step": 22700
},
{
"epoch": 201.94743845642049,
"eval_loss": 6.383710861206055,
"eval_runtime": 88.1839,
"eval_samples_per_second": 113.399,
"eval_steps_per_second": 3.549,
"step": 22700
},
{
"epoch": 202.83455311599025,
"grad_norm": 0.39605483412742615,
"learning_rate": 3.7324414715719067e-06,
"loss": 6.3704,
"step": 22800
},
{
"epoch": 202.83455311599025,
"eval_loss": 6.386079788208008,
"eval_runtime": 88.1808,
"eval_samples_per_second": 113.403,
"eval_steps_per_second": 3.55,
"step": 22800
},
{
"epoch": 203.72166777555998,
"grad_norm": 0.26171693205833435,
"learning_rate": 3.722408026755853e-06,
"loss": 6.3707,
"step": 22900
},
{
"epoch": 203.72166777555998,
"eval_loss": 6.387109279632568,
"eval_runtime": 88.1813,
"eval_samples_per_second": 113.403,
"eval_steps_per_second": 3.55,
"step": 22900
},
{
"epoch": 204.60878243512974,
"grad_norm": 0.26537904143333435,
"learning_rate": 3.7123745819398e-06,
"loss": 6.3712,
"step": 23000
},
{
"epoch": 204.60878243512974,
"eval_loss": 6.389610290527344,
"eval_runtime": 89.0112,
"eval_samples_per_second": 112.345,
"eval_steps_per_second": 3.516,
"step": 23000
},
{
"epoch": 205.4958970946995,
"grad_norm": 0.2203078716993332,
"learning_rate": 3.702341137123746e-06,
"loss": 6.3696,
"step": 23100
},
{
"epoch": 205.4958970946995,
"eval_loss": 6.3849568367004395,
"eval_runtime": 88.9819,
"eval_samples_per_second": 112.382,
"eval_steps_per_second": 3.518,
"step": 23100
},
{
"epoch": 206.38301175426923,
"grad_norm": 0.23989248275756836,
"learning_rate": 3.6923076923076925e-06,
"loss": 6.37,
"step": 23200
},
{
"epoch": 206.38301175426923,
"eval_loss": 6.39259147644043,
"eval_runtime": 88.1947,
"eval_samples_per_second": 113.386,
"eval_steps_per_second": 3.549,
"step": 23200
},
{
"epoch": 207.270126413839,
"grad_norm": 0.2467869073152542,
"learning_rate": 3.6822742474916393e-06,
"loss": 6.3701,
"step": 23300
},
{
"epoch": 207.270126413839,
"eval_loss": 6.386963367462158,
"eval_runtime": 89.001,
"eval_samples_per_second": 112.358,
"eval_steps_per_second": 3.517,
"step": 23300
},
{
"epoch": 208.15724107340873,
"grad_norm": 0.3064594268798828,
"learning_rate": 3.6722408026755856e-06,
"loss": 6.3706,
"step": 23400
},
{
"epoch": 208.15724107340873,
"eval_loss": 6.382241249084473,
"eval_runtime": 88.1745,
"eval_samples_per_second": 113.411,
"eval_steps_per_second": 3.55,
"step": 23400
},
{
"epoch": 209.0443557329785,
"grad_norm": 0.2418460100889206,
"learning_rate": 3.662207357859532e-06,
"loss": 6.3693,
"step": 23500
},
{
"epoch": 209.0443557329785,
"eval_loss": 6.387510776519775,
"eval_runtime": 88.983,
"eval_samples_per_second": 112.381,
"eval_steps_per_second": 3.518,
"step": 23500
},
{
"epoch": 209.93147039254825,
"grad_norm": 0.5038089156150818,
"learning_rate": 3.6521739130434787e-06,
"loss": 6.3699,
"step": 23600
},
{
"epoch": 209.93147039254825,
"eval_loss": 6.392237663269043,
"eval_runtime": 88.1898,
"eval_samples_per_second": 113.392,
"eval_steps_per_second": 3.549,
"step": 23600
},
{
"epoch": 210.81858505211798,
"grad_norm": 0.30169734358787537,
"learning_rate": 3.642140468227425e-06,
"loss": 6.3706,
"step": 23700
},
{
"epoch": 210.81858505211798,
"eval_loss": 6.392018795013428,
"eval_runtime": 88.9849,
"eval_samples_per_second": 112.379,
"eval_steps_per_second": 3.517,
"step": 23700
},
{
"epoch": 211.70569971168774,
"grad_norm": 0.2609444558620453,
"learning_rate": 3.6321070234113714e-06,
"loss": 6.3706,
"step": 23800
},
{
"epoch": 211.70569971168774,
"eval_loss": 6.388724327087402,
"eval_runtime": 88.6575,
"eval_samples_per_second": 112.794,
"eval_steps_per_second": 3.53,
"step": 23800
},
{
"epoch": 212.59281437125748,
"grad_norm": 0.21443623304367065,
"learning_rate": 3.622073578595318e-06,
"loss": 6.3703,
"step": 23900
},
{
"epoch": 212.59281437125748,
"eval_loss": 6.385756015777588,
"eval_runtime": 88.9775,
"eval_samples_per_second": 112.388,
"eval_steps_per_second": 3.518,
"step": 23900
},
{
"epoch": 213.47992903082724,
"grad_norm": 0.22561503946781158,
"learning_rate": 3.6120401337792645e-06,
"loss": 6.3697,
"step": 24000
},
{
"epoch": 213.47992903082724,
"eval_loss": 6.388892650604248,
"eval_runtime": 88.1935,
"eval_samples_per_second": 113.387,
"eval_steps_per_second": 3.549,
"step": 24000
},
{
"epoch": 214.367043690397,
"grad_norm": 0.23940326273441315,
"learning_rate": 3.6020066889632112e-06,
"loss": 6.3689,
"step": 24100
},
{
"epoch": 214.367043690397,
"eval_loss": 6.386131286621094,
"eval_runtime": 88.4334,
"eval_samples_per_second": 113.079,
"eval_steps_per_second": 3.539,
"step": 24100
},
{
"epoch": 215.25415834996673,
"grad_norm": 0.3109673857688904,
"learning_rate": 3.5919732441471576e-06,
"loss": 6.3694,
"step": 24200
},
{
"epoch": 215.25415834996673,
"eval_loss": 6.3832244873046875,
"eval_runtime": 89.0249,
"eval_samples_per_second": 112.328,
"eval_steps_per_second": 3.516,
"step": 24200
},
{
"epoch": 216.1412730095365,
"grad_norm": 0.2562812566757202,
"learning_rate": 3.581939799331104e-06,
"loss": 6.3686,
"step": 24300
},
{
"epoch": 216.1412730095365,
"eval_loss": 6.385456085205078,
"eval_runtime": 88.1951,
"eval_samples_per_second": 113.385,
"eval_steps_per_second": 3.549,
"step": 24300
},
{
"epoch": 217.02838766910622,
"grad_norm": 0.33149996399879456,
"learning_rate": 3.5719063545150507e-06,
"loss": 6.3696,
"step": 24400
},
{
"epoch": 217.02838766910622,
"eval_loss": 6.387702465057373,
"eval_runtime": 88.9847,
"eval_samples_per_second": 112.379,
"eval_steps_per_second": 3.517,
"step": 24400
},
{
"epoch": 217.91550232867598,
"grad_norm": 0.2598579525947571,
"learning_rate": 3.561872909698997e-06,
"loss": 6.3699,
"step": 24500
},
{
"epoch": 217.91550232867598,
"eval_loss": 6.38595724105835,
"eval_runtime": 88.198,
"eval_samples_per_second": 113.381,
"eval_steps_per_second": 3.549,
"step": 24500
},
{
"epoch": 218.80261698824572,
"grad_norm": 0.2651689648628235,
"learning_rate": 3.5518394648829434e-06,
"loss": 6.3703,
"step": 24600
},
{
"epoch": 218.80261698824572,
"eval_loss": 6.383368968963623,
"eval_runtime": 89.0584,
"eval_samples_per_second": 112.286,
"eval_steps_per_second": 3.515,
"step": 24600
},
{
"epoch": 219.68973164781548,
"grad_norm": 0.25209030508995056,
"learning_rate": 3.54180602006689e-06,
"loss": 6.3703,
"step": 24700
},
{
"epoch": 219.68973164781548,
"eval_loss": 6.389649868011475,
"eval_runtime": 89.0152,
"eval_samples_per_second": 112.34,
"eval_steps_per_second": 3.516,
"step": 24700
},
{
"epoch": 220.57684630738524,
"grad_norm": 0.16648085415363312,
"learning_rate": 3.5317725752508365e-06,
"loss": 6.3694,
"step": 24800
},
{
"epoch": 220.57684630738524,
"eval_loss": 6.384476661682129,
"eval_runtime": 89.0288,
"eval_samples_per_second": 112.323,
"eval_steps_per_second": 3.516,
"step": 24800
},
{
"epoch": 221.46396096695497,
"grad_norm": 0.25535905361175537,
"learning_rate": 3.521739130434783e-06,
"loss": 6.3701,
"step": 24900
},
{
"epoch": 221.46396096695497,
"eval_loss": 6.383844375610352,
"eval_runtime": 88.1889,
"eval_samples_per_second": 113.393,
"eval_steps_per_second": 3.549,
"step": 24900
},
{
"epoch": 222.35107562652473,
"grad_norm": 0.14982174336910248,
"learning_rate": 3.5117056856187296e-06,
"loss": 6.3689,
"step": 25000
},
{
"epoch": 222.35107562652473,
"eval_loss": 6.383812427520752,
"eval_runtime": 88.1955,
"eval_samples_per_second": 113.385,
"eval_steps_per_second": 3.549,
"step": 25000
},
{
"epoch": 223.23819028609446,
"grad_norm": 0.24092227220535278,
"learning_rate": 3.501672240802676e-06,
"loss": 6.3696,
"step": 25100
},
{
"epoch": 223.23819028609446,
"eval_loss": 6.387426376342773,
"eval_runtime": 88.8638,
"eval_samples_per_second": 112.532,
"eval_steps_per_second": 3.522,
"step": 25100
},
{
"epoch": 224.12530494566423,
"grad_norm": 0.3173174262046814,
"learning_rate": 3.491638795986622e-06,
"loss": 6.3685,
"step": 25200
},
{
"epoch": 224.12530494566423,
"eval_loss": 6.387609004974365,
"eval_runtime": 88.9892,
"eval_samples_per_second": 112.373,
"eval_steps_per_second": 3.517,
"step": 25200
},
{
"epoch": 225.012419605234,
"grad_norm": 0.2092152088880539,
"learning_rate": 3.481605351170568e-06,
"loss": 6.3695,
"step": 25300
},
{
"epoch": 225.012419605234,
"eval_loss": 6.386031627655029,
"eval_runtime": 88.2056,
"eval_samples_per_second": 113.371,
"eval_steps_per_second": 3.549,
"step": 25300
},
{
"epoch": 225.89953426480372,
"grad_norm": 0.2362297624349594,
"learning_rate": 3.471571906354515e-06,
"loss": 6.3684,
"step": 25400
},
{
"epoch": 225.89953426480372,
"eval_loss": 6.389245510101318,
"eval_runtime": 88.1955,
"eval_samples_per_second": 113.384,
"eval_steps_per_second": 3.549,
"step": 25400
},
{
"epoch": 226.78664892437348,
"grad_norm": 0.16113384068012238,
"learning_rate": 3.4615384615384613e-06,
"loss": 6.3688,
"step": 25500
},
{
"epoch": 226.78664892437348,
"eval_loss": 6.388128757476807,
"eval_runtime": 88.1884,
"eval_samples_per_second": 113.394,
"eval_steps_per_second": 3.549,
"step": 25500
},
{
"epoch": 227.6737635839432,
"grad_norm": 0.28249019384384155,
"learning_rate": 3.4515050167224076e-06,
"loss": 6.3685,
"step": 25600
},
{
"epoch": 227.6737635839432,
"eval_loss": 6.38515043258667,
"eval_runtime": 89.0087,
"eval_samples_per_second": 112.349,
"eval_steps_per_second": 3.517,
"step": 25600
},
{
"epoch": 228.56087824351297,
"grad_norm": 0.2178281992673874,
"learning_rate": 3.4414715719063544e-06,
"loss": 6.3692,
"step": 25700
},
{
"epoch": 228.56087824351297,
"eval_loss": 6.385435104370117,
"eval_runtime": 89.0004,
"eval_samples_per_second": 112.359,
"eval_steps_per_second": 3.517,
"step": 25700
},
{
"epoch": 229.44799290308273,
"grad_norm": 0.2855147123336792,
"learning_rate": 3.4314381270903007e-06,
"loss": 6.3691,
"step": 25800
},
{
"epoch": 229.44799290308273,
"eval_loss": 6.384737491607666,
"eval_runtime": 89.03,
"eval_samples_per_second": 112.322,
"eval_steps_per_second": 3.516,
"step": 25800
},
{
"epoch": 230.33510756265247,
"grad_norm": 0.2967989146709442,
"learning_rate": 3.4214046822742475e-06,
"loss": 6.3688,
"step": 25900
},
{
"epoch": 230.33510756265247,
"eval_loss": 6.380478382110596,
"eval_runtime": 88.1811,
"eval_samples_per_second": 113.403,
"eval_steps_per_second": 3.55,
"step": 25900
},
{
"epoch": 231.22222222222223,
"grad_norm": 0.23676429688930511,
"learning_rate": 3.411371237458194e-06,
"loss": 6.3689,
"step": 26000
},
{
"epoch": 231.22222222222223,
"eval_loss": 6.383557319641113,
"eval_runtime": 88.9992,
"eval_samples_per_second": 112.361,
"eval_steps_per_second": 3.517,
"step": 26000
},
{
"epoch": 232.10933688179196,
"grad_norm": 0.26867687702178955,
"learning_rate": 3.40133779264214e-06,
"loss": 6.3687,
"step": 26100
},
{
"epoch": 232.10933688179196,
"eval_loss": 6.382840633392334,
"eval_runtime": 88.2227,
"eval_samples_per_second": 113.349,
"eval_steps_per_second": 3.548,
"step": 26100
},
{
"epoch": 232.99645154136172,
"grad_norm": 0.31317785382270813,
"learning_rate": 3.391304347826087e-06,
"loss": 6.3681,
"step": 26200
},
{
"epoch": 232.99645154136172,
"eval_loss": 6.383928298950195,
"eval_runtime": 88.1948,
"eval_samples_per_second": 113.385,
"eval_steps_per_second": 3.549,
"step": 26200
},
{
"epoch": 233.88356620093148,
"grad_norm": 0.19290131330490112,
"learning_rate": 3.3812709030100333e-06,
"loss": 6.3686,
"step": 26300
},
{
"epoch": 233.88356620093148,
"eval_loss": 6.383606910705566,
"eval_runtime": 88.1805,
"eval_samples_per_second": 113.404,
"eval_steps_per_second": 3.55,
"step": 26300
},
{
"epoch": 234.77068086050122,
"grad_norm": 0.2145206481218338,
"learning_rate": 3.3712374581939796e-06,
"loss": 6.3683,
"step": 26400
},
{
"epoch": 234.77068086050122,
"eval_loss": 6.382413864135742,
"eval_runtime": 89.0087,
"eval_samples_per_second": 112.349,
"eval_steps_per_second": 3.517,
"step": 26400
},
{
"epoch": 235.65779552007098,
"grad_norm": 0.23395557701587677,
"learning_rate": 3.3612040133779264e-06,
"loss": 6.3685,
"step": 26500
},
{
"epoch": 235.65779552007098,
"eval_loss": 6.381302356719971,
"eval_runtime": 89.0044,
"eval_samples_per_second": 112.354,
"eval_steps_per_second": 3.517,
"step": 26500
},
{
"epoch": 236.5449101796407,
"grad_norm": 0.2277672439813614,
"learning_rate": 3.3511705685618727e-06,
"loss": 6.3694,
"step": 26600
},
{
"epoch": 236.5449101796407,
"eval_loss": 6.382754325866699,
"eval_runtime": 88.1906,
"eval_samples_per_second": 113.391,
"eval_steps_per_second": 3.549,
"step": 26600
},
{
"epoch": 237.43202483921047,
"grad_norm": 0.15456043183803558,
"learning_rate": 3.3411371237458195e-06,
"loss": 6.3674,
"step": 26700
},
{
"epoch": 237.43202483921047,
"eval_loss": 6.385075569152832,
"eval_runtime": 89.0461,
"eval_samples_per_second": 112.301,
"eval_steps_per_second": 3.515,
"step": 26700
},
{
"epoch": 238.31913949878023,
"grad_norm": 0.2268277257680893,
"learning_rate": 3.331103678929766e-06,
"loss": 6.3679,
"step": 26800
},
{
"epoch": 238.31913949878023,
"eval_loss": 6.382864952087402,
"eval_runtime": 88.1787,
"eval_samples_per_second": 113.406,
"eval_steps_per_second": 3.55,
"step": 26800
},
{
"epoch": 239.20625415834996,
"grad_norm": 0.2599903643131256,
"learning_rate": 3.321070234113712e-06,
"loss": 6.3681,
"step": 26900
},
{
"epoch": 239.20625415834996,
"eval_loss": 6.382370948791504,
"eval_runtime": 88.1887,
"eval_samples_per_second": 113.393,
"eval_steps_per_second": 3.549,
"step": 26900
},
{
"epoch": 240.09336881791972,
"grad_norm": 0.2117336094379425,
"learning_rate": 3.311036789297659e-06,
"loss": 6.3686,
"step": 27000
},
{
"epoch": 240.09336881791972,
"eval_loss": 6.381521701812744,
"eval_runtime": 88.9818,
"eval_samples_per_second": 112.382,
"eval_steps_per_second": 3.518,
"step": 27000
},
{
"epoch": 240.98048347748946,
"grad_norm": 0.20599253475666046,
"learning_rate": 3.3010033444816052e-06,
"loss": 6.3683,
"step": 27100
},
{
"epoch": 240.98048347748946,
"eval_loss": 6.382330417633057,
"eval_runtime": 88.1957,
"eval_samples_per_second": 113.384,
"eval_steps_per_second": 3.549,
"step": 27100
},
{
"epoch": 241.86759813705922,
"grad_norm": 0.22722215950489044,
"learning_rate": 3.2909698996655516e-06,
"loss": 6.3678,
"step": 27200
},
{
"epoch": 241.86759813705922,
"eval_loss": 6.3871564865112305,
"eval_runtime": 88.1783,
"eval_samples_per_second": 113.407,
"eval_steps_per_second": 3.55,
"step": 27200
},
{
"epoch": 242.75471279662895,
"grad_norm": 0.259403795003891,
"learning_rate": 3.2809364548494983e-06,
"loss": 6.3681,
"step": 27300
},
{
"epoch": 242.75471279662895,
"eval_loss": 6.384130954742432,
"eval_runtime": 89.014,
"eval_samples_per_second": 112.342,
"eval_steps_per_second": 3.516,
"step": 27300
},
{
"epoch": 243.6418274561987,
"grad_norm": 0.25630879402160645,
"learning_rate": 3.2709030100334447e-06,
"loss": 6.3682,
"step": 27400
},
{
"epoch": 243.6418274561987,
"eval_loss": 6.382914066314697,
"eval_runtime": 89.0259,
"eval_samples_per_second": 112.327,
"eval_steps_per_second": 3.516,
"step": 27400
},
{
"epoch": 244.52894211576847,
"grad_norm": 0.28536516427993774,
"learning_rate": 3.260869565217391e-06,
"loss": 6.3686,
"step": 27500
},
{
"epoch": 244.52894211576847,
"eval_loss": 6.386742115020752,
"eval_runtime": 88.9916,
"eval_samples_per_second": 112.37,
"eval_steps_per_second": 3.517,
"step": 27500
},
{
"epoch": 245.4160567753382,
"grad_norm": 0.1816515326499939,
"learning_rate": 3.2508361204013378e-06,
"loss": 6.3667,
"step": 27600
},
{
"epoch": 245.4160567753382,
"eval_loss": 6.380117416381836,
"eval_runtime": 88.9894,
"eval_samples_per_second": 112.373,
"eval_steps_per_second": 3.517,
"step": 27600
},
{
"epoch": 246.30317143490797,
"grad_norm": 0.24183250963687897,
"learning_rate": 3.240802675585284e-06,
"loss": 6.3675,
"step": 27700
},
{
"epoch": 246.30317143490797,
"eval_loss": 6.3849968910217285,
"eval_runtime": 88.1725,
"eval_samples_per_second": 113.414,
"eval_steps_per_second": 3.55,
"step": 27700
},
{
"epoch": 247.1902860944777,
"grad_norm": 0.28278273344039917,
"learning_rate": 3.230769230769231e-06,
"loss": 6.368,
"step": 27800
},
{
"epoch": 247.1902860944777,
"eval_loss": 6.382080554962158,
"eval_runtime": 88.1841,
"eval_samples_per_second": 113.399,
"eval_steps_per_second": 3.549,
"step": 27800
},
{
"epoch": 248.07740075404746,
"grad_norm": 0.27085331082344055,
"learning_rate": 3.2207357859531772e-06,
"loss": 6.3686,
"step": 27900
},
{
"epoch": 248.07740075404746,
"eval_loss": 6.384332656860352,
"eval_runtime": 88.1761,
"eval_samples_per_second": 113.409,
"eval_steps_per_second": 3.55,
"step": 27900
},
{
"epoch": 248.96451541361722,
"grad_norm": 0.18361283838748932,
"learning_rate": 3.2107023411371236e-06,
"loss": 6.3667,
"step": 28000
},
{
"epoch": 248.96451541361722,
"eval_loss": 6.383978843688965,
"eval_runtime": 88.1931,
"eval_samples_per_second": 113.388,
"eval_steps_per_second": 3.549,
"step": 28000
},
{
"epoch": 249.85163007318695,
"grad_norm": 0.20948508381843567,
"learning_rate": 3.2006688963210703e-06,
"loss": 6.3683,
"step": 28100
},
{
"epoch": 249.85163007318695,
"eval_loss": 6.383596420288086,
"eval_runtime": 88.1945,
"eval_samples_per_second": 113.386,
"eval_steps_per_second": 3.549,
"step": 28100
},
{
"epoch": 250.73874473275671,
"grad_norm": 0.2579098641872406,
"learning_rate": 3.1906354515050167e-06,
"loss": 6.3679,
"step": 28200
},
{
"epoch": 250.73874473275671,
"eval_loss": 6.38535213470459,
"eval_runtime": 89.0182,
"eval_samples_per_second": 112.337,
"eval_steps_per_second": 3.516,
"step": 28200
},
{
"epoch": 251.62585939232645,
"grad_norm": 0.16455556452274323,
"learning_rate": 3.180602006688963e-06,
"loss": 6.3679,
"step": 28300
},
{
"epoch": 251.62585939232645,
"eval_loss": 6.3854899406433105,
"eval_runtime": 88.1768,
"eval_samples_per_second": 113.409,
"eval_steps_per_second": 3.55,
"step": 28300
},
{
"epoch": 252.5129740518962,
"grad_norm": 0.15089711546897888,
"learning_rate": 3.1705685618729098e-06,
"loss": 6.3674,
"step": 28400
},
{
"epoch": 252.5129740518962,
"eval_loss": 6.380008697509766,
"eval_runtime": 88.186,
"eval_samples_per_second": 113.397,
"eval_steps_per_second": 3.549,
"step": 28400
},
{
"epoch": 253.40008871146597,
"grad_norm": 0.19287870824337006,
"learning_rate": 3.160535117056856e-06,
"loss": 6.3671,
"step": 28500
},
{
"epoch": 253.40008871146597,
"eval_loss": 6.381292343139648,
"eval_runtime": 89.0041,
"eval_samples_per_second": 112.354,
"eval_steps_per_second": 3.517,
"step": 28500
},
{
"epoch": 254.2872033710357,
"grad_norm": 0.28032493591308594,
"learning_rate": 3.1505016722408024e-06,
"loss": 6.3684,
"step": 28600
},
{
"epoch": 254.2872033710357,
"eval_loss": 6.381994247436523,
"eval_runtime": 88.2052,
"eval_samples_per_second": 113.372,
"eval_steps_per_second": 3.549,
"step": 28600
},
{
"epoch": 255.17431803060546,
"grad_norm": 0.2228955328464508,
"learning_rate": 3.140468227424749e-06,
"loss": 6.3673,
"step": 28700
},
{
"epoch": 255.17431803060546,
"eval_loss": 6.3841552734375,
"eval_runtime": 88.1783,
"eval_samples_per_second": 113.407,
"eval_steps_per_second": 3.55,
"step": 28700
},
{
"epoch": 256.0614326901752,
"grad_norm": 0.2289431095123291,
"learning_rate": 3.1304347826086955e-06,
"loss": 6.3667,
"step": 28800
},
{
"epoch": 256.0614326901752,
"eval_loss": 6.383512020111084,
"eval_runtime": 89.0073,
"eval_samples_per_second": 112.35,
"eval_steps_per_second": 3.517,
"step": 28800
},
{
"epoch": 256.94854734974496,
"grad_norm": 0.17454871535301208,
"learning_rate": 3.1204013377926423e-06,
"loss": 6.3668,
"step": 28900
},
{
"epoch": 256.94854734974496,
"eval_loss": 6.386359214782715,
"eval_runtime": 88.1766,
"eval_samples_per_second": 113.409,
"eval_steps_per_second": 3.55,
"step": 28900
},
{
"epoch": 257.8356620093147,
"grad_norm": 0.19062787294387817,
"learning_rate": 3.1103678929765886e-06,
"loss": 6.3671,
"step": 29000
},
{
"epoch": 257.8356620093147,
"eval_loss": 6.382784366607666,
"eval_runtime": 89.0271,
"eval_samples_per_second": 112.325,
"eval_steps_per_second": 3.516,
"step": 29000
},
{
"epoch": 258.7227766688845,
"grad_norm": 0.19611743092536926,
"learning_rate": 3.100334448160535e-06,
"loss": 6.3673,
"step": 29100
},
{
"epoch": 258.7227766688845,
"eval_loss": 6.378743648529053,
"eval_runtime": 89.0,
"eval_samples_per_second": 112.36,
"eval_steps_per_second": 3.517,
"step": 29100
},
{
"epoch": 259.6098913284542,
"grad_norm": 0.20483489334583282,
"learning_rate": 3.0903010033444818e-06,
"loss": 6.3666,
"step": 29200
},
{
"epoch": 259.6098913284542,
"eval_loss": 6.384799003601074,
"eval_runtime": 88.186,
"eval_samples_per_second": 113.397,
"eval_steps_per_second": 3.549,
"step": 29200
},
{
"epoch": 260.49700598802394,
"grad_norm": 0.1686568409204483,
"learning_rate": 3.080267558528428e-06,
"loss": 6.3678,
"step": 29300
},
{
"epoch": 260.49700598802394,
"eval_loss": 6.38092565536499,
"eval_runtime": 88.191,
"eval_samples_per_second": 113.39,
"eval_steps_per_second": 3.549,
"step": 29300
},
{
"epoch": 261.3841206475937,
"grad_norm": 0.16638343036174774,
"learning_rate": 3.0702341137123744e-06,
"loss": 6.3671,
"step": 29400
},
{
"epoch": 261.3841206475937,
"eval_loss": 6.380900859832764,
"eval_runtime": 88.1878,
"eval_samples_per_second": 113.394,
"eval_steps_per_second": 3.549,
"step": 29400
},
{
"epoch": 262.27123530716347,
"grad_norm": 0.16073353588581085,
"learning_rate": 3.060200668896321e-06,
"loss": 6.3668,
"step": 29500
},
{
"epoch": 262.27123530716347,
"eval_loss": 6.382925033569336,
"eval_runtime": 88.184,
"eval_samples_per_second": 113.399,
"eval_steps_per_second": 3.549,
"step": 29500
},
{
"epoch": 263.1583499667332,
"grad_norm": 0.2387487143278122,
"learning_rate": 3.0501672240802675e-06,
"loss": 6.3665,
"step": 29600
},
{
"epoch": 263.1583499667332,
"eval_loss": 6.3799662590026855,
"eval_runtime": 88.1877,
"eval_samples_per_second": 113.394,
"eval_steps_per_second": 3.549,
"step": 29600
},
{
"epoch": 264.04546462630293,
"grad_norm": 0.22873957455158234,
"learning_rate": 3.0401337792642143e-06,
"loss": 6.3666,
"step": 29700
},
{
"epoch": 264.04546462630293,
"eval_loss": 6.379544734954834,
"eval_runtime": 88.1981,
"eval_samples_per_second": 113.381,
"eval_steps_per_second": 3.549,
"step": 29700
},
{
"epoch": 264.9325792858727,
"grad_norm": 0.20048406720161438,
"learning_rate": 3.0301003344481606e-06,
"loss": 6.3668,
"step": 29800
},
{
"epoch": 264.9325792858727,
"eval_loss": 6.380821228027344,
"eval_runtime": 88.1967,
"eval_samples_per_second": 113.383,
"eval_steps_per_second": 3.549,
"step": 29800
},
{
"epoch": 265.81969394544245,
"grad_norm": 0.20105549693107605,
"learning_rate": 3.020066889632107e-06,
"loss": 6.3663,
"step": 29900
},
{
"epoch": 265.81969394544245,
"eval_loss": 6.3833537101745605,
"eval_runtime": 88.9918,
"eval_samples_per_second": 112.37,
"eval_steps_per_second": 3.517,
"step": 29900
},
{
"epoch": 266.7068086050122,
"grad_norm": 0.26339054107666016,
"learning_rate": 3.0100334448160537e-06,
"loss": 6.3663,
"step": 30000
},
{
"epoch": 266.7068086050122,
"eval_loss": 6.388853073120117,
"eval_runtime": 89.0161,
"eval_samples_per_second": 112.339,
"eval_steps_per_second": 3.516,
"step": 30000
},
{
"epoch": 267.593923264582,
"grad_norm": 0.1931493878364563,
"learning_rate": 3e-06,
"loss": 6.3666,
"step": 30100
},
{
"epoch": 267.593923264582,
"eval_loss": 6.378931045532227,
"eval_runtime": 88.2044,
"eval_samples_per_second": 113.373,
"eval_steps_per_second": 3.549,
"step": 30100
},
{
"epoch": 268.4810379241517,
"grad_norm": 0.268880158662796,
"learning_rate": 2.9899665551839464e-06,
"loss": 6.367,
"step": 30200
},
{
"epoch": 268.4810379241517,
"eval_loss": 6.381078243255615,
"eval_runtime": 88.182,
"eval_samples_per_second": 113.402,
"eval_steps_per_second": 3.549,
"step": 30200
},
{
"epoch": 269.36815258372144,
"grad_norm": 0.15537361800670624,
"learning_rate": 2.979933110367893e-06,
"loss": 6.3659,
"step": 30300
},
{
"epoch": 269.36815258372144,
"eval_loss": 6.38137674331665,
"eval_runtime": 88.1976,
"eval_samples_per_second": 113.382,
"eval_steps_per_second": 3.549,
"step": 30300
},
{
"epoch": 270.2552672432912,
"grad_norm": 0.23357395827770233,
"learning_rate": 2.9698996655518395e-06,
"loss": 6.3661,
"step": 30400
},
{
"epoch": 270.2552672432912,
"eval_loss": 6.384622573852539,
"eval_runtime": 88.1861,
"eval_samples_per_second": 113.397,
"eval_steps_per_second": 3.549,
"step": 30400
},
{
"epoch": 271.14238190286096,
"grad_norm": 0.29505735635757446,
"learning_rate": 2.959866220735786e-06,
"loss": 6.3666,
"step": 30500
},
{
"epoch": 271.14238190286096,
"eval_loss": 6.383800983428955,
"eval_runtime": 88.188,
"eval_samples_per_second": 113.394,
"eval_steps_per_second": 3.549,
"step": 30500
},
{
"epoch": 272.0294965624307,
"grad_norm": 0.14850308001041412,
"learning_rate": 2.9498327759197326e-06,
"loss": 6.3664,
"step": 30600
},
{
"epoch": 272.0294965624307,
"eval_loss": 6.384856224060059,
"eval_runtime": 88.1953,
"eval_samples_per_second": 113.385,
"eval_steps_per_second": 3.549,
"step": 30600
},
{
"epoch": 272.9166112220004,
"grad_norm": 0.16296862065792084,
"learning_rate": 2.939799331103679e-06,
"loss": 6.3667,
"step": 30700
},
{
"epoch": 272.9166112220004,
"eval_loss": 6.380056858062744,
"eval_runtime": 88.6214,
"eval_samples_per_second": 112.84,
"eval_steps_per_second": 3.532,
"step": 30700
},
{
"epoch": 273.8037258815702,
"grad_norm": 0.212349534034729,
"learning_rate": 2.9297658862876257e-06,
"loss": 6.3659,
"step": 30800
},
{
"epoch": 273.8037258815702,
"eval_loss": 6.379006862640381,
"eval_runtime": 89.0119,
"eval_samples_per_second": 112.345,
"eval_steps_per_second": 3.516,
"step": 30800
},
{
"epoch": 274.69084054113995,
"grad_norm": 0.18035291135311127,
"learning_rate": 2.919732441471572e-06,
"loss": 6.3664,
"step": 30900
},
{
"epoch": 274.69084054113995,
"eval_loss": 6.382543563842773,
"eval_runtime": 89.0418,
"eval_samples_per_second": 112.307,
"eval_steps_per_second": 3.515,
"step": 30900
},
{
"epoch": 275.5779552007097,
"grad_norm": 0.24907241761684418,
"learning_rate": 2.9096989966555184e-06,
"loss": 6.3669,
"step": 31000
},
{
"epoch": 275.5779552007097,
"eval_loss": 6.379300594329834,
"eval_runtime": 88.2037,
"eval_samples_per_second": 113.374,
"eval_steps_per_second": 3.549,
"step": 31000
},
{
"epoch": 276.4650698602794,
"grad_norm": 0.1900593638420105,
"learning_rate": 2.899665551839465e-06,
"loss": 6.367,
"step": 31100
},
{
"epoch": 276.4650698602794,
"eval_loss": 6.3781561851501465,
"eval_runtime": 89.0059,
"eval_samples_per_second": 112.352,
"eval_steps_per_second": 3.517,
"step": 31100
},
{
"epoch": 277.3521845198492,
"grad_norm": 0.16180412471294403,
"learning_rate": 2.8896321070234115e-06,
"loss": 6.3663,
"step": 31200
},
{
"epoch": 277.3521845198492,
"eval_loss": 6.377742767333984,
"eval_runtime": 89.0264,
"eval_samples_per_second": 112.326,
"eval_steps_per_second": 3.516,
"step": 31200
},
{
"epoch": 278.23929917941894,
"grad_norm": 0.15212863683700562,
"learning_rate": 2.879598662207358e-06,
"loss": 6.3667,
"step": 31300
},
{
"epoch": 278.23929917941894,
"eval_loss": 6.379834175109863,
"eval_runtime": 88.1893,
"eval_samples_per_second": 113.392,
"eval_steps_per_second": 3.549,
"step": 31300
},
{
"epoch": 279.1264138389887,
"grad_norm": 0.17719916999340057,
"learning_rate": 2.8695652173913046e-06,
"loss": 6.3662,
"step": 31400
},
{
"epoch": 279.1264138389887,
"eval_loss": 6.383392333984375,
"eval_runtime": 88.1973,
"eval_samples_per_second": 113.382,
"eval_steps_per_second": 3.549,
"step": 31400
},
{
"epoch": 280.01352849855846,
"grad_norm": 0.25364619493484497,
"learning_rate": 2.859531772575251e-06,
"loss": 6.3667,
"step": 31500
},
{
"epoch": 280.01352849855846,
"eval_loss": 6.38493537902832,
"eval_runtime": 88.2155,
"eval_samples_per_second": 113.359,
"eval_steps_per_second": 3.548,
"step": 31500
},
{
"epoch": 280.90064315812816,
"grad_norm": 0.14650413393974304,
"learning_rate": 2.8494983277591977e-06,
"loss": 6.3657,
"step": 31600
},
{
"epoch": 280.90064315812816,
"eval_loss": 6.381402015686035,
"eval_runtime": 89.0091,
"eval_samples_per_second": 112.348,
"eval_steps_per_second": 3.516,
"step": 31600
},
{
"epoch": 281.7877578176979,
"grad_norm": 0.18827463686466217,
"learning_rate": 2.839464882943144e-06,
"loss": 6.366,
"step": 31700
},
{
"epoch": 281.7877578176979,
"eval_loss": 6.382148265838623,
"eval_runtime": 89.0075,
"eval_samples_per_second": 112.35,
"eval_steps_per_second": 3.517,
"step": 31700
},
{
"epoch": 282.6748724772677,
"grad_norm": 0.1384831815958023,
"learning_rate": 2.8294314381270904e-06,
"loss": 6.3652,
"step": 31800
},
{
"epoch": 282.6748724772677,
"eval_loss": 6.384429454803467,
"eval_runtime": 89.0178,
"eval_samples_per_second": 112.337,
"eval_steps_per_second": 3.516,
"step": 31800
},
{
"epoch": 283.56198713683744,
"grad_norm": 0.2322372943162918,
"learning_rate": 2.819397993311037e-06,
"loss": 6.3665,
"step": 31900
},
{
"epoch": 283.56198713683744,
"eval_loss": 6.378748416900635,
"eval_runtime": 88.1981,
"eval_samples_per_second": 113.381,
"eval_steps_per_second": 3.549,
"step": 31900
},
{
"epoch": 284.4491017964072,
"grad_norm": 0.18588069081306458,
"learning_rate": 2.8093645484949835e-06,
"loss": 6.3655,
"step": 32000
},
{
"epoch": 284.4491017964072,
"eval_loss": 6.383064270019531,
"eval_runtime": 88.9701,
"eval_samples_per_second": 112.397,
"eval_steps_per_second": 3.518,
"step": 32000
},
{
"epoch": 285.3362164559769,
"grad_norm": 0.24989992380142212,
"learning_rate": 2.79933110367893e-06,
"loss": 6.3657,
"step": 32100
},
{
"epoch": 285.3362164559769,
"eval_loss": 6.381895542144775,
"eval_runtime": 88.1861,
"eval_samples_per_second": 113.396,
"eval_steps_per_second": 3.549,
"step": 32100
},
{
"epoch": 286.22333111554667,
"grad_norm": 0.15007902681827545,
"learning_rate": 2.7892976588628766e-06,
"loss": 6.3655,
"step": 32200
},
{
"epoch": 286.22333111554667,
"eval_loss": 6.381099224090576,
"eval_runtime": 88.2079,
"eval_samples_per_second": 113.368,
"eval_steps_per_second": 3.548,
"step": 32200
},
{
"epoch": 287.11044577511643,
"grad_norm": 0.1818419098854065,
"learning_rate": 2.779264214046823e-06,
"loss": 6.3647,
"step": 32300
},
{
"epoch": 287.11044577511643,
"eval_loss": 6.380296230316162,
"eval_runtime": 88.1867,
"eval_samples_per_second": 113.396,
"eval_steps_per_second": 3.549,
"step": 32300
},
{
"epoch": 287.9975604346862,
"grad_norm": 0.16886812448501587,
"learning_rate": 2.7692307692307693e-06,
"loss": 6.3657,
"step": 32400
},
{
"epoch": 287.9975604346862,
"eval_loss": 6.378762245178223,
"eval_runtime": 89.0581,
"eval_samples_per_second": 112.286,
"eval_steps_per_second": 3.515,
"step": 32400
},
{
"epoch": 288.88467509425595,
"grad_norm": 0.1774781197309494,
"learning_rate": 2.759197324414716e-06,
"loss": 6.3652,
"step": 32500
},
{
"epoch": 288.88467509425595,
"eval_loss": 6.377442359924316,
"eval_runtime": 89.0228,
"eval_samples_per_second": 112.331,
"eval_steps_per_second": 3.516,
"step": 32500
},
{
"epoch": 289.77178975382566,
"grad_norm": 0.22276373207569122,
"learning_rate": 2.749163879598662e-06,
"loss": 6.3651,
"step": 32600
},
{
"epoch": 289.77178975382566,
"eval_loss": 6.378692626953125,
"eval_runtime": 88.9428,
"eval_samples_per_second": 112.432,
"eval_steps_per_second": 3.519,
"step": 32600
},
{
"epoch": 290.6589044133954,
"grad_norm": 0.17587396502494812,
"learning_rate": 2.7391304347826087e-06,
"loss": 6.3659,
"step": 32700
},
{
"epoch": 290.6589044133954,
"eval_loss": 6.381659984588623,
"eval_runtime": 88.9921,
"eval_samples_per_second": 112.37,
"eval_steps_per_second": 3.517,
"step": 32700
},
{
"epoch": 291.5460190729652,
"grad_norm": 0.14095981419086456,
"learning_rate": 2.729096989966555e-06,
"loss": 6.3658,
"step": 32800
},
{
"epoch": 291.5460190729652,
"eval_loss": 6.3807477951049805,
"eval_runtime": 88.2004,
"eval_samples_per_second": 113.378,
"eval_steps_per_second": 3.549,
"step": 32800
},
{
"epoch": 292.43313373253494,
"grad_norm": 0.24706387519836426,
"learning_rate": 2.7190635451505014e-06,
"loss": 6.3664,
"step": 32900
},
{
"epoch": 292.43313373253494,
"eval_loss": 6.381751537322998,
"eval_runtime": 88.2016,
"eval_samples_per_second": 113.377,
"eval_steps_per_second": 3.549,
"step": 32900
},
{
"epoch": 293.3202483921047,
"grad_norm": 0.22346995770931244,
"learning_rate": 2.709030100334448e-06,
"loss": 6.3639,
"step": 33000
},
{
"epoch": 293.3202483921047,
"eval_loss": 6.382026195526123,
"eval_runtime": 88.1835,
"eval_samples_per_second": 113.4,
"eval_steps_per_second": 3.549,
"step": 33000
},
{
"epoch": 294.2073630516744,
"grad_norm": 0.172585129737854,
"learning_rate": 2.6989966555183945e-06,
"loss": 6.3672,
"step": 33100
},
{
"epoch": 294.2073630516744,
"eval_loss": 6.37891149520874,
"eval_runtime": 88.1788,
"eval_samples_per_second": 113.406,
"eval_steps_per_second": 3.55,
"step": 33100
},
{
"epoch": 295.09447771124417,
"grad_norm": 0.19066356122493744,
"learning_rate": 2.6889632107023413e-06,
"loss": 6.3665,
"step": 33200
},
{
"epoch": 295.09447771124417,
"eval_loss": 6.381018161773682,
"eval_runtime": 88.2083,
"eval_samples_per_second": 113.368,
"eval_steps_per_second": 3.548,
"step": 33200
},
{
"epoch": 295.9815923708139,
"grad_norm": 0.18018165230751038,
"learning_rate": 2.6789297658862876e-06,
"loss": 6.3654,
"step": 33300
},
{
"epoch": 295.9815923708139,
"eval_loss": 6.384938716888428,
"eval_runtime": 89.0301,
"eval_samples_per_second": 112.322,
"eval_steps_per_second": 3.516,
"step": 33300
},
{
"epoch": 296.8687070303837,
"grad_norm": 0.20351873338222504,
"learning_rate": 2.668896321070234e-06,
"loss": 6.3657,
"step": 33400
},
{
"epoch": 296.8687070303837,
"eval_loss": 6.382087230682373,
"eval_runtime": 88.6634,
"eval_samples_per_second": 112.786,
"eval_steps_per_second": 3.53,
"step": 33400
},
{
"epoch": 297.75582168995345,
"grad_norm": 0.13977867364883423,
"learning_rate": 2.6588628762541807e-06,
"loss": 6.3651,
"step": 33500
},
{
"epoch": 297.75582168995345,
"eval_loss": 6.378364086151123,
"eval_runtime": 88.988,
"eval_samples_per_second": 112.375,
"eval_steps_per_second": 3.517,
"step": 33500
},
{
"epoch": 298.64293634952315,
"grad_norm": 0.17024530470371246,
"learning_rate": 2.648829431438127e-06,
"loss": 6.3661,
"step": 33600
},
{
"epoch": 298.64293634952315,
"eval_loss": 6.375431060791016,
"eval_runtime": 88.1687,
"eval_samples_per_second": 113.419,
"eval_steps_per_second": 3.55,
"step": 33600
},
{
"epoch": 299.5300510090929,
"grad_norm": 0.2234225571155548,
"learning_rate": 2.6387959866220734e-06,
"loss": 6.3654,
"step": 33700
},
{
"epoch": 299.5300510090929,
"eval_loss": 6.378067970275879,
"eval_runtime": 88.1651,
"eval_samples_per_second": 113.424,
"eval_steps_per_second": 3.55,
"step": 33700
},
{
"epoch": 300.4171656686627,
"grad_norm": 0.2681805193424225,
"learning_rate": 2.62876254180602e-06,
"loss": 6.3655,
"step": 33800
},
{
"epoch": 300.4171656686627,
"eval_loss": 6.379166603088379,
"eval_runtime": 88.1788,
"eval_samples_per_second": 113.406,
"eval_steps_per_second": 3.55,
"step": 33800
},
{
"epoch": 301.30428032823244,
"grad_norm": 0.1696304976940155,
"learning_rate": 2.6187290969899665e-06,
"loss": 6.3653,
"step": 33900
},
{
"epoch": 301.30428032823244,
"eval_loss": 6.376532554626465,
"eval_runtime": 88.1839,
"eval_samples_per_second": 113.399,
"eval_steps_per_second": 3.549,
"step": 33900
},
{
"epoch": 302.1913949878022,
"grad_norm": 0.2099679708480835,
"learning_rate": 2.6086956521739132e-06,
"loss": 6.3654,
"step": 34000
},
{
"epoch": 302.1913949878022,
"eval_loss": 6.383284568786621,
"eval_runtime": 88.1787,
"eval_samples_per_second": 113.406,
"eval_steps_per_second": 3.55,
"step": 34000
},
{
"epoch": 303.0785096473719,
"grad_norm": 0.16611598432064056,
"learning_rate": 2.5986622073578596e-06,
"loss": 6.3651,
"step": 34100
},
{
"epoch": 303.0785096473719,
"eval_loss": 6.381277084350586,
"eval_runtime": 88.3292,
"eval_samples_per_second": 113.213,
"eval_steps_per_second": 3.544,
"step": 34100
},
{
"epoch": 303.96562430694166,
"grad_norm": 0.19213254749774933,
"learning_rate": 2.588628762541806e-06,
"loss": 6.3652,
"step": 34200
},
{
"epoch": 303.96562430694166,
"eval_loss": 6.383517265319824,
"eval_runtime": 89.0065,
"eval_samples_per_second": 112.351,
"eval_steps_per_second": 3.517,
"step": 34200
},
{
"epoch": 304.8527389665114,
"grad_norm": 0.16786985099315643,
"learning_rate": 2.5785953177257527e-06,
"loss": 6.365,
"step": 34300
},
{
"epoch": 304.8527389665114,
"eval_loss": 6.381478786468506,
"eval_runtime": 89.048,
"eval_samples_per_second": 112.299,
"eval_steps_per_second": 3.515,
"step": 34300
},
{
"epoch": 305.7398536260812,
"grad_norm": 0.1815180480480194,
"learning_rate": 2.568561872909699e-06,
"loss": 6.365,
"step": 34400
},
{
"epoch": 305.7398536260812,
"eval_loss": 6.379263877868652,
"eval_runtime": 89.0151,
"eval_samples_per_second": 112.34,
"eval_steps_per_second": 3.516,
"step": 34400
},
{
"epoch": 306.62696828565095,
"grad_norm": 0.23312950134277344,
"learning_rate": 2.5585284280936454e-06,
"loss": 6.3646,
"step": 34500
},
{
"epoch": 306.62696828565095,
"eval_loss": 6.380245685577393,
"eval_runtime": 89.0276,
"eval_samples_per_second": 112.325,
"eval_steps_per_second": 3.516,
"step": 34500
},
{
"epoch": 307.51408294522065,
"grad_norm": 0.17679564654827118,
"learning_rate": 2.548494983277592e-06,
"loss": 6.3644,
"step": 34600
},
{
"epoch": 307.51408294522065,
"eval_loss": 6.380576133728027,
"eval_runtime": 89.0337,
"eval_samples_per_second": 112.317,
"eval_steps_per_second": 3.516,
"step": 34600
},
{
"epoch": 308.4011976047904,
"grad_norm": 0.15505360066890717,
"learning_rate": 2.5384615384615385e-06,
"loss": 6.3652,
"step": 34700
},
{
"epoch": 308.4011976047904,
"eval_loss": 6.379436492919922,
"eval_runtime": 89.0636,
"eval_samples_per_second": 112.279,
"eval_steps_per_second": 3.514,
"step": 34700
},
{
"epoch": 309.2883122643602,
"grad_norm": 0.1679382175207138,
"learning_rate": 2.528428093645485e-06,
"loss": 6.3651,
"step": 34800
},
{
"epoch": 309.2883122643602,
"eval_loss": 6.37863302230835,
"eval_runtime": 89.0287,
"eval_samples_per_second": 112.323,
"eval_steps_per_second": 3.516,
"step": 34800
},
{
"epoch": 310.17542692392993,
"grad_norm": 0.1264224648475647,
"learning_rate": 2.5183946488294316e-06,
"loss": 6.365,
"step": 34900
},
{
"epoch": 310.17542692392993,
"eval_loss": 6.381104469299316,
"eval_runtime": 88.9777,
"eval_samples_per_second": 112.388,
"eval_steps_per_second": 3.518,
"step": 34900
},
{
"epoch": 311.0625415834997,
"grad_norm": 0.17346155643463135,
"learning_rate": 2.508361204013378e-06,
"loss": 6.3654,
"step": 35000
},
{
"epoch": 311.0625415834997,
"eval_loss": 6.379766464233398,
"eval_runtime": 88.9982,
"eval_samples_per_second": 112.362,
"eval_steps_per_second": 3.517,
"step": 35000
},
{
"epoch": 311.9496562430694,
"grad_norm": 0.2368006557226181,
"learning_rate": 2.4983277591973247e-06,
"loss": 6.3649,
"step": 35100
},
{
"epoch": 311.9496562430694,
"eval_loss": 6.376424789428711,
"eval_runtime": 89.004,
"eval_samples_per_second": 112.354,
"eval_steps_per_second": 3.517,
"step": 35100
},
{
"epoch": 312.83677090263916,
"grad_norm": 0.14664936065673828,
"learning_rate": 2.488294314381271e-06,
"loss": 6.365,
"step": 35200
},
{
"epoch": 312.83677090263916,
"eval_loss": 6.381261825561523,
"eval_runtime": 88.9989,
"eval_samples_per_second": 112.361,
"eval_steps_per_second": 3.517,
"step": 35200
},
{
"epoch": 313.7238855622089,
"grad_norm": 0.19366291165351868,
"learning_rate": 2.4782608695652173e-06,
"loss": 6.3656,
"step": 35300
},
{
"epoch": 313.7238855622089,
"eval_loss": 6.381620407104492,
"eval_runtime": 88.9954,
"eval_samples_per_second": 112.365,
"eval_steps_per_second": 3.517,
"step": 35300
},
{
"epoch": 314.6110002217787,
"grad_norm": 0.17280568182468414,
"learning_rate": 2.468227424749164e-06,
"loss": 6.3645,
"step": 35400
},
{
"epoch": 314.6110002217787,
"eval_loss": 6.376659870147705,
"eval_runtime": 89.0013,
"eval_samples_per_second": 112.358,
"eval_steps_per_second": 3.517,
"step": 35400
},
{
"epoch": 315.49811488134844,
"grad_norm": 0.20302744209766388,
"learning_rate": 2.4581939799331104e-06,
"loss": 6.3645,
"step": 35500
},
{
"epoch": 315.49811488134844,
"eval_loss": 6.376570701599121,
"eval_runtime": 88.9754,
"eval_samples_per_second": 112.391,
"eval_steps_per_second": 3.518,
"step": 35500
},
{
"epoch": 316.38522954091815,
"grad_norm": 0.18067042529582977,
"learning_rate": 2.4481605351170568e-06,
"loss": 6.3643,
"step": 35600
},
{
"epoch": 316.38522954091815,
"eval_loss": 6.377087593078613,
"eval_runtime": 89.0091,
"eval_samples_per_second": 112.348,
"eval_steps_per_second": 3.516,
"step": 35600
},
{
"epoch": 317.2723442004879,
"grad_norm": 0.17471148073673248,
"learning_rate": 2.4381270903010035e-06,
"loss": 6.3648,
"step": 35700
},
{
"epoch": 317.2723442004879,
"eval_loss": 6.380537509918213,
"eval_runtime": 88.9943,
"eval_samples_per_second": 112.367,
"eval_steps_per_second": 3.517,
"step": 35700
},
{
"epoch": 318.15945886005767,
"grad_norm": 0.20188532769680023,
"learning_rate": 2.42809364548495e-06,
"loss": 6.3648,
"step": 35800
},
{
"epoch": 318.15945886005767,
"eval_loss": 6.380505084991455,
"eval_runtime": 89.0195,
"eval_samples_per_second": 112.335,
"eval_steps_per_second": 3.516,
"step": 35800
},
{
"epoch": 319.04657351962743,
"grad_norm": 0.1507243514060974,
"learning_rate": 2.4180602006688962e-06,
"loss": 6.3644,
"step": 35900
},
{
"epoch": 319.04657351962743,
"eval_loss": 6.3797736167907715,
"eval_runtime": 89.0064,
"eval_samples_per_second": 112.351,
"eval_steps_per_second": 3.517,
"step": 35900
},
{
"epoch": 319.93368817919713,
"grad_norm": 0.21795004606246948,
"learning_rate": 2.408026755852843e-06,
"loss": 6.3639,
"step": 36000
},
{
"epoch": 319.93368817919713,
"eval_loss": 6.379575729370117,
"eval_runtime": 88.9863,
"eval_samples_per_second": 112.377,
"eval_steps_per_second": 3.517,
"step": 36000
},
{
"epoch": 322.3211721327382,
"grad_norm": 0.16106590628623962,
"learning_rate": 2.3979933110367893e-06,
"loss": 6.3637,
"step": 36100
},
{
"epoch": 322.3211721327382,
"eval_loss": 6.3763837814331055,
"eval_runtime": 51.0122,
"eval_samples_per_second": 196.032,
"eval_steps_per_second": 3.509,
"step": 36100
},
{
"epoch": 323.21385600621,
"grad_norm": 0.1778295785188675,
"learning_rate": 2.387959866220736e-06,
"loss": 6.3645,
"step": 36200
},
{
"epoch": 323.21385600621,
"eval_loss": 6.37896728515625,
"eval_runtime": 51.0085,
"eval_samples_per_second": 196.046,
"eval_steps_per_second": 3.509,
"step": 36200
},
{
"epoch": 324.10653987968175,
"grad_norm": 0.16518907248973846,
"learning_rate": 2.3779264214046824e-06,
"loss": 6.3644,
"step": 36300
},
{
"epoch": 324.10653987968175,
"eval_loss": 6.379991054534912,
"eval_runtime": 50.9898,
"eval_samples_per_second": 196.118,
"eval_steps_per_second": 3.511,
"step": 36300
},
{
"epoch": 324.9992237531535,
"grad_norm": 0.17673678696155548,
"learning_rate": 2.3678929765886288e-06,
"loss": 6.363,
"step": 36400
},
{
"epoch": 324.9992237531535,
"eval_loss": 6.377546310424805,
"eval_runtime": 51.0024,
"eval_samples_per_second": 196.069,
"eval_steps_per_second": 3.51,
"step": 36400
},
{
"epoch": 325.89190762662525,
"grad_norm": 0.18940462172031403,
"learning_rate": 2.3578595317725755e-06,
"loss": 6.3639,
"step": 36500
},
{
"epoch": 325.89190762662525,
"eval_loss": 6.381035327911377,
"eval_runtime": 50.9912,
"eval_samples_per_second": 196.112,
"eval_steps_per_second": 3.51,
"step": 36500
},
{
"epoch": 326.784591500097,
"grad_norm": 0.17796489596366882,
"learning_rate": 2.347826086956522e-06,
"loss": 6.3641,
"step": 36600
},
{
"epoch": 326.784591500097,
"eval_loss": 6.379162311553955,
"eval_runtime": 50.9814,
"eval_samples_per_second": 196.15,
"eval_steps_per_second": 3.511,
"step": 36600
},
{
"epoch": 327.6772753735688,
"grad_norm": 0.14749275147914886,
"learning_rate": 2.337792642140468e-06,
"loss": 6.3643,
"step": 36700
},
{
"epoch": 327.6772753735688,
"eval_loss": 6.379159450531006,
"eval_runtime": 51.0081,
"eval_samples_per_second": 196.047,
"eval_steps_per_second": 3.509,
"step": 36700
},
{
"epoch": 328.5699592470406,
"grad_norm": 0.2123512327671051,
"learning_rate": 2.327759197324415e-06,
"loss": 6.3642,
"step": 36800
},
{
"epoch": 328.5699592470406,
"eval_loss": 6.38007116317749,
"eval_runtime": 50.9674,
"eval_samples_per_second": 196.204,
"eval_steps_per_second": 3.512,
"step": 36800
},
{
"epoch": 329.4626431205123,
"grad_norm": 0.16111308336257935,
"learning_rate": 2.3177257525083613e-06,
"loss": 6.3642,
"step": 36900
},
{
"epoch": 329.4626431205123,
"eval_loss": 6.381565570831299,
"eval_runtime": 50.965,
"eval_samples_per_second": 196.213,
"eval_steps_per_second": 3.512,
"step": 36900
},
{
"epoch": 330.3553269939841,
"grad_norm": 0.1736401915550232,
"learning_rate": 2.307692307692308e-06,
"loss": 6.3638,
"step": 37000
},
{
"epoch": 330.3553269939841,
"eval_loss": 6.379702568054199,
"eval_runtime": 50.9633,
"eval_samples_per_second": 196.22,
"eval_steps_per_second": 3.512,
"step": 37000
},
{
"epoch": 331.24801086745583,
"grad_norm": 0.144011989235878,
"learning_rate": 2.2976588628762544e-06,
"loss": 6.3638,
"step": 37100
},
{
"epoch": 331.24801086745583,
"eval_loss": 6.3794684410095215,
"eval_runtime": 51.0336,
"eval_samples_per_second": 195.949,
"eval_steps_per_second": 3.507,
"step": 37100
},
{
"epoch": 332.14069474092764,
"grad_norm": 0.18693791329860687,
"learning_rate": 2.2876254180602008e-06,
"loss": 6.364,
"step": 37200
},
{
"epoch": 332.14069474092764,
"eval_loss": 6.369089126586914,
"eval_runtime": 50.982,
"eval_samples_per_second": 196.148,
"eval_steps_per_second": 3.511,
"step": 37200
},
{
"epoch": 333.0333786143994,
"grad_norm": 0.2004149854183197,
"learning_rate": 2.2775919732441475e-06,
"loss": 6.3636,
"step": 37300
},
{
"epoch": 333.0333786143994,
"eval_loss": 6.379798889160156,
"eval_runtime": 50.9846,
"eval_samples_per_second": 196.138,
"eval_steps_per_second": 3.511,
"step": 37300
},
{
"epoch": 333.92606248787115,
"grad_norm": 0.21116772294044495,
"learning_rate": 2.267558528428094e-06,
"loss": 6.3638,
"step": 37400
},
{
"epoch": 333.92606248787115,
"eval_loss": 6.378098487854004,
"eval_runtime": 50.9792,
"eval_samples_per_second": 196.159,
"eval_steps_per_second": 3.511,
"step": 37400
},
{
"epoch": 334.8187463613429,
"grad_norm": 0.20911183953285217,
"learning_rate": 2.25752508361204e-06,
"loss": 6.3648,
"step": 37500
},
{
"epoch": 334.8187463613429,
"eval_loss": 6.374560356140137,
"eval_runtime": 50.5111,
"eval_samples_per_second": 197.976,
"eval_steps_per_second": 3.544,
"step": 37500
},
{
"epoch": 335.71143023481466,
"grad_norm": 0.1895991563796997,
"learning_rate": 2.2474916387959865e-06,
"loss": 6.3629,
"step": 37600
},
{
"epoch": 335.71143023481466,
"eval_loss": 6.377721309661865,
"eval_runtime": 50.9554,
"eval_samples_per_second": 196.25,
"eval_steps_per_second": 3.513,
"step": 37600
},
{
"epoch": 336.6041141082864,
"grad_norm": 0.23114106059074402,
"learning_rate": 2.237458193979933e-06,
"loss": 6.3648,
"step": 37700
},
{
"epoch": 336.6041141082864,
"eval_loss": 6.377990245819092,
"eval_runtime": 51.011,
"eval_samples_per_second": 196.036,
"eval_steps_per_second": 3.509,
"step": 37700
},
{
"epoch": 337.4967979817582,
"grad_norm": 0.1858934611082077,
"learning_rate": 2.2274247491638796e-06,
"loss": 6.3632,
"step": 37800
},
{
"epoch": 337.4967979817582,
"eval_loss": 6.380919933319092,
"eval_runtime": 50.986,
"eval_samples_per_second": 196.132,
"eval_steps_per_second": 3.511,
"step": 37800
},
{
"epoch": 338.38948185523,
"grad_norm": 0.1767103672027588,
"learning_rate": 2.217391304347826e-06,
"loss": 6.3647,
"step": 37900
},
{
"epoch": 338.38948185523,
"eval_loss": 6.374737739562988,
"eval_runtime": 50.9864,
"eval_samples_per_second": 196.131,
"eval_steps_per_second": 3.511,
"step": 37900
},
{
"epoch": 339.2821657287017,
"grad_norm": 0.17408744990825653,
"learning_rate": 2.2073578595317723e-06,
"loss": 6.3639,
"step": 38000
},
{
"epoch": 339.2821657287017,
"eval_loss": 6.3790283203125,
"eval_runtime": 50.9845,
"eval_samples_per_second": 196.138,
"eval_steps_per_second": 3.511,
"step": 38000
},
{
"epoch": 340.1748496021735,
"grad_norm": 0.16043353080749512,
"learning_rate": 2.197324414715719e-06,
"loss": 6.3631,
"step": 38100
},
{
"epoch": 340.1748496021735,
"eval_loss": 6.377453327178955,
"eval_runtime": 51.0066,
"eval_samples_per_second": 196.053,
"eval_steps_per_second": 3.509,
"step": 38100
},
{
"epoch": 341.06753347564523,
"grad_norm": 0.18346284329891205,
"learning_rate": 2.1872909698996654e-06,
"loss": 6.3638,
"step": 38200
},
{
"epoch": 341.06753347564523,
"eval_loss": 6.3782172203063965,
"eval_runtime": 50.987,
"eval_samples_per_second": 196.129,
"eval_steps_per_second": 3.511,
"step": 38200
},
{
"epoch": 341.96021734911704,
"grad_norm": 0.1794682890176773,
"learning_rate": 2.177257525083612e-06,
"loss": 6.3642,
"step": 38300
},
{
"epoch": 341.96021734911704,
"eval_loss": 6.383487701416016,
"eval_runtime": 51.0216,
"eval_samples_per_second": 195.996,
"eval_steps_per_second": 3.508,
"step": 38300
},
{
"epoch": 342.8529012225888,
"grad_norm": 0.18743447959423065,
"learning_rate": 2.1672240802675585e-06,
"loss": 6.3635,
"step": 38400
},
{
"epoch": 342.8529012225888,
"eval_loss": 6.378910064697266,
"eval_runtime": 50.985,
"eval_samples_per_second": 196.136,
"eval_steps_per_second": 3.511,
"step": 38400
},
{
"epoch": 343.74558509606055,
"grad_norm": 0.21308189630508423,
"learning_rate": 2.157190635451505e-06,
"loss": 6.3638,
"step": 38500
},
{
"epoch": 343.74558509606055,
"eval_loss": 6.3776469230651855,
"eval_runtime": 51.0198,
"eval_samples_per_second": 196.002,
"eval_steps_per_second": 3.508,
"step": 38500
},
{
"epoch": 344.6382689695323,
"grad_norm": 0.19906771183013916,
"learning_rate": 2.1471571906354516e-06,
"loss": 6.3635,
"step": 38600
},
{
"epoch": 344.6382689695323,
"eval_loss": 6.378528118133545,
"eval_runtime": 50.8807,
"eval_samples_per_second": 196.538,
"eval_steps_per_second": 3.518,
"step": 38600
},
{
"epoch": 345.53095284300406,
"grad_norm": 0.15157081186771393,
"learning_rate": 2.137123745819398e-06,
"loss": 6.3638,
"step": 38700
},
{
"epoch": 345.53095284300406,
"eval_loss": 6.377796649932861,
"eval_runtime": 50.9807,
"eval_samples_per_second": 196.153,
"eval_steps_per_second": 3.511,
"step": 38700
},
{
"epoch": 346.4236367164758,
"grad_norm": 0.13750579953193665,
"learning_rate": 2.1270903010033443e-06,
"loss": 6.3633,
"step": 38800
},
{
"epoch": 346.4236367164758,
"eval_loss": 6.373489856719971,
"eval_runtime": 51.0164,
"eval_samples_per_second": 196.015,
"eval_steps_per_second": 3.509,
"step": 38800
},
{
"epoch": 347.3163205899476,
"grad_norm": 0.14071586728096008,
"learning_rate": 2.117056856187291e-06,
"loss": 6.3638,
"step": 38900
},
{
"epoch": 347.3163205899476,
"eval_loss": 6.374903202056885,
"eval_runtime": 50.9908,
"eval_samples_per_second": 196.114,
"eval_steps_per_second": 3.51,
"step": 38900
},
{
"epoch": 348.2090044634194,
"grad_norm": 0.20056802034378052,
"learning_rate": 2.1070234113712374e-06,
"loss": 6.3625,
"step": 39000
},
{
"epoch": 348.2090044634194,
"eval_loss": 6.374448299407959,
"eval_runtime": 50.9627,
"eval_samples_per_second": 196.222,
"eval_steps_per_second": 3.512,
"step": 39000
},
{
"epoch": 349.10168833689113,
"grad_norm": 0.1474703550338745,
"learning_rate": 2.0969899665551837e-06,
"loss": 6.3644,
"step": 39100
},
{
"epoch": 349.10168833689113,
"eval_loss": 6.375302314758301,
"eval_runtime": 51.0147,
"eval_samples_per_second": 196.022,
"eval_steps_per_second": 3.509,
"step": 39100
},
{
"epoch": 349.9943722103629,
"grad_norm": 0.1974957287311554,
"learning_rate": 2.0869565217391305e-06,
"loss": 6.3636,
"step": 39200
},
{
"epoch": 349.9943722103629,
"eval_loss": 6.3749308586120605,
"eval_runtime": 50.9972,
"eval_samples_per_second": 196.089,
"eval_steps_per_second": 3.51,
"step": 39200
},
{
"epoch": 350.88705608383464,
"grad_norm": 0.1811438351869583,
"learning_rate": 2.076923076923077e-06,
"loss": 6.3641,
"step": 39300
},
{
"epoch": 350.88705608383464,
"eval_loss": 6.373296737670898,
"eval_runtime": 51.0664,
"eval_samples_per_second": 195.824,
"eval_steps_per_second": 3.505,
"step": 39300
},
{
"epoch": 351.77973995730645,
"grad_norm": 0.19500285387039185,
"learning_rate": 2.0668896321070236e-06,
"loss": 6.3635,
"step": 39400
},
{
"epoch": 351.77973995730645,
"eval_loss": 6.3765153884887695,
"eval_runtime": 50.9989,
"eval_samples_per_second": 196.083,
"eval_steps_per_second": 3.51,
"step": 39400
},
{
"epoch": 352.6724238307782,
"grad_norm": 0.14763915538787842,
"learning_rate": 2.05685618729097e-06,
"loss": 6.363,
"step": 39500
},
{
"epoch": 352.6724238307782,
"eval_loss": 6.380082607269287,
"eval_runtime": 51.0221,
"eval_samples_per_second": 195.993,
"eval_steps_per_second": 3.508,
"step": 39500
},
{
"epoch": 353.56510770424995,
"grad_norm": 0.14987926185131073,
"learning_rate": 2.0468227424749163e-06,
"loss": 6.3625,
"step": 39600
},
{
"epoch": 353.56510770424995,
"eval_loss": 6.375669002532959,
"eval_runtime": 50.9913,
"eval_samples_per_second": 196.112,
"eval_steps_per_second": 3.51,
"step": 39600
},
{
"epoch": 354.4577915777217,
"grad_norm": 0.1568908393383026,
"learning_rate": 2.036789297658863e-06,
"loss": 6.3639,
"step": 39700
},
{
"epoch": 354.4577915777217,
"eval_loss": 6.374993801116943,
"eval_runtime": 50.9889,
"eval_samples_per_second": 196.121,
"eval_steps_per_second": 3.511,
"step": 39700
},
{
"epoch": 355.35047545119346,
"grad_norm": 0.1752849966287613,
"learning_rate": 2.0267558528428094e-06,
"loss": 6.3636,
"step": 39800
},
{
"epoch": 355.35047545119346,
"eval_loss": 6.3728227615356445,
"eval_runtime": 51.0076,
"eval_samples_per_second": 196.049,
"eval_steps_per_second": 3.509,
"step": 39800
},
{
"epoch": 356.24315932466527,
"grad_norm": 0.15474580228328705,
"learning_rate": 2.0167224080267557e-06,
"loss": 6.3632,
"step": 39900
},
{
"epoch": 356.24315932466527,
"eval_loss": 6.374934196472168,
"eval_runtime": 50.9903,
"eval_samples_per_second": 196.116,
"eval_steps_per_second": 3.51,
"step": 39900
},
{
"epoch": 357.135843198137,
"grad_norm": 0.1670171320438385,
"learning_rate": 2.0066889632107025e-06,
"loss": 6.3632,
"step": 40000
},
{
"epoch": 357.135843198137,
"eval_loss": 6.3780436515808105,
"eval_runtime": 50.9795,
"eval_samples_per_second": 196.157,
"eval_steps_per_second": 3.511,
"step": 40000
},
{
"epoch": 358.0285270716088,
"grad_norm": 0.159672349691391,
"learning_rate": 1.996655518394649e-06,
"loss": 6.3633,
"step": 40100
},
{
"epoch": 358.0285270716088,
"eval_loss": 6.376949310302734,
"eval_runtime": 50.9704,
"eval_samples_per_second": 196.192,
"eval_steps_per_second": 3.512,
"step": 40100
},
{
"epoch": 358.92121094508053,
"grad_norm": 0.11732380092144012,
"learning_rate": 1.986622073578595e-06,
"loss": 6.3624,
"step": 40200
},
{
"epoch": 358.92121094508053,
"eval_loss": 6.378962516784668,
"eval_runtime": 51.2082,
"eval_samples_per_second": 195.281,
"eval_steps_per_second": 3.496,
"step": 40200
},
{
"epoch": 359.8138948185523,
"grad_norm": 0.16079199314117432,
"learning_rate": 1.976588628762542e-06,
"loss": 6.3627,
"step": 40300
},
{
"epoch": 359.8138948185523,
"eval_loss": 6.376839637756348,
"eval_runtime": 51.2246,
"eval_samples_per_second": 195.219,
"eval_steps_per_second": 3.494,
"step": 40300
},
{
"epoch": 360.70657869202404,
"grad_norm": 0.1894705593585968,
"learning_rate": 1.9665551839464883e-06,
"loss": 6.3629,
"step": 40400
},
{
"epoch": 360.70657869202404,
"eval_loss": 6.376771450042725,
"eval_runtime": 50.9722,
"eval_samples_per_second": 196.185,
"eval_steps_per_second": 3.512,
"step": 40400
},
{
"epoch": 361.59926256549585,
"grad_norm": 0.15382538735866547,
"learning_rate": 1.956521739130435e-06,
"loss": 6.3629,
"step": 40500
},
{
"epoch": 361.59926256549585,
"eval_loss": 6.377914905548096,
"eval_runtime": 50.9641,
"eval_samples_per_second": 196.217,
"eval_steps_per_second": 3.512,
"step": 40500
},
{
"epoch": 362.4919464389676,
"grad_norm": 0.20456081628799438,
"learning_rate": 1.9464882943143814e-06,
"loss": 6.3619,
"step": 40600
},
{
"epoch": 362.4919464389676,
"eval_loss": 6.38068962097168,
"eval_runtime": 50.9716,
"eval_samples_per_second": 196.188,
"eval_steps_per_second": 3.512,
"step": 40600
},
{
"epoch": 363.38463031243936,
"grad_norm": 0.18184669315814972,
"learning_rate": 1.9364548494983277e-06,
"loss": 6.3628,
"step": 40700
},
{
"epoch": 363.38463031243936,
"eval_loss": 6.375256061553955,
"eval_runtime": 50.9921,
"eval_samples_per_second": 196.109,
"eval_steps_per_second": 3.51,
"step": 40700
},
{
"epoch": 364.2773141859111,
"grad_norm": 0.12955954670906067,
"learning_rate": 1.9264214046822745e-06,
"loss": 6.3634,
"step": 40800
},
{
"epoch": 364.2773141859111,
"eval_loss": 6.379732608795166,
"eval_runtime": 50.9701,
"eval_samples_per_second": 196.193,
"eval_steps_per_second": 3.512,
"step": 40800
},
{
"epoch": 365.16999805938286,
"grad_norm": 0.1785167008638382,
"learning_rate": 1.916387959866221e-06,
"loss": 6.3616,
"step": 40900
},
{
"epoch": 365.16999805938286,
"eval_loss": 6.372657775878906,
"eval_runtime": 50.9791,
"eval_samples_per_second": 196.159,
"eval_steps_per_second": 3.511,
"step": 40900
},
{
"epoch": 366.0626819328547,
"grad_norm": 0.17105770111083984,
"learning_rate": 1.9063545150501674e-06,
"loss": 6.3622,
"step": 41000
},
{
"epoch": 366.0626819328547,
"eval_loss": 6.378147602081299,
"eval_runtime": 50.9646,
"eval_samples_per_second": 196.214,
"eval_steps_per_second": 3.512,
"step": 41000
},
{
"epoch": 366.9553658063264,
"grad_norm": 0.16092269122600555,
"learning_rate": 1.896321070234114e-06,
"loss": 6.363,
"step": 41100
},
{
"epoch": 366.9553658063264,
"eval_loss": 6.378008842468262,
"eval_runtime": 50.971,
"eval_samples_per_second": 196.19,
"eval_steps_per_second": 3.512,
"step": 41100
},
{
"epoch": 367.8480496797982,
"grad_norm": 0.18064095079898834,
"learning_rate": 1.8862876254180603e-06,
"loss": 6.363,
"step": 41200
},
{
"epoch": 367.8480496797982,
"eval_loss": 6.373415470123291,
"eval_runtime": 50.9712,
"eval_samples_per_second": 196.189,
"eval_steps_per_second": 3.512,
"step": 41200
},
{
"epoch": 368.74073355326993,
"grad_norm": 0.14576148986816406,
"learning_rate": 1.8762541806020068e-06,
"loss": 6.3617,
"step": 41300
},
{
"epoch": 368.74073355326993,
"eval_loss": 6.375607013702393,
"eval_runtime": 50.965,
"eval_samples_per_second": 196.213,
"eval_steps_per_second": 3.512,
"step": 41300
},
{
"epoch": 369.6334174267417,
"grad_norm": 0.14404740929603577,
"learning_rate": 1.8662207357859534e-06,
"loss": 6.3629,
"step": 41400
},
{
"epoch": 369.6334174267417,
"eval_loss": 6.378086090087891,
"eval_runtime": 50.9589,
"eval_samples_per_second": 196.236,
"eval_steps_per_second": 3.513,
"step": 41400
},
{
"epoch": 370.52610130021344,
"grad_norm": 0.19737081229686737,
"learning_rate": 1.8561872909699e-06,
"loss": 6.3627,
"step": 41500
},
{
"epoch": 370.52610130021344,
"eval_loss": 6.375402927398682,
"eval_runtime": 50.9619,
"eval_samples_per_second": 196.225,
"eval_steps_per_second": 3.512,
"step": 41500
},
{
"epoch": 371.41878517368525,
"grad_norm": 0.14666880667209625,
"learning_rate": 1.8461538461538462e-06,
"loss": 6.3621,
"step": 41600
},
{
"epoch": 371.41878517368525,
"eval_loss": 6.375915050506592,
"eval_runtime": 50.9649,
"eval_samples_per_second": 196.213,
"eval_steps_per_second": 3.512,
"step": 41600
},
{
"epoch": 372.311469047157,
"grad_norm": 0.21582022309303284,
"learning_rate": 1.8361204013377928e-06,
"loss": 6.3626,
"step": 41700
},
{
"epoch": 372.311469047157,
"eval_loss": 6.38447904586792,
"eval_runtime": 50.9609,
"eval_samples_per_second": 196.229,
"eval_steps_per_second": 3.512,
"step": 41700
},
{
"epoch": 373.20415292062876,
"grad_norm": 0.1295013576745987,
"learning_rate": 1.8260869565217394e-06,
"loss": 6.362,
"step": 41800
},
{
"epoch": 373.20415292062876,
"eval_loss": 6.375004768371582,
"eval_runtime": 50.9807,
"eval_samples_per_second": 196.153,
"eval_steps_per_second": 3.511,
"step": 41800
},
{
"epoch": 374.0968367941005,
"grad_norm": 0.21674145758152008,
"learning_rate": 1.8160535117056857e-06,
"loss": 6.3622,
"step": 41900
},
{
"epoch": 374.0968367941005,
"eval_loss": 6.373767375946045,
"eval_runtime": 50.9601,
"eval_samples_per_second": 196.232,
"eval_steps_per_second": 3.513,
"step": 41900
},
{
"epoch": 374.98952066757226,
"grad_norm": 0.16833952069282532,
"learning_rate": 1.8060200668896322e-06,
"loss": 6.3621,
"step": 42000
},
{
"epoch": 374.98952066757226,
"eval_loss": 6.375979900360107,
"eval_runtime": 50.9671,
"eval_samples_per_second": 196.205,
"eval_steps_per_second": 3.512,
"step": 42000
},
{
"epoch": 375.8822045410441,
"grad_norm": 0.13281434774398804,
"learning_rate": 1.7959866220735788e-06,
"loss": 6.3622,
"step": 42100
},
{
"epoch": 375.8822045410441,
"eval_loss": 6.377115726470947,
"eval_runtime": 51.0774,
"eval_samples_per_second": 195.781,
"eval_steps_per_second": 3.504,
"step": 42100
},
{
"epoch": 376.77488841451583,
"grad_norm": 0.14955252408981323,
"learning_rate": 1.7859531772575253e-06,
"loss": 6.3622,
"step": 42200
},
{
"epoch": 376.77488841451583,
"eval_loss": 6.378284454345703,
"eval_runtime": 50.975,
"eval_samples_per_second": 196.175,
"eval_steps_per_second": 3.512,
"step": 42200
},
{
"epoch": 377.6675722879876,
"grad_norm": 0.1695183515548706,
"learning_rate": 1.7759197324414717e-06,
"loss": 6.3609,
"step": 42300
},
{
"epoch": 377.6675722879876,
"eval_loss": 6.377320766448975,
"eval_runtime": 50.9555,
"eval_samples_per_second": 196.25,
"eval_steps_per_second": 3.513,
"step": 42300
},
{
"epoch": 378.56025616145934,
"grad_norm": 0.1487826108932495,
"learning_rate": 1.7658862876254182e-06,
"loss": 6.3636,
"step": 42400
},
{
"epoch": 378.56025616145934,
"eval_loss": 6.373607158660889,
"eval_runtime": 50.958,
"eval_samples_per_second": 196.24,
"eval_steps_per_second": 3.513,
"step": 42400
},
{
"epoch": 379.4529400349311,
"grad_norm": 0.15890148282051086,
"learning_rate": 1.7558528428093648e-06,
"loss": 6.3622,
"step": 42500
},
{
"epoch": 379.4529400349311,
"eval_loss": 6.378411769866943,
"eval_runtime": 50.9578,
"eval_samples_per_second": 196.241,
"eval_steps_per_second": 3.513,
"step": 42500
},
{
"epoch": 380.3456239084029,
"grad_norm": 0.13191881775856018,
"learning_rate": 1.745819397993311e-06,
"loss": 6.3625,
"step": 42600
},
{
"epoch": 380.3456239084029,
"eval_loss": 6.380100250244141,
"eval_runtime": 50.9563,
"eval_samples_per_second": 196.246,
"eval_steps_per_second": 3.513,
"step": 42600
},
{
"epoch": 381.23830778187465,
"grad_norm": 0.13398431241512299,
"learning_rate": 1.7357859531772575e-06,
"loss": 6.3631,
"step": 42700
},
{
"epoch": 381.23830778187465,
"eval_loss": 6.372678756713867,
"eval_runtime": 50.967,
"eval_samples_per_second": 196.205,
"eval_steps_per_second": 3.512,
"step": 42700
},
{
"epoch": 382.1309916553464,
"grad_norm": 0.1774672120809555,
"learning_rate": 1.7257525083612038e-06,
"loss": 6.3619,
"step": 42800
},
{
"epoch": 382.1309916553464,
"eval_loss": 6.374143600463867,
"eval_runtime": 50.9527,
"eval_samples_per_second": 196.26,
"eval_steps_per_second": 3.513,
"step": 42800
},
{
"epoch": 383.02367552881816,
"grad_norm": 0.15919719636440277,
"learning_rate": 1.7157190635451504e-06,
"loss": 6.3625,
"step": 42900
},
{
"epoch": 383.02367552881816,
"eval_loss": 6.380612373352051,
"eval_runtime": 50.9597,
"eval_samples_per_second": 196.233,
"eval_steps_per_second": 3.513,
"step": 42900
},
{
"epoch": 383.9163594022899,
"grad_norm": 0.15100547671318054,
"learning_rate": 1.705685618729097e-06,
"loss": 6.3624,
"step": 43000
},
{
"epoch": 383.9163594022899,
"eval_loss": 6.375205039978027,
"eval_runtime": 51.0178,
"eval_samples_per_second": 196.01,
"eval_steps_per_second": 3.509,
"step": 43000
},
{
"epoch": 384.80904327576167,
"grad_norm": 0.17773090302944183,
"learning_rate": 1.6956521739130435e-06,
"loss": 6.3622,
"step": 43100
},
{
"epoch": 384.80904327576167,
"eval_loss": 6.377906322479248,
"eval_runtime": 50.9528,
"eval_samples_per_second": 196.26,
"eval_steps_per_second": 3.513,
"step": 43100
},
{
"epoch": 385.7017271492335,
"grad_norm": 0.16673114895820618,
"learning_rate": 1.6856187290969898e-06,
"loss": 6.3614,
"step": 43200
},
{
"epoch": 385.7017271492335,
"eval_loss": 6.3741583824157715,
"eval_runtime": 50.9886,
"eval_samples_per_second": 196.122,
"eval_steps_per_second": 3.511,
"step": 43200
},
{
"epoch": 386.59441102270523,
"grad_norm": 0.13911914825439453,
"learning_rate": 1.6755852842809363e-06,
"loss": 6.3627,
"step": 43300
},
{
"epoch": 386.59441102270523,
"eval_loss": 6.376387596130371,
"eval_runtime": 50.9745,
"eval_samples_per_second": 196.177,
"eval_steps_per_second": 3.512,
"step": 43300
},
{
"epoch": 387.487094896177,
"grad_norm": 0.14674533903598785,
"learning_rate": 1.665551839464883e-06,
"loss": 6.3615,
"step": 43400
},
{
"epoch": 387.487094896177,
"eval_loss": 6.374913692474365,
"eval_runtime": 50.964,
"eval_samples_per_second": 196.217,
"eval_steps_per_second": 3.512,
"step": 43400
},
{
"epoch": 388.37977876964874,
"grad_norm": 0.14424017071723938,
"learning_rate": 1.6555183946488294e-06,
"loss": 6.3614,
"step": 43500
},
{
"epoch": 388.37977876964874,
"eval_loss": 6.3738508224487305,
"eval_runtime": 50.9746,
"eval_samples_per_second": 196.176,
"eval_steps_per_second": 3.512,
"step": 43500
},
{
"epoch": 389.2724626431205,
"grad_norm": 0.12726858258247375,
"learning_rate": 1.6454849498327758e-06,
"loss": 6.3631,
"step": 43600
},
{
"epoch": 389.2724626431205,
"eval_loss": 6.377626895904541,
"eval_runtime": 50.9831,
"eval_samples_per_second": 196.143,
"eval_steps_per_second": 3.511,
"step": 43600
},
{
"epoch": 390.1651465165923,
"grad_norm": 0.1261419951915741,
"learning_rate": 1.6354515050167223e-06,
"loss": 6.362,
"step": 43700
},
{
"epoch": 390.1651465165923,
"eval_loss": 6.371913433074951,
"eval_runtime": 50.9952,
"eval_samples_per_second": 196.097,
"eval_steps_per_second": 3.51,
"step": 43700
},
{
"epoch": 391.05783039006405,
"grad_norm": 0.15761396288871765,
"learning_rate": 1.6254180602006689e-06,
"loss": 6.3625,
"step": 43800
},
{
"epoch": 391.05783039006405,
"eval_loss": 6.372257709503174,
"eval_runtime": 50.9814,
"eval_samples_per_second": 196.15,
"eval_steps_per_second": 3.511,
"step": 43800
},
{
"epoch": 391.9505142635358,
"grad_norm": 0.14318187534809113,
"learning_rate": 1.6153846153846154e-06,
"loss": 6.3622,
"step": 43900
},
{
"epoch": 391.9505142635358,
"eval_loss": 6.375759601593018,
"eval_runtime": 50.9942,
"eval_samples_per_second": 196.101,
"eval_steps_per_second": 3.51,
"step": 43900
},
{
"epoch": 392.84319813700756,
"grad_norm": 0.13848328590393066,
"learning_rate": 1.6053511705685618e-06,
"loss": 6.3612,
"step": 44000
},
{
"epoch": 392.84319813700756,
"eval_loss": 6.376217842102051,
"eval_runtime": 50.9908,
"eval_samples_per_second": 196.114,
"eval_steps_per_second": 3.51,
"step": 44000
},
{
"epoch": 393.7358820104793,
"grad_norm": 0.13598565757274628,
"learning_rate": 1.5953177257525083e-06,
"loss": 6.3625,
"step": 44100
},
{
"epoch": 393.7358820104793,
"eval_loss": 6.37490701675415,
"eval_runtime": 50.978,
"eval_samples_per_second": 196.163,
"eval_steps_per_second": 3.511,
"step": 44100
},
{
"epoch": 394.62856588395107,
"grad_norm": 0.14148621261119843,
"learning_rate": 1.5852842809364549e-06,
"loss": 6.3615,
"step": 44200
},
{
"epoch": 394.62856588395107,
"eval_loss": 6.378378868103027,
"eval_runtime": 50.9657,
"eval_samples_per_second": 196.21,
"eval_steps_per_second": 3.512,
"step": 44200
},
{
"epoch": 395.5212497574229,
"grad_norm": 0.13936679065227509,
"learning_rate": 1.5752508361204012e-06,
"loss": 6.3626,
"step": 44300
},
{
"epoch": 395.5212497574229,
"eval_loss": 6.374247074127197,
"eval_runtime": 50.9816,
"eval_samples_per_second": 196.149,
"eval_steps_per_second": 3.511,
"step": 44300
},
{
"epoch": 396.41393363089463,
"grad_norm": 0.163307785987854,
"learning_rate": 1.5652173913043478e-06,
"loss": 6.3611,
"step": 44400
},
{
"epoch": 396.41393363089463,
"eval_loss": 6.37465763092041,
"eval_runtime": 50.9876,
"eval_samples_per_second": 196.126,
"eval_steps_per_second": 3.511,
"step": 44400
},
{
"epoch": 397.3066175043664,
"grad_norm": 0.1514696627855301,
"learning_rate": 1.5551839464882943e-06,
"loss": 6.3614,
"step": 44500
},
{
"epoch": 397.3066175043664,
"eval_loss": 6.374813079833984,
"eval_runtime": 50.9704,
"eval_samples_per_second": 196.192,
"eval_steps_per_second": 3.512,
"step": 44500
},
{
"epoch": 398.19930137783814,
"grad_norm": 0.12864980101585388,
"learning_rate": 1.5451505016722409e-06,
"loss": 6.3611,
"step": 44600
},
{
"epoch": 398.19930137783814,
"eval_loss": 6.374229431152344,
"eval_runtime": 50.9713,
"eval_samples_per_second": 196.189,
"eval_steps_per_second": 3.512,
"step": 44600
},
{
"epoch": 399.0919852513099,
"grad_norm": 0.18459634482860565,
"learning_rate": 1.5351170568561872e-06,
"loss": 6.3623,
"step": 44700
},
{
"epoch": 399.0919852513099,
"eval_loss": 6.374811172485352,
"eval_runtime": 50.9833,
"eval_samples_per_second": 196.143,
"eval_steps_per_second": 3.511,
"step": 44700
},
{
"epoch": 399.9846691247817,
"grad_norm": 0.14292342960834503,
"learning_rate": 1.5250836120401338e-06,
"loss": 6.3611,
"step": 44800
},
{
"epoch": 399.9846691247817,
"eval_loss": 6.373171329498291,
"eval_runtime": 50.971,
"eval_samples_per_second": 196.19,
"eval_steps_per_second": 3.512,
"step": 44800
},
{
"epoch": 400.87735299825346,
"grad_norm": 0.14087602496147156,
"learning_rate": 1.5150501672240803e-06,
"loss": 6.3619,
"step": 44900
},
{
"epoch": 400.87735299825346,
"eval_loss": 6.3750786781311035,
"eval_runtime": 50.9873,
"eval_samples_per_second": 196.127,
"eval_steps_per_second": 3.511,
"step": 44900
},
{
"epoch": 401.7700368717252,
"grad_norm": 0.1677563190460205,
"learning_rate": 1.5050167224080269e-06,
"loss": 6.361,
"step": 45000
},
{
"epoch": 401.7700368717252,
"eval_loss": 6.37678337097168,
"eval_runtime": 50.9768,
"eval_samples_per_second": 196.168,
"eval_steps_per_second": 3.511,
"step": 45000
},
{
"epoch": 402.66272074519696,
"grad_norm": 0.16920335590839386,
"learning_rate": 1.4949832775919732e-06,
"loss": 6.3622,
"step": 45100
},
{
"epoch": 402.66272074519696,
"eval_loss": 6.371730327606201,
"eval_runtime": 51.1672,
"eval_samples_per_second": 195.438,
"eval_steps_per_second": 3.498,
"step": 45100
},
{
"epoch": 403.5554046186687,
"grad_norm": 0.1975216269493103,
"learning_rate": 1.4849498327759198e-06,
"loss": 6.3615,
"step": 45200
},
{
"epoch": 403.5554046186687,
"eval_loss": 6.373182773590088,
"eval_runtime": 50.97,
"eval_samples_per_second": 196.194,
"eval_steps_per_second": 3.512,
"step": 45200
},
{
"epoch": 404.4480884921405,
"grad_norm": 0.14191223680973053,
"learning_rate": 1.4749163879598663e-06,
"loss": 6.3616,
"step": 45300
},
{
"epoch": 404.4480884921405,
"eval_loss": 6.373088359832764,
"eval_runtime": 51.0328,
"eval_samples_per_second": 195.952,
"eval_steps_per_second": 3.508,
"step": 45300
},
{
"epoch": 405.3407723656123,
"grad_norm": 0.1346922665834427,
"learning_rate": 1.4648829431438129e-06,
"loss": 6.3612,
"step": 45400
},
{
"epoch": 405.3407723656123,
"eval_loss": 6.374698162078857,
"eval_runtime": 50.9921,
"eval_samples_per_second": 196.109,
"eval_steps_per_second": 3.51,
"step": 45400
},
{
"epoch": 406.23345623908403,
"grad_norm": 0.14625421166419983,
"learning_rate": 1.4548494983277592e-06,
"loss": 6.3618,
"step": 45500
},
{
"epoch": 406.23345623908403,
"eval_loss": 6.374713897705078,
"eval_runtime": 50.9902,
"eval_samples_per_second": 196.116,
"eval_steps_per_second": 3.51,
"step": 45500
},
{
"epoch": 407.1261401125558,
"grad_norm": 0.1339327096939087,
"learning_rate": 1.4448160535117058e-06,
"loss": 6.3614,
"step": 45600
},
{
"epoch": 407.1261401125558,
"eval_loss": 6.375463962554932,
"eval_runtime": 50.9843,
"eval_samples_per_second": 196.139,
"eval_steps_per_second": 3.511,
"step": 45600
},
{
"epoch": 408.01882398602754,
"grad_norm": 0.1191440001130104,
"learning_rate": 1.4347826086956523e-06,
"loss": 6.3616,
"step": 45700
},
{
"epoch": 408.01882398602754,
"eval_loss": 6.372775554656982,
"eval_runtime": 50.976,
"eval_samples_per_second": 196.171,
"eval_steps_per_second": 3.511,
"step": 45700
},
{
"epoch": 408.9115078594993,
"grad_norm": 0.14053776860237122,
"learning_rate": 1.4247491638795989e-06,
"loss": 6.3615,
"step": 45800
},
{
"epoch": 408.9115078594993,
"eval_loss": 6.376742362976074,
"eval_runtime": 50.9922,
"eval_samples_per_second": 196.108,
"eval_steps_per_second": 3.51,
"step": 45800
},
{
"epoch": 409.8041917329711,
"grad_norm": 0.1356232613325119,
"learning_rate": 1.4147157190635452e-06,
"loss": 6.3608,
"step": 45900
},
{
"epoch": 409.8041917329711,
"eval_loss": 6.3739728927612305,
"eval_runtime": 50.9685,
"eval_samples_per_second": 196.2,
"eval_steps_per_second": 3.512,
"step": 45900
},
{
"epoch": 410.69687560644286,
"grad_norm": 0.17138876020908356,
"learning_rate": 1.4046822742474917e-06,
"loss": 6.3613,
"step": 46000
},
{
"epoch": 410.69687560644286,
"eval_loss": 6.381918907165527,
"eval_runtime": 50.9709,
"eval_samples_per_second": 196.19,
"eval_steps_per_second": 3.512,
"step": 46000
},
{
"epoch": 411.5895594799146,
"grad_norm": 0.15673908591270447,
"learning_rate": 1.3946488294314383e-06,
"loss": 6.3619,
"step": 46100
},
{
"epoch": 411.5895594799146,
"eval_loss": 6.375350475311279,
"eval_runtime": 50.9723,
"eval_samples_per_second": 196.185,
"eval_steps_per_second": 3.512,
"step": 46100
},
{
"epoch": 412.48224335338637,
"grad_norm": 0.13772110641002655,
"learning_rate": 1.3846153846153846e-06,
"loss": 6.3609,
"step": 46200
},
{
"epoch": 412.48224335338637,
"eval_loss": 6.374034881591797,
"eval_runtime": 50.9636,
"eval_samples_per_second": 196.219,
"eval_steps_per_second": 3.512,
"step": 46200
},
{
"epoch": 413.3749272268581,
"grad_norm": 0.12614521384239197,
"learning_rate": 1.374581939799331e-06,
"loss": 6.3617,
"step": 46300
},
{
"epoch": 413.3749272268581,
"eval_loss": 6.375347137451172,
"eval_runtime": 50.9521,
"eval_samples_per_second": 196.263,
"eval_steps_per_second": 3.513,
"step": 46300
},
{
"epoch": 414.26761110032993,
"grad_norm": 0.13640394806861877,
"learning_rate": 1.3645484949832775e-06,
"loss": 6.3608,
"step": 46400
},
{
"epoch": 414.26761110032993,
"eval_loss": 6.378127574920654,
"eval_runtime": 50.9727,
"eval_samples_per_second": 196.184,
"eval_steps_per_second": 3.512,
"step": 46400
},
{
"epoch": 415.1602949738017,
"grad_norm": 0.17697331309318542,
"learning_rate": 1.354515050167224e-06,
"loss": 6.3614,
"step": 46500
},
{
"epoch": 415.1602949738017,
"eval_loss": 6.370326995849609,
"eval_runtime": 50.9684,
"eval_samples_per_second": 196.2,
"eval_steps_per_second": 3.512,
"step": 46500
},
{
"epoch": 416.05297884727344,
"grad_norm": 0.12979310750961304,
"learning_rate": 1.3444816053511706e-06,
"loss": 6.3618,
"step": 46600
},
{
"epoch": 416.05297884727344,
"eval_loss": 6.3708062171936035,
"eval_runtime": 50.983,
"eval_samples_per_second": 196.144,
"eval_steps_per_second": 3.511,
"step": 46600
},
{
"epoch": 416.9456627207452,
"grad_norm": 0.1369139850139618,
"learning_rate": 1.334448160535117e-06,
"loss": 6.3616,
"step": 46700
},
{
"epoch": 416.9456627207452,
"eval_loss": 6.375351905822754,
"eval_runtime": 50.979,
"eval_samples_per_second": 196.159,
"eval_steps_per_second": 3.511,
"step": 46700
},
{
"epoch": 417.83834659421694,
"grad_norm": 0.1491391658782959,
"learning_rate": 1.3244147157190635e-06,
"loss": 6.3612,
"step": 46800
},
{
"epoch": 417.83834659421694,
"eval_loss": 6.378176689147949,
"eval_runtime": 50.9644,
"eval_samples_per_second": 196.215,
"eval_steps_per_second": 3.512,
"step": 46800
},
{
"epoch": 418.7310304676887,
"grad_norm": 0.1265108585357666,
"learning_rate": 1.31438127090301e-06,
"loss": 6.361,
"step": 46900
},
{
"epoch": 418.7310304676887,
"eval_loss": 6.372585773468018,
"eval_runtime": 50.9948,
"eval_samples_per_second": 196.098,
"eval_steps_per_second": 3.51,
"step": 46900
},
{
"epoch": 419.6237143411605,
"grad_norm": 0.16357433795928955,
"learning_rate": 1.3043478260869566e-06,
"loss": 6.3608,
"step": 47000
},
{
"epoch": 419.6237143411605,
"eval_loss": 6.373856067657471,
"eval_runtime": 50.9849,
"eval_samples_per_second": 196.137,
"eval_steps_per_second": 3.511,
"step": 47000
},
{
"epoch": 420.51639821463226,
"grad_norm": 0.12764860689640045,
"learning_rate": 1.294314381270903e-06,
"loss": 6.3618,
"step": 47100
},
{
"epoch": 420.51639821463226,
"eval_loss": 6.377871513366699,
"eval_runtime": 50.9803,
"eval_samples_per_second": 196.154,
"eval_steps_per_second": 3.511,
"step": 47100
},
{
"epoch": 421.409082088104,
"grad_norm": 0.14270265400409698,
"learning_rate": 1.2842809364548495e-06,
"loss": 6.3608,
"step": 47200
},
{
"epoch": 421.409082088104,
"eval_loss": 6.3771162033081055,
"eval_runtime": 50.9877,
"eval_samples_per_second": 196.126,
"eval_steps_per_second": 3.511,
"step": 47200
},
{
"epoch": 422.30176596157577,
"grad_norm": 0.13178826868534088,
"learning_rate": 1.274247491638796e-06,
"loss": 6.3612,
"step": 47300
},
{
"epoch": 422.30176596157577,
"eval_loss": 6.375566482543945,
"eval_runtime": 50.9884,
"eval_samples_per_second": 196.123,
"eval_steps_per_second": 3.511,
"step": 47300
},
{
"epoch": 423.1944498350475,
"grad_norm": 0.17805926501750946,
"learning_rate": 1.2642140468227424e-06,
"loss": 6.361,
"step": 47400
},
{
"epoch": 423.1944498350475,
"eval_loss": 6.3782830238342285,
"eval_runtime": 50.983,
"eval_samples_per_second": 196.144,
"eval_steps_per_second": 3.511,
"step": 47400
},
{
"epoch": 424.08713370851933,
"grad_norm": 0.12532693147659302,
"learning_rate": 1.254180602006689e-06,
"loss": 6.3615,
"step": 47500
},
{
"epoch": 424.08713370851933,
"eval_loss": 6.372131824493408,
"eval_runtime": 50.9739,
"eval_samples_per_second": 196.179,
"eval_steps_per_second": 3.512,
"step": 47500
},
{
"epoch": 424.9798175819911,
"grad_norm": 0.18605230748653412,
"learning_rate": 1.2441471571906355e-06,
"loss": 6.3608,
"step": 47600
},
{
"epoch": 424.9798175819911,
"eval_loss": 6.375829696655273,
"eval_runtime": 50.9794,
"eval_samples_per_second": 196.158,
"eval_steps_per_second": 3.511,
"step": 47600
},
{
"epoch": 425.87250145546284,
"grad_norm": 0.13004036247730255,
"learning_rate": 1.234113712374582e-06,
"loss": 6.3611,
"step": 47700
},
{
"epoch": 425.87250145546284,
"eval_loss": 6.3748297691345215,
"eval_runtime": 50.9638,
"eval_samples_per_second": 196.218,
"eval_steps_per_second": 3.512,
"step": 47700
},
{
"epoch": 426.7651853289346,
"grad_norm": 0.14566391706466675,
"learning_rate": 1.2240802675585284e-06,
"loss": 6.3614,
"step": 47800
},
{
"epoch": 426.7651853289346,
"eval_loss": 6.375539302825928,
"eval_runtime": 50.9667,
"eval_samples_per_second": 196.206,
"eval_steps_per_second": 3.512,
"step": 47800
},
{
"epoch": 427.65786920240635,
"grad_norm": 0.12622636556625366,
"learning_rate": 1.214046822742475e-06,
"loss": 6.3602,
"step": 47900
},
{
"epoch": 427.65786920240635,
"eval_loss": 6.371495723724365,
"eval_runtime": 50.9753,
"eval_samples_per_second": 196.174,
"eval_steps_per_second": 3.512,
"step": 47900
},
{
"epoch": 428.55055307587816,
"grad_norm": 0.14083540439605713,
"learning_rate": 1.2040133779264215e-06,
"loss": 6.3616,
"step": 48000
},
{
"epoch": 428.55055307587816,
"eval_loss": 6.37429141998291,
"eval_runtime": 50.9764,
"eval_samples_per_second": 196.169,
"eval_steps_per_second": 3.511,
"step": 48000
},
{
"epoch": 429.4432369493499,
"grad_norm": 0.12131120264530182,
"learning_rate": 1.193979933110368e-06,
"loss": 6.3611,
"step": 48100
},
{
"epoch": 429.4432369493499,
"eval_loss": 6.371769428253174,
"eval_runtime": 51.0086,
"eval_samples_per_second": 196.045,
"eval_steps_per_second": 3.509,
"step": 48100
},
{
"epoch": 430.33592082282166,
"grad_norm": 0.11834459006786346,
"learning_rate": 1.1839464882943144e-06,
"loss": 6.3605,
"step": 48200
},
{
"epoch": 430.33592082282166,
"eval_loss": 6.368320465087891,
"eval_runtime": 50.9661,
"eval_samples_per_second": 196.209,
"eval_steps_per_second": 3.512,
"step": 48200
},
{
"epoch": 431.2286046962934,
"grad_norm": 0.13733911514282227,
"learning_rate": 1.173913043478261e-06,
"loss": 6.3607,
"step": 48300
},
{
"epoch": 431.2286046962934,
"eval_loss": 6.371362686157227,
"eval_runtime": 50.9504,
"eval_samples_per_second": 196.269,
"eval_steps_per_second": 3.513,
"step": 48300
},
{
"epoch": 432.12128856976517,
"grad_norm": 0.12458811700344086,
"learning_rate": 1.1638795986622075e-06,
"loss": 6.3604,
"step": 48400
},
{
"epoch": 432.12128856976517,
"eval_loss": 6.372464179992676,
"eval_runtime": 50.9762,
"eval_samples_per_second": 196.17,
"eval_steps_per_second": 3.511,
"step": 48400
},
{
"epoch": 433.0139724432369,
"grad_norm": 0.16090624034404755,
"learning_rate": 1.153846153846154e-06,
"loss": 6.3611,
"step": 48500
},
{
"epoch": 433.0139724432369,
"eval_loss": 6.373631000518799,
"eval_runtime": 50.9618,
"eval_samples_per_second": 196.226,
"eval_steps_per_second": 3.512,
"step": 48500
},
{
"epoch": 433.90665631670873,
"grad_norm": 0.12443886697292328,
"learning_rate": 1.1438127090301004e-06,
"loss": 6.361,
"step": 48600
},
{
"epoch": 433.90665631670873,
"eval_loss": 6.3762993812561035,
"eval_runtime": 50.9606,
"eval_samples_per_second": 196.23,
"eval_steps_per_second": 3.513,
"step": 48600
},
{
"epoch": 434.7993401901805,
"grad_norm": 0.14061865210533142,
"learning_rate": 1.133779264214047e-06,
"loss": 6.36,
"step": 48700
},
{
"epoch": 434.7993401901805,
"eval_loss": 6.3731865882873535,
"eval_runtime": 50.9932,
"eval_samples_per_second": 196.105,
"eval_steps_per_second": 3.51,
"step": 48700
},
{
"epoch": 435.69202406365224,
"grad_norm": 0.12875817716121674,
"learning_rate": 1.1237458193979933e-06,
"loss": 6.3614,
"step": 48800
},
{
"epoch": 435.69202406365224,
"eval_loss": 6.372591018676758,
"eval_runtime": 50.9814,
"eval_samples_per_second": 196.15,
"eval_steps_per_second": 3.511,
"step": 48800
},
{
"epoch": 436.584707937124,
"grad_norm": 0.1300763338804245,
"learning_rate": 1.1137123745819398e-06,
"loss": 6.3611,
"step": 48900
},
{
"epoch": 436.584707937124,
"eval_loss": 6.375086784362793,
"eval_runtime": 50.9667,
"eval_samples_per_second": 196.207,
"eval_steps_per_second": 3.512,
"step": 48900
},
{
"epoch": 437.47739181059575,
"grad_norm": 0.12522312998771667,
"learning_rate": 1.1036789297658862e-06,
"loss": 6.3605,
"step": 49000
},
{
"epoch": 437.47739181059575,
"eval_loss": 6.373082637786865,
"eval_runtime": 50.9686,
"eval_samples_per_second": 196.199,
"eval_steps_per_second": 3.512,
"step": 49000
},
{
"epoch": 438.37007568406756,
"grad_norm": 0.15034428238868713,
"learning_rate": 1.0936454849498327e-06,
"loss": 6.3601,
"step": 49100
},
{
"epoch": 438.37007568406756,
"eval_loss": 6.369637489318848,
"eval_runtime": 50.9806,
"eval_samples_per_second": 196.153,
"eval_steps_per_second": 3.511,
"step": 49100
},
{
"epoch": 439.2627595575393,
"grad_norm": 0.14699020981788635,
"learning_rate": 1.0836120401337793e-06,
"loss": 6.3602,
"step": 49200
},
{
"epoch": 439.2627595575393,
"eval_loss": 6.3717498779296875,
"eval_runtime": 50.9494,
"eval_samples_per_second": 196.273,
"eval_steps_per_second": 3.513,
"step": 49200
},
{
"epoch": 440.15544343101107,
"grad_norm": 0.1339484453201294,
"learning_rate": 1.0735785953177258e-06,
"loss": 6.3608,
"step": 49300
},
{
"epoch": 440.15544343101107,
"eval_loss": 6.374644756317139,
"eval_runtime": 50.9591,
"eval_samples_per_second": 196.236,
"eval_steps_per_second": 3.513,
"step": 49300
},
{
"epoch": 441.0481273044828,
"grad_norm": 0.10889836400747299,
"learning_rate": 1.0635451505016722e-06,
"loss": 6.3602,
"step": 49400
},
{
"epoch": 441.0481273044828,
"eval_loss": 6.375630855560303,
"eval_runtime": 50.9618,
"eval_samples_per_second": 196.225,
"eval_steps_per_second": 3.512,
"step": 49400
},
{
"epoch": 441.9408111779546,
"grad_norm": 0.135609433054924,
"learning_rate": 1.0535117056856187e-06,
"loss": 6.3596,
"step": 49500
},
{
"epoch": 441.9408111779546,
"eval_loss": 6.37455940246582,
"eval_runtime": 50.968,
"eval_samples_per_second": 196.201,
"eval_steps_per_second": 3.512,
"step": 49500
},
{
"epoch": 442.8334950514263,
"grad_norm": 0.13086004555225372,
"learning_rate": 1.0434782608695653e-06,
"loss": 6.3601,
"step": 49600
},
{
"epoch": 442.8334950514263,
"eval_loss": 6.375424385070801,
"eval_runtime": 50.9762,
"eval_samples_per_second": 196.17,
"eval_steps_per_second": 3.511,
"step": 49600
},
{
"epoch": 443.72617892489814,
"grad_norm": 0.1462557315826416,
"learning_rate": 1.0334448160535118e-06,
"loss": 6.3606,
"step": 49700
},
{
"epoch": 443.72617892489814,
"eval_loss": 6.376568794250488,
"eval_runtime": 50.9824,
"eval_samples_per_second": 196.146,
"eval_steps_per_second": 3.511,
"step": 49700
},
{
"epoch": 444.6188627983699,
"grad_norm": 0.15183542668819427,
"learning_rate": 1.0234113712374581e-06,
"loss": 6.3595,
"step": 49800
},
{
"epoch": 444.6188627983699,
"eval_loss": 6.368979454040527,
"eval_runtime": 50.9624,
"eval_samples_per_second": 196.223,
"eval_steps_per_second": 3.512,
"step": 49800
},
{
"epoch": 445.51154667184164,
"grad_norm": 0.1357332020998001,
"learning_rate": 1.0133779264214047e-06,
"loss": 6.3605,
"step": 49900
},
{
"epoch": 445.51154667184164,
"eval_loss": 6.374391555786133,
"eval_runtime": 50.959,
"eval_samples_per_second": 196.236,
"eval_steps_per_second": 3.513,
"step": 49900
},
{
"epoch": 446.4042305453134,
"grad_norm": 0.14846473932266235,
"learning_rate": 1.0033444816053512e-06,
"loss": 6.3608,
"step": 50000
},
{
"epoch": 446.4042305453134,
"eval_loss": 6.372031211853027,
"eval_runtime": 50.9866,
"eval_samples_per_second": 196.13,
"eval_steps_per_second": 3.511,
"step": 50000
},
{
"epoch": 447.29691441878515,
"grad_norm": 0.1612795740365982,
"learning_rate": 9.933110367892976e-07,
"loss": 6.3606,
"step": 50100
},
{
"epoch": 447.29691441878515,
"eval_loss": 6.372196674346924,
"eval_runtime": 51.0079,
"eval_samples_per_second": 196.048,
"eval_steps_per_second": 3.509,
"step": 50100
},
{
"epoch": 448.18959829225696,
"grad_norm": 0.1360219269990921,
"learning_rate": 9.832775919732441e-07,
"loss": 6.3605,
"step": 50200
},
{
"epoch": 448.18959829225696,
"eval_loss": 6.374830722808838,
"eval_runtime": 50.9535,
"eval_samples_per_second": 196.257,
"eval_steps_per_second": 3.513,
"step": 50200
},
{
"epoch": 449.0822821657287,
"grad_norm": 0.14171314239501953,
"learning_rate": 9.732441471571907e-07,
"loss": 6.36,
"step": 50300
},
{
"epoch": 449.0822821657287,
"eval_loss": 6.374056816101074,
"eval_runtime": 50.9648,
"eval_samples_per_second": 196.214,
"eval_steps_per_second": 3.512,
"step": 50300
},
{
"epoch": 449.97496603920047,
"grad_norm": 0.10322766751050949,
"learning_rate": 9.632107023411372e-07,
"loss": 6.3595,
"step": 50400
},
{
"epoch": 449.97496603920047,
"eval_loss": 6.373784065246582,
"eval_runtime": 50.9502,
"eval_samples_per_second": 196.27,
"eval_steps_per_second": 3.513,
"step": 50400
},
{
"epoch": 450.8676499126722,
"grad_norm": 0.14763601124286652,
"learning_rate": 9.531772575250837e-07,
"loss": 6.3593,
"step": 50500
},
{
"epoch": 450.8676499126722,
"eval_loss": 6.373796463012695,
"eval_runtime": 50.9901,
"eval_samples_per_second": 196.117,
"eval_steps_per_second": 3.51,
"step": 50500
},
{
"epoch": 451.760333786144,
"grad_norm": 0.18021999299526215,
"learning_rate": 9.431438127090301e-07,
"loss": 6.3612,
"step": 50600
},
{
"epoch": 451.760333786144,
"eval_loss": 6.371494293212891,
"eval_runtime": 50.9922,
"eval_samples_per_second": 196.108,
"eval_steps_per_second": 3.51,
"step": 50600
},
{
"epoch": 452.6530176596158,
"grad_norm": 0.1338716447353363,
"learning_rate": 9.331103678929767e-07,
"loss": 6.3594,
"step": 50700
},
{
"epoch": 452.6530176596158,
"eval_loss": 6.3735032081604,
"eval_runtime": 50.4979,
"eval_samples_per_second": 198.028,
"eval_steps_per_second": 3.545,
"step": 50700
},
{
"epoch": 453.54570153308754,
"grad_norm": 0.11512942612171173,
"learning_rate": 9.230769230769231e-07,
"loss": 6.3605,
"step": 50800
},
{
"epoch": 453.54570153308754,
"eval_loss": 6.373264789581299,
"eval_runtime": 50.9877,
"eval_samples_per_second": 196.126,
"eval_steps_per_second": 3.511,
"step": 50800
},
{
"epoch": 454.4383854065593,
"grad_norm": 0.09796648472547531,
"learning_rate": 9.130434782608697e-07,
"loss": 6.3601,
"step": 50900
},
{
"epoch": 454.4383854065593,
"eval_loss": 6.374275207519531,
"eval_runtime": 50.9875,
"eval_samples_per_second": 196.126,
"eval_steps_per_second": 3.511,
"step": 50900
},
{
"epoch": 455.33106928003104,
"grad_norm": 0.1316356211900711,
"learning_rate": 9.030100334448161e-07,
"loss": 6.3601,
"step": 51000
},
{
"epoch": 455.33106928003104,
"eval_loss": 6.374828338623047,
"eval_runtime": 50.4891,
"eval_samples_per_second": 198.063,
"eval_steps_per_second": 3.545,
"step": 51000
},
{
"epoch": 456.2237531535028,
"grad_norm": 0.17832376062870026,
"learning_rate": 8.929765886287627e-07,
"loss": 6.3604,
"step": 51100
},
{
"epoch": 456.2237531535028,
"eval_loss": 6.371827602386475,
"eval_runtime": 50.9826,
"eval_samples_per_second": 196.145,
"eval_steps_per_second": 3.511,
"step": 51100
},
{
"epoch": 457.11643702697455,
"grad_norm": 0.14637400209903717,
"learning_rate": 8.829431438127091e-07,
"loss": 6.36,
"step": 51200
},
{
"epoch": 457.11643702697455,
"eval_loss": 6.375898361206055,
"eval_runtime": 50.495,
"eval_samples_per_second": 198.039,
"eval_steps_per_second": 3.545,
"step": 51200
},
{
"epoch": 458.00912090044636,
"grad_norm": 0.16641865670681,
"learning_rate": 8.729096989966555e-07,
"loss": 6.3595,
"step": 51300
},
{
"epoch": 458.00912090044636,
"eval_loss": 6.375617027282715,
"eval_runtime": 50.9794,
"eval_samples_per_second": 196.158,
"eval_steps_per_second": 3.511,
"step": 51300
},
{
"epoch": 458.9018047739181,
"grad_norm": 0.12667568027973175,
"learning_rate": 8.628762541806019e-07,
"loss": 6.3599,
"step": 51400
},
{
"epoch": 458.9018047739181,
"eval_loss": 6.368325710296631,
"eval_runtime": 50.4918,
"eval_samples_per_second": 198.052,
"eval_steps_per_second": 3.545,
"step": 51400
},
{
"epoch": 459.79448864738987,
"grad_norm": 0.1586967408657074,
"learning_rate": 8.528428093645485e-07,
"loss": 6.3599,
"step": 51500
},
{
"epoch": 459.79448864738987,
"eval_loss": 6.37186861038208,
"eval_runtime": 50.9603,
"eval_samples_per_second": 196.231,
"eval_steps_per_second": 3.513,
"step": 51500
},
{
"epoch": 460.6871725208616,
"grad_norm": 0.11572112888097763,
"learning_rate": 8.428093645484949e-07,
"loss": 6.3597,
"step": 51600
},
{
"epoch": 460.6871725208616,
"eval_loss": 6.371321678161621,
"eval_runtime": 50.9929,
"eval_samples_per_second": 196.106,
"eval_steps_per_second": 3.51,
"step": 51600
},
{
"epoch": 461.5798563943334,
"grad_norm": 0.12478705495595932,
"learning_rate": 8.327759197324414e-07,
"loss": 6.3598,
"step": 51700
},
{
"epoch": 461.5798563943334,
"eval_loss": 6.373435974121094,
"eval_runtime": 50.9766,
"eval_samples_per_second": 196.168,
"eval_steps_per_second": 3.511,
"step": 51700
},
{
"epoch": 462.4725402678052,
"grad_norm": 0.12946990132331848,
"learning_rate": 8.227424749163879e-07,
"loss": 6.3613,
"step": 51800
},
{
"epoch": 462.4725402678052,
"eval_loss": 6.371443748474121,
"eval_runtime": 50.9724,
"eval_samples_per_second": 196.185,
"eval_steps_per_second": 3.512,
"step": 51800
},
{
"epoch": 463.36522414127694,
"grad_norm": 0.13125728070735931,
"learning_rate": 8.127090301003344e-07,
"loss": 6.3602,
"step": 51900
},
{
"epoch": 463.36522414127694,
"eval_loss": 6.373104095458984,
"eval_runtime": 50.946,
"eval_samples_per_second": 196.286,
"eval_steps_per_second": 3.514,
"step": 51900
},
{
"epoch": 464.2579080147487,
"grad_norm": 0.1575118899345398,
"learning_rate": 8.026755852842809e-07,
"loss": 6.3599,
"step": 52000
},
{
"epoch": 464.2579080147487,
"eval_loss": 6.371898651123047,
"eval_runtime": 50.9549,
"eval_samples_per_second": 196.252,
"eval_steps_per_second": 3.513,
"step": 52000
},
{
"epoch": 465.15059188822045,
"grad_norm": 0.13345403969287872,
"learning_rate": 7.926421404682274e-07,
"loss": 6.3604,
"step": 52100
},
{
"epoch": 465.15059188822045,
"eval_loss": 6.374370098114014,
"eval_runtime": 50.488,
"eval_samples_per_second": 198.067,
"eval_steps_per_second": 3.545,
"step": 52100
},
{
"epoch": 466.0432757616922,
"grad_norm": 0.12134841084480286,
"learning_rate": 7.826086956521739e-07,
"loss": 6.3597,
"step": 52200
},
{
"epoch": 466.0432757616922,
"eval_loss": 6.370124816894531,
"eval_runtime": 50.9572,
"eval_samples_per_second": 196.243,
"eval_steps_per_second": 3.513,
"step": 52200
},
{
"epoch": 466.93595963516395,
"grad_norm": 0.14935283362865448,
"learning_rate": 7.725752508361204e-07,
"loss": 6.3599,
"step": 52300
},
{
"epoch": 466.93595963516395,
"eval_loss": 6.372580051422119,
"eval_runtime": 50.9516,
"eval_samples_per_second": 196.265,
"eval_steps_per_second": 3.513,
"step": 52300
},
{
"epoch": 467.82864350863576,
"grad_norm": 0.11806395649909973,
"learning_rate": 7.625418060200669e-07,
"loss": 6.3602,
"step": 52400
},
{
"epoch": 467.82864350863576,
"eval_loss": 6.37704610824585,
"eval_runtime": 50.9684,
"eval_samples_per_second": 196.2,
"eval_steps_per_second": 3.512,
"step": 52400
},
{
"epoch": 468.7213273821075,
"grad_norm": 0.1526840329170227,
"learning_rate": 7.525083612040134e-07,
"loss": 6.3594,
"step": 52500
},
{
"epoch": 468.7213273821075,
"eval_loss": 6.372363090515137,
"eval_runtime": 50.9653,
"eval_samples_per_second": 196.212,
"eval_steps_per_second": 3.512,
"step": 52500
},
{
"epoch": 469.61401125557927,
"grad_norm": 0.1198643147945404,
"learning_rate": 7.424749163879599e-07,
"loss": 6.3602,
"step": 52600
},
{
"epoch": 469.61401125557927,
"eval_loss": 6.370110034942627,
"eval_runtime": 50.9739,
"eval_samples_per_second": 196.179,
"eval_steps_per_second": 3.512,
"step": 52600
},
{
"epoch": 470.506695129051,
"grad_norm": 0.12439325451850891,
"learning_rate": 7.324414715719064e-07,
"loss": 6.3597,
"step": 52700
},
{
"epoch": 470.506695129051,
"eval_loss": 6.370666980743408,
"eval_runtime": 50.4975,
"eval_samples_per_second": 198.03,
"eval_steps_per_second": 3.545,
"step": 52700
},
{
"epoch": 471.3993790025228,
"grad_norm": 0.13444113731384277,
"learning_rate": 7.224080267558529e-07,
"loss": 6.359,
"step": 52800
},
{
"epoch": 471.3993790025228,
"eval_loss": 6.369675159454346,
"eval_runtime": 50.9791,
"eval_samples_per_second": 196.159,
"eval_steps_per_second": 3.511,
"step": 52800
},
{
"epoch": 472.2920628759946,
"grad_norm": 0.11212828010320663,
"learning_rate": 7.123745819397994e-07,
"loss": 6.3595,
"step": 52900
},
{
"epoch": 472.2920628759946,
"eval_loss": 6.36935567855835,
"eval_runtime": 50.9962,
"eval_samples_per_second": 196.093,
"eval_steps_per_second": 3.51,
"step": 52900
},
{
"epoch": 473.18474674946634,
"grad_norm": 0.1080106794834137,
"learning_rate": 7.023411371237459e-07,
"loss": 6.3595,
"step": 53000
},
{
"epoch": 473.18474674946634,
"eval_loss": 6.37483024597168,
"eval_runtime": 50.9694,
"eval_samples_per_second": 196.196,
"eval_steps_per_second": 3.512,
"step": 53000
},
{
"epoch": 474.0774306229381,
"grad_norm": 0.131260484457016,
"learning_rate": 6.923076923076923e-07,
"loss": 6.3599,
"step": 53100
},
{
"epoch": 474.0774306229381,
"eval_loss": 6.372048377990723,
"eval_runtime": 50.9726,
"eval_samples_per_second": 196.184,
"eval_steps_per_second": 3.512,
"step": 53100
},
{
"epoch": 474.97011449640985,
"grad_norm": 0.11120131611824036,
"learning_rate": 6.822742474916388e-07,
"loss": 6.3595,
"step": 53200
},
{
"epoch": 474.97011449640985,
"eval_loss": 6.371298789978027,
"eval_runtime": 50.9746,
"eval_samples_per_second": 196.176,
"eval_steps_per_second": 3.512,
"step": 53200
},
{
"epoch": 475.8627983698816,
"grad_norm": 0.1382032185792923,
"learning_rate": 6.722408026755853e-07,
"loss": 6.3597,
"step": 53300
},
{
"epoch": 475.8627983698816,
"eval_loss": 6.375929832458496,
"eval_runtime": 50.9847,
"eval_samples_per_second": 196.137,
"eval_steps_per_second": 3.511,
"step": 53300
},
{
"epoch": 476.7554822433534,
"grad_norm": 0.11284707486629486,
"learning_rate": 6.622073578595318e-07,
"loss": 6.3591,
"step": 53400
},
{
"epoch": 476.7554822433534,
"eval_loss": 6.373961925506592,
"eval_runtime": 50.9718,
"eval_samples_per_second": 196.187,
"eval_steps_per_second": 3.512,
"step": 53400
},
{
"epoch": 477.64816611682517,
"grad_norm": 0.11296847462654114,
"learning_rate": 6.521739130434783e-07,
"loss": 6.3599,
"step": 53500
},
{
"epoch": 477.64816611682517,
"eval_loss": 6.373483657836914,
"eval_runtime": 50.9566,
"eval_samples_per_second": 196.245,
"eval_steps_per_second": 3.513,
"step": 53500
},
{
"epoch": 478.5408499902969,
"grad_norm": 0.1363115906715393,
"learning_rate": 6.421404682274248e-07,
"loss": 6.3597,
"step": 53600
},
{
"epoch": 478.5408499902969,
"eval_loss": 6.37340784072876,
"eval_runtime": 50.9626,
"eval_samples_per_second": 196.222,
"eval_steps_per_second": 3.512,
"step": 53600
},
{
"epoch": 479.4335338637687,
"grad_norm": 0.12509457767009735,
"learning_rate": 6.321070234113712e-07,
"loss": 6.3593,
"step": 53700
},
{
"epoch": 479.4335338637687,
"eval_loss": 6.374527931213379,
"eval_runtime": 50.9733,
"eval_samples_per_second": 196.181,
"eval_steps_per_second": 3.512,
"step": 53700
},
{
"epoch": 480.3262177372404,
"grad_norm": 0.1320326179265976,
"learning_rate": 6.220735785953178e-07,
"loss": 6.3593,
"step": 53800
},
{
"epoch": 480.3262177372404,
"eval_loss": 6.376550674438477,
"eval_runtime": 50.966,
"eval_samples_per_second": 196.209,
"eval_steps_per_second": 3.512,
"step": 53800
},
{
"epoch": 481.2189016107122,
"grad_norm": 0.1382244974374771,
"learning_rate": 6.120401337792642e-07,
"loss": 6.3598,
"step": 53900
},
{
"epoch": 481.2189016107122,
"eval_loss": 6.372669696807861,
"eval_runtime": 50.9557,
"eval_samples_per_second": 196.249,
"eval_steps_per_second": 3.513,
"step": 53900
},
{
"epoch": 482.111585484184,
"grad_norm": 0.12267334014177322,
"learning_rate": 6.020066889632107e-07,
"loss": 6.3601,
"step": 54000
},
{
"epoch": 482.111585484184,
"eval_loss": 6.377495765686035,
"eval_runtime": 50.9659,
"eval_samples_per_second": 196.21,
"eval_steps_per_second": 3.512,
"step": 54000
},
{
"epoch": 483.00426935765574,
"grad_norm": 0.13831213116645813,
"learning_rate": 5.919732441471572e-07,
"loss": 6.3593,
"step": 54100
},
{
"epoch": 483.00426935765574,
"eval_loss": 6.3768439292907715,
"eval_runtime": 51.0259,
"eval_samples_per_second": 195.979,
"eval_steps_per_second": 3.508,
"step": 54100
},
{
"epoch": 483.8969532311275,
"grad_norm": 0.127532958984375,
"learning_rate": 5.819397993311037e-07,
"loss": 6.36,
"step": 54200
},
{
"epoch": 483.8969532311275,
"eval_loss": 6.369021415710449,
"eval_runtime": 50.5058,
"eval_samples_per_second": 197.997,
"eval_steps_per_second": 3.544,
"step": 54200
},
{
"epoch": 484.78963710459925,
"grad_norm": 0.11770881712436676,
"learning_rate": 5.719063545150502e-07,
"loss": 6.3589,
"step": 54300
},
{
"epoch": 484.78963710459925,
"eval_loss": 6.375646591186523,
"eval_runtime": 50.9866,
"eval_samples_per_second": 196.13,
"eval_steps_per_second": 3.511,
"step": 54300
},
{
"epoch": 485.682320978071,
"grad_norm": 0.1295900046825409,
"learning_rate": 5.618729096989966e-07,
"loss": 6.3594,
"step": 54400
},
{
"epoch": 485.682320978071,
"eval_loss": 6.371916770935059,
"eval_runtime": 50.9696,
"eval_samples_per_second": 196.196,
"eval_steps_per_second": 3.512,
"step": 54400
},
{
"epoch": 486.5750048515428,
"grad_norm": 0.11955253779888153,
"learning_rate": 5.518394648829431e-07,
"loss": 6.3595,
"step": 54500
},
{
"epoch": 486.5750048515428,
"eval_loss": 6.3733906745910645,
"eval_runtime": 50.9551,
"eval_samples_per_second": 196.251,
"eval_steps_per_second": 3.513,
"step": 54500
},
{
"epoch": 487.46768872501457,
"grad_norm": 0.12596124410629272,
"learning_rate": 5.418060200668896e-07,
"loss": 6.3597,
"step": 54600
},
{
"epoch": 487.46768872501457,
"eval_loss": 6.372114658355713,
"eval_runtime": 50.4972,
"eval_samples_per_second": 198.031,
"eval_steps_per_second": 3.545,
"step": 54600
},
{
"epoch": 488.3603725984863,
"grad_norm": 0.1110687404870987,
"learning_rate": 5.317725752508361e-07,
"loss": 6.3591,
"step": 54700
},
{
"epoch": 488.3603725984863,
"eval_loss": 6.370881080627441,
"eval_runtime": 50.963,
"eval_samples_per_second": 196.221,
"eval_steps_per_second": 3.512,
"step": 54700
},
{
"epoch": 489.2530564719581,
"grad_norm": 0.12368372082710266,
"learning_rate": 5.217391304347826e-07,
"loss": 6.3595,
"step": 54800
},
{
"epoch": 489.2530564719581,
"eval_loss": 6.371975421905518,
"eval_runtime": 50.9641,
"eval_samples_per_second": 196.216,
"eval_steps_per_second": 3.512,
"step": 54800
},
{
"epoch": 490.14574034542983,
"grad_norm": 0.1045992448925972,
"learning_rate": 5.117056856187291e-07,
"loss": 6.3587,
"step": 54900
},
{
"epoch": 490.14574034542983,
"eval_loss": 6.374923229217529,
"eval_runtime": 50.9721,
"eval_samples_per_second": 196.186,
"eval_steps_per_second": 3.512,
"step": 54900
},
{
"epoch": 491.03842421890164,
"grad_norm": 0.12338841706514359,
"learning_rate": 5.016722408026756e-07,
"loss": 6.3605,
"step": 55000
},
{
"epoch": 491.03842421890164,
"eval_loss": 6.367209434509277,
"eval_runtime": 50.9647,
"eval_samples_per_second": 196.214,
"eval_steps_per_second": 3.512,
"step": 55000
},
{
"epoch": 491.9311080923734,
"grad_norm": 0.12877170741558075,
"learning_rate": 4.916387959866221e-07,
"loss": 6.3591,
"step": 55100
},
{
"epoch": 491.9311080923734,
"eval_loss": 6.373247146606445,
"eval_runtime": 50.9752,
"eval_samples_per_second": 196.174,
"eval_steps_per_second": 3.512,
"step": 55100
},
{
"epoch": 492.82379196584515,
"grad_norm": 0.1188189759850502,
"learning_rate": 4.816053511705686e-07,
"loss": 6.3586,
"step": 55200
},
{
"epoch": 492.82379196584515,
"eval_loss": 6.371592998504639,
"eval_runtime": 50.9797,
"eval_samples_per_second": 196.157,
"eval_steps_per_second": 3.511,
"step": 55200
},
{
"epoch": 493.7164758393169,
"grad_norm": 0.14705920219421387,
"learning_rate": 4.7157190635451506e-07,
"loss": 6.3589,
"step": 55300
},
{
"epoch": 493.7164758393169,
"eval_loss": 6.375323295593262,
"eval_runtime": 50.9746,
"eval_samples_per_second": 196.176,
"eval_steps_per_second": 3.512,
"step": 55300
},
{
"epoch": 494.60915971278865,
"grad_norm": 0.1193486750125885,
"learning_rate": 4.6153846153846156e-07,
"loss": 6.3604,
"step": 55400
},
{
"epoch": 494.60915971278865,
"eval_loss": 6.3740973472595215,
"eval_runtime": 50.966,
"eval_samples_per_second": 196.209,
"eval_steps_per_second": 3.512,
"step": 55400
},
{
"epoch": 495.5018435862604,
"grad_norm": 0.12742812931537628,
"learning_rate": 4.5150501672240806e-07,
"loss": 6.3603,
"step": 55500
},
{
"epoch": 495.5018435862604,
"eval_loss": 6.37678337097168,
"eval_runtime": 50.9604,
"eval_samples_per_second": 196.231,
"eval_steps_per_second": 3.513,
"step": 55500
},
{
"epoch": 496.3945274597322,
"grad_norm": 0.1414756029844284,
"learning_rate": 4.4147157190635456e-07,
"loss": 6.3595,
"step": 55600
},
{
"epoch": 496.3945274597322,
"eval_loss": 6.373994827270508,
"eval_runtime": 50.9792,
"eval_samples_per_second": 196.158,
"eval_steps_per_second": 3.511,
"step": 55600
},
{
"epoch": 497.28721133320397,
"grad_norm": 0.11560999602079391,
"learning_rate": 4.3143812709030095e-07,
"loss": 6.3599,
"step": 55700
},
{
"epoch": 497.28721133320397,
"eval_loss": 6.374427318572998,
"eval_runtime": 50.5007,
"eval_samples_per_second": 198.017,
"eval_steps_per_second": 3.545,
"step": 55700
},
{
"epoch": 498.1798952066757,
"grad_norm": 0.16057543456554413,
"learning_rate": 4.2140468227424745e-07,
"loss": 6.3604,
"step": 55800
},
{
"epoch": 498.1798952066757,
"eval_loss": 6.375630855560303,
"eval_runtime": 50.9586,
"eval_samples_per_second": 196.238,
"eval_steps_per_second": 3.513,
"step": 55800
},
{
"epoch": 499.0725790801475,
"grad_norm": 0.14680643379688263,
"learning_rate": 4.1137123745819395e-07,
"loss": 6.3589,
"step": 55900
},
{
"epoch": 499.0725790801475,
"eval_loss": 6.373570919036865,
"eval_runtime": 50.4998,
"eval_samples_per_second": 198.02,
"eval_steps_per_second": 3.545,
"step": 55900
},
{
"epoch": 499.96526295361923,
"grad_norm": 0.12228725850582123,
"learning_rate": 4.0133779264214045e-07,
"loss": 6.3594,
"step": 56000
},
{
"epoch": 499.96526295361923,
"eval_loss": 6.371649742126465,
"eval_runtime": 50.9786,
"eval_samples_per_second": 196.161,
"eval_steps_per_second": 3.511,
"step": 56000
},
{
"epoch": 500.85794682709104,
"grad_norm": 0.12265335768461227,
"learning_rate": 3.9130434782608694e-07,
"loss": 6.3594,
"step": 56100
},
{
"epoch": 500.85794682709104,
"eval_loss": 6.376364231109619,
"eval_runtime": 50.9881,
"eval_samples_per_second": 196.124,
"eval_steps_per_second": 3.511,
"step": 56100
},
{
"epoch": 501.7506307005628,
"grad_norm": 0.10380034893751144,
"learning_rate": 3.8127090301003344e-07,
"loss": 6.36,
"step": 56200
},
{
"epoch": 501.7506307005628,
"eval_loss": 6.37660551071167,
"eval_runtime": 50.9903,
"eval_samples_per_second": 196.116,
"eval_steps_per_second": 3.51,
"step": 56200
},
{
"epoch": 502.64331457403455,
"grad_norm": 0.1066294014453888,
"learning_rate": 3.7123745819397994e-07,
"loss": 6.3596,
"step": 56300
},
{
"epoch": 502.64331457403455,
"eval_loss": 6.371345043182373,
"eval_runtime": 51.0067,
"eval_samples_per_second": 196.053,
"eval_steps_per_second": 3.509,
"step": 56300
},
{
"epoch": 503.5359984475063,
"grad_norm": 0.12047789245843887,
"learning_rate": 3.6120401337792644e-07,
"loss": 6.3592,
"step": 56400
},
{
"epoch": 503.5359984475063,
"eval_loss": 6.371187686920166,
"eval_runtime": 50.502,
"eval_samples_per_second": 198.012,
"eval_steps_per_second": 3.544,
"step": 56400
},
{
"epoch": 504.42868232097806,
"grad_norm": 0.12361543625593185,
"learning_rate": 3.5117056856187294e-07,
"loss": 6.3589,
"step": 56500
},
{
"epoch": 504.42868232097806,
"eval_loss": 6.369196891784668,
"eval_runtime": 50.9845,
"eval_samples_per_second": 196.138,
"eval_steps_per_second": 3.511,
"step": 56500
},
{
"epoch": 505.3213661944498,
"grad_norm": 0.10645488649606705,
"learning_rate": 3.411371237458194e-07,
"loss": 6.3595,
"step": 56600
},
{
"epoch": 505.3213661944498,
"eval_loss": 6.372078895568848,
"eval_runtime": 50.9783,
"eval_samples_per_second": 196.162,
"eval_steps_per_second": 3.511,
"step": 56600
},
{
"epoch": 506.2140500679216,
"grad_norm": 0.12366556376218796,
"learning_rate": 3.311036789297659e-07,
"loss": 6.3604,
"step": 56700
},
{
"epoch": 506.2140500679216,
"eval_loss": 6.3741960525512695,
"eval_runtime": 50.54,
"eval_samples_per_second": 197.863,
"eval_steps_per_second": 3.542,
"step": 56700
},
{
"epoch": 507.1067339413934,
"grad_norm": 0.10554321855306625,
"learning_rate": 3.210702341137124e-07,
"loss": 6.3593,
"step": 56800
},
{
"epoch": 507.1067339413934,
"eval_loss": 6.375464916229248,
"eval_runtime": 50.9673,
"eval_samples_per_second": 196.204,
"eval_steps_per_second": 3.512,
"step": 56800
},
{
"epoch": 507.9994178148651,
"grad_norm": 0.11263983696699142,
"learning_rate": 3.110367892976589e-07,
"loss": 6.3597,
"step": 56900
},
{
"epoch": 507.9994178148651,
"eval_loss": 6.370204925537109,
"eval_runtime": 50.9973,
"eval_samples_per_second": 196.089,
"eval_steps_per_second": 3.51,
"step": 56900
},
{
"epoch": 508.8921016883369,
"grad_norm": 0.11769650131464005,
"learning_rate": 3.010033444816054e-07,
"loss": 6.3589,
"step": 57000
},
{
"epoch": 508.8921016883369,
"eval_loss": 6.374892234802246,
"eval_runtime": 51.0033,
"eval_samples_per_second": 196.066,
"eval_steps_per_second": 3.51,
"step": 57000
},
{
"epoch": 509.78478556180863,
"grad_norm": 0.12533652782440186,
"learning_rate": 2.9096989966555187e-07,
"loss": 6.3585,
"step": 57100
},
{
"epoch": 509.78478556180863,
"eval_loss": 6.370015621185303,
"eval_runtime": 50.9934,
"eval_samples_per_second": 196.104,
"eval_steps_per_second": 3.51,
"step": 57100
},
{
"epoch": 510.67746943528044,
"grad_norm": 0.11758119612932205,
"learning_rate": 2.809364548494983e-07,
"loss": 6.3588,
"step": 57200
},
{
"epoch": 510.67746943528044,
"eval_loss": 6.374600410461426,
"eval_runtime": 50.4993,
"eval_samples_per_second": 198.023,
"eval_steps_per_second": 3.545,
"step": 57200
},
{
"epoch": 511.5701533087522,
"grad_norm": 0.13065285980701447,
"learning_rate": 2.709030100334448e-07,
"loss": 6.3595,
"step": 57300
},
{
"epoch": 511.5701533087522,
"eval_loss": 6.372690677642822,
"eval_runtime": 50.9923,
"eval_samples_per_second": 196.108,
"eval_steps_per_second": 3.51,
"step": 57300
},
{
"epoch": 512.4628371822239,
"grad_norm": 0.11216452717781067,
"learning_rate": 2.608695652173913e-07,
"loss": 6.3594,
"step": 57400
},
{
"epoch": 512.4628371822239,
"eval_loss": 6.370244026184082,
"eval_runtime": 50.981,
"eval_samples_per_second": 196.152,
"eval_steps_per_second": 3.511,
"step": 57400
},
{
"epoch": 513.3555210556957,
"grad_norm": 0.11593976616859436,
"learning_rate": 2.508361204013378e-07,
"loss": 6.3599,
"step": 57500
},
{
"epoch": 513.3555210556957,
"eval_loss": 6.3737688064575195,
"eval_runtime": 50.9877,
"eval_samples_per_second": 196.126,
"eval_steps_per_second": 3.511,
"step": 57500
},
{
"epoch": 514.2482049291675,
"grad_norm": 0.1154174879193306,
"learning_rate": 2.408026755852843e-07,
"loss": 6.3598,
"step": 57600
},
{
"epoch": 514.2482049291675,
"eval_loss": 6.373289108276367,
"eval_runtime": 50.9752,
"eval_samples_per_second": 196.174,
"eval_steps_per_second": 3.512,
"step": 57600
},
{
"epoch": 515.1408888026392,
"grad_norm": 0.12078119069337845,
"learning_rate": 2.3076923076923078e-07,
"loss": 6.3592,
"step": 57700
},
{
"epoch": 515.1408888026392,
"eval_loss": 6.371698379516602,
"eval_runtime": 50.9768,
"eval_samples_per_second": 196.168,
"eval_steps_per_second": 3.511,
"step": 57700
},
{
"epoch": 516.033572676111,
"grad_norm": 0.09368869662284851,
"learning_rate": 2.2073578595317728e-07,
"loss": 6.3593,
"step": 57800
},
{
"epoch": 516.033572676111,
"eval_loss": 6.372560024261475,
"eval_runtime": 50.9893,
"eval_samples_per_second": 196.119,
"eval_steps_per_second": 3.511,
"step": 57800
},
{
"epoch": 516.9262565495827,
"grad_norm": 0.09950955212116241,
"learning_rate": 2.1070234113712372e-07,
"loss": 6.3593,
"step": 57900
},
{
"epoch": 516.9262565495827,
"eval_loss": 6.375257968902588,
"eval_runtime": 50.9655,
"eval_samples_per_second": 196.211,
"eval_steps_per_second": 3.512,
"step": 57900
},
{
"epoch": 517.8189404230545,
"grad_norm": 0.12712809443473816,
"learning_rate": 2.0066889632107022e-07,
"loss": 6.3587,
"step": 58000
},
{
"epoch": 517.8189404230545,
"eval_loss": 6.374295234680176,
"eval_runtime": 50.9826,
"eval_samples_per_second": 196.145,
"eval_steps_per_second": 3.511,
"step": 58000
},
{
"epoch": 518.7116242965263,
"grad_norm": 0.11053524911403656,
"learning_rate": 1.9063545150501672e-07,
"loss": 6.3594,
"step": 58100
},
{
"epoch": 518.7116242965263,
"eval_loss": 6.376541614532471,
"eval_runtime": 50.9747,
"eval_samples_per_second": 196.176,
"eval_steps_per_second": 3.512,
"step": 58100
},
{
"epoch": 519.604308169998,
"grad_norm": 0.10716045647859573,
"learning_rate": 1.8060200668896322e-07,
"loss": 6.3586,
"step": 58200
},
{
"epoch": 519.604308169998,
"eval_loss": 6.373443126678467,
"eval_runtime": 50.9793,
"eval_samples_per_second": 196.158,
"eval_steps_per_second": 3.511,
"step": 58200
},
{
"epoch": 520.4969920434698,
"grad_norm": 0.1010851114988327,
"learning_rate": 1.705685618729097e-07,
"loss": 6.3583,
"step": 58300
},
{
"epoch": 520.4969920434698,
"eval_loss": 6.375570297241211,
"eval_runtime": 50.9829,
"eval_samples_per_second": 196.144,
"eval_steps_per_second": 3.511,
"step": 58300
},
{
"epoch": 521.3896759169415,
"grad_norm": 0.10243038833141327,
"learning_rate": 1.605351170568562e-07,
"loss": 6.359,
"step": 58400
},
{
"epoch": 521.3896759169415,
"eval_loss": 6.37014627456665,
"eval_runtime": 50.9806,
"eval_samples_per_second": 196.153,
"eval_steps_per_second": 3.511,
"step": 58400
},
{
"epoch": 522.2823597904134,
"grad_norm": 0.11007111519575119,
"learning_rate": 1.505016722408027e-07,
"loss": 6.3597,
"step": 58500
},
{
"epoch": 522.2823597904134,
"eval_loss": 6.367834091186523,
"eval_runtime": 50.9773,
"eval_samples_per_second": 196.166,
"eval_steps_per_second": 3.511,
"step": 58500
},
{
"epoch": 523.1750436638852,
"grad_norm": 0.10557661205530167,
"learning_rate": 1.4046822742474916e-07,
"loss": 6.3597,
"step": 58600
},
{
"epoch": 523.1750436638852,
"eval_loss": 6.3743696212768555,
"eval_runtime": 50.9815,
"eval_samples_per_second": 196.15,
"eval_steps_per_second": 3.511,
"step": 58600
},
{
"epoch": 524.0677275373569,
"grad_norm": 0.11409670859575272,
"learning_rate": 1.3043478260869566e-07,
"loss": 6.3595,
"step": 58700
},
{
"epoch": 524.0677275373569,
"eval_loss": 6.372434139251709,
"eval_runtime": 50.9833,
"eval_samples_per_second": 196.143,
"eval_steps_per_second": 3.511,
"step": 58700
},
{
"epoch": 524.9604114108287,
"grad_norm": 0.11429371684789658,
"learning_rate": 1.2040133779264215e-07,
"loss": 6.3583,
"step": 58800
},
{
"epoch": 524.9604114108287,
"eval_loss": 6.374448776245117,
"eval_runtime": 50.9877,
"eval_samples_per_second": 196.126,
"eval_steps_per_second": 3.511,
"step": 58800
},
{
"epoch": 525.8530952843004,
"grad_norm": 0.11243493109941483,
"learning_rate": 1.1036789297658864e-07,
"loss": 6.3594,
"step": 58900
},
{
"epoch": 525.8530952843004,
"eval_loss": 6.372460842132568,
"eval_runtime": 50.9747,
"eval_samples_per_second": 196.176,
"eval_steps_per_second": 3.512,
"step": 58900
},
{
"epoch": 526.7457791577722,
"grad_norm": 0.10929535329341888,
"learning_rate": 1.0033444816053511e-07,
"loss": 6.3596,
"step": 59000
},
{
"epoch": 526.7457791577722,
"eval_loss": 6.372054576873779,
"eval_runtime": 50.9854,
"eval_samples_per_second": 196.134,
"eval_steps_per_second": 3.511,
"step": 59000
},
{
"epoch": 527.638463031244,
"grad_norm": 0.10336798429489136,
"learning_rate": 9.030100334448161e-08,
"loss": 6.3588,
"step": 59100
},
{
"epoch": 527.638463031244,
"eval_loss": 6.373047828674316,
"eval_runtime": 50.9782,
"eval_samples_per_second": 196.162,
"eval_steps_per_second": 3.511,
"step": 59100
},
{
"epoch": 528.5311469047157,
"grad_norm": 0.11266309767961502,
"learning_rate": 8.02675585284281e-08,
"loss": 6.3602,
"step": 59200
},
{
"epoch": 528.5311469047157,
"eval_loss": 6.370576858520508,
"eval_runtime": 51.0093,
"eval_samples_per_second": 196.043,
"eval_steps_per_second": 3.509,
"step": 59200
},
{
"epoch": 529.4238307781875,
"grad_norm": 0.10325779765844345,
"learning_rate": 7.023411371237458e-08,
"loss": 6.3595,
"step": 59300
},
{
"epoch": 529.4238307781875,
"eval_loss": 6.371870994567871,
"eval_runtime": 50.501,
"eval_samples_per_second": 198.016,
"eval_steps_per_second": 3.544,
"step": 59300
},
{
"epoch": 530.3165146516592,
"grad_norm": 0.09962137043476105,
"learning_rate": 6.020066889632108e-08,
"loss": 6.358,
"step": 59400
},
{
"epoch": 530.3165146516592,
"eval_loss": 6.365788459777832,
"eval_runtime": 50.983,
"eval_samples_per_second": 196.144,
"eval_steps_per_second": 3.511,
"step": 59400
},
{
"epoch": 531.209198525131,
"grad_norm": 0.10900256037712097,
"learning_rate": 5.0167224080267556e-08,
"loss": 6.359,
"step": 59500
},
{
"epoch": 531.209198525131,
"eval_loss": 6.371830940246582,
"eval_runtime": 46.7226,
"eval_samples_per_second": 214.029,
"eval_steps_per_second": 3.831,
"step": 59500
},
{
"epoch": 532.1018823986028,
"grad_norm": 0.10019946843385696,
"learning_rate": 4.013377926421405e-08,
"loss": 6.3591,
"step": 59600
},
{
"epoch": 532.1018823986028,
"eval_loss": 6.372683048248291,
"eval_runtime": 50.9869,
"eval_samples_per_second": 196.129,
"eval_steps_per_second": 3.511,
"step": 59600
},
{
"epoch": 532.9945662720745,
"grad_norm": 0.10921988636255264,
"learning_rate": 3.010033444816054e-08,
"loss": 6.3601,
"step": 59700
},
{
"epoch": 532.9945662720745,
"eval_loss": 6.371883392333984,
"eval_runtime": 50.5044,
"eval_samples_per_second": 198.002,
"eval_steps_per_second": 3.544,
"step": 59700
},
{
"epoch": 533.8872501455463,
"grad_norm": 0.09983010590076447,
"learning_rate": 2.0066889632107024e-08,
"loss": 6.3597,
"step": 59800
},
{
"epoch": 533.8872501455463,
"eval_loss": 6.372203350067139,
"eval_runtime": 51.0084,
"eval_samples_per_second": 196.046,
"eval_steps_per_second": 3.509,
"step": 59800
},
{
"epoch": 534.779934019018,
"grad_norm": 0.10680444538593292,
"learning_rate": 1.0033444816053512e-08,
"loss": 6.3592,
"step": 59900
},
{
"epoch": 534.779934019018,
"eval_loss": 6.379711627960205,
"eval_runtime": 50.9976,
"eval_samples_per_second": 196.088,
"eval_steps_per_second": 3.51,
"step": 59900
},
{
"epoch": 535.6726178924898,
"grad_norm": 0.10077936947345734,
"learning_rate": 0.0,
"loss": 6.3593,
"step": 60000
},
{
"epoch": 535.6726178924898,
"eval_loss": 6.370903968811035,
"eval_runtime": 50.9925,
"eval_samples_per_second": 196.107,
"eval_steps_per_second": 3.51,
"step": 60000
}
],
"logging_steps": 100,
"max_steps": 60000,
"num_input_tokens_seen": 0,
"num_train_epochs": 536,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 4.808412969204368e+20,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}