HumorGen_GRPO_Think_7B / trainer_state.json
Jayi2424's picture
Upload folder using huggingface_hub
9ac396b verified
Raw
History Blame Contribute Delete
149 kB
{
"best_global_step": 6850,
"best_metric": 1.4607393741607666,
"best_model_checkpoint": "/ocean/projects/cis250225p/eajayi1/HUMOR_V2/models/HumorGen_GRPO_Think_7B/checkpoint-6850",
"epoch": 4.024676850763807,
"eval_steps": 50,
"global_step": 6850,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.005875440658049354,
"grad_norm": 8.811631202697754,
"learning_rate": 9.98942420681551e-07,
"loss": 12.2374,
"step": 10
},
{
"epoch": 0.011750881316098707,
"grad_norm": 8.409488677978516,
"learning_rate": 9.97767332549941e-07,
"loss": 11.9053,
"step": 20
},
{
"epoch": 0.01762632197414806,
"grad_norm": 8.858304023742676,
"learning_rate": 9.965922444183313e-07,
"loss": 11.7157,
"step": 30
},
{
"epoch": 0.023501762632197415,
"grad_norm": 7.180182456970215,
"learning_rate": 9.954171562867215e-07,
"loss": 11.502,
"step": 40
},
{
"epoch": 0.02937720329024677,
"grad_norm": 6.562496662139893,
"learning_rate": 9.942420681551115e-07,
"loss": 11.2901,
"step": 50
},
{
"epoch": 0.02937720329024677,
"eval_loss": 2.7823050022125244,
"eval_runtime": 67.4853,
"eval_samples_per_second": 21.249,
"eval_steps_per_second": 2.667,
"step": 50
},
{
"epoch": 0.03525264394829612,
"grad_norm": 6.412452697753906,
"learning_rate": 9.930669800235017e-07,
"loss": 11.3432,
"step": 60
},
{
"epoch": 0.041128084606345476,
"grad_norm": 5.517050266265869,
"learning_rate": 9.91891891891892e-07,
"loss": 10.9799,
"step": 70
},
{
"epoch": 0.04700352526439483,
"grad_norm": 5.147578716278076,
"learning_rate": 9.90716803760282e-07,
"loss": 10.7056,
"step": 80
},
{
"epoch": 0.052878965922444184,
"grad_norm": 5.424646377563477,
"learning_rate": 9.895417156286721e-07,
"loss": 10.8406,
"step": 90
},
{
"epoch": 0.05875440658049354,
"grad_norm": 5.833001613616943,
"learning_rate": 9.883666274970623e-07,
"loss": 10.381,
"step": 100
},
{
"epoch": 0.05875440658049354,
"eval_loss": 2.5908639430999756,
"eval_runtime": 67.4352,
"eval_samples_per_second": 21.265,
"eval_steps_per_second": 2.669,
"step": 100
},
{
"epoch": 0.06462984723854288,
"grad_norm": 5.278085708618164,
"learning_rate": 9.871915393654523e-07,
"loss": 10.4618,
"step": 110
},
{
"epoch": 0.07050528789659224,
"grad_norm": 5.3119378089904785,
"learning_rate": 9.860164512338425e-07,
"loss": 10.2036,
"step": 120
},
{
"epoch": 0.07638072855464159,
"grad_norm": 5.22417688369751,
"learning_rate": 9.848413631022327e-07,
"loss": 9.938,
"step": 130
},
{
"epoch": 0.08225616921269095,
"grad_norm": 5.020732402801514,
"learning_rate": 9.836662749706227e-07,
"loss": 9.8027,
"step": 140
},
{
"epoch": 0.0881316098707403,
"grad_norm": 5.330644607543945,
"learning_rate": 9.82491186839013e-07,
"loss": 9.8301,
"step": 150
},
{
"epoch": 0.0881316098707403,
"eval_loss": 2.414473533630371,
"eval_runtime": 67.5277,
"eval_samples_per_second": 21.236,
"eval_steps_per_second": 2.666,
"step": 150
},
{
"epoch": 0.09400705052878966,
"grad_norm": 5.486049175262451,
"learning_rate": 9.813160987074031e-07,
"loss": 9.5357,
"step": 160
},
{
"epoch": 0.099882491186839,
"grad_norm": 5.097166061401367,
"learning_rate": 9.801410105757931e-07,
"loss": 9.4452,
"step": 170
},
{
"epoch": 0.10575793184488837,
"grad_norm": 5.45658540725708,
"learning_rate": 9.789659224441834e-07,
"loss": 9.2689,
"step": 180
},
{
"epoch": 0.11163337250293771,
"grad_norm": 4.833297252655029,
"learning_rate": 9.777908343125733e-07,
"loss": 9.3352,
"step": 190
},
{
"epoch": 0.11750881316098707,
"grad_norm": 4.945570945739746,
"learning_rate": 9.766157461809636e-07,
"loss": 9.0403,
"step": 200
},
{
"epoch": 0.11750881316098707,
"eval_loss": 2.241272211074829,
"eval_runtime": 67.4972,
"eval_samples_per_second": 21.245,
"eval_steps_per_second": 2.667,
"step": 200
},
{
"epoch": 0.12338425381903642,
"grad_norm": 4.854373455047607,
"learning_rate": 9.754406580493535e-07,
"loss": 8.989,
"step": 210
},
{
"epoch": 0.12925969447708577,
"grad_norm": 5.162915229797363,
"learning_rate": 9.742655699177438e-07,
"loss": 8.8739,
"step": 220
},
{
"epoch": 0.13513513513513514,
"grad_norm": 4.9273223876953125,
"learning_rate": 9.73090481786134e-07,
"loss": 8.5618,
"step": 230
},
{
"epoch": 0.1410105757931845,
"grad_norm": 6.022256851196289,
"learning_rate": 9.71915393654524e-07,
"loss": 8.6177,
"step": 240
},
{
"epoch": 0.14688601645123384,
"grad_norm": 5.432478427886963,
"learning_rate": 9.707403055229142e-07,
"loss": 8.4886,
"step": 250
},
{
"epoch": 0.14688601645123384,
"eval_loss": 2.0618011951446533,
"eval_runtime": 67.4752,
"eval_samples_per_second": 21.252,
"eval_steps_per_second": 2.668,
"step": 250
},
{
"epoch": 0.15276145710928318,
"grad_norm": 4.686826705932617,
"learning_rate": 9.695652173913042e-07,
"loss": 8.2455,
"step": 260
},
{
"epoch": 0.15863689776733256,
"grad_norm": 4.1519598960876465,
"learning_rate": 9.683901292596944e-07,
"loss": 8.1025,
"step": 270
},
{
"epoch": 0.1645123384253819,
"grad_norm": 4.351338863372803,
"learning_rate": 9.672150411280846e-07,
"loss": 7.9276,
"step": 280
},
{
"epoch": 0.17038777908343125,
"grad_norm": 4.530479431152344,
"learning_rate": 9.660399529964746e-07,
"loss": 7.8546,
"step": 290
},
{
"epoch": 0.1762632197414806,
"grad_norm": 4.559052467346191,
"learning_rate": 9.648648648648648e-07,
"loss": 7.5711,
"step": 300
},
{
"epoch": 0.1762632197414806,
"eval_loss": 1.9077221155166626,
"eval_runtime": 67.4909,
"eval_samples_per_second": 21.247,
"eval_steps_per_second": 2.667,
"step": 300
},
{
"epoch": 0.18213866039952997,
"grad_norm": 4.547175884246826,
"learning_rate": 9.63689776733255e-07,
"loss": 7.6163,
"step": 310
},
{
"epoch": 0.18801410105757932,
"grad_norm": 4.496427536010742,
"learning_rate": 9.62514688601645e-07,
"loss": 7.5918,
"step": 320
},
{
"epoch": 0.19388954171562867,
"grad_norm": 3.8418445587158203,
"learning_rate": 9.613396004700352e-07,
"loss": 7.4111,
"step": 330
},
{
"epoch": 0.199764982373678,
"grad_norm": 3.503477096557617,
"learning_rate": 9.601645123384254e-07,
"loss": 7.3492,
"step": 340
},
{
"epoch": 0.2056404230317274,
"grad_norm": 3.4004416465759277,
"learning_rate": 9.589894242068156e-07,
"loss": 7.3022,
"step": 350
},
{
"epoch": 0.2056404230317274,
"eval_loss": 1.7808701992034912,
"eval_runtime": 67.5434,
"eval_samples_per_second": 21.231,
"eval_steps_per_second": 2.665,
"step": 350
},
{
"epoch": 0.21151586368977673,
"grad_norm": 3.0668485164642334,
"learning_rate": 9.578143360752056e-07,
"loss": 7.1996,
"step": 360
},
{
"epoch": 0.21739130434782608,
"grad_norm": 3.0713930130004883,
"learning_rate": 9.566392479435958e-07,
"loss": 7.0048,
"step": 370
},
{
"epoch": 0.22326674500587543,
"grad_norm": 2.9766199588775635,
"learning_rate": 9.554641598119858e-07,
"loss": 6.87,
"step": 380
},
{
"epoch": 0.2291421856639248,
"grad_norm": 3.037301778793335,
"learning_rate": 9.54289071680376e-07,
"loss": 6.9316,
"step": 390
},
{
"epoch": 0.23501762632197415,
"grad_norm": 2.995626211166382,
"learning_rate": 9.531139835487661e-07,
"loss": 6.923,
"step": 400
},
{
"epoch": 0.23501762632197415,
"eval_loss": 1.7068030834197998,
"eval_runtime": 67.4312,
"eval_samples_per_second": 21.266,
"eval_steps_per_second": 2.669,
"step": 400
},
{
"epoch": 0.2408930669800235,
"grad_norm": 2.8138625621795654,
"learning_rate": 9.519388954171562e-07,
"loss": 6.839,
"step": 410
},
{
"epoch": 0.24676850763807284,
"grad_norm": 3.0855729579925537,
"learning_rate": 9.507638072855464e-07,
"loss": 6.8684,
"step": 420
},
{
"epoch": 0.2526439482961222,
"grad_norm": 3.1985392570495605,
"learning_rate": 9.495887191539364e-07,
"loss": 6.8183,
"step": 430
},
{
"epoch": 0.25851938895417154,
"grad_norm": 2.9578516483306885,
"learning_rate": 9.484136310223266e-07,
"loss": 6.7427,
"step": 440
},
{
"epoch": 0.26439482961222094,
"grad_norm": 2.966491460800171,
"learning_rate": 9.472385428907168e-07,
"loss": 6.5244,
"step": 450
},
{
"epoch": 0.26439482961222094,
"eval_loss": 1.6518244743347168,
"eval_runtime": 67.4846,
"eval_samples_per_second": 21.249,
"eval_steps_per_second": 2.667,
"step": 450
},
{
"epoch": 0.2702702702702703,
"grad_norm": 3.0331716537475586,
"learning_rate": 9.460634547591068e-07,
"loss": 6.7348,
"step": 460
},
{
"epoch": 0.27614571092831963,
"grad_norm": 2.72918963432312,
"learning_rate": 9.44888366627497e-07,
"loss": 6.5748,
"step": 470
},
{
"epoch": 0.282021151586369,
"grad_norm": 2.724346399307251,
"learning_rate": 9.437132784958871e-07,
"loss": 6.6686,
"step": 480
},
{
"epoch": 0.2878965922444183,
"grad_norm": 2.5998895168304443,
"learning_rate": 9.425381903642773e-07,
"loss": 6.5502,
"step": 490
},
{
"epoch": 0.2937720329024677,
"grad_norm": 2.6023731231689453,
"learning_rate": 9.413631022326674e-07,
"loss": 6.7858,
"step": 500
},
{
"epoch": 0.2937720329024677,
"eval_loss": 1.6121058464050293,
"eval_runtime": 67.4886,
"eval_samples_per_second": 21.248,
"eval_steps_per_second": 2.667,
"step": 500
},
{
"epoch": 0.299647473560517,
"grad_norm": 2.7446892261505127,
"learning_rate": 9.401880141010575e-07,
"loss": 6.4195,
"step": 510
},
{
"epoch": 0.30552291421856637,
"grad_norm": 2.613320827484131,
"learning_rate": 9.390129259694477e-07,
"loss": 6.4007,
"step": 520
},
{
"epoch": 0.31139835487661577,
"grad_norm": 2.511936664581299,
"learning_rate": 9.378378378378377e-07,
"loss": 6.4101,
"step": 530
},
{
"epoch": 0.3172737955346651,
"grad_norm": 2.873652219772339,
"learning_rate": 9.36662749706228e-07,
"loss": 6.3963,
"step": 540
},
{
"epoch": 0.32314923619271446,
"grad_norm": 2.630295515060425,
"learning_rate": 9.35487661574618e-07,
"loss": 6.3901,
"step": 550
},
{
"epoch": 0.32314923619271446,
"eval_loss": 1.5881245136260986,
"eval_runtime": 67.5206,
"eval_samples_per_second": 21.238,
"eval_steps_per_second": 2.666,
"step": 550
},
{
"epoch": 0.3290246768507638,
"grad_norm": 2.6342382431030273,
"learning_rate": 9.343125734430082e-07,
"loss": 6.3494,
"step": 560
},
{
"epoch": 0.33490011750881316,
"grad_norm": 2.5987398624420166,
"learning_rate": 9.331374853113984e-07,
"loss": 6.5762,
"step": 570
},
{
"epoch": 0.3407755581668625,
"grad_norm": 2.516655445098877,
"learning_rate": 9.319623971797885e-07,
"loss": 6.1983,
"step": 580
},
{
"epoch": 0.34665099882491185,
"grad_norm": 2.4287195205688477,
"learning_rate": 9.307873090481786e-07,
"loss": 6.1897,
"step": 590
},
{
"epoch": 0.3525264394829612,
"grad_norm": 2.5706946849823,
"learning_rate": 9.296122209165687e-07,
"loss": 6.26,
"step": 600
},
{
"epoch": 0.3525264394829612,
"eval_loss": 1.5706110000610352,
"eval_runtime": 67.47,
"eval_samples_per_second": 21.254,
"eval_steps_per_second": 2.668,
"step": 600
},
{
"epoch": 0.3584018801410106,
"grad_norm": 2.3836824893951416,
"learning_rate": 9.284371327849589e-07,
"loss": 6.2133,
"step": 610
},
{
"epoch": 0.36427732079905994,
"grad_norm": 2.400269031524658,
"learning_rate": 9.27262044653349e-07,
"loss": 6.1327,
"step": 620
},
{
"epoch": 0.3701527614571093,
"grad_norm": 2.3165385723114014,
"learning_rate": 9.260869565217391e-07,
"loss": 6.3342,
"step": 630
},
{
"epoch": 0.37602820211515864,
"grad_norm": 2.231174945831299,
"learning_rate": 9.249118683901293e-07,
"loss": 6.2059,
"step": 640
},
{
"epoch": 0.381903642773208,
"grad_norm": 2.0728275775909424,
"learning_rate": 9.237367802585193e-07,
"loss": 6.3354,
"step": 650
},
{
"epoch": 0.381903642773208,
"eval_loss": 1.5572385787963867,
"eval_runtime": 67.5201,
"eval_samples_per_second": 21.238,
"eval_steps_per_second": 2.666,
"step": 650
},
{
"epoch": 0.38777908343125733,
"grad_norm": 2.2668001651763916,
"learning_rate": 9.225616921269095e-07,
"loss": 6.3588,
"step": 660
},
{
"epoch": 0.3936545240893067,
"grad_norm": 1.953262209892273,
"learning_rate": 9.213866039952997e-07,
"loss": 6.1279,
"step": 670
},
{
"epoch": 0.399529964747356,
"grad_norm": 2.1020588874816895,
"learning_rate": 9.202115158636897e-07,
"loss": 6.3427,
"step": 680
},
{
"epoch": 0.40540540540540543,
"grad_norm": 2.1236062049865723,
"learning_rate": 9.190364277320799e-07,
"loss": 6.263,
"step": 690
},
{
"epoch": 0.4112808460634548,
"grad_norm": 1.9457736015319824,
"learning_rate": 9.1786133960047e-07,
"loss": 6.2794,
"step": 700
},
{
"epoch": 0.4112808460634548,
"eval_loss": 1.5472731590270996,
"eval_runtime": 67.5297,
"eval_samples_per_second": 21.235,
"eval_steps_per_second": 2.665,
"step": 700
},
{
"epoch": 0.4171562867215041,
"grad_norm": 1.8783148527145386,
"learning_rate": 9.166862514688601e-07,
"loss": 6.1391,
"step": 710
},
{
"epoch": 0.42303172737955347,
"grad_norm": 1.9739516973495483,
"learning_rate": 9.155111633372502e-07,
"loss": 6.1713,
"step": 720
},
{
"epoch": 0.4289071680376028,
"grad_norm": 1.813057541847229,
"learning_rate": 9.143360752056404e-07,
"loss": 6.1088,
"step": 730
},
{
"epoch": 0.43478260869565216,
"grad_norm": 1.8499605655670166,
"learning_rate": 9.131609870740305e-07,
"loss": 6.1912,
"step": 740
},
{
"epoch": 0.4406580493537015,
"grad_norm": 1.9469040632247925,
"learning_rate": 9.119858989424206e-07,
"loss": 6.236,
"step": 750
},
{
"epoch": 0.4406580493537015,
"eval_loss": 1.5403022766113281,
"eval_runtime": 67.8197,
"eval_samples_per_second": 21.144,
"eval_steps_per_second": 2.654,
"step": 750
},
{
"epoch": 0.44653349001175086,
"grad_norm": 2.038455009460449,
"learning_rate": 9.108108108108108e-07,
"loss": 6.0741,
"step": 760
},
{
"epoch": 0.45240893066980026,
"grad_norm": 1.835290551185608,
"learning_rate": 9.096357226792008e-07,
"loss": 6.0559,
"step": 770
},
{
"epoch": 0.4582843713278496,
"grad_norm": 2.0130181312561035,
"learning_rate": 9.08460634547591e-07,
"loss": 6.0528,
"step": 780
},
{
"epoch": 0.46415981198589895,
"grad_norm": 1.840409278869629,
"learning_rate": 9.072855464159812e-07,
"loss": 6.2831,
"step": 790
},
{
"epoch": 0.4700352526439483,
"grad_norm": 1.9972599744796753,
"learning_rate": 9.061104582843712e-07,
"loss": 6.1976,
"step": 800
},
{
"epoch": 0.4700352526439483,
"eval_loss": 1.5347312688827515,
"eval_runtime": 67.5274,
"eval_samples_per_second": 21.236,
"eval_steps_per_second": 2.666,
"step": 800
},
{
"epoch": 0.47591069330199764,
"grad_norm": 1.8628931045532227,
"learning_rate": 9.049353701527614e-07,
"loss": 6.1779,
"step": 810
},
{
"epoch": 0.481786133960047,
"grad_norm": 2.0729994773864746,
"learning_rate": 9.037602820211515e-07,
"loss": 6.242,
"step": 820
},
{
"epoch": 0.48766157461809634,
"grad_norm": 1.8701937198638916,
"learning_rate": 9.025851938895417e-07,
"loss": 6.1222,
"step": 830
},
{
"epoch": 0.4935370152761457,
"grad_norm": 1.851508617401123,
"learning_rate": 9.014101057579317e-07,
"loss": 6.297,
"step": 840
},
{
"epoch": 0.4994124559341951,
"grad_norm": 1.8502558469772339,
"learning_rate": 9.002350176263219e-07,
"loss": 6.2895,
"step": 850
},
{
"epoch": 0.4994124559341951,
"eval_loss": 1.5294647216796875,
"eval_runtime": 67.5444,
"eval_samples_per_second": 21.23,
"eval_steps_per_second": 2.665,
"step": 850
},
{
"epoch": 0.5052878965922444,
"grad_norm": 1.861267328262329,
"learning_rate": 8.990599294947121e-07,
"loss": 6.0995,
"step": 860
},
{
"epoch": 0.5111633372502937,
"grad_norm": 1.8467332124710083,
"learning_rate": 8.978848413631021e-07,
"loss": 6.2265,
"step": 870
},
{
"epoch": 0.5170387779083431,
"grad_norm": 1.7630133628845215,
"learning_rate": 8.967097532314923e-07,
"loss": 6.0044,
"step": 880
},
{
"epoch": 0.5229142185663925,
"grad_norm": 1.6147162914276123,
"learning_rate": 8.955346650998825e-07,
"loss": 6.1896,
"step": 890
},
{
"epoch": 0.5287896592244419,
"grad_norm": 1.9183772802352905,
"learning_rate": 8.943595769682726e-07,
"loss": 6.0518,
"step": 900
},
{
"epoch": 0.5287896592244419,
"eval_loss": 1.5241233110427856,
"eval_runtime": 67.5042,
"eval_samples_per_second": 21.243,
"eval_steps_per_second": 2.667,
"step": 900
},
{
"epoch": 0.5346650998824912,
"grad_norm": 1.999889850616455,
"learning_rate": 8.931844888366628e-07,
"loss": 6.1402,
"step": 910
},
{
"epoch": 0.5405405405405406,
"grad_norm": 1.853894829750061,
"learning_rate": 8.920094007050529e-07,
"loss": 6.1626,
"step": 920
},
{
"epoch": 0.5464159811985899,
"grad_norm": 1.6458221673965454,
"learning_rate": 8.90834312573443e-07,
"loss": 6.0245,
"step": 930
},
{
"epoch": 0.5522914218566393,
"grad_norm": 1.8022114038467407,
"learning_rate": 8.896592244418331e-07,
"loss": 6.0397,
"step": 940
},
{
"epoch": 0.5581668625146886,
"grad_norm": 1.8993277549743652,
"learning_rate": 8.884841363102233e-07,
"loss": 6.2759,
"step": 950
},
{
"epoch": 0.5581668625146886,
"eval_loss": 1.5192291736602783,
"eval_runtime": 67.5518,
"eval_samples_per_second": 21.228,
"eval_steps_per_second": 2.665,
"step": 950
},
{
"epoch": 0.564042303172738,
"grad_norm": 1.7591309547424316,
"learning_rate": 8.873090481786134e-07,
"loss": 6.1107,
"step": 960
},
{
"epoch": 0.5699177438307873,
"grad_norm": 1.8564950227737427,
"learning_rate": 8.861339600470035e-07,
"loss": 6.0074,
"step": 970
},
{
"epoch": 0.5757931844888367,
"grad_norm": 1.7324663400650024,
"learning_rate": 8.849588719153937e-07,
"loss": 5.9752,
"step": 980
},
{
"epoch": 0.581668625146886,
"grad_norm": 1.9091726541519165,
"learning_rate": 8.837837837837837e-07,
"loss": 6.0551,
"step": 990
},
{
"epoch": 0.5875440658049353,
"grad_norm": 1.667810082435608,
"learning_rate": 8.826086956521739e-07,
"loss": 6.1355,
"step": 1000
},
{
"epoch": 0.5875440658049353,
"eval_loss": 1.5135389566421509,
"eval_runtime": 67.5223,
"eval_samples_per_second": 21.237,
"eval_steps_per_second": 2.666,
"step": 1000
},
{
"epoch": 0.5934195064629847,
"grad_norm": 2.0499677658081055,
"learning_rate": 8.81433607520564e-07,
"loss": 5.9337,
"step": 1010
},
{
"epoch": 0.599294947121034,
"grad_norm": 2.237178087234497,
"learning_rate": 8.802585193889541e-07,
"loss": 6.1225,
"step": 1020
},
{
"epoch": 0.6051703877790834,
"grad_norm": 1.904250144958496,
"learning_rate": 8.790834312573443e-07,
"loss": 6.1227,
"step": 1030
},
{
"epoch": 0.6110458284371327,
"grad_norm": 1.9532405138015747,
"learning_rate": 8.779083431257344e-07,
"loss": 6.0628,
"step": 1040
},
{
"epoch": 0.6169212690951822,
"grad_norm": 1.8243640661239624,
"learning_rate": 8.767332549941245e-07,
"loss": 5.956,
"step": 1050
},
{
"epoch": 0.6169212690951822,
"eval_loss": 1.5078574419021606,
"eval_runtime": 67.6452,
"eval_samples_per_second": 21.199,
"eval_steps_per_second": 2.661,
"step": 1050
},
{
"epoch": 0.6227967097532315,
"grad_norm": 1.8850717544555664,
"learning_rate": 8.755581668625146e-07,
"loss": 6.1356,
"step": 1060
},
{
"epoch": 0.6286721504112809,
"grad_norm": 1.7223460674285889,
"learning_rate": 8.743830787309048e-07,
"loss": 5.8176,
"step": 1070
},
{
"epoch": 0.6345475910693302,
"grad_norm": 1.873952865600586,
"learning_rate": 8.732079905992949e-07,
"loss": 6.1002,
"step": 1080
},
{
"epoch": 0.6404230317273796,
"grad_norm": 1.7804756164550781,
"learning_rate": 8.72032902467685e-07,
"loss": 6.1699,
"step": 1090
},
{
"epoch": 0.6462984723854289,
"grad_norm": 1.8307634592056274,
"learning_rate": 8.708578143360752e-07,
"loss": 6.089,
"step": 1100
},
{
"epoch": 0.6462984723854289,
"eval_loss": 1.5017292499542236,
"eval_runtime": 67.5101,
"eval_samples_per_second": 21.241,
"eval_steps_per_second": 2.666,
"step": 1100
},
{
"epoch": 0.6521739130434783,
"grad_norm": 2.105025053024292,
"learning_rate": 8.696827262044652e-07,
"loss": 6.1025,
"step": 1110
},
{
"epoch": 0.6580493537015276,
"grad_norm": 1.729182481765747,
"learning_rate": 8.685076380728554e-07,
"loss": 6.004,
"step": 1120
},
{
"epoch": 0.663924794359577,
"grad_norm": 2.012986183166504,
"learning_rate": 8.673325499412456e-07,
"loss": 6.1159,
"step": 1130
},
{
"epoch": 0.6698002350176263,
"grad_norm": 1.7573076486587524,
"learning_rate": 8.661574618096356e-07,
"loss": 6.075,
"step": 1140
},
{
"epoch": 0.6756756756756757,
"grad_norm": 1.7264623641967773,
"learning_rate": 8.649823736780258e-07,
"loss": 5.8563,
"step": 1150
},
{
"epoch": 0.6756756756756757,
"eval_loss": 1.4951844215393066,
"eval_runtime": 67.5809,
"eval_samples_per_second": 21.219,
"eval_steps_per_second": 2.663,
"step": 1150
},
{
"epoch": 0.681551116333725,
"grad_norm": 1.9470430612564087,
"learning_rate": 8.638072855464159e-07,
"loss": 5.8498,
"step": 1160
},
{
"epoch": 0.6874265569917744,
"grad_norm": 1.6648173332214355,
"learning_rate": 8.626321974148061e-07,
"loss": 6.0192,
"step": 1170
},
{
"epoch": 0.6933019976498237,
"grad_norm": 1.784105896949768,
"learning_rate": 8.614571092831961e-07,
"loss": 6.0703,
"step": 1180
},
{
"epoch": 0.699177438307873,
"grad_norm": 1.6299229860305786,
"learning_rate": 8.602820211515863e-07,
"loss": 6.0794,
"step": 1190
},
{
"epoch": 0.7050528789659224,
"grad_norm": 1.8894709348678589,
"learning_rate": 8.591069330199765e-07,
"loss": 5.9203,
"step": 1200
},
{
"epoch": 0.7050528789659224,
"eval_loss": 1.4896841049194336,
"eval_runtime": 67.5564,
"eval_samples_per_second": 21.227,
"eval_steps_per_second": 2.664,
"step": 1200
},
{
"epoch": 0.7109283196239718,
"grad_norm": 1.8506622314453125,
"learning_rate": 8.579318448883665e-07,
"loss": 6.1517,
"step": 1210
},
{
"epoch": 0.7168037602820212,
"grad_norm": 1.5787792205810547,
"learning_rate": 8.567567567567567e-07,
"loss": 5.932,
"step": 1220
},
{
"epoch": 0.7226792009400705,
"grad_norm": 1.9385451078414917,
"learning_rate": 8.555816686251468e-07,
"loss": 6.1204,
"step": 1230
},
{
"epoch": 0.7285546415981199,
"grad_norm": 1.789788842201233,
"learning_rate": 8.54406580493537e-07,
"loss": 6.0878,
"step": 1240
},
{
"epoch": 0.7344300822561692,
"grad_norm": 1.9521713256835938,
"learning_rate": 8.532314923619272e-07,
"loss": 6.0651,
"step": 1250
},
{
"epoch": 0.7344300822561692,
"eval_loss": 1.4861587285995483,
"eval_runtime": 78.0463,
"eval_samples_per_second": 18.374,
"eval_steps_per_second": 2.306,
"step": 1250
},
{
"epoch": 0.7403055229142186,
"grad_norm": 1.9088025093078613,
"learning_rate": 8.520564042303173e-07,
"loss": 6.0032,
"step": 1260
},
{
"epoch": 0.7461809635722679,
"grad_norm": 2.0229740142822266,
"learning_rate": 8.508813160987074e-07,
"loss": 6.1724,
"step": 1270
},
{
"epoch": 0.7520564042303173,
"grad_norm": 1.7247604131698608,
"learning_rate": 8.497062279670975e-07,
"loss": 5.9501,
"step": 1280
},
{
"epoch": 0.7579318448883666,
"grad_norm": 2.1122665405273438,
"learning_rate": 8.485311398354877e-07,
"loss": 5.8399,
"step": 1290
},
{
"epoch": 0.763807285546416,
"grad_norm": 1.9144885540008545,
"learning_rate": 8.473560517038778e-07,
"loss": 6.0293,
"step": 1300
},
{
"epoch": 0.763807285546416,
"eval_loss": 1.4840021133422852,
"eval_runtime": 67.75,
"eval_samples_per_second": 21.166,
"eval_steps_per_second": 2.657,
"step": 1300
},
{
"epoch": 0.7696827262044653,
"grad_norm": 1.7198468446731567,
"learning_rate": 8.461809635722679e-07,
"loss": 6.0714,
"step": 1310
},
{
"epoch": 0.7755581668625147,
"grad_norm": 1.7803094387054443,
"learning_rate": 8.450058754406581e-07,
"loss": 5.9993,
"step": 1320
},
{
"epoch": 0.781433607520564,
"grad_norm": 1.9184415340423584,
"learning_rate": 8.438307873090481e-07,
"loss": 5.9439,
"step": 1330
},
{
"epoch": 0.7873090481786134,
"grad_norm": 1.9405663013458252,
"learning_rate": 8.426556991774383e-07,
"loss": 6.0342,
"step": 1340
},
{
"epoch": 0.7931844888366627,
"grad_norm": 1.9659658670425415,
"learning_rate": 8.414806110458284e-07,
"loss": 5.8654,
"step": 1350
},
{
"epoch": 0.7931844888366627,
"eval_loss": 1.4824680089950562,
"eval_runtime": 67.5038,
"eval_samples_per_second": 21.243,
"eval_steps_per_second": 2.667,
"step": 1350
},
{
"epoch": 0.799059929494712,
"grad_norm": 1.8041818141937256,
"learning_rate": 8.403055229142185e-07,
"loss": 5.8713,
"step": 1360
},
{
"epoch": 0.8049353701527615,
"grad_norm": 1.7908101081848145,
"learning_rate": 8.391304347826087e-07,
"loss": 5.904,
"step": 1370
},
{
"epoch": 0.8108108108108109,
"grad_norm": 1.6884026527404785,
"learning_rate": 8.379553466509988e-07,
"loss": 6.3144,
"step": 1380
},
{
"epoch": 0.8166862514688602,
"grad_norm": 1.9209022521972656,
"learning_rate": 8.367802585193889e-07,
"loss": 6.0199,
"step": 1390
},
{
"epoch": 0.8225616921269095,
"grad_norm": 1.7688874006271362,
"learning_rate": 8.35605170387779e-07,
"loss": 5.957,
"step": 1400
},
{
"epoch": 0.8225616921269095,
"eval_loss": 1.4813125133514404,
"eval_runtime": 67.3592,
"eval_samples_per_second": 21.289,
"eval_steps_per_second": 2.672,
"step": 1400
},
{
"epoch": 0.8284371327849589,
"grad_norm": 1.8281030654907227,
"learning_rate": 8.344300822561692e-07,
"loss": 5.7265,
"step": 1410
},
{
"epoch": 0.8343125734430082,
"grad_norm": 1.7813804149627686,
"learning_rate": 8.332549941245593e-07,
"loss": 5.9138,
"step": 1420
},
{
"epoch": 0.8401880141010576,
"grad_norm": 1.8841749429702759,
"learning_rate": 8.320799059929494e-07,
"loss": 5.93,
"step": 1430
},
{
"epoch": 0.8460634547591069,
"grad_norm": 1.8778326511383057,
"learning_rate": 8.309048178613396e-07,
"loss": 6.0624,
"step": 1440
},
{
"epoch": 0.8519388954171563,
"grad_norm": 1.534106969833374,
"learning_rate": 8.297297297297296e-07,
"loss": 5.9173,
"step": 1450
},
{
"epoch": 0.8519388954171563,
"eval_loss": 1.4806052446365356,
"eval_runtime": 67.443,
"eval_samples_per_second": 21.262,
"eval_steps_per_second": 2.669,
"step": 1450
},
{
"epoch": 0.8578143360752056,
"grad_norm": 1.958788514137268,
"learning_rate": 8.285546415981198e-07,
"loss": 5.9058,
"step": 1460
},
{
"epoch": 0.863689776733255,
"grad_norm": 1.6875348091125488,
"learning_rate": 8.2737955346651e-07,
"loss": 6.071,
"step": 1470
},
{
"epoch": 0.8695652173913043,
"grad_norm": 1.887682318687439,
"learning_rate": 8.262044653349001e-07,
"loss": 5.9213,
"step": 1480
},
{
"epoch": 0.8754406580493537,
"grad_norm": 1.945660948753357,
"learning_rate": 8.250293772032902e-07,
"loss": 5.9722,
"step": 1490
},
{
"epoch": 0.881316098707403,
"grad_norm": 1.9587616920471191,
"learning_rate": 8.238542890716803e-07,
"loss": 5.9644,
"step": 1500
},
{
"epoch": 0.881316098707403,
"eval_loss": 1.4798330068588257,
"eval_runtime": 69.9429,
"eval_samples_per_second": 20.502,
"eval_steps_per_second": 2.574,
"step": 1500
},
{
"epoch": 0.8871915393654524,
"grad_norm": 2.033848762512207,
"learning_rate": 8.226792009400705e-07,
"loss": 5.9035,
"step": 1510
},
{
"epoch": 0.8930669800235017,
"grad_norm": 2.0481224060058594,
"learning_rate": 8.215041128084605e-07,
"loss": 5.9669,
"step": 1520
},
{
"epoch": 0.8989424206815512,
"grad_norm": 1.684850811958313,
"learning_rate": 8.203290246768507e-07,
"loss": 5.7496,
"step": 1530
},
{
"epoch": 0.9048178613396005,
"grad_norm": 1.7894434928894043,
"learning_rate": 8.191539365452409e-07,
"loss": 6.0756,
"step": 1540
},
{
"epoch": 0.9106933019976499,
"grad_norm": 1.8205320835113525,
"learning_rate": 8.179788484136309e-07,
"loss": 6.1865,
"step": 1550
},
{
"epoch": 0.9106933019976499,
"eval_loss": 1.4793447256088257,
"eval_runtime": 67.3984,
"eval_samples_per_second": 21.276,
"eval_steps_per_second": 2.671,
"step": 1550
},
{
"epoch": 0.9165687426556992,
"grad_norm": 2.025639057159424,
"learning_rate": 8.168037602820211e-07,
"loss": 6.1506,
"step": 1560
},
{
"epoch": 0.9224441833137486,
"grad_norm": 1.745783805847168,
"learning_rate": 8.156286721504112e-07,
"loss": 6.0317,
"step": 1570
},
{
"epoch": 0.9283196239717979,
"grad_norm": 1.8073749542236328,
"learning_rate": 8.144535840188013e-07,
"loss": 6.0357,
"step": 1580
},
{
"epoch": 0.9341950646298472,
"grad_norm": 1.9718337059020996,
"learning_rate": 8.132784958871916e-07,
"loss": 5.9024,
"step": 1590
},
{
"epoch": 0.9400705052878966,
"grad_norm": 1.7604055404663086,
"learning_rate": 8.121034077555817e-07,
"loss": 5.8952,
"step": 1600
},
{
"epoch": 0.9400705052878966,
"eval_loss": 1.4788146018981934,
"eval_runtime": 67.3877,
"eval_samples_per_second": 21.28,
"eval_steps_per_second": 2.671,
"step": 1600
},
{
"epoch": 0.9459459459459459,
"grad_norm": 1.9103364944458008,
"learning_rate": 8.109283196239718e-07,
"loss": 5.9051,
"step": 1610
},
{
"epoch": 0.9518213866039953,
"grad_norm": 1.6583188772201538,
"learning_rate": 8.097532314923619e-07,
"loss": 5.864,
"step": 1620
},
{
"epoch": 0.9576968272620446,
"grad_norm": 1.8631893396377563,
"learning_rate": 8.085781433607521e-07,
"loss": 5.8381,
"step": 1630
},
{
"epoch": 0.963572267920094,
"grad_norm": 1.9318718910217285,
"learning_rate": 8.074030552291421e-07,
"loss": 5.941,
"step": 1640
},
{
"epoch": 0.9694477085781433,
"grad_norm": 1.7922627925872803,
"learning_rate": 8.062279670975323e-07,
"loss": 5.9733,
"step": 1650
},
{
"epoch": 0.9694477085781433,
"eval_loss": 1.4783855676651,
"eval_runtime": 67.5032,
"eval_samples_per_second": 21.243,
"eval_steps_per_second": 2.667,
"step": 1650
},
{
"epoch": 0.9753231492361927,
"grad_norm": 1.6979329586029053,
"learning_rate": 8.050528789659225e-07,
"loss": 6.077,
"step": 1660
},
{
"epoch": 0.981198589894242,
"grad_norm": 1.6366304159164429,
"learning_rate": 8.038777908343125e-07,
"loss": 5.804,
"step": 1670
},
{
"epoch": 0.9870740305522914,
"grad_norm": 1.5034892559051514,
"learning_rate": 8.027027027027027e-07,
"loss": 5.7737,
"step": 1680
},
{
"epoch": 0.9929494712103408,
"grad_norm": 1.487920880317688,
"learning_rate": 8.015276145710928e-07,
"loss": 5.879,
"step": 1690
},
{
"epoch": 0.9988249118683902,
"grad_norm": 1.7758818864822388,
"learning_rate": 8.003525264394829e-07,
"loss": 6.015,
"step": 1700
},
{
"epoch": 0.9988249118683902,
"eval_loss": 1.477812647819519,
"eval_runtime": 67.3925,
"eval_samples_per_second": 21.278,
"eval_steps_per_second": 2.671,
"step": 1700
},
{
"epoch": 1.0047003525264395,
"grad_norm": 1.8898565769195557,
"learning_rate": 7.991774383078731e-07,
"loss": 5.8394,
"step": 1710
},
{
"epoch": 1.0105757931844888,
"grad_norm": 1.7957675457000732,
"learning_rate": 7.980023501762632e-07,
"loss": 5.9171,
"step": 1720
},
{
"epoch": 1.0164512338425382,
"grad_norm": 1.4734153747558594,
"learning_rate": 7.968272620446533e-07,
"loss": 5.7544,
"step": 1730
},
{
"epoch": 1.0223266745005875,
"grad_norm": 1.8453232049942017,
"learning_rate": 7.956521739130434e-07,
"loss": 5.7172,
"step": 1740
},
{
"epoch": 1.028202115158637,
"grad_norm": 1.6651732921600342,
"learning_rate": 7.944770857814336e-07,
"loss": 5.7981,
"step": 1750
},
{
"epoch": 1.028202115158637,
"eval_loss": 1.4773787260055542,
"eval_runtime": 67.4079,
"eval_samples_per_second": 21.273,
"eval_steps_per_second": 2.67,
"step": 1750
},
{
"epoch": 1.0340775558166861,
"grad_norm": 1.9795799255371094,
"learning_rate": 7.933019976498237e-07,
"loss": 5.7833,
"step": 1760
},
{
"epoch": 1.0399529964747356,
"grad_norm": 2.128406286239624,
"learning_rate": 7.921269095182138e-07,
"loss": 6.1611,
"step": 1770
},
{
"epoch": 1.045828437132785,
"grad_norm": 1.7242544889450073,
"learning_rate": 7.90951821386604e-07,
"loss": 5.8551,
"step": 1780
},
{
"epoch": 1.0517038777908343,
"grad_norm": 1.89352285861969,
"learning_rate": 7.89776733254994e-07,
"loss": 5.9303,
"step": 1790
},
{
"epoch": 1.0575793184488838,
"grad_norm": 1.7971441745758057,
"learning_rate": 7.886016451233842e-07,
"loss": 5.9246,
"step": 1800
},
{
"epoch": 1.0575793184488838,
"eval_loss": 1.476963996887207,
"eval_runtime": 67.356,
"eval_samples_per_second": 21.29,
"eval_steps_per_second": 2.672,
"step": 1800
},
{
"epoch": 1.063454759106933,
"grad_norm": 1.8786916732788086,
"learning_rate": 7.874265569917743e-07,
"loss": 5.7856,
"step": 1810
},
{
"epoch": 1.0693301997649824,
"grad_norm": 1.9047880172729492,
"learning_rate": 7.862514688601645e-07,
"loss": 6.0362,
"step": 1820
},
{
"epoch": 1.0752056404230317,
"grad_norm": 1.9103033542633057,
"learning_rate": 7.850763807285546e-07,
"loss": 5.8908,
"step": 1830
},
{
"epoch": 1.0810810810810811,
"grad_norm": 2.0070149898529053,
"learning_rate": 7.839012925969447e-07,
"loss": 5.982,
"step": 1840
},
{
"epoch": 1.0869565217391304,
"grad_norm": 1.5143649578094482,
"learning_rate": 7.827262044653349e-07,
"loss": 5.8349,
"step": 1850
},
{
"epoch": 1.0869565217391304,
"eval_loss": 1.4763119220733643,
"eval_runtime": 67.3329,
"eval_samples_per_second": 21.297,
"eval_steps_per_second": 2.673,
"step": 1850
},
{
"epoch": 1.0928319623971798,
"grad_norm": 1.6700143814086914,
"learning_rate": 7.815511163337249e-07,
"loss": 6.0503,
"step": 1860
},
{
"epoch": 1.098707403055229,
"grad_norm": 1.734837532043457,
"learning_rate": 7.803760282021151e-07,
"loss": 5.9907,
"step": 1870
},
{
"epoch": 1.1045828437132785,
"grad_norm": 1.778960943222046,
"learning_rate": 7.792009400705053e-07,
"loss": 5.6846,
"step": 1880
},
{
"epoch": 1.1104582843713278,
"grad_norm": 2.055248498916626,
"learning_rate": 7.780258519388953e-07,
"loss": 6.0658,
"step": 1890
},
{
"epoch": 1.1163337250293772,
"grad_norm": 2.000680923461914,
"learning_rate": 7.768507638072855e-07,
"loss": 5.9983,
"step": 1900
},
{
"epoch": 1.1163337250293772,
"eval_loss": 1.4759562015533447,
"eval_runtime": 67.4275,
"eval_samples_per_second": 21.267,
"eval_steps_per_second": 2.67,
"step": 1900
},
{
"epoch": 1.1222091656874265,
"grad_norm": 1.8254281282424927,
"learning_rate": 7.756756756756756e-07,
"loss": 5.9185,
"step": 1910
},
{
"epoch": 1.128084606345476,
"grad_norm": 1.8100814819335938,
"learning_rate": 7.745005875440657e-07,
"loss": 5.9912,
"step": 1920
},
{
"epoch": 1.1339600470035252,
"grad_norm": 1.7456374168395996,
"learning_rate": 7.73325499412456e-07,
"loss": 5.8861,
"step": 1930
},
{
"epoch": 1.1398354876615746,
"grad_norm": 1.508423089981079,
"learning_rate": 7.721504112808461e-07,
"loss": 5.7021,
"step": 1940
},
{
"epoch": 1.145710928319624,
"grad_norm": 2.055159330368042,
"learning_rate": 7.709753231492362e-07,
"loss": 6.0077,
"step": 1950
},
{
"epoch": 1.145710928319624,
"eval_loss": 1.4756381511688232,
"eval_runtime": 67.3529,
"eval_samples_per_second": 21.291,
"eval_steps_per_second": 2.672,
"step": 1950
},
{
"epoch": 1.1515863689776733,
"grad_norm": 1.5550910234451294,
"learning_rate": 7.698002350176263e-07,
"loss": 6.0144,
"step": 1960
},
{
"epoch": 1.1574618096357228,
"grad_norm": 1.627854585647583,
"learning_rate": 7.686251468860165e-07,
"loss": 5.9242,
"step": 1970
},
{
"epoch": 1.163337250293772,
"grad_norm": 1.8871314525604248,
"learning_rate": 7.674500587544065e-07,
"loss": 5.8759,
"step": 1980
},
{
"epoch": 1.1692126909518215,
"grad_norm": 1.6970958709716797,
"learning_rate": 7.662749706227967e-07,
"loss": 5.7471,
"step": 1990
},
{
"epoch": 1.1750881316098707,
"grad_norm": 2.148339033126831,
"learning_rate": 7.650998824911869e-07,
"loss": 5.932,
"step": 2000
},
{
"epoch": 1.1750881316098707,
"eval_loss": 1.4752864837646484,
"eval_runtime": 67.3674,
"eval_samples_per_second": 21.286,
"eval_steps_per_second": 2.672,
"step": 2000
},
{
"epoch": 1.1809635722679201,
"grad_norm": 1.8196816444396973,
"learning_rate": 7.639247943595769e-07,
"loss": 5.8354,
"step": 2010
},
{
"epoch": 1.1868390129259694,
"grad_norm": 1.5692166090011597,
"learning_rate": 7.627497062279671e-07,
"loss": 6.0992,
"step": 2020
},
{
"epoch": 1.1927144535840188,
"grad_norm": 1.7445123195648193,
"learning_rate": 7.615746180963572e-07,
"loss": 5.8826,
"step": 2030
},
{
"epoch": 1.198589894242068,
"grad_norm": 1.774656891822815,
"learning_rate": 7.603995299647473e-07,
"loss": 5.7213,
"step": 2040
},
{
"epoch": 1.2044653349001175,
"grad_norm": 1.7705199718475342,
"learning_rate": 7.592244418331375e-07,
"loss": 6.0987,
"step": 2050
},
{
"epoch": 1.2044653349001175,
"eval_loss": 1.474990725517273,
"eval_runtime": 67.3591,
"eval_samples_per_second": 21.289,
"eval_steps_per_second": 2.672,
"step": 2050
},
{
"epoch": 1.2103407755581668,
"grad_norm": 1.7765486240386963,
"learning_rate": 7.580493537015276e-07,
"loss": 5.9866,
"step": 2060
},
{
"epoch": 1.2162162162162162,
"grad_norm": 1.877685785293579,
"learning_rate": 7.568742655699177e-07,
"loss": 5.9616,
"step": 2070
},
{
"epoch": 1.2220916568742655,
"grad_norm": 1.8580436706542969,
"learning_rate": 7.556991774383078e-07,
"loss": 5.9441,
"step": 2080
},
{
"epoch": 1.227967097532315,
"grad_norm": 1.7666056156158447,
"learning_rate": 7.54524089306698e-07,
"loss": 5.8912,
"step": 2090
},
{
"epoch": 1.2338425381903644,
"grad_norm": 1.9045265913009644,
"learning_rate": 7.533490011750881e-07,
"loss": 5.7918,
"step": 2100
},
{
"epoch": 1.2338425381903644,
"eval_loss": 1.4744936227798462,
"eval_runtime": 67.3793,
"eval_samples_per_second": 21.283,
"eval_steps_per_second": 2.671,
"step": 2100
},
{
"epoch": 1.2397179788484136,
"grad_norm": 1.8948485851287842,
"learning_rate": 7.521739130434782e-07,
"loss": 6.0362,
"step": 2110
},
{
"epoch": 1.245593419506463,
"grad_norm": 1.8872965574264526,
"learning_rate": 7.509988249118684e-07,
"loss": 5.8342,
"step": 2120
},
{
"epoch": 1.2514688601645123,
"grad_norm": 1.5916881561279297,
"learning_rate": 7.498237367802584e-07,
"loss": 5.8995,
"step": 2130
},
{
"epoch": 1.2573443008225618,
"grad_norm": 1.6878283023834229,
"learning_rate": 7.486486486486486e-07,
"loss": 5.79,
"step": 2140
},
{
"epoch": 1.263219741480611,
"grad_norm": 1.6764466762542725,
"learning_rate": 7.474735605170387e-07,
"loss": 5.9001,
"step": 2150
},
{
"epoch": 1.263219741480611,
"eval_loss": 1.4742045402526855,
"eval_runtime": 67.3898,
"eval_samples_per_second": 21.279,
"eval_steps_per_second": 2.671,
"step": 2150
},
{
"epoch": 1.2690951821386605,
"grad_norm": 1.6931419372558594,
"learning_rate": 7.462984723854289e-07,
"loss": 6.0569,
"step": 2160
},
{
"epoch": 1.2749706227967097,
"grad_norm": 1.604083776473999,
"learning_rate": 7.45123384253819e-07,
"loss": 6.0979,
"step": 2170
},
{
"epoch": 1.2808460634547592,
"grad_norm": 1.7342679500579834,
"learning_rate": 7.439482961222091e-07,
"loss": 5.771,
"step": 2180
},
{
"epoch": 1.2867215041128084,
"grad_norm": 1.5740374326705933,
"learning_rate": 7.427732079905993e-07,
"loss": 6.0591,
"step": 2190
},
{
"epoch": 1.2925969447708578,
"grad_norm": 1.7753512859344482,
"learning_rate": 7.415981198589893e-07,
"loss": 5.839,
"step": 2200
},
{
"epoch": 1.2925969447708578,
"eval_loss": 1.473833680152893,
"eval_runtime": 67.3634,
"eval_samples_per_second": 21.288,
"eval_steps_per_second": 2.672,
"step": 2200
},
{
"epoch": 1.2984723854289073,
"grad_norm": 1.9094125032424927,
"learning_rate": 7.404230317273795e-07,
"loss": 5.9792,
"step": 2210
},
{
"epoch": 1.3043478260869565,
"grad_norm": 1.6728532314300537,
"learning_rate": 7.392479435957697e-07,
"loss": 5.9578,
"step": 2220
},
{
"epoch": 1.3102232667450058,
"grad_norm": 1.6236289739608765,
"learning_rate": 7.380728554641597e-07,
"loss": 5.742,
"step": 2230
},
{
"epoch": 1.3160987074030552,
"grad_norm": 1.7581902742385864,
"learning_rate": 7.368977673325499e-07,
"loss": 6.0485,
"step": 2240
},
{
"epoch": 1.3219741480611047,
"grad_norm": 1.5793126821517944,
"learning_rate": 7.3572267920094e-07,
"loss": 5.8889,
"step": 2250
},
{
"epoch": 1.3219741480611047,
"eval_loss": 1.4734312295913696,
"eval_runtime": 67.3603,
"eval_samples_per_second": 21.288,
"eval_steps_per_second": 2.672,
"step": 2250
},
{
"epoch": 1.327849588719154,
"grad_norm": 1.8450642824172974,
"learning_rate": 7.345475910693301e-07,
"loss": 5.8915,
"step": 2260
},
{
"epoch": 1.3337250293772032,
"grad_norm": 1.5437251329421997,
"learning_rate": 7.333725029377203e-07,
"loss": 6.0109,
"step": 2270
},
{
"epoch": 1.3396004700352526,
"grad_norm": 1.9785826206207275,
"learning_rate": 7.321974148061105e-07,
"loss": 6.0857,
"step": 2280
},
{
"epoch": 1.345475910693302,
"grad_norm": 1.6962827444076538,
"learning_rate": 7.310223266745006e-07,
"loss": 6.0538,
"step": 2290
},
{
"epoch": 1.3513513513513513,
"grad_norm": 1.6559593677520752,
"learning_rate": 7.298472385428907e-07,
"loss": 5.8229,
"step": 2300
},
{
"epoch": 1.3513513513513513,
"eval_loss": 1.473131537437439,
"eval_runtime": 67.3467,
"eval_samples_per_second": 21.293,
"eval_steps_per_second": 2.673,
"step": 2300
},
{
"epoch": 1.3572267920094008,
"grad_norm": 1.7718429565429688,
"learning_rate": 7.286721504112809e-07,
"loss": 5.7397,
"step": 2310
},
{
"epoch": 1.36310223266745,
"grad_norm": 2.0191490650177,
"learning_rate": 7.274970622796709e-07,
"loss": 5.8808,
"step": 2320
},
{
"epoch": 1.3689776733254995,
"grad_norm": 1.874172329902649,
"learning_rate": 7.263219741480611e-07,
"loss": 5.8991,
"step": 2330
},
{
"epoch": 1.3748531139835487,
"grad_norm": 2.0867104530334473,
"learning_rate": 7.251468860164513e-07,
"loss": 6.058,
"step": 2340
},
{
"epoch": 1.3807285546415982,
"grad_norm": 1.8972036838531494,
"learning_rate": 7.239717978848413e-07,
"loss": 5.9622,
"step": 2350
},
{
"epoch": 1.3807285546415982,
"eval_loss": 1.4728530645370483,
"eval_runtime": 67.4,
"eval_samples_per_second": 21.276,
"eval_steps_per_second": 2.671,
"step": 2350
},
{
"epoch": 1.3866039952996474,
"grad_norm": 1.6675537824630737,
"learning_rate": 7.227967097532315e-07,
"loss": 5.7922,
"step": 2360
},
{
"epoch": 1.3924794359576969,
"grad_norm": 1.9455453157424927,
"learning_rate": 7.216216216216216e-07,
"loss": 5.7635,
"step": 2370
},
{
"epoch": 1.398354876615746,
"grad_norm": 1.9944945573806763,
"learning_rate": 7.204465334900117e-07,
"loss": 5.9451,
"step": 2380
},
{
"epoch": 1.4042303172737955,
"grad_norm": 1.7845548391342163,
"learning_rate": 7.192714453584019e-07,
"loss": 5.8706,
"step": 2390
},
{
"epoch": 1.410105757931845,
"grad_norm": 1.5239243507385254,
"learning_rate": 7.18096357226792e-07,
"loss": 5.6772,
"step": 2400
},
{
"epoch": 1.410105757931845,
"eval_loss": 1.472511887550354,
"eval_runtime": 67.3938,
"eval_samples_per_second": 21.278,
"eval_steps_per_second": 2.671,
"step": 2400
},
{
"epoch": 1.4159811985898942,
"grad_norm": 1.8625153303146362,
"learning_rate": 7.169212690951821e-07,
"loss": 5.971,
"step": 2410
},
{
"epoch": 1.4218566392479435,
"grad_norm": 1.6709333658218384,
"learning_rate": 7.157461809635722e-07,
"loss": 5.768,
"step": 2420
},
{
"epoch": 1.427732079905993,
"grad_norm": 1.7736382484436035,
"learning_rate": 7.145710928319624e-07,
"loss": 5.9641,
"step": 2430
},
{
"epoch": 1.4336075205640424,
"grad_norm": 1.7415990829467773,
"learning_rate": 7.133960047003526e-07,
"loss": 5.8895,
"step": 2440
},
{
"epoch": 1.4394829612220916,
"grad_norm": 1.5600135326385498,
"learning_rate": 7.122209165687426e-07,
"loss": 5.8265,
"step": 2450
},
{
"epoch": 1.4394829612220916,
"eval_loss": 1.4722115993499756,
"eval_runtime": 67.4064,
"eval_samples_per_second": 21.274,
"eval_steps_per_second": 2.67,
"step": 2450
},
{
"epoch": 1.445358401880141,
"grad_norm": 1.6844279766082764,
"learning_rate": 7.110458284371328e-07,
"loss": 5.9639,
"step": 2460
},
{
"epoch": 1.4512338425381903,
"grad_norm": 2.118544816970825,
"learning_rate": 7.098707403055229e-07,
"loss": 5.8694,
"step": 2470
},
{
"epoch": 1.4571092831962398,
"grad_norm": 2.1383907794952393,
"learning_rate": 7.08695652173913e-07,
"loss": 6.1653,
"step": 2480
},
{
"epoch": 1.462984723854289,
"grad_norm": 1.7942463159561157,
"learning_rate": 7.075205640423031e-07,
"loss": 5.9392,
"step": 2490
},
{
"epoch": 1.4688601645123385,
"grad_norm": 1.9785916805267334,
"learning_rate": 7.063454759106933e-07,
"loss": 5.8598,
"step": 2500
},
{
"epoch": 1.4688601645123385,
"eval_loss": 1.4719326496124268,
"eval_runtime": 70.2328,
"eval_samples_per_second": 20.418,
"eval_steps_per_second": 2.563,
"step": 2500
},
{
"epoch": 1.4747356051703877,
"grad_norm": 1.9141045808792114,
"learning_rate": 7.051703877790834e-07,
"loss": 5.8666,
"step": 2510
},
{
"epoch": 1.4806110458284372,
"grad_norm": 1.8248971700668335,
"learning_rate": 7.039952996474735e-07,
"loss": 5.899,
"step": 2520
},
{
"epoch": 1.4864864864864864,
"grad_norm": 1.5081406831741333,
"learning_rate": 7.028202115158637e-07,
"loss": 5.913,
"step": 2530
},
{
"epoch": 1.4923619271445359,
"grad_norm": 1.5788573026657104,
"learning_rate": 7.016451233842537e-07,
"loss": 5.9105,
"step": 2540
},
{
"epoch": 1.4982373678025853,
"grad_norm": 1.781790018081665,
"learning_rate": 7.004700352526439e-07,
"loss": 5.8894,
"step": 2550
},
{
"epoch": 1.4982373678025853,
"eval_loss": 1.4717662334442139,
"eval_runtime": 67.4015,
"eval_samples_per_second": 21.275,
"eval_steps_per_second": 2.671,
"step": 2550
},
{
"epoch": 1.5041128084606346,
"grad_norm": 1.9443302154541016,
"learning_rate": 6.992949471210341e-07,
"loss": 5.9698,
"step": 2560
},
{
"epoch": 1.5099882491186838,
"grad_norm": 1.4953645467758179,
"learning_rate": 6.981198589894241e-07,
"loss": 5.9081,
"step": 2570
},
{
"epoch": 1.5158636897767332,
"grad_norm": 1.9432063102722168,
"learning_rate": 6.969447708578143e-07,
"loss": 5.7949,
"step": 2580
},
{
"epoch": 1.5217391304347827,
"grad_norm": 2.1520416736602783,
"learning_rate": 6.957696827262044e-07,
"loss": 5.9385,
"step": 2590
},
{
"epoch": 1.527614571092832,
"grad_norm": 1.7321327924728394,
"learning_rate": 6.945945945945945e-07,
"loss": 5.9739,
"step": 2600
},
{
"epoch": 1.527614571092832,
"eval_loss": 1.4715373516082764,
"eval_runtime": 67.3781,
"eval_samples_per_second": 21.283,
"eval_steps_per_second": 2.671,
"step": 2600
},
{
"epoch": 1.5334900117508812,
"grad_norm": 1.9069325923919678,
"learning_rate": 6.934195064629846e-07,
"loss": 6.1236,
"step": 2610
},
{
"epoch": 1.5393654524089306,
"grad_norm": 1.6319619417190552,
"learning_rate": 6.922444183313748e-07,
"loss": 5.8563,
"step": 2620
},
{
"epoch": 1.54524089306698,
"grad_norm": 1.8981560468673706,
"learning_rate": 6.91069330199765e-07,
"loss": 5.8279,
"step": 2630
},
{
"epoch": 1.5511163337250293,
"grad_norm": 1.9158369302749634,
"learning_rate": 6.89894242068155e-07,
"loss": 5.9491,
"step": 2640
},
{
"epoch": 1.5569917743830788,
"grad_norm": 1.7800869941711426,
"learning_rate": 6.887191539365453e-07,
"loss": 5.9947,
"step": 2650
},
{
"epoch": 1.5569917743830788,
"eval_loss": 1.4711698293685913,
"eval_runtime": 67.3987,
"eval_samples_per_second": 21.276,
"eval_steps_per_second": 2.671,
"step": 2650
},
{
"epoch": 1.5628672150411282,
"grad_norm": 1.9000372886657715,
"learning_rate": 6.875440658049353e-07,
"loss": 6.0369,
"step": 2660
},
{
"epoch": 1.5687426556991775,
"grad_norm": 1.7624439001083374,
"learning_rate": 6.863689776733255e-07,
"loss": 6.0012,
"step": 2670
},
{
"epoch": 1.5746180963572267,
"grad_norm": 1.9102165699005127,
"learning_rate": 6.851938895417157e-07,
"loss": 6.0187,
"step": 2680
},
{
"epoch": 1.5804935370152762,
"grad_norm": 1.7985962629318237,
"learning_rate": 6.840188014101057e-07,
"loss": 5.8977,
"step": 2690
},
{
"epoch": 1.5863689776733256,
"grad_norm": 1.7566959857940674,
"learning_rate": 6.828437132784959e-07,
"loss": 5.9648,
"step": 2700
},
{
"epoch": 1.5863689776733256,
"eval_loss": 1.4709213972091675,
"eval_runtime": 67.4381,
"eval_samples_per_second": 21.264,
"eval_steps_per_second": 2.669,
"step": 2700
},
{
"epoch": 1.5922444183313749,
"grad_norm": 1.8974095582962036,
"learning_rate": 6.81668625146886e-07,
"loss": 5.8202,
"step": 2710
},
{
"epoch": 1.598119858989424,
"grad_norm": 1.6938475370407104,
"learning_rate": 6.804935370152761e-07,
"loss": 5.8596,
"step": 2720
},
{
"epoch": 1.6039952996474736,
"grad_norm": 1.7465293407440186,
"learning_rate": 6.793184488836663e-07,
"loss": 5.8589,
"step": 2730
},
{
"epoch": 1.609870740305523,
"grad_norm": 2.00980806350708,
"learning_rate": 6.781433607520564e-07,
"loss": 5.7711,
"step": 2740
},
{
"epoch": 1.6157461809635723,
"grad_norm": 1.6437867879867554,
"learning_rate": 6.769682726204465e-07,
"loss": 5.909,
"step": 2750
},
{
"epoch": 1.6157461809635723,
"eval_loss": 1.4707252979278564,
"eval_runtime": 67.4451,
"eval_samples_per_second": 21.262,
"eval_steps_per_second": 2.669,
"step": 2750
},
{
"epoch": 1.6216216216216215,
"grad_norm": 1.5175350904464722,
"learning_rate": 6.757931844888366e-07,
"loss": 5.9722,
"step": 2760
},
{
"epoch": 1.627497062279671,
"grad_norm": 2.1253652572631836,
"learning_rate": 6.746180963572268e-07,
"loss": 5.9066,
"step": 2770
},
{
"epoch": 1.6333725029377204,
"grad_norm": 2.046537160873413,
"learning_rate": 6.734430082256168e-07,
"loss": 5.8499,
"step": 2780
},
{
"epoch": 1.6392479435957696,
"grad_norm": 1.9087352752685547,
"learning_rate": 6.72267920094007e-07,
"loss": 5.8846,
"step": 2790
},
{
"epoch": 1.6451233842538189,
"grad_norm": 1.858866572380066,
"learning_rate": 6.710928319623972e-07,
"loss": 6.1428,
"step": 2800
},
{
"epoch": 1.6451233842538189,
"eval_loss": 1.4704252481460571,
"eval_runtime": 67.4318,
"eval_samples_per_second": 21.266,
"eval_steps_per_second": 2.669,
"step": 2800
},
{
"epoch": 1.6509988249118686,
"grad_norm": 1.888319492340088,
"learning_rate": 6.699177438307873e-07,
"loss": 5.9711,
"step": 2810
},
{
"epoch": 1.6568742655699178,
"grad_norm": 2.5909926891326904,
"learning_rate": 6.687426556991774e-07,
"loss": 5.8139,
"step": 2820
},
{
"epoch": 1.662749706227967,
"grad_norm": 1.7682013511657715,
"learning_rate": 6.675675675675675e-07,
"loss": 5.8262,
"step": 2830
},
{
"epoch": 1.6686251468860165,
"grad_norm": 1.8746877908706665,
"learning_rate": 6.663924794359577e-07,
"loss": 5.9217,
"step": 2840
},
{
"epoch": 1.674500587544066,
"grad_norm": 1.5268665552139282,
"learning_rate": 6.652173913043478e-07,
"loss": 5.7433,
"step": 2850
},
{
"epoch": 1.674500587544066,
"eval_loss": 1.4701635837554932,
"eval_runtime": 67.5227,
"eval_samples_per_second": 21.237,
"eval_steps_per_second": 2.666,
"step": 2850
},
{
"epoch": 1.6803760282021152,
"grad_norm": 2.257277011871338,
"learning_rate": 6.640423031727379e-07,
"loss": 5.9719,
"step": 2860
},
{
"epoch": 1.6862514688601644,
"grad_norm": 1.724713921546936,
"learning_rate": 6.628672150411281e-07,
"loss": 5.8062,
"step": 2870
},
{
"epoch": 1.6921269095182139,
"grad_norm": 2.0070745944976807,
"learning_rate": 6.616921269095181e-07,
"loss": 5.8094,
"step": 2880
},
{
"epoch": 1.6980023501762633,
"grad_norm": 1.8564118146896362,
"learning_rate": 6.605170387779083e-07,
"loss": 5.9552,
"step": 2890
},
{
"epoch": 1.7038777908343126,
"grad_norm": 1.6099361181259155,
"learning_rate": 6.593419506462985e-07,
"loss": 5.8433,
"step": 2900
},
{
"epoch": 1.7038777908343126,
"eval_loss": 1.4698939323425293,
"eval_runtime": 67.3768,
"eval_samples_per_second": 21.283,
"eval_steps_per_second": 2.672,
"step": 2900
},
{
"epoch": 1.7097532314923618,
"grad_norm": 1.7506616115570068,
"learning_rate": 6.581668625146885e-07,
"loss": 5.8262,
"step": 2910
},
{
"epoch": 1.7156286721504113,
"grad_norm": 1.6937963962554932,
"learning_rate": 6.569917743830787e-07,
"loss": 5.753,
"step": 2920
},
{
"epoch": 1.7215041128084607,
"grad_norm": 1.9550119638442993,
"learning_rate": 6.558166862514688e-07,
"loss": 6.082,
"step": 2930
},
{
"epoch": 1.72737955346651,
"grad_norm": 1.9541058540344238,
"learning_rate": 6.546415981198589e-07,
"loss": 5.94,
"step": 2940
},
{
"epoch": 1.7332549941245592,
"grad_norm": 1.8375394344329834,
"learning_rate": 6.53466509988249e-07,
"loss": 6.0372,
"step": 2950
},
{
"epoch": 1.7332549941245592,
"eval_loss": 1.4696645736694336,
"eval_runtime": 68.3981,
"eval_samples_per_second": 20.965,
"eval_steps_per_second": 2.632,
"step": 2950
},
{
"epoch": 1.7391304347826086,
"grad_norm": 1.9922813177108765,
"learning_rate": 6.522914218566392e-07,
"loss": 6.1165,
"step": 2960
},
{
"epoch": 1.745005875440658,
"grad_norm": 1.6892035007476807,
"learning_rate": 6.511163337250293e-07,
"loss": 5.9984,
"step": 2970
},
{
"epoch": 1.7508813160987073,
"grad_norm": 1.7739448547363281,
"learning_rate": 6.499412455934194e-07,
"loss": 6.054,
"step": 2980
},
{
"epoch": 1.7567567567567568,
"grad_norm": 1.658884882926941,
"learning_rate": 6.487661574618097e-07,
"loss": 5.983,
"step": 2990
},
{
"epoch": 1.7626321974148063,
"grad_norm": 1.8757832050323486,
"learning_rate": 6.475910693301997e-07,
"loss": 5.9327,
"step": 3000
},
{
"epoch": 1.7626321974148063,
"eval_loss": 1.469561219215393,
"eval_runtime": 67.5038,
"eval_samples_per_second": 21.243,
"eval_steps_per_second": 2.667,
"step": 3000
},
{
"epoch": 1.7685076380728555,
"grad_norm": 1.6837679147720337,
"learning_rate": 6.464159811985899e-07,
"loss": 5.8991,
"step": 3010
},
{
"epoch": 1.7743830787309047,
"grad_norm": 1.7924985885620117,
"learning_rate": 6.452408930669801e-07,
"loss": 6.0283,
"step": 3020
},
{
"epoch": 1.7802585193889542,
"grad_norm": 1.6187570095062256,
"learning_rate": 6.440658049353701e-07,
"loss": 5.8629,
"step": 3030
},
{
"epoch": 1.7861339600470036,
"grad_norm": 1.851152777671814,
"learning_rate": 6.428907168037603e-07,
"loss": 5.9834,
"step": 3040
},
{
"epoch": 1.7920094007050529,
"grad_norm": 1.9718443155288696,
"learning_rate": 6.417156286721504e-07,
"loss": 5.9162,
"step": 3050
},
{
"epoch": 1.7920094007050529,
"eval_loss": 1.469072937965393,
"eval_runtime": 67.5637,
"eval_samples_per_second": 21.224,
"eval_steps_per_second": 2.664,
"step": 3050
},
{
"epoch": 1.7978848413631021,
"grad_norm": 1.7449281215667725,
"learning_rate": 6.405405405405405e-07,
"loss": 5.7984,
"step": 3060
},
{
"epoch": 1.8037602820211516,
"grad_norm": 1.8318501710891724,
"learning_rate": 6.393654524089307e-07,
"loss": 5.9781,
"step": 3070
},
{
"epoch": 1.809635722679201,
"grad_norm": 2.28659987449646,
"learning_rate": 6.381903642773208e-07,
"loss": 5.9832,
"step": 3080
},
{
"epoch": 1.8155111633372503,
"grad_norm": 2.0227696895599365,
"learning_rate": 6.370152761457109e-07,
"loss": 6.1062,
"step": 3090
},
{
"epoch": 1.8213866039952995,
"grad_norm": 1.8883931636810303,
"learning_rate": 6.35840188014101e-07,
"loss": 5.9535,
"step": 3100
},
{
"epoch": 1.8213866039952995,
"eval_loss": 1.469115138053894,
"eval_runtime": 67.5527,
"eval_samples_per_second": 21.228,
"eval_steps_per_second": 2.665,
"step": 3100
},
{
"epoch": 1.827262044653349,
"grad_norm": 1.8074959516525269,
"learning_rate": 6.346650998824912e-07,
"loss": 5.9359,
"step": 3110
},
{
"epoch": 1.8331374853113984,
"grad_norm": 1.8197052478790283,
"learning_rate": 6.334900117508812e-07,
"loss": 5.9669,
"step": 3120
},
{
"epoch": 1.8390129259694477,
"grad_norm": 2.2025105953216553,
"learning_rate": 6.323149236192714e-07,
"loss": 6.0365,
"step": 3130
},
{
"epoch": 1.8448883666274971,
"grad_norm": 1.7041133642196655,
"learning_rate": 6.311398354876616e-07,
"loss": 5.7503,
"step": 3140
},
{
"epoch": 1.8507638072855466,
"grad_norm": 1.7134292125701904,
"learning_rate": 6.299647473560517e-07,
"loss": 5.8262,
"step": 3150
},
{
"epoch": 1.8507638072855466,
"eval_loss": 1.4687591791152954,
"eval_runtime": 67.5398,
"eval_samples_per_second": 21.232,
"eval_steps_per_second": 2.665,
"step": 3150
},
{
"epoch": 1.8566392479435958,
"grad_norm": 1.691468596458435,
"learning_rate": 6.287896592244418e-07,
"loss": 6.0252,
"step": 3160
},
{
"epoch": 1.862514688601645,
"grad_norm": 2.009781837463379,
"learning_rate": 6.276145710928319e-07,
"loss": 5.9691,
"step": 3170
},
{
"epoch": 1.8683901292596945,
"grad_norm": 1.7237638235092163,
"learning_rate": 6.264394829612221e-07,
"loss": 5.9849,
"step": 3180
},
{
"epoch": 1.874265569917744,
"grad_norm": 1.611922264099121,
"learning_rate": 6.252643948296122e-07,
"loss": 5.8563,
"step": 3190
},
{
"epoch": 1.8801410105757932,
"grad_norm": 1.808998703956604,
"learning_rate": 6.240893066980023e-07,
"loss": 6.1277,
"step": 3200
},
{
"epoch": 1.8801410105757932,
"eval_loss": 1.468484878540039,
"eval_runtime": 67.6509,
"eval_samples_per_second": 21.197,
"eval_steps_per_second": 2.661,
"step": 3200
},
{
"epoch": 1.8860164512338424,
"grad_norm": 1.6996632814407349,
"learning_rate": 6.229142185663925e-07,
"loss": 5.9768,
"step": 3210
},
{
"epoch": 1.8918918918918919,
"grad_norm": 1.8977118730545044,
"learning_rate": 6.217391304347825e-07,
"loss": 5.8365,
"step": 3220
},
{
"epoch": 1.8977673325499413,
"grad_norm": 1.71300208568573,
"learning_rate": 6.205640423031727e-07,
"loss": 5.8048,
"step": 3230
},
{
"epoch": 1.9036427732079906,
"grad_norm": 1.83664870262146,
"learning_rate": 6.193889541715629e-07,
"loss": 5.87,
"step": 3240
},
{
"epoch": 1.9095182138660398,
"grad_norm": 1.8034873008728027,
"learning_rate": 6.182138660399529e-07,
"loss": 5.9079,
"step": 3250
},
{
"epoch": 1.9095182138660398,
"eval_loss": 1.4684431552886963,
"eval_runtime": 67.6943,
"eval_samples_per_second": 21.183,
"eval_steps_per_second": 2.659,
"step": 3250
},
{
"epoch": 1.9153936545240893,
"grad_norm": 1.6270906925201416,
"learning_rate": 6.170387779083431e-07,
"loss": 5.9307,
"step": 3260
},
{
"epoch": 1.9212690951821387,
"grad_norm": 1.9603782892227173,
"learning_rate": 6.158636897767332e-07,
"loss": 5.8802,
"step": 3270
},
{
"epoch": 1.927144535840188,
"grad_norm": 1.7977780103683472,
"learning_rate": 6.146886016451233e-07,
"loss": 5.9755,
"step": 3280
},
{
"epoch": 1.9330199764982372,
"grad_norm": 1.9165523052215576,
"learning_rate": 6.135135135135134e-07,
"loss": 5.9277,
"step": 3290
},
{
"epoch": 1.9388954171562869,
"grad_norm": 1.881980061531067,
"learning_rate": 6.123384253819036e-07,
"loss": 5.932,
"step": 3300
},
{
"epoch": 1.9388954171562869,
"eval_loss": 1.4681587219238281,
"eval_runtime": 67.5744,
"eval_samples_per_second": 21.221,
"eval_steps_per_second": 2.664,
"step": 3300
},
{
"epoch": 1.9447708578143361,
"grad_norm": 1.837111234664917,
"learning_rate": 6.111633372502937e-07,
"loss": 5.8813,
"step": 3310
},
{
"epoch": 1.9506462984723854,
"grad_norm": 1.781909465789795,
"learning_rate": 6.099882491186838e-07,
"loss": 5.891,
"step": 3320
},
{
"epoch": 1.9565217391304348,
"grad_norm": 1.9645850658416748,
"learning_rate": 6.088131609870741e-07,
"loss": 5.8671,
"step": 3330
},
{
"epoch": 1.9623971797884843,
"grad_norm": 2.163180112838745,
"learning_rate": 6.07638072855464e-07,
"loss": 5.9638,
"step": 3340
},
{
"epoch": 1.9682726204465335,
"grad_norm": 2.026726007461548,
"learning_rate": 6.064629847238543e-07,
"loss": 5.9407,
"step": 3350
},
{
"epoch": 1.9682726204465335,
"eval_loss": 1.4679971933364868,
"eval_runtime": 67.7006,
"eval_samples_per_second": 21.181,
"eval_steps_per_second": 2.659,
"step": 3350
},
{
"epoch": 1.9741480611045827,
"grad_norm": 1.7907665967941284,
"learning_rate": 6.052878965922445e-07,
"loss": 5.8758,
"step": 3360
},
{
"epoch": 1.9800235017626322,
"grad_norm": 1.534509539604187,
"learning_rate": 6.041128084606345e-07,
"loss": 5.9446,
"step": 3370
},
{
"epoch": 1.9858989424206817,
"grad_norm": 2.1159238815307617,
"learning_rate": 6.029377203290247e-07,
"loss": 5.9475,
"step": 3380
},
{
"epoch": 1.991774383078731,
"grad_norm": 1.6477874517440796,
"learning_rate": 6.017626321974148e-07,
"loss": 5.905,
"step": 3390
},
{
"epoch": 1.9976498237367801,
"grad_norm": 1.7018089294433594,
"learning_rate": 6.005875440658049e-07,
"loss": 6.0155,
"step": 3400
},
{
"epoch": 1.9976498237367801,
"eval_loss": 1.4677451848983765,
"eval_runtime": 67.3618,
"eval_samples_per_second": 21.288,
"eval_steps_per_second": 2.672,
"step": 3400
},
{
"epoch": 2.00352526439483,
"grad_norm": 2.056706190109253,
"learning_rate": 5.99412455934195e-07,
"loss": 5.9612,
"step": 3410
},
{
"epoch": 2.009400705052879,
"grad_norm": 1.9465574026107788,
"learning_rate": 5.982373678025852e-07,
"loss": 5.7667,
"step": 3420
},
{
"epoch": 2.0152761457109283,
"grad_norm": 1.745105266571045,
"learning_rate": 5.970622796709754e-07,
"loss": 6.0523,
"step": 3430
},
{
"epoch": 2.0211515863689775,
"grad_norm": 1.695147156715393,
"learning_rate": 5.958871915393654e-07,
"loss": 5.9134,
"step": 3440
},
{
"epoch": 2.027027027027027,
"grad_norm": 1.5801490545272827,
"learning_rate": 5.947121034077556e-07,
"loss": 5.7663,
"step": 3450
},
{
"epoch": 2.027027027027027,
"eval_loss": 1.467654824256897,
"eval_runtime": 67.3107,
"eval_samples_per_second": 21.304,
"eval_steps_per_second": 2.674,
"step": 3450
},
{
"epoch": 2.0329024676850764,
"grad_norm": 1.7473292350769043,
"learning_rate": 5.935370152761457e-07,
"loss": 5.7892,
"step": 3460
},
{
"epoch": 2.0387779083431257,
"grad_norm": 1.7656643390655518,
"learning_rate": 5.923619271445358e-07,
"loss": 5.7947,
"step": 3470
},
{
"epoch": 2.044653349001175,
"grad_norm": 1.8827358484268188,
"learning_rate": 5.91186839012926e-07,
"loss": 5.8024,
"step": 3480
},
{
"epoch": 2.0505287896592246,
"grad_norm": 2.413665771484375,
"learning_rate": 5.900117508813161e-07,
"loss": 5.8395,
"step": 3490
},
{
"epoch": 2.056404230317274,
"grad_norm": 1.7899099588394165,
"learning_rate": 5.888366627497062e-07,
"loss": 5.8906,
"step": 3500
},
{
"epoch": 2.056404230317274,
"eval_loss": 1.4674228429794312,
"eval_runtime": 67.4193,
"eval_samples_per_second": 21.27,
"eval_steps_per_second": 2.67,
"step": 3500
},
{
"epoch": 2.062279670975323,
"grad_norm": 1.7669270038604736,
"learning_rate": 5.876615746180963e-07,
"loss": 6.0558,
"step": 3510
},
{
"epoch": 2.0681551116333723,
"grad_norm": 1.7801496982574463,
"learning_rate": 5.864864864864865e-07,
"loss": 5.6794,
"step": 3520
},
{
"epoch": 2.074030552291422,
"grad_norm": 2.059295415878296,
"learning_rate": 5.853113983548766e-07,
"loss": 5.8377,
"step": 3530
},
{
"epoch": 2.079905992949471,
"grad_norm": 1.7855298519134521,
"learning_rate": 5.841363102232667e-07,
"loss": 5.8119,
"step": 3540
},
{
"epoch": 2.0857814336075204,
"grad_norm": 1.53040611743927,
"learning_rate": 5.829612220916569e-07,
"loss": 6.0381,
"step": 3550
},
{
"epoch": 2.0857814336075204,
"eval_loss": 1.467327356338501,
"eval_runtime": 67.4105,
"eval_samples_per_second": 21.273,
"eval_steps_per_second": 2.67,
"step": 3550
},
{
"epoch": 2.09165687426557,
"grad_norm": 1.7886220216751099,
"learning_rate": 5.817861339600469e-07,
"loss": 5.9189,
"step": 3560
},
{
"epoch": 2.0975323149236194,
"grad_norm": 1.7158267498016357,
"learning_rate": 5.806110458284371e-07,
"loss": 5.8659,
"step": 3570
},
{
"epoch": 2.1034077555816686,
"grad_norm": 1.8124908208847046,
"learning_rate": 5.794359576968272e-07,
"loss": 5.7777,
"step": 3580
},
{
"epoch": 2.109283196239718,
"grad_norm": 1.8852800130844116,
"learning_rate": 5.782608695652173e-07,
"loss": 5.7058,
"step": 3590
},
{
"epoch": 2.1151586368977675,
"grad_norm": 1.8558183908462524,
"learning_rate": 5.770857814336075e-07,
"loss": 6.0992,
"step": 3600
},
{
"epoch": 2.1151586368977675,
"eval_loss": 1.467076063156128,
"eval_runtime": 67.5271,
"eval_samples_per_second": 21.236,
"eval_steps_per_second": 2.666,
"step": 3600
},
{
"epoch": 2.1210340775558167,
"grad_norm": 1.7967942953109741,
"learning_rate": 5.759106933019976e-07,
"loss": 5.9542,
"step": 3610
},
{
"epoch": 2.126909518213866,
"grad_norm": 1.811843752861023,
"learning_rate": 5.747356051703877e-07,
"loss": 5.7699,
"step": 3620
},
{
"epoch": 2.132784958871915,
"grad_norm": 1.774497151374817,
"learning_rate": 5.735605170387778e-07,
"loss": 5.9018,
"step": 3630
},
{
"epoch": 2.138660399529965,
"grad_norm": 1.739669680595398,
"learning_rate": 5.72385428907168e-07,
"loss": 5.855,
"step": 3640
},
{
"epoch": 2.144535840188014,
"grad_norm": 1.8997622728347778,
"learning_rate": 5.712103407755581e-07,
"loss": 5.8494,
"step": 3650
},
{
"epoch": 2.144535840188014,
"eval_loss": 1.4668962955474854,
"eval_runtime": 67.352,
"eval_samples_per_second": 21.291,
"eval_steps_per_second": 2.673,
"step": 3650
},
{
"epoch": 2.1504112808460634,
"grad_norm": 2.079676389694214,
"learning_rate": 5.700352526439482e-07,
"loss": 5.9762,
"step": 3660
},
{
"epoch": 2.1562867215041126,
"grad_norm": 1.7779871225357056,
"learning_rate": 5.688601645123385e-07,
"loss": 5.895,
"step": 3670
},
{
"epoch": 2.1621621621621623,
"grad_norm": 1.5973154306411743,
"learning_rate": 5.676850763807284e-07,
"loss": 5.9583,
"step": 3680
},
{
"epoch": 2.1680376028202115,
"grad_norm": 1.6692899465560913,
"learning_rate": 5.665099882491187e-07,
"loss": 5.874,
"step": 3690
},
{
"epoch": 2.1739130434782608,
"grad_norm": 1.9078632593154907,
"learning_rate": 5.653349001175089e-07,
"loss": 5.9224,
"step": 3700
},
{
"epoch": 2.1739130434782608,
"eval_loss": 1.466797947883606,
"eval_runtime": 67.3337,
"eval_samples_per_second": 21.297,
"eval_steps_per_second": 2.673,
"step": 3700
},
{
"epoch": 2.17978848413631,
"grad_norm": 1.675715684890747,
"learning_rate": 5.641598119858989e-07,
"loss": 5.9647,
"step": 3710
},
{
"epoch": 2.1856639247943597,
"grad_norm": 2.0339181423187256,
"learning_rate": 5.629847238542891e-07,
"loss": 5.8245,
"step": 3720
},
{
"epoch": 2.191539365452409,
"grad_norm": 1.6942006349563599,
"learning_rate": 5.618096357226792e-07,
"loss": 5.9127,
"step": 3730
},
{
"epoch": 2.197414806110458,
"grad_norm": 1.82574462890625,
"learning_rate": 5.606345475910693e-07,
"loss": 5.8228,
"step": 3740
},
{
"epoch": 2.203290246768508,
"grad_norm": 1.7962678670883179,
"learning_rate": 5.594594594594594e-07,
"loss": 6.043,
"step": 3750
},
{
"epoch": 2.203290246768508,
"eval_loss": 1.4665814638137817,
"eval_runtime": 70.2464,
"eval_samples_per_second": 20.414,
"eval_steps_per_second": 2.562,
"step": 3750
},
{
"epoch": 2.209165687426557,
"grad_norm": 1.7127306461334229,
"learning_rate": 5.582843713278496e-07,
"loss": 5.9409,
"step": 3760
},
{
"epoch": 2.2150411280846063,
"grad_norm": 1.6787141561508179,
"learning_rate": 5.571092831962398e-07,
"loss": 5.9635,
"step": 3770
},
{
"epoch": 2.2209165687426555,
"grad_norm": 1.8650240898132324,
"learning_rate": 5.559341950646298e-07,
"loss": 5.9097,
"step": 3780
},
{
"epoch": 2.226792009400705,
"grad_norm": 1.9650366306304932,
"learning_rate": 5.5475910693302e-07,
"loss": 5.9976,
"step": 3790
},
{
"epoch": 2.2326674500587544,
"grad_norm": 2.1691102981567383,
"learning_rate": 5.535840188014101e-07,
"loss": 5.8537,
"step": 3800
},
{
"epoch": 2.2326674500587544,
"eval_loss": 1.4663869142532349,
"eval_runtime": 67.3836,
"eval_samples_per_second": 21.281,
"eval_steps_per_second": 2.671,
"step": 3800
},
{
"epoch": 2.2385428907168037,
"grad_norm": 1.642232060432434,
"learning_rate": 5.524089306698002e-07,
"loss": 5.8476,
"step": 3810
},
{
"epoch": 2.244418331374853,
"grad_norm": 2.063124895095825,
"learning_rate": 5.512338425381904e-07,
"loss": 6.0597,
"step": 3820
},
{
"epoch": 2.2502937720329026,
"grad_norm": 1.841054081916809,
"learning_rate": 5.500587544065805e-07,
"loss": 6.0998,
"step": 3830
},
{
"epoch": 2.256169212690952,
"grad_norm": 1.6578458547592163,
"learning_rate": 5.488836662749706e-07,
"loss": 6.0319,
"step": 3840
},
{
"epoch": 2.262044653349001,
"grad_norm": 1.8542330265045166,
"learning_rate": 5.477085781433607e-07,
"loss": 5.9107,
"step": 3850
},
{
"epoch": 2.262044653349001,
"eval_loss": 1.4663937091827393,
"eval_runtime": 67.8634,
"eval_samples_per_second": 21.131,
"eval_steps_per_second": 2.652,
"step": 3850
},
{
"epoch": 2.2679200940070503,
"grad_norm": 1.8425204753875732,
"learning_rate": 5.465334900117509e-07,
"loss": 5.788,
"step": 3860
},
{
"epoch": 2.2737955346651,
"grad_norm": 1.9576416015625,
"learning_rate": 5.45358401880141e-07,
"loss": 5.7692,
"step": 3870
},
{
"epoch": 2.279670975323149,
"grad_norm": 1.6908799409866333,
"learning_rate": 5.441833137485311e-07,
"loss": 5.7556,
"step": 3880
},
{
"epoch": 2.2855464159811985,
"grad_norm": 1.787754774093628,
"learning_rate": 5.430082256169213e-07,
"loss": 5.8563,
"step": 3890
},
{
"epoch": 2.291421856639248,
"grad_norm": 1.9981508255004883,
"learning_rate": 5.418331374853113e-07,
"loss": 5.8377,
"step": 3900
},
{
"epoch": 2.291421856639248,
"eval_loss": 1.4661545753479004,
"eval_runtime": 67.3909,
"eval_samples_per_second": 21.279,
"eval_steps_per_second": 2.671,
"step": 3900
},
{
"epoch": 2.2972972972972974,
"grad_norm": 2.019265651702881,
"learning_rate": 5.406580493537015e-07,
"loss": 5.8725,
"step": 3910
},
{
"epoch": 2.3031727379553466,
"grad_norm": 2.1026248931884766,
"learning_rate": 5.394829612220916e-07,
"loss": 5.6895,
"step": 3920
},
{
"epoch": 2.309048178613396,
"grad_norm": 2.0098109245300293,
"learning_rate": 5.383078730904817e-07,
"loss": 5.9395,
"step": 3930
},
{
"epoch": 2.3149236192714455,
"grad_norm": 1.9912086725234985,
"learning_rate": 5.371327849588719e-07,
"loss": 5.8199,
"step": 3940
},
{
"epoch": 2.3207990599294948,
"grad_norm": 1.8740649223327637,
"learning_rate": 5.35957696827262e-07,
"loss": 5.9611,
"step": 3950
},
{
"epoch": 2.3207990599294948,
"eval_loss": 1.4659883975982666,
"eval_runtime": 67.3181,
"eval_samples_per_second": 21.302,
"eval_steps_per_second": 2.674,
"step": 3950
},
{
"epoch": 2.326674500587544,
"grad_norm": 1.4131051301956177,
"learning_rate": 5.347826086956521e-07,
"loss": 5.8967,
"step": 3960
},
{
"epoch": 2.3325499412455932,
"grad_norm": 1.7178343534469604,
"learning_rate": 5.336075205640422e-07,
"loss": 5.8699,
"step": 3970
},
{
"epoch": 2.338425381903643,
"grad_norm": 1.9381266832351685,
"learning_rate": 5.324324324324324e-07,
"loss": 6.014,
"step": 3980
},
{
"epoch": 2.344300822561692,
"grad_norm": 1.8134095668792725,
"learning_rate": 5.312573443008225e-07,
"loss": 5.7731,
"step": 3990
},
{
"epoch": 2.3501762632197414,
"grad_norm": 1.9413225650787354,
"learning_rate": 5.300822561692126e-07,
"loss": 5.8098,
"step": 4000
},
{
"epoch": 2.3501762632197414,
"eval_loss": 1.4658437967300415,
"eval_runtime": 67.3732,
"eval_samples_per_second": 21.284,
"eval_steps_per_second": 2.672,
"step": 4000
},
{
"epoch": 2.3560517038777906,
"grad_norm": 1.762492299079895,
"learning_rate": 5.289071680376028e-07,
"loss": 5.9946,
"step": 4010
},
{
"epoch": 2.3619271445358403,
"grad_norm": 1.657081127166748,
"learning_rate": 5.277320799059928e-07,
"loss": 5.8473,
"step": 4020
},
{
"epoch": 2.3678025851938895,
"grad_norm": 1.9021812677383423,
"learning_rate": 5.26556991774383e-07,
"loss": 6.0927,
"step": 4030
},
{
"epoch": 2.3736780258519388,
"grad_norm": 1.7664687633514404,
"learning_rate": 5.253819036427733e-07,
"loss": 5.6985,
"step": 4040
},
{
"epoch": 2.3795534665099884,
"grad_norm": 2.071560859680176,
"learning_rate": 5.242068155111633e-07,
"loss": 5.8251,
"step": 4050
},
{
"epoch": 2.3795534665099884,
"eval_loss": 1.4657713174819946,
"eval_runtime": 67.3816,
"eval_samples_per_second": 21.282,
"eval_steps_per_second": 2.671,
"step": 4050
},
{
"epoch": 2.3854289071680377,
"grad_norm": 1.715277075767517,
"learning_rate": 5.230317273795535e-07,
"loss": 6.0299,
"step": 4060
},
{
"epoch": 2.391304347826087,
"grad_norm": 1.7600971460342407,
"learning_rate": 5.218566392479436e-07,
"loss": 5.7579,
"step": 4070
},
{
"epoch": 2.397179788484136,
"grad_norm": 2.067085027694702,
"learning_rate": 5.206815511163337e-07,
"loss": 5.9357,
"step": 4080
},
{
"epoch": 2.403055229142186,
"grad_norm": 1.6616854667663574,
"learning_rate": 5.195064629847238e-07,
"loss": 5.8101,
"step": 4090
},
{
"epoch": 2.408930669800235,
"grad_norm": 1.7067201137542725,
"learning_rate": 5.18331374853114e-07,
"loss": 5.9347,
"step": 4100
},
{
"epoch": 2.408930669800235,
"eval_loss": 1.465532898902893,
"eval_runtime": 67.3821,
"eval_samples_per_second": 21.282,
"eval_steps_per_second": 2.671,
"step": 4100
},
{
"epoch": 2.4148061104582843,
"grad_norm": 2.5587124824523926,
"learning_rate": 5.171562867215042e-07,
"loss": 5.9894,
"step": 4110
},
{
"epoch": 2.4206815511163335,
"grad_norm": 1.795381784439087,
"learning_rate": 5.159811985898942e-07,
"loss": 5.8384,
"step": 4120
},
{
"epoch": 2.426556991774383,
"grad_norm": 2.450474500656128,
"learning_rate": 5.148061104582844e-07,
"loss": 5.885,
"step": 4130
},
{
"epoch": 2.4324324324324325,
"grad_norm": 1.8166522979736328,
"learning_rate": 5.136310223266745e-07,
"loss": 5.8504,
"step": 4140
},
{
"epoch": 2.4383078730904817,
"grad_norm": 1.6221665143966675,
"learning_rate": 5.124559341950646e-07,
"loss": 5.9535,
"step": 4150
},
{
"epoch": 2.4383078730904817,
"eval_loss": 1.4654651880264282,
"eval_runtime": 67.324,
"eval_samples_per_second": 21.3,
"eval_steps_per_second": 2.674,
"step": 4150
},
{
"epoch": 2.444183313748531,
"grad_norm": 1.6266223192214966,
"learning_rate": 5.112808460634548e-07,
"loss": 5.9099,
"step": 4160
},
{
"epoch": 2.4500587544065806,
"grad_norm": 1.839812994003296,
"learning_rate": 5.101057579318449e-07,
"loss": 6.0562,
"step": 4170
},
{
"epoch": 2.45593419506463,
"grad_norm": 1.6507972478866577,
"learning_rate": 5.08930669800235e-07,
"loss": 5.9426,
"step": 4180
},
{
"epoch": 2.461809635722679,
"grad_norm": 2.02901554107666,
"learning_rate": 5.077555816686251e-07,
"loss": 5.8951,
"step": 4190
},
{
"epoch": 2.4676850763807288,
"grad_norm": 1.8781306743621826,
"learning_rate": 5.065804935370153e-07,
"loss": 5.9792,
"step": 4200
},
{
"epoch": 2.4676850763807288,
"eval_loss": 1.46532142162323,
"eval_runtime": 68.0363,
"eval_samples_per_second": 21.077,
"eval_steps_per_second": 2.646,
"step": 4200
},
{
"epoch": 2.473560517038778,
"grad_norm": 2.0996501445770264,
"learning_rate": 5.054054054054053e-07,
"loss": 5.9635,
"step": 4210
},
{
"epoch": 2.4794359576968272,
"grad_norm": 1.8582676649093628,
"learning_rate": 5.042303172737955e-07,
"loss": 5.7168,
"step": 4220
},
{
"epoch": 2.4853113983548765,
"grad_norm": 2.0282630920410156,
"learning_rate": 5.030552291421857e-07,
"loss": 5.8186,
"step": 4230
},
{
"epoch": 2.491186839012926,
"grad_norm": 1.7468255758285522,
"learning_rate": 5.018801410105757e-07,
"loss": 5.8905,
"step": 4240
},
{
"epoch": 2.4970622796709754,
"grad_norm": 1.6229472160339355,
"learning_rate": 5.007050528789659e-07,
"loss": 5.7106,
"step": 4250
},
{
"epoch": 2.4970622796709754,
"eval_loss": 1.4651542901992798,
"eval_runtime": 67.3322,
"eval_samples_per_second": 21.297,
"eval_steps_per_second": 2.673,
"step": 4250
},
{
"epoch": 2.5029377203290246,
"grad_norm": 1.912929654121399,
"learning_rate": 4.99529964747356e-07,
"loss": 5.9134,
"step": 4260
},
{
"epoch": 2.5088131609870743,
"grad_norm": 2.1273841857910156,
"learning_rate": 4.983548766157461e-07,
"loss": 6.0254,
"step": 4270
},
{
"epoch": 2.5146886016451235,
"grad_norm": 1.7473537921905518,
"learning_rate": 4.971797884841363e-07,
"loss": 5.7731,
"step": 4280
},
{
"epoch": 2.5205640423031728,
"grad_norm": 1.8446624279022217,
"learning_rate": 4.960047003525264e-07,
"loss": 5.5428,
"step": 4290
},
{
"epoch": 2.526439482961222,
"grad_norm": 1.9221971035003662,
"learning_rate": 4.948296122209165e-07,
"loss": 5.9076,
"step": 4300
},
{
"epoch": 2.526439482961222,
"eval_loss": 1.4649547338485718,
"eval_runtime": 67.4292,
"eval_samples_per_second": 21.267,
"eval_steps_per_second": 2.669,
"step": 4300
},
{
"epoch": 2.5323149236192712,
"grad_norm": 1.844045877456665,
"learning_rate": 4.936545240893067e-07,
"loss": 5.9249,
"step": 4310
},
{
"epoch": 2.538190364277321,
"grad_norm": 1.7555588483810425,
"learning_rate": 4.924794359576968e-07,
"loss": 5.8795,
"step": 4320
},
{
"epoch": 2.54406580493537,
"grad_norm": 1.904198408126831,
"learning_rate": 4.913043478260869e-07,
"loss": 5.9253,
"step": 4330
},
{
"epoch": 2.5499412455934194,
"grad_norm": 1.6488707065582275,
"learning_rate": 4.90129259694477e-07,
"loss": 5.7982,
"step": 4340
},
{
"epoch": 2.555816686251469,
"grad_norm": 1.6343579292297363,
"learning_rate": 4.889541715628671e-07,
"loss": 5.8531,
"step": 4350
},
{
"epoch": 2.555816686251469,
"eval_loss": 1.4648929834365845,
"eval_runtime": 67.3567,
"eval_samples_per_second": 21.29,
"eval_steps_per_second": 2.672,
"step": 4350
},
{
"epoch": 2.5616921269095183,
"grad_norm": 1.8681535720825195,
"learning_rate": 4.877790834312573e-07,
"loss": 5.9276,
"step": 4360
},
{
"epoch": 2.5675675675675675,
"grad_norm": 2.1231424808502197,
"learning_rate": 4.866039952996475e-07,
"loss": 5.9091,
"step": 4370
},
{
"epoch": 2.573443008225617,
"grad_norm": 1.6580970287322998,
"learning_rate": 4.854289071680376e-07,
"loss": 5.9298,
"step": 4380
},
{
"epoch": 2.579318448883666,
"grad_norm": 1.5748720169067383,
"learning_rate": 4.842538190364277e-07,
"loss": 5.9232,
"step": 4390
},
{
"epoch": 2.5851938895417157,
"grad_norm": 1.945760726928711,
"learning_rate": 4.830787309048179e-07,
"loss": 5.8322,
"step": 4400
},
{
"epoch": 2.5851938895417157,
"eval_loss": 1.4647204875946045,
"eval_runtime": 67.3856,
"eval_samples_per_second": 21.281,
"eval_steps_per_second": 2.671,
"step": 4400
},
{
"epoch": 2.591069330199765,
"grad_norm": 1.7735313177108765,
"learning_rate": 4.81903642773208e-07,
"loss": 6.0296,
"step": 4410
},
{
"epoch": 2.5969447708578146,
"grad_norm": 1.6112607717514038,
"learning_rate": 4.807285546415982e-07,
"loss": 5.8741,
"step": 4420
},
{
"epoch": 2.602820211515864,
"grad_norm": 1.7845340967178345,
"learning_rate": 4.795534665099883e-07,
"loss": 5.9611,
"step": 4430
},
{
"epoch": 2.608695652173913,
"grad_norm": 2.0016372203826904,
"learning_rate": 4.783783783783784e-07,
"loss": 5.9482,
"step": 4440
},
{
"epoch": 2.6145710928319623,
"grad_norm": 1.9225436449050903,
"learning_rate": 4.772032902467685e-07,
"loss": 5.897,
"step": 4450
},
{
"epoch": 2.6145710928319623,
"eval_loss": 1.4647117853164673,
"eval_runtime": 67.3807,
"eval_samples_per_second": 21.282,
"eval_steps_per_second": 2.671,
"step": 4450
},
{
"epoch": 2.6204465334900116,
"grad_norm": 1.7982288599014282,
"learning_rate": 4.760282021151586e-07,
"loss": 5.7977,
"step": 4460
},
{
"epoch": 2.6263219741480612,
"grad_norm": 2.0047717094421387,
"learning_rate": 4.748531139835488e-07,
"loss": 5.8034,
"step": 4470
},
{
"epoch": 2.6321974148061105,
"grad_norm": 2.0406343936920166,
"learning_rate": 4.736780258519389e-07,
"loss": 5.8348,
"step": 4480
},
{
"epoch": 2.6380728554641597,
"grad_norm": 1.7326260805130005,
"learning_rate": 4.72502937720329e-07,
"loss": 5.7419,
"step": 4490
},
{
"epoch": 2.6439482961222094,
"grad_norm": 2.017756462097168,
"learning_rate": 4.7132784958871914e-07,
"loss": 5.8776,
"step": 4500
},
{
"epoch": 2.6439482961222094,
"eval_loss": 1.4645116329193115,
"eval_runtime": 67.0576,
"eval_samples_per_second": 21.385,
"eval_steps_per_second": 2.684,
"step": 4500
},
{
"epoch": 2.6498237367802586,
"grad_norm": 1.670611023902893,
"learning_rate": 4.7015276145710924e-07,
"loss": 5.9727,
"step": 4510
},
{
"epoch": 2.655699177438308,
"grad_norm": 1.8651740550994873,
"learning_rate": 4.689776733254994e-07,
"loss": 5.8256,
"step": 4520
},
{
"epoch": 2.661574618096357,
"grad_norm": 1.7110469341278076,
"learning_rate": 4.6780258519388955e-07,
"loss": 5.8413,
"step": 4530
},
{
"epoch": 2.6674500587544063,
"grad_norm": 1.6548104286193848,
"learning_rate": 4.6662749706227965e-07,
"loss": 6.0178,
"step": 4540
},
{
"epoch": 2.673325499412456,
"grad_norm": 1.9871407747268677,
"learning_rate": 4.654524089306698e-07,
"loss": 5.8025,
"step": 4550
},
{
"epoch": 2.673325499412456,
"eval_loss": 1.4644556045532227,
"eval_runtime": 67.0171,
"eval_samples_per_second": 21.398,
"eval_steps_per_second": 2.686,
"step": 4550
},
{
"epoch": 2.6792009400705052,
"grad_norm": 1.7982734441757202,
"learning_rate": 4.642773207990599e-07,
"loss": 5.7593,
"step": 4560
},
{
"epoch": 2.6850763807285545,
"grad_norm": 2.1447372436523438,
"learning_rate": 4.6310223266745e-07,
"loss": 5.8057,
"step": 4570
},
{
"epoch": 2.690951821386604,
"grad_norm": 1.9947744607925415,
"learning_rate": 4.6192714453584016e-07,
"loss": 5.964,
"step": 4580
},
{
"epoch": 2.6968272620446534,
"grad_norm": 2.2180542945861816,
"learning_rate": 4.607520564042303e-07,
"loss": 5.8878,
"step": 4590
},
{
"epoch": 2.7027027027027026,
"grad_norm": 1.5173759460449219,
"learning_rate": 4.595769682726204e-07,
"loss": 5.8811,
"step": 4600
},
{
"epoch": 2.7027027027027026,
"eval_loss": 1.4642778635025024,
"eval_runtime": 69.6554,
"eval_samples_per_second": 20.587,
"eval_steps_per_second": 2.584,
"step": 4600
},
{
"epoch": 2.708578143360752,
"grad_norm": 1.739025354385376,
"learning_rate": 4.5840188014101057e-07,
"loss": 5.893,
"step": 4610
},
{
"epoch": 2.7144535840188015,
"grad_norm": 2.0034613609313965,
"learning_rate": 4.5722679200940067e-07,
"loss": 5.984,
"step": 4620
},
{
"epoch": 2.720329024676851,
"grad_norm": 2.050755739212036,
"learning_rate": 4.5605170387779077e-07,
"loss": 6.0021,
"step": 4630
},
{
"epoch": 2.7262044653349,
"grad_norm": 2.053459644317627,
"learning_rate": 4.54876615746181e-07,
"loss": 5.8983,
"step": 4640
},
{
"epoch": 2.7320799059929497,
"grad_norm": 1.7340502738952637,
"learning_rate": 4.537015276145711e-07,
"loss": 5.9349,
"step": 4650
},
{
"epoch": 2.7320799059929497,
"eval_loss": 1.4640307426452637,
"eval_runtime": 67.1022,
"eval_samples_per_second": 21.37,
"eval_steps_per_second": 2.682,
"step": 4650
},
{
"epoch": 2.737955346650999,
"grad_norm": 2.087167978286743,
"learning_rate": 4.525264394829612e-07,
"loss": 5.9448,
"step": 4660
},
{
"epoch": 2.743830787309048,
"grad_norm": 1.8812017440795898,
"learning_rate": 4.5135135135135134e-07,
"loss": 5.9692,
"step": 4670
},
{
"epoch": 2.7497062279670974,
"grad_norm": 1.7874183654785156,
"learning_rate": 4.5017626321974144e-07,
"loss": 5.8267,
"step": 4680
},
{
"epoch": 2.7555816686251466,
"grad_norm": 2.020829439163208,
"learning_rate": 4.490011750881316e-07,
"loss": 6.0666,
"step": 4690
},
{
"epoch": 2.7614571092831963,
"grad_norm": 1.6772513389587402,
"learning_rate": 4.4782608695652175e-07,
"loss": 5.9288,
"step": 4700
},
{
"epoch": 2.7614571092831963,
"eval_loss": 1.464098572731018,
"eval_runtime": 67.1135,
"eval_samples_per_second": 21.367,
"eval_steps_per_second": 2.682,
"step": 4700
},
{
"epoch": 2.7673325499412456,
"grad_norm": 1.8247939348220825,
"learning_rate": 4.4665099882491185e-07,
"loss": 5.9552,
"step": 4710
},
{
"epoch": 2.773207990599295,
"grad_norm": 2.047966718673706,
"learning_rate": 4.45475910693302e-07,
"loss": 5.9451,
"step": 4720
},
{
"epoch": 2.7790834312573445,
"grad_norm": 1.7807133197784424,
"learning_rate": 4.443008225616921e-07,
"loss": 5.8045,
"step": 4730
},
{
"epoch": 2.7849588719153937,
"grad_norm": 1.7953366041183472,
"learning_rate": 4.431257344300822e-07,
"loss": 5.782,
"step": 4740
},
{
"epoch": 2.790834312573443,
"grad_norm": 1.9604454040527344,
"learning_rate": 4.4195064629847236e-07,
"loss": 6.0679,
"step": 4750
},
{
"epoch": 2.790834312573443,
"eval_loss": 1.4638469219207764,
"eval_runtime": 67.0044,
"eval_samples_per_second": 21.402,
"eval_steps_per_second": 2.686,
"step": 4750
},
{
"epoch": 2.796709753231492,
"grad_norm": 1.9754419326782227,
"learning_rate": 4.407755581668625e-07,
"loss": 5.7528,
"step": 4760
},
{
"epoch": 2.802585193889542,
"grad_norm": 1.7962079048156738,
"learning_rate": 4.396004700352526e-07,
"loss": 5.7068,
"step": 4770
},
{
"epoch": 2.808460634547591,
"grad_norm": 1.7251296043395996,
"learning_rate": 4.3842538190364277e-07,
"loss": 5.7795,
"step": 4780
},
{
"epoch": 2.8143360752056403,
"grad_norm": 1.8542954921722412,
"learning_rate": 4.3725029377203287e-07,
"loss": 5.8237,
"step": 4790
},
{
"epoch": 2.82021151586369,
"grad_norm": 1.9788106679916382,
"learning_rate": 4.3607520564042297e-07,
"loss": 5.9022,
"step": 4800
},
{
"epoch": 2.82021151586369,
"eval_loss": 1.4637619256973267,
"eval_runtime": 67.0549,
"eval_samples_per_second": 21.385,
"eval_steps_per_second": 2.684,
"step": 4800
},
{
"epoch": 2.8260869565217392,
"grad_norm": 1.8251780271530151,
"learning_rate": 4.349001175088131e-07,
"loss": 5.8354,
"step": 4810
},
{
"epoch": 2.8319623971797885,
"grad_norm": 1.8526431322097778,
"learning_rate": 4.337250293772033e-07,
"loss": 5.9148,
"step": 4820
},
{
"epoch": 2.8378378378378377,
"grad_norm": 2.040987730026245,
"learning_rate": 4.3254994124559343e-07,
"loss": 6.0853,
"step": 4830
},
{
"epoch": 2.843713278495887,
"grad_norm": 1.7101026773452759,
"learning_rate": 4.3137485311398354e-07,
"loss": 5.9939,
"step": 4840
},
{
"epoch": 2.8495887191539366,
"grad_norm": 2.0545079708099365,
"learning_rate": 4.3019976498237364e-07,
"loss": 5.7725,
"step": 4850
},
{
"epoch": 2.8495887191539366,
"eval_loss": 1.463710904121399,
"eval_runtime": 67.0425,
"eval_samples_per_second": 21.389,
"eval_steps_per_second": 2.685,
"step": 4850
},
{
"epoch": 2.855464159811986,
"grad_norm": 2.194539785385132,
"learning_rate": 4.290246768507638e-07,
"loss": 6.1075,
"step": 4860
},
{
"epoch": 2.861339600470035,
"grad_norm": 2.0312609672546387,
"learning_rate": 4.2784958871915395e-07,
"loss": 5.8069,
"step": 4870
},
{
"epoch": 2.867215041128085,
"grad_norm": 1.9404051303863525,
"learning_rate": 4.2667450058754405e-07,
"loss": 5.7062,
"step": 4880
},
{
"epoch": 2.873090481786134,
"grad_norm": 1.8269391059875488,
"learning_rate": 4.254994124559342e-07,
"loss": 5.8407,
"step": 4890
},
{
"epoch": 2.8789659224441833,
"grad_norm": 2.041775941848755,
"learning_rate": 4.243243243243243e-07,
"loss": 5.9366,
"step": 4900
},
{
"epoch": 2.8789659224441833,
"eval_loss": 1.4636270999908447,
"eval_runtime": 67.4942,
"eval_samples_per_second": 21.246,
"eval_steps_per_second": 2.667,
"step": 4900
},
{
"epoch": 2.8848413631022325,
"grad_norm": 1.7362725734710693,
"learning_rate": 4.231492361927144e-07,
"loss": 5.7943,
"step": 4910
},
{
"epoch": 2.890716803760282,
"grad_norm": 1.8290835618972778,
"learning_rate": 4.2197414806110456e-07,
"loss": 5.9051,
"step": 4920
},
{
"epoch": 2.8965922444183314,
"grad_norm": 1.716813087463379,
"learning_rate": 4.207990599294947e-07,
"loss": 5.9952,
"step": 4930
},
{
"epoch": 2.9024676850763806,
"grad_norm": 1.7275757789611816,
"learning_rate": 4.196239717978848e-07,
"loss": 5.7364,
"step": 4940
},
{
"epoch": 2.9083431257344303,
"grad_norm": 1.7062081098556519,
"learning_rate": 4.1844888366627497e-07,
"loss": 6.0433,
"step": 4950
},
{
"epoch": 2.9083431257344303,
"eval_loss": 1.4636424779891968,
"eval_runtime": 67.363,
"eval_samples_per_second": 21.288,
"eval_steps_per_second": 2.672,
"step": 4950
},
{
"epoch": 2.9142185663924796,
"grad_norm": 1.8800413608551025,
"learning_rate": 4.1727379553466507e-07,
"loss": 6.0615,
"step": 4960
},
{
"epoch": 2.920094007050529,
"grad_norm": 1.6869240999221802,
"learning_rate": 4.1609870740305517e-07,
"loss": 5.9313,
"step": 4970
},
{
"epoch": 2.925969447708578,
"grad_norm": 1.733893632888794,
"learning_rate": 4.149236192714453e-07,
"loss": 5.8278,
"step": 4980
},
{
"epoch": 2.9318448883666273,
"grad_norm": 2.009671926498413,
"learning_rate": 4.137485311398355e-07,
"loss": 5.931,
"step": 4990
},
{
"epoch": 2.937720329024677,
"grad_norm": 2.2526206970214844,
"learning_rate": 4.1257344300822563e-07,
"loss": 5.8845,
"step": 5000
},
{
"epoch": 2.937720329024677,
"eval_loss": 1.4632807970046997,
"eval_runtime": 69.3633,
"eval_samples_per_second": 20.674,
"eval_steps_per_second": 2.595,
"step": 5000
},
{
"epoch": 2.943595769682726,
"grad_norm": 1.7864453792572021,
"learning_rate": 4.1139835487661573e-07,
"loss": 5.767,
"step": 5010
},
{
"epoch": 2.9494712103407754,
"grad_norm": 1.755837082862854,
"learning_rate": 4.1022326674500584e-07,
"loss": 6.0009,
"step": 5020
},
{
"epoch": 2.955346650998825,
"grad_norm": 1.8690998554229736,
"learning_rate": 4.09048178613396e-07,
"loss": 5.9741,
"step": 5030
},
{
"epoch": 2.9612220916568743,
"grad_norm": 1.7106729745864868,
"learning_rate": 4.0787309048178614e-07,
"loss": 5.8316,
"step": 5040
},
{
"epoch": 2.9670975323149236,
"grad_norm": 2.05641770362854,
"learning_rate": 4.0669800235017625e-07,
"loss": 5.796,
"step": 5050
},
{
"epoch": 2.9670975323149236,
"eval_loss": 1.4632810354232788,
"eval_runtime": 67.2478,
"eval_samples_per_second": 21.324,
"eval_steps_per_second": 2.677,
"step": 5050
},
{
"epoch": 2.972972972972973,
"grad_norm": 1.9636961221694946,
"learning_rate": 4.055229142185664e-07,
"loss": 5.9396,
"step": 5060
},
{
"epoch": 2.9788484136310225,
"grad_norm": 1.9900755882263184,
"learning_rate": 4.043478260869565e-07,
"loss": 5.7244,
"step": 5070
},
{
"epoch": 2.9847238542890717,
"grad_norm": 1.7656136751174927,
"learning_rate": 4.031727379553466e-07,
"loss": 6.0377,
"step": 5080
},
{
"epoch": 2.990599294947121,
"grad_norm": 2.1417531967163086,
"learning_rate": 4.0199764982373676e-07,
"loss": 5.8221,
"step": 5090
},
{
"epoch": 2.9964747356051706,
"grad_norm": 1.6871669292449951,
"learning_rate": 4.008225616921269e-07,
"loss": 5.8345,
"step": 5100
},
{
"epoch": 2.9964747356051706,
"eval_loss": 1.4631738662719727,
"eval_runtime": 67.2117,
"eval_samples_per_second": 21.336,
"eval_steps_per_second": 2.678,
"step": 5100
},
{
"epoch": 3.00235017626322,
"grad_norm": 1.6874431371688843,
"learning_rate": 3.99647473560517e-07,
"loss": 5.6226,
"step": 5110
},
{
"epoch": 3.008225616921269,
"grad_norm": 1.9499021768569946,
"learning_rate": 3.9847238542890717e-07,
"loss": 5.7983,
"step": 5120
},
{
"epoch": 3.0141010575793183,
"grad_norm": 1.7841684818267822,
"learning_rate": 3.9729729729729727e-07,
"loss": 5.7704,
"step": 5130
},
{
"epoch": 3.0199764982373676,
"grad_norm": 1.7825994491577148,
"learning_rate": 3.9612220916568737e-07,
"loss": 6.1243,
"step": 5140
},
{
"epoch": 3.0258519388954173,
"grad_norm": 1.9684655666351318,
"learning_rate": 3.949471210340775e-07,
"loss": 5.9495,
"step": 5150
},
{
"epoch": 3.0258519388954173,
"eval_loss": 1.4631444215774536,
"eval_runtime": 67.1653,
"eval_samples_per_second": 21.35,
"eval_steps_per_second": 2.68,
"step": 5150
},
{
"epoch": 3.0317273795534665,
"grad_norm": 1.820328712463379,
"learning_rate": 3.937720329024677e-07,
"loss": 5.82,
"step": 5160
},
{
"epoch": 3.0376028202115157,
"grad_norm": 1.9277817010879517,
"learning_rate": 3.9259694477085783e-07,
"loss": 5.6194,
"step": 5170
},
{
"epoch": 3.0434782608695654,
"grad_norm": 2.056603193283081,
"learning_rate": 3.9142185663924793e-07,
"loss": 6.0018,
"step": 5180
},
{
"epoch": 3.0493537015276146,
"grad_norm": 1.9370253086090088,
"learning_rate": 3.9024676850763803e-07,
"loss": 5.869,
"step": 5190
},
{
"epoch": 3.055229142185664,
"grad_norm": 1.8661144971847534,
"learning_rate": 3.890716803760282e-07,
"loss": 5.9485,
"step": 5200
},
{
"epoch": 3.055229142185664,
"eval_loss": 1.4629672765731812,
"eval_runtime": 67.0872,
"eval_samples_per_second": 21.375,
"eval_steps_per_second": 2.683,
"step": 5200
},
{
"epoch": 3.061104582843713,
"grad_norm": 1.7688831090927124,
"learning_rate": 3.8789659224441834e-07,
"loss": 5.9163,
"step": 5210
},
{
"epoch": 3.066980023501763,
"grad_norm": 2.025082588195801,
"learning_rate": 3.8672150411280844e-07,
"loss": 5.959,
"step": 5220
},
{
"epoch": 3.072855464159812,
"grad_norm": 1.8350175619125366,
"learning_rate": 3.855464159811986e-07,
"loss": 5.7492,
"step": 5230
},
{
"epoch": 3.0787309048178613,
"grad_norm": 2.098921298980713,
"learning_rate": 3.843713278495887e-07,
"loss": 6.0287,
"step": 5240
},
{
"epoch": 3.0846063454759105,
"grad_norm": 1.5796895027160645,
"learning_rate": 3.831962397179788e-07,
"loss": 5.9429,
"step": 5250
},
{
"epoch": 3.0846063454759105,
"eval_loss": 1.4628491401672363,
"eval_runtime": 67.2809,
"eval_samples_per_second": 21.314,
"eval_steps_per_second": 2.675,
"step": 5250
},
{
"epoch": 3.09048178613396,
"grad_norm": 1.8605477809906006,
"learning_rate": 3.8202115158636896e-07,
"loss": 5.7176,
"step": 5260
},
{
"epoch": 3.0963572267920094,
"grad_norm": 1.938942790031433,
"learning_rate": 3.808460634547591e-07,
"loss": 5.9195,
"step": 5270
},
{
"epoch": 3.1022326674500587,
"grad_norm": 2.0489580631256104,
"learning_rate": 3.796709753231492e-07,
"loss": 5.8776,
"step": 5280
},
{
"epoch": 3.108108108108108,
"grad_norm": 1.7016371488571167,
"learning_rate": 3.7849588719153937e-07,
"loss": 5.8859,
"step": 5290
},
{
"epoch": 3.1139835487661576,
"grad_norm": 2.140580654144287,
"learning_rate": 3.7732079905992947e-07,
"loss": 5.743,
"step": 5300
},
{
"epoch": 3.1139835487661576,
"eval_loss": 1.4629240036010742,
"eval_runtime": 67.2129,
"eval_samples_per_second": 21.335,
"eval_steps_per_second": 2.678,
"step": 5300
},
{
"epoch": 3.119858989424207,
"grad_norm": 1.872502326965332,
"learning_rate": 3.7614571092831957e-07,
"loss": 5.9483,
"step": 5310
},
{
"epoch": 3.125734430082256,
"grad_norm": 2.179497718811035,
"learning_rate": 3.749706227967097e-07,
"loss": 5.7933,
"step": 5320
},
{
"epoch": 3.1316098707403057,
"grad_norm": 1.7496691942214966,
"learning_rate": 3.737955346650999e-07,
"loss": 5.892,
"step": 5330
},
{
"epoch": 3.137485311398355,
"grad_norm": 1.722602128982544,
"learning_rate": 3.7262044653349003e-07,
"loss": 5.897,
"step": 5340
},
{
"epoch": 3.143360752056404,
"grad_norm": 1.8440240621566772,
"learning_rate": 3.7144535840188013e-07,
"loss": 6.0027,
"step": 5350
},
{
"epoch": 3.143360752056404,
"eval_loss": 1.4626725912094116,
"eval_runtime": 67.549,
"eval_samples_per_second": 21.229,
"eval_steps_per_second": 2.665,
"step": 5350
},
{
"epoch": 3.1492361927144534,
"grad_norm": 1.77263605594635,
"learning_rate": 3.7027027027027023e-07,
"loss": 5.6062,
"step": 5360
},
{
"epoch": 3.155111633372503,
"grad_norm": 1.7622977495193481,
"learning_rate": 3.690951821386604e-07,
"loss": 5.9189,
"step": 5370
},
{
"epoch": 3.1609870740305523,
"grad_norm": 1.9615147113800049,
"learning_rate": 3.679200940070505e-07,
"loss": 5.77,
"step": 5380
},
{
"epoch": 3.1668625146886016,
"grad_norm": 1.7339571714401245,
"learning_rate": 3.6674500587544064e-07,
"loss": 5.6509,
"step": 5390
},
{
"epoch": 3.172737955346651,
"grad_norm": 1.9717214107513428,
"learning_rate": 3.655699177438308e-07,
"loss": 5.952,
"step": 5400
},
{
"epoch": 3.172737955346651,
"eval_loss": 1.4626277685165405,
"eval_runtime": 67.2483,
"eval_samples_per_second": 21.324,
"eval_steps_per_second": 2.677,
"step": 5400
},
{
"epoch": 3.1786133960047005,
"grad_norm": 1.6808756589889526,
"learning_rate": 3.643948296122209e-07,
"loss": 5.9226,
"step": 5410
},
{
"epoch": 3.1844888366627497,
"grad_norm": 1.802362084388733,
"learning_rate": 3.63219741480611e-07,
"loss": 5.8396,
"step": 5420
},
{
"epoch": 3.190364277320799,
"grad_norm": 2.0765771865844727,
"learning_rate": 3.6204465334900115e-07,
"loss": 5.9202,
"step": 5430
},
{
"epoch": 3.196239717978848,
"grad_norm": 1.8261579275131226,
"learning_rate": 3.608695652173913e-07,
"loss": 5.8945,
"step": 5440
},
{
"epoch": 3.202115158636898,
"grad_norm": 1.978142261505127,
"learning_rate": 3.596944770857814e-07,
"loss": 6.0232,
"step": 5450
},
{
"epoch": 3.202115158636898,
"eval_loss": 1.4625942707061768,
"eval_runtime": 68.053,
"eval_samples_per_second": 21.072,
"eval_steps_per_second": 2.645,
"step": 5450
},
{
"epoch": 3.207990599294947,
"grad_norm": 1.7350192070007324,
"learning_rate": 3.5851938895417156e-07,
"loss": 6.0179,
"step": 5460
},
{
"epoch": 3.2138660399529964,
"grad_norm": 1.9900667667388916,
"learning_rate": 3.5734430082256167e-07,
"loss": 5.7541,
"step": 5470
},
{
"epoch": 3.219741480611046,
"grad_norm": 1.9178911447525024,
"learning_rate": 3.5616921269095177e-07,
"loss": 5.9233,
"step": 5480
},
{
"epoch": 3.2256169212690953,
"grad_norm": 1.925896406173706,
"learning_rate": 3.549941245593419e-07,
"loss": 5.8819,
"step": 5490
},
{
"epoch": 3.2314923619271445,
"grad_norm": 1.8195209503173828,
"learning_rate": 3.538190364277321e-07,
"loss": 5.799,
"step": 5500
},
{
"epoch": 3.2314923619271445,
"eval_loss": 1.4624738693237305,
"eval_runtime": 67.222,
"eval_samples_per_second": 21.332,
"eval_steps_per_second": 2.678,
"step": 5500
},
{
"epoch": 3.2373678025851937,
"grad_norm": 1.9356062412261963,
"learning_rate": 3.5264394829612223e-07,
"loss": 5.9717,
"step": 5510
},
{
"epoch": 3.2432432432432434,
"grad_norm": 2.2090444564819336,
"learning_rate": 3.5146886016451233e-07,
"loss": 5.9176,
"step": 5520
},
{
"epoch": 3.2491186839012927,
"grad_norm": 1.6561217308044434,
"learning_rate": 3.5029377203290243e-07,
"loss": 5.9658,
"step": 5530
},
{
"epoch": 3.254994124559342,
"grad_norm": 1.8014518022537231,
"learning_rate": 3.491186839012926e-07,
"loss": 5.9286,
"step": 5540
},
{
"epoch": 3.260869565217391,
"grad_norm": 2.0677366256713867,
"learning_rate": 3.479435957696827e-07,
"loss": 5.8748,
"step": 5550
},
{
"epoch": 3.260869565217391,
"eval_loss": 1.4624980688095093,
"eval_runtime": 67.2161,
"eval_samples_per_second": 21.334,
"eval_steps_per_second": 2.678,
"step": 5550
},
{
"epoch": 3.266745005875441,
"grad_norm": 1.6031136512756348,
"learning_rate": 3.4676850763807284e-07,
"loss": 5.6663,
"step": 5560
},
{
"epoch": 3.27262044653349,
"grad_norm": 1.5398238897323608,
"learning_rate": 3.45593419506463e-07,
"loss": 5.9192,
"step": 5570
},
{
"epoch": 3.2784958871915393,
"grad_norm": 1.7016900777816772,
"learning_rate": 3.444183313748531e-07,
"loss": 5.7822,
"step": 5580
},
{
"epoch": 3.2843713278495885,
"grad_norm": 1.646475076675415,
"learning_rate": 3.432432432432432e-07,
"loss": 5.9348,
"step": 5590
},
{
"epoch": 3.290246768507638,
"grad_norm": 1.9710693359375,
"learning_rate": 3.4206815511163335e-07,
"loss": 5.94,
"step": 5600
},
{
"epoch": 3.290246768507638,
"eval_loss": 1.4622986316680908,
"eval_runtime": 67.3258,
"eval_samples_per_second": 21.299,
"eval_steps_per_second": 2.674,
"step": 5600
},
{
"epoch": 3.2961222091656874,
"grad_norm": 1.9802639484405518,
"learning_rate": 3.408930669800235e-07,
"loss": 5.9262,
"step": 5610
},
{
"epoch": 3.3019976498237367,
"grad_norm": 1.9483816623687744,
"learning_rate": 3.397179788484136e-07,
"loss": 5.9497,
"step": 5620
},
{
"epoch": 3.3078730904817863,
"grad_norm": 2.1321420669555664,
"learning_rate": 3.3854289071680376e-07,
"loss": 5.9206,
"step": 5630
},
{
"epoch": 3.3137485311398356,
"grad_norm": 2.117222547531128,
"learning_rate": 3.3736780258519386e-07,
"loss": 5.8896,
"step": 5640
},
{
"epoch": 3.319623971797885,
"grad_norm": 1.7869446277618408,
"learning_rate": 3.3619271445358397e-07,
"loss": 5.745,
"step": 5650
},
{
"epoch": 3.319623971797885,
"eval_loss": 1.4623204469680786,
"eval_runtime": 67.2748,
"eval_samples_per_second": 21.316,
"eval_steps_per_second": 2.676,
"step": 5650
},
{
"epoch": 3.325499412455934,
"grad_norm": 1.9660139083862305,
"learning_rate": 3.350176263219741e-07,
"loss": 5.8493,
"step": 5660
},
{
"epoch": 3.3313748531139837,
"grad_norm": 1.9285929203033447,
"learning_rate": 3.338425381903643e-07,
"loss": 5.7798,
"step": 5670
},
{
"epoch": 3.337250293772033,
"grad_norm": 1.9511888027191162,
"learning_rate": 3.3266745005875443e-07,
"loss": 5.9952,
"step": 5680
},
{
"epoch": 3.343125734430082,
"grad_norm": 1.659542441368103,
"learning_rate": 3.3149236192714453e-07,
"loss": 5.889,
"step": 5690
},
{
"epoch": 3.3490011750881314,
"grad_norm": 1.6342780590057373,
"learning_rate": 3.3031727379553463e-07,
"loss": 5.7368,
"step": 5700
},
{
"epoch": 3.3490011750881314,
"eval_loss": 1.462188482284546,
"eval_runtime": 67.3727,
"eval_samples_per_second": 21.285,
"eval_steps_per_second": 2.672,
"step": 5700
},
{
"epoch": 3.354876615746181,
"grad_norm": 1.9756345748901367,
"learning_rate": 3.291421856639248e-07,
"loss": 5.7537,
"step": 5710
},
{
"epoch": 3.3607520564042304,
"grad_norm": 1.679041862487793,
"learning_rate": 3.279670975323149e-07,
"loss": 5.8132,
"step": 5720
},
{
"epoch": 3.3666274970622796,
"grad_norm": 1.6406320333480835,
"learning_rate": 3.2679200940070504e-07,
"loss": 5.8062,
"step": 5730
},
{
"epoch": 3.372502937720329,
"grad_norm": 2.1878700256347656,
"learning_rate": 3.256169212690952e-07,
"loss": 5.9283,
"step": 5740
},
{
"epoch": 3.3783783783783785,
"grad_norm": 1.7907475233078003,
"learning_rate": 3.244418331374853e-07,
"loss": 5.9412,
"step": 5750
},
{
"epoch": 3.3783783783783785,
"eval_loss": 1.4620883464813232,
"eval_runtime": 67.3105,
"eval_samples_per_second": 21.304,
"eval_steps_per_second": 2.674,
"step": 5750
},
{
"epoch": 3.3842538190364277,
"grad_norm": 1.8572816848754883,
"learning_rate": 3.232667450058754e-07,
"loss": 5.8449,
"step": 5760
},
{
"epoch": 3.390129259694477,
"grad_norm": 1.9807683229446411,
"learning_rate": 3.2209165687426555e-07,
"loss": 5.8463,
"step": 5770
},
{
"epoch": 3.3960047003525267,
"grad_norm": 2.1083383560180664,
"learning_rate": 3.2091656874265565e-07,
"loss": 5.7518,
"step": 5780
},
{
"epoch": 3.401880141010576,
"grad_norm": 1.8015503883361816,
"learning_rate": 3.197414806110458e-07,
"loss": 6.0802,
"step": 5790
},
{
"epoch": 3.407755581668625,
"grad_norm": 1.9593247175216675,
"learning_rate": 3.1856639247943596e-07,
"loss": 5.7689,
"step": 5800
},
{
"epoch": 3.407755581668625,
"eval_loss": 1.462052345275879,
"eval_runtime": 67.2848,
"eval_samples_per_second": 21.312,
"eval_steps_per_second": 2.675,
"step": 5800
},
{
"epoch": 3.4136310223266744,
"grad_norm": 1.8491374254226685,
"learning_rate": 3.1739130434782606e-07,
"loss": 5.9444,
"step": 5810
},
{
"epoch": 3.4195064629847236,
"grad_norm": 1.7238551378250122,
"learning_rate": 3.162162162162162e-07,
"loss": 5.9425,
"step": 5820
},
{
"epoch": 3.4253819036427733,
"grad_norm": 1.681721568107605,
"learning_rate": 3.150411280846063e-07,
"loss": 5.7639,
"step": 5830
},
{
"epoch": 3.4312573443008225,
"grad_norm": 1.882681131362915,
"learning_rate": 3.1386603995299647e-07,
"loss": 5.925,
"step": 5840
},
{
"epoch": 3.4371327849588718,
"grad_norm": 1.8038091659545898,
"learning_rate": 3.1269095182138663e-07,
"loss": 5.7596,
"step": 5850
},
{
"epoch": 3.4371327849588718,
"eval_loss": 1.4619789123535156,
"eval_runtime": 67.3524,
"eval_samples_per_second": 21.291,
"eval_steps_per_second": 2.673,
"step": 5850
},
{
"epoch": 3.4430082256169214,
"grad_norm": 1.9123611450195312,
"learning_rate": 3.1151586368977673e-07,
"loss": 5.9172,
"step": 5860
},
{
"epoch": 3.4488836662749707,
"grad_norm": 1.6836742162704468,
"learning_rate": 3.1034077555816683e-07,
"loss": 5.8407,
"step": 5870
},
{
"epoch": 3.45475910693302,
"grad_norm": 1.9502021074295044,
"learning_rate": 3.09165687426557e-07,
"loss": 6.0026,
"step": 5880
},
{
"epoch": 3.460634547591069,
"grad_norm": 2.0914485454559326,
"learning_rate": 3.079905992949471e-07,
"loss": 5.9751,
"step": 5890
},
{
"epoch": 3.466509988249119,
"grad_norm": 1.6563928127288818,
"learning_rate": 3.0681551116333724e-07,
"loss": 5.6502,
"step": 5900
},
{
"epoch": 3.466509988249119,
"eval_loss": 1.4618340730667114,
"eval_runtime": 67.2646,
"eval_samples_per_second": 21.319,
"eval_steps_per_second": 2.676,
"step": 5900
},
{
"epoch": 3.472385428907168,
"grad_norm": 1.7382484674453735,
"learning_rate": 3.056404230317274e-07,
"loss": 5.7525,
"step": 5910
},
{
"epoch": 3.4782608695652173,
"grad_norm": 1.8393006324768066,
"learning_rate": 3.044653349001175e-07,
"loss": 5.6196,
"step": 5920
},
{
"epoch": 3.484136310223267,
"grad_norm": 1.8184826374053955,
"learning_rate": 3.032902467685076e-07,
"loss": 5.7433,
"step": 5930
},
{
"epoch": 3.490011750881316,
"grad_norm": 1.9732388257980347,
"learning_rate": 3.0211515863689775e-07,
"loss": 5.8874,
"step": 5940
},
{
"epoch": 3.4958871915393654,
"grad_norm": 2.0303008556365967,
"learning_rate": 3.0094007050528785e-07,
"loss": 5.9181,
"step": 5950
},
{
"epoch": 3.4958871915393654,
"eval_loss": 1.4617245197296143,
"eval_runtime": 67.3499,
"eval_samples_per_second": 21.292,
"eval_steps_per_second": 2.673,
"step": 5950
},
{
"epoch": 3.5017626321974147,
"grad_norm": 1.7813360691070557,
"learning_rate": 2.99764982373678e-07,
"loss": 5.8842,
"step": 5960
},
{
"epoch": 3.507638072855464,
"grad_norm": 1.7646697759628296,
"learning_rate": 2.9858989424206816e-07,
"loss": 5.5021,
"step": 5970
},
{
"epoch": 3.5135135135135136,
"grad_norm": 1.9409451484680176,
"learning_rate": 2.9741480611045826e-07,
"loss": 5.8135,
"step": 5980
},
{
"epoch": 3.519388954171563,
"grad_norm": 1.96255624294281,
"learning_rate": 2.962397179788484e-07,
"loss": 5.9597,
"step": 5990
},
{
"epoch": 3.525264394829612,
"grad_norm": 1.9019967317581177,
"learning_rate": 2.950646298472385e-07,
"loss": 5.8966,
"step": 6000
},
{
"epoch": 3.525264394829612,
"eval_loss": 1.4617407321929932,
"eval_runtime": 67.4776,
"eval_samples_per_second": 21.251,
"eval_steps_per_second": 2.668,
"step": 6000
},
{
"epoch": 3.5311398354876617,
"grad_norm": 1.9315980672836304,
"learning_rate": 2.9388954171562867e-07,
"loss": 5.9795,
"step": 6010
},
{
"epoch": 3.537015276145711,
"grad_norm": 1.920632243156433,
"learning_rate": 2.927144535840188e-07,
"loss": 5.8567,
"step": 6020
},
{
"epoch": 3.54289071680376,
"grad_norm": 1.9164453744888306,
"learning_rate": 2.9153936545240893e-07,
"loss": 5.895,
"step": 6030
},
{
"epoch": 3.5487661574618095,
"grad_norm": 1.761549949645996,
"learning_rate": 2.9036427732079903e-07,
"loss": 6.036,
"step": 6040
},
{
"epoch": 3.554641598119859,
"grad_norm": 1.8866323232650757,
"learning_rate": 2.891891891891892e-07,
"loss": 5.9864,
"step": 6050
},
{
"epoch": 3.554641598119859,
"eval_loss": 1.4616913795471191,
"eval_runtime": 67.2721,
"eval_samples_per_second": 21.316,
"eval_steps_per_second": 2.676,
"step": 6050
},
{
"epoch": 3.5605170387779084,
"grad_norm": 1.8041138648986816,
"learning_rate": 2.880141010575793e-07,
"loss": 5.854,
"step": 6060
},
{
"epoch": 3.5663924794359576,
"grad_norm": 2.0642271041870117,
"learning_rate": 2.8683901292596944e-07,
"loss": 5.8082,
"step": 6070
},
{
"epoch": 3.5722679200940073,
"grad_norm": 2.4056267738342285,
"learning_rate": 2.856639247943596e-07,
"loss": 5.8928,
"step": 6080
},
{
"epoch": 3.5781433607520565,
"grad_norm": 2.040055274963379,
"learning_rate": 2.844888366627497e-07,
"loss": 5.7473,
"step": 6090
},
{
"epoch": 3.5840188014101058,
"grad_norm": 1.7047302722930908,
"learning_rate": 2.833137485311398e-07,
"loss": 5.9143,
"step": 6100
},
{
"epoch": 3.5840188014101058,
"eval_loss": 1.4616738557815552,
"eval_runtime": 67.3074,
"eval_samples_per_second": 21.305,
"eval_steps_per_second": 2.674,
"step": 6100
},
{
"epoch": 3.589894242068155,
"grad_norm": 1.9022328853607178,
"learning_rate": 2.8213866039952995e-07,
"loss": 5.9284,
"step": 6110
},
{
"epoch": 3.5957696827262042,
"grad_norm": 1.7916126251220703,
"learning_rate": 2.8096357226792005e-07,
"loss": 5.8873,
"step": 6120
},
{
"epoch": 3.601645123384254,
"grad_norm": 1.954274296760559,
"learning_rate": 2.7978848413631026e-07,
"loss": 5.8389,
"step": 6130
},
{
"epoch": 3.607520564042303,
"grad_norm": 1.74794602394104,
"learning_rate": 2.7861339600470036e-07,
"loss": 5.8795,
"step": 6140
},
{
"epoch": 3.6133960047003524,
"grad_norm": 1.8686721324920654,
"learning_rate": 2.7743830787309046e-07,
"loss": 5.7894,
"step": 6150
},
{
"epoch": 3.6133960047003524,
"eval_loss": 1.4615228176116943,
"eval_runtime": 67.2128,
"eval_samples_per_second": 21.335,
"eval_steps_per_second": 2.678,
"step": 6150
},
{
"epoch": 3.619271445358402,
"grad_norm": 1.8556008338928223,
"learning_rate": 2.762632197414806e-07,
"loss": 5.8837,
"step": 6160
},
{
"epoch": 3.6251468860164513,
"grad_norm": 1.8632394075393677,
"learning_rate": 2.750881316098707e-07,
"loss": 5.9041,
"step": 6170
},
{
"epoch": 3.6310223266745005,
"grad_norm": 1.7999444007873535,
"learning_rate": 2.739130434782608e-07,
"loss": 5.8486,
"step": 6180
},
{
"epoch": 3.6368977673325498,
"grad_norm": 1.9313387870788574,
"learning_rate": 2.72737955346651e-07,
"loss": 5.9457,
"step": 6190
},
{
"epoch": 3.6427732079905994,
"grad_norm": 2.07930064201355,
"learning_rate": 2.7156286721504113e-07,
"loss": 5.8247,
"step": 6200
},
{
"epoch": 3.6427732079905994,
"eval_loss": 1.461436152458191,
"eval_runtime": 67.263,
"eval_samples_per_second": 21.319,
"eval_steps_per_second": 2.676,
"step": 6200
},
{
"epoch": 3.6486486486486487,
"grad_norm": 2.2443180084228516,
"learning_rate": 2.7038777908343123e-07,
"loss": 6.1853,
"step": 6210
},
{
"epoch": 3.654524089306698,
"grad_norm": 1.9109710454940796,
"learning_rate": 2.692126909518214e-07,
"loss": 5.9959,
"step": 6220
},
{
"epoch": 3.6603995299647476,
"grad_norm": 1.809380292892456,
"learning_rate": 2.680376028202115e-07,
"loss": 5.7262,
"step": 6230
},
{
"epoch": 3.666274970622797,
"grad_norm": 1.8630945682525635,
"learning_rate": 2.6686251468860164e-07,
"loss": 5.8591,
"step": 6240
},
{
"epoch": 3.672150411280846,
"grad_norm": 1.8457863330841064,
"learning_rate": 2.656874265569918e-07,
"loss": 5.8961,
"step": 6250
},
{
"epoch": 3.672150411280846,
"eval_loss": 1.4614366292953491,
"eval_runtime": 67.434,
"eval_samples_per_second": 21.265,
"eval_steps_per_second": 2.669,
"step": 6250
},
{
"epoch": 3.6780258519388953,
"grad_norm": 1.829138994216919,
"learning_rate": 2.645123384253819e-07,
"loss": 6.0951,
"step": 6260
},
{
"epoch": 3.6839012925969445,
"grad_norm": 2.01283860206604,
"learning_rate": 2.63337250293772e-07,
"loss": 5.8845,
"step": 6270
},
{
"epoch": 3.6897767332549942,
"grad_norm": 1.7411574125289917,
"learning_rate": 2.6216216216216215e-07,
"loss": 5.8118,
"step": 6280
},
{
"epoch": 3.6956521739130435,
"grad_norm": 2.0445363521575928,
"learning_rate": 2.6098707403055225e-07,
"loss": 6.0719,
"step": 6290
},
{
"epoch": 3.7015276145710927,
"grad_norm": 1.6012552976608276,
"learning_rate": 2.5981198589894246e-07,
"loss": 5.9107,
"step": 6300
},
{
"epoch": 3.7015276145710927,
"eval_loss": 1.4612646102905273,
"eval_runtime": 67.3397,
"eval_samples_per_second": 21.295,
"eval_steps_per_second": 2.673,
"step": 6300
},
{
"epoch": 3.7074030552291424,
"grad_norm": 1.668100357055664,
"learning_rate": 2.5863689776733256e-07,
"loss": 5.7761,
"step": 6310
},
{
"epoch": 3.7132784958871916,
"grad_norm": 1.8935034275054932,
"learning_rate": 2.5746180963572266e-07,
"loss": 5.6924,
"step": 6320
},
{
"epoch": 3.719153936545241,
"grad_norm": 1.6541757583618164,
"learning_rate": 2.562867215041128e-07,
"loss": 5.798,
"step": 6330
},
{
"epoch": 3.72502937720329,
"grad_norm": 1.9191126823425293,
"learning_rate": 2.551116333725029e-07,
"loss": 5.7736,
"step": 6340
},
{
"epoch": 3.7309048178613398,
"grad_norm": 1.6552644968032837,
"learning_rate": 2.53936545240893e-07,
"loss": 5.8405,
"step": 6350
},
{
"epoch": 3.7309048178613398,
"eval_loss": 1.4613573551177979,
"eval_runtime": 68.3662,
"eval_samples_per_second": 20.975,
"eval_steps_per_second": 2.633,
"step": 6350
},
{
"epoch": 3.736780258519389,
"grad_norm": 1.8980045318603516,
"learning_rate": 2.527614571092832e-07,
"loss": 5.9485,
"step": 6360
},
{
"epoch": 3.7426556991774382,
"grad_norm": 1.8480231761932373,
"learning_rate": 2.515863689776733e-07,
"loss": 5.7251,
"step": 6370
},
{
"epoch": 3.748531139835488,
"grad_norm": 2.0423247814178467,
"learning_rate": 2.5041128084606343e-07,
"loss": 5.9523,
"step": 6380
},
{
"epoch": 3.754406580493537,
"grad_norm": 1.9046651124954224,
"learning_rate": 2.492361927144536e-07,
"loss": 6.1359,
"step": 6390
},
{
"epoch": 3.7602820211515864,
"grad_norm": 1.644461989402771,
"learning_rate": 2.4806110458284374e-07,
"loss": 5.8119,
"step": 6400
},
{
"epoch": 3.7602820211515864,
"eval_loss": 1.4611767530441284,
"eval_runtime": 67.7542,
"eval_samples_per_second": 21.165,
"eval_steps_per_second": 2.657,
"step": 6400
},
{
"epoch": 3.7661574618096356,
"grad_norm": 1.9219424724578857,
"learning_rate": 2.4688601645123384e-07,
"loss": 5.7408,
"step": 6410
},
{
"epoch": 3.772032902467685,
"grad_norm": 2.5688843727111816,
"learning_rate": 2.4571092831962394e-07,
"loss": 5.858,
"step": 6420
},
{
"epoch": 3.7779083431257345,
"grad_norm": 1.7739956378936768,
"learning_rate": 2.445358401880141e-07,
"loss": 6.0526,
"step": 6430
},
{
"epoch": 3.7837837837837838,
"grad_norm": 1.7807574272155762,
"learning_rate": 2.433607520564042e-07,
"loss": 5.7706,
"step": 6440
},
{
"epoch": 3.789659224441833,
"grad_norm": 1.7440868616104126,
"learning_rate": 2.4218566392479435e-07,
"loss": 5.9321,
"step": 6450
},
{
"epoch": 3.789659224441833,
"eval_loss": 1.461159110069275,
"eval_runtime": 67.3392,
"eval_samples_per_second": 21.295,
"eval_steps_per_second": 2.673,
"step": 6450
},
{
"epoch": 3.7955346650998827,
"grad_norm": 1.6572002172470093,
"learning_rate": 2.410105757931845e-07,
"loss": 5.83,
"step": 6460
},
{
"epoch": 3.801410105757932,
"grad_norm": 2.195672035217285,
"learning_rate": 2.398354876615746e-07,
"loss": 5.8685,
"step": 6470
},
{
"epoch": 3.807285546415981,
"grad_norm": 1.828194260597229,
"learning_rate": 2.386603995299647e-07,
"loss": 5.8451,
"step": 6480
},
{
"epoch": 3.8131609870740304,
"grad_norm": 1.9797534942626953,
"learning_rate": 2.3748531139835486e-07,
"loss": 5.8433,
"step": 6490
},
{
"epoch": 3.8190364277320796,
"grad_norm": 1.7732436656951904,
"learning_rate": 2.3631022326674499e-07,
"loss": 5.936,
"step": 6500
},
{
"epoch": 3.8190364277320796,
"eval_loss": 1.4612115621566772,
"eval_runtime": 67.3159,
"eval_samples_per_second": 21.303,
"eval_steps_per_second": 2.674,
"step": 6500
},
{
"epoch": 3.8249118683901293,
"grad_norm": 1.738011360168457,
"learning_rate": 2.3513513513513514e-07,
"loss": 5.9119,
"step": 6510
},
{
"epoch": 3.8307873090481785,
"grad_norm": 2.1319050788879395,
"learning_rate": 2.3396004700352527e-07,
"loss": 5.7625,
"step": 6520
},
{
"epoch": 3.8366627497062282,
"grad_norm": 1.9762002229690552,
"learning_rate": 2.3278495887191537e-07,
"loss": 5.8969,
"step": 6530
},
{
"epoch": 3.8425381903642775,
"grad_norm": 1.8025697469711304,
"learning_rate": 2.3160987074030552e-07,
"loss": 5.7755,
"step": 6540
},
{
"epoch": 3.8484136310223267,
"grad_norm": 1.8634493350982666,
"learning_rate": 2.3043478260869565e-07,
"loss": 5.7939,
"step": 6550
},
{
"epoch": 3.8484136310223267,
"eval_loss": 1.4610487222671509,
"eval_runtime": 67.3671,
"eval_samples_per_second": 21.286,
"eval_steps_per_second": 2.672,
"step": 6550
},
{
"epoch": 3.854289071680376,
"grad_norm": 2.1296660900115967,
"learning_rate": 2.2925969447708575e-07,
"loss": 5.8576,
"step": 6560
},
{
"epoch": 3.860164512338425,
"grad_norm": 2.249799966812134,
"learning_rate": 2.280846063454759e-07,
"loss": 5.9107,
"step": 6570
},
{
"epoch": 3.866039952996475,
"grad_norm": 1.938138723373413,
"learning_rate": 2.2690951821386604e-07,
"loss": 5.7601,
"step": 6580
},
{
"epoch": 3.871915393654524,
"grad_norm": 1.7803981304168701,
"learning_rate": 2.2573443008225614e-07,
"loss": 5.8213,
"step": 6590
},
{
"epoch": 3.8777908343125733,
"grad_norm": 1.6013925075531006,
"learning_rate": 2.245593419506463e-07,
"loss": 5.8792,
"step": 6600
},
{
"epoch": 3.8777908343125733,
"eval_loss": 1.4610427618026733,
"eval_runtime": 67.2577,
"eval_samples_per_second": 21.321,
"eval_steps_per_second": 2.676,
"step": 6600
},
{
"epoch": 3.883666274970623,
"grad_norm": 2.0687365531921387,
"learning_rate": 2.2338425381903642e-07,
"loss": 5.7506,
"step": 6610
},
{
"epoch": 3.8895417156286722,
"grad_norm": 1.913124918937683,
"learning_rate": 2.2220916568742655e-07,
"loss": 5.8087,
"step": 6620
},
{
"epoch": 3.8954171562867215,
"grad_norm": 1.6601601839065552,
"learning_rate": 2.2103407755581667e-07,
"loss": 5.7706,
"step": 6630
},
{
"epoch": 3.9012925969447707,
"grad_norm": 1.7471449375152588,
"learning_rate": 2.198589894242068e-07,
"loss": 5.9002,
"step": 6640
},
{
"epoch": 3.90716803760282,
"grad_norm": 1.875045657157898,
"learning_rate": 2.1868390129259693e-07,
"loss": 5.8144,
"step": 6650
},
{
"epoch": 3.90716803760282,
"eval_loss": 1.4610403776168823,
"eval_runtime": 67.3072,
"eval_samples_per_second": 21.305,
"eval_steps_per_second": 2.674,
"step": 6650
},
{
"epoch": 3.9130434782608696,
"grad_norm": 1.9555529356002808,
"learning_rate": 2.1750881316098706e-07,
"loss": 6.0214,
"step": 6660
},
{
"epoch": 3.918918918918919,
"grad_norm": 1.9561495780944824,
"learning_rate": 2.1633372502937719e-07,
"loss": 5.984,
"step": 6670
},
{
"epoch": 3.9247943595769685,
"grad_norm": 1.739403247833252,
"learning_rate": 2.1515863689776731e-07,
"loss": 5.9714,
"step": 6680
},
{
"epoch": 3.9306698002350178,
"grad_norm": 1.620549201965332,
"learning_rate": 2.1398354876615747e-07,
"loss": 5.88,
"step": 6690
},
{
"epoch": 3.936545240893067,
"grad_norm": 1.9505090713500977,
"learning_rate": 2.1280846063454757e-07,
"loss": 5.7891,
"step": 6700
},
{
"epoch": 3.936545240893067,
"eval_loss": 1.4608731269836426,
"eval_runtime": 68.119,
"eval_samples_per_second": 21.051,
"eval_steps_per_second": 2.642,
"step": 6700
},
{
"epoch": 3.9424206815511162,
"grad_norm": 1.7288826704025269,
"learning_rate": 2.1163337250293772e-07,
"loss": 5.9777,
"step": 6710
},
{
"epoch": 3.9482961222091655,
"grad_norm": 1.8516991138458252,
"learning_rate": 2.1045828437132785e-07,
"loss": 5.7113,
"step": 6720
},
{
"epoch": 3.954171562867215,
"grad_norm": 1.7342356443405151,
"learning_rate": 2.0928319623971795e-07,
"loss": 5.7252,
"step": 6730
},
{
"epoch": 3.9600470035252644,
"grad_norm": 1.5385229587554932,
"learning_rate": 2.081081081081081e-07,
"loss": 5.8457,
"step": 6740
},
{
"epoch": 3.9659224441833136,
"grad_norm": 1.548790693283081,
"learning_rate": 2.0693301997649823e-07,
"loss": 5.7167,
"step": 6750
},
{
"epoch": 3.9659224441833136,
"eval_loss": 1.4608203172683716,
"eval_runtime": 67.3467,
"eval_samples_per_second": 21.293,
"eval_steps_per_second": 2.673,
"step": 6750
},
{
"epoch": 3.9717978848413633,
"grad_norm": 1.6528300046920776,
"learning_rate": 2.0575793184488836e-07,
"loss": 5.9047,
"step": 6760
},
{
"epoch": 3.9776733254994125,
"grad_norm": 1.8215575218200684,
"learning_rate": 2.045828437132785e-07,
"loss": 6.0313,
"step": 6770
},
{
"epoch": 3.983548766157462,
"grad_norm": 1.7826635837554932,
"learning_rate": 2.0340775558166862e-07,
"loss": 5.9478,
"step": 6780
},
{
"epoch": 3.989424206815511,
"grad_norm": 1.5644893646240234,
"learning_rate": 2.0223266745005875e-07,
"loss": 5.8306,
"step": 6790
},
{
"epoch": 3.9952996474735603,
"grad_norm": 1.9673813581466675,
"learning_rate": 2.0105757931844887e-07,
"loss": 5.826,
"step": 6800
},
{
"epoch": 3.9952996474735603,
"eval_loss": 1.4608874320983887,
"eval_runtime": 67.3633,
"eval_samples_per_second": 21.288,
"eval_steps_per_second": 2.672,
"step": 6800
},
{
"epoch": 4.0011750881316095,
"grad_norm": 1.796644926071167,
"learning_rate": 1.99882491186839e-07,
"loss": 5.9259,
"step": 6810
},
{
"epoch": 4.00705052878966,
"grad_norm": 1.6265869140625,
"learning_rate": 1.9870740305522913e-07,
"loss": 5.8435,
"step": 6820
},
{
"epoch": 4.012925969447709,
"grad_norm": 1.6663663387298584,
"learning_rate": 1.9753231492361926e-07,
"loss": 5.6056,
"step": 6830
},
{
"epoch": 4.018801410105758,
"grad_norm": 2.006054401397705,
"learning_rate": 1.9635722679200938e-07,
"loss": 5.8087,
"step": 6840
},
{
"epoch": 4.024676850763807,
"grad_norm": 1.7286150455474854,
"learning_rate": 1.951821386603995e-07,
"loss": 5.9072,
"step": 6850
},
{
"epoch": 4.024676850763807,
"eval_loss": 1.4607393741607666,
"eval_runtime": 67.3237,
"eval_samples_per_second": 21.3,
"eval_steps_per_second": 2.674,
"step": 6850
}
],
"logging_steps": 10,
"max_steps": 8510,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 50,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 2,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 4.788240289615577e+18,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}