{ "best_global_step": 6850, "best_metric": 1.4607393741607666, "best_model_checkpoint": "/ocean/projects/cis250225p/eajayi1/HUMOR_V2/models/HumorGen_GRPO_Think_7B/checkpoint-6850", "epoch": 4.024676850763807, "eval_steps": 50, "global_step": 6850, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.005875440658049354, "grad_norm": 8.811631202697754, "learning_rate": 9.98942420681551e-07, "loss": 12.2374, "step": 10 }, { "epoch": 0.011750881316098707, "grad_norm": 8.409488677978516, "learning_rate": 9.97767332549941e-07, "loss": 11.9053, "step": 20 }, { "epoch": 0.01762632197414806, "grad_norm": 8.858304023742676, "learning_rate": 9.965922444183313e-07, "loss": 11.7157, "step": 30 }, { "epoch": 0.023501762632197415, "grad_norm": 7.180182456970215, "learning_rate": 9.954171562867215e-07, "loss": 11.502, "step": 40 }, { "epoch": 0.02937720329024677, "grad_norm": 6.562496662139893, "learning_rate": 9.942420681551115e-07, "loss": 11.2901, "step": 50 }, { "epoch": 0.02937720329024677, "eval_loss": 2.7823050022125244, "eval_runtime": 67.4853, "eval_samples_per_second": 21.249, "eval_steps_per_second": 2.667, "step": 50 }, { "epoch": 0.03525264394829612, "grad_norm": 6.412452697753906, "learning_rate": 9.930669800235017e-07, "loss": 11.3432, "step": 60 }, { "epoch": 0.041128084606345476, "grad_norm": 5.517050266265869, "learning_rate": 9.91891891891892e-07, "loss": 10.9799, "step": 70 }, { "epoch": 0.04700352526439483, "grad_norm": 5.147578716278076, "learning_rate": 9.90716803760282e-07, "loss": 10.7056, "step": 80 }, { "epoch": 0.052878965922444184, "grad_norm": 5.424646377563477, "learning_rate": 9.895417156286721e-07, "loss": 10.8406, "step": 90 }, { "epoch": 0.05875440658049354, "grad_norm": 5.833001613616943, "learning_rate": 9.883666274970623e-07, "loss": 10.381, "step": 100 }, { "epoch": 0.05875440658049354, "eval_loss": 2.5908639430999756, "eval_runtime": 67.4352, "eval_samples_per_second": 21.265, "eval_steps_per_second": 2.669, "step": 100 }, { "epoch": 0.06462984723854288, "grad_norm": 5.278085708618164, "learning_rate": 9.871915393654523e-07, "loss": 10.4618, "step": 110 }, { "epoch": 0.07050528789659224, "grad_norm": 5.3119378089904785, "learning_rate": 9.860164512338425e-07, "loss": 10.2036, "step": 120 }, { "epoch": 0.07638072855464159, "grad_norm": 5.22417688369751, "learning_rate": 9.848413631022327e-07, "loss": 9.938, "step": 130 }, { "epoch": 0.08225616921269095, "grad_norm": 5.020732402801514, "learning_rate": 9.836662749706227e-07, "loss": 9.8027, "step": 140 }, { "epoch": 0.0881316098707403, "grad_norm": 5.330644607543945, "learning_rate": 9.82491186839013e-07, "loss": 9.8301, "step": 150 }, { "epoch": 0.0881316098707403, "eval_loss": 2.414473533630371, "eval_runtime": 67.5277, "eval_samples_per_second": 21.236, "eval_steps_per_second": 2.666, "step": 150 }, { "epoch": 0.09400705052878966, "grad_norm": 5.486049175262451, "learning_rate": 9.813160987074031e-07, "loss": 9.5357, "step": 160 }, { "epoch": 0.099882491186839, "grad_norm": 5.097166061401367, "learning_rate": 9.801410105757931e-07, "loss": 9.4452, "step": 170 }, { "epoch": 0.10575793184488837, "grad_norm": 5.45658540725708, "learning_rate": 9.789659224441834e-07, "loss": 9.2689, "step": 180 }, { "epoch": 0.11163337250293771, "grad_norm": 4.833297252655029, "learning_rate": 9.777908343125733e-07, "loss": 9.3352, "step": 190 }, { "epoch": 0.11750881316098707, "grad_norm": 4.945570945739746, "learning_rate": 9.766157461809636e-07, "loss": 9.0403, "step": 200 }, { "epoch": 0.11750881316098707, "eval_loss": 2.241272211074829, "eval_runtime": 67.4972, "eval_samples_per_second": 21.245, "eval_steps_per_second": 2.667, "step": 200 }, { "epoch": 0.12338425381903642, "grad_norm": 4.854373455047607, "learning_rate": 9.754406580493535e-07, "loss": 8.989, "step": 210 }, { "epoch": 0.12925969447708577, "grad_norm": 5.162915229797363, "learning_rate": 9.742655699177438e-07, "loss": 8.8739, "step": 220 }, { "epoch": 0.13513513513513514, "grad_norm": 4.9273223876953125, "learning_rate": 9.73090481786134e-07, "loss": 8.5618, "step": 230 }, { "epoch": 0.1410105757931845, "grad_norm": 6.022256851196289, "learning_rate": 9.71915393654524e-07, "loss": 8.6177, "step": 240 }, { "epoch": 0.14688601645123384, "grad_norm": 5.432478427886963, "learning_rate": 9.707403055229142e-07, "loss": 8.4886, "step": 250 }, { "epoch": 0.14688601645123384, "eval_loss": 2.0618011951446533, "eval_runtime": 67.4752, "eval_samples_per_second": 21.252, "eval_steps_per_second": 2.668, "step": 250 }, { "epoch": 0.15276145710928318, "grad_norm": 4.686826705932617, "learning_rate": 9.695652173913042e-07, "loss": 8.2455, "step": 260 }, { "epoch": 0.15863689776733256, "grad_norm": 4.1519598960876465, "learning_rate": 9.683901292596944e-07, "loss": 8.1025, "step": 270 }, { "epoch": 0.1645123384253819, "grad_norm": 4.351338863372803, "learning_rate": 9.672150411280846e-07, "loss": 7.9276, "step": 280 }, { "epoch": 0.17038777908343125, "grad_norm": 4.530479431152344, "learning_rate": 9.660399529964746e-07, "loss": 7.8546, "step": 290 }, { "epoch": 0.1762632197414806, "grad_norm": 4.559052467346191, "learning_rate": 9.648648648648648e-07, "loss": 7.5711, "step": 300 }, { "epoch": 0.1762632197414806, "eval_loss": 1.9077221155166626, "eval_runtime": 67.4909, "eval_samples_per_second": 21.247, "eval_steps_per_second": 2.667, "step": 300 }, { "epoch": 0.18213866039952997, "grad_norm": 4.547175884246826, "learning_rate": 9.63689776733255e-07, "loss": 7.6163, "step": 310 }, { "epoch": 0.18801410105757932, "grad_norm": 4.496427536010742, "learning_rate": 9.62514688601645e-07, "loss": 7.5918, "step": 320 }, { "epoch": 0.19388954171562867, "grad_norm": 3.8418445587158203, "learning_rate": 9.613396004700352e-07, "loss": 7.4111, "step": 330 }, { "epoch": 0.199764982373678, "grad_norm": 3.503477096557617, "learning_rate": 9.601645123384254e-07, "loss": 7.3492, "step": 340 }, { "epoch": 0.2056404230317274, "grad_norm": 3.4004416465759277, "learning_rate": 9.589894242068156e-07, "loss": 7.3022, "step": 350 }, { "epoch": 0.2056404230317274, "eval_loss": 1.7808701992034912, "eval_runtime": 67.5434, "eval_samples_per_second": 21.231, "eval_steps_per_second": 2.665, "step": 350 }, { "epoch": 0.21151586368977673, "grad_norm": 3.0668485164642334, "learning_rate": 9.578143360752056e-07, "loss": 7.1996, "step": 360 }, { "epoch": 0.21739130434782608, "grad_norm": 3.0713930130004883, "learning_rate": 9.566392479435958e-07, "loss": 7.0048, "step": 370 }, { "epoch": 0.22326674500587543, "grad_norm": 2.9766199588775635, "learning_rate": 9.554641598119858e-07, "loss": 6.87, "step": 380 }, { "epoch": 0.2291421856639248, "grad_norm": 3.037301778793335, "learning_rate": 9.54289071680376e-07, "loss": 6.9316, "step": 390 }, { "epoch": 0.23501762632197415, "grad_norm": 2.995626211166382, "learning_rate": 9.531139835487661e-07, "loss": 6.923, "step": 400 }, { "epoch": 0.23501762632197415, "eval_loss": 1.7068030834197998, "eval_runtime": 67.4312, "eval_samples_per_second": 21.266, "eval_steps_per_second": 2.669, "step": 400 }, { "epoch": 0.2408930669800235, "grad_norm": 2.8138625621795654, "learning_rate": 9.519388954171562e-07, "loss": 6.839, "step": 410 }, { "epoch": 0.24676850763807284, "grad_norm": 3.0855729579925537, "learning_rate": 9.507638072855464e-07, "loss": 6.8684, "step": 420 }, { "epoch": 0.2526439482961222, "grad_norm": 3.1985392570495605, "learning_rate": 9.495887191539364e-07, "loss": 6.8183, "step": 430 }, { "epoch": 0.25851938895417154, "grad_norm": 2.9578516483306885, "learning_rate": 9.484136310223266e-07, "loss": 6.7427, "step": 440 }, { "epoch": 0.26439482961222094, "grad_norm": 2.966491460800171, "learning_rate": 9.472385428907168e-07, "loss": 6.5244, "step": 450 }, { "epoch": 0.26439482961222094, "eval_loss": 1.6518244743347168, "eval_runtime": 67.4846, "eval_samples_per_second": 21.249, "eval_steps_per_second": 2.667, "step": 450 }, { "epoch": 0.2702702702702703, "grad_norm": 3.0331716537475586, "learning_rate": 9.460634547591068e-07, "loss": 6.7348, "step": 460 }, { "epoch": 0.27614571092831963, "grad_norm": 2.72918963432312, "learning_rate": 9.44888366627497e-07, "loss": 6.5748, "step": 470 }, { "epoch": 0.282021151586369, "grad_norm": 2.724346399307251, "learning_rate": 9.437132784958871e-07, "loss": 6.6686, "step": 480 }, { "epoch": 0.2878965922444183, "grad_norm": 2.5998895168304443, "learning_rate": 9.425381903642773e-07, "loss": 6.5502, "step": 490 }, { "epoch": 0.2937720329024677, "grad_norm": 2.6023731231689453, "learning_rate": 9.413631022326674e-07, "loss": 6.7858, "step": 500 }, { "epoch": 0.2937720329024677, "eval_loss": 1.6121058464050293, "eval_runtime": 67.4886, "eval_samples_per_second": 21.248, "eval_steps_per_second": 2.667, "step": 500 }, { "epoch": 0.299647473560517, "grad_norm": 2.7446892261505127, "learning_rate": 9.401880141010575e-07, "loss": 6.4195, "step": 510 }, { "epoch": 0.30552291421856637, "grad_norm": 2.613320827484131, "learning_rate": 9.390129259694477e-07, "loss": 6.4007, "step": 520 }, { "epoch": 0.31139835487661577, "grad_norm": 2.511936664581299, "learning_rate": 9.378378378378377e-07, "loss": 6.4101, "step": 530 }, { "epoch": 0.3172737955346651, "grad_norm": 2.873652219772339, "learning_rate": 9.36662749706228e-07, "loss": 6.3963, "step": 540 }, { "epoch": 0.32314923619271446, "grad_norm": 2.630295515060425, "learning_rate": 9.35487661574618e-07, "loss": 6.3901, "step": 550 }, { "epoch": 0.32314923619271446, "eval_loss": 1.5881245136260986, "eval_runtime": 67.5206, "eval_samples_per_second": 21.238, "eval_steps_per_second": 2.666, "step": 550 }, { "epoch": 0.3290246768507638, "grad_norm": 2.6342382431030273, "learning_rate": 9.343125734430082e-07, "loss": 6.3494, "step": 560 }, { "epoch": 0.33490011750881316, "grad_norm": 2.5987398624420166, "learning_rate": 9.331374853113984e-07, "loss": 6.5762, "step": 570 }, { "epoch": 0.3407755581668625, "grad_norm": 2.516655445098877, "learning_rate": 9.319623971797885e-07, "loss": 6.1983, "step": 580 }, { "epoch": 0.34665099882491185, "grad_norm": 2.4287195205688477, "learning_rate": 9.307873090481786e-07, "loss": 6.1897, "step": 590 }, { "epoch": 0.3525264394829612, "grad_norm": 2.5706946849823, "learning_rate": 9.296122209165687e-07, "loss": 6.26, "step": 600 }, { "epoch": 0.3525264394829612, "eval_loss": 1.5706110000610352, "eval_runtime": 67.47, "eval_samples_per_second": 21.254, "eval_steps_per_second": 2.668, "step": 600 }, { "epoch": 0.3584018801410106, "grad_norm": 2.3836824893951416, "learning_rate": 9.284371327849589e-07, "loss": 6.2133, "step": 610 }, { "epoch": 0.36427732079905994, "grad_norm": 2.400269031524658, "learning_rate": 9.27262044653349e-07, "loss": 6.1327, "step": 620 }, { "epoch": 0.3701527614571093, "grad_norm": 2.3165385723114014, "learning_rate": 9.260869565217391e-07, "loss": 6.3342, "step": 630 }, { "epoch": 0.37602820211515864, "grad_norm": 2.231174945831299, "learning_rate": 9.249118683901293e-07, "loss": 6.2059, "step": 640 }, { "epoch": 0.381903642773208, "grad_norm": 2.0728275775909424, "learning_rate": 9.237367802585193e-07, "loss": 6.3354, "step": 650 }, { "epoch": 0.381903642773208, "eval_loss": 1.5572385787963867, "eval_runtime": 67.5201, "eval_samples_per_second": 21.238, "eval_steps_per_second": 2.666, "step": 650 }, { "epoch": 0.38777908343125733, "grad_norm": 2.2668001651763916, "learning_rate": 9.225616921269095e-07, "loss": 6.3588, "step": 660 }, { "epoch": 0.3936545240893067, "grad_norm": 1.953262209892273, "learning_rate": 9.213866039952997e-07, "loss": 6.1279, "step": 670 }, { "epoch": 0.399529964747356, "grad_norm": 2.1020588874816895, "learning_rate": 9.202115158636897e-07, "loss": 6.3427, "step": 680 }, { "epoch": 0.40540540540540543, "grad_norm": 2.1236062049865723, "learning_rate": 9.190364277320799e-07, "loss": 6.263, "step": 690 }, { "epoch": 0.4112808460634548, "grad_norm": 1.9457736015319824, "learning_rate": 9.1786133960047e-07, "loss": 6.2794, "step": 700 }, { "epoch": 0.4112808460634548, "eval_loss": 1.5472731590270996, "eval_runtime": 67.5297, "eval_samples_per_second": 21.235, "eval_steps_per_second": 2.665, "step": 700 }, { "epoch": 0.4171562867215041, "grad_norm": 1.8783148527145386, "learning_rate": 9.166862514688601e-07, "loss": 6.1391, "step": 710 }, { "epoch": 0.42303172737955347, "grad_norm": 1.9739516973495483, "learning_rate": 9.155111633372502e-07, "loss": 6.1713, "step": 720 }, { "epoch": 0.4289071680376028, "grad_norm": 1.813057541847229, "learning_rate": 9.143360752056404e-07, "loss": 6.1088, "step": 730 }, { "epoch": 0.43478260869565216, "grad_norm": 1.8499605655670166, "learning_rate": 9.131609870740305e-07, "loss": 6.1912, "step": 740 }, { "epoch": 0.4406580493537015, "grad_norm": 1.9469040632247925, "learning_rate": 9.119858989424206e-07, "loss": 6.236, "step": 750 }, { "epoch": 0.4406580493537015, "eval_loss": 1.5403022766113281, "eval_runtime": 67.8197, "eval_samples_per_second": 21.144, "eval_steps_per_second": 2.654, "step": 750 }, { "epoch": 0.44653349001175086, "grad_norm": 2.038455009460449, "learning_rate": 9.108108108108108e-07, "loss": 6.0741, "step": 760 }, { "epoch": 0.45240893066980026, "grad_norm": 1.835290551185608, "learning_rate": 9.096357226792008e-07, "loss": 6.0559, "step": 770 }, { "epoch": 0.4582843713278496, "grad_norm": 2.0130181312561035, "learning_rate": 9.08460634547591e-07, "loss": 6.0528, "step": 780 }, { "epoch": 0.46415981198589895, "grad_norm": 1.840409278869629, "learning_rate": 9.072855464159812e-07, "loss": 6.2831, "step": 790 }, { "epoch": 0.4700352526439483, "grad_norm": 1.9972599744796753, "learning_rate": 9.061104582843712e-07, "loss": 6.1976, "step": 800 }, { "epoch": 0.4700352526439483, "eval_loss": 1.5347312688827515, "eval_runtime": 67.5274, "eval_samples_per_second": 21.236, "eval_steps_per_second": 2.666, "step": 800 }, { "epoch": 0.47591069330199764, "grad_norm": 1.8628931045532227, "learning_rate": 9.049353701527614e-07, "loss": 6.1779, "step": 810 }, { "epoch": 0.481786133960047, "grad_norm": 2.0729994773864746, "learning_rate": 9.037602820211515e-07, "loss": 6.242, "step": 820 }, { "epoch": 0.48766157461809634, "grad_norm": 1.8701937198638916, "learning_rate": 9.025851938895417e-07, "loss": 6.1222, "step": 830 }, { "epoch": 0.4935370152761457, "grad_norm": 1.851508617401123, "learning_rate": 9.014101057579317e-07, "loss": 6.297, "step": 840 }, { "epoch": 0.4994124559341951, "grad_norm": 1.8502558469772339, "learning_rate": 9.002350176263219e-07, "loss": 6.2895, "step": 850 }, { "epoch": 0.4994124559341951, "eval_loss": 1.5294647216796875, "eval_runtime": 67.5444, "eval_samples_per_second": 21.23, "eval_steps_per_second": 2.665, "step": 850 }, { "epoch": 0.5052878965922444, "grad_norm": 1.861267328262329, "learning_rate": 8.990599294947121e-07, "loss": 6.0995, "step": 860 }, { "epoch": 0.5111633372502937, "grad_norm": 1.8467332124710083, "learning_rate": 8.978848413631021e-07, "loss": 6.2265, "step": 870 }, { "epoch": 0.5170387779083431, "grad_norm": 1.7630133628845215, "learning_rate": 8.967097532314923e-07, "loss": 6.0044, "step": 880 }, { "epoch": 0.5229142185663925, "grad_norm": 1.6147162914276123, "learning_rate": 8.955346650998825e-07, "loss": 6.1896, "step": 890 }, { "epoch": 0.5287896592244419, "grad_norm": 1.9183772802352905, "learning_rate": 8.943595769682726e-07, "loss": 6.0518, "step": 900 }, { "epoch": 0.5287896592244419, "eval_loss": 1.5241233110427856, "eval_runtime": 67.5042, "eval_samples_per_second": 21.243, "eval_steps_per_second": 2.667, "step": 900 }, { "epoch": 0.5346650998824912, "grad_norm": 1.999889850616455, "learning_rate": 8.931844888366628e-07, "loss": 6.1402, "step": 910 }, { "epoch": 0.5405405405405406, "grad_norm": 1.853894829750061, "learning_rate": 8.920094007050529e-07, "loss": 6.1626, "step": 920 }, { "epoch": 0.5464159811985899, "grad_norm": 1.6458221673965454, "learning_rate": 8.90834312573443e-07, "loss": 6.0245, "step": 930 }, { "epoch": 0.5522914218566393, "grad_norm": 1.8022114038467407, "learning_rate": 8.896592244418331e-07, "loss": 6.0397, "step": 940 }, { "epoch": 0.5581668625146886, "grad_norm": 1.8993277549743652, "learning_rate": 8.884841363102233e-07, "loss": 6.2759, "step": 950 }, { "epoch": 0.5581668625146886, "eval_loss": 1.5192291736602783, "eval_runtime": 67.5518, "eval_samples_per_second": 21.228, "eval_steps_per_second": 2.665, "step": 950 }, { "epoch": 0.564042303172738, "grad_norm": 1.7591309547424316, "learning_rate": 8.873090481786134e-07, "loss": 6.1107, "step": 960 }, { "epoch": 0.5699177438307873, "grad_norm": 1.8564950227737427, "learning_rate": 8.861339600470035e-07, "loss": 6.0074, "step": 970 }, { "epoch": 0.5757931844888367, "grad_norm": 1.7324663400650024, "learning_rate": 8.849588719153937e-07, "loss": 5.9752, "step": 980 }, { "epoch": 0.581668625146886, "grad_norm": 1.9091726541519165, "learning_rate": 8.837837837837837e-07, "loss": 6.0551, "step": 990 }, { "epoch": 0.5875440658049353, "grad_norm": 1.667810082435608, "learning_rate": 8.826086956521739e-07, "loss": 6.1355, "step": 1000 }, { "epoch": 0.5875440658049353, "eval_loss": 1.5135389566421509, "eval_runtime": 67.5223, "eval_samples_per_second": 21.237, "eval_steps_per_second": 2.666, "step": 1000 }, { "epoch": 0.5934195064629847, "grad_norm": 2.0499677658081055, "learning_rate": 8.81433607520564e-07, "loss": 5.9337, "step": 1010 }, { "epoch": 0.599294947121034, "grad_norm": 2.237178087234497, "learning_rate": 8.802585193889541e-07, "loss": 6.1225, "step": 1020 }, { "epoch": 0.6051703877790834, "grad_norm": 1.904250144958496, "learning_rate": 8.790834312573443e-07, "loss": 6.1227, "step": 1030 }, { "epoch": 0.6110458284371327, "grad_norm": 1.9532405138015747, "learning_rate": 8.779083431257344e-07, "loss": 6.0628, "step": 1040 }, { "epoch": 0.6169212690951822, "grad_norm": 1.8243640661239624, "learning_rate": 8.767332549941245e-07, "loss": 5.956, "step": 1050 }, { "epoch": 0.6169212690951822, "eval_loss": 1.5078574419021606, "eval_runtime": 67.6452, "eval_samples_per_second": 21.199, "eval_steps_per_second": 2.661, "step": 1050 }, { "epoch": 0.6227967097532315, "grad_norm": 1.8850717544555664, "learning_rate": 8.755581668625146e-07, "loss": 6.1356, "step": 1060 }, { "epoch": 0.6286721504112809, "grad_norm": 1.7223460674285889, "learning_rate": 8.743830787309048e-07, "loss": 5.8176, "step": 1070 }, { "epoch": 0.6345475910693302, "grad_norm": 1.873952865600586, "learning_rate": 8.732079905992949e-07, "loss": 6.1002, "step": 1080 }, { "epoch": 0.6404230317273796, "grad_norm": 1.7804756164550781, "learning_rate": 8.72032902467685e-07, "loss": 6.1699, "step": 1090 }, { "epoch": 0.6462984723854289, "grad_norm": 1.8307634592056274, "learning_rate": 8.708578143360752e-07, "loss": 6.089, "step": 1100 }, { "epoch": 0.6462984723854289, "eval_loss": 1.5017292499542236, "eval_runtime": 67.5101, "eval_samples_per_second": 21.241, "eval_steps_per_second": 2.666, "step": 1100 }, { "epoch": 0.6521739130434783, "grad_norm": 2.105025053024292, "learning_rate": 8.696827262044652e-07, "loss": 6.1025, "step": 1110 }, { "epoch": 0.6580493537015276, "grad_norm": 1.729182481765747, "learning_rate": 8.685076380728554e-07, "loss": 6.004, "step": 1120 }, { "epoch": 0.663924794359577, "grad_norm": 2.012986183166504, "learning_rate": 8.673325499412456e-07, "loss": 6.1159, "step": 1130 }, { "epoch": 0.6698002350176263, "grad_norm": 1.7573076486587524, "learning_rate": 8.661574618096356e-07, "loss": 6.075, "step": 1140 }, { "epoch": 0.6756756756756757, "grad_norm": 1.7264623641967773, "learning_rate": 8.649823736780258e-07, "loss": 5.8563, "step": 1150 }, { "epoch": 0.6756756756756757, "eval_loss": 1.4951844215393066, "eval_runtime": 67.5809, "eval_samples_per_second": 21.219, "eval_steps_per_second": 2.663, "step": 1150 }, { "epoch": 0.681551116333725, "grad_norm": 1.9470430612564087, "learning_rate": 8.638072855464159e-07, "loss": 5.8498, "step": 1160 }, { "epoch": 0.6874265569917744, "grad_norm": 1.6648173332214355, "learning_rate": 8.626321974148061e-07, "loss": 6.0192, "step": 1170 }, { "epoch": 0.6933019976498237, "grad_norm": 1.784105896949768, "learning_rate": 8.614571092831961e-07, "loss": 6.0703, "step": 1180 }, { "epoch": 0.699177438307873, "grad_norm": 1.6299229860305786, "learning_rate": 8.602820211515863e-07, "loss": 6.0794, "step": 1190 }, { "epoch": 0.7050528789659224, "grad_norm": 1.8894709348678589, "learning_rate": 8.591069330199765e-07, "loss": 5.9203, "step": 1200 }, { "epoch": 0.7050528789659224, "eval_loss": 1.4896841049194336, "eval_runtime": 67.5564, "eval_samples_per_second": 21.227, "eval_steps_per_second": 2.664, "step": 1200 }, { "epoch": 0.7109283196239718, "grad_norm": 1.8506622314453125, "learning_rate": 8.579318448883665e-07, "loss": 6.1517, "step": 1210 }, { "epoch": 0.7168037602820212, "grad_norm": 1.5787792205810547, "learning_rate": 8.567567567567567e-07, "loss": 5.932, "step": 1220 }, { "epoch": 0.7226792009400705, "grad_norm": 1.9385451078414917, "learning_rate": 8.555816686251468e-07, "loss": 6.1204, "step": 1230 }, { "epoch": 0.7285546415981199, "grad_norm": 1.789788842201233, "learning_rate": 8.54406580493537e-07, "loss": 6.0878, "step": 1240 }, { "epoch": 0.7344300822561692, "grad_norm": 1.9521713256835938, "learning_rate": 8.532314923619272e-07, "loss": 6.0651, "step": 1250 }, { "epoch": 0.7344300822561692, "eval_loss": 1.4861587285995483, "eval_runtime": 78.0463, "eval_samples_per_second": 18.374, "eval_steps_per_second": 2.306, "step": 1250 }, { "epoch": 0.7403055229142186, "grad_norm": 1.9088025093078613, "learning_rate": 8.520564042303173e-07, "loss": 6.0032, "step": 1260 }, { "epoch": 0.7461809635722679, "grad_norm": 2.0229740142822266, "learning_rate": 8.508813160987074e-07, "loss": 6.1724, "step": 1270 }, { "epoch": 0.7520564042303173, "grad_norm": 1.7247604131698608, "learning_rate": 8.497062279670975e-07, "loss": 5.9501, "step": 1280 }, { "epoch": 0.7579318448883666, "grad_norm": 2.1122665405273438, "learning_rate": 8.485311398354877e-07, "loss": 5.8399, "step": 1290 }, { "epoch": 0.763807285546416, "grad_norm": 1.9144885540008545, "learning_rate": 8.473560517038778e-07, "loss": 6.0293, "step": 1300 }, { "epoch": 0.763807285546416, "eval_loss": 1.4840021133422852, "eval_runtime": 67.75, "eval_samples_per_second": 21.166, "eval_steps_per_second": 2.657, "step": 1300 }, { "epoch": 0.7696827262044653, "grad_norm": 1.7198468446731567, "learning_rate": 8.461809635722679e-07, "loss": 6.0714, "step": 1310 }, { "epoch": 0.7755581668625147, "grad_norm": 1.7803094387054443, "learning_rate": 8.450058754406581e-07, "loss": 5.9993, "step": 1320 }, { "epoch": 0.781433607520564, "grad_norm": 1.9184415340423584, "learning_rate": 8.438307873090481e-07, "loss": 5.9439, "step": 1330 }, { "epoch": 0.7873090481786134, "grad_norm": 1.9405663013458252, "learning_rate": 8.426556991774383e-07, "loss": 6.0342, "step": 1340 }, { "epoch": 0.7931844888366627, "grad_norm": 1.9659658670425415, "learning_rate": 8.414806110458284e-07, "loss": 5.8654, "step": 1350 }, { "epoch": 0.7931844888366627, "eval_loss": 1.4824680089950562, "eval_runtime": 67.5038, "eval_samples_per_second": 21.243, "eval_steps_per_second": 2.667, "step": 1350 }, { "epoch": 0.799059929494712, "grad_norm": 1.8041818141937256, "learning_rate": 8.403055229142185e-07, "loss": 5.8713, "step": 1360 }, { "epoch": 0.8049353701527615, "grad_norm": 1.7908101081848145, "learning_rate": 8.391304347826087e-07, "loss": 5.904, "step": 1370 }, { "epoch": 0.8108108108108109, "grad_norm": 1.6884026527404785, "learning_rate": 8.379553466509988e-07, "loss": 6.3144, "step": 1380 }, { "epoch": 0.8166862514688602, "grad_norm": 1.9209022521972656, "learning_rate": 8.367802585193889e-07, "loss": 6.0199, "step": 1390 }, { "epoch": 0.8225616921269095, "grad_norm": 1.7688874006271362, "learning_rate": 8.35605170387779e-07, "loss": 5.957, "step": 1400 }, { "epoch": 0.8225616921269095, "eval_loss": 1.4813125133514404, "eval_runtime": 67.3592, "eval_samples_per_second": 21.289, "eval_steps_per_second": 2.672, "step": 1400 }, { "epoch": 0.8284371327849589, "grad_norm": 1.8281030654907227, "learning_rate": 8.344300822561692e-07, "loss": 5.7265, "step": 1410 }, { "epoch": 0.8343125734430082, "grad_norm": 1.7813804149627686, "learning_rate": 8.332549941245593e-07, "loss": 5.9138, "step": 1420 }, { "epoch": 0.8401880141010576, "grad_norm": 1.8841749429702759, "learning_rate": 8.320799059929494e-07, "loss": 5.93, "step": 1430 }, { "epoch": 0.8460634547591069, "grad_norm": 1.8778326511383057, "learning_rate": 8.309048178613396e-07, "loss": 6.0624, "step": 1440 }, { "epoch": 0.8519388954171563, "grad_norm": 1.534106969833374, "learning_rate": 8.297297297297296e-07, "loss": 5.9173, "step": 1450 }, { "epoch": 0.8519388954171563, "eval_loss": 1.4806052446365356, "eval_runtime": 67.443, "eval_samples_per_second": 21.262, "eval_steps_per_second": 2.669, "step": 1450 }, { "epoch": 0.8578143360752056, "grad_norm": 1.958788514137268, "learning_rate": 8.285546415981198e-07, "loss": 5.9058, "step": 1460 }, { "epoch": 0.863689776733255, "grad_norm": 1.6875348091125488, "learning_rate": 8.2737955346651e-07, "loss": 6.071, "step": 1470 }, { "epoch": 0.8695652173913043, "grad_norm": 1.887682318687439, "learning_rate": 8.262044653349001e-07, "loss": 5.9213, "step": 1480 }, { "epoch": 0.8754406580493537, "grad_norm": 1.945660948753357, "learning_rate": 8.250293772032902e-07, "loss": 5.9722, "step": 1490 }, { "epoch": 0.881316098707403, "grad_norm": 1.9587616920471191, "learning_rate": 8.238542890716803e-07, "loss": 5.9644, "step": 1500 }, { "epoch": 0.881316098707403, "eval_loss": 1.4798330068588257, "eval_runtime": 69.9429, "eval_samples_per_second": 20.502, "eval_steps_per_second": 2.574, "step": 1500 }, { "epoch": 0.8871915393654524, "grad_norm": 2.033848762512207, "learning_rate": 8.226792009400705e-07, "loss": 5.9035, "step": 1510 }, { "epoch": 0.8930669800235017, "grad_norm": 2.0481224060058594, "learning_rate": 8.215041128084605e-07, "loss": 5.9669, "step": 1520 }, { "epoch": 0.8989424206815512, "grad_norm": 1.684850811958313, "learning_rate": 8.203290246768507e-07, "loss": 5.7496, "step": 1530 }, { "epoch": 0.9048178613396005, "grad_norm": 1.7894434928894043, "learning_rate": 8.191539365452409e-07, "loss": 6.0756, "step": 1540 }, { "epoch": 0.9106933019976499, "grad_norm": 1.8205320835113525, "learning_rate": 8.179788484136309e-07, "loss": 6.1865, "step": 1550 }, { "epoch": 0.9106933019976499, "eval_loss": 1.4793447256088257, "eval_runtime": 67.3984, "eval_samples_per_second": 21.276, "eval_steps_per_second": 2.671, "step": 1550 }, { "epoch": 0.9165687426556992, "grad_norm": 2.025639057159424, "learning_rate": 8.168037602820211e-07, "loss": 6.1506, "step": 1560 }, { "epoch": 0.9224441833137486, "grad_norm": 1.745783805847168, "learning_rate": 8.156286721504112e-07, "loss": 6.0317, "step": 1570 }, { "epoch": 0.9283196239717979, "grad_norm": 1.8073749542236328, "learning_rate": 8.144535840188013e-07, "loss": 6.0357, "step": 1580 }, { "epoch": 0.9341950646298472, "grad_norm": 1.9718337059020996, "learning_rate": 8.132784958871916e-07, "loss": 5.9024, "step": 1590 }, { "epoch": 0.9400705052878966, "grad_norm": 1.7604055404663086, "learning_rate": 8.121034077555817e-07, "loss": 5.8952, "step": 1600 }, { "epoch": 0.9400705052878966, "eval_loss": 1.4788146018981934, "eval_runtime": 67.3877, "eval_samples_per_second": 21.28, "eval_steps_per_second": 2.671, "step": 1600 }, { "epoch": 0.9459459459459459, "grad_norm": 1.9103364944458008, "learning_rate": 8.109283196239718e-07, "loss": 5.9051, "step": 1610 }, { "epoch": 0.9518213866039953, "grad_norm": 1.6583188772201538, "learning_rate": 8.097532314923619e-07, "loss": 5.864, "step": 1620 }, { "epoch": 0.9576968272620446, "grad_norm": 1.8631893396377563, "learning_rate": 8.085781433607521e-07, "loss": 5.8381, "step": 1630 }, { "epoch": 0.963572267920094, "grad_norm": 1.9318718910217285, "learning_rate": 8.074030552291421e-07, "loss": 5.941, "step": 1640 }, { "epoch": 0.9694477085781433, "grad_norm": 1.7922627925872803, "learning_rate": 8.062279670975323e-07, "loss": 5.9733, "step": 1650 }, { "epoch": 0.9694477085781433, "eval_loss": 1.4783855676651, "eval_runtime": 67.5032, "eval_samples_per_second": 21.243, "eval_steps_per_second": 2.667, "step": 1650 }, { "epoch": 0.9753231492361927, "grad_norm": 1.6979329586029053, "learning_rate": 8.050528789659225e-07, "loss": 6.077, "step": 1660 }, { "epoch": 0.981198589894242, "grad_norm": 1.6366304159164429, "learning_rate": 8.038777908343125e-07, "loss": 5.804, "step": 1670 }, { "epoch": 0.9870740305522914, "grad_norm": 1.5034892559051514, "learning_rate": 8.027027027027027e-07, "loss": 5.7737, "step": 1680 }, { "epoch": 0.9929494712103408, "grad_norm": 1.487920880317688, "learning_rate": 8.015276145710928e-07, "loss": 5.879, "step": 1690 }, { "epoch": 0.9988249118683902, "grad_norm": 1.7758818864822388, "learning_rate": 8.003525264394829e-07, "loss": 6.015, "step": 1700 }, { "epoch": 0.9988249118683902, "eval_loss": 1.477812647819519, "eval_runtime": 67.3925, "eval_samples_per_second": 21.278, "eval_steps_per_second": 2.671, "step": 1700 }, { "epoch": 1.0047003525264395, "grad_norm": 1.8898565769195557, "learning_rate": 7.991774383078731e-07, "loss": 5.8394, "step": 1710 }, { "epoch": 1.0105757931844888, "grad_norm": 1.7957675457000732, "learning_rate": 7.980023501762632e-07, "loss": 5.9171, "step": 1720 }, { "epoch": 1.0164512338425382, "grad_norm": 1.4734153747558594, "learning_rate": 7.968272620446533e-07, "loss": 5.7544, "step": 1730 }, { "epoch": 1.0223266745005875, "grad_norm": 1.8453232049942017, "learning_rate": 7.956521739130434e-07, "loss": 5.7172, "step": 1740 }, { "epoch": 1.028202115158637, "grad_norm": 1.6651732921600342, "learning_rate": 7.944770857814336e-07, "loss": 5.7981, "step": 1750 }, { "epoch": 1.028202115158637, "eval_loss": 1.4773787260055542, "eval_runtime": 67.4079, "eval_samples_per_second": 21.273, "eval_steps_per_second": 2.67, "step": 1750 }, { "epoch": 1.0340775558166861, "grad_norm": 1.9795799255371094, "learning_rate": 7.933019976498237e-07, "loss": 5.7833, "step": 1760 }, { "epoch": 1.0399529964747356, "grad_norm": 2.128406286239624, "learning_rate": 7.921269095182138e-07, "loss": 6.1611, "step": 1770 }, { "epoch": 1.045828437132785, "grad_norm": 1.7242544889450073, "learning_rate": 7.90951821386604e-07, "loss": 5.8551, "step": 1780 }, { "epoch": 1.0517038777908343, "grad_norm": 1.89352285861969, "learning_rate": 7.89776733254994e-07, "loss": 5.9303, "step": 1790 }, { "epoch": 1.0575793184488838, "grad_norm": 1.7971441745758057, "learning_rate": 7.886016451233842e-07, "loss": 5.9246, "step": 1800 }, { "epoch": 1.0575793184488838, "eval_loss": 1.476963996887207, "eval_runtime": 67.356, "eval_samples_per_second": 21.29, "eval_steps_per_second": 2.672, "step": 1800 }, { "epoch": 1.063454759106933, "grad_norm": 1.8786916732788086, "learning_rate": 7.874265569917743e-07, "loss": 5.7856, "step": 1810 }, { "epoch": 1.0693301997649824, "grad_norm": 1.9047880172729492, "learning_rate": 7.862514688601645e-07, "loss": 6.0362, "step": 1820 }, { "epoch": 1.0752056404230317, "grad_norm": 1.9103033542633057, "learning_rate": 7.850763807285546e-07, "loss": 5.8908, "step": 1830 }, { "epoch": 1.0810810810810811, "grad_norm": 2.0070149898529053, "learning_rate": 7.839012925969447e-07, "loss": 5.982, "step": 1840 }, { "epoch": 1.0869565217391304, "grad_norm": 1.5143649578094482, "learning_rate": 7.827262044653349e-07, "loss": 5.8349, "step": 1850 }, { "epoch": 1.0869565217391304, "eval_loss": 1.4763119220733643, "eval_runtime": 67.3329, "eval_samples_per_second": 21.297, "eval_steps_per_second": 2.673, "step": 1850 }, { "epoch": 1.0928319623971798, "grad_norm": 1.6700143814086914, "learning_rate": 7.815511163337249e-07, "loss": 6.0503, "step": 1860 }, { "epoch": 1.098707403055229, "grad_norm": 1.734837532043457, "learning_rate": 7.803760282021151e-07, "loss": 5.9907, "step": 1870 }, { "epoch": 1.1045828437132785, "grad_norm": 1.778960943222046, "learning_rate": 7.792009400705053e-07, "loss": 5.6846, "step": 1880 }, { "epoch": 1.1104582843713278, "grad_norm": 2.055248498916626, "learning_rate": 7.780258519388953e-07, "loss": 6.0658, "step": 1890 }, { "epoch": 1.1163337250293772, "grad_norm": 2.000680923461914, "learning_rate": 7.768507638072855e-07, "loss": 5.9983, "step": 1900 }, { "epoch": 1.1163337250293772, "eval_loss": 1.4759562015533447, "eval_runtime": 67.4275, "eval_samples_per_second": 21.267, "eval_steps_per_second": 2.67, "step": 1900 }, { "epoch": 1.1222091656874265, "grad_norm": 1.8254281282424927, "learning_rate": 7.756756756756756e-07, "loss": 5.9185, "step": 1910 }, { "epoch": 1.128084606345476, "grad_norm": 1.8100814819335938, "learning_rate": 7.745005875440657e-07, "loss": 5.9912, "step": 1920 }, { "epoch": 1.1339600470035252, "grad_norm": 1.7456374168395996, "learning_rate": 7.73325499412456e-07, "loss": 5.8861, "step": 1930 }, { "epoch": 1.1398354876615746, "grad_norm": 1.508423089981079, "learning_rate": 7.721504112808461e-07, "loss": 5.7021, "step": 1940 }, { "epoch": 1.145710928319624, "grad_norm": 2.055159330368042, "learning_rate": 7.709753231492362e-07, "loss": 6.0077, "step": 1950 }, { "epoch": 1.145710928319624, "eval_loss": 1.4756381511688232, "eval_runtime": 67.3529, "eval_samples_per_second": 21.291, "eval_steps_per_second": 2.672, "step": 1950 }, { "epoch": 1.1515863689776733, "grad_norm": 1.5550910234451294, "learning_rate": 7.698002350176263e-07, "loss": 6.0144, "step": 1960 }, { "epoch": 1.1574618096357228, "grad_norm": 1.627854585647583, "learning_rate": 7.686251468860165e-07, "loss": 5.9242, "step": 1970 }, { "epoch": 1.163337250293772, "grad_norm": 1.8871314525604248, "learning_rate": 7.674500587544065e-07, "loss": 5.8759, "step": 1980 }, { "epoch": 1.1692126909518215, "grad_norm": 1.6970958709716797, "learning_rate": 7.662749706227967e-07, "loss": 5.7471, "step": 1990 }, { "epoch": 1.1750881316098707, "grad_norm": 2.148339033126831, "learning_rate": 7.650998824911869e-07, "loss": 5.932, "step": 2000 }, { "epoch": 1.1750881316098707, "eval_loss": 1.4752864837646484, "eval_runtime": 67.3674, "eval_samples_per_second": 21.286, "eval_steps_per_second": 2.672, "step": 2000 }, { "epoch": 1.1809635722679201, "grad_norm": 1.8196816444396973, "learning_rate": 7.639247943595769e-07, "loss": 5.8354, "step": 2010 }, { "epoch": 1.1868390129259694, "grad_norm": 1.5692166090011597, "learning_rate": 7.627497062279671e-07, "loss": 6.0992, "step": 2020 }, { "epoch": 1.1927144535840188, "grad_norm": 1.7445123195648193, "learning_rate": 7.615746180963572e-07, "loss": 5.8826, "step": 2030 }, { "epoch": 1.198589894242068, "grad_norm": 1.774656891822815, "learning_rate": 7.603995299647473e-07, "loss": 5.7213, "step": 2040 }, { "epoch": 1.2044653349001175, "grad_norm": 1.7705199718475342, "learning_rate": 7.592244418331375e-07, "loss": 6.0987, "step": 2050 }, { "epoch": 1.2044653349001175, "eval_loss": 1.474990725517273, "eval_runtime": 67.3591, "eval_samples_per_second": 21.289, "eval_steps_per_second": 2.672, "step": 2050 }, { "epoch": 1.2103407755581668, "grad_norm": 1.7765486240386963, "learning_rate": 7.580493537015276e-07, "loss": 5.9866, "step": 2060 }, { "epoch": 1.2162162162162162, "grad_norm": 1.877685785293579, "learning_rate": 7.568742655699177e-07, "loss": 5.9616, "step": 2070 }, { "epoch": 1.2220916568742655, "grad_norm": 1.8580436706542969, "learning_rate": 7.556991774383078e-07, "loss": 5.9441, "step": 2080 }, { "epoch": 1.227967097532315, "grad_norm": 1.7666056156158447, "learning_rate": 7.54524089306698e-07, "loss": 5.8912, "step": 2090 }, { "epoch": 1.2338425381903644, "grad_norm": 1.9045265913009644, "learning_rate": 7.533490011750881e-07, "loss": 5.7918, "step": 2100 }, { "epoch": 1.2338425381903644, "eval_loss": 1.4744936227798462, "eval_runtime": 67.3793, "eval_samples_per_second": 21.283, "eval_steps_per_second": 2.671, "step": 2100 }, { "epoch": 1.2397179788484136, "grad_norm": 1.8948485851287842, "learning_rate": 7.521739130434782e-07, "loss": 6.0362, "step": 2110 }, { "epoch": 1.245593419506463, "grad_norm": 1.8872965574264526, "learning_rate": 7.509988249118684e-07, "loss": 5.8342, "step": 2120 }, { "epoch": 1.2514688601645123, "grad_norm": 1.5916881561279297, "learning_rate": 7.498237367802584e-07, "loss": 5.8995, "step": 2130 }, { "epoch": 1.2573443008225618, "grad_norm": 1.6878283023834229, "learning_rate": 7.486486486486486e-07, "loss": 5.79, "step": 2140 }, { "epoch": 1.263219741480611, "grad_norm": 1.6764466762542725, "learning_rate": 7.474735605170387e-07, "loss": 5.9001, "step": 2150 }, { "epoch": 1.263219741480611, "eval_loss": 1.4742045402526855, "eval_runtime": 67.3898, "eval_samples_per_second": 21.279, "eval_steps_per_second": 2.671, "step": 2150 }, { "epoch": 1.2690951821386605, "grad_norm": 1.6931419372558594, "learning_rate": 7.462984723854289e-07, "loss": 6.0569, "step": 2160 }, { "epoch": 1.2749706227967097, "grad_norm": 1.604083776473999, "learning_rate": 7.45123384253819e-07, "loss": 6.0979, "step": 2170 }, { "epoch": 1.2808460634547592, "grad_norm": 1.7342679500579834, "learning_rate": 7.439482961222091e-07, "loss": 5.771, "step": 2180 }, { "epoch": 1.2867215041128084, "grad_norm": 1.5740374326705933, "learning_rate": 7.427732079905993e-07, "loss": 6.0591, "step": 2190 }, { "epoch": 1.2925969447708578, "grad_norm": 1.7753512859344482, "learning_rate": 7.415981198589893e-07, "loss": 5.839, "step": 2200 }, { "epoch": 1.2925969447708578, "eval_loss": 1.473833680152893, "eval_runtime": 67.3634, "eval_samples_per_second": 21.288, "eval_steps_per_second": 2.672, "step": 2200 }, { "epoch": 1.2984723854289073, "grad_norm": 1.9094125032424927, "learning_rate": 7.404230317273795e-07, "loss": 5.9792, "step": 2210 }, { "epoch": 1.3043478260869565, "grad_norm": 1.6728532314300537, "learning_rate": 7.392479435957697e-07, "loss": 5.9578, "step": 2220 }, { "epoch": 1.3102232667450058, "grad_norm": 1.6236289739608765, "learning_rate": 7.380728554641597e-07, "loss": 5.742, "step": 2230 }, { "epoch": 1.3160987074030552, "grad_norm": 1.7581902742385864, "learning_rate": 7.368977673325499e-07, "loss": 6.0485, "step": 2240 }, { "epoch": 1.3219741480611047, "grad_norm": 1.5793126821517944, "learning_rate": 7.3572267920094e-07, "loss": 5.8889, "step": 2250 }, { "epoch": 1.3219741480611047, "eval_loss": 1.4734312295913696, "eval_runtime": 67.3603, "eval_samples_per_second": 21.288, "eval_steps_per_second": 2.672, "step": 2250 }, { "epoch": 1.327849588719154, "grad_norm": 1.8450642824172974, "learning_rate": 7.345475910693301e-07, "loss": 5.8915, "step": 2260 }, { "epoch": 1.3337250293772032, "grad_norm": 1.5437251329421997, "learning_rate": 7.333725029377203e-07, "loss": 6.0109, "step": 2270 }, { "epoch": 1.3396004700352526, "grad_norm": 1.9785826206207275, "learning_rate": 7.321974148061105e-07, "loss": 6.0857, "step": 2280 }, { "epoch": 1.345475910693302, "grad_norm": 1.6962827444076538, "learning_rate": 7.310223266745006e-07, "loss": 6.0538, "step": 2290 }, { "epoch": 1.3513513513513513, "grad_norm": 1.6559593677520752, "learning_rate": 7.298472385428907e-07, "loss": 5.8229, "step": 2300 }, { "epoch": 1.3513513513513513, "eval_loss": 1.473131537437439, "eval_runtime": 67.3467, "eval_samples_per_second": 21.293, "eval_steps_per_second": 2.673, "step": 2300 }, { "epoch": 1.3572267920094008, "grad_norm": 1.7718429565429688, "learning_rate": 7.286721504112809e-07, "loss": 5.7397, "step": 2310 }, { "epoch": 1.36310223266745, "grad_norm": 2.0191490650177, "learning_rate": 7.274970622796709e-07, "loss": 5.8808, "step": 2320 }, { "epoch": 1.3689776733254995, "grad_norm": 1.874172329902649, "learning_rate": 7.263219741480611e-07, "loss": 5.8991, "step": 2330 }, { "epoch": 1.3748531139835487, "grad_norm": 2.0867104530334473, "learning_rate": 7.251468860164513e-07, "loss": 6.058, "step": 2340 }, { "epoch": 1.3807285546415982, "grad_norm": 1.8972036838531494, "learning_rate": 7.239717978848413e-07, "loss": 5.9622, "step": 2350 }, { "epoch": 1.3807285546415982, "eval_loss": 1.4728530645370483, "eval_runtime": 67.4, "eval_samples_per_second": 21.276, "eval_steps_per_second": 2.671, "step": 2350 }, { "epoch": 1.3866039952996474, "grad_norm": 1.6675537824630737, "learning_rate": 7.227967097532315e-07, "loss": 5.7922, "step": 2360 }, { "epoch": 1.3924794359576969, "grad_norm": 1.9455453157424927, "learning_rate": 7.216216216216216e-07, "loss": 5.7635, "step": 2370 }, { "epoch": 1.398354876615746, "grad_norm": 1.9944945573806763, "learning_rate": 7.204465334900117e-07, "loss": 5.9451, "step": 2380 }, { "epoch": 1.4042303172737955, "grad_norm": 1.7845548391342163, "learning_rate": 7.192714453584019e-07, "loss": 5.8706, "step": 2390 }, { "epoch": 1.410105757931845, "grad_norm": 1.5239243507385254, "learning_rate": 7.18096357226792e-07, "loss": 5.6772, "step": 2400 }, { "epoch": 1.410105757931845, "eval_loss": 1.472511887550354, "eval_runtime": 67.3938, "eval_samples_per_second": 21.278, "eval_steps_per_second": 2.671, "step": 2400 }, { "epoch": 1.4159811985898942, "grad_norm": 1.8625153303146362, "learning_rate": 7.169212690951821e-07, "loss": 5.971, "step": 2410 }, { "epoch": 1.4218566392479435, "grad_norm": 1.6709333658218384, "learning_rate": 7.157461809635722e-07, "loss": 5.768, "step": 2420 }, { "epoch": 1.427732079905993, "grad_norm": 1.7736382484436035, "learning_rate": 7.145710928319624e-07, "loss": 5.9641, "step": 2430 }, { "epoch": 1.4336075205640424, "grad_norm": 1.7415990829467773, "learning_rate": 7.133960047003526e-07, "loss": 5.8895, "step": 2440 }, { "epoch": 1.4394829612220916, "grad_norm": 1.5600135326385498, "learning_rate": 7.122209165687426e-07, "loss": 5.8265, "step": 2450 }, { "epoch": 1.4394829612220916, "eval_loss": 1.4722115993499756, "eval_runtime": 67.4064, "eval_samples_per_second": 21.274, "eval_steps_per_second": 2.67, "step": 2450 }, { "epoch": 1.445358401880141, "grad_norm": 1.6844279766082764, "learning_rate": 7.110458284371328e-07, "loss": 5.9639, "step": 2460 }, { "epoch": 1.4512338425381903, "grad_norm": 2.118544816970825, "learning_rate": 7.098707403055229e-07, "loss": 5.8694, "step": 2470 }, { "epoch": 1.4571092831962398, "grad_norm": 2.1383907794952393, "learning_rate": 7.08695652173913e-07, "loss": 6.1653, "step": 2480 }, { "epoch": 1.462984723854289, "grad_norm": 1.7942463159561157, "learning_rate": 7.075205640423031e-07, "loss": 5.9392, "step": 2490 }, { "epoch": 1.4688601645123385, "grad_norm": 1.9785916805267334, "learning_rate": 7.063454759106933e-07, "loss": 5.8598, "step": 2500 }, { "epoch": 1.4688601645123385, "eval_loss": 1.4719326496124268, "eval_runtime": 70.2328, "eval_samples_per_second": 20.418, "eval_steps_per_second": 2.563, "step": 2500 }, { "epoch": 1.4747356051703877, "grad_norm": 1.9141045808792114, "learning_rate": 7.051703877790834e-07, "loss": 5.8666, "step": 2510 }, { "epoch": 1.4806110458284372, "grad_norm": 1.8248971700668335, "learning_rate": 7.039952996474735e-07, "loss": 5.899, "step": 2520 }, { "epoch": 1.4864864864864864, "grad_norm": 1.5081406831741333, "learning_rate": 7.028202115158637e-07, "loss": 5.913, "step": 2530 }, { "epoch": 1.4923619271445359, "grad_norm": 1.5788573026657104, "learning_rate": 7.016451233842537e-07, "loss": 5.9105, "step": 2540 }, { "epoch": 1.4982373678025853, "grad_norm": 1.781790018081665, "learning_rate": 7.004700352526439e-07, "loss": 5.8894, "step": 2550 }, { "epoch": 1.4982373678025853, "eval_loss": 1.4717662334442139, "eval_runtime": 67.4015, "eval_samples_per_second": 21.275, "eval_steps_per_second": 2.671, "step": 2550 }, { "epoch": 1.5041128084606346, "grad_norm": 1.9443302154541016, "learning_rate": 6.992949471210341e-07, "loss": 5.9698, "step": 2560 }, { "epoch": 1.5099882491186838, "grad_norm": 1.4953645467758179, "learning_rate": 6.981198589894241e-07, "loss": 5.9081, "step": 2570 }, { "epoch": 1.5158636897767332, "grad_norm": 1.9432063102722168, "learning_rate": 6.969447708578143e-07, "loss": 5.7949, "step": 2580 }, { "epoch": 1.5217391304347827, "grad_norm": 2.1520416736602783, "learning_rate": 6.957696827262044e-07, "loss": 5.9385, "step": 2590 }, { "epoch": 1.527614571092832, "grad_norm": 1.7321327924728394, "learning_rate": 6.945945945945945e-07, "loss": 5.9739, "step": 2600 }, { "epoch": 1.527614571092832, "eval_loss": 1.4715373516082764, "eval_runtime": 67.3781, "eval_samples_per_second": 21.283, "eval_steps_per_second": 2.671, "step": 2600 }, { "epoch": 1.5334900117508812, "grad_norm": 1.9069325923919678, "learning_rate": 6.934195064629846e-07, "loss": 6.1236, "step": 2610 }, { "epoch": 1.5393654524089306, "grad_norm": 1.6319619417190552, "learning_rate": 6.922444183313748e-07, "loss": 5.8563, "step": 2620 }, { "epoch": 1.54524089306698, "grad_norm": 1.8981560468673706, "learning_rate": 6.91069330199765e-07, "loss": 5.8279, "step": 2630 }, { "epoch": 1.5511163337250293, "grad_norm": 1.9158369302749634, "learning_rate": 6.89894242068155e-07, "loss": 5.9491, "step": 2640 }, { "epoch": 1.5569917743830788, "grad_norm": 1.7800869941711426, "learning_rate": 6.887191539365453e-07, "loss": 5.9947, "step": 2650 }, { "epoch": 1.5569917743830788, "eval_loss": 1.4711698293685913, "eval_runtime": 67.3987, "eval_samples_per_second": 21.276, "eval_steps_per_second": 2.671, "step": 2650 }, { "epoch": 1.5628672150411282, "grad_norm": 1.9000372886657715, "learning_rate": 6.875440658049353e-07, "loss": 6.0369, "step": 2660 }, { "epoch": 1.5687426556991775, "grad_norm": 1.7624439001083374, "learning_rate": 6.863689776733255e-07, "loss": 6.0012, "step": 2670 }, { "epoch": 1.5746180963572267, "grad_norm": 1.9102165699005127, "learning_rate": 6.851938895417157e-07, "loss": 6.0187, "step": 2680 }, { "epoch": 1.5804935370152762, "grad_norm": 1.7985962629318237, "learning_rate": 6.840188014101057e-07, "loss": 5.8977, "step": 2690 }, { "epoch": 1.5863689776733256, "grad_norm": 1.7566959857940674, "learning_rate": 6.828437132784959e-07, "loss": 5.9648, "step": 2700 }, { "epoch": 1.5863689776733256, "eval_loss": 1.4709213972091675, "eval_runtime": 67.4381, "eval_samples_per_second": 21.264, "eval_steps_per_second": 2.669, "step": 2700 }, { "epoch": 1.5922444183313749, "grad_norm": 1.8974095582962036, "learning_rate": 6.81668625146886e-07, "loss": 5.8202, "step": 2710 }, { "epoch": 1.598119858989424, "grad_norm": 1.6938475370407104, "learning_rate": 6.804935370152761e-07, "loss": 5.8596, "step": 2720 }, { "epoch": 1.6039952996474736, "grad_norm": 1.7465293407440186, "learning_rate": 6.793184488836663e-07, "loss": 5.8589, "step": 2730 }, { "epoch": 1.609870740305523, "grad_norm": 2.00980806350708, "learning_rate": 6.781433607520564e-07, "loss": 5.7711, "step": 2740 }, { "epoch": 1.6157461809635723, "grad_norm": 1.6437867879867554, "learning_rate": 6.769682726204465e-07, "loss": 5.909, "step": 2750 }, { "epoch": 1.6157461809635723, "eval_loss": 1.4707252979278564, "eval_runtime": 67.4451, "eval_samples_per_second": 21.262, "eval_steps_per_second": 2.669, "step": 2750 }, { "epoch": 1.6216216216216215, "grad_norm": 1.5175350904464722, "learning_rate": 6.757931844888366e-07, "loss": 5.9722, "step": 2760 }, { "epoch": 1.627497062279671, "grad_norm": 2.1253652572631836, "learning_rate": 6.746180963572268e-07, "loss": 5.9066, "step": 2770 }, { "epoch": 1.6333725029377204, "grad_norm": 2.046537160873413, "learning_rate": 6.734430082256168e-07, "loss": 5.8499, "step": 2780 }, { "epoch": 1.6392479435957696, "grad_norm": 1.9087352752685547, "learning_rate": 6.72267920094007e-07, "loss": 5.8846, "step": 2790 }, { "epoch": 1.6451233842538189, "grad_norm": 1.858866572380066, "learning_rate": 6.710928319623972e-07, "loss": 6.1428, "step": 2800 }, { "epoch": 1.6451233842538189, "eval_loss": 1.4704252481460571, "eval_runtime": 67.4318, "eval_samples_per_second": 21.266, "eval_steps_per_second": 2.669, "step": 2800 }, { "epoch": 1.6509988249118686, "grad_norm": 1.888319492340088, "learning_rate": 6.699177438307873e-07, "loss": 5.9711, "step": 2810 }, { "epoch": 1.6568742655699178, "grad_norm": 2.5909926891326904, "learning_rate": 6.687426556991774e-07, "loss": 5.8139, "step": 2820 }, { "epoch": 1.662749706227967, "grad_norm": 1.7682013511657715, "learning_rate": 6.675675675675675e-07, "loss": 5.8262, "step": 2830 }, { "epoch": 1.6686251468860165, "grad_norm": 1.8746877908706665, "learning_rate": 6.663924794359577e-07, "loss": 5.9217, "step": 2840 }, { "epoch": 1.674500587544066, "grad_norm": 1.5268665552139282, "learning_rate": 6.652173913043478e-07, "loss": 5.7433, "step": 2850 }, { "epoch": 1.674500587544066, "eval_loss": 1.4701635837554932, "eval_runtime": 67.5227, "eval_samples_per_second": 21.237, "eval_steps_per_second": 2.666, "step": 2850 }, { "epoch": 1.6803760282021152, "grad_norm": 2.257277011871338, "learning_rate": 6.640423031727379e-07, "loss": 5.9719, "step": 2860 }, { "epoch": 1.6862514688601644, "grad_norm": 1.724713921546936, "learning_rate": 6.628672150411281e-07, "loss": 5.8062, "step": 2870 }, { "epoch": 1.6921269095182139, "grad_norm": 2.0070745944976807, "learning_rate": 6.616921269095181e-07, "loss": 5.8094, "step": 2880 }, { "epoch": 1.6980023501762633, "grad_norm": 1.8564118146896362, "learning_rate": 6.605170387779083e-07, "loss": 5.9552, "step": 2890 }, { "epoch": 1.7038777908343126, "grad_norm": 1.6099361181259155, "learning_rate": 6.593419506462985e-07, "loss": 5.8433, "step": 2900 }, { "epoch": 1.7038777908343126, "eval_loss": 1.4698939323425293, "eval_runtime": 67.3768, "eval_samples_per_second": 21.283, "eval_steps_per_second": 2.672, "step": 2900 }, { "epoch": 1.7097532314923618, "grad_norm": 1.7506616115570068, "learning_rate": 6.581668625146885e-07, "loss": 5.8262, "step": 2910 }, { "epoch": 1.7156286721504113, "grad_norm": 1.6937963962554932, "learning_rate": 6.569917743830787e-07, "loss": 5.753, "step": 2920 }, { "epoch": 1.7215041128084607, "grad_norm": 1.9550119638442993, "learning_rate": 6.558166862514688e-07, "loss": 6.082, "step": 2930 }, { "epoch": 1.72737955346651, "grad_norm": 1.9541058540344238, "learning_rate": 6.546415981198589e-07, "loss": 5.94, "step": 2940 }, { "epoch": 1.7332549941245592, "grad_norm": 1.8375394344329834, "learning_rate": 6.53466509988249e-07, "loss": 6.0372, "step": 2950 }, { "epoch": 1.7332549941245592, "eval_loss": 1.4696645736694336, "eval_runtime": 68.3981, "eval_samples_per_second": 20.965, "eval_steps_per_second": 2.632, "step": 2950 }, { "epoch": 1.7391304347826086, "grad_norm": 1.9922813177108765, "learning_rate": 6.522914218566392e-07, "loss": 6.1165, "step": 2960 }, { "epoch": 1.745005875440658, "grad_norm": 1.6892035007476807, "learning_rate": 6.511163337250293e-07, "loss": 5.9984, "step": 2970 }, { "epoch": 1.7508813160987073, "grad_norm": 1.7739448547363281, "learning_rate": 6.499412455934194e-07, "loss": 6.054, "step": 2980 }, { "epoch": 1.7567567567567568, "grad_norm": 1.658884882926941, "learning_rate": 6.487661574618097e-07, "loss": 5.983, "step": 2990 }, { "epoch": 1.7626321974148063, "grad_norm": 1.8757832050323486, "learning_rate": 6.475910693301997e-07, "loss": 5.9327, "step": 3000 }, { "epoch": 1.7626321974148063, "eval_loss": 1.469561219215393, "eval_runtime": 67.5038, "eval_samples_per_second": 21.243, "eval_steps_per_second": 2.667, "step": 3000 }, { "epoch": 1.7685076380728555, "grad_norm": 1.6837679147720337, "learning_rate": 6.464159811985899e-07, "loss": 5.8991, "step": 3010 }, { "epoch": 1.7743830787309047, "grad_norm": 1.7924985885620117, "learning_rate": 6.452408930669801e-07, "loss": 6.0283, "step": 3020 }, { "epoch": 1.7802585193889542, "grad_norm": 1.6187570095062256, "learning_rate": 6.440658049353701e-07, "loss": 5.8629, "step": 3030 }, { "epoch": 1.7861339600470036, "grad_norm": 1.851152777671814, "learning_rate": 6.428907168037603e-07, "loss": 5.9834, "step": 3040 }, { "epoch": 1.7920094007050529, "grad_norm": 1.9718443155288696, "learning_rate": 6.417156286721504e-07, "loss": 5.9162, "step": 3050 }, { "epoch": 1.7920094007050529, "eval_loss": 1.469072937965393, "eval_runtime": 67.5637, "eval_samples_per_second": 21.224, "eval_steps_per_second": 2.664, "step": 3050 }, { "epoch": 1.7978848413631021, "grad_norm": 1.7449281215667725, "learning_rate": 6.405405405405405e-07, "loss": 5.7984, "step": 3060 }, { "epoch": 1.8037602820211516, "grad_norm": 1.8318501710891724, "learning_rate": 6.393654524089307e-07, "loss": 5.9781, "step": 3070 }, { "epoch": 1.809635722679201, "grad_norm": 2.28659987449646, "learning_rate": 6.381903642773208e-07, "loss": 5.9832, "step": 3080 }, { "epoch": 1.8155111633372503, "grad_norm": 2.0227696895599365, "learning_rate": 6.370152761457109e-07, "loss": 6.1062, "step": 3090 }, { "epoch": 1.8213866039952995, "grad_norm": 1.8883931636810303, "learning_rate": 6.35840188014101e-07, "loss": 5.9535, "step": 3100 }, { "epoch": 1.8213866039952995, "eval_loss": 1.469115138053894, "eval_runtime": 67.5527, "eval_samples_per_second": 21.228, "eval_steps_per_second": 2.665, "step": 3100 }, { "epoch": 1.827262044653349, "grad_norm": 1.8074959516525269, "learning_rate": 6.346650998824912e-07, "loss": 5.9359, "step": 3110 }, { "epoch": 1.8331374853113984, "grad_norm": 1.8197052478790283, "learning_rate": 6.334900117508812e-07, "loss": 5.9669, "step": 3120 }, { "epoch": 1.8390129259694477, "grad_norm": 2.2025105953216553, "learning_rate": 6.323149236192714e-07, "loss": 6.0365, "step": 3130 }, { "epoch": 1.8448883666274971, "grad_norm": 1.7041133642196655, "learning_rate": 6.311398354876616e-07, "loss": 5.7503, "step": 3140 }, { "epoch": 1.8507638072855466, "grad_norm": 1.7134292125701904, "learning_rate": 6.299647473560517e-07, "loss": 5.8262, "step": 3150 }, { "epoch": 1.8507638072855466, "eval_loss": 1.4687591791152954, "eval_runtime": 67.5398, "eval_samples_per_second": 21.232, "eval_steps_per_second": 2.665, "step": 3150 }, { "epoch": 1.8566392479435958, "grad_norm": 1.691468596458435, "learning_rate": 6.287896592244418e-07, "loss": 6.0252, "step": 3160 }, { "epoch": 1.862514688601645, "grad_norm": 2.009781837463379, "learning_rate": 6.276145710928319e-07, "loss": 5.9691, "step": 3170 }, { "epoch": 1.8683901292596945, "grad_norm": 1.7237638235092163, "learning_rate": 6.264394829612221e-07, "loss": 5.9849, "step": 3180 }, { "epoch": 1.874265569917744, "grad_norm": 1.611922264099121, "learning_rate": 6.252643948296122e-07, "loss": 5.8563, "step": 3190 }, { "epoch": 1.8801410105757932, "grad_norm": 1.808998703956604, "learning_rate": 6.240893066980023e-07, "loss": 6.1277, "step": 3200 }, { "epoch": 1.8801410105757932, "eval_loss": 1.468484878540039, "eval_runtime": 67.6509, "eval_samples_per_second": 21.197, "eval_steps_per_second": 2.661, "step": 3200 }, { "epoch": 1.8860164512338424, "grad_norm": 1.6996632814407349, "learning_rate": 6.229142185663925e-07, "loss": 5.9768, "step": 3210 }, { "epoch": 1.8918918918918919, "grad_norm": 1.8977118730545044, "learning_rate": 6.217391304347825e-07, "loss": 5.8365, "step": 3220 }, { "epoch": 1.8977673325499413, "grad_norm": 1.71300208568573, "learning_rate": 6.205640423031727e-07, "loss": 5.8048, "step": 3230 }, { "epoch": 1.9036427732079906, "grad_norm": 1.83664870262146, "learning_rate": 6.193889541715629e-07, "loss": 5.87, "step": 3240 }, { "epoch": 1.9095182138660398, "grad_norm": 1.8034873008728027, "learning_rate": 6.182138660399529e-07, "loss": 5.9079, "step": 3250 }, { "epoch": 1.9095182138660398, "eval_loss": 1.4684431552886963, "eval_runtime": 67.6943, "eval_samples_per_second": 21.183, "eval_steps_per_second": 2.659, "step": 3250 }, { "epoch": 1.9153936545240893, "grad_norm": 1.6270906925201416, "learning_rate": 6.170387779083431e-07, "loss": 5.9307, "step": 3260 }, { "epoch": 1.9212690951821387, "grad_norm": 1.9603782892227173, "learning_rate": 6.158636897767332e-07, "loss": 5.8802, "step": 3270 }, { "epoch": 1.927144535840188, "grad_norm": 1.7977780103683472, "learning_rate": 6.146886016451233e-07, "loss": 5.9755, "step": 3280 }, { "epoch": 1.9330199764982372, "grad_norm": 1.9165523052215576, "learning_rate": 6.135135135135134e-07, "loss": 5.9277, "step": 3290 }, { "epoch": 1.9388954171562869, "grad_norm": 1.881980061531067, "learning_rate": 6.123384253819036e-07, "loss": 5.932, "step": 3300 }, { "epoch": 1.9388954171562869, "eval_loss": 1.4681587219238281, "eval_runtime": 67.5744, "eval_samples_per_second": 21.221, "eval_steps_per_second": 2.664, "step": 3300 }, { "epoch": 1.9447708578143361, "grad_norm": 1.837111234664917, "learning_rate": 6.111633372502937e-07, "loss": 5.8813, "step": 3310 }, { "epoch": 1.9506462984723854, "grad_norm": 1.781909465789795, "learning_rate": 6.099882491186838e-07, "loss": 5.891, "step": 3320 }, { "epoch": 1.9565217391304348, "grad_norm": 1.9645850658416748, "learning_rate": 6.088131609870741e-07, "loss": 5.8671, "step": 3330 }, { "epoch": 1.9623971797884843, "grad_norm": 2.163180112838745, "learning_rate": 6.07638072855464e-07, "loss": 5.9638, "step": 3340 }, { "epoch": 1.9682726204465335, "grad_norm": 2.026726007461548, "learning_rate": 6.064629847238543e-07, "loss": 5.9407, "step": 3350 }, { "epoch": 1.9682726204465335, "eval_loss": 1.4679971933364868, "eval_runtime": 67.7006, "eval_samples_per_second": 21.181, "eval_steps_per_second": 2.659, "step": 3350 }, { "epoch": 1.9741480611045827, "grad_norm": 1.7907665967941284, "learning_rate": 6.052878965922445e-07, "loss": 5.8758, "step": 3360 }, { "epoch": 1.9800235017626322, "grad_norm": 1.534509539604187, "learning_rate": 6.041128084606345e-07, "loss": 5.9446, "step": 3370 }, { "epoch": 1.9858989424206817, "grad_norm": 2.1159238815307617, "learning_rate": 6.029377203290247e-07, "loss": 5.9475, "step": 3380 }, { "epoch": 1.991774383078731, "grad_norm": 1.6477874517440796, "learning_rate": 6.017626321974148e-07, "loss": 5.905, "step": 3390 }, { "epoch": 1.9976498237367801, "grad_norm": 1.7018089294433594, "learning_rate": 6.005875440658049e-07, "loss": 6.0155, "step": 3400 }, { "epoch": 1.9976498237367801, "eval_loss": 1.4677451848983765, "eval_runtime": 67.3618, "eval_samples_per_second": 21.288, "eval_steps_per_second": 2.672, "step": 3400 }, { "epoch": 2.00352526439483, "grad_norm": 2.056706190109253, "learning_rate": 5.99412455934195e-07, "loss": 5.9612, "step": 3410 }, { "epoch": 2.009400705052879, "grad_norm": 1.9465574026107788, "learning_rate": 5.982373678025852e-07, "loss": 5.7667, "step": 3420 }, { "epoch": 2.0152761457109283, "grad_norm": 1.745105266571045, "learning_rate": 5.970622796709754e-07, "loss": 6.0523, "step": 3430 }, { "epoch": 2.0211515863689775, "grad_norm": 1.695147156715393, "learning_rate": 5.958871915393654e-07, "loss": 5.9134, "step": 3440 }, { "epoch": 2.027027027027027, "grad_norm": 1.5801490545272827, "learning_rate": 5.947121034077556e-07, "loss": 5.7663, "step": 3450 }, { "epoch": 2.027027027027027, "eval_loss": 1.467654824256897, "eval_runtime": 67.3107, "eval_samples_per_second": 21.304, "eval_steps_per_second": 2.674, "step": 3450 }, { "epoch": 2.0329024676850764, "grad_norm": 1.7473292350769043, "learning_rate": 5.935370152761457e-07, "loss": 5.7892, "step": 3460 }, { "epoch": 2.0387779083431257, "grad_norm": 1.7656643390655518, "learning_rate": 5.923619271445358e-07, "loss": 5.7947, "step": 3470 }, { "epoch": 2.044653349001175, "grad_norm": 1.8827358484268188, "learning_rate": 5.91186839012926e-07, "loss": 5.8024, "step": 3480 }, { "epoch": 2.0505287896592246, "grad_norm": 2.413665771484375, "learning_rate": 5.900117508813161e-07, "loss": 5.8395, "step": 3490 }, { "epoch": 2.056404230317274, "grad_norm": 1.7899099588394165, "learning_rate": 5.888366627497062e-07, "loss": 5.8906, "step": 3500 }, { "epoch": 2.056404230317274, "eval_loss": 1.4674228429794312, "eval_runtime": 67.4193, "eval_samples_per_second": 21.27, "eval_steps_per_second": 2.67, "step": 3500 }, { "epoch": 2.062279670975323, "grad_norm": 1.7669270038604736, "learning_rate": 5.876615746180963e-07, "loss": 6.0558, "step": 3510 }, { "epoch": 2.0681551116333723, "grad_norm": 1.7801496982574463, "learning_rate": 5.864864864864865e-07, "loss": 5.6794, "step": 3520 }, { "epoch": 2.074030552291422, "grad_norm": 2.059295415878296, "learning_rate": 5.853113983548766e-07, "loss": 5.8377, "step": 3530 }, { "epoch": 2.079905992949471, "grad_norm": 1.7855298519134521, "learning_rate": 5.841363102232667e-07, "loss": 5.8119, "step": 3540 }, { "epoch": 2.0857814336075204, "grad_norm": 1.53040611743927, "learning_rate": 5.829612220916569e-07, "loss": 6.0381, "step": 3550 }, { "epoch": 2.0857814336075204, "eval_loss": 1.467327356338501, "eval_runtime": 67.4105, "eval_samples_per_second": 21.273, "eval_steps_per_second": 2.67, "step": 3550 }, { "epoch": 2.09165687426557, "grad_norm": 1.7886220216751099, "learning_rate": 5.817861339600469e-07, "loss": 5.9189, "step": 3560 }, { "epoch": 2.0975323149236194, "grad_norm": 1.7158267498016357, "learning_rate": 5.806110458284371e-07, "loss": 5.8659, "step": 3570 }, { "epoch": 2.1034077555816686, "grad_norm": 1.8124908208847046, "learning_rate": 5.794359576968272e-07, "loss": 5.7777, "step": 3580 }, { "epoch": 2.109283196239718, "grad_norm": 1.8852800130844116, "learning_rate": 5.782608695652173e-07, "loss": 5.7058, "step": 3590 }, { "epoch": 2.1151586368977675, "grad_norm": 1.8558183908462524, "learning_rate": 5.770857814336075e-07, "loss": 6.0992, "step": 3600 }, { "epoch": 2.1151586368977675, "eval_loss": 1.467076063156128, "eval_runtime": 67.5271, "eval_samples_per_second": 21.236, "eval_steps_per_second": 2.666, "step": 3600 }, { "epoch": 2.1210340775558167, "grad_norm": 1.7967942953109741, "learning_rate": 5.759106933019976e-07, "loss": 5.9542, "step": 3610 }, { "epoch": 2.126909518213866, "grad_norm": 1.811843752861023, "learning_rate": 5.747356051703877e-07, "loss": 5.7699, "step": 3620 }, { "epoch": 2.132784958871915, "grad_norm": 1.774497151374817, "learning_rate": 5.735605170387778e-07, "loss": 5.9018, "step": 3630 }, { "epoch": 2.138660399529965, "grad_norm": 1.739669680595398, "learning_rate": 5.72385428907168e-07, "loss": 5.855, "step": 3640 }, { "epoch": 2.144535840188014, "grad_norm": 1.8997622728347778, "learning_rate": 5.712103407755581e-07, "loss": 5.8494, "step": 3650 }, { "epoch": 2.144535840188014, "eval_loss": 1.4668962955474854, "eval_runtime": 67.352, "eval_samples_per_second": 21.291, "eval_steps_per_second": 2.673, "step": 3650 }, { "epoch": 2.1504112808460634, "grad_norm": 2.079676389694214, "learning_rate": 5.700352526439482e-07, "loss": 5.9762, "step": 3660 }, { "epoch": 2.1562867215041126, "grad_norm": 1.7779871225357056, "learning_rate": 5.688601645123385e-07, "loss": 5.895, "step": 3670 }, { "epoch": 2.1621621621621623, "grad_norm": 1.5973154306411743, "learning_rate": 5.676850763807284e-07, "loss": 5.9583, "step": 3680 }, { "epoch": 2.1680376028202115, "grad_norm": 1.6692899465560913, "learning_rate": 5.665099882491187e-07, "loss": 5.874, "step": 3690 }, { "epoch": 2.1739130434782608, "grad_norm": 1.9078632593154907, "learning_rate": 5.653349001175089e-07, "loss": 5.9224, "step": 3700 }, { "epoch": 2.1739130434782608, "eval_loss": 1.466797947883606, "eval_runtime": 67.3337, "eval_samples_per_second": 21.297, "eval_steps_per_second": 2.673, "step": 3700 }, { "epoch": 2.17978848413631, "grad_norm": 1.675715684890747, "learning_rate": 5.641598119858989e-07, "loss": 5.9647, "step": 3710 }, { "epoch": 2.1856639247943597, "grad_norm": 2.0339181423187256, "learning_rate": 5.629847238542891e-07, "loss": 5.8245, "step": 3720 }, { "epoch": 2.191539365452409, "grad_norm": 1.6942006349563599, "learning_rate": 5.618096357226792e-07, "loss": 5.9127, "step": 3730 }, { "epoch": 2.197414806110458, "grad_norm": 1.82574462890625, "learning_rate": 5.606345475910693e-07, "loss": 5.8228, "step": 3740 }, { "epoch": 2.203290246768508, "grad_norm": 1.7962678670883179, "learning_rate": 5.594594594594594e-07, "loss": 6.043, "step": 3750 }, { "epoch": 2.203290246768508, "eval_loss": 1.4665814638137817, "eval_runtime": 70.2464, "eval_samples_per_second": 20.414, "eval_steps_per_second": 2.562, "step": 3750 }, { "epoch": 2.209165687426557, "grad_norm": 1.7127306461334229, "learning_rate": 5.582843713278496e-07, "loss": 5.9409, "step": 3760 }, { "epoch": 2.2150411280846063, "grad_norm": 1.6787141561508179, "learning_rate": 5.571092831962398e-07, "loss": 5.9635, "step": 3770 }, { "epoch": 2.2209165687426555, "grad_norm": 1.8650240898132324, "learning_rate": 5.559341950646298e-07, "loss": 5.9097, "step": 3780 }, { "epoch": 2.226792009400705, "grad_norm": 1.9650366306304932, "learning_rate": 5.5475910693302e-07, "loss": 5.9976, "step": 3790 }, { "epoch": 2.2326674500587544, "grad_norm": 2.1691102981567383, "learning_rate": 5.535840188014101e-07, "loss": 5.8537, "step": 3800 }, { "epoch": 2.2326674500587544, "eval_loss": 1.4663869142532349, "eval_runtime": 67.3836, "eval_samples_per_second": 21.281, "eval_steps_per_second": 2.671, "step": 3800 }, { "epoch": 2.2385428907168037, "grad_norm": 1.642232060432434, "learning_rate": 5.524089306698002e-07, "loss": 5.8476, "step": 3810 }, { "epoch": 2.244418331374853, "grad_norm": 2.063124895095825, "learning_rate": 5.512338425381904e-07, "loss": 6.0597, "step": 3820 }, { "epoch": 2.2502937720329026, "grad_norm": 1.841054081916809, "learning_rate": 5.500587544065805e-07, "loss": 6.0998, "step": 3830 }, { "epoch": 2.256169212690952, "grad_norm": 1.6578458547592163, "learning_rate": 5.488836662749706e-07, "loss": 6.0319, "step": 3840 }, { "epoch": 2.262044653349001, "grad_norm": 1.8542330265045166, "learning_rate": 5.477085781433607e-07, "loss": 5.9107, "step": 3850 }, { "epoch": 2.262044653349001, "eval_loss": 1.4663937091827393, "eval_runtime": 67.8634, "eval_samples_per_second": 21.131, "eval_steps_per_second": 2.652, "step": 3850 }, { "epoch": 2.2679200940070503, "grad_norm": 1.8425204753875732, "learning_rate": 5.465334900117509e-07, "loss": 5.788, "step": 3860 }, { "epoch": 2.2737955346651, "grad_norm": 1.9576416015625, "learning_rate": 5.45358401880141e-07, "loss": 5.7692, "step": 3870 }, { "epoch": 2.279670975323149, "grad_norm": 1.6908799409866333, "learning_rate": 5.441833137485311e-07, "loss": 5.7556, "step": 3880 }, { "epoch": 2.2855464159811985, "grad_norm": 1.787754774093628, "learning_rate": 5.430082256169213e-07, "loss": 5.8563, "step": 3890 }, { "epoch": 2.291421856639248, "grad_norm": 1.9981508255004883, "learning_rate": 5.418331374853113e-07, "loss": 5.8377, "step": 3900 }, { "epoch": 2.291421856639248, "eval_loss": 1.4661545753479004, "eval_runtime": 67.3909, "eval_samples_per_second": 21.279, "eval_steps_per_second": 2.671, "step": 3900 }, { "epoch": 2.2972972972972974, "grad_norm": 2.019265651702881, "learning_rate": 5.406580493537015e-07, "loss": 5.8725, "step": 3910 }, { "epoch": 2.3031727379553466, "grad_norm": 2.1026248931884766, "learning_rate": 5.394829612220916e-07, "loss": 5.6895, "step": 3920 }, { "epoch": 2.309048178613396, "grad_norm": 2.0098109245300293, "learning_rate": 5.383078730904817e-07, "loss": 5.9395, "step": 3930 }, { "epoch": 2.3149236192714455, "grad_norm": 1.9912086725234985, "learning_rate": 5.371327849588719e-07, "loss": 5.8199, "step": 3940 }, { "epoch": 2.3207990599294948, "grad_norm": 1.8740649223327637, "learning_rate": 5.35957696827262e-07, "loss": 5.9611, "step": 3950 }, { "epoch": 2.3207990599294948, "eval_loss": 1.4659883975982666, "eval_runtime": 67.3181, "eval_samples_per_second": 21.302, "eval_steps_per_second": 2.674, "step": 3950 }, { "epoch": 2.326674500587544, "grad_norm": 1.4131051301956177, "learning_rate": 5.347826086956521e-07, "loss": 5.8967, "step": 3960 }, { "epoch": 2.3325499412455932, "grad_norm": 1.7178343534469604, "learning_rate": 5.336075205640422e-07, "loss": 5.8699, "step": 3970 }, { "epoch": 2.338425381903643, "grad_norm": 1.9381266832351685, "learning_rate": 5.324324324324324e-07, "loss": 6.014, "step": 3980 }, { "epoch": 2.344300822561692, "grad_norm": 1.8134095668792725, "learning_rate": 5.312573443008225e-07, "loss": 5.7731, "step": 3990 }, { "epoch": 2.3501762632197414, "grad_norm": 1.9413225650787354, "learning_rate": 5.300822561692126e-07, "loss": 5.8098, "step": 4000 }, { "epoch": 2.3501762632197414, "eval_loss": 1.4658437967300415, "eval_runtime": 67.3732, "eval_samples_per_second": 21.284, "eval_steps_per_second": 2.672, "step": 4000 }, { "epoch": 2.3560517038777906, "grad_norm": 1.762492299079895, "learning_rate": 5.289071680376028e-07, "loss": 5.9946, "step": 4010 }, { "epoch": 2.3619271445358403, "grad_norm": 1.657081127166748, "learning_rate": 5.277320799059928e-07, "loss": 5.8473, "step": 4020 }, { "epoch": 2.3678025851938895, "grad_norm": 1.9021812677383423, "learning_rate": 5.26556991774383e-07, "loss": 6.0927, "step": 4030 }, { "epoch": 2.3736780258519388, "grad_norm": 1.7664687633514404, "learning_rate": 5.253819036427733e-07, "loss": 5.6985, "step": 4040 }, { "epoch": 2.3795534665099884, "grad_norm": 2.071560859680176, "learning_rate": 5.242068155111633e-07, "loss": 5.8251, "step": 4050 }, { "epoch": 2.3795534665099884, "eval_loss": 1.4657713174819946, "eval_runtime": 67.3816, "eval_samples_per_second": 21.282, "eval_steps_per_second": 2.671, "step": 4050 }, { "epoch": 2.3854289071680377, "grad_norm": 1.715277075767517, "learning_rate": 5.230317273795535e-07, "loss": 6.0299, "step": 4060 }, { "epoch": 2.391304347826087, "grad_norm": 1.7600971460342407, "learning_rate": 5.218566392479436e-07, "loss": 5.7579, "step": 4070 }, { "epoch": 2.397179788484136, "grad_norm": 2.067085027694702, "learning_rate": 5.206815511163337e-07, "loss": 5.9357, "step": 4080 }, { "epoch": 2.403055229142186, "grad_norm": 1.6616854667663574, "learning_rate": 5.195064629847238e-07, "loss": 5.8101, "step": 4090 }, { "epoch": 2.408930669800235, "grad_norm": 1.7067201137542725, "learning_rate": 5.18331374853114e-07, "loss": 5.9347, "step": 4100 }, { "epoch": 2.408930669800235, "eval_loss": 1.465532898902893, "eval_runtime": 67.3821, "eval_samples_per_second": 21.282, "eval_steps_per_second": 2.671, "step": 4100 }, { "epoch": 2.4148061104582843, "grad_norm": 2.5587124824523926, "learning_rate": 5.171562867215042e-07, "loss": 5.9894, "step": 4110 }, { "epoch": 2.4206815511163335, "grad_norm": 1.795381784439087, "learning_rate": 5.159811985898942e-07, "loss": 5.8384, "step": 4120 }, { "epoch": 2.426556991774383, "grad_norm": 2.450474500656128, "learning_rate": 5.148061104582844e-07, "loss": 5.885, "step": 4130 }, { "epoch": 2.4324324324324325, "grad_norm": 1.8166522979736328, "learning_rate": 5.136310223266745e-07, "loss": 5.8504, "step": 4140 }, { "epoch": 2.4383078730904817, "grad_norm": 1.6221665143966675, "learning_rate": 5.124559341950646e-07, "loss": 5.9535, "step": 4150 }, { "epoch": 2.4383078730904817, "eval_loss": 1.4654651880264282, "eval_runtime": 67.324, "eval_samples_per_second": 21.3, "eval_steps_per_second": 2.674, "step": 4150 }, { "epoch": 2.444183313748531, "grad_norm": 1.6266223192214966, "learning_rate": 5.112808460634548e-07, "loss": 5.9099, "step": 4160 }, { "epoch": 2.4500587544065806, "grad_norm": 1.839812994003296, "learning_rate": 5.101057579318449e-07, "loss": 6.0562, "step": 4170 }, { "epoch": 2.45593419506463, "grad_norm": 1.6507972478866577, "learning_rate": 5.08930669800235e-07, "loss": 5.9426, "step": 4180 }, { "epoch": 2.461809635722679, "grad_norm": 2.02901554107666, "learning_rate": 5.077555816686251e-07, "loss": 5.8951, "step": 4190 }, { "epoch": 2.4676850763807288, "grad_norm": 1.8781306743621826, "learning_rate": 5.065804935370153e-07, "loss": 5.9792, "step": 4200 }, { "epoch": 2.4676850763807288, "eval_loss": 1.46532142162323, "eval_runtime": 68.0363, "eval_samples_per_second": 21.077, "eval_steps_per_second": 2.646, "step": 4200 }, { "epoch": 2.473560517038778, "grad_norm": 2.0996501445770264, "learning_rate": 5.054054054054053e-07, "loss": 5.9635, "step": 4210 }, { "epoch": 2.4794359576968272, "grad_norm": 1.8582676649093628, "learning_rate": 5.042303172737955e-07, "loss": 5.7168, "step": 4220 }, { "epoch": 2.4853113983548765, "grad_norm": 2.0282630920410156, "learning_rate": 5.030552291421857e-07, "loss": 5.8186, "step": 4230 }, { "epoch": 2.491186839012926, "grad_norm": 1.7468255758285522, "learning_rate": 5.018801410105757e-07, "loss": 5.8905, "step": 4240 }, { "epoch": 2.4970622796709754, "grad_norm": 1.6229472160339355, "learning_rate": 5.007050528789659e-07, "loss": 5.7106, "step": 4250 }, { "epoch": 2.4970622796709754, "eval_loss": 1.4651542901992798, "eval_runtime": 67.3322, "eval_samples_per_second": 21.297, "eval_steps_per_second": 2.673, "step": 4250 }, { "epoch": 2.5029377203290246, "grad_norm": 1.912929654121399, "learning_rate": 4.99529964747356e-07, "loss": 5.9134, "step": 4260 }, { "epoch": 2.5088131609870743, "grad_norm": 2.1273841857910156, "learning_rate": 4.983548766157461e-07, "loss": 6.0254, "step": 4270 }, { "epoch": 2.5146886016451235, "grad_norm": 1.7473537921905518, "learning_rate": 4.971797884841363e-07, "loss": 5.7731, "step": 4280 }, { "epoch": 2.5205640423031728, "grad_norm": 1.8446624279022217, "learning_rate": 4.960047003525264e-07, "loss": 5.5428, "step": 4290 }, { "epoch": 2.526439482961222, "grad_norm": 1.9221971035003662, "learning_rate": 4.948296122209165e-07, "loss": 5.9076, "step": 4300 }, { "epoch": 2.526439482961222, "eval_loss": 1.4649547338485718, "eval_runtime": 67.4292, "eval_samples_per_second": 21.267, "eval_steps_per_second": 2.669, "step": 4300 }, { "epoch": 2.5323149236192712, "grad_norm": 1.844045877456665, "learning_rate": 4.936545240893067e-07, "loss": 5.9249, "step": 4310 }, { "epoch": 2.538190364277321, "grad_norm": 1.7555588483810425, "learning_rate": 4.924794359576968e-07, "loss": 5.8795, "step": 4320 }, { "epoch": 2.54406580493537, "grad_norm": 1.904198408126831, "learning_rate": 4.913043478260869e-07, "loss": 5.9253, "step": 4330 }, { "epoch": 2.5499412455934194, "grad_norm": 1.6488707065582275, "learning_rate": 4.90129259694477e-07, "loss": 5.7982, "step": 4340 }, { "epoch": 2.555816686251469, "grad_norm": 1.6343579292297363, "learning_rate": 4.889541715628671e-07, "loss": 5.8531, "step": 4350 }, { "epoch": 2.555816686251469, "eval_loss": 1.4648929834365845, "eval_runtime": 67.3567, "eval_samples_per_second": 21.29, "eval_steps_per_second": 2.672, "step": 4350 }, { "epoch": 2.5616921269095183, "grad_norm": 1.8681535720825195, "learning_rate": 4.877790834312573e-07, "loss": 5.9276, "step": 4360 }, { "epoch": 2.5675675675675675, "grad_norm": 2.1231424808502197, "learning_rate": 4.866039952996475e-07, "loss": 5.9091, "step": 4370 }, { "epoch": 2.573443008225617, "grad_norm": 1.6580970287322998, "learning_rate": 4.854289071680376e-07, "loss": 5.9298, "step": 4380 }, { "epoch": 2.579318448883666, "grad_norm": 1.5748720169067383, "learning_rate": 4.842538190364277e-07, "loss": 5.9232, "step": 4390 }, { "epoch": 2.5851938895417157, "grad_norm": 1.945760726928711, "learning_rate": 4.830787309048179e-07, "loss": 5.8322, "step": 4400 }, { "epoch": 2.5851938895417157, "eval_loss": 1.4647204875946045, "eval_runtime": 67.3856, "eval_samples_per_second": 21.281, "eval_steps_per_second": 2.671, "step": 4400 }, { "epoch": 2.591069330199765, "grad_norm": 1.7735313177108765, "learning_rate": 4.81903642773208e-07, "loss": 6.0296, "step": 4410 }, { "epoch": 2.5969447708578146, "grad_norm": 1.6112607717514038, "learning_rate": 4.807285546415982e-07, "loss": 5.8741, "step": 4420 }, { "epoch": 2.602820211515864, "grad_norm": 1.7845340967178345, "learning_rate": 4.795534665099883e-07, "loss": 5.9611, "step": 4430 }, { "epoch": 2.608695652173913, "grad_norm": 2.0016372203826904, "learning_rate": 4.783783783783784e-07, "loss": 5.9482, "step": 4440 }, { "epoch": 2.6145710928319623, "grad_norm": 1.9225436449050903, "learning_rate": 4.772032902467685e-07, "loss": 5.897, "step": 4450 }, { "epoch": 2.6145710928319623, "eval_loss": 1.4647117853164673, "eval_runtime": 67.3807, "eval_samples_per_second": 21.282, "eval_steps_per_second": 2.671, "step": 4450 }, { "epoch": 2.6204465334900116, "grad_norm": 1.7982288599014282, "learning_rate": 4.760282021151586e-07, "loss": 5.7977, "step": 4460 }, { "epoch": 2.6263219741480612, "grad_norm": 2.0047717094421387, "learning_rate": 4.748531139835488e-07, "loss": 5.8034, "step": 4470 }, { "epoch": 2.6321974148061105, "grad_norm": 2.0406343936920166, "learning_rate": 4.736780258519389e-07, "loss": 5.8348, "step": 4480 }, { "epoch": 2.6380728554641597, "grad_norm": 1.7326260805130005, "learning_rate": 4.72502937720329e-07, "loss": 5.7419, "step": 4490 }, { "epoch": 2.6439482961222094, "grad_norm": 2.017756462097168, "learning_rate": 4.7132784958871914e-07, "loss": 5.8776, "step": 4500 }, { "epoch": 2.6439482961222094, "eval_loss": 1.4645116329193115, "eval_runtime": 67.0576, "eval_samples_per_second": 21.385, "eval_steps_per_second": 2.684, "step": 4500 }, { "epoch": 2.6498237367802586, "grad_norm": 1.670611023902893, "learning_rate": 4.7015276145710924e-07, "loss": 5.9727, "step": 4510 }, { "epoch": 2.655699177438308, "grad_norm": 1.8651740550994873, "learning_rate": 4.689776733254994e-07, "loss": 5.8256, "step": 4520 }, { "epoch": 2.661574618096357, "grad_norm": 1.7110469341278076, "learning_rate": 4.6780258519388955e-07, "loss": 5.8413, "step": 4530 }, { "epoch": 2.6674500587544063, "grad_norm": 1.6548104286193848, "learning_rate": 4.6662749706227965e-07, "loss": 6.0178, "step": 4540 }, { "epoch": 2.673325499412456, "grad_norm": 1.9871407747268677, "learning_rate": 4.654524089306698e-07, "loss": 5.8025, "step": 4550 }, { "epoch": 2.673325499412456, "eval_loss": 1.4644556045532227, "eval_runtime": 67.0171, "eval_samples_per_second": 21.398, "eval_steps_per_second": 2.686, "step": 4550 }, { "epoch": 2.6792009400705052, "grad_norm": 1.7982734441757202, "learning_rate": 4.642773207990599e-07, "loss": 5.7593, "step": 4560 }, { "epoch": 2.6850763807285545, "grad_norm": 2.1447372436523438, "learning_rate": 4.6310223266745e-07, "loss": 5.8057, "step": 4570 }, { "epoch": 2.690951821386604, "grad_norm": 1.9947744607925415, "learning_rate": 4.6192714453584016e-07, "loss": 5.964, "step": 4580 }, { "epoch": 2.6968272620446534, "grad_norm": 2.2180542945861816, "learning_rate": 4.607520564042303e-07, "loss": 5.8878, "step": 4590 }, { "epoch": 2.7027027027027026, "grad_norm": 1.5173759460449219, "learning_rate": 4.595769682726204e-07, "loss": 5.8811, "step": 4600 }, { "epoch": 2.7027027027027026, "eval_loss": 1.4642778635025024, "eval_runtime": 69.6554, "eval_samples_per_second": 20.587, "eval_steps_per_second": 2.584, "step": 4600 }, { "epoch": 2.708578143360752, "grad_norm": 1.739025354385376, "learning_rate": 4.5840188014101057e-07, "loss": 5.893, "step": 4610 }, { "epoch": 2.7144535840188015, "grad_norm": 2.0034613609313965, "learning_rate": 4.5722679200940067e-07, "loss": 5.984, "step": 4620 }, { "epoch": 2.720329024676851, "grad_norm": 2.050755739212036, "learning_rate": 4.5605170387779077e-07, "loss": 6.0021, "step": 4630 }, { "epoch": 2.7262044653349, "grad_norm": 2.053459644317627, "learning_rate": 4.54876615746181e-07, "loss": 5.8983, "step": 4640 }, { "epoch": 2.7320799059929497, "grad_norm": 1.7340502738952637, "learning_rate": 4.537015276145711e-07, "loss": 5.9349, "step": 4650 }, { "epoch": 2.7320799059929497, "eval_loss": 1.4640307426452637, "eval_runtime": 67.1022, "eval_samples_per_second": 21.37, "eval_steps_per_second": 2.682, "step": 4650 }, { "epoch": 2.737955346650999, "grad_norm": 2.087167978286743, "learning_rate": 4.525264394829612e-07, "loss": 5.9448, "step": 4660 }, { "epoch": 2.743830787309048, "grad_norm": 1.8812017440795898, "learning_rate": 4.5135135135135134e-07, "loss": 5.9692, "step": 4670 }, { "epoch": 2.7497062279670974, "grad_norm": 1.7874183654785156, "learning_rate": 4.5017626321974144e-07, "loss": 5.8267, "step": 4680 }, { "epoch": 2.7555816686251466, "grad_norm": 2.020829439163208, "learning_rate": 4.490011750881316e-07, "loss": 6.0666, "step": 4690 }, { "epoch": 2.7614571092831963, "grad_norm": 1.6772513389587402, "learning_rate": 4.4782608695652175e-07, "loss": 5.9288, "step": 4700 }, { "epoch": 2.7614571092831963, "eval_loss": 1.464098572731018, "eval_runtime": 67.1135, "eval_samples_per_second": 21.367, "eval_steps_per_second": 2.682, "step": 4700 }, { "epoch": 2.7673325499412456, "grad_norm": 1.8247939348220825, "learning_rate": 4.4665099882491185e-07, "loss": 5.9552, "step": 4710 }, { "epoch": 2.773207990599295, "grad_norm": 2.047966718673706, "learning_rate": 4.45475910693302e-07, "loss": 5.9451, "step": 4720 }, { "epoch": 2.7790834312573445, "grad_norm": 1.7807133197784424, "learning_rate": 4.443008225616921e-07, "loss": 5.8045, "step": 4730 }, { "epoch": 2.7849588719153937, "grad_norm": 1.7953366041183472, "learning_rate": 4.431257344300822e-07, "loss": 5.782, "step": 4740 }, { "epoch": 2.790834312573443, "grad_norm": 1.9604454040527344, "learning_rate": 4.4195064629847236e-07, "loss": 6.0679, "step": 4750 }, { "epoch": 2.790834312573443, "eval_loss": 1.4638469219207764, "eval_runtime": 67.0044, "eval_samples_per_second": 21.402, "eval_steps_per_second": 2.686, "step": 4750 }, { "epoch": 2.796709753231492, "grad_norm": 1.9754419326782227, "learning_rate": 4.407755581668625e-07, "loss": 5.7528, "step": 4760 }, { "epoch": 2.802585193889542, "grad_norm": 1.7962079048156738, "learning_rate": 4.396004700352526e-07, "loss": 5.7068, "step": 4770 }, { "epoch": 2.808460634547591, "grad_norm": 1.7251296043395996, "learning_rate": 4.3842538190364277e-07, "loss": 5.7795, "step": 4780 }, { "epoch": 2.8143360752056403, "grad_norm": 1.8542954921722412, "learning_rate": 4.3725029377203287e-07, "loss": 5.8237, "step": 4790 }, { "epoch": 2.82021151586369, "grad_norm": 1.9788106679916382, "learning_rate": 4.3607520564042297e-07, "loss": 5.9022, "step": 4800 }, { "epoch": 2.82021151586369, "eval_loss": 1.4637619256973267, "eval_runtime": 67.0549, "eval_samples_per_second": 21.385, "eval_steps_per_second": 2.684, "step": 4800 }, { "epoch": 2.8260869565217392, "grad_norm": 1.8251780271530151, "learning_rate": 4.349001175088131e-07, "loss": 5.8354, "step": 4810 }, { "epoch": 2.8319623971797885, "grad_norm": 1.8526431322097778, "learning_rate": 4.337250293772033e-07, "loss": 5.9148, "step": 4820 }, { "epoch": 2.8378378378378377, "grad_norm": 2.040987730026245, "learning_rate": 4.3254994124559343e-07, "loss": 6.0853, "step": 4830 }, { "epoch": 2.843713278495887, "grad_norm": 1.7101026773452759, "learning_rate": 4.3137485311398354e-07, "loss": 5.9939, "step": 4840 }, { "epoch": 2.8495887191539366, "grad_norm": 2.0545079708099365, "learning_rate": 4.3019976498237364e-07, "loss": 5.7725, "step": 4850 }, { "epoch": 2.8495887191539366, "eval_loss": 1.463710904121399, "eval_runtime": 67.0425, "eval_samples_per_second": 21.389, "eval_steps_per_second": 2.685, "step": 4850 }, { "epoch": 2.855464159811986, "grad_norm": 2.194539785385132, "learning_rate": 4.290246768507638e-07, "loss": 6.1075, "step": 4860 }, { "epoch": 2.861339600470035, "grad_norm": 2.0312609672546387, "learning_rate": 4.2784958871915395e-07, "loss": 5.8069, "step": 4870 }, { "epoch": 2.867215041128085, "grad_norm": 1.9404051303863525, "learning_rate": 4.2667450058754405e-07, "loss": 5.7062, "step": 4880 }, { "epoch": 2.873090481786134, "grad_norm": 1.8269391059875488, "learning_rate": 4.254994124559342e-07, "loss": 5.8407, "step": 4890 }, { "epoch": 2.8789659224441833, "grad_norm": 2.041775941848755, "learning_rate": 4.243243243243243e-07, "loss": 5.9366, "step": 4900 }, { "epoch": 2.8789659224441833, "eval_loss": 1.4636270999908447, "eval_runtime": 67.4942, "eval_samples_per_second": 21.246, "eval_steps_per_second": 2.667, "step": 4900 }, { "epoch": 2.8848413631022325, "grad_norm": 1.7362725734710693, "learning_rate": 4.231492361927144e-07, "loss": 5.7943, "step": 4910 }, { "epoch": 2.890716803760282, "grad_norm": 1.8290835618972778, "learning_rate": 4.2197414806110456e-07, "loss": 5.9051, "step": 4920 }, { "epoch": 2.8965922444183314, "grad_norm": 1.716813087463379, "learning_rate": 4.207990599294947e-07, "loss": 5.9952, "step": 4930 }, { "epoch": 2.9024676850763806, "grad_norm": 1.7275757789611816, "learning_rate": 4.196239717978848e-07, "loss": 5.7364, "step": 4940 }, { "epoch": 2.9083431257344303, "grad_norm": 1.7062081098556519, "learning_rate": 4.1844888366627497e-07, "loss": 6.0433, "step": 4950 }, { "epoch": 2.9083431257344303, "eval_loss": 1.4636424779891968, "eval_runtime": 67.363, "eval_samples_per_second": 21.288, "eval_steps_per_second": 2.672, "step": 4950 }, { "epoch": 2.9142185663924796, "grad_norm": 1.8800413608551025, "learning_rate": 4.1727379553466507e-07, "loss": 6.0615, "step": 4960 }, { "epoch": 2.920094007050529, "grad_norm": 1.6869240999221802, "learning_rate": 4.1609870740305517e-07, "loss": 5.9313, "step": 4970 }, { "epoch": 2.925969447708578, "grad_norm": 1.733893632888794, "learning_rate": 4.149236192714453e-07, "loss": 5.8278, "step": 4980 }, { "epoch": 2.9318448883666273, "grad_norm": 2.009671926498413, "learning_rate": 4.137485311398355e-07, "loss": 5.931, "step": 4990 }, { "epoch": 2.937720329024677, "grad_norm": 2.2526206970214844, "learning_rate": 4.1257344300822563e-07, "loss": 5.8845, "step": 5000 }, { "epoch": 2.937720329024677, "eval_loss": 1.4632807970046997, "eval_runtime": 69.3633, "eval_samples_per_second": 20.674, "eval_steps_per_second": 2.595, "step": 5000 }, { "epoch": 2.943595769682726, "grad_norm": 1.7864453792572021, "learning_rate": 4.1139835487661573e-07, "loss": 5.767, "step": 5010 }, { "epoch": 2.9494712103407754, "grad_norm": 1.755837082862854, "learning_rate": 4.1022326674500584e-07, "loss": 6.0009, "step": 5020 }, { "epoch": 2.955346650998825, "grad_norm": 1.8690998554229736, "learning_rate": 4.09048178613396e-07, "loss": 5.9741, "step": 5030 }, { "epoch": 2.9612220916568743, "grad_norm": 1.7106729745864868, "learning_rate": 4.0787309048178614e-07, "loss": 5.8316, "step": 5040 }, { "epoch": 2.9670975323149236, "grad_norm": 2.05641770362854, "learning_rate": 4.0669800235017625e-07, "loss": 5.796, "step": 5050 }, { "epoch": 2.9670975323149236, "eval_loss": 1.4632810354232788, "eval_runtime": 67.2478, "eval_samples_per_second": 21.324, "eval_steps_per_second": 2.677, "step": 5050 }, { "epoch": 2.972972972972973, "grad_norm": 1.9636961221694946, "learning_rate": 4.055229142185664e-07, "loss": 5.9396, "step": 5060 }, { "epoch": 2.9788484136310225, "grad_norm": 1.9900755882263184, "learning_rate": 4.043478260869565e-07, "loss": 5.7244, "step": 5070 }, { "epoch": 2.9847238542890717, "grad_norm": 1.7656136751174927, "learning_rate": 4.031727379553466e-07, "loss": 6.0377, "step": 5080 }, { "epoch": 2.990599294947121, "grad_norm": 2.1417531967163086, "learning_rate": 4.0199764982373676e-07, "loss": 5.8221, "step": 5090 }, { "epoch": 2.9964747356051706, "grad_norm": 1.6871669292449951, "learning_rate": 4.008225616921269e-07, "loss": 5.8345, "step": 5100 }, { "epoch": 2.9964747356051706, "eval_loss": 1.4631738662719727, "eval_runtime": 67.2117, "eval_samples_per_second": 21.336, "eval_steps_per_second": 2.678, "step": 5100 }, { "epoch": 3.00235017626322, "grad_norm": 1.6874431371688843, "learning_rate": 3.99647473560517e-07, "loss": 5.6226, "step": 5110 }, { "epoch": 3.008225616921269, "grad_norm": 1.9499021768569946, "learning_rate": 3.9847238542890717e-07, "loss": 5.7983, "step": 5120 }, { "epoch": 3.0141010575793183, "grad_norm": 1.7841684818267822, "learning_rate": 3.9729729729729727e-07, "loss": 5.7704, "step": 5130 }, { "epoch": 3.0199764982373676, "grad_norm": 1.7825994491577148, "learning_rate": 3.9612220916568737e-07, "loss": 6.1243, "step": 5140 }, { "epoch": 3.0258519388954173, "grad_norm": 1.9684655666351318, "learning_rate": 3.949471210340775e-07, "loss": 5.9495, "step": 5150 }, { "epoch": 3.0258519388954173, "eval_loss": 1.4631444215774536, "eval_runtime": 67.1653, "eval_samples_per_second": 21.35, "eval_steps_per_second": 2.68, "step": 5150 }, { "epoch": 3.0317273795534665, "grad_norm": 1.820328712463379, "learning_rate": 3.937720329024677e-07, "loss": 5.82, "step": 5160 }, { "epoch": 3.0376028202115157, "grad_norm": 1.9277817010879517, "learning_rate": 3.9259694477085783e-07, "loss": 5.6194, "step": 5170 }, { "epoch": 3.0434782608695654, "grad_norm": 2.056603193283081, "learning_rate": 3.9142185663924793e-07, "loss": 6.0018, "step": 5180 }, { "epoch": 3.0493537015276146, "grad_norm": 1.9370253086090088, "learning_rate": 3.9024676850763803e-07, "loss": 5.869, "step": 5190 }, { "epoch": 3.055229142185664, "grad_norm": 1.8661144971847534, "learning_rate": 3.890716803760282e-07, "loss": 5.9485, "step": 5200 }, { "epoch": 3.055229142185664, "eval_loss": 1.4629672765731812, "eval_runtime": 67.0872, "eval_samples_per_second": 21.375, "eval_steps_per_second": 2.683, "step": 5200 }, { "epoch": 3.061104582843713, "grad_norm": 1.7688831090927124, "learning_rate": 3.8789659224441834e-07, "loss": 5.9163, "step": 5210 }, { "epoch": 3.066980023501763, "grad_norm": 2.025082588195801, "learning_rate": 3.8672150411280844e-07, "loss": 5.959, "step": 5220 }, { "epoch": 3.072855464159812, "grad_norm": 1.8350175619125366, "learning_rate": 3.855464159811986e-07, "loss": 5.7492, "step": 5230 }, { "epoch": 3.0787309048178613, "grad_norm": 2.098921298980713, "learning_rate": 3.843713278495887e-07, "loss": 6.0287, "step": 5240 }, { "epoch": 3.0846063454759105, "grad_norm": 1.5796895027160645, "learning_rate": 3.831962397179788e-07, "loss": 5.9429, "step": 5250 }, { "epoch": 3.0846063454759105, "eval_loss": 1.4628491401672363, "eval_runtime": 67.2809, "eval_samples_per_second": 21.314, "eval_steps_per_second": 2.675, "step": 5250 }, { "epoch": 3.09048178613396, "grad_norm": 1.8605477809906006, "learning_rate": 3.8202115158636896e-07, "loss": 5.7176, "step": 5260 }, { "epoch": 3.0963572267920094, "grad_norm": 1.938942790031433, "learning_rate": 3.808460634547591e-07, "loss": 5.9195, "step": 5270 }, { "epoch": 3.1022326674500587, "grad_norm": 2.0489580631256104, "learning_rate": 3.796709753231492e-07, "loss": 5.8776, "step": 5280 }, { "epoch": 3.108108108108108, "grad_norm": 1.7016371488571167, "learning_rate": 3.7849588719153937e-07, "loss": 5.8859, "step": 5290 }, { "epoch": 3.1139835487661576, "grad_norm": 2.140580654144287, "learning_rate": 3.7732079905992947e-07, "loss": 5.743, "step": 5300 }, { "epoch": 3.1139835487661576, "eval_loss": 1.4629240036010742, "eval_runtime": 67.2129, "eval_samples_per_second": 21.335, "eval_steps_per_second": 2.678, "step": 5300 }, { "epoch": 3.119858989424207, "grad_norm": 1.872502326965332, "learning_rate": 3.7614571092831957e-07, "loss": 5.9483, "step": 5310 }, { "epoch": 3.125734430082256, "grad_norm": 2.179497718811035, "learning_rate": 3.749706227967097e-07, "loss": 5.7933, "step": 5320 }, { "epoch": 3.1316098707403057, "grad_norm": 1.7496691942214966, "learning_rate": 3.737955346650999e-07, "loss": 5.892, "step": 5330 }, { "epoch": 3.137485311398355, "grad_norm": 1.722602128982544, "learning_rate": 3.7262044653349003e-07, "loss": 5.897, "step": 5340 }, { "epoch": 3.143360752056404, "grad_norm": 1.8440240621566772, "learning_rate": 3.7144535840188013e-07, "loss": 6.0027, "step": 5350 }, { "epoch": 3.143360752056404, "eval_loss": 1.4626725912094116, "eval_runtime": 67.549, "eval_samples_per_second": 21.229, "eval_steps_per_second": 2.665, "step": 5350 }, { "epoch": 3.1492361927144534, "grad_norm": 1.77263605594635, "learning_rate": 3.7027027027027023e-07, "loss": 5.6062, "step": 5360 }, { "epoch": 3.155111633372503, "grad_norm": 1.7622977495193481, "learning_rate": 3.690951821386604e-07, "loss": 5.9189, "step": 5370 }, { "epoch": 3.1609870740305523, "grad_norm": 1.9615147113800049, "learning_rate": 3.679200940070505e-07, "loss": 5.77, "step": 5380 }, { "epoch": 3.1668625146886016, "grad_norm": 1.7339571714401245, "learning_rate": 3.6674500587544064e-07, "loss": 5.6509, "step": 5390 }, { "epoch": 3.172737955346651, "grad_norm": 1.9717214107513428, "learning_rate": 3.655699177438308e-07, "loss": 5.952, "step": 5400 }, { "epoch": 3.172737955346651, "eval_loss": 1.4626277685165405, "eval_runtime": 67.2483, "eval_samples_per_second": 21.324, "eval_steps_per_second": 2.677, "step": 5400 }, { "epoch": 3.1786133960047005, "grad_norm": 1.6808756589889526, "learning_rate": 3.643948296122209e-07, "loss": 5.9226, "step": 5410 }, { "epoch": 3.1844888366627497, "grad_norm": 1.802362084388733, "learning_rate": 3.63219741480611e-07, "loss": 5.8396, "step": 5420 }, { "epoch": 3.190364277320799, "grad_norm": 2.0765771865844727, "learning_rate": 3.6204465334900115e-07, "loss": 5.9202, "step": 5430 }, { "epoch": 3.196239717978848, "grad_norm": 1.8261579275131226, "learning_rate": 3.608695652173913e-07, "loss": 5.8945, "step": 5440 }, { "epoch": 3.202115158636898, "grad_norm": 1.978142261505127, "learning_rate": 3.596944770857814e-07, "loss": 6.0232, "step": 5450 }, { "epoch": 3.202115158636898, "eval_loss": 1.4625942707061768, "eval_runtime": 68.053, "eval_samples_per_second": 21.072, "eval_steps_per_second": 2.645, "step": 5450 }, { "epoch": 3.207990599294947, "grad_norm": 1.7350192070007324, "learning_rate": 3.5851938895417156e-07, "loss": 6.0179, "step": 5460 }, { "epoch": 3.2138660399529964, "grad_norm": 1.9900667667388916, "learning_rate": 3.5734430082256167e-07, "loss": 5.7541, "step": 5470 }, { "epoch": 3.219741480611046, "grad_norm": 1.9178911447525024, "learning_rate": 3.5616921269095177e-07, "loss": 5.9233, "step": 5480 }, { "epoch": 3.2256169212690953, "grad_norm": 1.925896406173706, "learning_rate": 3.549941245593419e-07, "loss": 5.8819, "step": 5490 }, { "epoch": 3.2314923619271445, "grad_norm": 1.8195209503173828, "learning_rate": 3.538190364277321e-07, "loss": 5.799, "step": 5500 }, { "epoch": 3.2314923619271445, "eval_loss": 1.4624738693237305, "eval_runtime": 67.222, "eval_samples_per_second": 21.332, "eval_steps_per_second": 2.678, "step": 5500 }, { "epoch": 3.2373678025851937, "grad_norm": 1.9356062412261963, "learning_rate": 3.5264394829612223e-07, "loss": 5.9717, "step": 5510 }, { "epoch": 3.2432432432432434, "grad_norm": 2.2090444564819336, "learning_rate": 3.5146886016451233e-07, "loss": 5.9176, "step": 5520 }, { "epoch": 3.2491186839012927, "grad_norm": 1.6561217308044434, "learning_rate": 3.5029377203290243e-07, "loss": 5.9658, "step": 5530 }, { "epoch": 3.254994124559342, "grad_norm": 1.8014518022537231, "learning_rate": 3.491186839012926e-07, "loss": 5.9286, "step": 5540 }, { "epoch": 3.260869565217391, "grad_norm": 2.0677366256713867, "learning_rate": 3.479435957696827e-07, "loss": 5.8748, "step": 5550 }, { "epoch": 3.260869565217391, "eval_loss": 1.4624980688095093, "eval_runtime": 67.2161, "eval_samples_per_second": 21.334, "eval_steps_per_second": 2.678, "step": 5550 }, { "epoch": 3.266745005875441, "grad_norm": 1.6031136512756348, "learning_rate": 3.4676850763807284e-07, "loss": 5.6663, "step": 5560 }, { "epoch": 3.27262044653349, "grad_norm": 1.5398238897323608, "learning_rate": 3.45593419506463e-07, "loss": 5.9192, "step": 5570 }, { "epoch": 3.2784958871915393, "grad_norm": 1.7016900777816772, "learning_rate": 3.444183313748531e-07, "loss": 5.7822, "step": 5580 }, { "epoch": 3.2843713278495885, "grad_norm": 1.646475076675415, "learning_rate": 3.432432432432432e-07, "loss": 5.9348, "step": 5590 }, { "epoch": 3.290246768507638, "grad_norm": 1.9710693359375, "learning_rate": 3.4206815511163335e-07, "loss": 5.94, "step": 5600 }, { "epoch": 3.290246768507638, "eval_loss": 1.4622986316680908, "eval_runtime": 67.3258, "eval_samples_per_second": 21.299, "eval_steps_per_second": 2.674, "step": 5600 }, { "epoch": 3.2961222091656874, "grad_norm": 1.9802639484405518, "learning_rate": 3.408930669800235e-07, "loss": 5.9262, "step": 5610 }, { "epoch": 3.3019976498237367, "grad_norm": 1.9483816623687744, "learning_rate": 3.397179788484136e-07, "loss": 5.9497, "step": 5620 }, { "epoch": 3.3078730904817863, "grad_norm": 2.1321420669555664, "learning_rate": 3.3854289071680376e-07, "loss": 5.9206, "step": 5630 }, { "epoch": 3.3137485311398356, "grad_norm": 2.117222547531128, "learning_rate": 3.3736780258519386e-07, "loss": 5.8896, "step": 5640 }, { "epoch": 3.319623971797885, "grad_norm": 1.7869446277618408, "learning_rate": 3.3619271445358397e-07, "loss": 5.745, "step": 5650 }, { "epoch": 3.319623971797885, "eval_loss": 1.4623204469680786, "eval_runtime": 67.2748, "eval_samples_per_second": 21.316, "eval_steps_per_second": 2.676, "step": 5650 }, { "epoch": 3.325499412455934, "grad_norm": 1.9660139083862305, "learning_rate": 3.350176263219741e-07, "loss": 5.8493, "step": 5660 }, { "epoch": 3.3313748531139837, "grad_norm": 1.9285929203033447, "learning_rate": 3.338425381903643e-07, "loss": 5.7798, "step": 5670 }, { "epoch": 3.337250293772033, "grad_norm": 1.9511888027191162, "learning_rate": 3.3266745005875443e-07, "loss": 5.9952, "step": 5680 }, { "epoch": 3.343125734430082, "grad_norm": 1.659542441368103, "learning_rate": 3.3149236192714453e-07, "loss": 5.889, "step": 5690 }, { "epoch": 3.3490011750881314, "grad_norm": 1.6342780590057373, "learning_rate": 3.3031727379553463e-07, "loss": 5.7368, "step": 5700 }, { "epoch": 3.3490011750881314, "eval_loss": 1.462188482284546, "eval_runtime": 67.3727, "eval_samples_per_second": 21.285, "eval_steps_per_second": 2.672, "step": 5700 }, { "epoch": 3.354876615746181, "grad_norm": 1.9756345748901367, "learning_rate": 3.291421856639248e-07, "loss": 5.7537, "step": 5710 }, { "epoch": 3.3607520564042304, "grad_norm": 1.679041862487793, "learning_rate": 3.279670975323149e-07, "loss": 5.8132, "step": 5720 }, { "epoch": 3.3666274970622796, "grad_norm": 1.6406320333480835, "learning_rate": 3.2679200940070504e-07, "loss": 5.8062, "step": 5730 }, { "epoch": 3.372502937720329, "grad_norm": 2.1878700256347656, "learning_rate": 3.256169212690952e-07, "loss": 5.9283, "step": 5740 }, { "epoch": 3.3783783783783785, "grad_norm": 1.7907475233078003, "learning_rate": 3.244418331374853e-07, "loss": 5.9412, "step": 5750 }, { "epoch": 3.3783783783783785, "eval_loss": 1.4620883464813232, "eval_runtime": 67.3105, "eval_samples_per_second": 21.304, "eval_steps_per_second": 2.674, "step": 5750 }, { "epoch": 3.3842538190364277, "grad_norm": 1.8572816848754883, "learning_rate": 3.232667450058754e-07, "loss": 5.8449, "step": 5760 }, { "epoch": 3.390129259694477, "grad_norm": 1.9807683229446411, "learning_rate": 3.2209165687426555e-07, "loss": 5.8463, "step": 5770 }, { "epoch": 3.3960047003525267, "grad_norm": 2.1083383560180664, "learning_rate": 3.2091656874265565e-07, "loss": 5.7518, "step": 5780 }, { "epoch": 3.401880141010576, "grad_norm": 1.8015503883361816, "learning_rate": 3.197414806110458e-07, "loss": 6.0802, "step": 5790 }, { "epoch": 3.407755581668625, "grad_norm": 1.9593247175216675, "learning_rate": 3.1856639247943596e-07, "loss": 5.7689, "step": 5800 }, { "epoch": 3.407755581668625, "eval_loss": 1.462052345275879, "eval_runtime": 67.2848, "eval_samples_per_second": 21.312, "eval_steps_per_second": 2.675, "step": 5800 }, { "epoch": 3.4136310223266744, "grad_norm": 1.8491374254226685, "learning_rate": 3.1739130434782606e-07, "loss": 5.9444, "step": 5810 }, { "epoch": 3.4195064629847236, "grad_norm": 1.7238551378250122, "learning_rate": 3.162162162162162e-07, "loss": 5.9425, "step": 5820 }, { "epoch": 3.4253819036427733, "grad_norm": 1.681721568107605, "learning_rate": 3.150411280846063e-07, "loss": 5.7639, "step": 5830 }, { "epoch": 3.4312573443008225, "grad_norm": 1.882681131362915, "learning_rate": 3.1386603995299647e-07, "loss": 5.925, "step": 5840 }, { "epoch": 3.4371327849588718, "grad_norm": 1.8038091659545898, "learning_rate": 3.1269095182138663e-07, "loss": 5.7596, "step": 5850 }, { "epoch": 3.4371327849588718, "eval_loss": 1.4619789123535156, "eval_runtime": 67.3524, "eval_samples_per_second": 21.291, "eval_steps_per_second": 2.673, "step": 5850 }, { "epoch": 3.4430082256169214, "grad_norm": 1.9123611450195312, "learning_rate": 3.1151586368977673e-07, "loss": 5.9172, "step": 5860 }, { "epoch": 3.4488836662749707, "grad_norm": 1.6836742162704468, "learning_rate": 3.1034077555816683e-07, "loss": 5.8407, "step": 5870 }, { "epoch": 3.45475910693302, "grad_norm": 1.9502021074295044, "learning_rate": 3.09165687426557e-07, "loss": 6.0026, "step": 5880 }, { "epoch": 3.460634547591069, "grad_norm": 2.0914485454559326, "learning_rate": 3.079905992949471e-07, "loss": 5.9751, "step": 5890 }, { "epoch": 3.466509988249119, "grad_norm": 1.6563928127288818, "learning_rate": 3.0681551116333724e-07, "loss": 5.6502, "step": 5900 }, { "epoch": 3.466509988249119, "eval_loss": 1.4618340730667114, "eval_runtime": 67.2646, "eval_samples_per_second": 21.319, "eval_steps_per_second": 2.676, "step": 5900 }, { "epoch": 3.472385428907168, "grad_norm": 1.7382484674453735, "learning_rate": 3.056404230317274e-07, "loss": 5.7525, "step": 5910 }, { "epoch": 3.4782608695652173, "grad_norm": 1.8393006324768066, "learning_rate": 3.044653349001175e-07, "loss": 5.6196, "step": 5920 }, { "epoch": 3.484136310223267, "grad_norm": 1.8184826374053955, "learning_rate": 3.032902467685076e-07, "loss": 5.7433, "step": 5930 }, { "epoch": 3.490011750881316, "grad_norm": 1.9732388257980347, "learning_rate": 3.0211515863689775e-07, "loss": 5.8874, "step": 5940 }, { "epoch": 3.4958871915393654, "grad_norm": 2.0303008556365967, "learning_rate": 3.0094007050528785e-07, "loss": 5.9181, "step": 5950 }, { "epoch": 3.4958871915393654, "eval_loss": 1.4617245197296143, "eval_runtime": 67.3499, "eval_samples_per_second": 21.292, "eval_steps_per_second": 2.673, "step": 5950 }, { "epoch": 3.5017626321974147, "grad_norm": 1.7813360691070557, "learning_rate": 2.99764982373678e-07, "loss": 5.8842, "step": 5960 }, { "epoch": 3.507638072855464, "grad_norm": 1.7646697759628296, "learning_rate": 2.9858989424206816e-07, "loss": 5.5021, "step": 5970 }, { "epoch": 3.5135135135135136, "grad_norm": 1.9409451484680176, "learning_rate": 2.9741480611045826e-07, "loss": 5.8135, "step": 5980 }, { "epoch": 3.519388954171563, "grad_norm": 1.96255624294281, "learning_rate": 2.962397179788484e-07, "loss": 5.9597, "step": 5990 }, { "epoch": 3.525264394829612, "grad_norm": 1.9019967317581177, "learning_rate": 2.950646298472385e-07, "loss": 5.8966, "step": 6000 }, { "epoch": 3.525264394829612, "eval_loss": 1.4617407321929932, "eval_runtime": 67.4776, "eval_samples_per_second": 21.251, "eval_steps_per_second": 2.668, "step": 6000 }, { "epoch": 3.5311398354876617, "grad_norm": 1.9315980672836304, "learning_rate": 2.9388954171562867e-07, "loss": 5.9795, "step": 6010 }, { "epoch": 3.537015276145711, "grad_norm": 1.920632243156433, "learning_rate": 2.927144535840188e-07, "loss": 5.8567, "step": 6020 }, { "epoch": 3.54289071680376, "grad_norm": 1.9164453744888306, "learning_rate": 2.9153936545240893e-07, "loss": 5.895, "step": 6030 }, { "epoch": 3.5487661574618095, "grad_norm": 1.761549949645996, "learning_rate": 2.9036427732079903e-07, "loss": 6.036, "step": 6040 }, { "epoch": 3.554641598119859, "grad_norm": 1.8866323232650757, "learning_rate": 2.891891891891892e-07, "loss": 5.9864, "step": 6050 }, { "epoch": 3.554641598119859, "eval_loss": 1.4616913795471191, "eval_runtime": 67.2721, "eval_samples_per_second": 21.316, "eval_steps_per_second": 2.676, "step": 6050 }, { "epoch": 3.5605170387779084, "grad_norm": 1.8041138648986816, "learning_rate": 2.880141010575793e-07, "loss": 5.854, "step": 6060 }, { "epoch": 3.5663924794359576, "grad_norm": 2.0642271041870117, "learning_rate": 2.8683901292596944e-07, "loss": 5.8082, "step": 6070 }, { "epoch": 3.5722679200940073, "grad_norm": 2.4056267738342285, "learning_rate": 2.856639247943596e-07, "loss": 5.8928, "step": 6080 }, { "epoch": 3.5781433607520565, "grad_norm": 2.040055274963379, "learning_rate": 2.844888366627497e-07, "loss": 5.7473, "step": 6090 }, { "epoch": 3.5840188014101058, "grad_norm": 1.7047302722930908, "learning_rate": 2.833137485311398e-07, "loss": 5.9143, "step": 6100 }, { "epoch": 3.5840188014101058, "eval_loss": 1.4616738557815552, "eval_runtime": 67.3074, "eval_samples_per_second": 21.305, "eval_steps_per_second": 2.674, "step": 6100 }, { "epoch": 3.589894242068155, "grad_norm": 1.9022328853607178, "learning_rate": 2.8213866039952995e-07, "loss": 5.9284, "step": 6110 }, { "epoch": 3.5957696827262042, "grad_norm": 1.7916126251220703, "learning_rate": 2.8096357226792005e-07, "loss": 5.8873, "step": 6120 }, { "epoch": 3.601645123384254, "grad_norm": 1.954274296760559, "learning_rate": 2.7978848413631026e-07, "loss": 5.8389, "step": 6130 }, { "epoch": 3.607520564042303, "grad_norm": 1.74794602394104, "learning_rate": 2.7861339600470036e-07, "loss": 5.8795, "step": 6140 }, { "epoch": 3.6133960047003524, "grad_norm": 1.8686721324920654, "learning_rate": 2.7743830787309046e-07, "loss": 5.7894, "step": 6150 }, { "epoch": 3.6133960047003524, "eval_loss": 1.4615228176116943, "eval_runtime": 67.2128, "eval_samples_per_second": 21.335, "eval_steps_per_second": 2.678, "step": 6150 }, { "epoch": 3.619271445358402, "grad_norm": 1.8556008338928223, "learning_rate": 2.762632197414806e-07, "loss": 5.8837, "step": 6160 }, { "epoch": 3.6251468860164513, "grad_norm": 1.8632394075393677, "learning_rate": 2.750881316098707e-07, "loss": 5.9041, "step": 6170 }, { "epoch": 3.6310223266745005, "grad_norm": 1.7999444007873535, "learning_rate": 2.739130434782608e-07, "loss": 5.8486, "step": 6180 }, { "epoch": 3.6368977673325498, "grad_norm": 1.9313387870788574, "learning_rate": 2.72737955346651e-07, "loss": 5.9457, "step": 6190 }, { "epoch": 3.6427732079905994, "grad_norm": 2.07930064201355, "learning_rate": 2.7156286721504113e-07, "loss": 5.8247, "step": 6200 }, { "epoch": 3.6427732079905994, "eval_loss": 1.461436152458191, "eval_runtime": 67.263, "eval_samples_per_second": 21.319, "eval_steps_per_second": 2.676, "step": 6200 }, { "epoch": 3.6486486486486487, "grad_norm": 2.2443180084228516, "learning_rate": 2.7038777908343123e-07, "loss": 6.1853, "step": 6210 }, { "epoch": 3.654524089306698, "grad_norm": 1.9109710454940796, "learning_rate": 2.692126909518214e-07, "loss": 5.9959, "step": 6220 }, { "epoch": 3.6603995299647476, "grad_norm": 1.809380292892456, "learning_rate": 2.680376028202115e-07, "loss": 5.7262, "step": 6230 }, { "epoch": 3.666274970622797, "grad_norm": 1.8630945682525635, "learning_rate": 2.6686251468860164e-07, "loss": 5.8591, "step": 6240 }, { "epoch": 3.672150411280846, "grad_norm": 1.8457863330841064, "learning_rate": 2.656874265569918e-07, "loss": 5.8961, "step": 6250 }, { "epoch": 3.672150411280846, "eval_loss": 1.4614366292953491, "eval_runtime": 67.434, "eval_samples_per_second": 21.265, "eval_steps_per_second": 2.669, "step": 6250 }, { "epoch": 3.6780258519388953, "grad_norm": 1.829138994216919, "learning_rate": 2.645123384253819e-07, "loss": 6.0951, "step": 6260 }, { "epoch": 3.6839012925969445, "grad_norm": 2.01283860206604, "learning_rate": 2.63337250293772e-07, "loss": 5.8845, "step": 6270 }, { "epoch": 3.6897767332549942, "grad_norm": 1.7411574125289917, "learning_rate": 2.6216216216216215e-07, "loss": 5.8118, "step": 6280 }, { "epoch": 3.6956521739130435, "grad_norm": 2.0445363521575928, "learning_rate": 2.6098707403055225e-07, "loss": 6.0719, "step": 6290 }, { "epoch": 3.7015276145710927, "grad_norm": 1.6012552976608276, "learning_rate": 2.5981198589894246e-07, "loss": 5.9107, "step": 6300 }, { "epoch": 3.7015276145710927, "eval_loss": 1.4612646102905273, "eval_runtime": 67.3397, "eval_samples_per_second": 21.295, "eval_steps_per_second": 2.673, "step": 6300 }, { "epoch": 3.7074030552291424, "grad_norm": 1.668100357055664, "learning_rate": 2.5863689776733256e-07, "loss": 5.7761, "step": 6310 }, { "epoch": 3.7132784958871916, "grad_norm": 1.8935034275054932, "learning_rate": 2.5746180963572266e-07, "loss": 5.6924, "step": 6320 }, { "epoch": 3.719153936545241, "grad_norm": 1.6541757583618164, "learning_rate": 2.562867215041128e-07, "loss": 5.798, "step": 6330 }, { "epoch": 3.72502937720329, "grad_norm": 1.9191126823425293, "learning_rate": 2.551116333725029e-07, "loss": 5.7736, "step": 6340 }, { "epoch": 3.7309048178613398, "grad_norm": 1.6552644968032837, "learning_rate": 2.53936545240893e-07, "loss": 5.8405, "step": 6350 }, { "epoch": 3.7309048178613398, "eval_loss": 1.4613573551177979, "eval_runtime": 68.3662, "eval_samples_per_second": 20.975, "eval_steps_per_second": 2.633, "step": 6350 }, { "epoch": 3.736780258519389, "grad_norm": 1.8980045318603516, "learning_rate": 2.527614571092832e-07, "loss": 5.9485, "step": 6360 }, { "epoch": 3.7426556991774382, "grad_norm": 1.8480231761932373, "learning_rate": 2.515863689776733e-07, "loss": 5.7251, "step": 6370 }, { "epoch": 3.748531139835488, "grad_norm": 2.0423247814178467, "learning_rate": 2.5041128084606343e-07, "loss": 5.9523, "step": 6380 }, { "epoch": 3.754406580493537, "grad_norm": 1.9046651124954224, "learning_rate": 2.492361927144536e-07, "loss": 6.1359, "step": 6390 }, { "epoch": 3.7602820211515864, "grad_norm": 1.644461989402771, "learning_rate": 2.4806110458284374e-07, "loss": 5.8119, "step": 6400 }, { "epoch": 3.7602820211515864, "eval_loss": 1.4611767530441284, "eval_runtime": 67.7542, "eval_samples_per_second": 21.165, "eval_steps_per_second": 2.657, "step": 6400 }, { "epoch": 3.7661574618096356, "grad_norm": 1.9219424724578857, "learning_rate": 2.4688601645123384e-07, "loss": 5.7408, "step": 6410 }, { "epoch": 3.772032902467685, "grad_norm": 2.5688843727111816, "learning_rate": 2.4571092831962394e-07, "loss": 5.858, "step": 6420 }, { "epoch": 3.7779083431257345, "grad_norm": 1.7739956378936768, "learning_rate": 2.445358401880141e-07, "loss": 6.0526, "step": 6430 }, { "epoch": 3.7837837837837838, "grad_norm": 1.7807574272155762, "learning_rate": 2.433607520564042e-07, "loss": 5.7706, "step": 6440 }, { "epoch": 3.789659224441833, "grad_norm": 1.7440868616104126, "learning_rate": 2.4218566392479435e-07, "loss": 5.9321, "step": 6450 }, { "epoch": 3.789659224441833, "eval_loss": 1.461159110069275, "eval_runtime": 67.3392, "eval_samples_per_second": 21.295, "eval_steps_per_second": 2.673, "step": 6450 }, { "epoch": 3.7955346650998827, "grad_norm": 1.6572002172470093, "learning_rate": 2.410105757931845e-07, "loss": 5.83, "step": 6460 }, { "epoch": 3.801410105757932, "grad_norm": 2.195672035217285, "learning_rate": 2.398354876615746e-07, "loss": 5.8685, "step": 6470 }, { "epoch": 3.807285546415981, "grad_norm": 1.828194260597229, "learning_rate": 2.386603995299647e-07, "loss": 5.8451, "step": 6480 }, { "epoch": 3.8131609870740304, "grad_norm": 1.9797534942626953, "learning_rate": 2.3748531139835486e-07, "loss": 5.8433, "step": 6490 }, { "epoch": 3.8190364277320796, "grad_norm": 1.7732436656951904, "learning_rate": 2.3631022326674499e-07, "loss": 5.936, "step": 6500 }, { "epoch": 3.8190364277320796, "eval_loss": 1.4612115621566772, "eval_runtime": 67.3159, "eval_samples_per_second": 21.303, "eval_steps_per_second": 2.674, "step": 6500 }, { "epoch": 3.8249118683901293, "grad_norm": 1.738011360168457, "learning_rate": 2.3513513513513514e-07, "loss": 5.9119, "step": 6510 }, { "epoch": 3.8307873090481785, "grad_norm": 2.1319050788879395, "learning_rate": 2.3396004700352527e-07, "loss": 5.7625, "step": 6520 }, { "epoch": 3.8366627497062282, "grad_norm": 1.9762002229690552, "learning_rate": 2.3278495887191537e-07, "loss": 5.8969, "step": 6530 }, { "epoch": 3.8425381903642775, "grad_norm": 1.8025697469711304, "learning_rate": 2.3160987074030552e-07, "loss": 5.7755, "step": 6540 }, { "epoch": 3.8484136310223267, "grad_norm": 1.8634493350982666, "learning_rate": 2.3043478260869565e-07, "loss": 5.7939, "step": 6550 }, { "epoch": 3.8484136310223267, "eval_loss": 1.4610487222671509, "eval_runtime": 67.3671, "eval_samples_per_second": 21.286, "eval_steps_per_second": 2.672, "step": 6550 }, { "epoch": 3.854289071680376, "grad_norm": 2.1296660900115967, "learning_rate": 2.2925969447708575e-07, "loss": 5.8576, "step": 6560 }, { "epoch": 3.860164512338425, "grad_norm": 2.249799966812134, "learning_rate": 2.280846063454759e-07, "loss": 5.9107, "step": 6570 }, { "epoch": 3.866039952996475, "grad_norm": 1.938138723373413, "learning_rate": 2.2690951821386604e-07, "loss": 5.7601, "step": 6580 }, { "epoch": 3.871915393654524, "grad_norm": 1.7803981304168701, "learning_rate": 2.2573443008225614e-07, "loss": 5.8213, "step": 6590 }, { "epoch": 3.8777908343125733, "grad_norm": 1.6013925075531006, "learning_rate": 2.245593419506463e-07, "loss": 5.8792, "step": 6600 }, { "epoch": 3.8777908343125733, "eval_loss": 1.4610427618026733, "eval_runtime": 67.2577, "eval_samples_per_second": 21.321, "eval_steps_per_second": 2.676, "step": 6600 }, { "epoch": 3.883666274970623, "grad_norm": 2.0687365531921387, "learning_rate": 2.2338425381903642e-07, "loss": 5.7506, "step": 6610 }, { "epoch": 3.8895417156286722, "grad_norm": 1.913124918937683, "learning_rate": 2.2220916568742655e-07, "loss": 5.8087, "step": 6620 }, { "epoch": 3.8954171562867215, "grad_norm": 1.6601601839065552, "learning_rate": 2.2103407755581667e-07, "loss": 5.7706, "step": 6630 }, { "epoch": 3.9012925969447707, "grad_norm": 1.7471449375152588, "learning_rate": 2.198589894242068e-07, "loss": 5.9002, "step": 6640 }, { "epoch": 3.90716803760282, "grad_norm": 1.875045657157898, "learning_rate": 2.1868390129259693e-07, "loss": 5.8144, "step": 6650 }, { "epoch": 3.90716803760282, "eval_loss": 1.4610403776168823, "eval_runtime": 67.3072, "eval_samples_per_second": 21.305, "eval_steps_per_second": 2.674, "step": 6650 }, { "epoch": 3.9130434782608696, "grad_norm": 1.9555529356002808, "learning_rate": 2.1750881316098706e-07, "loss": 6.0214, "step": 6660 }, { "epoch": 3.918918918918919, "grad_norm": 1.9561495780944824, "learning_rate": 2.1633372502937719e-07, "loss": 5.984, "step": 6670 }, { "epoch": 3.9247943595769685, "grad_norm": 1.739403247833252, "learning_rate": 2.1515863689776731e-07, "loss": 5.9714, "step": 6680 }, { "epoch": 3.9306698002350178, "grad_norm": 1.620549201965332, "learning_rate": 2.1398354876615747e-07, "loss": 5.88, "step": 6690 }, { "epoch": 3.936545240893067, "grad_norm": 1.9505090713500977, "learning_rate": 2.1280846063454757e-07, "loss": 5.7891, "step": 6700 }, { "epoch": 3.936545240893067, "eval_loss": 1.4608731269836426, "eval_runtime": 68.119, "eval_samples_per_second": 21.051, "eval_steps_per_second": 2.642, "step": 6700 }, { "epoch": 3.9424206815511162, "grad_norm": 1.7288826704025269, "learning_rate": 2.1163337250293772e-07, "loss": 5.9777, "step": 6710 }, { "epoch": 3.9482961222091655, "grad_norm": 1.8516991138458252, "learning_rate": 2.1045828437132785e-07, "loss": 5.7113, "step": 6720 }, { "epoch": 3.954171562867215, "grad_norm": 1.7342356443405151, "learning_rate": 2.0928319623971795e-07, "loss": 5.7252, "step": 6730 }, { "epoch": 3.9600470035252644, "grad_norm": 1.5385229587554932, "learning_rate": 2.081081081081081e-07, "loss": 5.8457, "step": 6740 }, { "epoch": 3.9659224441833136, "grad_norm": 1.548790693283081, "learning_rate": 2.0693301997649823e-07, "loss": 5.7167, "step": 6750 }, { "epoch": 3.9659224441833136, "eval_loss": 1.4608203172683716, "eval_runtime": 67.3467, "eval_samples_per_second": 21.293, "eval_steps_per_second": 2.673, "step": 6750 }, { "epoch": 3.9717978848413633, "grad_norm": 1.6528300046920776, "learning_rate": 2.0575793184488836e-07, "loss": 5.9047, "step": 6760 }, { "epoch": 3.9776733254994125, "grad_norm": 1.8215575218200684, "learning_rate": 2.045828437132785e-07, "loss": 6.0313, "step": 6770 }, { "epoch": 3.983548766157462, "grad_norm": 1.7826635837554932, "learning_rate": 2.0340775558166862e-07, "loss": 5.9478, "step": 6780 }, { "epoch": 3.989424206815511, "grad_norm": 1.5644893646240234, "learning_rate": 2.0223266745005875e-07, "loss": 5.8306, "step": 6790 }, { "epoch": 3.9952996474735603, "grad_norm": 1.9673813581466675, "learning_rate": 2.0105757931844887e-07, "loss": 5.826, "step": 6800 }, { "epoch": 3.9952996474735603, "eval_loss": 1.4608874320983887, "eval_runtime": 67.3633, "eval_samples_per_second": 21.288, "eval_steps_per_second": 2.672, "step": 6800 }, { "epoch": 4.0011750881316095, "grad_norm": 1.796644926071167, "learning_rate": 1.99882491186839e-07, "loss": 5.9259, "step": 6810 }, { "epoch": 4.00705052878966, "grad_norm": 1.6265869140625, "learning_rate": 1.9870740305522913e-07, "loss": 5.8435, "step": 6820 }, { "epoch": 4.012925969447709, "grad_norm": 1.6663663387298584, "learning_rate": 1.9753231492361926e-07, "loss": 5.6056, "step": 6830 }, { "epoch": 4.018801410105758, "grad_norm": 2.006054401397705, "learning_rate": 1.9635722679200938e-07, "loss": 5.8087, "step": 6840 }, { "epoch": 4.024676850763807, "grad_norm": 1.7286150455474854, "learning_rate": 1.951821386603995e-07, "loss": 5.9072, "step": 6850 }, { "epoch": 4.024676850763807, "eval_loss": 1.4607393741607666, "eval_runtime": 67.3237, "eval_samples_per_second": 21.3, "eval_steps_per_second": 2.674, "step": 6850 } ], "logging_steps": 10, "max_steps": 8510, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 50, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 2, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 4.788240289615577e+18, "train_batch_size": 4, "trial_name": null, "trial_params": null }