Text Generation
PEFT
Safetensors
English
humor
computational-humor
lora
qwen
cognitive-synergy-framework
headline-humor
conversational
Instructions to use Jayi2424/HumorGen_GRPO_Think_7B with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use Jayi2424/HumorGen_GRPO_Think_7B with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("unsloth/qwen2.5-7b-instruct-unsloth-bnb-4bit") model = PeftModel.from_pretrained(base_model, "Jayi2424/HumorGen_GRPO_Think_7B") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 6850, | |
| "best_metric": 1.4607393741607666, | |
| "best_model_checkpoint": "/ocean/projects/cis250225p/eajayi1/HUMOR_V2/models/HumorGen_GRPO_Think_7B/checkpoint-6850", | |
| "epoch": 4.024676850763807, | |
| "eval_steps": 50, | |
| "global_step": 6850, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.005875440658049354, | |
| "grad_norm": 8.811631202697754, | |
| "learning_rate": 9.98942420681551e-07, | |
| "loss": 12.2374, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.011750881316098707, | |
| "grad_norm": 8.409488677978516, | |
| "learning_rate": 9.97767332549941e-07, | |
| "loss": 11.9053, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.01762632197414806, | |
| "grad_norm": 8.858304023742676, | |
| "learning_rate": 9.965922444183313e-07, | |
| "loss": 11.7157, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.023501762632197415, | |
| "grad_norm": 7.180182456970215, | |
| "learning_rate": 9.954171562867215e-07, | |
| "loss": 11.502, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.02937720329024677, | |
| "grad_norm": 6.562496662139893, | |
| "learning_rate": 9.942420681551115e-07, | |
| "loss": 11.2901, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.02937720329024677, | |
| "eval_loss": 2.7823050022125244, | |
| "eval_runtime": 67.4853, | |
| "eval_samples_per_second": 21.249, | |
| "eval_steps_per_second": 2.667, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.03525264394829612, | |
| "grad_norm": 6.412452697753906, | |
| "learning_rate": 9.930669800235017e-07, | |
| "loss": 11.3432, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.041128084606345476, | |
| "grad_norm": 5.517050266265869, | |
| "learning_rate": 9.91891891891892e-07, | |
| "loss": 10.9799, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.04700352526439483, | |
| "grad_norm": 5.147578716278076, | |
| "learning_rate": 9.90716803760282e-07, | |
| "loss": 10.7056, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.052878965922444184, | |
| "grad_norm": 5.424646377563477, | |
| "learning_rate": 9.895417156286721e-07, | |
| "loss": 10.8406, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.05875440658049354, | |
| "grad_norm": 5.833001613616943, | |
| "learning_rate": 9.883666274970623e-07, | |
| "loss": 10.381, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.05875440658049354, | |
| "eval_loss": 2.5908639430999756, | |
| "eval_runtime": 67.4352, | |
| "eval_samples_per_second": 21.265, | |
| "eval_steps_per_second": 2.669, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.06462984723854288, | |
| "grad_norm": 5.278085708618164, | |
| "learning_rate": 9.871915393654523e-07, | |
| "loss": 10.4618, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.07050528789659224, | |
| "grad_norm": 5.3119378089904785, | |
| "learning_rate": 9.860164512338425e-07, | |
| "loss": 10.2036, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.07638072855464159, | |
| "grad_norm": 5.22417688369751, | |
| "learning_rate": 9.848413631022327e-07, | |
| "loss": 9.938, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.08225616921269095, | |
| "grad_norm": 5.020732402801514, | |
| "learning_rate": 9.836662749706227e-07, | |
| "loss": 9.8027, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.0881316098707403, | |
| "grad_norm": 5.330644607543945, | |
| "learning_rate": 9.82491186839013e-07, | |
| "loss": 9.8301, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.0881316098707403, | |
| "eval_loss": 2.414473533630371, | |
| "eval_runtime": 67.5277, | |
| "eval_samples_per_second": 21.236, | |
| "eval_steps_per_second": 2.666, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.09400705052878966, | |
| "grad_norm": 5.486049175262451, | |
| "learning_rate": 9.813160987074031e-07, | |
| "loss": 9.5357, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.099882491186839, | |
| "grad_norm": 5.097166061401367, | |
| "learning_rate": 9.801410105757931e-07, | |
| "loss": 9.4452, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.10575793184488837, | |
| "grad_norm": 5.45658540725708, | |
| "learning_rate": 9.789659224441834e-07, | |
| "loss": 9.2689, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.11163337250293771, | |
| "grad_norm": 4.833297252655029, | |
| "learning_rate": 9.777908343125733e-07, | |
| "loss": 9.3352, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.11750881316098707, | |
| "grad_norm": 4.945570945739746, | |
| "learning_rate": 9.766157461809636e-07, | |
| "loss": 9.0403, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.11750881316098707, | |
| "eval_loss": 2.241272211074829, | |
| "eval_runtime": 67.4972, | |
| "eval_samples_per_second": 21.245, | |
| "eval_steps_per_second": 2.667, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.12338425381903642, | |
| "grad_norm": 4.854373455047607, | |
| "learning_rate": 9.754406580493535e-07, | |
| "loss": 8.989, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.12925969447708577, | |
| "grad_norm": 5.162915229797363, | |
| "learning_rate": 9.742655699177438e-07, | |
| "loss": 8.8739, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.13513513513513514, | |
| "grad_norm": 4.9273223876953125, | |
| "learning_rate": 9.73090481786134e-07, | |
| "loss": 8.5618, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.1410105757931845, | |
| "grad_norm": 6.022256851196289, | |
| "learning_rate": 9.71915393654524e-07, | |
| "loss": 8.6177, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.14688601645123384, | |
| "grad_norm": 5.432478427886963, | |
| "learning_rate": 9.707403055229142e-07, | |
| "loss": 8.4886, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.14688601645123384, | |
| "eval_loss": 2.0618011951446533, | |
| "eval_runtime": 67.4752, | |
| "eval_samples_per_second": 21.252, | |
| "eval_steps_per_second": 2.668, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.15276145710928318, | |
| "grad_norm": 4.686826705932617, | |
| "learning_rate": 9.695652173913042e-07, | |
| "loss": 8.2455, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.15863689776733256, | |
| "grad_norm": 4.1519598960876465, | |
| "learning_rate": 9.683901292596944e-07, | |
| "loss": 8.1025, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.1645123384253819, | |
| "grad_norm": 4.351338863372803, | |
| "learning_rate": 9.672150411280846e-07, | |
| "loss": 7.9276, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.17038777908343125, | |
| "grad_norm": 4.530479431152344, | |
| "learning_rate": 9.660399529964746e-07, | |
| "loss": 7.8546, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.1762632197414806, | |
| "grad_norm": 4.559052467346191, | |
| "learning_rate": 9.648648648648648e-07, | |
| "loss": 7.5711, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.1762632197414806, | |
| "eval_loss": 1.9077221155166626, | |
| "eval_runtime": 67.4909, | |
| "eval_samples_per_second": 21.247, | |
| "eval_steps_per_second": 2.667, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.18213866039952997, | |
| "grad_norm": 4.547175884246826, | |
| "learning_rate": 9.63689776733255e-07, | |
| "loss": 7.6163, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.18801410105757932, | |
| "grad_norm": 4.496427536010742, | |
| "learning_rate": 9.62514688601645e-07, | |
| "loss": 7.5918, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.19388954171562867, | |
| "grad_norm": 3.8418445587158203, | |
| "learning_rate": 9.613396004700352e-07, | |
| "loss": 7.4111, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.199764982373678, | |
| "grad_norm": 3.503477096557617, | |
| "learning_rate": 9.601645123384254e-07, | |
| "loss": 7.3492, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.2056404230317274, | |
| "grad_norm": 3.4004416465759277, | |
| "learning_rate": 9.589894242068156e-07, | |
| "loss": 7.3022, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.2056404230317274, | |
| "eval_loss": 1.7808701992034912, | |
| "eval_runtime": 67.5434, | |
| "eval_samples_per_second": 21.231, | |
| "eval_steps_per_second": 2.665, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.21151586368977673, | |
| "grad_norm": 3.0668485164642334, | |
| "learning_rate": 9.578143360752056e-07, | |
| "loss": 7.1996, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.21739130434782608, | |
| "grad_norm": 3.0713930130004883, | |
| "learning_rate": 9.566392479435958e-07, | |
| "loss": 7.0048, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.22326674500587543, | |
| "grad_norm": 2.9766199588775635, | |
| "learning_rate": 9.554641598119858e-07, | |
| "loss": 6.87, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.2291421856639248, | |
| "grad_norm": 3.037301778793335, | |
| "learning_rate": 9.54289071680376e-07, | |
| "loss": 6.9316, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 0.23501762632197415, | |
| "grad_norm": 2.995626211166382, | |
| "learning_rate": 9.531139835487661e-07, | |
| "loss": 6.923, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.23501762632197415, | |
| "eval_loss": 1.7068030834197998, | |
| "eval_runtime": 67.4312, | |
| "eval_samples_per_second": 21.266, | |
| "eval_steps_per_second": 2.669, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.2408930669800235, | |
| "grad_norm": 2.8138625621795654, | |
| "learning_rate": 9.519388954171562e-07, | |
| "loss": 6.839, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 0.24676850763807284, | |
| "grad_norm": 3.0855729579925537, | |
| "learning_rate": 9.507638072855464e-07, | |
| "loss": 6.8684, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 0.2526439482961222, | |
| "grad_norm": 3.1985392570495605, | |
| "learning_rate": 9.495887191539364e-07, | |
| "loss": 6.8183, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 0.25851938895417154, | |
| "grad_norm": 2.9578516483306885, | |
| "learning_rate": 9.484136310223266e-07, | |
| "loss": 6.7427, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 0.26439482961222094, | |
| "grad_norm": 2.966491460800171, | |
| "learning_rate": 9.472385428907168e-07, | |
| "loss": 6.5244, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.26439482961222094, | |
| "eval_loss": 1.6518244743347168, | |
| "eval_runtime": 67.4846, | |
| "eval_samples_per_second": 21.249, | |
| "eval_steps_per_second": 2.667, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.2702702702702703, | |
| "grad_norm": 3.0331716537475586, | |
| "learning_rate": 9.460634547591068e-07, | |
| "loss": 6.7348, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 0.27614571092831963, | |
| "grad_norm": 2.72918963432312, | |
| "learning_rate": 9.44888366627497e-07, | |
| "loss": 6.5748, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 0.282021151586369, | |
| "grad_norm": 2.724346399307251, | |
| "learning_rate": 9.437132784958871e-07, | |
| "loss": 6.6686, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 0.2878965922444183, | |
| "grad_norm": 2.5998895168304443, | |
| "learning_rate": 9.425381903642773e-07, | |
| "loss": 6.5502, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 0.2937720329024677, | |
| "grad_norm": 2.6023731231689453, | |
| "learning_rate": 9.413631022326674e-07, | |
| "loss": 6.7858, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.2937720329024677, | |
| "eval_loss": 1.6121058464050293, | |
| "eval_runtime": 67.4886, | |
| "eval_samples_per_second": 21.248, | |
| "eval_steps_per_second": 2.667, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.299647473560517, | |
| "grad_norm": 2.7446892261505127, | |
| "learning_rate": 9.401880141010575e-07, | |
| "loss": 6.4195, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 0.30552291421856637, | |
| "grad_norm": 2.613320827484131, | |
| "learning_rate": 9.390129259694477e-07, | |
| "loss": 6.4007, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 0.31139835487661577, | |
| "grad_norm": 2.511936664581299, | |
| "learning_rate": 9.378378378378377e-07, | |
| "loss": 6.4101, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 0.3172737955346651, | |
| "grad_norm": 2.873652219772339, | |
| "learning_rate": 9.36662749706228e-07, | |
| "loss": 6.3963, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 0.32314923619271446, | |
| "grad_norm": 2.630295515060425, | |
| "learning_rate": 9.35487661574618e-07, | |
| "loss": 6.3901, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.32314923619271446, | |
| "eval_loss": 1.5881245136260986, | |
| "eval_runtime": 67.5206, | |
| "eval_samples_per_second": 21.238, | |
| "eval_steps_per_second": 2.666, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.3290246768507638, | |
| "grad_norm": 2.6342382431030273, | |
| "learning_rate": 9.343125734430082e-07, | |
| "loss": 6.3494, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 0.33490011750881316, | |
| "grad_norm": 2.5987398624420166, | |
| "learning_rate": 9.331374853113984e-07, | |
| "loss": 6.5762, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 0.3407755581668625, | |
| "grad_norm": 2.516655445098877, | |
| "learning_rate": 9.319623971797885e-07, | |
| "loss": 6.1983, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 0.34665099882491185, | |
| "grad_norm": 2.4287195205688477, | |
| "learning_rate": 9.307873090481786e-07, | |
| "loss": 6.1897, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 0.3525264394829612, | |
| "grad_norm": 2.5706946849823, | |
| "learning_rate": 9.296122209165687e-07, | |
| "loss": 6.26, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.3525264394829612, | |
| "eval_loss": 1.5706110000610352, | |
| "eval_runtime": 67.47, | |
| "eval_samples_per_second": 21.254, | |
| "eval_steps_per_second": 2.668, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.3584018801410106, | |
| "grad_norm": 2.3836824893951416, | |
| "learning_rate": 9.284371327849589e-07, | |
| "loss": 6.2133, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 0.36427732079905994, | |
| "grad_norm": 2.400269031524658, | |
| "learning_rate": 9.27262044653349e-07, | |
| "loss": 6.1327, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 0.3701527614571093, | |
| "grad_norm": 2.3165385723114014, | |
| "learning_rate": 9.260869565217391e-07, | |
| "loss": 6.3342, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 0.37602820211515864, | |
| "grad_norm": 2.231174945831299, | |
| "learning_rate": 9.249118683901293e-07, | |
| "loss": 6.2059, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 0.381903642773208, | |
| "grad_norm": 2.0728275775909424, | |
| "learning_rate": 9.237367802585193e-07, | |
| "loss": 6.3354, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.381903642773208, | |
| "eval_loss": 1.5572385787963867, | |
| "eval_runtime": 67.5201, | |
| "eval_samples_per_second": 21.238, | |
| "eval_steps_per_second": 2.666, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.38777908343125733, | |
| "grad_norm": 2.2668001651763916, | |
| "learning_rate": 9.225616921269095e-07, | |
| "loss": 6.3588, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 0.3936545240893067, | |
| "grad_norm": 1.953262209892273, | |
| "learning_rate": 9.213866039952997e-07, | |
| "loss": 6.1279, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 0.399529964747356, | |
| "grad_norm": 2.1020588874816895, | |
| "learning_rate": 9.202115158636897e-07, | |
| "loss": 6.3427, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 0.40540540540540543, | |
| "grad_norm": 2.1236062049865723, | |
| "learning_rate": 9.190364277320799e-07, | |
| "loss": 6.263, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 0.4112808460634548, | |
| "grad_norm": 1.9457736015319824, | |
| "learning_rate": 9.1786133960047e-07, | |
| "loss": 6.2794, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.4112808460634548, | |
| "eval_loss": 1.5472731590270996, | |
| "eval_runtime": 67.5297, | |
| "eval_samples_per_second": 21.235, | |
| "eval_steps_per_second": 2.665, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.4171562867215041, | |
| "grad_norm": 1.8783148527145386, | |
| "learning_rate": 9.166862514688601e-07, | |
| "loss": 6.1391, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 0.42303172737955347, | |
| "grad_norm": 1.9739516973495483, | |
| "learning_rate": 9.155111633372502e-07, | |
| "loss": 6.1713, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 0.4289071680376028, | |
| "grad_norm": 1.813057541847229, | |
| "learning_rate": 9.143360752056404e-07, | |
| "loss": 6.1088, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 0.43478260869565216, | |
| "grad_norm": 1.8499605655670166, | |
| "learning_rate": 9.131609870740305e-07, | |
| "loss": 6.1912, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 0.4406580493537015, | |
| "grad_norm": 1.9469040632247925, | |
| "learning_rate": 9.119858989424206e-07, | |
| "loss": 6.236, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.4406580493537015, | |
| "eval_loss": 1.5403022766113281, | |
| "eval_runtime": 67.8197, | |
| "eval_samples_per_second": 21.144, | |
| "eval_steps_per_second": 2.654, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.44653349001175086, | |
| "grad_norm": 2.038455009460449, | |
| "learning_rate": 9.108108108108108e-07, | |
| "loss": 6.0741, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 0.45240893066980026, | |
| "grad_norm": 1.835290551185608, | |
| "learning_rate": 9.096357226792008e-07, | |
| "loss": 6.0559, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 0.4582843713278496, | |
| "grad_norm": 2.0130181312561035, | |
| "learning_rate": 9.08460634547591e-07, | |
| "loss": 6.0528, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 0.46415981198589895, | |
| "grad_norm": 1.840409278869629, | |
| "learning_rate": 9.072855464159812e-07, | |
| "loss": 6.2831, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 0.4700352526439483, | |
| "grad_norm": 1.9972599744796753, | |
| "learning_rate": 9.061104582843712e-07, | |
| "loss": 6.1976, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.4700352526439483, | |
| "eval_loss": 1.5347312688827515, | |
| "eval_runtime": 67.5274, | |
| "eval_samples_per_second": 21.236, | |
| "eval_steps_per_second": 2.666, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.47591069330199764, | |
| "grad_norm": 1.8628931045532227, | |
| "learning_rate": 9.049353701527614e-07, | |
| "loss": 6.1779, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 0.481786133960047, | |
| "grad_norm": 2.0729994773864746, | |
| "learning_rate": 9.037602820211515e-07, | |
| "loss": 6.242, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 0.48766157461809634, | |
| "grad_norm": 1.8701937198638916, | |
| "learning_rate": 9.025851938895417e-07, | |
| "loss": 6.1222, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 0.4935370152761457, | |
| "grad_norm": 1.851508617401123, | |
| "learning_rate": 9.014101057579317e-07, | |
| "loss": 6.297, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 0.4994124559341951, | |
| "grad_norm": 1.8502558469772339, | |
| "learning_rate": 9.002350176263219e-07, | |
| "loss": 6.2895, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.4994124559341951, | |
| "eval_loss": 1.5294647216796875, | |
| "eval_runtime": 67.5444, | |
| "eval_samples_per_second": 21.23, | |
| "eval_steps_per_second": 2.665, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.5052878965922444, | |
| "grad_norm": 1.861267328262329, | |
| "learning_rate": 8.990599294947121e-07, | |
| "loss": 6.0995, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 0.5111633372502937, | |
| "grad_norm": 1.8467332124710083, | |
| "learning_rate": 8.978848413631021e-07, | |
| "loss": 6.2265, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 0.5170387779083431, | |
| "grad_norm": 1.7630133628845215, | |
| "learning_rate": 8.967097532314923e-07, | |
| "loss": 6.0044, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 0.5229142185663925, | |
| "grad_norm": 1.6147162914276123, | |
| "learning_rate": 8.955346650998825e-07, | |
| "loss": 6.1896, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 0.5287896592244419, | |
| "grad_norm": 1.9183772802352905, | |
| "learning_rate": 8.943595769682726e-07, | |
| "loss": 6.0518, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.5287896592244419, | |
| "eval_loss": 1.5241233110427856, | |
| "eval_runtime": 67.5042, | |
| "eval_samples_per_second": 21.243, | |
| "eval_steps_per_second": 2.667, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.5346650998824912, | |
| "grad_norm": 1.999889850616455, | |
| "learning_rate": 8.931844888366628e-07, | |
| "loss": 6.1402, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 0.5405405405405406, | |
| "grad_norm": 1.853894829750061, | |
| "learning_rate": 8.920094007050529e-07, | |
| "loss": 6.1626, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 0.5464159811985899, | |
| "grad_norm": 1.6458221673965454, | |
| "learning_rate": 8.90834312573443e-07, | |
| "loss": 6.0245, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 0.5522914218566393, | |
| "grad_norm": 1.8022114038467407, | |
| "learning_rate": 8.896592244418331e-07, | |
| "loss": 6.0397, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 0.5581668625146886, | |
| "grad_norm": 1.8993277549743652, | |
| "learning_rate": 8.884841363102233e-07, | |
| "loss": 6.2759, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.5581668625146886, | |
| "eval_loss": 1.5192291736602783, | |
| "eval_runtime": 67.5518, | |
| "eval_samples_per_second": 21.228, | |
| "eval_steps_per_second": 2.665, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.564042303172738, | |
| "grad_norm": 1.7591309547424316, | |
| "learning_rate": 8.873090481786134e-07, | |
| "loss": 6.1107, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 0.5699177438307873, | |
| "grad_norm": 1.8564950227737427, | |
| "learning_rate": 8.861339600470035e-07, | |
| "loss": 6.0074, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 0.5757931844888367, | |
| "grad_norm": 1.7324663400650024, | |
| "learning_rate": 8.849588719153937e-07, | |
| "loss": 5.9752, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 0.581668625146886, | |
| "grad_norm": 1.9091726541519165, | |
| "learning_rate": 8.837837837837837e-07, | |
| "loss": 6.0551, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 0.5875440658049353, | |
| "grad_norm": 1.667810082435608, | |
| "learning_rate": 8.826086956521739e-07, | |
| "loss": 6.1355, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.5875440658049353, | |
| "eval_loss": 1.5135389566421509, | |
| "eval_runtime": 67.5223, | |
| "eval_samples_per_second": 21.237, | |
| "eval_steps_per_second": 2.666, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.5934195064629847, | |
| "grad_norm": 2.0499677658081055, | |
| "learning_rate": 8.81433607520564e-07, | |
| "loss": 5.9337, | |
| "step": 1010 | |
| }, | |
| { | |
| "epoch": 0.599294947121034, | |
| "grad_norm": 2.237178087234497, | |
| "learning_rate": 8.802585193889541e-07, | |
| "loss": 6.1225, | |
| "step": 1020 | |
| }, | |
| { | |
| "epoch": 0.6051703877790834, | |
| "grad_norm": 1.904250144958496, | |
| "learning_rate": 8.790834312573443e-07, | |
| "loss": 6.1227, | |
| "step": 1030 | |
| }, | |
| { | |
| "epoch": 0.6110458284371327, | |
| "grad_norm": 1.9532405138015747, | |
| "learning_rate": 8.779083431257344e-07, | |
| "loss": 6.0628, | |
| "step": 1040 | |
| }, | |
| { | |
| "epoch": 0.6169212690951822, | |
| "grad_norm": 1.8243640661239624, | |
| "learning_rate": 8.767332549941245e-07, | |
| "loss": 5.956, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.6169212690951822, | |
| "eval_loss": 1.5078574419021606, | |
| "eval_runtime": 67.6452, | |
| "eval_samples_per_second": 21.199, | |
| "eval_steps_per_second": 2.661, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.6227967097532315, | |
| "grad_norm": 1.8850717544555664, | |
| "learning_rate": 8.755581668625146e-07, | |
| "loss": 6.1356, | |
| "step": 1060 | |
| }, | |
| { | |
| "epoch": 0.6286721504112809, | |
| "grad_norm": 1.7223460674285889, | |
| "learning_rate": 8.743830787309048e-07, | |
| "loss": 5.8176, | |
| "step": 1070 | |
| }, | |
| { | |
| "epoch": 0.6345475910693302, | |
| "grad_norm": 1.873952865600586, | |
| "learning_rate": 8.732079905992949e-07, | |
| "loss": 6.1002, | |
| "step": 1080 | |
| }, | |
| { | |
| "epoch": 0.6404230317273796, | |
| "grad_norm": 1.7804756164550781, | |
| "learning_rate": 8.72032902467685e-07, | |
| "loss": 6.1699, | |
| "step": 1090 | |
| }, | |
| { | |
| "epoch": 0.6462984723854289, | |
| "grad_norm": 1.8307634592056274, | |
| "learning_rate": 8.708578143360752e-07, | |
| "loss": 6.089, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.6462984723854289, | |
| "eval_loss": 1.5017292499542236, | |
| "eval_runtime": 67.5101, | |
| "eval_samples_per_second": 21.241, | |
| "eval_steps_per_second": 2.666, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.6521739130434783, | |
| "grad_norm": 2.105025053024292, | |
| "learning_rate": 8.696827262044652e-07, | |
| "loss": 6.1025, | |
| "step": 1110 | |
| }, | |
| { | |
| "epoch": 0.6580493537015276, | |
| "grad_norm": 1.729182481765747, | |
| "learning_rate": 8.685076380728554e-07, | |
| "loss": 6.004, | |
| "step": 1120 | |
| }, | |
| { | |
| "epoch": 0.663924794359577, | |
| "grad_norm": 2.012986183166504, | |
| "learning_rate": 8.673325499412456e-07, | |
| "loss": 6.1159, | |
| "step": 1130 | |
| }, | |
| { | |
| "epoch": 0.6698002350176263, | |
| "grad_norm": 1.7573076486587524, | |
| "learning_rate": 8.661574618096356e-07, | |
| "loss": 6.075, | |
| "step": 1140 | |
| }, | |
| { | |
| "epoch": 0.6756756756756757, | |
| "grad_norm": 1.7264623641967773, | |
| "learning_rate": 8.649823736780258e-07, | |
| "loss": 5.8563, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.6756756756756757, | |
| "eval_loss": 1.4951844215393066, | |
| "eval_runtime": 67.5809, | |
| "eval_samples_per_second": 21.219, | |
| "eval_steps_per_second": 2.663, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.681551116333725, | |
| "grad_norm": 1.9470430612564087, | |
| "learning_rate": 8.638072855464159e-07, | |
| "loss": 5.8498, | |
| "step": 1160 | |
| }, | |
| { | |
| "epoch": 0.6874265569917744, | |
| "grad_norm": 1.6648173332214355, | |
| "learning_rate": 8.626321974148061e-07, | |
| "loss": 6.0192, | |
| "step": 1170 | |
| }, | |
| { | |
| "epoch": 0.6933019976498237, | |
| "grad_norm": 1.784105896949768, | |
| "learning_rate": 8.614571092831961e-07, | |
| "loss": 6.0703, | |
| "step": 1180 | |
| }, | |
| { | |
| "epoch": 0.699177438307873, | |
| "grad_norm": 1.6299229860305786, | |
| "learning_rate": 8.602820211515863e-07, | |
| "loss": 6.0794, | |
| "step": 1190 | |
| }, | |
| { | |
| "epoch": 0.7050528789659224, | |
| "grad_norm": 1.8894709348678589, | |
| "learning_rate": 8.591069330199765e-07, | |
| "loss": 5.9203, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.7050528789659224, | |
| "eval_loss": 1.4896841049194336, | |
| "eval_runtime": 67.5564, | |
| "eval_samples_per_second": 21.227, | |
| "eval_steps_per_second": 2.664, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.7109283196239718, | |
| "grad_norm": 1.8506622314453125, | |
| "learning_rate": 8.579318448883665e-07, | |
| "loss": 6.1517, | |
| "step": 1210 | |
| }, | |
| { | |
| "epoch": 0.7168037602820212, | |
| "grad_norm": 1.5787792205810547, | |
| "learning_rate": 8.567567567567567e-07, | |
| "loss": 5.932, | |
| "step": 1220 | |
| }, | |
| { | |
| "epoch": 0.7226792009400705, | |
| "grad_norm": 1.9385451078414917, | |
| "learning_rate": 8.555816686251468e-07, | |
| "loss": 6.1204, | |
| "step": 1230 | |
| }, | |
| { | |
| "epoch": 0.7285546415981199, | |
| "grad_norm": 1.789788842201233, | |
| "learning_rate": 8.54406580493537e-07, | |
| "loss": 6.0878, | |
| "step": 1240 | |
| }, | |
| { | |
| "epoch": 0.7344300822561692, | |
| "grad_norm": 1.9521713256835938, | |
| "learning_rate": 8.532314923619272e-07, | |
| "loss": 6.0651, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.7344300822561692, | |
| "eval_loss": 1.4861587285995483, | |
| "eval_runtime": 78.0463, | |
| "eval_samples_per_second": 18.374, | |
| "eval_steps_per_second": 2.306, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.7403055229142186, | |
| "grad_norm": 1.9088025093078613, | |
| "learning_rate": 8.520564042303173e-07, | |
| "loss": 6.0032, | |
| "step": 1260 | |
| }, | |
| { | |
| "epoch": 0.7461809635722679, | |
| "grad_norm": 2.0229740142822266, | |
| "learning_rate": 8.508813160987074e-07, | |
| "loss": 6.1724, | |
| "step": 1270 | |
| }, | |
| { | |
| "epoch": 0.7520564042303173, | |
| "grad_norm": 1.7247604131698608, | |
| "learning_rate": 8.497062279670975e-07, | |
| "loss": 5.9501, | |
| "step": 1280 | |
| }, | |
| { | |
| "epoch": 0.7579318448883666, | |
| "grad_norm": 2.1122665405273438, | |
| "learning_rate": 8.485311398354877e-07, | |
| "loss": 5.8399, | |
| "step": 1290 | |
| }, | |
| { | |
| "epoch": 0.763807285546416, | |
| "grad_norm": 1.9144885540008545, | |
| "learning_rate": 8.473560517038778e-07, | |
| "loss": 6.0293, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.763807285546416, | |
| "eval_loss": 1.4840021133422852, | |
| "eval_runtime": 67.75, | |
| "eval_samples_per_second": 21.166, | |
| "eval_steps_per_second": 2.657, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.7696827262044653, | |
| "grad_norm": 1.7198468446731567, | |
| "learning_rate": 8.461809635722679e-07, | |
| "loss": 6.0714, | |
| "step": 1310 | |
| }, | |
| { | |
| "epoch": 0.7755581668625147, | |
| "grad_norm": 1.7803094387054443, | |
| "learning_rate": 8.450058754406581e-07, | |
| "loss": 5.9993, | |
| "step": 1320 | |
| }, | |
| { | |
| "epoch": 0.781433607520564, | |
| "grad_norm": 1.9184415340423584, | |
| "learning_rate": 8.438307873090481e-07, | |
| "loss": 5.9439, | |
| "step": 1330 | |
| }, | |
| { | |
| "epoch": 0.7873090481786134, | |
| "grad_norm": 1.9405663013458252, | |
| "learning_rate": 8.426556991774383e-07, | |
| "loss": 6.0342, | |
| "step": 1340 | |
| }, | |
| { | |
| "epoch": 0.7931844888366627, | |
| "grad_norm": 1.9659658670425415, | |
| "learning_rate": 8.414806110458284e-07, | |
| "loss": 5.8654, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 0.7931844888366627, | |
| "eval_loss": 1.4824680089950562, | |
| "eval_runtime": 67.5038, | |
| "eval_samples_per_second": 21.243, | |
| "eval_steps_per_second": 2.667, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 0.799059929494712, | |
| "grad_norm": 1.8041818141937256, | |
| "learning_rate": 8.403055229142185e-07, | |
| "loss": 5.8713, | |
| "step": 1360 | |
| }, | |
| { | |
| "epoch": 0.8049353701527615, | |
| "grad_norm": 1.7908101081848145, | |
| "learning_rate": 8.391304347826087e-07, | |
| "loss": 5.904, | |
| "step": 1370 | |
| }, | |
| { | |
| "epoch": 0.8108108108108109, | |
| "grad_norm": 1.6884026527404785, | |
| "learning_rate": 8.379553466509988e-07, | |
| "loss": 6.3144, | |
| "step": 1380 | |
| }, | |
| { | |
| "epoch": 0.8166862514688602, | |
| "grad_norm": 1.9209022521972656, | |
| "learning_rate": 8.367802585193889e-07, | |
| "loss": 6.0199, | |
| "step": 1390 | |
| }, | |
| { | |
| "epoch": 0.8225616921269095, | |
| "grad_norm": 1.7688874006271362, | |
| "learning_rate": 8.35605170387779e-07, | |
| "loss": 5.957, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.8225616921269095, | |
| "eval_loss": 1.4813125133514404, | |
| "eval_runtime": 67.3592, | |
| "eval_samples_per_second": 21.289, | |
| "eval_steps_per_second": 2.672, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.8284371327849589, | |
| "grad_norm": 1.8281030654907227, | |
| "learning_rate": 8.344300822561692e-07, | |
| "loss": 5.7265, | |
| "step": 1410 | |
| }, | |
| { | |
| "epoch": 0.8343125734430082, | |
| "grad_norm": 1.7813804149627686, | |
| "learning_rate": 8.332549941245593e-07, | |
| "loss": 5.9138, | |
| "step": 1420 | |
| }, | |
| { | |
| "epoch": 0.8401880141010576, | |
| "grad_norm": 1.8841749429702759, | |
| "learning_rate": 8.320799059929494e-07, | |
| "loss": 5.93, | |
| "step": 1430 | |
| }, | |
| { | |
| "epoch": 0.8460634547591069, | |
| "grad_norm": 1.8778326511383057, | |
| "learning_rate": 8.309048178613396e-07, | |
| "loss": 6.0624, | |
| "step": 1440 | |
| }, | |
| { | |
| "epoch": 0.8519388954171563, | |
| "grad_norm": 1.534106969833374, | |
| "learning_rate": 8.297297297297296e-07, | |
| "loss": 5.9173, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 0.8519388954171563, | |
| "eval_loss": 1.4806052446365356, | |
| "eval_runtime": 67.443, | |
| "eval_samples_per_second": 21.262, | |
| "eval_steps_per_second": 2.669, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 0.8578143360752056, | |
| "grad_norm": 1.958788514137268, | |
| "learning_rate": 8.285546415981198e-07, | |
| "loss": 5.9058, | |
| "step": 1460 | |
| }, | |
| { | |
| "epoch": 0.863689776733255, | |
| "grad_norm": 1.6875348091125488, | |
| "learning_rate": 8.2737955346651e-07, | |
| "loss": 6.071, | |
| "step": 1470 | |
| }, | |
| { | |
| "epoch": 0.8695652173913043, | |
| "grad_norm": 1.887682318687439, | |
| "learning_rate": 8.262044653349001e-07, | |
| "loss": 5.9213, | |
| "step": 1480 | |
| }, | |
| { | |
| "epoch": 0.8754406580493537, | |
| "grad_norm": 1.945660948753357, | |
| "learning_rate": 8.250293772032902e-07, | |
| "loss": 5.9722, | |
| "step": 1490 | |
| }, | |
| { | |
| "epoch": 0.881316098707403, | |
| "grad_norm": 1.9587616920471191, | |
| "learning_rate": 8.238542890716803e-07, | |
| "loss": 5.9644, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.881316098707403, | |
| "eval_loss": 1.4798330068588257, | |
| "eval_runtime": 69.9429, | |
| "eval_samples_per_second": 20.502, | |
| "eval_steps_per_second": 2.574, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.8871915393654524, | |
| "grad_norm": 2.033848762512207, | |
| "learning_rate": 8.226792009400705e-07, | |
| "loss": 5.9035, | |
| "step": 1510 | |
| }, | |
| { | |
| "epoch": 0.8930669800235017, | |
| "grad_norm": 2.0481224060058594, | |
| "learning_rate": 8.215041128084605e-07, | |
| "loss": 5.9669, | |
| "step": 1520 | |
| }, | |
| { | |
| "epoch": 0.8989424206815512, | |
| "grad_norm": 1.684850811958313, | |
| "learning_rate": 8.203290246768507e-07, | |
| "loss": 5.7496, | |
| "step": 1530 | |
| }, | |
| { | |
| "epoch": 0.9048178613396005, | |
| "grad_norm": 1.7894434928894043, | |
| "learning_rate": 8.191539365452409e-07, | |
| "loss": 6.0756, | |
| "step": 1540 | |
| }, | |
| { | |
| "epoch": 0.9106933019976499, | |
| "grad_norm": 1.8205320835113525, | |
| "learning_rate": 8.179788484136309e-07, | |
| "loss": 6.1865, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 0.9106933019976499, | |
| "eval_loss": 1.4793447256088257, | |
| "eval_runtime": 67.3984, | |
| "eval_samples_per_second": 21.276, | |
| "eval_steps_per_second": 2.671, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 0.9165687426556992, | |
| "grad_norm": 2.025639057159424, | |
| "learning_rate": 8.168037602820211e-07, | |
| "loss": 6.1506, | |
| "step": 1560 | |
| }, | |
| { | |
| "epoch": 0.9224441833137486, | |
| "grad_norm": 1.745783805847168, | |
| "learning_rate": 8.156286721504112e-07, | |
| "loss": 6.0317, | |
| "step": 1570 | |
| }, | |
| { | |
| "epoch": 0.9283196239717979, | |
| "grad_norm": 1.8073749542236328, | |
| "learning_rate": 8.144535840188013e-07, | |
| "loss": 6.0357, | |
| "step": 1580 | |
| }, | |
| { | |
| "epoch": 0.9341950646298472, | |
| "grad_norm": 1.9718337059020996, | |
| "learning_rate": 8.132784958871916e-07, | |
| "loss": 5.9024, | |
| "step": 1590 | |
| }, | |
| { | |
| "epoch": 0.9400705052878966, | |
| "grad_norm": 1.7604055404663086, | |
| "learning_rate": 8.121034077555817e-07, | |
| "loss": 5.8952, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 0.9400705052878966, | |
| "eval_loss": 1.4788146018981934, | |
| "eval_runtime": 67.3877, | |
| "eval_samples_per_second": 21.28, | |
| "eval_steps_per_second": 2.671, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 0.9459459459459459, | |
| "grad_norm": 1.9103364944458008, | |
| "learning_rate": 8.109283196239718e-07, | |
| "loss": 5.9051, | |
| "step": 1610 | |
| }, | |
| { | |
| "epoch": 0.9518213866039953, | |
| "grad_norm": 1.6583188772201538, | |
| "learning_rate": 8.097532314923619e-07, | |
| "loss": 5.864, | |
| "step": 1620 | |
| }, | |
| { | |
| "epoch": 0.9576968272620446, | |
| "grad_norm": 1.8631893396377563, | |
| "learning_rate": 8.085781433607521e-07, | |
| "loss": 5.8381, | |
| "step": 1630 | |
| }, | |
| { | |
| "epoch": 0.963572267920094, | |
| "grad_norm": 1.9318718910217285, | |
| "learning_rate": 8.074030552291421e-07, | |
| "loss": 5.941, | |
| "step": 1640 | |
| }, | |
| { | |
| "epoch": 0.9694477085781433, | |
| "grad_norm": 1.7922627925872803, | |
| "learning_rate": 8.062279670975323e-07, | |
| "loss": 5.9733, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 0.9694477085781433, | |
| "eval_loss": 1.4783855676651, | |
| "eval_runtime": 67.5032, | |
| "eval_samples_per_second": 21.243, | |
| "eval_steps_per_second": 2.667, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 0.9753231492361927, | |
| "grad_norm": 1.6979329586029053, | |
| "learning_rate": 8.050528789659225e-07, | |
| "loss": 6.077, | |
| "step": 1660 | |
| }, | |
| { | |
| "epoch": 0.981198589894242, | |
| "grad_norm": 1.6366304159164429, | |
| "learning_rate": 8.038777908343125e-07, | |
| "loss": 5.804, | |
| "step": 1670 | |
| }, | |
| { | |
| "epoch": 0.9870740305522914, | |
| "grad_norm": 1.5034892559051514, | |
| "learning_rate": 8.027027027027027e-07, | |
| "loss": 5.7737, | |
| "step": 1680 | |
| }, | |
| { | |
| "epoch": 0.9929494712103408, | |
| "grad_norm": 1.487920880317688, | |
| "learning_rate": 8.015276145710928e-07, | |
| "loss": 5.879, | |
| "step": 1690 | |
| }, | |
| { | |
| "epoch": 0.9988249118683902, | |
| "grad_norm": 1.7758818864822388, | |
| "learning_rate": 8.003525264394829e-07, | |
| "loss": 6.015, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 0.9988249118683902, | |
| "eval_loss": 1.477812647819519, | |
| "eval_runtime": 67.3925, | |
| "eval_samples_per_second": 21.278, | |
| "eval_steps_per_second": 2.671, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 1.0047003525264395, | |
| "grad_norm": 1.8898565769195557, | |
| "learning_rate": 7.991774383078731e-07, | |
| "loss": 5.8394, | |
| "step": 1710 | |
| }, | |
| { | |
| "epoch": 1.0105757931844888, | |
| "grad_norm": 1.7957675457000732, | |
| "learning_rate": 7.980023501762632e-07, | |
| "loss": 5.9171, | |
| "step": 1720 | |
| }, | |
| { | |
| "epoch": 1.0164512338425382, | |
| "grad_norm": 1.4734153747558594, | |
| "learning_rate": 7.968272620446533e-07, | |
| "loss": 5.7544, | |
| "step": 1730 | |
| }, | |
| { | |
| "epoch": 1.0223266745005875, | |
| "grad_norm": 1.8453232049942017, | |
| "learning_rate": 7.956521739130434e-07, | |
| "loss": 5.7172, | |
| "step": 1740 | |
| }, | |
| { | |
| "epoch": 1.028202115158637, | |
| "grad_norm": 1.6651732921600342, | |
| "learning_rate": 7.944770857814336e-07, | |
| "loss": 5.7981, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 1.028202115158637, | |
| "eval_loss": 1.4773787260055542, | |
| "eval_runtime": 67.4079, | |
| "eval_samples_per_second": 21.273, | |
| "eval_steps_per_second": 2.67, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 1.0340775558166861, | |
| "grad_norm": 1.9795799255371094, | |
| "learning_rate": 7.933019976498237e-07, | |
| "loss": 5.7833, | |
| "step": 1760 | |
| }, | |
| { | |
| "epoch": 1.0399529964747356, | |
| "grad_norm": 2.128406286239624, | |
| "learning_rate": 7.921269095182138e-07, | |
| "loss": 6.1611, | |
| "step": 1770 | |
| }, | |
| { | |
| "epoch": 1.045828437132785, | |
| "grad_norm": 1.7242544889450073, | |
| "learning_rate": 7.90951821386604e-07, | |
| "loss": 5.8551, | |
| "step": 1780 | |
| }, | |
| { | |
| "epoch": 1.0517038777908343, | |
| "grad_norm": 1.89352285861969, | |
| "learning_rate": 7.89776733254994e-07, | |
| "loss": 5.9303, | |
| "step": 1790 | |
| }, | |
| { | |
| "epoch": 1.0575793184488838, | |
| "grad_norm": 1.7971441745758057, | |
| "learning_rate": 7.886016451233842e-07, | |
| "loss": 5.9246, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 1.0575793184488838, | |
| "eval_loss": 1.476963996887207, | |
| "eval_runtime": 67.356, | |
| "eval_samples_per_second": 21.29, | |
| "eval_steps_per_second": 2.672, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 1.063454759106933, | |
| "grad_norm": 1.8786916732788086, | |
| "learning_rate": 7.874265569917743e-07, | |
| "loss": 5.7856, | |
| "step": 1810 | |
| }, | |
| { | |
| "epoch": 1.0693301997649824, | |
| "grad_norm": 1.9047880172729492, | |
| "learning_rate": 7.862514688601645e-07, | |
| "loss": 6.0362, | |
| "step": 1820 | |
| }, | |
| { | |
| "epoch": 1.0752056404230317, | |
| "grad_norm": 1.9103033542633057, | |
| "learning_rate": 7.850763807285546e-07, | |
| "loss": 5.8908, | |
| "step": 1830 | |
| }, | |
| { | |
| "epoch": 1.0810810810810811, | |
| "grad_norm": 2.0070149898529053, | |
| "learning_rate": 7.839012925969447e-07, | |
| "loss": 5.982, | |
| "step": 1840 | |
| }, | |
| { | |
| "epoch": 1.0869565217391304, | |
| "grad_norm": 1.5143649578094482, | |
| "learning_rate": 7.827262044653349e-07, | |
| "loss": 5.8349, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 1.0869565217391304, | |
| "eval_loss": 1.4763119220733643, | |
| "eval_runtime": 67.3329, | |
| "eval_samples_per_second": 21.297, | |
| "eval_steps_per_second": 2.673, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 1.0928319623971798, | |
| "grad_norm": 1.6700143814086914, | |
| "learning_rate": 7.815511163337249e-07, | |
| "loss": 6.0503, | |
| "step": 1860 | |
| }, | |
| { | |
| "epoch": 1.098707403055229, | |
| "grad_norm": 1.734837532043457, | |
| "learning_rate": 7.803760282021151e-07, | |
| "loss": 5.9907, | |
| "step": 1870 | |
| }, | |
| { | |
| "epoch": 1.1045828437132785, | |
| "grad_norm": 1.778960943222046, | |
| "learning_rate": 7.792009400705053e-07, | |
| "loss": 5.6846, | |
| "step": 1880 | |
| }, | |
| { | |
| "epoch": 1.1104582843713278, | |
| "grad_norm": 2.055248498916626, | |
| "learning_rate": 7.780258519388953e-07, | |
| "loss": 6.0658, | |
| "step": 1890 | |
| }, | |
| { | |
| "epoch": 1.1163337250293772, | |
| "grad_norm": 2.000680923461914, | |
| "learning_rate": 7.768507638072855e-07, | |
| "loss": 5.9983, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 1.1163337250293772, | |
| "eval_loss": 1.4759562015533447, | |
| "eval_runtime": 67.4275, | |
| "eval_samples_per_second": 21.267, | |
| "eval_steps_per_second": 2.67, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 1.1222091656874265, | |
| "grad_norm": 1.8254281282424927, | |
| "learning_rate": 7.756756756756756e-07, | |
| "loss": 5.9185, | |
| "step": 1910 | |
| }, | |
| { | |
| "epoch": 1.128084606345476, | |
| "grad_norm": 1.8100814819335938, | |
| "learning_rate": 7.745005875440657e-07, | |
| "loss": 5.9912, | |
| "step": 1920 | |
| }, | |
| { | |
| "epoch": 1.1339600470035252, | |
| "grad_norm": 1.7456374168395996, | |
| "learning_rate": 7.73325499412456e-07, | |
| "loss": 5.8861, | |
| "step": 1930 | |
| }, | |
| { | |
| "epoch": 1.1398354876615746, | |
| "grad_norm": 1.508423089981079, | |
| "learning_rate": 7.721504112808461e-07, | |
| "loss": 5.7021, | |
| "step": 1940 | |
| }, | |
| { | |
| "epoch": 1.145710928319624, | |
| "grad_norm": 2.055159330368042, | |
| "learning_rate": 7.709753231492362e-07, | |
| "loss": 6.0077, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 1.145710928319624, | |
| "eval_loss": 1.4756381511688232, | |
| "eval_runtime": 67.3529, | |
| "eval_samples_per_second": 21.291, | |
| "eval_steps_per_second": 2.672, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 1.1515863689776733, | |
| "grad_norm": 1.5550910234451294, | |
| "learning_rate": 7.698002350176263e-07, | |
| "loss": 6.0144, | |
| "step": 1960 | |
| }, | |
| { | |
| "epoch": 1.1574618096357228, | |
| "grad_norm": 1.627854585647583, | |
| "learning_rate": 7.686251468860165e-07, | |
| "loss": 5.9242, | |
| "step": 1970 | |
| }, | |
| { | |
| "epoch": 1.163337250293772, | |
| "grad_norm": 1.8871314525604248, | |
| "learning_rate": 7.674500587544065e-07, | |
| "loss": 5.8759, | |
| "step": 1980 | |
| }, | |
| { | |
| "epoch": 1.1692126909518215, | |
| "grad_norm": 1.6970958709716797, | |
| "learning_rate": 7.662749706227967e-07, | |
| "loss": 5.7471, | |
| "step": 1990 | |
| }, | |
| { | |
| "epoch": 1.1750881316098707, | |
| "grad_norm": 2.148339033126831, | |
| "learning_rate": 7.650998824911869e-07, | |
| "loss": 5.932, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 1.1750881316098707, | |
| "eval_loss": 1.4752864837646484, | |
| "eval_runtime": 67.3674, | |
| "eval_samples_per_second": 21.286, | |
| "eval_steps_per_second": 2.672, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 1.1809635722679201, | |
| "grad_norm": 1.8196816444396973, | |
| "learning_rate": 7.639247943595769e-07, | |
| "loss": 5.8354, | |
| "step": 2010 | |
| }, | |
| { | |
| "epoch": 1.1868390129259694, | |
| "grad_norm": 1.5692166090011597, | |
| "learning_rate": 7.627497062279671e-07, | |
| "loss": 6.0992, | |
| "step": 2020 | |
| }, | |
| { | |
| "epoch": 1.1927144535840188, | |
| "grad_norm": 1.7445123195648193, | |
| "learning_rate": 7.615746180963572e-07, | |
| "loss": 5.8826, | |
| "step": 2030 | |
| }, | |
| { | |
| "epoch": 1.198589894242068, | |
| "grad_norm": 1.774656891822815, | |
| "learning_rate": 7.603995299647473e-07, | |
| "loss": 5.7213, | |
| "step": 2040 | |
| }, | |
| { | |
| "epoch": 1.2044653349001175, | |
| "grad_norm": 1.7705199718475342, | |
| "learning_rate": 7.592244418331375e-07, | |
| "loss": 6.0987, | |
| "step": 2050 | |
| }, | |
| { | |
| "epoch": 1.2044653349001175, | |
| "eval_loss": 1.474990725517273, | |
| "eval_runtime": 67.3591, | |
| "eval_samples_per_second": 21.289, | |
| "eval_steps_per_second": 2.672, | |
| "step": 2050 | |
| }, | |
| { | |
| "epoch": 1.2103407755581668, | |
| "grad_norm": 1.7765486240386963, | |
| "learning_rate": 7.580493537015276e-07, | |
| "loss": 5.9866, | |
| "step": 2060 | |
| }, | |
| { | |
| "epoch": 1.2162162162162162, | |
| "grad_norm": 1.877685785293579, | |
| "learning_rate": 7.568742655699177e-07, | |
| "loss": 5.9616, | |
| "step": 2070 | |
| }, | |
| { | |
| "epoch": 1.2220916568742655, | |
| "grad_norm": 1.8580436706542969, | |
| "learning_rate": 7.556991774383078e-07, | |
| "loss": 5.9441, | |
| "step": 2080 | |
| }, | |
| { | |
| "epoch": 1.227967097532315, | |
| "grad_norm": 1.7666056156158447, | |
| "learning_rate": 7.54524089306698e-07, | |
| "loss": 5.8912, | |
| "step": 2090 | |
| }, | |
| { | |
| "epoch": 1.2338425381903644, | |
| "grad_norm": 1.9045265913009644, | |
| "learning_rate": 7.533490011750881e-07, | |
| "loss": 5.7918, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 1.2338425381903644, | |
| "eval_loss": 1.4744936227798462, | |
| "eval_runtime": 67.3793, | |
| "eval_samples_per_second": 21.283, | |
| "eval_steps_per_second": 2.671, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 1.2397179788484136, | |
| "grad_norm": 1.8948485851287842, | |
| "learning_rate": 7.521739130434782e-07, | |
| "loss": 6.0362, | |
| "step": 2110 | |
| }, | |
| { | |
| "epoch": 1.245593419506463, | |
| "grad_norm": 1.8872965574264526, | |
| "learning_rate": 7.509988249118684e-07, | |
| "loss": 5.8342, | |
| "step": 2120 | |
| }, | |
| { | |
| "epoch": 1.2514688601645123, | |
| "grad_norm": 1.5916881561279297, | |
| "learning_rate": 7.498237367802584e-07, | |
| "loss": 5.8995, | |
| "step": 2130 | |
| }, | |
| { | |
| "epoch": 1.2573443008225618, | |
| "grad_norm": 1.6878283023834229, | |
| "learning_rate": 7.486486486486486e-07, | |
| "loss": 5.79, | |
| "step": 2140 | |
| }, | |
| { | |
| "epoch": 1.263219741480611, | |
| "grad_norm": 1.6764466762542725, | |
| "learning_rate": 7.474735605170387e-07, | |
| "loss": 5.9001, | |
| "step": 2150 | |
| }, | |
| { | |
| "epoch": 1.263219741480611, | |
| "eval_loss": 1.4742045402526855, | |
| "eval_runtime": 67.3898, | |
| "eval_samples_per_second": 21.279, | |
| "eval_steps_per_second": 2.671, | |
| "step": 2150 | |
| }, | |
| { | |
| "epoch": 1.2690951821386605, | |
| "grad_norm": 1.6931419372558594, | |
| "learning_rate": 7.462984723854289e-07, | |
| "loss": 6.0569, | |
| "step": 2160 | |
| }, | |
| { | |
| "epoch": 1.2749706227967097, | |
| "grad_norm": 1.604083776473999, | |
| "learning_rate": 7.45123384253819e-07, | |
| "loss": 6.0979, | |
| "step": 2170 | |
| }, | |
| { | |
| "epoch": 1.2808460634547592, | |
| "grad_norm": 1.7342679500579834, | |
| "learning_rate": 7.439482961222091e-07, | |
| "loss": 5.771, | |
| "step": 2180 | |
| }, | |
| { | |
| "epoch": 1.2867215041128084, | |
| "grad_norm": 1.5740374326705933, | |
| "learning_rate": 7.427732079905993e-07, | |
| "loss": 6.0591, | |
| "step": 2190 | |
| }, | |
| { | |
| "epoch": 1.2925969447708578, | |
| "grad_norm": 1.7753512859344482, | |
| "learning_rate": 7.415981198589893e-07, | |
| "loss": 5.839, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 1.2925969447708578, | |
| "eval_loss": 1.473833680152893, | |
| "eval_runtime": 67.3634, | |
| "eval_samples_per_second": 21.288, | |
| "eval_steps_per_second": 2.672, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 1.2984723854289073, | |
| "grad_norm": 1.9094125032424927, | |
| "learning_rate": 7.404230317273795e-07, | |
| "loss": 5.9792, | |
| "step": 2210 | |
| }, | |
| { | |
| "epoch": 1.3043478260869565, | |
| "grad_norm": 1.6728532314300537, | |
| "learning_rate": 7.392479435957697e-07, | |
| "loss": 5.9578, | |
| "step": 2220 | |
| }, | |
| { | |
| "epoch": 1.3102232667450058, | |
| "grad_norm": 1.6236289739608765, | |
| "learning_rate": 7.380728554641597e-07, | |
| "loss": 5.742, | |
| "step": 2230 | |
| }, | |
| { | |
| "epoch": 1.3160987074030552, | |
| "grad_norm": 1.7581902742385864, | |
| "learning_rate": 7.368977673325499e-07, | |
| "loss": 6.0485, | |
| "step": 2240 | |
| }, | |
| { | |
| "epoch": 1.3219741480611047, | |
| "grad_norm": 1.5793126821517944, | |
| "learning_rate": 7.3572267920094e-07, | |
| "loss": 5.8889, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 1.3219741480611047, | |
| "eval_loss": 1.4734312295913696, | |
| "eval_runtime": 67.3603, | |
| "eval_samples_per_second": 21.288, | |
| "eval_steps_per_second": 2.672, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 1.327849588719154, | |
| "grad_norm": 1.8450642824172974, | |
| "learning_rate": 7.345475910693301e-07, | |
| "loss": 5.8915, | |
| "step": 2260 | |
| }, | |
| { | |
| "epoch": 1.3337250293772032, | |
| "grad_norm": 1.5437251329421997, | |
| "learning_rate": 7.333725029377203e-07, | |
| "loss": 6.0109, | |
| "step": 2270 | |
| }, | |
| { | |
| "epoch": 1.3396004700352526, | |
| "grad_norm": 1.9785826206207275, | |
| "learning_rate": 7.321974148061105e-07, | |
| "loss": 6.0857, | |
| "step": 2280 | |
| }, | |
| { | |
| "epoch": 1.345475910693302, | |
| "grad_norm": 1.6962827444076538, | |
| "learning_rate": 7.310223266745006e-07, | |
| "loss": 6.0538, | |
| "step": 2290 | |
| }, | |
| { | |
| "epoch": 1.3513513513513513, | |
| "grad_norm": 1.6559593677520752, | |
| "learning_rate": 7.298472385428907e-07, | |
| "loss": 5.8229, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 1.3513513513513513, | |
| "eval_loss": 1.473131537437439, | |
| "eval_runtime": 67.3467, | |
| "eval_samples_per_second": 21.293, | |
| "eval_steps_per_second": 2.673, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 1.3572267920094008, | |
| "grad_norm": 1.7718429565429688, | |
| "learning_rate": 7.286721504112809e-07, | |
| "loss": 5.7397, | |
| "step": 2310 | |
| }, | |
| { | |
| "epoch": 1.36310223266745, | |
| "grad_norm": 2.0191490650177, | |
| "learning_rate": 7.274970622796709e-07, | |
| "loss": 5.8808, | |
| "step": 2320 | |
| }, | |
| { | |
| "epoch": 1.3689776733254995, | |
| "grad_norm": 1.874172329902649, | |
| "learning_rate": 7.263219741480611e-07, | |
| "loss": 5.8991, | |
| "step": 2330 | |
| }, | |
| { | |
| "epoch": 1.3748531139835487, | |
| "grad_norm": 2.0867104530334473, | |
| "learning_rate": 7.251468860164513e-07, | |
| "loss": 6.058, | |
| "step": 2340 | |
| }, | |
| { | |
| "epoch": 1.3807285546415982, | |
| "grad_norm": 1.8972036838531494, | |
| "learning_rate": 7.239717978848413e-07, | |
| "loss": 5.9622, | |
| "step": 2350 | |
| }, | |
| { | |
| "epoch": 1.3807285546415982, | |
| "eval_loss": 1.4728530645370483, | |
| "eval_runtime": 67.4, | |
| "eval_samples_per_second": 21.276, | |
| "eval_steps_per_second": 2.671, | |
| "step": 2350 | |
| }, | |
| { | |
| "epoch": 1.3866039952996474, | |
| "grad_norm": 1.6675537824630737, | |
| "learning_rate": 7.227967097532315e-07, | |
| "loss": 5.7922, | |
| "step": 2360 | |
| }, | |
| { | |
| "epoch": 1.3924794359576969, | |
| "grad_norm": 1.9455453157424927, | |
| "learning_rate": 7.216216216216216e-07, | |
| "loss": 5.7635, | |
| "step": 2370 | |
| }, | |
| { | |
| "epoch": 1.398354876615746, | |
| "grad_norm": 1.9944945573806763, | |
| "learning_rate": 7.204465334900117e-07, | |
| "loss": 5.9451, | |
| "step": 2380 | |
| }, | |
| { | |
| "epoch": 1.4042303172737955, | |
| "grad_norm": 1.7845548391342163, | |
| "learning_rate": 7.192714453584019e-07, | |
| "loss": 5.8706, | |
| "step": 2390 | |
| }, | |
| { | |
| "epoch": 1.410105757931845, | |
| "grad_norm": 1.5239243507385254, | |
| "learning_rate": 7.18096357226792e-07, | |
| "loss": 5.6772, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 1.410105757931845, | |
| "eval_loss": 1.472511887550354, | |
| "eval_runtime": 67.3938, | |
| "eval_samples_per_second": 21.278, | |
| "eval_steps_per_second": 2.671, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 1.4159811985898942, | |
| "grad_norm": 1.8625153303146362, | |
| "learning_rate": 7.169212690951821e-07, | |
| "loss": 5.971, | |
| "step": 2410 | |
| }, | |
| { | |
| "epoch": 1.4218566392479435, | |
| "grad_norm": 1.6709333658218384, | |
| "learning_rate": 7.157461809635722e-07, | |
| "loss": 5.768, | |
| "step": 2420 | |
| }, | |
| { | |
| "epoch": 1.427732079905993, | |
| "grad_norm": 1.7736382484436035, | |
| "learning_rate": 7.145710928319624e-07, | |
| "loss": 5.9641, | |
| "step": 2430 | |
| }, | |
| { | |
| "epoch": 1.4336075205640424, | |
| "grad_norm": 1.7415990829467773, | |
| "learning_rate": 7.133960047003526e-07, | |
| "loss": 5.8895, | |
| "step": 2440 | |
| }, | |
| { | |
| "epoch": 1.4394829612220916, | |
| "grad_norm": 1.5600135326385498, | |
| "learning_rate": 7.122209165687426e-07, | |
| "loss": 5.8265, | |
| "step": 2450 | |
| }, | |
| { | |
| "epoch": 1.4394829612220916, | |
| "eval_loss": 1.4722115993499756, | |
| "eval_runtime": 67.4064, | |
| "eval_samples_per_second": 21.274, | |
| "eval_steps_per_second": 2.67, | |
| "step": 2450 | |
| }, | |
| { | |
| "epoch": 1.445358401880141, | |
| "grad_norm": 1.6844279766082764, | |
| "learning_rate": 7.110458284371328e-07, | |
| "loss": 5.9639, | |
| "step": 2460 | |
| }, | |
| { | |
| "epoch": 1.4512338425381903, | |
| "grad_norm": 2.118544816970825, | |
| "learning_rate": 7.098707403055229e-07, | |
| "loss": 5.8694, | |
| "step": 2470 | |
| }, | |
| { | |
| "epoch": 1.4571092831962398, | |
| "grad_norm": 2.1383907794952393, | |
| "learning_rate": 7.08695652173913e-07, | |
| "loss": 6.1653, | |
| "step": 2480 | |
| }, | |
| { | |
| "epoch": 1.462984723854289, | |
| "grad_norm": 1.7942463159561157, | |
| "learning_rate": 7.075205640423031e-07, | |
| "loss": 5.9392, | |
| "step": 2490 | |
| }, | |
| { | |
| "epoch": 1.4688601645123385, | |
| "grad_norm": 1.9785916805267334, | |
| "learning_rate": 7.063454759106933e-07, | |
| "loss": 5.8598, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 1.4688601645123385, | |
| "eval_loss": 1.4719326496124268, | |
| "eval_runtime": 70.2328, | |
| "eval_samples_per_second": 20.418, | |
| "eval_steps_per_second": 2.563, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 1.4747356051703877, | |
| "grad_norm": 1.9141045808792114, | |
| "learning_rate": 7.051703877790834e-07, | |
| "loss": 5.8666, | |
| "step": 2510 | |
| }, | |
| { | |
| "epoch": 1.4806110458284372, | |
| "grad_norm": 1.8248971700668335, | |
| "learning_rate": 7.039952996474735e-07, | |
| "loss": 5.899, | |
| "step": 2520 | |
| }, | |
| { | |
| "epoch": 1.4864864864864864, | |
| "grad_norm": 1.5081406831741333, | |
| "learning_rate": 7.028202115158637e-07, | |
| "loss": 5.913, | |
| "step": 2530 | |
| }, | |
| { | |
| "epoch": 1.4923619271445359, | |
| "grad_norm": 1.5788573026657104, | |
| "learning_rate": 7.016451233842537e-07, | |
| "loss": 5.9105, | |
| "step": 2540 | |
| }, | |
| { | |
| "epoch": 1.4982373678025853, | |
| "grad_norm": 1.781790018081665, | |
| "learning_rate": 7.004700352526439e-07, | |
| "loss": 5.8894, | |
| "step": 2550 | |
| }, | |
| { | |
| "epoch": 1.4982373678025853, | |
| "eval_loss": 1.4717662334442139, | |
| "eval_runtime": 67.4015, | |
| "eval_samples_per_second": 21.275, | |
| "eval_steps_per_second": 2.671, | |
| "step": 2550 | |
| }, | |
| { | |
| "epoch": 1.5041128084606346, | |
| "grad_norm": 1.9443302154541016, | |
| "learning_rate": 6.992949471210341e-07, | |
| "loss": 5.9698, | |
| "step": 2560 | |
| }, | |
| { | |
| "epoch": 1.5099882491186838, | |
| "grad_norm": 1.4953645467758179, | |
| "learning_rate": 6.981198589894241e-07, | |
| "loss": 5.9081, | |
| "step": 2570 | |
| }, | |
| { | |
| "epoch": 1.5158636897767332, | |
| "grad_norm": 1.9432063102722168, | |
| "learning_rate": 6.969447708578143e-07, | |
| "loss": 5.7949, | |
| "step": 2580 | |
| }, | |
| { | |
| "epoch": 1.5217391304347827, | |
| "grad_norm": 2.1520416736602783, | |
| "learning_rate": 6.957696827262044e-07, | |
| "loss": 5.9385, | |
| "step": 2590 | |
| }, | |
| { | |
| "epoch": 1.527614571092832, | |
| "grad_norm": 1.7321327924728394, | |
| "learning_rate": 6.945945945945945e-07, | |
| "loss": 5.9739, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 1.527614571092832, | |
| "eval_loss": 1.4715373516082764, | |
| "eval_runtime": 67.3781, | |
| "eval_samples_per_second": 21.283, | |
| "eval_steps_per_second": 2.671, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 1.5334900117508812, | |
| "grad_norm": 1.9069325923919678, | |
| "learning_rate": 6.934195064629846e-07, | |
| "loss": 6.1236, | |
| "step": 2610 | |
| }, | |
| { | |
| "epoch": 1.5393654524089306, | |
| "grad_norm": 1.6319619417190552, | |
| "learning_rate": 6.922444183313748e-07, | |
| "loss": 5.8563, | |
| "step": 2620 | |
| }, | |
| { | |
| "epoch": 1.54524089306698, | |
| "grad_norm": 1.8981560468673706, | |
| "learning_rate": 6.91069330199765e-07, | |
| "loss": 5.8279, | |
| "step": 2630 | |
| }, | |
| { | |
| "epoch": 1.5511163337250293, | |
| "grad_norm": 1.9158369302749634, | |
| "learning_rate": 6.89894242068155e-07, | |
| "loss": 5.9491, | |
| "step": 2640 | |
| }, | |
| { | |
| "epoch": 1.5569917743830788, | |
| "grad_norm": 1.7800869941711426, | |
| "learning_rate": 6.887191539365453e-07, | |
| "loss": 5.9947, | |
| "step": 2650 | |
| }, | |
| { | |
| "epoch": 1.5569917743830788, | |
| "eval_loss": 1.4711698293685913, | |
| "eval_runtime": 67.3987, | |
| "eval_samples_per_second": 21.276, | |
| "eval_steps_per_second": 2.671, | |
| "step": 2650 | |
| }, | |
| { | |
| "epoch": 1.5628672150411282, | |
| "grad_norm": 1.9000372886657715, | |
| "learning_rate": 6.875440658049353e-07, | |
| "loss": 6.0369, | |
| "step": 2660 | |
| }, | |
| { | |
| "epoch": 1.5687426556991775, | |
| "grad_norm": 1.7624439001083374, | |
| "learning_rate": 6.863689776733255e-07, | |
| "loss": 6.0012, | |
| "step": 2670 | |
| }, | |
| { | |
| "epoch": 1.5746180963572267, | |
| "grad_norm": 1.9102165699005127, | |
| "learning_rate": 6.851938895417157e-07, | |
| "loss": 6.0187, | |
| "step": 2680 | |
| }, | |
| { | |
| "epoch": 1.5804935370152762, | |
| "grad_norm": 1.7985962629318237, | |
| "learning_rate": 6.840188014101057e-07, | |
| "loss": 5.8977, | |
| "step": 2690 | |
| }, | |
| { | |
| "epoch": 1.5863689776733256, | |
| "grad_norm": 1.7566959857940674, | |
| "learning_rate": 6.828437132784959e-07, | |
| "loss": 5.9648, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 1.5863689776733256, | |
| "eval_loss": 1.4709213972091675, | |
| "eval_runtime": 67.4381, | |
| "eval_samples_per_second": 21.264, | |
| "eval_steps_per_second": 2.669, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 1.5922444183313749, | |
| "grad_norm": 1.8974095582962036, | |
| "learning_rate": 6.81668625146886e-07, | |
| "loss": 5.8202, | |
| "step": 2710 | |
| }, | |
| { | |
| "epoch": 1.598119858989424, | |
| "grad_norm": 1.6938475370407104, | |
| "learning_rate": 6.804935370152761e-07, | |
| "loss": 5.8596, | |
| "step": 2720 | |
| }, | |
| { | |
| "epoch": 1.6039952996474736, | |
| "grad_norm": 1.7465293407440186, | |
| "learning_rate": 6.793184488836663e-07, | |
| "loss": 5.8589, | |
| "step": 2730 | |
| }, | |
| { | |
| "epoch": 1.609870740305523, | |
| "grad_norm": 2.00980806350708, | |
| "learning_rate": 6.781433607520564e-07, | |
| "loss": 5.7711, | |
| "step": 2740 | |
| }, | |
| { | |
| "epoch": 1.6157461809635723, | |
| "grad_norm": 1.6437867879867554, | |
| "learning_rate": 6.769682726204465e-07, | |
| "loss": 5.909, | |
| "step": 2750 | |
| }, | |
| { | |
| "epoch": 1.6157461809635723, | |
| "eval_loss": 1.4707252979278564, | |
| "eval_runtime": 67.4451, | |
| "eval_samples_per_second": 21.262, | |
| "eval_steps_per_second": 2.669, | |
| "step": 2750 | |
| }, | |
| { | |
| "epoch": 1.6216216216216215, | |
| "grad_norm": 1.5175350904464722, | |
| "learning_rate": 6.757931844888366e-07, | |
| "loss": 5.9722, | |
| "step": 2760 | |
| }, | |
| { | |
| "epoch": 1.627497062279671, | |
| "grad_norm": 2.1253652572631836, | |
| "learning_rate": 6.746180963572268e-07, | |
| "loss": 5.9066, | |
| "step": 2770 | |
| }, | |
| { | |
| "epoch": 1.6333725029377204, | |
| "grad_norm": 2.046537160873413, | |
| "learning_rate": 6.734430082256168e-07, | |
| "loss": 5.8499, | |
| "step": 2780 | |
| }, | |
| { | |
| "epoch": 1.6392479435957696, | |
| "grad_norm": 1.9087352752685547, | |
| "learning_rate": 6.72267920094007e-07, | |
| "loss": 5.8846, | |
| "step": 2790 | |
| }, | |
| { | |
| "epoch": 1.6451233842538189, | |
| "grad_norm": 1.858866572380066, | |
| "learning_rate": 6.710928319623972e-07, | |
| "loss": 6.1428, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 1.6451233842538189, | |
| "eval_loss": 1.4704252481460571, | |
| "eval_runtime": 67.4318, | |
| "eval_samples_per_second": 21.266, | |
| "eval_steps_per_second": 2.669, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 1.6509988249118686, | |
| "grad_norm": 1.888319492340088, | |
| "learning_rate": 6.699177438307873e-07, | |
| "loss": 5.9711, | |
| "step": 2810 | |
| }, | |
| { | |
| "epoch": 1.6568742655699178, | |
| "grad_norm": 2.5909926891326904, | |
| "learning_rate": 6.687426556991774e-07, | |
| "loss": 5.8139, | |
| "step": 2820 | |
| }, | |
| { | |
| "epoch": 1.662749706227967, | |
| "grad_norm": 1.7682013511657715, | |
| "learning_rate": 6.675675675675675e-07, | |
| "loss": 5.8262, | |
| "step": 2830 | |
| }, | |
| { | |
| "epoch": 1.6686251468860165, | |
| "grad_norm": 1.8746877908706665, | |
| "learning_rate": 6.663924794359577e-07, | |
| "loss": 5.9217, | |
| "step": 2840 | |
| }, | |
| { | |
| "epoch": 1.674500587544066, | |
| "grad_norm": 1.5268665552139282, | |
| "learning_rate": 6.652173913043478e-07, | |
| "loss": 5.7433, | |
| "step": 2850 | |
| }, | |
| { | |
| "epoch": 1.674500587544066, | |
| "eval_loss": 1.4701635837554932, | |
| "eval_runtime": 67.5227, | |
| "eval_samples_per_second": 21.237, | |
| "eval_steps_per_second": 2.666, | |
| "step": 2850 | |
| }, | |
| { | |
| "epoch": 1.6803760282021152, | |
| "grad_norm": 2.257277011871338, | |
| "learning_rate": 6.640423031727379e-07, | |
| "loss": 5.9719, | |
| "step": 2860 | |
| }, | |
| { | |
| "epoch": 1.6862514688601644, | |
| "grad_norm": 1.724713921546936, | |
| "learning_rate": 6.628672150411281e-07, | |
| "loss": 5.8062, | |
| "step": 2870 | |
| }, | |
| { | |
| "epoch": 1.6921269095182139, | |
| "grad_norm": 2.0070745944976807, | |
| "learning_rate": 6.616921269095181e-07, | |
| "loss": 5.8094, | |
| "step": 2880 | |
| }, | |
| { | |
| "epoch": 1.6980023501762633, | |
| "grad_norm": 1.8564118146896362, | |
| "learning_rate": 6.605170387779083e-07, | |
| "loss": 5.9552, | |
| "step": 2890 | |
| }, | |
| { | |
| "epoch": 1.7038777908343126, | |
| "grad_norm": 1.6099361181259155, | |
| "learning_rate": 6.593419506462985e-07, | |
| "loss": 5.8433, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 1.7038777908343126, | |
| "eval_loss": 1.4698939323425293, | |
| "eval_runtime": 67.3768, | |
| "eval_samples_per_second": 21.283, | |
| "eval_steps_per_second": 2.672, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 1.7097532314923618, | |
| "grad_norm": 1.7506616115570068, | |
| "learning_rate": 6.581668625146885e-07, | |
| "loss": 5.8262, | |
| "step": 2910 | |
| }, | |
| { | |
| "epoch": 1.7156286721504113, | |
| "grad_norm": 1.6937963962554932, | |
| "learning_rate": 6.569917743830787e-07, | |
| "loss": 5.753, | |
| "step": 2920 | |
| }, | |
| { | |
| "epoch": 1.7215041128084607, | |
| "grad_norm": 1.9550119638442993, | |
| "learning_rate": 6.558166862514688e-07, | |
| "loss": 6.082, | |
| "step": 2930 | |
| }, | |
| { | |
| "epoch": 1.72737955346651, | |
| "grad_norm": 1.9541058540344238, | |
| "learning_rate": 6.546415981198589e-07, | |
| "loss": 5.94, | |
| "step": 2940 | |
| }, | |
| { | |
| "epoch": 1.7332549941245592, | |
| "grad_norm": 1.8375394344329834, | |
| "learning_rate": 6.53466509988249e-07, | |
| "loss": 6.0372, | |
| "step": 2950 | |
| }, | |
| { | |
| "epoch": 1.7332549941245592, | |
| "eval_loss": 1.4696645736694336, | |
| "eval_runtime": 68.3981, | |
| "eval_samples_per_second": 20.965, | |
| "eval_steps_per_second": 2.632, | |
| "step": 2950 | |
| }, | |
| { | |
| "epoch": 1.7391304347826086, | |
| "grad_norm": 1.9922813177108765, | |
| "learning_rate": 6.522914218566392e-07, | |
| "loss": 6.1165, | |
| "step": 2960 | |
| }, | |
| { | |
| "epoch": 1.745005875440658, | |
| "grad_norm": 1.6892035007476807, | |
| "learning_rate": 6.511163337250293e-07, | |
| "loss": 5.9984, | |
| "step": 2970 | |
| }, | |
| { | |
| "epoch": 1.7508813160987073, | |
| "grad_norm": 1.7739448547363281, | |
| "learning_rate": 6.499412455934194e-07, | |
| "loss": 6.054, | |
| "step": 2980 | |
| }, | |
| { | |
| "epoch": 1.7567567567567568, | |
| "grad_norm": 1.658884882926941, | |
| "learning_rate": 6.487661574618097e-07, | |
| "loss": 5.983, | |
| "step": 2990 | |
| }, | |
| { | |
| "epoch": 1.7626321974148063, | |
| "grad_norm": 1.8757832050323486, | |
| "learning_rate": 6.475910693301997e-07, | |
| "loss": 5.9327, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 1.7626321974148063, | |
| "eval_loss": 1.469561219215393, | |
| "eval_runtime": 67.5038, | |
| "eval_samples_per_second": 21.243, | |
| "eval_steps_per_second": 2.667, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 1.7685076380728555, | |
| "grad_norm": 1.6837679147720337, | |
| "learning_rate": 6.464159811985899e-07, | |
| "loss": 5.8991, | |
| "step": 3010 | |
| }, | |
| { | |
| "epoch": 1.7743830787309047, | |
| "grad_norm": 1.7924985885620117, | |
| "learning_rate": 6.452408930669801e-07, | |
| "loss": 6.0283, | |
| "step": 3020 | |
| }, | |
| { | |
| "epoch": 1.7802585193889542, | |
| "grad_norm": 1.6187570095062256, | |
| "learning_rate": 6.440658049353701e-07, | |
| "loss": 5.8629, | |
| "step": 3030 | |
| }, | |
| { | |
| "epoch": 1.7861339600470036, | |
| "grad_norm": 1.851152777671814, | |
| "learning_rate": 6.428907168037603e-07, | |
| "loss": 5.9834, | |
| "step": 3040 | |
| }, | |
| { | |
| "epoch": 1.7920094007050529, | |
| "grad_norm": 1.9718443155288696, | |
| "learning_rate": 6.417156286721504e-07, | |
| "loss": 5.9162, | |
| "step": 3050 | |
| }, | |
| { | |
| "epoch": 1.7920094007050529, | |
| "eval_loss": 1.469072937965393, | |
| "eval_runtime": 67.5637, | |
| "eval_samples_per_second": 21.224, | |
| "eval_steps_per_second": 2.664, | |
| "step": 3050 | |
| }, | |
| { | |
| "epoch": 1.7978848413631021, | |
| "grad_norm": 1.7449281215667725, | |
| "learning_rate": 6.405405405405405e-07, | |
| "loss": 5.7984, | |
| "step": 3060 | |
| }, | |
| { | |
| "epoch": 1.8037602820211516, | |
| "grad_norm": 1.8318501710891724, | |
| "learning_rate": 6.393654524089307e-07, | |
| "loss": 5.9781, | |
| "step": 3070 | |
| }, | |
| { | |
| "epoch": 1.809635722679201, | |
| "grad_norm": 2.28659987449646, | |
| "learning_rate": 6.381903642773208e-07, | |
| "loss": 5.9832, | |
| "step": 3080 | |
| }, | |
| { | |
| "epoch": 1.8155111633372503, | |
| "grad_norm": 2.0227696895599365, | |
| "learning_rate": 6.370152761457109e-07, | |
| "loss": 6.1062, | |
| "step": 3090 | |
| }, | |
| { | |
| "epoch": 1.8213866039952995, | |
| "grad_norm": 1.8883931636810303, | |
| "learning_rate": 6.35840188014101e-07, | |
| "loss": 5.9535, | |
| "step": 3100 | |
| }, | |
| { | |
| "epoch": 1.8213866039952995, | |
| "eval_loss": 1.469115138053894, | |
| "eval_runtime": 67.5527, | |
| "eval_samples_per_second": 21.228, | |
| "eval_steps_per_second": 2.665, | |
| "step": 3100 | |
| }, | |
| { | |
| "epoch": 1.827262044653349, | |
| "grad_norm": 1.8074959516525269, | |
| "learning_rate": 6.346650998824912e-07, | |
| "loss": 5.9359, | |
| "step": 3110 | |
| }, | |
| { | |
| "epoch": 1.8331374853113984, | |
| "grad_norm": 1.8197052478790283, | |
| "learning_rate": 6.334900117508812e-07, | |
| "loss": 5.9669, | |
| "step": 3120 | |
| }, | |
| { | |
| "epoch": 1.8390129259694477, | |
| "grad_norm": 2.2025105953216553, | |
| "learning_rate": 6.323149236192714e-07, | |
| "loss": 6.0365, | |
| "step": 3130 | |
| }, | |
| { | |
| "epoch": 1.8448883666274971, | |
| "grad_norm": 1.7041133642196655, | |
| "learning_rate": 6.311398354876616e-07, | |
| "loss": 5.7503, | |
| "step": 3140 | |
| }, | |
| { | |
| "epoch": 1.8507638072855466, | |
| "grad_norm": 1.7134292125701904, | |
| "learning_rate": 6.299647473560517e-07, | |
| "loss": 5.8262, | |
| "step": 3150 | |
| }, | |
| { | |
| "epoch": 1.8507638072855466, | |
| "eval_loss": 1.4687591791152954, | |
| "eval_runtime": 67.5398, | |
| "eval_samples_per_second": 21.232, | |
| "eval_steps_per_second": 2.665, | |
| "step": 3150 | |
| }, | |
| { | |
| "epoch": 1.8566392479435958, | |
| "grad_norm": 1.691468596458435, | |
| "learning_rate": 6.287896592244418e-07, | |
| "loss": 6.0252, | |
| "step": 3160 | |
| }, | |
| { | |
| "epoch": 1.862514688601645, | |
| "grad_norm": 2.009781837463379, | |
| "learning_rate": 6.276145710928319e-07, | |
| "loss": 5.9691, | |
| "step": 3170 | |
| }, | |
| { | |
| "epoch": 1.8683901292596945, | |
| "grad_norm": 1.7237638235092163, | |
| "learning_rate": 6.264394829612221e-07, | |
| "loss": 5.9849, | |
| "step": 3180 | |
| }, | |
| { | |
| "epoch": 1.874265569917744, | |
| "grad_norm": 1.611922264099121, | |
| "learning_rate": 6.252643948296122e-07, | |
| "loss": 5.8563, | |
| "step": 3190 | |
| }, | |
| { | |
| "epoch": 1.8801410105757932, | |
| "grad_norm": 1.808998703956604, | |
| "learning_rate": 6.240893066980023e-07, | |
| "loss": 6.1277, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 1.8801410105757932, | |
| "eval_loss": 1.468484878540039, | |
| "eval_runtime": 67.6509, | |
| "eval_samples_per_second": 21.197, | |
| "eval_steps_per_second": 2.661, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 1.8860164512338424, | |
| "grad_norm": 1.6996632814407349, | |
| "learning_rate": 6.229142185663925e-07, | |
| "loss": 5.9768, | |
| "step": 3210 | |
| }, | |
| { | |
| "epoch": 1.8918918918918919, | |
| "grad_norm": 1.8977118730545044, | |
| "learning_rate": 6.217391304347825e-07, | |
| "loss": 5.8365, | |
| "step": 3220 | |
| }, | |
| { | |
| "epoch": 1.8977673325499413, | |
| "grad_norm": 1.71300208568573, | |
| "learning_rate": 6.205640423031727e-07, | |
| "loss": 5.8048, | |
| "step": 3230 | |
| }, | |
| { | |
| "epoch": 1.9036427732079906, | |
| "grad_norm": 1.83664870262146, | |
| "learning_rate": 6.193889541715629e-07, | |
| "loss": 5.87, | |
| "step": 3240 | |
| }, | |
| { | |
| "epoch": 1.9095182138660398, | |
| "grad_norm": 1.8034873008728027, | |
| "learning_rate": 6.182138660399529e-07, | |
| "loss": 5.9079, | |
| "step": 3250 | |
| }, | |
| { | |
| "epoch": 1.9095182138660398, | |
| "eval_loss": 1.4684431552886963, | |
| "eval_runtime": 67.6943, | |
| "eval_samples_per_second": 21.183, | |
| "eval_steps_per_second": 2.659, | |
| "step": 3250 | |
| }, | |
| { | |
| "epoch": 1.9153936545240893, | |
| "grad_norm": 1.6270906925201416, | |
| "learning_rate": 6.170387779083431e-07, | |
| "loss": 5.9307, | |
| "step": 3260 | |
| }, | |
| { | |
| "epoch": 1.9212690951821387, | |
| "grad_norm": 1.9603782892227173, | |
| "learning_rate": 6.158636897767332e-07, | |
| "loss": 5.8802, | |
| "step": 3270 | |
| }, | |
| { | |
| "epoch": 1.927144535840188, | |
| "grad_norm": 1.7977780103683472, | |
| "learning_rate": 6.146886016451233e-07, | |
| "loss": 5.9755, | |
| "step": 3280 | |
| }, | |
| { | |
| "epoch": 1.9330199764982372, | |
| "grad_norm": 1.9165523052215576, | |
| "learning_rate": 6.135135135135134e-07, | |
| "loss": 5.9277, | |
| "step": 3290 | |
| }, | |
| { | |
| "epoch": 1.9388954171562869, | |
| "grad_norm": 1.881980061531067, | |
| "learning_rate": 6.123384253819036e-07, | |
| "loss": 5.932, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 1.9388954171562869, | |
| "eval_loss": 1.4681587219238281, | |
| "eval_runtime": 67.5744, | |
| "eval_samples_per_second": 21.221, | |
| "eval_steps_per_second": 2.664, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 1.9447708578143361, | |
| "grad_norm": 1.837111234664917, | |
| "learning_rate": 6.111633372502937e-07, | |
| "loss": 5.8813, | |
| "step": 3310 | |
| }, | |
| { | |
| "epoch": 1.9506462984723854, | |
| "grad_norm": 1.781909465789795, | |
| "learning_rate": 6.099882491186838e-07, | |
| "loss": 5.891, | |
| "step": 3320 | |
| }, | |
| { | |
| "epoch": 1.9565217391304348, | |
| "grad_norm": 1.9645850658416748, | |
| "learning_rate": 6.088131609870741e-07, | |
| "loss": 5.8671, | |
| "step": 3330 | |
| }, | |
| { | |
| "epoch": 1.9623971797884843, | |
| "grad_norm": 2.163180112838745, | |
| "learning_rate": 6.07638072855464e-07, | |
| "loss": 5.9638, | |
| "step": 3340 | |
| }, | |
| { | |
| "epoch": 1.9682726204465335, | |
| "grad_norm": 2.026726007461548, | |
| "learning_rate": 6.064629847238543e-07, | |
| "loss": 5.9407, | |
| "step": 3350 | |
| }, | |
| { | |
| "epoch": 1.9682726204465335, | |
| "eval_loss": 1.4679971933364868, | |
| "eval_runtime": 67.7006, | |
| "eval_samples_per_second": 21.181, | |
| "eval_steps_per_second": 2.659, | |
| "step": 3350 | |
| }, | |
| { | |
| "epoch": 1.9741480611045827, | |
| "grad_norm": 1.7907665967941284, | |
| "learning_rate": 6.052878965922445e-07, | |
| "loss": 5.8758, | |
| "step": 3360 | |
| }, | |
| { | |
| "epoch": 1.9800235017626322, | |
| "grad_norm": 1.534509539604187, | |
| "learning_rate": 6.041128084606345e-07, | |
| "loss": 5.9446, | |
| "step": 3370 | |
| }, | |
| { | |
| "epoch": 1.9858989424206817, | |
| "grad_norm": 2.1159238815307617, | |
| "learning_rate": 6.029377203290247e-07, | |
| "loss": 5.9475, | |
| "step": 3380 | |
| }, | |
| { | |
| "epoch": 1.991774383078731, | |
| "grad_norm": 1.6477874517440796, | |
| "learning_rate": 6.017626321974148e-07, | |
| "loss": 5.905, | |
| "step": 3390 | |
| }, | |
| { | |
| "epoch": 1.9976498237367801, | |
| "grad_norm": 1.7018089294433594, | |
| "learning_rate": 6.005875440658049e-07, | |
| "loss": 6.0155, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 1.9976498237367801, | |
| "eval_loss": 1.4677451848983765, | |
| "eval_runtime": 67.3618, | |
| "eval_samples_per_second": 21.288, | |
| "eval_steps_per_second": 2.672, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 2.00352526439483, | |
| "grad_norm": 2.056706190109253, | |
| "learning_rate": 5.99412455934195e-07, | |
| "loss": 5.9612, | |
| "step": 3410 | |
| }, | |
| { | |
| "epoch": 2.009400705052879, | |
| "grad_norm": 1.9465574026107788, | |
| "learning_rate": 5.982373678025852e-07, | |
| "loss": 5.7667, | |
| "step": 3420 | |
| }, | |
| { | |
| "epoch": 2.0152761457109283, | |
| "grad_norm": 1.745105266571045, | |
| "learning_rate": 5.970622796709754e-07, | |
| "loss": 6.0523, | |
| "step": 3430 | |
| }, | |
| { | |
| "epoch": 2.0211515863689775, | |
| "grad_norm": 1.695147156715393, | |
| "learning_rate": 5.958871915393654e-07, | |
| "loss": 5.9134, | |
| "step": 3440 | |
| }, | |
| { | |
| "epoch": 2.027027027027027, | |
| "grad_norm": 1.5801490545272827, | |
| "learning_rate": 5.947121034077556e-07, | |
| "loss": 5.7663, | |
| "step": 3450 | |
| }, | |
| { | |
| "epoch": 2.027027027027027, | |
| "eval_loss": 1.467654824256897, | |
| "eval_runtime": 67.3107, | |
| "eval_samples_per_second": 21.304, | |
| "eval_steps_per_second": 2.674, | |
| "step": 3450 | |
| }, | |
| { | |
| "epoch": 2.0329024676850764, | |
| "grad_norm": 1.7473292350769043, | |
| "learning_rate": 5.935370152761457e-07, | |
| "loss": 5.7892, | |
| "step": 3460 | |
| }, | |
| { | |
| "epoch": 2.0387779083431257, | |
| "grad_norm": 1.7656643390655518, | |
| "learning_rate": 5.923619271445358e-07, | |
| "loss": 5.7947, | |
| "step": 3470 | |
| }, | |
| { | |
| "epoch": 2.044653349001175, | |
| "grad_norm": 1.8827358484268188, | |
| "learning_rate": 5.91186839012926e-07, | |
| "loss": 5.8024, | |
| "step": 3480 | |
| }, | |
| { | |
| "epoch": 2.0505287896592246, | |
| "grad_norm": 2.413665771484375, | |
| "learning_rate": 5.900117508813161e-07, | |
| "loss": 5.8395, | |
| "step": 3490 | |
| }, | |
| { | |
| "epoch": 2.056404230317274, | |
| "grad_norm": 1.7899099588394165, | |
| "learning_rate": 5.888366627497062e-07, | |
| "loss": 5.8906, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 2.056404230317274, | |
| "eval_loss": 1.4674228429794312, | |
| "eval_runtime": 67.4193, | |
| "eval_samples_per_second": 21.27, | |
| "eval_steps_per_second": 2.67, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 2.062279670975323, | |
| "grad_norm": 1.7669270038604736, | |
| "learning_rate": 5.876615746180963e-07, | |
| "loss": 6.0558, | |
| "step": 3510 | |
| }, | |
| { | |
| "epoch": 2.0681551116333723, | |
| "grad_norm": 1.7801496982574463, | |
| "learning_rate": 5.864864864864865e-07, | |
| "loss": 5.6794, | |
| "step": 3520 | |
| }, | |
| { | |
| "epoch": 2.074030552291422, | |
| "grad_norm": 2.059295415878296, | |
| "learning_rate": 5.853113983548766e-07, | |
| "loss": 5.8377, | |
| "step": 3530 | |
| }, | |
| { | |
| "epoch": 2.079905992949471, | |
| "grad_norm": 1.7855298519134521, | |
| "learning_rate": 5.841363102232667e-07, | |
| "loss": 5.8119, | |
| "step": 3540 | |
| }, | |
| { | |
| "epoch": 2.0857814336075204, | |
| "grad_norm": 1.53040611743927, | |
| "learning_rate": 5.829612220916569e-07, | |
| "loss": 6.0381, | |
| "step": 3550 | |
| }, | |
| { | |
| "epoch": 2.0857814336075204, | |
| "eval_loss": 1.467327356338501, | |
| "eval_runtime": 67.4105, | |
| "eval_samples_per_second": 21.273, | |
| "eval_steps_per_second": 2.67, | |
| "step": 3550 | |
| }, | |
| { | |
| "epoch": 2.09165687426557, | |
| "grad_norm": 1.7886220216751099, | |
| "learning_rate": 5.817861339600469e-07, | |
| "loss": 5.9189, | |
| "step": 3560 | |
| }, | |
| { | |
| "epoch": 2.0975323149236194, | |
| "grad_norm": 1.7158267498016357, | |
| "learning_rate": 5.806110458284371e-07, | |
| "loss": 5.8659, | |
| "step": 3570 | |
| }, | |
| { | |
| "epoch": 2.1034077555816686, | |
| "grad_norm": 1.8124908208847046, | |
| "learning_rate": 5.794359576968272e-07, | |
| "loss": 5.7777, | |
| "step": 3580 | |
| }, | |
| { | |
| "epoch": 2.109283196239718, | |
| "grad_norm": 1.8852800130844116, | |
| "learning_rate": 5.782608695652173e-07, | |
| "loss": 5.7058, | |
| "step": 3590 | |
| }, | |
| { | |
| "epoch": 2.1151586368977675, | |
| "grad_norm": 1.8558183908462524, | |
| "learning_rate": 5.770857814336075e-07, | |
| "loss": 6.0992, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 2.1151586368977675, | |
| "eval_loss": 1.467076063156128, | |
| "eval_runtime": 67.5271, | |
| "eval_samples_per_second": 21.236, | |
| "eval_steps_per_second": 2.666, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 2.1210340775558167, | |
| "grad_norm": 1.7967942953109741, | |
| "learning_rate": 5.759106933019976e-07, | |
| "loss": 5.9542, | |
| "step": 3610 | |
| }, | |
| { | |
| "epoch": 2.126909518213866, | |
| "grad_norm": 1.811843752861023, | |
| "learning_rate": 5.747356051703877e-07, | |
| "loss": 5.7699, | |
| "step": 3620 | |
| }, | |
| { | |
| "epoch": 2.132784958871915, | |
| "grad_norm": 1.774497151374817, | |
| "learning_rate": 5.735605170387778e-07, | |
| "loss": 5.9018, | |
| "step": 3630 | |
| }, | |
| { | |
| "epoch": 2.138660399529965, | |
| "grad_norm": 1.739669680595398, | |
| "learning_rate": 5.72385428907168e-07, | |
| "loss": 5.855, | |
| "step": 3640 | |
| }, | |
| { | |
| "epoch": 2.144535840188014, | |
| "grad_norm": 1.8997622728347778, | |
| "learning_rate": 5.712103407755581e-07, | |
| "loss": 5.8494, | |
| "step": 3650 | |
| }, | |
| { | |
| "epoch": 2.144535840188014, | |
| "eval_loss": 1.4668962955474854, | |
| "eval_runtime": 67.352, | |
| "eval_samples_per_second": 21.291, | |
| "eval_steps_per_second": 2.673, | |
| "step": 3650 | |
| }, | |
| { | |
| "epoch": 2.1504112808460634, | |
| "grad_norm": 2.079676389694214, | |
| "learning_rate": 5.700352526439482e-07, | |
| "loss": 5.9762, | |
| "step": 3660 | |
| }, | |
| { | |
| "epoch": 2.1562867215041126, | |
| "grad_norm": 1.7779871225357056, | |
| "learning_rate": 5.688601645123385e-07, | |
| "loss": 5.895, | |
| "step": 3670 | |
| }, | |
| { | |
| "epoch": 2.1621621621621623, | |
| "grad_norm": 1.5973154306411743, | |
| "learning_rate": 5.676850763807284e-07, | |
| "loss": 5.9583, | |
| "step": 3680 | |
| }, | |
| { | |
| "epoch": 2.1680376028202115, | |
| "grad_norm": 1.6692899465560913, | |
| "learning_rate": 5.665099882491187e-07, | |
| "loss": 5.874, | |
| "step": 3690 | |
| }, | |
| { | |
| "epoch": 2.1739130434782608, | |
| "grad_norm": 1.9078632593154907, | |
| "learning_rate": 5.653349001175089e-07, | |
| "loss": 5.9224, | |
| "step": 3700 | |
| }, | |
| { | |
| "epoch": 2.1739130434782608, | |
| "eval_loss": 1.466797947883606, | |
| "eval_runtime": 67.3337, | |
| "eval_samples_per_second": 21.297, | |
| "eval_steps_per_second": 2.673, | |
| "step": 3700 | |
| }, | |
| { | |
| "epoch": 2.17978848413631, | |
| "grad_norm": 1.675715684890747, | |
| "learning_rate": 5.641598119858989e-07, | |
| "loss": 5.9647, | |
| "step": 3710 | |
| }, | |
| { | |
| "epoch": 2.1856639247943597, | |
| "grad_norm": 2.0339181423187256, | |
| "learning_rate": 5.629847238542891e-07, | |
| "loss": 5.8245, | |
| "step": 3720 | |
| }, | |
| { | |
| "epoch": 2.191539365452409, | |
| "grad_norm": 1.6942006349563599, | |
| "learning_rate": 5.618096357226792e-07, | |
| "loss": 5.9127, | |
| "step": 3730 | |
| }, | |
| { | |
| "epoch": 2.197414806110458, | |
| "grad_norm": 1.82574462890625, | |
| "learning_rate": 5.606345475910693e-07, | |
| "loss": 5.8228, | |
| "step": 3740 | |
| }, | |
| { | |
| "epoch": 2.203290246768508, | |
| "grad_norm": 1.7962678670883179, | |
| "learning_rate": 5.594594594594594e-07, | |
| "loss": 6.043, | |
| "step": 3750 | |
| }, | |
| { | |
| "epoch": 2.203290246768508, | |
| "eval_loss": 1.4665814638137817, | |
| "eval_runtime": 70.2464, | |
| "eval_samples_per_second": 20.414, | |
| "eval_steps_per_second": 2.562, | |
| "step": 3750 | |
| }, | |
| { | |
| "epoch": 2.209165687426557, | |
| "grad_norm": 1.7127306461334229, | |
| "learning_rate": 5.582843713278496e-07, | |
| "loss": 5.9409, | |
| "step": 3760 | |
| }, | |
| { | |
| "epoch": 2.2150411280846063, | |
| "grad_norm": 1.6787141561508179, | |
| "learning_rate": 5.571092831962398e-07, | |
| "loss": 5.9635, | |
| "step": 3770 | |
| }, | |
| { | |
| "epoch": 2.2209165687426555, | |
| "grad_norm": 1.8650240898132324, | |
| "learning_rate": 5.559341950646298e-07, | |
| "loss": 5.9097, | |
| "step": 3780 | |
| }, | |
| { | |
| "epoch": 2.226792009400705, | |
| "grad_norm": 1.9650366306304932, | |
| "learning_rate": 5.5475910693302e-07, | |
| "loss": 5.9976, | |
| "step": 3790 | |
| }, | |
| { | |
| "epoch": 2.2326674500587544, | |
| "grad_norm": 2.1691102981567383, | |
| "learning_rate": 5.535840188014101e-07, | |
| "loss": 5.8537, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 2.2326674500587544, | |
| "eval_loss": 1.4663869142532349, | |
| "eval_runtime": 67.3836, | |
| "eval_samples_per_second": 21.281, | |
| "eval_steps_per_second": 2.671, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 2.2385428907168037, | |
| "grad_norm": 1.642232060432434, | |
| "learning_rate": 5.524089306698002e-07, | |
| "loss": 5.8476, | |
| "step": 3810 | |
| }, | |
| { | |
| "epoch": 2.244418331374853, | |
| "grad_norm": 2.063124895095825, | |
| "learning_rate": 5.512338425381904e-07, | |
| "loss": 6.0597, | |
| "step": 3820 | |
| }, | |
| { | |
| "epoch": 2.2502937720329026, | |
| "grad_norm": 1.841054081916809, | |
| "learning_rate": 5.500587544065805e-07, | |
| "loss": 6.0998, | |
| "step": 3830 | |
| }, | |
| { | |
| "epoch": 2.256169212690952, | |
| "grad_norm": 1.6578458547592163, | |
| "learning_rate": 5.488836662749706e-07, | |
| "loss": 6.0319, | |
| "step": 3840 | |
| }, | |
| { | |
| "epoch": 2.262044653349001, | |
| "grad_norm": 1.8542330265045166, | |
| "learning_rate": 5.477085781433607e-07, | |
| "loss": 5.9107, | |
| "step": 3850 | |
| }, | |
| { | |
| "epoch": 2.262044653349001, | |
| "eval_loss": 1.4663937091827393, | |
| "eval_runtime": 67.8634, | |
| "eval_samples_per_second": 21.131, | |
| "eval_steps_per_second": 2.652, | |
| "step": 3850 | |
| }, | |
| { | |
| "epoch": 2.2679200940070503, | |
| "grad_norm": 1.8425204753875732, | |
| "learning_rate": 5.465334900117509e-07, | |
| "loss": 5.788, | |
| "step": 3860 | |
| }, | |
| { | |
| "epoch": 2.2737955346651, | |
| "grad_norm": 1.9576416015625, | |
| "learning_rate": 5.45358401880141e-07, | |
| "loss": 5.7692, | |
| "step": 3870 | |
| }, | |
| { | |
| "epoch": 2.279670975323149, | |
| "grad_norm": 1.6908799409866333, | |
| "learning_rate": 5.441833137485311e-07, | |
| "loss": 5.7556, | |
| "step": 3880 | |
| }, | |
| { | |
| "epoch": 2.2855464159811985, | |
| "grad_norm": 1.787754774093628, | |
| "learning_rate": 5.430082256169213e-07, | |
| "loss": 5.8563, | |
| "step": 3890 | |
| }, | |
| { | |
| "epoch": 2.291421856639248, | |
| "grad_norm": 1.9981508255004883, | |
| "learning_rate": 5.418331374853113e-07, | |
| "loss": 5.8377, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 2.291421856639248, | |
| "eval_loss": 1.4661545753479004, | |
| "eval_runtime": 67.3909, | |
| "eval_samples_per_second": 21.279, | |
| "eval_steps_per_second": 2.671, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 2.2972972972972974, | |
| "grad_norm": 2.019265651702881, | |
| "learning_rate": 5.406580493537015e-07, | |
| "loss": 5.8725, | |
| "step": 3910 | |
| }, | |
| { | |
| "epoch": 2.3031727379553466, | |
| "grad_norm": 2.1026248931884766, | |
| "learning_rate": 5.394829612220916e-07, | |
| "loss": 5.6895, | |
| "step": 3920 | |
| }, | |
| { | |
| "epoch": 2.309048178613396, | |
| "grad_norm": 2.0098109245300293, | |
| "learning_rate": 5.383078730904817e-07, | |
| "loss": 5.9395, | |
| "step": 3930 | |
| }, | |
| { | |
| "epoch": 2.3149236192714455, | |
| "grad_norm": 1.9912086725234985, | |
| "learning_rate": 5.371327849588719e-07, | |
| "loss": 5.8199, | |
| "step": 3940 | |
| }, | |
| { | |
| "epoch": 2.3207990599294948, | |
| "grad_norm": 1.8740649223327637, | |
| "learning_rate": 5.35957696827262e-07, | |
| "loss": 5.9611, | |
| "step": 3950 | |
| }, | |
| { | |
| "epoch": 2.3207990599294948, | |
| "eval_loss": 1.4659883975982666, | |
| "eval_runtime": 67.3181, | |
| "eval_samples_per_second": 21.302, | |
| "eval_steps_per_second": 2.674, | |
| "step": 3950 | |
| }, | |
| { | |
| "epoch": 2.326674500587544, | |
| "grad_norm": 1.4131051301956177, | |
| "learning_rate": 5.347826086956521e-07, | |
| "loss": 5.8967, | |
| "step": 3960 | |
| }, | |
| { | |
| "epoch": 2.3325499412455932, | |
| "grad_norm": 1.7178343534469604, | |
| "learning_rate": 5.336075205640422e-07, | |
| "loss": 5.8699, | |
| "step": 3970 | |
| }, | |
| { | |
| "epoch": 2.338425381903643, | |
| "grad_norm": 1.9381266832351685, | |
| "learning_rate": 5.324324324324324e-07, | |
| "loss": 6.014, | |
| "step": 3980 | |
| }, | |
| { | |
| "epoch": 2.344300822561692, | |
| "grad_norm": 1.8134095668792725, | |
| "learning_rate": 5.312573443008225e-07, | |
| "loss": 5.7731, | |
| "step": 3990 | |
| }, | |
| { | |
| "epoch": 2.3501762632197414, | |
| "grad_norm": 1.9413225650787354, | |
| "learning_rate": 5.300822561692126e-07, | |
| "loss": 5.8098, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 2.3501762632197414, | |
| "eval_loss": 1.4658437967300415, | |
| "eval_runtime": 67.3732, | |
| "eval_samples_per_second": 21.284, | |
| "eval_steps_per_second": 2.672, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 2.3560517038777906, | |
| "grad_norm": 1.762492299079895, | |
| "learning_rate": 5.289071680376028e-07, | |
| "loss": 5.9946, | |
| "step": 4010 | |
| }, | |
| { | |
| "epoch": 2.3619271445358403, | |
| "grad_norm": 1.657081127166748, | |
| "learning_rate": 5.277320799059928e-07, | |
| "loss": 5.8473, | |
| "step": 4020 | |
| }, | |
| { | |
| "epoch": 2.3678025851938895, | |
| "grad_norm": 1.9021812677383423, | |
| "learning_rate": 5.26556991774383e-07, | |
| "loss": 6.0927, | |
| "step": 4030 | |
| }, | |
| { | |
| "epoch": 2.3736780258519388, | |
| "grad_norm": 1.7664687633514404, | |
| "learning_rate": 5.253819036427733e-07, | |
| "loss": 5.6985, | |
| "step": 4040 | |
| }, | |
| { | |
| "epoch": 2.3795534665099884, | |
| "grad_norm": 2.071560859680176, | |
| "learning_rate": 5.242068155111633e-07, | |
| "loss": 5.8251, | |
| "step": 4050 | |
| }, | |
| { | |
| "epoch": 2.3795534665099884, | |
| "eval_loss": 1.4657713174819946, | |
| "eval_runtime": 67.3816, | |
| "eval_samples_per_second": 21.282, | |
| "eval_steps_per_second": 2.671, | |
| "step": 4050 | |
| }, | |
| { | |
| "epoch": 2.3854289071680377, | |
| "grad_norm": 1.715277075767517, | |
| "learning_rate": 5.230317273795535e-07, | |
| "loss": 6.0299, | |
| "step": 4060 | |
| }, | |
| { | |
| "epoch": 2.391304347826087, | |
| "grad_norm": 1.7600971460342407, | |
| "learning_rate": 5.218566392479436e-07, | |
| "loss": 5.7579, | |
| "step": 4070 | |
| }, | |
| { | |
| "epoch": 2.397179788484136, | |
| "grad_norm": 2.067085027694702, | |
| "learning_rate": 5.206815511163337e-07, | |
| "loss": 5.9357, | |
| "step": 4080 | |
| }, | |
| { | |
| "epoch": 2.403055229142186, | |
| "grad_norm": 1.6616854667663574, | |
| "learning_rate": 5.195064629847238e-07, | |
| "loss": 5.8101, | |
| "step": 4090 | |
| }, | |
| { | |
| "epoch": 2.408930669800235, | |
| "grad_norm": 1.7067201137542725, | |
| "learning_rate": 5.18331374853114e-07, | |
| "loss": 5.9347, | |
| "step": 4100 | |
| }, | |
| { | |
| "epoch": 2.408930669800235, | |
| "eval_loss": 1.465532898902893, | |
| "eval_runtime": 67.3821, | |
| "eval_samples_per_second": 21.282, | |
| "eval_steps_per_second": 2.671, | |
| "step": 4100 | |
| }, | |
| { | |
| "epoch": 2.4148061104582843, | |
| "grad_norm": 2.5587124824523926, | |
| "learning_rate": 5.171562867215042e-07, | |
| "loss": 5.9894, | |
| "step": 4110 | |
| }, | |
| { | |
| "epoch": 2.4206815511163335, | |
| "grad_norm": 1.795381784439087, | |
| "learning_rate": 5.159811985898942e-07, | |
| "loss": 5.8384, | |
| "step": 4120 | |
| }, | |
| { | |
| "epoch": 2.426556991774383, | |
| "grad_norm": 2.450474500656128, | |
| "learning_rate": 5.148061104582844e-07, | |
| "loss": 5.885, | |
| "step": 4130 | |
| }, | |
| { | |
| "epoch": 2.4324324324324325, | |
| "grad_norm": 1.8166522979736328, | |
| "learning_rate": 5.136310223266745e-07, | |
| "loss": 5.8504, | |
| "step": 4140 | |
| }, | |
| { | |
| "epoch": 2.4383078730904817, | |
| "grad_norm": 1.6221665143966675, | |
| "learning_rate": 5.124559341950646e-07, | |
| "loss": 5.9535, | |
| "step": 4150 | |
| }, | |
| { | |
| "epoch": 2.4383078730904817, | |
| "eval_loss": 1.4654651880264282, | |
| "eval_runtime": 67.324, | |
| "eval_samples_per_second": 21.3, | |
| "eval_steps_per_second": 2.674, | |
| "step": 4150 | |
| }, | |
| { | |
| "epoch": 2.444183313748531, | |
| "grad_norm": 1.6266223192214966, | |
| "learning_rate": 5.112808460634548e-07, | |
| "loss": 5.9099, | |
| "step": 4160 | |
| }, | |
| { | |
| "epoch": 2.4500587544065806, | |
| "grad_norm": 1.839812994003296, | |
| "learning_rate": 5.101057579318449e-07, | |
| "loss": 6.0562, | |
| "step": 4170 | |
| }, | |
| { | |
| "epoch": 2.45593419506463, | |
| "grad_norm": 1.6507972478866577, | |
| "learning_rate": 5.08930669800235e-07, | |
| "loss": 5.9426, | |
| "step": 4180 | |
| }, | |
| { | |
| "epoch": 2.461809635722679, | |
| "grad_norm": 2.02901554107666, | |
| "learning_rate": 5.077555816686251e-07, | |
| "loss": 5.8951, | |
| "step": 4190 | |
| }, | |
| { | |
| "epoch": 2.4676850763807288, | |
| "grad_norm": 1.8781306743621826, | |
| "learning_rate": 5.065804935370153e-07, | |
| "loss": 5.9792, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 2.4676850763807288, | |
| "eval_loss": 1.46532142162323, | |
| "eval_runtime": 68.0363, | |
| "eval_samples_per_second": 21.077, | |
| "eval_steps_per_second": 2.646, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 2.473560517038778, | |
| "grad_norm": 2.0996501445770264, | |
| "learning_rate": 5.054054054054053e-07, | |
| "loss": 5.9635, | |
| "step": 4210 | |
| }, | |
| { | |
| "epoch": 2.4794359576968272, | |
| "grad_norm": 1.8582676649093628, | |
| "learning_rate": 5.042303172737955e-07, | |
| "loss": 5.7168, | |
| "step": 4220 | |
| }, | |
| { | |
| "epoch": 2.4853113983548765, | |
| "grad_norm": 2.0282630920410156, | |
| "learning_rate": 5.030552291421857e-07, | |
| "loss": 5.8186, | |
| "step": 4230 | |
| }, | |
| { | |
| "epoch": 2.491186839012926, | |
| "grad_norm": 1.7468255758285522, | |
| "learning_rate": 5.018801410105757e-07, | |
| "loss": 5.8905, | |
| "step": 4240 | |
| }, | |
| { | |
| "epoch": 2.4970622796709754, | |
| "grad_norm": 1.6229472160339355, | |
| "learning_rate": 5.007050528789659e-07, | |
| "loss": 5.7106, | |
| "step": 4250 | |
| }, | |
| { | |
| "epoch": 2.4970622796709754, | |
| "eval_loss": 1.4651542901992798, | |
| "eval_runtime": 67.3322, | |
| "eval_samples_per_second": 21.297, | |
| "eval_steps_per_second": 2.673, | |
| "step": 4250 | |
| }, | |
| { | |
| "epoch": 2.5029377203290246, | |
| "grad_norm": 1.912929654121399, | |
| "learning_rate": 4.99529964747356e-07, | |
| "loss": 5.9134, | |
| "step": 4260 | |
| }, | |
| { | |
| "epoch": 2.5088131609870743, | |
| "grad_norm": 2.1273841857910156, | |
| "learning_rate": 4.983548766157461e-07, | |
| "loss": 6.0254, | |
| "step": 4270 | |
| }, | |
| { | |
| "epoch": 2.5146886016451235, | |
| "grad_norm": 1.7473537921905518, | |
| "learning_rate": 4.971797884841363e-07, | |
| "loss": 5.7731, | |
| "step": 4280 | |
| }, | |
| { | |
| "epoch": 2.5205640423031728, | |
| "grad_norm": 1.8446624279022217, | |
| "learning_rate": 4.960047003525264e-07, | |
| "loss": 5.5428, | |
| "step": 4290 | |
| }, | |
| { | |
| "epoch": 2.526439482961222, | |
| "grad_norm": 1.9221971035003662, | |
| "learning_rate": 4.948296122209165e-07, | |
| "loss": 5.9076, | |
| "step": 4300 | |
| }, | |
| { | |
| "epoch": 2.526439482961222, | |
| "eval_loss": 1.4649547338485718, | |
| "eval_runtime": 67.4292, | |
| "eval_samples_per_second": 21.267, | |
| "eval_steps_per_second": 2.669, | |
| "step": 4300 | |
| }, | |
| { | |
| "epoch": 2.5323149236192712, | |
| "grad_norm": 1.844045877456665, | |
| "learning_rate": 4.936545240893067e-07, | |
| "loss": 5.9249, | |
| "step": 4310 | |
| }, | |
| { | |
| "epoch": 2.538190364277321, | |
| "grad_norm": 1.7555588483810425, | |
| "learning_rate": 4.924794359576968e-07, | |
| "loss": 5.8795, | |
| "step": 4320 | |
| }, | |
| { | |
| "epoch": 2.54406580493537, | |
| "grad_norm": 1.904198408126831, | |
| "learning_rate": 4.913043478260869e-07, | |
| "loss": 5.9253, | |
| "step": 4330 | |
| }, | |
| { | |
| "epoch": 2.5499412455934194, | |
| "grad_norm": 1.6488707065582275, | |
| "learning_rate": 4.90129259694477e-07, | |
| "loss": 5.7982, | |
| "step": 4340 | |
| }, | |
| { | |
| "epoch": 2.555816686251469, | |
| "grad_norm": 1.6343579292297363, | |
| "learning_rate": 4.889541715628671e-07, | |
| "loss": 5.8531, | |
| "step": 4350 | |
| }, | |
| { | |
| "epoch": 2.555816686251469, | |
| "eval_loss": 1.4648929834365845, | |
| "eval_runtime": 67.3567, | |
| "eval_samples_per_second": 21.29, | |
| "eval_steps_per_second": 2.672, | |
| "step": 4350 | |
| }, | |
| { | |
| "epoch": 2.5616921269095183, | |
| "grad_norm": 1.8681535720825195, | |
| "learning_rate": 4.877790834312573e-07, | |
| "loss": 5.9276, | |
| "step": 4360 | |
| }, | |
| { | |
| "epoch": 2.5675675675675675, | |
| "grad_norm": 2.1231424808502197, | |
| "learning_rate": 4.866039952996475e-07, | |
| "loss": 5.9091, | |
| "step": 4370 | |
| }, | |
| { | |
| "epoch": 2.573443008225617, | |
| "grad_norm": 1.6580970287322998, | |
| "learning_rate": 4.854289071680376e-07, | |
| "loss": 5.9298, | |
| "step": 4380 | |
| }, | |
| { | |
| "epoch": 2.579318448883666, | |
| "grad_norm": 1.5748720169067383, | |
| "learning_rate": 4.842538190364277e-07, | |
| "loss": 5.9232, | |
| "step": 4390 | |
| }, | |
| { | |
| "epoch": 2.5851938895417157, | |
| "grad_norm": 1.945760726928711, | |
| "learning_rate": 4.830787309048179e-07, | |
| "loss": 5.8322, | |
| "step": 4400 | |
| }, | |
| { | |
| "epoch": 2.5851938895417157, | |
| "eval_loss": 1.4647204875946045, | |
| "eval_runtime": 67.3856, | |
| "eval_samples_per_second": 21.281, | |
| "eval_steps_per_second": 2.671, | |
| "step": 4400 | |
| }, | |
| { | |
| "epoch": 2.591069330199765, | |
| "grad_norm": 1.7735313177108765, | |
| "learning_rate": 4.81903642773208e-07, | |
| "loss": 6.0296, | |
| "step": 4410 | |
| }, | |
| { | |
| "epoch": 2.5969447708578146, | |
| "grad_norm": 1.6112607717514038, | |
| "learning_rate": 4.807285546415982e-07, | |
| "loss": 5.8741, | |
| "step": 4420 | |
| }, | |
| { | |
| "epoch": 2.602820211515864, | |
| "grad_norm": 1.7845340967178345, | |
| "learning_rate": 4.795534665099883e-07, | |
| "loss": 5.9611, | |
| "step": 4430 | |
| }, | |
| { | |
| "epoch": 2.608695652173913, | |
| "grad_norm": 2.0016372203826904, | |
| "learning_rate": 4.783783783783784e-07, | |
| "loss": 5.9482, | |
| "step": 4440 | |
| }, | |
| { | |
| "epoch": 2.6145710928319623, | |
| "grad_norm": 1.9225436449050903, | |
| "learning_rate": 4.772032902467685e-07, | |
| "loss": 5.897, | |
| "step": 4450 | |
| }, | |
| { | |
| "epoch": 2.6145710928319623, | |
| "eval_loss": 1.4647117853164673, | |
| "eval_runtime": 67.3807, | |
| "eval_samples_per_second": 21.282, | |
| "eval_steps_per_second": 2.671, | |
| "step": 4450 | |
| }, | |
| { | |
| "epoch": 2.6204465334900116, | |
| "grad_norm": 1.7982288599014282, | |
| "learning_rate": 4.760282021151586e-07, | |
| "loss": 5.7977, | |
| "step": 4460 | |
| }, | |
| { | |
| "epoch": 2.6263219741480612, | |
| "grad_norm": 2.0047717094421387, | |
| "learning_rate": 4.748531139835488e-07, | |
| "loss": 5.8034, | |
| "step": 4470 | |
| }, | |
| { | |
| "epoch": 2.6321974148061105, | |
| "grad_norm": 2.0406343936920166, | |
| "learning_rate": 4.736780258519389e-07, | |
| "loss": 5.8348, | |
| "step": 4480 | |
| }, | |
| { | |
| "epoch": 2.6380728554641597, | |
| "grad_norm": 1.7326260805130005, | |
| "learning_rate": 4.72502937720329e-07, | |
| "loss": 5.7419, | |
| "step": 4490 | |
| }, | |
| { | |
| "epoch": 2.6439482961222094, | |
| "grad_norm": 2.017756462097168, | |
| "learning_rate": 4.7132784958871914e-07, | |
| "loss": 5.8776, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 2.6439482961222094, | |
| "eval_loss": 1.4645116329193115, | |
| "eval_runtime": 67.0576, | |
| "eval_samples_per_second": 21.385, | |
| "eval_steps_per_second": 2.684, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 2.6498237367802586, | |
| "grad_norm": 1.670611023902893, | |
| "learning_rate": 4.7015276145710924e-07, | |
| "loss": 5.9727, | |
| "step": 4510 | |
| }, | |
| { | |
| "epoch": 2.655699177438308, | |
| "grad_norm": 1.8651740550994873, | |
| "learning_rate": 4.689776733254994e-07, | |
| "loss": 5.8256, | |
| "step": 4520 | |
| }, | |
| { | |
| "epoch": 2.661574618096357, | |
| "grad_norm": 1.7110469341278076, | |
| "learning_rate": 4.6780258519388955e-07, | |
| "loss": 5.8413, | |
| "step": 4530 | |
| }, | |
| { | |
| "epoch": 2.6674500587544063, | |
| "grad_norm": 1.6548104286193848, | |
| "learning_rate": 4.6662749706227965e-07, | |
| "loss": 6.0178, | |
| "step": 4540 | |
| }, | |
| { | |
| "epoch": 2.673325499412456, | |
| "grad_norm": 1.9871407747268677, | |
| "learning_rate": 4.654524089306698e-07, | |
| "loss": 5.8025, | |
| "step": 4550 | |
| }, | |
| { | |
| "epoch": 2.673325499412456, | |
| "eval_loss": 1.4644556045532227, | |
| "eval_runtime": 67.0171, | |
| "eval_samples_per_second": 21.398, | |
| "eval_steps_per_second": 2.686, | |
| "step": 4550 | |
| }, | |
| { | |
| "epoch": 2.6792009400705052, | |
| "grad_norm": 1.7982734441757202, | |
| "learning_rate": 4.642773207990599e-07, | |
| "loss": 5.7593, | |
| "step": 4560 | |
| }, | |
| { | |
| "epoch": 2.6850763807285545, | |
| "grad_norm": 2.1447372436523438, | |
| "learning_rate": 4.6310223266745e-07, | |
| "loss": 5.8057, | |
| "step": 4570 | |
| }, | |
| { | |
| "epoch": 2.690951821386604, | |
| "grad_norm": 1.9947744607925415, | |
| "learning_rate": 4.6192714453584016e-07, | |
| "loss": 5.964, | |
| "step": 4580 | |
| }, | |
| { | |
| "epoch": 2.6968272620446534, | |
| "grad_norm": 2.2180542945861816, | |
| "learning_rate": 4.607520564042303e-07, | |
| "loss": 5.8878, | |
| "step": 4590 | |
| }, | |
| { | |
| "epoch": 2.7027027027027026, | |
| "grad_norm": 1.5173759460449219, | |
| "learning_rate": 4.595769682726204e-07, | |
| "loss": 5.8811, | |
| "step": 4600 | |
| }, | |
| { | |
| "epoch": 2.7027027027027026, | |
| "eval_loss": 1.4642778635025024, | |
| "eval_runtime": 69.6554, | |
| "eval_samples_per_second": 20.587, | |
| "eval_steps_per_second": 2.584, | |
| "step": 4600 | |
| }, | |
| { | |
| "epoch": 2.708578143360752, | |
| "grad_norm": 1.739025354385376, | |
| "learning_rate": 4.5840188014101057e-07, | |
| "loss": 5.893, | |
| "step": 4610 | |
| }, | |
| { | |
| "epoch": 2.7144535840188015, | |
| "grad_norm": 2.0034613609313965, | |
| "learning_rate": 4.5722679200940067e-07, | |
| "loss": 5.984, | |
| "step": 4620 | |
| }, | |
| { | |
| "epoch": 2.720329024676851, | |
| "grad_norm": 2.050755739212036, | |
| "learning_rate": 4.5605170387779077e-07, | |
| "loss": 6.0021, | |
| "step": 4630 | |
| }, | |
| { | |
| "epoch": 2.7262044653349, | |
| "grad_norm": 2.053459644317627, | |
| "learning_rate": 4.54876615746181e-07, | |
| "loss": 5.8983, | |
| "step": 4640 | |
| }, | |
| { | |
| "epoch": 2.7320799059929497, | |
| "grad_norm": 1.7340502738952637, | |
| "learning_rate": 4.537015276145711e-07, | |
| "loss": 5.9349, | |
| "step": 4650 | |
| }, | |
| { | |
| "epoch": 2.7320799059929497, | |
| "eval_loss": 1.4640307426452637, | |
| "eval_runtime": 67.1022, | |
| "eval_samples_per_second": 21.37, | |
| "eval_steps_per_second": 2.682, | |
| "step": 4650 | |
| }, | |
| { | |
| "epoch": 2.737955346650999, | |
| "grad_norm": 2.087167978286743, | |
| "learning_rate": 4.525264394829612e-07, | |
| "loss": 5.9448, | |
| "step": 4660 | |
| }, | |
| { | |
| "epoch": 2.743830787309048, | |
| "grad_norm": 1.8812017440795898, | |
| "learning_rate": 4.5135135135135134e-07, | |
| "loss": 5.9692, | |
| "step": 4670 | |
| }, | |
| { | |
| "epoch": 2.7497062279670974, | |
| "grad_norm": 1.7874183654785156, | |
| "learning_rate": 4.5017626321974144e-07, | |
| "loss": 5.8267, | |
| "step": 4680 | |
| }, | |
| { | |
| "epoch": 2.7555816686251466, | |
| "grad_norm": 2.020829439163208, | |
| "learning_rate": 4.490011750881316e-07, | |
| "loss": 6.0666, | |
| "step": 4690 | |
| }, | |
| { | |
| "epoch": 2.7614571092831963, | |
| "grad_norm": 1.6772513389587402, | |
| "learning_rate": 4.4782608695652175e-07, | |
| "loss": 5.9288, | |
| "step": 4700 | |
| }, | |
| { | |
| "epoch": 2.7614571092831963, | |
| "eval_loss": 1.464098572731018, | |
| "eval_runtime": 67.1135, | |
| "eval_samples_per_second": 21.367, | |
| "eval_steps_per_second": 2.682, | |
| "step": 4700 | |
| }, | |
| { | |
| "epoch": 2.7673325499412456, | |
| "grad_norm": 1.8247939348220825, | |
| "learning_rate": 4.4665099882491185e-07, | |
| "loss": 5.9552, | |
| "step": 4710 | |
| }, | |
| { | |
| "epoch": 2.773207990599295, | |
| "grad_norm": 2.047966718673706, | |
| "learning_rate": 4.45475910693302e-07, | |
| "loss": 5.9451, | |
| "step": 4720 | |
| }, | |
| { | |
| "epoch": 2.7790834312573445, | |
| "grad_norm": 1.7807133197784424, | |
| "learning_rate": 4.443008225616921e-07, | |
| "loss": 5.8045, | |
| "step": 4730 | |
| }, | |
| { | |
| "epoch": 2.7849588719153937, | |
| "grad_norm": 1.7953366041183472, | |
| "learning_rate": 4.431257344300822e-07, | |
| "loss": 5.782, | |
| "step": 4740 | |
| }, | |
| { | |
| "epoch": 2.790834312573443, | |
| "grad_norm": 1.9604454040527344, | |
| "learning_rate": 4.4195064629847236e-07, | |
| "loss": 6.0679, | |
| "step": 4750 | |
| }, | |
| { | |
| "epoch": 2.790834312573443, | |
| "eval_loss": 1.4638469219207764, | |
| "eval_runtime": 67.0044, | |
| "eval_samples_per_second": 21.402, | |
| "eval_steps_per_second": 2.686, | |
| "step": 4750 | |
| }, | |
| { | |
| "epoch": 2.796709753231492, | |
| "grad_norm": 1.9754419326782227, | |
| "learning_rate": 4.407755581668625e-07, | |
| "loss": 5.7528, | |
| "step": 4760 | |
| }, | |
| { | |
| "epoch": 2.802585193889542, | |
| "grad_norm": 1.7962079048156738, | |
| "learning_rate": 4.396004700352526e-07, | |
| "loss": 5.7068, | |
| "step": 4770 | |
| }, | |
| { | |
| "epoch": 2.808460634547591, | |
| "grad_norm": 1.7251296043395996, | |
| "learning_rate": 4.3842538190364277e-07, | |
| "loss": 5.7795, | |
| "step": 4780 | |
| }, | |
| { | |
| "epoch": 2.8143360752056403, | |
| "grad_norm": 1.8542954921722412, | |
| "learning_rate": 4.3725029377203287e-07, | |
| "loss": 5.8237, | |
| "step": 4790 | |
| }, | |
| { | |
| "epoch": 2.82021151586369, | |
| "grad_norm": 1.9788106679916382, | |
| "learning_rate": 4.3607520564042297e-07, | |
| "loss": 5.9022, | |
| "step": 4800 | |
| }, | |
| { | |
| "epoch": 2.82021151586369, | |
| "eval_loss": 1.4637619256973267, | |
| "eval_runtime": 67.0549, | |
| "eval_samples_per_second": 21.385, | |
| "eval_steps_per_second": 2.684, | |
| "step": 4800 | |
| }, | |
| { | |
| "epoch": 2.8260869565217392, | |
| "grad_norm": 1.8251780271530151, | |
| "learning_rate": 4.349001175088131e-07, | |
| "loss": 5.8354, | |
| "step": 4810 | |
| }, | |
| { | |
| "epoch": 2.8319623971797885, | |
| "grad_norm": 1.8526431322097778, | |
| "learning_rate": 4.337250293772033e-07, | |
| "loss": 5.9148, | |
| "step": 4820 | |
| }, | |
| { | |
| "epoch": 2.8378378378378377, | |
| "grad_norm": 2.040987730026245, | |
| "learning_rate": 4.3254994124559343e-07, | |
| "loss": 6.0853, | |
| "step": 4830 | |
| }, | |
| { | |
| "epoch": 2.843713278495887, | |
| "grad_norm": 1.7101026773452759, | |
| "learning_rate": 4.3137485311398354e-07, | |
| "loss": 5.9939, | |
| "step": 4840 | |
| }, | |
| { | |
| "epoch": 2.8495887191539366, | |
| "grad_norm": 2.0545079708099365, | |
| "learning_rate": 4.3019976498237364e-07, | |
| "loss": 5.7725, | |
| "step": 4850 | |
| }, | |
| { | |
| "epoch": 2.8495887191539366, | |
| "eval_loss": 1.463710904121399, | |
| "eval_runtime": 67.0425, | |
| "eval_samples_per_second": 21.389, | |
| "eval_steps_per_second": 2.685, | |
| "step": 4850 | |
| }, | |
| { | |
| "epoch": 2.855464159811986, | |
| "grad_norm": 2.194539785385132, | |
| "learning_rate": 4.290246768507638e-07, | |
| "loss": 6.1075, | |
| "step": 4860 | |
| }, | |
| { | |
| "epoch": 2.861339600470035, | |
| "grad_norm": 2.0312609672546387, | |
| "learning_rate": 4.2784958871915395e-07, | |
| "loss": 5.8069, | |
| "step": 4870 | |
| }, | |
| { | |
| "epoch": 2.867215041128085, | |
| "grad_norm": 1.9404051303863525, | |
| "learning_rate": 4.2667450058754405e-07, | |
| "loss": 5.7062, | |
| "step": 4880 | |
| }, | |
| { | |
| "epoch": 2.873090481786134, | |
| "grad_norm": 1.8269391059875488, | |
| "learning_rate": 4.254994124559342e-07, | |
| "loss": 5.8407, | |
| "step": 4890 | |
| }, | |
| { | |
| "epoch": 2.8789659224441833, | |
| "grad_norm": 2.041775941848755, | |
| "learning_rate": 4.243243243243243e-07, | |
| "loss": 5.9366, | |
| "step": 4900 | |
| }, | |
| { | |
| "epoch": 2.8789659224441833, | |
| "eval_loss": 1.4636270999908447, | |
| "eval_runtime": 67.4942, | |
| "eval_samples_per_second": 21.246, | |
| "eval_steps_per_second": 2.667, | |
| "step": 4900 | |
| }, | |
| { | |
| "epoch": 2.8848413631022325, | |
| "grad_norm": 1.7362725734710693, | |
| "learning_rate": 4.231492361927144e-07, | |
| "loss": 5.7943, | |
| "step": 4910 | |
| }, | |
| { | |
| "epoch": 2.890716803760282, | |
| "grad_norm": 1.8290835618972778, | |
| "learning_rate": 4.2197414806110456e-07, | |
| "loss": 5.9051, | |
| "step": 4920 | |
| }, | |
| { | |
| "epoch": 2.8965922444183314, | |
| "grad_norm": 1.716813087463379, | |
| "learning_rate": 4.207990599294947e-07, | |
| "loss": 5.9952, | |
| "step": 4930 | |
| }, | |
| { | |
| "epoch": 2.9024676850763806, | |
| "grad_norm": 1.7275757789611816, | |
| "learning_rate": 4.196239717978848e-07, | |
| "loss": 5.7364, | |
| "step": 4940 | |
| }, | |
| { | |
| "epoch": 2.9083431257344303, | |
| "grad_norm": 1.7062081098556519, | |
| "learning_rate": 4.1844888366627497e-07, | |
| "loss": 6.0433, | |
| "step": 4950 | |
| }, | |
| { | |
| "epoch": 2.9083431257344303, | |
| "eval_loss": 1.4636424779891968, | |
| "eval_runtime": 67.363, | |
| "eval_samples_per_second": 21.288, | |
| "eval_steps_per_second": 2.672, | |
| "step": 4950 | |
| }, | |
| { | |
| "epoch": 2.9142185663924796, | |
| "grad_norm": 1.8800413608551025, | |
| "learning_rate": 4.1727379553466507e-07, | |
| "loss": 6.0615, | |
| "step": 4960 | |
| }, | |
| { | |
| "epoch": 2.920094007050529, | |
| "grad_norm": 1.6869240999221802, | |
| "learning_rate": 4.1609870740305517e-07, | |
| "loss": 5.9313, | |
| "step": 4970 | |
| }, | |
| { | |
| "epoch": 2.925969447708578, | |
| "grad_norm": 1.733893632888794, | |
| "learning_rate": 4.149236192714453e-07, | |
| "loss": 5.8278, | |
| "step": 4980 | |
| }, | |
| { | |
| "epoch": 2.9318448883666273, | |
| "grad_norm": 2.009671926498413, | |
| "learning_rate": 4.137485311398355e-07, | |
| "loss": 5.931, | |
| "step": 4990 | |
| }, | |
| { | |
| "epoch": 2.937720329024677, | |
| "grad_norm": 2.2526206970214844, | |
| "learning_rate": 4.1257344300822563e-07, | |
| "loss": 5.8845, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 2.937720329024677, | |
| "eval_loss": 1.4632807970046997, | |
| "eval_runtime": 69.3633, | |
| "eval_samples_per_second": 20.674, | |
| "eval_steps_per_second": 2.595, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 2.943595769682726, | |
| "grad_norm": 1.7864453792572021, | |
| "learning_rate": 4.1139835487661573e-07, | |
| "loss": 5.767, | |
| "step": 5010 | |
| }, | |
| { | |
| "epoch": 2.9494712103407754, | |
| "grad_norm": 1.755837082862854, | |
| "learning_rate": 4.1022326674500584e-07, | |
| "loss": 6.0009, | |
| "step": 5020 | |
| }, | |
| { | |
| "epoch": 2.955346650998825, | |
| "grad_norm": 1.8690998554229736, | |
| "learning_rate": 4.09048178613396e-07, | |
| "loss": 5.9741, | |
| "step": 5030 | |
| }, | |
| { | |
| "epoch": 2.9612220916568743, | |
| "grad_norm": 1.7106729745864868, | |
| "learning_rate": 4.0787309048178614e-07, | |
| "loss": 5.8316, | |
| "step": 5040 | |
| }, | |
| { | |
| "epoch": 2.9670975323149236, | |
| "grad_norm": 2.05641770362854, | |
| "learning_rate": 4.0669800235017625e-07, | |
| "loss": 5.796, | |
| "step": 5050 | |
| }, | |
| { | |
| "epoch": 2.9670975323149236, | |
| "eval_loss": 1.4632810354232788, | |
| "eval_runtime": 67.2478, | |
| "eval_samples_per_second": 21.324, | |
| "eval_steps_per_second": 2.677, | |
| "step": 5050 | |
| }, | |
| { | |
| "epoch": 2.972972972972973, | |
| "grad_norm": 1.9636961221694946, | |
| "learning_rate": 4.055229142185664e-07, | |
| "loss": 5.9396, | |
| "step": 5060 | |
| }, | |
| { | |
| "epoch": 2.9788484136310225, | |
| "grad_norm": 1.9900755882263184, | |
| "learning_rate": 4.043478260869565e-07, | |
| "loss": 5.7244, | |
| "step": 5070 | |
| }, | |
| { | |
| "epoch": 2.9847238542890717, | |
| "grad_norm": 1.7656136751174927, | |
| "learning_rate": 4.031727379553466e-07, | |
| "loss": 6.0377, | |
| "step": 5080 | |
| }, | |
| { | |
| "epoch": 2.990599294947121, | |
| "grad_norm": 2.1417531967163086, | |
| "learning_rate": 4.0199764982373676e-07, | |
| "loss": 5.8221, | |
| "step": 5090 | |
| }, | |
| { | |
| "epoch": 2.9964747356051706, | |
| "grad_norm": 1.6871669292449951, | |
| "learning_rate": 4.008225616921269e-07, | |
| "loss": 5.8345, | |
| "step": 5100 | |
| }, | |
| { | |
| "epoch": 2.9964747356051706, | |
| "eval_loss": 1.4631738662719727, | |
| "eval_runtime": 67.2117, | |
| "eval_samples_per_second": 21.336, | |
| "eval_steps_per_second": 2.678, | |
| "step": 5100 | |
| }, | |
| { | |
| "epoch": 3.00235017626322, | |
| "grad_norm": 1.6874431371688843, | |
| "learning_rate": 3.99647473560517e-07, | |
| "loss": 5.6226, | |
| "step": 5110 | |
| }, | |
| { | |
| "epoch": 3.008225616921269, | |
| "grad_norm": 1.9499021768569946, | |
| "learning_rate": 3.9847238542890717e-07, | |
| "loss": 5.7983, | |
| "step": 5120 | |
| }, | |
| { | |
| "epoch": 3.0141010575793183, | |
| "grad_norm": 1.7841684818267822, | |
| "learning_rate": 3.9729729729729727e-07, | |
| "loss": 5.7704, | |
| "step": 5130 | |
| }, | |
| { | |
| "epoch": 3.0199764982373676, | |
| "grad_norm": 1.7825994491577148, | |
| "learning_rate": 3.9612220916568737e-07, | |
| "loss": 6.1243, | |
| "step": 5140 | |
| }, | |
| { | |
| "epoch": 3.0258519388954173, | |
| "grad_norm": 1.9684655666351318, | |
| "learning_rate": 3.949471210340775e-07, | |
| "loss": 5.9495, | |
| "step": 5150 | |
| }, | |
| { | |
| "epoch": 3.0258519388954173, | |
| "eval_loss": 1.4631444215774536, | |
| "eval_runtime": 67.1653, | |
| "eval_samples_per_second": 21.35, | |
| "eval_steps_per_second": 2.68, | |
| "step": 5150 | |
| }, | |
| { | |
| "epoch": 3.0317273795534665, | |
| "grad_norm": 1.820328712463379, | |
| "learning_rate": 3.937720329024677e-07, | |
| "loss": 5.82, | |
| "step": 5160 | |
| }, | |
| { | |
| "epoch": 3.0376028202115157, | |
| "grad_norm": 1.9277817010879517, | |
| "learning_rate": 3.9259694477085783e-07, | |
| "loss": 5.6194, | |
| "step": 5170 | |
| }, | |
| { | |
| "epoch": 3.0434782608695654, | |
| "grad_norm": 2.056603193283081, | |
| "learning_rate": 3.9142185663924793e-07, | |
| "loss": 6.0018, | |
| "step": 5180 | |
| }, | |
| { | |
| "epoch": 3.0493537015276146, | |
| "grad_norm": 1.9370253086090088, | |
| "learning_rate": 3.9024676850763803e-07, | |
| "loss": 5.869, | |
| "step": 5190 | |
| }, | |
| { | |
| "epoch": 3.055229142185664, | |
| "grad_norm": 1.8661144971847534, | |
| "learning_rate": 3.890716803760282e-07, | |
| "loss": 5.9485, | |
| "step": 5200 | |
| }, | |
| { | |
| "epoch": 3.055229142185664, | |
| "eval_loss": 1.4629672765731812, | |
| "eval_runtime": 67.0872, | |
| "eval_samples_per_second": 21.375, | |
| "eval_steps_per_second": 2.683, | |
| "step": 5200 | |
| }, | |
| { | |
| "epoch": 3.061104582843713, | |
| "grad_norm": 1.7688831090927124, | |
| "learning_rate": 3.8789659224441834e-07, | |
| "loss": 5.9163, | |
| "step": 5210 | |
| }, | |
| { | |
| "epoch": 3.066980023501763, | |
| "grad_norm": 2.025082588195801, | |
| "learning_rate": 3.8672150411280844e-07, | |
| "loss": 5.959, | |
| "step": 5220 | |
| }, | |
| { | |
| "epoch": 3.072855464159812, | |
| "grad_norm": 1.8350175619125366, | |
| "learning_rate": 3.855464159811986e-07, | |
| "loss": 5.7492, | |
| "step": 5230 | |
| }, | |
| { | |
| "epoch": 3.0787309048178613, | |
| "grad_norm": 2.098921298980713, | |
| "learning_rate": 3.843713278495887e-07, | |
| "loss": 6.0287, | |
| "step": 5240 | |
| }, | |
| { | |
| "epoch": 3.0846063454759105, | |
| "grad_norm": 1.5796895027160645, | |
| "learning_rate": 3.831962397179788e-07, | |
| "loss": 5.9429, | |
| "step": 5250 | |
| }, | |
| { | |
| "epoch": 3.0846063454759105, | |
| "eval_loss": 1.4628491401672363, | |
| "eval_runtime": 67.2809, | |
| "eval_samples_per_second": 21.314, | |
| "eval_steps_per_second": 2.675, | |
| "step": 5250 | |
| }, | |
| { | |
| "epoch": 3.09048178613396, | |
| "grad_norm": 1.8605477809906006, | |
| "learning_rate": 3.8202115158636896e-07, | |
| "loss": 5.7176, | |
| "step": 5260 | |
| }, | |
| { | |
| "epoch": 3.0963572267920094, | |
| "grad_norm": 1.938942790031433, | |
| "learning_rate": 3.808460634547591e-07, | |
| "loss": 5.9195, | |
| "step": 5270 | |
| }, | |
| { | |
| "epoch": 3.1022326674500587, | |
| "grad_norm": 2.0489580631256104, | |
| "learning_rate": 3.796709753231492e-07, | |
| "loss": 5.8776, | |
| "step": 5280 | |
| }, | |
| { | |
| "epoch": 3.108108108108108, | |
| "grad_norm": 1.7016371488571167, | |
| "learning_rate": 3.7849588719153937e-07, | |
| "loss": 5.8859, | |
| "step": 5290 | |
| }, | |
| { | |
| "epoch": 3.1139835487661576, | |
| "grad_norm": 2.140580654144287, | |
| "learning_rate": 3.7732079905992947e-07, | |
| "loss": 5.743, | |
| "step": 5300 | |
| }, | |
| { | |
| "epoch": 3.1139835487661576, | |
| "eval_loss": 1.4629240036010742, | |
| "eval_runtime": 67.2129, | |
| "eval_samples_per_second": 21.335, | |
| "eval_steps_per_second": 2.678, | |
| "step": 5300 | |
| }, | |
| { | |
| "epoch": 3.119858989424207, | |
| "grad_norm": 1.872502326965332, | |
| "learning_rate": 3.7614571092831957e-07, | |
| "loss": 5.9483, | |
| "step": 5310 | |
| }, | |
| { | |
| "epoch": 3.125734430082256, | |
| "grad_norm": 2.179497718811035, | |
| "learning_rate": 3.749706227967097e-07, | |
| "loss": 5.7933, | |
| "step": 5320 | |
| }, | |
| { | |
| "epoch": 3.1316098707403057, | |
| "grad_norm": 1.7496691942214966, | |
| "learning_rate": 3.737955346650999e-07, | |
| "loss": 5.892, | |
| "step": 5330 | |
| }, | |
| { | |
| "epoch": 3.137485311398355, | |
| "grad_norm": 1.722602128982544, | |
| "learning_rate": 3.7262044653349003e-07, | |
| "loss": 5.897, | |
| "step": 5340 | |
| }, | |
| { | |
| "epoch": 3.143360752056404, | |
| "grad_norm": 1.8440240621566772, | |
| "learning_rate": 3.7144535840188013e-07, | |
| "loss": 6.0027, | |
| "step": 5350 | |
| }, | |
| { | |
| "epoch": 3.143360752056404, | |
| "eval_loss": 1.4626725912094116, | |
| "eval_runtime": 67.549, | |
| "eval_samples_per_second": 21.229, | |
| "eval_steps_per_second": 2.665, | |
| "step": 5350 | |
| }, | |
| { | |
| "epoch": 3.1492361927144534, | |
| "grad_norm": 1.77263605594635, | |
| "learning_rate": 3.7027027027027023e-07, | |
| "loss": 5.6062, | |
| "step": 5360 | |
| }, | |
| { | |
| "epoch": 3.155111633372503, | |
| "grad_norm": 1.7622977495193481, | |
| "learning_rate": 3.690951821386604e-07, | |
| "loss": 5.9189, | |
| "step": 5370 | |
| }, | |
| { | |
| "epoch": 3.1609870740305523, | |
| "grad_norm": 1.9615147113800049, | |
| "learning_rate": 3.679200940070505e-07, | |
| "loss": 5.77, | |
| "step": 5380 | |
| }, | |
| { | |
| "epoch": 3.1668625146886016, | |
| "grad_norm": 1.7339571714401245, | |
| "learning_rate": 3.6674500587544064e-07, | |
| "loss": 5.6509, | |
| "step": 5390 | |
| }, | |
| { | |
| "epoch": 3.172737955346651, | |
| "grad_norm": 1.9717214107513428, | |
| "learning_rate": 3.655699177438308e-07, | |
| "loss": 5.952, | |
| "step": 5400 | |
| }, | |
| { | |
| "epoch": 3.172737955346651, | |
| "eval_loss": 1.4626277685165405, | |
| "eval_runtime": 67.2483, | |
| "eval_samples_per_second": 21.324, | |
| "eval_steps_per_second": 2.677, | |
| "step": 5400 | |
| }, | |
| { | |
| "epoch": 3.1786133960047005, | |
| "grad_norm": 1.6808756589889526, | |
| "learning_rate": 3.643948296122209e-07, | |
| "loss": 5.9226, | |
| "step": 5410 | |
| }, | |
| { | |
| "epoch": 3.1844888366627497, | |
| "grad_norm": 1.802362084388733, | |
| "learning_rate": 3.63219741480611e-07, | |
| "loss": 5.8396, | |
| "step": 5420 | |
| }, | |
| { | |
| "epoch": 3.190364277320799, | |
| "grad_norm": 2.0765771865844727, | |
| "learning_rate": 3.6204465334900115e-07, | |
| "loss": 5.9202, | |
| "step": 5430 | |
| }, | |
| { | |
| "epoch": 3.196239717978848, | |
| "grad_norm": 1.8261579275131226, | |
| "learning_rate": 3.608695652173913e-07, | |
| "loss": 5.8945, | |
| "step": 5440 | |
| }, | |
| { | |
| "epoch": 3.202115158636898, | |
| "grad_norm": 1.978142261505127, | |
| "learning_rate": 3.596944770857814e-07, | |
| "loss": 6.0232, | |
| "step": 5450 | |
| }, | |
| { | |
| "epoch": 3.202115158636898, | |
| "eval_loss": 1.4625942707061768, | |
| "eval_runtime": 68.053, | |
| "eval_samples_per_second": 21.072, | |
| "eval_steps_per_second": 2.645, | |
| "step": 5450 | |
| }, | |
| { | |
| "epoch": 3.207990599294947, | |
| "grad_norm": 1.7350192070007324, | |
| "learning_rate": 3.5851938895417156e-07, | |
| "loss": 6.0179, | |
| "step": 5460 | |
| }, | |
| { | |
| "epoch": 3.2138660399529964, | |
| "grad_norm": 1.9900667667388916, | |
| "learning_rate": 3.5734430082256167e-07, | |
| "loss": 5.7541, | |
| "step": 5470 | |
| }, | |
| { | |
| "epoch": 3.219741480611046, | |
| "grad_norm": 1.9178911447525024, | |
| "learning_rate": 3.5616921269095177e-07, | |
| "loss": 5.9233, | |
| "step": 5480 | |
| }, | |
| { | |
| "epoch": 3.2256169212690953, | |
| "grad_norm": 1.925896406173706, | |
| "learning_rate": 3.549941245593419e-07, | |
| "loss": 5.8819, | |
| "step": 5490 | |
| }, | |
| { | |
| "epoch": 3.2314923619271445, | |
| "grad_norm": 1.8195209503173828, | |
| "learning_rate": 3.538190364277321e-07, | |
| "loss": 5.799, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 3.2314923619271445, | |
| "eval_loss": 1.4624738693237305, | |
| "eval_runtime": 67.222, | |
| "eval_samples_per_second": 21.332, | |
| "eval_steps_per_second": 2.678, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 3.2373678025851937, | |
| "grad_norm": 1.9356062412261963, | |
| "learning_rate": 3.5264394829612223e-07, | |
| "loss": 5.9717, | |
| "step": 5510 | |
| }, | |
| { | |
| "epoch": 3.2432432432432434, | |
| "grad_norm": 2.2090444564819336, | |
| "learning_rate": 3.5146886016451233e-07, | |
| "loss": 5.9176, | |
| "step": 5520 | |
| }, | |
| { | |
| "epoch": 3.2491186839012927, | |
| "grad_norm": 1.6561217308044434, | |
| "learning_rate": 3.5029377203290243e-07, | |
| "loss": 5.9658, | |
| "step": 5530 | |
| }, | |
| { | |
| "epoch": 3.254994124559342, | |
| "grad_norm": 1.8014518022537231, | |
| "learning_rate": 3.491186839012926e-07, | |
| "loss": 5.9286, | |
| "step": 5540 | |
| }, | |
| { | |
| "epoch": 3.260869565217391, | |
| "grad_norm": 2.0677366256713867, | |
| "learning_rate": 3.479435957696827e-07, | |
| "loss": 5.8748, | |
| "step": 5550 | |
| }, | |
| { | |
| "epoch": 3.260869565217391, | |
| "eval_loss": 1.4624980688095093, | |
| "eval_runtime": 67.2161, | |
| "eval_samples_per_second": 21.334, | |
| "eval_steps_per_second": 2.678, | |
| "step": 5550 | |
| }, | |
| { | |
| "epoch": 3.266745005875441, | |
| "grad_norm": 1.6031136512756348, | |
| "learning_rate": 3.4676850763807284e-07, | |
| "loss": 5.6663, | |
| "step": 5560 | |
| }, | |
| { | |
| "epoch": 3.27262044653349, | |
| "grad_norm": 1.5398238897323608, | |
| "learning_rate": 3.45593419506463e-07, | |
| "loss": 5.9192, | |
| "step": 5570 | |
| }, | |
| { | |
| "epoch": 3.2784958871915393, | |
| "grad_norm": 1.7016900777816772, | |
| "learning_rate": 3.444183313748531e-07, | |
| "loss": 5.7822, | |
| "step": 5580 | |
| }, | |
| { | |
| "epoch": 3.2843713278495885, | |
| "grad_norm": 1.646475076675415, | |
| "learning_rate": 3.432432432432432e-07, | |
| "loss": 5.9348, | |
| "step": 5590 | |
| }, | |
| { | |
| "epoch": 3.290246768507638, | |
| "grad_norm": 1.9710693359375, | |
| "learning_rate": 3.4206815511163335e-07, | |
| "loss": 5.94, | |
| "step": 5600 | |
| }, | |
| { | |
| "epoch": 3.290246768507638, | |
| "eval_loss": 1.4622986316680908, | |
| "eval_runtime": 67.3258, | |
| "eval_samples_per_second": 21.299, | |
| "eval_steps_per_second": 2.674, | |
| "step": 5600 | |
| }, | |
| { | |
| "epoch": 3.2961222091656874, | |
| "grad_norm": 1.9802639484405518, | |
| "learning_rate": 3.408930669800235e-07, | |
| "loss": 5.9262, | |
| "step": 5610 | |
| }, | |
| { | |
| "epoch": 3.3019976498237367, | |
| "grad_norm": 1.9483816623687744, | |
| "learning_rate": 3.397179788484136e-07, | |
| "loss": 5.9497, | |
| "step": 5620 | |
| }, | |
| { | |
| "epoch": 3.3078730904817863, | |
| "grad_norm": 2.1321420669555664, | |
| "learning_rate": 3.3854289071680376e-07, | |
| "loss": 5.9206, | |
| "step": 5630 | |
| }, | |
| { | |
| "epoch": 3.3137485311398356, | |
| "grad_norm": 2.117222547531128, | |
| "learning_rate": 3.3736780258519386e-07, | |
| "loss": 5.8896, | |
| "step": 5640 | |
| }, | |
| { | |
| "epoch": 3.319623971797885, | |
| "grad_norm": 1.7869446277618408, | |
| "learning_rate": 3.3619271445358397e-07, | |
| "loss": 5.745, | |
| "step": 5650 | |
| }, | |
| { | |
| "epoch": 3.319623971797885, | |
| "eval_loss": 1.4623204469680786, | |
| "eval_runtime": 67.2748, | |
| "eval_samples_per_second": 21.316, | |
| "eval_steps_per_second": 2.676, | |
| "step": 5650 | |
| }, | |
| { | |
| "epoch": 3.325499412455934, | |
| "grad_norm": 1.9660139083862305, | |
| "learning_rate": 3.350176263219741e-07, | |
| "loss": 5.8493, | |
| "step": 5660 | |
| }, | |
| { | |
| "epoch": 3.3313748531139837, | |
| "grad_norm": 1.9285929203033447, | |
| "learning_rate": 3.338425381903643e-07, | |
| "loss": 5.7798, | |
| "step": 5670 | |
| }, | |
| { | |
| "epoch": 3.337250293772033, | |
| "grad_norm": 1.9511888027191162, | |
| "learning_rate": 3.3266745005875443e-07, | |
| "loss": 5.9952, | |
| "step": 5680 | |
| }, | |
| { | |
| "epoch": 3.343125734430082, | |
| "grad_norm": 1.659542441368103, | |
| "learning_rate": 3.3149236192714453e-07, | |
| "loss": 5.889, | |
| "step": 5690 | |
| }, | |
| { | |
| "epoch": 3.3490011750881314, | |
| "grad_norm": 1.6342780590057373, | |
| "learning_rate": 3.3031727379553463e-07, | |
| "loss": 5.7368, | |
| "step": 5700 | |
| }, | |
| { | |
| "epoch": 3.3490011750881314, | |
| "eval_loss": 1.462188482284546, | |
| "eval_runtime": 67.3727, | |
| "eval_samples_per_second": 21.285, | |
| "eval_steps_per_second": 2.672, | |
| "step": 5700 | |
| }, | |
| { | |
| "epoch": 3.354876615746181, | |
| "grad_norm": 1.9756345748901367, | |
| "learning_rate": 3.291421856639248e-07, | |
| "loss": 5.7537, | |
| "step": 5710 | |
| }, | |
| { | |
| "epoch": 3.3607520564042304, | |
| "grad_norm": 1.679041862487793, | |
| "learning_rate": 3.279670975323149e-07, | |
| "loss": 5.8132, | |
| "step": 5720 | |
| }, | |
| { | |
| "epoch": 3.3666274970622796, | |
| "grad_norm": 1.6406320333480835, | |
| "learning_rate": 3.2679200940070504e-07, | |
| "loss": 5.8062, | |
| "step": 5730 | |
| }, | |
| { | |
| "epoch": 3.372502937720329, | |
| "grad_norm": 2.1878700256347656, | |
| "learning_rate": 3.256169212690952e-07, | |
| "loss": 5.9283, | |
| "step": 5740 | |
| }, | |
| { | |
| "epoch": 3.3783783783783785, | |
| "grad_norm": 1.7907475233078003, | |
| "learning_rate": 3.244418331374853e-07, | |
| "loss": 5.9412, | |
| "step": 5750 | |
| }, | |
| { | |
| "epoch": 3.3783783783783785, | |
| "eval_loss": 1.4620883464813232, | |
| "eval_runtime": 67.3105, | |
| "eval_samples_per_second": 21.304, | |
| "eval_steps_per_second": 2.674, | |
| "step": 5750 | |
| }, | |
| { | |
| "epoch": 3.3842538190364277, | |
| "grad_norm": 1.8572816848754883, | |
| "learning_rate": 3.232667450058754e-07, | |
| "loss": 5.8449, | |
| "step": 5760 | |
| }, | |
| { | |
| "epoch": 3.390129259694477, | |
| "grad_norm": 1.9807683229446411, | |
| "learning_rate": 3.2209165687426555e-07, | |
| "loss": 5.8463, | |
| "step": 5770 | |
| }, | |
| { | |
| "epoch": 3.3960047003525267, | |
| "grad_norm": 2.1083383560180664, | |
| "learning_rate": 3.2091656874265565e-07, | |
| "loss": 5.7518, | |
| "step": 5780 | |
| }, | |
| { | |
| "epoch": 3.401880141010576, | |
| "grad_norm": 1.8015503883361816, | |
| "learning_rate": 3.197414806110458e-07, | |
| "loss": 6.0802, | |
| "step": 5790 | |
| }, | |
| { | |
| "epoch": 3.407755581668625, | |
| "grad_norm": 1.9593247175216675, | |
| "learning_rate": 3.1856639247943596e-07, | |
| "loss": 5.7689, | |
| "step": 5800 | |
| }, | |
| { | |
| "epoch": 3.407755581668625, | |
| "eval_loss": 1.462052345275879, | |
| "eval_runtime": 67.2848, | |
| "eval_samples_per_second": 21.312, | |
| "eval_steps_per_second": 2.675, | |
| "step": 5800 | |
| }, | |
| { | |
| "epoch": 3.4136310223266744, | |
| "grad_norm": 1.8491374254226685, | |
| "learning_rate": 3.1739130434782606e-07, | |
| "loss": 5.9444, | |
| "step": 5810 | |
| }, | |
| { | |
| "epoch": 3.4195064629847236, | |
| "grad_norm": 1.7238551378250122, | |
| "learning_rate": 3.162162162162162e-07, | |
| "loss": 5.9425, | |
| "step": 5820 | |
| }, | |
| { | |
| "epoch": 3.4253819036427733, | |
| "grad_norm": 1.681721568107605, | |
| "learning_rate": 3.150411280846063e-07, | |
| "loss": 5.7639, | |
| "step": 5830 | |
| }, | |
| { | |
| "epoch": 3.4312573443008225, | |
| "grad_norm": 1.882681131362915, | |
| "learning_rate": 3.1386603995299647e-07, | |
| "loss": 5.925, | |
| "step": 5840 | |
| }, | |
| { | |
| "epoch": 3.4371327849588718, | |
| "grad_norm": 1.8038091659545898, | |
| "learning_rate": 3.1269095182138663e-07, | |
| "loss": 5.7596, | |
| "step": 5850 | |
| }, | |
| { | |
| "epoch": 3.4371327849588718, | |
| "eval_loss": 1.4619789123535156, | |
| "eval_runtime": 67.3524, | |
| "eval_samples_per_second": 21.291, | |
| "eval_steps_per_second": 2.673, | |
| "step": 5850 | |
| }, | |
| { | |
| "epoch": 3.4430082256169214, | |
| "grad_norm": 1.9123611450195312, | |
| "learning_rate": 3.1151586368977673e-07, | |
| "loss": 5.9172, | |
| "step": 5860 | |
| }, | |
| { | |
| "epoch": 3.4488836662749707, | |
| "grad_norm": 1.6836742162704468, | |
| "learning_rate": 3.1034077555816683e-07, | |
| "loss": 5.8407, | |
| "step": 5870 | |
| }, | |
| { | |
| "epoch": 3.45475910693302, | |
| "grad_norm": 1.9502021074295044, | |
| "learning_rate": 3.09165687426557e-07, | |
| "loss": 6.0026, | |
| "step": 5880 | |
| }, | |
| { | |
| "epoch": 3.460634547591069, | |
| "grad_norm": 2.0914485454559326, | |
| "learning_rate": 3.079905992949471e-07, | |
| "loss": 5.9751, | |
| "step": 5890 | |
| }, | |
| { | |
| "epoch": 3.466509988249119, | |
| "grad_norm": 1.6563928127288818, | |
| "learning_rate": 3.0681551116333724e-07, | |
| "loss": 5.6502, | |
| "step": 5900 | |
| }, | |
| { | |
| "epoch": 3.466509988249119, | |
| "eval_loss": 1.4618340730667114, | |
| "eval_runtime": 67.2646, | |
| "eval_samples_per_second": 21.319, | |
| "eval_steps_per_second": 2.676, | |
| "step": 5900 | |
| }, | |
| { | |
| "epoch": 3.472385428907168, | |
| "grad_norm": 1.7382484674453735, | |
| "learning_rate": 3.056404230317274e-07, | |
| "loss": 5.7525, | |
| "step": 5910 | |
| }, | |
| { | |
| "epoch": 3.4782608695652173, | |
| "grad_norm": 1.8393006324768066, | |
| "learning_rate": 3.044653349001175e-07, | |
| "loss": 5.6196, | |
| "step": 5920 | |
| }, | |
| { | |
| "epoch": 3.484136310223267, | |
| "grad_norm": 1.8184826374053955, | |
| "learning_rate": 3.032902467685076e-07, | |
| "loss": 5.7433, | |
| "step": 5930 | |
| }, | |
| { | |
| "epoch": 3.490011750881316, | |
| "grad_norm": 1.9732388257980347, | |
| "learning_rate": 3.0211515863689775e-07, | |
| "loss": 5.8874, | |
| "step": 5940 | |
| }, | |
| { | |
| "epoch": 3.4958871915393654, | |
| "grad_norm": 2.0303008556365967, | |
| "learning_rate": 3.0094007050528785e-07, | |
| "loss": 5.9181, | |
| "step": 5950 | |
| }, | |
| { | |
| "epoch": 3.4958871915393654, | |
| "eval_loss": 1.4617245197296143, | |
| "eval_runtime": 67.3499, | |
| "eval_samples_per_second": 21.292, | |
| "eval_steps_per_second": 2.673, | |
| "step": 5950 | |
| }, | |
| { | |
| "epoch": 3.5017626321974147, | |
| "grad_norm": 1.7813360691070557, | |
| "learning_rate": 2.99764982373678e-07, | |
| "loss": 5.8842, | |
| "step": 5960 | |
| }, | |
| { | |
| "epoch": 3.507638072855464, | |
| "grad_norm": 1.7646697759628296, | |
| "learning_rate": 2.9858989424206816e-07, | |
| "loss": 5.5021, | |
| "step": 5970 | |
| }, | |
| { | |
| "epoch": 3.5135135135135136, | |
| "grad_norm": 1.9409451484680176, | |
| "learning_rate": 2.9741480611045826e-07, | |
| "loss": 5.8135, | |
| "step": 5980 | |
| }, | |
| { | |
| "epoch": 3.519388954171563, | |
| "grad_norm": 1.96255624294281, | |
| "learning_rate": 2.962397179788484e-07, | |
| "loss": 5.9597, | |
| "step": 5990 | |
| }, | |
| { | |
| "epoch": 3.525264394829612, | |
| "grad_norm": 1.9019967317581177, | |
| "learning_rate": 2.950646298472385e-07, | |
| "loss": 5.8966, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 3.525264394829612, | |
| "eval_loss": 1.4617407321929932, | |
| "eval_runtime": 67.4776, | |
| "eval_samples_per_second": 21.251, | |
| "eval_steps_per_second": 2.668, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 3.5311398354876617, | |
| "grad_norm": 1.9315980672836304, | |
| "learning_rate": 2.9388954171562867e-07, | |
| "loss": 5.9795, | |
| "step": 6010 | |
| }, | |
| { | |
| "epoch": 3.537015276145711, | |
| "grad_norm": 1.920632243156433, | |
| "learning_rate": 2.927144535840188e-07, | |
| "loss": 5.8567, | |
| "step": 6020 | |
| }, | |
| { | |
| "epoch": 3.54289071680376, | |
| "grad_norm": 1.9164453744888306, | |
| "learning_rate": 2.9153936545240893e-07, | |
| "loss": 5.895, | |
| "step": 6030 | |
| }, | |
| { | |
| "epoch": 3.5487661574618095, | |
| "grad_norm": 1.761549949645996, | |
| "learning_rate": 2.9036427732079903e-07, | |
| "loss": 6.036, | |
| "step": 6040 | |
| }, | |
| { | |
| "epoch": 3.554641598119859, | |
| "grad_norm": 1.8866323232650757, | |
| "learning_rate": 2.891891891891892e-07, | |
| "loss": 5.9864, | |
| "step": 6050 | |
| }, | |
| { | |
| "epoch": 3.554641598119859, | |
| "eval_loss": 1.4616913795471191, | |
| "eval_runtime": 67.2721, | |
| "eval_samples_per_second": 21.316, | |
| "eval_steps_per_second": 2.676, | |
| "step": 6050 | |
| }, | |
| { | |
| "epoch": 3.5605170387779084, | |
| "grad_norm": 1.8041138648986816, | |
| "learning_rate": 2.880141010575793e-07, | |
| "loss": 5.854, | |
| "step": 6060 | |
| }, | |
| { | |
| "epoch": 3.5663924794359576, | |
| "grad_norm": 2.0642271041870117, | |
| "learning_rate": 2.8683901292596944e-07, | |
| "loss": 5.8082, | |
| "step": 6070 | |
| }, | |
| { | |
| "epoch": 3.5722679200940073, | |
| "grad_norm": 2.4056267738342285, | |
| "learning_rate": 2.856639247943596e-07, | |
| "loss": 5.8928, | |
| "step": 6080 | |
| }, | |
| { | |
| "epoch": 3.5781433607520565, | |
| "grad_norm": 2.040055274963379, | |
| "learning_rate": 2.844888366627497e-07, | |
| "loss": 5.7473, | |
| "step": 6090 | |
| }, | |
| { | |
| "epoch": 3.5840188014101058, | |
| "grad_norm": 1.7047302722930908, | |
| "learning_rate": 2.833137485311398e-07, | |
| "loss": 5.9143, | |
| "step": 6100 | |
| }, | |
| { | |
| "epoch": 3.5840188014101058, | |
| "eval_loss": 1.4616738557815552, | |
| "eval_runtime": 67.3074, | |
| "eval_samples_per_second": 21.305, | |
| "eval_steps_per_second": 2.674, | |
| "step": 6100 | |
| }, | |
| { | |
| "epoch": 3.589894242068155, | |
| "grad_norm": 1.9022328853607178, | |
| "learning_rate": 2.8213866039952995e-07, | |
| "loss": 5.9284, | |
| "step": 6110 | |
| }, | |
| { | |
| "epoch": 3.5957696827262042, | |
| "grad_norm": 1.7916126251220703, | |
| "learning_rate": 2.8096357226792005e-07, | |
| "loss": 5.8873, | |
| "step": 6120 | |
| }, | |
| { | |
| "epoch": 3.601645123384254, | |
| "grad_norm": 1.954274296760559, | |
| "learning_rate": 2.7978848413631026e-07, | |
| "loss": 5.8389, | |
| "step": 6130 | |
| }, | |
| { | |
| "epoch": 3.607520564042303, | |
| "grad_norm": 1.74794602394104, | |
| "learning_rate": 2.7861339600470036e-07, | |
| "loss": 5.8795, | |
| "step": 6140 | |
| }, | |
| { | |
| "epoch": 3.6133960047003524, | |
| "grad_norm": 1.8686721324920654, | |
| "learning_rate": 2.7743830787309046e-07, | |
| "loss": 5.7894, | |
| "step": 6150 | |
| }, | |
| { | |
| "epoch": 3.6133960047003524, | |
| "eval_loss": 1.4615228176116943, | |
| "eval_runtime": 67.2128, | |
| "eval_samples_per_second": 21.335, | |
| "eval_steps_per_second": 2.678, | |
| "step": 6150 | |
| }, | |
| { | |
| "epoch": 3.619271445358402, | |
| "grad_norm": 1.8556008338928223, | |
| "learning_rate": 2.762632197414806e-07, | |
| "loss": 5.8837, | |
| "step": 6160 | |
| }, | |
| { | |
| "epoch": 3.6251468860164513, | |
| "grad_norm": 1.8632394075393677, | |
| "learning_rate": 2.750881316098707e-07, | |
| "loss": 5.9041, | |
| "step": 6170 | |
| }, | |
| { | |
| "epoch": 3.6310223266745005, | |
| "grad_norm": 1.7999444007873535, | |
| "learning_rate": 2.739130434782608e-07, | |
| "loss": 5.8486, | |
| "step": 6180 | |
| }, | |
| { | |
| "epoch": 3.6368977673325498, | |
| "grad_norm": 1.9313387870788574, | |
| "learning_rate": 2.72737955346651e-07, | |
| "loss": 5.9457, | |
| "step": 6190 | |
| }, | |
| { | |
| "epoch": 3.6427732079905994, | |
| "grad_norm": 2.07930064201355, | |
| "learning_rate": 2.7156286721504113e-07, | |
| "loss": 5.8247, | |
| "step": 6200 | |
| }, | |
| { | |
| "epoch": 3.6427732079905994, | |
| "eval_loss": 1.461436152458191, | |
| "eval_runtime": 67.263, | |
| "eval_samples_per_second": 21.319, | |
| "eval_steps_per_second": 2.676, | |
| "step": 6200 | |
| }, | |
| { | |
| "epoch": 3.6486486486486487, | |
| "grad_norm": 2.2443180084228516, | |
| "learning_rate": 2.7038777908343123e-07, | |
| "loss": 6.1853, | |
| "step": 6210 | |
| }, | |
| { | |
| "epoch": 3.654524089306698, | |
| "grad_norm": 1.9109710454940796, | |
| "learning_rate": 2.692126909518214e-07, | |
| "loss": 5.9959, | |
| "step": 6220 | |
| }, | |
| { | |
| "epoch": 3.6603995299647476, | |
| "grad_norm": 1.809380292892456, | |
| "learning_rate": 2.680376028202115e-07, | |
| "loss": 5.7262, | |
| "step": 6230 | |
| }, | |
| { | |
| "epoch": 3.666274970622797, | |
| "grad_norm": 1.8630945682525635, | |
| "learning_rate": 2.6686251468860164e-07, | |
| "loss": 5.8591, | |
| "step": 6240 | |
| }, | |
| { | |
| "epoch": 3.672150411280846, | |
| "grad_norm": 1.8457863330841064, | |
| "learning_rate": 2.656874265569918e-07, | |
| "loss": 5.8961, | |
| "step": 6250 | |
| }, | |
| { | |
| "epoch": 3.672150411280846, | |
| "eval_loss": 1.4614366292953491, | |
| "eval_runtime": 67.434, | |
| "eval_samples_per_second": 21.265, | |
| "eval_steps_per_second": 2.669, | |
| "step": 6250 | |
| }, | |
| { | |
| "epoch": 3.6780258519388953, | |
| "grad_norm": 1.829138994216919, | |
| "learning_rate": 2.645123384253819e-07, | |
| "loss": 6.0951, | |
| "step": 6260 | |
| }, | |
| { | |
| "epoch": 3.6839012925969445, | |
| "grad_norm": 2.01283860206604, | |
| "learning_rate": 2.63337250293772e-07, | |
| "loss": 5.8845, | |
| "step": 6270 | |
| }, | |
| { | |
| "epoch": 3.6897767332549942, | |
| "grad_norm": 1.7411574125289917, | |
| "learning_rate": 2.6216216216216215e-07, | |
| "loss": 5.8118, | |
| "step": 6280 | |
| }, | |
| { | |
| "epoch": 3.6956521739130435, | |
| "grad_norm": 2.0445363521575928, | |
| "learning_rate": 2.6098707403055225e-07, | |
| "loss": 6.0719, | |
| "step": 6290 | |
| }, | |
| { | |
| "epoch": 3.7015276145710927, | |
| "grad_norm": 1.6012552976608276, | |
| "learning_rate": 2.5981198589894246e-07, | |
| "loss": 5.9107, | |
| "step": 6300 | |
| }, | |
| { | |
| "epoch": 3.7015276145710927, | |
| "eval_loss": 1.4612646102905273, | |
| "eval_runtime": 67.3397, | |
| "eval_samples_per_second": 21.295, | |
| "eval_steps_per_second": 2.673, | |
| "step": 6300 | |
| }, | |
| { | |
| "epoch": 3.7074030552291424, | |
| "grad_norm": 1.668100357055664, | |
| "learning_rate": 2.5863689776733256e-07, | |
| "loss": 5.7761, | |
| "step": 6310 | |
| }, | |
| { | |
| "epoch": 3.7132784958871916, | |
| "grad_norm": 1.8935034275054932, | |
| "learning_rate": 2.5746180963572266e-07, | |
| "loss": 5.6924, | |
| "step": 6320 | |
| }, | |
| { | |
| "epoch": 3.719153936545241, | |
| "grad_norm": 1.6541757583618164, | |
| "learning_rate": 2.562867215041128e-07, | |
| "loss": 5.798, | |
| "step": 6330 | |
| }, | |
| { | |
| "epoch": 3.72502937720329, | |
| "grad_norm": 1.9191126823425293, | |
| "learning_rate": 2.551116333725029e-07, | |
| "loss": 5.7736, | |
| "step": 6340 | |
| }, | |
| { | |
| "epoch": 3.7309048178613398, | |
| "grad_norm": 1.6552644968032837, | |
| "learning_rate": 2.53936545240893e-07, | |
| "loss": 5.8405, | |
| "step": 6350 | |
| }, | |
| { | |
| "epoch": 3.7309048178613398, | |
| "eval_loss": 1.4613573551177979, | |
| "eval_runtime": 68.3662, | |
| "eval_samples_per_second": 20.975, | |
| "eval_steps_per_second": 2.633, | |
| "step": 6350 | |
| }, | |
| { | |
| "epoch": 3.736780258519389, | |
| "grad_norm": 1.8980045318603516, | |
| "learning_rate": 2.527614571092832e-07, | |
| "loss": 5.9485, | |
| "step": 6360 | |
| }, | |
| { | |
| "epoch": 3.7426556991774382, | |
| "grad_norm": 1.8480231761932373, | |
| "learning_rate": 2.515863689776733e-07, | |
| "loss": 5.7251, | |
| "step": 6370 | |
| }, | |
| { | |
| "epoch": 3.748531139835488, | |
| "grad_norm": 2.0423247814178467, | |
| "learning_rate": 2.5041128084606343e-07, | |
| "loss": 5.9523, | |
| "step": 6380 | |
| }, | |
| { | |
| "epoch": 3.754406580493537, | |
| "grad_norm": 1.9046651124954224, | |
| "learning_rate": 2.492361927144536e-07, | |
| "loss": 6.1359, | |
| "step": 6390 | |
| }, | |
| { | |
| "epoch": 3.7602820211515864, | |
| "grad_norm": 1.644461989402771, | |
| "learning_rate": 2.4806110458284374e-07, | |
| "loss": 5.8119, | |
| "step": 6400 | |
| }, | |
| { | |
| "epoch": 3.7602820211515864, | |
| "eval_loss": 1.4611767530441284, | |
| "eval_runtime": 67.7542, | |
| "eval_samples_per_second": 21.165, | |
| "eval_steps_per_second": 2.657, | |
| "step": 6400 | |
| }, | |
| { | |
| "epoch": 3.7661574618096356, | |
| "grad_norm": 1.9219424724578857, | |
| "learning_rate": 2.4688601645123384e-07, | |
| "loss": 5.7408, | |
| "step": 6410 | |
| }, | |
| { | |
| "epoch": 3.772032902467685, | |
| "grad_norm": 2.5688843727111816, | |
| "learning_rate": 2.4571092831962394e-07, | |
| "loss": 5.858, | |
| "step": 6420 | |
| }, | |
| { | |
| "epoch": 3.7779083431257345, | |
| "grad_norm": 1.7739956378936768, | |
| "learning_rate": 2.445358401880141e-07, | |
| "loss": 6.0526, | |
| "step": 6430 | |
| }, | |
| { | |
| "epoch": 3.7837837837837838, | |
| "grad_norm": 1.7807574272155762, | |
| "learning_rate": 2.433607520564042e-07, | |
| "loss": 5.7706, | |
| "step": 6440 | |
| }, | |
| { | |
| "epoch": 3.789659224441833, | |
| "grad_norm": 1.7440868616104126, | |
| "learning_rate": 2.4218566392479435e-07, | |
| "loss": 5.9321, | |
| "step": 6450 | |
| }, | |
| { | |
| "epoch": 3.789659224441833, | |
| "eval_loss": 1.461159110069275, | |
| "eval_runtime": 67.3392, | |
| "eval_samples_per_second": 21.295, | |
| "eval_steps_per_second": 2.673, | |
| "step": 6450 | |
| }, | |
| { | |
| "epoch": 3.7955346650998827, | |
| "grad_norm": 1.6572002172470093, | |
| "learning_rate": 2.410105757931845e-07, | |
| "loss": 5.83, | |
| "step": 6460 | |
| }, | |
| { | |
| "epoch": 3.801410105757932, | |
| "grad_norm": 2.195672035217285, | |
| "learning_rate": 2.398354876615746e-07, | |
| "loss": 5.8685, | |
| "step": 6470 | |
| }, | |
| { | |
| "epoch": 3.807285546415981, | |
| "grad_norm": 1.828194260597229, | |
| "learning_rate": 2.386603995299647e-07, | |
| "loss": 5.8451, | |
| "step": 6480 | |
| }, | |
| { | |
| "epoch": 3.8131609870740304, | |
| "grad_norm": 1.9797534942626953, | |
| "learning_rate": 2.3748531139835486e-07, | |
| "loss": 5.8433, | |
| "step": 6490 | |
| }, | |
| { | |
| "epoch": 3.8190364277320796, | |
| "grad_norm": 1.7732436656951904, | |
| "learning_rate": 2.3631022326674499e-07, | |
| "loss": 5.936, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 3.8190364277320796, | |
| "eval_loss": 1.4612115621566772, | |
| "eval_runtime": 67.3159, | |
| "eval_samples_per_second": 21.303, | |
| "eval_steps_per_second": 2.674, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 3.8249118683901293, | |
| "grad_norm": 1.738011360168457, | |
| "learning_rate": 2.3513513513513514e-07, | |
| "loss": 5.9119, | |
| "step": 6510 | |
| }, | |
| { | |
| "epoch": 3.8307873090481785, | |
| "grad_norm": 2.1319050788879395, | |
| "learning_rate": 2.3396004700352527e-07, | |
| "loss": 5.7625, | |
| "step": 6520 | |
| }, | |
| { | |
| "epoch": 3.8366627497062282, | |
| "grad_norm": 1.9762002229690552, | |
| "learning_rate": 2.3278495887191537e-07, | |
| "loss": 5.8969, | |
| "step": 6530 | |
| }, | |
| { | |
| "epoch": 3.8425381903642775, | |
| "grad_norm": 1.8025697469711304, | |
| "learning_rate": 2.3160987074030552e-07, | |
| "loss": 5.7755, | |
| "step": 6540 | |
| }, | |
| { | |
| "epoch": 3.8484136310223267, | |
| "grad_norm": 1.8634493350982666, | |
| "learning_rate": 2.3043478260869565e-07, | |
| "loss": 5.7939, | |
| "step": 6550 | |
| }, | |
| { | |
| "epoch": 3.8484136310223267, | |
| "eval_loss": 1.4610487222671509, | |
| "eval_runtime": 67.3671, | |
| "eval_samples_per_second": 21.286, | |
| "eval_steps_per_second": 2.672, | |
| "step": 6550 | |
| }, | |
| { | |
| "epoch": 3.854289071680376, | |
| "grad_norm": 2.1296660900115967, | |
| "learning_rate": 2.2925969447708575e-07, | |
| "loss": 5.8576, | |
| "step": 6560 | |
| }, | |
| { | |
| "epoch": 3.860164512338425, | |
| "grad_norm": 2.249799966812134, | |
| "learning_rate": 2.280846063454759e-07, | |
| "loss": 5.9107, | |
| "step": 6570 | |
| }, | |
| { | |
| "epoch": 3.866039952996475, | |
| "grad_norm": 1.938138723373413, | |
| "learning_rate": 2.2690951821386604e-07, | |
| "loss": 5.7601, | |
| "step": 6580 | |
| }, | |
| { | |
| "epoch": 3.871915393654524, | |
| "grad_norm": 1.7803981304168701, | |
| "learning_rate": 2.2573443008225614e-07, | |
| "loss": 5.8213, | |
| "step": 6590 | |
| }, | |
| { | |
| "epoch": 3.8777908343125733, | |
| "grad_norm": 1.6013925075531006, | |
| "learning_rate": 2.245593419506463e-07, | |
| "loss": 5.8792, | |
| "step": 6600 | |
| }, | |
| { | |
| "epoch": 3.8777908343125733, | |
| "eval_loss": 1.4610427618026733, | |
| "eval_runtime": 67.2577, | |
| "eval_samples_per_second": 21.321, | |
| "eval_steps_per_second": 2.676, | |
| "step": 6600 | |
| }, | |
| { | |
| "epoch": 3.883666274970623, | |
| "grad_norm": 2.0687365531921387, | |
| "learning_rate": 2.2338425381903642e-07, | |
| "loss": 5.7506, | |
| "step": 6610 | |
| }, | |
| { | |
| "epoch": 3.8895417156286722, | |
| "grad_norm": 1.913124918937683, | |
| "learning_rate": 2.2220916568742655e-07, | |
| "loss": 5.8087, | |
| "step": 6620 | |
| }, | |
| { | |
| "epoch": 3.8954171562867215, | |
| "grad_norm": 1.6601601839065552, | |
| "learning_rate": 2.2103407755581667e-07, | |
| "loss": 5.7706, | |
| "step": 6630 | |
| }, | |
| { | |
| "epoch": 3.9012925969447707, | |
| "grad_norm": 1.7471449375152588, | |
| "learning_rate": 2.198589894242068e-07, | |
| "loss": 5.9002, | |
| "step": 6640 | |
| }, | |
| { | |
| "epoch": 3.90716803760282, | |
| "grad_norm": 1.875045657157898, | |
| "learning_rate": 2.1868390129259693e-07, | |
| "loss": 5.8144, | |
| "step": 6650 | |
| }, | |
| { | |
| "epoch": 3.90716803760282, | |
| "eval_loss": 1.4610403776168823, | |
| "eval_runtime": 67.3072, | |
| "eval_samples_per_second": 21.305, | |
| "eval_steps_per_second": 2.674, | |
| "step": 6650 | |
| }, | |
| { | |
| "epoch": 3.9130434782608696, | |
| "grad_norm": 1.9555529356002808, | |
| "learning_rate": 2.1750881316098706e-07, | |
| "loss": 6.0214, | |
| "step": 6660 | |
| }, | |
| { | |
| "epoch": 3.918918918918919, | |
| "grad_norm": 1.9561495780944824, | |
| "learning_rate": 2.1633372502937719e-07, | |
| "loss": 5.984, | |
| "step": 6670 | |
| }, | |
| { | |
| "epoch": 3.9247943595769685, | |
| "grad_norm": 1.739403247833252, | |
| "learning_rate": 2.1515863689776731e-07, | |
| "loss": 5.9714, | |
| "step": 6680 | |
| }, | |
| { | |
| "epoch": 3.9306698002350178, | |
| "grad_norm": 1.620549201965332, | |
| "learning_rate": 2.1398354876615747e-07, | |
| "loss": 5.88, | |
| "step": 6690 | |
| }, | |
| { | |
| "epoch": 3.936545240893067, | |
| "grad_norm": 1.9505090713500977, | |
| "learning_rate": 2.1280846063454757e-07, | |
| "loss": 5.7891, | |
| "step": 6700 | |
| }, | |
| { | |
| "epoch": 3.936545240893067, | |
| "eval_loss": 1.4608731269836426, | |
| "eval_runtime": 68.119, | |
| "eval_samples_per_second": 21.051, | |
| "eval_steps_per_second": 2.642, | |
| "step": 6700 | |
| }, | |
| { | |
| "epoch": 3.9424206815511162, | |
| "grad_norm": 1.7288826704025269, | |
| "learning_rate": 2.1163337250293772e-07, | |
| "loss": 5.9777, | |
| "step": 6710 | |
| }, | |
| { | |
| "epoch": 3.9482961222091655, | |
| "grad_norm": 1.8516991138458252, | |
| "learning_rate": 2.1045828437132785e-07, | |
| "loss": 5.7113, | |
| "step": 6720 | |
| }, | |
| { | |
| "epoch": 3.954171562867215, | |
| "grad_norm": 1.7342356443405151, | |
| "learning_rate": 2.0928319623971795e-07, | |
| "loss": 5.7252, | |
| "step": 6730 | |
| }, | |
| { | |
| "epoch": 3.9600470035252644, | |
| "grad_norm": 1.5385229587554932, | |
| "learning_rate": 2.081081081081081e-07, | |
| "loss": 5.8457, | |
| "step": 6740 | |
| }, | |
| { | |
| "epoch": 3.9659224441833136, | |
| "grad_norm": 1.548790693283081, | |
| "learning_rate": 2.0693301997649823e-07, | |
| "loss": 5.7167, | |
| "step": 6750 | |
| }, | |
| { | |
| "epoch": 3.9659224441833136, | |
| "eval_loss": 1.4608203172683716, | |
| "eval_runtime": 67.3467, | |
| "eval_samples_per_second": 21.293, | |
| "eval_steps_per_second": 2.673, | |
| "step": 6750 | |
| }, | |
| { | |
| "epoch": 3.9717978848413633, | |
| "grad_norm": 1.6528300046920776, | |
| "learning_rate": 2.0575793184488836e-07, | |
| "loss": 5.9047, | |
| "step": 6760 | |
| }, | |
| { | |
| "epoch": 3.9776733254994125, | |
| "grad_norm": 1.8215575218200684, | |
| "learning_rate": 2.045828437132785e-07, | |
| "loss": 6.0313, | |
| "step": 6770 | |
| }, | |
| { | |
| "epoch": 3.983548766157462, | |
| "grad_norm": 1.7826635837554932, | |
| "learning_rate": 2.0340775558166862e-07, | |
| "loss": 5.9478, | |
| "step": 6780 | |
| }, | |
| { | |
| "epoch": 3.989424206815511, | |
| "grad_norm": 1.5644893646240234, | |
| "learning_rate": 2.0223266745005875e-07, | |
| "loss": 5.8306, | |
| "step": 6790 | |
| }, | |
| { | |
| "epoch": 3.9952996474735603, | |
| "grad_norm": 1.9673813581466675, | |
| "learning_rate": 2.0105757931844887e-07, | |
| "loss": 5.826, | |
| "step": 6800 | |
| }, | |
| { | |
| "epoch": 3.9952996474735603, | |
| "eval_loss": 1.4608874320983887, | |
| "eval_runtime": 67.3633, | |
| "eval_samples_per_second": 21.288, | |
| "eval_steps_per_second": 2.672, | |
| "step": 6800 | |
| }, | |
| { | |
| "epoch": 4.0011750881316095, | |
| "grad_norm": 1.796644926071167, | |
| "learning_rate": 1.99882491186839e-07, | |
| "loss": 5.9259, | |
| "step": 6810 | |
| }, | |
| { | |
| "epoch": 4.00705052878966, | |
| "grad_norm": 1.6265869140625, | |
| "learning_rate": 1.9870740305522913e-07, | |
| "loss": 5.8435, | |
| "step": 6820 | |
| }, | |
| { | |
| "epoch": 4.012925969447709, | |
| "grad_norm": 1.6663663387298584, | |
| "learning_rate": 1.9753231492361926e-07, | |
| "loss": 5.6056, | |
| "step": 6830 | |
| }, | |
| { | |
| "epoch": 4.018801410105758, | |
| "grad_norm": 2.006054401397705, | |
| "learning_rate": 1.9635722679200938e-07, | |
| "loss": 5.8087, | |
| "step": 6840 | |
| }, | |
| { | |
| "epoch": 4.024676850763807, | |
| "grad_norm": 1.7286150455474854, | |
| "learning_rate": 1.951821386603995e-07, | |
| "loss": 5.9072, | |
| "step": 6850 | |
| }, | |
| { | |
| "epoch": 4.024676850763807, | |
| "eval_loss": 1.4607393741607666, | |
| "eval_runtime": 67.3237, | |
| "eval_samples_per_second": 21.3, | |
| "eval_steps_per_second": 2.674, | |
| "step": 6850 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 8510, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 5, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "EarlyStoppingCallback": { | |
| "args": { | |
| "early_stopping_patience": 2, | |
| "early_stopping_threshold": 0.0 | |
| }, | |
| "attributes": { | |
| "early_stopping_patience_counter": 0 | |
| } | |
| }, | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 4.788240289615577e+18, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |