Instructions to use jay2219/Q-Route-70B with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use jay2219/Q-Route-70B with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("togethercomputer/Meta-Llama-3.3-70B-Instruct-Reference") model = PeftModel.from_pretrained(base_model, "jay2219/Q-Route-70B") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 2.0, | |
| "eval_steps": 80, | |
| "global_step": 400, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.005, | |
| "grad_norm": 0.15680274367332458, | |
| "learning_rate": 0.0, | |
| "loss": 0.144775390625, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.01, | |
| "grad_norm": 0.15471383929252625, | |
| "learning_rate": 5e-06, | |
| "loss": 0.13623046875, | |
| "step": 2 | |
| }, | |
| { | |
| "epoch": 0.015, | |
| "grad_norm": 0.16802309453487396, | |
| "learning_rate": 1e-05, | |
| "loss": 0.13482666015625, | |
| "step": 3 | |
| }, | |
| { | |
| "epoch": 0.02, | |
| "grad_norm": 0.12738408148288727, | |
| "learning_rate": 1.5e-05, | |
| "loss": 0.13458251953125, | |
| "step": 4 | |
| }, | |
| { | |
| "epoch": 0.025, | |
| "grad_norm": 0.10133010149002075, | |
| "learning_rate": 2e-05, | |
| "loss": 0.12884521484375, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.03, | |
| "grad_norm": 0.060088176280260086, | |
| "learning_rate": 2.5e-05, | |
| "loss": 0.099334716796875, | |
| "step": 6 | |
| }, | |
| { | |
| "epoch": 0.035, | |
| "grad_norm": 0.06896929442882538, | |
| "learning_rate": 3e-05, | |
| "loss": 0.08770751953125, | |
| "step": 7 | |
| }, | |
| { | |
| "epoch": 0.04, | |
| "grad_norm": 0.060252595692873, | |
| "learning_rate": 3.5e-05, | |
| "loss": 0.13433837890625, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 0.045, | |
| "grad_norm": 0.036323413252830505, | |
| "learning_rate": 4e-05, | |
| "loss": 0.0687255859375, | |
| "step": 9 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "grad_norm": 0.05082182213664055, | |
| "learning_rate": 4.5e-05, | |
| "loss": 0.09259033203125, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.055, | |
| "grad_norm": 0.03914697468280792, | |
| "learning_rate": 5e-05, | |
| "loss": 0.05977630615234375, | |
| "step": 11 | |
| }, | |
| { | |
| "epoch": 0.06, | |
| "grad_norm": 0.04393604397773743, | |
| "learning_rate": 5.500000000000001e-05, | |
| "loss": 0.06298828125, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 0.065, | |
| "grad_norm": 0.040235262364149094, | |
| "learning_rate": 6e-05, | |
| "loss": 0.094696044921875, | |
| "step": 13 | |
| }, | |
| { | |
| "epoch": 0.07, | |
| "grad_norm": 0.035069484263658524, | |
| "learning_rate": 6.500000000000001e-05, | |
| "loss": 0.0823974609375, | |
| "step": 14 | |
| }, | |
| { | |
| "epoch": 0.075, | |
| "grad_norm": 0.03388446569442749, | |
| "learning_rate": 7e-05, | |
| "loss": 0.0683746337890625, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 0.030936958268284798, | |
| "learning_rate": 7.500000000000001e-05, | |
| "loss": 0.0635986328125, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 0.085, | |
| "grad_norm": 0.060820236802101135, | |
| "learning_rate": 8e-05, | |
| "loss": 0.065277099609375, | |
| "step": 17 | |
| }, | |
| { | |
| "epoch": 0.09, | |
| "grad_norm": 0.04122919216752052, | |
| "learning_rate": 8.5e-05, | |
| "loss": 0.078216552734375, | |
| "step": 18 | |
| }, | |
| { | |
| "epoch": 0.095, | |
| "grad_norm": 0.04100744053721428, | |
| "learning_rate": 9e-05, | |
| "loss": 0.062774658203125, | |
| "step": 19 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 0.035049788653850555, | |
| "learning_rate": 9.5e-05, | |
| "loss": 0.0718994140625, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.105, | |
| "grad_norm": 0.021961010992527008, | |
| "learning_rate": 0.0001, | |
| "loss": 0.055572509765625, | |
| "step": 21 | |
| }, | |
| { | |
| "epoch": 0.11, | |
| "grad_norm": 0.03183983638882637, | |
| "learning_rate": 9.999846215488786e-05, | |
| "loss": 0.068115234375, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 0.115, | |
| "grad_norm": 0.03052438609302044, | |
| "learning_rate": 9.999384872466111e-05, | |
| "loss": 0.072967529296875, | |
| "step": 23 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 0.035542961210012436, | |
| "learning_rate": 9.998616002464157e-05, | |
| "loss": 0.0618896484375, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 0.125, | |
| "grad_norm": 0.030043089762330055, | |
| "learning_rate": 9.997539658034168e-05, | |
| "loss": 0.064727783203125, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.13, | |
| "grad_norm": 0.023587681353092194, | |
| "learning_rate": 9.996155912742855e-05, | |
| "loss": 0.053131103515625, | |
| "step": 26 | |
| }, | |
| { | |
| "epoch": 0.135, | |
| "grad_norm": 0.022438321262598038, | |
| "learning_rate": 9.994464861167372e-05, | |
| "loss": 0.054168701171875, | |
| "step": 27 | |
| }, | |
| { | |
| "epoch": 0.14, | |
| "grad_norm": 0.03795755282044411, | |
| "learning_rate": 9.992466618888847e-05, | |
| "loss": 0.059478759765625, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 0.145, | |
| "grad_norm": 0.021761983633041382, | |
| "learning_rate": 9.990161322484486e-05, | |
| "loss": 0.05206298828125, | |
| "step": 29 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "grad_norm": 0.026853321120142937, | |
| "learning_rate": 9.987549129518235e-05, | |
| "loss": 0.048126220703125, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.155, | |
| "grad_norm": 0.022847812622785568, | |
| "learning_rate": 9.984630218530014e-05, | |
| "loss": 0.04364013671875, | |
| "step": 31 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 0.031377874314785004, | |
| "learning_rate": 9.981404789023512e-05, | |
| "loss": 0.0525054931640625, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 0.165, | |
| "grad_norm": 0.03190525993704796, | |
| "learning_rate": 9.977873061452552e-05, | |
| "loss": 0.060882568359375, | |
| "step": 33 | |
| }, | |
| { | |
| "epoch": 0.17, | |
| "grad_norm": 0.028999412432312965, | |
| "learning_rate": 9.974035277206021e-05, | |
| "loss": 0.0458221435546875, | |
| "step": 34 | |
| }, | |
| { | |
| "epoch": 0.175, | |
| "grad_norm": 0.022387295961380005, | |
| "learning_rate": 9.969891698591372e-05, | |
| "loss": 0.0454254150390625, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "grad_norm": 0.02159653790295124, | |
| "learning_rate": 9.965442608816703e-05, | |
| "loss": 0.0605316162109375, | |
| "step": 36 | |
| }, | |
| { | |
| "epoch": 0.185, | |
| "grad_norm": 0.027492763474583626, | |
| "learning_rate": 9.96068831197139e-05, | |
| "loss": 0.05517578125, | |
| "step": 37 | |
| }, | |
| { | |
| "epoch": 0.19, | |
| "grad_norm": 0.031047804281115532, | |
| "learning_rate": 9.955629133005302e-05, | |
| "loss": 0.06964111328125, | |
| "step": 38 | |
| }, | |
| { | |
| "epoch": 0.195, | |
| "grad_norm": 0.022201504558324814, | |
| "learning_rate": 9.950265417706608e-05, | |
| "loss": 0.0394287109375, | |
| "step": 39 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 0.020365344360470772, | |
| "learning_rate": 9.94459753267812e-05, | |
| "loss": 0.046295166015625, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.205, | |
| "grad_norm": 0.021846065297722816, | |
| "learning_rate": 9.938625865312251e-05, | |
| "loss": 0.0291900634765625, | |
| "step": 41 | |
| }, | |
| { | |
| "epoch": 0.21, | |
| "grad_norm": 0.04813797026872635, | |
| "learning_rate": 9.932350823764534e-05, | |
| "loss": 0.0376739501953125, | |
| "step": 42 | |
| }, | |
| { | |
| "epoch": 0.215, | |
| "grad_norm": 0.020583365112543106, | |
| "learning_rate": 9.92577283692572e-05, | |
| "loss": 0.051177978515625, | |
| "step": 43 | |
| }, | |
| { | |
| "epoch": 0.22, | |
| "grad_norm": 0.022562626749277115, | |
| "learning_rate": 9.918892354392477e-05, | |
| "loss": 0.0485687255859375, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 0.225, | |
| "grad_norm": 0.016049904748797417, | |
| "learning_rate": 9.911709846436641e-05, | |
| "loss": 0.03813934326171875, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 0.23, | |
| "grad_norm": 0.02223113551735878, | |
| "learning_rate": 9.904225803973094e-05, | |
| "loss": 0.03997802734375, | |
| "step": 46 | |
| }, | |
| { | |
| "epoch": 0.235, | |
| "grad_norm": 0.028438566252589226, | |
| "learning_rate": 9.896440738526198e-05, | |
| "loss": 0.056427001953125, | |
| "step": 47 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 0.025392597541213036, | |
| "learning_rate": 9.888355182194829e-05, | |
| "loss": 0.04984283447265625, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 0.245, | |
| "grad_norm": 0.02372913435101509, | |
| "learning_rate": 9.879969687616027e-05, | |
| "loss": 0.047210693359375, | |
| "step": 49 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 0.018541816622018814, | |
| "learning_rate": 9.871284827927205e-05, | |
| "loss": 0.0352325439453125, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.255, | |
| "grad_norm": 0.020503757521510124, | |
| "learning_rate": 9.862301196726987e-05, | |
| "loss": 0.040771484375, | |
| "step": 51 | |
| }, | |
| { | |
| "epoch": 0.26, | |
| "grad_norm": 0.022244155406951904, | |
| "learning_rate": 9.853019408034632e-05, | |
| "loss": 0.041168212890625, | |
| "step": 52 | |
| }, | |
| { | |
| "epoch": 0.265, | |
| "grad_norm": 0.02082468941807747, | |
| "learning_rate": 9.84344009624807e-05, | |
| "loss": 0.0489044189453125, | |
| "step": 53 | |
| }, | |
| { | |
| "epoch": 0.27, | |
| "grad_norm": 0.020852362737059593, | |
| "learning_rate": 9.833563916100533e-05, | |
| "loss": 0.0433807373046875, | |
| "step": 54 | |
| }, | |
| { | |
| "epoch": 0.275, | |
| "grad_norm": 0.016285911202430725, | |
| "learning_rate": 9.823391542615817e-05, | |
| "loss": 0.0467376708984375, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 0.28, | |
| "grad_norm": 0.032904356718063354, | |
| "learning_rate": 9.812923671062138e-05, | |
| "loss": 0.04266357421875, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 0.285, | |
| "grad_norm": 0.025433626025915146, | |
| "learning_rate": 9.80216101690461e-05, | |
| "loss": 0.05548095703125, | |
| "step": 57 | |
| }, | |
| { | |
| "epoch": 0.29, | |
| "grad_norm": 0.025250935927033424, | |
| "learning_rate": 9.791104315756349e-05, | |
| "loss": 0.0398101806640625, | |
| "step": 58 | |
| }, | |
| { | |
| "epoch": 0.295, | |
| "grad_norm": 0.02171344868838787, | |
| "learning_rate": 9.779754323328192e-05, | |
| "loss": 0.04587554931640625, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "grad_norm": 0.016125528141856194, | |
| "learning_rate": 9.768111815377042e-05, | |
| "loss": 0.03900146484375, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.305, | |
| "grad_norm": 0.020586300641298294, | |
| "learning_rate": 9.756177587652856e-05, | |
| "loss": 0.05072021484375, | |
| "step": 61 | |
| }, | |
| { | |
| "epoch": 0.31, | |
| "grad_norm": 0.015897052362561226, | |
| "learning_rate": 9.743952455844245e-05, | |
| "loss": 0.0466156005859375, | |
| "step": 62 | |
| }, | |
| { | |
| "epoch": 0.315, | |
| "grad_norm": 0.01866666041314602, | |
| "learning_rate": 9.731437255522727e-05, | |
| "loss": 0.042781829833984375, | |
| "step": 63 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 0.02183070406317711, | |
| "learning_rate": 9.71863284208562e-05, | |
| "loss": 0.042938232421875, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 0.325, | |
| "grad_norm": 0.013651255518198013, | |
| "learning_rate": 9.705540090697575e-05, | |
| "loss": 0.03275299072265625, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 0.33, | |
| "grad_norm": 0.021585367619991302, | |
| "learning_rate": 9.692159896230756e-05, | |
| "loss": 0.047580718994140625, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 0.335, | |
| "grad_norm": 0.02376355230808258, | |
| "learning_rate": 9.678493173203682e-05, | |
| "loss": 0.044921875, | |
| "step": 67 | |
| }, | |
| { | |
| "epoch": 0.34, | |
| "grad_norm": 0.0204895231872797, | |
| "learning_rate": 9.66454085571872e-05, | |
| "loss": 0.040069580078125, | |
| "step": 68 | |
| }, | |
| { | |
| "epoch": 0.345, | |
| "grad_norm": 0.02624756097793579, | |
| "learning_rate": 9.650303897398232e-05, | |
| "loss": 0.0423736572265625, | |
| "step": 69 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "grad_norm": 0.020928798243403435, | |
| "learning_rate": 9.635783271319409e-05, | |
| "loss": 0.03409576416015625, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.355, | |
| "grad_norm": 0.014311402104794979, | |
| "learning_rate": 9.620979969947759e-05, | |
| "loss": 0.0413970947265625, | |
| "step": 71 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "grad_norm": 0.016797911375761032, | |
| "learning_rate": 9.605895005069262e-05, | |
| "loss": 0.036468505859375, | |
| "step": 72 | |
| }, | |
| { | |
| "epoch": 0.365, | |
| "grad_norm": 0.01776743307709694, | |
| "learning_rate": 9.590529407721231e-05, | |
| "loss": 0.03543853759765625, | |
| "step": 73 | |
| }, | |
| { | |
| "epoch": 0.37, | |
| "grad_norm": 0.014951060526072979, | |
| "learning_rate": 9.574884228121836e-05, | |
| "loss": 0.030670166015625, | |
| "step": 74 | |
| }, | |
| { | |
| "epoch": 0.375, | |
| "grad_norm": 0.020909463986754417, | |
| "learning_rate": 9.558960535598316e-05, | |
| "loss": 0.03610992431640625, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.38, | |
| "grad_norm": 0.021412597969174385, | |
| "learning_rate": 9.542759418513906e-05, | |
| "loss": 0.0379638671875, | |
| "step": 76 | |
| }, | |
| { | |
| "epoch": 0.385, | |
| "grad_norm": 0.017438918352127075, | |
| "learning_rate": 9.526281984193436e-05, | |
| "loss": 0.04095458984375, | |
| "step": 77 | |
| }, | |
| { | |
| "epoch": 0.39, | |
| "grad_norm": 0.026842506602406502, | |
| "learning_rate": 9.509529358847655e-05, | |
| "loss": 0.0329132080078125, | |
| "step": 78 | |
| }, | |
| { | |
| "epoch": 0.395, | |
| "grad_norm": 0.01835726387798786, | |
| "learning_rate": 9.492502687496253e-05, | |
| "loss": 0.0428314208984375, | |
| "step": 79 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 0.013388189487159252, | |
| "learning_rate": 9.4752031338896e-05, | |
| "loss": 0.0354766845703125, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "eval_loss": 0.03489327430725098, | |
| "eval_runtime": 28.3541, | |
| "eval_samples_per_second": 0.952, | |
| "eval_steps_per_second": 0.141, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.405, | |
| "grad_norm": 0.01896721124649048, | |
| "learning_rate": 9.4576318804292e-05, | |
| "loss": 0.040676116943359375, | |
| "step": 81 | |
| }, | |
| { | |
| "epoch": 0.41, | |
| "grad_norm": 0.021692641079425812, | |
| "learning_rate": 9.439790128086894e-05, | |
| "loss": 0.03216552734375, | |
| "step": 82 | |
| }, | |
| { | |
| "epoch": 0.415, | |
| "grad_norm": 0.014553118497133255, | |
| "learning_rate": 9.421679096322747e-05, | |
| "loss": 0.043487548828125, | |
| "step": 83 | |
| }, | |
| { | |
| "epoch": 0.42, | |
| "grad_norm": 0.023560672998428345, | |
| "learning_rate": 9.403300023001728e-05, | |
| "loss": 0.04047393798828125, | |
| "step": 84 | |
| }, | |
| { | |
| "epoch": 0.425, | |
| "grad_norm": 0.018022865056991577, | |
| "learning_rate": 9.384654164309083e-05, | |
| "loss": 0.041473388671875, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 0.43, | |
| "grad_norm": 0.01921142265200615, | |
| "learning_rate": 9.365742794664484e-05, | |
| "loss": 0.05157470703125, | |
| "step": 86 | |
| }, | |
| { | |
| "epoch": 0.435, | |
| "grad_norm": 0.017880946397781372, | |
| "learning_rate": 9.346567206634927e-05, | |
| "loss": 0.0452880859375, | |
| "step": 87 | |
| }, | |
| { | |
| "epoch": 0.44, | |
| "grad_norm": 0.022030450403690338, | |
| "learning_rate": 9.327128710846379e-05, | |
| "loss": 0.037017822265625, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 0.445, | |
| "grad_norm": 0.016076408326625824, | |
| "learning_rate": 9.30742863589421e-05, | |
| "loss": 0.0357666015625, | |
| "step": 89 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "grad_norm": 0.01490243710577488, | |
| "learning_rate": 9.287468328252372e-05, | |
| "loss": 0.03411102294921875, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.455, | |
| "grad_norm": 0.01804336905479431, | |
| "learning_rate": 9.267249152181379e-05, | |
| "loss": 0.0401763916015625, | |
| "step": 91 | |
| }, | |
| { | |
| "epoch": 0.46, | |
| "grad_norm": 0.012609057128429413, | |
| "learning_rate": 9.246772489635057e-05, | |
| "loss": 0.03302001953125, | |
| "step": 92 | |
| }, | |
| { | |
| "epoch": 0.465, | |
| "grad_norm": 0.017548903822898865, | |
| "learning_rate": 9.226039740166091e-05, | |
| "loss": 0.04241943359375, | |
| "step": 93 | |
| }, | |
| { | |
| "epoch": 0.47, | |
| "grad_norm": 0.020240291953086853, | |
| "learning_rate": 9.205052320830367e-05, | |
| "loss": 0.047595977783203125, | |
| "step": 94 | |
| }, | |
| { | |
| "epoch": 0.475, | |
| "grad_norm": 0.01528893131762743, | |
| "learning_rate": 9.183811666090118e-05, | |
| "loss": 0.038116455078125, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 0.01530187763273716, | |
| "learning_rate": 9.162319227715878e-05, | |
| "loss": 0.04156494140625, | |
| "step": 96 | |
| }, | |
| { | |
| "epoch": 0.485, | |
| "grad_norm": 0.01865176111459732, | |
| "learning_rate": 9.140576474687264e-05, | |
| "loss": 0.040771484375, | |
| "step": 97 | |
| }, | |
| { | |
| "epoch": 0.49, | |
| "grad_norm": 0.012654994614422321, | |
| "learning_rate": 9.118584893092563e-05, | |
| "loss": 0.03326416015625, | |
| "step": 98 | |
| }, | |
| { | |
| "epoch": 0.495, | |
| "grad_norm": 0.0152023546397686, | |
| "learning_rate": 9.096345986027161e-05, | |
| "loss": 0.0385894775390625, | |
| "step": 99 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 0.016569027677178383, | |
| "learning_rate": 9.07386127349082e-05, | |
| "loss": 0.0369415283203125, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.505, | |
| "grad_norm": 0.015082771889865398, | |
| "learning_rate": 9.051132292283771e-05, | |
| "loss": 0.0381011962890625, | |
| "step": 101 | |
| }, | |
| { | |
| "epoch": 0.51, | |
| "grad_norm": 0.013354030437767506, | |
| "learning_rate": 9.028160595901689e-05, | |
| "loss": 0.02880096435546875, | |
| "step": 102 | |
| }, | |
| { | |
| "epoch": 0.515, | |
| "grad_norm": 0.011870468966662884, | |
| "learning_rate": 9.004947754429507e-05, | |
| "loss": 0.02591705322265625, | |
| "step": 103 | |
| }, | |
| { | |
| "epoch": 0.52, | |
| "grad_norm": 0.014292772859334946, | |
| "learning_rate": 8.981495354434103e-05, | |
| "loss": 0.0422515869140625, | |
| "step": 104 | |
| }, | |
| { | |
| "epoch": 0.525, | |
| "grad_norm": 0.012471764348447323, | |
| "learning_rate": 8.957804998855866e-05, | |
| "loss": 0.0385894775390625, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "grad_norm": 0.015379557386040688, | |
| "learning_rate": 8.93387830689913e-05, | |
| "loss": 0.03763580322265625, | |
| "step": 106 | |
| }, | |
| { | |
| "epoch": 0.535, | |
| "grad_norm": 0.015690065920352936, | |
| "learning_rate": 8.909716913921508e-05, | |
| "loss": 0.03033447265625, | |
| "step": 107 | |
| }, | |
| { | |
| "epoch": 0.54, | |
| "grad_norm": 0.016691656783223152, | |
| "learning_rate": 8.885322471322112e-05, | |
| "loss": 0.03069305419921875, | |
| "step": 108 | |
| }, | |
| { | |
| "epoch": 0.545, | |
| "grad_norm": 0.020343007519841194, | |
| "learning_rate": 8.860696646428693e-05, | |
| "loss": 0.0328826904296875, | |
| "step": 109 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "grad_norm": 0.04021941497921944, | |
| "learning_rate": 8.83584112238367e-05, | |
| "loss": 0.036376953125, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.555, | |
| "grad_norm": 0.02442409098148346, | |
| "learning_rate": 8.810757598029093e-05, | |
| "loss": 0.035491943359375, | |
| "step": 111 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "grad_norm": 0.015310805290937424, | |
| "learning_rate": 8.785447787790534e-05, | |
| "loss": 0.037628173828125, | |
| "step": 112 | |
| }, | |
| { | |
| "epoch": 0.565, | |
| "grad_norm": 0.018267996609210968, | |
| "learning_rate": 8.759913421559902e-05, | |
| "loss": 0.03273773193359375, | |
| "step": 113 | |
| }, | |
| { | |
| "epoch": 0.57, | |
| "grad_norm": 0.01219545491039753, | |
| "learning_rate": 8.734156244577209e-05, | |
| "loss": 0.031951904296875, | |
| "step": 114 | |
| }, | |
| { | |
| "epoch": 0.575, | |
| "grad_norm": 0.020344750955700874, | |
| "learning_rate": 8.708178017311287e-05, | |
| "loss": 0.043609619140625, | |
| "step": 115 | |
| }, | |
| { | |
| "epoch": 0.58, | |
| "grad_norm": 0.02359812706708908, | |
| "learning_rate": 8.681980515339464e-05, | |
| "loss": 0.0442352294921875, | |
| "step": 116 | |
| }, | |
| { | |
| "epoch": 0.585, | |
| "grad_norm": 0.02012728713452816, | |
| "learning_rate": 8.655565529226198e-05, | |
| "loss": 0.045928955078125, | |
| "step": 117 | |
| }, | |
| { | |
| "epoch": 0.59, | |
| "grad_norm": 0.0184403657913208, | |
| "learning_rate": 8.628934864400706e-05, | |
| "loss": 0.03472900390625, | |
| "step": 118 | |
| }, | |
| { | |
| "epoch": 0.595, | |
| "grad_norm": 0.017508087679743767, | |
| "learning_rate": 8.602090341033547e-05, | |
| "loss": 0.040069580078125, | |
| "step": 119 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 0.014133688062429428, | |
| "learning_rate": 8.575033793912239e-05, | |
| "loss": 0.0308837890625, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.605, | |
| "grad_norm": 0.01238363329321146, | |
| "learning_rate": 8.547767072315835e-05, | |
| "loss": 0.02675628662109375, | |
| "step": 121 | |
| }, | |
| { | |
| "epoch": 0.61, | |
| "grad_norm": 0.029849538579583168, | |
| "learning_rate": 8.520292039888539e-05, | |
| "loss": 0.0382843017578125, | |
| "step": 122 | |
| }, | |
| { | |
| "epoch": 0.615, | |
| "grad_norm": 0.017021069303154945, | |
| "learning_rate": 8.492610574512317e-05, | |
| "loss": 0.045654296875, | |
| "step": 123 | |
| }, | |
| { | |
| "epoch": 0.62, | |
| "grad_norm": 0.014278067275881767, | |
| "learning_rate": 8.46472456817856e-05, | |
| "loss": 0.0348358154296875, | |
| "step": 124 | |
| }, | |
| { | |
| "epoch": 0.625, | |
| "grad_norm": 0.01516707893460989, | |
| "learning_rate": 8.436635926858759e-05, | |
| "loss": 0.0356292724609375, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 0.63, | |
| "grad_norm": 0.010814281180500984, | |
| "learning_rate": 8.408346570374233e-05, | |
| "loss": 0.03143310546875, | |
| "step": 126 | |
| }, | |
| { | |
| "epoch": 0.635, | |
| "grad_norm": 0.014818891882896423, | |
| "learning_rate": 8.379858432264925e-05, | |
| "loss": 0.031951904296875, | |
| "step": 127 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 0.015958471223711967, | |
| "learning_rate": 8.351173459657227e-05, | |
| "loss": 0.0411376953125, | |
| "step": 128 | |
| }, | |
| { | |
| "epoch": 0.645, | |
| "grad_norm": 0.012437131255865097, | |
| "learning_rate": 8.322293613130917e-05, | |
| "loss": 0.02826690673828125, | |
| "step": 129 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "grad_norm": 0.04986541345715523, | |
| "learning_rate": 8.29322086658514e-05, | |
| "loss": 0.040924072265625, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.655, | |
| "grad_norm": 0.015265759080648422, | |
| "learning_rate": 8.263957207103507e-05, | |
| "loss": 0.029491424560546875, | |
| "step": 131 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "grad_norm": 0.016343101859092712, | |
| "learning_rate": 8.234504634818267e-05, | |
| "loss": 0.03159332275390625, | |
| "step": 132 | |
| }, | |
| { | |
| "epoch": 0.665, | |
| "grad_norm": 0.015688840299844742, | |
| "learning_rate": 8.204865162773613e-05, | |
| "loss": 0.0380859375, | |
| "step": 133 | |
| }, | |
| { | |
| "epoch": 0.67, | |
| "grad_norm": 0.013779958710074425, | |
| "learning_rate": 8.17504081678809e-05, | |
| "loss": 0.0353546142578125, | |
| "step": 134 | |
| }, | |
| { | |
| "epoch": 0.675, | |
| "grad_norm": 0.014648032374680042, | |
| "learning_rate": 8.14503363531613e-05, | |
| "loss": 0.04010772705078125, | |
| "step": 135 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "grad_norm": 0.015630153939127922, | |
| "learning_rate": 8.114845669308723e-05, | |
| "loss": 0.0338287353515625, | |
| "step": 136 | |
| }, | |
| { | |
| "epoch": 0.685, | |
| "grad_norm": 0.01083196047693491, | |
| "learning_rate": 8.084478982073247e-05, | |
| "loss": 0.0377655029296875, | |
| "step": 137 | |
| }, | |
| { | |
| "epoch": 0.69, | |
| "grad_norm": 0.01352809090167284, | |
| "learning_rate": 8.053935649132437e-05, | |
| "loss": 0.03235626220703125, | |
| "step": 138 | |
| }, | |
| { | |
| "epoch": 0.695, | |
| "grad_norm": 0.014272249303758144, | |
| "learning_rate": 8.023217758082529e-05, | |
| "loss": 0.03082275390625, | |
| "step": 139 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "grad_norm": 0.016515057533979416, | |
| "learning_rate": 7.992327408450569e-05, | |
| "loss": 0.032867431640625, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.705, | |
| "grad_norm": 0.013200527988374233, | |
| "learning_rate": 7.961266711550922e-05, | |
| "loss": 0.036224365234375, | |
| "step": 141 | |
| }, | |
| { | |
| "epoch": 0.71, | |
| "grad_norm": 0.011445350013673306, | |
| "learning_rate": 7.930037790340963e-05, | |
| "loss": 0.0290985107421875, | |
| "step": 142 | |
| }, | |
| { | |
| "epoch": 0.715, | |
| "grad_norm": 0.014979459345340729, | |
| "learning_rate": 7.898642779275972e-05, | |
| "loss": 0.025959014892578125, | |
| "step": 143 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 0.014446934685111046, | |
| "learning_rate": 7.867083824163254e-05, | |
| "loss": 0.0315704345703125, | |
| "step": 144 | |
| }, | |
| { | |
| "epoch": 0.725, | |
| "grad_norm": 0.011316702701151371, | |
| "learning_rate": 7.835363082015468e-05, | |
| "loss": 0.0324249267578125, | |
| "step": 145 | |
| }, | |
| { | |
| "epoch": 0.73, | |
| "grad_norm": 0.01544218696653843, | |
| "learning_rate": 7.803482720903205e-05, | |
| "loss": 0.0286102294921875, | |
| "step": 146 | |
| }, | |
| { | |
| "epoch": 0.735, | |
| "grad_norm": 0.13669143617153168, | |
| "learning_rate": 7.771444919806798e-05, | |
| "loss": 0.03907012939453125, | |
| "step": 147 | |
| }, | |
| { | |
| "epoch": 0.74, | |
| "grad_norm": 0.02304857224225998, | |
| "learning_rate": 7.739251868467393e-05, | |
| "loss": 0.042835235595703125, | |
| "step": 148 | |
| }, | |
| { | |
| "epoch": 0.745, | |
| "grad_norm": 0.014206026680767536, | |
| "learning_rate": 7.706905767237288e-05, | |
| "loss": 0.0366668701171875, | |
| "step": 149 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 0.019232211634516716, | |
| "learning_rate": 7.674408826929534e-05, | |
| "loss": 0.0406036376953125, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.755, | |
| "grad_norm": 0.011523840948939323, | |
| "learning_rate": 7.641763268666831e-05, | |
| "loss": 0.0338134765625, | |
| "step": 151 | |
| }, | |
| { | |
| "epoch": 0.76, | |
| "grad_norm": 0.01299508661031723, | |
| "learning_rate": 7.608971323729728e-05, | |
| "loss": 0.0387420654296875, | |
| "step": 152 | |
| }, | |
| { | |
| "epoch": 0.765, | |
| "grad_norm": 0.012335872277617455, | |
| "learning_rate": 7.576035233404096e-05, | |
| "loss": 0.038547515869140625, | |
| "step": 153 | |
| }, | |
| { | |
| "epoch": 0.77, | |
| "grad_norm": 0.018646301701664925, | |
| "learning_rate": 7.542957248827961e-05, | |
| "loss": 0.03460693359375, | |
| "step": 154 | |
| }, | |
| { | |
| "epoch": 0.775, | |
| "grad_norm": 0.018792515620589256, | |
| "learning_rate": 7.50973963083763e-05, | |
| "loss": 0.0379638671875, | |
| "step": 155 | |
| }, | |
| { | |
| "epoch": 0.78, | |
| "grad_norm": 0.015776216983795166, | |
| "learning_rate": 7.476384649813167e-05, | |
| "loss": 0.0323333740234375, | |
| "step": 156 | |
| }, | |
| { | |
| "epoch": 0.785, | |
| "grad_norm": 0.020831342786550522, | |
| "learning_rate": 7.442894585523218e-05, | |
| "loss": 0.0391387939453125, | |
| "step": 157 | |
| }, | |
| { | |
| "epoch": 0.79, | |
| "grad_norm": 0.017143981531262398, | |
| "learning_rate": 7.409271726969192e-05, | |
| "loss": 0.0317230224609375, | |
| "step": 158 | |
| }, | |
| { | |
| "epoch": 0.795, | |
| "grad_norm": 0.011811457574367523, | |
| "learning_rate": 7.375518372228806e-05, | |
| "loss": 0.02951812744140625, | |
| "step": 159 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 0.01569269597530365, | |
| "learning_rate": 7.341636828299023e-05, | |
| "loss": 0.0395355224609375, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "eval_loss": 0.03098893165588379, | |
| "eval_runtime": 28.3877, | |
| "eval_samples_per_second": 0.951, | |
| "eval_steps_per_second": 0.141, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.805, | |
| "grad_norm": 0.012150801718235016, | |
| "learning_rate": 7.307629410938363e-05, | |
| "loss": 0.0354461669921875, | |
| "step": 161 | |
| }, | |
| { | |
| "epoch": 0.81, | |
| "grad_norm": 0.016524996608495712, | |
| "learning_rate": 7.273498444508628e-05, | |
| "loss": 0.0362548828125, | |
| "step": 162 | |
| }, | |
| { | |
| "epoch": 0.815, | |
| "grad_norm": 0.17121411859989166, | |
| "learning_rate": 7.239246261816035e-05, | |
| "loss": 0.03398895263671875, | |
| "step": 163 | |
| }, | |
| { | |
| "epoch": 0.82, | |
| "grad_norm": 0.01245883945375681, | |
| "learning_rate": 7.204875203951774e-05, | |
| "loss": 0.032806396484375, | |
| "step": 164 | |
| }, | |
| { | |
| "epoch": 0.825, | |
| "grad_norm": 0.015971507877111435, | |
| "learning_rate": 7.170387620131993e-05, | |
| "loss": 0.0379638671875, | |
| "step": 165 | |
| }, | |
| { | |
| "epoch": 0.83, | |
| "grad_norm": 0.013089642859995365, | |
| "learning_rate": 7.135785867537234e-05, | |
| "loss": 0.0324249267578125, | |
| "step": 166 | |
| }, | |
| { | |
| "epoch": 0.835, | |
| "grad_norm": 0.01805449277162552, | |
| "learning_rate": 7.101072311151324e-05, | |
| "loss": 0.0274658203125, | |
| "step": 167 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "grad_norm": 0.013880079612135887, | |
| "learning_rate": 7.06624932359973e-05, | |
| "loss": 0.0326995849609375, | |
| "step": 168 | |
| }, | |
| { | |
| "epoch": 0.845, | |
| "grad_norm": 0.012722963467240334, | |
| "learning_rate": 7.031319284987394e-05, | |
| "loss": 0.0314178466796875, | |
| "step": 169 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "grad_norm": 0.01585008203983307, | |
| "learning_rate": 6.996284582736056e-05, | |
| "loss": 0.0345611572265625, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.855, | |
| "grad_norm": 0.016173021867871284, | |
| "learning_rate": 6.961147611421075e-05, | |
| "loss": 0.03189849853515625, | |
| "step": 171 | |
| }, | |
| { | |
| "epoch": 0.86, | |
| "grad_norm": 0.01533008087426424, | |
| "learning_rate": 6.92591077260777e-05, | |
| "loss": 0.033050537109375, | |
| "step": 172 | |
| }, | |
| { | |
| "epoch": 0.865, | |
| "grad_norm": 0.01337040401995182, | |
| "learning_rate": 6.890576474687263e-05, | |
| "loss": 0.031768798828125, | |
| "step": 173 | |
| }, | |
| { | |
| "epoch": 0.87, | |
| "grad_norm": 0.011512755416333675, | |
| "learning_rate": 6.855147132711884e-05, | |
| "loss": 0.02989959716796875, | |
| "step": 174 | |
| }, | |
| { | |
| "epoch": 0.875, | |
| "grad_norm": 0.013947159051895142, | |
| "learning_rate": 6.819625168230093e-05, | |
| "loss": 0.0273284912109375, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 0.016053346917033195, | |
| "learning_rate": 6.784013009120974e-05, | |
| "loss": 0.03271484375, | |
| "step": 176 | |
| }, | |
| { | |
| "epoch": 0.885, | |
| "grad_norm": 0.01287975162267685, | |
| "learning_rate": 6.7483130894283e-05, | |
| "loss": 0.0211181640625, | |
| "step": 177 | |
| }, | |
| { | |
| "epoch": 0.89, | |
| "grad_norm": 0.01123369112610817, | |
| "learning_rate": 6.712527849194162e-05, | |
| "loss": 0.02886962890625, | |
| "step": 178 | |
| }, | |
| { | |
| "epoch": 0.895, | |
| "grad_norm": 0.013561406172811985, | |
| "learning_rate": 6.676659734292189e-05, | |
| "loss": 0.0310516357421875, | |
| "step": 179 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "grad_norm": 0.01320588681846857, | |
| "learning_rate": 6.640711196260393e-05, | |
| "loss": 0.033935546875, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.905, | |
| "grad_norm": 0.013400975614786148, | |
| "learning_rate": 6.604684692133597e-05, | |
| "loss": 0.0310516357421875, | |
| "step": 181 | |
| }, | |
| { | |
| "epoch": 0.91, | |
| "grad_norm": 0.011845126748085022, | |
| "learning_rate": 6.5685826842755e-05, | |
| "loss": 0.02423095703125, | |
| "step": 182 | |
| }, | |
| { | |
| "epoch": 0.915, | |
| "grad_norm": 0.013208305463194847, | |
| "learning_rate": 6.532407640210383e-05, | |
| "loss": 0.0382537841796875, | |
| "step": 183 | |
| }, | |
| { | |
| "epoch": 0.92, | |
| "grad_norm": 0.024753054603934288, | |
| "learning_rate": 6.496162032454454e-05, | |
| "loss": 0.0308990478515625, | |
| "step": 184 | |
| }, | |
| { | |
| "epoch": 0.925, | |
| "grad_norm": 0.016255544498562813, | |
| "learning_rate": 6.459848338346861e-05, | |
| "loss": 0.0276947021484375, | |
| "step": 185 | |
| }, | |
| { | |
| "epoch": 0.93, | |
| "grad_norm": 0.015609354712069035, | |
| "learning_rate": 6.423469039880354e-05, | |
| "loss": 0.0390472412109375, | |
| "step": 186 | |
| }, | |
| { | |
| "epoch": 0.935, | |
| "grad_norm": 0.009405655786395073, | |
| "learning_rate": 6.387026623531661e-05, | |
| "loss": 0.02411651611328125, | |
| "step": 187 | |
| }, | |
| { | |
| "epoch": 0.94, | |
| "grad_norm": 0.013661784119904041, | |
| "learning_rate": 6.350523580091532e-05, | |
| "loss": 0.0293426513671875, | |
| "step": 188 | |
| }, | |
| { | |
| "epoch": 0.945, | |
| "grad_norm": 0.014555767178535461, | |
| "learning_rate": 6.313962404494496e-05, | |
| "loss": 0.03389739990234375, | |
| "step": 189 | |
| }, | |
| { | |
| "epoch": 0.95, | |
| "grad_norm": 0.01418206375092268, | |
| "learning_rate": 6.277345595648337e-05, | |
| "loss": 0.03375244140625, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.955, | |
| "grad_norm": 0.023851638659834862, | |
| "learning_rate": 6.240675656263303e-05, | |
| "loss": 0.0290069580078125, | |
| "step": 191 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 0.015131880529224873, | |
| "learning_rate": 6.203955092681039e-05, | |
| "loss": 0.0372772216796875, | |
| "step": 192 | |
| }, | |
| { | |
| "epoch": 0.965, | |
| "grad_norm": 0.016015928238630295, | |
| "learning_rate": 6.167186414703289e-05, | |
| "loss": 0.0377197265625, | |
| "step": 193 | |
| }, | |
| { | |
| "epoch": 0.97, | |
| "grad_norm": 0.01045469380915165, | |
| "learning_rate": 6.130372135420351e-05, | |
| "loss": 0.0282135009765625, | |
| "step": 194 | |
| }, | |
| { | |
| "epoch": 0.975, | |
| "grad_norm": 0.015949321910738945, | |
| "learning_rate": 6.0935147710393117e-05, | |
| "loss": 0.031494140625, | |
| "step": 195 | |
| }, | |
| { | |
| "epoch": 0.98, | |
| "grad_norm": 0.012823979370296001, | |
| "learning_rate": 6.056616840712065e-05, | |
| "loss": 0.02597808837890625, | |
| "step": 196 | |
| }, | |
| { | |
| "epoch": 0.985, | |
| "grad_norm": 0.014250967651605606, | |
| "learning_rate": 6.019680866363139e-05, | |
| "loss": 0.0314483642578125, | |
| "step": 197 | |
| }, | |
| { | |
| "epoch": 0.99, | |
| "grad_norm": 0.013376348651945591, | |
| "learning_rate": 5.982709372517313e-05, | |
| "loss": 0.0341033935546875, | |
| "step": 198 | |
| }, | |
| { | |
| "epoch": 0.995, | |
| "grad_norm": 0.013810945674777031, | |
| "learning_rate": 5.9457048861270834e-05, | |
| "loss": 0.030609130859375, | |
| "step": 199 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 0.018971672281622887, | |
| "learning_rate": 5.9086699363999373e-05, | |
| "loss": 0.0342864990234375, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 1.005, | |
| "grad_norm": 0.012260881252586842, | |
| "learning_rate": 5.8716070546254966e-05, | |
| "loss": 0.0346832275390625, | |
| "step": 201 | |
| }, | |
| { | |
| "epoch": 1.01, | |
| "grad_norm": 0.011518058367073536, | |
| "learning_rate": 5.8345187740024954e-05, | |
| "loss": 0.028076171875, | |
| "step": 202 | |
| }, | |
| { | |
| "epoch": 1.015, | |
| "grad_norm": 0.011177563108503819, | |
| "learning_rate": 5.7974076294656476e-05, | |
| "loss": 0.03180694580078125, | |
| "step": 203 | |
| }, | |
| { | |
| "epoch": 1.02, | |
| "grad_norm": 0.015048347413539886, | |
| "learning_rate": 5.760276157512389e-05, | |
| "loss": 0.0311737060546875, | |
| "step": 204 | |
| }, | |
| { | |
| "epoch": 1.025, | |
| "grad_norm": 0.01451602578163147, | |
| "learning_rate": 5.7231268960295e-05, | |
| "loss": 0.0342559814453125, | |
| "step": 205 | |
| }, | |
| { | |
| "epoch": 1.03, | |
| "grad_norm": 0.012694913893938065, | |
| "learning_rate": 5.6859623841196595e-05, | |
| "loss": 0.03231048583984375, | |
| "step": 206 | |
| }, | |
| { | |
| "epoch": 1.035, | |
| "grad_norm": 0.0170957800000906, | |
| "learning_rate": 5.648785161927888e-05, | |
| "loss": 0.0325927734375, | |
| "step": 207 | |
| }, | |
| { | |
| "epoch": 1.04, | |
| "grad_norm": 0.01753183826804161, | |
| "learning_rate": 5.611597770467936e-05, | |
| "loss": 0.0388641357421875, | |
| "step": 208 | |
| }, | |
| { | |
| "epoch": 1.045, | |
| "grad_norm": 0.01130843348801136, | |
| "learning_rate": 5.574402751448614e-05, | |
| "loss": 0.02392578125, | |
| "step": 209 | |
| }, | |
| { | |
| "epoch": 1.05, | |
| "grad_norm": 0.011236002668738365, | |
| "learning_rate": 5.537202647100063e-05, | |
| "loss": 0.027374267578125, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 1.055, | |
| "grad_norm": 0.009808492846786976, | |
| "learning_rate": 5.500000000000001e-05, | |
| "loss": 0.026319503784179688, | |
| "step": 211 | |
| }, | |
| { | |
| "epoch": 1.06, | |
| "grad_norm": 0.01099427416920662, | |
| "learning_rate": 5.462797352899939e-05, | |
| "loss": 0.02689361572265625, | |
| "step": 212 | |
| }, | |
| { | |
| "epoch": 1.065, | |
| "grad_norm": 0.01430500764399767, | |
| "learning_rate": 5.425597248551387e-05, | |
| "loss": 0.0367431640625, | |
| "step": 213 | |
| }, | |
| { | |
| "epoch": 1.07, | |
| "grad_norm": 0.012247784994542599, | |
| "learning_rate": 5.388402229532065e-05, | |
| "loss": 0.036895751953125, | |
| "step": 214 | |
| }, | |
| { | |
| "epoch": 1.075, | |
| "grad_norm": 0.012278667651116848, | |
| "learning_rate": 5.351214838072113e-05, | |
| "loss": 0.0282745361328125, | |
| "step": 215 | |
| }, | |
| { | |
| "epoch": 1.08, | |
| "grad_norm": 0.01197484228760004, | |
| "learning_rate": 5.314037615880341e-05, | |
| "loss": 0.0281829833984375, | |
| "step": 216 | |
| }, | |
| { | |
| "epoch": 1.085, | |
| "grad_norm": 0.010302647016942501, | |
| "learning_rate": 5.2768731039705e-05, | |
| "loss": 0.02788543701171875, | |
| "step": 217 | |
| }, | |
| { | |
| "epoch": 1.09, | |
| "grad_norm": 0.01971321552991867, | |
| "learning_rate": 5.239723842487613e-05, | |
| "loss": 0.037200927734375, | |
| "step": 218 | |
| }, | |
| { | |
| "epoch": 1.095, | |
| "grad_norm": 0.012483607977628708, | |
| "learning_rate": 5.2025923705343535e-05, | |
| "loss": 0.03564453125, | |
| "step": 219 | |
| }, | |
| { | |
| "epoch": 1.1, | |
| "grad_norm": 0.014276109635829926, | |
| "learning_rate": 5.165481225997507e-05, | |
| "loss": 0.03778076171875, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 1.105, | |
| "grad_norm": 0.00952853262424469, | |
| "learning_rate": 5.128392945374505e-05, | |
| "loss": 0.0271148681640625, | |
| "step": 221 | |
| }, | |
| { | |
| "epoch": 1.11, | |
| "grad_norm": 0.012801293283700943, | |
| "learning_rate": 5.0913300636000624e-05, | |
| "loss": 0.031585693359375, | |
| "step": 222 | |
| }, | |
| { | |
| "epoch": 1.115, | |
| "grad_norm": 0.012339530512690544, | |
| "learning_rate": 5.054295113872918e-05, | |
| "loss": 0.03807830810546875, | |
| "step": 223 | |
| }, | |
| { | |
| "epoch": 1.12, | |
| "grad_norm": 0.01411394402384758, | |
| "learning_rate": 5.017290627482688e-05, | |
| "loss": 0.0302581787109375, | |
| "step": 224 | |
| }, | |
| { | |
| "epoch": 1.125, | |
| "grad_norm": 0.011293116956949234, | |
| "learning_rate": 4.980319133636863e-05, | |
| "loss": 0.0330352783203125, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 1.13, | |
| "grad_norm": 0.01050038542598486, | |
| "learning_rate": 4.9433831592879355e-05, | |
| "loss": 0.0325927734375, | |
| "step": 226 | |
| }, | |
| { | |
| "epoch": 1.135, | |
| "grad_norm": 0.010293497703969479, | |
| "learning_rate": 4.90648522896069e-05, | |
| "loss": 0.03238677978515625, | |
| "step": 227 | |
| }, | |
| { | |
| "epoch": 1.1400000000000001, | |
| "grad_norm": 0.011916328221559525, | |
| "learning_rate": 4.86962786457965e-05, | |
| "loss": 0.0326385498046875, | |
| "step": 228 | |
| }, | |
| { | |
| "epoch": 1.145, | |
| "grad_norm": 0.012021253816783428, | |
| "learning_rate": 4.83281358529671e-05, | |
| "loss": 0.02626800537109375, | |
| "step": 229 | |
| }, | |
| { | |
| "epoch": 1.15, | |
| "grad_norm": 0.01019071415066719, | |
| "learning_rate": 4.7960449073189606e-05, | |
| "loss": 0.029571533203125, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 1.155, | |
| "grad_norm": 0.01098195556551218, | |
| "learning_rate": 4.7593243437366975e-05, | |
| "loss": 0.0305328369140625, | |
| "step": 231 | |
| }, | |
| { | |
| "epoch": 1.16, | |
| "grad_norm": 0.010289876721799374, | |
| "learning_rate": 4.722654404351665e-05, | |
| "loss": 0.030487060546875, | |
| "step": 232 | |
| }, | |
| { | |
| "epoch": 1.165, | |
| "grad_norm": 0.012640922330319881, | |
| "learning_rate": 4.686037595505507e-05, | |
| "loss": 0.02504730224609375, | |
| "step": 233 | |
| }, | |
| { | |
| "epoch": 1.17, | |
| "grad_norm": 0.010987567715346813, | |
| "learning_rate": 4.6494764199084695e-05, | |
| "loss": 0.02408599853515625, | |
| "step": 234 | |
| }, | |
| { | |
| "epoch": 1.175, | |
| "grad_norm": 0.009844702668488026, | |
| "learning_rate": 4.612973376468339e-05, | |
| "loss": 0.02532958984375, | |
| "step": 235 | |
| }, | |
| { | |
| "epoch": 1.18, | |
| "grad_norm": 0.013736176304519176, | |
| "learning_rate": 4.576530960119646e-05, | |
| "loss": 0.039520263671875, | |
| "step": 236 | |
| }, | |
| { | |
| "epoch": 1.185, | |
| "grad_norm": 0.012891293503344059, | |
| "learning_rate": 4.54015166165314e-05, | |
| "loss": 0.0346527099609375, | |
| "step": 237 | |
| }, | |
| { | |
| "epoch": 1.19, | |
| "grad_norm": 0.06185446307063103, | |
| "learning_rate": 4.5038379675455455e-05, | |
| "loss": 0.0376129150390625, | |
| "step": 238 | |
| }, | |
| { | |
| "epoch": 1.195, | |
| "grad_norm": 0.008688431233167648, | |
| "learning_rate": 4.467592359789618e-05, | |
| "loss": 0.0287628173828125, | |
| "step": 239 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 0.009764442220330238, | |
| "learning_rate": 4.431417315724502e-05, | |
| "loss": 0.0291900634765625, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "eval_loss": 0.028431415557861328, | |
| "eval_runtime": 28.2883, | |
| "eval_samples_per_second": 0.954, | |
| "eval_steps_per_second": 0.141, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 1.205, | |
| "grad_norm": 0.009662406519055367, | |
| "learning_rate": 4.395315307866405e-05, | |
| "loss": 0.02191162109375, | |
| "step": 241 | |
| }, | |
| { | |
| "epoch": 1.21, | |
| "grad_norm": 0.00908933486789465, | |
| "learning_rate": 4.359288803739607e-05, | |
| "loss": 0.023895263671875, | |
| "step": 242 | |
| }, | |
| { | |
| "epoch": 1.215, | |
| "grad_norm": 0.01030402909964323, | |
| "learning_rate": 4.3233402657078115e-05, | |
| "loss": 0.0335540771484375, | |
| "step": 243 | |
| }, | |
| { | |
| "epoch": 1.22, | |
| "grad_norm": 0.012763289734721184, | |
| "learning_rate": 4.2874721508058394e-05, | |
| "loss": 0.028594970703125, | |
| "step": 244 | |
| }, | |
| { | |
| "epoch": 1.225, | |
| "grad_norm": 0.011976095847785473, | |
| "learning_rate": 4.2516869105717004e-05, | |
| "loss": 0.0277252197265625, | |
| "step": 245 | |
| }, | |
| { | |
| "epoch": 1.23, | |
| "grad_norm": 0.00925954058766365, | |
| "learning_rate": 4.215986990879027e-05, | |
| "loss": 0.0278472900390625, | |
| "step": 246 | |
| }, | |
| { | |
| "epoch": 1.2349999999999999, | |
| "grad_norm": 0.010557391680777073, | |
| "learning_rate": 4.18037483176991e-05, | |
| "loss": 0.03607177734375, | |
| "step": 247 | |
| }, | |
| { | |
| "epoch": 1.24, | |
| "grad_norm": 0.014365902170538902, | |
| "learning_rate": 4.144852867288117e-05, | |
| "loss": 0.035251617431640625, | |
| "step": 248 | |
| }, | |
| { | |
| "epoch": 1.245, | |
| "grad_norm": 0.017640303820371628, | |
| "learning_rate": 4.109423525312738e-05, | |
| "loss": 0.0262603759765625, | |
| "step": 249 | |
| }, | |
| { | |
| "epoch": 1.25, | |
| "grad_norm": 0.009929345920681953, | |
| "learning_rate": 4.07408922739223e-05, | |
| "loss": 0.0264434814453125, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 1.255, | |
| "grad_norm": 0.013882244937121868, | |
| "learning_rate": 4.0388523885789256e-05, | |
| "loss": 0.0301513671875, | |
| "step": 251 | |
| }, | |
| { | |
| "epoch": 1.26, | |
| "grad_norm": 0.011529352515935898, | |
| "learning_rate": 4.003715417263945e-05, | |
| "loss": 0.0323638916015625, | |
| "step": 252 | |
| }, | |
| { | |
| "epoch": 1.2650000000000001, | |
| "grad_norm": 0.012532991357147694, | |
| "learning_rate": 3.968680715012606e-05, | |
| "loss": 0.0297393798828125, | |
| "step": 253 | |
| }, | |
| { | |
| "epoch": 1.27, | |
| "grad_norm": 0.010939935222268105, | |
| "learning_rate": 3.9337506764002696e-05, | |
| "loss": 0.0311279296875, | |
| "step": 254 | |
| }, | |
| { | |
| "epoch": 1.275, | |
| "grad_norm": 0.0119152357801795, | |
| "learning_rate": 3.898927688848676e-05, | |
| "loss": 0.0316619873046875, | |
| "step": 255 | |
| }, | |
| { | |
| "epoch": 1.28, | |
| "grad_norm": 0.01580975204706192, | |
| "learning_rate": 3.864214132462765e-05, | |
| "loss": 0.0294036865234375, | |
| "step": 256 | |
| }, | |
| { | |
| "epoch": 1.285, | |
| "grad_norm": 0.020052200183272362, | |
| "learning_rate": 3.829612379868006e-05, | |
| "loss": 0.03711700439453125, | |
| "step": 257 | |
| }, | |
| { | |
| "epoch": 1.29, | |
| "grad_norm": 0.009781856089830399, | |
| "learning_rate": 3.795124796048225e-05, | |
| "loss": 0.0296783447265625, | |
| "step": 258 | |
| }, | |
| { | |
| "epoch": 1.295, | |
| "grad_norm": 0.01327812485396862, | |
| "learning_rate": 3.7607537381839664e-05, | |
| "loss": 0.0332183837890625, | |
| "step": 259 | |
| }, | |
| { | |
| "epoch": 1.3, | |
| "grad_norm": 0.012484843842685223, | |
| "learning_rate": 3.726501555491374e-05, | |
| "loss": 0.0272064208984375, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 1.305, | |
| "grad_norm": 0.012586589902639389, | |
| "learning_rate": 3.692370589061639e-05, | |
| "loss": 0.0366668701171875, | |
| "step": 261 | |
| }, | |
| { | |
| "epoch": 1.31, | |
| "grad_norm": 0.017182666808366776, | |
| "learning_rate": 3.658363171700978e-05, | |
| "loss": 0.0348052978515625, | |
| "step": 262 | |
| }, | |
| { | |
| "epoch": 1.315, | |
| "grad_norm": 0.01260948646813631, | |
| "learning_rate": 3.624481627771195e-05, | |
| "loss": 0.030330657958984375, | |
| "step": 263 | |
| }, | |
| { | |
| "epoch": 1.32, | |
| "grad_norm": 0.016813892871141434, | |
| "learning_rate": 3.590728273030809e-05, | |
| "loss": 0.0311737060546875, | |
| "step": 264 | |
| }, | |
| { | |
| "epoch": 1.325, | |
| "grad_norm": 0.02393505908548832, | |
| "learning_rate": 3.557105414476782e-05, | |
| "loss": 0.02386474609375, | |
| "step": 265 | |
| }, | |
| { | |
| "epoch": 1.33, | |
| "grad_norm": 0.012872851453721523, | |
| "learning_rate": 3.523615350186834e-05, | |
| "loss": 0.036708831787109375, | |
| "step": 266 | |
| }, | |
| { | |
| "epoch": 1.335, | |
| "grad_norm": 0.013852291740477085, | |
| "learning_rate": 3.4902603691623715e-05, | |
| "loss": 0.0322113037109375, | |
| "step": 267 | |
| }, | |
| { | |
| "epoch": 1.34, | |
| "grad_norm": 0.0120933772996068, | |
| "learning_rate": 3.45704275117204e-05, | |
| "loss": 0.03125762939453125, | |
| "step": 268 | |
| }, | |
| { | |
| "epoch": 1.345, | |
| "grad_norm": 0.011581032536923885, | |
| "learning_rate": 3.423964766595906e-05, | |
| "loss": 0.0313262939453125, | |
| "step": 269 | |
| }, | |
| { | |
| "epoch": 1.35, | |
| "grad_norm": 0.01317279227077961, | |
| "learning_rate": 3.391028676270274e-05, | |
| "loss": 0.023712158203125, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 1.355, | |
| "grad_norm": 0.011064618825912476, | |
| "learning_rate": 3.358236731333169e-05, | |
| "loss": 0.0304718017578125, | |
| "step": 271 | |
| }, | |
| { | |
| "epoch": 1.3599999999999999, | |
| "grad_norm": 0.01208885945379734, | |
| "learning_rate": 3.3255911730704686e-05, | |
| "loss": 0.0293121337890625, | |
| "step": 272 | |
| }, | |
| { | |
| "epoch": 1.365, | |
| "grad_norm": 0.012625926174223423, | |
| "learning_rate": 3.293094232762715e-05, | |
| "loss": 0.02788543701171875, | |
| "step": 273 | |
| }, | |
| { | |
| "epoch": 1.37, | |
| "grad_norm": 0.008723299019038677, | |
| "learning_rate": 3.260748131532609e-05, | |
| "loss": 0.0234527587890625, | |
| "step": 274 | |
| }, | |
| { | |
| "epoch": 1.375, | |
| "grad_norm": 0.015441285446286201, | |
| "learning_rate": 3.2285550801932046e-05, | |
| "loss": 0.026874542236328125, | |
| "step": 275 | |
| }, | |
| { | |
| "epoch": 1.38, | |
| "grad_norm": 0.015323000960052013, | |
| "learning_rate": 3.1965172790967965e-05, | |
| "loss": 0.02556610107421875, | |
| "step": 276 | |
| }, | |
| { | |
| "epoch": 1.385, | |
| "grad_norm": 0.009566771797835827, | |
| "learning_rate": 3.164636917984534e-05, | |
| "loss": 0.032073974609375, | |
| "step": 277 | |
| }, | |
| { | |
| "epoch": 1.3900000000000001, | |
| "grad_norm": 0.00870845653116703, | |
| "learning_rate": 3.1329161758367474e-05, | |
| "loss": 0.025909423828125, | |
| "step": 278 | |
| }, | |
| { | |
| "epoch": 1.395, | |
| "grad_norm": 0.015511032193899155, | |
| "learning_rate": 3.101357220724029e-05, | |
| "loss": 0.034149169921875, | |
| "step": 279 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 0.010509622283279896, | |
| "learning_rate": 3.069962209659039e-05, | |
| "loss": 0.028778076171875, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 1.405, | |
| "grad_norm": 0.012134591117501259, | |
| "learning_rate": 3.0387332884490805e-05, | |
| "loss": 0.02805328369140625, | |
| "step": 281 | |
| }, | |
| { | |
| "epoch": 1.41, | |
| "grad_norm": 0.009603182785212994, | |
| "learning_rate": 3.0076725915494342e-05, | |
| "loss": 0.02630615234375, | |
| "step": 282 | |
| }, | |
| { | |
| "epoch": 1.415, | |
| "grad_norm": 0.011478835716843605, | |
| "learning_rate": 2.9767822419174735e-05, | |
| "loss": 0.0364532470703125, | |
| "step": 283 | |
| }, | |
| { | |
| "epoch": 1.42, | |
| "grad_norm": 0.014177806675434113, | |
| "learning_rate": 2.9460643508675646e-05, | |
| "loss": 0.03066253662109375, | |
| "step": 284 | |
| }, | |
| { | |
| "epoch": 1.425, | |
| "grad_norm": 0.009659729897975922, | |
| "learning_rate": 2.9155210179267546e-05, | |
| "loss": 0.0316314697265625, | |
| "step": 285 | |
| }, | |
| { | |
| "epoch": 1.43, | |
| "grad_norm": 0.01564187742769718, | |
| "learning_rate": 2.885154330691278e-05, | |
| "loss": 0.03838348388671875, | |
| "step": 286 | |
| }, | |
| { | |
| "epoch": 1.435, | |
| "grad_norm": 0.01141000259667635, | |
| "learning_rate": 2.854966364683872e-05, | |
| "loss": 0.0345306396484375, | |
| "step": 287 | |
| }, | |
| { | |
| "epoch": 1.44, | |
| "grad_norm": 0.008901636116206646, | |
| "learning_rate": 2.82495918321191e-05, | |
| "loss": 0.027801513671875, | |
| "step": 288 | |
| }, | |
| { | |
| "epoch": 1.445, | |
| "grad_norm": 0.010393813252449036, | |
| "learning_rate": 2.7951348372263875e-05, | |
| "loss": 0.028045654296875, | |
| "step": 289 | |
| }, | |
| { | |
| "epoch": 1.45, | |
| "grad_norm": 0.01010132022202015, | |
| "learning_rate": 2.765495365181735e-05, | |
| "loss": 0.02850341796875, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 1.455, | |
| "grad_norm": 0.011715458706021309, | |
| "learning_rate": 2.736042792896495e-05, | |
| "loss": 0.029327392578125, | |
| "step": 291 | |
| }, | |
| { | |
| "epoch": 1.46, | |
| "grad_norm": 0.009373151697218418, | |
| "learning_rate": 2.70677913341486e-05, | |
| "loss": 0.02581024169921875, | |
| "step": 292 | |
| }, | |
| { | |
| "epoch": 1.465, | |
| "grad_norm": 0.01763959228992462, | |
| "learning_rate": 2.677706386869083e-05, | |
| "loss": 0.03360748291015625, | |
| "step": 293 | |
| }, | |
| { | |
| "epoch": 1.47, | |
| "grad_norm": 0.0119975870475173, | |
| "learning_rate": 2.648826540342773e-05, | |
| "loss": 0.036174774169921875, | |
| "step": 294 | |
| }, | |
| { | |
| "epoch": 1.475, | |
| "grad_norm": 0.010560150258243084, | |
| "learning_rate": 2.6201415677350754e-05, | |
| "loss": 0.0302734375, | |
| "step": 295 | |
| }, | |
| { | |
| "epoch": 1.48, | |
| "grad_norm": 0.010286550037562847, | |
| "learning_rate": 2.5916534296257655e-05, | |
| "loss": 0.0329132080078125, | |
| "step": 296 | |
| }, | |
| { | |
| "epoch": 1.4849999999999999, | |
| "grad_norm": 0.011692552827298641, | |
| "learning_rate": 2.5633640731412412e-05, | |
| "loss": 0.0301666259765625, | |
| "step": 297 | |
| }, | |
| { | |
| "epoch": 1.49, | |
| "grad_norm": 0.008653022348880768, | |
| "learning_rate": 2.5352754318214388e-05, | |
| "loss": 0.02614593505859375, | |
| "step": 298 | |
| }, | |
| { | |
| "epoch": 1.495, | |
| "grad_norm": 0.014823955483734608, | |
| "learning_rate": 2.507389425487683e-05, | |
| "loss": 0.0302886962890625, | |
| "step": 299 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 0.009769944474101067, | |
| "learning_rate": 2.4797079601114633e-05, | |
| "loss": 0.02752685546875, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 1.505, | |
| "grad_norm": 0.011288745328783989, | |
| "learning_rate": 2.4522329276841663e-05, | |
| "loss": 0.0290679931640625, | |
| "step": 301 | |
| }, | |
| { | |
| "epoch": 1.51, | |
| "grad_norm": 0.01025415025651455, | |
| "learning_rate": 2.4249662060877625e-05, | |
| "loss": 0.02318572998046875, | |
| "step": 302 | |
| }, | |
| { | |
| "epoch": 1.5150000000000001, | |
| "grad_norm": 0.008605693466961384, | |
| "learning_rate": 2.397909658966454e-05, | |
| "loss": 0.0209197998046875, | |
| "step": 303 | |
| }, | |
| { | |
| "epoch": 1.52, | |
| "grad_norm": 0.010999895632266998, | |
| "learning_rate": 2.3710651355992965e-05, | |
| "loss": 0.034942626953125, | |
| "step": 304 | |
| }, | |
| { | |
| "epoch": 1.525, | |
| "grad_norm": 0.011252101510763168, | |
| "learning_rate": 2.3444344707738015e-05, | |
| "loss": 0.03350830078125, | |
| "step": 305 | |
| }, | |
| { | |
| "epoch": 1.53, | |
| "grad_norm": 0.01330597884953022, | |
| "learning_rate": 2.3180194846605367e-05, | |
| "loss": 0.02883148193359375, | |
| "step": 306 | |
| }, | |
| { | |
| "epoch": 1.5350000000000001, | |
| "grad_norm": 0.03568987175822258, | |
| "learning_rate": 2.2918219826887135e-05, | |
| "loss": 0.023555755615234375, | |
| "step": 307 | |
| }, | |
| { | |
| "epoch": 1.54, | |
| "grad_norm": 0.011042929254472256, | |
| "learning_rate": 2.265843755422793e-05, | |
| "loss": 0.0248565673828125, | |
| "step": 308 | |
| }, | |
| { | |
| "epoch": 1.545, | |
| "grad_norm": 0.010344709269702435, | |
| "learning_rate": 2.2400865784401e-05, | |
| "loss": 0.02606964111328125, | |
| "step": 309 | |
| }, | |
| { | |
| "epoch": 1.55, | |
| "grad_norm": 0.014688103459775448, | |
| "learning_rate": 2.2145522122094677e-05, | |
| "loss": 0.0271759033203125, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 1.5550000000000002, | |
| "grad_norm": 0.013890204951167107, | |
| "learning_rate": 2.189242401970908e-05, | |
| "loss": 0.0247650146484375, | |
| "step": 311 | |
| }, | |
| { | |
| "epoch": 1.56, | |
| "grad_norm": 0.011548725888133049, | |
| "learning_rate": 2.1641588776163313e-05, | |
| "loss": 0.02850341796875, | |
| "step": 312 | |
| }, | |
| { | |
| "epoch": 1.565, | |
| "grad_norm": 0.010344250127673149, | |
| "learning_rate": 2.1393033535713093e-05, | |
| "loss": 0.02475738525390625, | |
| "step": 313 | |
| }, | |
| { | |
| "epoch": 1.5699999999999998, | |
| "grad_norm": 0.014313779771327972, | |
| "learning_rate": 2.1146775286778902e-05, | |
| "loss": 0.02605438232421875, | |
| "step": 314 | |
| }, | |
| { | |
| "epoch": 1.575, | |
| "grad_norm": 0.012160670012235641, | |
| "learning_rate": 2.090283086078495e-05, | |
| "loss": 0.0352935791015625, | |
| "step": 315 | |
| }, | |
| { | |
| "epoch": 1.58, | |
| "grad_norm": 0.015203883871436119, | |
| "learning_rate": 2.0661216931008714e-05, | |
| "loss": 0.0348358154296875, | |
| "step": 316 | |
| }, | |
| { | |
| "epoch": 1.585, | |
| "grad_norm": 0.011938238516449928, | |
| "learning_rate": 2.0421950011441354e-05, | |
| "loss": 0.0354156494140625, | |
| "step": 317 | |
| }, | |
| { | |
| "epoch": 1.5899999999999999, | |
| "grad_norm": 0.011078753508627415, | |
| "learning_rate": 2.0185046455658985e-05, | |
| "loss": 0.026214599609375, | |
| "step": 318 | |
| }, | |
| { | |
| "epoch": 1.595, | |
| "grad_norm": 0.011282606050372124, | |
| "learning_rate": 1.9950522455704944e-05, | |
| "loss": 0.0305633544921875, | |
| "step": 319 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 0.00796019472181797, | |
| "learning_rate": 1.9718394040983118e-05, | |
| "loss": 0.0254974365234375, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "eval_loss": 0.02757096290588379, | |
| "eval_runtime": 28.3735, | |
| "eval_samples_per_second": 0.952, | |
| "eval_steps_per_second": 0.141, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 1.605, | |
| "grad_norm": 0.007915240712463856, | |
| "learning_rate": 1.9488677077162295e-05, | |
| "loss": 0.0223846435546875, | |
| "step": 321 | |
| }, | |
| { | |
| "epoch": 1.6099999999999999, | |
| "grad_norm": 0.015724292024970055, | |
| "learning_rate": 1.9261387265091808e-05, | |
| "loss": 0.0294189453125, | |
| "step": 322 | |
| }, | |
| { | |
| "epoch": 1.615, | |
| "grad_norm": 0.012798645533621311, | |
| "learning_rate": 1.903654013972839e-05, | |
| "loss": 0.035308837890625, | |
| "step": 323 | |
| }, | |
| { | |
| "epoch": 1.62, | |
| "grad_norm": 0.010512963868677616, | |
| "learning_rate": 1.881415106907439e-05, | |
| "loss": 0.0279083251953125, | |
| "step": 324 | |
| }, | |
| { | |
| "epoch": 1.625, | |
| "grad_norm": 0.010452947579324245, | |
| "learning_rate": 1.8594235253127375e-05, | |
| "loss": 0.028594970703125, | |
| "step": 325 | |
| }, | |
| { | |
| "epoch": 1.63, | |
| "grad_norm": 0.008237004280090332, | |
| "learning_rate": 1.837680772284123e-05, | |
| "loss": 0.02721405029296875, | |
| "step": 326 | |
| }, | |
| { | |
| "epoch": 1.635, | |
| "grad_norm": 0.013389012776315212, | |
| "learning_rate": 1.8161883339098846e-05, | |
| "loss": 0.0260162353515625, | |
| "step": 327 | |
| }, | |
| { | |
| "epoch": 1.6400000000000001, | |
| "grad_norm": 0.010061044245958328, | |
| "learning_rate": 1.794947679169634e-05, | |
| "loss": 0.033687591552734375, | |
| "step": 328 | |
| }, | |
| { | |
| "epoch": 1.645, | |
| "grad_norm": 0.008693205192685127, | |
| "learning_rate": 1.77396025983391e-05, | |
| "loss": 0.023193359375, | |
| "step": 329 | |
| }, | |
| { | |
| "epoch": 1.65, | |
| "grad_norm": 0.011013878509402275, | |
| "learning_rate": 1.7532275103649436e-05, | |
| "loss": 0.0345458984375, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 1.655, | |
| "grad_norm": 0.011123662814497948, | |
| "learning_rate": 1.7327508478186218e-05, | |
| "loss": 0.021877288818359375, | |
| "step": 331 | |
| }, | |
| { | |
| "epoch": 1.6600000000000001, | |
| "grad_norm": 0.010408765636384487, | |
| "learning_rate": 1.712531671747628e-05, | |
| "loss": 0.025348663330078125, | |
| "step": 332 | |
| }, | |
| { | |
| "epoch": 1.665, | |
| "grad_norm": 0.011021304875612259, | |
| "learning_rate": 1.6925713641057904e-05, | |
| "loss": 0.0307769775390625, | |
| "step": 333 | |
| }, | |
| { | |
| "epoch": 1.67, | |
| "grad_norm": 0.010004506446421146, | |
| "learning_rate": 1.6728712891536215e-05, | |
| "loss": 0.02822113037109375, | |
| "step": 334 | |
| }, | |
| { | |
| "epoch": 1.675, | |
| "grad_norm": 0.01740351878106594, | |
| "learning_rate": 1.653432793365074e-05, | |
| "loss": 0.03163909912109375, | |
| "step": 335 | |
| }, | |
| { | |
| "epoch": 1.6800000000000002, | |
| "grad_norm": 0.012323952279984951, | |
| "learning_rate": 1.6342572053355166e-05, | |
| "loss": 0.02740478515625, | |
| "step": 336 | |
| }, | |
| { | |
| "epoch": 1.685, | |
| "grad_norm": 0.01033550500869751, | |
| "learning_rate": 1.6153458356909176e-05, | |
| "loss": 0.0314483642578125, | |
| "step": 337 | |
| }, | |
| { | |
| "epoch": 1.69, | |
| "grad_norm": 0.011347970925271511, | |
| "learning_rate": 1.5966999769982712e-05, | |
| "loss": 0.02532196044921875, | |
| "step": 338 | |
| }, | |
| { | |
| "epoch": 1.6949999999999998, | |
| "grad_norm": 0.010214807465672493, | |
| "learning_rate": 1.578320903677252e-05, | |
| "loss": 0.02443695068359375, | |
| "step": 339 | |
| }, | |
| { | |
| "epoch": 1.7, | |
| "grad_norm": 0.02045145072042942, | |
| "learning_rate": 1.5602098719131076e-05, | |
| "loss": 0.026458740234375, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 1.705, | |
| "grad_norm": 0.01049800030887127, | |
| "learning_rate": 1.5423681195707997e-05, | |
| "loss": 0.0302734375, | |
| "step": 341 | |
| }, | |
| { | |
| "epoch": 1.71, | |
| "grad_norm": 0.0091980816796422, | |
| "learning_rate": 1.5247968661104017e-05, | |
| "loss": 0.0238494873046875, | |
| "step": 342 | |
| }, | |
| { | |
| "epoch": 1.7149999999999999, | |
| "grad_norm": 0.00883064977824688, | |
| "learning_rate": 1.507497312503747e-05, | |
| "loss": 0.0197601318359375, | |
| "step": 343 | |
| }, | |
| { | |
| "epoch": 1.72, | |
| "grad_norm": 0.014422561973333359, | |
| "learning_rate": 1.490470641152345e-05, | |
| "loss": 0.025146484375, | |
| "step": 344 | |
| }, | |
| { | |
| "epoch": 1.725, | |
| "grad_norm": 0.009651090018451214, | |
| "learning_rate": 1.4737180158065644e-05, | |
| "loss": 0.0275421142578125, | |
| "step": 345 | |
| }, | |
| { | |
| "epoch": 1.73, | |
| "grad_norm": 0.010517412796616554, | |
| "learning_rate": 1.4572405814860954e-05, | |
| "loss": 0.0245513916015625, | |
| "step": 346 | |
| }, | |
| { | |
| "epoch": 1.7349999999999999, | |
| "grad_norm": 0.009971555322408676, | |
| "learning_rate": 1.441039464401685e-05, | |
| "loss": 0.03174591064453125, | |
| "step": 347 | |
| }, | |
| { | |
| "epoch": 1.74, | |
| "grad_norm": 0.011207611300051212, | |
| "learning_rate": 1.4251157718781658e-05, | |
| "loss": 0.0351409912109375, | |
| "step": 348 | |
| }, | |
| { | |
| "epoch": 1.745, | |
| "grad_norm": 0.010495432652533054, | |
| "learning_rate": 1.4094705922787687e-05, | |
| "loss": 0.03032684326171875, | |
| "step": 349 | |
| }, | |
| { | |
| "epoch": 1.75, | |
| "grad_norm": 0.011869566515088081, | |
| "learning_rate": 1.394104994930738e-05, | |
| "loss": 0.0328826904296875, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 1.755, | |
| "grad_norm": 0.010121211409568787, | |
| "learning_rate": 1.3790200300522413e-05, | |
| "loss": 0.02735137939453125, | |
| "step": 351 | |
| }, | |
| { | |
| "epoch": 1.76, | |
| "grad_norm": 0.014805102720856667, | |
| "learning_rate": 1.36421672868059e-05, | |
| "loss": 0.033660888671875, | |
| "step": 352 | |
| }, | |
| { | |
| "epoch": 1.7650000000000001, | |
| "grad_norm": 0.010326611809432507, | |
| "learning_rate": 1.3496961026017687e-05, | |
| "loss": 0.033466339111328125, | |
| "step": 353 | |
| }, | |
| { | |
| "epoch": 1.77, | |
| "grad_norm": 0.012950467877089977, | |
| "learning_rate": 1.3354591442812822e-05, | |
| "loss": 0.0269622802734375, | |
| "step": 354 | |
| }, | |
| { | |
| "epoch": 1.775, | |
| "grad_norm": 0.012358403764665127, | |
| "learning_rate": 1.3215068267963188e-05, | |
| "loss": 0.0299835205078125, | |
| "step": 355 | |
| }, | |
| { | |
| "epoch": 1.78, | |
| "grad_norm": 0.009418732486665249, | |
| "learning_rate": 1.307840103769245e-05, | |
| "loss": 0.02685546875, | |
| "step": 356 | |
| }, | |
| { | |
| "epoch": 1.7850000000000001, | |
| "grad_norm": 0.009776061400771141, | |
| "learning_rate": 1.2944599093024267e-05, | |
| "loss": 0.0323028564453125, | |
| "step": 357 | |
| }, | |
| { | |
| "epoch": 1.79, | |
| "grad_norm": 0.009743714705109596, | |
| "learning_rate": 1.281367157914381e-05, | |
| "loss": 0.026031494140625, | |
| "step": 358 | |
| }, | |
| { | |
| "epoch": 1.795, | |
| "grad_norm": 0.008474187925457954, | |
| "learning_rate": 1.2685627444772748e-05, | |
| "loss": 0.02619171142578125, | |
| "step": 359 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 0.01052561029791832, | |
| "learning_rate": 1.2560475441557565e-05, | |
| "loss": 0.031768798828125, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 1.8050000000000002, | |
| "grad_norm": 0.010250302962958813, | |
| "learning_rate": 1.2438224123471442e-05, | |
| "loss": 0.030551910400390625, | |
| "step": 361 | |
| }, | |
| { | |
| "epoch": 1.81, | |
| "grad_norm": 0.009635678492486477, | |
| "learning_rate": 1.2318881846229578e-05, | |
| "loss": 0.029354095458984375, | |
| "step": 362 | |
| }, | |
| { | |
| "epoch": 1.815, | |
| "grad_norm": 0.018043145537376404, | |
| "learning_rate": 1.2202456766718093e-05, | |
| "loss": 0.028411865234375, | |
| "step": 363 | |
| }, | |
| { | |
| "epoch": 1.8199999999999998, | |
| "grad_norm": 0.010215197689831257, | |
| "learning_rate": 1.2088956842436515e-05, | |
| "loss": 0.02750396728515625, | |
| "step": 364 | |
| }, | |
| { | |
| "epoch": 1.825, | |
| "grad_norm": 0.011272676289081573, | |
| "learning_rate": 1.1978389830953907e-05, | |
| "loss": 0.031951904296875, | |
| "step": 365 | |
| }, | |
| { | |
| "epoch": 1.83, | |
| "grad_norm": 0.011401425115764141, | |
| "learning_rate": 1.1870763289378629e-05, | |
| "loss": 0.028167724609375, | |
| "step": 366 | |
| }, | |
| { | |
| "epoch": 1.835, | |
| "grad_norm": 0.009742112830281258, | |
| "learning_rate": 1.1766084573841835e-05, | |
| "loss": 0.021697998046875, | |
| "step": 367 | |
| }, | |
| { | |
| "epoch": 1.8399999999999999, | |
| "grad_norm": 0.010335804894566536, | |
| "learning_rate": 1.166436083899468e-05, | |
| "loss": 0.02709197998046875, | |
| "step": 368 | |
| }, | |
| { | |
| "epoch": 1.845, | |
| "grad_norm": 0.008323920890688896, | |
| "learning_rate": 1.1565599037519316e-05, | |
| "loss": 0.02667236328125, | |
| "step": 369 | |
| }, | |
| { | |
| "epoch": 1.85, | |
| "grad_norm": 0.01001122035086155, | |
| "learning_rate": 1.146980591965368e-05, | |
| "loss": 0.02816009521484375, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 1.855, | |
| "grad_norm": 0.014210703782737255, | |
| "learning_rate": 1.1376988032730134e-05, | |
| "loss": 0.0249786376953125, | |
| "step": 371 | |
| }, | |
| { | |
| "epoch": 1.8599999999999999, | |
| "grad_norm": 0.009568016976118088, | |
| "learning_rate": 1.128715172072796e-05, | |
| "loss": 0.0278167724609375, | |
| "step": 372 | |
| }, | |
| { | |
| "epoch": 1.865, | |
| "grad_norm": 0.009678252041339874, | |
| "learning_rate": 1.1200303123839742e-05, | |
| "loss": 0.02631378173828125, | |
| "step": 373 | |
| }, | |
| { | |
| "epoch": 1.87, | |
| "grad_norm": 0.008704318664968014, | |
| "learning_rate": 1.1116448178051713e-05, | |
| "loss": 0.02629852294921875, | |
| "step": 374 | |
| }, | |
| { | |
| "epoch": 1.875, | |
| "grad_norm": 0.014527424238622189, | |
| "learning_rate": 1.1035592614738034e-05, | |
| "loss": 0.02300262451171875, | |
| "step": 375 | |
| }, | |
| { | |
| "epoch": 1.88, | |
| "grad_norm": 0.010122748091816902, | |
| "learning_rate": 1.0957741960269049e-05, | |
| "loss": 0.02685546875, | |
| "step": 376 | |
| }, | |
| { | |
| "epoch": 1.885, | |
| "grad_norm": 0.007298020645976067, | |
| "learning_rate": 1.088290153563358e-05, | |
| "loss": 0.0183868408203125, | |
| "step": 377 | |
| }, | |
| { | |
| "epoch": 1.8900000000000001, | |
| "grad_norm": 0.008330732583999634, | |
| "learning_rate": 1.081107645607524e-05, | |
| "loss": 0.023834228515625, | |
| "step": 378 | |
| }, | |
| { | |
| "epoch": 1.895, | |
| "grad_norm": 0.02022983878850937, | |
| "learning_rate": 1.0742271630742796e-05, | |
| "loss": 0.0269927978515625, | |
| "step": 379 | |
| }, | |
| { | |
| "epoch": 1.9, | |
| "grad_norm": 0.010069115087389946, | |
| "learning_rate": 1.0676491762354676e-05, | |
| "loss": 0.02846527099609375, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 1.905, | |
| "grad_norm": 0.00943570863455534, | |
| "learning_rate": 1.0613741346877497e-05, | |
| "loss": 0.02564239501953125, | |
| "step": 381 | |
| }, | |
| { | |
| "epoch": 1.9100000000000001, | |
| "grad_norm": 0.010675134137272835, | |
| "learning_rate": 1.0554024673218807e-05, | |
| "loss": 0.02086639404296875, | |
| "step": 382 | |
| }, | |
| { | |
| "epoch": 1.915, | |
| "grad_norm": 0.013744503259658813, | |
| "learning_rate": 1.0497345822933918e-05, | |
| "loss": 0.033782958984375, | |
| "step": 383 | |
| }, | |
| { | |
| "epoch": 1.92, | |
| "grad_norm": 0.012528883293271065, | |
| "learning_rate": 1.044370866994697e-05, | |
| "loss": 0.0260009765625, | |
| "step": 384 | |
| }, | |
| { | |
| "epoch": 1.925, | |
| "grad_norm": 0.01032931450754404, | |
| "learning_rate": 1.0393116880286118e-05, | |
| "loss": 0.0235137939453125, | |
| "step": 385 | |
| }, | |
| { | |
| "epoch": 1.9300000000000002, | |
| "grad_norm": 0.013555163517594337, | |
| "learning_rate": 1.0345573911832976e-05, | |
| "loss": 0.0333099365234375, | |
| "step": 386 | |
| }, | |
| { | |
| "epoch": 1.935, | |
| "grad_norm": 0.007477805484086275, | |
| "learning_rate": 1.0301083014086285e-05, | |
| "loss": 0.02054595947265625, | |
| "step": 387 | |
| }, | |
| { | |
| "epoch": 1.94, | |
| "grad_norm": 0.010511595755815506, | |
| "learning_rate": 1.0259647227939808e-05, | |
| "loss": 0.02536773681640625, | |
| "step": 388 | |
| }, | |
| { | |
| "epoch": 1.9449999999999998, | |
| "grad_norm": 0.009861464612185955, | |
| "learning_rate": 1.0221269385474488e-05, | |
| "loss": 0.029483795166015625, | |
| "step": 389 | |
| }, | |
| { | |
| "epoch": 1.95, | |
| "grad_norm": 0.010630265809595585, | |
| "learning_rate": 1.0185952109764878e-05, | |
| "loss": 0.02857208251953125, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 1.955, | |
| "grad_norm": 0.008438383229076862, | |
| "learning_rate": 1.0153697814699859e-05, | |
| "loss": 0.0250396728515625, | |
| "step": 391 | |
| }, | |
| { | |
| "epoch": 1.96, | |
| "grad_norm": 0.013799340464174747, | |
| "learning_rate": 1.012450870481765e-05, | |
| "loss": 0.0318756103515625, | |
| "step": 392 | |
| }, | |
| { | |
| "epoch": 1.9649999999999999, | |
| "grad_norm": 0.014741787686944008, | |
| "learning_rate": 1.0098386775155147e-05, | |
| "loss": 0.0309295654296875, | |
| "step": 393 | |
| }, | |
| { | |
| "epoch": 1.97, | |
| "grad_norm": 0.009878206998109818, | |
| "learning_rate": 1.0075333811111535e-05, | |
| "loss": 0.0249176025390625, | |
| "step": 394 | |
| }, | |
| { | |
| "epoch": 1.975, | |
| "grad_norm": 0.010228660888969898, | |
| "learning_rate": 1.0055351388326288e-05, | |
| "loss": 0.028350830078125, | |
| "step": 395 | |
| }, | |
| { | |
| "epoch": 1.98, | |
| "grad_norm": 0.011952117085456848, | |
| "learning_rate": 1.0038440872571456e-05, | |
| "loss": 0.021148681640625, | |
| "step": 396 | |
| }, | |
| { | |
| "epoch": 1.9849999999999999, | |
| "grad_norm": 0.010431772097945213, | |
| "learning_rate": 1.0024603419658329e-05, | |
| "loss": 0.02730560302734375, | |
| "step": 397 | |
| }, | |
| { | |
| "epoch": 1.99, | |
| "grad_norm": 0.011022545397281647, | |
| "learning_rate": 1.001383997535844e-05, | |
| "loss": 0.029876708984375, | |
| "step": 398 | |
| }, | |
| { | |
| "epoch": 1.995, | |
| "grad_norm": 0.009447705931961536, | |
| "learning_rate": 1.0006151275338897e-05, | |
| "loss": 0.02649688720703125, | |
| "step": 399 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 0.011590216308832169, | |
| "learning_rate": 1.0001537845112144e-05, | |
| "loss": 0.02838134765625, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_loss": 0.02712535858154297, | |
| "eval_runtime": 28.2889, | |
| "eval_samples_per_second": 0.954, | |
| "eval_steps_per_second": 0.141, | |
| "step": 400 | |
| } | |
| ], | |
| "logging_steps": 1.0, | |
| "max_steps": 400, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 0, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 3.3140823917796e+19, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |