Q-Route-70B / trainer_state.json
jay2219's picture
publish: model weights
0ad2e99
Raw
History Blame Contribute Delete
70.9 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 80,
"global_step": 400,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.005,
"grad_norm": 0.15680274367332458,
"learning_rate": 0.0,
"loss": 0.144775390625,
"step": 1
},
{
"epoch": 0.01,
"grad_norm": 0.15471383929252625,
"learning_rate": 5e-06,
"loss": 0.13623046875,
"step": 2
},
{
"epoch": 0.015,
"grad_norm": 0.16802309453487396,
"learning_rate": 1e-05,
"loss": 0.13482666015625,
"step": 3
},
{
"epoch": 0.02,
"grad_norm": 0.12738408148288727,
"learning_rate": 1.5e-05,
"loss": 0.13458251953125,
"step": 4
},
{
"epoch": 0.025,
"grad_norm": 0.10133010149002075,
"learning_rate": 2e-05,
"loss": 0.12884521484375,
"step": 5
},
{
"epoch": 0.03,
"grad_norm": 0.060088176280260086,
"learning_rate": 2.5e-05,
"loss": 0.099334716796875,
"step": 6
},
{
"epoch": 0.035,
"grad_norm": 0.06896929442882538,
"learning_rate": 3e-05,
"loss": 0.08770751953125,
"step": 7
},
{
"epoch": 0.04,
"grad_norm": 0.060252595692873,
"learning_rate": 3.5e-05,
"loss": 0.13433837890625,
"step": 8
},
{
"epoch": 0.045,
"grad_norm": 0.036323413252830505,
"learning_rate": 4e-05,
"loss": 0.0687255859375,
"step": 9
},
{
"epoch": 0.05,
"grad_norm": 0.05082182213664055,
"learning_rate": 4.5e-05,
"loss": 0.09259033203125,
"step": 10
},
{
"epoch": 0.055,
"grad_norm": 0.03914697468280792,
"learning_rate": 5e-05,
"loss": 0.05977630615234375,
"step": 11
},
{
"epoch": 0.06,
"grad_norm": 0.04393604397773743,
"learning_rate": 5.500000000000001e-05,
"loss": 0.06298828125,
"step": 12
},
{
"epoch": 0.065,
"grad_norm": 0.040235262364149094,
"learning_rate": 6e-05,
"loss": 0.094696044921875,
"step": 13
},
{
"epoch": 0.07,
"grad_norm": 0.035069484263658524,
"learning_rate": 6.500000000000001e-05,
"loss": 0.0823974609375,
"step": 14
},
{
"epoch": 0.075,
"grad_norm": 0.03388446569442749,
"learning_rate": 7e-05,
"loss": 0.0683746337890625,
"step": 15
},
{
"epoch": 0.08,
"grad_norm": 0.030936958268284798,
"learning_rate": 7.500000000000001e-05,
"loss": 0.0635986328125,
"step": 16
},
{
"epoch": 0.085,
"grad_norm": 0.060820236802101135,
"learning_rate": 8e-05,
"loss": 0.065277099609375,
"step": 17
},
{
"epoch": 0.09,
"grad_norm": 0.04122919216752052,
"learning_rate": 8.5e-05,
"loss": 0.078216552734375,
"step": 18
},
{
"epoch": 0.095,
"grad_norm": 0.04100744053721428,
"learning_rate": 9e-05,
"loss": 0.062774658203125,
"step": 19
},
{
"epoch": 0.1,
"grad_norm": 0.035049788653850555,
"learning_rate": 9.5e-05,
"loss": 0.0718994140625,
"step": 20
},
{
"epoch": 0.105,
"grad_norm": 0.021961010992527008,
"learning_rate": 0.0001,
"loss": 0.055572509765625,
"step": 21
},
{
"epoch": 0.11,
"grad_norm": 0.03183983638882637,
"learning_rate": 9.999846215488786e-05,
"loss": 0.068115234375,
"step": 22
},
{
"epoch": 0.115,
"grad_norm": 0.03052438609302044,
"learning_rate": 9.999384872466111e-05,
"loss": 0.072967529296875,
"step": 23
},
{
"epoch": 0.12,
"grad_norm": 0.035542961210012436,
"learning_rate": 9.998616002464157e-05,
"loss": 0.0618896484375,
"step": 24
},
{
"epoch": 0.125,
"grad_norm": 0.030043089762330055,
"learning_rate": 9.997539658034168e-05,
"loss": 0.064727783203125,
"step": 25
},
{
"epoch": 0.13,
"grad_norm": 0.023587681353092194,
"learning_rate": 9.996155912742855e-05,
"loss": 0.053131103515625,
"step": 26
},
{
"epoch": 0.135,
"grad_norm": 0.022438321262598038,
"learning_rate": 9.994464861167372e-05,
"loss": 0.054168701171875,
"step": 27
},
{
"epoch": 0.14,
"grad_norm": 0.03795755282044411,
"learning_rate": 9.992466618888847e-05,
"loss": 0.059478759765625,
"step": 28
},
{
"epoch": 0.145,
"grad_norm": 0.021761983633041382,
"learning_rate": 9.990161322484486e-05,
"loss": 0.05206298828125,
"step": 29
},
{
"epoch": 0.15,
"grad_norm": 0.026853321120142937,
"learning_rate": 9.987549129518235e-05,
"loss": 0.048126220703125,
"step": 30
},
{
"epoch": 0.155,
"grad_norm": 0.022847812622785568,
"learning_rate": 9.984630218530014e-05,
"loss": 0.04364013671875,
"step": 31
},
{
"epoch": 0.16,
"grad_norm": 0.031377874314785004,
"learning_rate": 9.981404789023512e-05,
"loss": 0.0525054931640625,
"step": 32
},
{
"epoch": 0.165,
"grad_norm": 0.03190525993704796,
"learning_rate": 9.977873061452552e-05,
"loss": 0.060882568359375,
"step": 33
},
{
"epoch": 0.17,
"grad_norm": 0.028999412432312965,
"learning_rate": 9.974035277206021e-05,
"loss": 0.0458221435546875,
"step": 34
},
{
"epoch": 0.175,
"grad_norm": 0.022387295961380005,
"learning_rate": 9.969891698591372e-05,
"loss": 0.0454254150390625,
"step": 35
},
{
"epoch": 0.18,
"grad_norm": 0.02159653790295124,
"learning_rate": 9.965442608816703e-05,
"loss": 0.0605316162109375,
"step": 36
},
{
"epoch": 0.185,
"grad_norm": 0.027492763474583626,
"learning_rate": 9.96068831197139e-05,
"loss": 0.05517578125,
"step": 37
},
{
"epoch": 0.19,
"grad_norm": 0.031047804281115532,
"learning_rate": 9.955629133005302e-05,
"loss": 0.06964111328125,
"step": 38
},
{
"epoch": 0.195,
"grad_norm": 0.022201504558324814,
"learning_rate": 9.950265417706608e-05,
"loss": 0.0394287109375,
"step": 39
},
{
"epoch": 0.2,
"grad_norm": 0.020365344360470772,
"learning_rate": 9.94459753267812e-05,
"loss": 0.046295166015625,
"step": 40
},
{
"epoch": 0.205,
"grad_norm": 0.021846065297722816,
"learning_rate": 9.938625865312251e-05,
"loss": 0.0291900634765625,
"step": 41
},
{
"epoch": 0.21,
"grad_norm": 0.04813797026872635,
"learning_rate": 9.932350823764534e-05,
"loss": 0.0376739501953125,
"step": 42
},
{
"epoch": 0.215,
"grad_norm": 0.020583365112543106,
"learning_rate": 9.92577283692572e-05,
"loss": 0.051177978515625,
"step": 43
},
{
"epoch": 0.22,
"grad_norm": 0.022562626749277115,
"learning_rate": 9.918892354392477e-05,
"loss": 0.0485687255859375,
"step": 44
},
{
"epoch": 0.225,
"grad_norm": 0.016049904748797417,
"learning_rate": 9.911709846436641e-05,
"loss": 0.03813934326171875,
"step": 45
},
{
"epoch": 0.23,
"grad_norm": 0.02223113551735878,
"learning_rate": 9.904225803973094e-05,
"loss": 0.03997802734375,
"step": 46
},
{
"epoch": 0.235,
"grad_norm": 0.028438566252589226,
"learning_rate": 9.896440738526198e-05,
"loss": 0.056427001953125,
"step": 47
},
{
"epoch": 0.24,
"grad_norm": 0.025392597541213036,
"learning_rate": 9.888355182194829e-05,
"loss": 0.04984283447265625,
"step": 48
},
{
"epoch": 0.245,
"grad_norm": 0.02372913435101509,
"learning_rate": 9.879969687616027e-05,
"loss": 0.047210693359375,
"step": 49
},
{
"epoch": 0.25,
"grad_norm": 0.018541816622018814,
"learning_rate": 9.871284827927205e-05,
"loss": 0.0352325439453125,
"step": 50
},
{
"epoch": 0.255,
"grad_norm": 0.020503757521510124,
"learning_rate": 9.862301196726987e-05,
"loss": 0.040771484375,
"step": 51
},
{
"epoch": 0.26,
"grad_norm": 0.022244155406951904,
"learning_rate": 9.853019408034632e-05,
"loss": 0.041168212890625,
"step": 52
},
{
"epoch": 0.265,
"grad_norm": 0.02082468941807747,
"learning_rate": 9.84344009624807e-05,
"loss": 0.0489044189453125,
"step": 53
},
{
"epoch": 0.27,
"grad_norm": 0.020852362737059593,
"learning_rate": 9.833563916100533e-05,
"loss": 0.0433807373046875,
"step": 54
},
{
"epoch": 0.275,
"grad_norm": 0.016285911202430725,
"learning_rate": 9.823391542615817e-05,
"loss": 0.0467376708984375,
"step": 55
},
{
"epoch": 0.28,
"grad_norm": 0.032904356718063354,
"learning_rate": 9.812923671062138e-05,
"loss": 0.04266357421875,
"step": 56
},
{
"epoch": 0.285,
"grad_norm": 0.025433626025915146,
"learning_rate": 9.80216101690461e-05,
"loss": 0.05548095703125,
"step": 57
},
{
"epoch": 0.29,
"grad_norm": 0.025250935927033424,
"learning_rate": 9.791104315756349e-05,
"loss": 0.0398101806640625,
"step": 58
},
{
"epoch": 0.295,
"grad_norm": 0.02171344868838787,
"learning_rate": 9.779754323328192e-05,
"loss": 0.04587554931640625,
"step": 59
},
{
"epoch": 0.3,
"grad_norm": 0.016125528141856194,
"learning_rate": 9.768111815377042e-05,
"loss": 0.03900146484375,
"step": 60
},
{
"epoch": 0.305,
"grad_norm": 0.020586300641298294,
"learning_rate": 9.756177587652856e-05,
"loss": 0.05072021484375,
"step": 61
},
{
"epoch": 0.31,
"grad_norm": 0.015897052362561226,
"learning_rate": 9.743952455844245e-05,
"loss": 0.0466156005859375,
"step": 62
},
{
"epoch": 0.315,
"grad_norm": 0.01866666041314602,
"learning_rate": 9.731437255522727e-05,
"loss": 0.042781829833984375,
"step": 63
},
{
"epoch": 0.32,
"grad_norm": 0.02183070406317711,
"learning_rate": 9.71863284208562e-05,
"loss": 0.042938232421875,
"step": 64
},
{
"epoch": 0.325,
"grad_norm": 0.013651255518198013,
"learning_rate": 9.705540090697575e-05,
"loss": 0.03275299072265625,
"step": 65
},
{
"epoch": 0.33,
"grad_norm": 0.021585367619991302,
"learning_rate": 9.692159896230756e-05,
"loss": 0.047580718994140625,
"step": 66
},
{
"epoch": 0.335,
"grad_norm": 0.02376355230808258,
"learning_rate": 9.678493173203682e-05,
"loss": 0.044921875,
"step": 67
},
{
"epoch": 0.34,
"grad_norm": 0.0204895231872797,
"learning_rate": 9.66454085571872e-05,
"loss": 0.040069580078125,
"step": 68
},
{
"epoch": 0.345,
"grad_norm": 0.02624756097793579,
"learning_rate": 9.650303897398232e-05,
"loss": 0.0423736572265625,
"step": 69
},
{
"epoch": 0.35,
"grad_norm": 0.020928798243403435,
"learning_rate": 9.635783271319409e-05,
"loss": 0.03409576416015625,
"step": 70
},
{
"epoch": 0.355,
"grad_norm": 0.014311402104794979,
"learning_rate": 9.620979969947759e-05,
"loss": 0.0413970947265625,
"step": 71
},
{
"epoch": 0.36,
"grad_norm": 0.016797911375761032,
"learning_rate": 9.605895005069262e-05,
"loss": 0.036468505859375,
"step": 72
},
{
"epoch": 0.365,
"grad_norm": 0.01776743307709694,
"learning_rate": 9.590529407721231e-05,
"loss": 0.03543853759765625,
"step": 73
},
{
"epoch": 0.37,
"grad_norm": 0.014951060526072979,
"learning_rate": 9.574884228121836e-05,
"loss": 0.030670166015625,
"step": 74
},
{
"epoch": 0.375,
"grad_norm": 0.020909463986754417,
"learning_rate": 9.558960535598316e-05,
"loss": 0.03610992431640625,
"step": 75
},
{
"epoch": 0.38,
"grad_norm": 0.021412597969174385,
"learning_rate": 9.542759418513906e-05,
"loss": 0.0379638671875,
"step": 76
},
{
"epoch": 0.385,
"grad_norm": 0.017438918352127075,
"learning_rate": 9.526281984193436e-05,
"loss": 0.04095458984375,
"step": 77
},
{
"epoch": 0.39,
"grad_norm": 0.026842506602406502,
"learning_rate": 9.509529358847655e-05,
"loss": 0.0329132080078125,
"step": 78
},
{
"epoch": 0.395,
"grad_norm": 0.01835726387798786,
"learning_rate": 9.492502687496253e-05,
"loss": 0.0428314208984375,
"step": 79
},
{
"epoch": 0.4,
"grad_norm": 0.013388189487159252,
"learning_rate": 9.4752031338896e-05,
"loss": 0.0354766845703125,
"step": 80
},
{
"epoch": 0.4,
"eval_loss": 0.03489327430725098,
"eval_runtime": 28.3541,
"eval_samples_per_second": 0.952,
"eval_steps_per_second": 0.141,
"step": 80
},
{
"epoch": 0.405,
"grad_norm": 0.01896721124649048,
"learning_rate": 9.4576318804292e-05,
"loss": 0.040676116943359375,
"step": 81
},
{
"epoch": 0.41,
"grad_norm": 0.021692641079425812,
"learning_rate": 9.439790128086894e-05,
"loss": 0.03216552734375,
"step": 82
},
{
"epoch": 0.415,
"grad_norm": 0.014553118497133255,
"learning_rate": 9.421679096322747e-05,
"loss": 0.043487548828125,
"step": 83
},
{
"epoch": 0.42,
"grad_norm": 0.023560672998428345,
"learning_rate": 9.403300023001728e-05,
"loss": 0.04047393798828125,
"step": 84
},
{
"epoch": 0.425,
"grad_norm": 0.018022865056991577,
"learning_rate": 9.384654164309083e-05,
"loss": 0.041473388671875,
"step": 85
},
{
"epoch": 0.43,
"grad_norm": 0.01921142265200615,
"learning_rate": 9.365742794664484e-05,
"loss": 0.05157470703125,
"step": 86
},
{
"epoch": 0.435,
"grad_norm": 0.017880946397781372,
"learning_rate": 9.346567206634927e-05,
"loss": 0.0452880859375,
"step": 87
},
{
"epoch": 0.44,
"grad_norm": 0.022030450403690338,
"learning_rate": 9.327128710846379e-05,
"loss": 0.037017822265625,
"step": 88
},
{
"epoch": 0.445,
"grad_norm": 0.016076408326625824,
"learning_rate": 9.30742863589421e-05,
"loss": 0.0357666015625,
"step": 89
},
{
"epoch": 0.45,
"grad_norm": 0.01490243710577488,
"learning_rate": 9.287468328252372e-05,
"loss": 0.03411102294921875,
"step": 90
},
{
"epoch": 0.455,
"grad_norm": 0.01804336905479431,
"learning_rate": 9.267249152181379e-05,
"loss": 0.0401763916015625,
"step": 91
},
{
"epoch": 0.46,
"grad_norm": 0.012609057128429413,
"learning_rate": 9.246772489635057e-05,
"loss": 0.03302001953125,
"step": 92
},
{
"epoch": 0.465,
"grad_norm": 0.017548903822898865,
"learning_rate": 9.226039740166091e-05,
"loss": 0.04241943359375,
"step": 93
},
{
"epoch": 0.47,
"grad_norm": 0.020240291953086853,
"learning_rate": 9.205052320830367e-05,
"loss": 0.047595977783203125,
"step": 94
},
{
"epoch": 0.475,
"grad_norm": 0.01528893131762743,
"learning_rate": 9.183811666090118e-05,
"loss": 0.038116455078125,
"step": 95
},
{
"epoch": 0.48,
"grad_norm": 0.01530187763273716,
"learning_rate": 9.162319227715878e-05,
"loss": 0.04156494140625,
"step": 96
},
{
"epoch": 0.485,
"grad_norm": 0.01865176111459732,
"learning_rate": 9.140576474687264e-05,
"loss": 0.040771484375,
"step": 97
},
{
"epoch": 0.49,
"grad_norm": 0.012654994614422321,
"learning_rate": 9.118584893092563e-05,
"loss": 0.03326416015625,
"step": 98
},
{
"epoch": 0.495,
"grad_norm": 0.0152023546397686,
"learning_rate": 9.096345986027161e-05,
"loss": 0.0385894775390625,
"step": 99
},
{
"epoch": 0.5,
"grad_norm": 0.016569027677178383,
"learning_rate": 9.07386127349082e-05,
"loss": 0.0369415283203125,
"step": 100
},
{
"epoch": 0.505,
"grad_norm": 0.015082771889865398,
"learning_rate": 9.051132292283771e-05,
"loss": 0.0381011962890625,
"step": 101
},
{
"epoch": 0.51,
"grad_norm": 0.013354030437767506,
"learning_rate": 9.028160595901689e-05,
"loss": 0.02880096435546875,
"step": 102
},
{
"epoch": 0.515,
"grad_norm": 0.011870468966662884,
"learning_rate": 9.004947754429507e-05,
"loss": 0.02591705322265625,
"step": 103
},
{
"epoch": 0.52,
"grad_norm": 0.014292772859334946,
"learning_rate": 8.981495354434103e-05,
"loss": 0.0422515869140625,
"step": 104
},
{
"epoch": 0.525,
"grad_norm": 0.012471764348447323,
"learning_rate": 8.957804998855866e-05,
"loss": 0.0385894775390625,
"step": 105
},
{
"epoch": 0.53,
"grad_norm": 0.015379557386040688,
"learning_rate": 8.93387830689913e-05,
"loss": 0.03763580322265625,
"step": 106
},
{
"epoch": 0.535,
"grad_norm": 0.015690065920352936,
"learning_rate": 8.909716913921508e-05,
"loss": 0.03033447265625,
"step": 107
},
{
"epoch": 0.54,
"grad_norm": 0.016691656783223152,
"learning_rate": 8.885322471322112e-05,
"loss": 0.03069305419921875,
"step": 108
},
{
"epoch": 0.545,
"grad_norm": 0.020343007519841194,
"learning_rate": 8.860696646428693e-05,
"loss": 0.0328826904296875,
"step": 109
},
{
"epoch": 0.55,
"grad_norm": 0.04021941497921944,
"learning_rate": 8.83584112238367e-05,
"loss": 0.036376953125,
"step": 110
},
{
"epoch": 0.555,
"grad_norm": 0.02442409098148346,
"learning_rate": 8.810757598029093e-05,
"loss": 0.035491943359375,
"step": 111
},
{
"epoch": 0.56,
"grad_norm": 0.015310805290937424,
"learning_rate": 8.785447787790534e-05,
"loss": 0.037628173828125,
"step": 112
},
{
"epoch": 0.565,
"grad_norm": 0.018267996609210968,
"learning_rate": 8.759913421559902e-05,
"loss": 0.03273773193359375,
"step": 113
},
{
"epoch": 0.57,
"grad_norm": 0.01219545491039753,
"learning_rate": 8.734156244577209e-05,
"loss": 0.031951904296875,
"step": 114
},
{
"epoch": 0.575,
"grad_norm": 0.020344750955700874,
"learning_rate": 8.708178017311287e-05,
"loss": 0.043609619140625,
"step": 115
},
{
"epoch": 0.58,
"grad_norm": 0.02359812706708908,
"learning_rate": 8.681980515339464e-05,
"loss": 0.0442352294921875,
"step": 116
},
{
"epoch": 0.585,
"grad_norm": 0.02012728713452816,
"learning_rate": 8.655565529226198e-05,
"loss": 0.045928955078125,
"step": 117
},
{
"epoch": 0.59,
"grad_norm": 0.0184403657913208,
"learning_rate": 8.628934864400706e-05,
"loss": 0.03472900390625,
"step": 118
},
{
"epoch": 0.595,
"grad_norm": 0.017508087679743767,
"learning_rate": 8.602090341033547e-05,
"loss": 0.040069580078125,
"step": 119
},
{
"epoch": 0.6,
"grad_norm": 0.014133688062429428,
"learning_rate": 8.575033793912239e-05,
"loss": 0.0308837890625,
"step": 120
},
{
"epoch": 0.605,
"grad_norm": 0.01238363329321146,
"learning_rate": 8.547767072315835e-05,
"loss": 0.02675628662109375,
"step": 121
},
{
"epoch": 0.61,
"grad_norm": 0.029849538579583168,
"learning_rate": 8.520292039888539e-05,
"loss": 0.0382843017578125,
"step": 122
},
{
"epoch": 0.615,
"grad_norm": 0.017021069303154945,
"learning_rate": 8.492610574512317e-05,
"loss": 0.045654296875,
"step": 123
},
{
"epoch": 0.62,
"grad_norm": 0.014278067275881767,
"learning_rate": 8.46472456817856e-05,
"loss": 0.0348358154296875,
"step": 124
},
{
"epoch": 0.625,
"grad_norm": 0.01516707893460989,
"learning_rate": 8.436635926858759e-05,
"loss": 0.0356292724609375,
"step": 125
},
{
"epoch": 0.63,
"grad_norm": 0.010814281180500984,
"learning_rate": 8.408346570374233e-05,
"loss": 0.03143310546875,
"step": 126
},
{
"epoch": 0.635,
"grad_norm": 0.014818891882896423,
"learning_rate": 8.379858432264925e-05,
"loss": 0.031951904296875,
"step": 127
},
{
"epoch": 0.64,
"grad_norm": 0.015958471223711967,
"learning_rate": 8.351173459657227e-05,
"loss": 0.0411376953125,
"step": 128
},
{
"epoch": 0.645,
"grad_norm": 0.012437131255865097,
"learning_rate": 8.322293613130917e-05,
"loss": 0.02826690673828125,
"step": 129
},
{
"epoch": 0.65,
"grad_norm": 0.04986541345715523,
"learning_rate": 8.29322086658514e-05,
"loss": 0.040924072265625,
"step": 130
},
{
"epoch": 0.655,
"grad_norm": 0.015265759080648422,
"learning_rate": 8.263957207103507e-05,
"loss": 0.029491424560546875,
"step": 131
},
{
"epoch": 0.66,
"grad_norm": 0.016343101859092712,
"learning_rate": 8.234504634818267e-05,
"loss": 0.03159332275390625,
"step": 132
},
{
"epoch": 0.665,
"grad_norm": 0.015688840299844742,
"learning_rate": 8.204865162773613e-05,
"loss": 0.0380859375,
"step": 133
},
{
"epoch": 0.67,
"grad_norm": 0.013779958710074425,
"learning_rate": 8.17504081678809e-05,
"loss": 0.0353546142578125,
"step": 134
},
{
"epoch": 0.675,
"grad_norm": 0.014648032374680042,
"learning_rate": 8.14503363531613e-05,
"loss": 0.04010772705078125,
"step": 135
},
{
"epoch": 0.68,
"grad_norm": 0.015630153939127922,
"learning_rate": 8.114845669308723e-05,
"loss": 0.0338287353515625,
"step": 136
},
{
"epoch": 0.685,
"grad_norm": 0.01083196047693491,
"learning_rate": 8.084478982073247e-05,
"loss": 0.0377655029296875,
"step": 137
},
{
"epoch": 0.69,
"grad_norm": 0.01352809090167284,
"learning_rate": 8.053935649132437e-05,
"loss": 0.03235626220703125,
"step": 138
},
{
"epoch": 0.695,
"grad_norm": 0.014272249303758144,
"learning_rate": 8.023217758082529e-05,
"loss": 0.03082275390625,
"step": 139
},
{
"epoch": 0.7,
"grad_norm": 0.016515057533979416,
"learning_rate": 7.992327408450569e-05,
"loss": 0.032867431640625,
"step": 140
},
{
"epoch": 0.705,
"grad_norm": 0.013200527988374233,
"learning_rate": 7.961266711550922e-05,
"loss": 0.036224365234375,
"step": 141
},
{
"epoch": 0.71,
"grad_norm": 0.011445350013673306,
"learning_rate": 7.930037790340963e-05,
"loss": 0.0290985107421875,
"step": 142
},
{
"epoch": 0.715,
"grad_norm": 0.014979459345340729,
"learning_rate": 7.898642779275972e-05,
"loss": 0.025959014892578125,
"step": 143
},
{
"epoch": 0.72,
"grad_norm": 0.014446934685111046,
"learning_rate": 7.867083824163254e-05,
"loss": 0.0315704345703125,
"step": 144
},
{
"epoch": 0.725,
"grad_norm": 0.011316702701151371,
"learning_rate": 7.835363082015468e-05,
"loss": 0.0324249267578125,
"step": 145
},
{
"epoch": 0.73,
"grad_norm": 0.01544218696653843,
"learning_rate": 7.803482720903205e-05,
"loss": 0.0286102294921875,
"step": 146
},
{
"epoch": 0.735,
"grad_norm": 0.13669143617153168,
"learning_rate": 7.771444919806798e-05,
"loss": 0.03907012939453125,
"step": 147
},
{
"epoch": 0.74,
"grad_norm": 0.02304857224225998,
"learning_rate": 7.739251868467393e-05,
"loss": 0.042835235595703125,
"step": 148
},
{
"epoch": 0.745,
"grad_norm": 0.014206026680767536,
"learning_rate": 7.706905767237288e-05,
"loss": 0.0366668701171875,
"step": 149
},
{
"epoch": 0.75,
"grad_norm": 0.019232211634516716,
"learning_rate": 7.674408826929534e-05,
"loss": 0.0406036376953125,
"step": 150
},
{
"epoch": 0.755,
"grad_norm": 0.011523840948939323,
"learning_rate": 7.641763268666831e-05,
"loss": 0.0338134765625,
"step": 151
},
{
"epoch": 0.76,
"grad_norm": 0.01299508661031723,
"learning_rate": 7.608971323729728e-05,
"loss": 0.0387420654296875,
"step": 152
},
{
"epoch": 0.765,
"grad_norm": 0.012335872277617455,
"learning_rate": 7.576035233404096e-05,
"loss": 0.038547515869140625,
"step": 153
},
{
"epoch": 0.77,
"grad_norm": 0.018646301701664925,
"learning_rate": 7.542957248827961e-05,
"loss": 0.03460693359375,
"step": 154
},
{
"epoch": 0.775,
"grad_norm": 0.018792515620589256,
"learning_rate": 7.50973963083763e-05,
"loss": 0.0379638671875,
"step": 155
},
{
"epoch": 0.78,
"grad_norm": 0.015776216983795166,
"learning_rate": 7.476384649813167e-05,
"loss": 0.0323333740234375,
"step": 156
},
{
"epoch": 0.785,
"grad_norm": 0.020831342786550522,
"learning_rate": 7.442894585523218e-05,
"loss": 0.0391387939453125,
"step": 157
},
{
"epoch": 0.79,
"grad_norm": 0.017143981531262398,
"learning_rate": 7.409271726969192e-05,
"loss": 0.0317230224609375,
"step": 158
},
{
"epoch": 0.795,
"grad_norm": 0.011811457574367523,
"learning_rate": 7.375518372228806e-05,
"loss": 0.02951812744140625,
"step": 159
},
{
"epoch": 0.8,
"grad_norm": 0.01569269597530365,
"learning_rate": 7.341636828299023e-05,
"loss": 0.0395355224609375,
"step": 160
},
{
"epoch": 0.8,
"eval_loss": 0.03098893165588379,
"eval_runtime": 28.3877,
"eval_samples_per_second": 0.951,
"eval_steps_per_second": 0.141,
"step": 160
},
{
"epoch": 0.805,
"grad_norm": 0.012150801718235016,
"learning_rate": 7.307629410938363e-05,
"loss": 0.0354461669921875,
"step": 161
},
{
"epoch": 0.81,
"grad_norm": 0.016524996608495712,
"learning_rate": 7.273498444508628e-05,
"loss": 0.0362548828125,
"step": 162
},
{
"epoch": 0.815,
"grad_norm": 0.17121411859989166,
"learning_rate": 7.239246261816035e-05,
"loss": 0.03398895263671875,
"step": 163
},
{
"epoch": 0.82,
"grad_norm": 0.01245883945375681,
"learning_rate": 7.204875203951774e-05,
"loss": 0.032806396484375,
"step": 164
},
{
"epoch": 0.825,
"grad_norm": 0.015971507877111435,
"learning_rate": 7.170387620131993e-05,
"loss": 0.0379638671875,
"step": 165
},
{
"epoch": 0.83,
"grad_norm": 0.013089642859995365,
"learning_rate": 7.135785867537234e-05,
"loss": 0.0324249267578125,
"step": 166
},
{
"epoch": 0.835,
"grad_norm": 0.01805449277162552,
"learning_rate": 7.101072311151324e-05,
"loss": 0.0274658203125,
"step": 167
},
{
"epoch": 0.84,
"grad_norm": 0.013880079612135887,
"learning_rate": 7.06624932359973e-05,
"loss": 0.0326995849609375,
"step": 168
},
{
"epoch": 0.845,
"grad_norm": 0.012722963467240334,
"learning_rate": 7.031319284987394e-05,
"loss": 0.0314178466796875,
"step": 169
},
{
"epoch": 0.85,
"grad_norm": 0.01585008203983307,
"learning_rate": 6.996284582736056e-05,
"loss": 0.0345611572265625,
"step": 170
},
{
"epoch": 0.855,
"grad_norm": 0.016173021867871284,
"learning_rate": 6.961147611421075e-05,
"loss": 0.03189849853515625,
"step": 171
},
{
"epoch": 0.86,
"grad_norm": 0.01533008087426424,
"learning_rate": 6.92591077260777e-05,
"loss": 0.033050537109375,
"step": 172
},
{
"epoch": 0.865,
"grad_norm": 0.01337040401995182,
"learning_rate": 6.890576474687263e-05,
"loss": 0.031768798828125,
"step": 173
},
{
"epoch": 0.87,
"grad_norm": 0.011512755416333675,
"learning_rate": 6.855147132711884e-05,
"loss": 0.02989959716796875,
"step": 174
},
{
"epoch": 0.875,
"grad_norm": 0.013947159051895142,
"learning_rate": 6.819625168230093e-05,
"loss": 0.0273284912109375,
"step": 175
},
{
"epoch": 0.88,
"grad_norm": 0.016053346917033195,
"learning_rate": 6.784013009120974e-05,
"loss": 0.03271484375,
"step": 176
},
{
"epoch": 0.885,
"grad_norm": 0.01287975162267685,
"learning_rate": 6.7483130894283e-05,
"loss": 0.0211181640625,
"step": 177
},
{
"epoch": 0.89,
"grad_norm": 0.01123369112610817,
"learning_rate": 6.712527849194162e-05,
"loss": 0.02886962890625,
"step": 178
},
{
"epoch": 0.895,
"grad_norm": 0.013561406172811985,
"learning_rate": 6.676659734292189e-05,
"loss": 0.0310516357421875,
"step": 179
},
{
"epoch": 0.9,
"grad_norm": 0.01320588681846857,
"learning_rate": 6.640711196260393e-05,
"loss": 0.033935546875,
"step": 180
},
{
"epoch": 0.905,
"grad_norm": 0.013400975614786148,
"learning_rate": 6.604684692133597e-05,
"loss": 0.0310516357421875,
"step": 181
},
{
"epoch": 0.91,
"grad_norm": 0.011845126748085022,
"learning_rate": 6.5685826842755e-05,
"loss": 0.02423095703125,
"step": 182
},
{
"epoch": 0.915,
"grad_norm": 0.013208305463194847,
"learning_rate": 6.532407640210383e-05,
"loss": 0.0382537841796875,
"step": 183
},
{
"epoch": 0.92,
"grad_norm": 0.024753054603934288,
"learning_rate": 6.496162032454454e-05,
"loss": 0.0308990478515625,
"step": 184
},
{
"epoch": 0.925,
"grad_norm": 0.016255544498562813,
"learning_rate": 6.459848338346861e-05,
"loss": 0.0276947021484375,
"step": 185
},
{
"epoch": 0.93,
"grad_norm": 0.015609354712069035,
"learning_rate": 6.423469039880354e-05,
"loss": 0.0390472412109375,
"step": 186
},
{
"epoch": 0.935,
"grad_norm": 0.009405655786395073,
"learning_rate": 6.387026623531661e-05,
"loss": 0.02411651611328125,
"step": 187
},
{
"epoch": 0.94,
"grad_norm": 0.013661784119904041,
"learning_rate": 6.350523580091532e-05,
"loss": 0.0293426513671875,
"step": 188
},
{
"epoch": 0.945,
"grad_norm": 0.014555767178535461,
"learning_rate": 6.313962404494496e-05,
"loss": 0.03389739990234375,
"step": 189
},
{
"epoch": 0.95,
"grad_norm": 0.01418206375092268,
"learning_rate": 6.277345595648337e-05,
"loss": 0.03375244140625,
"step": 190
},
{
"epoch": 0.955,
"grad_norm": 0.023851638659834862,
"learning_rate": 6.240675656263303e-05,
"loss": 0.0290069580078125,
"step": 191
},
{
"epoch": 0.96,
"grad_norm": 0.015131880529224873,
"learning_rate": 6.203955092681039e-05,
"loss": 0.0372772216796875,
"step": 192
},
{
"epoch": 0.965,
"grad_norm": 0.016015928238630295,
"learning_rate": 6.167186414703289e-05,
"loss": 0.0377197265625,
"step": 193
},
{
"epoch": 0.97,
"grad_norm": 0.01045469380915165,
"learning_rate": 6.130372135420351e-05,
"loss": 0.0282135009765625,
"step": 194
},
{
"epoch": 0.975,
"grad_norm": 0.015949321910738945,
"learning_rate": 6.0935147710393117e-05,
"loss": 0.031494140625,
"step": 195
},
{
"epoch": 0.98,
"grad_norm": 0.012823979370296001,
"learning_rate": 6.056616840712065e-05,
"loss": 0.02597808837890625,
"step": 196
},
{
"epoch": 0.985,
"grad_norm": 0.014250967651605606,
"learning_rate": 6.019680866363139e-05,
"loss": 0.0314483642578125,
"step": 197
},
{
"epoch": 0.99,
"grad_norm": 0.013376348651945591,
"learning_rate": 5.982709372517313e-05,
"loss": 0.0341033935546875,
"step": 198
},
{
"epoch": 0.995,
"grad_norm": 0.013810945674777031,
"learning_rate": 5.9457048861270834e-05,
"loss": 0.030609130859375,
"step": 199
},
{
"epoch": 1.0,
"grad_norm": 0.018971672281622887,
"learning_rate": 5.9086699363999373e-05,
"loss": 0.0342864990234375,
"step": 200
},
{
"epoch": 1.005,
"grad_norm": 0.012260881252586842,
"learning_rate": 5.8716070546254966e-05,
"loss": 0.0346832275390625,
"step": 201
},
{
"epoch": 1.01,
"grad_norm": 0.011518058367073536,
"learning_rate": 5.8345187740024954e-05,
"loss": 0.028076171875,
"step": 202
},
{
"epoch": 1.015,
"grad_norm": 0.011177563108503819,
"learning_rate": 5.7974076294656476e-05,
"loss": 0.03180694580078125,
"step": 203
},
{
"epoch": 1.02,
"grad_norm": 0.015048347413539886,
"learning_rate": 5.760276157512389e-05,
"loss": 0.0311737060546875,
"step": 204
},
{
"epoch": 1.025,
"grad_norm": 0.01451602578163147,
"learning_rate": 5.7231268960295e-05,
"loss": 0.0342559814453125,
"step": 205
},
{
"epoch": 1.03,
"grad_norm": 0.012694913893938065,
"learning_rate": 5.6859623841196595e-05,
"loss": 0.03231048583984375,
"step": 206
},
{
"epoch": 1.035,
"grad_norm": 0.0170957800000906,
"learning_rate": 5.648785161927888e-05,
"loss": 0.0325927734375,
"step": 207
},
{
"epoch": 1.04,
"grad_norm": 0.01753183826804161,
"learning_rate": 5.611597770467936e-05,
"loss": 0.0388641357421875,
"step": 208
},
{
"epoch": 1.045,
"grad_norm": 0.01130843348801136,
"learning_rate": 5.574402751448614e-05,
"loss": 0.02392578125,
"step": 209
},
{
"epoch": 1.05,
"grad_norm": 0.011236002668738365,
"learning_rate": 5.537202647100063e-05,
"loss": 0.027374267578125,
"step": 210
},
{
"epoch": 1.055,
"grad_norm": 0.009808492846786976,
"learning_rate": 5.500000000000001e-05,
"loss": 0.026319503784179688,
"step": 211
},
{
"epoch": 1.06,
"grad_norm": 0.01099427416920662,
"learning_rate": 5.462797352899939e-05,
"loss": 0.02689361572265625,
"step": 212
},
{
"epoch": 1.065,
"grad_norm": 0.01430500764399767,
"learning_rate": 5.425597248551387e-05,
"loss": 0.0367431640625,
"step": 213
},
{
"epoch": 1.07,
"grad_norm": 0.012247784994542599,
"learning_rate": 5.388402229532065e-05,
"loss": 0.036895751953125,
"step": 214
},
{
"epoch": 1.075,
"grad_norm": 0.012278667651116848,
"learning_rate": 5.351214838072113e-05,
"loss": 0.0282745361328125,
"step": 215
},
{
"epoch": 1.08,
"grad_norm": 0.01197484228760004,
"learning_rate": 5.314037615880341e-05,
"loss": 0.0281829833984375,
"step": 216
},
{
"epoch": 1.085,
"grad_norm": 0.010302647016942501,
"learning_rate": 5.2768731039705e-05,
"loss": 0.02788543701171875,
"step": 217
},
{
"epoch": 1.09,
"grad_norm": 0.01971321552991867,
"learning_rate": 5.239723842487613e-05,
"loss": 0.037200927734375,
"step": 218
},
{
"epoch": 1.095,
"grad_norm": 0.012483607977628708,
"learning_rate": 5.2025923705343535e-05,
"loss": 0.03564453125,
"step": 219
},
{
"epoch": 1.1,
"grad_norm": 0.014276109635829926,
"learning_rate": 5.165481225997507e-05,
"loss": 0.03778076171875,
"step": 220
},
{
"epoch": 1.105,
"grad_norm": 0.00952853262424469,
"learning_rate": 5.128392945374505e-05,
"loss": 0.0271148681640625,
"step": 221
},
{
"epoch": 1.11,
"grad_norm": 0.012801293283700943,
"learning_rate": 5.0913300636000624e-05,
"loss": 0.031585693359375,
"step": 222
},
{
"epoch": 1.115,
"grad_norm": 0.012339530512690544,
"learning_rate": 5.054295113872918e-05,
"loss": 0.03807830810546875,
"step": 223
},
{
"epoch": 1.12,
"grad_norm": 0.01411394402384758,
"learning_rate": 5.017290627482688e-05,
"loss": 0.0302581787109375,
"step": 224
},
{
"epoch": 1.125,
"grad_norm": 0.011293116956949234,
"learning_rate": 4.980319133636863e-05,
"loss": 0.0330352783203125,
"step": 225
},
{
"epoch": 1.13,
"grad_norm": 0.01050038542598486,
"learning_rate": 4.9433831592879355e-05,
"loss": 0.0325927734375,
"step": 226
},
{
"epoch": 1.135,
"grad_norm": 0.010293497703969479,
"learning_rate": 4.90648522896069e-05,
"loss": 0.03238677978515625,
"step": 227
},
{
"epoch": 1.1400000000000001,
"grad_norm": 0.011916328221559525,
"learning_rate": 4.86962786457965e-05,
"loss": 0.0326385498046875,
"step": 228
},
{
"epoch": 1.145,
"grad_norm": 0.012021253816783428,
"learning_rate": 4.83281358529671e-05,
"loss": 0.02626800537109375,
"step": 229
},
{
"epoch": 1.15,
"grad_norm": 0.01019071415066719,
"learning_rate": 4.7960449073189606e-05,
"loss": 0.029571533203125,
"step": 230
},
{
"epoch": 1.155,
"grad_norm": 0.01098195556551218,
"learning_rate": 4.7593243437366975e-05,
"loss": 0.0305328369140625,
"step": 231
},
{
"epoch": 1.16,
"grad_norm": 0.010289876721799374,
"learning_rate": 4.722654404351665e-05,
"loss": 0.030487060546875,
"step": 232
},
{
"epoch": 1.165,
"grad_norm": 0.012640922330319881,
"learning_rate": 4.686037595505507e-05,
"loss": 0.02504730224609375,
"step": 233
},
{
"epoch": 1.17,
"grad_norm": 0.010987567715346813,
"learning_rate": 4.6494764199084695e-05,
"loss": 0.02408599853515625,
"step": 234
},
{
"epoch": 1.175,
"grad_norm": 0.009844702668488026,
"learning_rate": 4.612973376468339e-05,
"loss": 0.02532958984375,
"step": 235
},
{
"epoch": 1.18,
"grad_norm": 0.013736176304519176,
"learning_rate": 4.576530960119646e-05,
"loss": 0.039520263671875,
"step": 236
},
{
"epoch": 1.185,
"grad_norm": 0.012891293503344059,
"learning_rate": 4.54015166165314e-05,
"loss": 0.0346527099609375,
"step": 237
},
{
"epoch": 1.19,
"grad_norm": 0.06185446307063103,
"learning_rate": 4.5038379675455455e-05,
"loss": 0.0376129150390625,
"step": 238
},
{
"epoch": 1.195,
"grad_norm": 0.008688431233167648,
"learning_rate": 4.467592359789618e-05,
"loss": 0.0287628173828125,
"step": 239
},
{
"epoch": 1.2,
"grad_norm": 0.009764442220330238,
"learning_rate": 4.431417315724502e-05,
"loss": 0.0291900634765625,
"step": 240
},
{
"epoch": 1.2,
"eval_loss": 0.028431415557861328,
"eval_runtime": 28.2883,
"eval_samples_per_second": 0.954,
"eval_steps_per_second": 0.141,
"step": 240
},
{
"epoch": 1.205,
"grad_norm": 0.009662406519055367,
"learning_rate": 4.395315307866405e-05,
"loss": 0.02191162109375,
"step": 241
},
{
"epoch": 1.21,
"grad_norm": 0.00908933486789465,
"learning_rate": 4.359288803739607e-05,
"loss": 0.023895263671875,
"step": 242
},
{
"epoch": 1.215,
"grad_norm": 0.01030402909964323,
"learning_rate": 4.3233402657078115e-05,
"loss": 0.0335540771484375,
"step": 243
},
{
"epoch": 1.22,
"grad_norm": 0.012763289734721184,
"learning_rate": 4.2874721508058394e-05,
"loss": 0.028594970703125,
"step": 244
},
{
"epoch": 1.225,
"grad_norm": 0.011976095847785473,
"learning_rate": 4.2516869105717004e-05,
"loss": 0.0277252197265625,
"step": 245
},
{
"epoch": 1.23,
"grad_norm": 0.00925954058766365,
"learning_rate": 4.215986990879027e-05,
"loss": 0.0278472900390625,
"step": 246
},
{
"epoch": 1.2349999999999999,
"grad_norm": 0.010557391680777073,
"learning_rate": 4.18037483176991e-05,
"loss": 0.03607177734375,
"step": 247
},
{
"epoch": 1.24,
"grad_norm": 0.014365902170538902,
"learning_rate": 4.144852867288117e-05,
"loss": 0.035251617431640625,
"step": 248
},
{
"epoch": 1.245,
"grad_norm": 0.017640303820371628,
"learning_rate": 4.109423525312738e-05,
"loss": 0.0262603759765625,
"step": 249
},
{
"epoch": 1.25,
"grad_norm": 0.009929345920681953,
"learning_rate": 4.07408922739223e-05,
"loss": 0.0264434814453125,
"step": 250
},
{
"epoch": 1.255,
"grad_norm": 0.013882244937121868,
"learning_rate": 4.0388523885789256e-05,
"loss": 0.0301513671875,
"step": 251
},
{
"epoch": 1.26,
"grad_norm": 0.011529352515935898,
"learning_rate": 4.003715417263945e-05,
"loss": 0.0323638916015625,
"step": 252
},
{
"epoch": 1.2650000000000001,
"grad_norm": 0.012532991357147694,
"learning_rate": 3.968680715012606e-05,
"loss": 0.0297393798828125,
"step": 253
},
{
"epoch": 1.27,
"grad_norm": 0.010939935222268105,
"learning_rate": 3.9337506764002696e-05,
"loss": 0.0311279296875,
"step": 254
},
{
"epoch": 1.275,
"grad_norm": 0.0119152357801795,
"learning_rate": 3.898927688848676e-05,
"loss": 0.0316619873046875,
"step": 255
},
{
"epoch": 1.28,
"grad_norm": 0.01580975204706192,
"learning_rate": 3.864214132462765e-05,
"loss": 0.0294036865234375,
"step": 256
},
{
"epoch": 1.285,
"grad_norm": 0.020052200183272362,
"learning_rate": 3.829612379868006e-05,
"loss": 0.03711700439453125,
"step": 257
},
{
"epoch": 1.29,
"grad_norm": 0.009781856089830399,
"learning_rate": 3.795124796048225e-05,
"loss": 0.0296783447265625,
"step": 258
},
{
"epoch": 1.295,
"grad_norm": 0.01327812485396862,
"learning_rate": 3.7607537381839664e-05,
"loss": 0.0332183837890625,
"step": 259
},
{
"epoch": 1.3,
"grad_norm": 0.012484843842685223,
"learning_rate": 3.726501555491374e-05,
"loss": 0.0272064208984375,
"step": 260
},
{
"epoch": 1.305,
"grad_norm": 0.012586589902639389,
"learning_rate": 3.692370589061639e-05,
"loss": 0.0366668701171875,
"step": 261
},
{
"epoch": 1.31,
"grad_norm": 0.017182666808366776,
"learning_rate": 3.658363171700978e-05,
"loss": 0.0348052978515625,
"step": 262
},
{
"epoch": 1.315,
"grad_norm": 0.01260948646813631,
"learning_rate": 3.624481627771195e-05,
"loss": 0.030330657958984375,
"step": 263
},
{
"epoch": 1.32,
"grad_norm": 0.016813892871141434,
"learning_rate": 3.590728273030809e-05,
"loss": 0.0311737060546875,
"step": 264
},
{
"epoch": 1.325,
"grad_norm": 0.02393505908548832,
"learning_rate": 3.557105414476782e-05,
"loss": 0.02386474609375,
"step": 265
},
{
"epoch": 1.33,
"grad_norm": 0.012872851453721523,
"learning_rate": 3.523615350186834e-05,
"loss": 0.036708831787109375,
"step": 266
},
{
"epoch": 1.335,
"grad_norm": 0.013852291740477085,
"learning_rate": 3.4902603691623715e-05,
"loss": 0.0322113037109375,
"step": 267
},
{
"epoch": 1.34,
"grad_norm": 0.0120933772996068,
"learning_rate": 3.45704275117204e-05,
"loss": 0.03125762939453125,
"step": 268
},
{
"epoch": 1.345,
"grad_norm": 0.011581032536923885,
"learning_rate": 3.423964766595906e-05,
"loss": 0.0313262939453125,
"step": 269
},
{
"epoch": 1.35,
"grad_norm": 0.01317279227077961,
"learning_rate": 3.391028676270274e-05,
"loss": 0.023712158203125,
"step": 270
},
{
"epoch": 1.355,
"grad_norm": 0.011064618825912476,
"learning_rate": 3.358236731333169e-05,
"loss": 0.0304718017578125,
"step": 271
},
{
"epoch": 1.3599999999999999,
"grad_norm": 0.01208885945379734,
"learning_rate": 3.3255911730704686e-05,
"loss": 0.0293121337890625,
"step": 272
},
{
"epoch": 1.365,
"grad_norm": 0.012625926174223423,
"learning_rate": 3.293094232762715e-05,
"loss": 0.02788543701171875,
"step": 273
},
{
"epoch": 1.37,
"grad_norm": 0.008723299019038677,
"learning_rate": 3.260748131532609e-05,
"loss": 0.0234527587890625,
"step": 274
},
{
"epoch": 1.375,
"grad_norm": 0.015441285446286201,
"learning_rate": 3.2285550801932046e-05,
"loss": 0.026874542236328125,
"step": 275
},
{
"epoch": 1.38,
"grad_norm": 0.015323000960052013,
"learning_rate": 3.1965172790967965e-05,
"loss": 0.02556610107421875,
"step": 276
},
{
"epoch": 1.385,
"grad_norm": 0.009566771797835827,
"learning_rate": 3.164636917984534e-05,
"loss": 0.032073974609375,
"step": 277
},
{
"epoch": 1.3900000000000001,
"grad_norm": 0.00870845653116703,
"learning_rate": 3.1329161758367474e-05,
"loss": 0.025909423828125,
"step": 278
},
{
"epoch": 1.395,
"grad_norm": 0.015511032193899155,
"learning_rate": 3.101357220724029e-05,
"loss": 0.034149169921875,
"step": 279
},
{
"epoch": 1.4,
"grad_norm": 0.010509622283279896,
"learning_rate": 3.069962209659039e-05,
"loss": 0.028778076171875,
"step": 280
},
{
"epoch": 1.405,
"grad_norm": 0.012134591117501259,
"learning_rate": 3.0387332884490805e-05,
"loss": 0.02805328369140625,
"step": 281
},
{
"epoch": 1.41,
"grad_norm": 0.009603182785212994,
"learning_rate": 3.0076725915494342e-05,
"loss": 0.02630615234375,
"step": 282
},
{
"epoch": 1.415,
"grad_norm": 0.011478835716843605,
"learning_rate": 2.9767822419174735e-05,
"loss": 0.0364532470703125,
"step": 283
},
{
"epoch": 1.42,
"grad_norm": 0.014177806675434113,
"learning_rate": 2.9460643508675646e-05,
"loss": 0.03066253662109375,
"step": 284
},
{
"epoch": 1.425,
"grad_norm": 0.009659729897975922,
"learning_rate": 2.9155210179267546e-05,
"loss": 0.0316314697265625,
"step": 285
},
{
"epoch": 1.43,
"grad_norm": 0.01564187742769718,
"learning_rate": 2.885154330691278e-05,
"loss": 0.03838348388671875,
"step": 286
},
{
"epoch": 1.435,
"grad_norm": 0.01141000259667635,
"learning_rate": 2.854966364683872e-05,
"loss": 0.0345306396484375,
"step": 287
},
{
"epoch": 1.44,
"grad_norm": 0.008901636116206646,
"learning_rate": 2.82495918321191e-05,
"loss": 0.027801513671875,
"step": 288
},
{
"epoch": 1.445,
"grad_norm": 0.010393813252449036,
"learning_rate": 2.7951348372263875e-05,
"loss": 0.028045654296875,
"step": 289
},
{
"epoch": 1.45,
"grad_norm": 0.01010132022202015,
"learning_rate": 2.765495365181735e-05,
"loss": 0.02850341796875,
"step": 290
},
{
"epoch": 1.455,
"grad_norm": 0.011715458706021309,
"learning_rate": 2.736042792896495e-05,
"loss": 0.029327392578125,
"step": 291
},
{
"epoch": 1.46,
"grad_norm": 0.009373151697218418,
"learning_rate": 2.70677913341486e-05,
"loss": 0.02581024169921875,
"step": 292
},
{
"epoch": 1.465,
"grad_norm": 0.01763959228992462,
"learning_rate": 2.677706386869083e-05,
"loss": 0.03360748291015625,
"step": 293
},
{
"epoch": 1.47,
"grad_norm": 0.0119975870475173,
"learning_rate": 2.648826540342773e-05,
"loss": 0.036174774169921875,
"step": 294
},
{
"epoch": 1.475,
"grad_norm": 0.010560150258243084,
"learning_rate": 2.6201415677350754e-05,
"loss": 0.0302734375,
"step": 295
},
{
"epoch": 1.48,
"grad_norm": 0.010286550037562847,
"learning_rate": 2.5916534296257655e-05,
"loss": 0.0329132080078125,
"step": 296
},
{
"epoch": 1.4849999999999999,
"grad_norm": 0.011692552827298641,
"learning_rate": 2.5633640731412412e-05,
"loss": 0.0301666259765625,
"step": 297
},
{
"epoch": 1.49,
"grad_norm": 0.008653022348880768,
"learning_rate": 2.5352754318214388e-05,
"loss": 0.02614593505859375,
"step": 298
},
{
"epoch": 1.495,
"grad_norm": 0.014823955483734608,
"learning_rate": 2.507389425487683e-05,
"loss": 0.0302886962890625,
"step": 299
},
{
"epoch": 1.5,
"grad_norm": 0.009769944474101067,
"learning_rate": 2.4797079601114633e-05,
"loss": 0.02752685546875,
"step": 300
},
{
"epoch": 1.505,
"grad_norm": 0.011288745328783989,
"learning_rate": 2.4522329276841663e-05,
"loss": 0.0290679931640625,
"step": 301
},
{
"epoch": 1.51,
"grad_norm": 0.01025415025651455,
"learning_rate": 2.4249662060877625e-05,
"loss": 0.02318572998046875,
"step": 302
},
{
"epoch": 1.5150000000000001,
"grad_norm": 0.008605693466961384,
"learning_rate": 2.397909658966454e-05,
"loss": 0.0209197998046875,
"step": 303
},
{
"epoch": 1.52,
"grad_norm": 0.010999895632266998,
"learning_rate": 2.3710651355992965e-05,
"loss": 0.034942626953125,
"step": 304
},
{
"epoch": 1.525,
"grad_norm": 0.011252101510763168,
"learning_rate": 2.3444344707738015e-05,
"loss": 0.03350830078125,
"step": 305
},
{
"epoch": 1.53,
"grad_norm": 0.01330597884953022,
"learning_rate": 2.3180194846605367e-05,
"loss": 0.02883148193359375,
"step": 306
},
{
"epoch": 1.5350000000000001,
"grad_norm": 0.03568987175822258,
"learning_rate": 2.2918219826887135e-05,
"loss": 0.023555755615234375,
"step": 307
},
{
"epoch": 1.54,
"grad_norm": 0.011042929254472256,
"learning_rate": 2.265843755422793e-05,
"loss": 0.0248565673828125,
"step": 308
},
{
"epoch": 1.545,
"grad_norm": 0.010344709269702435,
"learning_rate": 2.2400865784401e-05,
"loss": 0.02606964111328125,
"step": 309
},
{
"epoch": 1.55,
"grad_norm": 0.014688103459775448,
"learning_rate": 2.2145522122094677e-05,
"loss": 0.0271759033203125,
"step": 310
},
{
"epoch": 1.5550000000000002,
"grad_norm": 0.013890204951167107,
"learning_rate": 2.189242401970908e-05,
"loss": 0.0247650146484375,
"step": 311
},
{
"epoch": 1.56,
"grad_norm": 0.011548725888133049,
"learning_rate": 2.1641588776163313e-05,
"loss": 0.02850341796875,
"step": 312
},
{
"epoch": 1.565,
"grad_norm": 0.010344250127673149,
"learning_rate": 2.1393033535713093e-05,
"loss": 0.02475738525390625,
"step": 313
},
{
"epoch": 1.5699999999999998,
"grad_norm": 0.014313779771327972,
"learning_rate": 2.1146775286778902e-05,
"loss": 0.02605438232421875,
"step": 314
},
{
"epoch": 1.575,
"grad_norm": 0.012160670012235641,
"learning_rate": 2.090283086078495e-05,
"loss": 0.0352935791015625,
"step": 315
},
{
"epoch": 1.58,
"grad_norm": 0.015203883871436119,
"learning_rate": 2.0661216931008714e-05,
"loss": 0.0348358154296875,
"step": 316
},
{
"epoch": 1.585,
"grad_norm": 0.011938238516449928,
"learning_rate": 2.0421950011441354e-05,
"loss": 0.0354156494140625,
"step": 317
},
{
"epoch": 1.5899999999999999,
"grad_norm": 0.011078753508627415,
"learning_rate": 2.0185046455658985e-05,
"loss": 0.026214599609375,
"step": 318
},
{
"epoch": 1.595,
"grad_norm": 0.011282606050372124,
"learning_rate": 1.9950522455704944e-05,
"loss": 0.0305633544921875,
"step": 319
},
{
"epoch": 1.6,
"grad_norm": 0.00796019472181797,
"learning_rate": 1.9718394040983118e-05,
"loss": 0.0254974365234375,
"step": 320
},
{
"epoch": 1.6,
"eval_loss": 0.02757096290588379,
"eval_runtime": 28.3735,
"eval_samples_per_second": 0.952,
"eval_steps_per_second": 0.141,
"step": 320
},
{
"epoch": 1.605,
"grad_norm": 0.007915240712463856,
"learning_rate": 1.9488677077162295e-05,
"loss": 0.0223846435546875,
"step": 321
},
{
"epoch": 1.6099999999999999,
"grad_norm": 0.015724292024970055,
"learning_rate": 1.9261387265091808e-05,
"loss": 0.0294189453125,
"step": 322
},
{
"epoch": 1.615,
"grad_norm": 0.012798645533621311,
"learning_rate": 1.903654013972839e-05,
"loss": 0.035308837890625,
"step": 323
},
{
"epoch": 1.62,
"grad_norm": 0.010512963868677616,
"learning_rate": 1.881415106907439e-05,
"loss": 0.0279083251953125,
"step": 324
},
{
"epoch": 1.625,
"grad_norm": 0.010452947579324245,
"learning_rate": 1.8594235253127375e-05,
"loss": 0.028594970703125,
"step": 325
},
{
"epoch": 1.63,
"grad_norm": 0.008237004280090332,
"learning_rate": 1.837680772284123e-05,
"loss": 0.02721405029296875,
"step": 326
},
{
"epoch": 1.635,
"grad_norm": 0.013389012776315212,
"learning_rate": 1.8161883339098846e-05,
"loss": 0.0260162353515625,
"step": 327
},
{
"epoch": 1.6400000000000001,
"grad_norm": 0.010061044245958328,
"learning_rate": 1.794947679169634e-05,
"loss": 0.033687591552734375,
"step": 328
},
{
"epoch": 1.645,
"grad_norm": 0.008693205192685127,
"learning_rate": 1.77396025983391e-05,
"loss": 0.023193359375,
"step": 329
},
{
"epoch": 1.65,
"grad_norm": 0.011013878509402275,
"learning_rate": 1.7532275103649436e-05,
"loss": 0.0345458984375,
"step": 330
},
{
"epoch": 1.655,
"grad_norm": 0.011123662814497948,
"learning_rate": 1.7327508478186218e-05,
"loss": 0.021877288818359375,
"step": 331
},
{
"epoch": 1.6600000000000001,
"grad_norm": 0.010408765636384487,
"learning_rate": 1.712531671747628e-05,
"loss": 0.025348663330078125,
"step": 332
},
{
"epoch": 1.665,
"grad_norm": 0.011021304875612259,
"learning_rate": 1.6925713641057904e-05,
"loss": 0.0307769775390625,
"step": 333
},
{
"epoch": 1.67,
"grad_norm": 0.010004506446421146,
"learning_rate": 1.6728712891536215e-05,
"loss": 0.02822113037109375,
"step": 334
},
{
"epoch": 1.675,
"grad_norm": 0.01740351878106594,
"learning_rate": 1.653432793365074e-05,
"loss": 0.03163909912109375,
"step": 335
},
{
"epoch": 1.6800000000000002,
"grad_norm": 0.012323952279984951,
"learning_rate": 1.6342572053355166e-05,
"loss": 0.02740478515625,
"step": 336
},
{
"epoch": 1.685,
"grad_norm": 0.01033550500869751,
"learning_rate": 1.6153458356909176e-05,
"loss": 0.0314483642578125,
"step": 337
},
{
"epoch": 1.69,
"grad_norm": 0.011347970925271511,
"learning_rate": 1.5966999769982712e-05,
"loss": 0.02532196044921875,
"step": 338
},
{
"epoch": 1.6949999999999998,
"grad_norm": 0.010214807465672493,
"learning_rate": 1.578320903677252e-05,
"loss": 0.02443695068359375,
"step": 339
},
{
"epoch": 1.7,
"grad_norm": 0.02045145072042942,
"learning_rate": 1.5602098719131076e-05,
"loss": 0.026458740234375,
"step": 340
},
{
"epoch": 1.705,
"grad_norm": 0.01049800030887127,
"learning_rate": 1.5423681195707997e-05,
"loss": 0.0302734375,
"step": 341
},
{
"epoch": 1.71,
"grad_norm": 0.0091980816796422,
"learning_rate": 1.5247968661104017e-05,
"loss": 0.0238494873046875,
"step": 342
},
{
"epoch": 1.7149999999999999,
"grad_norm": 0.00883064977824688,
"learning_rate": 1.507497312503747e-05,
"loss": 0.0197601318359375,
"step": 343
},
{
"epoch": 1.72,
"grad_norm": 0.014422561973333359,
"learning_rate": 1.490470641152345e-05,
"loss": 0.025146484375,
"step": 344
},
{
"epoch": 1.725,
"grad_norm": 0.009651090018451214,
"learning_rate": 1.4737180158065644e-05,
"loss": 0.0275421142578125,
"step": 345
},
{
"epoch": 1.73,
"grad_norm": 0.010517412796616554,
"learning_rate": 1.4572405814860954e-05,
"loss": 0.0245513916015625,
"step": 346
},
{
"epoch": 1.7349999999999999,
"grad_norm": 0.009971555322408676,
"learning_rate": 1.441039464401685e-05,
"loss": 0.03174591064453125,
"step": 347
},
{
"epoch": 1.74,
"grad_norm": 0.011207611300051212,
"learning_rate": 1.4251157718781658e-05,
"loss": 0.0351409912109375,
"step": 348
},
{
"epoch": 1.745,
"grad_norm": 0.010495432652533054,
"learning_rate": 1.4094705922787687e-05,
"loss": 0.03032684326171875,
"step": 349
},
{
"epoch": 1.75,
"grad_norm": 0.011869566515088081,
"learning_rate": 1.394104994930738e-05,
"loss": 0.0328826904296875,
"step": 350
},
{
"epoch": 1.755,
"grad_norm": 0.010121211409568787,
"learning_rate": 1.3790200300522413e-05,
"loss": 0.02735137939453125,
"step": 351
},
{
"epoch": 1.76,
"grad_norm": 0.014805102720856667,
"learning_rate": 1.36421672868059e-05,
"loss": 0.033660888671875,
"step": 352
},
{
"epoch": 1.7650000000000001,
"grad_norm": 0.010326611809432507,
"learning_rate": 1.3496961026017687e-05,
"loss": 0.033466339111328125,
"step": 353
},
{
"epoch": 1.77,
"grad_norm": 0.012950467877089977,
"learning_rate": 1.3354591442812822e-05,
"loss": 0.0269622802734375,
"step": 354
},
{
"epoch": 1.775,
"grad_norm": 0.012358403764665127,
"learning_rate": 1.3215068267963188e-05,
"loss": 0.0299835205078125,
"step": 355
},
{
"epoch": 1.78,
"grad_norm": 0.009418732486665249,
"learning_rate": 1.307840103769245e-05,
"loss": 0.02685546875,
"step": 356
},
{
"epoch": 1.7850000000000001,
"grad_norm": 0.009776061400771141,
"learning_rate": 1.2944599093024267e-05,
"loss": 0.0323028564453125,
"step": 357
},
{
"epoch": 1.79,
"grad_norm": 0.009743714705109596,
"learning_rate": 1.281367157914381e-05,
"loss": 0.026031494140625,
"step": 358
},
{
"epoch": 1.795,
"grad_norm": 0.008474187925457954,
"learning_rate": 1.2685627444772748e-05,
"loss": 0.02619171142578125,
"step": 359
},
{
"epoch": 1.8,
"grad_norm": 0.01052561029791832,
"learning_rate": 1.2560475441557565e-05,
"loss": 0.031768798828125,
"step": 360
},
{
"epoch": 1.8050000000000002,
"grad_norm": 0.010250302962958813,
"learning_rate": 1.2438224123471442e-05,
"loss": 0.030551910400390625,
"step": 361
},
{
"epoch": 1.81,
"grad_norm": 0.009635678492486477,
"learning_rate": 1.2318881846229578e-05,
"loss": 0.029354095458984375,
"step": 362
},
{
"epoch": 1.815,
"grad_norm": 0.018043145537376404,
"learning_rate": 1.2202456766718093e-05,
"loss": 0.028411865234375,
"step": 363
},
{
"epoch": 1.8199999999999998,
"grad_norm": 0.010215197689831257,
"learning_rate": 1.2088956842436515e-05,
"loss": 0.02750396728515625,
"step": 364
},
{
"epoch": 1.825,
"grad_norm": 0.011272676289081573,
"learning_rate": 1.1978389830953907e-05,
"loss": 0.031951904296875,
"step": 365
},
{
"epoch": 1.83,
"grad_norm": 0.011401425115764141,
"learning_rate": 1.1870763289378629e-05,
"loss": 0.028167724609375,
"step": 366
},
{
"epoch": 1.835,
"grad_norm": 0.009742112830281258,
"learning_rate": 1.1766084573841835e-05,
"loss": 0.021697998046875,
"step": 367
},
{
"epoch": 1.8399999999999999,
"grad_norm": 0.010335804894566536,
"learning_rate": 1.166436083899468e-05,
"loss": 0.02709197998046875,
"step": 368
},
{
"epoch": 1.845,
"grad_norm": 0.008323920890688896,
"learning_rate": 1.1565599037519316e-05,
"loss": 0.02667236328125,
"step": 369
},
{
"epoch": 1.85,
"grad_norm": 0.01001122035086155,
"learning_rate": 1.146980591965368e-05,
"loss": 0.02816009521484375,
"step": 370
},
{
"epoch": 1.855,
"grad_norm": 0.014210703782737255,
"learning_rate": 1.1376988032730134e-05,
"loss": 0.0249786376953125,
"step": 371
},
{
"epoch": 1.8599999999999999,
"grad_norm": 0.009568016976118088,
"learning_rate": 1.128715172072796e-05,
"loss": 0.0278167724609375,
"step": 372
},
{
"epoch": 1.865,
"grad_norm": 0.009678252041339874,
"learning_rate": 1.1200303123839742e-05,
"loss": 0.02631378173828125,
"step": 373
},
{
"epoch": 1.87,
"grad_norm": 0.008704318664968014,
"learning_rate": 1.1116448178051713e-05,
"loss": 0.02629852294921875,
"step": 374
},
{
"epoch": 1.875,
"grad_norm": 0.014527424238622189,
"learning_rate": 1.1035592614738034e-05,
"loss": 0.02300262451171875,
"step": 375
},
{
"epoch": 1.88,
"grad_norm": 0.010122748091816902,
"learning_rate": 1.0957741960269049e-05,
"loss": 0.02685546875,
"step": 376
},
{
"epoch": 1.885,
"grad_norm": 0.007298020645976067,
"learning_rate": 1.088290153563358e-05,
"loss": 0.0183868408203125,
"step": 377
},
{
"epoch": 1.8900000000000001,
"grad_norm": 0.008330732583999634,
"learning_rate": 1.081107645607524e-05,
"loss": 0.023834228515625,
"step": 378
},
{
"epoch": 1.895,
"grad_norm": 0.02022983878850937,
"learning_rate": 1.0742271630742796e-05,
"loss": 0.0269927978515625,
"step": 379
},
{
"epoch": 1.9,
"grad_norm": 0.010069115087389946,
"learning_rate": 1.0676491762354676e-05,
"loss": 0.02846527099609375,
"step": 380
},
{
"epoch": 1.905,
"grad_norm": 0.00943570863455534,
"learning_rate": 1.0613741346877497e-05,
"loss": 0.02564239501953125,
"step": 381
},
{
"epoch": 1.9100000000000001,
"grad_norm": 0.010675134137272835,
"learning_rate": 1.0554024673218807e-05,
"loss": 0.02086639404296875,
"step": 382
},
{
"epoch": 1.915,
"grad_norm": 0.013744503259658813,
"learning_rate": 1.0497345822933918e-05,
"loss": 0.033782958984375,
"step": 383
},
{
"epoch": 1.92,
"grad_norm": 0.012528883293271065,
"learning_rate": 1.044370866994697e-05,
"loss": 0.0260009765625,
"step": 384
},
{
"epoch": 1.925,
"grad_norm": 0.01032931450754404,
"learning_rate": 1.0393116880286118e-05,
"loss": 0.0235137939453125,
"step": 385
},
{
"epoch": 1.9300000000000002,
"grad_norm": 0.013555163517594337,
"learning_rate": 1.0345573911832976e-05,
"loss": 0.0333099365234375,
"step": 386
},
{
"epoch": 1.935,
"grad_norm": 0.007477805484086275,
"learning_rate": 1.0301083014086285e-05,
"loss": 0.02054595947265625,
"step": 387
},
{
"epoch": 1.94,
"grad_norm": 0.010511595755815506,
"learning_rate": 1.0259647227939808e-05,
"loss": 0.02536773681640625,
"step": 388
},
{
"epoch": 1.9449999999999998,
"grad_norm": 0.009861464612185955,
"learning_rate": 1.0221269385474488e-05,
"loss": 0.029483795166015625,
"step": 389
},
{
"epoch": 1.95,
"grad_norm": 0.010630265809595585,
"learning_rate": 1.0185952109764878e-05,
"loss": 0.02857208251953125,
"step": 390
},
{
"epoch": 1.955,
"grad_norm": 0.008438383229076862,
"learning_rate": 1.0153697814699859e-05,
"loss": 0.0250396728515625,
"step": 391
},
{
"epoch": 1.96,
"grad_norm": 0.013799340464174747,
"learning_rate": 1.012450870481765e-05,
"loss": 0.0318756103515625,
"step": 392
},
{
"epoch": 1.9649999999999999,
"grad_norm": 0.014741787686944008,
"learning_rate": 1.0098386775155147e-05,
"loss": 0.0309295654296875,
"step": 393
},
{
"epoch": 1.97,
"grad_norm": 0.009878206998109818,
"learning_rate": 1.0075333811111535e-05,
"loss": 0.0249176025390625,
"step": 394
},
{
"epoch": 1.975,
"grad_norm": 0.010228660888969898,
"learning_rate": 1.0055351388326288e-05,
"loss": 0.028350830078125,
"step": 395
},
{
"epoch": 1.98,
"grad_norm": 0.011952117085456848,
"learning_rate": 1.0038440872571456e-05,
"loss": 0.021148681640625,
"step": 396
},
{
"epoch": 1.9849999999999999,
"grad_norm": 0.010431772097945213,
"learning_rate": 1.0024603419658329e-05,
"loss": 0.02730560302734375,
"step": 397
},
{
"epoch": 1.99,
"grad_norm": 0.011022545397281647,
"learning_rate": 1.001383997535844e-05,
"loss": 0.029876708984375,
"step": 398
},
{
"epoch": 1.995,
"grad_norm": 0.009447705931961536,
"learning_rate": 1.0006151275338897e-05,
"loss": 0.02649688720703125,
"step": 399
},
{
"epoch": 2.0,
"grad_norm": 0.011590216308832169,
"learning_rate": 1.0001537845112144e-05,
"loss": 0.02838134765625,
"step": 400
},
{
"epoch": 2.0,
"eval_loss": 0.02712535858154297,
"eval_runtime": 28.2889,
"eval_samples_per_second": 0.954,
"eval_steps_per_second": 0.141,
"step": 400
}
],
"logging_steps": 1.0,
"max_steps": 400,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 0,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 3.3140823917796e+19,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}