PEFT
Safetensors
GGUF
English
conversational
song-chatbot-v2 / trainer_state.json
noweshere's picture
Upload folder using huggingface_hub
b371b32 verified
Raw
History Blame Contribute Delete
460 kB
Invalid JSON:Unexpected token 'N', ..."ad_norm": NaN, "... is not valid JSON
{
"best_metric": 2.6534903049468994,
"best_model_checkpoint": "finetuned_output/checkpoint-26800",
"epoch": 1.9944967682363806,
"eval_steps": 200,
"global_step": 27000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0,
"grad_norm": NaN,
"learning_rate": 0.0,
"loss": 6.359,
"step": 1
},
{
"epoch": 0.0,
"grad_norm": NaN,
"learning_rate": 8.862629246676516e-07,
"loss": 6.4896,
"step": 10
},
{
"epoch": 0.0,
"grad_norm": 12.363865852355957,
"learning_rate": 2.2156573116691286e-06,
"loss": 6.7819,
"step": 20
},
{
"epoch": 0.0,
"grad_norm": 17.94967269897461,
"learning_rate": 3.6927621861152146e-06,
"loss": 6.243,
"step": 30
},
{
"epoch": 0.0,
"grad_norm": 19.398380279541016,
"learning_rate": 5.1698670605613006e-06,
"loss": 6.8645,
"step": 40
},
{
"epoch": 0.0,
"grad_norm": 18.63751792907715,
"learning_rate": 6.646971935007386e-06,
"loss": 6.3908,
"step": 50
},
{
"epoch": 0.0,
"grad_norm": 18.712358474731445,
"learning_rate": 8.124076809453472e-06,
"loss": 5.4173,
"step": 60
},
{
"epoch": 0.01,
"grad_norm": 16.64569664001465,
"learning_rate": 9.601181683899557e-06,
"loss": 6.0525,
"step": 70
},
{
"epoch": 0.01,
"grad_norm": 14.164616584777832,
"learning_rate": 1.1078286558345644e-05,
"loss": 5.7338,
"step": 80
},
{
"epoch": 0.01,
"grad_norm": 18.707992553710938,
"learning_rate": 1.255539143279173e-05,
"loss": 5.1387,
"step": 90
},
{
"epoch": 0.01,
"grad_norm": 27.919492721557617,
"learning_rate": 1.4032496307237814e-05,
"loss": 5.0792,
"step": 100
},
{
"epoch": 0.01,
"grad_norm": 12.875962257385254,
"learning_rate": 1.55096011816839e-05,
"loss": 4.8748,
"step": 110
},
{
"epoch": 0.01,
"grad_norm": 13.589888572692871,
"learning_rate": 1.6986706056129988e-05,
"loss": 4.3393,
"step": 120
},
{
"epoch": 0.01,
"grad_norm": 14.79183578491211,
"learning_rate": 1.8463810930576073e-05,
"loss": 4.5417,
"step": 130
},
{
"epoch": 0.01,
"grad_norm": 15.221105575561523,
"learning_rate": 1.9940915805022155e-05,
"loss": 4.7915,
"step": 140
},
{
"epoch": 0.01,
"grad_norm": 13.27481746673584,
"learning_rate": 2.1418020679468243e-05,
"loss": 4.433,
"step": 150
},
{
"epoch": 0.01,
"grad_norm": 14.454379081726074,
"learning_rate": 2.2895125553914328e-05,
"loss": 4.4096,
"step": 160
},
{
"epoch": 0.01,
"grad_norm": 18.132295608520508,
"learning_rate": 2.4372230428360417e-05,
"loss": 4.2882,
"step": 170
},
{
"epoch": 0.01,
"grad_norm": 12.889933586120605,
"learning_rate": 2.58493353028065e-05,
"loss": 4.5541,
"step": 180
},
{
"epoch": 0.01,
"grad_norm": 11.339323997497559,
"learning_rate": 2.7326440177252587e-05,
"loss": 4.2746,
"step": 190
},
{
"epoch": 0.01,
"grad_norm": 15.804581642150879,
"learning_rate": 2.8803545051698672e-05,
"loss": 4.1199,
"step": 200
},
{
"epoch": 0.01,
"eval_loss": 4.2089715003967285,
"eval_runtime": 1148.912,
"eval_samples_per_second": 4.961,
"eval_steps_per_second": 4.961,
"step": 200
},
{
"epoch": 0.02,
"grad_norm": 15.684308052062988,
"learning_rate": 3.0280649926144754e-05,
"loss": 4.5603,
"step": 210
},
{
"epoch": 0.02,
"grad_norm": 15.939892768859863,
"learning_rate": 3.1757754800590846e-05,
"loss": 4.2042,
"step": 220
},
{
"epoch": 0.02,
"grad_norm": 11.890963554382324,
"learning_rate": 3.323485967503693e-05,
"loss": 3.8026,
"step": 230
},
{
"epoch": 0.02,
"grad_norm": 13.109417915344238,
"learning_rate": 3.4711964549483016e-05,
"loss": 4.464,
"step": 240
},
{
"epoch": 0.02,
"grad_norm": 12.069670677185059,
"learning_rate": 3.61890694239291e-05,
"loss": 3.9818,
"step": 250
},
{
"epoch": 0.02,
"grad_norm": 12.528508186340332,
"learning_rate": 3.7666174298375187e-05,
"loss": 4.1944,
"step": 260
},
{
"epoch": 0.02,
"grad_norm": 16.27909278869629,
"learning_rate": 3.9143279172821275e-05,
"loss": 4.1983,
"step": 270
},
{
"epoch": 0.02,
"grad_norm": 16.70147132873535,
"learning_rate": 4.062038404726736e-05,
"loss": 4.1177,
"step": 280
},
{
"epoch": 0.02,
"grad_norm": 17.577062606811523,
"learning_rate": 4.2097488921713445e-05,
"loss": 4.0985,
"step": 290
},
{
"epoch": 0.02,
"grad_norm": 15.422350883483887,
"learning_rate": 4.357459379615953e-05,
"loss": 3.7929,
"step": 300
},
{
"epoch": 0.02,
"grad_norm": 25.00748634338379,
"learning_rate": 4.5051698670605616e-05,
"loss": 4.0118,
"step": 310
},
{
"epoch": 0.02,
"grad_norm": 14.866429328918457,
"learning_rate": 4.6528803545051704e-05,
"loss": 4.3715,
"step": 320
},
{
"epoch": 0.02,
"grad_norm": 16.465192794799805,
"learning_rate": 4.8005908419497786e-05,
"loss": 4.3538,
"step": 330
},
{
"epoch": 0.03,
"grad_norm": 12.310616493225098,
"learning_rate": 4.9483013293943874e-05,
"loss": 4.0751,
"step": 340
},
{
"epoch": 0.03,
"grad_norm": 11.21264362335205,
"learning_rate": 5.0960118168389956e-05,
"loss": 3.7735,
"step": 350
},
{
"epoch": 0.03,
"grad_norm": 20.764062881469727,
"learning_rate": 5.2437223042836045e-05,
"loss": 3.87,
"step": 360
},
{
"epoch": 0.03,
"grad_norm": 14.75299072265625,
"learning_rate": 5.3914327917282127e-05,
"loss": 4.0889,
"step": 370
},
{
"epoch": 0.03,
"grad_norm": 14.28115177154541,
"learning_rate": 5.5391432791728215e-05,
"loss": 3.63,
"step": 380
},
{
"epoch": 0.03,
"grad_norm": 10.375629425048828,
"learning_rate": 5.6868537666174304e-05,
"loss": 4.2333,
"step": 390
},
{
"epoch": 0.03,
"grad_norm": 12.934395790100098,
"learning_rate": 5.8345642540620385e-05,
"loss": 3.637,
"step": 400
},
{
"epoch": 0.03,
"eval_loss": 4.002247333526611,
"eval_runtime": 1149.4819,
"eval_samples_per_second": 4.959,
"eval_steps_per_second": 4.959,
"step": 400
},
{
"epoch": 0.03,
"grad_norm": 14.344521522521973,
"learning_rate": 5.937961595273265e-05,
"loss": 3.9191,
"step": 410
},
{
"epoch": 0.03,
"grad_norm": 16.335979461669922,
"learning_rate": 6.0856720827178737e-05,
"loss": 3.712,
"step": 420
},
{
"epoch": 0.03,
"grad_norm": 12.617454528808594,
"learning_rate": 6.233382570162482e-05,
"loss": 3.696,
"step": 430
},
{
"epoch": 0.03,
"grad_norm": 11.171549797058105,
"learning_rate": 6.38109305760709e-05,
"loss": 4.317,
"step": 440
},
{
"epoch": 0.03,
"grad_norm": 10.807971954345703,
"learning_rate": 6.5288035450517e-05,
"loss": 4.0245,
"step": 450
},
{
"epoch": 0.03,
"grad_norm": 14.287726402282715,
"learning_rate": 6.661742983751846e-05,
"loss": 4.11,
"step": 460
},
{
"epoch": 0.03,
"grad_norm": 12.783670425415039,
"learning_rate": 6.809453471196455e-05,
"loss": 4.3735,
"step": 470
},
{
"epoch": 0.04,
"grad_norm": 14.521145820617676,
"learning_rate": 6.957163958641064e-05,
"loss": 3.8375,
"step": 480
},
{
"epoch": 0.04,
"grad_norm": 17.16818618774414,
"learning_rate": 7.104874446085672e-05,
"loss": 4.2095,
"step": 490
},
{
"epoch": 0.04,
"grad_norm": 14.1270170211792,
"learning_rate": 7.252584933530281e-05,
"loss": 3.8374,
"step": 500
},
{
"epoch": 0.04,
"grad_norm": 10.878564834594727,
"learning_rate": 7.40029542097489e-05,
"loss": 3.8449,
"step": 510
},
{
"epoch": 0.04,
"grad_norm": 15.475001335144043,
"learning_rate": 7.548005908419498e-05,
"loss": 3.8567,
"step": 520
},
{
"epoch": 0.04,
"grad_norm": 10.29078483581543,
"learning_rate": 7.695716395864106e-05,
"loss": 4.0472,
"step": 530
},
{
"epoch": 0.04,
"grad_norm": 11.84984016418457,
"learning_rate": 7.843426883308715e-05,
"loss": 4.0074,
"step": 540
},
{
"epoch": 0.04,
"grad_norm": 11.358631134033203,
"learning_rate": 7.991137370753325e-05,
"loss": 4.26,
"step": 550
},
{
"epoch": 0.04,
"grad_norm": 9.24376392364502,
"learning_rate": 8.138847858197932e-05,
"loss": 4.1398,
"step": 560
},
{
"epoch": 0.04,
"grad_norm": 12.005671501159668,
"learning_rate": 8.286558345642541e-05,
"loss": 3.948,
"step": 570
},
{
"epoch": 0.04,
"grad_norm": 16.197847366333008,
"learning_rate": 8.43426883308715e-05,
"loss": 4.252,
"step": 580
},
{
"epoch": 0.04,
"grad_norm": 11.188523292541504,
"learning_rate": 8.581979320531758e-05,
"loss": 4.1579,
"step": 590
},
{
"epoch": 0.04,
"grad_norm": 10.116312980651855,
"learning_rate": 8.729689807976367e-05,
"loss": 3.7998,
"step": 600
},
{
"epoch": 0.04,
"eval_loss": 3.877913236618042,
"eval_runtime": 1135.4542,
"eval_samples_per_second": 5.02,
"eval_steps_per_second": 5.02,
"step": 600
},
{
"epoch": 0.05,
"grad_norm": 11.187545776367188,
"learning_rate": 8.877400295420975e-05,
"loss": 3.5609,
"step": 610
},
{
"epoch": 0.05,
"grad_norm": 11.974798202514648,
"learning_rate": 9.025110782865584e-05,
"loss": 4.2729,
"step": 620
},
{
"epoch": 0.05,
"grad_norm": 9.664997100830078,
"learning_rate": 9.172821270310192e-05,
"loss": 4.0576,
"step": 630
},
{
"epoch": 0.05,
"grad_norm": 8.53403091430664,
"learning_rate": 9.320531757754801e-05,
"loss": 3.7363,
"step": 640
},
{
"epoch": 0.05,
"grad_norm": 11.338556289672852,
"learning_rate": 9.468242245199411e-05,
"loss": 4.3457,
"step": 650
},
{
"epoch": 0.05,
"grad_norm": 11.836936950683594,
"learning_rate": 9.615952732644018e-05,
"loss": 4.3066,
"step": 660
},
{
"epoch": 0.05,
"grad_norm": 7.8482890129089355,
"learning_rate": 9.763663220088627e-05,
"loss": 3.4205,
"step": 670
},
{
"epoch": 0.05,
"grad_norm": 9.069377899169922,
"learning_rate": 9.911373707533235e-05,
"loss": 3.992,
"step": 680
},
{
"epoch": 0.05,
"grad_norm": 10.200207710266113,
"learning_rate": 0.00010059084194977843,
"loss": 3.7709,
"step": 690
},
{
"epoch": 0.05,
"grad_norm": 7.830392360687256,
"learning_rate": 0.00010206794682422452,
"loss": 3.3458,
"step": 700
},
{
"epoch": 0.05,
"grad_norm": 9.707051277160645,
"learning_rate": 0.00010354505169867061,
"loss": 3.591,
"step": 710
},
{
"epoch": 0.05,
"grad_norm": 7.163864612579346,
"learning_rate": 0.0001050221565731167,
"loss": 3.7154,
"step": 720
},
{
"epoch": 0.05,
"grad_norm": 5.52028751373291,
"learning_rate": 0.00010649926144756279,
"loss": 3.4662,
"step": 730
},
{
"epoch": 0.05,
"grad_norm": 9.911632537841797,
"learning_rate": 0.00010797636632200887,
"loss": 3.6873,
"step": 740
},
{
"epoch": 0.06,
"grad_norm": 9.579071998596191,
"learning_rate": 0.00010945347119645495,
"loss": 3.7212,
"step": 750
},
{
"epoch": 0.06,
"grad_norm": 8.60621166229248,
"learning_rate": 0.00011093057607090105,
"loss": 3.8167,
"step": 760
},
{
"epoch": 0.06,
"grad_norm": 9.796650886535645,
"learning_rate": 0.00011240768094534713,
"loss": 3.9552,
"step": 770
},
{
"epoch": 0.06,
"grad_norm": 10.821413040161133,
"learning_rate": 0.00011388478581979321,
"loss": 3.9494,
"step": 780
},
{
"epoch": 0.06,
"grad_norm": 6.736440181732178,
"learning_rate": 0.0001153618906942393,
"loss": 3.6909,
"step": 790
},
{
"epoch": 0.06,
"grad_norm": 8.424497604370117,
"learning_rate": 0.00011683899556868539,
"loss": 4.0993,
"step": 800
},
{
"epoch": 0.06,
"eval_loss": 3.8091275691986084,
"eval_runtime": 1134.5045,
"eval_samples_per_second": 5.024,
"eval_steps_per_second": 5.024,
"step": 800
},
{
"epoch": 0.06,
"grad_norm": 7.850163459777832,
"learning_rate": 0.00011831610044313146,
"loss": 3.6776,
"step": 810
},
{
"epoch": 0.06,
"grad_norm": 10.378649711608887,
"learning_rate": 0.00011979320531757757,
"loss": 3.8521,
"step": 820
},
{
"epoch": 0.06,
"grad_norm": 8.155631065368652,
"learning_rate": 0.00012127031019202363,
"loss": 3.5103,
"step": 830
},
{
"epoch": 0.06,
"grad_norm": 7.763760089874268,
"learning_rate": 0.00012274741506646973,
"loss": 3.975,
"step": 840
},
{
"epoch": 0.06,
"grad_norm": 8.467230796813965,
"learning_rate": 0.00012422451994091582,
"loss": 3.7825,
"step": 850
},
{
"epoch": 0.06,
"grad_norm": 9.121253967285156,
"learning_rate": 0.0001257016248153619,
"loss": 3.801,
"step": 860
},
{
"epoch": 0.06,
"grad_norm": 9.41889762878418,
"learning_rate": 0.00012717872968980796,
"loss": 3.7899,
"step": 870
},
{
"epoch": 0.07,
"grad_norm": 7.1193108558654785,
"learning_rate": 0.00012865583456425408,
"loss": 3.6037,
"step": 880
},
{
"epoch": 0.07,
"grad_norm": 7.241006851196289,
"learning_rate": 0.00013013293943870015,
"loss": 3.7016,
"step": 890
},
{
"epoch": 0.07,
"grad_norm": 7.67100191116333,
"learning_rate": 0.00013161004431314622,
"loss": 4.0709,
"step": 900
},
{
"epoch": 0.07,
"grad_norm": 8.182023048400879,
"learning_rate": 0.00013308714918759234,
"loss": 3.8902,
"step": 910
},
{
"epoch": 0.07,
"grad_norm": 6.974468231201172,
"learning_rate": 0.0001345642540620384,
"loss": 3.5811,
"step": 920
},
{
"epoch": 0.07,
"grad_norm": 8.211260795593262,
"learning_rate": 0.00013604135893648448,
"loss": 3.7973,
"step": 930
},
{
"epoch": 0.07,
"grad_norm": 7.410445690155029,
"learning_rate": 0.00013751846381093057,
"loss": 3.4891,
"step": 940
},
{
"epoch": 0.07,
"grad_norm": 7.951589584350586,
"learning_rate": 0.00013899556868537667,
"loss": 3.755,
"step": 950
},
{
"epoch": 0.07,
"grad_norm": 7.486601829528809,
"learning_rate": 0.00014047267355982276,
"loss": 3.6841,
"step": 960
},
{
"epoch": 0.07,
"grad_norm": 6.828805923461914,
"learning_rate": 0.00014194977843426883,
"loss": 3.8212,
"step": 970
},
{
"epoch": 0.07,
"grad_norm": 6.689596176147461,
"learning_rate": 0.00014342688330871493,
"loss": 3.7554,
"step": 980
},
{
"epoch": 0.07,
"grad_norm": 9.896605491638184,
"learning_rate": 0.00014490398818316102,
"loss": 3.7252,
"step": 990
},
{
"epoch": 0.07,
"grad_norm": 7.683341026306152,
"learning_rate": 0.0001463810930576071,
"loss": 3.8645,
"step": 1000
},
{
"epoch": 0.07,
"eval_loss": 3.7340312004089355,
"eval_runtime": 1137.3342,
"eval_samples_per_second": 5.012,
"eval_steps_per_second": 5.012,
"step": 1000
},
{
"epoch": 0.07,
"grad_norm": 7.333156108856201,
"learning_rate": 0.0001478581979320532,
"loss": 3.701,
"step": 1010
},
{
"epoch": 0.08,
"grad_norm": 6.860635757446289,
"learning_rate": 0.00014933530280649928,
"loss": 3.8575,
"step": 1020
},
{
"epoch": 0.08,
"grad_norm": 8.277637481689453,
"learning_rate": 0.00015081240768094535,
"loss": 3.5714,
"step": 1030
},
{
"epoch": 0.08,
"grad_norm": 6.834525108337402,
"learning_rate": 0.00015228951255539145,
"loss": 3.7444,
"step": 1040
},
{
"epoch": 0.08,
"grad_norm": 7.9503679275512695,
"learning_rate": 0.00015376661742983754,
"loss": 4.1119,
"step": 1050
},
{
"epoch": 0.08,
"grad_norm": 6.239004135131836,
"learning_rate": 0.0001552437223042836,
"loss": 3.9033,
"step": 1060
},
{
"epoch": 0.08,
"grad_norm": 8.255178451538086,
"learning_rate": 0.00015672082717872968,
"loss": 3.9257,
"step": 1070
},
{
"epoch": 0.08,
"grad_norm": 5.259088039398193,
"learning_rate": 0.0001581979320531758,
"loss": 3.8068,
"step": 1080
},
{
"epoch": 0.08,
"grad_norm": 7.921567916870117,
"learning_rate": 0.00015967503692762187,
"loss": 3.9009,
"step": 1090
},
{
"epoch": 0.08,
"grad_norm": 5.800931930541992,
"learning_rate": 0.00016115214180206794,
"loss": 3.4145,
"step": 1100
},
{
"epoch": 0.08,
"grad_norm": 5.795458793640137,
"learning_rate": 0.00016262924667651406,
"loss": 3.8581,
"step": 1110
},
{
"epoch": 0.08,
"grad_norm": 6.043853282928467,
"learning_rate": 0.00016410635155096013,
"loss": 3.6541,
"step": 1120
},
{
"epoch": 0.08,
"grad_norm": 9.615581512451172,
"learning_rate": 0.0001655834564254062,
"loss": 3.7231,
"step": 1130
},
{
"epoch": 0.08,
"grad_norm": 7.142824172973633,
"learning_rate": 0.0001670605612998523,
"loss": 3.9728,
"step": 1140
},
{
"epoch": 0.08,
"grad_norm": 8.246708869934082,
"learning_rate": 0.00016853766617429839,
"loss": 3.7804,
"step": 1150
},
{
"epoch": 0.09,
"grad_norm": 7.163732528686523,
"learning_rate": 0.00017001477104874445,
"loss": 3.5747,
"step": 1160
},
{
"epoch": 0.09,
"grad_norm": 7.906023979187012,
"learning_rate": 0.00017149187592319055,
"loss": 3.8617,
"step": 1170
},
{
"epoch": 0.09,
"grad_norm": 7.039794445037842,
"learning_rate": 0.00017296898079763664,
"loss": 3.57,
"step": 1180
},
{
"epoch": 0.09,
"grad_norm": 4.418554782867432,
"learning_rate": 0.0001744460856720827,
"loss": 3.5283,
"step": 1190
},
{
"epoch": 0.09,
"grad_norm": 4.833454608917236,
"learning_rate": 0.0001759231905465288,
"loss": 3.707,
"step": 1200
},
{
"epoch": 0.09,
"eval_loss": 3.6806743144989014,
"eval_runtime": 1137.1006,
"eval_samples_per_second": 5.013,
"eval_steps_per_second": 5.013,
"step": 1200
},
{
"epoch": 0.09,
"grad_norm": 7.413050174713135,
"learning_rate": 0.0001774002954209749,
"loss": 3.6721,
"step": 1210
},
{
"epoch": 0.09,
"grad_norm": 7.842188358306885,
"learning_rate": 0.000178877400295421,
"loss": 3.4724,
"step": 1220
},
{
"epoch": 0.09,
"grad_norm": 6.357587814331055,
"learning_rate": 0.00018035450516986707,
"loss": 3.56,
"step": 1230
},
{
"epoch": 0.09,
"grad_norm": 6.298316478729248,
"learning_rate": 0.00018183161004431316,
"loss": 3.6209,
"step": 1240
},
{
"epoch": 0.09,
"grad_norm": 5.822552680969238,
"learning_rate": 0.00018330871491875926,
"loss": 3.4501,
"step": 1250
},
{
"epoch": 0.09,
"grad_norm": 5.943758487701416,
"learning_rate": 0.00018478581979320533,
"loss": 3.6772,
"step": 1260
},
{
"epoch": 0.09,
"grad_norm": 5.048367977142334,
"learning_rate": 0.0001862629246676514,
"loss": 3.5117,
"step": 1270
},
{
"epoch": 0.09,
"grad_norm": 6.460511684417725,
"learning_rate": 0.00018774002954209752,
"loss": 3.7063,
"step": 1280
},
{
"epoch": 0.1,
"grad_norm": 5.242683410644531,
"learning_rate": 0.00018921713441654358,
"loss": 3.636,
"step": 1290
},
{
"epoch": 0.1,
"grad_norm": 7.642856597900391,
"learning_rate": 0.00019069423929098965,
"loss": 3.9246,
"step": 1300
},
{
"epoch": 0.1,
"grad_norm": 8.507002830505371,
"learning_rate": 0.00019217134416543577,
"loss": 3.7781,
"step": 1310
},
{
"epoch": 0.1,
"grad_norm": 7.879441261291504,
"learning_rate": 0.00019364844903988184,
"loss": 3.7177,
"step": 1320
},
{
"epoch": 0.1,
"grad_norm": 7.368891716003418,
"learning_rate": 0.0001951255539143279,
"loss": 3.8024,
"step": 1330
},
{
"epoch": 0.1,
"grad_norm": 7.859127044677734,
"learning_rate": 0.000196602658788774,
"loss": 3.9274,
"step": 1340
},
{
"epoch": 0.1,
"grad_norm": 6.2005743980407715,
"learning_rate": 0.0001980797636632201,
"loss": 3.2389,
"step": 1350
},
{
"epoch": 0.1,
"grad_norm": 7.01071310043335,
"learning_rate": 0.00019955686853766617,
"loss": 3.947,
"step": 1360
},
{
"epoch": 0.1,
"grad_norm": 6.5373759269714355,
"learning_rate": 0.0001999999634469286,
"loss": 3.6943,
"step": 1370
},
{
"epoch": 0.1,
"grad_norm": 5.488951206207275,
"learning_rate": 0.00019999978441154117,
"loss": 4.0045,
"step": 1380
},
{
"epoch": 0.1,
"grad_norm": 6.409852504730225,
"learning_rate": 0.00019999945618027503,
"loss": 3.8439,
"step": 1390
},
{
"epoch": 0.1,
"grad_norm": 9.671121597290039,
"learning_rate": 0.0001999989787536199,
"loss": 3.4072,
"step": 1400
},
{
"epoch": 0.1,
"eval_loss": 3.6475000381469727,
"eval_runtime": 1136.9069,
"eval_samples_per_second": 5.014,
"eval_steps_per_second": 5.014,
"step": 1400
},
{
"epoch": 0.1,
"grad_norm": 6.519821643829346,
"learning_rate": 0.00019999835213228807,
"loss": 3.5066,
"step": 1410
},
{
"epoch": 0.1,
"grad_norm": 7.092315196990967,
"learning_rate": 0.00019999757631721448,
"loss": 3.4159,
"step": 1420
},
{
"epoch": 0.11,
"grad_norm": 5.200545310974121,
"learning_rate": 0.00019999665130955658,
"loss": 3.6435,
"step": 1430
},
{
"epoch": 0.11,
"grad_norm": 9.300562858581543,
"learning_rate": 0.00019999557711069445,
"loss": 3.4732,
"step": 1440
},
{
"epoch": 0.11,
"grad_norm": 6.44257926940918,
"learning_rate": 0.00019999435372223073,
"loss": 3.2643,
"step": 1450
},
{
"epoch": 0.11,
"grad_norm": 5.217918872833252,
"learning_rate": 0.00019999298114599073,
"loss": 3.4528,
"step": 1460
},
{
"epoch": 0.11,
"grad_norm": 5.9047465324401855,
"learning_rate": 0.00019999145938402223,
"loss": 3.615,
"step": 1470
},
{
"epoch": 0.11,
"grad_norm": 6.925083160400391,
"learning_rate": 0.00019998978843859563,
"loss": 3.5132,
"step": 1480
},
{
"epoch": 0.11,
"grad_norm": 5.6990885734558105,
"learning_rate": 0.000199987968312204,
"loss": 3.5586,
"step": 1490
},
{
"epoch": 0.11,
"grad_norm": 6.031268119812012,
"learning_rate": 0.00019998599900756278,
"loss": 3.4244,
"step": 1500
},
{
"epoch": 0.11,
"grad_norm": 6.2754807472229,
"learning_rate": 0.0001999838805276102,
"loss": 3.6738,
"step": 1510
},
{
"epoch": 0.11,
"grad_norm": 7.507335662841797,
"learning_rate": 0.0001999816128755069,
"loss": 3.5759,
"step": 1520
},
{
"epoch": 0.11,
"grad_norm": 5.121018886566162,
"learning_rate": 0.00019997919605463615,
"loss": 3.4038,
"step": 1530
},
{
"epoch": 0.11,
"grad_norm": 6.7317585945129395,
"learning_rate": 0.00019997663006860377,
"loss": 3.4423,
"step": 1540
},
{
"epoch": 0.11,
"grad_norm": 8.375152587890625,
"learning_rate": 0.00019997391492123805,
"loss": 3.4604,
"step": 1550
},
{
"epoch": 0.12,
"grad_norm": 8.493053436279297,
"learning_rate": 0.00019997105061658993,
"loss": 3.7444,
"step": 1560
},
{
"epoch": 0.12,
"grad_norm": 7.297514915466309,
"learning_rate": 0.00019996803715893288,
"loss": 3.5108,
"step": 1570
},
{
"epoch": 0.12,
"grad_norm": 7.771124362945557,
"learning_rate": 0.0001999648745527628,
"loss": 3.4314,
"step": 1580
},
{
"epoch": 0.12,
"grad_norm": 6.717478275299072,
"learning_rate": 0.0001999615628027982,
"loss": 3.4074,
"step": 1590
},
{
"epoch": 0.12,
"grad_norm": 6.69790506362915,
"learning_rate": 0.00019995810191398013,
"loss": 3.6088,
"step": 1600
},
{
"epoch": 0.12,
"eval_loss": 3.577223777770996,
"eval_runtime": 1137.2761,
"eval_samples_per_second": 5.012,
"eval_steps_per_second": 5.012,
"step": 1600
},
{
"epoch": 0.12,
"grad_norm": 6.6742353439331055,
"learning_rate": 0.00019995449189147202,
"loss": 3.8424,
"step": 1610
},
{
"epoch": 0.12,
"grad_norm": 7.415431499481201,
"learning_rate": 0.00019995073274065996,
"loss": 3.5783,
"step": 1620
},
{
"epoch": 0.12,
"grad_norm": 6.665797233581543,
"learning_rate": 0.00019994682446715243,
"loss": 3.7045,
"step": 1630
},
{
"epoch": 0.12,
"grad_norm": 7.37005090713501,
"learning_rate": 0.00019994276707678042,
"loss": 3.6974,
"step": 1640
},
{
"epoch": 0.12,
"grad_norm": 7.891625881195068,
"learning_rate": 0.0001999385605755974,
"loss": 3.7608,
"step": 1650
},
{
"epoch": 0.12,
"grad_norm": 7.512894153594971,
"learning_rate": 0.0001999342049698793,
"loss": 3.431,
"step": 1660
},
{
"epoch": 0.12,
"grad_norm": 6.875561714172363,
"learning_rate": 0.00019992970026612458,
"loss": 3.3929,
"step": 1670
},
{
"epoch": 0.12,
"grad_norm": 8.319578170776367,
"learning_rate": 0.00019992504647105402,
"loss": 4.0538,
"step": 1680
},
{
"epoch": 0.12,
"grad_norm": 7.310130596160889,
"learning_rate": 0.00019992024359161094,
"loss": 3.4099,
"step": 1690
},
{
"epoch": 0.13,
"grad_norm": 8.529996871948242,
"learning_rate": 0.00019991529163496105,
"loss": 3.8976,
"step": 1700
},
{
"epoch": 0.13,
"grad_norm": 7.030924320220947,
"learning_rate": 0.00019991019060849245,
"loss": 3.308,
"step": 1710
},
{
"epoch": 0.13,
"grad_norm": 7.881046772003174,
"learning_rate": 0.00019990494051981572,
"loss": 3.6736,
"step": 1720
},
{
"epoch": 0.13,
"grad_norm": 6.200523376464844,
"learning_rate": 0.00019989954137676378,
"loss": 3.5267,
"step": 1730
},
{
"epoch": 0.13,
"grad_norm": 7.548309326171875,
"learning_rate": 0.00019989399318739195,
"loss": 3.5834,
"step": 1740
},
{
"epoch": 0.13,
"grad_norm": 4.992281436920166,
"learning_rate": 0.0001998882959599779,
"loss": 3.5305,
"step": 1750
},
{
"epoch": 0.13,
"grad_norm": 4.387537002563477,
"learning_rate": 0.00019988244970302167,
"loss": 3.6708,
"step": 1760
},
{
"epoch": 0.13,
"grad_norm": 7.442427158355713,
"learning_rate": 0.00019987645442524565,
"loss": 3.3423,
"step": 1770
},
{
"epoch": 0.13,
"grad_norm": 8.170509338378906,
"learning_rate": 0.00019987031013559464,
"loss": 3.3772,
"step": 1780
},
{
"epoch": 0.13,
"grad_norm": 7.7752156257629395,
"learning_rate": 0.00019986401684323558,
"loss": 3.3992,
"step": 1790
},
{
"epoch": 0.13,
"grad_norm": 7.013359546661377,
"learning_rate": 0.00019985757455755792,
"loss": 3.5566,
"step": 1800
},
{
"epoch": 0.13,
"eval_loss": 3.54105806350708,
"eval_runtime": 1135.1448,
"eval_samples_per_second": 5.021,
"eval_steps_per_second": 5.021,
"step": 1800
},
{
"epoch": 0.13,
"grad_norm": 6.861136436462402,
"learning_rate": 0.00019985098328817325,
"loss": 3.9438,
"step": 1810
},
{
"epoch": 0.13,
"grad_norm": 6.609218120574951,
"learning_rate": 0.00019984424304491548,
"loss": 3.666,
"step": 1820
},
{
"epoch": 0.14,
"grad_norm": 4.466552257537842,
"learning_rate": 0.00019983735383784083,
"loss": 3.8464,
"step": 1830
},
{
"epoch": 0.14,
"grad_norm": 7.376965522766113,
"learning_rate": 0.00019983031567722776,
"loss": 3.6616,
"step": 1840
},
{
"epoch": 0.14,
"grad_norm": 7.786184310913086,
"learning_rate": 0.00019982312857357685,
"loss": 3.7319,
"step": 1850
},
{
"epoch": 0.14,
"grad_norm": 8.764631271362305,
"learning_rate": 0.00019981579253761108,
"loss": 3.6593,
"step": 1860
},
{
"epoch": 0.14,
"grad_norm": 5.396511077880859,
"learning_rate": 0.00019980830758027545,
"loss": 3.441,
"step": 1870
},
{
"epoch": 0.14,
"grad_norm": 8.925567626953125,
"learning_rate": 0.00019980067371273735,
"loss": 3.4468,
"step": 1880
},
{
"epoch": 0.14,
"grad_norm": 8.163759231567383,
"learning_rate": 0.00019979289094638613,
"loss": 3.245,
"step": 1890
},
{
"epoch": 0.14,
"grad_norm": 8.861410140991211,
"learning_rate": 0.00019978495929283337,
"loss": 3.5554,
"step": 1900
},
{
"epoch": 0.14,
"grad_norm": 7.900471210479736,
"learning_rate": 0.00019977687876391285,
"loss": 3.2615,
"step": 1910
},
{
"epoch": 0.14,
"grad_norm": 5.780396461486816,
"learning_rate": 0.00019976864937168036,
"loss": 3.3208,
"step": 1920
},
{
"epoch": 0.14,
"grad_norm": 5.2572407722473145,
"learning_rate": 0.00019976027112841388,
"loss": 3.352,
"step": 1930
},
{
"epoch": 0.14,
"grad_norm": 5.782130241394043,
"learning_rate": 0.00019975174404661346,
"loss": 3.5688,
"step": 1940
},
{
"epoch": 0.14,
"grad_norm": 6.212008953094482,
"learning_rate": 0.0001997430681390011,
"loss": 3.5783,
"step": 1950
},
{
"epoch": 0.14,
"grad_norm": 6.492382049560547,
"learning_rate": 0.00019973424341852099,
"loss": 3.5022,
"step": 1960
},
{
"epoch": 0.15,
"grad_norm": 8.884483337402344,
"learning_rate": 0.0001997252698983392,
"loss": 3.7064,
"step": 1970
},
{
"epoch": 0.15,
"grad_norm": 5.934466361999512,
"learning_rate": 0.000199716147591844,
"loss": 3.2841,
"step": 1980
},
{
"epoch": 0.15,
"grad_norm": 7.51339054107666,
"learning_rate": 0.00019970687651264544,
"loss": 3.5057,
"step": 1990
},
{
"epoch": 0.15,
"grad_norm": 6.577907562255859,
"learning_rate": 0.00019969745667457563,
"loss": 3.732,
"step": 2000
},
{
"epoch": 0.15,
"eval_loss": 3.5348992347717285,
"eval_runtime": 1138.0424,
"eval_samples_per_second": 5.009,
"eval_steps_per_second": 5.009,
"step": 2000
},
{
"epoch": 0.15,
"grad_norm": 7.850986957550049,
"learning_rate": 0.00019968788809168864,
"loss": 3.6663,
"step": 2010
},
{
"epoch": 0.15,
"grad_norm": 6.481893539428711,
"learning_rate": 0.00019967817077826038,
"loss": 3.6468,
"step": 2020
},
{
"epoch": 0.15,
"grad_norm": 4.882330417633057,
"learning_rate": 0.00019966830474878874,
"loss": 3.2107,
"step": 2030
},
{
"epoch": 0.15,
"grad_norm": 6.80741548538208,
"learning_rate": 0.0001996582900179935,
"loss": 3.4008,
"step": 2040
},
{
"epoch": 0.15,
"grad_norm": 6.9632062911987305,
"learning_rate": 0.0001996481266008162,
"loss": 3.7073,
"step": 2050
},
{
"epoch": 0.15,
"grad_norm": 6.361908435821533,
"learning_rate": 0.0001996378145124203,
"loss": 3.766,
"step": 2060
},
{
"epoch": 0.15,
"grad_norm": 6.315945625305176,
"learning_rate": 0.00019962735376819103,
"loss": 3.2956,
"step": 2070
},
{
"epoch": 0.15,
"grad_norm": 6.583601474761963,
"learning_rate": 0.00019961674438373543,
"loss": 3.5508,
"step": 2080
},
{
"epoch": 0.15,
"grad_norm": 4.8111443519592285,
"learning_rate": 0.00019960598637488232,
"loss": 3.2411,
"step": 2090
},
{
"epoch": 0.16,
"grad_norm": 4.75316858291626,
"learning_rate": 0.0001995950797576822,
"loss": 3.5754,
"step": 2100
},
{
"epoch": 0.16,
"grad_norm": 10.522501945495605,
"learning_rate": 0.00019958402454840735,
"loss": 3.4347,
"step": 2110
},
{
"epoch": 0.16,
"grad_norm": 4.327103137969971,
"learning_rate": 0.00019957282076355176,
"loss": 3.1955,
"step": 2120
},
{
"epoch": 0.16,
"grad_norm": 6.88126802444458,
"learning_rate": 0.00019956146841983095,
"loss": 3.7632,
"step": 2130
},
{
"epoch": 0.16,
"grad_norm": 7.087936878204346,
"learning_rate": 0.00019954996753418226,
"loss": 3.6128,
"step": 2140
},
{
"epoch": 0.16,
"grad_norm": 7.831874847412109,
"learning_rate": 0.00019953831812376458,
"loss": 3.3576,
"step": 2150
},
{
"epoch": 0.16,
"grad_norm": 8.72523307800293,
"learning_rate": 0.00019952652020595836,
"loss": 3.7325,
"step": 2160
},
{
"epoch": 0.16,
"grad_norm": 4.645705223083496,
"learning_rate": 0.0001995145737983657,
"loss": 3.1901,
"step": 2170
},
{
"epoch": 0.16,
"grad_norm": 4.229705810546875,
"learning_rate": 0.00019950247891881007,
"loss": 3.4187,
"step": 2180
},
{
"epoch": 0.16,
"grad_norm": 6.123934745788574,
"learning_rate": 0.00019949023558533667,
"loss": 3.4375,
"step": 2190
},
{
"epoch": 0.16,
"grad_norm": 5.184828758239746,
"learning_rate": 0.00019947784381621207,
"loss": 3.439,
"step": 2200
},
{
"epoch": 0.16,
"eval_loss": 3.48419451713562,
"eval_runtime": 1136.5822,
"eval_samples_per_second": 5.015,
"eval_steps_per_second": 5.015,
"step": 2200
},
{
"epoch": 0.16,
"grad_norm": 8.93528938293457,
"learning_rate": 0.0001994653036299243,
"loss": 3.3408,
"step": 2210
},
{
"epoch": 0.16,
"grad_norm": 6.074134349822998,
"learning_rate": 0.00019945261504518283,
"loss": 3.2553,
"step": 2220
},
{
"epoch": 0.16,
"grad_norm": 6.840206623077393,
"learning_rate": 0.0001994397780809186,
"loss": 3.7404,
"step": 2230
},
{
"epoch": 0.17,
"grad_norm": 5.7097015380859375,
"learning_rate": 0.00019942679275628385,
"loss": 3.5795,
"step": 2240
},
{
"epoch": 0.17,
"grad_norm": 9.260488510131836,
"learning_rate": 0.00019941365909065213,
"loss": 3.3823,
"step": 2250
},
{
"epoch": 0.17,
"grad_norm": 5.96670389175415,
"learning_rate": 0.00019940037710361845,
"loss": 3.5781,
"step": 2260
},
{
"epoch": 0.17,
"grad_norm": 6.096765041351318,
"learning_rate": 0.000199386946814999,
"loss": 3.318,
"step": 2270
},
{
"epoch": 0.17,
"grad_norm": 8.807679176330566,
"learning_rate": 0.00019937336824483125,
"loss": 3.899,
"step": 2280
},
{
"epoch": 0.17,
"grad_norm": 8.762829780578613,
"learning_rate": 0.00019935964141337397,
"loss": 3.6643,
"step": 2290
},
{
"epoch": 0.17,
"grad_norm": 6.245787143707275,
"learning_rate": 0.00019934576634110694,
"loss": 3.3506,
"step": 2300
},
{
"epoch": 0.17,
"grad_norm": 7.598389148712158,
"learning_rate": 0.00019933174304873137,
"loss": 3.6882,
"step": 2310
},
{
"epoch": 0.17,
"grad_norm": 5.335952281951904,
"learning_rate": 0.00019931757155716945,
"loss": 3.2894,
"step": 2320
},
{
"epoch": 0.17,
"grad_norm": 9.133307456970215,
"learning_rate": 0.00019930325188756445,
"loss": 3.7499,
"step": 2330
},
{
"epoch": 0.17,
"grad_norm": 4.007411003112793,
"learning_rate": 0.00019928878406128082,
"loss": 3.5422,
"step": 2340
},
{
"epoch": 0.17,
"grad_norm": 5.258805274963379,
"learning_rate": 0.000199274168099904,
"loss": 3.2147,
"step": 2350
},
{
"epoch": 0.17,
"grad_norm": 7.238628387451172,
"learning_rate": 0.00019925940402524045,
"loss": 3.6826,
"step": 2360
},
{
"epoch": 0.18,
"grad_norm": 9.149068832397461,
"learning_rate": 0.0001992444918593176,
"loss": 3.3555,
"step": 2370
},
{
"epoch": 0.18,
"grad_norm": 4.866962432861328,
"learning_rate": 0.00019922943162438387,
"loss": 3.4047,
"step": 2380
},
{
"epoch": 0.18,
"grad_norm": 5.280197620391846,
"learning_rate": 0.00019921422334290853,
"loss": 3.3403,
"step": 2390
},
{
"epoch": 0.18,
"grad_norm": 7.82426643371582,
"learning_rate": 0.00019919886703758172,
"loss": 3.3946,
"step": 2400
},
{
"epoch": 0.18,
"eval_loss": 3.453319549560547,
"eval_runtime": 1136.6416,
"eval_samples_per_second": 5.015,
"eval_steps_per_second": 5.015,
"step": 2400
},
{
"epoch": 0.18,
"grad_norm": 5.7295026779174805,
"learning_rate": 0.00019918336273131452,
"loss": 3.5742,
"step": 2410
},
{
"epoch": 0.18,
"grad_norm": 8.926092147827148,
"learning_rate": 0.00019916771044723876,
"loss": 3.2468,
"step": 2420
},
{
"epoch": 0.18,
"grad_norm": 7.297746181488037,
"learning_rate": 0.00019915191020870702,
"loss": 3.3415,
"step": 2430
},
{
"epoch": 0.18,
"grad_norm": 9.079599380493164,
"learning_rate": 0.0001991359620392927,
"loss": 3.3625,
"step": 2440
},
{
"epoch": 0.18,
"grad_norm": 5.494599342346191,
"learning_rate": 0.00019911986596278985,
"loss": 3.6401,
"step": 2450
},
{
"epoch": 0.18,
"grad_norm": 6.640133380889893,
"learning_rate": 0.00019910362200321316,
"loss": 3.4156,
"step": 2460
},
{
"epoch": 0.18,
"grad_norm": 6.4240899085998535,
"learning_rate": 0.00019908723018479803,
"loss": 3.5701,
"step": 2470
},
{
"epoch": 0.18,
"grad_norm": 8.585311889648438,
"learning_rate": 0.00019907069053200048,
"loss": 3.7639,
"step": 2480
},
{
"epoch": 0.18,
"grad_norm": 5.190982341766357,
"learning_rate": 0.00019905400306949696,
"loss": 3.33,
"step": 2490
},
{
"epoch": 0.18,
"grad_norm": 11.753495216369629,
"learning_rate": 0.0001990371678221846,
"loss": 3.4348,
"step": 2500
},
{
"epoch": 0.19,
"grad_norm": 6.850786209106445,
"learning_rate": 0.00019902018481518087,
"loss": 3.3675,
"step": 2510
},
{
"epoch": 0.19,
"grad_norm": 6.522672653198242,
"learning_rate": 0.00019900305407382385,
"loss": 3.8967,
"step": 2520
},
{
"epoch": 0.19,
"grad_norm": 5.153144836425781,
"learning_rate": 0.00019898577562367192,
"loss": 3.5849,
"step": 2530
},
{
"epoch": 0.19,
"grad_norm": 5.392364978790283,
"learning_rate": 0.00019896834949050386,
"loss": 3.4041,
"step": 2540
},
{
"epoch": 0.19,
"grad_norm": 4.904518127441406,
"learning_rate": 0.00019895077570031885,
"loss": 3.1431,
"step": 2550
},
{
"epoch": 0.19,
"grad_norm": 8.451141357421875,
"learning_rate": 0.00019893305427933625,
"loss": 3.5762,
"step": 2560
},
{
"epoch": 0.19,
"grad_norm": 4.73913049697876,
"learning_rate": 0.00019891518525399577,
"loss": 3.385,
"step": 2570
},
{
"epoch": 0.19,
"grad_norm": 7.964975357055664,
"learning_rate": 0.00019889716865095737,
"loss": 3.5396,
"step": 2580
},
{
"epoch": 0.19,
"grad_norm": 5.87448787689209,
"learning_rate": 0.00019887900449710105,
"loss": 3.3033,
"step": 2590
},
{
"epoch": 0.19,
"grad_norm": 7.167208671569824,
"learning_rate": 0.0001988606928195271,
"loss": 3.2439,
"step": 2600
},
{
"epoch": 0.19,
"eval_loss": 3.4154865741729736,
"eval_runtime": 1136.1752,
"eval_samples_per_second": 5.017,
"eval_steps_per_second": 5.017,
"step": 2600
},
{
"epoch": 0.19,
"grad_norm": 8.291434288024902,
"learning_rate": 0.00019884223364555577,
"loss": 3.5985,
"step": 2610
},
{
"epoch": 0.19,
"grad_norm": 13.045690536499023,
"learning_rate": 0.00019882362700272756,
"loss": 3.6016,
"step": 2620
},
{
"epoch": 0.19,
"grad_norm": 4.1934638023376465,
"learning_rate": 0.0001988048729188028,
"loss": 3.3421,
"step": 2630
},
{
"epoch": 0.2,
"grad_norm": 6.0803022384643555,
"learning_rate": 0.0001987859714217619,
"loss": 3.3617,
"step": 2640
},
{
"epoch": 0.2,
"grad_norm": 5.752238750457764,
"learning_rate": 0.00019876692253980514,
"loss": 3.2002,
"step": 2650
},
{
"epoch": 0.2,
"grad_norm": 7.0404229164123535,
"learning_rate": 0.00019874772630135276,
"loss": 3.6474,
"step": 2660
},
{
"epoch": 0.2,
"grad_norm": 6.9117231369018555,
"learning_rate": 0.00019872838273504484,
"loss": 3.4813,
"step": 2670
},
{
"epoch": 0.2,
"grad_norm": 4.626667022705078,
"learning_rate": 0.00019870889186974114,
"loss": 3.4797,
"step": 2680
},
{
"epoch": 0.2,
"grad_norm": 7.123105049133301,
"learning_rate": 0.00019868925373452143,
"loss": 3.3551,
"step": 2690
},
{
"epoch": 0.2,
"grad_norm": 5.760848045349121,
"learning_rate": 0.00019866946835868498,
"loss": 3.449,
"step": 2700
},
{
"epoch": 0.2,
"grad_norm": 8.604194641113281,
"learning_rate": 0.00019864953577175082,
"loss": 3.5442,
"step": 2710
},
{
"epoch": 0.2,
"grad_norm": 6.785797595977783,
"learning_rate": 0.00019862945600345765,
"loss": 3.2603,
"step": 2720
},
{
"epoch": 0.2,
"grad_norm": 5.647066593170166,
"learning_rate": 0.00019860922908376369,
"loss": 2.6124,
"step": 2730
},
{
"epoch": 0.2,
"grad_norm": 7.947900295257568,
"learning_rate": 0.00019858885504284678,
"loss": 3.4572,
"step": 2740
},
{
"epoch": 0.2,
"grad_norm": 8.052631378173828,
"learning_rate": 0.00019856833391110413,
"loss": 3.5738,
"step": 2750
},
{
"epoch": 0.2,
"grad_norm": 8.352448463439941,
"learning_rate": 0.00019854766571915256,
"loss": 3.6006,
"step": 2760
},
{
"epoch": 0.2,
"grad_norm": 7.586352825164795,
"learning_rate": 0.0001985268504978282,
"loss": 3.2241,
"step": 2770
},
{
"epoch": 0.21,
"grad_norm": 7.188523292541504,
"learning_rate": 0.00019850588827818657,
"loss": 3.6322,
"step": 2780
},
{
"epoch": 0.21,
"grad_norm": 5.39801025390625,
"learning_rate": 0.0001984847790915025,
"loss": 3.4845,
"step": 2790
},
{
"epoch": 0.21,
"grad_norm": 7.282923221588135,
"learning_rate": 0.00019846352296927014,
"loss": 3.4464,
"step": 2800
},
{
"epoch": 0.21,
"eval_loss": 3.367934465408325,
"eval_runtime": 1136.0262,
"eval_samples_per_second": 5.017,
"eval_steps_per_second": 5.017,
"step": 2800
},
{
"epoch": 0.21,
"grad_norm": 4.772936820983887,
"learning_rate": 0.00019844211994320276,
"loss": 3.4074,
"step": 2810
},
{
"epoch": 0.21,
"grad_norm": 4.3813557624816895,
"learning_rate": 0.0001984205700452329,
"loss": 3.3233,
"step": 2820
},
{
"epoch": 0.21,
"grad_norm": 6.158441066741943,
"learning_rate": 0.00019839887330751216,
"loss": 3.3386,
"step": 2830
},
{
"epoch": 0.21,
"grad_norm": 6.600301742553711,
"learning_rate": 0.00019837702976241125,
"loss": 3.6874,
"step": 2840
},
{
"epoch": 0.21,
"grad_norm": 4.815470218658447,
"learning_rate": 0.0001983550394425199,
"loss": 3.3827,
"step": 2850
},
{
"epoch": 0.21,
"grad_norm": 5.964359283447266,
"learning_rate": 0.0001983329023806469,
"loss": 3.2807,
"step": 2860
},
{
"epoch": 0.21,
"grad_norm": 8.458023071289062,
"learning_rate": 0.00019831061860981983,
"loss": 3.632,
"step": 2870
},
{
"epoch": 0.21,
"grad_norm": 5.9718451499938965,
"learning_rate": 0.00019828818816328524,
"loss": 3.5007,
"step": 2880
},
{
"epoch": 0.21,
"grad_norm": 5.465640068054199,
"learning_rate": 0.00019826561107450855,
"loss": 3.4227,
"step": 2890
},
{
"epoch": 0.21,
"grad_norm": 7.5957932472229,
"learning_rate": 0.0001982428873771739,
"loss": 3.276,
"step": 2900
},
{
"epoch": 0.21,
"grad_norm": 6.594062805175781,
"learning_rate": 0.00019822001710518414,
"loss": 3.5748,
"step": 2910
},
{
"epoch": 0.22,
"grad_norm": 7.030744552612305,
"learning_rate": 0.0001981970002926609,
"loss": 3.52,
"step": 2920
},
{
"epoch": 0.22,
"grad_norm": 4.242162227630615,
"learning_rate": 0.00019817383697394436,
"loss": 3.1708,
"step": 2930
},
{
"epoch": 0.22,
"grad_norm": 5.48106575012207,
"learning_rate": 0.00019815052718359332,
"loss": 3.3604,
"step": 2940
},
{
"epoch": 0.22,
"grad_norm": 5.874629020690918,
"learning_rate": 0.0001981270709563851,
"loss": 3.6508,
"step": 2950
},
{
"epoch": 0.22,
"grad_norm": 8.531209945678711,
"learning_rate": 0.00019810346832731547,
"loss": 3.6164,
"step": 2960
},
{
"epoch": 0.22,
"grad_norm": 5.588098526000977,
"learning_rate": 0.00019807971933159872,
"loss": 3.2622,
"step": 2970
},
{
"epoch": 0.22,
"grad_norm": 6.22597599029541,
"learning_rate": 0.00019805582400466744,
"loss": 3.4031,
"step": 2980
},
{
"epoch": 0.22,
"grad_norm": 6.695744514465332,
"learning_rate": 0.0001980317823821725,
"loss": 3.5455,
"step": 2990
},
{
"epoch": 0.22,
"grad_norm": 4.2548041343688965,
"learning_rate": 0.00019800759449998309,
"loss": 3.0615,
"step": 3000
},
{
"epoch": 0.22,
"eval_loss": 3.3597333431243896,
"eval_runtime": 1134.8816,
"eval_samples_per_second": 5.023,
"eval_steps_per_second": 5.023,
"step": 3000
},
{
"epoch": 0.22,
"grad_norm": 8.229665756225586,
"learning_rate": 0.00019798326039418667,
"loss": 3.3148,
"step": 3010
},
{
"epoch": 0.22,
"grad_norm": 5.809466361999512,
"learning_rate": 0.00019795878010108874,
"loss": 3.4232,
"step": 3020
},
{
"epoch": 0.22,
"grad_norm": 6.6790452003479,
"learning_rate": 0.00019793415365721302,
"loss": 3.4493,
"step": 3030
},
{
"epoch": 0.22,
"grad_norm": 5.497518539428711,
"learning_rate": 0.00019790938109930117,
"loss": 3.5587,
"step": 3040
},
{
"epoch": 0.23,
"grad_norm": 6.745602607727051,
"learning_rate": 0.00019788446246431294,
"loss": 3.1202,
"step": 3050
},
{
"epoch": 0.23,
"grad_norm": 5.6326751708984375,
"learning_rate": 0.00019785939778942598,
"loss": 3.3952,
"step": 3060
},
{
"epoch": 0.23,
"grad_norm": 9.828627586364746,
"learning_rate": 0.00019783418711203586,
"loss": 3.515,
"step": 3070
},
{
"epoch": 0.23,
"grad_norm": 6.52869987487793,
"learning_rate": 0.00019780883046975593,
"loss": 3.0494,
"step": 3080
},
{
"epoch": 0.23,
"grad_norm": 5.64887809753418,
"learning_rate": 0.0001977833279004173,
"loss": 3.25,
"step": 3090
},
{
"epoch": 0.23,
"grad_norm": 8.327272415161133,
"learning_rate": 0.0001977576794420689,
"loss": 3.0999,
"step": 3100
},
{
"epoch": 0.23,
"grad_norm": 6.6515960693359375,
"learning_rate": 0.0001977318851329772,
"loss": 3.4192,
"step": 3110
},
{
"epoch": 0.23,
"grad_norm": 5.670393943786621,
"learning_rate": 0.00019770594501162636,
"loss": 3.5086,
"step": 3120
},
{
"epoch": 0.23,
"grad_norm": 4.622827529907227,
"learning_rate": 0.00019767985911671806,
"loss": 3.4726,
"step": 3130
},
{
"epoch": 0.23,
"grad_norm": 8.66515827178955,
"learning_rate": 0.00019765362748717146,
"loss": 3.4205,
"step": 3140
},
{
"epoch": 0.23,
"grad_norm": 8.402259826660156,
"learning_rate": 0.0001976272501621231,
"loss": 3.4137,
"step": 3150
},
{
"epoch": 0.23,
"grad_norm": 5.634212017059326,
"learning_rate": 0.00019760072718092705,
"loss": 3.1628,
"step": 3160
},
{
"epoch": 0.23,
"grad_norm": 4.353554725646973,
"learning_rate": 0.00019757405858315452,
"loss": 3.276,
"step": 3170
},
{
"epoch": 0.23,
"grad_norm": 5.939391613006592,
"learning_rate": 0.00019754724440859404,
"loss": 3.5853,
"step": 3180
},
{
"epoch": 0.24,
"grad_norm": 8.367985725402832,
"learning_rate": 0.0001975202846972514,
"loss": 3.4567,
"step": 3190
},
{
"epoch": 0.24,
"grad_norm": 7.315502166748047,
"learning_rate": 0.00019749317948934938,
"loss": 3.4765,
"step": 3200
},
{
"epoch": 0.24,
"eval_loss": 3.343524217605591,
"eval_runtime": 1140.2904,
"eval_samples_per_second": 4.999,
"eval_steps_per_second": 4.999,
"step": 3200
},
{
"epoch": 0.24,
"grad_norm": 8.31916332244873,
"learning_rate": 0.000197465928825328,
"loss": 3.3034,
"step": 3210
},
{
"epoch": 0.24,
"grad_norm": 8.205561637878418,
"learning_rate": 0.00019743853274584413,
"loss": 3.5482,
"step": 3220
},
{
"epoch": 0.24,
"grad_norm": 5.829329967498779,
"learning_rate": 0.00019741099129177175,
"loss": 2.9163,
"step": 3230
},
{
"epoch": 0.24,
"grad_norm": 7.337162494659424,
"learning_rate": 0.00019738330450420167,
"loss": 3.8382,
"step": 3240
},
{
"epoch": 0.24,
"grad_norm": 3.8535377979278564,
"learning_rate": 0.00019735547242444147,
"loss": 3.3907,
"step": 3250
},
{
"epoch": 0.24,
"grad_norm": 8.694036483764648,
"learning_rate": 0.0001973274950940156,
"loss": 3.3614,
"step": 3260
},
{
"epoch": 0.24,
"grad_norm": 6.478395938873291,
"learning_rate": 0.00019729937255466516,
"loss": 3.5151,
"step": 3270
},
{
"epoch": 0.24,
"grad_norm": 5.95184850692749,
"learning_rate": 0.00019727110484834786,
"loss": 3.6187,
"step": 3280
},
{
"epoch": 0.24,
"grad_norm": 7.137448787689209,
"learning_rate": 0.00019724269201723812,
"loss": 3.1106,
"step": 3290
},
{
"epoch": 0.24,
"grad_norm": 11.196949005126953,
"learning_rate": 0.0001972141341037268,
"loss": 3.5204,
"step": 3300
},
{
"epoch": 0.24,
"grad_norm": 6.896291732788086,
"learning_rate": 0.00019718543115042114,
"loss": 3.0704,
"step": 3310
},
{
"epoch": 0.25,
"grad_norm": 6.517507076263428,
"learning_rate": 0.00019715658320014495,
"loss": 2.7999,
"step": 3320
},
{
"epoch": 0.25,
"grad_norm": 5.880134582519531,
"learning_rate": 0.00019712759029593823,
"loss": 3.1512,
"step": 3330
},
{
"epoch": 0.25,
"grad_norm": 5.887697696685791,
"learning_rate": 0.0001970984524810573,
"loss": 3.2726,
"step": 3340
},
{
"epoch": 0.25,
"grad_norm": 7.048807144165039,
"learning_rate": 0.0001970691697989747,
"loss": 3.2771,
"step": 3350
},
{
"epoch": 0.25,
"grad_norm": 7.299494743347168,
"learning_rate": 0.000197039742293379,
"loss": 3.5471,
"step": 3360
},
{
"epoch": 0.25,
"grad_norm": 5.468966007232666,
"learning_rate": 0.000197010170008175,
"loss": 3.255,
"step": 3370
},
{
"epoch": 0.25,
"grad_norm": 5.875086307525635,
"learning_rate": 0.0001969804529874834,
"loss": 3.4126,
"step": 3380
},
{
"epoch": 0.25,
"grad_norm": 7.930294513702393,
"learning_rate": 0.00019695059127564085,
"loss": 3.075,
"step": 3390
},
{
"epoch": 0.25,
"grad_norm": 7.626434803009033,
"learning_rate": 0.0001969205849171999,
"loss": 3.4761,
"step": 3400
},
{
"epoch": 0.25,
"eval_loss": 3.3232839107513428,
"eval_runtime": 1137.5832,
"eval_samples_per_second": 5.011,
"eval_steps_per_second": 5.011,
"step": 3400
},
{
"epoch": 0.25,
"grad_norm": 5.242149829864502,
"learning_rate": 0.00019689043395692892,
"loss": 3.0588,
"step": 3410
},
{
"epoch": 0.25,
"grad_norm": 7.011462688446045,
"learning_rate": 0.00019686013843981198,
"loss": 3.2723,
"step": 3420
},
{
"epoch": 0.25,
"grad_norm": 4.377874374389648,
"learning_rate": 0.00019682969841104878,
"loss": 3.1512,
"step": 3430
},
{
"epoch": 0.25,
"grad_norm": 6.708550930023193,
"learning_rate": 0.0001967991139160548,
"loss": 3.1751,
"step": 3440
},
{
"epoch": 0.25,
"grad_norm": 4.417352199554443,
"learning_rate": 0.00019676838500046087,
"loss": 3.3083,
"step": 3450
},
{
"epoch": 0.26,
"grad_norm": 7.341493129730225,
"learning_rate": 0.00019673751171011338,
"loss": 3.2975,
"step": 3460
},
{
"epoch": 0.26,
"grad_norm": 8.692483901977539,
"learning_rate": 0.00019670649409107412,
"loss": 3.8891,
"step": 3470
},
{
"epoch": 0.26,
"grad_norm": 6.154200077056885,
"learning_rate": 0.00019667533218962018,
"loss": 3.6839,
"step": 3480
},
{
"epoch": 0.26,
"grad_norm": 4.297388553619385,
"learning_rate": 0.00019664402605224394,
"loss": 3.1778,
"step": 3490
},
{
"epoch": 0.26,
"grad_norm": 7.2736992835998535,
"learning_rate": 0.00019661257572565295,
"loss": 3.469,
"step": 3500
},
{
"epoch": 0.26,
"grad_norm": 7.676090717315674,
"learning_rate": 0.00019658098125676992,
"loss": 3.4535,
"step": 3510
},
{
"epoch": 0.26,
"grad_norm": 6.6982421875,
"learning_rate": 0.00019654924269273263,
"loss": 3.3746,
"step": 3520
},
{
"epoch": 0.26,
"grad_norm": 6.276124954223633,
"learning_rate": 0.00019651736008089373,
"loss": 2.9256,
"step": 3530
},
{
"epoch": 0.26,
"grad_norm": 5.375932693481445,
"learning_rate": 0.00019648533346882093,
"loss": 3.3528,
"step": 3540
},
{
"epoch": 0.26,
"grad_norm": 4.612643718719482,
"learning_rate": 0.00019645316290429674,
"loss": 3.5446,
"step": 3550
},
{
"epoch": 0.26,
"grad_norm": 6.172947406768799,
"learning_rate": 0.00019642084843531836,
"loss": 3.1953,
"step": 3560
},
{
"epoch": 0.26,
"grad_norm": 7.488225936889648,
"learning_rate": 0.00019638839011009774,
"loss": 3.6664,
"step": 3570
},
{
"epoch": 0.26,
"grad_norm": 7.576664924621582,
"learning_rate": 0.00019635578797706153,
"loss": 3.3036,
"step": 3580
},
{
"epoch": 0.27,
"grad_norm": 5.035768508911133,
"learning_rate": 0.00019632304208485083,
"loss": 3.0142,
"step": 3590
},
{
"epoch": 0.27,
"grad_norm": 9.324599266052246,
"learning_rate": 0.0001962901524823213,
"loss": 3.3434,
"step": 3600
},
{
"epoch": 0.27,
"eval_loss": 3.311063289642334,
"eval_runtime": 1137.219,
"eval_samples_per_second": 5.012,
"eval_steps_per_second": 5.012,
"step": 3600
},
{
"epoch": 0.27,
"grad_norm": 10.588373184204102,
"learning_rate": 0.00019625711921854294,
"loss": 3.2817,
"step": 3610
},
{
"epoch": 0.27,
"grad_norm": 6.402177333831787,
"learning_rate": 0.00019622394234280015,
"loss": 3.5977,
"step": 3620
},
{
"epoch": 0.27,
"grad_norm": 5.769714832305908,
"learning_rate": 0.00019619062190459158,
"loss": 3.4483,
"step": 3630
},
{
"epoch": 0.27,
"grad_norm": 7.45050573348999,
"learning_rate": 0.00019615715795363002,
"loss": 3.1609,
"step": 3640
},
{
"epoch": 0.27,
"grad_norm": 7.920661926269531,
"learning_rate": 0.0001961235505398424,
"loss": 3.6847,
"step": 3650
},
{
"epoch": 0.27,
"grad_norm": 5.056427478790283,
"learning_rate": 0.00019608979971336976,
"loss": 3.2006,
"step": 3660
},
{
"epoch": 0.27,
"grad_norm": 4.104165554046631,
"learning_rate": 0.00019605590552456702,
"loss": 3.3135,
"step": 3670
},
{
"epoch": 0.27,
"grad_norm": 7.370213985443115,
"learning_rate": 0.00019602186802400304,
"loss": 3.2463,
"step": 3680
},
{
"epoch": 0.27,
"grad_norm": 8.189712524414062,
"learning_rate": 0.00019598768726246046,
"loss": 3.3439,
"step": 3690
},
{
"epoch": 0.27,
"grad_norm": 7.025254249572754,
"learning_rate": 0.0001959533632909357,
"loss": 3.377,
"step": 3700
},
{
"epoch": 0.27,
"grad_norm": 8.040080070495605,
"learning_rate": 0.00019591889616063876,
"loss": 2.955,
"step": 3710
},
{
"epoch": 0.27,
"grad_norm": 10.804893493652344,
"learning_rate": 0.00019588428592299338,
"loss": 3.1838,
"step": 3720
},
{
"epoch": 0.28,
"grad_norm": 5.024282455444336,
"learning_rate": 0.00019584953262963666,
"loss": 3.6454,
"step": 3730
},
{
"epoch": 0.28,
"grad_norm": 8.655365943908691,
"learning_rate": 0.00019581463633241918,
"loss": 3.1139,
"step": 3740
},
{
"epoch": 0.28,
"grad_norm": 6.94295597076416,
"learning_rate": 0.00019577959708340497,
"loss": 3.2513,
"step": 3750
},
{
"epoch": 0.28,
"grad_norm": 7.816835880279541,
"learning_rate": 0.00019574441493487113,
"loss": 3.2964,
"step": 3760
},
{
"epoch": 0.28,
"grad_norm": 6.934699058532715,
"learning_rate": 0.00019570908993930825,
"loss": 3.4247,
"step": 3770
},
{
"epoch": 0.28,
"grad_norm": 5.775935649871826,
"learning_rate": 0.0001956736221494197,
"loss": 3.2132,
"step": 3780
},
{
"epoch": 0.28,
"grad_norm": 10.476348876953125,
"learning_rate": 0.00019563801161812222,
"loss": 3.3441,
"step": 3790
},
{
"epoch": 0.28,
"grad_norm": 6.069675445556641,
"learning_rate": 0.0001956022583985453,
"loss": 3.5925,
"step": 3800
},
{
"epoch": 0.28,
"eval_loss": 3.297185182571411,
"eval_runtime": 1137.6657,
"eval_samples_per_second": 5.01,
"eval_steps_per_second": 5.01,
"step": 3800
},
{
"epoch": 0.28,
"grad_norm": 7.1156134605407715,
"learning_rate": 0.00019556636254403143,
"loss": 3.3711,
"step": 3810
},
{
"epoch": 0.28,
"grad_norm": 6.738784313201904,
"learning_rate": 0.0001955303241081358,
"loss": 3.6561,
"step": 3820
},
{
"epoch": 0.28,
"grad_norm": 6.976244926452637,
"learning_rate": 0.00019549414314462644,
"loss": 3.3276,
"step": 3830
},
{
"epoch": 0.28,
"grad_norm": 6.545201301574707,
"learning_rate": 0.00019545781970748395,
"loss": 3.6572,
"step": 3840
},
{
"epoch": 0.28,
"grad_norm": 2.9633677005767822,
"learning_rate": 0.00019542135385090155,
"loss": 3.0714,
"step": 3850
},
{
"epoch": 0.29,
"grad_norm": 8.194368362426758,
"learning_rate": 0.00019538474562928485,
"loss": 3.3449,
"step": 3860
},
{
"epoch": 0.29,
"grad_norm": 8.38609790802002,
"learning_rate": 0.00019534799509725198,
"loss": 3.1067,
"step": 3870
},
{
"epoch": 0.29,
"grad_norm": 7.127841472625732,
"learning_rate": 0.00019531110230963327,
"loss": 3.4038,
"step": 3880
},
{
"epoch": 0.29,
"grad_norm": 6.696997165679932,
"learning_rate": 0.00019527406732147145,
"loss": 3.286,
"step": 3890
},
{
"epoch": 0.29,
"grad_norm": 6.132751941680908,
"learning_rate": 0.00019523689018802125,
"loss": 3.4134,
"step": 3900
},
{
"epoch": 0.29,
"grad_norm": 4.486321449279785,
"learning_rate": 0.00019519957096474956,
"loss": 3.6381,
"step": 3910
},
{
"epoch": 0.29,
"grad_norm": 5.290067195892334,
"learning_rate": 0.00019516210970733526,
"loss": 3.661,
"step": 3920
},
{
"epoch": 0.29,
"grad_norm": 8.747777938842773,
"learning_rate": 0.0001951245064716691,
"loss": 3.4642,
"step": 3930
},
{
"epoch": 0.29,
"grad_norm": 7.958836555480957,
"learning_rate": 0.00019508676131385367,
"loss": 3.0258,
"step": 3940
},
{
"epoch": 0.29,
"grad_norm": 6.06564998626709,
"learning_rate": 0.00019504887429020335,
"loss": 3.666,
"step": 3950
},
{
"epoch": 0.29,
"grad_norm": 5.823673248291016,
"learning_rate": 0.0001950108454572441,
"loss": 2.9987,
"step": 3960
},
{
"epoch": 0.29,
"grad_norm": 9.578413009643555,
"learning_rate": 0.00019497267487171352,
"loss": 3.2817,
"step": 3970
},
{
"epoch": 0.29,
"grad_norm": 6.610091686248779,
"learning_rate": 0.00019493436259056067,
"loss": 3.1193,
"step": 3980
},
{
"epoch": 0.29,
"grad_norm": 6.841573238372803,
"learning_rate": 0.000194895908670946,
"loss": 3.2473,
"step": 3990
},
{
"epoch": 0.3,
"grad_norm": 7.869802474975586,
"learning_rate": 0.0001948573131702413,
"loss": 3.2627,
"step": 4000
},
{
"epoch": 0.3,
"eval_loss": 3.2718520164489746,
"eval_runtime": 1137.1006,
"eval_samples_per_second": 5.013,
"eval_steps_per_second": 5.013,
"step": 4000
},
{
"epoch": 0.3,
"grad_norm": 5.743564605712891,
"learning_rate": 0.0001948185761460296,
"loss": 3.4821,
"step": 4010
},
{
"epoch": 0.3,
"grad_norm": 5.584972858428955,
"learning_rate": 0.00019477969765610507,
"loss": 3.0976,
"step": 4020
},
{
"epoch": 0.3,
"grad_norm": 6.404329299926758,
"learning_rate": 0.00019474067775847296,
"loss": 3.165,
"step": 4030
},
{
"epoch": 0.3,
"grad_norm": 4.988752841949463,
"learning_rate": 0.0001947015165113494,
"loss": 3.5626,
"step": 4040
},
{
"epoch": 0.3,
"grad_norm": 7.516745090484619,
"learning_rate": 0.00019466221397316158,
"loss": 3.2796,
"step": 4050
},
{
"epoch": 0.3,
"grad_norm": 5.895244121551514,
"learning_rate": 0.00019462277020254734,
"loss": 3.2945,
"step": 4060
},
{
"epoch": 0.3,
"grad_norm": 6.884443283081055,
"learning_rate": 0.00019458318525835525,
"loss": 3.449,
"step": 4070
},
{
"epoch": 0.3,
"grad_norm": 6.1220245361328125,
"learning_rate": 0.00019454345919964463,
"loss": 3.4166,
"step": 4080
},
{
"epoch": 0.3,
"grad_norm": 6.293818950653076,
"learning_rate": 0.0001945035920856852,
"loss": 3.2527,
"step": 4090
},
{
"epoch": 0.3,
"grad_norm": 7.266450881958008,
"learning_rate": 0.0001944635839759572,
"loss": 2.9923,
"step": 4100
},
{
"epoch": 0.3,
"grad_norm": 12.944222450256348,
"learning_rate": 0.00019442343493015116,
"loss": 3.5396,
"step": 4110
},
{
"epoch": 0.3,
"grad_norm": 6.282738208770752,
"learning_rate": 0.000194383145008168,
"loss": 3.4869,
"step": 4120
},
{
"epoch": 0.31,
"grad_norm": 5.127700328826904,
"learning_rate": 0.00019434271427011868,
"loss": 3.0043,
"step": 4130
},
{
"epoch": 0.31,
"grad_norm": 5.7289838790893555,
"learning_rate": 0.00019430214277632438,
"loss": 3.269,
"step": 4140
},
{
"epoch": 0.31,
"grad_norm": 7.922645092010498,
"learning_rate": 0.00019426143058731623,
"loss": 3.1655,
"step": 4150
},
{
"epoch": 0.31,
"grad_norm": 6.550185680389404,
"learning_rate": 0.00019422057776383525,
"loss": 3.2869,
"step": 4160
},
{
"epoch": 0.31,
"grad_norm": 4.6260480880737305,
"learning_rate": 0.00019417958436683227,
"loss": 3.2263,
"step": 4170
},
{
"epoch": 0.31,
"grad_norm": 8.116255760192871,
"learning_rate": 0.00019413845045746796,
"loss": 3.2272,
"step": 4180
},
{
"epoch": 0.31,
"grad_norm": 9.626754760742188,
"learning_rate": 0.00019409717609711246,
"loss": 3.2186,
"step": 4190
},
{
"epoch": 0.31,
"grad_norm": 6.456797122955322,
"learning_rate": 0.00019405576134734563,
"loss": 3.4864,
"step": 4200
},
{
"epoch": 0.31,
"eval_loss": 3.2689456939697266,
"eval_runtime": 1134.8632,
"eval_samples_per_second": 5.023,
"eval_steps_per_second": 5.023,
"step": 4200
},
{
"epoch": 0.31,
"grad_norm": 7.205773830413818,
"learning_rate": 0.0001940142062699566,
"loss": 2.9953,
"step": 4210
},
{
"epoch": 0.31,
"grad_norm": 5.470200538635254,
"learning_rate": 0.00019397251092694408,
"loss": 3.1267,
"step": 4220
},
{
"epoch": 0.31,
"grad_norm": 6.280062198638916,
"learning_rate": 0.00019393067538051587,
"loss": 3.1818,
"step": 4230
},
{
"epoch": 0.31,
"grad_norm": 5.139229774475098,
"learning_rate": 0.00019388869969308903,
"loss": 3.214,
"step": 4240
},
{
"epoch": 0.31,
"grad_norm": 4.247889041900635,
"learning_rate": 0.0001938465839272897,
"loss": 2.9846,
"step": 4250
},
{
"epoch": 0.31,
"grad_norm": 8.27074146270752,
"learning_rate": 0.00019380432814595299,
"loss": 3.2215,
"step": 4260
},
{
"epoch": 0.32,
"grad_norm": 5.101616859436035,
"learning_rate": 0.00019376193241212294,
"loss": 3.532,
"step": 4270
},
{
"epoch": 0.32,
"grad_norm": 4.839563369750977,
"learning_rate": 0.00019371939678905232,
"loss": 3.0666,
"step": 4280
},
{
"epoch": 0.32,
"grad_norm": 5.436496257781982,
"learning_rate": 0.0001936767213402027,
"loss": 3.2893,
"step": 4290
},
{
"epoch": 0.32,
"grad_norm": 3.8287880420684814,
"learning_rate": 0.00019363390612924425,
"loss": 3.1401,
"step": 4300
},
{
"epoch": 0.32,
"grad_norm": 6.251564025878906,
"learning_rate": 0.00019359095122005563,
"loss": 3.3396,
"step": 4310
},
{
"epoch": 0.32,
"grad_norm": 5.008293151855469,
"learning_rate": 0.00019354785667672394,
"loss": 3.6161,
"step": 4320
},
{
"epoch": 0.32,
"grad_norm": 5.853148937225342,
"learning_rate": 0.00019350462256354452,
"loss": 3.4238,
"step": 4330
},
{
"epoch": 0.32,
"grad_norm": 10.029765129089355,
"learning_rate": 0.00019346124894502114,
"loss": 2.9422,
"step": 4340
},
{
"epoch": 0.32,
"grad_norm": 8.551016807556152,
"learning_rate": 0.0001934177358858655,
"loss": 3.0181,
"step": 4350
},
{
"epoch": 0.32,
"grad_norm": 8.455645561218262,
"learning_rate": 0.00019337845496453685,
"loss": 3.554,
"step": 4360
},
{
"epoch": 0.32,
"grad_norm": 6.219696044921875,
"learning_rate": 0.00019333467714720599,
"loss": 3.2154,
"step": 4370
},
{
"epoch": 0.32,
"grad_norm": 5.962626934051514,
"learning_rate": 0.00019329076007808325,
"loss": 3.2577,
"step": 4380
},
{
"epoch": 0.32,
"grad_norm": 4.884113311767578,
"learning_rate": 0.00019324670382269115,
"loss": 3.4911,
"step": 4390
},
{
"epoch": 0.33,
"grad_norm": 9.073639869689941,
"learning_rate": 0.00019320250844676005,
"loss": 3.2337,
"step": 4400
},
{
"epoch": 0.33,
"eval_loss": 3.2600619792938232,
"eval_runtime": 1136.7951,
"eval_samples_per_second": 5.014,
"eval_steps_per_second": 5.014,
"step": 4400
},
{
"epoch": 0.33,
"grad_norm": 6.009994983673096,
"learning_rate": 0.0001931581740162277,
"loss": 3.1117,
"step": 4410
},
{
"epoch": 0.33,
"grad_norm": 5.953939914703369,
"learning_rate": 0.0001931137005972394,
"loss": 3.5592,
"step": 4420
},
{
"epoch": 0.33,
"grad_norm": 6.099554061889648,
"learning_rate": 0.0001930690882561478,
"loss": 3.024,
"step": 4430
},
{
"epoch": 0.33,
"grad_norm": 6.600510120391846,
"learning_rate": 0.00019302433705951284,
"loss": 3.3492,
"step": 4440
},
{
"epoch": 0.33,
"grad_norm": 7.4830322265625,
"learning_rate": 0.00019297944707410159,
"loss": 3.1173,
"step": 4450
},
{
"epoch": 0.33,
"grad_norm": 7.494085311889648,
"learning_rate": 0.00019293441836688816,
"loss": 3.3076,
"step": 4460
},
{
"epoch": 0.33,
"grad_norm": 6.360881805419922,
"learning_rate": 0.00019288925100505375,
"loss": 3.3496,
"step": 4470
},
{
"epoch": 0.33,
"grad_norm": 5.511220932006836,
"learning_rate": 0.0001928439450559863,
"loss": 3.321,
"step": 4480
},
{
"epoch": 0.33,
"grad_norm": 5.7247514724731445,
"learning_rate": 0.00019279850058728058,
"loss": 3.3129,
"step": 4490
},
{
"epoch": 0.33,
"grad_norm": 7.3512349128723145,
"learning_rate": 0.000192752917666738,
"loss": 3.3597,
"step": 4500
},
{
"epoch": 0.33,
"grad_norm": 7.68686056137085,
"learning_rate": 0.00019270719636236655,
"loss": 3.1758,
"step": 4510
},
{
"epoch": 0.33,
"grad_norm": 6.120543956756592,
"learning_rate": 0.00019266133674238067,
"loss": 3.3944,
"step": 4520
},
{
"epoch": 0.33,
"grad_norm": 3.884521007537842,
"learning_rate": 0.0001926153388752012,
"loss": 3.0115,
"step": 4530
},
{
"epoch": 0.34,
"grad_norm": 5.13805627822876,
"learning_rate": 0.00019256920282945516,
"loss": 3.5171,
"step": 4540
},
{
"epoch": 0.34,
"grad_norm": 4.273939609527588,
"learning_rate": 0.00019252292867397584,
"loss": 3.2311,
"step": 4550
},
{
"epoch": 0.34,
"grad_norm": 4.657829284667969,
"learning_rate": 0.00019247651647780244,
"loss": 2.8801,
"step": 4560
},
{
"epoch": 0.34,
"grad_norm": 7.604819297790527,
"learning_rate": 0.0001924299663101803,
"loss": 3.0956,
"step": 4570
},
{
"epoch": 0.34,
"grad_norm": 5.1106390953063965,
"learning_rate": 0.00019238327824056038,
"loss": 2.8648,
"step": 4580
},
{
"epoch": 0.34,
"grad_norm": 5.146661758422852,
"learning_rate": 0.00019233645233859964,
"loss": 3.1102,
"step": 4590
},
{
"epoch": 0.34,
"grad_norm": 5.23886251449585,
"learning_rate": 0.0001922894886741604,
"loss": 2.9659,
"step": 4600
},
{
"epoch": 0.34,
"eval_loss": 3.243014097213745,
"eval_runtime": 1137.1324,
"eval_samples_per_second": 5.013,
"eval_steps_per_second": 5.013,
"step": 4600
},
{
"epoch": 0.34,
"grad_norm": 7.990192890167236,
"learning_rate": 0.00019224238731731079,
"loss": 3.1794,
"step": 4610
},
{
"epoch": 0.34,
"grad_norm": 6.751334190368652,
"learning_rate": 0.0001921951483383242,
"loss": 3.2815,
"step": 4620
},
{
"epoch": 0.34,
"grad_norm": 6.687454700469971,
"learning_rate": 0.00019214777180767936,
"loss": 3.1559,
"step": 4630
},
{
"epoch": 0.34,
"grad_norm": 4.849421977996826,
"learning_rate": 0.00019210025779606028,
"loss": 3.0585,
"step": 4640
},
{
"epoch": 0.34,
"grad_norm": 7.930562496185303,
"learning_rate": 0.00019205260637435604,
"loss": 2.8349,
"step": 4650
},
{
"epoch": 0.34,
"grad_norm": 7.275119781494141,
"learning_rate": 0.00019200481761366082,
"loss": 3.2115,
"step": 4660
},
{
"epoch": 0.34,
"grad_norm": 5.657308578491211,
"learning_rate": 0.00019195689158527354,
"loss": 2.9877,
"step": 4670
},
{
"epoch": 0.35,
"grad_norm": 7.506052017211914,
"learning_rate": 0.00019190882836069806,
"loss": 3.3649,
"step": 4680
},
{
"epoch": 0.35,
"grad_norm": 6.52008581161499,
"learning_rate": 0.00019186062801164288,
"loss": 3.308,
"step": 4690
},
{
"epoch": 0.35,
"grad_norm": 6.489314556121826,
"learning_rate": 0.00019181229061002113,
"loss": 3.2823,
"step": 4700
},
{
"epoch": 0.35,
"grad_norm": 6.584408760070801,
"learning_rate": 0.0001917638162279503,
"loss": 3.2338,
"step": 4710
},
{
"epoch": 0.35,
"grad_norm": 7.005248069763184,
"learning_rate": 0.00019171520493775236,
"loss": 3.1882,
"step": 4720
},
{
"epoch": 0.35,
"grad_norm": 6.1764397621154785,
"learning_rate": 0.00019166645681195353,
"loss": 3.3283,
"step": 4730
},
{
"epoch": 0.35,
"grad_norm": 7.389091491699219,
"learning_rate": 0.00019161757192328414,
"loss": 3.1865,
"step": 4740
},
{
"epoch": 0.35,
"grad_norm": 6.51524019241333,
"learning_rate": 0.0001915685503446786,
"loss": 3.2328,
"step": 4750
},
{
"epoch": 0.35,
"grad_norm": 9.388795852661133,
"learning_rate": 0.0001915193921492752,
"loss": 3.567,
"step": 4760
},
{
"epoch": 0.35,
"grad_norm": 8.696200370788574,
"learning_rate": 0.00019147009741041617,
"loss": 3.1716,
"step": 4770
},
{
"epoch": 0.35,
"grad_norm": 6.319981575012207,
"learning_rate": 0.00019142066620164735,
"loss": 3.367,
"step": 4780
},
{
"epoch": 0.35,
"grad_norm": 6.704361438751221,
"learning_rate": 0.0001913710985967182,
"loss": 3.1016,
"step": 4790
},
{
"epoch": 0.35,
"grad_norm": 7.778378486633301,
"learning_rate": 0.00019132139466958173,
"loss": 3.1036,
"step": 4800
},
{
"epoch": 0.35,
"eval_loss": 3.2003843784332275,
"eval_runtime": 1138.607,
"eval_samples_per_second": 5.006,
"eval_steps_per_second": 5.006,
"step": 4800
},
{
"epoch": 0.36,
"grad_norm": 5.96036958694458,
"learning_rate": 0.00019127155449439432,
"loss": 3.1986,
"step": 4810
},
{
"epoch": 0.36,
"grad_norm": 4.976071834564209,
"learning_rate": 0.0001912215781455156,
"loss": 3.1981,
"step": 4820
},
{
"epoch": 0.36,
"grad_norm": 3.7487850189208984,
"learning_rate": 0.00019117146569750838,
"loss": 3.1252,
"step": 4830
},
{
"epoch": 0.36,
"grad_norm": 6.183620929718018,
"learning_rate": 0.00019112121722513855,
"loss": 3.0109,
"step": 4840
},
{
"epoch": 0.36,
"grad_norm": 6.189425468444824,
"learning_rate": 0.0001910708328033749,
"loss": 3.2106,
"step": 4850
},
{
"epoch": 0.36,
"grad_norm": 8.113247871398926,
"learning_rate": 0.0001910203125073891,
"loss": 3.1525,
"step": 4860
},
{
"epoch": 0.36,
"grad_norm": 6.9849653244018555,
"learning_rate": 0.00019096965641255548,
"loss": 3.5768,
"step": 4870
},
{
"epoch": 0.36,
"grad_norm": 6.2269978523254395,
"learning_rate": 0.00019091886459445104,
"loss": 3.09,
"step": 4880
},
{
"epoch": 0.36,
"grad_norm": 4.787795543670654,
"learning_rate": 0.0001908679371288552,
"loss": 3.3626,
"step": 4890
},
{
"epoch": 0.36,
"grad_norm": 4.196493625640869,
"learning_rate": 0.00019081687409174984,
"loss": 3.0434,
"step": 4900
},
{
"epoch": 0.36,
"grad_norm": 6.388833999633789,
"learning_rate": 0.00019076567555931906,
"loss": 3.3835,
"step": 4910
},
{
"epoch": 0.36,
"grad_norm": 8.204059600830078,
"learning_rate": 0.00019071434160794915,
"loss": 3.4197,
"step": 4920
},
{
"epoch": 0.36,
"grad_norm": 8.208364486694336,
"learning_rate": 0.00019066287231422834,
"loss": 3.4219,
"step": 4930
},
{
"epoch": 0.36,
"grad_norm": 6.949147701263428,
"learning_rate": 0.00019061126775494697,
"loss": 3.1267,
"step": 4940
},
{
"epoch": 0.37,
"grad_norm": 8.652156829833984,
"learning_rate": 0.000190559528007097,
"loss": 3.4893,
"step": 4950
},
{
"epoch": 0.37,
"grad_norm": 5.506767749786377,
"learning_rate": 0.00019050765314787218,
"loss": 3.0858,
"step": 4960
},
{
"epoch": 0.37,
"grad_norm": 7.854613780975342,
"learning_rate": 0.00019045564325466784,
"loss": 3.2453,
"step": 4970
},
{
"epoch": 0.37,
"grad_norm": 4.6655073165893555,
"learning_rate": 0.00019040349840508076,
"loss": 3.1197,
"step": 4980
},
{
"epoch": 0.37,
"grad_norm": 6.948372840881348,
"learning_rate": 0.00019035121867690908,
"loss": 3.2466,
"step": 4990
},
{
"epoch": 0.37,
"grad_norm": 8.339057922363281,
"learning_rate": 0.0001902988041481522,
"loss": 3.3991,
"step": 5000
},
{
"epoch": 0.37,
"eval_loss": 3.216885566711426,
"eval_runtime": 1136.0117,
"eval_samples_per_second": 5.018,
"eval_steps_per_second": 5.018,
"step": 5000
},
{
"epoch": 0.37,
"grad_norm": 6.042678356170654,
"learning_rate": 0.00019024625489701054,
"loss": 3.3492,
"step": 5010
},
{
"epoch": 0.37,
"grad_norm": 4.894794464111328,
"learning_rate": 0.00019019357100188563,
"loss": 3.0045,
"step": 5020
},
{
"epoch": 0.37,
"grad_norm": 4.939303398132324,
"learning_rate": 0.0001901407525413798,
"loss": 3.1535,
"step": 5030
},
{
"epoch": 0.37,
"grad_norm": 8.999835014343262,
"learning_rate": 0.00019008779959429624,
"loss": 3.3011,
"step": 5040
},
{
"epoch": 0.37,
"grad_norm": 5.480611801147461,
"learning_rate": 0.0001900347122396387,
"loss": 3.0302,
"step": 5050
},
{
"epoch": 0.37,
"grad_norm": 4.675875186920166,
"learning_rate": 0.0001899814905566115,
"loss": 2.8846,
"step": 5060
},
{
"epoch": 0.37,
"grad_norm": 6.680566787719727,
"learning_rate": 0.00018992813462461938,
"loss": 3.672,
"step": 5070
},
{
"epoch": 0.38,
"grad_norm": 3.9609920978546143,
"learning_rate": 0.00018987464452326736,
"loss": 2.8783,
"step": 5080
},
{
"epoch": 0.38,
"grad_norm": 8.886730194091797,
"learning_rate": 0.00018982102033236062,
"loss": 3.3141,
"step": 5090
},
{
"epoch": 0.38,
"grad_norm": 5.5499186515808105,
"learning_rate": 0.00018976726213190445,
"loss": 3.4179,
"step": 5100
},
{
"epoch": 0.38,
"grad_norm": 4.3828654289245605,
"learning_rate": 0.000189713370002104,
"loss": 3.4815,
"step": 5110
},
{
"epoch": 0.38,
"grad_norm": 10.297881126403809,
"learning_rate": 0.00018965934402336433,
"loss": 3.3344,
"step": 5120
},
{
"epoch": 0.38,
"grad_norm": 9.131120681762695,
"learning_rate": 0.00018960518427629013,
"loss": 3.0974,
"step": 5130
},
{
"epoch": 0.38,
"grad_norm": 8.753045082092285,
"learning_rate": 0.00018955089084168566,
"loss": 3.3982,
"step": 5140
},
{
"epoch": 0.38,
"grad_norm": 7.8969316482543945,
"learning_rate": 0.00018949646380055465,
"loss": 3.0704,
"step": 5150
},
{
"epoch": 0.38,
"grad_norm": 9.234929084777832,
"learning_rate": 0.00018944190323410024,
"loss": 3.2858,
"step": 5160
},
{
"epoch": 0.38,
"grad_norm": 7.354836940765381,
"learning_rate": 0.00018938720922372467,
"loss": 3.1516,
"step": 5170
},
{
"epoch": 0.38,
"grad_norm": 4.409235000610352,
"learning_rate": 0.00018933238185102935,
"loss": 2.9736,
"step": 5180
},
{
"epoch": 0.38,
"grad_norm": 7.718225479125977,
"learning_rate": 0.0001892774211978146,
"loss": 3.3702,
"step": 5190
},
{
"epoch": 0.38,
"grad_norm": 7.247618198394775,
"learning_rate": 0.00018922232734607967,
"loss": 3.2514,
"step": 5200
},
{
"epoch": 0.38,
"eval_loss": 3.20190167427063,
"eval_runtime": 1137.1433,
"eval_samples_per_second": 5.013,
"eval_steps_per_second": 5.013,
"step": 5200
},
{
"epoch": 0.38,
"grad_norm": 6.2430644035339355,
"learning_rate": 0.00018916710037802253,
"loss": 3.244,
"step": 5210
},
{
"epoch": 0.39,
"grad_norm": 6.088860034942627,
"learning_rate": 0.00018911174037603958,
"loss": 3.309,
"step": 5220
},
{
"epoch": 0.39,
"grad_norm": 6.1977739334106445,
"learning_rate": 0.000189056247422726,
"loss": 3.1773,
"step": 5230
},
{
"epoch": 0.39,
"grad_norm": 7.018752574920654,
"learning_rate": 0.00018900062160087503,
"loss": 3.1125,
"step": 5240
},
{
"epoch": 0.39,
"grad_norm": 11.884779930114746,
"learning_rate": 0.00018894486299347838,
"loss": 3.1848,
"step": 5250
},
{
"epoch": 0.39,
"grad_norm": 5.222365379333496,
"learning_rate": 0.00018888897168372573,
"loss": 3.2378,
"step": 5260
},
{
"epoch": 0.39,
"grad_norm": 7.695111274719238,
"learning_rate": 0.00018883294775500482,
"loss": 3.2287,
"step": 5270
},
{
"epoch": 0.39,
"grad_norm": 5.415168285369873,
"learning_rate": 0.00018877679129090117,
"loss": 3.254,
"step": 5280
},
{
"epoch": 0.39,
"grad_norm": 7.421213150024414,
"learning_rate": 0.00018872050237519816,
"loss": 3.3848,
"step": 5290
},
{
"epoch": 0.39,
"grad_norm": 7.068855285644531,
"learning_rate": 0.00018866408109187663,
"loss": 3.4544,
"step": 5300
},
{
"epoch": 0.39,
"grad_norm": 5.558896541595459,
"learning_rate": 0.00018860752752511507,
"loss": 3.4343,
"step": 5310
},
{
"epoch": 0.39,
"grad_norm": 5.823142051696777,
"learning_rate": 0.00018855084175928923,
"loss": 3.1807,
"step": 5320
},
{
"epoch": 0.39,
"grad_norm": 7.187647342681885,
"learning_rate": 0.00018849402387897208,
"loss": 2.9435,
"step": 5330
},
{
"epoch": 0.39,
"grad_norm": 9.714073181152344,
"learning_rate": 0.0001884370739689338,
"loss": 3.4785,
"step": 5340
},
{
"epoch": 0.4,
"grad_norm": 5.349802017211914,
"learning_rate": 0.00018837999211414146,
"loss": 3.0782,
"step": 5350
},
{
"epoch": 0.4,
"grad_norm": 6.526556968688965,
"learning_rate": 0.00018832277839975897,
"loss": 3.2347,
"step": 5360
},
{
"epoch": 0.4,
"grad_norm": 5.845700263977051,
"learning_rate": 0.0001882654329111471,
"loss": 3.0192,
"step": 5370
},
{
"epoch": 0.4,
"grad_norm": 5.289205074310303,
"learning_rate": 0.0001882079557338631,
"loss": 3.3813,
"step": 5380
},
{
"epoch": 0.4,
"grad_norm": 3.3808743953704834,
"learning_rate": 0.00018815034695366075,
"loss": 3.319,
"step": 5390
},
{
"epoch": 0.4,
"grad_norm": 4.758996963500977,
"learning_rate": 0.00018809260665649015,
"loss": 3.3189,
"step": 5400
},
{
"epoch": 0.4,
"eval_loss": 3.1736836433410645,
"eval_runtime": 1136.1695,
"eval_samples_per_second": 5.017,
"eval_steps_per_second": 5.017,
"step": 5400
},
{
"epoch": 0.4,
"grad_norm": 4.7935309410095215,
"learning_rate": 0.00018803473492849763,
"loss": 3.1906,
"step": 5410
},
{
"epoch": 0.4,
"grad_norm": 6.932259559631348,
"learning_rate": 0.00018797673185602562,
"loss": 2.996,
"step": 5420
},
{
"epoch": 0.4,
"grad_norm": 6.560030937194824,
"learning_rate": 0.00018791859752561248,
"loss": 2.9432,
"step": 5430
},
{
"epoch": 0.4,
"grad_norm": 9.305426597595215,
"learning_rate": 0.00018786033202399243,
"loss": 3.2491,
"step": 5440
},
{
"epoch": 0.4,
"grad_norm": 7.172638893127441,
"learning_rate": 0.0001878019354380954,
"loss": 3.1311,
"step": 5450
},
{
"epoch": 0.4,
"grad_norm": 7.696325778961182,
"learning_rate": 0.00018774340785504684,
"loss": 3.1054,
"step": 5460
},
{
"epoch": 0.4,
"grad_norm": 7.473097801208496,
"learning_rate": 0.00018768474936216772,
"loss": 3.2003,
"step": 5470
},
{
"epoch": 0.4,
"grad_norm": 8.726866722106934,
"learning_rate": 0.00018762596004697426,
"loss": 3.2119,
"step": 5480
},
{
"epoch": 0.41,
"grad_norm": 9.802130699157715,
"learning_rate": 0.0001875670399971779,
"loss": 2.9675,
"step": 5490
},
{
"epoch": 0.41,
"grad_norm": 7.459918975830078,
"learning_rate": 0.0001875079893006851,
"loss": 3.2299,
"step": 5500
},
{
"epoch": 0.41,
"grad_norm": 6.798010349273682,
"learning_rate": 0.00018744880804559728,
"loss": 3.1507,
"step": 5510
},
{
"epoch": 0.41,
"grad_norm": 8.681066513061523,
"learning_rate": 0.0001873894963202106,
"loss": 3.1474,
"step": 5520
},
{
"epoch": 0.41,
"grad_norm": 7.05427885055542,
"learning_rate": 0.0001873300542130159,
"loss": 3.1704,
"step": 5530
},
{
"epoch": 0.41,
"grad_norm": 8.765000343322754,
"learning_rate": 0.00018727048181269856,
"loss": 3.0459,
"step": 5540
},
{
"epoch": 0.41,
"grad_norm": 6.171086311340332,
"learning_rate": 0.00018721077920813833,
"loss": 3.4174,
"step": 5550
},
{
"epoch": 0.41,
"grad_norm": 11.81342887878418,
"learning_rate": 0.0001871509464884092,
"loss": 3.0682,
"step": 5560
},
{
"epoch": 0.41,
"grad_norm": 4.2086286544799805,
"learning_rate": 0.00018709098374277937,
"loss": 2.9207,
"step": 5570
},
{
"epoch": 0.41,
"grad_norm": 8.466970443725586,
"learning_rate": 0.00018703089106071095,
"loss": 3.4195,
"step": 5580
},
{
"epoch": 0.41,
"grad_norm": 3.9653847217559814,
"learning_rate": 0.00018697066853185995,
"loss": 3.3978,
"step": 5590
},
{
"epoch": 0.41,
"grad_norm": 6.923947334289551,
"learning_rate": 0.00018691031624607605,
"loss": 3.4599,
"step": 5600
},
{
"epoch": 0.41,
"eval_loss": 3.163978099822998,
"eval_runtime": 1137.4991,
"eval_samples_per_second": 5.011,
"eval_steps_per_second": 5.011,
"step": 5600
},
{
"epoch": 0.41,
"grad_norm": 4.512587547302246,
"learning_rate": 0.00018684983429340265,
"loss": 2.9866,
"step": 5610
},
{
"epoch": 0.42,
"grad_norm": 6.818958759307861,
"learning_rate": 0.00018678922276407642,
"loss": 3.2473,
"step": 5620
},
{
"epoch": 0.42,
"grad_norm": 6.915249347686768,
"learning_rate": 0.00018672848174852756,
"loss": 3.2113,
"step": 5630
},
{
"epoch": 0.42,
"grad_norm": 5.651949882507324,
"learning_rate": 0.00018666761133737927,
"loss": 3.0937,
"step": 5640
},
{
"epoch": 0.42,
"grad_norm": 6.507778644561768,
"learning_rate": 0.00018660661162144798,
"loss": 2.9943,
"step": 5650
},
{
"epoch": 0.42,
"grad_norm": 6.6092095375061035,
"learning_rate": 0.00018654548269174287,
"loss": 2.9204,
"step": 5660
},
{
"epoch": 0.42,
"grad_norm": 6.253643035888672,
"learning_rate": 0.00018648422463946602,
"loss": 3.3986,
"step": 5670
},
{
"epoch": 0.42,
"grad_norm": 6.839259624481201,
"learning_rate": 0.0001864228375560121,
"loss": 3.0319,
"step": 5680
},
{
"epoch": 0.42,
"grad_norm": 6.3006181716918945,
"learning_rate": 0.00018636132153296831,
"loss": 2.9178,
"step": 5690
},
{
"epoch": 0.42,
"grad_norm": 5.2430219650268555,
"learning_rate": 0.00018629967666211427,
"loss": 2.833,
"step": 5700
},
{
"epoch": 0.42,
"grad_norm": 8.878287315368652,
"learning_rate": 0.00018623790303542168,
"loss": 3.3581,
"step": 5710
},
{
"epoch": 0.42,
"grad_norm": 6.703078746795654,
"learning_rate": 0.0001861760007450545,
"loss": 3.2832,
"step": 5720
},
{
"epoch": 0.42,
"grad_norm": 4.616283416748047,
"learning_rate": 0.00018611396988336862,
"loss": 3.211,
"step": 5730
},
{
"epoch": 0.42,
"grad_norm": 5.617763996124268,
"learning_rate": 0.0001860518105429117,
"loss": 3.0924,
"step": 5740
},
{
"epoch": 0.42,
"grad_norm": 5.632263660430908,
"learning_rate": 0.00018598952281642314,
"loss": 3.1122,
"step": 5750
},
{
"epoch": 0.43,
"grad_norm": 5.472113132476807,
"learning_rate": 0.00018592710679683384,
"loss": 3.1495,
"step": 5760
},
{
"epoch": 0.43,
"grad_norm": 4.280898094177246,
"learning_rate": 0.0001858645625772661,
"loss": 3.1842,
"step": 5770
},
{
"epoch": 0.43,
"grad_norm": 6.199119567871094,
"learning_rate": 0.00018580189025103357,
"loss": 3.0955,
"step": 5780
},
{
"epoch": 0.43,
"grad_norm": 5.373068809509277,
"learning_rate": 0.00018573908991164096,
"loss": 2.6837,
"step": 5790
},
{
"epoch": 0.43,
"grad_norm": 2.7935683727264404,
"learning_rate": 0.00018567616165278398,
"loss": 3.1536,
"step": 5800
},
{
"epoch": 0.43,
"eval_loss": 3.1541407108306885,
"eval_runtime": 1137.3308,
"eval_samples_per_second": 5.012,
"eval_steps_per_second": 5.012,
"step": 5800
},
{
"epoch": 0.43,
"grad_norm": 6.602904319763184,
"learning_rate": 0.0001856131055683492,
"loss": 3.1246,
"step": 5810
},
{
"epoch": 0.43,
"grad_norm": 5.87777042388916,
"learning_rate": 0.00018554992175241392,
"loss": 3.2625,
"step": 5820
},
{
"epoch": 0.43,
"grad_norm": 5.858922481536865,
"learning_rate": 0.00018548661029924601,
"loss": 3.3251,
"step": 5830
},
{
"epoch": 0.43,
"grad_norm": 6.421278476715088,
"learning_rate": 0.0001854231713033037,
"loss": 2.9533,
"step": 5840
},
{
"epoch": 0.43,
"grad_norm": 7.115844249725342,
"learning_rate": 0.0001853596048592356,
"loss": 3.3951,
"step": 5850
},
{
"epoch": 0.43,
"grad_norm": 5.380497932434082,
"learning_rate": 0.00018529591106188043,
"loss": 3.1816,
"step": 5860
},
{
"epoch": 0.43,
"grad_norm": 5.796582221984863,
"learning_rate": 0.00018523209000626686,
"loss": 2.9288,
"step": 5870
},
{
"epoch": 0.43,
"grad_norm": 6.43263053894043,
"learning_rate": 0.00018516814178761356,
"loss": 3.1933,
"step": 5880
},
{
"epoch": 0.44,
"grad_norm": 4.534740447998047,
"learning_rate": 0.00018510406650132884,
"loss": 2.7832,
"step": 5890
},
{
"epoch": 0.44,
"grad_norm": 6.020338535308838,
"learning_rate": 0.0001850398642430105,
"loss": 3.2289,
"step": 5900
},
{
"epoch": 0.44,
"grad_norm": 7.014430999755859,
"learning_rate": 0.00018497553510844595,
"loss": 3.4209,
"step": 5910
},
{
"epoch": 0.44,
"grad_norm": 6.1231369972229,
"learning_rate": 0.0001849110791936118,
"loss": 3.0681,
"step": 5920
},
{
"epoch": 0.44,
"grad_norm": 7.167814254760742,
"learning_rate": 0.0001848464965946738,
"loss": 3.1848,
"step": 5930
},
{
"epoch": 0.44,
"grad_norm": 5.2950005531311035,
"learning_rate": 0.00018478178740798676,
"loss": 3.2838,
"step": 5940
},
{
"epoch": 0.44,
"grad_norm": 4.44722843170166,
"learning_rate": 0.0001847169517300943,
"loss": 3.2951,
"step": 5950
},
{
"epoch": 0.44,
"grad_norm": 5.411314964294434,
"learning_rate": 0.00018465198965772887,
"loss": 3.0394,
"step": 5960
},
{
"epoch": 0.44,
"grad_norm": 5.1140923500061035,
"learning_rate": 0.0001845869012878113,
"loss": 3.0466,
"step": 5970
},
{
"epoch": 0.44,
"grad_norm": 7.282729148864746,
"learning_rate": 0.00018452168671745102,
"loss": 3.2923,
"step": 5980
},
{
"epoch": 0.44,
"grad_norm": 6.504138946533203,
"learning_rate": 0.00018445634604394572,
"loss": 3.1633,
"step": 5990
},
{
"epoch": 0.44,
"grad_norm": 4.982309818267822,
"learning_rate": 0.00018439087936478115,
"loss": 3.3825,
"step": 6000
},
{
"epoch": 0.44,
"eval_loss": 3.144286632537842,
"eval_runtime": 1137.5221,
"eval_samples_per_second": 5.011,
"eval_steps_per_second": 5.011,
"step": 6000
},
{
"epoch": 0.44,
"grad_norm": 9.198885917663574,
"learning_rate": 0.0001843252867776311,
"loss": 3.178,
"step": 6010
},
{
"epoch": 0.44,
"grad_norm": 5.505146503448486,
"learning_rate": 0.0001842595683803573,
"loss": 2.9734,
"step": 6020
},
{
"epoch": 0.45,
"grad_norm": 9.131953239440918,
"learning_rate": 0.000184193724271009,
"loss": 3.4452,
"step": 6030
},
{
"epoch": 0.45,
"grad_norm": 3.000302314758301,
"learning_rate": 0.0001841277545478232,
"loss": 3.1034,
"step": 6040
},
{
"epoch": 0.45,
"grad_norm": 8.891810417175293,
"learning_rate": 0.00018406165930922414,
"loss": 3.4236,
"step": 6050
},
{
"epoch": 0.45,
"grad_norm": 4.17402982711792,
"learning_rate": 0.00018399543865382345,
"loss": 3.001,
"step": 6060
},
{
"epoch": 0.45,
"grad_norm": 5.869381904602051,
"learning_rate": 0.00018392909268041984,
"loss": 2.9168,
"step": 6070
},
{
"epoch": 0.45,
"grad_norm": 6.271331787109375,
"learning_rate": 0.00018386262148799895,
"loss": 3.2482,
"step": 6080
},
{
"epoch": 0.45,
"grad_norm": 5.643693923950195,
"learning_rate": 0.00018379602517573328,
"loss": 2.9908,
"step": 6090
},
{
"epoch": 0.45,
"grad_norm": 6.856283664703369,
"learning_rate": 0.000183729303842982,
"loss": 3.084,
"step": 6100
},
{
"epoch": 0.45,
"grad_norm": 4.403018951416016,
"learning_rate": 0.00018366245758929086,
"loss": 2.9356,
"step": 6110
},
{
"epoch": 0.45,
"grad_norm": 4.758050441741943,
"learning_rate": 0.00018359548651439184,
"loss": 3.3273,
"step": 6120
},
{
"epoch": 0.45,
"grad_norm": 8.164340019226074,
"learning_rate": 0.00018352839071820326,
"loss": 3.0777,
"step": 6130
},
{
"epoch": 0.45,
"grad_norm": 9.588719367980957,
"learning_rate": 0.00018346117030082953,
"loss": 3.051,
"step": 6140
},
{
"epoch": 0.45,
"grad_norm": 7.1701273918151855,
"learning_rate": 0.00018339382536256097,
"loss": 3.0665,
"step": 6150
},
{
"epoch": 0.46,
"grad_norm": 6.325179576873779,
"learning_rate": 0.00018332635600387364,
"loss": 3.3382,
"step": 6160
},
{
"epoch": 0.46,
"grad_norm": 8.45527172088623,
"learning_rate": 0.00018325876232542924,
"loss": 3.0616,
"step": 6170
},
{
"epoch": 0.46,
"grad_norm": 7.3909502029418945,
"learning_rate": 0.00018319104442807502,
"loss": 3.122,
"step": 6180
},
{
"epoch": 0.46,
"grad_norm": 6.6926374435424805,
"learning_rate": 0.00018312320241284347,
"loss": 3.271,
"step": 6190
},
{
"epoch": 0.46,
"grad_norm": 6.650495529174805,
"learning_rate": 0.00018305523638095233,
"loss": 3.401,
"step": 6200
},
{
"epoch": 0.46,
"eval_loss": 3.1480228900909424,
"eval_runtime": 1136.9357,
"eval_samples_per_second": 5.013,
"eval_steps_per_second": 5.013,
"step": 6200
},
{
"epoch": 0.46,
"grad_norm": 5.135234832763672,
"learning_rate": 0.0001829871464338043,
"loss": 3.1063,
"step": 6210
},
{
"epoch": 0.46,
"grad_norm": 6.894030570983887,
"learning_rate": 0.000182918932672987,
"loss": 3.3267,
"step": 6220
},
{
"epoch": 0.46,
"grad_norm": 10.895586967468262,
"learning_rate": 0.0001828505952002728,
"loss": 3.2664,
"step": 6230
},
{
"epoch": 0.46,
"grad_norm": 7.774397373199463,
"learning_rate": 0.0001827821341176186,
"loss": 3.0503,
"step": 6240
},
{
"epoch": 0.46,
"grad_norm": 5.991896152496338,
"learning_rate": 0.00018271354952716573,
"loss": 2.8635,
"step": 6250
},
{
"epoch": 0.46,
"grad_norm": 10.050676345825195,
"learning_rate": 0.0001826448415312398,
"loss": 3.0997,
"step": 6260
},
{
"epoch": 0.46,
"grad_norm": 4.294887542724609,
"learning_rate": 0.00018257601023235052,
"loss": 3.1495,
"step": 6270
},
{
"epoch": 0.46,
"grad_norm": 4.689005374908447,
"learning_rate": 0.00018250705573319155,
"loss": 2.9893,
"step": 6280
},
{
"epoch": 0.46,
"grad_norm": 4.834038257598877,
"learning_rate": 0.00018243797813664042,
"loss": 2.8042,
"step": 6290
},
{
"epoch": 0.47,
"grad_norm": 6.34830904006958,
"learning_rate": 0.00018236877754575827,
"loss": 3.1042,
"step": 6300
},
{
"epoch": 0.47,
"grad_norm": 4.145033836364746,
"learning_rate": 0.00018229945406378977,
"loss": 3.1158,
"step": 6310
},
{
"epoch": 0.47,
"grad_norm": 6.606880187988281,
"learning_rate": 0.00018223000779416285,
"loss": 3.1161,
"step": 6320
},
{
"epoch": 0.47,
"grad_norm": 8.302144050598145,
"learning_rate": 0.0001821604388404888,
"loss": 2.8363,
"step": 6330
},
{
"epoch": 0.47,
"grad_norm": 5.119319915771484,
"learning_rate": 0.0001820907473065618,
"loss": 3.0148,
"step": 6340
},
{
"epoch": 0.47,
"grad_norm": 7.135417461395264,
"learning_rate": 0.00018202093329635897,
"loss": 3.1195,
"step": 6350
},
{
"epoch": 0.47,
"grad_norm": 5.360604286193848,
"learning_rate": 0.00018195099691404017,
"loss": 2.9308,
"step": 6360
},
{
"epoch": 0.47,
"grad_norm": 11.024898529052734,
"learning_rate": 0.0001818809382639479,
"loss": 3.3839,
"step": 6370
},
{
"epoch": 0.47,
"grad_norm": 10.323607444763184,
"learning_rate": 0.00018181075745060684,
"loss": 3.4607,
"step": 6380
},
{
"epoch": 0.47,
"grad_norm": 5.803746223449707,
"learning_rate": 0.00018174045457872422,
"loss": 3.2707,
"step": 6390
},
{
"epoch": 0.47,
"grad_norm": 6.415554523468018,
"learning_rate": 0.0001816700297531892,
"loss": 3.2877,
"step": 6400
},
{
"epoch": 0.47,
"eval_loss": 3.116978406906128,
"eval_runtime": 1138.0492,
"eval_samples_per_second": 5.009,
"eval_steps_per_second": 5.009,
"step": 6400
},
{
"epoch": 0.47,
"grad_norm": 9.01855182647705,
"learning_rate": 0.000181599483079073,
"loss": 3.1119,
"step": 6410
},
{
"epoch": 0.47,
"grad_norm": 6.799642086029053,
"learning_rate": 0.00018152881466162852,
"loss": 3.0316,
"step": 6420
},
{
"epoch": 0.47,
"grad_norm": 8.301816940307617,
"learning_rate": 0.00018145802460629038,
"loss": 3.1189,
"step": 6430
},
{
"epoch": 0.48,
"grad_norm": 4.256124019622803,
"learning_rate": 0.00018138711301867466,
"loss": 3.0403,
"step": 6440
},
{
"epoch": 0.48,
"grad_norm": 5.179169654846191,
"learning_rate": 0.00018131608000457872,
"loss": 3.2503,
"step": 6450
},
{
"epoch": 0.48,
"grad_norm": 6.934343338012695,
"learning_rate": 0.00018124492566998118,
"loss": 3.0684,
"step": 6460
},
{
"epoch": 0.48,
"grad_norm": 8.213187217712402,
"learning_rate": 0.00018117365012104152,
"loss": 3.1016,
"step": 6470
},
{
"epoch": 0.48,
"grad_norm": 9.77891731262207,
"learning_rate": 0.00018110225346410026,
"loss": 3.1766,
"step": 6480
},
{
"epoch": 0.48,
"grad_norm": 5.665271759033203,
"learning_rate": 0.00018103073580567837,
"loss": 2.8177,
"step": 6490
},
{
"epoch": 0.48,
"grad_norm": 5.387053966522217,
"learning_rate": 0.0001809590972524776,
"loss": 3.0647,
"step": 6500
},
{
"epoch": 0.48,
"grad_norm": 6.457382678985596,
"learning_rate": 0.00018088733791137983,
"loss": 3.1087,
"step": 6510
},
{
"epoch": 0.48,
"grad_norm": 4.992802143096924,
"learning_rate": 0.00018081545788944738,
"loss": 3.3095,
"step": 6520
},
{
"epoch": 0.48,
"grad_norm": 6.124748229980469,
"learning_rate": 0.00018074345729392243,
"loss": 3.2727,
"step": 6530
},
{
"epoch": 0.48,
"grad_norm": 8.606759071350098,
"learning_rate": 0.0001806713362322272,
"loss": 2.7637,
"step": 6540
},
{
"epoch": 0.48,
"grad_norm": 4.487072944641113,
"learning_rate": 0.00018059909481196352,
"loss": 3.0667,
"step": 6550
},
{
"epoch": 0.48,
"grad_norm": 4.0933003425598145,
"learning_rate": 0.00018052673314091291,
"loss": 2.9759,
"step": 6560
},
{
"epoch": 0.49,
"grad_norm": 7.057580947875977,
"learning_rate": 0.00018045425132703615,
"loss": 3.0746,
"step": 6570
},
{
"epoch": 0.49,
"grad_norm": 7.039517879486084,
"learning_rate": 0.0001803816494784734,
"loss": 3.3283,
"step": 6580
},
{
"epoch": 0.49,
"grad_norm": 6.682270050048828,
"learning_rate": 0.00018030892770354385,
"loss": 2.8775,
"step": 6590
},
{
"epoch": 0.49,
"grad_norm": 5.233624458312988,
"learning_rate": 0.00018023608611074564,
"loss": 3.2119,
"step": 6600
},
{
"epoch": 0.49,
"eval_loss": 3.1197338104248047,
"eval_runtime": 1135.3428,
"eval_samples_per_second": 5.021,
"eval_steps_per_second": 5.021,
"step": 6600
},
{
"epoch": 0.49,
"grad_norm": 7.95053768157959,
"learning_rate": 0.00018016312480875565,
"loss": 3.385,
"step": 6610
},
{
"epoch": 0.49,
"grad_norm": 5.972837448120117,
"learning_rate": 0.00018009004390642935,
"loss": 3.1906,
"step": 6620
},
{
"epoch": 0.49,
"grad_norm": 6.372288227081299,
"learning_rate": 0.00018001684351280067,
"loss": 3.2157,
"step": 6630
},
{
"epoch": 0.49,
"grad_norm": 6.065051555633545,
"learning_rate": 0.00017994352373708184,
"loss": 3.2601,
"step": 6640
},
{
"epoch": 0.49,
"grad_norm": 8.61384391784668,
"learning_rate": 0.00017987008468866317,
"loss": 3.3174,
"step": 6650
},
{
"epoch": 0.49,
"grad_norm": 5.757634162902832,
"learning_rate": 0.00017979652647711293,
"loss": 3.2527,
"step": 6660
},
{
"epoch": 0.49,
"grad_norm": 6.122255802154541,
"learning_rate": 0.0001797228492121772,
"loss": 3.2824,
"step": 6670
},
{
"epoch": 0.49,
"grad_norm": 6.160879135131836,
"learning_rate": 0.00017964905300377958,
"loss": 3.3164,
"step": 6680
},
{
"epoch": 0.49,
"grad_norm": 5.023545265197754,
"learning_rate": 0.00017957513796202132,
"loss": 2.7596,
"step": 6690
},
{
"epoch": 0.49,
"grad_norm": 6.02267599105835,
"learning_rate": 0.0001795011041971808,
"loss": 2.9532,
"step": 6700
},
{
"epoch": 0.5,
"grad_norm": 6.672699928283691,
"learning_rate": 0.00017942695181971357,
"loss": 2.9572,
"step": 6710
},
{
"epoch": 0.5,
"grad_norm": 9.895316123962402,
"learning_rate": 0.00017935268094025216,
"loss": 2.9637,
"step": 6720
},
{
"epoch": 0.5,
"grad_norm": 3.4045603275299072,
"learning_rate": 0.00017927829166960592,
"loss": 3.1477,
"step": 6730
},
{
"epoch": 0.5,
"grad_norm": 5.545341491699219,
"learning_rate": 0.00017920378411876082,
"loss": 2.9996,
"step": 6740
},
{
"epoch": 0.5,
"grad_norm": 6.233349323272705,
"learning_rate": 0.00017912915839887926,
"loss": 3.1531,
"step": 6750
},
{
"epoch": 0.5,
"grad_norm": 5.089627265930176,
"learning_rate": 0.00017905441462130002,
"loss": 3.0789,
"step": 6760
},
{
"epoch": 0.5,
"grad_norm": 4.95676851272583,
"learning_rate": 0.00017897955289753796,
"loss": 3.173,
"step": 6770
},
{
"epoch": 0.5,
"grad_norm": 7.904139518737793,
"learning_rate": 0.00017890457333928392,
"loss": 3.3228,
"step": 6780
},
{
"epoch": 0.5,
"grad_norm": 5.2170915603637695,
"learning_rate": 0.00017882947605840456,
"loss": 3.0489,
"step": 6790
},
{
"epoch": 0.5,
"grad_norm": 7.633049011230469,
"learning_rate": 0.00017875426116694215,
"loss": 3.056,
"step": 6800
},
{
"epoch": 0.5,
"eval_loss": 3.1002590656280518,
"eval_runtime": 1137.3982,
"eval_samples_per_second": 5.011,
"eval_steps_per_second": 5.011,
"step": 6800
},
{
"epoch": 0.5,
"grad_norm": 5.702763557434082,
"learning_rate": 0.0001786789287771145,
"loss": 2.8698,
"step": 6810
},
{
"epoch": 0.5,
"grad_norm": 8.918027877807617,
"learning_rate": 0.00017860347900131463,
"loss": 2.9931,
"step": 6820
},
{
"epoch": 0.5,
"grad_norm": 5.658896446228027,
"learning_rate": 0.00017852791195211074,
"loss": 2.8901,
"step": 6830
},
{
"epoch": 0.51,
"grad_norm": 7.5781378746032715,
"learning_rate": 0.000178452227742246,
"loss": 3.4028,
"step": 6840
},
{
"epoch": 0.51,
"grad_norm": 5.097570896148682,
"learning_rate": 0.00017837642648463838,
"loss": 3.1365,
"step": 6850
},
{
"epoch": 0.51,
"grad_norm": 4.289078712463379,
"learning_rate": 0.00017830050829238049,
"loss": 3.1823,
"step": 6860
},
{
"epoch": 0.51,
"grad_norm": 6.053905487060547,
"learning_rate": 0.00017822447327873938,
"loss": 2.8224,
"step": 6870
},
{
"epoch": 0.51,
"grad_norm": 5.861936092376709,
"learning_rate": 0.00017814832155715635,
"loss": 2.7414,
"step": 6880
},
{
"epoch": 0.51,
"grad_norm": 10.660014152526855,
"learning_rate": 0.00017807205324124698,
"loss": 3.1545,
"step": 6890
},
{
"epoch": 0.51,
"grad_norm": 9.52756118774414,
"learning_rate": 0.00017799566844480062,
"loss": 3.1248,
"step": 6900
},
{
"epoch": 0.51,
"grad_norm": 6.511455059051514,
"learning_rate": 0.0001779191672817805,
"loss": 3.1991,
"step": 6910
},
{
"epoch": 0.51,
"grad_norm": 6.9415669441223145,
"learning_rate": 0.00017784254986632345,
"loss": 2.9941,
"step": 6920
},
{
"epoch": 0.51,
"grad_norm": 4.175106048583984,
"learning_rate": 0.00017776581631273974,
"loss": 3.1579,
"step": 6930
},
{
"epoch": 0.51,
"grad_norm": 5.956933498382568,
"learning_rate": 0.00017768896673551294,
"loss": 2.8536,
"step": 6940
},
{
"epoch": 0.51,
"grad_norm": 6.128865718841553,
"learning_rate": 0.00017761200124929966,
"loss": 3.3484,
"step": 6950
},
{
"epoch": 0.51,
"grad_norm": 7.494982719421387,
"learning_rate": 0.0001775349199689295,
"loss": 3.186,
"step": 6960
},
{
"epoch": 0.51,
"grad_norm": 7.484640121459961,
"learning_rate": 0.00017745772300940485,
"loss": 3.1214,
"step": 6970
},
{
"epoch": 0.52,
"grad_norm": 8.72867488861084,
"learning_rate": 0.00017738041048590057,
"loss": 2.9991,
"step": 6980
},
{
"epoch": 0.52,
"grad_norm": 5.649702072143555,
"learning_rate": 0.00017730298251376404,
"loss": 3.0823,
"step": 6990
},
{
"epoch": 0.52,
"grad_norm": 6.184506893157959,
"learning_rate": 0.0001772254392085148,
"loss": 3.0852,
"step": 7000
},
{
"epoch": 0.52,
"eval_loss": 3.0923123359680176,
"eval_runtime": 1136.1904,
"eval_samples_per_second": 5.017,
"eval_steps_per_second": 5.017,
"step": 7000
},
{
"epoch": 0.52,
"grad_norm": 6.7169880867004395,
"learning_rate": 0.0001771477806858446,
"loss": 3.1608,
"step": 7010
},
{
"epoch": 0.52,
"grad_norm": 5.178481578826904,
"learning_rate": 0.00017707000706161695,
"loss": 3.283,
"step": 7020
},
{
"epoch": 0.52,
"grad_norm": 5.29659366607666,
"learning_rate": 0.00017699211845186716,
"loss": 3.2108,
"step": 7030
},
{
"epoch": 0.52,
"grad_norm": 7.533651351928711,
"learning_rate": 0.00017691411497280208,
"loss": 3.2544,
"step": 7040
},
{
"epoch": 0.52,
"grad_norm": 4.470998764038086,
"learning_rate": 0.00017683599674079992,
"loss": 3.1424,
"step": 7050
},
{
"epoch": 0.52,
"grad_norm": 4.548938751220703,
"learning_rate": 0.0001767577638724101,
"loss": 3.189,
"step": 7060
},
{
"epoch": 0.52,
"grad_norm": 5.8620405197143555,
"learning_rate": 0.00017667941648435317,
"loss": 3.0072,
"step": 7070
},
{
"epoch": 0.52,
"grad_norm": 9.185796737670898,
"learning_rate": 0.00017660095469352035,
"loss": 3.1691,
"step": 7080
},
{
"epoch": 0.52,
"grad_norm": 4.8303728103637695,
"learning_rate": 0.0001765223786169737,
"loss": 2.8953,
"step": 7090
},
{
"epoch": 0.52,
"grad_norm": 6.9875078201293945,
"learning_rate": 0.00017644368837194577,
"loss": 2.9854,
"step": 7100
},
{
"epoch": 0.53,
"grad_norm": 4.392673015594482,
"learning_rate": 0.00017636488407583934,
"loss": 3.1433,
"step": 7110
},
{
"epoch": 0.53,
"grad_norm": 4.60288143157959,
"learning_rate": 0.00017628596584622752,
"loss": 2.9387,
"step": 7120
},
{
"epoch": 0.53,
"grad_norm": 8.164209365844727,
"learning_rate": 0.00017620693380085322,
"loss": 3.1131,
"step": 7130
},
{
"epoch": 0.53,
"grad_norm": 3.8639328479766846,
"learning_rate": 0.00017612778805762931,
"loss": 3.0315,
"step": 7140
},
{
"epoch": 0.53,
"grad_norm": 9.054656028747559,
"learning_rate": 0.0001760485287346382,
"loss": 3.3817,
"step": 7150
},
{
"epoch": 0.53,
"grad_norm": 5.484858512878418,
"learning_rate": 0.00017596915595013176,
"loss": 3.1232,
"step": 7160
},
{
"epoch": 0.53,
"grad_norm": 10.846295356750488,
"learning_rate": 0.00017588966982253124,
"loss": 2.9237,
"step": 7170
},
{
"epoch": 0.53,
"grad_norm": 8.18273639678955,
"learning_rate": 0.0001758100704704269,
"loss": 2.7913,
"step": 7180
},
{
"epoch": 0.53,
"grad_norm": 6.365214824676514,
"learning_rate": 0.00017573035801257794,
"loss": 3.2157,
"step": 7190
},
{
"epoch": 0.53,
"grad_norm": 4.8987627029418945,
"learning_rate": 0.0001756505325679123,
"loss": 2.9277,
"step": 7200
},
{
"epoch": 0.53,
"eval_loss": 3.0856003761291504,
"eval_runtime": 1138.1785,
"eval_samples_per_second": 5.008,
"eval_steps_per_second": 5.008,
"step": 7200
},
{
"epoch": 0.53,
"grad_norm": 5.561722755432129,
"learning_rate": 0.00017557059425552654,
"loss": 2.6905,
"step": 7210
},
{
"epoch": 0.53,
"grad_norm": 5.034555435180664,
"learning_rate": 0.00017549054319468554,
"loss": 3.087,
"step": 7220
},
{
"epoch": 0.53,
"grad_norm": 6.637314796447754,
"learning_rate": 0.00017541037950482248,
"loss": 2.8424,
"step": 7230
},
{
"epoch": 0.53,
"grad_norm": 5.636795997619629,
"learning_rate": 0.00017533010330553857,
"loss": 3.2438,
"step": 7240
},
{
"epoch": 0.54,
"grad_norm": 7.967324256896973,
"learning_rate": 0.00017524971471660276,
"loss": 3.0933,
"step": 7250
},
{
"epoch": 0.54,
"grad_norm": 4.078129291534424,
"learning_rate": 0.00017516921385795183,
"loss": 3.3142,
"step": 7260
},
{
"epoch": 0.54,
"grad_norm": 6.510000705718994,
"learning_rate": 0.00017508860084969004,
"loss": 3.3133,
"step": 7270
},
{
"epoch": 0.54,
"grad_norm": 5.694852352142334,
"learning_rate": 0.00017500787581208884,
"loss": 2.8118,
"step": 7280
},
{
"epoch": 0.54,
"grad_norm": 6.753634929656982,
"learning_rate": 0.00017492703886558698,
"loss": 3.0533,
"step": 7290
},
{
"epoch": 0.54,
"grad_norm": 6.030417442321777,
"learning_rate": 0.0001748460901307901,
"loss": 2.7696,
"step": 7300
},
{
"epoch": 0.54,
"grad_norm": 6.480371475219727,
"learning_rate": 0.00017476502972847065,
"loss": 3.3933,
"step": 7310
},
{
"epoch": 0.54,
"grad_norm": 6.749428749084473,
"learning_rate": 0.0001746838577795676,
"loss": 2.9271,
"step": 7320
},
{
"epoch": 0.54,
"grad_norm": 6.193231582641602,
"learning_rate": 0.00017460257440518655,
"loss": 2.9716,
"step": 7330
},
{
"epoch": 0.54,
"grad_norm": 6.23006010055542,
"learning_rate": 0.00017452117972659907,
"loss": 2.846,
"step": 7340
},
{
"epoch": 0.54,
"grad_norm": 9.593443870544434,
"learning_rate": 0.000174439673865243,
"loss": 3.2238,
"step": 7350
},
{
"epoch": 0.54,
"grad_norm": 7.841164588928223,
"learning_rate": 0.00017435805694272197,
"loss": 3.231,
"step": 7360
},
{
"epoch": 0.54,
"grad_norm": 6.105316638946533,
"learning_rate": 0.00017427632908080537,
"loss": 2.9946,
"step": 7370
},
{
"epoch": 0.55,
"grad_norm": 5.265261173248291,
"learning_rate": 0.00017419449040142795,
"loss": 2.8048,
"step": 7380
},
{
"epoch": 0.55,
"grad_norm": 5.074249267578125,
"learning_rate": 0.00017411254102669003,
"loss": 3.6117,
"step": 7390
},
{
"epoch": 0.55,
"grad_norm": 7.331019401550293,
"learning_rate": 0.00017403048107885694,
"loss": 3.0561,
"step": 7400
},
{
"epoch": 0.55,
"eval_loss": 3.077350378036499,
"eval_runtime": 1138.274,
"eval_samples_per_second": 5.008,
"eval_steps_per_second": 5.008,
"step": 7400
},
{
"epoch": 0.55,
"grad_norm": 4.099388599395752,
"learning_rate": 0.00017394831068035893,
"loss": 3.2471,
"step": 7410
},
{
"epoch": 0.55,
"grad_norm": 7.908533573150635,
"learning_rate": 0.0001738660299537912,
"loss": 3.4178,
"step": 7420
},
{
"epoch": 0.55,
"grad_norm": 5.370948791503906,
"learning_rate": 0.0001737836390219134,
"loss": 3.108,
"step": 7430
},
{
"epoch": 0.55,
"grad_norm": 12.10229206085205,
"learning_rate": 0.00017370113800764972,
"loss": 2.8955,
"step": 7440
},
{
"epoch": 0.55,
"grad_norm": 6.406788349151611,
"learning_rate": 0.00017361852703408852,
"loss": 2.9021,
"step": 7450
},
{
"epoch": 0.55,
"grad_norm": 10.103180885314941,
"learning_rate": 0.0001735358062244822,
"loss": 2.9578,
"step": 7460
},
{
"epoch": 0.55,
"grad_norm": 7.811886787414551,
"learning_rate": 0.00017345297570224712,
"loss": 3.2403,
"step": 7470
},
{
"epoch": 0.55,
"grad_norm": 8.512283325195312,
"learning_rate": 0.00017337003559096328,
"loss": 3.1895,
"step": 7480
},
{
"epoch": 0.55,
"grad_norm": 9.635491371154785,
"learning_rate": 0.0001732869860143741,
"loss": 3.0036,
"step": 7490
},
{
"epoch": 0.55,
"grad_norm": 5.56748104095459,
"learning_rate": 0.00017320382709638647,
"loss": 3.1748,
"step": 7500
},
{
"epoch": 0.55,
"grad_norm": 4.9890265464782715,
"learning_rate": 0.00017312055896107032,
"loss": 3.1185,
"step": 7510
},
{
"epoch": 0.56,
"grad_norm": 5.688922882080078,
"learning_rate": 0.00017303718173265848,
"loss": 2.9293,
"step": 7520
},
{
"epoch": 0.56,
"grad_norm": 7.263044834136963,
"learning_rate": 0.0001729536955355467,
"loss": 3.1688,
"step": 7530
},
{
"epoch": 0.56,
"grad_norm": 9.175032615661621,
"learning_rate": 0.0001728701004942931,
"loss": 3.0364,
"step": 7540
},
{
"epoch": 0.56,
"grad_norm": 8.44921588897705,
"learning_rate": 0.00017278639673361842,
"loss": 3.2652,
"step": 7550
},
{
"epoch": 0.56,
"grad_norm": 7.016599178314209,
"learning_rate": 0.00017270258437840545,
"loss": 3.0066,
"step": 7560
},
{
"epoch": 0.56,
"grad_norm": 7.336106300354004,
"learning_rate": 0.00017261866355369903,
"loss": 2.8191,
"step": 7570
},
{
"epoch": 0.56,
"grad_norm": 8.093605041503906,
"learning_rate": 0.0001725346343847058,
"loss": 3.0282,
"step": 7580
},
{
"epoch": 0.56,
"grad_norm": 5.580060005187988,
"learning_rate": 0.0001724504969967942,
"loss": 2.8839,
"step": 7590
},
{
"epoch": 0.56,
"grad_norm": 5.478754997253418,
"learning_rate": 0.0001723662515154939,
"loss": 3.3122,
"step": 7600
},
{
"epoch": 0.56,
"eval_loss": 3.061328172683716,
"eval_runtime": 1139.392,
"eval_samples_per_second": 5.003,
"eval_steps_per_second": 5.003,
"step": 7600
},
{
"epoch": 0.56,
"grad_norm": 6.29701566696167,
"learning_rate": 0.00017228189806649602,
"loss": 3.3338,
"step": 7610
},
{
"epoch": 0.56,
"grad_norm": 7.164097785949707,
"learning_rate": 0.0001721974367756527,
"loss": 2.924,
"step": 7620
},
{
"epoch": 0.56,
"grad_norm": 7.159896373748779,
"learning_rate": 0.00017211286776897694,
"loss": 3.2111,
"step": 7630
},
{
"epoch": 0.56,
"grad_norm": 9.791536331176758,
"learning_rate": 0.0001720281911726425,
"loss": 3.201,
"step": 7640
},
{
"epoch": 0.57,
"grad_norm": 6.786426067352295,
"learning_rate": 0.00017194340711298368,
"loss": 2.8274,
"step": 7650
},
{
"epoch": 0.57,
"grad_norm": 8.007925033569336,
"learning_rate": 0.00017185851571649506,
"loss": 3.176,
"step": 7660
},
{
"epoch": 0.57,
"grad_norm": 8.49763011932373,
"learning_rate": 0.0001717735171098313,
"loss": 3.2994,
"step": 7670
},
{
"epoch": 0.57,
"grad_norm": 5.434768199920654,
"learning_rate": 0.0001716884114198072,
"loss": 2.8618,
"step": 7680
},
{
"epoch": 0.57,
"grad_norm": 4.9746012687683105,
"learning_rate": 0.00017160319877339717,
"loss": 2.9885,
"step": 7690
},
{
"epoch": 0.57,
"grad_norm": 4.094747543334961,
"learning_rate": 0.00017151787929773525,
"loss": 2.7888,
"step": 7700
},
{
"epoch": 0.57,
"grad_norm": 9.222213745117188,
"learning_rate": 0.00017143245312011484,
"loss": 3.0399,
"step": 7710
},
{
"epoch": 0.57,
"grad_norm": 8.820667266845703,
"learning_rate": 0.00017134692036798854,
"loss": 3.1198,
"step": 7720
},
{
"epoch": 0.57,
"grad_norm": 6.44861364364624,
"learning_rate": 0.000171261281168968,
"loss": 3.3128,
"step": 7730
},
{
"epoch": 0.57,
"grad_norm": 5.5747270584106445,
"learning_rate": 0.00017117553565082364,
"loss": 3.1565,
"step": 7740
},
{
"epoch": 0.57,
"grad_norm": 5.769834041595459,
"learning_rate": 0.00017108968394148453,
"loss": 3.1719,
"step": 7750
},
{
"epoch": 0.57,
"grad_norm": 3.5767252445220947,
"learning_rate": 0.00017100372616903813,
"loss": 2.8726,
"step": 7760
},
{
"epoch": 0.57,
"grad_norm": 6.374331951141357,
"learning_rate": 0.00017091766246173017,
"loss": 2.8511,
"step": 7770
},
{
"epoch": 0.57,
"grad_norm": 10.399380683898926,
"learning_rate": 0.00017083149294796446,
"loss": 2.9068,
"step": 7780
},
{
"epoch": 0.58,
"grad_norm": 6.99971342086792,
"learning_rate": 0.00017074521775630258,
"loss": 2.7705,
"step": 7790
},
{
"epoch": 0.58,
"grad_norm": 7.660416603088379,
"learning_rate": 0.0001706588370154639,
"loss": 2.8446,
"step": 7800
},
{
"epoch": 0.58,
"eval_loss": 3.0599443912506104,
"eval_runtime": 1134.9351,
"eval_samples_per_second": 5.022,
"eval_steps_per_second": 5.022,
"step": 7800
},
{
"epoch": 0.58,
"grad_norm": 8.767396926879883,
"learning_rate": 0.00017057235085432519,
"loss": 3.17,
"step": 7810
},
{
"epoch": 0.58,
"grad_norm": 6.4136223793029785,
"learning_rate": 0.00017048575940192053,
"loss": 3.1791,
"step": 7820
},
{
"epoch": 0.58,
"grad_norm": 7.993081092834473,
"learning_rate": 0.00017039906278744105,
"loss": 3.0694,
"step": 7830
},
{
"epoch": 0.58,
"grad_norm": 4.835598945617676,
"learning_rate": 0.0001703122611402348,
"loss": 3.0197,
"step": 7840
},
{
"epoch": 0.58,
"grad_norm": 7.789417743682861,
"learning_rate": 0.00017022535458980652,
"loss": 3.2511,
"step": 7850
},
{
"epoch": 0.58,
"grad_norm": 6.523293495178223,
"learning_rate": 0.00017013834326581753,
"loss": 3.2971,
"step": 7860
},
{
"epoch": 0.58,
"grad_norm": 4.12329626083374,
"learning_rate": 0.0001700512272980854,
"loss": 3.4024,
"step": 7870
},
{
"epoch": 0.58,
"grad_norm": 4.0998945236206055,
"learning_rate": 0.00016996400681658388,
"loss": 2.91,
"step": 7880
},
{
"epoch": 0.58,
"grad_norm": 4.825921058654785,
"learning_rate": 0.00016987668195144254,
"loss": 3.0696,
"step": 7890
},
{
"epoch": 0.58,
"grad_norm": 4.836582183837891,
"learning_rate": 0.00016978925283294682,
"loss": 3.1299,
"step": 7900
},
{
"epoch": 0.58,
"grad_norm": 5.9830217361450195,
"learning_rate": 0.0001697017195915376,
"loss": 2.8505,
"step": 7910
},
{
"epoch": 0.59,
"grad_norm": 5.919245719909668,
"learning_rate": 0.0001696140823578112,
"loss": 3.129,
"step": 7920
},
{
"epoch": 0.59,
"grad_norm": 7.34597635269165,
"learning_rate": 0.00016952634126251903,
"loss": 3.0404,
"step": 7930
},
{
"epoch": 0.59,
"grad_norm": 6.159910678863525,
"learning_rate": 0.0001694384964365674,
"loss": 2.9518,
"step": 7940
},
{
"epoch": 0.59,
"grad_norm": 5.33622932434082,
"learning_rate": 0.00016935054801101753,
"loss": 3.0204,
"step": 7950
},
{
"epoch": 0.59,
"grad_norm": 4.061224460601807,
"learning_rate": 0.00016926249611708512,
"loss": 3.1284,
"step": 7960
},
{
"epoch": 0.59,
"grad_norm": 4.315130233764648,
"learning_rate": 0.00016917434088614024,
"loss": 2.9494,
"step": 7970
},
{
"epoch": 0.59,
"grad_norm": 8.222806930541992,
"learning_rate": 0.00016908608244970715,
"loss": 3.1193,
"step": 7980
},
{
"epoch": 0.59,
"grad_norm": 10.138331413269043,
"learning_rate": 0.00016899772093946405,
"loss": 2.9443,
"step": 7990
},
{
"epoch": 0.59,
"grad_norm": 9.246224403381348,
"learning_rate": 0.00016890925648724298,
"loss": 2.8743,
"step": 8000
},
{
"epoch": 0.59,
"eval_loss": 3.0430643558502197,
"eval_runtime": 1136.7077,
"eval_samples_per_second": 5.014,
"eval_steps_per_second": 5.014,
"step": 8000
},
{
"epoch": 0.59,
"grad_norm": 5.0878586769104,
"learning_rate": 0.00016882068922502956,
"loss": 3.028,
"step": 8010
},
{
"epoch": 0.59,
"grad_norm": 4.8212666511535645,
"learning_rate": 0.00016873201928496276,
"loss": 2.8606,
"step": 8020
},
{
"epoch": 0.59,
"grad_norm": 4.808487415313721,
"learning_rate": 0.00016864324679933477,
"loss": 2.7987,
"step": 8030
},
{
"epoch": 0.59,
"grad_norm": 7.51768159866333,
"learning_rate": 0.00016855437190059074,
"loss": 3.1772,
"step": 8040
},
{
"epoch": 0.59,
"grad_norm": 6.17442512512207,
"learning_rate": 0.00016846539472132867,
"loss": 3.517,
"step": 8050
},
{
"epoch": 0.6,
"grad_norm": 4.601199626922607,
"learning_rate": 0.0001683763153942991,
"loss": 2.8995,
"step": 8060
},
{
"epoch": 0.6,
"grad_norm": 8.681718826293945,
"learning_rate": 0.0001682871340524051,
"loss": 2.9769,
"step": 8070
},
{
"epoch": 0.6,
"grad_norm": 8.995853424072266,
"learning_rate": 0.00016819785082870168,
"loss": 3.3334,
"step": 8080
},
{
"epoch": 0.6,
"grad_norm": 4.729511260986328,
"learning_rate": 0.00016810846585639614,
"loss": 2.9659,
"step": 8090
},
{
"epoch": 0.6,
"grad_norm": 8.431835174560547,
"learning_rate": 0.00016801897926884747,
"loss": 3.1703,
"step": 8100
},
{
"epoch": 0.6,
"grad_norm": 6.615757942199707,
"learning_rate": 0.00016792939119956616,
"loss": 3.2366,
"step": 8110
},
{
"epoch": 0.6,
"grad_norm": 7.626440048217773,
"learning_rate": 0.0001678397017822143,
"loss": 3.2195,
"step": 8120
},
{
"epoch": 0.6,
"grad_norm": 6.6842241287231445,
"learning_rate": 0.00016774991115060502,
"loss": 3.1806,
"step": 8130
},
{
"epoch": 0.6,
"grad_norm": 6.602607250213623,
"learning_rate": 0.00016766001943870258,
"loss": 2.8451,
"step": 8140
},
{
"epoch": 0.6,
"grad_norm": 6.661900997161865,
"learning_rate": 0.000167570026780622,
"loss": 2.9985,
"step": 8150
},
{
"epoch": 0.6,
"grad_norm": 5.912670135498047,
"learning_rate": 0.00016747993331062884,
"loss": 2.9751,
"step": 8160
},
{
"epoch": 0.6,
"grad_norm": 9.231598854064941,
"learning_rate": 0.0001673897391631392,
"loss": 3.1625,
"step": 8170
},
{
"epoch": 0.6,
"grad_norm": 3.841637372970581,
"learning_rate": 0.00016729944447271933,
"loss": 3.2863,
"step": 8180
},
{
"epoch": 0.6,
"grad_norm": 4.234511852264404,
"learning_rate": 0.00016720904937408545,
"loss": 3.1483,
"step": 8190
},
{
"epoch": 0.61,
"grad_norm": 8.182954788208008,
"learning_rate": 0.00016711855400210359,
"loss": 3.176,
"step": 8200
},
{
"epoch": 0.61,
"eval_loss": 3.0353262424468994,
"eval_runtime": 1138.7137,
"eval_samples_per_second": 5.006,
"eval_steps_per_second": 5.006,
"step": 8200
},
{
"epoch": 0.61,
"grad_norm": 5.439648628234863,
"learning_rate": 0.00016702795849178945,
"loss": 2.9075,
"step": 8210
},
{
"epoch": 0.61,
"grad_norm": 6.0995192527771,
"learning_rate": 0.00016693726297830805,
"loss": 2.9992,
"step": 8220
},
{
"epoch": 0.61,
"grad_norm": 5.458889484405518,
"learning_rate": 0.00016684646759697368,
"loss": 2.9326,
"step": 8230
},
{
"epoch": 0.61,
"grad_norm": 4.805375576019287,
"learning_rate": 0.0001667555724832496,
"loss": 2.8286,
"step": 8240
},
{
"epoch": 0.61,
"grad_norm": 6.176124572753906,
"learning_rate": 0.00016666457777274785,
"loss": 2.9266,
"step": 8250
},
{
"epoch": 0.61,
"grad_norm": 9.262208938598633,
"learning_rate": 0.00016657348360122907,
"loss": 2.8841,
"step": 8260
},
{
"epoch": 0.61,
"grad_norm": 5.791190147399902,
"learning_rate": 0.00016648229010460234,
"loss": 2.8039,
"step": 8270
},
{
"epoch": 0.61,
"grad_norm": 5.125844955444336,
"learning_rate": 0.00016639099741892486,
"loss": 3.2558,
"step": 8280
},
{
"epoch": 0.61,
"grad_norm": 4.081056118011475,
"learning_rate": 0.00016629960568040187,
"loss": 3.2467,
"step": 8290
},
{
"epoch": 0.61,
"grad_norm": 6.962846279144287,
"learning_rate": 0.00016620811502538634,
"loss": 3.1461,
"step": 8300
},
{
"epoch": 0.61,
"grad_norm": 4.538918495178223,
"learning_rate": 0.00016611652559037884,
"loss": 3.2418,
"step": 8310
},
{
"epoch": 0.61,
"grad_norm": 3.3968560695648193,
"learning_rate": 0.00016602483751202742,
"loss": 2.8624,
"step": 8320
},
{
"epoch": 0.62,
"grad_norm": 7.998313903808594,
"learning_rate": 0.00016593305092712712,
"loss": 3.0516,
"step": 8330
},
{
"epoch": 0.62,
"grad_norm": 9.397892951965332,
"learning_rate": 0.00016584116597262007,
"loss": 3.2749,
"step": 8340
},
{
"epoch": 0.62,
"grad_norm": 6.359921932220459,
"learning_rate": 0.00016574918278559512,
"loss": 2.9715,
"step": 8350
},
{
"epoch": 0.62,
"grad_norm": 12.321609497070312,
"learning_rate": 0.0001656571015032877,
"loss": 3.1384,
"step": 8360
},
{
"epoch": 0.62,
"grad_norm": NaN,
"learning_rate": 0.0001655741445912875,
"loss": 3.0863,
"step": 8370
},
{
"epoch": 0.62,
"grad_norm": 4.111155033111572,
"learning_rate": 0.00016548187730655096,
"loss": 2.7541,
"step": 8380
},
{
"epoch": 0.62,
"grad_norm": 6.458191394805908,
"learning_rate": 0.00016538951232534155,
"loss": 3.1002,
"step": 8390
},
{
"epoch": 0.62,
"grad_norm": 6.862247943878174,
"learning_rate": 0.0001652970497854643,
"loss": 3.3266,
"step": 8400
},
{
"epoch": 0.62,
"eval_loss": 3.0325841903686523,
"eval_runtime": 1139.1009,
"eval_samples_per_second": 5.004,
"eval_steps_per_second": 5.004,
"step": 8400
},
{
"epoch": 0.62,
"grad_norm": 4.755209922790527,
"learning_rate": 0.00016520448982486991,
"loss": 3.6499,
"step": 8410
},
{
"epoch": 0.62,
"grad_norm": 6.747128963470459,
"learning_rate": 0.00016511183258165419,
"loss": 2.8711,
"step": 8420
},
{
"epoch": 0.62,
"grad_norm": 10.228262901306152,
"learning_rate": 0.0001650190781940583,
"loss": 2.8253,
"step": 8430
},
{
"epoch": 0.62,
"grad_norm": 10.171624183654785,
"learning_rate": 0.00016492622680046824,
"loss": 2.8922,
"step": 8440
},
{
"epoch": 0.62,
"grad_norm": 7.286989688873291,
"learning_rate": 0.00016483327853941476,
"loss": 2.8137,
"step": 8450
},
{
"epoch": 0.62,
"grad_norm": 7.342117786407471,
"learning_rate": 0.00016474023354957313,
"loss": 2.8627,
"step": 8460
},
{
"epoch": 0.63,
"grad_norm": 6.907195091247559,
"learning_rate": 0.00016464709196976294,
"loss": 3.1057,
"step": 8470
},
{
"epoch": 0.63,
"grad_norm": 4.412569522857666,
"learning_rate": 0.0001645538539389479,
"loss": 3.1517,
"step": 8480
},
{
"epoch": 0.63,
"grad_norm": 9.296083450317383,
"learning_rate": 0.00016446051959623562,
"loss": 3.0493,
"step": 8490
},
{
"epoch": 0.63,
"grad_norm": 4.984066009521484,
"learning_rate": 0.00016436708908087737,
"loss": 3.37,
"step": 8500
},
{
"epoch": 0.63,
"grad_norm": 6.971232891082764,
"learning_rate": 0.00016427356253226796,
"loss": 2.9304,
"step": 8510
},
{
"epoch": 0.63,
"grad_norm": 6.060530662536621,
"learning_rate": 0.0001641799400899454,
"loss": 3.1361,
"step": 8520
},
{
"epoch": 0.63,
"grad_norm": 7.630738735198975,
"learning_rate": 0.00016408622189359085,
"loss": 2.9571,
"step": 8530
},
{
"epoch": 0.63,
"grad_norm": 7.277754783630371,
"learning_rate": 0.00016399240808302826,
"loss": 3.0568,
"step": 8540
},
{
"epoch": 0.63,
"grad_norm": 6.79268217086792,
"learning_rate": 0.00016389849879822434,
"loss": 2.8103,
"step": 8550
},
{
"epoch": 0.63,
"grad_norm": 6.705874919891357,
"learning_rate": 0.0001638044941792881,
"loss": 2.7768,
"step": 8560
},
{
"epoch": 0.63,
"grad_norm": 4.756038188934326,
"learning_rate": 0.00016371039436647092,
"loss": 3.1237,
"step": 8570
},
{
"epoch": 0.63,
"grad_norm": 5.9619317054748535,
"learning_rate": 0.00016361619950016612,
"loss": 3.0635,
"step": 8580
},
{
"epoch": 0.63,
"grad_norm": 7.578229904174805,
"learning_rate": 0.00016352190972090884,
"loss": 2.955,
"step": 8590
},
{
"epoch": 0.64,
"grad_norm": 9.273209571838379,
"learning_rate": 0.0001634275251693759,
"loss": 3.2253,
"step": 8600
},
{
"epoch": 0.64,
"eval_loss": 3.0166234970092773,
"eval_runtime": 1138.7152,
"eval_samples_per_second": 5.006,
"eval_steps_per_second": 5.006,
"step": 8600
},
{
"epoch": 0.64,
"grad_norm": 6.731431007385254,
"learning_rate": 0.00016333304598638537,
"loss": 2.8567,
"step": 8610
},
{
"epoch": 0.64,
"grad_norm": 7.561667442321777,
"learning_rate": 0.0001632384723128967,
"loss": 2.8719,
"step": 8620
},
{
"epoch": 0.64,
"grad_norm": 5.603372097015381,
"learning_rate": 0.0001631438042900102,
"loss": 2.8939,
"step": 8630
},
{
"epoch": 0.64,
"grad_norm": 6.9654436111450195,
"learning_rate": 0.00016304904205896695,
"loss": 2.9811,
"step": 8640
},
{
"epoch": 0.64,
"grad_norm": 5.97416877746582,
"learning_rate": 0.00016295418576114855,
"loss": 3.0695,
"step": 8650
},
{
"epoch": 0.64,
"grad_norm": 12.01034927368164,
"learning_rate": 0.00016285923553807706,
"loss": 2.979,
"step": 8660
},
{
"epoch": 0.64,
"grad_norm": 10.122462272644043,
"learning_rate": 0.0001627641915314146,
"loss": 3.3434,
"step": 8670
},
{
"epoch": 0.64,
"grad_norm": 4.262747287750244,
"learning_rate": 0.00016266905388296317,
"loss": 2.8383,
"step": 8680
},
{
"epoch": 0.64,
"grad_norm": 7.6208953857421875,
"learning_rate": 0.00016257382273466455,
"loss": 3.2615,
"step": 8690
},
{
"epoch": 0.64,
"grad_norm": 4.870731353759766,
"learning_rate": 0.0001624784982286,
"loss": 3.0911,
"step": 8700
},
{
"epoch": 0.64,
"grad_norm": 4.434355735778809,
"learning_rate": 0.00016238308050699004,
"loss": 3.0843,
"step": 8710
},
{
"epoch": 0.64,
"grad_norm": 5.287969589233398,
"learning_rate": 0.00016228756971219433,
"loss": 2.9681,
"step": 8720
},
{
"epoch": 0.64,
"grad_norm": 5.047779083251953,
"learning_rate": 0.0001621919659867113,
"loss": 3.1289,
"step": 8730
},
{
"epoch": 0.65,
"grad_norm": 6.657232761383057,
"learning_rate": 0.00016209626947317815,
"loss": 3.0631,
"step": 8740
},
{
"epoch": 0.65,
"grad_norm": 4.935356140136719,
"learning_rate": 0.00016200048031437034,
"loss": 2.8295,
"step": 8750
},
{
"epoch": 0.65,
"grad_norm": 10.847895622253418,
"learning_rate": 0.00016190459865320173,
"loss": 3.1355,
"step": 8760
},
{
"epoch": 0.65,
"grad_norm": 5.847652435302734,
"learning_rate": 0.00016180862463272406,
"loss": 2.6263,
"step": 8770
},
{
"epoch": 0.65,
"grad_norm": 5.575468063354492,
"learning_rate": 0.00016171255839612694,
"loss": 2.9246,
"step": 8780
},
{
"epoch": 0.65,
"grad_norm": 11.922440528869629,
"learning_rate": 0.0001616164000867376,
"loss": 3.236,
"step": 8790
},
{
"epoch": 0.65,
"grad_norm": 6.166906356811523,
"learning_rate": 0.0001615201498480205,
"loss": 2.9586,
"step": 8800
},
{
"epoch": 0.65,
"eval_loss": 3.0125856399536133,
"eval_runtime": 1137.092,
"eval_samples_per_second": 5.013,
"eval_steps_per_second": 5.013,
"step": 8800
},
{
"epoch": 0.65,
"grad_norm": 5.383087158203125,
"learning_rate": 0.00016142380782357743,
"loss": 2.7651,
"step": 8810
},
{
"epoch": 0.65,
"grad_norm": 4.864884853363037,
"learning_rate": 0.00016132737415714692,
"loss": 2.8964,
"step": 8820
},
{
"epoch": 0.65,
"grad_norm": 13.638253211975098,
"learning_rate": 0.00016123084899260444,
"loss": 3.0387,
"step": 8830
},
{
"epoch": 0.65,
"grad_norm": 5.7503204345703125,
"learning_rate": 0.0001611342324739618,
"loss": 2.6854,
"step": 8840
},
{
"epoch": 0.65,
"grad_norm": 6.744014739990234,
"learning_rate": 0.0001610375247453672,
"loss": 2.961,
"step": 8850
},
{
"epoch": 0.65,
"grad_norm": 9.730425834655762,
"learning_rate": 0.0001609407259511049,
"loss": 3.2752,
"step": 8860
},
{
"epoch": 0.66,
"grad_norm": 5.120224952697754,
"learning_rate": 0.00016084383623559502,
"loss": 2.8938,
"step": 8870
},
{
"epoch": 0.66,
"grad_norm": 7.75462007522583,
"learning_rate": 0.00016074685574339332,
"loss": 3.184,
"step": 8880
},
{
"epoch": 0.66,
"grad_norm": 4.399641990661621,
"learning_rate": 0.000160649784619191,
"loss": 2.8226,
"step": 8890
},
{
"epoch": 0.66,
"grad_norm": 5.9601898193359375,
"learning_rate": 0.00016055262300781453,
"loss": 2.8385,
"step": 8900
},
{
"epoch": 0.66,
"grad_norm": 5.693487167358398,
"learning_rate": 0.00016045537105422534,
"loss": 3.2339,
"step": 8910
},
{
"epoch": 0.66,
"grad_norm": 6.121466636657715,
"learning_rate": 0.00016035802890351962,
"loss": 3.0847,
"step": 8920
},
{
"epoch": 0.66,
"grad_norm": 6.453389644622803,
"learning_rate": 0.00016026059670092816,
"loss": 3.3022,
"step": 8930
},
{
"epoch": 0.66,
"grad_norm": 4.665291786193848,
"learning_rate": 0.00016016307459181613,
"loss": 3.0313,
"step": 8940
},
{
"epoch": 0.66,
"grad_norm": 7.089426517486572,
"learning_rate": 0.00016006546272168278,
"loss": 3.2097,
"step": 8950
},
{
"epoch": 0.66,
"grad_norm": 6.783688068389893,
"learning_rate": 0.00015996776123616133,
"loss": 2.842,
"step": 8960
},
{
"epoch": 0.66,
"grad_norm": 4.681889533996582,
"learning_rate": 0.00015986997028101868,
"loss": 2.7781,
"step": 8970
},
{
"epoch": 0.66,
"grad_norm": 10.384384155273438,
"learning_rate": 0.00015977209000215525,
"loss": 3.0,
"step": 8980
},
{
"epoch": 0.66,
"grad_norm": 10.24274730682373,
"learning_rate": 0.00015967412054560464,
"loss": 2.9689,
"step": 8990
},
{
"epoch": 0.66,
"grad_norm": 4.38585090637207,
"learning_rate": 0.0001595760620575336,
"loss": 2.786,
"step": 9000
},
{
"epoch": 0.66,
"eval_loss": 3.0171055793762207,
"eval_runtime": 1137.1019,
"eval_samples_per_second": 5.013,
"eval_steps_per_second": 5.013,
"step": 9000
},
{
"epoch": 0.67,
"grad_norm": 5.604382038116455,
"learning_rate": 0.00015947791468424164,
"loss": 3.2516,
"step": 9010
},
{
"epoch": 0.67,
"grad_norm": 5.53500509262085,
"learning_rate": 0.00015937967857216094,
"loss": 3.1364,
"step": 9020
},
{
"epoch": 0.67,
"grad_norm": 7.274658679962158,
"learning_rate": 0.00015928135386785602,
"loss": 3.1856,
"step": 9030
},
{
"epoch": 0.67,
"grad_norm": 6.1844353675842285,
"learning_rate": 0.00015918294071802362,
"loss": 2.8782,
"step": 9040
},
{
"epoch": 0.67,
"grad_norm": 5.413163185119629,
"learning_rate": 0.0001590844392694924,
"loss": 3.1712,
"step": 9050
},
{
"epoch": 0.67,
"grad_norm": 5.227255344390869,
"learning_rate": 0.00015898584966922283,
"loss": 3.0771,
"step": 9060
},
{
"epoch": 0.67,
"grad_norm": 10.300729751586914,
"learning_rate": 0.00015888717206430678,
"loss": 3.0506,
"step": 9070
},
{
"epoch": 0.67,
"grad_norm": 5.3075456619262695,
"learning_rate": 0.00015878840660196752,
"loss": 2.7935,
"step": 9080
},
{
"epoch": 0.67,
"grad_norm": 4.687715530395508,
"learning_rate": 0.00015868955342955937,
"loss": 2.966,
"step": 9090
},
{
"epoch": 0.67,
"grad_norm": 12.141742706298828,
"learning_rate": 0.0001585906126945675,
"loss": 2.9231,
"step": 9100
},
{
"epoch": 0.67,
"grad_norm": 9.727426528930664,
"learning_rate": 0.00015849158454460773,
"loss": 2.8196,
"step": 9110
},
{
"epoch": 0.67,
"grad_norm": 6.129993915557861,
"learning_rate": 0.0001583924691274263,
"loss": 2.8332,
"step": 9120
},
{
"epoch": 0.67,
"grad_norm": 4.653347969055176,
"learning_rate": 0.00015829326659089963,
"loss": 3.2322,
"step": 9130
},
{
"epoch": 0.68,
"grad_norm": 7.963883876800537,
"learning_rate": 0.00015819397708303416,
"loss": 3.0491,
"step": 9140
},
{
"epoch": 0.68,
"grad_norm": 4.15736722946167,
"learning_rate": 0.00015809460075196606,
"loss": 2.7982,
"step": 9150
},
{
"epoch": 0.68,
"grad_norm": 4.2904133796691895,
"learning_rate": 0.000157995137745961,
"loss": 2.9823,
"step": 9160
},
{
"epoch": 0.68,
"grad_norm": 7.554558753967285,
"learning_rate": 0.00015789558821341408,
"loss": 2.9495,
"step": 9170
},
{
"epoch": 0.68,
"grad_norm": 8.047385215759277,
"learning_rate": 0.00015779595230284933,
"loss": 2.9106,
"step": 9180
},
{
"epoch": 0.68,
"grad_norm": 9.017010688781738,
"learning_rate": 0.00015769623016291987,
"loss": 2.5535,
"step": 9190
},
{
"epoch": 0.68,
"grad_norm": 4.758884906768799,
"learning_rate": 0.00015759642194240718,
"loss": 2.5587,
"step": 9200
},
{
"epoch": 0.68,
"eval_loss": 2.9998974800109863,
"eval_runtime": 1139.1877,
"eval_samples_per_second": 5.004,
"eval_steps_per_second": 5.004,
"step": 9200
},
{
"epoch": 0.68,
"grad_norm": 5.704859733581543,
"learning_rate": 0.00015749652779022144,
"loss": 2.9386,
"step": 9210
},
{
"epoch": 0.68,
"grad_norm": 3.6972222328186035,
"learning_rate": 0.0001573965478554009,
"loss": 2.9757,
"step": 9220
},
{
"epoch": 0.68,
"grad_norm": 4.977140426635742,
"learning_rate": 0.00015729648228711182,
"loss": 2.9307,
"step": 9230
},
{
"epoch": 0.68,
"grad_norm": 4.237871170043945,
"learning_rate": 0.0001571963312346483,
"loss": 2.7724,
"step": 9240
},
{
"epoch": 0.68,
"grad_norm": 5.418900012969971,
"learning_rate": 0.00015709609484743176,
"loss": 2.767,
"step": 9250
},
{
"epoch": 0.68,
"grad_norm": 5.639104843139648,
"learning_rate": 0.0001569957732750112,
"loss": 2.9483,
"step": 9260
},
{
"epoch": 0.68,
"grad_norm": 8.407296180725098,
"learning_rate": 0.00015689536666706254,
"loss": 3.1998,
"step": 9270
},
{
"epoch": 0.69,
"grad_norm": 4.8399128913879395,
"learning_rate": 0.00015679487517338865,
"loss": 2.8589,
"step": 9280
},
{
"epoch": 0.69,
"grad_norm": 5.254055023193359,
"learning_rate": 0.000156694298943919,
"loss": 3.0868,
"step": 9290
},
{
"epoch": 0.69,
"grad_norm": 6.7703094482421875,
"learning_rate": 0.0001565936381287095,
"loss": 3.1148,
"step": 9300
},
{
"epoch": 0.69,
"grad_norm": 4.5534186363220215,
"learning_rate": 0.0001564928928779423,
"loss": 2.8424,
"step": 9310
},
{
"epoch": 0.69,
"grad_norm": 5.026829242706299,
"learning_rate": 0.00015639206334192544,
"loss": 2.9863,
"step": 9320
},
{
"epoch": 0.69,
"grad_norm": 5.98419713973999,
"learning_rate": 0.0001562911496710928,
"loss": 3.0387,
"step": 9330
},
{
"epoch": 0.69,
"grad_norm": 5.446651935577393,
"learning_rate": 0.00015619015201600371,
"loss": 3.0489,
"step": 9340
},
{
"epoch": 0.69,
"grad_norm": 3.870856761932373,
"learning_rate": 0.00015608907052734283,
"loss": 2.6993,
"step": 9350
},
{
"epoch": 0.69,
"grad_norm": 9.323542594909668,
"learning_rate": 0.00015598790535591994,
"loss": 3.4028,
"step": 9360
},
{
"epoch": 0.69,
"grad_norm": 5.4584431648254395,
"learning_rate": 0.00015588665665266957,
"loss": 3.2105,
"step": 9370
},
{
"epoch": 0.69,
"grad_norm": 4.321359634399414,
"learning_rate": 0.000155785324568651,
"loss": 2.7321,
"step": 9380
},
{
"epoch": 0.69,
"grad_norm": 6.849380970001221,
"learning_rate": 0.00015568390925504782,
"loss": 2.9796,
"step": 9390
},
{
"epoch": 0.69,
"grad_norm": 5.754255294799805,
"learning_rate": 0.0001555824108631678,
"loss": 2.7112,
"step": 9400
},
{
"epoch": 0.69,
"eval_loss": 2.999478578567505,
"eval_runtime": 1136.8232,
"eval_samples_per_second": 5.014,
"eval_steps_per_second": 5.014,
"step": 9400
},
{
"epoch": 0.7,
"grad_norm": 7.1536173820495605,
"learning_rate": 0.0001554808295444427,
"loss": 2.9848,
"step": 9410
},
{
"epoch": 0.7,
"grad_norm": 7.908527851104736,
"learning_rate": 0.00015537916545042805,
"loss": 2.9802,
"step": 9420
},
{
"epoch": 0.7,
"grad_norm": 10.420408248901367,
"learning_rate": 0.00015527741873280274,
"loss": 2.8162,
"step": 9430
},
{
"epoch": 0.7,
"grad_norm": 5.7388763427734375,
"learning_rate": 0.00015517558954336903,
"loss": 3.2836,
"step": 9440
},
{
"epoch": 0.7,
"grad_norm": 5.738020420074463,
"learning_rate": 0.0001550736780340522,
"loss": 2.9862,
"step": 9450
},
{
"epoch": 0.7,
"grad_norm": 5.188188076019287,
"learning_rate": 0.00015497168435690036,
"loss": 2.913,
"step": 9460
},
{
"epoch": 0.7,
"grad_norm": 3.969451427459717,
"learning_rate": 0.00015486960866408417,
"loss": 2.9761,
"step": 9470
},
{
"epoch": 0.7,
"grad_norm": 6.392033100128174,
"learning_rate": 0.00015476745110789674,
"loss": 2.8509,
"step": 9480
},
{
"epoch": 0.7,
"grad_norm": 5.61599063873291,
"learning_rate": 0.00015466521184075323,
"loss": 3.1069,
"step": 9490
},
{
"epoch": 0.7,
"grad_norm": 7.307232856750488,
"learning_rate": 0.0001545628910151907,
"loss": 3.0924,
"step": 9500
},
{
"epoch": 0.7,
"grad_norm": 6.591823101043701,
"learning_rate": 0.00015446048878386802,
"loss": 2.9399,
"step": 9510
},
{
"epoch": 0.7,
"grad_norm": 5.432168483734131,
"learning_rate": 0.00015435800529956534,
"loss": 3.0241,
"step": 9520
},
{
"epoch": 0.7,
"grad_norm": 4.527278423309326,
"learning_rate": 0.00015425544071518422,
"loss": 3.2915,
"step": 9530
},
{
"epoch": 0.7,
"grad_norm": 4.801354885101318,
"learning_rate": 0.000154152795183747,
"loss": 2.9509,
"step": 9540
},
{
"epoch": 0.71,
"grad_norm": 8.737408638000488,
"learning_rate": 0.00015405006885839707,
"loss": 2.9119,
"step": 9550
},
{
"epoch": 0.71,
"grad_norm": 5.51857852935791,
"learning_rate": 0.00015394726189239805,
"loss": 3.2417,
"step": 9560
},
{
"epoch": 0.71,
"grad_norm": 4.063334941864014,
"learning_rate": 0.00015384437443913414,
"loss": 2.8913,
"step": 9570
},
{
"epoch": 0.71,
"grad_norm": 7.9327287673950195,
"learning_rate": 0.00015374140665210946,
"loss": 2.913,
"step": 9580
},
{
"epoch": 0.71,
"grad_norm": 6.562859058380127,
"learning_rate": 0.000153638358684948,
"loss": 3.0012,
"step": 9590
},
{
"epoch": 0.71,
"grad_norm": 9.443960189819336,
"learning_rate": 0.00015353523069139348,
"loss": 2.9245,
"step": 9600
},
{
"epoch": 0.71,
"eval_loss": 2.9986822605133057,
"eval_runtime": 1138.3167,
"eval_samples_per_second": 5.007,
"eval_steps_per_second": 5.007,
"step": 9600
},
{
"epoch": 0.71,
"grad_norm": 5.080326080322266,
"learning_rate": 0.00015343202282530892,
"loss": 2.5978,
"step": 9610
},
{
"epoch": 0.71,
"grad_norm": 4.626572608947754,
"learning_rate": 0.00015332873524067658,
"loss": 2.8308,
"step": 9620
},
{
"epoch": 0.71,
"grad_norm": 14.406761169433594,
"learning_rate": 0.0001532253680915975,
"loss": 3.2131,
"step": 9630
},
{
"epoch": 0.71,
"grad_norm": 8.314620971679688,
"learning_rate": 0.00015312192153229162,
"loss": 2.8485,
"step": 9640
},
{
"epoch": 0.71,
"grad_norm": 9.021672248840332,
"learning_rate": 0.0001530183957170973,
"loss": 3.1707,
"step": 9650
},
{
"epoch": 0.71,
"grad_norm": 6.305810451507568,
"learning_rate": 0.00015291479080047104,
"loss": 2.8943,
"step": 9660
},
{
"epoch": 0.71,
"grad_norm": 4.459597587585449,
"learning_rate": 0.00015281110693698752,
"loss": 2.8154,
"step": 9670
},
{
"epoch": 0.72,
"grad_norm": 6.650838375091553,
"learning_rate": 0.00015270734428133906,
"loss": 2.9857,
"step": 9680
},
{
"epoch": 0.72,
"grad_norm": 7.86285924911499,
"learning_rate": 0.00015260350298833565,
"loss": 2.8424,
"step": 9690
},
{
"epoch": 0.72,
"grad_norm": 8.555646896362305,
"learning_rate": 0.0001524995832129045,
"loss": 3.1926,
"step": 9700
},
{
"epoch": 0.72,
"grad_norm": 7.865792751312256,
"learning_rate": 0.00015239558511009004,
"loss": 3.1938,
"step": 9710
},
{
"epoch": 0.72,
"grad_norm": 8.588205337524414,
"learning_rate": 0.00015229150883505342,
"loss": 2.9822,
"step": 9720
},
{
"epoch": 0.72,
"grad_norm": 7.853447437286377,
"learning_rate": 0.0001521873545430725,
"loss": 2.9926,
"step": 9730
},
{
"epoch": 0.72,
"grad_norm": 6.028032302856445,
"learning_rate": 0.00015208312238954158,
"loss": 3.1323,
"step": 9740
},
{
"epoch": 0.72,
"grad_norm": 4.851654529571533,
"learning_rate": 0.000151978812529971,
"loss": 2.892,
"step": 9750
},
{
"epoch": 0.72,
"grad_norm": 4.319963455200195,
"learning_rate": 0.00015187442511998715,
"loss": 2.5974,
"step": 9760
},
{
"epoch": 0.72,
"grad_norm": 6.1562628746032715,
"learning_rate": 0.0001517699603153321,
"loss": 2.9623,
"step": 9770
},
{
"epoch": 0.72,
"grad_norm": 5.6080193519592285,
"learning_rate": 0.00015166541827186326,
"loss": 2.8689,
"step": 9780
},
{
"epoch": 0.72,
"grad_norm": 9.012639045715332,
"learning_rate": 0.00015156079914555354,
"loss": 3.1591,
"step": 9790
},
{
"epoch": 0.72,
"grad_norm": 4.5083746910095215,
"learning_rate": 0.00015145610309249058,
"loss": 2.8816,
"step": 9800
},
{
"epoch": 0.72,
"eval_loss": 2.9825246334075928,
"eval_runtime": 1137.641,
"eval_samples_per_second": 5.01,
"eval_steps_per_second": 5.01,
"step": 9800
},
{
"epoch": 0.72,
"grad_norm": 8.24355697631836,
"learning_rate": 0.00015135133026887698,
"loss": 2.7468,
"step": 9810
},
{
"epoch": 0.73,
"grad_norm": 6.146825790405273,
"learning_rate": 0.00015124648083102979,
"loss": 3.1624,
"step": 9820
},
{
"epoch": 0.73,
"grad_norm": 5.946303844451904,
"learning_rate": 0.00015114155493538037,
"loss": 2.9932,
"step": 9830
},
{
"epoch": 0.73,
"grad_norm": 7.62037992477417,
"learning_rate": 0.00015103655273847422,
"loss": 2.8597,
"step": 9840
},
{
"epoch": 0.73,
"grad_norm": 8.6740083694458,
"learning_rate": 0.00015093147439697058,
"loss": 3.2558,
"step": 9850
},
{
"epoch": 0.73,
"grad_norm": 4.523014545440674,
"learning_rate": 0.00015082632006764238,
"loss": 2.9356,
"step": 9860
},
{
"epoch": 0.73,
"grad_norm": 6.251735210418701,
"learning_rate": 0.00015072108990737582,
"loss": 2.7333,
"step": 9870
},
{
"epoch": 0.73,
"grad_norm": 6.199810028076172,
"learning_rate": 0.0001506157840731704,
"loss": 2.8651,
"step": 9880
},
{
"epoch": 0.73,
"grad_norm": 5.6429972648620605,
"learning_rate": 0.0001505104027221383,
"loss": 3.0208,
"step": 9890
},
{
"epoch": 0.73,
"grad_norm": 6.78240966796875,
"learning_rate": 0.0001504049460115046,
"loss": 3.4201,
"step": 9900
},
{
"epoch": 0.73,
"grad_norm": 5.331435203552246,
"learning_rate": 0.00015029941409860667,
"loss": 3.0285,
"step": 9910
},
{
"epoch": 0.73,
"grad_norm": 7.6099324226379395,
"learning_rate": 0.0001501938071408941,
"loss": 2.9424,
"step": 9920
},
{
"epoch": 0.73,
"grad_norm": 5.696933269500732,
"learning_rate": 0.00015008812529592843,
"loss": 2.9491,
"step": 9930
},
{
"epoch": 0.73,
"grad_norm": 4.624625205993652,
"learning_rate": 0.00014998236872138302,
"loss": 2.9854,
"step": 9940
},
{
"epoch": 0.73,
"grad_norm": 7.571484088897705,
"learning_rate": 0.00014987653757504263,
"loss": 3.0587,
"step": 9950
},
{
"epoch": 0.74,
"grad_norm": 4.712878227233887,
"learning_rate": 0.00014977063201480334,
"loss": 3.0112,
"step": 9960
},
{
"epoch": 0.74,
"grad_norm": 4.909578323364258,
"learning_rate": 0.00014966465219867217,
"loss": 2.9227,
"step": 9970
},
{
"epoch": 0.74,
"grad_norm": 4.633456707000732,
"learning_rate": 0.00014955859828476702,
"loss": 3.1489,
"step": 9980
},
{
"epoch": 0.74,
"grad_norm": 4.861935615539551,
"learning_rate": 0.00014945247043131622,
"loss": 2.984,
"step": 9990
},
{
"epoch": 0.74,
"grad_norm": 10.554461479187012,
"learning_rate": 0.00014934626879665864,
"loss": 3.0501,
"step": 10000
},
{
"epoch": 0.74,
"eval_loss": 2.9680299758911133,
"eval_runtime": 1137.4461,
"eval_samples_per_second": 5.011,
"eval_steps_per_second": 5.011,
"step": 10000
},
{
"epoch": 0.74,
"grad_norm": 4.56096887588501,
"learning_rate": 0.00014923999353924297,
"loss": 2.7057,
"step": 10010
},
{
"epoch": 0.74,
"grad_norm": 7.319655418395996,
"learning_rate": 0.0001491336448176279,
"loss": 3.1668,
"step": 10020
},
{
"epoch": 0.74,
"grad_norm": 6.589526653289795,
"learning_rate": 0.00014902722279048166,
"loss": 3.1742,
"step": 10030
},
{
"epoch": 0.74,
"grad_norm": 7.270175457000732,
"learning_rate": 0.00014892072761658187,
"loss": 3.0247,
"step": 10040
},
{
"epoch": 0.74,
"grad_norm": 6.527873992919922,
"learning_rate": 0.0001488141594548153,
"loss": 2.9606,
"step": 10050
},
{
"epoch": 0.74,
"grad_norm": 5.78521728515625,
"learning_rate": 0.00014870751846417758,
"loss": 3.3098,
"step": 10060
},
{
"epoch": 0.74,
"grad_norm": 7.620880126953125,
"learning_rate": 0.00014860080480377306,
"loss": 2.9146,
"step": 10070
},
{
"epoch": 0.74,
"grad_norm": 5.929685115814209,
"learning_rate": 0.0001484940186328144,
"loss": 3.0891,
"step": 10080
},
{
"epoch": 0.75,
"grad_norm": 10.600454330444336,
"learning_rate": 0.00014838716011062258,
"loss": 2.7763,
"step": 10090
},
{
"epoch": 0.75,
"grad_norm": 5.074846267700195,
"learning_rate": 0.00014828022939662638,
"loss": 2.9147,
"step": 10100
},
{
"epoch": 0.75,
"grad_norm": 6.829638957977295,
"learning_rate": 0.00014817322665036244,
"loss": 3.0132,
"step": 10110
},
{
"epoch": 0.75,
"grad_norm": 5.505454063415527,
"learning_rate": 0.00014806615203147473,
"loss": 3.0183,
"step": 10120
},
{
"epoch": 0.75,
"grad_norm": 5.461676597595215,
"learning_rate": 0.00014795900569971454,
"loss": 3.1014,
"step": 10130
},
{
"epoch": 0.75,
"grad_norm": 4.047961711883545,
"learning_rate": 0.0001478517878149401,
"loss": 3.1134,
"step": 10140
},
{
"epoch": 0.75,
"grad_norm": 4.537815570831299,
"learning_rate": 0.00014774449853711648,
"loss": 2.9786,
"step": 10150
},
{
"epoch": 0.75,
"grad_norm": 8.680290222167969,
"learning_rate": 0.00014763713802631515,
"loss": 2.8598,
"step": 10160
},
{
"epoch": 0.75,
"grad_norm": 5.524952411651611,
"learning_rate": 0.00014752970644271393,
"loss": 2.8898,
"step": 10170
},
{
"epoch": 0.75,
"grad_norm": 4.378311634063721,
"learning_rate": 0.00014742220394659667,
"loss": 3.1406,
"step": 10180
},
{
"epoch": 0.75,
"grad_norm": 4.671150207519531,
"learning_rate": 0.000147314630698353,
"loss": 2.9889,
"step": 10190
},
{
"epoch": 0.75,
"grad_norm": 6.330467700958252,
"learning_rate": 0.0001472069868584781,
"loss": 3.1183,
"step": 10200
},
{
"epoch": 0.75,
"eval_loss": 2.969615936279297,
"eval_runtime": 1135.1327,
"eval_samples_per_second": 5.021,
"eval_steps_per_second": 5.021,
"step": 10200
},
{
"epoch": 0.75,
"grad_norm": 7.620838642120361,
"learning_rate": 0.00014709927258757253,
"loss": 2.9721,
"step": 10210
},
{
"epoch": 0.75,
"grad_norm": 6.69796895980835,
"learning_rate": 0.00014699148804634185,
"loss": 2.9581,
"step": 10220
},
{
"epoch": 0.76,
"grad_norm": 6.295568943023682,
"learning_rate": 0.00014688363339559652,
"loss": 3.0132,
"step": 10230
},
{
"epoch": 0.76,
"grad_norm": 5.181854248046875,
"learning_rate": 0.0001467757087962516,
"loss": 2.9179,
"step": 10240
},
{
"epoch": 0.76,
"grad_norm": 4.249350547790527,
"learning_rate": 0.00014666771440932644,
"loss": 2.8028,
"step": 10250
},
{
"epoch": 0.76,
"grad_norm": 7.280447959899902,
"learning_rate": 0.0001465596503959446,
"loss": 2.9399,
"step": 10260
},
{
"epoch": 0.76,
"grad_norm": 5.414987087249756,
"learning_rate": 0.0001464515169173335,
"loss": 2.8953,
"step": 10270
},
{
"epoch": 0.76,
"grad_norm": 7.337689399719238,
"learning_rate": 0.00014634331413482414,
"loss": 2.8618,
"step": 10280
},
{
"epoch": 0.76,
"grad_norm": 9.888291358947754,
"learning_rate": 0.00014623504220985097,
"loss": 3.2855,
"step": 10290
},
{
"epoch": 0.76,
"grad_norm": 4.2359299659729,
"learning_rate": 0.0001461267013039516,
"loss": 3.011,
"step": 10300
},
{
"epoch": 0.76,
"grad_norm": 5.158446788787842,
"learning_rate": 0.00014601829157876654,
"loss": 2.7949,
"step": 10310
},
{
"epoch": 0.76,
"grad_norm": 4.1677680015563965,
"learning_rate": 0.000145909813196039,
"loss": 3.2265,
"step": 10320
},
{
"epoch": 0.76,
"grad_norm": 6.444026470184326,
"learning_rate": 0.00014580126631761454,
"loss": 3.0472,
"step": 10330
},
{
"epoch": 0.76,
"grad_norm": 5.472976207733154,
"learning_rate": 0.00014569265110544105,
"loss": 2.8335,
"step": 10340
},
{
"epoch": 0.76,
"grad_norm": 4.650349140167236,
"learning_rate": 0.00014558396772156826,
"loss": 2.9379,
"step": 10350
},
{
"epoch": 0.77,
"grad_norm": 4.644428253173828,
"learning_rate": 0.00014547521632814767,
"loss": 2.8781,
"step": 10360
},
{
"epoch": 0.77,
"grad_norm": 4.317287921905518,
"learning_rate": 0.0001453663970874322,
"loss": 2.867,
"step": 10370
},
{
"epoch": 0.77,
"grad_norm": 6.050807952880859,
"learning_rate": 0.0001452575101617761,
"loss": 3.0715,
"step": 10380
},
{
"epoch": 0.77,
"grad_norm": 4.716285705566406,
"learning_rate": 0.0001451485557136344,
"loss": 2.6545,
"step": 10390
},
{
"epoch": 0.77,
"grad_norm": 5.954706192016602,
"learning_rate": 0.0001450395339055631,
"loss": 3.1563,
"step": 10400
},
{
"epoch": 0.77,
"eval_loss": 2.9598331451416016,
"eval_runtime": 1137.1539,
"eval_samples_per_second": 5.013,
"eval_steps_per_second": 5.013,
"step": 10400
},
{
"epoch": 0.77,
"grad_norm": 5.110961437225342,
"learning_rate": 0.0001449304449002185,
"loss": 3.0793,
"step": 10410
},
{
"epoch": 0.77,
"grad_norm": 4.516371250152588,
"learning_rate": 0.0001448212888603574,
"loss": 3.0189,
"step": 10420
},
{
"epoch": 0.77,
"grad_norm": 7.248453617095947,
"learning_rate": 0.00014471206594883634,
"loss": 3.0615,
"step": 10430
},
{
"epoch": 0.77,
"grad_norm": 4.003082752227783,
"learning_rate": 0.00014460277632861174,
"loss": 3.2798,
"step": 10440
},
{
"epoch": 0.77,
"grad_norm": 6.659687519073486,
"learning_rate": 0.00014449342016273966,
"loss": 2.9107,
"step": 10450
},
{
"epoch": 0.77,
"grad_norm": 7.421617031097412,
"learning_rate": 0.00014438399761437527,
"loss": 3.1504,
"step": 10460
},
{
"epoch": 0.77,
"grad_norm": 4.268542289733887,
"learning_rate": 0.00014427450884677289,
"loss": 2.9658,
"step": 10470
},
{
"epoch": 0.77,
"grad_norm": 5.025989532470703,
"learning_rate": 0.0001441649540232856,
"loss": 3.2243,
"step": 10480
},
{
"epoch": 0.77,
"grad_norm": 5.317170143127441,
"learning_rate": 0.00014405533330736497,
"loss": 2.8027,
"step": 10490
},
{
"epoch": 0.78,
"grad_norm": 8.103606224060059,
"learning_rate": 0.00014394564686256108,
"loss": 2.8796,
"step": 10500
},
{
"epoch": 0.78,
"grad_norm": 6.020264148712158,
"learning_rate": 0.0001438358948525218,
"loss": 2.6636,
"step": 10510
},
{
"epoch": 0.78,
"grad_norm": 5.222537517547607,
"learning_rate": 0.000143726077440993,
"loss": 3.1448,
"step": 10520
},
{
"epoch": 0.78,
"grad_norm": 5.023114204406738,
"learning_rate": 0.00014361619479181812,
"loss": 2.9364,
"step": 10530
},
{
"epoch": 0.78,
"grad_norm": 5.129509925842285,
"learning_rate": 0.00014350624706893785,
"loss": 2.8327,
"step": 10540
},
{
"epoch": 0.78,
"grad_norm": 3.634791135787964,
"learning_rate": 0.00014339623443639004,
"loss": 2.8565,
"step": 10550
},
{
"epoch": 0.78,
"grad_norm": 5.827573299407959,
"learning_rate": 0.0001432861570583094,
"loss": 2.8492,
"step": 10560
},
{
"epoch": 0.78,
"grad_norm": 4.608321189880371,
"learning_rate": 0.0001431760150989271,
"loss": 2.7838,
"step": 10570
},
{
"epoch": 0.78,
"grad_norm": 5.711697578430176,
"learning_rate": 0.00014306580872257084,
"loss": 2.7076,
"step": 10580
},
{
"epoch": 0.78,
"grad_norm": 4.423154830932617,
"learning_rate": 0.0001429555380936643,
"loss": 2.8312,
"step": 10590
},
{
"epoch": 0.78,
"grad_norm": 6.354341983795166,
"learning_rate": 0.0001428452033767271,
"loss": 2.8778,
"step": 10600
},
{
"epoch": 0.78,
"eval_loss": 2.959249973297119,
"eval_runtime": 1138.9728,
"eval_samples_per_second": 5.005,
"eval_steps_per_second": 5.005,
"step": 10600
},
{
"epoch": 0.78,
"grad_norm": 7.5264763832092285,
"learning_rate": 0.00014273480473637443,
"loss": 3.1428,
"step": 10610
},
{
"epoch": 0.78,
"grad_norm": 6.143415451049805,
"learning_rate": 0.0001426243423373169,
"loss": 3.0073,
"step": 10620
},
{
"epoch": 0.79,
"grad_norm": 4.933542251586914,
"learning_rate": 0.00014251381634436015,
"loss": 2.7708,
"step": 10630
},
{
"epoch": 0.79,
"grad_norm": 5.974007606506348,
"learning_rate": 0.00014240322692240476,
"loss": 2.5688,
"step": 10640
},
{
"epoch": 0.79,
"grad_norm": 4.774169445037842,
"learning_rate": 0.000142292574236446,
"loss": 3.0229,
"step": 10650
},
{
"epoch": 0.79,
"grad_norm": 7.627336502075195,
"learning_rate": 0.00014218185845157346,
"loss": 2.779,
"step": 10660
},
{
"epoch": 0.79,
"grad_norm": 4.425614833831787,
"learning_rate": 0.00014207107973297087,
"loss": 2.8371,
"step": 10670
},
{
"epoch": 0.79,
"grad_norm": 5.521327495574951,
"learning_rate": 0.0001419602382459159,
"loss": 2.9034,
"step": 10680
},
{
"epoch": 0.79,
"grad_norm": 6.049530982971191,
"learning_rate": 0.00014184933415577978,
"loss": 2.8192,
"step": 10690
},
{
"epoch": 0.79,
"grad_norm": 4.450803756713867,
"learning_rate": 0.0001417383676280272,
"loss": 3.0164,
"step": 10700
},
{
"epoch": 0.79,
"grad_norm": 6.391834735870361,
"learning_rate": 0.00014162733882821607,
"loss": 2.7078,
"step": 10710
},
{
"epoch": 0.79,
"grad_norm": NaN,
"learning_rate": 0.00014152735980268438,
"loss": 3.3182,
"step": 10720
},
{
"epoch": 0.79,
"grad_norm": 5.099579811096191,
"learning_rate": 0.00014141621314240634,
"loss": 2.8339,
"step": 10730
},
{
"epoch": 0.79,
"grad_norm": 4.9488067626953125,
"learning_rate": 0.00014130500469071195,
"loss": 2.9437,
"step": 10740
},
{
"epoch": 0.79,
"grad_norm": 6.22238302230835,
"learning_rate": 0.00014119373461352001,
"loss": 2.9827,
"step": 10750
},
{
"epoch": 0.79,
"grad_norm": 5.493013858795166,
"learning_rate": 0.00014108240307684127,
"loss": 3.0163,
"step": 10760
},
{
"epoch": 0.8,
"grad_norm": 5.54683780670166,
"learning_rate": 0.00014097101024677808,
"loss": 3.0077,
"step": 10770
},
{
"epoch": 0.8,
"grad_norm": 6.295912742614746,
"learning_rate": 0.00014085955628952441,
"loss": 2.8018,
"step": 10780
},
{
"epoch": 0.8,
"grad_norm": 3.9085795879364014,
"learning_rate": 0.00014074804137136524,
"loss": 2.9818,
"step": 10790
},
{
"epoch": 0.8,
"grad_norm": 5.808225631713867,
"learning_rate": 0.00014063646565867663,
"loss": 3.159,
"step": 10800
},
{
"epoch": 0.8,
"eval_loss": 2.9464659690856934,
"eval_runtime": 1139.1096,
"eval_samples_per_second": 5.004,
"eval_steps_per_second": 5.004,
"step": 10800
},
{
"epoch": 0.8,
"grad_norm": 6.944069862365723,
"learning_rate": 0.0001405248293179253,
"loss": 3.1757,
"step": 10810
},
{
"epoch": 0.8,
"grad_norm": 7.533534526824951,
"learning_rate": 0.00014041313251566845,
"loss": 2.9995,
"step": 10820
},
{
"epoch": 0.8,
"grad_norm": 6.755417346954346,
"learning_rate": 0.00014030137541855346,
"loss": 3.1326,
"step": 10830
},
{
"epoch": 0.8,
"grad_norm": 8.288308143615723,
"learning_rate": 0.00014018955819331764,
"loss": 2.7772,
"step": 10840
},
{
"epoch": 0.8,
"grad_norm": 3.5482583045959473,
"learning_rate": 0.00014007768100678805,
"loss": 2.8674,
"step": 10850
},
{
"epoch": 0.8,
"grad_norm": 4.020620346069336,
"learning_rate": 0.0001399657440258812,
"loss": 3.028,
"step": 10860
},
{
"epoch": 0.8,
"grad_norm": 7.0991315841674805,
"learning_rate": 0.00013985374741760283,
"loss": 3.1083,
"step": 10870
},
{
"epoch": 0.8,
"grad_norm": 7.445100784301758,
"learning_rate": 0.00013974169134904765,
"loss": 2.6173,
"step": 10880
},
{
"epoch": 0.8,
"grad_norm": 4.649611949920654,
"learning_rate": 0.000139629575987399,
"loss": 2.9081,
"step": 10890
},
{
"epoch": 0.81,
"grad_norm": 6.424789905548096,
"learning_rate": 0.00013951740149992876,
"loss": 3.134,
"step": 10900
},
{
"epoch": 0.81,
"grad_norm": 7.624310493469238,
"learning_rate": 0.00013940516805399699,
"loss": 3.1254,
"step": 10910
},
{
"epoch": 0.81,
"grad_norm": 8.405814170837402,
"learning_rate": 0.00013929287581705176,
"loss": 3.1216,
"step": 10920
},
{
"epoch": 0.81,
"grad_norm": 5.037896156311035,
"learning_rate": 0.00013918052495662882,
"loss": 2.7543,
"step": 10930
},
{
"epoch": 0.81,
"grad_norm": 5.659261703491211,
"learning_rate": 0.00013906811564035133,
"loss": 3.0607,
"step": 10940
},
{
"epoch": 0.81,
"grad_norm": 7.80034065246582,
"learning_rate": 0.0001389556480359298,
"loss": 2.9075,
"step": 10950
},
{
"epoch": 0.81,
"grad_norm": 4.6370038986206055,
"learning_rate": 0.00013884312231116156,
"loss": 2.6178,
"step": 10960
},
{
"epoch": 0.81,
"grad_norm": 5.196686744689941,
"learning_rate": 0.00013873053863393072,
"loss": 2.7758,
"step": 10970
},
{
"epoch": 0.81,
"grad_norm": 6.2154083251953125,
"learning_rate": 0.00013861789717220787,
"loss": 3.1309,
"step": 10980
},
{
"epoch": 0.81,
"grad_norm": 6.0769124031066895,
"learning_rate": 0.0001385051980940498,
"loss": 2.9105,
"step": 10990
},
{
"epoch": 0.81,
"grad_norm": 16.503326416015625,
"learning_rate": 0.00013839244156759923,
"loss": 2.8583,
"step": 11000
},
{
"epoch": 0.81,
"eval_loss": 2.930485963821411,
"eval_runtime": 1135.5048,
"eval_samples_per_second": 5.02,
"eval_steps_per_second": 5.02,
"step": 11000
},
{
"epoch": 0.81,
"grad_norm": 6.584379196166992,
"learning_rate": 0.00013827962776108462,
"loss": 2.7119,
"step": 11010
},
{
"epoch": 0.81,
"grad_norm": 6.973694324493408,
"learning_rate": 0.0001381667568428199,
"loss": 2.7612,
"step": 11020
},
{
"epoch": 0.81,
"grad_norm": 6.25327205657959,
"learning_rate": 0.00013805382898120414,
"loss": 3.2764,
"step": 11030
},
{
"epoch": 0.82,
"grad_norm": 6.84330415725708,
"learning_rate": 0.00013794084434472147,
"loss": 2.8709,
"step": 11040
},
{
"epoch": 0.82,
"grad_norm": 6.320117950439453,
"learning_rate": 0.00013782780310194067,
"loss": 3.0335,
"step": 11050
},
{
"epoch": 0.82,
"grad_norm": 4.778736114501953,
"learning_rate": 0.00013771470542151497,
"loss": 2.9884,
"step": 11060
},
{
"epoch": 0.82,
"grad_norm": 6.087406635284424,
"learning_rate": 0.00013760155147218178,
"loss": 2.9923,
"step": 11070
},
{
"epoch": 0.82,
"grad_norm": 4.868623733520508,
"learning_rate": 0.00013748834142276252,
"loss": 2.829,
"step": 11080
},
{
"epoch": 0.82,
"grad_norm": 5.565182209014893,
"learning_rate": 0.00013737507544216233,
"loss": 2.728,
"step": 11090
},
{
"epoch": 0.82,
"grad_norm": 5.934764862060547,
"learning_rate": 0.00013726175369936967,
"loss": 2.8737,
"step": 11100
},
{
"epoch": 0.82,
"grad_norm": 6.818757057189941,
"learning_rate": 0.0001371483763634563,
"loss": 2.6239,
"step": 11110
},
{
"epoch": 0.82,
"grad_norm": 4.30825662612915,
"learning_rate": 0.00013703494360357694,
"loss": 2.8212,
"step": 11120
},
{
"epoch": 0.82,
"grad_norm": 6.317237377166748,
"learning_rate": 0.00013692145558896887,
"loss": 2.7839,
"step": 11130
},
{
"epoch": 0.82,
"grad_norm": 5.52744197845459,
"learning_rate": 0.00013680791248895199,
"loss": 3.1383,
"step": 11140
},
{
"epoch": 0.82,
"grad_norm": 6.30517053604126,
"learning_rate": 0.00013669431447292825,
"loss": 2.7455,
"step": 11150
},
{
"epoch": 0.82,
"grad_norm": 7.219874858856201,
"learning_rate": 0.00013658066171038153,
"loss": 2.8031,
"step": 11160
},
{
"epoch": 0.83,
"grad_norm": 3.8619625568389893,
"learning_rate": 0.00013646695437087754,
"loss": 3.0624,
"step": 11170
},
{
"epoch": 0.83,
"grad_norm": 9.413076400756836,
"learning_rate": 0.00013635319262406318,
"loss": 2.9665,
"step": 11180
},
{
"epoch": 0.83,
"grad_norm": 9.219383239746094,
"learning_rate": 0.00013623937663966677,
"loss": 2.7616,
"step": 11190
},
{
"epoch": 0.83,
"grad_norm": 5.262277126312256,
"learning_rate": 0.00013612550658749736,
"loss": 2.9674,
"step": 11200
},
{
"epoch": 0.83,
"eval_loss": 2.9270477294921875,
"eval_runtime": 1134.3819,
"eval_samples_per_second": 5.025,
"eval_steps_per_second": 5.025,
"step": 11200
},
{
"epoch": 0.83,
"grad_norm": 4.998508453369141,
"learning_rate": 0.00013601158263744478,
"loss": 2.9739,
"step": 11210
},
{
"epoch": 0.83,
"grad_norm": 6.7563300132751465,
"learning_rate": 0.00013589760495947922,
"loss": 3.0721,
"step": 11220
},
{
"epoch": 0.83,
"grad_norm": 7.818253040313721,
"learning_rate": 0.00013578357372365102,
"loss": 2.9322,
"step": 11230
},
{
"epoch": 0.83,
"grad_norm": 3.3956222534179688,
"learning_rate": 0.0001356694891000905,
"loss": 3.0327,
"step": 11240
},
{
"epoch": 0.83,
"grad_norm": 3.3983898162841797,
"learning_rate": 0.00013555535125900757,
"loss": 2.5789,
"step": 11250
},
{
"epoch": 0.83,
"grad_norm": 6.465611457824707,
"learning_rate": 0.0001354411603706915,
"loss": 3.0299,
"step": 11260
},
{
"epoch": 0.83,
"grad_norm": 5.23297119140625,
"learning_rate": 0.0001353269166055108,
"loss": 2.8151,
"step": 11270
},
{
"epoch": 0.83,
"grad_norm": 4.9944586753845215,
"learning_rate": 0.00013521262013391287,
"loss": 2.9416,
"step": 11280
},
{
"epoch": 0.83,
"grad_norm": 3.9770894050598145,
"learning_rate": 0.0001350982711264236,
"loss": 2.7994,
"step": 11290
},
{
"epoch": 0.83,
"grad_norm": 9.537381172180176,
"learning_rate": 0.0001349838697536475,
"loss": 2.87,
"step": 11300
},
{
"epoch": 0.84,
"grad_norm": 5.436434745788574,
"learning_rate": 0.00013486941618626693,
"loss": 3.2234,
"step": 11310
},
{
"epoch": 0.84,
"grad_norm": 6.111148834228516,
"learning_rate": 0.00013475491059504233,
"loss": 2.8924,
"step": 11320
},
{
"epoch": 0.84,
"grad_norm": 12.326899528503418,
"learning_rate": 0.0001346403531508117,
"loss": 2.9485,
"step": 11330
},
{
"epoch": 0.84,
"grad_norm": 9.468557357788086,
"learning_rate": 0.00013452574402449038,
"loss": 3.0239,
"step": 11340
},
{
"epoch": 0.84,
"grad_norm": 8.779520988464355,
"learning_rate": 0.00013441108338707087,
"loss": 2.8417,
"step": 11350
},
{
"epoch": 0.84,
"grad_norm": 5.909932613372803,
"learning_rate": 0.0001342963714096224,
"loss": 2.7175,
"step": 11360
},
{
"epoch": 0.84,
"grad_norm": 5.584993362426758,
"learning_rate": 0.00013418160826329093,
"loss": 3.0146,
"step": 11370
},
{
"epoch": 0.84,
"grad_norm": 6.520732402801514,
"learning_rate": 0.00013406679411929873,
"loss": 3.1017,
"step": 11380
},
{
"epoch": 0.84,
"grad_norm": 4.61958122253418,
"learning_rate": 0.0001339519291489441,
"loss": 3.0017,
"step": 11390
},
{
"epoch": 0.84,
"grad_norm": 4.826852321624756,
"learning_rate": 0.0001338370135236013,
"loss": 2.827,
"step": 11400
},
{
"epoch": 0.84,
"eval_loss": 2.912285566329956,
"eval_runtime": 1137.7963,
"eval_samples_per_second": 5.01,
"eval_steps_per_second": 5.01,
"step": 11400
},
{
"epoch": 0.84,
"grad_norm": 7.968265533447266,
"learning_rate": 0.00013372204741471996,
"loss": 2.993,
"step": 11410
},
{
"epoch": 0.84,
"grad_norm": 4.151234149932861,
"learning_rate": 0.00013360703099382518,
"loss": 3.0601,
"step": 11420
},
{
"epoch": 0.84,
"grad_norm": 4.17539119720459,
"learning_rate": 0.00013349196443251718,
"loss": 2.9077,
"step": 11430
},
{
"epoch": 0.85,
"grad_norm": 6.504483222961426,
"learning_rate": 0.00013337684790247075,
"loss": 2.9594,
"step": 11440
},
{
"epoch": 0.85,
"grad_norm": 5.325105667114258,
"learning_rate": 0.0001332616815754355,
"loss": 2.8264,
"step": 11450
},
{
"epoch": 0.85,
"grad_norm": 7.66379976272583,
"learning_rate": 0.00013314646562323517,
"loss": 2.8312,
"step": 11460
},
{
"epoch": 0.85,
"grad_norm": 6.964573383331299,
"learning_rate": 0.0001330312002177675,
"loss": 2.6644,
"step": 11470
},
{
"epoch": 0.85,
"grad_norm": 7.418605327606201,
"learning_rate": 0.00013291588553100426,
"loss": 2.848,
"step": 11480
},
{
"epoch": 0.85,
"grad_norm": 12.711461067199707,
"learning_rate": 0.0001328005217349905,
"loss": 3.0142,
"step": 11490
},
{
"epoch": 0.85,
"grad_norm": 4.92010498046875,
"learning_rate": 0.00013268510900184459,
"loss": 2.8017,
"step": 11500
},
{
"epoch": 0.85,
"grad_norm": 5.789633274078369,
"learning_rate": 0.00013256964750375797,
"loss": 3.1904,
"step": 11510
},
{
"epoch": 0.85,
"grad_norm": 11.26569652557373,
"learning_rate": 0.0001324541374129948,
"loss": 2.9227,
"step": 11520
},
{
"epoch": 0.85,
"grad_norm": 4.300714492797852,
"learning_rate": 0.00013233857890189177,
"loss": 2.738,
"step": 11530
},
{
"epoch": 0.85,
"grad_norm": 8.24052619934082,
"learning_rate": 0.00013222297214285776,
"loss": 3.1162,
"step": 11540
},
{
"epoch": 0.85,
"grad_norm": 6.717054843902588,
"learning_rate": 0.00013210731730837368,
"loss": 3.1639,
"step": 11550
},
{
"epoch": 0.85,
"grad_norm": 9.139569282531738,
"learning_rate": 0.0001319916145709921,
"loss": 2.9694,
"step": 11560
},
{
"epoch": 0.85,
"grad_norm": 4.700305461883545,
"learning_rate": 0.00013187586410333724,
"loss": 2.674,
"step": 11570
},
{
"epoch": 0.86,
"grad_norm": 6.384634971618652,
"learning_rate": 0.00013176006607810425,
"loss": 3.0417,
"step": 11580
},
{
"epoch": 0.86,
"grad_norm": 7.221315860748291,
"learning_rate": 0.00013164422066805947,
"loss": 3.3196,
"step": 11590
},
{
"epoch": 0.86,
"grad_norm": 6.894277095794678,
"learning_rate": 0.0001315283280460398,
"loss": 2.7332,
"step": 11600
},
{
"epoch": 0.86,
"eval_loss": 2.915705919265747,
"eval_runtime": 1137.3676,
"eval_samples_per_second": 5.012,
"eval_steps_per_second": 5.012,
"step": 11600
},
{
"epoch": 0.86,
"grad_norm": 6.271778583526611,
"learning_rate": 0.00013141238838495264,
"loss": 3.0482,
"step": 11610
},
{
"epoch": 0.86,
"grad_norm": 7.282876014709473,
"learning_rate": 0.00013129640185777564,
"loss": 2.7195,
"step": 11620
},
{
"epoch": 0.86,
"grad_norm": 8.754749298095703,
"learning_rate": 0.00013118036863755614,
"loss": 3.1873,
"step": 11630
},
{
"epoch": 0.86,
"grad_norm": 6.130650520324707,
"learning_rate": 0.00013106428889741144,
"loss": 3.0263,
"step": 11640
},
{
"epoch": 0.86,
"grad_norm": 7.188558101654053,
"learning_rate": 0.000130948162810528,
"loss": 2.8634,
"step": 11650
},
{
"epoch": 0.86,
"grad_norm": 9.350152969360352,
"learning_rate": 0.00013083199055016154,
"loss": 3.2323,
"step": 11660
},
{
"epoch": 0.86,
"grad_norm": 7.754179954528809,
"learning_rate": 0.00013071577228963678,
"loss": 3.0035,
"step": 11670
},
{
"epoch": 0.86,
"grad_norm": 8.125720024108887,
"learning_rate": 0.00013059950820234678,
"loss": 3.264,
"step": 11680
},
{
"epoch": 0.86,
"grad_norm": 4.942266941070557,
"learning_rate": 0.00013048319846175325,
"loss": 2.7955,
"step": 11690
},
{
"epoch": 0.86,
"grad_norm": 6.1011505126953125,
"learning_rate": 0.00013036684324138587,
"loss": 2.6444,
"step": 11700
},
{
"epoch": 0.87,
"grad_norm": 5.939935207366943,
"learning_rate": 0.0001302504427148422,
"loss": 2.8813,
"step": 11710
},
{
"epoch": 0.87,
"grad_norm": 8.676549911499023,
"learning_rate": 0.0001301339970557874,
"loss": 2.7569,
"step": 11720
},
{
"epoch": 0.87,
"grad_norm": 8.003786087036133,
"learning_rate": 0.000130017506437954,
"loss": 2.7625,
"step": 11730
},
{
"epoch": 0.87,
"grad_norm": 4.292322635650635,
"learning_rate": 0.00012990097103514155,
"loss": 2.9883,
"step": 11740
},
{
"epoch": 0.87,
"grad_norm": 5.578572750091553,
"learning_rate": 0.00012978439102121647,
"loss": 3.4115,
"step": 11750
},
{
"epoch": 0.87,
"grad_norm": 5.9065093994140625,
"learning_rate": 0.00012966776657011167,
"loss": 3.057,
"step": 11760
},
{
"epoch": 0.87,
"grad_norm": 4.266748428344727,
"learning_rate": 0.0001295510978558264,
"loss": 2.9653,
"step": 11770
},
{
"epoch": 0.87,
"grad_norm": 5.894644737243652,
"learning_rate": 0.000129434385052426,
"loss": 2.9065,
"step": 11780
},
{
"epoch": 0.87,
"grad_norm": 5.477922439575195,
"learning_rate": 0.00012931762833404148,
"loss": 2.9249,
"step": 11790
},
{
"epoch": 0.87,
"grad_norm": 4.732699871063232,
"learning_rate": 0.00012920082787486948,
"loss": 2.8734,
"step": 11800
},
{
"epoch": 0.87,
"eval_loss": 2.905906915664673,
"eval_runtime": 1138.8177,
"eval_samples_per_second": 5.005,
"eval_steps_per_second": 5.005,
"step": 11800
},
{
"epoch": 0.87,
"grad_norm": 5.697981834411621,
"learning_rate": 0.0001290839838491718,
"loss": 2.843,
"step": 11810
},
{
"epoch": 0.87,
"grad_norm": 5.219038009643555,
"learning_rate": 0.00012896709643127528,
"loss": 3.123,
"step": 11820
},
{
"epoch": 0.87,
"grad_norm": 5.130221843719482,
"learning_rate": 0.00012885016579557162,
"loss": 2.8452,
"step": 11830
},
{
"epoch": 0.87,
"grad_norm": 10.45068645477295,
"learning_rate": 0.00012873319211651672,
"loss": 3.0178,
"step": 11840
},
{
"epoch": 0.88,
"grad_norm": 6.096733570098877,
"learning_rate": 0.000128616175568631,
"loss": 2.8138,
"step": 11850
},
{
"epoch": 0.88,
"grad_norm": 5.896446228027344,
"learning_rate": 0.0001284991163264986,
"loss": 3.3727,
"step": 11860
},
{
"epoch": 0.88,
"grad_norm": 10.954285621643066,
"learning_rate": 0.00012838201456476752,
"loss": 2.6517,
"step": 11870
},
{
"epoch": 0.88,
"grad_norm": 8.56272029876709,
"learning_rate": 0.00012826487045814914,
"loss": 3.3007,
"step": 11880
},
{
"epoch": 0.88,
"grad_norm": 4.866158485412598,
"learning_rate": 0.000128147684181418,
"loss": 2.8063,
"step": 11890
},
{
"epoch": 0.88,
"grad_norm": 4.69535493850708,
"learning_rate": 0.00012803045590941157,
"loss": 2.5951,
"step": 11900
},
{
"epoch": 0.88,
"grad_norm": 5.791335582733154,
"learning_rate": 0.00012791318581702998,
"loss": 2.9769,
"step": 11910
},
{
"epoch": 0.88,
"grad_norm": 10.670564651489258,
"learning_rate": 0.0001277958740792357,
"loss": 2.9634,
"step": 11920
},
{
"epoch": 0.88,
"grad_norm": 9.301645278930664,
"learning_rate": 0.00012767852087105353,
"loss": 2.6926,
"step": 11930
},
{
"epoch": 0.88,
"grad_norm": 5.858110427856445,
"learning_rate": 0.00012756112636756989,
"loss": 2.7778,
"step": 11940
},
{
"epoch": 0.88,
"grad_norm": 5.246842384338379,
"learning_rate": 0.00012744369074393292,
"loss": 2.693,
"step": 11950
},
{
"epoch": 0.88,
"grad_norm": 7.218985557556152,
"learning_rate": 0.00012732621417535213,
"loss": 2.9016,
"step": 11960
},
{
"epoch": 0.88,
"grad_norm": 5.314725399017334,
"learning_rate": 0.00012720869683709808,
"loss": 2.3808,
"step": 11970
},
{
"epoch": 0.88,
"grad_norm": 10.086341857910156,
"learning_rate": 0.0001270911389045022,
"loss": 2.9053,
"step": 11980
},
{
"epoch": 0.89,
"grad_norm": 4.592552661895752,
"learning_rate": 0.00012697354055295646,
"loss": 2.8766,
"step": 11990
},
{
"epoch": 0.89,
"grad_norm": 5.684471130371094,
"learning_rate": 0.00012685590195791308,
"loss": 3.0623,
"step": 12000
},
{
"epoch": 0.89,
"eval_loss": 2.904792308807373,
"eval_runtime": 1137.2933,
"eval_samples_per_second": 5.012,
"eval_steps_per_second": 5.012,
"step": 12000
},
{
"epoch": 0.89,
"grad_norm": 8.804437637329102,
"learning_rate": 0.00012673822329488442,
"loss": 3.2498,
"step": 12010
},
{
"epoch": 0.89,
"grad_norm": 8.336959838867188,
"learning_rate": 0.00012662050473944257,
"loss": 3.0255,
"step": 12020
},
{
"epoch": 0.89,
"grad_norm": 6.271881103515625,
"learning_rate": 0.00012650274646721914,
"loss": 2.5491,
"step": 12030
},
{
"epoch": 0.89,
"grad_norm": 5.716142654418945,
"learning_rate": 0.00012638494865390497,
"loss": 2.6117,
"step": 12040
},
{
"epoch": 0.89,
"grad_norm": 4.2103800773620605,
"learning_rate": 0.00012626711147524996,
"loss": 2.7738,
"step": 12050
},
{
"epoch": 0.89,
"grad_norm": 5.132654666900635,
"learning_rate": 0.00012614923510706269,
"loss": 2.7955,
"step": 12060
},
{
"epoch": 0.89,
"grad_norm": 6.06005859375,
"learning_rate": 0.00012603131972521023,
"loss": 3.0637,
"step": 12070
},
{
"epoch": 0.89,
"grad_norm": 5.199472427368164,
"learning_rate": 0.00012591336550561784,
"loss": 2.6771,
"step": 12080
},
{
"epoch": 0.89,
"grad_norm": 9.783750534057617,
"learning_rate": 0.0001257953726242687,
"loss": 3.0937,
"step": 12090
},
{
"epoch": 0.89,
"grad_norm": 7.431953430175781,
"learning_rate": 0.0001256773412572038,
"loss": 3.0264,
"step": 12100
},
{
"epoch": 0.89,
"grad_norm": 4.1111979484558105,
"learning_rate": 0.00012555927158052133,
"loss": 2.7148,
"step": 12110
},
{
"epoch": 0.9,
"grad_norm": 8.789063453674316,
"learning_rate": 0.00012544116377037688,
"loss": 3.0186,
"step": 12120
},
{
"epoch": 0.9,
"grad_norm": 6.812503337860107,
"learning_rate": 0.0001253230180029827,
"loss": 3.1154,
"step": 12130
},
{
"epoch": 0.9,
"grad_norm": 5.980816841125488,
"learning_rate": 0.00012520483445460786,
"loss": 2.864,
"step": 12140
},
{
"epoch": 0.9,
"grad_norm": 4.336915493011475,
"learning_rate": 0.00012508661330157774,
"loss": 2.7639,
"step": 12150
},
{
"epoch": 0.9,
"grad_norm": 4.914273738861084,
"learning_rate": 0.00012496835472027376,
"loss": 3.1715,
"step": 12160
},
{
"epoch": 0.9,
"grad_norm": 6.842685699462891,
"learning_rate": 0.0001248500588871333,
"loss": 3.0072,
"step": 12170
},
{
"epoch": 0.9,
"grad_norm": 9.586161613464355,
"learning_rate": 0.0001247317259786491,
"loss": 2.7299,
"step": 12180
},
{
"epoch": 0.9,
"grad_norm": 4.659690856933594,
"learning_rate": 0.0001246133561713695,
"loss": 2.7587,
"step": 12190
},
{
"epoch": 0.9,
"grad_norm": 5.354196548461914,
"learning_rate": 0.00012449494964189773,
"loss": 2.8163,
"step": 12200
},
{
"epoch": 0.9,
"eval_loss": 2.8869693279266357,
"eval_runtime": 1135.7184,
"eval_samples_per_second": 5.019,
"eval_steps_per_second": 5.019,
"step": 12200
},
{
"epoch": 0.9,
"grad_norm": 5.862390041351318,
"learning_rate": 0.00012437650656689183,
"loss": 3.0432,
"step": 12210
},
{
"epoch": 0.9,
"grad_norm": 6.009708404541016,
"learning_rate": 0.00012425802712306432,
"loss": 2.726,
"step": 12220
},
{
"epoch": 0.9,
"grad_norm": 7.788062572479248,
"learning_rate": 0.0001241395114871821,
"loss": 2.4635,
"step": 12230
},
{
"epoch": 0.9,
"grad_norm": 7.147851467132568,
"learning_rate": 0.00012402095983606593,
"loss": 2.8183,
"step": 12240
},
{
"epoch": 0.9,
"grad_norm": 4.320078372955322,
"learning_rate": 0.00012390237234659042,
"loss": 2.8154,
"step": 12250
},
{
"epoch": 0.91,
"grad_norm": 5.1208062171936035,
"learning_rate": 0.00012378374919568355,
"loss": 2.8344,
"step": 12260
},
{
"epoch": 0.91,
"grad_norm": 7.409857273101807,
"learning_rate": 0.0001236650905603266,
"loss": 2.8191,
"step": 12270
},
{
"epoch": 0.91,
"grad_norm": 4.807343006134033,
"learning_rate": 0.0001235463966175537,
"loss": 3.158,
"step": 12280
},
{
"epoch": 0.91,
"grad_norm": 7.55764627456665,
"learning_rate": 0.00012342766754445175,
"loss": 2.8936,
"step": 12290
},
{
"epoch": 0.91,
"grad_norm": 4.045491695404053,
"learning_rate": 0.00012330890351815998,
"loss": 2.925,
"step": 12300
},
{
"epoch": 0.91,
"grad_norm": 5.34037446975708,
"learning_rate": 0.00012319010471586984,
"loss": 3.0233,
"step": 12310
},
{
"epoch": 0.91,
"grad_norm": 5.470011234283447,
"learning_rate": 0.00012307127131482457,
"loss": 3.0561,
"step": 12320
},
{
"epoch": 0.91,
"grad_norm": 3.815101146697998,
"learning_rate": 0.00012295240349231918,
"loss": 2.4855,
"step": 12330
},
{
"epoch": 0.91,
"grad_norm": 5.214379787445068,
"learning_rate": 0.00012283350142569982,
"loss": 2.8585,
"step": 12340
},
{
"epoch": 0.91,
"grad_norm": 5.9461541175842285,
"learning_rate": 0.00012271456529236398,
"loss": 2.9515,
"step": 12350
},
{
"epoch": 0.91,
"grad_norm": 7.110766410827637,
"learning_rate": 0.00012259559526975978,
"loss": 3.0395,
"step": 12360
},
{
"epoch": 0.91,
"grad_norm": 5.845677375793457,
"learning_rate": 0.000122476591535386,
"loss": 2.7167,
"step": 12370
},
{
"epoch": 0.91,
"grad_norm": 5.942660808563232,
"learning_rate": 0.00012235755426679166,
"loss": 2.7902,
"step": 12380
},
{
"epoch": 0.92,
"grad_norm": 8.613824844360352,
"learning_rate": 0.00012223848364157592,
"loss": 2.8209,
"step": 12390
},
{
"epoch": 0.92,
"grad_norm": 9.6761474609375,
"learning_rate": 0.00012211937983738752,
"loss": 2.9448,
"step": 12400
},
{
"epoch": 0.92,
"eval_loss": 2.8819024562835693,
"eval_runtime": 1137.1197,
"eval_samples_per_second": 5.013,
"eval_steps_per_second": 5.013,
"step": 12400
},
{
"epoch": 0.92,
"grad_norm": 6.138139247894287,
"learning_rate": 0.00012200024303192488,
"loss": 2.7694,
"step": 12410
},
{
"epoch": 0.92,
"grad_norm": 5.604335308074951,
"learning_rate": 0.00012188107340293555,
"loss": 2.7826,
"step": 12420
},
{
"epoch": 0.92,
"grad_norm": 6.146926403045654,
"learning_rate": 0.00012176187112821611,
"loss": 2.725,
"step": 12430
},
{
"epoch": 0.92,
"grad_norm": 6.235223770141602,
"learning_rate": 0.00012164263638561184,
"loss": 3.0731,
"step": 12440
},
{
"epoch": 0.92,
"grad_norm": 8.349669456481934,
"learning_rate": 0.00012152336935301644,
"loss": 2.9744,
"step": 12450
},
{
"epoch": 0.92,
"grad_norm": 4.022830486297607,
"learning_rate": 0.00012140407020837177,
"loss": 2.8294,
"step": 12460
},
{
"epoch": 0.92,
"grad_norm": 4.709907054901123,
"learning_rate": 0.0001212847391296676,
"loss": 3.1276,
"step": 12470
},
{
"epoch": 0.92,
"grad_norm": 5.7833404541015625,
"learning_rate": 0.0001211653762949414,
"loss": 2.728,
"step": 12480
},
{
"epoch": 0.92,
"grad_norm": 5.090959072113037,
"learning_rate": 0.000121045981882278,
"loss": 2.7932,
"step": 12490
},
{
"epoch": 0.92,
"grad_norm": 6.4102654457092285,
"learning_rate": 0.00012092655606980931,
"loss": 3.067,
"step": 12500
},
{
"epoch": 0.92,
"grad_norm": 3.2918288707733154,
"learning_rate": 0.0001208070990357141,
"loss": 2.7084,
"step": 12510
},
{
"epoch": 0.92,
"grad_norm": 4.93757963180542,
"learning_rate": 0.00012068761095821772,
"loss": 2.7426,
"step": 12520
},
{
"epoch": 0.93,
"grad_norm": 4.599313259124756,
"learning_rate": 0.00012056809201559183,
"loss": 2.8432,
"step": 12530
},
{
"epoch": 0.93,
"grad_norm": 5.336906433105469,
"learning_rate": 0.00012044854238615417,
"loss": 2.6692,
"step": 12540
},
{
"epoch": 0.93,
"grad_norm": 6.711155891418457,
"learning_rate": 0.00012032896224826827,
"loss": 2.888,
"step": 12550
},
{
"epoch": 0.93,
"grad_norm": 4.558686256408691,
"learning_rate": 0.0001202093517803431,
"loss": 2.5864,
"step": 12560
},
{
"epoch": 0.93,
"grad_norm": 11.784100532531738,
"learning_rate": 0.00012008971116083299,
"loss": 2.9601,
"step": 12570
},
{
"epoch": 0.93,
"grad_norm": 6.828344345092773,
"learning_rate": 0.00011997004056823713,
"loss": 2.7396,
"step": 12580
},
{
"epoch": 0.93,
"grad_norm": 7.140361309051514,
"learning_rate": 0.00011985034018109956,
"loss": 2.654,
"step": 12590
},
{
"epoch": 0.93,
"grad_norm": 4.436099529266357,
"learning_rate": 0.00011973061017800866,
"loss": 2.6084,
"step": 12600
},
{
"epoch": 0.93,
"eval_loss": 2.8805291652679443,
"eval_runtime": 1136.5894,
"eval_samples_per_second": 5.015,
"eval_steps_per_second": 5.015,
"step": 12600
},
{
"epoch": 0.93,
"grad_norm": 7.968447208404541,
"learning_rate": 0.00011961085073759708,
"loss": 2.8732,
"step": 12610
},
{
"epoch": 0.93,
"grad_norm": 7.53559684753418,
"learning_rate": 0.00011949106203854136,
"loss": 2.8639,
"step": 12620
},
{
"epoch": 0.93,
"grad_norm": 5.95030403137207,
"learning_rate": 0.00011937124425956165,
"loss": 2.6471,
"step": 12630
},
{
"epoch": 0.93,
"grad_norm": 8.227439880371094,
"learning_rate": 0.00011925139757942156,
"loss": 3.1835,
"step": 12640
},
{
"epoch": 0.93,
"grad_norm": 3.934840679168701,
"learning_rate": 0.00011913152217692775,
"loss": 2.8887,
"step": 12650
},
{
"epoch": 0.94,
"grad_norm": 6.063136100769043,
"learning_rate": 0.00011901161823092979,
"loss": 3.0296,
"step": 12660
},
{
"epoch": 0.94,
"grad_norm": 9.32559871673584,
"learning_rate": 0.00011889168592031983,
"loss": 2.9871,
"step": 12670
},
{
"epoch": 0.94,
"grad_norm": 8.128053665161133,
"learning_rate": 0.00011877172542403228,
"loss": 2.8351,
"step": 12680
},
{
"epoch": 0.94,
"grad_norm": 9.050593376159668,
"learning_rate": 0.00011865173692104364,
"loss": 3.134,
"step": 12690
},
{
"epoch": 0.94,
"grad_norm": 4.40614128112793,
"learning_rate": 0.00011853172059037224,
"loss": 2.743,
"step": 12700
},
{
"epoch": 0.94,
"grad_norm": 4.777544975280762,
"learning_rate": 0.00011841167661107784,
"loss": 2.7829,
"step": 12710
},
{
"epoch": 0.94,
"grad_norm": 5.10864782333374,
"learning_rate": 0.00011829160516226153,
"loss": 2.8182,
"step": 12720
},
{
"epoch": 0.94,
"grad_norm": 3.8802578449249268,
"learning_rate": 0.00011817150642306531,
"loss": 2.7498,
"step": 12730
},
{
"epoch": 0.94,
"grad_norm": 9.293874740600586,
"learning_rate": 0.000118051380572672,
"loss": 3.1483,
"step": 12740
},
{
"epoch": 0.94,
"grad_norm": 6.355398654937744,
"learning_rate": 0.00011793122779030475,
"loss": 2.9183,
"step": 12750
},
{
"epoch": 0.94,
"grad_norm": 5.404056549072266,
"learning_rate": 0.00011781104825522695,
"loss": 2.761,
"step": 12760
},
{
"epoch": 0.94,
"grad_norm": 5.423532009124756,
"learning_rate": 0.00011769084214674189,
"loss": 3.0413,
"step": 12770
},
{
"epoch": 0.94,
"grad_norm": 5.6372199058532715,
"learning_rate": 0.00011757060964419258,
"loss": 2.9426,
"step": 12780
},
{
"epoch": 0.94,
"grad_norm": 8.241491317749023,
"learning_rate": 0.00011745035092696129,
"loss": 2.6652,
"step": 12790
},
{
"epoch": 0.95,
"grad_norm": 4.501625061035156,
"learning_rate": 0.00011733006617446947,
"loss": 2.7831,
"step": 12800
},
{
"epoch": 0.95,
"eval_loss": 2.8682727813720703,
"eval_runtime": 1135.344,
"eval_samples_per_second": 5.021,
"eval_steps_per_second": 5.021,
"step": 12800
},
{
"epoch": 0.95,
"grad_norm": 4.504491329193115,
"learning_rate": 0.0001172097555661774,
"loss": 2.839,
"step": 12810
},
{
"epoch": 0.95,
"grad_norm": 6.712375640869141,
"learning_rate": 0.00011708941928158393,
"loss": 2.8777,
"step": 12820
},
{
"epoch": 0.95,
"grad_norm": 5.017134189605713,
"learning_rate": 0.00011696905750022624,
"loss": 2.9566,
"step": 12830
},
{
"epoch": 0.95,
"grad_norm": 5.9697747230529785,
"learning_rate": 0.0001168486704016795,
"loss": 2.7984,
"step": 12840
},
{
"epoch": 0.95,
"grad_norm": 6.94989013671875,
"learning_rate": 0.00011672825816555672,
"loss": 2.8068,
"step": 12850
},
{
"epoch": 0.95,
"grad_norm": 4.509193420410156,
"learning_rate": 0.00011660782097150842,
"loss": 2.7397,
"step": 12860
},
{
"epoch": 0.95,
"grad_norm": 4.793773651123047,
"learning_rate": 0.00011648735899922221,
"loss": 3.0144,
"step": 12870
},
{
"epoch": 0.95,
"grad_norm": 5.6054792404174805,
"learning_rate": 0.00011636687242842286,
"loss": 2.7915,
"step": 12880
},
{
"epoch": 0.95,
"grad_norm": 3.980593204498291,
"learning_rate": 0.00011624636143887174,
"loss": 2.6483,
"step": 12890
},
{
"epoch": 0.95,
"grad_norm": 3.5728085041046143,
"learning_rate": 0.00011612582621036665,
"loss": 2.685,
"step": 12900
},
{
"epoch": 0.95,
"grad_norm": 10.15241527557373,
"learning_rate": 0.00011600526692274158,
"loss": 3.0063,
"step": 12910
},
{
"epoch": 0.95,
"grad_norm": 8.541998863220215,
"learning_rate": 0.00011588468375586638,
"loss": 3.0572,
"step": 12920
},
{
"epoch": 0.96,
"grad_norm": 7.413809299468994,
"learning_rate": 0.00011576407688964661,
"loss": 2.5417,
"step": 12930
},
{
"epoch": 0.96,
"grad_norm": 4.749917984008789,
"learning_rate": 0.0001156434465040231,
"loss": 2.694,
"step": 12940
},
{
"epoch": 0.96,
"grad_norm": 7.283080101013184,
"learning_rate": 0.0001155227927789718,
"loss": 2.8336,
"step": 12950
},
{
"epoch": 0.96,
"grad_norm": 4.781662464141846,
"learning_rate": 0.0001154021158945035,
"loss": 2.6173,
"step": 12960
},
{
"epoch": 0.96,
"grad_norm": 6.650935173034668,
"learning_rate": 0.00011528141603066347,
"loss": 2.8605,
"step": 12970
},
{
"epoch": 0.96,
"grad_norm": 6.372498035430908,
"learning_rate": 0.00011516069336753137,
"loss": 2.9947,
"step": 12980
},
{
"epoch": 0.96,
"grad_norm": 4.832932949066162,
"learning_rate": 0.00011505202362618099,
"loss": 2.7986,
"step": 12990
},
{
"epoch": 0.96,
"grad_norm": 6.009823799133301,
"learning_rate": 0.00011493125814063493,
"loss": 2.9087,
"step": 13000
},
{
"epoch": 0.96,
"eval_loss": 2.854703664779663,
"eval_runtime": 1138.6761,
"eval_samples_per_second": 5.006,
"eval_steps_per_second": 5.006,
"step": 13000
},
{
"epoch": 0.96,
"grad_norm": 7.64834451675415,
"learning_rate": 0.000114810470378219,
"loss": 2.7787,
"step": 13010
},
{
"epoch": 0.96,
"grad_norm": 6.409843921661377,
"learning_rate": 0.00011468966051914405,
"loss": 3.1866,
"step": 13020
},
{
"epoch": 0.96,
"grad_norm": 10.589412689208984,
"learning_rate": 0.00011456882874365376,
"loss": 2.9176,
"step": 13030
},
{
"epoch": 0.96,
"grad_norm": 5.453351974487305,
"learning_rate": 0.00011444797523202453,
"loss": 2.7734,
"step": 13040
},
{
"epoch": 0.96,
"grad_norm": 7.665455341339111,
"learning_rate": 0.00011432710016456525,
"loss": 3.082,
"step": 13050
},
{
"epoch": 0.96,
"grad_norm": 6.119209289550781,
"learning_rate": 0.00011420620372161688,
"loss": 2.931,
"step": 13060
},
{
"epoch": 0.97,
"grad_norm": 3.2885162830352783,
"learning_rate": 0.00011408528608355236,
"loss": 2.4232,
"step": 13070
},
{
"epoch": 0.97,
"grad_norm": 6.569406986236572,
"learning_rate": 0.0001139643474307762,
"loss": 2.7764,
"step": 13080
},
{
"epoch": 0.97,
"grad_norm": 6.823148727416992,
"learning_rate": 0.00011384338794372426,
"loss": 2.9104,
"step": 13090
},
{
"epoch": 0.97,
"grad_norm": 13.69426155090332,
"learning_rate": 0.00011372240780286349,
"loss": 2.8509,
"step": 13100
},
{
"epoch": 0.97,
"grad_norm": 5.851162433624268,
"learning_rate": 0.0001136014071886917,
"loss": 3.2161,
"step": 13110
},
{
"epoch": 0.97,
"grad_norm": 10.145004272460938,
"learning_rate": 0.0001134803862817372,
"loss": 2.968,
"step": 13120
},
{
"epoch": 0.97,
"grad_norm": 6.563608646392822,
"learning_rate": 0.00011335934526255858,
"loss": 2.7827,
"step": 13130
},
{
"epoch": 0.97,
"grad_norm": 4.670830726623535,
"learning_rate": 0.00011323828431174441,
"loss": 2.9768,
"step": 13140
},
{
"epoch": 0.97,
"grad_norm": 9.791251182556152,
"learning_rate": 0.00011311720360991306,
"loss": 3.0329,
"step": 13150
},
{
"epoch": 0.97,
"grad_norm": 4.974820137023926,
"learning_rate": 0.00011299610333771238,
"loss": 3.0875,
"step": 13160
},
{
"epoch": 0.97,
"grad_norm": 6.610928058624268,
"learning_rate": 0.00011287498367581928,
"loss": 2.8692,
"step": 13170
},
{
"epoch": 0.97,
"grad_norm": 6.3965911865234375,
"learning_rate": 0.00011275384480493976,
"loss": 3.0095,
"step": 13180
},
{
"epoch": 0.97,
"grad_norm": 7.755321979522705,
"learning_rate": 0.00011263268690580837,
"loss": 2.8522,
"step": 13190
},
{
"epoch": 0.98,
"grad_norm": 6.5569539070129395,
"learning_rate": 0.00011251151015918811,
"loss": 3.2111,
"step": 13200
},
{
"epoch": 0.98,
"eval_loss": 2.845184087753296,
"eval_runtime": 1136.0132,
"eval_samples_per_second": 5.018,
"eval_steps_per_second": 5.018,
"step": 13200
},
{
"epoch": 0.98,
"grad_norm": 5.710137367248535,
"learning_rate": 0.00011239031474587014,
"loss": 3.0802,
"step": 13210
},
{
"epoch": 0.98,
"grad_norm": 8.29128646850586,
"learning_rate": 0.0001122691008466733,
"loss": 3.2867,
"step": 13220
},
{
"epoch": 0.98,
"grad_norm": 5.905947208404541,
"learning_rate": 0.0001121478686424442,
"loss": 2.9385,
"step": 13230
},
{
"epoch": 0.98,
"grad_norm": 5.681633472442627,
"learning_rate": 0.00011202661831405668,
"loss": 2.8288,
"step": 13240
},
{
"epoch": 0.98,
"grad_norm": 6.492409706115723,
"learning_rate": 0.00011190535004241157,
"loss": 3.067,
"step": 13250
},
{
"epoch": 0.98,
"grad_norm": 9.93946647644043,
"learning_rate": 0.00011178406400843657,
"loss": 3.045,
"step": 13260
},
{
"epoch": 0.98,
"grad_norm": 8.157313346862793,
"learning_rate": 0.00011166276039308585,
"loss": 2.7287,
"step": 13270
},
{
"epoch": 0.98,
"grad_norm": 7.452297687530518,
"learning_rate": 0.00011154143937733974,
"loss": 2.6611,
"step": 13280
},
{
"epoch": 0.98,
"grad_norm": 4.351617336273193,
"learning_rate": 0.00011142010114220462,
"loss": 2.6843,
"step": 13290
},
{
"epoch": 0.98,
"grad_norm": 6.279202938079834,
"learning_rate": 0.00011129874586871251,
"loss": 2.8017,
"step": 13300
},
{
"epoch": 0.98,
"grad_norm": 6.140538215637207,
"learning_rate": 0.0001111773737379209,
"loss": 3.0927,
"step": 13310
},
{
"epoch": 0.98,
"grad_norm": 6.171574115753174,
"learning_rate": 0.00011105598493091235,
"loss": 2.8466,
"step": 13320
},
{
"epoch": 0.98,
"grad_norm": 6.33689022064209,
"learning_rate": 0.00011093457962879442,
"loss": 3.0005,
"step": 13330
},
{
"epoch": 0.99,
"grad_norm": 5.905701160430908,
"learning_rate": 0.00011081315801269911,
"loss": 2.6632,
"step": 13340
},
{
"epoch": 0.99,
"grad_norm": 4.605526924133301,
"learning_rate": 0.00011069172026378294,
"loss": 2.8175,
"step": 13350
},
{
"epoch": 0.99,
"grad_norm": 4.614380836486816,
"learning_rate": 0.00011057026656322636,
"loss": 2.9349,
"step": 13360
},
{
"epoch": 0.99,
"grad_norm": 4.65227746963501,
"learning_rate": 0.0001104487970922337,
"loss": 2.6209,
"step": 13370
},
{
"epoch": 0.99,
"grad_norm": 3.7751355171203613,
"learning_rate": 0.00011032731203203281,
"loss": 2.8983,
"step": 13380
},
{
"epoch": 0.99,
"grad_norm": 6.04954719543457,
"learning_rate": 0.00011020581156387474,
"loss": 2.9577,
"step": 13390
},
{
"epoch": 0.99,
"grad_norm": 7.594507217407227,
"learning_rate": 0.00011008429586903366,
"loss": 3.0118,
"step": 13400
},
{
"epoch": 0.99,
"eval_loss": 2.8346240520477295,
"eval_runtime": 1137.8991,
"eval_samples_per_second": 5.009,
"eval_steps_per_second": 5.009,
"step": 13400
},
{
"epoch": 0.99,
"grad_norm": 4.153735637664795,
"learning_rate": 0.00010996276512880626,
"loss": 2.5844,
"step": 13410
},
{
"epoch": 0.99,
"grad_norm": 9.582086563110352,
"learning_rate": 0.00010984121952451187,
"loss": 2.7306,
"step": 13420
},
{
"epoch": 0.99,
"grad_norm": 7.080514907836914,
"learning_rate": 0.00010971965923749188,
"loss": 3.1918,
"step": 13430
},
{
"epoch": 0.99,
"grad_norm": 6.384931564331055,
"learning_rate": 0.00010959808444910957,
"loss": 2.8799,
"step": 13440
},
{
"epoch": 0.99,
"grad_norm": 8.869901657104492,
"learning_rate": 0.00010947649534075005,
"loss": 2.9436,
"step": 13450
},
{
"epoch": 0.99,
"grad_norm": 6.180183410644531,
"learning_rate": 0.00010935489209381947,
"loss": 2.6373,
"step": 13460
},
{
"epoch": 1.0,
"grad_norm": 5.366621017456055,
"learning_rate": 0.00010923327488974537,
"loss": 2.9848,
"step": 13470
},
{
"epoch": 1.0,
"grad_norm": 10.306673049926758,
"learning_rate": 0.00010911164390997596,
"loss": 3.0342,
"step": 13480
},
{
"epoch": 1.0,
"grad_norm": 8.145923614501953,
"learning_rate": 0.00010898999933598004,
"loss": 2.708,
"step": 13490
},
{
"epoch": 1.0,
"grad_norm": 7.033836364746094,
"learning_rate": 0.00010886834134924675,
"loss": 2.7688,
"step": 13500
},
{
"epoch": 1.0,
"grad_norm": 5.030039310455322,
"learning_rate": 0.00010874667013128508,
"loss": 2.508,
"step": 13510
},
{
"epoch": 1.0,
"grad_norm": 6.092257022857666,
"learning_rate": 0.00010862498586362395,
"loss": 2.7908,
"step": 13520
},
{
"epoch": 1.0,
"grad_norm": 8.369385719299316,
"learning_rate": 0.00010850328872781161,
"loss": 2.6625,
"step": 13530
},
{
"epoch": 1.0,
"grad_norm": 6.076193332672119,
"learning_rate": 0.00010838157890541558,
"loss": 3.0781,
"step": 13540
},
{
"epoch": 1.0,
"grad_norm": 5.35760498046875,
"learning_rate": 0.0001082598565780223,
"loss": 2.7686,
"step": 13550
},
{
"epoch": 1.0,
"grad_norm": 6.823988437652588,
"learning_rate": 0.00010813812192723686,
"loss": 2.7569,
"step": 13560
},
{
"epoch": 1.0,
"grad_norm": 4.118238925933838,
"learning_rate": 0.00010801637513468272,
"loss": 2.7056,
"step": 13570
},
{
"epoch": 1.0,
"grad_norm": 6.218942165374756,
"learning_rate": 0.00010789461638200146,
"loss": 2.8498,
"step": 13580
},
{
"epoch": 1.0,
"grad_norm": 4.8708086013793945,
"learning_rate": 0.00010777284585085256,
"loss": 2.5863,
"step": 13590
},
{
"epoch": 1.0,
"grad_norm": 6.01025915145874,
"learning_rate": 0.00010765106372291296,
"loss": 2.6526,
"step": 13600
},
{
"epoch": 1.0,
"eval_loss": 2.845993757247925,
"eval_runtime": 1136.2008,
"eval_samples_per_second": 5.017,
"eval_steps_per_second": 5.017,
"step": 13600
},
{
"epoch": 1.01,
"grad_norm": 4.704145431518555,
"learning_rate": 0.000107529270179877,
"loss": 2.4644,
"step": 13610
},
{
"epoch": 1.01,
"grad_norm": 6.328924655914307,
"learning_rate": 0.00010740746540345603,
"loss": 2.6654,
"step": 13620
},
{
"epoch": 1.01,
"grad_norm": 4.664566516876221,
"learning_rate": 0.00010728564957537815,
"loss": 2.9038,
"step": 13630
},
{
"epoch": 1.01,
"grad_norm": 4.666599273681641,
"learning_rate": 0.00010716382287738791,
"loss": 2.5435,
"step": 13640
},
{
"epoch": 1.01,
"grad_norm": 4.4863176345825195,
"learning_rate": 0.00010704198549124614,
"loss": 2.5579,
"step": 13650
},
{
"epoch": 1.01,
"grad_norm": 6.503231048583984,
"learning_rate": 0.00010692013759872961,
"loss": 2.7717,
"step": 13660
},
{
"epoch": 1.01,
"grad_norm": 6.730213642120361,
"learning_rate": 0.0001067982793816307,
"loss": 2.8792,
"step": 13670
},
{
"epoch": 1.01,
"grad_norm": 4.679954528808594,
"learning_rate": 0.00010667641102175724,
"loss": 2.6506,
"step": 13680
},
{
"epoch": 1.01,
"grad_norm": 7.457332611083984,
"learning_rate": 0.00010655453270093227,
"loss": 2.8192,
"step": 13690
},
{
"epoch": 1.01,
"grad_norm": 6.174564361572266,
"learning_rate": 0.00010643264460099351,
"loss": 2.859,
"step": 13700
},
{
"epoch": 1.01,
"grad_norm": 4.672980785369873,
"learning_rate": 0.00010631074690379348,
"loss": 2.8721,
"step": 13710
},
{
"epoch": 1.01,
"grad_norm": 4.928731441497803,
"learning_rate": 0.0001061888397911988,
"loss": 2.537,
"step": 13720
},
{
"epoch": 1.01,
"grad_norm": 3.9560954570770264,
"learning_rate": 0.00010606692344509034,
"loss": 2.4611,
"step": 13730
},
{
"epoch": 1.01,
"grad_norm": 5.649095058441162,
"learning_rate": 0.00010594499804736262,
"loss": 2.6976,
"step": 13740
},
{
"epoch": 1.02,
"grad_norm": 8.706733703613281,
"learning_rate": 0.00010582306377992368,
"loss": 2.4591,
"step": 13750
},
{
"epoch": 1.02,
"grad_norm": 5.894099235534668,
"learning_rate": 0.00010570112082469485,
"loss": 2.6545,
"step": 13760
},
{
"epoch": 1.02,
"grad_norm": 6.439949035644531,
"learning_rate": 0.00010557916936361039,
"loss": 2.6755,
"step": 13770
},
{
"epoch": 1.02,
"grad_norm": 6.489779949188232,
"learning_rate": 0.0001054572095786172,
"loss": 2.4617,
"step": 13780
},
{
"epoch": 1.02,
"grad_norm": 7.473913669586182,
"learning_rate": 0.0001053352416516747,
"loss": 2.6437,
"step": 13790
},
{
"epoch": 1.02,
"grad_norm": 4.835104942321777,
"learning_rate": 0.00010521326576475434,
"loss": 2.6816,
"step": 13800
},
{
"epoch": 1.02,
"eval_loss": 2.8399221897125244,
"eval_runtime": 1134.199,
"eval_samples_per_second": 5.026,
"eval_steps_per_second": 5.026,
"step": 13800
},
{
"epoch": 1.02,
"grad_norm": 10.159151077270508,
"learning_rate": 0.00010509128209983956,
"loss": 2.7679,
"step": 13810
},
{
"epoch": 1.02,
"grad_norm": 5.414875507354736,
"learning_rate": 0.00010496929083892535,
"loss": 2.8924,
"step": 13820
},
{
"epoch": 1.02,
"grad_norm": 7.980355262756348,
"learning_rate": 0.00010484729216401803,
"loss": 2.6418,
"step": 13830
},
{
"epoch": 1.02,
"grad_norm": 5.9121413230896,
"learning_rate": 0.00010472528625713498,
"loss": 2.4819,
"step": 13840
},
{
"epoch": 1.02,
"grad_norm": 3.6737613677978516,
"learning_rate": 0.00010460327330030437,
"loss": 2.557,
"step": 13850
},
{
"epoch": 1.02,
"grad_norm": 6.475584506988525,
"learning_rate": 0.00010448125347556488,
"loss": 2.7248,
"step": 13860
},
{
"epoch": 1.02,
"grad_norm": 3.3596487045288086,
"learning_rate": 0.00010435922696496552,
"loss": 2.5047,
"step": 13870
},
{
"epoch": 1.03,
"grad_norm": 5.599161624908447,
"learning_rate": 0.00010423719395056515,
"loss": 2.61,
"step": 13880
},
{
"epoch": 1.03,
"grad_norm": 6.242649555206299,
"learning_rate": 0.00010411515461443237,
"loss": 2.6723,
"step": 13890
},
{
"epoch": 1.03,
"grad_norm": 7.319644927978516,
"learning_rate": 0.00010399310913864532,
"loss": 2.7631,
"step": 13900
},
{
"epoch": 1.03,
"grad_norm": 5.141343116760254,
"learning_rate": 0.00010387105770529113,
"loss": 2.7829,
"step": 13910
},
{
"epoch": 1.03,
"grad_norm": 5.021617889404297,
"learning_rate": 0.00010374900049646592,
"loss": 2.5408,
"step": 13920
},
{
"epoch": 1.03,
"grad_norm": 7.208983421325684,
"learning_rate": 0.00010362693769427446,
"loss": 2.8004,
"step": 13930
},
{
"epoch": 1.03,
"grad_norm": 5.373823642730713,
"learning_rate": 0.00010350486948082972,
"loss": 2.5771,
"step": 13940
},
{
"epoch": 1.03,
"grad_norm": 5.2942118644714355,
"learning_rate": 0.00010338279603825294,
"loss": 2.62,
"step": 13950
},
{
"epoch": 1.03,
"grad_norm": 6.039937496185303,
"learning_rate": 0.00010326071754867294,
"loss": 2.6654,
"step": 13960
},
{
"epoch": 1.03,
"grad_norm": 4.724233627319336,
"learning_rate": 0.00010313863419422631,
"loss": 2.5275,
"step": 13970
},
{
"epoch": 1.03,
"grad_norm": 6.356924533843994,
"learning_rate": 0.00010301654615705669,
"loss": 2.7036,
"step": 13980
},
{
"epoch": 1.03,
"grad_norm": 6.196333408355713,
"learning_rate": 0.00010289445361931482,
"loss": 2.5768,
"step": 13990
},
{
"epoch": 1.03,
"grad_norm": 8.118714332580566,
"learning_rate": 0.00010277235676315817,
"loss": 2.3845,
"step": 14000
},
{
"epoch": 1.03,
"eval_loss": 2.846597909927368,
"eval_runtime": 1140.6527,
"eval_samples_per_second": 4.997,
"eval_steps_per_second": 4.997,
"step": 14000
},
{
"epoch": 1.03,
"grad_norm": 5.258535861968994,
"learning_rate": 0.00010265025577075054,
"loss": 2.8392,
"step": 14010
},
{
"epoch": 1.04,
"grad_norm": 5.9286885261535645,
"learning_rate": 0.00010252815082426199,
"loss": 2.7799,
"step": 14020
},
{
"epoch": 1.04,
"grad_norm": 5.152517318725586,
"learning_rate": 0.00010240604210586848,
"loss": 2.4615,
"step": 14030
},
{
"epoch": 1.04,
"grad_norm": 4.207879543304443,
"learning_rate": 0.00010228392979775159,
"loss": 2.777,
"step": 14040
},
{
"epoch": 1.04,
"grad_norm": 6.9504475593566895,
"learning_rate": 0.00010216181408209817,
"loss": 2.6854,
"step": 14050
},
{
"epoch": 1.04,
"grad_norm": 6.830455780029297,
"learning_rate": 0.00010203969514110033,
"loss": 2.6638,
"step": 14060
},
{
"epoch": 1.04,
"grad_norm": 3.3591535091400146,
"learning_rate": 0.00010191757315695482,
"loss": 2.6079,
"step": 14070
},
{
"epoch": 1.04,
"grad_norm": 7.07043981552124,
"learning_rate": 0.00010179544831186305,
"loss": 2.7527,
"step": 14080
},
{
"epoch": 1.04,
"grad_norm": 3.6287598609924316,
"learning_rate": 0.0001016733207880306,
"loss": 2.733,
"step": 14090
},
{
"epoch": 1.04,
"grad_norm": 6.620267868041992,
"learning_rate": 0.00010155119076766708,
"loss": 2.6319,
"step": 14100
},
{
"epoch": 1.04,
"grad_norm": 5.5068793296813965,
"learning_rate": 0.00010142905843298592,
"loss": 2.7411,
"step": 14110
},
{
"epoch": 1.04,
"grad_norm": 5.742343902587891,
"learning_rate": 0.00010130692396620388,
"loss": 2.6599,
"step": 14120
},
{
"epoch": 1.04,
"grad_norm": 3.2871851921081543,
"learning_rate": 0.00010118478754954091,
"loss": 2.4312,
"step": 14130
},
{
"epoch": 1.04,
"grad_norm": 4.894622802734375,
"learning_rate": 0.00010106264936521996,
"loss": 2.749,
"step": 14140
},
{
"epoch": 1.05,
"grad_norm": 6.887192249298096,
"learning_rate": 0.0001009405095954665,
"loss": 2.5452,
"step": 14150
},
{
"epoch": 1.05,
"grad_norm": 7.4985175132751465,
"learning_rate": 0.00010081836842250851,
"loss": 2.9491,
"step": 14160
},
{
"epoch": 1.05,
"grad_norm": 7.017559051513672,
"learning_rate": 0.00010069622602857589,
"loss": 2.6417,
"step": 14170
},
{
"epoch": 1.05,
"grad_norm": 6.0003437995910645,
"learning_rate": 0.00010057408259590049,
"loss": 2.4899,
"step": 14180
},
{
"epoch": 1.05,
"grad_norm": 4.769591808319092,
"learning_rate": 0.00010045193830671568,
"loss": 2.5924,
"step": 14190
},
{
"epoch": 1.05,
"grad_norm": 4.747857093811035,
"learning_rate": 0.00010032979334325607,
"loss": 2.5493,
"step": 14200
},
{
"epoch": 1.05,
"eval_loss": 2.8418214321136475,
"eval_runtime": 1136.8707,
"eval_samples_per_second": 5.014,
"eval_steps_per_second": 5.014,
"step": 14200
},
{
"epoch": 1.05,
"grad_norm": 5.269603729248047,
"learning_rate": 0.00010020764788775736,
"loss": 2.6107,
"step": 14210
},
{
"epoch": 1.05,
"grad_norm": 5.822869777679443,
"learning_rate": 0.00010008550212245587,
"loss": 2.7305,
"step": 14220
},
{
"epoch": 1.05,
"grad_norm": 4.800507545471191,
"learning_rate": 9.996335622958848e-05,
"loss": 2.6997,
"step": 14230
},
{
"epoch": 1.05,
"grad_norm": 4.758016586303711,
"learning_rate": 9.984121039139218e-05,
"loss": 2.6385,
"step": 14240
},
{
"epoch": 1.05,
"grad_norm": 4.214052200317383,
"learning_rate": 9.971906479010394e-05,
"loss": 2.7877,
"step": 14250
},
{
"epoch": 1.05,
"grad_norm": 5.076603889465332,
"learning_rate": 9.959691960796036e-05,
"loss": 2.5551,
"step": 14260
},
{
"epoch": 1.05,
"grad_norm": 6.1883416175842285,
"learning_rate": 9.947477502719745e-05,
"loss": 2.7586,
"step": 14270
},
{
"epoch": 1.05,
"grad_norm": 3.745725154876709,
"learning_rate": 9.93526312300502e-05,
"loss": 2.6555,
"step": 14280
},
{
"epoch": 1.06,
"grad_norm": 4.745731830596924,
"learning_rate": 9.923048839875258e-05,
"loss": 2.7364,
"step": 14290
},
{
"epoch": 1.06,
"grad_norm": 4.47914981842041,
"learning_rate": 9.910834671553699e-05,
"loss": 2.6527,
"step": 14300
},
{
"epoch": 1.06,
"grad_norm": 6.2111897468566895,
"learning_rate": 9.898620636263426e-05,
"loss": 2.8341,
"step": 14310
},
{
"epoch": 1.06,
"grad_norm": 14.119166374206543,
"learning_rate": 9.886406752227313e-05,
"loss": 2.578,
"step": 14320
},
{
"epoch": 1.06,
"grad_norm": 5.5367889404296875,
"learning_rate": 9.874193037668006e-05,
"loss": 2.779,
"step": 14330
},
{
"epoch": 1.06,
"grad_norm": 4.672638416290283,
"learning_rate": 9.861979510807907e-05,
"loss": 2.8918,
"step": 14340
},
{
"epoch": 1.06,
"grad_norm": 6.862904071807861,
"learning_rate": 9.849766189869134e-05,
"loss": 2.6632,
"step": 14350
},
{
"epoch": 1.06,
"grad_norm": 3.7714316844940186,
"learning_rate": 9.837553093073494e-05,
"loss": 2.5183,
"step": 14360
},
{
"epoch": 1.06,
"grad_norm": 7.480538845062256,
"learning_rate": 9.825340238642473e-05,
"loss": 2.6456,
"step": 14370
},
{
"epoch": 1.06,
"grad_norm": 5.1482834815979,
"learning_rate": 9.813127644797177e-05,
"loss": 2.4604,
"step": 14380
},
{
"epoch": 1.06,
"grad_norm": 5.069243431091309,
"learning_rate": 9.800915329758333e-05,
"loss": 2.6392,
"step": 14390
},
{
"epoch": 1.06,
"grad_norm": 6.216825485229492,
"learning_rate": 9.788703311746254e-05,
"loss": 2.6742,
"step": 14400
},
{
"epoch": 1.06,
"eval_loss": 2.8299241065979004,
"eval_runtime": 1135.6729,
"eval_samples_per_second": 5.019,
"eval_steps_per_second": 5.019,
"step": 14400
},
{
"epoch": 1.06,
"grad_norm": 7.684316635131836,
"learning_rate": 9.776491608980808e-05,
"loss": 2.8018,
"step": 14410
},
{
"epoch": 1.07,
"grad_norm": 4.665287971496582,
"learning_rate": 9.764280239681385e-05,
"loss": 2.7907,
"step": 14420
},
{
"epoch": 1.07,
"grad_norm": 4.080597877502441,
"learning_rate": 9.752069222066889e-05,
"loss": 2.6134,
"step": 14430
},
{
"epoch": 1.07,
"grad_norm": 4.095142841339111,
"learning_rate": 9.739858574355691e-05,
"loss": 2.6614,
"step": 14440
},
{
"epoch": 1.07,
"grad_norm": 6.944389820098877,
"learning_rate": 9.727648314765617e-05,
"loss": 2.7235,
"step": 14450
},
{
"epoch": 1.07,
"grad_norm": 10.006865501403809,
"learning_rate": 9.715438461513912e-05,
"loss": 2.7576,
"step": 14460
},
{
"epoch": 1.07,
"grad_norm": 5.380651473999023,
"learning_rate": 9.703229032817207e-05,
"loss": 2.6551,
"step": 14470
},
{
"epoch": 1.07,
"grad_norm": 4.433184623718262,
"learning_rate": 9.691020046891509e-05,
"loss": 2.5386,
"step": 14480
},
{
"epoch": 1.07,
"grad_norm": 5.731329441070557,
"learning_rate": 9.678811521952161e-05,
"loss": 2.6239,
"step": 14490
},
{
"epoch": 1.07,
"grad_norm": 4.7876458168029785,
"learning_rate": 9.666603476213818e-05,
"loss": 2.5553,
"step": 14500
},
{
"epoch": 1.07,
"grad_norm": 15.640872955322266,
"learning_rate": 9.654395927890422e-05,
"loss": 2.6181,
"step": 14510
},
{
"epoch": 1.07,
"grad_norm": 8.363943099975586,
"learning_rate": 9.642188895195167e-05,
"loss": 2.7827,
"step": 14520
},
{
"epoch": 1.07,
"grad_norm": 11.327077865600586,
"learning_rate": 9.629982396340488e-05,
"loss": 2.5366,
"step": 14530
},
{
"epoch": 1.07,
"grad_norm": 6.818722248077393,
"learning_rate": 9.617776449538011e-05,
"loss": 2.7139,
"step": 14540
},
{
"epoch": 1.07,
"grad_norm": 5.882566928863525,
"learning_rate": 9.60557107299855e-05,
"loss": 2.5054,
"step": 14550
},
{
"epoch": 1.08,
"grad_norm": 7.939090251922607,
"learning_rate": 9.593366284932064e-05,
"loss": 2.7289,
"step": 14560
},
{
"epoch": 1.08,
"grad_norm": 11.2249755859375,
"learning_rate": 9.581162103547627e-05,
"loss": 2.8788,
"step": 14570
},
{
"epoch": 1.08,
"grad_norm": 4.7646002769470215,
"learning_rate": 9.568958547053417e-05,
"loss": 2.604,
"step": 14580
},
{
"epoch": 1.08,
"grad_norm": 6.1333513259887695,
"learning_rate": 9.556755633656676e-05,
"loss": 2.6,
"step": 14590
},
{
"epoch": 1.08,
"grad_norm": 5.915955543518066,
"learning_rate": 9.544553381563691e-05,
"loss": 2.6433,
"step": 14600
},
{
"epoch": 1.08,
"eval_loss": 2.822645902633667,
"eval_runtime": 1137.1119,
"eval_samples_per_second": 5.013,
"eval_steps_per_second": 5.013,
"step": 14600
},
{
"epoch": 1.08,
"grad_norm": 9.068519592285156,
"learning_rate": 9.532351808979754e-05,
"loss": 2.8102,
"step": 14610
},
{
"epoch": 1.08,
"grad_norm": 6.155020713806152,
"learning_rate": 9.520150934109146e-05,
"loss": 2.5665,
"step": 14620
},
{
"epoch": 1.08,
"grad_norm": 7.280089378356934,
"learning_rate": 9.507950775155116e-05,
"loss": 2.7537,
"step": 14630
},
{
"epoch": 1.08,
"grad_norm": 5.696301460266113,
"learning_rate": 9.495751350319829e-05,
"loss": 2.8477,
"step": 14640
},
{
"epoch": 1.08,
"grad_norm": 6.453228950500488,
"learning_rate": 9.483552677804372e-05,
"loss": 2.7048,
"step": 14650
},
{
"epoch": 1.08,
"grad_norm": 4.739017009735107,
"learning_rate": 9.471354775808695e-05,
"loss": 2.7032,
"step": 14660
},
{
"epoch": 1.08,
"grad_norm": 9.007843017578125,
"learning_rate": 9.459157662531603e-05,
"loss": 2.8116,
"step": 14670
},
{
"epoch": 1.08,
"grad_norm": 5.5827131271362305,
"learning_rate": 9.446961356170731e-05,
"loss": 2.8541,
"step": 14680
},
{
"epoch": 1.09,
"grad_norm": 4.878897190093994,
"learning_rate": 9.4347658749225e-05,
"loss": 2.739,
"step": 14690
},
{
"epoch": 1.09,
"grad_norm": 5.005230903625488,
"learning_rate": 9.422571236982113e-05,
"loss": 2.5947,
"step": 14700
},
{
"epoch": 1.09,
"grad_norm": 5.4663591384887695,
"learning_rate": 9.410377460543493e-05,
"loss": 2.5272,
"step": 14710
},
{
"epoch": 1.09,
"grad_norm": 4.379180908203125,
"learning_rate": 9.398184563799301e-05,
"loss": 2.4606,
"step": 14720
},
{
"epoch": 1.09,
"grad_norm": 5.044705390930176,
"learning_rate": 9.385992564940871e-05,
"loss": 2.5472,
"step": 14730
},
{
"epoch": 1.09,
"grad_norm": 2.9766154289245605,
"learning_rate": 9.373801482158206e-05,
"loss": 2.559,
"step": 14740
},
{
"epoch": 1.09,
"grad_norm": 6.4899396896362305,
"learning_rate": 9.36161133363994e-05,
"loss": 2.7749,
"step": 14750
},
{
"epoch": 1.09,
"grad_norm": 5.2543439865112305,
"learning_rate": 9.349422137573302e-05,
"loss": 2.5608,
"step": 14760
},
{
"epoch": 1.09,
"grad_norm": 4.9640703201293945,
"learning_rate": 9.337233912144116e-05,
"loss": 2.6551,
"step": 14770
},
{
"epoch": 1.09,
"grad_norm": 4.78398323059082,
"learning_rate": 9.32504667553675e-05,
"loss": 2.5717,
"step": 14780
},
{
"epoch": 1.09,
"grad_norm": 12.001642227172852,
"learning_rate": 9.312860445934101e-05,
"loss": 2.4541,
"step": 14790
},
{
"epoch": 1.09,
"grad_norm": 7.847120761871338,
"learning_rate": 9.300675241517557e-05,
"loss": 2.6015,
"step": 14800
},
{
"epoch": 1.09,
"eval_loss": 2.8366076946258545,
"eval_runtime": 1134.7417,
"eval_samples_per_second": 5.023,
"eval_steps_per_second": 5.023,
"step": 14800
},
{
"epoch": 1.09,
"grad_norm": 6.1443986892700195,
"learning_rate": 9.288491080466978e-05,
"loss": 2.5734,
"step": 14810
},
{
"epoch": 1.09,
"grad_norm": 8.345760345458984,
"learning_rate": 9.276307980960674e-05,
"loss": 2.7371,
"step": 14820
},
{
"epoch": 1.1,
"grad_norm": 6.313103199005127,
"learning_rate": 9.264125961175363e-05,
"loss": 2.9526,
"step": 14830
},
{
"epoch": 1.1,
"grad_norm": 6.4391350746154785,
"learning_rate": 9.251945039286161e-05,
"loss": 2.5819,
"step": 14840
},
{
"epoch": 1.1,
"grad_norm": 4.635354042053223,
"learning_rate": 9.239765233466535e-05,
"loss": 2.8905,
"step": 14850
},
{
"epoch": 1.1,
"grad_norm": 4.282767295837402,
"learning_rate": 9.227586561888292e-05,
"loss": 2.4121,
"step": 14860
},
{
"epoch": 1.1,
"grad_norm": 5.246340274810791,
"learning_rate": 9.215409042721552e-05,
"loss": 2.8323,
"step": 14870
},
{
"epoch": 1.1,
"grad_norm": 6.242234230041504,
"learning_rate": 9.203232694134706e-05,
"loss": 2.7003,
"step": 14880
},
{
"epoch": 1.1,
"grad_norm": 6.143115997314453,
"learning_rate": 9.191057534294411e-05,
"loss": 2.3707,
"step": 14890
},
{
"epoch": 1.1,
"grad_norm": 6.330958366394043,
"learning_rate": 9.178883581365534e-05,
"loss": 2.4944,
"step": 14900
},
{
"epoch": 1.1,
"grad_norm": 6.2139482498168945,
"learning_rate": 9.166710853511155e-05,
"loss": 2.6611,
"step": 14910
},
{
"epoch": 1.1,
"grad_norm": 4.927261829376221,
"learning_rate": 9.15453936889252e-05,
"loss": 2.8179,
"step": 14920
},
{
"epoch": 1.1,
"grad_norm": 4.508125305175781,
"learning_rate": 9.142369145669021e-05,
"loss": 2.6895,
"step": 14930
},
{
"epoch": 1.1,
"grad_norm": 7.7817230224609375,
"learning_rate": 9.130200201998173e-05,
"loss": 2.6323,
"step": 14940
},
{
"epoch": 1.1,
"grad_norm": 6.731665134429932,
"learning_rate": 9.118032556035572e-05,
"loss": 2.6161,
"step": 14950
},
{
"epoch": 1.11,
"grad_norm": 4.72010612487793,
"learning_rate": 9.105866225934885e-05,
"loss": 2.825,
"step": 14960
},
{
"epoch": 1.11,
"grad_norm": 6.487375736236572,
"learning_rate": 9.093701229847817e-05,
"loss": 2.3883,
"step": 14970
},
{
"epoch": 1.11,
"grad_norm": 5.321608066558838,
"learning_rate": 9.081537585924079e-05,
"loss": 2.7388,
"step": 14980
},
{
"epoch": 1.11,
"grad_norm": 5.753255367279053,
"learning_rate": 9.069375312311362e-05,
"loss": 2.7161,
"step": 14990
},
{
"epoch": 1.11,
"grad_norm": 5.2197265625,
"learning_rate": 9.057214427155319e-05,
"loss": 2.6866,
"step": 15000
},
{
"epoch": 1.11,
"eval_loss": 2.821988344192505,
"eval_runtime": 1135.7076,
"eval_samples_per_second": 5.019,
"eval_steps_per_second": 5.019,
"step": 15000
},
{
"epoch": 1.11,
"grad_norm": 4.719414710998535,
"learning_rate": 9.045054948599525e-05,
"loss": 2.5983,
"step": 15010
},
{
"epoch": 1.11,
"grad_norm": 6.498874664306641,
"learning_rate": 9.032896894785464e-05,
"loss": 2.8949,
"step": 15020
},
{
"epoch": 1.11,
"grad_norm": 5.581775188446045,
"learning_rate": 9.020740283852495e-05,
"loss": 2.5969,
"step": 15030
},
{
"epoch": 1.11,
"grad_norm": 6.098051071166992,
"learning_rate": 9.00858513393781e-05,
"loss": 2.5028,
"step": 15040
},
{
"epoch": 1.11,
"grad_norm": 7.322878837585449,
"learning_rate": 8.996431463176434e-05,
"loss": 2.5779,
"step": 15050
},
{
"epoch": 1.11,
"grad_norm": 5.357008934020996,
"learning_rate": 8.984279289701184e-05,
"loss": 2.6543,
"step": 15060
},
{
"epoch": 1.11,
"grad_norm": 3.7159807682037354,
"learning_rate": 8.97212863164264e-05,
"loss": 2.6203,
"step": 15070
},
{
"epoch": 1.11,
"grad_norm": 5.603279113769531,
"learning_rate": 8.959979507129124e-05,
"loss": 2.5972,
"step": 15080
},
{
"epoch": 1.11,
"grad_norm": 6.878233432769775,
"learning_rate": 8.947831934286664e-05,
"loss": 2.7696,
"step": 15090
},
{
"epoch": 1.12,
"grad_norm": 6.096282958984375,
"learning_rate": 8.935685931238979e-05,
"loss": 2.6345,
"step": 15100
},
{
"epoch": 1.12,
"grad_norm": 7.228655815124512,
"learning_rate": 8.923541516107445e-05,
"loss": 2.7248,
"step": 15110
},
{
"epoch": 1.12,
"grad_norm": 3.705758810043335,
"learning_rate": 8.911398707011065e-05,
"loss": 2.6374,
"step": 15120
},
{
"epoch": 1.12,
"grad_norm": 4.940635681152344,
"learning_rate": 8.899257522066455e-05,
"loss": 2.6978,
"step": 15130
},
{
"epoch": 1.12,
"grad_norm": 6.699410438537598,
"learning_rate": 8.887117979387797e-05,
"loss": 2.9187,
"step": 15140
},
{
"epoch": 1.12,
"grad_norm": 5.017121315002441,
"learning_rate": 8.874980097086826e-05,
"loss": 2.6659,
"step": 15150
},
{
"epoch": 1.12,
"grad_norm": 9.299418449401855,
"learning_rate": 8.862843893272805e-05,
"loss": 2.4321,
"step": 15160
},
{
"epoch": 1.12,
"grad_norm": 3.4937360286712646,
"learning_rate": 8.850709386052485e-05,
"loss": 2.6002,
"step": 15170
},
{
"epoch": 1.12,
"grad_norm": 5.106987476348877,
"learning_rate": 8.838576593530096e-05,
"loss": 2.9664,
"step": 15180
},
{
"epoch": 1.12,
"grad_norm": 5.51921272277832,
"learning_rate": 8.826445533807297e-05,
"loss": 2.6186,
"step": 15190
},
{
"epoch": 1.12,
"grad_norm": 8.393594741821289,
"learning_rate": 8.814316224983169e-05,
"loss": 2.7938,
"step": 15200
},
{
"epoch": 1.12,
"eval_loss": 2.81386661529541,
"eval_runtime": 1134.4546,
"eval_samples_per_second": 5.024,
"eval_steps_per_second": 5.024,
"step": 15200
},
{
"epoch": 1.12,
"grad_norm": 6.8599371910095215,
"learning_rate": 8.802188685154183e-05,
"loss": 2.7784,
"step": 15210
},
{
"epoch": 1.12,
"grad_norm": 6.077823162078857,
"learning_rate": 8.790062932414169e-05,
"loss": 2.9943,
"step": 15220
},
{
"epoch": 1.13,
"grad_norm": 6.662342071533203,
"learning_rate": 8.777938984854281e-05,
"loss": 2.432,
"step": 15230
},
{
"epoch": 1.13,
"grad_norm": 3.6993889808654785,
"learning_rate": 8.765816860562998e-05,
"loss": 2.4492,
"step": 15240
},
{
"epoch": 1.13,
"grad_norm": 8.877721786499023,
"learning_rate": 8.753696577626061e-05,
"loss": 2.5662,
"step": 15250
},
{
"epoch": 1.13,
"grad_norm": 4.209753513336182,
"learning_rate": 8.741578154126476e-05,
"loss": 2.5471,
"step": 15260
},
{
"epoch": 1.13,
"grad_norm": 4.297937870025635,
"learning_rate": 8.729461608144472e-05,
"loss": 2.5248,
"step": 15270
},
{
"epoch": 1.13,
"grad_norm": 4.832234859466553,
"learning_rate": 8.717346957757469e-05,
"loss": 2.5218,
"step": 15280
},
{
"epoch": 1.13,
"grad_norm": 4.7769999504089355,
"learning_rate": 8.70523422104007e-05,
"loss": 2.8345,
"step": 15290
},
{
"epoch": 1.13,
"grad_norm": 6.273793697357178,
"learning_rate": 8.693123416064015e-05,
"loss": 2.842,
"step": 15300
},
{
"epoch": 1.13,
"grad_norm": 7.538787364959717,
"learning_rate": 8.681014560898168e-05,
"loss": 2.6492,
"step": 15310
},
{
"epoch": 1.13,
"grad_norm": 5.364718914031982,
"learning_rate": 8.668907673608484e-05,
"loss": 2.6824,
"step": 15320
},
{
"epoch": 1.13,
"grad_norm": 9.456381797790527,
"learning_rate": 8.656802772257967e-05,
"loss": 2.5481,
"step": 15330
},
{
"epoch": 1.13,
"grad_norm": 5.099219799041748,
"learning_rate": 8.644699874906677e-05,
"loss": 2.6301,
"step": 15340
},
{
"epoch": 1.13,
"grad_norm": 10.843995094299316,
"learning_rate": 8.632598999611681e-05,
"loss": 2.8424,
"step": 15350
},
{
"epoch": 1.13,
"grad_norm": 5.564281940460205,
"learning_rate": 8.620500164427017e-05,
"loss": 2.6204,
"step": 15360
},
{
"epoch": 1.14,
"grad_norm": 5.3823628425598145,
"learning_rate": 8.608403387403697e-05,
"loss": 2.746,
"step": 15370
},
{
"epoch": 1.14,
"grad_norm": 3.44514799118042,
"learning_rate": 8.596308686589645e-05,
"loss": 2.7036,
"step": 15380
},
{
"epoch": 1.14,
"grad_norm": 6.357730865478516,
"learning_rate": 8.584216080029694e-05,
"loss": 2.3706,
"step": 15390
},
{
"epoch": 1.14,
"grad_norm": 7.127414226531982,
"learning_rate": 8.57212558576556e-05,
"loss": 2.3574,
"step": 15400
},
{
"epoch": 1.14,
"eval_loss": 2.8107047080993652,
"eval_runtime": 1137.0718,
"eval_samples_per_second": 5.013,
"eval_steps_per_second": 5.013,
"step": 15400
},
{
"epoch": 1.14,
"grad_norm": 6.099443435668945,
"learning_rate": 8.560037221835799e-05,
"loss": 2.7923,
"step": 15410
},
{
"epoch": 1.14,
"grad_norm": 8.16304874420166,
"learning_rate": 8.547951006275786e-05,
"loss": 2.6381,
"step": 15420
},
{
"epoch": 1.14,
"grad_norm": 4.368096828460693,
"learning_rate": 8.5358669571177e-05,
"loss": 2.5908,
"step": 15430
},
{
"epoch": 1.14,
"grad_norm": 6.323507785797119,
"learning_rate": 8.523785092390482e-05,
"loss": 2.7558,
"step": 15440
},
{
"epoch": 1.14,
"grad_norm": 8.191755294799805,
"learning_rate": 8.511705430119815e-05,
"loss": 2.6878,
"step": 15450
},
{
"epoch": 1.14,
"grad_norm": 4.996376037597656,
"learning_rate": 8.499627988328099e-05,
"loss": 2.3164,
"step": 15460
},
{
"epoch": 1.14,
"grad_norm": 6.701737880706787,
"learning_rate": 8.487552785034411e-05,
"loss": 2.5691,
"step": 15470
},
{
"epoch": 1.14,
"grad_norm": 4.932399749755859,
"learning_rate": 8.475479838254503e-05,
"loss": 2.4854,
"step": 15480
},
{
"epoch": 1.14,
"grad_norm": 6.256311893463135,
"learning_rate": 8.463409166000747e-05,
"loss": 2.2988,
"step": 15490
},
{
"epoch": 1.14,
"grad_norm": 5.213491439819336,
"learning_rate": 8.451340786282133e-05,
"loss": 2.5542,
"step": 15500
},
{
"epoch": 1.15,
"grad_norm": 4.382655620574951,
"learning_rate": 8.439274717104224e-05,
"loss": 2.9418,
"step": 15510
},
{
"epoch": 1.15,
"grad_norm": 4.432163715362549,
"learning_rate": 8.42721097646913e-05,
"loss": 2.5682,
"step": 15520
},
{
"epoch": 1.15,
"grad_norm": 6.079984664916992,
"learning_rate": 8.4151495823755e-05,
"loss": 2.7749,
"step": 15530
},
{
"epoch": 1.15,
"grad_norm": 4.57197380065918,
"learning_rate": 8.403090552818475e-05,
"loss": 2.6964,
"step": 15540
},
{
"epoch": 1.15,
"grad_norm": 5.710402965545654,
"learning_rate": 8.391033905789668e-05,
"loss": 2.7295,
"step": 15550
},
{
"epoch": 1.15,
"grad_norm": 5.570113658905029,
"learning_rate": 8.378979659277142e-05,
"loss": 2.4635,
"step": 15560
},
{
"epoch": 1.15,
"grad_norm": 4.270289421081543,
"learning_rate": 8.366927831265366e-05,
"loss": 2.4542,
"step": 15570
},
{
"epoch": 1.15,
"grad_norm": 7.5061845779418945,
"learning_rate": 8.354878439735216e-05,
"loss": 2.8317,
"step": 15580
},
{
"epoch": 1.15,
"grad_norm": 5.209946155548096,
"learning_rate": 8.342831502663924e-05,
"loss": 2.8297,
"step": 15590
},
{
"epoch": 1.15,
"grad_norm": 5.211167335510254,
"learning_rate": 8.330787038025068e-05,
"loss": 2.4852,
"step": 15600
},
{
"epoch": 1.15,
"eval_loss": 2.801150321960449,
"eval_runtime": 1135.7445,
"eval_samples_per_second": 5.019,
"eval_steps_per_second": 5.019,
"step": 15600
},
{
"epoch": 1.15,
"grad_norm": 4.61747407913208,
"learning_rate": 8.318745063788524e-05,
"loss": 2.7651,
"step": 15610
},
{
"epoch": 1.15,
"grad_norm": 7.793847560882568,
"learning_rate": 8.306705597920463e-05,
"loss": 2.6381,
"step": 15620
},
{
"epoch": 1.15,
"grad_norm": 7.500510215759277,
"learning_rate": 8.294668658383311e-05,
"loss": 2.7704,
"step": 15630
},
{
"epoch": 1.16,
"grad_norm": 4.450290203094482,
"learning_rate": 8.282634263135722e-05,
"loss": 2.4493,
"step": 15640
},
{
"epoch": 1.16,
"grad_norm": 7.9324750900268555,
"learning_rate": 8.270602430132562e-05,
"loss": 2.6112,
"step": 15650
},
{
"epoch": 1.16,
"grad_norm": 4.876689434051514,
"learning_rate": 8.258573177324861e-05,
"loss": 2.5688,
"step": 15660
},
{
"epoch": 1.16,
"grad_norm": 7.13979434967041,
"learning_rate": 8.247749070698486e-05,
"loss": 2.5836,
"step": 15670
},
{
"epoch": 1.16,
"grad_norm": 7.261677265167236,
"learning_rate": 8.235724769703466e-05,
"loss": 2.3577,
"step": 15680
},
{
"epoch": 1.16,
"grad_norm": 4.691134452819824,
"learning_rate": 8.223703100940052e-05,
"loss": 2.7229,
"step": 15690
},
{
"epoch": 1.16,
"grad_norm": 6.986545085906982,
"learning_rate": 8.211684082344125e-05,
"loss": 2.554,
"step": 15700
},
{
"epoch": 1.16,
"grad_norm": 5.607544422149658,
"learning_rate": 8.199667731847593e-05,
"loss": 2.403,
"step": 15710
},
{
"epoch": 1.16,
"grad_norm": 5.985232830047607,
"learning_rate": 8.187654067378397e-05,
"loss": 2.4481,
"step": 15720
},
{
"epoch": 1.16,
"grad_norm": 13.418354988098145,
"learning_rate": 8.175643106860472e-05,
"loss": 2.7237,
"step": 15730
},
{
"epoch": 1.16,
"grad_norm": 4.863924980163574,
"learning_rate": 8.163634868213715e-05,
"loss": 2.5766,
"step": 15740
},
{
"epoch": 1.16,
"grad_norm": 5.624682903289795,
"learning_rate": 8.151629369353952e-05,
"loss": 2.7085,
"step": 15750
},
{
"epoch": 1.16,
"grad_norm": 4.593716621398926,
"learning_rate": 8.139626628192944e-05,
"loss": 3.056,
"step": 15760
},
{
"epoch": 1.16,
"grad_norm": 5.1518025398254395,
"learning_rate": 8.127626662638315e-05,
"loss": 2.9041,
"step": 15770
},
{
"epoch": 1.17,
"grad_norm": 6.224874973297119,
"learning_rate": 8.115629490593564e-05,
"loss": 2.574,
"step": 15780
},
{
"epoch": 1.17,
"grad_norm": 7.418553352355957,
"learning_rate": 8.103635129958017e-05,
"loss": 2.7397,
"step": 15790
},
{
"epoch": 1.17,
"grad_norm": 15.142317771911621,
"learning_rate": 8.091643598626794e-05,
"loss": 2.845,
"step": 15800
},
{
"epoch": 1.17,
"eval_loss": 2.8001558780670166,
"eval_runtime": 1137.7655,
"eval_samples_per_second": 5.01,
"eval_steps_per_second": 5.01,
"step": 15800
},
{
"epoch": 1.17,
"grad_norm": 6.888623237609863,
"learning_rate": 8.079654914490815e-05,
"loss": 2.8391,
"step": 15810
},
{
"epoch": 1.17,
"grad_norm": 6.754673957824707,
"learning_rate": 8.067669095436736e-05,
"loss": 2.537,
"step": 15820
},
{
"epoch": 1.17,
"grad_norm": 7.226851940155029,
"learning_rate": 8.055686159346944e-05,
"loss": 2.5829,
"step": 15830
},
{
"epoch": 1.17,
"grad_norm": 6.088146209716797,
"learning_rate": 8.04370612409953e-05,
"loss": 2.6574,
"step": 15840
},
{
"epoch": 1.17,
"grad_norm": 5.43487024307251,
"learning_rate": 8.031729007568241e-05,
"loss": 2.8225,
"step": 15850
},
{
"epoch": 1.17,
"grad_norm": 5.83208703994751,
"learning_rate": 8.019754827622487e-05,
"loss": 2.4902,
"step": 15860
},
{
"epoch": 1.17,
"grad_norm": 5.5839738845825195,
"learning_rate": 8.007783602127285e-05,
"loss": 2.7953,
"step": 15870
},
{
"epoch": 1.17,
"grad_norm": 9.091108322143555,
"learning_rate": 7.995815348943256e-05,
"loss": 2.6682,
"step": 15880
},
{
"epoch": 1.17,
"grad_norm": 5.6139445304870605,
"learning_rate": 7.983850085926574e-05,
"loss": 2.4715,
"step": 15890
},
{
"epoch": 1.17,
"grad_norm": 11.105509757995605,
"learning_rate": 7.971887830928954e-05,
"loss": 2.4542,
"step": 15900
},
{
"epoch": 1.18,
"grad_norm": 5.053381443023682,
"learning_rate": 7.95992860179763e-05,
"loss": 2.5608,
"step": 15910
},
{
"epoch": 1.18,
"grad_norm": 6.730508327484131,
"learning_rate": 7.947972416375315e-05,
"loss": 2.6179,
"step": 15920
},
{
"epoch": 1.18,
"grad_norm": 4.9856276512146,
"learning_rate": 7.936019292500191e-05,
"loss": 2.9111,
"step": 15930
},
{
"epoch": 1.18,
"grad_norm": 6.622928142547607,
"learning_rate": 7.924069248005855e-05,
"loss": 2.9524,
"step": 15940
},
{
"epoch": 1.18,
"grad_norm": 5.014869213104248,
"learning_rate": 7.912122300721319e-05,
"loss": 2.7441,
"step": 15950
},
{
"epoch": 1.18,
"grad_norm": 6.20679235458374,
"learning_rate": 7.900178468470983e-05,
"loss": 2.488,
"step": 15960
},
{
"epoch": 1.18,
"grad_norm": 5.172658443450928,
"learning_rate": 7.888237769074582e-05,
"loss": 2.5992,
"step": 15970
},
{
"epoch": 1.18,
"grad_norm": 4.712294101715088,
"learning_rate": 7.876300220347195e-05,
"loss": 2.7378,
"step": 15980
},
{
"epoch": 1.18,
"grad_norm": 5.688995838165283,
"learning_rate": 7.864365840099183e-05,
"loss": 2.7758,
"step": 15990
},
{
"epoch": 1.18,
"grad_norm": 4.735537052154541,
"learning_rate": 7.852434646136191e-05,
"loss": 2.6825,
"step": 16000
},
{
"epoch": 1.18,
"eval_loss": 2.7963438034057617,
"eval_runtime": 1138.098,
"eval_samples_per_second": 5.008,
"eval_steps_per_second": 5.008,
"step": 16000
},
{
"epoch": 1.18,
"grad_norm": 5.686548233032227,
"learning_rate": 7.840506656259108e-05,
"loss": 2.6941,
"step": 16010
},
{
"epoch": 1.18,
"grad_norm": 4.687047004699707,
"learning_rate": 7.828581888264037e-05,
"loss": 2.3713,
"step": 16020
},
{
"epoch": 1.18,
"grad_norm": 5.9541850090026855,
"learning_rate": 7.816660359942288e-05,
"loss": 2.8516,
"step": 16030
},
{
"epoch": 1.18,
"grad_norm": 6.282932758331299,
"learning_rate": 7.804742089080319e-05,
"loss": 2.4472,
"step": 16040
},
{
"epoch": 1.19,
"grad_norm": 6.3287858963012695,
"learning_rate": 7.792827093459742e-05,
"loss": 2.5265,
"step": 16050
},
{
"epoch": 1.19,
"grad_norm": 7.00472354888916,
"learning_rate": 7.780915390857275e-05,
"loss": 2.8147,
"step": 16060
},
{
"epoch": 1.19,
"grad_norm": 5.5554399490356445,
"learning_rate": 7.769006999044729e-05,
"loss": 2.5742,
"step": 16070
},
{
"epoch": 1.19,
"grad_norm": 4.063988208770752,
"learning_rate": 7.757101935788973e-05,
"loss": 2.5979,
"step": 16080
},
{
"epoch": 1.19,
"grad_norm": 8.165379524230957,
"learning_rate": 7.745200218851901e-05,
"loss": 2.7628,
"step": 16090
},
{
"epoch": 1.19,
"grad_norm": 5.317456245422363,
"learning_rate": 7.733301865990432e-05,
"loss": 2.8025,
"step": 16100
},
{
"epoch": 1.19,
"grad_norm": 11.654034614562988,
"learning_rate": 7.721406894956449e-05,
"loss": 2.6235,
"step": 16110
},
{
"epoch": 1.19,
"grad_norm": 9.989720344543457,
"learning_rate": 7.709515323496804e-05,
"loss": 2.5045,
"step": 16120
},
{
"epoch": 1.19,
"grad_norm": 4.502736568450928,
"learning_rate": 7.697627169353265e-05,
"loss": 2.4192,
"step": 16130
},
{
"epoch": 1.19,
"grad_norm": 4.556110858917236,
"learning_rate": 7.685742450262504e-05,
"loss": 2.5847,
"step": 16140
},
{
"epoch": 1.19,
"grad_norm": 4.872483730316162,
"learning_rate": 7.673861183956077e-05,
"loss": 2.5115,
"step": 16150
},
{
"epoch": 1.19,
"grad_norm": 7.733802318572998,
"learning_rate": 7.661983388160375e-05,
"loss": 2.4647,
"step": 16160
},
{
"epoch": 1.19,
"grad_norm": 4.661727428436279,
"learning_rate": 7.650109080596625e-05,
"loss": 2.4705,
"step": 16170
},
{
"epoch": 1.2,
"grad_norm": 5.2123541831970215,
"learning_rate": 7.638238278980838e-05,
"loss": 2.5191,
"step": 16180
},
{
"epoch": 1.2,
"grad_norm": 5.72269868850708,
"learning_rate": 7.626371001023798e-05,
"loss": 2.6785,
"step": 16190
},
{
"epoch": 1.2,
"grad_norm": 12.739094734191895,
"learning_rate": 7.614507264431036e-05,
"loss": 2.8185,
"step": 16200
},
{
"epoch": 1.2,
"eval_loss": 2.794032335281372,
"eval_runtime": 1136.7877,
"eval_samples_per_second": 5.014,
"eval_steps_per_second": 5.014,
"step": 16200
},
{
"epoch": 1.2,
"grad_norm": 6.045168399810791,
"learning_rate": 7.602647086902794e-05,
"loss": 2.5196,
"step": 16210
},
{
"epoch": 1.2,
"grad_norm": 4.591131210327148,
"learning_rate": 7.59079048613401e-05,
"loss": 2.3241,
"step": 16220
},
{
"epoch": 1.2,
"grad_norm": 6.3532395362854,
"learning_rate": 7.578937479814279e-05,
"loss": 2.4889,
"step": 16230
},
{
"epoch": 1.2,
"grad_norm": 6.245053291320801,
"learning_rate": 7.567088085627834e-05,
"loss": 2.5951,
"step": 16240
},
{
"epoch": 1.2,
"grad_norm": 8.003286361694336,
"learning_rate": 7.555242321253525e-05,
"loss": 2.6774,
"step": 16250
},
{
"epoch": 1.2,
"grad_norm": 5.010828018188477,
"learning_rate": 7.543400204364776e-05,
"loss": 2.3974,
"step": 16260
},
{
"epoch": 1.2,
"grad_norm": 4.4079155921936035,
"learning_rate": 7.531561752629585e-05,
"loss": 2.4707,
"step": 16270
},
{
"epoch": 1.2,
"grad_norm": 5.175243377685547,
"learning_rate": 7.519726983710465e-05,
"loss": 2.7921,
"step": 16280
},
{
"epoch": 1.2,
"grad_norm": 4.758031368255615,
"learning_rate": 7.507895915264442e-05,
"loss": 2.6729,
"step": 16290
},
{
"epoch": 1.2,
"grad_norm": 5.974156379699707,
"learning_rate": 7.496068564943024e-05,
"loss": 2.4163,
"step": 16300
},
{
"epoch": 1.2,
"grad_norm": 5.608770370483398,
"learning_rate": 7.48424495039217e-05,
"loss": 2.8602,
"step": 16310
},
{
"epoch": 1.21,
"grad_norm": 5.631148815155029,
"learning_rate": 7.472425089252254e-05,
"loss": 2.5714,
"step": 16320
},
{
"epoch": 1.21,
"grad_norm": 4.781109809875488,
"learning_rate": 7.460608999158067e-05,
"loss": 2.6068,
"step": 16330
},
{
"epoch": 1.21,
"grad_norm": 7.0405449867248535,
"learning_rate": 7.448796697738765e-05,
"loss": 2.6175,
"step": 16340
},
{
"epoch": 1.21,
"grad_norm": 4.027560710906982,
"learning_rate": 7.436988202617854e-05,
"loss": 2.6064,
"step": 16350
},
{
"epoch": 1.21,
"grad_norm": 6.559507369995117,
"learning_rate": 7.425183531413163e-05,
"loss": 3.0446,
"step": 16360
},
{
"epoch": 1.21,
"grad_norm": 6.1287031173706055,
"learning_rate": 7.413382701736804e-05,
"loss": 2.5806,
"step": 16370
},
{
"epoch": 1.21,
"grad_norm": 7.039647102355957,
"learning_rate": 7.401585731195171e-05,
"loss": 2.5544,
"step": 16380
},
{
"epoch": 1.21,
"grad_norm": 3.893784999847412,
"learning_rate": 7.389792637388899e-05,
"loss": 2.6337,
"step": 16390
},
{
"epoch": 1.21,
"grad_norm": 9.116436958312988,
"learning_rate": 7.37800343791283e-05,
"loss": 2.5752,
"step": 16400
},
{
"epoch": 1.21,
"eval_loss": 2.7846195697784424,
"eval_runtime": 1137.5768,
"eval_samples_per_second": 5.011,
"eval_steps_per_second": 5.011,
"step": 16400
},
{
"epoch": 1.21,
"grad_norm": 5.62230110168457,
"learning_rate": 7.366218150356011e-05,
"loss": 2.4447,
"step": 16410
},
{
"epoch": 1.21,
"grad_norm": 5.021866798400879,
"learning_rate": 7.354436792301634e-05,
"loss": 2.5048,
"step": 16420
},
{
"epoch": 1.21,
"grad_norm": 4.596590995788574,
"learning_rate": 7.342659381327039e-05,
"loss": 2.4309,
"step": 16430
},
{
"epoch": 1.21,
"grad_norm": 4.406472206115723,
"learning_rate": 7.330885935003679e-05,
"loss": 2.458,
"step": 16440
},
{
"epoch": 1.22,
"grad_norm": 4.427298069000244,
"learning_rate": 7.319116470897085e-05,
"loss": 2.5887,
"step": 16450
},
{
"epoch": 1.22,
"grad_norm": 6.47908353805542,
"learning_rate": 7.307351006566856e-05,
"loss": 2.9025,
"step": 16460
},
{
"epoch": 1.22,
"grad_norm": 4.693458557128906,
"learning_rate": 7.295589559566612e-05,
"loss": 2.5394,
"step": 16470
},
{
"epoch": 1.22,
"grad_norm": 5.163450241088867,
"learning_rate": 7.283832147443985e-05,
"loss": 2.6656,
"step": 16480
},
{
"epoch": 1.22,
"grad_norm": 6.559133052825928,
"learning_rate": 7.27207878774059e-05,
"loss": 2.4291,
"step": 16490
},
{
"epoch": 1.22,
"grad_norm": 6.849522590637207,
"learning_rate": 7.260329497991996e-05,
"loss": 2.7398,
"step": 16500
},
{
"epoch": 1.22,
"grad_norm": 5.400025844573975,
"learning_rate": 7.248584295727688e-05,
"loss": 2.8048,
"step": 16510
},
{
"epoch": 1.22,
"grad_norm": 5.159172058105469,
"learning_rate": 7.236843198471068e-05,
"loss": 2.3586,
"step": 16520
},
{
"epoch": 1.22,
"grad_norm": 7.74296760559082,
"learning_rate": 7.225106223739405e-05,
"loss": 2.7643,
"step": 16530
},
{
"epoch": 1.22,
"grad_norm": 5.079954624176025,
"learning_rate": 7.213373389043822e-05,
"loss": 2.7399,
"step": 16540
},
{
"epoch": 1.22,
"grad_norm": 7.623778343200684,
"learning_rate": 7.201644711889262e-05,
"loss": 2.3221,
"step": 16550
},
{
"epoch": 1.22,
"grad_norm": 3.996065855026245,
"learning_rate": 7.189920209774458e-05,
"loss": 2.2776,
"step": 16560
},
{
"epoch": 1.22,
"grad_norm": 10.919685363769531,
"learning_rate": 7.178199900191932e-05,
"loss": 2.5631,
"step": 16570
},
{
"epoch": 1.22,
"grad_norm": 4.869669437408447,
"learning_rate": 7.166483800627934e-05,
"loss": 2.5653,
"step": 16580
},
{
"epoch": 1.23,
"grad_norm": 3.3495869636535645,
"learning_rate": 7.154771928562443e-05,
"loss": 2.4802,
"step": 16590
},
{
"epoch": 1.23,
"grad_norm": 4.56265926361084,
"learning_rate": 7.14306430146913e-05,
"loss": 2.9435,
"step": 16600
},
{
"epoch": 1.23,
"eval_loss": 2.779052734375,
"eval_runtime": 1138.9612,
"eval_samples_per_second": 5.005,
"eval_steps_per_second": 5.005,
"step": 16600
},
{
"epoch": 1.23,
"grad_norm": 6.799938201904297,
"learning_rate": 7.131360936815319e-05,
"loss": 2.7358,
"step": 16610
},
{
"epoch": 1.23,
"grad_norm": 4.682605266571045,
"learning_rate": 7.119661852061994e-05,
"loss": 2.6705,
"step": 16620
},
{
"epoch": 1.23,
"grad_norm": 5.452235221862793,
"learning_rate": 7.107967064663741e-05,
"loss": 2.5686,
"step": 16630
},
{
"epoch": 1.23,
"grad_norm": 5.695895195007324,
"learning_rate": 7.096276592068743e-05,
"loss": 2.8169,
"step": 16640
},
{
"epoch": 1.23,
"grad_norm": 5.076992034912109,
"learning_rate": 7.08459045171874e-05,
"loss": 2.4833,
"step": 16650
},
{
"epoch": 1.23,
"grad_norm": 5.666923999786377,
"learning_rate": 7.072908661049005e-05,
"loss": 2.5815,
"step": 16660
},
{
"epoch": 1.23,
"grad_norm": 4.95028829574585,
"learning_rate": 7.061231237488326e-05,
"loss": 2.4393,
"step": 16670
},
{
"epoch": 1.23,
"grad_norm": 5.579570293426514,
"learning_rate": 7.049558198458981e-05,
"loss": 2.7396,
"step": 16680
},
{
"epoch": 1.23,
"grad_norm": 6.172384262084961,
"learning_rate": 7.037889561376696e-05,
"loss": 2.5335,
"step": 16690
},
{
"epoch": 1.23,
"grad_norm": 4.954216480255127,
"learning_rate": 7.026225343650639e-05,
"loss": 2.6123,
"step": 16700
},
{
"epoch": 1.23,
"grad_norm": 6.319690227508545,
"learning_rate": 7.014565562683373e-05,
"loss": 2.6801,
"step": 16710
},
{
"epoch": 1.24,
"grad_norm": 4.945847034454346,
"learning_rate": 7.002910235870851e-05,
"loss": 2.42,
"step": 16720
},
{
"epoch": 1.24,
"grad_norm": 7.983598709106445,
"learning_rate": 6.991259380602379e-05,
"loss": 2.5028,
"step": 16730
},
{
"epoch": 1.24,
"grad_norm": 9.160069465637207,
"learning_rate": 6.979613014260591e-05,
"loss": 2.4809,
"step": 16740
},
{
"epoch": 1.24,
"grad_norm": 5.566466808319092,
"learning_rate": 6.96797115422142e-05,
"loss": 2.3794,
"step": 16750
},
{
"epoch": 1.24,
"grad_norm": 5.244190216064453,
"learning_rate": 6.956333817854079e-05,
"loss": 2.8169,
"step": 16760
},
{
"epoch": 1.24,
"grad_norm": 3.622380256652832,
"learning_rate": 6.944701022521034e-05,
"loss": 2.3658,
"step": 16770
},
{
"epoch": 1.24,
"grad_norm": 5.913341522216797,
"learning_rate": 6.933072785577973e-05,
"loss": 2.7368,
"step": 16780
},
{
"epoch": 1.24,
"grad_norm": 6.090620994567871,
"learning_rate": 6.921449124373787e-05,
"loss": 2.6396,
"step": 16790
},
{
"epoch": 1.24,
"grad_norm": 7.094319820404053,
"learning_rate": 6.909830056250527e-05,
"loss": 2.6005,
"step": 16800
},
{
"epoch": 1.24,
"eval_loss": 2.7737345695495605,
"eval_runtime": 1137.0285,
"eval_samples_per_second": 5.013,
"eval_steps_per_second": 5.013,
"step": 16800
},
{
"epoch": 1.24,
"grad_norm": 4.8968353271484375,
"learning_rate": 6.900538120419681e-05,
"loss": 2.5549,
"step": 16810
},
{
"epoch": 1.24,
"grad_norm": 5.737145900726318,
"learning_rate": 6.888927363522204e-05,
"loss": 2.6856,
"step": 16820
},
{
"epoch": 1.24,
"grad_norm": 3.957963466644287,
"learning_rate": 6.877321248226894e-05,
"loss": 2.5952,
"step": 16830
},
{
"epoch": 1.24,
"grad_norm": 4.489877223968506,
"learning_rate": 6.865719791849628e-05,
"loss": 2.7842,
"step": 16840
},
{
"epoch": 1.24,
"grad_norm": 4.478295803070068,
"learning_rate": 6.854123011699339e-05,
"loss": 2.8712,
"step": 16850
},
{
"epoch": 1.25,
"grad_norm": 5.02951717376709,
"learning_rate": 6.842530925077986e-05,
"loss": 2.4217,
"step": 16860
},
{
"epoch": 1.25,
"grad_norm": 5.9152631759643555,
"learning_rate": 6.830943549280519e-05,
"loss": 2.743,
"step": 16870
},
{
"epoch": 1.25,
"grad_norm": 4.8398637771606445,
"learning_rate": 6.819360901594866e-05,
"loss": 2.5406,
"step": 16880
},
{
"epoch": 1.25,
"grad_norm": 6.63694429397583,
"learning_rate": 6.807782999301893e-05,
"loss": 2.6179,
"step": 16890
},
{
"epoch": 1.25,
"grad_norm": 6.521999835968018,
"learning_rate": 6.796209859675391e-05,
"loss": 2.596,
"step": 16900
},
{
"epoch": 1.25,
"grad_norm": 4.723524570465088,
"learning_rate": 6.784641499982045e-05,
"loss": 2.5729,
"step": 16910
},
{
"epoch": 1.25,
"grad_norm": 4.5919880867004395,
"learning_rate": 6.773077937481409e-05,
"loss": 2.6229,
"step": 16920
},
{
"epoch": 1.25,
"grad_norm": 5.574059963226318,
"learning_rate": 6.76151918942588e-05,
"loss": 2.7673,
"step": 16930
},
{
"epoch": 1.25,
"grad_norm": 6.148488521575928,
"learning_rate": 6.751120446779786e-05,
"loss": 2.7547,
"step": 16940
},
{
"epoch": 1.25,
"grad_norm": 6.633347988128662,
"learning_rate": 6.73957089367456e-05,
"loss": 2.473,
"step": 16950
},
{
"epoch": 1.25,
"grad_norm": 7.267597198486328,
"learning_rate": 6.728026205005675e-05,
"loss": 2.7067,
"step": 16960
},
{
"epoch": 1.25,
"grad_norm": 7.949811935424805,
"learning_rate": 6.716486397997373e-05,
"loss": 2.6054,
"step": 16970
},
{
"epoch": 1.25,
"grad_norm": 4.672689914703369,
"learning_rate": 6.7049514898666e-05,
"loss": 2.3211,
"step": 16980
},
{
"epoch": 1.26,
"grad_norm": 5.937682628631592,
"learning_rate": 6.693421497823001e-05,
"loss": 2.7239,
"step": 16990
},
{
"epoch": 1.26,
"grad_norm": 7.0608086585998535,
"learning_rate": 6.681896439068893e-05,
"loss": 2.4637,
"step": 17000
},
{
"epoch": 1.26,
"eval_loss": 2.7728655338287354,
"eval_runtime": 1091.9813,
"eval_samples_per_second": 5.22,
"eval_steps_per_second": 5.22,
"step": 17000
},
{
"epoch": 1.26,
"grad_norm": 5.499873638153076,
"learning_rate": 6.670376330799217e-05,
"loss": 2.6289,
"step": 17010
},
{
"epoch": 1.26,
"grad_norm": 4.307833194732666,
"learning_rate": 6.658861190201547e-05,
"loss": 2.392,
"step": 17020
},
{
"epoch": 1.26,
"grad_norm": 5.94236421585083,
"learning_rate": 6.647351034456027e-05,
"loss": 2.5595,
"step": 17030
},
{
"epoch": 1.26,
"grad_norm": 4.513247489929199,
"learning_rate": 6.635845880735373e-05,
"loss": 2.3705,
"step": 17040
},
{
"epoch": 1.26,
"grad_norm": 4.779393672943115,
"learning_rate": 6.624345746204841e-05,
"loss": 2.4923,
"step": 17050
},
{
"epoch": 1.26,
"grad_norm": 4.398991107940674,
"learning_rate": 6.612850648022189e-05,
"loss": 2.4459,
"step": 17060
},
{
"epoch": 1.26,
"grad_norm": 5.860241889953613,
"learning_rate": 6.601360603337677e-05,
"loss": 2.5656,
"step": 17070
},
{
"epoch": 1.26,
"grad_norm": 5.763365268707275,
"learning_rate": 6.589875629294003e-05,
"loss": 2.419,
"step": 17080
},
{
"epoch": 1.26,
"grad_norm": 4.705411434173584,
"learning_rate": 6.578395743026318e-05,
"loss": 2.6694,
"step": 17090
},
{
"epoch": 1.26,
"grad_norm": 8.145054817199707,
"learning_rate": 6.566920961662175e-05,
"loss": 2.5453,
"step": 17100
},
{
"epoch": 1.26,
"grad_norm": 6.116779804229736,
"learning_rate": 6.555451302321515e-05,
"loss": 2.5598,
"step": 17110
},
{
"epoch": 1.26,
"grad_norm": 9.881659507751465,
"learning_rate": 6.543986782116628e-05,
"loss": 2.4526,
"step": 17120
},
{
"epoch": 1.27,
"grad_norm": 5.976058006286621,
"learning_rate": 6.532527418152147e-05,
"loss": 2.5674,
"step": 17130
},
{
"epoch": 1.27,
"grad_norm": 4.460546493530273,
"learning_rate": 6.521073227525003e-05,
"loss": 2.3611,
"step": 17140
},
{
"epoch": 1.27,
"grad_norm": 6.480743885040283,
"learning_rate": 6.50962422732442e-05,
"loss": 2.6928,
"step": 17150
},
{
"epoch": 1.27,
"grad_norm": 5.8814473152160645,
"learning_rate": 6.498180434631868e-05,
"loss": 2.5817,
"step": 17160
},
{
"epoch": 1.27,
"grad_norm": 4.516665935516357,
"learning_rate": 6.486741866521049e-05,
"loss": 2.9759,
"step": 17170
},
{
"epoch": 1.27,
"grad_norm": 5.590062618255615,
"learning_rate": 6.475308540057873e-05,
"loss": 2.3737,
"step": 17180
},
{
"epoch": 1.27,
"grad_norm": 5.345756530761719,
"learning_rate": 6.46388047230043e-05,
"loss": 2.6671,
"step": 17190
},
{
"epoch": 1.27,
"grad_norm": 6.258466720581055,
"learning_rate": 6.45245768029896e-05,
"loss": 2.5461,
"step": 17200
},
{
"epoch": 1.27,
"eval_loss": 2.767456531524658,
"eval_runtime": 1089.0078,
"eval_samples_per_second": 5.234,
"eval_steps_per_second": 5.234,
"step": 17200
},
{
"epoch": 1.27,
"grad_norm": 6.09370231628418,
"learning_rate": 6.441040181095841e-05,
"loss": 2.6281,
"step": 17210
},
{
"epoch": 1.27,
"grad_norm": 5.456587314605713,
"learning_rate": 6.429627991725541e-05,
"loss": 2.5189,
"step": 17220
},
{
"epoch": 1.27,
"grad_norm": 7.850766658782959,
"learning_rate": 6.418221129214616e-05,
"loss": 2.7745,
"step": 17230
},
{
"epoch": 1.27,
"grad_norm": 7.215473651885986,
"learning_rate": 6.406819610581671e-05,
"loss": 2.4249,
"step": 17240
},
{
"epoch": 1.27,
"grad_norm": 5.151793479919434,
"learning_rate": 6.39542345283734e-05,
"loss": 2.5455,
"step": 17250
},
{
"epoch": 1.28,
"grad_norm": 4.555073261260986,
"learning_rate": 6.384032672984256e-05,
"loss": 2.849,
"step": 17260
},
{
"epoch": 1.28,
"grad_norm": 5.082034587860107,
"learning_rate": 6.372647288017029e-05,
"loss": 2.7734,
"step": 17270
},
{
"epoch": 1.28,
"grad_norm": 5.69696569442749,
"learning_rate": 6.36126731492222e-05,
"loss": 2.5211,
"step": 17280
},
{
"epoch": 1.28,
"grad_norm": 4.185813903808594,
"learning_rate": 6.349892770678319e-05,
"loss": 2.601,
"step": 17290
},
{
"epoch": 1.28,
"grad_norm": 4.5403594970703125,
"learning_rate": 6.338523672255716e-05,
"loss": 2.6715,
"step": 17300
},
{
"epoch": 1.28,
"grad_norm": 7.941657066345215,
"learning_rate": 6.327160036616665e-05,
"loss": 2.4868,
"step": 17310
},
{
"epoch": 1.28,
"grad_norm": 4.206854820251465,
"learning_rate": 6.315801880715286e-05,
"loss": 2.4604,
"step": 17320
},
{
"epoch": 1.28,
"grad_norm": 5.025691032409668,
"learning_rate": 6.304449221497515e-05,
"loss": 2.2965,
"step": 17330
},
{
"epoch": 1.28,
"grad_norm": 4.888176918029785,
"learning_rate": 6.293102075901087e-05,
"loss": 2.5464,
"step": 17340
},
{
"epoch": 1.28,
"grad_norm": 5.918951988220215,
"learning_rate": 6.281760460855515e-05,
"loss": 2.5731,
"step": 17350
},
{
"epoch": 1.28,
"grad_norm": 5.8334431648254395,
"learning_rate": 6.270424393282052e-05,
"loss": 2.6812,
"step": 17360
},
{
"epoch": 1.28,
"grad_norm": 5.946429252624512,
"learning_rate": 6.259093890093685e-05,
"loss": 2.4973,
"step": 17370
},
{
"epoch": 1.28,
"grad_norm": 8.533334732055664,
"learning_rate": 6.247768968195089e-05,
"loss": 2.4206,
"step": 17380
},
{
"epoch": 1.28,
"grad_norm": 5.1779656410217285,
"learning_rate": 6.236449644482625e-05,
"loss": 2.6378,
"step": 17390
},
{
"epoch": 1.29,
"grad_norm": 5.802103519439697,
"learning_rate": 6.22513593584429e-05,
"loss": 2.3879,
"step": 17400
},
{
"epoch": 1.29,
"eval_loss": 2.7677671909332275,
"eval_runtime": 1093.1356,
"eval_samples_per_second": 5.214,
"eval_steps_per_second": 5.214,
"step": 17400
},
{
"epoch": 1.29,
"grad_norm": 4.996272563934326,
"learning_rate": 6.213827859159704e-05,
"loss": 2.467,
"step": 17410
},
{
"epoch": 1.29,
"grad_norm": 7.919410705566406,
"learning_rate": 6.202525431300092e-05,
"loss": 2.4002,
"step": 17420
},
{
"epoch": 1.29,
"grad_norm": 6.724912166595459,
"learning_rate": 6.191228669128243e-05,
"loss": 2.5839,
"step": 17430
},
{
"epoch": 1.29,
"grad_norm": 5.3846821784973145,
"learning_rate": 6.179937589498504e-05,
"loss": 2.5401,
"step": 17440
},
{
"epoch": 1.29,
"grad_norm": 5.267107963562012,
"learning_rate": 6.168652209256733e-05,
"loss": 2.511,
"step": 17450
},
{
"epoch": 1.29,
"grad_norm": 5.296595573425293,
"learning_rate": 6.157372545240284e-05,
"loss": 2.7247,
"step": 17460
},
{
"epoch": 1.29,
"grad_norm": 6.33009147644043,
"learning_rate": 6.146098614277993e-05,
"loss": 2.6327,
"step": 17470
},
{
"epoch": 1.29,
"grad_norm": 4.728981018066406,
"learning_rate": 6.134830433190132e-05,
"loss": 2.412,
"step": 17480
},
{
"epoch": 1.29,
"grad_norm": 5.756034851074219,
"learning_rate": 6.123568018788406e-05,
"loss": 2.6223,
"step": 17490
},
{
"epoch": 1.29,
"grad_norm": 4.870009422302246,
"learning_rate": 6.112311387875905e-05,
"loss": 2.6898,
"step": 17500
},
{
"epoch": 1.29,
"grad_norm": 6.132648944854736,
"learning_rate": 6.1010605572470906e-05,
"loss": 2.7397,
"step": 17510
},
{
"epoch": 1.29,
"grad_norm": 4.839498996734619,
"learning_rate": 6.089815543687778e-05,
"loss": 2.585,
"step": 17520
},
{
"epoch": 1.29,
"grad_norm": 4.22407865524292,
"learning_rate": 6.0785763639751045e-05,
"loss": 2.4158,
"step": 17530
},
{
"epoch": 1.3,
"grad_norm": 4.960424900054932,
"learning_rate": 6.0673430348774974e-05,
"loss": 2.4941,
"step": 17540
},
{
"epoch": 1.3,
"grad_norm": 4.620213031768799,
"learning_rate": 6.0561155731546506e-05,
"loss": 2.6422,
"step": 17550
},
{
"epoch": 1.3,
"grad_norm": 4.822215557098389,
"learning_rate": 6.0448939955575154e-05,
"loss": 2.7949,
"step": 17560
},
{
"epoch": 1.3,
"grad_norm": 7.760210990905762,
"learning_rate": 6.033678318828258e-05,
"loss": 2.5389,
"step": 17570
},
{
"epoch": 1.3,
"grad_norm": 5.080504417419434,
"learning_rate": 6.022468559700244e-05,
"loss": 2.6633,
"step": 17580
},
{
"epoch": 1.3,
"grad_norm": 4.475546360015869,
"learning_rate": 6.011264734898008e-05,
"loss": 2.5215,
"step": 17590
},
{
"epoch": 1.3,
"grad_norm": 4.916598320007324,
"learning_rate": 6.000066861137227e-05,
"loss": 2.5776,
"step": 17600
},
{
"epoch": 1.3,
"eval_loss": 2.7586658000946045,
"eval_runtime": 1090.7682,
"eval_samples_per_second": 5.226,
"eval_steps_per_second": 5.226,
"step": 17600
},
{
"epoch": 1.3,
"grad_norm": 5.858465194702148,
"learning_rate": 5.988874955124706e-05,
"loss": 2.5892,
"step": 17610
},
{
"epoch": 1.3,
"grad_norm": 6.47125768661499,
"learning_rate": 5.977689033558342e-05,
"loss": 2.626,
"step": 17620
},
{
"epoch": 1.3,
"grad_norm": 6.5208868980407715,
"learning_rate": 5.966509113127108e-05,
"loss": 2.6554,
"step": 17630
},
{
"epoch": 1.3,
"grad_norm": 3.4920830726623535,
"learning_rate": 5.95533521051102e-05,
"loss": 2.3402,
"step": 17640
},
{
"epoch": 1.3,
"grad_norm": 4.840210914611816,
"learning_rate": 5.9441673423811116e-05,
"loss": 2.8223,
"step": 17650
},
{
"epoch": 1.3,
"grad_norm": 5.344911098480225,
"learning_rate": 5.933005525399422e-05,
"loss": 2.6713,
"step": 17660
},
{
"epoch": 1.31,
"grad_norm": 5.766901969909668,
"learning_rate": 5.921849776218956e-05,
"loss": 2.6337,
"step": 17670
},
{
"epoch": 1.31,
"grad_norm": 7.614682674407959,
"learning_rate": 5.910700111483671e-05,
"loss": 2.7618,
"step": 17680
},
{
"epoch": 1.31,
"grad_norm": 4.827087879180908,
"learning_rate": 5.8995565478284396e-05,
"loss": 2.5264,
"step": 17690
},
{
"epoch": 1.31,
"grad_norm": 5.416106700897217,
"learning_rate": 5.8884191018790345e-05,
"loss": 2.578,
"step": 17700
},
{
"epoch": 1.31,
"grad_norm": 6.153903961181641,
"learning_rate": 5.877287790252104e-05,
"loss": 2.7986,
"step": 17710
},
{
"epoch": 1.31,
"grad_norm": 5.478076934814453,
"learning_rate": 5.866162629555141e-05,
"loss": 2.4586,
"step": 17720
},
{
"epoch": 1.31,
"grad_norm": 4.835690975189209,
"learning_rate": 5.855043636386467e-05,
"loss": 2.7115,
"step": 17730
},
{
"epoch": 1.31,
"grad_norm": 5.365401268005371,
"learning_rate": 5.8439308273351915e-05,
"loss": 2.4824,
"step": 17740
},
{
"epoch": 1.31,
"grad_norm": 4.931309700012207,
"learning_rate": 5.832824218981206e-05,
"loss": 2.8054,
"step": 17750
},
{
"epoch": 1.31,
"grad_norm": 5.70919942855835,
"learning_rate": 5.821723827895145e-05,
"loss": 2.4396,
"step": 17760
},
{
"epoch": 1.31,
"grad_norm": 4.619261741638184,
"learning_rate": 5.810629670638372e-05,
"loss": 2.6127,
"step": 17770
},
{
"epoch": 1.31,
"grad_norm": 7.530084133148193,
"learning_rate": 5.7995417637629533e-05,
"loss": 2.3805,
"step": 17780
},
{
"epoch": 1.31,
"grad_norm": 7.491077899932861,
"learning_rate": 5.788460123811617e-05,
"loss": 2.5465,
"step": 17790
},
{
"epoch": 1.31,
"grad_norm": 5.97875452041626,
"learning_rate": 5.777384767317755e-05,
"loss": 2.9236,
"step": 17800
},
{
"epoch": 1.31,
"eval_loss": 2.7564563751220703,
"eval_runtime": 1093.0048,
"eval_samples_per_second": 5.215,
"eval_steps_per_second": 5.215,
"step": 17800
},
{
"epoch": 1.32,
"grad_norm": 4.824826717376709,
"learning_rate": 5.7663157108053726e-05,
"loss": 2.7555,
"step": 17810
},
{
"epoch": 1.32,
"grad_norm": 7.008066654205322,
"learning_rate": 5.7552529707890846e-05,
"loss": 2.7833,
"step": 17820
},
{
"epoch": 1.32,
"grad_norm": 7.4979119300842285,
"learning_rate": 5.744196563774081e-05,
"loss": 2.7585,
"step": 17830
},
{
"epoch": 1.32,
"grad_norm": 10.446072578430176,
"learning_rate": 5.7331465062560955e-05,
"loss": 2.4665,
"step": 17840
},
{
"epoch": 1.32,
"grad_norm": 7.174097537994385,
"learning_rate": 5.722102814721397e-05,
"loss": 2.7389,
"step": 17850
},
{
"epoch": 1.32,
"grad_norm": 4.553163528442383,
"learning_rate": 5.711065505646758e-05,
"loss": 2.3752,
"step": 17860
},
{
"epoch": 1.32,
"grad_norm": 7.095092296600342,
"learning_rate": 5.7000345954994195e-05,
"loss": 2.6126,
"step": 17870
},
{
"epoch": 1.32,
"grad_norm": 4.0461225509643555,
"learning_rate": 5.6890101007370774e-05,
"loss": 2.6694,
"step": 17880
},
{
"epoch": 1.32,
"grad_norm": 4.112511157989502,
"learning_rate": 5.677992037807862e-05,
"loss": 2.5869,
"step": 17890
},
{
"epoch": 1.32,
"grad_norm": 4.1515936851501465,
"learning_rate": 5.6669804231503044e-05,
"loss": 2.605,
"step": 17900
},
{
"epoch": 1.32,
"grad_norm": 5.27680778503418,
"learning_rate": 5.65597527319332e-05,
"loss": 2.6241,
"step": 17910
},
{
"epoch": 1.32,
"grad_norm": 5.956172943115234,
"learning_rate": 5.64497660435617e-05,
"loss": 2.5378,
"step": 17920
},
{
"epoch": 1.32,
"grad_norm": 4.933371543884277,
"learning_rate": 5.633984433048447e-05,
"loss": 2.5712,
"step": 17930
},
{
"epoch": 1.33,
"grad_norm": 4.546905040740967,
"learning_rate": 5.622998775670056e-05,
"loss": 2.5774,
"step": 17940
},
{
"epoch": 1.33,
"grad_norm": 6.605489730834961,
"learning_rate": 5.612019648611182e-05,
"loss": 2.5219,
"step": 17950
},
{
"epoch": 1.33,
"grad_norm": 4.056662559509277,
"learning_rate": 5.6010470682522676e-05,
"loss": 2.5671,
"step": 17960
},
{
"epoch": 1.33,
"grad_norm": 5.21044397354126,
"learning_rate": 5.590081050963982e-05,
"loss": 2.2072,
"step": 17970
},
{
"epoch": 1.33,
"grad_norm": 4.24269437789917,
"learning_rate": 5.579121613107203e-05,
"loss": 2.529,
"step": 17980
},
{
"epoch": 1.33,
"grad_norm": 8.877058982849121,
"learning_rate": 5.568168771033e-05,
"loss": 2.728,
"step": 17990
},
{
"epoch": 1.33,
"grad_norm": 5.2844719886779785,
"learning_rate": 5.557222541082595e-05,
"loss": 2.5198,
"step": 18000
},
{
"epoch": 1.33,
"eval_loss": 2.754932403564453,
"eval_runtime": 1090.3866,
"eval_samples_per_second": 5.228,
"eval_steps_per_second": 5.228,
"step": 18000
},
{
"epoch": 1.33,
"grad_norm": 5.77738618850708,
"learning_rate": 5.546282939587354e-05,
"loss": 2.4213,
"step": 18010
},
{
"epoch": 1.33,
"grad_norm": 8.9447660446167,
"learning_rate": 5.535349982868741e-05,
"loss": 2.6623,
"step": 18020
},
{
"epoch": 1.33,
"grad_norm": 4.4816203117370605,
"learning_rate": 5.524423687238307e-05,
"loss": 2.6124,
"step": 18030
},
{
"epoch": 1.33,
"grad_norm": 6.370791912078857,
"learning_rate": 5.513504068997677e-05,
"loss": 2.705,
"step": 18040
},
{
"epoch": 1.33,
"grad_norm": 7.344057083129883,
"learning_rate": 5.502591144438505e-05,
"loss": 2.5722,
"step": 18050
},
{
"epoch": 1.33,
"grad_norm": 3.716496706008911,
"learning_rate": 5.4916849298424625e-05,
"loss": 2.6213,
"step": 18060
},
{
"epoch": 1.33,
"grad_norm": 4.81427001953125,
"learning_rate": 5.4807854414812046e-05,
"loss": 2.5988,
"step": 18070
},
{
"epoch": 1.34,
"grad_norm": 4.7489824295043945,
"learning_rate": 5.46989269561635e-05,
"loss": 2.578,
"step": 18080
},
{
"epoch": 1.34,
"grad_norm": 4.938182353973389,
"learning_rate": 5.4590067084994634e-05,
"loss": 2.3349,
"step": 18090
},
{
"epoch": 1.34,
"grad_norm": 5.349028587341309,
"learning_rate": 5.4481274963720286e-05,
"loss": 2.4367,
"step": 18100
},
{
"epoch": 1.34,
"grad_norm": 3.091707468032837,
"learning_rate": 5.437255075465415e-05,
"loss": 2.5173,
"step": 18110
},
{
"epoch": 1.34,
"grad_norm": 3.6265087127685547,
"learning_rate": 5.4263894620008626e-05,
"loss": 2.5161,
"step": 18120
},
{
"epoch": 1.34,
"grad_norm": 4.735933780670166,
"learning_rate": 5.4155306721894464e-05,
"loss": 2.6293,
"step": 18130
},
{
"epoch": 1.34,
"grad_norm": 9.483357429504395,
"learning_rate": 5.404678722232075e-05,
"loss": 2.3463,
"step": 18140
},
{
"epoch": 1.34,
"grad_norm": 2.9575343132019043,
"learning_rate": 5.3938336283194424e-05,
"loss": 2.522,
"step": 18150
},
{
"epoch": 1.34,
"grad_norm": 5.901381969451904,
"learning_rate": 5.382995406632021e-05,
"loss": 2.6077,
"step": 18160
},
{
"epoch": 1.34,
"grad_norm": 5.906281471252441,
"learning_rate": 5.3721640733400205e-05,
"loss": 2.6513,
"step": 18170
},
{
"epoch": 1.34,
"grad_norm": 6.043822288513184,
"learning_rate": 5.361339644603385e-05,
"loss": 2.707,
"step": 18180
},
{
"epoch": 1.34,
"grad_norm": 7.317911148071289,
"learning_rate": 5.350522136571742e-05,
"loss": 2.7309,
"step": 18190
},
{
"epoch": 1.34,
"grad_norm": 3.808610439300537,
"learning_rate": 5.339711565384408e-05,
"loss": 2.7111,
"step": 18200
},
{
"epoch": 1.34,
"eval_loss": 2.749652624130249,
"eval_runtime": 1093.3945,
"eval_samples_per_second": 5.213,
"eval_steps_per_second": 5.213,
"step": 18200
},
{
"epoch": 1.35,
"grad_norm": 6.145906925201416,
"learning_rate": 5.328907947170346e-05,
"loss": 2.5983,
"step": 18210
},
{
"epoch": 1.35,
"grad_norm": 6.049194812774658,
"learning_rate": 5.3181112980481386e-05,
"loss": 3.05,
"step": 18220
},
{
"epoch": 1.35,
"grad_norm": 8.137819290161133,
"learning_rate": 5.307321634125983e-05,
"loss": 2.5698,
"step": 18230
},
{
"epoch": 1.35,
"grad_norm": 5.600856781005859,
"learning_rate": 5.2965389715016414e-05,
"loss": 2.4588,
"step": 18240
},
{
"epoch": 1.35,
"grad_norm": 4.875741481781006,
"learning_rate": 5.2857633262624365e-05,
"loss": 2.7632,
"step": 18250
},
{
"epoch": 1.35,
"grad_norm": 6.16823673248291,
"learning_rate": 5.274994714485229e-05,
"loss": 2.6179,
"step": 18260
},
{
"epoch": 1.35,
"grad_norm": 6.03982400894165,
"learning_rate": 5.264233152236371e-05,
"loss": 2.676,
"step": 18270
},
{
"epoch": 1.35,
"grad_norm": 6.995283603668213,
"learning_rate": 5.2534786555717106e-05,
"loss": 2.6739,
"step": 18280
},
{
"epoch": 1.35,
"grad_norm": 5.1484270095825195,
"learning_rate": 5.24273124053654e-05,
"loss": 2.5794,
"step": 18290
},
{
"epoch": 1.35,
"grad_norm": 4.117734432220459,
"learning_rate": 5.231990923165604e-05,
"loss": 2.5715,
"step": 18300
},
{
"epoch": 1.35,
"grad_norm": 4.1332268714904785,
"learning_rate": 5.221257719483037e-05,
"loss": 2.5544,
"step": 18310
},
{
"epoch": 1.35,
"grad_norm": 5.754079341888428,
"learning_rate": 5.210531645502379e-05,
"loss": 2.5192,
"step": 18320
},
{
"epoch": 1.35,
"grad_norm": 4.778247833251953,
"learning_rate": 5.199812717226525e-05,
"loss": 2.4673,
"step": 18330
},
{
"epoch": 1.35,
"grad_norm": 4.264052391052246,
"learning_rate": 5.189100950647703e-05,
"loss": 2.7163,
"step": 18340
},
{
"epoch": 1.36,
"grad_norm": 6.049769401550293,
"learning_rate": 5.178396361747471e-05,
"loss": 2.4899,
"step": 18350
},
{
"epoch": 1.36,
"grad_norm": 4.8760762214660645,
"learning_rate": 5.1676989664966566e-05,
"loss": 2.6234,
"step": 18360
},
{
"epoch": 1.36,
"grad_norm": 4.067619323730469,
"learning_rate": 5.1570087808553745e-05,
"loss": 2.6173,
"step": 18370
},
{
"epoch": 1.36,
"grad_norm": 5.356283187866211,
"learning_rate": 5.146325820772979e-05,
"loss": 2.5618,
"step": 18380
},
{
"epoch": 1.36,
"grad_norm": 5.027037143707275,
"learning_rate": 5.135650102188032e-05,
"loss": 2.3784,
"step": 18390
},
{
"epoch": 1.36,
"grad_norm": 7.661667823791504,
"learning_rate": 5.124981641028307e-05,
"loss": 2.4899,
"step": 18400
},
{
"epoch": 1.36,
"eval_loss": 2.7469968795776367,
"eval_runtime": 1090.5801,
"eval_samples_per_second": 5.227,
"eval_steps_per_second": 5.227,
"step": 18400
},
{
"epoch": 1.36,
"grad_norm": 5.477719306945801,
"learning_rate": 5.114320453210737e-05,
"loss": 2.6192,
"step": 18410
},
{
"epoch": 1.36,
"grad_norm": 4.8712077140808105,
"learning_rate": 5.1036665546414107e-05,
"loss": 2.6542,
"step": 18420
},
{
"epoch": 1.36,
"grad_norm": 4.96636438369751,
"learning_rate": 5.0930199612155474e-05,
"loss": 2.7382,
"step": 18430
},
{
"epoch": 1.36,
"grad_norm": 5.233584880828857,
"learning_rate": 5.082380688817447e-05,
"loss": 2.812,
"step": 18440
},
{
"epoch": 1.36,
"grad_norm": 6.871877193450928,
"learning_rate": 5.0717487533205134e-05,
"loss": 2.5341,
"step": 18450
},
{
"epoch": 1.36,
"grad_norm": 8.461257934570312,
"learning_rate": 5.061124170587177e-05,
"loss": 2.4915,
"step": 18460
},
{
"epoch": 1.36,
"grad_norm": 7.310083866119385,
"learning_rate": 5.05050695646892e-05,
"loss": 2.6074,
"step": 18470
},
{
"epoch": 1.37,
"grad_norm": 4.759759426116943,
"learning_rate": 5.039897126806219e-05,
"loss": 2.7039,
"step": 18480
},
{
"epoch": 1.37,
"grad_norm": 6.0547661781311035,
"learning_rate": 5.029294697428546e-05,
"loss": 2.512,
"step": 18490
},
{
"epoch": 1.37,
"grad_norm": 7.052810192108154,
"learning_rate": 5.018699684154309e-05,
"loss": 2.5677,
"step": 18500
},
{
"epoch": 1.37,
"grad_norm": 5.241086959838867,
"learning_rate": 5.0081121027908694e-05,
"loss": 2.5115,
"step": 18510
},
{
"epoch": 1.37,
"grad_norm": 6.727292537689209,
"learning_rate": 4.997531969134498e-05,
"loss": 2.563,
"step": 18520
},
{
"epoch": 1.37,
"grad_norm": 4.072869777679443,
"learning_rate": 4.986959298970352e-05,
"loss": 2.3717,
"step": 18530
},
{
"epoch": 1.37,
"grad_norm": 5.985363006591797,
"learning_rate": 4.976394108072458e-05,
"loss": 2.6702,
"step": 18540
},
{
"epoch": 1.37,
"grad_norm": 8.397250175476074,
"learning_rate": 4.965836412203676e-05,
"loss": 2.3954,
"step": 18550
},
{
"epoch": 1.37,
"grad_norm": 6.862022876739502,
"learning_rate": 4.9552862271156816e-05,
"loss": 2.8558,
"step": 18560
},
{
"epoch": 1.37,
"grad_norm": 6.360130310058594,
"learning_rate": 4.9447435685489554e-05,
"loss": 2.6074,
"step": 18570
},
{
"epoch": 1.37,
"grad_norm": 7.378839492797852,
"learning_rate": 4.934208452232743e-05,
"loss": 2.566,
"step": 18580
},
{
"epoch": 1.37,
"grad_norm": 5.3151445388793945,
"learning_rate": 4.92368089388504e-05,
"loss": 2.6158,
"step": 18590
},
{
"epoch": 1.37,
"grad_norm": 5.593037128448486,
"learning_rate": 4.913160909212561e-05,
"loss": 2.4031,
"step": 18600
},
{
"epoch": 1.37,
"eval_loss": 2.7402687072753906,
"eval_runtime": 1093.0065,
"eval_samples_per_second": 5.215,
"eval_steps_per_second": 5.215,
"step": 18600
},
{
"epoch": 1.37,
"grad_norm": 5.234645843505859,
"learning_rate": 4.9026485139107206e-05,
"loss": 2.4703,
"step": 18610
},
{
"epoch": 1.38,
"grad_norm": 4.557468414306641,
"learning_rate": 4.892143723663615e-05,
"loss": 2.6366,
"step": 18620
},
{
"epoch": 1.38,
"grad_norm": 5.67350435256958,
"learning_rate": 4.8816465541439926e-05,
"loss": 2.5127,
"step": 18630
},
{
"epoch": 1.38,
"grad_norm": 4.1222357749938965,
"learning_rate": 4.8711570210132355e-05,
"loss": 2.7097,
"step": 18640
},
{
"epoch": 1.38,
"grad_norm": 8.09947681427002,
"learning_rate": 4.860675139921326e-05,
"loss": 2.5276,
"step": 18650
},
{
"epoch": 1.38,
"grad_norm": 5.646274566650391,
"learning_rate": 4.850200926506826e-05,
"loss": 2.5764,
"step": 18660
},
{
"epoch": 1.38,
"grad_norm": 5.521486759185791,
"learning_rate": 4.83973439639687e-05,
"loss": 2.6867,
"step": 18670
},
{
"epoch": 1.38,
"grad_norm": 7.946648120880127,
"learning_rate": 4.829275565207126e-05,
"loss": 2.6472,
"step": 18680
},
{
"epoch": 1.38,
"grad_norm": 5.645473480224609,
"learning_rate": 4.8188244485417656e-05,
"loss": 2.8183,
"step": 18690
},
{
"epoch": 1.38,
"grad_norm": 4.875026226043701,
"learning_rate": 4.8083810619934655e-05,
"loss": 2.6745,
"step": 18700
},
{
"epoch": 1.38,
"grad_norm": 6.1913838386535645,
"learning_rate": 4.797945421143353e-05,
"loss": 2.5512,
"step": 18710
},
{
"epoch": 1.38,
"grad_norm": 4.89860725402832,
"learning_rate": 4.7875175415610116e-05,
"loss": 2.6048,
"step": 18720
},
{
"epoch": 1.38,
"grad_norm": 6.097682476043701,
"learning_rate": 4.7770974388044465e-05,
"loss": 2.4741,
"step": 18730
},
{
"epoch": 1.38,
"grad_norm": 11.050512313842773,
"learning_rate": 4.7666851284200474e-05,
"loss": 2.9075,
"step": 18740
},
{
"epoch": 1.39,
"grad_norm": 3.9821629524230957,
"learning_rate": 4.756280625942592e-05,
"loss": 2.4667,
"step": 18750
},
{
"epoch": 1.39,
"grad_norm": 5.043511390686035,
"learning_rate": 4.745883946895195e-05,
"loss": 2.622,
"step": 18760
},
{
"epoch": 1.39,
"grad_norm": 5.638186931610107,
"learning_rate": 4.735495106789313e-05,
"loss": 2.5786,
"step": 18770
},
{
"epoch": 1.39,
"grad_norm": 4.257643699645996,
"learning_rate": 4.7251141211247006e-05,
"loss": 2.6245,
"step": 18780
},
{
"epoch": 1.39,
"grad_norm": 4.530847549438477,
"learning_rate": 4.714741005389389e-05,
"loss": 2.6005,
"step": 18790
},
{
"epoch": 1.39,
"grad_norm": 6.788181781768799,
"learning_rate": 4.704375775059676e-05,
"loss": 2.5644,
"step": 18800
},
{
"epoch": 1.39,
"eval_loss": 2.730058193206787,
"eval_runtime": 1092.4553,
"eval_samples_per_second": 5.218,
"eval_steps_per_second": 5.218,
"step": 18800
},
{
"epoch": 1.39,
"grad_norm": 6.159169673919678,
"learning_rate": 4.694018445600096e-05,
"loss": 2.6734,
"step": 18810
},
{
"epoch": 1.39,
"grad_norm": 4.513409614562988,
"learning_rate": 4.683669032463381e-05,
"loss": 2.3646,
"step": 18820
},
{
"epoch": 1.39,
"grad_norm": 4.685541152954102,
"learning_rate": 4.673327551090473e-05,
"loss": 2.7987,
"step": 18830
},
{
"epoch": 1.39,
"grad_norm": 6.203521251678467,
"learning_rate": 4.662994016910458e-05,
"loss": 3.0138,
"step": 18840
},
{
"epoch": 1.39,
"grad_norm": 7.593812465667725,
"learning_rate": 4.652668445340583e-05,
"loss": 2.5891,
"step": 18850
},
{
"epoch": 1.39,
"grad_norm": 7.254190921783447,
"learning_rate": 4.642350851786212e-05,
"loss": 2.6145,
"step": 18860
},
{
"epoch": 1.39,
"grad_norm": 5.389431953430176,
"learning_rate": 4.632041251640794e-05,
"loss": 2.5423,
"step": 18870
},
{
"epoch": 1.39,
"grad_norm": 4.145481109619141,
"learning_rate": 4.6217396602858676e-05,
"loss": 2.3867,
"step": 18880
},
{
"epoch": 1.4,
"grad_norm": 3.993748426437378,
"learning_rate": 4.61144609309101e-05,
"loss": 2.5064,
"step": 18890
},
{
"epoch": 1.4,
"grad_norm": 3.0699574947357178,
"learning_rate": 4.601160565413834e-05,
"loss": 2.6125,
"step": 18900
},
{
"epoch": 1.4,
"grad_norm": 4.14170503616333,
"learning_rate": 4.5908830925999625e-05,
"loss": 2.3033,
"step": 18910
},
{
"epoch": 1.4,
"grad_norm": 5.7811689376831055,
"learning_rate": 4.580613689982989e-05,
"loss": 2.5909,
"step": 18920
},
{
"epoch": 1.4,
"grad_norm": 4.923642158508301,
"learning_rate": 4.5703523728844675e-05,
"loss": 2.7412,
"step": 18930
},
{
"epoch": 1.4,
"grad_norm": 5.698610782623291,
"learning_rate": 4.560099156613898e-05,
"loss": 2.553,
"step": 18940
},
{
"epoch": 1.4,
"grad_norm": 7.011173248291016,
"learning_rate": 4.549854056468691e-05,
"loss": 2.6452,
"step": 18950
},
{
"epoch": 1.4,
"grad_norm": 4.988110542297363,
"learning_rate": 4.539617087734148e-05,
"loss": 2.5394,
"step": 18960
},
{
"epoch": 1.4,
"grad_norm": 7.155890941619873,
"learning_rate": 4.529388265683434e-05,
"loss": 2.4347,
"step": 18970
},
{
"epoch": 1.4,
"grad_norm": 5.443312644958496,
"learning_rate": 4.51916760557756e-05,
"loss": 2.6015,
"step": 18980
},
{
"epoch": 1.4,
"grad_norm": 4.91843318939209,
"learning_rate": 4.508955122665366e-05,
"loss": 2.5659,
"step": 18990
},
{
"epoch": 1.4,
"grad_norm": 4.711748123168945,
"learning_rate": 4.498750832183488e-05,
"loss": 2.4967,
"step": 19000
},
{
"epoch": 1.4,
"eval_loss": 2.7299466133117676,
"eval_runtime": 1091.1855,
"eval_samples_per_second": 5.224,
"eval_steps_per_second": 5.224,
"step": 19000
},
{
"epoch": 1.4,
"grad_norm": 7.943491458892822,
"learning_rate": 4.488554749356344e-05,
"loss": 2.3547,
"step": 19010
},
{
"epoch": 1.41,
"grad_norm": 3.8169167041778564,
"learning_rate": 4.478366889396099e-05,
"loss": 2.7277,
"step": 19020
},
{
"epoch": 1.41,
"grad_norm": 6.11760950088501,
"learning_rate": 4.468187267502647e-05,
"loss": 2.7133,
"step": 19030
},
{
"epoch": 1.41,
"grad_norm": 6.223377227783203,
"learning_rate": 4.4580158988636035e-05,
"loss": 2.5129,
"step": 19040
},
{
"epoch": 1.41,
"grad_norm": 4.303272724151611,
"learning_rate": 4.447852798654262e-05,
"loss": 2.3198,
"step": 19050
},
{
"epoch": 1.41,
"grad_norm": 8.338922500610352,
"learning_rate": 4.4376979820375866e-05,
"loss": 2.4968,
"step": 19060
},
{
"epoch": 1.41,
"grad_norm": 10.990848541259766,
"learning_rate": 4.427551464164173e-05,
"loss": 2.785,
"step": 19070
},
{
"epoch": 1.41,
"grad_norm": 6.105620861053467,
"learning_rate": 4.4184267060155825e-05,
"loss": 2.5712,
"step": 19080
},
{
"epoch": 1.41,
"grad_norm": 4.769411087036133,
"learning_rate": 4.408295997449907e-05,
"loss": 2.5135,
"step": 19090
},
{
"epoch": 1.41,
"grad_norm": 5.428181171417236,
"learning_rate": 4.398173631494139e-05,
"loss": 2.6994,
"step": 19100
},
{
"epoch": 1.41,
"grad_norm": 3.8140740394592285,
"learning_rate": 4.388059623250466e-05,
"loss": 2.7718,
"step": 19110
},
{
"epoch": 1.41,
"grad_norm": 4.616511821746826,
"learning_rate": 4.3779539878085964e-05,
"loss": 2.5677,
"step": 19120
},
{
"epoch": 1.41,
"grad_norm": 5.239737033843994,
"learning_rate": 4.367856740245764e-05,
"loss": 2.7527,
"step": 19130
},
{
"epoch": 1.41,
"grad_norm": 5.1812286376953125,
"learning_rate": 4.3577678956266676e-05,
"loss": 2.586,
"step": 19140
},
{
"epoch": 1.41,
"grad_norm": 4.772936820983887,
"learning_rate": 4.3476874690034875e-05,
"loss": 2.4089,
"step": 19150
},
{
"epoch": 1.42,
"grad_norm": 9.186141014099121,
"learning_rate": 4.337615475415838e-05,
"loss": 2.5755,
"step": 19160
},
{
"epoch": 1.42,
"grad_norm": 4.864750385284424,
"learning_rate": 4.327551929890745e-05,
"loss": 2.6029,
"step": 19170
},
{
"epoch": 1.42,
"grad_norm": 6.291383266448975,
"learning_rate": 4.317496847442639e-05,
"loss": 2.5028,
"step": 19180
},
{
"epoch": 1.42,
"grad_norm": 4.985967636108398,
"learning_rate": 4.3074502430733256e-05,
"loss": 2.574,
"step": 19190
},
{
"epoch": 1.42,
"grad_norm": 4.993092060089111,
"learning_rate": 4.297412131771952e-05,
"loss": 2.5018,
"step": 19200
},
{
"epoch": 1.42,
"eval_loss": 2.727829694747925,
"eval_runtime": 1092.1951,
"eval_samples_per_second": 5.219,
"eval_steps_per_second": 5.219,
"step": 19200
},
{
"epoch": 1.42,
"grad_norm": 4.054487228393555,
"learning_rate": 4.287382528514996e-05,
"loss": 2.4302,
"step": 19210
},
{
"epoch": 1.42,
"grad_norm": 12.623319625854492,
"learning_rate": 4.277361448266247e-05,
"loss": 2.575,
"step": 19220
},
{
"epoch": 1.42,
"grad_norm": 5.172916889190674,
"learning_rate": 4.267348905976777e-05,
"loss": 2.7427,
"step": 19230
},
{
"epoch": 1.42,
"grad_norm": 7.442451477050781,
"learning_rate": 4.257344916584922e-05,
"loss": 2.7931,
"step": 19240
},
{
"epoch": 1.42,
"grad_norm": 5.107058525085449,
"learning_rate": 4.247349495016252e-05,
"loss": 2.4842,
"step": 19250
},
{
"epoch": 1.42,
"grad_norm": 7.573449611663818,
"learning_rate": 4.23736265618355e-05,
"loss": 2.8292,
"step": 19260
},
{
"epoch": 1.42,
"grad_norm": 5.7733917236328125,
"learning_rate": 4.227384414986805e-05,
"loss": 2.4985,
"step": 19270
},
{
"epoch": 1.42,
"grad_norm": 4.382335662841797,
"learning_rate": 4.217414786313173e-05,
"loss": 2.4164,
"step": 19280
},
{
"epoch": 1.42,
"grad_norm": 6.469529628753662,
"learning_rate": 4.2074537850369654e-05,
"loss": 2.5815,
"step": 19290
},
{
"epoch": 1.43,
"grad_norm": 3.817382335662842,
"learning_rate": 4.197501426019614e-05,
"loss": 2.3491,
"step": 19300
},
{
"epoch": 1.43,
"grad_norm": 5.766961097717285,
"learning_rate": 4.1875577241096564e-05,
"loss": 2.457,
"step": 19310
},
{
"epoch": 1.43,
"grad_norm": 4.1226019859313965,
"learning_rate": 4.177622694142722e-05,
"loss": 2.443,
"step": 19320
},
{
"epoch": 1.43,
"grad_norm": 4.610818862915039,
"learning_rate": 4.167696350941498e-05,
"loss": 2.6016,
"step": 19330
},
{
"epoch": 1.43,
"grad_norm": 4.487005710601807,
"learning_rate": 4.157778709315715e-05,
"loss": 2.5832,
"step": 19340
},
{
"epoch": 1.43,
"grad_norm": 4.705280303955078,
"learning_rate": 4.147869784062113e-05,
"loss": 2.553,
"step": 19350
},
{
"epoch": 1.43,
"grad_norm": 5.880077838897705,
"learning_rate": 4.137969589964429e-05,
"loss": 2.4362,
"step": 19360
},
{
"epoch": 1.43,
"grad_norm": 3.722841262817383,
"learning_rate": 4.12807814179338e-05,
"loss": 2.5962,
"step": 19370
},
{
"epoch": 1.43,
"grad_norm": 5.202775955200195,
"learning_rate": 4.118195454306631e-05,
"loss": 2.4903,
"step": 19380
},
{
"epoch": 1.43,
"grad_norm": 4.760529518127441,
"learning_rate": 4.108321542248781e-05,
"loss": 2.3325,
"step": 19390
},
{
"epoch": 1.43,
"grad_norm": 6.372382164001465,
"learning_rate": 4.098456420351324e-05,
"loss": 2.6689,
"step": 19400
},
{
"epoch": 1.43,
"eval_loss": 2.723548412322998,
"eval_runtime": 1094.6965,
"eval_samples_per_second": 5.207,
"eval_steps_per_second": 5.207,
"step": 19400
},
{
"epoch": 1.43,
"grad_norm": 5.136544704437256,
"learning_rate": 4.088600103332648e-05,
"loss": 2.8788,
"step": 19410
},
{
"epoch": 1.43,
"grad_norm": 5.261312961578369,
"learning_rate": 4.078752605898005e-05,
"loss": 2.5705,
"step": 19420
},
{
"epoch": 1.44,
"grad_norm": 5.200085163116455,
"learning_rate": 4.0689139427394864e-05,
"loss": 2.6097,
"step": 19430
},
{
"epoch": 1.44,
"grad_norm": 4.0969977378845215,
"learning_rate": 4.0590841285360084e-05,
"loss": 2.3152,
"step": 19440
},
{
"epoch": 1.44,
"grad_norm": 4.328812599182129,
"learning_rate": 4.049263177953277e-05,
"loss": 2.598,
"step": 19450
},
{
"epoch": 1.44,
"grad_norm": 5.58969259262085,
"learning_rate": 4.039451105643772e-05,
"loss": 2.4586,
"step": 19460
},
{
"epoch": 1.44,
"grad_norm": 8.861074447631836,
"learning_rate": 4.029647926246739e-05,
"loss": 2.4843,
"step": 19470
},
{
"epoch": 1.44,
"grad_norm": 5.041561126708984,
"learning_rate": 4.019853654388146e-05,
"loss": 2.4352,
"step": 19480
},
{
"epoch": 1.44,
"grad_norm": 5.229025840759277,
"learning_rate": 4.01006830468068e-05,
"loss": 2.9516,
"step": 19490
},
{
"epoch": 1.44,
"grad_norm": 6.096444129943848,
"learning_rate": 4.000291891723706e-05,
"loss": 2.6971,
"step": 19500
},
{
"epoch": 1.44,
"grad_norm": 3.951528549194336,
"learning_rate": 3.9905244301032595e-05,
"loss": 2.5596,
"step": 19510
},
{
"epoch": 1.44,
"grad_norm": 7.2364325523376465,
"learning_rate": 3.9807659343920235e-05,
"loss": 2.5888,
"step": 19520
},
{
"epoch": 1.44,
"grad_norm": 6.946869373321533,
"learning_rate": 3.971016419149303e-05,
"loss": 2.5522,
"step": 19530
},
{
"epoch": 1.44,
"grad_norm": 7.022960662841797,
"learning_rate": 3.9612758989210083e-05,
"loss": 2.6643,
"step": 19540
},
{
"epoch": 1.44,
"grad_norm": 4.149036884307861,
"learning_rate": 3.951544388239619e-05,
"loss": 2.4732,
"step": 19550
},
{
"epoch": 1.44,
"grad_norm": 7.235793113708496,
"learning_rate": 3.941821901624185e-05,
"loss": 2.5966,
"step": 19560
},
{
"epoch": 1.45,
"grad_norm": 5.136077404022217,
"learning_rate": 3.932108453580281e-05,
"loss": 2.6064,
"step": 19570
},
{
"epoch": 1.45,
"grad_norm": 5.46553373336792,
"learning_rate": 3.9224040586000045e-05,
"loss": 2.6474,
"step": 19580
},
{
"epoch": 1.45,
"grad_norm": 4.688199043273926,
"learning_rate": 3.9127087311619496e-05,
"loss": 2.5544,
"step": 19590
},
{
"epoch": 1.45,
"grad_norm": 6.985490322113037,
"learning_rate": 3.903022485731168e-05,
"loss": 2.6272,
"step": 19600
},
{
"epoch": 1.45,
"eval_loss": 2.7148196697235107,
"eval_runtime": 1096.5876,
"eval_samples_per_second": 5.198,
"eval_steps_per_second": 5.198,
"step": 19600
},
{
"epoch": 1.45,
"grad_norm": 5.419033050537109,
"learning_rate": 3.8933453367591774e-05,
"loss": 2.3508,
"step": 19610
},
{
"epoch": 1.45,
"grad_norm": 4.328287601470947,
"learning_rate": 3.883677298683909e-05,
"loss": 2.4653,
"step": 19620
},
{
"epoch": 1.45,
"grad_norm": 6.014868259429932,
"learning_rate": 3.874018385929715e-05,
"loss": 2.6006,
"step": 19630
},
{
"epoch": 1.45,
"grad_norm": 4.715216159820557,
"learning_rate": 3.864368612907321e-05,
"loss": 2.8378,
"step": 19640
},
{
"epoch": 1.45,
"grad_norm": 5.374291896820068,
"learning_rate": 3.8547279940138225e-05,
"loss": 2.834,
"step": 19650
},
{
"epoch": 1.45,
"grad_norm": 4.934390068054199,
"learning_rate": 3.8450965436326626e-05,
"loss": 2.5945,
"step": 19660
},
{
"epoch": 1.45,
"grad_norm": 5.506863594055176,
"learning_rate": 3.83547427613359e-05,
"loss": 2.5895,
"step": 19670
},
{
"epoch": 1.45,
"grad_norm": 4.630877494812012,
"learning_rate": 3.825861205872672e-05,
"loss": 2.6303,
"step": 19680
},
{
"epoch": 1.45,
"grad_norm": 4.430076599121094,
"learning_rate": 3.816257347192234e-05,
"loss": 2.3571,
"step": 19690
},
{
"epoch": 1.46,
"grad_norm": 4.289999008178711,
"learning_rate": 3.8066627144208734e-05,
"loss": 2.4513,
"step": 19700
},
{
"epoch": 1.46,
"grad_norm": 4.023924350738525,
"learning_rate": 3.7970773218734216e-05,
"loss": 2.4787,
"step": 19710
},
{
"epoch": 1.46,
"grad_norm": 4.857785701751709,
"learning_rate": 3.787501183850912e-05,
"loss": 2.4347,
"step": 19720
},
{
"epoch": 1.46,
"grad_norm": 4.032500267028809,
"learning_rate": 3.777934314640587e-05,
"loss": 2.5699,
"step": 19730
},
{
"epoch": 1.46,
"grad_norm": 6.004321575164795,
"learning_rate": 3.768376728515844e-05,
"loss": 2.6813,
"step": 19740
},
{
"epoch": 1.46,
"grad_norm": 4.519407749176025,
"learning_rate": 3.758828439736242e-05,
"loss": 2.4588,
"step": 19750
},
{
"epoch": 1.46,
"grad_norm": 4.536065578460693,
"learning_rate": 3.749289462547469e-05,
"loss": 2.5396,
"step": 19760
},
{
"epoch": 1.46,
"grad_norm": 6.415857315063477,
"learning_rate": 3.739759811181308e-05,
"loss": 2.5567,
"step": 19770
},
{
"epoch": 1.46,
"grad_norm": 5.36800479888916,
"learning_rate": 3.7302394998556456e-05,
"loss": 2.5154,
"step": 19780
},
{
"epoch": 1.46,
"grad_norm": 3.876528024673462,
"learning_rate": 3.720728542774417e-05,
"loss": 2.4376,
"step": 19790
},
{
"epoch": 1.46,
"grad_norm": 7.150769233703613,
"learning_rate": 3.711226954127611e-05,
"loss": 2.5285,
"step": 19800
},
{
"epoch": 1.46,
"eval_loss": 2.7195167541503906,
"eval_runtime": 1090.5668,
"eval_samples_per_second": 5.227,
"eval_steps_per_second": 5.227,
"step": 19800
},
{
"epoch": 1.46,
"grad_norm": 6.845495700836182,
"learning_rate": 3.7017347480912426e-05,
"loss": 2.5522,
"step": 19810
},
{
"epoch": 1.46,
"grad_norm": 4.888938903808594,
"learning_rate": 3.692251938827317e-05,
"loss": 2.6649,
"step": 19820
},
{
"epoch": 1.46,
"grad_norm": 6.482171535491943,
"learning_rate": 3.6827785404838224e-05,
"loss": 2.539,
"step": 19830
},
{
"epoch": 1.47,
"grad_norm": 6.012960433959961,
"learning_rate": 3.6733145671947136e-05,
"loss": 2.465,
"step": 19840
},
{
"epoch": 1.47,
"grad_norm": 5.3928656578063965,
"learning_rate": 3.663860033079879e-05,
"loss": 2.4433,
"step": 19850
},
{
"epoch": 1.47,
"grad_norm": 7.735469818115234,
"learning_rate": 3.654414952245123e-05,
"loss": 2.6487,
"step": 19860
},
{
"epoch": 1.47,
"grad_norm": 4.888444900512695,
"learning_rate": 3.644979338782152e-05,
"loss": 2.4914,
"step": 19870
},
{
"epoch": 1.47,
"grad_norm": 6.5980424880981445,
"learning_rate": 3.635553206768538e-05,
"loss": 2.5173,
"step": 19880
},
{
"epoch": 1.47,
"grad_norm": 5.8707475662231445,
"learning_rate": 3.6261365702677095e-05,
"loss": 2.7204,
"step": 19890
},
{
"epoch": 1.47,
"grad_norm": 5.8201093673706055,
"learning_rate": 3.616729443328934e-05,
"loss": 2.409,
"step": 19900
},
{
"epoch": 1.47,
"grad_norm": 7.474509239196777,
"learning_rate": 3.607331839987287e-05,
"loss": 2.7956,
"step": 19910
},
{
"epoch": 1.47,
"grad_norm": 3.6222445964813232,
"learning_rate": 3.597943774263639e-05,
"loss": 2.7459,
"step": 19920
},
{
"epoch": 1.47,
"grad_norm": 7.91470193862915,
"learning_rate": 3.588565260164624e-05,
"loss": 2.654,
"step": 19930
},
{
"epoch": 1.47,
"grad_norm": 7.238543510437012,
"learning_rate": 3.5791963116826244e-05,
"loss": 2.909,
"step": 19940
},
{
"epoch": 1.47,
"grad_norm": 2.490121603012085,
"learning_rate": 3.56983694279576e-05,
"loss": 2.634,
"step": 19950
},
{
"epoch": 1.47,
"grad_norm": 7.118973731994629,
"learning_rate": 3.560487167467853e-05,
"loss": 2.5066,
"step": 19960
},
{
"epoch": 1.48,
"grad_norm": 4.224281311035156,
"learning_rate": 3.551146999648417e-05,
"loss": 2.555,
"step": 19970
},
{
"epoch": 1.48,
"grad_norm": 5.849978923797607,
"learning_rate": 3.541816453272623e-05,
"loss": 2.8908,
"step": 19980
},
{
"epoch": 1.48,
"grad_norm": 4.005553245544434,
"learning_rate": 3.532495542261288e-05,
"loss": 2.3425,
"step": 19990
},
{
"epoch": 1.48,
"grad_norm": 5.376830577850342,
"learning_rate": 3.523184280520863e-05,
"loss": 2.5874,
"step": 20000
},
{
"epoch": 1.48,
"eval_loss": 2.714773416519165,
"eval_runtime": 1096.8675,
"eval_samples_per_second": 5.197,
"eval_steps_per_second": 5.197,
"step": 20000
},
{
"epoch": 1.48,
"grad_norm": 7.455637454986572,
"learning_rate": 3.5138826819433965e-05,
"loss": 2.2953,
"step": 20010
},
{
"epoch": 1.48,
"grad_norm": 6.0181965827941895,
"learning_rate": 3.504590760406517e-05,
"loss": 2.642,
"step": 20020
},
{
"epoch": 1.48,
"grad_norm": 7.365159034729004,
"learning_rate": 3.4953085297734224e-05,
"loss": 2.7916,
"step": 20030
},
{
"epoch": 1.48,
"grad_norm": 5.694006443023682,
"learning_rate": 3.486036003892842e-05,
"loss": 2.4513,
"step": 20040
},
{
"epoch": 1.48,
"grad_norm": 4.591248512268066,
"learning_rate": 3.476773196599037e-05,
"loss": 2.4705,
"step": 20050
},
{
"epoch": 1.48,
"grad_norm": 8.414265632629395,
"learning_rate": 3.467520121711765e-05,
"loss": 2.7573,
"step": 20060
},
{
"epoch": 1.48,
"grad_norm": 5.675021171569824,
"learning_rate": 3.458276793036257e-05,
"loss": 2.5484,
"step": 20070
},
{
"epoch": 1.48,
"grad_norm": 4.582470417022705,
"learning_rate": 3.449043224363214e-05,
"loss": 2.5106,
"step": 20080
},
{
"epoch": 1.48,
"grad_norm": 5.4494309425354,
"learning_rate": 3.439819429468764e-05,
"loss": 2.6096,
"step": 20090
},
{
"epoch": 1.48,
"grad_norm": 9.734436988830566,
"learning_rate": 3.430605422114461e-05,
"loss": 2.5521,
"step": 20100
},
{
"epoch": 1.49,
"grad_norm": 6.490894317626953,
"learning_rate": 3.421401216047256e-05,
"loss": 2.6084,
"step": 20110
},
{
"epoch": 1.49,
"grad_norm": 4.981866359710693,
"learning_rate": 3.412206824999471e-05,
"loss": 2.6881,
"step": 20120
},
{
"epoch": 1.49,
"grad_norm": 6.633049964904785,
"learning_rate": 3.403022262688793e-05,
"loss": 2.569,
"step": 20130
},
{
"epoch": 1.49,
"grad_norm": 6.05472469329834,
"learning_rate": 3.3938475428182336e-05,
"loss": 2.4273,
"step": 20140
},
{
"epoch": 1.49,
"grad_norm": 7.141064167022705,
"learning_rate": 3.384682679076129e-05,
"loss": 2.4215,
"step": 20150
},
{
"epoch": 1.49,
"grad_norm": 6.378678798675537,
"learning_rate": 3.3755276851361116e-05,
"loss": 2.3028,
"step": 20160
},
{
"epoch": 1.49,
"grad_norm": 6.042534828186035,
"learning_rate": 3.366382574657078e-05,
"loss": 2.6589,
"step": 20170
},
{
"epoch": 1.49,
"grad_norm": 7.929354667663574,
"learning_rate": 3.357247361283189e-05,
"loss": 2.6183,
"step": 20180
},
{
"epoch": 1.49,
"grad_norm": 4.1936140060424805,
"learning_rate": 3.348122058643838e-05,
"loss": 2.4308,
"step": 20190
},
{
"epoch": 1.49,
"grad_norm": 6.097403049468994,
"learning_rate": 3.339006680353627e-05,
"loss": 2.3012,
"step": 20200
},
{
"epoch": 1.49,
"eval_loss": 2.7094500064849854,
"eval_runtime": 1096.4703,
"eval_samples_per_second": 5.198,
"eval_steps_per_second": 5.198,
"step": 20200
},
{
"epoch": 1.49,
"grad_norm": 5.574031829833984,
"learning_rate": 3.329901240012352e-05,
"loss": 2.8104,
"step": 20210
},
{
"epoch": 1.49,
"grad_norm": 4.519078254699707,
"learning_rate": 3.320805751204985e-05,
"loss": 2.7359,
"step": 20220
},
{
"epoch": 1.49,
"grad_norm": 6.293169975280762,
"learning_rate": 3.311720227501652e-05,
"loss": 2.6634,
"step": 20230
},
{
"epoch": 1.5,
"grad_norm": 4.480935573577881,
"learning_rate": 3.302644682457612e-05,
"loss": 2.3742,
"step": 20240
},
{
"epoch": 1.5,
"grad_norm": 4.8552446365356445,
"learning_rate": 3.293579129613228e-05,
"loss": 2.708,
"step": 20250
},
{
"epoch": 1.5,
"grad_norm": 5.601837158203125,
"learning_rate": 3.28452358249396e-05,
"loss": 2.3895,
"step": 20260
},
{
"epoch": 1.5,
"grad_norm": 4.053748607635498,
"learning_rate": 3.275478054610342e-05,
"loss": 2.2767,
"step": 20270
},
{
"epoch": 1.5,
"grad_norm": 4.6459550857543945,
"learning_rate": 3.2664425594579575e-05,
"loss": 2.427,
"step": 20280
},
{
"epoch": 1.5,
"grad_norm": 5.87542724609375,
"learning_rate": 3.2574171105174256e-05,
"loss": 2.6417,
"step": 20290
},
{
"epoch": 1.5,
"grad_norm": 6.246367931365967,
"learning_rate": 3.24840172125437e-05,
"loss": 2.5537,
"step": 20300
},
{
"epoch": 1.5,
"grad_norm": 4.897169589996338,
"learning_rate": 3.239396405119407e-05,
"loss": 2.7603,
"step": 20310
},
{
"epoch": 1.5,
"grad_norm": 5.356862545013428,
"learning_rate": 3.230401175548127e-05,
"loss": 2.3876,
"step": 20320
},
{
"epoch": 1.5,
"grad_norm": 5.569219589233398,
"learning_rate": 3.221416045961072e-05,
"loss": 2.577,
"step": 20330
},
{
"epoch": 1.5,
"grad_norm": 5.912481307983398,
"learning_rate": 3.2124410297637174e-05,
"loss": 2.5768,
"step": 20340
},
{
"epoch": 1.5,
"grad_norm": 5.4451494216918945,
"learning_rate": 3.203476140346443e-05,
"loss": 2.689,
"step": 20350
},
{
"epoch": 1.5,
"grad_norm": 3.8255879878997803,
"learning_rate": 3.1945213910845193e-05,
"loss": 2.4786,
"step": 20360
},
{
"epoch": 1.5,
"grad_norm": 5.024571418762207,
"learning_rate": 3.185576795338095e-05,
"loss": 2.3988,
"step": 20370
},
{
"epoch": 1.51,
"grad_norm": 5.674569606781006,
"learning_rate": 3.1766423664521685e-05,
"loss": 2.6459,
"step": 20380
},
{
"epoch": 1.51,
"grad_norm": 5.376116752624512,
"learning_rate": 3.167718117756571e-05,
"loss": 2.5263,
"step": 20390
},
{
"epoch": 1.51,
"grad_norm": 4.720499038696289,
"learning_rate": 3.1588040625659375e-05,
"loss": 2.8163,
"step": 20400
},
{
"epoch": 1.51,
"eval_loss": 2.702810525894165,
"eval_runtime": 1093.5293,
"eval_samples_per_second": 5.212,
"eval_steps_per_second": 5.212,
"step": 20400
},
{
"epoch": 1.51,
"grad_norm": 4.117152690887451,
"learning_rate": 3.1499002141796985e-05,
"loss": 2.403,
"step": 20410
},
{
"epoch": 1.51,
"grad_norm": 8.465569496154785,
"learning_rate": 3.1410065858820593e-05,
"loss": 2.4733,
"step": 20420
},
{
"epoch": 1.51,
"grad_norm": 5.661840438842773,
"learning_rate": 3.132123190941977e-05,
"loss": 2.4563,
"step": 20430
},
{
"epoch": 1.51,
"grad_norm": 4.873353958129883,
"learning_rate": 3.1232500426131416e-05,
"loss": 2.286,
"step": 20440
},
{
"epoch": 1.51,
"grad_norm": 5.124981880187988,
"learning_rate": 3.11438715413395e-05,
"loss": 2.5421,
"step": 20450
},
{
"epoch": 1.51,
"grad_norm": 5.187690734863281,
"learning_rate": 3.1055345387274906e-05,
"loss": 2.4144,
"step": 20460
},
{
"epoch": 1.51,
"grad_norm": 3.4242801666259766,
"learning_rate": 3.096692209601535e-05,
"loss": 2.6162,
"step": 20470
},
{
"epoch": 1.51,
"grad_norm": 4.927826404571533,
"learning_rate": 3.0878601799485006e-05,
"loss": 2.5308,
"step": 20480
},
{
"epoch": 1.51,
"grad_norm": 7.429085731506348,
"learning_rate": 3.079038462945444e-05,
"loss": 2.4955,
"step": 20490
},
{
"epoch": 1.51,
"grad_norm": 6.658217430114746,
"learning_rate": 3.070227071754024e-05,
"loss": 2.6021,
"step": 20500
},
{
"epoch": 1.52,
"grad_norm": 4.40215539932251,
"learning_rate": 3.061426019520509e-05,
"loss": 2.547,
"step": 20510
},
{
"epoch": 1.52,
"grad_norm": 4.97898530960083,
"learning_rate": 3.052635319375729e-05,
"loss": 2.8336,
"step": 20520
},
{
"epoch": 1.52,
"grad_norm": 7.03468132019043,
"learning_rate": 3.043854984435076e-05,
"loss": 2.7139,
"step": 20530
},
{
"epoch": 1.52,
"grad_norm": 5.653247833251953,
"learning_rate": 3.03508502779848e-05,
"loss": 2.4009,
"step": 20540
},
{
"epoch": 1.52,
"grad_norm": 8.55075454711914,
"learning_rate": 3.026325462550378e-05,
"loss": 2.4069,
"step": 20550
},
{
"epoch": 1.52,
"grad_norm": 4.287876605987549,
"learning_rate": 3.0175763017597125e-05,
"loss": 2.6115,
"step": 20560
},
{
"epoch": 1.52,
"grad_norm": 5.143221855163574,
"learning_rate": 3.0088375584798933e-05,
"loss": 2.3582,
"step": 20570
},
{
"epoch": 1.52,
"grad_norm": 6.826074123382568,
"learning_rate": 3.0001092457487978e-05,
"loss": 2.6807,
"step": 20580
},
{
"epoch": 1.52,
"grad_norm": 6.902110576629639,
"learning_rate": 2.991391376588739e-05,
"loss": 2.5424,
"step": 20590
},
{
"epoch": 1.52,
"grad_norm": 6.487607955932617,
"learning_rate": 2.9826839640064408e-05,
"loss": 2.3803,
"step": 20600
},
{
"epoch": 1.52,
"eval_loss": 2.6999261379241943,
"eval_runtime": 1093.9515,
"eval_samples_per_second": 5.21,
"eval_steps_per_second": 5.21,
"step": 20600
},
{
"epoch": 1.52,
"grad_norm": 5.772730350494385,
"learning_rate": 2.9739870209930375e-05,
"loss": 2.5028,
"step": 20610
},
{
"epoch": 1.52,
"grad_norm": 7.393251419067383,
"learning_rate": 2.9653005605240324e-05,
"loss": 2.536,
"step": 20620
},
{
"epoch": 1.52,
"grad_norm": 6.139245510101318,
"learning_rate": 2.9566245955592987e-05,
"loss": 2.4364,
"step": 20630
},
{
"epoch": 1.52,
"grad_norm": 5.206151962280273,
"learning_rate": 2.947959139043043e-05,
"loss": 2.1824,
"step": 20640
},
{
"epoch": 1.53,
"grad_norm": 5.136007308959961,
"learning_rate": 2.9393042039037976e-05,
"loss": 2.4632,
"step": 20650
},
{
"epoch": 1.53,
"grad_norm": 7.334249496459961,
"learning_rate": 2.9306598030544008e-05,
"loss": 2.8071,
"step": 20660
},
{
"epoch": 1.53,
"grad_norm": 5.497274398803711,
"learning_rate": 2.9220259493919657e-05,
"loss": 2.7154,
"step": 20670
},
{
"epoch": 1.53,
"grad_norm": 5.575246334075928,
"learning_rate": 2.9134026557978777e-05,
"loss": 2.5416,
"step": 20680
},
{
"epoch": 1.53,
"grad_norm": 4.933965682983398,
"learning_rate": 2.9047899351377595e-05,
"loss": 2.5452,
"step": 20690
},
{
"epoch": 1.53,
"grad_norm": 6.082450866699219,
"learning_rate": 2.896187800261464e-05,
"loss": 2.5025,
"step": 20700
},
{
"epoch": 1.53,
"grad_norm": 4.525998115539551,
"learning_rate": 2.8875962640030528e-05,
"loss": 2.3187,
"step": 20710
},
{
"epoch": 1.53,
"grad_norm": 4.0856099128723145,
"learning_rate": 2.8790153391807662e-05,
"loss": 2.2128,
"step": 20720
},
{
"epoch": 1.53,
"grad_norm": 5.021278381347656,
"learning_rate": 2.870445038597025e-05,
"loss": 2.5521,
"step": 20730
},
{
"epoch": 1.53,
"grad_norm": 6.382571697235107,
"learning_rate": 2.8618853750383835e-05,
"loss": 2.4939,
"step": 20740
},
{
"epoch": 1.53,
"grad_norm": 10.189557075500488,
"learning_rate": 2.8533363612755393e-05,
"loss": 2.7418,
"step": 20750
},
{
"epoch": 1.53,
"grad_norm": 8.443877220153809,
"learning_rate": 2.8447980100632987e-05,
"loss": 2.7598,
"step": 20760
},
{
"epoch": 1.53,
"grad_norm": 4.629593372344971,
"learning_rate": 2.8362703341405517e-05,
"loss": 2.4299,
"step": 20770
},
{
"epoch": 1.54,
"grad_norm": 4.1399617195129395,
"learning_rate": 2.827753346230273e-05,
"loss": 2.5201,
"step": 20780
},
{
"epoch": 1.54,
"grad_norm": 4.630882263183594,
"learning_rate": 2.819247059039477e-05,
"loss": 2.7113,
"step": 20790
},
{
"epoch": 1.54,
"grad_norm": 5.218183994293213,
"learning_rate": 2.8107514852592255e-05,
"loss": 2.6152,
"step": 20800
},
{
"epoch": 1.54,
"eval_loss": 2.699847936630249,
"eval_runtime": 1093.3276,
"eval_samples_per_second": 5.213,
"eval_steps_per_second": 5.213,
"step": 20800
},
{
"epoch": 1.54,
"grad_norm": 5.238626956939697,
"learning_rate": 2.802266637564591e-05,
"loss": 2.4939,
"step": 20810
},
{
"epoch": 1.54,
"grad_norm": 6.299570083618164,
"learning_rate": 2.7937925286146484e-05,
"loss": 2.5987,
"step": 20820
},
{
"epoch": 1.54,
"grad_norm": 6.078366756439209,
"learning_rate": 2.785329171052442e-05,
"loss": 2.5886,
"step": 20830
},
{
"epoch": 1.54,
"grad_norm": 4.5963521003723145,
"learning_rate": 2.7768765775049775e-05,
"loss": 2.2237,
"step": 20840
},
{
"epoch": 1.54,
"grad_norm": 7.452169895172119,
"learning_rate": 2.768434760583205e-05,
"loss": 2.3485,
"step": 20850
},
{
"epoch": 1.54,
"grad_norm": 6.703926086425781,
"learning_rate": 2.760003732881995e-05,
"loss": 2.9375,
"step": 20860
},
{
"epoch": 1.54,
"grad_norm": 4.925634860992432,
"learning_rate": 2.7515835069801255e-05,
"loss": 2.5594,
"step": 20870
},
{
"epoch": 1.54,
"grad_norm": 5.643716812133789,
"learning_rate": 2.7431740954402474e-05,
"loss": 2.3271,
"step": 20880
},
{
"epoch": 1.54,
"grad_norm": 5.306772232055664,
"learning_rate": 2.7347755108088824e-05,
"loss": 2.6106,
"step": 20890
},
{
"epoch": 1.54,
"grad_norm": 6.240164279937744,
"learning_rate": 2.7263877656164015e-05,
"loss": 2.3511,
"step": 20900
},
{
"epoch": 1.54,
"grad_norm": 7.3478474617004395,
"learning_rate": 2.7180108723770025e-05,
"loss": 2.602,
"step": 20910
},
{
"epoch": 1.55,
"grad_norm": 7.65614652633667,
"learning_rate": 2.7096448435886944e-05,
"loss": 2.3937,
"step": 20920
},
{
"epoch": 1.55,
"grad_norm": 7.315620422363281,
"learning_rate": 2.701289691733272e-05,
"loss": 2.5605,
"step": 20930
},
{
"epoch": 1.55,
"grad_norm": 4.321962833404541,
"learning_rate": 2.692945429276301e-05,
"loss": 2.5002,
"step": 20940
},
{
"epoch": 1.55,
"grad_norm": 3.468332052230835,
"learning_rate": 2.6846120686671072e-05,
"loss": 2.5641,
"step": 20950
},
{
"epoch": 1.55,
"grad_norm": 6.9545183181762695,
"learning_rate": 2.6762896223387467e-05,
"loss": 2.5489,
"step": 20960
},
{
"epoch": 1.55,
"grad_norm": 4.801777362823486,
"learning_rate": 2.6679781027079975e-05,
"loss": 2.4346,
"step": 20970
},
{
"epoch": 1.55,
"grad_norm": 5.563615322113037,
"learning_rate": 2.6596775221753277e-05,
"loss": 2.7003,
"step": 20980
},
{
"epoch": 1.55,
"grad_norm": 4.222386837005615,
"learning_rate": 2.651387893124885e-05,
"loss": 2.7923,
"step": 20990
},
{
"epoch": 1.55,
"grad_norm": 4.765193939208984,
"learning_rate": 2.643109227924484e-05,
"loss": 2.7056,
"step": 21000
},
{
"epoch": 1.55,
"eval_loss": 2.69392466545105,
"eval_runtime": 1095.952,
"eval_samples_per_second": 5.201,
"eval_steps_per_second": 5.201,
"step": 21000
},
{
"epoch": 1.55,
"grad_norm": 6.603006839752197,
"learning_rate": 2.634841538925582e-05,
"loss": 2.7542,
"step": 21010
},
{
"epoch": 1.55,
"grad_norm": 4.909721851348877,
"learning_rate": 2.6265848384632498e-05,
"loss": 2.5161,
"step": 21020
},
{
"epoch": 1.55,
"grad_norm": 5.59537935256958,
"learning_rate": 2.6183391388561785e-05,
"loss": 2.4003,
"step": 21030
},
{
"epoch": 1.55,
"grad_norm": 4.364444255828857,
"learning_rate": 2.6101044524066308e-05,
"loss": 2.3831,
"step": 21040
},
{
"epoch": 1.55,
"grad_norm": 3.9003069400787354,
"learning_rate": 2.6018807914004496e-05,
"loss": 2.4646,
"step": 21050
},
{
"epoch": 1.56,
"grad_norm": 3.842813491821289,
"learning_rate": 2.5936681681070285e-05,
"loss": 2.5775,
"step": 21060
},
{
"epoch": 1.56,
"grad_norm": 6.952861309051514,
"learning_rate": 2.585466594779282e-05,
"loss": 2.7062,
"step": 21070
},
{
"epoch": 1.56,
"grad_norm": 7.845983028411865,
"learning_rate": 2.5772760836536534e-05,
"loss": 2.4487,
"step": 21080
},
{
"epoch": 1.56,
"grad_norm": 3.9339027404785156,
"learning_rate": 2.5690966469500665e-05,
"loss": 2.5145,
"step": 21090
},
{
"epoch": 1.56,
"grad_norm": 7.971899032592773,
"learning_rate": 2.560928296871934e-05,
"loss": 2.5572,
"step": 21100
},
{
"epoch": 1.56,
"grad_norm": 5.591660976409912,
"learning_rate": 2.5527710456061272e-05,
"loss": 2.5267,
"step": 21110
},
{
"epoch": 1.56,
"grad_norm": 6.092624187469482,
"learning_rate": 2.5446249053229486e-05,
"loss": 2.6155,
"step": 21120
},
{
"epoch": 1.56,
"grad_norm": 6.59454870223999,
"learning_rate": 2.5364898881761325e-05,
"loss": 2.3968,
"step": 21130
},
{
"epoch": 1.56,
"grad_norm": 5.123286247253418,
"learning_rate": 2.5283660063028193e-05,
"loss": 2.8023,
"step": 21140
},
{
"epoch": 1.56,
"grad_norm": 6.058019638061523,
"learning_rate": 2.520253271823525e-05,
"loss": 2.4902,
"step": 21150
},
{
"epoch": 1.56,
"grad_norm": 4.217723369598389,
"learning_rate": 2.5121516968421476e-05,
"loss": 2.4366,
"step": 21160
},
{
"epoch": 1.56,
"grad_norm": 7.757789134979248,
"learning_rate": 2.5040612934459228e-05,
"loss": 2.6324,
"step": 21170
},
{
"epoch": 1.56,
"grad_norm": 4.6392388343811035,
"learning_rate": 2.4959820737054297e-05,
"loss": 2.6145,
"step": 21180
},
{
"epoch": 1.57,
"grad_norm": 4.291707992553711,
"learning_rate": 2.487914049674559e-05,
"loss": 2.5307,
"step": 21190
},
{
"epoch": 1.57,
"grad_norm": 4.865896701812744,
"learning_rate": 2.47985723339049e-05,
"loss": 2.408,
"step": 21200
},
{
"epoch": 1.57,
"eval_loss": 2.69248366355896,
"eval_runtime": 1095.3132,
"eval_samples_per_second": 5.204,
"eval_steps_per_second": 5.204,
"step": 21200
},
{
"epoch": 1.57,
"grad_norm": 4.253567218780518,
"learning_rate": 2.4718116368736922e-05,
"loss": 2.622,
"step": 21210
},
{
"epoch": 1.57,
"grad_norm": 3.9619877338409424,
"learning_rate": 2.463777272127884e-05,
"loss": 2.472,
"step": 21220
},
{
"epoch": 1.57,
"grad_norm": 6.162944793701172,
"learning_rate": 2.4557541511400352e-05,
"loss": 2.5967,
"step": 21230
},
{
"epoch": 1.57,
"grad_norm": 7.676807880401611,
"learning_rate": 2.4477422858803413e-05,
"loss": 2.5567,
"step": 21240
},
{
"epoch": 1.57,
"grad_norm": 4.426161766052246,
"learning_rate": 2.4397416883021973e-05,
"loss": 2.5195,
"step": 21250
},
{
"epoch": 1.57,
"grad_norm": 4.014848709106445,
"learning_rate": 2.4317523703421884e-05,
"loss": 2.4935,
"step": 21260
},
{
"epoch": 1.57,
"grad_norm": 4.517611503601074,
"learning_rate": 2.4237743439200757e-05,
"loss": 2.7503,
"step": 21270
},
{
"epoch": 1.57,
"grad_norm": 5.451789855957031,
"learning_rate": 2.4158076209387703e-05,
"loss": 2.6794,
"step": 21280
},
{
"epoch": 1.57,
"grad_norm": 5.650362968444824,
"learning_rate": 2.407852213284325e-05,
"loss": 2.6837,
"step": 21290
},
{
"epoch": 1.57,
"grad_norm": 5.634609699249268,
"learning_rate": 2.3999081328259033e-05,
"loss": 2.1458,
"step": 21300
},
{
"epoch": 1.57,
"grad_norm": 7.945886135101318,
"learning_rate": 2.391975391415766e-05,
"loss": 2.588,
"step": 21310
},
{
"epoch": 1.57,
"grad_norm": 5.702952861785889,
"learning_rate": 2.3840540008892676e-05,
"loss": 2.5176,
"step": 21320
},
{
"epoch": 1.58,
"grad_norm": 4.617548942565918,
"learning_rate": 2.3761439730648194e-05,
"loss": 2.5231,
"step": 21330
},
{
"epoch": 1.58,
"grad_norm": 9.549835205078125,
"learning_rate": 2.368245319743887e-05,
"loss": 2.5527,
"step": 21340
},
{
"epoch": 1.58,
"grad_norm": 3.8928442001342773,
"learning_rate": 2.360358052710957e-05,
"loss": 2.52,
"step": 21350
},
{
"epoch": 1.58,
"grad_norm": 7.256139755249023,
"learning_rate": 2.3524821837335297e-05,
"loss": 2.8356,
"step": 21360
},
{
"epoch": 1.58,
"grad_norm": 6.023710250854492,
"learning_rate": 2.344617724562105e-05,
"loss": 2.7982,
"step": 21370
},
{
"epoch": 1.58,
"grad_norm": 7.712351322174072,
"learning_rate": 2.3367646869301574e-05,
"loss": 2.535,
"step": 21380
},
{
"epoch": 1.58,
"grad_norm": 5.238154888153076,
"learning_rate": 2.328923082554123e-05,
"loss": 2.4871,
"step": 21390
},
{
"epoch": 1.58,
"grad_norm": 6.418647289276123,
"learning_rate": 2.3210929231333755e-05,
"loss": 2.4464,
"step": 21400
},
{
"epoch": 1.58,
"eval_loss": 2.6876254081726074,
"eval_runtime": 1093.9145,
"eval_samples_per_second": 5.211,
"eval_steps_per_second": 5.211,
"step": 21400
},
{
"epoch": 1.58,
"grad_norm": 4.497880458831787,
"learning_rate": 2.3132742203502123e-05,
"loss": 2.7903,
"step": 21410
},
{
"epoch": 1.58,
"grad_norm": 5.7589898109436035,
"learning_rate": 2.305466985869844e-05,
"loss": 2.6637,
"step": 21420
},
{
"epoch": 1.58,
"grad_norm": 5.456647872924805,
"learning_rate": 2.297671231340367e-05,
"loss": 2.5943,
"step": 21430
},
{
"epoch": 1.58,
"grad_norm": 5.261030673980713,
"learning_rate": 2.2898869683927528e-05,
"loss": 2.5029,
"step": 21440
},
{
"epoch": 1.58,
"grad_norm": 4.238167762756348,
"learning_rate": 2.2821142086408222e-05,
"loss": 2.6113,
"step": 21450
},
{
"epoch": 1.59,
"grad_norm": 9.860156059265137,
"learning_rate": 2.274352963681242e-05,
"loss": 2.9236,
"step": 21460
},
{
"epoch": 1.59,
"grad_norm": 5.734950542449951,
"learning_rate": 2.2666032450934903e-05,
"loss": 2.2808,
"step": 21470
},
{
"epoch": 1.59,
"grad_norm": 3.944988250732422,
"learning_rate": 2.2588650644398545e-05,
"loss": 2.5142,
"step": 21480
},
{
"epoch": 1.59,
"grad_norm": 6.458616256713867,
"learning_rate": 2.2511384332654083e-05,
"loss": 2.7614,
"step": 21490
},
{
"epoch": 1.59,
"grad_norm": 9.047236442565918,
"learning_rate": 2.2434233630979884e-05,
"loss": 2.5371,
"step": 21500
},
{
"epoch": 1.59,
"grad_norm": 12.842032432556152,
"learning_rate": 2.2357198654481892e-05,
"loss": 2.7668,
"step": 21510
},
{
"epoch": 1.59,
"grad_norm": 5.303598880767822,
"learning_rate": 2.2280279518093326e-05,
"loss": 2.6603,
"step": 21520
},
{
"epoch": 1.59,
"grad_norm": 6.416645526885986,
"learning_rate": 2.2203476336574646e-05,
"loss": 2.5208,
"step": 21530
},
{
"epoch": 1.59,
"grad_norm": 4.682002544403076,
"learning_rate": 2.21267892245133e-05,
"loss": 2.7197,
"step": 21540
},
{
"epoch": 1.59,
"grad_norm": 6.208341121673584,
"learning_rate": 2.205021829632349e-05,
"loss": 2.5291,
"step": 21550
},
{
"epoch": 1.59,
"grad_norm": 5.015642166137695,
"learning_rate": 2.1973763666246194e-05,
"loss": 2.5605,
"step": 21560
},
{
"epoch": 1.59,
"grad_norm": 4.047297477722168,
"learning_rate": 2.1897425448348742e-05,
"loss": 2.4668,
"step": 21570
},
{
"epoch": 1.59,
"grad_norm": 6.200460433959961,
"learning_rate": 2.182120375652491e-05,
"loss": 2.5086,
"step": 21580
},
{
"epoch": 1.59,
"grad_norm": 6.616320610046387,
"learning_rate": 2.1745098704494572e-05,
"loss": 2.4152,
"step": 21590
},
{
"epoch": 1.6,
"grad_norm": 5.158884048461914,
"learning_rate": 2.1669110405803517e-05,
"loss": 2.6802,
"step": 21600
},
{
"epoch": 1.6,
"eval_loss": 2.684189796447754,
"eval_runtime": 1097.2459,
"eval_samples_per_second": 5.195,
"eval_steps_per_second": 5.195,
"step": 21600
},
{
"epoch": 1.6,
"grad_norm": 6.151003837585449,
"learning_rate": 2.1593238973823472e-05,
"loss": 2.5556,
"step": 21610
},
{
"epoch": 1.6,
"grad_norm": 5.922985553741455,
"learning_rate": 2.1517484521751663e-05,
"loss": 2.6471,
"step": 21620
},
{
"epoch": 1.6,
"grad_norm": 3.364727735519409,
"learning_rate": 2.1441847162610916e-05,
"loss": 2.3658,
"step": 21630
},
{
"epoch": 1.6,
"grad_norm": 5.081273078918457,
"learning_rate": 2.1366327009249233e-05,
"loss": 2.5731,
"step": 21640
},
{
"epoch": 1.6,
"grad_norm": 7.894616603851318,
"learning_rate": 2.1290924174339844e-05,
"loss": 2.6044,
"step": 21650
},
{
"epoch": 1.6,
"grad_norm": 4.1407012939453125,
"learning_rate": 2.1215638770380953e-05,
"loss": 2.3113,
"step": 21660
},
{
"epoch": 1.6,
"grad_norm": 7.667937278747559,
"learning_rate": 2.114047090969544e-05,
"loss": 2.615,
"step": 21670
},
{
"epoch": 1.6,
"grad_norm": 5.139069557189941,
"learning_rate": 2.106542070443098e-05,
"loss": 2.7862,
"step": 21680
},
{
"epoch": 1.6,
"grad_norm": 8.500158309936523,
"learning_rate": 2.099048826655957e-05,
"loss": 2.5791,
"step": 21690
},
{
"epoch": 1.6,
"grad_norm": 3.9246647357940674,
"learning_rate": 2.091567370787757e-05,
"loss": 2.627,
"step": 21700
},
{
"epoch": 1.6,
"grad_norm": 4.196277618408203,
"learning_rate": 2.0840977140005503e-05,
"loss": 2.6593,
"step": 21710
},
{
"epoch": 1.6,
"grad_norm": 5.34571647644043,
"learning_rate": 2.0766398674387744e-05,
"loss": 2.6297,
"step": 21720
},
{
"epoch": 1.61,
"grad_norm": 9.215928077697754,
"learning_rate": 2.0691938422292577e-05,
"loss": 2.5687,
"step": 21730
},
{
"epoch": 1.61,
"grad_norm": 7.45725679397583,
"learning_rate": 2.0617596494811843e-05,
"loss": 2.5245,
"step": 21740
},
{
"epoch": 1.61,
"grad_norm": 5.027177810668945,
"learning_rate": 2.0543373002860877e-05,
"loss": 2.611,
"step": 21750
},
{
"epoch": 1.61,
"grad_norm": 5.864018440246582,
"learning_rate": 2.0469268057178315e-05,
"loss": 2.426,
"step": 21760
},
{
"epoch": 1.61,
"grad_norm": 5.623456954956055,
"learning_rate": 2.0395281768325947e-05,
"loss": 2.6679,
"step": 21770
},
{
"epoch": 1.61,
"grad_norm": 8.044170379638672,
"learning_rate": 2.0321414246688476e-05,
"loss": 2.5729,
"step": 21780
},
{
"epoch": 1.61,
"grad_norm": 7.187014102935791,
"learning_rate": 2.024766560247341e-05,
"loss": 2.6013,
"step": 21790
},
{
"epoch": 1.61,
"grad_norm": 4.8793158531188965,
"learning_rate": 2.0174035945710957e-05,
"loss": 2.377,
"step": 21800
},
{
"epoch": 1.61,
"eval_loss": 2.6814467906951904,
"eval_runtime": 1095.2107,
"eval_samples_per_second": 5.204,
"eval_steps_per_second": 5.204,
"step": 21800
},
{
"epoch": 1.61,
"grad_norm": 8.16999626159668,
"learning_rate": 2.0100525386253766e-05,
"loss": 2.6537,
"step": 21810
},
{
"epoch": 1.61,
"grad_norm": 5.531657695770264,
"learning_rate": 2.0027134033776828e-05,
"loss": 2.7857,
"step": 21820
},
{
"epoch": 1.61,
"grad_norm": 5.026412487030029,
"learning_rate": 1.995386199777721e-05,
"loss": 2.6778,
"step": 21830
},
{
"epoch": 1.61,
"grad_norm": 6.896015167236328,
"learning_rate": 1.988070938757399e-05,
"loss": 2.5839,
"step": 21840
},
{
"epoch": 1.61,
"grad_norm": 7.109387397766113,
"learning_rate": 1.980767631230812e-05,
"loss": 2.8903,
"step": 21850
},
{
"epoch": 1.61,
"grad_norm": 6.354283809661865,
"learning_rate": 1.973476288094216e-05,
"loss": 2.3177,
"step": 21860
},
{
"epoch": 1.62,
"grad_norm": 7.274041652679443,
"learning_rate": 1.96619692022602e-05,
"loss": 2.5199,
"step": 21870
},
{
"epoch": 1.62,
"grad_norm": 6.3600664138793945,
"learning_rate": 1.9596557369757285e-05,
"loss": 2.5857,
"step": 21880
},
{
"epoch": 1.62,
"grad_norm": 5.527103424072266,
"learning_rate": 1.9523991520234975e-05,
"loss": 2.7053,
"step": 21890
},
{
"epoch": 1.62,
"grad_norm": 4.095846176147461,
"learning_rate": 1.945154573785949e-05,
"loss": 2.4275,
"step": 21900
},
{
"epoch": 1.62,
"grad_norm": 4.542167663574219,
"learning_rate": 1.93792201307172e-05,
"loss": 2.354,
"step": 21910
},
{
"epoch": 1.62,
"grad_norm": 5.139354705810547,
"learning_rate": 1.9307014806715183e-05,
"loss": 2.3141,
"step": 21920
},
{
"epoch": 1.62,
"grad_norm": 7.073459625244141,
"learning_rate": 1.923492987358101e-05,
"loss": 2.5897,
"step": 21930
},
{
"epoch": 1.62,
"grad_norm": 5.215823650360107,
"learning_rate": 1.916296543886269e-05,
"loss": 2.4426,
"step": 21940
},
{
"epoch": 1.62,
"grad_norm": 4.4041361808776855,
"learning_rate": 1.9091121609928386e-05,
"loss": 2.477,
"step": 21950
},
{
"epoch": 1.62,
"grad_norm": 7.190915584564209,
"learning_rate": 1.901939849396641e-05,
"loss": 2.7217,
"step": 21960
},
{
"epoch": 1.62,
"grad_norm": 5.785027980804443,
"learning_rate": 1.894779619798488e-05,
"loss": 2.3363,
"step": 21970
},
{
"epoch": 1.62,
"grad_norm": 5.730170726776123,
"learning_rate": 1.8876314828811713e-05,
"loss": 2.4102,
"step": 21980
},
{
"epoch": 1.62,
"grad_norm": 6.119355201721191,
"learning_rate": 1.8804954493094428e-05,
"loss": 2.5663,
"step": 21990
},
{
"epoch": 1.63,
"grad_norm": 6.51188325881958,
"learning_rate": 1.8733715297299892e-05,
"loss": 2.5035,
"step": 22000
},
{
"epoch": 1.63,
"eval_loss": 2.6791791915893555,
"eval_runtime": 1093.3935,
"eval_samples_per_second": 5.213,
"eval_steps_per_second": 5.213,
"step": 22000
},
{
"epoch": 1.63,
"grad_norm": 5.506747722625732,
"learning_rate": 1.8662597347714318e-05,
"loss": 2.6332,
"step": 22010
},
{
"epoch": 1.63,
"grad_norm": 7.371239185333252,
"learning_rate": 1.8591600750442927e-05,
"loss": 2.4252,
"step": 22020
},
{
"epoch": 1.63,
"grad_norm": 5.349908351898193,
"learning_rate": 1.8520725611409996e-05,
"loss": 2.5931,
"step": 22030
},
{
"epoch": 1.63,
"grad_norm": 5.594857215881348,
"learning_rate": 1.844997203635853e-05,
"loss": 2.3067,
"step": 22040
},
{
"epoch": 1.63,
"grad_norm": 4.631478786468506,
"learning_rate": 1.8379340130850166e-05,
"loss": 2.5666,
"step": 22050
},
{
"epoch": 1.63,
"grad_norm": 5.589487552642822,
"learning_rate": 1.8308830000265032e-05,
"loss": 2.4052,
"step": 22060
},
{
"epoch": 1.63,
"grad_norm": 10.57905387878418,
"learning_rate": 1.8238441749801537e-05,
"loss": 2.5351,
"step": 22070
},
{
"epoch": 1.63,
"grad_norm": 3.848583459854126,
"learning_rate": 1.81681754844763e-05,
"loss": 2.4262,
"step": 22080
},
{
"epoch": 1.63,
"grad_norm": 4.930076599121094,
"learning_rate": 1.8098031309123942e-05,
"loss": 2.4726,
"step": 22090
},
{
"epoch": 1.63,
"grad_norm": 5.635489463806152,
"learning_rate": 1.8028009328396844e-05,
"loss": 2.7213,
"step": 22100
},
{
"epoch": 1.63,
"grad_norm": 5.582231521606445,
"learning_rate": 1.795810964676521e-05,
"loss": 2.3556,
"step": 22110
},
{
"epoch": 1.63,
"grad_norm": 7.522580146789551,
"learning_rate": 1.788833236851666e-05,
"loss": 2.577,
"step": 22120
},
{
"epoch": 1.63,
"grad_norm": 6.316006183624268,
"learning_rate": 1.781867759775624e-05,
"loss": 2.4932,
"step": 22130
},
{
"epoch": 1.64,
"grad_norm": 4.130107879638672,
"learning_rate": 1.7749145438406255e-05,
"loss": 2.3233,
"step": 22140
},
{
"epoch": 1.64,
"grad_norm": 3.4111945629119873,
"learning_rate": 1.767973599420607e-05,
"loss": 2.4543,
"step": 22150
},
{
"epoch": 1.64,
"grad_norm": 3.7794103622436523,
"learning_rate": 1.7610449368711857e-05,
"loss": 2.2836,
"step": 22160
},
{
"epoch": 1.64,
"grad_norm": 5.900721073150635,
"learning_rate": 1.7541285665296658e-05,
"loss": 2.3802,
"step": 22170
},
{
"epoch": 1.64,
"grad_norm": 8.760246276855469,
"learning_rate": 1.7472244987150112e-05,
"loss": 2.3997,
"step": 22180
},
{
"epoch": 1.64,
"grad_norm": 5.007622718811035,
"learning_rate": 1.7403327437278273e-05,
"loss": 2.5783,
"step": 22190
},
{
"epoch": 1.64,
"grad_norm": 4.590503215789795,
"learning_rate": 1.7334533118503526e-05,
"loss": 2.4172,
"step": 22200
},
{
"epoch": 1.64,
"eval_loss": 2.676037549972534,
"eval_runtime": 1096.8129,
"eval_samples_per_second": 5.197,
"eval_steps_per_second": 5.197,
"step": 22200
},
{
"epoch": 1.64,
"grad_norm": 5.619079113006592,
"learning_rate": 1.7265862133464382e-05,
"loss": 2.67,
"step": 22210
},
{
"epoch": 1.64,
"grad_norm": 5.27069616317749,
"learning_rate": 1.7197314584615286e-05,
"loss": 2.4192,
"step": 22220
},
{
"epoch": 1.64,
"grad_norm": 5.923769950866699,
"learning_rate": 1.712889057422663e-05,
"loss": 2.585,
"step": 22230
},
{
"epoch": 1.64,
"grad_norm": 6.051741600036621,
"learning_rate": 1.706059020438442e-05,
"loss": 2.6307,
"step": 22240
},
{
"epoch": 1.64,
"grad_norm": 7.821314334869385,
"learning_rate": 1.699241357699023e-05,
"loss": 2.6883,
"step": 22250
},
{
"epoch": 1.64,
"grad_norm": 4.7659912109375,
"learning_rate": 1.6924360793760996e-05,
"loss": 2.7255,
"step": 22260
},
{
"epoch": 1.65,
"grad_norm": 5.253278732299805,
"learning_rate": 1.6856431956228835e-05,
"loss": 2.8009,
"step": 22270
},
{
"epoch": 1.65,
"grad_norm": 5.987473487854004,
"learning_rate": 1.678862716574103e-05,
"loss": 2.5018,
"step": 22280
},
{
"epoch": 1.65,
"grad_norm": 5.667232990264893,
"learning_rate": 1.672094652345977e-05,
"loss": 2.6063,
"step": 22290
},
{
"epoch": 1.65,
"grad_norm": 6.441999435424805,
"learning_rate": 1.665339013036199e-05,
"loss": 2.5247,
"step": 22300
},
{
"epoch": 1.65,
"grad_norm": 4.456752777099609,
"learning_rate": 1.6585958087239252e-05,
"loss": 2.5529,
"step": 22310
},
{
"epoch": 1.65,
"grad_norm": 4.149497032165527,
"learning_rate": 1.6518650494697583e-05,
"loss": 2.3672,
"step": 22320
},
{
"epoch": 1.65,
"grad_norm": 6.830989360809326,
"learning_rate": 1.6451467453157375e-05,
"loss": 2.5149,
"step": 22330
},
{
"epoch": 1.65,
"grad_norm": 6.6800312995910645,
"learning_rate": 1.6384409062853202e-05,
"loss": 2.6433,
"step": 22340
},
{
"epoch": 1.65,
"grad_norm": 8.957132339477539,
"learning_rate": 1.6317475423833585e-05,
"loss": 2.3203,
"step": 22350
},
{
"epoch": 1.65,
"grad_norm": 5.662652015686035,
"learning_rate": 1.6250666635960997e-05,
"loss": 2.6583,
"step": 22360
},
{
"epoch": 1.65,
"grad_norm": 5.9897541999816895,
"learning_rate": 1.61839827989116e-05,
"loss": 2.6049,
"step": 22370
},
{
"epoch": 1.65,
"grad_norm": 5.011838436126709,
"learning_rate": 1.611742401217514e-05,
"loss": 2.7471,
"step": 22380
},
{
"epoch": 1.65,
"grad_norm": 8.517313957214355,
"learning_rate": 1.605099037505483e-05,
"loss": 2.7046,
"step": 22390
},
{
"epoch": 1.65,
"grad_norm": 6.329367160797119,
"learning_rate": 1.5984681986667095e-05,
"loss": 2.6179,
"step": 22400
},
{
"epoch": 1.65,
"eval_loss": 2.6726911067962646,
"eval_runtime": 1087.5084,
"eval_samples_per_second": 5.241,
"eval_steps_per_second": 5.241,
"step": 22400
},
{
"epoch": 1.66,
"grad_norm": 5.475883960723877,
"learning_rate": 1.591849894594155e-05,
"loss": 2.1697,
"step": 22410
},
{
"epoch": 1.66,
"grad_norm": 8.58638858795166,
"learning_rate": 1.5852441351620774e-05,
"loss": 2.6007,
"step": 22420
},
{
"epoch": 1.66,
"grad_norm": 7.628760814666748,
"learning_rate": 1.5786509302260167e-05,
"loss": 2.5558,
"step": 22430
},
{
"epoch": 1.66,
"grad_norm": 8.970362663269043,
"learning_rate": 1.572070289622789e-05,
"loss": 2.3498,
"step": 22440
},
{
"epoch": 1.66,
"grad_norm": 5.100218772888184,
"learning_rate": 1.5655022231704553e-05,
"loss": 2.2767,
"step": 22450
},
{
"epoch": 1.66,
"grad_norm": 6.442392349243164,
"learning_rate": 1.5589467406683256e-05,
"loss": 3.0826,
"step": 22460
},
{
"epoch": 1.66,
"grad_norm": 5.430817604064941,
"learning_rate": 1.5524038518969253e-05,
"loss": 2.4834,
"step": 22470
},
{
"epoch": 1.66,
"grad_norm": 4.273621559143066,
"learning_rate": 1.545873566617998e-05,
"loss": 2.2524,
"step": 22480
},
{
"epoch": 1.66,
"grad_norm": 4.311804294586182,
"learning_rate": 1.539355894574486e-05,
"loss": 2.5281,
"step": 22490
},
{
"epoch": 1.66,
"grad_norm": 7.450249195098877,
"learning_rate": 1.5328508454905e-05,
"loss": 2.3898,
"step": 22500
},
{
"epoch": 1.66,
"grad_norm": 4.738997936248779,
"learning_rate": 1.5263584290713305e-05,
"loss": 2.4634,
"step": 22510
},
{
"epoch": 1.66,
"grad_norm": 4.49940824508667,
"learning_rate": 1.5198786550034194e-05,
"loss": 2.4394,
"step": 22520
},
{
"epoch": 1.66,
"grad_norm": 4.811766624450684,
"learning_rate": 1.5134115329543363e-05,
"loss": 2.5136,
"step": 22530
},
{
"epoch": 1.67,
"grad_norm": 5.51740026473999,
"learning_rate": 1.5069570725727889e-05,
"loss": 2.3364,
"step": 22540
},
{
"epoch": 1.67,
"grad_norm": 6.221955299377441,
"learning_rate": 1.5005152834885794e-05,
"loss": 2.5954,
"step": 22550
},
{
"epoch": 1.67,
"grad_norm": 5.981647968292236,
"learning_rate": 1.4940861753126168e-05,
"loss": 2.3089,
"step": 22560
},
{
"epoch": 1.67,
"grad_norm": 7.435852527618408,
"learning_rate": 1.4876697576368881e-05,
"loss": 2.3998,
"step": 22570
},
{
"epoch": 1.67,
"grad_norm": 5.436887741088867,
"learning_rate": 1.4812660400344414e-05,
"loss": 2.4571,
"step": 22580
},
{
"epoch": 1.67,
"grad_norm": 5.0897722244262695,
"learning_rate": 1.4748750320593785e-05,
"loss": 2.439,
"step": 22590
},
{
"epoch": 1.67,
"grad_norm": 4.938666820526123,
"learning_rate": 1.4684967432468433e-05,
"loss": 2.1966,
"step": 22600
},
{
"epoch": 1.67,
"eval_loss": 2.67244553565979,
"eval_runtime": 1092.4378,
"eval_samples_per_second": 5.218,
"eval_steps_per_second": 5.218,
"step": 22600
},
{
"epoch": 1.67,
"grad_norm": 4.76402473449707,
"learning_rate": 1.4621311831129992e-05,
"loss": 2.7715,
"step": 22610
},
{
"epoch": 1.67,
"grad_norm": 5.895535945892334,
"learning_rate": 1.4557783611550224e-05,
"loss": 2.8179,
"step": 22620
},
{
"epoch": 1.67,
"grad_norm": 4.383255481719971,
"learning_rate": 1.4494382868510803e-05,
"loss": 2.6572,
"step": 22630
},
{
"epoch": 1.67,
"grad_norm": 6.317339897155762,
"learning_rate": 1.4431109696603207e-05,
"loss": 2.6832,
"step": 22640
},
{
"epoch": 1.67,
"grad_norm": 3.1432700157165527,
"learning_rate": 1.4367964190228623e-05,
"loss": 2.132,
"step": 22650
},
{
"epoch": 1.67,
"grad_norm": 4.70470666885376,
"learning_rate": 1.4304946443597744e-05,
"loss": 2.5938,
"step": 22660
},
{
"epoch": 1.67,
"grad_norm": 5.619884014129639,
"learning_rate": 1.4242056550730677e-05,
"loss": 2.6072,
"step": 22670
},
{
"epoch": 1.68,
"grad_norm": 6.059271335601807,
"learning_rate": 1.4179294605456739e-05,
"loss": 2.5668,
"step": 22680
},
{
"epoch": 1.68,
"grad_norm": 6.467549800872803,
"learning_rate": 1.411666070141433e-05,
"loss": 2.2774,
"step": 22690
},
{
"epoch": 1.68,
"grad_norm": 6.390707015991211,
"learning_rate": 1.40541549320509e-05,
"loss": 2.7621,
"step": 22700
},
{
"epoch": 1.68,
"grad_norm": 6.357089042663574,
"learning_rate": 1.3991777390622651e-05,
"loss": 2.3953,
"step": 22710
},
{
"epoch": 1.68,
"grad_norm": 4.777021408081055,
"learning_rate": 1.3929528170194561e-05,
"loss": 2.6179,
"step": 22720
},
{
"epoch": 1.68,
"grad_norm": 6.3577070236206055,
"learning_rate": 1.386740736364005e-05,
"loss": 2.5467,
"step": 22730
},
{
"epoch": 1.68,
"grad_norm": 7.2683634757995605,
"learning_rate": 1.3805415063641003e-05,
"loss": 2.5984,
"step": 22740
},
{
"epoch": 1.68,
"grad_norm": 7.257079124450684,
"learning_rate": 1.3743551362687568e-05,
"loss": 2.5944,
"step": 22750
},
{
"epoch": 1.68,
"grad_norm": 6.176877021789551,
"learning_rate": 1.368181635307807e-05,
"loss": 2.6696,
"step": 22760
},
{
"epoch": 1.68,
"grad_norm": 6.036998271942139,
"learning_rate": 1.3620210126918798e-05,
"loss": 2.3,
"step": 22770
},
{
"epoch": 1.68,
"grad_norm": 4.959908962249756,
"learning_rate": 1.3558732776123884e-05,
"loss": 2.8348,
"step": 22780
},
{
"epoch": 1.68,
"grad_norm": 6.45090389251709,
"learning_rate": 1.349738439241518e-05,
"loss": 2.3633,
"step": 22790
},
{
"epoch": 1.68,
"grad_norm": 4.981467247009277,
"learning_rate": 1.3436165067322171e-05,
"loss": 2.4786,
"step": 22800
},
{
"epoch": 1.68,
"eval_loss": 2.670815944671631,
"eval_runtime": 1095.8123,
"eval_samples_per_second": 5.202,
"eval_steps_per_second": 5.202,
"step": 22800
},
{
"epoch": 1.68,
"grad_norm": 4.602180004119873,
"learning_rate": 1.3375074892181749e-05,
"loss": 2.4742,
"step": 22810
},
{
"epoch": 1.69,
"grad_norm": 5.091914653778076,
"learning_rate": 1.3314113958138163e-05,
"loss": 2.6046,
"step": 22820
},
{
"epoch": 1.69,
"grad_norm": 5.247584342956543,
"learning_rate": 1.3253282356142771e-05,
"loss": 2.6917,
"step": 22830
},
{
"epoch": 1.69,
"grad_norm": 5.7452192306518555,
"learning_rate": 1.319258017695405e-05,
"loss": 2.4501,
"step": 22840
},
{
"epoch": 1.69,
"grad_norm": 5.045823574066162,
"learning_rate": 1.31320075111373e-05,
"loss": 2.2214,
"step": 22850
},
{
"epoch": 1.69,
"grad_norm": 4.422451019287109,
"learning_rate": 1.3071564449064666e-05,
"loss": 2.2831,
"step": 22860
},
{
"epoch": 1.69,
"grad_norm": 5.13774299621582,
"learning_rate": 1.301125108091492e-05,
"loss": 2.3201,
"step": 22870
},
{
"epoch": 1.69,
"grad_norm": 6.320522308349609,
"learning_rate": 1.2951067496673264e-05,
"loss": 2.534,
"step": 22880
},
{
"epoch": 1.69,
"grad_norm": 6.9759674072265625,
"learning_rate": 1.2891013786131368e-05,
"loss": 2.6257,
"step": 22890
},
{
"epoch": 1.69,
"grad_norm": 5.557161808013916,
"learning_rate": 1.283109003888704e-05,
"loss": 2.6524,
"step": 22900
},
{
"epoch": 1.69,
"grad_norm": 6.528628826141357,
"learning_rate": 1.2771296344344263e-05,
"loss": 2.4845,
"step": 22910
},
{
"epoch": 1.69,
"grad_norm": 4.082712650299072,
"learning_rate": 1.271163279171297e-05,
"loss": 2.4187,
"step": 22920
},
{
"epoch": 1.69,
"grad_norm": 3.7587528228759766,
"learning_rate": 1.2652099470008883e-05,
"loss": 2.6183,
"step": 22930
},
{
"epoch": 1.69,
"grad_norm": 6.589033126831055,
"learning_rate": 1.259269646805349e-05,
"loss": 2.574,
"step": 22940
},
{
"epoch": 1.7,
"grad_norm": 5.249916076660156,
"learning_rate": 1.2533423874473771e-05,
"loss": 2.5617,
"step": 22950
},
{
"epoch": 1.7,
"grad_norm": 3.8693699836730957,
"learning_rate": 1.2474281777702223e-05,
"loss": 2.5963,
"step": 22960
},
{
"epoch": 1.7,
"grad_norm": 5.250299453735352,
"learning_rate": 1.2415270265976564e-05,
"loss": 2.5467,
"step": 22970
},
{
"epoch": 1.7,
"grad_norm": 4.729397296905518,
"learning_rate": 1.2356389427339766e-05,
"loss": 2.8142,
"step": 22980
},
{
"epoch": 1.7,
"grad_norm": 3.2217938899993896,
"learning_rate": 1.22976393496398e-05,
"loss": 2.1877,
"step": 22990
},
{
"epoch": 1.7,
"grad_norm": 3.8777239322662354,
"learning_rate": 1.2239020120529521e-05,
"loss": 2.2498,
"step": 23000
},
{
"epoch": 1.7,
"eval_loss": 2.6680080890655518,
"eval_runtime": 1095.4556,
"eval_samples_per_second": 5.203,
"eval_steps_per_second": 5.203,
"step": 23000
},
{
"epoch": 1.7,
"grad_norm": 5.530909061431885,
"learning_rate": 1.2180531827466635e-05,
"loss": 2.6204,
"step": 23010
},
{
"epoch": 1.7,
"grad_norm": 4.088710308074951,
"learning_rate": 1.2122174557713406e-05,
"loss": 2.7187,
"step": 23020
},
{
"epoch": 1.7,
"grad_norm": 7.151991367340088,
"learning_rate": 1.2063948398336677e-05,
"loss": 2.4525,
"step": 23030
},
{
"epoch": 1.7,
"grad_norm": 3.7773518562316895,
"learning_rate": 1.2005853436207703e-05,
"loss": 2.3775,
"step": 23040
},
{
"epoch": 1.7,
"grad_norm": 5.765316486358643,
"learning_rate": 1.1947889758001907e-05,
"loss": 2.6697,
"step": 23050
},
{
"epoch": 1.7,
"grad_norm": 6.313945770263672,
"learning_rate": 1.1890057450198932e-05,
"loss": 2.3878,
"step": 23060
},
{
"epoch": 1.7,
"grad_norm": 3.7643887996673584,
"learning_rate": 1.1832356599082361e-05,
"loss": 2.6022,
"step": 23070
},
{
"epoch": 1.7,
"grad_norm": 5.528670787811279,
"learning_rate": 1.1774787290739676e-05,
"loss": 2.3164,
"step": 23080
},
{
"epoch": 1.71,
"grad_norm": 5.8710432052612305,
"learning_rate": 1.1717349611062122e-05,
"loss": 2.4571,
"step": 23090
},
{
"epoch": 1.71,
"grad_norm": 5.853476047515869,
"learning_rate": 1.166004364574449e-05,
"loss": 2.1946,
"step": 23100
},
{
"epoch": 1.71,
"grad_norm": 6.066964149475098,
"learning_rate": 1.160286948028515e-05,
"loss": 2.6727,
"step": 23110
},
{
"epoch": 1.71,
"grad_norm": 6.807967185974121,
"learning_rate": 1.1545827199985737e-05,
"loss": 2.5211,
"step": 23120
},
{
"epoch": 1.71,
"grad_norm": 5.183149814605713,
"learning_rate": 1.1488916889951195e-05,
"loss": 2.3858,
"step": 23130
},
{
"epoch": 1.71,
"grad_norm": 5.625608921051025,
"learning_rate": 1.143213863508954e-05,
"loss": 2.5197,
"step": 23140
},
{
"epoch": 1.71,
"grad_norm": 5.2954020500183105,
"learning_rate": 1.1375492520111797e-05,
"loss": 2.5251,
"step": 23150
},
{
"epoch": 1.71,
"grad_norm": 5.281711578369141,
"learning_rate": 1.1318978629531784e-05,
"loss": 2.3084,
"step": 23160
},
{
"epoch": 1.71,
"grad_norm": 4.606409549713135,
"learning_rate": 1.1262597047666067e-05,
"loss": 2.5242,
"step": 23170
},
{
"epoch": 1.71,
"grad_norm": 11.543262481689453,
"learning_rate": 1.1206347858633836e-05,
"loss": 2.7468,
"step": 23180
},
{
"epoch": 1.71,
"grad_norm": 4.565051555633545,
"learning_rate": 1.115023114635676e-05,
"loss": 2.8361,
"step": 23190
},
{
"epoch": 1.71,
"grad_norm": 5.548258304595947,
"learning_rate": 1.1094246994558843e-05,
"loss": 2.3842,
"step": 23200
},
{
"epoch": 1.71,
"eval_loss": 2.6673765182495117,
"eval_runtime": 1095.5672,
"eval_samples_per_second": 5.203,
"eval_steps_per_second": 5.203,
"step": 23200
},
{
"epoch": 1.71,
"grad_norm": 3.919635772705078,
"learning_rate": 1.1038395486766306e-05,
"loss": 2.519,
"step": 23210
},
{
"epoch": 1.72,
"grad_norm": 4.431865692138672,
"learning_rate": 1.0982676706307449e-05,
"loss": 2.2447,
"step": 23220
},
{
"epoch": 1.72,
"grad_norm": 4.190866947174072,
"learning_rate": 1.0927090736312595e-05,
"loss": 2.4587,
"step": 23230
},
{
"epoch": 1.72,
"grad_norm": 4.054731369018555,
"learning_rate": 1.0871637659713895e-05,
"loss": 2.49,
"step": 23240
},
{
"epoch": 1.72,
"grad_norm": 7.007957458496094,
"learning_rate": 1.081631755924527e-05,
"loss": 2.7029,
"step": 23250
},
{
"epoch": 1.72,
"grad_norm": 7.057101726531982,
"learning_rate": 1.0761130517442175e-05,
"loss": 2.756,
"step": 23260
},
{
"epoch": 1.72,
"grad_norm": 5.599599838256836,
"learning_rate": 1.0706076616641558e-05,
"loss": 2.5836,
"step": 23270
},
{
"epoch": 1.72,
"grad_norm": 4.555930137634277,
"learning_rate": 1.0651155938981771e-05,
"loss": 2.5641,
"step": 23280
},
{
"epoch": 1.72,
"grad_norm": 5.608716011047363,
"learning_rate": 1.0596368566402382e-05,
"loss": 2.8093,
"step": 23290
},
{
"epoch": 1.72,
"grad_norm": 4.5203375816345215,
"learning_rate": 1.054171458064408e-05,
"loss": 2.5123,
"step": 23300
},
{
"epoch": 1.72,
"grad_norm": 5.284296035766602,
"learning_rate": 1.0487194063248518e-05,
"loss": 2.5149,
"step": 23310
},
{
"epoch": 1.72,
"grad_norm": 4.907776355743408,
"learning_rate": 1.0432807095558217e-05,
"loss": 2.4423,
"step": 23320
},
{
"epoch": 1.72,
"grad_norm": 4.86950159072876,
"learning_rate": 1.0378553758716492e-05,
"loss": 2.5835,
"step": 23330
},
{
"epoch": 1.72,
"grad_norm": 3.8427376747131348,
"learning_rate": 1.0324434133667271e-05,
"loss": 2.4697,
"step": 23340
},
{
"epoch": 1.72,
"grad_norm": 5.208629131317139,
"learning_rate": 1.0270448301154955e-05,
"loss": 2.399,
"step": 23350
},
{
"epoch": 1.73,
"grad_norm": 6.390563011169434,
"learning_rate": 1.0216596341724372e-05,
"loss": 2.6222,
"step": 23360
},
{
"epoch": 1.73,
"grad_norm": 3.514446496963501,
"learning_rate": 1.0162878335720572e-05,
"loss": 2.4631,
"step": 23370
},
{
"epoch": 1.73,
"grad_norm": 4.729079723358154,
"learning_rate": 1.010929436328879e-05,
"loss": 2.6457,
"step": 23380
},
{
"epoch": 1.73,
"grad_norm": 7.517897129058838,
"learning_rate": 1.0055844504374311e-05,
"loss": 2.5569,
"step": 23390
},
{
"epoch": 1.73,
"grad_norm": 7.293701648712158,
"learning_rate": 1.0002528838722247e-05,
"loss": 2.3308,
"step": 23400
},
{
"epoch": 1.73,
"eval_loss": 2.6646196842193604,
"eval_runtime": 1099.3168,
"eval_samples_per_second": 5.185,
"eval_steps_per_second": 5.185,
"step": 23400
},
{
"epoch": 1.73,
"grad_norm": 3.726698160171509,
"learning_rate": 9.949347445877578e-06,
"loss": 2.577,
"step": 23410
},
{
"epoch": 1.73,
"grad_norm": 5.210052967071533,
"learning_rate": 9.896300405184899e-06,
"loss": 2.4381,
"step": 23420
},
{
"epoch": 1.73,
"grad_norm": 5.623903274536133,
"learning_rate": 9.843387795788383e-06,
"loss": 2.4011,
"step": 23430
},
{
"epoch": 1.73,
"grad_norm": 8.071617126464844,
"learning_rate": 9.790609696631648e-06,
"loss": 2.5279,
"step": 23440
},
{
"epoch": 1.73,
"grad_norm": 7.771283149719238,
"learning_rate": 9.737966186457592e-06,
"loss": 2.6137,
"step": 23450
},
{
"epoch": 1.73,
"grad_norm": 7.911716938018799,
"learning_rate": 9.685457343808347e-06,
"loss": 2.4973,
"step": 23460
},
{
"epoch": 1.73,
"grad_norm": 7.803577423095703,
"learning_rate": 9.63308324702512e-06,
"loss": 2.7497,
"step": 23470
},
{
"epoch": 1.73,
"grad_norm": 5.311838626861572,
"learning_rate": 9.580843974248032e-06,
"loss": 2.5562,
"step": 23480
},
{
"epoch": 1.74,
"grad_norm": 4.150722980499268,
"learning_rate": 9.528739603416159e-06,
"loss": 2.3497,
"step": 23490
},
{
"epoch": 1.74,
"grad_norm": 7.9773430824279785,
"learning_rate": 9.476770212267172e-06,
"loss": 2.6774,
"step": 23500
},
{
"epoch": 1.74,
"grad_norm": 4.366696357727051,
"learning_rate": 9.42493587833746e-06,
"loss": 2.2838,
"step": 23510
},
{
"epoch": 1.74,
"grad_norm": 7.453878402709961,
"learning_rate": 9.373236678961906e-06,
"loss": 2.4536,
"step": 23520
},
{
"epoch": 1.74,
"grad_norm": 6.814056396484375,
"learning_rate": 9.321672691273698e-06,
"loss": 2.4654,
"step": 23530
},
{
"epoch": 1.74,
"grad_norm": 7.097417831420898,
"learning_rate": 9.270243992204397e-06,
"loss": 2.2456,
"step": 23540
},
{
"epoch": 1.74,
"grad_norm": 5.335800647735596,
"learning_rate": 9.218950658483616e-06,
"loss": 2.4628,
"step": 23550
},
{
"epoch": 1.74,
"grad_norm": 5.825280666351318,
"learning_rate": 9.167792766639106e-06,
"loss": 2.4608,
"step": 23560
},
{
"epoch": 1.74,
"grad_norm": 6.578549385070801,
"learning_rate": 9.116770392996488e-06,
"loss": 2.586,
"step": 23570
},
{
"epoch": 1.74,
"grad_norm": 6.099307537078857,
"learning_rate": 9.065883613679193e-06,
"loss": 2.4974,
"step": 23580
},
{
"epoch": 1.74,
"grad_norm": 6.494635581970215,
"learning_rate": 9.015132504608347e-06,
"loss": 2.3944,
"step": 23590
},
{
"epoch": 1.74,
"grad_norm": 4.195499897003174,
"learning_rate": 8.964517141502704e-06,
"loss": 2.6393,
"step": 23600
},
{
"epoch": 1.74,
"eval_loss": 2.663755416870117,
"eval_runtime": 1093.6584,
"eval_samples_per_second": 5.212,
"eval_steps_per_second": 5.212,
"step": 23600
},
{
"epoch": 1.74,
"grad_norm": 8.729719161987305,
"learning_rate": 8.914037599878455e-06,
"loss": 2.7616,
"step": 23610
},
{
"epoch": 1.74,
"grad_norm": 4.2735724449157715,
"learning_rate": 8.863693955049167e-06,
"loss": 2.6174,
"step": 23620
},
{
"epoch": 1.75,
"grad_norm": 6.545641899108887,
"learning_rate": 8.813486282125637e-06,
"loss": 2.3377,
"step": 23630
},
{
"epoch": 1.75,
"grad_norm": 4.61662483215332,
"learning_rate": 8.76341465601579e-06,
"loss": 2.3364,
"step": 23640
},
{
"epoch": 1.75,
"grad_norm": 4.983887672424316,
"learning_rate": 8.713479151424598e-06,
"loss": 2.3039,
"step": 23650
},
{
"epoch": 1.75,
"grad_norm": 5.541987419128418,
"learning_rate": 8.663679842853945e-06,
"loss": 2.8135,
"step": 23660
},
{
"epoch": 1.75,
"grad_norm": 6.296572685241699,
"learning_rate": 8.61401680460252e-06,
"loss": 2.4277,
"step": 23670
},
{
"epoch": 1.75,
"grad_norm": 3.8996143341064453,
"learning_rate": 8.564490110765677e-06,
"loss": 2.5462,
"step": 23680
},
{
"epoch": 1.75,
"grad_norm": 6.054901123046875,
"learning_rate": 8.51509983523533e-06,
"loss": 2.6507,
"step": 23690
},
{
"epoch": 1.75,
"grad_norm": 6.450567722320557,
"learning_rate": 8.465846051699932e-06,
"loss": 2.5863,
"step": 23700
},
{
"epoch": 1.75,
"grad_norm": 6.507874488830566,
"learning_rate": 8.416728833644238e-06,
"loss": 2.5511,
"step": 23710
},
{
"epoch": 1.75,
"grad_norm": 6.341745853424072,
"learning_rate": 8.367748254349295e-06,
"loss": 2.5089,
"step": 23720
},
{
"epoch": 1.75,
"grad_norm": 5.820411205291748,
"learning_rate": 8.318904386892257e-06,
"loss": 2.4623,
"step": 23730
},
{
"epoch": 1.75,
"grad_norm": 5.08252477645874,
"learning_rate": 8.270197304146288e-06,
"loss": 2.5348,
"step": 23740
},
{
"epoch": 1.75,
"grad_norm": 4.101901531219482,
"learning_rate": 8.221627078780525e-06,
"loss": 2.5865,
"step": 23750
},
{
"epoch": 1.76,
"grad_norm": 6.394351482391357,
"learning_rate": 8.173193783259902e-06,
"loss": 2.3589,
"step": 23760
},
{
"epoch": 1.76,
"grad_norm": 7.091293811798096,
"learning_rate": 8.124897489845073e-06,
"loss": 2.8034,
"step": 23770
},
{
"epoch": 1.76,
"grad_norm": 6.968698024749756,
"learning_rate": 8.076738270592243e-06,
"loss": 2.2993,
"step": 23780
},
{
"epoch": 1.76,
"grad_norm": 5.620391368865967,
"learning_rate": 8.02871619735316e-06,
"loss": 2.4773,
"step": 23790
},
{
"epoch": 1.76,
"grad_norm": 6.991843223571777,
"learning_rate": 7.980831341774909e-06,
"loss": 2.4585,
"step": 23800
},
{
"epoch": 1.76,
"eval_loss": 2.662553548812866,
"eval_runtime": 1095.3908,
"eval_samples_per_second": 5.204,
"eval_steps_per_second": 5.204,
"step": 23800
},
{
"epoch": 1.76,
"grad_norm": 4.3224921226501465,
"learning_rate": 7.933083775299877e-06,
"loss": 2.3389,
"step": 23810
},
{
"epoch": 1.76,
"grad_norm": 4.530595302581787,
"learning_rate": 7.885473569165658e-06,
"loss": 2.2855,
"step": 23820
},
{
"epoch": 1.76,
"grad_norm": 4.67950439453125,
"learning_rate": 7.83800079440482e-06,
"loss": 2.4611,
"step": 23830
},
{
"epoch": 1.76,
"grad_norm": 4.393266201019287,
"learning_rate": 7.790665521844975e-06,
"loss": 2.4187,
"step": 23840
},
{
"epoch": 1.76,
"grad_norm": 5.820330619812012,
"learning_rate": 7.74346782210853e-06,
"loss": 2.5358,
"step": 23850
},
{
"epoch": 1.76,
"grad_norm": 5.662726879119873,
"learning_rate": 7.696407765612656e-06,
"loss": 2.5325,
"step": 23860
},
{
"epoch": 1.76,
"grad_norm": 4.868063449859619,
"learning_rate": 7.649485422569202e-06,
"loss": 2.5334,
"step": 23870
},
{
"epoch": 1.76,
"grad_norm": 5.6850714683532715,
"learning_rate": 7.60270086298448e-06,
"loss": 2.4373,
"step": 23880
},
{
"epoch": 1.76,
"grad_norm": 4.139278411865234,
"learning_rate": 7.556054156659309e-06,
"loss": 2.5888,
"step": 23890
},
{
"epoch": 1.77,
"grad_norm": 3.901987314224243,
"learning_rate": 7.509545373188776e-06,
"loss": 2.5425,
"step": 23900
},
{
"epoch": 1.77,
"grad_norm": 5.1275129318237305,
"learning_rate": 7.4631745819622286e-06,
"loss": 2.2698,
"step": 23910
},
{
"epoch": 1.77,
"grad_norm": 5.235576152801514,
"learning_rate": 7.41694185216315e-06,
"loss": 2.8522,
"step": 23920
},
{
"epoch": 1.77,
"grad_norm": 7.4979248046875,
"learning_rate": 7.370847252768964e-06,
"loss": 2.4142,
"step": 23930
},
{
"epoch": 1.77,
"grad_norm": 4.67307710647583,
"learning_rate": 7.324890852551114e-06,
"loss": 2.4082,
"step": 23940
},
{
"epoch": 1.77,
"grad_norm": 5.2745137214660645,
"learning_rate": 7.279072720074765e-06,
"loss": 2.6957,
"step": 23950
},
{
"epoch": 1.77,
"grad_norm": 5.682844638824463,
"learning_rate": 7.233392923698867e-06,
"loss": 2.4437,
"step": 23960
},
{
"epoch": 1.77,
"grad_norm": 5.371147155761719,
"learning_rate": 7.187851531575895e-06,
"loss": 2.4106,
"step": 23970
},
{
"epoch": 1.77,
"grad_norm": 3.5821807384490967,
"learning_rate": 7.1424486116518976e-06,
"loss": 2.3772,
"step": 23980
},
{
"epoch": 1.77,
"grad_norm": 7.6203789710998535,
"learning_rate": 7.097184231666321e-06,
"loss": 2.5593,
"step": 23990
},
{
"epoch": 1.77,
"grad_norm": 6.033676624298096,
"learning_rate": 7.052058459151878e-06,
"loss": 2.4586,
"step": 24000
},
{
"epoch": 1.77,
"eval_loss": 2.660005569458008,
"eval_runtime": 1097.5123,
"eval_samples_per_second": 5.194,
"eval_steps_per_second": 5.194,
"step": 24000
},
{
"epoch": 1.77,
"grad_norm": 10.172308921813965,
"learning_rate": 7.007071361434525e-06,
"loss": 2.4257,
"step": 24010
},
{
"epoch": 1.77,
"grad_norm": 7.140941619873047,
"learning_rate": 6.962223005633284e-06,
"loss": 2.4525,
"step": 24020
},
{
"epoch": 1.78,
"grad_norm": 6.787766933441162,
"learning_rate": 6.917513458660197e-06,
"loss": 2.7918,
"step": 24030
},
{
"epoch": 1.78,
"grad_norm": 4.571247577667236,
"learning_rate": 6.872942787220238e-06,
"loss": 2.4082,
"step": 24040
},
{
"epoch": 1.78,
"grad_norm": 5.534272193908691,
"learning_rate": 6.828511057811127e-06,
"loss": 2.5778,
"step": 24050
},
{
"epoch": 1.78,
"grad_norm": 5.400485992431641,
"learning_rate": 6.7842183367233354e-06,
"loss": 2.7021,
"step": 24060
},
{
"epoch": 1.78,
"grad_norm": 6.089663982391357,
"learning_rate": 6.740064690039893e-06,
"loss": 2.6363,
"step": 24070
},
{
"epoch": 1.78,
"grad_norm": 7.160126209259033,
"learning_rate": 6.696050183636371e-06,
"loss": 2.6046,
"step": 24080
},
{
"epoch": 1.78,
"grad_norm": 6.594214916229248,
"learning_rate": 6.652174883180762e-06,
"loss": 2.5559,
"step": 24090
},
{
"epoch": 1.78,
"grad_norm": 5.203665256500244,
"learning_rate": 6.608438854133347e-06,
"loss": 2.4476,
"step": 24100
},
{
"epoch": 1.78,
"grad_norm": 5.592020034790039,
"learning_rate": 6.56484216174661e-06,
"loss": 2.3035,
"step": 24110
},
{
"epoch": 1.78,
"grad_norm": 6.901062488555908,
"learning_rate": 6.521384871065139e-06,
"loss": 2.5734,
"step": 24120
},
{
"epoch": 1.78,
"grad_norm": 6.117889404296875,
"learning_rate": 6.478067046925573e-06,
"loss": 2.6569,
"step": 24130
},
{
"epoch": 1.78,
"grad_norm": 3.797450304031372,
"learning_rate": 6.439200302513093e-06,
"loss": 2.4993,
"step": 24140
},
{
"epoch": 1.78,
"grad_norm": 5.903318405151367,
"learning_rate": 6.396147642682771e-06,
"loss": 2.6547,
"step": 24150
},
{
"epoch": 1.78,
"grad_norm": 4.873409271240234,
"learning_rate": 6.3532346362435324e-06,
"loss": 2.3683,
"step": 24160
},
{
"epoch": 1.79,
"grad_norm": 5.629471302032471,
"learning_rate": 6.310461347219976e-06,
"loss": 2.9563,
"step": 24170
},
{
"epoch": 1.79,
"grad_norm": 3.3840177059173584,
"learning_rate": 6.267827839428186e-06,
"loss": 2.4681,
"step": 24180
},
{
"epoch": 1.79,
"grad_norm": 11.257518768310547,
"learning_rate": 6.2295772479447625e-06,
"loss": 2.4174,
"step": 24190
},
{
"epoch": 1.79,
"grad_norm": 4.495081901550293,
"learning_rate": 6.18720949955981e-06,
"loss": 2.6949,
"step": 24200
},
{
"epoch": 1.79,
"eval_loss": 2.6588234901428223,
"eval_runtime": 1093.4241,
"eval_samples_per_second": 5.213,
"eval_steps_per_second": 5.213,
"step": 24200
},
{
"epoch": 1.79,
"grad_norm": 4.914842128753662,
"learning_rate": 6.14498171629373e-06,
"loss": 2.7292,
"step": 24210
},
{
"epoch": 1.79,
"grad_norm": 10.351119041442871,
"learning_rate": 6.102893961148759e-06,
"loss": 2.4258,
"step": 24220
},
{
"epoch": 1.79,
"grad_norm": 5.2781982421875,
"learning_rate": 6.0609462969182575e-06,
"loss": 2.7965,
"step": 24230
},
{
"epoch": 1.79,
"grad_norm": 7.596676826477051,
"learning_rate": 6.019138786186518e-06,
"loss": 2.3767,
"step": 24240
},
{
"epoch": 1.79,
"grad_norm": 5.272423267364502,
"learning_rate": 5.977471491328745e-06,
"loss": 2.6428,
"step": 24250
},
{
"epoch": 1.79,
"grad_norm": 6.982003211975098,
"learning_rate": 5.935944474510991e-06,
"loss": 2.6295,
"step": 24260
},
{
"epoch": 1.79,
"grad_norm": 4.492363452911377,
"learning_rate": 5.894557797689959e-06,
"loss": 2.4975,
"step": 24270
},
{
"epoch": 1.79,
"grad_norm": 3.5356361865997314,
"learning_rate": 5.853311522613036e-06,
"loss": 2.6458,
"step": 24280
},
{
"epoch": 1.79,
"grad_norm": 4.993523597717285,
"learning_rate": 5.812205710818075e-06,
"loss": 2.3961,
"step": 24290
},
{
"epoch": 1.8,
"grad_norm": 6.376553058624268,
"learning_rate": 5.771240423633362e-06,
"loss": 2.4275,
"step": 24300
},
{
"epoch": 1.8,
"grad_norm": 5.525853157043457,
"learning_rate": 5.730415722177573e-06,
"loss": 2.3282,
"step": 24310
},
{
"epoch": 1.8,
"grad_norm": 6.546508312225342,
"learning_rate": 5.689731667359621e-06,
"loss": 2.5095,
"step": 24320
},
{
"epoch": 1.8,
"grad_norm": 5.087640285491943,
"learning_rate": 5.649188319878563e-06,
"loss": 2.4921,
"step": 24330
},
{
"epoch": 1.8,
"grad_norm": 5.294022083282471,
"learning_rate": 5.608785740223532e-06,
"loss": 2.5036,
"step": 24340
},
{
"epoch": 1.8,
"grad_norm": 6.46054220199585,
"learning_rate": 5.568523988673624e-06,
"loss": 2.7374,
"step": 24350
},
{
"epoch": 1.8,
"grad_norm": 7.733225345611572,
"learning_rate": 5.528403125297854e-06,
"loss": 2.5931,
"step": 24360
},
{
"epoch": 1.8,
"grad_norm": 5.521718978881836,
"learning_rate": 5.48842320995504e-06,
"loss": 2.324,
"step": 24370
},
{
"epoch": 1.8,
"grad_norm": 4.55715274810791,
"learning_rate": 5.448584302293691e-06,
"loss": 2.3213,
"step": 24380
},
{
"epoch": 1.8,
"grad_norm": 3.7885773181915283,
"learning_rate": 5.408886461751938e-06,
"loss": 2.2618,
"step": 24390
},
{
"epoch": 1.8,
"grad_norm": 4.088833808898926,
"learning_rate": 5.369329747557439e-06,
"loss": 2.4464,
"step": 24400
},
{
"epoch": 1.8,
"eval_loss": 2.658057928085327,
"eval_runtime": 1096.7974,
"eval_samples_per_second": 5.197,
"eval_steps_per_second": 5.197,
"step": 24400
},
{
"epoch": 1.8,
"grad_norm": 5.293616771697998,
"learning_rate": 5.329914218727317e-06,
"loss": 2.3675,
"step": 24410
},
{
"epoch": 1.8,
"grad_norm": 5.487192630767822,
"learning_rate": 5.290639934068042e-06,
"loss": 2.4274,
"step": 24420
},
{
"epoch": 1.8,
"grad_norm": 6.877601146697998,
"learning_rate": 5.251506952175378e-06,
"loss": 2.5587,
"step": 24430
},
{
"epoch": 1.81,
"grad_norm": 4.651222229003906,
"learning_rate": 5.212515331434231e-06,
"loss": 2.6733,
"step": 24440
},
{
"epoch": 1.81,
"grad_norm": 5.562499046325684,
"learning_rate": 5.17366513001859e-06,
"loss": 2.407,
"step": 24450
},
{
"epoch": 1.81,
"grad_norm": 5.536728858947754,
"learning_rate": 5.134956405891511e-06,
"loss": 2.7379,
"step": 24460
},
{
"epoch": 1.81,
"grad_norm": 7.043944358825684,
"learning_rate": 5.096389216804942e-06,
"loss": 2.6023,
"step": 24470
},
{
"epoch": 1.81,
"grad_norm": 4.266600608825684,
"learning_rate": 5.057963620299655e-06,
"loss": 2.5775,
"step": 24480
},
{
"epoch": 1.81,
"grad_norm": 5.975000858306885,
"learning_rate": 5.01967967370518e-06,
"loss": 2.6187,
"step": 24490
},
{
"epoch": 1.81,
"grad_norm": 6.738065719604492,
"learning_rate": 4.981537434139705e-06,
"loss": 2.3506,
"step": 24500
},
{
"epoch": 1.81,
"grad_norm": 5.501399040222168,
"learning_rate": 4.9435369585099975e-06,
"loss": 2.5722,
"step": 24510
},
{
"epoch": 1.81,
"grad_norm": 4.655872344970703,
"learning_rate": 4.90567830351134e-06,
"loss": 2.1844,
"step": 24520
},
{
"epoch": 1.81,
"grad_norm": 5.472281455993652,
"learning_rate": 4.8679615256274065e-06,
"loss": 2.6819,
"step": 24530
},
{
"epoch": 1.81,
"grad_norm": 4.1918253898620605,
"learning_rate": 4.830386681130184e-06,
"loss": 2.3479,
"step": 24540
},
{
"epoch": 1.81,
"grad_norm": 6.187207221984863,
"learning_rate": 4.7929538260799266e-06,
"loss": 2.3477,
"step": 24550
},
{
"epoch": 1.81,
"grad_norm": 6.957455635070801,
"learning_rate": 4.755663016325007e-06,
"loss": 2.4508,
"step": 24560
},
{
"epoch": 1.81,
"grad_norm": 5.570684909820557,
"learning_rate": 4.71851430750192e-06,
"loss": 2.3361,
"step": 24570
},
{
"epoch": 1.82,
"grad_norm": 7.463441848754883,
"learning_rate": 4.68150775503513e-06,
"loss": 2.5163,
"step": 24580
},
{
"epoch": 1.82,
"grad_norm": 6.18106746673584,
"learning_rate": 4.644643414136984e-06,
"loss": 2.7362,
"step": 24590
},
{
"epoch": 1.82,
"grad_norm": 6.137258052825928,
"learning_rate": 4.607921339807708e-06,
"loss": 2.5392,
"step": 24600
},
{
"epoch": 1.82,
"eval_loss": 2.6575379371643066,
"eval_runtime": 1097.6214,
"eval_samples_per_second": 5.193,
"eval_steps_per_second": 5.193,
"step": 24600
},
{
"epoch": 1.82,
"grad_norm": 4.705349922180176,
"learning_rate": 4.57134158683521e-06,
"loss": 2.3636,
"step": 24610
},
{
"epoch": 1.82,
"grad_norm": 13.131735801696777,
"learning_rate": 4.534904209795133e-06,
"loss": 2.7459,
"step": 24620
},
{
"epoch": 1.82,
"grad_norm": 5.176623344421387,
"learning_rate": 4.498609263050602e-06,
"loss": 2.5748,
"step": 24630
},
{
"epoch": 1.82,
"grad_norm": 4.853312015533447,
"learning_rate": 4.462456800752335e-06,
"loss": 2.5707,
"step": 24640
},
{
"epoch": 1.82,
"grad_norm": 7.627806663513184,
"learning_rate": 4.426446876838441e-06,
"loss": 2.7449,
"step": 24650
},
{
"epoch": 1.82,
"grad_norm": 5.656932353973389,
"learning_rate": 4.390579545034334e-06,
"loss": 2.4417,
"step": 24660
},
{
"epoch": 1.82,
"grad_norm": 3.796220541000366,
"learning_rate": 4.354854858852731e-06,
"loss": 2.3381,
"step": 24670
},
{
"epoch": 1.82,
"grad_norm": 5.063661575317383,
"learning_rate": 4.319272871593483e-06,
"loss": 2.2168,
"step": 24680
},
{
"epoch": 1.82,
"grad_norm": 7.319814682006836,
"learning_rate": 4.283833636343582e-06,
"loss": 2.6516,
"step": 24690
},
{
"epoch": 1.82,
"grad_norm": 4.529714107513428,
"learning_rate": 4.24853720597701e-06,
"loss": 2.5271,
"step": 24700
},
{
"epoch": 1.83,
"grad_norm": 3.921539783477783,
"learning_rate": 4.21338363315471e-06,
"loss": 2.4202,
"step": 24710
},
{
"epoch": 1.83,
"grad_norm": 6.239911079406738,
"learning_rate": 4.178372970324473e-06,
"loss": 2.3875,
"step": 24720
},
{
"epoch": 1.83,
"grad_norm": 6.639339447021484,
"learning_rate": 4.1435052697208595e-06,
"loss": 2.4489,
"step": 24730
},
{
"epoch": 1.83,
"grad_norm": 3.866710662841797,
"learning_rate": 4.1087805833651795e-06,
"loss": 2.6613,
"step": 24740
},
{
"epoch": 1.83,
"grad_norm": 5.444427490234375,
"learning_rate": 4.074198963065346e-06,
"loss": 2.6155,
"step": 24750
},
{
"epoch": 1.83,
"grad_norm": 4.5667195320129395,
"learning_rate": 4.039760460415798e-06,
"loss": 2.427,
"step": 24760
},
{
"epoch": 1.83,
"grad_norm": 5.31951904296875,
"learning_rate": 4.005465126797492e-06,
"loss": 2.696,
"step": 24770
},
{
"epoch": 1.83,
"grad_norm": 5.098918914794922,
"learning_rate": 3.971313013377753e-06,
"loss": 2.5229,
"step": 24780
},
{
"epoch": 1.83,
"grad_norm": 5.757137298583984,
"learning_rate": 3.937304171110245e-06,
"loss": 2.4862,
"step": 24790
},
{
"epoch": 1.83,
"grad_norm": 6.163649082183838,
"learning_rate": 3.903438650734881e-06,
"loss": 2.5195,
"step": 24800
},
{
"epoch": 1.83,
"eval_loss": 2.6563258171081543,
"eval_runtime": 1094.2795,
"eval_samples_per_second": 5.209,
"eval_steps_per_second": 5.209,
"step": 24800
},
{
"epoch": 1.83,
"grad_norm": 6.653298377990723,
"learning_rate": 3.8697165027776986e-06,
"loss": 2.5233,
"step": 24810
},
{
"epoch": 1.83,
"grad_norm": 4.475333213806152,
"learning_rate": 3.836137777550874e-06,
"loss": 2.4716,
"step": 24820
},
{
"epoch": 1.83,
"grad_norm": 5.567105293273926,
"learning_rate": 3.8027025251526016e-06,
"loss": 2.6092,
"step": 24830
},
{
"epoch": 1.83,
"grad_norm": 4.831381320953369,
"learning_rate": 3.7694107954669876e-06,
"loss": 2.4514,
"step": 24840
},
{
"epoch": 1.84,
"grad_norm": 3.961242198944092,
"learning_rate": 3.736262638164045e-06,
"loss": 2.6679,
"step": 24850
},
{
"epoch": 1.84,
"grad_norm": 4.817134380340576,
"learning_rate": 3.7032581026995806e-06,
"loss": 2.7695,
"step": 24860
},
{
"epoch": 1.84,
"grad_norm": 4.958139419555664,
"learning_rate": 3.67039723831506e-06,
"loss": 2.6389,
"step": 24870
},
{
"epoch": 1.84,
"grad_norm": 7.7273125648498535,
"learning_rate": 3.6376800940376654e-06,
"loss": 2.4678,
"step": 24880
},
{
"epoch": 1.84,
"grad_norm": 5.275628566741943,
"learning_rate": 3.60510671868014e-06,
"loss": 2.4368,
"step": 24890
},
{
"epoch": 1.84,
"grad_norm": 5.690983295440674,
"learning_rate": 3.5726771608407317e-06,
"loss": 2.1657,
"step": 24900
},
{
"epoch": 1.84,
"grad_norm": 6.044635772705078,
"learning_rate": 3.5403914689030925e-06,
"loss": 2.6097,
"step": 24910
},
{
"epoch": 1.84,
"grad_norm": 7.05141544342041,
"learning_rate": 3.508249691036258e-06,
"loss": 2.2663,
"step": 24920
},
{
"epoch": 1.84,
"grad_norm": 4.508877754211426,
"learning_rate": 3.476251875194525e-06,
"loss": 2.5327,
"step": 24930
},
{
"epoch": 1.84,
"grad_norm": 5.018611907958984,
"learning_rate": 3.4443980691174162e-06,
"loss": 2.3549,
"step": 24940
},
{
"epoch": 1.84,
"grad_norm": 5.333502292633057,
"learning_rate": 3.4126883203296266e-06,
"loss": 2.179,
"step": 24950
},
{
"epoch": 1.84,
"grad_norm": 6.344839096069336,
"learning_rate": 3.38112267614088e-06,
"loss": 2.6844,
"step": 24960
},
{
"epoch": 1.84,
"grad_norm": 4.554666519165039,
"learning_rate": 3.3497011836459258e-06,
"loss": 2.5045,
"step": 24970
},
{
"epoch": 1.85,
"grad_norm": 7.463393688201904,
"learning_rate": 3.3184238897244093e-06,
"loss": 2.6915,
"step": 24980
},
{
"epoch": 1.85,
"grad_norm": 5.385898590087891,
"learning_rate": 3.287290841040902e-06,
"loss": 2.5424,
"step": 24990
},
{
"epoch": 1.85,
"grad_norm": 4.146659851074219,
"learning_rate": 3.2563020840447157e-06,
"loss": 2.1064,
"step": 25000
},
{
"epoch": 1.85,
"eval_loss": 2.6555445194244385,
"eval_runtime": 1094.8064,
"eval_samples_per_second": 5.206,
"eval_steps_per_second": 5.206,
"step": 25000
},
{
"epoch": 1.85,
"grad_norm": 4.334985733032227,
"learning_rate": 3.2254576649698777e-06,
"loss": 2.5139,
"step": 25010
},
{
"epoch": 1.85,
"grad_norm": 9.473915100097656,
"learning_rate": 3.1947576298351214e-06,
"loss": 2.3403,
"step": 25020
},
{
"epoch": 1.85,
"grad_norm": 6.397850036621094,
"learning_rate": 3.164202024443719e-06,
"loss": 2.2274,
"step": 25030
},
{
"epoch": 1.85,
"grad_norm": 6.480834007263184,
"learning_rate": 3.133790894383459e-06,
"loss": 2.3635,
"step": 25040
},
{
"epoch": 1.85,
"grad_norm": 4.56965446472168,
"learning_rate": 3.1035242850266154e-06,
"loss": 2.3934,
"step": 25050
},
{
"epoch": 1.85,
"grad_norm": 5.493187427520752,
"learning_rate": 3.0734022415298103e-06,
"loss": 2.4646,
"step": 25060
},
{
"epoch": 1.85,
"grad_norm": 3.9670233726501465,
"learning_rate": 3.0434248088339943e-06,
"loss": 2.6645,
"step": 25070
},
{
"epoch": 1.85,
"grad_norm": 5.613986492156982,
"learning_rate": 3.0135920316643362e-06,
"loss": 2.7214,
"step": 25080
},
{
"epoch": 1.85,
"grad_norm": 3.3827364444732666,
"learning_rate": 2.9839039545302207e-06,
"loss": 2.4379,
"step": 25090
},
{
"epoch": 1.85,
"grad_norm": 6.201570987701416,
"learning_rate": 2.9543606217251384e-06,
"loss": 2.6216,
"step": 25100
},
{
"epoch": 1.85,
"grad_norm": 6.150888919830322,
"learning_rate": 2.9249620773266095e-06,
"loss": 2.4708,
"step": 25110
},
{
"epoch": 1.86,
"grad_norm": 5.124236583709717,
"learning_rate": 2.895708365196148e-06,
"loss": 2.3435,
"step": 25120
},
{
"epoch": 1.86,
"grad_norm": 4.904949188232422,
"learning_rate": 2.8665995289791745e-06,
"loss": 2.2964,
"step": 25130
},
{
"epoch": 1.86,
"grad_norm": 3.3704028129577637,
"learning_rate": 2.8376356121049717e-06,
"loss": 2.3127,
"step": 25140
},
{
"epoch": 1.86,
"grad_norm": 5.626865386962891,
"learning_rate": 2.808816657786617e-06,
"loss": 2.2965,
"step": 25150
},
{
"epoch": 1.86,
"grad_norm": 6.694971084594727,
"learning_rate": 2.780142709020861e-06,
"loss": 2.5454,
"step": 25160
},
{
"epoch": 1.86,
"grad_norm": 5.319484233856201,
"learning_rate": 2.751613808588183e-06,
"loss": 2.5326,
"step": 25170
},
{
"epoch": 1.86,
"grad_norm": 6.219109058380127,
"learning_rate": 2.7232299990526013e-06,
"loss": 2.5755,
"step": 25180
},
{
"epoch": 1.86,
"grad_norm": 7.463380336761475,
"learning_rate": 2.694991322761675e-06,
"loss": 2.4964,
"step": 25190
},
{
"epoch": 1.86,
"grad_norm": 4.71378231048584,
"learning_rate": 2.666897821846448e-06,
"loss": 2.4468,
"step": 25200
},
{
"epoch": 1.86,
"eval_loss": 2.655106782913208,
"eval_runtime": 1097.6812,
"eval_samples_per_second": 5.193,
"eval_steps_per_second": 5.193,
"step": 25200
},
{
"epoch": 1.86,
"grad_norm": 4.85548734664917,
"learning_rate": 2.638949538221347e-06,
"loss": 2.112,
"step": 25210
},
{
"epoch": 1.86,
"grad_norm": 6.407068729400635,
"learning_rate": 2.6111465135841507e-06,
"loss": 2.7188,
"step": 25220
},
{
"epoch": 1.86,
"grad_norm": 4.663290500640869,
"learning_rate": 2.583488789415922e-06,
"loss": 2.5207,
"step": 25230
},
{
"epoch": 1.86,
"grad_norm": 5.210723876953125,
"learning_rate": 2.555976406980942e-06,
"loss": 2.6299,
"step": 25240
},
{
"epoch": 1.87,
"grad_norm": 3.8297393321990967,
"learning_rate": 2.5286094073266097e-06,
"loss": 2.2596,
"step": 25250
},
{
"epoch": 1.87,
"grad_norm": 3.5863406658172607,
"learning_rate": 2.5013878312834747e-06,
"loss": 2.4618,
"step": 25260
},
{
"epoch": 1.87,
"grad_norm": 5.100343227386475,
"learning_rate": 2.4743117194650834e-06,
"loss": 2.4822,
"step": 25270
},
{
"epoch": 1.87,
"grad_norm": 5.481692314147949,
"learning_rate": 2.447381112267977e-06,
"loss": 2.683,
"step": 25280
},
{
"epoch": 1.87,
"grad_norm": 6.0729851722717285,
"learning_rate": 2.420596049871593e-06,
"loss": 2.4862,
"step": 25290
},
{
"epoch": 1.87,
"grad_norm": 9.472423553466797,
"learning_rate": 2.3939565722382207e-06,
"loss": 2.43,
"step": 25300
},
{
"epoch": 1.87,
"grad_norm": 5.9718523025512695,
"learning_rate": 2.3674627191129452e-06,
"loss": 2.2668,
"step": 25310
},
{
"epoch": 1.87,
"grad_norm": 6.822712421417236,
"learning_rate": 2.3411145300235915e-06,
"loss": 2.4001,
"step": 25320
},
{
"epoch": 1.87,
"grad_norm": 6.996267318725586,
"learning_rate": 2.3149120442806814e-06,
"loss": 2.6037,
"step": 25330
},
{
"epoch": 1.87,
"grad_norm": 6.17630672454834,
"learning_rate": 2.2888553009772997e-06,
"loss": 2.6959,
"step": 25340
},
{
"epoch": 1.87,
"grad_norm": 6.863979339599609,
"learning_rate": 2.2629443389891148e-06,
"loss": 2.6952,
"step": 25350
},
{
"epoch": 1.87,
"grad_norm": 8.45169734954834,
"learning_rate": 2.237179196974315e-06,
"loss": 2.7508,
"step": 25360
},
{
"epoch": 1.87,
"grad_norm": 5.637682914733887,
"learning_rate": 2.2115599133734952e-06,
"loss": 2.6583,
"step": 25370
},
{
"epoch": 1.87,
"grad_norm": 5.1772918701171875,
"learning_rate": 2.1860865264096808e-06,
"loss": 2.499,
"step": 25380
},
{
"epoch": 1.88,
"grad_norm": 6.219912052154541,
"learning_rate": 2.1607590740881813e-06,
"loss": 2.5316,
"step": 25390
},
{
"epoch": 1.88,
"grad_norm": 5.400609970092773,
"learning_rate": 2.1355775941965804e-06,
"loss": 2.4839,
"step": 25400
},
{
"epoch": 1.88,
"eval_loss": 2.655069589614868,
"eval_runtime": 1097.8052,
"eval_samples_per_second": 5.192,
"eval_steps_per_second": 5.192,
"step": 25400
},
{
"epoch": 1.88,
"grad_norm": 5.726144313812256,
"learning_rate": 2.1105421243047043e-06,
"loss": 2.7813,
"step": 25410
},
{
"epoch": 1.88,
"grad_norm": 6.688289642333984,
"learning_rate": 2.0856527017645176e-06,
"loss": 2.5251,
"step": 25420
},
{
"epoch": 1.88,
"grad_norm": 6.891797065734863,
"learning_rate": 2.060909363710106e-06,
"loss": 2.6199,
"step": 25430
},
{
"epoch": 1.88,
"grad_norm": 6.396704196929932,
"learning_rate": 2.036312147057573e-06,
"loss": 2.3888,
"step": 25440
},
{
"epoch": 1.88,
"grad_norm": 3.867151975631714,
"learning_rate": 2.0118610885050295e-06,
"loss": 2.291,
"step": 25450
},
{
"epoch": 1.88,
"grad_norm": 6.082787036895752,
"learning_rate": 1.9875562245325384e-06,
"loss": 2.5563,
"step": 25460
},
{
"epoch": 1.88,
"grad_norm": 5.629850387573242,
"learning_rate": 1.963397591402016e-06,
"loss": 2.4667,
"step": 25470
},
{
"epoch": 1.88,
"grad_norm": 6.9120774269104,
"learning_rate": 1.939385225157253e-06,
"loss": 2.5586,
"step": 25480
},
{
"epoch": 1.88,
"grad_norm": 5.51324462890625,
"learning_rate": 1.91551916162378e-06,
"loss": 2.625,
"step": 25490
},
{
"epoch": 1.88,
"grad_norm": 4.947356224060059,
"learning_rate": 1.8917994364088254e-06,
"loss": 2.6076,
"step": 25500
},
{
"epoch": 1.88,
"grad_norm": 4.116830825805664,
"learning_rate": 1.8682260849013478e-06,
"loss": 2.2131,
"step": 25510
},
{
"epoch": 1.89,
"grad_norm": 4.880571365356445,
"learning_rate": 1.8447991422718914e-06,
"loss": 2.5583,
"step": 25520
},
{
"epoch": 1.89,
"grad_norm": 7.822117805480957,
"learning_rate": 1.821518643472564e-06,
"loss": 2.684,
"step": 25530
},
{
"epoch": 1.89,
"grad_norm": 6.742255210876465,
"learning_rate": 1.7983846232369594e-06,
"loss": 2.4451,
"step": 25540
},
{
"epoch": 1.89,
"grad_norm": 8.71749496459961,
"learning_rate": 1.7753971160802018e-06,
"loss": 2.603,
"step": 25550
},
{
"epoch": 1.89,
"grad_norm": 5.900051593780518,
"learning_rate": 1.7525561562987347e-06,
"loss": 2.7087,
"step": 25560
},
{
"epoch": 1.89,
"grad_norm": 6.159276485443115,
"learning_rate": 1.7298617779704208e-06,
"loss": 2.5132,
"step": 25570
},
{
"epoch": 1.89,
"grad_norm": 5.493851661682129,
"learning_rate": 1.7073140149544197e-06,
"loss": 2.4985,
"step": 25580
},
{
"epoch": 1.89,
"grad_norm": 4.474180221557617,
"learning_rate": 1.6849129008911224e-06,
"loss": 2.3737,
"step": 25590
},
{
"epoch": 1.89,
"grad_norm": 9.486087799072266,
"learning_rate": 1.6626584692021497e-06,
"loss": 2.4829,
"step": 25600
},
{
"epoch": 1.89,
"eval_loss": 2.6546285152435303,
"eval_runtime": 1096.3114,
"eval_samples_per_second": 5.199,
"eval_steps_per_second": 5.199,
"step": 25600
},
{
"epoch": 1.89,
"grad_norm": 5.633112907409668,
"learning_rate": 1.6405507530902643e-06,
"loss": 2.6532,
"step": 25610
},
{
"epoch": 1.89,
"grad_norm": 6.957579135894775,
"learning_rate": 1.6185897855393372e-06,
"loss": 2.4989,
"step": 25620
},
{
"epoch": 1.89,
"grad_norm": 6.723416805267334,
"learning_rate": 1.596775599314293e-06,
"loss": 2.5217,
"step": 25630
},
{
"epoch": 1.89,
"grad_norm": 8.012822151184082,
"learning_rate": 1.575108226961075e-06,
"loss": 2.7455,
"step": 25640
},
{
"epoch": 1.89,
"grad_norm": 4.816512107849121,
"learning_rate": 1.5535877008065802e-06,
"loss": 2.3831,
"step": 25650
},
{
"epoch": 1.9,
"grad_norm": 4.9410881996154785,
"learning_rate": 1.5322140529586137e-06,
"loss": 2.8791,
"step": 25660
},
{
"epoch": 1.9,
"grad_norm": 7.129745960235596,
"learning_rate": 1.5109873153058562e-06,
"loss": 2.6591,
"step": 25670
},
{
"epoch": 1.9,
"grad_norm": 6.4482526779174805,
"learning_rate": 1.4899075195177747e-06,
"loss": 2.5458,
"step": 25680
},
{
"epoch": 1.9,
"grad_norm": 7.3847856521606445,
"learning_rate": 1.4689746970446228e-06,
"loss": 2.6046,
"step": 25690
},
{
"epoch": 1.9,
"grad_norm": 7.786729335784912,
"learning_rate": 1.448188879117407e-06,
"loss": 2.6478,
"step": 25700
},
{
"epoch": 1.9,
"grad_norm": 4.2452592849731445,
"learning_rate": 1.4275500967477428e-06,
"loss": 2.2543,
"step": 25710
},
{
"epoch": 1.9,
"grad_norm": 8.031307220458984,
"learning_rate": 1.4070583807279325e-06,
"loss": 2.6764,
"step": 25720
},
{
"epoch": 1.9,
"grad_norm": 7.834446907043457,
"learning_rate": 1.3867137616308312e-06,
"loss": 2.1737,
"step": 25730
},
{
"epoch": 1.9,
"grad_norm": 5.337544918060303,
"learning_rate": 1.3665162698098255e-06,
"loss": 2.4626,
"step": 25740
},
{
"epoch": 1.9,
"grad_norm": 6.047445774078369,
"learning_rate": 1.3464659353988218e-06,
"loss": 2.5175,
"step": 25750
},
{
"epoch": 1.9,
"grad_norm": 6.275997638702393,
"learning_rate": 1.3265627883121467e-06,
"loss": 2.547,
"step": 25760
},
{
"epoch": 1.9,
"grad_norm": 7.569523811340332,
"learning_rate": 1.306806858244547e-06,
"loss": 2.2549,
"step": 25770
},
{
"epoch": 1.9,
"grad_norm": 5.868937969207764,
"learning_rate": 1.2871981746711115e-06,
"loss": 2.445,
"step": 25780
},
{
"epoch": 1.91,
"grad_norm": 6.172995567321777,
"learning_rate": 1.2677367668472607e-06,
"loss": 2.4238,
"step": 25790
},
{
"epoch": 1.91,
"grad_norm": 5.2079949378967285,
"learning_rate": 1.2484226638086682e-06,
"loss": 2.4737,
"step": 25800
},
{
"epoch": 1.91,
"eval_loss": 2.6542229652404785,
"eval_runtime": 1089.7943,
"eval_samples_per_second": 5.23,
"eval_steps_per_second": 5.23,
"step": 25800
},
{
"epoch": 1.91,
"grad_norm": 4.673678874969482,
"learning_rate": 1.2292558943712619e-06,
"loss": 2.4163,
"step": 25810
},
{
"epoch": 1.91,
"grad_norm": 5.8100481033325195,
"learning_rate": 1.210236487131089e-06,
"loss": 2.7093,
"step": 25820
},
{
"epoch": 1.91,
"grad_norm": 6.0081610679626465,
"learning_rate": 1.1913644704644288e-06,
"loss": 2.7016,
"step": 25830
},
{
"epoch": 1.91,
"grad_norm": 4.318962574005127,
"learning_rate": 1.172639872527581e-06,
"loss": 2.2921,
"step": 25840
},
{
"epoch": 1.91,
"grad_norm": 6.901121616363525,
"learning_rate": 1.1540627212569433e-06,
"loss": 2.6351,
"step": 25850
},
{
"epoch": 1.91,
"grad_norm": 5.046151161193848,
"learning_rate": 1.1356330443689445e-06,
"loss": 2.7171,
"step": 25860
},
{
"epoch": 1.91,
"grad_norm": 5.555967330932617,
"learning_rate": 1.1173508693599344e-06,
"loss": 2.46,
"step": 25870
},
{
"epoch": 1.91,
"grad_norm": 4.512118816375732,
"learning_rate": 1.0992162235062164e-06,
"loss": 2.4003,
"step": 25880
},
{
"epoch": 1.91,
"grad_norm": 5.666736602783203,
"learning_rate": 1.0812291338640145e-06,
"loss": 2.6762,
"step": 25890
},
{
"epoch": 1.91,
"grad_norm": 6.129502296447754,
"learning_rate": 1.0633896272693732e-06,
"loss": 2.5756,
"step": 25900
},
{
"epoch": 1.91,
"grad_norm": 5.501920223236084,
"learning_rate": 1.0456977303381688e-06,
"loss": 2.3172,
"step": 25910
},
{
"epoch": 1.91,
"grad_norm": 5.519867420196533,
"learning_rate": 1.028153469466031e-06,
"loss": 2.538,
"step": 25920
},
{
"epoch": 1.92,
"grad_norm": 6.417172431945801,
"learning_rate": 1.0107568708283222e-06,
"loss": 2.5725,
"step": 25930
},
{
"epoch": 1.92,
"grad_norm": 5.723873615264893,
"learning_rate": 9.935079603801244e-07,
"loss": 2.5679,
"step": 25940
},
{
"epoch": 1.92,
"grad_norm": 5.8061065673828125,
"learning_rate": 9.764067638561415e-07,
"loss": 2.603,
"step": 25950
},
{
"epoch": 1.92,
"grad_norm": 7.154747009277344,
"learning_rate": 9.59453306770719e-07,
"loss": 2.2465,
"step": 25960
},
{
"epoch": 1.92,
"grad_norm": 5.935358047485352,
"learning_rate": 9.426476144177576e-07,
"loss": 2.7148,
"step": 25970
},
{
"epoch": 1.92,
"grad_norm": 6.310463905334473,
"learning_rate": 9.259897118707228e-07,
"loss": 2.5083,
"step": 25980
},
{
"epoch": 1.92,
"grad_norm": 5.4176926612854,
"learning_rate": 9.094796239825787e-07,
"loss": 2.7756,
"step": 25990
},
{
"epoch": 1.92,
"grad_norm": 6.910298824310303,
"learning_rate": 8.931173753857325e-07,
"loss": 2.6436,
"step": 26000
},
{
"epoch": 1.92,
"eval_loss": 2.6540627479553223,
"eval_runtime": 1093.6164,
"eval_samples_per_second": 5.212,
"eval_steps_per_second": 5.212,
"step": 26000
},
{
"epoch": 1.92,
"grad_norm": 5.972805500030518,
"learning_rate": 8.769029904920456e-07,
"loss": 2.5209,
"step": 26010
},
{
"epoch": 1.92,
"grad_norm": 5.985231876373291,
"learning_rate": 8.60836493492767e-07,
"loss": 2.5231,
"step": 26020
},
{
"epoch": 1.92,
"grad_norm": 7.196133136749268,
"learning_rate": 8.44917908358489e-07,
"loss": 2.7249,
"step": 26030
},
{
"epoch": 1.92,
"grad_norm": 5.080741882324219,
"learning_rate": 8.291472588391469e-07,
"loss": 2.4597,
"step": 26040
},
{
"epoch": 1.92,
"grad_norm": 4.692221164703369,
"learning_rate": 8.135245684639526e-07,
"loss": 2.5251,
"step": 26050
},
{
"epoch": 1.93,
"grad_norm": 4.760748386383057,
"learning_rate": 7.9804986054135e-07,
"loss": 2.5533,
"step": 26060
},
{
"epoch": 1.93,
"grad_norm": 5.430874347686768,
"learning_rate": 7.827231581590377e-07,
"loss": 2.7045,
"step": 26070
},
{
"epoch": 1.93,
"grad_norm": 3.716386079788208,
"learning_rate": 7.675444841838575e-07,
"loss": 2.2073,
"step": 26080
},
{
"epoch": 1.93,
"grad_norm": 7.227940082550049,
"learning_rate": 7.525138612618166e-07,
"loss": 2.7283,
"step": 26090
},
{
"epoch": 1.93,
"grad_norm": 5.73671817779541,
"learning_rate": 7.376313118180322e-07,
"loss": 2.3235,
"step": 26100
},
{
"epoch": 1.93,
"grad_norm": 4.938995361328125,
"learning_rate": 7.228968580567097e-07,
"loss": 2.3111,
"step": 26110
},
{
"epoch": 1.93,
"grad_norm": 4.570291042327881,
"learning_rate": 7.083105219610975e-07,
"loss": 2.4974,
"step": 26120
},
{
"epoch": 1.93,
"grad_norm": 6.675302505493164,
"learning_rate": 6.93872325293432e-07,
"loss": 2.4026,
"step": 26130
},
{
"epoch": 1.93,
"grad_norm": 3.6706745624542236,
"learning_rate": 6.79582289594971e-07,
"loss": 2.6083,
"step": 26140
},
{
"epoch": 1.93,
"grad_norm": 6.997994899749756,
"learning_rate": 6.654404361859156e-07,
"loss": 2.636,
"step": 26150
},
{
"epoch": 1.93,
"grad_norm": 3.7949180603027344,
"learning_rate": 6.51446786165355e-07,
"loss": 2.6478,
"step": 26160
},
{
"epoch": 1.93,
"grad_norm": 6.412059307098389,
"learning_rate": 6.376013604112885e-07,
"loss": 2.4066,
"step": 26170
},
{
"epoch": 1.93,
"grad_norm": 7.183565616607666,
"learning_rate": 6.2390417958057e-07,
"loss": 2.6993,
"step": 26180
},
{
"epoch": 1.93,
"grad_norm": 6.4794020652771,
"learning_rate": 6.103552641088639e-07,
"loss": 2.3288,
"step": 26190
},
{
"epoch": 1.94,
"grad_norm": 7.5243611335754395,
"learning_rate": 5.969546342106558e-07,
"loss": 2.5551,
"step": 26200
},
{
"epoch": 1.94,
"eval_loss": 2.6537866592407227,
"eval_runtime": 1093.9884,
"eval_samples_per_second": 5.21,
"eval_steps_per_second": 5.21,
"step": 26200
},
{
"epoch": 1.94,
"grad_norm": 5.41322660446167,
"learning_rate": 5.837023098791417e-07,
"loss": 2.472,
"step": 26210
},
{
"epoch": 1.94,
"grad_norm": 3.8366689682006836,
"learning_rate": 5.705983108863278e-07,
"loss": 2.5584,
"step": 26220
},
{
"epoch": 1.94,
"grad_norm": 6.729165077209473,
"learning_rate": 5.57642656782853e-07,
"loss": 2.5014,
"step": 26230
},
{
"epoch": 1.94,
"grad_norm": 7.120552062988281,
"learning_rate": 5.448353668980666e-07,
"loss": 2.9143,
"step": 26240
},
{
"epoch": 1.94,
"grad_norm": 6.512486457824707,
"learning_rate": 5.321764603399726e-07,
"loss": 2.5403,
"step": 26250
},
{
"epoch": 1.94,
"grad_norm": 5.751278400421143,
"learning_rate": 5.196659559951633e-07,
"loss": 2.5884,
"step": 26260
},
{
"epoch": 1.94,
"grad_norm": 6.711959362030029,
"learning_rate": 5.073038725288304e-07,
"loss": 2.5595,
"step": 26270
},
{
"epoch": 1.94,
"grad_norm": 7.284610748291016,
"learning_rate": 4.950902283847537e-07,
"loss": 2.2269,
"step": 26280
},
{
"epoch": 1.94,
"grad_norm": 4.604262828826904,
"learning_rate": 4.830250417852233e-07,
"loss": 2.5721,
"step": 26290
},
{
"epoch": 1.94,
"grad_norm": 6.925443649291992,
"learning_rate": 4.7110833073101825e-07,
"loss": 2.502,
"step": 26300
},
{
"epoch": 1.94,
"grad_norm": 3.369199752807617,
"learning_rate": 4.5934011300142743e-07,
"loss": 2.5734,
"step": 26310
},
{
"epoch": 1.94,
"grad_norm": 7.462447166442871,
"learning_rate": 4.477204061542062e-07,
"loss": 2.5041,
"step": 26320
},
{
"epoch": 1.95,
"grad_norm": 5.244159698486328,
"learning_rate": 4.36249227525487e-07,
"loss": 2.3157,
"step": 26330
},
{
"epoch": 1.95,
"grad_norm": 4.864575386047363,
"learning_rate": 4.249265942298464e-07,
"loss": 2.5586,
"step": 26340
},
{
"epoch": 1.95,
"grad_norm": 8.591397285461426,
"learning_rate": 4.1375252316021576e-07,
"loss": 2.6211,
"step": 26350
},
{
"epoch": 1.95,
"grad_norm": 5.036678791046143,
"learning_rate": 4.0272703098789276e-07,
"loss": 2.1728,
"step": 26360
},
{
"epoch": 1.95,
"grad_norm": 4.213713645935059,
"learning_rate": 3.9185013416249693e-07,
"loss": 2.5173,
"step": 26370
},
{
"epoch": 1.95,
"grad_norm": 9.083184242248535,
"learning_rate": 3.8112184891192504e-07,
"loss": 2.5333,
"step": 26380
},
{
"epoch": 1.95,
"grad_norm": 11.7958345413208,
"learning_rate": 3.705421912423956e-07,
"loss": 2.5472,
"step": 26390
},
{
"epoch": 1.95,
"grad_norm": 4.839986801147461,
"learning_rate": 3.6011117693833806e-07,
"loss": 2.5423,
"step": 26400
},
{
"epoch": 1.95,
"eval_loss": 2.6536054611206055,
"eval_runtime": 1094.3772,
"eval_samples_per_second": 5.208,
"eval_steps_per_second": 5.208,
"step": 26400
},
{
"epoch": 1.95,
"grad_norm": 5.843730926513672,
"learning_rate": 3.498288215624257e-07,
"loss": 2.537,
"step": 26410
},
{
"epoch": 1.95,
"grad_norm": 7.053458213806152,
"learning_rate": 3.396951404555648e-07,
"loss": 2.5372,
"step": 26420
},
{
"epoch": 1.95,
"grad_norm": 4.698965072631836,
"learning_rate": 3.2971014873680597e-07,
"loss": 2.2936,
"step": 26430
},
{
"epoch": 1.95,
"grad_norm": 5.811645984649658,
"learning_rate": 3.198738613033769e-07,
"loss": 2.7739,
"step": 26440
},
{
"epoch": 1.95,
"grad_norm": 6.532294750213623,
"learning_rate": 3.101862928306498e-07,
"loss": 2.5593,
"step": 26450
},
{
"epoch": 1.95,
"grad_norm": 5.7458367347717285,
"learning_rate": 3.0064745777210745e-07,
"loss": 2.4244,
"step": 26460
},
{
"epoch": 1.96,
"grad_norm": 4.933990478515625,
"learning_rate": 2.912573703593324e-07,
"loss": 2.4246,
"step": 26470
},
{
"epoch": 1.96,
"grad_norm": 5.212098598480225,
"learning_rate": 2.8201604460197375e-07,
"loss": 2.666,
"step": 26480
},
{
"epoch": 1.96,
"grad_norm": 7.725255489349365,
"learning_rate": 2.7292349428773567e-07,
"loss": 2.2872,
"step": 26490
},
{
"epoch": 1.96,
"grad_norm": 6.296080112457275,
"learning_rate": 2.639797329823668e-07,
"loss": 2.4227,
"step": 26500
},
{
"epoch": 1.96,
"grad_norm": 5.026681423187256,
"learning_rate": 2.551847740296154e-07,
"loss": 2.5354,
"step": 26510
},
{
"epoch": 1.96,
"grad_norm": 5.291750907897949,
"learning_rate": 2.465386305512185e-07,
"loss": 2.3962,
"step": 26520
},
{
"epoch": 1.96,
"grad_norm": 3.936063766479492,
"learning_rate": 2.380413154469019e-07,
"loss": 2.5252,
"step": 26530
},
{
"epoch": 1.96,
"grad_norm": 8.992650985717773,
"learning_rate": 2.2969284139433555e-07,
"loss": 2.4413,
"step": 26540
},
{
"epoch": 1.96,
"grad_norm": 7.641388893127441,
"learning_rate": 2.2149322084913381e-07,
"loss": 2.6156,
"step": 26550
},
{
"epoch": 1.96,
"grad_norm": 4.50031042098999,
"learning_rate": 2.134424660447998e-07,
"loss": 2.5348,
"step": 26560
},
{
"epoch": 1.96,
"grad_norm": 6.620706558227539,
"learning_rate": 2.0554058899275863e-07,
"loss": 2.2697,
"step": 26570
},
{
"epoch": 1.96,
"grad_norm": 5.6808085441589355,
"learning_rate": 1.9778760148232434e-07,
"loss": 2.6806,
"step": 26580
},
{
"epoch": 1.96,
"grad_norm": 5.3663506507873535,
"learning_rate": 1.9018351508065524e-07,
"loss": 2.5661,
"step": 26590
},
{
"epoch": 1.96,
"grad_norm": 6.384164333343506,
"learning_rate": 1.8272834113275406e-07,
"loss": 2.4298,
"step": 26600
},
{
"epoch": 1.96,
"eval_loss": 2.6534934043884277,
"eval_runtime": 1096.2312,
"eval_samples_per_second": 5.2,
"eval_steps_per_second": 5.2,
"step": 26600
},
{
"epoch": 1.97,
"grad_norm": 6.136931896209717,
"learning_rate": 1.7542209076144567e-07,
"loss": 2.4511,
"step": 26610
},
{
"epoch": 1.97,
"grad_norm": 7.29750919342041,
"learning_rate": 1.6826477486741045e-07,
"loss": 2.5982,
"step": 26620
},
{
"epoch": 1.97,
"grad_norm": 4.461855411529541,
"learning_rate": 1.6125640412906207e-07,
"loss": 2.3932,
"step": 26630
},
{
"epoch": 1.97,
"grad_norm": 4.770211219787598,
"learning_rate": 1.5439698900262534e-07,
"loss": 2.4409,
"step": 26640
},
{
"epoch": 1.97,
"grad_norm": 3.745713710784912,
"learning_rate": 1.4768653972210277e-07,
"loss": 2.433,
"step": 26650
},
{
"epoch": 1.97,
"grad_norm": 5.597508907318115,
"learning_rate": 1.4112506629923029e-07,
"loss": 2.5078,
"step": 26660
},
{
"epoch": 1.97,
"grad_norm": 4.793899059295654,
"learning_rate": 1.3471257852345487e-07,
"loss": 2.1771,
"step": 26670
},
{
"epoch": 1.97,
"grad_norm": 10.311989784240723,
"learning_rate": 1.2844908596199023e-07,
"loss": 2.6082,
"step": 26680
},
{
"epoch": 1.97,
"grad_norm": 4.9989118576049805,
"learning_rate": 1.223345979597057e-07,
"loss": 2.551,
"step": 26690
},
{
"epoch": 1.97,
"grad_norm": 5.613187789916992,
"learning_rate": 1.1636912363920393e-07,
"loss": 2.4562,
"step": 26700
},
{
"epoch": 1.97,
"grad_norm": 5.113211631774902,
"learning_rate": 1.1055267190074325e-07,
"loss": 2.3301,
"step": 26710
},
{
"epoch": 1.97,
"grad_norm": 7.665001392364502,
"learning_rate": 1.048852514222376e-07,
"loss": 2.4143,
"step": 26720
},
{
"epoch": 1.97,
"grad_norm": 5.974045276641846,
"learning_rate": 9.936687065926764e-08,
"loss": 2.7031,
"step": 26730
},
{
"epoch": 1.98,
"grad_norm": 4.682978630065918,
"learning_rate": 9.39975378450586e-08,
"loss": 2.4894,
"step": 26740
},
{
"epoch": 1.98,
"grad_norm": 6.042008399963379,
"learning_rate": 8.877726099043582e-08,
"loss": 2.5057,
"step": 26750
},
{
"epoch": 1.98,
"grad_norm": 5.749847888946533,
"learning_rate": 8.370604788385806e-08,
"loss": 2.3572,
"step": 26760
},
{
"epoch": 1.98,
"grad_norm": 3.9606752395629883,
"learning_rate": 7.87839060913953e-08,
"loss": 2.414,
"step": 26770
},
{
"epoch": 1.98,
"grad_norm": 7.164281845092773,
"learning_rate": 7.401084295667327e-08,
"loss": 2.2284,
"step": 26780
},
{
"epoch": 1.98,
"grad_norm": 5.0891547203063965,
"learning_rate": 6.938686560093999e-08,
"loss": 2.3254,
"step": 26790
},
{
"epoch": 1.98,
"grad_norm": 5.734001159667969,
"learning_rate": 6.491198092298811e-08,
"loss": 2.5871,
"step": 26800
},
{
"epoch": 1.98,
"eval_loss": 2.6534903049468994,
"eval_runtime": 1095.7983,
"eval_samples_per_second": 5.202,
"eval_steps_per_second": 5.202,
"step": 26800
},
{
"epoch": 1.98,
"grad_norm": 7.397612571716309,
"learning_rate": 6.058619559917711e-08,
"loss": 2.6794,
"step": 26810
},
{
"epoch": 1.98,
"grad_norm": 4.204326629638672,
"learning_rate": 5.640951608339995e-08,
"loss": 2.5394,
"step": 26820
},
{
"epoch": 1.98,
"grad_norm": 8.067238807678223,
"learning_rate": 5.238194860712753e-08,
"loss": 2.5528,
"step": 26830
},
{
"epoch": 1.98,
"grad_norm": 3.9365627765655518,
"learning_rate": 4.8503499179319844e-08,
"loss": 2.5808,
"step": 26840
},
{
"epoch": 1.98,
"grad_norm": 5.15150785446167,
"learning_rate": 4.47741735864815e-08,
"loss": 2.3032,
"step": 26850
},
{
"epoch": 1.98,
"grad_norm": 7.398310661315918,
"learning_rate": 4.1193977392628425e-08,
"loss": 2.4599,
"step": 26860
},
{
"epoch": 1.98,
"grad_norm": 5.485527515411377,
"learning_rate": 3.776291593927672e-08,
"loss": 2.6419,
"step": 26870
},
{
"epoch": 1.99,
"grad_norm": 6.389936447143555,
"learning_rate": 3.448099434543162e-08,
"loss": 2.4881,
"step": 26880
},
{
"epoch": 1.99,
"grad_norm": 4.455927848815918,
"learning_rate": 3.134821750759853e-08,
"loss": 2.4383,
"step": 26890
},
{
"epoch": 1.99,
"grad_norm": 3.46675968170166,
"learning_rate": 2.8364590099771992e-08,
"loss": 2.3959,
"step": 26900
},
{
"epoch": 1.99,
"grad_norm": 5.440370559692383,
"learning_rate": 2.5530116573391216e-08,
"loss": 2.4442,
"step": 26910
},
{
"epoch": 1.99,
"grad_norm": 6.947876453399658,
"learning_rate": 2.2844801157406726e-08,
"loss": 2.407,
"step": 26920
},
{
"epoch": 1.99,
"grad_norm": 4.38772439956665,
"learning_rate": 2.030864785818043e-08,
"loss": 2.5157,
"step": 26930
},
{
"epoch": 1.99,
"grad_norm": 7.698976993560791,
"learning_rate": 1.7921660459574442e-08,
"loss": 2.5359,
"step": 26940
},
{
"epoch": 1.99,
"grad_norm": 4.17779016494751,
"learning_rate": 1.5683842522884462e-08,
"loss": 2.3679,
"step": 26950
},
{
"epoch": 1.99,
"grad_norm": 5.525791645050049,
"learning_rate": 1.359519738685089e-08,
"loss": 2.6091,
"step": 26960
},
{
"epoch": 1.99,
"grad_norm": 5.552348613739014,
"learning_rate": 1.1655728167636603e-08,
"loss": 2.4131,
"step": 26970
},
{
"epoch": 1.99,
"grad_norm": 8.300748825073242,
"learning_rate": 9.865437758871387e-09,
"loss": 2.5513,
"step": 26980
},
{
"epoch": 1.99,
"grad_norm": 5.163261890411377,
"learning_rate": 8.224328831596405e-09,
"loss": 2.6024,
"step": 26990
},
{
"epoch": 1.99,
"grad_norm": 7.43178129196167,
"learning_rate": 6.732403834275314e-09,
"loss": 2.5353,
"step": 27000
},
{
"epoch": 1.99,
"eval_loss": 2.6534905433654785,
"eval_runtime": 1093.314,
"eval_samples_per_second": 5.214,
"eval_steps_per_second": 5.214,
"step": 27000
}
],
"logging_steps": 10,
"max_steps": 27074,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 200,
"total_flos": 1.1035098369036288e+16,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}