{ "best_metric": 2.6534903049468994, "best_model_checkpoint": "finetuned_output/checkpoint-26800", "epoch": 1.9944967682363806, "eval_steps": 200, "global_step": 27000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0, "grad_norm": NaN, "learning_rate": 0.0, "loss": 6.359, "step": 1 }, { "epoch": 0.0, "grad_norm": NaN, "learning_rate": 8.862629246676516e-07, "loss": 6.4896, "step": 10 }, { "epoch": 0.0, "grad_norm": 12.363865852355957, "learning_rate": 2.2156573116691286e-06, "loss": 6.7819, "step": 20 }, { "epoch": 0.0, "grad_norm": 17.94967269897461, "learning_rate": 3.6927621861152146e-06, "loss": 6.243, "step": 30 }, { "epoch": 0.0, "grad_norm": 19.398380279541016, "learning_rate": 5.1698670605613006e-06, "loss": 6.8645, "step": 40 }, { "epoch": 0.0, "grad_norm": 18.63751792907715, "learning_rate": 6.646971935007386e-06, "loss": 6.3908, "step": 50 }, { "epoch": 0.0, "grad_norm": 18.712358474731445, "learning_rate": 8.124076809453472e-06, "loss": 5.4173, "step": 60 }, { "epoch": 0.01, "grad_norm": 16.64569664001465, "learning_rate": 9.601181683899557e-06, "loss": 6.0525, "step": 70 }, { "epoch": 0.01, "grad_norm": 14.164616584777832, "learning_rate": 1.1078286558345644e-05, "loss": 5.7338, "step": 80 }, { "epoch": 0.01, "grad_norm": 18.707992553710938, "learning_rate": 1.255539143279173e-05, "loss": 5.1387, "step": 90 }, { "epoch": 0.01, "grad_norm": 27.919492721557617, "learning_rate": 1.4032496307237814e-05, "loss": 5.0792, "step": 100 }, { "epoch": 0.01, "grad_norm": 12.875962257385254, "learning_rate": 1.55096011816839e-05, "loss": 4.8748, "step": 110 }, { "epoch": 0.01, "grad_norm": 13.589888572692871, "learning_rate": 1.6986706056129988e-05, "loss": 4.3393, "step": 120 }, { "epoch": 0.01, "grad_norm": 14.79183578491211, "learning_rate": 1.8463810930576073e-05, "loss": 4.5417, "step": 130 }, { "epoch": 0.01, "grad_norm": 15.221105575561523, "learning_rate": 1.9940915805022155e-05, "loss": 4.7915, "step": 140 }, { "epoch": 0.01, "grad_norm": 13.27481746673584, "learning_rate": 2.1418020679468243e-05, "loss": 4.433, "step": 150 }, { "epoch": 0.01, "grad_norm": 14.454379081726074, "learning_rate": 2.2895125553914328e-05, "loss": 4.4096, "step": 160 }, { "epoch": 0.01, "grad_norm": 18.132295608520508, "learning_rate": 2.4372230428360417e-05, "loss": 4.2882, "step": 170 }, { "epoch": 0.01, "grad_norm": 12.889933586120605, "learning_rate": 2.58493353028065e-05, "loss": 4.5541, "step": 180 }, { "epoch": 0.01, "grad_norm": 11.339323997497559, "learning_rate": 2.7326440177252587e-05, "loss": 4.2746, "step": 190 }, { "epoch": 0.01, "grad_norm": 15.804581642150879, "learning_rate": 2.8803545051698672e-05, "loss": 4.1199, "step": 200 }, { "epoch": 0.01, "eval_loss": 4.2089715003967285, "eval_runtime": 1148.912, "eval_samples_per_second": 4.961, "eval_steps_per_second": 4.961, "step": 200 }, { "epoch": 0.02, "grad_norm": 15.684308052062988, "learning_rate": 3.0280649926144754e-05, "loss": 4.5603, "step": 210 }, { "epoch": 0.02, "grad_norm": 15.939892768859863, "learning_rate": 3.1757754800590846e-05, "loss": 4.2042, "step": 220 }, { "epoch": 0.02, "grad_norm": 11.890963554382324, "learning_rate": 3.323485967503693e-05, "loss": 3.8026, "step": 230 }, { "epoch": 0.02, "grad_norm": 13.109417915344238, "learning_rate": 3.4711964549483016e-05, "loss": 4.464, "step": 240 }, { "epoch": 0.02, "grad_norm": 12.069670677185059, "learning_rate": 3.61890694239291e-05, "loss": 3.9818, "step": 250 }, { "epoch": 0.02, "grad_norm": 12.528508186340332, "learning_rate": 3.7666174298375187e-05, "loss": 4.1944, "step": 260 }, { "epoch": 0.02, "grad_norm": 16.27909278869629, "learning_rate": 3.9143279172821275e-05, "loss": 4.1983, "step": 270 }, { "epoch": 0.02, "grad_norm": 16.70147132873535, "learning_rate": 4.062038404726736e-05, "loss": 4.1177, "step": 280 }, { "epoch": 0.02, "grad_norm": 17.577062606811523, "learning_rate": 4.2097488921713445e-05, "loss": 4.0985, "step": 290 }, { "epoch": 0.02, "grad_norm": 15.422350883483887, "learning_rate": 4.357459379615953e-05, "loss": 3.7929, "step": 300 }, { "epoch": 0.02, "grad_norm": 25.00748634338379, "learning_rate": 4.5051698670605616e-05, "loss": 4.0118, "step": 310 }, { "epoch": 0.02, "grad_norm": 14.866429328918457, "learning_rate": 4.6528803545051704e-05, "loss": 4.3715, "step": 320 }, { "epoch": 0.02, "grad_norm": 16.465192794799805, "learning_rate": 4.8005908419497786e-05, "loss": 4.3538, "step": 330 }, { "epoch": 0.03, "grad_norm": 12.310616493225098, "learning_rate": 4.9483013293943874e-05, "loss": 4.0751, "step": 340 }, { "epoch": 0.03, "grad_norm": 11.21264362335205, "learning_rate": 5.0960118168389956e-05, "loss": 3.7735, "step": 350 }, { "epoch": 0.03, "grad_norm": 20.764062881469727, "learning_rate": 5.2437223042836045e-05, "loss": 3.87, "step": 360 }, { "epoch": 0.03, "grad_norm": 14.75299072265625, "learning_rate": 5.3914327917282127e-05, "loss": 4.0889, "step": 370 }, { "epoch": 0.03, "grad_norm": 14.28115177154541, "learning_rate": 5.5391432791728215e-05, "loss": 3.63, "step": 380 }, { "epoch": 0.03, "grad_norm": 10.375629425048828, "learning_rate": 5.6868537666174304e-05, "loss": 4.2333, "step": 390 }, { "epoch": 0.03, "grad_norm": 12.934395790100098, "learning_rate": 5.8345642540620385e-05, "loss": 3.637, "step": 400 }, { "epoch": 0.03, "eval_loss": 4.002247333526611, "eval_runtime": 1149.4819, "eval_samples_per_second": 4.959, "eval_steps_per_second": 4.959, "step": 400 }, { "epoch": 0.03, "grad_norm": 14.344521522521973, "learning_rate": 5.937961595273265e-05, "loss": 3.9191, "step": 410 }, { "epoch": 0.03, "grad_norm": 16.335979461669922, "learning_rate": 6.0856720827178737e-05, "loss": 3.712, "step": 420 }, { "epoch": 0.03, "grad_norm": 12.617454528808594, "learning_rate": 6.233382570162482e-05, "loss": 3.696, "step": 430 }, { "epoch": 0.03, "grad_norm": 11.171549797058105, "learning_rate": 6.38109305760709e-05, "loss": 4.317, "step": 440 }, { "epoch": 0.03, "grad_norm": 10.807971954345703, "learning_rate": 6.5288035450517e-05, "loss": 4.0245, "step": 450 }, { "epoch": 0.03, "grad_norm": 14.287726402282715, "learning_rate": 6.661742983751846e-05, "loss": 4.11, "step": 460 }, { "epoch": 0.03, "grad_norm": 12.783670425415039, "learning_rate": 6.809453471196455e-05, "loss": 4.3735, "step": 470 }, { "epoch": 0.04, "grad_norm": 14.521145820617676, "learning_rate": 6.957163958641064e-05, "loss": 3.8375, "step": 480 }, { "epoch": 0.04, "grad_norm": 17.16818618774414, "learning_rate": 7.104874446085672e-05, "loss": 4.2095, "step": 490 }, { "epoch": 0.04, "grad_norm": 14.1270170211792, "learning_rate": 7.252584933530281e-05, "loss": 3.8374, "step": 500 }, { "epoch": 0.04, "grad_norm": 10.878564834594727, "learning_rate": 7.40029542097489e-05, "loss": 3.8449, "step": 510 }, { "epoch": 0.04, "grad_norm": 15.475001335144043, "learning_rate": 7.548005908419498e-05, "loss": 3.8567, "step": 520 }, { "epoch": 0.04, "grad_norm": 10.29078483581543, "learning_rate": 7.695716395864106e-05, "loss": 4.0472, "step": 530 }, { "epoch": 0.04, "grad_norm": 11.84984016418457, "learning_rate": 7.843426883308715e-05, "loss": 4.0074, "step": 540 }, { "epoch": 0.04, "grad_norm": 11.358631134033203, "learning_rate": 7.991137370753325e-05, "loss": 4.26, "step": 550 }, { "epoch": 0.04, "grad_norm": 9.24376392364502, "learning_rate": 8.138847858197932e-05, "loss": 4.1398, "step": 560 }, { "epoch": 0.04, "grad_norm": 12.005671501159668, "learning_rate": 8.286558345642541e-05, "loss": 3.948, "step": 570 }, { "epoch": 0.04, "grad_norm": 16.197847366333008, "learning_rate": 8.43426883308715e-05, "loss": 4.252, "step": 580 }, { "epoch": 0.04, "grad_norm": 11.188523292541504, "learning_rate": 8.581979320531758e-05, "loss": 4.1579, "step": 590 }, { "epoch": 0.04, "grad_norm": 10.116312980651855, "learning_rate": 8.729689807976367e-05, "loss": 3.7998, "step": 600 }, { "epoch": 0.04, "eval_loss": 3.877913236618042, "eval_runtime": 1135.4542, "eval_samples_per_second": 5.02, "eval_steps_per_second": 5.02, "step": 600 }, { "epoch": 0.05, "grad_norm": 11.187545776367188, "learning_rate": 8.877400295420975e-05, "loss": 3.5609, "step": 610 }, { "epoch": 0.05, "grad_norm": 11.974798202514648, "learning_rate": 9.025110782865584e-05, "loss": 4.2729, "step": 620 }, { "epoch": 0.05, "grad_norm": 9.664997100830078, "learning_rate": 9.172821270310192e-05, "loss": 4.0576, "step": 630 }, { "epoch": 0.05, "grad_norm": 8.53403091430664, "learning_rate": 9.320531757754801e-05, "loss": 3.7363, "step": 640 }, { "epoch": 0.05, "grad_norm": 11.338556289672852, "learning_rate": 9.468242245199411e-05, "loss": 4.3457, "step": 650 }, { "epoch": 0.05, "grad_norm": 11.836936950683594, "learning_rate": 9.615952732644018e-05, "loss": 4.3066, "step": 660 }, { "epoch": 0.05, "grad_norm": 7.8482890129089355, "learning_rate": 9.763663220088627e-05, "loss": 3.4205, "step": 670 }, { "epoch": 0.05, "grad_norm": 9.069377899169922, "learning_rate": 9.911373707533235e-05, "loss": 3.992, "step": 680 }, { "epoch": 0.05, "grad_norm": 10.200207710266113, "learning_rate": 0.00010059084194977843, "loss": 3.7709, "step": 690 }, { "epoch": 0.05, "grad_norm": 7.830392360687256, "learning_rate": 0.00010206794682422452, "loss": 3.3458, "step": 700 }, { "epoch": 0.05, "grad_norm": 9.707051277160645, "learning_rate": 0.00010354505169867061, "loss": 3.591, "step": 710 }, { "epoch": 0.05, "grad_norm": 7.163864612579346, "learning_rate": 0.0001050221565731167, "loss": 3.7154, "step": 720 }, { "epoch": 0.05, "grad_norm": 5.52028751373291, "learning_rate": 0.00010649926144756279, "loss": 3.4662, "step": 730 }, { "epoch": 0.05, "grad_norm": 9.911632537841797, "learning_rate": 0.00010797636632200887, "loss": 3.6873, "step": 740 }, { "epoch": 0.06, "grad_norm": 9.579071998596191, "learning_rate": 0.00010945347119645495, "loss": 3.7212, "step": 750 }, { "epoch": 0.06, "grad_norm": 8.60621166229248, "learning_rate": 0.00011093057607090105, "loss": 3.8167, "step": 760 }, { "epoch": 0.06, "grad_norm": 9.796650886535645, "learning_rate": 0.00011240768094534713, "loss": 3.9552, "step": 770 }, { "epoch": 0.06, "grad_norm": 10.821413040161133, "learning_rate": 0.00011388478581979321, "loss": 3.9494, "step": 780 }, { "epoch": 0.06, "grad_norm": 6.736440181732178, "learning_rate": 0.0001153618906942393, "loss": 3.6909, "step": 790 }, { "epoch": 0.06, "grad_norm": 8.424497604370117, "learning_rate": 0.00011683899556868539, "loss": 4.0993, "step": 800 }, { "epoch": 0.06, "eval_loss": 3.8091275691986084, "eval_runtime": 1134.5045, "eval_samples_per_second": 5.024, "eval_steps_per_second": 5.024, "step": 800 }, { "epoch": 0.06, "grad_norm": 7.850163459777832, "learning_rate": 0.00011831610044313146, "loss": 3.6776, "step": 810 }, { "epoch": 0.06, "grad_norm": 10.378649711608887, "learning_rate": 0.00011979320531757757, "loss": 3.8521, "step": 820 }, { "epoch": 0.06, "grad_norm": 8.155631065368652, "learning_rate": 0.00012127031019202363, "loss": 3.5103, "step": 830 }, { "epoch": 0.06, "grad_norm": 7.763760089874268, "learning_rate": 0.00012274741506646973, "loss": 3.975, "step": 840 }, { "epoch": 0.06, "grad_norm": 8.467230796813965, "learning_rate": 0.00012422451994091582, "loss": 3.7825, "step": 850 }, { "epoch": 0.06, "grad_norm": 9.121253967285156, "learning_rate": 0.0001257016248153619, "loss": 3.801, "step": 860 }, { "epoch": 0.06, "grad_norm": 9.41889762878418, "learning_rate": 0.00012717872968980796, "loss": 3.7899, "step": 870 }, { "epoch": 0.07, "grad_norm": 7.1193108558654785, "learning_rate": 0.00012865583456425408, "loss": 3.6037, "step": 880 }, { "epoch": 0.07, "grad_norm": 7.241006851196289, "learning_rate": 0.00013013293943870015, "loss": 3.7016, "step": 890 }, { "epoch": 0.07, "grad_norm": 7.67100191116333, "learning_rate": 0.00013161004431314622, "loss": 4.0709, "step": 900 }, { "epoch": 0.07, "grad_norm": 8.182023048400879, "learning_rate": 0.00013308714918759234, "loss": 3.8902, "step": 910 }, { "epoch": 0.07, "grad_norm": 6.974468231201172, "learning_rate": 0.0001345642540620384, "loss": 3.5811, "step": 920 }, { "epoch": 0.07, "grad_norm": 8.211260795593262, "learning_rate": 0.00013604135893648448, "loss": 3.7973, "step": 930 }, { "epoch": 0.07, "grad_norm": 7.410445690155029, "learning_rate": 0.00013751846381093057, "loss": 3.4891, "step": 940 }, { "epoch": 0.07, "grad_norm": 7.951589584350586, "learning_rate": 0.00013899556868537667, "loss": 3.755, "step": 950 }, { "epoch": 0.07, "grad_norm": 7.486601829528809, "learning_rate": 0.00014047267355982276, "loss": 3.6841, "step": 960 }, { "epoch": 0.07, "grad_norm": 6.828805923461914, "learning_rate": 0.00014194977843426883, "loss": 3.8212, "step": 970 }, { "epoch": 0.07, "grad_norm": 6.689596176147461, "learning_rate": 0.00014342688330871493, "loss": 3.7554, "step": 980 }, { "epoch": 0.07, "grad_norm": 9.896605491638184, "learning_rate": 0.00014490398818316102, "loss": 3.7252, "step": 990 }, { "epoch": 0.07, "grad_norm": 7.683341026306152, "learning_rate": 0.0001463810930576071, "loss": 3.8645, "step": 1000 }, { "epoch": 0.07, "eval_loss": 3.7340312004089355, "eval_runtime": 1137.3342, "eval_samples_per_second": 5.012, "eval_steps_per_second": 5.012, "step": 1000 }, { "epoch": 0.07, "grad_norm": 7.333156108856201, "learning_rate": 0.0001478581979320532, "loss": 3.701, "step": 1010 }, { "epoch": 0.08, "grad_norm": 6.860635757446289, "learning_rate": 0.00014933530280649928, "loss": 3.8575, "step": 1020 }, { "epoch": 0.08, "grad_norm": 8.277637481689453, "learning_rate": 0.00015081240768094535, "loss": 3.5714, "step": 1030 }, { "epoch": 0.08, "grad_norm": 6.834525108337402, "learning_rate": 0.00015228951255539145, "loss": 3.7444, "step": 1040 }, { "epoch": 0.08, "grad_norm": 7.9503679275512695, "learning_rate": 0.00015376661742983754, "loss": 4.1119, "step": 1050 }, { "epoch": 0.08, "grad_norm": 6.239004135131836, "learning_rate": 0.0001552437223042836, "loss": 3.9033, "step": 1060 }, { "epoch": 0.08, "grad_norm": 8.255178451538086, "learning_rate": 0.00015672082717872968, "loss": 3.9257, "step": 1070 }, { "epoch": 0.08, "grad_norm": 5.259088039398193, "learning_rate": 0.0001581979320531758, "loss": 3.8068, "step": 1080 }, { "epoch": 0.08, "grad_norm": 7.921567916870117, "learning_rate": 0.00015967503692762187, "loss": 3.9009, "step": 1090 }, { "epoch": 0.08, "grad_norm": 5.800931930541992, "learning_rate": 0.00016115214180206794, "loss": 3.4145, "step": 1100 }, { "epoch": 0.08, "grad_norm": 5.795458793640137, "learning_rate": 0.00016262924667651406, "loss": 3.8581, "step": 1110 }, { "epoch": 0.08, "grad_norm": 6.043853282928467, "learning_rate": 0.00016410635155096013, "loss": 3.6541, "step": 1120 }, { "epoch": 0.08, "grad_norm": 9.615581512451172, "learning_rate": 0.0001655834564254062, "loss": 3.7231, "step": 1130 }, { "epoch": 0.08, "grad_norm": 7.142824172973633, "learning_rate": 0.0001670605612998523, "loss": 3.9728, "step": 1140 }, { "epoch": 0.08, "grad_norm": 8.246708869934082, "learning_rate": 0.00016853766617429839, "loss": 3.7804, "step": 1150 }, { "epoch": 0.09, "grad_norm": 7.163732528686523, "learning_rate": 0.00017001477104874445, "loss": 3.5747, "step": 1160 }, { "epoch": 0.09, "grad_norm": 7.906023979187012, "learning_rate": 0.00017149187592319055, "loss": 3.8617, "step": 1170 }, { "epoch": 0.09, "grad_norm": 7.039794445037842, "learning_rate": 0.00017296898079763664, "loss": 3.57, "step": 1180 }, { "epoch": 0.09, "grad_norm": 4.418554782867432, "learning_rate": 0.0001744460856720827, "loss": 3.5283, "step": 1190 }, { "epoch": 0.09, "grad_norm": 4.833454608917236, "learning_rate": 0.0001759231905465288, "loss": 3.707, "step": 1200 }, { "epoch": 0.09, "eval_loss": 3.6806743144989014, "eval_runtime": 1137.1006, "eval_samples_per_second": 5.013, "eval_steps_per_second": 5.013, "step": 1200 }, { "epoch": 0.09, "grad_norm": 7.413050174713135, "learning_rate": 0.0001774002954209749, "loss": 3.6721, "step": 1210 }, { "epoch": 0.09, "grad_norm": 7.842188358306885, "learning_rate": 0.000178877400295421, "loss": 3.4724, "step": 1220 }, { "epoch": 0.09, "grad_norm": 6.357587814331055, "learning_rate": 0.00018035450516986707, "loss": 3.56, "step": 1230 }, { "epoch": 0.09, "grad_norm": 6.298316478729248, "learning_rate": 0.00018183161004431316, "loss": 3.6209, "step": 1240 }, { "epoch": 0.09, "grad_norm": 5.822552680969238, "learning_rate": 0.00018330871491875926, "loss": 3.4501, "step": 1250 }, { "epoch": 0.09, "grad_norm": 5.943758487701416, "learning_rate": 0.00018478581979320533, "loss": 3.6772, "step": 1260 }, { "epoch": 0.09, "grad_norm": 5.048367977142334, "learning_rate": 0.0001862629246676514, "loss": 3.5117, "step": 1270 }, { "epoch": 0.09, "grad_norm": 6.460511684417725, "learning_rate": 0.00018774002954209752, "loss": 3.7063, "step": 1280 }, { "epoch": 0.1, "grad_norm": 5.242683410644531, "learning_rate": 0.00018921713441654358, "loss": 3.636, "step": 1290 }, { "epoch": 0.1, "grad_norm": 7.642856597900391, "learning_rate": 0.00019069423929098965, "loss": 3.9246, "step": 1300 }, { "epoch": 0.1, "grad_norm": 8.507002830505371, "learning_rate": 0.00019217134416543577, "loss": 3.7781, "step": 1310 }, { "epoch": 0.1, "grad_norm": 7.879441261291504, "learning_rate": 0.00019364844903988184, "loss": 3.7177, "step": 1320 }, { "epoch": 0.1, "grad_norm": 7.368891716003418, "learning_rate": 0.0001951255539143279, "loss": 3.8024, "step": 1330 }, { "epoch": 0.1, "grad_norm": 7.859127044677734, "learning_rate": 0.000196602658788774, "loss": 3.9274, "step": 1340 }, { "epoch": 0.1, "grad_norm": 6.2005743980407715, "learning_rate": 0.0001980797636632201, "loss": 3.2389, "step": 1350 }, { "epoch": 0.1, "grad_norm": 7.01071310043335, "learning_rate": 0.00019955686853766617, "loss": 3.947, "step": 1360 }, { "epoch": 0.1, "grad_norm": 6.5373759269714355, "learning_rate": 0.0001999999634469286, "loss": 3.6943, "step": 1370 }, { "epoch": 0.1, "grad_norm": 5.488951206207275, "learning_rate": 0.00019999978441154117, "loss": 4.0045, "step": 1380 }, { "epoch": 0.1, "grad_norm": 6.409852504730225, "learning_rate": 0.00019999945618027503, "loss": 3.8439, "step": 1390 }, { "epoch": 0.1, "grad_norm": 9.671121597290039, "learning_rate": 0.0001999989787536199, "loss": 3.4072, "step": 1400 }, { "epoch": 0.1, "eval_loss": 3.6475000381469727, "eval_runtime": 1136.9069, "eval_samples_per_second": 5.014, "eval_steps_per_second": 5.014, "step": 1400 }, { "epoch": 0.1, "grad_norm": 6.519821643829346, "learning_rate": 0.00019999835213228807, "loss": 3.5066, "step": 1410 }, { "epoch": 0.1, "grad_norm": 7.092315196990967, "learning_rate": 0.00019999757631721448, "loss": 3.4159, "step": 1420 }, { "epoch": 0.11, "grad_norm": 5.200545310974121, "learning_rate": 0.00019999665130955658, "loss": 3.6435, "step": 1430 }, { "epoch": 0.11, "grad_norm": 9.300562858581543, "learning_rate": 0.00019999557711069445, "loss": 3.4732, "step": 1440 }, { "epoch": 0.11, "grad_norm": 6.44257926940918, "learning_rate": 0.00019999435372223073, "loss": 3.2643, "step": 1450 }, { "epoch": 0.11, "grad_norm": 5.217918872833252, "learning_rate": 0.00019999298114599073, "loss": 3.4528, "step": 1460 }, { "epoch": 0.11, "grad_norm": 5.9047465324401855, "learning_rate": 0.00019999145938402223, "loss": 3.615, "step": 1470 }, { "epoch": 0.11, "grad_norm": 6.925083160400391, "learning_rate": 0.00019998978843859563, "loss": 3.5132, "step": 1480 }, { "epoch": 0.11, "grad_norm": 5.6990885734558105, "learning_rate": 0.000199987968312204, "loss": 3.5586, "step": 1490 }, { "epoch": 0.11, "grad_norm": 6.031268119812012, "learning_rate": 0.00019998599900756278, "loss": 3.4244, "step": 1500 }, { "epoch": 0.11, "grad_norm": 6.2754807472229, "learning_rate": 0.0001999838805276102, "loss": 3.6738, "step": 1510 }, { "epoch": 0.11, "grad_norm": 7.507335662841797, "learning_rate": 0.0001999816128755069, "loss": 3.5759, "step": 1520 }, { "epoch": 0.11, "grad_norm": 5.121018886566162, "learning_rate": 0.00019997919605463615, "loss": 3.4038, "step": 1530 }, { "epoch": 0.11, "grad_norm": 6.7317585945129395, "learning_rate": 0.00019997663006860377, "loss": 3.4423, "step": 1540 }, { "epoch": 0.11, "grad_norm": 8.375152587890625, "learning_rate": 0.00019997391492123805, "loss": 3.4604, "step": 1550 }, { "epoch": 0.12, "grad_norm": 8.493053436279297, "learning_rate": 0.00019997105061658993, "loss": 3.7444, "step": 1560 }, { "epoch": 0.12, "grad_norm": 7.297514915466309, "learning_rate": 0.00019996803715893288, "loss": 3.5108, "step": 1570 }, { "epoch": 0.12, "grad_norm": 7.771124362945557, "learning_rate": 0.0001999648745527628, "loss": 3.4314, "step": 1580 }, { "epoch": 0.12, "grad_norm": 6.717478275299072, "learning_rate": 0.0001999615628027982, "loss": 3.4074, "step": 1590 }, { "epoch": 0.12, "grad_norm": 6.69790506362915, "learning_rate": 0.00019995810191398013, "loss": 3.6088, "step": 1600 }, { "epoch": 0.12, "eval_loss": 3.577223777770996, "eval_runtime": 1137.2761, "eval_samples_per_second": 5.012, "eval_steps_per_second": 5.012, "step": 1600 }, { "epoch": 0.12, "grad_norm": 6.6742353439331055, "learning_rate": 0.00019995449189147202, "loss": 3.8424, "step": 1610 }, { "epoch": 0.12, "grad_norm": 7.415431499481201, "learning_rate": 0.00019995073274065996, "loss": 3.5783, "step": 1620 }, { "epoch": 0.12, "grad_norm": 6.665797233581543, "learning_rate": 0.00019994682446715243, "loss": 3.7045, "step": 1630 }, { "epoch": 0.12, "grad_norm": 7.37005090713501, "learning_rate": 0.00019994276707678042, "loss": 3.6974, "step": 1640 }, { "epoch": 0.12, "grad_norm": 7.891625881195068, "learning_rate": 0.0001999385605755974, "loss": 3.7608, "step": 1650 }, { "epoch": 0.12, "grad_norm": 7.512894153594971, "learning_rate": 0.0001999342049698793, "loss": 3.431, "step": 1660 }, { "epoch": 0.12, "grad_norm": 6.875561714172363, "learning_rate": 0.00019992970026612458, "loss": 3.3929, "step": 1670 }, { "epoch": 0.12, "grad_norm": 8.319578170776367, "learning_rate": 0.00019992504647105402, "loss": 4.0538, "step": 1680 }, { "epoch": 0.12, "grad_norm": 7.310130596160889, "learning_rate": 0.00019992024359161094, "loss": 3.4099, "step": 1690 }, { "epoch": 0.13, "grad_norm": 8.529996871948242, "learning_rate": 0.00019991529163496105, "loss": 3.8976, "step": 1700 }, { "epoch": 0.13, "grad_norm": 7.030924320220947, "learning_rate": 0.00019991019060849245, "loss": 3.308, "step": 1710 }, { "epoch": 0.13, "grad_norm": 7.881046772003174, "learning_rate": 0.00019990494051981572, "loss": 3.6736, "step": 1720 }, { "epoch": 0.13, "grad_norm": 6.200523376464844, "learning_rate": 0.00019989954137676378, "loss": 3.5267, "step": 1730 }, { "epoch": 0.13, "grad_norm": 7.548309326171875, "learning_rate": 0.00019989399318739195, "loss": 3.5834, "step": 1740 }, { "epoch": 0.13, "grad_norm": 4.992281436920166, "learning_rate": 0.0001998882959599779, "loss": 3.5305, "step": 1750 }, { "epoch": 0.13, "grad_norm": 4.387537002563477, "learning_rate": 0.00019988244970302167, "loss": 3.6708, "step": 1760 }, { "epoch": 0.13, "grad_norm": 7.442427158355713, "learning_rate": 0.00019987645442524565, "loss": 3.3423, "step": 1770 }, { "epoch": 0.13, "grad_norm": 8.170509338378906, "learning_rate": 0.00019987031013559464, "loss": 3.3772, "step": 1780 }, { "epoch": 0.13, "grad_norm": 7.7752156257629395, "learning_rate": 0.00019986401684323558, "loss": 3.3992, "step": 1790 }, { "epoch": 0.13, "grad_norm": 7.013359546661377, "learning_rate": 0.00019985757455755792, "loss": 3.5566, "step": 1800 }, { "epoch": 0.13, "eval_loss": 3.54105806350708, "eval_runtime": 1135.1448, "eval_samples_per_second": 5.021, "eval_steps_per_second": 5.021, "step": 1800 }, { "epoch": 0.13, "grad_norm": 6.861136436462402, "learning_rate": 0.00019985098328817325, "loss": 3.9438, "step": 1810 }, { "epoch": 0.13, "grad_norm": 6.609218120574951, "learning_rate": 0.00019984424304491548, "loss": 3.666, "step": 1820 }, { "epoch": 0.14, "grad_norm": 4.466552257537842, "learning_rate": 0.00019983735383784083, "loss": 3.8464, "step": 1830 }, { "epoch": 0.14, "grad_norm": 7.376965522766113, "learning_rate": 0.00019983031567722776, "loss": 3.6616, "step": 1840 }, { "epoch": 0.14, "grad_norm": 7.786184310913086, "learning_rate": 0.00019982312857357685, "loss": 3.7319, "step": 1850 }, { "epoch": 0.14, "grad_norm": 8.764631271362305, "learning_rate": 0.00019981579253761108, "loss": 3.6593, "step": 1860 }, { "epoch": 0.14, "grad_norm": 5.396511077880859, "learning_rate": 0.00019980830758027545, "loss": 3.441, "step": 1870 }, { "epoch": 0.14, "grad_norm": 8.925567626953125, "learning_rate": 0.00019980067371273735, "loss": 3.4468, "step": 1880 }, { "epoch": 0.14, "grad_norm": 8.163759231567383, "learning_rate": 0.00019979289094638613, "loss": 3.245, "step": 1890 }, { "epoch": 0.14, "grad_norm": 8.861410140991211, "learning_rate": 0.00019978495929283337, "loss": 3.5554, "step": 1900 }, { "epoch": 0.14, "grad_norm": 7.900471210479736, "learning_rate": 0.00019977687876391285, "loss": 3.2615, "step": 1910 }, { "epoch": 0.14, "grad_norm": 5.780396461486816, "learning_rate": 0.00019976864937168036, "loss": 3.3208, "step": 1920 }, { "epoch": 0.14, "grad_norm": 5.2572407722473145, "learning_rate": 0.00019976027112841388, "loss": 3.352, "step": 1930 }, { "epoch": 0.14, "grad_norm": 5.782130241394043, "learning_rate": 0.00019975174404661346, "loss": 3.5688, "step": 1940 }, { "epoch": 0.14, "grad_norm": 6.212008953094482, "learning_rate": 0.0001997430681390011, "loss": 3.5783, "step": 1950 }, { "epoch": 0.14, "grad_norm": 6.492382049560547, "learning_rate": 0.00019973424341852099, "loss": 3.5022, "step": 1960 }, { "epoch": 0.15, "grad_norm": 8.884483337402344, "learning_rate": 0.0001997252698983392, "loss": 3.7064, "step": 1970 }, { "epoch": 0.15, "grad_norm": 5.934466361999512, "learning_rate": 0.000199716147591844, "loss": 3.2841, "step": 1980 }, { "epoch": 0.15, "grad_norm": 7.51339054107666, "learning_rate": 0.00019970687651264544, "loss": 3.5057, "step": 1990 }, { "epoch": 0.15, "grad_norm": 6.577907562255859, "learning_rate": 0.00019969745667457563, "loss": 3.732, "step": 2000 }, { "epoch": 0.15, "eval_loss": 3.5348992347717285, "eval_runtime": 1138.0424, "eval_samples_per_second": 5.009, "eval_steps_per_second": 5.009, "step": 2000 }, { "epoch": 0.15, "grad_norm": 7.850986957550049, "learning_rate": 0.00019968788809168864, "loss": 3.6663, "step": 2010 }, { "epoch": 0.15, "grad_norm": 6.481893539428711, "learning_rate": 0.00019967817077826038, "loss": 3.6468, "step": 2020 }, { "epoch": 0.15, "grad_norm": 4.882330417633057, "learning_rate": 0.00019966830474878874, "loss": 3.2107, "step": 2030 }, { "epoch": 0.15, "grad_norm": 6.80741548538208, "learning_rate": 0.0001996582900179935, "loss": 3.4008, "step": 2040 }, { "epoch": 0.15, "grad_norm": 6.9632062911987305, "learning_rate": 0.0001996481266008162, "loss": 3.7073, "step": 2050 }, { "epoch": 0.15, "grad_norm": 6.361908435821533, "learning_rate": 0.0001996378145124203, "loss": 3.766, "step": 2060 }, { "epoch": 0.15, "grad_norm": 6.315945625305176, "learning_rate": 0.00019962735376819103, "loss": 3.2956, "step": 2070 }, { "epoch": 0.15, "grad_norm": 6.583601474761963, "learning_rate": 0.00019961674438373543, "loss": 3.5508, "step": 2080 }, { "epoch": 0.15, "grad_norm": 4.8111443519592285, "learning_rate": 0.00019960598637488232, "loss": 3.2411, "step": 2090 }, { "epoch": 0.16, "grad_norm": 4.75316858291626, "learning_rate": 0.0001995950797576822, "loss": 3.5754, "step": 2100 }, { "epoch": 0.16, "grad_norm": 10.522501945495605, "learning_rate": 0.00019958402454840735, "loss": 3.4347, "step": 2110 }, { "epoch": 0.16, "grad_norm": 4.327103137969971, "learning_rate": 0.00019957282076355176, "loss": 3.1955, "step": 2120 }, { "epoch": 0.16, "grad_norm": 6.88126802444458, "learning_rate": 0.00019956146841983095, "loss": 3.7632, "step": 2130 }, { "epoch": 0.16, "grad_norm": 7.087936878204346, "learning_rate": 0.00019954996753418226, "loss": 3.6128, "step": 2140 }, { "epoch": 0.16, "grad_norm": 7.831874847412109, "learning_rate": 0.00019953831812376458, "loss": 3.3576, "step": 2150 }, { "epoch": 0.16, "grad_norm": 8.72523307800293, "learning_rate": 0.00019952652020595836, "loss": 3.7325, "step": 2160 }, { "epoch": 0.16, "grad_norm": 4.645705223083496, "learning_rate": 0.0001995145737983657, "loss": 3.1901, "step": 2170 }, { "epoch": 0.16, "grad_norm": 4.229705810546875, "learning_rate": 0.00019950247891881007, "loss": 3.4187, "step": 2180 }, { "epoch": 0.16, "grad_norm": 6.123934745788574, "learning_rate": 0.00019949023558533667, "loss": 3.4375, "step": 2190 }, { "epoch": 0.16, "grad_norm": 5.184828758239746, "learning_rate": 0.00019947784381621207, "loss": 3.439, "step": 2200 }, { "epoch": 0.16, "eval_loss": 3.48419451713562, "eval_runtime": 1136.5822, "eval_samples_per_second": 5.015, "eval_steps_per_second": 5.015, "step": 2200 }, { "epoch": 0.16, "grad_norm": 8.93528938293457, "learning_rate": 0.0001994653036299243, "loss": 3.3408, "step": 2210 }, { "epoch": 0.16, "grad_norm": 6.074134349822998, "learning_rate": 0.00019945261504518283, "loss": 3.2553, "step": 2220 }, { "epoch": 0.16, "grad_norm": 6.840206623077393, "learning_rate": 0.0001994397780809186, "loss": 3.7404, "step": 2230 }, { "epoch": 0.17, "grad_norm": 5.7097015380859375, "learning_rate": 0.00019942679275628385, "loss": 3.5795, "step": 2240 }, { "epoch": 0.17, "grad_norm": 9.260488510131836, "learning_rate": 0.00019941365909065213, "loss": 3.3823, "step": 2250 }, { "epoch": 0.17, "grad_norm": 5.96670389175415, "learning_rate": 0.00019940037710361845, "loss": 3.5781, "step": 2260 }, { "epoch": 0.17, "grad_norm": 6.096765041351318, "learning_rate": 0.000199386946814999, "loss": 3.318, "step": 2270 }, { "epoch": 0.17, "grad_norm": 8.807679176330566, "learning_rate": 0.00019937336824483125, "loss": 3.899, "step": 2280 }, { "epoch": 0.17, "grad_norm": 8.762829780578613, "learning_rate": 0.00019935964141337397, "loss": 3.6643, "step": 2290 }, { "epoch": 0.17, "grad_norm": 6.245787143707275, "learning_rate": 0.00019934576634110694, "loss": 3.3506, "step": 2300 }, { "epoch": 0.17, "grad_norm": 7.598389148712158, "learning_rate": 0.00019933174304873137, "loss": 3.6882, "step": 2310 }, { "epoch": 0.17, "grad_norm": 5.335952281951904, "learning_rate": 0.00019931757155716945, "loss": 3.2894, "step": 2320 }, { "epoch": 0.17, "grad_norm": 9.133307456970215, "learning_rate": 0.00019930325188756445, "loss": 3.7499, "step": 2330 }, { "epoch": 0.17, "grad_norm": 4.007411003112793, "learning_rate": 0.00019928878406128082, "loss": 3.5422, "step": 2340 }, { "epoch": 0.17, "grad_norm": 5.258805274963379, "learning_rate": 0.000199274168099904, "loss": 3.2147, "step": 2350 }, { "epoch": 0.17, "grad_norm": 7.238628387451172, "learning_rate": 0.00019925940402524045, "loss": 3.6826, "step": 2360 }, { "epoch": 0.18, "grad_norm": 9.149068832397461, "learning_rate": 0.0001992444918593176, "loss": 3.3555, "step": 2370 }, { "epoch": 0.18, "grad_norm": 4.866962432861328, "learning_rate": 0.00019922943162438387, "loss": 3.4047, "step": 2380 }, { "epoch": 0.18, "grad_norm": 5.280197620391846, "learning_rate": 0.00019921422334290853, "loss": 3.3403, "step": 2390 }, { "epoch": 0.18, "grad_norm": 7.82426643371582, "learning_rate": 0.00019919886703758172, "loss": 3.3946, "step": 2400 }, { "epoch": 0.18, "eval_loss": 3.453319549560547, "eval_runtime": 1136.6416, "eval_samples_per_second": 5.015, "eval_steps_per_second": 5.015, "step": 2400 }, { "epoch": 0.18, "grad_norm": 5.7295026779174805, "learning_rate": 0.00019918336273131452, "loss": 3.5742, "step": 2410 }, { "epoch": 0.18, "grad_norm": 8.926092147827148, "learning_rate": 0.00019916771044723876, "loss": 3.2468, "step": 2420 }, { "epoch": 0.18, "grad_norm": 7.297746181488037, "learning_rate": 0.00019915191020870702, "loss": 3.3415, "step": 2430 }, { "epoch": 0.18, "grad_norm": 9.079599380493164, "learning_rate": 0.0001991359620392927, "loss": 3.3625, "step": 2440 }, { "epoch": 0.18, "grad_norm": 5.494599342346191, "learning_rate": 0.00019911986596278985, "loss": 3.6401, "step": 2450 }, { "epoch": 0.18, "grad_norm": 6.640133380889893, "learning_rate": 0.00019910362200321316, "loss": 3.4156, "step": 2460 }, { "epoch": 0.18, "grad_norm": 6.4240899085998535, "learning_rate": 0.00019908723018479803, "loss": 3.5701, "step": 2470 }, { "epoch": 0.18, "grad_norm": 8.585311889648438, "learning_rate": 0.00019907069053200048, "loss": 3.7639, "step": 2480 }, { "epoch": 0.18, "grad_norm": 5.190982341766357, "learning_rate": 0.00019905400306949696, "loss": 3.33, "step": 2490 }, { "epoch": 0.18, "grad_norm": 11.753495216369629, "learning_rate": 0.0001990371678221846, "loss": 3.4348, "step": 2500 }, { "epoch": 0.19, "grad_norm": 6.850786209106445, "learning_rate": 0.00019902018481518087, "loss": 3.3675, "step": 2510 }, { "epoch": 0.19, "grad_norm": 6.522672653198242, "learning_rate": 0.00019900305407382385, "loss": 3.8967, "step": 2520 }, { "epoch": 0.19, "grad_norm": 5.153144836425781, "learning_rate": 0.00019898577562367192, "loss": 3.5849, "step": 2530 }, { "epoch": 0.19, "grad_norm": 5.392364978790283, "learning_rate": 0.00019896834949050386, "loss": 3.4041, "step": 2540 }, { "epoch": 0.19, "grad_norm": 4.904518127441406, "learning_rate": 0.00019895077570031885, "loss": 3.1431, "step": 2550 }, { "epoch": 0.19, "grad_norm": 8.451141357421875, "learning_rate": 0.00019893305427933625, "loss": 3.5762, "step": 2560 }, { "epoch": 0.19, "grad_norm": 4.73913049697876, "learning_rate": 0.00019891518525399577, "loss": 3.385, "step": 2570 }, { "epoch": 0.19, "grad_norm": 7.964975357055664, "learning_rate": 0.00019889716865095737, "loss": 3.5396, "step": 2580 }, { "epoch": 0.19, "grad_norm": 5.87448787689209, "learning_rate": 0.00019887900449710105, "loss": 3.3033, "step": 2590 }, { "epoch": 0.19, "grad_norm": 7.167208671569824, "learning_rate": 0.0001988606928195271, "loss": 3.2439, "step": 2600 }, { "epoch": 0.19, "eval_loss": 3.4154865741729736, "eval_runtime": 1136.1752, "eval_samples_per_second": 5.017, "eval_steps_per_second": 5.017, "step": 2600 }, { "epoch": 0.19, "grad_norm": 8.291434288024902, "learning_rate": 0.00019884223364555577, "loss": 3.5985, "step": 2610 }, { "epoch": 0.19, "grad_norm": 13.045690536499023, "learning_rate": 0.00019882362700272756, "loss": 3.6016, "step": 2620 }, { "epoch": 0.19, "grad_norm": 4.1934638023376465, "learning_rate": 0.0001988048729188028, "loss": 3.3421, "step": 2630 }, { "epoch": 0.2, "grad_norm": 6.0803022384643555, "learning_rate": 0.0001987859714217619, "loss": 3.3617, "step": 2640 }, { "epoch": 0.2, "grad_norm": 5.752238750457764, "learning_rate": 0.00019876692253980514, "loss": 3.2002, "step": 2650 }, { "epoch": 0.2, "grad_norm": 7.0404229164123535, "learning_rate": 0.00019874772630135276, "loss": 3.6474, "step": 2660 }, { "epoch": 0.2, "grad_norm": 6.9117231369018555, "learning_rate": 0.00019872838273504484, "loss": 3.4813, "step": 2670 }, { "epoch": 0.2, "grad_norm": 4.626667022705078, "learning_rate": 0.00019870889186974114, "loss": 3.4797, "step": 2680 }, { "epoch": 0.2, "grad_norm": 7.123105049133301, "learning_rate": 0.00019868925373452143, "loss": 3.3551, "step": 2690 }, { "epoch": 0.2, "grad_norm": 5.760848045349121, "learning_rate": 0.00019866946835868498, "loss": 3.449, "step": 2700 }, { "epoch": 0.2, "grad_norm": 8.604194641113281, "learning_rate": 0.00019864953577175082, "loss": 3.5442, "step": 2710 }, { "epoch": 0.2, "grad_norm": 6.785797595977783, "learning_rate": 0.00019862945600345765, "loss": 3.2603, "step": 2720 }, { "epoch": 0.2, "grad_norm": 5.647066593170166, "learning_rate": 0.00019860922908376369, "loss": 2.6124, "step": 2730 }, { "epoch": 0.2, "grad_norm": 7.947900295257568, "learning_rate": 0.00019858885504284678, "loss": 3.4572, "step": 2740 }, { "epoch": 0.2, "grad_norm": 8.052631378173828, "learning_rate": 0.00019856833391110413, "loss": 3.5738, "step": 2750 }, { "epoch": 0.2, "grad_norm": 8.352448463439941, "learning_rate": 0.00019854766571915256, "loss": 3.6006, "step": 2760 }, { "epoch": 0.2, "grad_norm": 7.586352825164795, "learning_rate": 0.0001985268504978282, "loss": 3.2241, "step": 2770 }, { "epoch": 0.21, "grad_norm": 7.188523292541504, "learning_rate": 0.00019850588827818657, "loss": 3.6322, "step": 2780 }, { "epoch": 0.21, "grad_norm": 5.39801025390625, "learning_rate": 0.0001984847790915025, "loss": 3.4845, "step": 2790 }, { "epoch": 0.21, "grad_norm": 7.282923221588135, "learning_rate": 0.00019846352296927014, "loss": 3.4464, "step": 2800 }, { "epoch": 0.21, "eval_loss": 3.367934465408325, "eval_runtime": 1136.0262, "eval_samples_per_second": 5.017, "eval_steps_per_second": 5.017, "step": 2800 }, { "epoch": 0.21, "grad_norm": 4.772936820983887, "learning_rate": 0.00019844211994320276, "loss": 3.4074, "step": 2810 }, { "epoch": 0.21, "grad_norm": 4.3813557624816895, "learning_rate": 0.0001984205700452329, "loss": 3.3233, "step": 2820 }, { "epoch": 0.21, "grad_norm": 6.158441066741943, "learning_rate": 0.00019839887330751216, "loss": 3.3386, "step": 2830 }, { "epoch": 0.21, "grad_norm": 6.600301742553711, "learning_rate": 0.00019837702976241125, "loss": 3.6874, "step": 2840 }, { "epoch": 0.21, "grad_norm": 4.815470218658447, "learning_rate": 0.0001983550394425199, "loss": 3.3827, "step": 2850 }, { "epoch": 0.21, "grad_norm": 5.964359283447266, "learning_rate": 0.0001983329023806469, "loss": 3.2807, "step": 2860 }, { "epoch": 0.21, "grad_norm": 8.458023071289062, "learning_rate": 0.00019831061860981983, "loss": 3.632, "step": 2870 }, { "epoch": 0.21, "grad_norm": 5.9718451499938965, "learning_rate": 0.00019828818816328524, "loss": 3.5007, "step": 2880 }, { "epoch": 0.21, "grad_norm": 5.465640068054199, "learning_rate": 0.00019826561107450855, "loss": 3.4227, "step": 2890 }, { "epoch": 0.21, "grad_norm": 7.5957932472229, "learning_rate": 0.0001982428873771739, "loss": 3.276, "step": 2900 }, { "epoch": 0.21, "grad_norm": 6.594062805175781, "learning_rate": 0.00019822001710518414, "loss": 3.5748, "step": 2910 }, { "epoch": 0.22, "grad_norm": 7.030744552612305, "learning_rate": 0.0001981970002926609, "loss": 3.52, "step": 2920 }, { "epoch": 0.22, "grad_norm": 4.242162227630615, "learning_rate": 0.00019817383697394436, "loss": 3.1708, "step": 2930 }, { "epoch": 0.22, "grad_norm": 5.48106575012207, "learning_rate": 0.00019815052718359332, "loss": 3.3604, "step": 2940 }, { "epoch": 0.22, "grad_norm": 5.874629020690918, "learning_rate": 0.0001981270709563851, "loss": 3.6508, "step": 2950 }, { "epoch": 0.22, "grad_norm": 8.531209945678711, "learning_rate": 0.00019810346832731547, "loss": 3.6164, "step": 2960 }, { "epoch": 0.22, "grad_norm": 5.588098526000977, "learning_rate": 0.00019807971933159872, "loss": 3.2622, "step": 2970 }, { "epoch": 0.22, "grad_norm": 6.22597599029541, "learning_rate": 0.00019805582400466744, "loss": 3.4031, "step": 2980 }, { "epoch": 0.22, "grad_norm": 6.695744514465332, "learning_rate": 0.0001980317823821725, "loss": 3.5455, "step": 2990 }, { "epoch": 0.22, "grad_norm": 4.2548041343688965, "learning_rate": 0.00019800759449998309, "loss": 3.0615, "step": 3000 }, { "epoch": 0.22, "eval_loss": 3.3597333431243896, "eval_runtime": 1134.8816, "eval_samples_per_second": 5.023, "eval_steps_per_second": 5.023, "step": 3000 }, { "epoch": 0.22, "grad_norm": 8.229665756225586, "learning_rate": 0.00019798326039418667, "loss": 3.3148, "step": 3010 }, { "epoch": 0.22, "grad_norm": 5.809466361999512, "learning_rate": 0.00019795878010108874, "loss": 3.4232, "step": 3020 }, { "epoch": 0.22, "grad_norm": 6.6790452003479, "learning_rate": 0.00019793415365721302, "loss": 3.4493, "step": 3030 }, { "epoch": 0.22, "grad_norm": 5.497518539428711, "learning_rate": 0.00019790938109930117, "loss": 3.5587, "step": 3040 }, { "epoch": 0.23, "grad_norm": 6.745602607727051, "learning_rate": 0.00019788446246431294, "loss": 3.1202, "step": 3050 }, { "epoch": 0.23, "grad_norm": 5.6326751708984375, "learning_rate": 0.00019785939778942598, "loss": 3.3952, "step": 3060 }, { "epoch": 0.23, "grad_norm": 9.828627586364746, "learning_rate": 0.00019783418711203586, "loss": 3.515, "step": 3070 }, { "epoch": 0.23, "grad_norm": 6.52869987487793, "learning_rate": 0.00019780883046975593, "loss": 3.0494, "step": 3080 }, { "epoch": 0.23, "grad_norm": 5.64887809753418, "learning_rate": 0.0001977833279004173, "loss": 3.25, "step": 3090 }, { "epoch": 0.23, "grad_norm": 8.327272415161133, "learning_rate": 0.0001977576794420689, "loss": 3.0999, "step": 3100 }, { "epoch": 0.23, "grad_norm": 6.6515960693359375, "learning_rate": 0.0001977318851329772, "loss": 3.4192, "step": 3110 }, { "epoch": 0.23, "grad_norm": 5.670393943786621, "learning_rate": 0.00019770594501162636, "loss": 3.5086, "step": 3120 }, { "epoch": 0.23, "grad_norm": 4.622827529907227, "learning_rate": 0.00019767985911671806, "loss": 3.4726, "step": 3130 }, { "epoch": 0.23, "grad_norm": 8.66515827178955, "learning_rate": 0.00019765362748717146, "loss": 3.4205, "step": 3140 }, { "epoch": 0.23, "grad_norm": 8.402259826660156, "learning_rate": 0.0001976272501621231, "loss": 3.4137, "step": 3150 }, { "epoch": 0.23, "grad_norm": 5.634212017059326, "learning_rate": 0.00019760072718092705, "loss": 3.1628, "step": 3160 }, { "epoch": 0.23, "grad_norm": 4.353554725646973, "learning_rate": 0.00019757405858315452, "loss": 3.276, "step": 3170 }, { "epoch": 0.23, "grad_norm": 5.939391613006592, "learning_rate": 0.00019754724440859404, "loss": 3.5853, "step": 3180 }, { "epoch": 0.24, "grad_norm": 8.367985725402832, "learning_rate": 0.0001975202846972514, "loss": 3.4567, "step": 3190 }, { "epoch": 0.24, "grad_norm": 7.315502166748047, "learning_rate": 0.00019749317948934938, "loss": 3.4765, "step": 3200 }, { "epoch": 0.24, "eval_loss": 3.343524217605591, "eval_runtime": 1140.2904, "eval_samples_per_second": 4.999, "eval_steps_per_second": 4.999, "step": 3200 }, { "epoch": 0.24, "grad_norm": 8.31916332244873, "learning_rate": 0.000197465928825328, "loss": 3.3034, "step": 3210 }, { "epoch": 0.24, "grad_norm": 8.205561637878418, "learning_rate": 0.00019743853274584413, "loss": 3.5482, "step": 3220 }, { "epoch": 0.24, "grad_norm": 5.829329967498779, "learning_rate": 0.00019741099129177175, "loss": 2.9163, "step": 3230 }, { "epoch": 0.24, "grad_norm": 7.337162494659424, "learning_rate": 0.00019738330450420167, "loss": 3.8382, "step": 3240 }, { "epoch": 0.24, "grad_norm": 3.8535377979278564, "learning_rate": 0.00019735547242444147, "loss": 3.3907, "step": 3250 }, { "epoch": 0.24, "grad_norm": 8.694036483764648, "learning_rate": 0.0001973274950940156, "loss": 3.3614, "step": 3260 }, { "epoch": 0.24, "grad_norm": 6.478395938873291, "learning_rate": 0.00019729937255466516, "loss": 3.5151, "step": 3270 }, { "epoch": 0.24, "grad_norm": 5.95184850692749, "learning_rate": 0.00019727110484834786, "loss": 3.6187, "step": 3280 }, { "epoch": 0.24, "grad_norm": 7.137448787689209, "learning_rate": 0.00019724269201723812, "loss": 3.1106, "step": 3290 }, { "epoch": 0.24, "grad_norm": 11.196949005126953, "learning_rate": 0.0001972141341037268, "loss": 3.5204, "step": 3300 }, { "epoch": 0.24, "grad_norm": 6.896291732788086, "learning_rate": 0.00019718543115042114, "loss": 3.0704, "step": 3310 }, { "epoch": 0.25, "grad_norm": 6.517507076263428, "learning_rate": 0.00019715658320014495, "loss": 2.7999, "step": 3320 }, { "epoch": 0.25, "grad_norm": 5.880134582519531, "learning_rate": 0.00019712759029593823, "loss": 3.1512, "step": 3330 }, { "epoch": 0.25, "grad_norm": 5.887697696685791, "learning_rate": 0.0001970984524810573, "loss": 3.2726, "step": 3340 }, { "epoch": 0.25, "grad_norm": 7.048807144165039, "learning_rate": 0.0001970691697989747, "loss": 3.2771, "step": 3350 }, { "epoch": 0.25, "grad_norm": 7.299494743347168, "learning_rate": 0.000197039742293379, "loss": 3.5471, "step": 3360 }, { "epoch": 0.25, "grad_norm": 5.468966007232666, "learning_rate": 0.000197010170008175, "loss": 3.255, "step": 3370 }, { "epoch": 0.25, "grad_norm": 5.875086307525635, "learning_rate": 0.0001969804529874834, "loss": 3.4126, "step": 3380 }, { "epoch": 0.25, "grad_norm": 7.930294513702393, "learning_rate": 0.00019695059127564085, "loss": 3.075, "step": 3390 }, { "epoch": 0.25, "grad_norm": 7.626434803009033, "learning_rate": 0.0001969205849171999, "loss": 3.4761, "step": 3400 }, { "epoch": 0.25, "eval_loss": 3.3232839107513428, "eval_runtime": 1137.5832, "eval_samples_per_second": 5.011, "eval_steps_per_second": 5.011, "step": 3400 }, { "epoch": 0.25, "grad_norm": 5.242149829864502, "learning_rate": 0.00019689043395692892, "loss": 3.0588, "step": 3410 }, { "epoch": 0.25, "grad_norm": 7.011462688446045, "learning_rate": 0.00019686013843981198, "loss": 3.2723, "step": 3420 }, { "epoch": 0.25, "grad_norm": 4.377874374389648, "learning_rate": 0.00019682969841104878, "loss": 3.1512, "step": 3430 }, { "epoch": 0.25, "grad_norm": 6.708550930023193, "learning_rate": 0.0001967991139160548, "loss": 3.1751, "step": 3440 }, { "epoch": 0.25, "grad_norm": 4.417352199554443, "learning_rate": 0.00019676838500046087, "loss": 3.3083, "step": 3450 }, { "epoch": 0.26, "grad_norm": 7.341493129730225, "learning_rate": 0.00019673751171011338, "loss": 3.2975, "step": 3460 }, { "epoch": 0.26, "grad_norm": 8.692483901977539, "learning_rate": 0.00019670649409107412, "loss": 3.8891, "step": 3470 }, { "epoch": 0.26, "grad_norm": 6.154200077056885, "learning_rate": 0.00019667533218962018, "loss": 3.6839, "step": 3480 }, { "epoch": 0.26, "grad_norm": 4.297388553619385, "learning_rate": 0.00019664402605224394, "loss": 3.1778, "step": 3490 }, { "epoch": 0.26, "grad_norm": 7.2736992835998535, "learning_rate": 0.00019661257572565295, "loss": 3.469, "step": 3500 }, { "epoch": 0.26, "grad_norm": 7.676090717315674, "learning_rate": 0.00019658098125676992, "loss": 3.4535, "step": 3510 }, { "epoch": 0.26, "grad_norm": 6.6982421875, "learning_rate": 0.00019654924269273263, "loss": 3.3746, "step": 3520 }, { "epoch": 0.26, "grad_norm": 6.276124954223633, "learning_rate": 0.00019651736008089373, "loss": 2.9256, "step": 3530 }, { "epoch": 0.26, "grad_norm": 5.375932693481445, "learning_rate": 0.00019648533346882093, "loss": 3.3528, "step": 3540 }, { "epoch": 0.26, "grad_norm": 4.612643718719482, "learning_rate": 0.00019645316290429674, "loss": 3.5446, "step": 3550 }, { "epoch": 0.26, "grad_norm": 6.172947406768799, "learning_rate": 0.00019642084843531836, "loss": 3.1953, "step": 3560 }, { "epoch": 0.26, "grad_norm": 7.488225936889648, "learning_rate": 0.00019638839011009774, "loss": 3.6664, "step": 3570 }, { "epoch": 0.26, "grad_norm": 7.576664924621582, "learning_rate": 0.00019635578797706153, "loss": 3.3036, "step": 3580 }, { "epoch": 0.27, "grad_norm": 5.035768508911133, "learning_rate": 0.00019632304208485083, "loss": 3.0142, "step": 3590 }, { "epoch": 0.27, "grad_norm": 9.324599266052246, "learning_rate": 0.0001962901524823213, "loss": 3.3434, "step": 3600 }, { "epoch": 0.27, "eval_loss": 3.311063289642334, "eval_runtime": 1137.219, "eval_samples_per_second": 5.012, "eval_steps_per_second": 5.012, "step": 3600 }, { "epoch": 0.27, "grad_norm": 10.588373184204102, "learning_rate": 0.00019625711921854294, "loss": 3.2817, "step": 3610 }, { "epoch": 0.27, "grad_norm": 6.402177333831787, "learning_rate": 0.00019622394234280015, "loss": 3.5977, "step": 3620 }, { "epoch": 0.27, "grad_norm": 5.769714832305908, "learning_rate": 0.00019619062190459158, "loss": 3.4483, "step": 3630 }, { "epoch": 0.27, "grad_norm": 7.45050573348999, "learning_rate": 0.00019615715795363002, "loss": 3.1609, "step": 3640 }, { "epoch": 0.27, "grad_norm": 7.920661926269531, "learning_rate": 0.0001961235505398424, "loss": 3.6847, "step": 3650 }, { "epoch": 0.27, "grad_norm": 5.056427478790283, "learning_rate": 0.00019608979971336976, "loss": 3.2006, "step": 3660 }, { "epoch": 0.27, "grad_norm": 4.104165554046631, "learning_rate": 0.00019605590552456702, "loss": 3.3135, "step": 3670 }, { "epoch": 0.27, "grad_norm": 7.370213985443115, "learning_rate": 0.00019602186802400304, "loss": 3.2463, "step": 3680 }, { "epoch": 0.27, "grad_norm": 8.189712524414062, "learning_rate": 0.00019598768726246046, "loss": 3.3439, "step": 3690 }, { "epoch": 0.27, "grad_norm": 7.025254249572754, "learning_rate": 0.0001959533632909357, "loss": 3.377, "step": 3700 }, { "epoch": 0.27, "grad_norm": 8.040080070495605, "learning_rate": 0.00019591889616063876, "loss": 2.955, "step": 3710 }, { "epoch": 0.27, "grad_norm": 10.804893493652344, "learning_rate": 0.00019588428592299338, "loss": 3.1838, "step": 3720 }, { "epoch": 0.28, "grad_norm": 5.024282455444336, "learning_rate": 0.00019584953262963666, "loss": 3.6454, "step": 3730 }, { "epoch": 0.28, "grad_norm": 8.655365943908691, "learning_rate": 0.00019581463633241918, "loss": 3.1139, "step": 3740 }, { "epoch": 0.28, "grad_norm": 6.94295597076416, "learning_rate": 0.00019577959708340497, "loss": 3.2513, "step": 3750 }, { "epoch": 0.28, "grad_norm": 7.816835880279541, "learning_rate": 0.00019574441493487113, "loss": 3.2964, "step": 3760 }, { "epoch": 0.28, "grad_norm": 6.934699058532715, "learning_rate": 0.00019570908993930825, "loss": 3.4247, "step": 3770 }, { "epoch": 0.28, "grad_norm": 5.775935649871826, "learning_rate": 0.0001956736221494197, "loss": 3.2132, "step": 3780 }, { "epoch": 0.28, "grad_norm": 10.476348876953125, "learning_rate": 0.00019563801161812222, "loss": 3.3441, "step": 3790 }, { "epoch": 0.28, "grad_norm": 6.069675445556641, "learning_rate": 0.0001956022583985453, "loss": 3.5925, "step": 3800 }, { "epoch": 0.28, "eval_loss": 3.297185182571411, "eval_runtime": 1137.6657, "eval_samples_per_second": 5.01, "eval_steps_per_second": 5.01, "step": 3800 }, { "epoch": 0.28, "grad_norm": 7.1156134605407715, "learning_rate": 0.00019556636254403143, "loss": 3.3711, "step": 3810 }, { "epoch": 0.28, "grad_norm": 6.738784313201904, "learning_rate": 0.0001955303241081358, "loss": 3.6561, "step": 3820 }, { "epoch": 0.28, "grad_norm": 6.976244926452637, "learning_rate": 0.00019549414314462644, "loss": 3.3276, "step": 3830 }, { "epoch": 0.28, "grad_norm": 6.545201301574707, "learning_rate": 0.00019545781970748395, "loss": 3.6572, "step": 3840 }, { "epoch": 0.28, "grad_norm": 2.9633677005767822, "learning_rate": 0.00019542135385090155, "loss": 3.0714, "step": 3850 }, { "epoch": 0.29, "grad_norm": 8.194368362426758, "learning_rate": 0.00019538474562928485, "loss": 3.3449, "step": 3860 }, { "epoch": 0.29, "grad_norm": 8.38609790802002, "learning_rate": 0.00019534799509725198, "loss": 3.1067, "step": 3870 }, { "epoch": 0.29, "grad_norm": 7.127841472625732, "learning_rate": 0.00019531110230963327, "loss": 3.4038, "step": 3880 }, { "epoch": 0.29, "grad_norm": 6.696997165679932, "learning_rate": 0.00019527406732147145, "loss": 3.286, "step": 3890 }, { "epoch": 0.29, "grad_norm": 6.132751941680908, "learning_rate": 0.00019523689018802125, "loss": 3.4134, "step": 3900 }, { "epoch": 0.29, "grad_norm": 4.486321449279785, "learning_rate": 0.00019519957096474956, "loss": 3.6381, "step": 3910 }, { "epoch": 0.29, "grad_norm": 5.290067195892334, "learning_rate": 0.00019516210970733526, "loss": 3.661, "step": 3920 }, { "epoch": 0.29, "grad_norm": 8.747777938842773, "learning_rate": 0.0001951245064716691, "loss": 3.4642, "step": 3930 }, { "epoch": 0.29, "grad_norm": 7.958836555480957, "learning_rate": 0.00019508676131385367, "loss": 3.0258, "step": 3940 }, { "epoch": 0.29, "grad_norm": 6.06564998626709, "learning_rate": 0.00019504887429020335, "loss": 3.666, "step": 3950 }, { "epoch": 0.29, "grad_norm": 5.823673248291016, "learning_rate": 0.0001950108454572441, "loss": 2.9987, "step": 3960 }, { "epoch": 0.29, "grad_norm": 9.578413009643555, "learning_rate": 0.00019497267487171352, "loss": 3.2817, "step": 3970 }, { "epoch": 0.29, "grad_norm": 6.610091686248779, "learning_rate": 0.00019493436259056067, "loss": 3.1193, "step": 3980 }, { "epoch": 0.29, "grad_norm": 6.841573238372803, "learning_rate": 0.000194895908670946, "loss": 3.2473, "step": 3990 }, { "epoch": 0.3, "grad_norm": 7.869802474975586, "learning_rate": 0.0001948573131702413, "loss": 3.2627, "step": 4000 }, { "epoch": 0.3, "eval_loss": 3.2718520164489746, "eval_runtime": 1137.1006, "eval_samples_per_second": 5.013, "eval_steps_per_second": 5.013, "step": 4000 }, { "epoch": 0.3, "grad_norm": 5.743564605712891, "learning_rate": 0.0001948185761460296, "loss": 3.4821, "step": 4010 }, { "epoch": 0.3, "grad_norm": 5.584972858428955, "learning_rate": 0.00019477969765610507, "loss": 3.0976, "step": 4020 }, { "epoch": 0.3, "grad_norm": 6.404329299926758, "learning_rate": 0.00019474067775847296, "loss": 3.165, "step": 4030 }, { "epoch": 0.3, "grad_norm": 4.988752841949463, "learning_rate": 0.0001947015165113494, "loss": 3.5626, "step": 4040 }, { "epoch": 0.3, "grad_norm": 7.516745090484619, "learning_rate": 0.00019466221397316158, "loss": 3.2796, "step": 4050 }, { "epoch": 0.3, "grad_norm": 5.895244121551514, "learning_rate": 0.00019462277020254734, "loss": 3.2945, "step": 4060 }, { "epoch": 0.3, "grad_norm": 6.884443283081055, "learning_rate": 0.00019458318525835525, "loss": 3.449, "step": 4070 }, { "epoch": 0.3, "grad_norm": 6.1220245361328125, "learning_rate": 0.00019454345919964463, "loss": 3.4166, "step": 4080 }, { "epoch": 0.3, "grad_norm": 6.293818950653076, "learning_rate": 0.0001945035920856852, "loss": 3.2527, "step": 4090 }, { "epoch": 0.3, "grad_norm": 7.266450881958008, "learning_rate": 0.0001944635839759572, "loss": 2.9923, "step": 4100 }, { "epoch": 0.3, "grad_norm": 12.944222450256348, "learning_rate": 0.00019442343493015116, "loss": 3.5396, "step": 4110 }, { "epoch": 0.3, "grad_norm": 6.282738208770752, "learning_rate": 0.000194383145008168, "loss": 3.4869, "step": 4120 }, { "epoch": 0.31, "grad_norm": 5.127700328826904, "learning_rate": 0.00019434271427011868, "loss": 3.0043, "step": 4130 }, { "epoch": 0.31, "grad_norm": 5.7289838790893555, "learning_rate": 0.00019430214277632438, "loss": 3.269, "step": 4140 }, { "epoch": 0.31, "grad_norm": 7.922645092010498, "learning_rate": 0.00019426143058731623, "loss": 3.1655, "step": 4150 }, { "epoch": 0.31, "grad_norm": 6.550185680389404, "learning_rate": 0.00019422057776383525, "loss": 3.2869, "step": 4160 }, { "epoch": 0.31, "grad_norm": 4.6260480880737305, "learning_rate": 0.00019417958436683227, "loss": 3.2263, "step": 4170 }, { "epoch": 0.31, "grad_norm": 8.116255760192871, "learning_rate": 0.00019413845045746796, "loss": 3.2272, "step": 4180 }, { "epoch": 0.31, "grad_norm": 9.626754760742188, "learning_rate": 0.00019409717609711246, "loss": 3.2186, "step": 4190 }, { "epoch": 0.31, "grad_norm": 6.456797122955322, "learning_rate": 0.00019405576134734563, "loss": 3.4864, "step": 4200 }, { "epoch": 0.31, "eval_loss": 3.2689456939697266, "eval_runtime": 1134.8632, "eval_samples_per_second": 5.023, "eval_steps_per_second": 5.023, "step": 4200 }, { "epoch": 0.31, "grad_norm": 7.205773830413818, "learning_rate": 0.0001940142062699566, "loss": 2.9953, "step": 4210 }, { "epoch": 0.31, "grad_norm": 5.470200538635254, "learning_rate": 0.00019397251092694408, "loss": 3.1267, "step": 4220 }, { "epoch": 0.31, "grad_norm": 6.280062198638916, "learning_rate": 0.00019393067538051587, "loss": 3.1818, "step": 4230 }, { "epoch": 0.31, "grad_norm": 5.139229774475098, "learning_rate": 0.00019388869969308903, "loss": 3.214, "step": 4240 }, { "epoch": 0.31, "grad_norm": 4.247889041900635, "learning_rate": 0.0001938465839272897, "loss": 2.9846, "step": 4250 }, { "epoch": 0.31, "grad_norm": 8.27074146270752, "learning_rate": 0.00019380432814595299, "loss": 3.2215, "step": 4260 }, { "epoch": 0.32, "grad_norm": 5.101616859436035, "learning_rate": 0.00019376193241212294, "loss": 3.532, "step": 4270 }, { "epoch": 0.32, "grad_norm": 4.839563369750977, "learning_rate": 0.00019371939678905232, "loss": 3.0666, "step": 4280 }, { "epoch": 0.32, "grad_norm": 5.436496257781982, "learning_rate": 0.0001936767213402027, "loss": 3.2893, "step": 4290 }, { "epoch": 0.32, "grad_norm": 3.8287880420684814, "learning_rate": 0.00019363390612924425, "loss": 3.1401, "step": 4300 }, { "epoch": 0.32, "grad_norm": 6.251564025878906, "learning_rate": 0.00019359095122005563, "loss": 3.3396, "step": 4310 }, { "epoch": 0.32, "grad_norm": 5.008293151855469, "learning_rate": 0.00019354785667672394, "loss": 3.6161, "step": 4320 }, { "epoch": 0.32, "grad_norm": 5.853148937225342, "learning_rate": 0.00019350462256354452, "loss": 3.4238, "step": 4330 }, { "epoch": 0.32, "grad_norm": 10.029765129089355, "learning_rate": 0.00019346124894502114, "loss": 2.9422, "step": 4340 }, { "epoch": 0.32, "grad_norm": 8.551016807556152, "learning_rate": 0.0001934177358858655, "loss": 3.0181, "step": 4350 }, { "epoch": 0.32, "grad_norm": 8.455645561218262, "learning_rate": 0.00019337845496453685, "loss": 3.554, "step": 4360 }, { "epoch": 0.32, "grad_norm": 6.219696044921875, "learning_rate": 0.00019333467714720599, "loss": 3.2154, "step": 4370 }, { "epoch": 0.32, "grad_norm": 5.962626934051514, "learning_rate": 0.00019329076007808325, "loss": 3.2577, "step": 4380 }, { "epoch": 0.32, "grad_norm": 4.884113311767578, "learning_rate": 0.00019324670382269115, "loss": 3.4911, "step": 4390 }, { "epoch": 0.33, "grad_norm": 9.073639869689941, "learning_rate": 0.00019320250844676005, "loss": 3.2337, "step": 4400 }, { "epoch": 0.33, "eval_loss": 3.2600619792938232, "eval_runtime": 1136.7951, "eval_samples_per_second": 5.014, "eval_steps_per_second": 5.014, "step": 4400 }, { "epoch": 0.33, "grad_norm": 6.009994983673096, "learning_rate": 0.0001931581740162277, "loss": 3.1117, "step": 4410 }, { "epoch": 0.33, "grad_norm": 5.953939914703369, "learning_rate": 0.0001931137005972394, "loss": 3.5592, "step": 4420 }, { "epoch": 0.33, "grad_norm": 6.099554061889648, "learning_rate": 0.0001930690882561478, "loss": 3.024, "step": 4430 }, { "epoch": 0.33, "grad_norm": 6.600510120391846, "learning_rate": 0.00019302433705951284, "loss": 3.3492, "step": 4440 }, { "epoch": 0.33, "grad_norm": 7.4830322265625, "learning_rate": 0.00019297944707410159, "loss": 3.1173, "step": 4450 }, { "epoch": 0.33, "grad_norm": 7.494085311889648, "learning_rate": 0.00019293441836688816, "loss": 3.3076, "step": 4460 }, { "epoch": 0.33, "grad_norm": 6.360881805419922, "learning_rate": 0.00019288925100505375, "loss": 3.3496, "step": 4470 }, { "epoch": 0.33, "grad_norm": 5.511220932006836, "learning_rate": 0.0001928439450559863, "loss": 3.321, "step": 4480 }, { "epoch": 0.33, "grad_norm": 5.7247514724731445, "learning_rate": 0.00019279850058728058, "loss": 3.3129, "step": 4490 }, { "epoch": 0.33, "grad_norm": 7.3512349128723145, "learning_rate": 0.000192752917666738, "loss": 3.3597, "step": 4500 }, { "epoch": 0.33, "grad_norm": 7.68686056137085, "learning_rate": 0.00019270719636236655, "loss": 3.1758, "step": 4510 }, { "epoch": 0.33, "grad_norm": 6.120543956756592, "learning_rate": 0.00019266133674238067, "loss": 3.3944, "step": 4520 }, { "epoch": 0.33, "grad_norm": 3.884521007537842, "learning_rate": 0.0001926153388752012, "loss": 3.0115, "step": 4530 }, { "epoch": 0.34, "grad_norm": 5.13805627822876, "learning_rate": 0.00019256920282945516, "loss": 3.5171, "step": 4540 }, { "epoch": 0.34, "grad_norm": 4.273939609527588, "learning_rate": 0.00019252292867397584, "loss": 3.2311, "step": 4550 }, { "epoch": 0.34, "grad_norm": 4.657829284667969, "learning_rate": 0.00019247651647780244, "loss": 2.8801, "step": 4560 }, { "epoch": 0.34, "grad_norm": 7.604819297790527, "learning_rate": 0.0001924299663101803, "loss": 3.0956, "step": 4570 }, { "epoch": 0.34, "grad_norm": 5.1106390953063965, "learning_rate": 0.00019238327824056038, "loss": 2.8648, "step": 4580 }, { "epoch": 0.34, "grad_norm": 5.146661758422852, "learning_rate": 0.00019233645233859964, "loss": 3.1102, "step": 4590 }, { "epoch": 0.34, "grad_norm": 5.23886251449585, "learning_rate": 0.0001922894886741604, "loss": 2.9659, "step": 4600 }, { "epoch": 0.34, "eval_loss": 3.243014097213745, "eval_runtime": 1137.1324, "eval_samples_per_second": 5.013, "eval_steps_per_second": 5.013, "step": 4600 }, { "epoch": 0.34, "grad_norm": 7.990192890167236, "learning_rate": 0.00019224238731731079, "loss": 3.1794, "step": 4610 }, { "epoch": 0.34, "grad_norm": 6.751334190368652, "learning_rate": 0.0001921951483383242, "loss": 3.2815, "step": 4620 }, { "epoch": 0.34, "grad_norm": 6.687454700469971, "learning_rate": 0.00019214777180767936, "loss": 3.1559, "step": 4630 }, { "epoch": 0.34, "grad_norm": 4.849421977996826, "learning_rate": 0.00019210025779606028, "loss": 3.0585, "step": 4640 }, { "epoch": 0.34, "grad_norm": 7.930562496185303, "learning_rate": 0.00019205260637435604, "loss": 2.8349, "step": 4650 }, { "epoch": 0.34, "grad_norm": 7.275119781494141, "learning_rate": 0.00019200481761366082, "loss": 3.2115, "step": 4660 }, { "epoch": 0.34, "grad_norm": 5.657308578491211, "learning_rate": 0.00019195689158527354, "loss": 2.9877, "step": 4670 }, { "epoch": 0.35, "grad_norm": 7.506052017211914, "learning_rate": 0.00019190882836069806, "loss": 3.3649, "step": 4680 }, { "epoch": 0.35, "grad_norm": 6.52008581161499, "learning_rate": 0.00019186062801164288, "loss": 3.308, "step": 4690 }, { "epoch": 0.35, "grad_norm": 6.489314556121826, "learning_rate": 0.00019181229061002113, "loss": 3.2823, "step": 4700 }, { "epoch": 0.35, "grad_norm": 6.584408760070801, "learning_rate": 0.0001917638162279503, "loss": 3.2338, "step": 4710 }, { "epoch": 0.35, "grad_norm": 7.005248069763184, "learning_rate": 0.00019171520493775236, "loss": 3.1882, "step": 4720 }, { "epoch": 0.35, "grad_norm": 6.1764397621154785, "learning_rate": 0.00019166645681195353, "loss": 3.3283, "step": 4730 }, { "epoch": 0.35, "grad_norm": 7.389091491699219, "learning_rate": 0.00019161757192328414, "loss": 3.1865, "step": 4740 }, { "epoch": 0.35, "grad_norm": 6.51524019241333, "learning_rate": 0.0001915685503446786, "loss": 3.2328, "step": 4750 }, { "epoch": 0.35, "grad_norm": 9.388795852661133, "learning_rate": 0.0001915193921492752, "loss": 3.567, "step": 4760 }, { "epoch": 0.35, "grad_norm": 8.696200370788574, "learning_rate": 0.00019147009741041617, "loss": 3.1716, "step": 4770 }, { "epoch": 0.35, "grad_norm": 6.319981575012207, "learning_rate": 0.00019142066620164735, "loss": 3.367, "step": 4780 }, { "epoch": 0.35, "grad_norm": 6.704361438751221, "learning_rate": 0.0001913710985967182, "loss": 3.1016, "step": 4790 }, { "epoch": 0.35, "grad_norm": 7.778378486633301, "learning_rate": 0.00019132139466958173, "loss": 3.1036, "step": 4800 }, { "epoch": 0.35, "eval_loss": 3.2003843784332275, "eval_runtime": 1138.607, "eval_samples_per_second": 5.006, "eval_steps_per_second": 5.006, "step": 4800 }, { "epoch": 0.36, "grad_norm": 5.96036958694458, "learning_rate": 0.00019127155449439432, "loss": 3.1986, "step": 4810 }, { "epoch": 0.36, "grad_norm": 4.976071834564209, "learning_rate": 0.0001912215781455156, "loss": 3.1981, "step": 4820 }, { "epoch": 0.36, "grad_norm": 3.7487850189208984, "learning_rate": 0.00019117146569750838, "loss": 3.1252, "step": 4830 }, { "epoch": 0.36, "grad_norm": 6.183620929718018, "learning_rate": 0.00019112121722513855, "loss": 3.0109, "step": 4840 }, { "epoch": 0.36, "grad_norm": 6.189425468444824, "learning_rate": 0.0001910708328033749, "loss": 3.2106, "step": 4850 }, { "epoch": 0.36, "grad_norm": 8.113247871398926, "learning_rate": 0.0001910203125073891, "loss": 3.1525, "step": 4860 }, { "epoch": 0.36, "grad_norm": 6.9849653244018555, "learning_rate": 0.00019096965641255548, "loss": 3.5768, "step": 4870 }, { "epoch": 0.36, "grad_norm": 6.2269978523254395, "learning_rate": 0.00019091886459445104, "loss": 3.09, "step": 4880 }, { "epoch": 0.36, "grad_norm": 4.787795543670654, "learning_rate": 0.0001908679371288552, "loss": 3.3626, "step": 4890 }, { "epoch": 0.36, "grad_norm": 4.196493625640869, "learning_rate": 0.00019081687409174984, "loss": 3.0434, "step": 4900 }, { "epoch": 0.36, "grad_norm": 6.388833999633789, "learning_rate": 0.00019076567555931906, "loss": 3.3835, "step": 4910 }, { "epoch": 0.36, "grad_norm": 8.204059600830078, "learning_rate": 0.00019071434160794915, "loss": 3.4197, "step": 4920 }, { "epoch": 0.36, "grad_norm": 8.208364486694336, "learning_rate": 0.00019066287231422834, "loss": 3.4219, "step": 4930 }, { "epoch": 0.36, "grad_norm": 6.949147701263428, "learning_rate": 0.00019061126775494697, "loss": 3.1267, "step": 4940 }, { "epoch": 0.37, "grad_norm": 8.652156829833984, "learning_rate": 0.000190559528007097, "loss": 3.4893, "step": 4950 }, { "epoch": 0.37, "grad_norm": 5.506767749786377, "learning_rate": 0.00019050765314787218, "loss": 3.0858, "step": 4960 }, { "epoch": 0.37, "grad_norm": 7.854613780975342, "learning_rate": 0.00019045564325466784, "loss": 3.2453, "step": 4970 }, { "epoch": 0.37, "grad_norm": 4.6655073165893555, "learning_rate": 0.00019040349840508076, "loss": 3.1197, "step": 4980 }, { "epoch": 0.37, "grad_norm": 6.948372840881348, "learning_rate": 0.00019035121867690908, "loss": 3.2466, "step": 4990 }, { "epoch": 0.37, "grad_norm": 8.339057922363281, "learning_rate": 0.0001902988041481522, "loss": 3.3991, "step": 5000 }, { "epoch": 0.37, "eval_loss": 3.216885566711426, "eval_runtime": 1136.0117, "eval_samples_per_second": 5.018, "eval_steps_per_second": 5.018, "step": 5000 }, { "epoch": 0.37, "grad_norm": 6.042678356170654, "learning_rate": 0.00019024625489701054, "loss": 3.3492, "step": 5010 }, { "epoch": 0.37, "grad_norm": 4.894794464111328, "learning_rate": 0.00019019357100188563, "loss": 3.0045, "step": 5020 }, { "epoch": 0.37, "grad_norm": 4.939303398132324, "learning_rate": 0.0001901407525413798, "loss": 3.1535, "step": 5030 }, { "epoch": 0.37, "grad_norm": 8.999835014343262, "learning_rate": 0.00019008779959429624, "loss": 3.3011, "step": 5040 }, { "epoch": 0.37, "grad_norm": 5.480611801147461, "learning_rate": 0.0001900347122396387, "loss": 3.0302, "step": 5050 }, { "epoch": 0.37, "grad_norm": 4.675875186920166, "learning_rate": 0.0001899814905566115, "loss": 2.8846, "step": 5060 }, { "epoch": 0.37, "grad_norm": 6.680566787719727, "learning_rate": 0.00018992813462461938, "loss": 3.672, "step": 5070 }, { "epoch": 0.38, "grad_norm": 3.9609920978546143, "learning_rate": 0.00018987464452326736, "loss": 2.8783, "step": 5080 }, { "epoch": 0.38, "grad_norm": 8.886730194091797, "learning_rate": 0.00018982102033236062, "loss": 3.3141, "step": 5090 }, { "epoch": 0.38, "grad_norm": 5.5499186515808105, "learning_rate": 0.00018976726213190445, "loss": 3.4179, "step": 5100 }, { "epoch": 0.38, "grad_norm": 4.3828654289245605, "learning_rate": 0.000189713370002104, "loss": 3.4815, "step": 5110 }, { "epoch": 0.38, "grad_norm": 10.297881126403809, "learning_rate": 0.00018965934402336433, "loss": 3.3344, "step": 5120 }, { "epoch": 0.38, "grad_norm": 9.131120681762695, "learning_rate": 0.00018960518427629013, "loss": 3.0974, "step": 5130 }, { "epoch": 0.38, "grad_norm": 8.753045082092285, "learning_rate": 0.00018955089084168566, "loss": 3.3982, "step": 5140 }, { "epoch": 0.38, "grad_norm": 7.8969316482543945, "learning_rate": 0.00018949646380055465, "loss": 3.0704, "step": 5150 }, { "epoch": 0.38, "grad_norm": 9.234929084777832, "learning_rate": 0.00018944190323410024, "loss": 3.2858, "step": 5160 }, { "epoch": 0.38, "grad_norm": 7.354836940765381, "learning_rate": 0.00018938720922372467, "loss": 3.1516, "step": 5170 }, { "epoch": 0.38, "grad_norm": 4.409235000610352, "learning_rate": 0.00018933238185102935, "loss": 2.9736, "step": 5180 }, { "epoch": 0.38, "grad_norm": 7.718225479125977, "learning_rate": 0.0001892774211978146, "loss": 3.3702, "step": 5190 }, { "epoch": 0.38, "grad_norm": 7.247618198394775, "learning_rate": 0.00018922232734607967, "loss": 3.2514, "step": 5200 }, { "epoch": 0.38, "eval_loss": 3.20190167427063, "eval_runtime": 1137.1433, "eval_samples_per_second": 5.013, "eval_steps_per_second": 5.013, "step": 5200 }, { "epoch": 0.38, "grad_norm": 6.2430644035339355, "learning_rate": 0.00018916710037802253, "loss": 3.244, "step": 5210 }, { "epoch": 0.39, "grad_norm": 6.088860034942627, "learning_rate": 0.00018911174037603958, "loss": 3.309, "step": 5220 }, { "epoch": 0.39, "grad_norm": 6.1977739334106445, "learning_rate": 0.000189056247422726, "loss": 3.1773, "step": 5230 }, { "epoch": 0.39, "grad_norm": 7.018752574920654, "learning_rate": 0.00018900062160087503, "loss": 3.1125, "step": 5240 }, { "epoch": 0.39, "grad_norm": 11.884779930114746, "learning_rate": 0.00018894486299347838, "loss": 3.1848, "step": 5250 }, { "epoch": 0.39, "grad_norm": 5.222365379333496, "learning_rate": 0.00018888897168372573, "loss": 3.2378, "step": 5260 }, { "epoch": 0.39, "grad_norm": 7.695111274719238, "learning_rate": 0.00018883294775500482, "loss": 3.2287, "step": 5270 }, { "epoch": 0.39, "grad_norm": 5.415168285369873, "learning_rate": 0.00018877679129090117, "loss": 3.254, "step": 5280 }, { "epoch": 0.39, "grad_norm": 7.421213150024414, "learning_rate": 0.00018872050237519816, "loss": 3.3848, "step": 5290 }, { "epoch": 0.39, "grad_norm": 7.068855285644531, "learning_rate": 0.00018866408109187663, "loss": 3.4544, "step": 5300 }, { "epoch": 0.39, "grad_norm": 5.558896541595459, "learning_rate": 0.00018860752752511507, "loss": 3.4343, "step": 5310 }, { "epoch": 0.39, "grad_norm": 5.823142051696777, "learning_rate": 0.00018855084175928923, "loss": 3.1807, "step": 5320 }, { "epoch": 0.39, "grad_norm": 7.187647342681885, "learning_rate": 0.00018849402387897208, "loss": 2.9435, "step": 5330 }, { "epoch": 0.39, "grad_norm": 9.714073181152344, "learning_rate": 0.0001884370739689338, "loss": 3.4785, "step": 5340 }, { "epoch": 0.4, "grad_norm": 5.349802017211914, "learning_rate": 0.00018837999211414146, "loss": 3.0782, "step": 5350 }, { "epoch": 0.4, "grad_norm": 6.526556968688965, "learning_rate": 0.00018832277839975897, "loss": 3.2347, "step": 5360 }, { "epoch": 0.4, "grad_norm": 5.845700263977051, "learning_rate": 0.0001882654329111471, "loss": 3.0192, "step": 5370 }, { "epoch": 0.4, "grad_norm": 5.289205074310303, "learning_rate": 0.0001882079557338631, "loss": 3.3813, "step": 5380 }, { "epoch": 0.4, "grad_norm": 3.3808743953704834, "learning_rate": 0.00018815034695366075, "loss": 3.319, "step": 5390 }, { "epoch": 0.4, "grad_norm": 4.758996963500977, "learning_rate": 0.00018809260665649015, "loss": 3.3189, "step": 5400 }, { "epoch": 0.4, "eval_loss": 3.1736836433410645, "eval_runtime": 1136.1695, "eval_samples_per_second": 5.017, "eval_steps_per_second": 5.017, "step": 5400 }, { "epoch": 0.4, "grad_norm": 4.7935309410095215, "learning_rate": 0.00018803473492849763, "loss": 3.1906, "step": 5410 }, { "epoch": 0.4, "grad_norm": 6.932259559631348, "learning_rate": 0.00018797673185602562, "loss": 2.996, "step": 5420 }, { "epoch": 0.4, "grad_norm": 6.560030937194824, "learning_rate": 0.00018791859752561248, "loss": 2.9432, "step": 5430 }, { "epoch": 0.4, "grad_norm": 9.305426597595215, "learning_rate": 0.00018786033202399243, "loss": 3.2491, "step": 5440 }, { "epoch": 0.4, "grad_norm": 7.172638893127441, "learning_rate": 0.0001878019354380954, "loss": 3.1311, "step": 5450 }, { "epoch": 0.4, "grad_norm": 7.696325778961182, "learning_rate": 0.00018774340785504684, "loss": 3.1054, "step": 5460 }, { "epoch": 0.4, "grad_norm": 7.473097801208496, "learning_rate": 0.00018768474936216772, "loss": 3.2003, "step": 5470 }, { "epoch": 0.4, "grad_norm": 8.726866722106934, "learning_rate": 0.00018762596004697426, "loss": 3.2119, "step": 5480 }, { "epoch": 0.41, "grad_norm": 9.802130699157715, "learning_rate": 0.0001875670399971779, "loss": 2.9675, "step": 5490 }, { "epoch": 0.41, "grad_norm": 7.459918975830078, "learning_rate": 0.0001875079893006851, "loss": 3.2299, "step": 5500 }, { "epoch": 0.41, "grad_norm": 6.798010349273682, "learning_rate": 0.00018744880804559728, "loss": 3.1507, "step": 5510 }, { "epoch": 0.41, "grad_norm": 8.681066513061523, "learning_rate": 0.0001873894963202106, "loss": 3.1474, "step": 5520 }, { "epoch": 0.41, "grad_norm": 7.05427885055542, "learning_rate": 0.0001873300542130159, "loss": 3.1704, "step": 5530 }, { "epoch": 0.41, "grad_norm": 8.765000343322754, "learning_rate": 0.00018727048181269856, "loss": 3.0459, "step": 5540 }, { "epoch": 0.41, "grad_norm": 6.171086311340332, "learning_rate": 0.00018721077920813833, "loss": 3.4174, "step": 5550 }, { "epoch": 0.41, "grad_norm": 11.81342887878418, "learning_rate": 0.0001871509464884092, "loss": 3.0682, "step": 5560 }, { "epoch": 0.41, "grad_norm": 4.2086286544799805, "learning_rate": 0.00018709098374277937, "loss": 2.9207, "step": 5570 }, { "epoch": 0.41, "grad_norm": 8.466970443725586, "learning_rate": 0.00018703089106071095, "loss": 3.4195, "step": 5580 }, { "epoch": 0.41, "grad_norm": 3.9653847217559814, "learning_rate": 0.00018697066853185995, "loss": 3.3978, "step": 5590 }, { "epoch": 0.41, "grad_norm": 6.923947334289551, "learning_rate": 0.00018691031624607605, "loss": 3.4599, "step": 5600 }, { "epoch": 0.41, "eval_loss": 3.163978099822998, "eval_runtime": 1137.4991, "eval_samples_per_second": 5.011, "eval_steps_per_second": 5.011, "step": 5600 }, { "epoch": 0.41, "grad_norm": 4.512587547302246, "learning_rate": 0.00018684983429340265, "loss": 2.9866, "step": 5610 }, { "epoch": 0.42, "grad_norm": 6.818958759307861, "learning_rate": 0.00018678922276407642, "loss": 3.2473, "step": 5620 }, { "epoch": 0.42, "grad_norm": 6.915249347686768, "learning_rate": 0.00018672848174852756, "loss": 3.2113, "step": 5630 }, { "epoch": 0.42, "grad_norm": 5.651949882507324, "learning_rate": 0.00018666761133737927, "loss": 3.0937, "step": 5640 }, { "epoch": 0.42, "grad_norm": 6.507778644561768, "learning_rate": 0.00018660661162144798, "loss": 2.9943, "step": 5650 }, { "epoch": 0.42, "grad_norm": 6.6092095375061035, "learning_rate": 0.00018654548269174287, "loss": 2.9204, "step": 5660 }, { "epoch": 0.42, "grad_norm": 6.253643035888672, "learning_rate": 0.00018648422463946602, "loss": 3.3986, "step": 5670 }, { "epoch": 0.42, "grad_norm": 6.839259624481201, "learning_rate": 0.0001864228375560121, "loss": 3.0319, "step": 5680 }, { "epoch": 0.42, "grad_norm": 6.3006181716918945, "learning_rate": 0.00018636132153296831, "loss": 2.9178, "step": 5690 }, { "epoch": 0.42, "grad_norm": 5.2430219650268555, "learning_rate": 0.00018629967666211427, "loss": 2.833, "step": 5700 }, { "epoch": 0.42, "grad_norm": 8.878287315368652, "learning_rate": 0.00018623790303542168, "loss": 3.3581, "step": 5710 }, { "epoch": 0.42, "grad_norm": 6.703078746795654, "learning_rate": 0.0001861760007450545, "loss": 3.2832, "step": 5720 }, { "epoch": 0.42, "grad_norm": 4.616283416748047, "learning_rate": 0.00018611396988336862, "loss": 3.211, "step": 5730 }, { "epoch": 0.42, "grad_norm": 5.617763996124268, "learning_rate": 0.0001860518105429117, "loss": 3.0924, "step": 5740 }, { "epoch": 0.42, "grad_norm": 5.632263660430908, "learning_rate": 0.00018598952281642314, "loss": 3.1122, "step": 5750 }, { "epoch": 0.43, "grad_norm": 5.472113132476807, "learning_rate": 0.00018592710679683384, "loss": 3.1495, "step": 5760 }, { "epoch": 0.43, "grad_norm": 4.280898094177246, "learning_rate": 0.0001858645625772661, "loss": 3.1842, "step": 5770 }, { "epoch": 0.43, "grad_norm": 6.199119567871094, "learning_rate": 0.00018580189025103357, "loss": 3.0955, "step": 5780 }, { "epoch": 0.43, "grad_norm": 5.373068809509277, "learning_rate": 0.00018573908991164096, "loss": 2.6837, "step": 5790 }, { "epoch": 0.43, "grad_norm": 2.7935683727264404, "learning_rate": 0.00018567616165278398, "loss": 3.1536, "step": 5800 }, { "epoch": 0.43, "eval_loss": 3.1541407108306885, "eval_runtime": 1137.3308, "eval_samples_per_second": 5.012, "eval_steps_per_second": 5.012, "step": 5800 }, { "epoch": 0.43, "grad_norm": 6.602904319763184, "learning_rate": 0.0001856131055683492, "loss": 3.1246, "step": 5810 }, { "epoch": 0.43, "grad_norm": 5.87777042388916, "learning_rate": 0.00018554992175241392, "loss": 3.2625, "step": 5820 }, { "epoch": 0.43, "grad_norm": 5.858922481536865, "learning_rate": 0.00018548661029924601, "loss": 3.3251, "step": 5830 }, { "epoch": 0.43, "grad_norm": 6.421278476715088, "learning_rate": 0.0001854231713033037, "loss": 2.9533, "step": 5840 }, { "epoch": 0.43, "grad_norm": 7.115844249725342, "learning_rate": 0.0001853596048592356, "loss": 3.3951, "step": 5850 }, { "epoch": 0.43, "grad_norm": 5.380497932434082, "learning_rate": 0.00018529591106188043, "loss": 3.1816, "step": 5860 }, { "epoch": 0.43, "grad_norm": 5.796582221984863, "learning_rate": 0.00018523209000626686, "loss": 2.9288, "step": 5870 }, { "epoch": 0.43, "grad_norm": 6.43263053894043, "learning_rate": 0.00018516814178761356, "loss": 3.1933, "step": 5880 }, { "epoch": 0.44, "grad_norm": 4.534740447998047, "learning_rate": 0.00018510406650132884, "loss": 2.7832, "step": 5890 }, { "epoch": 0.44, "grad_norm": 6.020338535308838, "learning_rate": 0.0001850398642430105, "loss": 3.2289, "step": 5900 }, { "epoch": 0.44, "grad_norm": 7.014430999755859, "learning_rate": 0.00018497553510844595, "loss": 3.4209, "step": 5910 }, { "epoch": 0.44, "grad_norm": 6.1231369972229, "learning_rate": 0.0001849110791936118, "loss": 3.0681, "step": 5920 }, { "epoch": 0.44, "grad_norm": 7.167814254760742, "learning_rate": 0.0001848464965946738, "loss": 3.1848, "step": 5930 }, { "epoch": 0.44, "grad_norm": 5.2950005531311035, "learning_rate": 0.00018478178740798676, "loss": 3.2838, "step": 5940 }, { "epoch": 0.44, "grad_norm": 4.44722843170166, "learning_rate": 0.0001847169517300943, "loss": 3.2951, "step": 5950 }, { "epoch": 0.44, "grad_norm": 5.411314964294434, "learning_rate": 0.00018465198965772887, "loss": 3.0394, "step": 5960 }, { "epoch": 0.44, "grad_norm": 5.1140923500061035, "learning_rate": 0.0001845869012878113, "loss": 3.0466, "step": 5970 }, { "epoch": 0.44, "grad_norm": 7.282729148864746, "learning_rate": 0.00018452168671745102, "loss": 3.2923, "step": 5980 }, { "epoch": 0.44, "grad_norm": 6.504138946533203, "learning_rate": 0.00018445634604394572, "loss": 3.1633, "step": 5990 }, { "epoch": 0.44, "grad_norm": 4.982309818267822, "learning_rate": 0.00018439087936478115, "loss": 3.3825, "step": 6000 }, { "epoch": 0.44, "eval_loss": 3.144286632537842, "eval_runtime": 1137.5221, "eval_samples_per_second": 5.011, "eval_steps_per_second": 5.011, "step": 6000 }, { "epoch": 0.44, "grad_norm": 9.198885917663574, "learning_rate": 0.0001843252867776311, "loss": 3.178, "step": 6010 }, { "epoch": 0.44, "grad_norm": 5.505146503448486, "learning_rate": 0.0001842595683803573, "loss": 2.9734, "step": 6020 }, { "epoch": 0.45, "grad_norm": 9.131953239440918, "learning_rate": 0.000184193724271009, "loss": 3.4452, "step": 6030 }, { "epoch": 0.45, "grad_norm": 3.000302314758301, "learning_rate": 0.0001841277545478232, "loss": 3.1034, "step": 6040 }, { "epoch": 0.45, "grad_norm": 8.891810417175293, "learning_rate": 0.00018406165930922414, "loss": 3.4236, "step": 6050 }, { "epoch": 0.45, "grad_norm": 4.17402982711792, "learning_rate": 0.00018399543865382345, "loss": 3.001, "step": 6060 }, { "epoch": 0.45, "grad_norm": 5.869381904602051, "learning_rate": 0.00018392909268041984, "loss": 2.9168, "step": 6070 }, { "epoch": 0.45, "grad_norm": 6.271331787109375, "learning_rate": 0.00018386262148799895, "loss": 3.2482, "step": 6080 }, { "epoch": 0.45, "grad_norm": 5.643693923950195, "learning_rate": 0.00018379602517573328, "loss": 2.9908, "step": 6090 }, { "epoch": 0.45, "grad_norm": 6.856283664703369, "learning_rate": 0.000183729303842982, "loss": 3.084, "step": 6100 }, { "epoch": 0.45, "grad_norm": 4.403018951416016, "learning_rate": 0.00018366245758929086, "loss": 2.9356, "step": 6110 }, { "epoch": 0.45, "grad_norm": 4.758050441741943, "learning_rate": 0.00018359548651439184, "loss": 3.3273, "step": 6120 }, { "epoch": 0.45, "grad_norm": 8.164340019226074, "learning_rate": 0.00018352839071820326, "loss": 3.0777, "step": 6130 }, { "epoch": 0.45, "grad_norm": 9.588719367980957, "learning_rate": 0.00018346117030082953, "loss": 3.051, "step": 6140 }, { "epoch": 0.45, "grad_norm": 7.1701273918151855, "learning_rate": 0.00018339382536256097, "loss": 3.0665, "step": 6150 }, { "epoch": 0.46, "grad_norm": 6.325179576873779, "learning_rate": 0.00018332635600387364, "loss": 3.3382, "step": 6160 }, { "epoch": 0.46, "grad_norm": 8.45527172088623, "learning_rate": 0.00018325876232542924, "loss": 3.0616, "step": 6170 }, { "epoch": 0.46, "grad_norm": 7.3909502029418945, "learning_rate": 0.00018319104442807502, "loss": 3.122, "step": 6180 }, { "epoch": 0.46, "grad_norm": 6.6926374435424805, "learning_rate": 0.00018312320241284347, "loss": 3.271, "step": 6190 }, { "epoch": 0.46, "grad_norm": 6.650495529174805, "learning_rate": 0.00018305523638095233, "loss": 3.401, "step": 6200 }, { "epoch": 0.46, "eval_loss": 3.1480228900909424, "eval_runtime": 1136.9357, "eval_samples_per_second": 5.013, "eval_steps_per_second": 5.013, "step": 6200 }, { "epoch": 0.46, "grad_norm": 5.135234832763672, "learning_rate": 0.0001829871464338043, "loss": 3.1063, "step": 6210 }, { "epoch": 0.46, "grad_norm": 6.894030570983887, "learning_rate": 0.000182918932672987, "loss": 3.3267, "step": 6220 }, { "epoch": 0.46, "grad_norm": 10.895586967468262, "learning_rate": 0.0001828505952002728, "loss": 3.2664, "step": 6230 }, { "epoch": 0.46, "grad_norm": 7.774397373199463, "learning_rate": 0.0001827821341176186, "loss": 3.0503, "step": 6240 }, { "epoch": 0.46, "grad_norm": 5.991896152496338, "learning_rate": 0.00018271354952716573, "loss": 2.8635, "step": 6250 }, { "epoch": 0.46, "grad_norm": 10.050676345825195, "learning_rate": 0.0001826448415312398, "loss": 3.0997, "step": 6260 }, { "epoch": 0.46, "grad_norm": 4.294887542724609, "learning_rate": 0.00018257601023235052, "loss": 3.1495, "step": 6270 }, { "epoch": 0.46, "grad_norm": 4.689005374908447, "learning_rate": 0.00018250705573319155, "loss": 2.9893, "step": 6280 }, { "epoch": 0.46, "grad_norm": 4.834038257598877, "learning_rate": 0.00018243797813664042, "loss": 2.8042, "step": 6290 }, { "epoch": 0.47, "grad_norm": 6.34830904006958, "learning_rate": 0.00018236877754575827, "loss": 3.1042, "step": 6300 }, { "epoch": 0.47, "grad_norm": 4.145033836364746, "learning_rate": 0.00018229945406378977, "loss": 3.1158, "step": 6310 }, { "epoch": 0.47, "grad_norm": 6.606880187988281, "learning_rate": 0.00018223000779416285, "loss": 3.1161, "step": 6320 }, { "epoch": 0.47, "grad_norm": 8.302144050598145, "learning_rate": 0.0001821604388404888, "loss": 2.8363, "step": 6330 }, { "epoch": 0.47, "grad_norm": 5.119319915771484, "learning_rate": 0.0001820907473065618, "loss": 3.0148, "step": 6340 }, { "epoch": 0.47, "grad_norm": 7.135417461395264, "learning_rate": 0.00018202093329635897, "loss": 3.1195, "step": 6350 }, { "epoch": 0.47, "grad_norm": 5.360604286193848, "learning_rate": 0.00018195099691404017, "loss": 2.9308, "step": 6360 }, { "epoch": 0.47, "grad_norm": 11.024898529052734, "learning_rate": 0.0001818809382639479, "loss": 3.3839, "step": 6370 }, { "epoch": 0.47, "grad_norm": 10.323607444763184, "learning_rate": 0.00018181075745060684, "loss": 3.4607, "step": 6380 }, { "epoch": 0.47, "grad_norm": 5.803746223449707, "learning_rate": 0.00018174045457872422, "loss": 3.2707, "step": 6390 }, { "epoch": 0.47, "grad_norm": 6.415554523468018, "learning_rate": 0.0001816700297531892, "loss": 3.2877, "step": 6400 }, { "epoch": 0.47, "eval_loss": 3.116978406906128, "eval_runtime": 1138.0492, "eval_samples_per_second": 5.009, "eval_steps_per_second": 5.009, "step": 6400 }, { "epoch": 0.47, "grad_norm": 9.01855182647705, "learning_rate": 0.000181599483079073, "loss": 3.1119, "step": 6410 }, { "epoch": 0.47, "grad_norm": 6.799642086029053, "learning_rate": 0.00018152881466162852, "loss": 3.0316, "step": 6420 }, { "epoch": 0.47, "grad_norm": 8.301816940307617, "learning_rate": 0.00018145802460629038, "loss": 3.1189, "step": 6430 }, { "epoch": 0.48, "grad_norm": 4.256124019622803, "learning_rate": 0.00018138711301867466, "loss": 3.0403, "step": 6440 }, { "epoch": 0.48, "grad_norm": 5.179169654846191, "learning_rate": 0.00018131608000457872, "loss": 3.2503, "step": 6450 }, { "epoch": 0.48, "grad_norm": 6.934343338012695, "learning_rate": 0.00018124492566998118, "loss": 3.0684, "step": 6460 }, { "epoch": 0.48, "grad_norm": 8.213187217712402, "learning_rate": 0.00018117365012104152, "loss": 3.1016, "step": 6470 }, { "epoch": 0.48, "grad_norm": 9.77891731262207, "learning_rate": 0.00018110225346410026, "loss": 3.1766, "step": 6480 }, { "epoch": 0.48, "grad_norm": 5.665271759033203, "learning_rate": 0.00018103073580567837, "loss": 2.8177, "step": 6490 }, { "epoch": 0.48, "grad_norm": 5.387053966522217, "learning_rate": 0.0001809590972524776, "loss": 3.0647, "step": 6500 }, { "epoch": 0.48, "grad_norm": 6.457382678985596, "learning_rate": 0.00018088733791137983, "loss": 3.1087, "step": 6510 }, { "epoch": 0.48, "grad_norm": 4.992802143096924, "learning_rate": 0.00018081545788944738, "loss": 3.3095, "step": 6520 }, { "epoch": 0.48, "grad_norm": 6.124748229980469, "learning_rate": 0.00018074345729392243, "loss": 3.2727, "step": 6530 }, { "epoch": 0.48, "grad_norm": 8.606759071350098, "learning_rate": 0.0001806713362322272, "loss": 2.7637, "step": 6540 }, { "epoch": 0.48, "grad_norm": 4.487072944641113, "learning_rate": 0.00018059909481196352, "loss": 3.0667, "step": 6550 }, { "epoch": 0.48, "grad_norm": 4.0933003425598145, "learning_rate": 0.00018052673314091291, "loss": 2.9759, "step": 6560 }, { "epoch": 0.49, "grad_norm": 7.057580947875977, "learning_rate": 0.00018045425132703615, "loss": 3.0746, "step": 6570 }, { "epoch": 0.49, "grad_norm": 7.039517879486084, "learning_rate": 0.0001803816494784734, "loss": 3.3283, "step": 6580 }, { "epoch": 0.49, "grad_norm": 6.682270050048828, "learning_rate": 0.00018030892770354385, "loss": 2.8775, "step": 6590 }, { "epoch": 0.49, "grad_norm": 5.233624458312988, "learning_rate": 0.00018023608611074564, "loss": 3.2119, "step": 6600 }, { "epoch": 0.49, "eval_loss": 3.1197338104248047, "eval_runtime": 1135.3428, "eval_samples_per_second": 5.021, "eval_steps_per_second": 5.021, "step": 6600 }, { "epoch": 0.49, "grad_norm": 7.95053768157959, "learning_rate": 0.00018016312480875565, "loss": 3.385, "step": 6610 }, { "epoch": 0.49, "grad_norm": 5.972837448120117, "learning_rate": 0.00018009004390642935, "loss": 3.1906, "step": 6620 }, { "epoch": 0.49, "grad_norm": 6.372288227081299, "learning_rate": 0.00018001684351280067, "loss": 3.2157, "step": 6630 }, { "epoch": 0.49, "grad_norm": 6.065051555633545, "learning_rate": 0.00017994352373708184, "loss": 3.2601, "step": 6640 }, { "epoch": 0.49, "grad_norm": 8.61384391784668, "learning_rate": 0.00017987008468866317, "loss": 3.3174, "step": 6650 }, { "epoch": 0.49, "grad_norm": 5.757634162902832, "learning_rate": 0.00017979652647711293, "loss": 3.2527, "step": 6660 }, { "epoch": 0.49, "grad_norm": 6.122255802154541, "learning_rate": 0.0001797228492121772, "loss": 3.2824, "step": 6670 }, { "epoch": 0.49, "grad_norm": 6.160879135131836, "learning_rate": 0.00017964905300377958, "loss": 3.3164, "step": 6680 }, { "epoch": 0.49, "grad_norm": 5.023545265197754, "learning_rate": 0.00017957513796202132, "loss": 2.7596, "step": 6690 }, { "epoch": 0.49, "grad_norm": 6.02267599105835, "learning_rate": 0.0001795011041971808, "loss": 2.9532, "step": 6700 }, { "epoch": 0.5, "grad_norm": 6.672699928283691, "learning_rate": 0.00017942695181971357, "loss": 2.9572, "step": 6710 }, { "epoch": 0.5, "grad_norm": 9.895316123962402, "learning_rate": 0.00017935268094025216, "loss": 2.9637, "step": 6720 }, { "epoch": 0.5, "grad_norm": 3.4045603275299072, "learning_rate": 0.00017927829166960592, "loss": 3.1477, "step": 6730 }, { "epoch": 0.5, "grad_norm": 5.545341491699219, "learning_rate": 0.00017920378411876082, "loss": 2.9996, "step": 6740 }, { "epoch": 0.5, "grad_norm": 6.233349323272705, "learning_rate": 0.00017912915839887926, "loss": 3.1531, "step": 6750 }, { "epoch": 0.5, "grad_norm": 5.089627265930176, "learning_rate": 0.00017905441462130002, "loss": 3.0789, "step": 6760 }, { "epoch": 0.5, "grad_norm": 4.95676851272583, "learning_rate": 0.00017897955289753796, "loss": 3.173, "step": 6770 }, { "epoch": 0.5, "grad_norm": 7.904139518737793, "learning_rate": 0.00017890457333928392, "loss": 3.3228, "step": 6780 }, { "epoch": 0.5, "grad_norm": 5.2170915603637695, "learning_rate": 0.00017882947605840456, "loss": 3.0489, "step": 6790 }, { "epoch": 0.5, "grad_norm": 7.633049011230469, "learning_rate": 0.00017875426116694215, "loss": 3.056, "step": 6800 }, { "epoch": 0.5, "eval_loss": 3.1002590656280518, "eval_runtime": 1137.3982, "eval_samples_per_second": 5.011, "eval_steps_per_second": 5.011, "step": 6800 }, { "epoch": 0.5, "grad_norm": 5.702763557434082, "learning_rate": 0.0001786789287771145, "loss": 2.8698, "step": 6810 }, { "epoch": 0.5, "grad_norm": 8.918027877807617, "learning_rate": 0.00017860347900131463, "loss": 2.9931, "step": 6820 }, { "epoch": 0.5, "grad_norm": 5.658896446228027, "learning_rate": 0.00017852791195211074, "loss": 2.8901, "step": 6830 }, { "epoch": 0.51, "grad_norm": 7.5781378746032715, "learning_rate": 0.000178452227742246, "loss": 3.4028, "step": 6840 }, { "epoch": 0.51, "grad_norm": 5.097570896148682, "learning_rate": 0.00017837642648463838, "loss": 3.1365, "step": 6850 }, { "epoch": 0.51, "grad_norm": 4.289078712463379, "learning_rate": 0.00017830050829238049, "loss": 3.1823, "step": 6860 }, { "epoch": 0.51, "grad_norm": 6.053905487060547, "learning_rate": 0.00017822447327873938, "loss": 2.8224, "step": 6870 }, { "epoch": 0.51, "grad_norm": 5.861936092376709, "learning_rate": 0.00017814832155715635, "loss": 2.7414, "step": 6880 }, { "epoch": 0.51, "grad_norm": 10.660014152526855, "learning_rate": 0.00017807205324124698, "loss": 3.1545, "step": 6890 }, { "epoch": 0.51, "grad_norm": 9.52756118774414, "learning_rate": 0.00017799566844480062, "loss": 3.1248, "step": 6900 }, { "epoch": 0.51, "grad_norm": 6.511455059051514, "learning_rate": 0.0001779191672817805, "loss": 3.1991, "step": 6910 }, { "epoch": 0.51, "grad_norm": 6.9415669441223145, "learning_rate": 0.00017784254986632345, "loss": 2.9941, "step": 6920 }, { "epoch": 0.51, "grad_norm": 4.175106048583984, "learning_rate": 0.00017776581631273974, "loss": 3.1579, "step": 6930 }, { "epoch": 0.51, "grad_norm": 5.956933498382568, "learning_rate": 0.00017768896673551294, "loss": 2.8536, "step": 6940 }, { "epoch": 0.51, "grad_norm": 6.128865718841553, "learning_rate": 0.00017761200124929966, "loss": 3.3484, "step": 6950 }, { "epoch": 0.51, "grad_norm": 7.494982719421387, "learning_rate": 0.0001775349199689295, "loss": 3.186, "step": 6960 }, { "epoch": 0.51, "grad_norm": 7.484640121459961, "learning_rate": 0.00017745772300940485, "loss": 3.1214, "step": 6970 }, { "epoch": 0.52, "grad_norm": 8.72867488861084, "learning_rate": 0.00017738041048590057, "loss": 2.9991, "step": 6980 }, { "epoch": 0.52, "grad_norm": 5.649702072143555, "learning_rate": 0.00017730298251376404, "loss": 3.0823, "step": 6990 }, { "epoch": 0.52, "grad_norm": 6.184506893157959, "learning_rate": 0.0001772254392085148, "loss": 3.0852, "step": 7000 }, { "epoch": 0.52, "eval_loss": 3.0923123359680176, "eval_runtime": 1136.1904, "eval_samples_per_second": 5.017, "eval_steps_per_second": 5.017, "step": 7000 }, { "epoch": 0.52, "grad_norm": 6.7169880867004395, "learning_rate": 0.0001771477806858446, "loss": 3.1608, "step": 7010 }, { "epoch": 0.52, "grad_norm": 5.178481578826904, "learning_rate": 0.00017707000706161695, "loss": 3.283, "step": 7020 }, { "epoch": 0.52, "grad_norm": 5.29659366607666, "learning_rate": 0.00017699211845186716, "loss": 3.2108, "step": 7030 }, { "epoch": 0.52, "grad_norm": 7.533651351928711, "learning_rate": 0.00017691411497280208, "loss": 3.2544, "step": 7040 }, { "epoch": 0.52, "grad_norm": 4.470998764038086, "learning_rate": 0.00017683599674079992, "loss": 3.1424, "step": 7050 }, { "epoch": 0.52, "grad_norm": 4.548938751220703, "learning_rate": 0.0001767577638724101, "loss": 3.189, "step": 7060 }, { "epoch": 0.52, "grad_norm": 5.8620405197143555, "learning_rate": 0.00017667941648435317, "loss": 3.0072, "step": 7070 }, { "epoch": 0.52, "grad_norm": 9.185796737670898, "learning_rate": 0.00017660095469352035, "loss": 3.1691, "step": 7080 }, { "epoch": 0.52, "grad_norm": 4.8303728103637695, "learning_rate": 0.0001765223786169737, "loss": 2.8953, "step": 7090 }, { "epoch": 0.52, "grad_norm": 6.9875078201293945, "learning_rate": 0.00017644368837194577, "loss": 2.9854, "step": 7100 }, { "epoch": 0.53, "grad_norm": 4.392673015594482, "learning_rate": 0.00017636488407583934, "loss": 3.1433, "step": 7110 }, { "epoch": 0.53, "grad_norm": 4.60288143157959, "learning_rate": 0.00017628596584622752, "loss": 2.9387, "step": 7120 }, { "epoch": 0.53, "grad_norm": 8.164209365844727, "learning_rate": 0.00017620693380085322, "loss": 3.1131, "step": 7130 }, { "epoch": 0.53, "grad_norm": 3.8639328479766846, "learning_rate": 0.00017612778805762931, "loss": 3.0315, "step": 7140 }, { "epoch": 0.53, "grad_norm": 9.054656028747559, "learning_rate": 0.0001760485287346382, "loss": 3.3817, "step": 7150 }, { "epoch": 0.53, "grad_norm": 5.484858512878418, "learning_rate": 0.00017596915595013176, "loss": 3.1232, "step": 7160 }, { "epoch": 0.53, "grad_norm": 10.846295356750488, "learning_rate": 0.00017588966982253124, "loss": 2.9237, "step": 7170 }, { "epoch": 0.53, "grad_norm": 8.18273639678955, "learning_rate": 0.0001758100704704269, "loss": 2.7913, "step": 7180 }, { "epoch": 0.53, "grad_norm": 6.365214824676514, "learning_rate": 0.00017573035801257794, "loss": 3.2157, "step": 7190 }, { "epoch": 0.53, "grad_norm": 4.8987627029418945, "learning_rate": 0.0001756505325679123, "loss": 2.9277, "step": 7200 }, { "epoch": 0.53, "eval_loss": 3.0856003761291504, "eval_runtime": 1138.1785, "eval_samples_per_second": 5.008, "eval_steps_per_second": 5.008, "step": 7200 }, { "epoch": 0.53, "grad_norm": 5.561722755432129, "learning_rate": 0.00017557059425552654, "loss": 2.6905, "step": 7210 }, { "epoch": 0.53, "grad_norm": 5.034555435180664, "learning_rate": 0.00017549054319468554, "loss": 3.087, "step": 7220 }, { "epoch": 0.53, "grad_norm": 6.637314796447754, "learning_rate": 0.00017541037950482248, "loss": 2.8424, "step": 7230 }, { "epoch": 0.53, "grad_norm": 5.636795997619629, "learning_rate": 0.00017533010330553857, "loss": 3.2438, "step": 7240 }, { "epoch": 0.54, "grad_norm": 7.967324256896973, "learning_rate": 0.00017524971471660276, "loss": 3.0933, "step": 7250 }, { "epoch": 0.54, "grad_norm": 4.078129291534424, "learning_rate": 0.00017516921385795183, "loss": 3.3142, "step": 7260 }, { "epoch": 0.54, "grad_norm": 6.510000705718994, "learning_rate": 0.00017508860084969004, "loss": 3.3133, "step": 7270 }, { "epoch": 0.54, "grad_norm": 5.694852352142334, "learning_rate": 0.00017500787581208884, "loss": 2.8118, "step": 7280 }, { "epoch": 0.54, "grad_norm": 6.753634929656982, "learning_rate": 0.00017492703886558698, "loss": 3.0533, "step": 7290 }, { "epoch": 0.54, "grad_norm": 6.030417442321777, "learning_rate": 0.0001748460901307901, "loss": 2.7696, "step": 7300 }, { "epoch": 0.54, "grad_norm": 6.480371475219727, "learning_rate": 0.00017476502972847065, "loss": 3.3933, "step": 7310 }, { "epoch": 0.54, "grad_norm": 6.749428749084473, "learning_rate": 0.0001746838577795676, "loss": 2.9271, "step": 7320 }, { "epoch": 0.54, "grad_norm": 6.193231582641602, "learning_rate": 0.00017460257440518655, "loss": 2.9716, "step": 7330 }, { "epoch": 0.54, "grad_norm": 6.23006010055542, "learning_rate": 0.00017452117972659907, "loss": 2.846, "step": 7340 }, { "epoch": 0.54, "grad_norm": 9.593443870544434, "learning_rate": 0.000174439673865243, "loss": 3.2238, "step": 7350 }, { "epoch": 0.54, "grad_norm": 7.841164588928223, "learning_rate": 0.00017435805694272197, "loss": 3.231, "step": 7360 }, { "epoch": 0.54, "grad_norm": 6.105316638946533, "learning_rate": 0.00017427632908080537, "loss": 2.9946, "step": 7370 }, { "epoch": 0.55, "grad_norm": 5.265261173248291, "learning_rate": 0.00017419449040142795, "loss": 2.8048, "step": 7380 }, { "epoch": 0.55, "grad_norm": 5.074249267578125, "learning_rate": 0.00017411254102669003, "loss": 3.6117, "step": 7390 }, { "epoch": 0.55, "grad_norm": 7.331019401550293, "learning_rate": 0.00017403048107885694, "loss": 3.0561, "step": 7400 }, { "epoch": 0.55, "eval_loss": 3.077350378036499, "eval_runtime": 1138.274, "eval_samples_per_second": 5.008, "eval_steps_per_second": 5.008, "step": 7400 }, { "epoch": 0.55, "grad_norm": 4.099388599395752, "learning_rate": 0.00017394831068035893, "loss": 3.2471, "step": 7410 }, { "epoch": 0.55, "grad_norm": 7.908533573150635, "learning_rate": 0.0001738660299537912, "loss": 3.4178, "step": 7420 }, { "epoch": 0.55, "grad_norm": 5.370948791503906, "learning_rate": 0.0001737836390219134, "loss": 3.108, "step": 7430 }, { "epoch": 0.55, "grad_norm": 12.10229206085205, "learning_rate": 0.00017370113800764972, "loss": 2.8955, "step": 7440 }, { "epoch": 0.55, "grad_norm": 6.406788349151611, "learning_rate": 0.00017361852703408852, "loss": 2.9021, "step": 7450 }, { "epoch": 0.55, "grad_norm": 10.103180885314941, "learning_rate": 0.0001735358062244822, "loss": 2.9578, "step": 7460 }, { "epoch": 0.55, "grad_norm": 7.811886787414551, "learning_rate": 0.00017345297570224712, "loss": 3.2403, "step": 7470 }, { "epoch": 0.55, "grad_norm": 8.512283325195312, "learning_rate": 0.00017337003559096328, "loss": 3.1895, "step": 7480 }, { "epoch": 0.55, "grad_norm": 9.635491371154785, "learning_rate": 0.0001732869860143741, "loss": 3.0036, "step": 7490 }, { "epoch": 0.55, "grad_norm": 5.56748104095459, "learning_rate": 0.00017320382709638647, "loss": 3.1748, "step": 7500 }, { "epoch": 0.55, "grad_norm": 4.9890265464782715, "learning_rate": 0.00017312055896107032, "loss": 3.1185, "step": 7510 }, { "epoch": 0.56, "grad_norm": 5.688922882080078, "learning_rate": 0.00017303718173265848, "loss": 2.9293, "step": 7520 }, { "epoch": 0.56, "grad_norm": 7.263044834136963, "learning_rate": 0.0001729536955355467, "loss": 3.1688, "step": 7530 }, { "epoch": 0.56, "grad_norm": 9.175032615661621, "learning_rate": 0.0001728701004942931, "loss": 3.0364, "step": 7540 }, { "epoch": 0.56, "grad_norm": 8.44921588897705, "learning_rate": 0.00017278639673361842, "loss": 3.2652, "step": 7550 }, { "epoch": 0.56, "grad_norm": 7.016599178314209, "learning_rate": 0.00017270258437840545, "loss": 3.0066, "step": 7560 }, { "epoch": 0.56, "grad_norm": 7.336106300354004, "learning_rate": 0.00017261866355369903, "loss": 2.8191, "step": 7570 }, { "epoch": 0.56, "grad_norm": 8.093605041503906, "learning_rate": 0.0001725346343847058, "loss": 3.0282, "step": 7580 }, { "epoch": 0.56, "grad_norm": 5.580060005187988, "learning_rate": 0.0001724504969967942, "loss": 2.8839, "step": 7590 }, { "epoch": 0.56, "grad_norm": 5.478754997253418, "learning_rate": 0.0001723662515154939, "loss": 3.3122, "step": 7600 }, { "epoch": 0.56, "eval_loss": 3.061328172683716, "eval_runtime": 1139.392, "eval_samples_per_second": 5.003, "eval_steps_per_second": 5.003, "step": 7600 }, { "epoch": 0.56, "grad_norm": 6.29701566696167, "learning_rate": 0.00017228189806649602, "loss": 3.3338, "step": 7610 }, { "epoch": 0.56, "grad_norm": 7.164097785949707, "learning_rate": 0.0001721974367756527, "loss": 2.924, "step": 7620 }, { "epoch": 0.56, "grad_norm": 7.159896373748779, "learning_rate": 0.00017211286776897694, "loss": 3.2111, "step": 7630 }, { "epoch": 0.56, "grad_norm": 9.791536331176758, "learning_rate": 0.0001720281911726425, "loss": 3.201, "step": 7640 }, { "epoch": 0.57, "grad_norm": 6.786426067352295, "learning_rate": 0.00017194340711298368, "loss": 2.8274, "step": 7650 }, { "epoch": 0.57, "grad_norm": 8.007925033569336, "learning_rate": 0.00017185851571649506, "loss": 3.176, "step": 7660 }, { "epoch": 0.57, "grad_norm": 8.49763011932373, "learning_rate": 0.0001717735171098313, "loss": 3.2994, "step": 7670 }, { "epoch": 0.57, "grad_norm": 5.434768199920654, "learning_rate": 0.0001716884114198072, "loss": 2.8618, "step": 7680 }, { "epoch": 0.57, "grad_norm": 4.9746012687683105, "learning_rate": 0.00017160319877339717, "loss": 2.9885, "step": 7690 }, { "epoch": 0.57, "grad_norm": 4.094747543334961, "learning_rate": 0.00017151787929773525, "loss": 2.7888, "step": 7700 }, { "epoch": 0.57, "grad_norm": 9.222213745117188, "learning_rate": 0.00017143245312011484, "loss": 3.0399, "step": 7710 }, { "epoch": 0.57, "grad_norm": 8.820667266845703, "learning_rate": 0.00017134692036798854, "loss": 3.1198, "step": 7720 }, { "epoch": 0.57, "grad_norm": 6.44861364364624, "learning_rate": 0.000171261281168968, "loss": 3.3128, "step": 7730 }, { "epoch": 0.57, "grad_norm": 5.5747270584106445, "learning_rate": 0.00017117553565082364, "loss": 3.1565, "step": 7740 }, { "epoch": 0.57, "grad_norm": 5.769834041595459, "learning_rate": 0.00017108968394148453, "loss": 3.1719, "step": 7750 }, { "epoch": 0.57, "grad_norm": 3.5767252445220947, "learning_rate": 0.00017100372616903813, "loss": 2.8726, "step": 7760 }, { "epoch": 0.57, "grad_norm": 6.374331951141357, "learning_rate": 0.00017091766246173017, "loss": 2.8511, "step": 7770 }, { "epoch": 0.57, "grad_norm": 10.399380683898926, "learning_rate": 0.00017083149294796446, "loss": 2.9068, "step": 7780 }, { "epoch": 0.58, "grad_norm": 6.99971342086792, "learning_rate": 0.00017074521775630258, "loss": 2.7705, "step": 7790 }, { "epoch": 0.58, "grad_norm": 7.660416603088379, "learning_rate": 0.0001706588370154639, "loss": 2.8446, "step": 7800 }, { "epoch": 0.58, "eval_loss": 3.0599443912506104, "eval_runtime": 1134.9351, "eval_samples_per_second": 5.022, "eval_steps_per_second": 5.022, "step": 7800 }, { "epoch": 0.58, "grad_norm": 8.767396926879883, "learning_rate": 0.00017057235085432519, "loss": 3.17, "step": 7810 }, { "epoch": 0.58, "grad_norm": 6.4136223793029785, "learning_rate": 0.00017048575940192053, "loss": 3.1791, "step": 7820 }, { "epoch": 0.58, "grad_norm": 7.993081092834473, "learning_rate": 0.00017039906278744105, "loss": 3.0694, "step": 7830 }, { "epoch": 0.58, "grad_norm": 4.835598945617676, "learning_rate": 0.0001703122611402348, "loss": 3.0197, "step": 7840 }, { "epoch": 0.58, "grad_norm": 7.789417743682861, "learning_rate": 0.00017022535458980652, "loss": 3.2511, "step": 7850 }, { "epoch": 0.58, "grad_norm": 6.523293495178223, "learning_rate": 0.00017013834326581753, "loss": 3.2971, "step": 7860 }, { "epoch": 0.58, "grad_norm": 4.12329626083374, "learning_rate": 0.0001700512272980854, "loss": 3.4024, "step": 7870 }, { "epoch": 0.58, "grad_norm": 4.0998945236206055, "learning_rate": 0.00016996400681658388, "loss": 2.91, "step": 7880 }, { "epoch": 0.58, "grad_norm": 4.825921058654785, "learning_rate": 0.00016987668195144254, "loss": 3.0696, "step": 7890 }, { "epoch": 0.58, "grad_norm": 4.836582183837891, "learning_rate": 0.00016978925283294682, "loss": 3.1299, "step": 7900 }, { "epoch": 0.58, "grad_norm": 5.9830217361450195, "learning_rate": 0.0001697017195915376, "loss": 2.8505, "step": 7910 }, { "epoch": 0.59, "grad_norm": 5.919245719909668, "learning_rate": 0.0001696140823578112, "loss": 3.129, "step": 7920 }, { "epoch": 0.59, "grad_norm": 7.34597635269165, "learning_rate": 0.00016952634126251903, "loss": 3.0404, "step": 7930 }, { "epoch": 0.59, "grad_norm": 6.159910678863525, "learning_rate": 0.0001694384964365674, "loss": 2.9518, "step": 7940 }, { "epoch": 0.59, "grad_norm": 5.33622932434082, "learning_rate": 0.00016935054801101753, "loss": 3.0204, "step": 7950 }, { "epoch": 0.59, "grad_norm": 4.061224460601807, "learning_rate": 0.00016926249611708512, "loss": 3.1284, "step": 7960 }, { "epoch": 0.59, "grad_norm": 4.315130233764648, "learning_rate": 0.00016917434088614024, "loss": 2.9494, "step": 7970 }, { "epoch": 0.59, "grad_norm": 8.222806930541992, "learning_rate": 0.00016908608244970715, "loss": 3.1193, "step": 7980 }, { "epoch": 0.59, "grad_norm": 10.138331413269043, "learning_rate": 0.00016899772093946405, "loss": 2.9443, "step": 7990 }, { "epoch": 0.59, "grad_norm": 9.246224403381348, "learning_rate": 0.00016890925648724298, "loss": 2.8743, "step": 8000 }, { "epoch": 0.59, "eval_loss": 3.0430643558502197, "eval_runtime": 1136.7077, "eval_samples_per_second": 5.014, "eval_steps_per_second": 5.014, "step": 8000 }, { "epoch": 0.59, "grad_norm": 5.0878586769104, "learning_rate": 0.00016882068922502956, "loss": 3.028, "step": 8010 }, { "epoch": 0.59, "grad_norm": 4.8212666511535645, "learning_rate": 0.00016873201928496276, "loss": 2.8606, "step": 8020 }, { "epoch": 0.59, "grad_norm": 4.808487415313721, "learning_rate": 0.00016864324679933477, "loss": 2.7987, "step": 8030 }, { "epoch": 0.59, "grad_norm": 7.51768159866333, "learning_rate": 0.00016855437190059074, "loss": 3.1772, "step": 8040 }, { "epoch": 0.59, "grad_norm": 6.17442512512207, "learning_rate": 0.00016846539472132867, "loss": 3.517, "step": 8050 }, { "epoch": 0.6, "grad_norm": 4.601199626922607, "learning_rate": 0.0001683763153942991, "loss": 2.8995, "step": 8060 }, { "epoch": 0.6, "grad_norm": 8.681718826293945, "learning_rate": 0.0001682871340524051, "loss": 2.9769, "step": 8070 }, { "epoch": 0.6, "grad_norm": 8.995853424072266, "learning_rate": 0.00016819785082870168, "loss": 3.3334, "step": 8080 }, { "epoch": 0.6, "grad_norm": 4.729511260986328, "learning_rate": 0.00016810846585639614, "loss": 2.9659, "step": 8090 }, { "epoch": 0.6, "grad_norm": 8.431835174560547, "learning_rate": 0.00016801897926884747, "loss": 3.1703, "step": 8100 }, { "epoch": 0.6, "grad_norm": 6.615757942199707, "learning_rate": 0.00016792939119956616, "loss": 3.2366, "step": 8110 }, { "epoch": 0.6, "grad_norm": 7.626440048217773, "learning_rate": 0.0001678397017822143, "loss": 3.2195, "step": 8120 }, { "epoch": 0.6, "grad_norm": 6.6842241287231445, "learning_rate": 0.00016774991115060502, "loss": 3.1806, "step": 8130 }, { "epoch": 0.6, "grad_norm": 6.602607250213623, "learning_rate": 0.00016766001943870258, "loss": 2.8451, "step": 8140 }, { "epoch": 0.6, "grad_norm": 6.661900997161865, "learning_rate": 0.000167570026780622, "loss": 2.9985, "step": 8150 }, { "epoch": 0.6, "grad_norm": 5.912670135498047, "learning_rate": 0.00016747993331062884, "loss": 2.9751, "step": 8160 }, { "epoch": 0.6, "grad_norm": 9.231598854064941, "learning_rate": 0.0001673897391631392, "loss": 3.1625, "step": 8170 }, { "epoch": 0.6, "grad_norm": 3.841637372970581, "learning_rate": 0.00016729944447271933, "loss": 3.2863, "step": 8180 }, { "epoch": 0.6, "grad_norm": 4.234511852264404, "learning_rate": 0.00016720904937408545, "loss": 3.1483, "step": 8190 }, { "epoch": 0.61, "grad_norm": 8.182954788208008, "learning_rate": 0.00016711855400210359, "loss": 3.176, "step": 8200 }, { "epoch": 0.61, "eval_loss": 3.0353262424468994, "eval_runtime": 1138.7137, "eval_samples_per_second": 5.006, "eval_steps_per_second": 5.006, "step": 8200 }, { "epoch": 0.61, "grad_norm": 5.439648628234863, "learning_rate": 0.00016702795849178945, "loss": 2.9075, "step": 8210 }, { "epoch": 0.61, "grad_norm": 6.0995192527771, "learning_rate": 0.00016693726297830805, "loss": 2.9992, "step": 8220 }, { "epoch": 0.61, "grad_norm": 5.458889484405518, "learning_rate": 0.00016684646759697368, "loss": 2.9326, "step": 8230 }, { "epoch": 0.61, "grad_norm": 4.805375576019287, "learning_rate": 0.0001667555724832496, "loss": 2.8286, "step": 8240 }, { "epoch": 0.61, "grad_norm": 6.176124572753906, "learning_rate": 0.00016666457777274785, "loss": 2.9266, "step": 8250 }, { "epoch": 0.61, "grad_norm": 9.262208938598633, "learning_rate": 0.00016657348360122907, "loss": 2.8841, "step": 8260 }, { "epoch": 0.61, "grad_norm": 5.791190147399902, "learning_rate": 0.00016648229010460234, "loss": 2.8039, "step": 8270 }, { "epoch": 0.61, "grad_norm": 5.125844955444336, "learning_rate": 0.00016639099741892486, "loss": 3.2558, "step": 8280 }, { "epoch": 0.61, "grad_norm": 4.081056118011475, "learning_rate": 0.00016629960568040187, "loss": 3.2467, "step": 8290 }, { "epoch": 0.61, "grad_norm": 6.962846279144287, "learning_rate": 0.00016620811502538634, "loss": 3.1461, "step": 8300 }, { "epoch": 0.61, "grad_norm": 4.538918495178223, "learning_rate": 0.00016611652559037884, "loss": 3.2418, "step": 8310 }, { "epoch": 0.61, "grad_norm": 3.3968560695648193, "learning_rate": 0.00016602483751202742, "loss": 2.8624, "step": 8320 }, { "epoch": 0.62, "grad_norm": 7.998313903808594, "learning_rate": 0.00016593305092712712, "loss": 3.0516, "step": 8330 }, { "epoch": 0.62, "grad_norm": 9.397892951965332, "learning_rate": 0.00016584116597262007, "loss": 3.2749, "step": 8340 }, { "epoch": 0.62, "grad_norm": 6.359921932220459, "learning_rate": 0.00016574918278559512, "loss": 2.9715, "step": 8350 }, { "epoch": 0.62, "grad_norm": 12.321609497070312, "learning_rate": 0.0001656571015032877, "loss": 3.1384, "step": 8360 }, { "epoch": 0.62, "grad_norm": NaN, "learning_rate": 0.0001655741445912875, "loss": 3.0863, "step": 8370 }, { "epoch": 0.62, "grad_norm": 4.111155033111572, "learning_rate": 0.00016548187730655096, "loss": 2.7541, "step": 8380 }, { "epoch": 0.62, "grad_norm": 6.458191394805908, "learning_rate": 0.00016538951232534155, "loss": 3.1002, "step": 8390 }, { "epoch": 0.62, "grad_norm": 6.862247943878174, "learning_rate": 0.0001652970497854643, "loss": 3.3266, "step": 8400 }, { "epoch": 0.62, "eval_loss": 3.0325841903686523, "eval_runtime": 1139.1009, "eval_samples_per_second": 5.004, "eval_steps_per_second": 5.004, "step": 8400 }, { "epoch": 0.62, "grad_norm": 4.755209922790527, "learning_rate": 0.00016520448982486991, "loss": 3.6499, "step": 8410 }, { "epoch": 0.62, "grad_norm": 6.747128963470459, "learning_rate": 0.00016511183258165419, "loss": 2.8711, "step": 8420 }, { "epoch": 0.62, "grad_norm": 10.228262901306152, "learning_rate": 0.0001650190781940583, "loss": 2.8253, "step": 8430 }, { "epoch": 0.62, "grad_norm": 10.171624183654785, "learning_rate": 0.00016492622680046824, "loss": 2.8922, "step": 8440 }, { "epoch": 0.62, "grad_norm": 7.286989688873291, "learning_rate": 0.00016483327853941476, "loss": 2.8137, "step": 8450 }, { "epoch": 0.62, "grad_norm": 7.342117786407471, "learning_rate": 0.00016474023354957313, "loss": 2.8627, "step": 8460 }, { "epoch": 0.63, "grad_norm": 6.907195091247559, "learning_rate": 0.00016464709196976294, "loss": 3.1057, "step": 8470 }, { "epoch": 0.63, "grad_norm": 4.412569522857666, "learning_rate": 0.0001645538539389479, "loss": 3.1517, "step": 8480 }, { "epoch": 0.63, "grad_norm": 9.296083450317383, "learning_rate": 0.00016446051959623562, "loss": 3.0493, "step": 8490 }, { "epoch": 0.63, "grad_norm": 4.984066009521484, "learning_rate": 0.00016436708908087737, "loss": 3.37, "step": 8500 }, { "epoch": 0.63, "grad_norm": 6.971232891082764, "learning_rate": 0.00016427356253226796, "loss": 2.9304, "step": 8510 }, { "epoch": 0.63, "grad_norm": 6.060530662536621, "learning_rate": 0.0001641799400899454, "loss": 3.1361, "step": 8520 }, { "epoch": 0.63, "grad_norm": 7.630738735198975, "learning_rate": 0.00016408622189359085, "loss": 2.9571, "step": 8530 }, { "epoch": 0.63, "grad_norm": 7.277754783630371, "learning_rate": 0.00016399240808302826, "loss": 3.0568, "step": 8540 }, { "epoch": 0.63, "grad_norm": 6.79268217086792, "learning_rate": 0.00016389849879822434, "loss": 2.8103, "step": 8550 }, { "epoch": 0.63, "grad_norm": 6.705874919891357, "learning_rate": 0.0001638044941792881, "loss": 2.7768, "step": 8560 }, { "epoch": 0.63, "grad_norm": 4.756038188934326, "learning_rate": 0.00016371039436647092, "loss": 3.1237, "step": 8570 }, { "epoch": 0.63, "grad_norm": 5.9619317054748535, "learning_rate": 0.00016361619950016612, "loss": 3.0635, "step": 8580 }, { "epoch": 0.63, "grad_norm": 7.578229904174805, "learning_rate": 0.00016352190972090884, "loss": 2.955, "step": 8590 }, { "epoch": 0.64, "grad_norm": 9.273209571838379, "learning_rate": 0.0001634275251693759, "loss": 3.2253, "step": 8600 }, { "epoch": 0.64, "eval_loss": 3.0166234970092773, "eval_runtime": 1138.7152, "eval_samples_per_second": 5.006, "eval_steps_per_second": 5.006, "step": 8600 }, { "epoch": 0.64, "grad_norm": 6.731431007385254, "learning_rate": 0.00016333304598638537, "loss": 2.8567, "step": 8610 }, { "epoch": 0.64, "grad_norm": 7.561667442321777, "learning_rate": 0.0001632384723128967, "loss": 2.8719, "step": 8620 }, { "epoch": 0.64, "grad_norm": 5.603372097015381, "learning_rate": 0.0001631438042900102, "loss": 2.8939, "step": 8630 }, { "epoch": 0.64, "grad_norm": 6.9654436111450195, "learning_rate": 0.00016304904205896695, "loss": 2.9811, "step": 8640 }, { "epoch": 0.64, "grad_norm": 5.97416877746582, "learning_rate": 0.00016295418576114855, "loss": 3.0695, "step": 8650 }, { "epoch": 0.64, "grad_norm": 12.01034927368164, "learning_rate": 0.00016285923553807706, "loss": 2.979, "step": 8660 }, { "epoch": 0.64, "grad_norm": 10.122462272644043, "learning_rate": 0.0001627641915314146, "loss": 3.3434, "step": 8670 }, { "epoch": 0.64, "grad_norm": 4.262747287750244, "learning_rate": 0.00016266905388296317, "loss": 2.8383, "step": 8680 }, { "epoch": 0.64, "grad_norm": 7.6208953857421875, "learning_rate": 0.00016257382273466455, "loss": 3.2615, "step": 8690 }, { "epoch": 0.64, "grad_norm": 4.870731353759766, "learning_rate": 0.0001624784982286, "loss": 3.0911, "step": 8700 }, { "epoch": 0.64, "grad_norm": 4.434355735778809, "learning_rate": 0.00016238308050699004, "loss": 3.0843, "step": 8710 }, { "epoch": 0.64, "grad_norm": 5.287969589233398, "learning_rate": 0.00016228756971219433, "loss": 2.9681, "step": 8720 }, { "epoch": 0.64, "grad_norm": 5.047779083251953, "learning_rate": 0.0001621919659867113, "loss": 3.1289, "step": 8730 }, { "epoch": 0.65, "grad_norm": 6.657232761383057, "learning_rate": 0.00016209626947317815, "loss": 3.0631, "step": 8740 }, { "epoch": 0.65, "grad_norm": 4.935356140136719, "learning_rate": 0.00016200048031437034, "loss": 2.8295, "step": 8750 }, { "epoch": 0.65, "grad_norm": 10.847895622253418, "learning_rate": 0.00016190459865320173, "loss": 3.1355, "step": 8760 }, { "epoch": 0.65, "grad_norm": 5.847652435302734, "learning_rate": 0.00016180862463272406, "loss": 2.6263, "step": 8770 }, { "epoch": 0.65, "grad_norm": 5.575468063354492, "learning_rate": 0.00016171255839612694, "loss": 2.9246, "step": 8780 }, { "epoch": 0.65, "grad_norm": 11.922440528869629, "learning_rate": 0.0001616164000867376, "loss": 3.236, "step": 8790 }, { "epoch": 0.65, "grad_norm": 6.166906356811523, "learning_rate": 0.0001615201498480205, "loss": 2.9586, "step": 8800 }, { "epoch": 0.65, "eval_loss": 3.0125856399536133, "eval_runtime": 1137.092, "eval_samples_per_second": 5.013, "eval_steps_per_second": 5.013, "step": 8800 }, { "epoch": 0.65, "grad_norm": 5.383087158203125, "learning_rate": 0.00016142380782357743, "loss": 2.7651, "step": 8810 }, { "epoch": 0.65, "grad_norm": 4.864884853363037, "learning_rate": 0.00016132737415714692, "loss": 2.8964, "step": 8820 }, { "epoch": 0.65, "grad_norm": 13.638253211975098, "learning_rate": 0.00016123084899260444, "loss": 3.0387, "step": 8830 }, { "epoch": 0.65, "grad_norm": 5.7503204345703125, "learning_rate": 0.0001611342324739618, "loss": 2.6854, "step": 8840 }, { "epoch": 0.65, "grad_norm": 6.744014739990234, "learning_rate": 0.0001610375247453672, "loss": 2.961, "step": 8850 }, { "epoch": 0.65, "grad_norm": 9.730425834655762, "learning_rate": 0.0001609407259511049, "loss": 3.2752, "step": 8860 }, { "epoch": 0.66, "grad_norm": 5.120224952697754, "learning_rate": 0.00016084383623559502, "loss": 2.8938, "step": 8870 }, { "epoch": 0.66, "grad_norm": 7.75462007522583, "learning_rate": 0.00016074685574339332, "loss": 3.184, "step": 8880 }, { "epoch": 0.66, "grad_norm": 4.399641990661621, "learning_rate": 0.000160649784619191, "loss": 2.8226, "step": 8890 }, { "epoch": 0.66, "grad_norm": 5.9601898193359375, "learning_rate": 0.00016055262300781453, "loss": 2.8385, "step": 8900 }, { "epoch": 0.66, "grad_norm": 5.693487167358398, "learning_rate": 0.00016045537105422534, "loss": 3.2339, "step": 8910 }, { "epoch": 0.66, "grad_norm": 6.121466636657715, "learning_rate": 0.00016035802890351962, "loss": 3.0847, "step": 8920 }, { "epoch": 0.66, "grad_norm": 6.453389644622803, "learning_rate": 0.00016026059670092816, "loss": 3.3022, "step": 8930 }, { "epoch": 0.66, "grad_norm": 4.665291786193848, "learning_rate": 0.00016016307459181613, "loss": 3.0313, "step": 8940 }, { "epoch": 0.66, "grad_norm": 7.089426517486572, "learning_rate": 0.00016006546272168278, "loss": 3.2097, "step": 8950 }, { "epoch": 0.66, "grad_norm": 6.783688068389893, "learning_rate": 0.00015996776123616133, "loss": 2.842, "step": 8960 }, { "epoch": 0.66, "grad_norm": 4.681889533996582, "learning_rate": 0.00015986997028101868, "loss": 2.7781, "step": 8970 }, { "epoch": 0.66, "grad_norm": 10.384384155273438, "learning_rate": 0.00015977209000215525, "loss": 3.0, "step": 8980 }, { "epoch": 0.66, "grad_norm": 10.24274730682373, "learning_rate": 0.00015967412054560464, "loss": 2.9689, "step": 8990 }, { "epoch": 0.66, "grad_norm": 4.38585090637207, "learning_rate": 0.0001595760620575336, "loss": 2.786, "step": 9000 }, { "epoch": 0.66, "eval_loss": 3.0171055793762207, "eval_runtime": 1137.1019, "eval_samples_per_second": 5.013, "eval_steps_per_second": 5.013, "step": 9000 }, { "epoch": 0.67, "grad_norm": 5.604382038116455, "learning_rate": 0.00015947791468424164, "loss": 3.2516, "step": 9010 }, { "epoch": 0.67, "grad_norm": 5.53500509262085, "learning_rate": 0.00015937967857216094, "loss": 3.1364, "step": 9020 }, { "epoch": 0.67, "grad_norm": 7.274658679962158, "learning_rate": 0.00015928135386785602, "loss": 3.1856, "step": 9030 }, { "epoch": 0.67, "grad_norm": 6.1844353675842285, "learning_rate": 0.00015918294071802362, "loss": 2.8782, "step": 9040 }, { "epoch": 0.67, "grad_norm": 5.413163185119629, "learning_rate": 0.0001590844392694924, "loss": 3.1712, "step": 9050 }, { "epoch": 0.67, "grad_norm": 5.227255344390869, "learning_rate": 0.00015898584966922283, "loss": 3.0771, "step": 9060 }, { "epoch": 0.67, "grad_norm": 10.300729751586914, "learning_rate": 0.00015888717206430678, "loss": 3.0506, "step": 9070 }, { "epoch": 0.67, "grad_norm": 5.3075456619262695, "learning_rate": 0.00015878840660196752, "loss": 2.7935, "step": 9080 }, { "epoch": 0.67, "grad_norm": 4.687715530395508, "learning_rate": 0.00015868955342955937, "loss": 2.966, "step": 9090 }, { "epoch": 0.67, "grad_norm": 12.141742706298828, "learning_rate": 0.0001585906126945675, "loss": 2.9231, "step": 9100 }, { "epoch": 0.67, "grad_norm": 9.727426528930664, "learning_rate": 0.00015849158454460773, "loss": 2.8196, "step": 9110 }, { "epoch": 0.67, "grad_norm": 6.129993915557861, "learning_rate": 0.0001583924691274263, "loss": 2.8332, "step": 9120 }, { "epoch": 0.67, "grad_norm": 4.653347969055176, "learning_rate": 0.00015829326659089963, "loss": 3.2322, "step": 9130 }, { "epoch": 0.68, "grad_norm": 7.963883876800537, "learning_rate": 0.00015819397708303416, "loss": 3.0491, "step": 9140 }, { "epoch": 0.68, "grad_norm": 4.15736722946167, "learning_rate": 0.00015809460075196606, "loss": 2.7982, "step": 9150 }, { "epoch": 0.68, "grad_norm": 4.2904133796691895, "learning_rate": 0.000157995137745961, "loss": 2.9823, "step": 9160 }, { "epoch": 0.68, "grad_norm": 7.554558753967285, "learning_rate": 0.00015789558821341408, "loss": 2.9495, "step": 9170 }, { "epoch": 0.68, "grad_norm": 8.047385215759277, "learning_rate": 0.00015779595230284933, "loss": 2.9106, "step": 9180 }, { "epoch": 0.68, "grad_norm": 9.017010688781738, "learning_rate": 0.00015769623016291987, "loss": 2.5535, "step": 9190 }, { "epoch": 0.68, "grad_norm": 4.758884906768799, "learning_rate": 0.00015759642194240718, "loss": 2.5587, "step": 9200 }, { "epoch": 0.68, "eval_loss": 2.9998974800109863, "eval_runtime": 1139.1877, "eval_samples_per_second": 5.004, "eval_steps_per_second": 5.004, "step": 9200 }, { "epoch": 0.68, "grad_norm": 5.704859733581543, "learning_rate": 0.00015749652779022144, "loss": 2.9386, "step": 9210 }, { "epoch": 0.68, "grad_norm": 3.6972222328186035, "learning_rate": 0.0001573965478554009, "loss": 2.9757, "step": 9220 }, { "epoch": 0.68, "grad_norm": 4.977140426635742, "learning_rate": 0.00015729648228711182, "loss": 2.9307, "step": 9230 }, { "epoch": 0.68, "grad_norm": 4.237871170043945, "learning_rate": 0.0001571963312346483, "loss": 2.7724, "step": 9240 }, { "epoch": 0.68, "grad_norm": 5.418900012969971, "learning_rate": 0.00015709609484743176, "loss": 2.767, "step": 9250 }, { "epoch": 0.68, "grad_norm": 5.639104843139648, "learning_rate": 0.0001569957732750112, "loss": 2.9483, "step": 9260 }, { "epoch": 0.68, "grad_norm": 8.407296180725098, "learning_rate": 0.00015689536666706254, "loss": 3.1998, "step": 9270 }, { "epoch": 0.69, "grad_norm": 4.8399128913879395, "learning_rate": 0.00015679487517338865, "loss": 2.8589, "step": 9280 }, { "epoch": 0.69, "grad_norm": 5.254055023193359, "learning_rate": 0.000156694298943919, "loss": 3.0868, "step": 9290 }, { "epoch": 0.69, "grad_norm": 6.7703094482421875, "learning_rate": 0.0001565936381287095, "loss": 3.1148, "step": 9300 }, { "epoch": 0.69, "grad_norm": 4.5534186363220215, "learning_rate": 0.0001564928928779423, "loss": 2.8424, "step": 9310 }, { "epoch": 0.69, "grad_norm": 5.026829242706299, "learning_rate": 0.00015639206334192544, "loss": 2.9863, "step": 9320 }, { "epoch": 0.69, "grad_norm": 5.98419713973999, "learning_rate": 0.0001562911496710928, "loss": 3.0387, "step": 9330 }, { "epoch": 0.69, "grad_norm": 5.446651935577393, "learning_rate": 0.00015619015201600371, "loss": 3.0489, "step": 9340 }, { "epoch": 0.69, "grad_norm": 3.870856761932373, "learning_rate": 0.00015608907052734283, "loss": 2.6993, "step": 9350 }, { "epoch": 0.69, "grad_norm": 9.323542594909668, "learning_rate": 0.00015598790535591994, "loss": 3.4028, "step": 9360 }, { "epoch": 0.69, "grad_norm": 5.4584431648254395, "learning_rate": 0.00015588665665266957, "loss": 3.2105, "step": 9370 }, { "epoch": 0.69, "grad_norm": 4.321359634399414, "learning_rate": 0.000155785324568651, "loss": 2.7321, "step": 9380 }, { "epoch": 0.69, "grad_norm": 6.849380970001221, "learning_rate": 0.00015568390925504782, "loss": 2.9796, "step": 9390 }, { "epoch": 0.69, "grad_norm": 5.754255294799805, "learning_rate": 0.0001555824108631678, "loss": 2.7112, "step": 9400 }, { "epoch": 0.69, "eval_loss": 2.999478578567505, "eval_runtime": 1136.8232, "eval_samples_per_second": 5.014, "eval_steps_per_second": 5.014, "step": 9400 }, { "epoch": 0.7, "grad_norm": 7.1536173820495605, "learning_rate": 0.0001554808295444427, "loss": 2.9848, "step": 9410 }, { "epoch": 0.7, "grad_norm": 7.908527851104736, "learning_rate": 0.00015537916545042805, "loss": 2.9802, "step": 9420 }, { "epoch": 0.7, "grad_norm": 10.420408248901367, "learning_rate": 0.00015527741873280274, "loss": 2.8162, "step": 9430 }, { "epoch": 0.7, "grad_norm": 5.7388763427734375, "learning_rate": 0.00015517558954336903, "loss": 3.2836, "step": 9440 }, { "epoch": 0.7, "grad_norm": 5.738020420074463, "learning_rate": 0.0001550736780340522, "loss": 2.9862, "step": 9450 }, { "epoch": 0.7, "grad_norm": 5.188188076019287, "learning_rate": 0.00015497168435690036, "loss": 2.913, "step": 9460 }, { "epoch": 0.7, "grad_norm": 3.969451427459717, "learning_rate": 0.00015486960866408417, "loss": 2.9761, "step": 9470 }, { "epoch": 0.7, "grad_norm": 6.392033100128174, "learning_rate": 0.00015476745110789674, "loss": 2.8509, "step": 9480 }, { "epoch": 0.7, "grad_norm": 5.61599063873291, "learning_rate": 0.00015466521184075323, "loss": 3.1069, "step": 9490 }, { "epoch": 0.7, "grad_norm": 7.307232856750488, "learning_rate": 0.0001545628910151907, "loss": 3.0924, "step": 9500 }, { "epoch": 0.7, "grad_norm": 6.591823101043701, "learning_rate": 0.00015446048878386802, "loss": 2.9399, "step": 9510 }, { "epoch": 0.7, "grad_norm": 5.432168483734131, "learning_rate": 0.00015435800529956534, "loss": 3.0241, "step": 9520 }, { "epoch": 0.7, "grad_norm": 4.527278423309326, "learning_rate": 0.00015425544071518422, "loss": 3.2915, "step": 9530 }, { "epoch": 0.7, "grad_norm": 4.801354885101318, "learning_rate": 0.000154152795183747, "loss": 2.9509, "step": 9540 }, { "epoch": 0.71, "grad_norm": 8.737408638000488, "learning_rate": 0.00015405006885839707, "loss": 2.9119, "step": 9550 }, { "epoch": 0.71, "grad_norm": 5.51857852935791, "learning_rate": 0.00015394726189239805, "loss": 3.2417, "step": 9560 }, { "epoch": 0.71, "grad_norm": 4.063334941864014, "learning_rate": 0.00015384437443913414, "loss": 2.8913, "step": 9570 }, { "epoch": 0.71, "grad_norm": 7.9327287673950195, "learning_rate": 0.00015374140665210946, "loss": 2.913, "step": 9580 }, { "epoch": 0.71, "grad_norm": 6.562859058380127, "learning_rate": 0.000153638358684948, "loss": 3.0012, "step": 9590 }, { "epoch": 0.71, "grad_norm": 9.443960189819336, "learning_rate": 0.00015353523069139348, "loss": 2.9245, "step": 9600 }, { "epoch": 0.71, "eval_loss": 2.9986822605133057, "eval_runtime": 1138.3167, "eval_samples_per_second": 5.007, "eval_steps_per_second": 5.007, "step": 9600 }, { "epoch": 0.71, "grad_norm": 5.080326080322266, "learning_rate": 0.00015343202282530892, "loss": 2.5978, "step": 9610 }, { "epoch": 0.71, "grad_norm": 4.626572608947754, "learning_rate": 0.00015332873524067658, "loss": 2.8308, "step": 9620 }, { "epoch": 0.71, "grad_norm": 14.406761169433594, "learning_rate": 0.0001532253680915975, "loss": 3.2131, "step": 9630 }, { "epoch": 0.71, "grad_norm": 8.314620971679688, "learning_rate": 0.00015312192153229162, "loss": 2.8485, "step": 9640 }, { "epoch": 0.71, "grad_norm": 9.021672248840332, "learning_rate": 0.0001530183957170973, "loss": 3.1707, "step": 9650 }, { "epoch": 0.71, "grad_norm": 6.305810451507568, "learning_rate": 0.00015291479080047104, "loss": 2.8943, "step": 9660 }, { "epoch": 0.71, "grad_norm": 4.459597587585449, "learning_rate": 0.00015281110693698752, "loss": 2.8154, "step": 9670 }, { "epoch": 0.72, "grad_norm": 6.650838375091553, "learning_rate": 0.00015270734428133906, "loss": 2.9857, "step": 9680 }, { "epoch": 0.72, "grad_norm": 7.86285924911499, "learning_rate": 0.00015260350298833565, "loss": 2.8424, "step": 9690 }, { "epoch": 0.72, "grad_norm": 8.555646896362305, "learning_rate": 0.0001524995832129045, "loss": 3.1926, "step": 9700 }, { "epoch": 0.72, "grad_norm": 7.865792751312256, "learning_rate": 0.00015239558511009004, "loss": 3.1938, "step": 9710 }, { "epoch": 0.72, "grad_norm": 8.588205337524414, "learning_rate": 0.00015229150883505342, "loss": 2.9822, "step": 9720 }, { "epoch": 0.72, "grad_norm": 7.853447437286377, "learning_rate": 0.0001521873545430725, "loss": 2.9926, "step": 9730 }, { "epoch": 0.72, "grad_norm": 6.028032302856445, "learning_rate": 0.00015208312238954158, "loss": 3.1323, "step": 9740 }, { "epoch": 0.72, "grad_norm": 4.851654529571533, "learning_rate": 0.000151978812529971, "loss": 2.892, "step": 9750 }, { "epoch": 0.72, "grad_norm": 4.319963455200195, "learning_rate": 0.00015187442511998715, "loss": 2.5974, "step": 9760 }, { "epoch": 0.72, "grad_norm": 6.1562628746032715, "learning_rate": 0.0001517699603153321, "loss": 2.9623, "step": 9770 }, { "epoch": 0.72, "grad_norm": 5.6080193519592285, "learning_rate": 0.00015166541827186326, "loss": 2.8689, "step": 9780 }, { "epoch": 0.72, "grad_norm": 9.012639045715332, "learning_rate": 0.00015156079914555354, "loss": 3.1591, "step": 9790 }, { "epoch": 0.72, "grad_norm": 4.5083746910095215, "learning_rate": 0.00015145610309249058, "loss": 2.8816, "step": 9800 }, { "epoch": 0.72, "eval_loss": 2.9825246334075928, "eval_runtime": 1137.641, "eval_samples_per_second": 5.01, "eval_steps_per_second": 5.01, "step": 9800 }, { "epoch": 0.72, "grad_norm": 8.24355697631836, "learning_rate": 0.00015135133026887698, "loss": 2.7468, "step": 9810 }, { "epoch": 0.73, "grad_norm": 6.146825790405273, "learning_rate": 0.00015124648083102979, "loss": 3.1624, "step": 9820 }, { "epoch": 0.73, "grad_norm": 5.946303844451904, "learning_rate": 0.00015114155493538037, "loss": 2.9932, "step": 9830 }, { "epoch": 0.73, "grad_norm": 7.62037992477417, "learning_rate": 0.00015103655273847422, "loss": 2.8597, "step": 9840 }, { "epoch": 0.73, "grad_norm": 8.6740083694458, "learning_rate": 0.00015093147439697058, "loss": 3.2558, "step": 9850 }, { "epoch": 0.73, "grad_norm": 4.523014545440674, "learning_rate": 0.00015082632006764238, "loss": 2.9356, "step": 9860 }, { "epoch": 0.73, "grad_norm": 6.251735210418701, "learning_rate": 0.00015072108990737582, "loss": 2.7333, "step": 9870 }, { "epoch": 0.73, "grad_norm": 6.199810028076172, "learning_rate": 0.0001506157840731704, "loss": 2.8651, "step": 9880 }, { "epoch": 0.73, "grad_norm": 5.6429972648620605, "learning_rate": 0.0001505104027221383, "loss": 3.0208, "step": 9890 }, { "epoch": 0.73, "grad_norm": 6.78240966796875, "learning_rate": 0.0001504049460115046, "loss": 3.4201, "step": 9900 }, { "epoch": 0.73, "grad_norm": 5.331435203552246, "learning_rate": 0.00015029941409860667, "loss": 3.0285, "step": 9910 }, { "epoch": 0.73, "grad_norm": 7.6099324226379395, "learning_rate": 0.0001501938071408941, "loss": 2.9424, "step": 9920 }, { "epoch": 0.73, "grad_norm": 5.696933269500732, "learning_rate": 0.00015008812529592843, "loss": 2.9491, "step": 9930 }, { "epoch": 0.73, "grad_norm": 4.624625205993652, "learning_rate": 0.00014998236872138302, "loss": 2.9854, "step": 9940 }, { "epoch": 0.73, "grad_norm": 7.571484088897705, "learning_rate": 0.00014987653757504263, "loss": 3.0587, "step": 9950 }, { "epoch": 0.74, "grad_norm": 4.712878227233887, "learning_rate": 0.00014977063201480334, "loss": 3.0112, "step": 9960 }, { "epoch": 0.74, "grad_norm": 4.909578323364258, "learning_rate": 0.00014966465219867217, "loss": 2.9227, "step": 9970 }, { "epoch": 0.74, "grad_norm": 4.633456707000732, "learning_rate": 0.00014955859828476702, "loss": 3.1489, "step": 9980 }, { "epoch": 0.74, "grad_norm": 4.861935615539551, "learning_rate": 0.00014945247043131622, "loss": 2.984, "step": 9990 }, { "epoch": 0.74, "grad_norm": 10.554461479187012, "learning_rate": 0.00014934626879665864, "loss": 3.0501, "step": 10000 }, { "epoch": 0.74, "eval_loss": 2.9680299758911133, "eval_runtime": 1137.4461, "eval_samples_per_second": 5.011, "eval_steps_per_second": 5.011, "step": 10000 }, { "epoch": 0.74, "grad_norm": 4.56096887588501, "learning_rate": 0.00014923999353924297, "loss": 2.7057, "step": 10010 }, { "epoch": 0.74, "grad_norm": 7.319655418395996, "learning_rate": 0.0001491336448176279, "loss": 3.1668, "step": 10020 }, { "epoch": 0.74, "grad_norm": 6.589526653289795, "learning_rate": 0.00014902722279048166, "loss": 3.1742, "step": 10030 }, { "epoch": 0.74, "grad_norm": 7.270175457000732, "learning_rate": 0.00014892072761658187, "loss": 3.0247, "step": 10040 }, { "epoch": 0.74, "grad_norm": 6.527873992919922, "learning_rate": 0.0001488141594548153, "loss": 2.9606, "step": 10050 }, { "epoch": 0.74, "grad_norm": 5.78521728515625, "learning_rate": 0.00014870751846417758, "loss": 3.3098, "step": 10060 }, { "epoch": 0.74, "grad_norm": 7.620880126953125, "learning_rate": 0.00014860080480377306, "loss": 2.9146, "step": 10070 }, { "epoch": 0.74, "grad_norm": 5.929685115814209, "learning_rate": 0.0001484940186328144, "loss": 3.0891, "step": 10080 }, { "epoch": 0.75, "grad_norm": 10.600454330444336, "learning_rate": 0.00014838716011062258, "loss": 2.7763, "step": 10090 }, { "epoch": 0.75, "grad_norm": 5.074846267700195, "learning_rate": 0.00014828022939662638, "loss": 2.9147, "step": 10100 }, { "epoch": 0.75, "grad_norm": 6.829638957977295, "learning_rate": 0.00014817322665036244, "loss": 3.0132, "step": 10110 }, { "epoch": 0.75, "grad_norm": 5.505454063415527, "learning_rate": 0.00014806615203147473, "loss": 3.0183, "step": 10120 }, { "epoch": 0.75, "grad_norm": 5.461676597595215, "learning_rate": 0.00014795900569971454, "loss": 3.1014, "step": 10130 }, { "epoch": 0.75, "grad_norm": 4.047961711883545, "learning_rate": 0.0001478517878149401, "loss": 3.1134, "step": 10140 }, { "epoch": 0.75, "grad_norm": 4.537815570831299, "learning_rate": 0.00014774449853711648, "loss": 2.9786, "step": 10150 }, { "epoch": 0.75, "grad_norm": 8.680290222167969, "learning_rate": 0.00014763713802631515, "loss": 2.8598, "step": 10160 }, { "epoch": 0.75, "grad_norm": 5.524952411651611, "learning_rate": 0.00014752970644271393, "loss": 2.8898, "step": 10170 }, { "epoch": 0.75, "grad_norm": 4.378311634063721, "learning_rate": 0.00014742220394659667, "loss": 3.1406, "step": 10180 }, { "epoch": 0.75, "grad_norm": 4.671150207519531, "learning_rate": 0.000147314630698353, "loss": 2.9889, "step": 10190 }, { "epoch": 0.75, "grad_norm": 6.330467700958252, "learning_rate": 0.0001472069868584781, "loss": 3.1183, "step": 10200 }, { "epoch": 0.75, "eval_loss": 2.969615936279297, "eval_runtime": 1135.1327, "eval_samples_per_second": 5.021, "eval_steps_per_second": 5.021, "step": 10200 }, { "epoch": 0.75, "grad_norm": 7.620838642120361, "learning_rate": 0.00014709927258757253, "loss": 2.9721, "step": 10210 }, { "epoch": 0.75, "grad_norm": 6.69796895980835, "learning_rate": 0.00014699148804634185, "loss": 2.9581, "step": 10220 }, { "epoch": 0.76, "grad_norm": 6.295568943023682, "learning_rate": 0.00014688363339559652, "loss": 3.0132, "step": 10230 }, { "epoch": 0.76, "grad_norm": 5.181854248046875, "learning_rate": 0.0001467757087962516, "loss": 2.9179, "step": 10240 }, { "epoch": 0.76, "grad_norm": 4.249350547790527, "learning_rate": 0.00014666771440932644, "loss": 2.8028, "step": 10250 }, { "epoch": 0.76, "grad_norm": 7.280447959899902, "learning_rate": 0.0001465596503959446, "loss": 2.9399, "step": 10260 }, { "epoch": 0.76, "grad_norm": 5.414987087249756, "learning_rate": 0.0001464515169173335, "loss": 2.8953, "step": 10270 }, { "epoch": 0.76, "grad_norm": 7.337689399719238, "learning_rate": 0.00014634331413482414, "loss": 2.8618, "step": 10280 }, { "epoch": 0.76, "grad_norm": 9.888291358947754, "learning_rate": 0.00014623504220985097, "loss": 3.2855, "step": 10290 }, { "epoch": 0.76, "grad_norm": 4.2359299659729, "learning_rate": 0.0001461267013039516, "loss": 3.011, "step": 10300 }, { "epoch": 0.76, "grad_norm": 5.158446788787842, "learning_rate": 0.00014601829157876654, "loss": 2.7949, "step": 10310 }, { "epoch": 0.76, "grad_norm": 4.1677680015563965, "learning_rate": 0.000145909813196039, "loss": 3.2265, "step": 10320 }, { "epoch": 0.76, "grad_norm": 6.444026470184326, "learning_rate": 0.00014580126631761454, "loss": 3.0472, "step": 10330 }, { "epoch": 0.76, "grad_norm": 5.472976207733154, "learning_rate": 0.00014569265110544105, "loss": 2.8335, "step": 10340 }, { "epoch": 0.76, "grad_norm": 4.650349140167236, "learning_rate": 0.00014558396772156826, "loss": 2.9379, "step": 10350 }, { "epoch": 0.77, "grad_norm": 4.644428253173828, "learning_rate": 0.00014547521632814767, "loss": 2.8781, "step": 10360 }, { "epoch": 0.77, "grad_norm": 4.317287921905518, "learning_rate": 0.0001453663970874322, "loss": 2.867, "step": 10370 }, { "epoch": 0.77, "grad_norm": 6.050807952880859, "learning_rate": 0.0001452575101617761, "loss": 3.0715, "step": 10380 }, { "epoch": 0.77, "grad_norm": 4.716285705566406, "learning_rate": 0.0001451485557136344, "loss": 2.6545, "step": 10390 }, { "epoch": 0.77, "grad_norm": 5.954706192016602, "learning_rate": 0.0001450395339055631, "loss": 3.1563, "step": 10400 }, { "epoch": 0.77, "eval_loss": 2.9598331451416016, "eval_runtime": 1137.1539, "eval_samples_per_second": 5.013, "eval_steps_per_second": 5.013, "step": 10400 }, { "epoch": 0.77, "grad_norm": 5.110961437225342, "learning_rate": 0.0001449304449002185, "loss": 3.0793, "step": 10410 }, { "epoch": 0.77, "grad_norm": 4.516371250152588, "learning_rate": 0.0001448212888603574, "loss": 3.0189, "step": 10420 }, { "epoch": 0.77, "grad_norm": 7.248453617095947, "learning_rate": 0.00014471206594883634, "loss": 3.0615, "step": 10430 }, { "epoch": 0.77, "grad_norm": 4.003082752227783, "learning_rate": 0.00014460277632861174, "loss": 3.2798, "step": 10440 }, { "epoch": 0.77, "grad_norm": 6.659687519073486, "learning_rate": 0.00014449342016273966, "loss": 2.9107, "step": 10450 }, { "epoch": 0.77, "grad_norm": 7.421617031097412, "learning_rate": 0.00014438399761437527, "loss": 3.1504, "step": 10460 }, { "epoch": 0.77, "grad_norm": 4.268542289733887, "learning_rate": 0.00014427450884677289, "loss": 2.9658, "step": 10470 }, { "epoch": 0.77, "grad_norm": 5.025989532470703, "learning_rate": 0.0001441649540232856, "loss": 3.2243, "step": 10480 }, { "epoch": 0.77, "grad_norm": 5.317170143127441, "learning_rate": 0.00014405533330736497, "loss": 2.8027, "step": 10490 }, { "epoch": 0.78, "grad_norm": 8.103606224060059, "learning_rate": 0.00014394564686256108, "loss": 2.8796, "step": 10500 }, { "epoch": 0.78, "grad_norm": 6.020264148712158, "learning_rate": 0.0001438358948525218, "loss": 2.6636, "step": 10510 }, { "epoch": 0.78, "grad_norm": 5.222537517547607, "learning_rate": 0.000143726077440993, "loss": 3.1448, "step": 10520 }, { "epoch": 0.78, "grad_norm": 5.023114204406738, "learning_rate": 0.00014361619479181812, "loss": 2.9364, "step": 10530 }, { "epoch": 0.78, "grad_norm": 5.129509925842285, "learning_rate": 0.00014350624706893785, "loss": 2.8327, "step": 10540 }, { "epoch": 0.78, "grad_norm": 3.634791135787964, "learning_rate": 0.00014339623443639004, "loss": 2.8565, "step": 10550 }, { "epoch": 0.78, "grad_norm": 5.827573299407959, "learning_rate": 0.0001432861570583094, "loss": 2.8492, "step": 10560 }, { "epoch": 0.78, "grad_norm": 4.608321189880371, "learning_rate": 0.0001431760150989271, "loss": 2.7838, "step": 10570 }, { "epoch": 0.78, "grad_norm": 5.711697578430176, "learning_rate": 0.00014306580872257084, "loss": 2.7076, "step": 10580 }, { "epoch": 0.78, "grad_norm": 4.423154830932617, "learning_rate": 0.0001429555380936643, "loss": 2.8312, "step": 10590 }, { "epoch": 0.78, "grad_norm": 6.354341983795166, "learning_rate": 0.0001428452033767271, "loss": 2.8778, "step": 10600 }, { "epoch": 0.78, "eval_loss": 2.959249973297119, "eval_runtime": 1138.9728, "eval_samples_per_second": 5.005, "eval_steps_per_second": 5.005, "step": 10600 }, { "epoch": 0.78, "grad_norm": 7.5264763832092285, "learning_rate": 0.00014273480473637443, "loss": 3.1428, "step": 10610 }, { "epoch": 0.78, "grad_norm": 6.143415451049805, "learning_rate": 0.0001426243423373169, "loss": 3.0073, "step": 10620 }, { "epoch": 0.79, "grad_norm": 4.933542251586914, "learning_rate": 0.00014251381634436015, "loss": 2.7708, "step": 10630 }, { "epoch": 0.79, "grad_norm": 5.974007606506348, "learning_rate": 0.00014240322692240476, "loss": 2.5688, "step": 10640 }, { "epoch": 0.79, "grad_norm": 4.774169445037842, "learning_rate": 0.000142292574236446, "loss": 3.0229, "step": 10650 }, { "epoch": 0.79, "grad_norm": 7.627336502075195, "learning_rate": 0.00014218185845157346, "loss": 2.779, "step": 10660 }, { "epoch": 0.79, "grad_norm": 4.425614833831787, "learning_rate": 0.00014207107973297087, "loss": 2.8371, "step": 10670 }, { "epoch": 0.79, "grad_norm": 5.521327495574951, "learning_rate": 0.0001419602382459159, "loss": 2.9034, "step": 10680 }, { "epoch": 0.79, "grad_norm": 6.049530982971191, "learning_rate": 0.00014184933415577978, "loss": 2.8192, "step": 10690 }, { "epoch": 0.79, "grad_norm": 4.450803756713867, "learning_rate": 0.0001417383676280272, "loss": 3.0164, "step": 10700 }, { "epoch": 0.79, "grad_norm": 6.391834735870361, "learning_rate": 0.00014162733882821607, "loss": 2.7078, "step": 10710 }, { "epoch": 0.79, "grad_norm": NaN, "learning_rate": 0.00014152735980268438, "loss": 3.3182, "step": 10720 }, { "epoch": 0.79, "grad_norm": 5.099579811096191, "learning_rate": 0.00014141621314240634, "loss": 2.8339, "step": 10730 }, { "epoch": 0.79, "grad_norm": 4.9488067626953125, "learning_rate": 0.00014130500469071195, "loss": 2.9437, "step": 10740 }, { "epoch": 0.79, "grad_norm": 6.22238302230835, "learning_rate": 0.00014119373461352001, "loss": 2.9827, "step": 10750 }, { "epoch": 0.79, "grad_norm": 5.493013858795166, "learning_rate": 0.00014108240307684127, "loss": 3.0163, "step": 10760 }, { "epoch": 0.8, "grad_norm": 5.54683780670166, "learning_rate": 0.00014097101024677808, "loss": 3.0077, "step": 10770 }, { "epoch": 0.8, "grad_norm": 6.295912742614746, "learning_rate": 0.00014085955628952441, "loss": 2.8018, "step": 10780 }, { "epoch": 0.8, "grad_norm": 3.9085795879364014, "learning_rate": 0.00014074804137136524, "loss": 2.9818, "step": 10790 }, { "epoch": 0.8, "grad_norm": 5.808225631713867, "learning_rate": 0.00014063646565867663, "loss": 3.159, "step": 10800 }, { "epoch": 0.8, "eval_loss": 2.9464659690856934, "eval_runtime": 1139.1096, "eval_samples_per_second": 5.004, "eval_steps_per_second": 5.004, "step": 10800 }, { "epoch": 0.8, "grad_norm": 6.944069862365723, "learning_rate": 0.0001405248293179253, "loss": 3.1757, "step": 10810 }, { "epoch": 0.8, "grad_norm": 7.533534526824951, "learning_rate": 0.00014041313251566845, "loss": 2.9995, "step": 10820 }, { "epoch": 0.8, "grad_norm": 6.755417346954346, "learning_rate": 0.00014030137541855346, "loss": 3.1326, "step": 10830 }, { "epoch": 0.8, "grad_norm": 8.288308143615723, "learning_rate": 0.00014018955819331764, "loss": 2.7772, "step": 10840 }, { "epoch": 0.8, "grad_norm": 3.5482583045959473, "learning_rate": 0.00014007768100678805, "loss": 2.8674, "step": 10850 }, { "epoch": 0.8, "grad_norm": 4.020620346069336, "learning_rate": 0.0001399657440258812, "loss": 3.028, "step": 10860 }, { "epoch": 0.8, "grad_norm": 7.0991315841674805, "learning_rate": 0.00013985374741760283, "loss": 3.1083, "step": 10870 }, { "epoch": 0.8, "grad_norm": 7.445100784301758, "learning_rate": 0.00013974169134904765, "loss": 2.6173, "step": 10880 }, { "epoch": 0.8, "grad_norm": 4.649611949920654, "learning_rate": 0.000139629575987399, "loss": 2.9081, "step": 10890 }, { "epoch": 0.81, "grad_norm": 6.424789905548096, "learning_rate": 0.00013951740149992876, "loss": 3.134, "step": 10900 }, { "epoch": 0.81, "grad_norm": 7.624310493469238, "learning_rate": 0.00013940516805399699, "loss": 3.1254, "step": 10910 }, { "epoch": 0.81, "grad_norm": 8.405814170837402, "learning_rate": 0.00013929287581705176, "loss": 3.1216, "step": 10920 }, { "epoch": 0.81, "grad_norm": 5.037896156311035, "learning_rate": 0.00013918052495662882, "loss": 2.7543, "step": 10930 }, { "epoch": 0.81, "grad_norm": 5.659261703491211, "learning_rate": 0.00013906811564035133, "loss": 3.0607, "step": 10940 }, { "epoch": 0.81, "grad_norm": 7.80034065246582, "learning_rate": 0.0001389556480359298, "loss": 2.9075, "step": 10950 }, { "epoch": 0.81, "grad_norm": 4.6370038986206055, "learning_rate": 0.00013884312231116156, "loss": 2.6178, "step": 10960 }, { "epoch": 0.81, "grad_norm": 5.196686744689941, "learning_rate": 0.00013873053863393072, "loss": 2.7758, "step": 10970 }, { "epoch": 0.81, "grad_norm": 6.2154083251953125, "learning_rate": 0.00013861789717220787, "loss": 3.1309, "step": 10980 }, { "epoch": 0.81, "grad_norm": 6.0769124031066895, "learning_rate": 0.0001385051980940498, "loss": 2.9105, "step": 10990 }, { "epoch": 0.81, "grad_norm": 16.503326416015625, "learning_rate": 0.00013839244156759923, "loss": 2.8583, "step": 11000 }, { "epoch": 0.81, "eval_loss": 2.930485963821411, "eval_runtime": 1135.5048, "eval_samples_per_second": 5.02, "eval_steps_per_second": 5.02, "step": 11000 }, { "epoch": 0.81, "grad_norm": 6.584379196166992, "learning_rate": 0.00013827962776108462, "loss": 2.7119, "step": 11010 }, { "epoch": 0.81, "grad_norm": 6.973694324493408, "learning_rate": 0.0001381667568428199, "loss": 2.7612, "step": 11020 }, { "epoch": 0.81, "grad_norm": 6.25327205657959, "learning_rate": 0.00013805382898120414, "loss": 3.2764, "step": 11030 }, { "epoch": 0.82, "grad_norm": 6.84330415725708, "learning_rate": 0.00013794084434472147, "loss": 2.8709, "step": 11040 }, { "epoch": 0.82, "grad_norm": 6.320117950439453, "learning_rate": 0.00013782780310194067, "loss": 3.0335, "step": 11050 }, { "epoch": 0.82, "grad_norm": 4.778736114501953, "learning_rate": 0.00013771470542151497, "loss": 2.9884, "step": 11060 }, { "epoch": 0.82, "grad_norm": 6.087406635284424, "learning_rate": 0.00013760155147218178, "loss": 2.9923, "step": 11070 }, { "epoch": 0.82, "grad_norm": 4.868623733520508, "learning_rate": 0.00013748834142276252, "loss": 2.829, "step": 11080 }, { "epoch": 0.82, "grad_norm": 5.565182209014893, "learning_rate": 0.00013737507544216233, "loss": 2.728, "step": 11090 }, { "epoch": 0.82, "grad_norm": 5.934764862060547, "learning_rate": 0.00013726175369936967, "loss": 2.8737, "step": 11100 }, { "epoch": 0.82, "grad_norm": 6.818757057189941, "learning_rate": 0.0001371483763634563, "loss": 2.6239, "step": 11110 }, { "epoch": 0.82, "grad_norm": 4.30825662612915, "learning_rate": 0.00013703494360357694, "loss": 2.8212, "step": 11120 }, { "epoch": 0.82, "grad_norm": 6.317237377166748, "learning_rate": 0.00013692145558896887, "loss": 2.7839, "step": 11130 }, { "epoch": 0.82, "grad_norm": 5.52744197845459, "learning_rate": 0.00013680791248895199, "loss": 3.1383, "step": 11140 }, { "epoch": 0.82, "grad_norm": 6.30517053604126, "learning_rate": 0.00013669431447292825, "loss": 2.7455, "step": 11150 }, { "epoch": 0.82, "grad_norm": 7.219874858856201, "learning_rate": 0.00013658066171038153, "loss": 2.8031, "step": 11160 }, { "epoch": 0.83, "grad_norm": 3.8619625568389893, "learning_rate": 0.00013646695437087754, "loss": 3.0624, "step": 11170 }, { "epoch": 0.83, "grad_norm": 9.413076400756836, "learning_rate": 0.00013635319262406318, "loss": 2.9665, "step": 11180 }, { "epoch": 0.83, "grad_norm": 9.219383239746094, "learning_rate": 0.00013623937663966677, "loss": 2.7616, "step": 11190 }, { "epoch": 0.83, "grad_norm": 5.262277126312256, "learning_rate": 0.00013612550658749736, "loss": 2.9674, "step": 11200 }, { "epoch": 0.83, "eval_loss": 2.9270477294921875, "eval_runtime": 1134.3819, "eval_samples_per_second": 5.025, "eval_steps_per_second": 5.025, "step": 11200 }, { "epoch": 0.83, "grad_norm": 4.998508453369141, "learning_rate": 0.00013601158263744478, "loss": 2.9739, "step": 11210 }, { "epoch": 0.83, "grad_norm": 6.7563300132751465, "learning_rate": 0.00013589760495947922, "loss": 3.0721, "step": 11220 }, { "epoch": 0.83, "grad_norm": 7.818253040313721, "learning_rate": 0.00013578357372365102, "loss": 2.9322, "step": 11230 }, { "epoch": 0.83, "grad_norm": 3.3956222534179688, "learning_rate": 0.0001356694891000905, "loss": 3.0327, "step": 11240 }, { "epoch": 0.83, "grad_norm": 3.3983898162841797, "learning_rate": 0.00013555535125900757, "loss": 2.5789, "step": 11250 }, { "epoch": 0.83, "grad_norm": 6.465611457824707, "learning_rate": 0.0001354411603706915, "loss": 3.0299, "step": 11260 }, { "epoch": 0.83, "grad_norm": 5.23297119140625, "learning_rate": 0.0001353269166055108, "loss": 2.8151, "step": 11270 }, { "epoch": 0.83, "grad_norm": 4.9944586753845215, "learning_rate": 0.00013521262013391287, "loss": 2.9416, "step": 11280 }, { "epoch": 0.83, "grad_norm": 3.9770894050598145, "learning_rate": 0.0001350982711264236, "loss": 2.7994, "step": 11290 }, { "epoch": 0.83, "grad_norm": 9.537381172180176, "learning_rate": 0.0001349838697536475, "loss": 2.87, "step": 11300 }, { "epoch": 0.84, "grad_norm": 5.436434745788574, "learning_rate": 0.00013486941618626693, "loss": 3.2234, "step": 11310 }, { "epoch": 0.84, "grad_norm": 6.111148834228516, "learning_rate": 0.00013475491059504233, "loss": 2.8924, "step": 11320 }, { "epoch": 0.84, "grad_norm": 12.326899528503418, "learning_rate": 0.0001346403531508117, "loss": 2.9485, "step": 11330 }, { "epoch": 0.84, "grad_norm": 9.468557357788086, "learning_rate": 0.00013452574402449038, "loss": 3.0239, "step": 11340 }, { "epoch": 0.84, "grad_norm": 8.779520988464355, "learning_rate": 0.00013441108338707087, "loss": 2.8417, "step": 11350 }, { "epoch": 0.84, "grad_norm": 5.909932613372803, "learning_rate": 0.0001342963714096224, "loss": 2.7175, "step": 11360 }, { "epoch": 0.84, "grad_norm": 5.584993362426758, "learning_rate": 0.00013418160826329093, "loss": 3.0146, "step": 11370 }, { "epoch": 0.84, "grad_norm": 6.520732402801514, "learning_rate": 0.00013406679411929873, "loss": 3.1017, "step": 11380 }, { "epoch": 0.84, "grad_norm": 4.61958122253418, "learning_rate": 0.0001339519291489441, "loss": 3.0017, "step": 11390 }, { "epoch": 0.84, "grad_norm": 4.826852321624756, "learning_rate": 0.0001338370135236013, "loss": 2.827, "step": 11400 }, { "epoch": 0.84, "eval_loss": 2.912285566329956, "eval_runtime": 1137.7963, "eval_samples_per_second": 5.01, "eval_steps_per_second": 5.01, "step": 11400 }, { "epoch": 0.84, "grad_norm": 7.968265533447266, "learning_rate": 0.00013372204741471996, "loss": 2.993, "step": 11410 }, { "epoch": 0.84, "grad_norm": 4.151234149932861, "learning_rate": 0.00013360703099382518, "loss": 3.0601, "step": 11420 }, { "epoch": 0.84, "grad_norm": 4.17539119720459, "learning_rate": 0.00013349196443251718, "loss": 2.9077, "step": 11430 }, { "epoch": 0.85, "grad_norm": 6.504483222961426, "learning_rate": 0.00013337684790247075, "loss": 2.9594, "step": 11440 }, { "epoch": 0.85, "grad_norm": 5.325105667114258, "learning_rate": 0.0001332616815754355, "loss": 2.8264, "step": 11450 }, { "epoch": 0.85, "grad_norm": 7.66379976272583, "learning_rate": 0.00013314646562323517, "loss": 2.8312, "step": 11460 }, { "epoch": 0.85, "grad_norm": 6.964573383331299, "learning_rate": 0.0001330312002177675, "loss": 2.6644, "step": 11470 }, { "epoch": 0.85, "grad_norm": 7.418605327606201, "learning_rate": 0.00013291588553100426, "loss": 2.848, "step": 11480 }, { "epoch": 0.85, "grad_norm": 12.711461067199707, "learning_rate": 0.0001328005217349905, "loss": 3.0142, "step": 11490 }, { "epoch": 0.85, "grad_norm": 4.92010498046875, "learning_rate": 0.00013268510900184459, "loss": 2.8017, "step": 11500 }, { "epoch": 0.85, "grad_norm": 5.789633274078369, "learning_rate": 0.00013256964750375797, "loss": 3.1904, "step": 11510 }, { "epoch": 0.85, "grad_norm": 11.26569652557373, "learning_rate": 0.0001324541374129948, "loss": 2.9227, "step": 11520 }, { "epoch": 0.85, "grad_norm": 4.300714492797852, "learning_rate": 0.00013233857890189177, "loss": 2.738, "step": 11530 }, { "epoch": 0.85, "grad_norm": 8.24052619934082, "learning_rate": 0.00013222297214285776, "loss": 3.1162, "step": 11540 }, { "epoch": 0.85, "grad_norm": 6.717054843902588, "learning_rate": 0.00013210731730837368, "loss": 3.1639, "step": 11550 }, { "epoch": 0.85, "grad_norm": 9.139569282531738, "learning_rate": 0.0001319916145709921, "loss": 2.9694, "step": 11560 }, { "epoch": 0.85, "grad_norm": 4.700305461883545, "learning_rate": 0.00013187586410333724, "loss": 2.674, "step": 11570 }, { "epoch": 0.86, "grad_norm": 6.384634971618652, "learning_rate": 0.00013176006607810425, "loss": 3.0417, "step": 11580 }, { "epoch": 0.86, "grad_norm": 7.221315860748291, "learning_rate": 0.00013164422066805947, "loss": 3.3196, "step": 11590 }, { "epoch": 0.86, "grad_norm": 6.894277095794678, "learning_rate": 0.0001315283280460398, "loss": 2.7332, "step": 11600 }, { "epoch": 0.86, "eval_loss": 2.915705919265747, "eval_runtime": 1137.3676, "eval_samples_per_second": 5.012, "eval_steps_per_second": 5.012, "step": 11600 }, { "epoch": 0.86, "grad_norm": 6.271778583526611, "learning_rate": 0.00013141238838495264, "loss": 3.0482, "step": 11610 }, { "epoch": 0.86, "grad_norm": 7.282876014709473, "learning_rate": 0.00013129640185777564, "loss": 2.7195, "step": 11620 }, { "epoch": 0.86, "grad_norm": 8.754749298095703, "learning_rate": 0.00013118036863755614, "loss": 3.1873, "step": 11630 }, { "epoch": 0.86, "grad_norm": 6.130650520324707, "learning_rate": 0.00013106428889741144, "loss": 3.0263, "step": 11640 }, { "epoch": 0.86, "grad_norm": 7.188558101654053, "learning_rate": 0.000130948162810528, "loss": 2.8634, "step": 11650 }, { "epoch": 0.86, "grad_norm": 9.350152969360352, "learning_rate": 0.00013083199055016154, "loss": 3.2323, "step": 11660 }, { "epoch": 0.86, "grad_norm": 7.754179954528809, "learning_rate": 0.00013071577228963678, "loss": 3.0035, "step": 11670 }, { "epoch": 0.86, "grad_norm": 8.125720024108887, "learning_rate": 0.00013059950820234678, "loss": 3.264, "step": 11680 }, { "epoch": 0.86, "grad_norm": 4.942266941070557, "learning_rate": 0.00013048319846175325, "loss": 2.7955, "step": 11690 }, { "epoch": 0.86, "grad_norm": 6.1011505126953125, "learning_rate": 0.00013036684324138587, "loss": 2.6444, "step": 11700 }, { "epoch": 0.87, "grad_norm": 5.939935207366943, "learning_rate": 0.0001302504427148422, "loss": 2.8813, "step": 11710 }, { "epoch": 0.87, "grad_norm": 8.676549911499023, "learning_rate": 0.0001301339970557874, "loss": 2.7569, "step": 11720 }, { "epoch": 0.87, "grad_norm": 8.003786087036133, "learning_rate": 0.000130017506437954, "loss": 2.7625, "step": 11730 }, { "epoch": 0.87, "grad_norm": 4.292322635650635, "learning_rate": 0.00012990097103514155, "loss": 2.9883, "step": 11740 }, { "epoch": 0.87, "grad_norm": 5.578572750091553, "learning_rate": 0.00012978439102121647, "loss": 3.4115, "step": 11750 }, { "epoch": 0.87, "grad_norm": 5.9065093994140625, "learning_rate": 0.00012966776657011167, "loss": 3.057, "step": 11760 }, { "epoch": 0.87, "grad_norm": 4.266748428344727, "learning_rate": 0.0001295510978558264, "loss": 2.9653, "step": 11770 }, { "epoch": 0.87, "grad_norm": 5.894644737243652, "learning_rate": 0.000129434385052426, "loss": 2.9065, "step": 11780 }, { "epoch": 0.87, "grad_norm": 5.477922439575195, "learning_rate": 0.00012931762833404148, "loss": 2.9249, "step": 11790 }, { "epoch": 0.87, "grad_norm": 4.732699871063232, "learning_rate": 0.00012920082787486948, "loss": 2.8734, "step": 11800 }, { "epoch": 0.87, "eval_loss": 2.905906915664673, "eval_runtime": 1138.8177, "eval_samples_per_second": 5.005, "eval_steps_per_second": 5.005, "step": 11800 }, { "epoch": 0.87, "grad_norm": 5.697981834411621, "learning_rate": 0.0001290839838491718, "loss": 2.843, "step": 11810 }, { "epoch": 0.87, "grad_norm": 5.219038009643555, "learning_rate": 0.00012896709643127528, "loss": 3.123, "step": 11820 }, { "epoch": 0.87, "grad_norm": 5.130221843719482, "learning_rate": 0.00012885016579557162, "loss": 2.8452, "step": 11830 }, { "epoch": 0.87, "grad_norm": 10.45068645477295, "learning_rate": 0.00012873319211651672, "loss": 3.0178, "step": 11840 }, { "epoch": 0.88, "grad_norm": 6.096733570098877, "learning_rate": 0.000128616175568631, "loss": 2.8138, "step": 11850 }, { "epoch": 0.88, "grad_norm": 5.896446228027344, "learning_rate": 0.0001284991163264986, "loss": 3.3727, "step": 11860 }, { "epoch": 0.88, "grad_norm": 10.954285621643066, "learning_rate": 0.00012838201456476752, "loss": 2.6517, "step": 11870 }, { "epoch": 0.88, "grad_norm": 8.56272029876709, "learning_rate": 0.00012826487045814914, "loss": 3.3007, "step": 11880 }, { "epoch": 0.88, "grad_norm": 4.866158485412598, "learning_rate": 0.000128147684181418, "loss": 2.8063, "step": 11890 }, { "epoch": 0.88, "grad_norm": 4.69535493850708, "learning_rate": 0.00012803045590941157, "loss": 2.5951, "step": 11900 }, { "epoch": 0.88, "grad_norm": 5.791335582733154, "learning_rate": 0.00012791318581702998, "loss": 2.9769, "step": 11910 }, { "epoch": 0.88, "grad_norm": 10.670564651489258, "learning_rate": 0.0001277958740792357, "loss": 2.9634, "step": 11920 }, { "epoch": 0.88, "grad_norm": 9.301645278930664, "learning_rate": 0.00012767852087105353, "loss": 2.6926, "step": 11930 }, { "epoch": 0.88, "grad_norm": 5.858110427856445, "learning_rate": 0.00012756112636756989, "loss": 2.7778, "step": 11940 }, { "epoch": 0.88, "grad_norm": 5.246842384338379, "learning_rate": 0.00012744369074393292, "loss": 2.693, "step": 11950 }, { "epoch": 0.88, "grad_norm": 7.218985557556152, "learning_rate": 0.00012732621417535213, "loss": 2.9016, "step": 11960 }, { "epoch": 0.88, "grad_norm": 5.314725399017334, "learning_rate": 0.00012720869683709808, "loss": 2.3808, "step": 11970 }, { "epoch": 0.88, "grad_norm": 10.086341857910156, "learning_rate": 0.0001270911389045022, "loss": 2.9053, "step": 11980 }, { "epoch": 0.89, "grad_norm": 4.592552661895752, "learning_rate": 0.00012697354055295646, "loss": 2.8766, "step": 11990 }, { "epoch": 0.89, "grad_norm": 5.684471130371094, "learning_rate": 0.00012685590195791308, "loss": 3.0623, "step": 12000 }, { "epoch": 0.89, "eval_loss": 2.904792308807373, "eval_runtime": 1137.2933, "eval_samples_per_second": 5.012, "eval_steps_per_second": 5.012, "step": 12000 }, { "epoch": 0.89, "grad_norm": 8.804437637329102, "learning_rate": 0.00012673822329488442, "loss": 3.2498, "step": 12010 }, { "epoch": 0.89, "grad_norm": 8.336959838867188, "learning_rate": 0.00012662050473944257, "loss": 3.0255, "step": 12020 }, { "epoch": 0.89, "grad_norm": 6.271881103515625, "learning_rate": 0.00012650274646721914, "loss": 2.5491, "step": 12030 }, { "epoch": 0.89, "grad_norm": 5.716142654418945, "learning_rate": 0.00012638494865390497, "loss": 2.6117, "step": 12040 }, { "epoch": 0.89, "grad_norm": 4.2103800773620605, "learning_rate": 0.00012626711147524996, "loss": 2.7738, "step": 12050 }, { "epoch": 0.89, "grad_norm": 5.132654666900635, "learning_rate": 0.00012614923510706269, "loss": 2.7955, "step": 12060 }, { "epoch": 0.89, "grad_norm": 6.06005859375, "learning_rate": 0.00012603131972521023, "loss": 3.0637, "step": 12070 }, { "epoch": 0.89, "grad_norm": 5.199472427368164, "learning_rate": 0.00012591336550561784, "loss": 2.6771, "step": 12080 }, { "epoch": 0.89, "grad_norm": 9.783750534057617, "learning_rate": 0.0001257953726242687, "loss": 3.0937, "step": 12090 }, { "epoch": 0.89, "grad_norm": 7.431953430175781, "learning_rate": 0.0001256773412572038, "loss": 3.0264, "step": 12100 }, { "epoch": 0.89, "grad_norm": 4.1111979484558105, "learning_rate": 0.00012555927158052133, "loss": 2.7148, "step": 12110 }, { "epoch": 0.9, "grad_norm": 8.789063453674316, "learning_rate": 0.00012544116377037688, "loss": 3.0186, "step": 12120 }, { "epoch": 0.9, "grad_norm": 6.812503337860107, "learning_rate": 0.0001253230180029827, "loss": 3.1154, "step": 12130 }, { "epoch": 0.9, "grad_norm": 5.980816841125488, "learning_rate": 0.00012520483445460786, "loss": 2.864, "step": 12140 }, { "epoch": 0.9, "grad_norm": 4.336915493011475, "learning_rate": 0.00012508661330157774, "loss": 2.7639, "step": 12150 }, { "epoch": 0.9, "grad_norm": 4.914273738861084, "learning_rate": 0.00012496835472027376, "loss": 3.1715, "step": 12160 }, { "epoch": 0.9, "grad_norm": 6.842685699462891, "learning_rate": 0.0001248500588871333, "loss": 3.0072, "step": 12170 }, { "epoch": 0.9, "grad_norm": 9.586161613464355, "learning_rate": 0.0001247317259786491, "loss": 2.7299, "step": 12180 }, { "epoch": 0.9, "grad_norm": 4.659690856933594, "learning_rate": 0.0001246133561713695, "loss": 2.7587, "step": 12190 }, { "epoch": 0.9, "grad_norm": 5.354196548461914, "learning_rate": 0.00012449494964189773, "loss": 2.8163, "step": 12200 }, { "epoch": 0.9, "eval_loss": 2.8869693279266357, "eval_runtime": 1135.7184, "eval_samples_per_second": 5.019, "eval_steps_per_second": 5.019, "step": 12200 }, { "epoch": 0.9, "grad_norm": 5.862390041351318, "learning_rate": 0.00012437650656689183, "loss": 3.0432, "step": 12210 }, { "epoch": 0.9, "grad_norm": 6.009708404541016, "learning_rate": 0.00012425802712306432, "loss": 2.726, "step": 12220 }, { "epoch": 0.9, "grad_norm": 7.788062572479248, "learning_rate": 0.0001241395114871821, "loss": 2.4635, "step": 12230 }, { "epoch": 0.9, "grad_norm": 7.147851467132568, "learning_rate": 0.00012402095983606593, "loss": 2.8183, "step": 12240 }, { "epoch": 0.9, "grad_norm": 4.320078372955322, "learning_rate": 0.00012390237234659042, "loss": 2.8154, "step": 12250 }, { "epoch": 0.91, "grad_norm": 5.1208062171936035, "learning_rate": 0.00012378374919568355, "loss": 2.8344, "step": 12260 }, { "epoch": 0.91, "grad_norm": 7.409857273101807, "learning_rate": 0.0001236650905603266, "loss": 2.8191, "step": 12270 }, { "epoch": 0.91, "grad_norm": 4.807343006134033, "learning_rate": 0.0001235463966175537, "loss": 3.158, "step": 12280 }, { "epoch": 0.91, "grad_norm": 7.55764627456665, "learning_rate": 0.00012342766754445175, "loss": 2.8936, "step": 12290 }, { "epoch": 0.91, "grad_norm": 4.045491695404053, "learning_rate": 0.00012330890351815998, "loss": 2.925, "step": 12300 }, { "epoch": 0.91, "grad_norm": 5.34037446975708, "learning_rate": 0.00012319010471586984, "loss": 3.0233, "step": 12310 }, { "epoch": 0.91, "grad_norm": 5.470011234283447, "learning_rate": 0.00012307127131482457, "loss": 3.0561, "step": 12320 }, { "epoch": 0.91, "grad_norm": 3.815101146697998, "learning_rate": 0.00012295240349231918, "loss": 2.4855, "step": 12330 }, { "epoch": 0.91, "grad_norm": 5.214379787445068, "learning_rate": 0.00012283350142569982, "loss": 2.8585, "step": 12340 }, { "epoch": 0.91, "grad_norm": 5.9461541175842285, "learning_rate": 0.00012271456529236398, "loss": 2.9515, "step": 12350 }, { "epoch": 0.91, "grad_norm": 7.110766410827637, "learning_rate": 0.00012259559526975978, "loss": 3.0395, "step": 12360 }, { "epoch": 0.91, "grad_norm": 5.845677375793457, "learning_rate": 0.000122476591535386, "loss": 2.7167, "step": 12370 }, { "epoch": 0.91, "grad_norm": 5.942660808563232, "learning_rate": 0.00012235755426679166, "loss": 2.7902, "step": 12380 }, { "epoch": 0.92, "grad_norm": 8.613824844360352, "learning_rate": 0.00012223848364157592, "loss": 2.8209, "step": 12390 }, { "epoch": 0.92, "grad_norm": 9.6761474609375, "learning_rate": 0.00012211937983738752, "loss": 2.9448, "step": 12400 }, { "epoch": 0.92, "eval_loss": 2.8819024562835693, "eval_runtime": 1137.1197, "eval_samples_per_second": 5.013, "eval_steps_per_second": 5.013, "step": 12400 }, { "epoch": 0.92, "grad_norm": 6.138139247894287, "learning_rate": 0.00012200024303192488, "loss": 2.7694, "step": 12410 }, { "epoch": 0.92, "grad_norm": 5.604335308074951, "learning_rate": 0.00012188107340293555, "loss": 2.7826, "step": 12420 }, { "epoch": 0.92, "grad_norm": 6.146926403045654, "learning_rate": 0.00012176187112821611, "loss": 2.725, "step": 12430 }, { "epoch": 0.92, "grad_norm": 6.235223770141602, "learning_rate": 0.00012164263638561184, "loss": 3.0731, "step": 12440 }, { "epoch": 0.92, "grad_norm": 8.349669456481934, "learning_rate": 0.00012152336935301644, "loss": 2.9744, "step": 12450 }, { "epoch": 0.92, "grad_norm": 4.022830486297607, "learning_rate": 0.00012140407020837177, "loss": 2.8294, "step": 12460 }, { "epoch": 0.92, "grad_norm": 4.709907054901123, "learning_rate": 0.0001212847391296676, "loss": 3.1276, "step": 12470 }, { "epoch": 0.92, "grad_norm": 5.7833404541015625, "learning_rate": 0.0001211653762949414, "loss": 2.728, "step": 12480 }, { "epoch": 0.92, "grad_norm": 5.090959072113037, "learning_rate": 0.000121045981882278, "loss": 2.7932, "step": 12490 }, { "epoch": 0.92, "grad_norm": 6.4102654457092285, "learning_rate": 0.00012092655606980931, "loss": 3.067, "step": 12500 }, { "epoch": 0.92, "grad_norm": 3.2918288707733154, "learning_rate": 0.0001208070990357141, "loss": 2.7084, "step": 12510 }, { "epoch": 0.92, "grad_norm": 4.93757963180542, "learning_rate": 0.00012068761095821772, "loss": 2.7426, "step": 12520 }, { "epoch": 0.93, "grad_norm": 4.599313259124756, "learning_rate": 0.00012056809201559183, "loss": 2.8432, "step": 12530 }, { "epoch": 0.93, "grad_norm": 5.336906433105469, "learning_rate": 0.00012044854238615417, "loss": 2.6692, "step": 12540 }, { "epoch": 0.93, "grad_norm": 6.711155891418457, "learning_rate": 0.00012032896224826827, "loss": 2.888, "step": 12550 }, { "epoch": 0.93, "grad_norm": 4.558686256408691, "learning_rate": 0.0001202093517803431, "loss": 2.5864, "step": 12560 }, { "epoch": 0.93, "grad_norm": 11.784100532531738, "learning_rate": 0.00012008971116083299, "loss": 2.9601, "step": 12570 }, { "epoch": 0.93, "grad_norm": 6.828344345092773, "learning_rate": 0.00011997004056823713, "loss": 2.7396, "step": 12580 }, { "epoch": 0.93, "grad_norm": 7.140361309051514, "learning_rate": 0.00011985034018109956, "loss": 2.654, "step": 12590 }, { "epoch": 0.93, "grad_norm": 4.436099529266357, "learning_rate": 0.00011973061017800866, "loss": 2.6084, "step": 12600 }, { "epoch": 0.93, "eval_loss": 2.8805291652679443, "eval_runtime": 1136.5894, "eval_samples_per_second": 5.015, "eval_steps_per_second": 5.015, "step": 12600 }, { "epoch": 0.93, "grad_norm": 7.968447208404541, "learning_rate": 0.00011961085073759708, "loss": 2.8732, "step": 12610 }, { "epoch": 0.93, "grad_norm": 7.53559684753418, "learning_rate": 0.00011949106203854136, "loss": 2.8639, "step": 12620 }, { "epoch": 0.93, "grad_norm": 5.95030403137207, "learning_rate": 0.00011937124425956165, "loss": 2.6471, "step": 12630 }, { "epoch": 0.93, "grad_norm": 8.227439880371094, "learning_rate": 0.00011925139757942156, "loss": 3.1835, "step": 12640 }, { "epoch": 0.93, "grad_norm": 3.934840679168701, "learning_rate": 0.00011913152217692775, "loss": 2.8887, "step": 12650 }, { "epoch": 0.94, "grad_norm": 6.063136100769043, "learning_rate": 0.00011901161823092979, "loss": 3.0296, "step": 12660 }, { "epoch": 0.94, "grad_norm": 9.32559871673584, "learning_rate": 0.00011889168592031983, "loss": 2.9871, "step": 12670 }, { "epoch": 0.94, "grad_norm": 8.128053665161133, "learning_rate": 0.00011877172542403228, "loss": 2.8351, "step": 12680 }, { "epoch": 0.94, "grad_norm": 9.050593376159668, "learning_rate": 0.00011865173692104364, "loss": 3.134, "step": 12690 }, { "epoch": 0.94, "grad_norm": 4.40614128112793, "learning_rate": 0.00011853172059037224, "loss": 2.743, "step": 12700 }, { "epoch": 0.94, "grad_norm": 4.777544975280762, "learning_rate": 0.00011841167661107784, "loss": 2.7829, "step": 12710 }, { "epoch": 0.94, "grad_norm": 5.10864782333374, "learning_rate": 0.00011829160516226153, "loss": 2.8182, "step": 12720 }, { "epoch": 0.94, "grad_norm": 3.8802578449249268, "learning_rate": 0.00011817150642306531, "loss": 2.7498, "step": 12730 }, { "epoch": 0.94, "grad_norm": 9.293874740600586, "learning_rate": 0.000118051380572672, "loss": 3.1483, "step": 12740 }, { "epoch": 0.94, "grad_norm": 6.355398654937744, "learning_rate": 0.00011793122779030475, "loss": 2.9183, "step": 12750 }, { "epoch": 0.94, "grad_norm": 5.404056549072266, "learning_rate": 0.00011781104825522695, "loss": 2.761, "step": 12760 }, { "epoch": 0.94, "grad_norm": 5.423532009124756, "learning_rate": 0.00011769084214674189, "loss": 3.0413, "step": 12770 }, { "epoch": 0.94, "grad_norm": 5.6372199058532715, "learning_rate": 0.00011757060964419258, "loss": 2.9426, "step": 12780 }, { "epoch": 0.94, "grad_norm": 8.241491317749023, "learning_rate": 0.00011745035092696129, "loss": 2.6652, "step": 12790 }, { "epoch": 0.95, "grad_norm": 4.501625061035156, "learning_rate": 0.00011733006617446947, "loss": 2.7831, "step": 12800 }, { "epoch": 0.95, "eval_loss": 2.8682727813720703, "eval_runtime": 1135.344, "eval_samples_per_second": 5.021, "eval_steps_per_second": 5.021, "step": 12800 }, { "epoch": 0.95, "grad_norm": 4.504491329193115, "learning_rate": 0.0001172097555661774, "loss": 2.839, "step": 12810 }, { "epoch": 0.95, "grad_norm": 6.712375640869141, "learning_rate": 0.00011708941928158393, "loss": 2.8777, "step": 12820 }, { "epoch": 0.95, "grad_norm": 5.017134189605713, "learning_rate": 0.00011696905750022624, "loss": 2.9566, "step": 12830 }, { "epoch": 0.95, "grad_norm": 5.9697747230529785, "learning_rate": 0.0001168486704016795, "loss": 2.7984, "step": 12840 }, { "epoch": 0.95, "grad_norm": 6.94989013671875, "learning_rate": 0.00011672825816555672, "loss": 2.8068, "step": 12850 }, { "epoch": 0.95, "grad_norm": 4.509193420410156, "learning_rate": 0.00011660782097150842, "loss": 2.7397, "step": 12860 }, { "epoch": 0.95, "grad_norm": 4.793773651123047, "learning_rate": 0.00011648735899922221, "loss": 3.0144, "step": 12870 }, { "epoch": 0.95, "grad_norm": 5.6054792404174805, "learning_rate": 0.00011636687242842286, "loss": 2.7915, "step": 12880 }, { "epoch": 0.95, "grad_norm": 3.980593204498291, "learning_rate": 0.00011624636143887174, "loss": 2.6483, "step": 12890 }, { "epoch": 0.95, "grad_norm": 3.5728085041046143, "learning_rate": 0.00011612582621036665, "loss": 2.685, "step": 12900 }, { "epoch": 0.95, "grad_norm": 10.15241527557373, "learning_rate": 0.00011600526692274158, "loss": 3.0063, "step": 12910 }, { "epoch": 0.95, "grad_norm": 8.541998863220215, "learning_rate": 0.00011588468375586638, "loss": 3.0572, "step": 12920 }, { "epoch": 0.96, "grad_norm": 7.413809299468994, "learning_rate": 0.00011576407688964661, "loss": 2.5417, "step": 12930 }, { "epoch": 0.96, "grad_norm": 4.749917984008789, "learning_rate": 0.0001156434465040231, "loss": 2.694, "step": 12940 }, { "epoch": 0.96, "grad_norm": 7.283080101013184, "learning_rate": 0.0001155227927789718, "loss": 2.8336, "step": 12950 }, { "epoch": 0.96, "grad_norm": 4.781662464141846, "learning_rate": 0.0001154021158945035, "loss": 2.6173, "step": 12960 }, { "epoch": 0.96, "grad_norm": 6.650935173034668, "learning_rate": 0.00011528141603066347, "loss": 2.8605, "step": 12970 }, { "epoch": 0.96, "grad_norm": 6.372498035430908, "learning_rate": 0.00011516069336753137, "loss": 2.9947, "step": 12980 }, { "epoch": 0.96, "grad_norm": 4.832932949066162, "learning_rate": 0.00011505202362618099, "loss": 2.7986, "step": 12990 }, { "epoch": 0.96, "grad_norm": 6.009823799133301, "learning_rate": 0.00011493125814063493, "loss": 2.9087, "step": 13000 }, { "epoch": 0.96, "eval_loss": 2.854703664779663, "eval_runtime": 1138.6761, "eval_samples_per_second": 5.006, "eval_steps_per_second": 5.006, "step": 13000 }, { "epoch": 0.96, "grad_norm": 7.64834451675415, "learning_rate": 0.000114810470378219, "loss": 2.7787, "step": 13010 }, { "epoch": 0.96, "grad_norm": 6.409843921661377, "learning_rate": 0.00011468966051914405, "loss": 3.1866, "step": 13020 }, { "epoch": 0.96, "grad_norm": 10.589412689208984, "learning_rate": 0.00011456882874365376, "loss": 2.9176, "step": 13030 }, { "epoch": 0.96, "grad_norm": 5.453351974487305, "learning_rate": 0.00011444797523202453, "loss": 2.7734, "step": 13040 }, { "epoch": 0.96, "grad_norm": 7.665455341339111, "learning_rate": 0.00011432710016456525, "loss": 3.082, "step": 13050 }, { "epoch": 0.96, "grad_norm": 6.119209289550781, "learning_rate": 0.00011420620372161688, "loss": 2.931, "step": 13060 }, { "epoch": 0.97, "grad_norm": 3.2885162830352783, "learning_rate": 0.00011408528608355236, "loss": 2.4232, "step": 13070 }, { "epoch": 0.97, "grad_norm": 6.569406986236572, "learning_rate": 0.0001139643474307762, "loss": 2.7764, "step": 13080 }, { "epoch": 0.97, "grad_norm": 6.823148727416992, "learning_rate": 0.00011384338794372426, "loss": 2.9104, "step": 13090 }, { "epoch": 0.97, "grad_norm": 13.69426155090332, "learning_rate": 0.00011372240780286349, "loss": 2.8509, "step": 13100 }, { "epoch": 0.97, "grad_norm": 5.851162433624268, "learning_rate": 0.0001136014071886917, "loss": 3.2161, "step": 13110 }, { "epoch": 0.97, "grad_norm": 10.145004272460938, "learning_rate": 0.0001134803862817372, "loss": 2.968, "step": 13120 }, { "epoch": 0.97, "grad_norm": 6.563608646392822, "learning_rate": 0.00011335934526255858, "loss": 2.7827, "step": 13130 }, { "epoch": 0.97, "grad_norm": 4.670830726623535, "learning_rate": 0.00011323828431174441, "loss": 2.9768, "step": 13140 }, { "epoch": 0.97, "grad_norm": 9.791251182556152, "learning_rate": 0.00011311720360991306, "loss": 3.0329, "step": 13150 }, { "epoch": 0.97, "grad_norm": 4.974820137023926, "learning_rate": 0.00011299610333771238, "loss": 3.0875, "step": 13160 }, { "epoch": 0.97, "grad_norm": 6.610928058624268, "learning_rate": 0.00011287498367581928, "loss": 2.8692, "step": 13170 }, { "epoch": 0.97, "grad_norm": 6.3965911865234375, "learning_rate": 0.00011275384480493976, "loss": 3.0095, "step": 13180 }, { "epoch": 0.97, "grad_norm": 7.755321979522705, "learning_rate": 0.00011263268690580837, "loss": 2.8522, "step": 13190 }, { "epoch": 0.98, "grad_norm": 6.5569539070129395, "learning_rate": 0.00011251151015918811, "loss": 3.2111, "step": 13200 }, { "epoch": 0.98, "eval_loss": 2.845184087753296, "eval_runtime": 1136.0132, "eval_samples_per_second": 5.018, "eval_steps_per_second": 5.018, "step": 13200 }, { "epoch": 0.98, "grad_norm": 5.710137367248535, "learning_rate": 0.00011239031474587014, "loss": 3.0802, "step": 13210 }, { "epoch": 0.98, "grad_norm": 8.29128646850586, "learning_rate": 0.0001122691008466733, "loss": 3.2867, "step": 13220 }, { "epoch": 0.98, "grad_norm": 5.905947208404541, "learning_rate": 0.0001121478686424442, "loss": 2.9385, "step": 13230 }, { "epoch": 0.98, "grad_norm": 5.681633472442627, "learning_rate": 0.00011202661831405668, "loss": 2.8288, "step": 13240 }, { "epoch": 0.98, "grad_norm": 6.492409706115723, "learning_rate": 0.00011190535004241157, "loss": 3.067, "step": 13250 }, { "epoch": 0.98, "grad_norm": 9.93946647644043, "learning_rate": 0.00011178406400843657, "loss": 3.045, "step": 13260 }, { "epoch": 0.98, "grad_norm": 8.157313346862793, "learning_rate": 0.00011166276039308585, "loss": 2.7287, "step": 13270 }, { "epoch": 0.98, "grad_norm": 7.452297687530518, "learning_rate": 0.00011154143937733974, "loss": 2.6611, "step": 13280 }, { "epoch": 0.98, "grad_norm": 4.351617336273193, "learning_rate": 0.00011142010114220462, "loss": 2.6843, "step": 13290 }, { "epoch": 0.98, "grad_norm": 6.279202938079834, "learning_rate": 0.00011129874586871251, "loss": 2.8017, "step": 13300 }, { "epoch": 0.98, "grad_norm": 6.140538215637207, "learning_rate": 0.0001111773737379209, "loss": 3.0927, "step": 13310 }, { "epoch": 0.98, "grad_norm": 6.171574115753174, "learning_rate": 0.00011105598493091235, "loss": 2.8466, "step": 13320 }, { "epoch": 0.98, "grad_norm": 6.33689022064209, "learning_rate": 0.00011093457962879442, "loss": 3.0005, "step": 13330 }, { "epoch": 0.99, "grad_norm": 5.905701160430908, "learning_rate": 0.00011081315801269911, "loss": 2.6632, "step": 13340 }, { "epoch": 0.99, "grad_norm": 4.605526924133301, "learning_rate": 0.00011069172026378294, "loss": 2.8175, "step": 13350 }, { "epoch": 0.99, "grad_norm": 4.614380836486816, "learning_rate": 0.00011057026656322636, "loss": 2.9349, "step": 13360 }, { "epoch": 0.99, "grad_norm": 4.65227746963501, "learning_rate": 0.0001104487970922337, "loss": 2.6209, "step": 13370 }, { "epoch": 0.99, "grad_norm": 3.7751355171203613, "learning_rate": 0.00011032731203203281, "loss": 2.8983, "step": 13380 }, { "epoch": 0.99, "grad_norm": 6.04954719543457, "learning_rate": 0.00011020581156387474, "loss": 2.9577, "step": 13390 }, { "epoch": 0.99, "grad_norm": 7.594507217407227, "learning_rate": 0.00011008429586903366, "loss": 3.0118, "step": 13400 }, { "epoch": 0.99, "eval_loss": 2.8346240520477295, "eval_runtime": 1137.8991, "eval_samples_per_second": 5.009, "eval_steps_per_second": 5.009, "step": 13400 }, { "epoch": 0.99, "grad_norm": 4.153735637664795, "learning_rate": 0.00010996276512880626, "loss": 2.5844, "step": 13410 }, { "epoch": 0.99, "grad_norm": 9.582086563110352, "learning_rate": 0.00010984121952451187, "loss": 2.7306, "step": 13420 }, { "epoch": 0.99, "grad_norm": 7.080514907836914, "learning_rate": 0.00010971965923749188, "loss": 3.1918, "step": 13430 }, { "epoch": 0.99, "grad_norm": 6.384931564331055, "learning_rate": 0.00010959808444910957, "loss": 2.8799, "step": 13440 }, { "epoch": 0.99, "grad_norm": 8.869901657104492, "learning_rate": 0.00010947649534075005, "loss": 2.9436, "step": 13450 }, { "epoch": 0.99, "grad_norm": 6.180183410644531, "learning_rate": 0.00010935489209381947, "loss": 2.6373, "step": 13460 }, { "epoch": 1.0, "grad_norm": 5.366621017456055, "learning_rate": 0.00010923327488974537, "loss": 2.9848, "step": 13470 }, { "epoch": 1.0, "grad_norm": 10.306673049926758, "learning_rate": 0.00010911164390997596, "loss": 3.0342, "step": 13480 }, { "epoch": 1.0, "grad_norm": 8.145923614501953, "learning_rate": 0.00010898999933598004, "loss": 2.708, "step": 13490 }, { "epoch": 1.0, "grad_norm": 7.033836364746094, "learning_rate": 0.00010886834134924675, "loss": 2.7688, "step": 13500 }, { "epoch": 1.0, "grad_norm": 5.030039310455322, "learning_rate": 0.00010874667013128508, "loss": 2.508, "step": 13510 }, { "epoch": 1.0, "grad_norm": 6.092257022857666, "learning_rate": 0.00010862498586362395, "loss": 2.7908, "step": 13520 }, { "epoch": 1.0, "grad_norm": 8.369385719299316, "learning_rate": 0.00010850328872781161, "loss": 2.6625, "step": 13530 }, { "epoch": 1.0, "grad_norm": 6.076193332672119, "learning_rate": 0.00010838157890541558, "loss": 3.0781, "step": 13540 }, { "epoch": 1.0, "grad_norm": 5.35760498046875, "learning_rate": 0.0001082598565780223, "loss": 2.7686, "step": 13550 }, { "epoch": 1.0, "grad_norm": 6.823988437652588, "learning_rate": 0.00010813812192723686, "loss": 2.7569, "step": 13560 }, { "epoch": 1.0, "grad_norm": 4.118238925933838, "learning_rate": 0.00010801637513468272, "loss": 2.7056, "step": 13570 }, { "epoch": 1.0, "grad_norm": 6.218942165374756, "learning_rate": 0.00010789461638200146, "loss": 2.8498, "step": 13580 }, { "epoch": 1.0, "grad_norm": 4.8708086013793945, "learning_rate": 0.00010777284585085256, "loss": 2.5863, "step": 13590 }, { "epoch": 1.0, "grad_norm": 6.01025915145874, "learning_rate": 0.00010765106372291296, "loss": 2.6526, "step": 13600 }, { "epoch": 1.0, "eval_loss": 2.845993757247925, "eval_runtime": 1136.2008, "eval_samples_per_second": 5.017, "eval_steps_per_second": 5.017, "step": 13600 }, { "epoch": 1.01, "grad_norm": 4.704145431518555, "learning_rate": 0.000107529270179877, "loss": 2.4644, "step": 13610 }, { "epoch": 1.01, "grad_norm": 6.328924655914307, "learning_rate": 0.00010740746540345603, "loss": 2.6654, "step": 13620 }, { "epoch": 1.01, "grad_norm": 4.664566516876221, "learning_rate": 0.00010728564957537815, "loss": 2.9038, "step": 13630 }, { "epoch": 1.01, "grad_norm": 4.666599273681641, "learning_rate": 0.00010716382287738791, "loss": 2.5435, "step": 13640 }, { "epoch": 1.01, "grad_norm": 4.4863176345825195, "learning_rate": 0.00010704198549124614, "loss": 2.5579, "step": 13650 }, { "epoch": 1.01, "grad_norm": 6.503231048583984, "learning_rate": 0.00010692013759872961, "loss": 2.7717, "step": 13660 }, { "epoch": 1.01, "grad_norm": 6.730213642120361, "learning_rate": 0.0001067982793816307, "loss": 2.8792, "step": 13670 }, { "epoch": 1.01, "grad_norm": 4.679954528808594, "learning_rate": 0.00010667641102175724, "loss": 2.6506, "step": 13680 }, { "epoch": 1.01, "grad_norm": 7.457332611083984, "learning_rate": 0.00010655453270093227, "loss": 2.8192, "step": 13690 }, { "epoch": 1.01, "grad_norm": 6.174564361572266, "learning_rate": 0.00010643264460099351, "loss": 2.859, "step": 13700 }, { "epoch": 1.01, "grad_norm": 4.672980785369873, "learning_rate": 0.00010631074690379348, "loss": 2.8721, "step": 13710 }, { "epoch": 1.01, "grad_norm": 4.928731441497803, "learning_rate": 0.0001061888397911988, "loss": 2.537, "step": 13720 }, { "epoch": 1.01, "grad_norm": 3.9560954570770264, "learning_rate": 0.00010606692344509034, "loss": 2.4611, "step": 13730 }, { "epoch": 1.01, "grad_norm": 5.649095058441162, "learning_rate": 0.00010594499804736262, "loss": 2.6976, "step": 13740 }, { "epoch": 1.02, "grad_norm": 8.706733703613281, "learning_rate": 0.00010582306377992368, "loss": 2.4591, "step": 13750 }, { "epoch": 1.02, "grad_norm": 5.894099235534668, "learning_rate": 0.00010570112082469485, "loss": 2.6545, "step": 13760 }, { "epoch": 1.02, "grad_norm": 6.439949035644531, "learning_rate": 0.00010557916936361039, "loss": 2.6755, "step": 13770 }, { "epoch": 1.02, "grad_norm": 6.489779949188232, "learning_rate": 0.0001054572095786172, "loss": 2.4617, "step": 13780 }, { "epoch": 1.02, "grad_norm": 7.473913669586182, "learning_rate": 0.0001053352416516747, "loss": 2.6437, "step": 13790 }, { "epoch": 1.02, "grad_norm": 4.835104942321777, "learning_rate": 0.00010521326576475434, "loss": 2.6816, "step": 13800 }, { "epoch": 1.02, "eval_loss": 2.8399221897125244, "eval_runtime": 1134.199, "eval_samples_per_second": 5.026, "eval_steps_per_second": 5.026, "step": 13800 }, { "epoch": 1.02, "grad_norm": 10.159151077270508, "learning_rate": 0.00010509128209983956, "loss": 2.7679, "step": 13810 }, { "epoch": 1.02, "grad_norm": 5.414875507354736, "learning_rate": 0.00010496929083892535, "loss": 2.8924, "step": 13820 }, { "epoch": 1.02, "grad_norm": 7.980355262756348, "learning_rate": 0.00010484729216401803, "loss": 2.6418, "step": 13830 }, { "epoch": 1.02, "grad_norm": 5.9121413230896, "learning_rate": 0.00010472528625713498, "loss": 2.4819, "step": 13840 }, { "epoch": 1.02, "grad_norm": 3.6737613677978516, "learning_rate": 0.00010460327330030437, "loss": 2.557, "step": 13850 }, { "epoch": 1.02, "grad_norm": 6.475584506988525, "learning_rate": 0.00010448125347556488, "loss": 2.7248, "step": 13860 }, { "epoch": 1.02, "grad_norm": 3.3596487045288086, "learning_rate": 0.00010435922696496552, "loss": 2.5047, "step": 13870 }, { "epoch": 1.03, "grad_norm": 5.599161624908447, "learning_rate": 0.00010423719395056515, "loss": 2.61, "step": 13880 }, { "epoch": 1.03, "grad_norm": 6.242649555206299, "learning_rate": 0.00010411515461443237, "loss": 2.6723, "step": 13890 }, { "epoch": 1.03, "grad_norm": 7.319644927978516, "learning_rate": 0.00010399310913864532, "loss": 2.7631, "step": 13900 }, { "epoch": 1.03, "grad_norm": 5.141343116760254, "learning_rate": 0.00010387105770529113, "loss": 2.7829, "step": 13910 }, { "epoch": 1.03, "grad_norm": 5.021617889404297, "learning_rate": 0.00010374900049646592, "loss": 2.5408, "step": 13920 }, { "epoch": 1.03, "grad_norm": 7.208983421325684, "learning_rate": 0.00010362693769427446, "loss": 2.8004, "step": 13930 }, { "epoch": 1.03, "grad_norm": 5.373823642730713, "learning_rate": 0.00010350486948082972, "loss": 2.5771, "step": 13940 }, { "epoch": 1.03, "grad_norm": 5.2942118644714355, "learning_rate": 0.00010338279603825294, "loss": 2.62, "step": 13950 }, { "epoch": 1.03, "grad_norm": 6.039937496185303, "learning_rate": 0.00010326071754867294, "loss": 2.6654, "step": 13960 }, { "epoch": 1.03, "grad_norm": 4.724233627319336, "learning_rate": 0.00010313863419422631, "loss": 2.5275, "step": 13970 }, { "epoch": 1.03, "grad_norm": 6.356924533843994, "learning_rate": 0.00010301654615705669, "loss": 2.7036, "step": 13980 }, { "epoch": 1.03, "grad_norm": 6.196333408355713, "learning_rate": 0.00010289445361931482, "loss": 2.5768, "step": 13990 }, { "epoch": 1.03, "grad_norm": 8.118714332580566, "learning_rate": 0.00010277235676315817, "loss": 2.3845, "step": 14000 }, { "epoch": 1.03, "eval_loss": 2.846597909927368, "eval_runtime": 1140.6527, "eval_samples_per_second": 4.997, "eval_steps_per_second": 4.997, "step": 14000 }, { "epoch": 1.03, "grad_norm": 5.258535861968994, "learning_rate": 0.00010265025577075054, "loss": 2.8392, "step": 14010 }, { "epoch": 1.04, "grad_norm": 5.9286885261535645, "learning_rate": 0.00010252815082426199, "loss": 2.7799, "step": 14020 }, { "epoch": 1.04, "grad_norm": 5.152517318725586, "learning_rate": 0.00010240604210586848, "loss": 2.4615, "step": 14030 }, { "epoch": 1.04, "grad_norm": 4.207879543304443, "learning_rate": 0.00010228392979775159, "loss": 2.777, "step": 14040 }, { "epoch": 1.04, "grad_norm": 6.9504475593566895, "learning_rate": 0.00010216181408209817, "loss": 2.6854, "step": 14050 }, { "epoch": 1.04, "grad_norm": 6.830455780029297, "learning_rate": 0.00010203969514110033, "loss": 2.6638, "step": 14060 }, { "epoch": 1.04, "grad_norm": 3.3591535091400146, "learning_rate": 0.00010191757315695482, "loss": 2.6079, "step": 14070 }, { "epoch": 1.04, "grad_norm": 7.07043981552124, "learning_rate": 0.00010179544831186305, "loss": 2.7527, "step": 14080 }, { "epoch": 1.04, "grad_norm": 3.6287598609924316, "learning_rate": 0.0001016733207880306, "loss": 2.733, "step": 14090 }, { "epoch": 1.04, "grad_norm": 6.620267868041992, "learning_rate": 0.00010155119076766708, "loss": 2.6319, "step": 14100 }, { "epoch": 1.04, "grad_norm": 5.5068793296813965, "learning_rate": 0.00010142905843298592, "loss": 2.7411, "step": 14110 }, { "epoch": 1.04, "grad_norm": 5.742343902587891, "learning_rate": 0.00010130692396620388, "loss": 2.6599, "step": 14120 }, { "epoch": 1.04, "grad_norm": 3.2871851921081543, "learning_rate": 0.00010118478754954091, "loss": 2.4312, "step": 14130 }, { "epoch": 1.04, "grad_norm": 4.894622802734375, "learning_rate": 0.00010106264936521996, "loss": 2.749, "step": 14140 }, { "epoch": 1.05, "grad_norm": 6.887192249298096, "learning_rate": 0.0001009405095954665, "loss": 2.5452, "step": 14150 }, { "epoch": 1.05, "grad_norm": 7.4985175132751465, "learning_rate": 0.00010081836842250851, "loss": 2.9491, "step": 14160 }, { "epoch": 1.05, "grad_norm": 7.017559051513672, "learning_rate": 0.00010069622602857589, "loss": 2.6417, "step": 14170 }, { "epoch": 1.05, "grad_norm": 6.0003437995910645, "learning_rate": 0.00010057408259590049, "loss": 2.4899, "step": 14180 }, { "epoch": 1.05, "grad_norm": 4.769591808319092, "learning_rate": 0.00010045193830671568, "loss": 2.5924, "step": 14190 }, { "epoch": 1.05, "grad_norm": 4.747857093811035, "learning_rate": 0.00010032979334325607, "loss": 2.5493, "step": 14200 }, { "epoch": 1.05, "eval_loss": 2.8418214321136475, "eval_runtime": 1136.8707, "eval_samples_per_second": 5.014, "eval_steps_per_second": 5.014, "step": 14200 }, { "epoch": 1.05, "grad_norm": 5.269603729248047, "learning_rate": 0.00010020764788775736, "loss": 2.6107, "step": 14210 }, { "epoch": 1.05, "grad_norm": 5.822869777679443, "learning_rate": 0.00010008550212245587, "loss": 2.7305, "step": 14220 }, { "epoch": 1.05, "grad_norm": 4.800507545471191, "learning_rate": 9.996335622958848e-05, "loss": 2.6997, "step": 14230 }, { "epoch": 1.05, "grad_norm": 4.758016586303711, "learning_rate": 9.984121039139218e-05, "loss": 2.6385, "step": 14240 }, { "epoch": 1.05, "grad_norm": 4.214052200317383, "learning_rate": 9.971906479010394e-05, "loss": 2.7877, "step": 14250 }, { "epoch": 1.05, "grad_norm": 5.076603889465332, "learning_rate": 9.959691960796036e-05, "loss": 2.5551, "step": 14260 }, { "epoch": 1.05, "grad_norm": 6.1883416175842285, "learning_rate": 9.947477502719745e-05, "loss": 2.7586, "step": 14270 }, { "epoch": 1.05, "grad_norm": 3.745725154876709, "learning_rate": 9.93526312300502e-05, "loss": 2.6555, "step": 14280 }, { "epoch": 1.06, "grad_norm": 4.745731830596924, "learning_rate": 9.923048839875258e-05, "loss": 2.7364, "step": 14290 }, { "epoch": 1.06, "grad_norm": 4.47914981842041, "learning_rate": 9.910834671553699e-05, "loss": 2.6527, "step": 14300 }, { "epoch": 1.06, "grad_norm": 6.2111897468566895, "learning_rate": 9.898620636263426e-05, "loss": 2.8341, "step": 14310 }, { "epoch": 1.06, "grad_norm": 14.119166374206543, "learning_rate": 9.886406752227313e-05, "loss": 2.578, "step": 14320 }, { "epoch": 1.06, "grad_norm": 5.5367889404296875, "learning_rate": 9.874193037668006e-05, "loss": 2.779, "step": 14330 }, { "epoch": 1.06, "grad_norm": 4.672638416290283, "learning_rate": 9.861979510807907e-05, "loss": 2.8918, "step": 14340 }, { "epoch": 1.06, "grad_norm": 6.862904071807861, "learning_rate": 9.849766189869134e-05, "loss": 2.6632, "step": 14350 }, { "epoch": 1.06, "grad_norm": 3.7714316844940186, "learning_rate": 9.837553093073494e-05, "loss": 2.5183, "step": 14360 }, { "epoch": 1.06, "grad_norm": 7.480538845062256, "learning_rate": 9.825340238642473e-05, "loss": 2.6456, "step": 14370 }, { "epoch": 1.06, "grad_norm": 5.1482834815979, "learning_rate": 9.813127644797177e-05, "loss": 2.4604, "step": 14380 }, { "epoch": 1.06, "grad_norm": 5.069243431091309, "learning_rate": 9.800915329758333e-05, "loss": 2.6392, "step": 14390 }, { "epoch": 1.06, "grad_norm": 6.216825485229492, "learning_rate": 9.788703311746254e-05, "loss": 2.6742, "step": 14400 }, { "epoch": 1.06, "eval_loss": 2.8299241065979004, "eval_runtime": 1135.6729, "eval_samples_per_second": 5.019, "eval_steps_per_second": 5.019, "step": 14400 }, { "epoch": 1.06, "grad_norm": 7.684316635131836, "learning_rate": 9.776491608980808e-05, "loss": 2.8018, "step": 14410 }, { "epoch": 1.07, "grad_norm": 4.665287971496582, "learning_rate": 9.764280239681385e-05, "loss": 2.7907, "step": 14420 }, { "epoch": 1.07, "grad_norm": 4.080597877502441, "learning_rate": 9.752069222066889e-05, "loss": 2.6134, "step": 14430 }, { "epoch": 1.07, "grad_norm": 4.095142841339111, "learning_rate": 9.739858574355691e-05, "loss": 2.6614, "step": 14440 }, { "epoch": 1.07, "grad_norm": 6.944389820098877, "learning_rate": 9.727648314765617e-05, "loss": 2.7235, "step": 14450 }, { "epoch": 1.07, "grad_norm": 10.006865501403809, "learning_rate": 9.715438461513912e-05, "loss": 2.7576, "step": 14460 }, { "epoch": 1.07, "grad_norm": 5.380651473999023, "learning_rate": 9.703229032817207e-05, "loss": 2.6551, "step": 14470 }, { "epoch": 1.07, "grad_norm": 4.433184623718262, "learning_rate": 9.691020046891509e-05, "loss": 2.5386, "step": 14480 }, { "epoch": 1.07, "grad_norm": 5.731329441070557, "learning_rate": 9.678811521952161e-05, "loss": 2.6239, "step": 14490 }, { "epoch": 1.07, "grad_norm": 4.7876458168029785, "learning_rate": 9.666603476213818e-05, "loss": 2.5553, "step": 14500 }, { "epoch": 1.07, "grad_norm": 15.640872955322266, "learning_rate": 9.654395927890422e-05, "loss": 2.6181, "step": 14510 }, { "epoch": 1.07, "grad_norm": 8.363943099975586, "learning_rate": 9.642188895195167e-05, "loss": 2.7827, "step": 14520 }, { "epoch": 1.07, "grad_norm": 11.327077865600586, "learning_rate": 9.629982396340488e-05, "loss": 2.5366, "step": 14530 }, { "epoch": 1.07, "grad_norm": 6.818722248077393, "learning_rate": 9.617776449538011e-05, "loss": 2.7139, "step": 14540 }, { "epoch": 1.07, "grad_norm": 5.882566928863525, "learning_rate": 9.60557107299855e-05, "loss": 2.5054, "step": 14550 }, { "epoch": 1.08, "grad_norm": 7.939090251922607, "learning_rate": 9.593366284932064e-05, "loss": 2.7289, "step": 14560 }, { "epoch": 1.08, "grad_norm": 11.2249755859375, "learning_rate": 9.581162103547627e-05, "loss": 2.8788, "step": 14570 }, { "epoch": 1.08, "grad_norm": 4.7646002769470215, "learning_rate": 9.568958547053417e-05, "loss": 2.604, "step": 14580 }, { "epoch": 1.08, "grad_norm": 6.1333513259887695, "learning_rate": 9.556755633656676e-05, "loss": 2.6, "step": 14590 }, { "epoch": 1.08, "grad_norm": 5.915955543518066, "learning_rate": 9.544553381563691e-05, "loss": 2.6433, "step": 14600 }, { "epoch": 1.08, "eval_loss": 2.822645902633667, "eval_runtime": 1137.1119, "eval_samples_per_second": 5.013, "eval_steps_per_second": 5.013, "step": 14600 }, { "epoch": 1.08, "grad_norm": 9.068519592285156, "learning_rate": 9.532351808979754e-05, "loss": 2.8102, "step": 14610 }, { "epoch": 1.08, "grad_norm": 6.155020713806152, "learning_rate": 9.520150934109146e-05, "loss": 2.5665, "step": 14620 }, { "epoch": 1.08, "grad_norm": 7.280089378356934, "learning_rate": 9.507950775155116e-05, "loss": 2.7537, "step": 14630 }, { "epoch": 1.08, "grad_norm": 5.696301460266113, "learning_rate": 9.495751350319829e-05, "loss": 2.8477, "step": 14640 }, { "epoch": 1.08, "grad_norm": 6.453228950500488, "learning_rate": 9.483552677804372e-05, "loss": 2.7048, "step": 14650 }, { "epoch": 1.08, "grad_norm": 4.739017009735107, "learning_rate": 9.471354775808695e-05, "loss": 2.7032, "step": 14660 }, { "epoch": 1.08, "grad_norm": 9.007843017578125, "learning_rate": 9.459157662531603e-05, "loss": 2.8116, "step": 14670 }, { "epoch": 1.08, "grad_norm": 5.5827131271362305, "learning_rate": 9.446961356170731e-05, "loss": 2.8541, "step": 14680 }, { "epoch": 1.09, "grad_norm": 4.878897190093994, "learning_rate": 9.4347658749225e-05, "loss": 2.739, "step": 14690 }, { "epoch": 1.09, "grad_norm": 5.005230903625488, "learning_rate": 9.422571236982113e-05, "loss": 2.5947, "step": 14700 }, { "epoch": 1.09, "grad_norm": 5.4663591384887695, "learning_rate": 9.410377460543493e-05, "loss": 2.5272, "step": 14710 }, { "epoch": 1.09, "grad_norm": 4.379180908203125, "learning_rate": 9.398184563799301e-05, "loss": 2.4606, "step": 14720 }, { "epoch": 1.09, "grad_norm": 5.044705390930176, "learning_rate": 9.385992564940871e-05, "loss": 2.5472, "step": 14730 }, { "epoch": 1.09, "grad_norm": 2.9766154289245605, "learning_rate": 9.373801482158206e-05, "loss": 2.559, "step": 14740 }, { "epoch": 1.09, "grad_norm": 6.4899396896362305, "learning_rate": 9.36161133363994e-05, "loss": 2.7749, "step": 14750 }, { "epoch": 1.09, "grad_norm": 5.2543439865112305, "learning_rate": 9.349422137573302e-05, "loss": 2.5608, "step": 14760 }, { "epoch": 1.09, "grad_norm": 4.9640703201293945, "learning_rate": 9.337233912144116e-05, "loss": 2.6551, "step": 14770 }, { "epoch": 1.09, "grad_norm": 4.78398323059082, "learning_rate": 9.32504667553675e-05, "loss": 2.5717, "step": 14780 }, { "epoch": 1.09, "grad_norm": 12.001642227172852, "learning_rate": 9.312860445934101e-05, "loss": 2.4541, "step": 14790 }, { "epoch": 1.09, "grad_norm": 7.847120761871338, "learning_rate": 9.300675241517557e-05, "loss": 2.6015, "step": 14800 }, { "epoch": 1.09, "eval_loss": 2.8366076946258545, "eval_runtime": 1134.7417, "eval_samples_per_second": 5.023, "eval_steps_per_second": 5.023, "step": 14800 }, { "epoch": 1.09, "grad_norm": 6.1443986892700195, "learning_rate": 9.288491080466978e-05, "loss": 2.5734, "step": 14810 }, { "epoch": 1.09, "grad_norm": 8.345760345458984, "learning_rate": 9.276307980960674e-05, "loss": 2.7371, "step": 14820 }, { "epoch": 1.1, "grad_norm": 6.313103199005127, "learning_rate": 9.264125961175363e-05, "loss": 2.9526, "step": 14830 }, { "epoch": 1.1, "grad_norm": 6.4391350746154785, "learning_rate": 9.251945039286161e-05, "loss": 2.5819, "step": 14840 }, { "epoch": 1.1, "grad_norm": 4.635354042053223, "learning_rate": 9.239765233466535e-05, "loss": 2.8905, "step": 14850 }, { "epoch": 1.1, "grad_norm": 4.282767295837402, "learning_rate": 9.227586561888292e-05, "loss": 2.4121, "step": 14860 }, { "epoch": 1.1, "grad_norm": 5.246340274810791, "learning_rate": 9.215409042721552e-05, "loss": 2.8323, "step": 14870 }, { "epoch": 1.1, "grad_norm": 6.242234230041504, "learning_rate": 9.203232694134706e-05, "loss": 2.7003, "step": 14880 }, { "epoch": 1.1, "grad_norm": 6.143115997314453, "learning_rate": 9.191057534294411e-05, "loss": 2.3707, "step": 14890 }, { "epoch": 1.1, "grad_norm": 6.330958366394043, "learning_rate": 9.178883581365534e-05, "loss": 2.4944, "step": 14900 }, { "epoch": 1.1, "grad_norm": 6.2139482498168945, "learning_rate": 9.166710853511155e-05, "loss": 2.6611, "step": 14910 }, { "epoch": 1.1, "grad_norm": 4.927261829376221, "learning_rate": 9.15453936889252e-05, "loss": 2.8179, "step": 14920 }, { "epoch": 1.1, "grad_norm": 4.508125305175781, "learning_rate": 9.142369145669021e-05, "loss": 2.6895, "step": 14930 }, { "epoch": 1.1, "grad_norm": 7.7817230224609375, "learning_rate": 9.130200201998173e-05, "loss": 2.6323, "step": 14940 }, { "epoch": 1.1, "grad_norm": 6.731665134429932, "learning_rate": 9.118032556035572e-05, "loss": 2.6161, "step": 14950 }, { "epoch": 1.11, "grad_norm": 4.72010612487793, "learning_rate": 9.105866225934885e-05, "loss": 2.825, "step": 14960 }, { "epoch": 1.11, "grad_norm": 6.487375736236572, "learning_rate": 9.093701229847817e-05, "loss": 2.3883, "step": 14970 }, { "epoch": 1.11, "grad_norm": 5.321608066558838, "learning_rate": 9.081537585924079e-05, "loss": 2.7388, "step": 14980 }, { "epoch": 1.11, "grad_norm": 5.753255367279053, "learning_rate": 9.069375312311362e-05, "loss": 2.7161, "step": 14990 }, { "epoch": 1.11, "grad_norm": 5.2197265625, "learning_rate": 9.057214427155319e-05, "loss": 2.6866, "step": 15000 }, { "epoch": 1.11, "eval_loss": 2.821988344192505, "eval_runtime": 1135.7076, "eval_samples_per_second": 5.019, "eval_steps_per_second": 5.019, "step": 15000 }, { "epoch": 1.11, "grad_norm": 4.719414710998535, "learning_rate": 9.045054948599525e-05, "loss": 2.5983, "step": 15010 }, { "epoch": 1.11, "grad_norm": 6.498874664306641, "learning_rate": 9.032896894785464e-05, "loss": 2.8949, "step": 15020 }, { "epoch": 1.11, "grad_norm": 5.581775188446045, "learning_rate": 9.020740283852495e-05, "loss": 2.5969, "step": 15030 }, { "epoch": 1.11, "grad_norm": 6.098051071166992, "learning_rate": 9.00858513393781e-05, "loss": 2.5028, "step": 15040 }, { "epoch": 1.11, "grad_norm": 7.322878837585449, "learning_rate": 8.996431463176434e-05, "loss": 2.5779, "step": 15050 }, { "epoch": 1.11, "grad_norm": 5.357008934020996, "learning_rate": 8.984279289701184e-05, "loss": 2.6543, "step": 15060 }, { "epoch": 1.11, "grad_norm": 3.7159807682037354, "learning_rate": 8.97212863164264e-05, "loss": 2.6203, "step": 15070 }, { "epoch": 1.11, "grad_norm": 5.603279113769531, "learning_rate": 8.959979507129124e-05, "loss": 2.5972, "step": 15080 }, { "epoch": 1.11, "grad_norm": 6.878233432769775, "learning_rate": 8.947831934286664e-05, "loss": 2.7696, "step": 15090 }, { "epoch": 1.12, "grad_norm": 6.096282958984375, "learning_rate": 8.935685931238979e-05, "loss": 2.6345, "step": 15100 }, { "epoch": 1.12, "grad_norm": 7.228655815124512, "learning_rate": 8.923541516107445e-05, "loss": 2.7248, "step": 15110 }, { "epoch": 1.12, "grad_norm": 3.705758810043335, "learning_rate": 8.911398707011065e-05, "loss": 2.6374, "step": 15120 }, { "epoch": 1.12, "grad_norm": 4.940635681152344, "learning_rate": 8.899257522066455e-05, "loss": 2.6978, "step": 15130 }, { "epoch": 1.12, "grad_norm": 6.699410438537598, "learning_rate": 8.887117979387797e-05, "loss": 2.9187, "step": 15140 }, { "epoch": 1.12, "grad_norm": 5.017121315002441, "learning_rate": 8.874980097086826e-05, "loss": 2.6659, "step": 15150 }, { "epoch": 1.12, "grad_norm": 9.299418449401855, "learning_rate": 8.862843893272805e-05, "loss": 2.4321, "step": 15160 }, { "epoch": 1.12, "grad_norm": 3.4937360286712646, "learning_rate": 8.850709386052485e-05, "loss": 2.6002, "step": 15170 }, { "epoch": 1.12, "grad_norm": 5.106987476348877, "learning_rate": 8.838576593530096e-05, "loss": 2.9664, "step": 15180 }, { "epoch": 1.12, "grad_norm": 5.51921272277832, "learning_rate": 8.826445533807297e-05, "loss": 2.6186, "step": 15190 }, { "epoch": 1.12, "grad_norm": 8.393594741821289, "learning_rate": 8.814316224983169e-05, "loss": 2.7938, "step": 15200 }, { "epoch": 1.12, "eval_loss": 2.81386661529541, "eval_runtime": 1134.4546, "eval_samples_per_second": 5.024, "eval_steps_per_second": 5.024, "step": 15200 }, { "epoch": 1.12, "grad_norm": 6.8599371910095215, "learning_rate": 8.802188685154183e-05, "loss": 2.7784, "step": 15210 }, { "epoch": 1.12, "grad_norm": 6.077823162078857, "learning_rate": 8.790062932414169e-05, "loss": 2.9943, "step": 15220 }, { "epoch": 1.13, "grad_norm": 6.662342071533203, "learning_rate": 8.777938984854281e-05, "loss": 2.432, "step": 15230 }, { "epoch": 1.13, "grad_norm": 3.6993889808654785, "learning_rate": 8.765816860562998e-05, "loss": 2.4492, "step": 15240 }, { "epoch": 1.13, "grad_norm": 8.877721786499023, "learning_rate": 8.753696577626061e-05, "loss": 2.5662, "step": 15250 }, { "epoch": 1.13, "grad_norm": 4.209753513336182, "learning_rate": 8.741578154126476e-05, "loss": 2.5471, "step": 15260 }, { "epoch": 1.13, "grad_norm": 4.297937870025635, "learning_rate": 8.729461608144472e-05, "loss": 2.5248, "step": 15270 }, { "epoch": 1.13, "grad_norm": 4.832234859466553, "learning_rate": 8.717346957757469e-05, "loss": 2.5218, "step": 15280 }, { "epoch": 1.13, "grad_norm": 4.7769999504089355, "learning_rate": 8.70523422104007e-05, "loss": 2.8345, "step": 15290 }, { "epoch": 1.13, "grad_norm": 6.273793697357178, "learning_rate": 8.693123416064015e-05, "loss": 2.842, "step": 15300 }, { "epoch": 1.13, "grad_norm": 7.538787364959717, "learning_rate": 8.681014560898168e-05, "loss": 2.6492, "step": 15310 }, { "epoch": 1.13, "grad_norm": 5.364718914031982, "learning_rate": 8.668907673608484e-05, "loss": 2.6824, "step": 15320 }, { "epoch": 1.13, "grad_norm": 9.456381797790527, "learning_rate": 8.656802772257967e-05, "loss": 2.5481, "step": 15330 }, { "epoch": 1.13, "grad_norm": 5.099219799041748, "learning_rate": 8.644699874906677e-05, "loss": 2.6301, "step": 15340 }, { "epoch": 1.13, "grad_norm": 10.843995094299316, "learning_rate": 8.632598999611681e-05, "loss": 2.8424, "step": 15350 }, { "epoch": 1.13, "grad_norm": 5.564281940460205, "learning_rate": 8.620500164427017e-05, "loss": 2.6204, "step": 15360 }, { "epoch": 1.14, "grad_norm": 5.3823628425598145, "learning_rate": 8.608403387403697e-05, "loss": 2.746, "step": 15370 }, { "epoch": 1.14, "grad_norm": 3.44514799118042, "learning_rate": 8.596308686589645e-05, "loss": 2.7036, "step": 15380 }, { "epoch": 1.14, "grad_norm": 6.357730865478516, "learning_rate": 8.584216080029694e-05, "loss": 2.3706, "step": 15390 }, { "epoch": 1.14, "grad_norm": 7.127414226531982, "learning_rate": 8.57212558576556e-05, "loss": 2.3574, "step": 15400 }, { "epoch": 1.14, "eval_loss": 2.8107047080993652, "eval_runtime": 1137.0718, "eval_samples_per_second": 5.013, "eval_steps_per_second": 5.013, "step": 15400 }, { "epoch": 1.14, "grad_norm": 6.099443435668945, "learning_rate": 8.560037221835799e-05, "loss": 2.7923, "step": 15410 }, { "epoch": 1.14, "grad_norm": 8.16304874420166, "learning_rate": 8.547951006275786e-05, "loss": 2.6381, "step": 15420 }, { "epoch": 1.14, "grad_norm": 4.368096828460693, "learning_rate": 8.5358669571177e-05, "loss": 2.5908, "step": 15430 }, { "epoch": 1.14, "grad_norm": 6.323507785797119, "learning_rate": 8.523785092390482e-05, "loss": 2.7558, "step": 15440 }, { "epoch": 1.14, "grad_norm": 8.191755294799805, "learning_rate": 8.511705430119815e-05, "loss": 2.6878, "step": 15450 }, { "epoch": 1.14, "grad_norm": 4.996376037597656, "learning_rate": 8.499627988328099e-05, "loss": 2.3164, "step": 15460 }, { "epoch": 1.14, "grad_norm": 6.701737880706787, "learning_rate": 8.487552785034411e-05, "loss": 2.5691, "step": 15470 }, { "epoch": 1.14, "grad_norm": 4.932399749755859, "learning_rate": 8.475479838254503e-05, "loss": 2.4854, "step": 15480 }, { "epoch": 1.14, "grad_norm": 6.256311893463135, "learning_rate": 8.463409166000747e-05, "loss": 2.2988, "step": 15490 }, { "epoch": 1.14, "grad_norm": 5.213491439819336, "learning_rate": 8.451340786282133e-05, "loss": 2.5542, "step": 15500 }, { "epoch": 1.15, "grad_norm": 4.382655620574951, "learning_rate": 8.439274717104224e-05, "loss": 2.9418, "step": 15510 }, { "epoch": 1.15, "grad_norm": 4.432163715362549, "learning_rate": 8.42721097646913e-05, "loss": 2.5682, "step": 15520 }, { "epoch": 1.15, "grad_norm": 6.079984664916992, "learning_rate": 8.4151495823755e-05, "loss": 2.7749, "step": 15530 }, { "epoch": 1.15, "grad_norm": 4.57197380065918, "learning_rate": 8.403090552818475e-05, "loss": 2.6964, "step": 15540 }, { "epoch": 1.15, "grad_norm": 5.710402965545654, "learning_rate": 8.391033905789668e-05, "loss": 2.7295, "step": 15550 }, { "epoch": 1.15, "grad_norm": 5.570113658905029, "learning_rate": 8.378979659277142e-05, "loss": 2.4635, "step": 15560 }, { "epoch": 1.15, "grad_norm": 4.270289421081543, "learning_rate": 8.366927831265366e-05, "loss": 2.4542, "step": 15570 }, { "epoch": 1.15, "grad_norm": 7.5061845779418945, "learning_rate": 8.354878439735216e-05, "loss": 2.8317, "step": 15580 }, { "epoch": 1.15, "grad_norm": 5.209946155548096, "learning_rate": 8.342831502663924e-05, "loss": 2.8297, "step": 15590 }, { "epoch": 1.15, "grad_norm": 5.211167335510254, "learning_rate": 8.330787038025068e-05, "loss": 2.4852, "step": 15600 }, { "epoch": 1.15, "eval_loss": 2.801150321960449, "eval_runtime": 1135.7445, "eval_samples_per_second": 5.019, "eval_steps_per_second": 5.019, "step": 15600 }, { "epoch": 1.15, "grad_norm": 4.61747407913208, "learning_rate": 8.318745063788524e-05, "loss": 2.7651, "step": 15610 }, { "epoch": 1.15, "grad_norm": 7.793847560882568, "learning_rate": 8.306705597920463e-05, "loss": 2.6381, "step": 15620 }, { "epoch": 1.15, "grad_norm": 7.500510215759277, "learning_rate": 8.294668658383311e-05, "loss": 2.7704, "step": 15630 }, { "epoch": 1.16, "grad_norm": 4.450290203094482, "learning_rate": 8.282634263135722e-05, "loss": 2.4493, "step": 15640 }, { "epoch": 1.16, "grad_norm": 7.9324750900268555, "learning_rate": 8.270602430132562e-05, "loss": 2.6112, "step": 15650 }, { "epoch": 1.16, "grad_norm": 4.876689434051514, "learning_rate": 8.258573177324861e-05, "loss": 2.5688, "step": 15660 }, { "epoch": 1.16, "grad_norm": 7.13979434967041, "learning_rate": 8.247749070698486e-05, "loss": 2.5836, "step": 15670 }, { "epoch": 1.16, "grad_norm": 7.261677265167236, "learning_rate": 8.235724769703466e-05, "loss": 2.3577, "step": 15680 }, { "epoch": 1.16, "grad_norm": 4.691134452819824, "learning_rate": 8.223703100940052e-05, "loss": 2.7229, "step": 15690 }, { "epoch": 1.16, "grad_norm": 6.986545085906982, "learning_rate": 8.211684082344125e-05, "loss": 2.554, "step": 15700 }, { "epoch": 1.16, "grad_norm": 5.607544422149658, "learning_rate": 8.199667731847593e-05, "loss": 2.403, "step": 15710 }, { "epoch": 1.16, "grad_norm": 5.985232830047607, "learning_rate": 8.187654067378397e-05, "loss": 2.4481, "step": 15720 }, { "epoch": 1.16, "grad_norm": 13.418354988098145, "learning_rate": 8.175643106860472e-05, "loss": 2.7237, "step": 15730 }, { "epoch": 1.16, "grad_norm": 4.863924980163574, "learning_rate": 8.163634868213715e-05, "loss": 2.5766, "step": 15740 }, { "epoch": 1.16, "grad_norm": 5.624682903289795, "learning_rate": 8.151629369353952e-05, "loss": 2.7085, "step": 15750 }, { "epoch": 1.16, "grad_norm": 4.593716621398926, "learning_rate": 8.139626628192944e-05, "loss": 3.056, "step": 15760 }, { "epoch": 1.16, "grad_norm": 5.1518025398254395, "learning_rate": 8.127626662638315e-05, "loss": 2.9041, "step": 15770 }, { "epoch": 1.17, "grad_norm": 6.224874973297119, "learning_rate": 8.115629490593564e-05, "loss": 2.574, "step": 15780 }, { "epoch": 1.17, "grad_norm": 7.418553352355957, "learning_rate": 8.103635129958017e-05, "loss": 2.7397, "step": 15790 }, { "epoch": 1.17, "grad_norm": 15.142317771911621, "learning_rate": 8.091643598626794e-05, "loss": 2.845, "step": 15800 }, { "epoch": 1.17, "eval_loss": 2.8001558780670166, "eval_runtime": 1137.7655, "eval_samples_per_second": 5.01, "eval_steps_per_second": 5.01, "step": 15800 }, { "epoch": 1.17, "grad_norm": 6.888623237609863, "learning_rate": 8.079654914490815e-05, "loss": 2.8391, "step": 15810 }, { "epoch": 1.17, "grad_norm": 6.754673957824707, "learning_rate": 8.067669095436736e-05, "loss": 2.537, "step": 15820 }, { "epoch": 1.17, "grad_norm": 7.226851940155029, "learning_rate": 8.055686159346944e-05, "loss": 2.5829, "step": 15830 }, { "epoch": 1.17, "grad_norm": 6.088146209716797, "learning_rate": 8.04370612409953e-05, "loss": 2.6574, "step": 15840 }, { "epoch": 1.17, "grad_norm": 5.43487024307251, "learning_rate": 8.031729007568241e-05, "loss": 2.8225, "step": 15850 }, { "epoch": 1.17, "grad_norm": 5.83208703994751, "learning_rate": 8.019754827622487e-05, "loss": 2.4902, "step": 15860 }, { "epoch": 1.17, "grad_norm": 5.5839738845825195, "learning_rate": 8.007783602127285e-05, "loss": 2.7953, "step": 15870 }, { "epoch": 1.17, "grad_norm": 9.091108322143555, "learning_rate": 7.995815348943256e-05, "loss": 2.6682, "step": 15880 }, { "epoch": 1.17, "grad_norm": 5.6139445304870605, "learning_rate": 7.983850085926574e-05, "loss": 2.4715, "step": 15890 }, { "epoch": 1.17, "grad_norm": 11.105509757995605, "learning_rate": 7.971887830928954e-05, "loss": 2.4542, "step": 15900 }, { "epoch": 1.18, "grad_norm": 5.053381443023682, "learning_rate": 7.95992860179763e-05, "loss": 2.5608, "step": 15910 }, { "epoch": 1.18, "grad_norm": 6.730508327484131, "learning_rate": 7.947972416375315e-05, "loss": 2.6179, "step": 15920 }, { "epoch": 1.18, "grad_norm": 4.9856276512146, "learning_rate": 7.936019292500191e-05, "loss": 2.9111, "step": 15930 }, { "epoch": 1.18, "grad_norm": 6.622928142547607, "learning_rate": 7.924069248005855e-05, "loss": 2.9524, "step": 15940 }, { "epoch": 1.18, "grad_norm": 5.014869213104248, "learning_rate": 7.912122300721319e-05, "loss": 2.7441, "step": 15950 }, { "epoch": 1.18, "grad_norm": 6.20679235458374, "learning_rate": 7.900178468470983e-05, "loss": 2.488, "step": 15960 }, { "epoch": 1.18, "grad_norm": 5.172658443450928, "learning_rate": 7.888237769074582e-05, "loss": 2.5992, "step": 15970 }, { "epoch": 1.18, "grad_norm": 4.712294101715088, "learning_rate": 7.876300220347195e-05, "loss": 2.7378, "step": 15980 }, { "epoch": 1.18, "grad_norm": 5.688995838165283, "learning_rate": 7.864365840099183e-05, "loss": 2.7758, "step": 15990 }, { "epoch": 1.18, "grad_norm": 4.735537052154541, "learning_rate": 7.852434646136191e-05, "loss": 2.6825, "step": 16000 }, { "epoch": 1.18, "eval_loss": 2.7963438034057617, "eval_runtime": 1138.098, "eval_samples_per_second": 5.008, "eval_steps_per_second": 5.008, "step": 16000 }, { "epoch": 1.18, "grad_norm": 5.686548233032227, "learning_rate": 7.840506656259108e-05, "loss": 2.6941, "step": 16010 }, { "epoch": 1.18, "grad_norm": 4.687047004699707, "learning_rate": 7.828581888264037e-05, "loss": 2.3713, "step": 16020 }, { "epoch": 1.18, "grad_norm": 5.9541850090026855, "learning_rate": 7.816660359942288e-05, "loss": 2.8516, "step": 16030 }, { "epoch": 1.18, "grad_norm": 6.282932758331299, "learning_rate": 7.804742089080319e-05, "loss": 2.4472, "step": 16040 }, { "epoch": 1.19, "grad_norm": 6.3287858963012695, "learning_rate": 7.792827093459742e-05, "loss": 2.5265, "step": 16050 }, { "epoch": 1.19, "grad_norm": 7.00472354888916, "learning_rate": 7.780915390857275e-05, "loss": 2.8147, "step": 16060 }, { "epoch": 1.19, "grad_norm": 5.5554399490356445, "learning_rate": 7.769006999044729e-05, "loss": 2.5742, "step": 16070 }, { "epoch": 1.19, "grad_norm": 4.063988208770752, "learning_rate": 7.757101935788973e-05, "loss": 2.5979, "step": 16080 }, { "epoch": 1.19, "grad_norm": 8.165379524230957, "learning_rate": 7.745200218851901e-05, "loss": 2.7628, "step": 16090 }, { "epoch": 1.19, "grad_norm": 5.317456245422363, "learning_rate": 7.733301865990432e-05, "loss": 2.8025, "step": 16100 }, { "epoch": 1.19, "grad_norm": 11.654034614562988, "learning_rate": 7.721406894956449e-05, "loss": 2.6235, "step": 16110 }, { "epoch": 1.19, "grad_norm": 9.989720344543457, "learning_rate": 7.709515323496804e-05, "loss": 2.5045, "step": 16120 }, { "epoch": 1.19, "grad_norm": 4.502736568450928, "learning_rate": 7.697627169353265e-05, "loss": 2.4192, "step": 16130 }, { "epoch": 1.19, "grad_norm": 4.556110858917236, "learning_rate": 7.685742450262504e-05, "loss": 2.5847, "step": 16140 }, { "epoch": 1.19, "grad_norm": 4.872483730316162, "learning_rate": 7.673861183956077e-05, "loss": 2.5115, "step": 16150 }, { "epoch": 1.19, "grad_norm": 7.733802318572998, "learning_rate": 7.661983388160375e-05, "loss": 2.4647, "step": 16160 }, { "epoch": 1.19, "grad_norm": 4.661727428436279, "learning_rate": 7.650109080596625e-05, "loss": 2.4705, "step": 16170 }, { "epoch": 1.2, "grad_norm": 5.2123541831970215, "learning_rate": 7.638238278980838e-05, "loss": 2.5191, "step": 16180 }, { "epoch": 1.2, "grad_norm": 5.72269868850708, "learning_rate": 7.626371001023798e-05, "loss": 2.6785, "step": 16190 }, { "epoch": 1.2, "grad_norm": 12.739094734191895, "learning_rate": 7.614507264431036e-05, "loss": 2.8185, "step": 16200 }, { "epoch": 1.2, "eval_loss": 2.794032335281372, "eval_runtime": 1136.7877, "eval_samples_per_second": 5.014, "eval_steps_per_second": 5.014, "step": 16200 }, { "epoch": 1.2, "grad_norm": 6.045168399810791, "learning_rate": 7.602647086902794e-05, "loss": 2.5196, "step": 16210 }, { "epoch": 1.2, "grad_norm": 4.591131210327148, "learning_rate": 7.59079048613401e-05, "loss": 2.3241, "step": 16220 }, { "epoch": 1.2, "grad_norm": 6.3532395362854, "learning_rate": 7.578937479814279e-05, "loss": 2.4889, "step": 16230 }, { "epoch": 1.2, "grad_norm": 6.245053291320801, "learning_rate": 7.567088085627834e-05, "loss": 2.5951, "step": 16240 }, { "epoch": 1.2, "grad_norm": 8.003286361694336, "learning_rate": 7.555242321253525e-05, "loss": 2.6774, "step": 16250 }, { "epoch": 1.2, "grad_norm": 5.010828018188477, "learning_rate": 7.543400204364776e-05, "loss": 2.3974, "step": 16260 }, { "epoch": 1.2, "grad_norm": 4.4079155921936035, "learning_rate": 7.531561752629585e-05, "loss": 2.4707, "step": 16270 }, { "epoch": 1.2, "grad_norm": 5.175243377685547, "learning_rate": 7.519726983710465e-05, "loss": 2.7921, "step": 16280 }, { "epoch": 1.2, "grad_norm": 4.758031368255615, "learning_rate": 7.507895915264442e-05, "loss": 2.6729, "step": 16290 }, { "epoch": 1.2, "grad_norm": 5.974156379699707, "learning_rate": 7.496068564943024e-05, "loss": 2.4163, "step": 16300 }, { "epoch": 1.2, "grad_norm": 5.608770370483398, "learning_rate": 7.48424495039217e-05, "loss": 2.8602, "step": 16310 }, { "epoch": 1.21, "grad_norm": 5.631148815155029, "learning_rate": 7.472425089252254e-05, "loss": 2.5714, "step": 16320 }, { "epoch": 1.21, "grad_norm": 4.781109809875488, "learning_rate": 7.460608999158067e-05, "loss": 2.6068, "step": 16330 }, { "epoch": 1.21, "grad_norm": 7.0405449867248535, "learning_rate": 7.448796697738765e-05, "loss": 2.6175, "step": 16340 }, { "epoch": 1.21, "grad_norm": 4.027560710906982, "learning_rate": 7.436988202617854e-05, "loss": 2.6064, "step": 16350 }, { "epoch": 1.21, "grad_norm": 6.559507369995117, "learning_rate": 7.425183531413163e-05, "loss": 3.0446, "step": 16360 }, { "epoch": 1.21, "grad_norm": 6.1287031173706055, "learning_rate": 7.413382701736804e-05, "loss": 2.5806, "step": 16370 }, { "epoch": 1.21, "grad_norm": 7.039647102355957, "learning_rate": 7.401585731195171e-05, "loss": 2.5544, "step": 16380 }, { "epoch": 1.21, "grad_norm": 3.893784999847412, "learning_rate": 7.389792637388899e-05, "loss": 2.6337, "step": 16390 }, { "epoch": 1.21, "grad_norm": 9.116436958312988, "learning_rate": 7.37800343791283e-05, "loss": 2.5752, "step": 16400 }, { "epoch": 1.21, "eval_loss": 2.7846195697784424, "eval_runtime": 1137.5768, "eval_samples_per_second": 5.011, "eval_steps_per_second": 5.011, "step": 16400 }, { "epoch": 1.21, "grad_norm": 5.62230110168457, "learning_rate": 7.366218150356011e-05, "loss": 2.4447, "step": 16410 }, { "epoch": 1.21, "grad_norm": 5.021866798400879, "learning_rate": 7.354436792301634e-05, "loss": 2.5048, "step": 16420 }, { "epoch": 1.21, "grad_norm": 4.596590995788574, "learning_rate": 7.342659381327039e-05, "loss": 2.4309, "step": 16430 }, { "epoch": 1.21, "grad_norm": 4.406472206115723, "learning_rate": 7.330885935003679e-05, "loss": 2.458, "step": 16440 }, { "epoch": 1.22, "grad_norm": 4.427298069000244, "learning_rate": 7.319116470897085e-05, "loss": 2.5887, "step": 16450 }, { "epoch": 1.22, "grad_norm": 6.47908353805542, "learning_rate": 7.307351006566856e-05, "loss": 2.9025, "step": 16460 }, { "epoch": 1.22, "grad_norm": 4.693458557128906, "learning_rate": 7.295589559566612e-05, "loss": 2.5394, "step": 16470 }, { "epoch": 1.22, "grad_norm": 5.163450241088867, "learning_rate": 7.283832147443985e-05, "loss": 2.6656, "step": 16480 }, { "epoch": 1.22, "grad_norm": 6.559133052825928, "learning_rate": 7.27207878774059e-05, "loss": 2.4291, "step": 16490 }, { "epoch": 1.22, "grad_norm": 6.849522590637207, "learning_rate": 7.260329497991996e-05, "loss": 2.7398, "step": 16500 }, { "epoch": 1.22, "grad_norm": 5.400025844573975, "learning_rate": 7.248584295727688e-05, "loss": 2.8048, "step": 16510 }, { "epoch": 1.22, "grad_norm": 5.159172058105469, "learning_rate": 7.236843198471068e-05, "loss": 2.3586, "step": 16520 }, { "epoch": 1.22, "grad_norm": 7.74296760559082, "learning_rate": 7.225106223739405e-05, "loss": 2.7643, "step": 16530 }, { "epoch": 1.22, "grad_norm": 5.079954624176025, "learning_rate": 7.213373389043822e-05, "loss": 2.7399, "step": 16540 }, { "epoch": 1.22, "grad_norm": 7.623778343200684, "learning_rate": 7.201644711889262e-05, "loss": 2.3221, "step": 16550 }, { "epoch": 1.22, "grad_norm": 3.996065855026245, "learning_rate": 7.189920209774458e-05, "loss": 2.2776, "step": 16560 }, { "epoch": 1.22, "grad_norm": 10.919685363769531, "learning_rate": 7.178199900191932e-05, "loss": 2.5631, "step": 16570 }, { "epoch": 1.22, "grad_norm": 4.869669437408447, "learning_rate": 7.166483800627934e-05, "loss": 2.5653, "step": 16580 }, { "epoch": 1.23, "grad_norm": 3.3495869636535645, "learning_rate": 7.154771928562443e-05, "loss": 2.4802, "step": 16590 }, { "epoch": 1.23, "grad_norm": 4.56265926361084, "learning_rate": 7.14306430146913e-05, "loss": 2.9435, "step": 16600 }, { "epoch": 1.23, "eval_loss": 2.779052734375, "eval_runtime": 1138.9612, "eval_samples_per_second": 5.005, "eval_steps_per_second": 5.005, "step": 16600 }, { "epoch": 1.23, "grad_norm": 6.799938201904297, "learning_rate": 7.131360936815319e-05, "loss": 2.7358, "step": 16610 }, { "epoch": 1.23, "grad_norm": 4.682605266571045, "learning_rate": 7.119661852061994e-05, "loss": 2.6705, "step": 16620 }, { "epoch": 1.23, "grad_norm": 5.452235221862793, "learning_rate": 7.107967064663741e-05, "loss": 2.5686, "step": 16630 }, { "epoch": 1.23, "grad_norm": 5.695895195007324, "learning_rate": 7.096276592068743e-05, "loss": 2.8169, "step": 16640 }, { "epoch": 1.23, "grad_norm": 5.076992034912109, "learning_rate": 7.08459045171874e-05, "loss": 2.4833, "step": 16650 }, { "epoch": 1.23, "grad_norm": 5.666923999786377, "learning_rate": 7.072908661049005e-05, "loss": 2.5815, "step": 16660 }, { "epoch": 1.23, "grad_norm": 4.95028829574585, "learning_rate": 7.061231237488326e-05, "loss": 2.4393, "step": 16670 }, { "epoch": 1.23, "grad_norm": 5.579570293426514, "learning_rate": 7.049558198458981e-05, "loss": 2.7396, "step": 16680 }, { "epoch": 1.23, "grad_norm": 6.172384262084961, "learning_rate": 7.037889561376696e-05, "loss": 2.5335, "step": 16690 }, { "epoch": 1.23, "grad_norm": 4.954216480255127, "learning_rate": 7.026225343650639e-05, "loss": 2.6123, "step": 16700 }, { "epoch": 1.23, "grad_norm": 6.319690227508545, "learning_rate": 7.014565562683373e-05, "loss": 2.6801, "step": 16710 }, { "epoch": 1.24, "grad_norm": 4.945847034454346, "learning_rate": 7.002910235870851e-05, "loss": 2.42, "step": 16720 }, { "epoch": 1.24, "grad_norm": 7.983598709106445, "learning_rate": 6.991259380602379e-05, "loss": 2.5028, "step": 16730 }, { "epoch": 1.24, "grad_norm": 9.160069465637207, "learning_rate": 6.979613014260591e-05, "loss": 2.4809, "step": 16740 }, { "epoch": 1.24, "grad_norm": 5.566466808319092, "learning_rate": 6.96797115422142e-05, "loss": 2.3794, "step": 16750 }, { "epoch": 1.24, "grad_norm": 5.244190216064453, "learning_rate": 6.956333817854079e-05, "loss": 2.8169, "step": 16760 }, { "epoch": 1.24, "grad_norm": 3.622380256652832, "learning_rate": 6.944701022521034e-05, "loss": 2.3658, "step": 16770 }, { "epoch": 1.24, "grad_norm": 5.913341522216797, "learning_rate": 6.933072785577973e-05, "loss": 2.7368, "step": 16780 }, { "epoch": 1.24, "grad_norm": 6.090620994567871, "learning_rate": 6.921449124373787e-05, "loss": 2.6396, "step": 16790 }, { "epoch": 1.24, "grad_norm": 7.094319820404053, "learning_rate": 6.909830056250527e-05, "loss": 2.6005, "step": 16800 }, { "epoch": 1.24, "eval_loss": 2.7737345695495605, "eval_runtime": 1137.0285, "eval_samples_per_second": 5.013, "eval_steps_per_second": 5.013, "step": 16800 }, { "epoch": 1.24, "grad_norm": 4.8968353271484375, "learning_rate": 6.900538120419681e-05, "loss": 2.5549, "step": 16810 }, { "epoch": 1.24, "grad_norm": 5.737145900726318, "learning_rate": 6.888927363522204e-05, "loss": 2.6856, "step": 16820 }, { "epoch": 1.24, "grad_norm": 3.957963466644287, "learning_rate": 6.877321248226894e-05, "loss": 2.5952, "step": 16830 }, { "epoch": 1.24, "grad_norm": 4.489877223968506, "learning_rate": 6.865719791849628e-05, "loss": 2.7842, "step": 16840 }, { "epoch": 1.24, "grad_norm": 4.478295803070068, "learning_rate": 6.854123011699339e-05, "loss": 2.8712, "step": 16850 }, { "epoch": 1.25, "grad_norm": 5.02951717376709, "learning_rate": 6.842530925077986e-05, "loss": 2.4217, "step": 16860 }, { "epoch": 1.25, "grad_norm": 5.9152631759643555, "learning_rate": 6.830943549280519e-05, "loss": 2.743, "step": 16870 }, { "epoch": 1.25, "grad_norm": 4.8398637771606445, "learning_rate": 6.819360901594866e-05, "loss": 2.5406, "step": 16880 }, { "epoch": 1.25, "grad_norm": 6.63694429397583, "learning_rate": 6.807782999301893e-05, "loss": 2.6179, "step": 16890 }, { "epoch": 1.25, "grad_norm": 6.521999835968018, "learning_rate": 6.796209859675391e-05, "loss": 2.596, "step": 16900 }, { "epoch": 1.25, "grad_norm": 4.723524570465088, "learning_rate": 6.784641499982045e-05, "loss": 2.5729, "step": 16910 }, { "epoch": 1.25, "grad_norm": 4.5919880867004395, "learning_rate": 6.773077937481409e-05, "loss": 2.6229, "step": 16920 }, { "epoch": 1.25, "grad_norm": 5.574059963226318, "learning_rate": 6.76151918942588e-05, "loss": 2.7673, "step": 16930 }, { "epoch": 1.25, "grad_norm": 6.148488521575928, "learning_rate": 6.751120446779786e-05, "loss": 2.7547, "step": 16940 }, { "epoch": 1.25, "grad_norm": 6.633347988128662, "learning_rate": 6.73957089367456e-05, "loss": 2.473, "step": 16950 }, { "epoch": 1.25, "grad_norm": 7.267597198486328, "learning_rate": 6.728026205005675e-05, "loss": 2.7067, "step": 16960 }, { "epoch": 1.25, "grad_norm": 7.949811935424805, "learning_rate": 6.716486397997373e-05, "loss": 2.6054, "step": 16970 }, { "epoch": 1.25, "grad_norm": 4.672689914703369, "learning_rate": 6.7049514898666e-05, "loss": 2.3211, "step": 16980 }, { "epoch": 1.26, "grad_norm": 5.937682628631592, "learning_rate": 6.693421497823001e-05, "loss": 2.7239, "step": 16990 }, { "epoch": 1.26, "grad_norm": 7.0608086585998535, "learning_rate": 6.681896439068893e-05, "loss": 2.4637, "step": 17000 }, { "epoch": 1.26, "eval_loss": 2.7728655338287354, "eval_runtime": 1091.9813, "eval_samples_per_second": 5.22, "eval_steps_per_second": 5.22, "step": 17000 }, { "epoch": 1.26, "grad_norm": 5.499873638153076, "learning_rate": 6.670376330799217e-05, "loss": 2.6289, "step": 17010 }, { "epoch": 1.26, "grad_norm": 4.307833194732666, "learning_rate": 6.658861190201547e-05, "loss": 2.392, "step": 17020 }, { "epoch": 1.26, "grad_norm": 5.94236421585083, "learning_rate": 6.647351034456027e-05, "loss": 2.5595, "step": 17030 }, { "epoch": 1.26, "grad_norm": 4.513247489929199, "learning_rate": 6.635845880735373e-05, "loss": 2.3705, "step": 17040 }, { "epoch": 1.26, "grad_norm": 4.779393672943115, "learning_rate": 6.624345746204841e-05, "loss": 2.4923, "step": 17050 }, { "epoch": 1.26, "grad_norm": 4.398991107940674, "learning_rate": 6.612850648022189e-05, "loss": 2.4459, "step": 17060 }, { "epoch": 1.26, "grad_norm": 5.860241889953613, "learning_rate": 6.601360603337677e-05, "loss": 2.5656, "step": 17070 }, { "epoch": 1.26, "grad_norm": 5.763365268707275, "learning_rate": 6.589875629294003e-05, "loss": 2.419, "step": 17080 }, { "epoch": 1.26, "grad_norm": 4.705411434173584, "learning_rate": 6.578395743026318e-05, "loss": 2.6694, "step": 17090 }, { "epoch": 1.26, "grad_norm": 8.145054817199707, "learning_rate": 6.566920961662175e-05, "loss": 2.5453, "step": 17100 }, { "epoch": 1.26, "grad_norm": 6.116779804229736, "learning_rate": 6.555451302321515e-05, "loss": 2.5598, "step": 17110 }, { "epoch": 1.26, "grad_norm": 9.881659507751465, "learning_rate": 6.543986782116628e-05, "loss": 2.4526, "step": 17120 }, { "epoch": 1.27, "grad_norm": 5.976058006286621, "learning_rate": 6.532527418152147e-05, "loss": 2.5674, "step": 17130 }, { "epoch": 1.27, "grad_norm": 4.460546493530273, "learning_rate": 6.521073227525003e-05, "loss": 2.3611, "step": 17140 }, { "epoch": 1.27, "grad_norm": 6.480743885040283, "learning_rate": 6.50962422732442e-05, "loss": 2.6928, "step": 17150 }, { "epoch": 1.27, "grad_norm": 5.8814473152160645, "learning_rate": 6.498180434631868e-05, "loss": 2.5817, "step": 17160 }, { "epoch": 1.27, "grad_norm": 4.516665935516357, "learning_rate": 6.486741866521049e-05, "loss": 2.9759, "step": 17170 }, { "epoch": 1.27, "grad_norm": 5.590062618255615, "learning_rate": 6.475308540057873e-05, "loss": 2.3737, "step": 17180 }, { "epoch": 1.27, "grad_norm": 5.345756530761719, "learning_rate": 6.46388047230043e-05, "loss": 2.6671, "step": 17190 }, { "epoch": 1.27, "grad_norm": 6.258466720581055, "learning_rate": 6.45245768029896e-05, "loss": 2.5461, "step": 17200 }, { "epoch": 1.27, "eval_loss": 2.767456531524658, "eval_runtime": 1089.0078, "eval_samples_per_second": 5.234, "eval_steps_per_second": 5.234, "step": 17200 }, { "epoch": 1.27, "grad_norm": 6.09370231628418, "learning_rate": 6.441040181095841e-05, "loss": 2.6281, "step": 17210 }, { "epoch": 1.27, "grad_norm": 5.456587314605713, "learning_rate": 6.429627991725541e-05, "loss": 2.5189, "step": 17220 }, { "epoch": 1.27, "grad_norm": 7.850766658782959, "learning_rate": 6.418221129214616e-05, "loss": 2.7745, "step": 17230 }, { "epoch": 1.27, "grad_norm": 7.215473651885986, "learning_rate": 6.406819610581671e-05, "loss": 2.4249, "step": 17240 }, { "epoch": 1.27, "grad_norm": 5.151793479919434, "learning_rate": 6.39542345283734e-05, "loss": 2.5455, "step": 17250 }, { "epoch": 1.28, "grad_norm": 4.555073261260986, "learning_rate": 6.384032672984256e-05, "loss": 2.849, "step": 17260 }, { "epoch": 1.28, "grad_norm": 5.082034587860107, "learning_rate": 6.372647288017029e-05, "loss": 2.7734, "step": 17270 }, { "epoch": 1.28, "grad_norm": 5.69696569442749, "learning_rate": 6.36126731492222e-05, "loss": 2.5211, "step": 17280 }, { "epoch": 1.28, "grad_norm": 4.185813903808594, "learning_rate": 6.349892770678319e-05, "loss": 2.601, "step": 17290 }, { "epoch": 1.28, "grad_norm": 4.5403594970703125, "learning_rate": 6.338523672255716e-05, "loss": 2.6715, "step": 17300 }, { "epoch": 1.28, "grad_norm": 7.941657066345215, "learning_rate": 6.327160036616665e-05, "loss": 2.4868, "step": 17310 }, { "epoch": 1.28, "grad_norm": 4.206854820251465, "learning_rate": 6.315801880715286e-05, "loss": 2.4604, "step": 17320 }, { "epoch": 1.28, "grad_norm": 5.025691032409668, "learning_rate": 6.304449221497515e-05, "loss": 2.2965, "step": 17330 }, { "epoch": 1.28, "grad_norm": 4.888176918029785, "learning_rate": 6.293102075901087e-05, "loss": 2.5464, "step": 17340 }, { "epoch": 1.28, "grad_norm": 5.918951988220215, "learning_rate": 6.281760460855515e-05, "loss": 2.5731, "step": 17350 }, { "epoch": 1.28, "grad_norm": 5.8334431648254395, "learning_rate": 6.270424393282052e-05, "loss": 2.6812, "step": 17360 }, { "epoch": 1.28, "grad_norm": 5.946429252624512, "learning_rate": 6.259093890093685e-05, "loss": 2.4973, "step": 17370 }, { "epoch": 1.28, "grad_norm": 8.533334732055664, "learning_rate": 6.247768968195089e-05, "loss": 2.4206, "step": 17380 }, { "epoch": 1.28, "grad_norm": 5.1779656410217285, "learning_rate": 6.236449644482625e-05, "loss": 2.6378, "step": 17390 }, { "epoch": 1.29, "grad_norm": 5.802103519439697, "learning_rate": 6.22513593584429e-05, "loss": 2.3879, "step": 17400 }, { "epoch": 1.29, "eval_loss": 2.7677671909332275, "eval_runtime": 1093.1356, "eval_samples_per_second": 5.214, "eval_steps_per_second": 5.214, "step": 17400 }, { "epoch": 1.29, "grad_norm": 4.996272563934326, "learning_rate": 6.213827859159704e-05, "loss": 2.467, "step": 17410 }, { "epoch": 1.29, "grad_norm": 7.919410705566406, "learning_rate": 6.202525431300092e-05, "loss": 2.4002, "step": 17420 }, { "epoch": 1.29, "grad_norm": 6.724912166595459, "learning_rate": 6.191228669128243e-05, "loss": 2.5839, "step": 17430 }, { "epoch": 1.29, "grad_norm": 5.3846821784973145, "learning_rate": 6.179937589498504e-05, "loss": 2.5401, "step": 17440 }, { "epoch": 1.29, "grad_norm": 5.267107963562012, "learning_rate": 6.168652209256733e-05, "loss": 2.511, "step": 17450 }, { "epoch": 1.29, "grad_norm": 5.296595573425293, "learning_rate": 6.157372545240284e-05, "loss": 2.7247, "step": 17460 }, { "epoch": 1.29, "grad_norm": 6.33009147644043, "learning_rate": 6.146098614277993e-05, "loss": 2.6327, "step": 17470 }, { "epoch": 1.29, "grad_norm": 4.728981018066406, "learning_rate": 6.134830433190132e-05, "loss": 2.412, "step": 17480 }, { "epoch": 1.29, "grad_norm": 5.756034851074219, "learning_rate": 6.123568018788406e-05, "loss": 2.6223, "step": 17490 }, { "epoch": 1.29, "grad_norm": 4.870009422302246, "learning_rate": 6.112311387875905e-05, "loss": 2.6898, "step": 17500 }, { "epoch": 1.29, "grad_norm": 6.132648944854736, "learning_rate": 6.1010605572470906e-05, "loss": 2.7397, "step": 17510 }, { "epoch": 1.29, "grad_norm": 4.839498996734619, "learning_rate": 6.089815543687778e-05, "loss": 2.585, "step": 17520 }, { "epoch": 1.29, "grad_norm": 4.22407865524292, "learning_rate": 6.0785763639751045e-05, "loss": 2.4158, "step": 17530 }, { "epoch": 1.3, "grad_norm": 4.960424900054932, "learning_rate": 6.0673430348774974e-05, "loss": 2.4941, "step": 17540 }, { "epoch": 1.3, "grad_norm": 4.620213031768799, "learning_rate": 6.0561155731546506e-05, "loss": 2.6422, "step": 17550 }, { "epoch": 1.3, "grad_norm": 4.822215557098389, "learning_rate": 6.0448939955575154e-05, "loss": 2.7949, "step": 17560 }, { "epoch": 1.3, "grad_norm": 7.760210990905762, "learning_rate": 6.033678318828258e-05, "loss": 2.5389, "step": 17570 }, { "epoch": 1.3, "grad_norm": 5.080504417419434, "learning_rate": 6.022468559700244e-05, "loss": 2.6633, "step": 17580 }, { "epoch": 1.3, "grad_norm": 4.475546360015869, "learning_rate": 6.011264734898008e-05, "loss": 2.5215, "step": 17590 }, { "epoch": 1.3, "grad_norm": 4.916598320007324, "learning_rate": 6.000066861137227e-05, "loss": 2.5776, "step": 17600 }, { "epoch": 1.3, "eval_loss": 2.7586658000946045, "eval_runtime": 1090.7682, "eval_samples_per_second": 5.226, "eval_steps_per_second": 5.226, "step": 17600 }, { "epoch": 1.3, "grad_norm": 5.858465194702148, "learning_rate": 5.988874955124706e-05, "loss": 2.5892, "step": 17610 }, { "epoch": 1.3, "grad_norm": 6.47125768661499, "learning_rate": 5.977689033558342e-05, "loss": 2.626, "step": 17620 }, { "epoch": 1.3, "grad_norm": 6.5208868980407715, "learning_rate": 5.966509113127108e-05, "loss": 2.6554, "step": 17630 }, { "epoch": 1.3, "grad_norm": 3.4920830726623535, "learning_rate": 5.95533521051102e-05, "loss": 2.3402, "step": 17640 }, { "epoch": 1.3, "grad_norm": 4.840210914611816, "learning_rate": 5.9441673423811116e-05, "loss": 2.8223, "step": 17650 }, { "epoch": 1.3, "grad_norm": 5.344911098480225, "learning_rate": 5.933005525399422e-05, "loss": 2.6713, "step": 17660 }, { "epoch": 1.31, "grad_norm": 5.766901969909668, "learning_rate": 5.921849776218956e-05, "loss": 2.6337, "step": 17670 }, { "epoch": 1.31, "grad_norm": 7.614682674407959, "learning_rate": 5.910700111483671e-05, "loss": 2.7618, "step": 17680 }, { "epoch": 1.31, "grad_norm": 4.827087879180908, "learning_rate": 5.8995565478284396e-05, "loss": 2.5264, "step": 17690 }, { "epoch": 1.31, "grad_norm": 5.416106700897217, "learning_rate": 5.8884191018790345e-05, "loss": 2.578, "step": 17700 }, { "epoch": 1.31, "grad_norm": 6.153903961181641, "learning_rate": 5.877287790252104e-05, "loss": 2.7986, "step": 17710 }, { "epoch": 1.31, "grad_norm": 5.478076934814453, "learning_rate": 5.866162629555141e-05, "loss": 2.4586, "step": 17720 }, { "epoch": 1.31, "grad_norm": 4.835690975189209, "learning_rate": 5.855043636386467e-05, "loss": 2.7115, "step": 17730 }, { "epoch": 1.31, "grad_norm": 5.365401268005371, "learning_rate": 5.8439308273351915e-05, "loss": 2.4824, "step": 17740 }, { "epoch": 1.31, "grad_norm": 4.931309700012207, "learning_rate": 5.832824218981206e-05, "loss": 2.8054, "step": 17750 }, { "epoch": 1.31, "grad_norm": 5.70919942855835, "learning_rate": 5.821723827895145e-05, "loss": 2.4396, "step": 17760 }, { "epoch": 1.31, "grad_norm": 4.619261741638184, "learning_rate": 5.810629670638372e-05, "loss": 2.6127, "step": 17770 }, { "epoch": 1.31, "grad_norm": 7.530084133148193, "learning_rate": 5.7995417637629533e-05, "loss": 2.3805, "step": 17780 }, { "epoch": 1.31, "grad_norm": 7.491077899932861, "learning_rate": 5.788460123811617e-05, "loss": 2.5465, "step": 17790 }, { "epoch": 1.31, "grad_norm": 5.97875452041626, "learning_rate": 5.777384767317755e-05, "loss": 2.9236, "step": 17800 }, { "epoch": 1.31, "eval_loss": 2.7564563751220703, "eval_runtime": 1093.0048, "eval_samples_per_second": 5.215, "eval_steps_per_second": 5.215, "step": 17800 }, { "epoch": 1.32, "grad_norm": 4.824826717376709, "learning_rate": 5.7663157108053726e-05, "loss": 2.7555, "step": 17810 }, { "epoch": 1.32, "grad_norm": 7.008066654205322, "learning_rate": 5.7552529707890846e-05, "loss": 2.7833, "step": 17820 }, { "epoch": 1.32, "grad_norm": 7.4979119300842285, "learning_rate": 5.744196563774081e-05, "loss": 2.7585, "step": 17830 }, { "epoch": 1.32, "grad_norm": 10.446072578430176, "learning_rate": 5.7331465062560955e-05, "loss": 2.4665, "step": 17840 }, { "epoch": 1.32, "grad_norm": 7.174097537994385, "learning_rate": 5.722102814721397e-05, "loss": 2.7389, "step": 17850 }, { "epoch": 1.32, "grad_norm": 4.553163528442383, "learning_rate": 5.711065505646758e-05, "loss": 2.3752, "step": 17860 }, { "epoch": 1.32, "grad_norm": 7.095092296600342, "learning_rate": 5.7000345954994195e-05, "loss": 2.6126, "step": 17870 }, { "epoch": 1.32, "grad_norm": 4.0461225509643555, "learning_rate": 5.6890101007370774e-05, "loss": 2.6694, "step": 17880 }, { "epoch": 1.32, "grad_norm": 4.112511157989502, "learning_rate": 5.677992037807862e-05, "loss": 2.5869, "step": 17890 }, { "epoch": 1.32, "grad_norm": 4.1515936851501465, "learning_rate": 5.6669804231503044e-05, "loss": 2.605, "step": 17900 }, { "epoch": 1.32, "grad_norm": 5.27680778503418, "learning_rate": 5.65597527319332e-05, "loss": 2.6241, "step": 17910 }, { "epoch": 1.32, "grad_norm": 5.956172943115234, "learning_rate": 5.64497660435617e-05, "loss": 2.5378, "step": 17920 }, { "epoch": 1.32, "grad_norm": 4.933371543884277, "learning_rate": 5.633984433048447e-05, "loss": 2.5712, "step": 17930 }, { "epoch": 1.33, "grad_norm": 4.546905040740967, "learning_rate": 5.622998775670056e-05, "loss": 2.5774, "step": 17940 }, { "epoch": 1.33, "grad_norm": 6.605489730834961, "learning_rate": 5.612019648611182e-05, "loss": 2.5219, "step": 17950 }, { "epoch": 1.33, "grad_norm": 4.056662559509277, "learning_rate": 5.6010470682522676e-05, "loss": 2.5671, "step": 17960 }, { "epoch": 1.33, "grad_norm": 5.21044397354126, "learning_rate": 5.590081050963982e-05, "loss": 2.2072, "step": 17970 }, { "epoch": 1.33, "grad_norm": 4.24269437789917, "learning_rate": 5.579121613107203e-05, "loss": 2.529, "step": 17980 }, { "epoch": 1.33, "grad_norm": 8.877058982849121, "learning_rate": 5.568168771033e-05, "loss": 2.728, "step": 17990 }, { "epoch": 1.33, "grad_norm": 5.2844719886779785, "learning_rate": 5.557222541082595e-05, "loss": 2.5198, "step": 18000 }, { "epoch": 1.33, "eval_loss": 2.754932403564453, "eval_runtime": 1090.3866, "eval_samples_per_second": 5.228, "eval_steps_per_second": 5.228, "step": 18000 }, { "epoch": 1.33, "grad_norm": 5.77738618850708, "learning_rate": 5.546282939587354e-05, "loss": 2.4213, "step": 18010 }, { "epoch": 1.33, "grad_norm": 8.9447660446167, "learning_rate": 5.535349982868741e-05, "loss": 2.6623, "step": 18020 }, { "epoch": 1.33, "grad_norm": 4.4816203117370605, "learning_rate": 5.524423687238307e-05, "loss": 2.6124, "step": 18030 }, { "epoch": 1.33, "grad_norm": 6.370791912078857, "learning_rate": 5.513504068997677e-05, "loss": 2.705, "step": 18040 }, { "epoch": 1.33, "grad_norm": 7.344057083129883, "learning_rate": 5.502591144438505e-05, "loss": 2.5722, "step": 18050 }, { "epoch": 1.33, "grad_norm": 3.716496706008911, "learning_rate": 5.4916849298424625e-05, "loss": 2.6213, "step": 18060 }, { "epoch": 1.33, "grad_norm": 4.81427001953125, "learning_rate": 5.4807854414812046e-05, "loss": 2.5988, "step": 18070 }, { "epoch": 1.34, "grad_norm": 4.7489824295043945, "learning_rate": 5.46989269561635e-05, "loss": 2.578, "step": 18080 }, { "epoch": 1.34, "grad_norm": 4.938182353973389, "learning_rate": 5.4590067084994634e-05, "loss": 2.3349, "step": 18090 }, { "epoch": 1.34, "grad_norm": 5.349028587341309, "learning_rate": 5.4481274963720286e-05, "loss": 2.4367, "step": 18100 }, { "epoch": 1.34, "grad_norm": 3.091707468032837, "learning_rate": 5.437255075465415e-05, "loss": 2.5173, "step": 18110 }, { "epoch": 1.34, "grad_norm": 3.6265087127685547, "learning_rate": 5.4263894620008626e-05, "loss": 2.5161, "step": 18120 }, { "epoch": 1.34, "grad_norm": 4.735933780670166, "learning_rate": 5.4155306721894464e-05, "loss": 2.6293, "step": 18130 }, { "epoch": 1.34, "grad_norm": 9.483357429504395, "learning_rate": 5.404678722232075e-05, "loss": 2.3463, "step": 18140 }, { "epoch": 1.34, "grad_norm": 2.9575343132019043, "learning_rate": 5.3938336283194424e-05, "loss": 2.522, "step": 18150 }, { "epoch": 1.34, "grad_norm": 5.901381969451904, "learning_rate": 5.382995406632021e-05, "loss": 2.6077, "step": 18160 }, { "epoch": 1.34, "grad_norm": 5.906281471252441, "learning_rate": 5.3721640733400205e-05, "loss": 2.6513, "step": 18170 }, { "epoch": 1.34, "grad_norm": 6.043822288513184, "learning_rate": 5.361339644603385e-05, "loss": 2.707, "step": 18180 }, { "epoch": 1.34, "grad_norm": 7.317911148071289, "learning_rate": 5.350522136571742e-05, "loss": 2.7309, "step": 18190 }, { "epoch": 1.34, "grad_norm": 3.808610439300537, "learning_rate": 5.339711565384408e-05, "loss": 2.7111, "step": 18200 }, { "epoch": 1.34, "eval_loss": 2.749652624130249, "eval_runtime": 1093.3945, "eval_samples_per_second": 5.213, "eval_steps_per_second": 5.213, "step": 18200 }, { "epoch": 1.35, "grad_norm": 6.145906925201416, "learning_rate": 5.328907947170346e-05, "loss": 2.5983, "step": 18210 }, { "epoch": 1.35, "grad_norm": 6.049194812774658, "learning_rate": 5.3181112980481386e-05, "loss": 3.05, "step": 18220 }, { "epoch": 1.35, "grad_norm": 8.137819290161133, "learning_rate": 5.307321634125983e-05, "loss": 2.5698, "step": 18230 }, { "epoch": 1.35, "grad_norm": 5.600856781005859, "learning_rate": 5.2965389715016414e-05, "loss": 2.4588, "step": 18240 }, { "epoch": 1.35, "grad_norm": 4.875741481781006, "learning_rate": 5.2857633262624365e-05, "loss": 2.7632, "step": 18250 }, { "epoch": 1.35, "grad_norm": 6.16823673248291, "learning_rate": 5.274994714485229e-05, "loss": 2.6179, "step": 18260 }, { "epoch": 1.35, "grad_norm": 6.03982400894165, "learning_rate": 5.264233152236371e-05, "loss": 2.676, "step": 18270 }, { "epoch": 1.35, "grad_norm": 6.995283603668213, "learning_rate": 5.2534786555717106e-05, "loss": 2.6739, "step": 18280 }, { "epoch": 1.35, "grad_norm": 5.1484270095825195, "learning_rate": 5.24273124053654e-05, "loss": 2.5794, "step": 18290 }, { "epoch": 1.35, "grad_norm": 4.117734432220459, "learning_rate": 5.231990923165604e-05, "loss": 2.5715, "step": 18300 }, { "epoch": 1.35, "grad_norm": 4.1332268714904785, "learning_rate": 5.221257719483037e-05, "loss": 2.5544, "step": 18310 }, { "epoch": 1.35, "grad_norm": 5.754079341888428, "learning_rate": 5.210531645502379e-05, "loss": 2.5192, "step": 18320 }, { "epoch": 1.35, "grad_norm": 4.778247833251953, "learning_rate": 5.199812717226525e-05, "loss": 2.4673, "step": 18330 }, { "epoch": 1.35, "grad_norm": 4.264052391052246, "learning_rate": 5.189100950647703e-05, "loss": 2.7163, "step": 18340 }, { "epoch": 1.36, "grad_norm": 6.049769401550293, "learning_rate": 5.178396361747471e-05, "loss": 2.4899, "step": 18350 }, { "epoch": 1.36, "grad_norm": 4.8760762214660645, "learning_rate": 5.1676989664966566e-05, "loss": 2.6234, "step": 18360 }, { "epoch": 1.36, "grad_norm": 4.067619323730469, "learning_rate": 5.1570087808553745e-05, "loss": 2.6173, "step": 18370 }, { "epoch": 1.36, "grad_norm": 5.356283187866211, "learning_rate": 5.146325820772979e-05, "loss": 2.5618, "step": 18380 }, { "epoch": 1.36, "grad_norm": 5.027037143707275, "learning_rate": 5.135650102188032e-05, "loss": 2.3784, "step": 18390 }, { "epoch": 1.36, "grad_norm": 7.661667823791504, "learning_rate": 5.124981641028307e-05, "loss": 2.4899, "step": 18400 }, { "epoch": 1.36, "eval_loss": 2.7469968795776367, "eval_runtime": 1090.5801, "eval_samples_per_second": 5.227, "eval_steps_per_second": 5.227, "step": 18400 }, { "epoch": 1.36, "grad_norm": 5.477719306945801, "learning_rate": 5.114320453210737e-05, "loss": 2.6192, "step": 18410 }, { "epoch": 1.36, "grad_norm": 4.8712077140808105, "learning_rate": 5.1036665546414107e-05, "loss": 2.6542, "step": 18420 }, { "epoch": 1.36, "grad_norm": 4.96636438369751, "learning_rate": 5.0930199612155474e-05, "loss": 2.7382, "step": 18430 }, { "epoch": 1.36, "grad_norm": 5.233584880828857, "learning_rate": 5.082380688817447e-05, "loss": 2.812, "step": 18440 }, { "epoch": 1.36, "grad_norm": 6.871877193450928, "learning_rate": 5.0717487533205134e-05, "loss": 2.5341, "step": 18450 }, { "epoch": 1.36, "grad_norm": 8.461257934570312, "learning_rate": 5.061124170587177e-05, "loss": 2.4915, "step": 18460 }, { "epoch": 1.36, "grad_norm": 7.310083866119385, "learning_rate": 5.05050695646892e-05, "loss": 2.6074, "step": 18470 }, { "epoch": 1.37, "grad_norm": 4.759759426116943, "learning_rate": 5.039897126806219e-05, "loss": 2.7039, "step": 18480 }, { "epoch": 1.37, "grad_norm": 6.0547661781311035, "learning_rate": 5.029294697428546e-05, "loss": 2.512, "step": 18490 }, { "epoch": 1.37, "grad_norm": 7.052810192108154, "learning_rate": 5.018699684154309e-05, "loss": 2.5677, "step": 18500 }, { "epoch": 1.37, "grad_norm": 5.241086959838867, "learning_rate": 5.0081121027908694e-05, "loss": 2.5115, "step": 18510 }, { "epoch": 1.37, "grad_norm": 6.727292537689209, "learning_rate": 4.997531969134498e-05, "loss": 2.563, "step": 18520 }, { "epoch": 1.37, "grad_norm": 4.072869777679443, "learning_rate": 4.986959298970352e-05, "loss": 2.3717, "step": 18530 }, { "epoch": 1.37, "grad_norm": 5.985363006591797, "learning_rate": 4.976394108072458e-05, "loss": 2.6702, "step": 18540 }, { "epoch": 1.37, "grad_norm": 8.397250175476074, "learning_rate": 4.965836412203676e-05, "loss": 2.3954, "step": 18550 }, { "epoch": 1.37, "grad_norm": 6.862022876739502, "learning_rate": 4.9552862271156816e-05, "loss": 2.8558, "step": 18560 }, { "epoch": 1.37, "grad_norm": 6.360130310058594, "learning_rate": 4.9447435685489554e-05, "loss": 2.6074, "step": 18570 }, { "epoch": 1.37, "grad_norm": 7.378839492797852, "learning_rate": 4.934208452232743e-05, "loss": 2.566, "step": 18580 }, { "epoch": 1.37, "grad_norm": 5.3151445388793945, "learning_rate": 4.92368089388504e-05, "loss": 2.6158, "step": 18590 }, { "epoch": 1.37, "grad_norm": 5.593037128448486, "learning_rate": 4.913160909212561e-05, "loss": 2.4031, "step": 18600 }, { "epoch": 1.37, "eval_loss": 2.7402687072753906, "eval_runtime": 1093.0065, "eval_samples_per_second": 5.215, "eval_steps_per_second": 5.215, "step": 18600 }, { "epoch": 1.37, "grad_norm": 5.234645843505859, "learning_rate": 4.9026485139107206e-05, "loss": 2.4703, "step": 18610 }, { "epoch": 1.38, "grad_norm": 4.557468414306641, "learning_rate": 4.892143723663615e-05, "loss": 2.6366, "step": 18620 }, { "epoch": 1.38, "grad_norm": 5.67350435256958, "learning_rate": 4.8816465541439926e-05, "loss": 2.5127, "step": 18630 }, { "epoch": 1.38, "grad_norm": 4.1222357749938965, "learning_rate": 4.8711570210132355e-05, "loss": 2.7097, "step": 18640 }, { "epoch": 1.38, "grad_norm": 8.09947681427002, "learning_rate": 4.860675139921326e-05, "loss": 2.5276, "step": 18650 }, { "epoch": 1.38, "grad_norm": 5.646274566650391, "learning_rate": 4.850200926506826e-05, "loss": 2.5764, "step": 18660 }, { "epoch": 1.38, "grad_norm": 5.521486759185791, "learning_rate": 4.83973439639687e-05, "loss": 2.6867, "step": 18670 }, { "epoch": 1.38, "grad_norm": 7.946648120880127, "learning_rate": 4.829275565207126e-05, "loss": 2.6472, "step": 18680 }, { "epoch": 1.38, "grad_norm": 5.645473480224609, "learning_rate": 4.8188244485417656e-05, "loss": 2.8183, "step": 18690 }, { "epoch": 1.38, "grad_norm": 4.875026226043701, "learning_rate": 4.8083810619934655e-05, "loss": 2.6745, "step": 18700 }, { "epoch": 1.38, "grad_norm": 6.1913838386535645, "learning_rate": 4.797945421143353e-05, "loss": 2.5512, "step": 18710 }, { "epoch": 1.38, "grad_norm": 4.89860725402832, "learning_rate": 4.7875175415610116e-05, "loss": 2.6048, "step": 18720 }, { "epoch": 1.38, "grad_norm": 6.097682476043701, "learning_rate": 4.7770974388044465e-05, "loss": 2.4741, "step": 18730 }, { "epoch": 1.38, "grad_norm": 11.050512313842773, "learning_rate": 4.7666851284200474e-05, "loss": 2.9075, "step": 18740 }, { "epoch": 1.39, "grad_norm": 3.9821629524230957, "learning_rate": 4.756280625942592e-05, "loss": 2.4667, "step": 18750 }, { "epoch": 1.39, "grad_norm": 5.043511390686035, "learning_rate": 4.745883946895195e-05, "loss": 2.622, "step": 18760 }, { "epoch": 1.39, "grad_norm": 5.638186931610107, "learning_rate": 4.735495106789313e-05, "loss": 2.5786, "step": 18770 }, { "epoch": 1.39, "grad_norm": 4.257643699645996, "learning_rate": 4.7251141211247006e-05, "loss": 2.6245, "step": 18780 }, { "epoch": 1.39, "grad_norm": 4.530847549438477, "learning_rate": 4.714741005389389e-05, "loss": 2.6005, "step": 18790 }, { "epoch": 1.39, "grad_norm": 6.788181781768799, "learning_rate": 4.704375775059676e-05, "loss": 2.5644, "step": 18800 }, { "epoch": 1.39, "eval_loss": 2.730058193206787, "eval_runtime": 1092.4553, "eval_samples_per_second": 5.218, "eval_steps_per_second": 5.218, "step": 18800 }, { "epoch": 1.39, "grad_norm": 6.159169673919678, "learning_rate": 4.694018445600096e-05, "loss": 2.6734, "step": 18810 }, { "epoch": 1.39, "grad_norm": 4.513409614562988, "learning_rate": 4.683669032463381e-05, "loss": 2.3646, "step": 18820 }, { "epoch": 1.39, "grad_norm": 4.685541152954102, "learning_rate": 4.673327551090473e-05, "loss": 2.7987, "step": 18830 }, { "epoch": 1.39, "grad_norm": 6.203521251678467, "learning_rate": 4.662994016910458e-05, "loss": 3.0138, "step": 18840 }, { "epoch": 1.39, "grad_norm": 7.593812465667725, "learning_rate": 4.652668445340583e-05, "loss": 2.5891, "step": 18850 }, { "epoch": 1.39, "grad_norm": 7.254190921783447, "learning_rate": 4.642350851786212e-05, "loss": 2.6145, "step": 18860 }, { "epoch": 1.39, "grad_norm": 5.389431953430176, "learning_rate": 4.632041251640794e-05, "loss": 2.5423, "step": 18870 }, { "epoch": 1.39, "grad_norm": 4.145481109619141, "learning_rate": 4.6217396602858676e-05, "loss": 2.3867, "step": 18880 }, { "epoch": 1.4, "grad_norm": 3.993748426437378, "learning_rate": 4.61144609309101e-05, "loss": 2.5064, "step": 18890 }, { "epoch": 1.4, "grad_norm": 3.0699574947357178, "learning_rate": 4.601160565413834e-05, "loss": 2.6125, "step": 18900 }, { "epoch": 1.4, "grad_norm": 4.14170503616333, "learning_rate": 4.5908830925999625e-05, "loss": 2.3033, "step": 18910 }, { "epoch": 1.4, "grad_norm": 5.7811689376831055, "learning_rate": 4.580613689982989e-05, "loss": 2.5909, "step": 18920 }, { "epoch": 1.4, "grad_norm": 4.923642158508301, "learning_rate": 4.5703523728844675e-05, "loss": 2.7412, "step": 18930 }, { "epoch": 1.4, "grad_norm": 5.698610782623291, "learning_rate": 4.560099156613898e-05, "loss": 2.553, "step": 18940 }, { "epoch": 1.4, "grad_norm": 7.011173248291016, "learning_rate": 4.549854056468691e-05, "loss": 2.6452, "step": 18950 }, { "epoch": 1.4, "grad_norm": 4.988110542297363, "learning_rate": 4.539617087734148e-05, "loss": 2.5394, "step": 18960 }, { "epoch": 1.4, "grad_norm": 7.155890941619873, "learning_rate": 4.529388265683434e-05, "loss": 2.4347, "step": 18970 }, { "epoch": 1.4, "grad_norm": 5.443312644958496, "learning_rate": 4.51916760557756e-05, "loss": 2.6015, "step": 18980 }, { "epoch": 1.4, "grad_norm": 4.91843318939209, "learning_rate": 4.508955122665366e-05, "loss": 2.5659, "step": 18990 }, { "epoch": 1.4, "grad_norm": 4.711748123168945, "learning_rate": 4.498750832183488e-05, "loss": 2.4967, "step": 19000 }, { "epoch": 1.4, "eval_loss": 2.7299466133117676, "eval_runtime": 1091.1855, "eval_samples_per_second": 5.224, "eval_steps_per_second": 5.224, "step": 19000 }, { "epoch": 1.4, "grad_norm": 7.943491458892822, "learning_rate": 4.488554749356344e-05, "loss": 2.3547, "step": 19010 }, { "epoch": 1.41, "grad_norm": 3.8169167041778564, "learning_rate": 4.478366889396099e-05, "loss": 2.7277, "step": 19020 }, { "epoch": 1.41, "grad_norm": 6.11760950088501, "learning_rate": 4.468187267502647e-05, "loss": 2.7133, "step": 19030 }, { "epoch": 1.41, "grad_norm": 6.223377227783203, "learning_rate": 4.4580158988636035e-05, "loss": 2.5129, "step": 19040 }, { "epoch": 1.41, "grad_norm": 4.303272724151611, "learning_rate": 4.447852798654262e-05, "loss": 2.3198, "step": 19050 }, { "epoch": 1.41, "grad_norm": 8.338922500610352, "learning_rate": 4.4376979820375866e-05, "loss": 2.4968, "step": 19060 }, { "epoch": 1.41, "grad_norm": 10.990848541259766, "learning_rate": 4.427551464164173e-05, "loss": 2.785, "step": 19070 }, { "epoch": 1.41, "grad_norm": 6.105620861053467, "learning_rate": 4.4184267060155825e-05, "loss": 2.5712, "step": 19080 }, { "epoch": 1.41, "grad_norm": 4.769411087036133, "learning_rate": 4.408295997449907e-05, "loss": 2.5135, "step": 19090 }, { "epoch": 1.41, "grad_norm": 5.428181171417236, "learning_rate": 4.398173631494139e-05, "loss": 2.6994, "step": 19100 }, { "epoch": 1.41, "grad_norm": 3.8140740394592285, "learning_rate": 4.388059623250466e-05, "loss": 2.7718, "step": 19110 }, { "epoch": 1.41, "grad_norm": 4.616511821746826, "learning_rate": 4.3779539878085964e-05, "loss": 2.5677, "step": 19120 }, { "epoch": 1.41, "grad_norm": 5.239737033843994, "learning_rate": 4.367856740245764e-05, "loss": 2.7527, "step": 19130 }, { "epoch": 1.41, "grad_norm": 5.1812286376953125, "learning_rate": 4.3577678956266676e-05, "loss": 2.586, "step": 19140 }, { "epoch": 1.41, "grad_norm": 4.772936820983887, "learning_rate": 4.3476874690034875e-05, "loss": 2.4089, "step": 19150 }, { "epoch": 1.42, "grad_norm": 9.186141014099121, "learning_rate": 4.337615475415838e-05, "loss": 2.5755, "step": 19160 }, { "epoch": 1.42, "grad_norm": 4.864750385284424, "learning_rate": 4.327551929890745e-05, "loss": 2.6029, "step": 19170 }, { "epoch": 1.42, "grad_norm": 6.291383266448975, "learning_rate": 4.317496847442639e-05, "loss": 2.5028, "step": 19180 }, { "epoch": 1.42, "grad_norm": 4.985967636108398, "learning_rate": 4.3074502430733256e-05, "loss": 2.574, "step": 19190 }, { "epoch": 1.42, "grad_norm": 4.993092060089111, "learning_rate": 4.297412131771952e-05, "loss": 2.5018, "step": 19200 }, { "epoch": 1.42, "eval_loss": 2.727829694747925, "eval_runtime": 1092.1951, "eval_samples_per_second": 5.219, "eval_steps_per_second": 5.219, "step": 19200 }, { "epoch": 1.42, "grad_norm": 4.054487228393555, "learning_rate": 4.287382528514996e-05, "loss": 2.4302, "step": 19210 }, { "epoch": 1.42, "grad_norm": 12.623319625854492, "learning_rate": 4.277361448266247e-05, "loss": 2.575, "step": 19220 }, { "epoch": 1.42, "grad_norm": 5.172916889190674, "learning_rate": 4.267348905976777e-05, "loss": 2.7427, "step": 19230 }, { "epoch": 1.42, "grad_norm": 7.442451477050781, "learning_rate": 4.257344916584922e-05, "loss": 2.7931, "step": 19240 }, { "epoch": 1.42, "grad_norm": 5.107058525085449, "learning_rate": 4.247349495016252e-05, "loss": 2.4842, "step": 19250 }, { "epoch": 1.42, "grad_norm": 7.573449611663818, "learning_rate": 4.23736265618355e-05, "loss": 2.8292, "step": 19260 }, { "epoch": 1.42, "grad_norm": 5.7733917236328125, "learning_rate": 4.227384414986805e-05, "loss": 2.4985, "step": 19270 }, { "epoch": 1.42, "grad_norm": 4.382335662841797, "learning_rate": 4.217414786313173e-05, "loss": 2.4164, "step": 19280 }, { "epoch": 1.42, "grad_norm": 6.469529628753662, "learning_rate": 4.2074537850369654e-05, "loss": 2.5815, "step": 19290 }, { "epoch": 1.43, "grad_norm": 3.817382335662842, "learning_rate": 4.197501426019614e-05, "loss": 2.3491, "step": 19300 }, { "epoch": 1.43, "grad_norm": 5.766961097717285, "learning_rate": 4.1875577241096564e-05, "loss": 2.457, "step": 19310 }, { "epoch": 1.43, "grad_norm": 4.1226019859313965, "learning_rate": 4.177622694142722e-05, "loss": 2.443, "step": 19320 }, { "epoch": 1.43, "grad_norm": 4.610818862915039, "learning_rate": 4.167696350941498e-05, "loss": 2.6016, "step": 19330 }, { "epoch": 1.43, "grad_norm": 4.487005710601807, "learning_rate": 4.157778709315715e-05, "loss": 2.5832, "step": 19340 }, { "epoch": 1.43, "grad_norm": 4.705280303955078, "learning_rate": 4.147869784062113e-05, "loss": 2.553, "step": 19350 }, { "epoch": 1.43, "grad_norm": 5.880077838897705, "learning_rate": 4.137969589964429e-05, "loss": 2.4362, "step": 19360 }, { "epoch": 1.43, "grad_norm": 3.722841262817383, "learning_rate": 4.12807814179338e-05, "loss": 2.5962, "step": 19370 }, { "epoch": 1.43, "grad_norm": 5.202775955200195, "learning_rate": 4.118195454306631e-05, "loss": 2.4903, "step": 19380 }, { "epoch": 1.43, "grad_norm": 4.760529518127441, "learning_rate": 4.108321542248781e-05, "loss": 2.3325, "step": 19390 }, { "epoch": 1.43, "grad_norm": 6.372382164001465, "learning_rate": 4.098456420351324e-05, "loss": 2.6689, "step": 19400 }, { "epoch": 1.43, "eval_loss": 2.723548412322998, "eval_runtime": 1094.6965, "eval_samples_per_second": 5.207, "eval_steps_per_second": 5.207, "step": 19400 }, { "epoch": 1.43, "grad_norm": 5.136544704437256, "learning_rate": 4.088600103332648e-05, "loss": 2.8788, "step": 19410 }, { "epoch": 1.43, "grad_norm": 5.261312961578369, "learning_rate": 4.078752605898005e-05, "loss": 2.5705, "step": 19420 }, { "epoch": 1.44, "grad_norm": 5.200085163116455, "learning_rate": 4.0689139427394864e-05, "loss": 2.6097, "step": 19430 }, { "epoch": 1.44, "grad_norm": 4.0969977378845215, "learning_rate": 4.0590841285360084e-05, "loss": 2.3152, "step": 19440 }, { "epoch": 1.44, "grad_norm": 4.328812599182129, "learning_rate": 4.049263177953277e-05, "loss": 2.598, "step": 19450 }, { "epoch": 1.44, "grad_norm": 5.58969259262085, "learning_rate": 4.039451105643772e-05, "loss": 2.4586, "step": 19460 }, { "epoch": 1.44, "grad_norm": 8.861074447631836, "learning_rate": 4.029647926246739e-05, "loss": 2.4843, "step": 19470 }, { "epoch": 1.44, "grad_norm": 5.041561126708984, "learning_rate": 4.019853654388146e-05, "loss": 2.4352, "step": 19480 }, { "epoch": 1.44, "grad_norm": 5.229025840759277, "learning_rate": 4.01006830468068e-05, "loss": 2.9516, "step": 19490 }, { "epoch": 1.44, "grad_norm": 6.096444129943848, "learning_rate": 4.000291891723706e-05, "loss": 2.6971, "step": 19500 }, { "epoch": 1.44, "grad_norm": 3.951528549194336, "learning_rate": 3.9905244301032595e-05, "loss": 2.5596, "step": 19510 }, { "epoch": 1.44, "grad_norm": 7.2364325523376465, "learning_rate": 3.9807659343920235e-05, "loss": 2.5888, "step": 19520 }, { "epoch": 1.44, "grad_norm": 6.946869373321533, "learning_rate": 3.971016419149303e-05, "loss": 2.5522, "step": 19530 }, { "epoch": 1.44, "grad_norm": 7.022960662841797, "learning_rate": 3.9612758989210083e-05, "loss": 2.6643, "step": 19540 }, { "epoch": 1.44, "grad_norm": 4.149036884307861, "learning_rate": 3.951544388239619e-05, "loss": 2.4732, "step": 19550 }, { "epoch": 1.44, "grad_norm": 7.235793113708496, "learning_rate": 3.941821901624185e-05, "loss": 2.5966, "step": 19560 }, { "epoch": 1.45, "grad_norm": 5.136077404022217, "learning_rate": 3.932108453580281e-05, "loss": 2.6064, "step": 19570 }, { "epoch": 1.45, "grad_norm": 5.46553373336792, "learning_rate": 3.9224040586000045e-05, "loss": 2.6474, "step": 19580 }, { "epoch": 1.45, "grad_norm": 4.688199043273926, "learning_rate": 3.9127087311619496e-05, "loss": 2.5544, "step": 19590 }, { "epoch": 1.45, "grad_norm": 6.985490322113037, "learning_rate": 3.903022485731168e-05, "loss": 2.6272, "step": 19600 }, { "epoch": 1.45, "eval_loss": 2.7148196697235107, "eval_runtime": 1096.5876, "eval_samples_per_second": 5.198, "eval_steps_per_second": 5.198, "step": 19600 }, { "epoch": 1.45, "grad_norm": 5.419033050537109, "learning_rate": 3.8933453367591774e-05, "loss": 2.3508, "step": 19610 }, { "epoch": 1.45, "grad_norm": 4.328287601470947, "learning_rate": 3.883677298683909e-05, "loss": 2.4653, "step": 19620 }, { "epoch": 1.45, "grad_norm": 6.014868259429932, "learning_rate": 3.874018385929715e-05, "loss": 2.6006, "step": 19630 }, { "epoch": 1.45, "grad_norm": 4.715216159820557, "learning_rate": 3.864368612907321e-05, "loss": 2.8378, "step": 19640 }, { "epoch": 1.45, "grad_norm": 5.374291896820068, "learning_rate": 3.8547279940138225e-05, "loss": 2.834, "step": 19650 }, { "epoch": 1.45, "grad_norm": 4.934390068054199, "learning_rate": 3.8450965436326626e-05, "loss": 2.5945, "step": 19660 }, { "epoch": 1.45, "grad_norm": 5.506863594055176, "learning_rate": 3.83547427613359e-05, "loss": 2.5895, "step": 19670 }, { "epoch": 1.45, "grad_norm": 4.630877494812012, "learning_rate": 3.825861205872672e-05, "loss": 2.6303, "step": 19680 }, { "epoch": 1.45, "grad_norm": 4.430076599121094, "learning_rate": 3.816257347192234e-05, "loss": 2.3571, "step": 19690 }, { "epoch": 1.46, "grad_norm": 4.289999008178711, "learning_rate": 3.8066627144208734e-05, "loss": 2.4513, "step": 19700 }, { "epoch": 1.46, "grad_norm": 4.023924350738525, "learning_rate": 3.7970773218734216e-05, "loss": 2.4787, "step": 19710 }, { "epoch": 1.46, "grad_norm": 4.857785701751709, "learning_rate": 3.787501183850912e-05, "loss": 2.4347, "step": 19720 }, { "epoch": 1.46, "grad_norm": 4.032500267028809, "learning_rate": 3.777934314640587e-05, "loss": 2.5699, "step": 19730 }, { "epoch": 1.46, "grad_norm": 6.004321575164795, "learning_rate": 3.768376728515844e-05, "loss": 2.6813, "step": 19740 }, { "epoch": 1.46, "grad_norm": 4.519407749176025, "learning_rate": 3.758828439736242e-05, "loss": 2.4588, "step": 19750 }, { "epoch": 1.46, "grad_norm": 4.536065578460693, "learning_rate": 3.749289462547469e-05, "loss": 2.5396, "step": 19760 }, { "epoch": 1.46, "grad_norm": 6.415857315063477, "learning_rate": 3.739759811181308e-05, "loss": 2.5567, "step": 19770 }, { "epoch": 1.46, "grad_norm": 5.36800479888916, "learning_rate": 3.7302394998556456e-05, "loss": 2.5154, "step": 19780 }, { "epoch": 1.46, "grad_norm": 3.876528024673462, "learning_rate": 3.720728542774417e-05, "loss": 2.4376, "step": 19790 }, { "epoch": 1.46, "grad_norm": 7.150769233703613, "learning_rate": 3.711226954127611e-05, "loss": 2.5285, "step": 19800 }, { "epoch": 1.46, "eval_loss": 2.7195167541503906, "eval_runtime": 1090.5668, "eval_samples_per_second": 5.227, "eval_steps_per_second": 5.227, "step": 19800 }, { "epoch": 1.46, "grad_norm": 6.845495700836182, "learning_rate": 3.7017347480912426e-05, "loss": 2.5522, "step": 19810 }, { "epoch": 1.46, "grad_norm": 4.888938903808594, "learning_rate": 3.692251938827317e-05, "loss": 2.6649, "step": 19820 }, { "epoch": 1.46, "grad_norm": 6.482171535491943, "learning_rate": 3.6827785404838224e-05, "loss": 2.539, "step": 19830 }, { "epoch": 1.47, "grad_norm": 6.012960433959961, "learning_rate": 3.6733145671947136e-05, "loss": 2.465, "step": 19840 }, { "epoch": 1.47, "grad_norm": 5.3928656578063965, "learning_rate": 3.663860033079879e-05, "loss": 2.4433, "step": 19850 }, { "epoch": 1.47, "grad_norm": 7.735469818115234, "learning_rate": 3.654414952245123e-05, "loss": 2.6487, "step": 19860 }, { "epoch": 1.47, "grad_norm": 4.888444900512695, "learning_rate": 3.644979338782152e-05, "loss": 2.4914, "step": 19870 }, { "epoch": 1.47, "grad_norm": 6.5980424880981445, "learning_rate": 3.635553206768538e-05, "loss": 2.5173, "step": 19880 }, { "epoch": 1.47, "grad_norm": 5.8707475662231445, "learning_rate": 3.6261365702677095e-05, "loss": 2.7204, "step": 19890 }, { "epoch": 1.47, "grad_norm": 5.8201093673706055, "learning_rate": 3.616729443328934e-05, "loss": 2.409, "step": 19900 }, { "epoch": 1.47, "grad_norm": 7.474509239196777, "learning_rate": 3.607331839987287e-05, "loss": 2.7956, "step": 19910 }, { "epoch": 1.47, "grad_norm": 3.6222445964813232, "learning_rate": 3.597943774263639e-05, "loss": 2.7459, "step": 19920 }, { "epoch": 1.47, "grad_norm": 7.91470193862915, "learning_rate": 3.588565260164624e-05, "loss": 2.654, "step": 19930 }, { "epoch": 1.47, "grad_norm": 7.238543510437012, "learning_rate": 3.5791963116826244e-05, "loss": 2.909, "step": 19940 }, { "epoch": 1.47, "grad_norm": 2.490121603012085, "learning_rate": 3.56983694279576e-05, "loss": 2.634, "step": 19950 }, { "epoch": 1.47, "grad_norm": 7.118973731994629, "learning_rate": 3.560487167467853e-05, "loss": 2.5066, "step": 19960 }, { "epoch": 1.48, "grad_norm": 4.224281311035156, "learning_rate": 3.551146999648417e-05, "loss": 2.555, "step": 19970 }, { "epoch": 1.48, "grad_norm": 5.849978923797607, "learning_rate": 3.541816453272623e-05, "loss": 2.8908, "step": 19980 }, { "epoch": 1.48, "grad_norm": 4.005553245544434, "learning_rate": 3.532495542261288e-05, "loss": 2.3425, "step": 19990 }, { "epoch": 1.48, "grad_norm": 5.376830577850342, "learning_rate": 3.523184280520863e-05, "loss": 2.5874, "step": 20000 }, { "epoch": 1.48, "eval_loss": 2.714773416519165, "eval_runtime": 1096.8675, "eval_samples_per_second": 5.197, "eval_steps_per_second": 5.197, "step": 20000 }, { "epoch": 1.48, "grad_norm": 7.455637454986572, "learning_rate": 3.5138826819433965e-05, "loss": 2.2953, "step": 20010 }, { "epoch": 1.48, "grad_norm": 6.0181965827941895, "learning_rate": 3.504590760406517e-05, "loss": 2.642, "step": 20020 }, { "epoch": 1.48, "grad_norm": 7.365159034729004, "learning_rate": 3.4953085297734224e-05, "loss": 2.7916, "step": 20030 }, { "epoch": 1.48, "grad_norm": 5.694006443023682, "learning_rate": 3.486036003892842e-05, "loss": 2.4513, "step": 20040 }, { "epoch": 1.48, "grad_norm": 4.591248512268066, "learning_rate": 3.476773196599037e-05, "loss": 2.4705, "step": 20050 }, { "epoch": 1.48, "grad_norm": 8.414265632629395, "learning_rate": 3.467520121711765e-05, "loss": 2.7573, "step": 20060 }, { "epoch": 1.48, "grad_norm": 5.675021171569824, "learning_rate": 3.458276793036257e-05, "loss": 2.5484, "step": 20070 }, { "epoch": 1.48, "grad_norm": 4.582470417022705, "learning_rate": 3.449043224363214e-05, "loss": 2.5106, "step": 20080 }, { "epoch": 1.48, "grad_norm": 5.4494309425354, "learning_rate": 3.439819429468764e-05, "loss": 2.6096, "step": 20090 }, { "epoch": 1.48, "grad_norm": 9.734436988830566, "learning_rate": 3.430605422114461e-05, "loss": 2.5521, "step": 20100 }, { "epoch": 1.49, "grad_norm": 6.490894317626953, "learning_rate": 3.421401216047256e-05, "loss": 2.6084, "step": 20110 }, { "epoch": 1.49, "grad_norm": 4.981866359710693, "learning_rate": 3.412206824999471e-05, "loss": 2.6881, "step": 20120 }, { "epoch": 1.49, "grad_norm": 6.633049964904785, "learning_rate": 3.403022262688793e-05, "loss": 2.569, "step": 20130 }, { "epoch": 1.49, "grad_norm": 6.05472469329834, "learning_rate": 3.3938475428182336e-05, "loss": 2.4273, "step": 20140 }, { "epoch": 1.49, "grad_norm": 7.141064167022705, "learning_rate": 3.384682679076129e-05, "loss": 2.4215, "step": 20150 }, { "epoch": 1.49, "grad_norm": 6.378678798675537, "learning_rate": 3.3755276851361116e-05, "loss": 2.3028, "step": 20160 }, { "epoch": 1.49, "grad_norm": 6.042534828186035, "learning_rate": 3.366382574657078e-05, "loss": 2.6589, "step": 20170 }, { "epoch": 1.49, "grad_norm": 7.929354667663574, "learning_rate": 3.357247361283189e-05, "loss": 2.6183, "step": 20180 }, { "epoch": 1.49, "grad_norm": 4.1936140060424805, "learning_rate": 3.348122058643838e-05, "loss": 2.4308, "step": 20190 }, { "epoch": 1.49, "grad_norm": 6.097403049468994, "learning_rate": 3.339006680353627e-05, "loss": 2.3012, "step": 20200 }, { "epoch": 1.49, "eval_loss": 2.7094500064849854, "eval_runtime": 1096.4703, "eval_samples_per_second": 5.198, "eval_steps_per_second": 5.198, "step": 20200 }, { "epoch": 1.49, "grad_norm": 5.574031829833984, "learning_rate": 3.329901240012352e-05, "loss": 2.8104, "step": 20210 }, { "epoch": 1.49, "grad_norm": 4.519078254699707, "learning_rate": 3.320805751204985e-05, "loss": 2.7359, "step": 20220 }, { "epoch": 1.49, "grad_norm": 6.293169975280762, "learning_rate": 3.311720227501652e-05, "loss": 2.6634, "step": 20230 }, { "epoch": 1.5, "grad_norm": 4.480935573577881, "learning_rate": 3.302644682457612e-05, "loss": 2.3742, "step": 20240 }, { "epoch": 1.5, "grad_norm": 4.8552446365356445, "learning_rate": 3.293579129613228e-05, "loss": 2.708, "step": 20250 }, { "epoch": 1.5, "grad_norm": 5.601837158203125, "learning_rate": 3.28452358249396e-05, "loss": 2.3895, "step": 20260 }, { "epoch": 1.5, "grad_norm": 4.053748607635498, "learning_rate": 3.275478054610342e-05, "loss": 2.2767, "step": 20270 }, { "epoch": 1.5, "grad_norm": 4.6459550857543945, "learning_rate": 3.2664425594579575e-05, "loss": 2.427, "step": 20280 }, { "epoch": 1.5, "grad_norm": 5.87542724609375, "learning_rate": 3.2574171105174256e-05, "loss": 2.6417, "step": 20290 }, { "epoch": 1.5, "grad_norm": 6.246367931365967, "learning_rate": 3.24840172125437e-05, "loss": 2.5537, "step": 20300 }, { "epoch": 1.5, "grad_norm": 4.897169589996338, "learning_rate": 3.239396405119407e-05, "loss": 2.7603, "step": 20310 }, { "epoch": 1.5, "grad_norm": 5.356862545013428, "learning_rate": 3.230401175548127e-05, "loss": 2.3876, "step": 20320 }, { "epoch": 1.5, "grad_norm": 5.569219589233398, "learning_rate": 3.221416045961072e-05, "loss": 2.577, "step": 20330 }, { "epoch": 1.5, "grad_norm": 5.912481307983398, "learning_rate": 3.2124410297637174e-05, "loss": 2.5768, "step": 20340 }, { "epoch": 1.5, "grad_norm": 5.4451494216918945, "learning_rate": 3.203476140346443e-05, "loss": 2.689, "step": 20350 }, { "epoch": 1.5, "grad_norm": 3.8255879878997803, "learning_rate": 3.1945213910845193e-05, "loss": 2.4786, "step": 20360 }, { "epoch": 1.5, "grad_norm": 5.024571418762207, "learning_rate": 3.185576795338095e-05, "loss": 2.3988, "step": 20370 }, { "epoch": 1.51, "grad_norm": 5.674569606781006, "learning_rate": 3.1766423664521685e-05, "loss": 2.6459, "step": 20380 }, { "epoch": 1.51, "grad_norm": 5.376116752624512, "learning_rate": 3.167718117756571e-05, "loss": 2.5263, "step": 20390 }, { "epoch": 1.51, "grad_norm": 4.720499038696289, "learning_rate": 3.1588040625659375e-05, "loss": 2.8163, "step": 20400 }, { "epoch": 1.51, "eval_loss": 2.702810525894165, "eval_runtime": 1093.5293, "eval_samples_per_second": 5.212, "eval_steps_per_second": 5.212, "step": 20400 }, { "epoch": 1.51, "grad_norm": 4.117152690887451, "learning_rate": 3.1499002141796985e-05, "loss": 2.403, "step": 20410 }, { "epoch": 1.51, "grad_norm": 8.465569496154785, "learning_rate": 3.1410065858820593e-05, "loss": 2.4733, "step": 20420 }, { "epoch": 1.51, "grad_norm": 5.661840438842773, "learning_rate": 3.132123190941977e-05, "loss": 2.4563, "step": 20430 }, { "epoch": 1.51, "grad_norm": 4.873353958129883, "learning_rate": 3.1232500426131416e-05, "loss": 2.286, "step": 20440 }, { "epoch": 1.51, "grad_norm": 5.124981880187988, "learning_rate": 3.11438715413395e-05, "loss": 2.5421, "step": 20450 }, { "epoch": 1.51, "grad_norm": 5.187690734863281, "learning_rate": 3.1055345387274906e-05, "loss": 2.4144, "step": 20460 }, { "epoch": 1.51, "grad_norm": 3.4242801666259766, "learning_rate": 3.096692209601535e-05, "loss": 2.6162, "step": 20470 }, { "epoch": 1.51, "grad_norm": 4.927826404571533, "learning_rate": 3.0878601799485006e-05, "loss": 2.5308, "step": 20480 }, { "epoch": 1.51, "grad_norm": 7.429085731506348, "learning_rate": 3.079038462945444e-05, "loss": 2.4955, "step": 20490 }, { "epoch": 1.51, "grad_norm": 6.658217430114746, "learning_rate": 3.070227071754024e-05, "loss": 2.6021, "step": 20500 }, { "epoch": 1.52, "grad_norm": 4.40215539932251, "learning_rate": 3.061426019520509e-05, "loss": 2.547, "step": 20510 }, { "epoch": 1.52, "grad_norm": 4.97898530960083, "learning_rate": 3.052635319375729e-05, "loss": 2.8336, "step": 20520 }, { "epoch": 1.52, "grad_norm": 7.03468132019043, "learning_rate": 3.043854984435076e-05, "loss": 2.7139, "step": 20530 }, { "epoch": 1.52, "grad_norm": 5.653247833251953, "learning_rate": 3.03508502779848e-05, "loss": 2.4009, "step": 20540 }, { "epoch": 1.52, "grad_norm": 8.55075454711914, "learning_rate": 3.026325462550378e-05, "loss": 2.4069, "step": 20550 }, { "epoch": 1.52, "grad_norm": 4.287876605987549, "learning_rate": 3.0175763017597125e-05, "loss": 2.6115, "step": 20560 }, { "epoch": 1.52, "grad_norm": 5.143221855163574, "learning_rate": 3.0088375584798933e-05, "loss": 2.3582, "step": 20570 }, { "epoch": 1.52, "grad_norm": 6.826074123382568, "learning_rate": 3.0001092457487978e-05, "loss": 2.6807, "step": 20580 }, { "epoch": 1.52, "grad_norm": 6.902110576629639, "learning_rate": 2.991391376588739e-05, "loss": 2.5424, "step": 20590 }, { "epoch": 1.52, "grad_norm": 6.487607955932617, "learning_rate": 2.9826839640064408e-05, "loss": 2.3803, "step": 20600 }, { "epoch": 1.52, "eval_loss": 2.6999261379241943, "eval_runtime": 1093.9515, "eval_samples_per_second": 5.21, "eval_steps_per_second": 5.21, "step": 20600 }, { "epoch": 1.52, "grad_norm": 5.772730350494385, "learning_rate": 2.9739870209930375e-05, "loss": 2.5028, "step": 20610 }, { "epoch": 1.52, "grad_norm": 7.393251419067383, "learning_rate": 2.9653005605240324e-05, "loss": 2.536, "step": 20620 }, { "epoch": 1.52, "grad_norm": 6.139245510101318, "learning_rate": 2.9566245955592987e-05, "loss": 2.4364, "step": 20630 }, { "epoch": 1.52, "grad_norm": 5.206151962280273, "learning_rate": 2.947959139043043e-05, "loss": 2.1824, "step": 20640 }, { "epoch": 1.53, "grad_norm": 5.136007308959961, "learning_rate": 2.9393042039037976e-05, "loss": 2.4632, "step": 20650 }, { "epoch": 1.53, "grad_norm": 7.334249496459961, "learning_rate": 2.9306598030544008e-05, "loss": 2.8071, "step": 20660 }, { "epoch": 1.53, "grad_norm": 5.497274398803711, "learning_rate": 2.9220259493919657e-05, "loss": 2.7154, "step": 20670 }, { "epoch": 1.53, "grad_norm": 5.575246334075928, "learning_rate": 2.9134026557978777e-05, "loss": 2.5416, "step": 20680 }, { "epoch": 1.53, "grad_norm": 4.933965682983398, "learning_rate": 2.9047899351377595e-05, "loss": 2.5452, "step": 20690 }, { "epoch": 1.53, "grad_norm": 6.082450866699219, "learning_rate": 2.896187800261464e-05, "loss": 2.5025, "step": 20700 }, { "epoch": 1.53, "grad_norm": 4.525998115539551, "learning_rate": 2.8875962640030528e-05, "loss": 2.3187, "step": 20710 }, { "epoch": 1.53, "grad_norm": 4.0856099128723145, "learning_rate": 2.8790153391807662e-05, "loss": 2.2128, "step": 20720 }, { "epoch": 1.53, "grad_norm": 5.021278381347656, "learning_rate": 2.870445038597025e-05, "loss": 2.5521, "step": 20730 }, { "epoch": 1.53, "grad_norm": 6.382571697235107, "learning_rate": 2.8618853750383835e-05, "loss": 2.4939, "step": 20740 }, { "epoch": 1.53, "grad_norm": 10.189557075500488, "learning_rate": 2.8533363612755393e-05, "loss": 2.7418, "step": 20750 }, { "epoch": 1.53, "grad_norm": 8.443877220153809, "learning_rate": 2.8447980100632987e-05, "loss": 2.7598, "step": 20760 }, { "epoch": 1.53, "grad_norm": 4.629593372344971, "learning_rate": 2.8362703341405517e-05, "loss": 2.4299, "step": 20770 }, { "epoch": 1.54, "grad_norm": 4.1399617195129395, "learning_rate": 2.827753346230273e-05, "loss": 2.5201, "step": 20780 }, { "epoch": 1.54, "grad_norm": 4.630882263183594, "learning_rate": 2.819247059039477e-05, "loss": 2.7113, "step": 20790 }, { "epoch": 1.54, "grad_norm": 5.218183994293213, "learning_rate": 2.8107514852592255e-05, "loss": 2.6152, "step": 20800 }, { "epoch": 1.54, "eval_loss": 2.699847936630249, "eval_runtime": 1093.3276, "eval_samples_per_second": 5.213, "eval_steps_per_second": 5.213, "step": 20800 }, { "epoch": 1.54, "grad_norm": 5.238626956939697, "learning_rate": 2.802266637564591e-05, "loss": 2.4939, "step": 20810 }, { "epoch": 1.54, "grad_norm": 6.299570083618164, "learning_rate": 2.7937925286146484e-05, "loss": 2.5987, "step": 20820 }, { "epoch": 1.54, "grad_norm": 6.078366756439209, "learning_rate": 2.785329171052442e-05, "loss": 2.5886, "step": 20830 }, { "epoch": 1.54, "grad_norm": 4.5963521003723145, "learning_rate": 2.7768765775049775e-05, "loss": 2.2237, "step": 20840 }, { "epoch": 1.54, "grad_norm": 7.452169895172119, "learning_rate": 2.768434760583205e-05, "loss": 2.3485, "step": 20850 }, { "epoch": 1.54, "grad_norm": 6.703926086425781, "learning_rate": 2.760003732881995e-05, "loss": 2.9375, "step": 20860 }, { "epoch": 1.54, "grad_norm": 4.925634860992432, "learning_rate": 2.7515835069801255e-05, "loss": 2.5594, "step": 20870 }, { "epoch": 1.54, "grad_norm": 5.643716812133789, "learning_rate": 2.7431740954402474e-05, "loss": 2.3271, "step": 20880 }, { "epoch": 1.54, "grad_norm": 5.306772232055664, "learning_rate": 2.7347755108088824e-05, "loss": 2.6106, "step": 20890 }, { "epoch": 1.54, "grad_norm": 6.240164279937744, "learning_rate": 2.7263877656164015e-05, "loss": 2.3511, "step": 20900 }, { "epoch": 1.54, "grad_norm": 7.3478474617004395, "learning_rate": 2.7180108723770025e-05, "loss": 2.602, "step": 20910 }, { "epoch": 1.55, "grad_norm": 7.65614652633667, "learning_rate": 2.7096448435886944e-05, "loss": 2.3937, "step": 20920 }, { "epoch": 1.55, "grad_norm": 7.315620422363281, "learning_rate": 2.701289691733272e-05, "loss": 2.5605, "step": 20930 }, { "epoch": 1.55, "grad_norm": 4.321962833404541, "learning_rate": 2.692945429276301e-05, "loss": 2.5002, "step": 20940 }, { "epoch": 1.55, "grad_norm": 3.468332052230835, "learning_rate": 2.6846120686671072e-05, "loss": 2.5641, "step": 20950 }, { "epoch": 1.55, "grad_norm": 6.9545183181762695, "learning_rate": 2.6762896223387467e-05, "loss": 2.5489, "step": 20960 }, { "epoch": 1.55, "grad_norm": 4.801777362823486, "learning_rate": 2.6679781027079975e-05, "loss": 2.4346, "step": 20970 }, { "epoch": 1.55, "grad_norm": 5.563615322113037, "learning_rate": 2.6596775221753277e-05, "loss": 2.7003, "step": 20980 }, { "epoch": 1.55, "grad_norm": 4.222386837005615, "learning_rate": 2.651387893124885e-05, "loss": 2.7923, "step": 20990 }, { "epoch": 1.55, "grad_norm": 4.765193939208984, "learning_rate": 2.643109227924484e-05, "loss": 2.7056, "step": 21000 }, { "epoch": 1.55, "eval_loss": 2.69392466545105, "eval_runtime": 1095.952, "eval_samples_per_second": 5.201, "eval_steps_per_second": 5.201, "step": 21000 }, { "epoch": 1.55, "grad_norm": 6.603006839752197, "learning_rate": 2.634841538925582e-05, "loss": 2.7542, "step": 21010 }, { "epoch": 1.55, "grad_norm": 4.909721851348877, "learning_rate": 2.6265848384632498e-05, "loss": 2.5161, "step": 21020 }, { "epoch": 1.55, "grad_norm": 5.59537935256958, "learning_rate": 2.6183391388561785e-05, "loss": 2.4003, "step": 21030 }, { "epoch": 1.55, "grad_norm": 4.364444255828857, "learning_rate": 2.6101044524066308e-05, "loss": 2.3831, "step": 21040 }, { "epoch": 1.55, "grad_norm": 3.9003069400787354, "learning_rate": 2.6018807914004496e-05, "loss": 2.4646, "step": 21050 }, { "epoch": 1.56, "grad_norm": 3.842813491821289, "learning_rate": 2.5936681681070285e-05, "loss": 2.5775, "step": 21060 }, { "epoch": 1.56, "grad_norm": 6.952861309051514, "learning_rate": 2.585466594779282e-05, "loss": 2.7062, "step": 21070 }, { "epoch": 1.56, "grad_norm": 7.845983028411865, "learning_rate": 2.5772760836536534e-05, "loss": 2.4487, "step": 21080 }, { "epoch": 1.56, "grad_norm": 3.9339027404785156, "learning_rate": 2.5690966469500665e-05, "loss": 2.5145, "step": 21090 }, { "epoch": 1.56, "grad_norm": 7.971899032592773, "learning_rate": 2.560928296871934e-05, "loss": 2.5572, "step": 21100 }, { "epoch": 1.56, "grad_norm": 5.591660976409912, "learning_rate": 2.5527710456061272e-05, "loss": 2.5267, "step": 21110 }, { "epoch": 1.56, "grad_norm": 6.092624187469482, "learning_rate": 2.5446249053229486e-05, "loss": 2.6155, "step": 21120 }, { "epoch": 1.56, "grad_norm": 6.59454870223999, "learning_rate": 2.5364898881761325e-05, "loss": 2.3968, "step": 21130 }, { "epoch": 1.56, "grad_norm": 5.123286247253418, "learning_rate": 2.5283660063028193e-05, "loss": 2.8023, "step": 21140 }, { "epoch": 1.56, "grad_norm": 6.058019638061523, "learning_rate": 2.520253271823525e-05, "loss": 2.4902, "step": 21150 }, { "epoch": 1.56, "grad_norm": 4.217723369598389, "learning_rate": 2.5121516968421476e-05, "loss": 2.4366, "step": 21160 }, { "epoch": 1.56, "grad_norm": 7.757789134979248, "learning_rate": 2.5040612934459228e-05, "loss": 2.6324, "step": 21170 }, { "epoch": 1.56, "grad_norm": 4.6392388343811035, "learning_rate": 2.4959820737054297e-05, "loss": 2.6145, "step": 21180 }, { "epoch": 1.57, "grad_norm": 4.291707992553711, "learning_rate": 2.487914049674559e-05, "loss": 2.5307, "step": 21190 }, { "epoch": 1.57, "grad_norm": 4.865896701812744, "learning_rate": 2.47985723339049e-05, "loss": 2.408, "step": 21200 }, { "epoch": 1.57, "eval_loss": 2.69248366355896, "eval_runtime": 1095.3132, "eval_samples_per_second": 5.204, "eval_steps_per_second": 5.204, "step": 21200 }, { "epoch": 1.57, "grad_norm": 4.253567218780518, "learning_rate": 2.4718116368736922e-05, "loss": 2.622, "step": 21210 }, { "epoch": 1.57, "grad_norm": 3.9619877338409424, "learning_rate": 2.463777272127884e-05, "loss": 2.472, "step": 21220 }, { "epoch": 1.57, "grad_norm": 6.162944793701172, "learning_rate": 2.4557541511400352e-05, "loss": 2.5967, "step": 21230 }, { "epoch": 1.57, "grad_norm": 7.676807880401611, "learning_rate": 2.4477422858803413e-05, "loss": 2.5567, "step": 21240 }, { "epoch": 1.57, "grad_norm": 4.426161766052246, "learning_rate": 2.4397416883021973e-05, "loss": 2.5195, "step": 21250 }, { "epoch": 1.57, "grad_norm": 4.014848709106445, "learning_rate": 2.4317523703421884e-05, "loss": 2.4935, "step": 21260 }, { "epoch": 1.57, "grad_norm": 4.517611503601074, "learning_rate": 2.4237743439200757e-05, "loss": 2.7503, "step": 21270 }, { "epoch": 1.57, "grad_norm": 5.451789855957031, "learning_rate": 2.4158076209387703e-05, "loss": 2.6794, "step": 21280 }, { "epoch": 1.57, "grad_norm": 5.650362968444824, "learning_rate": 2.407852213284325e-05, "loss": 2.6837, "step": 21290 }, { "epoch": 1.57, "grad_norm": 5.634609699249268, "learning_rate": 2.3999081328259033e-05, "loss": 2.1458, "step": 21300 }, { "epoch": 1.57, "grad_norm": 7.945886135101318, "learning_rate": 2.391975391415766e-05, "loss": 2.588, "step": 21310 }, { "epoch": 1.57, "grad_norm": 5.702952861785889, "learning_rate": 2.3840540008892676e-05, "loss": 2.5176, "step": 21320 }, { "epoch": 1.58, "grad_norm": 4.617548942565918, "learning_rate": 2.3761439730648194e-05, "loss": 2.5231, "step": 21330 }, { "epoch": 1.58, "grad_norm": 9.549835205078125, "learning_rate": 2.368245319743887e-05, "loss": 2.5527, "step": 21340 }, { "epoch": 1.58, "grad_norm": 3.8928442001342773, "learning_rate": 2.360358052710957e-05, "loss": 2.52, "step": 21350 }, { "epoch": 1.58, "grad_norm": 7.256139755249023, "learning_rate": 2.3524821837335297e-05, "loss": 2.8356, "step": 21360 }, { "epoch": 1.58, "grad_norm": 6.023710250854492, "learning_rate": 2.344617724562105e-05, "loss": 2.7982, "step": 21370 }, { "epoch": 1.58, "grad_norm": 7.712351322174072, "learning_rate": 2.3367646869301574e-05, "loss": 2.535, "step": 21380 }, { "epoch": 1.58, "grad_norm": 5.238154888153076, "learning_rate": 2.328923082554123e-05, "loss": 2.4871, "step": 21390 }, { "epoch": 1.58, "grad_norm": 6.418647289276123, "learning_rate": 2.3210929231333755e-05, "loss": 2.4464, "step": 21400 }, { "epoch": 1.58, "eval_loss": 2.6876254081726074, "eval_runtime": 1093.9145, "eval_samples_per_second": 5.211, "eval_steps_per_second": 5.211, "step": 21400 }, { "epoch": 1.58, "grad_norm": 4.497880458831787, "learning_rate": 2.3132742203502123e-05, "loss": 2.7903, "step": 21410 }, { "epoch": 1.58, "grad_norm": 5.7589898109436035, "learning_rate": 2.305466985869844e-05, "loss": 2.6637, "step": 21420 }, { "epoch": 1.58, "grad_norm": 5.456647872924805, "learning_rate": 2.297671231340367e-05, "loss": 2.5943, "step": 21430 }, { "epoch": 1.58, "grad_norm": 5.261030673980713, "learning_rate": 2.2898869683927528e-05, "loss": 2.5029, "step": 21440 }, { "epoch": 1.58, "grad_norm": 4.238167762756348, "learning_rate": 2.2821142086408222e-05, "loss": 2.6113, "step": 21450 }, { "epoch": 1.59, "grad_norm": 9.860156059265137, "learning_rate": 2.274352963681242e-05, "loss": 2.9236, "step": 21460 }, { "epoch": 1.59, "grad_norm": 5.734950542449951, "learning_rate": 2.2666032450934903e-05, "loss": 2.2808, "step": 21470 }, { "epoch": 1.59, "grad_norm": 3.944988250732422, "learning_rate": 2.2588650644398545e-05, "loss": 2.5142, "step": 21480 }, { "epoch": 1.59, "grad_norm": 6.458616256713867, "learning_rate": 2.2511384332654083e-05, "loss": 2.7614, "step": 21490 }, { "epoch": 1.59, "grad_norm": 9.047236442565918, "learning_rate": 2.2434233630979884e-05, "loss": 2.5371, "step": 21500 }, { "epoch": 1.59, "grad_norm": 12.842032432556152, "learning_rate": 2.2357198654481892e-05, "loss": 2.7668, "step": 21510 }, { "epoch": 1.59, "grad_norm": 5.303598880767822, "learning_rate": 2.2280279518093326e-05, "loss": 2.6603, "step": 21520 }, { "epoch": 1.59, "grad_norm": 6.416645526885986, "learning_rate": 2.2203476336574646e-05, "loss": 2.5208, "step": 21530 }, { "epoch": 1.59, "grad_norm": 4.682002544403076, "learning_rate": 2.21267892245133e-05, "loss": 2.7197, "step": 21540 }, { "epoch": 1.59, "grad_norm": 6.208341121673584, "learning_rate": 2.205021829632349e-05, "loss": 2.5291, "step": 21550 }, { "epoch": 1.59, "grad_norm": 5.015642166137695, "learning_rate": 2.1973763666246194e-05, "loss": 2.5605, "step": 21560 }, { "epoch": 1.59, "grad_norm": 4.047297477722168, "learning_rate": 2.1897425448348742e-05, "loss": 2.4668, "step": 21570 }, { "epoch": 1.59, "grad_norm": 6.200460433959961, "learning_rate": 2.182120375652491e-05, "loss": 2.5086, "step": 21580 }, { "epoch": 1.59, "grad_norm": 6.616320610046387, "learning_rate": 2.1745098704494572e-05, "loss": 2.4152, "step": 21590 }, { "epoch": 1.6, "grad_norm": 5.158884048461914, "learning_rate": 2.1669110405803517e-05, "loss": 2.6802, "step": 21600 }, { "epoch": 1.6, "eval_loss": 2.684189796447754, "eval_runtime": 1097.2459, "eval_samples_per_second": 5.195, "eval_steps_per_second": 5.195, "step": 21600 }, { "epoch": 1.6, "grad_norm": 6.151003837585449, "learning_rate": 2.1593238973823472e-05, "loss": 2.5556, "step": 21610 }, { "epoch": 1.6, "grad_norm": 5.922985553741455, "learning_rate": 2.1517484521751663e-05, "loss": 2.6471, "step": 21620 }, { "epoch": 1.6, "grad_norm": 3.364727735519409, "learning_rate": 2.1441847162610916e-05, "loss": 2.3658, "step": 21630 }, { "epoch": 1.6, "grad_norm": 5.081273078918457, "learning_rate": 2.1366327009249233e-05, "loss": 2.5731, "step": 21640 }, { "epoch": 1.6, "grad_norm": 7.894616603851318, "learning_rate": 2.1290924174339844e-05, "loss": 2.6044, "step": 21650 }, { "epoch": 1.6, "grad_norm": 4.1407012939453125, "learning_rate": 2.1215638770380953e-05, "loss": 2.3113, "step": 21660 }, { "epoch": 1.6, "grad_norm": 7.667937278747559, "learning_rate": 2.114047090969544e-05, "loss": 2.615, "step": 21670 }, { "epoch": 1.6, "grad_norm": 5.139069557189941, "learning_rate": 2.106542070443098e-05, "loss": 2.7862, "step": 21680 }, { "epoch": 1.6, "grad_norm": 8.500158309936523, "learning_rate": 2.099048826655957e-05, "loss": 2.5791, "step": 21690 }, { "epoch": 1.6, "grad_norm": 3.9246647357940674, "learning_rate": 2.091567370787757e-05, "loss": 2.627, "step": 21700 }, { "epoch": 1.6, "grad_norm": 4.196277618408203, "learning_rate": 2.0840977140005503e-05, "loss": 2.6593, "step": 21710 }, { "epoch": 1.6, "grad_norm": 5.34571647644043, "learning_rate": 2.0766398674387744e-05, "loss": 2.6297, "step": 21720 }, { "epoch": 1.61, "grad_norm": 9.215928077697754, "learning_rate": 2.0691938422292577e-05, "loss": 2.5687, "step": 21730 }, { "epoch": 1.61, "grad_norm": 7.45725679397583, "learning_rate": 2.0617596494811843e-05, "loss": 2.5245, "step": 21740 }, { "epoch": 1.61, "grad_norm": 5.027177810668945, "learning_rate": 2.0543373002860877e-05, "loss": 2.611, "step": 21750 }, { "epoch": 1.61, "grad_norm": 5.864018440246582, "learning_rate": 2.0469268057178315e-05, "loss": 2.426, "step": 21760 }, { "epoch": 1.61, "grad_norm": 5.623456954956055, "learning_rate": 2.0395281768325947e-05, "loss": 2.6679, "step": 21770 }, { "epoch": 1.61, "grad_norm": 8.044170379638672, "learning_rate": 2.0321414246688476e-05, "loss": 2.5729, "step": 21780 }, { "epoch": 1.61, "grad_norm": 7.187014102935791, "learning_rate": 2.024766560247341e-05, "loss": 2.6013, "step": 21790 }, { "epoch": 1.61, "grad_norm": 4.8793158531188965, "learning_rate": 2.0174035945710957e-05, "loss": 2.377, "step": 21800 }, { "epoch": 1.61, "eval_loss": 2.6814467906951904, "eval_runtime": 1095.2107, "eval_samples_per_second": 5.204, "eval_steps_per_second": 5.204, "step": 21800 }, { "epoch": 1.61, "grad_norm": 8.16999626159668, "learning_rate": 2.0100525386253766e-05, "loss": 2.6537, "step": 21810 }, { "epoch": 1.61, "grad_norm": 5.531657695770264, "learning_rate": 2.0027134033776828e-05, "loss": 2.7857, "step": 21820 }, { "epoch": 1.61, "grad_norm": 5.026412487030029, "learning_rate": 1.995386199777721e-05, "loss": 2.6778, "step": 21830 }, { "epoch": 1.61, "grad_norm": 6.896015167236328, "learning_rate": 1.988070938757399e-05, "loss": 2.5839, "step": 21840 }, { "epoch": 1.61, "grad_norm": 7.109387397766113, "learning_rate": 1.980767631230812e-05, "loss": 2.8903, "step": 21850 }, { "epoch": 1.61, "grad_norm": 6.354283809661865, "learning_rate": 1.973476288094216e-05, "loss": 2.3177, "step": 21860 }, { "epoch": 1.62, "grad_norm": 7.274041652679443, "learning_rate": 1.96619692022602e-05, "loss": 2.5199, "step": 21870 }, { "epoch": 1.62, "grad_norm": 6.3600664138793945, "learning_rate": 1.9596557369757285e-05, "loss": 2.5857, "step": 21880 }, { "epoch": 1.62, "grad_norm": 5.527103424072266, "learning_rate": 1.9523991520234975e-05, "loss": 2.7053, "step": 21890 }, { "epoch": 1.62, "grad_norm": 4.095846176147461, "learning_rate": 1.945154573785949e-05, "loss": 2.4275, "step": 21900 }, { "epoch": 1.62, "grad_norm": 4.542167663574219, "learning_rate": 1.93792201307172e-05, "loss": 2.354, "step": 21910 }, { "epoch": 1.62, "grad_norm": 5.139354705810547, "learning_rate": 1.9307014806715183e-05, "loss": 2.3141, "step": 21920 }, { "epoch": 1.62, "grad_norm": 7.073459625244141, "learning_rate": 1.923492987358101e-05, "loss": 2.5897, "step": 21930 }, { "epoch": 1.62, "grad_norm": 5.215823650360107, "learning_rate": 1.916296543886269e-05, "loss": 2.4426, "step": 21940 }, { "epoch": 1.62, "grad_norm": 4.4041361808776855, "learning_rate": 1.9091121609928386e-05, "loss": 2.477, "step": 21950 }, { "epoch": 1.62, "grad_norm": 7.190915584564209, "learning_rate": 1.901939849396641e-05, "loss": 2.7217, "step": 21960 }, { "epoch": 1.62, "grad_norm": 5.785027980804443, "learning_rate": 1.894779619798488e-05, "loss": 2.3363, "step": 21970 }, { "epoch": 1.62, "grad_norm": 5.730170726776123, "learning_rate": 1.8876314828811713e-05, "loss": 2.4102, "step": 21980 }, { "epoch": 1.62, "grad_norm": 6.119355201721191, "learning_rate": 1.8804954493094428e-05, "loss": 2.5663, "step": 21990 }, { "epoch": 1.63, "grad_norm": 6.51188325881958, "learning_rate": 1.8733715297299892e-05, "loss": 2.5035, "step": 22000 }, { "epoch": 1.63, "eval_loss": 2.6791791915893555, "eval_runtime": 1093.3935, "eval_samples_per_second": 5.213, "eval_steps_per_second": 5.213, "step": 22000 }, { "epoch": 1.63, "grad_norm": 5.506747722625732, "learning_rate": 1.8662597347714318e-05, "loss": 2.6332, "step": 22010 }, { "epoch": 1.63, "grad_norm": 7.371239185333252, "learning_rate": 1.8591600750442927e-05, "loss": 2.4252, "step": 22020 }, { "epoch": 1.63, "grad_norm": 5.349908351898193, "learning_rate": 1.8520725611409996e-05, "loss": 2.5931, "step": 22030 }, { "epoch": 1.63, "grad_norm": 5.594857215881348, "learning_rate": 1.844997203635853e-05, "loss": 2.3067, "step": 22040 }, { "epoch": 1.63, "grad_norm": 4.631478786468506, "learning_rate": 1.8379340130850166e-05, "loss": 2.5666, "step": 22050 }, { "epoch": 1.63, "grad_norm": 5.589487552642822, "learning_rate": 1.8308830000265032e-05, "loss": 2.4052, "step": 22060 }, { "epoch": 1.63, "grad_norm": 10.57905387878418, "learning_rate": 1.8238441749801537e-05, "loss": 2.5351, "step": 22070 }, { "epoch": 1.63, "grad_norm": 3.848583459854126, "learning_rate": 1.81681754844763e-05, "loss": 2.4262, "step": 22080 }, { "epoch": 1.63, "grad_norm": 4.930076599121094, "learning_rate": 1.8098031309123942e-05, "loss": 2.4726, "step": 22090 }, { "epoch": 1.63, "grad_norm": 5.635489463806152, "learning_rate": 1.8028009328396844e-05, "loss": 2.7213, "step": 22100 }, { "epoch": 1.63, "grad_norm": 5.582231521606445, "learning_rate": 1.795810964676521e-05, "loss": 2.3556, "step": 22110 }, { "epoch": 1.63, "grad_norm": 7.522580146789551, "learning_rate": 1.788833236851666e-05, "loss": 2.577, "step": 22120 }, { "epoch": 1.63, "grad_norm": 6.316006183624268, "learning_rate": 1.781867759775624e-05, "loss": 2.4932, "step": 22130 }, { "epoch": 1.64, "grad_norm": 4.130107879638672, "learning_rate": 1.7749145438406255e-05, "loss": 2.3233, "step": 22140 }, { "epoch": 1.64, "grad_norm": 3.4111945629119873, "learning_rate": 1.767973599420607e-05, "loss": 2.4543, "step": 22150 }, { "epoch": 1.64, "grad_norm": 3.7794103622436523, "learning_rate": 1.7610449368711857e-05, "loss": 2.2836, "step": 22160 }, { "epoch": 1.64, "grad_norm": 5.900721073150635, "learning_rate": 1.7541285665296658e-05, "loss": 2.3802, "step": 22170 }, { "epoch": 1.64, "grad_norm": 8.760246276855469, "learning_rate": 1.7472244987150112e-05, "loss": 2.3997, "step": 22180 }, { "epoch": 1.64, "grad_norm": 5.007622718811035, "learning_rate": 1.7403327437278273e-05, "loss": 2.5783, "step": 22190 }, { "epoch": 1.64, "grad_norm": 4.590503215789795, "learning_rate": 1.7334533118503526e-05, "loss": 2.4172, "step": 22200 }, { "epoch": 1.64, "eval_loss": 2.676037549972534, "eval_runtime": 1096.8129, "eval_samples_per_second": 5.197, "eval_steps_per_second": 5.197, "step": 22200 }, { "epoch": 1.64, "grad_norm": 5.619079113006592, "learning_rate": 1.7265862133464382e-05, "loss": 2.67, "step": 22210 }, { "epoch": 1.64, "grad_norm": 5.27069616317749, "learning_rate": 1.7197314584615286e-05, "loss": 2.4192, "step": 22220 }, { "epoch": 1.64, "grad_norm": 5.923769950866699, "learning_rate": 1.712889057422663e-05, "loss": 2.585, "step": 22230 }, { "epoch": 1.64, "grad_norm": 6.051741600036621, "learning_rate": 1.706059020438442e-05, "loss": 2.6307, "step": 22240 }, { "epoch": 1.64, "grad_norm": 7.821314334869385, "learning_rate": 1.699241357699023e-05, "loss": 2.6883, "step": 22250 }, { "epoch": 1.64, "grad_norm": 4.7659912109375, "learning_rate": 1.6924360793760996e-05, "loss": 2.7255, "step": 22260 }, { "epoch": 1.65, "grad_norm": 5.253278732299805, "learning_rate": 1.6856431956228835e-05, "loss": 2.8009, "step": 22270 }, { "epoch": 1.65, "grad_norm": 5.987473487854004, "learning_rate": 1.678862716574103e-05, "loss": 2.5018, "step": 22280 }, { "epoch": 1.65, "grad_norm": 5.667232990264893, "learning_rate": 1.672094652345977e-05, "loss": 2.6063, "step": 22290 }, { "epoch": 1.65, "grad_norm": 6.441999435424805, "learning_rate": 1.665339013036199e-05, "loss": 2.5247, "step": 22300 }, { "epoch": 1.65, "grad_norm": 4.456752777099609, "learning_rate": 1.6585958087239252e-05, "loss": 2.5529, "step": 22310 }, { "epoch": 1.65, "grad_norm": 4.149497032165527, "learning_rate": 1.6518650494697583e-05, "loss": 2.3672, "step": 22320 }, { "epoch": 1.65, "grad_norm": 6.830989360809326, "learning_rate": 1.6451467453157375e-05, "loss": 2.5149, "step": 22330 }, { "epoch": 1.65, "grad_norm": 6.6800312995910645, "learning_rate": 1.6384409062853202e-05, "loss": 2.6433, "step": 22340 }, { "epoch": 1.65, "grad_norm": 8.957132339477539, "learning_rate": 1.6317475423833585e-05, "loss": 2.3203, "step": 22350 }, { "epoch": 1.65, "grad_norm": 5.662652015686035, "learning_rate": 1.6250666635960997e-05, "loss": 2.6583, "step": 22360 }, { "epoch": 1.65, "grad_norm": 5.9897541999816895, "learning_rate": 1.61839827989116e-05, "loss": 2.6049, "step": 22370 }, { "epoch": 1.65, "grad_norm": 5.011838436126709, "learning_rate": 1.611742401217514e-05, "loss": 2.7471, "step": 22380 }, { "epoch": 1.65, "grad_norm": 8.517313957214355, "learning_rate": 1.605099037505483e-05, "loss": 2.7046, "step": 22390 }, { "epoch": 1.65, "grad_norm": 6.329367160797119, "learning_rate": 1.5984681986667095e-05, "loss": 2.6179, "step": 22400 }, { "epoch": 1.65, "eval_loss": 2.6726911067962646, "eval_runtime": 1087.5084, "eval_samples_per_second": 5.241, "eval_steps_per_second": 5.241, "step": 22400 }, { "epoch": 1.66, "grad_norm": 5.475883960723877, "learning_rate": 1.591849894594155e-05, "loss": 2.1697, "step": 22410 }, { "epoch": 1.66, "grad_norm": 8.58638858795166, "learning_rate": 1.5852441351620774e-05, "loss": 2.6007, "step": 22420 }, { "epoch": 1.66, "grad_norm": 7.628760814666748, "learning_rate": 1.5786509302260167e-05, "loss": 2.5558, "step": 22430 }, { "epoch": 1.66, "grad_norm": 8.970362663269043, "learning_rate": 1.572070289622789e-05, "loss": 2.3498, "step": 22440 }, { "epoch": 1.66, "grad_norm": 5.100218772888184, "learning_rate": 1.5655022231704553e-05, "loss": 2.2767, "step": 22450 }, { "epoch": 1.66, "grad_norm": 6.442392349243164, "learning_rate": 1.5589467406683256e-05, "loss": 3.0826, "step": 22460 }, { "epoch": 1.66, "grad_norm": 5.430817604064941, "learning_rate": 1.5524038518969253e-05, "loss": 2.4834, "step": 22470 }, { "epoch": 1.66, "grad_norm": 4.273621559143066, "learning_rate": 1.545873566617998e-05, "loss": 2.2524, "step": 22480 }, { "epoch": 1.66, "grad_norm": 4.311804294586182, "learning_rate": 1.539355894574486e-05, "loss": 2.5281, "step": 22490 }, { "epoch": 1.66, "grad_norm": 7.450249195098877, "learning_rate": 1.5328508454905e-05, "loss": 2.3898, "step": 22500 }, { "epoch": 1.66, "grad_norm": 4.738997936248779, "learning_rate": 1.5263584290713305e-05, "loss": 2.4634, "step": 22510 }, { "epoch": 1.66, "grad_norm": 4.49940824508667, "learning_rate": 1.5198786550034194e-05, "loss": 2.4394, "step": 22520 }, { "epoch": 1.66, "grad_norm": 4.811766624450684, "learning_rate": 1.5134115329543363e-05, "loss": 2.5136, "step": 22530 }, { "epoch": 1.67, "grad_norm": 5.51740026473999, "learning_rate": 1.5069570725727889e-05, "loss": 2.3364, "step": 22540 }, { "epoch": 1.67, "grad_norm": 6.221955299377441, "learning_rate": 1.5005152834885794e-05, "loss": 2.5954, "step": 22550 }, { "epoch": 1.67, "grad_norm": 5.981647968292236, "learning_rate": 1.4940861753126168e-05, "loss": 2.3089, "step": 22560 }, { "epoch": 1.67, "grad_norm": 7.435852527618408, "learning_rate": 1.4876697576368881e-05, "loss": 2.3998, "step": 22570 }, { "epoch": 1.67, "grad_norm": 5.436887741088867, "learning_rate": 1.4812660400344414e-05, "loss": 2.4571, "step": 22580 }, { "epoch": 1.67, "grad_norm": 5.0897722244262695, "learning_rate": 1.4748750320593785e-05, "loss": 2.439, "step": 22590 }, { "epoch": 1.67, "grad_norm": 4.938666820526123, "learning_rate": 1.4684967432468433e-05, "loss": 2.1966, "step": 22600 }, { "epoch": 1.67, "eval_loss": 2.67244553565979, "eval_runtime": 1092.4378, "eval_samples_per_second": 5.218, "eval_steps_per_second": 5.218, "step": 22600 }, { "epoch": 1.67, "grad_norm": 4.76402473449707, "learning_rate": 1.4621311831129992e-05, "loss": 2.7715, "step": 22610 }, { "epoch": 1.67, "grad_norm": 5.895535945892334, "learning_rate": 1.4557783611550224e-05, "loss": 2.8179, "step": 22620 }, { "epoch": 1.67, "grad_norm": 4.383255481719971, "learning_rate": 1.4494382868510803e-05, "loss": 2.6572, "step": 22630 }, { "epoch": 1.67, "grad_norm": 6.317339897155762, "learning_rate": 1.4431109696603207e-05, "loss": 2.6832, "step": 22640 }, { "epoch": 1.67, "grad_norm": 3.1432700157165527, "learning_rate": 1.4367964190228623e-05, "loss": 2.132, "step": 22650 }, { "epoch": 1.67, "grad_norm": 4.70470666885376, "learning_rate": 1.4304946443597744e-05, "loss": 2.5938, "step": 22660 }, { "epoch": 1.67, "grad_norm": 5.619884014129639, "learning_rate": 1.4242056550730677e-05, "loss": 2.6072, "step": 22670 }, { "epoch": 1.68, "grad_norm": 6.059271335601807, "learning_rate": 1.4179294605456739e-05, "loss": 2.5668, "step": 22680 }, { "epoch": 1.68, "grad_norm": 6.467549800872803, "learning_rate": 1.411666070141433e-05, "loss": 2.2774, "step": 22690 }, { "epoch": 1.68, "grad_norm": 6.390707015991211, "learning_rate": 1.40541549320509e-05, "loss": 2.7621, "step": 22700 }, { "epoch": 1.68, "grad_norm": 6.357089042663574, "learning_rate": 1.3991777390622651e-05, "loss": 2.3953, "step": 22710 }, { "epoch": 1.68, "grad_norm": 4.777021408081055, "learning_rate": 1.3929528170194561e-05, "loss": 2.6179, "step": 22720 }, { "epoch": 1.68, "grad_norm": 6.3577070236206055, "learning_rate": 1.386740736364005e-05, "loss": 2.5467, "step": 22730 }, { "epoch": 1.68, "grad_norm": 7.2683634757995605, "learning_rate": 1.3805415063641003e-05, "loss": 2.5984, "step": 22740 }, { "epoch": 1.68, "grad_norm": 7.257079124450684, "learning_rate": 1.3743551362687568e-05, "loss": 2.5944, "step": 22750 }, { "epoch": 1.68, "grad_norm": 6.176877021789551, "learning_rate": 1.368181635307807e-05, "loss": 2.6696, "step": 22760 }, { "epoch": 1.68, "grad_norm": 6.036998271942139, "learning_rate": 1.3620210126918798e-05, "loss": 2.3, "step": 22770 }, { "epoch": 1.68, "grad_norm": 4.959908962249756, "learning_rate": 1.3558732776123884e-05, "loss": 2.8348, "step": 22780 }, { "epoch": 1.68, "grad_norm": 6.45090389251709, "learning_rate": 1.349738439241518e-05, "loss": 2.3633, "step": 22790 }, { "epoch": 1.68, "grad_norm": 4.981467247009277, "learning_rate": 1.3436165067322171e-05, "loss": 2.4786, "step": 22800 }, { "epoch": 1.68, "eval_loss": 2.670815944671631, "eval_runtime": 1095.8123, "eval_samples_per_second": 5.202, "eval_steps_per_second": 5.202, "step": 22800 }, { "epoch": 1.68, "grad_norm": 4.602180004119873, "learning_rate": 1.3375074892181749e-05, "loss": 2.4742, "step": 22810 }, { "epoch": 1.69, "grad_norm": 5.091914653778076, "learning_rate": 1.3314113958138163e-05, "loss": 2.6046, "step": 22820 }, { "epoch": 1.69, "grad_norm": 5.247584342956543, "learning_rate": 1.3253282356142771e-05, "loss": 2.6917, "step": 22830 }, { "epoch": 1.69, "grad_norm": 5.7452192306518555, "learning_rate": 1.319258017695405e-05, "loss": 2.4501, "step": 22840 }, { "epoch": 1.69, "grad_norm": 5.045823574066162, "learning_rate": 1.31320075111373e-05, "loss": 2.2214, "step": 22850 }, { "epoch": 1.69, "grad_norm": 4.422451019287109, "learning_rate": 1.3071564449064666e-05, "loss": 2.2831, "step": 22860 }, { "epoch": 1.69, "grad_norm": 5.13774299621582, "learning_rate": 1.301125108091492e-05, "loss": 2.3201, "step": 22870 }, { "epoch": 1.69, "grad_norm": 6.320522308349609, "learning_rate": 1.2951067496673264e-05, "loss": 2.534, "step": 22880 }, { "epoch": 1.69, "grad_norm": 6.9759674072265625, "learning_rate": 1.2891013786131368e-05, "loss": 2.6257, "step": 22890 }, { "epoch": 1.69, "grad_norm": 5.557161808013916, "learning_rate": 1.283109003888704e-05, "loss": 2.6524, "step": 22900 }, { "epoch": 1.69, "grad_norm": 6.528628826141357, "learning_rate": 1.2771296344344263e-05, "loss": 2.4845, "step": 22910 }, { "epoch": 1.69, "grad_norm": 4.082712650299072, "learning_rate": 1.271163279171297e-05, "loss": 2.4187, "step": 22920 }, { "epoch": 1.69, "grad_norm": 3.7587528228759766, "learning_rate": 1.2652099470008883e-05, "loss": 2.6183, "step": 22930 }, { "epoch": 1.69, "grad_norm": 6.589033126831055, "learning_rate": 1.259269646805349e-05, "loss": 2.574, "step": 22940 }, { "epoch": 1.7, "grad_norm": 5.249916076660156, "learning_rate": 1.2533423874473771e-05, "loss": 2.5617, "step": 22950 }, { "epoch": 1.7, "grad_norm": 3.8693699836730957, "learning_rate": 1.2474281777702223e-05, "loss": 2.5963, "step": 22960 }, { "epoch": 1.7, "grad_norm": 5.250299453735352, "learning_rate": 1.2415270265976564e-05, "loss": 2.5467, "step": 22970 }, { "epoch": 1.7, "grad_norm": 4.729397296905518, "learning_rate": 1.2356389427339766e-05, "loss": 2.8142, "step": 22980 }, { "epoch": 1.7, "grad_norm": 3.2217938899993896, "learning_rate": 1.22976393496398e-05, "loss": 2.1877, "step": 22990 }, { "epoch": 1.7, "grad_norm": 3.8777239322662354, "learning_rate": 1.2239020120529521e-05, "loss": 2.2498, "step": 23000 }, { "epoch": 1.7, "eval_loss": 2.6680080890655518, "eval_runtime": 1095.4556, "eval_samples_per_second": 5.203, "eval_steps_per_second": 5.203, "step": 23000 }, { "epoch": 1.7, "grad_norm": 5.530909061431885, "learning_rate": 1.2180531827466635e-05, "loss": 2.6204, "step": 23010 }, { "epoch": 1.7, "grad_norm": 4.088710308074951, "learning_rate": 1.2122174557713406e-05, "loss": 2.7187, "step": 23020 }, { "epoch": 1.7, "grad_norm": 7.151991367340088, "learning_rate": 1.2063948398336677e-05, "loss": 2.4525, "step": 23030 }, { "epoch": 1.7, "grad_norm": 3.7773518562316895, "learning_rate": 1.2005853436207703e-05, "loss": 2.3775, "step": 23040 }, { "epoch": 1.7, "grad_norm": 5.765316486358643, "learning_rate": 1.1947889758001907e-05, "loss": 2.6697, "step": 23050 }, { "epoch": 1.7, "grad_norm": 6.313945770263672, "learning_rate": 1.1890057450198932e-05, "loss": 2.3878, "step": 23060 }, { "epoch": 1.7, "grad_norm": 3.7643887996673584, "learning_rate": 1.1832356599082361e-05, "loss": 2.6022, "step": 23070 }, { "epoch": 1.7, "grad_norm": 5.528670787811279, "learning_rate": 1.1774787290739676e-05, "loss": 2.3164, "step": 23080 }, { "epoch": 1.71, "grad_norm": 5.8710432052612305, "learning_rate": 1.1717349611062122e-05, "loss": 2.4571, "step": 23090 }, { "epoch": 1.71, "grad_norm": 5.853476047515869, "learning_rate": 1.166004364574449e-05, "loss": 2.1946, "step": 23100 }, { "epoch": 1.71, "grad_norm": 6.066964149475098, "learning_rate": 1.160286948028515e-05, "loss": 2.6727, "step": 23110 }, { "epoch": 1.71, "grad_norm": 6.807967185974121, "learning_rate": 1.1545827199985737e-05, "loss": 2.5211, "step": 23120 }, { "epoch": 1.71, "grad_norm": 5.183149814605713, "learning_rate": 1.1488916889951195e-05, "loss": 2.3858, "step": 23130 }, { "epoch": 1.71, "grad_norm": 5.625608921051025, "learning_rate": 1.143213863508954e-05, "loss": 2.5197, "step": 23140 }, { "epoch": 1.71, "grad_norm": 5.2954020500183105, "learning_rate": 1.1375492520111797e-05, "loss": 2.5251, "step": 23150 }, { "epoch": 1.71, "grad_norm": 5.281711578369141, "learning_rate": 1.1318978629531784e-05, "loss": 2.3084, "step": 23160 }, { "epoch": 1.71, "grad_norm": 4.606409549713135, "learning_rate": 1.1262597047666067e-05, "loss": 2.5242, "step": 23170 }, { "epoch": 1.71, "grad_norm": 11.543262481689453, "learning_rate": 1.1206347858633836e-05, "loss": 2.7468, "step": 23180 }, { "epoch": 1.71, "grad_norm": 4.565051555633545, "learning_rate": 1.115023114635676e-05, "loss": 2.8361, "step": 23190 }, { "epoch": 1.71, "grad_norm": 5.548258304595947, "learning_rate": 1.1094246994558843e-05, "loss": 2.3842, "step": 23200 }, { "epoch": 1.71, "eval_loss": 2.6673765182495117, "eval_runtime": 1095.5672, "eval_samples_per_second": 5.203, "eval_steps_per_second": 5.203, "step": 23200 }, { "epoch": 1.71, "grad_norm": 3.919635772705078, "learning_rate": 1.1038395486766306e-05, "loss": 2.519, "step": 23210 }, { "epoch": 1.72, "grad_norm": 4.431865692138672, "learning_rate": 1.0982676706307449e-05, "loss": 2.2447, "step": 23220 }, { "epoch": 1.72, "grad_norm": 4.190866947174072, "learning_rate": 1.0927090736312595e-05, "loss": 2.4587, "step": 23230 }, { "epoch": 1.72, "grad_norm": 4.054731369018555, "learning_rate": 1.0871637659713895e-05, "loss": 2.49, "step": 23240 }, { "epoch": 1.72, "grad_norm": 7.007957458496094, "learning_rate": 1.081631755924527e-05, "loss": 2.7029, "step": 23250 }, { "epoch": 1.72, "grad_norm": 7.057101726531982, "learning_rate": 1.0761130517442175e-05, "loss": 2.756, "step": 23260 }, { "epoch": 1.72, "grad_norm": 5.599599838256836, "learning_rate": 1.0706076616641558e-05, "loss": 2.5836, "step": 23270 }, { "epoch": 1.72, "grad_norm": 4.555930137634277, "learning_rate": 1.0651155938981771e-05, "loss": 2.5641, "step": 23280 }, { "epoch": 1.72, "grad_norm": 5.608716011047363, "learning_rate": 1.0596368566402382e-05, "loss": 2.8093, "step": 23290 }, { "epoch": 1.72, "grad_norm": 4.5203375816345215, "learning_rate": 1.054171458064408e-05, "loss": 2.5123, "step": 23300 }, { "epoch": 1.72, "grad_norm": 5.284296035766602, "learning_rate": 1.0487194063248518e-05, "loss": 2.5149, "step": 23310 }, { "epoch": 1.72, "grad_norm": 4.907776355743408, "learning_rate": 1.0432807095558217e-05, "loss": 2.4423, "step": 23320 }, { "epoch": 1.72, "grad_norm": 4.86950159072876, "learning_rate": 1.0378553758716492e-05, "loss": 2.5835, "step": 23330 }, { "epoch": 1.72, "grad_norm": 3.8427376747131348, "learning_rate": 1.0324434133667271e-05, "loss": 2.4697, "step": 23340 }, { "epoch": 1.72, "grad_norm": 5.208629131317139, "learning_rate": 1.0270448301154955e-05, "loss": 2.399, "step": 23350 }, { "epoch": 1.73, "grad_norm": 6.390563011169434, "learning_rate": 1.0216596341724372e-05, "loss": 2.6222, "step": 23360 }, { "epoch": 1.73, "grad_norm": 3.514446496963501, "learning_rate": 1.0162878335720572e-05, "loss": 2.4631, "step": 23370 }, { "epoch": 1.73, "grad_norm": 4.729079723358154, "learning_rate": 1.010929436328879e-05, "loss": 2.6457, "step": 23380 }, { "epoch": 1.73, "grad_norm": 7.517897129058838, "learning_rate": 1.0055844504374311e-05, "loss": 2.5569, "step": 23390 }, { "epoch": 1.73, "grad_norm": 7.293701648712158, "learning_rate": 1.0002528838722247e-05, "loss": 2.3308, "step": 23400 }, { "epoch": 1.73, "eval_loss": 2.6646196842193604, "eval_runtime": 1099.3168, "eval_samples_per_second": 5.185, "eval_steps_per_second": 5.185, "step": 23400 }, { "epoch": 1.73, "grad_norm": 3.726698160171509, "learning_rate": 9.949347445877578e-06, "loss": 2.577, "step": 23410 }, { "epoch": 1.73, "grad_norm": 5.210052967071533, "learning_rate": 9.896300405184899e-06, "loss": 2.4381, "step": 23420 }, { "epoch": 1.73, "grad_norm": 5.623903274536133, "learning_rate": 9.843387795788383e-06, "loss": 2.4011, "step": 23430 }, { "epoch": 1.73, "grad_norm": 8.071617126464844, "learning_rate": 9.790609696631648e-06, "loss": 2.5279, "step": 23440 }, { "epoch": 1.73, "grad_norm": 7.771283149719238, "learning_rate": 9.737966186457592e-06, "loss": 2.6137, "step": 23450 }, { "epoch": 1.73, "grad_norm": 7.911716938018799, "learning_rate": 9.685457343808347e-06, "loss": 2.4973, "step": 23460 }, { "epoch": 1.73, "grad_norm": 7.803577423095703, "learning_rate": 9.63308324702512e-06, "loss": 2.7497, "step": 23470 }, { "epoch": 1.73, "grad_norm": 5.311838626861572, "learning_rate": 9.580843974248032e-06, "loss": 2.5562, "step": 23480 }, { "epoch": 1.74, "grad_norm": 4.150722980499268, "learning_rate": 9.528739603416159e-06, "loss": 2.3497, "step": 23490 }, { "epoch": 1.74, "grad_norm": 7.9773430824279785, "learning_rate": 9.476770212267172e-06, "loss": 2.6774, "step": 23500 }, { "epoch": 1.74, "grad_norm": 4.366696357727051, "learning_rate": 9.42493587833746e-06, "loss": 2.2838, "step": 23510 }, { "epoch": 1.74, "grad_norm": 7.453878402709961, "learning_rate": 9.373236678961906e-06, "loss": 2.4536, "step": 23520 }, { "epoch": 1.74, "grad_norm": 6.814056396484375, "learning_rate": 9.321672691273698e-06, "loss": 2.4654, "step": 23530 }, { "epoch": 1.74, "grad_norm": 7.097417831420898, "learning_rate": 9.270243992204397e-06, "loss": 2.2456, "step": 23540 }, { "epoch": 1.74, "grad_norm": 5.335800647735596, "learning_rate": 9.218950658483616e-06, "loss": 2.4628, "step": 23550 }, { "epoch": 1.74, "grad_norm": 5.825280666351318, "learning_rate": 9.167792766639106e-06, "loss": 2.4608, "step": 23560 }, { "epoch": 1.74, "grad_norm": 6.578549385070801, "learning_rate": 9.116770392996488e-06, "loss": 2.586, "step": 23570 }, { "epoch": 1.74, "grad_norm": 6.099307537078857, "learning_rate": 9.065883613679193e-06, "loss": 2.4974, "step": 23580 }, { "epoch": 1.74, "grad_norm": 6.494635581970215, "learning_rate": 9.015132504608347e-06, "loss": 2.3944, "step": 23590 }, { "epoch": 1.74, "grad_norm": 4.195499897003174, "learning_rate": 8.964517141502704e-06, "loss": 2.6393, "step": 23600 }, { "epoch": 1.74, "eval_loss": 2.663755416870117, "eval_runtime": 1093.6584, "eval_samples_per_second": 5.212, "eval_steps_per_second": 5.212, "step": 23600 }, { "epoch": 1.74, "grad_norm": 8.729719161987305, "learning_rate": 8.914037599878455e-06, "loss": 2.7616, "step": 23610 }, { "epoch": 1.74, "grad_norm": 4.2735724449157715, "learning_rate": 8.863693955049167e-06, "loss": 2.6174, "step": 23620 }, { "epoch": 1.75, "grad_norm": 6.545641899108887, "learning_rate": 8.813486282125637e-06, "loss": 2.3377, "step": 23630 }, { "epoch": 1.75, "grad_norm": 4.61662483215332, "learning_rate": 8.76341465601579e-06, "loss": 2.3364, "step": 23640 }, { "epoch": 1.75, "grad_norm": 4.983887672424316, "learning_rate": 8.713479151424598e-06, "loss": 2.3039, "step": 23650 }, { "epoch": 1.75, "grad_norm": 5.541987419128418, "learning_rate": 8.663679842853945e-06, "loss": 2.8135, "step": 23660 }, { "epoch": 1.75, "grad_norm": 6.296572685241699, "learning_rate": 8.61401680460252e-06, "loss": 2.4277, "step": 23670 }, { "epoch": 1.75, "grad_norm": 3.8996143341064453, "learning_rate": 8.564490110765677e-06, "loss": 2.5462, "step": 23680 }, { "epoch": 1.75, "grad_norm": 6.054901123046875, "learning_rate": 8.51509983523533e-06, "loss": 2.6507, "step": 23690 }, { "epoch": 1.75, "grad_norm": 6.450567722320557, "learning_rate": 8.465846051699932e-06, "loss": 2.5863, "step": 23700 }, { "epoch": 1.75, "grad_norm": 6.507874488830566, "learning_rate": 8.416728833644238e-06, "loss": 2.5511, "step": 23710 }, { "epoch": 1.75, "grad_norm": 6.341745853424072, "learning_rate": 8.367748254349295e-06, "loss": 2.5089, "step": 23720 }, { "epoch": 1.75, "grad_norm": 5.820411205291748, "learning_rate": 8.318904386892257e-06, "loss": 2.4623, "step": 23730 }, { "epoch": 1.75, "grad_norm": 5.08252477645874, "learning_rate": 8.270197304146288e-06, "loss": 2.5348, "step": 23740 }, { "epoch": 1.75, "grad_norm": 4.101901531219482, "learning_rate": 8.221627078780525e-06, "loss": 2.5865, "step": 23750 }, { "epoch": 1.76, "grad_norm": 6.394351482391357, "learning_rate": 8.173193783259902e-06, "loss": 2.3589, "step": 23760 }, { "epoch": 1.76, "grad_norm": 7.091293811798096, "learning_rate": 8.124897489845073e-06, "loss": 2.8034, "step": 23770 }, { "epoch": 1.76, "grad_norm": 6.968698024749756, "learning_rate": 8.076738270592243e-06, "loss": 2.2993, "step": 23780 }, { "epoch": 1.76, "grad_norm": 5.620391368865967, "learning_rate": 8.02871619735316e-06, "loss": 2.4773, "step": 23790 }, { "epoch": 1.76, "grad_norm": 6.991843223571777, "learning_rate": 7.980831341774909e-06, "loss": 2.4585, "step": 23800 }, { "epoch": 1.76, "eval_loss": 2.662553548812866, "eval_runtime": 1095.3908, "eval_samples_per_second": 5.204, "eval_steps_per_second": 5.204, "step": 23800 }, { "epoch": 1.76, "grad_norm": 4.3224921226501465, "learning_rate": 7.933083775299877e-06, "loss": 2.3389, "step": 23810 }, { "epoch": 1.76, "grad_norm": 4.530595302581787, "learning_rate": 7.885473569165658e-06, "loss": 2.2855, "step": 23820 }, { "epoch": 1.76, "grad_norm": 4.67950439453125, "learning_rate": 7.83800079440482e-06, "loss": 2.4611, "step": 23830 }, { "epoch": 1.76, "grad_norm": 4.393266201019287, "learning_rate": 7.790665521844975e-06, "loss": 2.4187, "step": 23840 }, { "epoch": 1.76, "grad_norm": 5.820330619812012, "learning_rate": 7.74346782210853e-06, "loss": 2.5358, "step": 23850 }, { "epoch": 1.76, "grad_norm": 5.662726879119873, "learning_rate": 7.696407765612656e-06, "loss": 2.5325, "step": 23860 }, { "epoch": 1.76, "grad_norm": 4.868063449859619, "learning_rate": 7.649485422569202e-06, "loss": 2.5334, "step": 23870 }, { "epoch": 1.76, "grad_norm": 5.6850714683532715, "learning_rate": 7.60270086298448e-06, "loss": 2.4373, "step": 23880 }, { "epoch": 1.76, "grad_norm": 4.139278411865234, "learning_rate": 7.556054156659309e-06, "loss": 2.5888, "step": 23890 }, { "epoch": 1.77, "grad_norm": 3.901987314224243, "learning_rate": 7.509545373188776e-06, "loss": 2.5425, "step": 23900 }, { "epoch": 1.77, "grad_norm": 5.1275129318237305, "learning_rate": 7.4631745819622286e-06, "loss": 2.2698, "step": 23910 }, { "epoch": 1.77, "grad_norm": 5.235576152801514, "learning_rate": 7.41694185216315e-06, "loss": 2.8522, "step": 23920 }, { "epoch": 1.77, "grad_norm": 7.4979248046875, "learning_rate": 7.370847252768964e-06, "loss": 2.4142, "step": 23930 }, { "epoch": 1.77, "grad_norm": 4.67307710647583, "learning_rate": 7.324890852551114e-06, "loss": 2.4082, "step": 23940 }, { "epoch": 1.77, "grad_norm": 5.2745137214660645, "learning_rate": 7.279072720074765e-06, "loss": 2.6957, "step": 23950 }, { "epoch": 1.77, "grad_norm": 5.682844638824463, "learning_rate": 7.233392923698867e-06, "loss": 2.4437, "step": 23960 }, { "epoch": 1.77, "grad_norm": 5.371147155761719, "learning_rate": 7.187851531575895e-06, "loss": 2.4106, "step": 23970 }, { "epoch": 1.77, "grad_norm": 3.5821807384490967, "learning_rate": 7.1424486116518976e-06, "loss": 2.3772, "step": 23980 }, { "epoch": 1.77, "grad_norm": 7.6203789710998535, "learning_rate": 7.097184231666321e-06, "loss": 2.5593, "step": 23990 }, { "epoch": 1.77, "grad_norm": 6.033676624298096, "learning_rate": 7.052058459151878e-06, "loss": 2.4586, "step": 24000 }, { "epoch": 1.77, "eval_loss": 2.660005569458008, "eval_runtime": 1097.5123, "eval_samples_per_second": 5.194, "eval_steps_per_second": 5.194, "step": 24000 }, { "epoch": 1.77, "grad_norm": 10.172308921813965, "learning_rate": 7.007071361434525e-06, "loss": 2.4257, "step": 24010 }, { "epoch": 1.77, "grad_norm": 7.140941619873047, "learning_rate": 6.962223005633284e-06, "loss": 2.4525, "step": 24020 }, { "epoch": 1.78, "grad_norm": 6.787766933441162, "learning_rate": 6.917513458660197e-06, "loss": 2.7918, "step": 24030 }, { "epoch": 1.78, "grad_norm": 4.571247577667236, "learning_rate": 6.872942787220238e-06, "loss": 2.4082, "step": 24040 }, { "epoch": 1.78, "grad_norm": 5.534272193908691, "learning_rate": 6.828511057811127e-06, "loss": 2.5778, "step": 24050 }, { "epoch": 1.78, "grad_norm": 5.400485992431641, "learning_rate": 6.7842183367233354e-06, "loss": 2.7021, "step": 24060 }, { "epoch": 1.78, "grad_norm": 6.089663982391357, "learning_rate": 6.740064690039893e-06, "loss": 2.6363, "step": 24070 }, { "epoch": 1.78, "grad_norm": 7.160126209259033, "learning_rate": 6.696050183636371e-06, "loss": 2.6046, "step": 24080 }, { "epoch": 1.78, "grad_norm": 6.594214916229248, "learning_rate": 6.652174883180762e-06, "loss": 2.5559, "step": 24090 }, { "epoch": 1.78, "grad_norm": 5.203665256500244, "learning_rate": 6.608438854133347e-06, "loss": 2.4476, "step": 24100 }, { "epoch": 1.78, "grad_norm": 5.592020034790039, "learning_rate": 6.56484216174661e-06, "loss": 2.3035, "step": 24110 }, { "epoch": 1.78, "grad_norm": 6.901062488555908, "learning_rate": 6.521384871065139e-06, "loss": 2.5734, "step": 24120 }, { "epoch": 1.78, "grad_norm": 6.117889404296875, "learning_rate": 6.478067046925573e-06, "loss": 2.6569, "step": 24130 }, { "epoch": 1.78, "grad_norm": 3.797450304031372, "learning_rate": 6.439200302513093e-06, "loss": 2.4993, "step": 24140 }, { "epoch": 1.78, "grad_norm": 5.903318405151367, "learning_rate": 6.396147642682771e-06, "loss": 2.6547, "step": 24150 }, { "epoch": 1.78, "grad_norm": 4.873409271240234, "learning_rate": 6.3532346362435324e-06, "loss": 2.3683, "step": 24160 }, { "epoch": 1.79, "grad_norm": 5.629471302032471, "learning_rate": 6.310461347219976e-06, "loss": 2.9563, "step": 24170 }, { "epoch": 1.79, "grad_norm": 3.3840177059173584, "learning_rate": 6.267827839428186e-06, "loss": 2.4681, "step": 24180 }, { "epoch": 1.79, "grad_norm": 11.257518768310547, "learning_rate": 6.2295772479447625e-06, "loss": 2.4174, "step": 24190 }, { "epoch": 1.79, "grad_norm": 4.495081901550293, "learning_rate": 6.18720949955981e-06, "loss": 2.6949, "step": 24200 }, { "epoch": 1.79, "eval_loss": 2.6588234901428223, "eval_runtime": 1093.4241, "eval_samples_per_second": 5.213, "eval_steps_per_second": 5.213, "step": 24200 }, { "epoch": 1.79, "grad_norm": 4.914842128753662, "learning_rate": 6.14498171629373e-06, "loss": 2.7292, "step": 24210 }, { "epoch": 1.79, "grad_norm": 10.351119041442871, "learning_rate": 6.102893961148759e-06, "loss": 2.4258, "step": 24220 }, { "epoch": 1.79, "grad_norm": 5.2781982421875, "learning_rate": 6.0609462969182575e-06, "loss": 2.7965, "step": 24230 }, { "epoch": 1.79, "grad_norm": 7.596676826477051, "learning_rate": 6.019138786186518e-06, "loss": 2.3767, "step": 24240 }, { "epoch": 1.79, "grad_norm": 5.272423267364502, "learning_rate": 5.977471491328745e-06, "loss": 2.6428, "step": 24250 }, { "epoch": 1.79, "grad_norm": 6.982003211975098, "learning_rate": 5.935944474510991e-06, "loss": 2.6295, "step": 24260 }, { "epoch": 1.79, "grad_norm": 4.492363452911377, "learning_rate": 5.894557797689959e-06, "loss": 2.4975, "step": 24270 }, { "epoch": 1.79, "grad_norm": 3.5356361865997314, "learning_rate": 5.853311522613036e-06, "loss": 2.6458, "step": 24280 }, { "epoch": 1.79, "grad_norm": 4.993523597717285, "learning_rate": 5.812205710818075e-06, "loss": 2.3961, "step": 24290 }, { "epoch": 1.8, "grad_norm": 6.376553058624268, "learning_rate": 5.771240423633362e-06, "loss": 2.4275, "step": 24300 }, { "epoch": 1.8, "grad_norm": 5.525853157043457, "learning_rate": 5.730415722177573e-06, "loss": 2.3282, "step": 24310 }, { "epoch": 1.8, "grad_norm": 6.546508312225342, "learning_rate": 5.689731667359621e-06, "loss": 2.5095, "step": 24320 }, { "epoch": 1.8, "grad_norm": 5.087640285491943, "learning_rate": 5.649188319878563e-06, "loss": 2.4921, "step": 24330 }, { "epoch": 1.8, "grad_norm": 5.294022083282471, "learning_rate": 5.608785740223532e-06, "loss": 2.5036, "step": 24340 }, { "epoch": 1.8, "grad_norm": 6.46054220199585, "learning_rate": 5.568523988673624e-06, "loss": 2.7374, "step": 24350 }, { "epoch": 1.8, "grad_norm": 7.733225345611572, "learning_rate": 5.528403125297854e-06, "loss": 2.5931, "step": 24360 }, { "epoch": 1.8, "grad_norm": 5.521718978881836, "learning_rate": 5.48842320995504e-06, "loss": 2.324, "step": 24370 }, { "epoch": 1.8, "grad_norm": 4.55715274810791, "learning_rate": 5.448584302293691e-06, "loss": 2.3213, "step": 24380 }, { "epoch": 1.8, "grad_norm": 3.7885773181915283, "learning_rate": 5.408886461751938e-06, "loss": 2.2618, "step": 24390 }, { "epoch": 1.8, "grad_norm": 4.088833808898926, "learning_rate": 5.369329747557439e-06, "loss": 2.4464, "step": 24400 }, { "epoch": 1.8, "eval_loss": 2.658057928085327, "eval_runtime": 1096.7974, "eval_samples_per_second": 5.197, "eval_steps_per_second": 5.197, "step": 24400 }, { "epoch": 1.8, "grad_norm": 5.293616771697998, "learning_rate": 5.329914218727317e-06, "loss": 2.3675, "step": 24410 }, { "epoch": 1.8, "grad_norm": 5.487192630767822, "learning_rate": 5.290639934068042e-06, "loss": 2.4274, "step": 24420 }, { "epoch": 1.8, "grad_norm": 6.877601146697998, "learning_rate": 5.251506952175378e-06, "loss": 2.5587, "step": 24430 }, { "epoch": 1.81, "grad_norm": 4.651222229003906, "learning_rate": 5.212515331434231e-06, "loss": 2.6733, "step": 24440 }, { "epoch": 1.81, "grad_norm": 5.562499046325684, "learning_rate": 5.17366513001859e-06, "loss": 2.407, "step": 24450 }, { "epoch": 1.81, "grad_norm": 5.536728858947754, "learning_rate": 5.134956405891511e-06, "loss": 2.7379, "step": 24460 }, { "epoch": 1.81, "grad_norm": 7.043944358825684, "learning_rate": 5.096389216804942e-06, "loss": 2.6023, "step": 24470 }, { "epoch": 1.81, "grad_norm": 4.266600608825684, "learning_rate": 5.057963620299655e-06, "loss": 2.5775, "step": 24480 }, { "epoch": 1.81, "grad_norm": 5.975000858306885, "learning_rate": 5.01967967370518e-06, "loss": 2.6187, "step": 24490 }, { "epoch": 1.81, "grad_norm": 6.738065719604492, "learning_rate": 4.981537434139705e-06, "loss": 2.3506, "step": 24500 }, { "epoch": 1.81, "grad_norm": 5.501399040222168, "learning_rate": 4.9435369585099975e-06, "loss": 2.5722, "step": 24510 }, { "epoch": 1.81, "grad_norm": 4.655872344970703, "learning_rate": 4.90567830351134e-06, "loss": 2.1844, "step": 24520 }, { "epoch": 1.81, "grad_norm": 5.472281455993652, "learning_rate": 4.8679615256274065e-06, "loss": 2.6819, "step": 24530 }, { "epoch": 1.81, "grad_norm": 4.1918253898620605, "learning_rate": 4.830386681130184e-06, "loss": 2.3479, "step": 24540 }, { "epoch": 1.81, "grad_norm": 6.187207221984863, "learning_rate": 4.7929538260799266e-06, "loss": 2.3477, "step": 24550 }, { "epoch": 1.81, "grad_norm": 6.957455635070801, "learning_rate": 4.755663016325007e-06, "loss": 2.4508, "step": 24560 }, { "epoch": 1.81, "grad_norm": 5.570684909820557, "learning_rate": 4.71851430750192e-06, "loss": 2.3361, "step": 24570 }, { "epoch": 1.82, "grad_norm": 7.463441848754883, "learning_rate": 4.68150775503513e-06, "loss": 2.5163, "step": 24580 }, { "epoch": 1.82, "grad_norm": 6.18106746673584, "learning_rate": 4.644643414136984e-06, "loss": 2.7362, "step": 24590 }, { "epoch": 1.82, "grad_norm": 6.137258052825928, "learning_rate": 4.607921339807708e-06, "loss": 2.5392, "step": 24600 }, { "epoch": 1.82, "eval_loss": 2.6575379371643066, "eval_runtime": 1097.6214, "eval_samples_per_second": 5.193, "eval_steps_per_second": 5.193, "step": 24600 }, { "epoch": 1.82, "grad_norm": 4.705349922180176, "learning_rate": 4.57134158683521e-06, "loss": 2.3636, "step": 24610 }, { "epoch": 1.82, "grad_norm": 13.131735801696777, "learning_rate": 4.534904209795133e-06, "loss": 2.7459, "step": 24620 }, { "epoch": 1.82, "grad_norm": 5.176623344421387, "learning_rate": 4.498609263050602e-06, "loss": 2.5748, "step": 24630 }, { "epoch": 1.82, "grad_norm": 4.853312015533447, "learning_rate": 4.462456800752335e-06, "loss": 2.5707, "step": 24640 }, { "epoch": 1.82, "grad_norm": 7.627806663513184, "learning_rate": 4.426446876838441e-06, "loss": 2.7449, "step": 24650 }, { "epoch": 1.82, "grad_norm": 5.656932353973389, "learning_rate": 4.390579545034334e-06, "loss": 2.4417, "step": 24660 }, { "epoch": 1.82, "grad_norm": 3.796220541000366, "learning_rate": 4.354854858852731e-06, "loss": 2.3381, "step": 24670 }, { "epoch": 1.82, "grad_norm": 5.063661575317383, "learning_rate": 4.319272871593483e-06, "loss": 2.2168, "step": 24680 }, { "epoch": 1.82, "grad_norm": 7.319814682006836, "learning_rate": 4.283833636343582e-06, "loss": 2.6516, "step": 24690 }, { "epoch": 1.82, "grad_norm": 4.529714107513428, "learning_rate": 4.24853720597701e-06, "loss": 2.5271, "step": 24700 }, { "epoch": 1.83, "grad_norm": 3.921539783477783, "learning_rate": 4.21338363315471e-06, "loss": 2.4202, "step": 24710 }, { "epoch": 1.83, "grad_norm": 6.239911079406738, "learning_rate": 4.178372970324473e-06, "loss": 2.3875, "step": 24720 }, { "epoch": 1.83, "grad_norm": 6.639339447021484, "learning_rate": 4.1435052697208595e-06, "loss": 2.4489, "step": 24730 }, { "epoch": 1.83, "grad_norm": 3.866710662841797, "learning_rate": 4.1087805833651795e-06, "loss": 2.6613, "step": 24740 }, { "epoch": 1.83, "grad_norm": 5.444427490234375, "learning_rate": 4.074198963065346e-06, "loss": 2.6155, "step": 24750 }, { "epoch": 1.83, "grad_norm": 4.5667195320129395, "learning_rate": 4.039760460415798e-06, "loss": 2.427, "step": 24760 }, { "epoch": 1.83, "grad_norm": 5.31951904296875, "learning_rate": 4.005465126797492e-06, "loss": 2.696, "step": 24770 }, { "epoch": 1.83, "grad_norm": 5.098918914794922, "learning_rate": 3.971313013377753e-06, "loss": 2.5229, "step": 24780 }, { "epoch": 1.83, "grad_norm": 5.757137298583984, "learning_rate": 3.937304171110245e-06, "loss": 2.4862, "step": 24790 }, { "epoch": 1.83, "grad_norm": 6.163649082183838, "learning_rate": 3.903438650734881e-06, "loss": 2.5195, "step": 24800 }, { "epoch": 1.83, "eval_loss": 2.6563258171081543, "eval_runtime": 1094.2795, "eval_samples_per_second": 5.209, "eval_steps_per_second": 5.209, "step": 24800 }, { "epoch": 1.83, "grad_norm": 6.653298377990723, "learning_rate": 3.8697165027776986e-06, "loss": 2.5233, "step": 24810 }, { "epoch": 1.83, "grad_norm": 4.475333213806152, "learning_rate": 3.836137777550874e-06, "loss": 2.4716, "step": 24820 }, { "epoch": 1.83, "grad_norm": 5.567105293273926, "learning_rate": 3.8027025251526016e-06, "loss": 2.6092, "step": 24830 }, { "epoch": 1.83, "grad_norm": 4.831381320953369, "learning_rate": 3.7694107954669876e-06, "loss": 2.4514, "step": 24840 }, { "epoch": 1.84, "grad_norm": 3.961242198944092, "learning_rate": 3.736262638164045e-06, "loss": 2.6679, "step": 24850 }, { "epoch": 1.84, "grad_norm": 4.817134380340576, "learning_rate": 3.7032581026995806e-06, "loss": 2.7695, "step": 24860 }, { "epoch": 1.84, "grad_norm": 4.958139419555664, "learning_rate": 3.67039723831506e-06, "loss": 2.6389, "step": 24870 }, { "epoch": 1.84, "grad_norm": 7.7273125648498535, "learning_rate": 3.6376800940376654e-06, "loss": 2.4678, "step": 24880 }, { "epoch": 1.84, "grad_norm": 5.275628566741943, "learning_rate": 3.60510671868014e-06, "loss": 2.4368, "step": 24890 }, { "epoch": 1.84, "grad_norm": 5.690983295440674, "learning_rate": 3.5726771608407317e-06, "loss": 2.1657, "step": 24900 }, { "epoch": 1.84, "grad_norm": 6.044635772705078, "learning_rate": 3.5403914689030925e-06, "loss": 2.6097, "step": 24910 }, { "epoch": 1.84, "grad_norm": 7.05141544342041, "learning_rate": 3.508249691036258e-06, "loss": 2.2663, "step": 24920 }, { "epoch": 1.84, "grad_norm": 4.508877754211426, "learning_rate": 3.476251875194525e-06, "loss": 2.5327, "step": 24930 }, { "epoch": 1.84, "grad_norm": 5.018611907958984, "learning_rate": 3.4443980691174162e-06, "loss": 2.3549, "step": 24940 }, { "epoch": 1.84, "grad_norm": 5.333502292633057, "learning_rate": 3.4126883203296266e-06, "loss": 2.179, "step": 24950 }, { "epoch": 1.84, "grad_norm": 6.344839096069336, "learning_rate": 3.38112267614088e-06, "loss": 2.6844, "step": 24960 }, { "epoch": 1.84, "grad_norm": 4.554666519165039, "learning_rate": 3.3497011836459258e-06, "loss": 2.5045, "step": 24970 }, { "epoch": 1.85, "grad_norm": 7.463393688201904, "learning_rate": 3.3184238897244093e-06, "loss": 2.6915, "step": 24980 }, { "epoch": 1.85, "grad_norm": 5.385898590087891, "learning_rate": 3.287290841040902e-06, "loss": 2.5424, "step": 24990 }, { "epoch": 1.85, "grad_norm": 4.146659851074219, "learning_rate": 3.2563020840447157e-06, "loss": 2.1064, "step": 25000 }, { "epoch": 1.85, "eval_loss": 2.6555445194244385, "eval_runtime": 1094.8064, "eval_samples_per_second": 5.206, "eval_steps_per_second": 5.206, "step": 25000 }, { "epoch": 1.85, "grad_norm": 4.334985733032227, "learning_rate": 3.2254576649698777e-06, "loss": 2.5139, "step": 25010 }, { "epoch": 1.85, "grad_norm": 9.473915100097656, "learning_rate": 3.1947576298351214e-06, "loss": 2.3403, "step": 25020 }, { "epoch": 1.85, "grad_norm": 6.397850036621094, "learning_rate": 3.164202024443719e-06, "loss": 2.2274, "step": 25030 }, { "epoch": 1.85, "grad_norm": 6.480834007263184, "learning_rate": 3.133790894383459e-06, "loss": 2.3635, "step": 25040 }, { "epoch": 1.85, "grad_norm": 4.56965446472168, "learning_rate": 3.1035242850266154e-06, "loss": 2.3934, "step": 25050 }, { "epoch": 1.85, "grad_norm": 5.493187427520752, "learning_rate": 3.0734022415298103e-06, "loss": 2.4646, "step": 25060 }, { "epoch": 1.85, "grad_norm": 3.9670233726501465, "learning_rate": 3.0434248088339943e-06, "loss": 2.6645, "step": 25070 }, { "epoch": 1.85, "grad_norm": 5.613986492156982, "learning_rate": 3.0135920316643362e-06, "loss": 2.7214, "step": 25080 }, { "epoch": 1.85, "grad_norm": 3.3827364444732666, "learning_rate": 2.9839039545302207e-06, "loss": 2.4379, "step": 25090 }, { "epoch": 1.85, "grad_norm": 6.201570987701416, "learning_rate": 2.9543606217251384e-06, "loss": 2.6216, "step": 25100 }, { "epoch": 1.85, "grad_norm": 6.150888919830322, "learning_rate": 2.9249620773266095e-06, "loss": 2.4708, "step": 25110 }, { "epoch": 1.86, "grad_norm": 5.124236583709717, "learning_rate": 2.895708365196148e-06, "loss": 2.3435, "step": 25120 }, { "epoch": 1.86, "grad_norm": 4.904949188232422, "learning_rate": 2.8665995289791745e-06, "loss": 2.2964, "step": 25130 }, { "epoch": 1.86, "grad_norm": 3.3704028129577637, "learning_rate": 2.8376356121049717e-06, "loss": 2.3127, "step": 25140 }, { "epoch": 1.86, "grad_norm": 5.626865386962891, "learning_rate": 2.808816657786617e-06, "loss": 2.2965, "step": 25150 }, { "epoch": 1.86, "grad_norm": 6.694971084594727, "learning_rate": 2.780142709020861e-06, "loss": 2.5454, "step": 25160 }, { "epoch": 1.86, "grad_norm": 5.319484233856201, "learning_rate": 2.751613808588183e-06, "loss": 2.5326, "step": 25170 }, { "epoch": 1.86, "grad_norm": 6.219109058380127, "learning_rate": 2.7232299990526013e-06, "loss": 2.5755, "step": 25180 }, { "epoch": 1.86, "grad_norm": 7.463380336761475, "learning_rate": 2.694991322761675e-06, "loss": 2.4964, "step": 25190 }, { "epoch": 1.86, "grad_norm": 4.71378231048584, "learning_rate": 2.666897821846448e-06, "loss": 2.4468, "step": 25200 }, { "epoch": 1.86, "eval_loss": 2.655106782913208, "eval_runtime": 1097.6812, "eval_samples_per_second": 5.193, "eval_steps_per_second": 5.193, "step": 25200 }, { "epoch": 1.86, "grad_norm": 4.85548734664917, "learning_rate": 2.638949538221347e-06, "loss": 2.112, "step": 25210 }, { "epoch": 1.86, "grad_norm": 6.407068729400635, "learning_rate": 2.6111465135841507e-06, "loss": 2.7188, "step": 25220 }, { "epoch": 1.86, "grad_norm": 4.663290500640869, "learning_rate": 2.583488789415922e-06, "loss": 2.5207, "step": 25230 }, { "epoch": 1.86, "grad_norm": 5.210723876953125, "learning_rate": 2.555976406980942e-06, "loss": 2.6299, "step": 25240 }, { "epoch": 1.87, "grad_norm": 3.8297393321990967, "learning_rate": 2.5286094073266097e-06, "loss": 2.2596, "step": 25250 }, { "epoch": 1.87, "grad_norm": 3.5863406658172607, "learning_rate": 2.5013878312834747e-06, "loss": 2.4618, "step": 25260 }, { "epoch": 1.87, "grad_norm": 5.100343227386475, "learning_rate": 2.4743117194650834e-06, "loss": 2.4822, "step": 25270 }, { "epoch": 1.87, "grad_norm": 5.481692314147949, "learning_rate": 2.447381112267977e-06, "loss": 2.683, "step": 25280 }, { "epoch": 1.87, "grad_norm": 6.0729851722717285, "learning_rate": 2.420596049871593e-06, "loss": 2.4862, "step": 25290 }, { "epoch": 1.87, "grad_norm": 9.472423553466797, "learning_rate": 2.3939565722382207e-06, "loss": 2.43, "step": 25300 }, { "epoch": 1.87, "grad_norm": 5.9718523025512695, "learning_rate": 2.3674627191129452e-06, "loss": 2.2668, "step": 25310 }, { "epoch": 1.87, "grad_norm": 6.822712421417236, "learning_rate": 2.3411145300235915e-06, "loss": 2.4001, "step": 25320 }, { "epoch": 1.87, "grad_norm": 6.996267318725586, "learning_rate": 2.3149120442806814e-06, "loss": 2.6037, "step": 25330 }, { "epoch": 1.87, "grad_norm": 6.17630672454834, "learning_rate": 2.2888553009772997e-06, "loss": 2.6959, "step": 25340 }, { "epoch": 1.87, "grad_norm": 6.863979339599609, "learning_rate": 2.2629443389891148e-06, "loss": 2.6952, "step": 25350 }, { "epoch": 1.87, "grad_norm": 8.45169734954834, "learning_rate": 2.237179196974315e-06, "loss": 2.7508, "step": 25360 }, { "epoch": 1.87, "grad_norm": 5.637682914733887, "learning_rate": 2.2115599133734952e-06, "loss": 2.6583, "step": 25370 }, { "epoch": 1.87, "grad_norm": 5.1772918701171875, "learning_rate": 2.1860865264096808e-06, "loss": 2.499, "step": 25380 }, { "epoch": 1.88, "grad_norm": 6.219912052154541, "learning_rate": 2.1607590740881813e-06, "loss": 2.5316, "step": 25390 }, { "epoch": 1.88, "grad_norm": 5.400609970092773, "learning_rate": 2.1355775941965804e-06, "loss": 2.4839, "step": 25400 }, { "epoch": 1.88, "eval_loss": 2.655069589614868, "eval_runtime": 1097.8052, "eval_samples_per_second": 5.192, "eval_steps_per_second": 5.192, "step": 25400 }, { "epoch": 1.88, "grad_norm": 5.726144313812256, "learning_rate": 2.1105421243047043e-06, "loss": 2.7813, "step": 25410 }, { "epoch": 1.88, "grad_norm": 6.688289642333984, "learning_rate": 2.0856527017645176e-06, "loss": 2.5251, "step": 25420 }, { "epoch": 1.88, "grad_norm": 6.891797065734863, "learning_rate": 2.060909363710106e-06, "loss": 2.6199, "step": 25430 }, { "epoch": 1.88, "grad_norm": 6.396704196929932, "learning_rate": 2.036312147057573e-06, "loss": 2.3888, "step": 25440 }, { "epoch": 1.88, "grad_norm": 3.867151975631714, "learning_rate": 2.0118610885050295e-06, "loss": 2.291, "step": 25450 }, { "epoch": 1.88, "grad_norm": 6.082787036895752, "learning_rate": 1.9875562245325384e-06, "loss": 2.5563, "step": 25460 }, { "epoch": 1.88, "grad_norm": 5.629850387573242, "learning_rate": 1.963397591402016e-06, "loss": 2.4667, "step": 25470 }, { "epoch": 1.88, "grad_norm": 6.9120774269104, "learning_rate": 1.939385225157253e-06, "loss": 2.5586, "step": 25480 }, { "epoch": 1.88, "grad_norm": 5.51324462890625, "learning_rate": 1.91551916162378e-06, "loss": 2.625, "step": 25490 }, { "epoch": 1.88, "grad_norm": 4.947356224060059, "learning_rate": 1.8917994364088254e-06, "loss": 2.6076, "step": 25500 }, { "epoch": 1.88, "grad_norm": 4.116830825805664, "learning_rate": 1.8682260849013478e-06, "loss": 2.2131, "step": 25510 }, { "epoch": 1.89, "grad_norm": 4.880571365356445, "learning_rate": 1.8447991422718914e-06, "loss": 2.5583, "step": 25520 }, { "epoch": 1.89, "grad_norm": 7.822117805480957, "learning_rate": 1.821518643472564e-06, "loss": 2.684, "step": 25530 }, { "epoch": 1.89, "grad_norm": 6.742255210876465, "learning_rate": 1.7983846232369594e-06, "loss": 2.4451, "step": 25540 }, { "epoch": 1.89, "grad_norm": 8.71749496459961, "learning_rate": 1.7753971160802018e-06, "loss": 2.603, "step": 25550 }, { "epoch": 1.89, "grad_norm": 5.900051593780518, "learning_rate": 1.7525561562987347e-06, "loss": 2.7087, "step": 25560 }, { "epoch": 1.89, "grad_norm": 6.159276485443115, "learning_rate": 1.7298617779704208e-06, "loss": 2.5132, "step": 25570 }, { "epoch": 1.89, "grad_norm": 5.493851661682129, "learning_rate": 1.7073140149544197e-06, "loss": 2.4985, "step": 25580 }, { "epoch": 1.89, "grad_norm": 4.474180221557617, "learning_rate": 1.6849129008911224e-06, "loss": 2.3737, "step": 25590 }, { "epoch": 1.89, "grad_norm": 9.486087799072266, "learning_rate": 1.6626584692021497e-06, "loss": 2.4829, "step": 25600 }, { "epoch": 1.89, "eval_loss": 2.6546285152435303, "eval_runtime": 1096.3114, "eval_samples_per_second": 5.199, "eval_steps_per_second": 5.199, "step": 25600 }, { "epoch": 1.89, "grad_norm": 5.633112907409668, "learning_rate": 1.6405507530902643e-06, "loss": 2.6532, "step": 25610 }, { "epoch": 1.89, "grad_norm": 6.957579135894775, "learning_rate": 1.6185897855393372e-06, "loss": 2.4989, "step": 25620 }, { "epoch": 1.89, "grad_norm": 6.723416805267334, "learning_rate": 1.596775599314293e-06, "loss": 2.5217, "step": 25630 }, { "epoch": 1.89, "grad_norm": 8.012822151184082, "learning_rate": 1.575108226961075e-06, "loss": 2.7455, "step": 25640 }, { "epoch": 1.89, "grad_norm": 4.816512107849121, "learning_rate": 1.5535877008065802e-06, "loss": 2.3831, "step": 25650 }, { "epoch": 1.9, "grad_norm": 4.9410881996154785, "learning_rate": 1.5322140529586137e-06, "loss": 2.8791, "step": 25660 }, { "epoch": 1.9, "grad_norm": 7.129745960235596, "learning_rate": 1.5109873153058562e-06, "loss": 2.6591, "step": 25670 }, { "epoch": 1.9, "grad_norm": 6.4482526779174805, "learning_rate": 1.4899075195177747e-06, "loss": 2.5458, "step": 25680 }, { "epoch": 1.9, "grad_norm": 7.3847856521606445, "learning_rate": 1.4689746970446228e-06, "loss": 2.6046, "step": 25690 }, { "epoch": 1.9, "grad_norm": 7.786729335784912, "learning_rate": 1.448188879117407e-06, "loss": 2.6478, "step": 25700 }, { "epoch": 1.9, "grad_norm": 4.2452592849731445, "learning_rate": 1.4275500967477428e-06, "loss": 2.2543, "step": 25710 }, { "epoch": 1.9, "grad_norm": 8.031307220458984, "learning_rate": 1.4070583807279325e-06, "loss": 2.6764, "step": 25720 }, { "epoch": 1.9, "grad_norm": 7.834446907043457, "learning_rate": 1.3867137616308312e-06, "loss": 2.1737, "step": 25730 }, { "epoch": 1.9, "grad_norm": 5.337544918060303, "learning_rate": 1.3665162698098255e-06, "loss": 2.4626, "step": 25740 }, { "epoch": 1.9, "grad_norm": 6.047445774078369, "learning_rate": 1.3464659353988218e-06, "loss": 2.5175, "step": 25750 }, { "epoch": 1.9, "grad_norm": 6.275997638702393, "learning_rate": 1.3265627883121467e-06, "loss": 2.547, "step": 25760 }, { "epoch": 1.9, "grad_norm": 7.569523811340332, "learning_rate": 1.306806858244547e-06, "loss": 2.2549, "step": 25770 }, { "epoch": 1.9, "grad_norm": 5.868937969207764, "learning_rate": 1.2871981746711115e-06, "loss": 2.445, "step": 25780 }, { "epoch": 1.91, "grad_norm": 6.172995567321777, "learning_rate": 1.2677367668472607e-06, "loss": 2.4238, "step": 25790 }, { "epoch": 1.91, "grad_norm": 5.2079949378967285, "learning_rate": 1.2484226638086682e-06, "loss": 2.4737, "step": 25800 }, { "epoch": 1.91, "eval_loss": 2.6542229652404785, "eval_runtime": 1089.7943, "eval_samples_per_second": 5.23, "eval_steps_per_second": 5.23, "step": 25800 }, { "epoch": 1.91, "grad_norm": 4.673678874969482, "learning_rate": 1.2292558943712619e-06, "loss": 2.4163, "step": 25810 }, { "epoch": 1.91, "grad_norm": 5.8100481033325195, "learning_rate": 1.210236487131089e-06, "loss": 2.7093, "step": 25820 }, { "epoch": 1.91, "grad_norm": 6.0081610679626465, "learning_rate": 1.1913644704644288e-06, "loss": 2.7016, "step": 25830 }, { "epoch": 1.91, "grad_norm": 4.318962574005127, "learning_rate": 1.172639872527581e-06, "loss": 2.2921, "step": 25840 }, { "epoch": 1.91, "grad_norm": 6.901121616363525, "learning_rate": 1.1540627212569433e-06, "loss": 2.6351, "step": 25850 }, { "epoch": 1.91, "grad_norm": 5.046151161193848, "learning_rate": 1.1356330443689445e-06, "loss": 2.7171, "step": 25860 }, { "epoch": 1.91, "grad_norm": 5.555967330932617, "learning_rate": 1.1173508693599344e-06, "loss": 2.46, "step": 25870 }, { "epoch": 1.91, "grad_norm": 4.512118816375732, "learning_rate": 1.0992162235062164e-06, "loss": 2.4003, "step": 25880 }, { "epoch": 1.91, "grad_norm": 5.666736602783203, "learning_rate": 1.0812291338640145e-06, "loss": 2.6762, "step": 25890 }, { "epoch": 1.91, "grad_norm": 6.129502296447754, "learning_rate": 1.0633896272693732e-06, "loss": 2.5756, "step": 25900 }, { "epoch": 1.91, "grad_norm": 5.501920223236084, "learning_rate": 1.0456977303381688e-06, "loss": 2.3172, "step": 25910 }, { "epoch": 1.91, "grad_norm": 5.519867420196533, "learning_rate": 1.028153469466031e-06, "loss": 2.538, "step": 25920 }, { "epoch": 1.92, "grad_norm": 6.417172431945801, "learning_rate": 1.0107568708283222e-06, "loss": 2.5725, "step": 25930 }, { "epoch": 1.92, "grad_norm": 5.723873615264893, "learning_rate": 9.935079603801244e-07, "loss": 2.5679, "step": 25940 }, { "epoch": 1.92, "grad_norm": 5.8061065673828125, "learning_rate": 9.764067638561415e-07, "loss": 2.603, "step": 25950 }, { "epoch": 1.92, "grad_norm": 7.154747009277344, "learning_rate": 9.59453306770719e-07, "loss": 2.2465, "step": 25960 }, { "epoch": 1.92, "grad_norm": 5.935358047485352, "learning_rate": 9.426476144177576e-07, "loss": 2.7148, "step": 25970 }, { "epoch": 1.92, "grad_norm": 6.310463905334473, "learning_rate": 9.259897118707228e-07, "loss": 2.5083, "step": 25980 }, { "epoch": 1.92, "grad_norm": 5.4176926612854, "learning_rate": 9.094796239825787e-07, "loss": 2.7756, "step": 25990 }, { "epoch": 1.92, "grad_norm": 6.910298824310303, "learning_rate": 8.931173753857325e-07, "loss": 2.6436, "step": 26000 }, { "epoch": 1.92, "eval_loss": 2.6540627479553223, "eval_runtime": 1093.6164, "eval_samples_per_second": 5.212, "eval_steps_per_second": 5.212, "step": 26000 }, { "epoch": 1.92, "grad_norm": 5.972805500030518, "learning_rate": 8.769029904920456e-07, "loss": 2.5209, "step": 26010 }, { "epoch": 1.92, "grad_norm": 5.985231876373291, "learning_rate": 8.60836493492767e-07, "loss": 2.5231, "step": 26020 }, { "epoch": 1.92, "grad_norm": 7.196133136749268, "learning_rate": 8.44917908358489e-07, "loss": 2.7249, "step": 26030 }, { "epoch": 1.92, "grad_norm": 5.080741882324219, "learning_rate": 8.291472588391469e-07, "loss": 2.4597, "step": 26040 }, { "epoch": 1.92, "grad_norm": 4.692221164703369, "learning_rate": 8.135245684639526e-07, "loss": 2.5251, "step": 26050 }, { "epoch": 1.93, "grad_norm": 4.760748386383057, "learning_rate": 7.9804986054135e-07, "loss": 2.5533, "step": 26060 }, { "epoch": 1.93, "grad_norm": 5.430874347686768, "learning_rate": 7.827231581590377e-07, "loss": 2.7045, "step": 26070 }, { "epoch": 1.93, "grad_norm": 3.716386079788208, "learning_rate": 7.675444841838575e-07, "loss": 2.2073, "step": 26080 }, { "epoch": 1.93, "grad_norm": 7.227940082550049, "learning_rate": 7.525138612618166e-07, "loss": 2.7283, "step": 26090 }, { "epoch": 1.93, "grad_norm": 5.73671817779541, "learning_rate": 7.376313118180322e-07, "loss": 2.3235, "step": 26100 }, { "epoch": 1.93, "grad_norm": 4.938995361328125, "learning_rate": 7.228968580567097e-07, "loss": 2.3111, "step": 26110 }, { "epoch": 1.93, "grad_norm": 4.570291042327881, "learning_rate": 7.083105219610975e-07, "loss": 2.4974, "step": 26120 }, { "epoch": 1.93, "grad_norm": 6.675302505493164, "learning_rate": 6.93872325293432e-07, "loss": 2.4026, "step": 26130 }, { "epoch": 1.93, "grad_norm": 3.6706745624542236, "learning_rate": 6.79582289594971e-07, "loss": 2.6083, "step": 26140 }, { "epoch": 1.93, "grad_norm": 6.997994899749756, "learning_rate": 6.654404361859156e-07, "loss": 2.636, "step": 26150 }, { "epoch": 1.93, "grad_norm": 3.7949180603027344, "learning_rate": 6.51446786165355e-07, "loss": 2.6478, "step": 26160 }, { "epoch": 1.93, "grad_norm": 6.412059307098389, "learning_rate": 6.376013604112885e-07, "loss": 2.4066, "step": 26170 }, { "epoch": 1.93, "grad_norm": 7.183565616607666, "learning_rate": 6.2390417958057e-07, "loss": 2.6993, "step": 26180 }, { "epoch": 1.93, "grad_norm": 6.4794020652771, "learning_rate": 6.103552641088639e-07, "loss": 2.3288, "step": 26190 }, { "epoch": 1.94, "grad_norm": 7.5243611335754395, "learning_rate": 5.969546342106558e-07, "loss": 2.5551, "step": 26200 }, { "epoch": 1.94, "eval_loss": 2.6537866592407227, "eval_runtime": 1093.9884, "eval_samples_per_second": 5.21, "eval_steps_per_second": 5.21, "step": 26200 }, { "epoch": 1.94, "grad_norm": 5.41322660446167, "learning_rate": 5.837023098791417e-07, "loss": 2.472, "step": 26210 }, { "epoch": 1.94, "grad_norm": 3.8366689682006836, "learning_rate": 5.705983108863278e-07, "loss": 2.5584, "step": 26220 }, { "epoch": 1.94, "grad_norm": 6.729165077209473, "learning_rate": 5.57642656782853e-07, "loss": 2.5014, "step": 26230 }, { "epoch": 1.94, "grad_norm": 7.120552062988281, "learning_rate": 5.448353668980666e-07, "loss": 2.9143, "step": 26240 }, { "epoch": 1.94, "grad_norm": 6.512486457824707, "learning_rate": 5.321764603399726e-07, "loss": 2.5403, "step": 26250 }, { "epoch": 1.94, "grad_norm": 5.751278400421143, "learning_rate": 5.196659559951633e-07, "loss": 2.5884, "step": 26260 }, { "epoch": 1.94, "grad_norm": 6.711959362030029, "learning_rate": 5.073038725288304e-07, "loss": 2.5595, "step": 26270 }, { "epoch": 1.94, "grad_norm": 7.284610748291016, "learning_rate": 4.950902283847537e-07, "loss": 2.2269, "step": 26280 }, { "epoch": 1.94, "grad_norm": 4.604262828826904, "learning_rate": 4.830250417852233e-07, "loss": 2.5721, "step": 26290 }, { "epoch": 1.94, "grad_norm": 6.925443649291992, "learning_rate": 4.7110833073101825e-07, "loss": 2.502, "step": 26300 }, { "epoch": 1.94, "grad_norm": 3.369199752807617, "learning_rate": 4.5934011300142743e-07, "loss": 2.5734, "step": 26310 }, { "epoch": 1.94, "grad_norm": 7.462447166442871, "learning_rate": 4.477204061542062e-07, "loss": 2.5041, "step": 26320 }, { "epoch": 1.95, "grad_norm": 5.244159698486328, "learning_rate": 4.36249227525487e-07, "loss": 2.3157, "step": 26330 }, { "epoch": 1.95, "grad_norm": 4.864575386047363, "learning_rate": 4.249265942298464e-07, "loss": 2.5586, "step": 26340 }, { "epoch": 1.95, "grad_norm": 8.591397285461426, "learning_rate": 4.1375252316021576e-07, "loss": 2.6211, "step": 26350 }, { "epoch": 1.95, "grad_norm": 5.036678791046143, "learning_rate": 4.0272703098789276e-07, "loss": 2.1728, "step": 26360 }, { "epoch": 1.95, "grad_norm": 4.213713645935059, "learning_rate": 3.9185013416249693e-07, "loss": 2.5173, "step": 26370 }, { "epoch": 1.95, "grad_norm": 9.083184242248535, "learning_rate": 3.8112184891192504e-07, "loss": 2.5333, "step": 26380 }, { "epoch": 1.95, "grad_norm": 11.7958345413208, "learning_rate": 3.705421912423956e-07, "loss": 2.5472, "step": 26390 }, { "epoch": 1.95, "grad_norm": 4.839986801147461, "learning_rate": 3.6011117693833806e-07, "loss": 2.5423, "step": 26400 }, { "epoch": 1.95, "eval_loss": 2.6536054611206055, "eval_runtime": 1094.3772, "eval_samples_per_second": 5.208, "eval_steps_per_second": 5.208, "step": 26400 }, { "epoch": 1.95, "grad_norm": 5.843730926513672, "learning_rate": 3.498288215624257e-07, "loss": 2.537, "step": 26410 }, { "epoch": 1.95, "grad_norm": 7.053458213806152, "learning_rate": 3.396951404555648e-07, "loss": 2.5372, "step": 26420 }, { "epoch": 1.95, "grad_norm": 4.698965072631836, "learning_rate": 3.2971014873680597e-07, "loss": 2.2936, "step": 26430 }, { "epoch": 1.95, "grad_norm": 5.811645984649658, "learning_rate": 3.198738613033769e-07, "loss": 2.7739, "step": 26440 }, { "epoch": 1.95, "grad_norm": 6.532294750213623, "learning_rate": 3.101862928306498e-07, "loss": 2.5593, "step": 26450 }, { "epoch": 1.95, "grad_norm": 5.7458367347717285, "learning_rate": 3.0064745777210745e-07, "loss": 2.4244, "step": 26460 }, { "epoch": 1.96, "grad_norm": 4.933990478515625, "learning_rate": 2.912573703593324e-07, "loss": 2.4246, "step": 26470 }, { "epoch": 1.96, "grad_norm": 5.212098598480225, "learning_rate": 2.8201604460197375e-07, "loss": 2.666, "step": 26480 }, { "epoch": 1.96, "grad_norm": 7.725255489349365, "learning_rate": 2.7292349428773567e-07, "loss": 2.2872, "step": 26490 }, { "epoch": 1.96, "grad_norm": 6.296080112457275, "learning_rate": 2.639797329823668e-07, "loss": 2.4227, "step": 26500 }, { "epoch": 1.96, "grad_norm": 5.026681423187256, "learning_rate": 2.551847740296154e-07, "loss": 2.5354, "step": 26510 }, { "epoch": 1.96, "grad_norm": 5.291750907897949, "learning_rate": 2.465386305512185e-07, "loss": 2.3962, "step": 26520 }, { "epoch": 1.96, "grad_norm": 3.936063766479492, "learning_rate": 2.380413154469019e-07, "loss": 2.5252, "step": 26530 }, { "epoch": 1.96, "grad_norm": 8.992650985717773, "learning_rate": 2.2969284139433555e-07, "loss": 2.4413, "step": 26540 }, { "epoch": 1.96, "grad_norm": 7.641388893127441, "learning_rate": 2.2149322084913381e-07, "loss": 2.6156, "step": 26550 }, { "epoch": 1.96, "grad_norm": 4.50031042098999, "learning_rate": 2.134424660447998e-07, "loss": 2.5348, "step": 26560 }, { "epoch": 1.96, "grad_norm": 6.620706558227539, "learning_rate": 2.0554058899275863e-07, "loss": 2.2697, "step": 26570 }, { "epoch": 1.96, "grad_norm": 5.6808085441589355, "learning_rate": 1.9778760148232434e-07, "loss": 2.6806, "step": 26580 }, { "epoch": 1.96, "grad_norm": 5.3663506507873535, "learning_rate": 1.9018351508065524e-07, "loss": 2.5661, "step": 26590 }, { "epoch": 1.96, "grad_norm": 6.384164333343506, "learning_rate": 1.8272834113275406e-07, "loss": 2.4298, "step": 26600 }, { "epoch": 1.96, "eval_loss": 2.6534934043884277, "eval_runtime": 1096.2312, "eval_samples_per_second": 5.2, "eval_steps_per_second": 5.2, "step": 26600 }, { "epoch": 1.97, "grad_norm": 6.136931896209717, "learning_rate": 1.7542209076144567e-07, "loss": 2.4511, "step": 26610 }, { "epoch": 1.97, "grad_norm": 7.29750919342041, "learning_rate": 1.6826477486741045e-07, "loss": 2.5982, "step": 26620 }, { "epoch": 1.97, "grad_norm": 4.461855411529541, "learning_rate": 1.6125640412906207e-07, "loss": 2.3932, "step": 26630 }, { "epoch": 1.97, "grad_norm": 4.770211219787598, "learning_rate": 1.5439698900262534e-07, "loss": 2.4409, "step": 26640 }, { "epoch": 1.97, "grad_norm": 3.745713710784912, "learning_rate": 1.4768653972210277e-07, "loss": 2.433, "step": 26650 }, { "epoch": 1.97, "grad_norm": 5.597508907318115, "learning_rate": 1.4112506629923029e-07, "loss": 2.5078, "step": 26660 }, { "epoch": 1.97, "grad_norm": 4.793899059295654, "learning_rate": 1.3471257852345487e-07, "loss": 2.1771, "step": 26670 }, { "epoch": 1.97, "grad_norm": 10.311989784240723, "learning_rate": 1.2844908596199023e-07, "loss": 2.6082, "step": 26680 }, { "epoch": 1.97, "grad_norm": 4.9989118576049805, "learning_rate": 1.223345979597057e-07, "loss": 2.551, "step": 26690 }, { "epoch": 1.97, "grad_norm": 5.613187789916992, "learning_rate": 1.1636912363920393e-07, "loss": 2.4562, "step": 26700 }, { "epoch": 1.97, "grad_norm": 5.113211631774902, "learning_rate": 1.1055267190074325e-07, "loss": 2.3301, "step": 26710 }, { "epoch": 1.97, "grad_norm": 7.665001392364502, "learning_rate": 1.048852514222376e-07, "loss": 2.4143, "step": 26720 }, { "epoch": 1.97, "grad_norm": 5.974045276641846, "learning_rate": 9.936687065926764e-08, "loss": 2.7031, "step": 26730 }, { "epoch": 1.98, "grad_norm": 4.682978630065918, "learning_rate": 9.39975378450586e-08, "loss": 2.4894, "step": 26740 }, { "epoch": 1.98, "grad_norm": 6.042008399963379, "learning_rate": 8.877726099043582e-08, "loss": 2.5057, "step": 26750 }, { "epoch": 1.98, "grad_norm": 5.749847888946533, "learning_rate": 8.370604788385806e-08, "loss": 2.3572, "step": 26760 }, { "epoch": 1.98, "grad_norm": 3.9606752395629883, "learning_rate": 7.87839060913953e-08, "loss": 2.414, "step": 26770 }, { "epoch": 1.98, "grad_norm": 7.164281845092773, "learning_rate": 7.401084295667327e-08, "loss": 2.2284, "step": 26780 }, { "epoch": 1.98, "grad_norm": 5.0891547203063965, "learning_rate": 6.938686560093999e-08, "loss": 2.3254, "step": 26790 }, { "epoch": 1.98, "grad_norm": 5.734001159667969, "learning_rate": 6.491198092298811e-08, "loss": 2.5871, "step": 26800 }, { "epoch": 1.98, "eval_loss": 2.6534903049468994, "eval_runtime": 1095.7983, "eval_samples_per_second": 5.202, "eval_steps_per_second": 5.202, "step": 26800 }, { "epoch": 1.98, "grad_norm": 7.397612571716309, "learning_rate": 6.058619559917711e-08, "loss": 2.6794, "step": 26810 }, { "epoch": 1.98, "grad_norm": 4.204326629638672, "learning_rate": 5.640951608339995e-08, "loss": 2.5394, "step": 26820 }, { "epoch": 1.98, "grad_norm": 8.067238807678223, "learning_rate": 5.238194860712753e-08, "loss": 2.5528, "step": 26830 }, { "epoch": 1.98, "grad_norm": 3.9365627765655518, "learning_rate": 4.8503499179319844e-08, "loss": 2.5808, "step": 26840 }, { "epoch": 1.98, "grad_norm": 5.15150785446167, "learning_rate": 4.47741735864815e-08, "loss": 2.3032, "step": 26850 }, { "epoch": 1.98, "grad_norm": 7.398310661315918, "learning_rate": 4.1193977392628425e-08, "loss": 2.4599, "step": 26860 }, { "epoch": 1.98, "grad_norm": 5.485527515411377, "learning_rate": 3.776291593927672e-08, "loss": 2.6419, "step": 26870 }, { "epoch": 1.99, "grad_norm": 6.389936447143555, "learning_rate": 3.448099434543162e-08, "loss": 2.4881, "step": 26880 }, { "epoch": 1.99, "grad_norm": 4.455927848815918, "learning_rate": 3.134821750759853e-08, "loss": 2.4383, "step": 26890 }, { "epoch": 1.99, "grad_norm": 3.46675968170166, "learning_rate": 2.8364590099771992e-08, "loss": 2.3959, "step": 26900 }, { "epoch": 1.99, "grad_norm": 5.440370559692383, "learning_rate": 2.5530116573391216e-08, "loss": 2.4442, "step": 26910 }, { "epoch": 1.99, "grad_norm": 6.947876453399658, "learning_rate": 2.2844801157406726e-08, "loss": 2.407, "step": 26920 }, { "epoch": 1.99, "grad_norm": 4.38772439956665, "learning_rate": 2.030864785818043e-08, "loss": 2.5157, "step": 26930 }, { "epoch": 1.99, "grad_norm": 7.698976993560791, "learning_rate": 1.7921660459574442e-08, "loss": 2.5359, "step": 26940 }, { "epoch": 1.99, "grad_norm": 4.17779016494751, "learning_rate": 1.5683842522884462e-08, "loss": 2.3679, "step": 26950 }, { "epoch": 1.99, "grad_norm": 5.525791645050049, "learning_rate": 1.359519738685089e-08, "loss": 2.6091, "step": 26960 }, { "epoch": 1.99, "grad_norm": 5.552348613739014, "learning_rate": 1.1655728167636603e-08, "loss": 2.4131, "step": 26970 }, { "epoch": 1.99, "grad_norm": 8.300748825073242, "learning_rate": 9.865437758871387e-09, "loss": 2.5513, "step": 26980 }, { "epoch": 1.99, "grad_norm": 5.163261890411377, "learning_rate": 8.224328831596405e-09, "loss": 2.6024, "step": 26990 }, { "epoch": 1.99, "grad_norm": 7.43178129196167, "learning_rate": 6.732403834275314e-09, "loss": 2.5353, "step": 27000 }, { "epoch": 1.99, "eval_loss": 2.6534905433654785, "eval_runtime": 1093.314, "eval_samples_per_second": 5.214, "eval_steps_per_second": 5.214, "step": 27000 } ], "logging_steps": 10, "max_steps": 27074, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 200, "total_flos": 1.1035098369036288e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }