{ "best_global_step": 3600, "best_metric": 0.36828258633613586, "best_model_checkpoint": "saves/Gemma-2-9B/lora_seqcls/train_seqcls/checkpoint-1000", "epoch": 2.9603014399138745, "eval_steps": 100, "global_step": 5500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0053828556048983985, "grad_norm": 198.63441467285156, "learning_rate": 6.474820143884892e-06, "loss": 19.1404296875, "step": 10 }, { "epoch": 0.010765711209796797, "grad_norm": 130.11439514160156, "learning_rate": 1.366906474820144e-05, "loss": 16.12879333496094, "step": 20 }, { "epoch": 0.016148566814695196, "grad_norm": 94.73497009277344, "learning_rate": 2.0863309352517988e-05, "loss": 11.966738891601562, "step": 30 }, { "epoch": 0.021531422419593594, "grad_norm": 55.8490104675293, "learning_rate": 2.805755395683453e-05, "loss": 9.874456787109375, "step": 40 }, { "epoch": 0.02691427802449199, "grad_norm": 53.740142822265625, "learning_rate": 3.5251798561151075e-05, "loss": 7.273980712890625, "step": 50 }, { "epoch": 0.03229713362939039, "grad_norm": 83.30630493164062, "learning_rate": 4.244604316546763e-05, "loss": 6.787509155273438, "step": 60 }, { "epoch": 0.03767998923428879, "grad_norm": 96.4136734008789, "learning_rate": 4.964028776978418e-05, "loss": 6.7754661560058596, "step": 70 }, { "epoch": 0.04306284483918719, "grad_norm": 77.66259765625, "learning_rate": 5.683453237410072e-05, "loss": 5.704140853881836, "step": 80 }, { "epoch": 0.04844570044408559, "grad_norm": 46.28746032714844, "learning_rate": 6.402877697841726e-05, "loss": 4.287641906738282, "step": 90 }, { "epoch": 0.05382855604898398, "grad_norm": 121.80719757080078, "learning_rate": 7.122302158273382e-05, "loss": 4.469888305664062, "step": 100 }, { "epoch": 0.05382855604898398, "eval_loss": 1.1105364561080933, "eval_runtime": 64.1061, "eval_samples_per_second": 51.524, "eval_steps_per_second": 12.885, "step": 100 }, { "epoch": 0.059211411653882384, "grad_norm": 82.3691635131836, "learning_rate": 7.841726618705037e-05, "loss": 4.892630767822266, "step": 110 }, { "epoch": 0.06459426725878079, "grad_norm": 53.88746643066406, "learning_rate": 8.561151079136692e-05, "loss": 3.885559844970703, "step": 120 }, { "epoch": 0.06997712286367919, "grad_norm": 59.405372619628906, "learning_rate": 9.280575539568345e-05, "loss": 3.8151809692382814, "step": 130 }, { "epoch": 0.07535997846857757, "grad_norm": 85.99320220947266, "learning_rate": 0.0001, "loss": 4.0115612030029295, "step": 140 }, { "epoch": 0.08074283407347597, "grad_norm": 40.51960754394531, "learning_rate": 0.00010719424460431656, "loss": 3.4070945739746095, "step": 150 }, { "epoch": 0.08612568967837438, "grad_norm": 73.72062683105469, "learning_rate": 0.00011438848920863309, "loss": 4.7824043273925785, "step": 160 }, { "epoch": 0.09150854528327278, "grad_norm": 62.74378204345703, "learning_rate": 0.00012158273381294964, "loss": 4.632376480102539, "step": 170 }, { "epoch": 0.09689140088817118, "grad_norm": 41.6406364440918, "learning_rate": 0.0001287769784172662, "loss": 3.02130126953125, "step": 180 }, { "epoch": 0.10227425649306958, "grad_norm": 55.67851257324219, "learning_rate": 0.00013597122302158273, "loss": 4.105777359008789, "step": 190 }, { "epoch": 0.10765711209796797, "grad_norm": 88.68601989746094, "learning_rate": 0.0001431654676258993, "loss": 3.745909881591797, "step": 200 }, { "epoch": 0.10765711209796797, "eval_loss": 1.129400610923767, "eval_runtime": 64.0494, "eval_samples_per_second": 51.57, "eval_steps_per_second": 12.896, "step": 200 }, { "epoch": 0.11303996770286637, "grad_norm": 44.12594223022461, "learning_rate": 0.00015035971223021583, "loss": 4.0704700469970705, "step": 210 }, { "epoch": 0.11842282330776477, "grad_norm": 41.71208572387695, "learning_rate": 0.00015755395683453237, "loss": 3.3986480712890623, "step": 220 }, { "epoch": 0.12380567891266317, "grad_norm": 51.5625, "learning_rate": 0.00016474820143884893, "loss": 3.7478317260742187, "step": 230 }, { "epoch": 0.12918853451756157, "grad_norm": 54.59484100341797, "learning_rate": 0.00017194244604316547, "loss": 4.002623748779297, "step": 240 }, { "epoch": 0.13457139012245997, "grad_norm": 34.029727935791016, "learning_rate": 0.000179136690647482, "loss": 3.538894271850586, "step": 250 }, { "epoch": 0.13995424572735837, "grad_norm": 19.37107276916504, "learning_rate": 0.00018633093525179857, "loss": 3.356983184814453, "step": 260 }, { "epoch": 0.14533710133225677, "grad_norm": 58.17410659790039, "learning_rate": 0.0001935251798561151, "loss": 3.4610286712646485, "step": 270 }, { "epoch": 0.15071995693715515, "grad_norm": 115.1293716430664, "learning_rate": 0.00019999998240562744, "loss": 4.566124343872071, "step": 280 }, { "epoch": 0.15610281254205355, "grad_norm": 52.380348205566406, "learning_rate": 0.0001999978710884105, "loss": 4.061540222167968, "step": 290 }, { "epoch": 0.16148566814695195, "grad_norm": 63.469581604003906, "learning_rate": 0.00019999224098180877, "loss": 3.930801773071289, "step": 300 }, { "epoch": 0.16148566814695195, "eval_loss": 0.9815971255302429, "eval_runtime": 64.185, "eval_samples_per_second": 51.461, "eval_steps_per_second": 12.869, "step": 300 }, { "epoch": 0.16686852375185035, "grad_norm": 18.164447784423828, "learning_rate": 0.00019998309228393805, "loss": 4.083843612670899, "step": 310 }, { "epoch": 0.17225137935674875, "grad_norm": 93.28253936767578, "learning_rate": 0.00019997042531672858, "loss": 3.1324670791625975, "step": 320 }, { "epoch": 0.17763423496164715, "grad_norm": 49.66929626464844, "learning_rate": 0.00019995424052591376, "loss": 4.83184928894043, "step": 330 }, { "epoch": 0.18301709056654555, "grad_norm": 43.669410705566406, "learning_rate": 0.00019993453848101442, "loss": 3.0538238525390624, "step": 340 }, { "epoch": 0.18839994617144395, "grad_norm": 28.3753719329834, "learning_rate": 0.00019991131987531877, "loss": 3.760041427612305, "step": 350 }, { "epoch": 0.19378280177634236, "grad_norm": 26.99091148376465, "learning_rate": 0.00019988458552585808, "loss": 3.3557403564453123, "step": 360 }, { "epoch": 0.19916565738124076, "grad_norm": 42.94520568847656, "learning_rate": 0.00019985433637337776, "loss": 3.5249252319335938, "step": 370 }, { "epoch": 0.20454851298613916, "grad_norm": 34.760292053222656, "learning_rate": 0.00019982057348230447, "loss": 3.889664077758789, "step": 380 }, { "epoch": 0.20993136859103753, "grad_norm": 22.45956802368164, "learning_rate": 0.00019978329804070858, "loss": 3.2252212524414063, "step": 390 }, { "epoch": 0.21531422419593593, "grad_norm": 54.65021514892578, "learning_rate": 0.0001997425113602622, "loss": 3.99298095703125, "step": 400 }, { "epoch": 0.21531422419593593, "eval_loss": 0.8698179721832275, "eval_runtime": 64.4139, "eval_samples_per_second": 51.278, "eval_steps_per_second": 12.823, "step": 400 }, { "epoch": 0.22069707980083433, "grad_norm": 37.18206024169922, "learning_rate": 0.0001996982148761933, "loss": 2.9811370849609373, "step": 410 }, { "epoch": 0.22607993540573273, "grad_norm": 33.8664436340332, "learning_rate": 0.0001996504101472351, "loss": 2.5169837951660154, "step": 420 }, { "epoch": 0.23146279101063114, "grad_norm": 45.07470703125, "learning_rate": 0.00019959909885557112, "loss": 3.458451843261719, "step": 430 }, { "epoch": 0.23684564661552954, "grad_norm": 25.689266204833984, "learning_rate": 0.00019954428280677603, "loss": 3.2378326416015626, "step": 440 }, { "epoch": 0.24222850222042794, "grad_norm": 53.7376594543457, "learning_rate": 0.0001994859639297522, "loss": 3.302751159667969, "step": 450 }, { "epoch": 0.24761135782532634, "grad_norm": 49.085391998291016, "learning_rate": 0.00019942414427666187, "loss": 2.930678939819336, "step": 460 }, { "epoch": 0.2529942134302247, "grad_norm": 23.53020477294922, "learning_rate": 0.00019935882602285462, "loss": 3.5229896545410155, "step": 470 }, { "epoch": 0.25837706903512314, "grad_norm": 42.54838562011719, "learning_rate": 0.00019929001146679127, "loss": 3.073961639404297, "step": 480 }, { "epoch": 0.2637599246400215, "grad_norm": 36.783966064453125, "learning_rate": 0.0001992177030299626, "loss": 2.839693069458008, "step": 490 }, { "epoch": 0.26914278024491994, "grad_norm": 29.89275360107422, "learning_rate": 0.0001991419032568044, "loss": 3.5954513549804688, "step": 500 }, { "epoch": 0.26914278024491994, "eval_loss": 0.7735958099365234, "eval_runtime": 64.2996, "eval_samples_per_second": 51.369, "eval_steps_per_second": 12.846, "step": 500 }, { "epoch": 0.2745256358498183, "grad_norm": 15.766196250915527, "learning_rate": 0.0001990626148146078, "loss": 2.6433101654052735, "step": 510 }, { "epoch": 0.27990849145471675, "grad_norm": 15.622676849365234, "learning_rate": 0.00019897984049342552, "loss": 2.2897308349609373, "step": 520 }, { "epoch": 0.2852913470596151, "grad_norm": 64.56971740722656, "learning_rate": 0.0001988935832059736, "loss": 4.1805778503417965, "step": 530 }, { "epoch": 0.29067420266451355, "grad_norm": 30.153961181640625, "learning_rate": 0.0001988038459875289, "loss": 2.8382762908935546, "step": 540 }, { "epoch": 0.2960570582694119, "grad_norm": 28.525348663330078, "learning_rate": 0.00019871063199582237, "loss": 3.3420616149902345, "step": 550 }, { "epoch": 0.3014399138743103, "grad_norm": 25.80811882019043, "learning_rate": 0.0001986139445109279, "loss": 2.491804504394531, "step": 560 }, { "epoch": 0.3068227694792087, "grad_norm": 42.330684661865234, "learning_rate": 0.00019851378693514686, "loss": 3.0271644592285156, "step": 570 }, { "epoch": 0.3122056250841071, "grad_norm": 40.063087463378906, "learning_rate": 0.00019841016279288846, "loss": 2.38574161529541, "step": 580 }, { "epoch": 0.3175884806890055, "grad_norm": 36.078636169433594, "learning_rate": 0.0001983030757305456, "loss": 2.8599777221679688, "step": 590 }, { "epoch": 0.3229713362939039, "grad_norm": 37.90999984741211, "learning_rate": 0.0001981925295163667, "loss": 3.3058528900146484, "step": 600 }, { "epoch": 0.3229713362939039, "eval_loss": 0.724442720413208, "eval_runtime": 64.0896, "eval_samples_per_second": 51.537, "eval_steps_per_second": 12.888, "step": 600 }, { "epoch": 0.32835419189880233, "grad_norm": 34.73746871948242, "learning_rate": 0.00019807852804032305, "loss": 3.4641307830810546, "step": 610 }, { "epoch": 0.3337370475037007, "grad_norm": 72.2687759399414, "learning_rate": 0.00019796107531397188, "loss": 4.683813858032226, "step": 620 }, { "epoch": 0.33911990310859913, "grad_norm": 30.93055534362793, "learning_rate": 0.00019784017547031522, "loss": 2.6965951919555664, "step": 630 }, { "epoch": 0.3445027587134975, "grad_norm": 18.676742553710938, "learning_rate": 0.00019771583276365453, "loss": 2.5014991760253906, "step": 640 }, { "epoch": 0.34988561431839593, "grad_norm": 42.73445510864258, "learning_rate": 0.0001975880515694409, "loss": 3.033338737487793, "step": 650 }, { "epoch": 0.3552684699232943, "grad_norm": 47.229732513427734, "learning_rate": 0.00019745683638412116, "loss": 3.065496635437012, "step": 660 }, { "epoch": 0.3606513255281927, "grad_norm": 36.450660705566406, "learning_rate": 0.00019732219182497964, "loss": 2.9941673278808594, "step": 670 }, { "epoch": 0.3660341811330911, "grad_norm": 45.24620056152344, "learning_rate": 0.00019718412262997566, "loss": 2.664113998413086, "step": 680 }, { "epoch": 0.3714170367379895, "grad_norm": 22.437503814697266, "learning_rate": 0.0001970426336575768, "loss": 1.6834583282470703, "step": 690 }, { "epoch": 0.3767998923428879, "grad_norm": 36.59716033935547, "learning_rate": 0.000196897729886588, "loss": 2.480428123474121, "step": 700 }, { "epoch": 0.3767998923428879, "eval_loss": 0.6947948932647705, "eval_runtime": 64.1166, "eval_samples_per_second": 51.516, "eval_steps_per_second": 12.883, "step": 700 }, { "epoch": 0.3821827479477863, "grad_norm": 45.49883270263672, "learning_rate": 0.00019674941641597638, "loss": 2.7860897064208983, "step": 710 }, { "epoch": 0.3875656035526847, "grad_norm": 33.21625518798828, "learning_rate": 0.00019659769846469164, "loss": 3.083520698547363, "step": 720 }, { "epoch": 0.3929484591575831, "grad_norm": 16.77117919921875, "learning_rate": 0.00019644258137148263, "loss": 2.312260055541992, "step": 730 }, { "epoch": 0.3983313147624815, "grad_norm": 51.02537536621094, "learning_rate": 0.00019628407059470938, "loss": 3.675634002685547, "step": 740 }, { "epoch": 0.4037141703673799, "grad_norm": 20.05516242980957, "learning_rate": 0.00019612217171215094, "loss": 2.1038530349731444, "step": 750 }, { "epoch": 0.4090970259722783, "grad_norm": 35.98112869262695, "learning_rate": 0.00019595689042080944, "loss": 2.4246122360229494, "step": 760 }, { "epoch": 0.4144798815771767, "grad_norm": 27.854074478149414, "learning_rate": 0.0001957882325367091, "loss": 2.453342056274414, "step": 770 }, { "epoch": 0.41986273718207506, "grad_norm": 40.96638870239258, "learning_rate": 0.000195616203994692, "loss": 2.2066173553466797, "step": 780 }, { "epoch": 0.4252455927869735, "grad_norm": 19.81163215637207, "learning_rate": 0.00019544081084820915, "loss": 2.4471906661987304, "step": 790 }, { "epoch": 0.43062844839187187, "grad_norm": 42.2238883972168, "learning_rate": 0.00019526205926910734, "loss": 2.8852027893066405, "step": 800 }, { "epoch": 0.43062844839187187, "eval_loss": 0.7064014077186584, "eval_runtime": 64.4405, "eval_samples_per_second": 51.257, "eval_steps_per_second": 12.818, "step": 800 }, { "epoch": 0.4360113039967703, "grad_norm": 32.852134704589844, "learning_rate": 0.00019507995554741205, "loss": 2.385086441040039, "step": 810 }, { "epoch": 0.44139415960166867, "grad_norm": 6.121428489685059, "learning_rate": 0.00019489450609110618, "loss": 1.8915294647216796, "step": 820 }, { "epoch": 0.4467770152065671, "grad_norm": 24.810670852661133, "learning_rate": 0.00019470571742590437, "loss": 2.8130746841430665, "step": 830 }, { "epoch": 0.45215987081146547, "grad_norm": 32.280818939208984, "learning_rate": 0.0001945135961950236, "loss": 2.450386619567871, "step": 840 }, { "epoch": 0.4575427264163639, "grad_norm": 48.205787658691406, "learning_rate": 0.0001943181491589493, "loss": 3.0519411087036135, "step": 850 }, { "epoch": 0.46292558202126227, "grad_norm": 22.858253479003906, "learning_rate": 0.00019411938319519734, "loss": 2.4671669006347656, "step": 860 }, { "epoch": 0.4683084376261607, "grad_norm": 45.50665283203125, "learning_rate": 0.00019391730529807238, "loss": 2.972084808349609, "step": 870 }, { "epoch": 0.4736912932310591, "grad_norm": 19.182138442993164, "learning_rate": 0.0001937119225784213, "loss": 1.9543575286865233, "step": 880 }, { "epoch": 0.4790741488359575, "grad_norm": 53.60784149169922, "learning_rate": 0.00019350324226338338, "loss": 3.198233413696289, "step": 890 }, { "epoch": 0.4844570044408559, "grad_norm": 28.96963882446289, "learning_rate": 0.00019329127169613564, "loss": 3.061937141418457, "step": 900 }, { "epoch": 0.4844570044408559, "eval_loss": 0.6995744109153748, "eval_runtime": 64.1823, "eval_samples_per_second": 51.463, "eval_steps_per_second": 12.87, "step": 900 }, { "epoch": 0.48983986004575425, "grad_norm": 42.73357009887695, "learning_rate": 0.00019307601833563475, "loss": 3.221673583984375, "step": 910 }, { "epoch": 0.4952227156506527, "grad_norm": 21.203781127929688, "learning_rate": 0.00019285748975635437, "loss": 2.1903615951538087, "step": 920 }, { "epoch": 0.500605571255551, "grad_norm": 21.64086151123047, "learning_rate": 0.0001926356936480186, "loss": 2.1224742889404298, "step": 930 }, { "epoch": 0.5059884268604494, "grad_norm": 35.52275466918945, "learning_rate": 0.0001924106378153316, "loss": 3.230604553222656, "step": 940 }, { "epoch": 0.5113712824653479, "grad_norm": 26.517505645751953, "learning_rate": 0.00019218233017770264, "loss": 2.1124088287353517, "step": 950 }, { "epoch": 0.5167541380702463, "grad_norm": 27.521711349487305, "learning_rate": 0.0001919507787689677, "loss": 2.729749298095703, "step": 960 }, { "epoch": 0.5221369936751447, "grad_norm": 33.03516387939453, "learning_rate": 0.00019171599173710662, "loss": 1.914764976501465, "step": 970 }, { "epoch": 0.527519849280043, "grad_norm": 28.447750091552734, "learning_rate": 0.00019147797734395648, "loss": 1.99549560546875, "step": 980 }, { "epoch": 0.5329027048849415, "grad_norm": 19.028818130493164, "learning_rate": 0.0001912367439649207, "loss": 1.8732738494873047, "step": 990 }, { "epoch": 0.5382855604898399, "grad_norm": 26.41012191772461, "learning_rate": 0.00019099230008867463, "loss": 2.936910057067871, "step": 1000 }, { "epoch": 0.5382855604898399, "eval_loss": 0.6647254228591919, "eval_runtime": 64.3533, "eval_samples_per_second": 51.326, "eval_steps_per_second": 12.835, "step": 1000 }, { "epoch": 0.5436684160947383, "grad_norm": 29.55500602722168, "learning_rate": 0.00019074465431686652, "loss": 2.9467599868774412, "step": 1010 }, { "epoch": 0.5490512716996366, "grad_norm": 15.729572296142578, "learning_rate": 0.00019049381536381503, "loss": 2.841005325317383, "step": 1020 }, { "epoch": 0.554434127304535, "grad_norm": 7.53200626373291, "learning_rate": 0.0001902397920562025, "loss": 1.8715387344360352, "step": 1030 }, { "epoch": 0.5598169829094335, "grad_norm": 35.68206787109375, "learning_rate": 0.0001899825933327644, "loss": 2.8048942565917967, "step": 1040 }, { "epoch": 0.5651998385143319, "grad_norm": 46.12540054321289, "learning_rate": 0.00018972222824397485, "loss": 2.888982963562012, "step": 1050 }, { "epoch": 0.5705826941192302, "grad_norm": 28.082979202270508, "learning_rate": 0.00018945870595172797, "loss": 2.8277057647705077, "step": 1060 }, { "epoch": 0.5759655497241286, "grad_norm": 8.667706489562988, "learning_rate": 0.00018919203572901559, "loss": 1.7566593170166016, "step": 1070 }, { "epoch": 0.5813484053290271, "grad_norm": 32.86021423339844, "learning_rate": 0.000188922226959601, "loss": 2.00911922454834, "step": 1080 }, { "epoch": 0.5867312609339255, "grad_norm": 20.026046752929688, "learning_rate": 0.00018864928913768866, "loss": 3.050994873046875, "step": 1090 }, { "epoch": 0.5921141165388238, "grad_norm": 34.74673843383789, "learning_rate": 0.00018837323186759016, "loss": 2.7538400650024415, "step": 1100 }, { "epoch": 0.5921141165388238, "eval_loss": 0.671667754650116, "eval_runtime": 64.3041, "eval_samples_per_second": 51.365, "eval_steps_per_second": 12.845, "step": 1100 }, { "epoch": 0.5974969721437222, "grad_norm": 26.802404403686523, "learning_rate": 0.00018809406486338618, "loss": 2.579293060302734, "step": 1110 }, { "epoch": 0.6028798277486206, "grad_norm": 37.77304458618164, "learning_rate": 0.00018781179794858478, "loss": 2.3671943664550783, "step": 1120 }, { "epoch": 0.6082626833535191, "grad_norm": 40.37071228027344, "learning_rate": 0.00018752644105577565, "loss": 1.8490634918212892, "step": 1130 }, { "epoch": 0.6136455389584174, "grad_norm": 58.33607482910156, "learning_rate": 0.0001872380042262806, "loss": 2.5194568634033203, "step": 1140 }, { "epoch": 0.6190283945633158, "grad_norm": 18.999311447143555, "learning_rate": 0.0001869464976098003, "loss": 2.8447465896606445, "step": 1150 }, { "epoch": 0.6244112501682142, "grad_norm": 9.258393287658691, "learning_rate": 0.00018665193146405695, "loss": 1.3028793334960938, "step": 1160 }, { "epoch": 0.6297941057731127, "grad_norm": 36.751834869384766, "learning_rate": 0.00018635431615443354, "loss": 2.4607158660888673, "step": 1170 }, { "epoch": 0.635176961378011, "grad_norm": 32.03705596923828, "learning_rate": 0.00018605366215360887, "loss": 2.4548139572143555, "step": 1180 }, { "epoch": 0.6405598169829094, "grad_norm": 83.0655746459961, "learning_rate": 0.00018574998004118932, "loss": 4.094330215454102, "step": 1190 }, { "epoch": 0.6459426725878078, "grad_norm": 16.984663009643555, "learning_rate": 0.00018544328050333625, "loss": 2.0978935241699217, "step": 1200 }, { "epoch": 0.6459426725878078, "eval_loss": 0.5826177597045898, "eval_runtime": 64.1932, "eval_samples_per_second": 51.454, "eval_steps_per_second": 12.867, "step": 1200 }, { "epoch": 0.6513255281927063, "grad_norm": 31.547466278076172, "learning_rate": 0.00018513357433239022, "loss": 2.314143753051758, "step": 1210 }, { "epoch": 0.6567083837976047, "grad_norm": 50.67429733276367, "learning_rate": 0.00018482087242649117, "loss": 4.206168746948242, "step": 1220 }, { "epoch": 0.662091239402503, "grad_norm": 31.81623649597168, "learning_rate": 0.00018450518578919475, "loss": 2.8035467147827147, "step": 1230 }, { "epoch": 0.6674740950074014, "grad_norm": 24.316707611083984, "learning_rate": 0.00018418652552908537, "loss": 2.3980735778808593, "step": 1240 }, { "epoch": 0.6728569506122998, "grad_norm": 34.293701171875, "learning_rate": 0.00018386490285938516, "loss": 2.651681900024414, "step": 1250 }, { "epoch": 0.6782398062171983, "grad_norm": 34.4983024597168, "learning_rate": 0.0001835403290975594, "loss": 2.2850324630737306, "step": 1260 }, { "epoch": 0.6836226618220966, "grad_norm": 31.51317596435547, "learning_rate": 0.00018321281566491835, "loss": 1.8678964614868163, "step": 1270 }, { "epoch": 0.689005517426995, "grad_norm": 88.34801483154297, "learning_rate": 0.0001828823740862152, "loss": 2.051138496398926, "step": 1280 }, { "epoch": 0.6943883730318934, "grad_norm": 23.922054290771484, "learning_rate": 0.00018254901598924078, "loss": 1.466459083557129, "step": 1290 }, { "epoch": 0.6997712286367919, "grad_norm": 39.07735824584961, "learning_rate": 0.00018221275310441405, "loss": 2.2651920318603516, "step": 1300 }, { "epoch": 0.6997712286367919, "eval_loss": 0.6614837646484375, "eval_runtime": 63.9775, "eval_samples_per_second": 51.628, "eval_steps_per_second": 12.911, "step": 1300 }, { "epoch": 0.7051540842416902, "grad_norm": 51.51314926147461, "learning_rate": 0.0001818735972643697, "loss": 2.400813102722168, "step": 1310 }, { "epoch": 0.7105369398465886, "grad_norm": 27.827117919921875, "learning_rate": 0.0001815315604035414, "loss": 2.1232112884521483, "step": 1320 }, { "epoch": 0.715919795451487, "grad_norm": 39.04352951049805, "learning_rate": 0.00018118665455774227, "loss": 2.0058998107910155, "step": 1330 }, { "epoch": 0.7213026510563854, "grad_norm": 21.7037296295166, "learning_rate": 0.00018083889186374088, "loss": 4.023828125, "step": 1340 }, { "epoch": 0.7266855066612838, "grad_norm": 23.27933120727539, "learning_rate": 0.00018048828455883455, "loss": 2.1123376846313477, "step": 1350 }, { "epoch": 0.7320683622661822, "grad_norm": 23.154111862182617, "learning_rate": 0.00018013484498041854, "loss": 2.0040388107299805, "step": 1360 }, { "epoch": 0.7374512178710806, "grad_norm": 36.17502212524414, "learning_rate": 0.000179778585565552, "loss": 1.7808284759521484, "step": 1370 }, { "epoch": 0.742834073475979, "grad_norm": 46.8353385925293, "learning_rate": 0.0001794195188505203, "loss": 2.6809072494506836, "step": 1380 }, { "epoch": 0.7482169290808774, "grad_norm": 19.901514053344727, "learning_rate": 0.00017905765747039385, "loss": 2.2484678268432616, "step": 1390 }, { "epoch": 0.7535997846857758, "grad_norm": 31.01380729675293, "learning_rate": 0.0001786930141585836, "loss": 1.9935230255126952, "step": 1400 }, { "epoch": 0.7535997846857758, "eval_loss": 0.5672405362129211, "eval_runtime": 64.147, "eval_samples_per_second": 51.491, "eval_steps_per_second": 12.877, "step": 1400 }, { "epoch": 0.7589826402906742, "grad_norm": 40.08690643310547, "learning_rate": 0.00017832560174639282, "loss": 2.275004577636719, "step": 1410 }, { "epoch": 0.7643654958955726, "grad_norm": 33.389278411865234, "learning_rate": 0.00017795543316256578, "loss": 2.6517934799194336, "step": 1420 }, { "epoch": 0.769748351500471, "grad_norm": 24.02670669555664, "learning_rate": 0.0001775825214328326, "loss": 1.8687612533569335, "step": 1430 }, { "epoch": 0.7751312071053694, "grad_norm": 39.74971008300781, "learning_rate": 0.00017720687967945093, "loss": 2.8546443939208985, "step": 1440 }, { "epoch": 0.7805140627102678, "grad_norm": 42.48725891113281, "learning_rate": 0.0001768285211207444, "loss": 2.515781784057617, "step": 1450 }, { "epoch": 0.7858969183151662, "grad_norm": 24.863798141479492, "learning_rate": 0.00017644745907063723, "loss": 1.927882766723633, "step": 1460 }, { "epoch": 0.7912797739200645, "grad_norm": 9.220629692077637, "learning_rate": 0.00017606370693818584, "loss": 1.976559829711914, "step": 1470 }, { "epoch": 0.796662629524963, "grad_norm": 48.26815414428711, "learning_rate": 0.000175677278227107, "loss": 2.111470413208008, "step": 1480 }, { "epoch": 0.8020454851298614, "grad_norm": 39.00963592529297, "learning_rate": 0.00017528818653530273, "loss": 1.7109893798828124, "step": 1490 }, { "epoch": 0.8074283407347598, "grad_norm": 24.070545196533203, "learning_rate": 0.0001748964455543816, "loss": 3.191597747802734, "step": 1500 }, { "epoch": 0.8074283407347598, "eval_loss": 0.5993195176124573, "eval_runtime": 63.9501, "eval_samples_per_second": 51.65, "eval_steps_per_second": 12.916, "step": 1500 }, { "epoch": 0.8128111963396581, "grad_norm": 12.18187141418457, "learning_rate": 0.00017450206906917713, "loss": 2.0544879913330076, "step": 1510 }, { "epoch": 0.8181940519445566, "grad_norm": 28.476694107055664, "learning_rate": 0.0001741050709572627, "loss": 2.3975988388061524, "step": 1520 }, { "epoch": 0.823576907549455, "grad_norm": 24.376489639282227, "learning_rate": 0.0001737054651884631, "loss": 1.8688972473144532, "step": 1530 }, { "epoch": 0.8289597631543534, "grad_norm": 38.94839096069336, "learning_rate": 0.00017330326582436304, "loss": 2.3757015228271485, "step": 1540 }, { "epoch": 0.8343426187592518, "grad_norm": 37.19301223754883, "learning_rate": 0.00017289848701781244, "loss": 2.7712066650390623, "step": 1550 }, { "epoch": 0.8397254743641501, "grad_norm": 23.972366333007812, "learning_rate": 0.0001724911430124281, "loss": 2.109449005126953, "step": 1560 }, { "epoch": 0.8451083299690486, "grad_norm": 37.52610397338867, "learning_rate": 0.0001720812481420929, "loss": 1.802728271484375, "step": 1570 }, { "epoch": 0.850491185573947, "grad_norm": 16.366283416748047, "learning_rate": 0.00017166881683045103, "loss": 2.741063117980957, "step": 1580 }, { "epoch": 0.8558740411788454, "grad_norm": 38.8548469543457, "learning_rate": 0.00017125386359040067, "loss": 1.7972919464111328, "step": 1590 }, { "epoch": 0.8612568967837437, "grad_norm": 22.872310638427734, "learning_rate": 0.00017083640302358326, "loss": 2.159262275695801, "step": 1600 }, { "epoch": 0.8612568967837437, "eval_loss": 0.4924517571926117, "eval_runtime": 64.2275, "eval_samples_per_second": 51.427, "eval_steps_per_second": 12.861, "step": 1600 }, { "epoch": 0.8666397523886422, "grad_norm": 27.983964920043945, "learning_rate": 0.00017041644981986967, "loss": 1.717204475402832, "step": 1610 }, { "epoch": 0.8720226079935406, "grad_norm": 21.148286819458008, "learning_rate": 0.00016999401875684316, "loss": 2.8551345825195313, "step": 1620 }, { "epoch": 0.877405463598439, "grad_norm": 80.67280578613281, "learning_rate": 0.0001695691246992797, "loss": 2.6277225494384764, "step": 1630 }, { "epoch": 0.8827883192033373, "grad_norm": 18.69855308532715, "learning_rate": 0.0001691417825986245, "loss": 2.1024648666381838, "step": 1640 }, { "epoch": 0.8881711748082358, "grad_norm": 34.107303619384766, "learning_rate": 0.00016871200749246626, "loss": 2.2313766479492188, "step": 1650 }, { "epoch": 0.8935540304131342, "grad_norm": 40.186038970947266, "learning_rate": 0.00016827981450400774, "loss": 2.4880607604980467, "step": 1660 }, { "epoch": 0.8989368860180326, "grad_norm": 70.78448486328125, "learning_rate": 0.00016784521884153362, "loss": 2.738982582092285, "step": 1670 }, { "epoch": 0.9043197416229309, "grad_norm": 36.99370193481445, "learning_rate": 0.00016740823579787558, "loss": 2.254520606994629, "step": 1680 }, { "epoch": 0.9097025972278293, "grad_norm": 39.36662673950195, "learning_rate": 0.00016696888074987392, "loss": 1.8448904037475586, "step": 1690 }, { "epoch": 0.9150854528327278, "grad_norm": 61.377532958984375, "learning_rate": 0.00016652716915783658, "loss": 2.130519485473633, "step": 1700 }, { "epoch": 0.9150854528327278, "eval_loss": 0.532718300819397, "eval_runtime": 64.1771, "eval_samples_per_second": 51.467, "eval_steps_per_second": 12.871, "step": 1700 }, { "epoch": 0.9204683084376262, "grad_norm": 40.985164642333984, "learning_rate": 0.00016608311656499504, "loss": 3.142055702209473, "step": 1710 }, { "epoch": 0.9258511640425245, "grad_norm": 15.224512100219727, "learning_rate": 0.0001656367385969575, "loss": 2.681681823730469, "step": 1720 }, { "epoch": 0.9312340196474229, "grad_norm": 30.765071868896484, "learning_rate": 0.00016518805096115888, "loss": 2.4531631469726562, "step": 1730 }, { "epoch": 0.9366168752523214, "grad_norm": 39.2271614074707, "learning_rate": 0.00016473706944630822, "loss": 1.7306629180908204, "step": 1740 }, { "epoch": 0.9419997308572198, "grad_norm": 28.554643630981445, "learning_rate": 0.00016428380992183304, "loss": 2.5790334701538087, "step": 1750 }, { "epoch": 0.9473825864621181, "grad_norm": 31.55245590209961, "learning_rate": 0.0001638282883373209, "loss": 2.3022281646728517, "step": 1760 }, { "epoch": 0.9527654420670165, "grad_norm": 29.733423233032227, "learning_rate": 0.00016337052072195823, "loss": 1.7397018432617188, "step": 1770 }, { "epoch": 0.958148297671915, "grad_norm": 28.3569393157959, "learning_rate": 0.00016291052318396625, "loss": 2.331684112548828, "step": 1780 }, { "epoch": 0.9635311532768134, "grad_norm": 31.536741256713867, "learning_rate": 0.00016244831191003406, "loss": 1.9013969421386718, "step": 1790 }, { "epoch": 0.9689140088817118, "grad_norm": 27.39286231994629, "learning_rate": 0.0001619839031647491, "loss": 1.9535322189331055, "step": 1800 }, { "epoch": 0.9689140088817118, "eval_loss": 0.4878155589103699, "eval_runtime": 63.9092, "eval_samples_per_second": 51.683, "eval_steps_per_second": 12.925, "step": 1800 }, { "epoch": 0.9742968644866101, "grad_norm": 35.60191345214844, "learning_rate": 0.00016151731329002505, "loss": 2.3475147247314454, "step": 1810 }, { "epoch": 0.9796797200915085, "grad_norm": 54.64162826538086, "learning_rate": 0.0001610485587045263, "loss": 2.4532806396484377, "step": 1820 }, { "epoch": 0.985062575696407, "grad_norm": 24.01209831237793, "learning_rate": 0.00016057765590309067, "loss": 1.9294677734375, "step": 1830 }, { "epoch": 0.9904454313013054, "grad_norm": 28.77838706970215, "learning_rate": 0.00016010462145614872, "loss": 2.6661401748657227, "step": 1840 }, { "epoch": 0.9958282869062037, "grad_norm": 23.397241592407227, "learning_rate": 0.0001596294720091407, "loss": 2.083774375915527, "step": 1850 }, { "epoch": 1.0010765711209797, "grad_norm": 24.451494216918945, "learning_rate": 0.0001591522242819309, "loss": 1.6308988571166991, "step": 1860 }, { "epoch": 1.0064594267258782, "grad_norm": 35.17308044433594, "learning_rate": 0.00015867289506821914, "loss": 2.0649885177612304, "step": 1870 }, { "epoch": 1.0118422823307764, "grad_norm": 18.505117416381836, "learning_rate": 0.00015819150123495005, "loss": 1.7077461242675782, "step": 1880 }, { "epoch": 1.017225137935675, "grad_norm": 32.787864685058594, "learning_rate": 0.00015770805972171935, "loss": 1.5830881118774414, "step": 1890 }, { "epoch": 1.0226079935405732, "grad_norm": 49.975154876708984, "learning_rate": 0.00015722258754017783, "loss": 2.320701026916504, "step": 1900 }, { "epoch": 1.0226079935405732, "eval_loss": 0.5473566055297852, "eval_runtime": 64.1602, "eval_samples_per_second": 51.481, "eval_steps_per_second": 12.874, "step": 1900 }, { "epoch": 1.0279908491454717, "grad_norm": 95.95193481445312, "learning_rate": 0.00015673510177343283, "loss": 2.1278076171875, "step": 1910 }, { "epoch": 1.0333737047503702, "grad_norm": 38.54022979736328, "learning_rate": 0.00015624561957544686, "loss": 1.865066146850586, "step": 1920 }, { "epoch": 1.0387565603552684, "grad_norm": 42.10824203491211, "learning_rate": 0.0001557541581704343, "loss": 2.5854557037353514, "step": 1930 }, { "epoch": 1.044139415960167, "grad_norm": 29.79697608947754, "learning_rate": 0.00015526073485225506, "loss": 1.4342741012573241, "step": 1940 }, { "epoch": 1.0495222715650652, "grad_norm": 19.559640884399414, "learning_rate": 0.0001547653669838061, "loss": 1.4350951194763184, "step": 1950 }, { "epoch": 1.0549051271699637, "grad_norm": 36.87428665161133, "learning_rate": 0.0001542680719964105, "loss": 1.7127342224121094, "step": 1960 }, { "epoch": 1.0602879827748621, "grad_norm": 20.139524459838867, "learning_rate": 0.000153768867389204, "loss": 1.6490812301635742, "step": 1970 }, { "epoch": 1.0656708383797604, "grad_norm": 32.64472579956055, "learning_rate": 0.0001532677707285194, "loss": 1.6485609054565429, "step": 1980 }, { "epoch": 1.0710536939846589, "grad_norm": 42.68798828125, "learning_rate": 0.00015276479964726808, "loss": 2.758069610595703, "step": 1990 }, { "epoch": 1.0764365495895571, "grad_norm": 39.17344284057617, "learning_rate": 0.0001522599718443199, "loss": 2.326355743408203, "step": 2000 }, { "epoch": 1.0764365495895571, "eval_loss": 0.5851911306381226, "eval_runtime": 63.9143, "eval_samples_per_second": 51.679, "eval_steps_per_second": 12.924, "step": 2000 }, { "epoch": 1.0818194051944556, "grad_norm": 26.366891860961914, "learning_rate": 0.0001517533050838802, "loss": 1.368880844116211, "step": 2010 }, { "epoch": 1.0872022607993541, "grad_norm": 50.400123596191406, "learning_rate": 0.00015124481719486465, "loss": 1.787089729309082, "step": 2020 }, { "epoch": 1.0925851164042524, "grad_norm": 9.160683631896973, "learning_rate": 0.00015073452607027214, "loss": 1.864046859741211, "step": 2030 }, { "epoch": 1.0979679720091509, "grad_norm": 19.865297317504883, "learning_rate": 0.00015022244966655482, "loss": 1.632607650756836, "step": 2040 }, { "epoch": 1.1033508276140493, "grad_norm": 49.69865036010742, "learning_rate": 0.00014970860600298642, "loss": 1.7247093200683594, "step": 2050 }, { "epoch": 1.1087336832189476, "grad_norm": 43.50836181640625, "learning_rate": 0.0001491930131610282, "loss": 1.298050880432129, "step": 2060 }, { "epoch": 1.114116538823846, "grad_norm": 55.050758361816406, "learning_rate": 0.00014867568928369256, "loss": 1.6693323135375977, "step": 2070 }, { "epoch": 1.1194993944287444, "grad_norm": 66.28153228759766, "learning_rate": 0.00014815665257490482, "loss": 2.2023120880126954, "step": 2080 }, { "epoch": 1.1248822500336428, "grad_norm": 38.08374786376953, "learning_rate": 0.00014763592129886228, "loss": 1.427632713317871, "step": 2090 }, { "epoch": 1.1302651056385413, "grad_norm": 42.69854736328125, "learning_rate": 0.000147113513779392, "loss": 2.1791011810302736, "step": 2100 }, { "epoch": 1.1302651056385413, "eval_loss": 0.5500441789627075, "eval_runtime": 63.9044, "eval_samples_per_second": 51.687, "eval_steps_per_second": 12.926, "step": 2100 }, { "epoch": 1.1356479612434396, "grad_norm": 27.943300247192383, "learning_rate": 0.0001465894483993057, "loss": 1.6217365264892578, "step": 2110 }, { "epoch": 1.141030816848338, "grad_norm": 34.99180221557617, "learning_rate": 0.00014606374359975286, "loss": 2.2697931289672852, "step": 2120 }, { "epoch": 1.1464136724532366, "grad_norm": 27.82872772216797, "learning_rate": 0.000145536417879572, "loss": 2.0169490814208983, "step": 2130 }, { "epoch": 1.1517965280581348, "grad_norm": 18.295881271362305, "learning_rate": 0.00014500748979463966, "loss": 1.2729131698608398, "step": 2140 }, { "epoch": 1.1571793836630333, "grad_norm": 18.062448501586914, "learning_rate": 0.00014447697795721737, "loss": 2.3540084838867186, "step": 2150 }, { "epoch": 1.1625622392679316, "grad_norm": 41.10131072998047, "learning_rate": 0.00014394490103529676, "loss": 2.1076675415039063, "step": 2160 }, { "epoch": 1.16794509487283, "grad_norm": 39.552982330322266, "learning_rate": 0.0001434112777519427, "loss": 2.1465015411376953, "step": 2170 }, { "epoch": 1.1733279504777285, "grad_norm": 28.34930419921875, "learning_rate": 0.0001428761268846344, "loss": 1.4876040458679198, "step": 2180 }, { "epoch": 1.1787108060826268, "grad_norm": 26.313669204711914, "learning_rate": 0.00014233946726460462, "loss": 1.5450728416442872, "step": 2190 }, { "epoch": 1.1840936616875253, "grad_norm": 14.592830657958984, "learning_rate": 0.00014180131777617716, "loss": 2.097823715209961, "step": 2200 }, { "epoch": 1.1840936616875253, "eval_loss": 0.4937271177768707, "eval_runtime": 64.1972, "eval_samples_per_second": 51.451, "eval_steps_per_second": 12.867, "step": 2200 }, { "epoch": 1.1894765172924235, "grad_norm": 57.555904388427734, "learning_rate": 0.00014126169735610225, "loss": 1.3126806259155273, "step": 2210 }, { "epoch": 1.194859372897322, "grad_norm": 49.10297775268555, "learning_rate": 0.00014072062499289023, "loss": 1.8571784973144532, "step": 2220 }, { "epoch": 1.2002422285022205, "grad_norm": 63.582420349121094, "learning_rate": 0.00014017811972614325, "loss": 1.6554574966430664, "step": 2230 }, { "epoch": 1.2056250841071188, "grad_norm": 38.78810501098633, "learning_rate": 0.0001396342006458855, "loss": 1.6202888488769531, "step": 2240 }, { "epoch": 1.2110079397120173, "grad_norm": 27.394638061523438, "learning_rate": 0.00013908888689189133, "loss": 2.127480697631836, "step": 2250 }, { "epoch": 1.2163907953169155, "grad_norm": 48.140830993652344, "learning_rate": 0.00013854219765301165, "loss": 1.8078197479248046, "step": 2260 }, { "epoch": 1.221773650921814, "grad_norm": 44.98652267456055, "learning_rate": 0.00013799415216649897, "loss": 2.2878448486328127, "step": 2270 }, { "epoch": 1.2271565065267125, "grad_norm": 10.705018043518066, "learning_rate": 0.0001374447697173303, "loss": 2.145868682861328, "step": 2280 }, { "epoch": 1.2325393621316107, "grad_norm": 27.23916244506836, "learning_rate": 0.00013689406963752844, "loss": 1.3377301216125488, "step": 2290 }, { "epoch": 1.2379222177365092, "grad_norm": 34.806480407714844, "learning_rate": 0.00013634207130548194, "loss": 1.9754547119140624, "step": 2300 }, { "epoch": 1.2379222177365092, "eval_loss": 0.47936686873435974, "eval_runtime": 64.2268, "eval_samples_per_second": 51.427, "eval_steps_per_second": 12.861, "step": 2300 }, { "epoch": 1.2433050733414075, "grad_norm": 32.58279037475586, "learning_rate": 0.00013578879414526292, "loss": 1.7109735488891602, "step": 2310 }, { "epoch": 1.248687928946306, "grad_norm": 33.94943618774414, "learning_rate": 0.000135234257625944, "loss": 2.3083892822265626, "step": 2320 }, { "epoch": 1.2540707845512045, "grad_norm": 35.721805572509766, "learning_rate": 0.00013467848126091266, "loss": 1.966238021850586, "step": 2330 }, { "epoch": 1.259453640156103, "grad_norm": 22.220964431762695, "learning_rate": 0.00013412148460718507, "loss": 1.9786643981933594, "step": 2340 }, { "epoch": 1.2648364957610012, "grad_norm": 22.529788970947266, "learning_rate": 0.00013356328726471753, "loss": 2.2097476959228515, "step": 2350 }, { "epoch": 1.2702193513658995, "grad_norm": 14.958813667297363, "learning_rate": 0.00013300390887571715, "loss": 1.8351505279541016, "step": 2360 }, { "epoch": 1.275602206970798, "grad_norm": 17.01559829711914, "learning_rate": 0.00013244336912395026, "loss": 1.9661121368408203, "step": 2370 }, { "epoch": 1.2809850625756964, "grad_norm": 28.454547882080078, "learning_rate": 0.00013188168773405008, "loss": 1.6221160888671875, "step": 2380 }, { "epoch": 1.286367918180595, "grad_norm": 41.18201446533203, "learning_rate": 0.00013131888447082254, "loss": 1.636754035949707, "step": 2390 }, { "epoch": 1.2917507737854932, "grad_norm": 34.558536529541016, "learning_rate": 0.00013075497913855072, "loss": 1.8497133255004883, "step": 2400 }, { "epoch": 1.2917507737854932, "eval_loss": 0.5467978119850159, "eval_runtime": 64.2912, "eval_samples_per_second": 51.376, "eval_steps_per_second": 12.848, "step": 2400 }, { "epoch": 1.2971336293903917, "grad_norm": 43.164146423339844, "learning_rate": 0.00013018999158029802, "loss": 2.0868755340576173, "step": 2410 }, { "epoch": 1.30251648499529, "grad_norm": 13.502433776855469, "learning_rate": 0.00012962394167720997, "loss": 2.3471694946289063, "step": 2420 }, { "epoch": 1.3078993406001884, "grad_norm": 11.673425674438477, "learning_rate": 0.00012905684934781447, "loss": 0.8880938529968262, "step": 2430 }, { "epoch": 1.313282196205087, "grad_norm": 24.767826080322266, "learning_rate": 0.00012848873454732106, "loss": 1.9171413421630858, "step": 2440 }, { "epoch": 1.3186650518099852, "grad_norm": 31.41339111328125, "learning_rate": 0.0001279196172669186, "loss": 1.550046443939209, "step": 2450 }, { "epoch": 1.3240479074148837, "grad_norm": 42.19283676147461, "learning_rate": 0.00012734951753307194, "loss": 1.5069122314453125, "step": 2460 }, { "epoch": 1.329430763019782, "grad_norm": 34.4764289855957, "learning_rate": 0.00012677845540681702, "loss": 1.5139981269836427, "step": 2470 }, { "epoch": 1.3348136186246804, "grad_norm": 45.293399810791016, "learning_rate": 0.00012620645098305514, "loss": 2.5238950729370115, "step": 2480 }, { "epoch": 1.3401964742295789, "grad_norm": 21.721302032470703, "learning_rate": 0.0001256335243898458, "loss": 2.452337646484375, "step": 2490 }, { "epoch": 1.3455793298344771, "grad_norm": 32.277462005615234, "learning_rate": 0.00012505969578769827, "loss": 1.747513198852539, "step": 2500 }, { "epoch": 1.3455793298344771, "eval_loss": 0.5084195137023926, "eval_runtime": 64.3491, "eval_samples_per_second": 51.329, "eval_steps_per_second": 12.836, "step": 2500 }, { "epoch": 1.3509621854393756, "grad_norm": 28.49180793762207, "learning_rate": 0.00012448498536886242, "loss": 1.7691278457641602, "step": 2510 }, { "epoch": 1.356345041044274, "grad_norm": 19.427194595336914, "learning_rate": 0.00012390941335661793, "loss": 1.7051538467407226, "step": 2520 }, { "epoch": 1.3617278966491724, "grad_norm": 25.067476272583008, "learning_rate": 0.00012333300000456294, "loss": 1.2319503784179688, "step": 2530 }, { "epoch": 1.3671107522540709, "grad_norm": 43.21786880493164, "learning_rate": 0.00012275576559590107, "loss": 1.9394664764404297, "step": 2540 }, { "epoch": 1.3724936078589691, "grad_norm": 33.55292510986328, "learning_rate": 0.0001221777304427278, "loss": 1.6529422760009767, "step": 2550 }, { "epoch": 1.3778764634638676, "grad_norm": 17.388324737548828, "learning_rate": 0.00012159891488531583, "loss": 1.6362987518310548, "step": 2560 }, { "epoch": 1.3832593190687659, "grad_norm": 11.812196731567383, "learning_rate": 0.00012101933929139911, "loss": 1.3777896881103515, "step": 2570 }, { "epoch": 1.3886421746736644, "grad_norm": 10.543932914733887, "learning_rate": 0.00012043902405545635, "loss": 1.7387680053710937, "step": 2580 }, { "epoch": 1.3940250302785628, "grad_norm": 25.3862247467041, "learning_rate": 0.00011985798959799315, "loss": 1.6691925048828125, "step": 2590 }, { "epoch": 1.399407885883461, "grad_norm": 44.17007064819336, "learning_rate": 0.00011927625636482364, "loss": 1.8721656799316406, "step": 2600 }, { "epoch": 1.399407885883461, "eval_loss": 0.5541885495185852, "eval_runtime": 63.9819, "eval_samples_per_second": 51.624, "eval_steps_per_second": 12.91, "step": 2600 }, { "epoch": 1.4047907414883596, "grad_norm": 30.539979934692383, "learning_rate": 0.00011869384482635087, "loss": 1.5085716247558594, "step": 2610 }, { "epoch": 1.4101735970932578, "grad_norm": 39.790950775146484, "learning_rate": 0.00011811077547684652, "loss": 1.9276805877685548, "step": 2620 }, { "epoch": 1.4155564526981563, "grad_norm": 26.07389259338379, "learning_rate": 0.00011752706883372975, "loss": 1.6762975692749023, "step": 2630 }, { "epoch": 1.4209393083030548, "grad_norm": 19.482772827148438, "learning_rate": 0.00011694274543684525, "loss": 1.6249858856201171, "step": 2640 }, { "epoch": 1.4263221639079533, "grad_norm": 27.41213607788086, "learning_rate": 0.00011635782584774042, "loss": 1.7710115432739257, "step": 2650 }, { "epoch": 1.4317050195128516, "grad_norm": 44.63675308227539, "learning_rate": 0.00011577233064894184, "loss": 1.3814048767089844, "step": 2660 }, { "epoch": 1.43708787511775, "grad_norm": 35.491634368896484, "learning_rate": 0.00011518628044323105, "loss": 2.505926322937012, "step": 2670 }, { "epoch": 1.4424707307226483, "grad_norm": 19.543800354003906, "learning_rate": 0.00011459969585291952, "loss": 1.4784714698791503, "step": 2680 }, { "epoch": 1.4478535863275468, "grad_norm": 17.39204978942871, "learning_rate": 0.00011401259751912294, "loss": 1.8356576919555665, "step": 2690 }, { "epoch": 1.4532364419324453, "grad_norm": 30.696813583374023, "learning_rate": 0.000113425006101035, "loss": 1.7911975860595704, "step": 2700 }, { "epoch": 1.4532364419324453, "eval_loss": 0.4373091459274292, "eval_runtime": 63.9584, "eval_samples_per_second": 51.643, "eval_steps_per_second": 12.915, "step": 2700 }, { "epoch": 1.4586192975373435, "grad_norm": 62.493797302246094, "learning_rate": 0.00011283694227520032, "loss": 1.1635123252868653, "step": 2710 }, { "epoch": 1.464002153142242, "grad_norm": 37.97821807861328, "learning_rate": 0.00011224842673478692, "loss": 1.40887451171875, "step": 2720 }, { "epoch": 1.4693850087471403, "grad_norm": 29.938425064086914, "learning_rate": 0.00011165948018885803, "loss": 1.6324567794799805, "step": 2730 }, { "epoch": 1.4747678643520388, "grad_norm": 20.280174255371094, "learning_rate": 0.00011107012336164342, "loss": 1.2600415229797364, "step": 2740 }, { "epoch": 1.4801507199569373, "grad_norm": 37.221309661865234, "learning_rate": 0.00011048037699181007, "loss": 1.7051061630249023, "step": 2750 }, { "epoch": 1.4855335755618355, "grad_norm": 10.49577808380127, "learning_rate": 0.00010989026183173241, "loss": 1.4941570281982421, "step": 2760 }, { "epoch": 1.490916431166734, "grad_norm": 22.56839370727539, "learning_rate": 0.00010929979864676214, "loss": 1.240116786956787, "step": 2770 }, { "epoch": 1.4962992867716323, "grad_norm": 19.91226577758789, "learning_rate": 0.00010870900821449747, "loss": 1.3393290519714356, "step": 2780 }, { "epoch": 1.5016821423765307, "grad_norm": 32.016357421875, "learning_rate": 0.00010811791132405202, "loss": 1.7406791687011718, "step": 2790 }, { "epoch": 1.5070649979814292, "grad_norm": 50.24219512939453, "learning_rate": 0.00010752652877532318, "loss": 1.9366174697875977, "step": 2800 }, { "epoch": 1.5070649979814292, "eval_loss": 0.43302831053733826, "eval_runtime": 63.946, "eval_samples_per_second": 51.653, "eval_steps_per_second": 12.917, "step": 2800 }, { "epoch": 1.5124478535863275, "grad_norm": 35.96293258666992, "learning_rate": 0.00010693488137826042, "loss": 1.8892341613769532, "step": 2810 }, { "epoch": 1.517830709191226, "grad_norm": 20.087125778198242, "learning_rate": 0.00010634298995213267, "loss": 1.5483041763305665, "step": 2820 }, { "epoch": 1.5232135647961242, "grad_norm": 44.48786926269531, "learning_rate": 0.00010575087532479608, "loss": 2.049909210205078, "step": 2830 }, { "epoch": 1.5285964204010227, "grad_norm": 13.480371475219727, "learning_rate": 0.0001051585583319608, "loss": 1.4279634475708007, "step": 2840 }, { "epoch": 1.5339792760059212, "grad_norm": 12.939706802368164, "learning_rate": 0.0001045660598164581, "loss": 1.3665541648864745, "step": 2850 }, { "epoch": 1.5393621316108197, "grad_norm": 12.383955001831055, "learning_rate": 0.00010397340062750666, "loss": 1.9608146667480468, "step": 2860 }, { "epoch": 1.544744987215718, "grad_norm": 31.020015716552734, "learning_rate": 0.00010338060161997911, "loss": 1.3746890068054198, "step": 2870 }, { "epoch": 1.5501278428206162, "grad_norm": 38.224365234375, "learning_rate": 0.00010278768365366809, "loss": 1.9677223205566405, "step": 2880 }, { "epoch": 1.5555106984255147, "grad_norm": 16.846071243286133, "learning_rate": 0.00010219466759255225, "loss": 2.040707588195801, "step": 2890 }, { "epoch": 1.5608935540304132, "grad_norm": 14.602941513061523, "learning_rate": 0.00010160157430406201, "loss": 1.4509224891662598, "step": 2900 }, { "epoch": 1.5608935540304132, "eval_loss": 0.4190095067024231, "eval_runtime": 63.6149, "eval_samples_per_second": 51.922, "eval_steps_per_second": 12.984, "step": 2900 }, { "epoch": 1.5662764096353117, "grad_norm": 6.937775611877441, "learning_rate": 0.00010100842465834537, "loss": 1.9573307037353516, "step": 2910 }, { "epoch": 1.57165926524021, "grad_norm": 30.520694732666016, "learning_rate": 0.00010041523952753346, "loss": 1.8950252532958984, "step": 2920 }, { "epoch": 1.5770421208451082, "grad_norm": 38.1561279296875, "learning_rate": 9.982203978500608e-05, "loss": 1.7020187377929688, "step": 2930 }, { "epoch": 1.5824249764500067, "grad_norm": 27.7998104095459, "learning_rate": 9.922884630465717e-05, "loss": 1.7406475067138671, "step": 2940 }, { "epoch": 1.5878078320549052, "grad_norm": 20.777448654174805, "learning_rate": 9.86356799601603e-05, "loss": 1.344972515106201, "step": 2950 }, { "epoch": 1.5931906876598037, "grad_norm": 18.08922004699707, "learning_rate": 9.804256162423427e-05, "loss": 1.6805049896240234, "step": 2960 }, { "epoch": 1.598573543264702, "grad_norm": 15.266389846801758, "learning_rate": 9.744951216790837e-05, "loss": 1.569887638092041, "step": 2970 }, { "epoch": 1.6039563988696002, "grad_norm": 24.077733993530273, "learning_rate": 9.685655245978823e-05, "loss": 1.4327526092529297, "step": 2980 }, { "epoch": 1.6093392544744987, "grad_norm": 29.76258087158203, "learning_rate": 9.626370336532132e-05, "loss": 1.696345901489258, "step": 2990 }, { "epoch": 1.6147221100793971, "grad_norm": 22.80702781677246, "learning_rate": 9.567098574606279e-05, "loss": 0.9164070129394531, "step": 3000 }, { "epoch": 1.6147221100793971, "eval_loss": 0.45202314853668213, "eval_runtime": 63.7845, "eval_samples_per_second": 51.784, "eval_steps_per_second": 12.95, "step": 3000 }, { "epoch": 1.6201049656842956, "grad_norm": 28.408498764038086, "learning_rate": 9.507842045894128e-05, "loss": 1.2415037155151367, "step": 3010 }, { "epoch": 1.625487821289194, "grad_norm": 17.381816864013672, "learning_rate": 9.448602835552512e-05, "loss": 1.1174392700195312, "step": 3020 }, { "epoch": 1.6308706768940922, "grad_norm": 41.50532913208008, "learning_rate": 9.389383028128866e-05, "loss": 2.0566314697265624, "step": 3030 }, { "epoch": 1.6362535324989906, "grad_norm": 43.86766052246094, "learning_rate": 9.330184707487837e-05, "loss": 1.5256672859191895, "step": 3040 }, { "epoch": 1.6416363881038891, "grad_norm": 22.702362060546875, "learning_rate": 9.271009956738004e-05, "loss": 1.5772756576538085, "step": 3050 }, { "epoch": 1.6470192437087876, "grad_norm": 20.469390869140625, "learning_rate": 9.211860858158538e-05, "loss": 1.4132847785949707, "step": 3060 }, { "epoch": 1.6524020993136859, "grad_norm": 23.878665924072266, "learning_rate": 9.152739493125962e-05, "loss": 1.7029796600341798, "step": 3070 }, { "epoch": 1.6577849549185844, "grad_norm": 20.67031478881836, "learning_rate": 9.09364794204087e-05, "loss": 1.7173995971679688, "step": 3080 }, { "epoch": 1.6631678105234826, "grad_norm": 26.168128967285156, "learning_rate": 9.034588284254765e-05, "loss": 1.3580098152160645, "step": 3090 }, { "epoch": 1.668550666128381, "grad_norm": 36.75242233276367, "learning_rate": 8.975562597996855e-05, "loss": 1.6930839538574218, "step": 3100 }, { "epoch": 1.668550666128381, "eval_loss": 0.4625987410545349, "eval_runtime": 63.5645, "eval_samples_per_second": 51.963, "eval_steps_per_second": 12.995, "step": 3100 }, { "epoch": 1.6739335217332796, "grad_norm": 26.191268920898438, "learning_rate": 8.916572960300947e-05, "loss": 2.067066955566406, "step": 3110 }, { "epoch": 1.679316377338178, "grad_norm": 30.239843368530273, "learning_rate": 8.857621446932334e-05, "loss": 1.3582192420959474, "step": 3120 }, { "epoch": 1.6846992329430763, "grad_norm": 11.36849308013916, "learning_rate": 8.798710132314778e-05, "loss": 1.4313419342041016, "step": 3130 }, { "epoch": 1.6900820885479746, "grad_norm": 24.18775177001953, "learning_rate": 8.739841089457494e-05, "loss": 1.6131771087646485, "step": 3140 }, { "epoch": 1.695464944152873, "grad_norm": 17.61792755126953, "learning_rate": 8.681016389882217e-05, "loss": 1.5064881324768067, "step": 3150 }, { "epoch": 1.7008477997577716, "grad_norm": 36.965396881103516, "learning_rate": 8.622238103550293e-05, "loss": 2.0960357666015623, "step": 3160 }, { "epoch": 1.70623065536267, "grad_norm": 15.143284797668457, "learning_rate": 8.563508298789865e-05, "loss": 1.0306715011596679, "step": 3170 }, { "epoch": 1.7116135109675683, "grad_norm": 21.073841094970703, "learning_rate": 8.504829042223055e-05, "loss": 1.4934981346130372, "step": 3180 }, { "epoch": 1.7169963665724666, "grad_norm": 14.031085968017578, "learning_rate": 8.44620239869328e-05, "loss": 1.470815372467041, "step": 3190 }, { "epoch": 1.722379222177365, "grad_norm": 12.69394302368164, "learning_rate": 8.387630431192562e-05, "loss": 1.4816364288330077, "step": 3200 }, { "epoch": 1.722379222177365, "eval_loss": 0.4099518358707428, "eval_runtime": 63.7017, "eval_samples_per_second": 51.851, "eval_steps_per_second": 12.967, "step": 3200 }, { "epoch": 1.7277620777822635, "grad_norm": 36.04399871826172, "learning_rate": 8.329115200788962e-05, "loss": 1.2866575241088867, "step": 3210 }, { "epoch": 1.733144933387162, "grad_norm": 15.661164283752441, "learning_rate": 8.270658766554023e-05, "loss": 1.2794793128967286, "step": 3220 }, { "epoch": 1.7385277889920603, "grad_norm": 14.594550132751465, "learning_rate": 8.212263185490347e-05, "loss": 0.900571060180664, "step": 3230 }, { "epoch": 1.7439106445969585, "grad_norm": 23.809280395507812, "learning_rate": 8.153930512459182e-05, "loss": 1.2999605178833007, "step": 3240 }, { "epoch": 1.749293500201857, "grad_norm": 24.3289737701416, "learning_rate": 8.095662800108141e-05, "loss": 0.756270456314087, "step": 3250 }, { "epoch": 1.7546763558067555, "grad_norm": 55.45784378051758, "learning_rate": 8.037462098798942e-05, "loss": 1.5912586212158204, "step": 3260 }, { "epoch": 1.760059211411654, "grad_norm": 20.93805694580078, "learning_rate": 7.97933045653529e-05, "loss": 1.602321243286133, "step": 3270 }, { "epoch": 1.7654420670165523, "grad_norm": 37.905189514160156, "learning_rate": 7.92126991889079e-05, "loss": 1.5339111328125, "step": 3280 }, { "epoch": 1.7708249226214505, "grad_norm": 24.21660804748535, "learning_rate": 7.863282528936978e-05, "loss": 1.646210289001465, "step": 3290 }, { "epoch": 1.776207778226349, "grad_norm": 18.371828079223633, "learning_rate": 7.805370327171402e-05, "loss": 1.3416717529296875, "step": 3300 }, { "epoch": 1.776207778226349, "eval_loss": 0.4250826835632324, "eval_runtime": 63.8411, "eval_samples_per_second": 51.738, "eval_steps_per_second": 12.938, "step": 3300 }, { "epoch": 1.7815906338312475, "grad_norm": 37.405426025390625, "learning_rate": 7.747535351445871e-05, "loss": 1.5578692436218262, "step": 3310 }, { "epoch": 1.786973489436146, "grad_norm": 62.97222900390625, "learning_rate": 7.689779636894687e-05, "loss": 2.0751113891601562, "step": 3320 }, { "epoch": 1.7923563450410442, "grad_norm": 24.98927879333496, "learning_rate": 7.632105215863072e-05, "loss": 1.8148933410644532, "step": 3330 }, { "epoch": 1.7977392006459427, "grad_norm": 17.803342819213867, "learning_rate": 7.57451411783564e-05, "loss": 1.1781111717224122, "step": 3340 }, { "epoch": 1.803122056250841, "grad_norm": 31.60127067565918, "learning_rate": 7.517008369364973e-05, "loss": 1.2258566856384276, "step": 3350 }, { "epoch": 1.8085049118557395, "grad_norm": 21.834125518798828, "learning_rate": 7.459589994000331e-05, "loss": 1.8756603240966796, "step": 3360 }, { "epoch": 1.813887767460638, "grad_norm": 8.82114315032959, "learning_rate": 7.402261012216418e-05, "loss": 1.5807505607604981, "step": 3370 }, { "epoch": 1.8192706230655362, "grad_norm": 6.503419399261475, "learning_rate": 7.345023441342312e-05, "loss": 1.110390567779541, "step": 3380 }, { "epoch": 1.8246534786704347, "grad_norm": 17.47008514404297, "learning_rate": 7.287879295490454e-05, "loss": 1.7794336318969726, "step": 3390 }, { "epoch": 1.830036334275333, "grad_norm": 20.7091121673584, "learning_rate": 7.230830585485799e-05, "loss": 1.1825596809387207, "step": 3400 }, { "epoch": 1.830036334275333, "eval_loss": 0.3694857954978943, "eval_runtime": 63.578, "eval_samples_per_second": 51.952, "eval_steps_per_second": 12.992, "step": 3400 }, { "epoch": 1.8354191898802314, "grad_norm": 26.3618221282959, "learning_rate": 7.173879318795027e-05, "loss": 1.3671013832092285, "step": 3410 }, { "epoch": 1.84080204548513, "grad_norm": 14.309059143066406, "learning_rate": 7.117027499455938e-05, "loss": 1.7152782440185548, "step": 3420 }, { "epoch": 1.8461849010900284, "grad_norm": 14.735411643981934, "learning_rate": 7.060277128006896e-05, "loss": 1.2705150604248048, "step": 3430 }, { "epoch": 1.8515677566949267, "grad_norm": 37.376731872558594, "learning_rate": 7.003630201416469e-05, "loss": 0.823548698425293, "step": 3440 }, { "epoch": 1.856950612299825, "grad_norm": 30.746421813964844, "learning_rate": 6.947088713013127e-05, "loss": 1.9406600952148438, "step": 3450 }, { "epoch": 1.8623334679047234, "grad_norm": 28.229276657104492, "learning_rate": 6.89065465241513e-05, "loss": 1.542259120941162, "step": 3460 }, { "epoch": 1.867716323509622, "grad_norm": 6.486597537994385, "learning_rate": 6.834330005460472e-05, "loss": 1.522111701965332, "step": 3470 }, { "epoch": 1.8730991791145204, "grad_norm": 21.441097259521484, "learning_rate": 6.778116754137058e-05, "loss": 1.2606025695800782, "step": 3480 }, { "epoch": 1.8784820347194187, "grad_norm": 7.534696102142334, "learning_rate": 6.722016876512916e-05, "loss": 1.5245902061462402, "step": 3490 }, { "epoch": 1.883864890324317, "grad_norm": 32.19171142578125, "learning_rate": 6.666032346666613e-05, "loss": 1.5431558609008789, "step": 3500 }, { "epoch": 1.883864890324317, "eval_loss": 0.37625691294670105, "eval_runtime": 63.829, "eval_samples_per_second": 51.748, "eval_steps_per_second": 12.941, "step": 3500 }, { "epoch": 1.8892477459292154, "grad_norm": 23.33196258544922, "learning_rate": 6.610165134617778e-05, "loss": 1.21827974319458, "step": 3510 }, { "epoch": 1.894630601534114, "grad_norm": 40.78279113769531, "learning_rate": 6.554417206257795e-05, "loss": 1.7008653640747071, "step": 3520 }, { "epoch": 1.9000134571390124, "grad_norm": 23.865211486816406, "learning_rate": 6.498790523280607e-05, "loss": 1.0905473709106446, "step": 3530 }, { "epoch": 1.9053963127439106, "grad_norm": 26.986589431762695, "learning_rate": 6.44328704311371e-05, "loss": 1.2692423820495606, "step": 3540 }, { "epoch": 1.910779168348809, "grad_norm": 15.614501953125, "learning_rate": 6.387908718849239e-05, "loss": 1.1699938774108887, "step": 3550 }, { "epoch": 1.9161620239537074, "grad_norm": 16.81165313720703, "learning_rate": 6.332657499175291e-05, "loss": 1.7018922805786132, "step": 3560 }, { "epoch": 1.9215448795586059, "grad_norm": 23.331390380859375, "learning_rate": 6.277535328307296e-05, "loss": 1.1255874633789062, "step": 3570 }, { "epoch": 1.9269277351635044, "grad_norm": 24.57452964782715, "learning_rate": 6.222544145919653e-05, "loss": 2.053675079345703, "step": 3580 }, { "epoch": 1.9323105907684026, "grad_norm": 13.287324905395508, "learning_rate": 6.167685887077444e-05, "loss": 1.2274766921997071, "step": 3590 }, { "epoch": 1.9376934463733009, "grad_norm": 18.1403865814209, "learning_rate": 6.112962482168356e-05, "loss": 1.2781085968017578, "step": 3600 }, { "epoch": 1.9376934463733009, "eval_loss": 0.36828258633613586, "eval_runtime": 63.8932, "eval_samples_per_second": 51.696, "eval_steps_per_second": 12.928, "step": 3600 }, { "epoch": 1.9430763019781994, "grad_norm": 19.552724838256836, "learning_rate": 6.058375856834742e-05, "loss": 1.5518939971923829, "step": 3610 }, { "epoch": 1.9484591575830978, "grad_norm": 25.114530563354492, "learning_rate": 6.003927931905875e-05, "loss": 1.3678104400634765, "step": 3620 }, { "epoch": 1.9538420131879963, "grad_norm": 24.832029342651367, "learning_rate": 5.949620623330351e-05, "loss": 1.3850306510925292, "step": 3630 }, { "epoch": 1.9592248687928946, "grad_norm": 28.975635528564453, "learning_rate": 5.895455842108656e-05, "loss": 2.144721031188965, "step": 3640 }, { "epoch": 1.964607724397793, "grad_norm": 20.551748275756836, "learning_rate": 5.841435494225946e-05, "loss": 1.024734878540039, "step": 3650 }, { "epoch": 1.9699905800026913, "grad_norm": 28.49460792541504, "learning_rate": 5.7875614805849464e-05, "loss": 1.2350109100341797, "step": 3660 }, { "epoch": 1.9753734356075898, "grad_norm": 46.727195739746094, "learning_rate": 5.7338356969390996e-05, "loss": 1.4352140426635742, "step": 3670 }, { "epoch": 1.9807562912124883, "grad_norm": 22.224246978759766, "learning_rate": 5.680260033825819e-05, "loss": 1.4729737281799316, "step": 3680 }, { "epoch": 1.9861391468173866, "grad_norm": 21.090652465820312, "learning_rate": 5.626836376499991e-05, "loss": 1.332131576538086, "step": 3690 }, { "epoch": 1.991522002422285, "grad_norm": 19.748018264770508, "learning_rate": 5.573566604867616e-05, "loss": 1.1651579856872558, "step": 3700 }, { "epoch": 1.991522002422285, "eval_loss": 0.3755303621292114, "eval_runtime": 63.642, "eval_samples_per_second": 51.9, "eval_steps_per_second": 12.979, "step": 3700 }, { "epoch": 1.9969048580271833, "grad_norm": 26.874662399291992, "learning_rate": 5.5204525934196715e-05, "loss": 1.8782270431518555, "step": 3710 }, { "epoch": 2.0021531422419594, "grad_norm": 11.230367660522461, "learning_rate": 5.4674962111661396e-05, "loss": 1.1111202239990234, "step": 3720 }, { "epoch": 2.007535997846858, "grad_norm": 11.470046043395996, "learning_rate": 5.4146993215702614e-05, "loss": 1.2164538383483887, "step": 3730 }, { "epoch": 2.0129188534517564, "grad_norm": 14.980729103088379, "learning_rate": 5.362063782482918e-05, "loss": 0.72305908203125, "step": 3740 }, { "epoch": 2.0183017090566544, "grad_norm": 22.74243927001953, "learning_rate": 5.309591446077316e-05, "loss": 0.9697726249694825, "step": 3750 }, { "epoch": 2.023684564661553, "grad_norm": 39.94514083862305, "learning_rate": 5.257284158783764e-05, "loss": 1.0772478103637695, "step": 3760 }, { "epoch": 2.0290674202664514, "grad_norm": 14.271464347839355, "learning_rate": 5.20514376122472e-05, "loss": 0.7649795055389405, "step": 3770 }, { "epoch": 2.03445027587135, "grad_norm": 46.278282165527344, "learning_rate": 5.1531720881500156e-05, "loss": 1.7668495178222656, "step": 3780 }, { "epoch": 2.0398331314762483, "grad_norm": 26.685871124267578, "learning_rate": 5.1013709683723044e-05, "loss": 0.9311368942260743, "step": 3790 }, { "epoch": 2.0452159870811464, "grad_norm": 19.982656478881836, "learning_rate": 5.0497422247026895e-05, "loss": 1.1055089950561523, "step": 3800 }, { "epoch": 2.0452159870811464, "eval_loss": 0.4047035276889801, "eval_runtime": 63.58, "eval_samples_per_second": 51.95, "eval_steps_per_second": 12.992, "step": 3800 }, { "epoch": 2.050598842686045, "grad_norm": 12.345768928527832, "learning_rate": 4.9982876738866094e-05, "loss": 0.7015519618988038, "step": 3810 }, { "epoch": 2.0559816982909433, "grad_norm": 33.307762145996094, "learning_rate": 4.9470091265398754e-05, "loss": 0.6976238250732422, "step": 3820 }, { "epoch": 2.061364553895842, "grad_norm": 38.2665901184082, "learning_rate": 4.8959083870849864e-05, "loss": 1.1541186332702638, "step": 3830 }, { "epoch": 2.0667474095007403, "grad_norm": 22.593074798583984, "learning_rate": 4.844987253687618e-05, "loss": 0.4699763298034668, "step": 3840 }, { "epoch": 2.0721302651056384, "grad_norm": 21.039308547973633, "learning_rate": 4.794247518193353e-05, "loss": 0.8926765441894531, "step": 3850 }, { "epoch": 2.077513120710537, "grad_norm": 24.009326934814453, "learning_rate": 4.743690966064626e-05, "loss": 0.7189272403717041, "step": 3860 }, { "epoch": 2.0828959763154353, "grad_norm": 8.515445709228516, "learning_rate": 4.6933193763179105e-05, "loss": 0.5480011940002442, "step": 3870 }, { "epoch": 2.088278831920334, "grad_norm": 19.915380477905273, "learning_rate": 4.64313452146108e-05, "loss": 0.7470302581787109, "step": 3880 }, { "epoch": 2.0936616875252323, "grad_norm": 5.266428470611572, "learning_rate": 4.593138167431087e-05, "loss": 0.592840576171875, "step": 3890 }, { "epoch": 2.0990445431301303, "grad_norm": 38.52595520019531, "learning_rate": 4.54333207353178e-05, "loss": 0.9797579765319824, "step": 3900 }, { "epoch": 2.0990445431301303, "eval_loss": 0.4082370102405548, "eval_runtime": 63.7106, "eval_samples_per_second": 51.844, "eval_steps_per_second": 12.965, "step": 3900 }, { "epoch": 2.104427398735029, "grad_norm": 38.00594711303711, "learning_rate": 4.493717992372014e-05, "loss": 0.6796042919158936, "step": 3910 }, { "epoch": 2.1098102543399273, "grad_norm": 22.110828399658203, "learning_rate": 4.444297669803981e-05, "loss": 1.6094877243041992, "step": 3920 }, { "epoch": 2.115193109944826, "grad_norm": 14.167129516601562, "learning_rate": 4.395072844861762e-05, "loss": 0.752195167541504, "step": 3930 }, { "epoch": 2.1205759655497243, "grad_norm": 13.590848922729492, "learning_rate": 4.3460452497001546e-05, "loss": 0.9873428344726562, "step": 3940 }, { "epoch": 2.1259588211546223, "grad_norm": 21.298370361328125, "learning_rate": 4.2972166095336996e-05, "loss": 0.7805982112884522, "step": 3950 }, { "epoch": 2.131341676759521, "grad_norm": 26.588743209838867, "learning_rate": 4.2485886425759824e-05, "loss": 0.8509333610534668, "step": 3960 }, { "epoch": 2.1367245323644193, "grad_norm": 14.079202651977539, "learning_rate": 4.200163059979168e-05, "loss": 0.46779747009277345, "step": 3970 }, { "epoch": 2.1421073879693178, "grad_norm": 16.043773651123047, "learning_rate": 4.1519415657738026e-05, "loss": 0.4787121295928955, "step": 3980 }, { "epoch": 2.1474902435742163, "grad_norm": 21.35724449157715, "learning_rate": 4.103925856808817e-05, "loss": 0.9199463844299316, "step": 3990 }, { "epoch": 2.1528730991791143, "grad_norm": 27.052135467529297, "learning_rate": 4.056117622691863e-05, "loss": 1.4920102119445802, "step": 4000 }, { "epoch": 2.1528730991791143, "eval_loss": 0.4048362374305725, "eval_runtime": 63.48, "eval_samples_per_second": 52.032, "eval_steps_per_second": 13.012, "step": 4000 }, { "epoch": 2.1582559547840128, "grad_norm": 1.1041878461837769, "learning_rate": 4.008518545729818e-05, "loss": 0.5191349029541016, "step": 4010 }, { "epoch": 2.1636388103889113, "grad_norm": 19.768545150756836, "learning_rate": 3.9611303008696073e-05, "loss": 0.9854854583740235, "step": 4020 }, { "epoch": 2.1690216659938097, "grad_norm": 55.555599212646484, "learning_rate": 3.913954555639263e-05, "loss": 0.7864606857299805, "step": 4030 }, { "epoch": 2.1744045215987082, "grad_norm": 38.11814880371094, "learning_rate": 3.866992970089238e-05, "loss": 1.094459342956543, "step": 4040 }, { "epoch": 2.1797873772036067, "grad_norm": 25.64844512939453, "learning_rate": 3.8202471967340004e-05, "loss": 0.7594769477844239, "step": 4050 }, { "epoch": 2.1851702328085048, "grad_norm": 39.07038879394531, "learning_rate": 3.773718880493883e-05, "loss": 0.767018985748291, "step": 4060 }, { "epoch": 2.1905530884134032, "grad_norm": 11.75182819366455, "learning_rate": 3.727409658637194e-05, "loss": 1.0294831275939942, "step": 4070 }, { "epoch": 2.1959359440183017, "grad_norm": 20.518577575683594, "learning_rate": 3.681321160722606e-05, "loss": 0.6886996746063232, "step": 4080 }, { "epoch": 2.2013187996232, "grad_norm": 38.67143630981445, "learning_rate": 3.6354550085418207e-05, "loss": 1.033548069000244, "step": 4090 }, { "epoch": 2.2067016552280987, "grad_norm": 37.95046615600586, "learning_rate": 3.589812816062489e-05, "loss": 1.114480209350586, "step": 4100 }, { "epoch": 2.2067016552280987, "eval_loss": 0.40899786353111267, "eval_runtime": 63.5021, "eval_samples_per_second": 52.014, "eval_steps_per_second": 13.007, "step": 4100 }, { "epoch": 2.2120845108329967, "grad_norm": 11.148638725280762, "learning_rate": 3.544396189371425e-05, "loss": 0.6971592426300048, "step": 4110 }, { "epoch": 2.217467366437895, "grad_norm": 22.88878631591797, "learning_rate": 3.4992067266181015e-05, "loss": 0.669145917892456, "step": 4120 }, { "epoch": 2.2228502220427937, "grad_norm": 6.007533550262451, "learning_rate": 3.454246017958376e-05, "loss": 0.627226448059082, "step": 4130 }, { "epoch": 2.228233077647692, "grad_norm": 6.372663497924805, "learning_rate": 3.409515645498583e-05, "loss": 0.4246776580810547, "step": 4140 }, { "epoch": 2.2336159332525907, "grad_norm": 37.81616973876953, "learning_rate": 3.3650171832398284e-05, "loss": 0.8943648338317871, "step": 4150 }, { "epoch": 2.2389987888574887, "grad_norm": 35.7336540222168, "learning_rate": 3.3207521970226104e-05, "loss": 1.005715560913086, "step": 4160 }, { "epoch": 2.244381644462387, "grad_norm": 25.88532066345215, "learning_rate": 3.2767222444717295e-05, "loss": 0.6161307334899903, "step": 4170 }, { "epoch": 2.2497645000672857, "grad_norm": 1.1592823266983032, "learning_rate": 3.232928874941463e-05, "loss": 0.35333144664764404, "step": 4180 }, { "epoch": 2.255147355672184, "grad_norm": 18.25936508178711, "learning_rate": 3.189373629461056e-05, "loss": 0.603509521484375, "step": 4190 }, { "epoch": 2.2605302112770826, "grad_norm": 18.44670295715332, "learning_rate": 3.1460580406804975e-05, "loss": 0.9603145599365235, "step": 4200 }, { "epoch": 2.2605302112770826, "eval_loss": 0.461373895406723, "eval_runtime": 63.6154, "eval_samples_per_second": 51.921, "eval_steps_per_second": 12.984, "step": 4200 }, { "epoch": 2.265913066881981, "grad_norm": 7.78346586227417, "learning_rate": 3.102983632816573e-05, "loss": 0.832798957824707, "step": 4210 }, { "epoch": 2.271295922486879, "grad_norm": 23.0885066986084, "learning_rate": 3.060151921599241e-05, "loss": 0.9533357620239258, "step": 4220 }, { "epoch": 2.2766787780917777, "grad_norm": 18.10384750366211, "learning_rate": 3.017564414218299e-05, "loss": 0.64031081199646, "step": 4230 }, { "epoch": 2.282061633696676, "grad_norm": 38.35786437988281, "learning_rate": 2.975222609270335e-05, "loss": 0.6714494705200196, "step": 4240 }, { "epoch": 2.2874444893015746, "grad_norm": 30.549135208129883, "learning_rate": 2.9331279967060132e-05, "loss": 0.6489608764648438, "step": 4250 }, { "epoch": 2.292827344906473, "grad_norm": 22.884374618530273, "learning_rate": 2.8912820577776234e-05, "loss": 0.6908737182617187, "step": 4260 }, { "epoch": 2.298210200511371, "grad_norm": 3.388777732849121, "learning_rate": 2.8496862649869706e-05, "loss": 0.52658109664917, "step": 4270 }, { "epoch": 2.3035930561162696, "grad_norm": 49.91218948364258, "learning_rate": 2.808342082033556e-05, "loss": 1.008077049255371, "step": 4280 }, { "epoch": 2.308975911721168, "grad_norm": 10.552830696105957, "learning_rate": 2.767250963763075e-05, "loss": 0.8219211578369141, "step": 4290 }, { "epoch": 2.3143587673260666, "grad_norm": 52.01408386230469, "learning_rate": 2.7264143561162136e-05, "loss": 1.2357698440551759, "step": 4300 }, { "epoch": 2.3143587673260666, "eval_loss": 0.4524453580379486, "eval_runtime": 63.5057, "eval_samples_per_second": 52.011, "eval_steps_per_second": 13.007, "step": 4300 }, { "epoch": 2.319741622930965, "grad_norm": 8.435943603515625, "learning_rate": 2.6858336960777863e-05, "loss": 0.7867340087890625, "step": 4310 }, { "epoch": 2.325124478535863, "grad_norm": 25.12037467956543, "learning_rate": 2.6455104116261477e-05, "loss": 0.6435882091522217, "step": 4320 }, { "epoch": 2.3305073341407616, "grad_norm": 19.58714485168457, "learning_rate": 2.6054459216829573e-05, "loss": 0.7821506977081298, "step": 4330 }, { "epoch": 2.33589018974566, "grad_norm": 17.670440673828125, "learning_rate": 2.5656416360632494e-05, "loss": 0.7270960807800293, "step": 4340 }, { "epoch": 2.3412730453505586, "grad_norm": 19.895416259765625, "learning_rate": 2.5260989554258185e-05, "loss": 1.1800201416015625, "step": 4350 }, { "epoch": 2.346655900955457, "grad_norm": 27.924663543701172, "learning_rate": 2.4868192712239348e-05, "loss": 0.891145896911621, "step": 4360 }, { "epoch": 2.352038756560355, "grad_norm": 24.85103988647461, "learning_rate": 2.44780396565639e-05, "loss": 0.9543925285339355, "step": 4370 }, { "epoch": 2.3574216121652536, "grad_norm": 23.492963790893555, "learning_rate": 2.409054411618831e-05, "loss": 1.0963412284851075, "step": 4380 }, { "epoch": 2.362804467770152, "grad_norm": 23.491336822509766, "learning_rate": 2.370571972655489e-05, "loss": 0.7562737464904785, "step": 4390 }, { "epoch": 2.3681873233750506, "grad_norm": 9.930757522583008, "learning_rate": 2.332358002911167e-05, "loss": 0.5512786388397217, "step": 4400 }, { "epoch": 2.3681873233750506, "eval_loss": 0.43738052248954773, "eval_runtime": 63.71, "eval_samples_per_second": 51.844, "eval_steps_per_second": 12.965, "step": 4400 }, { "epoch": 2.373570178979949, "grad_norm": 24.945201873779297, "learning_rate": 2.294413847083604e-05, "loss": 0.719010305404663, "step": 4410 }, { "epoch": 2.378953034584847, "grad_norm": 18.582550048828125, "learning_rate": 2.2567408403761526e-05, "loss": 0.9431358337402344, "step": 4420 }, { "epoch": 2.3843358901897456, "grad_norm": 3.468303680419922, "learning_rate": 2.2193403084507947e-05, "loss": 0.6178753852844239, "step": 4430 }, { "epoch": 2.389718745794644, "grad_norm": 22.029281616210938, "learning_rate": 2.1822135673814948e-05, "loss": 1.0714486122131348, "step": 4440 }, { "epoch": 2.3951016013995425, "grad_norm": 19.43686294555664, "learning_rate": 2.1453619236078937e-05, "loss": 0.831718635559082, "step": 4450 }, { "epoch": 2.400484457004441, "grad_norm": 20.41507911682129, "learning_rate": 2.1087866738893246e-05, "loss": 0.7316448211669921, "step": 4460 }, { "epoch": 2.405867312609339, "grad_norm": 24.05844497680664, "learning_rate": 2.072489105259192e-05, "loss": 0.5118863582611084, "step": 4470 }, { "epoch": 2.4112501682142375, "grad_norm": 4.802274703979492, "learning_rate": 2.036470494979681e-05, "loss": 0.4543926239013672, "step": 4480 }, { "epoch": 2.416633023819136, "grad_norm": 6.404051780700684, "learning_rate": 2.000732110496808e-05, "loss": 0.6312252521514893, "step": 4490 }, { "epoch": 2.4220158794240345, "grad_norm": 23.455795288085938, "learning_rate": 1.9652752093958225e-05, "loss": 0.5971816062927247, "step": 4500 }, { "epoch": 2.4220158794240345, "eval_loss": 0.4342218041419983, "eval_runtime": 63.961, "eval_samples_per_second": 51.641, "eval_steps_per_second": 12.914, "step": 4500 }, { "epoch": 2.427398735028933, "grad_norm": 35.069087982177734, "learning_rate": 1.9301010393569676e-05, "loss": 0.763551664352417, "step": 4510 }, { "epoch": 2.432781590633831, "grad_norm": 22.598342895507812, "learning_rate": 1.895210838111544e-05, "loss": 1.073389434814453, "step": 4520 }, { "epoch": 2.4381644462387295, "grad_norm": 15.471684455871582, "learning_rate": 1.8606058333983946e-05, "loss": 0.8500160217285156, "step": 4530 }, { "epoch": 2.443547301843628, "grad_norm": 38.8491325378418, "learning_rate": 1.8262872429206734e-05, "loss": 1.3663853645324706, "step": 4540 }, { "epoch": 2.4489301574485265, "grad_norm": 22.642866134643555, "learning_rate": 1.7922562743030057e-05, "loss": 0.6329252243041992, "step": 4550 }, { "epoch": 2.454313013053425, "grad_norm": 16.064590454101562, "learning_rate": 1.7585141250490022e-05, "loss": 0.8116084098815918, "step": 4560 }, { "epoch": 2.459695868658323, "grad_norm": 26.74970245361328, "learning_rate": 1.725061982499103e-05, "loss": 0.8728569984436035, "step": 4570 }, { "epoch": 2.4650787242632215, "grad_norm": 13.955748558044434, "learning_rate": 1.69190102378881e-05, "loss": 0.7079121589660644, "step": 4580 }, { "epoch": 2.47046157986812, "grad_norm": 30.616897583007812, "learning_rate": 1.6590324158072603e-05, "loss": 0.8990015029907227, "step": 4590 }, { "epoch": 2.4758444354730185, "grad_norm": 20.03752899169922, "learning_rate": 1.6264573151561648e-05, "loss": 1.1187437057495118, "step": 4600 }, { "epoch": 2.4758444354730185, "eval_loss": 0.39977964758872986, "eval_runtime": 63.806, "eval_samples_per_second": 51.766, "eval_steps_per_second": 12.945, "step": 4600 }, { "epoch": 2.481227291077917, "grad_norm": 18.699827194213867, "learning_rate": 1.5941768681091085e-05, "loss": 0.7999272346496582, "step": 4610 }, { "epoch": 2.486610146682815, "grad_norm": 4.604935646057129, "learning_rate": 1.562192210571225e-05, "loss": 0.8284183502197265, "step": 4620 }, { "epoch": 2.4919930022877135, "grad_norm": 29.9500732421875, "learning_rate": 1.5305044680392e-05, "loss": 0.8354525566101074, "step": 4630 }, { "epoch": 2.497375857892612, "grad_norm": 37.695804595947266, "learning_rate": 1.499114755561699e-05, "loss": 0.8016999244689942, "step": 4640 }, { "epoch": 2.5027587134975104, "grad_norm": 4.899083614349365, "learning_rate": 1.4680241777001059e-05, "loss": 0.9540206909179687, "step": 4650 }, { "epoch": 2.508141569102409, "grad_norm": 26.045948028564453, "learning_rate": 1.4372338284896647e-05, "loss": 0.5969816684722901, "step": 4660 }, { "epoch": 2.513524424707307, "grad_norm": 23.402122497558594, "learning_rate": 1.4067447914009823e-05, "loss": 0.7931214809417725, "step": 4670 }, { "epoch": 2.518907280312206, "grad_norm": 5.232571601867676, "learning_rate": 1.3765581393018978e-05, "loss": 0.6403655052185059, "step": 4680 }, { "epoch": 2.524290135917104, "grad_norm": 11.179905891418457, "learning_rate": 1.3466749344197339e-05, "loss": 0.5316050529479981, "step": 4690 }, { "epoch": 2.5296729915220024, "grad_norm": 21.05845069885254, "learning_rate": 1.3170962283039235e-05, "loss": 1.0778657913208007, "step": 4700 }, { "epoch": 2.5296729915220024, "eval_loss": 0.40597495436668396, "eval_runtime": 63.8788, "eval_samples_per_second": 51.707, "eval_steps_per_second": 12.931, "step": 4700 }, { "epoch": 2.535055847126901, "grad_norm": 17.45840072631836, "learning_rate": 1.2878230617889918e-05, "loss": 1.3090163230895997, "step": 4710 }, { "epoch": 2.540438702731799, "grad_norm": 13.649649620056152, "learning_rate": 1.2588564649579449e-05, "loss": 0.6182886600494385, "step": 4720 }, { "epoch": 2.545821558336698, "grad_norm": 30.202678680419922, "learning_rate": 1.2301974571060181e-05, "loss": 0.8260242462158203, "step": 4730 }, { "epoch": 2.551204413941596, "grad_norm": 9.608967781066895, "learning_rate": 1.2018470467048072e-05, "loss": 0.5750818729400635, "step": 4740 }, { "epoch": 2.5565872695464944, "grad_norm": 12.897671699523926, "learning_rate": 1.1738062313667786e-05, "loss": 0.8292213439941406, "step": 4750 }, { "epoch": 2.561970125151393, "grad_norm": 48.488006591796875, "learning_rate": 1.1460759978101787e-05, "loss": 0.8127927780151367, "step": 4760 }, { "epoch": 2.5673529807562914, "grad_norm": 30.89815330505371, "learning_rate": 1.118657321824289e-05, "loss": 0.710633659362793, "step": 4770 }, { "epoch": 2.57273583636119, "grad_norm": 17.691478729248047, "learning_rate": 1.0915511682351142e-05, "loss": 0.6440166473388672, "step": 4780 }, { "epoch": 2.578118691966088, "grad_norm": 27.643741607666016, "learning_rate": 1.0647584908714148e-05, "loss": 0.679203987121582, "step": 4790 }, { "epoch": 2.5835015475709864, "grad_norm": 27.048784255981445, "learning_rate": 1.0382802325311491e-05, "loss": 0.9150435447692871, "step": 4800 }, { "epoch": 2.5835015475709864, "eval_loss": 0.40863797068595886, "eval_runtime": 63.903, "eval_samples_per_second": 51.688, "eval_steps_per_second": 12.926, "step": 4800 }, { "epoch": 2.588884403175885, "grad_norm": 17.041791915893555, "learning_rate": 1.0121173249482962e-05, "loss": 0.8509119987487793, "step": 4810 }, { "epoch": 2.5942672587807833, "grad_norm": 28.006967544555664, "learning_rate": 9.862706887600714e-06, "loss": 0.8236183166503906, "step": 4820 }, { "epoch": 2.599650114385682, "grad_norm": 36.17509078979492, "learning_rate": 9.607412334745235e-06, "loss": 0.839243221282959, "step": 4830 }, { "epoch": 2.60503296999058, "grad_norm": 1.2139636278152466, "learning_rate": 9.355298574385474e-06, "loss": 0.49801297187805177, "step": 4840 }, { "epoch": 2.6104158255954784, "grad_norm": 24.570405960083008, "learning_rate": 9.106374478062485e-06, "loss": 0.7030567169189453, "step": 4850 }, { "epoch": 2.615798681200377, "grad_norm": 25.26799201965332, "learning_rate": 8.86064880507742e-06, "loss": 0.8722931861877441, "step": 4860 }, { "epoch": 2.6211815368052753, "grad_norm": 18.12640380859375, "learning_rate": 8.618130202183317e-06, "loss": 0.8933378219604492, "step": 4870 }, { "epoch": 2.626564392410174, "grad_norm": 33.00815200805664, "learning_rate": 8.378827203280625e-06, "loss": 0.7595347881317138, "step": 4880 }, { "epoch": 2.631947248015072, "grad_norm": 1.4025450944900513, "learning_rate": 8.142748229117192e-06, "loss": 1.158553695678711, "step": 4890 }, { "epoch": 2.6373301036199703, "grad_norm": 2.04663348197937, "learning_rate": 7.909901586991752e-06, "loss": 0.495909595489502, "step": 4900 }, { "epoch": 2.6373301036199703, "eval_loss": 0.4060768187046051, "eval_runtime": 63.9323, "eval_samples_per_second": 51.664, "eval_steps_per_second": 12.92, "step": 4900 }, { "epoch": 2.642712959224869, "grad_norm": 34.9760856628418, "learning_rate": 7.680295470461651e-06, "loss": 0.8339058876037597, "step": 4910 }, { "epoch": 2.6480958148297673, "grad_norm": 7.547365665435791, "learning_rate": 7.4539379590545575e-06, "loss": 1.0124500274658204, "step": 4920 }, { "epoch": 2.653478670434666, "grad_norm": 36.673561096191406, "learning_rate": 7.230837017984127e-06, "loss": 0.9258150100708008, "step": 4930 }, { "epoch": 2.658861526039564, "grad_norm": 12.191123962402344, "learning_rate": 7.011000497869691e-06, "loss": 0.7174896240234375, "step": 4940 }, { "epoch": 2.6642443816444623, "grad_norm": 27.09784507751465, "learning_rate": 6.794436134460125e-06, "loss": 0.7737472534179688, "step": 4950 }, { "epoch": 2.669627237249361, "grad_norm": 1.9672365188598633, "learning_rate": 6.581151548361475e-06, "loss": 0.7733006954193116, "step": 4960 }, { "epoch": 2.6750100928542593, "grad_norm": 24.851816177368164, "learning_rate": 6.3711542447688956e-06, "loss": 0.976164436340332, "step": 4970 }, { "epoch": 2.6803929484591578, "grad_norm": 4.714712142944336, "learning_rate": 6.164451613202515e-06, "loss": 1.361710262298584, "step": 4980 }, { "epoch": 2.685775804064056, "grad_norm": 33.14804458618164, "learning_rate": 5.961050927247458e-06, "loss": 1.0757354736328124, "step": 4990 }, { "epoch": 2.6911586596689543, "grad_norm": 19.453475952148438, "learning_rate": 5.760959344297811e-06, "loss": 0.7794712543487549, "step": 5000 }, { "epoch": 2.6911586596689543, "eval_loss": 0.3953015208244324, "eval_runtime": 63.9175, "eval_samples_per_second": 51.676, "eval_steps_per_second": 12.923, "step": 5000 }, { "epoch": 2.6965415152738528, "grad_norm": 38.8685302734375, "learning_rate": 5.56418390530492e-06, "loss": 0.8262761116027832, "step": 5010 }, { "epoch": 2.7019243708787513, "grad_norm": 42.21137237548828, "learning_rate": 5.370731534529383e-06, "loss": 0.9226728439331054, "step": 5020 }, { "epoch": 2.7073072264836497, "grad_norm": 11.871996879577637, "learning_rate": 5.180609039297646e-06, "loss": 0.4317474365234375, "step": 5030 }, { "epoch": 2.712690082088548, "grad_norm": 1.4888293743133545, "learning_rate": 4.993823109762319e-06, "loss": 1.047317886352539, "step": 5040 }, { "epoch": 2.7180729376934463, "grad_norm": 31.726903915405273, "learning_rate": 4.810380318666774e-06, "loss": 0.9913960456848144, "step": 5050 }, { "epoch": 2.7234557932983448, "grad_norm": 30.20676040649414, "learning_rate": 4.630287121113897e-06, "loss": 0.6376973628997803, "step": 5060 }, { "epoch": 2.7288386489032432, "grad_norm": 29.86091423034668, "learning_rate": 4.453549854338934e-06, "loss": 0.8093062400817871, "step": 5070 }, { "epoch": 2.7342215045081417, "grad_norm": 3.3067686557769775, "learning_rate": 4.280174737486442e-06, "loss": 1.0463817596435547, "step": 5080 }, { "epoch": 2.7396043601130398, "grad_norm": 0.369608610868454, "learning_rate": 4.110167871391546e-06, "loss": 0.7146965980529785, "step": 5090 }, { "epoch": 2.7449872157179382, "grad_norm": 17.710023880004883, "learning_rate": 3.943535238365137e-06, "loss": 0.4951002597808838, "step": 5100 }, { "epoch": 2.7449872157179382, "eval_loss": 0.3943323791027069, "eval_runtime": 63.9034, "eval_samples_per_second": 51.687, "eval_steps_per_second": 12.926, "step": 5100 }, { "epoch": 2.7503700713228367, "grad_norm": 13.03876781463623, "learning_rate": 3.780282701983462e-06, "loss": 0.8074542045593261, "step": 5110 }, { "epoch": 2.755752926927735, "grad_norm": 36.00669860839844, "learning_rate": 3.620416006881722e-06, "loss": 1.496070957183838, "step": 5120 }, { "epoch": 2.7611357825326337, "grad_norm": 20.361572265625, "learning_rate": 3.4639407785519774e-06, "loss": 1.3481143951416015, "step": 5130 }, { "epoch": 2.7665186381375317, "grad_norm": 20.532785415649414, "learning_rate": 3.310862523145197e-06, "loss": 0.5495355129241943, "step": 5140 }, { "epoch": 2.7719014937424302, "grad_norm": 17.233598709106445, "learning_rate": 3.161186627277435e-06, "loss": 0.9931418418884277, "step": 5150 }, { "epoch": 2.7772843493473287, "grad_norm": 10.674700736999512, "learning_rate": 3.014918357840368e-06, "loss": 0.6294282913208008, "step": 5160 }, { "epoch": 2.782667204952227, "grad_norm": 29.000959396362305, "learning_rate": 2.872062861815905e-06, "loss": 0.7137054920196533, "step": 5170 }, { "epoch": 2.7880500605571257, "grad_norm": 27.14993667602539, "learning_rate": 2.732625166095093e-06, "loss": 0.7461415767669678, "step": 5180 }, { "epoch": 2.7934329161620237, "grad_norm": 19.03074073791504, "learning_rate": 2.5966101773012064e-06, "loss": 0.9058383941650391, "step": 5190 }, { "epoch": 2.798815771766922, "grad_norm": 25.3709659576416, "learning_rate": 2.464022681617162e-06, "loss": 0.9319804191589356, "step": 5200 }, { "epoch": 2.798815771766922, "eval_loss": 0.39116066694259644, "eval_runtime": 63.7425, "eval_samples_per_second": 51.818, "eval_steps_per_second": 12.958, "step": 5200 }, { "epoch": 2.8041986273718207, "grad_norm": 24.770858764648438, "learning_rate": 2.334867344616998e-06, "loss": 0.8134791374206543, "step": 5210 }, { "epoch": 2.809581482976719, "grad_norm": 32.360477447509766, "learning_rate": 2.2091487111017383e-06, "loss": 0.9853259086608886, "step": 5220 }, { "epoch": 2.8149643385816177, "grad_norm": 26.975568771362305, "learning_rate": 2.086871204939511e-06, "loss": 0.3680762767791748, "step": 5230 }, { "epoch": 2.8203471941865157, "grad_norm": 40.22636413574219, "learning_rate": 1.9680391289098266e-06, "loss": 0.7327807426452637, "step": 5240 }, { "epoch": 2.8257300497914146, "grad_norm": 27.841876983642578, "learning_rate": 1.852656664552166e-06, "loss": 1.114755630493164, "step": 5250 }, { "epoch": 2.8311129053963127, "grad_norm": 23.36740493774414, "learning_rate": 1.740727872018899e-06, "loss": 1.0058785438537599, "step": 5260 }, { "epoch": 2.836495761001211, "grad_norm": 3.433856725692749, "learning_rate": 1.632256689932321e-06, "loss": 0.6553703784942627, "step": 5270 }, { "epoch": 2.8418786166061096, "grad_norm": 28.19014549255371, "learning_rate": 1.5272469352461517e-06, "loss": 0.5715783119201661, "step": 5280 }, { "epoch": 2.8472614722110077, "grad_norm": 33.08034133911133, "learning_rate": 1.4257023031111538e-06, "loss": 1.0896245002746583, "step": 5290 }, { "epoch": 2.8526443278159066, "grad_norm": 29.616188049316406, "learning_rate": 1.3276263667451272e-06, "loss": 0.575172758102417, "step": 5300 }, { "epoch": 2.8526443278159066, "eval_loss": 0.39213913679122925, "eval_runtime": 63.7458, "eval_samples_per_second": 51.815, "eval_steps_per_second": 12.958, "step": 5300 }, { "epoch": 2.8580271834208046, "grad_norm": 24.045257568359375, "learning_rate": 1.2330225773071858e-06, "loss": 0.6139691352844239, "step": 5310 }, { "epoch": 2.863410039025703, "grad_norm": 32.76106643676758, "learning_rate": 1.1418942637763109e-06, "loss": 0.6473401069641114, "step": 5320 }, { "epoch": 2.8687928946306016, "grad_norm": 17.230541229248047, "learning_rate": 1.054244632834167e-06, "loss": 0.6802839279174805, "step": 5330 }, { "epoch": 2.8741757502355, "grad_norm": 14.499601364135742, "learning_rate": 9.700767687523483e-07, "loss": 0.8065154075622558, "step": 5340 }, { "epoch": 2.8795586058403986, "grad_norm": 16.937408447265625, "learning_rate": 8.893936332837749e-07, "loss": 1.2557835578918457, "step": 5350 }, { "epoch": 2.8849414614452966, "grad_norm": 18.08892250061035, "learning_rate": 8.121980655584783e-07, "loss": 0.5564064979553223, "step": 5360 }, { "epoch": 2.890324317050195, "grad_norm": 5.15496826171875, "learning_rate": 7.384927819837461e-07, "loss": 0.7302708625793457, "step": 5370 }, { "epoch": 2.8957071726550936, "grad_norm": 0.6171675324440002, "learning_rate": 6.68280376148489e-07, "loss": 0.46964249610900877, "step": 5380 }, { "epoch": 2.901090028259992, "grad_norm": 12.738670349121094, "learning_rate": 6.01563318731968e-07, "loss": 0.8759981155395508, "step": 5390 }, { "epoch": 2.9064728838648906, "grad_norm": 8.0991849899292, "learning_rate": 5.383439574169313e-07, "loss": 0.3772397994995117, "step": 5400 }, { "epoch": 2.9064728838648906, "eval_loss": 0.39079996943473816, "eval_runtime": 63.7806, "eval_samples_per_second": 51.787, "eval_steps_per_second": 12.951, "step": 5400 }, { "epoch": 2.9118557394697886, "grad_norm": 2.8664917945861816, "learning_rate": 4.786245168068804e-07, "loss": 0.6327933311462403, "step": 5410 }, { "epoch": 2.917238595074687, "grad_norm": 15.887563705444336, "learning_rate": 4.2240709834791004e-07, "loss": 0.8755616188049317, "step": 5420 }, { "epoch": 2.9226214506795856, "grad_norm": 10.990631103515625, "learning_rate": 3.696936802546902e-07, "loss": 0.9237110137939453, "step": 5430 }, { "epoch": 2.928004306284484, "grad_norm": 36.54423141479492, "learning_rate": 3.204861174408547e-07, "loss": 0.6388278484344483, "step": 5440 }, { "epoch": 2.9333871618893825, "grad_norm": 25.8781795501709, "learning_rate": 2.747861414537756e-07, "loss": 0.8046004295349121, "step": 5450 }, { "epoch": 2.9387700174942806, "grad_norm": 14.25063419342041, "learning_rate": 2.3259536041357888e-07, "loss": 1.015383243560791, "step": 5460 }, { "epoch": 2.944152873099179, "grad_norm": 49.4938850402832, "learning_rate": 1.9391525895661178e-07, "loss": 0.9852633476257324, "step": 5470 }, { "epoch": 2.9495357287040775, "grad_norm": 8.794760704040527, "learning_rate": 1.587471981831512e-07, "loss": 0.7090904235839843, "step": 5480 }, { "epoch": 2.954918584308976, "grad_norm": 20.00497055053711, "learning_rate": 1.27092415609531e-07, "loss": 0.8313823699951172, "step": 5490 }, { "epoch": 2.9603014399138745, "grad_norm": 33.549407958984375, "learning_rate": 9.89520251245879e-08, "loss": 0.7701246261596679, "step": 5500 }, { "epoch": 2.9603014399138745, "eval_loss": 0.3912367820739746, "eval_runtime": 63.5041, "eval_samples_per_second": 52.012, "eval_steps_per_second": 13.007, "step": 5500 } ], "logging_steps": 10, "max_steps": 5574, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 4.246694746194002e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }