{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.17777777777777778, "eval_steps": 500, "global_step": 8000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00044444444444444447, "grad_norm": 0.4511776566505432, "learning_rate": 5.7e-06, "loss": 3.2161075592041017, "step": 20 }, { "epoch": 0.0008888888888888889, "grad_norm": 0.44093042612075806, "learning_rate": 1.17e-05, "loss": 3.201356887817383, "step": 40 }, { "epoch": 0.0013333333333333333, "grad_norm": 0.4689347743988037, "learning_rate": 1.7699999999999997e-05, "loss": 3.2072242736816405, "step": 60 }, { "epoch": 0.0017777777777777779, "grad_norm": 0.4622272253036499, "learning_rate": 2.3699999999999997e-05, "loss": 3.1648168563842773, "step": 80 }, { "epoch": 0.0022222222222222222, "grad_norm": 0.4848445653915405, "learning_rate": 2.97e-05, "loss": 3.2546276092529296, "step": 100 }, { "epoch": 0.0026666666666666666, "grad_norm": 0.4572749137878418, "learning_rate": 3.5699999999999994e-05, "loss": 3.200400161743164, "step": 120 }, { "epoch": 0.003111111111111111, "grad_norm": 0.47524744272232056, "learning_rate": 4.17e-05, "loss": 3.186128044128418, "step": 140 }, { "epoch": 0.0035555555555555557, "grad_norm": 0.4501917362213135, "learning_rate": 4.7699999999999994e-05, "loss": 3.2226837158203123, "step": 160 }, { "epoch": 0.004, "grad_norm": 0.5257205963134766, "learning_rate": 5.369999999999999e-05, "loss": 3.164937210083008, "step": 180 }, { "epoch": 0.0044444444444444444, "grad_norm": 0.5314930081367493, "learning_rate": 5.97e-05, "loss": 3.281321716308594, "step": 200 }, { "epoch": 0.004888888888888889, "grad_norm": 0.4933965802192688, "learning_rate": 6.57e-05, "loss": 3.2729015350341797, "step": 220 }, { "epoch": 0.005333333333333333, "grad_norm": 0.5019872784614563, "learning_rate": 7.17e-05, "loss": 3.2970985412597655, "step": 240 }, { "epoch": 0.0057777777777777775, "grad_norm": 0.5201398134231567, "learning_rate": 7.769999999999999e-05, "loss": 3.2776580810546876, "step": 260 }, { "epoch": 0.006222222222222222, "grad_norm": 0.4757533669471741, "learning_rate": 8.37e-05, "loss": 3.2021453857421873, "step": 280 }, { "epoch": 0.006666666666666667, "grad_norm": 0.5352882146835327, "learning_rate": 8.969999999999998e-05, "loss": 3.247829818725586, "step": 300 }, { "epoch": 0.0071111111111111115, "grad_norm": 0.4869779646396637, "learning_rate": 9.57e-05, "loss": 3.241053009033203, "step": 320 }, { "epoch": 0.007555555555555556, "grad_norm": 0.468607097864151, "learning_rate": 0.00010169999999999999, "loss": 3.2389141082763673, "step": 340 }, { "epoch": 0.008, "grad_norm": 0.4561017155647278, "learning_rate": 0.00010769999999999999, "loss": 3.1932161331176756, "step": 360 }, { "epoch": 0.008444444444444444, "grad_norm": 0.4775182902812958, "learning_rate": 0.00011369999999999999, "loss": 3.2328330993652346, "step": 380 }, { "epoch": 0.008888888888888889, "grad_norm": 0.48155900835990906, "learning_rate": 0.0001197, "loss": 3.235352325439453, "step": 400 }, { "epoch": 0.009333333333333334, "grad_norm": 0.5080763101577759, "learning_rate": 0.0001257, "loss": 3.2805110931396486, "step": 420 }, { "epoch": 0.009777777777777778, "grad_norm": 0.4807881712913513, "learning_rate": 0.00013169999999999998, "loss": 3.2630645751953127, "step": 440 }, { "epoch": 0.010222222222222223, "grad_norm": 0.5513017773628235, "learning_rate": 0.00013769999999999999, "loss": 3.248635101318359, "step": 460 }, { "epoch": 0.010666666666666666, "grad_norm": 0.4453672468662262, "learning_rate": 0.00014369999999999997, "loss": 3.2130226135253905, "step": 480 }, { "epoch": 0.011111111111111112, "grad_norm": 0.46986159682273865, "learning_rate": 0.00014969999999999998, "loss": 3.2899818420410156, "step": 500 }, { "epoch": 0.011555555555555555, "grad_norm": 0.45752519369125366, "learning_rate": 0.0001499999325288476, "loss": 3.294172668457031, "step": 520 }, { "epoch": 0.012, "grad_norm": 0.4956851005554199, "learning_rate": 0.0001499997157241735, "loss": 3.264346694946289, "step": 540 }, { "epoch": 0.012444444444444444, "grad_norm": 0.49039188027381897, "learning_rate": 0.00014999934939950921, "loss": 3.2950061798095702, "step": 560 }, { "epoch": 0.012888888888888889, "grad_norm": 0.552381157875061, "learning_rate": 0.00014999883355558505, "loss": 3.2415611267089846, "step": 580 }, { "epoch": 0.013333333333333334, "grad_norm": 0.46296975016593933, "learning_rate": 0.00014999816819342944, "loss": 3.255002975463867, "step": 600 }, { "epoch": 0.013777777777777778, "grad_norm": 0.5508076548576355, "learning_rate": 0.00014999735331436878, "loss": 3.1999645233154297, "step": 620 }, { "epoch": 0.014222222222222223, "grad_norm": 0.4961799085140228, "learning_rate": 0.00014999638892002764, "loss": 3.1514266967773437, "step": 640 }, { "epoch": 0.014666666666666666, "grad_norm": 0.4749923646450043, "learning_rate": 0.00014999527501232868, "loss": 3.2499130249023436, "step": 660 }, { "epoch": 0.015111111111111112, "grad_norm": 0.5820915102958679, "learning_rate": 0.00014999401159349255, "loss": 3.256272888183594, "step": 680 }, { "epoch": 0.015555555555555555, "grad_norm": 0.4775523245334625, "learning_rate": 0.00014999259866603804, "loss": 3.262600326538086, "step": 700 }, { "epoch": 0.016, "grad_norm": 0.5320135354995728, "learning_rate": 0.00014999103623278197, "loss": 3.1844825744628906, "step": 720 }, { "epoch": 0.016444444444444446, "grad_norm": 0.47456520795822144, "learning_rate": 0.0001499893242968392, "loss": 3.1583158493041994, "step": 740 }, { "epoch": 0.016888888888888887, "grad_norm": 0.4774903357028961, "learning_rate": 0.00014998746286162267, "loss": 3.244768524169922, "step": 760 }, { "epoch": 0.017333333333333333, "grad_norm": 0.48431041836738586, "learning_rate": 0.00014998545193084338, "loss": 3.2968166351318358, "step": 780 }, { "epoch": 0.017777777777777778, "grad_norm": 0.4681703746318817, "learning_rate": 0.00014998329150851027, "loss": 3.249764633178711, "step": 800 }, { "epoch": 0.018222222222222223, "grad_norm": 0.45024555921554565, "learning_rate": 0.00014998098159893042, "loss": 3.2845108032226564, "step": 820 }, { "epoch": 0.018666666666666668, "grad_norm": 0.4507620334625244, "learning_rate": 0.00014997852220670888, "loss": 3.2801742553710938, "step": 840 }, { "epoch": 0.01911111111111111, "grad_norm": 0.4610176682472229, "learning_rate": 0.00014997591333674873, "loss": 3.274794006347656, "step": 860 }, { "epoch": 0.019555555555555555, "grad_norm": 0.4393482208251953, "learning_rate": 0.000149973154994251, "loss": 3.270203399658203, "step": 880 }, { "epoch": 0.02, "grad_norm": 0.4708148241043091, "learning_rate": 0.00014997024718471473, "loss": 3.2781902313232423, "step": 900 }, { "epoch": 0.020444444444444446, "grad_norm": 0.45222797989845276, "learning_rate": 0.000149967189913937, "loss": 3.2682468414306642, "step": 920 }, { "epoch": 0.020888888888888887, "grad_norm": 0.43749532103538513, "learning_rate": 0.00014996398318801275, "loss": 3.2331676483154297, "step": 940 }, { "epoch": 0.021333333333333333, "grad_norm": 0.4368564486503601, "learning_rate": 0.00014996062701333498, "loss": 3.2656929016113283, "step": 960 }, { "epoch": 0.021777777777777778, "grad_norm": 0.4446834623813629, "learning_rate": 0.00014995712139659456, "loss": 3.2684513092041017, "step": 980 }, { "epoch": 0.022222222222222223, "grad_norm": 0.4783112704753876, "learning_rate": 0.00014995346634478032, "loss": 3.0523948669433594, "step": 1000 }, { "epoch": 0.02266666666666667, "grad_norm": 0.5712579488754272, "learning_rate": 0.000149949661865179, "loss": 3.264796829223633, "step": 1020 }, { "epoch": 0.02311111111111111, "grad_norm": 0.5574910044670105, "learning_rate": 0.00014994570796537525, "loss": 3.1938405990600587, "step": 1040 }, { "epoch": 0.023555555555555555, "grad_norm": 0.47714975476264954, "learning_rate": 0.00014994160465325157, "loss": 3.1733489990234376, "step": 1060 }, { "epoch": 0.024, "grad_norm": 0.5303850173950195, "learning_rate": 0.00014993735193698837, "loss": 3.2493263244628907, "step": 1080 }, { "epoch": 0.024444444444444446, "grad_norm": 0.45851755142211914, "learning_rate": 0.0001499329498250639, "loss": 3.2284214019775392, "step": 1100 }, { "epoch": 0.024888888888888887, "grad_norm": 0.46116310358047485, "learning_rate": 0.00014992839832625424, "loss": 3.2240779876708983, "step": 1120 }, { "epoch": 0.025333333333333333, "grad_norm": 0.47025495767593384, "learning_rate": 0.00014992369744963328, "loss": 3.2619400024414062, "step": 1140 }, { "epoch": 0.025777777777777778, "grad_norm": 0.49180319905281067, "learning_rate": 0.00014991884720457274, "loss": 3.1931442260742187, "step": 1160 }, { "epoch": 0.026222222222222223, "grad_norm": 0.464128702878952, "learning_rate": 0.0001499138476007421, "loss": 3.2129077911376953, "step": 1180 }, { "epoch": 0.02666666666666667, "grad_norm": 0.4527023434638977, "learning_rate": 0.00014990869864810855, "loss": 3.183033561706543, "step": 1200 }, { "epoch": 0.02711111111111111, "grad_norm": 0.4221210777759552, "learning_rate": 0.0001499034003569372, "loss": 3.169704055786133, "step": 1220 }, { "epoch": 0.027555555555555555, "grad_norm": 0.4447830021381378, "learning_rate": 0.00014989795273779064, "loss": 3.248243713378906, "step": 1240 }, { "epoch": 0.028, "grad_norm": 0.4672100245952606, "learning_rate": 0.00014989235580152937, "loss": 3.204691696166992, "step": 1260 }, { "epoch": 0.028444444444444446, "grad_norm": 0.4576936364173889, "learning_rate": 0.00014988660955931143, "loss": 3.2274940490722654, "step": 1280 }, { "epoch": 0.028888888888888888, "grad_norm": 0.4463963508605957, "learning_rate": 0.00014988071402259262, "loss": 3.159174919128418, "step": 1300 }, { "epoch": 0.029333333333333333, "grad_norm": 0.4741155505180359, "learning_rate": 0.0001498746692031263, "loss": 3.1926496505737303, "step": 1320 }, { "epoch": 0.029777777777777778, "grad_norm": 0.4806189239025116, "learning_rate": 0.00014986847511296345, "loss": 3.253347396850586, "step": 1340 }, { "epoch": 0.030222222222222223, "grad_norm": 0.49649766087532043, "learning_rate": 0.00014986213176445266, "loss": 3.2681900024414063, "step": 1360 }, { "epoch": 0.030666666666666665, "grad_norm": 0.46470171213150024, "learning_rate": 0.0001498556391702401, "loss": 3.258492279052734, "step": 1380 }, { "epoch": 0.03111111111111111, "grad_norm": 0.4878062605857849, "learning_rate": 0.00014984899734326947, "loss": 3.2820438385009765, "step": 1400 }, { "epoch": 0.03155555555555556, "grad_norm": 0.46043869853019714, "learning_rate": 0.0001498422062967819, "loss": 3.274037551879883, "step": 1420 }, { "epoch": 0.032, "grad_norm": 0.6005187630653381, "learning_rate": 0.00014983526604431613, "loss": 3.260797119140625, "step": 1440 }, { "epoch": 0.03244444444444444, "grad_norm": 0.6328933835029602, "learning_rate": 0.00014982817659970826, "loss": 3.2706462860107424, "step": 1460 }, { "epoch": 0.03288888888888889, "grad_norm": 0.46984460949897766, "learning_rate": 0.00014982093797709188, "loss": 3.2529743194580076, "step": 1480 }, { "epoch": 0.03333333333333333, "grad_norm": 0.4528060853481293, "learning_rate": 0.00014981355019089796, "loss": 3.2241920471191405, "step": 1500 }, { "epoch": 0.033777777777777775, "grad_norm": 0.43708541989326477, "learning_rate": 0.00014980601325585482, "loss": 3.2406337738037108, "step": 1520 }, { "epoch": 0.03422222222222222, "grad_norm": 0.5542400479316711, "learning_rate": 0.00014979832718698823, "loss": 3.2768516540527344, "step": 1540 }, { "epoch": 0.034666666666666665, "grad_norm": 0.47203993797302246, "learning_rate": 0.0001497904919996211, "loss": 3.265271759033203, "step": 1560 }, { "epoch": 0.035111111111111114, "grad_norm": 0.621870219707489, "learning_rate": 0.00014978250770937373, "loss": 3.283491516113281, "step": 1580 }, { "epoch": 0.035555555555555556, "grad_norm": 0.45592767000198364, "learning_rate": 0.00014977437433216374, "loss": 3.2492713928222656, "step": 1600 }, { "epoch": 0.036, "grad_norm": 0.44699525833129883, "learning_rate": 0.0001497660918842058, "loss": 3.2586002349853516, "step": 1620 }, { "epoch": 0.036444444444444446, "grad_norm": 0.44761922955513, "learning_rate": 0.0001497576603820119, "loss": 3.310761642456055, "step": 1640 }, { "epoch": 0.03688888888888889, "grad_norm": 0.44739192724227905, "learning_rate": 0.00014974907984239113, "loss": 3.196021842956543, "step": 1660 }, { "epoch": 0.037333333333333336, "grad_norm": 0.43892452120780945, "learning_rate": 0.00014974035028244976, "loss": 3.2814334869384765, "step": 1680 }, { "epoch": 0.03777777777777778, "grad_norm": 0.478014200925827, "learning_rate": 0.00014973147171959105, "loss": 3.265171432495117, "step": 1700 }, { "epoch": 0.03822222222222222, "grad_norm": 0.5787922143936157, "learning_rate": 0.0001497224441715154, "loss": 3.195718002319336, "step": 1720 }, { "epoch": 0.03866666666666667, "grad_norm": 0.4398203194141388, "learning_rate": 0.00014971326765622018, "loss": 3.144413375854492, "step": 1740 }, { "epoch": 0.03911111111111111, "grad_norm": 0.48114529252052307, "learning_rate": 0.0001497039421919998, "loss": 3.1378915786743162, "step": 1760 }, { "epoch": 0.03955555555555555, "grad_norm": 0.44224387407302856, "learning_rate": 0.00014969446779744552, "loss": 3.2676132202148436, "step": 1780 }, { "epoch": 0.04, "grad_norm": 0.489261269569397, "learning_rate": 0.00014968484449144558, "loss": 3.091619300842285, "step": 1800 }, { "epoch": 0.04044444444444444, "grad_norm": 0.44093602895736694, "learning_rate": 0.0001496750722931851, "loss": 3.1997377395629885, "step": 1820 }, { "epoch": 0.04088888888888889, "grad_norm": 0.43990451097488403, "learning_rate": 0.00014966515122214597, "loss": 3.2633441925048827, "step": 1840 }, { "epoch": 0.04133333333333333, "grad_norm": 0.4617629051208496, "learning_rate": 0.00014965508129810695, "loss": 3.1695838928222657, "step": 1860 }, { "epoch": 0.041777777777777775, "grad_norm": 0.46426230669021606, "learning_rate": 0.00014964486254114348, "loss": 3.218312072753906, "step": 1880 }, { "epoch": 0.042222222222222223, "grad_norm": 0.43642115592956543, "learning_rate": 0.00014963449497162778, "loss": 3.2762382507324217, "step": 1900 }, { "epoch": 0.042666666666666665, "grad_norm": 0.44940701127052307, "learning_rate": 0.00014962397861022867, "loss": 3.2622085571289063, "step": 1920 }, { "epoch": 0.043111111111111114, "grad_norm": 0.4700528383255005, "learning_rate": 0.0001496133134779117, "loss": 3.280713653564453, "step": 1940 }, { "epoch": 0.043555555555555556, "grad_norm": 0.4469633102416992, "learning_rate": 0.0001496024995959389, "loss": 3.273088073730469, "step": 1960 }, { "epoch": 0.044, "grad_norm": 0.46984365582466125, "learning_rate": 0.00014959153698586896, "loss": 3.3301361083984373, "step": 1980 }, { "epoch": 0.044444444444444446, "grad_norm": 0.6420442461967468, "learning_rate": 0.000149580425669557, "loss": 3.2632827758789062, "step": 2000 }, { "epoch": 0.04488888888888889, "grad_norm": 0.48015037178993225, "learning_rate": 0.00014956916566915461, "loss": 3.2271102905273437, "step": 2020 }, { "epoch": 0.04533333333333334, "grad_norm": 0.47737839818000793, "learning_rate": 0.00014955775700710983, "loss": 3.2571079254150392, "step": 2040 }, { "epoch": 0.04577777777777778, "grad_norm": 0.47588035464286804, "learning_rate": 0.00014954619970616704, "loss": 3.2312530517578124, "step": 2060 }, { "epoch": 0.04622222222222222, "grad_norm": 0.4254153370857239, "learning_rate": 0.00014953449378936695, "loss": 3.246951675415039, "step": 2080 }, { "epoch": 0.04666666666666667, "grad_norm": 0.5118470788002014, "learning_rate": 0.00014952263928004662, "loss": 3.2460872650146486, "step": 2100 }, { "epoch": 0.04711111111111111, "grad_norm": 0.44925907254219055, "learning_rate": 0.0001495106362018392, "loss": 3.199997329711914, "step": 2120 }, { "epoch": 0.04755555555555555, "grad_norm": 0.47085729241371155, "learning_rate": 0.0001494984845786742, "loss": 3.2512306213378905, "step": 2140 }, { "epoch": 0.048, "grad_norm": 0.4463195204734802, "learning_rate": 0.0001494861844347771, "loss": 3.2025390625, "step": 2160 }, { "epoch": 0.04844444444444444, "grad_norm": 0.4751906991004944, "learning_rate": 0.00014947373579466962, "loss": 3.224716567993164, "step": 2180 }, { "epoch": 0.04888888888888889, "grad_norm": 0.4598497152328491, "learning_rate": 0.00014946113868316948, "loss": 3.1804378509521483, "step": 2200 }, { "epoch": 0.04933333333333333, "grad_norm": 0.5118657946586609, "learning_rate": 0.0001494483931253903, "loss": 3.2649372100830076, "step": 2220 }, { "epoch": 0.049777777777777775, "grad_norm": 0.4563441276550293, "learning_rate": 0.0001494354991467418, "loss": 3.2689468383789064, "step": 2240 }, { "epoch": 0.050222222222222224, "grad_norm": 0.4234507083892822, "learning_rate": 0.00014942245677292945, "loss": 3.221723937988281, "step": 2260 }, { "epoch": 0.050666666666666665, "grad_norm": 0.4410296082496643, "learning_rate": 0.00014940926602995464, "loss": 3.2029151916503906, "step": 2280 }, { "epoch": 0.051111111111111114, "grad_norm": 0.43239203095436096, "learning_rate": 0.00014939592694411454, "loss": 3.232569122314453, "step": 2300 }, { "epoch": 0.051555555555555556, "grad_norm": 0.4741559326648712, "learning_rate": 0.00014938243954200207, "loss": 3.204850769042969, "step": 2320 }, { "epoch": 0.052, "grad_norm": 0.46059247851371765, "learning_rate": 0.00014936880385050578, "loss": 3.1890140533447267, "step": 2340 }, { "epoch": 0.052444444444444446, "grad_norm": 0.4493935704231262, "learning_rate": 0.00014935501989680986, "loss": 3.190713882446289, "step": 2360 }, { "epoch": 0.05288888888888889, "grad_norm": 0.45153337717056274, "learning_rate": 0.0001493410877083942, "loss": 3.18747501373291, "step": 2380 }, { "epoch": 0.05333333333333334, "grad_norm": 0.4542306363582611, "learning_rate": 0.00014932700731303404, "loss": 3.206298065185547, "step": 2400 }, { "epoch": 0.05377777777777778, "grad_norm": 0.47714149951934814, "learning_rate": 0.00014931277873880017, "loss": 3.1353384017944337, "step": 2420 }, { "epoch": 0.05422222222222222, "grad_norm": 0.4965257942676544, "learning_rate": 0.00014929840201405878, "loss": 3.2254898071289064, "step": 2440 }, { "epoch": 0.05466666666666667, "grad_norm": 0.44981348514556885, "learning_rate": 0.00014928387716747144, "loss": 3.2872825622558595, "step": 2460 }, { "epoch": 0.05511111111111111, "grad_norm": 0.46337834000587463, "learning_rate": 0.00014926920422799497, "loss": 3.3067367553710936, "step": 2480 }, { "epoch": 0.05555555555555555, "grad_norm": 0.4484391212463379, "learning_rate": 0.00014925438322488147, "loss": 3.246139907836914, "step": 2500 }, { "epoch": 0.056, "grad_norm": 0.49288684129714966, "learning_rate": 0.00014923941418767817, "loss": 3.277478790283203, "step": 2520 }, { "epoch": 0.05644444444444444, "grad_norm": 0.4538717269897461, "learning_rate": 0.00014922429714622748, "loss": 3.274536895751953, "step": 2540 }, { "epoch": 0.05688888888888889, "grad_norm": 0.4540354907512665, "learning_rate": 0.00014920903213066683, "loss": 3.2235836029052733, "step": 2560 }, { "epoch": 0.05733333333333333, "grad_norm": 0.45585209131240845, "learning_rate": 0.0001491936191714287, "loss": 3.2165584564208984, "step": 2580 }, { "epoch": 0.057777777777777775, "grad_norm": 0.4547863006591797, "learning_rate": 0.00014917805829924044, "loss": 3.218004608154297, "step": 2600 }, { "epoch": 0.058222222222222224, "grad_norm": 0.43512633442878723, "learning_rate": 0.00014916234954512434, "loss": 3.240696334838867, "step": 2620 }, { "epoch": 0.058666666666666666, "grad_norm": 0.4822997748851776, "learning_rate": 0.0001491464929403975, "loss": 3.328903579711914, "step": 2640 }, { "epoch": 0.059111111111111114, "grad_norm": 0.7447636723518372, "learning_rate": 0.00014913048851667173, "loss": 3.266691207885742, "step": 2660 }, { "epoch": 0.059555555555555556, "grad_norm": 0.4689463973045349, "learning_rate": 0.00014911433630585358, "loss": 3.2194419860839845, "step": 2680 }, { "epoch": 0.06, "grad_norm": 0.46186351776123047, "learning_rate": 0.00014909803634014426, "loss": 3.2315700531005858, "step": 2700 }, { "epoch": 0.060444444444444446, "grad_norm": 0.46033021807670593, "learning_rate": 0.00014908158865203943, "loss": 3.238422393798828, "step": 2720 }, { "epoch": 0.06088888888888889, "grad_norm": 0.45534399151802063, "learning_rate": 0.0001490649932743294, "loss": 3.1761499404907227, "step": 2740 }, { "epoch": 0.06133333333333333, "grad_norm": 0.4606379270553589, "learning_rate": 0.00014904825024009878, "loss": 3.193553352355957, "step": 2760 }, { "epoch": 0.06177777777777778, "grad_norm": 0.47090214490890503, "learning_rate": 0.00014903135958272662, "loss": 3.2463909149169923, "step": 2780 }, { "epoch": 0.06222222222222222, "grad_norm": 0.4921543300151825, "learning_rate": 0.00014901432133588628, "loss": 2.72841796875, "step": 2800 }, { "epoch": 0.06266666666666666, "grad_norm": 0.4393237829208374, "learning_rate": 0.00014899713553354532, "loss": 3.206405258178711, "step": 2820 }, { "epoch": 0.06311111111111112, "grad_norm": 0.4873638451099396, "learning_rate": 0.0001489798022099655, "loss": 3.2590980529785156, "step": 2840 }, { "epoch": 0.06355555555555556, "grad_norm": 0.44010642170906067, "learning_rate": 0.00014896232139970263, "loss": 3.219563293457031, "step": 2860 }, { "epoch": 0.064, "grad_norm": 0.5251273512840271, "learning_rate": 0.0001489446931376066, "loss": 3.162039947509766, "step": 2880 }, { "epoch": 0.06444444444444444, "grad_norm": 0.44742482900619507, "learning_rate": 0.00014892691745882128, "loss": 3.185013771057129, "step": 2900 }, { "epoch": 0.06488888888888888, "grad_norm": 0.4437820017337799, "learning_rate": 0.00014890899439878435, "loss": 3.195759582519531, "step": 2920 }, { "epoch": 0.06533333333333333, "grad_norm": 0.456325501203537, "learning_rate": 0.00014889092399322733, "loss": 3.2370731353759767, "step": 2940 }, { "epoch": 0.06577777777777778, "grad_norm": 0.45418423414230347, "learning_rate": 0.0001488727062781756, "loss": 3.2278636932373046, "step": 2960 }, { "epoch": 0.06622222222222222, "grad_norm": 0.4399702847003937, "learning_rate": 0.00014885434128994804, "loss": 3.187220573425293, "step": 2980 }, { "epoch": 0.06666666666666667, "grad_norm": 0.4456944167613983, "learning_rate": 0.0001488358290651573, "loss": 3.1808168411254885, "step": 3000 }, { "epoch": 0.06711111111111111, "grad_norm": 0.4393834173679352, "learning_rate": 0.00014881716964070945, "loss": 3.2609729766845703, "step": 3020 }, { "epoch": 0.06755555555555555, "grad_norm": 0.4507199823856354, "learning_rate": 0.00014879836305380407, "loss": 3.25162353515625, "step": 3040 }, { "epoch": 0.068, "grad_norm": 0.43662023544311523, "learning_rate": 0.0001487794093419341, "loss": 3.286798858642578, "step": 3060 }, { "epoch": 0.06844444444444445, "grad_norm": 0.4379214346408844, "learning_rate": 0.00014876030854288583, "loss": 3.273093414306641, "step": 3080 }, { "epoch": 0.06888888888888889, "grad_norm": 0.4596593976020813, "learning_rate": 0.0001487410606947387, "loss": 3.2046443939208986, "step": 3100 }, { "epoch": 0.06933333333333333, "grad_norm": 0.4801647365093231, "learning_rate": 0.00014872166583586543, "loss": 3.1880971908569338, "step": 3120 }, { "epoch": 0.06977777777777777, "grad_norm": 0.4532665014266968, "learning_rate": 0.0001487021240049317, "loss": 3.2293254852294924, "step": 3140 }, { "epoch": 0.07022222222222223, "grad_norm": 0.45275741815567017, "learning_rate": 0.0001486824352408963, "loss": 3.213456726074219, "step": 3160 }, { "epoch": 0.07066666666666667, "grad_norm": 0.4813518524169922, "learning_rate": 0.00014866259958301083, "loss": 3.16424503326416, "step": 3180 }, { "epoch": 0.07111111111111111, "grad_norm": 0.43920573592185974, "learning_rate": 0.00014864261707081986, "loss": 3.225775146484375, "step": 3200 }, { "epoch": 0.07155555555555555, "grad_norm": 0.4605831205844879, "learning_rate": 0.00014862248774416065, "loss": 3.2264049530029295, "step": 3220 }, { "epoch": 0.072, "grad_norm": 0.4871290326118469, "learning_rate": 0.00014860221164316318, "loss": 3.2987743377685548, "step": 3240 }, { "epoch": 0.07244444444444445, "grad_norm": 0.44592469930648804, "learning_rate": 0.00014858178880825003, "loss": 3.2625717163085937, "step": 3260 }, { "epoch": 0.07288888888888889, "grad_norm": 0.4380069375038147, "learning_rate": 0.00014856121928013633, "loss": 3.1424211502075194, "step": 3280 }, { "epoch": 0.07333333333333333, "grad_norm": 0.45689529180526733, "learning_rate": 0.00014854050309982966, "loss": 3.2054012298583983, "step": 3300 }, { "epoch": 0.07377777777777778, "grad_norm": 0.5314270257949829, "learning_rate": 0.0001485196403086299, "loss": 3.249923324584961, "step": 3320 }, { "epoch": 0.07422222222222222, "grad_norm": 0.4701533317565918, "learning_rate": 0.0001484986309481293, "loss": 3.2303524017333984, "step": 3340 }, { "epoch": 0.07466666666666667, "grad_norm": 0.4300021529197693, "learning_rate": 0.00014847747506021227, "loss": 3.1313520431518556, "step": 3360 }, { "epoch": 0.07511111111111111, "grad_norm": 0.4340360164642334, "learning_rate": 0.00014845617268705535, "loss": 3.235000228881836, "step": 3380 }, { "epoch": 0.07555555555555556, "grad_norm": 0.4472038745880127, "learning_rate": 0.0001484347238711271, "loss": 3.205880355834961, "step": 3400 }, { "epoch": 0.076, "grad_norm": 0.4635298252105713, "learning_rate": 0.00014841312865518803, "loss": 3.1971580505371096, "step": 3420 }, { "epoch": 0.07644444444444444, "grad_norm": 0.4464603066444397, "learning_rate": 0.00014839138708229053, "loss": 3.186069107055664, "step": 3440 }, { "epoch": 0.0768888888888889, "grad_norm": 0.4462911784648895, "learning_rate": 0.0001483694991957788, "loss": 3.176103973388672, "step": 3460 }, { "epoch": 0.07733333333333334, "grad_norm": 0.468891441822052, "learning_rate": 0.00014834746503928863, "loss": 3.1954296112060545, "step": 3480 }, { "epoch": 0.07777777777777778, "grad_norm": 0.47356855869293213, "learning_rate": 0.00014832528465674751, "loss": 3.2059261322021486, "step": 3500 }, { "epoch": 0.07822222222222222, "grad_norm": 0.4475370943546295, "learning_rate": 0.00014830295809237443, "loss": 3.1797210693359377, "step": 3520 }, { "epoch": 0.07866666666666666, "grad_norm": 0.46259668469429016, "learning_rate": 0.00014828048539067978, "loss": 3.1870779037475585, "step": 3540 }, { "epoch": 0.0791111111111111, "grad_norm": 0.42246803641319275, "learning_rate": 0.00014825786659646527, "loss": 3.2552505493164063, "step": 3560 }, { "epoch": 0.07955555555555556, "grad_norm": 0.45982298254966736, "learning_rate": 0.00014823510175482397, "loss": 3.266408920288086, "step": 3580 }, { "epoch": 0.08, "grad_norm": 0.5468801259994507, "learning_rate": 0.00014821219091114, "loss": 3.24694709777832, "step": 3600 }, { "epoch": 0.08044444444444444, "grad_norm": 0.4892885088920593, "learning_rate": 0.00014818913411108854, "loss": 3.2342227935791015, "step": 3620 }, { "epoch": 0.08088888888888889, "grad_norm": 0.4678572118282318, "learning_rate": 0.00014816593140063589, "loss": 3.237919235229492, "step": 3640 }, { "epoch": 0.08133333333333333, "grad_norm": 0.45714640617370605, "learning_rate": 0.00014814258282603906, "loss": 3.280614471435547, "step": 3660 }, { "epoch": 0.08177777777777778, "grad_norm": 0.45380696654319763, "learning_rate": 0.000148119088433846, "loss": 3.2560638427734374, "step": 3680 }, { "epoch": 0.08222222222222222, "grad_norm": 0.4514298737049103, "learning_rate": 0.00014809544827089525, "loss": 3.247824859619141, "step": 3700 }, { "epoch": 0.08266666666666667, "grad_norm": 0.44343146681785583, "learning_rate": 0.0001480716623843161, "loss": 3.237125778198242, "step": 3720 }, { "epoch": 0.08311111111111111, "grad_norm": 0.4640170931816101, "learning_rate": 0.00014804773082152819, "loss": 3.233687973022461, "step": 3740 }, { "epoch": 0.08355555555555555, "grad_norm": 0.4303954243659973, "learning_rate": 0.00014802365363024168, "loss": 3.243009567260742, "step": 3760 }, { "epoch": 0.084, "grad_norm": 0.4338454008102417, "learning_rate": 0.00014799943085845707, "loss": 3.2204730987548826, "step": 3780 }, { "epoch": 0.08444444444444445, "grad_norm": 0.45959097146987915, "learning_rate": 0.00014797506255446503, "loss": 3.2294166564941404, "step": 3800 }, { "epoch": 0.08488888888888889, "grad_norm": 0.44124501943588257, "learning_rate": 0.0001479505487668464, "loss": 3.2337928771972657, "step": 3820 }, { "epoch": 0.08533333333333333, "grad_norm": 0.46661219000816345, "learning_rate": 0.00014792588954447205, "loss": 3.2283748626708983, "step": 3840 }, { "epoch": 0.08577777777777777, "grad_norm": 0.46878811717033386, "learning_rate": 0.00014790108493650277, "loss": 3.24823112487793, "step": 3860 }, { "epoch": 0.08622222222222223, "grad_norm": 0.4897356927394867, "learning_rate": 0.00014787613499238922, "loss": 3.201289749145508, "step": 3880 }, { "epoch": 0.08666666666666667, "grad_norm": 0.47273531556129456, "learning_rate": 0.00014785103976187183, "loss": 3.213232421875, "step": 3900 }, { "epoch": 0.08711111111111111, "grad_norm": 0.4345775842666626, "learning_rate": 0.00014782579929498057, "loss": 3.240903854370117, "step": 3920 }, { "epoch": 0.08755555555555555, "grad_norm": 0.45916658639907837, "learning_rate": 0.00014780041364203508, "loss": 3.2107330322265626, "step": 3940 }, { "epoch": 0.088, "grad_norm": 0.4350726306438446, "learning_rate": 0.0001477748828536444, "loss": 3.1960351943969725, "step": 3960 }, { "epoch": 0.08844444444444445, "grad_norm": 0.4590388834476471, "learning_rate": 0.0001477492069807068, "loss": 3.1532678604125977, "step": 3980 }, { "epoch": 0.08888888888888889, "grad_norm": 0.48074522614479065, "learning_rate": 0.00014772338607441, "loss": 3.1624448776245115, "step": 4000 }, { "epoch": 0.08933333333333333, "grad_norm": 0.73881596326828, "learning_rate": 0.0001476974201862307, "loss": 3.2126842498779298, "step": 4020 }, { "epoch": 0.08977777777777778, "grad_norm": 0.5197725296020508, "learning_rate": 0.00014767130936793466, "loss": 3.1392391204833983, "step": 4040 }, { "epoch": 0.09022222222222222, "grad_norm": 0.5045404434204102, "learning_rate": 0.00014764505367157666, "loss": 3.182374382019043, "step": 4060 }, { "epoch": 0.09066666666666667, "grad_norm": 0.463045209646225, "learning_rate": 0.00014761865314950022, "loss": 3.204686737060547, "step": 4080 }, { "epoch": 0.09111111111111111, "grad_norm": 0.4603744447231293, "learning_rate": 0.00014759210785433765, "loss": 3.222509002685547, "step": 4100 }, { "epoch": 0.09155555555555556, "grad_norm": 0.46453946828842163, "learning_rate": 0.00014756541783900978, "loss": 3.3014972686767576, "step": 4120 }, { "epoch": 0.092, "grad_norm": 0.5600302815437317, "learning_rate": 0.0001475385831567261, "loss": 3.2589656829833986, "step": 4140 }, { "epoch": 0.09244444444444444, "grad_norm": 0.4428822100162506, "learning_rate": 0.00014751160386098437, "loss": 3.2647415161132813, "step": 4160 }, { "epoch": 0.09288888888888888, "grad_norm": 0.44363075494766235, "learning_rate": 0.00014748448000557075, "loss": 3.2011764526367186, "step": 4180 }, { "epoch": 0.09333333333333334, "grad_norm": 0.4819713532924652, "learning_rate": 0.00014745721164455955, "loss": 3.286373519897461, "step": 4200 }, { "epoch": 0.09377777777777778, "grad_norm": 0.47001391649246216, "learning_rate": 0.0001474297988323132, "loss": 3.2380504608154297, "step": 4220 }, { "epoch": 0.09422222222222222, "grad_norm": 0.4884569048881531, "learning_rate": 0.00014740224162348203, "loss": 3.177922821044922, "step": 4240 }, { "epoch": 0.09466666666666666, "grad_norm": 0.4659939706325531, "learning_rate": 0.00014737454007300433, "loss": 3.2145915985107423, "step": 4260 }, { "epoch": 0.0951111111111111, "grad_norm": 0.49327704310417175, "learning_rate": 0.00014734669423610612, "loss": 3.2188236236572267, "step": 4280 }, { "epoch": 0.09555555555555556, "grad_norm": 0.506740391254425, "learning_rate": 0.00014731870416830108, "loss": 3.1984685897827148, "step": 4300 }, { "epoch": 0.096, "grad_norm": 0.4642484188079834, "learning_rate": 0.00014729056992539036, "loss": 3.3112255096435548, "step": 4320 }, { "epoch": 0.09644444444444444, "grad_norm": 0.5405056476593018, "learning_rate": 0.00014726229156346266, "loss": 3.2192611694335938, "step": 4340 }, { "epoch": 0.09688888888888889, "grad_norm": 0.5260511040687561, "learning_rate": 0.00014723386913889392, "loss": 3.2375102996826173, "step": 4360 }, { "epoch": 0.09733333333333333, "grad_norm": 0.47228509187698364, "learning_rate": 0.0001472053027083473, "loss": 3.2128177642822267, "step": 4380 }, { "epoch": 0.09777777777777778, "grad_norm": 0.4495222270488739, "learning_rate": 0.00014717659232877297, "loss": 3.1765506744384764, "step": 4400 }, { "epoch": 0.09822222222222222, "grad_norm": 0.49598413705825806, "learning_rate": 0.00014714773805740825, "loss": 3.254990005493164, "step": 4420 }, { "epoch": 0.09866666666666667, "grad_norm": 0.5155579447746277, "learning_rate": 0.00014711873995177722, "loss": 3.185023880004883, "step": 4440 }, { "epoch": 0.09911111111111111, "grad_norm": 0.532940685749054, "learning_rate": 0.00014708959806969068, "loss": 3.198038864135742, "step": 4460 }, { "epoch": 0.09955555555555555, "grad_norm": 0.54673832654953, "learning_rate": 0.00014706031246924608, "loss": 3.1188608169555665, "step": 4480 }, { "epoch": 0.1, "grad_norm": 0.46205902099609375, "learning_rate": 0.00014703088320882748, "loss": 3.1994697570800783, "step": 4500 }, { "epoch": 0.10044444444444445, "grad_norm": 0.45501023530960083, "learning_rate": 0.00014700131034710528, "loss": 3.2075408935546874, "step": 4520 }, { "epoch": 0.10088888888888889, "grad_norm": 0.44364458322525024, "learning_rate": 0.00014697159394303608, "loss": 3.1500192642211915, "step": 4540 }, { "epoch": 0.10133333333333333, "grad_norm": 0.4537247121334076, "learning_rate": 0.00014694173405586277, "loss": 3.22845458984375, "step": 4560 }, { "epoch": 0.10177777777777777, "grad_norm": 0.4371682107448578, "learning_rate": 0.00014691173074511422, "loss": 3.0997844696044923, "step": 4580 }, { "epoch": 0.10222222222222223, "grad_norm": 0.4579278826713562, "learning_rate": 0.0001468815840706053, "loss": 3.156996154785156, "step": 4600 }, { "epoch": 0.10266666666666667, "grad_norm": 0.47462958097457886, "learning_rate": 0.00014685129409243658, "loss": 3.1914037704467773, "step": 4620 }, { "epoch": 0.10311111111111111, "grad_norm": 0.5009214282035828, "learning_rate": 0.00014682086087099442, "loss": 3.2067234039306642, "step": 4640 }, { "epoch": 0.10355555555555555, "grad_norm": 0.5263777375221252, "learning_rate": 0.00014679028446695072, "loss": 3.238682174682617, "step": 4660 }, { "epoch": 0.104, "grad_norm": 0.4436848759651184, "learning_rate": 0.00014675956494126282, "loss": 3.2270687103271483, "step": 4680 }, { "epoch": 0.10444444444444445, "grad_norm": 0.4504874348640442, "learning_rate": 0.0001467287023551734, "loss": 3.241545486450195, "step": 4700 }, { "epoch": 0.10488888888888889, "grad_norm": 0.4560563862323761, "learning_rate": 0.00014669769677021032, "loss": 3.214568328857422, "step": 4720 }, { "epoch": 0.10533333333333333, "grad_norm": 0.5226325988769531, "learning_rate": 0.0001466665482481866, "loss": 3.1895187377929686, "step": 4740 }, { "epoch": 0.10577777777777778, "grad_norm": 0.46069765090942383, "learning_rate": 0.00014663525685120008, "loss": 3.194733428955078, "step": 4760 }, { "epoch": 0.10622222222222222, "grad_norm": 0.45767131447792053, "learning_rate": 0.00014660382264163358, "loss": 3.1710975646972654, "step": 4780 }, { "epoch": 0.10666666666666667, "grad_norm": 0.49453967809677124, "learning_rate": 0.00014657224568215456, "loss": 3.2196239471435546, "step": 4800 }, { "epoch": 0.10711111111111112, "grad_norm": 0.4364623427391052, "learning_rate": 0.00014654052603571509, "loss": 3.2239658355712892, "step": 4820 }, { "epoch": 0.10755555555555556, "grad_norm": 0.43620210886001587, "learning_rate": 0.0001465086637655517, "loss": 3.2461246490478515, "step": 4840 }, { "epoch": 0.108, "grad_norm": 0.44628360867500305, "learning_rate": 0.00014647665893518518, "loss": 3.201553726196289, "step": 4860 }, { "epoch": 0.10844444444444444, "grad_norm": 0.6283556818962097, "learning_rate": 0.00014644451160842066, "loss": 3.258001708984375, "step": 4880 }, { "epoch": 0.10888888888888888, "grad_norm": 0.46947452425956726, "learning_rate": 0.00014641222184934733, "loss": 3.311473083496094, "step": 4900 }, { "epoch": 0.10933333333333334, "grad_norm": 0.4496892988681793, "learning_rate": 0.0001463797897223382, "loss": 3.2201786041259766, "step": 4920 }, { "epoch": 0.10977777777777778, "grad_norm": 0.4735954999923706, "learning_rate": 0.00014634721529205023, "loss": 3.2269256591796873, "step": 4940 }, { "epoch": 0.11022222222222222, "grad_norm": 0.4686685800552368, "learning_rate": 0.00014631449862342408, "loss": 3.1545198440551756, "step": 4960 }, { "epoch": 0.11066666666666666, "grad_norm": 0.4850025475025177, "learning_rate": 0.0001462816397816839, "loss": 3.1916128158569337, "step": 4980 }, { "epoch": 0.1111111111111111, "grad_norm": 0.44467711448669434, "learning_rate": 0.00014624863883233737, "loss": 3.296238327026367, "step": 5000 }, { "epoch": 0.11155555555555556, "grad_norm": 0.4278726875782013, "learning_rate": 0.00014621549584117538, "loss": 3.2197341918945312, "step": 5020 }, { "epoch": 0.112, "grad_norm": 0.44800201058387756, "learning_rate": 0.00014618221087427208, "loss": 3.1955873489379885, "step": 5040 }, { "epoch": 0.11244444444444444, "grad_norm": 0.7889285683631897, "learning_rate": 0.00014614878399798459, "loss": 3.1953197479248048, "step": 5060 }, { "epoch": 0.11288888888888889, "grad_norm": 0.46701595187187195, "learning_rate": 0.00014611521527895302, "loss": 3.1930301666259764, "step": 5080 }, { "epoch": 0.11333333333333333, "grad_norm": 0.580479621887207, "learning_rate": 0.00014608150478410018, "loss": 3.191876029968262, "step": 5100 }, { "epoch": 0.11377777777777778, "grad_norm": 0.48068711161613464, "learning_rate": 0.00014604765258063157, "loss": 3.2010311126708983, "step": 5120 }, { "epoch": 0.11422222222222222, "grad_norm": 0.480557918548584, "learning_rate": 0.00014601365873603524, "loss": 3.2152126312255858, "step": 5140 }, { "epoch": 0.11466666666666667, "grad_norm": 0.47577980160713196, "learning_rate": 0.0001459795233180815, "loss": 3.180438423156738, "step": 5160 }, { "epoch": 0.11511111111111111, "grad_norm": 0.4441629946231842, "learning_rate": 0.000145945246394823, "loss": 3.158919334411621, "step": 5180 }, { "epoch": 0.11555555555555555, "grad_norm": 0.47655239701271057, "learning_rate": 0.0001459108280345945, "loss": 3.2550262451171874, "step": 5200 }, { "epoch": 0.116, "grad_norm": 0.4978802502155304, "learning_rate": 0.00014587626830601266, "loss": 3.2300640106201173, "step": 5220 }, { "epoch": 0.11644444444444445, "grad_norm": 0.5484026670455933, "learning_rate": 0.00014584156727797605, "loss": 3.2527088165283202, "step": 5240 }, { "epoch": 0.11688888888888889, "grad_norm": 0.4482669234275818, "learning_rate": 0.00014580672501966483, "loss": 3.2293865203857424, "step": 5260 }, { "epoch": 0.11733333333333333, "grad_norm": 0.45747998356819153, "learning_rate": 0.00014577174160054088, "loss": 3.220448684692383, "step": 5280 }, { "epoch": 0.11777777777777777, "grad_norm": 0.4511623680591583, "learning_rate": 0.0001457366170903473, "loss": 3.2540283203125, "step": 5300 }, { "epoch": 0.11822222222222223, "grad_norm": 0.5221858620643616, "learning_rate": 0.00014570135155910865, "loss": 3.2781753540039062, "step": 5320 }, { "epoch": 0.11866666666666667, "grad_norm": 0.44799089431762695, "learning_rate": 0.00014566594507713052, "loss": 3.226374053955078, "step": 5340 }, { "epoch": 0.11911111111111111, "grad_norm": 0.5282427668571472, "learning_rate": 0.00014563039771499958, "loss": 3.196961212158203, "step": 5360 }, { "epoch": 0.11955555555555555, "grad_norm": 0.46396657824516296, "learning_rate": 0.00014559470954358326, "loss": 3.2554805755615233, "step": 5380 }, { "epoch": 0.12, "grad_norm": 0.625439465045929, "learning_rate": 0.00014555888063402976, "loss": 3.164295768737793, "step": 5400 }, { "epoch": 0.12044444444444445, "grad_norm": 0.43783435225486755, "learning_rate": 0.00014552291105776792, "loss": 3.1544946670532226, "step": 5420 }, { "epoch": 0.12088888888888889, "grad_norm": 0.47741207480430603, "learning_rate": 0.00014548680088650692, "loss": 3.227632522583008, "step": 5440 }, { "epoch": 0.12133333333333333, "grad_norm": 0.4600733816623688, "learning_rate": 0.00014545055019223624, "loss": 3.2658519744873047, "step": 5460 }, { "epoch": 0.12177777777777778, "grad_norm": 0.5606860518455505, "learning_rate": 0.00014541415904722557, "loss": 3.181635284423828, "step": 5480 }, { "epoch": 0.12222222222222222, "grad_norm": 0.4462604224681854, "learning_rate": 0.00014537762752402455, "loss": 3.209598159790039, "step": 5500 }, { "epoch": 0.12266666666666666, "grad_norm": 0.6866390109062195, "learning_rate": 0.00014534095569546272, "loss": 3.2540157318115233, "step": 5520 }, { "epoch": 0.12311111111111112, "grad_norm": 0.4729842245578766, "learning_rate": 0.00014530414363464928, "loss": 3.245439147949219, "step": 5540 }, { "epoch": 0.12355555555555556, "grad_norm": 0.46783679723739624, "learning_rate": 0.00014526719141497304, "loss": 3.2365901947021483, "step": 5560 }, { "epoch": 0.124, "grad_norm": 0.45501041412353516, "learning_rate": 0.0001452300991101022, "loss": 3.206534194946289, "step": 5580 }, { "epoch": 0.12444444444444444, "grad_norm": 0.474590539932251, "learning_rate": 0.00014519286679398431, "loss": 3.224322509765625, "step": 5600 }, { "epoch": 0.12488888888888888, "grad_norm": 0.5209236741065979, "learning_rate": 0.00014515549454084594, "loss": 3.1018524169921875, "step": 5620 }, { "epoch": 0.12533333333333332, "grad_norm": 0.5150535106658936, "learning_rate": 0.00014511798242519268, "loss": 3.2113582611083986, "step": 5640 }, { "epoch": 0.12577777777777777, "grad_norm": 0.46810182929039, "learning_rate": 0.00014508033052180902, "loss": 3.191122055053711, "step": 5660 }, { "epoch": 0.12622222222222224, "grad_norm": 0.4673914909362793, "learning_rate": 0.00014504253890575803, "loss": 3.196429443359375, "step": 5680 }, { "epoch": 0.12666666666666668, "grad_norm": 0.44238048791885376, "learning_rate": 0.00014500460765238136, "loss": 3.171088981628418, "step": 5700 }, { "epoch": 0.12711111111111112, "grad_norm": 0.44561734795570374, "learning_rate": 0.00014496653683729907, "loss": 3.1610361099243165, "step": 5720 }, { "epoch": 0.12755555555555556, "grad_norm": 0.4601413309574127, "learning_rate": 0.00014492832653640938, "loss": 3.19616756439209, "step": 5740 }, { "epoch": 0.128, "grad_norm": 0.47111231088638306, "learning_rate": 0.00014488997682588866, "loss": 3.1309431076049803, "step": 5760 }, { "epoch": 0.12844444444444444, "grad_norm": 0.43808022141456604, "learning_rate": 0.00014485148778219114, "loss": 3.212171173095703, "step": 5780 }, { "epoch": 0.1288888888888889, "grad_norm": 0.4717647433280945, "learning_rate": 0.0001448128594820489, "loss": 3.2262546539306642, "step": 5800 }, { "epoch": 0.12933333333333333, "grad_norm": 0.4447265565395355, "learning_rate": 0.0001447740920024716, "loss": 3.186686325073242, "step": 5820 }, { "epoch": 0.12977777777777777, "grad_norm": 0.4754256010055542, "learning_rate": 0.00014473518542074636, "loss": 3.233407211303711, "step": 5840 }, { "epoch": 0.1302222222222222, "grad_norm": 0.49175721406936646, "learning_rate": 0.00014469613981443763, "loss": 3.1972814559936524, "step": 5860 }, { "epoch": 0.13066666666666665, "grad_norm": 0.4555152654647827, "learning_rate": 0.00014465695526138703, "loss": 3.214908981323242, "step": 5880 }, { "epoch": 0.13111111111111112, "grad_norm": 0.44315478205680847, "learning_rate": 0.00014461763183971321, "loss": 3.1543107986450196, "step": 5900 }, { "epoch": 0.13155555555555556, "grad_norm": 0.4695570468902588, "learning_rate": 0.00014457816962781158, "loss": 3.1565223693847657, "step": 5920 }, { "epoch": 0.132, "grad_norm": 0.9257342219352722, "learning_rate": 0.00014453856870435432, "loss": 3.242453384399414, "step": 5940 }, { "epoch": 0.13244444444444445, "grad_norm": 0.44902992248535156, "learning_rate": 0.0001444988291482901, "loss": 3.197645378112793, "step": 5960 }, { "epoch": 0.1328888888888889, "grad_norm": 0.556738555431366, "learning_rate": 0.00014445895103884406, "loss": 3.2306198120117187, "step": 5980 }, { "epoch": 0.13333333333333333, "grad_norm": 0.4576815366744995, "learning_rate": 0.00014441893445551744, "loss": 3.1862377166748046, "step": 6000 }, { "epoch": 0.13377777777777777, "grad_norm": 0.4665937125682831, "learning_rate": 0.0001443787794780876, "loss": 3.246712875366211, "step": 6020 }, { "epoch": 0.13422222222222221, "grad_norm": 0.4366329610347748, "learning_rate": 0.00014433848618660783, "loss": 3.2400737762451173, "step": 6040 }, { "epoch": 0.13466666666666666, "grad_norm": 0.4293994903564453, "learning_rate": 0.0001442980546614071, "loss": 3.2190624237060548, "step": 6060 }, { "epoch": 0.1351111111111111, "grad_norm": 0.4521493911743164, "learning_rate": 0.00014425748498309002, "loss": 3.1341930389404298, "step": 6080 }, { "epoch": 0.13555555555555557, "grad_norm": 0.45834416151046753, "learning_rate": 0.0001442167772325366, "loss": 3.223272705078125, "step": 6100 }, { "epoch": 0.136, "grad_norm": 0.4612223505973816, "learning_rate": 0.00014417593149090212, "loss": 3.1569169998168944, "step": 6120 }, { "epoch": 0.13644444444444445, "grad_norm": 0.43669217824935913, "learning_rate": 0.00014413494783961696, "loss": 3.181291389465332, "step": 6140 }, { "epoch": 0.1368888888888889, "grad_norm": 0.4475366473197937, "learning_rate": 0.00014409382636038637, "loss": 3.1732030868530274, "step": 6160 }, { "epoch": 0.13733333333333334, "grad_norm": 0.4427911639213562, "learning_rate": 0.00014405256713519054, "loss": 3.103558158874512, "step": 6180 }, { "epoch": 0.13777777777777778, "grad_norm": 0.44157102704048157, "learning_rate": 0.00014401117024628407, "loss": 3.1719968795776365, "step": 6200 }, { "epoch": 0.13822222222222222, "grad_norm": 0.4316306710243225, "learning_rate": 0.00014396963577619618, "loss": 3.172272872924805, "step": 6220 }, { "epoch": 0.13866666666666666, "grad_norm": 0.4874098002910614, "learning_rate": 0.00014392796380773023, "loss": 3.1618614196777344, "step": 6240 }, { "epoch": 0.1391111111111111, "grad_norm": 0.48193442821502686, "learning_rate": 0.00014388615442396382, "loss": 3.1742340087890626, "step": 6260 }, { "epoch": 0.13955555555555554, "grad_norm": 0.4783935844898224, "learning_rate": 0.00014384420770824843, "loss": 3.179502487182617, "step": 6280 }, { "epoch": 0.14, "grad_norm": 0.48292383551597595, "learning_rate": 0.00014380212374420933, "loss": 3.2242942810058595, "step": 6300 }, { "epoch": 0.14044444444444446, "grad_norm": 0.46342727541923523, "learning_rate": 0.00014375990261574544, "loss": 3.2213905334472654, "step": 6320 }, { "epoch": 0.1408888888888889, "grad_norm": 0.44609126448631287, "learning_rate": 0.0001437175444070291, "loss": 3.2207828521728517, "step": 6340 }, { "epoch": 0.14133333333333334, "grad_norm": 0.5168944597244263, "learning_rate": 0.00014367504920250598, "loss": 3.246337890625, "step": 6360 }, { "epoch": 0.14177777777777778, "grad_norm": 0.44399183988571167, "learning_rate": 0.00014363241708689482, "loss": 3.275266647338867, "step": 6380 }, { "epoch": 0.14222222222222222, "grad_norm": 0.5032855272293091, "learning_rate": 0.0001435896481451873, "loss": 3.264081573486328, "step": 6400 }, { "epoch": 0.14266666666666666, "grad_norm": 0.46948346495628357, "learning_rate": 0.00014354674246264796, "loss": 3.248103713989258, "step": 6420 }, { "epoch": 0.1431111111111111, "grad_norm": 0.5252745747566223, "learning_rate": 0.0001435037001248138, "loss": 3.204604721069336, "step": 6440 }, { "epoch": 0.14355555555555555, "grad_norm": 0.44080179929733276, "learning_rate": 0.00014346052121749442, "loss": 3.2393447875976564, "step": 6460 }, { "epoch": 0.144, "grad_norm": 0.5272217988967896, "learning_rate": 0.00014341720582677155, "loss": 3.199708938598633, "step": 6480 }, { "epoch": 0.14444444444444443, "grad_norm": 0.5089524388313293, "learning_rate": 0.0001433737540389991, "loss": 3.2157310485839843, "step": 6500 }, { "epoch": 0.1448888888888889, "grad_norm": 0.4520503282546997, "learning_rate": 0.0001433301659408029, "loss": 3.180294418334961, "step": 6520 }, { "epoch": 0.14533333333333334, "grad_norm": 0.4651671051979065, "learning_rate": 0.00014328644161908048, "loss": 3.1775156021118165, "step": 6540 }, { "epoch": 0.14577777777777778, "grad_norm": 0.4689304828643799, "learning_rate": 0.000143242581161001, "loss": 3.2424713134765626, "step": 6560 }, { "epoch": 0.14622222222222223, "grad_norm": 0.471964567899704, "learning_rate": 0.00014319858465400496, "loss": 3.1502920150756837, "step": 6580 }, { "epoch": 0.14666666666666667, "grad_norm": 0.44283661246299744, "learning_rate": 0.00014315445218580415, "loss": 3.2001998901367186, "step": 6600 }, { "epoch": 0.1471111111111111, "grad_norm": 0.5364190340042114, "learning_rate": 0.00014311018384438135, "loss": 3.197841453552246, "step": 6620 }, { "epoch": 0.14755555555555555, "grad_norm": 0.5220893025398254, "learning_rate": 0.0001430657797179903, "loss": 3.1643524169921875, "step": 6640 }, { "epoch": 0.148, "grad_norm": 0.4660756289958954, "learning_rate": 0.00014302123989515535, "loss": 3.180074691772461, "step": 6660 }, { "epoch": 0.14844444444444443, "grad_norm": 0.44047045707702637, "learning_rate": 0.00014297656446467144, "loss": 3.1517871856689452, "step": 6680 }, { "epoch": 0.14888888888888888, "grad_norm": 0.44566479325294495, "learning_rate": 0.00014293175351560387, "loss": 3.13958797454834, "step": 6700 }, { "epoch": 0.14933333333333335, "grad_norm": 0.4864153265953064, "learning_rate": 0.00014288680713728805, "loss": 3.1510459899902346, "step": 6720 }, { "epoch": 0.1497777777777778, "grad_norm": 0.4525631368160248, "learning_rate": 0.00014284172541932942, "loss": 3.1826549530029298, "step": 6740 }, { "epoch": 0.15022222222222223, "grad_norm": 0.44795510172843933, "learning_rate": 0.00014279650845160321, "loss": 3.198468780517578, "step": 6760 }, { "epoch": 0.15066666666666667, "grad_norm": 0.48972034454345703, "learning_rate": 0.00014275115632425437, "loss": 3.1678110122680665, "step": 6780 }, { "epoch": 0.1511111111111111, "grad_norm": 0.4844519793987274, "learning_rate": 0.00014270566912769715, "loss": 3.1859018325805666, "step": 6800 }, { "epoch": 0.15155555555555555, "grad_norm": 0.4583846628665924, "learning_rate": 0.00014266004695261518, "loss": 3.150168037414551, "step": 6820 }, { "epoch": 0.152, "grad_norm": 0.45687735080718994, "learning_rate": 0.00014261428988996124, "loss": 3.2176143646240236, "step": 6840 }, { "epoch": 0.15244444444444444, "grad_norm": 0.4774504601955414, "learning_rate": 0.00014256839803095686, "loss": 3.241961669921875, "step": 6860 }, { "epoch": 0.15288888888888888, "grad_norm": 0.4882252812385559, "learning_rate": 0.00014252237146709245, "loss": 3.189226531982422, "step": 6880 }, { "epoch": 0.15333333333333332, "grad_norm": 0.46765080094337463, "learning_rate": 0.0001424762102901269, "loss": 3.233798599243164, "step": 6900 }, { "epoch": 0.1537777777777778, "grad_norm": 0.46064749360084534, "learning_rate": 0.00014242991459208744, "loss": 3.233529281616211, "step": 6920 }, { "epoch": 0.15422222222222223, "grad_norm": 0.500286340713501, "learning_rate": 0.00014238348446526955, "loss": 3.2048763275146483, "step": 6940 }, { "epoch": 0.15466666666666667, "grad_norm": 0.4983065724372864, "learning_rate": 0.00014233692000223665, "loss": 3.231466293334961, "step": 6960 }, { "epoch": 0.15511111111111112, "grad_norm": 0.5212306380271912, "learning_rate": 0.00014229022129582004, "loss": 3.235833740234375, "step": 6980 }, { "epoch": 0.15555555555555556, "grad_norm": 0.4826495051383972, "learning_rate": 0.00014224338843911856, "loss": 3.2368419647216795, "step": 7000 }, { "epoch": 0.156, "grad_norm": 0.4858686029911041, "learning_rate": 0.00014219642152549857, "loss": 3.288930892944336, "step": 7020 }, { "epoch": 0.15644444444444444, "grad_norm": 0.5357473492622375, "learning_rate": 0.00014214932064859367, "loss": 3.2147579193115234, "step": 7040 }, { "epoch": 0.15688888888888888, "grad_norm": 0.4566601514816284, "learning_rate": 0.00014210208590230446, "loss": 3.253256607055664, "step": 7060 }, { "epoch": 0.15733333333333333, "grad_norm": 0.4568151533603668, "learning_rate": 0.00014205471738079858, "loss": 3.208812713623047, "step": 7080 }, { "epoch": 0.15777777777777777, "grad_norm": 0.4708445966243744, "learning_rate": 0.00014200721517851017, "loss": 3.160601806640625, "step": 7100 }, { "epoch": 0.1582222222222222, "grad_norm": 0.4495849013328552, "learning_rate": 0.00014195957939014002, "loss": 3.1883201599121094, "step": 7120 }, { "epoch": 0.15866666666666668, "grad_norm": 0.4833003580570221, "learning_rate": 0.00014191181011065517, "loss": 3.209871292114258, "step": 7140 }, { "epoch": 0.15911111111111112, "grad_norm": 0.43168163299560547, "learning_rate": 0.00014186390743528885, "loss": 3.210647201538086, "step": 7160 }, { "epoch": 0.15955555555555556, "grad_norm": 0.4708026349544525, "learning_rate": 0.00014181587145954013, "loss": 3.1830673217773438, "step": 7180 }, { "epoch": 0.16, "grad_norm": 0.4427180588245392, "learning_rate": 0.00014176770227917394, "loss": 3.2198902130126954, "step": 7200 }, { "epoch": 0.16044444444444445, "grad_norm": 0.4427896738052368, "learning_rate": 0.0001417193999902207, "loss": 3.2056446075439453, "step": 7220 }, { "epoch": 0.1608888888888889, "grad_norm": 0.45977112650871277, "learning_rate": 0.00014167096468897618, "loss": 3.2209922790527346, "step": 7240 }, { "epoch": 0.16133333333333333, "grad_norm": 0.4678868353366852, "learning_rate": 0.0001416223964720014, "loss": 3.137177848815918, "step": 7260 }, { "epoch": 0.16177777777777777, "grad_norm": 0.4499399662017822, "learning_rate": 0.0001415736954361223, "loss": 3.1637380599975584, "step": 7280 }, { "epoch": 0.1622222222222222, "grad_norm": 0.5418245196342468, "learning_rate": 0.00014152486167842964, "loss": 3.1573974609375, "step": 7300 }, { "epoch": 0.16266666666666665, "grad_norm": 0.47254660725593567, "learning_rate": 0.00014147589529627875, "loss": 3.155618095397949, "step": 7320 }, { "epoch": 0.16311111111111112, "grad_norm": 0.4802646338939667, "learning_rate": 0.00014142679638728936, "loss": 3.1851667404174804, "step": 7340 }, { "epoch": 0.16355555555555557, "grad_norm": 0.5078751444816589, "learning_rate": 0.00014137756504934543, "loss": 3.109396553039551, "step": 7360 }, { "epoch": 0.164, "grad_norm": 0.5291840434074402, "learning_rate": 0.00014132820138059492, "loss": 3.1485904693603515, "step": 7380 }, { "epoch": 0.16444444444444445, "grad_norm": 0.49084246158599854, "learning_rate": 0.00014127870547944962, "loss": 3.2375328063964846, "step": 7400 }, { "epoch": 0.1648888888888889, "grad_norm": 0.5139070153236389, "learning_rate": 0.00014122907744458494, "loss": 3.2759769439697264, "step": 7420 }, { "epoch": 0.16533333333333333, "grad_norm": 6.400476932525635, "learning_rate": 0.00014117931737493963, "loss": 3.1718652725219725, "step": 7440 }, { "epoch": 0.16577777777777777, "grad_norm": 0.8315669298171997, "learning_rate": 0.0001411294253697158, "loss": 3.0809513092041017, "step": 7460 }, { "epoch": 0.16622222222222222, "grad_norm": 0.4860391914844513, "learning_rate": 0.0001410794015283785, "loss": 3.242574691772461, "step": 7480 }, { "epoch": 0.16666666666666666, "grad_norm": 0.5168259739875793, "learning_rate": 0.00014102924595065566, "loss": 3.232664108276367, "step": 7500 }, { "epoch": 0.1671111111111111, "grad_norm": 0.45953169465065, "learning_rate": 0.00014097895873653774, "loss": 3.227385711669922, "step": 7520 }, { "epoch": 0.16755555555555557, "grad_norm": 0.5139103531837463, "learning_rate": 0.00014092853998627777, "loss": 3.2735107421875, "step": 7540 }, { "epoch": 0.168, "grad_norm": 0.4912737011909485, "learning_rate": 0.00014087798980039093, "loss": 3.1870044708251952, "step": 7560 }, { "epoch": 0.16844444444444445, "grad_norm": 0.45814642310142517, "learning_rate": 0.0001408273082796544, "loss": 3.213631820678711, "step": 7580 }, { "epoch": 0.1688888888888889, "grad_norm": 0.4608581066131592, "learning_rate": 0.00014077649552510734, "loss": 3.2406402587890626, "step": 7600 }, { "epoch": 0.16933333333333334, "grad_norm": 0.4913986623287201, "learning_rate": 0.00014072555163805036, "loss": 3.2200984954833984, "step": 7620 }, { "epoch": 0.16977777777777778, "grad_norm": 0.47340869903564453, "learning_rate": 0.00014067447672004555, "loss": 3.199324035644531, "step": 7640 }, { "epoch": 0.17022222222222222, "grad_norm": 0.48123660683631897, "learning_rate": 0.00014062327087291626, "loss": 3.205300140380859, "step": 7660 }, { "epoch": 0.17066666666666666, "grad_norm": 0.45687246322631836, "learning_rate": 0.0001405719341987469, "loss": 3.190545654296875, "step": 7680 }, { "epoch": 0.1711111111111111, "grad_norm": 0.4392889738082886, "learning_rate": 0.00014052046679988262, "loss": 3.2179519653320314, "step": 7700 }, { "epoch": 0.17155555555555554, "grad_norm": 0.4522570073604584, "learning_rate": 0.00014046886877892918, "loss": 3.165958595275879, "step": 7720 }, { "epoch": 0.172, "grad_norm": 0.4553944766521454, "learning_rate": 0.0001404171402387528, "loss": 3.211654281616211, "step": 7740 }, { "epoch": 0.17244444444444446, "grad_norm": 0.4623655378818512, "learning_rate": 0.00014036528128247985, "loss": 3.2386489868164063, "step": 7760 }, { "epoch": 0.1728888888888889, "grad_norm": 0.46499407291412354, "learning_rate": 0.00014031329201349678, "loss": 3.206338119506836, "step": 7780 }, { "epoch": 0.17333333333333334, "grad_norm": 0.5669381022453308, "learning_rate": 0.0001402611725354498, "loss": 3.2185150146484376, "step": 7800 }, { "epoch": 0.17377777777777778, "grad_norm": 0.4446219801902771, "learning_rate": 0.0001402089229522446, "loss": 3.1521705627441405, "step": 7820 }, { "epoch": 0.17422222222222222, "grad_norm": 0.4553963243961334, "learning_rate": 0.00014015654336804642, "loss": 3.1520723342895507, "step": 7840 }, { "epoch": 0.17466666666666666, "grad_norm": 0.4424580931663513, "learning_rate": 0.0001401040338872795, "loss": 3.157762336730957, "step": 7860 }, { "epoch": 0.1751111111111111, "grad_norm": 0.5282416343688965, "learning_rate": 0.00014005139461462722, "loss": 3.1652385711669924, "step": 7880 }, { "epoch": 0.17555555555555555, "grad_norm": 0.4637663662433624, "learning_rate": 0.00013999862565503162, "loss": 3.198106575012207, "step": 7900 }, { "epoch": 0.176, "grad_norm": 0.4382156431674957, "learning_rate": 0.00013994572711369322, "loss": 3.1545337677001952, "step": 7920 }, { "epoch": 0.17644444444444443, "grad_norm": 0.46246689558029175, "learning_rate": 0.00013989269909607099, "loss": 3.11791934967041, "step": 7940 }, { "epoch": 0.1768888888888889, "grad_norm": 0.5010555982589722, "learning_rate": 0.00013983954170788198, "loss": 3.2244075775146483, "step": 7960 }, { "epoch": 0.17733333333333334, "grad_norm": 0.5009114146232605, "learning_rate": 0.00013978625505510115, "loss": 3.2503635406494142, "step": 7980 }, { "epoch": 0.17777777777777778, "grad_norm": 0.4728047549724579, "learning_rate": 0.00013973283924396116, "loss": 3.2232902526855467, "step": 8000 } ], "logging_steps": 20, "max_steps": 45000, "num_input_tokens_seen": 0, "num_train_epochs": 9223372036854775807, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.37554909577216e+17, "train_batch_size": 64, "trial_name": null, "trial_params": null }