Hydrion-v1-Base / trainer_state.json
TeamNull's picture
Upload folder using huggingface_hub
68d1fc9 verified
Raw
History Blame Contribute Delete
75 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.17777777777777778,
"eval_steps": 500,
"global_step": 8000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.00044444444444444447,
"grad_norm": 0.4511776566505432,
"learning_rate": 5.7e-06,
"loss": 3.2161075592041017,
"step": 20
},
{
"epoch": 0.0008888888888888889,
"grad_norm": 0.44093042612075806,
"learning_rate": 1.17e-05,
"loss": 3.201356887817383,
"step": 40
},
{
"epoch": 0.0013333333333333333,
"grad_norm": 0.4689347743988037,
"learning_rate": 1.7699999999999997e-05,
"loss": 3.2072242736816405,
"step": 60
},
{
"epoch": 0.0017777777777777779,
"grad_norm": 0.4622272253036499,
"learning_rate": 2.3699999999999997e-05,
"loss": 3.1648168563842773,
"step": 80
},
{
"epoch": 0.0022222222222222222,
"grad_norm": 0.4848445653915405,
"learning_rate": 2.97e-05,
"loss": 3.2546276092529296,
"step": 100
},
{
"epoch": 0.0026666666666666666,
"grad_norm": 0.4572749137878418,
"learning_rate": 3.5699999999999994e-05,
"loss": 3.200400161743164,
"step": 120
},
{
"epoch": 0.003111111111111111,
"grad_norm": 0.47524744272232056,
"learning_rate": 4.17e-05,
"loss": 3.186128044128418,
"step": 140
},
{
"epoch": 0.0035555555555555557,
"grad_norm": 0.4501917362213135,
"learning_rate": 4.7699999999999994e-05,
"loss": 3.2226837158203123,
"step": 160
},
{
"epoch": 0.004,
"grad_norm": 0.5257205963134766,
"learning_rate": 5.369999999999999e-05,
"loss": 3.164937210083008,
"step": 180
},
{
"epoch": 0.0044444444444444444,
"grad_norm": 0.5314930081367493,
"learning_rate": 5.97e-05,
"loss": 3.281321716308594,
"step": 200
},
{
"epoch": 0.004888888888888889,
"grad_norm": 0.4933965802192688,
"learning_rate": 6.57e-05,
"loss": 3.2729015350341797,
"step": 220
},
{
"epoch": 0.005333333333333333,
"grad_norm": 0.5019872784614563,
"learning_rate": 7.17e-05,
"loss": 3.2970985412597655,
"step": 240
},
{
"epoch": 0.0057777777777777775,
"grad_norm": 0.5201398134231567,
"learning_rate": 7.769999999999999e-05,
"loss": 3.2776580810546876,
"step": 260
},
{
"epoch": 0.006222222222222222,
"grad_norm": 0.4757533669471741,
"learning_rate": 8.37e-05,
"loss": 3.2021453857421873,
"step": 280
},
{
"epoch": 0.006666666666666667,
"grad_norm": 0.5352882146835327,
"learning_rate": 8.969999999999998e-05,
"loss": 3.247829818725586,
"step": 300
},
{
"epoch": 0.0071111111111111115,
"grad_norm": 0.4869779646396637,
"learning_rate": 9.57e-05,
"loss": 3.241053009033203,
"step": 320
},
{
"epoch": 0.007555555555555556,
"grad_norm": 0.468607097864151,
"learning_rate": 0.00010169999999999999,
"loss": 3.2389141082763673,
"step": 340
},
{
"epoch": 0.008,
"grad_norm": 0.4561017155647278,
"learning_rate": 0.00010769999999999999,
"loss": 3.1932161331176756,
"step": 360
},
{
"epoch": 0.008444444444444444,
"grad_norm": 0.4775182902812958,
"learning_rate": 0.00011369999999999999,
"loss": 3.2328330993652346,
"step": 380
},
{
"epoch": 0.008888888888888889,
"grad_norm": 0.48155900835990906,
"learning_rate": 0.0001197,
"loss": 3.235352325439453,
"step": 400
},
{
"epoch": 0.009333333333333334,
"grad_norm": 0.5080763101577759,
"learning_rate": 0.0001257,
"loss": 3.2805110931396486,
"step": 420
},
{
"epoch": 0.009777777777777778,
"grad_norm": 0.4807881712913513,
"learning_rate": 0.00013169999999999998,
"loss": 3.2630645751953127,
"step": 440
},
{
"epoch": 0.010222222222222223,
"grad_norm": 0.5513017773628235,
"learning_rate": 0.00013769999999999999,
"loss": 3.248635101318359,
"step": 460
},
{
"epoch": 0.010666666666666666,
"grad_norm": 0.4453672468662262,
"learning_rate": 0.00014369999999999997,
"loss": 3.2130226135253905,
"step": 480
},
{
"epoch": 0.011111111111111112,
"grad_norm": 0.46986159682273865,
"learning_rate": 0.00014969999999999998,
"loss": 3.2899818420410156,
"step": 500
},
{
"epoch": 0.011555555555555555,
"grad_norm": 0.45752519369125366,
"learning_rate": 0.0001499999325288476,
"loss": 3.294172668457031,
"step": 520
},
{
"epoch": 0.012,
"grad_norm": 0.4956851005554199,
"learning_rate": 0.0001499997157241735,
"loss": 3.264346694946289,
"step": 540
},
{
"epoch": 0.012444444444444444,
"grad_norm": 0.49039188027381897,
"learning_rate": 0.00014999934939950921,
"loss": 3.2950061798095702,
"step": 560
},
{
"epoch": 0.012888888888888889,
"grad_norm": 0.552381157875061,
"learning_rate": 0.00014999883355558505,
"loss": 3.2415611267089846,
"step": 580
},
{
"epoch": 0.013333333333333334,
"grad_norm": 0.46296975016593933,
"learning_rate": 0.00014999816819342944,
"loss": 3.255002975463867,
"step": 600
},
{
"epoch": 0.013777777777777778,
"grad_norm": 0.5508076548576355,
"learning_rate": 0.00014999735331436878,
"loss": 3.1999645233154297,
"step": 620
},
{
"epoch": 0.014222222222222223,
"grad_norm": 0.4961799085140228,
"learning_rate": 0.00014999638892002764,
"loss": 3.1514266967773437,
"step": 640
},
{
"epoch": 0.014666666666666666,
"grad_norm": 0.4749923646450043,
"learning_rate": 0.00014999527501232868,
"loss": 3.2499130249023436,
"step": 660
},
{
"epoch": 0.015111111111111112,
"grad_norm": 0.5820915102958679,
"learning_rate": 0.00014999401159349255,
"loss": 3.256272888183594,
"step": 680
},
{
"epoch": 0.015555555555555555,
"grad_norm": 0.4775523245334625,
"learning_rate": 0.00014999259866603804,
"loss": 3.262600326538086,
"step": 700
},
{
"epoch": 0.016,
"grad_norm": 0.5320135354995728,
"learning_rate": 0.00014999103623278197,
"loss": 3.1844825744628906,
"step": 720
},
{
"epoch": 0.016444444444444446,
"grad_norm": 0.47456520795822144,
"learning_rate": 0.0001499893242968392,
"loss": 3.1583158493041994,
"step": 740
},
{
"epoch": 0.016888888888888887,
"grad_norm": 0.4774903357028961,
"learning_rate": 0.00014998746286162267,
"loss": 3.244768524169922,
"step": 760
},
{
"epoch": 0.017333333333333333,
"grad_norm": 0.48431041836738586,
"learning_rate": 0.00014998545193084338,
"loss": 3.2968166351318358,
"step": 780
},
{
"epoch": 0.017777777777777778,
"grad_norm": 0.4681703746318817,
"learning_rate": 0.00014998329150851027,
"loss": 3.249764633178711,
"step": 800
},
{
"epoch": 0.018222222222222223,
"grad_norm": 0.45024555921554565,
"learning_rate": 0.00014998098159893042,
"loss": 3.2845108032226564,
"step": 820
},
{
"epoch": 0.018666666666666668,
"grad_norm": 0.4507620334625244,
"learning_rate": 0.00014997852220670888,
"loss": 3.2801742553710938,
"step": 840
},
{
"epoch": 0.01911111111111111,
"grad_norm": 0.4610176682472229,
"learning_rate": 0.00014997591333674873,
"loss": 3.274794006347656,
"step": 860
},
{
"epoch": 0.019555555555555555,
"grad_norm": 0.4393482208251953,
"learning_rate": 0.000149973154994251,
"loss": 3.270203399658203,
"step": 880
},
{
"epoch": 0.02,
"grad_norm": 0.4708148241043091,
"learning_rate": 0.00014997024718471473,
"loss": 3.2781902313232423,
"step": 900
},
{
"epoch": 0.020444444444444446,
"grad_norm": 0.45222797989845276,
"learning_rate": 0.000149967189913937,
"loss": 3.2682468414306642,
"step": 920
},
{
"epoch": 0.020888888888888887,
"grad_norm": 0.43749532103538513,
"learning_rate": 0.00014996398318801275,
"loss": 3.2331676483154297,
"step": 940
},
{
"epoch": 0.021333333333333333,
"grad_norm": 0.4368564486503601,
"learning_rate": 0.00014996062701333498,
"loss": 3.2656929016113283,
"step": 960
},
{
"epoch": 0.021777777777777778,
"grad_norm": 0.4446834623813629,
"learning_rate": 0.00014995712139659456,
"loss": 3.2684513092041017,
"step": 980
},
{
"epoch": 0.022222222222222223,
"grad_norm": 0.4783112704753876,
"learning_rate": 0.00014995346634478032,
"loss": 3.0523948669433594,
"step": 1000
},
{
"epoch": 0.02266666666666667,
"grad_norm": 0.5712579488754272,
"learning_rate": 0.000149949661865179,
"loss": 3.264796829223633,
"step": 1020
},
{
"epoch": 0.02311111111111111,
"grad_norm": 0.5574910044670105,
"learning_rate": 0.00014994570796537525,
"loss": 3.1938405990600587,
"step": 1040
},
{
"epoch": 0.023555555555555555,
"grad_norm": 0.47714975476264954,
"learning_rate": 0.00014994160465325157,
"loss": 3.1733489990234376,
"step": 1060
},
{
"epoch": 0.024,
"grad_norm": 0.5303850173950195,
"learning_rate": 0.00014993735193698837,
"loss": 3.2493263244628907,
"step": 1080
},
{
"epoch": 0.024444444444444446,
"grad_norm": 0.45851755142211914,
"learning_rate": 0.0001499329498250639,
"loss": 3.2284214019775392,
"step": 1100
},
{
"epoch": 0.024888888888888887,
"grad_norm": 0.46116310358047485,
"learning_rate": 0.00014992839832625424,
"loss": 3.2240779876708983,
"step": 1120
},
{
"epoch": 0.025333333333333333,
"grad_norm": 0.47025495767593384,
"learning_rate": 0.00014992369744963328,
"loss": 3.2619400024414062,
"step": 1140
},
{
"epoch": 0.025777777777777778,
"grad_norm": 0.49180319905281067,
"learning_rate": 0.00014991884720457274,
"loss": 3.1931442260742187,
"step": 1160
},
{
"epoch": 0.026222222222222223,
"grad_norm": 0.464128702878952,
"learning_rate": 0.0001499138476007421,
"loss": 3.2129077911376953,
"step": 1180
},
{
"epoch": 0.02666666666666667,
"grad_norm": 0.4527023434638977,
"learning_rate": 0.00014990869864810855,
"loss": 3.183033561706543,
"step": 1200
},
{
"epoch": 0.02711111111111111,
"grad_norm": 0.4221210777759552,
"learning_rate": 0.0001499034003569372,
"loss": 3.169704055786133,
"step": 1220
},
{
"epoch": 0.027555555555555555,
"grad_norm": 0.4447830021381378,
"learning_rate": 0.00014989795273779064,
"loss": 3.248243713378906,
"step": 1240
},
{
"epoch": 0.028,
"grad_norm": 0.4672100245952606,
"learning_rate": 0.00014989235580152937,
"loss": 3.204691696166992,
"step": 1260
},
{
"epoch": 0.028444444444444446,
"grad_norm": 0.4576936364173889,
"learning_rate": 0.00014988660955931143,
"loss": 3.2274940490722654,
"step": 1280
},
{
"epoch": 0.028888888888888888,
"grad_norm": 0.4463963508605957,
"learning_rate": 0.00014988071402259262,
"loss": 3.159174919128418,
"step": 1300
},
{
"epoch": 0.029333333333333333,
"grad_norm": 0.4741155505180359,
"learning_rate": 0.0001498746692031263,
"loss": 3.1926496505737303,
"step": 1320
},
{
"epoch": 0.029777777777777778,
"grad_norm": 0.4806189239025116,
"learning_rate": 0.00014986847511296345,
"loss": 3.253347396850586,
"step": 1340
},
{
"epoch": 0.030222222222222223,
"grad_norm": 0.49649766087532043,
"learning_rate": 0.00014986213176445266,
"loss": 3.2681900024414063,
"step": 1360
},
{
"epoch": 0.030666666666666665,
"grad_norm": 0.46470171213150024,
"learning_rate": 0.0001498556391702401,
"loss": 3.258492279052734,
"step": 1380
},
{
"epoch": 0.03111111111111111,
"grad_norm": 0.4878062605857849,
"learning_rate": 0.00014984899734326947,
"loss": 3.2820438385009765,
"step": 1400
},
{
"epoch": 0.03155555555555556,
"grad_norm": 0.46043869853019714,
"learning_rate": 0.0001498422062967819,
"loss": 3.274037551879883,
"step": 1420
},
{
"epoch": 0.032,
"grad_norm": 0.6005187630653381,
"learning_rate": 0.00014983526604431613,
"loss": 3.260797119140625,
"step": 1440
},
{
"epoch": 0.03244444444444444,
"grad_norm": 0.6328933835029602,
"learning_rate": 0.00014982817659970826,
"loss": 3.2706462860107424,
"step": 1460
},
{
"epoch": 0.03288888888888889,
"grad_norm": 0.46984460949897766,
"learning_rate": 0.00014982093797709188,
"loss": 3.2529743194580076,
"step": 1480
},
{
"epoch": 0.03333333333333333,
"grad_norm": 0.4528060853481293,
"learning_rate": 0.00014981355019089796,
"loss": 3.2241920471191405,
"step": 1500
},
{
"epoch": 0.033777777777777775,
"grad_norm": 0.43708541989326477,
"learning_rate": 0.00014980601325585482,
"loss": 3.2406337738037108,
"step": 1520
},
{
"epoch": 0.03422222222222222,
"grad_norm": 0.5542400479316711,
"learning_rate": 0.00014979832718698823,
"loss": 3.2768516540527344,
"step": 1540
},
{
"epoch": 0.034666666666666665,
"grad_norm": 0.47203993797302246,
"learning_rate": 0.0001497904919996211,
"loss": 3.265271759033203,
"step": 1560
},
{
"epoch": 0.035111111111111114,
"grad_norm": 0.621870219707489,
"learning_rate": 0.00014978250770937373,
"loss": 3.283491516113281,
"step": 1580
},
{
"epoch": 0.035555555555555556,
"grad_norm": 0.45592767000198364,
"learning_rate": 0.00014977437433216374,
"loss": 3.2492713928222656,
"step": 1600
},
{
"epoch": 0.036,
"grad_norm": 0.44699525833129883,
"learning_rate": 0.0001497660918842058,
"loss": 3.2586002349853516,
"step": 1620
},
{
"epoch": 0.036444444444444446,
"grad_norm": 0.44761922955513,
"learning_rate": 0.0001497576603820119,
"loss": 3.310761642456055,
"step": 1640
},
{
"epoch": 0.03688888888888889,
"grad_norm": 0.44739192724227905,
"learning_rate": 0.00014974907984239113,
"loss": 3.196021842956543,
"step": 1660
},
{
"epoch": 0.037333333333333336,
"grad_norm": 0.43892452120780945,
"learning_rate": 0.00014974035028244976,
"loss": 3.2814334869384765,
"step": 1680
},
{
"epoch": 0.03777777777777778,
"grad_norm": 0.478014200925827,
"learning_rate": 0.00014973147171959105,
"loss": 3.265171432495117,
"step": 1700
},
{
"epoch": 0.03822222222222222,
"grad_norm": 0.5787922143936157,
"learning_rate": 0.0001497224441715154,
"loss": 3.195718002319336,
"step": 1720
},
{
"epoch": 0.03866666666666667,
"grad_norm": 0.4398203194141388,
"learning_rate": 0.00014971326765622018,
"loss": 3.144413375854492,
"step": 1740
},
{
"epoch": 0.03911111111111111,
"grad_norm": 0.48114529252052307,
"learning_rate": 0.0001497039421919998,
"loss": 3.1378915786743162,
"step": 1760
},
{
"epoch": 0.03955555555555555,
"grad_norm": 0.44224387407302856,
"learning_rate": 0.00014969446779744552,
"loss": 3.2676132202148436,
"step": 1780
},
{
"epoch": 0.04,
"grad_norm": 0.489261269569397,
"learning_rate": 0.00014968484449144558,
"loss": 3.091619300842285,
"step": 1800
},
{
"epoch": 0.04044444444444444,
"grad_norm": 0.44093602895736694,
"learning_rate": 0.0001496750722931851,
"loss": 3.1997377395629885,
"step": 1820
},
{
"epoch": 0.04088888888888889,
"grad_norm": 0.43990451097488403,
"learning_rate": 0.00014966515122214597,
"loss": 3.2633441925048827,
"step": 1840
},
{
"epoch": 0.04133333333333333,
"grad_norm": 0.4617629051208496,
"learning_rate": 0.00014965508129810695,
"loss": 3.1695838928222657,
"step": 1860
},
{
"epoch": 0.041777777777777775,
"grad_norm": 0.46426230669021606,
"learning_rate": 0.00014964486254114348,
"loss": 3.218312072753906,
"step": 1880
},
{
"epoch": 0.042222222222222223,
"grad_norm": 0.43642115592956543,
"learning_rate": 0.00014963449497162778,
"loss": 3.2762382507324217,
"step": 1900
},
{
"epoch": 0.042666666666666665,
"grad_norm": 0.44940701127052307,
"learning_rate": 0.00014962397861022867,
"loss": 3.2622085571289063,
"step": 1920
},
{
"epoch": 0.043111111111111114,
"grad_norm": 0.4700528383255005,
"learning_rate": 0.0001496133134779117,
"loss": 3.280713653564453,
"step": 1940
},
{
"epoch": 0.043555555555555556,
"grad_norm": 0.4469633102416992,
"learning_rate": 0.0001496024995959389,
"loss": 3.273088073730469,
"step": 1960
},
{
"epoch": 0.044,
"grad_norm": 0.46984365582466125,
"learning_rate": 0.00014959153698586896,
"loss": 3.3301361083984373,
"step": 1980
},
{
"epoch": 0.044444444444444446,
"grad_norm": 0.6420442461967468,
"learning_rate": 0.000149580425669557,
"loss": 3.2632827758789062,
"step": 2000
},
{
"epoch": 0.04488888888888889,
"grad_norm": 0.48015037178993225,
"learning_rate": 0.00014956916566915461,
"loss": 3.2271102905273437,
"step": 2020
},
{
"epoch": 0.04533333333333334,
"grad_norm": 0.47737839818000793,
"learning_rate": 0.00014955775700710983,
"loss": 3.2571079254150392,
"step": 2040
},
{
"epoch": 0.04577777777777778,
"grad_norm": 0.47588035464286804,
"learning_rate": 0.00014954619970616704,
"loss": 3.2312530517578124,
"step": 2060
},
{
"epoch": 0.04622222222222222,
"grad_norm": 0.4254153370857239,
"learning_rate": 0.00014953449378936695,
"loss": 3.246951675415039,
"step": 2080
},
{
"epoch": 0.04666666666666667,
"grad_norm": 0.5118470788002014,
"learning_rate": 0.00014952263928004662,
"loss": 3.2460872650146486,
"step": 2100
},
{
"epoch": 0.04711111111111111,
"grad_norm": 0.44925907254219055,
"learning_rate": 0.0001495106362018392,
"loss": 3.199997329711914,
"step": 2120
},
{
"epoch": 0.04755555555555555,
"grad_norm": 0.47085729241371155,
"learning_rate": 0.0001494984845786742,
"loss": 3.2512306213378905,
"step": 2140
},
{
"epoch": 0.048,
"grad_norm": 0.4463195204734802,
"learning_rate": 0.0001494861844347771,
"loss": 3.2025390625,
"step": 2160
},
{
"epoch": 0.04844444444444444,
"grad_norm": 0.4751906991004944,
"learning_rate": 0.00014947373579466962,
"loss": 3.224716567993164,
"step": 2180
},
{
"epoch": 0.04888888888888889,
"grad_norm": 0.4598497152328491,
"learning_rate": 0.00014946113868316948,
"loss": 3.1804378509521483,
"step": 2200
},
{
"epoch": 0.04933333333333333,
"grad_norm": 0.5118657946586609,
"learning_rate": 0.0001494483931253903,
"loss": 3.2649372100830076,
"step": 2220
},
{
"epoch": 0.049777777777777775,
"grad_norm": 0.4563441276550293,
"learning_rate": 0.0001494354991467418,
"loss": 3.2689468383789064,
"step": 2240
},
{
"epoch": 0.050222222222222224,
"grad_norm": 0.4234507083892822,
"learning_rate": 0.00014942245677292945,
"loss": 3.221723937988281,
"step": 2260
},
{
"epoch": 0.050666666666666665,
"grad_norm": 0.4410296082496643,
"learning_rate": 0.00014940926602995464,
"loss": 3.2029151916503906,
"step": 2280
},
{
"epoch": 0.051111111111111114,
"grad_norm": 0.43239203095436096,
"learning_rate": 0.00014939592694411454,
"loss": 3.232569122314453,
"step": 2300
},
{
"epoch": 0.051555555555555556,
"grad_norm": 0.4741559326648712,
"learning_rate": 0.00014938243954200207,
"loss": 3.204850769042969,
"step": 2320
},
{
"epoch": 0.052,
"grad_norm": 0.46059247851371765,
"learning_rate": 0.00014936880385050578,
"loss": 3.1890140533447267,
"step": 2340
},
{
"epoch": 0.052444444444444446,
"grad_norm": 0.4493935704231262,
"learning_rate": 0.00014935501989680986,
"loss": 3.190713882446289,
"step": 2360
},
{
"epoch": 0.05288888888888889,
"grad_norm": 0.45153337717056274,
"learning_rate": 0.0001493410877083942,
"loss": 3.18747501373291,
"step": 2380
},
{
"epoch": 0.05333333333333334,
"grad_norm": 0.4542306363582611,
"learning_rate": 0.00014932700731303404,
"loss": 3.206298065185547,
"step": 2400
},
{
"epoch": 0.05377777777777778,
"grad_norm": 0.47714149951934814,
"learning_rate": 0.00014931277873880017,
"loss": 3.1353384017944337,
"step": 2420
},
{
"epoch": 0.05422222222222222,
"grad_norm": 0.4965257942676544,
"learning_rate": 0.00014929840201405878,
"loss": 3.2254898071289064,
"step": 2440
},
{
"epoch": 0.05466666666666667,
"grad_norm": 0.44981348514556885,
"learning_rate": 0.00014928387716747144,
"loss": 3.2872825622558595,
"step": 2460
},
{
"epoch": 0.05511111111111111,
"grad_norm": 0.46337834000587463,
"learning_rate": 0.00014926920422799497,
"loss": 3.3067367553710936,
"step": 2480
},
{
"epoch": 0.05555555555555555,
"grad_norm": 0.4484391212463379,
"learning_rate": 0.00014925438322488147,
"loss": 3.246139907836914,
"step": 2500
},
{
"epoch": 0.056,
"grad_norm": 0.49288684129714966,
"learning_rate": 0.00014923941418767817,
"loss": 3.277478790283203,
"step": 2520
},
{
"epoch": 0.05644444444444444,
"grad_norm": 0.4538717269897461,
"learning_rate": 0.00014922429714622748,
"loss": 3.274536895751953,
"step": 2540
},
{
"epoch": 0.05688888888888889,
"grad_norm": 0.4540354907512665,
"learning_rate": 0.00014920903213066683,
"loss": 3.2235836029052733,
"step": 2560
},
{
"epoch": 0.05733333333333333,
"grad_norm": 0.45585209131240845,
"learning_rate": 0.0001491936191714287,
"loss": 3.2165584564208984,
"step": 2580
},
{
"epoch": 0.057777777777777775,
"grad_norm": 0.4547863006591797,
"learning_rate": 0.00014917805829924044,
"loss": 3.218004608154297,
"step": 2600
},
{
"epoch": 0.058222222222222224,
"grad_norm": 0.43512633442878723,
"learning_rate": 0.00014916234954512434,
"loss": 3.240696334838867,
"step": 2620
},
{
"epoch": 0.058666666666666666,
"grad_norm": 0.4822997748851776,
"learning_rate": 0.0001491464929403975,
"loss": 3.328903579711914,
"step": 2640
},
{
"epoch": 0.059111111111111114,
"grad_norm": 0.7447636723518372,
"learning_rate": 0.00014913048851667173,
"loss": 3.266691207885742,
"step": 2660
},
{
"epoch": 0.059555555555555556,
"grad_norm": 0.4689463973045349,
"learning_rate": 0.00014911433630585358,
"loss": 3.2194419860839845,
"step": 2680
},
{
"epoch": 0.06,
"grad_norm": 0.46186351776123047,
"learning_rate": 0.00014909803634014426,
"loss": 3.2315700531005858,
"step": 2700
},
{
"epoch": 0.060444444444444446,
"grad_norm": 0.46033021807670593,
"learning_rate": 0.00014908158865203943,
"loss": 3.238422393798828,
"step": 2720
},
{
"epoch": 0.06088888888888889,
"grad_norm": 0.45534399151802063,
"learning_rate": 0.0001490649932743294,
"loss": 3.1761499404907227,
"step": 2740
},
{
"epoch": 0.06133333333333333,
"grad_norm": 0.4606379270553589,
"learning_rate": 0.00014904825024009878,
"loss": 3.193553352355957,
"step": 2760
},
{
"epoch": 0.06177777777777778,
"grad_norm": 0.47090214490890503,
"learning_rate": 0.00014903135958272662,
"loss": 3.2463909149169923,
"step": 2780
},
{
"epoch": 0.06222222222222222,
"grad_norm": 0.4921543300151825,
"learning_rate": 0.00014901432133588628,
"loss": 2.72841796875,
"step": 2800
},
{
"epoch": 0.06266666666666666,
"grad_norm": 0.4393237829208374,
"learning_rate": 0.00014899713553354532,
"loss": 3.206405258178711,
"step": 2820
},
{
"epoch": 0.06311111111111112,
"grad_norm": 0.4873638451099396,
"learning_rate": 0.0001489798022099655,
"loss": 3.2590980529785156,
"step": 2840
},
{
"epoch": 0.06355555555555556,
"grad_norm": 0.44010642170906067,
"learning_rate": 0.00014896232139970263,
"loss": 3.219563293457031,
"step": 2860
},
{
"epoch": 0.064,
"grad_norm": 0.5251273512840271,
"learning_rate": 0.0001489446931376066,
"loss": 3.162039947509766,
"step": 2880
},
{
"epoch": 0.06444444444444444,
"grad_norm": 0.44742482900619507,
"learning_rate": 0.00014892691745882128,
"loss": 3.185013771057129,
"step": 2900
},
{
"epoch": 0.06488888888888888,
"grad_norm": 0.4437820017337799,
"learning_rate": 0.00014890899439878435,
"loss": 3.195759582519531,
"step": 2920
},
{
"epoch": 0.06533333333333333,
"grad_norm": 0.456325501203537,
"learning_rate": 0.00014889092399322733,
"loss": 3.2370731353759767,
"step": 2940
},
{
"epoch": 0.06577777777777778,
"grad_norm": 0.45418423414230347,
"learning_rate": 0.0001488727062781756,
"loss": 3.2278636932373046,
"step": 2960
},
{
"epoch": 0.06622222222222222,
"grad_norm": 0.4399702847003937,
"learning_rate": 0.00014885434128994804,
"loss": 3.187220573425293,
"step": 2980
},
{
"epoch": 0.06666666666666667,
"grad_norm": 0.4456944167613983,
"learning_rate": 0.0001488358290651573,
"loss": 3.1808168411254885,
"step": 3000
},
{
"epoch": 0.06711111111111111,
"grad_norm": 0.4393834173679352,
"learning_rate": 0.00014881716964070945,
"loss": 3.2609729766845703,
"step": 3020
},
{
"epoch": 0.06755555555555555,
"grad_norm": 0.4507199823856354,
"learning_rate": 0.00014879836305380407,
"loss": 3.25162353515625,
"step": 3040
},
{
"epoch": 0.068,
"grad_norm": 0.43662023544311523,
"learning_rate": 0.0001487794093419341,
"loss": 3.286798858642578,
"step": 3060
},
{
"epoch": 0.06844444444444445,
"grad_norm": 0.4379214346408844,
"learning_rate": 0.00014876030854288583,
"loss": 3.273093414306641,
"step": 3080
},
{
"epoch": 0.06888888888888889,
"grad_norm": 0.4596593976020813,
"learning_rate": 0.0001487410606947387,
"loss": 3.2046443939208986,
"step": 3100
},
{
"epoch": 0.06933333333333333,
"grad_norm": 0.4801647365093231,
"learning_rate": 0.00014872166583586543,
"loss": 3.1880971908569338,
"step": 3120
},
{
"epoch": 0.06977777777777777,
"grad_norm": 0.4532665014266968,
"learning_rate": 0.0001487021240049317,
"loss": 3.2293254852294924,
"step": 3140
},
{
"epoch": 0.07022222222222223,
"grad_norm": 0.45275741815567017,
"learning_rate": 0.0001486824352408963,
"loss": 3.213456726074219,
"step": 3160
},
{
"epoch": 0.07066666666666667,
"grad_norm": 0.4813518524169922,
"learning_rate": 0.00014866259958301083,
"loss": 3.16424503326416,
"step": 3180
},
{
"epoch": 0.07111111111111111,
"grad_norm": 0.43920573592185974,
"learning_rate": 0.00014864261707081986,
"loss": 3.225775146484375,
"step": 3200
},
{
"epoch": 0.07155555555555555,
"grad_norm": 0.4605831205844879,
"learning_rate": 0.00014862248774416065,
"loss": 3.2264049530029295,
"step": 3220
},
{
"epoch": 0.072,
"grad_norm": 0.4871290326118469,
"learning_rate": 0.00014860221164316318,
"loss": 3.2987743377685548,
"step": 3240
},
{
"epoch": 0.07244444444444445,
"grad_norm": 0.44592469930648804,
"learning_rate": 0.00014858178880825003,
"loss": 3.2625717163085937,
"step": 3260
},
{
"epoch": 0.07288888888888889,
"grad_norm": 0.4380069375038147,
"learning_rate": 0.00014856121928013633,
"loss": 3.1424211502075194,
"step": 3280
},
{
"epoch": 0.07333333333333333,
"grad_norm": 0.45689529180526733,
"learning_rate": 0.00014854050309982966,
"loss": 3.2054012298583983,
"step": 3300
},
{
"epoch": 0.07377777777777778,
"grad_norm": 0.5314270257949829,
"learning_rate": 0.0001485196403086299,
"loss": 3.249923324584961,
"step": 3320
},
{
"epoch": 0.07422222222222222,
"grad_norm": 0.4701533317565918,
"learning_rate": 0.0001484986309481293,
"loss": 3.2303524017333984,
"step": 3340
},
{
"epoch": 0.07466666666666667,
"grad_norm": 0.4300021529197693,
"learning_rate": 0.00014847747506021227,
"loss": 3.1313520431518556,
"step": 3360
},
{
"epoch": 0.07511111111111111,
"grad_norm": 0.4340360164642334,
"learning_rate": 0.00014845617268705535,
"loss": 3.235000228881836,
"step": 3380
},
{
"epoch": 0.07555555555555556,
"grad_norm": 0.4472038745880127,
"learning_rate": 0.0001484347238711271,
"loss": 3.205880355834961,
"step": 3400
},
{
"epoch": 0.076,
"grad_norm": 0.4635298252105713,
"learning_rate": 0.00014841312865518803,
"loss": 3.1971580505371096,
"step": 3420
},
{
"epoch": 0.07644444444444444,
"grad_norm": 0.4464603066444397,
"learning_rate": 0.00014839138708229053,
"loss": 3.186069107055664,
"step": 3440
},
{
"epoch": 0.0768888888888889,
"grad_norm": 0.4462911784648895,
"learning_rate": 0.0001483694991957788,
"loss": 3.176103973388672,
"step": 3460
},
{
"epoch": 0.07733333333333334,
"grad_norm": 0.468891441822052,
"learning_rate": 0.00014834746503928863,
"loss": 3.1954296112060545,
"step": 3480
},
{
"epoch": 0.07777777777777778,
"grad_norm": 0.47356855869293213,
"learning_rate": 0.00014832528465674751,
"loss": 3.2059261322021486,
"step": 3500
},
{
"epoch": 0.07822222222222222,
"grad_norm": 0.4475370943546295,
"learning_rate": 0.00014830295809237443,
"loss": 3.1797210693359377,
"step": 3520
},
{
"epoch": 0.07866666666666666,
"grad_norm": 0.46259668469429016,
"learning_rate": 0.00014828048539067978,
"loss": 3.1870779037475585,
"step": 3540
},
{
"epoch": 0.0791111111111111,
"grad_norm": 0.42246803641319275,
"learning_rate": 0.00014825786659646527,
"loss": 3.2552505493164063,
"step": 3560
},
{
"epoch": 0.07955555555555556,
"grad_norm": 0.45982298254966736,
"learning_rate": 0.00014823510175482397,
"loss": 3.266408920288086,
"step": 3580
},
{
"epoch": 0.08,
"grad_norm": 0.5468801259994507,
"learning_rate": 0.00014821219091114,
"loss": 3.24694709777832,
"step": 3600
},
{
"epoch": 0.08044444444444444,
"grad_norm": 0.4892885088920593,
"learning_rate": 0.00014818913411108854,
"loss": 3.2342227935791015,
"step": 3620
},
{
"epoch": 0.08088888888888889,
"grad_norm": 0.4678572118282318,
"learning_rate": 0.00014816593140063589,
"loss": 3.237919235229492,
"step": 3640
},
{
"epoch": 0.08133333333333333,
"grad_norm": 0.45714640617370605,
"learning_rate": 0.00014814258282603906,
"loss": 3.280614471435547,
"step": 3660
},
{
"epoch": 0.08177777777777778,
"grad_norm": 0.45380696654319763,
"learning_rate": 0.000148119088433846,
"loss": 3.2560638427734374,
"step": 3680
},
{
"epoch": 0.08222222222222222,
"grad_norm": 0.4514298737049103,
"learning_rate": 0.00014809544827089525,
"loss": 3.247824859619141,
"step": 3700
},
{
"epoch": 0.08266666666666667,
"grad_norm": 0.44343146681785583,
"learning_rate": 0.0001480716623843161,
"loss": 3.237125778198242,
"step": 3720
},
{
"epoch": 0.08311111111111111,
"grad_norm": 0.4640170931816101,
"learning_rate": 0.00014804773082152819,
"loss": 3.233687973022461,
"step": 3740
},
{
"epoch": 0.08355555555555555,
"grad_norm": 0.4303954243659973,
"learning_rate": 0.00014802365363024168,
"loss": 3.243009567260742,
"step": 3760
},
{
"epoch": 0.084,
"grad_norm": 0.4338454008102417,
"learning_rate": 0.00014799943085845707,
"loss": 3.2204730987548826,
"step": 3780
},
{
"epoch": 0.08444444444444445,
"grad_norm": 0.45959097146987915,
"learning_rate": 0.00014797506255446503,
"loss": 3.2294166564941404,
"step": 3800
},
{
"epoch": 0.08488888888888889,
"grad_norm": 0.44124501943588257,
"learning_rate": 0.0001479505487668464,
"loss": 3.2337928771972657,
"step": 3820
},
{
"epoch": 0.08533333333333333,
"grad_norm": 0.46661219000816345,
"learning_rate": 0.00014792588954447205,
"loss": 3.2283748626708983,
"step": 3840
},
{
"epoch": 0.08577777777777777,
"grad_norm": 0.46878811717033386,
"learning_rate": 0.00014790108493650277,
"loss": 3.24823112487793,
"step": 3860
},
{
"epoch": 0.08622222222222223,
"grad_norm": 0.4897356927394867,
"learning_rate": 0.00014787613499238922,
"loss": 3.201289749145508,
"step": 3880
},
{
"epoch": 0.08666666666666667,
"grad_norm": 0.47273531556129456,
"learning_rate": 0.00014785103976187183,
"loss": 3.213232421875,
"step": 3900
},
{
"epoch": 0.08711111111111111,
"grad_norm": 0.4345775842666626,
"learning_rate": 0.00014782579929498057,
"loss": 3.240903854370117,
"step": 3920
},
{
"epoch": 0.08755555555555555,
"grad_norm": 0.45916658639907837,
"learning_rate": 0.00014780041364203508,
"loss": 3.2107330322265626,
"step": 3940
},
{
"epoch": 0.088,
"grad_norm": 0.4350726306438446,
"learning_rate": 0.0001477748828536444,
"loss": 3.1960351943969725,
"step": 3960
},
{
"epoch": 0.08844444444444445,
"grad_norm": 0.4590388834476471,
"learning_rate": 0.0001477492069807068,
"loss": 3.1532678604125977,
"step": 3980
},
{
"epoch": 0.08888888888888889,
"grad_norm": 0.48074522614479065,
"learning_rate": 0.00014772338607441,
"loss": 3.1624448776245115,
"step": 4000
},
{
"epoch": 0.08933333333333333,
"grad_norm": 0.73881596326828,
"learning_rate": 0.0001476974201862307,
"loss": 3.2126842498779298,
"step": 4020
},
{
"epoch": 0.08977777777777778,
"grad_norm": 0.5197725296020508,
"learning_rate": 0.00014767130936793466,
"loss": 3.1392391204833983,
"step": 4040
},
{
"epoch": 0.09022222222222222,
"grad_norm": 0.5045404434204102,
"learning_rate": 0.00014764505367157666,
"loss": 3.182374382019043,
"step": 4060
},
{
"epoch": 0.09066666666666667,
"grad_norm": 0.463045209646225,
"learning_rate": 0.00014761865314950022,
"loss": 3.204686737060547,
"step": 4080
},
{
"epoch": 0.09111111111111111,
"grad_norm": 0.4603744447231293,
"learning_rate": 0.00014759210785433765,
"loss": 3.222509002685547,
"step": 4100
},
{
"epoch": 0.09155555555555556,
"grad_norm": 0.46453946828842163,
"learning_rate": 0.00014756541783900978,
"loss": 3.3014972686767576,
"step": 4120
},
{
"epoch": 0.092,
"grad_norm": 0.5600302815437317,
"learning_rate": 0.0001475385831567261,
"loss": 3.2589656829833986,
"step": 4140
},
{
"epoch": 0.09244444444444444,
"grad_norm": 0.4428822100162506,
"learning_rate": 0.00014751160386098437,
"loss": 3.2647415161132813,
"step": 4160
},
{
"epoch": 0.09288888888888888,
"grad_norm": 0.44363075494766235,
"learning_rate": 0.00014748448000557075,
"loss": 3.2011764526367186,
"step": 4180
},
{
"epoch": 0.09333333333333334,
"grad_norm": 0.4819713532924652,
"learning_rate": 0.00014745721164455955,
"loss": 3.286373519897461,
"step": 4200
},
{
"epoch": 0.09377777777777778,
"grad_norm": 0.47001391649246216,
"learning_rate": 0.0001474297988323132,
"loss": 3.2380504608154297,
"step": 4220
},
{
"epoch": 0.09422222222222222,
"grad_norm": 0.4884569048881531,
"learning_rate": 0.00014740224162348203,
"loss": 3.177922821044922,
"step": 4240
},
{
"epoch": 0.09466666666666666,
"grad_norm": 0.4659939706325531,
"learning_rate": 0.00014737454007300433,
"loss": 3.2145915985107423,
"step": 4260
},
{
"epoch": 0.0951111111111111,
"grad_norm": 0.49327704310417175,
"learning_rate": 0.00014734669423610612,
"loss": 3.2188236236572267,
"step": 4280
},
{
"epoch": 0.09555555555555556,
"grad_norm": 0.506740391254425,
"learning_rate": 0.00014731870416830108,
"loss": 3.1984685897827148,
"step": 4300
},
{
"epoch": 0.096,
"grad_norm": 0.4642484188079834,
"learning_rate": 0.00014729056992539036,
"loss": 3.3112255096435548,
"step": 4320
},
{
"epoch": 0.09644444444444444,
"grad_norm": 0.5405056476593018,
"learning_rate": 0.00014726229156346266,
"loss": 3.2192611694335938,
"step": 4340
},
{
"epoch": 0.09688888888888889,
"grad_norm": 0.5260511040687561,
"learning_rate": 0.00014723386913889392,
"loss": 3.2375102996826173,
"step": 4360
},
{
"epoch": 0.09733333333333333,
"grad_norm": 0.47228509187698364,
"learning_rate": 0.0001472053027083473,
"loss": 3.2128177642822267,
"step": 4380
},
{
"epoch": 0.09777777777777778,
"grad_norm": 0.4495222270488739,
"learning_rate": 0.00014717659232877297,
"loss": 3.1765506744384764,
"step": 4400
},
{
"epoch": 0.09822222222222222,
"grad_norm": 0.49598413705825806,
"learning_rate": 0.00014714773805740825,
"loss": 3.254990005493164,
"step": 4420
},
{
"epoch": 0.09866666666666667,
"grad_norm": 0.5155579447746277,
"learning_rate": 0.00014711873995177722,
"loss": 3.185023880004883,
"step": 4440
},
{
"epoch": 0.09911111111111111,
"grad_norm": 0.532940685749054,
"learning_rate": 0.00014708959806969068,
"loss": 3.198038864135742,
"step": 4460
},
{
"epoch": 0.09955555555555555,
"grad_norm": 0.54673832654953,
"learning_rate": 0.00014706031246924608,
"loss": 3.1188608169555665,
"step": 4480
},
{
"epoch": 0.1,
"grad_norm": 0.46205902099609375,
"learning_rate": 0.00014703088320882748,
"loss": 3.1994697570800783,
"step": 4500
},
{
"epoch": 0.10044444444444445,
"grad_norm": 0.45501023530960083,
"learning_rate": 0.00014700131034710528,
"loss": 3.2075408935546874,
"step": 4520
},
{
"epoch": 0.10088888888888889,
"grad_norm": 0.44364458322525024,
"learning_rate": 0.00014697159394303608,
"loss": 3.1500192642211915,
"step": 4540
},
{
"epoch": 0.10133333333333333,
"grad_norm": 0.4537247121334076,
"learning_rate": 0.00014694173405586277,
"loss": 3.22845458984375,
"step": 4560
},
{
"epoch": 0.10177777777777777,
"grad_norm": 0.4371682107448578,
"learning_rate": 0.00014691173074511422,
"loss": 3.0997844696044923,
"step": 4580
},
{
"epoch": 0.10222222222222223,
"grad_norm": 0.4579278826713562,
"learning_rate": 0.0001468815840706053,
"loss": 3.156996154785156,
"step": 4600
},
{
"epoch": 0.10266666666666667,
"grad_norm": 0.47462958097457886,
"learning_rate": 0.00014685129409243658,
"loss": 3.1914037704467773,
"step": 4620
},
{
"epoch": 0.10311111111111111,
"grad_norm": 0.5009214282035828,
"learning_rate": 0.00014682086087099442,
"loss": 3.2067234039306642,
"step": 4640
},
{
"epoch": 0.10355555555555555,
"grad_norm": 0.5263777375221252,
"learning_rate": 0.00014679028446695072,
"loss": 3.238682174682617,
"step": 4660
},
{
"epoch": 0.104,
"grad_norm": 0.4436848759651184,
"learning_rate": 0.00014675956494126282,
"loss": 3.2270687103271483,
"step": 4680
},
{
"epoch": 0.10444444444444445,
"grad_norm": 0.4504874348640442,
"learning_rate": 0.0001467287023551734,
"loss": 3.241545486450195,
"step": 4700
},
{
"epoch": 0.10488888888888889,
"grad_norm": 0.4560563862323761,
"learning_rate": 0.00014669769677021032,
"loss": 3.214568328857422,
"step": 4720
},
{
"epoch": 0.10533333333333333,
"grad_norm": 0.5226325988769531,
"learning_rate": 0.0001466665482481866,
"loss": 3.1895187377929686,
"step": 4740
},
{
"epoch": 0.10577777777777778,
"grad_norm": 0.46069765090942383,
"learning_rate": 0.00014663525685120008,
"loss": 3.194733428955078,
"step": 4760
},
{
"epoch": 0.10622222222222222,
"grad_norm": 0.45767131447792053,
"learning_rate": 0.00014660382264163358,
"loss": 3.1710975646972654,
"step": 4780
},
{
"epoch": 0.10666666666666667,
"grad_norm": 0.49453967809677124,
"learning_rate": 0.00014657224568215456,
"loss": 3.2196239471435546,
"step": 4800
},
{
"epoch": 0.10711111111111112,
"grad_norm": 0.4364623427391052,
"learning_rate": 0.00014654052603571509,
"loss": 3.2239658355712892,
"step": 4820
},
{
"epoch": 0.10755555555555556,
"grad_norm": 0.43620210886001587,
"learning_rate": 0.0001465086637655517,
"loss": 3.2461246490478515,
"step": 4840
},
{
"epoch": 0.108,
"grad_norm": 0.44628360867500305,
"learning_rate": 0.00014647665893518518,
"loss": 3.201553726196289,
"step": 4860
},
{
"epoch": 0.10844444444444444,
"grad_norm": 0.6283556818962097,
"learning_rate": 0.00014644451160842066,
"loss": 3.258001708984375,
"step": 4880
},
{
"epoch": 0.10888888888888888,
"grad_norm": 0.46947452425956726,
"learning_rate": 0.00014641222184934733,
"loss": 3.311473083496094,
"step": 4900
},
{
"epoch": 0.10933333333333334,
"grad_norm": 0.4496892988681793,
"learning_rate": 0.0001463797897223382,
"loss": 3.2201786041259766,
"step": 4920
},
{
"epoch": 0.10977777777777778,
"grad_norm": 0.4735954999923706,
"learning_rate": 0.00014634721529205023,
"loss": 3.2269256591796873,
"step": 4940
},
{
"epoch": 0.11022222222222222,
"grad_norm": 0.4686685800552368,
"learning_rate": 0.00014631449862342408,
"loss": 3.1545198440551756,
"step": 4960
},
{
"epoch": 0.11066666666666666,
"grad_norm": 0.4850025475025177,
"learning_rate": 0.0001462816397816839,
"loss": 3.1916128158569337,
"step": 4980
},
{
"epoch": 0.1111111111111111,
"grad_norm": 0.44467711448669434,
"learning_rate": 0.00014624863883233737,
"loss": 3.296238327026367,
"step": 5000
},
{
"epoch": 0.11155555555555556,
"grad_norm": 0.4278726875782013,
"learning_rate": 0.00014621549584117538,
"loss": 3.2197341918945312,
"step": 5020
},
{
"epoch": 0.112,
"grad_norm": 0.44800201058387756,
"learning_rate": 0.00014618221087427208,
"loss": 3.1955873489379885,
"step": 5040
},
{
"epoch": 0.11244444444444444,
"grad_norm": 0.7889285683631897,
"learning_rate": 0.00014614878399798459,
"loss": 3.1953197479248048,
"step": 5060
},
{
"epoch": 0.11288888888888889,
"grad_norm": 0.46701595187187195,
"learning_rate": 0.00014611521527895302,
"loss": 3.1930301666259764,
"step": 5080
},
{
"epoch": 0.11333333333333333,
"grad_norm": 0.580479621887207,
"learning_rate": 0.00014608150478410018,
"loss": 3.191876029968262,
"step": 5100
},
{
"epoch": 0.11377777777777778,
"grad_norm": 0.48068711161613464,
"learning_rate": 0.00014604765258063157,
"loss": 3.2010311126708983,
"step": 5120
},
{
"epoch": 0.11422222222222222,
"grad_norm": 0.480557918548584,
"learning_rate": 0.00014601365873603524,
"loss": 3.2152126312255858,
"step": 5140
},
{
"epoch": 0.11466666666666667,
"grad_norm": 0.47577980160713196,
"learning_rate": 0.0001459795233180815,
"loss": 3.180438423156738,
"step": 5160
},
{
"epoch": 0.11511111111111111,
"grad_norm": 0.4441629946231842,
"learning_rate": 0.000145945246394823,
"loss": 3.158919334411621,
"step": 5180
},
{
"epoch": 0.11555555555555555,
"grad_norm": 0.47655239701271057,
"learning_rate": 0.0001459108280345945,
"loss": 3.2550262451171874,
"step": 5200
},
{
"epoch": 0.116,
"grad_norm": 0.4978802502155304,
"learning_rate": 0.00014587626830601266,
"loss": 3.2300640106201173,
"step": 5220
},
{
"epoch": 0.11644444444444445,
"grad_norm": 0.5484026670455933,
"learning_rate": 0.00014584156727797605,
"loss": 3.2527088165283202,
"step": 5240
},
{
"epoch": 0.11688888888888889,
"grad_norm": 0.4482669234275818,
"learning_rate": 0.00014580672501966483,
"loss": 3.2293865203857424,
"step": 5260
},
{
"epoch": 0.11733333333333333,
"grad_norm": 0.45747998356819153,
"learning_rate": 0.00014577174160054088,
"loss": 3.220448684692383,
"step": 5280
},
{
"epoch": 0.11777777777777777,
"grad_norm": 0.4511623680591583,
"learning_rate": 0.0001457366170903473,
"loss": 3.2540283203125,
"step": 5300
},
{
"epoch": 0.11822222222222223,
"grad_norm": 0.5221858620643616,
"learning_rate": 0.00014570135155910865,
"loss": 3.2781753540039062,
"step": 5320
},
{
"epoch": 0.11866666666666667,
"grad_norm": 0.44799089431762695,
"learning_rate": 0.00014566594507713052,
"loss": 3.226374053955078,
"step": 5340
},
{
"epoch": 0.11911111111111111,
"grad_norm": 0.5282427668571472,
"learning_rate": 0.00014563039771499958,
"loss": 3.196961212158203,
"step": 5360
},
{
"epoch": 0.11955555555555555,
"grad_norm": 0.46396657824516296,
"learning_rate": 0.00014559470954358326,
"loss": 3.2554805755615233,
"step": 5380
},
{
"epoch": 0.12,
"grad_norm": 0.625439465045929,
"learning_rate": 0.00014555888063402976,
"loss": 3.164295768737793,
"step": 5400
},
{
"epoch": 0.12044444444444445,
"grad_norm": 0.43783435225486755,
"learning_rate": 0.00014552291105776792,
"loss": 3.1544946670532226,
"step": 5420
},
{
"epoch": 0.12088888888888889,
"grad_norm": 0.47741207480430603,
"learning_rate": 0.00014548680088650692,
"loss": 3.227632522583008,
"step": 5440
},
{
"epoch": 0.12133333333333333,
"grad_norm": 0.4600733816623688,
"learning_rate": 0.00014545055019223624,
"loss": 3.2658519744873047,
"step": 5460
},
{
"epoch": 0.12177777777777778,
"grad_norm": 0.5606860518455505,
"learning_rate": 0.00014541415904722557,
"loss": 3.181635284423828,
"step": 5480
},
{
"epoch": 0.12222222222222222,
"grad_norm": 0.4462604224681854,
"learning_rate": 0.00014537762752402455,
"loss": 3.209598159790039,
"step": 5500
},
{
"epoch": 0.12266666666666666,
"grad_norm": 0.6866390109062195,
"learning_rate": 0.00014534095569546272,
"loss": 3.2540157318115233,
"step": 5520
},
{
"epoch": 0.12311111111111112,
"grad_norm": 0.4729842245578766,
"learning_rate": 0.00014530414363464928,
"loss": 3.245439147949219,
"step": 5540
},
{
"epoch": 0.12355555555555556,
"grad_norm": 0.46783679723739624,
"learning_rate": 0.00014526719141497304,
"loss": 3.2365901947021483,
"step": 5560
},
{
"epoch": 0.124,
"grad_norm": 0.45501041412353516,
"learning_rate": 0.0001452300991101022,
"loss": 3.206534194946289,
"step": 5580
},
{
"epoch": 0.12444444444444444,
"grad_norm": 0.474590539932251,
"learning_rate": 0.00014519286679398431,
"loss": 3.224322509765625,
"step": 5600
},
{
"epoch": 0.12488888888888888,
"grad_norm": 0.5209236741065979,
"learning_rate": 0.00014515549454084594,
"loss": 3.1018524169921875,
"step": 5620
},
{
"epoch": 0.12533333333333332,
"grad_norm": 0.5150535106658936,
"learning_rate": 0.00014511798242519268,
"loss": 3.2113582611083986,
"step": 5640
},
{
"epoch": 0.12577777777777777,
"grad_norm": 0.46810182929039,
"learning_rate": 0.00014508033052180902,
"loss": 3.191122055053711,
"step": 5660
},
{
"epoch": 0.12622222222222224,
"grad_norm": 0.4673914909362793,
"learning_rate": 0.00014504253890575803,
"loss": 3.196429443359375,
"step": 5680
},
{
"epoch": 0.12666666666666668,
"grad_norm": 0.44238048791885376,
"learning_rate": 0.00014500460765238136,
"loss": 3.171088981628418,
"step": 5700
},
{
"epoch": 0.12711111111111112,
"grad_norm": 0.44561734795570374,
"learning_rate": 0.00014496653683729907,
"loss": 3.1610361099243165,
"step": 5720
},
{
"epoch": 0.12755555555555556,
"grad_norm": 0.4601413309574127,
"learning_rate": 0.00014492832653640938,
"loss": 3.19616756439209,
"step": 5740
},
{
"epoch": 0.128,
"grad_norm": 0.47111231088638306,
"learning_rate": 0.00014488997682588866,
"loss": 3.1309431076049803,
"step": 5760
},
{
"epoch": 0.12844444444444444,
"grad_norm": 0.43808022141456604,
"learning_rate": 0.00014485148778219114,
"loss": 3.212171173095703,
"step": 5780
},
{
"epoch": 0.1288888888888889,
"grad_norm": 0.4717647433280945,
"learning_rate": 0.0001448128594820489,
"loss": 3.2262546539306642,
"step": 5800
},
{
"epoch": 0.12933333333333333,
"grad_norm": 0.4447265565395355,
"learning_rate": 0.0001447740920024716,
"loss": 3.186686325073242,
"step": 5820
},
{
"epoch": 0.12977777777777777,
"grad_norm": 0.4754256010055542,
"learning_rate": 0.00014473518542074636,
"loss": 3.233407211303711,
"step": 5840
},
{
"epoch": 0.1302222222222222,
"grad_norm": 0.49175721406936646,
"learning_rate": 0.00014469613981443763,
"loss": 3.1972814559936524,
"step": 5860
},
{
"epoch": 0.13066666666666665,
"grad_norm": 0.4555152654647827,
"learning_rate": 0.00014465695526138703,
"loss": 3.214908981323242,
"step": 5880
},
{
"epoch": 0.13111111111111112,
"grad_norm": 0.44315478205680847,
"learning_rate": 0.00014461763183971321,
"loss": 3.1543107986450196,
"step": 5900
},
{
"epoch": 0.13155555555555556,
"grad_norm": 0.4695570468902588,
"learning_rate": 0.00014457816962781158,
"loss": 3.1565223693847657,
"step": 5920
},
{
"epoch": 0.132,
"grad_norm": 0.9257342219352722,
"learning_rate": 0.00014453856870435432,
"loss": 3.242453384399414,
"step": 5940
},
{
"epoch": 0.13244444444444445,
"grad_norm": 0.44902992248535156,
"learning_rate": 0.0001444988291482901,
"loss": 3.197645378112793,
"step": 5960
},
{
"epoch": 0.1328888888888889,
"grad_norm": 0.556738555431366,
"learning_rate": 0.00014445895103884406,
"loss": 3.2306198120117187,
"step": 5980
},
{
"epoch": 0.13333333333333333,
"grad_norm": 0.4576815366744995,
"learning_rate": 0.00014441893445551744,
"loss": 3.1862377166748046,
"step": 6000
},
{
"epoch": 0.13377777777777777,
"grad_norm": 0.4665937125682831,
"learning_rate": 0.0001443787794780876,
"loss": 3.246712875366211,
"step": 6020
},
{
"epoch": 0.13422222222222221,
"grad_norm": 0.4366329610347748,
"learning_rate": 0.00014433848618660783,
"loss": 3.2400737762451173,
"step": 6040
},
{
"epoch": 0.13466666666666666,
"grad_norm": 0.4293994903564453,
"learning_rate": 0.0001442980546614071,
"loss": 3.2190624237060548,
"step": 6060
},
{
"epoch": 0.1351111111111111,
"grad_norm": 0.4521493911743164,
"learning_rate": 0.00014425748498309002,
"loss": 3.1341930389404298,
"step": 6080
},
{
"epoch": 0.13555555555555557,
"grad_norm": 0.45834416151046753,
"learning_rate": 0.0001442167772325366,
"loss": 3.223272705078125,
"step": 6100
},
{
"epoch": 0.136,
"grad_norm": 0.4612223505973816,
"learning_rate": 0.00014417593149090212,
"loss": 3.1569169998168944,
"step": 6120
},
{
"epoch": 0.13644444444444445,
"grad_norm": 0.43669217824935913,
"learning_rate": 0.00014413494783961696,
"loss": 3.181291389465332,
"step": 6140
},
{
"epoch": 0.1368888888888889,
"grad_norm": 0.4475366473197937,
"learning_rate": 0.00014409382636038637,
"loss": 3.1732030868530274,
"step": 6160
},
{
"epoch": 0.13733333333333334,
"grad_norm": 0.4427911639213562,
"learning_rate": 0.00014405256713519054,
"loss": 3.103558158874512,
"step": 6180
},
{
"epoch": 0.13777777777777778,
"grad_norm": 0.44157102704048157,
"learning_rate": 0.00014401117024628407,
"loss": 3.1719968795776365,
"step": 6200
},
{
"epoch": 0.13822222222222222,
"grad_norm": 0.4316306710243225,
"learning_rate": 0.00014396963577619618,
"loss": 3.172272872924805,
"step": 6220
},
{
"epoch": 0.13866666666666666,
"grad_norm": 0.4874098002910614,
"learning_rate": 0.00014392796380773023,
"loss": 3.1618614196777344,
"step": 6240
},
{
"epoch": 0.1391111111111111,
"grad_norm": 0.48193442821502686,
"learning_rate": 0.00014388615442396382,
"loss": 3.1742340087890626,
"step": 6260
},
{
"epoch": 0.13955555555555554,
"grad_norm": 0.4783935844898224,
"learning_rate": 0.00014384420770824843,
"loss": 3.179502487182617,
"step": 6280
},
{
"epoch": 0.14,
"grad_norm": 0.48292383551597595,
"learning_rate": 0.00014380212374420933,
"loss": 3.2242942810058595,
"step": 6300
},
{
"epoch": 0.14044444444444446,
"grad_norm": 0.46342727541923523,
"learning_rate": 0.00014375990261574544,
"loss": 3.2213905334472654,
"step": 6320
},
{
"epoch": 0.1408888888888889,
"grad_norm": 0.44609126448631287,
"learning_rate": 0.0001437175444070291,
"loss": 3.2207828521728517,
"step": 6340
},
{
"epoch": 0.14133333333333334,
"grad_norm": 0.5168944597244263,
"learning_rate": 0.00014367504920250598,
"loss": 3.246337890625,
"step": 6360
},
{
"epoch": 0.14177777777777778,
"grad_norm": 0.44399183988571167,
"learning_rate": 0.00014363241708689482,
"loss": 3.275266647338867,
"step": 6380
},
{
"epoch": 0.14222222222222222,
"grad_norm": 0.5032855272293091,
"learning_rate": 0.0001435896481451873,
"loss": 3.264081573486328,
"step": 6400
},
{
"epoch": 0.14266666666666666,
"grad_norm": 0.46948346495628357,
"learning_rate": 0.00014354674246264796,
"loss": 3.248103713989258,
"step": 6420
},
{
"epoch": 0.1431111111111111,
"grad_norm": 0.5252745747566223,
"learning_rate": 0.0001435037001248138,
"loss": 3.204604721069336,
"step": 6440
},
{
"epoch": 0.14355555555555555,
"grad_norm": 0.44080179929733276,
"learning_rate": 0.00014346052121749442,
"loss": 3.2393447875976564,
"step": 6460
},
{
"epoch": 0.144,
"grad_norm": 0.5272217988967896,
"learning_rate": 0.00014341720582677155,
"loss": 3.199708938598633,
"step": 6480
},
{
"epoch": 0.14444444444444443,
"grad_norm": 0.5089524388313293,
"learning_rate": 0.0001433737540389991,
"loss": 3.2157310485839843,
"step": 6500
},
{
"epoch": 0.1448888888888889,
"grad_norm": 0.4520503282546997,
"learning_rate": 0.0001433301659408029,
"loss": 3.180294418334961,
"step": 6520
},
{
"epoch": 0.14533333333333334,
"grad_norm": 0.4651671051979065,
"learning_rate": 0.00014328644161908048,
"loss": 3.1775156021118165,
"step": 6540
},
{
"epoch": 0.14577777777777778,
"grad_norm": 0.4689304828643799,
"learning_rate": 0.000143242581161001,
"loss": 3.2424713134765626,
"step": 6560
},
{
"epoch": 0.14622222222222223,
"grad_norm": 0.471964567899704,
"learning_rate": 0.00014319858465400496,
"loss": 3.1502920150756837,
"step": 6580
},
{
"epoch": 0.14666666666666667,
"grad_norm": 0.44283661246299744,
"learning_rate": 0.00014315445218580415,
"loss": 3.2001998901367186,
"step": 6600
},
{
"epoch": 0.1471111111111111,
"grad_norm": 0.5364190340042114,
"learning_rate": 0.00014311018384438135,
"loss": 3.197841453552246,
"step": 6620
},
{
"epoch": 0.14755555555555555,
"grad_norm": 0.5220893025398254,
"learning_rate": 0.0001430657797179903,
"loss": 3.1643524169921875,
"step": 6640
},
{
"epoch": 0.148,
"grad_norm": 0.4660756289958954,
"learning_rate": 0.00014302123989515535,
"loss": 3.180074691772461,
"step": 6660
},
{
"epoch": 0.14844444444444443,
"grad_norm": 0.44047045707702637,
"learning_rate": 0.00014297656446467144,
"loss": 3.1517871856689452,
"step": 6680
},
{
"epoch": 0.14888888888888888,
"grad_norm": 0.44566479325294495,
"learning_rate": 0.00014293175351560387,
"loss": 3.13958797454834,
"step": 6700
},
{
"epoch": 0.14933333333333335,
"grad_norm": 0.4864153265953064,
"learning_rate": 0.00014288680713728805,
"loss": 3.1510459899902346,
"step": 6720
},
{
"epoch": 0.1497777777777778,
"grad_norm": 0.4525631368160248,
"learning_rate": 0.00014284172541932942,
"loss": 3.1826549530029298,
"step": 6740
},
{
"epoch": 0.15022222222222223,
"grad_norm": 0.44795510172843933,
"learning_rate": 0.00014279650845160321,
"loss": 3.198468780517578,
"step": 6760
},
{
"epoch": 0.15066666666666667,
"grad_norm": 0.48972034454345703,
"learning_rate": 0.00014275115632425437,
"loss": 3.1678110122680665,
"step": 6780
},
{
"epoch": 0.1511111111111111,
"grad_norm": 0.4844519793987274,
"learning_rate": 0.00014270566912769715,
"loss": 3.1859018325805666,
"step": 6800
},
{
"epoch": 0.15155555555555555,
"grad_norm": 0.4583846628665924,
"learning_rate": 0.00014266004695261518,
"loss": 3.150168037414551,
"step": 6820
},
{
"epoch": 0.152,
"grad_norm": 0.45687735080718994,
"learning_rate": 0.00014261428988996124,
"loss": 3.2176143646240236,
"step": 6840
},
{
"epoch": 0.15244444444444444,
"grad_norm": 0.4774504601955414,
"learning_rate": 0.00014256839803095686,
"loss": 3.241961669921875,
"step": 6860
},
{
"epoch": 0.15288888888888888,
"grad_norm": 0.4882252812385559,
"learning_rate": 0.00014252237146709245,
"loss": 3.189226531982422,
"step": 6880
},
{
"epoch": 0.15333333333333332,
"grad_norm": 0.46765080094337463,
"learning_rate": 0.0001424762102901269,
"loss": 3.233798599243164,
"step": 6900
},
{
"epoch": 0.1537777777777778,
"grad_norm": 0.46064749360084534,
"learning_rate": 0.00014242991459208744,
"loss": 3.233529281616211,
"step": 6920
},
{
"epoch": 0.15422222222222223,
"grad_norm": 0.500286340713501,
"learning_rate": 0.00014238348446526955,
"loss": 3.2048763275146483,
"step": 6940
},
{
"epoch": 0.15466666666666667,
"grad_norm": 0.4983065724372864,
"learning_rate": 0.00014233692000223665,
"loss": 3.231466293334961,
"step": 6960
},
{
"epoch": 0.15511111111111112,
"grad_norm": 0.5212306380271912,
"learning_rate": 0.00014229022129582004,
"loss": 3.235833740234375,
"step": 6980
},
{
"epoch": 0.15555555555555556,
"grad_norm": 0.4826495051383972,
"learning_rate": 0.00014224338843911856,
"loss": 3.2368419647216795,
"step": 7000
},
{
"epoch": 0.156,
"grad_norm": 0.4858686029911041,
"learning_rate": 0.00014219642152549857,
"loss": 3.288930892944336,
"step": 7020
},
{
"epoch": 0.15644444444444444,
"grad_norm": 0.5357473492622375,
"learning_rate": 0.00014214932064859367,
"loss": 3.2147579193115234,
"step": 7040
},
{
"epoch": 0.15688888888888888,
"grad_norm": 0.4566601514816284,
"learning_rate": 0.00014210208590230446,
"loss": 3.253256607055664,
"step": 7060
},
{
"epoch": 0.15733333333333333,
"grad_norm": 0.4568151533603668,
"learning_rate": 0.00014205471738079858,
"loss": 3.208812713623047,
"step": 7080
},
{
"epoch": 0.15777777777777777,
"grad_norm": 0.4708445966243744,
"learning_rate": 0.00014200721517851017,
"loss": 3.160601806640625,
"step": 7100
},
{
"epoch": 0.1582222222222222,
"grad_norm": 0.4495849013328552,
"learning_rate": 0.00014195957939014002,
"loss": 3.1883201599121094,
"step": 7120
},
{
"epoch": 0.15866666666666668,
"grad_norm": 0.4833003580570221,
"learning_rate": 0.00014191181011065517,
"loss": 3.209871292114258,
"step": 7140
},
{
"epoch": 0.15911111111111112,
"grad_norm": 0.43168163299560547,
"learning_rate": 0.00014186390743528885,
"loss": 3.210647201538086,
"step": 7160
},
{
"epoch": 0.15955555555555556,
"grad_norm": 0.4708026349544525,
"learning_rate": 0.00014181587145954013,
"loss": 3.1830673217773438,
"step": 7180
},
{
"epoch": 0.16,
"grad_norm": 0.4427180588245392,
"learning_rate": 0.00014176770227917394,
"loss": 3.2198902130126954,
"step": 7200
},
{
"epoch": 0.16044444444444445,
"grad_norm": 0.4427896738052368,
"learning_rate": 0.0001417193999902207,
"loss": 3.2056446075439453,
"step": 7220
},
{
"epoch": 0.1608888888888889,
"grad_norm": 0.45977112650871277,
"learning_rate": 0.00014167096468897618,
"loss": 3.2209922790527346,
"step": 7240
},
{
"epoch": 0.16133333333333333,
"grad_norm": 0.4678868353366852,
"learning_rate": 0.0001416223964720014,
"loss": 3.137177848815918,
"step": 7260
},
{
"epoch": 0.16177777777777777,
"grad_norm": 0.4499399662017822,
"learning_rate": 0.0001415736954361223,
"loss": 3.1637380599975584,
"step": 7280
},
{
"epoch": 0.1622222222222222,
"grad_norm": 0.5418245196342468,
"learning_rate": 0.00014152486167842964,
"loss": 3.1573974609375,
"step": 7300
},
{
"epoch": 0.16266666666666665,
"grad_norm": 0.47254660725593567,
"learning_rate": 0.00014147589529627875,
"loss": 3.155618095397949,
"step": 7320
},
{
"epoch": 0.16311111111111112,
"grad_norm": 0.4802646338939667,
"learning_rate": 0.00014142679638728936,
"loss": 3.1851667404174804,
"step": 7340
},
{
"epoch": 0.16355555555555557,
"grad_norm": 0.5078751444816589,
"learning_rate": 0.00014137756504934543,
"loss": 3.109396553039551,
"step": 7360
},
{
"epoch": 0.164,
"grad_norm": 0.5291840434074402,
"learning_rate": 0.00014132820138059492,
"loss": 3.1485904693603515,
"step": 7380
},
{
"epoch": 0.16444444444444445,
"grad_norm": 0.49084246158599854,
"learning_rate": 0.00014127870547944962,
"loss": 3.2375328063964846,
"step": 7400
},
{
"epoch": 0.1648888888888889,
"grad_norm": 0.5139070153236389,
"learning_rate": 0.00014122907744458494,
"loss": 3.2759769439697264,
"step": 7420
},
{
"epoch": 0.16533333333333333,
"grad_norm": 6.400476932525635,
"learning_rate": 0.00014117931737493963,
"loss": 3.1718652725219725,
"step": 7440
},
{
"epoch": 0.16577777777777777,
"grad_norm": 0.8315669298171997,
"learning_rate": 0.0001411294253697158,
"loss": 3.0809513092041017,
"step": 7460
},
{
"epoch": 0.16622222222222222,
"grad_norm": 0.4860391914844513,
"learning_rate": 0.0001410794015283785,
"loss": 3.242574691772461,
"step": 7480
},
{
"epoch": 0.16666666666666666,
"grad_norm": 0.5168259739875793,
"learning_rate": 0.00014102924595065566,
"loss": 3.232664108276367,
"step": 7500
},
{
"epoch": 0.1671111111111111,
"grad_norm": 0.45953169465065,
"learning_rate": 0.00014097895873653774,
"loss": 3.227385711669922,
"step": 7520
},
{
"epoch": 0.16755555555555557,
"grad_norm": 0.5139103531837463,
"learning_rate": 0.00014092853998627777,
"loss": 3.2735107421875,
"step": 7540
},
{
"epoch": 0.168,
"grad_norm": 0.4912737011909485,
"learning_rate": 0.00014087798980039093,
"loss": 3.1870044708251952,
"step": 7560
},
{
"epoch": 0.16844444444444445,
"grad_norm": 0.45814642310142517,
"learning_rate": 0.0001408273082796544,
"loss": 3.213631820678711,
"step": 7580
},
{
"epoch": 0.1688888888888889,
"grad_norm": 0.4608581066131592,
"learning_rate": 0.00014077649552510734,
"loss": 3.2406402587890626,
"step": 7600
},
{
"epoch": 0.16933333333333334,
"grad_norm": 0.4913986623287201,
"learning_rate": 0.00014072555163805036,
"loss": 3.2200984954833984,
"step": 7620
},
{
"epoch": 0.16977777777777778,
"grad_norm": 0.47340869903564453,
"learning_rate": 0.00014067447672004555,
"loss": 3.199324035644531,
"step": 7640
},
{
"epoch": 0.17022222222222222,
"grad_norm": 0.48123660683631897,
"learning_rate": 0.00014062327087291626,
"loss": 3.205300140380859,
"step": 7660
},
{
"epoch": 0.17066666666666666,
"grad_norm": 0.45687246322631836,
"learning_rate": 0.0001405719341987469,
"loss": 3.190545654296875,
"step": 7680
},
{
"epoch": 0.1711111111111111,
"grad_norm": 0.4392889738082886,
"learning_rate": 0.00014052046679988262,
"loss": 3.2179519653320314,
"step": 7700
},
{
"epoch": 0.17155555555555554,
"grad_norm": 0.4522570073604584,
"learning_rate": 0.00014046886877892918,
"loss": 3.165958595275879,
"step": 7720
},
{
"epoch": 0.172,
"grad_norm": 0.4553944766521454,
"learning_rate": 0.0001404171402387528,
"loss": 3.211654281616211,
"step": 7740
},
{
"epoch": 0.17244444444444446,
"grad_norm": 0.4623655378818512,
"learning_rate": 0.00014036528128247985,
"loss": 3.2386489868164063,
"step": 7760
},
{
"epoch": 0.1728888888888889,
"grad_norm": 0.46499407291412354,
"learning_rate": 0.00014031329201349678,
"loss": 3.206338119506836,
"step": 7780
},
{
"epoch": 0.17333333333333334,
"grad_norm": 0.5669381022453308,
"learning_rate": 0.0001402611725354498,
"loss": 3.2185150146484376,
"step": 7800
},
{
"epoch": 0.17377777777777778,
"grad_norm": 0.4446219801902771,
"learning_rate": 0.0001402089229522446,
"loss": 3.1521705627441405,
"step": 7820
},
{
"epoch": 0.17422222222222222,
"grad_norm": 0.4553963243961334,
"learning_rate": 0.00014015654336804642,
"loss": 3.1520723342895507,
"step": 7840
},
{
"epoch": 0.17466666666666666,
"grad_norm": 0.4424580931663513,
"learning_rate": 0.0001401040338872795,
"loss": 3.157762336730957,
"step": 7860
},
{
"epoch": 0.1751111111111111,
"grad_norm": 0.5282416343688965,
"learning_rate": 0.00014005139461462722,
"loss": 3.1652385711669924,
"step": 7880
},
{
"epoch": 0.17555555555555555,
"grad_norm": 0.4637663662433624,
"learning_rate": 0.00013999862565503162,
"loss": 3.198106575012207,
"step": 7900
},
{
"epoch": 0.176,
"grad_norm": 0.4382156431674957,
"learning_rate": 0.00013994572711369322,
"loss": 3.1545337677001952,
"step": 7920
},
{
"epoch": 0.17644444444444443,
"grad_norm": 0.46246689558029175,
"learning_rate": 0.00013989269909607099,
"loss": 3.11791934967041,
"step": 7940
},
{
"epoch": 0.1768888888888889,
"grad_norm": 0.5010555982589722,
"learning_rate": 0.00013983954170788198,
"loss": 3.2244075775146483,
"step": 7960
},
{
"epoch": 0.17733333333333334,
"grad_norm": 0.5009114146232605,
"learning_rate": 0.00013978625505510115,
"loss": 3.2503635406494142,
"step": 7980
},
{
"epoch": 0.17777777777777778,
"grad_norm": 0.4728047549724579,
"learning_rate": 0.00013973283924396116,
"loss": 3.2232902526855467,
"step": 8000
}
],
"logging_steps": 20,
"max_steps": 45000,
"num_input_tokens_seen": 0,
"num_train_epochs": 9223372036854775807,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.37554909577216e+17,
"train_batch_size": 64,
"trial_name": null,
"trial_params": null
}