shakespear-gpt2 / trainer_state.json
tdizhere's picture
Upload folder using huggingface_hub
1b1c916 verified
Raw
History Blame Contribute Delete
31.9 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 10.0,
"eval_steps": 500,
"global_step": 1690,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.05917159763313609,
"grad_norm": 2.13480806350708,
"learning_rate": 0.0004973372781065089,
"loss": 8.609089660644532,
"step": 10
},
{
"epoch": 0.11834319526627218,
"grad_norm": 0.5722453594207764,
"learning_rate": 0.0004943786982248521,
"loss": 6.307852554321289,
"step": 20
},
{
"epoch": 0.17751479289940827,
"grad_norm": 0.5311302542686462,
"learning_rate": 0.0004914201183431953,
"loss": 5.795976257324218,
"step": 30
},
{
"epoch": 0.23668639053254437,
"grad_norm": 0.936571478843689,
"learning_rate": 0.0004884615384615384,
"loss": 5.6642906188964846,
"step": 40
},
{
"epoch": 0.2958579881656805,
"grad_norm": 0.46537888050079346,
"learning_rate": 0.0004855029585798817,
"loss": 5.564136123657226,
"step": 50
},
{
"epoch": 0.35502958579881655,
"grad_norm": 0.5137708783149719,
"learning_rate": 0.00048254437869822486,
"loss": 5.482704925537109,
"step": 60
},
{
"epoch": 0.41420118343195267,
"grad_norm": 0.6558282971382141,
"learning_rate": 0.00047958579881656805,
"loss": 5.424795532226563,
"step": 70
},
{
"epoch": 0.47337278106508873,
"grad_norm": 0.602185845375061,
"learning_rate": 0.00047662721893491125,
"loss": 5.312729263305664,
"step": 80
},
{
"epoch": 0.5325443786982249,
"grad_norm": 0.49187108874320984,
"learning_rate": 0.0004736686390532545,
"loss": 5.2327423095703125,
"step": 90
},
{
"epoch": 0.591715976331361,
"grad_norm": 0.5671802163124084,
"learning_rate": 0.00047071005917159763,
"loss": 5.180327224731445,
"step": 100
},
{
"epoch": 0.650887573964497,
"grad_norm": 0.5761376619338989,
"learning_rate": 0.0004677514792899408,
"loss": 5.1113639831542965,
"step": 110
},
{
"epoch": 0.7100591715976331,
"grad_norm": 0.6834049820899963,
"learning_rate": 0.000464792899408284,
"loss": 5.110577011108399,
"step": 120
},
{
"epoch": 0.7692307692307693,
"grad_norm": 0.4934782385826111,
"learning_rate": 0.00046183431952662727,
"loss": 5.033809661865234,
"step": 130
},
{
"epoch": 0.8284023668639053,
"grad_norm": 0.5475414395332336,
"learning_rate": 0.0004588757396449704,
"loss": 5.023288726806641,
"step": 140
},
{
"epoch": 0.8875739644970414,
"grad_norm": 0.6682299971580505,
"learning_rate": 0.0004559171597633136,
"loss": 5.008454895019531,
"step": 150
},
{
"epoch": 0.9467455621301775,
"grad_norm": 0.6575542092323303,
"learning_rate": 0.00045295857988165685,
"loss": 5.023602676391602,
"step": 160
},
{
"epoch": 1.0059171597633136,
"grad_norm": 0.5498866438865662,
"learning_rate": 0.00045000000000000004,
"loss": 4.9478710174560545,
"step": 170
},
{
"epoch": 1.0650887573964498,
"grad_norm": 0.5482797026634216,
"learning_rate": 0.0004470414201183432,
"loss": 4.826501083374024,
"step": 180
},
{
"epoch": 1.1242603550295858,
"grad_norm": 0.473796546459198,
"learning_rate": 0.0004440828402366864,
"loss": 4.809365081787109,
"step": 190
},
{
"epoch": 1.183431952662722,
"grad_norm": 0.5151321291923523,
"learning_rate": 0.0004411242603550296,
"loss": 4.864156723022461,
"step": 200
},
{
"epoch": 1.242603550295858,
"grad_norm": 0.6074804663658142,
"learning_rate": 0.0004381656804733728,
"loss": 4.838579559326172,
"step": 210
},
{
"epoch": 1.301775147928994,
"grad_norm": 0.5551325678825378,
"learning_rate": 0.00043520710059171596,
"loss": 4.841543579101563,
"step": 220
},
{
"epoch": 1.3609467455621302,
"grad_norm": 0.566065788269043,
"learning_rate": 0.00043224852071005915,
"loss": 4.785538864135742,
"step": 230
},
{
"epoch": 1.4201183431952662,
"grad_norm": 0.5819883942604065,
"learning_rate": 0.0004292899408284024,
"loss": 4.791210556030274,
"step": 240
},
{
"epoch": 1.4792899408284024,
"grad_norm": 0.6059792637825012,
"learning_rate": 0.0004263313609467456,
"loss": 4.756925582885742,
"step": 250
},
{
"epoch": 1.5384615384615383,
"grad_norm": 0.7058536410331726,
"learning_rate": 0.00042337278106508873,
"loss": 4.7325084686279295,
"step": 260
},
{
"epoch": 1.5976331360946747,
"grad_norm": 0.5290840864181519,
"learning_rate": 0.000420414201183432,
"loss": 4.736005020141602,
"step": 270
},
{
"epoch": 1.6568047337278107,
"grad_norm": 0.543929934501648,
"learning_rate": 0.00041745562130177517,
"loss": 4.721459197998047,
"step": 280
},
{
"epoch": 1.7159763313609466,
"grad_norm": 0.587887704372406,
"learning_rate": 0.00041449704142011837,
"loss": 4.697582244873047,
"step": 290
},
{
"epoch": 1.7751479289940828,
"grad_norm": 0.6189513802528381,
"learning_rate": 0.0004115384615384615,
"loss": 4.6849010467529295,
"step": 300
},
{
"epoch": 1.834319526627219,
"grad_norm": 0.6452702879905701,
"learning_rate": 0.00040857988165680475,
"loss": 4.6623176574707035,
"step": 310
},
{
"epoch": 1.893491124260355,
"grad_norm": 0.593474805355072,
"learning_rate": 0.00040562130177514795,
"loss": 4.680774688720703,
"step": 320
},
{
"epoch": 1.952662721893491,
"grad_norm": 0.5981247425079346,
"learning_rate": 0.00040266272189349114,
"loss": 4.683719253540039,
"step": 330
},
{
"epoch": 2.0118343195266273,
"grad_norm": 0.6405901312828064,
"learning_rate": 0.0003997041420118343,
"loss": 4.630902481079102,
"step": 340
},
{
"epoch": 2.0710059171597632,
"grad_norm": 0.5495120286941528,
"learning_rate": 0.0003967455621301775,
"loss": 4.565330505371094,
"step": 350
},
{
"epoch": 2.1301775147928996,
"grad_norm": 0.5600634813308716,
"learning_rate": 0.0003937869822485207,
"loss": 4.529523468017578,
"step": 360
},
{
"epoch": 2.1893491124260356,
"grad_norm": 0.5625339150428772,
"learning_rate": 0.0003908284023668639,
"loss": 4.531766128540039,
"step": 370
},
{
"epoch": 2.2485207100591715,
"grad_norm": 0.6504446864128113,
"learning_rate": 0.00038786982248520716,
"loss": 4.5285888671875,
"step": 380
},
{
"epoch": 2.3076923076923075,
"grad_norm": 0.5576902627944946,
"learning_rate": 0.0003849112426035503,
"loss": 4.525382232666016,
"step": 390
},
{
"epoch": 2.366863905325444,
"grad_norm": 0.4833173453807831,
"learning_rate": 0.0003819526627218935,
"loss": 4.554251480102539,
"step": 400
},
{
"epoch": 2.42603550295858,
"grad_norm": 0.6758867502212524,
"learning_rate": 0.0003789940828402367,
"loss": 4.56910400390625,
"step": 410
},
{
"epoch": 2.485207100591716,
"grad_norm": 0.6613295078277588,
"learning_rate": 0.00037603550295857994,
"loss": 4.526834487915039,
"step": 420
},
{
"epoch": 2.544378698224852,
"grad_norm": 0.5260049104690552,
"learning_rate": 0.0003730769230769231,
"loss": 4.503446960449219,
"step": 430
},
{
"epoch": 2.603550295857988,
"grad_norm": 0.60712069272995,
"learning_rate": 0.00037011834319526627,
"loss": 4.499971771240235,
"step": 440
},
{
"epoch": 2.662721893491124,
"grad_norm": 0.5932305455207825,
"learning_rate": 0.00036715976331360946,
"loss": 4.478979873657226,
"step": 450
},
{
"epoch": 2.7218934911242605,
"grad_norm": 0.6632292866706848,
"learning_rate": 0.0003642011834319527,
"loss": 4.521138763427734,
"step": 460
},
{
"epoch": 2.7810650887573964,
"grad_norm": 0.6352905035018921,
"learning_rate": 0.00036124260355029585,
"loss": 4.520418930053711,
"step": 470
},
{
"epoch": 2.8402366863905324,
"grad_norm": 0.5262125730514526,
"learning_rate": 0.00035828402366863904,
"loss": 4.479636764526367,
"step": 480
},
{
"epoch": 2.899408284023669,
"grad_norm": 0.5989189147949219,
"learning_rate": 0.0003553254437869823,
"loss": 4.487276077270508,
"step": 490
},
{
"epoch": 2.9585798816568047,
"grad_norm": 0.767411470413208,
"learning_rate": 0.0003523668639053255,
"loss": 4.505224227905273,
"step": 500
},
{
"epoch": 3.0177514792899407,
"grad_norm": 0.5135788321495056,
"learning_rate": 0.0003494082840236686,
"loss": 4.422508621215821,
"step": 510
},
{
"epoch": 3.076923076923077,
"grad_norm": 0.6293925046920776,
"learning_rate": 0.0003464497041420118,
"loss": 4.3678031921386715,
"step": 520
},
{
"epoch": 3.136094674556213,
"grad_norm": 0.6665500998497009,
"learning_rate": 0.00034349112426035507,
"loss": 4.388924789428711,
"step": 530
},
{
"epoch": 3.195266272189349,
"grad_norm": 0.5690398216247559,
"learning_rate": 0.00034053254437869826,
"loss": 4.389263153076172,
"step": 540
},
{
"epoch": 3.2544378698224854,
"grad_norm": 0.6139602065086365,
"learning_rate": 0.0003375739644970414,
"loss": 4.390654754638672,
"step": 550
},
{
"epoch": 3.3136094674556213,
"grad_norm": 0.5563338398933411,
"learning_rate": 0.0003346153846153846,
"loss": 4.337279510498047,
"step": 560
},
{
"epoch": 3.3727810650887573,
"grad_norm": 0.5675852298736572,
"learning_rate": 0.00033165680473372784,
"loss": 4.345052337646484,
"step": 570
},
{
"epoch": 3.4319526627218933,
"grad_norm": 0.5776380300521851,
"learning_rate": 0.00032869822485207103,
"loss": 4.363264846801758,
"step": 580
},
{
"epoch": 3.4911242603550297,
"grad_norm": 0.6946626901626587,
"learning_rate": 0.0003257396449704142,
"loss": 4.355237579345703,
"step": 590
},
{
"epoch": 3.5502958579881656,
"grad_norm": 0.6529305577278137,
"learning_rate": 0.0003227810650887574,
"loss": 4.337129211425781,
"step": 600
},
{
"epoch": 3.609467455621302,
"grad_norm": 0.5602537989616394,
"learning_rate": 0.0003198224852071006,
"loss": 4.341841125488282,
"step": 610
},
{
"epoch": 3.668639053254438,
"grad_norm": 0.5301386713981628,
"learning_rate": 0.0003168639053254438,
"loss": 4.362986755371094,
"step": 620
},
{
"epoch": 3.727810650887574,
"grad_norm": 0.6010480523109436,
"learning_rate": 0.00031390532544378695,
"loss": 4.322038269042968,
"step": 630
},
{
"epoch": 3.78698224852071,
"grad_norm": 0.6022279858589172,
"learning_rate": 0.0003109467455621302,
"loss": 4.359962844848633,
"step": 640
},
{
"epoch": 3.8461538461538463,
"grad_norm": 0.56232088804245,
"learning_rate": 0.0003079881656804734,
"loss": 4.3375293731689455,
"step": 650
},
{
"epoch": 3.905325443786982,
"grad_norm": 0.7015820741653442,
"learning_rate": 0.0003050295857988166,
"loss": 4.334150695800782,
"step": 660
},
{
"epoch": 3.9644970414201186,
"grad_norm": 0.6077319383621216,
"learning_rate": 0.0003020710059171597,
"loss": 4.341176986694336,
"step": 670
},
{
"epoch": 4.023668639053255,
"grad_norm": 0.773983359336853,
"learning_rate": 0.00029911242603550297,
"loss": 4.262639999389648,
"step": 680
},
{
"epoch": 4.0828402366863905,
"grad_norm": 0.5960440635681152,
"learning_rate": 0.00029615384615384616,
"loss": 4.2081657409667965,
"step": 690
},
{
"epoch": 4.1420118343195265,
"grad_norm": 0.5495953559875488,
"learning_rate": 0.00029319526627218936,
"loss": 4.228216171264648,
"step": 700
},
{
"epoch": 4.201183431952662,
"grad_norm": 0.6150968074798584,
"learning_rate": 0.0002902366863905325,
"loss": 4.252474975585938,
"step": 710
},
{
"epoch": 4.260355029585799,
"grad_norm": 0.7338055372238159,
"learning_rate": 0.00028727810650887574,
"loss": 4.226696395874024,
"step": 720
},
{
"epoch": 4.319526627218935,
"grad_norm": 0.6750577092170715,
"learning_rate": 0.00028431952662721894,
"loss": 4.212493133544922,
"step": 730
},
{
"epoch": 4.378698224852071,
"grad_norm": 0.6345236897468567,
"learning_rate": 0.00028136094674556213,
"loss": 4.218838500976562,
"step": 740
},
{
"epoch": 4.437869822485207,
"grad_norm": 0.6776763200759888,
"learning_rate": 0.0002784023668639054,
"loss": 4.217085266113282,
"step": 750
},
{
"epoch": 4.497041420118343,
"grad_norm": 0.6580626368522644,
"learning_rate": 0.0002754437869822485,
"loss": 4.237897491455078,
"step": 760
},
{
"epoch": 4.556213017751479,
"grad_norm": 0.5971556305885315,
"learning_rate": 0.0002724852071005917,
"loss": 4.22449951171875,
"step": 770
},
{
"epoch": 4.615384615384615,
"grad_norm": 0.6069461107254028,
"learning_rate": 0.0002695266272189349,
"loss": 4.191236877441407,
"step": 780
},
{
"epoch": 4.674556213017752,
"grad_norm": 0.7110677361488342,
"learning_rate": 0.00026656804733727815,
"loss": 4.21960334777832,
"step": 790
},
{
"epoch": 4.733727810650888,
"grad_norm": 0.6254327893257141,
"learning_rate": 0.0002636094674556213,
"loss": 4.211502456665039,
"step": 800
},
{
"epoch": 4.792899408284024,
"grad_norm": 0.6190422773361206,
"learning_rate": 0.0002606508875739645,
"loss": 4.2044940948486325,
"step": 810
},
{
"epoch": 4.85207100591716,
"grad_norm": 0.6811033487319946,
"learning_rate": 0.0002576923076923077,
"loss": 4.237732696533203,
"step": 820
},
{
"epoch": 4.911242603550296,
"grad_norm": 0.5956006646156311,
"learning_rate": 0.00025473372781065093,
"loss": 4.215926742553711,
"step": 830
},
{
"epoch": 4.970414201183432,
"grad_norm": 0.6755359172821045,
"learning_rate": 0.00025177514792899407,
"loss": 4.18463363647461,
"step": 840
},
{
"epoch": 5.029585798816568,
"grad_norm": 0.6072905659675598,
"learning_rate": 0.0002488165680473373,
"loss": 4.154659271240234,
"step": 850
},
{
"epoch": 5.088757396449704,
"grad_norm": 0.6316264271736145,
"learning_rate": 0.00024585798816568045,
"loss": 4.110084533691406,
"step": 860
},
{
"epoch": 5.14792899408284,
"grad_norm": 0.5995630621910095,
"learning_rate": 0.00024289940828402368,
"loss": 4.094839477539063,
"step": 870
},
{
"epoch": 5.207100591715976,
"grad_norm": 0.5662926435470581,
"learning_rate": 0.00023994082840236687,
"loss": 4.120201492309571,
"step": 880
},
{
"epoch": 5.266272189349112,
"grad_norm": 0.5866499543190002,
"learning_rate": 0.00023698224852071006,
"loss": 4.091806411743164,
"step": 890
},
{
"epoch": 5.325443786982248,
"grad_norm": 0.6538463830947876,
"learning_rate": 0.00023402366863905326,
"loss": 4.110548400878907,
"step": 900
},
{
"epoch": 5.384615384615385,
"grad_norm": 0.7380921840667725,
"learning_rate": 0.00023106508875739645,
"loss": 4.089152145385742,
"step": 910
},
{
"epoch": 5.443786982248521,
"grad_norm": 0.7094395756721497,
"learning_rate": 0.00022810650887573964,
"loss": 4.125375747680664,
"step": 920
},
{
"epoch": 5.502958579881657,
"grad_norm": 0.6104142069816589,
"learning_rate": 0.00022514792899408284,
"loss": 4.108364105224609,
"step": 930
},
{
"epoch": 5.562130177514793,
"grad_norm": 0.6437958478927612,
"learning_rate": 0.00022218934911242606,
"loss": 4.102787780761719,
"step": 940
},
{
"epoch": 5.621301775147929,
"grad_norm": 0.6497628092765808,
"learning_rate": 0.00021923076923076922,
"loss": 4.098801803588867,
"step": 950
},
{
"epoch": 5.680473372781065,
"grad_norm": 0.7420417666435242,
"learning_rate": 0.00021627218934911244,
"loss": 4.110585784912109,
"step": 960
},
{
"epoch": 5.739644970414201,
"grad_norm": 0.6537092924118042,
"learning_rate": 0.0002133136094674556,
"loss": 4.079868316650391,
"step": 970
},
{
"epoch": 5.798816568047338,
"grad_norm": 0.9173883199691772,
"learning_rate": 0.00021035502958579883,
"loss": 4.0837654113769535,
"step": 980
},
{
"epoch": 5.8579881656804735,
"grad_norm": 0.6213467121124268,
"learning_rate": 0.000207396449704142,
"loss": 4.101559829711914,
"step": 990
},
{
"epoch": 5.9171597633136095,
"grad_norm": 0.700158417224884,
"learning_rate": 0.00020443786982248522,
"loss": 4.107759475708008,
"step": 1000
},
{
"epoch": 5.976331360946745,
"grad_norm": 0.7389625906944275,
"learning_rate": 0.00020147928994082839,
"loss": 4.045748901367188,
"step": 1010
},
{
"epoch": 6.035502958579881,
"grad_norm": 0.629220724105835,
"learning_rate": 0.0001985207100591716,
"loss": 4.003813552856445,
"step": 1020
},
{
"epoch": 6.094674556213017,
"grad_norm": 0.6587775349617004,
"learning_rate": 0.00019556213017751477,
"loss": 3.947599411010742,
"step": 1030
},
{
"epoch": 6.153846153846154,
"grad_norm": 0.6797946691513062,
"learning_rate": 0.000192603550295858,
"loss": 3.9570587158203123,
"step": 1040
},
{
"epoch": 6.21301775147929,
"grad_norm": 0.8000279068946838,
"learning_rate": 0.00018964497041420121,
"loss": 3.9946006774902343,
"step": 1050
},
{
"epoch": 6.272189349112426,
"grad_norm": 0.7699520587921143,
"learning_rate": 0.00018668639053254438,
"loss": 3.9914344787597655,
"step": 1060
},
{
"epoch": 6.331360946745562,
"grad_norm": 0.7474783062934875,
"learning_rate": 0.0001837278106508876,
"loss": 3.9896411895751953,
"step": 1070
},
{
"epoch": 6.390532544378698,
"grad_norm": 0.6568964719772339,
"learning_rate": 0.00018076923076923077,
"loss": 3.9945484161376954,
"step": 1080
},
{
"epoch": 6.449704142011834,
"grad_norm": 0.702962338924408,
"learning_rate": 0.000177810650887574,
"loss": 3.9896453857421874,
"step": 1090
},
{
"epoch": 6.508875739644971,
"grad_norm": 0.8072907328605652,
"learning_rate": 0.00017485207100591716,
"loss": 3.9789073944091795,
"step": 1100
},
{
"epoch": 6.568047337278107,
"grad_norm": 0.690667986869812,
"learning_rate": 0.00017189349112426038,
"loss": 3.9628318786621093,
"step": 1110
},
{
"epoch": 6.627218934911243,
"grad_norm": 0.7332726716995239,
"learning_rate": 0.00016893491124260354,
"loss": 4.001555633544922,
"step": 1120
},
{
"epoch": 6.686390532544379,
"grad_norm": 0.7399805784225464,
"learning_rate": 0.00016597633136094676,
"loss": 3.987625503540039,
"step": 1130
},
{
"epoch": 6.745562130177515,
"grad_norm": 1.0256022214889526,
"learning_rate": 0.00016301775147928993,
"loss": 3.9571834564208985,
"step": 1140
},
{
"epoch": 6.804733727810651,
"grad_norm": 0.7827850580215454,
"learning_rate": 0.00016005917159763315,
"loss": 3.9762195587158202,
"step": 1150
},
{
"epoch": 6.8639053254437865,
"grad_norm": 0.7092675566673279,
"learning_rate": 0.00015710059171597632,
"loss": 3.9586578369140626,
"step": 1160
},
{
"epoch": 6.923076923076923,
"grad_norm": 0.7039374709129333,
"learning_rate": 0.00015414201183431954,
"loss": 3.944875717163086,
"step": 1170
},
{
"epoch": 6.982248520710059,
"grad_norm": 0.7573893070220947,
"learning_rate": 0.00015118343195266273,
"loss": 3.975397491455078,
"step": 1180
},
{
"epoch": 7.041420118343195,
"grad_norm": 0.7940344214439392,
"learning_rate": 0.00014822485207100592,
"loss": 3.8859161376953124,
"step": 1190
},
{
"epoch": 7.100591715976331,
"grad_norm": 0.8005825877189636,
"learning_rate": 0.00014526627218934912,
"loss": 3.8561363220214844,
"step": 1200
},
{
"epoch": 7.159763313609467,
"grad_norm": 0.7510560750961304,
"learning_rate": 0.0001423076923076923,
"loss": 3.842996597290039,
"step": 1210
},
{
"epoch": 7.218934911242604,
"grad_norm": 0.7474063038825989,
"learning_rate": 0.0001393491124260355,
"loss": 3.8655860900878904,
"step": 1220
},
{
"epoch": 7.27810650887574,
"grad_norm": 0.7399153113365173,
"learning_rate": 0.0001363905325443787,
"loss": 3.8691051483154295,
"step": 1230
},
{
"epoch": 7.337278106508876,
"grad_norm": 0.6961866021156311,
"learning_rate": 0.0001334319526627219,
"loss": 3.8814228057861326,
"step": 1240
},
{
"epoch": 7.396449704142012,
"grad_norm": 0.7503266334533691,
"learning_rate": 0.00013047337278106509,
"loss": 3.860675811767578,
"step": 1250
},
{
"epoch": 7.455621301775148,
"grad_norm": 0.7707279920578003,
"learning_rate": 0.00012751479289940828,
"loss": 3.8663909912109373,
"step": 1260
},
{
"epoch": 7.514792899408284,
"grad_norm": 0.7248626947402954,
"learning_rate": 0.00012455621301775147,
"loss": 3.8687854766845704,
"step": 1270
},
{
"epoch": 7.57396449704142,
"grad_norm": 0.7378124594688416,
"learning_rate": 0.00012159763313609468,
"loss": 3.853357696533203,
"step": 1280
},
{
"epoch": 7.633136094674557,
"grad_norm": 0.7708460092544556,
"learning_rate": 0.00011863905325443787,
"loss": 3.8905601501464844,
"step": 1290
},
{
"epoch": 7.6923076923076925,
"grad_norm": 0.6937795877456665,
"learning_rate": 0.00011568047337278107,
"loss": 3.87835578918457,
"step": 1300
},
{
"epoch": 7.7514792899408285,
"grad_norm": 0.8977406620979309,
"learning_rate": 0.00011272189349112426,
"loss": 3.865726852416992,
"step": 1310
},
{
"epoch": 7.810650887573964,
"grad_norm": 0.7240127921104431,
"learning_rate": 0.00010976331360946746,
"loss": 3.846134567260742,
"step": 1320
},
{
"epoch": 7.8698224852071,
"grad_norm": 0.7820615768432617,
"learning_rate": 0.00010680473372781065,
"loss": 3.8235801696777343,
"step": 1330
},
{
"epoch": 7.928994082840236,
"grad_norm": 0.7931578755378723,
"learning_rate": 0.00010384615384615386,
"loss": 3.852934646606445,
"step": 1340
},
{
"epoch": 7.988165680473373,
"grad_norm": 0.7435231804847717,
"learning_rate": 0.00010088757396449705,
"loss": 3.8489166259765626,
"step": 1350
},
{
"epoch": 8.04733727810651,
"grad_norm": 0.7691823244094849,
"learning_rate": 9.792899408284024e-05,
"loss": 3.794635009765625,
"step": 1360
},
{
"epoch": 8.106508875739644,
"grad_norm": 0.885684609413147,
"learning_rate": 9.497041420118344e-05,
"loss": 3.787654495239258,
"step": 1370
},
{
"epoch": 8.165680473372781,
"grad_norm": 0.8940234184265137,
"learning_rate": 9.201183431952663e-05,
"loss": 3.756052780151367,
"step": 1380
},
{
"epoch": 8.224852071005918,
"grad_norm": 0.7225572466850281,
"learning_rate": 8.905325443786982e-05,
"loss": 3.724110412597656,
"step": 1390
},
{
"epoch": 8.284023668639053,
"grad_norm": 0.792807936668396,
"learning_rate": 8.609467455621302e-05,
"loss": 3.75240478515625,
"step": 1400
},
{
"epoch": 8.34319526627219,
"grad_norm": 0.8160039782524109,
"learning_rate": 8.313609467455621e-05,
"loss": 3.7542896270751953,
"step": 1410
},
{
"epoch": 8.402366863905325,
"grad_norm": 0.715473473072052,
"learning_rate": 8.01775147928994e-05,
"loss": 3.817658233642578,
"step": 1420
},
{
"epoch": 8.461538461538462,
"grad_norm": 0.8090062141418457,
"learning_rate": 7.72189349112426e-05,
"loss": 3.7604396820068358,
"step": 1430
},
{
"epoch": 8.520710059171599,
"grad_norm": 0.726865828037262,
"learning_rate": 7.426035502958579e-05,
"loss": 3.7455059051513673,
"step": 1440
},
{
"epoch": 8.579881656804734,
"grad_norm": 0.7755900621414185,
"learning_rate": 7.1301775147929e-05,
"loss": 3.7822811126708986,
"step": 1450
},
{
"epoch": 8.63905325443787,
"grad_norm": 0.7525601983070374,
"learning_rate": 6.834319526627219e-05,
"loss": 3.7710426330566404,
"step": 1460
},
{
"epoch": 8.698224852071005,
"grad_norm": 0.7370349764823914,
"learning_rate": 6.538461538461539e-05,
"loss": 3.7621829986572264,
"step": 1470
},
{
"epoch": 8.757396449704142,
"grad_norm": 0.7664944529533386,
"learning_rate": 6.242603550295858e-05,
"loss": 3.7525020599365235,
"step": 1480
},
{
"epoch": 8.816568047337277,
"grad_norm": 0.8167346119880676,
"learning_rate": 5.946745562130178e-05,
"loss": 3.7805561065673827,
"step": 1490
},
{
"epoch": 8.875739644970414,
"grad_norm": 0.7823934555053711,
"learning_rate": 5.6508875739644974e-05,
"loss": 3.766466522216797,
"step": 1500
},
{
"epoch": 8.934911242603551,
"grad_norm": 0.8203352093696594,
"learning_rate": 5.355029585798817e-05,
"loss": 3.7743297576904298,
"step": 1510
},
{
"epoch": 8.994082840236686,
"grad_norm": 0.7480125427246094,
"learning_rate": 5.059171597633136e-05,
"loss": 3.7630767822265625,
"step": 1520
},
{
"epoch": 9.053254437869823,
"grad_norm": 0.7367929220199585,
"learning_rate": 4.763313609467456e-05,
"loss": 3.7045642852783205,
"step": 1530
},
{
"epoch": 9.112426035502958,
"grad_norm": 0.7291252017021179,
"learning_rate": 4.4674556213017755e-05,
"loss": 3.7382125854492188,
"step": 1540
},
{
"epoch": 9.171597633136095,
"grad_norm": 0.7637320756912231,
"learning_rate": 4.171597633136095e-05,
"loss": 3.7042491912841795,
"step": 1550
},
{
"epoch": 9.23076923076923,
"grad_norm": 0.7738555669784546,
"learning_rate": 3.875739644970414e-05,
"loss": 3.703077697753906,
"step": 1560
},
{
"epoch": 9.289940828402367,
"grad_norm": 0.7595531940460205,
"learning_rate": 3.5798816568047336e-05,
"loss": 3.7166164398193358,
"step": 1570
},
{
"epoch": 9.349112426035504,
"grad_norm": 0.7209826707839966,
"learning_rate": 3.284023668639053e-05,
"loss": 3.7272975921630858,
"step": 1580
},
{
"epoch": 9.408284023668639,
"grad_norm": 0.7385886907577515,
"learning_rate": 2.9881656804733726e-05,
"loss": 3.710719680786133,
"step": 1590
},
{
"epoch": 9.467455621301776,
"grad_norm": 0.7908353805541992,
"learning_rate": 2.6923076923076927e-05,
"loss": 3.7108623504638674,
"step": 1600
},
{
"epoch": 9.52662721893491,
"grad_norm": 0.7293062210083008,
"learning_rate": 2.396449704142012e-05,
"loss": 3.6832290649414063,
"step": 1610
},
{
"epoch": 9.585798816568047,
"grad_norm": 0.7990091443061829,
"learning_rate": 2.1005917159763314e-05,
"loss": 3.693344497680664,
"step": 1620
},
{
"epoch": 9.644970414201183,
"grad_norm": 0.7727529406547546,
"learning_rate": 1.804733727810651e-05,
"loss": 3.704065704345703,
"step": 1630
},
{
"epoch": 9.70414201183432,
"grad_norm": 0.7558280825614929,
"learning_rate": 1.5088757396449705e-05,
"loss": 3.701119232177734,
"step": 1640
},
{
"epoch": 9.763313609467456,
"grad_norm": 0.7217801213264465,
"learning_rate": 1.21301775147929e-05,
"loss": 3.6759807586669924,
"step": 1650
},
{
"epoch": 9.822485207100591,
"grad_norm": 0.7166690826416016,
"learning_rate": 9.171597633136093e-06,
"loss": 3.691928482055664,
"step": 1660
},
{
"epoch": 9.881656804733728,
"grad_norm": 0.7086900472640991,
"learning_rate": 6.2130177514792895e-06,
"loss": 3.679682159423828,
"step": 1670
},
{
"epoch": 9.940828402366863,
"grad_norm": 0.7332860827445984,
"learning_rate": 3.2544378698224853e-06,
"loss": 3.7041976928710936,
"step": 1680
},
{
"epoch": 10.0,
"grad_norm": 0.7306056022644043,
"learning_rate": 2.958579881656805e-07,
"loss": 3.6652008056640626,
"step": 1690
}
],
"logging_steps": 10,
"max_steps": 1690,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 999999,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1047519874252800.0,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}