fasthypernet-8 / checkpoint-1000 /trainer_state.json
aixk's picture
Upload folder using huggingface_hub
55b548b verified
Raw
History Blame Contribute Delete
17.5 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.6153609476558594,
"eval_steps": 500,
"global_step": 1000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.006153609476558594,
"grad_norm": 26290.87109375,
"learning_rate": 1.9999999999999996e-07,
"loss": 8.2122,
"step": 10
},
{
"epoch": 0.012307218953117188,
"grad_norm": 1750.26953125,
"learning_rate": 1.2e-06,
"loss": 7.6386,
"step": 20
},
{
"epoch": 0.018460828429675783,
"grad_norm": 235.5290985107422,
"learning_rate": 2.1999999999999997e-06,
"loss": 7.0511,
"step": 30
},
{
"epoch": 0.024614437906234375,
"grad_norm": 317.7790222167969,
"learning_rate": 3.1999999999999994e-06,
"loss": 6.889,
"step": 40
},
{
"epoch": 0.03076804738279297,
"grad_norm": 906.6453247070312,
"learning_rate": 4.2e-06,
"loss": 6.8145,
"step": 50
},
{
"epoch": 0.036921656859351566,
"grad_norm": 1056.044189453125,
"learning_rate": 5.199999999999999e-06,
"loss": 6.7193,
"step": 60
},
{
"epoch": 0.043075266335910155,
"grad_norm": 830.0984497070312,
"learning_rate": 6.199999999999999e-06,
"loss": 6.6406,
"step": 70
},
{
"epoch": 0.04922887581246875,
"grad_norm": 259.50299072265625,
"learning_rate": 7.2e-06,
"loss": 6.6149,
"step": 80
},
{
"epoch": 0.055382485289027346,
"grad_norm": 143.87599182128906,
"learning_rate": 8.2e-06,
"loss": 6.6122,
"step": 90
},
{
"epoch": 0.06153609476558594,
"grad_norm": 435.93017578125,
"learning_rate": 9.199999999999998e-06,
"loss": 6.5612,
"step": 100
},
{
"epoch": 0.06768970424214453,
"grad_norm": 557.260498046875,
"learning_rate": 1.02e-05,
"loss": 6.5083,
"step": 110
},
{
"epoch": 0.07384331371870313,
"grad_norm": 291.8673095703125,
"learning_rate": 1.12e-05,
"loss": 6.5365,
"step": 120
},
{
"epoch": 0.07999692319526172,
"grad_norm": 434.8012390136719,
"learning_rate": 1.2199999999999998e-05,
"loss": 6.5229,
"step": 130
},
{
"epoch": 0.08615053267182031,
"grad_norm": 1767.30908203125,
"learning_rate": 1.3199999999999997e-05,
"loss": 6.4961,
"step": 140
},
{
"epoch": 0.09230414214837891,
"grad_norm": 548.34228515625,
"learning_rate": 1.4199999999999998e-05,
"loss": 6.5135,
"step": 150
},
{
"epoch": 0.0984577516249375,
"grad_norm": 212.0412139892578,
"learning_rate": 1.5199999999999998e-05,
"loss": 6.47,
"step": 160
},
{
"epoch": 0.1046113611014961,
"grad_norm": 220.91732788085938,
"learning_rate": 1.6199999999999997e-05,
"loss": 6.4492,
"step": 170
},
{
"epoch": 0.11076497057805469,
"grad_norm": 275.8125305175781,
"learning_rate": 1.7199999999999998e-05,
"loss": 6.5087,
"step": 180
},
{
"epoch": 0.11691858005461328,
"grad_norm": 205.40353393554688,
"learning_rate": 1.82e-05,
"loss": 6.4695,
"step": 190
},
{
"epoch": 0.12307218953117188,
"grad_norm": 170.36024475097656,
"learning_rate": 1.92e-05,
"loss": 6.4184,
"step": 200
},
{
"epoch": 0.12922579900773049,
"grad_norm": 240.3199462890625,
"learning_rate": 2.0199999999999996e-05,
"loss": 6.4329,
"step": 210
},
{
"epoch": 0.13537940848428906,
"grad_norm": 508.4911193847656,
"learning_rate": 2.12e-05,
"loss": 6.3826,
"step": 220
},
{
"epoch": 0.14153301796084766,
"grad_norm": 117.4170150756836,
"learning_rate": 2.2199999999999998e-05,
"loss": 6.394,
"step": 230
},
{
"epoch": 0.14768662743740626,
"grad_norm": 76.04037475585938,
"learning_rate": 2.3199999999999998e-05,
"loss": 6.3696,
"step": 240
},
{
"epoch": 0.15384023691396484,
"grad_norm": 243.4922332763672,
"learning_rate": 2.42e-05,
"loss": 6.3843,
"step": 250
},
{
"epoch": 0.15999384639052344,
"grad_norm": 84.42725372314453,
"learning_rate": 2.52e-05,
"loss": 6.3401,
"step": 260
},
{
"epoch": 0.16614745586708204,
"grad_norm": 119.90478515625,
"learning_rate": 2.6199999999999996e-05,
"loss": 6.3586,
"step": 270
},
{
"epoch": 0.17230106534364062,
"grad_norm": 101.67578125,
"learning_rate": 2.72e-05,
"loss": 6.3315,
"step": 280
},
{
"epoch": 0.17845467482019922,
"grad_norm": 64.19589233398438,
"learning_rate": 2.8199999999999998e-05,
"loss": 6.3033,
"step": 290
},
{
"epoch": 0.18460828429675782,
"grad_norm": 43.22764205932617,
"learning_rate": 2.9199999999999995e-05,
"loss": 6.3065,
"step": 300
},
{
"epoch": 0.1907618937733164,
"grad_norm": 70.01463317871094,
"learning_rate": 3.02e-05,
"loss": 6.3044,
"step": 310
},
{
"epoch": 0.196915503249875,
"grad_norm": 48.240699768066406,
"learning_rate": 3.119999999999999e-05,
"loss": 6.2598,
"step": 320
},
{
"epoch": 0.2030691127264336,
"grad_norm": 59.44075012207031,
"learning_rate": 3.22e-05,
"loss": 6.2607,
"step": 330
},
{
"epoch": 0.2092227222029922,
"grad_norm": 61.2050666809082,
"learning_rate": 3.3199999999999994e-05,
"loss": 6.2497,
"step": 340
},
{
"epoch": 0.21537633167955078,
"grad_norm": 60.02091598510742,
"learning_rate": 3.42e-05,
"loss": 6.2319,
"step": 350
},
{
"epoch": 0.22152994115610938,
"grad_norm": 41.094627380371094,
"learning_rate": 3.5199999999999995e-05,
"loss": 6.219,
"step": 360
},
{
"epoch": 0.22768355063266799,
"grad_norm": 64.33719635009766,
"learning_rate": 3.62e-05,
"loss": 6.2147,
"step": 370
},
{
"epoch": 0.23383716010922656,
"grad_norm": 62.03013610839844,
"learning_rate": 3.7199999999999996e-05,
"loss": 6.1763,
"step": 380
},
{
"epoch": 0.23999076958578516,
"grad_norm": 181.71493530273438,
"learning_rate": 3.8199999999999993e-05,
"loss": 6.1753,
"step": 390
},
{
"epoch": 0.24614437906234377,
"grad_norm": 80.83346557617188,
"learning_rate": 3.919999999999999e-05,
"loss": 6.1614,
"step": 400
},
{
"epoch": 0.25229798853890234,
"grad_norm": 35.45427703857422,
"learning_rate": 4.02e-05,
"loss": 6.1271,
"step": 410
},
{
"epoch": 0.25845159801546097,
"grad_norm": 44.923248291015625,
"learning_rate": 4.12e-05,
"loss": 6.1036,
"step": 420
},
{
"epoch": 0.26460520749201955,
"grad_norm": 53.389827728271484,
"learning_rate": 4.2199999999999996e-05,
"loss": 6.0938,
"step": 430
},
{
"epoch": 0.2707588169685781,
"grad_norm": 36.64761734008789,
"learning_rate": 4.319999999999999e-05,
"loss": 6.1188,
"step": 440
},
{
"epoch": 0.27691242644513675,
"grad_norm": 73.00870513916016,
"learning_rate": 4.42e-05,
"loss": 6.0647,
"step": 450
},
{
"epoch": 0.2830660359216953,
"grad_norm": 54.08327865600586,
"learning_rate": 4.5199999999999994e-05,
"loss": 6.0432,
"step": 460
},
{
"epoch": 0.2892196453982539,
"grad_norm": 40.13100051879883,
"learning_rate": 4.62e-05,
"loss": 6.0383,
"step": 470
},
{
"epoch": 0.29537325487481253,
"grad_norm": 39.69797134399414,
"learning_rate": 4.7199999999999995e-05,
"loss": 6.0178,
"step": 480
},
{
"epoch": 0.3015268643513711,
"grad_norm": 47.64400863647461,
"learning_rate": 4.82e-05,
"loss": 6.0412,
"step": 490
},
{
"epoch": 0.3076804738279297,
"grad_norm": 59.538387298583984,
"learning_rate": 4.9199999999999997e-05,
"loss": 5.9841,
"step": 500
},
{
"epoch": 0.3138340833044883,
"grad_norm": 63.603389739990234,
"learning_rate": 5.0199999999999994e-05,
"loss": 6.0088,
"step": 510
},
{
"epoch": 0.3199876927810469,
"grad_norm": 50.28224563598633,
"learning_rate": 5.119999999999999e-05,
"loss": 5.9469,
"step": 520
},
{
"epoch": 0.32614130225760546,
"grad_norm": 43.31625747680664,
"learning_rate": 5.2199999999999995e-05,
"loss": 5.9464,
"step": 530
},
{
"epoch": 0.3322949117341641,
"grad_norm": 56.94966506958008,
"learning_rate": 5.32e-05,
"loss": 5.9139,
"step": 540
},
{
"epoch": 0.33844852121072266,
"grad_norm": 97.49286651611328,
"learning_rate": 5.4199999999999996e-05,
"loss": 5.9177,
"step": 550
},
{
"epoch": 0.34460213068728124,
"grad_norm": 57.25851058959961,
"learning_rate": 5.519999999999999e-05,
"loss": 5.8818,
"step": 560
},
{
"epoch": 0.35075574016383987,
"grad_norm": 40.23714065551758,
"learning_rate": 5.619999999999999e-05,
"loss": 5.8755,
"step": 570
},
{
"epoch": 0.35690934964039844,
"grad_norm": 39.241878509521484,
"learning_rate": 5.72e-05,
"loss": 5.8417,
"step": 580
},
{
"epoch": 0.363062959116957,
"grad_norm": 46.391117095947266,
"learning_rate": 5.82e-05,
"loss": 5.8327,
"step": 590
},
{
"epoch": 0.36921656859351565,
"grad_norm": 51.62196350097656,
"learning_rate": 5.9199999999999996e-05,
"loss": 5.7876,
"step": 600
},
{
"epoch": 0.3753701780700742,
"grad_norm": 45.93042755126953,
"learning_rate": 6.019999999999999e-05,
"loss": 5.7931,
"step": 610
},
{
"epoch": 0.3815237875466328,
"grad_norm": 47.86789321899414,
"learning_rate": 6.12e-05,
"loss": 5.7766,
"step": 620
},
{
"epoch": 0.38767739702319143,
"grad_norm": 51.02197265625,
"learning_rate": 6.22e-05,
"loss": 5.7919,
"step": 630
},
{
"epoch": 0.39383100649975,
"grad_norm": 43.17515182495117,
"learning_rate": 6.319999999999999e-05,
"loss": 5.7334,
"step": 640
},
{
"epoch": 0.3999846159763086,
"grad_norm": 38.8260612487793,
"learning_rate": 6.419999999999999e-05,
"loss": 5.7261,
"step": 650
},
{
"epoch": 0.4061382254528672,
"grad_norm": 46.640254974365234,
"learning_rate": 6.519999999999999e-05,
"loss": 5.7115,
"step": 660
},
{
"epoch": 0.4122918349294258,
"grad_norm": 44.81010818481445,
"learning_rate": 6.62e-05,
"loss": 5.6818,
"step": 670
},
{
"epoch": 0.4184454444059844,
"grad_norm": 49.53409957885742,
"learning_rate": 6.72e-05,
"loss": 5.6717,
"step": 680
},
{
"epoch": 0.424599053882543,
"grad_norm": 43.571102142333984,
"learning_rate": 6.819999999999999e-05,
"loss": 5.6472,
"step": 690
},
{
"epoch": 0.43075266335910156,
"grad_norm": 52.427913665771484,
"learning_rate": 6.919999999999999e-05,
"loss": 5.6295,
"step": 700
},
{
"epoch": 0.4369062728356602,
"grad_norm": 41.100425720214844,
"learning_rate": 7.02e-05,
"loss": 5.6157,
"step": 710
},
{
"epoch": 0.44305988231221877,
"grad_norm": 46.8226432800293,
"learning_rate": 7.12e-05,
"loss": 5.5794,
"step": 720
},
{
"epoch": 0.44921349178877734,
"grad_norm": 33.2792854309082,
"learning_rate": 7.219999999999999e-05,
"loss": 5.5731,
"step": 730
},
{
"epoch": 0.45536710126533597,
"grad_norm": 44.90331268310547,
"learning_rate": 7.319999999999999e-05,
"loss": 5.5528,
"step": 740
},
{
"epoch": 0.46152071074189455,
"grad_norm": 48.1407356262207,
"learning_rate": 7.419999999999999e-05,
"loss": 5.5387,
"step": 750
},
{
"epoch": 0.4676743202184531,
"grad_norm": 37.969139099121094,
"learning_rate": 7.519999999999998e-05,
"loss": 5.5043,
"step": 760
},
{
"epoch": 0.47382792969501175,
"grad_norm": 35.248779296875,
"learning_rate": 7.62e-05,
"loss": 5.4854,
"step": 770
},
{
"epoch": 0.4799815391715703,
"grad_norm": 32.92762756347656,
"learning_rate": 7.72e-05,
"loss": 5.4737,
"step": 780
},
{
"epoch": 0.4861351486481289,
"grad_norm": 44.820735931396484,
"learning_rate": 7.819999999999999e-05,
"loss": 5.4688,
"step": 790
},
{
"epoch": 0.49228875812468753,
"grad_norm": 46.39222717285156,
"learning_rate": 7.92e-05,
"loss": 5.4436,
"step": 800
},
{
"epoch": 0.4984423676012461,
"grad_norm": 32.6016845703125,
"learning_rate": 8.019999999999998e-05,
"loss": 5.401,
"step": 810
},
{
"epoch": 0.5045959770778047,
"grad_norm": 35.57933044433594,
"learning_rate": 8.12e-05,
"loss": 5.3821,
"step": 820
},
{
"epoch": 0.5107495865543633,
"grad_norm": 37.136383056640625,
"learning_rate": 8.22e-05,
"loss": 5.3444,
"step": 830
},
{
"epoch": 0.5169031960309219,
"grad_norm": 34.6875,
"learning_rate": 8.319999999999999e-05,
"loss": 5.354,
"step": 840
},
{
"epoch": 0.5230568055074805,
"grad_norm": 40.43978500366211,
"learning_rate": 8.42e-05,
"loss": 5.3268,
"step": 850
},
{
"epoch": 0.5292104149840391,
"grad_norm": 40.99334716796875,
"learning_rate": 8.519999999999998e-05,
"loss": 5.3141,
"step": 860
},
{
"epoch": 0.5353640244605977,
"grad_norm": 32.84165954589844,
"learning_rate": 8.62e-05,
"loss": 5.2781,
"step": 870
},
{
"epoch": 0.5415176339371562,
"grad_norm": 35.99928665161133,
"learning_rate": 8.719999999999999e-05,
"loss": 5.2663,
"step": 880
},
{
"epoch": 0.5476712434137149,
"grad_norm": 36.6622314453125,
"learning_rate": 8.819999999999999e-05,
"loss": 5.2482,
"step": 890
},
{
"epoch": 0.5538248528902735,
"grad_norm": 34.90840530395508,
"learning_rate": 8.92e-05,
"loss": 5.231,
"step": 900
},
{
"epoch": 0.559978462366832,
"grad_norm": 34.32698059082031,
"learning_rate": 9.02e-05,
"loss": 5.1974,
"step": 910
},
{
"epoch": 0.5661320718433906,
"grad_norm": 35.207275390625,
"learning_rate": 9.12e-05,
"loss": 5.1597,
"step": 920
},
{
"epoch": 0.5722856813199493,
"grad_norm": 31.89891815185547,
"learning_rate": 9.219999999999999e-05,
"loss": 5.1325,
"step": 930
},
{
"epoch": 0.5784392907965078,
"grad_norm": 35.24873733520508,
"learning_rate": 9.319999999999999e-05,
"loss": 5.1351,
"step": 940
},
{
"epoch": 0.5845929002730664,
"grad_norm": 31.70831298828125,
"learning_rate": 9.419999999999999e-05,
"loss": 5.1192,
"step": 950
},
{
"epoch": 0.5907465097496251,
"grad_norm": 35.57630920410156,
"learning_rate": 9.52e-05,
"loss": 5.0645,
"step": 960
},
{
"epoch": 0.5969001192261836,
"grad_norm": 29.440296173095703,
"learning_rate": 9.62e-05,
"loss": 5.0909,
"step": 970
},
{
"epoch": 0.6030537287027422,
"grad_norm": 35.24326705932617,
"learning_rate": 9.719999999999999e-05,
"loss": 5.0579,
"step": 980
},
{
"epoch": 0.6092073381793008,
"grad_norm": 29.68679428100586,
"learning_rate": 9.819999999999999e-05,
"loss": 5.0141,
"step": 990
},
{
"epoch": 0.6153609476558594,
"grad_norm": 30.82079315185547,
"learning_rate": 9.919999999999999e-05,
"loss": 5.0224,
"step": 1000
}
],
"logging_steps": 10,
"max_steps": 100000,
"num_input_tokens_seen": 0,
"num_train_epochs": 62,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 7.57685886959616e+16,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}