fasthypernet-11 / checkpoint-800 /trainer_state.json
aixk's picture
Upload folder using huggingface_hub
fcba4d0 verified
Raw
History Blame Contribute Delete
14.2 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.16798782088298597,
"eval_steps": 500,
"global_step": 800,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.002099847761037325,
"grad_norm": 22925.884765625,
"learning_rate": 1.9999999999999996e-07,
"loss": 9.5004,
"step": 10
},
{
"epoch": 0.00419969552207465,
"grad_norm": 1589.221435546875,
"learning_rate": 1.2e-06,
"loss": 8.7173,
"step": 20
},
{
"epoch": 0.006299543283111974,
"grad_norm": 577.2943115234375,
"learning_rate": 2.1999999999999997e-06,
"loss": 7.6284,
"step": 30
},
{
"epoch": 0.0083993910441493,
"grad_norm": 308.8800048828125,
"learning_rate": 3.1999999999999994e-06,
"loss": 7.2988,
"step": 40
},
{
"epoch": 0.010499238805186623,
"grad_norm": 458.5738220214844,
"learning_rate": 4.2e-06,
"loss": 7.1397,
"step": 50
},
{
"epoch": 0.012599086566223949,
"grad_norm": 2117.726806640625,
"learning_rate": 5.199999999999999e-06,
"loss": 7.0424,
"step": 60
},
{
"epoch": 0.014698934327261274,
"grad_norm": 784.7866821289062,
"learning_rate": 6.199999999999999e-06,
"loss": 6.9896,
"step": 70
},
{
"epoch": 0.0167987820882986,
"grad_norm": 719.2965087890625,
"learning_rate": 7.2e-06,
"loss": 6.9514,
"step": 80
},
{
"epoch": 0.018898629849335925,
"grad_norm": 887.7239379882812,
"learning_rate": 8.2e-06,
"loss": 6.9188,
"step": 90
},
{
"epoch": 0.020998477610373247,
"grad_norm": 657.1996459960938,
"learning_rate": 9.199999999999998e-06,
"loss": 6.9113,
"step": 100
},
{
"epoch": 0.023098325371410572,
"grad_norm": 1241.19482421875,
"learning_rate": 1.02e-05,
"loss": 6.8953,
"step": 110
},
{
"epoch": 0.025198173132447897,
"grad_norm": 411.5585021972656,
"learning_rate": 1.12e-05,
"loss": 6.8474,
"step": 120
},
{
"epoch": 0.027298020893485223,
"grad_norm": 1062.7774658203125,
"learning_rate": 1.2199999999999998e-05,
"loss": 6.8514,
"step": 130
},
{
"epoch": 0.029397868654522548,
"grad_norm": 148.0970001220703,
"learning_rate": 1.3199999999999997e-05,
"loss": 6.8698,
"step": 140
},
{
"epoch": 0.03149771641555987,
"grad_norm": 280.5868835449219,
"learning_rate": 1.4199999999999998e-05,
"loss": 6.8395,
"step": 150
},
{
"epoch": 0.0335975641765972,
"grad_norm": 407.1022644042969,
"learning_rate": 1.5199999999999998e-05,
"loss": 6.8029,
"step": 160
},
{
"epoch": 0.035697411937634524,
"grad_norm": 166.18153381347656,
"learning_rate": 1.6199999999999997e-05,
"loss": 6.7946,
"step": 170
},
{
"epoch": 0.03779725969867185,
"grad_norm": 234.69805908203125,
"learning_rate": 1.7199999999999998e-05,
"loss": 6.7898,
"step": 180
},
{
"epoch": 0.03989710745970917,
"grad_norm": 917.2261352539062,
"learning_rate": 1.82e-05,
"loss": 6.7996,
"step": 190
},
{
"epoch": 0.04199695522074649,
"grad_norm": 237.35519409179688,
"learning_rate": 1.92e-05,
"loss": 6.7733,
"step": 200
},
{
"epoch": 0.04409680298178382,
"grad_norm": 49.55766296386719,
"learning_rate": 2.0199999999999996e-05,
"loss": 6.7318,
"step": 210
},
{
"epoch": 0.046196650742821144,
"grad_norm": 152.66554260253906,
"learning_rate": 2.12e-05,
"loss": 6.6867,
"step": 220
},
{
"epoch": 0.04829649850385847,
"grad_norm": 284.306640625,
"learning_rate": 2.2199999999999998e-05,
"loss": 6.6555,
"step": 230
},
{
"epoch": 0.050396346264895794,
"grad_norm": 127.93234252929688,
"learning_rate": 2.3199999999999998e-05,
"loss": 6.6263,
"step": 240
},
{
"epoch": 0.05249619402593312,
"grad_norm": 119.77033996582031,
"learning_rate": 2.42e-05,
"loss": 6.649,
"step": 250
},
{
"epoch": 0.054596041786970445,
"grad_norm": 389.56536865234375,
"learning_rate": 2.52e-05,
"loss": 6.6383,
"step": 260
},
{
"epoch": 0.05669588954800777,
"grad_norm": 427.01580810546875,
"learning_rate": 2.6199999999999996e-05,
"loss": 6.593,
"step": 270
},
{
"epoch": 0.058795737309045096,
"grad_norm": 222.83114624023438,
"learning_rate": 2.72e-05,
"loss": 6.5701,
"step": 280
},
{
"epoch": 0.06089558507008242,
"grad_norm": 92.09854125976562,
"learning_rate": 2.8199999999999998e-05,
"loss": 6.5495,
"step": 290
},
{
"epoch": 0.06299543283111975,
"grad_norm": 137.1016082763672,
"learning_rate": 2.9199999999999995e-05,
"loss": 6.5433,
"step": 300
},
{
"epoch": 0.06509528059215706,
"grad_norm": 165.11099243164062,
"learning_rate": 3.02e-05,
"loss": 6.5528,
"step": 310
},
{
"epoch": 0.0671951283531944,
"grad_norm": 193.72972106933594,
"learning_rate": 3.119999999999999e-05,
"loss": 6.4983,
"step": 320
},
{
"epoch": 0.06929497611423172,
"grad_norm": 168.2730255126953,
"learning_rate": 3.22e-05,
"loss": 6.4875,
"step": 330
},
{
"epoch": 0.07139482387526905,
"grad_norm": 204.45751953125,
"learning_rate": 3.3199999999999994e-05,
"loss": 6.4667,
"step": 340
},
{
"epoch": 0.07349467163630637,
"grad_norm": 200.1185302734375,
"learning_rate": 3.42e-05,
"loss": 6.4163,
"step": 350
},
{
"epoch": 0.0755945193973437,
"grad_norm": 212.8289337158203,
"learning_rate": 3.5199999999999995e-05,
"loss": 6.4009,
"step": 360
},
{
"epoch": 0.07769436715838102,
"grad_norm": 67.6531982421875,
"learning_rate": 3.62e-05,
"loss": 6.3942,
"step": 370
},
{
"epoch": 0.07979421491941834,
"grad_norm": 103.08153533935547,
"learning_rate": 3.7199999999999996e-05,
"loss": 6.37,
"step": 380
},
{
"epoch": 0.08189406268045567,
"grad_norm": 155.30517578125,
"learning_rate": 3.8199999999999993e-05,
"loss": 6.3541,
"step": 390
},
{
"epoch": 0.08399391044149299,
"grad_norm": 78.574462890625,
"learning_rate": 3.919999999999999e-05,
"loss": 6.331,
"step": 400
},
{
"epoch": 0.08609375820253032,
"grad_norm": 293.90155029296875,
"learning_rate": 4.02e-05,
"loss": 6.2978,
"step": 410
},
{
"epoch": 0.08819360596356764,
"grad_norm": 133.43336486816406,
"learning_rate": 4.12e-05,
"loss": 6.2921,
"step": 420
},
{
"epoch": 0.09029345372460497,
"grad_norm": 105.68527221679688,
"learning_rate": 4.2199999999999996e-05,
"loss": 6.2955,
"step": 430
},
{
"epoch": 0.09239330148564229,
"grad_norm": 91.55309295654297,
"learning_rate": 4.319999999999999e-05,
"loss": 6.2592,
"step": 440
},
{
"epoch": 0.09449314924667962,
"grad_norm": 72.15143585205078,
"learning_rate": 4.42e-05,
"loss": 6.2545,
"step": 450
},
{
"epoch": 0.09659299700771694,
"grad_norm": 109.66728210449219,
"learning_rate": 4.5199999999999994e-05,
"loss": 6.2325,
"step": 460
},
{
"epoch": 0.09869284476875427,
"grad_norm": 69.46297454833984,
"learning_rate": 4.62e-05,
"loss": 6.1691,
"step": 470
},
{
"epoch": 0.10079269252979159,
"grad_norm": 137.57276916503906,
"learning_rate": 4.7199999999999995e-05,
"loss": 6.1748,
"step": 480
},
{
"epoch": 0.10289254029082892,
"grad_norm": 142.85269165039062,
"learning_rate": 4.82e-05,
"loss": 6.1763,
"step": 490
},
{
"epoch": 0.10499238805186624,
"grad_norm": 68.21001434326172,
"learning_rate": 4.9199999999999997e-05,
"loss": 6.1683,
"step": 500
},
{
"epoch": 0.10709223581290356,
"grad_norm": 190.91734313964844,
"learning_rate": 5.0199999999999994e-05,
"loss": 6.1276,
"step": 510
},
{
"epoch": 0.10919208357394089,
"grad_norm": 96.1802978515625,
"learning_rate": 5.119999999999999e-05,
"loss": 6.1462,
"step": 520
},
{
"epoch": 0.11129193133497821,
"grad_norm": 67.83528137207031,
"learning_rate": 5.2199999999999995e-05,
"loss": 6.1067,
"step": 530
},
{
"epoch": 0.11339177909601554,
"grad_norm": 42.651100158691406,
"learning_rate": 5.32e-05,
"loss": 6.0776,
"step": 540
},
{
"epoch": 0.11549162685705286,
"grad_norm": 79.75711822509766,
"learning_rate": 5.4199999999999996e-05,
"loss": 6.0815,
"step": 550
},
{
"epoch": 0.11759147461809019,
"grad_norm": 46.156211853027344,
"learning_rate": 5.519999999999999e-05,
"loss": 6.053,
"step": 560
},
{
"epoch": 0.11969132237912751,
"grad_norm": 45.88727951049805,
"learning_rate": 5.619999999999999e-05,
"loss": 6.0348,
"step": 570
},
{
"epoch": 0.12179117014016484,
"grad_norm": 46.44386672973633,
"learning_rate": 5.72e-05,
"loss": 6.0195,
"step": 580
},
{
"epoch": 0.12389101790120216,
"grad_norm": 70.52837371826172,
"learning_rate": 5.82e-05,
"loss": 5.9979,
"step": 590
},
{
"epoch": 0.1259908656622395,
"grad_norm": 59.506553649902344,
"learning_rate": 5.9199999999999996e-05,
"loss": 5.983,
"step": 600
},
{
"epoch": 0.12809071342327683,
"grad_norm": 38.77995681762695,
"learning_rate": 6.019999999999999e-05,
"loss": 5.9576,
"step": 610
},
{
"epoch": 0.13019056118431413,
"grad_norm": 62.45197677612305,
"learning_rate": 6.12e-05,
"loss": 5.951,
"step": 620
},
{
"epoch": 0.13229040894535146,
"grad_norm": 46.94855499267578,
"learning_rate": 6.22e-05,
"loss": 5.9626,
"step": 630
},
{
"epoch": 0.1343902567063888,
"grad_norm": 54.95368194580078,
"learning_rate": 6.319999999999999e-05,
"loss": 5.9268,
"step": 640
},
{
"epoch": 0.1364901044674261,
"grad_norm": 47.36136245727539,
"learning_rate": 6.419999999999999e-05,
"loss": 5.8941,
"step": 650
},
{
"epoch": 0.13858995222846343,
"grad_norm": 40.393096923828125,
"learning_rate": 6.519999999999999e-05,
"loss": 5.8787,
"step": 660
},
{
"epoch": 0.14068979998950076,
"grad_norm": 41.42562484741211,
"learning_rate": 6.62e-05,
"loss": 5.8632,
"step": 670
},
{
"epoch": 0.1427896477505381,
"grad_norm": 41.52008056640625,
"learning_rate": 6.72e-05,
"loss": 5.8166,
"step": 680
},
{
"epoch": 0.1448894955115754,
"grad_norm": 60.34001922607422,
"learning_rate": 6.819999999999999e-05,
"loss": 5.8412,
"step": 690
},
{
"epoch": 0.14698934327261273,
"grad_norm": 45.22390365600586,
"learning_rate": 6.919999999999999e-05,
"loss": 5.7904,
"step": 700
},
{
"epoch": 0.14908919103365006,
"grad_norm": 40.19221496582031,
"learning_rate": 7.02e-05,
"loss": 5.7796,
"step": 710
},
{
"epoch": 0.1511890387946874,
"grad_norm": 38.9415283203125,
"learning_rate": 7.12e-05,
"loss": 5.7776,
"step": 720
},
{
"epoch": 0.1532888865557247,
"grad_norm": 36.409732818603516,
"learning_rate": 7.219999999999999e-05,
"loss": 5.7442,
"step": 730
},
{
"epoch": 0.15538873431676203,
"grad_norm": 33.082157135009766,
"learning_rate": 7.319999999999999e-05,
"loss": 5.7215,
"step": 740
},
{
"epoch": 0.15748858207779937,
"grad_norm": 40.2638053894043,
"learning_rate": 7.419999999999999e-05,
"loss": 5.6798,
"step": 750
},
{
"epoch": 0.15958842983883667,
"grad_norm": 36.72783660888672,
"learning_rate": 7.519999999999998e-05,
"loss": 5.6984,
"step": 760
},
{
"epoch": 0.161688277599874,
"grad_norm": 40.32900619506836,
"learning_rate": 7.62e-05,
"loss": 5.6429,
"step": 770
},
{
"epoch": 0.16378812536091134,
"grad_norm": 31.345502853393555,
"learning_rate": 7.72e-05,
"loss": 5.6839,
"step": 780
},
{
"epoch": 0.16588797312194867,
"grad_norm": 42.13299560546875,
"learning_rate": 7.819999999999999e-05,
"loss": 5.641,
"step": 790
},
{
"epoch": 0.16798782088298597,
"grad_norm": 42.9160270690918,
"learning_rate": 7.92e-05,
"loss": 5.6259,
"step": 800
}
],
"logging_steps": 10,
"max_steps": 100000,
"num_input_tokens_seen": 0,
"num_train_epochs": 21,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 5.21741415112704e+16,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}