fasthypernet-6 / checkpoint-800 /trainer_state.json
aixk's picture
Upload folder using huggingface_hub
85c39f8 verified
Raw
History Blame Contribute Delete
14.2 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.12307218953117188,
"eval_steps": 500,
"global_step": 800,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0015384023691396484,
"grad_norm": 11396.142578125,
"learning_rate": 3e-07,
"loss": 8.8759,
"step": 10
},
{
"epoch": 0.003076804738279297,
"grad_norm": 689.1935424804688,
"learning_rate": 1.2999999999999998e-06,
"loss": 8.2644,
"step": 20
},
{
"epoch": 0.004615207107418946,
"grad_norm": 454.8230285644531,
"learning_rate": 2.2999999999999996e-06,
"loss": 7.2145,
"step": 30
},
{
"epoch": 0.006153609476558594,
"grad_norm": 169.3773193359375,
"learning_rate": 3.2999999999999993e-06,
"loss": 6.899,
"step": 40
},
{
"epoch": 0.007692011845698243,
"grad_norm": 121.77935028076172,
"learning_rate": 4.2999999999999995e-06,
"loss": 6.7803,
"step": 50
},
{
"epoch": 0.009230414214837892,
"grad_norm": 1289.1287841796875,
"learning_rate": 5.3e-06,
"loss": 6.5956,
"step": 60
},
{
"epoch": 0.010768816583977539,
"grad_norm": 157.25286865234375,
"learning_rate": 6.3e-06,
"loss": 6.6402,
"step": 70
},
{
"epoch": 0.012307218953117188,
"grad_norm": 384.85919189453125,
"learning_rate": 7.299999999999999e-06,
"loss": 6.4978,
"step": 80
},
{
"epoch": 0.013845621322256836,
"grad_norm": 301.0735778808594,
"learning_rate": 8.299999999999998e-06,
"loss": 6.3964,
"step": 90
},
{
"epoch": 0.015384023691396485,
"grad_norm": 226.9570770263672,
"learning_rate": 9.299999999999999e-06,
"loss": 6.3804,
"step": 100
},
{
"epoch": 0.016922426060536132,
"grad_norm": 101.4676513671875,
"learning_rate": 1.03e-05,
"loss": 6.3698,
"step": 110
},
{
"epoch": 0.018460828429675783,
"grad_norm": 230.73281860351562,
"learning_rate": 1.1299999999999999e-05,
"loss": 6.4247,
"step": 120
},
{
"epoch": 0.01999923079881543,
"grad_norm": 124.10091400146484,
"learning_rate": 1.2299999999999999e-05,
"loss": 6.3109,
"step": 130
},
{
"epoch": 0.021537633167955077,
"grad_norm": 97.28553009033203,
"learning_rate": 1.33e-05,
"loss": 6.3895,
"step": 140
},
{
"epoch": 0.023076035537094728,
"grad_norm": 182.08811950683594,
"learning_rate": 1.43e-05,
"loss": 6.4089,
"step": 150
},
{
"epoch": 0.024614437906234375,
"grad_norm": 433.91973876953125,
"learning_rate": 1.53e-05,
"loss": 6.3014,
"step": 160
},
{
"epoch": 0.026152840275374026,
"grad_norm": 352.3630065917969,
"learning_rate": 1.6299999999999996e-05,
"loss": 6.3332,
"step": 170
},
{
"epoch": 0.027691242644513673,
"grad_norm": 74.03328704833984,
"learning_rate": 1.7299999999999997e-05,
"loss": 6.315,
"step": 180
},
{
"epoch": 0.02922964501365332,
"grad_norm": 264.071044921875,
"learning_rate": 1.8299999999999998e-05,
"loss": 6.3367,
"step": 190
},
{
"epoch": 0.03076804738279297,
"grad_norm": 92.3805160522461,
"learning_rate": 1.93e-05,
"loss": 6.306,
"step": 200
},
{
"epoch": 0.03230644975193262,
"grad_norm": 105.78662872314453,
"learning_rate": 2.03e-05,
"loss": 6.272,
"step": 210
},
{
"epoch": 0.033844852121072265,
"grad_norm": 34.507057189941406,
"learning_rate": 2.1299999999999996e-05,
"loss": 6.2943,
"step": 220
},
{
"epoch": 0.035383254490211916,
"grad_norm": 29.95108985900879,
"learning_rate": 2.23e-05,
"loss": 6.2231,
"step": 230
},
{
"epoch": 0.036921656859351566,
"grad_norm": 105.78109741210938,
"learning_rate": 2.3299999999999997e-05,
"loss": 6.2223,
"step": 240
},
{
"epoch": 0.03846005922849121,
"grad_norm": 115.77278900146484,
"learning_rate": 2.4299999999999998e-05,
"loss": 6.1873,
"step": 250
},
{
"epoch": 0.03999846159763086,
"grad_norm": 117.57398223876953,
"learning_rate": 2.53e-05,
"loss": 6.1889,
"step": 260
},
{
"epoch": 0.04153686396677051,
"grad_norm": 27.769681930541992,
"learning_rate": 2.63e-05,
"loss": 6.1833,
"step": 270
},
{
"epoch": 0.043075266335910155,
"grad_norm": 50.23863220214844,
"learning_rate": 2.7299999999999996e-05,
"loss": 6.1718,
"step": 280
},
{
"epoch": 0.044613668705049805,
"grad_norm": 16.450408935546875,
"learning_rate": 2.83e-05,
"loss": 6.0966,
"step": 290
},
{
"epoch": 0.046152071074189456,
"grad_norm": 28.899629592895508,
"learning_rate": 2.9299999999999997e-05,
"loss": 6.146,
"step": 300
},
{
"epoch": 0.0476904734433291,
"grad_norm": 47.915279388427734,
"learning_rate": 3.0299999999999998e-05,
"loss": 6.1493,
"step": 310
},
{
"epoch": 0.04922887581246875,
"grad_norm": 27.1001033782959,
"learning_rate": 3.1299999999999995e-05,
"loss": 6.1186,
"step": 320
},
{
"epoch": 0.0507672781816084,
"grad_norm": 22.059106826782227,
"learning_rate": 3.229999999999999e-05,
"loss": 6.0607,
"step": 330
},
{
"epoch": 0.05230568055074805,
"grad_norm": 19.7325496673584,
"learning_rate": 3.3299999999999996e-05,
"loss": 6.1196,
"step": 340
},
{
"epoch": 0.053844082919887695,
"grad_norm": 100.60061645507812,
"learning_rate": 3.4299999999999993e-05,
"loss": 6.1176,
"step": 350
},
{
"epoch": 0.055382485289027346,
"grad_norm": 18.382129669189453,
"learning_rate": 3.53e-05,
"loss": 6.1501,
"step": 360
},
{
"epoch": 0.056920887658166996,
"grad_norm": 31.890426635742188,
"learning_rate": 3.6299999999999995e-05,
"loss": 6.0863,
"step": 370
},
{
"epoch": 0.05845929002730664,
"grad_norm": 22.61912727355957,
"learning_rate": 3.73e-05,
"loss": 6.0543,
"step": 380
},
{
"epoch": 0.05999769239644629,
"grad_norm": 30.638811111450195,
"learning_rate": 3.83e-05,
"loss": 5.989,
"step": 390
},
{
"epoch": 0.06153609476558594,
"grad_norm": 45.842227935791016,
"learning_rate": 3.93e-05,
"loss": 6.0216,
"step": 400
},
{
"epoch": 0.06307449713472559,
"grad_norm": 61.62559127807617,
"learning_rate": 4.03e-05,
"loss": 6.0232,
"step": 410
},
{
"epoch": 0.06461289950386524,
"grad_norm": 24.91366958618164,
"learning_rate": 4.1299999999999994e-05,
"loss": 6.0153,
"step": 420
},
{
"epoch": 0.06615130187300489,
"grad_norm": 22.554046630859375,
"learning_rate": 4.229999999999999e-05,
"loss": 5.9533,
"step": 430
},
{
"epoch": 0.06768970424214453,
"grad_norm": 22.699480056762695,
"learning_rate": 4.3299999999999995e-05,
"loss": 5.9179,
"step": 440
},
{
"epoch": 0.06922810661128419,
"grad_norm": 17.466867446899414,
"learning_rate": 4.43e-05,
"loss": 5.9714,
"step": 450
},
{
"epoch": 0.07076650898042383,
"grad_norm": 20.46624183654785,
"learning_rate": 4.5299999999999997e-05,
"loss": 5.9621,
"step": 460
},
{
"epoch": 0.07230491134956347,
"grad_norm": 15.140242576599121,
"learning_rate": 4.6299999999999994e-05,
"loss": 5.94,
"step": 470
},
{
"epoch": 0.07384331371870313,
"grad_norm": 23.270614624023438,
"learning_rate": 4.73e-05,
"loss": 5.9387,
"step": 480
},
{
"epoch": 0.07538171608784278,
"grad_norm": 23.621036529541016,
"learning_rate": 4.8299999999999995e-05,
"loss": 5.9683,
"step": 490
},
{
"epoch": 0.07692011845698242,
"grad_norm": 16.960304260253906,
"learning_rate": 4.929999999999999e-05,
"loss": 5.9136,
"step": 500
},
{
"epoch": 0.07845852082612208,
"grad_norm": 17.167306900024414,
"learning_rate": 5.0299999999999996e-05,
"loss": 5.9011,
"step": 510
},
{
"epoch": 0.07999692319526172,
"grad_norm": 28.44086456298828,
"learning_rate": 5.13e-05,
"loss": 5.88,
"step": 520
},
{
"epoch": 0.08153532556440136,
"grad_norm": 19.138957977294922,
"learning_rate": 5.23e-05,
"loss": 5.8525,
"step": 530
},
{
"epoch": 0.08307372793354102,
"grad_norm": 23.37527847290039,
"learning_rate": 5.3299999999999995e-05,
"loss": 5.9051,
"step": 540
},
{
"epoch": 0.08461213030268067,
"grad_norm": 14.438946723937988,
"learning_rate": 5.429999999999999e-05,
"loss": 5.8024,
"step": 550
},
{
"epoch": 0.08615053267182031,
"grad_norm": 17.277740478515625,
"learning_rate": 5.529999999999999e-05,
"loss": 5.764,
"step": 560
},
{
"epoch": 0.08768893504095997,
"grad_norm": 18.269975662231445,
"learning_rate": 5.63e-05,
"loss": 5.8667,
"step": 570
},
{
"epoch": 0.08922733741009961,
"grad_norm": 17.265398025512695,
"learning_rate": 5.73e-05,
"loss": 5.7963,
"step": 580
},
{
"epoch": 0.09076573977923925,
"grad_norm": 20.076812744140625,
"learning_rate": 5.8299999999999994e-05,
"loss": 5.7426,
"step": 590
},
{
"epoch": 0.09230414214837891,
"grad_norm": 25.95227813720703,
"learning_rate": 5.929999999999999e-05,
"loss": 5.7171,
"step": 600
},
{
"epoch": 0.09384254451751856,
"grad_norm": 21.3321590423584,
"learning_rate": 6.0299999999999995e-05,
"loss": 5.7266,
"step": 610
},
{
"epoch": 0.0953809468866582,
"grad_norm": 33.217811584472656,
"learning_rate": 6.13e-05,
"loss": 5.6971,
"step": 620
},
{
"epoch": 0.09691934925579786,
"grad_norm": 16.669315338134766,
"learning_rate": 6.23e-05,
"loss": 5.7298,
"step": 630
},
{
"epoch": 0.0984577516249375,
"grad_norm": 14.09073543548584,
"learning_rate": 6.33e-05,
"loss": 5.7124,
"step": 640
},
{
"epoch": 0.09999615399407714,
"grad_norm": 19.583980560302734,
"learning_rate": 6.429999999999999e-05,
"loss": 5.7241,
"step": 650
},
{
"epoch": 0.1015345563632168,
"grad_norm": 24.256364822387695,
"learning_rate": 6.53e-05,
"loss": 5.7128,
"step": 660
},
{
"epoch": 0.10307295873235645,
"grad_norm": 23.34236717224121,
"learning_rate": 6.63e-05,
"loss": 5.5961,
"step": 670
},
{
"epoch": 0.1046113611014961,
"grad_norm": 20.654870986938477,
"learning_rate": 6.73e-05,
"loss": 5.5613,
"step": 680
},
{
"epoch": 0.10614976347063575,
"grad_norm": 30.639785766601562,
"learning_rate": 6.829999999999999e-05,
"loss": 5.6384,
"step": 690
},
{
"epoch": 0.10768816583977539,
"grad_norm": 15.175138473510742,
"learning_rate": 6.93e-05,
"loss": 5.5526,
"step": 700
},
{
"epoch": 0.10922656820891505,
"grad_norm": 20.746421813964844,
"learning_rate": 7.03e-05,
"loss": 5.6075,
"step": 710
},
{
"epoch": 0.11076497057805469,
"grad_norm": 14.452651023864746,
"learning_rate": 7.13e-05,
"loss": 5.6052,
"step": 720
},
{
"epoch": 0.11230337294719434,
"grad_norm": 15.90872859954834,
"learning_rate": 7.23e-05,
"loss": 5.5681,
"step": 730
},
{
"epoch": 0.11384177531633399,
"grad_norm": 19.600723266601562,
"learning_rate": 7.329999999999999e-05,
"loss": 5.5155,
"step": 740
},
{
"epoch": 0.11538017768547364,
"grad_norm": 15.309789657592773,
"learning_rate": 7.429999999999999e-05,
"loss": 5.5764,
"step": 750
},
{
"epoch": 0.11691858005461328,
"grad_norm": 19.05169677734375,
"learning_rate": 7.529999999999999e-05,
"loss": 5.4731,
"step": 760
},
{
"epoch": 0.11845698242375294,
"grad_norm": 19.819692611694336,
"learning_rate": 7.63e-05,
"loss": 5.3959,
"step": 770
},
{
"epoch": 0.11999538479289258,
"grad_norm": 19.908710479736328,
"learning_rate": 7.73e-05,
"loss": 5.43,
"step": 780
},
{
"epoch": 0.12153378716203223,
"grad_norm": 22.767356872558594,
"learning_rate": 7.829999999999999e-05,
"loss": 5.432,
"step": 790
},
{
"epoch": 0.12307218953117188,
"grad_norm": 14.213640213012695,
"learning_rate": 7.929999999999999e-05,
"loss": 5.4079,
"step": 800
}
],
"logging_steps": 10,
"max_steps": 100000,
"num_input_tokens_seen": 0,
"num_train_epochs": 16,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.5425342296129536e+16,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}