fasthypernet-fs83 / checkpoint-900 /trainer_state.json
aixk's picture
Upload folder using huggingface_hub
14e1ec5 verified
Raw
History Blame Contribute Delete
15.7 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.03830398467840613,
"eval_steps": 500,
"global_step": 900,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0004255998297600681,
"grad_norm": 5634.16845703125,
"learning_rate": 2.4e-07,
"loss": 14.1264,
"step": 10
},
{
"epoch": 0.0008511996595201362,
"grad_norm": 2312.5771484375,
"learning_rate": 1.04e-06,
"loss": 13.2905,
"step": 20
},
{
"epoch": 0.0012767994892802044,
"grad_norm": 2110.1591796875,
"learning_rate": 1.84e-06,
"loss": 12.6236,
"step": 30
},
{
"epoch": 0.0017023993190402723,
"grad_norm": 1493.8431396484375,
"learning_rate": 2.64e-06,
"loss": 12.3954,
"step": 40
},
{
"epoch": 0.0021279991488003403,
"grad_norm": 1430.7598876953125,
"learning_rate": 3.44e-06,
"loss": 12.265,
"step": 50
},
{
"epoch": 0.0025535989785604087,
"grad_norm": 2192.621826171875,
"learning_rate": 4.24e-06,
"loss": 12.018,
"step": 60
},
{
"epoch": 0.0029791988083204767,
"grad_norm": 1678.5159912109375,
"learning_rate": 5.04e-06,
"loss": 11.8932,
"step": 70
},
{
"epoch": 0.0034047986380805447,
"grad_norm": 1261.883056640625,
"learning_rate": 5.84e-06,
"loss": 11.8077,
"step": 80
},
{
"epoch": 0.0038303984678406127,
"grad_norm": 1710.3070068359375,
"learning_rate": 6.640000000000001e-06,
"loss": 11.6841,
"step": 90
},
{
"epoch": 0.004255998297600681,
"grad_norm": 2306.063232421875,
"learning_rate": 7.44e-06,
"loss": 11.5426,
"step": 100
},
{
"epoch": 0.004681598127360749,
"grad_norm": 2158.360107421875,
"learning_rate": 8.24e-06,
"loss": 11.4863,
"step": 110
},
{
"epoch": 0.0051071979571208174,
"grad_norm": 2058.938232421875,
"learning_rate": 9.04e-06,
"loss": 11.5044,
"step": 120
},
{
"epoch": 0.005532797786880885,
"grad_norm": 2320.1376953125,
"learning_rate": 9.84e-06,
"loss": 11.4696,
"step": 130
},
{
"epoch": 0.005958397616640953,
"grad_norm": 3147.455078125,
"learning_rate": 1.064e-05,
"loss": 11.2994,
"step": 140
},
{
"epoch": 0.006383997446401022,
"grad_norm": 1930.887451171875,
"learning_rate": 1.144e-05,
"loss": 11.2686,
"step": 150
},
{
"epoch": 0.006809597276161089,
"grad_norm": 3005.495361328125,
"learning_rate": 1.224e-05,
"loss": 11.2556,
"step": 160
},
{
"epoch": 0.007235197105921158,
"grad_norm": 1587.324462890625,
"learning_rate": 1.3039999999999999e-05,
"loss": 11.1593,
"step": 170
},
{
"epoch": 0.007660796935681225,
"grad_norm": 1496.0810546875,
"learning_rate": 1.384e-05,
"loss": 11.0329,
"step": 180
},
{
"epoch": 0.008086396765441295,
"grad_norm": 2397.255615234375,
"learning_rate": 1.4560000000000001e-05,
"loss": 11.0514,
"step": 190
},
{
"epoch": 0.008511996595201361,
"grad_norm": 3627.1494140625,
"learning_rate": 1.536e-05,
"loss": 10.9684,
"step": 200
},
{
"epoch": 0.00893759642496143,
"grad_norm": 1078.9390869140625,
"learning_rate": 1.616e-05,
"loss": 11.0077,
"step": 210
},
{
"epoch": 0.009363196254721498,
"grad_norm": 1400.2003173828125,
"learning_rate": 1.696e-05,
"loss": 10.7138,
"step": 220
},
{
"epoch": 0.009788796084481566,
"grad_norm": 880.6416015625,
"learning_rate": 1.7760000000000003e-05,
"loss": 10.4564,
"step": 230
},
{
"epoch": 0.010214395914241635,
"grad_norm": 888.9507446289062,
"learning_rate": 1.856e-05,
"loss": 10.4699,
"step": 240
},
{
"epoch": 0.010639995744001702,
"grad_norm": 604.7562255859375,
"learning_rate": 1.936e-05,
"loss": 10.5335,
"step": 250
},
{
"epoch": 0.01106559557376177,
"grad_norm": 885.2161865234375,
"learning_rate": 2.016e-05,
"loss": 10.3258,
"step": 260
},
{
"epoch": 0.011491195403521838,
"grad_norm": 689.9547729492188,
"learning_rate": 2.0960000000000003e-05,
"loss": 10.3034,
"step": 270
},
{
"epoch": 0.011916795233281907,
"grad_norm": 1086.3548583984375,
"learning_rate": 2.176e-05,
"loss": 10.121,
"step": 280
},
{
"epoch": 0.012342395063041975,
"grad_norm": 728.9247436523438,
"learning_rate": 2.256e-05,
"loss": 9.9983,
"step": 290
},
{
"epoch": 0.012767994892802044,
"grad_norm": 931.4705200195312,
"learning_rate": 2.336e-05,
"loss": 10.1502,
"step": 300
},
{
"epoch": 0.01319359472256211,
"grad_norm": 836.438720703125,
"learning_rate": 2.4160000000000002e-05,
"loss": 10.0117,
"step": 310
},
{
"epoch": 0.013619194552322179,
"grad_norm": 481.8641662597656,
"learning_rate": 2.496e-05,
"loss": 10.0033,
"step": 320
},
{
"epoch": 0.014044794382082247,
"grad_norm": 368.5486755371094,
"learning_rate": 2.576e-05,
"loss": 9.7842,
"step": 330
},
{
"epoch": 0.014470394211842316,
"grad_norm": 408.945068359375,
"learning_rate": 2.6560000000000003e-05,
"loss": 10.0045,
"step": 340
},
{
"epoch": 0.014895994041602384,
"grad_norm": 882.4168701171875,
"learning_rate": 2.7360000000000002e-05,
"loss": 9.8133,
"step": 350
},
{
"epoch": 0.01532159387136245,
"grad_norm": 688.0091552734375,
"learning_rate": 2.816e-05,
"loss": 9.74,
"step": 360
},
{
"epoch": 0.01574719370112252,
"grad_norm": 480.2123107910156,
"learning_rate": 2.8960000000000004e-05,
"loss": 9.7187,
"step": 370
},
{
"epoch": 0.01617279353088259,
"grad_norm": 266.4781799316406,
"learning_rate": 2.976e-05,
"loss": 9.4574,
"step": 380
},
{
"epoch": 0.016598393360642654,
"grad_norm": 426.8431091308594,
"learning_rate": 3.056e-05,
"loss": 9.4476,
"step": 390
},
{
"epoch": 0.017023993190402723,
"grad_norm": 507.83984375,
"learning_rate": 3.136e-05,
"loss": 9.6252,
"step": 400
},
{
"epoch": 0.01744959302016279,
"grad_norm": 345.3815612792969,
"learning_rate": 3.2160000000000004e-05,
"loss": 9.4701,
"step": 410
},
{
"epoch": 0.01787519284992286,
"grad_norm": 661.6119384765625,
"learning_rate": 3.296e-05,
"loss": 9.2308,
"step": 420
},
{
"epoch": 0.018300792679682928,
"grad_norm": 249.719970703125,
"learning_rate": 3.376e-05,
"loss": 9.2749,
"step": 430
},
{
"epoch": 0.018726392509442996,
"grad_norm": 396.6395263671875,
"learning_rate": 3.456e-05,
"loss": 9.3583,
"step": 440
},
{
"epoch": 0.019151992339203065,
"grad_norm": 317.9398193359375,
"learning_rate": 3.536000000000001e-05,
"loss": 9.2281,
"step": 450
},
{
"epoch": 0.019577592168963133,
"grad_norm": 237.1824493408203,
"learning_rate": 3.616e-05,
"loss": 9.0913,
"step": 460
},
{
"epoch": 0.0200031919987232,
"grad_norm": 427.8457336425781,
"learning_rate": 3.696e-05,
"loss": 9.0147,
"step": 470
},
{
"epoch": 0.02042879182848327,
"grad_norm": 380.43719482421875,
"learning_rate": 3.776e-05,
"loss": 8.9519,
"step": 480
},
{
"epoch": 0.020854391658243338,
"grad_norm": 222.20193481445312,
"learning_rate": 3.8560000000000004e-05,
"loss": 9.0848,
"step": 490
},
{
"epoch": 0.021279991488003403,
"grad_norm": 343.4478454589844,
"learning_rate": 3.936e-05,
"loss": 8.8757,
"step": 500
},
{
"epoch": 0.02170559131776347,
"grad_norm": 261.2217712402344,
"learning_rate": 4.016e-05,
"loss": 8.9742,
"step": 510
},
{
"epoch": 0.02213119114752354,
"grad_norm": 263.2187805175781,
"learning_rate": 4.096e-05,
"loss": 8.6574,
"step": 520
},
{
"epoch": 0.02255679097728361,
"grad_norm": 323.5589904785156,
"learning_rate": 4.176000000000001e-05,
"loss": 8.8006,
"step": 530
},
{
"epoch": 0.022982390807043677,
"grad_norm": 275.9966735839844,
"learning_rate": 4.256e-05,
"loss": 8.3938,
"step": 540
},
{
"epoch": 0.023407990636803745,
"grad_norm": 217.8997344970703,
"learning_rate": 4.336e-05,
"loss": 8.7494,
"step": 550
},
{
"epoch": 0.023833590466563814,
"grad_norm": 238.54171752929688,
"learning_rate": 4.4160000000000004e-05,
"loss": 8.4978,
"step": 560
},
{
"epoch": 0.024259190296323882,
"grad_norm": 248.50515747070312,
"learning_rate": 4.496e-05,
"loss": 8.4339,
"step": 570
},
{
"epoch": 0.02468479012608395,
"grad_norm": 300.531982421875,
"learning_rate": 4.576e-05,
"loss": 8.5025,
"step": 580
},
{
"epoch": 0.02511038995584402,
"grad_norm": 262.1846923828125,
"learning_rate": 4.656e-05,
"loss": 8.3452,
"step": 590
},
{
"epoch": 0.025535989785604087,
"grad_norm": 236.63243103027344,
"learning_rate": 4.736000000000001e-05,
"loss": 8.2499,
"step": 600
},
{
"epoch": 0.025961589615364152,
"grad_norm": 312.71343994140625,
"learning_rate": 4.816e-05,
"loss": 8.2303,
"step": 610
},
{
"epoch": 0.02638718944512422,
"grad_norm": 247.94815063476562,
"learning_rate": 4.8880000000000006e-05,
"loss": 8.1981,
"step": 620
},
{
"epoch": 0.02681278927488429,
"grad_norm": 230.76556396484375,
"learning_rate": 4.9680000000000005e-05,
"loss": 8.1115,
"step": 630
},
{
"epoch": 0.027238389104644357,
"grad_norm": 185.8600616455078,
"learning_rate": 5.0480000000000005e-05,
"loss": 8.1543,
"step": 640
},
{
"epoch": 0.027663988934404426,
"grad_norm": 210.5782470703125,
"learning_rate": 5.1280000000000004e-05,
"loss": 8.0605,
"step": 650
},
{
"epoch": 0.028089588764164494,
"grad_norm": 244.0819549560547,
"learning_rate": 5.208000000000001e-05,
"loss": 7.9563,
"step": 660
},
{
"epoch": 0.028515188593924563,
"grad_norm": 226.42645263671875,
"learning_rate": 5.288000000000001e-05,
"loss": 7.946,
"step": 670
},
{
"epoch": 0.02894078842368463,
"grad_norm": 297.0813903808594,
"learning_rate": 5.368000000000001e-05,
"loss": 7.8138,
"step": 680
},
{
"epoch": 0.0293663882534447,
"grad_norm": 250.51219177246094,
"learning_rate": 5.448e-05,
"loss": 7.9005,
"step": 690
},
{
"epoch": 0.029791988083204768,
"grad_norm": 215.31597900390625,
"learning_rate": 5.528e-05,
"loss": 7.8383,
"step": 700
},
{
"epoch": 0.030217587912964836,
"grad_norm": 190.99282836914062,
"learning_rate": 5.608e-05,
"loss": 7.8832,
"step": 710
},
{
"epoch": 0.0306431877427249,
"grad_norm": 220.77931213378906,
"learning_rate": 5.688e-05,
"loss": 7.6152,
"step": 720
},
{
"epoch": 0.03106878757248497,
"grad_norm": 239.42454528808594,
"learning_rate": 5.7680000000000003e-05,
"loss": 7.8036,
"step": 730
},
{
"epoch": 0.03149438740224504,
"grad_norm": 184.58163452148438,
"learning_rate": 5.848e-05,
"loss": 7.8012,
"step": 740
},
{
"epoch": 0.031919987232005106,
"grad_norm": 201.47549438476562,
"learning_rate": 5.928e-05,
"loss": 7.6639,
"step": 750
},
{
"epoch": 0.03234558706176518,
"grad_norm": 157.16506958007812,
"learning_rate": 6.008e-05,
"loss": 7.8203,
"step": 760
},
{
"epoch": 0.03277118689152524,
"grad_norm": 236.1090545654297,
"learning_rate": 6.088000000000001e-05,
"loss": 7.6494,
"step": 770
},
{
"epoch": 0.03319678672128531,
"grad_norm": 196.18592834472656,
"learning_rate": 6.168e-05,
"loss": 7.7588,
"step": 780
},
{
"epoch": 0.03362238655104538,
"grad_norm": 172.52780151367188,
"learning_rate": 6.248000000000001e-05,
"loss": 7.65,
"step": 790
},
{
"epoch": 0.034047986380805445,
"grad_norm": 167.19175720214844,
"learning_rate": 6.328e-05,
"loss": 7.5127,
"step": 800
},
{
"epoch": 0.03447358621056552,
"grad_norm": 156.87774658203125,
"learning_rate": 6.408000000000001e-05,
"loss": 7.4108,
"step": 810
},
{
"epoch": 0.03489918604032558,
"grad_norm": 159.38601684570312,
"learning_rate": 6.488e-05,
"loss": 7.437,
"step": 820
},
{
"epoch": 0.035324785870085654,
"grad_norm": 153.8631134033203,
"learning_rate": 6.568000000000001e-05,
"loss": 7.6065,
"step": 830
},
{
"epoch": 0.03575038569984572,
"grad_norm": 190.62391662597656,
"learning_rate": 6.648e-05,
"loss": 7.5105,
"step": 840
},
{
"epoch": 0.03617598552960579,
"grad_norm": 185.58334350585938,
"learning_rate": 6.727999999999999e-05,
"loss": 7.3454,
"step": 850
},
{
"epoch": 0.036601585359365855,
"grad_norm": 250.2914581298828,
"learning_rate": 6.808e-05,
"loss": 7.3132,
"step": 860
},
{
"epoch": 0.03702718518912593,
"grad_norm": 146.8917999267578,
"learning_rate": 6.888e-05,
"loss": 7.2683,
"step": 870
},
{
"epoch": 0.03745278501888599,
"grad_norm": 132.48252868652344,
"learning_rate": 6.968e-05,
"loss": 7.2115,
"step": 880
},
{
"epoch": 0.03787838484864606,
"grad_norm": 124.25926208496094,
"learning_rate": 7.048e-05,
"loss": 7.2205,
"step": 890
},
{
"epoch": 0.03830398467840613,
"grad_norm": 134.99722290039062,
"learning_rate": 7.128000000000001e-05,
"loss": 7.2713,
"step": 900
}
],
"logging_steps": 10,
"max_steps": 10000000,
"num_input_tokens_seen": 0,
"num_train_epochs": 426,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.3172736067584e+16,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}