chart-qa-vlm-multilingual / trainer_state.json
tojpaj's picture
Upload folder using huggingface_hub
e5f1422 verified
Raw
History Blame Contribute Delete
13.1 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 12,
"global_step": 63,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.047619047619047616,
"grad_norm": 55.872169494628906,
"learning_rate": 0.0,
"loss": 11.3984375,
"step": 1
},
{
"epoch": 0.09523809523809523,
"grad_norm": 39.94508361816406,
"learning_rate": 2.5e-05,
"loss": 8.734375,
"step": 2
},
{
"epoch": 0.14285714285714285,
"grad_norm": 30.2918701171875,
"learning_rate": 5e-05,
"loss": 6.33984375,
"step": 3
},
{
"epoch": 0.19047619047619047,
"grad_norm": 11.614492416381836,
"learning_rate": 4.9970167022408685e-05,
"loss": 4.24609375,
"step": 4
},
{
"epoch": 0.23809523809523808,
"grad_norm": 10.849442481994629,
"learning_rate": 4.988074720132825e-05,
"loss": 2.6611328125,
"step": 5
},
{
"epoch": 0.2857142857142857,
"grad_norm": 6.369261264801025,
"learning_rate": 4.9731977662049233e-05,
"loss": 1.529296875,
"step": 6
},
{
"epoch": 0.3333333333333333,
"grad_norm": 1.0310866832733154,
"learning_rate": 4.9524252914645555e-05,
"loss": 2.18267822265625,
"step": 7
},
{
"epoch": 0.38095238095238093,
"grad_norm": 2.9220826625823975,
"learning_rate": 4.9258123807804715e-05,
"loss": 0.80126953125,
"step": 8
},
{
"epoch": 0.42857142857142855,
"grad_norm": 2.5777978897094727,
"learning_rate": 4.8934296068076105e-05,
"loss": 0.8701171875,
"step": 9
},
{
"epoch": 0.47619047619047616,
"grad_norm": 2.27763295173645,
"learning_rate": 4.855362842841111e-05,
"loss": 0.7646484375,
"step": 10
},
{
"epoch": 0.5238095238095238,
"grad_norm": 1.504328727722168,
"learning_rate": 4.811713035095761e-05,
"loss": 0.79931640625,
"step": 11
},
{
"epoch": 0.5714285714285714,
"grad_norm": 1.8779164552688599,
"learning_rate": 4.7625959350147905e-05,
"loss": 0.83056640625,
"step": 12
},
{
"epoch": 0.6190476190476191,
"grad_norm": 0.6685611605644226,
"learning_rate": 4.70814179231785e-05,
"loss": 1.894866943359375,
"step": 13
},
{
"epoch": 0.6666666666666666,
"grad_norm": 1.276977300643921,
"learning_rate": 4.648495009602168e-05,
"loss": 0.64892578125,
"step": 14
},
{
"epoch": 0.7142857142857143,
"grad_norm": 1.3761838674545288,
"learning_rate": 4.5838137594128254e-05,
"loss": 0.689208984375,
"step": 15
},
{
"epoch": 0.7142857142857143,
"eval_loss": 1.626708984375,
"eval_runtime": 5.6958,
"eval_samples_per_second": 0.351,
"eval_steps_per_second": 0.176,
"step": 15
},
{
"epoch": 0.7619047619047619,
"grad_norm": 1.0244767665863037,
"learning_rate": 4.5142695647975993e-05,
"loss": 0.554443359375,
"step": 16
},
{
"epoch": 0.8095238095238095,
"grad_norm": 0.4870399832725525,
"learning_rate": 4.44004684445867e-05,
"loss": 1.8179779052734375,
"step": 17
},
{
"epoch": 0.8571428571428571,
"grad_norm": 0.820194661617279,
"learning_rate": 4.361342423707385e-05,
"loss": 1.12042236328125,
"step": 18
},
{
"epoch": 0.9047619047619048,
"grad_norm": 0.8197793364524841,
"learning_rate": 4.2783650125189096e-05,
"loss": 0.616943359375,
"step": 19
},
{
"epoch": 0.9523809523809523,
"grad_norm": 0.5198944211006165,
"learning_rate": 4.191334652070895e-05,
"loss": 1.839569091796875,
"step": 20
},
{
"epoch": 1.0,
"grad_norm": 0.34501922130584717,
"learning_rate": 4.1004821312338285e-05,
"loss": 1.6414794921875,
"step": 21
},
{
"epoch": 1.0476190476190477,
"grad_norm": 0.873728334903717,
"learning_rate": 4.006048374560445e-05,
"loss": 0.578125,
"step": 22
},
{
"epoch": 1.0952380952380953,
"grad_norm": 0.9984555840492249,
"learning_rate": 3.90828380339712e-05,
"loss": 0.4749755859375,
"step": 23
},
{
"epoch": 1.1428571428571428,
"grad_norm": 0.9322866797447205,
"learning_rate": 3.8074476718114706e-05,
"loss": 0.59375,
"step": 24
},
{
"epoch": 1.1904761904761905,
"grad_norm": 1.126771330833435,
"learning_rate": 3.7038073790971875e-05,
"loss": 0.451416015625,
"step": 25
},
{
"epoch": 1.2380952380952381,
"grad_norm": 0.921955406665802,
"learning_rate": 3.597637760679167e-05,
"loss": 0.4898681640625,
"step": 26
},
{
"epoch": 1.2857142857142856,
"grad_norm": 1.160629153251648,
"learning_rate": 3.4892203592993786e-05,
"loss": 0.4130859375,
"step": 27
},
{
"epoch": 1.2857142857142856,
"eval_loss": 1.51025390625,
"eval_runtime": 5.4865,
"eval_samples_per_second": 0.365,
"eval_steps_per_second": 0.182,
"step": 27
},
{
"epoch": 1.3333333333333333,
"grad_norm": 0.5455287098884583,
"learning_rate": 3.3788426784161216e-05,
"loss": 1.712249755859375,
"step": 28
},
{
"epoch": 1.380952380952381,
"grad_norm": 1.361806869506836,
"learning_rate": 3.2667974197965405e-05,
"loss": 0.3602294921875,
"step": 29
},
{
"epoch": 1.4285714285714286,
"grad_norm": 1.2242106199264526,
"learning_rate": 3.1533817073241556e-05,
"loss": 0.5125732421875,
"step": 30
},
{
"epoch": 1.4761904761904763,
"grad_norm": 1.058226466178894,
"learning_rate": 3.03889629907974e-05,
"loss": 0.3873291015625,
"step": 31
},
{
"epoch": 1.5238095238095237,
"grad_norm": 1.107188105583191,
"learning_rate": 2.923644789784955e-05,
"loss": 0.5450439453125,
"step": 32
},
{
"epoch": 1.5714285714285714,
"grad_norm": 1.150083303451538,
"learning_rate": 2.807932805723725e-05,
"loss": 0.51953125,
"step": 33
},
{
"epoch": 1.619047619047619,
"grad_norm": 0.534706175327301,
"learning_rate": 2.692067194276276e-05,
"loss": 1.4922409057617188,
"step": 34
},
{
"epoch": 1.6666666666666665,
"grad_norm": 1.0580393075942993,
"learning_rate": 2.5763552102150456e-05,
"loss": 0.4501953125,
"step": 35
},
{
"epoch": 1.7142857142857144,
"grad_norm": 1.0441676378250122,
"learning_rate": 2.4611037009202603e-05,
"loss": 0.478515625,
"step": 36
},
{
"epoch": 1.7619047619047619,
"grad_norm": 0.8805537819862366,
"learning_rate": 2.3466182926758456e-05,
"loss": 0.3509521484375,
"step": 37
},
{
"epoch": 1.8095238095238095,
"grad_norm": 0.4713503420352936,
"learning_rate": 2.2332025802034607e-05,
"loss": 1.53851318359375,
"step": 38
},
{
"epoch": 1.8571428571428572,
"grad_norm": 0.6947212219238281,
"learning_rate": 2.1211573215838792e-05,
"loss": 0.891815185546875,
"step": 39
},
{
"epoch": 1.8571428571428572,
"eval_loss": 1.4468994140625,
"eval_runtime": 5.1599,
"eval_samples_per_second": 0.388,
"eval_steps_per_second": 0.194,
"step": 39
},
{
"epoch": 1.9047619047619047,
"grad_norm": 0.8006393909454346,
"learning_rate": 2.010779640700622e-05,
"loss": 0.4466552734375,
"step": 40
},
{
"epoch": 1.9523809523809523,
"grad_norm": 0.47487154603004456,
"learning_rate": 1.9023622393208336e-05,
"loss": 1.5706024169921875,
"step": 41
},
{
"epoch": 2.0,
"grad_norm": 0.3503785729408264,
"learning_rate": 1.796192620902814e-05,
"loss": 1.513275146484375,
"step": 42
},
{
"epoch": 2.0476190476190474,
"grad_norm": 0.8355963230133057,
"learning_rate": 1.692552328188531e-05,
"loss": 0.43603515625,
"step": 43
},
{
"epoch": 2.0952380952380953,
"grad_norm": 0.7735680937767029,
"learning_rate": 1.5917161966028815e-05,
"loss": 0.34686279296875,
"step": 44
},
{
"epoch": 2.142857142857143,
"grad_norm": 0.7461949586868286,
"learning_rate": 1.4939516254395546e-05,
"loss": 0.43896484375,
"step": 45
},
{
"epoch": 2.1904761904761907,
"grad_norm": 1.0518755912780762,
"learning_rate": 1.399517868766172e-05,
"loss": 0.325439453125,
"step": 46
},
{
"epoch": 2.238095238095238,
"grad_norm": 0.8924214243888855,
"learning_rate": 1.3086653479291062e-05,
"loss": 0.3905029296875,
"step": 47
},
{
"epoch": 2.2857142857142856,
"grad_norm": 0.8009278774261475,
"learning_rate": 1.2216349874810906e-05,
"loss": 0.30126953125,
"step": 48
},
{
"epoch": 2.3333333333333335,
"grad_norm": 0.5341566801071167,
"learning_rate": 1.1386575762926155e-05,
"loss": 1.5106887817382812,
"step": 49
},
{
"epoch": 2.380952380952381,
"grad_norm": 0.8630108833312988,
"learning_rate": 1.0599531555413309e-05,
"loss": 0.266845703125,
"step": 50
},
{
"epoch": 2.4285714285714284,
"grad_norm": 0.8821431994438171,
"learning_rate": 9.857304352024019e-06,
"loss": 0.3577880859375,
"step": 51
},
{
"epoch": 2.4285714285714284,
"eval_loss": 1.4066162109375,
"eval_runtime": 5.4612,
"eval_samples_per_second": 0.366,
"eval_steps_per_second": 0.183,
"step": 51
},
{
"epoch": 2.4761904761904763,
"grad_norm": 0.6822161674499512,
"learning_rate": 9.161862405871748e-06,
"loss": 0.29779052734375,
"step": 52
},
{
"epoch": 2.5238095238095237,
"grad_norm": 0.9326254725456238,
"learning_rate": 8.515049903978325e-06,
"loss": 0.45281982421875,
"step": 53
},
{
"epoch": 2.571428571428571,
"grad_norm": 1.0303138494491577,
"learning_rate": 7.918582076821507e-06,
"loss": 0.39422607421875,
"step": 54
},
{
"epoch": 2.619047619047619,
"grad_norm": 0.5410661101341248,
"learning_rate": 7.374040649852105e-06,
"loss": 1.334136962890625,
"step": 55
},
{
"epoch": 2.6666666666666665,
"grad_norm": 0.9201714396476746,
"learning_rate": 6.882869649042397e-06,
"loss": 0.35498046875,
"step": 56
},
{
"epoch": 2.7142857142857144,
"grad_norm": 0.8627307415008545,
"learning_rate": 6.446371571588896e-06,
"loss": 0.39990234375,
"step": 57
},
{
"epoch": 2.761904761904762,
"grad_norm": 0.6887866258621216,
"learning_rate": 6.065703931923894e-06,
"loss": 0.2904052734375,
"step": 58
},
{
"epoch": 2.8095238095238093,
"grad_norm": 0.4894810616970062,
"learning_rate": 5.741876192195292e-06,
"loss": 1.4284439086914062,
"step": 59
},
{
"epoch": 2.857142857142857,
"grad_norm": 0.7044135332107544,
"learning_rate": 5.47574708535445e-06,
"loss": 0.8047714233398438,
"step": 60
},
{
"epoch": 2.9047619047619047,
"grad_norm": 0.9605301022529602,
"learning_rate": 5.268022337950767e-06,
"loss": 0.38262939453125,
"step": 61
},
{
"epoch": 2.9523809523809526,
"grad_norm": 0.49748826026916504,
"learning_rate": 5.119252798671747e-06,
"loss": 1.4863128662109375,
"step": 62
},
{
"epoch": 3.0,
"grad_norm": 0.3692787289619446,
"learning_rate": 5.029832977591314e-06,
"loss": 1.4801177978515625,
"step": 63
},
{
"epoch": 3.0,
"eval_loss": 1.3985595703125,
"eval_runtime": 5.1407,
"eval_samples_per_second": 0.389,
"eval_steps_per_second": 0.195,
"step": 63
}
],
"logging_steps": 1.0,
"max_steps": 63,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 0,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.3702596321542144e+16,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}