FM-6789comp-dataaug-dnum4k / trainer_state.json
alei97's picture
Upload FM-6789comp-dataaug-dnum4k model artifacts
88809ea verified
Raw
History Blame Contribute Delete
10.4 kB
{
"best_metric": 0.1237926334142685,
"best_model_checkpoint": "/home/gz66/analog_model/analog_LLM_model_flanT5/FM-data5-6-dataaug-epoch120-dnum1000/checkpoint-1400",
"epoch": 33.333333333333336,
"eval_steps": 200,
"global_step": 1400,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.48,
"learning_rate": 1.9999999999999998e-05,
"loss": 4.6089,
"step": 20
},
{
"epoch": 0.95,
"learning_rate": 3.9999999999999996e-05,
"loss": 3.1589,
"step": 40
},
{
"epoch": 1.43,
"learning_rate": 5.9999999999999995e-05,
"loss": 1.6568,
"step": 60
},
{
"epoch": 1.9,
"learning_rate": 7.999999999999999e-05,
"loss": 0.8994,
"step": 80
},
{
"epoch": 2.38,
"learning_rate": 9.999999999999999e-05,
"loss": 0.5677,
"step": 100
},
{
"epoch": 2.86,
"learning_rate": 0.00011999999999999999,
"loss": 0.3986,
"step": 120
},
{
"epoch": 3.33,
"learning_rate": 0.00014,
"loss": 0.3327,
"step": 140
},
{
"epoch": 3.81,
"learning_rate": 0.00015999999999999999,
"loss": 0.2885,
"step": 160
},
{
"epoch": 4.29,
"learning_rate": 0.00017999999999999998,
"loss": 0.2546,
"step": 180
},
{
"epoch": 4.76,
"learning_rate": 0.00019999999999999998,
"loss": 0.257,
"step": 200
},
{
"epoch": 4.76,
"eval_loss": 0.14169558882713318,
"eval_runtime": 50.821,
"eval_samples_per_second": 198.245,
"eval_steps_per_second": 24.793,
"step": 200
},
{
"epoch": 5.24,
"learning_rate": 0.00021999999999999995,
"loss": 0.2281,
"step": 220
},
{
"epoch": 5.71,
"learning_rate": 0.00023999999999999998,
"loss": 0.2314,
"step": 240
},
{
"epoch": 6.19,
"learning_rate": 0.00026,
"loss": 0.2501,
"step": 260
},
{
"epoch": 6.67,
"learning_rate": 0.00028,
"loss": 0.2213,
"step": 280
},
{
"epoch": 7.14,
"learning_rate": 0.0003,
"loss": 0.2072,
"step": 300
},
{
"epoch": 7.62,
"learning_rate": 0.0002987341772151899,
"loss": 0.1958,
"step": 320
},
{
"epoch": 8.1,
"learning_rate": 0.00029746835443037974,
"loss": 0.2004,
"step": 340
},
{
"epoch": 8.57,
"learning_rate": 0.0002962025316455696,
"loss": 0.188,
"step": 360
},
{
"epoch": 9.05,
"learning_rate": 0.00029493670886075946,
"loss": 0.2117,
"step": 380
},
{
"epoch": 9.52,
"learning_rate": 0.0002936708860759494,
"loss": 0.1892,
"step": 400
},
{
"epoch": 9.52,
"eval_loss": 0.13606849312782288,
"eval_runtime": 50.8082,
"eval_samples_per_second": 198.295,
"eval_steps_per_second": 24.799,
"step": 400
},
{
"epoch": 10.0,
"learning_rate": 0.00029240506329113923,
"loss": 0.181,
"step": 420
},
{
"epoch": 10.48,
"learning_rate": 0.0002911392405063291,
"loss": 0.1875,
"step": 440
},
{
"epoch": 10.95,
"learning_rate": 0.00028987341772151895,
"loss": 0.1983,
"step": 460
},
{
"epoch": 11.43,
"learning_rate": 0.00028860759493670886,
"loss": 0.2003,
"step": 480
},
{
"epoch": 11.9,
"learning_rate": 0.0002873417721518987,
"loss": 0.1986,
"step": 500
},
{
"epoch": 12.38,
"learning_rate": 0.0002860759493670886,
"loss": 0.1929,
"step": 520
},
{
"epoch": 12.86,
"learning_rate": 0.00028481012658227844,
"loss": 0.1762,
"step": 540
},
{
"epoch": 13.33,
"learning_rate": 0.00028354430379746835,
"loss": 0.1685,
"step": 560
},
{
"epoch": 13.81,
"learning_rate": 0.0002822784810126582,
"loss": 0.1698,
"step": 580
},
{
"epoch": 14.29,
"learning_rate": 0.00028101265822784807,
"loss": 0.1582,
"step": 600
},
{
"epoch": 14.29,
"eval_loss": 0.13090607523918152,
"eval_runtime": 50.6708,
"eval_samples_per_second": 198.832,
"eval_steps_per_second": 24.866,
"step": 600
},
{
"epoch": 14.76,
"learning_rate": 0.000279746835443038,
"loss": 0.1575,
"step": 620
},
{
"epoch": 15.24,
"learning_rate": 0.00027848101265822784,
"loss": 0.1548,
"step": 640
},
{
"epoch": 15.71,
"learning_rate": 0.0002772151898734177,
"loss": 0.1513,
"step": 660
},
{
"epoch": 16.19,
"learning_rate": 0.00027594936708860755,
"loss": 0.1508,
"step": 680
},
{
"epoch": 16.67,
"learning_rate": 0.00027468354430379747,
"loss": 0.1494,
"step": 700
},
{
"epoch": 17.14,
"learning_rate": 0.0002734177215189873,
"loss": 0.1488,
"step": 720
},
{
"epoch": 17.62,
"learning_rate": 0.0002721518987341772,
"loss": 0.1483,
"step": 740
},
{
"epoch": 18.1,
"learning_rate": 0.00027088607594936704,
"loss": 0.1464,
"step": 760
},
{
"epoch": 18.57,
"learning_rate": 0.00026962025316455696,
"loss": 0.1461,
"step": 780
},
{
"epoch": 19.05,
"learning_rate": 0.0002683544303797468,
"loss": 0.1457,
"step": 800
},
{
"epoch": 19.05,
"eval_loss": 0.12519289553165436,
"eval_runtime": 51.1791,
"eval_samples_per_second": 196.858,
"eval_steps_per_second": 24.619,
"step": 800
},
{
"epoch": 19.52,
"learning_rate": 0.00026708860759493667,
"loss": 0.1482,
"step": 820
},
{
"epoch": 20.0,
"learning_rate": 0.00026582278481012653,
"loss": 0.1498,
"step": 840
},
{
"epoch": 20.48,
"learning_rate": 0.00026455696202531644,
"loss": 0.1542,
"step": 860
},
{
"epoch": 20.95,
"learning_rate": 0.0002632911392405063,
"loss": 0.1605,
"step": 880
},
{
"epoch": 21.43,
"learning_rate": 0.00026202531645569616,
"loss": 0.15,
"step": 900
},
{
"epoch": 21.9,
"learning_rate": 0.0002607594936708861,
"loss": 0.1452,
"step": 920
},
{
"epoch": 22.38,
"learning_rate": 0.00025949367088607593,
"loss": 0.1457,
"step": 940
},
{
"epoch": 22.86,
"learning_rate": 0.0002582278481012658,
"loss": 0.1453,
"step": 960
},
{
"epoch": 23.33,
"learning_rate": 0.00025696202531645565,
"loss": 0.1444,
"step": 980
},
{
"epoch": 23.81,
"learning_rate": 0.00025569620253164556,
"loss": 0.1435,
"step": 1000
},
{
"epoch": 23.81,
"eval_loss": 0.12461867928504944,
"eval_runtime": 53.232,
"eval_samples_per_second": 189.266,
"eval_steps_per_second": 23.67,
"step": 1000
},
{
"epoch": 24.29,
"learning_rate": 0.0002544303797468354,
"loss": 0.1414,
"step": 1020
},
{
"epoch": 24.76,
"learning_rate": 0.0002531645569620253,
"loss": 0.1427,
"step": 1040
},
{
"epoch": 25.24,
"learning_rate": 0.00025189873417721514,
"loss": 0.1406,
"step": 1060
},
{
"epoch": 25.71,
"learning_rate": 0.00025063291139240505,
"loss": 0.143,
"step": 1080
},
{
"epoch": 26.19,
"learning_rate": 0.0002493670886075949,
"loss": 0.1434,
"step": 1100
},
{
"epoch": 26.67,
"learning_rate": 0.00024810126582278477,
"loss": 0.1435,
"step": 1120
},
{
"epoch": 27.14,
"learning_rate": 0.0002468354430379747,
"loss": 0.1433,
"step": 1140
},
{
"epoch": 27.62,
"learning_rate": 0.00024556962025316454,
"loss": 0.1421,
"step": 1160
},
{
"epoch": 28.1,
"learning_rate": 0.00024430379746835445,
"loss": 0.1403,
"step": 1180
},
{
"epoch": 28.57,
"learning_rate": 0.00024303797468354428,
"loss": 0.1425,
"step": 1200
},
{
"epoch": 28.57,
"eval_loss": 0.12540313601493835,
"eval_runtime": 52.2087,
"eval_samples_per_second": 192.976,
"eval_steps_per_second": 24.134,
"step": 1200
},
{
"epoch": 29.05,
"learning_rate": 0.00024177215189873417,
"loss": 0.1398,
"step": 1220
},
{
"epoch": 29.52,
"learning_rate": 0.00024050632911392402,
"loss": 0.1416,
"step": 1240
},
{
"epoch": 30.0,
"learning_rate": 0.0002392405063291139,
"loss": 0.1383,
"step": 1260
},
{
"epoch": 30.48,
"learning_rate": 0.00023797468354430377,
"loss": 0.1417,
"step": 1280
},
{
"epoch": 30.95,
"learning_rate": 0.00023670886075949365,
"loss": 0.1403,
"step": 1300
},
{
"epoch": 31.43,
"learning_rate": 0.0002354430379746835,
"loss": 0.1419,
"step": 1320
},
{
"epoch": 31.9,
"learning_rate": 0.0002341772151898734,
"loss": 0.1408,
"step": 1340
},
{
"epoch": 32.38,
"learning_rate": 0.00023291139240506326,
"loss": 0.1405,
"step": 1360
},
{
"epoch": 32.86,
"learning_rate": 0.00023164556962025314,
"loss": 0.1409,
"step": 1380
},
{
"epoch": 33.33,
"learning_rate": 0.000230379746835443,
"loss": 0.1389,
"step": 1400
},
{
"epoch": 33.33,
"eval_loss": 0.1237926334142685,
"eval_runtime": 53.5272,
"eval_samples_per_second": 188.222,
"eval_steps_per_second": 23.539,
"step": 1400
}
],
"logging_steps": 20,
"max_steps": 5040,
"num_train_epochs": 120,
"save_steps": 200,
"total_flos": 4561981476102144.0,
"trial_name": null,
"trial_params": null
}