{ "best_metric": 0.1237926334142685, "best_model_checkpoint": "/home/gz66/analog_model/analog_LLM_model_flanT5/FM-data5-6-dataaug-epoch120-dnum1000/checkpoint-1400", "epoch": 33.333333333333336, "eval_steps": 200, "global_step": 1400, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.48, "learning_rate": 1.9999999999999998e-05, "loss": 4.6089, "step": 20 }, { "epoch": 0.95, "learning_rate": 3.9999999999999996e-05, "loss": 3.1589, "step": 40 }, { "epoch": 1.43, "learning_rate": 5.9999999999999995e-05, "loss": 1.6568, "step": 60 }, { "epoch": 1.9, "learning_rate": 7.999999999999999e-05, "loss": 0.8994, "step": 80 }, { "epoch": 2.38, "learning_rate": 9.999999999999999e-05, "loss": 0.5677, "step": 100 }, { "epoch": 2.86, "learning_rate": 0.00011999999999999999, "loss": 0.3986, "step": 120 }, { "epoch": 3.33, "learning_rate": 0.00014, "loss": 0.3327, "step": 140 }, { "epoch": 3.81, "learning_rate": 0.00015999999999999999, "loss": 0.2885, "step": 160 }, { "epoch": 4.29, "learning_rate": 0.00017999999999999998, "loss": 0.2546, "step": 180 }, { "epoch": 4.76, "learning_rate": 0.00019999999999999998, "loss": 0.257, "step": 200 }, { "epoch": 4.76, "eval_loss": 0.14169558882713318, "eval_runtime": 50.821, "eval_samples_per_second": 198.245, "eval_steps_per_second": 24.793, "step": 200 }, { "epoch": 5.24, "learning_rate": 0.00021999999999999995, "loss": 0.2281, "step": 220 }, { "epoch": 5.71, "learning_rate": 0.00023999999999999998, "loss": 0.2314, "step": 240 }, { "epoch": 6.19, "learning_rate": 0.00026, "loss": 0.2501, "step": 260 }, { "epoch": 6.67, "learning_rate": 0.00028, "loss": 0.2213, "step": 280 }, { "epoch": 7.14, "learning_rate": 0.0003, "loss": 0.2072, "step": 300 }, { "epoch": 7.62, "learning_rate": 0.0002987341772151899, "loss": 0.1958, "step": 320 }, { "epoch": 8.1, "learning_rate": 0.00029746835443037974, "loss": 0.2004, "step": 340 }, { "epoch": 8.57, "learning_rate": 0.0002962025316455696, "loss": 0.188, "step": 360 }, { "epoch": 9.05, "learning_rate": 0.00029493670886075946, "loss": 0.2117, "step": 380 }, { "epoch": 9.52, "learning_rate": 0.0002936708860759494, "loss": 0.1892, "step": 400 }, { "epoch": 9.52, "eval_loss": 0.13606849312782288, "eval_runtime": 50.8082, "eval_samples_per_second": 198.295, "eval_steps_per_second": 24.799, "step": 400 }, { "epoch": 10.0, "learning_rate": 0.00029240506329113923, "loss": 0.181, "step": 420 }, { "epoch": 10.48, "learning_rate": 0.0002911392405063291, "loss": 0.1875, "step": 440 }, { "epoch": 10.95, "learning_rate": 0.00028987341772151895, "loss": 0.1983, "step": 460 }, { "epoch": 11.43, "learning_rate": 0.00028860759493670886, "loss": 0.2003, "step": 480 }, { "epoch": 11.9, "learning_rate": 0.0002873417721518987, "loss": 0.1986, "step": 500 }, { "epoch": 12.38, "learning_rate": 0.0002860759493670886, "loss": 0.1929, "step": 520 }, { "epoch": 12.86, "learning_rate": 0.00028481012658227844, "loss": 0.1762, "step": 540 }, { "epoch": 13.33, "learning_rate": 0.00028354430379746835, "loss": 0.1685, "step": 560 }, { "epoch": 13.81, "learning_rate": 0.0002822784810126582, "loss": 0.1698, "step": 580 }, { "epoch": 14.29, "learning_rate": 0.00028101265822784807, "loss": 0.1582, "step": 600 }, { "epoch": 14.29, "eval_loss": 0.13090607523918152, "eval_runtime": 50.6708, "eval_samples_per_second": 198.832, "eval_steps_per_second": 24.866, "step": 600 }, { "epoch": 14.76, "learning_rate": 0.000279746835443038, "loss": 0.1575, "step": 620 }, { "epoch": 15.24, "learning_rate": 0.00027848101265822784, "loss": 0.1548, "step": 640 }, { "epoch": 15.71, "learning_rate": 0.0002772151898734177, "loss": 0.1513, "step": 660 }, { "epoch": 16.19, "learning_rate": 0.00027594936708860755, "loss": 0.1508, "step": 680 }, { "epoch": 16.67, "learning_rate": 0.00027468354430379747, "loss": 0.1494, "step": 700 }, { "epoch": 17.14, "learning_rate": 0.0002734177215189873, "loss": 0.1488, "step": 720 }, { "epoch": 17.62, "learning_rate": 0.0002721518987341772, "loss": 0.1483, "step": 740 }, { "epoch": 18.1, "learning_rate": 0.00027088607594936704, "loss": 0.1464, "step": 760 }, { "epoch": 18.57, "learning_rate": 0.00026962025316455696, "loss": 0.1461, "step": 780 }, { "epoch": 19.05, "learning_rate": 0.0002683544303797468, "loss": 0.1457, "step": 800 }, { "epoch": 19.05, "eval_loss": 0.12519289553165436, "eval_runtime": 51.1791, "eval_samples_per_second": 196.858, "eval_steps_per_second": 24.619, "step": 800 }, { "epoch": 19.52, "learning_rate": 0.00026708860759493667, "loss": 0.1482, "step": 820 }, { "epoch": 20.0, "learning_rate": 0.00026582278481012653, "loss": 0.1498, "step": 840 }, { "epoch": 20.48, "learning_rate": 0.00026455696202531644, "loss": 0.1542, "step": 860 }, { "epoch": 20.95, "learning_rate": 0.0002632911392405063, "loss": 0.1605, "step": 880 }, { "epoch": 21.43, "learning_rate": 0.00026202531645569616, "loss": 0.15, "step": 900 }, { "epoch": 21.9, "learning_rate": 0.0002607594936708861, "loss": 0.1452, "step": 920 }, { "epoch": 22.38, "learning_rate": 0.00025949367088607593, "loss": 0.1457, "step": 940 }, { "epoch": 22.86, "learning_rate": 0.0002582278481012658, "loss": 0.1453, "step": 960 }, { "epoch": 23.33, "learning_rate": 0.00025696202531645565, "loss": 0.1444, "step": 980 }, { "epoch": 23.81, "learning_rate": 0.00025569620253164556, "loss": 0.1435, "step": 1000 }, { "epoch": 23.81, "eval_loss": 0.12461867928504944, "eval_runtime": 53.232, "eval_samples_per_second": 189.266, "eval_steps_per_second": 23.67, "step": 1000 }, { "epoch": 24.29, "learning_rate": 0.0002544303797468354, "loss": 0.1414, "step": 1020 }, { "epoch": 24.76, "learning_rate": 0.0002531645569620253, "loss": 0.1427, "step": 1040 }, { "epoch": 25.24, "learning_rate": 0.00025189873417721514, "loss": 0.1406, "step": 1060 }, { "epoch": 25.71, "learning_rate": 0.00025063291139240505, "loss": 0.143, "step": 1080 }, { "epoch": 26.19, "learning_rate": 0.0002493670886075949, "loss": 0.1434, "step": 1100 }, { "epoch": 26.67, "learning_rate": 0.00024810126582278477, "loss": 0.1435, "step": 1120 }, { "epoch": 27.14, "learning_rate": 0.0002468354430379747, "loss": 0.1433, "step": 1140 }, { "epoch": 27.62, "learning_rate": 0.00024556962025316454, "loss": 0.1421, "step": 1160 }, { "epoch": 28.1, "learning_rate": 0.00024430379746835445, "loss": 0.1403, "step": 1180 }, { "epoch": 28.57, "learning_rate": 0.00024303797468354428, "loss": 0.1425, "step": 1200 }, { "epoch": 28.57, "eval_loss": 0.12540313601493835, "eval_runtime": 52.2087, "eval_samples_per_second": 192.976, "eval_steps_per_second": 24.134, "step": 1200 }, { "epoch": 29.05, "learning_rate": 0.00024177215189873417, "loss": 0.1398, "step": 1220 }, { "epoch": 29.52, "learning_rate": 0.00024050632911392402, "loss": 0.1416, "step": 1240 }, { "epoch": 30.0, "learning_rate": 0.0002392405063291139, "loss": 0.1383, "step": 1260 }, { "epoch": 30.48, "learning_rate": 0.00023797468354430377, "loss": 0.1417, "step": 1280 }, { "epoch": 30.95, "learning_rate": 0.00023670886075949365, "loss": 0.1403, "step": 1300 }, { "epoch": 31.43, "learning_rate": 0.0002354430379746835, "loss": 0.1419, "step": 1320 }, { "epoch": 31.9, "learning_rate": 0.0002341772151898734, "loss": 0.1408, "step": 1340 }, { "epoch": 32.38, "learning_rate": 0.00023291139240506326, "loss": 0.1405, "step": 1360 }, { "epoch": 32.86, "learning_rate": 0.00023164556962025314, "loss": 0.1409, "step": 1380 }, { "epoch": 33.33, "learning_rate": 0.000230379746835443, "loss": 0.1389, "step": 1400 }, { "epoch": 33.33, "eval_loss": 0.1237926334142685, "eval_runtime": 53.5272, "eval_samples_per_second": 188.222, "eval_steps_per_second": 23.539, "step": 1400 } ], "logging_steps": 20, "max_steps": 5040, "num_train_epochs": 120, "save_steps": 200, "total_flos": 4561981476102144.0, "trial_name": null, "trial_params": null }