SushantGautam's picture
Upload folder using huggingface_hub
09f184a verified
Raw
History Blame Contribute Delete
6.29 kB
{
"best_metric": 0.03547798842191696,
"best_model_checkpoint": "logs/google-bert/bert-large-cased_accuracy-coverage/checkpoint-1737",
"epoch": 12.0,
"eval_steps": 500,
"global_step": 2316,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 1.0,
"grad_norm": 18.177562713623047,
"learning_rate": 1.900518134715026e-05,
"loss": 0.0796,
"step": 193
},
{
"epoch": 1.0,
"eval_MAE": 0.16079820692539215,
"eval_R2": 0.09031999984589933,
"eval_RMSE": 0.20937980711460114,
"eval_loss": 0.04383990541100502,
"eval_runtime": 14.15,
"eval_samples_per_second": 203.604,
"eval_steps_per_second": 3.463,
"step": 193
},
{
"epoch": 2.0,
"grad_norm": 5.8847270011901855,
"learning_rate": 1.800518134715026e-05,
"loss": 0.0589,
"step": 386
},
{
"epoch": 2.0,
"eval_MAE": 0.16792413592338562,
"eval_R2": -0.035297909277749895,
"eval_RMSE": 0.22336912155151367,
"eval_loss": 0.04989376664161682,
"eval_runtime": 14.0183,
"eval_samples_per_second": 205.517,
"eval_steps_per_second": 3.495,
"step": 386
},
{
"epoch": 3.0,
"grad_norm": 7.614197731018066,
"learning_rate": 1.7005181347150262e-05,
"loss": 0.051,
"step": 579
},
{
"epoch": 3.0,
"eval_MAE": 0.18675751984119415,
"eval_R2": -0.032218313600698156,
"eval_RMSE": 0.22303664684295654,
"eval_loss": 0.0497453473508358,
"eval_runtime": 14.1082,
"eval_samples_per_second": 204.208,
"eval_steps_per_second": 3.473,
"step": 579
},
{
"epoch": 4.0,
"grad_norm": 0.26663488149642944,
"learning_rate": 1.6005181347150262e-05,
"loss": 0.0368,
"step": 772
},
{
"epoch": 4.0,
"eval_MAE": 0.14720453321933746,
"eval_R2": 0.17138686484945131,
"eval_RMSE": 0.19983261823654175,
"eval_loss": 0.03993307799100876,
"eval_runtime": 13.9915,
"eval_samples_per_second": 205.91,
"eval_steps_per_second": 3.502,
"step": 772
},
{
"epoch": 5.0,
"grad_norm": 2.195333480834961,
"learning_rate": 1.500518134715026e-05,
"loss": 0.0305,
"step": 965
},
{
"epoch": 5.0,
"eval_MAE": 0.14292865991592407,
"eval_R2": 0.23018361342873883,
"eval_RMSE": 0.19261230528354645,
"eval_loss": 0.037099506705999374,
"eval_runtime": 14.2625,
"eval_samples_per_second": 201.999,
"eval_steps_per_second": 3.436,
"step": 965
},
{
"epoch": 6.0,
"grad_norm": 4.641444683074951,
"learning_rate": 1.400518134715026e-05,
"loss": 0.0251,
"step": 1158
},
{
"epoch": 6.0,
"eval_MAE": 0.14436666667461395,
"eval_R2": 0.21001704033333712,
"eval_RMSE": 0.19511890411376953,
"eval_loss": 0.03807138651609421,
"eval_runtime": 14.0937,
"eval_samples_per_second": 204.418,
"eval_steps_per_second": 3.477,
"step": 1158
},
{
"epoch": 7.0,
"grad_norm": 6.497671127319336,
"learning_rate": 1.300518134715026e-05,
"loss": 0.0211,
"step": 1351
},
{
"epoch": 7.0,
"eval_MAE": 0.14056500792503357,
"eval_R2": 0.25886664349880983,
"eval_RMSE": 0.18898992240428925,
"eval_loss": 0.0357171930372715,
"eval_runtime": 14.0545,
"eval_samples_per_second": 204.987,
"eval_steps_per_second": 3.486,
"step": 1351
},
{
"epoch": 8.0,
"grad_norm": 7.818419933319092,
"learning_rate": 1.2005181347150261e-05,
"loss": 0.0174,
"step": 1544
},
{
"epoch": 8.0,
"eval_MAE": 0.15229639410972595,
"eval_R2": 0.11496506128758999,
"eval_RMSE": 0.2065240740776062,
"eval_loss": 0.0426521971821785,
"eval_runtime": 14.1469,
"eval_samples_per_second": 203.649,
"eval_steps_per_second": 3.464,
"step": 1544
},
{
"epoch": 9.0,
"grad_norm": 4.021462917327881,
"learning_rate": 1.100518134715026e-05,
"loss": 0.0153,
"step": 1737
},
{
"epoch": 9.0,
"eval_MAE": 0.13968582451343536,
"eval_R2": 0.2638301636372278,
"eval_RMSE": 0.18835601210594177,
"eval_loss": 0.03547798842191696,
"eval_runtime": 14.0576,
"eval_samples_per_second": 204.942,
"eval_steps_per_second": 3.486,
"step": 1737
},
{
"epoch": 10.0,
"grad_norm": 0.8230902552604675,
"learning_rate": 1.0005181347150258e-05,
"loss": 0.0127,
"step": 1930
},
{
"epoch": 10.0,
"eval_MAE": 0.1468822956085205,
"eval_R2": 0.2201558651457277,
"eval_RMSE": 0.19386275112628937,
"eval_loss": 0.037582769989967346,
"eval_runtime": 14.0579,
"eval_samples_per_second": 204.939,
"eval_steps_per_second": 3.486,
"step": 1930
},
{
"epoch": 11.0,
"grad_norm": 1.3326853513717651,
"learning_rate": 9.005181347150261e-06,
"loss": 0.0112,
"step": 2123
},
{
"epoch": 11.0,
"eval_MAE": 0.15102224051952362,
"eval_R2": 0.12659890818148722,
"eval_RMSE": 0.2051621973514557,
"eval_loss": 0.042091526091098785,
"eval_runtime": 14.0985,
"eval_samples_per_second": 204.348,
"eval_steps_per_second": 3.476,
"step": 2123
},
{
"epoch": 12.0,
"grad_norm": 4.036520481109619,
"learning_rate": 8.005181347150259e-06,
"loss": 0.0102,
"step": 2316
},
{
"epoch": 12.0,
"eval_MAE": 0.15016663074493408,
"eval_R2": 0.13732674296360936,
"eval_RMSE": 0.20389831066131592,
"eval_loss": 0.04157452657818794,
"eval_runtime": 14.1218,
"eval_samples_per_second": 204.011,
"eval_steps_per_second": 3.47,
"step": 2316
}
],
"logging_steps": 500,
"max_steps": 3860,
"num_input_tokens_seen": 0,
"num_train_epochs": 20,
"save_steps": 500,
"total_flos": 1.2883969633724826e+17,
"train_batch_size": 60,
"trial_name": null,
"trial_params": null
}