{ "best_metric": 0.03547798842191696, "best_model_checkpoint": "logs/google-bert/bert-large-cased_accuracy-coverage/checkpoint-1737", "epoch": 12.0, "eval_steps": 500, "global_step": 2316, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 1.0, "grad_norm": 18.177562713623047, "learning_rate": 1.900518134715026e-05, "loss": 0.0796, "step": 193 }, { "epoch": 1.0, "eval_MAE": 0.16079820692539215, "eval_R2": 0.09031999984589933, "eval_RMSE": 0.20937980711460114, "eval_loss": 0.04383990541100502, "eval_runtime": 14.15, "eval_samples_per_second": 203.604, "eval_steps_per_second": 3.463, "step": 193 }, { "epoch": 2.0, "grad_norm": 5.8847270011901855, "learning_rate": 1.800518134715026e-05, "loss": 0.0589, "step": 386 }, { "epoch": 2.0, "eval_MAE": 0.16792413592338562, "eval_R2": -0.035297909277749895, "eval_RMSE": 0.22336912155151367, "eval_loss": 0.04989376664161682, "eval_runtime": 14.0183, "eval_samples_per_second": 205.517, "eval_steps_per_second": 3.495, "step": 386 }, { "epoch": 3.0, "grad_norm": 7.614197731018066, "learning_rate": 1.7005181347150262e-05, "loss": 0.051, "step": 579 }, { "epoch": 3.0, "eval_MAE": 0.18675751984119415, "eval_R2": -0.032218313600698156, "eval_RMSE": 0.22303664684295654, "eval_loss": 0.0497453473508358, "eval_runtime": 14.1082, "eval_samples_per_second": 204.208, "eval_steps_per_second": 3.473, "step": 579 }, { "epoch": 4.0, "grad_norm": 0.26663488149642944, "learning_rate": 1.6005181347150262e-05, "loss": 0.0368, "step": 772 }, { "epoch": 4.0, "eval_MAE": 0.14720453321933746, "eval_R2": 0.17138686484945131, "eval_RMSE": 0.19983261823654175, "eval_loss": 0.03993307799100876, "eval_runtime": 13.9915, "eval_samples_per_second": 205.91, "eval_steps_per_second": 3.502, "step": 772 }, { "epoch": 5.0, "grad_norm": 2.195333480834961, "learning_rate": 1.500518134715026e-05, "loss": 0.0305, "step": 965 }, { "epoch": 5.0, "eval_MAE": 0.14292865991592407, "eval_R2": 0.23018361342873883, "eval_RMSE": 0.19261230528354645, "eval_loss": 0.037099506705999374, "eval_runtime": 14.2625, "eval_samples_per_second": 201.999, "eval_steps_per_second": 3.436, "step": 965 }, { "epoch": 6.0, "grad_norm": 4.641444683074951, "learning_rate": 1.400518134715026e-05, "loss": 0.0251, "step": 1158 }, { "epoch": 6.0, "eval_MAE": 0.14436666667461395, "eval_R2": 0.21001704033333712, "eval_RMSE": 0.19511890411376953, "eval_loss": 0.03807138651609421, "eval_runtime": 14.0937, "eval_samples_per_second": 204.418, "eval_steps_per_second": 3.477, "step": 1158 }, { "epoch": 7.0, "grad_norm": 6.497671127319336, "learning_rate": 1.300518134715026e-05, "loss": 0.0211, "step": 1351 }, { "epoch": 7.0, "eval_MAE": 0.14056500792503357, "eval_R2": 0.25886664349880983, "eval_RMSE": 0.18898992240428925, "eval_loss": 0.0357171930372715, "eval_runtime": 14.0545, "eval_samples_per_second": 204.987, "eval_steps_per_second": 3.486, "step": 1351 }, { "epoch": 8.0, "grad_norm": 7.818419933319092, "learning_rate": 1.2005181347150261e-05, "loss": 0.0174, "step": 1544 }, { "epoch": 8.0, "eval_MAE": 0.15229639410972595, "eval_R2": 0.11496506128758999, "eval_RMSE": 0.2065240740776062, "eval_loss": 0.0426521971821785, "eval_runtime": 14.1469, "eval_samples_per_second": 203.649, "eval_steps_per_second": 3.464, "step": 1544 }, { "epoch": 9.0, "grad_norm": 4.021462917327881, "learning_rate": 1.100518134715026e-05, "loss": 0.0153, "step": 1737 }, { "epoch": 9.0, "eval_MAE": 0.13968582451343536, "eval_R2": 0.2638301636372278, "eval_RMSE": 0.18835601210594177, "eval_loss": 0.03547798842191696, "eval_runtime": 14.0576, "eval_samples_per_second": 204.942, "eval_steps_per_second": 3.486, "step": 1737 }, { "epoch": 10.0, "grad_norm": 0.8230902552604675, "learning_rate": 1.0005181347150258e-05, "loss": 0.0127, "step": 1930 }, { "epoch": 10.0, "eval_MAE": 0.1468822956085205, "eval_R2": 0.2201558651457277, "eval_RMSE": 0.19386275112628937, "eval_loss": 0.037582769989967346, "eval_runtime": 14.0579, "eval_samples_per_second": 204.939, "eval_steps_per_second": 3.486, "step": 1930 }, { "epoch": 11.0, "grad_norm": 1.3326853513717651, "learning_rate": 9.005181347150261e-06, "loss": 0.0112, "step": 2123 }, { "epoch": 11.0, "eval_MAE": 0.15102224051952362, "eval_R2": 0.12659890818148722, "eval_RMSE": 0.2051621973514557, "eval_loss": 0.042091526091098785, "eval_runtime": 14.0985, "eval_samples_per_second": 204.348, "eval_steps_per_second": 3.476, "step": 2123 }, { "epoch": 12.0, "grad_norm": 4.036520481109619, "learning_rate": 8.005181347150259e-06, "loss": 0.0102, "step": 2316 }, { "epoch": 12.0, "eval_MAE": 0.15016663074493408, "eval_R2": 0.13732674296360936, "eval_RMSE": 0.20389831066131592, "eval_loss": 0.04157452657818794, "eval_runtime": 14.1218, "eval_samples_per_second": 204.011, "eval_steps_per_second": 3.47, "step": 2316 } ], "logging_steps": 500, "max_steps": 3860, "num_input_tokens_seen": 0, "num_train_epochs": 20, "save_steps": 500, "total_flos": 1.2883969633724826e+17, "train_batch_size": 60, "trial_name": null, "trial_params": null }