{ "best_metric": 0.016377536579966545, "best_model_checkpoint": "bart_test_p2/checkpoint-8500", "epoch": 2.9782761037140855, "eval_steps": 500, "global_step": 8500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0, "learning_rate": 9.99883204858678e-06, "loss": 0.0025, "step": 1 }, { "epoch": 0.18, "learning_rate": 9.416024293389396e-06, "loss": 0.0083, "step": 500 }, { "epoch": 0.18, "eval_loss": 0.022603686898946762, "eval_runtime": 64.8155, "eval_samples_per_second": 150.952, "eval_steps_per_second": 18.869, "step": 500 }, { "epoch": 0.35, "learning_rate": 8.83204858677879e-06, "loss": 0.0075, "step": 1000 }, { "epoch": 0.35, "eval_loss": 0.022469399496912956, "eval_runtime": 64.9299, "eval_samples_per_second": 150.686, "eval_steps_per_second": 18.836, "step": 1000 }, { "epoch": 0.53, "learning_rate": 8.248072880168185e-06, "loss": 0.0073, "step": 1500 }, { "epoch": 0.53, "eval_loss": 0.021044988185167313, "eval_runtime": 64.7915, "eval_samples_per_second": 151.008, "eval_steps_per_second": 18.876, "step": 1500 }, { "epoch": 0.7, "learning_rate": 7.664097173557581e-06, "loss": 0.0062, "step": 2000 }, { "epoch": 0.7, "eval_loss": 0.02233254536986351, "eval_runtime": 64.8144, "eval_samples_per_second": 150.954, "eval_steps_per_second": 18.869, "step": 2000 }, { "epoch": 0.88, "learning_rate": 7.080121466946975e-06, "loss": 0.007, "step": 2500 }, { "epoch": 0.88, "eval_loss": 0.020101269707083702, "eval_runtime": 64.955, "eval_samples_per_second": 150.627, "eval_steps_per_second": 18.828, "step": 2500 }, { "epoch": 1.05, "learning_rate": 6.496145760336371e-06, "loss": 0.0072, "step": 3000 }, { "epoch": 1.05, "eval_loss": 0.020503461360931396, "eval_runtime": 64.8414, "eval_samples_per_second": 150.891, "eval_steps_per_second": 18.861, "step": 3000 }, { "epoch": 1.23, "learning_rate": 5.912170053725765e-06, "loss": 0.006, "step": 3500 }, { "epoch": 1.23, "eval_loss": 0.01998145505785942, "eval_runtime": 64.8121, "eval_samples_per_second": 150.96, "eval_steps_per_second": 18.87, "step": 3500 }, { "epoch": 1.4, "learning_rate": 5.328194347115161e-06, "loss": 0.005, "step": 4000 }, { "epoch": 1.4, "eval_loss": 0.020134715363383293, "eval_runtime": 65.0335, "eval_samples_per_second": 150.445, "eval_steps_per_second": 18.806, "step": 4000 }, { "epoch": 1.58, "learning_rate": 4.744218640504556e-06, "loss": 0.0058, "step": 4500 }, { "epoch": 1.58, "eval_loss": 0.019398093223571777, "eval_runtime": 64.8875, "eval_samples_per_second": 150.784, "eval_steps_per_second": 18.848, "step": 4500 }, { "epoch": 1.75, "learning_rate": 4.16024293389395e-06, "loss": 0.0062, "step": 5000 }, { "epoch": 1.75, "eval_loss": 0.018503881990909576, "eval_runtime": 64.9786, "eval_samples_per_second": 150.573, "eval_steps_per_second": 18.822, "step": 5000 }, { "epoch": 1.93, "learning_rate": 3.5762672272833454e-06, "loss": 0.0068, "step": 5500 }, { "epoch": 1.93, "eval_loss": 0.017726033926010132, "eval_runtime": 64.7672, "eval_samples_per_second": 151.064, "eval_steps_per_second": 18.883, "step": 5500 }, { "epoch": 2.1, "learning_rate": 2.9922915206727405e-06, "loss": 0.0069, "step": 6000 }, { "epoch": 2.1, "eval_loss": 0.017498329281806946, "eval_runtime": 64.8308, "eval_samples_per_second": 150.916, "eval_steps_per_second": 18.864, "step": 6000 }, { "epoch": 2.28, "learning_rate": 2.4083158140621352e-06, "loss": 0.0061, "step": 6500 }, { "epoch": 2.28, "eval_loss": 0.017673367634415627, "eval_runtime": 64.856, "eval_samples_per_second": 150.857, "eval_steps_per_second": 18.857, "step": 6500 }, { "epoch": 2.45, "learning_rate": 1.8243401074515301e-06, "loss": 0.0074, "step": 7000 }, { "epoch": 2.45, "eval_loss": 0.017499757930636406, "eval_runtime": 64.9811, "eval_samples_per_second": 150.567, "eval_steps_per_second": 18.821, "step": 7000 }, { "epoch": 2.63, "learning_rate": 1.2403644008409253e-06, "loss": 0.0092, "step": 7500 }, { "epoch": 2.63, "eval_loss": 0.016884520649909973, "eval_runtime": 64.8891, "eval_samples_per_second": 150.78, "eval_steps_per_second": 18.848, "step": 7500 }, { "epoch": 2.8, "learning_rate": 6.563886942303201e-07, "loss": 0.011, "step": 8000 }, { "epoch": 2.8, "eval_loss": 0.016412850469350815, "eval_runtime": 64.9682, "eval_samples_per_second": 150.597, "eval_steps_per_second": 18.825, "step": 8000 }, { "epoch": 2.98, "learning_rate": 7.241298761971503e-08, "loss": 0.0125, "step": 8500 }, { "epoch": 2.98, "eval_loss": 0.016377536579966545, "eval_runtime": 64.7805, "eval_samples_per_second": 151.033, "eval_steps_per_second": 18.879, "step": 8500 } ], "logging_steps": 500, "max_steps": 8562, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "total_flos": 2548110095032320.0, "train_batch_size": 8, "trial_name": null, "trial_params": null }