ypl's picture
ypl/bart_game_clean_final
3407d16 verified
Raw
History Blame Contribute Delete
6.18 kB
{
"best_metric": 0.016377536579966545,
"best_model_checkpoint": "bart_test_p2/checkpoint-8500",
"epoch": 2.9782761037140855,
"eval_steps": 500,
"global_step": 8500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0,
"learning_rate": 9.99883204858678e-06,
"loss": 0.0025,
"step": 1
},
{
"epoch": 0.18,
"learning_rate": 9.416024293389396e-06,
"loss": 0.0083,
"step": 500
},
{
"epoch": 0.18,
"eval_loss": 0.022603686898946762,
"eval_runtime": 64.8155,
"eval_samples_per_second": 150.952,
"eval_steps_per_second": 18.869,
"step": 500
},
{
"epoch": 0.35,
"learning_rate": 8.83204858677879e-06,
"loss": 0.0075,
"step": 1000
},
{
"epoch": 0.35,
"eval_loss": 0.022469399496912956,
"eval_runtime": 64.9299,
"eval_samples_per_second": 150.686,
"eval_steps_per_second": 18.836,
"step": 1000
},
{
"epoch": 0.53,
"learning_rate": 8.248072880168185e-06,
"loss": 0.0073,
"step": 1500
},
{
"epoch": 0.53,
"eval_loss": 0.021044988185167313,
"eval_runtime": 64.7915,
"eval_samples_per_second": 151.008,
"eval_steps_per_second": 18.876,
"step": 1500
},
{
"epoch": 0.7,
"learning_rate": 7.664097173557581e-06,
"loss": 0.0062,
"step": 2000
},
{
"epoch": 0.7,
"eval_loss": 0.02233254536986351,
"eval_runtime": 64.8144,
"eval_samples_per_second": 150.954,
"eval_steps_per_second": 18.869,
"step": 2000
},
{
"epoch": 0.88,
"learning_rate": 7.080121466946975e-06,
"loss": 0.007,
"step": 2500
},
{
"epoch": 0.88,
"eval_loss": 0.020101269707083702,
"eval_runtime": 64.955,
"eval_samples_per_second": 150.627,
"eval_steps_per_second": 18.828,
"step": 2500
},
{
"epoch": 1.05,
"learning_rate": 6.496145760336371e-06,
"loss": 0.0072,
"step": 3000
},
{
"epoch": 1.05,
"eval_loss": 0.020503461360931396,
"eval_runtime": 64.8414,
"eval_samples_per_second": 150.891,
"eval_steps_per_second": 18.861,
"step": 3000
},
{
"epoch": 1.23,
"learning_rate": 5.912170053725765e-06,
"loss": 0.006,
"step": 3500
},
{
"epoch": 1.23,
"eval_loss": 0.01998145505785942,
"eval_runtime": 64.8121,
"eval_samples_per_second": 150.96,
"eval_steps_per_second": 18.87,
"step": 3500
},
{
"epoch": 1.4,
"learning_rate": 5.328194347115161e-06,
"loss": 0.005,
"step": 4000
},
{
"epoch": 1.4,
"eval_loss": 0.020134715363383293,
"eval_runtime": 65.0335,
"eval_samples_per_second": 150.445,
"eval_steps_per_second": 18.806,
"step": 4000
},
{
"epoch": 1.58,
"learning_rate": 4.744218640504556e-06,
"loss": 0.0058,
"step": 4500
},
{
"epoch": 1.58,
"eval_loss": 0.019398093223571777,
"eval_runtime": 64.8875,
"eval_samples_per_second": 150.784,
"eval_steps_per_second": 18.848,
"step": 4500
},
{
"epoch": 1.75,
"learning_rate": 4.16024293389395e-06,
"loss": 0.0062,
"step": 5000
},
{
"epoch": 1.75,
"eval_loss": 0.018503881990909576,
"eval_runtime": 64.9786,
"eval_samples_per_second": 150.573,
"eval_steps_per_second": 18.822,
"step": 5000
},
{
"epoch": 1.93,
"learning_rate": 3.5762672272833454e-06,
"loss": 0.0068,
"step": 5500
},
{
"epoch": 1.93,
"eval_loss": 0.017726033926010132,
"eval_runtime": 64.7672,
"eval_samples_per_second": 151.064,
"eval_steps_per_second": 18.883,
"step": 5500
},
{
"epoch": 2.1,
"learning_rate": 2.9922915206727405e-06,
"loss": 0.0069,
"step": 6000
},
{
"epoch": 2.1,
"eval_loss": 0.017498329281806946,
"eval_runtime": 64.8308,
"eval_samples_per_second": 150.916,
"eval_steps_per_second": 18.864,
"step": 6000
},
{
"epoch": 2.28,
"learning_rate": 2.4083158140621352e-06,
"loss": 0.0061,
"step": 6500
},
{
"epoch": 2.28,
"eval_loss": 0.017673367634415627,
"eval_runtime": 64.856,
"eval_samples_per_second": 150.857,
"eval_steps_per_second": 18.857,
"step": 6500
},
{
"epoch": 2.45,
"learning_rate": 1.8243401074515301e-06,
"loss": 0.0074,
"step": 7000
},
{
"epoch": 2.45,
"eval_loss": 0.017499757930636406,
"eval_runtime": 64.9811,
"eval_samples_per_second": 150.567,
"eval_steps_per_second": 18.821,
"step": 7000
},
{
"epoch": 2.63,
"learning_rate": 1.2403644008409253e-06,
"loss": 0.0092,
"step": 7500
},
{
"epoch": 2.63,
"eval_loss": 0.016884520649909973,
"eval_runtime": 64.8891,
"eval_samples_per_second": 150.78,
"eval_steps_per_second": 18.848,
"step": 7500
},
{
"epoch": 2.8,
"learning_rate": 6.563886942303201e-07,
"loss": 0.011,
"step": 8000
},
{
"epoch": 2.8,
"eval_loss": 0.016412850469350815,
"eval_runtime": 64.9682,
"eval_samples_per_second": 150.597,
"eval_steps_per_second": 18.825,
"step": 8000
},
{
"epoch": 2.98,
"learning_rate": 7.241298761971503e-08,
"loss": 0.0125,
"step": 8500
},
{
"epoch": 2.98,
"eval_loss": 0.016377536579966545,
"eval_runtime": 64.7805,
"eval_samples_per_second": 151.033,
"eval_steps_per_second": 18.879,
"step": 8500
}
],
"logging_steps": 500,
"max_steps": 8562,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"total_flos": 2548110095032320.0,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}