CodeIsAbstract's picture
Training in progress, step 1000, checkpoint
bd510e9 verified
Raw
History Blame Contribute Delete
7.21 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 50,
"global_step": 1000,
"is_hyper_param_search": false,
"is_local_process_zero": false,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.05,
"eval_accuracy": 0.14088188976377952,
"eval_loss": 49.78975296020508,
"eval_runtime": 13.6275,
"eval_samples_per_second": 9.173,
"eval_steps_per_second": 1.174,
"step": 50
},
{
"epoch": 0.1,
"grad_norm": 13452.2255859375,
"learning_rate": 0.000264,
"loss": 1505.6178125,
"step": 100
},
{
"epoch": 0.1,
"eval_accuracy": 0.1445748031496063,
"eval_loss": 49.24732208251953,
"eval_runtime": 8.7677,
"eval_samples_per_second": 14.257,
"eval_steps_per_second": 1.825,
"step": 100
},
{
"epoch": 0.15,
"eval_accuracy": 0.1491968503937008,
"eval_loss": 48.760948181152344,
"eval_runtime": 8.1271,
"eval_samples_per_second": 15.381,
"eval_steps_per_second": 1.969,
"step": 150
},
{
"epoch": 0.2,
"grad_norm": 8017.09326171875,
"learning_rate": 0.0003967291041791484,
"loss": 1469.6371875,
"step": 200
},
{
"epoch": 0.2,
"eval_accuracy": 0.15311023622047243,
"eval_loss": 48.39834213256836,
"eval_runtime": 8.3927,
"eval_samples_per_second": 14.894,
"eval_steps_per_second": 1.906,
"step": 200
},
{
"epoch": 0.25,
"eval_accuracy": 0.15462204724409448,
"eval_loss": 48.1512336730957,
"eval_runtime": 10.9865,
"eval_samples_per_second": 11.378,
"eval_steps_per_second": 1.456,
"step": 250
},
{
"epoch": 0.3,
"grad_norm": 9418.4111328125,
"learning_rate": 0.0003704314025795668,
"loss": 1449.61,
"step": 300
},
{
"epoch": 0.3,
"eval_accuracy": 0.15623622047244096,
"eval_loss": 47.92970275878906,
"eval_runtime": 8.5559,
"eval_samples_per_second": 14.61,
"eval_steps_per_second": 1.87,
"step": 300
},
{
"epoch": 0.35,
"eval_accuracy": 0.15805511811023623,
"eval_loss": 47.6953125,
"eval_runtime": 10.9375,
"eval_samples_per_second": 11.429,
"eval_steps_per_second": 1.463,
"step": 350
},
{
"epoch": 0.4,
"grad_norm": 3742.375,
"learning_rate": 0.0003211159956686115,
"loss": 1437.1715625,
"step": 400
},
{
"epoch": 0.4,
"eval_accuracy": 0.16048031496062992,
"eval_loss": 47.554046630859375,
"eval_runtime": 8.2976,
"eval_samples_per_second": 15.065,
"eval_steps_per_second": 1.928,
"step": 400
},
{
"epoch": 0.45,
"eval_accuracy": 0.16221259842519686,
"eval_loss": 47.40172576904297,
"eval_runtime": 7.9017,
"eval_samples_per_second": 15.819,
"eval_steps_per_second": 2.025,
"step": 450
},
{
"epoch": 0.5,
"grad_norm": 12861.1259765625,
"learning_rate": 0.00025544320241571017,
"loss": 1426.95953125,
"step": 500
},
{
"epoch": 0.5,
"eval_accuracy": 0.1636220472440945,
"eval_loss": 47.27663803100586,
"eval_runtime": 8.5898,
"eval_samples_per_second": 14.552,
"eval_steps_per_second": 1.863,
"step": 500
},
{
"epoch": 0.55,
"eval_accuracy": 0.1651023622047244,
"eval_loss": 47.143985748291016,
"eval_runtime": 10.7415,
"eval_samples_per_second": 11.637,
"eval_steps_per_second": 1.49,
"step": 550
},
{
"epoch": 0.6,
"grad_norm": 9027.2001953125,
"learning_rate": 0.0001822824974551769,
"loss": 1423.1790625,
"step": 600
},
{
"epoch": 0.6,
"eval_accuracy": 0.16569291338582678,
"eval_loss": 47.07837677001953,
"eval_runtime": 8.4354,
"eval_samples_per_second": 14.818,
"eval_steps_per_second": 1.897,
"step": 600
},
{
"epoch": 0.65,
"eval_accuracy": 0.16648031496062993,
"eval_loss": 47.00508117675781,
"eval_runtime": 10.7099,
"eval_samples_per_second": 11.671,
"eval_steps_per_second": 1.494,
"step": 650
},
{
"epoch": 0.7,
"grad_norm": 5090.822265625,
"learning_rate": 0.0001115146393893927,
"loss": 1419.58796875,
"step": 700
},
{
"epoch": 0.7,
"eval_accuracy": 0.16728346456692914,
"eval_loss": 46.935848236083984,
"eval_runtime": 8.4034,
"eval_samples_per_second": 14.875,
"eval_steps_per_second": 1.904,
"step": 700
},
{
"epoch": 0.75,
"eval_accuracy": 0.1675748031496063,
"eval_loss": 46.88325119018555,
"eval_runtime": 7.7053,
"eval_samples_per_second": 16.223,
"eval_steps_per_second": 2.076,
"step": 750
},
{
"epoch": 0.8,
"grad_norm": 8640.748046875,
"learning_rate": 5.269721958838045e-05,
"loss": 1415.78859375,
"step": 800
},
{
"epoch": 0.8,
"eval_accuracy": 0.1682755905511811,
"eval_loss": 46.84225845336914,
"eval_runtime": 8.5769,
"eval_samples_per_second": 14.574,
"eval_steps_per_second": 1.865,
"step": 800
},
{
"epoch": 0.85,
"eval_accuracy": 0.16845669291338583,
"eval_loss": 46.823673248291016,
"eval_runtime": 10.5888,
"eval_samples_per_second": 11.805,
"eval_steps_per_second": 1.511,
"step": 850
},
{
"epoch": 0.9,
"grad_norm": 14275.54296875,
"learning_rate": 1.3773856514840955e-05,
"loss": 1415.929375,
"step": 900
},
{
"epoch": 0.9,
"eval_accuracy": 0.1687007874015748,
"eval_loss": 46.804019927978516,
"eval_runtime": 8.7116,
"eval_samples_per_second": 14.349,
"eval_steps_per_second": 1.837,
"step": 900
},
{
"epoch": 0.95,
"eval_accuracy": 0.16866141732283466,
"eval_loss": 46.80295181274414,
"eval_runtime": 8.0554,
"eval_samples_per_second": 15.518,
"eval_steps_per_second": 1.986,
"step": 950
},
{
"epoch": 1.0,
"grad_norm": 11099.6376953125,
"learning_rate": 1.3660336561915898e-09,
"loss": 1415.8740625,
"step": 1000
},
{
"epoch": 1.0,
"eval_accuracy": 0.16873228346456692,
"eval_loss": 46.800193786621094,
"eval_runtime": 8.4996,
"eval_samples_per_second": 14.707,
"eval_steps_per_second": 1.882,
"step": 1000
}
],
"logging_steps": 100,
"max_steps": 1000,
"num_input_tokens_seen": 0,
"num_train_epochs": 9223372036854775807,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}