CodeIsAbstract's picture
Training in progress, step 1000, checkpoint
b98f0b6 verified
Raw
History Blame Contribute Delete
7.23 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 50,
"global_step": 1000,
"is_hyper_param_search": false,
"is_local_process_zero": false,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.05,
"eval_accuracy": 0.07674803149606299,
"eval_loss": 59.70803451538086,
"eval_runtime": 27.1066,
"eval_samples_per_second": 4.611,
"eval_steps_per_second": 0.59,
"step": 50
},
{
"epoch": 0.1,
"grad_norm": 1437.81298828125,
"learning_rate": 0.000264,
"loss": 1842.08875,
"step": 100
},
{
"epoch": 0.1,
"eval_accuracy": 0.11214173228346457,
"eval_loss": 56.53706359863281,
"eval_runtime": 9.6201,
"eval_samples_per_second": 12.994,
"eval_steps_per_second": 1.663,
"step": 100
},
{
"epoch": 0.15,
"eval_accuracy": 0.1248740157480315,
"eval_loss": 53.10245132446289,
"eval_runtime": 13.0919,
"eval_samples_per_second": 9.548,
"eval_steps_per_second": 1.222,
"step": 150
},
{
"epoch": 0.2,
"grad_norm": 1170.414794921875,
"learning_rate": 0.0003967291041791484,
"loss": 1604.2784375,
"step": 200
},
{
"epoch": 0.2,
"eval_accuracy": 0.14473228346456693,
"eval_loss": 49.9360237121582,
"eval_runtime": 9.3123,
"eval_samples_per_second": 13.423,
"eval_steps_per_second": 1.718,
"step": 200
},
{
"epoch": 0.25,
"eval_accuracy": 0.17015748031496064,
"eval_loss": 47.78742218017578,
"eval_runtime": 10.4409,
"eval_samples_per_second": 11.972,
"eval_steps_per_second": 1.532,
"step": 250
},
{
"epoch": 0.3,
"grad_norm": 627.5261840820312,
"learning_rate": 0.0003704314025795668,
"loss": 1458.88296875,
"step": 300
},
{
"epoch": 0.3,
"eval_accuracy": 0.16708661417322834,
"eval_loss": 47.620853424072266,
"eval_runtime": 9.5812,
"eval_samples_per_second": 13.046,
"eval_steps_per_second": 1.67,
"step": 300
},
{
"epoch": 0.35,
"eval_accuracy": 0.18376377952755907,
"eval_loss": 46.354679107666016,
"eval_runtime": 8.2523,
"eval_samples_per_second": 15.147,
"eval_steps_per_second": 1.939,
"step": 350
},
{
"epoch": 0.4,
"grad_norm": 1531.896484375,
"learning_rate": 0.0003211159956686115,
"loss": 1410.06390625,
"step": 400
},
{
"epoch": 0.4,
"eval_accuracy": 0.18334645669291338,
"eval_loss": 45.935264587402344,
"eval_runtime": 9.4355,
"eval_samples_per_second": 13.248,
"eval_steps_per_second": 1.696,
"step": 400
},
{
"epoch": 0.45,
"eval_accuracy": 0.18777165354330708,
"eval_loss": 45.47114944458008,
"eval_runtime": 14.0955,
"eval_samples_per_second": 8.868,
"eval_steps_per_second": 1.135,
"step": 450
},
{
"epoch": 0.5,
"grad_norm": 19442.306640625,
"learning_rate": 0.00025544320241571017,
"loss": 1381.1546875,
"step": 500
},
{
"epoch": 0.5,
"eval_accuracy": 0.18888188976377954,
"eval_loss": 45.3370475769043,
"eval_runtime": 9.3555,
"eval_samples_per_second": 13.361,
"eval_steps_per_second": 1.71,
"step": 500
},
{
"epoch": 0.55,
"eval_accuracy": 0.19033070866141732,
"eval_loss": 44.91364288330078,
"eval_runtime": 8.7783,
"eval_samples_per_second": 14.24,
"eval_steps_per_second": 1.823,
"step": 550
},
{
"epoch": 0.6,
"grad_norm": 28925.150390625,
"learning_rate": 0.0001822824974551769,
"loss": 1365.12171875,
"step": 600
},
{
"epoch": 0.6,
"eval_accuracy": 0.19299212598425197,
"eval_loss": 44.67140579223633,
"eval_runtime": 9.3914,
"eval_samples_per_second": 13.31,
"eval_steps_per_second": 1.704,
"step": 600
},
{
"epoch": 0.65,
"eval_accuracy": 0.19476377952755905,
"eval_loss": 44.36285400390625,
"eval_runtime": 11.8603,
"eval_samples_per_second": 10.539,
"eval_steps_per_second": 1.349,
"step": 650
},
{
"epoch": 0.7,
"grad_norm": 6494.93701171875,
"learning_rate": 0.0001115146393893927,
"loss": 1348.1965625,
"step": 700
},
{
"epoch": 0.7,
"eval_accuracy": 0.19607086614173228,
"eval_loss": 44.26563262939453,
"eval_runtime": 9.2536,
"eval_samples_per_second": 13.508,
"eval_steps_per_second": 1.729,
"step": 700
},
{
"epoch": 0.75,
"eval_accuracy": 0.19792125984251968,
"eval_loss": 44.026851654052734,
"eval_runtime": 13.9865,
"eval_samples_per_second": 8.937,
"eval_steps_per_second": 1.144,
"step": 750
},
{
"epoch": 0.8,
"grad_norm": 6566.00732421875,
"learning_rate": 5.269721958838045e-05,
"loss": 1335.25640625,
"step": 800
},
{
"epoch": 0.8,
"eval_accuracy": 0.19969291338582676,
"eval_loss": 43.83841323852539,
"eval_runtime": 9.3886,
"eval_samples_per_second": 13.314,
"eval_steps_per_second": 1.704,
"step": 800
},
{
"epoch": 0.85,
"eval_accuracy": 0.2002755905511811,
"eval_loss": 43.76130294799805,
"eval_runtime": 16.2687,
"eval_samples_per_second": 7.683,
"eval_steps_per_second": 0.983,
"step": 850
},
{
"epoch": 0.9,
"grad_norm": 5925.8193359375,
"learning_rate": 1.3773856514840955e-05,
"loss": 1328.743125,
"step": 900
},
{
"epoch": 0.9,
"eval_accuracy": 0.20086614173228345,
"eval_loss": 43.69052505493164,
"eval_runtime": 9.3216,
"eval_samples_per_second": 13.41,
"eval_steps_per_second": 1.716,
"step": 900
},
{
"epoch": 0.95,
"eval_accuracy": 0.2008503937007874,
"eval_loss": 43.665740966796875,
"eval_runtime": 15.4653,
"eval_samples_per_second": 8.083,
"eval_steps_per_second": 1.035,
"step": 950
},
{
"epoch": 1.0,
"grad_norm": 6814.45703125,
"learning_rate": 1.3660336561915898e-09,
"loss": 1325.8203125,
"step": 1000
},
{
"epoch": 1.0,
"eval_accuracy": 0.2012047244094488,
"eval_loss": 43.653385162353516,
"eval_runtime": 9.352,
"eval_samples_per_second": 13.366,
"eval_steps_per_second": 1.711,
"step": 1000
}
],
"logging_steps": 100,
"max_steps": 1000,
"num_input_tokens_seen": 0,
"num_train_epochs": 9223372036854775807,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}