Commgpt-3B / trainer_state.json
dabboud's picture
Add files using upload-large-folder tool
3ef865b verified
Raw
History Blame Contribute Delete
7.65 kB
{
"best_global_step": 288,
"best_metric": 0.018894104287028313,
"best_model_checkpoint": "Qwen2.5-full-ft-HardQAfromMid/checkpoint-288",
"epoch": 2.9766233766233765,
"eval_steps": 16,
"global_step": 288,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.16623376623376623,
"grad_norm": 1.078125,
"learning_rate": 1.9154929577464788e-05,
"loss": 0.068,
"step": 16
},
{
"epoch": 0.16623376623376623,
"eval_loss": 0.030648380517959595,
"eval_runtime": 16.1836,
"eval_samples_per_second": 67.167,
"eval_steps_per_second": 4.202,
"step": 16
},
{
"epoch": 0.33246753246753247,
"grad_norm": 1.0546875,
"learning_rate": 1.8028169014084508e-05,
"loss": 0.0686,
"step": 32
},
{
"epoch": 0.33246753246753247,
"eval_loss": 0.02682075835764408,
"eval_runtime": 14.3127,
"eval_samples_per_second": 75.947,
"eval_steps_per_second": 4.751,
"step": 32
},
{
"epoch": 0.4987012987012987,
"grad_norm": 0.796875,
"learning_rate": 1.6901408450704228e-05,
"loss": 0.0269,
"step": 48
},
{
"epoch": 0.4987012987012987,
"eval_loss": 0.02497519925236702,
"eval_runtime": 14.3099,
"eval_samples_per_second": 75.962,
"eval_steps_per_second": 4.752,
"step": 48
},
{
"epoch": 0.6649350649350649,
"grad_norm": 1.078125,
"learning_rate": 1.5774647887323945e-05,
"loss": 0.1362,
"step": 64
},
{
"epoch": 0.6649350649350649,
"eval_loss": 0.024142559617757797,
"eval_runtime": 14.3652,
"eval_samples_per_second": 75.669,
"eval_steps_per_second": 4.734,
"step": 64
},
{
"epoch": 0.8311688311688312,
"grad_norm": 7.8125,
"learning_rate": 1.4647887323943663e-05,
"loss": 0.0952,
"step": 80
},
{
"epoch": 0.8311688311688312,
"eval_loss": 0.0227623600512743,
"eval_runtime": 14.4579,
"eval_samples_per_second": 75.184,
"eval_steps_per_second": 4.703,
"step": 80
},
{
"epoch": 0.9974025974025974,
"grad_norm": 1.2734375,
"learning_rate": 1.3521126760563382e-05,
"loss": 0.2095,
"step": 96
},
{
"epoch": 0.9974025974025974,
"eval_loss": 0.021850209683179855,
"eval_runtime": 14.7659,
"eval_samples_per_second": 73.615,
"eval_steps_per_second": 4.605,
"step": 96
},
{
"epoch": 1.155844155844156,
"grad_norm": 0.765625,
"learning_rate": 1.2394366197183098e-05,
"loss": 0.1785,
"step": 112
},
{
"epoch": 1.155844155844156,
"eval_loss": 0.021022453904151917,
"eval_runtime": 14.3936,
"eval_samples_per_second": 75.52,
"eval_steps_per_second": 4.724,
"step": 112
},
{
"epoch": 1.3220779220779222,
"grad_norm": 0.51171875,
"learning_rate": 1.1267605633802819e-05,
"loss": 0.0454,
"step": 128
},
{
"epoch": 1.3220779220779222,
"eval_loss": 0.020695487037301064,
"eval_runtime": 14.3712,
"eval_samples_per_second": 75.637,
"eval_steps_per_second": 4.732,
"step": 128
},
{
"epoch": 1.4883116883116883,
"grad_norm": 1.125,
"learning_rate": 1.0140845070422535e-05,
"loss": 0.0481,
"step": 144
},
{
"epoch": 1.4883116883116883,
"eval_loss": 0.020237548276782036,
"eval_runtime": 14.3561,
"eval_samples_per_second": 75.717,
"eval_steps_per_second": 4.737,
"step": 144
},
{
"epoch": 1.6545454545454545,
"grad_norm": 0.8984375,
"learning_rate": 9.014084507042254e-06,
"loss": 0.0515,
"step": 160
},
{
"epoch": 1.6545454545454545,
"eval_loss": 0.019498903304338455,
"eval_runtime": 14.378,
"eval_samples_per_second": 75.602,
"eval_steps_per_second": 4.729,
"step": 160
},
{
"epoch": 1.8207792207792208,
"grad_norm": 0.90625,
"learning_rate": 7.887323943661972e-06,
"loss": 0.0548,
"step": 176
},
{
"epoch": 1.8207792207792208,
"eval_loss": 0.01939920149743557,
"eval_runtime": 14.3814,
"eval_samples_per_second": 75.584,
"eval_steps_per_second": 4.728,
"step": 176
},
{
"epoch": 1.987012987012987,
"grad_norm": 7.71875,
"learning_rate": 6.760563380281691e-06,
"loss": 0.1138,
"step": 192
},
{
"epoch": 1.987012987012987,
"eval_loss": 0.01901831291615963,
"eval_runtime": 14.5408,
"eval_samples_per_second": 74.755,
"eval_steps_per_second": 4.676,
"step": 192
},
{
"epoch": 2.1454545454545455,
"grad_norm": 0.63671875,
"learning_rate": 5.633802816901409e-06,
"loss": 0.1448,
"step": 208
},
{
"epoch": 2.1454545454545455,
"eval_loss": 0.018952278420329094,
"eval_runtime": 14.472,
"eval_samples_per_second": 75.111,
"eval_steps_per_second": 4.699,
"step": 208
},
{
"epoch": 2.311688311688312,
"grad_norm": 0.71875,
"learning_rate": 4.507042253521127e-06,
"loss": 0.107,
"step": 224
},
{
"epoch": 2.311688311688312,
"eval_loss": 0.019044360145926476,
"eval_runtime": 14.5479,
"eval_samples_per_second": 74.719,
"eval_steps_per_second": 4.674,
"step": 224
},
{
"epoch": 2.477922077922078,
"grad_norm": 0.91796875,
"learning_rate": 3.3802816901408454e-06,
"loss": 0.0077,
"step": 240
},
{
"epoch": 2.477922077922078,
"eval_loss": 0.018966523930430412,
"eval_runtime": 14.3869,
"eval_samples_per_second": 75.555,
"eval_steps_per_second": 4.727,
"step": 240
},
{
"epoch": 2.6441558441558444,
"grad_norm": 0.44140625,
"learning_rate": 2.2535211267605635e-06,
"loss": 0.0415,
"step": 256
},
{
"epoch": 2.6441558441558444,
"eval_loss": 0.01892191916704178,
"eval_runtime": 14.332,
"eval_samples_per_second": 75.844,
"eval_steps_per_second": 4.745,
"step": 256
},
{
"epoch": 2.8103896103896107,
"grad_norm": 0.5703125,
"learning_rate": 1.1267605633802817e-06,
"loss": 0.0941,
"step": 272
},
{
"epoch": 2.8103896103896107,
"eval_loss": 0.01891483925282955,
"eval_runtime": 14.3263,
"eval_samples_per_second": 75.874,
"eval_steps_per_second": 4.747,
"step": 272
},
{
"epoch": 2.9766233766233765,
"grad_norm": 0.80078125,
"learning_rate": 0.0,
"loss": 0.0806,
"step": 288
},
{
"epoch": 2.9766233766233765,
"eval_loss": 0.018894104287028313,
"eval_runtime": 14.5656,
"eval_samples_per_second": 74.628,
"eval_steps_per_second": 4.669,
"step": 288
}
],
"logging_steps": 16,
"max_steps": 288,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 48,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.22041209421824e+17,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}