| { |
| "best_global_step": 288, |
| "best_metric": 0.018894104287028313, |
| "best_model_checkpoint": "Qwen2.5-full-ft-HardQAfromMid/checkpoint-288", |
| "epoch": 2.9766233766233765, |
| "eval_steps": 16, |
| "global_step": 288, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.16623376623376623, |
| "grad_norm": 1.078125, |
| "learning_rate": 1.9154929577464788e-05, |
| "loss": 0.068, |
| "step": 16 |
| }, |
| { |
| "epoch": 0.16623376623376623, |
| "eval_loss": 0.030648380517959595, |
| "eval_runtime": 16.1836, |
| "eval_samples_per_second": 67.167, |
| "eval_steps_per_second": 4.202, |
| "step": 16 |
| }, |
| { |
| "epoch": 0.33246753246753247, |
| "grad_norm": 1.0546875, |
| "learning_rate": 1.8028169014084508e-05, |
| "loss": 0.0686, |
| "step": 32 |
| }, |
| { |
| "epoch": 0.33246753246753247, |
| "eval_loss": 0.02682075835764408, |
| "eval_runtime": 14.3127, |
| "eval_samples_per_second": 75.947, |
| "eval_steps_per_second": 4.751, |
| "step": 32 |
| }, |
| { |
| "epoch": 0.4987012987012987, |
| "grad_norm": 0.796875, |
| "learning_rate": 1.6901408450704228e-05, |
| "loss": 0.0269, |
| "step": 48 |
| }, |
| { |
| "epoch": 0.4987012987012987, |
| "eval_loss": 0.02497519925236702, |
| "eval_runtime": 14.3099, |
| "eval_samples_per_second": 75.962, |
| "eval_steps_per_second": 4.752, |
| "step": 48 |
| }, |
| { |
| "epoch": 0.6649350649350649, |
| "grad_norm": 1.078125, |
| "learning_rate": 1.5774647887323945e-05, |
| "loss": 0.1362, |
| "step": 64 |
| }, |
| { |
| "epoch": 0.6649350649350649, |
| "eval_loss": 0.024142559617757797, |
| "eval_runtime": 14.3652, |
| "eval_samples_per_second": 75.669, |
| "eval_steps_per_second": 4.734, |
| "step": 64 |
| }, |
| { |
| "epoch": 0.8311688311688312, |
| "grad_norm": 7.8125, |
| "learning_rate": 1.4647887323943663e-05, |
| "loss": 0.0952, |
| "step": 80 |
| }, |
| { |
| "epoch": 0.8311688311688312, |
| "eval_loss": 0.0227623600512743, |
| "eval_runtime": 14.4579, |
| "eval_samples_per_second": 75.184, |
| "eval_steps_per_second": 4.703, |
| "step": 80 |
| }, |
| { |
| "epoch": 0.9974025974025974, |
| "grad_norm": 1.2734375, |
| "learning_rate": 1.3521126760563382e-05, |
| "loss": 0.2095, |
| "step": 96 |
| }, |
| { |
| "epoch": 0.9974025974025974, |
| "eval_loss": 0.021850209683179855, |
| "eval_runtime": 14.7659, |
| "eval_samples_per_second": 73.615, |
| "eval_steps_per_second": 4.605, |
| "step": 96 |
| }, |
| { |
| "epoch": 1.155844155844156, |
| "grad_norm": 0.765625, |
| "learning_rate": 1.2394366197183098e-05, |
| "loss": 0.1785, |
| "step": 112 |
| }, |
| { |
| "epoch": 1.155844155844156, |
| "eval_loss": 0.021022453904151917, |
| "eval_runtime": 14.3936, |
| "eval_samples_per_second": 75.52, |
| "eval_steps_per_second": 4.724, |
| "step": 112 |
| }, |
| { |
| "epoch": 1.3220779220779222, |
| "grad_norm": 0.51171875, |
| "learning_rate": 1.1267605633802819e-05, |
| "loss": 0.0454, |
| "step": 128 |
| }, |
| { |
| "epoch": 1.3220779220779222, |
| "eval_loss": 0.020695487037301064, |
| "eval_runtime": 14.3712, |
| "eval_samples_per_second": 75.637, |
| "eval_steps_per_second": 4.732, |
| "step": 128 |
| }, |
| { |
| "epoch": 1.4883116883116883, |
| "grad_norm": 1.125, |
| "learning_rate": 1.0140845070422535e-05, |
| "loss": 0.0481, |
| "step": 144 |
| }, |
| { |
| "epoch": 1.4883116883116883, |
| "eval_loss": 0.020237548276782036, |
| "eval_runtime": 14.3561, |
| "eval_samples_per_second": 75.717, |
| "eval_steps_per_second": 4.737, |
| "step": 144 |
| }, |
| { |
| "epoch": 1.6545454545454545, |
| "grad_norm": 0.8984375, |
| "learning_rate": 9.014084507042254e-06, |
| "loss": 0.0515, |
| "step": 160 |
| }, |
| { |
| "epoch": 1.6545454545454545, |
| "eval_loss": 0.019498903304338455, |
| "eval_runtime": 14.378, |
| "eval_samples_per_second": 75.602, |
| "eval_steps_per_second": 4.729, |
| "step": 160 |
| }, |
| { |
| "epoch": 1.8207792207792208, |
| "grad_norm": 0.90625, |
| "learning_rate": 7.887323943661972e-06, |
| "loss": 0.0548, |
| "step": 176 |
| }, |
| { |
| "epoch": 1.8207792207792208, |
| "eval_loss": 0.01939920149743557, |
| "eval_runtime": 14.3814, |
| "eval_samples_per_second": 75.584, |
| "eval_steps_per_second": 4.728, |
| "step": 176 |
| }, |
| { |
| "epoch": 1.987012987012987, |
| "grad_norm": 7.71875, |
| "learning_rate": 6.760563380281691e-06, |
| "loss": 0.1138, |
| "step": 192 |
| }, |
| { |
| "epoch": 1.987012987012987, |
| "eval_loss": 0.01901831291615963, |
| "eval_runtime": 14.5408, |
| "eval_samples_per_second": 74.755, |
| "eval_steps_per_second": 4.676, |
| "step": 192 |
| }, |
| { |
| "epoch": 2.1454545454545455, |
| "grad_norm": 0.63671875, |
| "learning_rate": 5.633802816901409e-06, |
| "loss": 0.1448, |
| "step": 208 |
| }, |
| { |
| "epoch": 2.1454545454545455, |
| "eval_loss": 0.018952278420329094, |
| "eval_runtime": 14.472, |
| "eval_samples_per_second": 75.111, |
| "eval_steps_per_second": 4.699, |
| "step": 208 |
| }, |
| { |
| "epoch": 2.311688311688312, |
| "grad_norm": 0.71875, |
| "learning_rate": 4.507042253521127e-06, |
| "loss": 0.107, |
| "step": 224 |
| }, |
| { |
| "epoch": 2.311688311688312, |
| "eval_loss": 0.019044360145926476, |
| "eval_runtime": 14.5479, |
| "eval_samples_per_second": 74.719, |
| "eval_steps_per_second": 4.674, |
| "step": 224 |
| }, |
| { |
| "epoch": 2.477922077922078, |
| "grad_norm": 0.91796875, |
| "learning_rate": 3.3802816901408454e-06, |
| "loss": 0.0077, |
| "step": 240 |
| }, |
| { |
| "epoch": 2.477922077922078, |
| "eval_loss": 0.018966523930430412, |
| "eval_runtime": 14.3869, |
| "eval_samples_per_second": 75.555, |
| "eval_steps_per_second": 4.727, |
| "step": 240 |
| }, |
| { |
| "epoch": 2.6441558441558444, |
| "grad_norm": 0.44140625, |
| "learning_rate": 2.2535211267605635e-06, |
| "loss": 0.0415, |
| "step": 256 |
| }, |
| { |
| "epoch": 2.6441558441558444, |
| "eval_loss": 0.01892191916704178, |
| "eval_runtime": 14.332, |
| "eval_samples_per_second": 75.844, |
| "eval_steps_per_second": 4.745, |
| "step": 256 |
| }, |
| { |
| "epoch": 2.8103896103896107, |
| "grad_norm": 0.5703125, |
| "learning_rate": 1.1267605633802817e-06, |
| "loss": 0.0941, |
| "step": 272 |
| }, |
| { |
| "epoch": 2.8103896103896107, |
| "eval_loss": 0.01891483925282955, |
| "eval_runtime": 14.3263, |
| "eval_samples_per_second": 75.874, |
| "eval_steps_per_second": 4.747, |
| "step": 272 |
| }, |
| { |
| "epoch": 2.9766233766233765, |
| "grad_norm": 0.80078125, |
| "learning_rate": 0.0, |
| "loss": 0.0806, |
| "step": 288 |
| }, |
| { |
| "epoch": 2.9766233766233765, |
| "eval_loss": 0.018894104287028313, |
| "eval_runtime": 14.5656, |
| "eval_samples_per_second": 74.628, |
| "eval_steps_per_second": 4.669, |
| "step": 288 |
| } |
| ], |
| "logging_steps": 16, |
| "max_steps": 288, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 3, |
| "save_steps": 48, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.22041209421824e+17, |
| "train_batch_size": 16, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|