{ "best_global_step": 288, "best_metric": 0.018894104287028313, "best_model_checkpoint": "Qwen2.5-full-ft-HardQAfromMid/checkpoint-288", "epoch": 2.9766233766233765, "eval_steps": 16, "global_step": 288, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.16623376623376623, "grad_norm": 1.078125, "learning_rate": 1.9154929577464788e-05, "loss": 0.068, "step": 16 }, { "epoch": 0.16623376623376623, "eval_loss": 0.030648380517959595, "eval_runtime": 16.1836, "eval_samples_per_second": 67.167, "eval_steps_per_second": 4.202, "step": 16 }, { "epoch": 0.33246753246753247, "grad_norm": 1.0546875, "learning_rate": 1.8028169014084508e-05, "loss": 0.0686, "step": 32 }, { "epoch": 0.33246753246753247, "eval_loss": 0.02682075835764408, "eval_runtime": 14.3127, "eval_samples_per_second": 75.947, "eval_steps_per_second": 4.751, "step": 32 }, { "epoch": 0.4987012987012987, "grad_norm": 0.796875, "learning_rate": 1.6901408450704228e-05, "loss": 0.0269, "step": 48 }, { "epoch": 0.4987012987012987, "eval_loss": 0.02497519925236702, "eval_runtime": 14.3099, "eval_samples_per_second": 75.962, "eval_steps_per_second": 4.752, "step": 48 }, { "epoch": 0.6649350649350649, "grad_norm": 1.078125, "learning_rate": 1.5774647887323945e-05, "loss": 0.1362, "step": 64 }, { "epoch": 0.6649350649350649, "eval_loss": 0.024142559617757797, "eval_runtime": 14.3652, "eval_samples_per_second": 75.669, "eval_steps_per_second": 4.734, "step": 64 }, { "epoch": 0.8311688311688312, "grad_norm": 7.8125, "learning_rate": 1.4647887323943663e-05, "loss": 0.0952, "step": 80 }, { "epoch": 0.8311688311688312, "eval_loss": 0.0227623600512743, "eval_runtime": 14.4579, "eval_samples_per_second": 75.184, "eval_steps_per_second": 4.703, "step": 80 }, { "epoch": 0.9974025974025974, "grad_norm": 1.2734375, "learning_rate": 1.3521126760563382e-05, "loss": 0.2095, "step": 96 }, { "epoch": 0.9974025974025974, "eval_loss": 0.021850209683179855, "eval_runtime": 14.7659, "eval_samples_per_second": 73.615, "eval_steps_per_second": 4.605, "step": 96 }, { "epoch": 1.155844155844156, "grad_norm": 0.765625, "learning_rate": 1.2394366197183098e-05, "loss": 0.1785, "step": 112 }, { "epoch": 1.155844155844156, "eval_loss": 0.021022453904151917, "eval_runtime": 14.3936, "eval_samples_per_second": 75.52, "eval_steps_per_second": 4.724, "step": 112 }, { "epoch": 1.3220779220779222, "grad_norm": 0.51171875, "learning_rate": 1.1267605633802819e-05, "loss": 0.0454, "step": 128 }, { "epoch": 1.3220779220779222, "eval_loss": 0.020695487037301064, "eval_runtime": 14.3712, "eval_samples_per_second": 75.637, "eval_steps_per_second": 4.732, "step": 128 }, { "epoch": 1.4883116883116883, "grad_norm": 1.125, "learning_rate": 1.0140845070422535e-05, "loss": 0.0481, "step": 144 }, { "epoch": 1.4883116883116883, "eval_loss": 0.020237548276782036, "eval_runtime": 14.3561, "eval_samples_per_second": 75.717, "eval_steps_per_second": 4.737, "step": 144 }, { "epoch": 1.6545454545454545, "grad_norm": 0.8984375, "learning_rate": 9.014084507042254e-06, "loss": 0.0515, "step": 160 }, { "epoch": 1.6545454545454545, "eval_loss": 0.019498903304338455, "eval_runtime": 14.378, "eval_samples_per_second": 75.602, "eval_steps_per_second": 4.729, "step": 160 }, { "epoch": 1.8207792207792208, "grad_norm": 0.90625, "learning_rate": 7.887323943661972e-06, "loss": 0.0548, "step": 176 }, { "epoch": 1.8207792207792208, "eval_loss": 0.01939920149743557, "eval_runtime": 14.3814, "eval_samples_per_second": 75.584, "eval_steps_per_second": 4.728, "step": 176 }, { "epoch": 1.987012987012987, "grad_norm": 7.71875, "learning_rate": 6.760563380281691e-06, "loss": 0.1138, "step": 192 }, { "epoch": 1.987012987012987, "eval_loss": 0.01901831291615963, "eval_runtime": 14.5408, "eval_samples_per_second": 74.755, "eval_steps_per_second": 4.676, "step": 192 }, { "epoch": 2.1454545454545455, "grad_norm": 0.63671875, "learning_rate": 5.633802816901409e-06, "loss": 0.1448, "step": 208 }, { "epoch": 2.1454545454545455, "eval_loss": 0.018952278420329094, "eval_runtime": 14.472, "eval_samples_per_second": 75.111, "eval_steps_per_second": 4.699, "step": 208 }, { "epoch": 2.311688311688312, "grad_norm": 0.71875, "learning_rate": 4.507042253521127e-06, "loss": 0.107, "step": 224 }, { "epoch": 2.311688311688312, "eval_loss": 0.019044360145926476, "eval_runtime": 14.5479, "eval_samples_per_second": 74.719, "eval_steps_per_second": 4.674, "step": 224 }, { "epoch": 2.477922077922078, "grad_norm": 0.91796875, "learning_rate": 3.3802816901408454e-06, "loss": 0.0077, "step": 240 }, { "epoch": 2.477922077922078, "eval_loss": 0.018966523930430412, "eval_runtime": 14.3869, "eval_samples_per_second": 75.555, "eval_steps_per_second": 4.727, "step": 240 }, { "epoch": 2.6441558441558444, "grad_norm": 0.44140625, "learning_rate": 2.2535211267605635e-06, "loss": 0.0415, "step": 256 }, { "epoch": 2.6441558441558444, "eval_loss": 0.01892191916704178, "eval_runtime": 14.332, "eval_samples_per_second": 75.844, "eval_steps_per_second": 4.745, "step": 256 }, { "epoch": 2.8103896103896107, "grad_norm": 0.5703125, "learning_rate": 1.1267605633802817e-06, "loss": 0.0941, "step": 272 }, { "epoch": 2.8103896103896107, "eval_loss": 0.01891483925282955, "eval_runtime": 14.3263, "eval_samples_per_second": 75.874, "eval_steps_per_second": 4.747, "step": 272 }, { "epoch": 2.9766233766233765, "grad_norm": 0.80078125, "learning_rate": 0.0, "loss": 0.0806, "step": 288 }, { "epoch": 2.9766233766233765, "eval_loss": 0.018894104287028313, "eval_runtime": 14.5656, "eval_samples_per_second": 74.628, "eval_steps_per_second": 4.669, "step": 288 } ], "logging_steps": 16, "max_steps": 288, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 48, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.22041209421824e+17, "train_batch_size": 16, "trial_name": null, "trial_params": null }