{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 4, "global_step": 24, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.041666666666666664, "grad_norm": 0.3123926520347595, "learning_rate": 0.0, "loss": 1.883056640625, "step": 1 }, { "epoch": 0.08333333333333333, "grad_norm": 0.2646231949329376, "learning_rate": 3.3333333333333333e-06, "loss": 1.545166015625, "step": 2 }, { "epoch": 0.125, "grad_norm": 0.3297826945781708, "learning_rate": 6.666666666666667e-06, "loss": 1.984375, "step": 3 }, { "epoch": 0.16666666666666666, "grad_norm": 0.31352558732032776, "learning_rate": 1e-05, "loss": 2.01513671875, "step": 4 }, { "epoch": 0.20833333333333334, "grad_norm": 0.3233188986778259, "learning_rate": 9.94973871801308e-06, "loss": 2.00390625, "step": 5 }, { "epoch": 0.25, "grad_norm": 0.3321285843849182, "learning_rate": 9.800077626037633e-06, "loss": 1.942138671875, "step": 6 }, { "epoch": 0.2916666666666667, "grad_norm": 0.3049088418483734, "learning_rate": 9.554359905560887e-06, "loss": 1.93603515625, "step": 7 }, { "epoch": 0.3333333333333333, "grad_norm": 0.3181479573249817, "learning_rate": 9.218074484421977e-06, "loss": 2.012939453125, "step": 8 }, { "epoch": 0.3333333333333333, "eval_loss": 1.88671875, "eval_runtime": 2.0383, "eval_samples_per_second": 0.981, "eval_steps_per_second": 0.491, "step": 8 }, { "epoch": 0.375, "grad_norm": 0.2911038100719452, "learning_rate": 8.79873342323422e-06, "loss": 1.9248046875, "step": 9 }, { "epoch": 0.4166666666666667, "grad_norm": 0.2789157032966614, "learning_rate": 8.305704108364301e-06, "loss": 1.876953125, "step": 10 }, { "epoch": 0.4583333333333333, "grad_norm": 0.27122828364372253, "learning_rate": 7.75e-06, "loss": 1.6368408203125, "step": 11 }, { "epoch": 0.5, "grad_norm": 0.40605419874191284, "learning_rate": 7.144034609648779e-06, "loss": 1.90869140625, "step": 12 }, { "epoch": 0.5, "eval_loss": 1.875, "eval_runtime": 2.0365, "eval_samples_per_second": 0.982, "eval_steps_per_second": 0.491, "step": 12 }, { "epoch": 0.5416666666666666, "grad_norm": 0.34622395038604736, "learning_rate": 6.501344202803415e-06, "loss": 1.98095703125, "step": 13 }, { "epoch": 0.5833333333333334, "grad_norm": 0.29148659110069275, "learning_rate": 5.83628542113891e-06, "loss": 1.9169921875, "step": 14 }, { "epoch": 0.625, "grad_norm": 0.42373839020729065, "learning_rate": 5.163714578861091e-06, "loss": 1.904296875, "step": 15 }, { "epoch": 0.6666666666666666, "grad_norm": 0.2787005305290222, "learning_rate": 4.4986557971965865e-06, "loss": 1.802734375, "step": 16 }, { "epoch": 0.6666666666666666, "eval_loss": 1.87109375, "eval_runtime": 2.0447, "eval_samples_per_second": 0.978, "eval_steps_per_second": 0.489, "step": 16 }, { "epoch": 0.7083333333333334, "grad_norm": 0.3802435100078583, "learning_rate": 3.855965390351223e-06, "loss": 1.77783203125, "step": 17 }, { "epoch": 0.75, "grad_norm": 0.48945489525794983, "learning_rate": 3.2500000000000015e-06, "loss": 1.68115234375, "step": 18 }, { "epoch": 0.7916666666666666, "grad_norm": 0.32995471358299255, "learning_rate": 2.6942958916356997e-06, "loss": 1.8994140625, "step": 19 }, { "epoch": 0.8333333333333334, "grad_norm": 0.297360897064209, "learning_rate": 2.2012665767657825e-06, "loss": 1.8544921875, "step": 20 }, { "epoch": 0.8333333333333334, "eval_loss": 1.859375, "eval_runtime": 2.0504, "eval_samples_per_second": 0.975, "eval_steps_per_second": 0.488, "step": 20 }, { "epoch": 0.875, "grad_norm": 0.29491743445396423, "learning_rate": 1.7819255155780241e-06, "loss": 1.7412109375, "step": 21 }, { "epoch": 0.9166666666666666, "grad_norm": 0.30005648732185364, "learning_rate": 1.4456400944391147e-06, "loss": 1.86865234375, "step": 22 }, { "epoch": 0.9583333333333334, "grad_norm": 0.3333606719970703, "learning_rate": 1.1999223739623667e-06, "loss": 1.9453125, "step": 23 }, { "epoch": 1.0, "grad_norm": 0.3210712969303131, "learning_rate": 1.0502612819869219e-06, "loss": 1.87646484375, "step": 24 }, { "epoch": 1.0, "eval_loss": 1.859375, "eval_runtime": 2.0443, "eval_samples_per_second": 0.978, "eval_steps_per_second": 0.489, "step": 24 } ], "logging_steps": 1.0, "max_steps": 24, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 0, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3.190182178528952e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }