{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 4, "global_step": 24, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.041666666666666664, "grad_norm": 1.7443342208862305, "learning_rate": 0.0, "loss": 2.9140625, "step": 1 }, { "epoch": 0.08333333333333333, "grad_norm": 0.6939694881439209, "learning_rate": 3.3333333333333333e-06, "loss": 1.904296875, "step": 2 }, { "epoch": 0.125, "grad_norm": 0.9981868267059326, "learning_rate": 6.666666666666667e-06, "loss": 2.17431640625, "step": 3 }, { "epoch": 0.16666666666666666, "grad_norm": 1.2372512817382812, "learning_rate": 1e-05, "loss": 2.482421875, "step": 4 }, { "epoch": 0.20833333333333334, "grad_norm": 1.0146492719650269, "learning_rate": 9.94973871801308e-06, "loss": 2.31640625, "step": 5 }, { "epoch": 0.25, "grad_norm": 1.3084410429000854, "learning_rate": 9.800077626037633e-06, "loss": 2.517578125, "step": 6 }, { "epoch": 0.2916666666666667, "grad_norm": 1.0703275203704834, "learning_rate": 9.554359905560887e-06, "loss": 2.3740234375, "step": 7 }, { "epoch": 0.3333333333333333, "grad_norm": 1.1062793731689453, "learning_rate": 9.218074484421977e-06, "loss": 2.376953125, "step": 8 }, { "epoch": 0.3333333333333333, "eval_loss": 2.390625, "eval_runtime": 2.5769, "eval_samples_per_second": 0.776, "eval_steps_per_second": 0.388, "step": 8 }, { "epoch": 0.375, "grad_norm": 1.0547977685928345, "learning_rate": 8.79873342323422e-06, "loss": 2.29827880859375, "step": 9 }, { "epoch": 0.4166666666666667, "grad_norm": 1.1507635116577148, "learning_rate": 8.305704108364301e-06, "loss": 2.388671875, "step": 10 }, { "epoch": 0.4583333333333333, "grad_norm": 1.0763663053512573, "learning_rate": 7.75e-06, "loss": 2.345703125, "step": 11 }, { "epoch": 0.5, "grad_norm": 0.8644738793373108, "learning_rate": 7.144034609648779e-06, "loss": 2.1279296875, "step": 12 }, { "epoch": 0.5, "eval_loss": 2.2890625, "eval_runtime": 2.5807, "eval_samples_per_second": 0.775, "eval_steps_per_second": 0.387, "step": 12 }, { "epoch": 0.5416666666666666, "grad_norm": 0.9719507694244385, "learning_rate": 6.501344202803415e-06, "loss": 2.2490234375, "step": 13 }, { "epoch": 0.5833333333333334, "grad_norm": 0.8876709938049316, "learning_rate": 5.83628542113891e-06, "loss": 2.150390625, "step": 14 }, { "epoch": 0.625, "grad_norm": 0.6461179852485657, "learning_rate": 5.163714578861091e-06, "loss": 1.770751953125, "step": 15 }, { "epoch": 0.6666666666666666, "grad_norm": 0.9092628359794617, "learning_rate": 4.4986557971965865e-06, "loss": 2.205078125, "step": 16 }, { "epoch": 0.6666666666666666, "eval_loss": 2.19140625, "eval_runtime": 2.5791, "eval_samples_per_second": 0.775, "eval_steps_per_second": 0.388, "step": 16 }, { "epoch": 0.7083333333333334, "grad_norm": 0.8737649917602539, "learning_rate": 3.855965390351223e-06, "loss": 2.1943359375, "step": 17 }, { "epoch": 0.75, "grad_norm": 0.700472891330719, "learning_rate": 3.2500000000000015e-06, "loss": 1.80035400390625, "step": 18 }, { "epoch": 0.7916666666666666, "grad_norm": 1.0030174255371094, "learning_rate": 2.6942958916356997e-06, "loss": 2.23828125, "step": 19 }, { "epoch": 0.8333333333333334, "grad_norm": 0.8105897903442383, "learning_rate": 2.2012665767657825e-06, "loss": 1.911865234375, "step": 20 }, { "epoch": 0.8333333333333334, "eval_loss": 2.14453125, "eval_runtime": 2.5866, "eval_samples_per_second": 0.773, "eval_steps_per_second": 0.387, "step": 20 }, { "epoch": 0.875, "grad_norm": 0.8769823312759399, "learning_rate": 1.7819255155780241e-06, "loss": 2.140625, "step": 21 }, { "epoch": 0.9166666666666666, "grad_norm": 0.7764416337013245, "learning_rate": 1.4456400944391147e-06, "loss": 2.0595703125, "step": 22 }, { "epoch": 0.9583333333333334, "grad_norm": 0.8468369245529175, "learning_rate": 1.1999223739623667e-06, "loss": 2.0947265625, "step": 23 }, { "epoch": 1.0, "grad_norm": 1.2951644659042358, "learning_rate": 1.0502612819869219e-06, "loss": 2.4521484375, "step": 24 }, { "epoch": 1.0, "eval_loss": 2.13671875, "eval_runtime": 2.5792, "eval_samples_per_second": 0.775, "eval_steps_per_second": 0.388, "step": 24 } ], "logging_steps": 1.0, "max_steps": 24, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 0, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.866689140302807e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }