{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 4, "global_step": 21, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.04938271604938271, "grad_norm": 1.6329176425933838, "learning_rate": 0.0, "loss": 1.5989837646484375, "step": 1 }, { "epoch": 0.09876543209876543, "grad_norm": 1.5437233448028564, "learning_rate": 5e-05, "loss": 1.397216796875, "step": 2 }, { "epoch": 0.14814814814814814, "grad_norm": 1.8224302530288696, "learning_rate": 4.97229876633906e-05, "loss": 1.8496208190917969, "step": 3 }, { "epoch": 0.19753086419753085, "grad_norm": 2.892070770263672, "learning_rate": 4.889877161664096e-05, "loss": 1.764373779296875, "step": 4 }, { "epoch": 0.24691358024691357, "grad_norm": 1.495557188987732, "learning_rate": 4.7547646794238276e-05, "loss": 1.0567550659179688, "step": 5 }, { "epoch": 0.24691358024691357, "eval_loss": 1.6196187734603882, "eval_runtime": 1.4051, "eval_samples_per_second": 2.135, "eval_steps_per_second": 0.712, "step": 5 }, { "epoch": 0.2962962962962963, "grad_norm": 1.864427924156189, "learning_rate": 4.570288237343632e-05, "loss": 1.2507476806640625, "step": 6 }, { "epoch": 0.345679012345679, "grad_norm": 1.3507896661758423, "learning_rate": 4.340990257669732e-05, "loss": 1.331756591796875, "step": 7 }, { "epoch": 0.3950617283950617, "grad_norm": 1.7334824800491333, "learning_rate": 4.072516817658065e-05, "loss": 1.53045654296875, "step": 8 }, { "epoch": 0.4444444444444444, "grad_norm": 1.8571280241012573, "learning_rate": 3.771478624413981e-05, "loss": 1.5605926513671875, "step": 9 }, { "epoch": 0.4444444444444444, "eval_loss": 1.555816650390625, "eval_runtime": 1.413, "eval_samples_per_second": 2.123, "eval_steps_per_second": 0.708, "step": 9 }, { "epoch": 0.49382716049382713, "grad_norm": 0.7206937670707703, "learning_rate": 3.4452882373436316e-05, "loss": 0.989166259765625, "step": 10 }, { "epoch": 0.5432098765432098, "grad_norm": 1.1625598669052124, "learning_rate": 3.1019775463405195e-05, "loss": 1.3414230346679688, "step": 11 }, { "epoch": 0.5925925925925926, "grad_norm": 0.6076969504356384, "learning_rate": 2.7500000000000004e-05, "loss": 1.179987907409668, "step": 12 }, { "epoch": 0.6419753086419753, "grad_norm": 1.648446798324585, "learning_rate": 2.3980224536594803e-05, "loss": 1.587249755859375, "step": 13 }, { "epoch": 0.6419753086419753, "eval_loss": 1.5245157480239868, "eval_runtime": 1.4071, "eval_samples_per_second": 2.132, "eval_steps_per_second": 0.711, "step": 13 }, { "epoch": 0.691358024691358, "grad_norm": 0.6548490524291992, "learning_rate": 2.054711762656369e-05, "loss": 1.12933349609375, "step": 14 }, { "epoch": 0.7407407407407407, "grad_norm": 1.4055821895599365, "learning_rate": 1.72852137558602e-05, "loss": 1.6487960815429688, "step": 15 }, { "epoch": 0.7901234567901234, "grad_norm": 0.8826307058334351, "learning_rate": 1.427483182341936e-05, "loss": 1.3438186645507812, "step": 16 }, { "epoch": 0.8395061728395061, "grad_norm": 0.8792888522148132, "learning_rate": 1.1590097423302684e-05, "loss": 1.407318115234375, "step": 17 }, { "epoch": 0.8395061728395061, "eval_loss": 1.5126241445541382, "eval_runtime": 1.3931, "eval_samples_per_second": 2.153, "eval_steps_per_second": 0.718, "step": 17 }, { "epoch": 0.8888888888888888, "grad_norm": 1.2766690254211426, "learning_rate": 9.297117626563687e-06, "loss": 1.725189208984375, "step": 18 }, { "epoch": 0.9382716049382716, "grad_norm": 1.0004721879959106, "learning_rate": 7.452353205761725e-06, "loss": 1.5459928512573242, "step": 19 }, { "epoch": 0.9876543209876543, "grad_norm": 0.8124762177467346, "learning_rate": 6.1012283833590465e-06, "loss": 1.2266616821289062, "step": 20 }, { "epoch": 1.0, "grad_norm": 1.1515922546386719, "learning_rate": 5.277012336609403e-06, "loss": 1.62939453125, "step": 21 }, { "epoch": 1.0, "eval_loss": 1.506256103515625, "eval_runtime": 1.365, "eval_samples_per_second": 2.198, "eval_steps_per_second": 0.733, "step": 21 } ], "logging_steps": 1.0, "max_steps": 21, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 0, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3.0688776401453056e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }