{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 4, "global_step": 21, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.047619047619047616, "grad_norm": 0.94771409034729, "learning_rate": 0.0, "loss": 0.82177734375, "step": 1 }, { "epoch": 0.09523809523809523, "grad_norm": 1.5331836938858032, "learning_rate": 3.3333333333333333e-06, "loss": 1.030029296875, "step": 2 }, { "epoch": 0.14285714285714285, "grad_norm": 1.3439949750900269, "learning_rate": 6.666666666666667e-06, "loss": 0.786376953125, "step": 3 }, { "epoch": 0.19047619047619047, "grad_norm": 1.7871679067611694, "learning_rate": 1e-05, "loss": 1.161376953125, "step": 4 }, { "epoch": 0.23809523809523808, "grad_norm": 2.040626287460327, "learning_rate": 9.931634888554937e-06, "loss": 1.0858154296875, "step": 5 }, { "epoch": 0.23809523809523808, "eval_loss": 0.89599609375, "eval_runtime": 13.0821, "eval_samples_per_second": 0.229, "eval_steps_per_second": 0.076, "step": 5 }, { "epoch": 0.2857142857142857, "grad_norm": 1.32891845703125, "learning_rate": 9.728616793536588e-06, "loss": 0.83447265625, "step": 6 }, { "epoch": 0.3333333333333333, "grad_norm": 1.272424340248108, "learning_rate": 9.397114317029975e-06, "loss": 0.7705078125, "step": 7 }, { "epoch": 0.38095238095238093, "grad_norm": 1.9414798021316528, "learning_rate": 8.947199994035402e-06, "loss": 1.12548828125, "step": 8 }, { "epoch": 0.42857142857142855, "grad_norm": 1.7536942958831787, "learning_rate": 8.392544243589428e-06, "loss": 0.78173828125, "step": 9 }, { "epoch": 0.42857142857142855, "eval_loss": 0.888671875, "eval_runtime": 2.9172, "eval_samples_per_second": 1.028, "eval_steps_per_second": 0.343, "step": 9 }, { "epoch": 0.47619047619047616, "grad_norm": 1.3101036548614502, "learning_rate": 7.75e-06, "loss": 1.006103515625, "step": 10 }, { "epoch": 0.5238095238095238, "grad_norm": 1.4956482648849487, "learning_rate": 7.0390906449655104e-06, "loss": 1.017333984375, "step": 11 }, { "epoch": 0.5714285714285714, "grad_norm": 1.1593928337097168, "learning_rate": 6.281416799501188e-06, "loss": 0.773681640625, "step": 12 }, { "epoch": 0.6190476190476191, "grad_norm": 1.1063566207885742, "learning_rate": 5.500000000000001e-06, "loss": 0.828369140625, "step": 13 }, { "epoch": 0.6190476190476191, "eval_loss": 0.8779296875, "eval_runtime": 2.9267, "eval_samples_per_second": 1.025, "eval_steps_per_second": 0.342, "step": 13 }, { "epoch": 0.6666666666666666, "grad_norm": 1.55467689037323, "learning_rate": 4.718583200498814e-06, "loss": 0.9912109375, "step": 14 }, { "epoch": 0.7142857142857143, "grad_norm": 2.003232479095459, "learning_rate": 3.960909355034491e-06, "loss": 0.82373046875, "step": 15 }, { "epoch": 0.7619047619047619, "grad_norm": 1.6703325510025024, "learning_rate": 3.2500000000000015e-06, "loss": 0.926025390625, "step": 16 }, { "epoch": 0.8095238095238095, "grad_norm": 1.2591973543167114, "learning_rate": 2.607455756410573e-06, "loss": 0.751953125, "step": 17 }, { "epoch": 0.8095238095238095, "eval_loss": 0.875, "eval_runtime": 2.9333, "eval_samples_per_second": 1.023, "eval_steps_per_second": 0.341, "step": 17 }, { "epoch": 0.8571428571428571, "grad_norm": 1.1961588859558105, "learning_rate": 2.0528000059646e-06, "loss": 0.814208984375, "step": 18 }, { "epoch": 0.9047619047619048, "grad_norm": 1.0266940593719482, "learning_rate": 1.602885682970026e-06, "loss": 0.704833984375, "step": 19 }, { "epoch": 0.9523809523809523, "grad_norm": 1.2737773656845093, "learning_rate": 1.2713832064634127e-06, "loss": 0.871337890625, "step": 20 }, { "epoch": 1.0, "grad_norm": 1.16634202003479, "learning_rate": 1.0683651114450641e-06, "loss": 0.8125, "step": 21 }, { "epoch": 1.0, "eval_loss": 0.8681640625, "eval_runtime": 2.9371, "eval_samples_per_second": 1.021, "eval_steps_per_second": 0.34, "step": 21 } ], "logging_steps": 1.0, "max_steps": 21, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 0, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.2429634227195085e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }