{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.5, "eval_steps": 20, "global_step": 100, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.025, "grad_norm": 6.181037902832031, "learning_rate": 1.6e-06, "loss": 21.926864624023438, "step": 5 }, { "epoch": 0.05, "grad_norm": 5.942561149597168, "learning_rate": 3.6e-06, "loss": 21.75578155517578, "step": 10 }, { "epoch": 0.075, "grad_norm": 5.655824184417725, "learning_rate": 3.995627254437549e-06, "loss": 21.41462097167969, "step": 15 }, { "epoch": 0.1, "grad_norm": 5.417076587677002, "learning_rate": 3.9778957412029366e-06, "loss": 21.02429962158203, "step": 20 }, { "epoch": 0.1, "eval_accuracy": 0.062084148727984345, "eval_loss": 10.375007629394531, "eval_runtime": 5.7371, "eval_samples_per_second": 174.305, "eval_steps_per_second": 29.109, "step": 20 }, { "epoch": 0.125, "grad_norm": 5.290545463562012, "learning_rate": 3.9466531944960116e-06, "loss": 20.648074340820312, "step": 25 }, { "epoch": 0.15, "grad_norm": 5.464421272277832, "learning_rate": 3.902113032590307e-06, "loss": 20.324154663085938, "step": 30 }, { "epoch": 0.175, "grad_norm": 5.148286819458008, "learning_rate": 3.844579509954769e-06, "loss": 20.022116088867186, "step": 35 }, { "epoch": 0.2, "grad_norm": 4.950249195098877, "learning_rate": 3.7744456388872234e-06, "loss": 19.932040405273437, "step": 40 }, { "epoch": 0.2, "eval_accuracy": 0.06708610567514676, "eval_loss": 9.851630210876465, "eval_runtime": 5.7231, "eval_samples_per_second": 174.73, "eval_steps_per_second": 29.18, "step": 40 }, { "epoch": 0.225, "grad_norm": 4.990023612976074, "learning_rate": 3.6921905048418706e-06, "loss": 19.716999816894532, "step": 45 }, { "epoch": 0.25, "grad_norm": 4.726850986480713, "learning_rate": 3.598375993789849e-06, "loss": 19.490966796875, "step": 50 }, { "epoch": 0.275, "grad_norm": 5.667174339294434, "learning_rate": 3.4936429539683075e-06, "loss": 19.308076477050783, "step": 55 }, { "epoch": 0.3, "grad_norm": 4.216722011566162, "learning_rate": 3.3787068182371314e-06, "loss": 19.342814636230468, "step": 60 }, { "epoch": 0.3, "eval_accuracy": 0.06902348336594911, "eval_loss": 9.606650352478027, "eval_runtime": 5.7327, "eval_samples_per_second": 174.439, "eval_steps_per_second": 29.131, "step": 60 }, { "epoch": 0.325, "grad_norm": 4.671233177185059, "learning_rate": 3.254352716947074e-06, "loss": 19.091270446777344, "step": 65 }, { "epoch": 0.35, "grad_norm": 4.2631611824035645, "learning_rate": 3.1214301147033453e-06, "loss": 19.065214538574217, "step": 70 }, { "epoch": 0.375, "grad_norm": 4.104111671447754, "learning_rate": 2.9808470076610163e-06, "loss": 19.055906677246092, "step": 75 }, { "epoch": 0.4, "grad_norm": 4.979343414306641, "learning_rate": 2.833563720990581e-06, "loss": 18.942726135253906, "step": 80 }, { "epoch": 0.4, "eval_accuracy": 0.06987084148727984, "eval_loss": 9.471638679504395, "eval_runtime": 5.8172, "eval_samples_per_second": 171.903, "eval_steps_per_second": 28.708, "step": 80 }, { "epoch": 0.425, "grad_norm": 4.60034704208374, "learning_rate": 2.680586348883286e-06, "loss": 18.900166320800782, "step": 85 }, { "epoch": 0.45, "grad_norm": 4.487170696258545, "learning_rate": 2.5229598819076393e-06, "loss": 18.824652099609374, "step": 90 }, { "epoch": 0.475, "grad_norm": 4.3784661293029785, "learning_rate": 2.36176106866422e-06, "loss": 18.77193603515625, "step": 95 }, { "epoch": 0.5, "grad_norm": 3.88219952583313, "learning_rate": 2.198091060500926e-06, "loss": 18.777445983886718, "step": 100 }, { "epoch": 0.5, "eval_accuracy": 0.07486888454011742, "eval_loss": 9.392426490783691, "eval_runtime": 5.7667, "eval_samples_per_second": 173.409, "eval_steps_per_second": 28.959, "step": 100 } ], "logging_steps": 5, "max_steps": 200, "num_input_tokens_seen": 0, "num_train_epochs": 9223372036854775807, "save_steps": 20, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 6, "trial_name": null, "trial_params": null }