| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 0.5, |
| "eval_steps": 20, |
| "global_step": 100, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.025, |
| "grad_norm": 6.181037902832031, |
| "learning_rate": 1.6e-06, |
| "loss": 21.926864624023438, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.05, |
| "grad_norm": 5.942561149597168, |
| "learning_rate": 3.6e-06, |
| "loss": 21.75578155517578, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.075, |
| "grad_norm": 5.655824184417725, |
| "learning_rate": 3.995627254437549e-06, |
| "loss": 21.41462097167969, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.1, |
| "grad_norm": 5.417076587677002, |
| "learning_rate": 3.9778957412029366e-06, |
| "loss": 21.02429962158203, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.1, |
| "eval_accuracy": 0.062084148727984345, |
| "eval_loss": 10.375007629394531, |
| "eval_runtime": 5.7371, |
| "eval_samples_per_second": 174.305, |
| "eval_steps_per_second": 29.109, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.125, |
| "grad_norm": 5.290545463562012, |
| "learning_rate": 3.9466531944960116e-06, |
| "loss": 20.648074340820312, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.15, |
| "grad_norm": 5.464421272277832, |
| "learning_rate": 3.902113032590307e-06, |
| "loss": 20.324154663085938, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.175, |
| "grad_norm": 5.148286819458008, |
| "learning_rate": 3.844579509954769e-06, |
| "loss": 20.022116088867186, |
| "step": 35 |
| }, |
| { |
| "epoch": 0.2, |
| "grad_norm": 4.950249195098877, |
| "learning_rate": 3.7744456388872234e-06, |
| "loss": 19.932040405273437, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.2, |
| "eval_accuracy": 0.06708610567514676, |
| "eval_loss": 9.851630210876465, |
| "eval_runtime": 5.7231, |
| "eval_samples_per_second": 174.73, |
| "eval_steps_per_second": 29.18, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.225, |
| "grad_norm": 4.990023612976074, |
| "learning_rate": 3.6921905048418706e-06, |
| "loss": 19.716999816894532, |
| "step": 45 |
| }, |
| { |
| "epoch": 0.25, |
| "grad_norm": 4.726850986480713, |
| "learning_rate": 3.598375993789849e-06, |
| "loss": 19.490966796875, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.275, |
| "grad_norm": 5.667174339294434, |
| "learning_rate": 3.4936429539683075e-06, |
| "loss": 19.308076477050783, |
| "step": 55 |
| }, |
| { |
| "epoch": 0.3, |
| "grad_norm": 4.216722011566162, |
| "learning_rate": 3.3787068182371314e-06, |
| "loss": 19.342814636230468, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.3, |
| "eval_accuracy": 0.06902348336594911, |
| "eval_loss": 9.606650352478027, |
| "eval_runtime": 5.7327, |
| "eval_samples_per_second": 174.439, |
| "eval_steps_per_second": 29.131, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.325, |
| "grad_norm": 4.671233177185059, |
| "learning_rate": 3.254352716947074e-06, |
| "loss": 19.091270446777344, |
| "step": 65 |
| }, |
| { |
| "epoch": 0.35, |
| "grad_norm": 4.2631611824035645, |
| "learning_rate": 3.1214301147033453e-06, |
| "loss": 19.065214538574217, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.375, |
| "grad_norm": 4.104111671447754, |
| "learning_rate": 2.9808470076610163e-06, |
| "loss": 19.055906677246092, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.4, |
| "grad_norm": 4.979343414306641, |
| "learning_rate": 2.833563720990581e-06, |
| "loss": 18.942726135253906, |
| "step": 80 |
| }, |
| { |
| "epoch": 0.4, |
| "eval_accuracy": 0.06987084148727984, |
| "eval_loss": 9.471638679504395, |
| "eval_runtime": 5.8172, |
| "eval_samples_per_second": 171.903, |
| "eval_steps_per_second": 28.708, |
| "step": 80 |
| }, |
| { |
| "epoch": 0.425, |
| "grad_norm": 4.60034704208374, |
| "learning_rate": 2.680586348883286e-06, |
| "loss": 18.900166320800782, |
| "step": 85 |
| }, |
| { |
| "epoch": 0.45, |
| "grad_norm": 4.487170696258545, |
| "learning_rate": 2.5229598819076393e-06, |
| "loss": 18.824652099609374, |
| "step": 90 |
| }, |
| { |
| "epoch": 0.475, |
| "grad_norm": 4.3784661293029785, |
| "learning_rate": 2.36176106866422e-06, |
| "loss": 18.77193603515625, |
| "step": 95 |
| }, |
| { |
| "epoch": 0.5, |
| "grad_norm": 3.88219952583313, |
| "learning_rate": 2.198091060500926e-06, |
| "loss": 18.777445983886718, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.5, |
| "eval_accuracy": 0.07486888454011742, |
| "eval_loss": 9.392426490783691, |
| "eval_runtime": 5.7667, |
| "eval_samples_per_second": 173.409, |
| "eval_steps_per_second": 28.959, |
| "step": 100 |
| } |
| ], |
| "logging_steps": 5, |
| "max_steps": 200, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 9223372036854775807, |
| "save_steps": 20, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 0.0, |
| "train_batch_size": 6, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|