{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.0006915151096051449, "eval_steps": 500, "global_step": 200, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 3.4575755480257244e-05, "grad_norm": 38.12546920776367, "learning_rate": 4.8e-07, "loss": 9.3097, "step": 10 }, { "epoch": 6.915151096051449e-05, "grad_norm": 31.766887664794922, "learning_rate": 1.0799999999999998e-06, "loss": 9.293, "step": 20 }, { "epoch": 0.00010372726644077173, "grad_norm": 48.67866897583008, "learning_rate": 1.6799999999999998e-06, "loss": 9.2784, "step": 30 }, { "epoch": 0.00013830302192102898, "grad_norm": 33.25461959838867, "learning_rate": 2.2799999999999998e-06, "loss": 9.2793, "step": 40 }, { "epoch": 0.00017287877740128623, "grad_norm": 35.62735366821289, "learning_rate": 2.8799999999999995e-06, "loss": 9.2657, "step": 50 }, { "epoch": 0.00020745453288154345, "grad_norm": 43.818328857421875, "learning_rate": 3.4799999999999993e-06, "loss": 9.2616, "step": 60 }, { "epoch": 0.0002420302883618007, "grad_norm": 43.82963943481445, "learning_rate": 4.079999999999999e-06, "loss": 9.2633, "step": 70 }, { "epoch": 0.00027660604384205796, "grad_norm": 57.38799285888672, "learning_rate": 4.679999999999999e-06, "loss": 9.2308, "step": 80 }, { "epoch": 0.0003111817993223152, "grad_norm": 44.78755187988281, "learning_rate": 5.28e-06, "loss": 9.2083, "step": 90 }, { "epoch": 0.00034575755480257246, "grad_norm": 40.440338134765625, "learning_rate": 5.88e-06, "loss": 9.2418, "step": 100 }, { "epoch": 0.00038033331028282965, "grad_norm": 36.28009033203125, "learning_rate": 6.48e-06, "loss": 9.2208, "step": 110 }, { "epoch": 0.0004149090657630869, "grad_norm": 42.1943473815918, "learning_rate": 7.079999999999999e-06, "loss": 9.2197, "step": 120 }, { "epoch": 0.00044948482124334416, "grad_norm": 37.897483825683594, "learning_rate": 7.68e-06, "loss": 9.2271, "step": 130 }, { "epoch": 0.0004840605767236014, "grad_norm": 33.77066421508789, "learning_rate": 8.279999999999999e-06, "loss": 9.2311, "step": 140 }, { "epoch": 0.0005186363322038587, "grad_norm": 34.798553466796875, "learning_rate": 8.88e-06, "loss": 9.2079, "step": 150 }, { "epoch": 0.0005532120876841159, "grad_norm": 39.236812591552734, "learning_rate": 9.48e-06, "loss": 9.2186, "step": 160 }, { "epoch": 0.0005877878431643732, "grad_norm": 37.878868103027344, "learning_rate": 1.0079999999999998e-05, "loss": 9.2176, "step": 170 }, { "epoch": 0.0006223635986446304, "grad_norm": 64.34676361083984, "learning_rate": 1.068e-05, "loss": 9.2086, "step": 180 }, { "epoch": 0.0006569393541248877, "grad_norm": 35.60507583618164, "learning_rate": 1.1279999999999999e-05, "loss": 9.2045, "step": 190 }, { "epoch": 0.0006915151096051449, "grad_norm": 45.516971588134766, "learning_rate": 1.188e-05, "loss": 9.2144, "step": 200 } ], "logging_steps": 10, "max_steps": 1000000, "num_input_tokens_seen": 0, "num_train_epochs": 4, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 638604533760000.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }