{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 4.0, "eval_steps": 500, "global_step": 108, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.180859375, "epoch": 0.37037037037037035, "grad_norm": 1.9087318181991577, "learning_rate": 0.00019886154122075343, "loss": 1.3855, "mean_token_accuracy": 0.709491191804409, "num_tokens": 20480.0, "step": 10 }, { "entropy": 0.77197265625, "epoch": 0.7407407407407407, "grad_norm": 1.5744595527648926, "learning_rate": 0.00018990881137654258, "loss": 0.8126, "mean_token_accuracy": 0.8044520571827889, "num_tokens": 40960.0, "step": 20 }, { "epoch": 1.0, "eval_entropy": 0.666015625, "eval_loss": 0.664973795413971, "eval_mean_token_accuracy": 0.8258317112922668, "eval_num_tokens": 55296.0, "eval_runtime": 104.8748, "eval_samples_per_second": 0.114, "eval_steps_per_second": 0.019, "step": 27 }, { "entropy": 0.67705078125, "epoch": 1.1111111111111112, "grad_norm": 1.3851813077926636, "learning_rate": 0.00017281409538757883, "loss": 0.6667, "mean_token_accuracy": 0.8270058631896973, "num_tokens": 61440.0, "step": 30 }, { "entropy": 0.3906982421875, "epoch": 1.4814814814814814, "grad_norm": 1.8623592853546143, "learning_rate": 0.00014912546110838775, "loss": 0.3976, "mean_token_accuracy": 0.8884540066123009, "num_tokens": 81920.0, "step": 40 }, { "entropy": 0.4400634765625, "epoch": 1.8518518518518519, "grad_norm": 1.3342927694320679, "learning_rate": 0.00012098811020648475, "loss": 0.4118, "mean_token_accuracy": 0.8866927579045296, "num_tokens": 102400.0, "step": 50 }, { "epoch": 2.0, "eval_entropy": 0.447265625, "eval_loss": 0.594461977481842, "eval_mean_token_accuracy": 0.8510273993015289, "eval_num_tokens": 110592.0, "eval_runtime": 158.7424, "eval_samples_per_second": 0.076, "eval_steps_per_second": 0.013, "step": 54 }, { "entropy": 0.3321044921875, "epoch": 2.2222222222222223, "grad_norm": 1.1872409582138062, "learning_rate": 9.095011241703623e-05, "loss": 0.2912, "mean_token_accuracy": 0.9179549887776375, "num_tokens": 122880.0, "step": 60 }, { "entropy": 0.24451904296875, "epoch": 2.5925925925925926, "grad_norm": 1.2892343997955322, "learning_rate": 6.173165676349103e-05, "loss": 0.237, "mean_token_accuracy": 0.9271037086844445, "num_tokens": 143360.0, "step": 70 }, { "entropy": 0.24892578125, "epoch": 2.962962962962963, "grad_norm": 1.2926205396652222, "learning_rate": 3.597871595375121e-05, "loss": 0.2154, "mean_token_accuracy": 0.9361056685447693, "num_tokens": 163840.0, "step": 80 }, { "epoch": 3.0, "eval_entropy": 0.3505859375, "eval_loss": 0.6058798432350159, "eval_mean_token_accuracy": 0.852372795343399, "eval_num_tokens": 165888.0, "eval_runtime": 453.1986, "eval_samples_per_second": 0.026, "eval_steps_per_second": 0.004, "step": 81 }, { "entropy": 0.18564453125, "epoch": 3.3333333333333335, "grad_norm": 0.9748417735099792, "learning_rate": 1.6023431677260214e-05, "loss": 0.1381, "mean_token_accuracy": 0.9602250471711159, "num_tokens": 184320.0, "step": 90 }, { "entropy": 0.15009765625, "epoch": 3.7037037037037037, "grad_norm": 0.9260263442993164, "learning_rate": 3.6729198952483724e-06, "loss": 0.1271, "mean_token_accuracy": 0.9631604671478271, "num_tokens": 204800.0, "step": 100 }, { "epoch": 4.0, "eval_entropy": 0.29296875, "eval_loss": 0.6591059565544128, "eval_mean_token_accuracy": 0.8539628088474274, "eval_num_tokens": 221184.0, "eval_runtime": 170.1635, "eval_samples_per_second": 0.071, "eval_steps_per_second": 0.012, "step": 108 } ], "logging_steps": 10, "max_steps": 108, "num_input_tokens_seen": 0, "num_train_epochs": 4, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 9496422940409856.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }