| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 1.9867841409691631, |
| "eval_steps": 500, |
| "global_step": 226, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "entropy": 0.9361699424684048, |
| "epoch": 0.0881057268722467, |
| "grad_norm": 0.80078125, |
| "learning_rate": 6e-05, |
| "loss": 0.1638, |
| "mean_token_accuracy": 0.9636025600135326, |
| "num_tokens": 941939.0, |
| "step": 10 |
| }, |
| { |
| "entropy": 1.2769331455230712, |
| "epoch": 0.1762114537444934, |
| "grad_norm": 0.640625, |
| "learning_rate": 9.993475671485666e-05, |
| "loss": 0.0768, |
| "mean_token_accuracy": 0.9733339473605156, |
| "num_tokens": 1897260.0, |
| "step": 20 |
| }, |
| { |
| "entropy": 1.3240129783749581, |
| "epoch": 0.2643171806167401, |
| "grad_norm": 2.578125, |
| "learning_rate": 9.920337448297678e-05, |
| "loss": 0.0922, |
| "mean_token_accuracy": 0.9707472532987594, |
| "num_tokens": 2850735.0, |
| "step": 30 |
| }, |
| { |
| "entropy": 1.4359926223754882, |
| "epoch": 0.3524229074889868, |
| "grad_norm": 0.44921875, |
| "learning_rate": 9.767499085071128e-05, |
| "loss": 0.1235, |
| "mean_token_accuracy": 0.9620010450482368, |
| "num_tokens": 3801040.0, |
| "step": 40 |
| }, |
| { |
| "entropy": 1.2460978001356124, |
| "epoch": 0.44052863436123346, |
| "grad_norm": 0.337890625, |
| "learning_rate": 9.538279415325828e-05, |
| "loss": 0.0623, |
| "mean_token_accuracy": 0.9752302221953869, |
| "num_tokens": 4743189.0, |
| "step": 50 |
| }, |
| { |
| "entropy": 1.181038823723793, |
| "epoch": 0.5286343612334802, |
| "grad_norm": 0.3984375, |
| "learning_rate": 9.237655866896586e-05, |
| "loss": 0.0585, |
| "mean_token_accuracy": 0.9763436049222947, |
| "num_tokens": 5688120.0, |
| "step": 60 |
| }, |
| { |
| "entropy": 1.1543719470500946, |
| "epoch": 0.6167400881057269, |
| "grad_norm": 0.34375, |
| "learning_rate": 8.872156378766179e-05, |
| "loss": 0.0568, |
| "mean_token_accuracy": 0.9767736874520778, |
| "num_tokens": 6633142.0, |
| "step": 70 |
| }, |
| { |
| "entropy": 1.1321007892489434, |
| "epoch": 0.7048458149779736, |
| "grad_norm": 0.31640625, |
| "learning_rate": 8.449717649071594e-05, |
| "loss": 0.0569, |
| "mean_token_accuracy": 0.9765677087008953, |
| "num_tokens": 7577006.0, |
| "step": 80 |
| }, |
| { |
| "entropy": 1.0975897915661335, |
| "epoch": 0.7929515418502202, |
| "grad_norm": 0.21484375, |
| "learning_rate": 7.979512792380263e-05, |
| "loss": 0.0507, |
| "mean_token_accuracy": 0.9798766911029816, |
| "num_tokens": 8526339.0, |
| "step": 90 |
| }, |
| { |
| "entropy": 1.0926882281899453, |
| "epoch": 0.8810572687224669, |
| "grad_norm": 0.28515625, |
| "learning_rate": 7.471752148600441e-05, |
| "loss": 0.0538, |
| "mean_token_accuracy": 0.9775132387876511, |
| "num_tokens": 9479754.0, |
| "step": 100 |
| }, |
| { |
| "entropy": 1.101259708404541, |
| "epoch": 0.9691629955947136, |
| "grad_norm": 0.306640625, |
| "learning_rate": 6.937461568893057e-05, |
| "loss": 0.0522, |
| "mean_token_accuracy": 0.9783625587821007, |
| "num_tokens": 10425857.0, |
| "step": 110 |
| }, |
| { |
| "entropy": 1.1054948803625608, |
| "epoch": 1.052863436123348, |
| "grad_norm": 0.275390625, |
| "learning_rate": 6.388242993031719e-05, |
| "loss": 0.0511, |
| "mean_token_accuracy": 0.9776703919235029, |
| "num_tokens": 11318715.0, |
| "step": 120 |
| }, |
| { |
| "entropy": 1.0859883286058902, |
| "epoch": 1.1409691629955947, |
| "grad_norm": 0.2734375, |
| "learning_rate": 5.8360225171927386e-05, |
| "loss": 0.051, |
| "mean_token_accuracy": 0.9791761793196201, |
| "num_tokens": 12265510.0, |
| "step": 130 |
| }, |
| { |
| "entropy": 1.085260946303606, |
| "epoch": 1.2290748898678414, |
| "grad_norm": 0.2431640625, |
| "learning_rate": 5.292791422798197e-05, |
| "loss": 0.0417, |
| "mean_token_accuracy": 0.9830566577613353, |
| "num_tokens": 13205143.0, |
| "step": 140 |
| }, |
| { |
| "entropy": 1.0741271749138832, |
| "epoch": 1.3171806167400881, |
| "grad_norm": 0.3671875, |
| "learning_rate": 4.7703457898833556e-05, |
| "loss": 0.0455, |
| "mean_token_accuracy": 0.9809500627219677, |
| "num_tokens": 14155920.0, |
| "step": 150 |
| }, |
| { |
| "entropy": 1.074209114164114, |
| "epoch": 1.4052863436123348, |
| "grad_norm": 0.412109375, |
| "learning_rate": 4.28003034919638e-05, |
| "loss": 0.0481, |
| "mean_token_accuracy": 0.9798587031662465, |
| "num_tokens": 15116850.0, |
| "step": 160 |
| }, |
| { |
| "entropy": 1.0775911159813405, |
| "epoch": 1.4933920704845816, |
| "grad_norm": 0.28125, |
| "learning_rate": 3.832492135195628e-05, |
| "loss": 0.0467, |
| "mean_token_accuracy": 0.9791537664830685, |
| "num_tokens": 16066781.0, |
| "step": 170 |
| }, |
| { |
| "entropy": 1.0590569734573365, |
| "epoch": 1.5814977973568283, |
| "grad_norm": 0.2578125, |
| "learning_rate": 3.437449289286601e-05, |
| "loss": 0.0476, |
| "mean_token_accuracy": 0.9791436046361923, |
| "num_tokens": 17008134.0, |
| "step": 180 |
| }, |
| { |
| "entropy": 1.0643939599394798, |
| "epoch": 1.6696035242290748, |
| "grad_norm": 0.275390625, |
| "learning_rate": 3.103480033658318e-05, |
| "loss": 0.0448, |
| "mean_token_accuracy": 0.980703292787075, |
| "num_tokens": 17955287.0, |
| "step": 190 |
| }, |
| { |
| "entropy": 1.0558478556573392, |
| "epoch": 1.7577092511013217, |
| "grad_norm": 0.2490234375, |
| "learning_rate": 2.8378363980810934e-05, |
| "loss": 0.0432, |
| "mean_token_accuracy": 0.9812683060765266, |
| "num_tokens": 18917353.0, |
| "step": 200 |
| }, |
| { |
| "entropy": 1.0567112952470779, |
| "epoch": 1.8458149779735682, |
| "grad_norm": 0.267578125, |
| "learning_rate": 2.646286744525481e-05, |
| "loss": 0.047, |
| "mean_token_accuracy": 0.9798793807625771, |
| "num_tokens": 19860980.0, |
| "step": 210 |
| }, |
| { |
| "entropy": 1.0524355478584766, |
| "epoch": 1.9339207048458151, |
| "grad_norm": 0.306640625, |
| "learning_rate": 2.5329905091271954e-05, |
| "loss": 0.0466, |
| "mean_token_accuracy": 0.9801529116928578, |
| "num_tokens": 20809310.0, |
| "step": 220 |
| } |
| ], |
| "logging_steps": 10, |
| "max_steps": 228, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 2, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 2.0935136308374528e+17, |
| "train_batch_size": 8, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|