| { |
| "best_global_step": 500, |
| "best_metric": 2.009260514264372, |
| "best_model_checkpoint": "/content/cot-split1/checkpoint-500", |
| "epoch": 0.7832080200501254, |
| "eval_steps": 250, |
| "global_step": 500, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0, |
| "eval_bpd": 5.449506205976702, |
| "eval_entropy": 3.8259646681880883, |
| "eval_loss": 3.7819511890411377, |
| "eval_mean_token_accuracy": 0.3298281561563004, |
| "eval_nll": 3.777309862116675, |
| "eval_num_tokens": 0.0, |
| "eval_ppl": 43.69832894461198, |
| "eval_runtime": 318.4397, |
| "eval_samples_per_second": 570.309, |
| "eval_steps_per_second": 8.912, |
| "step": 0 |
| }, |
| { |
| "entropy": 3.936198543874438, |
| "epoch": 0.0015664160401002505, |
| "grad_norm": 3.5, |
| "learning_rate": 0.0, |
| "loss": 3.687645435333252, |
| "mean_token_accuracy": 0.34163331851193124, |
| "num_tokens": 154043.0, |
| "step": 1 |
| }, |
| { |
| "entropy": 4.1582471953791025, |
| "epoch": 0.039160401002506263, |
| "grad_norm": 1.8515625, |
| "learning_rate": 9.375e-05, |
| "loss": 3.716327985127767, |
| "mean_token_accuracy": 0.32336124196593746, |
| "num_tokens": 3937675.0, |
| "step": 25 |
| }, |
| { |
| "entropy": 4.004832741749853, |
| "epoch": 0.07832080200501253, |
| "grad_norm": 1.578125, |
| "learning_rate": 0.00019140625, |
| "loss": 3.245400085449219, |
| "mean_token_accuracy": 0.3525532396162817, |
| "num_tokens": 7842040.0, |
| "step": 50 |
| }, |
| { |
| "entropy": 3.7060696659038226, |
| "epoch": 0.1174812030075188, |
| "grad_norm": 1.1328125, |
| "learning_rate": 0.0002890625, |
| "loss": 2.899266357421875, |
| "mean_token_accuracy": 0.3803508952459354, |
| "num_tokens": 11723384.0, |
| "step": 75 |
| }, |
| { |
| "entropy": 3.483661951565247, |
| "epoch": 0.15664160401002505, |
| "grad_norm": 0.796875, |
| "learning_rate": 0.00038671875, |
| "loss": 2.5580235290527344, |
| "mean_token_accuracy": 0.4106306236210145, |
| "num_tokens": 15613476.0, |
| "step": 100 |
| }, |
| { |
| "entropy": 3.279625251379403, |
| "epoch": 0.19580200501253134, |
| "grad_norm": 0.71484375, |
| "learning_rate": 0.000484375, |
| "loss": 2.3971221923828123, |
| "mean_token_accuracy": 0.43163137955735414, |
| "num_tokens": 19537696.0, |
| "step": 125 |
| }, |
| { |
| "entropy": 3.1596573478657435, |
| "epoch": 0.2349624060150376, |
| "grad_norm": 0.640625, |
| "learning_rate": 0.0004999075642455791, |
| "loss": 2.332003479003906, |
| "mean_token_accuracy": 0.44275144542816425, |
| "num_tokens": 23462566.0, |
| "step": 150 |
| }, |
| { |
| "entropy": 3.104312514398783, |
| "epoch": 0.2741228070175439, |
| "grad_norm": 0.609375, |
| "learning_rate": 0.0004995565798713207, |
| "loss": 2.2806515502929687, |
| "mean_token_accuracy": 0.44779701792125276, |
| "num_tokens": 27367329.0, |
| "step": 175 |
| }, |
| { |
| "entropy": 3.062113077731651, |
| "epoch": 0.3132832080200501, |
| "grad_norm": 0.796875, |
| "learning_rate": 0.0004989440608306114, |
| "loss": 2.2435511779785156, |
| "mean_token_accuracy": 0.45369474441778246, |
| "num_tokens": 31290903.0, |
| "step": 200 |
| }, |
| { |
| "entropy": 3.007945648412728, |
| "epoch": 0.3524436090225564, |
| "grad_norm": 0.71875, |
| "learning_rate": 0.0004980706490418613, |
| "loss": 2.214092559814453, |
| "mean_token_accuracy": 0.46001344086021506, |
| "num_tokens": 35158603.0, |
| "step": 225 |
| }, |
| { |
| "entropy": 2.9779412397442524, |
| "epoch": 0.3916040100250627, |
| "grad_norm": 0.65625, |
| "learning_rate": 0.0004969372598384225, |
| "loss": 2.191622314453125, |
| "mean_token_accuracy": 0.46235443734230136, |
| "num_tokens": 39050018.0, |
| "step": 250 |
| }, |
| { |
| "epoch": 0.3916040100250627, |
| "eval_bpd": 3.058715802573539, |
| "eval_entropy": 2.8622500597497296, |
| "eval_loss": 2.117133855819702, |
| "eval_mean_token_accuracy": 0.4719805146180118, |
| "eval_nll": 2.120140234687999, |
| "eval_num_tokens": 39050018.0, |
| "eval_ppl": 8.332305884076892, |
| "eval_runtime": 317.9266, |
| "eval_samples_per_second": 571.229, |
| "eval_steps_per_second": 8.927, |
| "step": 250 |
| }, |
| { |
| "entropy": 2.91319560400022, |
| "epoch": 0.4307644110275689, |
| "grad_norm": 0.59375, |
| "learning_rate": 0.0004955450810093227, |
| "loss": 2.1354435729980468, |
| "mean_token_accuracy": 0.46928864274436577, |
| "num_tokens": 42938915.0, |
| "step": 275 |
| }, |
| { |
| "entropy": 2.974404757708524, |
| "epoch": 0.4699248120300752, |
| "grad_norm": 0.63671875, |
| "learning_rate": 0.0004938955715544644, |
| "loss": 2.180239562988281, |
| "mean_token_accuracy": 0.4623402148856342, |
| "num_tokens": 46830642.0, |
| "step": 300 |
| }, |
| { |
| "entropy": 2.947778592589299, |
| "epoch": 0.5090852130325815, |
| "grad_norm": 0.52734375, |
| "learning_rate": 0.0004919904601555969, |
| "loss": 2.137745666503906, |
| "mean_token_accuracy": 0.4655975033913256, |
| "num_tokens": 50738889.0, |
| "step": 325 |
| }, |
| { |
| "entropy": 2.912182858652311, |
| "epoch": 0.5482456140350878, |
| "grad_norm": 0.73046875, |
| "learning_rate": 0.0004898317433646626, |
| "loss": 2.134133148193359, |
| "mean_token_accuracy": 0.47067078409410695, |
| "num_tokens": 54590447.0, |
| "step": 350 |
| }, |
| { |
| "entropy": 2.8808906902937665, |
| "epoch": 0.5874060150375939, |
| "grad_norm": 0.71484375, |
| "learning_rate": 0.00048742168351141525, |
| "loss": 2.111539001464844, |
| "mean_token_accuracy": 0.47415726155363475, |
| "num_tokens": 58477393.0, |
| "step": 375 |
| }, |
| { |
| "entropy": 2.8902592806431113, |
| "epoch": 0.6265664160401002, |
| "grad_norm": 0.77734375, |
| "learning_rate": 0.00048476280633250404, |
| "loss": 2.1172853088378907, |
| "mean_token_accuracy": 0.47171053962916015, |
| "num_tokens": 62364053.0, |
| "step": 400 |
| }, |
| { |
| "entropy": 2.8472467625827407, |
| "epoch": 0.6657268170426065, |
| "grad_norm": 0.5546875, |
| "learning_rate": 0.00048185789832450813, |
| "loss": 2.079963836669922, |
| "mean_token_accuracy": 0.47701584614870657, |
| "num_tokens": 66254150.0, |
| "step": 425 |
| }, |
| { |
| "entropy": 2.849270481153217, |
| "epoch": 0.7048872180451128, |
| "grad_norm": 0.76171875, |
| "learning_rate": 0.00047871000382369524, |
| "loss": 2.076465911865234, |
| "mean_token_accuracy": 0.477678835790845, |
| "num_tokens": 70155017.0, |
| "step": 450 |
| }, |
| { |
| "entropy": 2.8533846163704104, |
| "epoch": 0.7440476190476191, |
| "grad_norm": 0.75, |
| "learning_rate": 0.0004753224218155648, |
| "loss": 2.076942901611328, |
| "mean_token_accuracy": 0.4763377187304664, |
| "num_tokens": 74017889.0, |
| "step": 475 |
| }, |
| { |
| "entropy": 2.833587274583335, |
| "epoch": 0.7832080200501254, |
| "grad_norm": 0.61328125, |
| "learning_rate": 0.0004716987024775197, |
| "loss": 2.0738652038574217, |
| "mean_token_accuracy": 0.48083406578747806, |
| "num_tokens": 77928779.0, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.7832080200501254, |
| "eval_bpd": 2.898750179783218, |
| "eval_entropy": 2.6689496127647594, |
| "eval_loss": 2.006093978881836, |
| "eval_mean_token_accuracy": 0.4891084327887536, |
| "eval_nll": 2.009260514264372, |
| "eval_num_tokens": 77928779.0, |
| "eval_ppl": 7.457800370714545, |
| "eval_runtime": 317.8942, |
| "eval_samples_per_second": 571.288, |
| "eval_steps_per_second": 8.927, |
| "step": 500 |
| } |
| ], |
| "logging_steps": 25, |
| "max_steps": 2554, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 4, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 2.5466593463033856e+17, |
| "train_batch_size": 64, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|