{ "best_global_step": 500, "best_metric": 2.009260514264372, "best_model_checkpoint": "/content/cot-split1/checkpoint-500", "epoch": 0.7832080200501254, "eval_steps": 250, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0, "eval_bpd": 5.449506205976702, "eval_entropy": 3.8259646681880883, "eval_loss": 3.7819511890411377, "eval_mean_token_accuracy": 0.3298281561563004, "eval_nll": 3.777309862116675, "eval_num_tokens": 0.0, "eval_ppl": 43.69832894461198, "eval_runtime": 318.4397, "eval_samples_per_second": 570.309, "eval_steps_per_second": 8.912, "step": 0 }, { "entropy": 3.936198543874438, "epoch": 0.0015664160401002505, "grad_norm": 3.5, "learning_rate": 0.0, "loss": 3.687645435333252, "mean_token_accuracy": 0.34163331851193124, "num_tokens": 154043.0, "step": 1 }, { "entropy": 4.1582471953791025, "epoch": 0.039160401002506263, "grad_norm": 1.8515625, "learning_rate": 9.375e-05, "loss": 3.716327985127767, "mean_token_accuracy": 0.32336124196593746, "num_tokens": 3937675.0, "step": 25 }, { "entropy": 4.004832741749853, "epoch": 0.07832080200501253, "grad_norm": 1.578125, "learning_rate": 0.00019140625, "loss": 3.245400085449219, "mean_token_accuracy": 0.3525532396162817, "num_tokens": 7842040.0, "step": 50 }, { "entropy": 3.7060696659038226, "epoch": 0.1174812030075188, "grad_norm": 1.1328125, "learning_rate": 0.0002890625, "loss": 2.899266357421875, "mean_token_accuracy": 0.3803508952459354, "num_tokens": 11723384.0, "step": 75 }, { "entropy": 3.483661951565247, "epoch": 0.15664160401002505, "grad_norm": 0.796875, "learning_rate": 0.00038671875, "loss": 2.5580235290527344, "mean_token_accuracy": 0.4106306236210145, "num_tokens": 15613476.0, "step": 100 }, { "entropy": 3.279625251379403, "epoch": 0.19580200501253134, "grad_norm": 0.71484375, "learning_rate": 0.000484375, "loss": 2.3971221923828123, "mean_token_accuracy": 0.43163137955735414, "num_tokens": 19537696.0, "step": 125 }, { "entropy": 3.1596573478657435, "epoch": 0.2349624060150376, "grad_norm": 0.640625, "learning_rate": 0.0004999075642455791, "loss": 2.332003479003906, "mean_token_accuracy": 0.44275144542816425, "num_tokens": 23462566.0, "step": 150 }, { "entropy": 3.104312514398783, "epoch": 0.2741228070175439, "grad_norm": 0.609375, "learning_rate": 0.0004995565798713207, "loss": 2.2806515502929687, "mean_token_accuracy": 0.44779701792125276, "num_tokens": 27367329.0, "step": 175 }, { "entropy": 3.062113077731651, "epoch": 0.3132832080200501, "grad_norm": 0.796875, "learning_rate": 0.0004989440608306114, "loss": 2.2435511779785156, "mean_token_accuracy": 0.45369474441778246, "num_tokens": 31290903.0, "step": 200 }, { "entropy": 3.007945648412728, "epoch": 0.3524436090225564, "grad_norm": 0.71875, "learning_rate": 0.0004980706490418613, "loss": 2.214092559814453, "mean_token_accuracy": 0.46001344086021506, "num_tokens": 35158603.0, "step": 225 }, { "entropy": 2.9779412397442524, "epoch": 0.3916040100250627, "grad_norm": 0.65625, "learning_rate": 0.0004969372598384225, "loss": 2.191622314453125, "mean_token_accuracy": 0.46235443734230136, "num_tokens": 39050018.0, "step": 250 }, { "epoch": 0.3916040100250627, "eval_bpd": 3.058715802573539, "eval_entropy": 2.8622500597497296, "eval_loss": 2.117133855819702, "eval_mean_token_accuracy": 0.4719805146180118, "eval_nll": 2.120140234687999, "eval_num_tokens": 39050018.0, "eval_ppl": 8.332305884076892, "eval_runtime": 317.9266, "eval_samples_per_second": 571.229, "eval_steps_per_second": 8.927, "step": 250 }, { "entropy": 2.91319560400022, "epoch": 0.4307644110275689, "grad_norm": 0.59375, "learning_rate": 0.0004955450810093227, "loss": 2.1354435729980468, "mean_token_accuracy": 0.46928864274436577, "num_tokens": 42938915.0, "step": 275 }, { "entropy": 2.974404757708524, "epoch": 0.4699248120300752, "grad_norm": 0.63671875, "learning_rate": 0.0004938955715544644, "loss": 2.180239562988281, "mean_token_accuracy": 0.4623402148856342, "num_tokens": 46830642.0, "step": 300 }, { "entropy": 2.947778592589299, "epoch": 0.5090852130325815, "grad_norm": 0.52734375, "learning_rate": 0.0004919904601555969, "loss": 2.137745666503906, "mean_token_accuracy": 0.4655975033913256, "num_tokens": 50738889.0, "step": 325 }, { "entropy": 2.912182858652311, "epoch": 0.5482456140350878, "grad_norm": 0.73046875, "learning_rate": 0.0004898317433646626, "loss": 2.134133148193359, "mean_token_accuracy": 0.47067078409410695, "num_tokens": 54590447.0, "step": 350 }, { "entropy": 2.8808906902937665, "epoch": 0.5874060150375939, "grad_norm": 0.71484375, "learning_rate": 0.00048742168351141525, "loss": 2.111539001464844, "mean_token_accuracy": 0.47415726155363475, "num_tokens": 58477393.0, "step": 375 }, { "entropy": 2.8902592806431113, "epoch": 0.6265664160401002, "grad_norm": 0.77734375, "learning_rate": 0.00048476280633250404, "loss": 2.1172853088378907, "mean_token_accuracy": 0.47171053962916015, "num_tokens": 62364053.0, "step": 400 }, { "entropy": 2.8472467625827407, "epoch": 0.6657268170426065, "grad_norm": 0.5546875, "learning_rate": 0.00048185789832450813, "loss": 2.079963836669922, "mean_token_accuracy": 0.47701584614870657, "num_tokens": 66254150.0, "step": 425 }, { "entropy": 2.849270481153217, "epoch": 0.7048872180451128, "grad_norm": 0.76171875, "learning_rate": 0.00047871000382369524, "loss": 2.076465911865234, "mean_token_accuracy": 0.477678835790845, "num_tokens": 70155017.0, "step": 450 }, { "entropy": 2.8533846163704104, "epoch": 0.7440476190476191, "grad_norm": 0.75, "learning_rate": 0.0004753224218155648, "loss": 2.076942901611328, "mean_token_accuracy": 0.4763377187304664, "num_tokens": 74017889.0, "step": 475 }, { "entropy": 2.833587274583335, "epoch": 0.7832080200501254, "grad_norm": 0.61328125, "learning_rate": 0.0004716987024775197, "loss": 2.0738652038574217, "mean_token_accuracy": 0.48083406578747806, "num_tokens": 77928779.0, "step": 500 }, { "epoch": 0.7832080200501254, "eval_bpd": 2.898750179783218, "eval_entropy": 2.6689496127647594, "eval_loss": 2.006093978881836, "eval_mean_token_accuracy": 0.4891084327887536, "eval_nll": 2.009260514264372, "eval_num_tokens": 77928779.0, "eval_ppl": 7.457800370714545, "eval_runtime": 317.8942, "eval_samples_per_second": 571.288, "eval_steps_per_second": 8.927, "step": 500 } ], "logging_steps": 25, "max_steps": 2554, "num_input_tokens_seen": 0, "num_train_epochs": 4, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.5466593463033856e+17, "train_batch_size": 64, "trial_name": null, "trial_params": null }