| { |
| "best_global_step": 500, |
| "best_metric": 2.0163703955210246, |
| "best_model_checkpoint": "/content/cot-split3/checkpoint-500", |
| "epoch": 0.19577900465954032, |
| "eval_steps": 250, |
| "global_step": 500, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0, |
| "eval_bpd": 5.410557520272195, |
| "eval_entropy": 3.805819726348172, |
| "eval_loss": 3.754805564880371, |
| "eval_mean_token_accuracy": 0.3303780525619185, |
| "eval_nll": 3.7503126904340807, |
| "eval_num_tokens": 0.0, |
| "eval_ppl": 42.534380014623586, |
| "eval_runtime": 319.2646, |
| "eval_samples_per_second": 568.835, |
| "eval_steps_per_second": 8.889, |
| "step": 0 |
| }, |
| { |
| "entropy": 3.939532442367398, |
| "epoch": 0.00039155800931908063, |
| "grad_norm": 2.921875, |
| "learning_rate": 0.0, |
| "loss": 3.6805007457733154, |
| "mean_token_accuracy": 0.33797585886722376, |
| "num_tokens": 159295.0, |
| "step": 1 |
| }, |
| { |
| "entropy": 4.131688260781753, |
| "epoch": 0.009788950232977016, |
| "grad_norm": 1.828125, |
| "learning_rate": 9.375e-05, |
| "loss": 3.7089433670043945, |
| "mean_token_accuracy": 0.32488122625965454, |
| "num_tokens": 3875056.0, |
| "step": 25 |
| }, |
| { |
| "entropy": 4.03907456745432, |
| "epoch": 0.01957790046595403, |
| "grad_norm": 0.87109375, |
| "learning_rate": 0.00019140625, |
| "loss": 3.2840447998046876, |
| "mean_token_accuracy": 0.3501161635947849, |
| "num_tokens": 7796334.0, |
| "step": 50 |
| }, |
| { |
| "entropy": 3.718109237212473, |
| "epoch": 0.02936685069893105, |
| "grad_norm": 0.875, |
| "learning_rate": 0.0002890625, |
| "loss": 2.907643127441406, |
| "mean_token_accuracy": 0.37667007823156323, |
| "num_tokens": 11688138.0, |
| "step": 75 |
| }, |
| { |
| "entropy": 3.4646144502832286, |
| "epoch": 0.03915580093190806, |
| "grad_norm": 0.71484375, |
| "learning_rate": 0.00038671875, |
| "loss": 2.5448974609375, |
| "mean_token_accuracy": 0.41452789283904995, |
| "num_tokens": 15554877.0, |
| "step": 100 |
| }, |
| { |
| "entropy": 3.2713017840492147, |
| "epoch": 0.04894475116488508, |
| "grad_norm": 0.71484375, |
| "learning_rate": 0.000484375, |
| "loss": 2.4108335876464846, |
| "mean_token_accuracy": 0.4332291316341289, |
| "num_tokens": 19437565.0, |
| "step": 125 |
| }, |
| { |
| "entropy": 3.177977246980637, |
| "epoch": 0.0587337013978621, |
| "grad_norm": 0.6796875, |
| "learning_rate": 0.0004999075642455791, |
| "loss": 2.35259765625, |
| "mean_token_accuracy": 0.4402555277869966, |
| "num_tokens": 23324888.0, |
| "step": 150 |
| }, |
| { |
| "entropy": 3.1149309732260146, |
| "epoch": 0.06852265163083911, |
| "grad_norm": 0.6171875, |
| "learning_rate": 0.0004995565798713207, |
| "loss": 2.2896893310546873, |
| "mean_token_accuracy": 0.44857320203325, |
| "num_tokens": 27225978.0, |
| "step": 175 |
| }, |
| { |
| "entropy": 3.0429316923380134, |
| "epoch": 0.07831160186381612, |
| "grad_norm": 0.7109375, |
| "learning_rate": 0.0004989440608306114, |
| "loss": 2.2477577209472654, |
| "mean_token_accuracy": 0.45537929991850945, |
| "num_tokens": 31124891.0, |
| "step": 200 |
| }, |
| { |
| "entropy": 3.000580134712211, |
| "epoch": 0.08810055209679314, |
| "grad_norm": 0.73046875, |
| "learning_rate": 0.0004980706490418613, |
| "loss": 2.2050234985351564, |
| "mean_token_accuracy": 0.4608995247476681, |
| "num_tokens": 35005557.0, |
| "step": 225 |
| }, |
| { |
| "entropy": 2.972177586040443, |
| "epoch": 0.09788950232977016, |
| "grad_norm": 0.64453125, |
| "learning_rate": 0.0004969372598384225, |
| "loss": 2.1969384765625, |
| "mean_token_accuracy": 0.46284280083339074, |
| "num_tokens": 38902413.0, |
| "step": 250 |
| }, |
| { |
| "epoch": 0.09788950232977016, |
| "eval_bpd": 3.072745569254064, |
| "eval_entropy": 2.8243270517127983, |
| "eval_loss": 2.126833915710449, |
| "eval_mean_token_accuracy": 0.4728344847516112, |
| "eval_nll": 2.1298649279065187, |
| "eval_num_tokens": 38902413.0, |
| "eval_ppl": 8.41373027452248, |
| "eval_runtime": 318.4023, |
| "eval_samples_per_second": 570.376, |
| "eval_steps_per_second": 8.913, |
| "step": 250 |
| }, |
| { |
| "entropy": 2.9943911642269376, |
| "epoch": 0.10767845256274718, |
| "grad_norm": 0.6328125, |
| "learning_rate": 0.0004955450810093227, |
| "loss": 2.189352722167969, |
| "mean_token_accuracy": 0.4613144874232056, |
| "num_tokens": 42787954.0, |
| "step": 275 |
| }, |
| { |
| "entropy": 2.9854789787582336, |
| "epoch": 0.1174674027957242, |
| "grad_norm": 0.64453125, |
| "learning_rate": 0.0004938955715544644, |
| "loss": 2.197265625, |
| "mean_token_accuracy": 0.4586064115776618, |
| "num_tokens": 46649640.0, |
| "step": 300 |
| }, |
| { |
| "entropy": 2.967871895537734, |
| "epoch": 0.1272563530287012, |
| "grad_norm": 0.77734375, |
| "learning_rate": 0.0004919904601555969, |
| "loss": 2.1636979675292967, |
| "mean_token_accuracy": 0.46279846221708726, |
| "num_tokens": 50562181.0, |
| "step": 325 |
| }, |
| { |
| "entropy": 2.9346317600010297, |
| "epoch": 0.13704530326167821, |
| "grad_norm": 0.66796875, |
| "learning_rate": 0.0004898317433646626, |
| "loss": 2.1643003845214843, |
| "mean_token_accuracy": 0.4652492077421426, |
| "num_tokens": 54435712.0, |
| "step": 350 |
| }, |
| { |
| "entropy": 2.8769926588271595, |
| "epoch": 0.14683425349465523, |
| "grad_norm": 0.81640625, |
| "learning_rate": 0.00048742168351141525, |
| "loss": 2.1070077514648435, |
| "mean_token_accuracy": 0.4735955714097171, |
| "num_tokens": 58331515.0, |
| "step": 375 |
| }, |
| { |
| "entropy": 2.9047266886544443, |
| "epoch": 0.15662320372763225, |
| "grad_norm": 0.58984375, |
| "learning_rate": 0.00048476280633250404, |
| "loss": 2.1295965576171874, |
| "mean_token_accuracy": 0.4706730742865917, |
| "num_tokens": 62245696.0, |
| "step": 400 |
| }, |
| { |
| "entropy": 2.8752667624718105, |
| "epoch": 0.16641215396060927, |
| "grad_norm": 0.58203125, |
| "learning_rate": 0.00048185789832450813, |
| "loss": 2.11253173828125, |
| "mean_token_accuracy": 0.4743365019853278, |
| "num_tokens": 66145585.0, |
| "step": 425 |
| }, |
| { |
| "entropy": 2.8552429066577076, |
| "epoch": 0.17620110419358628, |
| "grad_norm": 0.59375, |
| "learning_rate": 0.00047871000382369524, |
| "loss": 2.0846556091308592, |
| "mean_token_accuracy": 0.47697299871989524, |
| "num_tokens": 70063214.0, |
| "step": 450 |
| }, |
| { |
| "entropy": 2.8341120851783472, |
| "epoch": 0.1859900544265633, |
| "grad_norm": 0.58203125, |
| "learning_rate": 0.0004753224218155648, |
| "loss": 2.068045349121094, |
| "mean_token_accuracy": 0.47787787454415265, |
| "num_tokens": 73984544.0, |
| "step": 475 |
| }, |
| { |
| "entropy": 2.8375192761847376, |
| "epoch": 0.19577900465954032, |
| "grad_norm": 0.61328125, |
| "learning_rate": 0.0004716987024775197, |
| "loss": 2.0847515869140625, |
| "mean_token_accuracy": 0.47784874690977935, |
| "num_tokens": 77862885.0, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.19577900465954032, |
| "eval_bpd": 2.9090075702135, |
| "eval_entropy": 2.6186967416048157, |
| "eval_loss": 2.013190507888794, |
| "eval_mean_token_accuracy": 0.48935668935428794, |
| "eval_nll": 2.0163703955210246, |
| "eval_num_tokens": 77862885.0, |
| "eval_ppl": 7.5110133907515495, |
| "eval_runtime": 318.4358, |
| "eval_samples_per_second": 570.316, |
| "eval_steps_per_second": 8.912, |
| "step": 500 |
| } |
| ], |
| "logging_steps": 25, |
| "max_steps": 2554, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 1, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 2.525280992403456e+17, |
| "train_batch_size": 64, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|