{ "best_global_step": 1000, "best_metric": 1.9394328048034677, "best_model_checkpoint": "/content/cot-split3/checkpoint-1000", "epoch": 0.39155800931908064, "eval_steps": 250, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0, "eval_bpd": 5.410557520272195, "eval_entropy": 3.805819726348172, "eval_loss": 3.754805564880371, "eval_mean_token_accuracy": 0.3303780525619185, "eval_nll": 3.7503126904340807, "eval_num_tokens": 0.0, "eval_ppl": 42.534380014623586, "eval_runtime": 319.2646, "eval_samples_per_second": 568.835, "eval_steps_per_second": 8.889, "step": 0 }, { "entropy": 3.939532442367398, "epoch": 0.00039155800931908063, "grad_norm": 2.921875, "learning_rate": 0.0, "loss": 3.6805007457733154, "mean_token_accuracy": 0.33797585886722376, "num_tokens": 159295.0, "step": 1 }, { "entropy": 4.131688260781753, "epoch": 0.009788950232977016, "grad_norm": 1.828125, "learning_rate": 9.375e-05, "loss": 3.7089433670043945, "mean_token_accuracy": 0.32488122625965454, "num_tokens": 3875056.0, "step": 25 }, { "entropy": 4.03907456745432, "epoch": 0.01957790046595403, "grad_norm": 0.87109375, "learning_rate": 0.00019140625, "loss": 3.2840447998046876, "mean_token_accuracy": 0.3501161635947849, "num_tokens": 7796334.0, "step": 50 }, { "entropy": 3.718109237212473, "epoch": 0.02936685069893105, "grad_norm": 0.875, "learning_rate": 0.0002890625, "loss": 2.907643127441406, "mean_token_accuracy": 0.37667007823156323, "num_tokens": 11688138.0, "step": 75 }, { "entropy": 3.4646144502832286, "epoch": 0.03915580093190806, "grad_norm": 0.71484375, "learning_rate": 0.00038671875, "loss": 2.5448974609375, "mean_token_accuracy": 0.41452789283904995, "num_tokens": 15554877.0, "step": 100 }, { "entropy": 3.2713017840492147, "epoch": 0.04894475116488508, "grad_norm": 0.71484375, "learning_rate": 0.000484375, "loss": 2.4108335876464846, "mean_token_accuracy": 0.4332291316341289, "num_tokens": 19437565.0, "step": 125 }, { "entropy": 3.177977246980637, "epoch": 0.0587337013978621, "grad_norm": 0.6796875, "learning_rate": 0.0004999075642455791, "loss": 2.35259765625, "mean_token_accuracy": 0.4402555277869966, "num_tokens": 23324888.0, "step": 150 }, { "entropy": 3.1149309732260146, "epoch": 0.06852265163083911, "grad_norm": 0.6171875, "learning_rate": 0.0004995565798713207, "loss": 2.2896893310546873, "mean_token_accuracy": 0.44857320203325, "num_tokens": 27225978.0, "step": 175 }, { "entropy": 3.0429316923380134, "epoch": 0.07831160186381612, "grad_norm": 0.7109375, "learning_rate": 0.0004989440608306114, "loss": 2.2477577209472654, "mean_token_accuracy": 0.45537929991850945, "num_tokens": 31124891.0, "step": 200 }, { "entropy": 3.000580134712211, "epoch": 0.08810055209679314, "grad_norm": 0.73046875, "learning_rate": 0.0004980706490418613, "loss": 2.2050234985351564, "mean_token_accuracy": 0.4608995247476681, "num_tokens": 35005557.0, "step": 225 }, { "entropy": 2.972177586040443, "epoch": 0.09788950232977016, "grad_norm": 0.64453125, "learning_rate": 0.0004969372598384225, "loss": 2.1969384765625, "mean_token_accuracy": 0.46284280083339074, "num_tokens": 38902413.0, "step": 250 }, { "epoch": 0.09788950232977016, "eval_bpd": 3.072745569254064, "eval_entropy": 2.8243270517127983, "eval_loss": 2.126833915710449, "eval_mean_token_accuracy": 0.4728344847516112, "eval_nll": 2.1298649279065187, "eval_num_tokens": 38902413.0, "eval_ppl": 8.41373027452248, "eval_runtime": 318.4023, "eval_samples_per_second": 570.376, "eval_steps_per_second": 8.913, "step": 250 }, { "entropy": 2.9943911642269376, "epoch": 0.10767845256274718, "grad_norm": 0.6328125, "learning_rate": 0.0004955450810093227, "loss": 2.189352722167969, "mean_token_accuracy": 0.4613144874232056, "num_tokens": 42787954.0, "step": 275 }, { "entropy": 2.9854789787582336, "epoch": 0.1174674027957242, "grad_norm": 0.64453125, "learning_rate": 0.0004938955715544644, "loss": 2.197265625, "mean_token_accuracy": 0.4586064115776618, "num_tokens": 46649640.0, "step": 300 }, { "entropy": 2.967871895537734, "epoch": 0.1272563530287012, "grad_norm": 0.77734375, "learning_rate": 0.0004919904601555969, "loss": 2.1636979675292967, "mean_token_accuracy": 0.46279846221708726, "num_tokens": 50562181.0, "step": 325 }, { "entropy": 2.9346317600010297, "epoch": 0.13704530326167821, "grad_norm": 0.66796875, "learning_rate": 0.0004898317433646626, "loss": 2.1643003845214843, "mean_token_accuracy": 0.4652492077421426, "num_tokens": 54435712.0, "step": 350 }, { "entropy": 2.8769926588271595, "epoch": 0.14683425349465523, "grad_norm": 0.81640625, "learning_rate": 0.00048742168351141525, "loss": 2.1070077514648435, "mean_token_accuracy": 0.4735955714097171, "num_tokens": 58331515.0, "step": 375 }, { "entropy": 2.9047266886544443, "epoch": 0.15662320372763225, "grad_norm": 0.58984375, "learning_rate": 0.00048476280633250404, "loss": 2.1295965576171874, "mean_token_accuracy": 0.4706730742865917, "num_tokens": 62245696.0, "step": 400 }, { "entropy": 2.8752667624718105, "epoch": 0.16641215396060927, "grad_norm": 0.58203125, "learning_rate": 0.00048185789832450813, "loss": 2.11253173828125, "mean_token_accuracy": 0.4743365019853278, "num_tokens": 66145585.0, "step": 425 }, { "entropy": 2.8552429066577076, "epoch": 0.17620110419358628, "grad_norm": 0.59375, "learning_rate": 0.00047871000382369524, "loss": 2.0846556091308592, "mean_token_accuracy": 0.47697299871989524, "num_tokens": 70063214.0, "step": 450 }, { "entropy": 2.8341120851783472, "epoch": 0.1859900544265633, "grad_norm": 0.58203125, "learning_rate": 0.0004753224218155648, "loss": 2.068045349121094, "mean_token_accuracy": 0.47787787454415265, "num_tokens": 73984544.0, "step": 475 }, { "entropy": 2.8375192761847376, "epoch": 0.19577900465954032, "grad_norm": 0.61328125, "learning_rate": 0.0004716987024775197, "loss": 2.0847515869140625, "mean_token_accuracy": 0.47784874690977935, "num_tokens": 77862885.0, "step": 500 }, { "epoch": 0.19577900465954032, "eval_bpd": 2.9090075702135, "eval_entropy": 2.6186967416048157, "eval_loss": 2.013190507888794, "eval_mean_token_accuracy": 0.48935668935428794, "eval_nll": 2.0163703955210246, "eval_num_tokens": 77862885.0, "eval_ppl": 7.5110133907515495, "eval_runtime": 318.4358, "eval_samples_per_second": 570.316, "eval_steps_per_second": 8.912, "step": 500 }, { "entropy": 2.86442423287629, "epoch": 0.20556795489251733, "grad_norm": 0.6796875, "learning_rate": 0.000467842643458289, "loss": 2.097323455810547, "mean_token_accuracy": 0.4766681852583933, "num_tokens": 81738952.0, "step": 525 }, { "entropy": 2.8243706708841483, "epoch": 0.21535690512549435, "grad_norm": 0.6328125, "learning_rate": 0.0004637582858980017, "loss": 2.050118865966797, "mean_token_accuracy": 0.48122489244307076, "num_tokens": 85626497.0, "step": 550 }, { "entropy": 2.848133797467131, "epoch": 0.22514585535847137, "grad_norm": 0.84375, "learning_rate": 0.0004594499101930825, "loss": 2.0830853271484373, "mean_token_accuracy": 0.47580645161290325, "num_tokens": 89484956.0, "step": 575 }, { "entropy": 2.8410350923085876, "epoch": 0.2349348055914484, "grad_norm": 0.52734375, "learning_rate": 0.00045492203151040655, "loss": 2.0800726318359377, "mean_token_accuracy": 0.47742178446222894, "num_tokens": 93413171.0, "step": 600 }, { "entropy": 2.7831898042795857, "epoch": 0.24472375582442538, "grad_norm": 0.5859375, "learning_rate": 0.00045017939505541626, "loss": 2.0370738220214846, "mean_token_accuracy": 0.4864190419562228, "num_tokens": 97298042.0, "step": 625 }, { "entropy": 2.8064169968349897, "epoch": 0.2545127060574024, "grad_norm": 0.5546875, "learning_rate": 0.00044522697109915813, "loss": 2.061403503417969, "mean_token_accuracy": 0.48147006407999693, "num_tokens": 101194607.0, "step": 650 }, { "entropy": 2.7893201624619977, "epoch": 0.26430165629037944, "grad_norm": 0.5234375, "learning_rate": 0.0004400699497694506, "loss": 2.0294932556152343, "mean_token_accuracy": 0.48583452555693873, "num_tokens": 105105248.0, "step": 675 }, { "entropy": 2.766137535649265, "epoch": 0.27409060652335643, "grad_norm": 0.61328125, "learning_rate": 0.00043471373561164396, "loss": 2.0185002136230468, "mean_token_accuracy": 0.48713530665141636, "num_tokens": 108992058.0, "step": 700 }, { "entropy": 2.7472840214584604, "epoch": 0.2838795567563335, "grad_norm": 0.61328125, "learning_rate": 0.00042916394192466997, "loss": 2.007948150634766, "mean_token_accuracy": 0.49140476584755016, "num_tokens": 112863096.0, "step": 725 }, { "entropy": 2.8039981412212533, "epoch": 0.29366850698931046, "grad_norm": 0.60546875, "learning_rate": 0.00042342638487831874, "loss": 2.0519680786132812, "mean_token_accuracy": 0.4848400037316914, "num_tokens": 116741714.0, "step": 750 }, { "epoch": 0.29366850698931046, "eval_bpd": 2.8368191124508524, "eval_entropy": 2.5129475370871655, "eval_loss": 1.963122010231018, "eval_mean_token_accuracy": 0.49759134340714123, "eval_nll": 1.9663331695538748, "eval_num_tokens": 116741714.0, "eval_ppl": 7.144430981798381, "eval_runtime": 318.4485, "eval_samples_per_second": 570.293, "eval_steps_per_second": 8.912, "step": 750 }, { "entropy": 2.7818116819998244, "epoch": 0.3034574572222875, "grad_norm": 0.60546875, "learning_rate": 0.0004175070774179078, "loss": 2.0355569458007814, "mean_token_accuracy": 0.4845890820401234, "num_tokens": 120630485.0, "step": 775 }, { "entropy": 2.754836296553474, "epoch": 0.3132464074552645, "grad_norm": 0.6328125, "learning_rate": 0.0004114122229627302, "loss": 2.026649627685547, "mean_token_accuracy": 0.4883731104937326, "num_tokens": 124539577.0, "step": 800 }, { "entropy": 2.7313264609464514, "epoch": 0.3230353576882415, "grad_norm": 0.5546875, "learning_rate": 0.00040514820890488664, "loss": 1.9894279479980468, "mean_token_accuracy": 0.493762371510729, "num_tokens": 128444796.0, "step": 825 }, { "entropy": 2.799315380985199, "epoch": 0.33282430792121853, "grad_norm": 0.6171875, "learning_rate": 0.00039872159991531533, "loss": 2.04507568359375, "mean_token_accuracy": 0.48317747648488935, "num_tokens": 132371500.0, "step": 850 }, { "entropy": 2.7418567548344273, "epoch": 0.3426132581541955, "grad_norm": 0.64453125, "learning_rate": 0.0003921391310640325, "loss": 2.0068865966796876, "mean_token_accuracy": 0.4890909259070856, "num_tokens": 136267287.0, "step": 875 }, { "entropy": 2.7740001842357076, "epoch": 0.35240220838717257, "grad_norm": 0.62109375, "learning_rate": 0.0003854077007617969, "loss": 2.022200164794922, "mean_token_accuracy": 0.4868092625998601, "num_tokens": 140138103.0, "step": 900 }, { "entropy": 2.7364819494297907, "epoch": 0.36219115862014956, "grad_norm": 1.65625, "learning_rate": 0.0003785343635305919, "loss": 2.0004840087890625, "mean_token_accuracy": 0.49300860279730147, "num_tokens": 144053086.0, "step": 925 }, { "entropy": 2.739402972362386, "epoch": 0.3719801088531266, "grad_norm": 0.51953125, "learning_rate": 0.00037152632261050483, "loss": 1.9922245788574218, "mean_token_accuracy": 0.4915943380171221, "num_tokens": 147953420.0, "step": 950 }, { "entropy": 2.7438382548220077, "epoch": 0.3817690590861036, "grad_norm": 0.7265625, "learning_rate": 0.0003643909224107492, "loss": 2.0027291870117185, "mean_token_accuracy": 0.48921148393722236, "num_tokens": 151836411.0, "step": 975 }, { "entropy": 2.7921177392917085, "epoch": 0.39155800931908064, "grad_norm": 0.6171875, "learning_rate": 0.00035713564081274257, "loss": 2.0273634338378907, "mean_token_accuracy": 0.48521556448666425, "num_tokens": 155738536.0, "step": 1000 }, { "epoch": 0.39155800931908064, "eval_bpd": 2.798010089627336, "eval_entropy": 2.536048009293489, "eval_loss": 1.9362056255340576, "eval_mean_token_accuracy": 0.5017364167555982, "eval_nll": 1.9394328048034677, "eval_num_tokens": 155738536.0, "eval_ppl": 6.95480511965251, "eval_runtime": 318.4763, "eval_samples_per_second": 570.243, "eval_steps_per_second": 8.911, "step": 1000 } ], "logging_steps": 25, "max_steps": 2554, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 5.064070482272256e+17, "train_batch_size": 64, "trial_name": null, "trial_params": null }