Instructions to use cragtmp/task1f with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use cragtmp/task1f with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct") model = PeftModel.from_pretrained(base_model, "cragtmp/task1f") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.8740617180984154, | |
| "eval_steps": 500, | |
| "global_step": 280, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.0234375, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 14.6328125, | |
| "completions/min_length": 2.0, | |
| "epoch": 0.0110803324099723, | |
| "grad_norm": 1.5475432762019699, | |
| "kl": 0.0, | |
| "learning_rate": 2.2222222222222223e-05, | |
| "loss": 5.587935447692871e-09, | |
| "memory(GiB)": 77.28, | |
| "reward": 0.25, | |
| "reward_std": 0.7772719860076904, | |
| "rewards/Response_no_think_reward/mean": 0.25, | |
| "rewards/Response_no_think_reward/std": 1.4795188903808594, | |
| "step": 1, | |
| "train_speed(iter/s)": 0.001043 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "epoch": 0.0221606648199446, | |
| "grad_norm": 1.552548658770951, | |
| "kl": 0.0, | |
| "learning_rate": 4.4444444444444447e-05, | |
| "loss": 5.587935447692871e-09, | |
| "memory(GiB)": 78.06, | |
| "step": 2, | |
| "train_speed(iter/s)": 0.001737 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 17.8828125, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.0332409972299169, | |
| "grad_norm": 1.291839688026328, | |
| "kl": 0.0012106498143111821, | |
| "learning_rate": 6.666666666666667e-05, | |
| "loss": 0.0004578572406899184, | |
| "memory(GiB)": 78.06, | |
| "reward": 0.25, | |
| "reward_std": 0.8250656127929688, | |
| "rewards/Response_no_think_reward/mean": 0.25, | |
| "rewards/Response_no_think_reward/std": 1.4634658098220825, | |
| "step": 3, | |
| "train_speed(iter/s)": 0.001451 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.004197790374746546, | |
| "clip_ratio/high_mean": 0.004197790374746546, | |
| "clip_ratio/low_mean": 0.012020835361909121, | |
| "clip_ratio/low_min": 0.012020835361909121, | |
| "clip_ratio/region_mean": 0.01621862585307099, | |
| "epoch": 0.0443213296398892, | |
| "grad_norm": 1.0301802967661304, | |
| "kl": 0.005412253500253428, | |
| "learning_rate": 8.888888888888889e-05, | |
| "loss": -0.005840146914124489, | |
| "memory(GiB)": 78.06, | |
| "step": 4, | |
| "train_speed(iter/s)": 0.001769 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.002237339736893773, | |
| "clip_ratio/low_min": 0.002237339736893773, | |
| "clip_ratio/region_mean": 0.002237339736893773, | |
| "completions/clipped_ratio": 0.0078125, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 12.5546875, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.055401662049861494, | |
| "grad_norm": 2.027395284218205, | |
| "kl": 0.014184385421685874, | |
| "learning_rate": 0.00011111111111111112, | |
| "loss": 0.0008896891959011555, | |
| "memory(GiB)": 78.06, | |
| "reward": 0.8515625, | |
| "reward_std": 0.5118520259857178, | |
| "rewards/Response_no_think_reward/mean": 0.8515625, | |
| "rewards/Response_no_think_reward/std": 1.4147136211395264, | |
| "step": 5, | |
| "train_speed(iter/s)": 0.00164 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.013844632252585143, | |
| "clip_ratio/high_mean": 0.013844632252585143, | |
| "clip_ratio/low_mean": 0.043920744908973575, | |
| "clip_ratio/low_min": 0.043920744908973575, | |
| "clip_ratio/region_mean": 0.05776537861675024, | |
| "epoch": 0.0664819944598338, | |
| "grad_norm": 6.212168397356187, | |
| "kl": 1.7603500080003869, | |
| "learning_rate": 0.00013333333333333334, | |
| "loss": 0.01842591166496277, | |
| "memory(GiB)": 79.98, | |
| "step": 6, | |
| "train_speed(iter/s)": 0.00185 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.001959657238330692, | |
| "clip_ratio/low_min": 0.001959657238330692, | |
| "clip_ratio/region_mean": 0.001959657238330692, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 70.0, | |
| "completions/mean_length": 10.359375, | |
| "completions/min_length": 2.0, | |
| "epoch": 0.07756232686980609, | |
| "grad_norm": 3.537674599924329, | |
| "kl": 0.33545287084416486, | |
| "learning_rate": 0.00015555555555555556, | |
| "loss": 0.0018048422643914819, | |
| "memory(GiB)": 79.98, | |
| "reward": 0.53125, | |
| "reward_std": 0.6121620535850525, | |
| "rewards/Response_no_think_reward/mean": 0.53125, | |
| "rewards/Response_no_think_reward/std": 1.3685873746871948, | |
| "step": 7, | |
| "train_speed(iter/s)": 0.001773 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.014042179333046079, | |
| "clip_ratio/high_mean": 0.014042179333046079, | |
| "clip_ratio/low_mean": 0.03925089433323592, | |
| "clip_ratio/low_min": 0.03925089433323592, | |
| "clip_ratio/region_mean": 0.053293074015527964, | |
| "epoch": 0.0886426592797784, | |
| "grad_norm": 2.64201486377639, | |
| "kl": 1.295830228133127, | |
| "learning_rate": 0.00017777777777777779, | |
| "loss": 0.011679837480187416, | |
| "memory(GiB)": 79.98, | |
| "step": 8, | |
| "train_speed(iter/s)": 0.001932 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0011001251987181604, | |
| "clip_ratio/high_mean": 0.0011001251987181604, | |
| "clip_ratio/low_mean": 0.008499634364852682, | |
| "clip_ratio/low_min": 0.008499634364852682, | |
| "clip_ratio/region_mean": 0.009599759563570842, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 62.0, | |
| "completions/mean_length": 11.4375, | |
| "completions/min_length": 2.0, | |
| "epoch": 0.0997229916897507, | |
| "grad_norm": 4.1929387792795065, | |
| "kl": 2.5014250652166083, | |
| "learning_rate": 0.0002, | |
| "loss": 0.016260012984275818, | |
| "memory(GiB)": 79.98, | |
| "reward": 0.2734375, | |
| "reward_std": 0.8412302732467651, | |
| "rewards/Response_no_think_reward/mean": 0.2734375, | |
| "rewards/Response_no_think_reward/std": 1.384474277496338, | |
| "step": 9, | |
| "train_speed(iter/s)": 0.001887 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.02779325417941436, | |
| "clip_ratio/high_mean": 0.02779325417941436, | |
| "clip_ratio/low_mean": 0.07855538238072768, | |
| "clip_ratio/low_min": 0.07855538238072768, | |
| "clip_ratio/region_mean": 0.10634863609448075, | |
| "epoch": 0.11080332409972299, | |
| "grad_norm": 990.7609804346584, | |
| "kl": 1.6530181597918272, | |
| "learning_rate": 0.00019998312416333227, | |
| "loss": 1.336751103401184, | |
| "memory(GiB)": 79.98, | |
| "step": 10, | |
| "train_speed(iter/s)": 0.002015 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.001354054023977369, | |
| "clip_ratio/high_mean": 0.001354054023977369, | |
| "clip_ratio/low_mean": 0.004174399145995267, | |
| "clip_ratio/low_min": 0.004174399145995267, | |
| "clip_ratio/region_mean": 0.005528453169972636, | |
| "completions/clipped_ratio": 0.0546875, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 26.453125, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.12188365650969529, | |
| "grad_norm": 1.115304569915306, | |
| "kl": 0.3547552889212966, | |
| "learning_rate": 0.00019993250234920636, | |
| "loss": 0.005897670052945614, | |
| "memory(GiB)": 79.98, | |
| "reward": 0.5234375, | |
| "reward_std": 0.876558780670166, | |
| "rewards/Response_no_think_reward/mean": 0.5234375, | |
| "rewards/Response_no_think_reward/std": 1.4251114130020142, | |
| "step": 11, | |
| "train_speed(iter/s)": 0.001964 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.02347446102066897, | |
| "clip_ratio/high_mean": 0.02347446102066897, | |
| "clip_ratio/low_mean": 0.0428259114123648, | |
| "clip_ratio/low_min": 0.0428259114123648, | |
| "clip_ratio/region_mean": 0.06630037224385887, | |
| "epoch": 0.1329639889196676, | |
| "grad_norm": 2.183295109715178, | |
| "kl": 0.6218942860141397, | |
| "learning_rate": 0.00019984815164333163, | |
| "loss": 0.007074224762618542, | |
| "memory(GiB)": 79.98, | |
| "step": 12, | |
| "train_speed(iter/s)": 0.00207 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.001206563669256866, | |
| "clip_ratio/low_min": 0.001206563669256866, | |
| "clip_ratio/region_mean": 0.001206563669256866, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 83.0, | |
| "completions/mean_length": 14.0234375, | |
| "completions/min_length": 4.0, | |
| "epoch": 0.1440443213296399, | |
| "grad_norm": 1.0424369292135751, | |
| "kl": 0.40942037590866676, | |
| "learning_rate": 0.00019973010051548275, | |
| "loss": 0.004908258095383644, | |
| "memory(GiB)": 79.98, | |
| "reward": 0.5625, | |
| "reward_std": 0.7038782835006714, | |
| "rewards/Response_no_think_reward/mean": 0.5625, | |
| "rewards/Response_no_think_reward/std": 1.2720495462417603, | |
| "step": 13, | |
| "train_speed(iter/s)": 0.002042 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.017414433998055756, | |
| "clip_ratio/high_mean": 0.017414433998055756, | |
| "clip_ratio/low_mean": 0.028266766399610788, | |
| "clip_ratio/low_min": 0.028266766399610788, | |
| "clip_ratio/region_mean": 0.04568120092153549, | |
| "epoch": 0.15512465373961218, | |
| "grad_norm": 0.650161789807741, | |
| "kl": 0.4890678570009186, | |
| "learning_rate": 0.00019957838880989078, | |
| "loss": -0.0075666941702365875, | |
| "memory(GiB)": 79.98, | |
| "step": 14, | |
| "train_speed(iter/s)": 0.002135 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0018629207770572975, | |
| "clip_ratio/high_mean": 0.0018629207770572975, | |
| "clip_ratio/low_mean": 0.0069178942940197885, | |
| "clip_ratio/low_min": 0.0069178942940197885, | |
| "clip_ratio/region_mean": 0.00878081505652517, | |
| "completions/clipped_ratio": 0.0078125, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 17.1953125, | |
| "completions/min_length": 4.0, | |
| "epoch": 0.16620498614958448, | |
| "grad_norm": 2.2362713456466605, | |
| "kl": 0.23374600778333843, | |
| "learning_rate": 0.00019939306773179497, | |
| "loss": 0.0009349192259833217, | |
| "memory(GiB)": 79.98, | |
| "reward": 0.6875, | |
| "reward_std": 0.8529120683670044, | |
| "rewards/Response_no_think_reward/mean": 0.6875, | |
| "rewards/Response_no_think_reward/std": 1.3265905380249023, | |
| "step": 15, | |
| "train_speed(iter/s)": 0.002091 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.03511151310522109, | |
| "clip_ratio/high_mean": 0.03511151310522109, | |
| "clip_ratio/low_mean": 0.028677020454779267, | |
| "clip_ratio/low_min": 0.028677020454779267, | |
| "clip_ratio/region_mean": 0.06378853344358504, | |
| "epoch": 0.1772853185595568, | |
| "grad_norm": 3.3548685452904934, | |
| "kl": 0.25148704896855634, | |
| "learning_rate": 0.00019917419983016025, | |
| "loss": 0.017475975677371025, | |
| "memory(GiB)": 79.98, | |
| "step": 16, | |
| "train_speed(iter/s)": 0.002171 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.000469924823846668, | |
| "clip_ratio/high_mean": 0.000469924823846668, | |
| "clip_ratio/low_mean": 0.0014688223309349269, | |
| "clip_ratio/low_min": 0.0014688223309349269, | |
| "clip_ratio/region_mean": 0.0019387471547815949, | |
| "completions/clipped_ratio": 0.0078125, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 18.2265625, | |
| "completions/min_length": 6.0, | |
| "epoch": 0.1883656509695291, | |
| "grad_norm": 0.6996032916694407, | |
| "kl": 0.138063008276049, | |
| "learning_rate": 0.00019892185897656578, | |
| "loss": 0.0021217623725533485, | |
| "memory(GiB)": 79.98, | |
| "reward": 0.5, | |
| "reward_std": 0.5098158717155457, | |
| "rewards/Response_no_think_reward/mean": 0.5, | |
| "rewards/Response_no_think_reward/std": 1.4086347818374634, | |
| "step": 17, | |
| "train_speed(iter/s)": 0.002127 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.01048101403284818, | |
| "clip_ratio/high_mean": 0.01048101403284818, | |
| "clip_ratio/low_mean": 0.028478411200921983, | |
| "clip_ratio/low_min": 0.028478411200921983, | |
| "clip_ratio/region_mean": 0.03895942587405443, | |
| "epoch": 0.1994459833795014, | |
| "grad_norm": 0.7437416506383379, | |
| "kl": 0.2438321103884391, | |
| "learning_rate": 0.00019863613034027224, | |
| "loss": -0.007616878021508455, | |
| "memory(GiB)": 79.98, | |
| "step": 18, | |
| "train_speed(iter/s)": 0.002199 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0009733444603625685, | |
| "clip_ratio/low_min": 0.0009733444603625685, | |
| "clip_ratio/region_mean": 0.0009733444603625685, | |
| "completions/clipped_ratio": 0.0078125, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 20.703125, | |
| "completions/min_length": 6.0, | |
| "epoch": 0.21052631578947367, | |
| "grad_norm": 0.8303775863701255, | |
| "kl": 0.09481111937202513, | |
| "learning_rate": 0.0001983171103594755, | |
| "loss": 0.0022672354243695736, | |
| "memory(GiB)": 79.98, | |
| "reward": -0.078125, | |
| "reward_std": 0.6301807761192322, | |
| "rewards/Response_no_think_reward/mean": -0.078125, | |
| "rewards/Response_no_think_reward/std": 1.3666982650756836, | |
| "step": 19, | |
| "train_speed(iter/s)": 0.002152 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.007191620621597394, | |
| "clip_ratio/high_mean": 0.007191620621597394, | |
| "clip_ratio/low_mean": 0.03550086636096239, | |
| "clip_ratio/low_min": 0.03550086636096239, | |
| "clip_ratio/region_mean": 0.0426924874773249, | |
| "epoch": 0.22160664819944598, | |
| "grad_norm": 1.7213808531720889, | |
| "kl": 1.6638920252444223, | |
| "learning_rate": 0.0001979649067087574, | |
| "loss": 0.006861768197268248, | |
| "memory(GiB)": 79.98, | |
| "step": 20, | |
| "train_speed(iter/s)": 0.002217 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0004032258002553135, | |
| "clip_ratio/high_mean": 0.0004032258002553135, | |
| "clip_ratio/low_mean": 0.003614576125983149, | |
| "clip_ratio/low_min": 0.003614576125983149, | |
| "clip_ratio/region_mean": 0.004017801926238462, | |
| "completions/clipped_ratio": 0.0078125, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 17.390625, | |
| "completions/min_length": 6.0, | |
| "epoch": 0.23268698060941828, | |
| "grad_norm": 1.5808946015405074, | |
| "kl": 0.1687323283404112, | |
| "learning_rate": 0.00019757963826274357, | |
| "loss": 0.003855248913168907, | |
| "memory(GiB)": 79.98, | |
| "reward": 0.5546875, | |
| "reward_std": 0.8033354878425598, | |
| "rewards/Response_no_think_reward/mean": 0.5546875, | |
| "rewards/Response_no_think_reward/std": 1.3328590393066406, | |
| "step": 21, | |
| "train_speed(iter/s)": 0.002189 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.012200821249280125, | |
| "clip_ratio/high_mean": 0.012200821249280125, | |
| "clip_ratio/low_mean": 0.04007338697556406, | |
| "clip_ratio/low_min": 0.04007338697556406, | |
| "clip_ratio/region_mean": 0.05227420857409015, | |
| "epoch": 0.24376731301939059, | |
| "grad_norm": 0.8850881940917656, | |
| "kl": 0.48105100472457707, | |
| "learning_rate": 0.0001971614350559814, | |
| "loss": -0.004205920733511448, | |
| "memory(GiB)": 79.98, | |
| "step": 22, | |
| "train_speed(iter/s)": 0.002248 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0008194574620574713, | |
| "clip_ratio/high_mean": 0.0008194574620574713, | |
| "clip_ratio/low_mean": 0.000811688310932368, | |
| "clip_ratio/low_min": 0.000811688310932368, | |
| "clip_ratio/region_mean": 0.0016311457729898393, | |
| "completions/clipped_ratio": 0.0078125, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 15.28125, | |
| "completions/min_length": 6.0, | |
| "epoch": 0.2548476454293629, | |
| "grad_norm": 0.6954813297644332, | |
| "kl": 0.11993603070732206, | |
| "learning_rate": 0.0001967104382390511, | |
| "loss": 0.001324990182183683, | |
| "memory(GiB)": 79.98, | |
| "reward": 0.78125, | |
| "reward_std": 0.5077463984489441, | |
| "rewards/Response_no_think_reward/mean": 0.78125, | |
| "rewards/Response_no_think_reward/std": 1.3970582485198975, | |
| "step": 23, | |
| "train_speed(iter/s)": 0.002219 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.014543175988364965, | |
| "clip_ratio/high_mean": 0.014543175988364965, | |
| "clip_ratio/low_mean": 0.027941336738877, | |
| "clip_ratio/low_min": 0.027941336738877, | |
| "clip_ratio/region_mean": 0.04248451231978834, | |
| "epoch": 0.2659279778393352, | |
| "grad_norm": 0.46891914008721675, | |
| "kl": 0.11759324668673798, | |
| "learning_rate": 0.00019622680003092503, | |
| "loss": -0.009693928062915802, | |
| "memory(GiB)": 79.98, | |
| "step": 24, | |
| "train_speed(iter/s)": 0.002273 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0006530559621751308, | |
| "clip_ratio/high_mean": 0.0006530559621751308, | |
| "clip_ratio/low_mean": 0.0019866162620019168, | |
| "clip_ratio/low_min": 0.0019866162620019168, | |
| "clip_ratio/region_mean": 0.002639672253280878, | |
| "completions/clipped_ratio": 0.0078125, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 12.9609375, | |
| "completions/min_length": 4.0, | |
| "epoch": 0.2770083102493075, | |
| "grad_norm": 1.333182473379268, | |
| "kl": 0.22027045290451497, | |
| "learning_rate": 0.00019571068366759143, | |
| "loss": 0.0026610023342072964, | |
| "memory(GiB)": 79.98, | |
| "reward": 0.4765625, | |
| "reward_std": 0.8257243633270264, | |
| "rewards/Response_no_think_reward/mean": 0.4765625, | |
| "rewards/Response_no_think_reward/std": 1.3219220638275146, | |
| "step": 25, | |
| "train_speed(iter/s)": 0.002248 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.02311275008833036, | |
| "clip_ratio/high_mean": 0.02311275008833036, | |
| "clip_ratio/low_mean": 0.03803046100074425, | |
| "clip_ratio/low_min": 0.03803046100074425, | |
| "clip_ratio/region_mean": 0.06114321056520566, | |
| "epoch": 0.2880886426592798, | |
| "grad_norm": 0.7053648057917502, | |
| "kl": 0.2949459235333052, | |
| "learning_rate": 0.0001951622633469592, | |
| "loss": -0.015641074627637863, | |
| "memory(GiB)": 79.98, | |
| "step": 26, | |
| "train_speed(iter/s)": 0.002297 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0004111842135898769, | |
| "clip_ratio/high_mean": 0.0004111842135898769, | |
| "clip_ratio/low_mean": 0.0027908546617254615, | |
| "clip_ratio/low_min": 0.0027908546617254615, | |
| "clip_ratio/region_mean": 0.0032020388753153384, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 85.0, | |
| "completions/mean_length": 16.875, | |
| "completions/min_length": 4.0, | |
| "epoch": 0.29916897506925205, | |
| "grad_norm": 1.544635006921068, | |
| "kl": 0.20233443519100547, | |
| "learning_rate": 0.00019458172417006347, | |
| "loss": 0.0030936466064304113, | |
| "memory(GiB)": 79.98, | |
| "reward": 0.6875, | |
| "reward_std": 0.9086803197860718, | |
| "rewards/Response_no_think_reward/mean": 0.6875, | |
| "rewards/Response_no_think_reward/std": 1.3265905380249023, | |
| "step": 27, | |
| "train_speed(iter/s)": 0.002272 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.03639351949095726, | |
| "clip_ratio/high_mean": 0.03639351949095726, | |
| "clip_ratio/low_mean": 0.024818695266731083, | |
| "clip_ratio/low_min": 0.024818695266731083, | |
| "clip_ratio/region_mean": 0.06121221440844238, | |
| "epoch": 0.31024930747922436, | |
| "grad_norm": 2.0012174050572105, | |
| "kl": 0.24312824057415128, | |
| "learning_rate": 0.00019396926207859084, | |
| "loss": -0.008060472086071968, | |
| "memory(GiB)": 79.98, | |
| "step": 28, | |
| "train_speed(iter/s)": 0.002319 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0007382866751868278, | |
| "clip_ratio/high_mean": 0.0007382866751868278, | |
| "clip_ratio/low_mean": 0.0024169938114937395, | |
| "clip_ratio/low_min": 0.0024169938114937395, | |
| "clip_ratio/region_mean": 0.0031552804866805673, | |
| "completions/clipped_ratio": 0.0234375, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 23.4140625, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.32132963988919666, | |
| "grad_norm": 1.0333627248580772, | |
| "kl": 0.19911292963661253, | |
| "learning_rate": 0.0001933250837887457, | |
| "loss": 0.004103388637304306, | |
| "memory(GiB)": 79.98, | |
| "reward": 0.6640625, | |
| "reward_std": 0.7995060086250305, | |
| "rewards/Response_no_think_reward/mean": 0.6640625, | |
| "rewards/Response_no_think_reward/std": 1.4323447942733765, | |
| "step": 29, | |
| "train_speed(iter/s)": 0.002285 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.021052728639915586, | |
| "clip_ratio/high_mean": 0.021052728639915586, | |
| "clip_ratio/low_mean": 0.03886253567179665, | |
| "clip_ratio/low_min": 0.03886253567179665, | |
| "clip_ratio/region_mean": 0.05991526402067393, | |
| "epoch": 0.33240997229916897, | |
| "grad_norm": 0.4744156832935017, | |
| "kl": 0.2653088476508856, | |
| "learning_rate": 0.00019264940672148018, | |
| "loss": -0.014724130742251873, | |
| "memory(GiB)": 79.98, | |
| "step": 30, | |
| "train_speed(iter/s)": 0.002328 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0008336337341461331, | |
| "clip_ratio/high_mean": 0.0008336337341461331, | |
| "clip_ratio/low_mean": 0.0028033541166223586, | |
| "clip_ratio/low_min": 0.0028033541166223586, | |
| "clip_ratio/region_mean": 0.0036369878507684916, | |
| "completions/clipped_ratio": 0.0078125, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 17.8125, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.34349030470914127, | |
| "grad_norm": 1.3971369328491496, | |
| "kl": 0.3057649952825159, | |
| "learning_rate": 0.0001919424589291108, | |
| "loss": 0.0056169466115534306, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.4296875, | |
| "reward_std": 0.8740850687026978, | |
| "rewards/Response_no_think_reward/mean": 0.4296875, | |
| "rewards/Response_no_think_reward/std": 1.3555577993392944, | |
| "step": 31, | |
| "train_speed(iter/s)": 0.002304 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.013716876972466707, | |
| "clip_ratio/high_mean": 0.013716876972466707, | |
| "clip_ratio/low_mean": 0.05669466912513599, | |
| "clip_ratio/low_min": 0.05669466912513599, | |
| "clip_ratio/region_mean": 0.07041154580656439, | |
| "epoch": 0.3545706371191136, | |
| "grad_norm": 0.7437646652660285, | |
| "kl": 0.3698675720952451, | |
| "learning_rate": 0.00019120447901834706, | |
| "loss": -0.013283709064126015, | |
| "memory(GiB)": 80.03, | |
| "step": 32, | |
| "train_speed(iter/s)": 0.002345 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0013764221512246877, | |
| "clip_ratio/high_mean": 0.0013764221512246877, | |
| "clip_ratio/low_mean": 0.0013627433363581076, | |
| "clip_ratio/low_min": 0.0013627433363581076, | |
| "clip_ratio/region_mean": 0.0027391654875827953, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 24.609375, | |
| "completions/min_length": 4.0, | |
| "epoch": 0.3656509695290859, | |
| "grad_norm": 0.8795930368140337, | |
| "kl": 0.22658177139237523, | |
| "learning_rate": 0.00019043571606975777, | |
| "loss": 0.0019196830689907074, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.4140625, | |
| "reward_std": 0.8300054669380188, | |
| "rewards/Response_no_think_reward/mean": 0.4140625, | |
| "rewards/Response_no_think_reward/std": 1.258216142654419, | |
| "step": 33, | |
| "train_speed(iter/s)": 0.002323 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.016442283987998962, | |
| "clip_ratio/high_mean": 0.016442283987998962, | |
| "clip_ratio/low_mean": 0.05633212422253564, | |
| "clip_ratio/low_min": 0.05633212422253564, | |
| "clip_ratio/region_mean": 0.07277440826874226, | |
| "epoch": 0.3767313019390582, | |
| "grad_norm": 0.5188690402432328, | |
| "kl": 0.23683911142870784, | |
| "learning_rate": 0.00018963642955370201, | |
| "loss": -0.016352392733097076, | |
| "memory(GiB)": 80.03, | |
| "step": 34, | |
| "train_speed(iter/s)": 0.002362 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0025397460121894255, | |
| "clip_ratio/high_mean": 0.0025397460121894255, | |
| "clip_ratio/low_mean": 0.00378477135382127, | |
| "clip_ratio/low_min": 0.00378477135382127, | |
| "clip_ratio/region_mean": 0.006324517366010696, | |
| "completions/clipped_ratio": 0.015625, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 23.375, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.3878116343490305, | |
| "grad_norm": 0.7751350107093148, | |
| "kl": 0.21053988160565495, | |
| "learning_rate": 0.00018880688924275378, | |
| "loss": 0.001979985274374485, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.25, | |
| "reward_std": 0.8051205277442932, | |
| "rewards/Response_no_think_reward/mean": 0.25, | |
| "rewards/Response_no_think_reward/std": 1.3101662397384644, | |
| "step": 35, | |
| "train_speed(iter/s)": 0.00234 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.02383261898648925, | |
| "clip_ratio/high_mean": 0.02383261898648925, | |
| "clip_ratio/low_mean": 0.02296329999808222, | |
| "clip_ratio/low_min": 0.02296329999808222, | |
| "clip_ratio/region_mean": 0.046795917907729745, | |
| "epoch": 0.3988919667590028, | |
| "grad_norm": 0.6919043847160915, | |
| "kl": 0.2092050458304584, | |
| "learning_rate": 0.0001879473751206489, | |
| "loss": -0.016633104532957077, | |
| "memory(GiB)": 80.03, | |
| "step": 36, | |
| "train_speed(iter/s)": 0.002376 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0003396739193703979, | |
| "clip_ratio/low_min": 0.0003396739193703979, | |
| "clip_ratio/region_mean": 0.0003396739193703979, | |
| "completions/clipped_ratio": 0.0078125, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 16.8828125, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.4099722991689751, | |
| "grad_norm": 1.0548464052821087, | |
| "kl": 0.20961805986007676, | |
| "learning_rate": 0.00018705817728778624, | |
| "loss": 0.003657686058431864, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.953125, | |
| "reward_std": 0.6187193393707275, | |
| "rewards/Response_no_think_reward/mean": 0.953125, | |
| "rewards/Response_no_think_reward/std": 1.1961840391159058, | |
| "step": 37, | |
| "train_speed(iter/s)": 0.002358 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.02387295541120693, | |
| "clip_ratio/high_mean": 0.02387295541120693, | |
| "clip_ratio/low_mean": 0.030282753868959844, | |
| "clip_ratio/low_min": 0.030282753868959844, | |
| "clip_ratio/region_mean": 0.05415570852346718, | |
| "epoch": 0.42105263157894735, | |
| "grad_norm": 0.49371052672691246, | |
| "kl": 0.24616074899677187, | |
| "learning_rate": 0.00018613959586331362, | |
| "loss": -0.012075964361429214, | |
| "memory(GiB)": 80.03, | |
| "step": 38, | |
| "train_speed(iter/s)": 0.002393 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0013275333330966532, | |
| "clip_ratio/high_mean": 0.0013275333330966532, | |
| "clip_ratio/low_mean": 0.0013904034567531198, | |
| "clip_ratio/low_min": 0.0013904034567531198, | |
| "clip_ratio/region_mean": 0.002717936789849773, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 21.6015625, | |
| "completions/min_length": 4.0, | |
| "epoch": 0.43213296398891965, | |
| "grad_norm": 0.972842541028031, | |
| "kl": 0.16011726018041372, | |
| "learning_rate": 0.00018519194088383273, | |
| "loss": 0.001440724590793252, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.625, | |
| "reward_std": 0.6670520305633545, | |
| "rewards/Response_no_think_reward/mean": 0.625, | |
| "rewards/Response_no_think_reward/std": 1.3457428216934204, | |
| "step": 39, | |
| "train_speed(iter/s)": 0.002371 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.03226059180451557, | |
| "clip_ratio/high_mean": 0.03226059180451557, | |
| "clip_ratio/low_mean": 0.03314233338460326, | |
| "clip_ratio/low_min": 0.03314233338460326, | |
| "clip_ratio/region_mean": 0.0654029252473265, | |
| "epoch": 0.44321329639889195, | |
| "grad_norm": 0.5253408277855696, | |
| "kl": 0.18682625680230558, | |
| "learning_rate": 0.00018421553219875658, | |
| "loss": -0.013099671341478825, | |
| "memory(GiB)": 80.03, | |
| "step": 40, | |
| "train_speed(iter/s)": 0.002404 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00029620854184031487, | |
| "clip_ratio/high_mean": 0.00029620854184031487, | |
| "clip_ratio/low_mean": 0.0009311849280493334, | |
| "clip_ratio/low_min": 0.0009311849280493334, | |
| "clip_ratio/region_mean": 0.0012273934698896483, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 88.0, | |
| "completions/mean_length": 17.5625, | |
| "completions/min_length": 5.0, | |
| "epoch": 0.45429362880886426, | |
| "grad_norm": 1.2919745010410586, | |
| "kl": 0.2366366102360189, | |
| "learning_rate": 0.00018321069936235503, | |
| "loss": 0.001985038397833705, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.859375, | |
| "reward_std": 0.6107450723648071, | |
| "rewards/Response_no_think_reward/mean": 0.859375, | |
| "rewards/Response_no_think_reward/std": 1.4071491956710815, | |
| "step": 41, | |
| "train_speed(iter/s)": 0.002379 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.01783788768807426, | |
| "clip_ratio/high_mean": 0.01783788768807426, | |
| "clip_ratio/low_mean": 0.044289187353570014, | |
| "clip_ratio/low_min": 0.044289187353570014, | |
| "clip_ratio/region_mean": 0.06212707597296685, | |
| "epoch": 0.46537396121883656, | |
| "grad_norm": 1.7719321167278534, | |
| "kl": 0.6719344789162278, | |
| "learning_rate": 0.0001821777815225245, | |
| "loss": -0.008167732506990433, | |
| "memory(GiB)": 80.03, | |
| "step": 42, | |
| "train_speed(iter/s)": 0.00241 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00036231885314919055, | |
| "clip_ratio/high_mean": 0.00036231885314919055, | |
| "clip_ratio/low_mean": 0.002238474931800738, | |
| "clip_ratio/low_min": 0.002238474931800738, | |
| "clip_ratio/region_mean": 0.0026007937849499285, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 97.0, | |
| "completions/mean_length": 15.875, | |
| "completions/min_length": 6.0, | |
| "epoch": 0.47645429362880887, | |
| "grad_norm": 1.1682612472028975, | |
| "kl": 0.2416230053640902, | |
| "learning_rate": 0.00018111712730632022, | |
| "loss": 0.0018095734994858503, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.0859375, | |
| "reward_std": 0.39637458324432373, | |
| "rewards/Response_no_think_reward/mean": 0.0859375, | |
| "rewards/Response_no_think_reward/std": 0.9962713122367859, | |
| "step": 43, | |
| "train_speed(iter/s)": 0.002397 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.007687599485507235, | |
| "clip_ratio/high_mean": 0.007687599485507235, | |
| "clip_ratio/low_mean": 0.042899149731965736, | |
| "clip_ratio/low_min": 0.042899149731965736, | |
| "clip_ratio/region_mean": 0.05058674863539636, | |
| "epoch": 0.48753462603878117, | |
| "grad_norm": 17.524605028595435, | |
| "kl": 15.062655651359819, | |
| "learning_rate": 0.00018002909470228842, | |
| "loss": 0.09481670707464218, | |
| "memory(GiB)": 80.03, | |
| "step": 44, | |
| "train_speed(iter/s)": 0.002427 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0012922932510264218, | |
| "clip_ratio/high_mean": 0.0012922932510264218, | |
| "clip_ratio/low_mean": 0.002554390055593103, | |
| "clip_ratio/low_min": 0.002554390055593103, | |
| "clip_ratio/region_mean": 0.003846683306619525, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 32.0, | |
| "completions/mean_length": 8.546875, | |
| "completions/min_length": 4.0, | |
| "epoch": 0.4986149584487535, | |
| "grad_norm": 1.474323820635427, | |
| "kl": 0.7951482257340103, | |
| "learning_rate": 0.00017891405093963938, | |
| "loss": 0.008442065678536892, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.171875, | |
| "reward_std": 0.540536105632782, | |
| "rewards/Response_no_think_reward/mean": 0.171875, | |
| "rewards/Response_no_think_reward/std": 0.9648089408874512, | |
| "step": 45, | |
| "train_speed(iter/s)": 0.002416 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.01782548933988437, | |
| "clip_ratio/high_mean": 0.01782548933988437, | |
| "clip_ratio/low_mean": 0.04517949424916878, | |
| "clip_ratio/low_min": 0.04517949424916878, | |
| "clip_ratio/region_mean": 0.06300498393829912, | |
| "epoch": 0.5096952908587258, | |
| "grad_norm": 23.18489815639863, | |
| "kl": 20.399557466851547, | |
| "learning_rate": 0.0001777723723643014, | |
| "loss": 0.15100935101509094, | |
| "memory(GiB)": 80.03, | |
| "step": 46, | |
| "train_speed(iter/s)": 0.002445 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0001338329748250544, | |
| "clip_ratio/high_mean": 0.0001338329748250544, | |
| "clip_ratio/low_mean": 0.0020056332577951252, | |
| "clip_ratio/low_min": 0.0020056332577951252, | |
| "clip_ratio/region_mean": 0.0021394662326201797, | |
| "completions/clipped_ratio": 0.015625, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 11.8203125, | |
| "completions/min_length": 4.0, | |
| "epoch": 0.5207756232686981, | |
| "grad_norm": 1.9101810703272282, | |
| "kl": 0.8325624349527061, | |
| "learning_rate": 0.0001766044443118978, | |
| "loss": 0.01317879930138588, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.21875, | |
| "reward_std": 0.5618736743927002, | |
| "rewards/Response_no_think_reward/mean": 0.21875, | |
| "rewards/Response_no_think_reward/std": 0.9301384091377258, | |
| "step": 47, | |
| "train_speed(iter/s)": 0.002435 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.01570215745596215, | |
| "clip_ratio/high_mean": 0.01570215745596215, | |
| "clip_ratio/low_mean": 0.01864259922876954, | |
| "clip_ratio/low_min": 0.01864259922876954, | |
| "clip_ratio/region_mean": 0.03434475651010871, | |
| "epoch": 0.5318559556786704, | |
| "grad_norm": 5.211743253538076, | |
| "kl": 0.4838231955654919, | |
| "learning_rate": 0.00017541066097768963, | |
| "loss": 0.03044246882200241, | |
| "memory(GiB)": 80.03, | |
| "step": 48, | |
| "train_speed(iter/s)": 0.002462 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.002905012297560461, | |
| "clip_ratio/low_min": 0.002905012297560461, | |
| "clip_ratio/region_mean": 0.002905012297560461, | |
| "completions/clipped_ratio": 0.0390625, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 17.7265625, | |
| "completions/min_length": 4.0, | |
| "epoch": 0.5429362880886427, | |
| "grad_norm": 0.9459153229739418, | |
| "kl": 0.33009129445417784, | |
| "learning_rate": 0.00017419142528352817, | |
| "loss": 0.004404420033097267, | |
| "memory(GiB)": 80.03, | |
| "reward": -0.0859375, | |
| "reward_std": 0.547653079032898, | |
| "rewards/Response_no_think_reward/mean": -0.0859375, | |
| "rewards/Response_no_think_reward/std": 0.9138250946998596, | |
| "step": 49, | |
| "train_speed(iter/s)": 0.002452 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00849696435034275, | |
| "clip_ratio/high_mean": 0.00849696435034275, | |
| "clip_ratio/low_mean": 0.059440263896249235, | |
| "clip_ratio/low_min": 0.059440263896249235, | |
| "clip_ratio/region_mean": 0.06793722766451538, | |
| "epoch": 0.554016620498615, | |
| "grad_norm": 1.5192885268898135, | |
| "kl": 0.5284001431518845, | |
| "learning_rate": 0.0001729471487418621, | |
| "loss": -0.012666964903473854, | |
| "memory(GiB)": 80.03, | |
| "step": 50, | |
| "train_speed(iter/s)": 0.002478 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0012755101779475808, | |
| "clip_ratio/low_min": 0.0012755101779475808, | |
| "clip_ratio/region_mean": 0.0012755101779475808, | |
| "completions/clipped_ratio": 0.0078125, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 12.640625, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.5650969529085873, | |
| "grad_norm": 1.7932835802898264, | |
| "kl": 0.582448753528297, | |
| "learning_rate": 0.00017167825131684513, | |
| "loss": 0.008432275615632534, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.15625, | |
| "reward_std": 0.7085258960723877, | |
| "rewards/Response_no_think_reward/mean": 0.15625, | |
| "rewards/Response_no_think_reward/std": 1.0228685140609741, | |
| "step": 51, | |
| "train_speed(iter/s)": 0.002465 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.006597792147658765, | |
| "clip_ratio/high_mean": 0.006597792147658765, | |
| "clip_ratio/low_mean": 0.049801092012785375, | |
| "clip_ratio/low_min": 0.049801092012785375, | |
| "clip_ratio/region_mean": 0.05639888462610543, | |
| "epoch": 0.5761772853185596, | |
| "grad_norm": 0.8422307837338449, | |
| "kl": 0.7035694038495421, | |
| "learning_rate": 0.00017038516128259115, | |
| "loss": -0.011608053930103779, | |
| "memory(GiB)": 80.03, | |
| "step": 52, | |
| "train_speed(iter/s)": 0.00249 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0005558648990700021, | |
| "clip_ratio/low_min": 0.0005558648990700021, | |
| "clip_ratio/region_mean": 0.0005558648990700021, | |
| "completions/clipped_ratio": 0.015625, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 12.5, | |
| "completions/min_length": 4.0, | |
| "epoch": 0.5872576177285319, | |
| "grad_norm": 1.0211580850819229, | |
| "kl": 0.7616109761074767, | |
| "learning_rate": 0.00016906831507862443, | |
| "loss": 0.005634145811200142, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.1640625, | |
| "reward_std": 0.70704185962677, | |
| "rewards/Response_no_think_reward/mean": 0.1640625, | |
| "rewards/Response_no_think_reward/std": 0.9702450633049011, | |
| "step": 53, | |
| "train_speed(iter/s)": 0.002477 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.02744574609096162, | |
| "clip_ratio/high_mean": 0.02744574609096162, | |
| "clip_ratio/low_mean": 0.04221567645436153, | |
| "clip_ratio/low_min": 0.04221567645436153, | |
| "clip_ratio/region_mean": 0.06966142146848142, | |
| "epoch": 0.5983379501385041, | |
| "grad_norm": 0.5808426269905869, | |
| "kl": 0.801087921798171, | |
| "learning_rate": 0.00016772815716257412, | |
| "loss": -0.01366308145225048, | |
| "memory(GiB)": 80.03, | |
| "step": 54, | |
| "train_speed(iter/s)": 0.002502 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0003881987649947405, | |
| "clip_ratio/high_mean": 0.0003881987649947405, | |
| "clip_ratio/low_mean": 0.001932911021867767, | |
| "clip_ratio/low_min": 0.001932911021867767, | |
| "clip_ratio/region_mean": 0.0023211097868625075, | |
| "completions/clipped_ratio": 0.0390625, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 18.9921875, | |
| "completions/min_length": 6.0, | |
| "epoch": 0.6094182825484764, | |
| "grad_norm": 1.1265096543789663, | |
| "kl": 0.5226203491911292, | |
| "learning_rate": 0.00016636513986016213, | |
| "loss": 0.007094700820744038, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.1875, | |
| "reward_std": 0.7182328104972839, | |
| "rewards/Response_no_think_reward/mean": 0.1875, | |
| "rewards/Response_no_think_reward/std": 1.0480577945709229, | |
| "step": 55, | |
| "train_speed(iter/s)": 0.00249 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.011908911721548066, | |
| "clip_ratio/high_mean": 0.011908911721548066, | |
| "clip_ratio/low_mean": 0.05817525731981732, | |
| "clip_ratio/low_min": 0.05817525731981732, | |
| "clip_ratio/region_mean": 0.07008416869211942, | |
| "epoch": 0.6204986149584487, | |
| "grad_norm": 0.5560920258062684, | |
| "kl": 0.5747523186728358, | |
| "learning_rate": 0.000164979723212536, | |
| "loss": -0.014954826794564724, | |
| "memory(GiB)": 80.03, | |
| "step": 56, | |
| "train_speed(iter/s)": 0.002513 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.002692167239729315, | |
| "clip_ratio/high_mean": 0.002692167239729315, | |
| "clip_ratio/low_mean": 0.0006428283377317712, | |
| "clip_ratio/low_min": 0.0006428283377317712, | |
| "clip_ratio/region_mean": 0.003334995577461086, | |
| "completions/clipped_ratio": 0.0390625, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 16.53125, | |
| "completions/min_length": 6.0, | |
| "epoch": 0.631578947368421, | |
| "grad_norm": 1.5596809103877662, | |
| "kl": 0.6855434570461512, | |
| "learning_rate": 0.00016357237482099684, | |
| "loss": 0.0062956069596111774, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.53125, | |
| "reward_std": 0.5907745361328125, | |
| "rewards/Response_no_think_reward/mean": 0.53125, | |
| "rewards/Response_no_think_reward/std": 1.0790598392486572, | |
| "step": 57, | |
| "train_speed(iter/s)": 0.002501 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0316368987550959, | |
| "clip_ratio/high_mean": 0.0316368987550959, | |
| "clip_ratio/low_mean": 0.015557856269879267, | |
| "clip_ratio/low_min": 0.015557856269879267, | |
| "clip_ratio/region_mean": 0.04719475514139049, | |
| "epoch": 0.6426592797783933, | |
| "grad_norm": 0.950735686233936, | |
| "kl": 0.5240823943167925, | |
| "learning_rate": 0.00016214356968917648, | |
| "loss": -0.015531505458056927, | |
| "memory(GiB)": 80.03, | |
| "step": 58, | |
| "train_speed(iter/s)": 0.002524 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00011467889999039471, | |
| "clip_ratio/high_mean": 0.00011467889999039471, | |
| "clip_ratio/low_mean": 0.0004376750875962898, | |
| "clip_ratio/low_min": 0.0004376750875962898, | |
| "clip_ratio/region_mean": 0.0005523539875866845, | |
| "completions/clipped_ratio": 0.078125, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 23.9140625, | |
| "completions/min_length": 6.0, | |
| "epoch": 0.6537396121883656, | |
| "grad_norm": 1.3162721482480142, | |
| "kl": 0.5214177745606321, | |
| "learning_rate": 0.00016069379006271566, | |
| "loss": 0.004921327345073223, | |
| "memory(GiB)": 80.03, | |
| "reward": -0.0625, | |
| "reward_std": 0.6303451657295227, | |
| "rewards/Response_no_think_reward/mean": -0.0625, | |
| "rewards/Response_no_think_reward/std": 1.0019665956497192, | |
| "step": 59, | |
| "train_speed(iter/s)": 0.002511 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00810479320352897, | |
| "clip_ratio/high_mean": 0.00810479320352897, | |
| "clip_ratio/low_mean": 0.05729365168372169, | |
| "clip_ratio/low_min": 0.05729365168372169, | |
| "clip_ratio/region_mean": 0.06539844395592809, | |
| "epoch": 0.6648199445983379, | |
| "grad_norm": 0.5733548474442324, | |
| "kl": 0.6363338100200053, | |
| "learning_rate": 0.00015922352526649803, | |
| "loss": -0.021113965660333633, | |
| "memory(GiB)": 80.03, | |
| "step": 60, | |
| "train_speed(iter/s)": 0.002532 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0005996339968987741, | |
| "clip_ratio/high_mean": 0.0005996339968987741, | |
| "clip_ratio/low_mean": 0.004901745676761493, | |
| "clip_ratio/low_min": 0.004901745676761493, | |
| "clip_ratio/region_mean": 0.00550137969548814, | |
| "completions/clipped_ratio": 0.0859375, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 22.375, | |
| "completions/min_length": 2.0, | |
| "epoch": 0.6759002770083102, | |
| "grad_norm": 1.887884786225259, | |
| "kl": 2.07791917472332, | |
| "learning_rate": 0.00015773327153949465, | |
| "loss": 0.008165515027940273, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.40625, | |
| "reward_std": 0.5973243117332458, | |
| "rewards/Response_no_think_reward/mean": 0.40625, | |
| "rewards/Response_no_think_reward/std": 1.186787486076355, | |
| "step": 61, | |
| "train_speed(iter/s)": 0.002506 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.017942053091246635, | |
| "clip_ratio/high_mean": 0.017942053091246635, | |
| "clip_ratio/low_mean": 0.06714771036058664, | |
| "clip_ratio/low_min": 0.06714771036058664, | |
| "clip_ratio/region_mean": 0.08508976292796433, | |
| "epoch": 0.6869806094182825, | |
| "grad_norm": 11.312330346219078, | |
| "kl": 0.5888316835043952, | |
| "learning_rate": 0.00015622353186727544, | |
| "loss": 0.04619387909770012, | |
| "memory(GiB)": 80.03, | |
| "step": 62, | |
| "train_speed(iter/s)": 0.002527 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00020032051543239504, | |
| "clip_ratio/high_mean": 0.00020032051543239504, | |
| "clip_ratio/low_mean": 0.001202335930429399, | |
| "clip_ratio/low_min": 0.001202335930429399, | |
| "clip_ratio/region_mean": 0.001402656445861794, | |
| "completions/clipped_ratio": 0.0546875, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 18.5859375, | |
| "completions/min_length": 2.0, | |
| "epoch": 0.6980609418282548, | |
| "grad_norm": 1.9804020858052087, | |
| "kl": 6.258792589243967, | |
| "learning_rate": 0.00015469481581224272, | |
| "loss": 0.014128579758107662, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.78125, | |
| "reward_std": 0.5936684608459473, | |
| "rewards/Response_no_think_reward/mean": 0.78125, | |
| "rewards/Response_no_think_reward/std": 1.235546350479126, | |
| "step": 63, | |
| "train_speed(iter/s)": 0.002486 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.020077986438991502, | |
| "clip_ratio/high_mean": 0.020077986438991502, | |
| "clip_ratio/low_mean": 0.12254823022522032, | |
| "clip_ratio/low_min": 0.12254823022522032, | |
| "clip_ratio/region_mean": 0.142626216635108, | |
| "epoch": 0.7091412742382271, | |
| "grad_norm": 1.5460664241155249, | |
| "kl": 5.241092938755173, | |
| "learning_rate": 0.0001531476393416456, | |
| "loss": -0.0033248686231672764, | |
| "memory(GiB)": 80.03, | |
| "step": 64, | |
| "train_speed(iter/s)": 0.002506 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0006774475477868691, | |
| "clip_ratio/high_mean": 0.0006774475477868691, | |
| "clip_ratio/low_mean": 0.0009178321633953601, | |
| "clip_ratio/low_min": 0.0009178321633953601, | |
| "clip_ratio/region_mean": 0.0015952797257341444, | |
| "completions/clipped_ratio": 0.0390625, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 15.1484375, | |
| "completions/min_length": 6.0, | |
| "epoch": 0.7202216066481995, | |
| "grad_norm": 1.528383760465238, | |
| "kl": 1.888367731589824, | |
| "learning_rate": 0.00015158252465343242, | |
| "loss": 0.010861902497708797, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.59375, | |
| "reward_std": 0.5738716125488281, | |
| "rewards/Response_no_think_reward/mean": 0.59375, | |
| "rewards/Response_no_think_reward/std": 1.1462881565093994, | |
| "step": 65, | |
| "train_speed(iter/s)": 0.002444 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.05604529404081404, | |
| "clip_ratio/high_mean": 0.05604529404081404, | |
| "clip_ratio/low_mean": 0.012011443439405411, | |
| "clip_ratio/low_min": 0.012011443439405411, | |
| "clip_ratio/region_mean": 0.06805673893541098, | |
| "epoch": 0.7313019390581718, | |
| "grad_norm": 0.9299498266912626, | |
| "kl": 1.0373663480422692, | |
| "learning_rate": 0.00015000000000000001, | |
| "loss": -0.001186850480735302, | |
| "memory(GiB)": 80.03, | |
| "step": 66, | |
| "train_speed(iter/s)": 0.002463 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.006279462773818523, | |
| "clip_ratio/high_mean": 0.006279462773818523, | |
| "clip_ratio/low_mean": 0.006620214961003512, | |
| "clip_ratio/low_min": 0.006620214961003512, | |
| "clip_ratio/region_mean": 0.012899677676614374, | |
| "completions/clipped_ratio": 0.0546875, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 17.5234375, | |
| "completions/min_length": 2.0, | |
| "epoch": 0.7423822714681441, | |
| "grad_norm": 3.0195311219652377, | |
| "kl": 1.4996049946639687, | |
| "learning_rate": 0.0001484005995098999, | |
| "loss": 0.0103817880153656, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.2421875, | |
| "reward_std": 0.5205168724060059, | |
| "rewards/Response_no_think_reward/mean": 0.2421875, | |
| "rewards/Response_no_think_reward/std": 1.2595843076705933, | |
| "step": 67, | |
| "train_speed(iter/s)": 0.002399 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.030079254298470914, | |
| "clip_ratio/high_mean": 0.030079254298470914, | |
| "clip_ratio/low_mean": 0.10815927106887102, | |
| "clip_ratio/low_min": 0.10815927106887102, | |
| "clip_ratio/region_mean": 0.1382385252509266, | |
| "epoch": 0.7534626038781164, | |
| "grad_norm": 7.7164901906176375, | |
| "kl": 4.463950714329258, | |
| "learning_rate": 0.0001467848630075608, | |
| "loss": 0.0073772999458014965, | |
| "memory(GiB)": 80.03, | |
| "step": 68, | |
| "train_speed(iter/s)": 0.002418 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0009369817780680023, | |
| "clip_ratio/high_mean": 0.0009369817780680023, | |
| "clip_ratio/low_mean": 0.006284750299528241, | |
| "clip_ratio/low_min": 0.006284750299528241, | |
| "clip_ratio/region_mean": 0.007221732055768371, | |
| "completions/clipped_ratio": 0.1484375, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 26.9296875, | |
| "completions/min_length": 3.0, | |
| "epoch": 0.7645429362880887, | |
| "grad_norm": 2.034534758963297, | |
| "kl": 2.321827916195616, | |
| "learning_rate": 0.00014515333583108896, | |
| "loss": 0.01671188324689865, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.5390625, | |
| "reward_std": 0.4874863028526306, | |
| "rewards/Response_no_think_reward/mean": 0.5390625, | |
| "rewards/Response_no_think_reward/std": 1.3095791339874268, | |
| "step": 69, | |
| "train_speed(iter/s)": 0.002373 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.012032406637445092, | |
| "clip_ratio/high_mean": 0.012032406637445092, | |
| "clip_ratio/low_mean": 0.11593639780767262, | |
| "clip_ratio/low_min": 0.11593639780767262, | |
| "clip_ratio/region_mean": 0.1279688044451177, | |
| "epoch": 0.775623268698061, | |
| "grad_norm": 1.497770517232466, | |
| "kl": 3.323778461664915, | |
| "learning_rate": 0.00014350656864820733, | |
| "loss": 0.0011269270908087492, | |
| "memory(GiB)": 80.03, | |
| "step": 70, | |
| "train_speed(iter/s)": 0.002392 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.000255623715929687, | |
| "clip_ratio/high_mean": 0.000255623715929687, | |
| "clip_ratio/low_mean": 0.005516766890650615, | |
| "clip_ratio/low_min": 0.005516766890650615, | |
| "clip_ratio/region_mean": 0.005772390664787963, | |
| "completions/clipped_ratio": 0.09375, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 17.25, | |
| "completions/min_length": 2.0, | |
| "epoch": 0.7867036011080333, | |
| "grad_norm": 2.3636642819394384, | |
| "kl": 2.6716066980734468, | |
| "learning_rate": 0.00014184511727039612, | |
| "loss": 0.020374953746795654, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.34375, | |
| "reward_std": 0.5405020713806152, | |
| "rewards/Response_no_think_reward/mean": 0.34375, | |
| "rewards/Response_no_think_reward/std": 1.2323558330535889, | |
| "step": 71, | |
| "train_speed(iter/s)": 0.00236 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.004156995622906834, | |
| "clip_ratio/high_mean": 0.004156995622906834, | |
| "clip_ratio/low_mean": 0.11334922257810831, | |
| "clip_ratio/low_min": 0.11334922257810831, | |
| "clip_ratio/region_mean": 0.11750621721148491, | |
| "epoch": 0.7977839335180056, | |
| "grad_norm": 1.5028809890146027, | |
| "kl": 3.652272095438093, | |
| "learning_rate": 0.00014016954246529696, | |
| "loss": 0.00900588370859623, | |
| "memory(GiB)": 80.03, | |
| "step": 72, | |
| "train_speed(iter/s)": 0.002378 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0024562697508372366, | |
| "clip_ratio/high_mean": 0.0024562697508372366, | |
| "clip_ratio/low_mean": 0.00900937442202121, | |
| "clip_ratio/low_min": 0.00900937442202121, | |
| "clip_ratio/region_mean": 0.01146564440568909, | |
| "completions/clipped_ratio": 0.1015625, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 20.9609375, | |
| "completions/min_length": 6.0, | |
| "epoch": 0.8088642659279779, | |
| "grad_norm": 1.9262088024122541, | |
| "kl": 2.068145776007441, | |
| "learning_rate": 0.00013848040976744457, | |
| "loss": 0.009554898366332054, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.7734375, | |
| "reward_std": 0.6535134315490723, | |
| "rewards/Response_no_think_reward/mean": 0.7734375, | |
| "rewards/Response_no_think_reward/std": 1.224518895149231, | |
| "step": 73, | |
| "train_speed(iter/s)": 0.002347 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.05884167249314487, | |
| "clip_ratio/high_mean": 0.05884167249314487, | |
| "clip_ratio/low_mean": 0.014398490195162594, | |
| "clip_ratio/low_min": 0.014398490195162594, | |
| "clip_ratio/region_mean": 0.0732401623390615, | |
| "epoch": 0.8199445983379502, | |
| "grad_norm": 3.7794078536832525, | |
| "kl": 1.1005137297324836, | |
| "learning_rate": 0.00013677828928738934, | |
| "loss": 0.027932219207286835, | |
| "memory(GiB)": 80.03, | |
| "step": 74, | |
| "train_speed(iter/s)": 0.002365 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0020199596765451133, | |
| "clip_ratio/high_mean": 0.0020199596765451133, | |
| "clip_ratio/low_mean": 0.009859619050985202, | |
| "clip_ratio/low_min": 0.009859619050985202, | |
| "clip_ratio/region_mean": 0.0118795787129784, | |
| "completions/clipped_ratio": 0.09375, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 19.734375, | |
| "completions/min_length": 2.0, | |
| "epoch": 0.8310249307479224, | |
| "grad_norm": 2.6931881467895598, | |
| "kl": 1.9703011065721512, | |
| "learning_rate": 0.00013506375551927547, | |
| "loss": 0.010023066774010658, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.4140625, | |
| "reward_std": 0.6804871559143066, | |
| "rewards/Response_no_think_reward/mean": 0.4140625, | |
| "rewards/Response_no_think_reward/std": 1.2005729675292969, | |
| "step": 75, | |
| "train_speed(iter/s)": 0.00233 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.004052987133036368, | |
| "clip_ratio/high_mean": 0.004052987133036368, | |
| "clip_ratio/low_mean": 0.14585177681874484, | |
| "clip_ratio/low_min": 0.14585177681874484, | |
| "clip_ratio/region_mean": 0.14990476449020207, | |
| "epoch": 0.8421052631578947, | |
| "grad_norm": 1.4459331642351634, | |
| "kl": 4.161040774546564, | |
| "learning_rate": 0.00013333738714693956, | |
| "loss": -0.005643587093800306, | |
| "memory(GiB)": 80.03, | |
| "step": 76, | |
| "train_speed(iter/s)": 0.002347 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00046641789958812296, | |
| "clip_ratio/high_mean": 0.00046641789958812296, | |
| "clip_ratio/low_mean": 0.0038580247201025486, | |
| "clip_ratio/low_min": 0.0038580247201025486, | |
| "clip_ratio/region_mean": 0.0043244426196906716, | |
| "completions/clipped_ratio": 0.0859375, | |
| "completions/max_length": 99.0, | |
| "completions/mean_length": 14.8828125, | |
| "completions/min_length": 2.0, | |
| "epoch": 0.853185595567867, | |
| "grad_norm": 2.393092790871116, | |
| "kl": 2.344057558570057, | |
| "learning_rate": 0.00013159976684859527, | |
| "loss": 0.014792806468904018, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.8046875, | |
| "reward_std": 0.515557050704956, | |
| "rewards/Response_no_think_reward/mean": 0.8046875, | |
| "rewards/Response_no_think_reward/std": 1.2862604856491089, | |
| "step": 77, | |
| "train_speed(iter/s)": 0.002292 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.005874009046237916, | |
| "clip_ratio/high_mean": 0.005874009046237916, | |
| "clip_ratio/low_mean": 0.0609364231931977, | |
| "clip_ratio/low_min": 0.0609364231931977, | |
| "clip_ratio/region_mean": 0.0668104327050969, | |
| "epoch": 0.8642659279778393, | |
| "grad_norm": 0.9235795825109938, | |
| "kl": 3.164612793829292, | |
| "learning_rate": 0.00012985148110016947, | |
| "loss": 0.001517204917035997, | |
| "memory(GiB)": 80.03, | |
| "step": 78, | |
| "train_speed(iter/s)": 0.002309 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.002277967141708359, | |
| "clip_ratio/high_mean": 0.002277967141708359, | |
| "clip_ratio/low_mean": 0.0037592062435578555, | |
| "clip_ratio/low_min": 0.0037592062435578555, | |
| "clip_ratio/region_mean": 0.006037173385266215, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 87.0, | |
| "completions/mean_length": 15.703125, | |
| "completions/min_length": 2.0, | |
| "epoch": 0.8753462603878116, | |
| "grad_norm": 1.666555946903183, | |
| "kl": 2.2231151023879647, | |
| "learning_rate": 0.00012809311997735696, | |
| "loss": 0.012878447771072388, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.546875, | |
| "reward_std": 0.7733994126319885, | |
| "rewards/Response_no_think_reward/mean": 0.546875, | |
| "rewards/Response_no_think_reward/std": 1.3032931089401245, | |
| "step": 79, | |
| "train_speed(iter/s)": 0.002271 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.03329824731918052, | |
| "clip_ratio/high_mean": 0.03329824731918052, | |
| "clip_ratio/low_mean": 0.017765316180884838, | |
| "clip_ratio/low_min": 0.017765316180884838, | |
| "clip_ratio/region_mean": 0.05106356361648068, | |
| "epoch": 0.8864265927977839, | |
| "grad_norm": 1.0568349375834465, | |
| "kl": 1.923786539278808, | |
| "learning_rate": 0.00012632527695645993, | |
| "loss": -0.0005231135291978717, | |
| "memory(GiB)": 80.03, | |
| "step": 80, | |
| "train_speed(iter/s)": 0.002287 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00021551724057644606, | |
| "clip_ratio/high_mean": 0.00021551724057644606, | |
| "clip_ratio/low_mean": 0.006801646784879267, | |
| "clip_ratio/low_min": 0.006801646784879267, | |
| "clip_ratio/region_mean": 0.007017164025455713, | |
| "completions/clipped_ratio": 0.046875, | |
| "completions/max_length": 90.0, | |
| "completions/mean_length": 14.03125, | |
| "completions/min_length": 2.0, | |
| "epoch": 0.8975069252077562, | |
| "grad_norm": 9.477113742654934, | |
| "kl": 3.0111945159733295, | |
| "learning_rate": 0.00012454854871407994, | |
| "loss": 0.016959797590970993, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.2578125, | |
| "reward_std": 0.5107755661010742, | |
| "rewards/Response_no_think_reward/mean": 0.2578125, | |
| "rewards/Response_no_think_reward/std": 1.2874077558517456, | |
| "step": 81, | |
| "train_speed(iter/s)": 0.002263 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.012387449765810743, | |
| "clip_ratio/high_mean": 0.012387449765810743, | |
| "clip_ratio/low_mean": 0.04806764563545585, | |
| "clip_ratio/low_min": 0.04806764563545585, | |
| "clip_ratio/region_mean": 0.06045509548857808, | |
| "epoch": 0.9085872576177285, | |
| "grad_norm": 1.1639747912015215, | |
| "kl": 3.7243148013949394, | |
| "learning_rate": 0.00012276353492572935, | |
| "loss": 0.0026693246327340603, | |
| "memory(GiB)": 80.03, | |
| "step": 82, | |
| "train_speed(iter/s)": 0.002279 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0004032258002553135, | |
| "clip_ratio/high_mean": 0.0004032258002553135, | |
| "clip_ratio/low_mean": 0.0061736139468848705, | |
| "clip_ratio/low_min": 0.0061736139468848705, | |
| "clip_ratio/region_mean": 0.006576839747140184, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 99.0, | |
| "completions/mean_length": 12.625, | |
| "completions/min_length": 2.0, | |
| "epoch": 0.9196675900277008, | |
| "grad_norm": 7.345333737975268, | |
| "kl": 1.6264500059187412, | |
| "learning_rate": 0.00012097083806343103, | |
| "loss": 0.02225027047097683, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.6640625, | |
| "reward_std": 0.4172249436378479, | |
| "rewards/Response_no_think_reward/mean": 0.6640625, | |
| "rewards/Response_no_think_reward/std": 1.1588573455810547, | |
| "step": 83, | |
| "train_speed(iter/s)": 0.00227 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0035271961241960526, | |
| "clip_ratio/high_mean": 0.0035271961241960526, | |
| "clip_ratio/low_mean": 0.02831025089835748, | |
| "clip_ratio/low_min": 0.02831025089835748, | |
| "clip_ratio/region_mean": 0.03183744702255353, | |
| "epoch": 0.9307479224376731, | |
| "grad_norm": 84.3494363093827, | |
| "kl": 10.616167868487537, | |
| "learning_rate": 0.00011917106319237386, | |
| "loss": 0.17172452807426453, | |
| "memory(GiB)": 80.03, | |
| "step": 84, | |
| "train_speed(iter/s)": 0.002286 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0011701860348694026, | |
| "clip_ratio/high_mean": 0.0011701860348694026, | |
| "clip_ratio/low_mean": 0.014238029951229692, | |
| "clip_ratio/low_min": 0.014238029951229692, | |
| "clip_ratio/region_mean": 0.015408215986099094, | |
| "completions/clipped_ratio": 0.140625, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 19.7578125, | |
| "completions/min_length": 4.0, | |
| "epoch": 0.9418282548476454, | |
| "grad_norm": 1.9907484000781221, | |
| "kl": 2.995624510163907, | |
| "learning_rate": 0.00011736481776669306, | |
| "loss": 0.01750401221215725, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.4765625, | |
| "reward_std": 0.4854952394962311, | |
| "rewards/Response_no_think_reward/mean": 0.4765625, | |
| "rewards/Response_no_think_reward/std": 1.1080580949783325, | |
| "step": 85, | |
| "train_speed(iter/s)": 0.002274 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.008182557401596569, | |
| "clip_ratio/high_mean": 0.008182557401596569, | |
| "clip_ratio/low_mean": 0.11124554229900241, | |
| "clip_ratio/low_min": 0.11124554229900241, | |
| "clip_ratio/region_mean": 0.11942810016626026, | |
| "epoch": 0.9529085872576177, | |
| "grad_norm": 1.9564641583381899, | |
| "kl": 4.675610944104847, | |
| "learning_rate": 0.00011555271142444433, | |
| "loss": 0.009754904545843601, | |
| "memory(GiB)": 80.03, | |
| "step": 86, | |
| "train_speed(iter/s)": 0.002289 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0004139889351790771, | |
| "clip_ratio/high_mean": 0.0004139889351790771, | |
| "clip_ratio/low_mean": 0.009557914454489946, | |
| "clip_ratio/low_min": 0.009557914454489946, | |
| "clip_ratio/region_mean": 0.0099719034624286, | |
| "completions/clipped_ratio": 0.0859375, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 17.90625, | |
| "completions/min_length": 2.0, | |
| "epoch": 0.96398891966759, | |
| "grad_norm": 1.805689670049186, | |
| "kl": 3.4809365491382778, | |
| "learning_rate": 0.00011373535578184082, | |
| "loss": 0.0213579460978508, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.5859375, | |
| "reward_std": 0.5313136577606201, | |
| "rewards/Response_no_think_reward/mean": 0.5859375, | |
| "rewards/Response_no_think_reward/std": 1.1939964294433594, | |
| "step": 87, | |
| "train_speed(iter/s)": 0.002277 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.009385127894347534, | |
| "clip_ratio/high_mean": 0.009385127894347534, | |
| "clip_ratio/low_mean": 0.08647578035015613, | |
| "clip_ratio/low_min": 0.08647578035015613, | |
| "clip_ratio/region_mean": 0.095860909903422, | |
| "epoch": 0.9750692520775623, | |
| "grad_norm": 2.411018383110019, | |
| "kl": 4.761912747140741, | |
| "learning_rate": 0.00011191336422682237, | |
| "loss": 0.01895134523510933, | |
| "memory(GiB)": 80.03, | |
| "step": 88, | |
| "train_speed(iter/s)": 0.002291 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0031819915457163006, | |
| "clip_ratio/high_mean": 0.0031819915457163006, | |
| "clip_ratio/low_mean": 0.012216789647936821, | |
| "clip_ratio/low_min": 0.012216789647936821, | |
| "clip_ratio/region_mean": 0.015398780989926308, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 64.0, | |
| "completions/mean_length": 11.28125, | |
| "completions/min_length": 2.0, | |
| "epoch": 0.9861495844875346, | |
| "grad_norm": 2.2626010793409574, | |
| "kl": 6.020935451146215, | |
| "learning_rate": 0.00011008735171202684, | |
| "loss": 0.031282562762498856, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.2890625, | |
| "reward_std": 0.847247302532196, | |
| "rewards/Response_no_think_reward/mean": 0.2890625, | |
| "rewards/Response_no_think_reward/std": 1.1915208101272583, | |
| "step": 89, | |
| "train_speed(iter/s)": 0.002254 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.024421937006991357, | |
| "clip_ratio/high_mean": 0.024421937006991357, | |
| "clip_ratio/low_mean": 0.0521851975354366, | |
| "clip_ratio/low_min": 0.0521851975354366, | |
| "clip_ratio/region_mean": 0.07660713430959731, | |
| "epoch": 0.997229916897507, | |
| "grad_norm": 1.8302536272850396, | |
| "kl": 6.024846433196217, | |
| "learning_rate": 0.00010825793454723325, | |
| "loss": 0.017346249893307686, | |
| "memory(GiB)": 80.03, | |
| "step": 90, | |
| "train_speed(iter/s)": 0.002268 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0011776478204410523, | |
| "clip_ratio/high_mean": 0.0011776478204410523, | |
| "clip_ratio/low_mean": 0.0035608798498287797, | |
| "clip_ratio/low_min": 0.0035608798498287797, | |
| "clip_ratio/region_mean": 0.004738527670269832, | |
| "completions/clipped_ratio": 0.125, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 24.046875, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.0110803324099722, | |
| "grad_norm": 2.3698869054826233, | |
| "kl": 5.333947827733937, | |
| "learning_rate": 0.00010642573019134703, | |
| "loss": 0.028505954891443253, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.84375, | |
| "reward_std": 0.6655995845794678, | |
| "rewards/Response_no_think_reward/mean": 0.84375, | |
| "rewards/Response_no_think_reward/std": 1.2065274715423584, | |
| "step": 91, | |
| "train_speed(iter/s)": 0.002232 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.02221274602925405, | |
| "clip_ratio/high_mean": 0.02221274602925405, | |
| "clip_ratio/low_mean": 0.04682085904642008, | |
| "clip_ratio/low_min": 0.04682085904642008, | |
| "clip_ratio/region_mean": 0.0690336050465703, | |
| "epoch": 1.0221606648199446, | |
| "grad_norm": 1.377879165623118, | |
| "kl": 6.767704317186144, | |
| "learning_rate": 0.00010459135704399718, | |
| "loss": 0.01659482903778553, | |
| "memory(GiB)": 80.03, | |
| "step": 92, | |
| "train_speed(iter/s)": 0.002246 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0007944914977997541, | |
| "clip_ratio/high_mean": 0.0007944914977997541, | |
| "clip_ratio/low_mean": 0.005214237666223198, | |
| "clip_ratio/low_min": 0.005214237666223198, | |
| "clip_ratio/region_mean": 0.006008729164022952, | |
| "completions/clipped_ratio": 0.046875, | |
| "completions/max_length": 79.0, | |
| "completions/mean_length": 11.1953125, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.0332409972299168, | |
| "grad_norm": 1.128328936062302, | |
| "kl": 2.6099998716963455, | |
| "learning_rate": 0.00010275543423681621, | |
| "loss": 0.01443527452647686, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.5703125, | |
| "reward_std": 0.34169840812683105, | |
| "rewards/Response_no_think_reward/mean": 0.5703125, | |
| "rewards/Response_no_think_reward/std": 1.26543128490448, | |
| "step": 93, | |
| "train_speed(iter/s)": 0.00223 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.024202606233302504, | |
| "clip_ratio/high_mean": 0.024202606233302504, | |
| "clip_ratio/low_mean": 0.017650849069468677, | |
| "clip_ratio/low_min": 0.017650849069468677, | |
| "clip_ratio/region_mean": 0.04185345536097884, | |
| "epoch": 1.0443213296398892, | |
| "grad_norm": 0.5979565041663649, | |
| "kl": 1.9247902451315895, | |
| "learning_rate": 0.00010091858142447265, | |
| "loss": 0.005481676664203405, | |
| "memory(GiB)": 80.03, | |
| "step": 94, | |
| "train_speed(iter/s)": 0.002243 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.002601411077193916, | |
| "clip_ratio/high_mean": 0.002601411077193916, | |
| "clip_ratio/low_mean": 0.005088170932140201, | |
| "clip_ratio/low_min": 0.005088170932140201, | |
| "clip_ratio/region_mean": 0.007689581951126456, | |
| "completions/clipped_ratio": 0.09375, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 18.25, | |
| "completions/min_length": 4.0, | |
| "epoch": 1.0554016620498614, | |
| "grad_norm": 2.0648308983451917, | |
| "kl": 1.713204285595566, | |
| "learning_rate": 9.908141857552737e-05, | |
| "loss": 0.015094820410013199, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.8046875, | |
| "reward_std": 0.47176384925842285, | |
| "rewards/Response_no_think_reward/mean": 0.8046875, | |
| "rewards/Response_no_think_reward/std": 1.1708977222442627, | |
| "step": 95, | |
| "train_speed(iter/s)": 0.002221 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.01881888063508086, | |
| "clip_ratio/high_mean": 0.01881888063508086, | |
| "clip_ratio/low_mean": 0.026617751631420106, | |
| "clip_ratio/low_min": 0.026617751631420106, | |
| "clip_ratio/region_mean": 0.0454366315389052, | |
| "epoch": 1.0664819944598338, | |
| "grad_norm": 1.5544793796965792, | |
| "kl": 1.6157679219031706, | |
| "learning_rate": 9.724456576318381e-05, | |
| "loss": 0.012739625759422779, | |
| "memory(GiB)": 80.03, | |
| "step": 96, | |
| "train_speed(iter/s)": 0.002234 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0020559211261570454, | |
| "clip_ratio/high_mean": 0.0020559211261570454, | |
| "clip_ratio/low_mean": 0.0043267360888421535, | |
| "clip_ratio/low_min": 0.0043267360888421535, | |
| "clip_ratio/region_mean": 0.006382657098583877, | |
| "completions/clipped_ratio": 0.015625, | |
| "completions/max_length": 41.0, | |
| "completions/mean_length": 11.046875, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.077562326869806, | |
| "grad_norm": 2.5531547462941115, | |
| "kl": 1.4817758100107312, | |
| "learning_rate": 9.540864295600283e-05, | |
| "loss": 0.016522858291864395, | |
| "memory(GiB)": 80.03, | |
| "reward": 0.9453125, | |
| "reward_std": 0.4848037362098694, | |
| "rewards/Response_no_think_reward/mean": 0.9453125, | |
| "rewards/Response_no_think_reward/std": 1.1454023122787476, | |
| "step": 97, | |
| "train_speed(iter/s)": 0.00222 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.01358306163456291, | |
| "clip_ratio/high_mean": 0.01358306163456291, | |
| "clip_ratio/low_mean": 0.019928007503040135, | |
| "clip_ratio/low_min": 0.019928007503040135, | |
| "clip_ratio/region_mean": 0.03351106960326433, | |
| "epoch": 1.0886426592797784, | |
| "grad_norm": 1.0799722223140724, | |
| "kl": 1.3886900492943823, | |
| "learning_rate": 9.357426980865301e-05, | |
| "loss": -0.0007159767556004226, | |
| "memory(GiB)": 80.03, | |
| "step": 98, | |
| "train_speed(iter/s)": 0.002234 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.001544758939417079, | |
| "clip_ratio/high_mean": 0.001544758939417079, | |
| "clip_ratio/low_mean": 0.0037943847200949676, | |
| "clip_ratio/low_min": 0.0037943847200949676, | |
| "clip_ratio/region_mean": 0.005339143652236089, | |
| "completions/clipped_ratio": 0.0546875, | |
| "completions/max_length": 101.0, | |
| "completions/mean_length": 18.546875, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.0997229916897506, | |
| "grad_norm": 0.943375664401446, | |
| "kl": 1.7392279328778386, | |
| "learning_rate": 9.174206545276677e-05, | |
| "loss": 0.014223725534975529, | |
| "memory(GiB)": 80.03, | |
| "reward": 1.1015625, | |
| "reward_std": 0.39179152250289917, | |
| "rewards/Response_no_think_reward/mean": 1.1015625, | |
| "rewards/Response_no_think_reward/std": 1.2221051454544067, | |
| "step": 99, | |
| "train_speed(iter/s)": 0.002219 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.01209607784403488, | |
| "clip_ratio/high_mean": 0.01209607784403488, | |
| "clip_ratio/low_mean": 0.011367922488716431, | |
| "clip_ratio/low_min": 0.011367922488716431, | |
| "clip_ratio/region_mean": 0.023464000318199396, | |
| "epoch": 1.110803324099723, | |
| "grad_norm": 0.8253425068817393, | |
| "kl": 1.7898913251701742, | |
| "learning_rate": 8.991264828797319e-05, | |
| "loss": 0.006411677226424217, | |
| "memory(GiB)": 80.03, | |
| "step": 100, | |
| "train_speed(iter/s)": 0.002232 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0038593837525695562, | |
| "clip_ratio/high_mean": 0.0038593837525695562, | |
| "clip_ratio/low_mean": 0.007897521747509018, | |
| "clip_ratio/low_min": 0.007897521747509018, | |
| "clip_ratio/region_mean": 0.011756905500078574, | |
| "completions/clipped_ratio": 0.140625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 18.0390625, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.1218836565096952, | |
| "grad_norm": 2.1091313211648033, | |
| "kl": 4.433779507409781, | |
| "learning_rate": 8.808663577317764e-05, | |
| "loss": 0.026584401726722717, | |
| "memory(GiB)": 77.36, | |
| "reward": 0.234375, | |
| "reward_std": 0.353938490152359, | |
| "rewards/Response_no_think_reward_1/mean": 0.234375, | |
| "rewards/Response_no_think_reward_1/std": 0.8275223970413208, | |
| "step": 101, | |
| "train_speed(iter/s)": 0.112917 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0257808348396793, | |
| "clip_ratio/high_mean": 0.0257808348396793, | |
| "clip_ratio/low_mean": 0.013182859780499712, | |
| "clip_ratio/low_min": 0.013182859780499712, | |
| "clip_ratio/region_mean": 0.038963694794801995, | |
| "epoch": 1.1329639889196677, | |
| "grad_norm": 0.8069647208167382, | |
| "kl": 2.7774715912528336, | |
| "learning_rate": 8.626464421815919e-05, | |
| "loss": 0.008937789127230644, | |
| "memory(GiB)": 77.36, | |
| "step": 102, | |
| "train_speed(iter/s)": 0.09385 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00028669723542407155, | |
| "clip_ratio/high_mean": 0.00028669723542407155, | |
| "clip_ratio/low_mean": 0.0008802816737443209, | |
| "clip_ratio/low_min": 0.0008802816737443209, | |
| "clip_ratio/region_mean": 0.0011669789091683924, | |
| "completions/clipped_ratio": 0.109375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 18.140625, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.1440443213296398, | |
| "grad_norm": 3.4014714828505634, | |
| "kl": 1.8993340344168246, | |
| "learning_rate": 8.444728857555572e-05, | |
| "loss": 0.029605647549033165, | |
| "memory(GiB)": 77.47, | |
| "reward": 0.390625, | |
| "reward_std": 0.1173202246427536, | |
| "rewards/Response_no_think_reward_1/mean": 0.390625, | |
| "rewards/Response_no_think_reward_1/std": 0.8440096974372864, | |
| "step": 103, | |
| "train_speed(iter/s)": 0.053798 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0013847328373230994, | |
| "clip_ratio/high_mean": 0.0013847328373230994, | |
| "clip_ratio/low_mean": 0.004156515002250671, | |
| "clip_ratio/low_min": 0.004156515002250671, | |
| "clip_ratio/region_mean": 0.00554124778136611, | |
| "epoch": 1.1551246537396123, | |
| "grad_norm": 0.6574286317590833, | |
| "kl": 0.8905834904871881, | |
| "learning_rate": 8.263518223330697e-05, | |
| "loss": 0.007299074437469244, | |
| "memory(GiB)": 77.47, | |
| "step": 104, | |
| "train_speed(iter/s)": 0.049358 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00036549707874655724, | |
| "clip_ratio/high_mean": 0.00036549707874655724, | |
| "clip_ratio/low_mean": 0.003542276710504666, | |
| "clip_ratio/low_min": 0.003542276710504666, | |
| "clip_ratio/region_mean": 0.003907773789251223, | |
| "completions/clipped_ratio": 0.0546875, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 12.1015625, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.1662049861495845, | |
| "grad_norm": 1.418255621232663, | |
| "kl": 1.0295969531871378, | |
| "learning_rate": 8.082893680762619e-05, | |
| "loss": 0.008070322684943676, | |
| "memory(GiB)": 77.47, | |
| "reward": 0.5625, | |
| "reward_std": 0.283821702003479, | |
| "rewards/Response_no_think_reward_1/mean": 0.5625, | |
| "rewards/Response_no_think_reward_1/std": 0.6728714108467102, | |
| "step": 105, | |
| "train_speed(iter/s)": 0.035507 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.015719514689408243, | |
| "clip_ratio/high_mean": 0.015719514689408243, | |
| "clip_ratio/low_mean": 0.010580109432339668, | |
| "clip_ratio/low_min": 0.010580109432339668, | |
| "clip_ratio/region_mean": 0.02629962412174791, | |
| "epoch": 1.1772853185595569, | |
| "grad_norm": 0.9124403050854863, | |
| "kl": 0.933376073371619, | |
| "learning_rate": 7.902916193656898e-05, | |
| "loss": -0.002763347467407584, | |
| "memory(GiB)": 79.43, | |
| "step": 106, | |
| "train_speed(iter/s)": 0.033633 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0023960003745742142, | |
| "clip_ratio/high_mean": 0.0023960003745742142, | |
| "clip_ratio/low_mean": 0.002585217938758433, | |
| "clip_ratio/low_min": 0.002585217938758433, | |
| "clip_ratio/region_mean": 0.004981218371540308, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 13.6328125, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.188365650969529, | |
| "grad_norm": 2.0082146476980807, | |
| "kl": 1.3074679019264295, | |
| "learning_rate": 7.72364650742707e-05, | |
| "loss": 0.011914699338376522, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.328125, | |
| "reward_std": 0.18394747376441956, | |
| "rewards/Response_no_think_reward_1/mean": 0.328125, | |
| "rewards/Response_no_think_reward_1/std": 0.7110973596572876, | |
| "step": 107, | |
| "train_speed(iter/s)": 0.027655 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00717889575753361, | |
| "clip_ratio/high_mean": 0.00717889575753361, | |
| "clip_ratio/low_mean": 0.008150914101861417, | |
| "clip_ratio/low_min": 0.008150914101861417, | |
| "clip_ratio/region_mean": 0.015329810208640993, | |
| "epoch": 1.1994459833795015, | |
| "grad_norm": 0.5916941576021421, | |
| "kl": 1.0833495813399168, | |
| "learning_rate": 7.54514512859201e-05, | |
| "loss": 0.0037035662680864334, | |
| "memory(GiB)": 79.43, | |
| "step": 108, | |
| "train_speed(iter/s)": 0.026591 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.004251995822414756, | |
| "clip_ratio/high_mean": 0.004251995822414756, | |
| "clip_ratio/low_mean": 0.008190131688024849, | |
| "clip_ratio/low_min": 0.008190131688024849, | |
| "clip_ratio/region_mean": 0.012442127510439605, | |
| "completions/clipped_ratio": 0.09375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 12.234375, | |
| "completions/min_length": 4.0, | |
| "epoch": 1.2105263157894737, | |
| "grad_norm": 2.6396182071410137, | |
| "kl": 2.141993957106024, | |
| "learning_rate": 7.36747230435401e-05, | |
| "loss": 0.011151588521897793, | |
| "memory(GiB)": 79.43, | |
| "reward": -0.2265625, | |
| "reward_std": 0.3407740592956543, | |
| "rewards/Response_no_think_reward_1/mean": -0.2265625, | |
| "rewards/Response_no_think_reward_1/std": 0.6425201892852783, | |
| "step": 109, | |
| "train_speed(iter/s)": 0.022574 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.004035328107420355, | |
| "clip_ratio/high_mean": 0.004035328107420355, | |
| "clip_ratio/low_mean": 0.08847818686626852, | |
| "clip_ratio/low_min": 0.08847818686626852, | |
| "clip_ratio/region_mean": 0.0925135153811425, | |
| "epoch": 1.221606648199446, | |
| "grad_norm": 1.4171762109533736, | |
| "kl": 3.1860878374427557, | |
| "learning_rate": 7.190688002264308e-05, | |
| "loss": 0.0037668771110475063, | |
| "memory(GiB)": 79.43, | |
| "step": 110, | |
| "train_speed(iter/s)": 0.021907 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.002568919211626053, | |
| "clip_ratio/low_min": 0.002568919211626053, | |
| "clip_ratio/region_mean": 0.002568919211626053, | |
| "completions/clipped_ratio": 0.046875, | |
| "completions/max_length": 48.0, | |
| "completions/mean_length": 11.7734375, | |
| "completions/min_length": 5.0, | |
| "epoch": 1.2326869806094183, | |
| "grad_norm": 1.02177770841713, | |
| "kl": 1.6274185269139707, | |
| "learning_rate": 7.014851889983057e-05, | |
| "loss": 0.010478168725967407, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.453125, | |
| "reward_std": 0.3291260004043579, | |
| "rewards/Response_no_think_reward_1/mean": 0.453125, | |
| "rewards/Response_no_think_reward_1/std": 0.685730516910553, | |
| "step": 111, | |
| "train_speed(iter/s)": 0.019127 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.013096909533487633, | |
| "clip_ratio/high_mean": 0.013096909533487633, | |
| "clip_ratio/low_mean": 0.016107605304569006, | |
| "clip_ratio/low_min": 0.016107605304569006, | |
| "clip_ratio/region_mean": 0.029204514692537487, | |
| "epoch": 1.2437673130193905, | |
| "grad_norm": 0.79999454502468, | |
| "kl": 1.5544351362623274, | |
| "learning_rate": 6.840023315140475e-05, | |
| "loss": 0.0022247314918786287, | |
| "memory(GiB)": 79.43, | |
| "step": 112, | |
| "train_speed(iter/s)": 0.018681 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0008340688509633765, | |
| "clip_ratio/high_mean": 0.0008340688509633765, | |
| "clip_ratio/low_mean": 0.007082634954713285, | |
| "clip_ratio/low_min": 0.007082634954713285, | |
| "clip_ratio/region_mean": 0.007916703820228577, | |
| "completions/clipped_ratio": 0.1171875, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 13.53125, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.254847645429363, | |
| "grad_norm": 1.6246389101003882, | |
| "kl": 1.6449745513964444, | |
| "learning_rate": 6.666261285306047e-05, | |
| "loss": 0.014917208813130856, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.1953125, | |
| "reward_std": 0.2754020392894745, | |
| "rewards/Response_no_think_reward_1/mean": 0.1953125, | |
| "rewards/Response_no_think_reward_1/std": 0.869958758354187, | |
| "step": 113, | |
| "train_speed(iter/s)": 0.016592 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.006006928611896001, | |
| "clip_ratio/high_mean": 0.006006928611896001, | |
| "clip_ratio/low_mean": 0.039706501411274076, | |
| "clip_ratio/low_min": 0.039706501411274076, | |
| "clip_ratio/region_mean": 0.045713430270552635, | |
| "epoch": 1.2659279778393353, | |
| "grad_norm": 0.940807595373605, | |
| "kl": 1.8106578167062253, | |
| "learning_rate": 6.493624448072457e-05, | |
| "loss": 0.006363555323332548, | |
| "memory(GiB)": 79.43, | |
| "step": 114, | |
| "train_speed(iter/s)": 0.016278 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0052188277477398515, | |
| "clip_ratio/high_mean": 0.0052188277477398515, | |
| "clip_ratio/low_mean": 0.004236701555782929, | |
| "clip_ratio/low_min": 0.004236701555782929, | |
| "clip_ratio/region_mean": 0.009455529390834272, | |
| "completions/clipped_ratio": 0.1796875, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 14.3671875, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.2770083102493075, | |
| "grad_norm": 2.8040352101197437, | |
| "kl": 5.506896490347572, | |
| "learning_rate": 6.322171071261071e-05, | |
| "loss": 0.03229736536741257, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.296875, | |
| "reward_std": 0.43980443477630615, | |
| "rewards/Response_no_think_reward_1/mean": 0.296875, | |
| "rewards/Response_no_think_reward_1/std": 0.8905397057533264, | |
| "step": 115, | |
| "train_speed(iter/s)": 0.014636 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.01615347486222163, | |
| "clip_ratio/high_mean": 0.01615347486222163, | |
| "clip_ratio/low_mean": 0.015428576618432999, | |
| "clip_ratio/low_min": 0.015428576618432999, | |
| "clip_ratio/region_mean": 0.031582050723955035, | |
| "epoch": 1.2880886426592797, | |
| "grad_norm": 1.8650893219420759, | |
| "kl": 4.258469146443531, | |
| "learning_rate": 6.151959023255545e-05, | |
| "loss": 0.020270783454179764, | |
| "memory(GiB)": 79.43, | |
| "step": 116, | |
| "train_speed(iter/s)": 0.014407 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.005145640461705625, | |
| "clip_ratio/high_mean": 0.005145640461705625, | |
| "clip_ratio/low_mean": 0.008849590638419613, | |
| "clip_ratio/low_min": 0.008849590638419613, | |
| "clip_ratio/region_mean": 0.013995230983709916, | |
| "completions/clipped_ratio": 0.1640625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 16.3125, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.299168975069252, | |
| "grad_norm": 2.4581301952944186, | |
| "kl": 3.745300827547908, | |
| "learning_rate": 5.983045753470308e-05, | |
| "loss": 0.024165078997612, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.453125, | |
| "reward_std": 0.5826787948608398, | |
| "rewards/Response_no_think_reward_1/mean": 0.453125, | |
| "rewards/Response_no_think_reward_1/std": 0.8405039310455322, | |
| "step": 117, | |
| "train_speed(iter/s)": 0.013208 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.04523819196037948, | |
| "clip_ratio/high_mean": 0.04523819196037948, | |
| "clip_ratio/low_mean": 0.01510127488290891, | |
| "clip_ratio/low_min": 0.01510127488290891, | |
| "clip_ratio/region_mean": 0.060339466377627105, | |
| "epoch": 1.3102493074792243, | |
| "grad_norm": 2.131099568305027, | |
| "kl": 2.847630614414811, | |
| "learning_rate": 5.8154882729603876e-05, | |
| "loss": 0.01335166022181511, | |
| "memory(GiB)": 79.43, | |
| "step": 118, | |
| "train_speed(iter/s)": 0.013037 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.002125054510543123, | |
| "clip_ratio/high_mean": 0.002125054510543123, | |
| "clip_ratio/low_mean": 0.0127813016588334, | |
| "clip_ratio/low_min": 0.0127813016588334, | |
| "clip_ratio/region_mean": 0.0149063560529612, | |
| "completions/clipped_ratio": 0.203125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 19.59375, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.3213296398891967, | |
| "grad_norm": 2.690385409772627, | |
| "kl": 2.0104650848079473, | |
| "learning_rate": 5.64934313517927e-05, | |
| "loss": 0.01620793715119362, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.2578125, | |
| "reward_std": 0.41504764556884766, | |
| "rewards/Response_no_think_reward_1/mean": 0.2578125, | |
| "rewards/Response_no_think_reward_1/std": 0.8625734448432922, | |
| "step": 119, | |
| "train_speed(iter/s)": 0.011541 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0026382115320302546, | |
| "clip_ratio/high_mean": 0.0026382115320302546, | |
| "clip_ratio/low_mean": 0.07074824426672421, | |
| "clip_ratio/low_min": 0.07074824426672421, | |
| "clip_ratio/region_mean": 0.07338645646814257, | |
| "epoch": 1.332409972299169, | |
| "grad_norm": 1.3611711034111147, | |
| "kl": 2.366683575557545, | |
| "learning_rate": 5.484666416891109e-05, | |
| "loss": 0.00427972199395299, | |
| "memory(GiB)": 79.43, | |
| "step": 120, | |
| "train_speed(iter/s)": 0.011424 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00034340660204179585, | |
| "clip_ratio/high_mean": 0.00034340660204179585, | |
| "clip_ratio/low_mean": 0.0057576168910600245, | |
| "clip_ratio/low_min": 0.0057576168910600245, | |
| "clip_ratio/region_mean": 0.00610102349310182, | |
| "completions/clipped_ratio": 0.109375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 14.1640625, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.3434903047091413, | |
| "grad_norm": 1.7730415769710828, | |
| "kl": 2.253111455589533, | |
| "learning_rate": 5.321513699243924e-05, | |
| "loss": 0.015828199684619904, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.2578125, | |
| "reward_std": 0.2504267692565918, | |
| "rewards/Response_no_think_reward_1/mean": 0.2578125, | |
| "rewards/Response_no_think_reward_1/std": 0.8533961176872253, | |
| "step": 121, | |
| "train_speed(iter/s)": 0.010746 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.002522797236451879, | |
| "clip_ratio/high_mean": 0.002522797236451879, | |
| "clip_ratio/low_mean": 0.03892370511312038, | |
| "clip_ratio/low_min": 0.03892370511312038, | |
| "clip_ratio/region_mean": 0.041446502320468426, | |
| "epoch": 1.3545706371191135, | |
| "grad_norm": 0.9270755733265906, | |
| "kl": 2.852388353087008, | |
| "learning_rate": 5.159940049010015e-05, | |
| "loss": 0.00514911487698555, | |
| "memory(GiB)": 79.43, | |
| "step": 122, | |
| "train_speed(iter/s)": 0.010652 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0008753835718380287, | |
| "clip_ratio/high_mean": 0.0008753835718380287, | |
| "clip_ratio/low_mean": 0.0012499999720603228, | |
| "clip_ratio/low_min": 0.0012499999720603228, | |
| "clip_ratio/region_mean": 0.0021253835438983515, | |
| "completions/clipped_ratio": 0.1171875, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 15.8515625, | |
| "completions/min_length": 4.0, | |
| "epoch": 1.365650969529086, | |
| "grad_norm": 24.163527329310554, | |
| "kl": 24.496757203305606, | |
| "learning_rate": 5.000000000000002e-05, | |
| "loss": 0.23566541075706482, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.3984375, | |
| "reward_std": 0.3253360986709595, | |
| "rewards/Response_no_think_reward_1/mean": 0.3984375, | |
| "rewards/Response_no_think_reward_1/std": 0.6912255883216858, | |
| "step": 123, | |
| "train_speed(iter/s)": 0.010181 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0009191176941385493, | |
| "clip_ratio/high_mean": 0.0009191176941385493, | |
| "clip_ratio/low_mean": 0.025084137567318976, | |
| "clip_ratio/low_min": 0.025084137567318976, | |
| "clip_ratio/region_mean": 0.026003255392424762, | |
| "epoch": 1.3767313019390581, | |
| "grad_norm": 4.61798364138243, | |
| "kl": 5.482510100933723, | |
| "learning_rate": 4.841747534656763e-05, | |
| "loss": 0.03564080968499184, | |
| "memory(GiB)": 79.43, | |
| "step": 124, | |
| "train_speed(iter/s)": 0.010103 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0004921259824186563, | |
| "clip_ratio/high_mean": 0.0004921259824186563, | |
| "clip_ratio/low_mean": 0.0009282178361900151, | |
| "clip_ratio/low_min": 0.0009282178361900151, | |
| "clip_ratio/region_mean": 0.0014203438186086714, | |
| "completions/clipped_ratio": 0.140625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 16.671875, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.3878116343490305, | |
| "grad_norm": 1.7230796893481761, | |
| "kl": 1.7308420957997441, | |
| "learning_rate": 4.685236065835443e-05, | |
| "loss": 0.01634293608367443, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.171875, | |
| "reward_std": 0.13258251547813416, | |
| "rewards/Response_no_think_reward_1/mean": 0.171875, | |
| "rewards/Response_no_think_reward_1/std": 0.8971465826034546, | |
| "step": 125, | |
| "train_speed(iter/s)": 0.009672 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0003094059356953949, | |
| "clip_ratio/high_mean": 0.0003094059356953949, | |
| "clip_ratio/low_mean": 0.02542525064200163, | |
| "clip_ratio/low_min": 0.02542525064200163, | |
| "clip_ratio/region_mean": 0.025734656490385532, | |
| "epoch": 1.3988919667590027, | |
| "grad_norm": 0.6685767852950313, | |
| "kl": 2.058195663616061, | |
| "learning_rate": 4.530518418775733e-05, | |
| "loss": 0.008037411607801914, | |
| "memory(GiB)": 79.43, | |
| "step": 126, | |
| "train_speed(iter/s)": 0.009605 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0035992932971566916, | |
| "clip_ratio/high_mean": 0.0035992932971566916, | |
| "clip_ratio/low_mean": 0.0026174120721407235, | |
| "clip_ratio/low_min": 0.0026174120721407235, | |
| "clip_ratio/region_mean": 0.006216705543920398, | |
| "completions/clipped_ratio": 0.078125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 13.1015625, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.4099722991689752, | |
| "grad_norm": 0.898899557372063, | |
| "kl": 1.8244512832025066, | |
| "learning_rate": 4.3776468132724604e-05, | |
| "loss": 0.013885595835745335, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.703125, | |
| "reward_std": 0.1841355264186859, | |
| "rewards/Response_no_think_reward_1/mean": 0.703125, | |
| "rewards/Response_no_think_reward_1/std": 0.552152156829834, | |
| "step": 127, | |
| "train_speed(iter/s)": 0.009212 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00787301326636225, | |
| "clip_ratio/high_mean": 0.00787301326636225, | |
| "clip_ratio/low_mean": 0.003833794384263456, | |
| "clip_ratio/low_min": 0.003833794384263456, | |
| "clip_ratio/region_mean": 0.011706807999871671, | |
| "epoch": 1.4210526315789473, | |
| "grad_norm": 0.6061431338619399, | |
| "kl": 1.8278243900567759, | |
| "learning_rate": 4.2266728460505375e-05, | |
| "loss": 0.009479128755629063, | |
| "memory(GiB)": 79.43, | |
| "step": 128, | |
| "train_speed(iter/s)": 0.009157 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0016208597226068377, | |
| "clip_ratio/high_mean": 0.0016208597226068377, | |
| "clip_ratio/low_mean": 0.004291799967177212, | |
| "clip_ratio/low_min": 0.004291799967177212, | |
| "clip_ratio/region_mean": 0.00591265968978405, | |
| "completions/clipped_ratio": 0.2421875, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 13.8359375, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.4321329639889195, | |
| "grad_norm": 4.256081630918958, | |
| "kl": 8.371784689603373, | |
| "learning_rate": 4.077647473350201e-05, | |
| "loss": 0.07109890133142471, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.1640625, | |
| "reward_std": 0.12844271957874298, | |
| "rewards/Response_no_think_reward_1/mean": 0.1640625, | |
| "rewards/Response_no_think_reward_1/std": 0.9029901623725891, | |
| "step": 129, | |
| "train_speed(iter/s)": 0.008828 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00940803368575871, | |
| "clip_ratio/high_mean": 0.00940803368575871, | |
| "clip_ratio/low_mean": 0.006534474319778383, | |
| "clip_ratio/low_min": 0.006534474319778383, | |
| "clip_ratio/region_mean": 0.01594250788912177, | |
| "epoch": 1.443213296398892, | |
| "grad_norm": 2.0975168570419678, | |
| "kl": 6.735093111405149, | |
| "learning_rate": 3.9306209937284346e-05, | |
| "loss": 0.05932926759123802, | |
| "memory(GiB)": 79.43, | |
| "step": 130, | |
| "train_speed(iter/s)": 0.008781 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.004439248572452925, | |
| "clip_ratio/high_mean": 0.004439248572452925, | |
| "clip_ratio/low_mean": 0.006494191708043218, | |
| "clip_ratio/low_min": 0.006494191708043218, | |
| "clip_ratio/region_mean": 0.01093344046967104, | |
| "completions/clipped_ratio": 0.1484375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 13.9140625, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.4542936288088644, | |
| "grad_norm": 1.7347303322446779, | |
| "kl": 3.3224903107620776, | |
| "learning_rate": 3.7856430310823545e-05, | |
| "loss": 0.028562916442751884, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.2578125, | |
| "reward_std": 0.4904649257659912, | |
| "rewards/Response_no_think_reward_1/mean": 0.2578125, | |
| "rewards/Response_no_think_reward_1/std": 0.8441190123558044, | |
| "step": 131, | |
| "train_speed(iter/s)": 0.008479 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.03524596616625786, | |
| "clip_ratio/high_mean": 0.03524596616625786, | |
| "clip_ratio/low_mean": 0.00640316259523388, | |
| "clip_ratio/low_min": 0.00640316259523388, | |
| "clip_ratio/region_mean": 0.04164912860142067, | |
| "epoch": 1.4653739612188366, | |
| "grad_norm": 1.8414978565783118, | |
| "kl": 2.55354578839615, | |
| "learning_rate": 3.642762517900322e-05, | |
| "loss": 0.016005922108888626, | |
| "memory(GiB)": 79.43, | |
| "step": 132, | |
| "train_speed(iter/s)": 0.008439 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00021331057359930128, | |
| "clip_ratio/high_mean": 0.00021331057359930128, | |
| "clip_ratio/low_mean": 0.007616169808898121, | |
| "clip_ratio/low_min": 0.007616169808898121, | |
| "clip_ratio/region_mean": 0.007829480382497422, | |
| "completions/clipped_ratio": 0.125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 16.9296875, | |
| "completions/min_length": 4.0, | |
| "epoch": 1.4764542936288088, | |
| "grad_norm": 2.995948442993347, | |
| "kl": 2.835317355929874, | |
| "learning_rate": 3.5020276787464056e-05, | |
| "loss": 0.020519524812698364, | |
| "memory(GiB)": 79.43, | |
| "reward": -0.109375, | |
| "reward_std": 0.39537471532821655, | |
| "rewards/Response_no_think_reward_1/mean": -0.109375, | |
| "rewards/Response_no_think_reward_1/std": 0.7860434055328369, | |
| "step": 133, | |
| "train_speed(iter/s)": 0.008214 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0014211501111276448, | |
| "clip_ratio/high_mean": 0.0014211501111276448, | |
| "clip_ratio/low_mean": 0.017294615099672228, | |
| "clip_ratio/low_min": 0.017294615099672228, | |
| "clip_ratio/region_mean": 0.01871576503617689, | |
| "epoch": 1.4875346260387812, | |
| "grad_norm": 2.3860638079880268, | |
| "kl": 2.9496174114756286, | |
| "learning_rate": 3.363486013983788e-05, | |
| "loss": 0.015305472537875175, | |
| "memory(GiB)": 79.43, | |
| "step": 134, | |
| "train_speed(iter/s)": 0.008178 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.004125965555431321, | |
| "clip_ratio/high_mean": 0.004125965555431321, | |
| "clip_ratio/low_mean": 0.01121757403598167, | |
| "clip_ratio/low_min": 0.01121757403598167, | |
| "clip_ratio/region_mean": 0.01534353947499767, | |
| "completions/clipped_ratio": 0.2421875, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 17.59375, | |
| "completions/min_length": 5.0, | |
| "epoch": 1.4986149584487536, | |
| "grad_norm": 1.9611447116444427, | |
| "kl": 4.596401881426573, | |
| "learning_rate": 3.227184283742591e-05, | |
| "loss": 0.037781622260808945, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.140625, | |
| "reward_std": 0.3686816394329071, | |
| "rewards/Response_no_think_reward_1/mean": 0.140625, | |
| "rewards/Response_no_think_reward_1/std": 0.9698962569236755, | |
| "step": 135, | |
| "train_speed(iter/s)": 0.007948 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.003497250087093562, | |
| "clip_ratio/high_mean": 0.003497250087093562, | |
| "clip_ratio/low_mean": 0.0877209399768617, | |
| "clip_ratio/low_min": 0.0877209399768617, | |
| "clip_ratio/region_mean": 0.09121819020947441, | |
| "epoch": 1.5096952908587258, | |
| "grad_norm": 1.7237744503611014, | |
| "kl": 4.757093018852174, | |
| "learning_rate": 3.093168492137557e-05, | |
| "loss": 0.02426687255501747, | |
| "memory(GiB)": 79.43, | |
| "step": 136, | |
| "train_speed(iter/s)": 0.007917 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0014806788822170347, | |
| "clip_ratio/high_mean": 0.0014806788822170347, | |
| "clip_ratio/low_mean": 0.008024309470783919, | |
| "clip_ratio/low_min": 0.008024309470783919, | |
| "clip_ratio/region_mean": 0.009504988382104784, | |
| "completions/clipped_ratio": 0.2265625, | |
| "completions/max_length": 49.0, | |
| "completions/mean_length": 15.859375, | |
| "completions/min_length": 4.0, | |
| "epoch": 1.520775623268698, | |
| "grad_norm": 2.1836739109067973, | |
| "kl": 5.872505620121956, | |
| "learning_rate": 2.9614838717408867e-05, | |
| "loss": 0.05089029669761658, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.1640625, | |
| "reward_std": 0.48505210876464844, | |
| "rewards/Response_no_think_reward_1/mean": 0.1640625, | |
| "rewards/Response_no_think_reward_1/std": 0.8303053379058838, | |
| "step": 137, | |
| "train_speed(iter/s)": 0.00773 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.009889701497741044, | |
| "clip_ratio/high_mean": 0.009889701497741044, | |
| "clip_ratio/low_mean": 0.03272932127583772, | |
| "clip_ratio/low_min": 0.03272932127583772, | |
| "clip_ratio/region_mean": 0.04261902256985195, | |
| "epoch": 1.5318559556786704, | |
| "grad_norm": 1.660171536889304, | |
| "kl": 5.461771305650473, | |
| "learning_rate": 2.8321748683154893e-05, | |
| "loss": 0.03914007171988487, | |
| "memory(GiB)": 79.43, | |
| "step": 138, | |
| "train_speed(iter/s)": 0.007702 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0019176136120222509, | |
| "clip_ratio/high_mean": 0.0019176136120222509, | |
| "clip_ratio/low_mean": 0.007726973562967032, | |
| "clip_ratio/low_min": 0.007726973562967032, | |
| "clip_ratio/region_mean": 0.009644587058573961, | |
| "completions/clipped_ratio": 0.265625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 15.359375, | |
| "completions/min_length": 4.0, | |
| "epoch": 1.5429362880886428, | |
| "grad_norm": 3.7132212896004106, | |
| "kl": 4.60741166153457, | |
| "learning_rate": 2.7052851258137935e-05, | |
| "loss": 0.039852242916822433, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.0078125, | |
| "reward_std": 0.3704521656036377, | |
| "rewards/Response_no_think_reward_1/mean": 0.0078125, | |
| "rewards/Response_no_think_reward_1/std": 0.7985823154449463, | |
| "step": 139, | |
| "train_speed(iter/s)": 0.007537 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0055117253214120865, | |
| "clip_ratio/high_mean": 0.0055117253214120865, | |
| "clip_ratio/low_mean": 0.016618184628896415, | |
| "clip_ratio/low_min": 0.016618184628896415, | |
| "clip_ratio/region_mean": 0.022129910183139145, | |
| "epoch": 1.554016620498615, | |
| "grad_norm": 2.5249297141615665, | |
| "kl": 4.39259727431272, | |
| "learning_rate": 2.5808574716471856e-05, | |
| "loss": 0.03180728852748871, | |
| "memory(GiB)": 79.43, | |
| "step": 140, | |
| "train_speed(iter/s)": 0.007513 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.001243597303982824, | |
| "clip_ratio/high_mean": 0.001243597303982824, | |
| "clip_ratio/low_mean": 0.009276433673221618, | |
| "clip_ratio/low_min": 0.009276433673221618, | |
| "clip_ratio/region_mean": 0.010520030977204442, | |
| "completions/clipped_ratio": 0.1640625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 13.2578125, | |
| "completions/min_length": 4.0, | |
| "epoch": 1.5650969529085872, | |
| "grad_norm": 2.0040824091240594, | |
| "kl": 6.036298241931945, | |
| "learning_rate": 2.4589339022310386e-05, | |
| "loss": 0.044014573097229004, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.2109375, | |
| "reward_std": 0.3419404625892639, | |
| "rewards/Response_no_think_reward_1/mean": 0.2109375, | |
| "rewards/Response_no_think_reward_1/std": 0.7902191877365112, | |
| "step": 141, | |
| "train_speed(iter/s)": 0.007347 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.008325316943228245, | |
| "clip_ratio/high_mean": 0.008325316943228245, | |
| "clip_ratio/low_mean": 0.024790967552689835, | |
| "clip_ratio/low_min": 0.024790967552689835, | |
| "clip_ratio/region_mean": 0.0331162846123334, | |
| "epoch": 1.5761772853185596, | |
| "grad_norm": 1.8697222079345355, | |
| "kl": 6.215300239622593, | |
| "learning_rate": 2.339555568810221e-05, | |
| "loss": 0.03644668310880661, | |
| "memory(GiB)": 79.43, | |
| "step": 142, | |
| "train_speed(iter/s)": 0.007326 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0029302738257683814, | |
| "clip_ratio/high_mean": 0.0029302738257683814, | |
| "clip_ratio/low_mean": 0.007880916586145759, | |
| "clip_ratio/low_min": 0.007880916586145759, | |
| "clip_ratio/region_mean": 0.01081119041191414, | |
| "completions/clipped_ratio": 0.1953125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 16.0546875, | |
| "completions/min_length": 5.0, | |
| "epoch": 1.587257617728532, | |
| "grad_norm": 2.558849178134003, | |
| "kl": 3.834877057670383, | |
| "learning_rate": 2.222762763569862e-05, | |
| "loss": 0.029992224648594856, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.1875, | |
| "reward_std": 0.35771697759628296, | |
| "rewards/Response_no_think_reward_1/mean": 0.1875, | |
| "rewards/Response_no_think_reward_1/std": 0.8010819554328918, | |
| "step": 143, | |
| "train_speed(iter/s)": 0.007139 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.003368975827470422, | |
| "clip_ratio/high_mean": 0.003368975827470422, | |
| "clip_ratio/low_mean": 0.02965959811990615, | |
| "clip_ratio/low_min": 0.02965959811990615, | |
| "clip_ratio/region_mean": 0.033028574180207215, | |
| "epoch": 1.5983379501385042, | |
| "grad_norm": 1.5351560901882282, | |
| "kl": 4.278483287169365, | |
| "learning_rate": 2.1085949060360654e-05, | |
| "loss": 0.022547291591763496, | |
| "memory(GiB)": 79.43, | |
| "step": 144, | |
| "train_speed(iter/s)": 0.007121 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.002464834105921909, | |
| "clip_ratio/high_mean": 0.002464834105921909, | |
| "clip_ratio/low_mean": 0.01630687521537766, | |
| "clip_ratio/low_min": 0.01630687521537766, | |
| "clip_ratio/region_mean": 0.018771709233988076, | |
| "completions/clipped_ratio": 0.1953125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 15.2265625, | |
| "completions/min_length": 6.0, | |
| "epoch": 1.6094182825484764, | |
| "grad_norm": 2.2342359741828877, | |
| "kl": 5.610230388585478, | |
| "learning_rate": 1.9970905297711606e-05, | |
| "loss": 0.04032519459724426, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.15625, | |
| "reward_std": 0.3392276465892792, | |
| "rewards/Response_no_think_reward_1/mean": 0.15625, | |
| "rewards/Response_no_think_reward_1/std": 0.8175004720687866, | |
| "step": 145, | |
| "train_speed(iter/s)": 0.006942 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.004107788117835298, | |
| "clip_ratio/high_mean": 0.004107788117835298, | |
| "clip_ratio/low_mean": 0.07009978080168366, | |
| "clip_ratio/low_min": 0.07009978080168366, | |
| "clip_ratio/region_mean": 0.07420756877399981, | |
| "epoch": 1.6204986149584486, | |
| "grad_norm": 1.7237867651621368, | |
| "kl": 6.150614712154493, | |
| "learning_rate": 1.888287269367979e-05, | |
| "loss": 0.03451818227767944, | |
| "memory(GiB)": 79.43, | |
| "step": 146, | |
| "train_speed(iter/s)": 0.006925 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0020879992516711354, | |
| "clip_ratio/high_mean": 0.0020879992516711354, | |
| "clip_ratio/low_mean": 0.0016714749799575657, | |
| "clip_ratio/low_min": 0.0016714749799575657, | |
| "clip_ratio/region_mean": 0.0037594741152133793, | |
| "completions/clipped_ratio": 0.0390625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 12.09375, | |
| "completions/min_length": 5.0, | |
| "epoch": 1.631578947368421, | |
| "grad_norm": 1.8301432866457292, | |
| "kl": 1.3922554631717503, | |
| "learning_rate": 1.7822218477475494e-05, | |
| "loss": 0.015794314444065094, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.5234375, | |
| "reward_std": 0.20214977860450745, | |
| "rewards/Response_no_think_reward_1/mean": 0.5234375, | |
| "rewards/Response_no_think_reward_1/std": 0.6143282055854797, | |
| "step": 147, | |
| "train_speed(iter/s)": 0.006704 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.004581842658808455, | |
| "clip_ratio/high_mean": 0.004581842658808455, | |
| "clip_ratio/low_mean": 0.00751026114448905, | |
| "clip_ratio/low_min": 0.00751026114448905, | |
| "clip_ratio/region_mean": 0.012092103715986013, | |
| "epoch": 1.6426592797783934, | |
| "grad_norm": 2.0798983048360977, | |
| "kl": 1.5519673400558531, | |
| "learning_rate": 1.6789300637645e-05, | |
| "loss": 0.010683290660381317, | |
| "memory(GiB)": 79.43, | |
| "step": 148, | |
| "train_speed(iter/s)": 0.006691 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0013595109921880066, | |
| "clip_ratio/high_mean": 0.0013595109921880066, | |
| "clip_ratio/low_mean": 0.004456432332517579, | |
| "clip_ratio/low_min": 0.004456432332517579, | |
| "clip_ratio/region_mean": 0.005815943295601755, | |
| "completions/clipped_ratio": 0.140625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 13.4453125, | |
| "completions/min_length": 6.0, | |
| "epoch": 1.6537396121883656, | |
| "grad_norm": 2.124340745472962, | |
| "kl": 4.468803564086556, | |
| "learning_rate": 1.578446780124344e-05, | |
| "loss": 0.04191342741250992, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.09375, | |
| "reward_std": 0.2688094973564148, | |
| "rewards/Response_no_think_reward_1/mean": 0.09375, | |
| "rewards/Response_no_think_reward_1/std": 0.7036183476448059, | |
| "step": 149, | |
| "train_speed(iter/s)": 0.006516 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.004650130198569968, | |
| "clip_ratio/high_mean": 0.004650130198569968, | |
| "clip_ratio/low_mean": 0.015789811441209167, | |
| "clip_ratio/low_min": 0.015789811441209167, | |
| "clip_ratio/region_mean": 0.020439941552467644, | |
| "epoch": 1.6648199445983378, | |
| "grad_norm": 1.3890201997929057, | |
| "kl": 4.818290303461254, | |
| "learning_rate": 1.4808059116167305e-05, | |
| "loss": 0.03111656755208969, | |
| "memory(GiB)": 79.43, | |
| "step": 150, | |
| "train_speed(iter/s)": 0.006505 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0031864915508776903, | |
| "clip_ratio/low_min": 0.0031864915508776903, | |
| "clip_ratio/region_mean": 0.0031864915508776903, | |
| "completions/clipped_ratio": 0.1484375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 15.96875, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.6759002770083102, | |
| "grad_norm": 1.3263437432774172, | |
| "kl": 3.4037277391953467, | |
| "learning_rate": 1.3860404136686411e-05, | |
| "loss": 0.02711915224790573, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.2890625, | |
| "reward_std": 0.20480823516845703, | |
| "rewards/Response_no_think_reward_1/mean": 0.2890625, | |
| "rewards/Response_no_think_reward_1/std": 0.7852212190628052, | |
| "step": 151, | |
| "train_speed(iter/s)": 0.006367 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.002190002123825252, | |
| "clip_ratio/high_mean": 0.002190002123825252, | |
| "clip_ratio/low_mean": 0.010535595705732703, | |
| "clip_ratio/low_min": 0.010535595705732703, | |
| "clip_ratio/region_mean": 0.012725598004180938, | |
| "epoch": 1.6869806094182827, | |
| "grad_norm": 1.0936459304561021, | |
| "kl": 3.5067162624327466, | |
| "learning_rate": 1.294182271221377e-05, | |
| "loss": 0.02425944060087204, | |
| "memory(GiB)": 79.43, | |
| "step": 152, | |
| "train_speed(iter/s)": 0.006357 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.004777037829626352, | |
| "clip_ratio/high_mean": 0.004777037829626352, | |
| "clip_ratio/low_mean": 0.0015179030015133321, | |
| "clip_ratio/low_min": 0.0015179030015133321, | |
| "clip_ratio/region_mean": 0.006294940831139684, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 47.0, | |
| "completions/mean_length": 13.6796875, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.6980609418282548, | |
| "grad_norm": 3.294412855573239, | |
| "kl": 4.274040638643783, | |
| "learning_rate": 1.2052624879351104e-05, | |
| "loss": 0.03787969425320625, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.6015625, | |
| "reward_std": 0.17859892547130585, | |
| "rewards/Response_no_think_reward_1/mean": 0.6015625, | |
| "rewards/Response_no_think_reward_1/std": 0.5931345224380493, | |
| "step": 153, | |
| "train_speed(iter/s)": 0.006206 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.005947966914391145, | |
| "clip_ratio/high_mean": 0.005947966914391145, | |
| "clip_ratio/low_mean": 0.004764656303450465, | |
| "clip_ratio/low_min": 0.004764656303450465, | |
| "clip_ratio/region_mean": 0.010712623450672254, | |
| "epoch": 1.709141274238227, | |
| "grad_norm": 2.9610057087874977, | |
| "kl": 3.866908519703429, | |
| "learning_rate": 1.119311075724625e-05, | |
| "loss": 0.033227190375328064, | |
| "memory(GiB)": 79.43, | |
| "step": 154, | |
| "train_speed(iter/s)": 0.006199 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0032051282469183207, | |
| "clip_ratio/high_mean": 0.0032051282469183207, | |
| "clip_ratio/low_mean": 0.00683464459143579, | |
| "clip_ratio/low_min": 0.00683464459143579, | |
| "clip_ratio/region_mean": 0.01003977283835411, | |
| "completions/clipped_ratio": 0.1875, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 16.2265625, | |
| "completions/min_length": 5.0, | |
| "epoch": 1.7202216066481995, | |
| "grad_norm": 3.0112138436872624, | |
| "kl": 4.548647504067048, | |
| "learning_rate": 1.0363570446297999e-05, | |
| "loss": 0.03970736265182495, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.328125, | |
| "reward_std": 0.32412126660346985, | |
| "rewards/Response_no_think_reward_1/mean": 0.328125, | |
| "rewards/Response_no_think_reward_1/std": 0.743574857711792, | |
| "step": 155, | |
| "train_speed(iter/s)": 0.006071 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0029493323527276516, | |
| "clip_ratio/high_mean": 0.0029493323527276516, | |
| "clip_ratio/low_mean": 0.008986421715235338, | |
| "clip_ratio/low_min": 0.008986421715235338, | |
| "clip_ratio/region_mean": 0.011935754009755328, | |
| "epoch": 1.7313019390581719, | |
| "grad_norm": 3.1784321577702666, | |
| "kl": 4.521617598744342, | |
| "learning_rate": 9.564283930242257e-06, | |
| "loss": 0.03974776715040207, | |
| "memory(GiB)": 79.43, | |
| "step": 156, | |
| "train_speed(iter/s)": 0.006064 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.005233740259427577, | |
| "clip_ratio/high_mean": 0.005233740259427577, | |
| "clip_ratio/low_mean": 0.013618246564874426, | |
| "clip_ratio/low_min": 0.013618246564874426, | |
| "clip_ratio/region_mean": 0.018851986795198172, | |
| "completions/clipped_ratio": 0.140625, | |
| "completions/max_length": 46.0, | |
| "completions/mean_length": 12.71875, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.742382271468144, | |
| "grad_norm": 3.107280979259554, | |
| "kl": 7.697673750575632, | |
| "learning_rate": 8.795520981652961e-06, | |
| "loss": 0.04705927148461342, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.171875, | |
| "reward_std": 0.49000412225723267, | |
| "rewards/Response_no_think_reward_1/mean": 0.171875, | |
| "rewards/Response_no_think_reward_1/std": 0.8143339157104492, | |
| "step": 157, | |
| "train_speed(iter/s)": 0.005969 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.018029920000117272, | |
| "clip_ratio/high_mean": 0.018029920000117272, | |
| "clip_ratio/low_mean": 0.011481558292871341, | |
| "clip_ratio/low_min": 0.011481558292871341, | |
| "clip_ratio/region_mean": 0.029511478263884783, | |
| "epoch": 1.7534626038781163, | |
| "grad_norm": 2.4164221842161395, | |
| "kl": 7.264460427570157, | |
| "learning_rate": 8.05754107088923e-06, | |
| "loss": 0.0432392843067646, | |
| "memory(GiB)": 79.43, | |
| "step": 158, | |
| "train_speed(iter/s)": 0.005963 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.003813613730017096, | |
| "clip_ratio/low_min": 0.003813613730017096, | |
| "clip_ratio/region_mean": 0.003813613730017096, | |
| "completions/clipped_ratio": 0.0859375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 14.8359375, | |
| "completions/min_length": 4.0, | |
| "epoch": 1.7645429362880887, | |
| "grad_norm": 1.905247433106981, | |
| "kl": 1.1771136652678251, | |
| "learning_rate": 7.350593278519824e-06, | |
| "loss": 0.00986653845757246, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.359375, | |
| "reward_std": 0.27169257402420044, | |
| "rewards/Response_no_think_reward_1/mean": 0.359375, | |
| "rewards/Response_no_think_reward_1/std": 0.7605879902839661, | |
| "step": 159, | |
| "train_speed(iter/s)": 0.005878 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.003413711878238246, | |
| "clip_ratio/low_min": 0.003413711878238246, | |
| "clip_ratio/region_mean": 0.003413711878238246, | |
| "epoch": 1.775623268698061, | |
| "grad_norm": 1.9755946085728415, | |
| "kl": 1.1371133443899453, | |
| "learning_rate": 6.674916211254289e-06, | |
| "loss": 0.009400583803653717, | |
| "memory(GiB)": 79.43, | |
| "step": 160, | |
| "train_speed(iter/s)": 0.005873 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0028935185400769114, | |
| "clip_ratio/high_mean": 0.0028935185400769114, | |
| "clip_ratio/low_mean": 0.007061597076244652, | |
| "clip_ratio/low_min": 0.007061597076244652, | |
| "clip_ratio/region_mean": 0.009955115616321564, | |
| "completions/clipped_ratio": 0.1015625, | |
| "completions/max_length": 50.0, | |
| "completions/mean_length": 10.5625, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.7867036011080333, | |
| "grad_norm": 2.0459547550897166, | |
| "kl": 3.880769203417003, | |
| "learning_rate": 7.689418917193289e-05, | |
| "loss": 0.024239888414740562, | |
| "memory(GiB)": 77.36, | |
| "reward": 0.234375, | |
| "reward_std": 0.31300365924835205, | |
| "rewards/Response_no_think_reward_1/mean": 0.234375, | |
| "rewards/Response_no_think_reward_1/std": 0.7475352883338928, | |
| "step": 161, | |
| "train_speed(iter/s)": 0.21784 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.005787037080153823, | |
| "clip_ratio/high_mean": 0.005787037080153823, | |
| "clip_ratio/low_mean": 0.011741390626411885, | |
| "clip_ratio/low_min": 0.011741390626411885, | |
| "clip_ratio/region_mean": 0.017528427706565708, | |
| "epoch": 1.7977839335180055, | |
| "grad_norm": 1.6284449438133224, | |
| "kl": 3.9539552154019475, | |
| "learning_rate": 7.570198200967362e-05, | |
| "loss": 0.026077013462781906, | |
| "memory(GiB)": 77.36, | |
| "step": 162, | |
| "train_speed(iter/s)": 0.173972 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0007267441833391786, | |
| "clip_ratio/high_mean": 0.0007267441833391786, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0007267441833391786, | |
| "completions/clipped_ratio": 0.078125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 15.1875, | |
| "completions/min_length": 6.0, | |
| "epoch": 1.8088642659279779, | |
| "grad_norm": 6.190200790245519, | |
| "kl": 2.1185005172155797, | |
| "learning_rate": 7.451343403954856e-05, | |
| "loss": 0.015710504725575447, | |
| "memory(GiB)": 77.47, | |
| "reward": 0.46875, | |
| "reward_std": 0.11279275268316269, | |
| "rewards/Response_no_think_reward_1/mean": 0.46875, | |
| "rewards/Response_no_think_reward_1/std": 0.7310600280761719, | |
| "step": 163, | |
| "train_speed(iter/s)": 0.105292 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.010034247010480613, | |
| "clip_ratio/high_mean": 0.010034247010480613, | |
| "clip_ratio/low_mean": 0.0050670221680775285, | |
| "clip_ratio/low_min": 0.0050670221680775285, | |
| "clip_ratio/region_mean": 0.015101269178558141, | |
| "epoch": 1.8199445983379503, | |
| "grad_norm": 1.5020471792427759, | |
| "kl": 1.848701277282089, | |
| "learning_rate": 7.332872425251018e-05, | |
| "loss": 0.011468175798654556, | |
| "memory(GiB)": 77.47, | |
| "step": 164, | |
| "train_speed(iter/s)": 0.094243 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0031305171723943204, | |
| "clip_ratio/high_mean": 0.0031305171723943204, | |
| "clip_ratio/low_mean": 0.006101353617850691, | |
| "clip_ratio/low_min": 0.006101353617850691, | |
| "clip_ratio/region_mean": 0.00923187073203735, | |
| "completions/clipped_ratio": 0.0859375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 13.578125, | |
| "completions/min_length": 4.0, | |
| "epoch": 1.8310249307479225, | |
| "grad_norm": 1.5859082442887886, | |
| "kl": 3.1664798953570426, | |
| "learning_rate": 7.21480310614947e-05, | |
| "loss": 0.024385500699281693, | |
| "memory(GiB)": 77.47, | |
| "reward": 0.34375, | |
| "reward_std": 0.3683975338935852, | |
| "rewards/Response_no_think_reward_1/mean": 0.34375, | |
| "rewards/Response_no_think_reward_1/std": 0.692337155342102, | |
| "step": 165, | |
| "train_speed(iter/s)": 0.069824 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.019868265371769667, | |
| "clip_ratio/high_mean": 0.019868265371769667, | |
| "clip_ratio/low_mean": 0.011233113938942552, | |
| "clip_ratio/low_min": 0.011233113938942552, | |
| "clip_ratio/region_mean": 0.031101379543542862, | |
| "epoch": 1.8421052631578947, | |
| "grad_norm": 1.8023731350310037, | |
| "kl": 2.8112484337762, | |
| "learning_rate": 7.097153227455379e-05, | |
| "loss": 0.013743140734732151, | |
| "memory(GiB)": 79.43, | |
| "step": 166, | |
| "train_speed(iter/s)": 0.064907 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0011916428920812905, | |
| "clip_ratio/high_mean": 0.0011916428920812905, | |
| "clip_ratio/low_mean": 0.0034684768179431558, | |
| "clip_ratio/low_min": 0.0034684768179431558, | |
| "clip_ratio/region_mean": 0.004660119710024446, | |
| "completions/clipped_ratio": 0.046875, | |
| "completions/max_length": 31.0, | |
| "completions/mean_length": 9.9765625, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.8531855955678669, | |
| "grad_norm": 2.973635940137616, | |
| "kl": 2.157054567243904, | |
| "learning_rate": 6.97994050680772e-05, | |
| "loss": 0.017193181440234184, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.484375, | |
| "reward_std": 0.22119547426700592, | |
| "rewards/Response_no_think_reward_1/mean": 0.484375, | |
| "rewards/Response_no_think_reward_1/std": 0.7527835369110107, | |
| "step": 167, | |
| "train_speed(iter/s)": 0.052203 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.006835455656982958, | |
| "clip_ratio/high_mean": 0.006835455656982958, | |
| "clip_ratio/low_mean": 0.046273494604974985, | |
| "clip_ratio/low_min": 0.046273494604974985, | |
| "clip_ratio/region_mean": 0.05310894921422005, | |
| "epoch": 1.8642659279778393, | |
| "grad_norm": 1.4603345730407995, | |
| "kl": 3.1518404465168715, | |
| "learning_rate": 6.863182596011087e-05, | |
| "loss": 0.009599600918591022, | |
| "memory(GiB)": 79.43, | |
| "step": 168, | |
| "train_speed(iter/s)": 0.04954 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0006965868233237416, | |
| "clip_ratio/high_mean": 0.0006965868233237416, | |
| "clip_ratio/low_mean": 0.002629449882078916, | |
| "clip_ratio/low_min": 0.002629449882078916, | |
| "clip_ratio/region_mean": 0.003326036676298827, | |
| "completions/clipped_ratio": 0.0859375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 13.03125, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.8753462603878117, | |
| "grad_norm": 1.302354063269936, | |
| "kl": 1.0980142642074497, | |
| "learning_rate": 6.746897078377372e-05, | |
| "loss": 0.01619286648929119, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.359375, | |
| "reward_std": 0.31949180364608765, | |
| "rewards/Response_no_think_reward_1/mean": 0.359375, | |
| "rewards/Response_no_think_reward_1/std": 0.7810186743736267, | |
| "step": 169, | |
| "train_speed(iter/s)": 0.041791 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0037332845386117697, | |
| "clip_ratio/high_mean": 0.0037332845386117697, | |
| "clip_ratio/low_mean": 0.013076976756565273, | |
| "clip_ratio/low_min": 0.013076976756565273, | |
| "clip_ratio/region_mean": 0.016810261004138738, | |
| "epoch": 1.886426592797784, | |
| "grad_norm": 0.6775107653086064, | |
| "kl": 0.8065175649971934, | |
| "learning_rate": 6.6311014660778e-05, | |
| "loss": 0.005674303974956274, | |
| "memory(GiB)": 79.43, | |
| "step": 170, | |
| "train_speed(iter/s)": 0.040129 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0017115735390689224, | |
| "clip_ratio/high_mean": 0.0017115735390689224, | |
| "clip_ratio/low_mean": 0.004471359890885651, | |
| "clip_ratio/low_min": 0.004471359890885651, | |
| "clip_ratio/region_mean": 0.006182933488162234, | |
| "completions/clipped_ratio": 0.078125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 10.8359375, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.897506925207756, | |
| "grad_norm": 1.6323523762740895, | |
| "kl": 1.2415385083295405, | |
| "learning_rate": 6.515813197505656e-05, | |
| "loss": 0.01243288628757, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.265625, | |
| "reward_std": 0.25462424755096436, | |
| "rewards/Response_no_think_reward_1/mean": 0.265625, | |
| "rewards/Response_no_think_reward_1/std": 0.7475352883338928, | |
| "step": 171, | |
| "train_speed(iter/s)": 0.035141 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.015582295309286565, | |
| "clip_ratio/high_mean": 0.015582295309286565, | |
| "clip_ratio/low_mean": 0.010968676884658635, | |
| "clip_ratio/low_min": 0.010968676884658635, | |
| "clip_ratio/region_mean": 0.026550972019322217, | |
| "epoch": 1.9085872576177285, | |
| "grad_norm": 0.8010680473291589, | |
| "kl": 1.0659651298337849, | |
| "learning_rate": 6.401049634650118e-05, | |
| "loss": 4.9868394853547215e-05, | |
| "memory(GiB)": 79.43, | |
| "step": 172, | |
| "train_speed(iter/s)": 0.034005 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0024205285299103707, | |
| "clip_ratio/high_mean": 0.0024205285299103707, | |
| "clip_ratio/low_mean": 0.006205722645972855, | |
| "clip_ratio/low_min": 0.006205722645972855, | |
| "clip_ratio/region_mean": 0.008626251190435141, | |
| "completions/clipped_ratio": 0.078125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 10.5, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.919667590027701, | |
| "grad_norm": 2.2598530338882874, | |
| "kl": 3.693746126416954, | |
| "learning_rate": 6.286828060481626e-05, | |
| "loss": 0.02687670849263668, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.328125, | |
| "reward_std": 0.3272990882396698, | |
| "rewards/Response_no_think_reward_1/mean": 0.328125, | |
| "rewards/Response_no_think_reward_1/std": 0.7220855355262756, | |
| "step": 173, | |
| "train_speed(iter/s)": 0.030698 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.01826251167221926, | |
| "clip_ratio/high_mean": 0.01826251167221926, | |
| "clip_ratio/low_mean": 0.027282171708066016, | |
| "clip_ratio/low_min": 0.027282171708066016, | |
| "clip_ratio/region_mean": 0.04554468300193548, | |
| "epoch": 1.9307479224376731, | |
| "grad_norm": 2.095627271198394, | |
| "kl": 2.8586582938878564, | |
| "learning_rate": 6.173165676349103e-05, | |
| "loss": 0.017260747030377388, | |
| "memory(GiB)": 79.43, | |
| "step": 174, | |
| "train_speed(iter/s)": 0.029861 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.001936484724865295, | |
| "clip_ratio/high_mean": 0.001936484724865295, | |
| "clip_ratio/low_mean": 0.006831976061221212, | |
| "clip_ratio/low_min": 0.006831976061221212, | |
| "clip_ratio/region_mean": 0.008768460800638422, | |
| "completions/clipped_ratio": 0.1640625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 15.4453125, | |
| "completions/min_length": 4.0, | |
| "epoch": 1.9418282548476453, | |
| "grad_norm": 3.0827807424330964, | |
| "kl": 1.9612275282852352, | |
| "learning_rate": 6.060079599389521e-05, | |
| "loss": 0.020160475745797157, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.3125, | |
| "reward_std": 0.29061752557754517, | |
| "rewards/Response_no_think_reward_1/mean": 0.3125, | |
| "rewards/Response_no_think_reward_1/std": 0.6728714108467102, | |
| "step": 175, | |
| "train_speed(iter/s)": 0.027244 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.002366035128943622, | |
| "clip_ratio/high_mean": 0.002366035128943622, | |
| "clip_ratio/low_mean": 0.02325177617603913, | |
| "clip_ratio/low_min": 0.02325177617603913, | |
| "clip_ratio/region_mean": 0.02561781130498275, | |
| "epoch": 1.9529085872576177, | |
| "grad_norm": 1.4280426957771801, | |
| "kl": 2.292961670376826, | |
| "learning_rate": 5.947586859950103e-05, | |
| "loss": 0.010125662200152874, | |
| "memory(GiB)": 79.43, | |
| "step": 176, | |
| "train_speed(iter/s)": 0.026595 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0025192692410200834, | |
| "clip_ratio/high_mean": 0.0025192692410200834, | |
| "clip_ratio/low_mean": 0.008224956574849784, | |
| "clip_ratio/low_min": 0.008224956574849784, | |
| "clip_ratio/region_mean": 0.01074422593228519, | |
| "completions/clipped_ratio": 0.1328125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 14.640625, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.9639889196675901, | |
| "grad_norm": 1.6671459210295219, | |
| "kl": 2.1587753768544644, | |
| "learning_rate": 5.83570439902363e-05, | |
| "loss": 0.01727483607828617, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.3515625, | |
| "reward_std": 0.40715324878692627, | |
| "rewards/Response_no_think_reward_1/mean": 0.3515625, | |
| "rewards/Response_no_think_reward_1/std": 0.7273059487342834, | |
| "step": 177, | |
| "train_speed(iter/s)": 0.024303 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.010156267147976905, | |
| "clip_ratio/high_mean": 0.010156267147976905, | |
| "clip_ratio/low_mean": 0.044217503629624844, | |
| "clip_ratio/low_min": 0.044217503629624844, | |
| "clip_ratio/region_mean": 0.05437377095222473, | |
| "epoch": 1.9750692520775623, | |
| "grad_norm": 1.0768089968910826, | |
| "kl": 2.5309184610377997, | |
| "learning_rate": 5.7244490656971815e-05, | |
| "loss": 0.004669432528316975, | |
| "memory(GiB)": 79.43, | |
| "step": 178, | |
| "train_speed(iter/s)": 0.02381 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.004732780216727406, | |
| "clip_ratio/high_mean": 0.004732780216727406, | |
| "clip_ratio/low_mean": 0.008979557853308506, | |
| "clip_ratio/low_min": 0.008979557853308506, | |
| "clip_ratio/region_mean": 0.013712337939068675, | |
| "completions/clipped_ratio": 0.171875, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 10.34375, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.9861495844875345, | |
| "grad_norm": 5.022277357841641, | |
| "kl": 8.668162640184164, | |
| "learning_rate": 5.613837614614727e-05, | |
| "loss": 0.07592084258794785, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.359375, | |
| "reward_std": 0.43547919392585754, | |
| "rewards/Response_no_think_reward_1/mean": 0.359375, | |
| "rewards/Response_no_think_reward_1/std": 0.7395931482315063, | |
| "step": 179, | |
| "train_speed(iter/s)": 0.021893 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.012752994283800945, | |
| "clip_ratio/high_mean": 0.012752994283800945, | |
| "clip_ratio/low_mean": 0.013070159242488444, | |
| "clip_ratio/low_min": 0.013070159242488444, | |
| "clip_ratio/region_mean": 0.025823153846431524, | |
| "epoch": 1.997229916897507, | |
| "grad_norm": 3.8459944315903036, | |
| "kl": 5.999185686931014, | |
| "learning_rate": 5.503886703453933e-05, | |
| "loss": 0.05208824574947357, | |
| "memory(GiB)": 79.43, | |
| "step": 180, | |
| "train_speed(iter/s)": 0.02151 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.003978091655881144, | |
| "clip_ratio/high_mean": 0.003978091655881144, | |
| "clip_ratio/low_mean": 0.010502228324185126, | |
| "clip_ratio/low_min": 0.010502228324185126, | |
| "clip_ratio/region_mean": 0.0144803200091701, | |
| "completions/clipped_ratio": 0.21875, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 18.1328125, | |
| "completions/min_length": 3.0, | |
| "epoch": 2.011080332409972, | |
| "grad_norm": 2.078473476427749, | |
| "kl": 4.435361886702594, | |
| "learning_rate": 5.3946128904176e-05, | |
| "loss": 0.04282068833708763, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.3828125, | |
| "reward_std": 0.39536070823669434, | |
| "rewards/Response_no_think_reward_1/mean": 0.3828125, | |
| "rewards/Response_no_think_reward_1/std": 0.7542122602462769, | |
| "step": 181, | |
| "train_speed(iter/s)": 0.020048 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.008797917238553055, | |
| "clip_ratio/high_mean": 0.008797917238553055, | |
| "clip_ratio/low_mean": 0.032597673358395696, | |
| "clip_ratio/low_min": 0.032597673358395696, | |
| "clip_ratio/region_mean": 0.041395590524189174, | |
| "epoch": 2.0221606648199444, | |
| "grad_norm": 2.4243106079822865, | |
| "kl": 4.070879372608033, | |
| "learning_rate": 5.286032631740023e-05, | |
| "loss": 0.031270649284124374, | |
| "memory(GiB)": 79.43, | |
| "step": 182, | |
| "train_speed(iter/s)": 0.019738 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0034528043179307133, | |
| "clip_ratio/high_mean": 0.0034528043179307133, | |
| "clip_ratio/low_mean": 0.0063797495095059276, | |
| "clip_ratio/low_min": 0.0063797495095059276, | |
| "clip_ratio/region_mean": 0.00983255379833281, | |
| "completions/clipped_ratio": 0.078125, | |
| "completions/max_length": 41.0, | |
| "completions/mean_length": 11.1171875, | |
| "completions/min_length": 2.0, | |
| "epoch": 2.033240997229917, | |
| "grad_norm": 2.23823245032825, | |
| "kl": 6.291976309614256, | |
| "learning_rate": 5.1781622792087735e-05, | |
| "loss": 0.035929106175899506, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.3515625, | |
| "reward_std": 0.25183364748954773, | |
| "rewards/Response_no_think_reward_1/mean": 0.3515625, | |
| "rewards/Response_no_think_reward_1/std": 0.7895961403846741, | |
| "step": 183, | |
| "train_speed(iter/s)": 0.018597 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.005401399568654597, | |
| "clip_ratio/high_mean": 0.005401399568654597, | |
| "clip_ratio/low_mean": 0.017693198169581592, | |
| "clip_ratio/low_min": 0.017693198169581592, | |
| "clip_ratio/region_mean": 0.023094597971066833, | |
| "epoch": 2.044321329639889, | |
| "grad_norm": 1.8820731345647987, | |
| "kl": 5.607178944861516, | |
| "learning_rate": 5.071018077702161e-05, | |
| "loss": 0.026268446817994118, | |
| "memory(GiB)": 79.43, | |
| "step": 184, | |
| "train_speed(iter/s)": 0.018339 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0011341095669195056, | |
| "clip_ratio/high_mean": 0.0011341095669195056, | |
| "clip_ratio/low_mean": 0.002640133607201278, | |
| "clip_ratio/low_min": 0.002640133607201278, | |
| "clip_ratio/region_mean": 0.003774243174120784, | |
| "completions/clipped_ratio": 0.1171875, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 12.90625, | |
| "completions/min_length": 4.0, | |
| "epoch": 2.0554016620498614, | |
| "grad_norm": 1.162828426123081, | |
| "kl": 2.032533585326746, | |
| "learning_rate": 4.964616162742826e-05, | |
| "loss": 0.018750667572021484, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.4765625, | |
| "reward_std": 0.2650260925292969, | |
| "rewards/Response_no_think_reward_1/mean": 0.4765625, | |
| "rewards/Response_no_think_reward_1/std": 0.7205077409744263, | |
| "step": 185, | |
| "train_speed(iter/s)": 0.017419 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.023568872129544616, | |
| "clip_ratio/high_mean": 0.023568872129544616, | |
| "clip_ratio/low_mean": 0.003940592927392572, | |
| "clip_ratio/low_min": 0.003940592927392572, | |
| "clip_ratio/region_mean": 0.02750946453306824, | |
| "epoch": 2.0664819944598336, | |
| "grad_norm": 1.5607380960763384, | |
| "kl": 1.8544287201948464, | |
| "learning_rate": 4.8589725580677835e-05, | |
| "loss": 0.017856435850262642, | |
| "memory(GiB)": 79.43, | |
| "step": 186, | |
| "train_speed(iter/s)": 0.017196 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0021306818234734237, | |
| "clip_ratio/high_mean": 0.0021306818234734237, | |
| "clip_ratio/low_mean": 0.009969204489607364, | |
| "clip_ratio/low_min": 0.009969204489607364, | |
| "clip_ratio/region_mean": 0.01209988642949611, | |
| "completions/clipped_ratio": 0.1015625, | |
| "completions/max_length": 47.0, | |
| "completions/mean_length": 10.5859375, | |
| "completions/min_length": 3.0, | |
| "epoch": 2.0775623268698062, | |
| "grad_norm": 2.2199233392807804, | |
| "kl": 4.046690948307514, | |
| "learning_rate": 4.754103173215313e-05, | |
| "loss": 0.02398597076535225, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.6171875, | |
| "reward_std": 0.23733052611351013, | |
| "rewards/Response_no_think_reward_1/mean": 0.6171875, | |
| "rewards/Response_no_think_reward_1/std": 0.6413702368736267, | |
| "step": 187, | |
| "train_speed(iter/s)": 0.016352 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.012073863414116204, | |
| "clip_ratio/high_mean": 0.012073863414116204, | |
| "clip_ratio/low_mean": 0.029048353899270296, | |
| "clip_ratio/low_min": 0.029048353899270296, | |
| "clip_ratio/region_mean": 0.041122217662632465, | |
| "epoch": 2.0886426592797784, | |
| "grad_norm": 0.9728732612498153, | |
| "kl": 4.168077672366053, | |
| "learning_rate": 4.6500238011290295e-05, | |
| "loss": 0.013498052954673767, | |
| "memory(GiB)": 79.43, | |
| "step": 188, | |
| "train_speed(iter/s)": 0.016166 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0011479975655674934, | |
| "clip_ratio/high_mean": 0.0011479975655674934, | |
| "clip_ratio/low_mean": 0.01187260658480227, | |
| "clip_ratio/low_min": 0.01187260658480227, | |
| "clip_ratio/region_mean": 0.013020604150369763, | |
| "completions/clipped_ratio": 0.140625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 13.515625, | |
| "completions/min_length": 2.0, | |
| "epoch": 2.0997229916897506, | |
| "grad_norm": 2.9644587346763975, | |
| "kl": 2.9032904393970966, | |
| "learning_rate": 4.546750115779538e-05, | |
| "loss": 0.025254033505916595, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.390625, | |
| "reward_std": 0.3936568796634674, | |
| "rewards/Response_no_think_reward_1/mean": 0.390625, | |
| "rewards/Response_no_think_reward_1/std": 0.815541684627533, | |
| "step": 189, | |
| "train_speed(iter/s)": 0.015408 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.002348073641769588, | |
| "clip_ratio/high_mean": 0.002348073641769588, | |
| "clip_ratio/low_mean": 0.03768142650369555, | |
| "clip_ratio/low_min": 0.03768142650369555, | |
| "clip_ratio/region_mean": 0.04002950026188046, | |
| "epoch": 2.110803324099723, | |
| "grad_norm": 1.6848916127813878, | |
| "kl": 3.357306843623519, | |
| "learning_rate": 4.444297669803981e-05, | |
| "loss": 0.011942790821194649, | |
| "memory(GiB)": 79.43, | |
| "step": 190, | |
| "train_speed(iter/s)": 0.01525 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0038575184298679233, | |
| "clip_ratio/high_mean": 0.0038575184298679233, | |
| "clip_ratio/low_mean": 0.0018564801721367985, | |
| "clip_ratio/low_min": 0.0018564801721367985, | |
| "clip_ratio/region_mean": 0.005713998660212383, | |
| "completions/clipped_ratio": 0.1640625, | |
| "completions/max_length": 49.0, | |
| "completions/mean_length": 12.40625, | |
| "completions/min_length": 2.0, | |
| "epoch": 2.1218836565096955, | |
| "grad_norm": 2.185626617314445, | |
| "kl": 4.500719710253179, | |
| "learning_rate": 4.342681892163868e-05, | |
| "loss": 0.04343116655945778, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.3125, | |
| "reward_std": 0.3249424993991852, | |
| "rewards/Response_no_think_reward_1/mean": 0.3125, | |
| "rewards/Response_no_think_reward_1/std": 0.8108515739440918, | |
| "step": 191, | |
| "train_speed(iter/s)": 0.014605 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.005653464584611356, | |
| "clip_ratio/high_mean": 0.005653464584611356, | |
| "clip_ratio/low_mean": 0.014596144377719611, | |
| "clip_ratio/low_min": 0.014596144377719611, | |
| "clip_ratio/region_mean": 0.020249608729500324, | |
| "epoch": 2.1329639889196677, | |
| "grad_norm": 1.3831255673808591, | |
| "kl": 3.3093000794760883, | |
| "learning_rate": 4.241918085821547e-05, | |
| "loss": 0.025410175323486328, | |
| "memory(GiB)": 79.43, | |
| "step": 192, | |
| "train_speed(iter/s)": 0.014469 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0007621950935572386, | |
| "clip_ratio/high_mean": 0.0007621950935572386, | |
| "clip_ratio/low_mean": 0.016430354735348374, | |
| "clip_ratio/low_min": 0.016430354735348374, | |
| "clip_ratio/region_mean": 0.017192550061736256, | |
| "completions/clipped_ratio": 0.1875, | |
| "completions/max_length": 52.0, | |
| "completions/mean_length": 13.7578125, | |
| "completions/min_length": 3.0, | |
| "epoch": 2.14404432132964, | |
| "grad_norm": 4.027535318826777, | |
| "kl": 5.601793970912695, | |
| "learning_rate": 4.142021425435612e-05, | |
| "loss": 0.06872062385082245, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.171875, | |
| "reward_std": 0.3266732692718506, | |
| "rewards/Response_no_think_reward_1/mean": 0.171875, | |
| "rewards/Response_no_think_reward_1/std": 0.8334481716156006, | |
| "step": 193, | |
| "train_speed(iter/s)": 0.013947 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0032193634542636573, | |
| "clip_ratio/high_mean": 0.0032193634542636573, | |
| "clip_ratio/low_mean": 0.0076680079801008105, | |
| "clip_ratio/low_min": 0.0076680079801008105, | |
| "clip_ratio/region_mean": 0.010887371434364468, | |
| "epoch": 2.155124653739612, | |
| "grad_norm": 4.385106696987604, | |
| "kl": 3.2986946790479124, | |
| "learning_rate": 4.0430069550756665e-05, | |
| "loss": 0.057711075991392136, | |
| "memory(GiB)": 79.43, | |
| "step": 194, | |
| "train_speed(iter/s)": 0.013826 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0006905972259119153, | |
| "clip_ratio/high_mean": 0.0006905972259119153, | |
| "clip_ratio/low_mean": 0.0036786437267437577, | |
| "clip_ratio/low_min": 0.0036786437267437577, | |
| "clip_ratio/region_mean": 0.004369240894448012, | |
| "completions/clipped_ratio": 0.046875, | |
| "completions/max_length": 49.0, | |
| "completions/mean_length": 12.3359375, | |
| "completions/min_length": 6.0, | |
| "epoch": 2.1662049861495847, | |
| "grad_norm": 1.606761596776354, | |
| "kl": 1.8307960720267147, | |
| "learning_rate": 3.944889585956746e-05, | |
| "loss": 0.01529858261346817, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.53125, | |
| "reward_std": 0.13994136452674866, | |
| "rewards/Response_no_think_reward_1/mean": 0.53125, | |
| "rewards/Response_no_think_reward_1/std": 0.6010162234306335, | |
| "step": 195, | |
| "train_speed(iter/s)": 0.01337 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0014173414674587548, | |
| "clip_ratio/high_mean": 0.0014173414674587548, | |
| "clip_ratio/low_mean": 0.01785696716979146, | |
| "clip_ratio/low_min": 0.01785696716979146, | |
| "clip_ratio/region_mean": 0.019274308579042554, | |
| "epoch": 2.177285318559557, | |
| "grad_norm": 0.6605318527442696, | |
| "kl": 1.4683757405728102, | |
| "learning_rate": 3.847684094193733e-05, | |
| "loss": 0.006466372404247522, | |
| "memory(GiB)": 79.43, | |
| "step": 196, | |
| "train_speed(iter/s)": 0.013262 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0005787037080153823, | |
| "clip_ratio/high_mean": 0.0005787037080153823, | |
| "clip_ratio/low_mean": 0.00706394191365689, | |
| "clip_ratio/low_min": 0.00706394191365689, | |
| "clip_ratio/region_mean": 0.007642645505256951, | |
| "completions/clipped_ratio": 0.1171875, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 12.6640625, | |
| "completions/min_length": 4.0, | |
| "epoch": 2.188365650969529, | |
| "grad_norm": 2.268325311129086, | |
| "kl": 1.9495291512284894, | |
| "learning_rate": 3.751405118576138e-05, | |
| "loss": 0.021440906450152397, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.40625, | |
| "reward_std": 0.33038538694381714, | |
| "rewards/Response_no_think_reward_1/mean": 0.40625, | |
| "rewards/Response_no_think_reward_1/std": 0.692337155342102, | |
| "step": 197, | |
| "train_speed(iter/s)": 0.012815 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0015153939457377419, | |
| "clip_ratio/high_mean": 0.0015153939457377419, | |
| "clip_ratio/low_mean": 0.03491706313798204, | |
| "clip_ratio/low_min": 0.03491706313798204, | |
| "clip_ratio/region_mean": 0.03643245715647936, | |
| "epoch": 2.1994459833795013, | |
| "grad_norm": 1.065092801753265, | |
| "kl": 2.4326230198785197, | |
| "learning_rate": 3.6560671583635467e-05, | |
| "loss": 0.014199762605130672, | |
| "memory(GiB)": 79.43, | |
| "step": 198, | |
| "train_speed(iter/s)": 0.012721 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.002581158187240362, | |
| "clip_ratio/high_mean": 0.002581158187240362, | |
| "clip_ratio/low_mean": 0.0033617604058235884, | |
| "clip_ratio/low_min": 0.0033617604058235884, | |
| "clip_ratio/region_mean": 0.0059429185930639505, | |
| "completions/clipped_ratio": 0.09375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 11.40625, | |
| "completions/min_length": 2.0, | |
| "epoch": 2.2105263157894735, | |
| "grad_norm": 4.969169060239286, | |
| "kl": 2.6644327271496877, | |
| "learning_rate": 3.561684571102087e-05, | |
| "loss": 0.04970448464155197, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.609375, | |
| "reward_std": 0.189372718334198, | |
| "rewards/Response_no_think_reward_1/mean": 0.609375, | |
| "rewards/Response_no_think_reward_1/std": 0.617773175239563, | |
| "step": 199, | |
| "train_speed(iter/s)": 0.012318 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.007839692523702979, | |
| "clip_ratio/high_mean": 0.007839692523702979, | |
| "clip_ratio/low_mean": 0.007207914255559444, | |
| "clip_ratio/low_min": 0.007207914255559444, | |
| "clip_ratio/region_mean": 0.015047606895677745, | |
| "epoch": 2.221606648199446, | |
| "grad_norm": 1.5017699084351217, | |
| "kl": 1.7442057720618322, | |
| "learning_rate": 3.468271570462235e-05, | |
| "loss": 0.03236105293035507, | |
| "memory(GiB)": 79.43, | |
| "step": 200, | |
| "train_speed(iter/s)": 0.012235 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.011193181620910764, | |
| "clip_ratio/low_min": 0.011193181620910764, | |
| "clip_ratio/region_mean": 0.011193181620910764, | |
| "completions/clipped_ratio": 0.109375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 14.9140625, | |
| "completions/min_length": 3.0, | |
| "epoch": 2.2326869806094183, | |
| "grad_norm": 4.931712878754855, | |
| "kl": 5.507446703501046, | |
| "learning_rate": 3.375842224098281e-05, | |
| "loss": 0.04869800806045532, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.0546875, | |
| "reward_std": 0.13610614836215973, | |
| "rewards/Response_no_think_reward_1/mean": 0.0546875, | |
| "rewards/Response_no_think_reward_1/std": 0.9076108336448669, | |
| "step": 201, | |
| "train_speed(iter/s)": 0.011859 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0006249999860301614, | |
| "clip_ratio/high_mean": 0.0006249999860301614, | |
| "clip_ratio/low_mean": 0.01068181823939085, | |
| "clip_ratio/low_min": 0.01068181823939085, | |
| "clip_ratio/region_mean": 0.011306818574666977, | |
| "epoch": 2.2437673130193905, | |
| "grad_norm": 1.976139653305045, | |
| "kl": 2.772067047073506, | |
| "learning_rate": 3.2844104515298155e-05, | |
| "loss": 0.02979501150548458, | |
| "memory(GiB)": 79.43, | |
| "step": 202, | |
| "train_speed(iter/s)": 0.011784 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0021551724057644606, | |
| "clip_ratio/high_mean": 0.0021551724057644606, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0021551724057644606, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 15.109375, | |
| "completions/min_length": 2.0, | |
| "epoch": 2.254847645429363, | |
| "grad_norm": 1.5562382605817529, | |
| "kl": 0.8431436920873239, | |
| "learning_rate": 3.19399002204547e-05, | |
| "loss": 0.007927711121737957, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.5546875, | |
| "reward_std": 0.1965562254190445, | |
| "rewards/Response_no_think_reward_1/mean": 0.5546875, | |
| "rewards/Response_no_think_reward_1/std": 0.612322211265564, | |
| "step": 203, | |
| "train_speed(iter/s)": 0.011458 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.01512533612549305, | |
| "clip_ratio/high_mean": 0.01512533612549305, | |
| "clip_ratio/low_mean": 0.011428028345108032, | |
| "clip_ratio/low_min": 0.011428028345108032, | |
| "clip_ratio/region_mean": 0.026553363888524473, | |
| "epoch": 2.2659279778393353, | |
| "grad_norm": 0.7974321717950155, | |
| "kl": 0.8073496993965819, | |
| "learning_rate": 3.104594552629331e-05, | |
| "loss": -0.0036839484237134457, | |
| "memory(GiB)": 79.43, | |
| "step": 204, | |
| "train_speed(iter/s)": 0.011391 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0038362154737114906, | |
| "clip_ratio/high_mean": 0.0038362154737114906, | |
| "clip_ratio/low_mean": 0.006098126468714327, | |
| "clip_ratio/low_min": 0.006098126468714327, | |
| "clip_ratio/region_mean": 0.009934341884218156, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 9.859375, | |
| "completions/min_length": 3.0, | |
| "epoch": 2.2770083102493075, | |
| "grad_norm": 1.6738122176232313, | |
| "kl": 2.2672509452095255, | |
| "learning_rate": 3.016237505910272e-05, | |
| "loss": 0.019055092707276344, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.3828125, | |
| "reward_std": 0.24184317886829376, | |
| "rewards/Response_no_think_reward_1/mean": 0.3828125, | |
| "rewards/Response_no_think_reward_1/std": 0.6289736032485962, | |
| "step": 205, | |
| "train_speed(iter/s)": 0.011117 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.008882887894287705, | |
| "clip_ratio/high_mean": 0.008882887894287705, | |
| "clip_ratio/low_mean": 0.0127694628899917, | |
| "clip_ratio/low_min": 0.0127694628899917, | |
| "clip_ratio/region_mean": 0.021652350667864084, | |
| "epoch": 2.2880886426592797, | |
| "grad_norm": 1.7770705331591035, | |
| "kl": 2.6307186615886167, | |
| "learning_rate": 2.9289321881345254e-05, | |
| "loss": 0.020140212029218674, | |
| "memory(GiB)": 79.43, | |
| "step": 206, | |
| "train_speed(iter/s)": 0.011054 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0027895565144717693, | |
| "clip_ratio/high_mean": 0.0027895565144717693, | |
| "clip_ratio/low_mean": 0.004148252191953361, | |
| "clip_ratio/low_min": 0.004148252191953361, | |
| "clip_ratio/region_mean": 0.0069378085900098085, | |
| "completions/clipped_ratio": 0.09375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 11.28125, | |
| "completions/min_length": 2.0, | |
| "epoch": 2.299168975069252, | |
| "grad_norm": 1.319228923221061, | |
| "kl": 2.2385971848852932, | |
| "learning_rate": 2.8426917471618144e-05, | |
| "loss": 0.02266935259103775, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.3359375, | |
| "reward_std": 0.2283492535352707, | |
| "rewards/Response_no_think_reward_1/mean": 0.3359375, | |
| "rewards/Response_no_think_reward_1/std": 0.7018237709999084, | |
| "step": 207, | |
| "train_speed(iter/s)": 0.010791 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.011985209857812151, | |
| "clip_ratio/high_mean": 0.011985209857812151, | |
| "clip_ratio/low_mean": 0.007749008131213486, | |
| "clip_ratio/low_min": 0.007749008131213486, | |
| "clip_ratio/region_mean": 0.019734218367375433, | |
| "epoch": 2.3102493074792245, | |
| "grad_norm": 1.4392087091443533, | |
| "kl": 2.1376722818240523, | |
| "learning_rate": 2.7575291704853323e-05, | |
| "loss": 0.019175298511981964, | |
| "memory(GiB)": 79.43, | |
| "step": 208, | |
| "train_speed(iter/s)": 0.010735 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.005309505155310035, | |
| "clip_ratio/low_min": 0.005309505155310035, | |
| "clip_ratio/region_mean": 0.005309505155310035, | |
| "completions/clipped_ratio": 0.1484375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 13.78125, | |
| "completions/min_length": 2.0, | |
| "epoch": 2.3213296398891967, | |
| "grad_norm": 3.9723735950660957, | |
| "kl": 5.278170272591524, | |
| "learning_rate": 2.673457283275873e-05, | |
| "loss": 0.035180311650037766, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.40625, | |
| "reward_std": 0.13098980486392975, | |
| "rewards/Response_no_think_reward_1/mean": 0.40625, | |
| "rewards/Response_no_think_reward_1/std": 0.6692044734954834, | |
| "step": 209, | |
| "train_speed(iter/s)": 0.010491 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.005584693106357008, | |
| "clip_ratio/low_min": 0.005584693106357008, | |
| "clip_ratio/region_mean": 0.005584693106357008, | |
| "epoch": 2.332409972299169, | |
| "grad_norm": 1.3665368093756183, | |
| "kl": 2.833973544766195, | |
| "learning_rate": 2.5904887464504114e-05, | |
| "loss": 0.021212518215179443, | |
| "memory(GiB)": 79.43, | |
| "step": 210, | |
| "train_speed(iter/s)": 0.010441 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0037202382227405906, | |
| "clip_ratio/high_mean": 0.0037202382227405906, | |
| "clip_ratio/low_mean": 0.0047081211232580245, | |
| "clip_ratio/low_min": 0.0047081211232580245, | |
| "clip_ratio/region_mean": 0.008428359229583293, | |
| "completions/clipped_ratio": 0.109375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 13.515625, | |
| "completions/min_length": 2.0, | |
| "epoch": 2.343490304709141, | |
| "grad_norm": 13.071565563919009, | |
| "kl": 3.0507688876241446, | |
| "learning_rate": 2.5086360547654087e-05, | |
| "loss": 0.03715192899107933, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.3515625, | |
| "reward_std": 0.23045912384986877, | |
| "rewards/Response_no_think_reward_1/mean": 0.3515625, | |
| "rewards/Response_no_think_reward_1/std": 0.8189665675163269, | |
| "step": 211, | |
| "train_speed(iter/s)": 0.010202 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.003481080086203292, | |
| "clip_ratio/high_mean": 0.003481080086203292, | |
| "clip_ratio/low_mean": 0.006368864676915109, | |
| "clip_ratio/low_min": 0.006368864676915109, | |
| "clip_ratio/region_mean": 0.009849944588495418, | |
| "epoch": 2.3545706371191137, | |
| "grad_norm": 3.097490825276586, | |
| "kl": 2.710134948603809, | |
| "learning_rate": 2.4279115349351543e-05, | |
| "loss": 0.022687038406729698, | |
| "memory(GiB)": 79.43, | |
| "step": 212, | |
| "train_speed(iter/s)": 0.010156 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.002016128972172737, | |
| "clip_ratio/low_min": 0.002016128972172737, | |
| "clip_ratio/region_mean": 0.002016128972172737, | |
| "completions/clipped_ratio": 0.046875, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 10.421875, | |
| "completions/min_length": 2.0, | |
| "epoch": 2.365650969529086, | |
| "grad_norm": 1.136594776957956, | |
| "kl": 1.1303195441141725, | |
| "learning_rate": 2.3483273437754107e-05, | |
| "loss": 0.009659601375460625, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.390625, | |
| "reward_std": 0.10205793380737305, | |
| "rewards/Response_no_think_reward_1/mean": 0.390625, | |
| "rewards/Response_no_think_reward_1/std": 0.7342506647109985, | |
| "step": 213, | |
| "train_speed(iter/s)": 0.009943 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.006048386916518211, | |
| "clip_ratio/high_mean": 0.006048386916518211, | |
| "clip_ratio/low_mean": 0.00942321156617254, | |
| "clip_ratio/low_min": 0.00942321156617254, | |
| "clip_ratio/region_mean": 0.015471598482690752, | |
| "epoch": 2.376731301939058, | |
| "grad_norm": 0.825911363622962, | |
| "kl": 1.1256521647737827, | |
| "learning_rate": 2.26989546637263e-05, | |
| "loss": 0.005634521599858999, | |
| "memory(GiB)": 79.43, | |
| "step": 214, | |
| "train_speed(iter/s)": 0.009901 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.001342517207376659, | |
| "clip_ratio/high_mean": 0.001342517207376659, | |
| "clip_ratio/low_mean": 0.0013586956774815917, | |
| "clip_ratio/low_min": 0.0013586956774815917, | |
| "clip_ratio/region_mean": 0.0027012128848582506, | |
| "completions/clipped_ratio": 0.1328125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 15.6484375, | |
| "completions/min_length": 4.0, | |
| "epoch": 2.3878116343490303, | |
| "grad_norm": 1.6607743819090053, | |
| "kl": 1.4292651428841054, | |
| "learning_rate": 2.1926277142790552e-05, | |
| "loss": 0.01813752017915249, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.609375, | |
| "reward_std": 0.31577742099761963, | |
| "rewards/Response_no_think_reward_1/mean": 0.609375, | |
| "rewards/Response_no_think_reward_1/std": 0.6668102145195007, | |
| "step": 215, | |
| "train_speed(iter/s)": 0.009685 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0026189450873062015, | |
| "clip_ratio/high_mean": 0.0026189450873062015, | |
| "clip_ratio/low_mean": 0.0053210301557555795, | |
| "clip_ratio/low_min": 0.0053210301557555795, | |
| "clip_ratio/region_mean": 0.007939975359477103, | |
| "epoch": 2.398891966759003, | |
| "grad_norm": 1.3712211159888634, | |
| "kl": 1.414744115434587, | |
| "learning_rate": 2.116535723733938e-05, | |
| "loss": 0.01291576400399208, | |
| "memory(GiB)": 79.43, | |
| "step": 216, | |
| "train_speed(iter/s)": 0.009645 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.002932063478510827, | |
| "clip_ratio/high_mean": 0.002932063478510827, | |
| "clip_ratio/low_mean": 0.0015625000232830644, | |
| "clip_ratio/low_min": 0.0015625000232830644, | |
| "clip_ratio/region_mean": 0.004494563501793891, | |
| "completions/clipped_ratio": 0.0703125, | |
| "completions/max_length": 49.0, | |
| "completions/mean_length": 10.9296875, | |
| "completions/min_length": 2.0, | |
| "epoch": 2.409972299168975, | |
| "grad_norm": 6.046911872213327, | |
| "kl": 3.113054335270135, | |
| "learning_rate": 2.0416309539111654e-05, | |
| "loss": 0.050445497035980225, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.484375, | |
| "reward_std": 0.2109457552433014, | |
| "rewards/Response_no_think_reward_1/mean": 0.484375, | |
| "rewards/Response_no_think_reward_1/std": 0.8416741490364075, | |
| "step": 217, | |
| "train_speed(iter/s)": 0.009417 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0037691170582547784, | |
| "clip_ratio/high_mean": 0.0037691170582547784, | |
| "clip_ratio/low_mean": 0.0015625000232830644, | |
| "clip_ratio/low_min": 0.0015625000232830644, | |
| "clip_ratio/region_mean": 0.005331617081537843, | |
| "epoch": 2.4210526315789473, | |
| "grad_norm": 5.501927716874391, | |
| "kl": 2.3150660254395916, | |
| "learning_rate": 1.967924685193552e-05, | |
| "loss": 0.030173499137163162, | |
| "memory(GiB)": 79.43, | |
| "step": 218, | |
| "train_speed(iter/s)": 0.009382 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.0234375, | |
| "completions/max_length": 47.0, | |
| "completions/mean_length": 7.734375, | |
| "completions/min_length": 2.0, | |
| "epoch": 2.4321329639889195, | |
| "grad_norm": 1.8000862094404895, | |
| "kl": 1.0117176891799318, | |
| "learning_rate": 1.8954280174740537e-05, | |
| "loss": 0.009762465953826904, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.7265625, | |
| "reward_std": 0.19728107750415802, | |
| "rewards/Response_no_think_reward_1/mean": 0.7265625, | |
| "rewards/Response_no_think_reward_1/std": 0.5130554437637329, | |
| "step": 219, | |
| "train_speed(iter/s)": 0.009197 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.012120938044972718, | |
| "clip_ratio/high_mean": 0.012120938044972718, | |
| "clip_ratio/low_mean": 0.008152684022206813, | |
| "clip_ratio/low_min": 0.008152684022206813, | |
| "clip_ratio/region_mean": 0.020273622183594853, | |
| "epoch": 2.443213296398892, | |
| "grad_norm": 1.1304227715929336, | |
| "kl": 1.0098483412293717, | |
| "learning_rate": 1.824151868484164e-05, | |
| "loss": 0.002491909544914961, | |
| "memory(GiB)": 79.43, | |
| "step": 220, | |
| "train_speed(iter/s)": 0.009165 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.0390625, | |
| "completions/max_length": 38.0, | |
| "completions/mean_length": 10.0546875, | |
| "completions/min_length": 2.0, | |
| "epoch": 2.4542936288088644, | |
| "grad_norm": 0.7487543034262131, | |
| "kl": 2.248408433049917, | |
| "learning_rate": 1.7541069721497493e-05, | |
| "loss": 0.020080924034118652, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.5234375, | |
| "reward_std": 0.0765409916639328, | |
| "rewards/Response_no_think_reward_1/mean": 0.5234375, | |
| "rewards/Response_no_think_reward_1/std": 0.8320815563201904, | |
| "step": 221, | |
| "train_speed(iter/s)": 0.008978 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.002016128972172737, | |
| "clip_ratio/low_min": 0.002016128972172737, | |
| "clip_ratio/region_mean": 0.002016128972172737, | |
| "epoch": 2.4653739612188366, | |
| "grad_norm": 0.5471388079740459, | |
| "kl": 2.286591000854969, | |
| "learning_rate": 1.6853038769745467e-05, | |
| "loss": 0.020101318135857582, | |
| "memory(GiB)": 79.43, | |
| "step": 222, | |
| "train_speed(iter/s)": 0.008949 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00021186440426390618, | |
| "clip_ratio/high_mean": 0.00021186440426390618, | |
| "clip_ratio/low_mean": 0.008871822035871446, | |
| "clip_ratio/low_min": 0.008871822035871446, | |
| "clip_ratio/region_mean": 0.009083686396479607, | |
| "completions/clipped_ratio": 0.09375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 13.7109375, | |
| "completions/min_length": 2.0, | |
| "epoch": 2.4764542936288088, | |
| "grad_norm": 1.362062642699485, | |
| "kl": 2.5377135479357094, | |
| "learning_rate": 1.6177529444516194e-05, | |
| "loss": 0.02206542156636715, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.296875, | |
| "reward_std": 0.19568344950675964, | |
| "rewards/Response_no_think_reward_1/mean": 0.296875, | |
| "rewards/Response_no_think_reward_1/std": 0.8993381261825562, | |
| "step": 223, | |
| "train_speed(iter/s)": 0.008782 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0016772599192336202, | |
| "clip_ratio/high_mean": 0.0016772599192336202, | |
| "clip_ratio/low_mean": 0.006158006319310516, | |
| "clip_ratio/low_min": 0.006158006319310516, | |
| "clip_ratio/region_mean": 0.007835266180336475, | |
| "epoch": 2.487534626038781, | |
| "grad_norm": 1.146370544556826, | |
| "kl": 2.2770726842572913, | |
| "learning_rate": 1.551464347502929e-05, | |
| "loss": 0.019708380103111267, | |
| "memory(GiB)": 79.43, | |
| "step": 224, | |
| "train_speed(iter/s)": 0.008755 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0006412798393284902, | |
| "clip_ratio/high_mean": 0.0006412798393284902, | |
| "clip_ratio/low_mean": 0.005606794758932665, | |
| "clip_ratio/low_min": 0.005606794758932665, | |
| "clip_ratio/region_mean": 0.006248074598261155, | |
| "completions/clipped_ratio": 0.0390625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 11.546875, | |
| "completions/min_length": 3.0, | |
| "epoch": 2.4986149584487536, | |
| "grad_norm": 15.413339320982411, | |
| "kl": 8.634065281590665, | |
| "learning_rate": 1.486448068947348e-05, | |
| "loss": 0.12368878722190857, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.3828125, | |
| "reward_std": 0.24082913994789124, | |
| "rewards/Response_no_think_reward_1/mean": 0.3828125, | |
| "rewards/Response_no_think_reward_1/std": 0.7000685334205627, | |
| "step": 225, | |
| "train_speed(iter/s)": 0.008606 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.002233636550954543, | |
| "clip_ratio/high_mean": 0.002233636550954543, | |
| "clip_ratio/low_mean": 0.0067390410986263305, | |
| "clip_ratio/low_min": 0.0067390410986263305, | |
| "clip_ratio/region_mean": 0.008972677649580874, | |
| "epoch": 2.509695290858726, | |
| "grad_norm": 9.203465486887826, | |
| "kl": 6.063290272684753, | |
| "learning_rate": 1.42271389999728e-05, | |
| "loss": 0.08513150364160538, | |
| "memory(GiB)": 79.43, | |
| "step": 226, | |
| "train_speed(iter/s)": 0.008581 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0003799392143264413, | |
| "clip_ratio/high_mean": 0.0003799392143264413, | |
| "clip_ratio/low_mean": 0.0011398176429793239, | |
| "clip_ratio/low_min": 0.0011398176429793239, | |
| "clip_ratio/region_mean": 0.0015197568573057652, | |
| "completions/clipped_ratio": 0.0859375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 10.0390625, | |
| "completions/min_length": 3.0, | |
| "epoch": 2.520775623268698, | |
| "grad_norm": 2.120226005232822, | |
| "kl": 0.9155051370617002, | |
| "learning_rate": 1.360271438784133e-05, | |
| "loss": 0.010180685669183731, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.1484375, | |
| "reward_std": 0.1979907602071762, | |
| "rewards/Response_no_think_reward_1/mean": 0.1484375, | |
| "rewards/Response_no_think_reward_1/std": 0.7326990962028503, | |
| "step": 227, | |
| "train_speed(iter/s)": 0.008446 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0009498480358161032, | |
| "clip_ratio/high_mean": 0.0009498480358161032, | |
| "clip_ratio/low_mean": 0.009764322196133435, | |
| "clip_ratio/low_min": 0.009764322196133435, | |
| "clip_ratio/region_mean": 0.010714170290157199, | |
| "epoch": 2.5318559556786706, | |
| "grad_norm": 1.4078021108161598, | |
| "kl": 0.9818148800404742, | |
| "learning_rate": 1.2991300889128866e-05, | |
| "loss": 0.004585812333971262, | |
| "memory(GiB)": 79.43, | |
| "step": 228, | |
| "train_speed(iter/s)": 0.008423 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0011812333250418305, | |
| "clip_ratio/high_mean": 0.0011812333250418305, | |
| "clip_ratio/low_mean": 0.0039037082460708916, | |
| "clip_ratio/low_min": 0.0039037082460708916, | |
| "clip_ratio/region_mean": 0.005084941629320383, | |
| "completions/clipped_ratio": 0.0390625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 8.265625, | |
| "completions/min_length": 2.0, | |
| "epoch": 2.542936288088643, | |
| "grad_norm": 5.0825431269611965, | |
| "kl": 1.4881244308780879, | |
| "learning_rate": 1.2392990580459352e-05, | |
| "loss": 0.01816009357571602, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.265625, | |
| "reward_std": 0.19226360321044922, | |
| "rewards/Response_no_think_reward_1/mean": 0.265625, | |
| "rewards/Response_no_think_reward_1/std": 0.9004318714141846, | |
| "step": 229, | |
| "train_speed(iter/s)": 0.008282 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0009686482953839004, | |
| "clip_ratio/high_mean": 0.0009686482953839004, | |
| "clip_ratio/low_mean": 0.00444972823606804, | |
| "clip_ratio/low_min": 0.00444972823606804, | |
| "clip_ratio/region_mean": 0.0054183765314519405, | |
| "epoch": 2.554016620498615, | |
| "grad_norm": 5.947762469687869, | |
| "kl": 1.5637177263852209, | |
| "learning_rate": 1.1807873565164506e-05, | |
| "loss": 0.014085257425904274, | |
| "memory(GiB)": 79.43, | |
| "step": 230, | |
| "train_speed(iter/s)": 0.008261 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.001238734505022876, | |
| "clip_ratio/high_mean": 0.001238734505022876, | |
| "clip_ratio/low_mean": 0.0045786225236952305, | |
| "clip_ratio/low_min": 0.0045786225236952305, | |
| "clip_ratio/region_mean": 0.0058173570287181064, | |
| "completions/clipped_ratio": 0.1640625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 15.609375, | |
| "completions/min_length": 3.0, | |
| "epoch": 2.565096952908587, | |
| "grad_norm": 2.991093002864201, | |
| "kl": 2.183058348018676, | |
| "learning_rate": 1.1236037959714618e-05, | |
| "loss": 0.021889833733439445, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.4609375, | |
| "reward_std": 0.3135277330875397, | |
| "rewards/Response_no_think_reward_1/mean": 0.4609375, | |
| "rewards/Response_no_think_reward_1/std": 0.7827102541923523, | |
| "step": 231, | |
| "train_speed(iter/s)": 0.008131 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0028425113996490836, | |
| "clip_ratio/high_mean": 0.0028425113996490836, | |
| "clip_ratio/low_mean": 0.009468507007113658, | |
| "clip_ratio/low_min": 0.009468507007113658, | |
| "clip_ratio/region_mean": 0.012311018639593385, | |
| "epoch": 2.5761772853185594, | |
| "grad_norm": 2.565607083550086, | |
| "kl": 1.9908064976334572, | |
| "learning_rate": 1.067756988044848e-05, | |
| "loss": 0.016938552260398865, | |
| "memory(GiB)": 79.43, | |
| "step": 232, | |
| "train_speed(iter/s)": 0.008111 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0014164648891892284, | |
| "clip_ratio/high_mean": 0.0014164648891892284, | |
| "clip_ratio/low_mean": 0.0031525760132353753, | |
| "clip_ratio/low_min": 0.0031525760132353753, | |
| "clip_ratio/region_mean": 0.004569040902424604, | |
| "completions/clipped_ratio": 0.1015625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 9.75, | |
| "completions/min_length": 2.0, | |
| "epoch": 2.587257617728532, | |
| "grad_norm": 5.0565474550432326, | |
| "kl": 5.047875659758574, | |
| "learning_rate": 1.0132553430604608e-05, | |
| "loss": 0.07161970436573029, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.2265625, | |
| "reward_std": 0.17859892547130585, | |
| "rewards/Response_no_think_reward_1/mean": 0.2265625, | |
| "rewards/Response_no_think_reward_1/std": 0.7446908354759216, | |
| "step": 233, | |
| "train_speed(iter/s)": 0.008004 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.006010896002408117, | |
| "clip_ratio/high_mean": 0.006010896002408117, | |
| "clip_ratio/low_mean": 0.006369341921526939, | |
| "clip_ratio/low_min": 0.006369341921526939, | |
| "clip_ratio/region_mean": 0.01238023757468909, | |
| "epoch": 2.598337950138504, | |
| "grad_norm": 3.9632773907657626, | |
| "kl": 4.599423869600287, | |
| "learning_rate": 9.601070687655667e-06, | |
| "loss": 0.062261972576379776, | |
| "memory(GiB)": 79.43, | |
| "step": 234, | |
| "train_speed(iter/s)": 0.007986 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.001923076924867928, | |
| "clip_ratio/low_min": 0.001923076924867928, | |
| "clip_ratio/region_mean": 0.001923076924867928, | |
| "completions/clipped_ratio": 0.1015625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 9.453125, | |
| "completions/min_length": 2.0, | |
| "epoch": 2.6094182825484764, | |
| "grad_norm": 5.621375964647713, | |
| "kl": 4.620725775370374, | |
| "learning_rate": 9.083201690947763e-06, | |
| "loss": 0.0421258881688118, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.28125, | |
| "reward_std": 0.1468440443277359, | |
| "rewards/Response_no_think_reward_1/mean": 0.28125, | |
| "rewards/Response_no_think_reward_1/std": 0.7830638289451599, | |
| "step": 235, | |
| "train_speed(iter/s)": 0.007861 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.010077075916342437, | |
| "clip_ratio/high_mean": 0.010077075916342437, | |
| "clip_ratio/low_mean": 0.000961538462433964, | |
| "clip_ratio/low_min": 0.000961538462433964, | |
| "clip_ratio/region_mean": 0.01103861432056874, | |
| "epoch": 2.6204986149584486, | |
| "grad_norm": 4.170803291082545, | |
| "kl": 4.307271543191746, | |
| "learning_rate": 8.579024429646932e-06, | |
| "loss": 0.03107025846838951, | |
| "memory(GiB)": 79.43, | |
| "step": 236, | |
| "train_speed(iter/s)": 0.007844 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00024319066142197698, | |
| "clip_ratio/high_mean": 0.00024319066142197698, | |
| "clip_ratio/low_mean": 0.0016447368543595076, | |
| "clip_ratio/low_min": 0.0016447368543595076, | |
| "clip_ratio/region_mean": 0.0018879275157814845, | |
| "completions/clipped_ratio": 0.1015625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 12.21875, | |
| "completions/min_length": 2.0, | |
| "epoch": 2.6315789473684212, | |
| "grad_norm": 1.3493712018234787, | |
| "kl": 1.6652233960921876, | |
| "learning_rate": 8.088614830994223e-06, | |
| "loss": 0.015416830778121948, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.1640625, | |
| "reward_std": 0.21537472307682037, | |
| "rewards/Response_no_think_reward_1/mean": 0.1640625, | |
| "rewards/Response_no_think_reward_1/std": 0.7713097929954529, | |
| "step": 237, | |
| "train_speed(iter/s)": 0.007735 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0005482456181198359, | |
| "clip_ratio/high_mean": 0.0005482456181198359, | |
| "clip_ratio/low_mean": 0.0018879275157814845, | |
| "clip_ratio/low_min": 0.0018879275157814845, | |
| "clip_ratio/region_mean": 0.0024361731339013204, | |
| "epoch": 2.6426592797783934, | |
| "grad_norm": 1.3201384353784884, | |
| "kl": 1.5714624499087222, | |
| "learning_rate": 7.612046748871327e-06, | |
| "loss": 0.01534443162381649, | |
| "memory(GiB)": 79.43, | |
| "step": 238, | |
| "train_speed(iter/s)": 0.00772 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00204707685043104, | |
| "clip_ratio/high_mean": 0.00204707685043104, | |
| "clip_ratio/low_mean": 0.007919068011688069, | |
| "clip_ratio/low_min": 0.007919068011688069, | |
| "clip_ratio/region_mean": 0.009966144862119108, | |
| "completions/clipped_ratio": 0.125, | |
| "completions/max_length": 36.0, | |
| "completions/mean_length": 10.8515625, | |
| "completions/min_length": 2.0, | |
| "epoch": 2.6537396121883656, | |
| "grad_norm": 2.827545573836865, | |
| "kl": 1.8283915198408067, | |
| "learning_rate": 7.149391952678452e-06, | |
| "loss": 0.017831573262810707, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.2890625, | |
| "reward_std": 0.3461739718914032, | |
| "rewards/Response_no_think_reward_1/mean": 0.2890625, | |
| "rewards/Response_no_think_reward_1/std": 0.7852212190628052, | |
| "step": 239, | |
| "train_speed(iter/s)": 0.00762 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.005028763844165951, | |
| "clip_ratio/high_mean": 0.005028763844165951, | |
| "clip_ratio/low_mean": 0.008577116299420595, | |
| "clip_ratio/low_min": 0.008577116299420595, | |
| "clip_ratio/region_mean": 0.013605880201794207, | |
| "epoch": 2.664819944598338, | |
| "grad_norm": 3.1585454235161925, | |
| "kl": 1.771346734254621, | |
| "learning_rate": 6.700720116526116e-06, | |
| "loss": 0.01860269345343113, | |
| "memory(GiB)": 79.43, | |
| "step": 240, | |
| "train_speed(iter/s)": 0.007606 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0017265193164348602, | |
| "clip_ratio/high_mean": 0.0017265193164348602, | |
| "clip_ratio/low_mean": 0.0015245491813402623, | |
| "clip_ratio/low_min": 0.0015245491813402623, | |
| "clip_ratio/region_mean": 0.003251068526878953, | |
| "completions/clipped_ratio": 0.0390625, | |
| "completions/max_length": 46.0, | |
| "completions/mean_length": 8.765625, | |
| "completions/min_length": 2.0, | |
| "epoch": 2.67590027700831, | |
| "grad_norm": 2.4712156808930987, | |
| "kl": 3.0323174638469936, | |
| "learning_rate": 6.266098808742516e-06, | |
| "loss": 0.027942461892962456, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.2734375, | |
| "reward_std": 0.09069566428661346, | |
| "rewards/Response_no_think_reward_1/mean": 0.2734375, | |
| "rewards/Response_no_think_reward_1/std": 0.7908416986465454, | |
| "step": 241, | |
| "train_speed(iter/s)": 0.007496 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0027624310459941626, | |
| "clip_ratio/high_mean": 0.0027624310459941626, | |
| "clip_ratio/low_mean": 0.006610044481931254, | |
| "clip_ratio/low_min": 0.006610044481931254, | |
| "clip_ratio/region_mean": 0.009372475324198604, | |
| "epoch": 2.6869806094182827, | |
| "grad_norm": 1.4174226924918587, | |
| "kl": 2.842063266711193, | |
| "learning_rate": 5.8455934816979305e-06, | |
| "loss": 0.025462469086050987, | |
| "memory(GiB)": 79.43, | |
| "step": 242, | |
| "train_speed(iter/s)": 0.007483 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0027961052255705, | |
| "clip_ratio/low_min": 0.0027961052255705, | |
| "clip_ratio/region_mean": 0.0027961052255705, | |
| "completions/clipped_ratio": 0.0546875, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 10.0625, | |
| "completions/min_length": 2.0, | |
| "epoch": 2.698060941828255, | |
| "grad_norm": 2.4284263318080272, | |
| "kl": 1.1247594757005572, | |
| "learning_rate": 5.439267461947883e-06, | |
| "loss": 0.013277001678943634, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.4765625, | |
| "reward_std": 0.2019251585006714, | |
| "rewards/Response_no_think_reward_1/mean": 0.4765625, | |
| "rewards/Response_no_think_reward_1/std": 0.8031909465789795, | |
| "step": 243, | |
| "train_speed(iter/s)": 0.007378 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00271630787756294, | |
| "clip_ratio/high_mean": 0.00271630787756294, | |
| "clip_ratio/low_mean": 0.003980028559453785, | |
| "clip_ratio/low_min": 0.003980028559453785, | |
| "clip_ratio/region_mean": 0.0066963364370167255, | |
| "epoch": 2.709141274238227, | |
| "grad_norm": 1.999946631431668, | |
| "kl": 1.150102037936449, | |
| "learning_rate": 5.047181940696333e-06, | |
| "loss": 0.011227283626794815, | |
| "memory(GiB)": 79.43, | |
| "step": 244, | |
| "train_speed(iter/s)": 0.007365 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.003839633078314364, | |
| "clip_ratio/high_mean": 0.003839633078314364, | |
| "clip_ratio/low_mean": 0.002922048792243004, | |
| "clip_ratio/low_min": 0.002922048792243004, | |
| "clip_ratio/region_mean": 0.006761681521311402, | |
| "completions/clipped_ratio": 0.0390625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 10.1875, | |
| "completions/min_length": 2.0, | |
| "epoch": 2.7202216066481997, | |
| "grad_norm": 114.02408735149653, | |
| "kl": 4.607287279635784, | |
| "learning_rate": 4.669395964580614e-06, | |
| "loss": 0.09313861280679703, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.265625, | |
| "reward_std": 0.22673699259757996, | |
| "rewards/Response_no_think_reward_1/mean": 0.265625, | |
| "rewards/Response_no_think_reward_1/std": 0.7475352883338928, | |
| "step": 245, | |
| "train_speed(iter/s)": 0.00727 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.004987254389561713, | |
| "clip_ratio/high_mean": 0.004987254389561713, | |
| "clip_ratio/low_mean": 0.005028058891184628, | |
| "clip_ratio/low_min": 0.005028058891184628, | |
| "clip_ratio/region_mean": 0.01001531328074634, | |
| "completions/clipped_ratio": 0.125, | |
| "completions/max_length": 32.0, | |
| "completions/mean_length": 9.0390625, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.6472060050041701, | |
| "grad_norm": 7.885151261057047, | |
| "kl": 4.317316887667403, | |
| "learning_rate": 0.0001363371892680654, | |
| "loss": 0.06505110114812851, | |
| "memory(GiB)": 77.36, | |
| "reward": 0.390625, | |
| "reward_std": 0.2467075139284134, | |
| "rewards/Response_no_think_reward_1/mean": 0.390625, | |
| "rewards/Response_no_think_reward_1/std": 0.7124801278114319, | |
| "step": 246, | |
| "train_speed(iter/s)": 0.212467 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.008637543302029371, | |
| "clip_ratio/high_mean": 0.008637543302029371, | |
| "clip_ratio/low_mean": 0.007979447836987674, | |
| "clip_ratio/low_min": 0.007979447836987674, | |
| "clip_ratio/region_mean": 0.016616990906186402, | |
| "epoch": 1.6538782318598833, | |
| "grad_norm": 9.765727829411468, | |
| "kl": 5.302235448267311, | |
| "learning_rate": 0.00013581952149432303, | |
| "loss": 0.07505911588668823, | |
| "memory(GiB)": 77.36, | |
| "step": 247, | |
| "train_speed(iter/s)": 0.182988 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00024900399148464203, | |
| "clip_ratio/high_mean": 0.00024900399148464203, | |
| "clip_ratio/low_mean": 0.006602977169677615, | |
| "clip_ratio/low_min": 0.006602977169677615, | |
| "clip_ratio/region_mean": 0.006851981161162257, | |
| "completions/clipped_ratio": 0.1484375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 13.0625, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.6605504587155964, | |
| "grad_norm": 5.732775568700692, | |
| "kl": 7.248534864047542, | |
| "learning_rate": 0.0001353007501870137, | |
| "loss": 0.07064881920814514, | |
| "memory(GiB)": 77.47, | |
| "reward": 0.0234375, | |
| "reward_std": 0.21814784407615662, | |
| "rewards/Response_no_think_reward_1/mean": 0.0234375, | |
| "rewards/Response_no_think_reward_1/std": 0.8080777525901794, | |
| "step": 248, | |
| "train_speed(iter/s)": 0.101239 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.009486032678978518, | |
| "clip_ratio/high_mean": 0.009486032678978518, | |
| "clip_ratio/low_mean": 0.01039744314039126, | |
| "clip_ratio/low_min": 0.01039744314039126, | |
| "clip_ratio/region_mean": 0.019883474858943373, | |
| "epoch": 1.6672226855713093, | |
| "grad_norm": 6.377381125669229, | |
| "kl": 2.9445294842589647, | |
| "learning_rate": 0.00013478089132852716, | |
| "loss": 0.08124249428510666, | |
| "memory(GiB)": 77.47, | |
| "step": 249, | |
| "train_speed(iter/s)": 0.094255 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0010964912362396717, | |
| "clip_ratio/high_mean": 0.0010964912362396717, | |
| "clip_ratio/low_mean": 0.003289473708719015, | |
| "clip_ratio/low_min": 0.003289473708719015, | |
| "clip_ratio/region_mean": 0.004385964944958687, | |
| "completions/clipped_ratio": 0.125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 7.9140625, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.6738949124270226, | |
| "grad_norm": 1.96116793666507, | |
| "kl": 2.669485174041256, | |
| "learning_rate": 0.0001342599609347585, | |
| "loss": 0.02923566661775112, | |
| "memory(GiB)": 77.47, | |
| "reward": -0.0625, | |
| "reward_std": 0.09127141535282135, | |
| "rewards/Response_no_think_reward_1/mean": -0.0625, | |
| "rewards/Response_no_think_reward_1/std": 0.9200308322906494, | |
| "step": 250, | |
| "train_speed(iter/s)": 0.065352 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.005629746010527015, | |
| "clip_ratio/high_mean": 0.005629746010527015, | |
| "clip_ratio/low_mean": 0.0412575276568532, | |
| "clip_ratio/low_min": 0.0412575276568532, | |
| "clip_ratio/region_mean": 0.04688727576285601, | |
| "epoch": 1.6805671392827355, | |
| "grad_norm": 1.933812668241347, | |
| "kl": 3.5041955505930673, | |
| "learning_rate": 0.000133737975054615, | |
| "loss": 0.024076396599411964, | |
| "memory(GiB)": 79.43, | |
| "step": 251, | |
| "train_speed(iter/s)": 0.062446 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00119566879584454, | |
| "clip_ratio/high_mean": 0.00119566879584454, | |
| "clip_ratio/low_mean": 0.0004687021573772654, | |
| "clip_ratio/low_min": 0.0004687021573772654, | |
| "clip_ratio/region_mean": 0.0016643709386698902, | |
| "completions/clipped_ratio": 0.140625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 12.6953125, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.6872393661384488, | |
| "grad_norm": 2.4412702069582983, | |
| "kl": 3.9371446361765265, | |
| "learning_rate": 0.00013321494976952132, | |
| "loss": 0.03714549541473389, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.1796875, | |
| "reward_std": 0.13782459497451782, | |
| "rewards/Response_no_think_reward_1/mean": 0.1796875, | |
| "rewards/Response_no_think_reward_1/std": 0.9258628487586975, | |
| "step": 252, | |
| "train_speed(iter/s)": 0.047385 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.007317493204027414, | |
| "clip_ratio/high_mean": 0.007317493204027414, | |
| "clip_ratio/low_mean": 0.005186333088204265, | |
| "clip_ratio/low_min": 0.005186333088204265, | |
| "clip_ratio/region_mean": 0.012503825942985713, | |
| "epoch": 1.6939115929941617, | |
| "grad_norm": 4.580377931462122, | |
| "kl": 1.7039022920653224, | |
| "learning_rate": 0.00013269090119292444, | |
| "loss": 0.021267667412757874, | |
| "memory(GiB)": 79.43, | |
| "step": 253, | |
| "train_speed(iter/s)": 0.045915 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0008462663099635392, | |
| "clip_ratio/high_mean": 0.0008462663099635392, | |
| "clip_ratio/low_mean": 0.005740528285969049, | |
| "clip_ratio/low_min": 0.005740528285969049, | |
| "clip_ratio/region_mean": 0.006586794595932588, | |
| "completions/clipped_ratio": 0.1328125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 13.03125, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.700583819849875, | |
| "grad_norm": 2.9913603629745245, | |
| "kl": 1.2227803394198418, | |
| "learning_rate": 0.00013216584546979702, | |
| "loss": 0.01559203490614891, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.015625, | |
| "reward_std": 0.27663108706474304, | |
| "rewards/Response_no_think_reward_1/mean": 0.015625, | |
| "rewards/Response_no_think_reward_1/std": 0.9555834531784058, | |
| "step": 254, | |
| "train_speed(iter/s)": 0.037104 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.007223855180200189, | |
| "clip_ratio/high_mean": 0.007223855180200189, | |
| "clip_ratio/low_mean": 0.10893735339050181, | |
| "clip_ratio/low_min": 0.10893735339050181, | |
| "clip_ratio/region_mean": 0.11616120918188244, | |
| "epoch": 1.707256046705588, | |
| "grad_norm": 1.9655670074579659, | |
| "kl": 2.0845303861424327, | |
| "learning_rate": 0.00013163979877614, | |
| "loss": 0.011529060080647469, | |
| "memory(GiB)": 79.43, | |
| "step": 255, | |
| "train_speed(iter/s)": 0.036232 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.006948165129870176, | |
| "clip_ratio/high_mean": 0.006948165129870176, | |
| "clip_ratio/low_mean": 0.00925130266114138, | |
| "clip_ratio/low_min": 0.00925130266114138, | |
| "clip_ratio/region_mean": 0.01619946787832305, | |
| "completions/clipped_ratio": 0.359375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 14.140625, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.713928273561301, | |
| "grad_norm": 4.730855130110655, | |
| "kl": 5.062177191488445, | |
| "learning_rate": 0.00013111277731848442, | |
| "loss": 0.05786250904202461, | |
| "memory(GiB)": 79.43, | |
| "reward": -0.0859375, | |
| "reward_std": 0.410529226064682, | |
| "rewards/Response_no_think_reward_1/mean": -0.0859375, | |
| "rewards/Response_no_think_reward_1/std": 0.869675874710083, | |
| "step": 256, | |
| "train_speed(iter/s)": 0.033266 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.014393029327038676, | |
| "clip_ratio/high_mean": 0.014393029327038676, | |
| "clip_ratio/low_mean": 0.1303235706873238, | |
| "clip_ratio/low_min": 0.1303235706873238, | |
| "clip_ratio/region_mean": 0.14471660286653787, | |
| "epoch": 1.7206005004170142, | |
| "grad_norm": 6.110613692874304, | |
| "kl": 6.920241659507155, | |
| "learning_rate": 0.00013058479733339185, | |
| "loss": 0.0579487606883049, | |
| "memory(GiB)": 79.43, | |
| "step": 257, | |
| "train_speed(iter/s)": 0.032582 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0021560846944339573, | |
| "clip_ratio/high_mean": 0.0021560846944339573, | |
| "clip_ratio/low_mean": 0.027111168601550162, | |
| "clip_ratio/low_min": 0.027111168601550162, | |
| "clip_ratio/region_mean": 0.029267253237776458, | |
| "completions/clipped_ratio": 0.296875, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 9.203125, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.7272727272727273, | |
| "grad_norm": 13.319715864612775, | |
| "kl": 13.24667002509068, | |
| "learning_rate": 0.00013005587508695444, | |
| "loss": 0.12780021131038666, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.109375, | |
| "reward_std": 0.3405221104621887, | |
| "rewards/Response_no_think_reward_1/mean": 0.109375, | |
| "rewards/Response_no_think_reward_1/std": 0.8982430100440979, | |
| "step": 258, | |
| "train_speed(iter/s)": 0.030335 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.025854239764157683, | |
| "clip_ratio/high_mean": 0.025854239764157683, | |
| "clip_ratio/low_mean": 0.02940721553750336, | |
| "clip_ratio/low_min": 0.02940721553750336, | |
| "clip_ratio/region_mean": 0.055261454777792096, | |
| "epoch": 1.7339449541284404, | |
| "grad_norm": 7.873376409391432, | |
| "kl": 3.398330974082228, | |
| "learning_rate": 0.00012952602687429362, | |
| "loss": 0.08237586915493011, | |
| "memory(GiB)": 79.43, | |
| "step": 259, | |
| "train_speed(iter/s)": 0.029779 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0010593220358714461, | |
| "clip_ratio/high_mean": 0.0010593220358714461, | |
| "clip_ratio/low_mean": 0.025134949712082744, | |
| "clip_ratio/low_min": 0.025134949712082744, | |
| "clip_ratio/region_mean": 0.02619427174795419, | |
| "completions/clipped_ratio": 0.3828125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 11.0390625, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.7406171809841533, | |
| "grad_norm": 5.622914024348242, | |
| "kl": 8.146455611102283, | |
| "learning_rate": 0.00012899526901905822, | |
| "loss": 0.09567078202962875, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.046875, | |
| "reward_std": 0.30238547921180725, | |
| "rewards/Response_no_think_reward_1/mean": 0.046875, | |
| "rewards/Response_no_think_reward_1/std": 0.8681537508964539, | |
| "step": 260, | |
| "train_speed(iter/s)": 0.028068 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.01715171878458932, | |
| "clip_ratio/high_mean": 0.01715171878458932, | |
| "clip_ratio/low_mean": 0.0735002284636721, | |
| "clip_ratio/low_min": 0.0735002284636721, | |
| "clip_ratio/region_mean": 0.0906519484706223, | |
| "epoch": 1.7472894078398666, | |
| "grad_norm": 8.808673951478834, | |
| "kl": 5.425452136900276, | |
| "learning_rate": 0.00012846361787292136, | |
| "loss": 0.08871767669916153, | |
| "memory(GiB)": 79.43, | |
| "step": 261, | |
| "train_speed(iter/s)": 0.027598 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.000811688310932368, | |
| "clip_ratio/high_mean": 0.000811688310932368, | |
| "clip_ratio/low_mean": 0.009334841219242662, | |
| "clip_ratio/low_min": 0.009334841219242662, | |
| "clip_ratio/region_mean": 0.01014652947196737, | |
| "completions/clipped_ratio": 0.3984375, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 10.890625, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.7539616346955795, | |
| "grad_norm": 9.615584503884596, | |
| "kl": 8.083851436153054, | |
| "learning_rate": 0.00012793108981507694, | |
| "loss": 0.11578933149576187, | |
| "memory(GiB)": 79.43, | |
| "reward": -0.0859375, | |
| "reward_std": 0.41268494725227356, | |
| "rewards/Response_no_think_reward_1/mean": -0.0859375, | |
| "rewards/Response_no_think_reward_1/std": 0.8605742454528809, | |
| "step": 262, | |
| "train_speed(iter/s)": 0.02625 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.020523510698694736, | |
| "clip_ratio/high_mean": 0.020523510698694736, | |
| "clip_ratio/low_mean": 0.04563906986732036, | |
| "clip_ratio/low_min": 0.04563906986732036, | |
| "clip_ratio/region_mean": 0.0661625819047913, | |
| "epoch": 1.7606338615512929, | |
| "grad_norm": 30.924872115013905, | |
| "kl": 3.7772719897329807, | |
| "learning_rate": 0.0001273977012517348, | |
| "loss": 0.21410413086414337, | |
| "memory(GiB)": 79.43, | |
| "step": 263, | |
| "train_speed(iter/s)": 0.025852 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0010416667209938169, | |
| "clip_ratio/high_mean": 0.0010416667209938169, | |
| "clip_ratio/low_mean": 0.013979690615087748, | |
| "clip_ratio/low_min": 0.013979690615087748, | |
| "clip_ratio/region_mean": 0.015021357336081564, | |
| "completions/clipped_ratio": 0.140625, | |
| "completions/max_length": 41.0, | |
| "completions/mean_length": 7.9609375, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.7673060884070058, | |
| "grad_norm": 2.801515232228881, | |
| "kl": 1.5485301897861063, | |
| "learning_rate": 0.00012686346861561537, | |
| "loss": 0.014268179424107075, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.015625, | |
| "reward_std": 0.2223242074251175, | |
| "rewards/Response_no_think_reward_1/mean": 0.015625, | |
| "rewards/Response_no_think_reward_1/std": 0.8227510452270508, | |
| "step": 264, | |
| "train_speed(iter/s)": 0.024697 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0018305982230231166, | |
| "clip_ratio/high_mean": 0.0018305982230231166, | |
| "clip_ratio/low_mean": 0.0754491506377235, | |
| "clip_ratio/low_min": 0.0754491506377235, | |
| "clip_ratio/region_mean": 0.07727974897716194, | |
| "epoch": 1.773978315262719, | |
| "grad_norm": 5.020289308786792, | |
| "kl": 4.038693455513567, | |
| "learning_rate": 0.0001263284083654435, | |
| "loss": 0.035946328192949295, | |
| "memory(GiB)": 79.43, | |
| "step": 265, | |
| "train_speed(iter/s)": 0.024353 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0015625000232830644, | |
| "clip_ratio/high_mean": 0.0015625000232830644, | |
| "clip_ratio/low_mean": 0.011535812984220684, | |
| "clip_ratio/low_min": 0.011535812984220684, | |
| "clip_ratio/region_mean": 0.013098313007503748, | |
| "completions/clipped_ratio": 0.2421875, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 7.0546875, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.780650542118432, | |
| "grad_norm": 4.823867965705569, | |
| "kl": 5.8212087393421825, | |
| "learning_rate": 0.00012579253698544125, | |
| "loss": 0.07973380386829376, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.0078125, | |
| "reward_std": 0.30061954259872437, | |
| "rewards/Response_no_think_reward_1/mean": 0.0078125, | |
| "rewards/Response_no_think_reward_1/std": 0.6459577083587646, | |
| "step": 266, | |
| "train_speed(iter/s)": 0.023359 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0031250000465661287, | |
| "clip_ratio/high_mean": 0.0031250000465661287, | |
| "clip_ratio/low_mean": 0.11317632021382451, | |
| "clip_ratio/low_min": 0.11317632021382451, | |
| "clip_ratio/region_mean": 0.11630132002756, | |
| "epoch": 1.787322768974145, | |
| "grad_norm": 11.546843380663908, | |
| "kl": 10.476074979640543, | |
| "learning_rate": 0.00012525587098482005, | |
| "loss": 0.09422159940004349, | |
| "memory(GiB)": 79.43, | |
| "step": 267, | |
| "train_speed(iter/s)": 0.023058 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.000811688310932368, | |
| "clip_ratio/high_mean": 0.000811688310932368, | |
| "clip_ratio/low_mean": 0.006867786491056904, | |
| "clip_ratio/low_min": 0.006867786491056904, | |
| "clip_ratio/region_mean": 0.007679474772885442, | |
| "completions/clipped_ratio": 0.1328125, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 9.8515625, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.7939949958298582, | |
| "grad_norm": 48.055640901825676, | |
| "kl": 22.36742792606401, | |
| "learning_rate": 0.0001247184268972722, | |
| "loss": 0.4101108908653259, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.125, | |
| "reward_std": 0.2585597634315491, | |
| "rewards/Response_no_think_reward_1/mean": 0.125, | |
| "rewards/Response_no_think_reward_1/std": 0.6274557709693909, | |
| "step": 268, | |
| "train_speed(iter/s)": 0.022062 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00529984722379595, | |
| "clip_ratio/high_mean": 0.00529984722379595, | |
| "clip_ratio/low_mean": 0.01420470466837287, | |
| "clip_ratio/low_min": 0.01420470466837287, | |
| "clip_ratio/region_mean": 0.01950455189216882, | |
| "epoch": 1.8006672226855713, | |
| "grad_norm": 10.145223773494124, | |
| "kl": 7.905034697459087, | |
| "learning_rate": 0.00012418022128046142, | |
| "loss": 0.22370362281799316, | |
| "memory(GiB)": 79.43, | |
| "step": 269, | |
| "train_speed(iter/s)": 0.021799 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0020380434580147266, | |
| "clip_ratio/high_mean": 0.0020380434580147266, | |
| "clip_ratio/low_mean": 0.004399414756335318, | |
| "clip_ratio/low_min": 0.004399414756335318, | |
| "clip_ratio/region_mean": 0.006437458097934723, | |
| "completions/clipped_ratio": 0.1640625, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 9.84375, | |
| "completions/min_length": 3.0, | |
| "epoch": 1.8073394495412844, | |
| "grad_norm": 2.925526379332068, | |
| "kl": 1.9621957493945956, | |
| "learning_rate": 0.0001236412707155127, | |
| "loss": 0.02435774728655815, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.34375, | |
| "reward_std": 0.22380223870277405, | |
| "rewards/Response_no_think_reward_1/mean": 0.34375, | |
| "rewards/Response_no_think_reward_1/std": 0.6329222321510315, | |
| "step": 270, | |
| "train_speed(iter/s)": 0.021038 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.027234246022999287, | |
| "clip_ratio/high_mean": 0.027234246022999287, | |
| "clip_ratio/low_mean": 0.014790827757678926, | |
| "clip_ratio/low_min": 0.014790827757678926, | |
| "clip_ratio/region_mean": 0.04202507343143225, | |
| "epoch": 1.8140116763969973, | |
| "grad_norm": 7.85150802599005, | |
| "kl": 1.2954727746546268, | |
| "learning_rate": 0.0001231015918065016, | |
| "loss": 0.046614713966846466, | |
| "memory(GiB)": 79.43, | |
| "step": 271, | |
| "train_speed(iter/s)": 0.020801 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0007812500116415322, | |
| "clip_ratio/high_mean": 0.0007812500116415322, | |
| "clip_ratio/low_mean": 0.008673313190229237, | |
| "clip_ratio/low_min": 0.008673313190229237, | |
| "clip_ratio/region_mean": 0.00945456320187077, | |
| "completions/clipped_ratio": 0.125, | |
| "completions/max_length": 23.0, | |
| "completions/mean_length": 8.578125, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.8206839032527107, | |
| "grad_norm": 5.663376365839488, | |
| "kl": 3.0526226649526507, | |
| "learning_rate": 0.00012256120117994245, | |
| "loss": 0.029910365119576454, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.2578125, | |
| "reward_std": 0.2626354694366455, | |
| "rewards/Response_no_think_reward_1/mean": 0.2578125, | |
| "rewards/Response_no_think_reward_1/std": 0.70147305727005, | |
| "step": 272, | |
| "train_speed(iter/s)": 0.020032 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.003040286072064191, | |
| "clip_ratio/high_mean": 0.003040286072064191, | |
| "clip_ratio/low_mean": 0.06708688009530306, | |
| "clip_ratio/low_min": 0.06708688009530306, | |
| "clip_ratio/region_mean": 0.07012716663302854, | |
| "epoch": 1.8273561301084236, | |
| "grad_norm": 4.421434755408977, | |
| "kl": 5.31667997315526, | |
| "learning_rate": 0.0001220201154842765, | |
| "loss": 0.03301015496253967, | |
| "memory(GiB)": 79.43, | |
| "step": 273, | |
| "train_speed(iter/s)": 0.019826 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.007332374923862517, | |
| "clip_ratio/low_min": 0.007332374923862517, | |
| "clip_ratio/region_mean": 0.007332374923862517, | |
| "completions/clipped_ratio": 0.1796875, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 11.125, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.834028356964137, | |
| "grad_norm": 1.9255495711888, | |
| "kl": 2.3658070964738727, | |
| "learning_rate": 0.00012147835138935868, | |
| "loss": 0.040864668786525726, | |
| "memory(GiB)": 79.43, | |
| "reward": -0.3203125, | |
| "reward_std": 0.22869102656841278, | |
| "rewards/Response_no_think_reward_1/mean": -0.3203125, | |
| "rewards/Response_no_think_reward_1/std": 0.7091482281684875, | |
| "step": 274, | |
| "train_speed(iter/s)": 0.019168 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.014975278521887958, | |
| "clip_ratio/high_mean": 0.014975278521887958, | |
| "clip_ratio/low_mean": 0.056431527715176344, | |
| "clip_ratio/low_min": 0.056431527715176344, | |
| "clip_ratio/region_mean": 0.07140680588781834, | |
| "epoch": 1.8407005838198498, | |
| "grad_norm": 1.7607705528260904, | |
| "kl": 2.3127799107460305, | |
| "learning_rate": 0.00012093592558594416, | |
| "loss": 0.021540286019444466, | |
| "memory(GiB)": 79.43, | |
| "step": 275, | |
| "train_speed(iter/s)": 0.018983 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.00027173911803402007, | |
| "clip_ratio/high_mean": 0.00027173911803402007, | |
| "clip_ratio/low_mean": 0.0030319468351081014, | |
| "clip_ratio/low_min": 0.0030319468351081014, | |
| "clip_ratio/region_mean": 0.003303685924038291, | |
| "completions/clipped_ratio": 0.1171875, | |
| "completions/max_length": 51.0, | |
| "completions/mean_length": 10.21875, | |
| "completions/min_length": 5.0, | |
| "epoch": 1.847372810675563, | |
| "grad_norm": 1.3845096214977168, | |
| "kl": 0.5768661912588868, | |
| "learning_rate": 0.00012039285478517417, | |
| "loss": 0.005703174974769354, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.296875, | |
| "reward_std": 0.31093141436576843, | |
| "rewards/Response_no_think_reward_1/mean": 0.296875, | |
| "rewards/Response_no_think_reward_1/std": 0.6563964486122131, | |
| "step": 276, | |
| "train_speed(iter/s)": 0.018355 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.02822316304082051, | |
| "clip_ratio/high_mean": 0.02822316304082051, | |
| "clip_ratio/low_mean": 0.023227162193506956, | |
| "clip_ratio/low_min": 0.023227162193506956, | |
| "clip_ratio/region_mean": 0.05145032424479723, | |
| "epoch": 1.854045037531276, | |
| "grad_norm": 2.277051850874954, | |
| "kl": 1.444888403537334, | |
| "learning_rate": 0.00011984915571806108, | |
| "loss": 0.004672436509281397, | |
| "memory(GiB)": 79.43, | |
| "step": 277, | |
| "train_speed(iter/s)": 0.018189 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.006991013826336712, | |
| "clip_ratio/high_mean": 0.006991013826336712, | |
| "clip_ratio/low_mean": 0.009722222341224551, | |
| "clip_ratio/low_min": 0.009722222341224551, | |
| "clip_ratio/region_mean": 0.016713236400391906, | |
| "completions/clipped_ratio": 0.0703125, | |
| "completions/max_length": 25.0, | |
| "completions/mean_length": 6.9765625, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.8607172643869891, | |
| "grad_norm": 35.77457650983362, | |
| "kl": 31.698298294795677, | |
| "learning_rate": 0.000119304845134973, | |
| "loss": 0.27273401618003845, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.1015625, | |
| "reward_std": 0.17464229464530945, | |
| "rewards/Response_no_think_reward_1/mean": 0.1015625, | |
| "rewards/Response_no_think_reward_1/std": 0.6621350049972534, | |
| "step": 278, | |
| "train_speed(iter/s)": 0.017652 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.009891506866551936, | |
| "clip_ratio/high_mean": 0.009891506866551936, | |
| "clip_ratio/low_mean": 0.0069444444961845875, | |
| "clip_ratio/low_min": 0.0069444444961845875, | |
| "clip_ratio/region_mean": 0.016835951362736523, | |
| "epoch": 1.8673894912427023, | |
| "grad_norm": 4.542577039630815, | |
| "kl": 3.7718499208567664, | |
| "learning_rate": 0.00011875993980511773, | |
| "loss": 0.07798631489276886, | |
| "memory(GiB)": 79.43, | |
| "step": 279, | |
| "train_speed(iter/s)": 0.017502 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.002536526066251099, | |
| "clip_ratio/high_mean": 0.002536526066251099, | |
| "clip_ratio/low_mean": 0.0024038462433964014, | |
| "clip_ratio/low_min": 0.0024038462433964014, | |
| "clip_ratio/region_mean": 0.0049403723096475005, | |
| "completions/clipped_ratio": 0.0859375, | |
| "completions/max_length": 27.0, | |
| "completions/mean_length": 8.1484375, | |
| "completions/min_length": 2.0, | |
| "epoch": 1.8740617180984154, | |
| "grad_norm": 2.8417572027389006, | |
| "kl": 3.5999494855445846, | |
| "learning_rate": 0.00011821445651602616, | |
| "loss": 0.038278549909591675, | |
| "memory(GiB)": 79.43, | |
| "reward": 0.078125, | |
| "reward_std": 0.18506525456905365, | |
| "rewards/Response_no_think_reward_1/mean": 0.078125, | |
| "rewards/Response_no_think_reward_1/std": 0.7797574400901794, | |
| "step": 280, | |
| "train_speed(iter/s)": 0.016994 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 596, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 4, | |
| "save_steps": 5, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 0.0, | |
| "train_batch_size": 8, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |