diff --git "a/trainer_state.json" "b/trainer_state.json" --- "a/trainer_state.json" +++ "b/trainer_state.json" @@ -2,9 +2,9 @@ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, - "epoch": 1.443213296398892, + "epoch": 1.6925373134328359, "eval_steps": 500, - "global_step": 130, + "global_step": 140, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, @@ -15,22 +15,22 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "completions/clipped_ratio": 0.0234375, - "completions/max_length": 101.0, - "completions/mean_length": 14.6328125, + "completions/clipped_ratio": 0.0625, + "completions/max_length": 51.0, + "completions/mean_length": 16.09375, "completions/min_length": 2.0, - "epoch": 0.0110803324099723, - "grad_norm": 1.5475432762019699, + "epoch": 0.011940298507462687, + "grad_norm": 3.1591623828063176, "kl": 0.0, "learning_rate": 2.2222222222222223e-05, - "loss": 5.587935447692871e-09, - "memory(GiB)": 77.28, - "reward": 0.25, - "reward_std": 0.7772719860076904, - "rewards/Response_no_think_reward/mean": 0.25, - "rewards/Response_no_think_reward/std": 1.4795188903808594, + "loss": -3.725290298461914e-09, + "memory(GiB)": 77.11, + "reward": 0.1484375, + "reward_std": 0.7272911071777344, + "rewards/Response_no_think_reward_1/mean": 0.1484375, + "rewards/Response_no_think_reward_1/std": 0.9646495580673218, "step": 1, - "train_speed(iter/s)": 0.001043 + "train_speed(iter/s)": 0.001668 }, { "clip_ratio/high_max": 0.0, @@ -38,2450 +38,2640 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "epoch": 0.0221606648199446, - "grad_norm": 1.552548658770951, + "epoch": 0.023880597014925373, + "grad_norm": 3.150729002521691, "kl": 0.0, "learning_rate": 4.4444444444444447e-05, - "loss": 5.587935447692871e-09, - "memory(GiB)": 78.06, + "loss": -3.725290298461914e-09, + "memory(GiB)": 77.11, "step": 2, - "train_speed(iter/s)": 0.001737 + "train_speed(iter/s)": 0.002544 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.0, - "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.0, - "completions/clipped_ratio": 0.03125, - "completions/max_length": 101.0, - "completions/mean_length": 17.8828125, - "completions/min_length": 3.0, - "epoch": 0.0332409972299169, - "grad_norm": 1.291839688026328, - "kl": 0.0012106498143111821, + "clip_ratio/low_mean": 0.0028647197177633643, + "clip_ratio/low_min": 0.0028647197177633643, + "clip_ratio/region_mean": 0.0028647197177633643, + "completions/clipped_ratio": 0.0390625, + "completions/max_length": 51.0, + "completions/mean_length": 14.59375, + "completions/min_length": 2.0, + "epoch": 0.03582089552238806, + "grad_norm": 2.067277005959865, + "kl": 0.0022258755707298405, "learning_rate": 6.666666666666667e-05, - "loss": 0.0004578572406899184, - "memory(GiB)": 78.06, - "reward": 0.25, - "reward_std": 0.8250656127929688, - "rewards/Response_no_think_reward/mean": 0.25, - "rewards/Response_no_think_reward/std": 1.4634658098220825, + "loss": -0.0004270445788279176, + "memory(GiB)": 77.3, + "reward": -0.3828125, + "reward_std": 0.707726001739502, + "rewards/Response_no_think_reward_1/mean": -0.3828125, + "rewards/Response_no_think_reward_1/std": 0.923201322555542, "step": 3, - "train_speed(iter/s)": 0.001451 + "train_speed(iter/s)": 0.002313 }, { - "clip_ratio/high_max": 0.004197790374746546, - "clip_ratio/high_mean": 0.004197790374746546, - "clip_ratio/low_mean": 0.012020835361909121, - "clip_ratio/low_min": 0.012020835361909121, - "clip_ratio/region_mean": 0.01621862585307099, - "epoch": 0.0443213296398892, - "grad_norm": 1.0301802967661304, - "kl": 0.005412253500253428, + "clip_ratio/high_max": 0.003551179339410737, + "clip_ratio/high_mean": 0.003551179339410737, + "clip_ratio/low_mean": 0.025148934859316796, + "clip_ratio/low_min": 0.025148934859316796, + "clip_ratio/region_mean": 0.028700114460662007, + "epoch": 0.04776119402985075, + "grad_norm": 1.6109973009110337, + "kl": 0.007886729676101822, "learning_rate": 8.888888888888889e-05, - "loss": -0.005840146914124489, - "memory(GiB)": 78.06, + "loss": -0.010280434973537922, + "memory(GiB)": 77.3, "step": 4, - "train_speed(iter/s)": 0.001769 + "train_speed(iter/s)": 0.002696 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.002237339736893773, - "clip_ratio/low_min": 0.002237339736893773, - "clip_ratio/region_mean": 0.002237339736893773, - "completions/clipped_ratio": 0.0078125, - "completions/max_length": 101.0, - "completions/mean_length": 12.5546875, + "clip_ratio/low_mean": 0.0019339247373864055, + "clip_ratio/low_min": 0.0019339247373864055, + "clip_ratio/region_mean": 0.0019339247373864055, + "completions/clipped_ratio": 0.0390625, + "completions/max_length": 51.0, + "completions/mean_length": 13.5390625, "completions/min_length": 3.0, - "epoch": 0.055401662049861494, - "grad_norm": 2.027395284218205, - "kl": 0.014184385421685874, + "epoch": 0.05970149253731343, + "grad_norm": 2.893722550507481, + "kl": 0.010198775078606559, "learning_rate": 0.00011111111111111112, - "loss": 0.0008896891959011555, - "memory(GiB)": 78.06, - "reward": 0.8515625, - "reward_std": 0.5118520259857178, - "rewards/Response_no_think_reward/mean": 0.8515625, - "rewards/Response_no_think_reward/std": 1.4147136211395264, + "loss": 0.0004082494997419417, + "memory(GiB)": 77.52, + "reward": 0.125, + "reward_std": 0.493943989276886, + "rewards/Response_no_think_reward_1/mean": 0.125, + "rewards/Response_no_think_reward_1/std": 0.9881184101104736, "step": 5, - "train_speed(iter/s)": 0.00164 + "train_speed(iter/s)": 0.002517 }, { - "clip_ratio/high_max": 0.013844632252585143, - "clip_ratio/high_mean": 0.013844632252585143, - "clip_ratio/low_mean": 0.043920744908973575, - "clip_ratio/low_min": 0.043920744908973575, - "clip_ratio/region_mean": 0.05776537861675024, - "epoch": 0.0664819944598338, - "grad_norm": 6.212168397356187, - "kl": 1.7603500080003869, + "clip_ratio/high_max": 0.028469400480389595, + "clip_ratio/high_mean": 0.028469400480389595, + "clip_ratio/low_mean": 0.04948427155613899, + "clip_ratio/low_min": 0.04948427155613899, + "clip_ratio/region_mean": 0.07795367110520601, + "epoch": 0.07164179104477612, + "grad_norm": 1.5585579234945925, + "kl": 0.6935355372261256, "learning_rate": 0.00013333333333333334, - "loss": 0.01842591166496277, - "memory(GiB)": 79.98, + "loss": -0.005084950476884842, + "memory(GiB)": 79.48, "step": 6, - "train_speed(iter/s)": 0.00185 + "train_speed(iter/s)": 0.002759 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.001959657238330692, - "clip_ratio/low_min": 0.001959657238330692, - "clip_ratio/region_mean": 0.001959657238330692, - "completions/clipped_ratio": 0.0, - "completions/max_length": 70.0, - "completions/mean_length": 10.359375, - "completions/min_length": 2.0, - "epoch": 0.07756232686980609, - "grad_norm": 3.537674599924329, - "kl": 0.33545287084416486, + "clip_ratio/low_mean": 0.0010160960373468697, + "clip_ratio/low_min": 0.0010160960373468697, + "clip_ratio/region_mean": 0.0010160960373468697, + "completions/clipped_ratio": 0.0078125, + "completions/max_length": 51.0, + "completions/mean_length": 11.9296875, + "completions/min_length": 3.0, + "epoch": 0.08358208955223881, + "grad_norm": 1.7579177577957044, + "kl": 0.07463712914614007, "learning_rate": 0.00015555555555555556, - "loss": 0.0018048422643914819, - "memory(GiB)": 79.98, - "reward": 0.53125, - "reward_std": 0.6121620535850525, - "rewards/Response_no_think_reward/mean": 0.53125, - "rewards/Response_no_think_reward/std": 1.3685873746871948, + "loss": 0.0008710746187716722, + "memory(GiB)": 79.48, + "reward": -0.0390625, + "reward_std": 0.6340709924697876, + "rewards/Response_no_think_reward_1/mean": -0.0390625, + "rewards/Response_no_think_reward_1/std": 0.9992307424545288, "step": 7, - "train_speed(iter/s)": 0.001773 + "train_speed(iter/s)": 0.002622 }, { - "clip_ratio/high_max": 0.014042179333046079, - "clip_ratio/high_mean": 0.014042179333046079, - "clip_ratio/low_mean": 0.03925089433323592, - "clip_ratio/low_min": 0.03925089433323592, - "clip_ratio/region_mean": 0.053293074015527964, - "epoch": 0.0886426592797784, - "grad_norm": 2.64201486377639, - "kl": 1.295830228133127, + "clip_ratio/high_max": 0.02714990673121065, + "clip_ratio/high_mean": 0.02714990673121065, + "clip_ratio/low_mean": 0.03809016165905632, + "clip_ratio/low_min": 0.03809016165905632, + "clip_ratio/region_mean": 0.06524006789550185, + "epoch": 0.0955223880597015, + "grad_norm": 1.2730547516178623, + "kl": 0.21840606682235375, "learning_rate": 0.00017777777777777779, - "loss": 0.011679837480187416, - "memory(GiB)": 79.98, + "loss": -0.013987341895699501, + "memory(GiB)": 79.48, "step": 8, - "train_speed(iter/s)": 0.001932 + "train_speed(iter/s)": 0.002802 }, { - "clip_ratio/high_max": 0.0011001251987181604, - "clip_ratio/high_mean": 0.0011001251987181604, - "clip_ratio/low_mean": 0.008499634364852682, - "clip_ratio/low_min": 0.008499634364852682, - "clip_ratio/region_mean": 0.009599759563570842, - "completions/clipped_ratio": 0.0, - "completions/max_length": 62.0, - "completions/mean_length": 11.4375, - "completions/min_length": 2.0, - "epoch": 0.0997229916897507, - "grad_norm": 4.1929387792795065, - "kl": 2.5014250652166083, + "clip_ratio/high_max": 0.0009191176504828036, + "clip_ratio/high_mean": 0.0009191176504828036, + "clip_ratio/low_mean": 0.0018382353009656072, + "clip_ratio/low_min": 0.0018382353009656072, + "clip_ratio/region_mean": 0.0027573530096560717, + "completions/clipped_ratio": 0.0078125, + "completions/max_length": 51.0, + "completions/mean_length": 10.3828125, + "completions/min_length": 3.0, + "epoch": 0.10746268656716418, + "grad_norm": 3.3295900087180645, + "kl": 0.35752939723897725, "learning_rate": 0.0002, - "loss": 0.016260012984275818, - "memory(GiB)": 79.98, - "reward": 0.2734375, - "reward_std": 0.8412302732467651, - "rewards/Response_no_think_reward/mean": 0.2734375, - "rewards/Response_no_think_reward/std": 1.384474277496338, + "loss": 0.003791232593357563, + "memory(GiB)": 79.48, + "reward": 0.328125, + "reward_std": 0.5329009890556335, + "rewards/Response_no_think_reward_1/mean": 0.328125, + "rewards/Response_no_think_reward_1/std": 0.9483460783958435, "step": 9, - "train_speed(iter/s)": 0.001887 - }, - { - "clip_ratio/high_max": 0.02779325417941436, - "clip_ratio/high_mean": 0.02779325417941436, - "clip_ratio/low_mean": 0.07855538238072768, - "clip_ratio/low_min": 0.07855538238072768, - "clip_ratio/region_mean": 0.10634863609448075, - "epoch": 0.11080332409972299, - "grad_norm": 990.7609804346584, - "kl": 1.6530181597918272, - "learning_rate": 0.00019998312416333227, - "loss": 1.336751103401184, - "memory(GiB)": 79.98, + "train_speed(iter/s)": 0.002657 + }, + { + "clip_ratio/high_max": 0.03471234819153324, + "clip_ratio/high_mean": 0.03471234819153324, + "clip_ratio/low_mean": 0.045793990429956466, + "clip_ratio/low_min": 0.045793990429956466, + "clip_ratio/region_mean": 0.08050633978564292, + "epoch": 0.11940298507462686, + "grad_norm": 3.037041883710677, + "kl": 1.3611202164320275, + "learning_rate": 0.00019997998037428526, + "loss": -0.0012767184525728226, + "memory(GiB)": 79.48, "step": 10, - "train_speed(iter/s)": 0.002015 + "train_speed(iter/s)": 0.002798 }, { - "clip_ratio/high_max": 0.001354054023977369, - "clip_ratio/high_mean": 0.001354054023977369, - "clip_ratio/low_mean": 0.004174399145995267, - "clip_ratio/low_min": 0.004174399145995267, - "clip_ratio/region_mean": 0.005528453169972636, - "completions/clipped_ratio": 0.0546875, - "completions/max_length": 101.0, - "completions/mean_length": 26.453125, - "completions/min_length": 3.0, - "epoch": 0.12188365650969529, - "grad_norm": 1.115304569915306, - "kl": 0.3547552889212966, - "learning_rate": 0.00019993250234920636, - "loss": 0.005897670052945614, - "memory(GiB)": 79.98, - "reward": 0.5234375, - "reward_std": 0.876558780670166, - "rewards/Response_no_think_reward/mean": 0.5234375, - "rewards/Response_no_think_reward/std": 1.4251114130020142, + "clip_ratio/high_max": 0.0022767678019590676, + "clip_ratio/high_mean": 0.0022767678019590676, + "clip_ratio/low_mean": 0.004576534847728908, + "clip_ratio/low_min": 0.004576534847728908, + "clip_ratio/region_mean": 0.006853302649687976, + "completions/clipped_ratio": 0.015625, + "completions/max_length": 51.0, + "completions/mean_length": 11.3828125, + "completions/min_length": 3.0, + "epoch": 0.13134328358208955, + "grad_norm": 1.1988213220999966, + "kl": 0.176690819360374, + "learning_rate": 0.00019991992951284932, + "loss": 0.0002530772762838751, + "memory(GiB)": 79.48, + "reward": 0.2890625, + "reward_std": 0.36220550537109375, + "rewards/Response_no_think_reward_1/mean": 0.2890625, + "rewards/Response_no_think_reward_1/std": 0.9487027525901794, "step": 11, - "train_speed(iter/s)": 0.001964 - }, - { - "clip_ratio/high_max": 0.02347446102066897, - "clip_ratio/high_mean": 0.02347446102066897, - "clip_ratio/low_mean": 0.0428259114123648, - "clip_ratio/low_min": 0.0428259114123648, - "clip_ratio/region_mean": 0.06630037224385887, - "epoch": 0.1329639889196676, - "grad_norm": 2.183295109715178, - "kl": 0.6218942860141397, - "learning_rate": 0.00019984815164333163, - "loss": 0.007074224762618542, - "memory(GiB)": 79.98, + "train_speed(iter/s)": 0.002687 + }, + { + "clip_ratio/high_max": 0.010013980441726744, + "clip_ratio/high_mean": 0.010013980441726744, + "clip_ratio/low_mean": 0.0431372388266027, + "clip_ratio/low_min": 0.0431372388266027, + "clip_ratio/region_mean": 0.053151219501160085, + "epoch": 0.14328358208955225, + "grad_norm": 4.4251813995519464, + "kl": 3.680493631065474, + "learning_rate": 0.00019981987145960755, + "loss": 0.022724991664290428, + "memory(GiB)": 79.48, "step": 12, - "train_speed(iter/s)": 0.00207 + "train_speed(iter/s)": 0.002804 }, { - "clip_ratio/high_max": 0.0, - "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.001206563669256866, - "clip_ratio/low_min": 0.001206563669256866, - "clip_ratio/region_mean": 0.001206563669256866, - "completions/clipped_ratio": 0.0, - "completions/max_length": 83.0, - "completions/mean_length": 14.0234375, - "completions/min_length": 4.0, - "epoch": 0.1440443213296399, - "grad_norm": 1.0424369292135751, - "kl": 0.40942037590866676, - "learning_rate": 0.00019973010051548275, - "loss": 0.004908258095383644, - "memory(GiB)": 79.98, - "reward": 0.5625, - "reward_std": 0.7038782835006714, - "rewards/Response_no_think_reward/mean": 0.5625, - "rewards/Response_no_think_reward/std": 1.2720495462417603, + "clip_ratio/high_max": 0.000480769231216982, + "clip_ratio/high_mean": 0.000480769231216982, + "clip_ratio/low_mean": 0.0022044407669454813, + "clip_ratio/low_min": 0.0022044407669454813, + "clip_ratio/region_mean": 0.0026852099981624633, + "completions/clipped_ratio": 0.0078125, + "completions/max_length": 51.0, + "completions/mean_length": 12.0703125, + "completions/min_length": 3.0, + "epoch": 0.15522388059701492, + "grad_norm": 2.0136556426936285, + "kl": 0.14468206313904375, + "learning_rate": 0.00019967984627705548, + "loss": -0.00039299592026509345, + "memory(GiB)": 79.48, + "reward": 0.0625, + "reward_std": 0.6480826735496521, + "rewards/Response_no_think_reward_1/mean": 0.0625, + "rewards/Response_no_think_reward_1/std": 0.9861242175102234, "step": 13, - "train_speed(iter/s)": 0.002042 - }, - { - "clip_ratio/high_max": 0.017414433998055756, - "clip_ratio/high_mean": 0.017414433998055756, - "clip_ratio/low_mean": 0.028266766399610788, - "clip_ratio/low_min": 0.028266766399610788, - "clip_ratio/region_mean": 0.04568120092153549, - "epoch": 0.15512465373961218, - "grad_norm": 0.650161789807741, - "kl": 0.4890678570009186, - "learning_rate": 0.00019957838880989078, - "loss": -0.0075666941702365875, - "memory(GiB)": 79.98, + "train_speed(iter/s)": 0.00269 + }, + { + "clip_ratio/high_max": 0.016389093652833253, + "clip_ratio/high_mean": 0.016389093652833253, + "clip_ratio/low_mean": 0.03954102098941803, + "clip_ratio/low_min": 0.03954102098941803, + "clip_ratio/region_mean": 0.05593011493328959, + "epoch": 0.16716417910447762, + "grad_norm": 0.7268697285990734, + "kl": 0.15212981263175607, + "learning_rate": 0.00019949991003022808, + "loss": -0.01738908141851425, + "memory(GiB)": 79.48, "step": 14, - "train_speed(iter/s)": 0.002135 + "train_speed(iter/s)": 0.002789 }, { - "clip_ratio/high_max": 0.0018629207770572975, - "clip_ratio/high_mean": 0.0018629207770572975, - "clip_ratio/low_mean": 0.0069178942940197885, - "clip_ratio/low_min": 0.0069178942940197885, - "clip_ratio/region_mean": 0.00878081505652517, - "completions/clipped_ratio": 0.0078125, - "completions/max_length": 101.0, - "completions/mean_length": 17.1953125, - "completions/min_length": 4.0, - "epoch": 0.16620498614958448, - "grad_norm": 2.2362713456466605, - "kl": 0.23374600778333843, - "learning_rate": 0.00019939306773179497, - "loss": 0.0009349192259833217, - "memory(GiB)": 79.98, - "reward": 0.6875, - "reward_std": 0.8529120683670044, - "rewards/Response_no_think_reward/mean": 0.6875, - "rewards/Response_no_think_reward/std": 1.3265905380249023, + "clip_ratio/high_max": 0.0005787037080153823, + "clip_ratio/high_mean": 0.0005787037080153823, + "clip_ratio/low_mean": 0.004868808202445507, + "clip_ratio/low_min": 0.004868808202445507, + "clip_ratio/region_mean": 0.005447512026876211, + "completions/clipped_ratio": 0.015625, + "completions/max_length": 51.0, + "completions/mean_length": 9.8671875, + "completions/min_length": 3.0, + "epoch": 0.1791044776119403, + "grad_norm": 1.881956635614757, + "kl": 0.24015408230479807, + "learning_rate": 0.0001992801347642515, + "loss": 0.0037227380089461803, + "memory(GiB)": 79.48, + "reward": 0.0625, + "reward_std": 0.15197435021400452, + "rewards/Response_no_think_reward_1/mean": 0.0625, + "rewards/Response_no_think_reward_1/std": 0.9700231552124023, "step": 15, - "train_speed(iter/s)": 0.002091 - }, - { - "clip_ratio/high_max": 0.03511151310522109, - "clip_ratio/high_mean": 0.03511151310522109, - "clip_ratio/low_mean": 0.028677020454779267, - "clip_ratio/low_min": 0.028677020454779267, - "clip_ratio/region_mean": 0.06378853344358504, - "epoch": 0.1772853185595568, - "grad_norm": 3.3548685452904934, - "kl": 0.25148704896855634, - "learning_rate": 0.00019917419983016025, - "loss": 0.017475975677371025, - "memory(GiB)": 79.98, + "train_speed(iter/s)": 0.002716 + }, + { + "clip_ratio/high_max": 0.005905566504225135, + "clip_ratio/high_mean": 0.005905566504225135, + "clip_ratio/low_mean": 0.03072124859318137, + "clip_ratio/low_min": 0.03072124859318137, + "clip_ratio/region_mean": 0.036626815563067794, + "epoch": 0.191044776119403, + "grad_norm": 9.037445474392891, + "kl": 4.632834411575459, + "learning_rate": 0.00019902060847549718, + "loss": 0.06257862597703934, + "memory(GiB)": 79.48, "step": 16, - "train_speed(iter/s)": 0.002171 + "train_speed(iter/s)": 0.002802 }, { - "clip_ratio/high_max": 0.000469924823846668, - "clip_ratio/high_mean": 0.000469924823846668, - "clip_ratio/low_mean": 0.0014688223309349269, - "clip_ratio/low_min": 0.0014688223309349269, - "clip_ratio/region_mean": 0.0019387471547815949, - "completions/clipped_ratio": 0.0078125, - "completions/max_length": 101.0, - "completions/mean_length": 18.2265625, - "completions/min_length": 6.0, - "epoch": 0.1883656509695291, - "grad_norm": 0.6996032916694407, - "kl": 0.138063008276049, - "learning_rate": 0.00019892185897656578, - "loss": 0.0021217623725533485, - "memory(GiB)": 79.98, - "reward": 0.5, - "reward_std": 0.5098158717155457, - "rewards/Response_no_think_reward/mean": 0.5, - "rewards/Response_no_think_reward/std": 1.4086347818374634, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.004252503567840904, + "clip_ratio/low_min": 0.004252503567840904, + "clip_ratio/region_mean": 0.004252503567840904, + "completions/clipped_ratio": 0.0, + "completions/max_length": 46.0, + "completions/mean_length": 7.0, + "completions/min_length": 3.0, + "epoch": 0.20298507462686566, + "grad_norm": 5.483351751991195, + "kl": 3.0633848210127326, + "learning_rate": 0.0001987214350763483, + "loss": 0.026951301842927933, + "memory(GiB)": 79.48, + "reward": 0.1640625, + "reward_std": 0.45976677536964417, + "rewards/Response_no_think_reward_1/mean": 0.1640625, + "rewards/Response_no_think_reward_1/std": 0.9116684198379517, "step": 17, - "train_speed(iter/s)": 0.002127 - }, - { - "clip_ratio/high_max": 0.01048101403284818, - "clip_ratio/high_mean": 0.01048101403284818, - "clip_ratio/low_mean": 0.028478411200921983, - "clip_ratio/low_min": 0.028478411200921983, - "clip_ratio/region_mean": 0.03895942587405443, - "epoch": 0.1994459833795014, - "grad_norm": 0.7437416506383379, - "kl": 0.2438321103884391, - "learning_rate": 0.00019863613034027224, - "loss": -0.007616878021508455, - "memory(GiB)": 79.98, + "train_speed(iter/s)": 0.002741 + }, + { + "clip_ratio/high_max": 0.02420679770875722, + "clip_ratio/high_mean": 0.02420679770875722, + "clip_ratio/low_mean": 0.029018129454925656, + "clip_ratio/low_min": 0.029018129454925656, + "clip_ratio/region_mean": 0.053224927629344165, + "epoch": 0.21492537313432836, + "grad_norm": 11.084807824277876, + "kl": 4.480629495417816, + "learning_rate": 0.00019838273435359444, + "loss": 0.03358945623040199, + "memory(GiB)": 79.48, "step": 18, - "train_speed(iter/s)": 0.002199 + "train_speed(iter/s)": 0.002818 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.0009733444603625685, - "clip_ratio/low_min": 0.0009733444603625685, - "clip_ratio/region_mean": 0.0009733444603625685, + "clip_ratio/low_mean": 0.009987752127926797, + "clip_ratio/low_min": 0.009987752127926797, + "clip_ratio/region_mean": 0.009987752127926797, "completions/clipped_ratio": 0.0078125, - "completions/max_length": 101.0, - "completions/mean_length": 20.703125, - "completions/min_length": 6.0, - "epoch": 0.21052631578947367, - "grad_norm": 0.8303775863701255, - "kl": 0.09481111937202513, - "learning_rate": 0.0001983171103594755, - "loss": 0.0022672354243695736, - "memory(GiB)": 79.98, - "reward": -0.078125, - "reward_std": 0.6301807761192322, - "rewards/Response_no_think_reward/mean": -0.078125, - "rewards/Response_no_think_reward/std": 1.3666982650756836, + "completions/max_length": 51.0, + "completions/mean_length": 8.6875, + "completions/min_length": 3.0, + "epoch": 0.22686567164179106, + "grad_norm": 2.774235490038128, + "kl": 1.3207979609724134, + "learning_rate": 0.00019800464192046955, + "loss": 0.012463792227208614, + "memory(GiB)": 79.48, + "reward": -0.0078125, + "reward_std": 0.3263596296310425, + "rewards/Response_no_think_reward_1/mean": -0.0078125, + "rewards/Response_no_think_reward_1/std": 0.9515514969825745, "step": 19, - "train_speed(iter/s)": 0.002152 - }, - { - "clip_ratio/high_max": 0.007191620621597394, - "clip_ratio/high_mean": 0.007191620621597394, - "clip_ratio/low_mean": 0.03550086636096239, - "clip_ratio/low_min": 0.03550086636096239, - "clip_ratio/region_mean": 0.0426924874773249, - "epoch": 0.22160664819944598, - "grad_norm": 1.7213808531720889, - "kl": 1.6638920252444223, - "learning_rate": 0.0001979649067087574, - "loss": 0.006861768197268248, - "memory(GiB)": 79.98, + "train_speed(iter/s)": 0.002746 + }, + { + "clip_ratio/high_max": 0.013878540194127709, + "clip_ratio/high_mean": 0.013878540194127709, + "clip_ratio/low_mean": 0.053771398146636784, + "clip_ratio/low_min": 0.053771398146636784, + "clip_ratio/region_mean": 0.06764993839897215, + "epoch": 0.23880597014925373, + "grad_norm": 18.987604867751966, + "kl": 9.466534710245469, + "learning_rate": 0.00019758730916235356, + "loss": 0.16672615706920624, + "memory(GiB)": 79.48, "step": 20, - "train_speed(iter/s)": 0.002217 + "train_speed(iter/s)": 0.002807 }, { - "clip_ratio/high_max": 0.0004032258002553135, - "clip_ratio/high_mean": 0.0004032258002553135, - "clip_ratio/low_mean": 0.003614576125983149, - "clip_ratio/low_min": 0.003614576125983149, - "clip_ratio/region_mean": 0.004017801926238462, - "completions/clipped_ratio": 0.0078125, - "completions/max_length": 101.0, - "completions/mean_length": 17.390625, - "completions/min_length": 6.0, - "epoch": 0.23268698060941828, - "grad_norm": 1.5808946015405074, - "kl": 0.1687323283404112, - "learning_rate": 0.00019757963826274357, - "loss": 0.003855248913168907, - "memory(GiB)": 79.98, - "reward": 0.5546875, - "reward_std": 0.8033354878425598, - "rewards/Response_no_think_reward/mean": 0.5546875, - "rewards/Response_no_think_reward/std": 1.3328590393066406, + "clip_ratio/high_max": 0.005019778618589044, + "clip_ratio/high_mean": 0.005019778618589044, + "clip_ratio/low_mean": 0.00046641789958812296, + "clip_ratio/low_min": 0.00046641789958812296, + "clip_ratio/region_mean": 0.005486196518177167, + "completions/clipped_ratio": 0.015625, + "completions/max_length": 51.0, + "completions/mean_length": 8.234375, + "completions/min_length": 3.0, + "epoch": 0.2507462686567164, + "grad_norm": 3.1541164754847397, + "kl": 0.4539797595352866, + "learning_rate": 0.00019713090317615876, + "loss": 0.0023644084576517344, + "memory(GiB)": 79.48, + "reward": -0.1015625, + "reward_std": 0.3404619097709656, + "rewards/Response_no_think_reward_1/mean": -0.1015625, + "rewards/Response_no_think_reward_1/std": 0.9788298010826111, "step": 21, - "train_speed(iter/s)": 0.002189 - }, - { - "clip_ratio/high_max": 0.012200821249280125, - "clip_ratio/high_mean": 0.012200821249280125, - "clip_ratio/low_mean": 0.04007338697556406, - "clip_ratio/low_min": 0.04007338697556406, - "clip_ratio/region_mean": 0.05227420857409015, - "epoch": 0.24376731301939059, - "grad_norm": 0.8850881940917656, - "kl": 0.48105100472457707, - "learning_rate": 0.0001971614350559814, - "loss": -0.004205920733511448, - "memory(GiB)": 79.98, + "train_speed(iter/s)": 0.002748 + }, + { + "clip_ratio/high_max": 0.02849817555397749, + "clip_ratio/high_mean": 0.02849817555397749, + "clip_ratio/low_mean": 0.02262113688630052, + "clip_ratio/low_min": 0.02262113688630052, + "clip_ratio/region_mean": 0.051119312876835465, + "epoch": 0.2626865671641791, + "grad_norm": 3.225175633228704, + "kl": 0.27581185393501073, + "learning_rate": 0.00019663560670342558, + "loss": 0.0023057509679347277, + "memory(GiB)": 79.48, "step": 22, - "train_speed(iter/s)": 0.002248 + "train_speed(iter/s)": 0.002811 }, { - "clip_ratio/high_max": 0.0008194574620574713, - "clip_ratio/high_mean": 0.0008194574620574713, - "clip_ratio/low_mean": 0.000811688310932368, - "clip_ratio/low_min": 0.000811688310932368, - "clip_ratio/region_mean": 0.0016311457729898393, - "completions/clipped_ratio": 0.0078125, - "completions/max_length": 101.0, - "completions/mean_length": 15.28125, - "completions/min_length": 6.0, - "epoch": 0.2548476454293629, - "grad_norm": 0.6954813297644332, - "kl": 0.11993603070732206, - "learning_rate": 0.0001967104382390511, - "loss": 0.001324990182183683, - "memory(GiB)": 79.98, - "reward": 0.78125, - "reward_std": 0.5077463984489441, - "rewards/Response_no_think_reward/mean": 0.78125, - "rewards/Response_no_think_reward/std": 1.3970582485198975, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0015432098880410194, + "clip_ratio/low_min": 0.0015432098880410194, + "clip_ratio/region_mean": 0.0015432098880410194, + "completions/clipped_ratio": 0.03125, + "completions/max_length": 51.0, + "completions/mean_length": 9.1015625, + "completions/min_length": 3.0, + "epoch": 0.2746268656716418, + "grad_norm": 1.602042628934705, + "kl": 0.223259057267569, + "learning_rate": 0.00019610161805715397, + "loss": 0.0012852977961301804, + "memory(GiB)": 79.48, + "reward": 0.25, + "reward_std": 0.45234403014183044, + "rewards/Response_no_think_reward_1/mean": 0.25, + "rewards/Response_no_think_reward_1/std": 0.9474374651908875, "step": 23, - "train_speed(iter/s)": 0.002219 - }, - { - "clip_ratio/high_max": 0.014543175988364965, - "clip_ratio/high_mean": 0.014543175988364965, - "clip_ratio/low_mean": 0.027941336738877, - "clip_ratio/low_min": 0.027941336738877, - "clip_ratio/region_mean": 0.04248451231978834, - "epoch": 0.2659279778393352, - "grad_norm": 0.46891914008721675, - "kl": 0.11759324668673798, - "learning_rate": 0.00019622680003092503, - "loss": -0.009693928062915802, - "memory(GiB)": 79.98, + "train_speed(iter/s)": 0.002763 + }, + { + "clip_ratio/high_max": 0.02699369314359501, + "clip_ratio/high_mean": 0.02699369314359501, + "clip_ratio/low_mean": 0.024013921502046287, + "clip_ratio/low_min": 0.024013921502046287, + "clip_ratio/region_mean": 0.05100761540234089, + "epoch": 0.2865671641791045, + "grad_norm": 1.2163889618122583, + "kl": 0.48499861752497964, + "learning_rate": 0.00019552915104240065, + "loss": -0.007453325670212507, + "memory(GiB)": 79.48, "step": 24, - "train_speed(iter/s)": 0.002273 + "train_speed(iter/s)": 0.002821 }, { - "clip_ratio/high_max": 0.0006530559621751308, - "clip_ratio/high_mean": 0.0006530559621751308, - "clip_ratio/low_mean": 0.0019866162620019168, - "clip_ratio/low_min": 0.0019866162620019168, - "clip_ratio/region_mean": 0.002639672253280878, - "completions/clipped_ratio": 0.0078125, - "completions/max_length": 101.0, - "completions/mean_length": 12.9609375, - "completions/min_length": 4.0, - "epoch": 0.2770083102493075, - "grad_norm": 1.333182473379268, - "kl": 0.22027045290451497, - "learning_rate": 0.00019571068366759143, - "loss": 0.0026610023342072964, - "memory(GiB)": 79.98, - "reward": 0.4765625, - "reward_std": 0.8257243633270264, - "rewards/Response_no_think_reward/mean": 0.4765625, - "rewards/Response_no_think_reward/std": 1.3219220638275146, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.001253594527952373, + "clip_ratio/low_min": 0.001253594527952373, + "clip_ratio/region_mean": 0.001253594527952373, + "completions/clipped_ratio": 0.0625, + "completions/max_length": 51.0, + "completions/mean_length": 9.9375, + "completions/min_length": 3.0, + "epoch": 0.29850746268656714, + "grad_norm": 1.3884331155836789, + "kl": 0.5089308844180778, + "learning_rate": 0.00019491843487067306, + "loss": 0.00490172766149044, + "memory(GiB)": 79.48, + "reward": 0.2265625, + "reward_std": 0.46621453762054443, + "rewards/Response_no_think_reward_1/mean": 0.2265625, + "rewards/Response_no_think_reward_1/std": 0.9324832558631897, "step": 25, - "train_speed(iter/s)": 0.002248 - }, - { - "clip_ratio/high_max": 0.02311275008833036, - "clip_ratio/high_mean": 0.02311275008833036, - "clip_ratio/low_mean": 0.03803046100074425, - "clip_ratio/low_min": 0.03803046100074425, - "clip_ratio/region_mean": 0.06114321056520566, - "epoch": 0.2880886426592798, - "grad_norm": 0.7053648057917502, - "kl": 0.2949459235333052, - "learning_rate": 0.0001951622633469592, - "loss": -0.015641074627637863, - "memory(GiB)": 79.98, + "train_speed(iter/s)": 0.002775 + }, + { + "clip_ratio/high_max": 0.01939821511041373, + "clip_ratio/high_mean": 0.01939821511041373, + "clip_ratio/low_mean": 0.046715788485016674, + "clip_ratio/low_min": 0.046715788485016674, + "clip_ratio/region_mean": 0.06611400278052315, + "epoch": 0.31044776119402984, + "grad_norm": 7.610505518747904, + "kl": 2.1003341920441017, + "learning_rate": 0.00019426971406815463, + "loss": 0.024694038555026054, + "memory(GiB)": 79.48, "step": 26, - "train_speed(iter/s)": 0.002297 + "train_speed(iter/s)": 0.002827 }, { - "clip_ratio/high_max": 0.0004111842135898769, - "clip_ratio/high_mean": 0.0004111842135898769, - "clip_ratio/low_mean": 0.0027908546617254615, - "clip_ratio/low_min": 0.0027908546617254615, - "clip_ratio/region_mean": 0.0032020388753153384, - "completions/clipped_ratio": 0.0, - "completions/max_length": 85.0, - "completions/mean_length": 16.875, - "completions/min_length": 4.0, - "epoch": 0.29916897506925205, - "grad_norm": 1.544635006921068, - "kl": 0.20233443519100547, - "learning_rate": 0.00019458172417006347, - "loss": 0.0030936466064304113, - "memory(GiB)": 79.98, - "reward": 0.6875, - "reward_std": 0.9086803197860718, - "rewards/Response_no_think_reward/mean": 0.6875, - "rewards/Response_no_think_reward/std": 1.3265905380249023, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0030820727697573602, + "clip_ratio/low_min": 0.0030820727697573602, + "clip_ratio/region_mean": 0.0030820727697573602, + "completions/clipped_ratio": 0.03125, + "completions/max_length": 51.0, + "completions/mean_length": 9.2265625, + "completions/min_length": 3.0, + "epoch": 0.32238805970149254, + "grad_norm": 2.593834753837433, + "kl": 0.6449481542804278, + "learning_rate": 0.00019358324837779863, + "loss": 0.007649811916053295, + "memory(GiB)": 79.48, + "reward": 0.2890625, + "reward_std": 0.6288036704063416, + "rewards/Response_no_think_reward_1/mean": 0.2890625, + "rewards/Response_no_think_reward_1/std": 0.870806872844696, "step": 27, - "train_speed(iter/s)": 0.002272 - }, - { - "clip_ratio/high_max": 0.03639351949095726, - "clip_ratio/high_mean": 0.03639351949095726, - "clip_ratio/low_mean": 0.024818695266731083, - "clip_ratio/low_min": 0.024818695266731083, - "clip_ratio/region_mean": 0.06121221440844238, - "epoch": 0.31024930747922436, - "grad_norm": 2.0012174050572105, - "kl": 0.24312824057415128, - "learning_rate": 0.00019396926207859084, - "loss": -0.008060472086071968, - "memory(GiB)": 79.98, + "train_speed(iter/s)": 0.00279 + }, + { + "clip_ratio/high_max": 0.02224817470414564, + "clip_ratio/high_mean": 0.02224817470414564, + "clip_ratio/low_mean": 0.03963817795738578, + "clip_ratio/low_min": 0.03963817795738578, + "clip_ratio/region_mean": 0.061886353767476976, + "epoch": 0.33432835820895523, + "grad_norm": 4.001134871741585, + "kl": 2.057775880966801, + "learning_rate": 0.00019285931265532871, + "loss": 0.024306027218699455, + "memory(GiB)": 79.48, "step": 28, - "train_speed(iter/s)": 0.002319 + "train_speed(iter/s)": 0.002839 }, { - "clip_ratio/high_max": 0.0007382866751868278, - "clip_ratio/high_mean": 0.0007382866751868278, - "clip_ratio/low_mean": 0.0024169938114937395, - "clip_ratio/low_min": 0.0024169938114937395, - "clip_ratio/region_mean": 0.0031552804866805673, - "completions/clipped_ratio": 0.0234375, - "completions/max_length": 101.0, - "completions/mean_length": 23.4140625, - "completions/min_length": 3.0, - "epoch": 0.32132963988919666, - "grad_norm": 1.0333627248580772, - "kl": 0.19911292963661253, - "learning_rate": 0.0001933250837887457, - "loss": 0.004103388637304306, - "memory(GiB)": 79.98, - "reward": 0.6640625, - "reward_std": 0.7995060086250305, - "rewards/Response_no_think_reward/mean": 0.6640625, - "rewards/Response_no_think_reward/std": 1.4323447942733765, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0025941890198737383, + "clip_ratio/low_min": 0.0025941890198737383, + "clip_ratio/region_mean": 0.0025941890198737383, + "completions/clipped_ratio": 0.015625, + "completions/max_length": 51.0, + "completions/mean_length": 7.6640625, + "completions/min_length": 3.0, + "epoch": 0.34626865671641793, + "grad_norm": 2.4322431330202017, + "kl": 0.9759200520347804, + "learning_rate": 0.0001920981967591891, + "loss": 0.009954690001904964, + "memory(GiB)": 79.48, + "reward": 0.234375, + "reward_std": 0.5239416360855103, + "rewards/Response_no_think_reward_1/mean": 0.234375, + "rewards/Response_no_think_reward_1/std": 0.8179518580436707, "step": 29, - "train_speed(iter/s)": 0.002285 - }, - { - "clip_ratio/high_max": 0.021052728639915586, - "clip_ratio/high_mean": 0.021052728639915586, - "clip_ratio/low_mean": 0.03886253567179665, - "clip_ratio/low_min": 0.03886253567179665, - "clip_ratio/region_mean": 0.05991526402067393, - "epoch": 0.33240997229916897, - "grad_norm": 0.4744156832935017, - "kl": 0.2653088476508856, - "learning_rate": 0.00019264940672148018, - "loss": -0.014724130742251873, - "memory(GiB)": 79.98, + "train_speed(iter/s)": 0.002811 + }, + { + "clip_ratio/high_max": 0.05181985488161445, + "clip_ratio/high_mean": 0.05181985488161445, + "clip_ratio/low_mean": 0.03574432339519262, + "clip_ratio/low_min": 0.03574432339519262, + "clip_ratio/region_mean": 0.0875641773454845, + "epoch": 0.3582089552238806, + "grad_norm": 2.469531358214721, + "kl": 0.3759418617701158, + "learning_rate": 0.00019130020543448704, + "loss": 0.030206725001335144, + "memory(GiB)": 79.48, "step": 30, - "train_speed(iter/s)": 0.002328 + "train_speed(iter/s)": 0.002857 }, { - "clip_ratio/high_max": 0.0008336337341461331, - "clip_ratio/high_mean": 0.0008336337341461331, - "clip_ratio/low_mean": 0.0028033541166223586, - "clip_ratio/low_min": 0.0028033541166223586, - "clip_ratio/region_mean": 0.0036369878507684916, - "completions/clipped_ratio": 0.0078125, - "completions/max_length": 101.0, - "completions/mean_length": 17.8125, - "completions/min_length": 3.0, - "epoch": 0.34349030470914127, - "grad_norm": 1.3971369328491496, - "kl": 0.3057649952825159, - "learning_rate": 0.0001919424589291108, - "loss": 0.0056169466115534306, - "memory(GiB)": 80.03, - "reward": 0.4296875, - "reward_std": 0.8740850687026978, - "rewards/Response_no_think_reward/mean": 0.4296875, - "rewards/Response_no_think_reward/std": 1.3555577993392944, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0007102272938936949, + "clip_ratio/low_min": 0.0007102272938936949, + "clip_ratio/region_mean": 0.0007102272938936949, + "completions/clipped_ratio": 0.015625, + "completions/max_length": 51.0, + "completions/mean_length": 7.4921875, + "completions/min_length": 3.0, + "epoch": 0.3701492537313433, + "grad_norm": 25.502961039749618, + "kl": 0.3221544102343614, + "learning_rate": 0.00019046565819097545, + "loss": 0.0061463117599487305, + "memory(GiB)": 79.48, + "reward": 0.265625, + "reward_std": 0.3810158967971802, + "rewards/Response_no_think_reward_1/mean": 0.265625, + "rewards/Response_no_think_reward_1/std": 0.8082680702209473, "step": 31, - "train_speed(iter/s)": 0.002304 - }, - { - "clip_ratio/high_max": 0.013716876972466707, - "clip_ratio/high_mean": 0.013716876972466707, - "clip_ratio/low_mean": 0.05669466912513599, - "clip_ratio/low_min": 0.05669466912513599, - "clip_ratio/region_mean": 0.07041154580656439, - "epoch": 0.3545706371191136, - "grad_norm": 0.7437646652660285, - "kl": 0.3698675720952451, - "learning_rate": 0.00019120447901834706, - "loss": -0.013283709064126015, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002819 + }, + { + "clip_ratio/high_max": 0.0004340277810115367, + "clip_ratio/high_mean": 0.0004340277810115367, + "clip_ratio/low_mean": 0.015644782513845712, + "clip_ratio/low_min": 0.015644782513845712, + "clip_ratio/region_mean": 0.01607881032396108, + "epoch": 0.382089552238806, + "grad_norm": 2.386529018247983, + "kl": 0.4242442559116171, + "learning_rate": 0.0001895948891751234, + "loss": 0.005282086320221424, + "memory(GiB)": 79.48, "step": 32, - "train_speed(iter/s)": 0.002345 + "train_speed(iter/s)": 0.002862 }, { - "clip_ratio/high_max": 0.0013764221512246877, - "clip_ratio/high_mean": 0.0013764221512246877, - "clip_ratio/low_mean": 0.0013627433363581076, - "clip_ratio/low_min": 0.0013627433363581076, - "clip_ratio/region_mean": 0.0027391654875827953, - "completions/clipped_ratio": 0.0625, - "completions/max_length": 101.0, - "completions/mean_length": 24.609375, - "completions/min_length": 4.0, - "epoch": 0.3656509695290859, - "grad_norm": 0.8795930368140337, - "kl": 0.22658177139237523, - "learning_rate": 0.00019043571606975777, - "loss": 0.0019196830689907074, - "memory(GiB)": 80.03, - "reward": 0.4140625, - "reward_std": 0.8300054669380188, - "rewards/Response_no_think_reward/mean": 0.4140625, - "rewards/Response_no_think_reward/std": 1.258216142654419, + "clip_ratio/high_max": 0.0008561643771827221, + "clip_ratio/high_mean": 0.0008561643771827221, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0008561643771827221, + "completions/clipped_ratio": 0.0, + "completions/max_length": 36.0, + "completions/mean_length": 6.8984375, + "completions/min_length": 3.0, + "epoch": 0.3940298507462687, + "grad_norm": 2.313143797352374, + "kl": 1.4197996056172997, + "learning_rate": 0.00018868824703632657, + "loss": 0.011696252971887589, + "memory(GiB)": 79.48, + "reward": 0.046875, + "reward_std": 0.6391555070877075, + "rewards/Response_no_think_reward_1/mean": 0.046875, + "rewards/Response_no_think_reward_1/std": 0.8215538859367371, "step": 33, - "train_speed(iter/s)": 0.002323 - }, - { - "clip_ratio/high_max": 0.016442283987998962, - "clip_ratio/high_mean": 0.016442283987998962, - "clip_ratio/low_mean": 0.05633212422253564, - "clip_ratio/low_min": 0.05633212422253564, - "clip_ratio/region_mean": 0.07277440826874226, - "epoch": 0.3767313019390582, - "grad_norm": 0.5188690402432328, - "kl": 0.23683911142870784, - "learning_rate": 0.00018963642955370201, - "loss": -0.016352392733097076, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002823 + }, + { + "clip_ratio/high_max": 0.03243769891560078, + "clip_ratio/high_mean": 0.03243769891560078, + "clip_ratio/low_mean": 0.057673962553963065, + "clip_ratio/low_min": 0.057673962553963065, + "clip_ratio/region_mean": 0.09011166216805577, + "epoch": 0.4059701492537313, + "grad_norm": 1.7539402550269323, + "kl": 1.9242291511036456, + "learning_rate": 0.00018774609478731046, + "loss": -0.004083915147930384, + "memory(GiB)": 79.48, "step": 34, - "train_speed(iter/s)": 0.002362 + "train_speed(iter/s)": 0.002863 }, { - "clip_ratio/high_max": 0.0025397460121894255, - "clip_ratio/high_mean": 0.0025397460121894255, - "clip_ratio/low_mean": 0.00378477135382127, - "clip_ratio/low_min": 0.00378477135382127, - "clip_ratio/region_mean": 0.006324517366010696, - "completions/clipped_ratio": 0.015625, - "completions/max_length": 101.0, - "completions/mean_length": 23.375, - "completions/min_length": 3.0, - "epoch": 0.3878116343490305, - "grad_norm": 0.7751350107093148, - "kl": 0.21053988160565495, - "learning_rate": 0.00018880688924275378, - "loss": 0.001979985274374485, - "memory(GiB)": 80.03, - "reward": 0.25, - "reward_std": 0.8051205277442932, - "rewards/Response_no_think_reward/mean": 0.25, - "rewards/Response_no_think_reward/std": 1.3101662397384644, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0010245901066809893, + "clip_ratio/low_min": 0.0010245901066809893, + "clip_ratio/region_mean": 0.0010245901066809893, + "completions/clipped_ratio": 0.0078125, + "completions/max_length": 51.0, + "completions/mean_length": 7.7109375, + "completions/min_length": 3.0, + "epoch": 0.417910447761194, + "grad_norm": 2.4226244872635485, + "kl": 1.010538819245994, + "learning_rate": 0.00018676880965878291, + "loss": 0.015125149860978127, + "memory(GiB)": 79.48, + "reward": 0.0546875, + "reward_std": 0.5867211818695068, + "rewards/Response_no_think_reward_1/mean": 0.0546875, + "rewards/Response_no_think_reward_1/std": 0.8539726138114929, "step": 35, - "train_speed(iter/s)": 0.00234 - }, - { - "clip_ratio/high_max": 0.02383261898648925, - "clip_ratio/high_mean": 0.02383261898648925, - "clip_ratio/low_mean": 0.02296329999808222, - "clip_ratio/low_min": 0.02296329999808222, - "clip_ratio/region_mean": 0.046795917907729745, - "epoch": 0.3988919667590028, - "grad_norm": 0.6919043847160915, - "kl": 0.2092050458304584, - "learning_rate": 0.0001879473751206489, - "loss": -0.016633104532957077, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.00283 + }, + { + "clip_ratio/high_max": 0.030840664519928396, + "clip_ratio/high_mean": 0.030840664519928396, + "clip_ratio/low_mean": 0.06221208241186105, + "clip_ratio/low_min": 0.06221208241186105, + "clip_ratio/region_mean": 0.09305274731013924, + "epoch": 0.4298507462686567, + "grad_norm": 2.284561806665497, + "kl": 2.4607611764222383, + "learning_rate": 0.00018575678294839373, + "loss": 0.010896118357777596, + "memory(GiB)": 79.48, "step": 36, - "train_speed(iter/s)": 0.002376 + "train_speed(iter/s)": 0.002867 }, { - "clip_ratio/high_max": 0.0, - "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.0003396739193703979, - "clip_ratio/low_min": 0.0003396739193703979, - "clip_ratio/region_mean": 0.0003396739193703979, - "completions/clipped_ratio": 0.0078125, - "completions/max_length": 101.0, - "completions/mean_length": 16.8828125, - "completions/min_length": 3.0, - "epoch": 0.4099722991689751, - "grad_norm": 1.0548464052821087, - "kl": 0.20961805986007676, - "learning_rate": 0.00018705817728778624, - "loss": 0.003657686058431864, - "memory(GiB)": 80.03, - "reward": 0.953125, - "reward_std": 0.6187193393707275, - "rewards/Response_no_think_reward/mean": 0.953125, - "rewards/Response_no_think_reward/std": 1.1961840391159058, + "clip_ratio/high_max": 0.001179245300590992, + "clip_ratio/high_mean": 0.001179245300590992, + "clip_ratio/low_mean": 0.00924376118928194, + "clip_ratio/low_min": 0.00924376118928194, + "clip_ratio/region_mean": 0.010423006489872932, + "completions/clipped_ratio": 0.0, + "completions/max_length": 27.0, + "completions/mean_length": 5.328125, + "completions/min_length": 2.0, + "epoch": 0.4417910447761194, + "grad_norm": 3.3426494147901047, + "kl": 0.3604982797114644, + "learning_rate": 0.000184710419864062, + "loss": 0.0029986475128680468, + "memory(GiB)": 79.48, + "reward": 0.328125, + "reward_std": 0.34082794189453125, + "rewards/Response_no_think_reward_1/mean": 0.328125, + "rewards/Response_no_think_reward_1/std": 0.8794179558753967, "step": 37, - "train_speed(iter/s)": 0.002358 - }, - { - "clip_ratio/high_max": 0.02387295541120693, - "clip_ratio/high_mean": 0.02387295541120693, - "clip_ratio/low_mean": 0.030282753868959844, - "clip_ratio/low_min": 0.030282753868959844, - "clip_ratio/region_mean": 0.05415570852346718, - "epoch": 0.42105263157894735, - "grad_norm": 0.49371052672691246, - "kl": 0.24616074899677187, - "learning_rate": 0.00018613959586331362, - "loss": -0.012075964361429214, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002821 + }, + { + "clip_ratio/high_max": 0.011844758177176118, + "clip_ratio/high_mean": 0.011844758177176118, + "clip_ratio/low_mean": 0.05284481216222048, + "clip_ratio/low_min": 0.05284481216222048, + "clip_ratio/region_mean": 0.06468957080505788, + "epoch": 0.4537313432835821, + "grad_norm": 0.9022263920887504, + "kl": 0.5205309305310948, + "learning_rate": 0.00018363013936173393, + "loss": -0.011295529082417488, + "memory(GiB)": 79.48, "step": 38, - "train_speed(iter/s)": 0.002393 + "train_speed(iter/s)": 0.002857 }, { - "clip_ratio/high_max": 0.0013275333330966532, - "clip_ratio/high_mean": 0.0013275333330966532, - "clip_ratio/low_mean": 0.0013904034567531198, - "clip_ratio/low_min": 0.0013904034567531198, - "clip_ratio/region_mean": 0.002717936789849773, - "completions/clipped_ratio": 0.03125, - "completions/max_length": 101.0, - "completions/mean_length": 21.6015625, - "completions/min_length": 4.0, - "epoch": 0.43213296398891965, - "grad_norm": 0.972842541028031, - "kl": 0.16011726018041372, - "learning_rate": 0.00018519194088383273, - "loss": 0.001440724590793252, - "memory(GiB)": 80.03, - "reward": 0.625, - "reward_std": 0.6670520305633545, - "rewards/Response_no_think_reward/mean": 0.625, - "rewards/Response_no_think_reward/std": 1.3457428216934204, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0078125, + "completions/max_length": 51.0, + "completions/mean_length": 5.328125, + "completions/min_length": 3.0, + "epoch": 0.46567164179104475, + "grad_norm": 1.5271115661229067, + "kl": 0.27687166831583454, + "learning_rate": 0.00018251637397763597, + "loss": 0.0014096113154664636, + "memory(GiB)": 79.48, + "reward": 0.046875, + "reward_std": 0.3280481696128845, + "rewards/Response_no_think_reward_1/mean": 0.046875, + "rewards/Response_no_think_reward_1/std": 0.9379100203514099, "step": 39, - "train_speed(iter/s)": 0.002371 - }, - { - "clip_ratio/high_max": 0.03226059180451557, - "clip_ratio/high_mean": 0.03226059180451557, - "clip_ratio/low_mean": 0.03314233338460326, - "clip_ratio/low_min": 0.03314233338460326, - "clip_ratio/region_mean": 0.0654029252473265, - "epoch": 0.44321329639889195, - "grad_norm": 0.5253408277855696, - "kl": 0.18682625680230558, - "learning_rate": 0.00018421553219875658, - "loss": -0.013099671341478825, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002785 + }, + { + "clip_ratio/high_max": 0.04636762477457523, + "clip_ratio/high_mean": 0.04636762477457523, + "clip_ratio/low_mean": 0.02858343638945371, + "clip_ratio/low_min": 0.02858343638945371, + "clip_ratio/region_mean": 0.07495106221176684, + "epoch": 0.47761194029850745, + "grad_norm": 0.6061436422525854, + "kl": 0.7858691609289963, + "learning_rate": 0.00018136956965509064, + "loss": -0.008444712497293949, + "memory(GiB)": 79.48, "step": 40, - "train_speed(iter/s)": 0.002404 + "train_speed(iter/s)": 0.002819 }, { - "clip_ratio/high_max": 0.00029620854184031487, - "clip_ratio/high_mean": 0.00029620854184031487, - "clip_ratio/low_mean": 0.0009311849280493334, - "clip_ratio/low_min": 0.0009311849280493334, - "clip_ratio/region_mean": 0.0012273934698896483, - "completions/clipped_ratio": 0.0, - "completions/max_length": 88.0, - "completions/mean_length": 17.5625, - "completions/min_length": 5.0, - "epoch": 0.45429362880886426, - "grad_norm": 1.2919745010410586, - "kl": 0.2366366102360189, - "learning_rate": 0.00018321069936235503, - "loss": 0.001985038397833705, - "memory(GiB)": 80.03, - "reward": 0.859375, - "reward_std": 0.6107450723648071, - "rewards/Response_no_think_reward/mean": 0.859375, - "rewards/Response_no_think_reward/std": 1.4071491956710815, + "clip_ratio/high_max": 0.001953125, + "clip_ratio/high_mean": 0.001953125, + "clip_ratio/low_mean": 0.0004006410308647901, + "clip_ratio/low_min": 0.0004006410308647901, + "clip_ratio/region_mean": 0.00235376603086479, + "completions/clipped_ratio": 0.0390625, + "completions/max_length": 51.0, + "completions/mean_length": 8.296875, + "completions/min_length": 3.0, + "epoch": 0.48955223880597015, + "grad_norm": 2.15651488822414, + "kl": 0.5289879650626972, + "learning_rate": 0.000180190185565964, + "loss": 0.006278940010815859, + "memory(GiB)": 79.48, + "reward": 0.140625, + "reward_std": 0.3606899678707123, + "rewards/Response_no_think_reward_1/mean": 0.140625, + "rewards/Response_no_think_reward_1/std": 0.9284173250198364, "step": 41, - "train_speed(iter/s)": 0.002379 - }, - { - "clip_ratio/high_max": 0.01783788768807426, - "clip_ratio/high_mean": 0.01783788768807426, - "clip_ratio/low_mean": 0.044289187353570014, - "clip_ratio/low_min": 0.044289187353570014, - "clip_ratio/region_mean": 0.06212707597296685, - "epoch": 0.46537396121883656, - "grad_norm": 1.7719321167278534, - "kl": 0.6719344789162278, - "learning_rate": 0.0001821777815225245, - "loss": -0.008167732506990433, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002732 + }, + { + "clip_ratio/high_max": 0.019255130202509463, + "clip_ratio/high_mean": 0.019255130202509463, + "clip_ratio/low_mean": 0.049764272407628596, + "clip_ratio/low_min": 0.049764272407628596, + "clip_ratio/region_mean": 0.06901940272655338, + "epoch": 0.5014925373134328, + "grad_norm": 7.678211490755348, + "kl": 4.704732097394299, + "learning_rate": 0.00017897869392681685, + "loss": 0.036949772387742996, + "memory(GiB)": 79.48, "step": 42, - "train_speed(iter/s)": 0.00241 + "train_speed(iter/s)": 0.002764 }, { - "clip_ratio/high_max": 0.00036231885314919055, - "clip_ratio/high_mean": 0.00036231885314919055, - "clip_ratio/low_mean": 0.002238474931800738, - "clip_ratio/low_min": 0.002238474931800738, - "clip_ratio/region_mean": 0.0026007937849499285, - "completions/clipped_ratio": 0.0, - "completions/max_length": 97.0, - "completions/mean_length": 15.875, - "completions/min_length": 6.0, - "epoch": 0.47645429362880887, - "grad_norm": 1.1682612472028975, - "kl": 0.2416230053640902, - "learning_rate": 0.00018111712730632022, - "loss": 0.0018095734994858503, - "memory(GiB)": 80.03, - "reward": 0.0859375, - "reward_std": 0.39637458324432373, - "rewards/Response_no_think_reward/mean": 0.0859375, - "rewards/Response_no_think_reward/std": 0.9962713122367859, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0018887363257817924, + "clip_ratio/low_min": 0.0018887363257817924, + "clip_ratio/region_mean": 0.0018887363257817924, + "completions/clipped_ratio": 0.03125, + "completions/max_length": 51.0, + "completions/mean_length": 10.0390625, + "completions/min_length": 3.0, + "epoch": 0.5134328358208955, + "grad_norm": 1.5758982248595066, + "kl": 0.34190677378865075, + "learning_rate": 0.00017773557980983262, + "loss": 0.004829109646379948, + "memory(GiB)": 79.48, + "reward": 0.3671875, + "reward_std": 0.355153352022171, + "rewards/Response_no_think_reward_1/mean": 0.3671875, + "rewards/Response_no_think_reward_1/std": 0.8406137228012085, "step": 43, - "train_speed(iter/s)": 0.002397 - }, - { - "clip_ratio/high_max": 0.007687599485507235, - "clip_ratio/high_mean": 0.007687599485507235, - "clip_ratio/low_mean": 0.042899149731965736, - "clip_ratio/low_min": 0.042899149731965736, - "clip_ratio/region_mean": 0.05058674863539636, - "epoch": 0.48753462603878117, - "grad_norm": 17.524605028595435, - "kl": 15.062655651359819, - "learning_rate": 0.00018002909470228842, - "loss": 0.09481670707464218, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002649 + }, + { + "clip_ratio/high_max": 0.010433136369101703, + "clip_ratio/high_mean": 0.010433136369101703, + "clip_ratio/low_mean": 0.0495308703975752, + "clip_ratio/low_min": 0.0495308703975752, + "clip_ratio/region_mean": 0.05996400595176965, + "epoch": 0.5253731343283582, + "grad_norm": 0.9699999569587556, + "kl": 0.5136687369667925, + "learning_rate": 0.00017646134094859815, + "loss": -0.008213551715016365, + "memory(GiB)": 79.48, "step": 44, - "train_speed(iter/s)": 0.002427 + "train_speed(iter/s)": 0.00268 }, { - "clip_ratio/high_max": 0.0012922932510264218, - "clip_ratio/high_mean": 0.0012922932510264218, - "clip_ratio/low_mean": 0.002554390055593103, - "clip_ratio/low_min": 0.002554390055593103, - "clip_ratio/region_mean": 0.003846683306619525, - "completions/clipped_ratio": 0.0, - "completions/max_length": 32.0, - "completions/mean_length": 8.546875, - "completions/min_length": 4.0, - "epoch": 0.4986149584487535, - "grad_norm": 1.474323820635427, - "kl": 0.7951482257340103, - "learning_rate": 0.00017891405093963938, - "loss": 0.008442065678536892, - "memory(GiB)": 80.03, - "reward": 0.171875, - "reward_std": 0.540536105632782, - "rewards/Response_no_think_reward/mean": 0.171875, - "rewards/Response_no_think_reward/std": 0.9648089408874512, + "clip_ratio/high_max": 0.0009920635493472219, + "clip_ratio/high_mean": 0.0009920635493472219, + "clip_ratio/low_mean": 0.0006793478387407959, + "clip_ratio/low_min": 0.0006793478387407959, + "clip_ratio/region_mean": 0.0016714113880880177, + "completions/clipped_ratio": 0.0234375, + "completions/max_length": 51.0, + "completions/mean_length": 6.53125, + "completions/min_length": 3.0, + "epoch": 0.5373134328358209, + "grad_norm": 2.6187879748810294, + "kl": 0.4996573789976537, + "learning_rate": 0.00017515648753881492, + "loss": 0.00461646867915988, + "memory(GiB)": 79.48, + "reward": 0.390625, + "reward_std": 0.4600672125816345, + "rewards/Response_no_think_reward_1/mean": 0.390625, + "rewards/Response_no_think_reward_1/std": 0.8251401782035828, "step": 45, - "train_speed(iter/s)": 0.002416 - }, - { - "clip_ratio/high_max": 0.01782548933988437, - "clip_ratio/high_mean": 0.01782548933988437, - "clip_ratio/low_mean": 0.04517949424916878, - "clip_ratio/low_min": 0.04517949424916878, - "clip_ratio/region_mean": 0.06300498393829912, - "epoch": 0.5096952908587258, - "grad_norm": 23.18489815639863, - "kl": 20.399557466851547, - "learning_rate": 0.0001777723723643014, - "loss": 0.15100935101509094, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002583 + }, + { + "clip_ratio/high_max": 0.023812146624550223, + "clip_ratio/high_mean": 0.023812146624550223, + "clip_ratio/low_mean": 0.030458416498731822, + "clip_ratio/low_min": 0.030458416498731822, + "clip_ratio/region_mean": 0.054270562424790114, + "epoch": 0.5492537313432836, + "grad_norm": 1.046619303634399, + "kl": 1.1794932310585864, + "learning_rate": 0.00017382154203402048, + "loss": -0.007490159012377262, + "memory(GiB)": 79.48, "step": 46, - "train_speed(iter/s)": 0.002445 + "train_speed(iter/s)": 0.002612 }, { - "clip_ratio/high_max": 0.0001338329748250544, - "clip_ratio/high_mean": 0.0001338329748250544, - "clip_ratio/low_mean": 0.0020056332577951252, - "clip_ratio/low_min": 0.0020056332577951252, - "clip_ratio/region_mean": 0.0021394662326201797, - "completions/clipped_ratio": 0.015625, - "completions/max_length": 101.0, - "completions/mean_length": 11.8203125, - "completions/min_length": 4.0, - "epoch": 0.5207756232686981, - "grad_norm": 1.9101810703272282, - "kl": 0.8325624349527061, - "learning_rate": 0.0001766044443118978, - "loss": 0.01317879930138588, - "memory(GiB)": 80.03, - "reward": 0.21875, - "reward_std": 0.5618736743927002, - "rewards/Response_no_think_reward/mean": 0.21875, - "rewards/Response_no_think_reward/std": 0.9301384091377258, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0014244693447835743, + "clip_ratio/low_min": 0.0014244693447835743, + "clip_ratio/region_mean": 0.0014244693447835743, + "completions/clipped_ratio": 0.078125, + "completions/max_length": 51.0, + "completions/mean_length": 11.59375, + "completions/min_length": 3.0, + "epoch": 0.5611940298507463, + "grad_norm": 1.8613572071063658, + "kl": 0.6177221334655769, + "learning_rate": 0.0001724570389364019, + "loss": 0.004859148990362883, + "memory(GiB)": 79.48, + "reward": 0.0625, + "reward_std": 0.47469794750213623, + "rewards/Response_no_think_reward_1/mean": 0.0625, + "rewards/Response_no_think_reward_1/std": 0.8761943578720093, "step": 47, - "train_speed(iter/s)": 0.002435 - }, - { - "clip_ratio/high_max": 0.01570215745596215, - "clip_ratio/high_mean": 0.01570215745596215, - "clip_ratio/low_mean": 0.01864259922876954, - "clip_ratio/low_min": 0.01864259922876954, - "clip_ratio/region_mean": 0.03434475651010871, - "epoch": 0.5318559556786704, - "grad_norm": 5.211743253538076, - "kl": 0.4838231955654919, - "learning_rate": 0.00017541066097768963, - "loss": 0.03044246882200241, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002518 + }, + { + "clip_ratio/high_max": 0.009966709709260613, + "clip_ratio/high_mean": 0.009966709709260613, + "clip_ratio/low_mean": 0.11994545813649893, + "clip_ratio/low_min": 0.11994545813649893, + "clip_ratio/region_mean": 0.12991216825321317, + "epoch": 0.573134328358209, + "grad_norm": 0.9444759818819449, + "kl": 0.9089975492097437, + "learning_rate": 0.00017106352458278522, + "loss": -0.009144289419054985, + "memory(GiB)": 79.48, "step": 48, - "train_speed(iter/s)": 0.002462 + "train_speed(iter/s)": 0.002547 }, { - "clip_ratio/high_max": 0.0, - "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.002905012297560461, - "clip_ratio/low_min": 0.002905012297560461, - "clip_ratio/region_mean": 0.002905012297560461, - "completions/clipped_ratio": 0.0390625, - "completions/max_length": 101.0, - "completions/mean_length": 17.7265625, - "completions/min_length": 4.0, - "epoch": 0.5429362880886427, - "grad_norm": 0.9459153229739418, - "kl": 0.33009129445417784, - "learning_rate": 0.00017419142528352817, - "loss": 0.004404420033097267, - "memory(GiB)": 80.03, - "reward": -0.0859375, - "reward_std": 0.547653079032898, - "rewards/Response_no_think_reward/mean": -0.0859375, - "rewards/Response_no_think_reward/std": 0.9138250946998596, + "clip_ratio/high_max": 0.00021043770539108664, + "clip_ratio/high_mean": 0.00021043770539108664, + "clip_ratio/low_mean": 0.002260449342429638, + "clip_ratio/low_min": 0.002260449342429638, + "clip_ratio/region_mean": 0.0024708870478207245, + "completions/clipped_ratio": 0.1328125, + "completions/max_length": 51.0, + "completions/mean_length": 12.921875, + "completions/min_length": 3.0, + "epoch": 0.5850746268656717, + "grad_norm": 1.7364401500647022, + "kl": 0.6272030578693375, + "learning_rate": 0.00016964155692588616, + "loss": 0.004394113551825285, + "memory(GiB)": 79.48, + "reward": 0.1484375, + "reward_std": 0.424231618642807, + "rewards/Response_no_think_reward_1/mean": 0.1484375, + "rewards/Response_no_think_reward_1/std": 0.914363443851471, "step": 49, - "train_speed(iter/s)": 0.002452 - }, - { - "clip_ratio/high_max": 0.00849696435034275, - "clip_ratio/high_mean": 0.00849696435034275, - "clip_ratio/low_mean": 0.059440263896249235, - "clip_ratio/low_min": 0.059440263896249235, - "clip_ratio/region_mean": 0.06793722766451538, - "epoch": 0.554016620498615, - "grad_norm": 1.5192885268898135, - "kl": 0.5284001431518845, - "learning_rate": 0.0001729471487418621, - "loss": -0.012666964903473854, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002518 + }, + { + "clip_ratio/high_max": 0.03189032070804387, + "clip_ratio/high_mean": 0.03189032070804387, + "clip_ratio/low_mean": 0.04090093384729698, + "clip_ratio/low_min": 0.04090093384729698, + "clip_ratio/region_mean": 0.07279125548666343, + "epoch": 0.5970149253731343, + "grad_norm": 4.461755913109612, + "kl": 1.2612105239531957, + "learning_rate": 0.00016819170531091017, + "loss": 0.0014673060504719615, + "memory(GiB)": 79.48, "step": 50, - "train_speed(iter/s)": 0.002478 + "train_speed(iter/s)": 0.002545 }, { - "clip_ratio/high_max": 0.0, - "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.0012755101779475808, - "clip_ratio/low_min": 0.0012755101779475808, - "clip_ratio/region_mean": 0.0012755101779475808, - "completions/clipped_ratio": 0.0078125, - "completions/max_length": 101.0, - "completions/mean_length": 12.640625, - "completions/min_length": 3.0, - "epoch": 0.5650969529085873, - "grad_norm": 1.7932835802898264, - "kl": 0.582448753528297, - "learning_rate": 0.00017167825131684513, - "loss": 0.008432275615632534, - "memory(GiB)": 80.03, - "reward": 0.15625, - "reward_std": 0.7085258960723877, - "rewards/Response_no_think_reward/mean": 0.15625, - "rewards/Response_no_think_reward/std": 1.0228685140609741, + "clip_ratio/high_max": 0.0015625000232830644, + "clip_ratio/high_mean": 0.0015625000232830644, + "clip_ratio/low_mean": 0.0016522249497938901, + "clip_ratio/low_min": 0.0016522249497938901, + "clip_ratio/region_mean": 0.0032147249730769545, + "completions/clipped_ratio": 0.0859375, + "completions/max_length": 51.0, + "completions/mean_length": 10.46875, + "completions/min_length": 3.0, + "epoch": 0.608955223880597, + "grad_norm": 2.519038758282151, + "kl": 0.549895275675226, + "learning_rate": 0.00016671455024759067, + "loss": 0.0033532448578625917, + "memory(GiB)": 79.48, + "reward": 0.1796875, + "reward_std": 0.39886242151260376, + "rewards/Response_no_think_reward_1/mean": 0.1796875, + "rewards/Response_no_think_reward_1/std": 0.9258628487586975, "step": 51, - "train_speed(iter/s)": 0.002465 - }, - { - "clip_ratio/high_max": 0.006597792147658765, - "clip_ratio/high_mean": 0.006597792147658765, - "clip_ratio/low_mean": 0.049801092012785375, - "clip_ratio/low_min": 0.049801092012785375, - "clip_ratio/region_mean": 0.05639888462610543, - "epoch": 0.5761772853185596, - "grad_norm": 0.8422307837338449, - "kl": 0.7035694038495421, - "learning_rate": 0.00017038516128259115, - "loss": -0.011608053930103779, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002473 + }, + { + "clip_ratio/high_max": 0.03367150644771755, + "clip_ratio/high_mean": 0.03367150644771755, + "clip_ratio/low_mean": 0.0576377569232136, + "clip_ratio/low_min": 0.0576377569232136, + "clip_ratio/region_mean": 0.09130926383659244, + "epoch": 0.6208955223880597, + "grad_norm": 0.9238461637378925, + "kl": 0.672293990442995, + "learning_rate": 0.00016521068317775753, + "loss": -0.019059473648667336, + "memory(GiB)": 79.48, "step": 52, - "train_speed(iter/s)": 0.00249 + "train_speed(iter/s)": 0.002499 }, { - "clip_ratio/high_max": 0.0, - "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.0005558648990700021, - "clip_ratio/low_min": 0.0005558648990700021, - "clip_ratio/region_mean": 0.0005558648990700021, - "completions/clipped_ratio": 0.015625, - "completions/max_length": 101.0, - "completions/mean_length": 12.5, - "completions/min_length": 4.0, - "epoch": 0.5872576177285319, - "grad_norm": 1.0211580850819229, - "kl": 0.7616109761074767, - "learning_rate": 0.00016906831507862443, - "loss": 0.005634145811200142, - "memory(GiB)": 80.03, - "reward": 0.1640625, - "reward_std": 0.70704185962677, - "rewards/Response_no_think_reward/mean": 0.1640625, - "rewards/Response_no_think_reward/std": 0.9702450633049011, + "clip_ratio/high_max": 0.0013558201026171446, + "clip_ratio/high_mean": 0.0013558201026171446, + "clip_ratio/low_mean": 0.010322635032935068, + "clip_ratio/low_min": 0.010322635032935068, + "clip_ratio/region_mean": 0.011678455251967534, + "completions/clipped_ratio": 0.1796875, + "completions/max_length": 51.0, + "completions/mean_length": 14.0390625, + "completions/min_length": 3.0, + "epoch": 0.6328358208955224, + "grad_norm": 6.547271710761981, + "kl": 1.0316203383699758, + "learning_rate": 0.00016368070623852792, + "loss": 0.006902866996824741, + "memory(GiB)": 79.48, + "reward": 0.1328125, + "reward_std": 0.561459481716156, + "rewards/Response_no_think_reward_1/mean": 0.1328125, + "rewards/Response_no_think_reward_1/std": 0.9081528782844543, "step": 53, - "train_speed(iter/s)": 0.002477 - }, - { - "clip_ratio/high_max": 0.02744574609096162, - "clip_ratio/high_mean": 0.02744574609096162, - "clip_ratio/low_mean": 0.04221567645436153, - "clip_ratio/low_min": 0.04221567645436153, - "clip_ratio/region_mean": 0.06966142146848142, - "epoch": 0.5983379501385041, - "grad_norm": 0.5808426269905869, - "kl": 0.801087921798171, - "learning_rate": 0.00016772815716257412, - "loss": -0.01366308145225048, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002484 + }, + { + "clip_ratio/high_max": 0.0014829304564045742, + "clip_ratio/high_mean": 0.0014829304564045742, + "clip_ratio/low_mean": 0.1896184734068811, + "clip_ratio/low_min": 0.1896184734068811, + "clip_ratio/region_mean": 0.19110140530392528, + "epoch": 0.6447761194029851, + "grad_norm": 3.3472874723788295, + "kl": 2.011909826847841, + "learning_rate": 0.00016212523202121544, + "loss": 0.00577022647485137, + "memory(GiB)": 79.48, "step": 54, - "train_speed(iter/s)": 0.002502 + "train_speed(iter/s)": 0.002509 }, { - "clip_ratio/high_max": 0.0003881987649947405, - "clip_ratio/high_mean": 0.0003881987649947405, - "clip_ratio/low_mean": 0.001932911021867767, - "clip_ratio/low_min": 0.001932911021867767, - "clip_ratio/region_mean": 0.0023211097868625075, - "completions/clipped_ratio": 0.0390625, - "completions/max_length": 101.0, - "completions/mean_length": 18.9921875, - "completions/min_length": 6.0, - "epoch": 0.6094182825484764, - "grad_norm": 1.1265096543789663, - "kl": 0.5226203491911292, - "learning_rate": 0.00016636513986016213, - "loss": 0.007094700820744038, - "memory(GiB)": 80.03, - "reward": 0.1875, - "reward_std": 0.7182328104972839, - "rewards/Response_no_think_reward/mean": 0.1875, - "rewards/Response_no_think_reward/std": 1.0480577945709229, + "clip_ratio/high_max": 0.0017361111240461469, + "clip_ratio/high_mean": 0.0017361111240461469, + "clip_ratio/low_mean": 0.004226236138492823, + "clip_ratio/low_min": 0.004226236138492823, + "clip_ratio/region_mean": 0.0059623472625389695, + "completions/clipped_ratio": 0.0859375, + "completions/max_length": 51.0, + "completions/mean_length": 10.125, + "completions/min_length": 3.0, + "epoch": 0.6567164179104478, + "grad_norm": 2.1721724253324193, + "kl": 1.4456337625160813, + "learning_rate": 0.00016054488332605283, + "loss": 0.007076151203364134, + "memory(GiB)": 79.48, + "reward": 0.3046875, + "reward_std": 0.4615631103515625, + "rewards/Response_no_think_reward_1/mean": 0.3046875, + "rewards/Response_no_think_reward_1/std": 0.8654214143753052, "step": 55, - "train_speed(iter/s)": 0.00249 - }, - { - "clip_ratio/high_max": 0.011908911721548066, - "clip_ratio/high_mean": 0.011908911721548066, - "clip_ratio/low_mean": 0.05817525731981732, - "clip_ratio/low_min": 0.05817525731981732, - "clip_ratio/region_mean": 0.07008416869211942, - "epoch": 0.6204986149584487, - "grad_norm": 0.5560920258062684, - "kl": 0.5747523186728358, - "learning_rate": 0.000164979723212536, - "loss": -0.014954826794564724, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002495 + }, + { + "clip_ratio/high_max": 0.07161095441551879, + "clip_ratio/high_mean": 0.07161095441551879, + "clip_ratio/low_mean": 0.0391811344306916, + "clip_ratio/low_min": 0.0391811344306916, + "clip_ratio/region_mean": 0.11079208552837372, + "epoch": 0.6686567164179105, + "grad_norm": 1.6216131312943962, + "kl": 0.9301650315364896, + "learning_rate": 0.00015894029291282758, + "loss": -0.018307652324438095, + "memory(GiB)": 79.48, "step": 56, - "train_speed(iter/s)": 0.002513 + "train_speed(iter/s)": 0.002519 }, { - "clip_ratio/high_max": 0.002692167239729315, - "clip_ratio/high_mean": 0.002692167239729315, - "clip_ratio/low_mean": 0.0006428283377317712, - "clip_ratio/low_min": 0.0006428283377317712, - "clip_ratio/region_mean": 0.003334995577461086, - "completions/clipped_ratio": 0.0390625, - "completions/max_length": 101.0, - "completions/mean_length": 16.53125, - "completions/min_length": 6.0, - "epoch": 0.631578947368421, - "grad_norm": 1.5596809103877662, - "kl": 0.6855434570461512, - "learning_rate": 0.00016357237482099684, - "loss": 0.0062956069596111774, - "memory(GiB)": 80.03, - "reward": 0.53125, - "reward_std": 0.5907745361328125, - "rewards/Response_no_think_reward/mean": 0.53125, - "rewards/Response_no_think_reward/std": 1.0790598392486572, + "clip_ratio/high_max": 0.0028409091755747795, + "clip_ratio/high_mean": 0.0028409091755747795, + "clip_ratio/low_mean": 0.007847597065847367, + "clip_ratio/low_min": 0.007847597065847367, + "clip_ratio/region_mean": 0.010688506241422147, + "completions/clipped_ratio": 0.0703125, + "completions/max_length": 51.0, + "completions/mean_length": 8.2109375, + "completions/min_length": 3.0, + "epoch": 0.6805970149253732, + "grad_norm": 4.528309911623671, + "kl": 1.2233935340000244, + "learning_rate": 0.00015731210324752972, + "loss": 0.015045193955302238, + "memory(GiB)": 79.48, + "reward": 0.171875, + "reward_std": 0.5126261711120605, + "rewards/Response_no_think_reward_1/mean": 0.171875, + "rewards/Response_no_think_reward_1/std": 0.9315922856330872, "step": 57, - "train_speed(iter/s)": 0.002501 - }, - { - "clip_ratio/high_max": 0.0316368987550959, - "clip_ratio/high_mean": 0.0316368987550959, - "clip_ratio/low_mean": 0.015557856269879267, - "clip_ratio/low_min": 0.015557856269879267, - "clip_ratio/region_mean": 0.04719475514139049, - "epoch": 0.6426592797783933, - "grad_norm": 0.950735686233936, - "kl": 0.5240823943167925, - "learning_rate": 0.00016214356968917648, - "loss": -0.015531505458056927, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002481 + }, + { + "clip_ratio/high_max": 0.022757820785045624, + "clip_ratio/high_mean": 0.022757820785045624, + "clip_ratio/low_mean": 0.14223288698121905, + "clip_ratio/low_min": 0.14223288698121905, + "clip_ratio/region_mean": 0.1649907068349421, + "epoch": 0.6925373134328359, + "grad_norm": 75.05881389891198, + "kl": 71.87919758663793, + "learning_rate": 0.00015566096624511307, + "loss": 0.9493598341941833, + "memory(GiB)": 79.48, "step": 58, - "train_speed(iter/s)": 0.002524 + "train_speed(iter/s)": 0.002504 }, { - "clip_ratio/high_max": 0.00011467889999039471, - "clip_ratio/high_mean": 0.00011467889999039471, - "clip_ratio/low_mean": 0.0004376750875962898, - "clip_ratio/low_min": 0.0004376750875962898, - "clip_ratio/region_mean": 0.0005523539875866845, - "completions/clipped_ratio": 0.078125, - "completions/max_length": 101.0, - "completions/mean_length": 23.9140625, - "completions/min_length": 6.0, - "epoch": 0.6537396121883656, - "grad_norm": 1.3162721482480142, - "kl": 0.5214177745606321, - "learning_rate": 0.00016069379006271566, - "loss": 0.004921327345073223, - "memory(GiB)": 80.03, - "reward": -0.0625, - "reward_std": 0.6303451657295227, - "rewards/Response_no_think_reward/mean": -0.0625, - "rewards/Response_no_think_reward/std": 1.0019665956497192, + "clip_ratio/high_max": 0.0005230125389061868, + "clip_ratio/high_mean": 0.0005230125389061868, + "clip_ratio/low_mean": 0.012553135456983, + "clip_ratio/low_min": 0.012553135456983, + "clip_ratio/region_mean": 0.013076147937681526, + "completions/clipped_ratio": 0.1171875, + "completions/max_length": 51.0, + "completions/mean_length": 9.3828125, + "completions/min_length": 3.0, + "epoch": 0.7044776119402985, + "grad_norm": 2.061647426051912, + "kl": 3.4461456341377925, + "learning_rate": 0.00015398754300847343, + "loss": 0.024864066392183304, + "memory(GiB)": 79.48, + "reward": 0.3046875, + "reward_std": 0.35084033012390137, + "rewards/Response_no_think_reward_1/mean": 0.3046875, + "rewards/Response_no_think_reward_1/std": 0.9010806679725647, "step": 59, - "train_speed(iter/s)": 0.002511 - }, - { - "clip_ratio/high_max": 0.00810479320352897, - "clip_ratio/high_mean": 0.00810479320352897, - "clip_ratio/low_mean": 0.05729365168372169, - "clip_ratio/low_min": 0.05729365168372169, - "clip_ratio/region_mean": 0.06539844395592809, - "epoch": 0.6648199445983379, - "grad_norm": 0.5733548474442324, - "kl": 0.6363338100200053, - "learning_rate": 0.00015922352526649803, - "loss": -0.021113965660333633, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002474 + }, + { + "clip_ratio/high_max": 0.010577498760540038, + "clip_ratio/high_mean": 0.010577498760540038, + "clip_ratio/low_mean": 0.15099563542753458, + "clip_ratio/low_min": 0.15099563542753458, + "clip_ratio/region_mean": 0.16157313529402018, + "epoch": 0.7164179104477612, + "grad_norm": 6.318543519105419, + "kl": 9.211844031116925, + "learning_rate": 0.00015229250356374804, + "loss": 0.058415383100509644, + "memory(GiB)": 79.48, "step": 60, - "train_speed(iter/s)": 0.002532 + "train_speed(iter/s)": 0.002497 }, { - "clip_ratio/high_max": 0.0005996339968987741, - "clip_ratio/high_mean": 0.0005996339968987741, - "clip_ratio/low_mean": 0.004901745676761493, - "clip_ratio/low_min": 0.004901745676761493, - "clip_ratio/region_mean": 0.00550137969548814, - "completions/clipped_ratio": 0.0859375, - "completions/max_length": 101.0, - "completions/mean_length": 22.375, - "completions/min_length": 2.0, - "epoch": 0.6759002770083102, - "grad_norm": 1.887884786225259, - "kl": 2.07791917472332, - "learning_rate": 0.00015773327153949465, - "loss": 0.008165515027940273, - "memory(GiB)": 80.03, - "reward": 0.40625, - "reward_std": 0.5973243117332458, - "rewards/Response_no_think_reward/mean": 0.40625, - "rewards/Response_no_think_reward/std": 1.186787486076355, + "clip_ratio/high_max": 0.0023436461633536965, + "clip_ratio/high_mean": 0.0023436461633536965, + "clip_ratio/low_mean": 0.01256567076779902, + "clip_ratio/low_min": 0.01256567076779902, + "clip_ratio/region_mean": 0.014909316785633564, + "completions/clipped_ratio": 0.1640625, + "completions/max_length": 51.0, + "completions/mean_length": 9.0546875, + "completions/min_length": 3.0, + "epoch": 0.7283582089552239, + "grad_norm": 8.650077130485371, + "kl": 12.875115153714432, + "learning_rate": 0.00015057652659204197, + "loss": 0.11098186671733856, + "memory(GiB)": 79.48, + "reward": -0.2109375, + "reward_std": 0.3248431980609894, + "rewards/Response_no_think_reward_1/mean": -0.2109375, + "rewards/Response_no_think_reward_1/std": 0.7060185074806213, "step": 61, - "train_speed(iter/s)": 0.002506 - }, - { - "clip_ratio/high_max": 0.017942053091246635, - "clip_ratio/high_mean": 0.017942053091246635, - "clip_ratio/low_mean": 0.06714771036058664, - "clip_ratio/low_min": 0.06714771036058664, - "clip_ratio/region_mean": 0.08508976292796433, - "epoch": 0.6869806094182825, - "grad_norm": 11.312330346219078, - "kl": 0.5888316835043952, - "learning_rate": 0.00015622353186727544, - "loss": 0.04619387909770012, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002485 + }, + { + "clip_ratio/high_max": 0.04812772118020803, + "clip_ratio/high_mean": 0.04812772118020803, + "clip_ratio/low_mean": 0.016272668377496302, + "clip_ratio/low_min": 0.016272668377496302, + "clip_ratio/region_mean": 0.06440038897562772, + "epoch": 0.7402985074626866, + "grad_norm": 6.330882663211948, + "kl": 4.831557432677073, + "learning_rate": 0.00014884029915768944, + "loss": 0.08532620966434479, + "memory(GiB)": 79.48, "step": 62, - "train_speed(iter/s)": 0.002527 + "train_speed(iter/s)": 0.002507 }, { - "clip_ratio/high_max": 0.00020032051543239504, - "clip_ratio/high_mean": 0.00020032051543239504, - "clip_ratio/low_mean": 0.001202335930429399, - "clip_ratio/low_min": 0.001202335930429399, - "clip_ratio/region_mean": 0.001402656445861794, - "completions/clipped_ratio": 0.0546875, - "completions/max_length": 101.0, - "completions/mean_length": 18.5859375, - "completions/min_length": 2.0, - "epoch": 0.6980609418282548, - "grad_norm": 1.9804020858052087, - "kl": 6.258792589243967, - "learning_rate": 0.00015469481581224272, - "loss": 0.014128579758107662, - "memory(GiB)": 80.03, - "reward": 0.78125, - "reward_std": 0.5936684608459473, - "rewards/Response_no_think_reward/mean": 0.78125, - "rewards/Response_no_think_reward/std": 1.235546350479126, + "clip_ratio/high_max": 0.0009259259095415473, + "clip_ratio/high_mean": 0.0009259259095415473, + "clip_ratio/low_mean": 0.005223244777880609, + "clip_ratio/low_min": 0.005223244777880609, + "clip_ratio/region_mean": 0.006149170687422156, + "completions/clipped_ratio": 0.0625, + "completions/max_length": 49.0, + "completions/mean_length": 6.8203125, + "completions/min_length": 3.0, + "epoch": 0.7522388059701492, + "grad_norm": 0.8455863083310526, + "kl": 3.406710424387711, + "learning_rate": 0.00014708451643315827, + "loss": 0.015459287911653519, + "memory(GiB)": 79.48, + "reward": 0.2890625, + "reward_std": 0.09522313624620438, + "rewards/Response_no_think_reward_1/mean": 0.2890625, + "rewards/Response_no_think_reward_1/std": 0.9319553971290588, "step": 63, - "train_speed(iter/s)": 0.002486 - }, - { - "clip_ratio/high_max": 0.020077986438991502, - "clip_ratio/high_mean": 0.020077986438991502, - "clip_ratio/low_mean": 0.12254823022522032, - "clip_ratio/low_min": 0.12254823022522032, - "clip_ratio/region_mean": 0.142626216635108, - "epoch": 0.7091412742382271, - "grad_norm": 1.5460664241155249, - "kl": 5.241092938755173, - "learning_rate": 0.0001531476393416456, - "loss": -0.0033248686231672764, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002478 + }, + { + "clip_ratio/high_max": 0.00038343557389453053, + "clip_ratio/high_mean": 0.00038343557389453053, + "clip_ratio/low_mean": 0.03692773682996631, + "clip_ratio/low_min": 0.03692773682996631, + "clip_ratio/region_mean": 0.037311173509806395, + "epoch": 0.764179104477612, + "grad_norm": 1.460493225059439, + "kl": 3.925420918938471, + "learning_rate": 0.00014530988142070803, + "loss": 0.015160211361944675, + "memory(GiB)": 79.48, "step": 64, - "train_speed(iter/s)": 0.002506 + "train_speed(iter/s)": 0.002499 }, { - "clip_ratio/high_max": 0.0006774475477868691, - "clip_ratio/high_mean": 0.0006774475477868691, - "clip_ratio/low_mean": 0.0009178321633953601, - "clip_ratio/low_min": 0.0009178321633953601, - "clip_ratio/region_mean": 0.0015952797257341444, - "completions/clipped_ratio": 0.0390625, - "completions/max_length": 101.0, - "completions/mean_length": 15.1484375, - "completions/min_length": 6.0, - "epoch": 0.7202216066481995, - "grad_norm": 1.528383760465238, - "kl": 1.888367731589824, - "learning_rate": 0.00015158252465343242, - "loss": 0.010861902497708797, - "memory(GiB)": 80.03, - "reward": 0.59375, - "reward_std": 0.5738716125488281, - "rewards/Response_no_think_reward/mean": 0.59375, - "rewards/Response_no_think_reward/std": 1.1462881565093994, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.02216397225856781, + "clip_ratio/low_min": 0.02216397225856781, + "clip_ratio/region_mean": 0.02216397225856781, + "completions/clipped_ratio": 0.15625, + "completions/max_length": 51.0, + "completions/mean_length": 8.1484375, + "completions/min_length": 3.0, + "epoch": 0.7761194029850746, + "grad_norm": 16.54465377888419, + "kl": 13.583033993607387, + "learning_rate": 0.00014351710467091336, + "loss": 0.09176836162805557, + "memory(GiB)": 79.48, + "reward": 0.0, + "reward_std": 0.44421693682670593, + "rewards/Response_no_think_reward_1/mean": 0.0, + "rewards/Response_no_think_reward_1/std": 0.8418202996253967, "step": 65, - "train_speed(iter/s)": 0.002444 - }, - { - "clip_ratio/high_max": 0.05604529404081404, - "clip_ratio/high_mean": 0.05604529404081404, - "clip_ratio/low_mean": 0.012011443439405411, - "clip_ratio/low_min": 0.012011443439405411, - "clip_ratio/region_mean": 0.06805673893541098, - "epoch": 0.7313019390581718, - "grad_norm": 0.9299498266912626, - "kl": 1.0373663480422692, - "learning_rate": 0.00015000000000000001, - "loss": -0.001186850480735302, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.00249 + }, + { + "clip_ratio/high_max": 0.016292952001094818, + "clip_ratio/high_mean": 0.016292952001094818, + "clip_ratio/low_mean": 0.02969469508389011, + "clip_ratio/low_min": 0.02969469508389011, + "clip_ratio/region_mean": 0.04598764737602323, + "epoch": 0.7880597014925373, + "grad_norm": 7.478581616879351, + "kl": 9.063416050747037, + "learning_rate": 0.0001417069039981647, + "loss": 0.08187955617904663, + "memory(GiB)": 79.48, "step": 66, - "train_speed(iter/s)": 0.002463 + "train_speed(iter/s)": 0.00251 }, { - "clip_ratio/high_max": 0.006279462773818523, - "clip_ratio/high_mean": 0.006279462773818523, - "clip_ratio/low_mean": 0.006620214961003512, - "clip_ratio/low_min": 0.006620214961003512, - "clip_ratio/region_mean": 0.012899677676614374, - "completions/clipped_ratio": 0.0546875, - "completions/max_length": 101.0, - "completions/mean_length": 17.5234375, - "completions/min_length": 2.0, - "epoch": 0.7423822714681441, - "grad_norm": 3.0195311219652377, - "kl": 1.4996049946639687, - "learning_rate": 0.0001484005995098999, - "loss": 0.0103817880153656, - "memory(GiB)": 80.03, - "reward": 0.2421875, - "reward_std": 0.5205168724060059, - "rewards/Response_no_think_reward/mean": 0.2421875, - "rewards/Response_no_think_reward/std": 1.2595843076705933, + "clip_ratio/high_max": 0.0003571428533177823, + "clip_ratio/high_mean": 0.0003571428533177823, + "clip_ratio/low_mean": 0.011069363099522889, + "clip_ratio/low_min": 0.011069363099522889, + "clip_ratio/region_mean": 0.011426505981944501, + "completions/clipped_ratio": 0.1171875, + "completions/max_length": 48.0, + "completions/mean_length": 6.75, + "completions/min_length": 3.0, + "epoch": 0.8, + "grad_norm": 2.789323653853436, + "kl": 6.344451879562257, + "learning_rate": 0.00013988000419326072, + "loss": 0.04125535860657692, + "memory(GiB)": 79.48, + "reward": 0.21875, + "reward_std": 0.40496253967285156, + "rewards/Response_no_think_reward_1/mean": 0.21875, + "rewards/Response_no_think_reward_1/std": 0.8778777122497559, "step": 67, - "train_speed(iter/s)": 0.002399 - }, - { - "clip_ratio/high_max": 0.030079254298470914, - "clip_ratio/high_mean": 0.030079254298470914, - "clip_ratio/low_mean": 0.10815927106887102, - "clip_ratio/low_min": 0.10815927106887102, - "clip_ratio/region_mean": 0.1382385252509266, - "epoch": 0.7534626038781164, - "grad_norm": 7.7164901906176375, - "kl": 4.463950714329258, - "learning_rate": 0.0001467848630075608, - "loss": 0.0073772999458014965, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.0025 + }, + { + "clip_ratio/high_max": 0.036289573181420565, + "clip_ratio/high_mean": 0.036289573181420565, + "clip_ratio/low_mean": 0.07330909674055874, + "clip_ratio/low_min": 0.07330909674055874, + "clip_ratio/region_mean": 0.10959866992197931, + "epoch": 0.8119402985074626, + "grad_norm": 3.351094606732551, + "kl": 7.85955839138478, + "learning_rate": 0.00013803713673320772, + "loss": 0.0294882133603096, + "memory(GiB)": 79.48, "step": 68, - "train_speed(iter/s)": 0.002418 + "train_speed(iter/s)": 0.00252 }, { - "clip_ratio/high_max": 0.0009369817780680023, - "clip_ratio/high_mean": 0.0009369817780680023, - "clip_ratio/low_mean": 0.006284750299528241, - "clip_ratio/low_min": 0.006284750299528241, - "clip_ratio/region_mean": 0.007221732055768371, - "completions/clipped_ratio": 0.1484375, - "completions/max_length": 101.0, - "completions/mean_length": 26.9296875, - "completions/min_length": 3.0, - "epoch": 0.7645429362880887, - "grad_norm": 2.034534758963297, - "kl": 2.321827916195616, - "learning_rate": 0.00014515333583108896, - "loss": 0.01671188324689865, - "memory(GiB)": 80.03, - "reward": 0.5390625, - "reward_std": 0.4874863028526306, - "rewards/Response_no_think_reward/mean": 0.5390625, - "rewards/Response_no_think_reward/std": 1.3095791339874268, + "clip_ratio/high_max": 0.0034414873807691038, + "clip_ratio/high_mean": 0.0034414873807691038, + "clip_ratio/low_mean": 0.017763152020052075, + "clip_ratio/low_min": 0.017763152020052075, + "clip_ratio/region_mean": 0.021204639226198196, + "completions/clipped_ratio": 0.1953125, + "completions/max_length": 50.0, + "completions/mean_length": 9.0390625, + "completions/min_length": 3.0, + "epoch": 0.8238805970149253, + "grad_norm": 2.3936208496329043, + "kl": 8.319812071829801, + "learning_rate": 0.00013617903948834155, + "loss": 0.0558692142367363, + "memory(GiB)": 79.48, + "reward": 0.1484375, + "reward_std": 0.5162962079048157, + "rewards/Response_no_think_reward_1/mean": 0.1484375, + "rewards/Response_no_think_reward_1/std": 0.7642591595649719, "step": 69, - "train_speed(iter/s)": 0.002373 - }, - { - "clip_ratio/high_max": 0.012032406637445092, - "clip_ratio/high_mean": 0.012032406637445092, - "clip_ratio/low_mean": 0.11593639780767262, - "clip_ratio/low_min": 0.11593639780767262, - "clip_ratio/region_mean": 0.1279688044451177, - "epoch": 0.775623268698061, - "grad_norm": 1.497770517232466, - "kl": 3.323778461664915, - "learning_rate": 0.00014350656864820733, - "loss": 0.0011269270908087492, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002511 + }, + { + "clip_ratio/high_max": 0.05922704888507724, + "clip_ratio/high_mean": 0.05922704888507724, + "clip_ratio/low_mean": 0.03970964252948761, + "clip_ratio/low_min": 0.03970964252948761, + "clip_ratio/region_mean": 0.09893669094890356, + "epoch": 0.835820895522388, + "grad_norm": 6.476273530366032, + "kl": 5.813117837678874, + "learning_rate": 0.00013430645642688988, + "loss": 0.04987351968884468, + "memory(GiB)": 79.48, "step": 70, - "train_speed(iter/s)": 0.002392 + "train_speed(iter/s)": 0.00253 }, { - "clip_ratio/high_max": 0.000255623715929687, - "clip_ratio/high_mean": 0.000255623715929687, - "clip_ratio/low_mean": 0.005516766890650615, - "clip_ratio/low_min": 0.005516766890650615, - "clip_ratio/region_mean": 0.005772390664787963, - "completions/clipped_ratio": 0.09375, - "completions/max_length": 101.0, - "completions/mean_length": 17.25, - "completions/min_length": 2.0, - "epoch": 0.7867036011080333, - "grad_norm": 2.3636642819394384, - "kl": 2.6716066980734468, - "learning_rate": 0.00014184511727039612, - "loss": 0.020374953746795654, - "memory(GiB)": 80.03, - "reward": 0.34375, - "reward_std": 0.5405020713806152, - "rewards/Response_no_think_reward/mean": 0.34375, - "rewards/Response_no_think_reward/std": 1.2323558330535889, + "clip_ratio/high_max": 0.002159281895728782, + "clip_ratio/high_mean": 0.002159281895728782, + "clip_ratio/low_mean": 0.010578428045846522, + "clip_ratio/low_min": 0.010578428045846522, + "clip_ratio/region_mean": 0.012737710087094456, + "completions/clipped_ratio": 0.1171875, + "completions/max_length": 44.0, + "completions/mean_length": 9.2421875, + "completions/min_length": 3.0, + "epoch": 0.8477611940298507, + "grad_norm": 3.9784798974103217, + "kl": 7.147874560090713, + "learning_rate": 0.00013242013731709287, + "loss": 0.06330341100692749, + "memory(GiB)": 79.48, + "reward": 0.015625, + "reward_std": 0.39743539690971375, + "rewards/Response_no_think_reward_1/mean": 0.015625, + "rewards/Response_no_think_reward_1/std": 0.6985291242599487, "step": 71, - "train_speed(iter/s)": 0.00236 - }, - { - "clip_ratio/high_max": 0.004156995622906834, - "clip_ratio/high_mean": 0.004156995622906834, - "clip_ratio/low_mean": 0.11334922257810831, - "clip_ratio/low_min": 0.11334922257810831, - "clip_ratio/region_mean": 0.11750621721148491, - "epoch": 0.7977839335180056, - "grad_norm": 1.5028809890146027, - "kl": 3.652272095438093, - "learning_rate": 0.00014016954246529696, - "loss": 0.00900588370859623, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002526 + }, + { + "clip_ratio/high_max": 0.014909500489011407, + "clip_ratio/high_mean": 0.014909500489011407, + "clip_ratio/low_mean": 0.05899865587707609, + "clip_ratio/low_min": 0.05899865587707609, + "clip_ratio/region_mean": 0.07390815508551896, + "epoch": 0.8597014925373134, + "grad_norm": 107.14584369632281, + "kl": 5.481248813099228, + "learning_rate": 0.00013052083742700173, + "loss": 0.5873211026191711, + "memory(GiB)": 79.48, "step": 72, - "train_speed(iter/s)": 0.002378 + "train_speed(iter/s)": 0.002544 }, { - "clip_ratio/high_max": 0.0024562697508372366, - "clip_ratio/high_mean": 0.0024562697508372366, - "clip_ratio/low_mean": 0.00900937442202121, - "clip_ratio/low_min": 0.00900937442202121, - "clip_ratio/region_mean": 0.01146564440568909, - "completions/clipped_ratio": 0.1015625, - "completions/max_length": 101.0, - "completions/mean_length": 20.9609375, - "completions/min_length": 6.0, - "epoch": 0.8088642659279779, - "grad_norm": 1.9262088024122541, - "kl": 2.068145776007441, - "learning_rate": 0.00013848040976744457, - "loss": 0.009554898366332054, - "memory(GiB)": 80.03, - "reward": 0.7734375, - "reward_std": 0.6535134315490723, - "rewards/Response_no_think_reward/mean": 0.7734375, - "rewards/Response_no_think_reward/std": 1.224518895149231, + "clip_ratio/high_max": 0.005898644914850593, + "clip_ratio/high_mean": 0.005898644914850593, + "clip_ratio/low_mean": 0.013190844911150634, + "clip_ratio/low_min": 0.013190844911150634, + "clip_ratio/region_mean": 0.01908948994241655, + "completions/clipped_ratio": 0.1484375, + "completions/max_length": 51.0, + "completions/mean_length": 7.625, + "completions/min_length": 3.0, + "epoch": 0.8716417910447761, + "grad_norm": 5.671656969858763, + "kl": 5.887194114271551, + "learning_rate": 0.0001286093172220748, + "loss": 0.05823807045817375, + "memory(GiB)": 79.48, + "reward": 0.0078125, + "reward_std": 0.47193682193756104, + "rewards/Response_no_think_reward_1/mean": 0.0078125, + "rewards/Response_no_think_reward_1/std": 0.8648526072502136, "step": 73, - "train_speed(iter/s)": 0.002347 - }, - { - "clip_ratio/high_max": 0.05884167249314487, - "clip_ratio/high_mean": 0.05884167249314487, - "clip_ratio/low_mean": 0.014398490195162594, - "clip_ratio/low_min": 0.014398490195162594, - "clip_ratio/region_mean": 0.0732401623390615, - "epoch": 0.8199445983379502, - "grad_norm": 3.7794078536832525, - "kl": 1.1005137297324836, - "learning_rate": 0.00013677828928738934, - "loss": 0.027932219207286835, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002537 + }, + { + "clip_ratio/high_max": 0.05940199224278331, + "clip_ratio/high_mean": 0.05940199224278331, + "clip_ratio/low_mean": 0.07782801624853164, + "clip_ratio/low_min": 0.07782801624853164, + "clip_ratio/region_mean": 0.1372300088405609, + "epoch": 0.8835820895522388, + "grad_norm": 5.588550612212405, + "kl": 9.119772452046163, + "learning_rate": 0.00012668634206069304, + "loss": 0.05784386023879051, + "memory(GiB)": 79.48, "step": 74, - "train_speed(iter/s)": 0.002365 + "train_speed(iter/s)": 0.002555 }, { - "clip_ratio/high_max": 0.0020199596765451133, - "clip_ratio/high_mean": 0.0020199596765451133, - "clip_ratio/low_mean": 0.009859619050985202, - "clip_ratio/low_min": 0.009859619050985202, - "clip_ratio/region_mean": 0.0118795787129784, - "completions/clipped_ratio": 0.09375, - "completions/max_length": 101.0, - "completions/mean_length": 19.734375, - "completions/min_length": 2.0, - "epoch": 0.8310249307479224, - "grad_norm": 2.6931881467895598, - "kl": 1.9703011065721512, - "learning_rate": 0.00013506375551927547, - "loss": 0.010023066774010658, - "memory(GiB)": 80.03, - "reward": 0.4140625, - "reward_std": 0.6804871559143066, - "rewards/Response_no_think_reward/mean": 0.4140625, - "rewards/Response_no_think_reward/std": 1.2005729675292969, + "clip_ratio/high_max": 0.0005630630766972899, + "clip_ratio/high_mean": 0.0005630630766972899, + "clip_ratio/low_mean": 0.009406007709912956, + "clip_ratio/low_min": 0.009406007709912956, + "clip_ratio/region_mean": 0.009969070786610246, + "completions/clipped_ratio": 0.0546875, + "completions/max_length": 43.0, + "completions/mean_length": 7.3671875, + "completions/min_length": 3.0, + "epoch": 0.8955223880597015, + "grad_norm": 40.351102862526105, + "kl": 37.61209568884806, + "learning_rate": 0.00012475268188771627, + "loss": 0.25722047686576843, + "memory(GiB)": 79.48, + "reward": 0.515625, + "reward_std": 0.3077147901058197, + "rewards/Response_no_think_reward_1/mean": 0.515625, + "rewards/Response_no_think_reward_1/std": 0.5883966684341431, "step": 75, - "train_speed(iter/s)": 0.00233 - }, - { - "clip_ratio/high_max": 0.004052987133036368, - "clip_ratio/high_mean": 0.004052987133036368, - "clip_ratio/low_mean": 0.14585177681874484, - "clip_ratio/low_min": 0.14585177681874484, - "clip_ratio/region_mean": 0.14990476449020207, - "epoch": 0.8421052631578947, - "grad_norm": 1.4459331642351634, - "kl": 4.161040774546564, - "learning_rate": 0.00013333738714693956, - "loss": -0.005643587093800306, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.00255 + }, + { + "clip_ratio/high_max": 0.03623928187880665, + "clip_ratio/high_mean": 0.03623928187880665, + "clip_ratio/low_mean": 0.00604772218503058, + "clip_ratio/low_min": 0.00604772218503058, + "clip_ratio/region_mean": 0.04228700394742191, + "epoch": 0.9074626865671642, + "grad_norm": 17.208461552664357, + "kl": 6.087301138206385, + "learning_rate": 0.00012280911092620297, + "loss": 0.16766606271266937, + "memory(GiB)": 79.48, "step": 76, - "train_speed(iter/s)": 0.002347 + "train_speed(iter/s)": 0.002568 }, { - "clip_ratio/high_max": 0.00046641789958812296, - "clip_ratio/high_mean": 0.00046641789958812296, - "clip_ratio/low_mean": 0.0038580247201025486, - "clip_ratio/low_min": 0.0038580247201025486, - "clip_ratio/region_mean": 0.0043244426196906716, - "completions/clipped_ratio": 0.0859375, - "completions/max_length": 99.0, - "completions/mean_length": 14.8828125, - "completions/min_length": 2.0, - "epoch": 0.853185595567867, - "grad_norm": 2.393092790871116, - "kl": 2.344057558570057, - "learning_rate": 0.00013159976684859527, - "loss": 0.014792806468904018, - "memory(GiB)": 80.03, - "reward": 0.8046875, - "reward_std": 0.515557050704956, - "rewards/Response_no_think_reward/mean": 0.8046875, - "rewards/Response_no_think_reward/std": 1.2862604856491089, + "clip_ratio/high_max": 0.0016891892300918698, + "clip_ratio/high_mean": 0.0016891892300918698, + "clip_ratio/low_mean": 0.012179655604995787, + "clip_ratio/low_min": 0.012179655604995787, + "clip_ratio/region_mean": 0.013868844718672335, + "completions/clipped_ratio": 0.125, + "completions/max_length": 39.0, + "completions/mean_length": 7.21875, + "completions/min_length": 3.0, + "epoch": 0.9194029850746268, + "grad_norm": 4.3979207862679734, + "kl": 7.126492358453106, + "learning_rate": 0.00012085640736741708, + "loss": 0.06262560933828354, + "memory(GiB)": 79.48, + "reward": 0.0546875, + "reward_std": 0.39322251081466675, + "rewards/Response_no_think_reward_1/mean": 0.0546875, + "rewards/Response_no_think_reward_1/std": 0.7561672329902649, "step": 77, - "train_speed(iter/s)": 0.002292 - }, - { - "clip_ratio/high_max": 0.005874009046237916, - "clip_ratio/high_mean": 0.005874009046237916, - "clip_ratio/low_mean": 0.0609364231931977, - "clip_ratio/low_min": 0.0609364231931977, - "clip_ratio/region_mean": 0.0668104327050969, - "epoch": 0.8642659279778393, - "grad_norm": 0.9235795825109938, - "kl": 3.164612793829292, - "learning_rate": 0.00012985148110016947, - "loss": 0.001517204917035997, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002562 + }, + { + "clip_ratio/high_max": 0.026138584362342954, + "clip_ratio/high_mean": 0.026138584362342954, + "clip_ratio/low_mean": 0.04480157361831516, + "clip_ratio/low_min": 0.04480157361831516, + "clip_ratio/region_mean": 0.07094015786424279, + "epoch": 0.9313432835820895, + "grad_norm": 2.916485581854171, + "kl": 4.029124836612027, + "learning_rate": 0.00011889535305924618, + "loss": 0.04432527720928192, + "memory(GiB)": 79.48, "step": 78, - "train_speed(iter/s)": 0.002309 + "train_speed(iter/s)": 0.002579 }, { - "clip_ratio/high_max": 0.002277967141708359, - "clip_ratio/high_mean": 0.002277967141708359, - "clip_ratio/low_mean": 0.0037592062435578555, - "clip_ratio/low_min": 0.0037592062435578555, - "clip_ratio/region_mean": 0.006037173385266215, - "completions/clipped_ratio": 0.0625, - "completions/max_length": 87.0, - "completions/mean_length": 15.703125, - "completions/min_length": 2.0, - "epoch": 0.8753462603878116, - "grad_norm": 1.666555946903183, - "kl": 2.2231151023879647, - "learning_rate": 0.00012809311997735696, - "loss": 0.012878447771072388, - "memory(GiB)": 80.03, - "reward": 0.546875, - "reward_std": 0.7733994126319885, - "rewards/Response_no_think_reward/mean": 0.546875, - "rewards/Response_no_think_reward/std": 1.3032931089401245, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0125213154242374, + "clip_ratio/low_min": 0.0125213154242374, + "clip_ratio/region_mean": 0.0125213154242374, + "completions/clipped_ratio": 0.1015625, + "completions/max_length": 41.0, + "completions/mean_length": 7.5703125, + "completions/min_length": 3.0, + "epoch": 0.9432835820895522, + "grad_norm": 5.401724081079944, + "kl": 2.715451994285104, + "learning_rate": 0.00011692673319315541, + "loss": 0.025846321135759354, + "memory(GiB)": 79.48, + "reward": 0.15625, + "reward_std": 0.32662156224250793, + "rewards/Response_no_think_reward_1/mean": 0.15625, + "rewards/Response_no_think_reward_1/std": 0.778019905090332, "step": 79, - "train_speed(iter/s)": 0.002271 - }, - { - "clip_ratio/high_max": 0.03329824731918052, - "clip_ratio/high_mean": 0.03329824731918052, - "clip_ratio/low_mean": 0.017765316180884838, - "clip_ratio/low_min": 0.017765316180884838, - "clip_ratio/region_mean": 0.05106356361648068, - "epoch": 0.8864265927977839, - "grad_norm": 1.0568349375834465, - "kl": 1.923786539278808, - "learning_rate": 0.00012632527695645993, - "loss": -0.0005231135291978717, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002572 + }, + { + "clip_ratio/high_max": 0.02864583395421505, + "clip_ratio/high_mean": 0.02864583395421505, + "clip_ratio/low_mean": 0.06598890712484717, + "clip_ratio/low_min": 0.06598890712484717, + "clip_ratio/region_mean": 0.09463474014773965, + "epoch": 0.9552238805970149, + "grad_norm": 1.7607357402294221, + "kl": 3.6259496022976236, + "learning_rate": 0.00011495133598980263, + "loss": 0.011118962429463863, + "memory(GiB)": 79.48, "step": 80, - "train_speed(iter/s)": 0.002287 + "train_speed(iter/s)": 0.002589 }, { - "clip_ratio/high_max": 0.00021551724057644606, - "clip_ratio/high_mean": 0.00021551724057644606, - "clip_ratio/low_mean": 0.006801646784879267, - "clip_ratio/low_min": 0.006801646784879267, - "clip_ratio/region_mean": 0.007017164025455713, - "completions/clipped_ratio": 0.046875, - "completions/max_length": 90.0, - "completions/mean_length": 14.03125, - "completions/min_length": 2.0, - "epoch": 0.8975069252077562, - "grad_norm": 9.477113742654934, - "kl": 3.0111945159733295, - "learning_rate": 0.00012454854871407994, - "loss": 0.016959797590970993, - "memory(GiB)": 80.03, - "reward": 0.2578125, - "reward_std": 0.5107755661010742, - "rewards/Response_no_think_reward/mean": 0.2578125, - "rewards/Response_no_think_reward/std": 1.2874077558517456, + "clip_ratio/high_max": 0.0010000000474974513, + "clip_ratio/high_mean": 0.0010000000474974513, + "clip_ratio/low_mean": 0.009746301162522286, + "clip_ratio/low_min": 0.009746301162522286, + "clip_ratio/region_mean": 0.010746301151812077, + "completions/clipped_ratio": 0.1015625, + "completions/max_length": 45.0, + "completions/mean_length": 7.421875, + "completions/min_length": 3.0, + "epoch": 0.9671641791044776, + "grad_norm": 6.226807855082435, + "kl": 3.5353202793048695, + "learning_rate": 0.00011296995238344084, + "loss": 0.0407019704580307, + "memory(GiB)": 79.48, + "reward": 0.2109375, + "reward_std": 0.3596799373626709, + "rewards/Response_no_think_reward_1/mean": 0.2109375, + "rewards/Response_no_think_reward_1/std": 0.78019118309021, "step": 81, - "train_speed(iter/s)": 0.002263 - }, - { - "clip_ratio/high_max": 0.012387449765810743, - "clip_ratio/high_mean": 0.012387449765810743, - "clip_ratio/low_mean": 0.04806764563545585, - "clip_ratio/low_min": 0.04806764563545585, - "clip_ratio/region_mean": 0.06045509548857808, - "epoch": 0.9085872576177285, - "grad_norm": 1.1639747912015215, - "kl": 3.7243148013949394, - "learning_rate": 0.00012276353492572935, - "loss": 0.0026693246327340603, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002582 + }, + { + "clip_ratio/high_max": 0.025790343526750803, + "clip_ratio/high_mean": 0.025790343526750803, + "clip_ratio/low_mean": 0.027053400757722557, + "clip_ratio/low_min": 0.027053400757722557, + "clip_ratio/region_mean": 0.052843744633719325, + "epoch": 0.9791044776119403, + "grad_norm": 43.50825312796573, + "kl": 2.1143818981945515, + "learning_rate": 0.00011098337570523396, + "loss": 0.1263183057308197, + "memory(GiB)": 79.48, "step": 82, - "train_speed(iter/s)": 0.002279 + "train_speed(iter/s)": 0.002599 }, { - "clip_ratio/high_max": 0.0004032258002553135, - "clip_ratio/high_mean": 0.0004032258002553135, - "clip_ratio/low_mean": 0.0061736139468848705, - "clip_ratio/low_min": 0.0061736139468848705, - "clip_ratio/region_mean": 0.006576839747140184, - "completions/clipped_ratio": 0.03125, - "completions/max_length": 99.0, - "completions/mean_length": 12.625, - "completions/min_length": 2.0, - "epoch": 0.9196675900277008, - "grad_norm": 7.345333737975268, - "kl": 1.6264500059187412, - "learning_rate": 0.00012097083806343103, - "loss": 0.02225027047097683, - "memory(GiB)": 80.03, - "reward": 0.6640625, - "reward_std": 0.4172249436378479, - "rewards/Response_no_think_reward/mean": 0.6640625, - "rewards/Response_no_think_reward/std": 1.1588573455810547, + "clip_ratio/high_max": 0.0045458003878593445, + "clip_ratio/high_mean": 0.0045458003878593445, + "clip_ratio/low_mean": 0.004786531790159643, + "clip_ratio/low_min": 0.004786531790159643, + "clip_ratio/region_mean": 0.009332332178018987, + "completions/clipped_ratio": 0.0625, + "completions/max_length": 23.0, + "completions/mean_length": 5.6796875, + "completions/min_length": 3.0, + "epoch": 1.0119402985074626, + "grad_norm": 5.294876949688284, + "kl": 1.5498897642164593, + "learning_rate": 0.00010899240136561299, + "loss": 0.011598482728004456, + "memory(GiB)": 79.48, + "reward": 0.4453125, + "reward_std": 0.1938612163066864, + "rewards/Response_no_think_reward_1/mean": 0.4453125, + "rewards/Response_no_think_reward_1/std": 0.7187981605529785, "step": 83, - "train_speed(iter/s)": 0.00227 - }, - { - "clip_ratio/high_max": 0.0035271961241960526, - "clip_ratio/high_mean": 0.0035271961241960526, - "clip_ratio/low_mean": 0.02831025089835748, - "clip_ratio/low_min": 0.02831025089835748, - "clip_ratio/region_mean": 0.03183744702255353, - "epoch": 0.9307479224376731, - "grad_norm": 84.3494363093827, - "kl": 10.616167868487537, - "learning_rate": 0.00011917106319237386, - "loss": 0.17172452807426453, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002589 + }, + { + "clip_ratio/high_max": 0.025593542493879795, + "clip_ratio/high_mean": 0.025593542493879795, + "clip_ratio/low_mean": 0.025054577039554715, + "clip_ratio/low_min": 0.025054577039554715, + "clip_ratio/region_mean": 0.05064811953343451, + "epoch": 1.0238805970149254, + "grad_norm": 2.6737027093734143, + "kl": 1.398324867649535, + "learning_rate": 0.00010699782653579973, + "loss": -0.00029344583163037896, + "memory(GiB)": 79.48, "step": 84, - "train_speed(iter/s)": 0.002286 - }, - { - "clip_ratio/high_max": 0.0011701860348694026, - "clip_ratio/high_mean": 0.0011701860348694026, - "clip_ratio/low_mean": 0.014238029951229692, - "clip_ratio/low_min": 0.014238029951229692, - "clip_ratio/region_mean": 0.015408215986099094, - "completions/clipped_ratio": 0.140625, - "completions/max_length": 101.0, - "completions/mean_length": 19.7578125, - "completions/min_length": 4.0, - "epoch": 0.9418282548476454, - "grad_norm": 1.9907484000781221, - "kl": 2.995624510163907, - "learning_rate": 0.00011736481776669306, - "loss": 0.01750401221215725, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002605 + }, + { + "clip_ratio/high_max": 0.0017993993242271245, + "clip_ratio/high_mean": 0.0017993993242271245, + "clip_ratio/low_mean": 0.01037665200419724, + "clip_ratio/low_min": 0.01037665200419724, + "clip_ratio/region_mean": 0.012176051270216703, + "completions/clipped_ratio": 0.171875, + "completions/max_length": 42.0, + "completions/mean_length": 6.125, + "completions/min_length": 3.0, + "epoch": 1.035820895522388, + "grad_norm": 2.5145149964606297, + "kl": 3.1435449587497715, + "learning_rate": 0.00010500044982862519, + "loss": 0.024344690144062042, + "memory(GiB)": 79.48, "reward": 0.4765625, - "reward_std": 0.4854952394962311, - "rewards/Response_no_think_reward/mean": 0.4765625, - "rewards/Response_no_think_reward/std": 1.1080580949783325, + "reward_std": 0.2772369980812073, + "rewards/Response_no_think_reward_1/mean": 0.4765625, + "rewards/Response_no_think_reward_1/std": 0.8414914011955261, "step": 85, - "train_speed(iter/s)": 0.002274 - }, - { - "clip_ratio/high_max": 0.008182557401596569, - "clip_ratio/high_mean": 0.008182557401596569, - "clip_ratio/low_mean": 0.11124554229900241, - "clip_ratio/low_min": 0.11124554229900241, - "clip_ratio/region_mean": 0.11942810016626026, - "epoch": 0.9529085872576177, - "grad_norm": 1.9564641583381899, - "kl": 4.675610944104847, - "learning_rate": 0.00011555271142444433, - "loss": 0.009754904545843601, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002595 + }, + { + "clip_ratio/high_max": 0.021866617840714753, + "clip_ratio/high_mean": 0.021866617840714753, + "clip_ratio/low_mean": 0.07049822807312012, + "clip_ratio/low_min": 0.07049822807312012, + "clip_ratio/region_mean": 0.09236484486609697, + "epoch": 1.0477611940298508, + "grad_norm": 2.607332219212116, + "kl": 4.641115245953188, + "learning_rate": 0.00010300107097877114, + "loss": 0.010013583116233349, + "memory(GiB)": 79.48, "step": 86, - "train_speed(iter/s)": 0.002289 + "train_speed(iter/s)": 0.00261 }, { - "clip_ratio/high_max": 0.0004139889351790771, - "clip_ratio/high_mean": 0.0004139889351790771, - "clip_ratio/low_mean": 0.009557914454489946, - "clip_ratio/low_min": 0.009557914454489946, - "clip_ratio/region_mean": 0.0099719034624286, - "completions/clipped_ratio": 0.0859375, - "completions/max_length": 101.0, - "completions/mean_length": 17.90625, - "completions/min_length": 2.0, - "epoch": 0.96398891966759, - "grad_norm": 1.805689670049186, - "kl": 3.4809365491382778, - "learning_rate": 0.00011373535578184082, - "loss": 0.0213579460978508, - "memory(GiB)": 80.03, - "reward": 0.5859375, - "reward_std": 0.5313136577606201, - "rewards/Response_no_think_reward/mean": 0.5859375, - "rewards/Response_no_think_reward/std": 1.1939964294433594, + "clip_ratio/high_max": 0.0018382353009656072, + "clip_ratio/high_mean": 0.0018382353009656072, + "clip_ratio/low_mean": 0.0032051282469183207, + "clip_ratio/low_min": 0.0032051282469183207, + "clip_ratio/region_mean": 0.005043363547883928, + "completions/clipped_ratio": 0.03125, + "completions/max_length": 20.0, + "completions/mean_length": 5.4375, + "completions/min_length": 3.0, + "epoch": 1.0597014925373134, + "grad_norm": 8.56914849705318, + "kl": 0.7865612751156732, + "learning_rate": 0.00010100049052256235, + "loss": 0.013117787428200245, + "memory(GiB)": 79.48, + "reward": 0.53125, + "reward_std": 0.1860944628715515, + "rewards/Response_no_think_reward_1/mean": 0.53125, + "rewards/Response_no_think_reward_1/std": 0.7202088236808777, "step": 87, - "train_speed(iter/s)": 0.002277 - }, - { - "clip_ratio/high_max": 0.009385127894347534, - "clip_ratio/high_mean": 0.009385127894347534, - "clip_ratio/low_mean": 0.08647578035015613, - "clip_ratio/low_min": 0.08647578035015613, - "clip_ratio/region_mean": 0.095860909903422, - "epoch": 0.9750692520775623, - "grad_norm": 2.411018383110019, - "kl": 4.761912747140741, - "learning_rate": 0.00011191336422682237, - "loss": 0.01895134523510933, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002597 + }, + { + "clip_ratio/high_max": 0.009521116502583027, + "clip_ratio/high_mean": 0.009521116502583027, + "clip_ratio/low_mean": 0.0203368536895141, + "clip_ratio/low_min": 0.0203368536895141, + "clip_ratio/region_mean": 0.029857969493605196, + "epoch": 1.0716417910447762, + "grad_norm": 3.3791848142288035, + "kl": 0.6961851019823371, + "learning_rate": 9.899950947743767e-05, + "loss": 0.00659452797845006, + "memory(GiB)": 79.48, "step": 88, - "train_speed(iter/s)": 0.002291 + "train_speed(iter/s)": 0.002612 }, { - "clip_ratio/high_max": 0.0031819915457163006, - "clip_ratio/high_mean": 0.0031819915457163006, - "clip_ratio/low_mean": 0.012216789647936821, - "clip_ratio/low_min": 0.012216789647936821, - "clip_ratio/region_mean": 0.015398780989926308, - "completions/clipped_ratio": 0.0625, - "completions/max_length": 64.0, - "completions/mean_length": 11.28125, - "completions/min_length": 2.0, - "epoch": 0.9861495844875346, - "grad_norm": 2.2626010793409574, - "kl": 6.020935451146215, - "learning_rate": 0.00011008735171202684, - "loss": 0.031282562762498856, - "memory(GiB)": 80.03, - "reward": 0.2890625, - "reward_std": 0.847247302532196, - "rewards/Response_no_think_reward/mean": 0.2890625, - "rewards/Response_no_think_reward/std": 1.1915208101272583, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.004996612435206771, + "clip_ratio/low_min": 0.004996612435206771, + "clip_ratio/region_mean": 0.004996612435206771, + "completions/clipped_ratio": 0.1171875, + "completions/max_length": 31.0, + "completions/mean_length": 5.2265625, + "completions/min_length": 3.0, + "epoch": 1.0835820895522388, + "grad_norm": 3.6519414582158323, + "kl": 4.849585925694555, + "learning_rate": 9.699892902122886e-05, + "loss": 0.06144208833575249, + "memory(GiB)": 79.48, + "reward": 0.1640625, + "reward_std": 0.3352247476577759, + "rewards/Response_no_think_reward_1/mean": 0.1640625, + "rewards/Response_no_think_reward_1/std": 0.8303053379058838, "step": 89, - "train_speed(iter/s)": 0.002254 - }, - { - "clip_ratio/high_max": 0.024421937006991357, - "clip_ratio/high_mean": 0.024421937006991357, - "clip_ratio/low_mean": 0.0521851975354366, - "clip_ratio/low_min": 0.0521851975354366, - "clip_ratio/region_mean": 0.07660713430959731, - "epoch": 0.997229916897507, - "grad_norm": 1.8302536272850396, - "kl": 6.024846433196217, - "learning_rate": 0.00010825793454723325, - "loss": 0.017346249893307686, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002606 + }, + { + "clip_ratio/high_max": 0.017538156593218446, + "clip_ratio/high_mean": 0.017538156593218446, + "clip_ratio/low_mean": 0.03697483101859689, + "clip_ratio/low_min": 0.03697483101859689, + "clip_ratio/region_mean": 0.054512988310307264, + "epoch": 1.0955223880597016, + "grad_norm": 13.104523239395307, + "kl": 2.37760816863738, + "learning_rate": 9.499955017137484e-05, + "loss": 0.10894370079040527, + "memory(GiB)": 79.48, "step": 90, - "train_speed(iter/s)": 0.002268 + "train_speed(iter/s)": 0.002621 }, { - "clip_ratio/high_max": 0.0011776478204410523, - "clip_ratio/high_mean": 0.0011776478204410523, - "clip_ratio/low_mean": 0.0035608798498287797, - "clip_ratio/low_min": 0.0035608798498287797, - "clip_ratio/region_mean": 0.004738527670269832, - "completions/clipped_ratio": 0.125, - "completions/max_length": 101.0, - "completions/mean_length": 24.046875, - "completions/min_length": 3.0, - "epoch": 1.0110803324099722, - "grad_norm": 2.3698869054826233, - "kl": 5.333947827733937, - "learning_rate": 0.00010642573019134703, - "loss": 0.028505954891443253, - "memory(GiB)": 80.03, - "reward": 0.84375, - "reward_std": 0.6655995845794678, - "rewards/Response_no_think_reward/mean": 0.84375, - "rewards/Response_no_think_reward/std": 1.2065274715423584, + "clip_ratio/high_max": 0.004422514699399471, + "clip_ratio/high_mean": 0.004422514699399471, + "clip_ratio/low_mean": 0.007080804323777556, + "clip_ratio/low_min": 0.007080804323777556, + "clip_ratio/region_mean": 0.01150331913959235, + "completions/clipped_ratio": 0.046875, + "completions/max_length": 7.0, + "completions/mean_length": 4.6640625, + "completions/min_length": 3.0, + "epoch": 1.1074626865671642, + "grad_norm": 3.292956583617785, + "kl": 3.1563512758002616, + "learning_rate": 9.30021734642003e-05, + "loss": 0.03713127598166466, + "memory(GiB)": 79.48, + "reward": 0.421875, + "reward_std": 0.2630079686641693, + "rewards/Response_no_think_reward_1/mean": 0.421875, + "rewards/Response_no_think_reward_1/std": 0.7382611632347107, "step": 91, - "train_speed(iter/s)": 0.002232 - }, - { - "clip_ratio/high_max": 0.02221274602925405, - "clip_ratio/high_mean": 0.02221274602925405, - "clip_ratio/low_mean": 0.04682085904642008, - "clip_ratio/low_min": 0.04682085904642008, - "clip_ratio/region_mean": 0.0690336050465703, - "epoch": 1.0221606648199446, - "grad_norm": 1.377879165623118, - "kl": 6.767704317186144, - "learning_rate": 0.00010459135704399718, - "loss": 0.01659482903778553, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002603 + }, + { + "clip_ratio/high_max": 0.012390351388603449, + "clip_ratio/high_mean": 0.012390351388603449, + "clip_ratio/low_mean": 0.01934311306104064, + "clip_ratio/low_min": 0.01934311306104064, + "clip_ratio/region_mean": 0.03173346375115216, + "epoch": 1.1194029850746268, + "grad_norm": 6.523254504794387, + "kl": 2.134530827694107, + "learning_rate": 9.100759863438702e-05, + "loss": 0.04548652470111847, + "memory(GiB)": 79.48, "step": 92, - "train_speed(iter/s)": 0.002246 + "train_speed(iter/s)": 0.002618 }, { - "clip_ratio/high_max": 0.0007944914977997541, - "clip_ratio/high_mean": 0.0007944914977997541, - "clip_ratio/low_mean": 0.005214237666223198, - "clip_ratio/low_min": 0.005214237666223198, - "clip_ratio/region_mean": 0.006008729164022952, - "completions/clipped_ratio": 0.046875, - "completions/max_length": 79.0, - "completions/mean_length": 11.1953125, - "completions/min_length": 2.0, - "epoch": 1.0332409972299168, - "grad_norm": 1.128328936062302, - "kl": 2.6099998716963455, - "learning_rate": 0.00010275543423681621, - "loss": 0.01443527452647686, - "memory(GiB)": 80.03, - "reward": 0.5703125, - "reward_std": 0.34169840812683105, - "rewards/Response_no_think_reward/mean": 0.5703125, - "rewards/Response_no_think_reward/std": 1.26543128490448, + "clip_ratio/high_max": 0.0018115942366421223, + "clip_ratio/high_mean": 0.0018115942366421223, + "clip_ratio/low_mean": 0.010487846680916846, + "clip_ratio/low_min": 0.010487846680916846, + "clip_ratio/region_mean": 0.012299440917558968, + "completions/clipped_ratio": 0.078125, + "completions/max_length": 17.0, + "completions/mean_length": 4.7109375, + "completions/min_length": 3.0, + "epoch": 1.1313432835820896, + "grad_norm": 2.8653500050121345, + "kl": 3.8929527901345864, + "learning_rate": 8.901662429476607e-05, + "loss": 0.04490555822849274, + "memory(GiB)": 79.48, + "reward": 0.1796875, + "reward_std": 0.25065141916275024, + "rewards/Response_no_think_reward_1/mean": 0.1796875, + "rewards/Response_no_think_reward_1/std": 0.9173188805580139, "step": 93, - "train_speed(iter/s)": 0.00223 - }, - { - "clip_ratio/high_max": 0.024202606233302504, - "clip_ratio/high_mean": 0.024202606233302504, - "clip_ratio/low_mean": 0.017650849069468677, - "clip_ratio/low_min": 0.017650849069468677, - "clip_ratio/region_mean": 0.04185345536097884, - "epoch": 1.0443213296398892, - "grad_norm": 0.5979565041663649, - "kl": 1.9247902451315895, - "learning_rate": 0.00010091858142447265, - "loss": 0.005481676664203405, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.00261 + }, + { + "clip_ratio/high_max": 0.019497282337397337, + "clip_ratio/high_mean": 0.019497282337397337, + "clip_ratio/low_mean": 0.05975891789421439, + "clip_ratio/low_min": 0.05975891789421439, + "clip_ratio/region_mean": 0.07925620023161173, + "epoch": 1.1432835820895522, + "grad_norm": 8.612775013595648, + "kl": 4.982872966560535, + "learning_rate": 8.703004761655917e-05, + "loss": 0.07919233292341232, + "memory(GiB)": 79.48, "step": 94, - "train_speed(iter/s)": 0.002243 - }, - { - "clip_ratio/high_max": 0.002601411077193916, - "clip_ratio/high_mean": 0.002601411077193916, - "clip_ratio/low_mean": 0.005088170932140201, - "clip_ratio/low_min": 0.005088170932140201, - "clip_ratio/region_mean": 0.007689581951126456, - "completions/clipped_ratio": 0.09375, - "completions/max_length": 101.0, - "completions/mean_length": 18.25, - "completions/min_length": 4.0, - "epoch": 1.0554016620498614, - "grad_norm": 2.0648308983451917, - "kl": 1.713204285595566, - "learning_rate": 9.908141857552737e-05, - "loss": 0.015094820410013199, - "memory(GiB)": 80.03, - "reward": 0.8046875, - "reward_std": 0.47176384925842285, - "rewards/Response_no_think_reward/mean": 0.8046875, - "rewards/Response_no_think_reward/std": 1.1708977222442627, + "train_speed(iter/s)": 0.002625 + }, + { + "clip_ratio/high_max": 0.0027173913549631834, + "clip_ratio/high_mean": 0.0027173913549631834, + "clip_ratio/low_mean": 0.005094834603369236, + "clip_ratio/low_min": 0.005094834603369236, + "clip_ratio/region_mean": 0.007812225958332419, + "completions/clipped_ratio": 0.0859375, + "completions/max_length": 10.0, + "completions/mean_length": 4.9375, + "completions/min_length": 3.0, + "epoch": 1.155223880597015, + "grad_norm": 10.776677331970285, + "kl": 9.849615207003808, + "learning_rate": 8.504866401019737e-05, + "loss": 0.1374131143093109, + "memory(GiB)": 79.48, + "reward": 0.3203125, + "reward_std": 0.14966703951358795, + "rewards/Response_no_think_reward_1/mean": 0.3203125, + "rewards/Response_no_think_reward_1/std": 0.6266219019889832, "step": 95, - "train_speed(iter/s)": 0.002221 - }, - { - "clip_ratio/high_max": 0.01881888063508086, - "clip_ratio/high_mean": 0.01881888063508086, - "clip_ratio/low_mean": 0.026617751631420106, - "clip_ratio/low_min": 0.026617751631420106, - "clip_ratio/region_mean": 0.0454366315389052, - "epoch": 1.0664819944598338, - "grad_norm": 1.5544793796965792, - "kl": 1.6157679219031706, - "learning_rate": 9.724456576318381e-05, - "loss": 0.012739625759422779, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002622 + }, + { + "clip_ratio/high_max": 0.019021738320589066, + "clip_ratio/high_mean": 0.019021738320589066, + "clip_ratio/low_mean": 0.005626177066005766, + "clip_ratio/low_min": 0.005626177066005766, + "clip_ratio/region_mean": 0.024647915386594832, + "epoch": 1.1671641791044776, + "grad_norm": 3.0583039624376402, + "kl": 4.468168576029711, + "learning_rate": 8.307326680684461e-05, + "loss": 0.07699939608573914, + "memory(GiB)": 79.48, "step": 96, - "train_speed(iter/s)": 0.002234 + "train_speed(iter/s)": 0.002636 }, { - "clip_ratio/high_max": 0.0020559211261570454, - "clip_ratio/high_mean": 0.0020559211261570454, - "clip_ratio/low_mean": 0.0043267360888421535, - "clip_ratio/low_min": 0.0043267360888421535, - "clip_ratio/region_mean": 0.006382657098583877, - "completions/clipped_ratio": 0.015625, - "completions/max_length": 41.0, - "completions/mean_length": 11.046875, - "completions/min_length": 3.0, - "epoch": 1.077562326869806, - "grad_norm": 2.5531547462941115, - "kl": 1.4817758100107312, - "learning_rate": 9.540864295600283e-05, - "loss": 0.016522858291864395, - "memory(GiB)": 80.03, - "reward": 0.9453125, - "reward_std": 0.4848037362098694, - "rewards/Response_no_think_reward/mean": 0.9453125, - "rewards/Response_no_think_reward/std": 1.1454023122787476, + "clip_ratio/high_max": 0.007378174108453095, + "clip_ratio/high_mean": 0.007378174108453095, + "clip_ratio/low_mean": 0.00924376118928194, + "clip_ratio/low_min": 0.00924376118928194, + "clip_ratio/region_mean": 0.016621935297735035, + "completions/clipped_ratio": 0.0546875, + "completions/max_length": 12.0, + "completions/mean_length": 4.9453125, + "completions/min_length": 3.0, + "epoch": 1.1791044776119404, + "grad_norm": 9.444776640622303, + "kl": 3.863095655280631, + "learning_rate": 8.110464694075383e-05, + "loss": 0.02421477437019348, + "memory(GiB)": 79.48, + "reward": 0.4375, + "reward_std": 0.25460314750671387, + "rewards/Response_no_think_reward_1/mean": 0.4375, + "rewards/Response_no_think_reward_1/std": 0.7290377616882324, "step": 97, - "train_speed(iter/s)": 0.00222 - }, - { - "clip_ratio/high_max": 0.01358306163456291, - "clip_ratio/high_mean": 0.01358306163456291, - "clip_ratio/low_mean": 0.019928007503040135, - "clip_ratio/low_min": 0.019928007503040135, - "clip_ratio/region_mean": 0.03351106960326433, - "epoch": 1.0886426592797784, - "grad_norm": 1.0799722223140724, - "kl": 1.3886900492943823, - "learning_rate": 9.357426980865301e-05, - "loss": -0.0007159767556004226, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002626 + }, + { + "clip_ratio/high_max": 0.02187895681709051, + "clip_ratio/high_mean": 0.02187895681709051, + "clip_ratio/low_mean": 0.005211503244936466, + "clip_ratio/low_min": 0.005211503244936466, + "clip_ratio/region_mean": 0.027090460062026978, + "epoch": 1.191044776119403, + "grad_norm": 4.753171281552747, + "kl": 3.498804785136599, + "learning_rate": 7.914359263258295e-05, + "loss": 0.02348589338362217, + "memory(GiB)": 79.48, "step": 98, - "train_speed(iter/s)": 0.002234 + "train_speed(iter/s)": 0.00264 }, { - "clip_ratio/high_max": 0.001544758939417079, - "clip_ratio/high_mean": 0.001544758939417079, - "clip_ratio/low_mean": 0.0037943847200949676, - "clip_ratio/low_min": 0.0037943847200949676, - "clip_ratio/region_mean": 0.005339143652236089, + "clip_ratio/high_max": 0.0014204545877873898, + "clip_ratio/high_mean": 0.0014204545877873898, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0014204545877873898, "completions/clipped_ratio": 0.0546875, - "completions/max_length": 101.0, - "completions/mean_length": 18.546875, - "completions/min_length": 3.0, - "epoch": 1.0997229916897506, - "grad_norm": 0.943375664401446, - "kl": 1.7392279328778386, - "learning_rate": 9.174206545276677e-05, - "loss": 0.014223725534975529, - "memory(GiB)": 80.03, - "reward": 1.1015625, - "reward_std": 0.39179152250289917, - "rewards/Response_no_think_reward/mean": 1.1015625, - "rewards/Response_no_think_reward/std": 1.2221051454544067, + "completions/max_length": 11.0, + "completions/mean_length": 5.5859375, + "completions/min_length": 3.0, + "epoch": 1.2029850746268655, + "grad_norm": 4.853951435141314, + "kl": 7.24955918840169, + "learning_rate": 7.719088907379706e-05, + "loss": 0.08564330637454987, + "memory(GiB)": 79.48, + "reward": 0.359375, + "reward_std": 0.1706565022468567, + "rewards/Response_no_think_reward_1/mean": 0.359375, + "rewards/Response_no_think_reward_1/std": 0.6608795523643494, "step": 99, - "train_speed(iter/s)": 0.002219 - }, - { - "clip_ratio/high_max": 0.01209607784403488, - "clip_ratio/high_mean": 0.01209607784403488, - "clip_ratio/low_mean": 0.011367922488716431, - "clip_ratio/low_min": 0.011367922488716431, - "clip_ratio/region_mean": 0.023464000318199396, - "epoch": 1.110803324099723, - "grad_norm": 0.8253425068817393, - "kl": 1.7898913251701742, - "learning_rate": 8.991264828797319e-05, - "loss": 0.006411677226424217, - "memory(GiB)": 80.03, + "train_speed(iter/s)": 0.002636 + }, + { + "clip_ratio/high_max": 0.01420454541221261, + "clip_ratio/high_mean": 0.01420454541221261, + "clip_ratio/low_mean": 0.0028409091755747795, + "clip_ratio/low_min": 0.0028409091755747795, + "clip_ratio/region_mean": 0.017045455053448677, + "epoch": 1.2149253731343284, + "grad_norm": 2.2986744180745324, + "kl": 4.886410776793127, + "learning_rate": 7.524731811228374e-05, + "loss": 0.06466365605592728, + "memory(GiB)": 79.48, "step": 100, - "train_speed(iter/s)": 0.002232 + "train_speed(iter/s)": 0.00265 }, { - "clip_ratio/high_max": 0.0038593837525695562, - "clip_ratio/high_mean": 0.0038593837525695562, - "clip_ratio/low_mean": 0.007897521747509018, - "clip_ratio/low_min": 0.007897521747509018, - "clip_ratio/region_mean": 0.011756905500078574, - "completions/clipped_ratio": 0.140625, - "completions/max_length": 51.0, - "completions/mean_length": 18.0390625, - "completions/min_length": 2.0, - "epoch": 1.1218836565096952, - "grad_norm": 2.1091313211648033, - "kl": 4.433779507409781, - "learning_rate": 8.808663577317764e-05, - "loss": 0.026584401726722717, - "memory(GiB)": 77.36, - "reward": 0.234375, - "reward_std": 0.353938490152359, - "rewards/Response_no_think_reward_1/mean": 0.234375, - "rewards/Response_no_think_reward_1/std": 0.8275223970413208, + "clip_ratio/high_max": 0.00620507646817714, + "clip_ratio/high_mean": 0.00620507646817714, + "clip_ratio/low_mean": 0.008002021699212492, + "clip_ratio/low_min": 0.008002021699212492, + "clip_ratio/region_mean": 0.014207098283804953, + "completions/clipped_ratio": 0.0859375, + "completions/max_length": 19.0, + "completions/mean_length": 6.2890625, + "completions/min_length": 3.0, + "epoch": 1.2268656716417912, + "grad_norm": 35.84498974880178, + "kl": 13.474940237792907, + "learning_rate": 7.331365793930698e-05, + "loss": 0.23400571942329407, + "memory(GiB)": 79.48, + "reward": 0.3671875, + "reward_std": 0.1965562105178833, + "rewards/Response_no_think_reward_1/mean": 0.3671875, + "rewards/Response_no_think_reward_1/std": 0.7410472631454468, "step": 101, - "train_speed(iter/s)": 0.112917 - }, - { - "clip_ratio/high_max": 0.0257808348396793, - "clip_ratio/high_mean": 0.0257808348396793, - "clip_ratio/low_mean": 0.013182859780499712, - "clip_ratio/low_min": 0.013182859780499712, - "clip_ratio/region_mean": 0.038963694794801995, - "epoch": 1.1329639889196677, - "grad_norm": 0.8069647208167382, - "kl": 2.7774715912528336, - "learning_rate": 8.626464421815919e-05, - "loss": 0.008937789127230644, - "memory(GiB)": 77.36, + "train_speed(iter/s)": 0.002642 + }, + { + "clip_ratio/high_max": 0.011945601785555482, + "clip_ratio/high_mean": 0.011945601785555482, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.011945601785555482, + "epoch": 1.2388059701492538, + "grad_norm": 27.884607230951485, + "kl": 1.4154490869450456, + "learning_rate": 7.139068277792523e-05, + "loss": 0.2148125171661377, + "memory(GiB)": 79.48, "step": 102, - "train_speed(iter/s)": 0.09385 + "train_speed(iter/s)": 0.002655 }, { - "clip_ratio/high_max": 0.00028669723542407155, - "clip_ratio/high_mean": 0.00028669723542407155, - "clip_ratio/low_mean": 0.0008802816737443209, - "clip_ratio/low_min": 0.0008802816737443209, - "clip_ratio/region_mean": 0.0011669789091683924, - "completions/clipped_ratio": 0.109375, - "completions/max_length": 51.0, - "completions/mean_length": 18.140625, - "completions/min_length": 3.0, - "epoch": 1.1440443213296398, - "grad_norm": 3.4014714828505634, - "kl": 1.8993340344168246, - "learning_rate": 8.444728857555572e-05, - "loss": 0.029605647549033165, - "memory(GiB)": 77.47, - "reward": 0.390625, - "reward_std": 0.1173202246427536, - "rewards/Response_no_think_reward_1/mean": 0.390625, - "rewards/Response_no_think_reward_1/std": 0.8440096974372864, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.007009345572441816, + "clip_ratio/low_min": 0.007009345572441816, + "clip_ratio/region_mean": 0.007009345572441816, + "completions/clipped_ratio": 0.0546875, + "completions/max_length": 40.0, + "completions/mean_length": 5.640625, + "completions/min_length": 3.0, + "epoch": 1.2507462686567163, + "grad_norm": 2.3687718583378876, + "kl": 1.394652240909636, + "learning_rate": 6.94791625729983e-05, + "loss": 0.018386229872703552, + "memory(GiB)": 79.48, + "reward": 0.6328125, + "reward_std": 0.20033246278762817, + "rewards/Response_no_think_reward_1/mean": 0.6328125, + "rewards/Response_no_think_reward_1/std": 0.6258360743522644, "step": 103, - "train_speed(iter/s)": 0.053798 - }, - { - "clip_ratio/high_max": 0.0013847328373230994, - "clip_ratio/high_mean": 0.0013847328373230994, - "clip_ratio/low_mean": 0.004156515002250671, - "clip_ratio/low_min": 0.004156515002250671, - "clip_ratio/region_mean": 0.00554124778136611, - "epoch": 1.1551246537396123, - "grad_norm": 0.6574286317590833, - "kl": 0.8905834904871881, - "learning_rate": 8.263518223330697e-05, - "loss": 0.007299074437469244, - "memory(GiB)": 77.47, + "train_speed(iter/s)": 0.002645 + }, + { + "clip_ratio/high_max": 0.031393789453431964, + "clip_ratio/high_mean": 0.031393789453431964, + "clip_ratio/low_mean": 0.01482532313093543, + "clip_ratio/low_min": 0.01482532313093543, + "clip_ratio/region_mean": 0.04621911211870611, + "epoch": 1.2626865671641792, + "grad_norm": 1.3586707954485446, + "kl": 1.0225394079461694, + "learning_rate": 6.757986268290712e-05, + "loss": 0.011677918955683708, + "memory(GiB)": 79.48, "step": 104, - "train_speed(iter/s)": 0.049358 + "train_speed(iter/s)": 0.002658 }, { - "clip_ratio/high_max": 0.00036549707874655724, - "clip_ratio/high_mean": 0.00036549707874655724, - "clip_ratio/low_mean": 0.003542276710504666, - "clip_ratio/low_min": 0.003542276710504666, - "clip_ratio/region_mean": 0.003907773789251223, - "completions/clipped_ratio": 0.0546875, - "completions/max_length": 51.0, - "completions/mean_length": 12.1015625, - "completions/min_length": 2.0, - "epoch": 1.1662049861495845, - "grad_norm": 1.418255621232663, - "kl": 1.0295969531871378, - "learning_rate": 8.082893680762619e-05, - "loss": 0.008070322684943676, - "memory(GiB)": 77.47, - "reward": 0.5625, - "reward_std": 0.283821702003479, - "rewards/Response_no_think_reward_1/mean": 0.5625, - "rewards/Response_no_think_reward_1/std": 0.6728714108467102, + "clip_ratio/high_max": 0.00795477326028049, + "clip_ratio/high_mean": 0.00795477326028049, + "clip_ratio/low_mean": 0.007858287775889039, + "clip_ratio/low_min": 0.007858287775889039, + "clip_ratio/region_mean": 0.015813061269000173, + "completions/clipped_ratio": 0.0625, + "completions/max_length": 32.0, + "completions/mean_length": 5.828125, + "completions/min_length": 3.0, + "epoch": 1.2746268656716417, + "grad_norm": 16.43559312212207, + "kl": 1.8490474935271664, + "learning_rate": 6.569354357311014e-05, + "loss": 0.03543264418840408, + "memory(GiB)": 79.48, + "reward": 0.3671875, + "reward_std": 0.31494253873825073, + "rewards/Response_no_think_reward_1/mean": 0.3671875, + "rewards/Response_no_think_reward_1/std": 0.7923958897590637, "step": 105, - "train_speed(iter/s)": 0.035507 - }, - { - "clip_ratio/high_max": 0.015719514689408243, - "clip_ratio/high_mean": 0.015719514689408243, - "clip_ratio/low_mean": 0.010580109432339668, - "clip_ratio/low_min": 0.010580109432339668, - "clip_ratio/region_mean": 0.02629962412174791, - "epoch": 1.1772853185595569, - "grad_norm": 0.9124403050854863, - "kl": 0.933376073371619, - "learning_rate": 7.902916193656898e-05, - "loss": -0.002763347467407584, - "memory(GiB)": 79.43, + "train_speed(iter/s)": 0.002652 + }, + { + "clip_ratio/high_max": 0.011914517963305116, + "clip_ratio/high_mean": 0.011914517963305116, + "clip_ratio/low_mean": 0.03227056178729981, + "clip_ratio/low_min": 0.03227056178729981, + "clip_ratio/region_mean": 0.04418508114758879, + "epoch": 1.2865671641791045, + "grad_norm": 2.5408508655554636, + "kl": 1.8903868702007571, + "learning_rate": 6.382096051165847e-05, + "loss": 0.014127654023468494, + "memory(GiB)": 79.48, "step": 106, - "train_speed(iter/s)": 0.033633 + "train_speed(iter/s)": 0.002665 }, { - "clip_ratio/high_max": 0.0023960003745742142, - "clip_ratio/high_mean": 0.0023960003745742142, - "clip_ratio/low_mean": 0.002585217938758433, - "clip_ratio/low_min": 0.002585217938758433, - "clip_ratio/region_mean": 0.004981218371540308, - "completions/clipped_ratio": 0.0625, - "completions/max_length": 51.0, - "completions/mean_length": 13.6328125, - "completions/min_length": 2.0, - "epoch": 1.188365650969529, - "grad_norm": 2.0082146476980807, - "kl": 1.3074679019264295, - "learning_rate": 7.72364650742707e-05, - "loss": 0.011914699338376522, - "memory(GiB)": 79.43, - "reward": 0.328125, - "reward_std": 0.18394747376441956, - "rewards/Response_no_think_reward_1/mean": 0.328125, - "rewards/Response_no_think_reward_1/std": 0.7110973596572876, + "clip_ratio/high_max": 0.0030637255404144526, + "clip_ratio/high_mean": 0.0030637255404144526, + "clip_ratio/low_mean": 0.015822806861251593, + "clip_ratio/low_min": 0.015822806861251593, + "clip_ratio/region_mean": 0.018886532401666045, + "completions/clipped_ratio": 0.109375, + "completions/max_length": 47.0, + "completions/mean_length": 6.7109375, + "completions/min_length": 3.0, + "epoch": 1.2985074626865671, + "grad_norm": 5.1535076282650945, + "kl": 2.8769574181642383, + "learning_rate": 6.19628632667923e-05, + "loss": 0.038440439850091934, + "memory(GiB)": 79.48, + "reward": -0.0625, + "reward_std": 0.4184814691543579, + "rewards/Response_no_think_reward_1/mean": -0.0625, + "rewards/Response_no_think_reward_1/std": 0.8394786715507507, "step": 107, - "train_speed(iter/s)": 0.027655 - }, - { - "clip_ratio/high_max": 0.00717889575753361, - "clip_ratio/high_mean": 0.00717889575753361, - "clip_ratio/low_mean": 0.008150914101861417, - "clip_ratio/low_min": 0.008150914101861417, - "clip_ratio/region_mean": 0.015329810208640993, - "epoch": 1.1994459833795015, - "grad_norm": 0.5916941576021421, - "kl": 1.0833495813399168, - "learning_rate": 7.54514512859201e-05, - "loss": 0.0037035662680864334, - "memory(GiB)": 79.43, + "train_speed(iter/s)": 0.002655 + }, + { + "clip_ratio/high_max": 0.011060049437219277, + "clip_ratio/high_mean": 0.011060049437219277, + "clip_ratio/low_mean": 0.05394765589153394, + "clip_ratio/low_min": 0.05394765589153394, + "clip_ratio/region_mean": 0.06500770541606471, + "epoch": 1.31044776119403, + "grad_norm": 38.3461665329109, + "kl": 2.019717270624824, + "learning_rate": 6.011999580673931e-05, + "loss": 0.16980835795402527, + "memory(GiB)": 79.48, "step": 108, - "train_speed(iter/s)": 0.026591 + "train_speed(iter/s)": 0.002668 }, { - "clip_ratio/high_max": 0.004251995822414756, - "clip_ratio/high_mean": 0.004251995822414756, - "clip_ratio/low_mean": 0.008190131688024849, - "clip_ratio/low_min": 0.008190131688024849, - "clip_ratio/region_mean": 0.012442127510439605, - "completions/clipped_ratio": 0.09375, - "completions/max_length": 51.0, - "completions/mean_length": 12.234375, - "completions/min_length": 4.0, - "epoch": 1.2105263157894737, - "grad_norm": 2.6396182071410137, - "kl": 2.141993957106024, - "learning_rate": 7.36747230435401e-05, - "loss": 0.011151588521897793, - "memory(GiB)": 79.43, - "reward": -0.2265625, - "reward_std": 0.3407740592956543, - "rewards/Response_no_think_reward_1/mean": -0.2265625, - "rewards/Response_no_think_reward_1/std": 0.6425201892852783, + "clip_ratio/high_max": 0.0016025641234591603, + "clip_ratio/high_mean": 0.0016025641234591603, + "clip_ratio/low_mean": 0.0032051282469183207, + "clip_ratio/low_min": 0.0032051282469183207, + "clip_ratio/region_mean": 0.004807692486792803, + "completions/clipped_ratio": 0.0078125, + "completions/max_length": 25.0, + "completions/mean_length": 5.703125, + "completions/min_length": 3.0, + "epoch": 1.3223880597014925, + "grad_norm": 1.9241770555383604, + "kl": 0.4095292093356875, + "learning_rate": 5.829309600183536e-05, + "loss": 0.003778851358219981, + "memory(GiB)": 79.48, + "reward": 0.453125, + "reward_std": 0.24464011192321777, + "rewards/Response_no_think_reward_1/mean": 0.453125, + "rewards/Response_no_think_reward_1/std": 0.8405039310455322, "step": 109, - "train_speed(iter/s)": 0.022574 - }, - { - "clip_ratio/high_max": 0.004035328107420355, - "clip_ratio/high_mean": 0.004035328107420355, - "clip_ratio/low_mean": 0.08847818686626852, - "clip_ratio/low_min": 0.08847818686626852, - "clip_ratio/region_mean": 0.0925135153811425, - "epoch": 1.221606648199446, - "grad_norm": 1.4171762109533736, - "kl": 3.1860878374427557, - "learning_rate": 7.190688002264308e-05, - "loss": 0.0037668771110475063, - "memory(GiB)": 79.43, + "train_speed(iter/s)": 0.00266 + }, + { + "clip_ratio/high_max": 0.016826923470944166, + "clip_ratio/high_mean": 0.016826923470944166, + "clip_ratio/low_mean": 0.025240384973585606, + "clip_ratio/low_min": 0.025240384973585606, + "clip_ratio/region_mean": 0.042067307978868484, + "epoch": 1.3343283582089551, + "grad_norm": 4.00720293405374, + "kl": 0.3944609015534297, + "learning_rate": 5.648289532908666e-05, + "loss": 0.0013700753916054964, + "memory(GiB)": 79.48, "step": 110, - "train_speed(iter/s)": 0.021907 + "train_speed(iter/s)": 0.002673 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.002568919211626053, - "clip_ratio/low_min": 0.002568919211626053, - "clip_ratio/region_mean": 0.002568919211626053, - "completions/clipped_ratio": 0.046875, - "completions/max_length": 48.0, - "completions/mean_length": 11.7734375, - "completions/min_length": 5.0, - "epoch": 1.2326869806094183, - "grad_norm": 1.02177770841713, - "kl": 1.6274185269139707, - "learning_rate": 7.014851889983057e-05, - "loss": 0.010478168725967407, - "memory(GiB)": 79.43, - "reward": 0.453125, - "reward_std": 0.3291260004043579, - "rewards/Response_no_think_reward_1/mean": 0.453125, - "rewards/Response_no_think_reward_1/std": 0.685730516910553, + "clip_ratio/low_mean": 0.012351020704954863, + "clip_ratio/low_min": 0.012351020704954863, + "clip_ratio/region_mean": 0.012351020704954863, + "completions/clipped_ratio": 0.2265625, + "completions/max_length": 23.0, + "completions/mean_length": 6.03125, + "completions/min_length": 3.0, + "epoch": 1.346268656716418, + "grad_norm": 5.342919033145562, + "kl": 6.366508552979212, + "learning_rate": 5.4690118579292015e-05, + "loss": 0.08252155035734177, + "memory(GiB)": 79.48, + "reward": -0.0703125, + "reward_std": 0.5281283259391785, + "rewards/Response_no_think_reward_1/mean": -0.0703125, + "rewards/Response_no_think_reward_1/std": 0.7954951524734497, "step": 111, - "train_speed(iter/s)": 0.019127 - }, - { - "clip_ratio/high_max": 0.013096909533487633, - "clip_ratio/high_mean": 0.013096909533487633, - "clip_ratio/low_mean": 0.016107605304569006, - "clip_ratio/low_min": 0.016107605304569006, - "clip_ratio/region_mean": 0.029204514692537487, - "epoch": 1.2437673130193905, - "grad_norm": 0.79999454502468, - "kl": 1.5544351362623274, - "learning_rate": 6.840023315140475e-05, - "loss": 0.0022247314918786287, - "memory(GiB)": 79.43, + "train_speed(iter/s)": 0.002667 + }, + { + "clip_ratio/high_max": 0.0056201552506536245, + "clip_ratio/high_mean": 0.0056201552506536245, + "clip_ratio/low_mean": 0.07672008802182972, + "clip_ratio/low_min": 0.07672008802182972, + "clip_ratio/region_mean": 0.08234024350531399, + "epoch": 1.3582089552238805, + "grad_norm": 4.841852348859136, + "kl": 7.482738017570227, + "learning_rate": 5.291548356684177e-05, + "loss": 0.06593235582113266, + "memory(GiB)": 79.48, "step": 112, - "train_speed(iter/s)": 0.018681 + "train_speed(iter/s)": 0.00268 }, { - "clip_ratio/high_max": 0.0008340688509633765, - "clip_ratio/high_mean": 0.0008340688509633765, - "clip_ratio/low_mean": 0.007082634954713285, - "clip_ratio/low_min": 0.007082634954713285, - "clip_ratio/region_mean": 0.007916703820228577, - "completions/clipped_ratio": 0.1171875, - "completions/max_length": 51.0, - "completions/mean_length": 13.53125, - "completions/min_length": 3.0, - "epoch": 1.254847645429363, - "grad_norm": 1.6246389101003882, - "kl": 1.6449745513964444, - "learning_rate": 6.666261285306047e-05, - "loss": 0.014917208813130856, - "memory(GiB)": 79.43, - "reward": 0.1953125, - "reward_std": 0.2754020392894745, - "rewards/Response_no_think_reward_1/mean": 0.1953125, - "rewards/Response_no_think_reward_1/std": 0.869958758354187, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.00446532026398927, + "clip_ratio/low_min": 0.00446532026398927, + "clip_ratio/region_mean": 0.00446532026398927, + "completions/clipped_ratio": 0.046875, + "completions/max_length": 10.0, + "completions/mean_length": 5.328125, + "completions/min_length": 3.0, + "epoch": 1.3701492537313433, + "grad_norm": 2.4231207405852158, + "kl": 2.7402262951763987, + "learning_rate": 5.115970084231059e-05, + "loss": 0.021689381450414658, + "memory(GiB)": 79.48, + "reward": 0.4453125, + "reward_std": 0.33350807428359985, + "rewards/Response_no_think_reward_1/mean": 0.4453125, + "rewards/Response_no_think_reward_1/std": 0.7817665934562683, "step": 113, - "train_speed(iter/s)": 0.016592 - }, - { - "clip_ratio/high_max": 0.006006928611896001, - "clip_ratio/high_mean": 0.006006928611896001, - "clip_ratio/low_mean": 0.039706501411274076, - "clip_ratio/low_min": 0.039706501411274076, - "clip_ratio/region_mean": 0.045713430270552635, - "epoch": 1.2659279778393353, - "grad_norm": 0.940807595373605, - "kl": 1.8106578167062253, - "learning_rate": 6.493624448072457e-05, - "loss": 0.006363555323332548, - "memory(GiB)": 79.43, + "train_speed(iter/s)": 0.002673 + }, + { + "clip_ratio/high_max": 0.02434239676222205, + "clip_ratio/high_mean": 0.02434239676222205, + "clip_ratio/low_mean": 0.0223974745022133, + "clip_ratio/low_min": 0.0223974745022133, + "clip_ratio/region_mean": 0.046739870798774064, + "epoch": 1.382089552238806, + "grad_norm": 1.0551090300064008, + "kl": 2.37436256357978, + "learning_rate": 4.9423473407958035e-05, + "loss": 0.008349667303264141, + "memory(GiB)": 79.48, "step": 114, - "train_speed(iter/s)": 0.016278 + "train_speed(iter/s)": 0.002685 }, { - "clip_ratio/high_max": 0.0052188277477398515, - "clip_ratio/high_mean": 0.0052188277477398515, - "clip_ratio/low_mean": 0.004236701555782929, - "clip_ratio/low_min": 0.004236701555782929, - "clip_ratio/region_mean": 0.009455529390834272, - "completions/clipped_ratio": 0.1796875, - "completions/max_length": 51.0, - "completions/mean_length": 14.3671875, - "completions/min_length": 2.0, - "epoch": 1.2770083102493075, - "grad_norm": 2.8040352101197437, - "kl": 5.506896490347572, - "learning_rate": 6.322171071261071e-05, - "loss": 0.03229736536741257, - "memory(GiB)": 79.43, - "reward": 0.296875, - "reward_std": 0.43980443477630615, - "rewards/Response_no_think_reward_1/mean": 0.296875, - "rewards/Response_no_think_reward_1/std": 0.8905397057533264, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.011147994082421064, + "clip_ratio/low_min": 0.011147994082421064, + "clip_ratio/region_mean": 0.011147994082421064, + "completions/clipped_ratio": 0.15625, + "completions/max_length": 11.0, + "completions/mean_length": 5.3515625, + "completions/min_length": 3.0, + "epoch": 1.3940298507462687, + "grad_norm": 35.484376517766954, + "kl": 24.603704601235222, + "learning_rate": 4.7707496436252e-05, + "loss": 0.3364083468914032, + "memory(GiB)": 79.48, + "reward": 0.1328125, + "reward_std": 0.28117600083351135, + "rewards/Response_no_think_reward_1/mean": 0.1328125, + "rewards/Response_no_think_reward_1/std": 0.8264437913894653, "step": 115, - "train_speed(iter/s)": 0.014636 - }, - { - "clip_ratio/high_max": 0.01615347486222163, - "clip_ratio/high_mean": 0.01615347486222163, - "clip_ratio/low_mean": 0.015428576618432999, - "clip_ratio/low_min": 0.015428576618432999, - "clip_ratio/region_mean": 0.031582050723955035, - "epoch": 1.2880886426592797, - "grad_norm": 1.8650893219420759, - "kl": 4.258469146443531, - "learning_rate": 6.151959023255545e-05, - "loss": 0.020270783454179764, - "memory(GiB)": 79.43, + "train_speed(iter/s)": 0.002678 + }, + { + "clip_ratio/high_max": 0.002314814832061529, + "clip_ratio/high_mean": 0.002314814832061529, + "clip_ratio/low_mean": 0.0054197743302211165, + "clip_ratio/low_min": 0.0054197743302211165, + "clip_ratio/region_mean": 0.007734589162282646, + "epoch": 1.4059701492537313, + "grad_norm": 7.954623939964381, + "kl": 12.087648045126116, + "learning_rate": 4.601245699152659e-05, + "loss": 0.2005119025707245, + "memory(GiB)": 79.48, "step": 116, - "train_speed(iter/s)": 0.014407 + "train_speed(iter/s)": 0.00269 }, { - "clip_ratio/high_max": 0.005145640461705625, - "clip_ratio/high_mean": 0.005145640461705625, - "clip_ratio/low_mean": 0.008849590638419613, - "clip_ratio/low_min": 0.008849590638419613, - "clip_ratio/region_mean": 0.013995230983709916, - "completions/clipped_ratio": 0.1640625, - "completions/max_length": 51.0, - "completions/mean_length": 16.3125, - "completions/min_length": 2.0, - "epoch": 1.299168975069252, - "grad_norm": 2.4581301952944186, - "kl": 3.745300827547908, - "learning_rate": 5.983045753470308e-05, - "loss": 0.024165078997612, - "memory(GiB)": 79.43, - "reward": 0.453125, - "reward_std": 0.5826787948608398, - "rewards/Response_no_think_reward_1/mean": 0.453125, - "rewards/Response_no_think_reward_1/std": 0.8405039310455322, + "clip_ratio/high_max": 0.0005434782360680401, + "clip_ratio/high_mean": 0.0005434782360680401, + "clip_ratio/low_mean": 0.004596828715875745, + "clip_ratio/low_min": 0.004596828715875745, + "clip_ratio/region_mean": 0.005140306951943785, + "completions/clipped_ratio": 0.0703125, + "completions/max_length": 40.0, + "completions/mean_length": 5.8671875, + "completions/min_length": 3.0, + "epoch": 1.417910447761194, + "grad_norm": 3.80570877135741, + "kl": 3.121465804113541, + "learning_rate": 4.433903375488697e-05, + "loss": 0.044249728322029114, + "memory(GiB)": 79.48, + "reward": 0.3046875, + "reward_std": 0.38101160526275635, + "rewards/Response_no_think_reward_1/mean": 0.3046875, + "rewards/Response_no_think_reward_1/std": 0.8562746047973633, "step": 117, - "train_speed(iter/s)": 0.013208 - }, - { - "clip_ratio/high_max": 0.04523819196037948, - "clip_ratio/high_mean": 0.04523819196037948, - "clip_ratio/low_mean": 0.01510127488290891, - "clip_ratio/low_min": 0.01510127488290891, - "clip_ratio/region_mean": 0.060339466377627105, - "epoch": 1.3102493074792243, - "grad_norm": 2.131099568305027, - "kl": 2.847630614414811, - "learning_rate": 5.8154882729603876e-05, - "loss": 0.01335166022181511, - "memory(GiB)": 79.43, + "train_speed(iter/s)": 0.002684 + }, + { + "clip_ratio/high_max": 0.014024957199580967, + "clip_ratio/high_mean": 0.014024957199580967, + "clip_ratio/low_mean": 0.0131244600052014, + "clip_ratio/low_min": 0.0131244600052014, + "clip_ratio/region_mean": 0.02714941732119769, + "epoch": 1.4298507462686567, + "grad_norm": 3.857626589553114, + "kl": 2.146273965074215, + "learning_rate": 4.268789675247029e-05, + "loss": 0.03236865624785423, + "memory(GiB)": 79.48, "step": 118, - "train_speed(iter/s)": 0.013037 + "train_speed(iter/s)": 0.002695 }, { - "clip_ratio/high_max": 0.002125054510543123, - "clip_ratio/high_mean": 0.002125054510543123, - "clip_ratio/low_mean": 0.0127813016588334, - "clip_ratio/low_min": 0.0127813016588334, - "clip_ratio/region_mean": 0.0149063560529612, - "completions/clipped_ratio": 0.203125, - "completions/max_length": 51.0, - "completions/mean_length": 19.59375, - "completions/min_length": 3.0, - "epoch": 1.3213296398891967, - "grad_norm": 2.690385409772627, - "kl": 2.0104650848079473, - "learning_rate": 5.64934313517927e-05, - "loss": 0.01620793715119362, - "memory(GiB)": 79.43, - "reward": 0.2578125, - "reward_std": 0.41504764556884766, - "rewards/Response_no_think_reward_1/mean": 0.2578125, - "rewards/Response_no_think_reward_1/std": 0.8625734448432922, + "clip_ratio/high_max": 0.0012886597542092204, + "clip_ratio/high_mean": 0.0012886597542092204, + "clip_ratio/low_mean": 0.0051683366764336824, + "clip_ratio/low_min": 0.0051683366764336824, + "clip_ratio/region_mean": 0.006456996430642903, + "completions/clipped_ratio": 0.0703125, + "completions/max_length": 22.0, + "completions/mean_length": 5.6171875, + "completions/min_length": 3.0, + "epoch": 1.4417910447761195, + "grad_norm": 3.2126971808505513, + "kl": 1.1720350683217475, + "learning_rate": 4.105970708717244e-05, + "loss": 0.018675971776247025, + "memory(GiB)": 79.48, + "reward": 0.5625, + "reward_std": 0.22125522792339325, + "rewards/Response_no_think_reward_1/mean": 0.5625, + "rewards/Response_no_think_reward_1/std": 0.6490453481674194, "step": 119, - "train_speed(iter/s)": 0.011541 - }, - { - "clip_ratio/high_max": 0.0026382115320302546, - "clip_ratio/high_mean": 0.0026382115320302546, - "clip_ratio/low_mean": 0.07074824426672421, - "clip_ratio/low_min": 0.07074824426672421, - "clip_ratio/region_mean": 0.07338645646814257, - "epoch": 1.332409972299169, - "grad_norm": 1.3611711034111147, - "kl": 2.366683575557545, - "learning_rate": 5.484666416891109e-05, - "loss": 0.00427972199395299, - "memory(GiB)": 79.43, + "train_speed(iter/s)": 0.002674 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.020605165394954383, + "clip_ratio/low_min": 0.020605165394954383, + "clip_ratio/region_mean": 0.020605165394954383, + "epoch": 1.4537313432835821, + "grad_norm": 1.102830732170957, + "kl": 1.583265769013451, + "learning_rate": 3.945511667394719e-05, + "loss": 0.003417772939428687, + "memory(GiB)": 79.48, "step": 120, - "train_speed(iter/s)": 0.011424 + "train_speed(iter/s)": 0.002685 }, { - "clip_ratio/high_max": 0.00034340660204179585, - "clip_ratio/high_mean": 0.00034340660204179585, - "clip_ratio/low_mean": 0.0057576168910600245, - "clip_ratio/low_min": 0.0057576168910600245, - "clip_ratio/region_mean": 0.00610102349310182, - "completions/clipped_ratio": 0.109375, - "completions/max_length": 51.0, - "completions/mean_length": 14.1640625, - "completions/min_length": 3.0, - "epoch": 1.3434903047091413, - "grad_norm": 1.7730415769710828, - "kl": 2.253111455589533, - "learning_rate": 5.321513699243924e-05, - "loss": 0.015828199684619904, - "memory(GiB)": 79.43, - "reward": 0.2578125, - "reward_std": 0.2504267692565918, - "rewards/Response_no_think_reward_1/mean": 0.2578125, - "rewards/Response_no_think_reward_1/std": 0.8533961176872253, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.007155258092097938, + "clip_ratio/low_min": 0.007155258092097938, + "clip_ratio/region_mean": 0.007155258092097938, + "completions/clipped_ratio": 0.046875, + "completions/max_length": 23.0, + "completions/mean_length": 5.6640625, + "completions/min_length": 3.0, + "epoch": 1.4656716417910447, + "grad_norm": 2.9093250272424034, + "kl": 1.8708921101060696, + "learning_rate": 3.787476797878459e-05, + "loss": 0.01941162720322609, + "memory(GiB)": 79.48, + "reward": 0.59375, + "reward_std": 0.3198433816432953, + "rewards/Response_no_think_reward_1/mean": 0.59375, + "rewards/Response_no_think_reward_1/std": 0.692337155342102, "step": 121, - "train_speed(iter/s)": 0.010746 - }, - { - "clip_ratio/high_max": 0.002522797236451879, - "clip_ratio/high_mean": 0.002522797236451879, - "clip_ratio/low_mean": 0.03892370511312038, - "clip_ratio/low_min": 0.03892370511312038, - "clip_ratio/region_mean": 0.041446502320468426, - "epoch": 1.3545706371191135, - "grad_norm": 0.9270755733265906, - "kl": 2.852388353087008, - "learning_rate": 5.159940049010015e-05, - "loss": 0.00514911487698555, - "memory(GiB)": 79.43, + "train_speed(iter/s)": 0.002659 + }, + { + "clip_ratio/high_max": 0.02566964237485081, + "clip_ratio/high_mean": 0.02566964237485081, + "clip_ratio/low_mean": 0.01106150820851326, + "clip_ratio/low_min": 0.01106150820851326, + "clip_ratio/region_mean": 0.03673115174751729, + "epoch": 1.4776119402985075, + "grad_norm": 1.6206572311785468, + "kl": 2.092067622463219, + "learning_rate": 3.631929376147207e-05, + "loss": 0.00795831624418497, + "memory(GiB)": 79.48, "step": 122, - "train_speed(iter/s)": 0.010652 + "train_speed(iter/s)": 0.00267 }, { - "clip_ratio/high_max": 0.0008753835718380287, - "clip_ratio/high_mean": 0.0008753835718380287, - "clip_ratio/low_mean": 0.0012499999720603228, - "clip_ratio/low_min": 0.0012499999720603228, - "clip_ratio/region_mean": 0.0021253835438983515, - "completions/clipped_ratio": 0.1171875, - "completions/max_length": 51.0, - "completions/mean_length": 15.8515625, - "completions/min_length": 4.0, - "epoch": 1.365650969529086, - "grad_norm": 24.163527329310554, - "kl": 24.496757203305606, - "learning_rate": 5.000000000000002e-05, - "loss": 0.23566541075706482, - "memory(GiB)": 79.43, - "reward": 0.3984375, - "reward_std": 0.3253360986709595, - "rewards/Response_no_think_reward_1/mean": 0.3984375, - "rewards/Response_no_think_reward_1/std": 0.6912255883216858, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0078125, + "completions/max_length": 16.0, + "completions/mean_length": 5.140625, + "completions/min_length": 3.0, + "epoch": 1.48955223880597, + "grad_norm": 1.1898236332850007, + "kl": 0.5545606576924911, + "learning_rate": 3.47893168222425e-05, + "loss": 0.005211046896874905, + "memory(GiB)": 79.48, + "reward": 0.5078125, + "reward_std": 0.2012200653553009, + "rewards/Response_no_think_reward_1/mean": 0.5078125, + "rewards/Response_no_think_reward_1/std": 0.763292670249939, "step": 123, - "train_speed(iter/s)": 0.010181 - }, - { - "clip_ratio/high_max": 0.0009191176941385493, - "clip_ratio/high_mean": 0.0009191176941385493, - "clip_ratio/low_mean": 0.025084137567318976, - "clip_ratio/low_min": 0.025084137567318976, - "clip_ratio/region_mean": 0.026003255392424762, - "epoch": 1.3767313019390581, - "grad_norm": 4.61798364138243, - "kl": 5.482510100933723, - "learning_rate": 4.841747534656763e-05, - "loss": 0.03564080968499184, - "memory(GiB)": 79.43, + "train_speed(iter/s)": 0.002638 + }, + { + "clip_ratio/high_max": 0.015350877307355404, + "clip_ratio/high_mean": 0.015350877307355404, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.015350877307355404, + "epoch": 1.5014925373134327, + "grad_norm": 0.3409132689994619, + "kl": 0.5577427046882804, + "learning_rate": 3.328544975240932e-05, + "loss": -0.0002708420215640217, + "memory(GiB)": 79.48, "step": 124, - "train_speed(iter/s)": 0.010103 + "train_speed(iter/s)": 0.002649 }, { - "clip_ratio/high_max": 0.0004921259824186563, - "clip_ratio/high_mean": 0.0004921259824186563, - "clip_ratio/low_mean": 0.0009282178361900151, - "clip_ratio/low_min": 0.0009282178361900151, - "clip_ratio/region_mean": 0.0014203438186086714, - "completions/clipped_ratio": 0.140625, - "completions/max_length": 51.0, - "completions/mean_length": 16.671875, - "completions/min_length": 3.0, - "epoch": 1.3878116343490305, - "grad_norm": 1.7230796893481761, - "kl": 1.7308420957997441, - "learning_rate": 4.685236065835443e-05, - "loss": 0.01634293608367443, - "memory(GiB)": 79.43, - "reward": 0.171875, - "reward_std": 0.13258251547813416, - "rewards/Response_no_think_reward_1/mean": 0.171875, - "rewards/Response_no_think_reward_1/std": 0.8971465826034546, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.00601851858664304, + "clip_ratio/low_min": 0.00601851858664304, + "clip_ratio/region_mean": 0.00601851858664304, + "completions/clipped_ratio": 0.0390625, + "completions/max_length": 30.0, + "completions/mean_length": 5.8671875, + "completions/min_length": 3.0, + "epoch": 1.5134328358208955, + "grad_norm": 5.906541393453947, + "kl": 6.567164011168643, + "learning_rate": 3.180829468908986e-05, + "loss": 0.07308901846408844, + "memory(GiB)": 79.48, + "reward": 0.3671875, + "reward_std": 0.1412346363067627, + "rewards/Response_no_think_reward_1/mean": 0.3671875, + "rewards/Response_no_think_reward_1/std": 0.8406137228012085, "step": 125, - "train_speed(iter/s)": 0.009672 - }, - { - "clip_ratio/high_max": 0.0003094059356953949, - "clip_ratio/high_mean": 0.0003094059356953949, - "clip_ratio/low_mean": 0.02542525064200163, - "clip_ratio/low_min": 0.02542525064200163, - "clip_ratio/region_mean": 0.025734656490385532, - "epoch": 1.3988919667590027, - "grad_norm": 0.6685767852950313, - "kl": 2.058195663616061, - "learning_rate": 4.530518418775733e-05, - "loss": 0.008037411607801914, - "memory(GiB)": 79.43, + "train_speed(iter/s)": 0.002642 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.010185185354202986, + "clip_ratio/low_min": 0.010185185354202986, + "clip_ratio/region_mean": 0.010185185354202986, + "epoch": 1.5253731343283583, + "grad_norm": 1.637348051569756, + "kl": 3.2303040275146486, + "learning_rate": 3.035844307411384e-05, + "loss": 0.04529271274805069, + "memory(GiB)": 79.48, "step": 126, - "train_speed(iter/s)": 0.009605 + "train_speed(iter/s)": 0.002652 }, { - "clip_ratio/high_max": 0.0035992932971566916, - "clip_ratio/high_mean": 0.0035992932971566916, - "clip_ratio/low_mean": 0.0026174120721407235, - "clip_ratio/low_min": 0.0026174120721407235, - "clip_ratio/region_mean": 0.006216705543920398, - "completions/clipped_ratio": 0.078125, - "completions/max_length": 51.0, - "completions/mean_length": 13.1015625, - "completions/min_length": 3.0, - "epoch": 1.4099722991689752, - "grad_norm": 0.898899557372063, - "kl": 1.8244512832025066, - "learning_rate": 4.3776468132724604e-05, - "loss": 0.013885595835745335, - "memory(GiB)": 79.43, - "reward": 0.703125, - "reward_std": 0.1841355264186859, - "rewards/Response_no_think_reward_1/mean": 0.703125, - "rewards/Response_no_think_reward_1/std": 0.552152156829834, + "clip_ratio/high_max": 0.00046296295477077365, + "clip_ratio/high_mean": 0.00046296295477077365, + "clip_ratio/low_mean": 0.004759002127684653, + "clip_ratio/low_min": 0.004759002127684653, + "clip_ratio/region_mean": 0.0052219650824554265, + "completions/clipped_ratio": 0.046875, + "completions/max_length": 29.0, + "completions/mean_length": 6.4453125, + "completions/min_length": 3.0, + "epoch": 1.537313432835821, + "grad_norm": 1.5814533572332585, + "kl": 1.9979073457579943, + "learning_rate": 2.8936475417214794e-05, + "loss": 0.022465700283646584, + "memory(GiB)": 79.48, + "reward": 0.3359375, + "reward_std": 0.17123225331306458, + "rewards/Response_no_think_reward_1/mean": 0.3359375, + "rewards/Response_no_think_reward_1/std": 0.7453514337539673, "step": 127, - "train_speed(iter/s)": 0.009212 - }, - { - "clip_ratio/high_max": 0.00787301326636225, - "clip_ratio/high_mean": 0.00787301326636225, - "clip_ratio/low_mean": 0.003833794384263456, - "clip_ratio/low_min": 0.003833794384263456, - "clip_ratio/region_mean": 0.011706807999871671, - "epoch": 1.4210526315789473, - "grad_norm": 0.6061431338619399, - "kl": 1.8278243900567759, - "learning_rate": 4.2266728460505375e-05, - "loss": 0.009479128755629063, - "memory(GiB)": 79.43, + "train_speed(iter/s)": 0.00264 + }, + { + "clip_ratio/high_max": 0.0014710274408571422, + "clip_ratio/high_mean": 0.0014710274408571422, + "clip_ratio/low_mean": 0.022759197046980262, + "clip_ratio/low_min": 0.022759197046980262, + "clip_ratio/region_mean": 0.024230224487837404, + "epoch": 1.5492537313432835, + "grad_norm": 0.9057768060895434, + "kl": 1.9242111706989817, + "learning_rate": 2.7542961063598104e-05, + "loss": 0.013444737531244755, + "memory(GiB)": 79.48, "step": 128, - "train_speed(iter/s)": 0.009157 + "train_speed(iter/s)": 0.002651 }, { - "clip_ratio/high_max": 0.0016208597226068377, - "clip_ratio/high_mean": 0.0016208597226068377, - "clip_ratio/low_mean": 0.004291799967177212, - "clip_ratio/low_min": 0.004291799967177212, - "clip_ratio/region_mean": 0.00591265968978405, - "completions/clipped_ratio": 0.2421875, - "completions/max_length": 51.0, - "completions/mean_length": 13.8359375, - "completions/min_length": 3.0, - "epoch": 1.4321329639889195, - "grad_norm": 4.256081630918958, - "kl": 8.371784689603373, - "learning_rate": 4.077647473350201e-05, - "loss": 0.07109890133142471, - "memory(GiB)": 79.43, - "reward": 0.1640625, - "reward_std": 0.12844271957874298, - "rewards/Response_no_think_reward_1/mean": 0.1640625, - "rewards/Response_no_think_reward_1/std": 0.9029901623725891, + "clip_ratio/high_max": 0.0026041667442768812, + "clip_ratio/high_mean": 0.0026041667442768812, + "clip_ratio/low_mean": 0.010856111068278551, + "clip_ratio/low_min": 0.010856111068278551, + "clip_ratio/region_mean": 0.013460277812555432, + "completions/clipped_ratio": 0.03125, + "completions/max_length": 28.0, + "completions/mean_length": 5.6875, + "completions/min_length": 3.0, + "epoch": 1.5611940298507463, + "grad_norm": 2.279027191303148, + "kl": 1.264391661035006, + "learning_rate": 2.617845796597954e-05, + "loss": 0.005756520200520754, + "memory(GiB)": 79.48, + "reward": 0.3671875, + "reward_std": 0.15756267309188843, + "rewards/Response_no_think_reward_1/mean": 0.3671875, + "rewards/Response_no_think_reward_1/std": 0.7410472631454468, "step": 129, - "train_speed(iter/s)": 0.008828 - }, - { - "clip_ratio/high_max": 0.00940803368575871, - "clip_ratio/high_mean": 0.00940803368575871, - "clip_ratio/low_mean": 0.006534474319778383, - "clip_ratio/low_min": 0.006534474319778383, - "clip_ratio/region_mean": 0.01594250788912177, - "epoch": 1.443213296398892, - "grad_norm": 2.0975168570419678, - "kl": 6.735093111405149, - "learning_rate": 3.9306209937284346e-05, - "loss": 0.05932926759123802, - "memory(GiB)": 79.43, + "train_speed(iter/s)": 0.002635 + }, + { + "clip_ratio/high_max": 0.0026041667442768812, + "clip_ratio/high_mean": 0.0026041667442768812, + "clip_ratio/low_mean": 0.06580501515418291, + "clip_ratio/low_min": 0.06580501515418291, + "clip_ratio/region_mean": 0.06840918306261301, + "epoch": 1.573134328358209, + "grad_norm": 1.198012219937442, + "kl": 1.689065290265944, + "learning_rate": 2.484351246118507e-05, + "loss": -0.000346488319337368, + "memory(GiB)": 79.48, "step": 130, - "train_speed(iter/s)": 0.008781 + "train_speed(iter/s)": 0.002646 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0059523810632526875, + "clip_ratio/low_min": 0.0059523810632526875, + "clip_ratio/region_mean": 0.0059523810632526875, + "completions/clipped_ratio": 0.0234375, + "completions/max_length": 25.0, + "completions/mean_length": 5.15625, + "completions/min_length": 3.0, + "epoch": 1.5850746268656717, + "grad_norm": 2.595184247375665, + "kl": 0.8083602132865053, + "learning_rate": 2.353865905140187e-05, + "loss": 0.009201270528137684, + "memory(GiB)": 79.48, + "reward": 0.4296875, + "reward_std": 0.13553348183631897, + "rewards/Response_no_think_reward_1/mean": 0.4296875, + "rewards/Response_no_think_reward_1/std": 0.7496308088302612, + "step": 131, + "train_speed(iter/s)": 0.002635 + }, + { + "clip_ratio/high_max": 0.0019841270986944437, + "clip_ratio/high_mean": 0.0019841270986944437, + "clip_ratio/low_mean": 0.01378506887704134, + "clip_ratio/low_min": 0.01378506887704134, + "clip_ratio/region_mean": 0.01576919574290514, + "epoch": 1.5970149253731343, + "grad_norm": 1.0694122716373746, + "kl": 0.8849439112927939, + "learning_rate": 2.226442019016739e-05, + "loss": 0.0032178200781345367, + "memory(GiB)": 79.48, + "step": 132, + "train_speed(iter/s)": 0.002646 + }, + { + "clip_ratio/high_max": 0.0014880952658131719, + "clip_ratio/high_mean": 0.0014880952658131719, + "clip_ratio/low_mean": 0.004777232185006142, + "clip_ratio/low_min": 0.004777232185006142, + "clip_ratio/region_mean": 0.0062653274508193135, + "completions/clipped_ratio": 0.0703125, + "completions/max_length": 51.0, + "completions/mean_length": 7.703125, + "completions/min_length": 3.0, + "epoch": 1.608955223880597, + "grad_norm": 8.857193213468985, + "kl": 6.557242290626164, + "learning_rate": 2.1021306073183167e-05, + "loss": 0.09046173840761185, + "memory(GiB)": 79.48, + "reward": 0.5625, + "reward_std": 0.3117782771587372, + "rewards/Response_no_think_reward_1/mean": 0.5625, + "rewards/Response_no_think_reward_1/std": 0.6728714108467102, + "step": 133, + "train_speed(iter/s)": 0.002636 + }, + { + "clip_ratio/high_max": 0.0043966451194137335, + "clip_ratio/high_mean": 0.0043966451194137335, + "clip_ratio/low_mean": 0.0072958533419296145, + "clip_ratio/low_min": 0.0072958533419296145, + "clip_ratio/region_mean": 0.01169249857775867, + "epoch": 1.6208955223880597, + "grad_norm": 5.293380513533871, + "kl": 4.1661525671806885, + "learning_rate": 1.9809814434036e-05, + "loss": 0.05591786280274391, + "memory(GiB)": 79.48, + "step": 134, + "train_speed(iter/s)": 0.002646 + }, + { + "clip_ratio/high_max": 0.0006793478387407959, + "clip_ratio/high_mean": 0.0006793478387407959, + "clip_ratio/low_mean": 0.008976120705483481, + "clip_ratio/low_min": 0.008976120705483481, + "clip_ratio/region_mean": 0.009655468544224277, + "completions/clipped_ratio": 0.0390625, + "completions/max_length": 29.0, + "completions/mean_length": 6.125, + "completions/min_length": 3.0, + "epoch": 1.6328358208955223, + "grad_norm": 2.599750460948482, + "kl": 2.9140283690503566, + "learning_rate": 1.863043034490938e-05, + "loss": 0.026728810742497444, + "memory(GiB)": 79.48, + "reward": 0.3828125, + "reward_std": 0.2688143849372864, + "rewards/Response_no_think_reward_1/mean": 0.3828125, + "rewards/Response_no_think_reward_1/std": 0.7542122602462769, + "step": 135, + "train_speed(iter/s)": 0.002641 + }, + { + "clip_ratio/high_max": 0.0006793478387407959, + "clip_ratio/high_mean": 0.0006793478387407959, + "clip_ratio/low_mean": 0.01892346324166283, + "clip_ratio/low_min": 0.01892346324166283, + "clip_ratio/region_mean": 0.019602811022195965, + "epoch": 1.644776119402985, + "grad_norm": 1.7776881222618184, + "kl": 2.936662324536883, + "learning_rate": 1.748362602236403e-05, + "loss": 0.021627021953463554, + "memory(GiB)": 79.48, + "step": 136, + "train_speed(iter/s)": 0.002651 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0003906250058207661, + "clip_ratio/low_min": 0.0003906250058207661, + "clip_ratio/region_mean": 0.0003906250058207661, + "completions/clipped_ratio": 0.0625, + "completions/max_length": 24.0, + "completions/mean_length": 6.6953125, + "completions/min_length": 3.0, + "epoch": 1.6567164179104479, + "grad_norm": 2.8008543153134777, + "kl": 1.5049916390344151, + "learning_rate": 1.63698606382661e-05, + "loss": 0.022346211597323418, + "memory(GiB)": 79.48, + "reward": 0.3828125, + "reward_std": 0.15467959642410278, + "rewards/Response_no_think_reward_1/mean": 0.3828125, + "rewards/Response_no_think_reward_1/std": 0.7436988949775696, + "step": 137, + "train_speed(iter/s)": 0.002647 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.004379986581625417, + "clip_ratio/low_min": 0.004379986581625417, + "clip_ratio/region_mean": 0.004379986581625417, + "epoch": 1.6686567164179105, + "grad_norm": 1.5764765403480743, + "kl": 1.4290150789947802, + "learning_rate": 1.528958013593801e-05, + "loss": 0.0181417278945446, + "memory(GiB)": 79.48, + "step": 138, + "train_speed(iter/s)": 0.002657 + }, + { + "clip_ratio/high_max": 0.0009469697251915932, + "clip_ratio/high_mean": 0.0009469697251915932, + "clip_ratio/low_mean": 0.009301686193794012, + "clip_ratio/low_min": 0.009301686193794012, + "clip_ratio/region_mean": 0.010248655918985605, + "completions/clipped_ratio": 0.0625, + "completions/max_length": 25.0, + "completions/mean_length": 5.15625, + "completions/min_length": 3.0, + "epoch": 1.680597014925373, + "grad_norm": 2.987112951446729, + "kl": 2.2646760795032606, + "learning_rate": 1.4243217051606283e-05, + "loss": 0.022022899240255356, + "memory(GiB)": 79.48, + "reward": 0.5625, + "reward_std": 0.3713865876197815, + "rewards/Response_no_think_reward_1/mean": 0.5625, + "rewards/Response_no_think_reward_1/std": 0.6958821415901184, + "step": 139, + "train_speed(iter/s)": 0.002652 + }, + { + "clip_ratio/high_max": 0.0010245901066809893, + "clip_ratio/high_mean": 0.0010245901066809893, + "clip_ratio/low_mean": 0.008475731243379414, + "clip_ratio/low_min": 0.008475731243379414, + "clip_ratio/region_mean": 0.009500321350060403, + "epoch": 1.6925373134328359, + "grad_norm": 2.122472644745234, + "kl": 2.2440224051242694, + "learning_rate": 1.3231190341217081e-05, + "loss": 0.017425674945116043, + "memory(GiB)": 79.48, + "step": 140, + "train_speed(iter/s)": 0.002662 } ], "logging_steps": 1, - "max_steps": 180, + "max_steps": 166, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 5,