{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.6925373134328359, "eval_steps": 500, "global_step": 140, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 51.0, "completions/mean_length": 16.09375, "completions/min_length": 2.0, "epoch": 0.011940298507462687, "grad_norm": 3.1591623828063176, "kl": 0.0, "learning_rate": 2.2222222222222223e-05, "loss": -3.725290298461914e-09, "memory(GiB)": 77.11, "reward": 0.1484375, "reward_std": 0.7272911071777344, "rewards/Response_no_think_reward_1/mean": 0.1484375, "rewards/Response_no_think_reward_1/std": 0.9646495580673218, "step": 1, "train_speed(iter/s)": 0.001668 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 0.023880597014925373, "grad_norm": 3.150729002521691, "kl": 0.0, "learning_rate": 4.4444444444444447e-05, "loss": -3.725290298461914e-09, "memory(GiB)": 77.11, "step": 2, "train_speed(iter/s)": 0.002544 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0028647197177633643, "clip_ratio/low_min": 0.0028647197177633643, "clip_ratio/region_mean": 0.0028647197177633643, "completions/clipped_ratio": 0.0390625, "completions/max_length": 51.0, "completions/mean_length": 14.59375, "completions/min_length": 2.0, "epoch": 0.03582089552238806, "grad_norm": 2.067277005959865, "kl": 0.0022258755707298405, "learning_rate": 6.666666666666667e-05, "loss": -0.0004270445788279176, "memory(GiB)": 77.3, "reward": -0.3828125, "reward_std": 0.707726001739502, "rewards/Response_no_think_reward_1/mean": -0.3828125, "rewards/Response_no_think_reward_1/std": 0.923201322555542, "step": 3, "train_speed(iter/s)": 0.002313 }, { "clip_ratio/high_max": 0.003551179339410737, "clip_ratio/high_mean": 0.003551179339410737, "clip_ratio/low_mean": 0.025148934859316796, "clip_ratio/low_min": 0.025148934859316796, "clip_ratio/region_mean": 0.028700114460662007, "epoch": 0.04776119402985075, "grad_norm": 1.6109973009110337, "kl": 0.007886729676101822, "learning_rate": 8.888888888888889e-05, "loss": -0.010280434973537922, "memory(GiB)": 77.3, "step": 4, "train_speed(iter/s)": 0.002696 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0019339247373864055, "clip_ratio/low_min": 0.0019339247373864055, "clip_ratio/region_mean": 0.0019339247373864055, "completions/clipped_ratio": 0.0390625, "completions/max_length": 51.0, "completions/mean_length": 13.5390625, "completions/min_length": 3.0, "epoch": 0.05970149253731343, "grad_norm": 2.893722550507481, "kl": 0.010198775078606559, "learning_rate": 0.00011111111111111112, "loss": 0.0004082494997419417, "memory(GiB)": 77.52, "reward": 0.125, "reward_std": 0.493943989276886, "rewards/Response_no_think_reward_1/mean": 0.125, "rewards/Response_no_think_reward_1/std": 0.9881184101104736, "step": 5, "train_speed(iter/s)": 0.002517 }, { "clip_ratio/high_max": 0.028469400480389595, "clip_ratio/high_mean": 0.028469400480389595, "clip_ratio/low_mean": 0.04948427155613899, "clip_ratio/low_min": 0.04948427155613899, "clip_ratio/region_mean": 0.07795367110520601, "epoch": 0.07164179104477612, "grad_norm": 1.5585579234945925, "kl": 0.6935355372261256, "learning_rate": 0.00013333333333333334, "loss": -0.005084950476884842, "memory(GiB)": 79.48, "step": 6, "train_speed(iter/s)": 0.002759 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0010160960373468697, "clip_ratio/low_min": 0.0010160960373468697, "clip_ratio/region_mean": 0.0010160960373468697, "completions/clipped_ratio": 0.0078125, "completions/max_length": 51.0, "completions/mean_length": 11.9296875, "completions/min_length": 3.0, "epoch": 0.08358208955223881, "grad_norm": 1.7579177577957044, "kl": 0.07463712914614007, "learning_rate": 0.00015555555555555556, "loss": 0.0008710746187716722, "memory(GiB)": 79.48, "reward": -0.0390625, "reward_std": 0.6340709924697876, "rewards/Response_no_think_reward_1/mean": -0.0390625, "rewards/Response_no_think_reward_1/std": 0.9992307424545288, "step": 7, "train_speed(iter/s)": 0.002622 }, { "clip_ratio/high_max": 0.02714990673121065, "clip_ratio/high_mean": 0.02714990673121065, "clip_ratio/low_mean": 0.03809016165905632, "clip_ratio/low_min": 0.03809016165905632, "clip_ratio/region_mean": 0.06524006789550185, "epoch": 0.0955223880597015, "grad_norm": 1.2730547516178623, "kl": 0.21840606682235375, "learning_rate": 0.00017777777777777779, "loss": -0.013987341895699501, "memory(GiB)": 79.48, "step": 8, "train_speed(iter/s)": 0.002802 }, { "clip_ratio/high_max": 0.0009191176504828036, "clip_ratio/high_mean": 0.0009191176504828036, "clip_ratio/low_mean": 0.0018382353009656072, "clip_ratio/low_min": 0.0018382353009656072, "clip_ratio/region_mean": 0.0027573530096560717, "completions/clipped_ratio": 0.0078125, "completions/max_length": 51.0, "completions/mean_length": 10.3828125, "completions/min_length": 3.0, "epoch": 0.10746268656716418, "grad_norm": 3.3295900087180645, "kl": 0.35752939723897725, "learning_rate": 0.0002, "loss": 0.003791232593357563, "memory(GiB)": 79.48, "reward": 0.328125, "reward_std": 0.5329009890556335, "rewards/Response_no_think_reward_1/mean": 0.328125, "rewards/Response_no_think_reward_1/std": 0.9483460783958435, "step": 9, "train_speed(iter/s)": 0.002657 }, { "clip_ratio/high_max": 0.03471234819153324, "clip_ratio/high_mean": 0.03471234819153324, "clip_ratio/low_mean": 0.045793990429956466, "clip_ratio/low_min": 0.045793990429956466, "clip_ratio/region_mean": 0.08050633978564292, "epoch": 0.11940298507462686, "grad_norm": 3.037041883710677, "kl": 1.3611202164320275, "learning_rate": 0.00019997998037428526, "loss": -0.0012767184525728226, "memory(GiB)": 79.48, "step": 10, "train_speed(iter/s)": 0.002798 }, { "clip_ratio/high_max": 0.0022767678019590676, "clip_ratio/high_mean": 0.0022767678019590676, "clip_ratio/low_mean": 0.004576534847728908, "clip_ratio/low_min": 0.004576534847728908, "clip_ratio/region_mean": 0.006853302649687976, "completions/clipped_ratio": 0.015625, "completions/max_length": 51.0, "completions/mean_length": 11.3828125, "completions/min_length": 3.0, "epoch": 0.13134328358208955, "grad_norm": 1.1988213220999966, "kl": 0.176690819360374, "learning_rate": 0.00019991992951284932, "loss": 0.0002530772762838751, "memory(GiB)": 79.48, "reward": 0.2890625, "reward_std": 0.36220550537109375, "rewards/Response_no_think_reward_1/mean": 0.2890625, "rewards/Response_no_think_reward_1/std": 0.9487027525901794, "step": 11, "train_speed(iter/s)": 0.002687 }, { "clip_ratio/high_max": 0.010013980441726744, "clip_ratio/high_mean": 0.010013980441726744, "clip_ratio/low_mean": 0.0431372388266027, "clip_ratio/low_min": 0.0431372388266027, "clip_ratio/region_mean": 0.053151219501160085, "epoch": 0.14328358208955225, "grad_norm": 4.4251813995519464, "kl": 3.680493631065474, "learning_rate": 0.00019981987145960755, "loss": 0.022724991664290428, "memory(GiB)": 79.48, "step": 12, "train_speed(iter/s)": 0.002804 }, { "clip_ratio/high_max": 0.000480769231216982, "clip_ratio/high_mean": 0.000480769231216982, "clip_ratio/low_mean": 0.0022044407669454813, "clip_ratio/low_min": 0.0022044407669454813, "clip_ratio/region_mean": 0.0026852099981624633, "completions/clipped_ratio": 0.0078125, "completions/max_length": 51.0, "completions/mean_length": 12.0703125, "completions/min_length": 3.0, "epoch": 0.15522388059701492, "grad_norm": 2.0136556426936285, "kl": 0.14468206313904375, "learning_rate": 0.00019967984627705548, "loss": -0.00039299592026509345, "memory(GiB)": 79.48, "reward": 0.0625, "reward_std": 0.6480826735496521, "rewards/Response_no_think_reward_1/mean": 0.0625, "rewards/Response_no_think_reward_1/std": 0.9861242175102234, "step": 13, "train_speed(iter/s)": 0.00269 }, { "clip_ratio/high_max": 0.016389093652833253, "clip_ratio/high_mean": 0.016389093652833253, "clip_ratio/low_mean": 0.03954102098941803, "clip_ratio/low_min": 0.03954102098941803, "clip_ratio/region_mean": 0.05593011493328959, "epoch": 0.16716417910447762, "grad_norm": 0.7268697285990734, "kl": 0.15212981263175607, "learning_rate": 0.00019949991003022808, "loss": -0.01738908141851425, "memory(GiB)": 79.48, "step": 14, "train_speed(iter/s)": 0.002789 }, { "clip_ratio/high_max": 0.0005787037080153823, "clip_ratio/high_mean": 0.0005787037080153823, "clip_ratio/low_mean": 0.004868808202445507, "clip_ratio/low_min": 0.004868808202445507, "clip_ratio/region_mean": 0.005447512026876211, "completions/clipped_ratio": 0.015625, "completions/max_length": 51.0, "completions/mean_length": 9.8671875, "completions/min_length": 3.0, "epoch": 0.1791044776119403, "grad_norm": 1.881956635614757, "kl": 0.24015408230479807, "learning_rate": 0.0001992801347642515, "loss": 0.0037227380089461803, "memory(GiB)": 79.48, "reward": 0.0625, "reward_std": 0.15197435021400452, "rewards/Response_no_think_reward_1/mean": 0.0625, "rewards/Response_no_think_reward_1/std": 0.9700231552124023, "step": 15, "train_speed(iter/s)": 0.002716 }, { "clip_ratio/high_max": 0.005905566504225135, "clip_ratio/high_mean": 0.005905566504225135, "clip_ratio/low_mean": 0.03072124859318137, "clip_ratio/low_min": 0.03072124859318137, "clip_ratio/region_mean": 0.036626815563067794, "epoch": 0.191044776119403, "grad_norm": 9.037445474392891, "kl": 4.632834411575459, "learning_rate": 0.00019902060847549718, "loss": 0.06257862597703934, "memory(GiB)": 79.48, "step": 16, "train_speed(iter/s)": 0.002802 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.004252503567840904, "clip_ratio/low_min": 0.004252503567840904, "clip_ratio/region_mean": 0.004252503567840904, "completions/clipped_ratio": 0.0, "completions/max_length": 46.0, "completions/mean_length": 7.0, "completions/min_length": 3.0, "epoch": 0.20298507462686566, "grad_norm": 5.483351751991195, "kl": 3.0633848210127326, "learning_rate": 0.0001987214350763483, "loss": 0.026951301842927933, "memory(GiB)": 79.48, "reward": 0.1640625, "reward_std": 0.45976677536964417, "rewards/Response_no_think_reward_1/mean": 0.1640625, "rewards/Response_no_think_reward_1/std": 0.9116684198379517, "step": 17, "train_speed(iter/s)": 0.002741 }, { "clip_ratio/high_max": 0.02420679770875722, "clip_ratio/high_mean": 0.02420679770875722, "clip_ratio/low_mean": 0.029018129454925656, "clip_ratio/low_min": 0.029018129454925656, "clip_ratio/region_mean": 0.053224927629344165, "epoch": 0.21492537313432836, "grad_norm": 11.084807824277876, "kl": 4.480629495417816, "learning_rate": 0.00019838273435359444, "loss": 0.03358945623040199, "memory(GiB)": 79.48, "step": 18, "train_speed(iter/s)": 0.002818 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.009987752127926797, "clip_ratio/low_min": 0.009987752127926797, "clip_ratio/region_mean": 0.009987752127926797, "completions/clipped_ratio": 0.0078125, "completions/max_length": 51.0, "completions/mean_length": 8.6875, "completions/min_length": 3.0, "epoch": 0.22686567164179106, "grad_norm": 2.774235490038128, "kl": 1.3207979609724134, "learning_rate": 0.00019800464192046955, "loss": 0.012463792227208614, "memory(GiB)": 79.48, "reward": -0.0078125, "reward_std": 0.3263596296310425, "rewards/Response_no_think_reward_1/mean": -0.0078125, "rewards/Response_no_think_reward_1/std": 0.9515514969825745, "step": 19, "train_speed(iter/s)": 0.002746 }, { "clip_ratio/high_max": 0.013878540194127709, "clip_ratio/high_mean": 0.013878540194127709, "clip_ratio/low_mean": 0.053771398146636784, "clip_ratio/low_min": 0.053771398146636784, "clip_ratio/region_mean": 0.06764993839897215, "epoch": 0.23880597014925373, "grad_norm": 18.987604867751966, "kl": 9.466534710245469, "learning_rate": 0.00019758730916235356, "loss": 0.16672615706920624, "memory(GiB)": 79.48, "step": 20, "train_speed(iter/s)": 0.002807 }, { "clip_ratio/high_max": 0.005019778618589044, "clip_ratio/high_mean": 0.005019778618589044, "clip_ratio/low_mean": 0.00046641789958812296, "clip_ratio/low_min": 0.00046641789958812296, "clip_ratio/region_mean": 0.005486196518177167, "completions/clipped_ratio": 0.015625, "completions/max_length": 51.0, "completions/mean_length": 8.234375, "completions/min_length": 3.0, "epoch": 0.2507462686567164, "grad_norm": 3.1541164754847397, "kl": 0.4539797595352866, "learning_rate": 0.00019713090317615876, "loss": 0.0023644084576517344, "memory(GiB)": 79.48, "reward": -0.1015625, "reward_std": 0.3404619097709656, "rewards/Response_no_think_reward_1/mean": -0.1015625, "rewards/Response_no_think_reward_1/std": 0.9788298010826111, "step": 21, "train_speed(iter/s)": 0.002748 }, { "clip_ratio/high_max": 0.02849817555397749, "clip_ratio/high_mean": 0.02849817555397749, "clip_ratio/low_mean": 0.02262113688630052, "clip_ratio/low_min": 0.02262113688630052, "clip_ratio/region_mean": 0.051119312876835465, "epoch": 0.2626865671641791, "grad_norm": 3.225175633228704, "kl": 0.27581185393501073, "learning_rate": 0.00019663560670342558, "loss": 0.0023057509679347277, "memory(GiB)": 79.48, "step": 22, "train_speed(iter/s)": 0.002811 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0015432098880410194, "clip_ratio/low_min": 0.0015432098880410194, "clip_ratio/region_mean": 0.0015432098880410194, "completions/clipped_ratio": 0.03125, "completions/max_length": 51.0, "completions/mean_length": 9.1015625, "completions/min_length": 3.0, "epoch": 0.2746268656716418, "grad_norm": 1.602042628934705, "kl": 0.223259057267569, "learning_rate": 0.00019610161805715397, "loss": 0.0012852977961301804, "memory(GiB)": 79.48, "reward": 0.25, "reward_std": 0.45234403014183044, "rewards/Response_no_think_reward_1/mean": 0.25, "rewards/Response_no_think_reward_1/std": 0.9474374651908875, "step": 23, "train_speed(iter/s)": 0.002763 }, { "clip_ratio/high_max": 0.02699369314359501, "clip_ratio/high_mean": 0.02699369314359501, "clip_ratio/low_mean": 0.024013921502046287, "clip_ratio/low_min": 0.024013921502046287, "clip_ratio/region_mean": 0.05100761540234089, "epoch": 0.2865671641791045, "grad_norm": 1.2163889618122583, "kl": 0.48499861752497964, "learning_rate": 0.00019552915104240065, "loss": -0.007453325670212507, "memory(GiB)": 79.48, "step": 24, "train_speed(iter/s)": 0.002821 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.001253594527952373, "clip_ratio/low_min": 0.001253594527952373, "clip_ratio/region_mean": 0.001253594527952373, "completions/clipped_ratio": 0.0625, "completions/max_length": 51.0, "completions/mean_length": 9.9375, "completions/min_length": 3.0, "epoch": 0.29850746268656714, "grad_norm": 1.3884331155836789, "kl": 0.5089308844180778, "learning_rate": 0.00019491843487067306, "loss": 0.00490172766149044, "memory(GiB)": 79.48, "reward": 0.2265625, "reward_std": 0.46621453762054443, "rewards/Response_no_think_reward_1/mean": 0.2265625, "rewards/Response_no_think_reward_1/std": 0.9324832558631897, "step": 25, "train_speed(iter/s)": 0.002775 }, { "clip_ratio/high_max": 0.01939821511041373, "clip_ratio/high_mean": 0.01939821511041373, "clip_ratio/low_mean": 0.046715788485016674, "clip_ratio/low_min": 0.046715788485016674, "clip_ratio/region_mean": 0.06611400278052315, "epoch": 0.31044776119402984, "grad_norm": 7.610505518747904, "kl": 2.1003341920441017, "learning_rate": 0.00019426971406815463, "loss": 0.024694038555026054, "memory(GiB)": 79.48, "step": 26, "train_speed(iter/s)": 0.002827 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0030820727697573602, "clip_ratio/low_min": 0.0030820727697573602, "clip_ratio/region_mean": 0.0030820727697573602, "completions/clipped_ratio": 0.03125, "completions/max_length": 51.0, "completions/mean_length": 9.2265625, "completions/min_length": 3.0, "epoch": 0.32238805970149254, "grad_norm": 2.593834753837433, "kl": 0.6449481542804278, "learning_rate": 0.00019358324837779863, "loss": 0.007649811916053295, "memory(GiB)": 79.48, "reward": 0.2890625, "reward_std": 0.6288036704063416, "rewards/Response_no_think_reward_1/mean": 0.2890625, "rewards/Response_no_think_reward_1/std": 0.870806872844696, "step": 27, "train_speed(iter/s)": 0.00279 }, { "clip_ratio/high_max": 0.02224817470414564, "clip_ratio/high_mean": 0.02224817470414564, "clip_ratio/low_mean": 0.03963817795738578, "clip_ratio/low_min": 0.03963817795738578, "clip_ratio/region_mean": 0.061886353767476976, "epoch": 0.33432835820895523, "grad_norm": 4.001134871741585, "kl": 2.057775880966801, "learning_rate": 0.00019285931265532871, "loss": 0.024306027218699455, "memory(GiB)": 79.48, "step": 28, "train_speed(iter/s)": 0.002839 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0025941890198737383, "clip_ratio/low_min": 0.0025941890198737383, "clip_ratio/region_mean": 0.0025941890198737383, "completions/clipped_ratio": 0.015625, "completions/max_length": 51.0, "completions/mean_length": 7.6640625, "completions/min_length": 3.0, "epoch": 0.34626865671641793, "grad_norm": 2.4322431330202017, "kl": 0.9759200520347804, "learning_rate": 0.0001920981967591891, "loss": 0.009954690001904964, "memory(GiB)": 79.48, "reward": 0.234375, "reward_std": 0.5239416360855103, "rewards/Response_no_think_reward_1/mean": 0.234375, "rewards/Response_no_think_reward_1/std": 0.8179518580436707, "step": 29, "train_speed(iter/s)": 0.002811 }, { "clip_ratio/high_max": 0.05181985488161445, "clip_ratio/high_mean": 0.05181985488161445, "clip_ratio/low_mean": 0.03574432339519262, "clip_ratio/low_min": 0.03574432339519262, "clip_ratio/region_mean": 0.0875641773454845, "epoch": 0.3582089552238806, "grad_norm": 2.469531358214721, "kl": 0.3759418617701158, "learning_rate": 0.00019130020543448704, "loss": 0.030206725001335144, "memory(GiB)": 79.48, "step": 30, "train_speed(iter/s)": 0.002857 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0007102272938936949, "clip_ratio/low_min": 0.0007102272938936949, "clip_ratio/region_mean": 0.0007102272938936949, "completions/clipped_ratio": 0.015625, "completions/max_length": 51.0, "completions/mean_length": 7.4921875, "completions/min_length": 3.0, "epoch": 0.3701492537313433, "grad_norm": 25.502961039749618, "kl": 0.3221544102343614, "learning_rate": 0.00019046565819097545, "loss": 0.0061463117599487305, "memory(GiB)": 79.48, "reward": 0.265625, "reward_std": 0.3810158967971802, "rewards/Response_no_think_reward_1/mean": 0.265625, "rewards/Response_no_think_reward_1/std": 0.8082680702209473, "step": 31, "train_speed(iter/s)": 0.002819 }, { "clip_ratio/high_max": 0.0004340277810115367, "clip_ratio/high_mean": 0.0004340277810115367, "clip_ratio/low_mean": 0.015644782513845712, "clip_ratio/low_min": 0.015644782513845712, "clip_ratio/region_mean": 0.01607881032396108, "epoch": 0.382089552238806, "grad_norm": 2.386529018247983, "kl": 0.4242442559116171, "learning_rate": 0.0001895948891751234, "loss": 0.005282086320221424, "memory(GiB)": 79.48, "step": 32, "train_speed(iter/s)": 0.002862 }, { "clip_ratio/high_max": 0.0008561643771827221, "clip_ratio/high_mean": 0.0008561643771827221, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0008561643771827221, "completions/clipped_ratio": 0.0, "completions/max_length": 36.0, "completions/mean_length": 6.8984375, "completions/min_length": 3.0, "epoch": 0.3940298507462687, "grad_norm": 2.313143797352374, "kl": 1.4197996056172997, "learning_rate": 0.00018868824703632657, "loss": 0.011696252971887589, "memory(GiB)": 79.48, "reward": 0.046875, "reward_std": 0.6391555070877075, "rewards/Response_no_think_reward_1/mean": 0.046875, "rewards/Response_no_think_reward_1/std": 0.8215538859367371, "step": 33, "train_speed(iter/s)": 0.002823 }, { "clip_ratio/high_max": 0.03243769891560078, "clip_ratio/high_mean": 0.03243769891560078, "clip_ratio/low_mean": 0.057673962553963065, "clip_ratio/low_min": 0.057673962553963065, "clip_ratio/region_mean": 0.09011166216805577, "epoch": 0.4059701492537313, "grad_norm": 1.7539402550269323, "kl": 1.9242291511036456, "learning_rate": 0.00018774609478731046, "loss": -0.004083915147930384, "memory(GiB)": 79.48, "step": 34, "train_speed(iter/s)": 0.002863 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0010245901066809893, "clip_ratio/low_min": 0.0010245901066809893, "clip_ratio/region_mean": 0.0010245901066809893, "completions/clipped_ratio": 0.0078125, "completions/max_length": 51.0, "completions/mean_length": 7.7109375, "completions/min_length": 3.0, "epoch": 0.417910447761194, "grad_norm": 2.4226244872635485, "kl": 1.010538819245994, "learning_rate": 0.00018676880965878291, "loss": 0.015125149860978127, "memory(GiB)": 79.48, "reward": 0.0546875, "reward_std": 0.5867211818695068, "rewards/Response_no_think_reward_1/mean": 0.0546875, "rewards/Response_no_think_reward_1/std": 0.8539726138114929, "step": 35, "train_speed(iter/s)": 0.00283 }, { "clip_ratio/high_max": 0.030840664519928396, "clip_ratio/high_mean": 0.030840664519928396, "clip_ratio/low_mean": 0.06221208241186105, "clip_ratio/low_min": 0.06221208241186105, "clip_ratio/region_mean": 0.09305274731013924, "epoch": 0.4298507462686567, "grad_norm": 2.284561806665497, "kl": 2.4607611764222383, "learning_rate": 0.00018575678294839373, "loss": 0.010896118357777596, "memory(GiB)": 79.48, "step": 36, "train_speed(iter/s)": 0.002867 }, { "clip_ratio/high_max": 0.001179245300590992, "clip_ratio/high_mean": 0.001179245300590992, "clip_ratio/low_mean": 0.00924376118928194, "clip_ratio/low_min": 0.00924376118928194, "clip_ratio/region_mean": 0.010423006489872932, "completions/clipped_ratio": 0.0, "completions/max_length": 27.0, "completions/mean_length": 5.328125, "completions/min_length": 2.0, "epoch": 0.4417910447761194, "grad_norm": 3.3426494147901047, "kl": 0.3604982797114644, "learning_rate": 0.000184710419864062, "loss": 0.0029986475128680468, "memory(GiB)": 79.48, "reward": 0.328125, "reward_std": 0.34082794189453125, "rewards/Response_no_think_reward_1/mean": 0.328125, "rewards/Response_no_think_reward_1/std": 0.8794179558753967, "step": 37, "train_speed(iter/s)": 0.002821 }, { "clip_ratio/high_max": 0.011844758177176118, "clip_ratio/high_mean": 0.011844758177176118, "clip_ratio/low_mean": 0.05284481216222048, "clip_ratio/low_min": 0.05284481216222048, "clip_ratio/region_mean": 0.06468957080505788, "epoch": 0.4537313432835821, "grad_norm": 0.9022263920887504, "kl": 0.5205309305310948, "learning_rate": 0.00018363013936173393, "loss": -0.011295529082417488, "memory(GiB)": 79.48, "step": 38, "train_speed(iter/s)": 0.002857 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 51.0, "completions/mean_length": 5.328125, "completions/min_length": 3.0, "epoch": 0.46567164179104475, "grad_norm": 1.5271115661229067, "kl": 0.27687166831583454, "learning_rate": 0.00018251637397763597, "loss": 0.0014096113154664636, "memory(GiB)": 79.48, "reward": 0.046875, "reward_std": 0.3280481696128845, "rewards/Response_no_think_reward_1/mean": 0.046875, "rewards/Response_no_think_reward_1/std": 0.9379100203514099, "step": 39, "train_speed(iter/s)": 0.002785 }, { "clip_ratio/high_max": 0.04636762477457523, "clip_ratio/high_mean": 0.04636762477457523, "clip_ratio/low_mean": 0.02858343638945371, "clip_ratio/low_min": 0.02858343638945371, "clip_ratio/region_mean": 0.07495106221176684, "epoch": 0.47761194029850745, "grad_norm": 0.6061436422525854, "kl": 0.7858691609289963, "learning_rate": 0.00018136956965509064, "loss": -0.008444712497293949, "memory(GiB)": 79.48, "step": 40, "train_speed(iter/s)": 0.002819 }, { "clip_ratio/high_max": 0.001953125, "clip_ratio/high_mean": 0.001953125, "clip_ratio/low_mean": 0.0004006410308647901, "clip_ratio/low_min": 0.0004006410308647901, "clip_ratio/region_mean": 0.00235376603086479, "completions/clipped_ratio": 0.0390625, "completions/max_length": 51.0, "completions/mean_length": 8.296875, "completions/min_length": 3.0, "epoch": 0.48955223880597015, "grad_norm": 2.15651488822414, "kl": 0.5289879650626972, "learning_rate": 0.000180190185565964, "loss": 0.006278940010815859, "memory(GiB)": 79.48, "reward": 0.140625, "reward_std": 0.3606899678707123, "rewards/Response_no_think_reward_1/mean": 0.140625, "rewards/Response_no_think_reward_1/std": 0.9284173250198364, "step": 41, "train_speed(iter/s)": 0.002732 }, { "clip_ratio/high_max": 0.019255130202509463, "clip_ratio/high_mean": 0.019255130202509463, "clip_ratio/low_mean": 0.049764272407628596, "clip_ratio/low_min": 0.049764272407628596, "clip_ratio/region_mean": 0.06901940272655338, "epoch": 0.5014925373134328, "grad_norm": 7.678211490755348, "kl": 4.704732097394299, "learning_rate": 0.00017897869392681685, "loss": 0.036949772387742996, "memory(GiB)": 79.48, "step": 42, "train_speed(iter/s)": 0.002764 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0018887363257817924, "clip_ratio/low_min": 0.0018887363257817924, "clip_ratio/region_mean": 0.0018887363257817924, "completions/clipped_ratio": 0.03125, "completions/max_length": 51.0, "completions/mean_length": 10.0390625, "completions/min_length": 3.0, "epoch": 0.5134328358208955, "grad_norm": 1.5758982248595066, "kl": 0.34190677378865075, "learning_rate": 0.00017773557980983262, "loss": 0.004829109646379948, "memory(GiB)": 79.48, "reward": 0.3671875, "reward_std": 0.355153352022171, "rewards/Response_no_think_reward_1/mean": 0.3671875, "rewards/Response_no_think_reward_1/std": 0.8406137228012085, "step": 43, "train_speed(iter/s)": 0.002649 }, { "clip_ratio/high_max": 0.010433136369101703, "clip_ratio/high_mean": 0.010433136369101703, "clip_ratio/low_mean": 0.0495308703975752, "clip_ratio/low_min": 0.0495308703975752, "clip_ratio/region_mean": 0.05996400595176965, "epoch": 0.5253731343283582, "grad_norm": 0.9699999569587556, "kl": 0.5136687369667925, "learning_rate": 0.00017646134094859815, "loss": -0.008213551715016365, "memory(GiB)": 79.48, "step": 44, "train_speed(iter/s)": 0.00268 }, { "clip_ratio/high_max": 0.0009920635493472219, "clip_ratio/high_mean": 0.0009920635493472219, "clip_ratio/low_mean": 0.0006793478387407959, "clip_ratio/low_min": 0.0006793478387407959, "clip_ratio/region_mean": 0.0016714113880880177, "completions/clipped_ratio": 0.0234375, "completions/max_length": 51.0, "completions/mean_length": 6.53125, "completions/min_length": 3.0, "epoch": 0.5373134328358209, "grad_norm": 2.6187879748810294, "kl": 0.4996573789976537, "learning_rate": 0.00017515648753881492, "loss": 0.00461646867915988, "memory(GiB)": 79.48, "reward": 0.390625, "reward_std": 0.4600672125816345, "rewards/Response_no_think_reward_1/mean": 0.390625, "rewards/Response_no_think_reward_1/std": 0.8251401782035828, "step": 45, "train_speed(iter/s)": 0.002583 }, { "clip_ratio/high_max": 0.023812146624550223, "clip_ratio/high_mean": 0.023812146624550223, "clip_ratio/low_mean": 0.030458416498731822, "clip_ratio/low_min": 0.030458416498731822, "clip_ratio/region_mean": 0.054270562424790114, "epoch": 0.5492537313432836, "grad_norm": 1.046619303634399, "kl": 1.1794932310585864, "learning_rate": 0.00017382154203402048, "loss": -0.007490159012377262, "memory(GiB)": 79.48, "step": 46, "train_speed(iter/s)": 0.002612 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0014244693447835743, "clip_ratio/low_min": 0.0014244693447835743, "clip_ratio/region_mean": 0.0014244693447835743, "completions/clipped_ratio": 0.078125, "completions/max_length": 51.0, "completions/mean_length": 11.59375, "completions/min_length": 3.0, "epoch": 0.5611940298507463, "grad_norm": 1.8613572071063658, "kl": 0.6177221334655769, "learning_rate": 0.0001724570389364019, "loss": 0.004859148990362883, "memory(GiB)": 79.48, "reward": 0.0625, "reward_std": 0.47469794750213623, "rewards/Response_no_think_reward_1/mean": 0.0625, "rewards/Response_no_think_reward_1/std": 0.8761943578720093, "step": 47, "train_speed(iter/s)": 0.002518 }, { "clip_ratio/high_max": 0.009966709709260613, "clip_ratio/high_mean": 0.009966709709260613, "clip_ratio/low_mean": 0.11994545813649893, "clip_ratio/low_min": 0.11994545813649893, "clip_ratio/region_mean": 0.12991216825321317, "epoch": 0.573134328358209, "grad_norm": 0.9444759818819449, "kl": 0.9089975492097437, "learning_rate": 0.00017106352458278522, "loss": -0.009144289419054985, "memory(GiB)": 79.48, "step": 48, "train_speed(iter/s)": 0.002547 }, { "clip_ratio/high_max": 0.00021043770539108664, "clip_ratio/high_mean": 0.00021043770539108664, "clip_ratio/low_mean": 0.002260449342429638, "clip_ratio/low_min": 0.002260449342429638, "clip_ratio/region_mean": 0.0024708870478207245, "completions/clipped_ratio": 0.1328125, "completions/max_length": 51.0, "completions/mean_length": 12.921875, "completions/min_length": 3.0, "epoch": 0.5850746268656717, "grad_norm": 1.7364401500647022, "kl": 0.6272030578693375, "learning_rate": 0.00016964155692588616, "loss": 0.004394113551825285, "memory(GiB)": 79.48, "reward": 0.1484375, "reward_std": 0.424231618642807, "rewards/Response_no_think_reward_1/mean": 0.1484375, "rewards/Response_no_think_reward_1/std": 0.914363443851471, "step": 49, "train_speed(iter/s)": 0.002518 }, { "clip_ratio/high_max": 0.03189032070804387, "clip_ratio/high_mean": 0.03189032070804387, "clip_ratio/low_mean": 0.04090093384729698, "clip_ratio/low_min": 0.04090093384729698, "clip_ratio/region_mean": 0.07279125548666343, "epoch": 0.5970149253731343, "grad_norm": 4.461755913109612, "kl": 1.2612105239531957, "learning_rate": 0.00016819170531091017, "loss": 0.0014673060504719615, "memory(GiB)": 79.48, "step": 50, "train_speed(iter/s)": 0.002545 }, { "clip_ratio/high_max": 0.0015625000232830644, "clip_ratio/high_mean": 0.0015625000232830644, "clip_ratio/low_mean": 0.0016522249497938901, "clip_ratio/low_min": 0.0016522249497938901, "clip_ratio/region_mean": 0.0032147249730769545, "completions/clipped_ratio": 0.0859375, "completions/max_length": 51.0, "completions/mean_length": 10.46875, "completions/min_length": 3.0, "epoch": 0.608955223880597, "grad_norm": 2.519038758282151, "kl": 0.549895275675226, "learning_rate": 0.00016671455024759067, "loss": 0.0033532448578625917, "memory(GiB)": 79.48, "reward": 0.1796875, "reward_std": 0.39886242151260376, "rewards/Response_no_think_reward_1/mean": 0.1796875, "rewards/Response_no_think_reward_1/std": 0.9258628487586975, "step": 51, "train_speed(iter/s)": 0.002473 }, { "clip_ratio/high_max": 0.03367150644771755, "clip_ratio/high_mean": 0.03367150644771755, "clip_ratio/low_mean": 0.0576377569232136, "clip_ratio/low_min": 0.0576377569232136, "clip_ratio/region_mean": 0.09130926383659244, "epoch": 0.6208955223880597, "grad_norm": 0.9238461637378925, "kl": 0.672293990442995, "learning_rate": 0.00016521068317775753, "loss": -0.019059473648667336, "memory(GiB)": 79.48, "step": 52, "train_speed(iter/s)": 0.002499 }, { "clip_ratio/high_max": 0.0013558201026171446, "clip_ratio/high_mean": 0.0013558201026171446, "clip_ratio/low_mean": 0.010322635032935068, "clip_ratio/low_min": 0.010322635032935068, "clip_ratio/region_mean": 0.011678455251967534, "completions/clipped_ratio": 0.1796875, "completions/max_length": 51.0, "completions/mean_length": 14.0390625, "completions/min_length": 3.0, "epoch": 0.6328358208955224, "grad_norm": 6.547271710761981, "kl": 1.0316203383699758, "learning_rate": 0.00016368070623852792, "loss": 0.006902866996824741, "memory(GiB)": 79.48, "reward": 0.1328125, "reward_std": 0.561459481716156, "rewards/Response_no_think_reward_1/mean": 0.1328125, "rewards/Response_no_think_reward_1/std": 0.9081528782844543, "step": 53, "train_speed(iter/s)": 0.002484 }, { "clip_ratio/high_max": 0.0014829304564045742, "clip_ratio/high_mean": 0.0014829304564045742, "clip_ratio/low_mean": 0.1896184734068811, "clip_ratio/low_min": 0.1896184734068811, "clip_ratio/region_mean": 0.19110140530392528, "epoch": 0.6447761194029851, "grad_norm": 3.3472874723788295, "kl": 2.011909826847841, "learning_rate": 0.00016212523202121544, "loss": 0.00577022647485137, "memory(GiB)": 79.48, "step": 54, "train_speed(iter/s)": 0.002509 }, { "clip_ratio/high_max": 0.0017361111240461469, "clip_ratio/high_mean": 0.0017361111240461469, "clip_ratio/low_mean": 0.004226236138492823, "clip_ratio/low_min": 0.004226236138492823, "clip_ratio/region_mean": 0.0059623472625389695, "completions/clipped_ratio": 0.0859375, "completions/max_length": 51.0, "completions/mean_length": 10.125, "completions/min_length": 3.0, "epoch": 0.6567164179104478, "grad_norm": 2.1721724253324193, "kl": 1.4456337625160813, "learning_rate": 0.00016054488332605283, "loss": 0.007076151203364134, "memory(GiB)": 79.48, "reward": 0.3046875, "reward_std": 0.4615631103515625, "rewards/Response_no_think_reward_1/mean": 0.3046875, "rewards/Response_no_think_reward_1/std": 0.8654214143753052, "step": 55, "train_speed(iter/s)": 0.002495 }, { "clip_ratio/high_max": 0.07161095441551879, "clip_ratio/high_mean": 0.07161095441551879, "clip_ratio/low_mean": 0.0391811344306916, "clip_ratio/low_min": 0.0391811344306916, "clip_ratio/region_mean": 0.11079208552837372, "epoch": 0.6686567164179105, "grad_norm": 1.6216131312943962, "kl": 0.9301650315364896, "learning_rate": 0.00015894029291282758, "loss": -0.018307652324438095, "memory(GiB)": 79.48, "step": 56, "train_speed(iter/s)": 0.002519 }, { "clip_ratio/high_max": 0.0028409091755747795, "clip_ratio/high_mean": 0.0028409091755747795, "clip_ratio/low_mean": 0.007847597065847367, "clip_ratio/low_min": 0.007847597065847367, "clip_ratio/region_mean": 0.010688506241422147, "completions/clipped_ratio": 0.0703125, "completions/max_length": 51.0, "completions/mean_length": 8.2109375, "completions/min_length": 3.0, "epoch": 0.6805970149253732, "grad_norm": 4.528309911623671, "kl": 1.2233935340000244, "learning_rate": 0.00015731210324752972, "loss": 0.015045193955302238, "memory(GiB)": 79.48, "reward": 0.171875, "reward_std": 0.5126261711120605, "rewards/Response_no_think_reward_1/mean": 0.171875, "rewards/Response_no_think_reward_1/std": 0.9315922856330872, "step": 57, "train_speed(iter/s)": 0.002481 }, { "clip_ratio/high_max": 0.022757820785045624, "clip_ratio/high_mean": 0.022757820785045624, "clip_ratio/low_mean": 0.14223288698121905, "clip_ratio/low_min": 0.14223288698121905, "clip_ratio/region_mean": 0.1649907068349421, "epoch": 0.6925373134328359, "grad_norm": 75.05881389891198, "kl": 71.87919758663793, "learning_rate": 0.00015566096624511307, "loss": 0.9493598341941833, "memory(GiB)": 79.48, "step": 58, "train_speed(iter/s)": 0.002504 }, { "clip_ratio/high_max": 0.0005230125389061868, "clip_ratio/high_mean": 0.0005230125389061868, "clip_ratio/low_mean": 0.012553135456983, "clip_ratio/low_min": 0.012553135456983, "clip_ratio/region_mean": 0.013076147937681526, "completions/clipped_ratio": 0.1171875, "completions/max_length": 51.0, "completions/mean_length": 9.3828125, "completions/min_length": 3.0, "epoch": 0.7044776119402985, "grad_norm": 2.061647426051912, "kl": 3.4461456341377925, "learning_rate": 0.00015398754300847343, "loss": 0.024864066392183304, "memory(GiB)": 79.48, "reward": 0.3046875, "reward_std": 0.35084033012390137, "rewards/Response_no_think_reward_1/mean": 0.3046875, "rewards/Response_no_think_reward_1/std": 0.9010806679725647, "step": 59, "train_speed(iter/s)": 0.002474 }, { "clip_ratio/high_max": 0.010577498760540038, "clip_ratio/high_mean": 0.010577498760540038, "clip_ratio/low_mean": 0.15099563542753458, "clip_ratio/low_min": 0.15099563542753458, "clip_ratio/region_mean": 0.16157313529402018, "epoch": 0.7164179104477612, "grad_norm": 6.318543519105419, "kl": 9.211844031116925, "learning_rate": 0.00015229250356374804, "loss": 0.058415383100509644, "memory(GiB)": 79.48, "step": 60, "train_speed(iter/s)": 0.002497 }, { "clip_ratio/high_max": 0.0023436461633536965, "clip_ratio/high_mean": 0.0023436461633536965, "clip_ratio/low_mean": 0.01256567076779902, "clip_ratio/low_min": 0.01256567076779902, "clip_ratio/region_mean": 0.014909316785633564, "completions/clipped_ratio": 0.1640625, "completions/max_length": 51.0, "completions/mean_length": 9.0546875, "completions/min_length": 3.0, "epoch": 0.7283582089552239, "grad_norm": 8.650077130485371, "kl": 12.875115153714432, "learning_rate": 0.00015057652659204197, "loss": 0.11098186671733856, "memory(GiB)": 79.48, "reward": -0.2109375, "reward_std": 0.3248431980609894, "rewards/Response_no_think_reward_1/mean": -0.2109375, "rewards/Response_no_think_reward_1/std": 0.7060185074806213, "step": 61, "train_speed(iter/s)": 0.002485 }, { "clip_ratio/high_max": 0.04812772118020803, "clip_ratio/high_mean": 0.04812772118020803, "clip_ratio/low_mean": 0.016272668377496302, "clip_ratio/low_min": 0.016272668377496302, "clip_ratio/region_mean": 0.06440038897562772, "epoch": 0.7402985074626866, "grad_norm": 6.330882663211948, "kl": 4.831557432677073, "learning_rate": 0.00014884029915768944, "loss": 0.08532620966434479, "memory(GiB)": 79.48, "step": 62, "train_speed(iter/s)": 0.002507 }, { "clip_ratio/high_max": 0.0009259259095415473, "clip_ratio/high_mean": 0.0009259259095415473, "clip_ratio/low_mean": 0.005223244777880609, "clip_ratio/low_min": 0.005223244777880609, "clip_ratio/region_mean": 0.006149170687422156, "completions/clipped_ratio": 0.0625, "completions/max_length": 49.0, "completions/mean_length": 6.8203125, "completions/min_length": 3.0, "epoch": 0.7522388059701492, "grad_norm": 0.8455863083310526, "kl": 3.406710424387711, "learning_rate": 0.00014708451643315827, "loss": 0.015459287911653519, "memory(GiB)": 79.48, "reward": 0.2890625, "reward_std": 0.09522313624620438, "rewards/Response_no_think_reward_1/mean": 0.2890625, "rewards/Response_no_think_reward_1/std": 0.9319553971290588, "step": 63, "train_speed(iter/s)": 0.002478 }, { "clip_ratio/high_max": 0.00038343557389453053, "clip_ratio/high_mean": 0.00038343557389453053, "clip_ratio/low_mean": 0.03692773682996631, "clip_ratio/low_min": 0.03692773682996631, "clip_ratio/region_mean": 0.037311173509806395, "epoch": 0.764179104477612, "grad_norm": 1.460493225059439, "kl": 3.925420918938471, "learning_rate": 0.00014530988142070803, "loss": 0.015160211361944675, "memory(GiB)": 79.48, "step": 64, "train_speed(iter/s)": 0.002499 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.02216397225856781, "clip_ratio/low_min": 0.02216397225856781, "clip_ratio/region_mean": 0.02216397225856781, "completions/clipped_ratio": 0.15625, "completions/max_length": 51.0, "completions/mean_length": 8.1484375, "completions/min_length": 3.0, "epoch": 0.7761194029850746, "grad_norm": 16.54465377888419, "kl": 13.583033993607387, "learning_rate": 0.00014351710467091336, "loss": 0.09176836162805557, "memory(GiB)": 79.48, "reward": 0.0, "reward_std": 0.44421693682670593, "rewards/Response_no_think_reward_1/mean": 0.0, "rewards/Response_no_think_reward_1/std": 0.8418202996253967, "step": 65, "train_speed(iter/s)": 0.00249 }, { "clip_ratio/high_max": 0.016292952001094818, "clip_ratio/high_mean": 0.016292952001094818, "clip_ratio/low_mean": 0.02969469508389011, "clip_ratio/low_min": 0.02969469508389011, "clip_ratio/region_mean": 0.04598764737602323, "epoch": 0.7880597014925373, "grad_norm": 7.478581616879351, "kl": 9.063416050747037, "learning_rate": 0.0001417069039981647, "loss": 0.08187955617904663, "memory(GiB)": 79.48, "step": 66, "train_speed(iter/s)": 0.00251 }, { "clip_ratio/high_max": 0.0003571428533177823, "clip_ratio/high_mean": 0.0003571428533177823, "clip_ratio/low_mean": 0.011069363099522889, "clip_ratio/low_min": 0.011069363099522889, "clip_ratio/region_mean": 0.011426505981944501, "completions/clipped_ratio": 0.1171875, "completions/max_length": 48.0, "completions/mean_length": 6.75, "completions/min_length": 3.0, "epoch": 0.8, "grad_norm": 2.789323653853436, "kl": 6.344451879562257, "learning_rate": 0.00013988000419326072, "loss": 0.04125535860657692, "memory(GiB)": 79.48, "reward": 0.21875, "reward_std": 0.40496253967285156, "rewards/Response_no_think_reward_1/mean": 0.21875, "rewards/Response_no_think_reward_1/std": 0.8778777122497559, "step": 67, "train_speed(iter/s)": 0.0025 }, { "clip_ratio/high_max": 0.036289573181420565, "clip_ratio/high_mean": 0.036289573181420565, "clip_ratio/low_mean": 0.07330909674055874, "clip_ratio/low_min": 0.07330909674055874, "clip_ratio/region_mean": 0.10959866992197931, "epoch": 0.8119402985074626, "grad_norm": 3.351094606732551, "kl": 7.85955839138478, "learning_rate": 0.00013803713673320772, "loss": 0.0294882133603096, "memory(GiB)": 79.48, "step": 68, "train_speed(iter/s)": 0.00252 }, { "clip_ratio/high_max": 0.0034414873807691038, "clip_ratio/high_mean": 0.0034414873807691038, "clip_ratio/low_mean": 0.017763152020052075, "clip_ratio/low_min": 0.017763152020052075, "clip_ratio/region_mean": 0.021204639226198196, "completions/clipped_ratio": 0.1953125, "completions/max_length": 50.0, "completions/mean_length": 9.0390625, "completions/min_length": 3.0, "epoch": 0.8238805970149253, "grad_norm": 2.3936208496329043, "kl": 8.319812071829801, "learning_rate": 0.00013617903948834155, "loss": 0.0558692142367363, "memory(GiB)": 79.48, "reward": 0.1484375, "reward_std": 0.5162962079048157, "rewards/Response_no_think_reward_1/mean": 0.1484375, "rewards/Response_no_think_reward_1/std": 0.7642591595649719, "step": 69, "train_speed(iter/s)": 0.002511 }, { "clip_ratio/high_max": 0.05922704888507724, "clip_ratio/high_mean": 0.05922704888507724, "clip_ratio/low_mean": 0.03970964252948761, "clip_ratio/low_min": 0.03970964252948761, "clip_ratio/region_mean": 0.09893669094890356, "epoch": 0.835820895522388, "grad_norm": 6.476273530366032, "kl": 5.813117837678874, "learning_rate": 0.00013430645642688988, "loss": 0.04987351968884468, "memory(GiB)": 79.48, "step": 70, "train_speed(iter/s)": 0.00253 }, { "clip_ratio/high_max": 0.002159281895728782, "clip_ratio/high_mean": 0.002159281895728782, "clip_ratio/low_mean": 0.010578428045846522, "clip_ratio/low_min": 0.010578428045846522, "clip_ratio/region_mean": 0.012737710087094456, "completions/clipped_ratio": 0.1171875, "completions/max_length": 44.0, "completions/mean_length": 9.2421875, "completions/min_length": 3.0, "epoch": 0.8477611940298507, "grad_norm": 3.9784798974103217, "kl": 7.147874560090713, "learning_rate": 0.00013242013731709287, "loss": 0.06330341100692749, "memory(GiB)": 79.48, "reward": 0.015625, "reward_std": 0.39743539690971375, "rewards/Response_no_think_reward_1/mean": 0.015625, "rewards/Response_no_think_reward_1/std": 0.6985291242599487, "step": 71, "train_speed(iter/s)": 0.002526 }, { "clip_ratio/high_max": 0.014909500489011407, "clip_ratio/high_mean": 0.014909500489011407, "clip_ratio/low_mean": 0.05899865587707609, "clip_ratio/low_min": 0.05899865587707609, "clip_ratio/region_mean": 0.07390815508551896, "epoch": 0.8597014925373134, "grad_norm": 107.14584369632281, "kl": 5.481248813099228, "learning_rate": 0.00013052083742700173, "loss": 0.5873211026191711, "memory(GiB)": 79.48, "step": 72, "train_speed(iter/s)": 0.002544 }, { "clip_ratio/high_max": 0.005898644914850593, "clip_ratio/high_mean": 0.005898644914850593, "clip_ratio/low_mean": 0.013190844911150634, "clip_ratio/low_min": 0.013190844911150634, "clip_ratio/region_mean": 0.01908948994241655, "completions/clipped_ratio": 0.1484375, "completions/max_length": 51.0, "completions/mean_length": 7.625, "completions/min_length": 3.0, "epoch": 0.8716417910447761, "grad_norm": 5.671656969858763, "kl": 5.887194114271551, "learning_rate": 0.0001286093172220748, "loss": 0.05823807045817375, "memory(GiB)": 79.48, "reward": 0.0078125, "reward_std": 0.47193682193756104, "rewards/Response_no_think_reward_1/mean": 0.0078125, "rewards/Response_no_think_reward_1/std": 0.8648526072502136, "step": 73, "train_speed(iter/s)": 0.002537 }, { "clip_ratio/high_max": 0.05940199224278331, "clip_ratio/high_mean": 0.05940199224278331, "clip_ratio/low_mean": 0.07782801624853164, "clip_ratio/low_min": 0.07782801624853164, "clip_ratio/region_mean": 0.1372300088405609, "epoch": 0.8835820895522388, "grad_norm": 5.588550612212405, "kl": 9.119772452046163, "learning_rate": 0.00012668634206069304, "loss": 0.05784386023879051, "memory(GiB)": 79.48, "step": 74, "train_speed(iter/s)": 0.002555 }, { "clip_ratio/high_max": 0.0005630630766972899, "clip_ratio/high_mean": 0.0005630630766972899, "clip_ratio/low_mean": 0.009406007709912956, "clip_ratio/low_min": 0.009406007709912956, "clip_ratio/region_mean": 0.009969070786610246, "completions/clipped_ratio": 0.0546875, "completions/max_length": 43.0, "completions/mean_length": 7.3671875, "completions/min_length": 3.0, "epoch": 0.8955223880597015, "grad_norm": 40.351102862526105, "kl": 37.61209568884806, "learning_rate": 0.00012475268188771627, "loss": 0.25722047686576843, "memory(GiB)": 79.48, "reward": 0.515625, "reward_std": 0.3077147901058197, "rewards/Response_no_think_reward_1/mean": 0.515625, "rewards/Response_no_think_reward_1/std": 0.5883966684341431, "step": 75, "train_speed(iter/s)": 0.00255 }, { "clip_ratio/high_max": 0.03623928187880665, "clip_ratio/high_mean": 0.03623928187880665, "clip_ratio/low_mean": 0.00604772218503058, "clip_ratio/low_min": 0.00604772218503058, "clip_ratio/region_mean": 0.04228700394742191, "epoch": 0.9074626865671642, "grad_norm": 17.208461552664357, "kl": 6.087301138206385, "learning_rate": 0.00012280911092620297, "loss": 0.16766606271266937, "memory(GiB)": 79.48, "step": 76, "train_speed(iter/s)": 0.002568 }, { "clip_ratio/high_max": 0.0016891892300918698, "clip_ratio/high_mean": 0.0016891892300918698, "clip_ratio/low_mean": 0.012179655604995787, "clip_ratio/low_min": 0.012179655604995787, "clip_ratio/region_mean": 0.013868844718672335, "completions/clipped_ratio": 0.125, "completions/max_length": 39.0, "completions/mean_length": 7.21875, "completions/min_length": 3.0, "epoch": 0.9194029850746268, "grad_norm": 4.3979207862679734, "kl": 7.126492358453106, "learning_rate": 0.00012085640736741708, "loss": 0.06262560933828354, "memory(GiB)": 79.48, "reward": 0.0546875, "reward_std": 0.39322251081466675, "rewards/Response_no_think_reward_1/mean": 0.0546875, "rewards/Response_no_think_reward_1/std": 0.7561672329902649, "step": 77, "train_speed(iter/s)": 0.002562 }, { "clip_ratio/high_max": 0.026138584362342954, "clip_ratio/high_mean": 0.026138584362342954, "clip_ratio/low_mean": 0.04480157361831516, "clip_ratio/low_min": 0.04480157361831516, "clip_ratio/region_mean": 0.07094015786424279, "epoch": 0.9313432835820895, "grad_norm": 2.916485581854171, "kl": 4.029124836612027, "learning_rate": 0.00011889535305924618, "loss": 0.04432527720928192, "memory(GiB)": 79.48, "step": 78, "train_speed(iter/s)": 0.002579 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0125213154242374, "clip_ratio/low_min": 0.0125213154242374, "clip_ratio/region_mean": 0.0125213154242374, "completions/clipped_ratio": 0.1015625, "completions/max_length": 41.0, "completions/mean_length": 7.5703125, "completions/min_length": 3.0, "epoch": 0.9432835820895522, "grad_norm": 5.401724081079944, "kl": 2.715451994285104, "learning_rate": 0.00011692673319315541, "loss": 0.025846321135759354, "memory(GiB)": 79.48, "reward": 0.15625, "reward_std": 0.32662156224250793, "rewards/Response_no_think_reward_1/mean": 0.15625, "rewards/Response_no_think_reward_1/std": 0.778019905090332, "step": 79, "train_speed(iter/s)": 0.002572 }, { "clip_ratio/high_max": 0.02864583395421505, "clip_ratio/high_mean": 0.02864583395421505, "clip_ratio/low_mean": 0.06598890712484717, "clip_ratio/low_min": 0.06598890712484717, "clip_ratio/region_mean": 0.09463474014773965, "epoch": 0.9552238805970149, "grad_norm": 1.7607357402294221, "kl": 3.6259496022976236, "learning_rate": 0.00011495133598980263, "loss": 0.011118962429463863, "memory(GiB)": 79.48, "step": 80, "train_speed(iter/s)": 0.002589 }, { "clip_ratio/high_max": 0.0010000000474974513, "clip_ratio/high_mean": 0.0010000000474974513, "clip_ratio/low_mean": 0.009746301162522286, "clip_ratio/low_min": 0.009746301162522286, "clip_ratio/region_mean": 0.010746301151812077, "completions/clipped_ratio": 0.1015625, "completions/max_length": 45.0, "completions/mean_length": 7.421875, "completions/min_length": 3.0, "epoch": 0.9671641791044776, "grad_norm": 6.226807855082435, "kl": 3.5353202793048695, "learning_rate": 0.00011296995238344084, "loss": 0.0407019704580307, "memory(GiB)": 79.48, "reward": 0.2109375, "reward_std": 0.3596799373626709, "rewards/Response_no_think_reward_1/mean": 0.2109375, "rewards/Response_no_think_reward_1/std": 0.78019118309021, "step": 81, "train_speed(iter/s)": 0.002582 }, { "clip_ratio/high_max": 0.025790343526750803, "clip_ratio/high_mean": 0.025790343526750803, "clip_ratio/low_mean": 0.027053400757722557, "clip_ratio/low_min": 0.027053400757722557, "clip_ratio/region_mean": 0.052843744633719325, "epoch": 0.9791044776119403, "grad_norm": 43.50825312796573, "kl": 2.1143818981945515, "learning_rate": 0.00011098337570523396, "loss": 0.1263183057308197, "memory(GiB)": 79.48, "step": 82, "train_speed(iter/s)": 0.002599 }, { "clip_ratio/high_max": 0.0045458003878593445, "clip_ratio/high_mean": 0.0045458003878593445, "clip_ratio/low_mean": 0.004786531790159643, "clip_ratio/low_min": 0.004786531790159643, "clip_ratio/region_mean": 0.009332332178018987, "completions/clipped_ratio": 0.0625, "completions/max_length": 23.0, "completions/mean_length": 5.6796875, "completions/min_length": 3.0, "epoch": 1.0119402985074626, "grad_norm": 5.294876949688284, "kl": 1.5498897642164593, "learning_rate": 0.00010899240136561299, "loss": 0.011598482728004456, "memory(GiB)": 79.48, "reward": 0.4453125, "reward_std": 0.1938612163066864, "rewards/Response_no_think_reward_1/mean": 0.4453125, "rewards/Response_no_think_reward_1/std": 0.7187981605529785, "step": 83, "train_speed(iter/s)": 0.002589 }, { "clip_ratio/high_max": 0.025593542493879795, "clip_ratio/high_mean": 0.025593542493879795, "clip_ratio/low_mean": 0.025054577039554715, "clip_ratio/low_min": 0.025054577039554715, "clip_ratio/region_mean": 0.05064811953343451, "epoch": 1.0238805970149254, "grad_norm": 2.6737027093734143, "kl": 1.398324867649535, "learning_rate": 0.00010699782653579973, "loss": -0.00029344583163037896, "memory(GiB)": 79.48, "step": 84, "train_speed(iter/s)": 0.002605 }, { "clip_ratio/high_max": 0.0017993993242271245, "clip_ratio/high_mean": 0.0017993993242271245, "clip_ratio/low_mean": 0.01037665200419724, "clip_ratio/low_min": 0.01037665200419724, "clip_ratio/region_mean": 0.012176051270216703, "completions/clipped_ratio": 0.171875, "completions/max_length": 42.0, "completions/mean_length": 6.125, "completions/min_length": 3.0, "epoch": 1.035820895522388, "grad_norm": 2.5145149964606297, "kl": 3.1435449587497715, "learning_rate": 0.00010500044982862519, "loss": 0.024344690144062042, "memory(GiB)": 79.48, "reward": 0.4765625, "reward_std": 0.2772369980812073, "rewards/Response_no_think_reward_1/mean": 0.4765625, "rewards/Response_no_think_reward_1/std": 0.8414914011955261, "step": 85, "train_speed(iter/s)": 0.002595 }, { "clip_ratio/high_max": 0.021866617840714753, "clip_ratio/high_mean": 0.021866617840714753, "clip_ratio/low_mean": 0.07049822807312012, "clip_ratio/low_min": 0.07049822807312012, "clip_ratio/region_mean": 0.09236484486609697, "epoch": 1.0477611940298508, "grad_norm": 2.607332219212116, "kl": 4.641115245953188, "learning_rate": 0.00010300107097877114, "loss": 0.010013583116233349, "memory(GiB)": 79.48, "step": 86, "train_speed(iter/s)": 0.00261 }, { "clip_ratio/high_max": 0.0018382353009656072, "clip_ratio/high_mean": 0.0018382353009656072, "clip_ratio/low_mean": 0.0032051282469183207, "clip_ratio/low_min": 0.0032051282469183207, "clip_ratio/region_mean": 0.005043363547883928, "completions/clipped_ratio": 0.03125, "completions/max_length": 20.0, "completions/mean_length": 5.4375, "completions/min_length": 3.0, "epoch": 1.0597014925373134, "grad_norm": 8.56914849705318, "kl": 0.7865612751156732, "learning_rate": 0.00010100049052256235, "loss": 0.013117787428200245, "memory(GiB)": 79.48, "reward": 0.53125, "reward_std": 0.1860944628715515, "rewards/Response_no_think_reward_1/mean": 0.53125, "rewards/Response_no_think_reward_1/std": 0.7202088236808777, "step": 87, "train_speed(iter/s)": 0.002597 }, { "clip_ratio/high_max": 0.009521116502583027, "clip_ratio/high_mean": 0.009521116502583027, "clip_ratio/low_mean": 0.0203368536895141, "clip_ratio/low_min": 0.0203368536895141, "clip_ratio/region_mean": 0.029857969493605196, "epoch": 1.0716417910447762, "grad_norm": 3.3791848142288035, "kl": 0.6961851019823371, "learning_rate": 9.899950947743767e-05, "loss": 0.00659452797845006, "memory(GiB)": 79.48, "step": 88, "train_speed(iter/s)": 0.002612 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.004996612435206771, "clip_ratio/low_min": 0.004996612435206771, "clip_ratio/region_mean": 0.004996612435206771, "completions/clipped_ratio": 0.1171875, "completions/max_length": 31.0, "completions/mean_length": 5.2265625, "completions/min_length": 3.0, "epoch": 1.0835820895522388, "grad_norm": 3.6519414582158323, "kl": 4.849585925694555, "learning_rate": 9.699892902122886e-05, "loss": 0.06144208833575249, "memory(GiB)": 79.48, "reward": 0.1640625, "reward_std": 0.3352247476577759, "rewards/Response_no_think_reward_1/mean": 0.1640625, "rewards/Response_no_think_reward_1/std": 0.8303053379058838, "step": 89, "train_speed(iter/s)": 0.002606 }, { "clip_ratio/high_max": 0.017538156593218446, "clip_ratio/high_mean": 0.017538156593218446, "clip_ratio/low_mean": 0.03697483101859689, "clip_ratio/low_min": 0.03697483101859689, "clip_ratio/region_mean": 0.054512988310307264, "epoch": 1.0955223880597016, "grad_norm": 13.104523239395307, "kl": 2.37760816863738, "learning_rate": 9.499955017137484e-05, "loss": 0.10894370079040527, "memory(GiB)": 79.48, "step": 90, "train_speed(iter/s)": 0.002621 }, { "clip_ratio/high_max": 0.004422514699399471, "clip_ratio/high_mean": 0.004422514699399471, "clip_ratio/low_mean": 0.007080804323777556, "clip_ratio/low_min": 0.007080804323777556, "clip_ratio/region_mean": 0.01150331913959235, "completions/clipped_ratio": 0.046875, "completions/max_length": 7.0, "completions/mean_length": 4.6640625, "completions/min_length": 3.0, "epoch": 1.1074626865671642, "grad_norm": 3.292956583617785, "kl": 3.1563512758002616, "learning_rate": 9.30021734642003e-05, "loss": 0.03713127598166466, "memory(GiB)": 79.48, "reward": 0.421875, "reward_std": 0.2630079686641693, "rewards/Response_no_think_reward_1/mean": 0.421875, "rewards/Response_no_think_reward_1/std": 0.7382611632347107, "step": 91, "train_speed(iter/s)": 0.002603 }, { "clip_ratio/high_max": 0.012390351388603449, "clip_ratio/high_mean": 0.012390351388603449, "clip_ratio/low_mean": 0.01934311306104064, "clip_ratio/low_min": 0.01934311306104064, "clip_ratio/region_mean": 0.03173346375115216, "epoch": 1.1194029850746268, "grad_norm": 6.523254504794387, "kl": 2.134530827694107, "learning_rate": 9.100759863438702e-05, "loss": 0.04548652470111847, "memory(GiB)": 79.48, "step": 92, "train_speed(iter/s)": 0.002618 }, { "clip_ratio/high_max": 0.0018115942366421223, "clip_ratio/high_mean": 0.0018115942366421223, "clip_ratio/low_mean": 0.010487846680916846, "clip_ratio/low_min": 0.010487846680916846, "clip_ratio/region_mean": 0.012299440917558968, "completions/clipped_ratio": 0.078125, "completions/max_length": 17.0, "completions/mean_length": 4.7109375, "completions/min_length": 3.0, "epoch": 1.1313432835820896, "grad_norm": 2.8653500050121345, "kl": 3.8929527901345864, "learning_rate": 8.901662429476607e-05, "loss": 0.04490555822849274, "memory(GiB)": 79.48, "reward": 0.1796875, "reward_std": 0.25065141916275024, "rewards/Response_no_think_reward_1/mean": 0.1796875, "rewards/Response_no_think_reward_1/std": 0.9173188805580139, "step": 93, "train_speed(iter/s)": 0.00261 }, { "clip_ratio/high_max": 0.019497282337397337, "clip_ratio/high_mean": 0.019497282337397337, "clip_ratio/low_mean": 0.05975891789421439, "clip_ratio/low_min": 0.05975891789421439, "clip_ratio/region_mean": 0.07925620023161173, "epoch": 1.1432835820895522, "grad_norm": 8.612775013595648, "kl": 4.982872966560535, "learning_rate": 8.703004761655917e-05, "loss": 0.07919233292341232, "memory(GiB)": 79.48, "step": 94, "train_speed(iter/s)": 0.002625 }, { "clip_ratio/high_max": 0.0027173913549631834, "clip_ratio/high_mean": 0.0027173913549631834, "clip_ratio/low_mean": 0.005094834603369236, "clip_ratio/low_min": 0.005094834603369236, "clip_ratio/region_mean": 0.007812225958332419, "completions/clipped_ratio": 0.0859375, "completions/max_length": 10.0, "completions/mean_length": 4.9375, "completions/min_length": 3.0, "epoch": 1.155223880597015, "grad_norm": 10.776677331970285, "kl": 9.849615207003808, "learning_rate": 8.504866401019737e-05, "loss": 0.1374131143093109, "memory(GiB)": 79.48, "reward": 0.3203125, "reward_std": 0.14966703951358795, "rewards/Response_no_think_reward_1/mean": 0.3203125, "rewards/Response_no_think_reward_1/std": 0.6266219019889832, "step": 95, "train_speed(iter/s)": 0.002622 }, { "clip_ratio/high_max": 0.019021738320589066, "clip_ratio/high_mean": 0.019021738320589066, "clip_ratio/low_mean": 0.005626177066005766, "clip_ratio/low_min": 0.005626177066005766, "clip_ratio/region_mean": 0.024647915386594832, "epoch": 1.1671641791044776, "grad_norm": 3.0583039624376402, "kl": 4.468168576029711, "learning_rate": 8.307326680684461e-05, "loss": 0.07699939608573914, "memory(GiB)": 79.48, "step": 96, "train_speed(iter/s)": 0.002636 }, { "clip_ratio/high_max": 0.007378174108453095, "clip_ratio/high_mean": 0.007378174108453095, "clip_ratio/low_mean": 0.00924376118928194, "clip_ratio/low_min": 0.00924376118928194, "clip_ratio/region_mean": 0.016621935297735035, "completions/clipped_ratio": 0.0546875, "completions/max_length": 12.0, "completions/mean_length": 4.9453125, "completions/min_length": 3.0, "epoch": 1.1791044776119404, "grad_norm": 9.444776640622303, "kl": 3.863095655280631, "learning_rate": 8.110464694075383e-05, "loss": 0.02421477437019348, "memory(GiB)": 79.48, "reward": 0.4375, "reward_std": 0.25460314750671387, "rewards/Response_no_think_reward_1/mean": 0.4375, "rewards/Response_no_think_reward_1/std": 0.7290377616882324, "step": 97, "train_speed(iter/s)": 0.002626 }, { "clip_ratio/high_max": 0.02187895681709051, "clip_ratio/high_mean": 0.02187895681709051, "clip_ratio/low_mean": 0.005211503244936466, "clip_ratio/low_min": 0.005211503244936466, "clip_ratio/region_mean": 0.027090460062026978, "epoch": 1.191044776119403, "grad_norm": 4.753171281552747, "kl": 3.498804785136599, "learning_rate": 7.914359263258295e-05, "loss": 0.02348589338362217, "memory(GiB)": 79.48, "step": 98, "train_speed(iter/s)": 0.00264 }, { "clip_ratio/high_max": 0.0014204545877873898, "clip_ratio/high_mean": 0.0014204545877873898, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0014204545877873898, "completions/clipped_ratio": 0.0546875, "completions/max_length": 11.0, "completions/mean_length": 5.5859375, "completions/min_length": 3.0, "epoch": 1.2029850746268655, "grad_norm": 4.853951435141314, "kl": 7.24955918840169, "learning_rate": 7.719088907379706e-05, "loss": 0.08564330637454987, "memory(GiB)": 79.48, "reward": 0.359375, "reward_std": 0.1706565022468567, "rewards/Response_no_think_reward_1/mean": 0.359375, "rewards/Response_no_think_reward_1/std": 0.6608795523643494, "step": 99, "train_speed(iter/s)": 0.002636 }, { "clip_ratio/high_max": 0.01420454541221261, "clip_ratio/high_mean": 0.01420454541221261, "clip_ratio/low_mean": 0.0028409091755747795, "clip_ratio/low_min": 0.0028409091755747795, "clip_ratio/region_mean": 0.017045455053448677, "epoch": 1.2149253731343284, "grad_norm": 2.2986744180745324, "kl": 4.886410776793127, "learning_rate": 7.524731811228374e-05, "loss": 0.06466365605592728, "memory(GiB)": 79.48, "step": 100, "train_speed(iter/s)": 0.00265 }, { "clip_ratio/high_max": 0.00620507646817714, "clip_ratio/high_mean": 0.00620507646817714, "clip_ratio/low_mean": 0.008002021699212492, "clip_ratio/low_min": 0.008002021699212492, "clip_ratio/region_mean": 0.014207098283804953, "completions/clipped_ratio": 0.0859375, "completions/max_length": 19.0, "completions/mean_length": 6.2890625, "completions/min_length": 3.0, "epoch": 1.2268656716417912, "grad_norm": 35.84498974880178, "kl": 13.474940237792907, "learning_rate": 7.331365793930698e-05, "loss": 0.23400571942329407, "memory(GiB)": 79.48, "reward": 0.3671875, "reward_std": 0.1965562105178833, "rewards/Response_no_think_reward_1/mean": 0.3671875, "rewards/Response_no_think_reward_1/std": 0.7410472631454468, "step": 101, "train_speed(iter/s)": 0.002642 }, { "clip_ratio/high_max": 0.011945601785555482, "clip_ratio/high_mean": 0.011945601785555482, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.011945601785555482, "epoch": 1.2388059701492538, "grad_norm": 27.884607230951485, "kl": 1.4154490869450456, "learning_rate": 7.139068277792523e-05, "loss": 0.2148125171661377, "memory(GiB)": 79.48, "step": 102, "train_speed(iter/s)": 0.002655 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.007009345572441816, "clip_ratio/low_min": 0.007009345572441816, "clip_ratio/region_mean": 0.007009345572441816, "completions/clipped_ratio": 0.0546875, "completions/max_length": 40.0, "completions/mean_length": 5.640625, "completions/min_length": 3.0, "epoch": 1.2507462686567163, "grad_norm": 2.3687718583378876, "kl": 1.394652240909636, "learning_rate": 6.94791625729983e-05, "loss": 0.018386229872703552, "memory(GiB)": 79.48, "reward": 0.6328125, "reward_std": 0.20033246278762817, "rewards/Response_no_think_reward_1/mean": 0.6328125, "rewards/Response_no_think_reward_1/std": 0.6258360743522644, "step": 103, "train_speed(iter/s)": 0.002645 }, { "clip_ratio/high_max": 0.031393789453431964, "clip_ratio/high_mean": 0.031393789453431964, "clip_ratio/low_mean": 0.01482532313093543, "clip_ratio/low_min": 0.01482532313093543, "clip_ratio/region_mean": 0.04621911211870611, "epoch": 1.2626865671641792, "grad_norm": 1.3586707954485446, "kl": 1.0225394079461694, "learning_rate": 6.757986268290712e-05, "loss": 0.011677918955683708, "memory(GiB)": 79.48, "step": 104, "train_speed(iter/s)": 0.002658 }, { "clip_ratio/high_max": 0.00795477326028049, "clip_ratio/high_mean": 0.00795477326028049, "clip_ratio/low_mean": 0.007858287775889039, "clip_ratio/low_min": 0.007858287775889039, "clip_ratio/region_mean": 0.015813061269000173, "completions/clipped_ratio": 0.0625, "completions/max_length": 32.0, "completions/mean_length": 5.828125, "completions/min_length": 3.0, "epoch": 1.2746268656716417, "grad_norm": 16.43559312212207, "kl": 1.8490474935271664, "learning_rate": 6.569354357311014e-05, "loss": 0.03543264418840408, "memory(GiB)": 79.48, "reward": 0.3671875, "reward_std": 0.31494253873825073, "rewards/Response_no_think_reward_1/mean": 0.3671875, "rewards/Response_no_think_reward_1/std": 0.7923958897590637, "step": 105, "train_speed(iter/s)": 0.002652 }, { "clip_ratio/high_max": 0.011914517963305116, "clip_ratio/high_mean": 0.011914517963305116, "clip_ratio/low_mean": 0.03227056178729981, "clip_ratio/low_min": 0.03227056178729981, "clip_ratio/region_mean": 0.04418508114758879, "epoch": 1.2865671641791045, "grad_norm": 2.5408508655554636, "kl": 1.8903868702007571, "learning_rate": 6.382096051165847e-05, "loss": 0.014127654023468494, "memory(GiB)": 79.48, "step": 106, "train_speed(iter/s)": 0.002665 }, { "clip_ratio/high_max": 0.0030637255404144526, "clip_ratio/high_mean": 0.0030637255404144526, "clip_ratio/low_mean": 0.015822806861251593, "clip_ratio/low_min": 0.015822806861251593, "clip_ratio/region_mean": 0.018886532401666045, "completions/clipped_ratio": 0.109375, "completions/max_length": 47.0, "completions/mean_length": 6.7109375, "completions/min_length": 3.0, "epoch": 1.2985074626865671, "grad_norm": 5.1535076282650945, "kl": 2.8769574181642383, "learning_rate": 6.19628632667923e-05, "loss": 0.038440439850091934, "memory(GiB)": 79.48, "reward": -0.0625, "reward_std": 0.4184814691543579, "rewards/Response_no_think_reward_1/mean": -0.0625, "rewards/Response_no_think_reward_1/std": 0.8394786715507507, "step": 107, "train_speed(iter/s)": 0.002655 }, { "clip_ratio/high_max": 0.011060049437219277, "clip_ratio/high_mean": 0.011060049437219277, "clip_ratio/low_mean": 0.05394765589153394, "clip_ratio/low_min": 0.05394765589153394, "clip_ratio/region_mean": 0.06500770541606471, "epoch": 1.31044776119403, "grad_norm": 38.3461665329109, "kl": 2.019717270624824, "learning_rate": 6.011999580673931e-05, "loss": 0.16980835795402527, "memory(GiB)": 79.48, "step": 108, "train_speed(iter/s)": 0.002668 }, { "clip_ratio/high_max": 0.0016025641234591603, "clip_ratio/high_mean": 0.0016025641234591603, "clip_ratio/low_mean": 0.0032051282469183207, "clip_ratio/low_min": 0.0032051282469183207, "clip_ratio/region_mean": 0.004807692486792803, "completions/clipped_ratio": 0.0078125, "completions/max_length": 25.0, "completions/mean_length": 5.703125, "completions/min_length": 3.0, "epoch": 1.3223880597014925, "grad_norm": 1.9241770555383604, "kl": 0.4095292093356875, "learning_rate": 5.829309600183536e-05, "loss": 0.003778851358219981, "memory(GiB)": 79.48, "reward": 0.453125, "reward_std": 0.24464011192321777, "rewards/Response_no_think_reward_1/mean": 0.453125, "rewards/Response_no_think_reward_1/std": 0.8405039310455322, "step": 109, "train_speed(iter/s)": 0.00266 }, { "clip_ratio/high_max": 0.016826923470944166, "clip_ratio/high_mean": 0.016826923470944166, "clip_ratio/low_mean": 0.025240384973585606, "clip_ratio/low_min": 0.025240384973585606, "clip_ratio/region_mean": 0.042067307978868484, "epoch": 1.3343283582089551, "grad_norm": 4.00720293405374, "kl": 0.3944609015534297, "learning_rate": 5.648289532908666e-05, "loss": 0.0013700753916054964, "memory(GiB)": 79.48, "step": 110, "train_speed(iter/s)": 0.002673 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.012351020704954863, "clip_ratio/low_min": 0.012351020704954863, "clip_ratio/region_mean": 0.012351020704954863, "completions/clipped_ratio": 0.2265625, "completions/max_length": 23.0, "completions/mean_length": 6.03125, "completions/min_length": 3.0, "epoch": 1.346268656716418, "grad_norm": 5.342919033145562, "kl": 6.366508552979212, "learning_rate": 5.4690118579292015e-05, "loss": 0.08252155035734177, "memory(GiB)": 79.48, "reward": -0.0703125, "reward_std": 0.5281283259391785, "rewards/Response_no_think_reward_1/mean": -0.0703125, "rewards/Response_no_think_reward_1/std": 0.7954951524734497, "step": 111, "train_speed(iter/s)": 0.002667 }, { "clip_ratio/high_max": 0.0056201552506536245, "clip_ratio/high_mean": 0.0056201552506536245, "clip_ratio/low_mean": 0.07672008802182972, "clip_ratio/low_min": 0.07672008802182972, "clip_ratio/region_mean": 0.08234024350531399, "epoch": 1.3582089552238805, "grad_norm": 4.841852348859136, "kl": 7.482738017570227, "learning_rate": 5.291548356684177e-05, "loss": 0.06593235582113266, "memory(GiB)": 79.48, "step": 112, "train_speed(iter/s)": 0.00268 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.00446532026398927, "clip_ratio/low_min": 0.00446532026398927, "clip_ratio/region_mean": 0.00446532026398927, "completions/clipped_ratio": 0.046875, "completions/max_length": 10.0, "completions/mean_length": 5.328125, "completions/min_length": 3.0, "epoch": 1.3701492537313433, "grad_norm": 2.4231207405852158, "kl": 2.7402262951763987, "learning_rate": 5.115970084231059e-05, "loss": 0.021689381450414658, "memory(GiB)": 79.48, "reward": 0.4453125, "reward_std": 0.33350807428359985, "rewards/Response_no_think_reward_1/mean": 0.4453125, "rewards/Response_no_think_reward_1/std": 0.7817665934562683, "step": 113, "train_speed(iter/s)": 0.002673 }, { "clip_ratio/high_max": 0.02434239676222205, "clip_ratio/high_mean": 0.02434239676222205, "clip_ratio/low_mean": 0.0223974745022133, "clip_ratio/low_min": 0.0223974745022133, "clip_ratio/region_mean": 0.046739870798774064, "epoch": 1.382089552238806, "grad_norm": 1.0551090300064008, "kl": 2.37436256357978, "learning_rate": 4.9423473407958035e-05, "loss": 0.008349667303264141, "memory(GiB)": 79.48, "step": 114, "train_speed(iter/s)": 0.002685 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.011147994082421064, "clip_ratio/low_min": 0.011147994082421064, "clip_ratio/region_mean": 0.011147994082421064, "completions/clipped_ratio": 0.15625, "completions/max_length": 11.0, "completions/mean_length": 5.3515625, "completions/min_length": 3.0, "epoch": 1.3940298507462687, "grad_norm": 35.484376517766954, "kl": 24.603704601235222, "learning_rate": 4.7707496436252e-05, "loss": 0.3364083468914032, "memory(GiB)": 79.48, "reward": 0.1328125, "reward_std": 0.28117600083351135, "rewards/Response_no_think_reward_1/mean": 0.1328125, "rewards/Response_no_think_reward_1/std": 0.8264437913894653, "step": 115, "train_speed(iter/s)": 0.002678 }, { "clip_ratio/high_max": 0.002314814832061529, "clip_ratio/high_mean": 0.002314814832061529, "clip_ratio/low_mean": 0.0054197743302211165, "clip_ratio/low_min": 0.0054197743302211165, "clip_ratio/region_mean": 0.007734589162282646, "epoch": 1.4059701492537313, "grad_norm": 7.954623939964381, "kl": 12.087648045126116, "learning_rate": 4.601245699152659e-05, "loss": 0.2005119025707245, "memory(GiB)": 79.48, "step": 116, "train_speed(iter/s)": 0.00269 }, { "clip_ratio/high_max": 0.0005434782360680401, "clip_ratio/high_mean": 0.0005434782360680401, "clip_ratio/low_mean": 0.004596828715875745, "clip_ratio/low_min": 0.004596828715875745, "clip_ratio/region_mean": 0.005140306951943785, "completions/clipped_ratio": 0.0703125, "completions/max_length": 40.0, "completions/mean_length": 5.8671875, "completions/min_length": 3.0, "epoch": 1.417910447761194, "grad_norm": 3.80570877135741, "kl": 3.121465804113541, "learning_rate": 4.433903375488697e-05, "loss": 0.044249728322029114, "memory(GiB)": 79.48, "reward": 0.3046875, "reward_std": 0.38101160526275635, "rewards/Response_no_think_reward_1/mean": 0.3046875, "rewards/Response_no_think_reward_1/std": 0.8562746047973633, "step": 117, "train_speed(iter/s)": 0.002684 }, { "clip_ratio/high_max": 0.014024957199580967, "clip_ratio/high_mean": 0.014024957199580967, "clip_ratio/low_mean": 0.0131244600052014, "clip_ratio/low_min": 0.0131244600052014, "clip_ratio/region_mean": 0.02714941732119769, "epoch": 1.4298507462686567, "grad_norm": 3.857626589553114, "kl": 2.146273965074215, "learning_rate": 4.268789675247029e-05, "loss": 0.03236865624785423, "memory(GiB)": 79.48, "step": 118, "train_speed(iter/s)": 0.002695 }, { "clip_ratio/high_max": 0.0012886597542092204, "clip_ratio/high_mean": 0.0012886597542092204, "clip_ratio/low_mean": 0.0051683366764336824, "clip_ratio/low_min": 0.0051683366764336824, "clip_ratio/region_mean": 0.006456996430642903, "completions/clipped_ratio": 0.0703125, "completions/max_length": 22.0, "completions/mean_length": 5.6171875, "completions/min_length": 3.0, "epoch": 1.4417910447761195, "grad_norm": 3.2126971808505513, "kl": 1.1720350683217475, "learning_rate": 4.105970708717244e-05, "loss": 0.018675971776247025, "memory(GiB)": 79.48, "reward": 0.5625, "reward_std": 0.22125522792339325, "rewards/Response_no_think_reward_1/mean": 0.5625, "rewards/Response_no_think_reward_1/std": 0.6490453481674194, "step": 119, "train_speed(iter/s)": 0.002674 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.020605165394954383, "clip_ratio/low_min": 0.020605165394954383, "clip_ratio/region_mean": 0.020605165394954383, "epoch": 1.4537313432835821, "grad_norm": 1.102830732170957, "kl": 1.583265769013451, "learning_rate": 3.945511667394719e-05, "loss": 0.003417772939428687, "memory(GiB)": 79.48, "step": 120, "train_speed(iter/s)": 0.002685 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.007155258092097938, "clip_ratio/low_min": 0.007155258092097938, "clip_ratio/region_mean": 0.007155258092097938, "completions/clipped_ratio": 0.046875, "completions/max_length": 23.0, "completions/mean_length": 5.6640625, "completions/min_length": 3.0, "epoch": 1.4656716417910447, "grad_norm": 2.9093250272424034, "kl": 1.8708921101060696, "learning_rate": 3.787476797878459e-05, "loss": 0.01941162720322609, "memory(GiB)": 79.48, "reward": 0.59375, "reward_std": 0.3198433816432953, "rewards/Response_no_think_reward_1/mean": 0.59375, "rewards/Response_no_think_reward_1/std": 0.692337155342102, "step": 121, "train_speed(iter/s)": 0.002659 }, { "clip_ratio/high_max": 0.02566964237485081, "clip_ratio/high_mean": 0.02566964237485081, "clip_ratio/low_mean": 0.01106150820851326, "clip_ratio/low_min": 0.01106150820851326, "clip_ratio/region_mean": 0.03673115174751729, "epoch": 1.4776119402985075, "grad_norm": 1.6206572311785468, "kl": 2.092067622463219, "learning_rate": 3.631929376147207e-05, "loss": 0.00795831624418497, "memory(GiB)": 79.48, "step": 122, "train_speed(iter/s)": 0.00267 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 16.0, "completions/mean_length": 5.140625, "completions/min_length": 3.0, "epoch": 1.48955223880597, "grad_norm": 1.1898236332850007, "kl": 0.5545606576924911, "learning_rate": 3.47893168222425e-05, "loss": 0.005211046896874905, "memory(GiB)": 79.48, "reward": 0.5078125, "reward_std": 0.2012200653553009, "rewards/Response_no_think_reward_1/mean": 0.5078125, "rewards/Response_no_think_reward_1/std": 0.763292670249939, "step": 123, "train_speed(iter/s)": 0.002638 }, { "clip_ratio/high_max": 0.015350877307355404, "clip_ratio/high_mean": 0.015350877307355404, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.015350877307355404, "epoch": 1.5014925373134327, "grad_norm": 0.3409132689994619, "kl": 0.5577427046882804, "learning_rate": 3.328544975240932e-05, "loss": -0.0002708420215640217, "memory(GiB)": 79.48, "step": 124, "train_speed(iter/s)": 0.002649 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.00601851858664304, "clip_ratio/low_min": 0.00601851858664304, "clip_ratio/region_mean": 0.00601851858664304, "completions/clipped_ratio": 0.0390625, "completions/max_length": 30.0, "completions/mean_length": 5.8671875, "completions/min_length": 3.0, "epoch": 1.5134328358208955, "grad_norm": 5.906541393453947, "kl": 6.567164011168643, "learning_rate": 3.180829468908986e-05, "loss": 0.07308901846408844, "memory(GiB)": 79.48, "reward": 0.3671875, "reward_std": 0.1412346363067627, "rewards/Response_no_think_reward_1/mean": 0.3671875, "rewards/Response_no_think_reward_1/std": 0.8406137228012085, "step": 125, "train_speed(iter/s)": 0.002642 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.010185185354202986, "clip_ratio/low_min": 0.010185185354202986, "clip_ratio/region_mean": 0.010185185354202986, "epoch": 1.5253731343283583, "grad_norm": 1.637348051569756, "kl": 3.2303040275146486, "learning_rate": 3.035844307411384e-05, "loss": 0.04529271274805069, "memory(GiB)": 79.48, "step": 126, "train_speed(iter/s)": 0.002652 }, { "clip_ratio/high_max": 0.00046296295477077365, "clip_ratio/high_mean": 0.00046296295477077365, "clip_ratio/low_mean": 0.004759002127684653, "clip_ratio/low_min": 0.004759002127684653, "clip_ratio/region_mean": 0.0052219650824554265, "completions/clipped_ratio": 0.046875, "completions/max_length": 29.0, "completions/mean_length": 6.4453125, "completions/min_length": 3.0, "epoch": 1.537313432835821, "grad_norm": 1.5814533572332585, "kl": 1.9979073457579943, "learning_rate": 2.8936475417214794e-05, "loss": 0.022465700283646584, "memory(GiB)": 79.48, "reward": 0.3359375, "reward_std": 0.17123225331306458, "rewards/Response_no_think_reward_1/mean": 0.3359375, "rewards/Response_no_think_reward_1/std": 0.7453514337539673, "step": 127, "train_speed(iter/s)": 0.00264 }, { "clip_ratio/high_max": 0.0014710274408571422, "clip_ratio/high_mean": 0.0014710274408571422, "clip_ratio/low_mean": 0.022759197046980262, "clip_ratio/low_min": 0.022759197046980262, "clip_ratio/region_mean": 0.024230224487837404, "epoch": 1.5492537313432835, "grad_norm": 0.9057768060895434, "kl": 1.9242111706989817, "learning_rate": 2.7542961063598104e-05, "loss": 0.013444737531244755, "memory(GiB)": 79.48, "step": 128, "train_speed(iter/s)": 0.002651 }, { "clip_ratio/high_max": 0.0026041667442768812, "clip_ratio/high_mean": 0.0026041667442768812, "clip_ratio/low_mean": 0.010856111068278551, "clip_ratio/low_min": 0.010856111068278551, "clip_ratio/region_mean": 0.013460277812555432, "completions/clipped_ratio": 0.03125, "completions/max_length": 28.0, "completions/mean_length": 5.6875, "completions/min_length": 3.0, "epoch": 1.5611940298507463, "grad_norm": 2.279027191303148, "kl": 1.264391661035006, "learning_rate": 2.617845796597954e-05, "loss": 0.005756520200520754, "memory(GiB)": 79.48, "reward": 0.3671875, "reward_std": 0.15756267309188843, "rewards/Response_no_think_reward_1/mean": 0.3671875, "rewards/Response_no_think_reward_1/std": 0.7410472631454468, "step": 129, "train_speed(iter/s)": 0.002635 }, { "clip_ratio/high_max": 0.0026041667442768812, "clip_ratio/high_mean": 0.0026041667442768812, "clip_ratio/low_mean": 0.06580501515418291, "clip_ratio/low_min": 0.06580501515418291, "clip_ratio/region_mean": 0.06840918306261301, "epoch": 1.573134328358209, "grad_norm": 1.198012219937442, "kl": 1.689065290265944, "learning_rate": 2.484351246118507e-05, "loss": -0.000346488319337368, "memory(GiB)": 79.48, "step": 130, "train_speed(iter/s)": 0.002646 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0059523810632526875, "clip_ratio/low_min": 0.0059523810632526875, "clip_ratio/region_mean": 0.0059523810632526875, "completions/clipped_ratio": 0.0234375, "completions/max_length": 25.0, "completions/mean_length": 5.15625, "completions/min_length": 3.0, "epoch": 1.5850746268656717, "grad_norm": 2.595184247375665, "kl": 0.8083602132865053, "learning_rate": 2.353865905140187e-05, "loss": 0.009201270528137684, "memory(GiB)": 79.48, "reward": 0.4296875, "reward_std": 0.13553348183631897, "rewards/Response_no_think_reward_1/mean": 0.4296875, "rewards/Response_no_think_reward_1/std": 0.7496308088302612, "step": 131, "train_speed(iter/s)": 0.002635 }, { "clip_ratio/high_max": 0.0019841270986944437, "clip_ratio/high_mean": 0.0019841270986944437, "clip_ratio/low_mean": 0.01378506887704134, "clip_ratio/low_min": 0.01378506887704134, "clip_ratio/region_mean": 0.01576919574290514, "epoch": 1.5970149253731343, "grad_norm": 1.0694122716373746, "kl": 0.8849439112927939, "learning_rate": 2.226442019016739e-05, "loss": 0.0032178200781345367, "memory(GiB)": 79.48, "step": 132, "train_speed(iter/s)": 0.002646 }, { "clip_ratio/high_max": 0.0014880952658131719, "clip_ratio/high_mean": 0.0014880952658131719, "clip_ratio/low_mean": 0.004777232185006142, "clip_ratio/low_min": 0.004777232185006142, "clip_ratio/region_mean": 0.0062653274508193135, "completions/clipped_ratio": 0.0703125, "completions/max_length": 51.0, "completions/mean_length": 7.703125, "completions/min_length": 3.0, "epoch": 1.608955223880597, "grad_norm": 8.857193213468985, "kl": 6.557242290626164, "learning_rate": 2.1021306073183167e-05, "loss": 0.09046173840761185, "memory(GiB)": 79.48, "reward": 0.5625, "reward_std": 0.3117782771587372, "rewards/Response_no_think_reward_1/mean": 0.5625, "rewards/Response_no_think_reward_1/std": 0.6728714108467102, "step": 133, "train_speed(iter/s)": 0.002636 }, { "clip_ratio/high_max": 0.0043966451194137335, "clip_ratio/high_mean": 0.0043966451194137335, "clip_ratio/low_mean": 0.0072958533419296145, "clip_ratio/low_min": 0.0072958533419296145, "clip_ratio/region_mean": 0.01169249857775867, "epoch": 1.6208955223880597, "grad_norm": 5.293380513533871, "kl": 4.1661525671806885, "learning_rate": 1.9809814434036e-05, "loss": 0.05591786280274391, "memory(GiB)": 79.48, "step": 134, "train_speed(iter/s)": 0.002646 }, { "clip_ratio/high_max": 0.0006793478387407959, "clip_ratio/high_mean": 0.0006793478387407959, "clip_ratio/low_mean": 0.008976120705483481, "clip_ratio/low_min": 0.008976120705483481, "clip_ratio/region_mean": 0.009655468544224277, "completions/clipped_ratio": 0.0390625, "completions/max_length": 29.0, "completions/mean_length": 6.125, "completions/min_length": 3.0, "epoch": 1.6328358208955223, "grad_norm": 2.599750460948482, "kl": 2.9140283690503566, "learning_rate": 1.863043034490938e-05, "loss": 0.026728810742497444, "memory(GiB)": 79.48, "reward": 0.3828125, "reward_std": 0.2688143849372864, "rewards/Response_no_think_reward_1/mean": 0.3828125, "rewards/Response_no_think_reward_1/std": 0.7542122602462769, "step": 135, "train_speed(iter/s)": 0.002641 }, { "clip_ratio/high_max": 0.0006793478387407959, "clip_ratio/high_mean": 0.0006793478387407959, "clip_ratio/low_mean": 0.01892346324166283, "clip_ratio/low_min": 0.01892346324166283, "clip_ratio/region_mean": 0.019602811022195965, "epoch": 1.644776119402985, "grad_norm": 1.7776881222618184, "kl": 2.936662324536883, "learning_rate": 1.748362602236403e-05, "loss": 0.021627021953463554, "memory(GiB)": 79.48, "step": 136, "train_speed(iter/s)": 0.002651 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0003906250058207661, "clip_ratio/low_min": 0.0003906250058207661, "clip_ratio/region_mean": 0.0003906250058207661, "completions/clipped_ratio": 0.0625, "completions/max_length": 24.0, "completions/mean_length": 6.6953125, "completions/min_length": 3.0, "epoch": 1.6567164179104479, "grad_norm": 2.8008543153134777, "kl": 1.5049916390344151, "learning_rate": 1.63698606382661e-05, "loss": 0.022346211597323418, "memory(GiB)": 79.48, "reward": 0.3828125, "reward_std": 0.15467959642410278, "rewards/Response_no_think_reward_1/mean": 0.3828125, "rewards/Response_no_think_reward_1/std": 0.7436988949775696, "step": 137, "train_speed(iter/s)": 0.002647 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.004379986581625417, "clip_ratio/low_min": 0.004379986581625417, "clip_ratio/region_mean": 0.004379986581625417, "epoch": 1.6686567164179105, "grad_norm": 1.5764765403480743, "kl": 1.4290150789947802, "learning_rate": 1.528958013593801e-05, "loss": 0.0181417278945446, "memory(GiB)": 79.48, "step": 138, "train_speed(iter/s)": 0.002657 }, { "clip_ratio/high_max": 0.0009469697251915932, "clip_ratio/high_mean": 0.0009469697251915932, "clip_ratio/low_mean": 0.009301686193794012, "clip_ratio/low_min": 0.009301686193794012, "clip_ratio/region_mean": 0.010248655918985605, "completions/clipped_ratio": 0.0625, "completions/max_length": 25.0, "completions/mean_length": 5.15625, "completions/min_length": 3.0, "epoch": 1.680597014925373, "grad_norm": 2.987112951446729, "kl": 2.2646760795032606, "learning_rate": 1.4243217051606283e-05, "loss": 0.022022899240255356, "memory(GiB)": 79.48, "reward": 0.5625, "reward_std": 0.3713865876197815, "rewards/Response_no_think_reward_1/mean": 0.5625, "rewards/Response_no_think_reward_1/std": 0.6958821415901184, "step": 139, "train_speed(iter/s)": 0.002652 }, { "clip_ratio/high_max": 0.0010245901066809893, "clip_ratio/high_mean": 0.0010245901066809893, "clip_ratio/low_mean": 0.008475731243379414, "clip_ratio/low_min": 0.008475731243379414, "clip_ratio/region_mean": 0.009500321350060403, "epoch": 1.6925373134328359, "grad_norm": 2.122472644745234, "kl": 2.2440224051242694, "learning_rate": 1.3231190341217081e-05, "loss": 0.017425674945116043, "memory(GiB)": 79.48, "step": 140, "train_speed(iter/s)": 0.002662 } ], "logging_steps": 1, "max_steps": 166, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 5, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 8, "trial_name": null, "trial_params": null }