PEFT
Safetensors
task1f / trainer_state.json
chen
Upload folder using huggingface_hub
bcf5b7d verified
Raw
History Blame
202 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.8740617180984154,
"eval_steps": 500,
"global_step": 280,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0234375,
"completions/max_length": 101.0,
"completions/mean_length": 14.6328125,
"completions/min_length": 2.0,
"epoch": 0.0110803324099723,
"grad_norm": 1.5475432762019699,
"kl": 0.0,
"learning_rate": 2.2222222222222223e-05,
"loss": 5.587935447692871e-09,
"memory(GiB)": 77.28,
"reward": 0.25,
"reward_std": 0.7772719860076904,
"rewards/Response_no_think_reward/mean": 0.25,
"rewards/Response_no_think_reward/std": 1.4795188903808594,
"step": 1,
"train_speed(iter/s)": 0.001043
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"epoch": 0.0221606648199446,
"grad_norm": 1.552548658770951,
"kl": 0.0,
"learning_rate": 4.4444444444444447e-05,
"loss": 5.587935447692871e-09,
"memory(GiB)": 78.06,
"step": 2,
"train_speed(iter/s)": 0.001737
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 101.0,
"completions/mean_length": 17.8828125,
"completions/min_length": 3.0,
"epoch": 0.0332409972299169,
"grad_norm": 1.291839688026328,
"kl": 0.0012106498143111821,
"learning_rate": 6.666666666666667e-05,
"loss": 0.0004578572406899184,
"memory(GiB)": 78.06,
"reward": 0.25,
"reward_std": 0.8250656127929688,
"rewards/Response_no_think_reward/mean": 0.25,
"rewards/Response_no_think_reward/std": 1.4634658098220825,
"step": 3,
"train_speed(iter/s)": 0.001451
},
{
"clip_ratio/high_max": 0.004197790374746546,
"clip_ratio/high_mean": 0.004197790374746546,
"clip_ratio/low_mean": 0.012020835361909121,
"clip_ratio/low_min": 0.012020835361909121,
"clip_ratio/region_mean": 0.01621862585307099,
"epoch": 0.0443213296398892,
"grad_norm": 1.0301802967661304,
"kl": 0.005412253500253428,
"learning_rate": 8.888888888888889e-05,
"loss": -0.005840146914124489,
"memory(GiB)": 78.06,
"step": 4,
"train_speed(iter/s)": 0.001769
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.002237339736893773,
"clip_ratio/low_min": 0.002237339736893773,
"clip_ratio/region_mean": 0.002237339736893773,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 101.0,
"completions/mean_length": 12.5546875,
"completions/min_length": 3.0,
"epoch": 0.055401662049861494,
"grad_norm": 2.027395284218205,
"kl": 0.014184385421685874,
"learning_rate": 0.00011111111111111112,
"loss": 0.0008896891959011555,
"memory(GiB)": 78.06,
"reward": 0.8515625,
"reward_std": 0.5118520259857178,
"rewards/Response_no_think_reward/mean": 0.8515625,
"rewards/Response_no_think_reward/std": 1.4147136211395264,
"step": 5,
"train_speed(iter/s)": 0.00164
},
{
"clip_ratio/high_max": 0.013844632252585143,
"clip_ratio/high_mean": 0.013844632252585143,
"clip_ratio/low_mean": 0.043920744908973575,
"clip_ratio/low_min": 0.043920744908973575,
"clip_ratio/region_mean": 0.05776537861675024,
"epoch": 0.0664819944598338,
"grad_norm": 6.212168397356187,
"kl": 1.7603500080003869,
"learning_rate": 0.00013333333333333334,
"loss": 0.01842591166496277,
"memory(GiB)": 79.98,
"step": 6,
"train_speed(iter/s)": 0.00185
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.001959657238330692,
"clip_ratio/low_min": 0.001959657238330692,
"clip_ratio/region_mean": 0.001959657238330692,
"completions/clipped_ratio": 0.0,
"completions/max_length": 70.0,
"completions/mean_length": 10.359375,
"completions/min_length": 2.0,
"epoch": 0.07756232686980609,
"grad_norm": 3.537674599924329,
"kl": 0.33545287084416486,
"learning_rate": 0.00015555555555555556,
"loss": 0.0018048422643914819,
"memory(GiB)": 79.98,
"reward": 0.53125,
"reward_std": 0.6121620535850525,
"rewards/Response_no_think_reward/mean": 0.53125,
"rewards/Response_no_think_reward/std": 1.3685873746871948,
"step": 7,
"train_speed(iter/s)": 0.001773
},
{
"clip_ratio/high_max": 0.014042179333046079,
"clip_ratio/high_mean": 0.014042179333046079,
"clip_ratio/low_mean": 0.03925089433323592,
"clip_ratio/low_min": 0.03925089433323592,
"clip_ratio/region_mean": 0.053293074015527964,
"epoch": 0.0886426592797784,
"grad_norm": 2.64201486377639,
"kl": 1.295830228133127,
"learning_rate": 0.00017777777777777779,
"loss": 0.011679837480187416,
"memory(GiB)": 79.98,
"step": 8,
"train_speed(iter/s)": 0.001932
},
{
"clip_ratio/high_max": 0.0011001251987181604,
"clip_ratio/high_mean": 0.0011001251987181604,
"clip_ratio/low_mean": 0.008499634364852682,
"clip_ratio/low_min": 0.008499634364852682,
"clip_ratio/region_mean": 0.009599759563570842,
"completions/clipped_ratio": 0.0,
"completions/max_length": 62.0,
"completions/mean_length": 11.4375,
"completions/min_length": 2.0,
"epoch": 0.0997229916897507,
"grad_norm": 4.1929387792795065,
"kl": 2.5014250652166083,
"learning_rate": 0.0002,
"loss": 0.016260012984275818,
"memory(GiB)": 79.98,
"reward": 0.2734375,
"reward_std": 0.8412302732467651,
"rewards/Response_no_think_reward/mean": 0.2734375,
"rewards/Response_no_think_reward/std": 1.384474277496338,
"step": 9,
"train_speed(iter/s)": 0.001887
},
{
"clip_ratio/high_max": 0.02779325417941436,
"clip_ratio/high_mean": 0.02779325417941436,
"clip_ratio/low_mean": 0.07855538238072768,
"clip_ratio/low_min": 0.07855538238072768,
"clip_ratio/region_mean": 0.10634863609448075,
"epoch": 0.11080332409972299,
"grad_norm": 990.7609804346584,
"kl": 1.6530181597918272,
"learning_rate": 0.00019998312416333227,
"loss": 1.336751103401184,
"memory(GiB)": 79.98,
"step": 10,
"train_speed(iter/s)": 0.002015
},
{
"clip_ratio/high_max": 0.001354054023977369,
"clip_ratio/high_mean": 0.001354054023977369,
"clip_ratio/low_mean": 0.004174399145995267,
"clip_ratio/low_min": 0.004174399145995267,
"clip_ratio/region_mean": 0.005528453169972636,
"completions/clipped_ratio": 0.0546875,
"completions/max_length": 101.0,
"completions/mean_length": 26.453125,
"completions/min_length": 3.0,
"epoch": 0.12188365650969529,
"grad_norm": 1.115304569915306,
"kl": 0.3547552889212966,
"learning_rate": 0.00019993250234920636,
"loss": 0.005897670052945614,
"memory(GiB)": 79.98,
"reward": 0.5234375,
"reward_std": 0.876558780670166,
"rewards/Response_no_think_reward/mean": 0.5234375,
"rewards/Response_no_think_reward/std": 1.4251114130020142,
"step": 11,
"train_speed(iter/s)": 0.001964
},
{
"clip_ratio/high_max": 0.02347446102066897,
"clip_ratio/high_mean": 0.02347446102066897,
"clip_ratio/low_mean": 0.0428259114123648,
"clip_ratio/low_min": 0.0428259114123648,
"clip_ratio/region_mean": 0.06630037224385887,
"epoch": 0.1329639889196676,
"grad_norm": 2.183295109715178,
"kl": 0.6218942860141397,
"learning_rate": 0.00019984815164333163,
"loss": 0.007074224762618542,
"memory(GiB)": 79.98,
"step": 12,
"train_speed(iter/s)": 0.00207
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.001206563669256866,
"clip_ratio/low_min": 0.001206563669256866,
"clip_ratio/region_mean": 0.001206563669256866,
"completions/clipped_ratio": 0.0,
"completions/max_length": 83.0,
"completions/mean_length": 14.0234375,
"completions/min_length": 4.0,
"epoch": 0.1440443213296399,
"grad_norm": 1.0424369292135751,
"kl": 0.40942037590866676,
"learning_rate": 0.00019973010051548275,
"loss": 0.004908258095383644,
"memory(GiB)": 79.98,
"reward": 0.5625,
"reward_std": 0.7038782835006714,
"rewards/Response_no_think_reward/mean": 0.5625,
"rewards/Response_no_think_reward/std": 1.2720495462417603,
"step": 13,
"train_speed(iter/s)": 0.002042
},
{
"clip_ratio/high_max": 0.017414433998055756,
"clip_ratio/high_mean": 0.017414433998055756,
"clip_ratio/low_mean": 0.028266766399610788,
"clip_ratio/low_min": 0.028266766399610788,
"clip_ratio/region_mean": 0.04568120092153549,
"epoch": 0.15512465373961218,
"grad_norm": 0.650161789807741,
"kl": 0.4890678570009186,
"learning_rate": 0.00019957838880989078,
"loss": -0.0075666941702365875,
"memory(GiB)": 79.98,
"step": 14,
"train_speed(iter/s)": 0.002135
},
{
"clip_ratio/high_max": 0.0018629207770572975,
"clip_ratio/high_mean": 0.0018629207770572975,
"clip_ratio/low_mean": 0.0069178942940197885,
"clip_ratio/low_min": 0.0069178942940197885,
"clip_ratio/region_mean": 0.00878081505652517,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 101.0,
"completions/mean_length": 17.1953125,
"completions/min_length": 4.0,
"epoch": 0.16620498614958448,
"grad_norm": 2.2362713456466605,
"kl": 0.23374600778333843,
"learning_rate": 0.00019939306773179497,
"loss": 0.0009349192259833217,
"memory(GiB)": 79.98,
"reward": 0.6875,
"reward_std": 0.8529120683670044,
"rewards/Response_no_think_reward/mean": 0.6875,
"rewards/Response_no_think_reward/std": 1.3265905380249023,
"step": 15,
"train_speed(iter/s)": 0.002091
},
{
"clip_ratio/high_max": 0.03511151310522109,
"clip_ratio/high_mean": 0.03511151310522109,
"clip_ratio/low_mean": 0.028677020454779267,
"clip_ratio/low_min": 0.028677020454779267,
"clip_ratio/region_mean": 0.06378853344358504,
"epoch": 0.1772853185595568,
"grad_norm": 3.3548685452904934,
"kl": 0.25148704896855634,
"learning_rate": 0.00019917419983016025,
"loss": 0.017475975677371025,
"memory(GiB)": 79.98,
"step": 16,
"train_speed(iter/s)": 0.002171
},
{
"clip_ratio/high_max": 0.000469924823846668,
"clip_ratio/high_mean": 0.000469924823846668,
"clip_ratio/low_mean": 0.0014688223309349269,
"clip_ratio/low_min": 0.0014688223309349269,
"clip_ratio/region_mean": 0.0019387471547815949,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 101.0,
"completions/mean_length": 18.2265625,
"completions/min_length": 6.0,
"epoch": 0.1883656509695291,
"grad_norm": 0.6996032916694407,
"kl": 0.138063008276049,
"learning_rate": 0.00019892185897656578,
"loss": 0.0021217623725533485,
"memory(GiB)": 79.98,
"reward": 0.5,
"reward_std": 0.5098158717155457,
"rewards/Response_no_think_reward/mean": 0.5,
"rewards/Response_no_think_reward/std": 1.4086347818374634,
"step": 17,
"train_speed(iter/s)": 0.002127
},
{
"clip_ratio/high_max": 0.01048101403284818,
"clip_ratio/high_mean": 0.01048101403284818,
"clip_ratio/low_mean": 0.028478411200921983,
"clip_ratio/low_min": 0.028478411200921983,
"clip_ratio/region_mean": 0.03895942587405443,
"epoch": 0.1994459833795014,
"grad_norm": 0.7437416506383379,
"kl": 0.2438321103884391,
"learning_rate": 0.00019863613034027224,
"loss": -0.007616878021508455,
"memory(GiB)": 79.98,
"step": 18,
"train_speed(iter/s)": 0.002199
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0009733444603625685,
"clip_ratio/low_min": 0.0009733444603625685,
"clip_ratio/region_mean": 0.0009733444603625685,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 101.0,
"completions/mean_length": 20.703125,
"completions/min_length": 6.0,
"epoch": 0.21052631578947367,
"grad_norm": 0.8303775863701255,
"kl": 0.09481111937202513,
"learning_rate": 0.0001983171103594755,
"loss": 0.0022672354243695736,
"memory(GiB)": 79.98,
"reward": -0.078125,
"reward_std": 0.6301807761192322,
"rewards/Response_no_think_reward/mean": -0.078125,
"rewards/Response_no_think_reward/std": 1.3666982650756836,
"step": 19,
"train_speed(iter/s)": 0.002152
},
{
"clip_ratio/high_max": 0.007191620621597394,
"clip_ratio/high_mean": 0.007191620621597394,
"clip_ratio/low_mean": 0.03550086636096239,
"clip_ratio/low_min": 0.03550086636096239,
"clip_ratio/region_mean": 0.0426924874773249,
"epoch": 0.22160664819944598,
"grad_norm": 1.7213808531720889,
"kl": 1.6638920252444223,
"learning_rate": 0.0001979649067087574,
"loss": 0.006861768197268248,
"memory(GiB)": 79.98,
"step": 20,
"train_speed(iter/s)": 0.002217
},
{
"clip_ratio/high_max": 0.0004032258002553135,
"clip_ratio/high_mean": 0.0004032258002553135,
"clip_ratio/low_mean": 0.003614576125983149,
"clip_ratio/low_min": 0.003614576125983149,
"clip_ratio/region_mean": 0.004017801926238462,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 101.0,
"completions/mean_length": 17.390625,
"completions/min_length": 6.0,
"epoch": 0.23268698060941828,
"grad_norm": 1.5808946015405074,
"kl": 0.1687323283404112,
"learning_rate": 0.00019757963826274357,
"loss": 0.003855248913168907,
"memory(GiB)": 79.98,
"reward": 0.5546875,
"reward_std": 0.8033354878425598,
"rewards/Response_no_think_reward/mean": 0.5546875,
"rewards/Response_no_think_reward/std": 1.3328590393066406,
"step": 21,
"train_speed(iter/s)": 0.002189
},
{
"clip_ratio/high_max": 0.012200821249280125,
"clip_ratio/high_mean": 0.012200821249280125,
"clip_ratio/low_mean": 0.04007338697556406,
"clip_ratio/low_min": 0.04007338697556406,
"clip_ratio/region_mean": 0.05227420857409015,
"epoch": 0.24376731301939059,
"grad_norm": 0.8850881940917656,
"kl": 0.48105100472457707,
"learning_rate": 0.0001971614350559814,
"loss": -0.004205920733511448,
"memory(GiB)": 79.98,
"step": 22,
"train_speed(iter/s)": 0.002248
},
{
"clip_ratio/high_max": 0.0008194574620574713,
"clip_ratio/high_mean": 0.0008194574620574713,
"clip_ratio/low_mean": 0.000811688310932368,
"clip_ratio/low_min": 0.000811688310932368,
"clip_ratio/region_mean": 0.0016311457729898393,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 101.0,
"completions/mean_length": 15.28125,
"completions/min_length": 6.0,
"epoch": 0.2548476454293629,
"grad_norm": 0.6954813297644332,
"kl": 0.11993603070732206,
"learning_rate": 0.0001967104382390511,
"loss": 0.001324990182183683,
"memory(GiB)": 79.98,
"reward": 0.78125,
"reward_std": 0.5077463984489441,
"rewards/Response_no_think_reward/mean": 0.78125,
"rewards/Response_no_think_reward/std": 1.3970582485198975,
"step": 23,
"train_speed(iter/s)": 0.002219
},
{
"clip_ratio/high_max": 0.014543175988364965,
"clip_ratio/high_mean": 0.014543175988364965,
"clip_ratio/low_mean": 0.027941336738877,
"clip_ratio/low_min": 0.027941336738877,
"clip_ratio/region_mean": 0.04248451231978834,
"epoch": 0.2659279778393352,
"grad_norm": 0.46891914008721675,
"kl": 0.11759324668673798,
"learning_rate": 0.00019622680003092503,
"loss": -0.009693928062915802,
"memory(GiB)": 79.98,
"step": 24,
"train_speed(iter/s)": 0.002273
},
{
"clip_ratio/high_max": 0.0006530559621751308,
"clip_ratio/high_mean": 0.0006530559621751308,
"clip_ratio/low_mean": 0.0019866162620019168,
"clip_ratio/low_min": 0.0019866162620019168,
"clip_ratio/region_mean": 0.002639672253280878,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 101.0,
"completions/mean_length": 12.9609375,
"completions/min_length": 4.0,
"epoch": 0.2770083102493075,
"grad_norm": 1.333182473379268,
"kl": 0.22027045290451497,
"learning_rate": 0.00019571068366759143,
"loss": 0.0026610023342072964,
"memory(GiB)": 79.98,
"reward": 0.4765625,
"reward_std": 0.8257243633270264,
"rewards/Response_no_think_reward/mean": 0.4765625,
"rewards/Response_no_think_reward/std": 1.3219220638275146,
"step": 25,
"train_speed(iter/s)": 0.002248
},
{
"clip_ratio/high_max": 0.02311275008833036,
"clip_ratio/high_mean": 0.02311275008833036,
"clip_ratio/low_mean": 0.03803046100074425,
"clip_ratio/low_min": 0.03803046100074425,
"clip_ratio/region_mean": 0.06114321056520566,
"epoch": 0.2880886426592798,
"grad_norm": 0.7053648057917502,
"kl": 0.2949459235333052,
"learning_rate": 0.0001951622633469592,
"loss": -0.015641074627637863,
"memory(GiB)": 79.98,
"step": 26,
"train_speed(iter/s)": 0.002297
},
{
"clip_ratio/high_max": 0.0004111842135898769,
"clip_ratio/high_mean": 0.0004111842135898769,
"clip_ratio/low_mean": 0.0027908546617254615,
"clip_ratio/low_min": 0.0027908546617254615,
"clip_ratio/region_mean": 0.0032020388753153384,
"completions/clipped_ratio": 0.0,
"completions/max_length": 85.0,
"completions/mean_length": 16.875,
"completions/min_length": 4.0,
"epoch": 0.29916897506925205,
"grad_norm": 1.544635006921068,
"kl": 0.20233443519100547,
"learning_rate": 0.00019458172417006347,
"loss": 0.0030936466064304113,
"memory(GiB)": 79.98,
"reward": 0.6875,
"reward_std": 0.9086803197860718,
"rewards/Response_no_think_reward/mean": 0.6875,
"rewards/Response_no_think_reward/std": 1.3265905380249023,
"step": 27,
"train_speed(iter/s)": 0.002272
},
{
"clip_ratio/high_max": 0.03639351949095726,
"clip_ratio/high_mean": 0.03639351949095726,
"clip_ratio/low_mean": 0.024818695266731083,
"clip_ratio/low_min": 0.024818695266731083,
"clip_ratio/region_mean": 0.06121221440844238,
"epoch": 0.31024930747922436,
"grad_norm": 2.0012174050572105,
"kl": 0.24312824057415128,
"learning_rate": 0.00019396926207859084,
"loss": -0.008060472086071968,
"memory(GiB)": 79.98,
"step": 28,
"train_speed(iter/s)": 0.002319
},
{
"clip_ratio/high_max": 0.0007382866751868278,
"clip_ratio/high_mean": 0.0007382866751868278,
"clip_ratio/low_mean": 0.0024169938114937395,
"clip_ratio/low_min": 0.0024169938114937395,
"clip_ratio/region_mean": 0.0031552804866805673,
"completions/clipped_ratio": 0.0234375,
"completions/max_length": 101.0,
"completions/mean_length": 23.4140625,
"completions/min_length": 3.0,
"epoch": 0.32132963988919666,
"grad_norm": 1.0333627248580772,
"kl": 0.19911292963661253,
"learning_rate": 0.0001933250837887457,
"loss": 0.004103388637304306,
"memory(GiB)": 79.98,
"reward": 0.6640625,
"reward_std": 0.7995060086250305,
"rewards/Response_no_think_reward/mean": 0.6640625,
"rewards/Response_no_think_reward/std": 1.4323447942733765,
"step": 29,
"train_speed(iter/s)": 0.002285
},
{
"clip_ratio/high_max": 0.021052728639915586,
"clip_ratio/high_mean": 0.021052728639915586,
"clip_ratio/low_mean": 0.03886253567179665,
"clip_ratio/low_min": 0.03886253567179665,
"clip_ratio/region_mean": 0.05991526402067393,
"epoch": 0.33240997229916897,
"grad_norm": 0.4744156832935017,
"kl": 0.2653088476508856,
"learning_rate": 0.00019264940672148018,
"loss": -0.014724130742251873,
"memory(GiB)": 79.98,
"step": 30,
"train_speed(iter/s)": 0.002328
},
{
"clip_ratio/high_max": 0.0008336337341461331,
"clip_ratio/high_mean": 0.0008336337341461331,
"clip_ratio/low_mean": 0.0028033541166223586,
"clip_ratio/low_min": 0.0028033541166223586,
"clip_ratio/region_mean": 0.0036369878507684916,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 101.0,
"completions/mean_length": 17.8125,
"completions/min_length": 3.0,
"epoch": 0.34349030470914127,
"grad_norm": 1.3971369328491496,
"kl": 0.3057649952825159,
"learning_rate": 0.0001919424589291108,
"loss": 0.0056169466115534306,
"memory(GiB)": 80.03,
"reward": 0.4296875,
"reward_std": 0.8740850687026978,
"rewards/Response_no_think_reward/mean": 0.4296875,
"rewards/Response_no_think_reward/std": 1.3555577993392944,
"step": 31,
"train_speed(iter/s)": 0.002304
},
{
"clip_ratio/high_max": 0.013716876972466707,
"clip_ratio/high_mean": 0.013716876972466707,
"clip_ratio/low_mean": 0.05669466912513599,
"clip_ratio/low_min": 0.05669466912513599,
"clip_ratio/region_mean": 0.07041154580656439,
"epoch": 0.3545706371191136,
"grad_norm": 0.7437646652660285,
"kl": 0.3698675720952451,
"learning_rate": 0.00019120447901834706,
"loss": -0.013283709064126015,
"memory(GiB)": 80.03,
"step": 32,
"train_speed(iter/s)": 0.002345
},
{
"clip_ratio/high_max": 0.0013764221512246877,
"clip_ratio/high_mean": 0.0013764221512246877,
"clip_ratio/low_mean": 0.0013627433363581076,
"clip_ratio/low_min": 0.0013627433363581076,
"clip_ratio/region_mean": 0.0027391654875827953,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 101.0,
"completions/mean_length": 24.609375,
"completions/min_length": 4.0,
"epoch": 0.3656509695290859,
"grad_norm": 0.8795930368140337,
"kl": 0.22658177139237523,
"learning_rate": 0.00019043571606975777,
"loss": 0.0019196830689907074,
"memory(GiB)": 80.03,
"reward": 0.4140625,
"reward_std": 0.8300054669380188,
"rewards/Response_no_think_reward/mean": 0.4140625,
"rewards/Response_no_think_reward/std": 1.258216142654419,
"step": 33,
"train_speed(iter/s)": 0.002323
},
{
"clip_ratio/high_max": 0.016442283987998962,
"clip_ratio/high_mean": 0.016442283987998962,
"clip_ratio/low_mean": 0.05633212422253564,
"clip_ratio/low_min": 0.05633212422253564,
"clip_ratio/region_mean": 0.07277440826874226,
"epoch": 0.3767313019390582,
"grad_norm": 0.5188690402432328,
"kl": 0.23683911142870784,
"learning_rate": 0.00018963642955370201,
"loss": -0.016352392733097076,
"memory(GiB)": 80.03,
"step": 34,
"train_speed(iter/s)": 0.002362
},
{
"clip_ratio/high_max": 0.0025397460121894255,
"clip_ratio/high_mean": 0.0025397460121894255,
"clip_ratio/low_mean": 0.00378477135382127,
"clip_ratio/low_min": 0.00378477135382127,
"clip_ratio/region_mean": 0.006324517366010696,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 101.0,
"completions/mean_length": 23.375,
"completions/min_length": 3.0,
"epoch": 0.3878116343490305,
"grad_norm": 0.7751350107093148,
"kl": 0.21053988160565495,
"learning_rate": 0.00018880688924275378,
"loss": 0.001979985274374485,
"memory(GiB)": 80.03,
"reward": 0.25,
"reward_std": 0.8051205277442932,
"rewards/Response_no_think_reward/mean": 0.25,
"rewards/Response_no_think_reward/std": 1.3101662397384644,
"step": 35,
"train_speed(iter/s)": 0.00234
},
{
"clip_ratio/high_max": 0.02383261898648925,
"clip_ratio/high_mean": 0.02383261898648925,
"clip_ratio/low_mean": 0.02296329999808222,
"clip_ratio/low_min": 0.02296329999808222,
"clip_ratio/region_mean": 0.046795917907729745,
"epoch": 0.3988919667590028,
"grad_norm": 0.6919043847160915,
"kl": 0.2092050458304584,
"learning_rate": 0.0001879473751206489,
"loss": -0.016633104532957077,
"memory(GiB)": 80.03,
"step": 36,
"train_speed(iter/s)": 0.002376
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0003396739193703979,
"clip_ratio/low_min": 0.0003396739193703979,
"clip_ratio/region_mean": 0.0003396739193703979,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 101.0,
"completions/mean_length": 16.8828125,
"completions/min_length": 3.0,
"epoch": 0.4099722991689751,
"grad_norm": 1.0548464052821087,
"kl": 0.20961805986007676,
"learning_rate": 0.00018705817728778624,
"loss": 0.003657686058431864,
"memory(GiB)": 80.03,
"reward": 0.953125,
"reward_std": 0.6187193393707275,
"rewards/Response_no_think_reward/mean": 0.953125,
"rewards/Response_no_think_reward/std": 1.1961840391159058,
"step": 37,
"train_speed(iter/s)": 0.002358
},
{
"clip_ratio/high_max": 0.02387295541120693,
"clip_ratio/high_mean": 0.02387295541120693,
"clip_ratio/low_mean": 0.030282753868959844,
"clip_ratio/low_min": 0.030282753868959844,
"clip_ratio/region_mean": 0.05415570852346718,
"epoch": 0.42105263157894735,
"grad_norm": 0.49371052672691246,
"kl": 0.24616074899677187,
"learning_rate": 0.00018613959586331362,
"loss": -0.012075964361429214,
"memory(GiB)": 80.03,
"step": 38,
"train_speed(iter/s)": 0.002393
},
{
"clip_ratio/high_max": 0.0013275333330966532,
"clip_ratio/high_mean": 0.0013275333330966532,
"clip_ratio/low_mean": 0.0013904034567531198,
"clip_ratio/low_min": 0.0013904034567531198,
"clip_ratio/region_mean": 0.002717936789849773,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 101.0,
"completions/mean_length": 21.6015625,
"completions/min_length": 4.0,
"epoch": 0.43213296398891965,
"grad_norm": 0.972842541028031,
"kl": 0.16011726018041372,
"learning_rate": 0.00018519194088383273,
"loss": 0.001440724590793252,
"memory(GiB)": 80.03,
"reward": 0.625,
"reward_std": 0.6670520305633545,
"rewards/Response_no_think_reward/mean": 0.625,
"rewards/Response_no_think_reward/std": 1.3457428216934204,
"step": 39,
"train_speed(iter/s)": 0.002371
},
{
"clip_ratio/high_max": 0.03226059180451557,
"clip_ratio/high_mean": 0.03226059180451557,
"clip_ratio/low_mean": 0.03314233338460326,
"clip_ratio/low_min": 0.03314233338460326,
"clip_ratio/region_mean": 0.0654029252473265,
"epoch": 0.44321329639889195,
"grad_norm": 0.5253408277855696,
"kl": 0.18682625680230558,
"learning_rate": 0.00018421553219875658,
"loss": -0.013099671341478825,
"memory(GiB)": 80.03,
"step": 40,
"train_speed(iter/s)": 0.002404
},
{
"clip_ratio/high_max": 0.00029620854184031487,
"clip_ratio/high_mean": 0.00029620854184031487,
"clip_ratio/low_mean": 0.0009311849280493334,
"clip_ratio/low_min": 0.0009311849280493334,
"clip_ratio/region_mean": 0.0012273934698896483,
"completions/clipped_ratio": 0.0,
"completions/max_length": 88.0,
"completions/mean_length": 17.5625,
"completions/min_length": 5.0,
"epoch": 0.45429362880886426,
"grad_norm": 1.2919745010410586,
"kl": 0.2366366102360189,
"learning_rate": 0.00018321069936235503,
"loss": 0.001985038397833705,
"memory(GiB)": 80.03,
"reward": 0.859375,
"reward_std": 0.6107450723648071,
"rewards/Response_no_think_reward/mean": 0.859375,
"rewards/Response_no_think_reward/std": 1.4071491956710815,
"step": 41,
"train_speed(iter/s)": 0.002379
},
{
"clip_ratio/high_max": 0.01783788768807426,
"clip_ratio/high_mean": 0.01783788768807426,
"clip_ratio/low_mean": 0.044289187353570014,
"clip_ratio/low_min": 0.044289187353570014,
"clip_ratio/region_mean": 0.06212707597296685,
"epoch": 0.46537396121883656,
"grad_norm": 1.7719321167278534,
"kl": 0.6719344789162278,
"learning_rate": 0.0001821777815225245,
"loss": -0.008167732506990433,
"memory(GiB)": 80.03,
"step": 42,
"train_speed(iter/s)": 0.00241
},
{
"clip_ratio/high_max": 0.00036231885314919055,
"clip_ratio/high_mean": 0.00036231885314919055,
"clip_ratio/low_mean": 0.002238474931800738,
"clip_ratio/low_min": 0.002238474931800738,
"clip_ratio/region_mean": 0.0026007937849499285,
"completions/clipped_ratio": 0.0,
"completions/max_length": 97.0,
"completions/mean_length": 15.875,
"completions/min_length": 6.0,
"epoch": 0.47645429362880887,
"grad_norm": 1.1682612472028975,
"kl": 0.2416230053640902,
"learning_rate": 0.00018111712730632022,
"loss": 0.0018095734994858503,
"memory(GiB)": 80.03,
"reward": 0.0859375,
"reward_std": 0.39637458324432373,
"rewards/Response_no_think_reward/mean": 0.0859375,
"rewards/Response_no_think_reward/std": 0.9962713122367859,
"step": 43,
"train_speed(iter/s)": 0.002397
},
{
"clip_ratio/high_max": 0.007687599485507235,
"clip_ratio/high_mean": 0.007687599485507235,
"clip_ratio/low_mean": 0.042899149731965736,
"clip_ratio/low_min": 0.042899149731965736,
"clip_ratio/region_mean": 0.05058674863539636,
"epoch": 0.48753462603878117,
"grad_norm": 17.524605028595435,
"kl": 15.062655651359819,
"learning_rate": 0.00018002909470228842,
"loss": 0.09481670707464218,
"memory(GiB)": 80.03,
"step": 44,
"train_speed(iter/s)": 0.002427
},
{
"clip_ratio/high_max": 0.0012922932510264218,
"clip_ratio/high_mean": 0.0012922932510264218,
"clip_ratio/low_mean": 0.002554390055593103,
"clip_ratio/low_min": 0.002554390055593103,
"clip_ratio/region_mean": 0.003846683306619525,
"completions/clipped_ratio": 0.0,
"completions/max_length": 32.0,
"completions/mean_length": 8.546875,
"completions/min_length": 4.0,
"epoch": 0.4986149584487535,
"grad_norm": 1.474323820635427,
"kl": 0.7951482257340103,
"learning_rate": 0.00017891405093963938,
"loss": 0.008442065678536892,
"memory(GiB)": 80.03,
"reward": 0.171875,
"reward_std": 0.540536105632782,
"rewards/Response_no_think_reward/mean": 0.171875,
"rewards/Response_no_think_reward/std": 0.9648089408874512,
"step": 45,
"train_speed(iter/s)": 0.002416
},
{
"clip_ratio/high_max": 0.01782548933988437,
"clip_ratio/high_mean": 0.01782548933988437,
"clip_ratio/low_mean": 0.04517949424916878,
"clip_ratio/low_min": 0.04517949424916878,
"clip_ratio/region_mean": 0.06300498393829912,
"epoch": 0.5096952908587258,
"grad_norm": 23.18489815639863,
"kl": 20.399557466851547,
"learning_rate": 0.0001777723723643014,
"loss": 0.15100935101509094,
"memory(GiB)": 80.03,
"step": 46,
"train_speed(iter/s)": 0.002445
},
{
"clip_ratio/high_max": 0.0001338329748250544,
"clip_ratio/high_mean": 0.0001338329748250544,
"clip_ratio/low_mean": 0.0020056332577951252,
"clip_ratio/low_min": 0.0020056332577951252,
"clip_ratio/region_mean": 0.0021394662326201797,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 101.0,
"completions/mean_length": 11.8203125,
"completions/min_length": 4.0,
"epoch": 0.5207756232686981,
"grad_norm": 1.9101810703272282,
"kl": 0.8325624349527061,
"learning_rate": 0.0001766044443118978,
"loss": 0.01317879930138588,
"memory(GiB)": 80.03,
"reward": 0.21875,
"reward_std": 0.5618736743927002,
"rewards/Response_no_think_reward/mean": 0.21875,
"rewards/Response_no_think_reward/std": 0.9301384091377258,
"step": 47,
"train_speed(iter/s)": 0.002435
},
{
"clip_ratio/high_max": 0.01570215745596215,
"clip_ratio/high_mean": 0.01570215745596215,
"clip_ratio/low_mean": 0.01864259922876954,
"clip_ratio/low_min": 0.01864259922876954,
"clip_ratio/region_mean": 0.03434475651010871,
"epoch": 0.5318559556786704,
"grad_norm": 5.211743253538076,
"kl": 0.4838231955654919,
"learning_rate": 0.00017541066097768963,
"loss": 0.03044246882200241,
"memory(GiB)": 80.03,
"step": 48,
"train_speed(iter/s)": 0.002462
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.002905012297560461,
"clip_ratio/low_min": 0.002905012297560461,
"clip_ratio/region_mean": 0.002905012297560461,
"completions/clipped_ratio": 0.0390625,
"completions/max_length": 101.0,
"completions/mean_length": 17.7265625,
"completions/min_length": 4.0,
"epoch": 0.5429362880886427,
"grad_norm": 0.9459153229739418,
"kl": 0.33009129445417784,
"learning_rate": 0.00017419142528352817,
"loss": 0.004404420033097267,
"memory(GiB)": 80.03,
"reward": -0.0859375,
"reward_std": 0.547653079032898,
"rewards/Response_no_think_reward/mean": -0.0859375,
"rewards/Response_no_think_reward/std": 0.9138250946998596,
"step": 49,
"train_speed(iter/s)": 0.002452
},
{
"clip_ratio/high_max": 0.00849696435034275,
"clip_ratio/high_mean": 0.00849696435034275,
"clip_ratio/low_mean": 0.059440263896249235,
"clip_ratio/low_min": 0.059440263896249235,
"clip_ratio/region_mean": 0.06793722766451538,
"epoch": 0.554016620498615,
"grad_norm": 1.5192885268898135,
"kl": 0.5284001431518845,
"learning_rate": 0.0001729471487418621,
"loss": -0.012666964903473854,
"memory(GiB)": 80.03,
"step": 50,
"train_speed(iter/s)": 0.002478
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0012755101779475808,
"clip_ratio/low_min": 0.0012755101779475808,
"clip_ratio/region_mean": 0.0012755101779475808,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 101.0,
"completions/mean_length": 12.640625,
"completions/min_length": 3.0,
"epoch": 0.5650969529085873,
"grad_norm": 1.7932835802898264,
"kl": 0.582448753528297,
"learning_rate": 0.00017167825131684513,
"loss": 0.008432275615632534,
"memory(GiB)": 80.03,
"reward": 0.15625,
"reward_std": 0.7085258960723877,
"rewards/Response_no_think_reward/mean": 0.15625,
"rewards/Response_no_think_reward/std": 1.0228685140609741,
"step": 51,
"train_speed(iter/s)": 0.002465
},
{
"clip_ratio/high_max": 0.006597792147658765,
"clip_ratio/high_mean": 0.006597792147658765,
"clip_ratio/low_mean": 0.049801092012785375,
"clip_ratio/low_min": 0.049801092012785375,
"clip_ratio/region_mean": 0.05639888462610543,
"epoch": 0.5761772853185596,
"grad_norm": 0.8422307837338449,
"kl": 0.7035694038495421,
"learning_rate": 0.00017038516128259115,
"loss": -0.011608053930103779,
"memory(GiB)": 80.03,
"step": 52,
"train_speed(iter/s)": 0.00249
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0005558648990700021,
"clip_ratio/low_min": 0.0005558648990700021,
"clip_ratio/region_mean": 0.0005558648990700021,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 101.0,
"completions/mean_length": 12.5,
"completions/min_length": 4.0,
"epoch": 0.5872576177285319,
"grad_norm": 1.0211580850819229,
"kl": 0.7616109761074767,
"learning_rate": 0.00016906831507862443,
"loss": 0.005634145811200142,
"memory(GiB)": 80.03,
"reward": 0.1640625,
"reward_std": 0.70704185962677,
"rewards/Response_no_think_reward/mean": 0.1640625,
"rewards/Response_no_think_reward/std": 0.9702450633049011,
"step": 53,
"train_speed(iter/s)": 0.002477
},
{
"clip_ratio/high_max": 0.02744574609096162,
"clip_ratio/high_mean": 0.02744574609096162,
"clip_ratio/low_mean": 0.04221567645436153,
"clip_ratio/low_min": 0.04221567645436153,
"clip_ratio/region_mean": 0.06966142146848142,
"epoch": 0.5983379501385041,
"grad_norm": 0.5808426269905869,
"kl": 0.801087921798171,
"learning_rate": 0.00016772815716257412,
"loss": -0.01366308145225048,
"memory(GiB)": 80.03,
"step": 54,
"train_speed(iter/s)": 0.002502
},
{
"clip_ratio/high_max": 0.0003881987649947405,
"clip_ratio/high_mean": 0.0003881987649947405,
"clip_ratio/low_mean": 0.001932911021867767,
"clip_ratio/low_min": 0.001932911021867767,
"clip_ratio/region_mean": 0.0023211097868625075,
"completions/clipped_ratio": 0.0390625,
"completions/max_length": 101.0,
"completions/mean_length": 18.9921875,
"completions/min_length": 6.0,
"epoch": 0.6094182825484764,
"grad_norm": 1.1265096543789663,
"kl": 0.5226203491911292,
"learning_rate": 0.00016636513986016213,
"loss": 0.007094700820744038,
"memory(GiB)": 80.03,
"reward": 0.1875,
"reward_std": 0.7182328104972839,
"rewards/Response_no_think_reward/mean": 0.1875,
"rewards/Response_no_think_reward/std": 1.0480577945709229,
"step": 55,
"train_speed(iter/s)": 0.00249
},
{
"clip_ratio/high_max": 0.011908911721548066,
"clip_ratio/high_mean": 0.011908911721548066,
"clip_ratio/low_mean": 0.05817525731981732,
"clip_ratio/low_min": 0.05817525731981732,
"clip_ratio/region_mean": 0.07008416869211942,
"epoch": 0.6204986149584487,
"grad_norm": 0.5560920258062684,
"kl": 0.5747523186728358,
"learning_rate": 0.000164979723212536,
"loss": -0.014954826794564724,
"memory(GiB)": 80.03,
"step": 56,
"train_speed(iter/s)": 0.002513
},
{
"clip_ratio/high_max": 0.002692167239729315,
"clip_ratio/high_mean": 0.002692167239729315,
"clip_ratio/low_mean": 0.0006428283377317712,
"clip_ratio/low_min": 0.0006428283377317712,
"clip_ratio/region_mean": 0.003334995577461086,
"completions/clipped_ratio": 0.0390625,
"completions/max_length": 101.0,
"completions/mean_length": 16.53125,
"completions/min_length": 6.0,
"epoch": 0.631578947368421,
"grad_norm": 1.5596809103877662,
"kl": 0.6855434570461512,
"learning_rate": 0.00016357237482099684,
"loss": 0.0062956069596111774,
"memory(GiB)": 80.03,
"reward": 0.53125,
"reward_std": 0.5907745361328125,
"rewards/Response_no_think_reward/mean": 0.53125,
"rewards/Response_no_think_reward/std": 1.0790598392486572,
"step": 57,
"train_speed(iter/s)": 0.002501
},
{
"clip_ratio/high_max": 0.0316368987550959,
"clip_ratio/high_mean": 0.0316368987550959,
"clip_ratio/low_mean": 0.015557856269879267,
"clip_ratio/low_min": 0.015557856269879267,
"clip_ratio/region_mean": 0.04719475514139049,
"epoch": 0.6426592797783933,
"grad_norm": 0.950735686233936,
"kl": 0.5240823943167925,
"learning_rate": 0.00016214356968917648,
"loss": -0.015531505458056927,
"memory(GiB)": 80.03,
"step": 58,
"train_speed(iter/s)": 0.002524
},
{
"clip_ratio/high_max": 0.00011467889999039471,
"clip_ratio/high_mean": 0.00011467889999039471,
"clip_ratio/low_mean": 0.0004376750875962898,
"clip_ratio/low_min": 0.0004376750875962898,
"clip_ratio/region_mean": 0.0005523539875866845,
"completions/clipped_ratio": 0.078125,
"completions/max_length": 101.0,
"completions/mean_length": 23.9140625,
"completions/min_length": 6.0,
"epoch": 0.6537396121883656,
"grad_norm": 1.3162721482480142,
"kl": 0.5214177745606321,
"learning_rate": 0.00016069379006271566,
"loss": 0.004921327345073223,
"memory(GiB)": 80.03,
"reward": -0.0625,
"reward_std": 0.6303451657295227,
"rewards/Response_no_think_reward/mean": -0.0625,
"rewards/Response_no_think_reward/std": 1.0019665956497192,
"step": 59,
"train_speed(iter/s)": 0.002511
},
{
"clip_ratio/high_max": 0.00810479320352897,
"clip_ratio/high_mean": 0.00810479320352897,
"clip_ratio/low_mean": 0.05729365168372169,
"clip_ratio/low_min": 0.05729365168372169,
"clip_ratio/region_mean": 0.06539844395592809,
"epoch": 0.6648199445983379,
"grad_norm": 0.5733548474442324,
"kl": 0.6363338100200053,
"learning_rate": 0.00015922352526649803,
"loss": -0.021113965660333633,
"memory(GiB)": 80.03,
"step": 60,
"train_speed(iter/s)": 0.002532
},
{
"clip_ratio/high_max": 0.0005996339968987741,
"clip_ratio/high_mean": 0.0005996339968987741,
"clip_ratio/low_mean": 0.004901745676761493,
"clip_ratio/low_min": 0.004901745676761493,
"clip_ratio/region_mean": 0.00550137969548814,
"completions/clipped_ratio": 0.0859375,
"completions/max_length": 101.0,
"completions/mean_length": 22.375,
"completions/min_length": 2.0,
"epoch": 0.6759002770083102,
"grad_norm": 1.887884786225259,
"kl": 2.07791917472332,
"learning_rate": 0.00015773327153949465,
"loss": 0.008165515027940273,
"memory(GiB)": 80.03,
"reward": 0.40625,
"reward_std": 0.5973243117332458,
"rewards/Response_no_think_reward/mean": 0.40625,
"rewards/Response_no_think_reward/std": 1.186787486076355,
"step": 61,
"train_speed(iter/s)": 0.002506
},
{
"clip_ratio/high_max": 0.017942053091246635,
"clip_ratio/high_mean": 0.017942053091246635,
"clip_ratio/low_mean": 0.06714771036058664,
"clip_ratio/low_min": 0.06714771036058664,
"clip_ratio/region_mean": 0.08508976292796433,
"epoch": 0.6869806094182825,
"grad_norm": 11.312330346219078,
"kl": 0.5888316835043952,
"learning_rate": 0.00015622353186727544,
"loss": 0.04619387909770012,
"memory(GiB)": 80.03,
"step": 62,
"train_speed(iter/s)": 0.002527
},
{
"clip_ratio/high_max": 0.00020032051543239504,
"clip_ratio/high_mean": 0.00020032051543239504,
"clip_ratio/low_mean": 0.001202335930429399,
"clip_ratio/low_min": 0.001202335930429399,
"clip_ratio/region_mean": 0.001402656445861794,
"completions/clipped_ratio": 0.0546875,
"completions/max_length": 101.0,
"completions/mean_length": 18.5859375,
"completions/min_length": 2.0,
"epoch": 0.6980609418282548,
"grad_norm": 1.9804020858052087,
"kl": 6.258792589243967,
"learning_rate": 0.00015469481581224272,
"loss": 0.014128579758107662,
"memory(GiB)": 80.03,
"reward": 0.78125,
"reward_std": 0.5936684608459473,
"rewards/Response_no_think_reward/mean": 0.78125,
"rewards/Response_no_think_reward/std": 1.235546350479126,
"step": 63,
"train_speed(iter/s)": 0.002486
},
{
"clip_ratio/high_max": 0.020077986438991502,
"clip_ratio/high_mean": 0.020077986438991502,
"clip_ratio/low_mean": 0.12254823022522032,
"clip_ratio/low_min": 0.12254823022522032,
"clip_ratio/region_mean": 0.142626216635108,
"epoch": 0.7091412742382271,
"grad_norm": 1.5460664241155249,
"kl": 5.241092938755173,
"learning_rate": 0.0001531476393416456,
"loss": -0.0033248686231672764,
"memory(GiB)": 80.03,
"step": 64,
"train_speed(iter/s)": 0.002506
},
{
"clip_ratio/high_max": 0.0006774475477868691,
"clip_ratio/high_mean": 0.0006774475477868691,
"clip_ratio/low_mean": 0.0009178321633953601,
"clip_ratio/low_min": 0.0009178321633953601,
"clip_ratio/region_mean": 0.0015952797257341444,
"completions/clipped_ratio": 0.0390625,
"completions/max_length": 101.0,
"completions/mean_length": 15.1484375,
"completions/min_length": 6.0,
"epoch": 0.7202216066481995,
"grad_norm": 1.528383760465238,
"kl": 1.888367731589824,
"learning_rate": 0.00015158252465343242,
"loss": 0.010861902497708797,
"memory(GiB)": 80.03,
"reward": 0.59375,
"reward_std": 0.5738716125488281,
"rewards/Response_no_think_reward/mean": 0.59375,
"rewards/Response_no_think_reward/std": 1.1462881565093994,
"step": 65,
"train_speed(iter/s)": 0.002444
},
{
"clip_ratio/high_max": 0.05604529404081404,
"clip_ratio/high_mean": 0.05604529404081404,
"clip_ratio/low_mean": 0.012011443439405411,
"clip_ratio/low_min": 0.012011443439405411,
"clip_ratio/region_mean": 0.06805673893541098,
"epoch": 0.7313019390581718,
"grad_norm": 0.9299498266912626,
"kl": 1.0373663480422692,
"learning_rate": 0.00015000000000000001,
"loss": -0.001186850480735302,
"memory(GiB)": 80.03,
"step": 66,
"train_speed(iter/s)": 0.002463
},
{
"clip_ratio/high_max": 0.006279462773818523,
"clip_ratio/high_mean": 0.006279462773818523,
"clip_ratio/low_mean": 0.006620214961003512,
"clip_ratio/low_min": 0.006620214961003512,
"clip_ratio/region_mean": 0.012899677676614374,
"completions/clipped_ratio": 0.0546875,
"completions/max_length": 101.0,
"completions/mean_length": 17.5234375,
"completions/min_length": 2.0,
"epoch": 0.7423822714681441,
"grad_norm": 3.0195311219652377,
"kl": 1.4996049946639687,
"learning_rate": 0.0001484005995098999,
"loss": 0.0103817880153656,
"memory(GiB)": 80.03,
"reward": 0.2421875,
"reward_std": 0.5205168724060059,
"rewards/Response_no_think_reward/mean": 0.2421875,
"rewards/Response_no_think_reward/std": 1.2595843076705933,
"step": 67,
"train_speed(iter/s)": 0.002399
},
{
"clip_ratio/high_max": 0.030079254298470914,
"clip_ratio/high_mean": 0.030079254298470914,
"clip_ratio/low_mean": 0.10815927106887102,
"clip_ratio/low_min": 0.10815927106887102,
"clip_ratio/region_mean": 0.1382385252509266,
"epoch": 0.7534626038781164,
"grad_norm": 7.7164901906176375,
"kl": 4.463950714329258,
"learning_rate": 0.0001467848630075608,
"loss": 0.0073772999458014965,
"memory(GiB)": 80.03,
"step": 68,
"train_speed(iter/s)": 0.002418
},
{
"clip_ratio/high_max": 0.0009369817780680023,
"clip_ratio/high_mean": 0.0009369817780680023,
"clip_ratio/low_mean": 0.006284750299528241,
"clip_ratio/low_min": 0.006284750299528241,
"clip_ratio/region_mean": 0.007221732055768371,
"completions/clipped_ratio": 0.1484375,
"completions/max_length": 101.0,
"completions/mean_length": 26.9296875,
"completions/min_length": 3.0,
"epoch": 0.7645429362880887,
"grad_norm": 2.034534758963297,
"kl": 2.321827916195616,
"learning_rate": 0.00014515333583108896,
"loss": 0.01671188324689865,
"memory(GiB)": 80.03,
"reward": 0.5390625,
"reward_std": 0.4874863028526306,
"rewards/Response_no_think_reward/mean": 0.5390625,
"rewards/Response_no_think_reward/std": 1.3095791339874268,
"step": 69,
"train_speed(iter/s)": 0.002373
},
{
"clip_ratio/high_max": 0.012032406637445092,
"clip_ratio/high_mean": 0.012032406637445092,
"clip_ratio/low_mean": 0.11593639780767262,
"clip_ratio/low_min": 0.11593639780767262,
"clip_ratio/region_mean": 0.1279688044451177,
"epoch": 0.775623268698061,
"grad_norm": 1.497770517232466,
"kl": 3.323778461664915,
"learning_rate": 0.00014350656864820733,
"loss": 0.0011269270908087492,
"memory(GiB)": 80.03,
"step": 70,
"train_speed(iter/s)": 0.002392
},
{
"clip_ratio/high_max": 0.000255623715929687,
"clip_ratio/high_mean": 0.000255623715929687,
"clip_ratio/low_mean": 0.005516766890650615,
"clip_ratio/low_min": 0.005516766890650615,
"clip_ratio/region_mean": 0.005772390664787963,
"completions/clipped_ratio": 0.09375,
"completions/max_length": 101.0,
"completions/mean_length": 17.25,
"completions/min_length": 2.0,
"epoch": 0.7867036011080333,
"grad_norm": 2.3636642819394384,
"kl": 2.6716066980734468,
"learning_rate": 0.00014184511727039612,
"loss": 0.020374953746795654,
"memory(GiB)": 80.03,
"reward": 0.34375,
"reward_std": 0.5405020713806152,
"rewards/Response_no_think_reward/mean": 0.34375,
"rewards/Response_no_think_reward/std": 1.2323558330535889,
"step": 71,
"train_speed(iter/s)": 0.00236
},
{
"clip_ratio/high_max": 0.004156995622906834,
"clip_ratio/high_mean": 0.004156995622906834,
"clip_ratio/low_mean": 0.11334922257810831,
"clip_ratio/low_min": 0.11334922257810831,
"clip_ratio/region_mean": 0.11750621721148491,
"epoch": 0.7977839335180056,
"grad_norm": 1.5028809890146027,
"kl": 3.652272095438093,
"learning_rate": 0.00014016954246529696,
"loss": 0.00900588370859623,
"memory(GiB)": 80.03,
"step": 72,
"train_speed(iter/s)": 0.002378
},
{
"clip_ratio/high_max": 0.0024562697508372366,
"clip_ratio/high_mean": 0.0024562697508372366,
"clip_ratio/low_mean": 0.00900937442202121,
"clip_ratio/low_min": 0.00900937442202121,
"clip_ratio/region_mean": 0.01146564440568909,
"completions/clipped_ratio": 0.1015625,
"completions/max_length": 101.0,
"completions/mean_length": 20.9609375,
"completions/min_length": 6.0,
"epoch": 0.8088642659279779,
"grad_norm": 1.9262088024122541,
"kl": 2.068145776007441,
"learning_rate": 0.00013848040976744457,
"loss": 0.009554898366332054,
"memory(GiB)": 80.03,
"reward": 0.7734375,
"reward_std": 0.6535134315490723,
"rewards/Response_no_think_reward/mean": 0.7734375,
"rewards/Response_no_think_reward/std": 1.224518895149231,
"step": 73,
"train_speed(iter/s)": 0.002347
},
{
"clip_ratio/high_max": 0.05884167249314487,
"clip_ratio/high_mean": 0.05884167249314487,
"clip_ratio/low_mean": 0.014398490195162594,
"clip_ratio/low_min": 0.014398490195162594,
"clip_ratio/region_mean": 0.0732401623390615,
"epoch": 0.8199445983379502,
"grad_norm": 3.7794078536832525,
"kl": 1.1005137297324836,
"learning_rate": 0.00013677828928738934,
"loss": 0.027932219207286835,
"memory(GiB)": 80.03,
"step": 74,
"train_speed(iter/s)": 0.002365
},
{
"clip_ratio/high_max": 0.0020199596765451133,
"clip_ratio/high_mean": 0.0020199596765451133,
"clip_ratio/low_mean": 0.009859619050985202,
"clip_ratio/low_min": 0.009859619050985202,
"clip_ratio/region_mean": 0.0118795787129784,
"completions/clipped_ratio": 0.09375,
"completions/max_length": 101.0,
"completions/mean_length": 19.734375,
"completions/min_length": 2.0,
"epoch": 0.8310249307479224,
"grad_norm": 2.6931881467895598,
"kl": 1.9703011065721512,
"learning_rate": 0.00013506375551927547,
"loss": 0.010023066774010658,
"memory(GiB)": 80.03,
"reward": 0.4140625,
"reward_std": 0.6804871559143066,
"rewards/Response_no_think_reward/mean": 0.4140625,
"rewards/Response_no_think_reward/std": 1.2005729675292969,
"step": 75,
"train_speed(iter/s)": 0.00233
},
{
"clip_ratio/high_max": 0.004052987133036368,
"clip_ratio/high_mean": 0.004052987133036368,
"clip_ratio/low_mean": 0.14585177681874484,
"clip_ratio/low_min": 0.14585177681874484,
"clip_ratio/region_mean": 0.14990476449020207,
"epoch": 0.8421052631578947,
"grad_norm": 1.4459331642351634,
"kl": 4.161040774546564,
"learning_rate": 0.00013333738714693956,
"loss": -0.005643587093800306,
"memory(GiB)": 80.03,
"step": 76,
"train_speed(iter/s)": 0.002347
},
{
"clip_ratio/high_max": 0.00046641789958812296,
"clip_ratio/high_mean": 0.00046641789958812296,
"clip_ratio/low_mean": 0.0038580247201025486,
"clip_ratio/low_min": 0.0038580247201025486,
"clip_ratio/region_mean": 0.0043244426196906716,
"completions/clipped_ratio": 0.0859375,
"completions/max_length": 99.0,
"completions/mean_length": 14.8828125,
"completions/min_length": 2.0,
"epoch": 0.853185595567867,
"grad_norm": 2.393092790871116,
"kl": 2.344057558570057,
"learning_rate": 0.00013159976684859527,
"loss": 0.014792806468904018,
"memory(GiB)": 80.03,
"reward": 0.8046875,
"reward_std": 0.515557050704956,
"rewards/Response_no_think_reward/mean": 0.8046875,
"rewards/Response_no_think_reward/std": 1.2862604856491089,
"step": 77,
"train_speed(iter/s)": 0.002292
},
{
"clip_ratio/high_max": 0.005874009046237916,
"clip_ratio/high_mean": 0.005874009046237916,
"clip_ratio/low_mean": 0.0609364231931977,
"clip_ratio/low_min": 0.0609364231931977,
"clip_ratio/region_mean": 0.0668104327050969,
"epoch": 0.8642659279778393,
"grad_norm": 0.9235795825109938,
"kl": 3.164612793829292,
"learning_rate": 0.00012985148110016947,
"loss": 0.001517204917035997,
"memory(GiB)": 80.03,
"step": 78,
"train_speed(iter/s)": 0.002309
},
{
"clip_ratio/high_max": 0.002277967141708359,
"clip_ratio/high_mean": 0.002277967141708359,
"clip_ratio/low_mean": 0.0037592062435578555,
"clip_ratio/low_min": 0.0037592062435578555,
"clip_ratio/region_mean": 0.006037173385266215,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 87.0,
"completions/mean_length": 15.703125,
"completions/min_length": 2.0,
"epoch": 0.8753462603878116,
"grad_norm": 1.666555946903183,
"kl": 2.2231151023879647,
"learning_rate": 0.00012809311997735696,
"loss": 0.012878447771072388,
"memory(GiB)": 80.03,
"reward": 0.546875,
"reward_std": 0.7733994126319885,
"rewards/Response_no_think_reward/mean": 0.546875,
"rewards/Response_no_think_reward/std": 1.3032931089401245,
"step": 79,
"train_speed(iter/s)": 0.002271
},
{
"clip_ratio/high_max": 0.03329824731918052,
"clip_ratio/high_mean": 0.03329824731918052,
"clip_ratio/low_mean": 0.017765316180884838,
"clip_ratio/low_min": 0.017765316180884838,
"clip_ratio/region_mean": 0.05106356361648068,
"epoch": 0.8864265927977839,
"grad_norm": 1.0568349375834465,
"kl": 1.923786539278808,
"learning_rate": 0.00012632527695645993,
"loss": -0.0005231135291978717,
"memory(GiB)": 80.03,
"step": 80,
"train_speed(iter/s)": 0.002287
},
{
"clip_ratio/high_max": 0.00021551724057644606,
"clip_ratio/high_mean": 0.00021551724057644606,
"clip_ratio/low_mean": 0.006801646784879267,
"clip_ratio/low_min": 0.006801646784879267,
"clip_ratio/region_mean": 0.007017164025455713,
"completions/clipped_ratio": 0.046875,
"completions/max_length": 90.0,
"completions/mean_length": 14.03125,
"completions/min_length": 2.0,
"epoch": 0.8975069252077562,
"grad_norm": 9.477113742654934,
"kl": 3.0111945159733295,
"learning_rate": 0.00012454854871407994,
"loss": 0.016959797590970993,
"memory(GiB)": 80.03,
"reward": 0.2578125,
"reward_std": 0.5107755661010742,
"rewards/Response_no_think_reward/mean": 0.2578125,
"rewards/Response_no_think_reward/std": 1.2874077558517456,
"step": 81,
"train_speed(iter/s)": 0.002263
},
{
"clip_ratio/high_max": 0.012387449765810743,
"clip_ratio/high_mean": 0.012387449765810743,
"clip_ratio/low_mean": 0.04806764563545585,
"clip_ratio/low_min": 0.04806764563545585,
"clip_ratio/region_mean": 0.06045509548857808,
"epoch": 0.9085872576177285,
"grad_norm": 1.1639747912015215,
"kl": 3.7243148013949394,
"learning_rate": 0.00012276353492572935,
"loss": 0.0026693246327340603,
"memory(GiB)": 80.03,
"step": 82,
"train_speed(iter/s)": 0.002279
},
{
"clip_ratio/high_max": 0.0004032258002553135,
"clip_ratio/high_mean": 0.0004032258002553135,
"clip_ratio/low_mean": 0.0061736139468848705,
"clip_ratio/low_min": 0.0061736139468848705,
"clip_ratio/region_mean": 0.006576839747140184,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 99.0,
"completions/mean_length": 12.625,
"completions/min_length": 2.0,
"epoch": 0.9196675900277008,
"grad_norm": 7.345333737975268,
"kl": 1.6264500059187412,
"learning_rate": 0.00012097083806343103,
"loss": 0.02225027047097683,
"memory(GiB)": 80.03,
"reward": 0.6640625,
"reward_std": 0.4172249436378479,
"rewards/Response_no_think_reward/mean": 0.6640625,
"rewards/Response_no_think_reward/std": 1.1588573455810547,
"step": 83,
"train_speed(iter/s)": 0.00227
},
{
"clip_ratio/high_max": 0.0035271961241960526,
"clip_ratio/high_mean": 0.0035271961241960526,
"clip_ratio/low_mean": 0.02831025089835748,
"clip_ratio/low_min": 0.02831025089835748,
"clip_ratio/region_mean": 0.03183744702255353,
"epoch": 0.9307479224376731,
"grad_norm": 84.3494363093827,
"kl": 10.616167868487537,
"learning_rate": 0.00011917106319237386,
"loss": 0.17172452807426453,
"memory(GiB)": 80.03,
"step": 84,
"train_speed(iter/s)": 0.002286
},
{
"clip_ratio/high_max": 0.0011701860348694026,
"clip_ratio/high_mean": 0.0011701860348694026,
"clip_ratio/low_mean": 0.014238029951229692,
"clip_ratio/low_min": 0.014238029951229692,
"clip_ratio/region_mean": 0.015408215986099094,
"completions/clipped_ratio": 0.140625,
"completions/max_length": 101.0,
"completions/mean_length": 19.7578125,
"completions/min_length": 4.0,
"epoch": 0.9418282548476454,
"grad_norm": 1.9907484000781221,
"kl": 2.995624510163907,
"learning_rate": 0.00011736481776669306,
"loss": 0.01750401221215725,
"memory(GiB)": 80.03,
"reward": 0.4765625,
"reward_std": 0.4854952394962311,
"rewards/Response_no_think_reward/mean": 0.4765625,
"rewards/Response_no_think_reward/std": 1.1080580949783325,
"step": 85,
"train_speed(iter/s)": 0.002274
},
{
"clip_ratio/high_max": 0.008182557401596569,
"clip_ratio/high_mean": 0.008182557401596569,
"clip_ratio/low_mean": 0.11124554229900241,
"clip_ratio/low_min": 0.11124554229900241,
"clip_ratio/region_mean": 0.11942810016626026,
"epoch": 0.9529085872576177,
"grad_norm": 1.9564641583381899,
"kl": 4.675610944104847,
"learning_rate": 0.00011555271142444433,
"loss": 0.009754904545843601,
"memory(GiB)": 80.03,
"step": 86,
"train_speed(iter/s)": 0.002289
},
{
"clip_ratio/high_max": 0.0004139889351790771,
"clip_ratio/high_mean": 0.0004139889351790771,
"clip_ratio/low_mean": 0.009557914454489946,
"clip_ratio/low_min": 0.009557914454489946,
"clip_ratio/region_mean": 0.0099719034624286,
"completions/clipped_ratio": 0.0859375,
"completions/max_length": 101.0,
"completions/mean_length": 17.90625,
"completions/min_length": 2.0,
"epoch": 0.96398891966759,
"grad_norm": 1.805689670049186,
"kl": 3.4809365491382778,
"learning_rate": 0.00011373535578184082,
"loss": 0.0213579460978508,
"memory(GiB)": 80.03,
"reward": 0.5859375,
"reward_std": 0.5313136577606201,
"rewards/Response_no_think_reward/mean": 0.5859375,
"rewards/Response_no_think_reward/std": 1.1939964294433594,
"step": 87,
"train_speed(iter/s)": 0.002277
},
{
"clip_ratio/high_max": 0.009385127894347534,
"clip_ratio/high_mean": 0.009385127894347534,
"clip_ratio/low_mean": 0.08647578035015613,
"clip_ratio/low_min": 0.08647578035015613,
"clip_ratio/region_mean": 0.095860909903422,
"epoch": 0.9750692520775623,
"grad_norm": 2.411018383110019,
"kl": 4.761912747140741,
"learning_rate": 0.00011191336422682237,
"loss": 0.01895134523510933,
"memory(GiB)": 80.03,
"step": 88,
"train_speed(iter/s)": 0.002291
},
{
"clip_ratio/high_max": 0.0031819915457163006,
"clip_ratio/high_mean": 0.0031819915457163006,
"clip_ratio/low_mean": 0.012216789647936821,
"clip_ratio/low_min": 0.012216789647936821,
"clip_ratio/region_mean": 0.015398780989926308,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 64.0,
"completions/mean_length": 11.28125,
"completions/min_length": 2.0,
"epoch": 0.9861495844875346,
"grad_norm": 2.2626010793409574,
"kl": 6.020935451146215,
"learning_rate": 0.00011008735171202684,
"loss": 0.031282562762498856,
"memory(GiB)": 80.03,
"reward": 0.2890625,
"reward_std": 0.847247302532196,
"rewards/Response_no_think_reward/mean": 0.2890625,
"rewards/Response_no_think_reward/std": 1.1915208101272583,
"step": 89,
"train_speed(iter/s)": 0.002254
},
{
"clip_ratio/high_max": 0.024421937006991357,
"clip_ratio/high_mean": 0.024421937006991357,
"clip_ratio/low_mean": 0.0521851975354366,
"clip_ratio/low_min": 0.0521851975354366,
"clip_ratio/region_mean": 0.07660713430959731,
"epoch": 0.997229916897507,
"grad_norm": 1.8302536272850396,
"kl": 6.024846433196217,
"learning_rate": 0.00010825793454723325,
"loss": 0.017346249893307686,
"memory(GiB)": 80.03,
"step": 90,
"train_speed(iter/s)": 0.002268
},
{
"clip_ratio/high_max": 0.0011776478204410523,
"clip_ratio/high_mean": 0.0011776478204410523,
"clip_ratio/low_mean": 0.0035608798498287797,
"clip_ratio/low_min": 0.0035608798498287797,
"clip_ratio/region_mean": 0.004738527670269832,
"completions/clipped_ratio": 0.125,
"completions/max_length": 101.0,
"completions/mean_length": 24.046875,
"completions/min_length": 3.0,
"epoch": 1.0110803324099722,
"grad_norm": 2.3698869054826233,
"kl": 5.333947827733937,
"learning_rate": 0.00010642573019134703,
"loss": 0.028505954891443253,
"memory(GiB)": 80.03,
"reward": 0.84375,
"reward_std": 0.6655995845794678,
"rewards/Response_no_think_reward/mean": 0.84375,
"rewards/Response_no_think_reward/std": 1.2065274715423584,
"step": 91,
"train_speed(iter/s)": 0.002232
},
{
"clip_ratio/high_max": 0.02221274602925405,
"clip_ratio/high_mean": 0.02221274602925405,
"clip_ratio/low_mean": 0.04682085904642008,
"clip_ratio/low_min": 0.04682085904642008,
"clip_ratio/region_mean": 0.0690336050465703,
"epoch": 1.0221606648199446,
"grad_norm": 1.377879165623118,
"kl": 6.767704317186144,
"learning_rate": 0.00010459135704399718,
"loss": 0.01659482903778553,
"memory(GiB)": 80.03,
"step": 92,
"train_speed(iter/s)": 0.002246
},
{
"clip_ratio/high_max": 0.0007944914977997541,
"clip_ratio/high_mean": 0.0007944914977997541,
"clip_ratio/low_mean": 0.005214237666223198,
"clip_ratio/low_min": 0.005214237666223198,
"clip_ratio/region_mean": 0.006008729164022952,
"completions/clipped_ratio": 0.046875,
"completions/max_length": 79.0,
"completions/mean_length": 11.1953125,
"completions/min_length": 2.0,
"epoch": 1.0332409972299168,
"grad_norm": 1.128328936062302,
"kl": 2.6099998716963455,
"learning_rate": 0.00010275543423681621,
"loss": 0.01443527452647686,
"memory(GiB)": 80.03,
"reward": 0.5703125,
"reward_std": 0.34169840812683105,
"rewards/Response_no_think_reward/mean": 0.5703125,
"rewards/Response_no_think_reward/std": 1.26543128490448,
"step": 93,
"train_speed(iter/s)": 0.00223
},
{
"clip_ratio/high_max": 0.024202606233302504,
"clip_ratio/high_mean": 0.024202606233302504,
"clip_ratio/low_mean": 0.017650849069468677,
"clip_ratio/low_min": 0.017650849069468677,
"clip_ratio/region_mean": 0.04185345536097884,
"epoch": 1.0443213296398892,
"grad_norm": 0.5979565041663649,
"kl": 1.9247902451315895,
"learning_rate": 0.00010091858142447265,
"loss": 0.005481676664203405,
"memory(GiB)": 80.03,
"step": 94,
"train_speed(iter/s)": 0.002243
},
{
"clip_ratio/high_max": 0.002601411077193916,
"clip_ratio/high_mean": 0.002601411077193916,
"clip_ratio/low_mean": 0.005088170932140201,
"clip_ratio/low_min": 0.005088170932140201,
"clip_ratio/region_mean": 0.007689581951126456,
"completions/clipped_ratio": 0.09375,
"completions/max_length": 101.0,
"completions/mean_length": 18.25,
"completions/min_length": 4.0,
"epoch": 1.0554016620498614,
"grad_norm": 2.0648308983451917,
"kl": 1.713204285595566,
"learning_rate": 9.908141857552737e-05,
"loss": 0.015094820410013199,
"memory(GiB)": 80.03,
"reward": 0.8046875,
"reward_std": 0.47176384925842285,
"rewards/Response_no_think_reward/mean": 0.8046875,
"rewards/Response_no_think_reward/std": 1.1708977222442627,
"step": 95,
"train_speed(iter/s)": 0.002221
},
{
"clip_ratio/high_max": 0.01881888063508086,
"clip_ratio/high_mean": 0.01881888063508086,
"clip_ratio/low_mean": 0.026617751631420106,
"clip_ratio/low_min": 0.026617751631420106,
"clip_ratio/region_mean": 0.0454366315389052,
"epoch": 1.0664819944598338,
"grad_norm": 1.5544793796965792,
"kl": 1.6157679219031706,
"learning_rate": 9.724456576318381e-05,
"loss": 0.012739625759422779,
"memory(GiB)": 80.03,
"step": 96,
"train_speed(iter/s)": 0.002234
},
{
"clip_ratio/high_max": 0.0020559211261570454,
"clip_ratio/high_mean": 0.0020559211261570454,
"clip_ratio/low_mean": 0.0043267360888421535,
"clip_ratio/low_min": 0.0043267360888421535,
"clip_ratio/region_mean": 0.006382657098583877,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 41.0,
"completions/mean_length": 11.046875,
"completions/min_length": 3.0,
"epoch": 1.077562326869806,
"grad_norm": 2.5531547462941115,
"kl": 1.4817758100107312,
"learning_rate": 9.540864295600283e-05,
"loss": 0.016522858291864395,
"memory(GiB)": 80.03,
"reward": 0.9453125,
"reward_std": 0.4848037362098694,
"rewards/Response_no_think_reward/mean": 0.9453125,
"rewards/Response_no_think_reward/std": 1.1454023122787476,
"step": 97,
"train_speed(iter/s)": 0.00222
},
{
"clip_ratio/high_max": 0.01358306163456291,
"clip_ratio/high_mean": 0.01358306163456291,
"clip_ratio/low_mean": 0.019928007503040135,
"clip_ratio/low_min": 0.019928007503040135,
"clip_ratio/region_mean": 0.03351106960326433,
"epoch": 1.0886426592797784,
"grad_norm": 1.0799722223140724,
"kl": 1.3886900492943823,
"learning_rate": 9.357426980865301e-05,
"loss": -0.0007159767556004226,
"memory(GiB)": 80.03,
"step": 98,
"train_speed(iter/s)": 0.002234
},
{
"clip_ratio/high_max": 0.001544758939417079,
"clip_ratio/high_mean": 0.001544758939417079,
"clip_ratio/low_mean": 0.0037943847200949676,
"clip_ratio/low_min": 0.0037943847200949676,
"clip_ratio/region_mean": 0.005339143652236089,
"completions/clipped_ratio": 0.0546875,
"completions/max_length": 101.0,
"completions/mean_length": 18.546875,
"completions/min_length": 3.0,
"epoch": 1.0997229916897506,
"grad_norm": 0.943375664401446,
"kl": 1.7392279328778386,
"learning_rate": 9.174206545276677e-05,
"loss": 0.014223725534975529,
"memory(GiB)": 80.03,
"reward": 1.1015625,
"reward_std": 0.39179152250289917,
"rewards/Response_no_think_reward/mean": 1.1015625,
"rewards/Response_no_think_reward/std": 1.2221051454544067,
"step": 99,
"train_speed(iter/s)": 0.002219
},
{
"clip_ratio/high_max": 0.01209607784403488,
"clip_ratio/high_mean": 0.01209607784403488,
"clip_ratio/low_mean": 0.011367922488716431,
"clip_ratio/low_min": 0.011367922488716431,
"clip_ratio/region_mean": 0.023464000318199396,
"epoch": 1.110803324099723,
"grad_norm": 0.8253425068817393,
"kl": 1.7898913251701742,
"learning_rate": 8.991264828797319e-05,
"loss": 0.006411677226424217,
"memory(GiB)": 80.03,
"step": 100,
"train_speed(iter/s)": 0.002232
},
{
"clip_ratio/high_max": 0.0038593837525695562,
"clip_ratio/high_mean": 0.0038593837525695562,
"clip_ratio/low_mean": 0.007897521747509018,
"clip_ratio/low_min": 0.007897521747509018,
"clip_ratio/region_mean": 0.011756905500078574,
"completions/clipped_ratio": 0.140625,
"completions/max_length": 51.0,
"completions/mean_length": 18.0390625,
"completions/min_length": 2.0,
"epoch": 1.1218836565096952,
"grad_norm": 2.1091313211648033,
"kl": 4.433779507409781,
"learning_rate": 8.808663577317764e-05,
"loss": 0.026584401726722717,
"memory(GiB)": 77.36,
"reward": 0.234375,
"reward_std": 0.353938490152359,
"rewards/Response_no_think_reward_1/mean": 0.234375,
"rewards/Response_no_think_reward_1/std": 0.8275223970413208,
"step": 101,
"train_speed(iter/s)": 0.112917
},
{
"clip_ratio/high_max": 0.0257808348396793,
"clip_ratio/high_mean": 0.0257808348396793,
"clip_ratio/low_mean": 0.013182859780499712,
"clip_ratio/low_min": 0.013182859780499712,
"clip_ratio/region_mean": 0.038963694794801995,
"epoch": 1.1329639889196677,
"grad_norm": 0.8069647208167382,
"kl": 2.7774715912528336,
"learning_rate": 8.626464421815919e-05,
"loss": 0.008937789127230644,
"memory(GiB)": 77.36,
"step": 102,
"train_speed(iter/s)": 0.09385
},
{
"clip_ratio/high_max": 0.00028669723542407155,
"clip_ratio/high_mean": 0.00028669723542407155,
"clip_ratio/low_mean": 0.0008802816737443209,
"clip_ratio/low_min": 0.0008802816737443209,
"clip_ratio/region_mean": 0.0011669789091683924,
"completions/clipped_ratio": 0.109375,
"completions/max_length": 51.0,
"completions/mean_length": 18.140625,
"completions/min_length": 3.0,
"epoch": 1.1440443213296398,
"grad_norm": 3.4014714828505634,
"kl": 1.8993340344168246,
"learning_rate": 8.444728857555572e-05,
"loss": 0.029605647549033165,
"memory(GiB)": 77.47,
"reward": 0.390625,
"reward_std": 0.1173202246427536,
"rewards/Response_no_think_reward_1/mean": 0.390625,
"rewards/Response_no_think_reward_1/std": 0.8440096974372864,
"step": 103,
"train_speed(iter/s)": 0.053798
},
{
"clip_ratio/high_max": 0.0013847328373230994,
"clip_ratio/high_mean": 0.0013847328373230994,
"clip_ratio/low_mean": 0.004156515002250671,
"clip_ratio/low_min": 0.004156515002250671,
"clip_ratio/region_mean": 0.00554124778136611,
"epoch": 1.1551246537396123,
"grad_norm": 0.6574286317590833,
"kl": 0.8905834904871881,
"learning_rate": 8.263518223330697e-05,
"loss": 0.007299074437469244,
"memory(GiB)": 77.47,
"step": 104,
"train_speed(iter/s)": 0.049358
},
{
"clip_ratio/high_max": 0.00036549707874655724,
"clip_ratio/high_mean": 0.00036549707874655724,
"clip_ratio/low_mean": 0.003542276710504666,
"clip_ratio/low_min": 0.003542276710504666,
"clip_ratio/region_mean": 0.003907773789251223,
"completions/clipped_ratio": 0.0546875,
"completions/max_length": 51.0,
"completions/mean_length": 12.1015625,
"completions/min_length": 2.0,
"epoch": 1.1662049861495845,
"grad_norm": 1.418255621232663,
"kl": 1.0295969531871378,
"learning_rate": 8.082893680762619e-05,
"loss": 0.008070322684943676,
"memory(GiB)": 77.47,
"reward": 0.5625,
"reward_std": 0.283821702003479,
"rewards/Response_no_think_reward_1/mean": 0.5625,
"rewards/Response_no_think_reward_1/std": 0.6728714108467102,
"step": 105,
"train_speed(iter/s)": 0.035507
},
{
"clip_ratio/high_max": 0.015719514689408243,
"clip_ratio/high_mean": 0.015719514689408243,
"clip_ratio/low_mean": 0.010580109432339668,
"clip_ratio/low_min": 0.010580109432339668,
"clip_ratio/region_mean": 0.02629962412174791,
"epoch": 1.1772853185595569,
"grad_norm": 0.9124403050854863,
"kl": 0.933376073371619,
"learning_rate": 7.902916193656898e-05,
"loss": -0.002763347467407584,
"memory(GiB)": 79.43,
"step": 106,
"train_speed(iter/s)": 0.033633
},
{
"clip_ratio/high_max": 0.0023960003745742142,
"clip_ratio/high_mean": 0.0023960003745742142,
"clip_ratio/low_mean": 0.002585217938758433,
"clip_ratio/low_min": 0.002585217938758433,
"clip_ratio/region_mean": 0.004981218371540308,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 51.0,
"completions/mean_length": 13.6328125,
"completions/min_length": 2.0,
"epoch": 1.188365650969529,
"grad_norm": 2.0082146476980807,
"kl": 1.3074679019264295,
"learning_rate": 7.72364650742707e-05,
"loss": 0.011914699338376522,
"memory(GiB)": 79.43,
"reward": 0.328125,
"reward_std": 0.18394747376441956,
"rewards/Response_no_think_reward_1/mean": 0.328125,
"rewards/Response_no_think_reward_1/std": 0.7110973596572876,
"step": 107,
"train_speed(iter/s)": 0.027655
},
{
"clip_ratio/high_max": 0.00717889575753361,
"clip_ratio/high_mean": 0.00717889575753361,
"clip_ratio/low_mean": 0.008150914101861417,
"clip_ratio/low_min": 0.008150914101861417,
"clip_ratio/region_mean": 0.015329810208640993,
"epoch": 1.1994459833795015,
"grad_norm": 0.5916941576021421,
"kl": 1.0833495813399168,
"learning_rate": 7.54514512859201e-05,
"loss": 0.0037035662680864334,
"memory(GiB)": 79.43,
"step": 108,
"train_speed(iter/s)": 0.026591
},
{
"clip_ratio/high_max": 0.004251995822414756,
"clip_ratio/high_mean": 0.004251995822414756,
"clip_ratio/low_mean": 0.008190131688024849,
"clip_ratio/low_min": 0.008190131688024849,
"clip_ratio/region_mean": 0.012442127510439605,
"completions/clipped_ratio": 0.09375,
"completions/max_length": 51.0,
"completions/mean_length": 12.234375,
"completions/min_length": 4.0,
"epoch": 1.2105263157894737,
"grad_norm": 2.6396182071410137,
"kl": 2.141993957106024,
"learning_rate": 7.36747230435401e-05,
"loss": 0.011151588521897793,
"memory(GiB)": 79.43,
"reward": -0.2265625,
"reward_std": 0.3407740592956543,
"rewards/Response_no_think_reward_1/mean": -0.2265625,
"rewards/Response_no_think_reward_1/std": 0.6425201892852783,
"step": 109,
"train_speed(iter/s)": 0.022574
},
{
"clip_ratio/high_max": 0.004035328107420355,
"clip_ratio/high_mean": 0.004035328107420355,
"clip_ratio/low_mean": 0.08847818686626852,
"clip_ratio/low_min": 0.08847818686626852,
"clip_ratio/region_mean": 0.0925135153811425,
"epoch": 1.221606648199446,
"grad_norm": 1.4171762109533736,
"kl": 3.1860878374427557,
"learning_rate": 7.190688002264308e-05,
"loss": 0.0037668771110475063,
"memory(GiB)": 79.43,
"step": 110,
"train_speed(iter/s)": 0.021907
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.002568919211626053,
"clip_ratio/low_min": 0.002568919211626053,
"clip_ratio/region_mean": 0.002568919211626053,
"completions/clipped_ratio": 0.046875,
"completions/max_length": 48.0,
"completions/mean_length": 11.7734375,
"completions/min_length": 5.0,
"epoch": 1.2326869806094183,
"grad_norm": 1.02177770841713,
"kl": 1.6274185269139707,
"learning_rate": 7.014851889983057e-05,
"loss": 0.010478168725967407,
"memory(GiB)": 79.43,
"reward": 0.453125,
"reward_std": 0.3291260004043579,
"rewards/Response_no_think_reward_1/mean": 0.453125,
"rewards/Response_no_think_reward_1/std": 0.685730516910553,
"step": 111,
"train_speed(iter/s)": 0.019127
},
{
"clip_ratio/high_max": 0.013096909533487633,
"clip_ratio/high_mean": 0.013096909533487633,
"clip_ratio/low_mean": 0.016107605304569006,
"clip_ratio/low_min": 0.016107605304569006,
"clip_ratio/region_mean": 0.029204514692537487,
"epoch": 1.2437673130193905,
"grad_norm": 0.79999454502468,
"kl": 1.5544351362623274,
"learning_rate": 6.840023315140475e-05,
"loss": 0.0022247314918786287,
"memory(GiB)": 79.43,
"step": 112,
"train_speed(iter/s)": 0.018681
},
{
"clip_ratio/high_max": 0.0008340688509633765,
"clip_ratio/high_mean": 0.0008340688509633765,
"clip_ratio/low_mean": 0.007082634954713285,
"clip_ratio/low_min": 0.007082634954713285,
"clip_ratio/region_mean": 0.007916703820228577,
"completions/clipped_ratio": 0.1171875,
"completions/max_length": 51.0,
"completions/mean_length": 13.53125,
"completions/min_length": 3.0,
"epoch": 1.254847645429363,
"grad_norm": 1.6246389101003882,
"kl": 1.6449745513964444,
"learning_rate": 6.666261285306047e-05,
"loss": 0.014917208813130856,
"memory(GiB)": 79.43,
"reward": 0.1953125,
"reward_std": 0.2754020392894745,
"rewards/Response_no_think_reward_1/mean": 0.1953125,
"rewards/Response_no_think_reward_1/std": 0.869958758354187,
"step": 113,
"train_speed(iter/s)": 0.016592
},
{
"clip_ratio/high_max": 0.006006928611896001,
"clip_ratio/high_mean": 0.006006928611896001,
"clip_ratio/low_mean": 0.039706501411274076,
"clip_ratio/low_min": 0.039706501411274076,
"clip_ratio/region_mean": 0.045713430270552635,
"epoch": 1.2659279778393353,
"grad_norm": 0.940807595373605,
"kl": 1.8106578167062253,
"learning_rate": 6.493624448072457e-05,
"loss": 0.006363555323332548,
"memory(GiB)": 79.43,
"step": 114,
"train_speed(iter/s)": 0.016278
},
{
"clip_ratio/high_max": 0.0052188277477398515,
"clip_ratio/high_mean": 0.0052188277477398515,
"clip_ratio/low_mean": 0.004236701555782929,
"clip_ratio/low_min": 0.004236701555782929,
"clip_ratio/region_mean": 0.009455529390834272,
"completions/clipped_ratio": 0.1796875,
"completions/max_length": 51.0,
"completions/mean_length": 14.3671875,
"completions/min_length": 2.0,
"epoch": 1.2770083102493075,
"grad_norm": 2.8040352101197437,
"kl": 5.506896490347572,
"learning_rate": 6.322171071261071e-05,
"loss": 0.03229736536741257,
"memory(GiB)": 79.43,
"reward": 0.296875,
"reward_std": 0.43980443477630615,
"rewards/Response_no_think_reward_1/mean": 0.296875,
"rewards/Response_no_think_reward_1/std": 0.8905397057533264,
"step": 115,
"train_speed(iter/s)": 0.014636
},
{
"clip_ratio/high_max": 0.01615347486222163,
"clip_ratio/high_mean": 0.01615347486222163,
"clip_ratio/low_mean": 0.015428576618432999,
"clip_ratio/low_min": 0.015428576618432999,
"clip_ratio/region_mean": 0.031582050723955035,
"epoch": 1.2880886426592797,
"grad_norm": 1.8650893219420759,
"kl": 4.258469146443531,
"learning_rate": 6.151959023255545e-05,
"loss": 0.020270783454179764,
"memory(GiB)": 79.43,
"step": 116,
"train_speed(iter/s)": 0.014407
},
{
"clip_ratio/high_max": 0.005145640461705625,
"clip_ratio/high_mean": 0.005145640461705625,
"clip_ratio/low_mean": 0.008849590638419613,
"clip_ratio/low_min": 0.008849590638419613,
"clip_ratio/region_mean": 0.013995230983709916,
"completions/clipped_ratio": 0.1640625,
"completions/max_length": 51.0,
"completions/mean_length": 16.3125,
"completions/min_length": 2.0,
"epoch": 1.299168975069252,
"grad_norm": 2.4581301952944186,
"kl": 3.745300827547908,
"learning_rate": 5.983045753470308e-05,
"loss": 0.024165078997612,
"memory(GiB)": 79.43,
"reward": 0.453125,
"reward_std": 0.5826787948608398,
"rewards/Response_no_think_reward_1/mean": 0.453125,
"rewards/Response_no_think_reward_1/std": 0.8405039310455322,
"step": 117,
"train_speed(iter/s)": 0.013208
},
{
"clip_ratio/high_max": 0.04523819196037948,
"clip_ratio/high_mean": 0.04523819196037948,
"clip_ratio/low_mean": 0.01510127488290891,
"clip_ratio/low_min": 0.01510127488290891,
"clip_ratio/region_mean": 0.060339466377627105,
"epoch": 1.3102493074792243,
"grad_norm": 2.131099568305027,
"kl": 2.847630614414811,
"learning_rate": 5.8154882729603876e-05,
"loss": 0.01335166022181511,
"memory(GiB)": 79.43,
"step": 118,
"train_speed(iter/s)": 0.013037
},
{
"clip_ratio/high_max": 0.002125054510543123,
"clip_ratio/high_mean": 0.002125054510543123,
"clip_ratio/low_mean": 0.0127813016588334,
"clip_ratio/low_min": 0.0127813016588334,
"clip_ratio/region_mean": 0.0149063560529612,
"completions/clipped_ratio": 0.203125,
"completions/max_length": 51.0,
"completions/mean_length": 19.59375,
"completions/min_length": 3.0,
"epoch": 1.3213296398891967,
"grad_norm": 2.690385409772627,
"kl": 2.0104650848079473,
"learning_rate": 5.64934313517927e-05,
"loss": 0.01620793715119362,
"memory(GiB)": 79.43,
"reward": 0.2578125,
"reward_std": 0.41504764556884766,
"rewards/Response_no_think_reward_1/mean": 0.2578125,
"rewards/Response_no_think_reward_1/std": 0.8625734448432922,
"step": 119,
"train_speed(iter/s)": 0.011541
},
{
"clip_ratio/high_max": 0.0026382115320302546,
"clip_ratio/high_mean": 0.0026382115320302546,
"clip_ratio/low_mean": 0.07074824426672421,
"clip_ratio/low_min": 0.07074824426672421,
"clip_ratio/region_mean": 0.07338645646814257,
"epoch": 1.332409972299169,
"grad_norm": 1.3611711034111147,
"kl": 2.366683575557545,
"learning_rate": 5.484666416891109e-05,
"loss": 0.00427972199395299,
"memory(GiB)": 79.43,
"step": 120,
"train_speed(iter/s)": 0.011424
},
{
"clip_ratio/high_max": 0.00034340660204179585,
"clip_ratio/high_mean": 0.00034340660204179585,
"clip_ratio/low_mean": 0.0057576168910600245,
"clip_ratio/low_min": 0.0057576168910600245,
"clip_ratio/region_mean": 0.00610102349310182,
"completions/clipped_ratio": 0.109375,
"completions/max_length": 51.0,
"completions/mean_length": 14.1640625,
"completions/min_length": 3.0,
"epoch": 1.3434903047091413,
"grad_norm": 1.7730415769710828,
"kl": 2.253111455589533,
"learning_rate": 5.321513699243924e-05,
"loss": 0.015828199684619904,
"memory(GiB)": 79.43,
"reward": 0.2578125,
"reward_std": 0.2504267692565918,
"rewards/Response_no_think_reward_1/mean": 0.2578125,
"rewards/Response_no_think_reward_1/std": 0.8533961176872253,
"step": 121,
"train_speed(iter/s)": 0.010746
},
{
"clip_ratio/high_max": 0.002522797236451879,
"clip_ratio/high_mean": 0.002522797236451879,
"clip_ratio/low_mean": 0.03892370511312038,
"clip_ratio/low_min": 0.03892370511312038,
"clip_ratio/region_mean": 0.041446502320468426,
"epoch": 1.3545706371191135,
"grad_norm": 0.9270755733265906,
"kl": 2.852388353087008,
"learning_rate": 5.159940049010015e-05,
"loss": 0.00514911487698555,
"memory(GiB)": 79.43,
"step": 122,
"train_speed(iter/s)": 0.010652
},
{
"clip_ratio/high_max": 0.0008753835718380287,
"clip_ratio/high_mean": 0.0008753835718380287,
"clip_ratio/low_mean": 0.0012499999720603228,
"clip_ratio/low_min": 0.0012499999720603228,
"clip_ratio/region_mean": 0.0021253835438983515,
"completions/clipped_ratio": 0.1171875,
"completions/max_length": 51.0,
"completions/mean_length": 15.8515625,
"completions/min_length": 4.0,
"epoch": 1.365650969529086,
"grad_norm": 24.163527329310554,
"kl": 24.496757203305606,
"learning_rate": 5.000000000000002e-05,
"loss": 0.23566541075706482,
"memory(GiB)": 79.43,
"reward": 0.3984375,
"reward_std": 0.3253360986709595,
"rewards/Response_no_think_reward_1/mean": 0.3984375,
"rewards/Response_no_think_reward_1/std": 0.6912255883216858,
"step": 123,
"train_speed(iter/s)": 0.010181
},
{
"clip_ratio/high_max": 0.0009191176941385493,
"clip_ratio/high_mean": 0.0009191176941385493,
"clip_ratio/low_mean": 0.025084137567318976,
"clip_ratio/low_min": 0.025084137567318976,
"clip_ratio/region_mean": 0.026003255392424762,
"epoch": 1.3767313019390581,
"grad_norm": 4.61798364138243,
"kl": 5.482510100933723,
"learning_rate": 4.841747534656763e-05,
"loss": 0.03564080968499184,
"memory(GiB)": 79.43,
"step": 124,
"train_speed(iter/s)": 0.010103
},
{
"clip_ratio/high_max": 0.0004921259824186563,
"clip_ratio/high_mean": 0.0004921259824186563,
"clip_ratio/low_mean": 0.0009282178361900151,
"clip_ratio/low_min": 0.0009282178361900151,
"clip_ratio/region_mean": 0.0014203438186086714,
"completions/clipped_ratio": 0.140625,
"completions/max_length": 51.0,
"completions/mean_length": 16.671875,
"completions/min_length": 3.0,
"epoch": 1.3878116343490305,
"grad_norm": 1.7230796893481761,
"kl": 1.7308420957997441,
"learning_rate": 4.685236065835443e-05,
"loss": 0.01634293608367443,
"memory(GiB)": 79.43,
"reward": 0.171875,
"reward_std": 0.13258251547813416,
"rewards/Response_no_think_reward_1/mean": 0.171875,
"rewards/Response_no_think_reward_1/std": 0.8971465826034546,
"step": 125,
"train_speed(iter/s)": 0.009672
},
{
"clip_ratio/high_max": 0.0003094059356953949,
"clip_ratio/high_mean": 0.0003094059356953949,
"clip_ratio/low_mean": 0.02542525064200163,
"clip_ratio/low_min": 0.02542525064200163,
"clip_ratio/region_mean": 0.025734656490385532,
"epoch": 1.3988919667590027,
"grad_norm": 0.6685767852950313,
"kl": 2.058195663616061,
"learning_rate": 4.530518418775733e-05,
"loss": 0.008037411607801914,
"memory(GiB)": 79.43,
"step": 126,
"train_speed(iter/s)": 0.009605
},
{
"clip_ratio/high_max": 0.0035992932971566916,
"clip_ratio/high_mean": 0.0035992932971566916,
"clip_ratio/low_mean": 0.0026174120721407235,
"clip_ratio/low_min": 0.0026174120721407235,
"clip_ratio/region_mean": 0.006216705543920398,
"completions/clipped_ratio": 0.078125,
"completions/max_length": 51.0,
"completions/mean_length": 13.1015625,
"completions/min_length": 3.0,
"epoch": 1.4099722991689752,
"grad_norm": 0.898899557372063,
"kl": 1.8244512832025066,
"learning_rate": 4.3776468132724604e-05,
"loss": 0.013885595835745335,
"memory(GiB)": 79.43,
"reward": 0.703125,
"reward_std": 0.1841355264186859,
"rewards/Response_no_think_reward_1/mean": 0.703125,
"rewards/Response_no_think_reward_1/std": 0.552152156829834,
"step": 127,
"train_speed(iter/s)": 0.009212
},
{
"clip_ratio/high_max": 0.00787301326636225,
"clip_ratio/high_mean": 0.00787301326636225,
"clip_ratio/low_mean": 0.003833794384263456,
"clip_ratio/low_min": 0.003833794384263456,
"clip_ratio/region_mean": 0.011706807999871671,
"epoch": 1.4210526315789473,
"grad_norm": 0.6061431338619399,
"kl": 1.8278243900567759,
"learning_rate": 4.2266728460505375e-05,
"loss": 0.009479128755629063,
"memory(GiB)": 79.43,
"step": 128,
"train_speed(iter/s)": 0.009157
},
{
"clip_ratio/high_max": 0.0016208597226068377,
"clip_ratio/high_mean": 0.0016208597226068377,
"clip_ratio/low_mean": 0.004291799967177212,
"clip_ratio/low_min": 0.004291799967177212,
"clip_ratio/region_mean": 0.00591265968978405,
"completions/clipped_ratio": 0.2421875,
"completions/max_length": 51.0,
"completions/mean_length": 13.8359375,
"completions/min_length": 3.0,
"epoch": 1.4321329639889195,
"grad_norm": 4.256081630918958,
"kl": 8.371784689603373,
"learning_rate": 4.077647473350201e-05,
"loss": 0.07109890133142471,
"memory(GiB)": 79.43,
"reward": 0.1640625,
"reward_std": 0.12844271957874298,
"rewards/Response_no_think_reward_1/mean": 0.1640625,
"rewards/Response_no_think_reward_1/std": 0.9029901623725891,
"step": 129,
"train_speed(iter/s)": 0.008828
},
{
"clip_ratio/high_max": 0.00940803368575871,
"clip_ratio/high_mean": 0.00940803368575871,
"clip_ratio/low_mean": 0.006534474319778383,
"clip_ratio/low_min": 0.006534474319778383,
"clip_ratio/region_mean": 0.01594250788912177,
"epoch": 1.443213296398892,
"grad_norm": 2.0975168570419678,
"kl": 6.735093111405149,
"learning_rate": 3.9306209937284346e-05,
"loss": 0.05932926759123802,
"memory(GiB)": 79.43,
"step": 130,
"train_speed(iter/s)": 0.008781
},
{
"clip_ratio/high_max": 0.004439248572452925,
"clip_ratio/high_mean": 0.004439248572452925,
"clip_ratio/low_mean": 0.006494191708043218,
"clip_ratio/low_min": 0.006494191708043218,
"clip_ratio/region_mean": 0.01093344046967104,
"completions/clipped_ratio": 0.1484375,
"completions/max_length": 51.0,
"completions/mean_length": 13.9140625,
"completions/min_length": 3.0,
"epoch": 1.4542936288088644,
"grad_norm": 1.7347303322446779,
"kl": 3.3224903107620776,
"learning_rate": 3.7856430310823545e-05,
"loss": 0.028562916442751884,
"memory(GiB)": 79.43,
"reward": 0.2578125,
"reward_std": 0.4904649257659912,
"rewards/Response_no_think_reward_1/mean": 0.2578125,
"rewards/Response_no_think_reward_1/std": 0.8441190123558044,
"step": 131,
"train_speed(iter/s)": 0.008479
},
{
"clip_ratio/high_max": 0.03524596616625786,
"clip_ratio/high_mean": 0.03524596616625786,
"clip_ratio/low_mean": 0.00640316259523388,
"clip_ratio/low_min": 0.00640316259523388,
"clip_ratio/region_mean": 0.04164912860142067,
"epoch": 1.4653739612188366,
"grad_norm": 1.8414978565783118,
"kl": 2.55354578839615,
"learning_rate": 3.642762517900322e-05,
"loss": 0.016005922108888626,
"memory(GiB)": 79.43,
"step": 132,
"train_speed(iter/s)": 0.008439
},
{
"clip_ratio/high_max": 0.00021331057359930128,
"clip_ratio/high_mean": 0.00021331057359930128,
"clip_ratio/low_mean": 0.007616169808898121,
"clip_ratio/low_min": 0.007616169808898121,
"clip_ratio/region_mean": 0.007829480382497422,
"completions/clipped_ratio": 0.125,
"completions/max_length": 51.0,
"completions/mean_length": 16.9296875,
"completions/min_length": 4.0,
"epoch": 1.4764542936288088,
"grad_norm": 2.995948442993347,
"kl": 2.835317355929874,
"learning_rate": 3.5020276787464056e-05,
"loss": 0.020519524812698364,
"memory(GiB)": 79.43,
"reward": -0.109375,
"reward_std": 0.39537471532821655,
"rewards/Response_no_think_reward_1/mean": -0.109375,
"rewards/Response_no_think_reward_1/std": 0.7860434055328369,
"step": 133,
"train_speed(iter/s)": 0.008214
},
{
"clip_ratio/high_max": 0.0014211501111276448,
"clip_ratio/high_mean": 0.0014211501111276448,
"clip_ratio/low_mean": 0.017294615099672228,
"clip_ratio/low_min": 0.017294615099672228,
"clip_ratio/region_mean": 0.01871576503617689,
"epoch": 1.4875346260387812,
"grad_norm": 2.3860638079880268,
"kl": 2.9496174114756286,
"learning_rate": 3.363486013983788e-05,
"loss": 0.015305472537875175,
"memory(GiB)": 79.43,
"step": 134,
"train_speed(iter/s)": 0.008178
},
{
"clip_ratio/high_max": 0.004125965555431321,
"clip_ratio/high_mean": 0.004125965555431321,
"clip_ratio/low_mean": 0.01121757403598167,
"clip_ratio/low_min": 0.01121757403598167,
"clip_ratio/region_mean": 0.01534353947499767,
"completions/clipped_ratio": 0.2421875,
"completions/max_length": 51.0,
"completions/mean_length": 17.59375,
"completions/min_length": 5.0,
"epoch": 1.4986149584487536,
"grad_norm": 1.9611447116444427,
"kl": 4.596401881426573,
"learning_rate": 3.227184283742591e-05,
"loss": 0.037781622260808945,
"memory(GiB)": 79.43,
"reward": 0.140625,
"reward_std": 0.3686816394329071,
"rewards/Response_no_think_reward_1/mean": 0.140625,
"rewards/Response_no_think_reward_1/std": 0.9698962569236755,
"step": 135,
"train_speed(iter/s)": 0.007948
},
{
"clip_ratio/high_max": 0.003497250087093562,
"clip_ratio/high_mean": 0.003497250087093562,
"clip_ratio/low_mean": 0.0877209399768617,
"clip_ratio/low_min": 0.0877209399768617,
"clip_ratio/region_mean": 0.09121819020947441,
"epoch": 1.5096952908587258,
"grad_norm": 1.7237744503611014,
"kl": 4.757093018852174,
"learning_rate": 3.093168492137557e-05,
"loss": 0.02426687255501747,
"memory(GiB)": 79.43,
"step": 136,
"train_speed(iter/s)": 0.007917
},
{
"clip_ratio/high_max": 0.0014806788822170347,
"clip_ratio/high_mean": 0.0014806788822170347,
"clip_ratio/low_mean": 0.008024309470783919,
"clip_ratio/low_min": 0.008024309470783919,
"clip_ratio/region_mean": 0.009504988382104784,
"completions/clipped_ratio": 0.2265625,
"completions/max_length": 49.0,
"completions/mean_length": 15.859375,
"completions/min_length": 4.0,
"epoch": 1.520775623268698,
"grad_norm": 2.1836739109067973,
"kl": 5.872505620121956,
"learning_rate": 2.9614838717408867e-05,
"loss": 0.05089029669761658,
"memory(GiB)": 79.43,
"reward": 0.1640625,
"reward_std": 0.48505210876464844,
"rewards/Response_no_think_reward_1/mean": 0.1640625,
"rewards/Response_no_think_reward_1/std": 0.8303053379058838,
"step": 137,
"train_speed(iter/s)": 0.00773
},
{
"clip_ratio/high_max": 0.009889701497741044,
"clip_ratio/high_mean": 0.009889701497741044,
"clip_ratio/low_mean": 0.03272932127583772,
"clip_ratio/low_min": 0.03272932127583772,
"clip_ratio/region_mean": 0.04261902256985195,
"epoch": 1.5318559556786704,
"grad_norm": 1.660171536889304,
"kl": 5.461771305650473,
"learning_rate": 2.8321748683154893e-05,
"loss": 0.03914007171988487,
"memory(GiB)": 79.43,
"step": 138,
"train_speed(iter/s)": 0.007702
},
{
"clip_ratio/high_max": 0.0019176136120222509,
"clip_ratio/high_mean": 0.0019176136120222509,
"clip_ratio/low_mean": 0.007726973562967032,
"clip_ratio/low_min": 0.007726973562967032,
"clip_ratio/region_mean": 0.009644587058573961,
"completions/clipped_ratio": 0.265625,
"completions/max_length": 51.0,
"completions/mean_length": 15.359375,
"completions/min_length": 4.0,
"epoch": 1.5429362880886428,
"grad_norm": 3.7132212896004106,
"kl": 4.60741166153457,
"learning_rate": 2.7052851258137935e-05,
"loss": 0.039852242916822433,
"memory(GiB)": 79.43,
"reward": 0.0078125,
"reward_std": 0.3704521656036377,
"rewards/Response_no_think_reward_1/mean": 0.0078125,
"rewards/Response_no_think_reward_1/std": 0.7985823154449463,
"step": 139,
"train_speed(iter/s)": 0.007537
},
{
"clip_ratio/high_max": 0.0055117253214120865,
"clip_ratio/high_mean": 0.0055117253214120865,
"clip_ratio/low_mean": 0.016618184628896415,
"clip_ratio/low_min": 0.016618184628896415,
"clip_ratio/region_mean": 0.022129910183139145,
"epoch": 1.554016620498615,
"grad_norm": 2.5249297141615665,
"kl": 4.39259727431272,
"learning_rate": 2.5808574716471856e-05,
"loss": 0.03180728852748871,
"memory(GiB)": 79.43,
"step": 140,
"train_speed(iter/s)": 0.007513
},
{
"clip_ratio/high_max": 0.001243597303982824,
"clip_ratio/high_mean": 0.001243597303982824,
"clip_ratio/low_mean": 0.009276433673221618,
"clip_ratio/low_min": 0.009276433673221618,
"clip_ratio/region_mean": 0.010520030977204442,
"completions/clipped_ratio": 0.1640625,
"completions/max_length": 51.0,
"completions/mean_length": 13.2578125,
"completions/min_length": 4.0,
"epoch": 1.5650969529085872,
"grad_norm": 2.0040824091240594,
"kl": 6.036298241931945,
"learning_rate": 2.4589339022310386e-05,
"loss": 0.044014573097229004,
"memory(GiB)": 79.43,
"reward": 0.2109375,
"reward_std": 0.3419404625892639,
"rewards/Response_no_think_reward_1/mean": 0.2109375,
"rewards/Response_no_think_reward_1/std": 0.7902191877365112,
"step": 141,
"train_speed(iter/s)": 0.007347
},
{
"clip_ratio/high_max": 0.008325316943228245,
"clip_ratio/high_mean": 0.008325316943228245,
"clip_ratio/low_mean": 0.024790967552689835,
"clip_ratio/low_min": 0.024790967552689835,
"clip_ratio/region_mean": 0.0331162846123334,
"epoch": 1.5761772853185596,
"grad_norm": 1.8697222079345355,
"kl": 6.215300239622593,
"learning_rate": 2.339555568810221e-05,
"loss": 0.03644668310880661,
"memory(GiB)": 79.43,
"step": 142,
"train_speed(iter/s)": 0.007326
},
{
"clip_ratio/high_max": 0.0029302738257683814,
"clip_ratio/high_mean": 0.0029302738257683814,
"clip_ratio/low_mean": 0.007880916586145759,
"clip_ratio/low_min": 0.007880916586145759,
"clip_ratio/region_mean": 0.01081119041191414,
"completions/clipped_ratio": 0.1953125,
"completions/max_length": 51.0,
"completions/mean_length": 16.0546875,
"completions/min_length": 5.0,
"epoch": 1.587257617728532,
"grad_norm": 2.558849178134003,
"kl": 3.834877057670383,
"learning_rate": 2.222762763569862e-05,
"loss": 0.029992224648594856,
"memory(GiB)": 79.43,
"reward": 0.1875,
"reward_std": 0.35771697759628296,
"rewards/Response_no_think_reward_1/mean": 0.1875,
"rewards/Response_no_think_reward_1/std": 0.8010819554328918,
"step": 143,
"train_speed(iter/s)": 0.007139
},
{
"clip_ratio/high_max": 0.003368975827470422,
"clip_ratio/high_mean": 0.003368975827470422,
"clip_ratio/low_mean": 0.02965959811990615,
"clip_ratio/low_min": 0.02965959811990615,
"clip_ratio/region_mean": 0.033028574180207215,
"epoch": 1.5983379501385042,
"grad_norm": 1.5351560901882282,
"kl": 4.278483287169365,
"learning_rate": 2.1085949060360654e-05,
"loss": 0.022547291591763496,
"memory(GiB)": 79.43,
"step": 144,
"train_speed(iter/s)": 0.007121
},
{
"clip_ratio/high_max": 0.002464834105921909,
"clip_ratio/high_mean": 0.002464834105921909,
"clip_ratio/low_mean": 0.01630687521537766,
"clip_ratio/low_min": 0.01630687521537766,
"clip_ratio/region_mean": 0.018771709233988076,
"completions/clipped_ratio": 0.1953125,
"completions/max_length": 51.0,
"completions/mean_length": 15.2265625,
"completions/min_length": 6.0,
"epoch": 1.6094182825484764,
"grad_norm": 2.2342359741828877,
"kl": 5.610230388585478,
"learning_rate": 1.9970905297711606e-05,
"loss": 0.04032519459724426,
"memory(GiB)": 79.43,
"reward": 0.15625,
"reward_std": 0.3392276465892792,
"rewards/Response_no_think_reward_1/mean": 0.15625,
"rewards/Response_no_think_reward_1/std": 0.8175004720687866,
"step": 145,
"train_speed(iter/s)": 0.006942
},
{
"clip_ratio/high_max": 0.004107788117835298,
"clip_ratio/high_mean": 0.004107788117835298,
"clip_ratio/low_mean": 0.07009978080168366,
"clip_ratio/low_min": 0.07009978080168366,
"clip_ratio/region_mean": 0.07420756877399981,
"epoch": 1.6204986149584486,
"grad_norm": 1.7237867651621368,
"kl": 6.150614712154493,
"learning_rate": 1.888287269367979e-05,
"loss": 0.03451818227767944,
"memory(GiB)": 79.43,
"step": 146,
"train_speed(iter/s)": 0.006925
},
{
"clip_ratio/high_max": 0.0020879992516711354,
"clip_ratio/high_mean": 0.0020879992516711354,
"clip_ratio/low_mean": 0.0016714749799575657,
"clip_ratio/low_min": 0.0016714749799575657,
"clip_ratio/region_mean": 0.0037594741152133793,
"completions/clipped_ratio": 0.0390625,
"completions/max_length": 51.0,
"completions/mean_length": 12.09375,
"completions/min_length": 5.0,
"epoch": 1.631578947368421,
"grad_norm": 1.8301432866457292,
"kl": 1.3922554631717503,
"learning_rate": 1.7822218477475494e-05,
"loss": 0.015794314444065094,
"memory(GiB)": 79.43,
"reward": 0.5234375,
"reward_std": 0.20214977860450745,
"rewards/Response_no_think_reward_1/mean": 0.5234375,
"rewards/Response_no_think_reward_1/std": 0.6143282055854797,
"step": 147,
"train_speed(iter/s)": 0.006704
},
{
"clip_ratio/high_max": 0.004581842658808455,
"clip_ratio/high_mean": 0.004581842658808455,
"clip_ratio/low_mean": 0.00751026114448905,
"clip_ratio/low_min": 0.00751026114448905,
"clip_ratio/region_mean": 0.012092103715986013,
"epoch": 1.6426592797783934,
"grad_norm": 2.0798983048360977,
"kl": 1.5519673400558531,
"learning_rate": 1.6789300637645e-05,
"loss": 0.010683290660381317,
"memory(GiB)": 79.43,
"step": 148,
"train_speed(iter/s)": 0.006691
},
{
"clip_ratio/high_max": 0.0013595109921880066,
"clip_ratio/high_mean": 0.0013595109921880066,
"clip_ratio/low_mean": 0.004456432332517579,
"clip_ratio/low_min": 0.004456432332517579,
"clip_ratio/region_mean": 0.005815943295601755,
"completions/clipped_ratio": 0.140625,
"completions/max_length": 51.0,
"completions/mean_length": 13.4453125,
"completions/min_length": 6.0,
"epoch": 1.6537396121883656,
"grad_norm": 2.124340745472962,
"kl": 4.468803564086556,
"learning_rate": 1.578446780124344e-05,
"loss": 0.04191342741250992,
"memory(GiB)": 79.43,
"reward": 0.09375,
"reward_std": 0.2688094973564148,
"rewards/Response_no_think_reward_1/mean": 0.09375,
"rewards/Response_no_think_reward_1/std": 0.7036183476448059,
"step": 149,
"train_speed(iter/s)": 0.006516
},
{
"clip_ratio/high_max": 0.004650130198569968,
"clip_ratio/high_mean": 0.004650130198569968,
"clip_ratio/low_mean": 0.015789811441209167,
"clip_ratio/low_min": 0.015789811441209167,
"clip_ratio/region_mean": 0.020439941552467644,
"epoch": 1.6648199445983378,
"grad_norm": 1.3890201997929057,
"kl": 4.818290303461254,
"learning_rate": 1.4808059116167305e-05,
"loss": 0.03111656755208969,
"memory(GiB)": 79.43,
"step": 150,
"train_speed(iter/s)": 0.006505
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0031864915508776903,
"clip_ratio/low_min": 0.0031864915508776903,
"clip_ratio/region_mean": 0.0031864915508776903,
"completions/clipped_ratio": 0.1484375,
"completions/max_length": 51.0,
"completions/mean_length": 15.96875,
"completions/min_length": 3.0,
"epoch": 1.6759002770083102,
"grad_norm": 1.3263437432774172,
"kl": 3.4037277391953467,
"learning_rate": 1.3860404136686411e-05,
"loss": 0.02711915224790573,
"memory(GiB)": 79.43,
"reward": 0.2890625,
"reward_std": 0.20480823516845703,
"rewards/Response_no_think_reward_1/mean": 0.2890625,
"rewards/Response_no_think_reward_1/std": 0.7852212190628052,
"step": 151,
"train_speed(iter/s)": 0.006367
},
{
"clip_ratio/high_max": 0.002190002123825252,
"clip_ratio/high_mean": 0.002190002123825252,
"clip_ratio/low_mean": 0.010535595705732703,
"clip_ratio/low_min": 0.010535595705732703,
"clip_ratio/region_mean": 0.012725598004180938,
"epoch": 1.6869806094182827,
"grad_norm": 1.0936459304561021,
"kl": 3.5067162624327466,
"learning_rate": 1.294182271221377e-05,
"loss": 0.02425944060087204,
"memory(GiB)": 79.43,
"step": 152,
"train_speed(iter/s)": 0.006357
},
{
"clip_ratio/high_max": 0.004777037829626352,
"clip_ratio/high_mean": 0.004777037829626352,
"clip_ratio/low_mean": 0.0015179030015133321,
"clip_ratio/low_min": 0.0015179030015133321,
"clip_ratio/region_mean": 0.006294940831139684,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 47.0,
"completions/mean_length": 13.6796875,
"completions/min_length": 3.0,
"epoch": 1.6980609418282548,
"grad_norm": 3.294412855573239,
"kl": 4.274040638643783,
"learning_rate": 1.2052624879351104e-05,
"loss": 0.03787969425320625,
"memory(GiB)": 79.43,
"reward": 0.6015625,
"reward_std": 0.17859892547130585,
"rewards/Response_no_think_reward_1/mean": 0.6015625,
"rewards/Response_no_think_reward_1/std": 0.5931345224380493,
"step": 153,
"train_speed(iter/s)": 0.006206
},
{
"clip_ratio/high_max": 0.005947966914391145,
"clip_ratio/high_mean": 0.005947966914391145,
"clip_ratio/low_mean": 0.004764656303450465,
"clip_ratio/low_min": 0.004764656303450465,
"clip_ratio/region_mean": 0.010712623450672254,
"epoch": 1.709141274238227,
"grad_norm": 2.9610057087874977,
"kl": 3.866908519703429,
"learning_rate": 1.119311075724625e-05,
"loss": 0.033227190375328064,
"memory(GiB)": 79.43,
"step": 154,
"train_speed(iter/s)": 0.006199
},
{
"clip_ratio/high_max": 0.0032051282469183207,
"clip_ratio/high_mean": 0.0032051282469183207,
"clip_ratio/low_mean": 0.00683464459143579,
"clip_ratio/low_min": 0.00683464459143579,
"clip_ratio/region_mean": 0.01003977283835411,
"completions/clipped_ratio": 0.1875,
"completions/max_length": 51.0,
"completions/mean_length": 16.2265625,
"completions/min_length": 5.0,
"epoch": 1.7202216066481995,
"grad_norm": 3.0112138436872624,
"kl": 4.548647504067048,
"learning_rate": 1.0363570446297999e-05,
"loss": 0.03970736265182495,
"memory(GiB)": 79.43,
"reward": 0.328125,
"reward_std": 0.32412126660346985,
"rewards/Response_no_think_reward_1/mean": 0.328125,
"rewards/Response_no_think_reward_1/std": 0.743574857711792,
"step": 155,
"train_speed(iter/s)": 0.006071
},
{
"clip_ratio/high_max": 0.0029493323527276516,
"clip_ratio/high_mean": 0.0029493323527276516,
"clip_ratio/low_mean": 0.008986421715235338,
"clip_ratio/low_min": 0.008986421715235338,
"clip_ratio/region_mean": 0.011935754009755328,
"epoch": 1.7313019390581719,
"grad_norm": 3.1784321577702666,
"kl": 4.521617598744342,
"learning_rate": 9.564283930242257e-06,
"loss": 0.03974776715040207,
"memory(GiB)": 79.43,
"step": 156,
"train_speed(iter/s)": 0.006064
},
{
"clip_ratio/high_max": 0.005233740259427577,
"clip_ratio/high_mean": 0.005233740259427577,
"clip_ratio/low_mean": 0.013618246564874426,
"clip_ratio/low_min": 0.013618246564874426,
"clip_ratio/region_mean": 0.018851986795198172,
"completions/clipped_ratio": 0.140625,
"completions/max_length": 46.0,
"completions/mean_length": 12.71875,
"completions/min_length": 2.0,
"epoch": 1.742382271468144,
"grad_norm": 3.107280979259554,
"kl": 7.697673750575632,
"learning_rate": 8.795520981652961e-06,
"loss": 0.04705927148461342,
"memory(GiB)": 79.43,
"reward": 0.171875,
"reward_std": 0.49000412225723267,
"rewards/Response_no_think_reward_1/mean": 0.171875,
"rewards/Response_no_think_reward_1/std": 0.8143339157104492,
"step": 157,
"train_speed(iter/s)": 0.005969
},
{
"clip_ratio/high_max": 0.018029920000117272,
"clip_ratio/high_mean": 0.018029920000117272,
"clip_ratio/low_mean": 0.011481558292871341,
"clip_ratio/low_min": 0.011481558292871341,
"clip_ratio/region_mean": 0.029511478263884783,
"epoch": 1.7534626038781163,
"grad_norm": 2.4164221842161395,
"kl": 7.264460427570157,
"learning_rate": 8.05754107088923e-06,
"loss": 0.0432392843067646,
"memory(GiB)": 79.43,
"step": 158,
"train_speed(iter/s)": 0.005963
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.003813613730017096,
"clip_ratio/low_min": 0.003813613730017096,
"clip_ratio/region_mean": 0.003813613730017096,
"completions/clipped_ratio": 0.0859375,
"completions/max_length": 51.0,
"completions/mean_length": 14.8359375,
"completions/min_length": 4.0,
"epoch": 1.7645429362880887,
"grad_norm": 1.905247433106981,
"kl": 1.1771136652678251,
"learning_rate": 7.350593278519824e-06,
"loss": 0.00986653845757246,
"memory(GiB)": 79.43,
"reward": 0.359375,
"reward_std": 0.27169257402420044,
"rewards/Response_no_think_reward_1/mean": 0.359375,
"rewards/Response_no_think_reward_1/std": 0.7605879902839661,
"step": 159,
"train_speed(iter/s)": 0.005878
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.003413711878238246,
"clip_ratio/low_min": 0.003413711878238246,
"clip_ratio/region_mean": 0.003413711878238246,
"epoch": 1.775623268698061,
"grad_norm": 1.9755946085728415,
"kl": 1.1371133443899453,
"learning_rate": 6.674916211254289e-06,
"loss": 0.009400583803653717,
"memory(GiB)": 79.43,
"step": 160,
"train_speed(iter/s)": 0.005873
},
{
"clip_ratio/high_max": 0.0028935185400769114,
"clip_ratio/high_mean": 0.0028935185400769114,
"clip_ratio/low_mean": 0.007061597076244652,
"clip_ratio/low_min": 0.007061597076244652,
"clip_ratio/region_mean": 0.009955115616321564,
"completions/clipped_ratio": 0.1015625,
"completions/max_length": 50.0,
"completions/mean_length": 10.5625,
"completions/min_length": 2.0,
"epoch": 1.7867036011080333,
"grad_norm": 2.0459547550897166,
"kl": 3.880769203417003,
"learning_rate": 7.689418917193289e-05,
"loss": 0.024239888414740562,
"memory(GiB)": 77.36,
"reward": 0.234375,
"reward_std": 0.31300365924835205,
"rewards/Response_no_think_reward_1/mean": 0.234375,
"rewards/Response_no_think_reward_1/std": 0.7475352883338928,
"step": 161,
"train_speed(iter/s)": 0.21784
},
{
"clip_ratio/high_max": 0.005787037080153823,
"clip_ratio/high_mean": 0.005787037080153823,
"clip_ratio/low_mean": 0.011741390626411885,
"clip_ratio/low_min": 0.011741390626411885,
"clip_ratio/region_mean": 0.017528427706565708,
"epoch": 1.7977839335180055,
"grad_norm": 1.6284449438133224,
"kl": 3.9539552154019475,
"learning_rate": 7.570198200967362e-05,
"loss": 0.026077013462781906,
"memory(GiB)": 77.36,
"step": 162,
"train_speed(iter/s)": 0.173972
},
{
"clip_ratio/high_max": 0.0007267441833391786,
"clip_ratio/high_mean": 0.0007267441833391786,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0007267441833391786,
"completions/clipped_ratio": 0.078125,
"completions/max_length": 51.0,
"completions/mean_length": 15.1875,
"completions/min_length": 6.0,
"epoch": 1.8088642659279779,
"grad_norm": 6.190200790245519,
"kl": 2.1185005172155797,
"learning_rate": 7.451343403954856e-05,
"loss": 0.015710504725575447,
"memory(GiB)": 77.47,
"reward": 0.46875,
"reward_std": 0.11279275268316269,
"rewards/Response_no_think_reward_1/mean": 0.46875,
"rewards/Response_no_think_reward_1/std": 0.7310600280761719,
"step": 163,
"train_speed(iter/s)": 0.105292
},
{
"clip_ratio/high_max": 0.010034247010480613,
"clip_ratio/high_mean": 0.010034247010480613,
"clip_ratio/low_mean": 0.0050670221680775285,
"clip_ratio/low_min": 0.0050670221680775285,
"clip_ratio/region_mean": 0.015101269178558141,
"epoch": 1.8199445983379503,
"grad_norm": 1.5020471792427759,
"kl": 1.848701277282089,
"learning_rate": 7.332872425251018e-05,
"loss": 0.011468175798654556,
"memory(GiB)": 77.47,
"step": 164,
"train_speed(iter/s)": 0.094243
},
{
"clip_ratio/high_max": 0.0031305171723943204,
"clip_ratio/high_mean": 0.0031305171723943204,
"clip_ratio/low_mean": 0.006101353617850691,
"clip_ratio/low_min": 0.006101353617850691,
"clip_ratio/region_mean": 0.00923187073203735,
"completions/clipped_ratio": 0.0859375,
"completions/max_length": 51.0,
"completions/mean_length": 13.578125,
"completions/min_length": 4.0,
"epoch": 1.8310249307479225,
"grad_norm": 1.5859082442887886,
"kl": 3.1664798953570426,
"learning_rate": 7.21480310614947e-05,
"loss": 0.024385500699281693,
"memory(GiB)": 77.47,
"reward": 0.34375,
"reward_std": 0.3683975338935852,
"rewards/Response_no_think_reward_1/mean": 0.34375,
"rewards/Response_no_think_reward_1/std": 0.692337155342102,
"step": 165,
"train_speed(iter/s)": 0.069824
},
{
"clip_ratio/high_max": 0.019868265371769667,
"clip_ratio/high_mean": 0.019868265371769667,
"clip_ratio/low_mean": 0.011233113938942552,
"clip_ratio/low_min": 0.011233113938942552,
"clip_ratio/region_mean": 0.031101379543542862,
"epoch": 1.8421052631578947,
"grad_norm": 1.8023731350310037,
"kl": 2.8112484337762,
"learning_rate": 7.097153227455379e-05,
"loss": 0.013743140734732151,
"memory(GiB)": 79.43,
"step": 166,
"train_speed(iter/s)": 0.064907
},
{
"clip_ratio/high_max": 0.0011916428920812905,
"clip_ratio/high_mean": 0.0011916428920812905,
"clip_ratio/low_mean": 0.0034684768179431558,
"clip_ratio/low_min": 0.0034684768179431558,
"clip_ratio/region_mean": 0.004660119710024446,
"completions/clipped_ratio": 0.046875,
"completions/max_length": 31.0,
"completions/mean_length": 9.9765625,
"completions/min_length": 3.0,
"epoch": 1.8531855955678669,
"grad_norm": 2.973635940137616,
"kl": 2.157054567243904,
"learning_rate": 6.97994050680772e-05,
"loss": 0.017193181440234184,
"memory(GiB)": 79.43,
"reward": 0.484375,
"reward_std": 0.22119547426700592,
"rewards/Response_no_think_reward_1/mean": 0.484375,
"rewards/Response_no_think_reward_1/std": 0.7527835369110107,
"step": 167,
"train_speed(iter/s)": 0.052203
},
{
"clip_ratio/high_max": 0.006835455656982958,
"clip_ratio/high_mean": 0.006835455656982958,
"clip_ratio/low_mean": 0.046273494604974985,
"clip_ratio/low_min": 0.046273494604974985,
"clip_ratio/region_mean": 0.05310894921422005,
"epoch": 1.8642659279778393,
"grad_norm": 1.4603345730407995,
"kl": 3.1518404465168715,
"learning_rate": 6.863182596011087e-05,
"loss": 0.009599600918591022,
"memory(GiB)": 79.43,
"step": 168,
"train_speed(iter/s)": 0.04954
},
{
"clip_ratio/high_max": 0.0006965868233237416,
"clip_ratio/high_mean": 0.0006965868233237416,
"clip_ratio/low_mean": 0.002629449882078916,
"clip_ratio/low_min": 0.002629449882078916,
"clip_ratio/region_mean": 0.003326036676298827,
"completions/clipped_ratio": 0.0859375,
"completions/max_length": 51.0,
"completions/mean_length": 13.03125,
"completions/min_length": 3.0,
"epoch": 1.8753462603878117,
"grad_norm": 1.302354063269936,
"kl": 1.0980142642074497,
"learning_rate": 6.746897078377372e-05,
"loss": 0.01619286648929119,
"memory(GiB)": 79.43,
"reward": 0.359375,
"reward_std": 0.31949180364608765,
"rewards/Response_no_think_reward_1/mean": 0.359375,
"rewards/Response_no_think_reward_1/std": 0.7810186743736267,
"step": 169,
"train_speed(iter/s)": 0.041791
},
{
"clip_ratio/high_max": 0.0037332845386117697,
"clip_ratio/high_mean": 0.0037332845386117697,
"clip_ratio/low_mean": 0.013076976756565273,
"clip_ratio/low_min": 0.013076976756565273,
"clip_ratio/region_mean": 0.016810261004138738,
"epoch": 1.886426592797784,
"grad_norm": 0.6775107653086064,
"kl": 0.8065175649971934,
"learning_rate": 6.6311014660778e-05,
"loss": 0.005674303974956274,
"memory(GiB)": 79.43,
"step": 170,
"train_speed(iter/s)": 0.040129
},
{
"clip_ratio/high_max": 0.0017115735390689224,
"clip_ratio/high_mean": 0.0017115735390689224,
"clip_ratio/low_mean": 0.004471359890885651,
"clip_ratio/low_min": 0.004471359890885651,
"clip_ratio/region_mean": 0.006182933488162234,
"completions/clipped_ratio": 0.078125,
"completions/max_length": 51.0,
"completions/mean_length": 10.8359375,
"completions/min_length": 3.0,
"epoch": 1.897506925207756,
"grad_norm": 1.6323523762740895,
"kl": 1.2415385083295405,
"learning_rate": 6.515813197505656e-05,
"loss": 0.01243288628757,
"memory(GiB)": 79.43,
"reward": 0.265625,
"reward_std": 0.25462424755096436,
"rewards/Response_no_think_reward_1/mean": 0.265625,
"rewards/Response_no_think_reward_1/std": 0.7475352883338928,
"step": 171,
"train_speed(iter/s)": 0.035141
},
{
"clip_ratio/high_max": 0.015582295309286565,
"clip_ratio/high_mean": 0.015582295309286565,
"clip_ratio/low_mean": 0.010968676884658635,
"clip_ratio/low_min": 0.010968676884658635,
"clip_ratio/region_mean": 0.026550972019322217,
"epoch": 1.9085872576177285,
"grad_norm": 0.8010680473291589,
"kl": 1.0659651298337849,
"learning_rate": 6.401049634650118e-05,
"loss": 4.9868394853547215e-05,
"memory(GiB)": 79.43,
"step": 172,
"train_speed(iter/s)": 0.034005
},
{
"clip_ratio/high_max": 0.0024205285299103707,
"clip_ratio/high_mean": 0.0024205285299103707,
"clip_ratio/low_mean": 0.006205722645972855,
"clip_ratio/low_min": 0.006205722645972855,
"clip_ratio/region_mean": 0.008626251190435141,
"completions/clipped_ratio": 0.078125,
"completions/max_length": 51.0,
"completions/mean_length": 10.5,
"completions/min_length": 2.0,
"epoch": 1.919667590027701,
"grad_norm": 2.2598530338882874,
"kl": 3.693746126416954,
"learning_rate": 6.286828060481626e-05,
"loss": 0.02687670849263668,
"memory(GiB)": 79.43,
"reward": 0.328125,
"reward_std": 0.3272990882396698,
"rewards/Response_no_think_reward_1/mean": 0.328125,
"rewards/Response_no_think_reward_1/std": 0.7220855355262756,
"step": 173,
"train_speed(iter/s)": 0.030698
},
{
"clip_ratio/high_max": 0.01826251167221926,
"clip_ratio/high_mean": 0.01826251167221926,
"clip_ratio/low_mean": 0.027282171708066016,
"clip_ratio/low_min": 0.027282171708066016,
"clip_ratio/region_mean": 0.04554468300193548,
"epoch": 1.9307479224376731,
"grad_norm": 2.095627271198394,
"kl": 2.8586582938878564,
"learning_rate": 6.173165676349103e-05,
"loss": 0.017260747030377388,
"memory(GiB)": 79.43,
"step": 174,
"train_speed(iter/s)": 0.029861
},
{
"clip_ratio/high_max": 0.001936484724865295,
"clip_ratio/high_mean": 0.001936484724865295,
"clip_ratio/low_mean": 0.006831976061221212,
"clip_ratio/low_min": 0.006831976061221212,
"clip_ratio/region_mean": 0.008768460800638422,
"completions/clipped_ratio": 0.1640625,
"completions/max_length": 51.0,
"completions/mean_length": 15.4453125,
"completions/min_length": 4.0,
"epoch": 1.9418282548476453,
"grad_norm": 3.0827807424330964,
"kl": 1.9612275282852352,
"learning_rate": 6.060079599389521e-05,
"loss": 0.020160475745797157,
"memory(GiB)": 79.43,
"reward": 0.3125,
"reward_std": 0.29061752557754517,
"rewards/Response_no_think_reward_1/mean": 0.3125,
"rewards/Response_no_think_reward_1/std": 0.6728714108467102,
"step": 175,
"train_speed(iter/s)": 0.027244
},
{
"clip_ratio/high_max": 0.002366035128943622,
"clip_ratio/high_mean": 0.002366035128943622,
"clip_ratio/low_mean": 0.02325177617603913,
"clip_ratio/low_min": 0.02325177617603913,
"clip_ratio/region_mean": 0.02561781130498275,
"epoch": 1.9529085872576177,
"grad_norm": 1.4280426957771801,
"kl": 2.292961670376826,
"learning_rate": 5.947586859950103e-05,
"loss": 0.010125662200152874,
"memory(GiB)": 79.43,
"step": 176,
"train_speed(iter/s)": 0.026595
},
{
"clip_ratio/high_max": 0.0025192692410200834,
"clip_ratio/high_mean": 0.0025192692410200834,
"clip_ratio/low_mean": 0.008224956574849784,
"clip_ratio/low_min": 0.008224956574849784,
"clip_ratio/region_mean": 0.01074422593228519,
"completions/clipped_ratio": 0.1328125,
"completions/max_length": 51.0,
"completions/mean_length": 14.640625,
"completions/min_length": 2.0,
"epoch": 1.9639889196675901,
"grad_norm": 1.6671459210295219,
"kl": 2.1587753768544644,
"learning_rate": 5.83570439902363e-05,
"loss": 0.01727483607828617,
"memory(GiB)": 79.43,
"reward": 0.3515625,
"reward_std": 0.40715324878692627,
"rewards/Response_no_think_reward_1/mean": 0.3515625,
"rewards/Response_no_think_reward_1/std": 0.7273059487342834,
"step": 177,
"train_speed(iter/s)": 0.024303
},
{
"clip_ratio/high_max": 0.010156267147976905,
"clip_ratio/high_mean": 0.010156267147976905,
"clip_ratio/low_mean": 0.044217503629624844,
"clip_ratio/low_min": 0.044217503629624844,
"clip_ratio/region_mean": 0.05437377095222473,
"epoch": 1.9750692520775623,
"grad_norm": 1.0768089968910826,
"kl": 2.5309184610377997,
"learning_rate": 5.7244490656971815e-05,
"loss": 0.004669432528316975,
"memory(GiB)": 79.43,
"step": 178,
"train_speed(iter/s)": 0.02381
},
{
"clip_ratio/high_max": 0.004732780216727406,
"clip_ratio/high_mean": 0.004732780216727406,
"clip_ratio/low_mean": 0.008979557853308506,
"clip_ratio/low_min": 0.008979557853308506,
"clip_ratio/region_mean": 0.013712337939068675,
"completions/clipped_ratio": 0.171875,
"completions/max_length": 51.0,
"completions/mean_length": 10.34375,
"completions/min_length": 3.0,
"epoch": 1.9861495844875345,
"grad_norm": 5.022277357841641,
"kl": 8.668162640184164,
"learning_rate": 5.613837614614727e-05,
"loss": 0.07592084258794785,
"memory(GiB)": 79.43,
"reward": 0.359375,
"reward_std": 0.43547919392585754,
"rewards/Response_no_think_reward_1/mean": 0.359375,
"rewards/Response_no_think_reward_1/std": 0.7395931482315063,
"step": 179,
"train_speed(iter/s)": 0.021893
},
{
"clip_ratio/high_max": 0.012752994283800945,
"clip_ratio/high_mean": 0.012752994283800945,
"clip_ratio/low_mean": 0.013070159242488444,
"clip_ratio/low_min": 0.013070159242488444,
"clip_ratio/region_mean": 0.025823153846431524,
"epoch": 1.997229916897507,
"grad_norm": 3.8459944315903036,
"kl": 5.999185686931014,
"learning_rate": 5.503886703453933e-05,
"loss": 0.05208824574947357,
"memory(GiB)": 79.43,
"step": 180,
"train_speed(iter/s)": 0.02151
},
{
"clip_ratio/high_max": 0.003978091655881144,
"clip_ratio/high_mean": 0.003978091655881144,
"clip_ratio/low_mean": 0.010502228324185126,
"clip_ratio/low_min": 0.010502228324185126,
"clip_ratio/region_mean": 0.0144803200091701,
"completions/clipped_ratio": 0.21875,
"completions/max_length": 51.0,
"completions/mean_length": 18.1328125,
"completions/min_length": 3.0,
"epoch": 2.011080332409972,
"grad_norm": 2.078473476427749,
"kl": 4.435361886702594,
"learning_rate": 5.3946128904176e-05,
"loss": 0.04282068833708763,
"memory(GiB)": 79.43,
"reward": 0.3828125,
"reward_std": 0.39536070823669434,
"rewards/Response_no_think_reward_1/mean": 0.3828125,
"rewards/Response_no_think_reward_1/std": 0.7542122602462769,
"step": 181,
"train_speed(iter/s)": 0.020048
},
{
"clip_ratio/high_max": 0.008797917238553055,
"clip_ratio/high_mean": 0.008797917238553055,
"clip_ratio/low_mean": 0.032597673358395696,
"clip_ratio/low_min": 0.032597673358395696,
"clip_ratio/region_mean": 0.041395590524189174,
"epoch": 2.0221606648199444,
"grad_norm": 2.4243106079822865,
"kl": 4.070879372608033,
"learning_rate": 5.286032631740023e-05,
"loss": 0.031270649284124374,
"memory(GiB)": 79.43,
"step": 182,
"train_speed(iter/s)": 0.019738
},
{
"clip_ratio/high_max": 0.0034528043179307133,
"clip_ratio/high_mean": 0.0034528043179307133,
"clip_ratio/low_mean": 0.0063797495095059276,
"clip_ratio/low_min": 0.0063797495095059276,
"clip_ratio/region_mean": 0.00983255379833281,
"completions/clipped_ratio": 0.078125,
"completions/max_length": 41.0,
"completions/mean_length": 11.1171875,
"completions/min_length": 2.0,
"epoch": 2.033240997229917,
"grad_norm": 2.23823245032825,
"kl": 6.291976309614256,
"learning_rate": 5.1781622792087735e-05,
"loss": 0.035929106175899506,
"memory(GiB)": 79.43,
"reward": 0.3515625,
"reward_std": 0.25183364748954773,
"rewards/Response_no_think_reward_1/mean": 0.3515625,
"rewards/Response_no_think_reward_1/std": 0.7895961403846741,
"step": 183,
"train_speed(iter/s)": 0.018597
},
{
"clip_ratio/high_max": 0.005401399568654597,
"clip_ratio/high_mean": 0.005401399568654597,
"clip_ratio/low_mean": 0.017693198169581592,
"clip_ratio/low_min": 0.017693198169581592,
"clip_ratio/region_mean": 0.023094597971066833,
"epoch": 2.044321329639889,
"grad_norm": 1.8820731345647987,
"kl": 5.607178944861516,
"learning_rate": 5.071018077702161e-05,
"loss": 0.026268446817994118,
"memory(GiB)": 79.43,
"step": 184,
"train_speed(iter/s)": 0.018339
},
{
"clip_ratio/high_max": 0.0011341095669195056,
"clip_ratio/high_mean": 0.0011341095669195056,
"clip_ratio/low_mean": 0.002640133607201278,
"clip_ratio/low_min": 0.002640133607201278,
"clip_ratio/region_mean": 0.003774243174120784,
"completions/clipped_ratio": 0.1171875,
"completions/max_length": 51.0,
"completions/mean_length": 12.90625,
"completions/min_length": 4.0,
"epoch": 2.0554016620498614,
"grad_norm": 1.162828426123081,
"kl": 2.032533585326746,
"learning_rate": 4.964616162742826e-05,
"loss": 0.018750667572021484,
"memory(GiB)": 79.43,
"reward": 0.4765625,
"reward_std": 0.2650260925292969,
"rewards/Response_no_think_reward_1/mean": 0.4765625,
"rewards/Response_no_think_reward_1/std": 0.7205077409744263,
"step": 185,
"train_speed(iter/s)": 0.017419
},
{
"clip_ratio/high_max": 0.023568872129544616,
"clip_ratio/high_mean": 0.023568872129544616,
"clip_ratio/low_mean": 0.003940592927392572,
"clip_ratio/low_min": 0.003940592927392572,
"clip_ratio/region_mean": 0.02750946453306824,
"epoch": 2.0664819944598336,
"grad_norm": 1.5607380960763384,
"kl": 1.8544287201948464,
"learning_rate": 4.8589725580677835e-05,
"loss": 0.017856435850262642,
"memory(GiB)": 79.43,
"step": 186,
"train_speed(iter/s)": 0.017196
},
{
"clip_ratio/high_max": 0.0021306818234734237,
"clip_ratio/high_mean": 0.0021306818234734237,
"clip_ratio/low_mean": 0.009969204489607364,
"clip_ratio/low_min": 0.009969204489607364,
"clip_ratio/region_mean": 0.01209988642949611,
"completions/clipped_ratio": 0.1015625,
"completions/max_length": 47.0,
"completions/mean_length": 10.5859375,
"completions/min_length": 3.0,
"epoch": 2.0775623268698062,
"grad_norm": 2.2199233392807804,
"kl": 4.046690948307514,
"learning_rate": 4.754103173215313e-05,
"loss": 0.02398597076535225,
"memory(GiB)": 79.43,
"reward": 0.6171875,
"reward_std": 0.23733052611351013,
"rewards/Response_no_think_reward_1/mean": 0.6171875,
"rewards/Response_no_think_reward_1/std": 0.6413702368736267,
"step": 187,
"train_speed(iter/s)": 0.016352
},
{
"clip_ratio/high_max": 0.012073863414116204,
"clip_ratio/high_mean": 0.012073863414116204,
"clip_ratio/low_mean": 0.029048353899270296,
"clip_ratio/low_min": 0.029048353899270296,
"clip_ratio/region_mean": 0.041122217662632465,
"epoch": 2.0886426592797784,
"grad_norm": 0.9728732612498153,
"kl": 4.168077672366053,
"learning_rate": 4.6500238011290295e-05,
"loss": 0.013498052954673767,
"memory(GiB)": 79.43,
"step": 188,
"train_speed(iter/s)": 0.016166
},
{
"clip_ratio/high_max": 0.0011479975655674934,
"clip_ratio/high_mean": 0.0011479975655674934,
"clip_ratio/low_mean": 0.01187260658480227,
"clip_ratio/low_min": 0.01187260658480227,
"clip_ratio/region_mean": 0.013020604150369763,
"completions/clipped_ratio": 0.140625,
"completions/max_length": 51.0,
"completions/mean_length": 13.515625,
"completions/min_length": 2.0,
"epoch": 2.0997229916897506,
"grad_norm": 2.9644587346763975,
"kl": 2.9032904393970966,
"learning_rate": 4.546750115779538e-05,
"loss": 0.025254033505916595,
"memory(GiB)": 79.43,
"reward": 0.390625,
"reward_std": 0.3936568796634674,
"rewards/Response_no_think_reward_1/mean": 0.390625,
"rewards/Response_no_think_reward_1/std": 0.815541684627533,
"step": 189,
"train_speed(iter/s)": 0.015408
},
{
"clip_ratio/high_max": 0.002348073641769588,
"clip_ratio/high_mean": 0.002348073641769588,
"clip_ratio/low_mean": 0.03768142650369555,
"clip_ratio/low_min": 0.03768142650369555,
"clip_ratio/region_mean": 0.04002950026188046,
"epoch": 2.110803324099723,
"grad_norm": 1.6848916127813878,
"kl": 3.357306843623519,
"learning_rate": 4.444297669803981e-05,
"loss": 0.011942790821194649,
"memory(GiB)": 79.43,
"step": 190,
"train_speed(iter/s)": 0.01525
},
{
"clip_ratio/high_max": 0.0038575184298679233,
"clip_ratio/high_mean": 0.0038575184298679233,
"clip_ratio/low_mean": 0.0018564801721367985,
"clip_ratio/low_min": 0.0018564801721367985,
"clip_ratio/region_mean": 0.005713998660212383,
"completions/clipped_ratio": 0.1640625,
"completions/max_length": 49.0,
"completions/mean_length": 12.40625,
"completions/min_length": 2.0,
"epoch": 2.1218836565096955,
"grad_norm": 2.185626617314445,
"kl": 4.500719710253179,
"learning_rate": 4.342681892163868e-05,
"loss": 0.04343116655945778,
"memory(GiB)": 79.43,
"reward": 0.3125,
"reward_std": 0.3249424993991852,
"rewards/Response_no_think_reward_1/mean": 0.3125,
"rewards/Response_no_think_reward_1/std": 0.8108515739440918,
"step": 191,
"train_speed(iter/s)": 0.014605
},
{
"clip_ratio/high_max": 0.005653464584611356,
"clip_ratio/high_mean": 0.005653464584611356,
"clip_ratio/low_mean": 0.014596144377719611,
"clip_ratio/low_min": 0.014596144377719611,
"clip_ratio/region_mean": 0.020249608729500324,
"epoch": 2.1329639889196677,
"grad_norm": 1.3831255673808591,
"kl": 3.3093000794760883,
"learning_rate": 4.241918085821547e-05,
"loss": 0.025410175323486328,
"memory(GiB)": 79.43,
"step": 192,
"train_speed(iter/s)": 0.014469
},
{
"clip_ratio/high_max": 0.0007621950935572386,
"clip_ratio/high_mean": 0.0007621950935572386,
"clip_ratio/low_mean": 0.016430354735348374,
"clip_ratio/low_min": 0.016430354735348374,
"clip_ratio/region_mean": 0.017192550061736256,
"completions/clipped_ratio": 0.1875,
"completions/max_length": 52.0,
"completions/mean_length": 13.7578125,
"completions/min_length": 3.0,
"epoch": 2.14404432132964,
"grad_norm": 4.027535318826777,
"kl": 5.601793970912695,
"learning_rate": 4.142021425435612e-05,
"loss": 0.06872062385082245,
"memory(GiB)": 79.43,
"reward": 0.171875,
"reward_std": 0.3266732692718506,
"rewards/Response_no_think_reward_1/mean": 0.171875,
"rewards/Response_no_think_reward_1/std": 0.8334481716156006,
"step": 193,
"train_speed(iter/s)": 0.013947
},
{
"clip_ratio/high_max": 0.0032193634542636573,
"clip_ratio/high_mean": 0.0032193634542636573,
"clip_ratio/low_mean": 0.0076680079801008105,
"clip_ratio/low_min": 0.0076680079801008105,
"clip_ratio/region_mean": 0.010887371434364468,
"epoch": 2.155124653739612,
"grad_norm": 4.385106696987604,
"kl": 3.2986946790479124,
"learning_rate": 4.0430069550756665e-05,
"loss": 0.057711075991392136,
"memory(GiB)": 79.43,
"step": 194,
"train_speed(iter/s)": 0.013826
},
{
"clip_ratio/high_max": 0.0006905972259119153,
"clip_ratio/high_mean": 0.0006905972259119153,
"clip_ratio/low_mean": 0.0036786437267437577,
"clip_ratio/low_min": 0.0036786437267437577,
"clip_ratio/region_mean": 0.004369240894448012,
"completions/clipped_ratio": 0.046875,
"completions/max_length": 49.0,
"completions/mean_length": 12.3359375,
"completions/min_length": 6.0,
"epoch": 2.1662049861495847,
"grad_norm": 1.606761596776354,
"kl": 1.8307960720267147,
"learning_rate": 3.944889585956746e-05,
"loss": 0.01529858261346817,
"memory(GiB)": 79.43,
"reward": 0.53125,
"reward_std": 0.13994136452674866,
"rewards/Response_no_think_reward_1/mean": 0.53125,
"rewards/Response_no_think_reward_1/std": 0.6010162234306335,
"step": 195,
"train_speed(iter/s)": 0.01337
},
{
"clip_ratio/high_max": 0.0014173414674587548,
"clip_ratio/high_mean": 0.0014173414674587548,
"clip_ratio/low_mean": 0.01785696716979146,
"clip_ratio/low_min": 0.01785696716979146,
"clip_ratio/region_mean": 0.019274308579042554,
"epoch": 2.177285318559557,
"grad_norm": 0.6605318527442696,
"kl": 1.4683757405728102,
"learning_rate": 3.847684094193733e-05,
"loss": 0.006466372404247522,
"memory(GiB)": 79.43,
"step": 196,
"train_speed(iter/s)": 0.013262
},
{
"clip_ratio/high_max": 0.0005787037080153823,
"clip_ratio/high_mean": 0.0005787037080153823,
"clip_ratio/low_mean": 0.00706394191365689,
"clip_ratio/low_min": 0.00706394191365689,
"clip_ratio/region_mean": 0.007642645505256951,
"completions/clipped_ratio": 0.1171875,
"completions/max_length": 51.0,
"completions/mean_length": 12.6640625,
"completions/min_length": 4.0,
"epoch": 2.188365650969529,
"grad_norm": 2.268325311129086,
"kl": 1.9495291512284894,
"learning_rate": 3.751405118576138e-05,
"loss": 0.021440906450152397,
"memory(GiB)": 79.43,
"reward": 0.40625,
"reward_std": 0.33038538694381714,
"rewards/Response_no_think_reward_1/mean": 0.40625,
"rewards/Response_no_think_reward_1/std": 0.692337155342102,
"step": 197,
"train_speed(iter/s)": 0.012815
},
{
"clip_ratio/high_max": 0.0015153939457377419,
"clip_ratio/high_mean": 0.0015153939457377419,
"clip_ratio/low_mean": 0.03491706313798204,
"clip_ratio/low_min": 0.03491706313798204,
"clip_ratio/region_mean": 0.03643245715647936,
"epoch": 2.1994459833795013,
"grad_norm": 1.065092801753265,
"kl": 2.4326230198785197,
"learning_rate": 3.6560671583635467e-05,
"loss": 0.014199762605130672,
"memory(GiB)": 79.43,
"step": 198,
"train_speed(iter/s)": 0.012721
},
{
"clip_ratio/high_max": 0.002581158187240362,
"clip_ratio/high_mean": 0.002581158187240362,
"clip_ratio/low_mean": 0.0033617604058235884,
"clip_ratio/low_min": 0.0033617604058235884,
"clip_ratio/region_mean": 0.0059429185930639505,
"completions/clipped_ratio": 0.09375,
"completions/max_length": 51.0,
"completions/mean_length": 11.40625,
"completions/min_length": 2.0,
"epoch": 2.2105263157894735,
"grad_norm": 4.969169060239286,
"kl": 2.6644327271496877,
"learning_rate": 3.561684571102087e-05,
"loss": 0.04970448464155197,
"memory(GiB)": 79.43,
"reward": 0.609375,
"reward_std": 0.189372718334198,
"rewards/Response_no_think_reward_1/mean": 0.609375,
"rewards/Response_no_think_reward_1/std": 0.617773175239563,
"step": 199,
"train_speed(iter/s)": 0.012318
},
{
"clip_ratio/high_max": 0.007839692523702979,
"clip_ratio/high_mean": 0.007839692523702979,
"clip_ratio/low_mean": 0.007207914255559444,
"clip_ratio/low_min": 0.007207914255559444,
"clip_ratio/region_mean": 0.015047606895677745,
"epoch": 2.221606648199446,
"grad_norm": 1.5017699084351217,
"kl": 1.7442057720618322,
"learning_rate": 3.468271570462235e-05,
"loss": 0.03236105293035507,
"memory(GiB)": 79.43,
"step": 200,
"train_speed(iter/s)": 0.012235
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.011193181620910764,
"clip_ratio/low_min": 0.011193181620910764,
"clip_ratio/region_mean": 0.011193181620910764,
"completions/clipped_ratio": 0.109375,
"completions/max_length": 51.0,
"completions/mean_length": 14.9140625,
"completions/min_length": 3.0,
"epoch": 2.2326869806094183,
"grad_norm": 4.931712878754855,
"kl": 5.507446703501046,
"learning_rate": 3.375842224098281e-05,
"loss": 0.04869800806045532,
"memory(GiB)": 79.43,
"reward": 0.0546875,
"reward_std": 0.13610614836215973,
"rewards/Response_no_think_reward_1/mean": 0.0546875,
"rewards/Response_no_think_reward_1/std": 0.9076108336448669,
"step": 201,
"train_speed(iter/s)": 0.011859
},
{
"clip_ratio/high_max": 0.0006249999860301614,
"clip_ratio/high_mean": 0.0006249999860301614,
"clip_ratio/low_mean": 0.01068181823939085,
"clip_ratio/low_min": 0.01068181823939085,
"clip_ratio/region_mean": 0.011306818574666977,
"epoch": 2.2437673130193905,
"grad_norm": 1.976139653305045,
"kl": 2.772067047073506,
"learning_rate": 3.2844104515298155e-05,
"loss": 0.02979501150548458,
"memory(GiB)": 79.43,
"step": 202,
"train_speed(iter/s)": 0.011784
},
{
"clip_ratio/high_max": 0.0021551724057644606,
"clip_ratio/high_mean": 0.0021551724057644606,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0021551724057644606,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 51.0,
"completions/mean_length": 15.109375,
"completions/min_length": 2.0,
"epoch": 2.254847645429363,
"grad_norm": 1.5562382605817529,
"kl": 0.8431436920873239,
"learning_rate": 3.19399002204547e-05,
"loss": 0.007927711121737957,
"memory(GiB)": 79.43,
"reward": 0.5546875,
"reward_std": 0.1965562254190445,
"rewards/Response_no_think_reward_1/mean": 0.5546875,
"rewards/Response_no_think_reward_1/std": 0.612322211265564,
"step": 203,
"train_speed(iter/s)": 0.011458
},
{
"clip_ratio/high_max": 0.01512533612549305,
"clip_ratio/high_mean": 0.01512533612549305,
"clip_ratio/low_mean": 0.011428028345108032,
"clip_ratio/low_min": 0.011428028345108032,
"clip_ratio/region_mean": 0.026553363888524473,
"epoch": 2.2659279778393353,
"grad_norm": 0.7974321717950155,
"kl": 0.8073496993965819,
"learning_rate": 3.104594552629331e-05,
"loss": -0.0036839484237134457,
"memory(GiB)": 79.43,
"step": 204,
"train_speed(iter/s)": 0.011391
},
{
"clip_ratio/high_max": 0.0038362154737114906,
"clip_ratio/high_mean": 0.0038362154737114906,
"clip_ratio/low_mean": 0.006098126468714327,
"clip_ratio/low_min": 0.006098126468714327,
"clip_ratio/region_mean": 0.009934341884218156,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 51.0,
"completions/mean_length": 9.859375,
"completions/min_length": 3.0,
"epoch": 2.2770083102493075,
"grad_norm": 1.6738122176232313,
"kl": 2.2672509452095255,
"learning_rate": 3.016237505910272e-05,
"loss": 0.019055092707276344,
"memory(GiB)": 79.43,
"reward": 0.3828125,
"reward_std": 0.24184317886829376,
"rewards/Response_no_think_reward_1/mean": 0.3828125,
"rewards/Response_no_think_reward_1/std": 0.6289736032485962,
"step": 205,
"train_speed(iter/s)": 0.011117
},
{
"clip_ratio/high_max": 0.008882887894287705,
"clip_ratio/high_mean": 0.008882887894287705,
"clip_ratio/low_mean": 0.0127694628899917,
"clip_ratio/low_min": 0.0127694628899917,
"clip_ratio/region_mean": 0.021652350667864084,
"epoch": 2.2880886426592797,
"grad_norm": 1.7770705331591035,
"kl": 2.6307186615886167,
"learning_rate": 2.9289321881345254e-05,
"loss": 0.020140212029218674,
"memory(GiB)": 79.43,
"step": 206,
"train_speed(iter/s)": 0.011054
},
{
"clip_ratio/high_max": 0.0027895565144717693,
"clip_ratio/high_mean": 0.0027895565144717693,
"clip_ratio/low_mean": 0.004148252191953361,
"clip_ratio/low_min": 0.004148252191953361,
"clip_ratio/region_mean": 0.0069378085900098085,
"completions/clipped_ratio": 0.09375,
"completions/max_length": 51.0,
"completions/mean_length": 11.28125,
"completions/min_length": 2.0,
"epoch": 2.299168975069252,
"grad_norm": 1.319228923221061,
"kl": 2.2385971848852932,
"learning_rate": 2.8426917471618144e-05,
"loss": 0.02266935259103775,
"memory(GiB)": 79.43,
"reward": 0.3359375,
"reward_std": 0.2283492535352707,
"rewards/Response_no_think_reward_1/mean": 0.3359375,
"rewards/Response_no_think_reward_1/std": 0.7018237709999084,
"step": 207,
"train_speed(iter/s)": 0.010791
},
{
"clip_ratio/high_max": 0.011985209857812151,
"clip_ratio/high_mean": 0.011985209857812151,
"clip_ratio/low_mean": 0.007749008131213486,
"clip_ratio/low_min": 0.007749008131213486,
"clip_ratio/region_mean": 0.019734218367375433,
"epoch": 2.3102493074792245,
"grad_norm": 1.4392087091443533,
"kl": 2.1376722818240523,
"learning_rate": 2.7575291704853323e-05,
"loss": 0.019175298511981964,
"memory(GiB)": 79.43,
"step": 208,
"train_speed(iter/s)": 0.010735
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.005309505155310035,
"clip_ratio/low_min": 0.005309505155310035,
"clip_ratio/region_mean": 0.005309505155310035,
"completions/clipped_ratio": 0.1484375,
"completions/max_length": 51.0,
"completions/mean_length": 13.78125,
"completions/min_length": 2.0,
"epoch": 2.3213296398891967,
"grad_norm": 3.9723735950660957,
"kl": 5.278170272591524,
"learning_rate": 2.673457283275873e-05,
"loss": 0.035180311650037766,
"memory(GiB)": 79.43,
"reward": 0.40625,
"reward_std": 0.13098980486392975,
"rewards/Response_no_think_reward_1/mean": 0.40625,
"rewards/Response_no_think_reward_1/std": 0.6692044734954834,
"step": 209,
"train_speed(iter/s)": 0.010491
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.005584693106357008,
"clip_ratio/low_min": 0.005584693106357008,
"clip_ratio/region_mean": 0.005584693106357008,
"epoch": 2.332409972299169,
"grad_norm": 1.3665368093756183,
"kl": 2.833973544766195,
"learning_rate": 2.5904887464504114e-05,
"loss": 0.021212518215179443,
"memory(GiB)": 79.43,
"step": 210,
"train_speed(iter/s)": 0.010441
},
{
"clip_ratio/high_max": 0.0037202382227405906,
"clip_ratio/high_mean": 0.0037202382227405906,
"clip_ratio/low_mean": 0.0047081211232580245,
"clip_ratio/low_min": 0.0047081211232580245,
"clip_ratio/region_mean": 0.008428359229583293,
"completions/clipped_ratio": 0.109375,
"completions/max_length": 51.0,
"completions/mean_length": 13.515625,
"completions/min_length": 2.0,
"epoch": 2.343490304709141,
"grad_norm": 13.071565563919009,
"kl": 3.0507688876241446,
"learning_rate": 2.5086360547654087e-05,
"loss": 0.03715192899107933,
"memory(GiB)": 79.43,
"reward": 0.3515625,
"reward_std": 0.23045912384986877,
"rewards/Response_no_think_reward_1/mean": 0.3515625,
"rewards/Response_no_think_reward_1/std": 0.8189665675163269,
"step": 211,
"train_speed(iter/s)": 0.010202
},
{
"clip_ratio/high_max": 0.003481080086203292,
"clip_ratio/high_mean": 0.003481080086203292,
"clip_ratio/low_mean": 0.006368864676915109,
"clip_ratio/low_min": 0.006368864676915109,
"clip_ratio/region_mean": 0.009849944588495418,
"epoch": 2.3545706371191137,
"grad_norm": 3.097490825276586,
"kl": 2.710134948603809,
"learning_rate": 2.4279115349351543e-05,
"loss": 0.022687038406729698,
"memory(GiB)": 79.43,
"step": 212,
"train_speed(iter/s)": 0.010156
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.002016128972172737,
"clip_ratio/low_min": 0.002016128972172737,
"clip_ratio/region_mean": 0.002016128972172737,
"completions/clipped_ratio": 0.046875,
"completions/max_length": 51.0,
"completions/mean_length": 10.421875,
"completions/min_length": 2.0,
"epoch": 2.365650969529086,
"grad_norm": 1.136594776957956,
"kl": 1.1303195441141725,
"learning_rate": 2.3483273437754107e-05,
"loss": 0.009659601375460625,
"memory(GiB)": 79.43,
"reward": 0.390625,
"reward_std": 0.10205793380737305,
"rewards/Response_no_think_reward_1/mean": 0.390625,
"rewards/Response_no_think_reward_1/std": 0.7342506647109985,
"step": 213,
"train_speed(iter/s)": 0.009943
},
{
"clip_ratio/high_max": 0.006048386916518211,
"clip_ratio/high_mean": 0.006048386916518211,
"clip_ratio/low_mean": 0.00942321156617254,
"clip_ratio/low_min": 0.00942321156617254,
"clip_ratio/region_mean": 0.015471598482690752,
"epoch": 2.376731301939058,
"grad_norm": 0.825911363622962,
"kl": 1.1256521647737827,
"learning_rate": 2.26989546637263e-05,
"loss": 0.005634521599858999,
"memory(GiB)": 79.43,
"step": 214,
"train_speed(iter/s)": 0.009901
},
{
"clip_ratio/high_max": 0.001342517207376659,
"clip_ratio/high_mean": 0.001342517207376659,
"clip_ratio/low_mean": 0.0013586956774815917,
"clip_ratio/low_min": 0.0013586956774815917,
"clip_ratio/region_mean": 0.0027012128848582506,
"completions/clipped_ratio": 0.1328125,
"completions/max_length": 51.0,
"completions/mean_length": 15.6484375,
"completions/min_length": 4.0,
"epoch": 2.3878116343490303,
"grad_norm": 1.6607743819090053,
"kl": 1.4292651428841054,
"learning_rate": 2.1926277142790552e-05,
"loss": 0.01813752017915249,
"memory(GiB)": 79.43,
"reward": 0.609375,
"reward_std": 0.31577742099761963,
"rewards/Response_no_think_reward_1/mean": 0.609375,
"rewards/Response_no_think_reward_1/std": 0.6668102145195007,
"step": 215,
"train_speed(iter/s)": 0.009685
},
{
"clip_ratio/high_max": 0.0026189450873062015,
"clip_ratio/high_mean": 0.0026189450873062015,
"clip_ratio/low_mean": 0.0053210301557555795,
"clip_ratio/low_min": 0.0053210301557555795,
"clip_ratio/region_mean": 0.007939975359477103,
"epoch": 2.398891966759003,
"grad_norm": 1.3712211159888634,
"kl": 1.414744115434587,
"learning_rate": 2.116535723733938e-05,
"loss": 0.01291576400399208,
"memory(GiB)": 79.43,
"step": 216,
"train_speed(iter/s)": 0.009645
},
{
"clip_ratio/high_max": 0.002932063478510827,
"clip_ratio/high_mean": 0.002932063478510827,
"clip_ratio/low_mean": 0.0015625000232830644,
"clip_ratio/low_min": 0.0015625000232830644,
"clip_ratio/region_mean": 0.004494563501793891,
"completions/clipped_ratio": 0.0703125,
"completions/max_length": 49.0,
"completions/mean_length": 10.9296875,
"completions/min_length": 2.0,
"epoch": 2.409972299168975,
"grad_norm": 6.046911872213327,
"kl": 3.113054335270135,
"learning_rate": 2.0416309539111654e-05,
"loss": 0.050445497035980225,
"memory(GiB)": 79.43,
"reward": 0.484375,
"reward_std": 0.2109457552433014,
"rewards/Response_no_think_reward_1/mean": 0.484375,
"rewards/Response_no_think_reward_1/std": 0.8416741490364075,
"step": 217,
"train_speed(iter/s)": 0.009417
},
{
"clip_ratio/high_max": 0.0037691170582547784,
"clip_ratio/high_mean": 0.0037691170582547784,
"clip_ratio/low_mean": 0.0015625000232830644,
"clip_ratio/low_min": 0.0015625000232830644,
"clip_ratio/region_mean": 0.005331617081537843,
"epoch": 2.4210526315789473,
"grad_norm": 5.501927716874391,
"kl": 2.3150660254395916,
"learning_rate": 1.967924685193552e-05,
"loss": 0.030173499137163162,
"memory(GiB)": 79.43,
"step": 218,
"train_speed(iter/s)": 0.009382
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0234375,
"completions/max_length": 47.0,
"completions/mean_length": 7.734375,
"completions/min_length": 2.0,
"epoch": 2.4321329639889195,
"grad_norm": 1.8000862094404895,
"kl": 1.0117176891799318,
"learning_rate": 1.8954280174740537e-05,
"loss": 0.009762465953826904,
"memory(GiB)": 79.43,
"reward": 0.7265625,
"reward_std": 0.19728107750415802,
"rewards/Response_no_think_reward_1/mean": 0.7265625,
"rewards/Response_no_think_reward_1/std": 0.5130554437637329,
"step": 219,
"train_speed(iter/s)": 0.009197
},
{
"clip_ratio/high_max": 0.012120938044972718,
"clip_ratio/high_mean": 0.012120938044972718,
"clip_ratio/low_mean": 0.008152684022206813,
"clip_ratio/low_min": 0.008152684022206813,
"clip_ratio/region_mean": 0.020273622183594853,
"epoch": 2.443213296398892,
"grad_norm": 1.1304227715929336,
"kl": 1.0098483412293717,
"learning_rate": 1.824151868484164e-05,
"loss": 0.002491909544914961,
"memory(GiB)": 79.43,
"step": 220,
"train_speed(iter/s)": 0.009165
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0390625,
"completions/max_length": 38.0,
"completions/mean_length": 10.0546875,
"completions/min_length": 2.0,
"epoch": 2.4542936288088644,
"grad_norm": 0.7487543034262131,
"kl": 2.248408433049917,
"learning_rate": 1.7541069721497493e-05,
"loss": 0.020080924034118652,
"memory(GiB)": 79.43,
"reward": 0.5234375,
"reward_std": 0.0765409916639328,
"rewards/Response_no_think_reward_1/mean": 0.5234375,
"rewards/Response_no_think_reward_1/std": 0.8320815563201904,
"step": 221,
"train_speed(iter/s)": 0.008978
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.002016128972172737,
"clip_ratio/low_min": 0.002016128972172737,
"clip_ratio/region_mean": 0.002016128972172737,
"epoch": 2.4653739612188366,
"grad_norm": 0.5471388079740459,
"kl": 2.286591000854969,
"learning_rate": 1.6853038769745467e-05,
"loss": 0.020101318135857582,
"memory(GiB)": 79.43,
"step": 222,
"train_speed(iter/s)": 0.008949
},
{
"clip_ratio/high_max": 0.00021186440426390618,
"clip_ratio/high_mean": 0.00021186440426390618,
"clip_ratio/low_mean": 0.008871822035871446,
"clip_ratio/low_min": 0.008871822035871446,
"clip_ratio/region_mean": 0.009083686396479607,
"completions/clipped_ratio": 0.09375,
"completions/max_length": 51.0,
"completions/mean_length": 13.7109375,
"completions/min_length": 2.0,
"epoch": 2.4764542936288088,
"grad_norm": 1.362062642699485,
"kl": 2.5377135479357094,
"learning_rate": 1.6177529444516194e-05,
"loss": 0.02206542156636715,
"memory(GiB)": 79.43,
"reward": 0.296875,
"reward_std": 0.19568344950675964,
"rewards/Response_no_think_reward_1/mean": 0.296875,
"rewards/Response_no_think_reward_1/std": 0.8993381261825562,
"step": 223,
"train_speed(iter/s)": 0.008782
},
{
"clip_ratio/high_max": 0.0016772599192336202,
"clip_ratio/high_mean": 0.0016772599192336202,
"clip_ratio/low_mean": 0.006158006319310516,
"clip_ratio/low_min": 0.006158006319310516,
"clip_ratio/region_mean": 0.007835266180336475,
"epoch": 2.487534626038781,
"grad_norm": 1.146370544556826,
"kl": 2.2770726842572913,
"learning_rate": 1.551464347502929e-05,
"loss": 0.019708380103111267,
"memory(GiB)": 79.43,
"step": 224,
"train_speed(iter/s)": 0.008755
},
{
"clip_ratio/high_max": 0.0006412798393284902,
"clip_ratio/high_mean": 0.0006412798393284902,
"clip_ratio/low_mean": 0.005606794758932665,
"clip_ratio/low_min": 0.005606794758932665,
"clip_ratio/region_mean": 0.006248074598261155,
"completions/clipped_ratio": 0.0390625,
"completions/max_length": 51.0,
"completions/mean_length": 11.546875,
"completions/min_length": 3.0,
"epoch": 2.4986149584487536,
"grad_norm": 15.413339320982411,
"kl": 8.634065281590665,
"learning_rate": 1.486448068947348e-05,
"loss": 0.12368878722190857,
"memory(GiB)": 79.43,
"reward": 0.3828125,
"reward_std": 0.24082913994789124,
"rewards/Response_no_think_reward_1/mean": 0.3828125,
"rewards/Response_no_think_reward_1/std": 0.7000685334205627,
"step": 225,
"train_speed(iter/s)": 0.008606
},
{
"clip_ratio/high_max": 0.002233636550954543,
"clip_ratio/high_mean": 0.002233636550954543,
"clip_ratio/low_mean": 0.0067390410986263305,
"clip_ratio/low_min": 0.0067390410986263305,
"clip_ratio/region_mean": 0.008972677649580874,
"epoch": 2.509695290858726,
"grad_norm": 9.203465486887826,
"kl": 6.063290272684753,
"learning_rate": 1.42271389999728e-05,
"loss": 0.08513150364160538,
"memory(GiB)": 79.43,
"step": 226,
"train_speed(iter/s)": 0.008581
},
{
"clip_ratio/high_max": 0.0003799392143264413,
"clip_ratio/high_mean": 0.0003799392143264413,
"clip_ratio/low_mean": 0.0011398176429793239,
"clip_ratio/low_min": 0.0011398176429793239,
"clip_ratio/region_mean": 0.0015197568573057652,
"completions/clipped_ratio": 0.0859375,
"completions/max_length": 51.0,
"completions/mean_length": 10.0390625,
"completions/min_length": 3.0,
"epoch": 2.520775623268698,
"grad_norm": 2.120226005232822,
"kl": 0.9155051370617002,
"learning_rate": 1.360271438784133e-05,
"loss": 0.010180685669183731,
"memory(GiB)": 79.43,
"reward": 0.1484375,
"reward_std": 0.1979907602071762,
"rewards/Response_no_think_reward_1/mean": 0.1484375,
"rewards/Response_no_think_reward_1/std": 0.7326990962028503,
"step": 227,
"train_speed(iter/s)": 0.008446
},
{
"clip_ratio/high_max": 0.0009498480358161032,
"clip_ratio/high_mean": 0.0009498480358161032,
"clip_ratio/low_mean": 0.009764322196133435,
"clip_ratio/low_min": 0.009764322196133435,
"clip_ratio/region_mean": 0.010714170290157199,
"epoch": 2.5318559556786706,
"grad_norm": 1.4078021108161598,
"kl": 0.9818148800404742,
"learning_rate": 1.2991300889128866e-05,
"loss": 0.004585812333971262,
"memory(GiB)": 79.43,
"step": 228,
"train_speed(iter/s)": 0.008423
},
{
"clip_ratio/high_max": 0.0011812333250418305,
"clip_ratio/high_mean": 0.0011812333250418305,
"clip_ratio/low_mean": 0.0039037082460708916,
"clip_ratio/low_min": 0.0039037082460708916,
"clip_ratio/region_mean": 0.005084941629320383,
"completions/clipped_ratio": 0.0390625,
"completions/max_length": 51.0,
"completions/mean_length": 8.265625,
"completions/min_length": 2.0,
"epoch": 2.542936288088643,
"grad_norm": 5.0825431269611965,
"kl": 1.4881244308780879,
"learning_rate": 1.2392990580459352e-05,
"loss": 0.01816009357571602,
"memory(GiB)": 79.43,
"reward": 0.265625,
"reward_std": 0.19226360321044922,
"rewards/Response_no_think_reward_1/mean": 0.265625,
"rewards/Response_no_think_reward_1/std": 0.9004318714141846,
"step": 229,
"train_speed(iter/s)": 0.008282
},
{
"clip_ratio/high_max": 0.0009686482953839004,
"clip_ratio/high_mean": 0.0009686482953839004,
"clip_ratio/low_mean": 0.00444972823606804,
"clip_ratio/low_min": 0.00444972823606804,
"clip_ratio/region_mean": 0.0054183765314519405,
"epoch": 2.554016620498615,
"grad_norm": 5.947762469687869,
"kl": 1.5637177263852209,
"learning_rate": 1.1807873565164506e-05,
"loss": 0.014085257425904274,
"memory(GiB)": 79.43,
"step": 230,
"train_speed(iter/s)": 0.008261
},
{
"clip_ratio/high_max": 0.001238734505022876,
"clip_ratio/high_mean": 0.001238734505022876,
"clip_ratio/low_mean": 0.0045786225236952305,
"clip_ratio/low_min": 0.0045786225236952305,
"clip_ratio/region_mean": 0.0058173570287181064,
"completions/clipped_ratio": 0.1640625,
"completions/max_length": 51.0,
"completions/mean_length": 15.609375,
"completions/min_length": 3.0,
"epoch": 2.565096952908587,
"grad_norm": 2.991093002864201,
"kl": 2.183058348018676,
"learning_rate": 1.1236037959714618e-05,
"loss": 0.021889833733439445,
"memory(GiB)": 79.43,
"reward": 0.4609375,
"reward_std": 0.3135277330875397,
"rewards/Response_no_think_reward_1/mean": 0.4609375,
"rewards/Response_no_think_reward_1/std": 0.7827102541923523,
"step": 231,
"train_speed(iter/s)": 0.008131
},
{
"clip_ratio/high_max": 0.0028425113996490836,
"clip_ratio/high_mean": 0.0028425113996490836,
"clip_ratio/low_mean": 0.009468507007113658,
"clip_ratio/low_min": 0.009468507007113658,
"clip_ratio/region_mean": 0.012311018639593385,
"epoch": 2.5761772853185594,
"grad_norm": 2.565607083550086,
"kl": 1.9908064976334572,
"learning_rate": 1.067756988044848e-05,
"loss": 0.016938552260398865,
"memory(GiB)": 79.43,
"step": 232,
"train_speed(iter/s)": 0.008111
},
{
"clip_ratio/high_max": 0.0014164648891892284,
"clip_ratio/high_mean": 0.0014164648891892284,
"clip_ratio/low_mean": 0.0031525760132353753,
"clip_ratio/low_min": 0.0031525760132353753,
"clip_ratio/region_mean": 0.004569040902424604,
"completions/clipped_ratio": 0.1015625,
"completions/max_length": 51.0,
"completions/mean_length": 9.75,
"completions/min_length": 2.0,
"epoch": 2.587257617728532,
"grad_norm": 5.0565474550432326,
"kl": 5.047875659758574,
"learning_rate": 1.0132553430604608e-05,
"loss": 0.07161970436573029,
"memory(GiB)": 79.43,
"reward": 0.2265625,
"reward_std": 0.17859892547130585,
"rewards/Response_no_think_reward_1/mean": 0.2265625,
"rewards/Response_no_think_reward_1/std": 0.7446908354759216,
"step": 233,
"train_speed(iter/s)": 0.008004
},
{
"clip_ratio/high_max": 0.006010896002408117,
"clip_ratio/high_mean": 0.006010896002408117,
"clip_ratio/low_mean": 0.006369341921526939,
"clip_ratio/low_min": 0.006369341921526939,
"clip_ratio/region_mean": 0.01238023757468909,
"epoch": 2.598337950138504,
"grad_norm": 3.9632773907657626,
"kl": 4.599423869600287,
"learning_rate": 9.601070687655667e-06,
"loss": 0.062261972576379776,
"memory(GiB)": 79.43,
"step": 234,
"train_speed(iter/s)": 0.007986
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.001923076924867928,
"clip_ratio/low_min": 0.001923076924867928,
"clip_ratio/region_mean": 0.001923076924867928,
"completions/clipped_ratio": 0.1015625,
"completions/max_length": 51.0,
"completions/mean_length": 9.453125,
"completions/min_length": 2.0,
"epoch": 2.6094182825484764,
"grad_norm": 5.621375964647713,
"kl": 4.620725775370374,
"learning_rate": 9.083201690947763e-06,
"loss": 0.0421258881688118,
"memory(GiB)": 79.43,
"reward": 0.28125,
"reward_std": 0.1468440443277359,
"rewards/Response_no_think_reward_1/mean": 0.28125,
"rewards/Response_no_think_reward_1/std": 0.7830638289451599,
"step": 235,
"train_speed(iter/s)": 0.007861
},
{
"clip_ratio/high_max": 0.010077075916342437,
"clip_ratio/high_mean": 0.010077075916342437,
"clip_ratio/low_mean": 0.000961538462433964,
"clip_ratio/low_min": 0.000961538462433964,
"clip_ratio/region_mean": 0.01103861432056874,
"epoch": 2.6204986149584486,
"grad_norm": 4.170803291082545,
"kl": 4.307271543191746,
"learning_rate": 8.579024429646932e-06,
"loss": 0.03107025846838951,
"memory(GiB)": 79.43,
"step": 236,
"train_speed(iter/s)": 0.007844
},
{
"clip_ratio/high_max": 0.00024319066142197698,
"clip_ratio/high_mean": 0.00024319066142197698,
"clip_ratio/low_mean": 0.0016447368543595076,
"clip_ratio/low_min": 0.0016447368543595076,
"clip_ratio/region_mean": 0.0018879275157814845,
"completions/clipped_ratio": 0.1015625,
"completions/max_length": 51.0,
"completions/mean_length": 12.21875,
"completions/min_length": 2.0,
"epoch": 2.6315789473684212,
"grad_norm": 1.3493712018234787,
"kl": 1.6652233960921876,
"learning_rate": 8.088614830994223e-06,
"loss": 0.015416830778121948,
"memory(GiB)": 79.43,
"reward": 0.1640625,
"reward_std": 0.21537472307682037,
"rewards/Response_no_think_reward_1/mean": 0.1640625,
"rewards/Response_no_think_reward_1/std": 0.7713097929954529,
"step": 237,
"train_speed(iter/s)": 0.007735
},
{
"clip_ratio/high_max": 0.0005482456181198359,
"clip_ratio/high_mean": 0.0005482456181198359,
"clip_ratio/low_mean": 0.0018879275157814845,
"clip_ratio/low_min": 0.0018879275157814845,
"clip_ratio/region_mean": 0.0024361731339013204,
"epoch": 2.6426592797783934,
"grad_norm": 1.3201384353784884,
"kl": 1.5714624499087222,
"learning_rate": 7.612046748871327e-06,
"loss": 0.01534443162381649,
"memory(GiB)": 79.43,
"step": 238,
"train_speed(iter/s)": 0.00772
},
{
"clip_ratio/high_max": 0.00204707685043104,
"clip_ratio/high_mean": 0.00204707685043104,
"clip_ratio/low_mean": 0.007919068011688069,
"clip_ratio/low_min": 0.007919068011688069,
"clip_ratio/region_mean": 0.009966144862119108,
"completions/clipped_ratio": 0.125,
"completions/max_length": 36.0,
"completions/mean_length": 10.8515625,
"completions/min_length": 2.0,
"epoch": 2.6537396121883656,
"grad_norm": 2.827545573836865,
"kl": 1.8283915198408067,
"learning_rate": 7.149391952678452e-06,
"loss": 0.017831573262810707,
"memory(GiB)": 79.43,
"reward": 0.2890625,
"reward_std": 0.3461739718914032,
"rewards/Response_no_think_reward_1/mean": 0.2890625,
"rewards/Response_no_think_reward_1/std": 0.7852212190628052,
"step": 239,
"train_speed(iter/s)": 0.00762
},
{
"clip_ratio/high_max": 0.005028763844165951,
"clip_ratio/high_mean": 0.005028763844165951,
"clip_ratio/low_mean": 0.008577116299420595,
"clip_ratio/low_min": 0.008577116299420595,
"clip_ratio/region_mean": 0.013605880201794207,
"epoch": 2.664819944598338,
"grad_norm": 3.1585454235161925,
"kl": 1.771346734254621,
"learning_rate": 6.700720116526116e-06,
"loss": 0.01860269345343113,
"memory(GiB)": 79.43,
"step": 240,
"train_speed(iter/s)": 0.007606
},
{
"clip_ratio/high_max": 0.0017265193164348602,
"clip_ratio/high_mean": 0.0017265193164348602,
"clip_ratio/low_mean": 0.0015245491813402623,
"clip_ratio/low_min": 0.0015245491813402623,
"clip_ratio/region_mean": 0.003251068526878953,
"completions/clipped_ratio": 0.0390625,
"completions/max_length": 46.0,
"completions/mean_length": 8.765625,
"completions/min_length": 2.0,
"epoch": 2.67590027700831,
"grad_norm": 2.4712156808930987,
"kl": 3.0323174638469936,
"learning_rate": 6.266098808742516e-06,
"loss": 0.027942461892962456,
"memory(GiB)": 79.43,
"reward": 0.2734375,
"reward_std": 0.09069566428661346,
"rewards/Response_no_think_reward_1/mean": 0.2734375,
"rewards/Response_no_think_reward_1/std": 0.7908416986465454,
"step": 241,
"train_speed(iter/s)": 0.007496
},
{
"clip_ratio/high_max": 0.0027624310459941626,
"clip_ratio/high_mean": 0.0027624310459941626,
"clip_ratio/low_mean": 0.006610044481931254,
"clip_ratio/low_min": 0.006610044481931254,
"clip_ratio/region_mean": 0.009372475324198604,
"epoch": 2.6869806094182827,
"grad_norm": 1.4174226924918587,
"kl": 2.842063266711193,
"learning_rate": 5.8455934816979305e-06,
"loss": 0.025462469086050987,
"memory(GiB)": 79.43,
"step": 242,
"train_speed(iter/s)": 0.007483
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0027961052255705,
"clip_ratio/low_min": 0.0027961052255705,
"clip_ratio/region_mean": 0.0027961052255705,
"completions/clipped_ratio": 0.0546875,
"completions/max_length": 51.0,
"completions/mean_length": 10.0625,
"completions/min_length": 2.0,
"epoch": 2.698060941828255,
"grad_norm": 2.4284263318080272,
"kl": 1.1247594757005572,
"learning_rate": 5.439267461947883e-06,
"loss": 0.013277001678943634,
"memory(GiB)": 79.43,
"reward": 0.4765625,
"reward_std": 0.2019251585006714,
"rewards/Response_no_think_reward_1/mean": 0.4765625,
"rewards/Response_no_think_reward_1/std": 0.8031909465789795,
"step": 243,
"train_speed(iter/s)": 0.007378
},
{
"clip_ratio/high_max": 0.00271630787756294,
"clip_ratio/high_mean": 0.00271630787756294,
"clip_ratio/low_mean": 0.003980028559453785,
"clip_ratio/low_min": 0.003980028559453785,
"clip_ratio/region_mean": 0.0066963364370167255,
"epoch": 2.709141274238227,
"grad_norm": 1.999946631431668,
"kl": 1.150102037936449,
"learning_rate": 5.047181940696333e-06,
"loss": 0.011227283626794815,
"memory(GiB)": 79.43,
"step": 244,
"train_speed(iter/s)": 0.007365
},
{
"clip_ratio/high_max": 0.003839633078314364,
"clip_ratio/high_mean": 0.003839633078314364,
"clip_ratio/low_mean": 0.002922048792243004,
"clip_ratio/low_min": 0.002922048792243004,
"clip_ratio/region_mean": 0.006761681521311402,
"completions/clipped_ratio": 0.0390625,
"completions/max_length": 51.0,
"completions/mean_length": 10.1875,
"completions/min_length": 2.0,
"epoch": 2.7202216066481997,
"grad_norm": 114.02408735149653,
"kl": 4.607287279635784,
"learning_rate": 4.669395964580614e-06,
"loss": 0.09313861280679703,
"memory(GiB)": 79.43,
"reward": 0.265625,
"reward_std": 0.22673699259757996,
"rewards/Response_no_think_reward_1/mean": 0.265625,
"rewards/Response_no_think_reward_1/std": 0.7475352883338928,
"step": 245,
"train_speed(iter/s)": 0.00727
},
{
"clip_ratio/high_max": 0.004987254389561713,
"clip_ratio/high_mean": 0.004987254389561713,
"clip_ratio/low_mean": 0.005028058891184628,
"clip_ratio/low_min": 0.005028058891184628,
"clip_ratio/region_mean": 0.01001531328074634,
"completions/clipped_ratio": 0.125,
"completions/max_length": 32.0,
"completions/mean_length": 9.0390625,
"completions/min_length": 2.0,
"epoch": 1.6472060050041701,
"grad_norm": 7.885151261057047,
"kl": 4.317316887667403,
"learning_rate": 0.0001363371892680654,
"loss": 0.06505110114812851,
"memory(GiB)": 77.36,
"reward": 0.390625,
"reward_std": 0.2467075139284134,
"rewards/Response_no_think_reward_1/mean": 0.390625,
"rewards/Response_no_think_reward_1/std": 0.7124801278114319,
"step": 246,
"train_speed(iter/s)": 0.212467
},
{
"clip_ratio/high_max": 0.008637543302029371,
"clip_ratio/high_mean": 0.008637543302029371,
"clip_ratio/low_mean": 0.007979447836987674,
"clip_ratio/low_min": 0.007979447836987674,
"clip_ratio/region_mean": 0.016616990906186402,
"epoch": 1.6538782318598833,
"grad_norm": 9.765727829411468,
"kl": 5.302235448267311,
"learning_rate": 0.00013581952149432303,
"loss": 0.07505911588668823,
"memory(GiB)": 77.36,
"step": 247,
"train_speed(iter/s)": 0.182988
},
{
"clip_ratio/high_max": 0.00024900399148464203,
"clip_ratio/high_mean": 0.00024900399148464203,
"clip_ratio/low_mean": 0.006602977169677615,
"clip_ratio/low_min": 0.006602977169677615,
"clip_ratio/region_mean": 0.006851981161162257,
"completions/clipped_ratio": 0.1484375,
"completions/max_length": 51.0,
"completions/mean_length": 13.0625,
"completions/min_length": 2.0,
"epoch": 1.6605504587155964,
"grad_norm": 5.732775568700692,
"kl": 7.248534864047542,
"learning_rate": 0.0001353007501870137,
"loss": 0.07064881920814514,
"memory(GiB)": 77.47,
"reward": 0.0234375,
"reward_std": 0.21814784407615662,
"rewards/Response_no_think_reward_1/mean": 0.0234375,
"rewards/Response_no_think_reward_1/std": 0.8080777525901794,
"step": 248,
"train_speed(iter/s)": 0.101239
},
{
"clip_ratio/high_max": 0.009486032678978518,
"clip_ratio/high_mean": 0.009486032678978518,
"clip_ratio/low_mean": 0.01039744314039126,
"clip_ratio/low_min": 0.01039744314039126,
"clip_ratio/region_mean": 0.019883474858943373,
"epoch": 1.6672226855713093,
"grad_norm": 6.377381125669229,
"kl": 2.9445294842589647,
"learning_rate": 0.00013478089132852716,
"loss": 0.08124249428510666,
"memory(GiB)": 77.47,
"step": 249,
"train_speed(iter/s)": 0.094255
},
{
"clip_ratio/high_max": 0.0010964912362396717,
"clip_ratio/high_mean": 0.0010964912362396717,
"clip_ratio/low_mean": 0.003289473708719015,
"clip_ratio/low_min": 0.003289473708719015,
"clip_ratio/region_mean": 0.004385964944958687,
"completions/clipped_ratio": 0.125,
"completions/max_length": 51.0,
"completions/mean_length": 7.9140625,
"completions/min_length": 2.0,
"epoch": 1.6738949124270226,
"grad_norm": 1.96116793666507,
"kl": 2.669485174041256,
"learning_rate": 0.0001342599609347585,
"loss": 0.02923566661775112,
"memory(GiB)": 77.47,
"reward": -0.0625,
"reward_std": 0.09127141535282135,
"rewards/Response_no_think_reward_1/mean": -0.0625,
"rewards/Response_no_think_reward_1/std": 0.9200308322906494,
"step": 250,
"train_speed(iter/s)": 0.065352
},
{
"clip_ratio/high_max": 0.005629746010527015,
"clip_ratio/high_mean": 0.005629746010527015,
"clip_ratio/low_mean": 0.0412575276568532,
"clip_ratio/low_min": 0.0412575276568532,
"clip_ratio/region_mean": 0.04688727576285601,
"epoch": 1.6805671392827355,
"grad_norm": 1.933812668241347,
"kl": 3.5041955505930673,
"learning_rate": 0.000133737975054615,
"loss": 0.024076396599411964,
"memory(GiB)": 79.43,
"step": 251,
"train_speed(iter/s)": 0.062446
},
{
"clip_ratio/high_max": 0.00119566879584454,
"clip_ratio/high_mean": 0.00119566879584454,
"clip_ratio/low_mean": 0.0004687021573772654,
"clip_ratio/low_min": 0.0004687021573772654,
"clip_ratio/region_mean": 0.0016643709386698902,
"completions/clipped_ratio": 0.140625,
"completions/max_length": 51.0,
"completions/mean_length": 12.6953125,
"completions/min_length": 2.0,
"epoch": 1.6872393661384488,
"grad_norm": 2.4412702069582983,
"kl": 3.9371446361765265,
"learning_rate": 0.00013321494976952132,
"loss": 0.03714549541473389,
"memory(GiB)": 79.43,
"reward": 0.1796875,
"reward_std": 0.13782459497451782,
"rewards/Response_no_think_reward_1/mean": 0.1796875,
"rewards/Response_no_think_reward_1/std": 0.9258628487586975,
"step": 252,
"train_speed(iter/s)": 0.047385
},
{
"clip_ratio/high_max": 0.007317493204027414,
"clip_ratio/high_mean": 0.007317493204027414,
"clip_ratio/low_mean": 0.005186333088204265,
"clip_ratio/low_min": 0.005186333088204265,
"clip_ratio/region_mean": 0.012503825942985713,
"epoch": 1.6939115929941617,
"grad_norm": 4.580377931462122,
"kl": 1.7039022920653224,
"learning_rate": 0.00013269090119292444,
"loss": 0.021267667412757874,
"memory(GiB)": 79.43,
"step": 253,
"train_speed(iter/s)": 0.045915
},
{
"clip_ratio/high_max": 0.0008462663099635392,
"clip_ratio/high_mean": 0.0008462663099635392,
"clip_ratio/low_mean": 0.005740528285969049,
"clip_ratio/low_min": 0.005740528285969049,
"clip_ratio/region_mean": 0.006586794595932588,
"completions/clipped_ratio": 0.1328125,
"completions/max_length": 51.0,
"completions/mean_length": 13.03125,
"completions/min_length": 2.0,
"epoch": 1.700583819849875,
"grad_norm": 2.9913603629745245,
"kl": 1.2227803394198418,
"learning_rate": 0.00013216584546979702,
"loss": 0.01559203490614891,
"memory(GiB)": 79.43,
"reward": 0.015625,
"reward_std": 0.27663108706474304,
"rewards/Response_no_think_reward_1/mean": 0.015625,
"rewards/Response_no_think_reward_1/std": 0.9555834531784058,
"step": 254,
"train_speed(iter/s)": 0.037104
},
{
"clip_ratio/high_max": 0.007223855180200189,
"clip_ratio/high_mean": 0.007223855180200189,
"clip_ratio/low_mean": 0.10893735339050181,
"clip_ratio/low_min": 0.10893735339050181,
"clip_ratio/region_mean": 0.11616120918188244,
"epoch": 1.707256046705588,
"grad_norm": 1.9655670074579659,
"kl": 2.0845303861424327,
"learning_rate": 0.00013163979877614,
"loss": 0.011529060080647469,
"memory(GiB)": 79.43,
"step": 255,
"train_speed(iter/s)": 0.036232
},
{
"clip_ratio/high_max": 0.006948165129870176,
"clip_ratio/high_mean": 0.006948165129870176,
"clip_ratio/low_mean": 0.00925130266114138,
"clip_ratio/low_min": 0.00925130266114138,
"clip_ratio/region_mean": 0.01619946787832305,
"completions/clipped_ratio": 0.359375,
"completions/max_length": 51.0,
"completions/mean_length": 14.140625,
"completions/min_length": 2.0,
"epoch": 1.713928273561301,
"grad_norm": 4.730855130110655,
"kl": 5.062177191488445,
"learning_rate": 0.00013111277731848442,
"loss": 0.05786250904202461,
"memory(GiB)": 79.43,
"reward": -0.0859375,
"reward_std": 0.410529226064682,
"rewards/Response_no_think_reward_1/mean": -0.0859375,
"rewards/Response_no_think_reward_1/std": 0.869675874710083,
"step": 256,
"train_speed(iter/s)": 0.033266
},
{
"clip_ratio/high_max": 0.014393029327038676,
"clip_ratio/high_mean": 0.014393029327038676,
"clip_ratio/low_mean": 0.1303235706873238,
"clip_ratio/low_min": 0.1303235706873238,
"clip_ratio/region_mean": 0.14471660286653787,
"epoch": 1.7206005004170142,
"grad_norm": 6.110613692874304,
"kl": 6.920241659507155,
"learning_rate": 0.00013058479733339185,
"loss": 0.0579487606883049,
"memory(GiB)": 79.43,
"step": 257,
"train_speed(iter/s)": 0.032582
},
{
"clip_ratio/high_max": 0.0021560846944339573,
"clip_ratio/high_mean": 0.0021560846944339573,
"clip_ratio/low_mean": 0.027111168601550162,
"clip_ratio/low_min": 0.027111168601550162,
"clip_ratio/region_mean": 0.029267253237776458,
"completions/clipped_ratio": 0.296875,
"completions/max_length": 51.0,
"completions/mean_length": 9.203125,
"completions/min_length": 2.0,
"epoch": 1.7272727272727273,
"grad_norm": 13.319715864612775,
"kl": 13.24667002509068,
"learning_rate": 0.00013005587508695444,
"loss": 0.12780021131038666,
"memory(GiB)": 79.43,
"reward": 0.109375,
"reward_std": 0.3405221104621887,
"rewards/Response_no_think_reward_1/mean": 0.109375,
"rewards/Response_no_think_reward_1/std": 0.8982430100440979,
"step": 258,
"train_speed(iter/s)": 0.030335
},
{
"clip_ratio/high_max": 0.025854239764157683,
"clip_ratio/high_mean": 0.025854239764157683,
"clip_ratio/low_mean": 0.02940721553750336,
"clip_ratio/low_min": 0.02940721553750336,
"clip_ratio/region_mean": 0.055261454777792096,
"epoch": 1.7339449541284404,
"grad_norm": 7.873376409391432,
"kl": 3.398330974082228,
"learning_rate": 0.00012952602687429362,
"loss": 0.08237586915493011,
"memory(GiB)": 79.43,
"step": 259,
"train_speed(iter/s)": 0.029779
},
{
"clip_ratio/high_max": 0.0010593220358714461,
"clip_ratio/high_mean": 0.0010593220358714461,
"clip_ratio/low_mean": 0.025134949712082744,
"clip_ratio/low_min": 0.025134949712082744,
"clip_ratio/region_mean": 0.02619427174795419,
"completions/clipped_ratio": 0.3828125,
"completions/max_length": 51.0,
"completions/mean_length": 11.0390625,
"completions/min_length": 2.0,
"epoch": 1.7406171809841533,
"grad_norm": 5.622914024348242,
"kl": 8.146455611102283,
"learning_rate": 0.00012899526901905822,
"loss": 0.09567078202962875,
"memory(GiB)": 79.43,
"reward": 0.046875,
"reward_std": 0.30238547921180725,
"rewards/Response_no_think_reward_1/mean": 0.046875,
"rewards/Response_no_think_reward_1/std": 0.8681537508964539,
"step": 260,
"train_speed(iter/s)": 0.028068
},
{
"clip_ratio/high_max": 0.01715171878458932,
"clip_ratio/high_mean": 0.01715171878458932,
"clip_ratio/low_mean": 0.0735002284636721,
"clip_ratio/low_min": 0.0735002284636721,
"clip_ratio/region_mean": 0.0906519484706223,
"epoch": 1.7472894078398666,
"grad_norm": 8.808673951478834,
"kl": 5.425452136900276,
"learning_rate": 0.00012846361787292136,
"loss": 0.08871767669916153,
"memory(GiB)": 79.43,
"step": 261,
"train_speed(iter/s)": 0.027598
},
{
"clip_ratio/high_max": 0.000811688310932368,
"clip_ratio/high_mean": 0.000811688310932368,
"clip_ratio/low_mean": 0.009334841219242662,
"clip_ratio/low_min": 0.009334841219242662,
"clip_ratio/region_mean": 0.01014652947196737,
"completions/clipped_ratio": 0.3984375,
"completions/max_length": 51.0,
"completions/mean_length": 10.890625,
"completions/min_length": 2.0,
"epoch": 1.7539616346955795,
"grad_norm": 9.615584503884596,
"kl": 8.083851436153054,
"learning_rate": 0.00012793108981507694,
"loss": 0.11578933149576187,
"memory(GiB)": 79.43,
"reward": -0.0859375,
"reward_std": 0.41268494725227356,
"rewards/Response_no_think_reward_1/mean": -0.0859375,
"rewards/Response_no_think_reward_1/std": 0.8605742454528809,
"step": 262,
"train_speed(iter/s)": 0.02625
},
{
"clip_ratio/high_max": 0.020523510698694736,
"clip_ratio/high_mean": 0.020523510698694736,
"clip_ratio/low_mean": 0.04563906986732036,
"clip_ratio/low_min": 0.04563906986732036,
"clip_ratio/region_mean": 0.0661625819047913,
"epoch": 1.7606338615512929,
"grad_norm": 30.924872115013905,
"kl": 3.7772719897329807,
"learning_rate": 0.0001273977012517348,
"loss": 0.21410413086414337,
"memory(GiB)": 79.43,
"step": 263,
"train_speed(iter/s)": 0.025852
},
{
"clip_ratio/high_max": 0.0010416667209938169,
"clip_ratio/high_mean": 0.0010416667209938169,
"clip_ratio/low_mean": 0.013979690615087748,
"clip_ratio/low_min": 0.013979690615087748,
"clip_ratio/region_mean": 0.015021357336081564,
"completions/clipped_ratio": 0.140625,
"completions/max_length": 41.0,
"completions/mean_length": 7.9609375,
"completions/min_length": 2.0,
"epoch": 1.7673060884070058,
"grad_norm": 2.801515232228881,
"kl": 1.5485301897861063,
"learning_rate": 0.00012686346861561537,
"loss": 0.014268179424107075,
"memory(GiB)": 79.43,
"reward": 0.015625,
"reward_std": 0.2223242074251175,
"rewards/Response_no_think_reward_1/mean": 0.015625,
"rewards/Response_no_think_reward_1/std": 0.8227510452270508,
"step": 264,
"train_speed(iter/s)": 0.024697
},
{
"clip_ratio/high_max": 0.0018305982230231166,
"clip_ratio/high_mean": 0.0018305982230231166,
"clip_ratio/low_mean": 0.0754491506377235,
"clip_ratio/low_min": 0.0754491506377235,
"clip_ratio/region_mean": 0.07727974897716194,
"epoch": 1.773978315262719,
"grad_norm": 5.020289308786792,
"kl": 4.038693455513567,
"learning_rate": 0.0001263284083654435,
"loss": 0.035946328192949295,
"memory(GiB)": 79.43,
"step": 265,
"train_speed(iter/s)": 0.024353
},
{
"clip_ratio/high_max": 0.0015625000232830644,
"clip_ratio/high_mean": 0.0015625000232830644,
"clip_ratio/low_mean": 0.011535812984220684,
"clip_ratio/low_min": 0.011535812984220684,
"clip_ratio/region_mean": 0.013098313007503748,
"completions/clipped_ratio": 0.2421875,
"completions/max_length": 51.0,
"completions/mean_length": 7.0546875,
"completions/min_length": 2.0,
"epoch": 1.780650542118432,
"grad_norm": 4.823867965705569,
"kl": 5.8212087393421825,
"learning_rate": 0.00012579253698544125,
"loss": 0.07973380386829376,
"memory(GiB)": 79.43,
"reward": 0.0078125,
"reward_std": 0.30061954259872437,
"rewards/Response_no_think_reward_1/mean": 0.0078125,
"rewards/Response_no_think_reward_1/std": 0.6459577083587646,
"step": 266,
"train_speed(iter/s)": 0.023359
},
{
"clip_ratio/high_max": 0.0031250000465661287,
"clip_ratio/high_mean": 0.0031250000465661287,
"clip_ratio/low_mean": 0.11317632021382451,
"clip_ratio/low_min": 0.11317632021382451,
"clip_ratio/region_mean": 0.11630132002756,
"epoch": 1.787322768974145,
"grad_norm": 11.546843380663908,
"kl": 10.476074979640543,
"learning_rate": 0.00012525587098482005,
"loss": 0.09422159940004349,
"memory(GiB)": 79.43,
"step": 267,
"train_speed(iter/s)": 0.023058
},
{
"clip_ratio/high_max": 0.000811688310932368,
"clip_ratio/high_mean": 0.000811688310932368,
"clip_ratio/low_mean": 0.006867786491056904,
"clip_ratio/low_min": 0.006867786491056904,
"clip_ratio/region_mean": 0.007679474772885442,
"completions/clipped_ratio": 0.1328125,
"completions/max_length": 51.0,
"completions/mean_length": 9.8515625,
"completions/min_length": 3.0,
"epoch": 1.7939949958298582,
"grad_norm": 48.055640901825676,
"kl": 22.36742792606401,
"learning_rate": 0.0001247184268972722,
"loss": 0.4101108908653259,
"memory(GiB)": 79.43,
"reward": 0.125,
"reward_std": 0.2585597634315491,
"rewards/Response_no_think_reward_1/mean": 0.125,
"rewards/Response_no_think_reward_1/std": 0.6274557709693909,
"step": 268,
"train_speed(iter/s)": 0.022062
},
{
"clip_ratio/high_max": 0.00529984722379595,
"clip_ratio/high_mean": 0.00529984722379595,
"clip_ratio/low_mean": 0.01420470466837287,
"clip_ratio/low_min": 0.01420470466837287,
"clip_ratio/region_mean": 0.01950455189216882,
"epoch": 1.8006672226855713,
"grad_norm": 10.145223773494124,
"kl": 7.905034697459087,
"learning_rate": 0.00012418022128046142,
"loss": 0.22370362281799316,
"memory(GiB)": 79.43,
"step": 269,
"train_speed(iter/s)": 0.021799
},
{
"clip_ratio/high_max": 0.0020380434580147266,
"clip_ratio/high_mean": 0.0020380434580147266,
"clip_ratio/low_mean": 0.004399414756335318,
"clip_ratio/low_min": 0.004399414756335318,
"clip_ratio/region_mean": 0.006437458097934723,
"completions/clipped_ratio": 0.1640625,
"completions/max_length": 51.0,
"completions/mean_length": 9.84375,
"completions/min_length": 3.0,
"epoch": 1.8073394495412844,
"grad_norm": 2.925526379332068,
"kl": 1.9621957493945956,
"learning_rate": 0.0001236412707155127,
"loss": 0.02435774728655815,
"memory(GiB)": 79.43,
"reward": 0.34375,
"reward_std": 0.22380223870277405,
"rewards/Response_no_think_reward_1/mean": 0.34375,
"rewards/Response_no_think_reward_1/std": 0.6329222321510315,
"step": 270,
"train_speed(iter/s)": 0.021038
},
{
"clip_ratio/high_max": 0.027234246022999287,
"clip_ratio/high_mean": 0.027234246022999287,
"clip_ratio/low_mean": 0.014790827757678926,
"clip_ratio/low_min": 0.014790827757678926,
"clip_ratio/region_mean": 0.04202507343143225,
"epoch": 1.8140116763969973,
"grad_norm": 7.85150802599005,
"kl": 1.2954727746546268,
"learning_rate": 0.0001231015918065016,
"loss": 0.046614713966846466,
"memory(GiB)": 79.43,
"step": 271,
"train_speed(iter/s)": 0.020801
},
{
"clip_ratio/high_max": 0.0007812500116415322,
"clip_ratio/high_mean": 0.0007812500116415322,
"clip_ratio/low_mean": 0.008673313190229237,
"clip_ratio/low_min": 0.008673313190229237,
"clip_ratio/region_mean": 0.00945456320187077,
"completions/clipped_ratio": 0.125,
"completions/max_length": 23.0,
"completions/mean_length": 8.578125,
"completions/min_length": 2.0,
"epoch": 1.8206839032527107,
"grad_norm": 5.663376365839488,
"kl": 3.0526226649526507,
"learning_rate": 0.00012256120117994245,
"loss": 0.029910365119576454,
"memory(GiB)": 79.43,
"reward": 0.2578125,
"reward_std": 0.2626354694366455,
"rewards/Response_no_think_reward_1/mean": 0.2578125,
"rewards/Response_no_think_reward_1/std": 0.70147305727005,
"step": 272,
"train_speed(iter/s)": 0.020032
},
{
"clip_ratio/high_max": 0.003040286072064191,
"clip_ratio/high_mean": 0.003040286072064191,
"clip_ratio/low_mean": 0.06708688009530306,
"clip_ratio/low_min": 0.06708688009530306,
"clip_ratio/region_mean": 0.07012716663302854,
"epoch": 1.8273561301084236,
"grad_norm": 4.421434755408977,
"kl": 5.31667997315526,
"learning_rate": 0.0001220201154842765,
"loss": 0.03301015496253967,
"memory(GiB)": 79.43,
"step": 273,
"train_speed(iter/s)": 0.019826
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.007332374923862517,
"clip_ratio/low_min": 0.007332374923862517,
"clip_ratio/region_mean": 0.007332374923862517,
"completions/clipped_ratio": 0.1796875,
"completions/max_length": 51.0,
"completions/mean_length": 11.125,
"completions/min_length": 2.0,
"epoch": 1.834028356964137,
"grad_norm": 1.9255495711888,
"kl": 2.3658070964738727,
"learning_rate": 0.00012147835138935868,
"loss": 0.040864668786525726,
"memory(GiB)": 79.43,
"reward": -0.3203125,
"reward_std": 0.22869102656841278,
"rewards/Response_no_think_reward_1/mean": -0.3203125,
"rewards/Response_no_think_reward_1/std": 0.7091482281684875,
"step": 274,
"train_speed(iter/s)": 0.019168
},
{
"clip_ratio/high_max": 0.014975278521887958,
"clip_ratio/high_mean": 0.014975278521887958,
"clip_ratio/low_mean": 0.056431527715176344,
"clip_ratio/low_min": 0.056431527715176344,
"clip_ratio/region_mean": 0.07140680588781834,
"epoch": 1.8407005838198498,
"grad_norm": 1.7607705528260904,
"kl": 2.3127799107460305,
"learning_rate": 0.00012093592558594416,
"loss": 0.021540286019444466,
"memory(GiB)": 79.43,
"step": 275,
"train_speed(iter/s)": 0.018983
},
{
"clip_ratio/high_max": 0.00027173911803402007,
"clip_ratio/high_mean": 0.00027173911803402007,
"clip_ratio/low_mean": 0.0030319468351081014,
"clip_ratio/low_min": 0.0030319468351081014,
"clip_ratio/region_mean": 0.003303685924038291,
"completions/clipped_ratio": 0.1171875,
"completions/max_length": 51.0,
"completions/mean_length": 10.21875,
"completions/min_length": 5.0,
"epoch": 1.847372810675563,
"grad_norm": 1.3845096214977168,
"kl": 0.5768661912588868,
"learning_rate": 0.00012039285478517417,
"loss": 0.005703174974769354,
"memory(GiB)": 79.43,
"reward": 0.296875,
"reward_std": 0.31093141436576843,
"rewards/Response_no_think_reward_1/mean": 0.296875,
"rewards/Response_no_think_reward_1/std": 0.6563964486122131,
"step": 276,
"train_speed(iter/s)": 0.018355
},
{
"clip_ratio/high_max": 0.02822316304082051,
"clip_ratio/high_mean": 0.02822316304082051,
"clip_ratio/low_mean": 0.023227162193506956,
"clip_ratio/low_min": 0.023227162193506956,
"clip_ratio/region_mean": 0.05145032424479723,
"epoch": 1.854045037531276,
"grad_norm": 2.277051850874954,
"kl": 1.444888403537334,
"learning_rate": 0.00011984915571806108,
"loss": 0.004672436509281397,
"memory(GiB)": 79.43,
"step": 277,
"train_speed(iter/s)": 0.018189
},
{
"clip_ratio/high_max": 0.006991013826336712,
"clip_ratio/high_mean": 0.006991013826336712,
"clip_ratio/low_mean": 0.009722222341224551,
"clip_ratio/low_min": 0.009722222341224551,
"clip_ratio/region_mean": 0.016713236400391906,
"completions/clipped_ratio": 0.0703125,
"completions/max_length": 25.0,
"completions/mean_length": 6.9765625,
"completions/min_length": 2.0,
"epoch": 1.8607172643869891,
"grad_norm": 35.77457650983362,
"kl": 31.698298294795677,
"learning_rate": 0.000119304845134973,
"loss": 0.27273401618003845,
"memory(GiB)": 79.43,
"reward": 0.1015625,
"reward_std": 0.17464229464530945,
"rewards/Response_no_think_reward_1/mean": 0.1015625,
"rewards/Response_no_think_reward_1/std": 0.6621350049972534,
"step": 278,
"train_speed(iter/s)": 0.017652
},
{
"clip_ratio/high_max": 0.009891506866551936,
"clip_ratio/high_mean": 0.009891506866551936,
"clip_ratio/low_mean": 0.0069444444961845875,
"clip_ratio/low_min": 0.0069444444961845875,
"clip_ratio/region_mean": 0.016835951362736523,
"epoch": 1.8673894912427023,
"grad_norm": 4.542577039630815,
"kl": 3.7718499208567664,
"learning_rate": 0.00011875993980511773,
"loss": 0.07798631489276886,
"memory(GiB)": 79.43,
"step": 279,
"train_speed(iter/s)": 0.017502
},
{
"clip_ratio/high_max": 0.002536526066251099,
"clip_ratio/high_mean": 0.002536526066251099,
"clip_ratio/low_mean": 0.0024038462433964014,
"clip_ratio/low_min": 0.0024038462433964014,
"clip_ratio/region_mean": 0.0049403723096475005,
"completions/clipped_ratio": 0.0859375,
"completions/max_length": 27.0,
"completions/mean_length": 8.1484375,
"completions/min_length": 2.0,
"epoch": 1.8740617180984154,
"grad_norm": 2.8417572027389006,
"kl": 3.5999494855445846,
"learning_rate": 0.00011821445651602616,
"loss": 0.038278549909591675,
"memory(GiB)": 79.43,
"reward": 0.078125,
"reward_std": 0.18506525456905365,
"rewards/Response_no_think_reward_1/mean": 0.078125,
"rewards/Response_no_think_reward_1/std": 0.7797574400901794,
"step": 280,
"train_speed(iter/s)": 0.016994
}
],
"logging_steps": 1,
"max_steps": 596,
"num_input_tokens_seen": 0,
"num_train_epochs": 4,
"save_steps": 5,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}