PEFT
Safetensors
task1s / trainer_state.json
chen
Upload folder using huggingface_hub
f298d36 verified
Raw
History Blame Contribute Delete
100 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.6925373134328359,
"eval_steps": 500,
"global_step": 140,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 51.0,
"completions/mean_length": 16.09375,
"completions/min_length": 2.0,
"epoch": 0.011940298507462687,
"grad_norm": 3.1591623828063176,
"kl": 0.0,
"learning_rate": 2.2222222222222223e-05,
"loss": -3.725290298461914e-09,
"memory(GiB)": 77.11,
"reward": 0.1484375,
"reward_std": 0.7272911071777344,
"rewards/Response_no_think_reward_1/mean": 0.1484375,
"rewards/Response_no_think_reward_1/std": 0.9646495580673218,
"step": 1,
"train_speed(iter/s)": 0.001668
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"epoch": 0.023880597014925373,
"grad_norm": 3.150729002521691,
"kl": 0.0,
"learning_rate": 4.4444444444444447e-05,
"loss": -3.725290298461914e-09,
"memory(GiB)": 77.11,
"step": 2,
"train_speed(iter/s)": 0.002544
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0028647197177633643,
"clip_ratio/low_min": 0.0028647197177633643,
"clip_ratio/region_mean": 0.0028647197177633643,
"completions/clipped_ratio": 0.0390625,
"completions/max_length": 51.0,
"completions/mean_length": 14.59375,
"completions/min_length": 2.0,
"epoch": 0.03582089552238806,
"grad_norm": 2.067277005959865,
"kl": 0.0022258755707298405,
"learning_rate": 6.666666666666667e-05,
"loss": -0.0004270445788279176,
"memory(GiB)": 77.3,
"reward": -0.3828125,
"reward_std": 0.707726001739502,
"rewards/Response_no_think_reward_1/mean": -0.3828125,
"rewards/Response_no_think_reward_1/std": 0.923201322555542,
"step": 3,
"train_speed(iter/s)": 0.002313
},
{
"clip_ratio/high_max": 0.003551179339410737,
"clip_ratio/high_mean": 0.003551179339410737,
"clip_ratio/low_mean": 0.025148934859316796,
"clip_ratio/low_min": 0.025148934859316796,
"clip_ratio/region_mean": 0.028700114460662007,
"epoch": 0.04776119402985075,
"grad_norm": 1.6109973009110337,
"kl": 0.007886729676101822,
"learning_rate": 8.888888888888889e-05,
"loss": -0.010280434973537922,
"memory(GiB)": 77.3,
"step": 4,
"train_speed(iter/s)": 0.002696
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0019339247373864055,
"clip_ratio/low_min": 0.0019339247373864055,
"clip_ratio/region_mean": 0.0019339247373864055,
"completions/clipped_ratio": 0.0390625,
"completions/max_length": 51.0,
"completions/mean_length": 13.5390625,
"completions/min_length": 3.0,
"epoch": 0.05970149253731343,
"grad_norm": 2.893722550507481,
"kl": 0.010198775078606559,
"learning_rate": 0.00011111111111111112,
"loss": 0.0004082494997419417,
"memory(GiB)": 77.52,
"reward": 0.125,
"reward_std": 0.493943989276886,
"rewards/Response_no_think_reward_1/mean": 0.125,
"rewards/Response_no_think_reward_1/std": 0.9881184101104736,
"step": 5,
"train_speed(iter/s)": 0.002517
},
{
"clip_ratio/high_max": 0.028469400480389595,
"clip_ratio/high_mean": 0.028469400480389595,
"clip_ratio/low_mean": 0.04948427155613899,
"clip_ratio/low_min": 0.04948427155613899,
"clip_ratio/region_mean": 0.07795367110520601,
"epoch": 0.07164179104477612,
"grad_norm": 1.5585579234945925,
"kl": 0.6935355372261256,
"learning_rate": 0.00013333333333333334,
"loss": -0.005084950476884842,
"memory(GiB)": 79.48,
"step": 6,
"train_speed(iter/s)": 0.002759
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0010160960373468697,
"clip_ratio/low_min": 0.0010160960373468697,
"clip_ratio/region_mean": 0.0010160960373468697,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 51.0,
"completions/mean_length": 11.9296875,
"completions/min_length": 3.0,
"epoch": 0.08358208955223881,
"grad_norm": 1.7579177577957044,
"kl": 0.07463712914614007,
"learning_rate": 0.00015555555555555556,
"loss": 0.0008710746187716722,
"memory(GiB)": 79.48,
"reward": -0.0390625,
"reward_std": 0.6340709924697876,
"rewards/Response_no_think_reward_1/mean": -0.0390625,
"rewards/Response_no_think_reward_1/std": 0.9992307424545288,
"step": 7,
"train_speed(iter/s)": 0.002622
},
{
"clip_ratio/high_max": 0.02714990673121065,
"clip_ratio/high_mean": 0.02714990673121065,
"clip_ratio/low_mean": 0.03809016165905632,
"clip_ratio/low_min": 0.03809016165905632,
"clip_ratio/region_mean": 0.06524006789550185,
"epoch": 0.0955223880597015,
"grad_norm": 1.2730547516178623,
"kl": 0.21840606682235375,
"learning_rate": 0.00017777777777777779,
"loss": -0.013987341895699501,
"memory(GiB)": 79.48,
"step": 8,
"train_speed(iter/s)": 0.002802
},
{
"clip_ratio/high_max": 0.0009191176504828036,
"clip_ratio/high_mean": 0.0009191176504828036,
"clip_ratio/low_mean": 0.0018382353009656072,
"clip_ratio/low_min": 0.0018382353009656072,
"clip_ratio/region_mean": 0.0027573530096560717,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 51.0,
"completions/mean_length": 10.3828125,
"completions/min_length": 3.0,
"epoch": 0.10746268656716418,
"grad_norm": 3.3295900087180645,
"kl": 0.35752939723897725,
"learning_rate": 0.0002,
"loss": 0.003791232593357563,
"memory(GiB)": 79.48,
"reward": 0.328125,
"reward_std": 0.5329009890556335,
"rewards/Response_no_think_reward_1/mean": 0.328125,
"rewards/Response_no_think_reward_1/std": 0.9483460783958435,
"step": 9,
"train_speed(iter/s)": 0.002657
},
{
"clip_ratio/high_max": 0.03471234819153324,
"clip_ratio/high_mean": 0.03471234819153324,
"clip_ratio/low_mean": 0.045793990429956466,
"clip_ratio/low_min": 0.045793990429956466,
"clip_ratio/region_mean": 0.08050633978564292,
"epoch": 0.11940298507462686,
"grad_norm": 3.037041883710677,
"kl": 1.3611202164320275,
"learning_rate": 0.00019997998037428526,
"loss": -0.0012767184525728226,
"memory(GiB)": 79.48,
"step": 10,
"train_speed(iter/s)": 0.002798
},
{
"clip_ratio/high_max": 0.0022767678019590676,
"clip_ratio/high_mean": 0.0022767678019590676,
"clip_ratio/low_mean": 0.004576534847728908,
"clip_ratio/low_min": 0.004576534847728908,
"clip_ratio/region_mean": 0.006853302649687976,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 51.0,
"completions/mean_length": 11.3828125,
"completions/min_length": 3.0,
"epoch": 0.13134328358208955,
"grad_norm": 1.1988213220999966,
"kl": 0.176690819360374,
"learning_rate": 0.00019991992951284932,
"loss": 0.0002530772762838751,
"memory(GiB)": 79.48,
"reward": 0.2890625,
"reward_std": 0.36220550537109375,
"rewards/Response_no_think_reward_1/mean": 0.2890625,
"rewards/Response_no_think_reward_1/std": 0.9487027525901794,
"step": 11,
"train_speed(iter/s)": 0.002687
},
{
"clip_ratio/high_max": 0.010013980441726744,
"clip_ratio/high_mean": 0.010013980441726744,
"clip_ratio/low_mean": 0.0431372388266027,
"clip_ratio/low_min": 0.0431372388266027,
"clip_ratio/region_mean": 0.053151219501160085,
"epoch": 0.14328358208955225,
"grad_norm": 4.4251813995519464,
"kl": 3.680493631065474,
"learning_rate": 0.00019981987145960755,
"loss": 0.022724991664290428,
"memory(GiB)": 79.48,
"step": 12,
"train_speed(iter/s)": 0.002804
},
{
"clip_ratio/high_max": 0.000480769231216982,
"clip_ratio/high_mean": 0.000480769231216982,
"clip_ratio/low_mean": 0.0022044407669454813,
"clip_ratio/low_min": 0.0022044407669454813,
"clip_ratio/region_mean": 0.0026852099981624633,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 51.0,
"completions/mean_length": 12.0703125,
"completions/min_length": 3.0,
"epoch": 0.15522388059701492,
"grad_norm": 2.0136556426936285,
"kl": 0.14468206313904375,
"learning_rate": 0.00019967984627705548,
"loss": -0.00039299592026509345,
"memory(GiB)": 79.48,
"reward": 0.0625,
"reward_std": 0.6480826735496521,
"rewards/Response_no_think_reward_1/mean": 0.0625,
"rewards/Response_no_think_reward_1/std": 0.9861242175102234,
"step": 13,
"train_speed(iter/s)": 0.00269
},
{
"clip_ratio/high_max": 0.016389093652833253,
"clip_ratio/high_mean": 0.016389093652833253,
"clip_ratio/low_mean": 0.03954102098941803,
"clip_ratio/low_min": 0.03954102098941803,
"clip_ratio/region_mean": 0.05593011493328959,
"epoch": 0.16716417910447762,
"grad_norm": 0.7268697285990734,
"kl": 0.15212981263175607,
"learning_rate": 0.00019949991003022808,
"loss": -0.01738908141851425,
"memory(GiB)": 79.48,
"step": 14,
"train_speed(iter/s)": 0.002789
},
{
"clip_ratio/high_max": 0.0005787037080153823,
"clip_ratio/high_mean": 0.0005787037080153823,
"clip_ratio/low_mean": 0.004868808202445507,
"clip_ratio/low_min": 0.004868808202445507,
"clip_ratio/region_mean": 0.005447512026876211,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 51.0,
"completions/mean_length": 9.8671875,
"completions/min_length": 3.0,
"epoch": 0.1791044776119403,
"grad_norm": 1.881956635614757,
"kl": 0.24015408230479807,
"learning_rate": 0.0001992801347642515,
"loss": 0.0037227380089461803,
"memory(GiB)": 79.48,
"reward": 0.0625,
"reward_std": 0.15197435021400452,
"rewards/Response_no_think_reward_1/mean": 0.0625,
"rewards/Response_no_think_reward_1/std": 0.9700231552124023,
"step": 15,
"train_speed(iter/s)": 0.002716
},
{
"clip_ratio/high_max": 0.005905566504225135,
"clip_ratio/high_mean": 0.005905566504225135,
"clip_ratio/low_mean": 0.03072124859318137,
"clip_ratio/low_min": 0.03072124859318137,
"clip_ratio/region_mean": 0.036626815563067794,
"epoch": 0.191044776119403,
"grad_norm": 9.037445474392891,
"kl": 4.632834411575459,
"learning_rate": 0.00019902060847549718,
"loss": 0.06257862597703934,
"memory(GiB)": 79.48,
"step": 16,
"train_speed(iter/s)": 0.002802
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.004252503567840904,
"clip_ratio/low_min": 0.004252503567840904,
"clip_ratio/region_mean": 0.004252503567840904,
"completions/clipped_ratio": 0.0,
"completions/max_length": 46.0,
"completions/mean_length": 7.0,
"completions/min_length": 3.0,
"epoch": 0.20298507462686566,
"grad_norm": 5.483351751991195,
"kl": 3.0633848210127326,
"learning_rate": 0.0001987214350763483,
"loss": 0.026951301842927933,
"memory(GiB)": 79.48,
"reward": 0.1640625,
"reward_std": 0.45976677536964417,
"rewards/Response_no_think_reward_1/mean": 0.1640625,
"rewards/Response_no_think_reward_1/std": 0.9116684198379517,
"step": 17,
"train_speed(iter/s)": 0.002741
},
{
"clip_ratio/high_max": 0.02420679770875722,
"clip_ratio/high_mean": 0.02420679770875722,
"clip_ratio/low_mean": 0.029018129454925656,
"clip_ratio/low_min": 0.029018129454925656,
"clip_ratio/region_mean": 0.053224927629344165,
"epoch": 0.21492537313432836,
"grad_norm": 11.084807824277876,
"kl": 4.480629495417816,
"learning_rate": 0.00019838273435359444,
"loss": 0.03358945623040199,
"memory(GiB)": 79.48,
"step": 18,
"train_speed(iter/s)": 0.002818
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.009987752127926797,
"clip_ratio/low_min": 0.009987752127926797,
"clip_ratio/region_mean": 0.009987752127926797,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 51.0,
"completions/mean_length": 8.6875,
"completions/min_length": 3.0,
"epoch": 0.22686567164179106,
"grad_norm": 2.774235490038128,
"kl": 1.3207979609724134,
"learning_rate": 0.00019800464192046955,
"loss": 0.012463792227208614,
"memory(GiB)": 79.48,
"reward": -0.0078125,
"reward_std": 0.3263596296310425,
"rewards/Response_no_think_reward_1/mean": -0.0078125,
"rewards/Response_no_think_reward_1/std": 0.9515514969825745,
"step": 19,
"train_speed(iter/s)": 0.002746
},
{
"clip_ratio/high_max": 0.013878540194127709,
"clip_ratio/high_mean": 0.013878540194127709,
"clip_ratio/low_mean": 0.053771398146636784,
"clip_ratio/low_min": 0.053771398146636784,
"clip_ratio/region_mean": 0.06764993839897215,
"epoch": 0.23880597014925373,
"grad_norm": 18.987604867751966,
"kl": 9.466534710245469,
"learning_rate": 0.00019758730916235356,
"loss": 0.16672615706920624,
"memory(GiB)": 79.48,
"step": 20,
"train_speed(iter/s)": 0.002807
},
{
"clip_ratio/high_max": 0.005019778618589044,
"clip_ratio/high_mean": 0.005019778618589044,
"clip_ratio/low_mean": 0.00046641789958812296,
"clip_ratio/low_min": 0.00046641789958812296,
"clip_ratio/region_mean": 0.005486196518177167,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 51.0,
"completions/mean_length": 8.234375,
"completions/min_length": 3.0,
"epoch": 0.2507462686567164,
"grad_norm": 3.1541164754847397,
"kl": 0.4539797595352866,
"learning_rate": 0.00019713090317615876,
"loss": 0.0023644084576517344,
"memory(GiB)": 79.48,
"reward": -0.1015625,
"reward_std": 0.3404619097709656,
"rewards/Response_no_think_reward_1/mean": -0.1015625,
"rewards/Response_no_think_reward_1/std": 0.9788298010826111,
"step": 21,
"train_speed(iter/s)": 0.002748
},
{
"clip_ratio/high_max": 0.02849817555397749,
"clip_ratio/high_mean": 0.02849817555397749,
"clip_ratio/low_mean": 0.02262113688630052,
"clip_ratio/low_min": 0.02262113688630052,
"clip_ratio/region_mean": 0.051119312876835465,
"epoch": 0.2626865671641791,
"grad_norm": 3.225175633228704,
"kl": 0.27581185393501073,
"learning_rate": 0.00019663560670342558,
"loss": 0.0023057509679347277,
"memory(GiB)": 79.48,
"step": 22,
"train_speed(iter/s)": 0.002811
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0015432098880410194,
"clip_ratio/low_min": 0.0015432098880410194,
"clip_ratio/region_mean": 0.0015432098880410194,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 51.0,
"completions/mean_length": 9.1015625,
"completions/min_length": 3.0,
"epoch": 0.2746268656716418,
"grad_norm": 1.602042628934705,
"kl": 0.223259057267569,
"learning_rate": 0.00019610161805715397,
"loss": 0.0012852977961301804,
"memory(GiB)": 79.48,
"reward": 0.25,
"reward_std": 0.45234403014183044,
"rewards/Response_no_think_reward_1/mean": 0.25,
"rewards/Response_no_think_reward_1/std": 0.9474374651908875,
"step": 23,
"train_speed(iter/s)": 0.002763
},
{
"clip_ratio/high_max": 0.02699369314359501,
"clip_ratio/high_mean": 0.02699369314359501,
"clip_ratio/low_mean": 0.024013921502046287,
"clip_ratio/low_min": 0.024013921502046287,
"clip_ratio/region_mean": 0.05100761540234089,
"epoch": 0.2865671641791045,
"grad_norm": 1.2163889618122583,
"kl": 0.48499861752497964,
"learning_rate": 0.00019552915104240065,
"loss": -0.007453325670212507,
"memory(GiB)": 79.48,
"step": 24,
"train_speed(iter/s)": 0.002821
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.001253594527952373,
"clip_ratio/low_min": 0.001253594527952373,
"clip_ratio/region_mean": 0.001253594527952373,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 51.0,
"completions/mean_length": 9.9375,
"completions/min_length": 3.0,
"epoch": 0.29850746268656714,
"grad_norm": 1.3884331155836789,
"kl": 0.5089308844180778,
"learning_rate": 0.00019491843487067306,
"loss": 0.00490172766149044,
"memory(GiB)": 79.48,
"reward": 0.2265625,
"reward_std": 0.46621453762054443,
"rewards/Response_no_think_reward_1/mean": 0.2265625,
"rewards/Response_no_think_reward_1/std": 0.9324832558631897,
"step": 25,
"train_speed(iter/s)": 0.002775
},
{
"clip_ratio/high_max": 0.01939821511041373,
"clip_ratio/high_mean": 0.01939821511041373,
"clip_ratio/low_mean": 0.046715788485016674,
"clip_ratio/low_min": 0.046715788485016674,
"clip_ratio/region_mean": 0.06611400278052315,
"epoch": 0.31044776119402984,
"grad_norm": 7.610505518747904,
"kl": 2.1003341920441017,
"learning_rate": 0.00019426971406815463,
"loss": 0.024694038555026054,
"memory(GiB)": 79.48,
"step": 26,
"train_speed(iter/s)": 0.002827
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0030820727697573602,
"clip_ratio/low_min": 0.0030820727697573602,
"clip_ratio/region_mean": 0.0030820727697573602,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 51.0,
"completions/mean_length": 9.2265625,
"completions/min_length": 3.0,
"epoch": 0.32238805970149254,
"grad_norm": 2.593834753837433,
"kl": 0.6449481542804278,
"learning_rate": 0.00019358324837779863,
"loss": 0.007649811916053295,
"memory(GiB)": 79.48,
"reward": 0.2890625,
"reward_std": 0.6288036704063416,
"rewards/Response_no_think_reward_1/mean": 0.2890625,
"rewards/Response_no_think_reward_1/std": 0.870806872844696,
"step": 27,
"train_speed(iter/s)": 0.00279
},
{
"clip_ratio/high_max": 0.02224817470414564,
"clip_ratio/high_mean": 0.02224817470414564,
"clip_ratio/low_mean": 0.03963817795738578,
"clip_ratio/low_min": 0.03963817795738578,
"clip_ratio/region_mean": 0.061886353767476976,
"epoch": 0.33432835820895523,
"grad_norm": 4.001134871741585,
"kl": 2.057775880966801,
"learning_rate": 0.00019285931265532871,
"loss": 0.024306027218699455,
"memory(GiB)": 79.48,
"step": 28,
"train_speed(iter/s)": 0.002839
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0025941890198737383,
"clip_ratio/low_min": 0.0025941890198737383,
"clip_ratio/region_mean": 0.0025941890198737383,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 51.0,
"completions/mean_length": 7.6640625,
"completions/min_length": 3.0,
"epoch": 0.34626865671641793,
"grad_norm": 2.4322431330202017,
"kl": 0.9759200520347804,
"learning_rate": 0.0001920981967591891,
"loss": 0.009954690001904964,
"memory(GiB)": 79.48,
"reward": 0.234375,
"reward_std": 0.5239416360855103,
"rewards/Response_no_think_reward_1/mean": 0.234375,
"rewards/Response_no_think_reward_1/std": 0.8179518580436707,
"step": 29,
"train_speed(iter/s)": 0.002811
},
{
"clip_ratio/high_max": 0.05181985488161445,
"clip_ratio/high_mean": 0.05181985488161445,
"clip_ratio/low_mean": 0.03574432339519262,
"clip_ratio/low_min": 0.03574432339519262,
"clip_ratio/region_mean": 0.0875641773454845,
"epoch": 0.3582089552238806,
"grad_norm": 2.469531358214721,
"kl": 0.3759418617701158,
"learning_rate": 0.00019130020543448704,
"loss": 0.030206725001335144,
"memory(GiB)": 79.48,
"step": 30,
"train_speed(iter/s)": 0.002857
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0007102272938936949,
"clip_ratio/low_min": 0.0007102272938936949,
"clip_ratio/region_mean": 0.0007102272938936949,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 51.0,
"completions/mean_length": 7.4921875,
"completions/min_length": 3.0,
"epoch": 0.3701492537313433,
"grad_norm": 25.502961039749618,
"kl": 0.3221544102343614,
"learning_rate": 0.00019046565819097545,
"loss": 0.0061463117599487305,
"memory(GiB)": 79.48,
"reward": 0.265625,
"reward_std": 0.3810158967971802,
"rewards/Response_no_think_reward_1/mean": 0.265625,
"rewards/Response_no_think_reward_1/std": 0.8082680702209473,
"step": 31,
"train_speed(iter/s)": 0.002819
},
{
"clip_ratio/high_max": 0.0004340277810115367,
"clip_ratio/high_mean": 0.0004340277810115367,
"clip_ratio/low_mean": 0.015644782513845712,
"clip_ratio/low_min": 0.015644782513845712,
"clip_ratio/region_mean": 0.01607881032396108,
"epoch": 0.382089552238806,
"grad_norm": 2.386529018247983,
"kl": 0.4242442559116171,
"learning_rate": 0.0001895948891751234,
"loss": 0.005282086320221424,
"memory(GiB)": 79.48,
"step": 32,
"train_speed(iter/s)": 0.002862
},
{
"clip_ratio/high_max": 0.0008561643771827221,
"clip_ratio/high_mean": 0.0008561643771827221,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0008561643771827221,
"completions/clipped_ratio": 0.0,
"completions/max_length": 36.0,
"completions/mean_length": 6.8984375,
"completions/min_length": 3.0,
"epoch": 0.3940298507462687,
"grad_norm": 2.313143797352374,
"kl": 1.4197996056172997,
"learning_rate": 0.00018868824703632657,
"loss": 0.011696252971887589,
"memory(GiB)": 79.48,
"reward": 0.046875,
"reward_std": 0.6391555070877075,
"rewards/Response_no_think_reward_1/mean": 0.046875,
"rewards/Response_no_think_reward_1/std": 0.8215538859367371,
"step": 33,
"train_speed(iter/s)": 0.002823
},
{
"clip_ratio/high_max": 0.03243769891560078,
"clip_ratio/high_mean": 0.03243769891560078,
"clip_ratio/low_mean": 0.057673962553963065,
"clip_ratio/low_min": 0.057673962553963065,
"clip_ratio/region_mean": 0.09011166216805577,
"epoch": 0.4059701492537313,
"grad_norm": 1.7539402550269323,
"kl": 1.9242291511036456,
"learning_rate": 0.00018774609478731046,
"loss": -0.004083915147930384,
"memory(GiB)": 79.48,
"step": 34,
"train_speed(iter/s)": 0.002863
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0010245901066809893,
"clip_ratio/low_min": 0.0010245901066809893,
"clip_ratio/region_mean": 0.0010245901066809893,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 51.0,
"completions/mean_length": 7.7109375,
"completions/min_length": 3.0,
"epoch": 0.417910447761194,
"grad_norm": 2.4226244872635485,
"kl": 1.010538819245994,
"learning_rate": 0.00018676880965878291,
"loss": 0.015125149860978127,
"memory(GiB)": 79.48,
"reward": 0.0546875,
"reward_std": 0.5867211818695068,
"rewards/Response_no_think_reward_1/mean": 0.0546875,
"rewards/Response_no_think_reward_1/std": 0.8539726138114929,
"step": 35,
"train_speed(iter/s)": 0.00283
},
{
"clip_ratio/high_max": 0.030840664519928396,
"clip_ratio/high_mean": 0.030840664519928396,
"clip_ratio/low_mean": 0.06221208241186105,
"clip_ratio/low_min": 0.06221208241186105,
"clip_ratio/region_mean": 0.09305274731013924,
"epoch": 0.4298507462686567,
"grad_norm": 2.284561806665497,
"kl": 2.4607611764222383,
"learning_rate": 0.00018575678294839373,
"loss": 0.010896118357777596,
"memory(GiB)": 79.48,
"step": 36,
"train_speed(iter/s)": 0.002867
},
{
"clip_ratio/high_max": 0.001179245300590992,
"clip_ratio/high_mean": 0.001179245300590992,
"clip_ratio/low_mean": 0.00924376118928194,
"clip_ratio/low_min": 0.00924376118928194,
"clip_ratio/region_mean": 0.010423006489872932,
"completions/clipped_ratio": 0.0,
"completions/max_length": 27.0,
"completions/mean_length": 5.328125,
"completions/min_length": 2.0,
"epoch": 0.4417910447761194,
"grad_norm": 3.3426494147901047,
"kl": 0.3604982797114644,
"learning_rate": 0.000184710419864062,
"loss": 0.0029986475128680468,
"memory(GiB)": 79.48,
"reward": 0.328125,
"reward_std": 0.34082794189453125,
"rewards/Response_no_think_reward_1/mean": 0.328125,
"rewards/Response_no_think_reward_1/std": 0.8794179558753967,
"step": 37,
"train_speed(iter/s)": 0.002821
},
{
"clip_ratio/high_max": 0.011844758177176118,
"clip_ratio/high_mean": 0.011844758177176118,
"clip_ratio/low_mean": 0.05284481216222048,
"clip_ratio/low_min": 0.05284481216222048,
"clip_ratio/region_mean": 0.06468957080505788,
"epoch": 0.4537313432835821,
"grad_norm": 0.9022263920887504,
"kl": 0.5205309305310948,
"learning_rate": 0.00018363013936173393,
"loss": -0.011295529082417488,
"memory(GiB)": 79.48,
"step": 38,
"train_speed(iter/s)": 0.002857
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 51.0,
"completions/mean_length": 5.328125,
"completions/min_length": 3.0,
"epoch": 0.46567164179104475,
"grad_norm": 1.5271115661229067,
"kl": 0.27687166831583454,
"learning_rate": 0.00018251637397763597,
"loss": 0.0014096113154664636,
"memory(GiB)": 79.48,
"reward": 0.046875,
"reward_std": 0.3280481696128845,
"rewards/Response_no_think_reward_1/mean": 0.046875,
"rewards/Response_no_think_reward_1/std": 0.9379100203514099,
"step": 39,
"train_speed(iter/s)": 0.002785
},
{
"clip_ratio/high_max": 0.04636762477457523,
"clip_ratio/high_mean": 0.04636762477457523,
"clip_ratio/low_mean": 0.02858343638945371,
"clip_ratio/low_min": 0.02858343638945371,
"clip_ratio/region_mean": 0.07495106221176684,
"epoch": 0.47761194029850745,
"grad_norm": 0.6061436422525854,
"kl": 0.7858691609289963,
"learning_rate": 0.00018136956965509064,
"loss": -0.008444712497293949,
"memory(GiB)": 79.48,
"step": 40,
"train_speed(iter/s)": 0.002819
},
{
"clip_ratio/high_max": 0.001953125,
"clip_ratio/high_mean": 0.001953125,
"clip_ratio/low_mean": 0.0004006410308647901,
"clip_ratio/low_min": 0.0004006410308647901,
"clip_ratio/region_mean": 0.00235376603086479,
"completions/clipped_ratio": 0.0390625,
"completions/max_length": 51.0,
"completions/mean_length": 8.296875,
"completions/min_length": 3.0,
"epoch": 0.48955223880597015,
"grad_norm": 2.15651488822414,
"kl": 0.5289879650626972,
"learning_rate": 0.000180190185565964,
"loss": 0.006278940010815859,
"memory(GiB)": 79.48,
"reward": 0.140625,
"reward_std": 0.3606899678707123,
"rewards/Response_no_think_reward_1/mean": 0.140625,
"rewards/Response_no_think_reward_1/std": 0.9284173250198364,
"step": 41,
"train_speed(iter/s)": 0.002732
},
{
"clip_ratio/high_max": 0.019255130202509463,
"clip_ratio/high_mean": 0.019255130202509463,
"clip_ratio/low_mean": 0.049764272407628596,
"clip_ratio/low_min": 0.049764272407628596,
"clip_ratio/region_mean": 0.06901940272655338,
"epoch": 0.5014925373134328,
"grad_norm": 7.678211490755348,
"kl": 4.704732097394299,
"learning_rate": 0.00017897869392681685,
"loss": 0.036949772387742996,
"memory(GiB)": 79.48,
"step": 42,
"train_speed(iter/s)": 0.002764
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0018887363257817924,
"clip_ratio/low_min": 0.0018887363257817924,
"clip_ratio/region_mean": 0.0018887363257817924,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 51.0,
"completions/mean_length": 10.0390625,
"completions/min_length": 3.0,
"epoch": 0.5134328358208955,
"grad_norm": 1.5758982248595066,
"kl": 0.34190677378865075,
"learning_rate": 0.00017773557980983262,
"loss": 0.004829109646379948,
"memory(GiB)": 79.48,
"reward": 0.3671875,
"reward_std": 0.355153352022171,
"rewards/Response_no_think_reward_1/mean": 0.3671875,
"rewards/Response_no_think_reward_1/std": 0.8406137228012085,
"step": 43,
"train_speed(iter/s)": 0.002649
},
{
"clip_ratio/high_max": 0.010433136369101703,
"clip_ratio/high_mean": 0.010433136369101703,
"clip_ratio/low_mean": 0.0495308703975752,
"clip_ratio/low_min": 0.0495308703975752,
"clip_ratio/region_mean": 0.05996400595176965,
"epoch": 0.5253731343283582,
"grad_norm": 0.9699999569587556,
"kl": 0.5136687369667925,
"learning_rate": 0.00017646134094859815,
"loss": -0.008213551715016365,
"memory(GiB)": 79.48,
"step": 44,
"train_speed(iter/s)": 0.00268
},
{
"clip_ratio/high_max": 0.0009920635493472219,
"clip_ratio/high_mean": 0.0009920635493472219,
"clip_ratio/low_mean": 0.0006793478387407959,
"clip_ratio/low_min": 0.0006793478387407959,
"clip_ratio/region_mean": 0.0016714113880880177,
"completions/clipped_ratio": 0.0234375,
"completions/max_length": 51.0,
"completions/mean_length": 6.53125,
"completions/min_length": 3.0,
"epoch": 0.5373134328358209,
"grad_norm": 2.6187879748810294,
"kl": 0.4996573789976537,
"learning_rate": 0.00017515648753881492,
"loss": 0.00461646867915988,
"memory(GiB)": 79.48,
"reward": 0.390625,
"reward_std": 0.4600672125816345,
"rewards/Response_no_think_reward_1/mean": 0.390625,
"rewards/Response_no_think_reward_1/std": 0.8251401782035828,
"step": 45,
"train_speed(iter/s)": 0.002583
},
{
"clip_ratio/high_max": 0.023812146624550223,
"clip_ratio/high_mean": 0.023812146624550223,
"clip_ratio/low_mean": 0.030458416498731822,
"clip_ratio/low_min": 0.030458416498731822,
"clip_ratio/region_mean": 0.054270562424790114,
"epoch": 0.5492537313432836,
"grad_norm": 1.046619303634399,
"kl": 1.1794932310585864,
"learning_rate": 0.00017382154203402048,
"loss": -0.007490159012377262,
"memory(GiB)": 79.48,
"step": 46,
"train_speed(iter/s)": 0.002612
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0014244693447835743,
"clip_ratio/low_min": 0.0014244693447835743,
"clip_ratio/region_mean": 0.0014244693447835743,
"completions/clipped_ratio": 0.078125,
"completions/max_length": 51.0,
"completions/mean_length": 11.59375,
"completions/min_length": 3.0,
"epoch": 0.5611940298507463,
"grad_norm": 1.8613572071063658,
"kl": 0.6177221334655769,
"learning_rate": 0.0001724570389364019,
"loss": 0.004859148990362883,
"memory(GiB)": 79.48,
"reward": 0.0625,
"reward_std": 0.47469794750213623,
"rewards/Response_no_think_reward_1/mean": 0.0625,
"rewards/Response_no_think_reward_1/std": 0.8761943578720093,
"step": 47,
"train_speed(iter/s)": 0.002518
},
{
"clip_ratio/high_max": 0.009966709709260613,
"clip_ratio/high_mean": 0.009966709709260613,
"clip_ratio/low_mean": 0.11994545813649893,
"clip_ratio/low_min": 0.11994545813649893,
"clip_ratio/region_mean": 0.12991216825321317,
"epoch": 0.573134328358209,
"grad_norm": 0.9444759818819449,
"kl": 0.9089975492097437,
"learning_rate": 0.00017106352458278522,
"loss": -0.009144289419054985,
"memory(GiB)": 79.48,
"step": 48,
"train_speed(iter/s)": 0.002547
},
{
"clip_ratio/high_max": 0.00021043770539108664,
"clip_ratio/high_mean": 0.00021043770539108664,
"clip_ratio/low_mean": 0.002260449342429638,
"clip_ratio/low_min": 0.002260449342429638,
"clip_ratio/region_mean": 0.0024708870478207245,
"completions/clipped_ratio": 0.1328125,
"completions/max_length": 51.0,
"completions/mean_length": 12.921875,
"completions/min_length": 3.0,
"epoch": 0.5850746268656717,
"grad_norm": 1.7364401500647022,
"kl": 0.6272030578693375,
"learning_rate": 0.00016964155692588616,
"loss": 0.004394113551825285,
"memory(GiB)": 79.48,
"reward": 0.1484375,
"reward_std": 0.424231618642807,
"rewards/Response_no_think_reward_1/mean": 0.1484375,
"rewards/Response_no_think_reward_1/std": 0.914363443851471,
"step": 49,
"train_speed(iter/s)": 0.002518
},
{
"clip_ratio/high_max": 0.03189032070804387,
"clip_ratio/high_mean": 0.03189032070804387,
"clip_ratio/low_mean": 0.04090093384729698,
"clip_ratio/low_min": 0.04090093384729698,
"clip_ratio/region_mean": 0.07279125548666343,
"epoch": 0.5970149253731343,
"grad_norm": 4.461755913109612,
"kl": 1.2612105239531957,
"learning_rate": 0.00016819170531091017,
"loss": 0.0014673060504719615,
"memory(GiB)": 79.48,
"step": 50,
"train_speed(iter/s)": 0.002545
},
{
"clip_ratio/high_max": 0.0015625000232830644,
"clip_ratio/high_mean": 0.0015625000232830644,
"clip_ratio/low_mean": 0.0016522249497938901,
"clip_ratio/low_min": 0.0016522249497938901,
"clip_ratio/region_mean": 0.0032147249730769545,
"completions/clipped_ratio": 0.0859375,
"completions/max_length": 51.0,
"completions/mean_length": 10.46875,
"completions/min_length": 3.0,
"epoch": 0.608955223880597,
"grad_norm": 2.519038758282151,
"kl": 0.549895275675226,
"learning_rate": 0.00016671455024759067,
"loss": 0.0033532448578625917,
"memory(GiB)": 79.48,
"reward": 0.1796875,
"reward_std": 0.39886242151260376,
"rewards/Response_no_think_reward_1/mean": 0.1796875,
"rewards/Response_no_think_reward_1/std": 0.9258628487586975,
"step": 51,
"train_speed(iter/s)": 0.002473
},
{
"clip_ratio/high_max": 0.03367150644771755,
"clip_ratio/high_mean": 0.03367150644771755,
"clip_ratio/low_mean": 0.0576377569232136,
"clip_ratio/low_min": 0.0576377569232136,
"clip_ratio/region_mean": 0.09130926383659244,
"epoch": 0.6208955223880597,
"grad_norm": 0.9238461637378925,
"kl": 0.672293990442995,
"learning_rate": 0.00016521068317775753,
"loss": -0.019059473648667336,
"memory(GiB)": 79.48,
"step": 52,
"train_speed(iter/s)": 0.002499
},
{
"clip_ratio/high_max": 0.0013558201026171446,
"clip_ratio/high_mean": 0.0013558201026171446,
"clip_ratio/low_mean": 0.010322635032935068,
"clip_ratio/low_min": 0.010322635032935068,
"clip_ratio/region_mean": 0.011678455251967534,
"completions/clipped_ratio": 0.1796875,
"completions/max_length": 51.0,
"completions/mean_length": 14.0390625,
"completions/min_length": 3.0,
"epoch": 0.6328358208955224,
"grad_norm": 6.547271710761981,
"kl": 1.0316203383699758,
"learning_rate": 0.00016368070623852792,
"loss": 0.006902866996824741,
"memory(GiB)": 79.48,
"reward": 0.1328125,
"reward_std": 0.561459481716156,
"rewards/Response_no_think_reward_1/mean": 0.1328125,
"rewards/Response_no_think_reward_1/std": 0.9081528782844543,
"step": 53,
"train_speed(iter/s)": 0.002484
},
{
"clip_ratio/high_max": 0.0014829304564045742,
"clip_ratio/high_mean": 0.0014829304564045742,
"clip_ratio/low_mean": 0.1896184734068811,
"clip_ratio/low_min": 0.1896184734068811,
"clip_ratio/region_mean": 0.19110140530392528,
"epoch": 0.6447761194029851,
"grad_norm": 3.3472874723788295,
"kl": 2.011909826847841,
"learning_rate": 0.00016212523202121544,
"loss": 0.00577022647485137,
"memory(GiB)": 79.48,
"step": 54,
"train_speed(iter/s)": 0.002509
},
{
"clip_ratio/high_max": 0.0017361111240461469,
"clip_ratio/high_mean": 0.0017361111240461469,
"clip_ratio/low_mean": 0.004226236138492823,
"clip_ratio/low_min": 0.004226236138492823,
"clip_ratio/region_mean": 0.0059623472625389695,
"completions/clipped_ratio": 0.0859375,
"completions/max_length": 51.0,
"completions/mean_length": 10.125,
"completions/min_length": 3.0,
"epoch": 0.6567164179104478,
"grad_norm": 2.1721724253324193,
"kl": 1.4456337625160813,
"learning_rate": 0.00016054488332605283,
"loss": 0.007076151203364134,
"memory(GiB)": 79.48,
"reward": 0.3046875,
"reward_std": 0.4615631103515625,
"rewards/Response_no_think_reward_1/mean": 0.3046875,
"rewards/Response_no_think_reward_1/std": 0.8654214143753052,
"step": 55,
"train_speed(iter/s)": 0.002495
},
{
"clip_ratio/high_max": 0.07161095441551879,
"clip_ratio/high_mean": 0.07161095441551879,
"clip_ratio/low_mean": 0.0391811344306916,
"clip_ratio/low_min": 0.0391811344306916,
"clip_ratio/region_mean": 0.11079208552837372,
"epoch": 0.6686567164179105,
"grad_norm": 1.6216131312943962,
"kl": 0.9301650315364896,
"learning_rate": 0.00015894029291282758,
"loss": -0.018307652324438095,
"memory(GiB)": 79.48,
"step": 56,
"train_speed(iter/s)": 0.002519
},
{
"clip_ratio/high_max": 0.0028409091755747795,
"clip_ratio/high_mean": 0.0028409091755747795,
"clip_ratio/low_mean": 0.007847597065847367,
"clip_ratio/low_min": 0.007847597065847367,
"clip_ratio/region_mean": 0.010688506241422147,
"completions/clipped_ratio": 0.0703125,
"completions/max_length": 51.0,
"completions/mean_length": 8.2109375,
"completions/min_length": 3.0,
"epoch": 0.6805970149253732,
"grad_norm": 4.528309911623671,
"kl": 1.2233935340000244,
"learning_rate": 0.00015731210324752972,
"loss": 0.015045193955302238,
"memory(GiB)": 79.48,
"reward": 0.171875,
"reward_std": 0.5126261711120605,
"rewards/Response_no_think_reward_1/mean": 0.171875,
"rewards/Response_no_think_reward_1/std": 0.9315922856330872,
"step": 57,
"train_speed(iter/s)": 0.002481
},
{
"clip_ratio/high_max": 0.022757820785045624,
"clip_ratio/high_mean": 0.022757820785045624,
"clip_ratio/low_mean": 0.14223288698121905,
"clip_ratio/low_min": 0.14223288698121905,
"clip_ratio/region_mean": 0.1649907068349421,
"epoch": 0.6925373134328359,
"grad_norm": 75.05881389891198,
"kl": 71.87919758663793,
"learning_rate": 0.00015566096624511307,
"loss": 0.9493598341941833,
"memory(GiB)": 79.48,
"step": 58,
"train_speed(iter/s)": 0.002504
},
{
"clip_ratio/high_max": 0.0005230125389061868,
"clip_ratio/high_mean": 0.0005230125389061868,
"clip_ratio/low_mean": 0.012553135456983,
"clip_ratio/low_min": 0.012553135456983,
"clip_ratio/region_mean": 0.013076147937681526,
"completions/clipped_ratio": 0.1171875,
"completions/max_length": 51.0,
"completions/mean_length": 9.3828125,
"completions/min_length": 3.0,
"epoch": 0.7044776119402985,
"grad_norm": 2.061647426051912,
"kl": 3.4461456341377925,
"learning_rate": 0.00015398754300847343,
"loss": 0.024864066392183304,
"memory(GiB)": 79.48,
"reward": 0.3046875,
"reward_std": 0.35084033012390137,
"rewards/Response_no_think_reward_1/mean": 0.3046875,
"rewards/Response_no_think_reward_1/std": 0.9010806679725647,
"step": 59,
"train_speed(iter/s)": 0.002474
},
{
"clip_ratio/high_max": 0.010577498760540038,
"clip_ratio/high_mean": 0.010577498760540038,
"clip_ratio/low_mean": 0.15099563542753458,
"clip_ratio/low_min": 0.15099563542753458,
"clip_ratio/region_mean": 0.16157313529402018,
"epoch": 0.7164179104477612,
"grad_norm": 6.318543519105419,
"kl": 9.211844031116925,
"learning_rate": 0.00015229250356374804,
"loss": 0.058415383100509644,
"memory(GiB)": 79.48,
"step": 60,
"train_speed(iter/s)": 0.002497
},
{
"clip_ratio/high_max": 0.0023436461633536965,
"clip_ratio/high_mean": 0.0023436461633536965,
"clip_ratio/low_mean": 0.01256567076779902,
"clip_ratio/low_min": 0.01256567076779902,
"clip_ratio/region_mean": 0.014909316785633564,
"completions/clipped_ratio": 0.1640625,
"completions/max_length": 51.0,
"completions/mean_length": 9.0546875,
"completions/min_length": 3.0,
"epoch": 0.7283582089552239,
"grad_norm": 8.650077130485371,
"kl": 12.875115153714432,
"learning_rate": 0.00015057652659204197,
"loss": 0.11098186671733856,
"memory(GiB)": 79.48,
"reward": -0.2109375,
"reward_std": 0.3248431980609894,
"rewards/Response_no_think_reward_1/mean": -0.2109375,
"rewards/Response_no_think_reward_1/std": 0.7060185074806213,
"step": 61,
"train_speed(iter/s)": 0.002485
},
{
"clip_ratio/high_max": 0.04812772118020803,
"clip_ratio/high_mean": 0.04812772118020803,
"clip_ratio/low_mean": 0.016272668377496302,
"clip_ratio/low_min": 0.016272668377496302,
"clip_ratio/region_mean": 0.06440038897562772,
"epoch": 0.7402985074626866,
"grad_norm": 6.330882663211948,
"kl": 4.831557432677073,
"learning_rate": 0.00014884029915768944,
"loss": 0.08532620966434479,
"memory(GiB)": 79.48,
"step": 62,
"train_speed(iter/s)": 0.002507
},
{
"clip_ratio/high_max": 0.0009259259095415473,
"clip_ratio/high_mean": 0.0009259259095415473,
"clip_ratio/low_mean": 0.005223244777880609,
"clip_ratio/low_min": 0.005223244777880609,
"clip_ratio/region_mean": 0.006149170687422156,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 49.0,
"completions/mean_length": 6.8203125,
"completions/min_length": 3.0,
"epoch": 0.7522388059701492,
"grad_norm": 0.8455863083310526,
"kl": 3.406710424387711,
"learning_rate": 0.00014708451643315827,
"loss": 0.015459287911653519,
"memory(GiB)": 79.48,
"reward": 0.2890625,
"reward_std": 0.09522313624620438,
"rewards/Response_no_think_reward_1/mean": 0.2890625,
"rewards/Response_no_think_reward_1/std": 0.9319553971290588,
"step": 63,
"train_speed(iter/s)": 0.002478
},
{
"clip_ratio/high_max": 0.00038343557389453053,
"clip_ratio/high_mean": 0.00038343557389453053,
"clip_ratio/low_mean": 0.03692773682996631,
"clip_ratio/low_min": 0.03692773682996631,
"clip_ratio/region_mean": 0.037311173509806395,
"epoch": 0.764179104477612,
"grad_norm": 1.460493225059439,
"kl": 3.925420918938471,
"learning_rate": 0.00014530988142070803,
"loss": 0.015160211361944675,
"memory(GiB)": 79.48,
"step": 64,
"train_speed(iter/s)": 0.002499
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.02216397225856781,
"clip_ratio/low_min": 0.02216397225856781,
"clip_ratio/region_mean": 0.02216397225856781,
"completions/clipped_ratio": 0.15625,
"completions/max_length": 51.0,
"completions/mean_length": 8.1484375,
"completions/min_length": 3.0,
"epoch": 0.7761194029850746,
"grad_norm": 16.54465377888419,
"kl": 13.583033993607387,
"learning_rate": 0.00014351710467091336,
"loss": 0.09176836162805557,
"memory(GiB)": 79.48,
"reward": 0.0,
"reward_std": 0.44421693682670593,
"rewards/Response_no_think_reward_1/mean": 0.0,
"rewards/Response_no_think_reward_1/std": 0.8418202996253967,
"step": 65,
"train_speed(iter/s)": 0.00249
},
{
"clip_ratio/high_max": 0.016292952001094818,
"clip_ratio/high_mean": 0.016292952001094818,
"clip_ratio/low_mean": 0.02969469508389011,
"clip_ratio/low_min": 0.02969469508389011,
"clip_ratio/region_mean": 0.04598764737602323,
"epoch": 0.7880597014925373,
"grad_norm": 7.478581616879351,
"kl": 9.063416050747037,
"learning_rate": 0.0001417069039981647,
"loss": 0.08187955617904663,
"memory(GiB)": 79.48,
"step": 66,
"train_speed(iter/s)": 0.00251
},
{
"clip_ratio/high_max": 0.0003571428533177823,
"clip_ratio/high_mean": 0.0003571428533177823,
"clip_ratio/low_mean": 0.011069363099522889,
"clip_ratio/low_min": 0.011069363099522889,
"clip_ratio/region_mean": 0.011426505981944501,
"completions/clipped_ratio": 0.1171875,
"completions/max_length": 48.0,
"completions/mean_length": 6.75,
"completions/min_length": 3.0,
"epoch": 0.8,
"grad_norm": 2.789323653853436,
"kl": 6.344451879562257,
"learning_rate": 0.00013988000419326072,
"loss": 0.04125535860657692,
"memory(GiB)": 79.48,
"reward": 0.21875,
"reward_std": 0.40496253967285156,
"rewards/Response_no_think_reward_1/mean": 0.21875,
"rewards/Response_no_think_reward_1/std": 0.8778777122497559,
"step": 67,
"train_speed(iter/s)": 0.0025
},
{
"clip_ratio/high_max": 0.036289573181420565,
"clip_ratio/high_mean": 0.036289573181420565,
"clip_ratio/low_mean": 0.07330909674055874,
"clip_ratio/low_min": 0.07330909674055874,
"clip_ratio/region_mean": 0.10959866992197931,
"epoch": 0.8119402985074626,
"grad_norm": 3.351094606732551,
"kl": 7.85955839138478,
"learning_rate": 0.00013803713673320772,
"loss": 0.0294882133603096,
"memory(GiB)": 79.48,
"step": 68,
"train_speed(iter/s)": 0.00252
},
{
"clip_ratio/high_max": 0.0034414873807691038,
"clip_ratio/high_mean": 0.0034414873807691038,
"clip_ratio/low_mean": 0.017763152020052075,
"clip_ratio/low_min": 0.017763152020052075,
"clip_ratio/region_mean": 0.021204639226198196,
"completions/clipped_ratio": 0.1953125,
"completions/max_length": 50.0,
"completions/mean_length": 9.0390625,
"completions/min_length": 3.0,
"epoch": 0.8238805970149253,
"grad_norm": 2.3936208496329043,
"kl": 8.319812071829801,
"learning_rate": 0.00013617903948834155,
"loss": 0.0558692142367363,
"memory(GiB)": 79.48,
"reward": 0.1484375,
"reward_std": 0.5162962079048157,
"rewards/Response_no_think_reward_1/mean": 0.1484375,
"rewards/Response_no_think_reward_1/std": 0.7642591595649719,
"step": 69,
"train_speed(iter/s)": 0.002511
},
{
"clip_ratio/high_max": 0.05922704888507724,
"clip_ratio/high_mean": 0.05922704888507724,
"clip_ratio/low_mean": 0.03970964252948761,
"clip_ratio/low_min": 0.03970964252948761,
"clip_ratio/region_mean": 0.09893669094890356,
"epoch": 0.835820895522388,
"grad_norm": 6.476273530366032,
"kl": 5.813117837678874,
"learning_rate": 0.00013430645642688988,
"loss": 0.04987351968884468,
"memory(GiB)": 79.48,
"step": 70,
"train_speed(iter/s)": 0.00253
},
{
"clip_ratio/high_max": 0.002159281895728782,
"clip_ratio/high_mean": 0.002159281895728782,
"clip_ratio/low_mean": 0.010578428045846522,
"clip_ratio/low_min": 0.010578428045846522,
"clip_ratio/region_mean": 0.012737710087094456,
"completions/clipped_ratio": 0.1171875,
"completions/max_length": 44.0,
"completions/mean_length": 9.2421875,
"completions/min_length": 3.0,
"epoch": 0.8477611940298507,
"grad_norm": 3.9784798974103217,
"kl": 7.147874560090713,
"learning_rate": 0.00013242013731709287,
"loss": 0.06330341100692749,
"memory(GiB)": 79.48,
"reward": 0.015625,
"reward_std": 0.39743539690971375,
"rewards/Response_no_think_reward_1/mean": 0.015625,
"rewards/Response_no_think_reward_1/std": 0.6985291242599487,
"step": 71,
"train_speed(iter/s)": 0.002526
},
{
"clip_ratio/high_max": 0.014909500489011407,
"clip_ratio/high_mean": 0.014909500489011407,
"clip_ratio/low_mean": 0.05899865587707609,
"clip_ratio/low_min": 0.05899865587707609,
"clip_ratio/region_mean": 0.07390815508551896,
"epoch": 0.8597014925373134,
"grad_norm": 107.14584369632281,
"kl": 5.481248813099228,
"learning_rate": 0.00013052083742700173,
"loss": 0.5873211026191711,
"memory(GiB)": 79.48,
"step": 72,
"train_speed(iter/s)": 0.002544
},
{
"clip_ratio/high_max": 0.005898644914850593,
"clip_ratio/high_mean": 0.005898644914850593,
"clip_ratio/low_mean": 0.013190844911150634,
"clip_ratio/low_min": 0.013190844911150634,
"clip_ratio/region_mean": 0.01908948994241655,
"completions/clipped_ratio": 0.1484375,
"completions/max_length": 51.0,
"completions/mean_length": 7.625,
"completions/min_length": 3.0,
"epoch": 0.8716417910447761,
"grad_norm": 5.671656969858763,
"kl": 5.887194114271551,
"learning_rate": 0.0001286093172220748,
"loss": 0.05823807045817375,
"memory(GiB)": 79.48,
"reward": 0.0078125,
"reward_std": 0.47193682193756104,
"rewards/Response_no_think_reward_1/mean": 0.0078125,
"rewards/Response_no_think_reward_1/std": 0.8648526072502136,
"step": 73,
"train_speed(iter/s)": 0.002537
},
{
"clip_ratio/high_max": 0.05940199224278331,
"clip_ratio/high_mean": 0.05940199224278331,
"clip_ratio/low_mean": 0.07782801624853164,
"clip_ratio/low_min": 0.07782801624853164,
"clip_ratio/region_mean": 0.1372300088405609,
"epoch": 0.8835820895522388,
"grad_norm": 5.588550612212405,
"kl": 9.119772452046163,
"learning_rate": 0.00012668634206069304,
"loss": 0.05784386023879051,
"memory(GiB)": 79.48,
"step": 74,
"train_speed(iter/s)": 0.002555
},
{
"clip_ratio/high_max": 0.0005630630766972899,
"clip_ratio/high_mean": 0.0005630630766972899,
"clip_ratio/low_mean": 0.009406007709912956,
"clip_ratio/low_min": 0.009406007709912956,
"clip_ratio/region_mean": 0.009969070786610246,
"completions/clipped_ratio": 0.0546875,
"completions/max_length": 43.0,
"completions/mean_length": 7.3671875,
"completions/min_length": 3.0,
"epoch": 0.8955223880597015,
"grad_norm": 40.351102862526105,
"kl": 37.61209568884806,
"learning_rate": 0.00012475268188771627,
"loss": 0.25722047686576843,
"memory(GiB)": 79.48,
"reward": 0.515625,
"reward_std": 0.3077147901058197,
"rewards/Response_no_think_reward_1/mean": 0.515625,
"rewards/Response_no_think_reward_1/std": 0.5883966684341431,
"step": 75,
"train_speed(iter/s)": 0.00255
},
{
"clip_ratio/high_max": 0.03623928187880665,
"clip_ratio/high_mean": 0.03623928187880665,
"clip_ratio/low_mean": 0.00604772218503058,
"clip_ratio/low_min": 0.00604772218503058,
"clip_ratio/region_mean": 0.04228700394742191,
"epoch": 0.9074626865671642,
"grad_norm": 17.208461552664357,
"kl": 6.087301138206385,
"learning_rate": 0.00012280911092620297,
"loss": 0.16766606271266937,
"memory(GiB)": 79.48,
"step": 76,
"train_speed(iter/s)": 0.002568
},
{
"clip_ratio/high_max": 0.0016891892300918698,
"clip_ratio/high_mean": 0.0016891892300918698,
"clip_ratio/low_mean": 0.012179655604995787,
"clip_ratio/low_min": 0.012179655604995787,
"clip_ratio/region_mean": 0.013868844718672335,
"completions/clipped_ratio": 0.125,
"completions/max_length": 39.0,
"completions/mean_length": 7.21875,
"completions/min_length": 3.0,
"epoch": 0.9194029850746268,
"grad_norm": 4.3979207862679734,
"kl": 7.126492358453106,
"learning_rate": 0.00012085640736741708,
"loss": 0.06262560933828354,
"memory(GiB)": 79.48,
"reward": 0.0546875,
"reward_std": 0.39322251081466675,
"rewards/Response_no_think_reward_1/mean": 0.0546875,
"rewards/Response_no_think_reward_1/std": 0.7561672329902649,
"step": 77,
"train_speed(iter/s)": 0.002562
},
{
"clip_ratio/high_max": 0.026138584362342954,
"clip_ratio/high_mean": 0.026138584362342954,
"clip_ratio/low_mean": 0.04480157361831516,
"clip_ratio/low_min": 0.04480157361831516,
"clip_ratio/region_mean": 0.07094015786424279,
"epoch": 0.9313432835820895,
"grad_norm": 2.916485581854171,
"kl": 4.029124836612027,
"learning_rate": 0.00011889535305924618,
"loss": 0.04432527720928192,
"memory(GiB)": 79.48,
"step": 78,
"train_speed(iter/s)": 0.002579
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0125213154242374,
"clip_ratio/low_min": 0.0125213154242374,
"clip_ratio/region_mean": 0.0125213154242374,
"completions/clipped_ratio": 0.1015625,
"completions/max_length": 41.0,
"completions/mean_length": 7.5703125,
"completions/min_length": 3.0,
"epoch": 0.9432835820895522,
"grad_norm": 5.401724081079944,
"kl": 2.715451994285104,
"learning_rate": 0.00011692673319315541,
"loss": 0.025846321135759354,
"memory(GiB)": 79.48,
"reward": 0.15625,
"reward_std": 0.32662156224250793,
"rewards/Response_no_think_reward_1/mean": 0.15625,
"rewards/Response_no_think_reward_1/std": 0.778019905090332,
"step": 79,
"train_speed(iter/s)": 0.002572
},
{
"clip_ratio/high_max": 0.02864583395421505,
"clip_ratio/high_mean": 0.02864583395421505,
"clip_ratio/low_mean": 0.06598890712484717,
"clip_ratio/low_min": 0.06598890712484717,
"clip_ratio/region_mean": 0.09463474014773965,
"epoch": 0.9552238805970149,
"grad_norm": 1.7607357402294221,
"kl": 3.6259496022976236,
"learning_rate": 0.00011495133598980263,
"loss": 0.011118962429463863,
"memory(GiB)": 79.48,
"step": 80,
"train_speed(iter/s)": 0.002589
},
{
"clip_ratio/high_max": 0.0010000000474974513,
"clip_ratio/high_mean": 0.0010000000474974513,
"clip_ratio/low_mean": 0.009746301162522286,
"clip_ratio/low_min": 0.009746301162522286,
"clip_ratio/region_mean": 0.010746301151812077,
"completions/clipped_ratio": 0.1015625,
"completions/max_length": 45.0,
"completions/mean_length": 7.421875,
"completions/min_length": 3.0,
"epoch": 0.9671641791044776,
"grad_norm": 6.226807855082435,
"kl": 3.5353202793048695,
"learning_rate": 0.00011296995238344084,
"loss": 0.0407019704580307,
"memory(GiB)": 79.48,
"reward": 0.2109375,
"reward_std": 0.3596799373626709,
"rewards/Response_no_think_reward_1/mean": 0.2109375,
"rewards/Response_no_think_reward_1/std": 0.78019118309021,
"step": 81,
"train_speed(iter/s)": 0.002582
},
{
"clip_ratio/high_max": 0.025790343526750803,
"clip_ratio/high_mean": 0.025790343526750803,
"clip_ratio/low_mean": 0.027053400757722557,
"clip_ratio/low_min": 0.027053400757722557,
"clip_ratio/region_mean": 0.052843744633719325,
"epoch": 0.9791044776119403,
"grad_norm": 43.50825312796573,
"kl": 2.1143818981945515,
"learning_rate": 0.00011098337570523396,
"loss": 0.1263183057308197,
"memory(GiB)": 79.48,
"step": 82,
"train_speed(iter/s)": 0.002599
},
{
"clip_ratio/high_max": 0.0045458003878593445,
"clip_ratio/high_mean": 0.0045458003878593445,
"clip_ratio/low_mean": 0.004786531790159643,
"clip_ratio/low_min": 0.004786531790159643,
"clip_ratio/region_mean": 0.009332332178018987,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 23.0,
"completions/mean_length": 5.6796875,
"completions/min_length": 3.0,
"epoch": 1.0119402985074626,
"grad_norm": 5.294876949688284,
"kl": 1.5498897642164593,
"learning_rate": 0.00010899240136561299,
"loss": 0.011598482728004456,
"memory(GiB)": 79.48,
"reward": 0.4453125,
"reward_std": 0.1938612163066864,
"rewards/Response_no_think_reward_1/mean": 0.4453125,
"rewards/Response_no_think_reward_1/std": 0.7187981605529785,
"step": 83,
"train_speed(iter/s)": 0.002589
},
{
"clip_ratio/high_max": 0.025593542493879795,
"clip_ratio/high_mean": 0.025593542493879795,
"clip_ratio/low_mean": 0.025054577039554715,
"clip_ratio/low_min": 0.025054577039554715,
"clip_ratio/region_mean": 0.05064811953343451,
"epoch": 1.0238805970149254,
"grad_norm": 2.6737027093734143,
"kl": 1.398324867649535,
"learning_rate": 0.00010699782653579973,
"loss": -0.00029344583163037896,
"memory(GiB)": 79.48,
"step": 84,
"train_speed(iter/s)": 0.002605
},
{
"clip_ratio/high_max": 0.0017993993242271245,
"clip_ratio/high_mean": 0.0017993993242271245,
"clip_ratio/low_mean": 0.01037665200419724,
"clip_ratio/low_min": 0.01037665200419724,
"clip_ratio/region_mean": 0.012176051270216703,
"completions/clipped_ratio": 0.171875,
"completions/max_length": 42.0,
"completions/mean_length": 6.125,
"completions/min_length": 3.0,
"epoch": 1.035820895522388,
"grad_norm": 2.5145149964606297,
"kl": 3.1435449587497715,
"learning_rate": 0.00010500044982862519,
"loss": 0.024344690144062042,
"memory(GiB)": 79.48,
"reward": 0.4765625,
"reward_std": 0.2772369980812073,
"rewards/Response_no_think_reward_1/mean": 0.4765625,
"rewards/Response_no_think_reward_1/std": 0.8414914011955261,
"step": 85,
"train_speed(iter/s)": 0.002595
},
{
"clip_ratio/high_max": 0.021866617840714753,
"clip_ratio/high_mean": 0.021866617840714753,
"clip_ratio/low_mean": 0.07049822807312012,
"clip_ratio/low_min": 0.07049822807312012,
"clip_ratio/region_mean": 0.09236484486609697,
"epoch": 1.0477611940298508,
"grad_norm": 2.607332219212116,
"kl": 4.641115245953188,
"learning_rate": 0.00010300107097877114,
"loss": 0.010013583116233349,
"memory(GiB)": 79.48,
"step": 86,
"train_speed(iter/s)": 0.00261
},
{
"clip_ratio/high_max": 0.0018382353009656072,
"clip_ratio/high_mean": 0.0018382353009656072,
"clip_ratio/low_mean": 0.0032051282469183207,
"clip_ratio/low_min": 0.0032051282469183207,
"clip_ratio/region_mean": 0.005043363547883928,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 20.0,
"completions/mean_length": 5.4375,
"completions/min_length": 3.0,
"epoch": 1.0597014925373134,
"grad_norm": 8.56914849705318,
"kl": 0.7865612751156732,
"learning_rate": 0.00010100049052256235,
"loss": 0.013117787428200245,
"memory(GiB)": 79.48,
"reward": 0.53125,
"reward_std": 0.1860944628715515,
"rewards/Response_no_think_reward_1/mean": 0.53125,
"rewards/Response_no_think_reward_1/std": 0.7202088236808777,
"step": 87,
"train_speed(iter/s)": 0.002597
},
{
"clip_ratio/high_max": 0.009521116502583027,
"clip_ratio/high_mean": 0.009521116502583027,
"clip_ratio/low_mean": 0.0203368536895141,
"clip_ratio/low_min": 0.0203368536895141,
"clip_ratio/region_mean": 0.029857969493605196,
"epoch": 1.0716417910447762,
"grad_norm": 3.3791848142288035,
"kl": 0.6961851019823371,
"learning_rate": 9.899950947743767e-05,
"loss": 0.00659452797845006,
"memory(GiB)": 79.48,
"step": 88,
"train_speed(iter/s)": 0.002612
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.004996612435206771,
"clip_ratio/low_min": 0.004996612435206771,
"clip_ratio/region_mean": 0.004996612435206771,
"completions/clipped_ratio": 0.1171875,
"completions/max_length": 31.0,
"completions/mean_length": 5.2265625,
"completions/min_length": 3.0,
"epoch": 1.0835820895522388,
"grad_norm": 3.6519414582158323,
"kl": 4.849585925694555,
"learning_rate": 9.699892902122886e-05,
"loss": 0.06144208833575249,
"memory(GiB)": 79.48,
"reward": 0.1640625,
"reward_std": 0.3352247476577759,
"rewards/Response_no_think_reward_1/mean": 0.1640625,
"rewards/Response_no_think_reward_1/std": 0.8303053379058838,
"step": 89,
"train_speed(iter/s)": 0.002606
},
{
"clip_ratio/high_max": 0.017538156593218446,
"clip_ratio/high_mean": 0.017538156593218446,
"clip_ratio/low_mean": 0.03697483101859689,
"clip_ratio/low_min": 0.03697483101859689,
"clip_ratio/region_mean": 0.054512988310307264,
"epoch": 1.0955223880597016,
"grad_norm": 13.104523239395307,
"kl": 2.37760816863738,
"learning_rate": 9.499955017137484e-05,
"loss": 0.10894370079040527,
"memory(GiB)": 79.48,
"step": 90,
"train_speed(iter/s)": 0.002621
},
{
"clip_ratio/high_max": 0.004422514699399471,
"clip_ratio/high_mean": 0.004422514699399471,
"clip_ratio/low_mean": 0.007080804323777556,
"clip_ratio/low_min": 0.007080804323777556,
"clip_ratio/region_mean": 0.01150331913959235,
"completions/clipped_ratio": 0.046875,
"completions/max_length": 7.0,
"completions/mean_length": 4.6640625,
"completions/min_length": 3.0,
"epoch": 1.1074626865671642,
"grad_norm": 3.292956583617785,
"kl": 3.1563512758002616,
"learning_rate": 9.30021734642003e-05,
"loss": 0.03713127598166466,
"memory(GiB)": 79.48,
"reward": 0.421875,
"reward_std": 0.2630079686641693,
"rewards/Response_no_think_reward_1/mean": 0.421875,
"rewards/Response_no_think_reward_1/std": 0.7382611632347107,
"step": 91,
"train_speed(iter/s)": 0.002603
},
{
"clip_ratio/high_max": 0.012390351388603449,
"clip_ratio/high_mean": 0.012390351388603449,
"clip_ratio/low_mean": 0.01934311306104064,
"clip_ratio/low_min": 0.01934311306104064,
"clip_ratio/region_mean": 0.03173346375115216,
"epoch": 1.1194029850746268,
"grad_norm": 6.523254504794387,
"kl": 2.134530827694107,
"learning_rate": 9.100759863438702e-05,
"loss": 0.04548652470111847,
"memory(GiB)": 79.48,
"step": 92,
"train_speed(iter/s)": 0.002618
},
{
"clip_ratio/high_max": 0.0018115942366421223,
"clip_ratio/high_mean": 0.0018115942366421223,
"clip_ratio/low_mean": 0.010487846680916846,
"clip_ratio/low_min": 0.010487846680916846,
"clip_ratio/region_mean": 0.012299440917558968,
"completions/clipped_ratio": 0.078125,
"completions/max_length": 17.0,
"completions/mean_length": 4.7109375,
"completions/min_length": 3.0,
"epoch": 1.1313432835820896,
"grad_norm": 2.8653500050121345,
"kl": 3.8929527901345864,
"learning_rate": 8.901662429476607e-05,
"loss": 0.04490555822849274,
"memory(GiB)": 79.48,
"reward": 0.1796875,
"reward_std": 0.25065141916275024,
"rewards/Response_no_think_reward_1/mean": 0.1796875,
"rewards/Response_no_think_reward_1/std": 0.9173188805580139,
"step": 93,
"train_speed(iter/s)": 0.00261
},
{
"clip_ratio/high_max": 0.019497282337397337,
"clip_ratio/high_mean": 0.019497282337397337,
"clip_ratio/low_mean": 0.05975891789421439,
"clip_ratio/low_min": 0.05975891789421439,
"clip_ratio/region_mean": 0.07925620023161173,
"epoch": 1.1432835820895522,
"grad_norm": 8.612775013595648,
"kl": 4.982872966560535,
"learning_rate": 8.703004761655917e-05,
"loss": 0.07919233292341232,
"memory(GiB)": 79.48,
"step": 94,
"train_speed(iter/s)": 0.002625
},
{
"clip_ratio/high_max": 0.0027173913549631834,
"clip_ratio/high_mean": 0.0027173913549631834,
"clip_ratio/low_mean": 0.005094834603369236,
"clip_ratio/low_min": 0.005094834603369236,
"clip_ratio/region_mean": 0.007812225958332419,
"completions/clipped_ratio": 0.0859375,
"completions/max_length": 10.0,
"completions/mean_length": 4.9375,
"completions/min_length": 3.0,
"epoch": 1.155223880597015,
"grad_norm": 10.776677331970285,
"kl": 9.849615207003808,
"learning_rate": 8.504866401019737e-05,
"loss": 0.1374131143093109,
"memory(GiB)": 79.48,
"reward": 0.3203125,
"reward_std": 0.14966703951358795,
"rewards/Response_no_think_reward_1/mean": 0.3203125,
"rewards/Response_no_think_reward_1/std": 0.6266219019889832,
"step": 95,
"train_speed(iter/s)": 0.002622
},
{
"clip_ratio/high_max": 0.019021738320589066,
"clip_ratio/high_mean": 0.019021738320589066,
"clip_ratio/low_mean": 0.005626177066005766,
"clip_ratio/low_min": 0.005626177066005766,
"clip_ratio/region_mean": 0.024647915386594832,
"epoch": 1.1671641791044776,
"grad_norm": 3.0583039624376402,
"kl": 4.468168576029711,
"learning_rate": 8.307326680684461e-05,
"loss": 0.07699939608573914,
"memory(GiB)": 79.48,
"step": 96,
"train_speed(iter/s)": 0.002636
},
{
"clip_ratio/high_max": 0.007378174108453095,
"clip_ratio/high_mean": 0.007378174108453095,
"clip_ratio/low_mean": 0.00924376118928194,
"clip_ratio/low_min": 0.00924376118928194,
"clip_ratio/region_mean": 0.016621935297735035,
"completions/clipped_ratio": 0.0546875,
"completions/max_length": 12.0,
"completions/mean_length": 4.9453125,
"completions/min_length": 3.0,
"epoch": 1.1791044776119404,
"grad_norm": 9.444776640622303,
"kl": 3.863095655280631,
"learning_rate": 8.110464694075383e-05,
"loss": 0.02421477437019348,
"memory(GiB)": 79.48,
"reward": 0.4375,
"reward_std": 0.25460314750671387,
"rewards/Response_no_think_reward_1/mean": 0.4375,
"rewards/Response_no_think_reward_1/std": 0.7290377616882324,
"step": 97,
"train_speed(iter/s)": 0.002626
},
{
"clip_ratio/high_max": 0.02187895681709051,
"clip_ratio/high_mean": 0.02187895681709051,
"clip_ratio/low_mean": 0.005211503244936466,
"clip_ratio/low_min": 0.005211503244936466,
"clip_ratio/region_mean": 0.027090460062026978,
"epoch": 1.191044776119403,
"grad_norm": 4.753171281552747,
"kl": 3.498804785136599,
"learning_rate": 7.914359263258295e-05,
"loss": 0.02348589338362217,
"memory(GiB)": 79.48,
"step": 98,
"train_speed(iter/s)": 0.00264
},
{
"clip_ratio/high_max": 0.0014204545877873898,
"clip_ratio/high_mean": 0.0014204545877873898,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0014204545877873898,
"completions/clipped_ratio": 0.0546875,
"completions/max_length": 11.0,
"completions/mean_length": 5.5859375,
"completions/min_length": 3.0,
"epoch": 1.2029850746268655,
"grad_norm": 4.853951435141314,
"kl": 7.24955918840169,
"learning_rate": 7.719088907379706e-05,
"loss": 0.08564330637454987,
"memory(GiB)": 79.48,
"reward": 0.359375,
"reward_std": 0.1706565022468567,
"rewards/Response_no_think_reward_1/mean": 0.359375,
"rewards/Response_no_think_reward_1/std": 0.6608795523643494,
"step": 99,
"train_speed(iter/s)": 0.002636
},
{
"clip_ratio/high_max": 0.01420454541221261,
"clip_ratio/high_mean": 0.01420454541221261,
"clip_ratio/low_mean": 0.0028409091755747795,
"clip_ratio/low_min": 0.0028409091755747795,
"clip_ratio/region_mean": 0.017045455053448677,
"epoch": 1.2149253731343284,
"grad_norm": 2.2986744180745324,
"kl": 4.886410776793127,
"learning_rate": 7.524731811228374e-05,
"loss": 0.06466365605592728,
"memory(GiB)": 79.48,
"step": 100,
"train_speed(iter/s)": 0.00265
},
{
"clip_ratio/high_max": 0.00620507646817714,
"clip_ratio/high_mean": 0.00620507646817714,
"clip_ratio/low_mean": 0.008002021699212492,
"clip_ratio/low_min": 0.008002021699212492,
"clip_ratio/region_mean": 0.014207098283804953,
"completions/clipped_ratio": 0.0859375,
"completions/max_length": 19.0,
"completions/mean_length": 6.2890625,
"completions/min_length": 3.0,
"epoch": 1.2268656716417912,
"grad_norm": 35.84498974880178,
"kl": 13.474940237792907,
"learning_rate": 7.331365793930698e-05,
"loss": 0.23400571942329407,
"memory(GiB)": 79.48,
"reward": 0.3671875,
"reward_std": 0.1965562105178833,
"rewards/Response_no_think_reward_1/mean": 0.3671875,
"rewards/Response_no_think_reward_1/std": 0.7410472631454468,
"step": 101,
"train_speed(iter/s)": 0.002642
},
{
"clip_ratio/high_max": 0.011945601785555482,
"clip_ratio/high_mean": 0.011945601785555482,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.011945601785555482,
"epoch": 1.2388059701492538,
"grad_norm": 27.884607230951485,
"kl": 1.4154490869450456,
"learning_rate": 7.139068277792523e-05,
"loss": 0.2148125171661377,
"memory(GiB)": 79.48,
"step": 102,
"train_speed(iter/s)": 0.002655
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.007009345572441816,
"clip_ratio/low_min": 0.007009345572441816,
"clip_ratio/region_mean": 0.007009345572441816,
"completions/clipped_ratio": 0.0546875,
"completions/max_length": 40.0,
"completions/mean_length": 5.640625,
"completions/min_length": 3.0,
"epoch": 1.2507462686567163,
"grad_norm": 2.3687718583378876,
"kl": 1.394652240909636,
"learning_rate": 6.94791625729983e-05,
"loss": 0.018386229872703552,
"memory(GiB)": 79.48,
"reward": 0.6328125,
"reward_std": 0.20033246278762817,
"rewards/Response_no_think_reward_1/mean": 0.6328125,
"rewards/Response_no_think_reward_1/std": 0.6258360743522644,
"step": 103,
"train_speed(iter/s)": 0.002645
},
{
"clip_ratio/high_max": 0.031393789453431964,
"clip_ratio/high_mean": 0.031393789453431964,
"clip_ratio/low_mean": 0.01482532313093543,
"clip_ratio/low_min": 0.01482532313093543,
"clip_ratio/region_mean": 0.04621911211870611,
"epoch": 1.2626865671641792,
"grad_norm": 1.3586707954485446,
"kl": 1.0225394079461694,
"learning_rate": 6.757986268290712e-05,
"loss": 0.011677918955683708,
"memory(GiB)": 79.48,
"step": 104,
"train_speed(iter/s)": 0.002658
},
{
"clip_ratio/high_max": 0.00795477326028049,
"clip_ratio/high_mean": 0.00795477326028049,
"clip_ratio/low_mean": 0.007858287775889039,
"clip_ratio/low_min": 0.007858287775889039,
"clip_ratio/region_mean": 0.015813061269000173,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 32.0,
"completions/mean_length": 5.828125,
"completions/min_length": 3.0,
"epoch": 1.2746268656716417,
"grad_norm": 16.43559312212207,
"kl": 1.8490474935271664,
"learning_rate": 6.569354357311014e-05,
"loss": 0.03543264418840408,
"memory(GiB)": 79.48,
"reward": 0.3671875,
"reward_std": 0.31494253873825073,
"rewards/Response_no_think_reward_1/mean": 0.3671875,
"rewards/Response_no_think_reward_1/std": 0.7923958897590637,
"step": 105,
"train_speed(iter/s)": 0.002652
},
{
"clip_ratio/high_max": 0.011914517963305116,
"clip_ratio/high_mean": 0.011914517963305116,
"clip_ratio/low_mean": 0.03227056178729981,
"clip_ratio/low_min": 0.03227056178729981,
"clip_ratio/region_mean": 0.04418508114758879,
"epoch": 1.2865671641791045,
"grad_norm": 2.5408508655554636,
"kl": 1.8903868702007571,
"learning_rate": 6.382096051165847e-05,
"loss": 0.014127654023468494,
"memory(GiB)": 79.48,
"step": 106,
"train_speed(iter/s)": 0.002665
},
{
"clip_ratio/high_max": 0.0030637255404144526,
"clip_ratio/high_mean": 0.0030637255404144526,
"clip_ratio/low_mean": 0.015822806861251593,
"clip_ratio/low_min": 0.015822806861251593,
"clip_ratio/region_mean": 0.018886532401666045,
"completions/clipped_ratio": 0.109375,
"completions/max_length": 47.0,
"completions/mean_length": 6.7109375,
"completions/min_length": 3.0,
"epoch": 1.2985074626865671,
"grad_norm": 5.1535076282650945,
"kl": 2.8769574181642383,
"learning_rate": 6.19628632667923e-05,
"loss": 0.038440439850091934,
"memory(GiB)": 79.48,
"reward": -0.0625,
"reward_std": 0.4184814691543579,
"rewards/Response_no_think_reward_1/mean": -0.0625,
"rewards/Response_no_think_reward_1/std": 0.8394786715507507,
"step": 107,
"train_speed(iter/s)": 0.002655
},
{
"clip_ratio/high_max": 0.011060049437219277,
"clip_ratio/high_mean": 0.011060049437219277,
"clip_ratio/low_mean": 0.05394765589153394,
"clip_ratio/low_min": 0.05394765589153394,
"clip_ratio/region_mean": 0.06500770541606471,
"epoch": 1.31044776119403,
"grad_norm": 38.3461665329109,
"kl": 2.019717270624824,
"learning_rate": 6.011999580673931e-05,
"loss": 0.16980835795402527,
"memory(GiB)": 79.48,
"step": 108,
"train_speed(iter/s)": 0.002668
},
{
"clip_ratio/high_max": 0.0016025641234591603,
"clip_ratio/high_mean": 0.0016025641234591603,
"clip_ratio/low_mean": 0.0032051282469183207,
"clip_ratio/low_min": 0.0032051282469183207,
"clip_ratio/region_mean": 0.004807692486792803,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 25.0,
"completions/mean_length": 5.703125,
"completions/min_length": 3.0,
"epoch": 1.3223880597014925,
"grad_norm": 1.9241770555383604,
"kl": 0.4095292093356875,
"learning_rate": 5.829309600183536e-05,
"loss": 0.003778851358219981,
"memory(GiB)": 79.48,
"reward": 0.453125,
"reward_std": 0.24464011192321777,
"rewards/Response_no_think_reward_1/mean": 0.453125,
"rewards/Response_no_think_reward_1/std": 0.8405039310455322,
"step": 109,
"train_speed(iter/s)": 0.00266
},
{
"clip_ratio/high_max": 0.016826923470944166,
"clip_ratio/high_mean": 0.016826923470944166,
"clip_ratio/low_mean": 0.025240384973585606,
"clip_ratio/low_min": 0.025240384973585606,
"clip_ratio/region_mean": 0.042067307978868484,
"epoch": 1.3343283582089551,
"grad_norm": 4.00720293405374,
"kl": 0.3944609015534297,
"learning_rate": 5.648289532908666e-05,
"loss": 0.0013700753916054964,
"memory(GiB)": 79.48,
"step": 110,
"train_speed(iter/s)": 0.002673
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.012351020704954863,
"clip_ratio/low_min": 0.012351020704954863,
"clip_ratio/region_mean": 0.012351020704954863,
"completions/clipped_ratio": 0.2265625,
"completions/max_length": 23.0,
"completions/mean_length": 6.03125,
"completions/min_length": 3.0,
"epoch": 1.346268656716418,
"grad_norm": 5.342919033145562,
"kl": 6.366508552979212,
"learning_rate": 5.4690118579292015e-05,
"loss": 0.08252155035734177,
"memory(GiB)": 79.48,
"reward": -0.0703125,
"reward_std": 0.5281283259391785,
"rewards/Response_no_think_reward_1/mean": -0.0703125,
"rewards/Response_no_think_reward_1/std": 0.7954951524734497,
"step": 111,
"train_speed(iter/s)": 0.002667
},
{
"clip_ratio/high_max": 0.0056201552506536245,
"clip_ratio/high_mean": 0.0056201552506536245,
"clip_ratio/low_mean": 0.07672008802182972,
"clip_ratio/low_min": 0.07672008802182972,
"clip_ratio/region_mean": 0.08234024350531399,
"epoch": 1.3582089552238805,
"grad_norm": 4.841852348859136,
"kl": 7.482738017570227,
"learning_rate": 5.291548356684177e-05,
"loss": 0.06593235582113266,
"memory(GiB)": 79.48,
"step": 112,
"train_speed(iter/s)": 0.00268
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.00446532026398927,
"clip_ratio/low_min": 0.00446532026398927,
"clip_ratio/region_mean": 0.00446532026398927,
"completions/clipped_ratio": 0.046875,
"completions/max_length": 10.0,
"completions/mean_length": 5.328125,
"completions/min_length": 3.0,
"epoch": 1.3701492537313433,
"grad_norm": 2.4231207405852158,
"kl": 2.7402262951763987,
"learning_rate": 5.115970084231059e-05,
"loss": 0.021689381450414658,
"memory(GiB)": 79.48,
"reward": 0.4453125,
"reward_std": 0.33350807428359985,
"rewards/Response_no_think_reward_1/mean": 0.4453125,
"rewards/Response_no_think_reward_1/std": 0.7817665934562683,
"step": 113,
"train_speed(iter/s)": 0.002673
},
{
"clip_ratio/high_max": 0.02434239676222205,
"clip_ratio/high_mean": 0.02434239676222205,
"clip_ratio/low_mean": 0.0223974745022133,
"clip_ratio/low_min": 0.0223974745022133,
"clip_ratio/region_mean": 0.046739870798774064,
"epoch": 1.382089552238806,
"grad_norm": 1.0551090300064008,
"kl": 2.37436256357978,
"learning_rate": 4.9423473407958035e-05,
"loss": 0.008349667303264141,
"memory(GiB)": 79.48,
"step": 114,
"train_speed(iter/s)": 0.002685
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.011147994082421064,
"clip_ratio/low_min": 0.011147994082421064,
"clip_ratio/region_mean": 0.011147994082421064,
"completions/clipped_ratio": 0.15625,
"completions/max_length": 11.0,
"completions/mean_length": 5.3515625,
"completions/min_length": 3.0,
"epoch": 1.3940298507462687,
"grad_norm": 35.484376517766954,
"kl": 24.603704601235222,
"learning_rate": 4.7707496436252e-05,
"loss": 0.3364083468914032,
"memory(GiB)": 79.48,
"reward": 0.1328125,
"reward_std": 0.28117600083351135,
"rewards/Response_no_think_reward_1/mean": 0.1328125,
"rewards/Response_no_think_reward_1/std": 0.8264437913894653,
"step": 115,
"train_speed(iter/s)": 0.002678
},
{
"clip_ratio/high_max": 0.002314814832061529,
"clip_ratio/high_mean": 0.002314814832061529,
"clip_ratio/low_mean": 0.0054197743302211165,
"clip_ratio/low_min": 0.0054197743302211165,
"clip_ratio/region_mean": 0.007734589162282646,
"epoch": 1.4059701492537313,
"grad_norm": 7.954623939964381,
"kl": 12.087648045126116,
"learning_rate": 4.601245699152659e-05,
"loss": 0.2005119025707245,
"memory(GiB)": 79.48,
"step": 116,
"train_speed(iter/s)": 0.00269
},
{
"clip_ratio/high_max": 0.0005434782360680401,
"clip_ratio/high_mean": 0.0005434782360680401,
"clip_ratio/low_mean": 0.004596828715875745,
"clip_ratio/low_min": 0.004596828715875745,
"clip_ratio/region_mean": 0.005140306951943785,
"completions/clipped_ratio": 0.0703125,
"completions/max_length": 40.0,
"completions/mean_length": 5.8671875,
"completions/min_length": 3.0,
"epoch": 1.417910447761194,
"grad_norm": 3.80570877135741,
"kl": 3.121465804113541,
"learning_rate": 4.433903375488697e-05,
"loss": 0.044249728322029114,
"memory(GiB)": 79.48,
"reward": 0.3046875,
"reward_std": 0.38101160526275635,
"rewards/Response_no_think_reward_1/mean": 0.3046875,
"rewards/Response_no_think_reward_1/std": 0.8562746047973633,
"step": 117,
"train_speed(iter/s)": 0.002684
},
{
"clip_ratio/high_max": 0.014024957199580967,
"clip_ratio/high_mean": 0.014024957199580967,
"clip_ratio/low_mean": 0.0131244600052014,
"clip_ratio/low_min": 0.0131244600052014,
"clip_ratio/region_mean": 0.02714941732119769,
"epoch": 1.4298507462686567,
"grad_norm": 3.857626589553114,
"kl": 2.146273965074215,
"learning_rate": 4.268789675247029e-05,
"loss": 0.03236865624785423,
"memory(GiB)": 79.48,
"step": 118,
"train_speed(iter/s)": 0.002695
},
{
"clip_ratio/high_max": 0.0012886597542092204,
"clip_ratio/high_mean": 0.0012886597542092204,
"clip_ratio/low_mean": 0.0051683366764336824,
"clip_ratio/low_min": 0.0051683366764336824,
"clip_ratio/region_mean": 0.006456996430642903,
"completions/clipped_ratio": 0.0703125,
"completions/max_length": 22.0,
"completions/mean_length": 5.6171875,
"completions/min_length": 3.0,
"epoch": 1.4417910447761195,
"grad_norm": 3.2126971808505513,
"kl": 1.1720350683217475,
"learning_rate": 4.105970708717244e-05,
"loss": 0.018675971776247025,
"memory(GiB)": 79.48,
"reward": 0.5625,
"reward_std": 0.22125522792339325,
"rewards/Response_no_think_reward_1/mean": 0.5625,
"rewards/Response_no_think_reward_1/std": 0.6490453481674194,
"step": 119,
"train_speed(iter/s)": 0.002674
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.020605165394954383,
"clip_ratio/low_min": 0.020605165394954383,
"clip_ratio/region_mean": 0.020605165394954383,
"epoch": 1.4537313432835821,
"grad_norm": 1.102830732170957,
"kl": 1.583265769013451,
"learning_rate": 3.945511667394719e-05,
"loss": 0.003417772939428687,
"memory(GiB)": 79.48,
"step": 120,
"train_speed(iter/s)": 0.002685
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.007155258092097938,
"clip_ratio/low_min": 0.007155258092097938,
"clip_ratio/region_mean": 0.007155258092097938,
"completions/clipped_ratio": 0.046875,
"completions/max_length": 23.0,
"completions/mean_length": 5.6640625,
"completions/min_length": 3.0,
"epoch": 1.4656716417910447,
"grad_norm": 2.9093250272424034,
"kl": 1.8708921101060696,
"learning_rate": 3.787476797878459e-05,
"loss": 0.01941162720322609,
"memory(GiB)": 79.48,
"reward": 0.59375,
"reward_std": 0.3198433816432953,
"rewards/Response_no_think_reward_1/mean": 0.59375,
"rewards/Response_no_think_reward_1/std": 0.692337155342102,
"step": 121,
"train_speed(iter/s)": 0.002659
},
{
"clip_ratio/high_max": 0.02566964237485081,
"clip_ratio/high_mean": 0.02566964237485081,
"clip_ratio/low_mean": 0.01106150820851326,
"clip_ratio/low_min": 0.01106150820851326,
"clip_ratio/region_mean": 0.03673115174751729,
"epoch": 1.4776119402985075,
"grad_norm": 1.6206572311785468,
"kl": 2.092067622463219,
"learning_rate": 3.631929376147207e-05,
"loss": 0.00795831624418497,
"memory(GiB)": 79.48,
"step": 122,
"train_speed(iter/s)": 0.00267
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 16.0,
"completions/mean_length": 5.140625,
"completions/min_length": 3.0,
"epoch": 1.48955223880597,
"grad_norm": 1.1898236332850007,
"kl": 0.5545606576924911,
"learning_rate": 3.47893168222425e-05,
"loss": 0.005211046896874905,
"memory(GiB)": 79.48,
"reward": 0.5078125,
"reward_std": 0.2012200653553009,
"rewards/Response_no_think_reward_1/mean": 0.5078125,
"rewards/Response_no_think_reward_1/std": 0.763292670249939,
"step": 123,
"train_speed(iter/s)": 0.002638
},
{
"clip_ratio/high_max": 0.015350877307355404,
"clip_ratio/high_mean": 0.015350877307355404,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.015350877307355404,
"epoch": 1.5014925373134327,
"grad_norm": 0.3409132689994619,
"kl": 0.5577427046882804,
"learning_rate": 3.328544975240932e-05,
"loss": -0.0002708420215640217,
"memory(GiB)": 79.48,
"step": 124,
"train_speed(iter/s)": 0.002649
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.00601851858664304,
"clip_ratio/low_min": 0.00601851858664304,
"clip_ratio/region_mean": 0.00601851858664304,
"completions/clipped_ratio": 0.0390625,
"completions/max_length": 30.0,
"completions/mean_length": 5.8671875,
"completions/min_length": 3.0,
"epoch": 1.5134328358208955,
"grad_norm": 5.906541393453947,
"kl": 6.567164011168643,
"learning_rate": 3.180829468908986e-05,
"loss": 0.07308901846408844,
"memory(GiB)": 79.48,
"reward": 0.3671875,
"reward_std": 0.1412346363067627,
"rewards/Response_no_think_reward_1/mean": 0.3671875,
"rewards/Response_no_think_reward_1/std": 0.8406137228012085,
"step": 125,
"train_speed(iter/s)": 0.002642
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.010185185354202986,
"clip_ratio/low_min": 0.010185185354202986,
"clip_ratio/region_mean": 0.010185185354202986,
"epoch": 1.5253731343283583,
"grad_norm": 1.637348051569756,
"kl": 3.2303040275146486,
"learning_rate": 3.035844307411384e-05,
"loss": 0.04529271274805069,
"memory(GiB)": 79.48,
"step": 126,
"train_speed(iter/s)": 0.002652
},
{
"clip_ratio/high_max": 0.00046296295477077365,
"clip_ratio/high_mean": 0.00046296295477077365,
"clip_ratio/low_mean": 0.004759002127684653,
"clip_ratio/low_min": 0.004759002127684653,
"clip_ratio/region_mean": 0.0052219650824554265,
"completions/clipped_ratio": 0.046875,
"completions/max_length": 29.0,
"completions/mean_length": 6.4453125,
"completions/min_length": 3.0,
"epoch": 1.537313432835821,
"grad_norm": 1.5814533572332585,
"kl": 1.9979073457579943,
"learning_rate": 2.8936475417214794e-05,
"loss": 0.022465700283646584,
"memory(GiB)": 79.48,
"reward": 0.3359375,
"reward_std": 0.17123225331306458,
"rewards/Response_no_think_reward_1/mean": 0.3359375,
"rewards/Response_no_think_reward_1/std": 0.7453514337539673,
"step": 127,
"train_speed(iter/s)": 0.00264
},
{
"clip_ratio/high_max": 0.0014710274408571422,
"clip_ratio/high_mean": 0.0014710274408571422,
"clip_ratio/low_mean": 0.022759197046980262,
"clip_ratio/low_min": 0.022759197046980262,
"clip_ratio/region_mean": 0.024230224487837404,
"epoch": 1.5492537313432835,
"grad_norm": 0.9057768060895434,
"kl": 1.9242111706989817,
"learning_rate": 2.7542961063598104e-05,
"loss": 0.013444737531244755,
"memory(GiB)": 79.48,
"step": 128,
"train_speed(iter/s)": 0.002651
},
{
"clip_ratio/high_max": 0.0026041667442768812,
"clip_ratio/high_mean": 0.0026041667442768812,
"clip_ratio/low_mean": 0.010856111068278551,
"clip_ratio/low_min": 0.010856111068278551,
"clip_ratio/region_mean": 0.013460277812555432,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 28.0,
"completions/mean_length": 5.6875,
"completions/min_length": 3.0,
"epoch": 1.5611940298507463,
"grad_norm": 2.279027191303148,
"kl": 1.264391661035006,
"learning_rate": 2.617845796597954e-05,
"loss": 0.005756520200520754,
"memory(GiB)": 79.48,
"reward": 0.3671875,
"reward_std": 0.15756267309188843,
"rewards/Response_no_think_reward_1/mean": 0.3671875,
"rewards/Response_no_think_reward_1/std": 0.7410472631454468,
"step": 129,
"train_speed(iter/s)": 0.002635
},
{
"clip_ratio/high_max": 0.0026041667442768812,
"clip_ratio/high_mean": 0.0026041667442768812,
"clip_ratio/low_mean": 0.06580501515418291,
"clip_ratio/low_min": 0.06580501515418291,
"clip_ratio/region_mean": 0.06840918306261301,
"epoch": 1.573134328358209,
"grad_norm": 1.198012219937442,
"kl": 1.689065290265944,
"learning_rate": 2.484351246118507e-05,
"loss": -0.000346488319337368,
"memory(GiB)": 79.48,
"step": 130,
"train_speed(iter/s)": 0.002646
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0059523810632526875,
"clip_ratio/low_min": 0.0059523810632526875,
"clip_ratio/region_mean": 0.0059523810632526875,
"completions/clipped_ratio": 0.0234375,
"completions/max_length": 25.0,
"completions/mean_length": 5.15625,
"completions/min_length": 3.0,
"epoch": 1.5850746268656717,
"grad_norm": 2.595184247375665,
"kl": 0.8083602132865053,
"learning_rate": 2.353865905140187e-05,
"loss": 0.009201270528137684,
"memory(GiB)": 79.48,
"reward": 0.4296875,
"reward_std": 0.13553348183631897,
"rewards/Response_no_think_reward_1/mean": 0.4296875,
"rewards/Response_no_think_reward_1/std": 0.7496308088302612,
"step": 131,
"train_speed(iter/s)": 0.002635
},
{
"clip_ratio/high_max": 0.0019841270986944437,
"clip_ratio/high_mean": 0.0019841270986944437,
"clip_ratio/low_mean": 0.01378506887704134,
"clip_ratio/low_min": 0.01378506887704134,
"clip_ratio/region_mean": 0.01576919574290514,
"epoch": 1.5970149253731343,
"grad_norm": 1.0694122716373746,
"kl": 0.8849439112927939,
"learning_rate": 2.226442019016739e-05,
"loss": 0.0032178200781345367,
"memory(GiB)": 79.48,
"step": 132,
"train_speed(iter/s)": 0.002646
},
{
"clip_ratio/high_max": 0.0014880952658131719,
"clip_ratio/high_mean": 0.0014880952658131719,
"clip_ratio/low_mean": 0.004777232185006142,
"clip_ratio/low_min": 0.004777232185006142,
"clip_ratio/region_mean": 0.0062653274508193135,
"completions/clipped_ratio": 0.0703125,
"completions/max_length": 51.0,
"completions/mean_length": 7.703125,
"completions/min_length": 3.0,
"epoch": 1.608955223880597,
"grad_norm": 8.857193213468985,
"kl": 6.557242290626164,
"learning_rate": 2.1021306073183167e-05,
"loss": 0.09046173840761185,
"memory(GiB)": 79.48,
"reward": 0.5625,
"reward_std": 0.3117782771587372,
"rewards/Response_no_think_reward_1/mean": 0.5625,
"rewards/Response_no_think_reward_1/std": 0.6728714108467102,
"step": 133,
"train_speed(iter/s)": 0.002636
},
{
"clip_ratio/high_max": 0.0043966451194137335,
"clip_ratio/high_mean": 0.0043966451194137335,
"clip_ratio/low_mean": 0.0072958533419296145,
"clip_ratio/low_min": 0.0072958533419296145,
"clip_ratio/region_mean": 0.01169249857775867,
"epoch": 1.6208955223880597,
"grad_norm": 5.293380513533871,
"kl": 4.1661525671806885,
"learning_rate": 1.9809814434036e-05,
"loss": 0.05591786280274391,
"memory(GiB)": 79.48,
"step": 134,
"train_speed(iter/s)": 0.002646
},
{
"clip_ratio/high_max": 0.0006793478387407959,
"clip_ratio/high_mean": 0.0006793478387407959,
"clip_ratio/low_mean": 0.008976120705483481,
"clip_ratio/low_min": 0.008976120705483481,
"clip_ratio/region_mean": 0.009655468544224277,
"completions/clipped_ratio": 0.0390625,
"completions/max_length": 29.0,
"completions/mean_length": 6.125,
"completions/min_length": 3.0,
"epoch": 1.6328358208955223,
"grad_norm": 2.599750460948482,
"kl": 2.9140283690503566,
"learning_rate": 1.863043034490938e-05,
"loss": 0.026728810742497444,
"memory(GiB)": 79.48,
"reward": 0.3828125,
"reward_std": 0.2688143849372864,
"rewards/Response_no_think_reward_1/mean": 0.3828125,
"rewards/Response_no_think_reward_1/std": 0.7542122602462769,
"step": 135,
"train_speed(iter/s)": 0.002641
},
{
"clip_ratio/high_max": 0.0006793478387407959,
"clip_ratio/high_mean": 0.0006793478387407959,
"clip_ratio/low_mean": 0.01892346324166283,
"clip_ratio/low_min": 0.01892346324166283,
"clip_ratio/region_mean": 0.019602811022195965,
"epoch": 1.644776119402985,
"grad_norm": 1.7776881222618184,
"kl": 2.936662324536883,
"learning_rate": 1.748362602236403e-05,
"loss": 0.021627021953463554,
"memory(GiB)": 79.48,
"step": 136,
"train_speed(iter/s)": 0.002651
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0003906250058207661,
"clip_ratio/low_min": 0.0003906250058207661,
"clip_ratio/region_mean": 0.0003906250058207661,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 24.0,
"completions/mean_length": 6.6953125,
"completions/min_length": 3.0,
"epoch": 1.6567164179104479,
"grad_norm": 2.8008543153134777,
"kl": 1.5049916390344151,
"learning_rate": 1.63698606382661e-05,
"loss": 0.022346211597323418,
"memory(GiB)": 79.48,
"reward": 0.3828125,
"reward_std": 0.15467959642410278,
"rewards/Response_no_think_reward_1/mean": 0.3828125,
"rewards/Response_no_think_reward_1/std": 0.7436988949775696,
"step": 137,
"train_speed(iter/s)": 0.002647
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.004379986581625417,
"clip_ratio/low_min": 0.004379986581625417,
"clip_ratio/region_mean": 0.004379986581625417,
"epoch": 1.6686567164179105,
"grad_norm": 1.5764765403480743,
"kl": 1.4290150789947802,
"learning_rate": 1.528958013593801e-05,
"loss": 0.0181417278945446,
"memory(GiB)": 79.48,
"step": 138,
"train_speed(iter/s)": 0.002657
},
{
"clip_ratio/high_max": 0.0009469697251915932,
"clip_ratio/high_mean": 0.0009469697251915932,
"clip_ratio/low_mean": 0.009301686193794012,
"clip_ratio/low_min": 0.009301686193794012,
"clip_ratio/region_mean": 0.010248655918985605,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 25.0,
"completions/mean_length": 5.15625,
"completions/min_length": 3.0,
"epoch": 1.680597014925373,
"grad_norm": 2.987112951446729,
"kl": 2.2646760795032606,
"learning_rate": 1.4243217051606283e-05,
"loss": 0.022022899240255356,
"memory(GiB)": 79.48,
"reward": 0.5625,
"reward_std": 0.3713865876197815,
"rewards/Response_no_think_reward_1/mean": 0.5625,
"rewards/Response_no_think_reward_1/std": 0.6958821415901184,
"step": 139,
"train_speed(iter/s)": 0.002652
},
{
"clip_ratio/high_max": 0.0010245901066809893,
"clip_ratio/high_mean": 0.0010245901066809893,
"clip_ratio/low_mean": 0.008475731243379414,
"clip_ratio/low_min": 0.008475731243379414,
"clip_ratio/region_mean": 0.009500321350060403,
"epoch": 1.6925373134328359,
"grad_norm": 2.122472644745234,
"kl": 2.2440224051242694,
"learning_rate": 1.3231190341217081e-05,
"loss": 0.017425674945116043,
"memory(GiB)": 79.48,
"step": 140,
"train_speed(iter/s)": 0.002662
}
],
"logging_steps": 1,
"max_steps": 166,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 5,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}