1.5B-v2 / trainer_state.json
Muennighoff's picture
Model save
1e5ef80 verified
Raw
History Blame Contribute Delete
179 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.05952971524952872,
"eval_steps": 500,
"global_step": 300,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"clip_ratio": 0.0,
"completion_length": 3451.34375,
"epoch": 0.00019843238416509574,
"grad_norm": 0.10741258412599564,
"learning_rate": 3.3333333333333334e-08,
"loss": 0.0105,
"num_tokens": 231454.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.34375,
"reward_std": 0.32195523381233215,
"rewards/accuracy_reward/mean": 0.359375,
"rewards/accuracy_reward/std": 0.48558124154806137,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 1
},
{
"clip_ratio": 0.0,
"completion_length": 4589.5625,
"epoch": 0.0003968647683301915,
"grad_norm": 0.10351114720106125,
"learning_rate": 6.666666666666667e-08,
"loss": 0.019,
"num_tokens": 534514.0,
"pctg_samples_exceeding_max_length": 7.8125,
"reward": 1.25,
"reward_std": 0.43757934123277664,
"rewards/accuracy_reward/mean": 0.328125,
"rewards/accuracy_reward/std": 0.479247085750103,
"rewards/format_simple_reward/mean": 0.921875,
"rewards/format_simple_reward/std": 0.17430340498685837,
"step": 2
},
{
"clip_ratio": 0.0,
"completion_length": 3421.875,
"epoch": 0.0005952971524952872,
"grad_norm": 0.06943769007921219,
"learning_rate": 1e-07,
"loss": 0.0273,
"num_tokens": 761922.0,
"pctg_samples_exceeding_max_length": 6.25,
"reward": 1.4375,
"reward_std": 0.23319074138998985,
"rewards/accuracy_reward/mean": 0.484375,
"rewards/accuracy_reward/std": 0.31026528775691986,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.14789126068353653,
"step": 3
},
{
"clip_ratio": 0.0,
"completion_length": 2767.453125,
"epoch": 0.000793729536660383,
"grad_norm": 0.12473472207784653,
"learning_rate": 1.3333333333333334e-07,
"loss": 0.0214,
"num_tokens": 948831.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.421875,
"reward_std": 0.3237007409334183,
"rewards/accuracy_reward/mean": 0.46875,
"rewards/accuracy_reward/std": 0.3155868947505951,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.1875,
"step": 4
},
{
"clip_ratio": 0.0,
"completion_length": 3693.609375,
"epoch": 0.0009921619208254787,
"grad_norm": 0.12483560293912888,
"learning_rate": 1.6666666666666665e-07,
"loss": 0.0328,
"num_tokens": 1196414.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.40625,
"reward_std": 0.3701305128633976,
"rewards/accuracy_reward/mean": 0.46875,
"rewards/accuracy_reward/std": 0.44335582107305527,
"rewards/format_simple_reward/mean": 0.9375,
"rewards/format_simple_reward/std": 0.21039126068353653,
"step": 5
},
{
"clip_ratio": 0.0,
"completion_length": 3081.03125,
"epoch": 0.0011905943049905744,
"grad_norm": 0.058863718062639236,
"learning_rate": 2e-07,
"loss": 0.016,
"num_tokens": 1404008.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.0625,
"reward_std": 0.19727616384625435,
"rewards/accuracy_reward/mean": 0.09375,
"rewards/accuracy_reward/std": 0.18217839300632477,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 6
},
{
"clip_ratio": 0.0,
"completion_length": 4436.265625,
"epoch": 0.0013890266891556703,
"grad_norm": 0.07167929410934448,
"learning_rate": 2.3333333333333333e-07,
"loss": -0.0069,
"num_tokens": 1698481.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.28125,
"reward_std": 0.3787454143166542,
"rewards/accuracy_reward/mean": 0.28125,
"rewards/accuracy_reward/std": 0.45247192680835724,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 7
},
{
"clip_ratio": 0.0,
"completion_length": 7289.78125,
"epoch": 0.001587459073320766,
"grad_norm": 0.05549306422472,
"learning_rate": 2.6666666666666667e-07,
"loss": 0.0574,
"num_tokens": 2176219.0,
"pctg_samples_exceeding_max_length": 15.625,
"reward": 0.921875,
"reward_std": 0.3603676147758961,
"rewards/accuracy_reward/mean": 0.078125,
"rewards/accuracy_reward/std": 0.17430340498685837,
"rewards/format_simple_reward/mean": 0.84375,
"rewards/format_simple_reward/std": 0.2882782220840454,
"step": 8
},
{
"clip_ratio": 0.0,
"completion_length": 3067.125,
"epoch": 0.0017858914574858616,
"grad_norm": 0.06410296261310577,
"learning_rate": 3e-07,
"loss": -0.0079,
"num_tokens": 2384043.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.296875,
"reward_std": 0.29826052859425545,
"rewards/accuracy_reward/mean": 0.296875,
"rewards/accuracy_reward/std": 0.46034691482782364,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 9
},
{
"clip_ratio": 0.0,
"completion_length": 4575.4375,
"epoch": 0.0019843238416509573,
"grad_norm": 0.08444339036941528,
"learning_rate": 3.333333333333333e-07,
"loss": 0.034,
"num_tokens": 2687175.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.34375,
"reward_std": 0.3952340893447399,
"rewards/accuracy_reward/mean": 0.40625,
"rewards/accuracy_reward/std": 0.4446863383054733,
"rewards/format_simple_reward/mean": 0.9375,
"rewards/format_simple_reward/std": 0.17078252136707306,
"step": 10
},
{
"clip_ratio": 0.0,
"completion_length": 1705.21875,
"epoch": 0.002182756225816053,
"grad_norm": 0.10505755245685577,
"learning_rate": 3.666666666666666e-07,
"loss": -0.0066,
"num_tokens": 2805109.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.515625,
"reward_std": 0.2777610495686531,
"rewards/accuracy_reward/mean": 0.53125,
"rewards/accuracy_reward/std": 0.40507759898900986,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 11
},
{
"clip_ratio": 0.0,
"completion_length": 4007.359375,
"epoch": 0.0023811886099811487,
"grad_norm": 0.02521890215575695,
"learning_rate": 4e-07,
"loss": 0.0137,
"num_tokens": 3071156.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.125,
"reward_std": 0.12430291995406151,
"rewards/accuracy_reward/mean": 0.15625,
"rewards/accuracy_reward/std": 0.25409944355487823,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 12
},
{
"clip_ratio": 0.0,
"completion_length": 6641.5,
"epoch": 0.002579620994146245,
"grad_norm": 0.10864025354385376,
"learning_rate": 4.3333333333333335e-07,
"loss": 0.0862,
"num_tokens": 3506052.0,
"pctg_samples_exceeding_max_length": 9.375,
"reward": 1.0625,
"reward_std": 0.4338294565677643,
"rewards/accuracy_reward/mean": 0.15625,
"rewards/accuracy_reward/std": 0.3529609143733978,
"rewards/format_simple_reward/mean": 0.90625,
"rewards/format_simple_reward/std": 0.18217839300632477,
"step": 13
},
{
"clip_ratio": 0.0,
"completion_length": 3274.546875,
"epoch": 0.0027780533783113405,
"grad_norm": 0.08583381026983261,
"learning_rate": 4.6666666666666666e-07,
"loss": 0.0135,
"num_tokens": 3724647.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.40625,
"reward_std": 0.37981898337602615,
"rewards/accuracy_reward/mean": 0.421875,
"rewards/accuracy_reward/std": 0.46757759898900986,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 14
},
{
"clip_ratio": 0.0,
"completion_length": 5086.3125,
"epoch": 0.0029764857624764362,
"grad_norm": 0.12476015090942383,
"learning_rate": 5e-07,
"loss": 0.031,
"num_tokens": 4060515.0,
"pctg_samples_exceeding_max_length": 9.375,
"reward": 1.28125,
"reward_std": 0.5432422310113907,
"rewards/accuracy_reward/mean": 0.375,
"rewards/accuracy_reward/std": 0.43217839300632477,
"rewards/format_simple_reward/mean": 0.90625,
"rewards/format_simple_reward/std": 0.23680340498685837,
"step": 15
},
{
"clip_ratio": 0.0,
"completion_length": 2486.546875,
"epoch": 0.003174918146641532,
"grad_norm": 0.10916439443826675,
"learning_rate": 5.333333333333333e-07,
"loss": 0.0081,
"num_tokens": 4230646.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.453125,
"reward_std": 0.31512534245848656,
"rewards/accuracy_reward/mean": 0.46875,
"rewards/accuracy_reward/std": 0.5061737895011902,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 16
},
{
"clip_ratio": 0.0,
"completion_length": 2730.03125,
"epoch": 0.0033733505308066276,
"grad_norm": 0.1063484251499176,
"learning_rate": 5.666666666666666e-07,
"loss": -0.0023,
"num_tokens": 4416216.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.328125,
"reward_std": 0.38664887472987175,
"rewards/accuracy_reward/mean": 0.359375,
"rewards/accuracy_reward/std": 0.46875541657209396,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 17
},
{
"clip_ratio": 0.0,
"completion_length": 4553.203125,
"epoch": 0.0035717829149717233,
"grad_norm": 0.045916423201560974,
"learning_rate": 6e-07,
"loss": 0.0621,
"num_tokens": 4717245.0,
"pctg_samples_exceeding_max_length": 9.375,
"reward": 1.296875,
"reward_std": 0.3420642241835594,
"rewards/accuracy_reward/mean": 0.390625,
"rewards/accuracy_reward/std": 0.31116948276758194,
"rewards/format_simple_reward/mean": 0.90625,
"rewards/format_simple_reward/std": 0.2561737820506096,
"step": 18
},
{
"clip_ratio": 0.0,
"completion_length": 2874.71875,
"epoch": 0.003770215299136819,
"grad_norm": 0.0827207863330841,
"learning_rate": 6.333333333333332e-07,
"loss": -0.0131,
"num_tokens": 4910803.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.484375,
"reward_std": 0.3445763736963272,
"rewards/accuracy_reward/mean": 0.484375,
"rewards/accuracy_reward/std": 0.44938503205776215,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 19
},
{
"clip_ratio": 0.0,
"completion_length": 3586.328125,
"epoch": 0.003968647683301915,
"grad_norm": 0.07332327216863632,
"learning_rate": 6.666666666666666e-07,
"loss": 0.0042,
"num_tokens": 5150656.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.109375,
"reward_std": 0.26196981221437454,
"rewards/accuracy_reward/mean": 0.125,
"rewards/accuracy_reward/std": 0.2750816270709038,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 20
},
{
"clip_ratio": 0.0,
"completion_length": 3977.953125,
"epoch": 0.00416708006746701,
"grad_norm": 0.08858250826597214,
"learning_rate": 7e-07,
"loss": -0.0041,
"num_tokens": 5417829.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.171875,
"reward_std": 0.31983356550335884,
"rewards/accuracy_reward/mean": 0.203125,
"rewards/accuracy_reward/std": 0.36967839300632477,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 21
},
{
"clip_ratio": 0.0,
"completion_length": 5309.203125,
"epoch": 0.004365512451632106,
"grad_norm": 0.0917082130908966,
"learning_rate": 7.333333333333332e-07,
"loss": 0.0381,
"num_tokens": 5767738.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.390625,
"reward_std": 0.4240131489932537,
"rewards/accuracy_reward/mean": 0.421875,
"rewards/accuracy_reward/std": 0.49606408923864365,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 22
},
{
"clip_ratio": 0.0,
"completion_length": 3746.625,
"epoch": 0.004563944835797202,
"grad_norm": 0.10065211355686188,
"learning_rate": 7.666666666666667e-07,
"loss": 0.0234,
"num_tokens": 6017410.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.28125,
"reward_std": 0.43768274039030075,
"rewards/accuracy_reward/mean": 0.34375,
"rewards/accuracy_reward/std": 0.3265564441680908,
"rewards/format_simple_reward/mean": 0.9375,
"rewards/format_simple_reward/std": 0.21039126068353653,
"step": 23
},
{
"clip_ratio": 0.0,
"completion_length": 3405.265625,
"epoch": 0.0047623772199622974,
"grad_norm": 0.07523792237043381,
"learning_rate": 8e-07,
"loss": 0.0322,
"num_tokens": 6244747.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.40625,
"reward_std": 0.275639396160841,
"rewards/accuracy_reward/mean": 0.421875,
"rewards/accuracy_reward/std": 0.3821863383054733,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 24
},
{
"clip_ratio": 0.0,
"completion_length": 3531.015625,
"epoch": 0.004960809604127394,
"grad_norm": 0.2034572958946228,
"learning_rate": 8.333333333333333e-07,
"loss": 0.0436,
"num_tokens": 6478996.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.4375,
"reward_std": 0.44340935349464417,
"rewards/accuracy_reward/mean": 0.515625,
"rewards/accuracy_reward/std": 0.49654312431812286,
"rewards/format_simple_reward/mean": 0.921875,
"rewards/format_simple_reward/std": 0.23328252136707306,
"step": 25
},
{
"clip_ratio": 0.0,
"completion_length": 4093.296875,
"epoch": 0.00515924198829249,
"grad_norm": 0.16380180418491364,
"learning_rate": 8.666666666666667e-07,
"loss": 0.0699,
"num_tokens": 6749471.0,
"pctg_samples_exceeding_max_length": 10.9375,
"reward": 1.34375,
"reward_std": 0.440941259264946,
"rewards/accuracy_reward/mean": 0.453125,
"rewards/accuracy_reward/std": 0.373777836561203,
"rewards/format_simple_reward/mean": 0.890625,
"rewards/format_simple_reward/std": 0.1875,
"step": 26
},
{
"clip_ratio": 0.0,
"completion_length": 3893.28125,
"epoch": 0.005357674372457585,
"grad_norm": 0.0847872719168663,
"learning_rate": 9e-07,
"loss": 0.0142,
"num_tokens": 7011681.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.34375,
"reward_std": 0.26423705741763115,
"rewards/accuracy_reward/mean": 0.375,
"rewards/accuracy_reward/std": 0.404181070625782,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 27
},
{
"clip_ratio": 0.0,
"completion_length": 2521.1875,
"epoch": 0.005556106756622681,
"grad_norm": 0.05729861557483673,
"learning_rate": 9.333333333333333e-07,
"loss": 0.0061,
"num_tokens": 7181229.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.265625,
"reward_std": 0.13258251920342445,
"rewards/accuracy_reward/mean": 0.265625,
"rewards/accuracy_reward/std": 0.3186737895011902,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 28
},
{
"clip_ratio": 0.0,
"completion_length": 4198.171875,
"epoch": 0.005754539140787777,
"grad_norm": 0.0762159675359726,
"learning_rate": 9.666666666666666e-07,
"loss": 0.0069,
"num_tokens": 7461104.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.34375,
"reward_std": 0.2651650384068489,
"rewards/accuracy_reward/mean": 0.375,
"rewards/accuracy_reward/std": 0.3872983306646347,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 29
},
{
"clip_ratio": 0.0,
"completion_length": 3921.140625,
"epoch": 0.0059529715249528724,
"grad_norm": 0.07685907185077667,
"learning_rate": 1e-06,
"loss": 0.025,
"num_tokens": 7723921.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.40625,
"reward_std": 0.3424547053873539,
"rewards/accuracy_reward/mean": 0.4375,
"rewards/accuracy_reward/std": 0.3454566150903702,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 30
},
{
"clip_ratio": 0.0,
"completion_length": 2438.921875,
"epoch": 0.006151403909117968,
"grad_norm": 0.10685097426176071,
"learning_rate": 9.99966154001881e-07,
"loss": 0.0282,
"num_tokens": 7892412.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.453125,
"reward_std": 0.40890367329120636,
"rewards/accuracy_reward/mean": 0.46875,
"rewards/accuracy_reward/std": 0.43925637751817703,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 31
},
{
"clip_ratio": 0.0,
"completion_length": 3708.703125,
"epoch": 0.006349836293283064,
"grad_norm": 0.12602362036705017,
"learning_rate": 9.998646205897307e-07,
"loss": -0.0101,
"num_tokens": 8138737.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.40625,
"reward_std": 0.3335031569004059,
"rewards/accuracy_reward/mean": 0.40625,
"rewards/accuracy_reward/std": 0.4581565484404564,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 32
},
{
"clip_ratio": 0.0,
"completion_length": 4339.0625,
"epoch": 0.0065482686774481595,
"grad_norm": 0.09338734298944473,
"learning_rate": 9.996954135095478e-07,
"loss": 0.0282,
"num_tokens": 8426357.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.421875,
"reward_std": 0.41731905192136765,
"rewards/accuracy_reward/mean": 0.484375,
"rewards/accuracy_reward/std": 0.48558124154806137,
"rewards/format_simple_reward/mean": 0.9375,
"rewards/format_simple_reward/std": 0.17078252136707306,
"step": 33
},
{
"clip_ratio": 0.0,
"completion_length": 5149.421875,
"epoch": 0.006746701061613255,
"grad_norm": 0.08221758902072906,
"learning_rate": 9.994585556692624e-07,
"loss": 0.0035,
"num_tokens": 8764784.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.171875,
"reward_std": 0.38118836283683777,
"rewards/accuracy_reward/mean": 0.21875,
"rewards/accuracy_reward/std": 0.39964763820171356,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.1875,
"step": 34
},
{
"clip_ratio": 0.0,
"completion_length": 4462.625,
"epoch": 0.006945133445778351,
"grad_norm": 0.08945805579423904,
"learning_rate": 9.991540791356342e-07,
"loss": 0.0143,
"num_tokens": 9061352.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.484375,
"reward_std": 0.38664887100458145,
"rewards/accuracy_reward/mean": 0.5,
"rewards/accuracy_reward/std": 0.4176512807607651,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 35
},
{
"clip_ratio": 0.0,
"completion_length": 3259.359375,
"epoch": 0.007143565829943447,
"grad_norm": 0.11584203690290451,
"learning_rate": 9.98782025129912e-07,
"loss": 0.0054,
"num_tokens": 9278895.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.3125,
"reward_std": 0.29613886773586273,
"rewards/accuracy_reward/mean": 0.3125,
"rewards/accuracy_reward/std": 0.4761601909995079,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 36
},
{
"clip_ratio": 0.0,
"completion_length": 1354.421875,
"epoch": 0.007341998214108542,
"grad_norm": 0.12929083406925201,
"learning_rate": 9.983424440222529e-07,
"loss": -0.0112,
"num_tokens": 9375386.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.265625,
"reward_std": 0.22673699632287025,
"rewards/accuracy_reward/mean": 0.359375,
"rewards/accuracy_reward/std": 0.27699070423841476,
"rewards/format_simple_reward/mean": 0.90625,
"rewards/format_simple_reward/std": 0.125,
"step": 37
},
{
"clip_ratio": 0.0,
"completion_length": 2904.71875,
"epoch": 0.007540430598273638,
"grad_norm": 0.13846805691719055,
"learning_rate": 9.978353953249021e-07,
"loss": 0.0149,
"num_tokens": 9573520.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.65625,
"reward_std": 0.3335031494498253,
"rewards/accuracy_reward/mean": 0.65625,
"rewards/accuracy_reward/std": 0.46449070423841476,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 38
},
{
"clip_ratio": 0.0,
"completion_length": 4555.0625,
"epoch": 0.007738862982438734,
"grad_norm": 0.09221411496400833,
"learning_rate": 9.972609476841365e-07,
"loss": 0.014,
"num_tokens": 9874540.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.25,
"reward_std": 0.4308430477976799,
"rewards/accuracy_reward/mean": 0.296875,
"rewards/accuracy_reward/std": 0.39789126068353653,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.10077822208404541,
"step": 39
},
{
"clip_ratio": 0.0,
"completion_length": 4357.921875,
"epoch": 0.00793729536660383,
"grad_norm": 0.18189272284507751,
"learning_rate": 9.966191788709714e-07,
"loss": -0.0103,
"num_tokens": 10162919.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.46875,
"reward_std": 0.5034401342272758,
"rewards/accuracy_reward/mean": 0.5,
"rewards/accuracy_reward/std": 0.46039126068353653,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 40
},
{
"clip_ratio": 0.0,
"completion_length": 4486.421875,
"epoch": 0.008135727750768925,
"grad_norm": 0.1539384424686432,
"learning_rate": 9.959101757706308e-07,
"loss": 0.0092,
"num_tokens": 10460378.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.234375,
"reward_std": 0.37769732996821404,
"rewards/accuracy_reward/mean": 0.25,
"rewards/accuracy_reward/std": 0.404181070625782,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 41
},
{
"clip_ratio": 0.0,
"completion_length": 4807.5,
"epoch": 0.00833416013493402,
"grad_norm": 0.07849445939064026,
"learning_rate": 9.95134034370785e-07,
"loss": 0.0045,
"num_tokens": 10777634.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.296875,
"reward_std": 0.25726158544421196,
"rewards/accuracy_reward/mean": 0.34375,
"rewards/accuracy_reward/std": 0.1971946656703949,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.1875,
"step": 42
},
{
"clip_ratio": 0.0,
"completion_length": 3212.59375,
"epoch": 0.008532592519099116,
"grad_norm": 0.08311497420072556,
"learning_rate": 9.942908597485558e-07,
"loss": 0.0127,
"num_tokens": 10992848.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.265625,
"reward_std": 0.3140517696738243,
"rewards/accuracy_reward/mean": 0.265625,
"rewards/accuracy_reward/std": 0.4106728211045265,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 43
},
{
"clip_ratio": 0.0,
"completion_length": 3765.6875,
"epoch": 0.008731024903264212,
"grad_norm": 0.08125404268503189,
"learning_rate": 9.933807660562896e-07,
"loss": 0.0154,
"num_tokens": 11242388.0,
"pctg_samples_exceeding_max_length": 6.25,
"reward": 1.359375,
"reward_std": 0.29826052486896515,
"rewards/accuracy_reward/mean": 0.421875,
"rewards/accuracy_reward/std": 0.2913651168346405,
"rewards/format_simple_reward/mean": 0.9375,
"rewards/format_simple_reward/std": 0.11180340498685837,
"step": 44
},
{
"clip_ratio": 0.0,
"completion_length": 3152.578125,
"epoch": 0.008929457287429308,
"grad_norm": 0.08672679960727692,
"learning_rate": 9.92403876506104e-07,
"loss": 0.0956,
"num_tokens": 11454273.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.578125,
"reward_std": 0.4165821261703968,
"rewards/accuracy_reward/mean": 0.625,
"rewards/accuracy_reward/std": 0.4132782220840454,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.14789126068353653,
"step": 45
},
{
"clip_ratio": 0.0,
"completion_length": 3422.296875,
"epoch": 0.009127889671594403,
"grad_norm": 0.09867958724498749,
"learning_rate": 9.913603233532067e-07,
"loss": 0.0211,
"num_tokens": 11684148.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.453125,
"reward_std": 0.2867126055061817,
"rewards/accuracy_reward/mean": 0.5,
"rewards/accuracy_reward/std": 0.29398179799318314,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.10077822208404541,
"step": 46
},
{
"clip_ratio": 0.0,
"completion_length": 5698.90625,
"epoch": 0.0093263220557595,
"grad_norm": 0.06482663750648499,
"learning_rate": 9.902502478779896e-07,
"loss": 0.0345,
"num_tokens": 12057958.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.375,
"reward_std": 0.430843036621809,
"rewards/accuracy_reward/mean": 0.421875,
"rewards/accuracy_reward/std": 0.3846946656703949,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.1875,
"step": 47
},
{
"clip_ratio": 0.0,
"completion_length": 4550.0625,
"epoch": 0.009524754439924595,
"grad_norm": 0.08825387060642242,
"learning_rate": 9.890738003669027e-07,
"loss": 0.0452,
"num_tokens": 12359362.0,
"pctg_samples_exceeding_max_length": 6.25,
"reward": 1.3125,
"reward_std": 0.44010020792484283,
"rewards/accuracy_reward/mean": 0.375,
"rewards/accuracy_reward/std": 0.4665650501847267,
"rewards/format_simple_reward/mean": 0.9375,
"rewards/format_simple_reward/std": 0.21039126068353653,
"step": 48
},
{
"clip_ratio": 0.0,
"completion_length": 4270.3125,
"epoch": 0.009723186824089692,
"grad_norm": 0.1147569790482521,
"learning_rate": 9.878311400921072e-07,
"loss": 0.0135,
"num_tokens": 12645526.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.265625,
"reward_std": 0.3804909363389015,
"rewards/accuracy_reward/mean": 0.296875,
"rewards/accuracy_reward/std": 0.4154609143733978,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 49
},
{
"clip_ratio": 0.0,
"completion_length": 4432.75,
"epoch": 0.009921619208254788,
"grad_norm": 0.07737451791763306,
"learning_rate": 9.865224352899118e-07,
"loss": 0.0381,
"num_tokens": 12939118.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.28125,
"reward_std": 0.43872103840112686,
"rewards/accuracy_reward/mean": 0.3125,
"rewards/accuracy_reward/std": 0.41898179799318314,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 50
},
{
"clip_ratio": 0.0,
"completion_length": 3153.84375,
"epoch": 0.010120051592419884,
"grad_norm": 0.07889407873153687,
"learning_rate": 9.851478631379982e-07,
"loss": 0.0495,
"num_tokens": 13149948.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.203125,
"reward_std": 0.260896235704422,
"rewards/accuracy_reward/mean": 0.21875,
"rewards/accuracy_reward/std": 0.3511601909995079,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 51
},
{
"clip_ratio": 0.0,
"completion_length": 4003.6875,
"epoch": 0.01031848397658498,
"grad_norm": 0.04930640757083893,
"learning_rate": 9.837076097314318e-07,
"loss": 0.0362,
"num_tokens": 13416048.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.359375,
"reward_std": 0.2777610644698143,
"rewards/accuracy_reward/mean": 0.40625,
"rewards/accuracy_reward/std": 0.436277836561203,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.1875,
"step": 52
},
{
"clip_ratio": 0.0,
"completion_length": 3485.859375,
"epoch": 0.010516916360750075,
"grad_norm": 0.14763857424259186,
"learning_rate": 9.822018700574694e-07,
"loss": -0.0146,
"num_tokens": 13655087.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.359375,
"reward_std": 0.4554910659790039,
"rewards/accuracy_reward/mean": 0.4375,
"rewards/accuracy_reward/std": 0.4745560586452484,
"rewards/format_simple_reward/mean": 0.921875,
"rewards/format_simple_reward/std": 0.17430340498685837,
"step": 53
},
{
"clip_ratio": 0.0,
"completion_length": 5981.53125,
"epoch": 0.01071534874491517,
"grad_norm": 0.07028347998857498,
"learning_rate": 9.806308479691594e-07,
"loss": 0.0773,
"num_tokens": 14048081.0,
"pctg_samples_exceeding_max_length": 9.375,
"reward": 1.21875,
"reward_std": 0.3787454217672348,
"rewards/accuracy_reward/mean": 0.3125,
"rewards/accuracy_reward/std": 0.3221946656703949,
"rewards/format_simple_reward/mean": 0.90625,
"rewards/format_simple_reward/std": 0.125,
"step": 54
},
{
"clip_ratio": 0.0,
"completion_length": 3949.0,
"epoch": 0.010913781129080266,
"grad_norm": 0.07105118781328201,
"learning_rate": 9.789947561577443e-07,
"loss": 0.0341,
"num_tokens": 14309537.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.34375,
"reward_std": 0.3149165138602257,
"rewards/accuracy_reward/mean": 0.390625,
"rewards/accuracy_reward/std": 0.27289126068353653,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.14789126068353653,
"step": 55
},
{
"clip_ratio": 0.0,
"completion_length": 4392.671875,
"epoch": 0.011112213513245362,
"grad_norm": 0.07586216926574707,
"learning_rate": 9.77293816123866e-07,
"loss": -0.0023,
"num_tokens": 14600580.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.46875,
"reward_std": 0.3808925598859787,
"rewards/accuracy_reward/mean": 0.484375,
"rewards/accuracy_reward/std": 0.4443683698773384,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 56
},
{
"clip_ratio": 0.0,
"completion_length": 2489.203125,
"epoch": 0.011310645897410458,
"grad_norm": 0.08419086784124374,
"learning_rate": 9.755282581475767e-07,
"loss": 0.0306,
"num_tokens": 14770649.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.484375,
"reward_std": 0.26621313765645027,
"rewards/accuracy_reward/mean": 0.484375,
"rewards/accuracy_reward/std": 0.41520625352859497,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 57
},
{
"clip_ratio": 0.0,
"completion_length": 3504.140625,
"epoch": 0.011509078281575554,
"grad_norm": 0.12374584376811981,
"learning_rate": 9.736983212571645e-07,
"loss": 0.0127,
"num_tokens": 15003402.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.40625,
"reward_std": 0.39347875863313675,
"rewards/accuracy_reward/mean": 0.421875,
"rewards/accuracy_reward/std": 0.4819520115852356,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 58
},
{
"clip_ratio": 0.0,
"completion_length": 4263.359375,
"epoch": 0.01170751066574065,
"grad_norm": 0.13865676522254944,
"learning_rate": 9.718042531967916e-07,
"loss": -0.0002,
"num_tokens": 15286993.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.359375,
"reward_std": 0.3844336085021496,
"rewards/accuracy_reward/mean": 0.375,
"rewards/accuracy_reward/std": 0.4405868947505951,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 59
},
{
"clip_ratio": 0.0,
"completion_length": 4828.078125,
"epoch": 0.011905943049905745,
"grad_norm": 0.08236661553382874,
"learning_rate": 9.698463103929541e-07,
"loss": 0.0366,
"num_tokens": 15608302.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.421875,
"reward_std": 0.28778617456555367,
"rewards/accuracy_reward/mean": 0.453125,
"rewards/accuracy_reward/std": 0.42046456038951874,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 60
},
{
"clip_ratio": 0.0,
"completion_length": 4732.03125,
"epoch": 0.01210437543407084,
"grad_norm": 0.04934617504477501,
"learning_rate": 9.678247579197658e-07,
"loss": 0.0333,
"num_tokens": 15921440.0,
"pctg_samples_exceeding_max_length": 6.25,
"reward": 1.359375,
"reward_std": 0.260896235704422,
"rewards/accuracy_reward/mean": 0.421875,
"rewards/accuracy_reward/std": 0.24467839300632477,
"rewards/format_simple_reward/mean": 0.9375,
"rewards/format_simple_reward/std": 0.1632782220840454,
"step": 61
},
{
"clip_ratio": 0.0,
"completion_length": 5229.09375,
"epoch": 0.012302807818235936,
"grad_norm": 0.076475128531456,
"learning_rate": 9.657398694630712e-07,
"loss": 0.0131,
"num_tokens": 16267150.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.5,
"reward_std": 0.32195522636175156,
"rewards/accuracy_reward/mean": 0.515625,
"rewards/accuracy_reward/std": 0.35169370472431183,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 62
},
{
"clip_ratio": 0.0,
"completion_length": 5002.796875,
"epoch": 0.012501240202401032,
"grad_norm": 0.06847423315048218,
"learning_rate": 9.635919272833937e-07,
"loss": 0.0545,
"num_tokens": 16596625.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.296875,
"reward_std": 0.26735979318618774,
"rewards/accuracy_reward/mean": 0.3125,
"rewards/accuracy_reward/std": 0.3331565484404564,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 63
},
{
"clip_ratio": 0.0,
"completion_length": 1869.09375,
"epoch": 0.012699672586566128,
"grad_norm": 0.10144737362861633,
"learning_rate": 9.613812221777212e-07,
"loss": 0.0065,
"num_tokens": 16724287.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.5625,
"reward_std": 0.23356688395142555,
"rewards/accuracy_reward/mean": 0.5625,
"rewards/accuracy_reward/std": 0.4000816270709038,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 64
},
{
"clip_ratio": 0.0,
"completion_length": 2825.453125,
"epoch": 0.012898104970731223,
"grad_norm": 0.11428092420101166,
"learning_rate": 9.591080534401371e-07,
"loss": 0.0277,
"num_tokens": 16916620.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.234375,
"reward_std": 0.24464010074734688,
"rewards/accuracy_reward/mean": 0.265625,
"rewards/accuracy_reward/std": 0.3186737895011902,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 65
},
{
"clip_ratio": 0.0,
"completion_length": 4634.90625,
"epoch": 0.013096537354896319,
"grad_norm": 0.049307409673929214,
"learning_rate": 9.567727288213004e-07,
"loss": 0.0116,
"num_tokens": 17223294.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.4375,
"reward_std": 0.2798827216029167,
"rewards/accuracy_reward/mean": 0.46875,
"rewards/accuracy_reward/std": 0.404181070625782,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 66
},
{
"clip_ratio": 0.0,
"completion_length": 2707.40625,
"epoch": 0.013294969739061415,
"grad_norm": 0.08468174189329147,
"learning_rate": 9.543755644867822e-07,
"loss": 0.0571,
"num_tokens": 17404792.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.484375,
"reward_std": 0.25370001792907715,
"rewards/accuracy_reward/mean": 0.5,
"rewards/accuracy_reward/std": 0.42078252136707306,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 67
},
{
"clip_ratio": 0.0,
"completion_length": 3649.0,
"epoch": 0.01349340212322651,
"grad_norm": 0.08149217814207077,
"learning_rate": 9.519168849742602e-07,
"loss": 0.0219,
"num_tokens": 17647616.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.46875,
"reward_std": 0.28566451370716095,
"rewards/accuracy_reward/mean": 0.5,
"rewards/accuracy_reward/std": 0.3155868947505951,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 68
},
{
"clip_ratio": 0.0,
"completion_length": 4725.40625,
"epoch": 0.013691834507391606,
"grad_norm": 0.09810058027505875,
"learning_rate": 9.493970231495834e-07,
"loss": 0.0341,
"num_tokens": 17961130.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.46875,
"reward_std": 0.39958153665065765,
"rewards/accuracy_reward/mean": 0.484375,
"rewards/accuracy_reward/std": 0.4546433389186859,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 69
},
{
"clip_ratio": 0.0,
"completion_length": 2968.09375,
"epoch": 0.013890266891556702,
"grad_norm": 0.07842040807008743,
"learning_rate": 9.468163201617061e-07,
"loss": 0.0265,
"num_tokens": 18159376.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.46875,
"reward_std": 0.29613886773586273,
"rewards/accuracy_reward/mean": 0.46875,
"rewards/accuracy_reward/std": 0.5040994435548782,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 70
},
{
"clip_ratio": 0.0,
"completion_length": 2120.3125,
"epoch": 0.014088699275721797,
"grad_norm": 0.12895283102989197,
"learning_rate": 9.44175125396502e-07,
"loss": 0.0276,
"num_tokens": 18304428.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.59375,
"reward_std": 0.4366091713309288,
"rewards/accuracy_reward/mean": 0.59375,
"rewards/accuracy_reward/std": 0.48296456038951874,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 71
},
{
"clip_ratio": 0.0,
"completion_length": 3236.015625,
"epoch": 0.014287131659886893,
"grad_norm": 0.09552279114723206,
"learning_rate": 9.414737964294634e-07,
"loss": 0.0086,
"num_tokens": 18522661.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.515625,
"reward_std": 0.35141606628894806,
"rewards/accuracy_reward/mean": 0.515625,
"rewards/accuracy_reward/std": 0.45028156042099,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 72
},
{
"clip_ratio": 0.0,
"completion_length": 3363.6875,
"epoch": 0.014485564044051989,
"grad_norm": 0.09300954639911652,
"learning_rate": 9.387126989772909e-07,
"loss": 0.0168,
"num_tokens": 18749065.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.375,
"reward_std": 0.3061639852821827,
"rewards/accuracy_reward/mean": 0.40625,
"rewards/accuracy_reward/std": 0.4613594636321068,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 73
},
{
"clip_ratio": 0.0,
"completion_length": 3751.8125,
"epoch": 0.014683996428217085,
"grad_norm": 0.1175587847828865,
"learning_rate": 9.358922068483811e-07,
"loss": 0.0296,
"num_tokens": 19000605.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.3125,
"reward_std": 0.32195522636175156,
"rewards/accuracy_reward/mean": 0.375,
"rewards/accuracy_reward/std": 0.3852732330560684,
"rewards/format_simple_reward/mean": 0.9375,
"rewards/format_simple_reward/std": 0.1632782220840454,
"step": 74
},
{
"clip_ratio": 0.0,
"completion_length": 4235.515625,
"epoch": 0.01488242881238218,
"grad_norm": 0.03519141301512718,
"learning_rate": 9.330127018922193e-07,
"loss": 0.0243,
"num_tokens": 19281366.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.46875,
"reward_std": 0.23356688022613525,
"rewards/accuracy_reward/mean": 0.46875,
"rewards/accuracy_reward/std": 0.3454566150903702,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 75
},
{
"clip_ratio": 0.0,
"completion_length": 6444.15625,
"epoch": 0.015080861196547276,
"grad_norm": 0.06904491782188416,
"learning_rate": 9.300745739476828e-07,
"loss": 0.008,
"num_tokens": 19705600.0,
"pctg_samples_exceeding_max_length": 7.8125,
"reward": 1.4375,
"reward_std": 0.37489212304353714,
"rewards/accuracy_reward/mean": 0.5,
"rewards/accuracy_reward/std": 0.5018647313117981,
"rewards/format_simple_reward/mean": 0.9375,
"rewards/format_simple_reward/std": 0.21039126068353653,
"step": 76
},
{
"clip_ratio": 0.0,
"completion_length": 2778.140625,
"epoch": 0.015279293580712372,
"grad_norm": 0.1446460783481598,
"learning_rate": 9.270782207902627e-07,
"loss": 0.0092,
"num_tokens": 19892689.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.375,
"reward_std": 0.26409147679805756,
"rewards/accuracy_reward/mean": 0.390625,
"rewards/accuracy_reward/std": 0.40316852182149887,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 77
},
{
"clip_ratio": 0.0,
"completion_length": 3331.53125,
"epoch": 0.015477725964877467,
"grad_norm": 0.0948755070567131,
"learning_rate": 9.240240480782129e-07,
"loss": -0.004,
"num_tokens": 20118387.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.46875,
"reward_std": 0.3014557585120201,
"rewards/accuracy_reward/mean": 0.5,
"rewards/accuracy_reward/std": 0.45129410922527313,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 78
},
{
"clip_ratio": 0.0,
"completion_length": 2956.828125,
"epoch": 0.015676158349042565,
"grad_norm": 0.07108301669359207,
"learning_rate": 9.209124692976287e-07,
"loss": -0.0105,
"num_tokens": 20318072.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.46875,
"reward_std": 0.2130674086511135,
"rewards/accuracy_reward/mean": 0.46875,
"rewards/accuracy_reward/std": 0.4622559919953346,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 79
},
{
"clip_ratio": 0.0,
"completion_length": 4523.578125,
"epoch": 0.01587459073320766,
"grad_norm": 0.0626734271645546,
"learning_rate": 9.177439057064682e-07,
"loss": 0.0578,
"num_tokens": 20618141.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.390625,
"reward_std": 0.3657732605934143,
"rewards/accuracy_reward/mean": 0.4375,
"rewards/accuracy_reward/std": 0.4533684551715851,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.1875,
"step": 80
},
{
"clip_ratio": 0.0,
"completion_length": 3825.921875,
"epoch": 0.016073023117372756,
"grad_norm": 0.1172095537185669,
"learning_rate": 9.145187862775208e-07,
"loss": 0.0367,
"num_tokens": 20872088.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.578125,
"reward_std": 0.3661493994295597,
"rewards/accuracy_reward/mean": 0.59375,
"rewards/accuracy_reward/std": 0.49776528775691986,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 81
},
{
"clip_ratio": 0.0,
"completion_length": 2816.140625,
"epoch": 0.01627145550153785,
"grad_norm": 0.068403460085392,
"learning_rate": 9.112375476403311e-07,
"loss": 0.0206,
"num_tokens": 21061409.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.328125,
"reward_std": 0.2777610570192337,
"rewards/accuracy_reward/mean": 0.34375,
"rewards/accuracy_reward/std": 0.43835218250751495,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 82
},
{
"clip_ratio": 0.0,
"completion_length": 4278.34375,
"epoch": 0.016469887885702948,
"grad_norm": 0.06919507682323456,
"learning_rate": 9.079006340220861e-07,
"loss": 0.0426,
"num_tokens": 21344207.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.46875,
"reward_std": 0.34034284949302673,
"rewards/accuracy_reward/mean": 0.5,
"rewards/accuracy_reward/std": 0.4745560586452484,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 83
},
{
"clip_ratio": 0.0,
"completion_length": 5301.4375,
"epoch": 0.01666832026986804,
"grad_norm": 0.06976253539323807,
"learning_rate": 9.045084971874737e-07,
"loss": 0.0277,
"num_tokens": 21693619.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.296875,
"reward_std": 0.38664887100458145,
"rewards/accuracy_reward/mean": 0.328125,
"rewards/accuracy_reward/std": 0.46034691482782364,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 84
},
{
"clip_ratio": 0.0,
"completion_length": 5274.90625,
"epoch": 0.01686675265403314,
"grad_norm": 0.08595464378595352,
"learning_rate": 9.010615963775219e-07,
"loss": 0.0424,
"num_tokens": 22041565.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.328125,
"reward_std": 0.37837908416986465,
"rewards/accuracy_reward/mean": 0.359375,
"rewards/accuracy_reward/std": 0.4543810039758682,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 85
},
{
"clip_ratio": 0.0,
"completion_length": 3935.0625,
"epoch": 0.017065185038198233,
"grad_norm": 0.06769334524869919,
"learning_rate": 8.975603982474238e-07,
"loss": 0.0241,
"num_tokens": 22305281.0,
"pctg_samples_exceeding_max_length": 6.25,
"reward": 1.28125,
"reward_std": 0.3014557547867298,
"rewards/accuracy_reward/mean": 0.328125,
"rewards/accuracy_reward/std": 0.43526528775691986,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.10077822208404541,
"step": 86
},
{
"clip_ratio": 0.0,
"completion_length": 3429.46875,
"epoch": 0.01726361742236333,
"grad_norm": 0.06938223540782928,
"learning_rate": 8.940053768033608e-07,
"loss": 0.0031,
"num_tokens": 22535479.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.546875,
"reward_std": 0.17358146235346794,
"rewards/accuracy_reward/mean": 0.546875,
"rewards/accuracy_reward/std": 0.3296433389186859,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 87
},
{
"clip_ratio": 0.0,
"completion_length": 3549.609375,
"epoch": 0.017462049806528424,
"grad_norm": 0.06082611903548241,
"learning_rate": 8.903970133383296e-07,
"loss": 0.0317,
"num_tokens": 22771558.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.546875,
"reward_std": 0.3107786178588867,
"rewards/accuracy_reward/mean": 0.5625,
"rewards/accuracy_reward/std": 0.3454566150903702,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 88
},
{
"clip_ratio": 0.0,
"completion_length": 4481.359375,
"epoch": 0.01766048219069352,
"grad_norm": 0.1013013944029808,
"learning_rate": 8.86735796366982e-07,
"loss": 0.0248,
"num_tokens": 23067557.0,
"pctg_samples_exceeding_max_length": 6.25,
"reward": 1.484375,
"reward_std": 0.32122811675071716,
"rewards/accuracy_reward/mean": 0.546875,
"rewards/accuracy_reward/std": 0.48989029973745346,
"rewards/format_simple_reward/mean": 0.9375,
"rewards/format_simple_reward/std": 0.17078252136707306,
"step": 89
},
{
"clip_ratio": 0.0,
"completion_length": 3357.4375,
"epoch": 0.017858914574858616,
"grad_norm": 0.1043267622590065,
"learning_rate": 8.83022221559489e-07,
"loss": 0.0003,
"num_tokens": 23292193.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.5625,
"reward_std": 0.3503679744899273,
"rewards/accuracy_reward/mean": 0.5625,
"rewards/accuracy_reward/std": 0.4467606842517853,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 90
},
{
"clip_ratio": 0.0,
"completion_length": 3427.453125,
"epoch": 0.018057346959023713,
"grad_norm": 0.07747521251440048,
"learning_rate": 8.792567916744345e-07,
"loss": 0.0138,
"num_tokens": 23521598.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.5625,
"reward_std": 0.37190571427345276,
"rewards/accuracy_reward/mean": 0.5625,
"rewards/accuracy_reward/std": 0.4871220737695694,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 91
},
{
"clip_ratio": 0.0,
"completion_length": 4175.078125,
"epoch": 0.018255779343188807,
"grad_norm": 0.06418845802545547,
"learning_rate": 8.754400164907496e-07,
"loss": -0.0117,
"num_tokens": 23798451.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.296875,
"reward_std": 0.2109457515180111,
"rewards/accuracy_reward/mean": 0.3125,
"rewards/accuracy_reward/std": 0.44335582107305527,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 92
},
{
"clip_ratio": 0.0,
"completion_length": 2668.609375,
"epoch": 0.018454211727353904,
"grad_norm": 0.07135380804538727,
"learning_rate": 8.71572412738697e-07,
"loss": 0.0175,
"num_tokens": 23977986.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.578125,
"reward_std": 0.16887323930859566,
"rewards/accuracy_reward/mean": 0.59375,
"rewards/accuracy_reward/std": 0.38319888710975647,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 93
},
{
"clip_ratio": 0.0,
"completion_length": 4150.625,
"epoch": 0.018652644111519,
"grad_norm": 0.08534057438373566,
"learning_rate": 8.676545040299143e-07,
"loss": -0.024,
"num_tokens": 24253562.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.34375,
"reward_std": 0.3014557585120201,
"rewards/accuracy_reward/mean": 0.34375,
"rewards/accuracy_reward/std": 0.41104350984096527,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 94
},
{
"clip_ratio": 0.0,
"completion_length": 5642.453125,
"epoch": 0.018851076495684096,
"grad_norm": 0.06363444775342941,
"learning_rate": 8.636868207865243e-07,
"loss": 0.014,
"num_tokens": 24624887.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.34375,
"reward_std": 0.3014557622373104,
"rewards/accuracy_reward/mean": 0.359375,
"rewards/accuracy_reward/std": 0.40316852182149887,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 95
},
{
"clip_ratio": 0.0,
"completion_length": 3724.75,
"epoch": 0.01904950887984919,
"grad_norm": 0.08911765366792679,
"learning_rate": 8.596699001693255e-07,
"loss": 0.0113,
"num_tokens": 24872703.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.5625,
"reward_std": 0.3932797461748123,
"rewards/accuracy_reward/mean": 0.59375,
"rewards/accuracy_reward/std": 0.4471946656703949,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 96
},
{
"clip_ratio": 0.0,
"completion_length": 3782.875,
"epoch": 0.019247941264014287,
"grad_norm": 0.07504376024007797,
"learning_rate": 8.556042860050685e-07,
"loss": 0.0262,
"num_tokens": 25126503.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.515625,
"reward_std": 0.25726158544421196,
"rewards/accuracy_reward/mean": 0.515625,
"rewards/accuracy_reward/std": 0.3846946656703949,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 97
},
{
"clip_ratio": 0.0,
"completion_length": 2841.203125,
"epoch": 0.019446373648179385,
"grad_norm": 0.05419033020734787,
"learning_rate": 8.514905287128309e-07,
"loss": -0.0101,
"num_tokens": 25319092.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.546875,
"reward_std": 0.16887323558330536,
"rewards/accuracy_reward/mean": 0.546875,
"rewards/accuracy_reward/std": 0.46326854079961777,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 98
},
{
"clip_ratio": 0.0,
"completion_length": 4430.90625,
"epoch": 0.01964480603234448,
"grad_norm": 0.10946149379014969,
"learning_rate": 8.473291852294986e-07,
"loss": 0.0438,
"num_tokens": 25612414.0,
"pctg_samples_exceeding_max_length": 7.8125,
"reward": 1.3125,
"reward_std": 0.40378159284591675,
"rewards/accuracy_reward/mean": 0.40625,
"rewards/accuracy_reward/std": 0.4424592927098274,
"rewards/format_simple_reward/mean": 0.90625,
"rewards/format_simple_reward/std": 0.23680340498685837,
"step": 99
},
{
"clip_ratio": 0.0,
"completion_length": 4251.15625,
"epoch": 0.019843238416509576,
"grad_norm": 0.05118429660797119,
"learning_rate": 8.431208189343669e-07,
"loss": 0.0023,
"num_tokens": 25893296.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.4375,
"reward_std": 0.25739736109972,
"rewards/accuracy_reward/mean": 0.46875,
"rewards/accuracy_reward/std": 0.3454566150903702,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 100
},
{
"clip_ratio": 0.0,
"completion_length": 5162.984375,
"epoch": 0.02004167080067467,
"grad_norm": 0.09052116423845291,
"learning_rate": 8.388659995728662e-07,
"loss": 0.0537,
"num_tokens": 26235783.0,
"pctg_samples_exceeding_max_length": 10.9375,
"reward": 1.25,
"reward_std": 0.39347876235842705,
"rewards/accuracy_reward/mean": 0.359375,
"rewards/accuracy_reward/std": 0.48079314827919006,
"rewards/format_simple_reward/mean": 0.890625,
"rewards/format_simple_reward/std": 0.31116948276758194,
"step": 101
},
{
"clip_ratio": 0.0,
"completion_length": 4199.3125,
"epoch": 0.020240103184839767,
"grad_norm": 0.050350647419691086,
"learning_rate": 8.34565303179429e-07,
"loss": 0.0229,
"num_tokens": 26517675.0,
"pctg_samples_exceeding_max_length": 6.25,
"reward": 1.484375,
"reward_std": 0.246860321611166,
"rewards/accuracy_reward/mean": 0.546875,
"rewards/accuracy_reward/std": 0.373777836561203,
"rewards/format_simple_reward/mean": 0.9375,
"rewards/format_simple_reward/std": 0.11180340498685837,
"step": 102
},
{
"clip_ratio": 0.0,
"completion_length": 4029.796875,
"epoch": 0.02043853556900486,
"grad_norm": 0.09524723142385483,
"learning_rate": 8.302193119995038e-07,
"loss": 0.0001,
"num_tokens": 26786166.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.25,
"reward_std": 0.29143063724040985,
"rewards/accuracy_reward/mean": 0.265625,
"rewards/accuracy_reward/std": 0.42707233130931854,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 103
},
{
"clip_ratio": 0.0,
"completion_length": 3896.953125,
"epoch": 0.02063696795316996,
"grad_norm": 0.07392734289169312,
"learning_rate": 8.258286144107276e-07,
"loss": 0.0005,
"num_tokens": 27046955.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.5625,
"reward_std": 0.24251843616366386,
"rewards/accuracy_reward/mean": 0.5625,
"rewards/accuracy_reward/std": 0.38688503205776215,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 104
},
{
"clip_ratio": 0.0,
"completion_length": 4753.453125,
"epoch": 0.020835400337335053,
"grad_norm": 0.10958008468151093,
"learning_rate": 8.213938048432696e-07,
"loss": 0.0691,
"num_tokens": 27361728.0,
"pctg_samples_exceeding_max_length": 12.5,
"reward": 1.328125,
"reward_std": 0.44580356776714325,
"rewards/accuracy_reward/mean": 0.453125,
"rewards/accuracy_reward/std": 0.3384781554341316,
"rewards/format_simple_reward/mean": 0.875,
"rewards/format_simple_reward/std": 0.21039126068353653,
"step": 105
},
{
"clip_ratio": 0.0,
"completion_length": 4891.484375,
"epoch": 0.02103383272150015,
"grad_norm": 0.08916284143924713,
"learning_rate": 8.16915483699355e-07,
"loss": 0.0082,
"num_tokens": 27686119.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.484375,
"reward_std": 0.39203885197639465,
"rewards/accuracy_reward/mean": 0.515625,
"rewards/accuracy_reward/std": 0.45283494144678116,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 106
},
{
"clip_ratio": 0.0,
"completion_length": 2756.71875,
"epoch": 0.021232265105665244,
"grad_norm": 0.09871362894773483,
"learning_rate": 8.123942572719799e-07,
"loss": 0.0114,
"num_tokens": 27873693.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.375,
"reward_std": 0.30038218945264816,
"rewards/accuracy_reward/mean": 0.375,
"rewards/accuracy_reward/std": 0.45726002007722855,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 107
},
{
"clip_ratio": 0.0,
"completion_length": 3924.90625,
"epoch": 0.02143069748983034,
"grad_norm": 0.061856530606746674,
"learning_rate": 8.07830737662829e-07,
"loss": 0.0342,
"num_tokens": 28134751.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.484375,
"reward_std": 0.3098084479570389,
"rewards/accuracy_reward/mean": 0.515625,
"rewards/accuracy_reward/std": 0.34854350984096527,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 108
},
{
"clip_ratio": 0.0,
"completion_length": 3649.75,
"epoch": 0.021629129873995435,
"grad_norm": 0.08661241829395294,
"learning_rate": 8.032255426994068e-07,
"loss": -0.0009,
"num_tokens": 28377807.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.53125,
"reward_std": 0.2041158601641655,
"rewards/accuracy_reward/mean": 0.578125,
"rewards/accuracy_reward/std": 0.44569888710975647,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.14789126068353653,
"step": 109
},
{
"clip_ratio": 0.0,
"completion_length": 2978.03125,
"epoch": 0.021827562258160533,
"grad_norm": 0.09419474005699158,
"learning_rate": 7.985792958513931e-07,
"loss": -0.0005,
"num_tokens": 28578825.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.4375,
"reward_std": 0.35400262102484703,
"rewards/accuracy_reward/mean": 0.4375,
"rewards/accuracy_reward/std": 0.4871220737695694,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 110
},
{
"clip_ratio": 0.0,
"completion_length": 6059.203125,
"epoch": 0.022025994642325627,
"grad_norm": 0.04390991851687431,
"learning_rate": 7.938926261462365e-07,
"loss": 0.0106,
"num_tokens": 28977046.0,
"pctg_samples_exceeding_max_length": 9.375,
"reward": 1.421875,
"reward_std": 0.2777610532939434,
"rewards/accuracy_reward/mean": 0.5,
"rewards/accuracy_reward/std": 0.5018647313117981,
"rewards/format_simple_reward/mean": 0.921875,
"rewards/format_simple_reward/std": 0.11967839300632477,
"step": 111
},
{
"clip_ratio": 0.0,
"completion_length": 2986.59375,
"epoch": 0.022224427026490724,
"grad_norm": 0.1120903417468071,
"learning_rate": 7.891661680839932e-07,
"loss": 0.022,
"num_tokens": 29176716.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.53125,
"reward_std": 0.29105448722839355,
"rewards/accuracy_reward/mean": 0.578125,
"rewards/accuracy_reward/std": 0.3821863383054733,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.14789126068353653,
"step": 112
},
{
"clip_ratio": 0.0,
"completion_length": 3915.53125,
"epoch": 0.022422859410655818,
"grad_norm": 0.06265829503536224,
"learning_rate": 7.844005615514258e-07,
"loss": 0.0137,
"num_tokens": 29438366.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.5,
"reward_std": 0.25513992458581924,
"rewards/accuracy_reward/mean": 0.5,
"rewards/accuracy_reward/std": 0.2825859263539314,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 113
},
{
"clip_ratio": 0.0,
"completion_length": 3760.59375,
"epoch": 0.022621291794820916,
"grad_norm": 0.0809578076004982,
"learning_rate": 7.795964517353733e-07,
"loss": 0.0233,
"num_tokens": 29689108.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.546875,
"reward_std": 0.2777610570192337,
"rewards/accuracy_reward/mean": 0.546875,
"rewards/accuracy_reward/std": 0.49606408923864365,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 114
},
{
"clip_ratio": 0.0,
"completion_length": 4368.59375,
"epoch": 0.02281972417898601,
"grad_norm": 0.07572012394666672,
"learning_rate": 7.74754489035403e-07,
"loss": 0.0135,
"num_tokens": 29979386.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.234375,
"reward_std": 0.2824692837893963,
"rewards/accuracy_reward/mean": 0.25,
"rewards/accuracy_reward/std": 0.41104350984096527,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 115
},
{
"clip_ratio": 0.0,
"completion_length": 5647.046875,
"epoch": 0.023018156563151107,
"grad_norm": 0.09180216491222382,
"learning_rate": 7.698753289757564e-07,
"loss": 0.0594,
"num_tokens": 30350501.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.359375,
"reward_std": 0.47147566080093384,
"rewards/accuracy_reward/mean": 0.40625,
"rewards/accuracy_reward/std": 0.45726002007722855,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.14789126068353653,
"step": 116
},
{
"clip_ratio": 0.0,
"completion_length": 3541.984375,
"epoch": 0.0232165889473162,
"grad_norm": 0.11565890908241272,
"learning_rate": 7.649596321166024e-07,
"loss": 0.0325,
"num_tokens": 30592980.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.421875,
"reward_std": 0.3322913199663162,
"rewards/accuracy_reward/mean": 0.453125,
"rewards/accuracy_reward/std": 0.3507782220840454,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 117
},
{
"clip_ratio": 0.0,
"completion_length": 5316.859375,
"epoch": 0.0234150213314813,
"grad_norm": 0.0745224729180336,
"learning_rate": 7.600080639646076e-07,
"loss": 0.0179,
"num_tokens": 30943611.0,
"pctg_samples_exceeding_max_length": 6.25,
"reward": 1.25,
"reward_std": 0.30807682126760483,
"rewards/accuracy_reward/mean": 0.296875,
"rewards/accuracy_reward/std": 0.3432852029800415,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.14789126068353653,
"step": 118
},
{
"clip_ratio": 0.0,
"completion_length": 1737.5,
"epoch": 0.023613453715646392,
"grad_norm": 0.07930964231491089,
"learning_rate": 7.550212948828376e-07,
"loss": -0.0027,
"num_tokens": 31063659.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.484375,
"reward_std": 0.2777610532939434,
"rewards/accuracy_reward/mean": 0.484375,
"rewards/accuracy_reward/std": 0.30185678601264954,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 119
},
{
"clip_ratio": 0.0,
"completion_length": 2376.125,
"epoch": 0.02381188609981149,
"grad_norm": 0.11325174570083618,
"learning_rate": 7.5e-07,
"loss": 0.0209,
"num_tokens": 31224819.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.515625,
"reward_std": 0.3047240823507309,
"rewards/accuracy_reward/mean": 0.53125,
"rewards/accuracy_reward/std": 0.34860680997371674,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 120
},
{
"clip_ratio": 0.0,
"completion_length": 4035.40625,
"epoch": 0.024010318483976584,
"grad_norm": 0.0741363987326622,
"learning_rate": 7.449448591190434e-07,
"loss": 0.0445,
"num_tokens": 31491805.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.484375,
"reward_std": 0.38627273216843605,
"rewards/accuracy_reward/mean": 0.515625,
"rewards/accuracy_reward/std": 0.4284028485417366,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 121
},
{
"clip_ratio": 0.0,
"completion_length": 3521.390625,
"epoch": 0.02420875086814168,
"grad_norm": 0.06572757661342621,
"learning_rate": 7.398565566251232e-07,
"loss": 0.0584,
"num_tokens": 31727182.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.5,
"reward_std": 0.28237568587064743,
"rewards/accuracy_reward/mean": 0.515625,
"rewards/accuracy_reward/std": 0.48079314827919006,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 122
},
{
"clip_ratio": 0.0,
"completion_length": 5891.6875,
"epoch": 0.024407183252306775,
"grad_norm": 0.06379007548093796,
"learning_rate": 7.347357813929454e-07,
"loss": 0.0329,
"num_tokens": 32112970.0,
"pctg_samples_exceeding_max_length": 7.8125,
"reward": 1.265625,
"reward_std": 0.2971188388764858,
"rewards/accuracy_reward/mean": 0.328125,
"rewards/accuracy_reward/std": 0.2913651168346405,
"rewards/format_simple_reward/mean": 0.9375,
"rewards/format_simple_reward/std": 0.11180340498685837,
"step": 123
},
{
"clip_ratio": 0.0,
"completion_length": 4472.3125,
"epoch": 0.024605615636471873,
"grad_norm": 0.10385247319936752,
"learning_rate": 7.295832266935058e-07,
"loss": 0.0427,
"num_tokens": 32408342.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.390625,
"reward_std": 0.3607042469084263,
"rewards/accuracy_reward/mean": 0.421875,
"rewards/accuracy_reward/std": 0.43526528775691986,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 124
},
{
"clip_ratio": 0.0,
"completion_length": 2435.546875,
"epoch": 0.024804048020636967,
"grad_norm": 0.06141391396522522,
"learning_rate": 7.243995901002311e-07,
"loss": 0.0031,
"num_tokens": 32574961.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.5625,
"reward_std": 0.24251843616366386,
"rewards/accuracy_reward/mean": 0.5625,
"rewards/accuracy_reward/std": 0.4057852029800415,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 125
},
{
"clip_ratio": 0.0,
"completion_length": 3610.796875,
"epoch": 0.025002480404802064,
"grad_norm": 0.05469653382897377,
"learning_rate": 7.191855733945386e-07,
"loss": 0.0048,
"num_tokens": 32815148.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.328125,
"reward_std": 0.26265157014131546,
"rewards/accuracy_reward/mean": 0.34375,
"rewards/accuracy_reward/std": 0.45539355278015137,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 126
},
{
"clip_ratio": 0.0,
"completion_length": 4347.34375,
"epoch": 0.025200912788967158,
"grad_norm": 0.0888119488954544,
"learning_rate": 7.139418824708271e-07,
"loss": 0.0222,
"num_tokens": 33106458.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.09375,
"reward_std": 0.25513992458581924,
"rewards/accuracy_reward/mean": 0.109375,
"rewards/accuracy_reward/std": 0.2640564441680908,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 127
},
{
"clip_ratio": 0.0,
"completion_length": 4784.21875,
"epoch": 0.025399345173132255,
"grad_norm": 0.048139411956071854,
"learning_rate": 7.086692272409089e-07,
"loss": 0.0012,
"num_tokens": 33423792.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.3125,
"reward_std": 0.2540663555264473,
"rewards/accuracy_reward/mean": 0.359375,
"rewards/accuracy_reward/std": 0.36058124154806137,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.10077822208404541,
"step": 128
},
{
"clip_ratio": 0.0,
"completion_length": 3833.390625,
"epoch": 0.02559777755729735,
"grad_norm": 0.03707767277956009,
"learning_rate": 7.033683215379002e-07,
"loss": -0.0222,
"num_tokens": 33680745.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.234375,
"reward_std": 0.12255740165710449,
"rewards/accuracy_reward/mean": 0.234375,
"rewards/accuracy_reward/std": 0.24467839300632477,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 129
},
{
"clip_ratio": 0.0,
"completion_length": 2265.390625,
"epoch": 0.025796209941462447,
"grad_norm": 0.10517938435077667,
"learning_rate": 6.980398830195784e-07,
"loss": 0.012,
"num_tokens": 33835122.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.671875,
"reward_std": 0.37769732624292374,
"rewards/accuracy_reward/mean": 0.671875,
"rewards/accuracy_reward/std": 0.4255262687802315,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 130
},
{
"clip_ratio": 0.0,
"completion_length": 4751.40625,
"epoch": 0.025994642325627544,
"grad_norm": 0.03988025337457657,
"learning_rate": 6.926846330712241e-07,
"loss": 0.0122,
"num_tokens": 34149140.0,
"pctg_samples_exceeding_max_length": 6.25,
"reward": 1.28125,
"reward_std": 0.20637330040335655,
"rewards/accuracy_reward/mean": 0.328125,
"rewards/accuracy_reward/std": 0.4279688596725464,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.10077822208404541,
"step": 131
},
{
"clip_ratio": 0.0,
"completion_length": 2498.59375,
"epoch": 0.026193074709792638,
"grad_norm": 0.11355213820934296,
"learning_rate": 6.87303296707956e-07,
"loss": 0.0059,
"num_tokens": 34318202.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.515625,
"reward_std": 0.23144521936774254,
"rewards/accuracy_reward/mean": 0.515625,
"rewards/accuracy_reward/std": 0.2829566150903702,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 132
},
{
"clip_ratio": 0.0,
"completion_length": 2982.21875,
"epoch": 0.026391507093957736,
"grad_norm": 0.05754660442471504,
"learning_rate": 6.818966024765757e-07,
"loss": -0.0116,
"num_tokens": 34519496.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.40625,
"reward_std": 0.2619796209037304,
"rewards/accuracy_reward/mean": 0.40625,
"rewards/accuracy_reward/std": 0.4665650501847267,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 133
},
{
"clip_ratio": 0.0,
"completion_length": 4033.15625,
"epoch": 0.02658993947812283,
"grad_norm": 0.03146485611796379,
"learning_rate": 6.764652823569343e-07,
"loss": -0.0031,
"num_tokens": 34788290.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.515625,
"reward_std": 0.15992168709635735,
"rewards/accuracy_reward/mean": 0.515625,
"rewards/accuracy_reward/std": 0.40199070423841476,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 134
},
{
"clip_ratio": 0.0,
"completion_length": 3357.203125,
"epoch": 0.026788371862287927,
"grad_norm": 0.08845074474811554,
"learning_rate": 6.710100716628344e-07,
"loss": 0.0226,
"num_tokens": 35014063.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.59375,
"reward_std": 0.2925041988492012,
"rewards/accuracy_reward/mean": 0.609375,
"rewards/accuracy_reward/std": 0.4716770425438881,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 135
},
{
"clip_ratio": 0.0,
"completion_length": 2488.734375,
"epoch": 0.02698680424645302,
"grad_norm": 0.0806184709072113,
"learning_rate": 6.65531708942479e-07,
"loss": 0.0073,
"num_tokens": 35183886.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.40625,
"reward_std": 0.19727616384625435,
"rewards/accuracy_reward/mean": 0.40625,
"rewards/accuracy_reward/std": 0.29237766563892365,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 136
},
{
"clip_ratio": 0.0,
"completion_length": 2789.140625,
"epoch": 0.027185236630618118,
"grad_norm": 0.047988295555114746,
"learning_rate": 6.600309358784857e-07,
"loss": 0.01,
"num_tokens": 35372519.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.609375,
"reward_std": 0.10205793008208275,
"rewards/accuracy_reward/mean": 0.609375,
"rewards/accuracy_reward/std": 0.21347815543413162,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 137
},
{
"clip_ratio": 0.0,
"completion_length": 5214.96875,
"epoch": 0.027383669014783212,
"grad_norm": 0.08441098779439926,
"learning_rate": 6.545084971874736e-07,
"loss": -0.011,
"num_tokens": 35716341.0,
"pctg_samples_exceeding_max_length": 6.25,
"reward": 1.171875,
"reward_std": 0.39456214010715485,
"rewards/accuracy_reward/mean": 0.21875,
"rewards/accuracy_reward/std": 0.39964763820171356,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.14789126068353653,
"step": 138
},
{
"clip_ratio": 0.0,
"completion_length": 3173.25,
"epoch": 0.02758210139894831,
"grad_norm": 0.08350157737731934,
"learning_rate": 6.489651405192409e-07,
"loss": -0.0179,
"num_tokens": 35930133.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.546875,
"reward_std": 0.35612428933382034,
"rewards/accuracy_reward/mean": 0.546875,
"rewards/accuracy_reward/std": 0.47669370472431183,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 139
},
{
"clip_ratio": 0.0,
"completion_length": 4006.796875,
"epoch": 0.027780533783113404,
"grad_norm": 0.0734095424413681,
"learning_rate": 6.434016163555451e-07,
"loss": 0.0564,
"num_tokens": 36195520.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.5,
"reward_std": 0.3830774985253811,
"rewards/accuracy_reward/mean": 0.53125,
"rewards/accuracy_reward/std": 0.47865550220012665,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 140
},
{
"clip_ratio": 0.0,
"completion_length": 3743.0625,
"epoch": 0.0279789661672785,
"grad_norm": 0.04596159979701042,
"learning_rate": 6.378186779084995e-07,
"loss": 0.0041,
"num_tokens": 36443772.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.328125,
"reward_std": 0.1889965645968914,
"rewards/accuracy_reward/mean": 0.34375,
"rewards/accuracy_reward/std": 0.41737766563892365,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 141
},
{
"clip_ratio": 0.0,
"completion_length": 2579.828125,
"epoch": 0.028177398551443595,
"grad_norm": 0.0764467716217041,
"learning_rate": 6.322170810186011e-07,
"loss": 0.011,
"num_tokens": 36618521.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.46875,
"reward_std": 0.22461533173918724,
"rewards/accuracy_reward/mean": 0.46875,
"rewards/accuracy_reward/std": 0.4697679653763771,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 142
},
{
"clip_ratio": 0.0,
"completion_length": 5357.15625,
"epoch": 0.028375830935608692,
"grad_norm": 0.09573767334222794,
"learning_rate": 6.265975840524009e-07,
"loss": 0.0198,
"num_tokens": 36974939.0,
"pctg_samples_exceeding_max_length": 14.0625,
"reward": 1.25,
"reward_std": 0.4674704074859619,
"rewards/accuracy_reward/mean": 0.40625,
"rewards/accuracy_reward/std": 0.4000816270709038,
"rewards/format_simple_reward/mean": 0.84375,
"rewards/format_simple_reward/std": 0.21449070423841476,
"step": 143
},
{
"clip_ratio": 0.0,
"completion_length": 4174.984375,
"epoch": 0.028574263319773786,
"grad_norm": 0.07029157131910324,
"learning_rate": 6.209609477998338e-07,
"loss": 0.007,
"num_tokens": 37253554.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.5,
"reward_std": 0.25513992458581924,
"rewards/accuracy_reward/mean": 0.515625,
"rewards/accuracy_reward/std": 0.2640564441680908,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 144
},
{
"clip_ratio": 0.0,
"completion_length": 4308.328125,
"epoch": 0.028772695703938884,
"grad_norm": 0.06995023041963577,
"learning_rate": 6.153079353712201e-07,
"loss": 0.0171,
"num_tokens": 37540311.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.359375,
"reward_std": 0.3352486677467823,
"rewards/accuracy_reward/mean": 0.375,
"rewards/accuracy_reward/std": 0.4581565484404564,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 145
},
{
"clip_ratio": 0.0,
"completion_length": 3475.8125,
"epoch": 0.028971128088103978,
"grad_norm": 0.06802232563495636,
"learning_rate": 6.096393120939516e-07,
"loss": 0.0006,
"num_tokens": 37773651.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.34375,
"reward_std": 0.2177756391465664,
"rewards/accuracy_reward/mean": 0.34375,
"rewards/accuracy_reward/std": 0.34066852182149887,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 146
},
{
"clip_ratio": 0.0,
"completion_length": 4245.046875,
"epoch": 0.029169560472269075,
"grad_norm": 0.03839960694313049,
"learning_rate": 6.039558454088795e-07,
"loss": 0.0159,
"num_tokens": 38056294.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.5,
"reward_std": 0.1767766922712326,
"rewards/accuracy_reward/mean": 0.53125,
"rewards/accuracy_reward/std": 0.35796456038951874,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 147
},
{
"clip_ratio": 0.0,
"completion_length": 3594.609375,
"epoch": 0.02936799285643417,
"grad_norm": 0.0880749374628067,
"learning_rate": 5.98258304766415e-07,
"loss": 0.0167,
"num_tokens": 38296005.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.59375,
"reward_std": 0.2756393924355507,
"rewards/accuracy_reward/mean": 0.59375,
"rewards/accuracy_reward/std": 0.4446863383054733,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 148
},
{
"clip_ratio": 0.0,
"completion_length": 3102.703125,
"epoch": 0.029566425240599267,
"grad_norm": 0.07202839106321335,
"learning_rate": 5.925474615223572e-07,
"loss": 0.0084,
"num_tokens": 38502578.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.609375,
"reward_std": 0.29355230554938316,
"rewards/accuracy_reward/mean": 0.609375,
"rewards/accuracy_reward/std": 0.3846946656703949,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 149
},
{
"clip_ratio": 0.0,
"completion_length": 5342.71875,
"epoch": 0.02976485762476436,
"grad_norm": 0.18192718923091888,
"learning_rate": 5.868240888334652e-07,
"loss": 0.0705,
"num_tokens": 38853928.0,
"pctg_samples_exceeding_max_length": 7.8125,
"reward": 1.296875,
"reward_std": 0.36403754353523254,
"rewards/accuracy_reward/mean": 0.375,
"rewards/accuracy_reward/std": 0.2759781554341316,
"rewards/format_simple_reward/mean": 0.921875,
"rewards/format_simple_reward/std": 0.23328252136707306,
"step": 150
},
{
"clip_ratio": 0.0,
"completion_length": 3987.96875,
"epoch": 0.029963290008929458,
"grad_norm": 0.07421736419200897,
"learning_rate": 5.810889615527838e-07,
"loss": 0.0138,
"num_tokens": 39119390.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.3125,
"reward_std": 0.2845909409224987,
"rewards/accuracy_reward/mean": 0.3125,
"rewards/accuracy_reward/std": 0.4314897432923317,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 151
},
{
"clip_ratio": 0.0,
"completion_length": 3305.453125,
"epoch": 0.030161722393094552,
"grad_norm": 0.06759615987539291,
"learning_rate": 5.753428561247415e-07,
"loss": 0.0074,
"num_tokens": 39340123.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.6875,
"reward_std": 0.22461533173918724,
"rewards/accuracy_reward/mean": 0.6875,
"rewards/accuracy_reward/std": 0.40507759898900986,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 152
},
{
"clip_ratio": 0.0,
"completion_length": 3000.875,
"epoch": 0.03036015477725965,
"grad_norm": 0.06739697605371475,
"learning_rate": 5.695865504800327e-07,
"loss": 0.0024,
"num_tokens": 39541979.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.640625,
"reward_std": 0.23144521936774254,
"rewards/accuracy_reward/mean": 0.640625,
"rewards/accuracy_reward/std": 0.4393647313117981,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 153
},
{
"clip_ratio": 0.0,
"completion_length": 3921.796875,
"epoch": 0.030558587161424743,
"grad_norm": 0.07829024642705917,
"learning_rate": 5.638208239302974e-07,
"loss": 0.0242,
"num_tokens": 39801886.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.296875,
"reward_std": 0.3445763625204563,
"rewards/accuracy_reward/mean": 0.3125,
"rewards/accuracy_reward/std": 0.43925637751817703,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 154
},
{
"clip_ratio": 0.0,
"completion_length": 3982.875,
"epoch": 0.03075701954558984,
"grad_norm": 0.08566286414861679,
"learning_rate": 5.580464570626151e-07,
"loss": 0.051,
"num_tokens": 40068342.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.40625,
"reward_std": 0.3923370726406574,
"rewards/accuracy_reward/mean": 0.46875,
"rewards/accuracy_reward/std": 0.5102732330560684,
"rewards/format_simple_reward/mean": 0.9375,
"rewards/format_simple_reward/std": 0.17078252136707306,
"step": 155
},
{
"clip_ratio": 0.0,
"completion_length": 3751.515625,
"epoch": 0.030955451929754935,
"grad_norm": 0.11006251722574234,
"learning_rate": 5.522642316338268e-07,
"loss": -0.0021,
"num_tokens": 40321231.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.46875,
"reward_std": 0.29143064096570015,
"rewards/accuracy_reward/mean": 0.484375,
"rewards/accuracy_reward/std": 0.4163651168346405,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 156
},
{
"clip_ratio": 0.0,
"completion_length": 5374.25,
"epoch": 0.031153884313920032,
"grad_norm": 0.06231905519962311,
"learning_rate": 5.464749304646961e-07,
"loss": -0.0058,
"num_tokens": 40676591.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.390625,
"reward_std": 0.32878511399030685,
"rewards/accuracy_reward/mean": 0.40625,
"rewards/accuracy_reward/std": 0.36180340498685837,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 157
},
{
"clip_ratio": 0.0,
"completion_length": 3987.703125,
"epoch": 0.03135231669808513,
"grad_norm": 0.08030477166175842,
"learning_rate": 5.406793373339292e-07,
"loss": 0.0036,
"num_tokens": 40944860.0,
"pctg_samples_exceeding_max_length": 9.375,
"reward": 1.390625,
"reward_std": 0.32407689094543457,
"rewards/accuracy_reward/mean": 0.453125,
"rewards/accuracy_reward/std": 0.46326854079961777,
"rewards/format_simple_reward/mean": 0.9375,
"rewards/format_simple_reward/std": 0.11180340498685837,
"step": 158
},
{
"clip_ratio": 0.0,
"completion_length": 3204.0625,
"epoch": 0.03155074908225022,
"grad_norm": 0.08892784267663956,
"learning_rate": 5.348782368720625e-07,
"loss": 0.0134,
"num_tokens": 41159256.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.265625,
"reward_std": 0.2198973037302494,
"rewards/accuracy_reward/mean": 0.265625,
"rewards/accuracy_reward/std": 0.36489029973745346,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 159
},
{
"clip_ratio": 0.0,
"completion_length": 3137.75,
"epoch": 0.03174918146641532,
"grad_norm": 0.07553652673959732,
"learning_rate": 5.290724144552379e-07,
"loss": -0.0061,
"num_tokens": 41369456.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.609375,
"reward_std": 0.2688095085322857,
"rewards/accuracy_reward/mean": 0.609375,
"rewards/accuracy_reward/std": 0.41520625352859497,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 160
},
{
"clip_ratio": 0.0,
"completion_length": 5182.15625,
"epoch": 0.03194761385058041,
"grad_norm": 0.06761611998081207,
"learning_rate": 5.232626560988734e-07,
"loss": 0.0157,
"num_tokens": 41712338.0,
"pctg_samples_exceeding_max_length": 6.25,
"reward": 1.15625,
"reward_std": 0.2346404530107975,
"rewards/accuracy_reward/mean": 0.21875,
"rewards/accuracy_reward/std": 0.1632782220840454,
"rewards/format_simple_reward/mean": 0.9375,
"rewards/format_simple_reward/std": 0.1632782220840454,
"step": 161
},
{
"clip_ratio": 0.0,
"completion_length": 4751.859375,
"epoch": 0.03214604623474551,
"grad_norm": 0.10682018846273422,
"learning_rate": 5.174497483512505e-07,
"loss": 0.0024,
"num_tokens": 42026841.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.359375,
"reward_std": 0.36403755098581314,
"rewards/accuracy_reward/mean": 0.40625,
"rewards/accuracy_reward/std": 0.46449070423841476,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.14789126068353653,
"step": 162
},
{
"clip_ratio": 0.0,
"completion_length": 2958.015625,
"epoch": 0.032344478618910606,
"grad_norm": 0.07404064387083054,
"learning_rate": 5.116344781870281e-07,
"loss": 0.0088,
"num_tokens": 42225346.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.546875,
"reward_std": 0.21778544411063194,
"rewards/accuracy_reward/mean": 0.546875,
"rewards/accuracy_reward/std": 0.42386941611766815,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 163
},
{
"clip_ratio": 0.0,
"completion_length": 5347.9375,
"epoch": 0.0325429110030757,
"grad_norm": 0.08778950572013855,
"learning_rate": 5.058176329006985e-07,
"loss": 0.052,
"num_tokens": 42577134.0,
"pctg_samples_exceeding_max_length": 9.375,
"reward": 1.34375,
"reward_std": 0.4648032784461975,
"rewards/accuracy_reward/mean": 0.4375,
"rewards/accuracy_reward/std": 0.4991017356514931,
"rewards/format_simple_reward/mean": 0.90625,
"rewards/format_simple_reward/std": 0.1971946656703949,
"step": 164
},
{
"clip_ratio": 0.0,
"completion_length": 3412.34375,
"epoch": 0.0327413433872408,
"grad_norm": 0.07785286754369736,
"learning_rate": 5e-07,
"loss": 0.0442,
"num_tokens": 42805308.0,
"pctg_samples_exceeding_max_length": 6.25,
"reward": 1.421875,
"reward_std": 0.23568854480981827,
"rewards/accuracy_reward/mean": 0.484375,
"rewards/accuracy_reward/std": 0.2596946656703949,
"rewards/format_simple_reward/mean": 0.9375,
"rewards/format_simple_reward/std": 0.11180340498685837,
"step": 165
},
{
"clip_ratio": 0.0,
"completion_length": 1768.828125,
"epoch": 0.032939775771405895,
"grad_norm": 0.044220659881830215,
"learning_rate": 4.941823670993015e-07,
"loss": -0.0102,
"num_tokens": 42926969.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.5625,
"reward_std": 0.10888781771063805,
"rewards/accuracy_reward/mean": 0.5625,
"rewards/accuracy_reward/std": 0.2288651168346405,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 166
},
{
"clip_ratio": 0.0,
"completion_length": 4506.234375,
"epoch": 0.03313820815557099,
"grad_norm": 0.06158232316374779,
"learning_rate": 4.883655218129719e-07,
"loss": 0.0376,
"num_tokens": 43226736.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.3125,
"reward_std": 0.32195523381233215,
"rewards/accuracy_reward/mean": 0.3125,
"rewards/accuracy_reward/std": 0.45129410922527313,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 167
},
{
"clip_ratio": 0.0,
"completion_length": 3642.921875,
"epoch": 0.03333664053973608,
"grad_norm": 0.08899498730897903,
"learning_rate": 4.825502516487496e-07,
"loss": 0.0018,
"num_tokens": 43470307.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.65625,
"reward_std": 0.43768275529146194,
"rewards/accuracy_reward/mean": 0.65625,
"rewards/accuracy_reward/std": 0.4515564441680908,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 168
},
{
"clip_ratio": 0.0,
"completion_length": 2957.375,
"epoch": 0.033535072923901184,
"grad_norm": 0.08617479354143143,
"learning_rate": 4.7673734390112666e-07,
"loss": 0.012,
"num_tokens": 43669363.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.671875,
"reward_std": 0.3051002249121666,
"rewards/accuracy_reward/mean": 0.671875,
"rewards/accuracy_reward/std": 0.466681070625782,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 169
},
{
"clip_ratio": 0.0,
"completion_length": 3149.125,
"epoch": 0.03373350530806628,
"grad_norm": 0.09472719579935074,
"learning_rate": 4.7092758554476206e-07,
"loss": 0.0237,
"num_tokens": 43880507.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.421875,
"reward_std": 0.282469280064106,
"rewards/accuracy_reward/mean": 0.421875,
"rewards/accuracy_reward/std": 0.4692344516515732,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 170
},
{
"clip_ratio": 0.0,
"completion_length": 2961.59375,
"epoch": 0.03393193769223137,
"grad_norm": 0.07322706282138824,
"learning_rate": 4.6512176312793735e-07,
"loss": 0.0505,
"num_tokens": 44079297.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.75,
"reward_std": 0.27439429983496666,
"rewards/accuracy_reward/mean": 0.78125,
"rewards/accuracy_reward/std": 0.34066852182149887,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 171
},
{
"clip_ratio": 0.0,
"completion_length": 4463.34375,
"epoch": 0.034130370076396466,
"grad_norm": 0.05957922339439392,
"learning_rate": 4.593206626660709e-07,
"loss": 0.0254,
"num_tokens": 44373663.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.421875,
"reward_std": 0.31512533873319626,
"rewards/accuracy_reward/mean": 0.421875,
"rewards/accuracy_reward/std": 0.31687305867671967,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 172
},
{
"clip_ratio": 0.0,
"completion_length": 4244.8125,
"epoch": 0.03432880246056157,
"grad_norm": 0.08755864948034286,
"learning_rate": 4.535250695353039e-07,
"loss": 0.0259,
"num_tokens": 44654251.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.609375,
"reward_std": 0.33669837564229965,
"rewards/accuracy_reward/mean": 0.640625,
"rewards/accuracy_reward/std": 0.29886941611766815,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 173
},
{
"clip_ratio": 0.0,
"completion_length": 3336.203125,
"epoch": 0.03452723484472666,
"grad_norm": 0.06668836623430252,
"learning_rate": 4.477357683661733e-07,
"loss": -0.0019,
"num_tokens": 44876576.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.390625,
"reward_std": 0.12255740165710449,
"rewards/accuracy_reward/mean": 0.390625,
"rewards/accuracy_reward/std": 0.373777836561203,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 174
},
{
"clip_ratio": 0.0,
"completion_length": 2194.125,
"epoch": 0.034725667228891755,
"grad_norm": 0.0380835235118866,
"learning_rate": 4.419535429373848e-07,
"loss": -0.0016,
"num_tokens": 45026112.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.703125,
"reward_std": 0.13258251920342445,
"rewards/accuracy_reward/mean": 0.703125,
"rewards/accuracy_reward/std": 0.3821863383054733,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 175
},
{
"clip_ratio": 0.0,
"completion_length": 3824.5,
"epoch": 0.03492409961305685,
"grad_norm": 0.09387128800153732,
"learning_rate": 4.3617917606970267e-07,
"loss": 0.0031,
"num_tokens": 45279224.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.4375,
"reward_std": 0.3640277460217476,
"rewards/accuracy_reward/mean": 0.453125,
"rewards/accuracy_reward/std": 0.46034691482782364,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 176
},
{
"clip_ratio": 0.0,
"completion_length": 2636.859375,
"epoch": 0.03512253199722195,
"grad_norm": 0.1106298416852951,
"learning_rate": 4.304134495199674e-07,
"loss": 0.0282,
"num_tokens": 45456887.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.453125,
"reward_std": 0.35612428933382034,
"rewards/accuracy_reward/mean": 0.453125,
"rewards/accuracy_reward/std": 0.49244368076324463,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 177
},
{
"clip_ratio": 0.0,
"completion_length": 3020.09375,
"epoch": 0.03532096438138704,
"grad_norm": 0.08344382047653198,
"learning_rate": 4.246571438752584e-07,
"loss": 0.0226,
"num_tokens": 45660013.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.5,
"reward_std": 0.3503679595887661,
"rewards/accuracy_reward/mean": 0.515625,
"rewards/accuracy_reward/std": 0.500852182507515,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 178
},
{
"clip_ratio": 0.0,
"completion_length": 2965.0625,
"epoch": 0.03551939676555214,
"grad_norm": 0.09550179541110992,
"learning_rate": 4.1891103844721634e-07,
"loss": 0.0385,
"num_tokens": 45858185.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.59375,
"reward_std": 0.2834492512047291,
"rewards/accuracy_reward/mean": 0.609375,
"rewards/accuracy_reward/std": 0.27289126068353653,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 179
},
{
"clip_ratio": 0.0,
"completion_length": 2239.40625,
"epoch": 0.03571782914971723,
"grad_norm": 0.12453499436378479,
"learning_rate": 4.131759111665348e-07,
"loss": 0.002,
"num_tokens": 46010723.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.53125,
"reward_std": 0.4276576265692711,
"rewards/accuracy_reward/mean": 0.5625,
"rewards/accuracy_reward/std": 0.43399807065725327,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 180
},
{
"clip_ratio": 0.0,
"completion_length": 2941.796875,
"epoch": 0.03591626153388233,
"grad_norm": 0.06762684136629105,
"learning_rate": 4.074525384776428e-07,
"loss": 0.0004,
"num_tokens": 46208798.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.625,
"reward_std": 0.17570312693715096,
"rewards/accuracy_reward/mean": 0.640625,
"rewards/accuracy_reward/std": 0.341681070625782,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 181
},
{
"clip_ratio": 0.0,
"completion_length": 3129.03125,
"epoch": 0.036114693918047426,
"grad_norm": 0.1322803497314453,
"learning_rate": 4.0174169523358485e-07,
"loss": 0.0233,
"num_tokens": 46418296.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.390625,
"reward_std": 0.3629639819264412,
"rewards/accuracy_reward/mean": 0.390625,
"rewards/accuracy_reward/std": 0.4634781554341316,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 182
},
{
"clip_ratio": 0.0,
"completion_length": 3589.4375,
"epoch": 0.03631312630221252,
"grad_norm": 0.10599295794963837,
"learning_rate": 3.960441545911204e-07,
"loss": 0.0035,
"num_tokens": 46656820.0,
"pctg_samples_exceeding_max_length": 6.25,
"reward": 1.234375,
"reward_std": 0.35945529490709305,
"rewards/accuracy_reward/mean": 0.28125,
"rewards/accuracy_reward/std": 0.36435678601264954,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.10077822208404541,
"step": 183
},
{
"clip_ratio": 0.0,
"completion_length": 4469.046875,
"epoch": 0.036511558686377614,
"grad_norm": 0.061696432530879974,
"learning_rate": 3.9036068790604823e-07,
"loss": 0.0445,
"num_tokens": 46951047.0,
"pctg_samples_exceeding_max_length": 7.8125,
"reward": 1.34375,
"reward_std": 0.3064695969223976,
"rewards/accuracy_reward/mean": 0.421875,
"rewards/accuracy_reward/std": 0.4436737895011902,
"rewards/format_simple_reward/mean": 0.921875,
"rewards/format_simple_reward/std": 0.17430340498685837,
"step": 184
},
{
"clip_ratio": 0.0,
"completion_length": 2311.359375,
"epoch": 0.036709991070542715,
"grad_norm": 0.06667950749397278,
"learning_rate": 3.846920646287799e-07,
"loss": -0.0207,
"num_tokens": 47111118.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.53125,
"reward_std": 0.16675157845020294,
"rewards/accuracy_reward/mean": 0.53125,
"rewards/accuracy_reward/std": 0.45539355278015137,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 185
},
{
"clip_ratio": 0.0,
"completion_length": 4311.1875,
"epoch": 0.03690842345470781,
"grad_norm": 0.08088706433773041,
"learning_rate": 3.790390522001662e-07,
"loss": 0.0349,
"num_tokens": 47395770.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.703125,
"reward_std": 0.4071483463048935,
"rewards/accuracy_reward/mean": 0.703125,
"rewards/accuracy_reward/std": 0.46513500809669495,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 186
},
{
"clip_ratio": 0.0,
"completion_length": 5377.203125,
"epoch": 0.0371068558388729,
"grad_norm": 0.06506410986185074,
"learning_rate": 3.734024159475991e-07,
"loss": 0.0259,
"num_tokens": 47749183.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.15625,
"reward_std": 0.2130674161016941,
"rewards/accuracy_reward/mean": 0.203125,
"rewards/accuracy_reward/std": 0.17430340498685837,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.14789126068353653,
"step": 187
},
{
"clip_ratio": 0.0,
"completion_length": 2529.90625,
"epoch": 0.037305288223038,
"grad_norm": 0.04323267564177513,
"learning_rate": 3.6778291898139903e-07,
"loss": 0.0017,
"num_tokens": 47920025.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.640625,
"reward_std": 0.17358146607875824,
"rewards/accuracy_reward/mean": 0.640625,
"rewards/accuracy_reward/std": 0.373777836561203,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 188
},
{
"clip_ratio": 0.0,
"completion_length": 2342.15625,
"epoch": 0.0375037206072031,
"grad_norm": 0.13311287760734558,
"learning_rate": 3.621813220915004e-07,
"loss": 0.0374,
"num_tokens": 48078483.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.578125,
"reward_std": 0.38664887472987175,
"rewards/accuracy_reward/mean": 0.578125,
"rewards/accuracy_reward/std": 0.500852182507515,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 189
},
{
"clip_ratio": 0.0,
"completion_length": 4707.875,
"epoch": 0.03770215299136819,
"grad_norm": 0.04849832132458687,
"learning_rate": 3.56598383644455e-07,
"loss": 0.0124,
"num_tokens": 48392411.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.390625,
"reward_std": 0.2468603253364563,
"rewards/accuracy_reward/mean": 0.40625,
"rewards/accuracy_reward/std": 0.3495560586452484,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 190
},
{
"clip_ratio": 0.0,
"completion_length": 4627.5625,
"epoch": 0.037900585375533286,
"grad_norm": 0.09096211194992065,
"learning_rate": 3.5103485948075894e-07,
"loss": 0.061,
"num_tokens": 48699791.0,
"pctg_samples_exceeding_max_length": 6.25,
"reward": 1.265625,
"reward_std": 0.35103992372751236,
"rewards/accuracy_reward/mean": 0.328125,
"rewards/accuracy_reward/std": 0.4040650501847267,
"rewards/format_simple_reward/mean": 0.9375,
"rewards/format_simple_reward/std": 0.21039126068353653,
"step": 191
},
{
"clip_ratio": 0.0,
"completion_length": 4474.796875,
"epoch": 0.03809901775969838,
"grad_norm": 0.07029682397842407,
"learning_rate": 3.454915028125263e-07,
"loss": 0.0195,
"num_tokens": 48997858.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.421875,
"reward_std": 0.368642371147871,
"rewards/accuracy_reward/mean": 0.453125,
"rewards/accuracy_reward/std": 0.40199070423841476,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 192
},
{
"clip_ratio": 0.0,
"completion_length": 2418.953125,
"epoch": 0.03829745014386348,
"grad_norm": 0.09375589340925217,
"learning_rate": 3.3996906412151417e-07,
"loss": 0.009,
"num_tokens": 49162695.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.5625,
"reward_std": 0.22461533173918724,
"rewards/accuracy_reward/mean": 0.5625,
"rewards/accuracy_reward/std": 0.39964763820171356,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 193
},
{
"clip_ratio": 0.0,
"completion_length": 2648.46875,
"epoch": 0.038495882528028574,
"grad_norm": 0.09423656761646271,
"learning_rate": 3.34468291057521e-07,
"loss": 0.0203,
"num_tokens": 49342309.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.703125,
"reward_std": 0.3266732655465603,
"rewards/accuracy_reward/mean": 0.703125,
"rewards/accuracy_reward/std": 0.4339347705245018,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 194
},
{
"clip_ratio": 0.0,
"completion_length": 2116.34375,
"epoch": 0.03869431491219367,
"grad_norm": 0.14581039547920227,
"learning_rate": 3.2898992833716563e-07,
"loss": 0.0484,
"num_tokens": 49486059.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.453125,
"reward_std": 0.3571978472173214,
"rewards/accuracy_reward/mean": 0.484375,
"rewards/accuracy_reward/std": 0.49654312431812286,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 195
},
{
"clip_ratio": 0.0,
"completion_length": 4332.984375,
"epoch": 0.03889274729635877,
"grad_norm": 0.06983482837677002,
"learning_rate": 3.235347176430656e-07,
"loss": 0.0125,
"num_tokens": 49772250.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.421875,
"reward_std": 0.2109457515180111,
"rewards/accuracy_reward/mean": 0.4375,
"rewards/accuracy_reward/std": 0.21039126068353653,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 196
},
{
"clip_ratio": 0.0,
"completion_length": 3591.109375,
"epoch": 0.03909117968052386,
"grad_norm": 0.07738480716943741,
"learning_rate": 3.181033975234244e-07,
"loss": 0.035,
"num_tokens": 50015257.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.5625,
"reward_std": 0.3424546979367733,
"rewards/accuracy_reward/mean": 0.578125,
"rewards/accuracy_reward/std": 0.3956565484404564,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 197
},
{
"clip_ratio": 0.0,
"completion_length": 2804.0,
"epoch": 0.03928961206468896,
"grad_norm": 0.08593685179948807,
"learning_rate": 3.1269670329204393e-07,
"loss": 0.0077,
"num_tokens": 50203649.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.734375,
"reward_std": 0.2777610532939434,
"rewards/accuracy_reward/mean": 0.734375,
"rewards/accuracy_reward/std": 0.3569520115852356,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 198
},
{
"clip_ratio": 0.0,
"completion_length": 3239.1875,
"epoch": 0.03948804444885405,
"grad_norm": 0.05978383868932724,
"learning_rate": 3.073153669287759e-07,
"loss": 0.0087,
"num_tokens": 50420645.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.53125,
"reward_std": 0.2346404492855072,
"rewards/accuracy_reward/mean": 0.53125,
"rewards/accuracy_reward/std": 0.40507759898900986,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 199
},
{
"clip_ratio": 0.0,
"completion_length": 4011.65625,
"epoch": 0.03968647683301915,
"grad_norm": 0.056433163583278656,
"learning_rate": 3.0196011698042156e-07,
"loss": 0.0041,
"num_tokens": 50686631.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.546875,
"reward_std": 0.2382849156856537,
"rewards/accuracy_reward/mean": 0.578125,
"rewards/accuracy_reward/std": 0.47987766563892365,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 200
},
{
"clip_ratio": 0.0,
"completion_length": 5321.28125,
"epoch": 0.039884909217184246,
"grad_norm": 0.09510478377342224,
"learning_rate": 2.9663167846209996e-07,
"loss": 0.0776,
"num_tokens": 51039201.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.4375,
"reward_std": 0.42506126314401627,
"rewards/accuracy_reward/mean": 0.484375,
"rewards/accuracy_reward/std": 0.4459725022315979,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.14789126068353653,
"step": 201
},
{
"clip_ratio": 0.0,
"completion_length": 3159.578125,
"epoch": 0.04008334160134934,
"grad_norm": 0.1077599823474884,
"learning_rate": 2.9133077275909107e-07,
"loss": 0.0466,
"num_tokens": 51259470.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.390625,
"reward_std": 0.3140517696738243,
"rewards/accuracy_reward/mean": 0.421875,
"rewards/accuracy_reward/std": 0.32528156042099,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 202
},
{
"clip_ratio": 0.0,
"completion_length": 3799.453125,
"epoch": 0.040281773985514434,
"grad_norm": 0.1074754074215889,
"learning_rate": 2.86058117529173e-07,
"loss": -0.008,
"num_tokens": 51513987.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.578125,
"reward_std": 0.3901550732553005,
"rewards/accuracy_reward/mean": 0.609375,
"rewards/accuracy_reward/std": 0.42206869274377823,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 203
},
{
"clip_ratio": 0.0,
"completion_length": 3664.171875,
"epoch": 0.040480206369679535,
"grad_norm": 0.09297296404838562,
"learning_rate": 2.808144266054612e-07,
"loss": 0.0342,
"num_tokens": 51764718.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.375,
"reward_std": 0.29143064096570015,
"rewards/accuracy_reward/mean": 0.390625,
"rewards/accuracy_reward/std": 0.4896806851029396,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 204
},
{
"clip_ratio": 0.0,
"completion_length": 4723.3125,
"epoch": 0.04067863875384463,
"grad_norm": 0.07666141539812088,
"learning_rate": 2.756004098997689e-07,
"loss": 0.0323,
"num_tokens": 52076802.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.328125,
"reward_std": 0.39560042321681976,
"rewards/accuracy_reward/mean": 0.359375,
"rewards/accuracy_reward/std": 0.36058124154806137,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 205
},
{
"clip_ratio": 0.0,
"completion_length": 3397.234375,
"epoch": 0.04087707113800972,
"grad_norm": 0.08058644831180573,
"learning_rate": 2.7041677330649406e-07,
"loss": 0.0147,
"num_tokens": 52302561.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.484375,
"reward_std": 0.32522355020046234,
"rewards/accuracy_reward/mean": 0.5,
"rewards/accuracy_reward/std": 0.45726002007722855,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 206
},
{
"clip_ratio": 0.0,
"completion_length": 3609.921875,
"epoch": 0.04107550352217482,
"grad_norm": 0.050570297986269,
"learning_rate": 2.6526421860705473e-07,
"loss": 0.0078,
"num_tokens": 52543540.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.75,
"reward_std": 0.32195523008704185,
"rewards/accuracy_reward/mean": 0.765625,
"rewards/accuracy_reward/std": 0.39315588772296906,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 207
},
{
"clip_ratio": 0.0,
"completion_length": 2769.71875,
"epoch": 0.04127393590633992,
"grad_norm": 0.0974111407995224,
"learning_rate": 2.6014344337487703e-07,
"loss": -0.0169,
"num_tokens": 52730858.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.4375,
"reward_std": 0.40715815499424934,
"rewards/accuracy_reward/mean": 0.453125,
"rewards/accuracy_reward/std": 0.48558124154806137,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 208
},
{
"clip_ratio": 0.0,
"completion_length": 2650.953125,
"epoch": 0.04147236829050501,
"grad_norm": 0.07112528383731842,
"learning_rate": 2.550551408809565e-07,
"loss": 0.0313,
"num_tokens": 52909031.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.578125,
"reward_std": 0.2777610495686531,
"rewards/accuracy_reward/mean": 0.578125,
"rewards/accuracy_reward/std": 0.3384781554341316,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 209
},
{
"clip_ratio": 0.0,
"completion_length": 6198.046875,
"epoch": 0.041670800674670105,
"grad_norm": 0.07550786435604095,
"learning_rate": 2.500000000000001e-07,
"loss": 0.0678,
"num_tokens": 53317186.0,
"pctg_samples_exceeding_max_length": 6.25,
"reward": 1.15625,
"reward_std": 0.46525514870882034,
"rewards/accuracy_reward/mean": 0.234375,
"rewards/accuracy_reward/std": 0.4079566150903702,
"rewards/format_simple_reward/mean": 0.921875,
"rewards/format_simple_reward/std": 0.27289126068353653,
"step": 210
},
{
"clip_ratio": 0.0,
"completion_length": 4693.609375,
"epoch": 0.0418692330588352,
"grad_norm": 0.07345623522996902,
"learning_rate": 2.4497870511716237e-07,
"loss": 0.0261,
"num_tokens": 53628297.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.5,
"reward_std": 0.3640277422964573,
"rewards/accuracy_reward/mean": 0.515625,
"rewards/accuracy_reward/std": 0.3384781554341316,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 211
},
{
"clip_ratio": 0.0,
"completion_length": 3636.015625,
"epoch": 0.0420676654430003,
"grad_norm": 0.0602419413626194,
"learning_rate": 2.399919360353923e-07,
"loss": 0.04,
"num_tokens": 53869698.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.71875,
"reward_std": 0.24511480331420898,
"rewards/accuracy_reward/mean": 0.71875,
"rewards/accuracy_reward/std": 0.23680340498685837,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 212
},
{
"clip_ratio": 0.0,
"completion_length": 3360.953125,
"epoch": 0.042266097827165394,
"grad_norm": 0.09265056252479553,
"learning_rate": 2.350403678833976e-07,
"loss": 0.0209,
"num_tokens": 54094887.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.453125,
"reward_std": 0.29826052114367485,
"rewards/accuracy_reward/mean": 0.453125,
"rewards/accuracy_reward/std": 0.4423432722687721,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 213
},
{
"clip_ratio": 0.0,
"completion_length": 2432.265625,
"epoch": 0.04246453021133049,
"grad_norm": 0.10387091338634491,
"learning_rate": 2.301246710242437e-07,
"loss": 0.0088,
"num_tokens": 54259960.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.734375,
"reward_std": 0.3356248140335083,
"rewards/accuracy_reward/mean": 0.734375,
"rewards/accuracy_reward/std": 0.44187305867671967,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 214
},
{
"clip_ratio": 0.0,
"completion_length": 3366.8125,
"epoch": 0.04266296259549558,
"grad_norm": 0.13589128851890564,
"learning_rate": 2.25245510964597e-07,
"loss": 0.0264,
"num_tokens": 54484500.0,
"pctg_samples_exceeding_max_length": 6.25,
"reward": 1.40625,
"reward_std": 0.4236226864159107,
"rewards/accuracy_reward/mean": 0.484375,
"rewards/accuracy_reward/std": 0.4040650501847267,
"rewards/format_simple_reward/mean": 0.921875,
"rewards/format_simple_reward/std": 0.18616948276758194,
"step": 215
},
{
"clip_ratio": 0.0,
"completion_length": 4263.390625,
"epoch": 0.04286139497966068,
"grad_norm": 0.06538370996713638,
"learning_rate": 2.2040354826462664e-07,
"loss": 0.0152,
"num_tokens": 54766709.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.390625,
"reward_std": 0.2414703369140625,
"rewards/accuracy_reward/mean": 0.40625,
"rewards/accuracy_reward/std": 0.3768647313117981,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 216
},
{
"clip_ratio": 0.0,
"completion_length": 2925.921875,
"epoch": 0.04305982736382578,
"grad_norm": 0.09177590161561966,
"learning_rate": 2.155994384485742e-07,
"loss": 0.025,
"num_tokens": 54964704.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.53125,
"reward_std": 0.3157972879707813,
"rewards/accuracy_reward/mean": 0.546875,
"rewards/accuracy_reward/std": 0.3846946656703949,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 217
},
{
"clip_ratio": 0.0,
"completion_length": 3170.296875,
"epoch": 0.04325825974799087,
"grad_norm": 0.0932336151599884,
"learning_rate": 2.1083383191600672e-07,
"loss": -0.0097,
"num_tokens": 55176691.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.546875,
"reward_std": 0.2688095085322857,
"rewards/accuracy_reward/mean": 0.546875,
"rewards/accuracy_reward/std": 0.34944770485162735,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 218
},
{
"clip_ratio": 0.0,
"completion_length": 3794.234375,
"epoch": 0.043456692132155965,
"grad_norm": 0.06655831634998322,
"learning_rate": 2.0610737385376348e-07,
"loss": 0.0072,
"num_tokens": 55430858.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.390625,
"reward_std": 0.2109457515180111,
"rewards/accuracy_reward/mean": 0.390625,
"rewards/accuracy_reward/std": 0.3296433389186859,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 219
},
{
"clip_ratio": 0.0,
"completion_length": 4100.3125,
"epoch": 0.043655124516321066,
"grad_norm": 0.09012893587350845,
"learning_rate": 2.01420704148607e-07,
"loss": 0.0583,
"num_tokens": 55705830.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.34375,
"reward_std": 0.3291315585374832,
"rewards/accuracy_reward/mean": 0.375,
"rewards/accuracy_reward/std": 0.3872983306646347,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 220
},
{
"clip_ratio": 0.0,
"completion_length": 4027.46875,
"epoch": 0.04385355690048616,
"grad_norm": 0.06345543265342712,
"learning_rate": 1.9677445730059344e-07,
"loss": 0.0165,
"num_tokens": 55974172.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.484375,
"reward_std": 0.3799547702074051,
"rewards/accuracy_reward/mean": 0.515625,
"rewards/accuracy_reward/std": 0.4682852029800415,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 221
},
{
"clip_ratio": 0.0,
"completion_length": 2500.578125,
"epoch": 0.044051989284651254,
"grad_norm": 0.06794095039367676,
"learning_rate": 1.9216926233717084e-07,
"loss": 0.0185,
"num_tokens": 56142889.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.65625,
"reward_std": 0.29476164653897285,
"rewards/accuracy_reward/mean": 0.6875,
"rewards/accuracy_reward/std": 0.4581565484404564,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 222
},
{
"clip_ratio": 0.0,
"completion_length": 2603.734375,
"epoch": 0.04425042166881635,
"grad_norm": 0.10391843318939209,
"learning_rate": 1.8760574272801998e-07,
"loss": -0.0091,
"num_tokens": 56318864.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.484375,
"reward_std": 0.2688095085322857,
"rewards/accuracy_reward/mean": 0.484375,
"rewards/accuracy_reward/std": 0.5133601278066635,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 223
},
{
"clip_ratio": 0.0,
"completion_length": 3673.234375,
"epoch": 0.04444885405298145,
"grad_norm": 0.054212868213653564,
"learning_rate": 1.830845163006448e-07,
"loss": 0.0238,
"num_tokens": 56564527.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.765625,
"reward_std": 0.2777610495686531,
"rewards/accuracy_reward/mean": 0.765625,
"rewards/accuracy_reward/std": 0.3384781554341316,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 224
},
{
"clip_ratio": 0.0,
"completion_length": 3679.203125,
"epoch": 0.04464728643714654,
"grad_norm": 0.07871349900960922,
"learning_rate": 1.7860619515673032e-07,
"loss": 0.0275,
"num_tokens": 56810452.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.65625,
"reward_std": 0.3122667595744133,
"rewards/accuracy_reward/mean": 0.671875,
"rewards/accuracy_reward/std": 0.466681070625782,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 225
},
{
"clip_ratio": 0.0,
"completion_length": 4605.390625,
"epoch": 0.044845718821311636,
"grad_norm": 0.09332305938005447,
"learning_rate": 1.741713855892724e-07,
"loss": 0.0316,
"num_tokens": 57114741.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.390625,
"reward_std": 0.42256344482302666,
"rewards/accuracy_reward/mean": 0.4375,
"rewards/accuracy_reward/std": 0.4665650501847267,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.10077822208404541,
"step": 226
},
{
"clip_ratio": 0.0,
"completion_length": 5579.109375,
"epoch": 0.04504415120547673,
"grad_norm": 0.0691530779004097,
"learning_rate": 1.697806880004962e-07,
"loss": 0.0047,
"num_tokens": 57481340.0,
"pctg_samples_exceeding_max_length": 9.375,
"reward": 1.203125,
"reward_std": 0.4297397807240486,
"rewards/accuracy_reward/mean": 0.296875,
"rewards/accuracy_reward/std": 0.4229728877544403,
"rewards/format_simple_reward/mean": 0.90625,
"rewards/format_simple_reward/std": 0.18217839300632477,
"step": 227
},
{
"clip_ratio": 0.0,
"completion_length": 4272.546875,
"epoch": 0.04524258358964183,
"grad_norm": 0.076441191136837,
"learning_rate": 1.6543469682057104e-07,
"loss": 0.0289,
"num_tokens": 57764319.0,
"pctg_samples_exceeding_max_length": 9.375,
"reward": 1.421875,
"reward_std": 0.2961486726999283,
"rewards/accuracy_reward/mean": 0.515625,
"rewards/accuracy_reward/std": 0.4443683698773384,
"rewards/format_simple_reward/mean": 0.90625,
"rewards/format_simple_reward/std": 0.125,
"step": 228
},
{
"clip_ratio": 0.0,
"completion_length": 5300.96875,
"epoch": 0.045441015973806925,
"grad_norm": 0.04717392474412918,
"learning_rate": 1.6113400042713388e-07,
"loss": 0.0214,
"num_tokens": 58112717.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.3125,
"reward_std": 0.19727616384625435,
"rewards/accuracy_reward/mean": 0.328125,
"rewards/accuracy_reward/std": 0.31026528775691986,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 229
},
{
"clip_ratio": 0.0,
"completion_length": 4836.9375,
"epoch": 0.04563944835797202,
"grad_norm": 0.09932030737400055,
"learning_rate": 1.5687918106563325e-07,
"loss": 0.001,
"num_tokens": 58432009.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.28125,
"reward_std": 0.31300368160009384,
"rewards/accuracy_reward/mean": 0.328125,
"rewards/accuracy_reward/std": 0.3507782220840454,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.14789126068353653,
"step": 230
},
{
"clip_ratio": 0.0,
"completion_length": 2293.109375,
"epoch": 0.04583788074213712,
"grad_norm": 0.09787152707576752,
"learning_rate": 1.5267081477050131e-07,
"loss": -0.0151,
"num_tokens": 58588232.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.65625,
"reward_std": 0.3335031569004059,
"rewards/accuracy_reward/mean": 0.65625,
"rewards/accuracy_reward/std": 0.4471946656703949,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 231
},
{
"clip_ratio": 0.0,
"completion_length": 2212.328125,
"epoch": 0.046036313126302214,
"grad_norm": 0.07984359562397003,
"learning_rate": 1.4850947128716911e-07,
"loss": 0.0071,
"num_tokens": 58738301.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.578125,
"reward_std": 0.19044627621769905,
"rewards/accuracy_reward/mean": 0.578125,
"rewards/accuracy_reward/std": 0.27289126068353653,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 232
},
{
"clip_ratio": 0.0,
"completion_length": 3222.96875,
"epoch": 0.04623474551046731,
"grad_norm": 0.05325806513428688,
"learning_rate": 1.4439571399493145e-07,
"loss": 0.0316,
"num_tokens": 58953091.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.5,
"reward_std": 0.2177756354212761,
"rewards/accuracy_reward/mean": 0.515625,
"rewards/accuracy_reward/std": 0.3212348371744156,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 233
},
{
"clip_ratio": 0.0,
"completion_length": 3310.09375,
"epoch": 0.0464331778946324,
"grad_norm": 0.09928283095359802,
"learning_rate": 1.4033009983067452e-07,
"loss": 0.0072,
"num_tokens": 59175009.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.40625,
"reward_std": 0.2404065802693367,
"rewards/accuracy_reward/mean": 0.40625,
"rewards/accuracy_reward/std": 0.49500229209661484,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 234
},
{
"clip_ratio": 0.0,
"completion_length": 2008.78125,
"epoch": 0.0466316102787975,
"grad_norm": 0.08970481157302856,
"learning_rate": 1.3631317921347562e-07,
"loss": -0.009,
"num_tokens": 59313819.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.609375,
"reward_std": 0.1804211586713791,
"rewards/accuracy_reward/mean": 0.609375,
"rewards/accuracy_reward/std": 0.31116948276758194,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 235
},
{
"clip_ratio": 0.0,
"completion_length": 4733.375,
"epoch": 0.0468300426629626,
"grad_norm": 0.06184681877493858,
"learning_rate": 1.3234549597008572e-07,
"loss": 0.0655,
"num_tokens": 59628251.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.40625,
"reward_std": 0.3731248788535595,
"rewards/accuracy_reward/mean": 0.453125,
"rewards/accuracy_reward/std": 0.47354350984096527,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.14789126068353653,
"step": 236
},
{
"clip_ratio": 0.0,
"completion_length": 4240.609375,
"epoch": 0.04702847504712769,
"grad_norm": 0.07269468903541565,
"learning_rate": 1.284275872613028e-07,
"loss": 0.0187,
"num_tokens": 59907770.0,
"pctg_samples_exceeding_max_length": 6.25,
"reward": 1.21875,
"reward_std": 0.2709311693906784,
"rewards/accuracy_reward/mean": 0.28125,
"rewards/accuracy_reward/std": 0.3659028485417366,
"rewards/format_simple_reward/mean": 0.9375,
"rewards/format_simple_reward/std": 0.21039126068353653,
"step": 237
},
{
"clip_ratio": 0.0,
"completion_length": 2916.421875,
"epoch": 0.047226907431292785,
"grad_norm": 0.044079460203647614,
"learning_rate": 1.245599835092504e-07,
"loss": -0.0076,
"num_tokens": 60103541.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.65625,
"reward_std": 0.1462521031498909,
"rewards/accuracy_reward/mean": 0.671875,
"rewards/accuracy_reward/std": 0.3821863383054733,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 238
},
{
"clip_ratio": 0.0,
"completion_length": 3496.859375,
"epoch": 0.047425339815457886,
"grad_norm": 0.06593558937311172,
"learning_rate": 1.2074320832556556e-07,
"loss": 0.0154,
"num_tokens": 60337420.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.28125,
"reward_std": 0.3618124797940254,
"rewards/accuracy_reward/mean": 0.296875,
"rewards/accuracy_reward/std": 0.42386941611766815,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 239
},
{
"clip_ratio": 0.0,
"completion_length": 2668.328125,
"epoch": 0.04762377219962298,
"grad_norm": 0.07535550743341446,
"learning_rate": 1.1697777844051104e-07,
"loss": 0.0131,
"num_tokens": 60518041.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.8125,
"reward_std": 0.10888781771063805,
"rewards/accuracy_reward/mean": 0.8125,
"rewards/accuracy_reward/std": 0.29237766563892365,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 240
},
{
"clip_ratio": 0.0,
"completion_length": 3496.453125,
"epoch": 0.047822204583788074,
"grad_norm": 0.05712200701236725,
"learning_rate": 1.1326420363301808e-07,
"loss": 0.0534,
"num_tokens": 60749878.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.390625,
"reward_std": 0.26265157014131546,
"rewards/accuracy_reward/mean": 0.4375,
"rewards/accuracy_reward/std": 0.3221946656703949,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.14789126068353653,
"step": 241
},
{
"clip_ratio": 0.0,
"completion_length": 2269.515625,
"epoch": 0.04802063696795317,
"grad_norm": 0.10938979685306549,
"learning_rate": 1.096029866616704e-07,
"loss": 0.0331,
"num_tokens": 60902855.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.609375,
"reward_std": 0.38664886727929115,
"rewards/accuracy_reward/mean": 0.625,
"rewards/accuracy_reward/std": 0.49297719448804855,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 242
},
{
"clip_ratio": 0.0,
"completion_length": 4668.234375,
"epoch": 0.04821906935211827,
"grad_norm": 0.04065511003136635,
"learning_rate": 1.0599462319663904e-07,
"loss": 0.0113,
"num_tokens": 61213894.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.328125,
"reward_std": 0.17358146235346794,
"rewards/accuracy_reward/mean": 0.34375,
"rewards/accuracy_reward/std": 0.20155644416809082,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 243
},
{
"clip_ratio": 0.0,
"completion_length": 3759.125,
"epoch": 0.04841750173628336,
"grad_norm": 0.10101503133773804,
"learning_rate": 1.0243960175257605e-07,
"loss": 0.0353,
"num_tokens": 61463190.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.46875,
"reward_std": 0.4196762442588806,
"rewards/accuracy_reward/mean": 0.484375,
"rewards/accuracy_reward/std": 0.43303824216127396,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 244
},
{
"clip_ratio": 0.0,
"completion_length": 2675.84375,
"epoch": 0.048615934120448456,
"grad_norm": 0.11434400081634521,
"learning_rate": 9.893840362247807e-08,
"loss": 0.0038,
"num_tokens": 61643780.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.6875,
"reward_std": 0.4560507535934448,
"rewards/accuracy_reward/mean": 0.6875,
"rewards/accuracy_reward/std": 0.46450965851545334,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 245
},
{
"clip_ratio": 0.0,
"completion_length": 5531.90625,
"epoch": 0.04881436650461355,
"grad_norm": 0.06921669840812683,
"learning_rate": 9.549150281252632e-08,
"loss": 0.0212,
"num_tokens": 62007806.0,
"pctg_samples_exceeding_max_length": 7.8125,
"reward": 1.421875,
"reward_std": 0.29826052859425545,
"rewards/accuracy_reward/mean": 0.5,
"rewards/accuracy_reward/std": 0.29398179799318314,
"rewards/format_simple_reward/mean": 0.921875,
"rewards/format_simple_reward/std": 0.18616948276758194,
"step": 246
},
{
"clip_ratio": 0.0,
"completion_length": 4724.828125,
"epoch": 0.04901279888877865,
"grad_norm": 0.08901813626289368,
"learning_rate": 9.209936597791407e-08,
"loss": 0.0444,
"num_tokens": 62318491.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.515625,
"reward_std": 0.338117778301239,
"rewards/accuracy_reward/mean": 0.53125,
"rewards/accuracy_reward/std": 0.49345622956752777,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 247
},
{
"clip_ratio": 0.0,
"completion_length": 3840.8125,
"epoch": 0.049211231272943745,
"grad_norm": 0.03847607970237732,
"learning_rate": 8.876245235966883e-08,
"loss": 0.0015,
"num_tokens": 62573375.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.46875,
"reward_std": 0.0883883461356163,
"rewards/accuracy_reward/mean": 0.484375,
"rewards/accuracy_reward/std": 0.32069888710975647,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 248
},
{
"clip_ratio": 0.0,
"completion_length": 2358.09375,
"epoch": 0.04940966365710884,
"grad_norm": 0.0523378811776638,
"learning_rate": 8.548121372247919e-08,
"loss": 0.0012,
"num_tokens": 62732421.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.734375,
"reward_std": 0.2198972962796688,
"rewards/accuracy_reward/mean": 0.75,
"rewards/accuracy_reward/std": 0.2750816270709038,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 249
},
{
"clip_ratio": 0.0,
"completion_length": 3048.625,
"epoch": 0.04960809604127393,
"grad_norm": 0.07096703350543976,
"learning_rate": 8.225609429353186e-08,
"loss": 0.0276,
"num_tokens": 62935805.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.765625,
"reward_std": 0.2558118775486946,
"rewards/accuracy_reward/mean": 0.796875,
"rewards/accuracy_reward/std": 0.32528156042099,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 250
},
{
"clip_ratio": 0.0,
"completion_length": 2348.203125,
"epoch": 0.049806528425439034,
"grad_norm": 0.07040499895811081,
"learning_rate": 7.908753070237124e-08,
"loss": 0.0133,
"num_tokens": 63094930.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.46875,
"reward_std": 0.2130674123764038,
"rewards/accuracy_reward/mean": 0.5,
"rewards/accuracy_reward/std": 0.33949070423841476,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 251
},
{
"clip_ratio": 0.0,
"completion_length": 4011.0,
"epoch": 0.05000496080960413,
"grad_norm": 0.11649756878614426,
"learning_rate": 7.597595192178702e-08,
"loss": 0.0692,
"num_tokens": 63361898.0,
"pctg_samples_exceeding_max_length": 7.8125,
"reward": 1.4375,
"reward_std": 0.45693711936473846,
"rewards/accuracy_reward/mean": 0.5,
"rewards/accuracy_reward/std": 0.48456869274377823,
"rewards/format_simple_reward/mean": 0.9375,
"rewards/format_simple_reward/std": 0.1632782220840454,
"step": 252
},
{
"clip_ratio": 0.0,
"completion_length": 5713.9375,
"epoch": 0.05020339319376922,
"grad_norm": 0.08011293411254883,
"learning_rate": 7.292177920973724e-08,
"loss": 0.0086,
"num_tokens": 63738198.0,
"pctg_samples_exceeding_max_length": 10.9375,
"reward": 1.234375,
"reward_std": 0.4611036404967308,
"rewards/accuracy_reward/mean": 0.359375,
"rewards/accuracy_reward/std": 0.35169370472431183,
"rewards/format_simple_reward/mean": 0.875,
"rewards/format_simple_reward/std": 0.2825859263539314,
"step": 253
},
{
"clip_ratio": 0.0,
"completion_length": 2523.6875,
"epoch": 0.050401825577934316,
"grad_norm": 0.11520835012197495,
"learning_rate": 6.992542605231738e-08,
"loss": 0.0169,
"num_tokens": 63909746.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.609375,
"reward_std": 0.2688095048069954,
"rewards/accuracy_reward/mean": 0.625,
"rewards/accuracy_reward/std": 0.4185478091239929,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 254
},
{
"clip_ratio": 0.0,
"completion_length": 3532.34375,
"epoch": 0.05060025796209942,
"grad_norm": 0.06957222521305084,
"learning_rate": 6.698729810778064e-08,
"loss": 0.0035,
"num_tokens": 64146200.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.4375,
"reward_std": 0.2619796209037304,
"rewards/accuracy_reward/mean": 0.4375,
"rewards/accuracy_reward/std": 0.36136941611766815,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 255
},
{
"clip_ratio": 0.0,
"completion_length": 4822.359375,
"epoch": 0.05079869034626451,
"grad_norm": 0.05012118071317673,
"learning_rate": 6.410779315161886e-08,
"loss": 0.0025,
"num_tokens": 64468951.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.453125,
"reward_std": 0.25726158916950226,
"rewards/accuracy_reward/mean": 0.46875,
"rewards/accuracy_reward/std": 0.30239029973745346,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 256
},
{
"clip_ratio": 0.0,
"completion_length": 3546.90625,
"epoch": 0.050997122730429605,
"grad_norm": 0.06868642568588257,
"learning_rate": 6.128730102270896e-08,
"loss": -0.0017,
"num_tokens": 64705761.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.328125,
"reward_std": 0.12255740165710449,
"rewards/accuracy_reward/mean": 0.328125,
"rewards/accuracy_reward/std": 0.35487766563892365,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 257
},
{
"clip_ratio": 0.0,
"completion_length": 4899.0625,
"epoch": 0.0511955551145947,
"grad_norm": 0.052525848150253296,
"learning_rate": 5.8526203570536504e-08,
"loss": -0.0038,
"num_tokens": 65029213.0,
"pctg_samples_exceeding_max_length": 7.8125,
"reward": 1.375,
"reward_std": 0.29176727309823036,
"rewards/accuracy_reward/mean": 0.453125,
"rewards/accuracy_reward/std": 0.5049516260623932,
"rewards/format_simple_reward/mean": 0.921875,
"rewards/format_simple_reward/std": 0.18616948276758194,
"step": 258
},
{
"clip_ratio": 0.0,
"completion_length": 5168.34375,
"epoch": 0.0513939874987598,
"grad_norm": 0.05612216517329216,
"learning_rate": 5.582487460349805e-08,
"loss": 0.0281,
"num_tokens": 65369235.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.25,
"reward_std": 0.26124268397688866,
"rewards/accuracy_reward/mean": 0.28125,
"rewards/accuracy_reward/std": 0.35796456038951874,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.125,
"step": 259
},
{
"clip_ratio": 0.0,
"completion_length": 3618.0,
"epoch": 0.05159241988292489,
"grad_norm": 0.07068302482366562,
"learning_rate": 5.318367983829392e-08,
"loss": 0.0256,
"num_tokens": 65610211.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.640625,
"reward_std": 0.2472364604473114,
"rewards/accuracy_reward/mean": 0.671875,
"rewards/accuracy_reward/std": 0.21347815543413162,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 260
},
{
"clip_ratio": 0.0,
"completion_length": 2409.984375,
"epoch": 0.05179085226708999,
"grad_norm": 0.09518856555223465,
"learning_rate": 5.060297685041659e-08,
"loss": 0.0229,
"num_tokens": 65772066.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.484375,
"reward_std": 0.31512534618377686,
"rewards/accuracy_reward/mean": 0.484375,
"rewards/accuracy_reward/std": 0.466681070625782,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 261
},
{
"clip_ratio": 0.0,
"completion_length": 2821.0625,
"epoch": 0.05198928465125509,
"grad_norm": 0.09415067732334137,
"learning_rate": 4.808311502573975e-08,
"loss": 0.0171,
"num_tokens": 65962854.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.703125,
"reward_std": 0.3403330445289612,
"rewards/accuracy_reward/mean": 0.703125,
"rewards/accuracy_reward/std": 0.4682852029800415,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 262
},
{
"clip_ratio": 0.0,
"completion_length": 2893.90625,
"epoch": 0.05218771703542018,
"grad_norm": 0.08477367460727692,
"learning_rate": 4.5624435513217873e-08,
"loss": 0.0105,
"num_tokens": 66156672.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.484375,
"reward_std": 0.3403330445289612,
"rewards/accuracy_reward/mean": 0.484375,
"rewards/accuracy_reward/std": 0.48079314827919006,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 263
},
{
"clip_ratio": 0.0,
"completion_length": 5083.375,
"epoch": 0.052386149419585276,
"grad_norm": 0.055171605199575424,
"learning_rate": 4.322727117869951e-08,
"loss": 0.0483,
"num_tokens": 66491672.0,
"pctg_samples_exceeding_max_length": 6.25,
"reward": 1.484375,
"reward_std": 0.3517775535583496,
"rewards/accuracy_reward/mean": 0.546875,
"rewards/accuracy_reward/std": 0.44442643970251083,
"rewards/format_simple_reward/mean": 0.9375,
"rewards/format_simple_reward/std": 0.1632782220840454,
"step": 264
},
{
"clip_ratio": 0.0,
"completion_length": 3292.953125,
"epoch": 0.05258458180375037,
"grad_norm": 0.07812030613422394,
"learning_rate": 4.089194655986306e-08,
"loss": 0.0235,
"num_tokens": 66711165.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.265625,
"reward_std": 0.3608325123786926,
"rewards/accuracy_reward/mean": 0.28125,
"rewards/accuracy_reward/std": 0.4598134011030197,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 265
},
{
"clip_ratio": 0.0,
"completion_length": 5663.515625,
"epoch": 0.05278301418791547,
"grad_norm": 0.05051609128713608,
"learning_rate": 3.861877782227885e-08,
"loss": 0.0203,
"num_tokens": 67085086.0,
"pctg_samples_exceeding_max_length": 7.8125,
"reward": 1.203125,
"reward_std": 0.2777610570192337,
"rewards/accuracy_reward/mean": 0.28125,
"rewards/accuracy_reward/std": 0.42739029973745346,
"rewards/format_simple_reward/mean": 0.921875,
"rewards/format_simple_reward/std": 0.11967839300632477,
"step": 266
},
{
"clip_ratio": 0.0,
"completion_length": 4678.625,
"epoch": 0.052981446572080565,
"grad_norm": 0.09890221059322357,
"learning_rate": 3.6408072716606345e-08,
"loss": 0.0345,
"num_tokens": 67395086.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.515625,
"reward_std": 0.445586197078228,
"rewards/accuracy_reward/mean": 0.5625,
"rewards/accuracy_reward/std": 0.487064003944397,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.14789126068353653,
"step": 267
},
{
"clip_ratio": 0.0,
"completion_length": 2490.125,
"epoch": 0.05317987895624566,
"grad_norm": 0.07824266701936722,
"learning_rate": 3.426013053692878e-08,
"loss": -0.0077,
"num_tokens": 67563486.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.515625,
"reward_std": 0.27564920485019684,
"rewards/accuracy_reward/mean": 0.53125,
"rewards/accuracy_reward/std": 0.45565588772296906,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 268
},
{
"clip_ratio": 0.0,
"completion_length": 1953.53125,
"epoch": 0.05337831134041075,
"grad_norm": 0.06599071621894836,
"learning_rate": 3.217524208023431e-08,
"loss": 0.0228,
"num_tokens": 67698392.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.515625,
"reward_std": 0.2109457515180111,
"rewards/accuracy_reward/mean": 0.53125,
"rewards/accuracy_reward/std": 0.43494731932878494,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 269
},
{
"clip_ratio": 0.0,
"completion_length": 3752.15625,
"epoch": 0.053576743724575854,
"grad_norm": 0.05245380476117134,
"learning_rate": 3.015368960704584e-08,
"loss": 0.0231,
"num_tokens": 67949234.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.4375,
"reward_std": 0.1462521031498909,
"rewards/accuracy_reward/mean": 0.453125,
"rewards/accuracy_reward/std": 0.5112857818603516,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 270
},
{
"clip_ratio": 0.0,
"completion_length": 3119.75,
"epoch": 0.05377517610874095,
"grad_norm": 0.07370147854089737,
"learning_rate": 2.8195746803208242e-08,
"loss": 0.0093,
"num_tokens": 68160466.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.421875,
"reward_std": 0.1530819907784462,
"rewards/accuracy_reward/mean": 0.4375,
"rewards/accuracy_reward/std": 0.311277836561203,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 271
},
{
"clip_ratio": 0.0,
"completion_length": 5866.609375,
"epoch": 0.05397360849290604,
"grad_norm": 0.07950908690690994,
"learning_rate": 2.6301678742835397e-08,
"loss": -0.0029,
"num_tokens": 68546497.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.34375,
"reward_std": 0.37981898710131645,
"rewards/accuracy_reward/mean": 0.359375,
"rewards/accuracy_reward/std": 0.36058124154806137,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 272
},
{
"clip_ratio": 0.0,
"completion_length": 4272.765625,
"epoch": 0.054172040877071136,
"grad_norm": 0.07312148064374924,
"learning_rate": 2.4471741852423233e-08,
"loss": 0.0498,
"num_tokens": 68830970.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.578125,
"reward_std": 0.35612428560853004,
"rewards/accuracy_reward/mean": 0.59375,
"rewards/accuracy_reward/std": 0.4405868947505951,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 273
},
{
"clip_ratio": 0.0,
"completion_length": 4441.921875,
"epoch": 0.054370473261236237,
"grad_norm": 0.06446761637926102,
"learning_rate": 2.2706183876134045e-08,
"loss": 0.0331,
"num_tokens": 69125237.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.46875,
"reward_std": 0.33276621997356415,
"rewards/accuracy_reward/mean": 0.484375,
"rewards/accuracy_reward/std": 0.46513500809669495,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 274
},
{
"clip_ratio": 0.0,
"completion_length": 3261.671875,
"epoch": 0.05456890564540133,
"grad_norm": 0.08079785108566284,
"learning_rate": 2.100524384225555e-08,
"loss": 0.012,
"num_tokens": 69343528.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.421875,
"reward_std": 0.335624810308218,
"rewards/accuracy_reward/mean": 0.421875,
"rewards/accuracy_reward/std": 0.39476002007722855,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 275
},
{
"clip_ratio": 0.0,
"completion_length": 5824.34375,
"epoch": 0.054767338029566424,
"grad_norm": 0.06168198958039284,
"learning_rate": 1.936915203084055e-08,
"loss": 0.0497,
"num_tokens": 69725862.0,
"pctg_samples_exceeding_max_length": 15.625,
"reward": 1.484375,
"reward_std": 0.3708576299250126,
"rewards/accuracy_reward/mean": 0.625,
"rewards/accuracy_reward/std": 0.48296456038951874,
"rewards/format_simple_reward/mean": 0.859375,
"rewards/format_simple_reward/std": 0.2829566150903702,
"step": 276
},
{
"clip_ratio": 0.0,
"completion_length": 3373.1875,
"epoch": 0.05496577041373152,
"grad_norm": 0.0802214965224266,
"learning_rate": 1.7798129942530548e-08,
"loss": 0.0405,
"num_tokens": 69951946.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.546875,
"reward_std": 0.3266732655465603,
"rewards/accuracy_reward/mean": 0.578125,
"rewards/accuracy_reward/std": 0.35487766563892365,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 277
},
{
"clip_ratio": 0.0,
"completion_length": 3529.78125,
"epoch": 0.05516420279789662,
"grad_norm": 0.062345512211322784,
"learning_rate": 1.62923902685681e-08,
"loss": 0.0428,
"num_tokens": 70187556.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.578125,
"reward_std": 0.2597545497119427,
"rewards/accuracy_reward/mean": 0.59375,
"rewards/accuracy_reward/std": 0.487064003944397,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 278
},
{
"clip_ratio": 0.0,
"completion_length": 3653.40625,
"epoch": 0.05536263518206171,
"grad_norm": 0.055186592042446136,
"learning_rate": 1.4852136862001763e-08,
"loss": 0.0308,
"num_tokens": 70431190.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.640625,
"reward_std": 0.23144522309303284,
"rewards/accuracy_reward/mean": 0.640625,
"rewards/accuracy_reward/std": 0.31687305867671967,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 279
},
{
"clip_ratio": 0.0,
"completion_length": 4036.84375,
"epoch": 0.05556106756622681,
"grad_norm": 0.10022751241922379,
"learning_rate": 1.3477564710088096e-08,
"loss": 0.0095,
"num_tokens": 70699660.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.453125,
"reward_std": 0.43556108325719833,
"rewards/accuracy_reward/mean": 0.46875,
"rewards/accuracy_reward/std": 0.47865550220012665,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 280
},
{
"clip_ratio": 0.0,
"completion_length": 5870.609375,
"epoch": 0.0557594999503919,
"grad_norm": 0.08025917410850525,
"learning_rate": 1.2168859907892902e-08,
"loss": -0.0033,
"num_tokens": 71084363.0,
"pctg_samples_exceeding_max_length": 7.8125,
"reward": 1.234375,
"reward_std": 0.25726158916950226,
"rewards/accuracy_reward/mean": 0.3125,
"rewards/accuracy_reward/std": 0.1632782220840454,
"rewards/format_simple_reward/mean": 0.921875,
"rewards/format_simple_reward/std": 0.17430340498685837,
"step": 281
},
{
"clip_ratio": 0.0,
"completion_length": 4939.859375,
"epoch": 0.055957932334557,
"grad_norm": 0.0907580628991127,
"learning_rate": 1.0926199633097154e-08,
"loss": 0.0415,
"num_tokens": 71410898.0,
"pctg_samples_exceeding_max_length": 6.25,
"reward": 1.28125,
"reward_std": 0.4445224404335022,
"rewards/accuracy_reward/mean": 0.328125,
"rewards/accuracy_reward/std": 0.48148179799318314,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.14789126068353653,
"step": 282
},
{
"clip_ratio": 0.0,
"completion_length": 2962.03125,
"epoch": 0.056156364718722096,
"grad_norm": 0.09937720000743866,
"learning_rate": 9.749752122010346e-09,
"loss": 0.0166,
"num_tokens": 71610556.0,
"pctg_samples_exceeding_max_length": 7.8125,
"reward": 1.59375,
"reward_std": 0.33276621624827385,
"rewards/accuracy_reward/mean": 0.671875,
"rewards/accuracy_reward/std": 0.39476002007722855,
"rewards/format_simple_reward/mean": 0.921875,
"rewards/format_simple_reward/std": 0.11967839300632477,
"step": 283
},
{
"clip_ratio": 0.0,
"completion_length": 4371.96875,
"epoch": 0.05635479710288719,
"grad_norm": 0.08584337681531906,
"learning_rate": 8.639676646793382e-09,
"loss": 0.0128,
"num_tokens": 71899794.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.4375,
"reward_std": 0.38452720269560814,
"rewards/accuracy_reward/mean": 0.453125,
"rewards/accuracy_reward/std": 0.4393647313117981,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 284
},
{
"clip_ratio": 0.0,
"completion_length": 3591.578125,
"epoch": 0.056553229487052284,
"grad_norm": 0.07933720201253891,
"learning_rate": 7.59612349389599e-09,
"loss": -0.003,
"num_tokens": 72138959.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.5,
"reward_std": 0.21161769330501556,
"rewards/accuracy_reward/mean": 0.515625,
"rewards/accuracy_reward/std": 0.24467839300632477,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 285
},
{
"clip_ratio": 0.0,
"completion_length": 2848.109375,
"epoch": 0.056751661871217385,
"grad_norm": 0.06404631584882736,
"learning_rate": 6.61923394371039e-09,
"loss": 0.0093,
"num_tokens": 72331022.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.703125,
"reward_std": 0.17358146235346794,
"rewards/accuracy_reward/mean": 0.703125,
"rewards/accuracy_reward/std": 0.2829566150903702,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 286
},
{
"clip_ratio": 0.0,
"completion_length": 2679.8125,
"epoch": 0.05695009425538248,
"grad_norm": 0.07299443334341049,
"learning_rate": 5.7091402514442e-09,
"loss": 0.0056,
"num_tokens": 72512658.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.421875,
"reward_std": 0.19044627994298935,
"rewards/accuracy_reward/mean": 0.421875,
"rewards/accuracy_reward/std": 0.48605145514011383,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 287
},
{
"clip_ratio": 0.0,
"completion_length": 3434.625,
"epoch": 0.05714852663954757,
"grad_norm": 0.0830707848072052,
"learning_rate": 4.865965629214819e-09,
"loss": 0.0155,
"num_tokens": 72745402.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.390625,
"reward_std": 0.3625878393650055,
"rewards/accuracy_reward/mean": 0.40625,
"rewards/accuracy_reward/std": 0.4665650501847267,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 288
},
{
"clip_ratio": 0.0,
"completion_length": 4877.640625,
"epoch": 0.05734695902371267,
"grad_norm": 0.0783158466219902,
"learning_rate": 4.089824229369154e-09,
"loss": 0.0012,
"num_tokens": 73068331.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.34375,
"reward_std": 0.2041158601641655,
"rewards/accuracy_reward/mean": 0.359375,
"rewards/accuracy_reward/std": 0.29886941611766815,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 289
},
{
"clip_ratio": 0.0,
"completion_length": 4068.1875,
"epoch": 0.05754539140787777,
"grad_norm": 0.08497243374586105,
"learning_rate": 3.380821129028488e-09,
"loss": 0.002,
"num_tokens": 73338719.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.578125,
"reward_std": 0.3492845855653286,
"rewards/accuracy_reward/mean": 0.59375,
"rewards/accuracy_reward/std": 0.48296456038951874,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 290
},
{
"clip_ratio": 0.0,
"completion_length": 1233.46875,
"epoch": 0.05774382379204286,
"grad_norm": 0.09693664312362671,
"learning_rate": 2.739052315863355e-09,
"loss": 0.0073,
"num_tokens": 73426517.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.59375,
"reward_std": 0.1462521031498909,
"rewards/accuracy_reward/mean": 0.59375,
"rewards/accuracy_reward/std": 0.2759781554341316,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 291
},
{
"clip_ratio": 0.0,
"completion_length": 4180.953125,
"epoch": 0.057942256176207955,
"grad_norm": 0.07849941402673721,
"learning_rate": 2.1646046750978253e-09,
"loss": 0.0026,
"num_tokens": 73704338.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.359375,
"reward_std": 0.4024401195347309,
"rewards/accuracy_reward/mean": 0.359375,
"rewards/accuracy_reward/std": 0.4436737895011902,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 292
},
{
"clip_ratio": 0.0,
"completion_length": 3585.15625,
"epoch": 0.05814068856037305,
"grad_norm": 0.09472294896841049,
"learning_rate": 1.6575559777469717e-09,
"loss": 0.0433,
"num_tokens": 73942804.0,
"pctg_samples_exceeding_max_length": 4.6875,
"reward": 1.40625,
"reward_std": 0.34034284949302673,
"rewards/accuracy_reward/mean": 0.453125,
"rewards/accuracy_reward/std": 0.373777836561203,
"rewards/format_simple_reward/mean": 0.953125,
"rewards/format_simple_reward/std": 0.10077822208404541,
"step": 293
},
{
"clip_ratio": 0.0,
"completion_length": 4984.203125,
"epoch": 0.05833912094453815,
"grad_norm": 0.044471655040979385,
"learning_rate": 1.217974870087901e-09,
"loss": 0.0325,
"num_tokens": 74271969.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.296875,
"reward_std": 0.2777610644698143,
"rewards/accuracy_reward/mean": 0.3125,
"rewards/accuracy_reward/std": 0.33226002007722855,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 294
},
{
"clip_ratio": 0.0,
"completion_length": 3475.828125,
"epoch": 0.058537553328703244,
"grad_norm": 0.07431676983833313,
"learning_rate": 8.459208643659121e-10,
"loss": -0.0021,
"num_tokens": 74505774.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.5,
"reward_std": 0.2177756354212761,
"rewards/accuracy_reward/mean": 0.5,
"rewards/accuracy_reward/std": 0.47663040459156036,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 295
},
{
"clip_ratio": 0.0,
"completion_length": 6076.953125,
"epoch": 0.05873598571286834,
"grad_norm": 0.07463104277849197,
"learning_rate": 5.41444330737717e-10,
"loss": 0.0125,
"num_tokens": 74906275.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.234375,
"reward_std": 0.3686423748731613,
"rewards/accuracy_reward/mean": 0.25,
"rewards/accuracy_reward/std": 0.4383598491549492,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 296
},
{
"clip_ratio": 0.0,
"completion_length": 4811.921875,
"epoch": 0.05893441809703344,
"grad_norm": 0.08277847617864609,
"learning_rate": 3.0458649045211894e-10,
"loss": 0.0423,
"num_tokens": 75225142.0,
"pctg_samples_exceeding_max_length": 3.125,
"reward": 1.421875,
"reward_std": 0.4765600264072418,
"rewards/accuracy_reward/mean": 0.453125,
"rewards/accuracy_reward/std": 0.500852182507515,
"rewards/format_simple_reward/mean": 0.96875,
"rewards/format_simple_reward/std": 0.08539126068353653,
"step": 297
},
{
"clip_ratio": 0.0,
"completion_length": 4022.984375,
"epoch": 0.05913285048119853,
"grad_norm": 0.08995603024959564,
"learning_rate": 1.3537941026914302e-10,
"loss": 0.0173,
"num_tokens": 75492421.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.40625,
"reward_std": 0.4003184661269188,
"rewards/accuracy_reward/mean": 0.421875,
"rewards/accuracy_reward/std": 0.4462348371744156,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 298
},
{
"clip_ratio": 0.0,
"completion_length": 3246.203125,
"epoch": 0.05933128286536363,
"grad_norm": 0.08339396864175797,
"learning_rate": 3.3845998118897657e-11,
"loss": -0.0126,
"num_tokens": 75709170.0,
"pctg_samples_exceeding_max_length": 0.0,
"reward": 1.3125,
"reward_std": 0.2619796246290207,
"rewards/accuracy_reward/mean": 0.3125,
"rewards/accuracy_reward/std": 0.3538651168346405,
"rewards/format_simple_reward/mean": 1.0,
"rewards/format_simple_reward/std": 0.0,
"step": 299
},
{
"clip_ratio": 0.0,
"completion_length": 4486.6875,
"epoch": 0.05952971524952872,
"grad_norm": 0.10416065901517868,
"learning_rate": 0.0,
"loss": 0.0265,
"num_tokens": 76007094.0,
"pctg_samples_exceeding_max_length": 1.5625,
"reward": 1.515625,
"reward_std": 0.2777610570192337,
"rewards/accuracy_reward/mean": 0.53125,
"rewards/accuracy_reward/std": 0.37276528775691986,
"rewards/format_simple_reward/mean": 0.984375,
"rewards/format_simple_reward/std": 0.0625,
"step": 300
},
{
"epoch": 0.05952971524952872,
"step": 300,
"total_flos": 0.0,
"train_loss": 0.019155046738063296,
"train_runtime": 89849.3674,
"train_samples_per_second": 0.214,
"train_steps_per_second": 0.003
}
],
"logging_steps": 1,
"max_steps": 300,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}