{ "best_global_step": 300, "best_metric": 0.13333333333333333, "best_model_checkpoint": "/local2/asuvarna31/distractors/Qwen3-1.7B_Mar25-0950_qwen3_0.6b_micro_top2_Mar18-0250_10000/checkpoint-300", "epoch": 0.12, "eval_steps": 100, "global_step": 300, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.025, "completions/max_length": 2162.52, "completions/max_terminated_length": 1872.8, "completions/mean_length": 773.9575, "completions/mean_terminated_length": 689.7016723632812, "completions/min_length": 228.04, "completions/min_terminated_length": 228.04, "entropy": 0.13874716758728028, "epoch": 0.01, "frac_reward_zero_std": 0.7, "grad_norm": 3.0590252022682956, "learning_rate": 4.952e-06, "loss": -0.0206, "num_tokens": 362415.0, "reward": 0.6125, "reward_std": 0.3983015561103821, "rewards/combined_reward/mean": 0.6125, "rewards/combined_reward/std": 0.3983015727996826, "sampling/importance_sampling_ratio/max": 1.8317672908306122, "sampling/importance_sampling_ratio/mean": 0.48074495911598203, "sampling/importance_sampling_ratio/min": 0.0045582325871396275, "sampling/sampling_logp_difference/max": 1.3460673189163208, "sampling/sampling_logp_difference/mean": 0.019111527167260646, "step": 25, "step_time": 10.766132144235307 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.045, "completions/max_length": 2697.8, "completions/max_terminated_length": 2434.96, "completions/mean_length": 1066.4775, "completions/mean_terminated_length": 922.5773754882813, "completions/min_length": 221.4, "completions/min_terminated_length": 221.4, "entropy": 0.11148266345262528, "epoch": 0.02, "frac_reward_zero_std": 0.83, "grad_norm": 0.12825042088739647, "learning_rate": 4.902000000000001e-06, "loss": -0.0055, "num_tokens": 844186.0, "reward": 0.7275, "reward_std": 0.3752095079421997, "rewards/combined_reward/mean": 0.7275, "rewards/combined_reward/std": 0.37520951986312867, "sampling/importance_sampling_ratio/max": 1.9092405343055725, "sampling/importance_sampling_ratio/mean": 0.39522121667861937, "sampling/importance_sampling_ratio/min": 0.0015749186025379913, "sampling/sampling_logp_difference/max": 2.5645344924926756, "sampling/sampling_logp_difference/mean": 0.018453369028866292, "step": 50, "step_time": 12.97097958703991 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.06, "completions/max_length": 3219.6, "completions/max_terminated_length": 2764.32, "completions/mean_length": 1319.6225, "completions/mean_terminated_length": 1149.2359936523437, "completions/min_length": 302.64, "completions/min_terminated_length": 302.64, "entropy": 0.11579328149557114, "epoch": 0.03, "frac_reward_zero_std": 0.74, "grad_norm": 0.024401731480704746, "learning_rate": 4.852e-06, "loss": 0.0148, "num_tokens": 1425675.0, "reward": 0.6675, "reward_std": 0.41027594327926636, "rewards/combined_reward/mean": 0.6675, "rewards/combined_reward/std": 0.41027595520019533, "sampling/importance_sampling_ratio/max": 1.7265777337551116, "sampling/importance_sampling_ratio/mean": 0.3491537272930145, "sampling/importance_sampling_ratio/min": 0.00037046234127728893, "sampling/sampling_logp_difference/max": 1.6775047159194947, "sampling/sampling_logp_difference/mean": 0.01777696244418621, "step": 75, "step_time": 15.33587351476075 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.1125, "completions/max_length": 3506.36, "completions/max_terminated_length": 3002.44, "completions/mean_length": 1729.6625, "completions/mean_terminated_length": 1449.84732421875, "completions/min_length": 491.68, "completions/min_terminated_length": 491.68, "entropy": 0.1540939062833786, "epoch": 0.04, "frac_reward_zero_std": 0.8, "grad_norm": 0.08228206305537464, "learning_rate": 4.802000000000001e-06, "loss": -0.0105, "num_tokens": 2169952.0, "reward": 0.6775, "reward_std": 0.4352877688407898, "rewards/combined_reward/mean": 0.6775, "rewards/combined_reward/std": 0.4352877867221832, "sampling/importance_sampling_ratio/max": 1.56971524477005, "sampling/importance_sampling_ratio/mean": 0.2744499149173498, "sampling/importance_sampling_ratio/min": 0.0005504332532569833, "sampling/sampling_logp_difference/max": 1.4530884885787965, "sampling/sampling_logp_difference/mean": 0.0194063538312912, "step": 100, "step_time": 16.7000939743605 }, { "epoch": 0.04, "eval_bbeh_mini_clip_ratio/high_max": 0.0, "eval_bbeh_mini_clip_ratio/high_mean": 0.0, "eval_bbeh_mini_clip_ratio/low_mean": 0.0, "eval_bbeh_mini_clip_ratio/low_min": 0.0, "eval_bbeh_mini_clip_ratio/region_mean": 0.0, "eval_bbeh_mini_completions/clipped_ratio": 0.7395833333333334, "eval_bbeh_mini_completions/max_length": 4096.0, "eval_bbeh_mini_completions/max_terminated_length": 3763.3333333333335, "eval_bbeh_mini_completions/mean_length": 3705.025, "eval_bbeh_mini_completions/mean_terminated_length": 2606.099161783854, "eval_bbeh_mini_completions/min_length": 1289.8666666666666, "eval_bbeh_mini_completions/min_terminated_length": 1289.8666666666666, "eval_bbeh_mini_entropy": 0.1524992863337199, "eval_bbeh_mini_frac_reward_zero_std": 1.0, "eval_bbeh_mini_loss": 0.0, "eval_bbeh_mini_num_tokens": 2169952.0, "eval_bbeh_mini_reward": 0.05416666666666667, "eval_bbeh_mini_reward_std": 0.21779155731201172, "eval_bbeh_mini_rewards/combined_reward/mean": 0.05416666666666667, "eval_bbeh_mini_rewards/combined_reward/std": 0.21779155731201172, "eval_bbeh_mini_runtime": 596.1354, "eval_bbeh_mini_samples_per_second": 0.772, "eval_bbeh_mini_sampling/importance_sampling_ratio/max": 0.8687558025121689, "eval_bbeh_mini_sampling/importance_sampling_ratio/mean": 0.06784403653194507, "eval_bbeh_mini_sampling/importance_sampling_ratio/min": 8.061984779939653e-08, "eval_bbeh_mini_sampling/sampling_logp_difference/max": 8.711139980951945, "eval_bbeh_mini_sampling/sampling_logp_difference/mean": 0.017877593512336414, "eval_bbeh_mini_steps_per_second": 0.025, "step": 100 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0775, "completions/max_length": 2879.52, "completions/max_terminated_length": 2611.76, "completions/mean_length": 1327.9475, "completions/mean_terminated_length": 1132.0394360351563, "completions/min_length": 399.84, "completions/min_terminated_length": 399.84, "entropy": 0.14349204391241074, "epoch": 0.05, "frac_reward_zero_std": 0.83, "grad_norm": 0.0, "learning_rate": 4.752e-06, "loss": -0.005, "num_tokens": 2753323.0, "reward": 0.6925, "reward_std": 0.4231112098693848, "rewards/combined_reward/mean": 0.6925, "rewards/combined_reward/std": 0.4231112253665924, "sampling/importance_sampling_ratio/max": 1.7390555197000503, "sampling/importance_sampling_ratio/mean": 0.36329600095748904, "sampling/importance_sampling_ratio/min": 0.00048197544169198636, "sampling/sampling_logp_difference/max": 1.7171998643875122, "sampling/sampling_logp_difference/mean": 0.018923953399062155, "step": 125, "step_time": 13.94366284076823 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0775, "completions/max_length": 3160.4, "completions/max_terminated_length": 2977.04, "completions/mean_length": 1392.4725, "completions/mean_terminated_length": 1181.5446044921875, "completions/min_length": 301.28, "completions/min_terminated_length": 301.28, "entropy": 0.12247561484575271, "epoch": 0.06, "frac_reward_zero_std": 0.78, "grad_norm": 0.0, "learning_rate": 4.702e-06, "loss": 0.0017, "num_tokens": 3363864.0, "reward": 0.68, "reward_std": 0.3949478316307068, "rewards/combined_reward/mean": 0.68, "rewards/combined_reward/std": 0.39494784593582155, "sampling/importance_sampling_ratio/max": 1.7060644900798798, "sampling/importance_sampling_ratio/mean": 0.3686066856980324, "sampling/importance_sampling_ratio/min": 0.0008563839933964346, "sampling/sampling_logp_difference/max": 1.8964796733856202, "sampling/sampling_logp_difference/mean": 0.01836306780576706, "step": 150, "step_time": 15.306864518483636 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.2725, "completions/max_length": 3987.92, "completions/max_terminated_length": 3347.12, "completions/mean_length": 2243.0825, "completions/mean_terminated_length": 1530.6420288085938, "completions/min_length": 497.16, "completions/min_terminated_length": 497.16, "entropy": 0.1512809532880783, "epoch": 0.07, "frac_reward_zero_std": 0.83, "grad_norm": 0.045936406952480385, "learning_rate": 4.6520000000000005e-06, "loss": 0.0011, "num_tokens": 4313477.0, "reward": 0.555, "reward_std": 0.47118185997009276, "rewards/combined_reward/mean": 0.555, "rewards/combined_reward/std": 0.4711818790435791, "sampling/importance_sampling_ratio/max": 1.6039721596240997, "sampling/importance_sampling_ratio/mean": 0.24182027772068979, "sampling/importance_sampling_ratio/min": 1.4114104745956979e-05, "sampling/sampling_logp_difference/max": 1.867432246208191, "sampling/sampling_logp_difference/mean": 0.01894252996891737, "step": 175, "step_time": 19.262136509235717 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.2025, "completions/max_length": 3906.24, "completions/max_terminated_length": 3193.44, "completions/mean_length": 1929.675, "completions/mean_terminated_length": 1359.7752429199218, "completions/min_length": 465.56, "completions/min_terminated_length": 465.56, "entropy": 0.14882746517658232, "epoch": 0.08, "frac_reward_zero_std": 0.8, "grad_norm": 0.0, "learning_rate": 4.602e-06, "loss": -0.0122, "num_tokens": 5136739.0, "reward": 0.5175, "reward_std": 0.4535848546028137, "rewards/combined_reward/mean": 0.5175, "rewards/combined_reward/std": 0.45358487248420715, "sampling/importance_sampling_ratio/max": 1.4915108323097228, "sampling/importance_sampling_ratio/mean": 0.2906982895731926, "sampling/importance_sampling_ratio/min": 3.519004383520041e-05, "sampling/sampling_logp_difference/max": 1.5955763387680053, "sampling/sampling_logp_difference/mean": 0.018773170486092568, "step": 200, "step_time": 18.719789853200783 }, { "epoch": 0.08, "eval_bbeh_mini_clip_ratio/high_max": 0.0, "eval_bbeh_mini_clip_ratio/high_mean": 0.0, "eval_bbeh_mini_clip_ratio/low_mean": 0.0, "eval_bbeh_mini_clip_ratio/low_min": 0.0, "eval_bbeh_mini_clip_ratio/region_mean": 0.0, "eval_bbeh_mini_completions/clipped_ratio": 0.6270833333333333, "eval_bbeh_mini_completions/max_length": 4096.0, "eval_bbeh_mini_completions/max_terminated_length": 3887.733333333333, "eval_bbeh_mini_completions/mean_length": 3548.6833333333334, "eval_bbeh_mini_completions/mean_terminated_length": 2656.084822591146, "eval_bbeh_mini_completions/min_length": 913.6666666666666, "eval_bbeh_mini_completions/min_terminated_length": 913.6666666666666, "eval_bbeh_mini_entropy": 0.15292017062505087, "eval_bbeh_mini_frac_reward_zero_std": 1.0, "eval_bbeh_mini_loss": 0.0, "eval_bbeh_mini_num_tokens": 5136739.0, "eval_bbeh_mini_reward": 0.07708333333333334, "eval_bbeh_mini_reward_std": 0.2598266154527664, "eval_bbeh_mini_rewards/combined_reward/mean": 0.07708333333333334, "eval_bbeh_mini_rewards/combined_reward/std": 0.2598266154527664, "eval_bbeh_mini_runtime": 591.7141, "eval_bbeh_mini_samples_per_second": 0.777, "eval_bbeh_mini_sampling/importance_sampling_ratio/max": 0.852098998427391, "eval_bbeh_mini_sampling/importance_sampling_ratio/mean": 0.05244890290002028, "eval_bbeh_mini_sampling/importance_sampling_ratio/min": 7.981859031252172e-08, "eval_bbeh_mini_sampling/sampling_logp_difference/max": 11.834616295496623, "eval_bbeh_mini_sampling/sampling_logp_difference/mean": 0.01872136120994886, "eval_bbeh_mini_steps_per_second": 0.025, "step": 200 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.135, "completions/max_length": 3525.44, "completions/max_terminated_length": 3045.72, "completions/mean_length": 1643.7375, "completions/mean_terminated_length": 1264.1704541015624, "completions/min_length": 371.4, "completions/min_terminated_length": 371.4, "entropy": 0.1282264119386673, "epoch": 0.09, "frac_reward_zero_std": 0.84, "grad_norm": 0.1124547393454232, "learning_rate": 4.552000000000001e-06, "loss": 0.0014, "num_tokens": 5845702.0, "reward": 0.6075, "reward_std": 0.43211185932159424, "rewards/combined_reward/mean": 0.6075, "rewards/combined_reward/std": 0.43211187958717345, "sampling/importance_sampling_ratio/max": 1.658061490058899, "sampling/importance_sampling_ratio/mean": 0.3288004392385483, "sampling/importance_sampling_ratio/min": 4.2134360328986985e-05, "sampling/sampling_logp_difference/max": 1.9848644018173218, "sampling/sampling_logp_difference/mean": 0.01779163155704737, "step": 225, "step_time": 16.881787369804226 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 2305.72, "completions/max_terminated_length": 2012.0, "completions/mean_length": 924.5325, "completions/mean_terminated_length": 733.4018725585937, "completions/min_length": 207.84, "completions/min_terminated_length": 207.84, "entropy": 0.10919148057699203, "epoch": 0.1, "frac_reward_zero_std": 0.84, "grad_norm": 0.0, "learning_rate": 4.502e-06, "loss": -0.007, "num_tokens": 6264623.0, "reward": 0.6575, "reward_std": 0.4052075219154358, "rewards/combined_reward/mean": 0.6575, "rewards/combined_reward/std": 0.4052075397968292, "sampling/importance_sampling_ratio/max": 1.6363923168182373, "sampling/importance_sampling_ratio/mean": 0.4022238349914551, "sampling/importance_sampling_ratio/min": 0.0022062478293512554, "sampling/sampling_logp_difference/max": 1.6151433634757995, "sampling/sampling_logp_difference/mean": 0.018232530616223812, "step": 250, "step_time": 11.461080919522793 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.05, "completions/max_length": 2949.48, "completions/max_terminated_length": 2563.92, "completions/mean_length": 970.1825, "completions/mean_terminated_length": 806.3617028808594, "completions/min_length": 156.76, "completions/min_terminated_length": 156.76, "entropy": 0.11048085868358612, "epoch": 0.11, "frac_reward_zero_std": 0.83, "grad_norm": 3.6386375264247395, "learning_rate": 4.452e-06, "loss": 0.016, "num_tokens": 6704088.0, "reward": 0.6, "reward_std": 0.46177455902099607, "rewards/combined_reward/mean": 0.6, "rewards/combined_reward/std": 0.46177458167076113, "sampling/importance_sampling_ratio/max": 1.8420022463798522, "sampling/importance_sampling_ratio/mean": 0.43595110774040224, "sampling/importance_sampling_ratio/min": 0.009071319757722449, "sampling/sampling_logp_difference/max": 1.796406216621399, "sampling/sampling_logp_difference/mean": 0.01782512180507183, "step": 275, "step_time": 14.068046440040925 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.065, "completions/max_length": 1638.0, "completions/max_terminated_length": 831.84, "completions/mean_length": 545.8975, "completions/mean_terminated_length": 305.88154296875, "completions/min_length": 114.76, "completions/min_terminated_length": 114.76, "entropy": 0.09797917470335961, "epoch": 0.12, "frac_reward_zero_std": 0.75, "grad_norm": 4.025023044693862, "learning_rate": 4.402e-06, "loss": 0.0096, "num_tokens": 6972795.0, "reward": 0.61, "reward_std": 0.4501744627952576, "rewards/combined_reward/mean": 0.61, "rewards/combined_reward/std": 0.4501744878292084, "sampling/importance_sampling_ratio/max": 2.163278422355652, "sampling/importance_sampling_ratio/mean": 0.6990827405452729, "sampling/importance_sampling_ratio/min": 0.0394745109800715, "sampling/sampling_logp_difference/max": 1.8717621159553528, "sampling/sampling_logp_difference/mean": 0.01609978877007961, "step": 300, "step_time": 8.448729626161512 }, { "epoch": 0.12, "eval_bbeh_mini_clip_ratio/high_max": 0.0, "eval_bbeh_mini_clip_ratio/high_mean": 0.0, "eval_bbeh_mini_clip_ratio/low_mean": 0.0, "eval_bbeh_mini_clip_ratio/low_min": 0.0, "eval_bbeh_mini_clip_ratio/region_mean": 0.0, "eval_bbeh_mini_completions/clipped_ratio": 0.04791666666666667, "eval_bbeh_mini_completions/max_length": 3786.5333333333333, "eval_bbeh_mini_completions/max_terminated_length": 2642.9333333333334, "eval_bbeh_mini_completions/mean_length": 1121.0229166666666, "eval_bbeh_mini_completions/mean_terminated_length": 970.7762817382812, "eval_bbeh_mini_completions/min_length": 183.2, "eval_bbeh_mini_completions/min_terminated_length": 183.2, "eval_bbeh_mini_entropy": 0.13576203087965646, "eval_bbeh_mini_frac_reward_zero_std": 1.0, "eval_bbeh_mini_loss": 0.0, "eval_bbeh_mini_num_tokens": 6972795.0, "eval_bbeh_mini_reward": 0.13333333333333333, "eval_bbeh_mini_reward_std": 0.32803594271341957, "eval_bbeh_mini_rewards/combined_reward/mean": 0.13333333333333333, "eval_bbeh_mini_rewards/combined_reward/std": 0.32803594271341957, "eval_bbeh_mini_runtime": 322.2651, "eval_bbeh_mini_samples_per_second": 1.427, "eval_bbeh_mini_sampling/importance_sampling_ratio/max": 2.0537617444992065, "eval_bbeh_mini_sampling/importance_sampling_ratio/mean": 0.2999363958835602, "eval_bbeh_mini_sampling/importance_sampling_ratio/min": 0.0, "eval_bbeh_mini_sampling/sampling_logp_difference/max": 5.164472190539042, "eval_bbeh_mini_sampling/sampling_logp_difference/mean": 0.019927356950938703, "eval_bbeh_mini_steps_per_second": 0.047, "step": 300 } ], "logging_steps": 25, "max_steps": 2500, "num_input_tokens_seen": 6972795, "num_train_epochs": 1, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }