| { |
| "best_global_step": 300, |
| "best_metric": 0.13333333333333333, |
| "best_model_checkpoint": "/local2/asuvarna31/distractors/Qwen3-1.7B_Mar25-0950_qwen3_0.6b_micro_top2_Mar18-0250_10000/checkpoint-300", |
| "epoch": 0.12, |
| "eval_steps": 100, |
| "global_step": 300, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.025, |
| "completions/max_length": 2162.52, |
| "completions/max_terminated_length": 1872.8, |
| "completions/mean_length": 773.9575, |
| "completions/mean_terminated_length": 689.7016723632812, |
| "completions/min_length": 228.04, |
| "completions/min_terminated_length": 228.04, |
| "entropy": 0.13874716758728028, |
| "epoch": 0.01, |
| "frac_reward_zero_std": 0.7, |
| "grad_norm": 3.0590252022682956, |
| "learning_rate": 4.952e-06, |
| "loss": -0.0206, |
| "num_tokens": 362415.0, |
| "reward": 0.6125, |
| "reward_std": 0.3983015561103821, |
| "rewards/combined_reward/mean": 0.6125, |
| "rewards/combined_reward/std": 0.3983015727996826, |
| "sampling/importance_sampling_ratio/max": 1.8317672908306122, |
| "sampling/importance_sampling_ratio/mean": 0.48074495911598203, |
| "sampling/importance_sampling_ratio/min": 0.0045582325871396275, |
| "sampling/sampling_logp_difference/max": 1.3460673189163208, |
| "sampling/sampling_logp_difference/mean": 0.019111527167260646, |
| "step": 25, |
| "step_time": 10.766132144235307 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.045, |
| "completions/max_length": 2697.8, |
| "completions/max_terminated_length": 2434.96, |
| "completions/mean_length": 1066.4775, |
| "completions/mean_terminated_length": 922.5773754882813, |
| "completions/min_length": 221.4, |
| "completions/min_terminated_length": 221.4, |
| "entropy": 0.11148266345262528, |
| "epoch": 0.02, |
| "frac_reward_zero_std": 0.83, |
| "grad_norm": 0.12825042088739647, |
| "learning_rate": 4.902000000000001e-06, |
| "loss": -0.0055, |
| "num_tokens": 844186.0, |
| "reward": 0.7275, |
| "reward_std": 0.3752095079421997, |
| "rewards/combined_reward/mean": 0.7275, |
| "rewards/combined_reward/std": 0.37520951986312867, |
| "sampling/importance_sampling_ratio/max": 1.9092405343055725, |
| "sampling/importance_sampling_ratio/mean": 0.39522121667861937, |
| "sampling/importance_sampling_ratio/min": 0.0015749186025379913, |
| "sampling/sampling_logp_difference/max": 2.5645344924926756, |
| "sampling/sampling_logp_difference/mean": 0.018453369028866292, |
| "step": 50, |
| "step_time": 12.97097958703991 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.06, |
| "completions/max_length": 3219.6, |
| "completions/max_terminated_length": 2764.32, |
| "completions/mean_length": 1319.6225, |
| "completions/mean_terminated_length": 1149.2359936523437, |
| "completions/min_length": 302.64, |
| "completions/min_terminated_length": 302.64, |
| "entropy": 0.11579328149557114, |
| "epoch": 0.03, |
| "frac_reward_zero_std": 0.74, |
| "grad_norm": 0.024401731480704746, |
| "learning_rate": 4.852e-06, |
| "loss": 0.0148, |
| "num_tokens": 1425675.0, |
| "reward": 0.6675, |
| "reward_std": 0.41027594327926636, |
| "rewards/combined_reward/mean": 0.6675, |
| "rewards/combined_reward/std": 0.41027595520019533, |
| "sampling/importance_sampling_ratio/max": 1.7265777337551116, |
| "sampling/importance_sampling_ratio/mean": 0.3491537272930145, |
| "sampling/importance_sampling_ratio/min": 0.00037046234127728893, |
| "sampling/sampling_logp_difference/max": 1.6775047159194947, |
| "sampling/sampling_logp_difference/mean": 0.01777696244418621, |
| "step": 75, |
| "step_time": 15.33587351476075 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.1125, |
| "completions/max_length": 3506.36, |
| "completions/max_terminated_length": 3002.44, |
| "completions/mean_length": 1729.6625, |
| "completions/mean_terminated_length": 1449.84732421875, |
| "completions/min_length": 491.68, |
| "completions/min_terminated_length": 491.68, |
| "entropy": 0.1540939062833786, |
| "epoch": 0.04, |
| "frac_reward_zero_std": 0.8, |
| "grad_norm": 0.08228206305537464, |
| "learning_rate": 4.802000000000001e-06, |
| "loss": -0.0105, |
| "num_tokens": 2169952.0, |
| "reward": 0.6775, |
| "reward_std": 0.4352877688407898, |
| "rewards/combined_reward/mean": 0.6775, |
| "rewards/combined_reward/std": 0.4352877867221832, |
| "sampling/importance_sampling_ratio/max": 1.56971524477005, |
| "sampling/importance_sampling_ratio/mean": 0.2744499149173498, |
| "sampling/importance_sampling_ratio/min": 0.0005504332532569833, |
| "sampling/sampling_logp_difference/max": 1.4530884885787965, |
| "sampling/sampling_logp_difference/mean": 0.0194063538312912, |
| "step": 100, |
| "step_time": 16.7000939743605 |
| }, |
| { |
| "epoch": 0.04, |
| "eval_bbeh_mini_clip_ratio/high_max": 0.0, |
| "eval_bbeh_mini_clip_ratio/high_mean": 0.0, |
| "eval_bbeh_mini_clip_ratio/low_mean": 0.0, |
| "eval_bbeh_mini_clip_ratio/low_min": 0.0, |
| "eval_bbeh_mini_clip_ratio/region_mean": 0.0, |
| "eval_bbeh_mini_completions/clipped_ratio": 0.7395833333333334, |
| "eval_bbeh_mini_completions/max_length": 4096.0, |
| "eval_bbeh_mini_completions/max_terminated_length": 3763.3333333333335, |
| "eval_bbeh_mini_completions/mean_length": 3705.025, |
| "eval_bbeh_mini_completions/mean_terminated_length": 2606.099161783854, |
| "eval_bbeh_mini_completions/min_length": 1289.8666666666666, |
| "eval_bbeh_mini_completions/min_terminated_length": 1289.8666666666666, |
| "eval_bbeh_mini_entropy": 0.1524992863337199, |
| "eval_bbeh_mini_frac_reward_zero_std": 1.0, |
| "eval_bbeh_mini_loss": 0.0, |
| "eval_bbeh_mini_num_tokens": 2169952.0, |
| "eval_bbeh_mini_reward": 0.05416666666666667, |
| "eval_bbeh_mini_reward_std": 0.21779155731201172, |
| "eval_bbeh_mini_rewards/combined_reward/mean": 0.05416666666666667, |
| "eval_bbeh_mini_rewards/combined_reward/std": 0.21779155731201172, |
| "eval_bbeh_mini_runtime": 596.1354, |
| "eval_bbeh_mini_samples_per_second": 0.772, |
| "eval_bbeh_mini_sampling/importance_sampling_ratio/max": 0.8687558025121689, |
| "eval_bbeh_mini_sampling/importance_sampling_ratio/mean": 0.06784403653194507, |
| "eval_bbeh_mini_sampling/importance_sampling_ratio/min": 8.061984779939653e-08, |
| "eval_bbeh_mini_sampling/sampling_logp_difference/max": 8.711139980951945, |
| "eval_bbeh_mini_sampling/sampling_logp_difference/mean": 0.017877593512336414, |
| "eval_bbeh_mini_steps_per_second": 0.025, |
| "step": 100 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0775, |
| "completions/max_length": 2879.52, |
| "completions/max_terminated_length": 2611.76, |
| "completions/mean_length": 1327.9475, |
| "completions/mean_terminated_length": 1132.0394360351563, |
| "completions/min_length": 399.84, |
| "completions/min_terminated_length": 399.84, |
| "entropy": 0.14349204391241074, |
| "epoch": 0.05, |
| "frac_reward_zero_std": 0.83, |
| "grad_norm": 0.0, |
| "learning_rate": 4.752e-06, |
| "loss": -0.005, |
| "num_tokens": 2753323.0, |
| "reward": 0.6925, |
| "reward_std": 0.4231112098693848, |
| "rewards/combined_reward/mean": 0.6925, |
| "rewards/combined_reward/std": 0.4231112253665924, |
| "sampling/importance_sampling_ratio/max": 1.7390555197000503, |
| "sampling/importance_sampling_ratio/mean": 0.36329600095748904, |
| "sampling/importance_sampling_ratio/min": 0.00048197544169198636, |
| "sampling/sampling_logp_difference/max": 1.7171998643875122, |
| "sampling/sampling_logp_difference/mean": 0.018923953399062155, |
| "step": 125, |
| "step_time": 13.94366284076823 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0775, |
| "completions/max_length": 3160.4, |
| "completions/max_terminated_length": 2977.04, |
| "completions/mean_length": 1392.4725, |
| "completions/mean_terminated_length": 1181.5446044921875, |
| "completions/min_length": 301.28, |
| "completions/min_terminated_length": 301.28, |
| "entropy": 0.12247561484575271, |
| "epoch": 0.06, |
| "frac_reward_zero_std": 0.78, |
| "grad_norm": 0.0, |
| "learning_rate": 4.702e-06, |
| "loss": 0.0017, |
| "num_tokens": 3363864.0, |
| "reward": 0.68, |
| "reward_std": 0.3949478316307068, |
| "rewards/combined_reward/mean": 0.68, |
| "rewards/combined_reward/std": 0.39494784593582155, |
| "sampling/importance_sampling_ratio/max": 1.7060644900798798, |
| "sampling/importance_sampling_ratio/mean": 0.3686066856980324, |
| "sampling/importance_sampling_ratio/min": 0.0008563839933964346, |
| "sampling/sampling_logp_difference/max": 1.8964796733856202, |
| "sampling/sampling_logp_difference/mean": 0.01836306780576706, |
| "step": 150, |
| "step_time": 15.306864518483636 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.2725, |
| "completions/max_length": 3987.92, |
| "completions/max_terminated_length": 3347.12, |
| "completions/mean_length": 2243.0825, |
| "completions/mean_terminated_length": 1530.6420288085938, |
| "completions/min_length": 497.16, |
| "completions/min_terminated_length": 497.16, |
| "entropy": 0.1512809532880783, |
| "epoch": 0.07, |
| "frac_reward_zero_std": 0.83, |
| "grad_norm": 0.045936406952480385, |
| "learning_rate": 4.6520000000000005e-06, |
| "loss": 0.0011, |
| "num_tokens": 4313477.0, |
| "reward": 0.555, |
| "reward_std": 0.47118185997009276, |
| "rewards/combined_reward/mean": 0.555, |
| "rewards/combined_reward/std": 0.4711818790435791, |
| "sampling/importance_sampling_ratio/max": 1.6039721596240997, |
| "sampling/importance_sampling_ratio/mean": 0.24182027772068979, |
| "sampling/importance_sampling_ratio/min": 1.4114104745956979e-05, |
| "sampling/sampling_logp_difference/max": 1.867432246208191, |
| "sampling/sampling_logp_difference/mean": 0.01894252996891737, |
| "step": 175, |
| "step_time": 19.262136509235717 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.2025, |
| "completions/max_length": 3906.24, |
| "completions/max_terminated_length": 3193.44, |
| "completions/mean_length": 1929.675, |
| "completions/mean_terminated_length": 1359.7752429199218, |
| "completions/min_length": 465.56, |
| "completions/min_terminated_length": 465.56, |
| "entropy": 0.14882746517658232, |
| "epoch": 0.08, |
| "frac_reward_zero_std": 0.8, |
| "grad_norm": 0.0, |
| "learning_rate": 4.602e-06, |
| "loss": -0.0122, |
| "num_tokens": 5136739.0, |
| "reward": 0.5175, |
| "reward_std": 0.4535848546028137, |
| "rewards/combined_reward/mean": 0.5175, |
| "rewards/combined_reward/std": 0.45358487248420715, |
| "sampling/importance_sampling_ratio/max": 1.4915108323097228, |
| "sampling/importance_sampling_ratio/mean": 0.2906982895731926, |
| "sampling/importance_sampling_ratio/min": 3.519004383520041e-05, |
| "sampling/sampling_logp_difference/max": 1.5955763387680053, |
| "sampling/sampling_logp_difference/mean": 0.018773170486092568, |
| "step": 200, |
| "step_time": 18.719789853200783 |
| }, |
| { |
| "epoch": 0.08, |
| "eval_bbeh_mini_clip_ratio/high_max": 0.0, |
| "eval_bbeh_mini_clip_ratio/high_mean": 0.0, |
| "eval_bbeh_mini_clip_ratio/low_mean": 0.0, |
| "eval_bbeh_mini_clip_ratio/low_min": 0.0, |
| "eval_bbeh_mini_clip_ratio/region_mean": 0.0, |
| "eval_bbeh_mini_completions/clipped_ratio": 0.6270833333333333, |
| "eval_bbeh_mini_completions/max_length": 4096.0, |
| "eval_bbeh_mini_completions/max_terminated_length": 3887.733333333333, |
| "eval_bbeh_mini_completions/mean_length": 3548.6833333333334, |
| "eval_bbeh_mini_completions/mean_terminated_length": 2656.084822591146, |
| "eval_bbeh_mini_completions/min_length": 913.6666666666666, |
| "eval_bbeh_mini_completions/min_terminated_length": 913.6666666666666, |
| "eval_bbeh_mini_entropy": 0.15292017062505087, |
| "eval_bbeh_mini_frac_reward_zero_std": 1.0, |
| "eval_bbeh_mini_loss": 0.0, |
| "eval_bbeh_mini_num_tokens": 5136739.0, |
| "eval_bbeh_mini_reward": 0.07708333333333334, |
| "eval_bbeh_mini_reward_std": 0.2598266154527664, |
| "eval_bbeh_mini_rewards/combined_reward/mean": 0.07708333333333334, |
| "eval_bbeh_mini_rewards/combined_reward/std": 0.2598266154527664, |
| "eval_bbeh_mini_runtime": 591.7141, |
| "eval_bbeh_mini_samples_per_second": 0.777, |
| "eval_bbeh_mini_sampling/importance_sampling_ratio/max": 0.852098998427391, |
| "eval_bbeh_mini_sampling/importance_sampling_ratio/mean": 0.05244890290002028, |
| "eval_bbeh_mini_sampling/importance_sampling_ratio/min": 7.981859031252172e-08, |
| "eval_bbeh_mini_sampling/sampling_logp_difference/max": 11.834616295496623, |
| "eval_bbeh_mini_sampling/sampling_logp_difference/mean": 0.01872136120994886, |
| "eval_bbeh_mini_steps_per_second": 0.025, |
| "step": 200 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.135, |
| "completions/max_length": 3525.44, |
| "completions/max_terminated_length": 3045.72, |
| "completions/mean_length": 1643.7375, |
| "completions/mean_terminated_length": 1264.1704541015624, |
| "completions/min_length": 371.4, |
| "completions/min_terminated_length": 371.4, |
| "entropy": 0.1282264119386673, |
| "epoch": 0.09, |
| "frac_reward_zero_std": 0.84, |
| "grad_norm": 0.1124547393454232, |
| "learning_rate": 4.552000000000001e-06, |
| "loss": 0.0014, |
| "num_tokens": 5845702.0, |
| "reward": 0.6075, |
| "reward_std": 0.43211185932159424, |
| "rewards/combined_reward/mean": 0.6075, |
| "rewards/combined_reward/std": 0.43211187958717345, |
| "sampling/importance_sampling_ratio/max": 1.658061490058899, |
| "sampling/importance_sampling_ratio/mean": 0.3288004392385483, |
| "sampling/importance_sampling_ratio/min": 4.2134360328986985e-05, |
| "sampling/sampling_logp_difference/max": 1.9848644018173218, |
| "sampling/sampling_logp_difference/mean": 0.01779163155704737, |
| "step": 225, |
| "step_time": 16.881787369804226 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0625, |
| "completions/max_length": 2305.72, |
| "completions/max_terminated_length": 2012.0, |
| "completions/mean_length": 924.5325, |
| "completions/mean_terminated_length": 733.4018725585937, |
| "completions/min_length": 207.84, |
| "completions/min_terminated_length": 207.84, |
| "entropy": 0.10919148057699203, |
| "epoch": 0.1, |
| "frac_reward_zero_std": 0.84, |
| "grad_norm": 0.0, |
| "learning_rate": 4.502e-06, |
| "loss": -0.007, |
| "num_tokens": 6264623.0, |
| "reward": 0.6575, |
| "reward_std": 0.4052075219154358, |
| "rewards/combined_reward/mean": 0.6575, |
| "rewards/combined_reward/std": 0.4052075397968292, |
| "sampling/importance_sampling_ratio/max": 1.6363923168182373, |
| "sampling/importance_sampling_ratio/mean": 0.4022238349914551, |
| "sampling/importance_sampling_ratio/min": 0.0022062478293512554, |
| "sampling/sampling_logp_difference/max": 1.6151433634757995, |
| "sampling/sampling_logp_difference/mean": 0.018232530616223812, |
| "step": 250, |
| "step_time": 11.461080919522793 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.05, |
| "completions/max_length": 2949.48, |
| "completions/max_terminated_length": 2563.92, |
| "completions/mean_length": 970.1825, |
| "completions/mean_terminated_length": 806.3617028808594, |
| "completions/min_length": 156.76, |
| "completions/min_terminated_length": 156.76, |
| "entropy": 0.11048085868358612, |
| "epoch": 0.11, |
| "frac_reward_zero_std": 0.83, |
| "grad_norm": 3.6386375264247395, |
| "learning_rate": 4.452e-06, |
| "loss": 0.016, |
| "num_tokens": 6704088.0, |
| "reward": 0.6, |
| "reward_std": 0.46177455902099607, |
| "rewards/combined_reward/mean": 0.6, |
| "rewards/combined_reward/std": 0.46177458167076113, |
| "sampling/importance_sampling_ratio/max": 1.8420022463798522, |
| "sampling/importance_sampling_ratio/mean": 0.43595110774040224, |
| "sampling/importance_sampling_ratio/min": 0.009071319757722449, |
| "sampling/sampling_logp_difference/max": 1.796406216621399, |
| "sampling/sampling_logp_difference/mean": 0.01782512180507183, |
| "step": 275, |
| "step_time": 14.068046440040925 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.065, |
| "completions/max_length": 1638.0, |
| "completions/max_terminated_length": 831.84, |
| "completions/mean_length": 545.8975, |
| "completions/mean_terminated_length": 305.88154296875, |
| "completions/min_length": 114.76, |
| "completions/min_terminated_length": 114.76, |
| "entropy": 0.09797917470335961, |
| "epoch": 0.12, |
| "frac_reward_zero_std": 0.75, |
| "grad_norm": 4.025023044693862, |
| "learning_rate": 4.402e-06, |
| "loss": 0.0096, |
| "num_tokens": 6972795.0, |
| "reward": 0.61, |
| "reward_std": 0.4501744627952576, |
| "rewards/combined_reward/mean": 0.61, |
| "rewards/combined_reward/std": 0.4501744878292084, |
| "sampling/importance_sampling_ratio/max": 2.163278422355652, |
| "sampling/importance_sampling_ratio/mean": 0.6990827405452729, |
| "sampling/importance_sampling_ratio/min": 0.0394745109800715, |
| "sampling/sampling_logp_difference/max": 1.8717621159553528, |
| "sampling/sampling_logp_difference/mean": 0.01609978877007961, |
| "step": 300, |
| "step_time": 8.448729626161512 |
| }, |
| { |
| "epoch": 0.12, |
| "eval_bbeh_mini_clip_ratio/high_max": 0.0, |
| "eval_bbeh_mini_clip_ratio/high_mean": 0.0, |
| "eval_bbeh_mini_clip_ratio/low_mean": 0.0, |
| "eval_bbeh_mini_clip_ratio/low_min": 0.0, |
| "eval_bbeh_mini_clip_ratio/region_mean": 0.0, |
| "eval_bbeh_mini_completions/clipped_ratio": 0.04791666666666667, |
| "eval_bbeh_mini_completions/max_length": 3786.5333333333333, |
| "eval_bbeh_mini_completions/max_terminated_length": 2642.9333333333334, |
| "eval_bbeh_mini_completions/mean_length": 1121.0229166666666, |
| "eval_bbeh_mini_completions/mean_terminated_length": 970.7762817382812, |
| "eval_bbeh_mini_completions/min_length": 183.2, |
| "eval_bbeh_mini_completions/min_terminated_length": 183.2, |
| "eval_bbeh_mini_entropy": 0.13576203087965646, |
| "eval_bbeh_mini_frac_reward_zero_std": 1.0, |
| "eval_bbeh_mini_loss": 0.0, |
| "eval_bbeh_mini_num_tokens": 6972795.0, |
| "eval_bbeh_mini_reward": 0.13333333333333333, |
| "eval_bbeh_mini_reward_std": 0.32803594271341957, |
| "eval_bbeh_mini_rewards/combined_reward/mean": 0.13333333333333333, |
| "eval_bbeh_mini_rewards/combined_reward/std": 0.32803594271341957, |
| "eval_bbeh_mini_runtime": 322.2651, |
| "eval_bbeh_mini_samples_per_second": 1.427, |
| "eval_bbeh_mini_sampling/importance_sampling_ratio/max": 2.0537617444992065, |
| "eval_bbeh_mini_sampling/importance_sampling_ratio/mean": 0.2999363958835602, |
| "eval_bbeh_mini_sampling/importance_sampling_ratio/min": 0.0, |
| "eval_bbeh_mini_sampling/sampling_logp_difference/max": 5.164472190539042, |
| "eval_bbeh_mini_sampling/sampling_logp_difference/mean": 0.019927356950938703, |
| "eval_bbeh_mini_steps_per_second": 0.047, |
| "step": 300 |
| } |
| ], |
| "logging_steps": 25, |
| "max_steps": 2500, |
| "num_input_tokens_seen": 6972795, |
| "num_train_epochs": 1, |
| "save_steps": 100, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 0.0, |
| "train_batch_size": 4, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|