diff --git "a/trainer_state.json" "b/trainer_state.json" --- "a/trainer_state.json" +++ "b/trainer_state.json" @@ -2,9 +2,9 @@ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, - "epoch": 0.00075, + "epoch": 0.003, "eval_steps": 500, - "global_step": 75, + "global_step": 300, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, @@ -16,41 +16,41 @@ "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, - "completions/max_length": 3.0, - "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.75, - "completions/mean_terminated_length": 2.75, + "completions/max_length": 8.0, + "completions/max_terminated_length": 8.0, + "completions/mean_length": 2.5625, + "completions/mean_terminated_length": 2.5625, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.8766089752316475, + "entropy": 0.8400783389806747, "epoch": 1e-05, - "frac_reward_zero_std": 0.75, - "grad_norm": 0.00977164227515459, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0, "kl": 0.0, "learning_rate": 0.0, "loss": 0.0, - "num_tokens": 41130.0, - "reward": 2.075000047683716, - "reward_std": 1.008032202720642, + "num_tokens": 51438.0, + "reward": 1.5750000476837158, + "reward_std": 1.4312187433242798, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.75, - "rewards/probe_completion_length/std": 0.4399413466453552, + "rewards/probe_completion_length/mean": 1.625, + "rewards/probe_completion_length/std": 1.4312187433242798, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.8125, - "rewards/probe_shaping_dominance/std": 0.3965577781200409, - "rewards/probe_terminal_raw/mean": 0.1875, - "rewards/probe_terminal_raw/std": 0.3965577781200409, - "rewards/rollout_reward_func/mean": -0.625, - "rewards/rollout_reward_func/std": 0.7931155562400818, - "sampling/importance_sampling_ratio/max": 1.4458240270614624, - "sampling/importance_sampling_ratio/mean": 0.8427327871322632, - "sampling/importance_sampling_ratio/min": 0.452865332365036, - "sampling/sampling_logp_difference/max": 0.3974947929382324, - "sampling/sampling_logp_difference/mean": 0.08604969829320908, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.0456675291061401, + "sampling/importance_sampling_ratio/mean": 0.8575431704521179, + "sampling/importance_sampling_ratio/min": 0.5433069467544556, + "sampling/sampling_logp_difference/max": 0.4106518030166626, + "sampling/sampling_logp_difference/mean": 0.07245150208473206, "step": 1, - "step_time": 10.943891547999556 + "step_time": 11.059172731000217 }, { "clip_ratio/high_max": 0.0, @@ -58,14 +58,14 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 0.8766089752316475, + "entropy": 0.8400783389806747, "epoch": 2e-05, - "grad_norm": 0.009746627882122993, + "grad_norm": 0.0, "kl": 0.0, "learning_rate": 2.2857142857142855e-07, "loss": 0.0, "step": 2, - "step_time": 5.863016629001322 + "step_time": 6.07740226399801 }, { "clip_ratio/high_max": 0.0, @@ -76,39 +76,39 @@ "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.84375, - "completions/mean_terminated_length": 2.84375, + "completions/mean_length": 2.8125, + "completions/mean_terminated_length": 2.8125, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.6090607978403568, + "entropy": 0.7734263241291046, "epoch": 3e-05, "frac_reward_zero_std": 1.0, - "grad_norm": 1.7606014807824977e-05, - "kl": 0.002607578739684868, + "grad_norm": 0.0, + "kl": 0.0, "learning_rate": 4.571428571428571e-07, "loss": 0.0, - "num_tokens": 83246.0, - "reward": 2.293750047683716, - "reward_std": 1.035167932510376, + "num_tokens": 99159.0, + "reward": 1.7625000476837158, + "reward_std": 0.3965577781200409, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.84375, - "rewards/probe_completion_length/std": 0.3689020276069641, + "rewards/probe_completion_length/mean": 1.8125, + "rewards/probe_completion_length/std": 0.3965577781200409, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.75, - "rewards/probe_shaping_dominance/std": 0.4399413466453552, - "rewards/probe_terminal_raw/mean": 0.25, - "rewards/probe_terminal_raw/std": 0.4399413466453552, - "rewards/rollout_reward_func/mean": -0.5, - "rewards/rollout_reward_func/std": 0.8798826932907104, - "sampling/importance_sampling_ratio/max": 1.640177845954895, - "sampling/importance_sampling_ratio/mean": 0.9333716630935669, - "sampling/importance_sampling_ratio/min": 0.47254422307014465, - "sampling/sampling_logp_difference/max": 0.5935717821121216, - "sampling/sampling_logp_difference/mean": 0.0694335401058197, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.0850459337234497, + "sampling/importance_sampling_ratio/mean": 0.8818035125732422, + "sampling/importance_sampling_ratio/min": 0.6340073347091675, + "sampling/sampling_logp_difference/max": 0.315462589263916, + "sampling/sampling_logp_difference/mean": 0.06536750495433807, "step": 3, - "step_time": 10.9592392880013 + "step_time": 11.278225346995896 }, { "clip_ratio/high_max": 0.0, @@ -116,14 +116,14 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 0.6121835336089134, + "entropy": 0.7734263241291046, "epoch": 4e-05, - "grad_norm": 7.779162842780352e-05, - "kl": 0.005520817290744162, + "grad_norm": 0.0, + "kl": 0.0, "learning_rate": 6.857142857142857e-07, "loss": 0.0, "step": 4, - "step_time": 5.935810445001152 + "step_time": 5.904026553995209 }, { "clip_ratio/high_max": 0.0, @@ -134,24 +134,24 @@ "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.46875, - "completions/mean_terminated_length": 2.46875, + "completions/mean_length": 2.71875, + "completions/mean_terminated_length": 2.71875, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.8703878000378609, + "entropy": 0.7801894694566727, "epoch": 5e-05, "frac_reward_zero_std": 1.0, - "grad_norm": 9.640563075663522e-05, - "kl": 0.006076000264101822, + "grad_norm": 0.0, + "kl": 0.0, "learning_rate": 9.142857142857142e-07, "loss": 0.0, - "num_tokens": 131563.0, - "reward": 1.4187500476837158, - "reward_std": 0.507007360458374, + "num_tokens": 148168.0, + "reward": 1.6687500476837158, + "reward_std": 0.45680341124534607, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.46875, - "rewards/probe_completion_length/std": 0.507007360458374, + "rewards/probe_completion_length/mean": 1.71875, + "rewards/probe_completion_length/std": 0.45680341124534607, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, "rewards/probe_shaping_dominance/mean": 1.0, @@ -160,13 +160,13 @@ "rewards/probe_terminal_raw/std": 0.0, "rewards/rollout_reward_func/mean": -1.0, "rewards/rollout_reward_func/std": 0.0, - "sampling/importance_sampling_ratio/max": 1.9647347927093506, - "sampling/importance_sampling_ratio/mean": 0.9198578596115112, - "sampling/importance_sampling_ratio/min": 0.5797430872917175, - "sampling/sampling_logp_difference/max": 0.7410016059875488, - "sampling/sampling_logp_difference/mean": 0.0826396569609642, + "sampling/importance_sampling_ratio/max": 1.526421070098877, + "sampling/importance_sampling_ratio/mean": 0.9378703832626343, + "sampling/importance_sampling_ratio/min": 0.6182330846786499, + "sampling/sampling_logp_difference/max": 0.8640813827514648, + "sampling/sampling_logp_difference/mean": 0.09040169417858124, "step": 5, - "step_time": 10.165990399998918 + "step_time": 10.348131929999 }, { "clip_ratio/high_max": 0.0, @@ -174,14 +174,14 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 0.8728083595633507, + "entropy": 0.7801894694566727, "epoch": 6e-05, - "grad_norm": 7.622271368745714e-05, - "kl": 0.009481642691298475, + "grad_norm": 0.0, + "kl": 0.0, "learning_rate": 1.1428571428571428e-06, "loss": 0.0, "step": 6, - "step_time": 6.0723176140008945 + "step_time": 6.946818038999481 }, { "clip_ratio/high_max": 0.0, @@ -190,56 +190,56 @@ "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, - "completions/max_length": 3.0, - "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.46875, - "completions/mean_terminated_length": 2.46875, + "completions/max_length": 7.0, + "completions/max_terminated_length": 7.0, + "completions/mean_length": 3.03125, + "completions/mean_terminated_length": 3.03125, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 1.0045497044920921, + "entropy": 0.6854325383901596, "epoch": 7e-05, - "frac_reward_zero_std": 1.0, - "grad_norm": 7.399460446322337e-05, - "kl": 0.006289539747740491, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.006476345006376505, + "kl": 0.0, "learning_rate": 1.3714285714285715e-06, "loss": 0.0, - "num_tokens": 180273.0, - "reward": 1.4187500476837158, - "reward_std": 0.507007360458374, + "num_tokens": 195423.0, + "reward": 2.1062498092651367, + "reward_std": 1.167002558708191, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.46875, - "rewards/probe_completion_length/std": 0.507007360458374, + "rewards/probe_completion_length/mean": 2.09375, + "rewards/probe_completion_length/std": 1.1175830364227295, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 1.0, - "rewards/probe_shaping_dominance/std": 0.0, - "rewards/probe_terminal_raw/mean": 0.0, - "rewards/probe_terminal_raw/std": 0.0, - "rewards/rollout_reward_func/mean": -1.0, - "rewards/rollout_reward_func/std": 0.0, - "sampling/importance_sampling_ratio/max": 1.3054357767105103, - "sampling/importance_sampling_ratio/mean": 0.8570933938026428, - "sampling/importance_sampling_ratio/min": 0.5681248903274536, - "sampling/sampling_logp_difference/max": 0.44519925117492676, - "sampling/sampling_logp_difference/mean": 0.09668958187103271, + "rewards/probe_shaping_dominance/mean": 0.96875, + "rewards/probe_shaping_dominance/std": 0.1767766922712326, + "rewards/probe_terminal_raw/mean": 0.03125, + "rewards/probe_terminal_raw/std": 0.1767766922712326, + "rewards/rollout_reward_func/mean": -0.9375, + "rewards/rollout_reward_func/std": 0.3535533845424652, + "sampling/importance_sampling_ratio/max": 1.9736851453781128, + "sampling/importance_sampling_ratio/mean": 0.8826993107795715, + "sampling/importance_sampling_ratio/min": 0.16903544962406158, + "sampling/sampling_logp_difference/max": 1.3518052101135254, + "sampling/sampling_logp_difference/mean": 0.09547412395477295, "step": 7, - "step_time": 11.251088656998036 + "step_time": 10.242166022000674 }, { - "clip_ratio/high_max": 0.0, - "clip_ratio/high_mean": 0.0, + "clip_ratio/high_max": 0.02083333395421505, + "clip_ratio/high_mean": 0.010416666977107525, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.0, - "entropy": 1.006740152835846, + "clip_ratio/region_mean": 0.010416666977107525, + "entropy": 0.6963466256856918, "epoch": 8e-05, - "grad_norm": 3.747232403839007e-05, - "kl": 0.0050201611193188, + "grad_norm": 0.0007595560164190829, + "kl": 0.012291169143281877, "learning_rate": 1.6e-06, "loss": 0.0, "step": 8, - "step_time": 6.059573506999186 + "step_time": 5.998965344997487 }, { "clip_ratio/high_max": 0.0, @@ -250,39 +250,39 @@ "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.90625, - "completions/mean_terminated_length": 2.90625, - "completions/min_length": 2.0, - "completions/min_terminated_length": 2.0, - "entropy": 0.6934512332081795, + "completions/mean_length": 3.0, + "completions/mean_terminated_length": 3.0, + "completions/min_length": 3.0, + "completions/min_terminated_length": 3.0, + "entropy": 0.6401678249239922, "epoch": 9e-05, "frac_reward_zero_std": 1.0, - "grad_norm": 3.45512708008755e-05, - "kl": 0.005398767949372996, + "grad_norm": 2.222989860456437e-05, + "kl": 0.0027450696452433476, "learning_rate": 1.8285714285714284e-06, "loss": 0.0, - "num_tokens": 226316.0, - "reward": 2.356250047683716, - "reward_std": 0.9791166186332703, + "num_tokens": 238781.0, + "reward": 1.9500000476837158, + "reward_std": 0.0, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.90625, - "rewards/probe_completion_length/std": 0.2961445748806, + "rewards/probe_completion_length/mean": 2.0, + "rewards/probe_completion_length/std": 0.0, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.75, - "rewards/probe_shaping_dominance/std": 0.4399413466453552, - "rewards/probe_terminal_raw/mean": 0.25, - "rewards/probe_terminal_raw/std": 0.4399413466453552, - "rewards/rollout_reward_func/mean": -0.5, - "rewards/rollout_reward_func/std": 0.8798826932907104, - "sampling/importance_sampling_ratio/max": 1.4297953844070435, - "sampling/importance_sampling_ratio/mean": 0.9057049751281738, - "sampling/importance_sampling_ratio/min": 0.47415363788604736, - "sampling/sampling_logp_difference/max": 0.6755725145339966, - "sampling/sampling_logp_difference/mean": 0.07361993193626404, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.2344462871551514, + "sampling/importance_sampling_ratio/mean": 0.8851175904273987, + "sampling/importance_sampling_ratio/min": 0.5345703959465027, + "sampling/sampling_logp_difference/max": 0.5086061358451843, + "sampling/sampling_logp_difference/mean": 0.06150691583752632, "step": 9, - "step_time": 9.991546349998316 + "step_time": 10.399385558001086 }, { "clip_ratio/high_max": 0.0, @@ -290,14 +290,14 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 0.6940568909049034, + "entropy": 0.6489881873130798, "epoch": 0.0001, - "grad_norm": 2.127706648025196e-05, - "kl": 0.0029271601816276416, + "grad_norm": 5.47774470760487e-05, + "kl": 0.005339258659660118, "learning_rate": 2.057142857142857e-06, "loss": 0.0, "step": 10, - "step_time": 6.432610926998677 + "step_time": 6.213306221998209 }, { "clip_ratio/high_max": 0.0, @@ -312,35 +312,35 @@ "completions/mean_terminated_length": 2.78125, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.6507774442434311, + "entropy": 0.6336817592382431, "epoch": 0.00011, "frac_reward_zero_std": 0.75, - "grad_norm": 0.0026587501633912325, - "kl": 0.0030539491679064668, + "grad_norm": 0.0054480223916471004, + "kl": 0.0008345261200020104, "learning_rate": 2.2857142857142856e-06, "loss": -0.0, - "num_tokens": 269819.0, - "reward": 2.356250047683716, - "reward_std": 1.160071611404419, + "num_tokens": 281810.0, + "reward": 1.9187500476837158, + "reward_std": 0.7822372913360596, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, "rewards/probe_completion_length/mean": 1.78125, "rewards/probe_completion_length/std": 0.420013427734375, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.6875, - "rewards/probe_shaping_dominance/std": 0.4709290862083435, - "rewards/probe_terminal_raw/mean": 0.3125, - "rewards/probe_terminal_raw/std": 0.4709290862083435, - "rewards/rollout_reward_func/mean": -0.375, - "rewards/rollout_reward_func/std": 0.941858172416687, - "sampling/importance_sampling_ratio/max": 1.1657392978668213, - "sampling/importance_sampling_ratio/mean": 0.9005649089813232, - "sampling/importance_sampling_ratio/min": 0.7608628273010254, - "sampling/sampling_logp_difference/max": 0.29668641090393066, - "sampling/sampling_logp_difference/mean": 0.05268556624650955, + "rewards/probe_shaping_dominance/mean": 0.90625, + "rewards/probe_shaping_dominance/std": 0.2961445748806, + "rewards/probe_terminal_raw/mean": 0.09375, + "rewards/probe_terminal_raw/std": 0.2961445748806, + "rewards/rollout_reward_func/mean": -0.8125, + "rewards/rollout_reward_func/std": 0.5922891497612, + "sampling/importance_sampling_ratio/max": 1.6787108182907104, + "sampling/importance_sampling_ratio/mean": 0.8936471939086914, + "sampling/importance_sampling_ratio/min": 0.5765784978866577, + "sampling/sampling_logp_difference/max": 0.5861668586730957, + "sampling/sampling_logp_difference/mean": 0.06395299732685089, "step": 11, - "step_time": 10.194988582000406 + "step_time": 10.046140308000759 }, { "clip_ratio/high_max": 0.0, @@ -348,14 +348,14 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 0.6534814164042473, + "entropy": 0.6370653584599495, "epoch": 0.00012, - "grad_norm": 0.0026218171697109938, - "kl": 0.0028509022927494243, + "grad_norm": 0.005797144025564194, + "kl": 0.0016152820803654322, "learning_rate": 2.5142857142857142e-06, "loss": -0.0, "step": 12, - "step_time": 5.727766669999255 + "step_time": 5.868836872001339 }, { "clip_ratio/high_max": 0.0, @@ -366,39 +366,39 @@ "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.59375, - "completions/mean_terminated_length": 2.59375, + "completions/mean_length": 2.78125, + "completions/mean_terminated_length": 2.78125, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.9608507007360458, + "entropy": 0.6840376108884811, "epoch": 0.00013, "frac_reward_zero_std": 1.0, - "grad_norm": 6.196741742314771e-05, - "kl": 0.006144683692127728, + "grad_norm": 2.0243625840521418e-05, + "kl": 0.0036721347541970317, "learning_rate": 2.742857142857143e-06, "loss": 0.0, - "num_tokens": 315178.0, - "reward": 2.043750047683716, - "reward_std": 1.201058030128479, + "num_tokens": 329969.0, + "reward": 1.7312500476837158, + "reward_std": 0.420013427734375, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.59375, - "rewards/probe_completion_length/std": 0.49899089336395264, + "rewards/probe_completion_length/mean": 1.78125, + "rewards/probe_completion_length/std": 0.420013427734375, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.75, - "rewards/probe_shaping_dominance/std": 0.4399413466453552, - "rewards/probe_terminal_raw/mean": 0.25, - "rewards/probe_terminal_raw/std": 0.4399413466453552, - "rewards/rollout_reward_func/mean": -0.5, - "rewards/rollout_reward_func/std": 0.8798826932907104, - "sampling/importance_sampling_ratio/max": 1.196762204170227, - "sampling/importance_sampling_ratio/mean": 0.86090487241745, - "sampling/importance_sampling_ratio/min": 0.4875930845737457, - "sampling/sampling_logp_difference/max": 0.40385901927948, - "sampling/sampling_logp_difference/mean": 0.09211455285549164, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.2268524169921875, + "sampling/importance_sampling_ratio/mean": 0.9003363847732544, + "sampling/importance_sampling_ratio/min": 0.5451527833938599, + "sampling/sampling_logp_difference/max": 0.5136758089065552, + "sampling/sampling_logp_difference/mean": 0.06247905641794205, "step": 13, - "step_time": 10.002985979000186 + "step_time": 10.74419506999584 }, { "clip_ratio/high_max": 0.0, @@ -406,72 +406,72 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 0.9843811690807343, + "entropy": 0.6921080499887466, "epoch": 0.00014, - "grad_norm": 9.995475556934252e-05, - "kl": 0.0112989693225245, + "grad_norm": 6.911743548698723e-05, + "kl": 0.007093713042195304, "learning_rate": 2.9714285714285716e-06, "loss": 0.0, "step": 14, - "step_time": 6.480481466999663 + "step_time": 6.484958697003094 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.02083333395421505, + "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.02083333395421505, + "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.375, - "completions/mean_terminated_length": 2.375, + "completions/mean_length": 2.78125, + "completions/mean_terminated_length": 2.78125, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.8333694264292717, + "entropy": 0.7193514481186867, "epoch": 0.00015, - "frac_reward_zero_std": 0.75, - "grad_norm": 0.009402290917932987, - "kl": 0.003834348764939932, + "frac_reward_zero_std": 1.0, + "grad_norm": 1.1802055269072298e-05, + "kl": 0.001129702115576947, "learning_rate": 3.2e-06, "loss": 0.0, - "num_tokens": 360159.0, - "reward": 1.3875000476837158, - "reward_std": 0.6690146923065186, + "num_tokens": 378690.0, + "reward": 1.7312500476837158, + "reward_std": 0.420013427734375, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.375, - "rewards/probe_completion_length/std": 0.49186936020851135, + "rewards/probe_completion_length/mean": 1.78125, + "rewards/probe_completion_length/std": 0.420013427734375, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.96875, - "rewards/probe_shaping_dominance/std": 0.1767766922712326, - "rewards/probe_terminal_raw/mean": 0.03125, - "rewards/probe_terminal_raw/std": 0.1767766922712326, - "rewards/rollout_reward_func/mean": -0.9375, - "rewards/rollout_reward_func/std": 0.3535533845424652, - "sampling/importance_sampling_ratio/max": 2.0241074562072754, - "sampling/importance_sampling_ratio/mean": 0.9765468835830688, - "sampling/importance_sampling_ratio/min": 0.40592315793037415, - "sampling/sampling_logp_difference/max": 0.8091045618057251, - "sampling/sampling_logp_difference/mean": 0.09295991063117981, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.6583240032196045, + "sampling/importance_sampling_ratio/mean": 0.9662915468215942, + "sampling/importance_sampling_ratio/min": 0.763291597366333, + "sampling/sampling_logp_difference/max": 0.6004593372344971, + "sampling/sampling_logp_difference/mean": 0.06859122216701508, "step": 15, - "step_time": 10.550640546000068 + "step_time": 10.628934043001209 }, { - "clip_ratio/high_max": 0.02083333395421505, - "clip_ratio/high_mean": 0.010416666977107525, - "clip_ratio/low_mean": 0.012500000186264515, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.02291666716337204, - "entropy": 0.8196478858590126, + "clip_ratio/region_mean": 0.0, + "entropy": 0.7239196375012398, "epoch": 0.00016, - "grad_norm": 0.001830586465075612, - "kl": 0.008265510034107137, + "grad_norm": 1.3546254194807261e-05, + "kl": 0.001586953027981508, "learning_rate": 3.428571428571428e-06, "loss": 0.0, "step": 16, - "step_time": 5.979319029999715 + "step_time": 5.975834984001267 }, { "clip_ratio/high_max": 0.0, @@ -480,41 +480,41 @@ "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, - "completions/max_length": 8.0, - "completions/max_terminated_length": 8.0, - "completions/mean_length": 2.875, - "completions/mean_terminated_length": 2.875, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.46875, + "completions/mean_terminated_length": 2.46875, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.7344488576054573, + "entropy": 0.9238218814134598, "epoch": 0.00017, - "frac_reward_zero_std": 0.75, - "grad_norm": 0.004971999675035477, - "kl": 0.00169508293402032, + "frac_reward_zero_std": 1.0, + "grad_norm": 3.5807555832434446e-05, + "kl": 0.004726857401692541, "learning_rate": 3.657142857142857e-06, "loss": 0.0, - "num_tokens": 402339.0, - "reward": 2.2624998092651367, - "reward_std": 1.59510338306427, + "num_tokens": 426711.0, + "reward": 1.4187500476837158, + "reward_std": 0.507007360458374, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.9375, - "rewards/probe_completion_length/std": 1.3663583993911743, + "rewards/probe_completion_length/mean": 1.46875, + "rewards/probe_completion_length/std": 0.507007360458374, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.8125, - "rewards/probe_shaping_dominance/std": 0.3965577781200409, - "rewards/probe_terminal_raw/mean": 0.1875, - "rewards/probe_terminal_raw/std": 0.3965577781200409, - "rewards/rollout_reward_func/mean": -0.625, - "rewards/rollout_reward_func/std": 0.7931155562400818, - "sampling/importance_sampling_ratio/max": 1.4009569883346558, - "sampling/importance_sampling_ratio/mean": 0.8987216353416443, - "sampling/importance_sampling_ratio/min": 0.4638045132160187, - "sampling/sampling_logp_difference/max": 0.7497167587280273, - "sampling/sampling_logp_difference/mean": 0.08023187518119812, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.2269541025161743, + "sampling/importance_sampling_ratio/mean": 0.8787311315536499, + "sampling/importance_sampling_ratio/min": 0.5107928514480591, + "sampling/sampling_logp_difference/max": 0.5426488518714905, + "sampling/sampling_logp_difference/mean": 0.08957700431346893, "step": 17, - "step_time": 10.03037292999852 + "step_time": 10.636119067996333 }, { "clip_ratio/high_max": 0.0, @@ -522,14 +522,14 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 0.7358419224619865, + "entropy": 0.9311410710215569, "epoch": 0.00018, - "grad_norm": 0.005262928549200296, - "kl": 0.0035523743881640257, + "grad_norm": 4.843952410737984e-05, + "kl": 0.0039593383044120856, "learning_rate": 3.885714285714286e-06, "loss": 0.0, "step": 18, - "step_time": 6.99632274600026 + "step_time": 6.45704991400271 }, { "clip_ratio/high_max": 0.0, @@ -540,39 +540,39 @@ "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.75, - "completions/mean_terminated_length": 2.75, + "completions/mean_length": 2.40625, + "completions/mean_terminated_length": 2.40625, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.6966657862067223, + "entropy": 0.9205264896154404, "epoch": 0.00019, "frac_reward_zero_std": 1.0, - "grad_norm": 0.0001658419641898945, - "kl": 0.020315399326136685, + "grad_norm": 2.6991318009095266e-05, + "kl": 0.005098032517707907, "learning_rate": 4.114285714285714e-06, "loss": 0.0, - "num_tokens": 452253.0, - "reward": 1.7000000476837158, - "reward_std": 0.4399413466453552, + "num_tokens": 476260.0, + "reward": 1.3875000476837158, + "reward_std": 0.504016101360321, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.75, - "rewards/probe_completion_length/std": 0.4399413466453552, - "rewards/probe_invalid_count/mean": 0.0, - "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_completion_length/mean": 1.40625, + "rewards/probe_completion_length/std": 0.49899089336395264, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, "rewards/probe_shaping_dominance/mean": 1.0, "rewards/probe_shaping_dominance/std": 0.0, "rewards/probe_terminal_raw/mean": 0.0, "rewards/probe_terminal_raw/std": 0.0, "rewards/rollout_reward_func/mean": -1.0, "rewards/rollout_reward_func/std": 0.0, - "sampling/importance_sampling_ratio/max": 1.3721214532852173, - "sampling/importance_sampling_ratio/mean": 0.857242226600647, - "sampling/importance_sampling_ratio/min": 0.32355910539627075, - "sampling/sampling_logp_difference/max": 1.2377636432647705, - "sampling/sampling_logp_difference/mean": 0.09668726474046707, + "sampling/importance_sampling_ratio/max": 1.1448806524276733, + "sampling/importance_sampling_ratio/mean": 0.873583197593689, + "sampling/importance_sampling_ratio/min": 0.5131767988204956, + "sampling/sampling_logp_difference/max": 0.6054301261901855, + "sampling/sampling_logp_difference/mean": 0.08943168818950653, "step": 19, - "step_time": 10.249966756000504 + "step_time": 10.410437912003545 }, { "clip_ratio/high_max": 0.0, @@ -580,14 +580,14 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 0.7012157067656517, + "entropy": 0.9188544452190399, "epoch": 0.0002, - "grad_norm": 2.9285800337675028e-05, - "kl": 0.003729396459675627, + "grad_norm": 2.9249089493532665e-05, + "kl": 0.00348761334316805, "learning_rate": 4.342857142857142e-06, "loss": 0.0, "step": 20, - "step_time": 6.159007310000561 + "step_time": 6.143518736002079 }, { "clip_ratio/high_max": 0.0, @@ -596,56 +596,56 @@ "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, - "completions/max_length": 8.0, - "completions/max_terminated_length": 8.0, - "completions/mean_length": 2.875, - "completions/mean_terminated_length": 2.875, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.84375, + "completions/mean_terminated_length": 2.84375, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.8007383048534393, + "entropy": 0.6722570210695267, "epoch": 0.00021, - "frac_reward_zero_std": 0.75, - "grad_norm": 0.007845139130949974, - "kl": 0.00453781802980302, + "frac_reward_zero_std": 0.5, + "grad_norm": 0.01012302003800869, + "kl": 0.009901609308144543, "learning_rate": 4.571428571428571e-06, - "loss": 0.0, - "num_tokens": 498950.0, - "reward": 2.1687498092651367, - "reward_std": 1.4308664798736572, + "loss": -0.0, + "num_tokens": 519927.0, + "reward": 2.231250047683716, + "reward_std": 0.9913944005966187, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.90625, - "rewards/probe_completion_length/std": 1.201058030128479, + "rewards/probe_completion_length/mean": 1.84375, + "rewards/probe_completion_length/std": 0.3689020276069641, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.84375, - "rewards/probe_shaping_dominance/std": 0.3689020276069641, - "rewards/probe_terminal_raw/mean": 0.15625, - "rewards/probe_terminal_raw/std": 0.3689020276069641, - "rewards/rollout_reward_func/mean": -0.6875, - "rewards/rollout_reward_func/std": 0.7378040552139282, - "sampling/importance_sampling_ratio/max": 1.7632538080215454, - "sampling/importance_sampling_ratio/mean": 0.9100350141525269, - "sampling/importance_sampling_ratio/min": 0.24061019718647003, - "sampling/sampling_logp_difference/max": 1.3275805711746216, - "sampling/sampling_logp_difference/mean": 0.08635358512401581, + "rewards/probe_shaping_dominance/mean": 0.78125, + "rewards/probe_shaping_dominance/std": 0.420013427734375, + "rewards/probe_terminal_raw/mean": 0.21875, + "rewards/probe_terminal_raw/std": 0.420013427734375, + "rewards/rollout_reward_func/mean": -0.5625, + "rewards/rollout_reward_func/std": 0.84002685546875, + "sampling/importance_sampling_ratio/max": 1.2477000951766968, + "sampling/importance_sampling_ratio/mean": 0.9216253161430359, + "sampling/importance_sampling_ratio/min": 0.6353219151496887, + "sampling/sampling_logp_difference/max": 0.462948203086853, + "sampling/sampling_logp_difference/mean": 0.0612877756357193, "step": 21, - "step_time": 9.962191802000234 + "step_time": 10.465017245000126 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_mean": 0.012500000186264515, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.010416666977107525, - "entropy": 0.8003072440624237, + "clip_ratio/region_mean": 0.012500000186264515, + "entropy": 0.6736566424369812, "epoch": 0.00022, - "grad_norm": 0.005664248485118151, - "kl": 0.008983593537777779, + "grad_norm": 0.007845910266041756, + "kl": 0.01028646872509853, "learning_rate": 4.8e-06, - "loss": 0.0, + "loss": -0.0, "step": 22, - "step_time": 6.554617122002128 + "step_time": 6.385594672996376 }, { "clip_ratio/high_max": 0.0, @@ -656,54 +656,54 @@ "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, - "completions/mean_length": 3.0, - "completions/mean_terminated_length": 3.0, - "completions/min_length": 3.0, - "completions/min_terminated_length": 3.0, - "entropy": 0.6100832298398018, + "completions/mean_length": 2.6875, + "completions/mean_terminated_length": 2.6875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.8278574831783772, "epoch": 0.00023, - "frac_reward_zero_std": 0.75, - "grad_norm": 0.007147330790758133, - "kl": 0.011804845751612447, + "frac_reward_zero_std": 1.0, + "grad_norm": 5.582312951446511e-05, + "kl": 0.005553377578507934, "learning_rate": 5.0285714285714285e-06, - "loss": -0.0, - "num_tokens": 546931.0, - "reward": 2.325000047683716, - "reward_std": 0.7931155562400818, + "loss": 0.0, + "num_tokens": 568175.0, + "reward": 1.6375000476837158, + "reward_std": 0.4709290862083435, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 2.0, - "rewards/probe_completion_length/std": 0.0, + "rewards/probe_completion_length/mean": 1.6875, + "rewards/probe_completion_length/std": 0.4709290862083435, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.8125, - "rewards/probe_shaping_dominance/std": 0.3965577781200409, - "rewards/probe_terminal_raw/mean": 0.1875, - "rewards/probe_terminal_raw/std": 0.3965577781200409, - "rewards/rollout_reward_func/mean": -0.625, - "rewards/rollout_reward_func/std": 0.7931155562400818, - "sampling/importance_sampling_ratio/max": 1.5701907873153687, - "sampling/importance_sampling_ratio/mean": 0.9152559041976929, - "sampling/importance_sampling_ratio/min": 0.38235926628112793, - "sampling/sampling_logp_difference/max": 0.8201756477355957, - "sampling/sampling_logp_difference/mean": 0.06971260905265808, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.3277029991149902, + "sampling/importance_sampling_ratio/mean": 0.8968680500984192, + "sampling/importance_sampling_ratio/min": 0.6297081708908081, + "sampling/sampling_logp_difference/max": 0.6801514625549316, + "sampling/sampling_logp_difference/mean": 0.08738863468170166, "step": 23, - "step_time": 9.90423563099921 + "step_time": 10.24965080399852 }, { - "clip_ratio/high_max": 0.02083333395421505, - "clip_ratio/high_mean": 0.010416666977107525, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.010416666977107525, - "entropy": 0.6199251338839531, + "clip_ratio/region_mean": 0.0, + "entropy": 0.8206844255328178, "epoch": 0.00024, - "grad_norm": 0.005858343094587326, - "kl": 0.016530382781638764, + "grad_norm": 3.3745935070328414e-05, + "kl": 0.004957256046054681, "learning_rate": 5.257142857142857e-06, - "loss": -0.0, + "loss": 0.0, "step": 24, - "step_time": 5.902607746000285 + "step_time": 6.033321787002933 }, { "clip_ratio/high_max": 0.0, @@ -714,39 +714,39 @@ "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.84375, - "completions/mean_terminated_length": 2.84375, + "completions/mean_length": 2.78125, + "completions/mean_terminated_length": 2.78125, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.5921763628721237, + "entropy": 0.6828285604715347, "epoch": 0.00025, - "frac_reward_zero_std": 0.75, - "grad_norm": 0.0020523809362202883, - "kl": 0.002616291645608726, + "frac_reward_zero_std": 1.0, + "grad_norm": 3.153899888275191e-05, + "kl": 0.0025460530912368995, "learning_rate": 5.485714285714286e-06, "loss": 0.0, - "num_tokens": 592263.0, - "reward": 2.731250047683716, - "reward_std": 1.2110878229141235, + "num_tokens": 616476.0, + "reward": 1.7312500476837158, + "reward_std": 0.420013427734375, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.84375, - "rewards/probe_completion_length/std": 0.3689020276069641, + "rewards/probe_completion_length/mean": 1.78125, + "rewards/probe_completion_length/std": 0.420013427734375, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.53125, - "rewards/probe_shaping_dominance/std": 0.507007360458374, - "rewards/probe_terminal_raw/mean": 0.46875, - "rewards/probe_terminal_raw/std": 0.507007360458374, - "rewards/rollout_reward_func/mean": -0.0625, - "rewards/rollout_reward_func/std": 1.014014720916748, - "sampling/importance_sampling_ratio/max": 1.470768690109253, - "sampling/importance_sampling_ratio/mean": 0.9247093200683594, - "sampling/importance_sampling_ratio/min": 0.46212413907051086, - "sampling/sampling_logp_difference/max": 0.4592486619949341, - "sampling/sampling_logp_difference/mean": 0.06738743931055069, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.0664699077606201, + "sampling/importance_sampling_ratio/mean": 0.8564985394477844, + "sampling/importance_sampling_ratio/min": 0.5391273498535156, + "sampling/sampling_logp_difference/max": 0.40851259231567383, + "sampling/sampling_logp_difference/mean": 0.06989122927188873, "step": 25, - "step_time": 10.45240628099964 + "step_time": 10.793845786996826 }, { "clip_ratio/high_max": 0.0, @@ -754,14 +754,14 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 0.5830045342445374, + "entropy": 0.683635301887989, "epoch": 0.00026, - "grad_norm": 0.0027421230915933847, - "kl": 0.010621169898968219, + "grad_norm": 0.0001063640447682701, + "kl": 0.012343363827312714, "learning_rate": 5.7142857142857145e-06, "loss": 0.0, "step": 26, - "step_time": 5.986171178999939 + "step_time": 6.026963442000124 }, { "clip_ratio/high_max": 0.0, @@ -772,54 +772,54 @@ "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, - "completions/mean_length": 3.0, - "completions/mean_terminated_length": 3.0, - "completions/min_length": 3.0, - "completions/min_terminated_length": 3.0, - "entropy": 0.5842774957418442, + "completions/mean_length": 2.625, + "completions/mean_terminated_length": 2.625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.9264916479587555, "epoch": 0.00027, - "frac_reward_zero_std": 0.5, - "grad_norm": 0.00840095616877079, - "kl": 0.05193354899529368, + "frac_reward_zero_std": 1.0, + "grad_norm": 8.221685857279226e-05, + "kl": 0.01160298454351505, "learning_rate": 5.942857142857143e-06, "loss": 0.0, - "num_tokens": 636215.0, - "reward": 2.575000047683716, - "reward_std": 0.941858172416687, + "num_tokens": 663041.0, + "reward": 1.5750000476837158, + "reward_std": 0.49186936020851135, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 2.0, - "rewards/probe_completion_length/std": 0.0, + "rewards/probe_completion_length/mean": 1.625, + "rewards/probe_completion_length/std": 0.49186936020851135, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.6875, - "rewards/probe_shaping_dominance/std": 0.4709290862083435, - "rewards/probe_terminal_raw/mean": 0.3125, - "rewards/probe_terminal_raw/std": 0.4709290862083435, - "rewards/rollout_reward_func/mean": -0.375, - "rewards/rollout_reward_func/std": 0.941858172416687, - "sampling/importance_sampling_ratio/max": 1.1518341302871704, - "sampling/importance_sampling_ratio/mean": 0.9229466915130615, - "sampling/importance_sampling_ratio/min": 0.740210235118866, - "sampling/sampling_logp_difference/max": 0.23350971937179565, - "sampling/sampling_logp_difference/mean": 0.04789143055677414, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.4550175666809082, + "sampling/importance_sampling_ratio/mean": 0.8919216394424438, + "sampling/importance_sampling_ratio/min": 0.2783103287220001, + "sampling/sampling_logp_difference/max": 0.7940692901611328, + "sampling/sampling_logp_difference/mean": 0.09577842056751251, "step": 27, - "step_time": 9.939240472000165 + "step_time": 10.399097397999867 }, { - "clip_ratio/high_max": 0.0416666679084301, - "clip_ratio/high_mean": 0.02083333395421505, - "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.031250000931322575, - "entropy": 0.5928279720246792, + "clip_ratio/region_mean": 0.0, + "entropy": 0.9363134279847145, "epoch": 0.00028, - "grad_norm": 0.001339235925115645, - "kl": 0.07154650982192834, + "grad_norm": 0.00021746440324932337, + "kl": 0.038634598463204384, "learning_rate": 6.171428571428571e-06, - "loss": -0.0, + "loss": 0.0, "step": 28, - "step_time": 5.932902072002435 + "step_time": 6.575508214997171 }, { "clip_ratio/high_max": 0.0, @@ -828,41 +828,41 @@ "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, - "completions/max_length": 4.0, - "completions/max_terminated_length": 4.0, - "completions/mean_length": 2.34375, - "completions/mean_terminated_length": 2.34375, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.3125, + "completions/mean_terminated_length": 2.3125, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.9780827686190605, + "entropy": 0.9583756104111671, "epoch": 0.00029, "frac_reward_zero_std": 1.0, - "grad_norm": 6.672603194601834e-05, - "kl": 0.013599209080439323, + "grad_norm": 0.00010810867388499901, + "kl": 0.024504184257239103, "learning_rate": 6.4e-06, "loss": 0.0, - "num_tokens": 688661.0, - "reward": 1.3562500476837158, - "reward_std": 0.6652370095252991, + "num_tokens": 714798.0, + "reward": 1.2625000476837158, + "reward_std": 0.4709290862083435, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.34375, - "rewards/probe_completion_length/std": 0.5453246831893921, - "rewards/probe_invalid_count/mean": 0.0625, - "rewards/probe_invalid_count/std": 0.24593468010425568, + "rewards/probe_completion_length/mean": 1.3125, + "rewards/probe_completion_length/std": 0.4709290862083435, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, "rewards/probe_shaping_dominance/mean": 1.0, "rewards/probe_shaping_dominance/std": 0.0, "rewards/probe_terminal_raw/mean": 0.0, "rewards/probe_terminal_raw/std": 0.0, "rewards/rollout_reward_func/mean": -1.0, "rewards/rollout_reward_func/std": 0.0, - "sampling/importance_sampling_ratio/max": 1.0643420219421387, - "sampling/importance_sampling_ratio/mean": 0.8627969026565552, - "sampling/importance_sampling_ratio/min": 0.5205104351043701, - "sampling/sampling_logp_difference/max": 0.4734225273132324, - "sampling/sampling_logp_difference/mean": 0.0874757170677185, + "sampling/importance_sampling_ratio/max": 1.5010457038879395, + "sampling/importance_sampling_ratio/mean": 0.9024466276168823, + "sampling/importance_sampling_ratio/min": 0.24003513157367706, + "sampling/sampling_logp_difference/max": 1.3649718761444092, + "sampling/sampling_logp_difference/mean": 0.11732985079288483, "step": 29, - "step_time": 10.943690365000293 + "step_time": 10.90805224900032 }, { "clip_ratio/high_max": 0.0, @@ -870,14 +870,14 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 0.9700995087623596, + "entropy": 0.9661187306046486, "epoch": 0.0003, - "grad_norm": 8.524458826286718e-05, - "kl": 0.01646642265313858, + "grad_norm": 4.100173100596294e-05, + "kl": 0.005046289617894217, "learning_rate": 6.628571428571428e-06, "loss": 0.0, "step": 30, - "step_time": 6.289740224002344 + "step_time": 6.139430252998864 }, { "clip_ratio/high_max": 0.0, @@ -886,56 +886,56 @@ "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, - "completions/max_length": 3.0, - "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.8125, - "completions/mean_terminated_length": 2.8125, + "completions/max_length": 8.0, + "completions/max_terminated_length": 8.0, + "completions/mean_length": 3.0, + "completions/mean_terminated_length": 3.0, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.5977483242750168, + "entropy": 0.6211910024285316, "epoch": 0.00031, "frac_reward_zero_std": 0.75, - "grad_norm": 0.0054800924845039845, - "kl": 0.03657999965313863, + "grad_norm": 0.004734576214104891, + "kl": 0.021804270082157018, "learning_rate": 6.857142857142856e-06, "loss": 0.0, - "num_tokens": 734504.0, - "reward": 2.325000047683716, - "reward_std": 1.0998533964157104, + "num_tokens": 760640.0, + "reward": 2.0749998092651367, + "reward_std": 1.361924648284912, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.8125, - "rewards/probe_completion_length/std": 0.3965577781200409, + "rewards/probe_completion_length/mean": 2.0625, + "rewards/probe_completion_length/std": 1.3182954788208008, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.71875, - "rewards/probe_shaping_dominance/std": 0.45680341124534607, - "rewards/probe_terminal_raw/mean": 0.28125, - "rewards/probe_terminal_raw/std": 0.45680341124534607, - "rewards/rollout_reward_func/mean": -0.4375, - "rewards/rollout_reward_func/std": 0.9136068224906921, - "sampling/importance_sampling_ratio/max": 0.9752265214920044, - "sampling/importance_sampling_ratio/mean": 0.8748180866241455, - "sampling/importance_sampling_ratio/min": 0.5280144214630127, - "sampling/sampling_logp_difference/max": 0.5450412034988403, - "sampling/sampling_logp_difference/mean": 0.05546283721923828, + "rewards/probe_shaping_dominance/mean": 0.96875, + "rewards/probe_shaping_dominance/std": 0.1767766922712326, + "rewards/probe_terminal_raw/mean": 0.03125, + "rewards/probe_terminal_raw/std": 0.1767766922712326, + "rewards/rollout_reward_func/mean": -0.9375, + "rewards/rollout_reward_func/std": 0.3535533845424652, + "sampling/importance_sampling_ratio/max": 1.617272138595581, + "sampling/importance_sampling_ratio/mean": 0.938959002494812, + "sampling/importance_sampling_ratio/min": 0.7246662974357605, + "sampling/sampling_logp_difference/max": 0.5712299346923828, + "sampling/sampling_logp_difference/mean": 0.05821167677640915, "step": 31, - "step_time": 10.040044982999461 + "step_time": 10.732313114996941 }, { - "clip_ratio/high_max": 0.02083333395421505, - "clip_ratio/high_mean": 0.010416666977107525, - "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.012500000186264515, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.02083333395421505, - "entropy": 0.5946150161325932, + "clip_ratio/region_mean": 0.012500000186264515, + "entropy": 0.6255892366170883, "epoch": 0.00032, - "grad_norm": 0.00047032409929670393, - "kl": 0.06455633977139996, + "grad_norm": 0.002519609173759818, + "kl": 0.03869383437631768, "learning_rate": 7.085714285714285e-06, "loss": 0.0, "step": 32, - "step_time": 6.533442915998421 + "step_time": 6.090148466997562 }, { "clip_ratio/high_max": 0.0, @@ -946,24 +946,24 @@ "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.21875, - "completions/mean_terminated_length": 2.21875, + "completions/mean_length": 2.625, + "completions/mean_terminated_length": 2.625, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 1.0080943554639816, + "entropy": 0.8118936568498611, "epoch": 0.00033, "frac_reward_zero_std": 1.0, - "grad_norm": 3.053375257877633e-05, - "kl": 0.010350218828534707, + "grad_norm": 8.35604005260393e-05, + "kl": 0.018937013923277846, "learning_rate": 7.314285714285714e-06, "loss": 0.0, - "num_tokens": 784204.0, - "reward": 1.1687500476837158, - "reward_std": 0.4200134575366974, + "num_tokens": 809340.0, + "reward": 1.5750000476837158, + "reward_std": 0.49186936020851135, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.21875, - "rewards/probe_completion_length/std": 0.420013427734375, + "rewards/probe_completion_length/mean": 1.625, + "rewards/probe_completion_length/std": 0.49186936020851135, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, "rewards/probe_shaping_dominance/mean": 1.0, @@ -972,13 +972,13 @@ "rewards/probe_terminal_raw/std": 0.0, "rewards/rollout_reward_func/mean": -1.0, "rewards/rollout_reward_func/std": 0.0, - "sampling/importance_sampling_ratio/max": 1.6532065868377686, - "sampling/importance_sampling_ratio/mean": 0.8955996036529541, - "sampling/importance_sampling_ratio/min": 0.555946409702301, - "sampling/sampling_logp_difference/max": 0.6041266918182373, - "sampling/sampling_logp_difference/mean": 0.10231932997703552, + "sampling/importance_sampling_ratio/max": 1.808742642402649, + "sampling/importance_sampling_ratio/mean": 0.8965403437614441, + "sampling/importance_sampling_ratio/min": 0.4695906937122345, + "sampling/sampling_logp_difference/max": 0.6713973879814148, + "sampling/sampling_logp_difference/mean": 0.08081598579883575, "step": 33, - "step_time": 10.570013555000514 + "step_time": 11.075895337000475 }, { "clip_ratio/high_max": 0.0, @@ -986,188 +986,188 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 1.0019470378756523, + "entropy": 0.8101335242390633, "epoch": 0.00034, - "grad_norm": 2.8502141503849998e-05, - "kl": 0.007157980311603751, + "grad_norm": 5.702187627321109e-05, + "kl": 0.019410209737543482, "learning_rate": 7.542857142857142e-06, "loss": 0.0, "step": 34, - "step_time": 6.132537012999819 + "step_time": 6.524634418001369 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.02291666716337204, + "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.02291666716337204, + "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, - "completions/max_length": 3.0, - "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.71875, - "completions/mean_terminated_length": 2.71875, + "completions/max_length": 8.0, + "completions/max_terminated_length": 8.0, + "completions/mean_length": 3.03125, + "completions/mean_terminated_length": 3.03125, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.7035567462444305, + "entropy": 0.6599159687757492, "epoch": 0.00035, "frac_reward_zero_std": 0.75, - "grad_norm": 0.0019313328666612506, - "kl": 0.12925253533012437, + "grad_norm": 0.0038426010869443417, + "kl": 0.0753691944591992, "learning_rate": 7.771428571428572e-06, - "loss": -0.0, - "num_tokens": 830986.0, - "reward": 2.262500047683716, - "reward_std": 1.1482806205749512, + "loss": 0.0, + "num_tokens": 857176.0, + "reward": 2.1687498092651367, + "reward_std": 1.385043978691101, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.71875, - "rewards/probe_completion_length/std": 0.45680341124534607, - "rewards/probe_invalid_count/mean": 0.03125, - "rewards/probe_invalid_count/std": 0.1767766922712326, - "rewards/probe_shaping_dominance/mean": 0.71875, - "rewards/probe_shaping_dominance/std": 0.45680341124534607, - "rewards/probe_terminal_raw/mean": 0.28125, - "rewards/probe_terminal_raw/std": 0.45680341124534607, - "rewards/rollout_reward_func/mean": -0.4375, - "rewards/rollout_reward_func/std": 0.9136068224906921, - "sampling/importance_sampling_ratio/max": 1.0661519765853882, - "sampling/importance_sampling_ratio/mean": 0.8217430710792542, - "sampling/importance_sampling_ratio/min": 0.204800084233284, - "sampling/sampling_logp_difference/max": 1.4816503524780273, - "sampling/sampling_logp_difference/mean": 0.09921938180923462, + "rewards/probe_completion_length/mean": 2.09375, + "rewards/probe_completion_length/std": 1.304072380065918, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.9375, + "rewards/probe_shaping_dominance/std": 0.24593468010425568, + "rewards/probe_terminal_raw/mean": 0.0625, + "rewards/probe_terminal_raw/std": 0.24593468010425568, + "rewards/rollout_reward_func/mean": -0.875, + "rewards/rollout_reward_func/std": 0.49186936020851135, + "sampling/importance_sampling_ratio/max": 1.3117048740386963, + "sampling/importance_sampling_ratio/mean": 0.8893284201622009, + "sampling/importance_sampling_ratio/min": 0.4679924249649048, + "sampling/sampling_logp_difference/max": 0.5346801280975342, + "sampling/sampling_logp_difference/mean": 0.06689614057540894, "step": 35, - "step_time": 10.03484531599861 + "step_time": 10.305036647003362 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.02291666716337204, + "clip_ratio/low_mean": 0.04375000111758709, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.02291666716337204, - "entropy": 0.7101162374019623, + "clip_ratio/region_mean": 0.04375000111758709, + "entropy": 0.6635555773973465, "epoch": 0.00036, - "grad_norm": 0.0020328587852418423, - "kl": 0.10064423059520777, + "grad_norm": 0.0011747012613341212, + "kl": 0.13147676514927298, "learning_rate": 8e-06, "loss": -0.0, "step": 36, - "step_time": 6.561449165999875 + "step_time": 6.042067124002642 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.058333334513008595, + "clip_ratio/low_mean": 0.010416666977107525, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.058333334513008595, + "clip_ratio/region_mean": 0.010416666977107525, "completions/clipped_ratio": 0.0, - "completions/max_length": 3.0, - "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.59375, - "completions/mean_terminated_length": 2.59375, + "completions/max_length": 6.0, + "completions/max_terminated_length": 6.0, + "completions/mean_length": 2.96875, + "completions/mean_terminated_length": 2.96875, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.8379025869071484, + "entropy": 0.6612287536263466, "epoch": 0.00037, - "frac_reward_zero_std": 0.5, - "grad_norm": 0.002047101268544793, - "kl": 0.4796946058049798, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0005710122059099376, + "kl": 0.27994170751958336, "learning_rate": 7.99999999962976e-06, - "loss": -0.0001, - "num_tokens": 878912.0, - "reward": 1.6687500476837158, - "reward_std": 0.7718588709831238, + "loss": 0.0, + "num_tokens": 900229.0, + "reward": 2.356250047683716, + "reward_std": 1.0734140872955322, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.59375, - "rewards/probe_completion_length/std": 0.49899089336395264, + "rewards/probe_completion_length/mean": 1.96875, + "rewards/probe_completion_length/std": 0.6467972993850708, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.9375, - "rewards/probe_shaping_dominance/std": 0.24593468010425568, - "rewards/probe_terminal_raw/mean": 0.0625, - "rewards/probe_terminal_raw/std": 0.24593468010425568, - "rewards/rollout_reward_func/mean": -0.875, - "rewards/rollout_reward_func/std": 0.49186936020851135, - "sampling/importance_sampling_ratio/max": 1.027855396270752, - "sampling/importance_sampling_ratio/mean": 0.7403821349143982, - "sampling/importance_sampling_ratio/min": 0.20094381272792816, - "sampling/sampling_logp_difference/max": 1.4957327842712402, - "sampling/sampling_logp_difference/mean": 0.15929864346981049, + "rewards/probe_shaping_dominance/mean": 0.78125, + "rewards/probe_shaping_dominance/std": 0.420013427734375, + "rewards/probe_terminal_raw/mean": 0.21875, + "rewards/probe_terminal_raw/std": 0.420013427734375, + "rewards/rollout_reward_func/mean": -0.5625, + "rewards/rollout_reward_func/std": 0.84002685546875, + "sampling/importance_sampling_ratio/max": 1.33085298538208, + "sampling/importance_sampling_ratio/mean": 0.9053265452384949, + "sampling/importance_sampling_ratio/min": 0.3018966317176819, + "sampling/sampling_logp_difference/max": 0.954264760017395, + "sampling/sampling_logp_difference/mean": 0.07190588116645813, "step": 37, - "step_time": 10.421861329000421 + "step_time": 10.737445328000831 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.09166666865348816, - "clip_ratio/low_min": 0.02083333395421505, - "clip_ratio/region_mean": 0.09166666865348816, - "entropy": 0.8225769698619843, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.6657588593661785, "epoch": 0.00038, - "grad_norm": 0.0023972741328179836, - "kl": 0.7458103867247701, + "grad_norm": 0.013408876024186611, + "kl": 0.4735182789929695, "learning_rate": 7.99999999851904e-06, - "loss": -0.0001, + "loss": 0.0001, "step": 38, - "step_time": 6.042584625999552 + "step_time": 5.906282284999179 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.012500000186264515, + "clip_ratio/low_mean": 0.02083333395421505, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.012500000186264515, + "clip_ratio/region_mean": 0.02083333395421505, "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.6875, - "completions/mean_terminated_length": 2.6875, + "completions/mean_length": 2.90625, + "completions/mean_terminated_length": 2.90625, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.7016490623354912, + "entropy": 0.6484945714473724, "epoch": 0.00039, - "frac_reward_zero_std": 0.5, - "grad_norm": 0.0051078652031719685, - "kl": 0.3725941587081252, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.004464410245418549, + "kl": 0.35673816324560903, "learning_rate": 7.999999996667841e-06, - "loss": -0.0002, - "num_tokens": 926402.0, - "reward": 1.8875000476837158, - "reward_std": 0.9136068224906921, + "loss": -0.0, + "num_tokens": 948183.0, + "reward": 2.075000047683716, + "reward_std": 0.6599119901657104, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.6875, - "rewards/probe_completion_length/std": 0.4709290862083435, - "rewards/probe_invalid_count/mean": 0.0, - "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.875, - "rewards/probe_shaping_dominance/std": 0.33601075410842896, - "rewards/probe_terminal_raw/mean": 0.125, - "rewards/probe_terminal_raw/std": 0.33601075410842896, - "rewards/rollout_reward_func/mean": -0.75, - "rewards/rollout_reward_func/std": 0.6720215082168579, - "sampling/importance_sampling_ratio/max": 2.5818870067596436, - "sampling/importance_sampling_ratio/mean": 0.9834462404251099, - "sampling/importance_sampling_ratio/min": 0.6739128828048706, - "sampling/sampling_logp_difference/max": 1.015700340270996, - "sampling/sampling_logp_difference/mean": 0.09071232378482819, + "rewards/probe_completion_length/mean": 1.90625, + "rewards/probe_completion_length/std": 0.2961445748806, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, + "rewards/probe_shaping_dominance/mean": 0.90625, + "rewards/probe_shaping_dominance/std": 0.2961445748806, + "rewards/probe_terminal_raw/mean": 0.09375, + "rewards/probe_terminal_raw/std": 0.2961445748806, + "rewards/rollout_reward_func/mean": -0.8125, + "rewards/rollout_reward_func/std": 0.5922891497612, + "sampling/importance_sampling_ratio/max": 1.1827647686004639, + "sampling/importance_sampling_ratio/mean": 0.8997206687927246, + "sampling/importance_sampling_ratio/min": 0.4464786946773529, + "sampling/sampling_logp_difference/max": 0.7061750888824463, + "sampling/sampling_logp_difference/mean": 0.07010062038898468, "step": 39, - "step_time": 10.201964306000264 + "step_time": 10.68057268800294 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.04375000111758709, + "clip_ratio/low_mean": 0.031250000931322575, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.04375000111758709, - "entropy": 0.7204578444361687, + "clip_ratio/region_mean": 0.031250000931322575, + "entropy": 0.6486207321286201, "epoch": 0.0004, - "grad_norm": 0.0035937828943133354, - "kl": 0.380961946604657, + "grad_norm": 0.0022209053859114647, + "kl": 0.46453470387496054, "learning_rate": 7.999999994076165e-06, - "loss": -0.0002, + "loss": -0.0, "step": 40, - "step_time": 6.1126418210005795 + "step_time": 7.016006264999305 }, { "clip_ratio/high_max": 0.0, @@ -1176,41 +1176,41 @@ "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, - "completions/max_length": 7.0, - "completions/max_terminated_length": 7.0, - "completions/mean_length": 2.59375, - "completions/mean_terminated_length": 2.59375, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.84375, + "completions/mean_terminated_length": 2.84375, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.7181754857301712, + "entropy": 0.5532779470086098, "epoch": 0.00041, "frac_reward_zero_std": 1.0, - "grad_norm": 0.0032158580143004656, - "kl": 0.5504793294239789, + "grad_norm": 4.3166332034161314e-05, + "kl": 0.08521343817847082, "learning_rate": 7.999999990744006e-06, "loss": 0.0, - "num_tokens": 976326.0, - "reward": 1.6062500476837158, - "reward_std": 1.260040283203125, + "num_tokens": 991447.0, + "reward": 3.293750047683716, + "reward_std": 1.180742621421814, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.65625, - "rewards/probe_completion_length/std": 1.260040283203125, + "rewards/probe_completion_length/mean": 1.84375, + "rewards/probe_completion_length/std": 0.3689020276069641, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 1.0, - "rewards/probe_shaping_dominance/std": 0.0, - "rewards/probe_terminal_raw/mean": 0.0, - "rewards/probe_terminal_raw/std": 0.0, - "rewards/rollout_reward_func/mean": -1.0, - "rewards/rollout_reward_func/std": 0.0, - "sampling/importance_sampling_ratio/max": 1.2834391593933105, - "sampling/importance_sampling_ratio/mean": 0.8834752440452576, - "sampling/importance_sampling_ratio/min": 0.009724746458232403, - "sampling/sampling_logp_difference/max": 4.535632610321045, - "sampling/sampling_logp_difference/mean": 0.11896064877510071, + "rewards/probe_shaping_dominance/mean": 0.25, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.75, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": 0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.0786104202270508, + "sampling/importance_sampling_ratio/mean": 0.9027760624885559, + "sampling/importance_sampling_ratio/min": 0.4814170300960541, + "sampling/sampling_logp_difference/max": 0.5579321980476379, + "sampling/sampling_logp_difference/mean": 0.04839656874537468, "step": 41, - "step_time": 10.60360760599906 + "step_time": 10.06029906799813 }, { "clip_ratio/high_max": 0.0, @@ -1218,79 +1218,79 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 0.7254802733659744, + "entropy": 0.5597705021500587, "epoch": 0.00042, - "grad_norm": 0.005343083292245865, - "kl": 0.9199199170143402, + "grad_norm": 7.465948147000745e-05, + "kl": 0.0919022122034221, "learning_rate": 7.999999986671369e-06, "loss": 0.0, "step": 42, - "step_time": 6.086681632998989 + "step_time": 5.93805161900309 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.010416666977107525, + "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.6875, - "completions/mean_terminated_length": 2.6875, + "completions/mean_length": 2.5, + "completions/mean_terminated_length": 2.5, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.7109739929437637, + "entropy": 0.8421927690505981, "epoch": 0.00043, - "frac_reward_zero_std": 0.75, - "grad_norm": 0.0019174222834408283, - "kl": 0.9979303739964962, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0004577457730192691, + "kl": 0.09166453240914052, "learning_rate": 7.999999981858253e-06, - "loss": -0.0001, - "num_tokens": 1024501.0, - "reward": 2.450000047683716, - "reward_std": 1.319823980331421, + "loss": 0.0, + "num_tokens": 1039971.0, + "reward": 1.4500000476837158, + "reward_std": 0.5080004930496216, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.6875, - "rewards/probe_completion_length/std": 0.4709290862083435, + "rewards/probe_completion_length/mean": 1.5, + "rewards/probe_completion_length/std": 0.5080004930496216, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.59375, - "rewards/probe_shaping_dominance/std": 0.49899089336395264, - "rewards/probe_terminal_raw/mean": 0.40625, - "rewards/probe_terminal_raw/std": 0.49899089336395264, - "rewards/rollout_reward_func/mean": -0.1875, - "rewards/rollout_reward_func/std": 0.9979817867279053, - "sampling/importance_sampling_ratio/max": 2.3034539222717285, - "sampling/importance_sampling_ratio/mean": 1.0141327381134033, - "sampling/importance_sampling_ratio/min": 0.10541930049657822, - "sampling/sampling_logp_difference/max": 2.156667470932007, - "sampling/sampling_logp_difference/mean": 0.1373995542526245, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.2432236671447754, + "sampling/importance_sampling_ratio/mean": 0.845447838306427, + "sampling/importance_sampling_ratio/min": 0.2577609121799469, + "sampling/sampling_logp_difference/max": 1.228003740310669, + "sampling/sampling_logp_difference/mean": 0.10384337604045868, "step": 43, - "step_time": 10.50327422799728 + "step_time": 10.771515129998079 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.010416666977107525, - "entropy": 0.7114239484071732, + "clip_ratio/region_mean": 0.0, + "entropy": 0.8766651302576065, "epoch": 0.00044, - "grad_norm": 0.0017295810393989086, - "kl": 1.1500265896320343, + "grad_norm": 0.0008605438051745296, + "kl": 0.1548362478843046, "learning_rate": 7.999999976304658e-06, - "loss": -0.0001, + "loss": 0.0, "step": 44, - "step_time": 6.055206838999766 + "step_time": 6.052436936000959 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.0, + "clip_ratio/low_mean": 0.012500000186264515, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.0, + "clip_ratio/region_mean": 0.012500000186264515, "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, @@ -1298,50 +1298,50 @@ "completions/mean_terminated_length": 2.625, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.6414694786071777, + "entropy": 0.651808388531208, "epoch": 0.00045, "frac_reward_zero_std": 0.75, - "grad_norm": 0.0025684612337499857, - "kl": 0.405933300498873, + "grad_norm": 0.0012912065722048283, + "kl": 0.4913899615421542, "learning_rate": 7.999999970010581e-06, "loss": -0.0001, - "num_tokens": 1066496.0, - "reward": 2.512500047683716, - "reward_std": 1.4127871990203857, + "num_tokens": 1089788.0, + "reward": 2.012500047683716, + "reward_std": 1.1341474056243896, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, "rewards/probe_completion_length/mean": 1.625, "rewards/probe_completion_length/std": 0.49186936020851135, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.53125, - "rewards/probe_shaping_dominance/std": 0.507007360458374, - "rewards/probe_terminal_raw/mean": 0.46875, - "rewards/probe_terminal_raw/std": 0.507007360458374, - "rewards/rollout_reward_func/mean": -0.0625, - "rewards/rollout_reward_func/std": 1.014014720916748, - "sampling/importance_sampling_ratio/max": 2.0344650745391846, - "sampling/importance_sampling_ratio/mean": 0.9185701608657837, - "sampling/importance_sampling_ratio/min": 0.3526281416416168, - "sampling/sampling_logp_difference/max": 0.9392699599266052, - "sampling/sampling_logp_difference/mean": 0.06703778356313705, + "rewards/probe_shaping_dominance/mean": 0.78125, + "rewards/probe_shaping_dominance/std": 0.420013427734375, + "rewards/probe_terminal_raw/mean": 0.21875, + "rewards/probe_terminal_raw/std": 0.420013427734375, + "rewards/rollout_reward_func/mean": -0.5625, + "rewards/rollout_reward_func/std": 0.84002685546875, + "sampling/importance_sampling_ratio/max": 1.964327096939087, + "sampling/importance_sampling_ratio/mean": 0.9429373741149902, + "sampling/importance_sampling_ratio/min": 0.45201072096824646, + "sampling/sampling_logp_difference/max": 0.7543458938598633, + "sampling/sampling_logp_difference/mean": 0.08115933835506439, "step": 45, - "step_time": 10.408880783999848 + "step_time": 10.30191364899838 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_mean": 0.012500000186264515, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.010416666977107525, - "entropy": 0.6403752155601978, + "clip_ratio/region_mean": 0.012500000186264515, + "entropy": 0.6510747969150543, "epoch": 0.00046, - "grad_norm": 0.0011193460086360574, - "kl": 0.418248422909528, + "grad_norm": 0.0015278910286724567, + "kl": 0.46892713010311127, "learning_rate": 7.999999962976027e-06, "loss": -0.0001, "step": 46, - "step_time": 5.940715425000235 + "step_time": 6.073613009000837 }, { "clip_ratio/high_max": 0.0, @@ -1352,39 +1352,39 @@ "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.75, - "completions/mean_terminated_length": 2.75, + "completions/mean_length": 2.625, + "completions/mean_terminated_length": 2.625, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.5939470268785954, + "entropy": 0.7168305143713951, "epoch": 0.00047, - "frac_reward_zero_std": 0.75, - "grad_norm": 0.00029027138953097165, - "kl": 1.086835566908121, + "frac_reward_zero_std": 1.0, + "grad_norm": 5.2330131438793615e-05, + "kl": 0.09791750832391699, "learning_rate": 7.999999955200991e-06, - "loss": -0.0, - "num_tokens": 1115763.0, - "reward": 2.137500047683716, - "reward_std": 1.0606601238250732, + "loss": 0.0, + "num_tokens": 1140406.0, + "reward": 1.5750000476837158, + "reward_std": 0.49186936020851135, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.75, - "rewards/probe_completion_length/std": 0.4399413466453552, + "rewards/probe_completion_length/mean": 1.625, + "rewards/probe_completion_length/std": 0.49186936020851135, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.78125, - "rewards/probe_shaping_dominance/std": 0.420013427734375, - "rewards/probe_terminal_raw/mean": 0.21875, - "rewards/probe_terminal_raw/std": 0.420013427734375, - "rewards/rollout_reward_func/mean": -0.5625, - "rewards/rollout_reward_func/std": 0.84002685546875, - "sampling/importance_sampling_ratio/max": 1.3324123620986938, - "sampling/importance_sampling_ratio/mean": 0.921471357345581, - "sampling/importance_sampling_ratio/min": 0.3086128532886505, - "sampling/sampling_logp_difference/max": 1.1996221542358398, - "sampling/sampling_logp_difference/mean": 0.09517379105091095, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.1620327234268188, + "sampling/importance_sampling_ratio/mean": 0.8909596800804138, + "sampling/importance_sampling_ratio/min": 0.521927535533905, + "sampling/sampling_logp_difference/max": 0.5213262438774109, + "sampling/sampling_logp_difference/mean": 0.06901270151138306, "step": 47, - "step_time": 10.570694217000892 + "step_time": 11.32904220099772 }, { "clip_ratio/high_max": 0.0, @@ -1392,14 +1392,14 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 0.5917784459888935, + "entropy": 0.7062753215432167, "epoch": 0.00048, - "grad_norm": 0.00045079184928908944, - "kl": 1.1454527378082275, + "grad_norm": 5.481049811351113e-05, + "kl": 0.10177884640688717, "learning_rate": 7.999999946685478e-06, - "loss": -0.0, + "loss": 0.0, "step": 48, - "step_time": 6.084416185999544 + "step_time": 6.08483760800118 }, { "clip_ratio/high_max": 0.0, @@ -1408,41 +1408,41 @@ "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, - "completions/max_length": 3.0, - "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.6875, - "completions/mean_terminated_length": 2.6875, + "completions/max_length": 7.0, + "completions/max_terminated_length": 7.0, + "completions/mean_length": 2.75, + "completions/mean_terminated_length": 2.75, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.5497034415602684, + "entropy": 0.7744219973683357, "epoch": 0.00049, "frac_reward_zero_std": 1.0, - "grad_norm": 4.048119080835022e-05, - "kl": 1.0796112641692162, + "grad_norm": 0.00023119112302083522, + "kl": 0.05695398036914412, "learning_rate": 7.999999937429484e-06, "loss": 0.0, - "num_tokens": 1159887.0, - "reward": 2.637500047683716, - "reward_std": 1.3781123161315918, + "num_tokens": 1184107.0, + "reward": 2.262500047683716, + "reward_std": 1.574750304222107, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.6875, - "rewards/probe_completion_length/std": 0.4709290862083435, + "rewards/probe_completion_length/mean": 1.8125, + "rewards/probe_completion_length/std": 1.2296733856201172, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.5, - "rewards/probe_shaping_dominance/std": 0.5080004930496216, - "rewards/probe_terminal_raw/mean": 0.5, - "rewards/probe_terminal_raw/std": 0.5080004930496216, - "rewards/rollout_reward_func/mean": 0.0, - "rewards/rollout_reward_func/std": 1.0160009860992432, - "sampling/importance_sampling_ratio/max": 1.194502592086792, - "sampling/importance_sampling_ratio/mean": 0.8948264122009277, - "sampling/importance_sampling_ratio/min": 0.0, - "sampling/sampling_logp_difference/max": 1.9638302326202393, - "sampling/sampling_logp_difference/mean": 0.07986211776733398, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.0071394443511963, + "sampling/importance_sampling_ratio/mean": 0.8390346169471741, + "sampling/importance_sampling_ratio/min": 0.4063165485858917, + "sampling/sampling_logp_difference/max": 0.7753506898880005, + "sampling/sampling_logp_difference/mean": 0.0786946639418602, "step": 49, - "step_time": 10.586019360999671 + "step_time": 10.03044281899929 }, { "clip_ratio/high_max": 0.0, @@ -1450,57 +1450,57 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 0.5474356599152088, + "entropy": 0.7632701024413109, "epoch": 0.0005, - "grad_norm": 4.84514057461638e-05, - "kl": 1.0822610259056091, + "grad_norm": 0.0003675088519230485, + "kl": 0.08831967870355584, "learning_rate": 7.999999927433012e-06, "loss": 0.0, "step": 50, - "step_time": 6.64471124299871 + "step_time": 6.67380327900355 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.0, + "clip_ratio/region_mean": 0.010416666977107525, "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.625, - "completions/mean_terminated_length": 2.625, + "completions/mean_length": 2.75, + "completions/mean_terminated_length": 2.75, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.6383445039391518, + "entropy": 0.883178424090147, "epoch": 0.00051, - "frac_reward_zero_std": 1.0, - "grad_norm": 0.00015050763613544405, - "kl": 0.6388462577888276, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.004802894778549671, + "kl": 1.0498504750430584, "learning_rate": 7.99999991669606e-06, "loss": 0.0, - "num_tokens": 1206661.0, - "reward": 2.075000047683716, - "reward_std": 1.1845782995224, + "num_tokens": 1231279.0, + "reward": 1.8250000476837158, + "reward_std": 0.7071067690849304, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.625, - "rewards/probe_completion_length/std": 0.49186936020851135, + "rewards/probe_completion_length/mean": 1.75, + "rewards/probe_completion_length/std": 0.4399413466453552, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.75, - "rewards/probe_shaping_dominance/std": 0.4399413466453552, - "rewards/probe_terminal_raw/mean": 0.25, - "rewards/probe_terminal_raw/std": 0.4399413466453552, - "rewards/rollout_reward_func/mean": -0.5, - "rewards/rollout_reward_func/std": 0.8798826932907104, - "sampling/importance_sampling_ratio/max": 2.2058069705963135, - "sampling/importance_sampling_ratio/mean": 0.9211057424545288, - "sampling/importance_sampling_ratio/min": 0.5255441069602966, - "sampling/sampling_logp_difference/max": 0.8412450551986694, - "sampling/sampling_logp_difference/mean": 0.07937976717948914, + "rewards/probe_shaping_dominance/mean": 0.9375, + "rewards/probe_shaping_dominance/std": 0.24593468010425568, + "rewards/probe_terminal_raw/mean": 0.0625, + "rewards/probe_terminal_raw/std": 0.24593468010425568, + "rewards/rollout_reward_func/mean": -0.875, + "rewards/rollout_reward_func/std": 0.49186936020851135, + "sampling/importance_sampling_ratio/max": 1.3820379972457886, + "sampling/importance_sampling_ratio/mean": 0.6330314874649048, + "sampling/importance_sampling_ratio/min": 0.0, + "sampling/sampling_logp_difference/max": 3.0561718940734863, + "sampling/sampling_logp_difference/mean": 0.28779780864715576, "step": 51, - "step_time": 10.090468297998086 + "step_time": 10.563791698999921 }, { "clip_ratio/high_max": 0.0, @@ -1508,14 +1508,14 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 0.65125298127532, + "entropy": 0.8849975541234016, "epoch": 0.00052, - "grad_norm": 0.00012597418390214443, - "kl": 0.6565363313129637, + "grad_norm": 0.0024871043860912323, + "kl": 0.7585216974839568, "learning_rate": 7.999999905218627e-06, - "loss": 0.0, + "loss": -0.0, "step": 52, - "step_time": 6.536847638998552 + "step_time": 6.215853247000268 }, { "clip_ratio/high_max": 0.0, @@ -1526,112 +1526,112 @@ "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.875, - "completions/mean_terminated_length": 2.875, + "completions/mean_length": 2.46875, + "completions/mean_terminated_length": 2.46875, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.5926927104592323, + "entropy": 0.8856398165225983, "epoch": 0.00053, - "frac_reward_zero_std": 1.0, - "grad_norm": 0.00019273272482678294, - "kl": 0.5490526768262498, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0032466028351336718, + "kl": 0.22195444721728563, "learning_rate": 7.999999893000716e-06, - "loss": 0.0, - "num_tokens": 1247965.0, - "reward": 2.825000047683716, - "reward_std": 1.1845782995224, + "loss": -0.0, + "num_tokens": 1285108.0, + "reward": 1.5437500476837158, + "reward_std": 0.797551691532135, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.875, - "rewards/probe_completion_length/std": 0.33601075410842896, + "rewards/probe_completion_length/mean": 1.46875, + "rewards/probe_completion_length/std": 0.507007360458374, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.5, - "rewards/probe_shaping_dominance/std": 0.5080004930496216, - "rewards/probe_terminal_raw/mean": 0.5, - "rewards/probe_terminal_raw/std": 0.5080004930496216, - "rewards/rollout_reward_func/mean": 0.0, - "rewards/rollout_reward_func/std": 1.0160009860992432, - "sampling/importance_sampling_ratio/max": 1.0803444385528564, - "sampling/importance_sampling_ratio/mean": 0.8436357975006104, - "sampling/importance_sampling_ratio/min": 0.22206127643585205, - "sampling/sampling_logp_difference/max": 1.4294672012329102, - "sampling/sampling_logp_difference/mean": 0.08037947118282318, + "rewards/probe_shaping_dominance/mean": 0.9375, + "rewards/probe_shaping_dominance/std": 0.24593468010425568, + "rewards/probe_terminal_raw/mean": 0.0625, + "rewards/probe_terminal_raw/std": 0.24593468010425568, + "rewards/rollout_reward_func/mean": -0.875, + "rewards/rollout_reward_func/std": 0.49186936020851135, + "sampling/importance_sampling_ratio/max": 1.8507949113845825, + "sampling/importance_sampling_ratio/mean": 0.9760150909423828, + "sampling/importance_sampling_ratio/min": 0.4805029332637787, + "sampling/sampling_logp_difference/max": 0.6980669498443604, + "sampling/sampling_logp_difference/mean": 0.10727604478597641, "step": 53, - "step_time": 9.839941635998002 + "step_time": 11.183175942000162 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.0, - "entropy": 0.571772389113903, + "clip_ratio/region_mean": 0.010416666977107525, + "entropy": 0.8866911977529526, "epoch": 0.00054, - "grad_norm": 0.0002839839144144207, - "kl": 0.5748571505537257, + "grad_norm": 0.0019594912882894278, + "kl": 0.21692284429445863, "learning_rate": 7.999999880042326e-06, - "loss": 0.0, + "loss": -0.0, "step": 54, - "step_time": 6.453985008000927 + "step_time": 6.095816975001071 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.010416666977107525, + "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, - "completions/max_length": 3.0, - "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.71875, - "completions/mean_terminated_length": 2.71875, + "completions/max_length": 7.0, + "completions/max_terminated_length": 7.0, + "completions/mean_length": 2.8125, + "completions/mean_terminated_length": 2.8125, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.573297243565321, + "entropy": 0.8108381032943726, "epoch": 0.00055, "frac_reward_zero_std": 0.75, - "grad_norm": 0.003776031779125333, - "kl": 1.215886102989316, + "grad_norm": 0.003048208076506853, + "kl": 0.43219664352363907, "learning_rate": 7.999999866343456e-06, "loss": -0.0, - "num_tokens": 1295187.0, - "reward": 1.7312500476837158, - "reward_std": 0.6082431077957153, + "num_tokens": 1334379.0, + "reward": 2.6374998092651367, + "reward_std": 1.63504958152771, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.71875, - "rewards/probe_completion_length/std": 0.45680341124534607, + "rewards/probe_completion_length/mean": 1.875, + "rewards/probe_completion_length/std": 1.2115039825439453, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.96875, - "rewards/probe_shaping_dominance/std": 0.1767766922712326, - "rewards/probe_terminal_raw/mean": 0.03125, - "rewards/probe_terminal_raw/std": 0.1767766922712326, - "rewards/rollout_reward_func/mean": -0.9375, - "rewards/rollout_reward_func/std": 0.3535533845424652, - "sampling/importance_sampling_ratio/max": 2.5861928462982178, - "sampling/importance_sampling_ratio/mean": 0.8224544525146484, - "sampling/importance_sampling_ratio/min": 0.0271281935274601, - "sampling/sampling_logp_difference/max": 3.4792683124542236, - "sampling/sampling_logp_difference/mean": 0.2531231939792633, + "rewards/probe_shaping_dominance/mean": 0.59375, + "rewards/probe_shaping_dominance/std": 0.49899089336395264, + "rewards/probe_terminal_raw/mean": 0.40625, + "rewards/probe_terminal_raw/std": 0.49899089336395264, + "rewards/rollout_reward_func/mean": -0.1875, + "rewards/rollout_reward_func/std": 0.9979817867279053, + "sampling/importance_sampling_ratio/max": 1.2705219984054565, + "sampling/importance_sampling_ratio/mean": 0.7683707475662231, + "sampling/importance_sampling_ratio/min": 0.0, + "sampling/sampling_logp_difference/max": 1.6249732971191406, + "sampling/sampling_logp_difference/mean": 0.12966416776180267, "step": 55, - "step_time": 10.005798918000437 + "step_time": 10.185927998001716 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.0, - "entropy": 0.579718828201294, + "clip_ratio/region_mean": 0.010416666977107525, + "entropy": 0.7804929316043854, "epoch": 0.00056, - "grad_norm": 0.0032236159313470125, - "kl": 0.9808710217475891, + "grad_norm": 0.0009110283572226763, + "kl": 0.4785164334462024, "learning_rate": 7.999999851904105e-06, "loss": -0.0, "step": 56, - "step_time": 6.5880885079996006 + "step_time": 6.473339682004735 }, { "clip_ratio/high_max": 0.0, @@ -1640,41 +1640,41 @@ "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, - "completions/max_length": 3.0, - "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.375, - "completions/mean_terminated_length": 2.375, + "completions/max_length": 8.0, + "completions/max_terminated_length": 8.0, + "completions/mean_length": 2.90625, + "completions/mean_terminated_length": 2.90625, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.766272783279419, + "entropy": 0.7907501719892025, "epoch": 0.00057, - "frac_reward_zero_std": 1.0, - "grad_norm": 5.2334169595269486e-05, - "kl": 0.8993725756881759, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0003316142538096756, + "kl": 0.13017687457613647, "learning_rate": 7.999999836724277e-06, "loss": 0.0, - "num_tokens": 1341867.0, - "reward": 1.3250000476837158, - "reward_std": 0.49186936020851135, + "num_tokens": 1378379.0, + "reward": 2.3249998092651367, + "reward_std": 1.4756081104278564, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.375, - "rewards/probe_completion_length/std": 0.49186936020851135, + "rewards/probe_completion_length/mean": 1.9375, + "rewards/probe_completion_length/std": 1.1896733045578003, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 1.0, - "rewards/probe_shaping_dominance/std": 0.0, - "rewards/probe_terminal_raw/mean": 0.0, - "rewards/probe_terminal_raw/std": 0.0, - "rewards/rollout_reward_func/mean": -1.0, - "rewards/rollout_reward_func/std": 0.0, - "sampling/importance_sampling_ratio/max": 1.305932879447937, - "sampling/importance_sampling_ratio/mean": 0.9440467357635498, - "sampling/importance_sampling_ratio/min": 0.6217635273933411, - "sampling/sampling_logp_difference/max": 0.3779376745223999, - "sampling/sampling_logp_difference/mean": 0.08750458061695099, + "rewards/probe_shaping_dominance/mean": 0.78125, + "rewards/probe_shaping_dominance/std": 0.420013427734375, + "rewards/probe_terminal_raw/mean": 0.21875, + "rewards/probe_terminal_raw/std": 0.420013427734375, + "rewards/rollout_reward_func/mean": -0.5625, + "rewards/rollout_reward_func/std": 0.84002685546875, + "sampling/importance_sampling_ratio/max": 1.202713131904602, + "sampling/importance_sampling_ratio/mean": 0.864936113357544, + "sampling/importance_sampling_ratio/min": 0.4689479470252991, + "sampling/sampling_logp_difference/max": 0.6789623498916626, + "sampling/sampling_logp_difference/mean": 0.0825042799115181, "step": 57, - "step_time": 9.915378274999057 + "step_time": 10.657130387999132 }, { "clip_ratio/high_max": 0.0, @@ -1682,14 +1682,14 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 0.7637373208999634, + "entropy": 0.7701332122087479, "epoch": 0.00058, - "grad_norm": 3.501655737636611e-05, - "kl": 0.8927765771513805, + "grad_norm": 0.00017936780932359397, + "kl": 0.12208469014149159, "learning_rate": 7.999999820803968e-06, "loss": 0.0, "step": 58, - "step_time": 6.4946643829989625 + "step_time": 6.01674000300045 }, { "clip_ratio/high_max": 0.0, @@ -1700,24 +1700,24 @@ "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.53125, - "completions/mean_terminated_length": 2.53125, + "completions/mean_length": 2.71875, + "completions/mean_terminated_length": 2.71875, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.6821361035108566, + "entropy": 0.5843091569840908, "epoch": 0.00059, "frac_reward_zero_std": 1.0, - "grad_norm": 0.00014250715321395546, - "kl": 0.5903439885005355, + "grad_norm": 0.0009200393105857074, + "kl": 0.46439418219961226, "learning_rate": 7.99999980414318e-06, "loss": 0.0, - "num_tokens": 1389227.0, - "reward": 1.9812500476837158, - "reward_std": 1.2309025526046753, + "num_tokens": 1424478.0, + "reward": 2.168750047683716, + "reward_std": 1.1283552646636963, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.53125, - "rewards/probe_completion_length/std": 0.507007360458374, + "rewards/probe_completion_length/mean": 1.71875, + "rewards/probe_completion_length/std": 0.45680341124534607, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, "rewards/probe_shaping_dominance/mean": 0.75, @@ -1726,13 +1726,13 @@ "rewards/probe_terminal_raw/std": 0.4399413466453552, "rewards/rollout_reward_func/mean": -0.5, "rewards/rollout_reward_func/std": 0.8798826932907104, - "sampling/importance_sampling_ratio/max": 1.239275336265564, - "sampling/importance_sampling_ratio/mean": 0.895161509513855, - "sampling/importance_sampling_ratio/min": 0.5463025569915771, - "sampling/sampling_logp_difference/max": 0.35671401023864746, - "sampling/sampling_logp_difference/mean": 0.06356121599674225, + "sampling/importance_sampling_ratio/max": 1.380016565322876, + "sampling/importance_sampling_ratio/mean": 0.8878653049468994, + "sampling/importance_sampling_ratio/min": 0.350737601518631, + "sampling/sampling_logp_difference/max": 0.9022061824798584, + "sampling/sampling_logp_difference/mean": 0.06674876809120178, "step": 59, - "step_time": 9.911828085000707 + "step_time": 10.694612899000276 }, { "clip_ratio/high_max": 0.0, @@ -1740,14 +1740,14 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 0.6835376396775246, + "entropy": 0.5868858397006989, "epoch": 0.0006, - "grad_norm": 0.00015305924171116203, - "kl": 0.5899961635004729, + "grad_norm": 0.0011626366758719087, + "kl": 0.48716597934253514, "learning_rate": 7.999999786741913e-06, "loss": 0.0, "step": 60, - "step_time": 6.513966230999358 + "step_time": 6.897457114002464 }, { "clip_ratio/high_max": 0.0, @@ -1758,97 +1758,97 @@ "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.71875, - "completions/mean_terminated_length": 2.71875, + "completions/mean_length": 2.5625, + "completions/mean_terminated_length": 2.5625, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.5099964067339897, + "entropy": 0.7314568310976028, "epoch": 0.00061, - "frac_reward_zero_std": 1.0, - "grad_norm": 0.0091713797301054, - "kl": 2.064895814655756, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0019117726478725672, + "kl": 0.5823338131885976, "learning_rate": 7.999999768600167e-06, - "loss": 0.0, - "num_tokens": 1433796.0, - "reward": 2.668750047683716, - "reward_std": 1.3496564626693726, + "loss": -0.0, + "num_tokens": 1475201.0, + "reward": 1.8875000476837158, + "reward_std": 1.1053389310836792, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.71875, - "rewards/probe_completion_length/std": 0.45680341124534607, + "rewards/probe_completion_length/mean": 1.5625, + "rewards/probe_completion_length/std": 0.504016101360321, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.5, - "rewards/probe_shaping_dominance/std": 0.5080004930496216, - "rewards/probe_terminal_raw/mean": 0.5, - "rewards/probe_terminal_raw/std": 0.5080004930496216, - "rewards/rollout_reward_func/mean": 0.0, - "rewards/rollout_reward_func/std": 1.0160009860992432, - "sampling/importance_sampling_ratio/max": 1.0167537927627563, - "sampling/importance_sampling_ratio/mean": 0.7621486783027649, - "sampling/importance_sampling_ratio/min": 0.06427010893821716, - "sampling/sampling_logp_difference/max": 3.6251673698425293, - "sampling/sampling_logp_difference/mean": 0.281258225440979, + "rewards/probe_shaping_dominance/mean": 0.8125, + "rewards/probe_shaping_dominance/std": 0.3965577781200409, + "rewards/probe_terminal_raw/mean": 0.1875, + "rewards/probe_terminal_raw/std": 0.3965577781200409, + "rewards/rollout_reward_func/mean": -0.625, + "rewards/rollout_reward_func/std": 0.7931155562400818, + "sampling/importance_sampling_ratio/max": 1.9046052694320679, + "sampling/importance_sampling_ratio/mean": 0.9178754091262817, + "sampling/importance_sampling_ratio/min": 0.3830260634422302, + "sampling/sampling_logp_difference/max": 0.8716261386871338, + "sampling/sampling_logp_difference/mean": 0.08674927055835724, "step": 61, - "step_time": 10.16635897499782 + "step_time": 10.71165037100036 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.0, + "clip_ratio/low_mean": 0.012500000186264515, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.0, - "entropy": 0.544323917478323, + "clip_ratio/region_mean": 0.012500000186264515, + "entropy": 0.7356374487280846, "epoch": 0.00062, - "grad_norm": 0.001195584307424724, - "kl": 0.8833366855978966, + "grad_norm": 0.0006256209453567863, + "kl": 0.6181492484174669, "learning_rate": 7.99999974971794e-06, - "loss": 0.0, + "loss": -0.0, "step": 62, - "step_time": 6.592917243999182 + "step_time": 6.187538994001443 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.0, + "clip_ratio/region_mean": 0.010416666977107525, "completions/clipped_ratio": 0.0, - "completions/max_length": 8.0, - "completions/max_terminated_length": 8.0, - "completions/mean_length": 2.59375, - "completions/mean_terminated_length": 2.59375, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.4375, + "completions/mean_terminated_length": 2.4375, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.6810576692223549, + "entropy": 0.8409040607511997, "epoch": 0.00063, - "frac_reward_zero_std": 1.0, - "grad_norm": 0.00010912255675066262, - "kl": 0.03229644891916905, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.01637086272239685, + "kl": 3.183713400037959, "learning_rate": 7.999999730095235e-06, - "loss": 0.0, - "num_tokens": 1481625.0, - "reward": 2.1062498092651367, - "reward_std": 1.7799850702285767, + "loss": -0.0001, + "num_tokens": 1522612.0, + "reward": 1.8250000476837158, + "reward_std": 1.2115039825439453, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.65625, - "rewards/probe_completion_length/std": 1.4280457496643066, + "rewards/probe_completion_length/mean": 1.4375, + "rewards/probe_completion_length/std": 0.504016101360321, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.75, - "rewards/probe_shaping_dominance/std": 0.4399413466453552, - "rewards/probe_terminal_raw/mean": 0.25, - "rewards/probe_terminal_raw/std": 0.4399413466453552, - "rewards/rollout_reward_func/mean": -0.5, - "rewards/rollout_reward_func/std": 0.8798826932907104, - "sampling/importance_sampling_ratio/max": 1.4093968868255615, - "sampling/importance_sampling_ratio/mean": 0.9041081666946411, - "sampling/importance_sampling_ratio/min": 0.6358160972595215, - "sampling/sampling_logp_difference/max": 0.4337819218635559, - "sampling/sampling_logp_difference/mean": 0.06429628282785416, + "rewards/probe_shaping_dominance/mean": 0.78125, + "rewards/probe_shaping_dominance/std": 0.420013427734375, + "rewards/probe_terminal_raw/mean": 0.21875, + "rewards/probe_terminal_raw/std": 0.420013427734375, + "rewards/rollout_reward_func/mean": -0.5625, + "rewards/rollout_reward_func/std": 0.84002685546875, + "sampling/importance_sampling_ratio/max": 1.2315932512283325, + "sampling/importance_sampling_ratio/mean": 0.8749663829803467, + "sampling/importance_sampling_ratio/min": 0.015888746827840805, + "sampling/sampling_logp_difference/max": 3.4728269577026367, + "sampling/sampling_logp_difference/mean": 0.12395516037940979, "step": 63, - "step_time": 9.980714073000854 + "step_time": 10.560535980997884 }, { "clip_ratio/high_max": 0.0, @@ -1856,14 +1856,14 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 0.6828571707010269, + "entropy": 0.8305284082889557, "epoch": 0.00064, - "grad_norm": 8.877379150362685e-05, - "kl": 0.03626353240088065, + "grad_norm": 0.0032985317520797253, + "kl": 0.5883966491091996, "learning_rate": 7.99999970973205e-06, - "loss": 0.0, + "loss": -0.0001, "step": 64, - "step_time": 6.516721850999602 + "step_time": 6.416247896999266 }, { "clip_ratio/high_max": 0.0, @@ -1874,39 +1874,39 @@ "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.40625, - "completions/mean_terminated_length": 2.40625, + "completions/mean_length": 2.5, + "completions/mean_terminated_length": 2.5, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.8135795295238495, + "entropy": 0.7524066865444183, "epoch": 0.00065, "frac_reward_zero_std": 1.0, - "grad_norm": 6.834424857515842e-05, - "kl": 0.032632274171191966, + "grad_norm": 0.00010499630297999829, + "kl": 0.20387221802957356, "learning_rate": 7.999999688628386e-06, "loss": 0.0, - "num_tokens": 1527985.0, - "reward": 1.8562500476837158, - "reward_std": 1.2790968418121338, + "num_tokens": 1571590.0, + "reward": 1.4812500476837158, + "reward_std": 0.507007360458374, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.40625, - "rewards/probe_completion_length/std": 0.49899089336395264, - "rewards/probe_invalid_count/mean": 0.0, - "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.75, - "rewards/probe_shaping_dominance/std": 0.4399413466453552, - "rewards/probe_terminal_raw/mean": 0.25, - "rewards/probe_terminal_raw/std": 0.4399413466453552, - "rewards/rollout_reward_func/mean": -0.5, - "rewards/rollout_reward_func/std": 0.8798826932907104, - "sampling/importance_sampling_ratio/max": 1.3485047817230225, - "sampling/importance_sampling_ratio/mean": 0.9244140386581421, - "sampling/importance_sampling_ratio/min": 0.4989074468612671, - "sampling/sampling_logp_difference/max": 0.4888077974319458, - "sampling/sampling_logp_difference/mean": 0.09029445052146912, + "rewards/probe_completion_length/mean": 1.5, + "rewards/probe_completion_length/std": 0.5080004930496216, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.4499962329864502, + "sampling/importance_sampling_ratio/mean": 0.888777494430542, + "sampling/importance_sampling_ratio/min": 0.5364581942558289, + "sampling/sampling_logp_difference/max": 0.5399905443191528, + "sampling/sampling_logp_difference/mean": 0.07261274755001068, "step": 65, - "step_time": 10.491214556999694 + "step_time": 10.264871265002512 }, { "clip_ratio/high_max": 0.0, @@ -1914,14 +1914,14 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 0.8274623081088066, + "entropy": 0.759266197681427, "epoch": 0.00066, - "grad_norm": 8.216574497055262e-05, - "kl": 0.03480283582757693, + "grad_norm": 0.00010316984116798267, + "kl": 0.20505999261513352, "learning_rate": 7.999999666784243e-06, "loss": 0.0, "step": 66, - "step_time": 6.049761105999096 + "step_time": 5.990639261999604 }, { "clip_ratio/high_max": 0.0, @@ -1930,41 +1930,41 @@ "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, - "completions/max_length": 3.0, - "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.5, - "completions/mean_terminated_length": 2.5, + "completions/max_length": 7.0, + "completions/max_terminated_length": 7.0, + "completions/mean_length": 2.65625, + "completions/mean_terminated_length": 2.65625, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.8280301168560982, + "entropy": 0.8478573858737946, "epoch": 0.00067, "frac_reward_zero_std": 1.0, - "grad_norm": 8.851613529259339e-05, - "kl": 0.19343006524650264, + "grad_norm": 0.00017549873155076057, + "kl": 0.09552802673715632, "learning_rate": 7.999999644199619e-06, "loss": 0.0, - "num_tokens": 1575885.0, - "reward": 1.4500000476837158, - "reward_std": 0.5080004930496216, + "num_tokens": 1621069.0, + "reward": 1.7000000476837158, + "reward_std": 1.2443419694900513, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.5, - "rewards/probe_completion_length/std": 0.5080004930496216, - "rewards/probe_invalid_count/mean": 0.0, - "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_completion_length/mean": 1.71875, + "rewards/probe_completion_length/std": 1.2504031658172607, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, "rewards/probe_shaping_dominance/mean": 1.0, "rewards/probe_shaping_dominance/std": 0.0, "rewards/probe_terminal_raw/mean": 0.0, "rewards/probe_terminal_raw/std": 0.0, "rewards/rollout_reward_func/mean": -1.0, "rewards/rollout_reward_func/std": 0.0, - "sampling/importance_sampling_ratio/max": 1.5432251691818237, - "sampling/importance_sampling_ratio/mean": 0.9077194929122925, - "sampling/importance_sampling_ratio/min": 0.4163496196269989, - "sampling/sampling_logp_difference/max": 0.6807805299758911, - "sampling/sampling_logp_difference/mean": 0.09229114651679993, + "sampling/importance_sampling_ratio/max": 1.1542682647705078, + "sampling/importance_sampling_ratio/mean": 0.8189550638198853, + "sampling/importance_sampling_ratio/min": 0.36865320801734924, + "sampling/sampling_logp_difference/max": 0.900229811668396, + "sampling/sampling_logp_difference/mean": 0.10676399618387222, "step": 67, - "step_time": 10.033269270999881 + "step_time": 11.213862350001364 }, { "clip_ratio/high_max": 0.0, @@ -1972,57 +1972,57 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 0.8344325572252274, + "entropy": 0.8443719670176506, "epoch": 0.00068, - "grad_norm": 6.554734864039347e-05, - "kl": 0.19161523527145619, + "grad_norm": 0.00021201952768024057, + "kl": 0.10493764441343956, "learning_rate": 7.999999620874517e-06, "loss": 0.0, "step": 68, - "step_time": 7.017202997999448 + "step_time": 6.09188792200257 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.0, + "clip_ratio/low_mean": 0.035416667349636555, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.0, + "clip_ratio/region_mean": 0.035416667349636555, "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.625, - "completions/mean_terminated_length": 2.625, + "completions/mean_length": 2.65625, + "completions/mean_terminated_length": 2.65625, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.5219790041446686, + "entropy": 0.8209497034549713, "epoch": 0.00069, - "frac_reward_zero_std": 1.0, - "grad_norm": 0.000104649989225436, - "kl": 1.053569495677948, + "frac_reward_zero_std": 0.5, + "grad_norm": 0.0020198614802211523, + "kl": 0.8513226807117462, "learning_rate": 7.999999596808934e-06, - "loss": 0.0, - "num_tokens": 1622330.0, - "reward": 2.575000047683716, - "reward_std": 1.4312187433242798, + "loss": -0.0001, + "num_tokens": 1667152.0, + "reward": 2.481250047683716, + "reward_std": 1.3674646615982056, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.625, - "rewards/probe_completion_length/std": 0.49186936020851135, + "rewards/probe_completion_length/mean": 1.65625, + "rewards/probe_completion_length/std": 0.4825586974620819, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.5, - "rewards/probe_shaping_dominance/std": 0.5080004930496216, - "rewards/probe_terminal_raw/mean": 0.5, - "rewards/probe_terminal_raw/std": 0.5080004930496216, - "rewards/rollout_reward_func/mean": 0.0, - "rewards/rollout_reward_func/std": 1.0160009860992432, - "sampling/importance_sampling_ratio/max": 1.0400450229644775, - "sampling/importance_sampling_ratio/mean": 0.9155407547950745, - "sampling/importance_sampling_ratio/min": 0.7058902382850647, - "sampling/sampling_logp_difference/max": 0.24529099464416504, - "sampling/sampling_logp_difference/mean": 0.04126736894249916, + "rewards/probe_shaping_dominance/mean": 0.5625, + "rewards/probe_shaping_dominance/std": 0.504016101360321, + "rewards/probe_terminal_raw/mean": 0.4375, + "rewards/probe_terminal_raw/std": 0.504016101360321, + "rewards/rollout_reward_func/mean": -0.125, + "rewards/rollout_reward_func/std": 1.008032202720642, + "sampling/importance_sampling_ratio/max": 1.8785016536712646, + "sampling/importance_sampling_ratio/mean": 0.9165289402008057, + "sampling/importance_sampling_ratio/min": 0.4227677583694458, + "sampling/sampling_logp_difference/max": 0.8007502555847168, + "sampling/sampling_logp_difference/mean": 0.10074363648891449, "step": 69, - "step_time": 9.983138362999853 + "step_time": 10.905393431999983 }, { "clip_ratio/high_max": 0.0, @@ -2030,14 +2030,14 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 0.5127745680510998, + "entropy": 0.8409527391195297, "epoch": 0.0007, - "grad_norm": 0.00018927347264252603, - "kl": 1.0697944089770317, + "grad_norm": 0.009374535642564297, + "kl": 0.7900811154395342, "learning_rate": 7.999999572002872e-06, - "loss": 0.0, + "loss": -0.0001, "step": 70, - "step_time": 6.019172412000444 + "step_time": 6.190164835001269 }, { "clip_ratio/high_max": 0.0, @@ -2048,97 +2048,155 @@ "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.8125, - "completions/mean_terminated_length": 2.8125, + "completions/mean_length": 2.625, + "completions/mean_terminated_length": 2.625, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.607807818800211, + "entropy": 0.640807468444109, "epoch": 0.00071, - "frac_reward_zero_std": 1.0, - "grad_norm": 0.0003802482970058918, - "kl": 0.21827068779384717, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0027836360968649387, + "kl": 0.6423672240234737, "learning_rate": 7.999999546456332e-06, - "loss": 0.0, - "num_tokens": 1671382.0, - "reward": 2.262500047683716, - "reward_std": 1.0606601238250732, + "loss": -0.0001, + "num_tokens": 1713194.0, + "reward": 1.9500000476837158, + "reward_std": 1.0776318311691284, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.8125, - "rewards/probe_completion_length/std": 0.3965577781200409, + "rewards/probe_completion_length/mean": 1.625, + "rewards/probe_completion_length/std": 0.49186936020851135, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.75, - "rewards/probe_shaping_dominance/std": 0.4399413466453552, - "rewards/probe_terminal_raw/mean": 0.25, - "rewards/probe_terminal_raw/std": 0.4399413466453552, - "rewards/rollout_reward_func/mean": -0.5, - "rewards/rollout_reward_func/std": 0.8798826932907104, - "sampling/importance_sampling_ratio/max": 2.478405714035034, - "sampling/importance_sampling_ratio/mean": 0.9307346343994141, - "sampling/importance_sampling_ratio/min": 0.17532044649124146, - "sampling/sampling_logp_difference/max": 1.585439682006836, - "sampling/sampling_logp_difference/mean": 0.10700278729200363, + "rewards/probe_shaping_dominance/mean": 0.8125, + "rewards/probe_shaping_dominance/std": 0.3965577781200409, + "rewards/probe_terminal_raw/mean": 0.1875, + "rewards/probe_terminal_raw/std": 0.3965577781200409, + "rewards/rollout_reward_func/mean": -0.625, + "rewards/rollout_reward_func/std": 0.7931155562400818, + "sampling/importance_sampling_ratio/max": 1.3413078784942627, + "sampling/importance_sampling_ratio/mean": 0.8879814147949219, + "sampling/importance_sampling_ratio/min": 0.3190351724624634, + "sampling/sampling_logp_difference/max": 1.076015830039978, + "sampling/sampling_logp_difference/mean": 0.08176332712173462, "step": 71, - "step_time": 10.181540167999628 + "step_time": 10.522709103001034 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.0, + "clip_ratio/low_mean": 0.012500000186264515, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.0, - "entropy": 0.6031206957995892, + "clip_ratio/region_mean": 0.012500000186264515, + "entropy": 0.6309941411018372, "epoch": 0.00072, - "grad_norm": 0.00040189133142121136, - "kl": 0.2209149764967151, + "grad_norm": 0.002217747736722231, + "kl": 1.143750467152131, "learning_rate": 7.999999520169313e-06, - "loss": 0.0, + "loss": -0.0001, "step": 72, - "step_time": 7.0209326659978615 + "step_time": 5.988715680998212 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, - "clip_ratio/low_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, "clip_ratio/low_min": 0.0, - "clip_ratio/region_mean": 0.0, + "clip_ratio/region_mean": 0.010416666977107525, "completions/clipped_ratio": 0.0, "completions/max_length": 3.0, "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.4375, - "completions/mean_terminated_length": 2.4375, + "completions/mean_length": 2.78125, + "completions/mean_terminated_length": 2.78125, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.7966198176145554, + "entropy": 0.6769370436668396, "epoch": 0.00073, - "frac_reward_zero_std": 1.0, - "grad_norm": 5.5945911299204454e-05, - "kl": 0.019231000915169716, + "frac_reward_zero_std": 0.5, + "grad_norm": 0.011145965196192265, + "kl": 0.6622413620352745, "learning_rate": 7.999999493141815e-06, + "loss": -0.0002, + "num_tokens": 1760736.0, + "reward": 2.387500047683716, + "reward_std": 1.1341474056243896, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.78125, + "rewards/probe_completion_length/std": 0.420013427734375, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, + "rewards/probe_shaping_dominance/mean": 0.6875, + "rewards/probe_shaping_dominance/std": 0.4709290862083435, + "rewards/probe_terminal_raw/mean": 0.3125, + "rewards/probe_terminal_raw/std": 0.4709290862083435, + "rewards/rollout_reward_func/mean": -0.375, + "rewards/rollout_reward_func/std": 0.941858172416687, + "sampling/importance_sampling_ratio/max": 2.0832128524780273, + "sampling/importance_sampling_ratio/mean": 0.8911354541778564, + "sampling/importance_sampling_ratio/min": 0.2129342257976532, + "sampling/sampling_logp_difference/max": 1.4288380146026611, + "sampling/sampling_logp_difference/mean": 0.13255563378334045, + "step": 73, + "step_time": 10.575429333001011 + }, + { + "clip_ratio/high_max": 0.02083333395421505, + "clip_ratio/high_mean": 0.010416666977107525, + "clip_ratio/low_mean": 0.06458333507180214, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.07500000111758709, + "entropy": 0.642921295017004, + "epoch": 0.00074, + "grad_norm": 0.0028342357836663723, + "kl": 1.2112234272062778, + "learning_rate": 7.999999465373833e-06, + "loss": -0.0002, + "step": 74, + "step_time": 5.997502170999724 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 3.0, + "completions/mean_terminated_length": 3.0, + "completions/min_length": 3.0, + "completions/min_terminated_length": 3.0, + "entropy": 0.4875616766512394, + "epoch": 0.00075, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.00022702451678924263, + "kl": 0.5974396051169606, + "learning_rate": 7.999999436865376e-06, "loss": 0.0, - "num_tokens": 1721707.0, - "reward": 1.3875000476837158, - "reward_std": 0.504016101360321, + "num_tokens": 1806616.0, + "reward": 2.450000047683716, + "reward_std": 0.8798826932907104, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.4375, - "rewards/probe_completion_length/std": 0.504016101360321, + "rewards/probe_completion_length/mean": 2.0, + "rewards/probe_completion_length/std": 0.0, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 1.0, - "rewards/probe_shaping_dominance/std": 0.0, - "rewards/probe_terminal_raw/mean": 0.0, - "rewards/probe_terminal_raw/std": 0.0, - "rewards/rollout_reward_func/mean": -1.0, - "rewards/rollout_reward_func/std": 0.0, - "sampling/importance_sampling_ratio/max": 1.1157020330429077, - "sampling/importance_sampling_ratio/mean": 0.8640221953392029, - "sampling/importance_sampling_ratio/min": 0.5155755877494812, - "sampling/sampling_logp_difference/max": 0.4500473737716675, - "sampling/sampling_logp_difference/mean": 0.07616540789604187, - "step": 73, - "step_time": 10.120440676000726 + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 2.3010740280151367, + "sampling/importance_sampling_ratio/mean": 1.0142158269882202, + "sampling/importance_sampling_ratio/min": 0.37630370259284973, + "sampling/sampling_logp_difference/max": 1.117997646331787, + "sampling/sampling_logp_difference/mean": 0.10312129557132721, + "step": 75, + "step_time": 10.39726536499984 }, { "clip_ratio/high_max": 0.0, @@ -2146,14 +2204,14 @@ "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, - "entropy": 0.7941807508468628, - "epoch": 0.00074, - "grad_norm": 2.562938243499957e-05, - "kl": 0.009964701312128454, - "learning_rate": 7.999999465373833e-06, + "entropy": 0.48410840332508087, + "epoch": 0.00076, + "grad_norm": 0.0004807643999811262, + "kl": 0.6427391922770767, + "learning_rate": 7.999999407616439e-06, "loss": 0.0, - "step": 74, - "step_time": 6.081612156000119 + "step": 76, + "step_time": 6.295117113002561 }, { "clip_ratio/high_max": 0.0, @@ -2162,46 +2220,6499 @@ "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, - "completions/max_length": 3.0, - "completions/max_terminated_length": 3.0, - "completions/mean_length": 2.65625, - "completions/mean_terminated_length": 2.65625, + "completions/max_length": 7.0, + "completions/max_terminated_length": 7.0, + "completions/mean_length": 2.84375, + "completions/mean_terminated_length": 2.84375, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, - "entropy": 0.5862512141466141, - "epoch": 0.00075, + "entropy": 0.7104897350072861, + "epoch": 0.00077, "frac_reward_zero_std": 0.75, - "grad_norm": 0.0030402804259210825, - "kl": 2.1613324359059334, - "learning_rate": 7.999999436865376e-06, + "grad_norm": 0.0019423841731622815, + "kl": 0.7007742009591311, + "learning_rate": 7.999999377627022e-06, "loss": -0.0001, - "num_tokens": 1769976.0, - "reward": 1.9812500476837158, - "reward_std": 1.0620847940444946, + "num_tokens": 1854875.0, + "reward": 2.0437498092651367, + "reward_std": 1.3526406288146973, "rewards/format_guard/mean": -0.05000000074505806, "rewards/format_guard/std": 0.0, - "rewards/probe_completion_length/mean": 1.65625, - "rewards/probe_completion_length/std": 0.4825586974620819, + "rewards/probe_completion_length/mean": 1.90625, + "rewards/probe_completion_length/std": 1.201058030128479, "rewards/probe_invalid_count/mean": 0.0, "rewards/probe_invalid_count/std": 0.0, - "rewards/probe_shaping_dominance/mean": 0.8125, - "rewards/probe_shaping_dominance/std": 0.3965577781200409, + "rewards/probe_shaping_dominance/mean": 0.90625, + "rewards/probe_shaping_dominance/std": 0.2961445748806, + "rewards/probe_terminal_raw/mean": 0.09375, + "rewards/probe_terminal_raw/std": 0.2961445748806, + "rewards/rollout_reward_func/mean": -0.8125, + "rewards/rollout_reward_func/std": 0.5922891497612, + "sampling/importance_sampling_ratio/max": 1.0384966135025024, + "sampling/importance_sampling_ratio/mean": 0.7873358130455017, + "sampling/importance_sampling_ratio/min": 0.16774220764636993, + "sampling/sampling_logp_difference/max": 1.7101855278015137, + "sampling/sampling_logp_difference/mean": 0.12416968494653702, + "step": 77, + "step_time": 10.378455145999396 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.031250000931322575, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.031250000931322575, + "entropy": 0.712644524872303, + "epoch": 0.00078, + "grad_norm": 0.001622700714506209, + "kl": 0.9561241322662681, + "learning_rate": 7.999999346897126e-06, + "loss": -0.0001, + "step": 78, + "step_time": 6.033231712997804 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.78125, + "completions/mean_terminated_length": 2.78125, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.4954247400164604, + "epoch": 0.00079, + "frac_reward_zero_std": 1.0, + "grad_norm": 7.158728112699464e-05, + "kl": 1.1242153272032738, + "learning_rate": 7.99999931542675e-06, + "loss": 0.0, + "num_tokens": 1901828.0, + "reward": 2.731250047683716, + "reward_std": 1.2885193824768066, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.78125, + "rewards/probe_completion_length/std": 0.420013427734375, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.5, + "rewards/probe_shaping_dominance/std": 0.5080004930496216, + "rewards/probe_terminal_raw/mean": 0.5, + "rewards/probe_terminal_raw/std": 0.5080004930496216, + "rewards/rollout_reward_func/mean": 0.0, + "rewards/rollout_reward_func/std": 1.0160009860992432, + "sampling/importance_sampling_ratio/max": 1.4480345249176025, + "sampling/importance_sampling_ratio/mean": 0.9386520385742188, + "sampling/importance_sampling_ratio/min": 0.6387155055999756, + "sampling/sampling_logp_difference/max": 0.4249168634414673, + "sampling/sampling_logp_difference/mean": 0.05157982185482979, + "step": 79, + "step_time": 11.405814464003925 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.5006568469107151, + "epoch": 0.0008, + "grad_norm": 0.0001417232269886881, + "kl": 1.1419733166694641, + "learning_rate": 7.999999283215897e-06, + "loss": 0.0, + "step": 80, + "step_time": 6.161420755997824 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.010416666977107525, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.59375, + "completions/mean_terminated_length": 2.59375, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.6742436736822128, + "epoch": 0.00081, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.00282097514718771, + "kl": 1.1596152225974947, + "learning_rate": 7.999999250264562e-06, + "loss": -0.0001, + "num_tokens": 1953232.0, + "reward": 1.9187500476837158, + "reward_std": 1.092034935951233, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.59375, + "rewards/probe_completion_length/std": 0.49899089336395264, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.8125, + "rewards/probe_shaping_dominance/std": 0.3965577781200409, "rewards/probe_terminal_raw/mean": 0.1875, "rewards/probe_terminal_raw/std": 0.3965577781200409, "rewards/rollout_reward_func/mean": -0.625, "rewards/rollout_reward_func/std": 0.7931155562400818, - "sampling/importance_sampling_ratio/max": 1.468144416809082, - "sampling/importance_sampling_ratio/mean": 0.9493575096130371, - "sampling/importance_sampling_ratio/min": 0.03764805570244789, - "sampling/sampling_logp_difference/max": 3.1981916427612305, - "sampling/sampling_logp_difference/mean": 0.11449257284402847, - "step": 75, - "step_time": 10.459286816998429 + "sampling/importance_sampling_ratio/max": 1.3345328569412231, + "sampling/importance_sampling_ratio/mean": 0.9116201400756836, + "sampling/importance_sampling_ratio/min": 0.0795779824256897, + "sampling/sampling_logp_difference/max": 2.446382999420166, + "sampling/sampling_logp_difference/mean": 0.12286892533302307, + "step": 81, + "step_time": 10.233006808000937 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.010416666977107525, + "entropy": 0.6922024786472321, + "epoch": 0.00082, + "grad_norm": 0.001407204894348979, + "kl": 0.876353993313387, + "learning_rate": 7.999999216572749e-06, + "loss": -0.0001, + "step": 82, + "step_time": 6.428627160998076 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.625, + "completions/mean_terminated_length": 2.625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.7211672216653824, + "epoch": 0.00083, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.00017314944125246257, + "kl": 0.26839208393357694, + "learning_rate": 7.999999182140456e-06, + "loss": 0.0, + "num_tokens": 2001699.0, + "reward": 1.5750000476837158, + "reward_std": 0.49186936020851135, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.625, + "rewards/probe_completion_length/std": 0.49186936020851135, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 2.0702590942382812, + "sampling/importance_sampling_ratio/mean": 0.918670654296875, + "sampling/importance_sampling_ratio/min": 0.31061917543411255, + "sampling/sampling_logp_difference/max": 0.9575868248939514, + "sampling/sampling_logp_difference/mean": 0.09307387471199036, + "step": 83, + "step_time": 10.531592241997714 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.7358985021710396, + "epoch": 0.00084, + "grad_norm": 0.00017405653488822281, + "kl": 0.2663446672777354, + "learning_rate": 7.999999146967684e-06, + "loss": 0.0, + "step": 84, + "step_time": 6.026314235999962 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.59375, + "completions/mean_terminated_length": 2.59375, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.8648177459836006, + "epoch": 0.00085, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.000491270562633872, + "kl": 0.09633485117228702, + "learning_rate": 7.999999111054434e-06, + "loss": 0.0, + "num_tokens": 2049769.0, + "reward": 1.5437500476837158, + "reward_std": 0.498990923166275, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.59375, + "rewards/probe_completion_length/std": 0.49899089336395264, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 0.9729283452033997, + "sampling/importance_sampling_ratio/mean": 0.7784683704376221, + "sampling/importance_sampling_ratio/min": 0.0, + "sampling/sampling_logp_difference/max": 1.6030910015106201, + "sampling/sampling_logp_difference/mean": 0.12049049139022827, + "step": 85, + "step_time": 10.301046949998636 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.8687215521931648, + "epoch": 0.00086, + "grad_norm": 0.0005266318912617862, + "kl": 0.09560301806777716, + "learning_rate": 7.999999074400703e-06, + "loss": 0.0, + "step": 86, + "step_time": 6.827429698998458 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.65625, + "completions/mean_terminated_length": 2.65625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.6539479978382587, + "epoch": 0.00087, + "frac_reward_zero_std": 1.0, + "grad_norm": 6.415531242964789e-05, + "kl": 0.36288101226091385, + "learning_rate": 7.999999037006494e-06, + "loss": 0.0, + "num_tokens": 2096587.0, + "reward": 1.6062500476837158, + "reward_std": 0.4825586974620819, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.65625, + "rewards/probe_completion_length/std": 0.4825586974620819, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.364053726196289, + "sampling/importance_sampling_ratio/mean": 0.9139212369918823, + "sampling/importance_sampling_ratio/min": 0.46633586287498474, + "sampling/sampling_logp_difference/max": 0.7080342769622803, + "sampling/sampling_logp_difference/mean": 0.06971700489521027, + "step": 87, + "step_time": 10.411047061999852 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.6638137400150299, + "epoch": 0.00088, + "grad_norm": 6.288591248448938e-05, + "kl": 0.36502306535840034, + "learning_rate": 7.999998998871805e-06, + "loss": 0.0, + "step": 88, + "step_time": 6.455294155004594 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.78125, + "completions/mean_terminated_length": 2.78125, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.6723155006766319, + "epoch": 0.00089, + "frac_reward_zero_std": 0.5, + "grad_norm": 0.004749135114252567, + "kl": 2.617519076447934, + "learning_rate": 7.999998959996637e-06, + "loss": -0.0002, + "num_tokens": 2144825.0, + "reward": 2.262500047683716, + "reward_std": 1.0606601238250732, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.78125, + "rewards/probe_completion_length/std": 0.420013427734375, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 2.2531893253326416, + "sampling/importance_sampling_ratio/mean": 0.9639551639556885, + "sampling/importance_sampling_ratio/min": 0.1937435120344162, + "sampling/sampling_logp_difference/max": 1.603487491607666, + "sampling/sampling_logp_difference/mean": 0.10713129490613937, + "step": 89, + "step_time": 10.420832339999833 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.656385749578476, + "epoch": 0.0009, + "grad_norm": 0.0035466940607875586, + "kl": 2.387696197256446, + "learning_rate": 7.99999892038099e-06, + "loss": -0.0002, + "step": 90, + "step_time": 6.442203360002168 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.53125, + "completions/mean_terminated_length": 2.53125, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.8181677013635635, + "epoch": 0.00091, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0019888803362846375, + "kl": 0.5702489176765084, + "learning_rate": 7.999998880024863e-06, + "loss": -0.0001, + "num_tokens": 2192809.0, + "reward": 1.9187500476837158, + "reward_std": 1.1773227453231812, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.53125, + "rewards/probe_completion_length/std": 0.507007360458374, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.78125, + "rewards/probe_shaping_dominance/std": 0.420013427734375, + "rewards/probe_terminal_raw/mean": 0.21875, + "rewards/probe_terminal_raw/std": 0.420013427734375, + "rewards/rollout_reward_func/mean": -0.5625, + "rewards/rollout_reward_func/std": 0.84002685546875, + "sampling/importance_sampling_ratio/max": 1.1860374212265015, + "sampling/importance_sampling_ratio/mean": 0.8859227895736694, + "sampling/importance_sampling_ratio/min": 0.1813456267118454, + "sampling/sampling_logp_difference/max": 1.622064471244812, + "sampling/sampling_logp_difference/mean": 0.09506501257419586, + "step": 91, + "step_time": 10.108775123004307 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.800042949616909, + "epoch": 0.00092, + "grad_norm": 0.001467581489123404, + "kl": 0.5681175279896706, + "learning_rate": 7.999998838928257e-06, + "loss": -0.0001, + "step": 92, + "step_time": 6.406815487996937 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.40625, + "completions/mean_terminated_length": 2.40625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.716269675642252, + "epoch": 0.00093, + "frac_reward_zero_std": 1.0, + "grad_norm": 6.907718488946557e-05, + "kl": 0.024005705378840503, + "learning_rate": 7.999998797091172e-06, + "loss": 0.0, + "num_tokens": 2241682.0, + "reward": 1.8562500476837158, + "reward_std": 1.2790968418121338, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.40625, + "rewards/probe_completion_length/std": 0.49899089336395264, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.3916001319885254, + "sampling/importance_sampling_ratio/mean": 0.9141188859939575, + "sampling/importance_sampling_ratio/min": 0.6723463535308838, + "sampling/sampling_logp_difference/max": 0.3769274950027466, + "sampling/sampling_logp_difference/mean": 0.05592293664813042, + "step": 93, + "step_time": 10.462285012999928 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.6890156902372837, + "epoch": 0.00094, + "grad_norm": 0.00013785925693809986, + "kl": 0.031552536704111844, + "learning_rate": 7.999998754513608e-06, + "loss": 0.0, + "step": 94, + "step_time": 5.955127831999562 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.59375, + "completions/mean_terminated_length": 2.59375, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.5587945282459259, + "epoch": 0.00095, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.00024127251526806504, + "kl": 0.9856726005673409, + "learning_rate": 7.999998711195565e-06, + "loss": 0.0, + "num_tokens": 2286451.0, + "reward": 2.543750047683716, + "reward_std": 1.4560080766677856, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.59375, + "rewards/probe_completion_length/std": 0.49899089336395264, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.5, + "rewards/probe_shaping_dominance/std": 0.5080004930496216, + "rewards/probe_terminal_raw/mean": 0.5, + "rewards/probe_terminal_raw/std": 0.5080004930496216, + "rewards/rollout_reward_func/mean": 0.0, + "rewards/rollout_reward_func/std": 1.0160009860992432, + "sampling/importance_sampling_ratio/max": 1.0284326076507568, + "sampling/importance_sampling_ratio/mean": 0.8956028819084167, + "sampling/importance_sampling_ratio/min": 0.4129232168197632, + "sampling/sampling_logp_difference/max": 0.7938406467437744, + "sampling/sampling_logp_difference/mean": 0.06116846576333046, + "step": 95, + "step_time": 10.090581595999538 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.5542779862880707, + "epoch": 0.00096, + "grad_norm": 0.0001853352296166122, + "kl": 0.9771002680063248, + "learning_rate": 7.999998667137043e-06, + "loss": 0.0, + "step": 96, + "step_time": 6.352050979998239 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.875, + "completions/mean_terminated_length": 2.875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.4173930324614048, + "epoch": 0.00097, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.00037545509985648096, + "kl": 0.9331283923238516, + "learning_rate": 7.999998622338041e-06, + "loss": 0.0, + "num_tokens": 2336439.0, + "reward": 2.762500047683716, + "reward_std": 1.1760376691818237, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.875, + "rewards/probe_completion_length/std": 0.33601075410842896, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.53125, + "rewards/probe_shaping_dominance/std": 0.507007360458374, + "rewards/probe_terminal_raw/mean": 0.46875, + "rewards/probe_terminal_raw/std": 0.507007360458374, + "rewards/rollout_reward_func/mean": -0.0625, + "rewards/rollout_reward_func/std": 1.014014720916748, + "sampling/importance_sampling_ratio/max": 1.4940528869628906, + "sampling/importance_sampling_ratio/mean": 0.9181157350540161, + "sampling/importance_sampling_ratio/min": 0.556973397731781, + "sampling/sampling_logp_difference/max": 0.5000306367874146, + "sampling/sampling_logp_difference/mean": 0.05192491039633751, + "step": 97, + "step_time": 10.801652450001711 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.4088115468621254, + "epoch": 0.00098, + "grad_norm": 0.0004249197954777628, + "kl": 0.9439695589244366, + "learning_rate": 7.999998576798562e-06, + "loss": 0.0, + "step": 98, + "step_time": 6.155849446995489 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.010416666977107525, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.84375, + "completions/mean_terminated_length": 2.84375, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.5160295888781548, + "epoch": 0.00099, + "frac_reward_zero_std": 0.5, + "grad_norm": 0.0072716595605015755, + "kl": 4.22201424402374, + "learning_rate": 7.999998530518601e-06, + "loss": -0.0, + "num_tokens": 2379722.0, + "reward": 2.418750047683716, + "reward_std": 1.106706142425537, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.84375, + "rewards/probe_completion_length/std": 0.3689020276069641, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.6875, + "rewards/probe_shaping_dominance/std": 0.4709290862083435, + "rewards/probe_terminal_raw/mean": 0.3125, + "rewards/probe_terminal_raw/std": 0.4709290862083435, + "rewards/rollout_reward_func/mean": -0.375, + "rewards/rollout_reward_func/std": 0.941858172416687, + "sampling/importance_sampling_ratio/max": 1.3872947692871094, + "sampling/importance_sampling_ratio/mean": 0.8936517238616943, + "sampling/importance_sampling_ratio/min": 0.0, + "sampling/sampling_logp_difference/max": 1.780822515487671, + "sampling/sampling_logp_difference/mean": 0.09026888012886047, + "step": 99, + "step_time": 10.53207572199608 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.5115218348801136, + "epoch": 0.001, + "grad_norm": 0.0031906350050121546, + "kl": 2.792147676460445, + "learning_rate": 7.999998483498162e-06, + "loss": -0.0, + "step": 100, + "step_time": 5.868994353000744 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.5, + "completions/mean_terminated_length": 2.5, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.8312729708850384, + "epoch": 0.00101, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.00014353707956615835, + "kl": 0.6586928470060229, + "learning_rate": 7.999998435737244e-06, + "loss": 0.0, + "num_tokens": 2428865.0, + "reward": 1.9500000476837158, + "reward_std": 1.2443419694900513, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.5, + "rewards/probe_completion_length/std": 0.5080004930496216, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.398367166519165, + "sampling/importance_sampling_ratio/mean": 0.9189577698707581, + "sampling/importance_sampling_ratio/min": 0.6098452806472778, + "sampling/sampling_logp_difference/max": 0.5889620780944824, + "sampling/sampling_logp_difference/mean": 0.07546409219503403, + "step": 101, + "step_time": 10.53599652000048 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.8421025648713112, + "epoch": 0.00102, + "grad_norm": 0.00014895916683599353, + "kl": 0.6579505642876029, + "learning_rate": 7.999998387235846e-06, + "loss": 0.0, + "step": 102, + "step_time": 6.442589998996482 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 7.0, + "completions/max_terminated_length": 7.0, + "completions/mean_length": 3.0, + "completions/mean_terminated_length": 3.0, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.4542905166745186, + "epoch": 0.00103, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.00018467936024535447, + "kl": 1.264952726662159, + "learning_rate": 7.99999833799397e-06, + "loss": 0.0, + "num_tokens": 2476084.0, + "reward": 2.9812498092651367, + "reward_std": 1.3792091608047485, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 2.03125, + "rewards/probe_completion_length/std": 0.9666828513145447, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.5, + "rewards/probe_shaping_dominance/std": 0.5080004930496216, + "rewards/probe_terminal_raw/mean": 0.5, + "rewards/probe_terminal_raw/std": 0.5080004930496216, + "rewards/rollout_reward_func/mean": 0.0, + "rewards/rollout_reward_func/std": 1.0160009860992432, + "sampling/importance_sampling_ratio/max": 1.6235320568084717, + "sampling/importance_sampling_ratio/mean": 0.9240143299102783, + "sampling/importance_sampling_ratio/min": 0.3445168435573578, + "sampling/sampling_logp_difference/max": 0.7978925704956055, + "sampling/sampling_logp_difference/mean": 0.06782019138336182, + "step": 103, + "step_time": 10.232398630996613 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.4663286581635475, + "epoch": 0.00104, + "grad_norm": 0.0002121606084983796, + "kl": 1.2690180391073227, + "learning_rate": 7.999998288011616e-06, + "loss": 0.0, + "step": 104, + "step_time": 6.369392825999967 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.59375, + "completions/mean_terminated_length": 2.59375, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.5813856143504381, + "epoch": 0.00105, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.004445977043360472, + "kl": 0.5892454935237765, + "learning_rate": 7.999998237288781e-06, + "loss": -0.0, + "num_tokens": 2520485.0, + "reward": 2.481250047683716, + "reward_std": 1.43649160861969, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.59375, + "rewards/probe_completion_length/std": 0.49899089336395264, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.53125, + "rewards/probe_shaping_dominance/std": 0.507007360458374, + "rewards/probe_terminal_raw/mean": 0.46875, + "rewards/probe_terminal_raw/std": 0.507007360458374, + "rewards/rollout_reward_func/mean": -0.0625, + "rewards/rollout_reward_func/std": 1.014014720916748, + "sampling/importance_sampling_ratio/max": 1.263745665550232, + "sampling/importance_sampling_ratio/mean": 0.915697455406189, + "sampling/importance_sampling_ratio/min": 0.44258958101272583, + "sampling/sampling_logp_difference/max": 0.7512234449386597, + "sampling/sampling_logp_difference/mean": 0.05213358998298645, + "step": 105, + "step_time": 10.497982850998596 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.576000239700079, + "epoch": 0.00106, + "grad_norm": 0.0021153499837964773, + "kl": 0.6080902330577374, + "learning_rate": 7.999998185825468e-06, + "loss": -0.0001, + "step": 106, + "step_time": 5.98566820799897 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.5625, + "completions/mean_terminated_length": 2.5625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.7922704741358757, + "epoch": 0.00107, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.001570796244777739, + "kl": 0.8546689227223396, + "learning_rate": 7.999998133621676e-06, + "loss": -0.0001, + "num_tokens": 2569391.0, + "reward": 1.7937500476837158, + "reward_std": 0.9540871381759644, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.5625, + "rewards/probe_completion_length/std": 0.504016101360321, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, + "rewards/probe_shaping_dominance/mean": 0.875, + "rewards/probe_shaping_dominance/std": 0.33601075410842896, + "rewards/probe_terminal_raw/mean": 0.125, + "rewards/probe_terminal_raw/std": 0.33601075410842896, + "rewards/rollout_reward_func/mean": -0.75, + "rewards/rollout_reward_func/std": 0.6720215082168579, + "sampling/importance_sampling_ratio/max": 1.3402096033096313, + "sampling/importance_sampling_ratio/mean": 0.863715410232544, + "sampling/importance_sampling_ratio/min": 0.29634997248649597, + "sampling/sampling_logp_difference/max": 0.9534087181091309, + "sampling/sampling_logp_difference/mean": 0.12255297601222992, + "step": 107, + "step_time": 10.240153937998912 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.7928206250071526, + "epoch": 0.00108, + "grad_norm": 0.0015277264174073935, + "kl": 0.7050070539116859, + "learning_rate": 7.999998080677404e-06, + "loss": -0.0001, + "step": 108, + "step_time": 6.46414371100218 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.010416666977107525, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.8125, + "completions/mean_terminated_length": 2.8125, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.5738925524055958, + "epoch": 0.00109, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0044546849094331264, + "kl": 0.8377486700192094, + "learning_rate": 7.999998026992654e-06, + "loss": -0.0001, + "num_tokens": 2615756.0, + "reward": 2.075000047683716, + "reward_std": 0.9069623351097107, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.8125, + "rewards/probe_completion_length/std": 0.3965577781200409, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.84375, + "rewards/probe_shaping_dominance/std": 0.3689020276069641, + "rewards/probe_terminal_raw/mean": 0.15625, + "rewards/probe_terminal_raw/std": 0.3689020276069641, + "rewards/rollout_reward_func/mean": -0.6875, + "rewards/rollout_reward_func/std": 0.7378040552139282, + "sampling/importance_sampling_ratio/max": 2.154284954071045, + "sampling/importance_sampling_ratio/mean": 0.9438944458961487, + "sampling/importance_sampling_ratio/min": 0.28246164321899414, + "sampling/sampling_logp_difference/max": 0.8599565029144287, + "sampling/sampling_logp_difference/mean": 0.126668319106102, + "step": 109, + "step_time": 10.330337892997704 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.033333334140479565, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.033333334140479565, + "entropy": 0.5660623703151941, + "epoch": 0.0011, + "grad_norm": 0.00280306045897305, + "kl": 0.9475272796116769, + "learning_rate": 7.999997972567424e-06, + "loss": -0.0001, + "step": 110, + "step_time": 5.766006027999538 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.71875, + "completions/mean_terminated_length": 2.71875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.6521939821541309, + "epoch": 0.00111, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0037616584450006485, + "kl": 0.6928037863690406, + "learning_rate": 7.999997917401717e-06, + "loss": -0.0, + "num_tokens": 2660029.0, + "reward": 2.543750047683716, + "reward_std": 1.3163825273513794, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.71875, + "rewards/probe_completion_length/std": 0.45680341124534607, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.5625, + "rewards/probe_shaping_dominance/std": 0.504016101360321, + "rewards/probe_terminal_raw/mean": 0.4375, + "rewards/probe_terminal_raw/std": 0.504016101360321, + "rewards/rollout_reward_func/mean": -0.125, + "rewards/rollout_reward_func/std": 1.008032202720642, + "sampling/importance_sampling_ratio/max": 2.5399951934814453, + "sampling/importance_sampling_ratio/mean": 0.912597119808197, + "sampling/importance_sampling_ratio/min": 0.3494853973388672, + "sampling/sampling_logp_difference/max": 1.6019632816314697, + "sampling/sampling_logp_difference/mean": 0.11006368696689606, + "step": 111, + "step_time": 10.330967569998393 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.02083333395421505, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.02083333395421505, + "entropy": 0.653257854282856, + "epoch": 0.00112, + "grad_norm": 0.00019386877829674631, + "kl": 0.7184119247831404, + "learning_rate": 7.99999786149553e-06, + "loss": -0.0, + "step": 112, + "step_time": 6.43034187000012 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.010416666977107525, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.6875, + "completions/mean_terminated_length": 2.6875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.5557065382599831, + "epoch": 0.00113, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0019610777962952852, + "kl": 0.5786571955832187, + "learning_rate": 7.999997804848863e-06, + "loss": -0.0001, + "num_tokens": 2706298.0, + "reward": 2.512500047683716, + "reward_std": 1.342542052268982, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.6875, + "rewards/probe_completion_length/std": 0.4709290862083435, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.5625, + "rewards/probe_shaping_dominance/std": 0.504016101360321, + "rewards/probe_terminal_raw/mean": 0.4375, + "rewards/probe_terminal_raw/std": 0.504016101360321, + "rewards/rollout_reward_func/mean": -0.125, + "rewards/rollout_reward_func/std": 1.008032202720642, + "sampling/importance_sampling_ratio/max": 1.146275520324707, + "sampling/importance_sampling_ratio/mean": 0.9030254483222961, + "sampling/importance_sampling_ratio/min": 0.18932893872261047, + "sampling/sampling_logp_difference/max": 1.3923919200897217, + "sampling/sampling_logp_difference/mean": 0.06794135272502899, + "step": 113, + "step_time": 10.613757418001114 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.010416666977107525, + "entropy": 0.5475253388285637, + "epoch": 0.00114, + "grad_norm": 0.0020037624053657055, + "kl": 0.5677314543281682, + "learning_rate": 7.999997747461717e-06, + "loss": -0.0001, + "step": 114, + "step_time": 5.993655662001402 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.5, + "completions/mean_terminated_length": 2.5, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.7513568848371506, + "epoch": 0.00115, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0003399779088795185, + "kl": 0.2799269228707999, + "learning_rate": 7.999997689334094e-06, + "loss": 0.0, + "num_tokens": 2758680.0, + "reward": 1.4500000476837158, + "reward_std": 0.5080004930496216, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.5, + "rewards/probe_completion_length/std": 0.5080004930496216, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.589788794517517, + "sampling/importance_sampling_ratio/mean": 0.8488104939460754, + "sampling/importance_sampling_ratio/min": 0.29667946696281433, + "sampling/sampling_logp_difference/max": 1.1271950006484985, + "sampling/sampling_logp_difference/mean": 0.11992794275283813, + "step": 115, + "step_time": 10.530936768000174 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.7374518886208534, + "epoch": 0.00116, + "grad_norm": 0.0005056450027041137, + "kl": 0.3286844752728939, + "learning_rate": 7.99999763046599e-06, + "loss": 0.0, + "step": 116, + "step_time": 6.617304399002023 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.53125, + "completions/mean_terminated_length": 2.53125, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.8363222517073154, + "epoch": 0.00117, + "frac_reward_zero_std": 1.0, + "grad_norm": 5.731517740059644e-05, + "kl": 0.5686155576258898, + "learning_rate": 7.999997570857409e-06, + "loss": 0.0, + "num_tokens": 2807756.0, + "reward": 1.9812500476837158, + "reward_std": 1.2309025526046753, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.53125, + "rewards/probe_completion_length/std": 0.507007360458374, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.3529267311096191, + "sampling/importance_sampling_ratio/mean": 0.8506964445114136, + "sampling/importance_sampling_ratio/min": 0.4534793198108673, + "sampling/sampling_logp_difference/max": 0.5722330212593079, + "sampling/sampling_logp_difference/mean": 0.0960143581032753, + "step": 117, + "step_time": 10.560414547995606 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.8329844176769257, + "epoch": 0.00118, + "grad_norm": 7.695100794080645e-05, + "kl": 0.5957790687680244, + "learning_rate": 7.999997510508348e-06, + "loss": 0.0, + "step": 118, + "step_time": 6.05941285299923 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.010416666977107525, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.46875, + "completions/mean_terminated_length": 2.46875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.7654928229749203, + "epoch": 0.00119, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.001598424045369029, + "kl": 0.6253797174431384, + "learning_rate": 7.999997449418809e-06, + "loss": -0.0001, + "num_tokens": 2856512.0, + "reward": 1.7312500476837158, + "reward_std": 1.0696510076522827, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.46875, + "rewards/probe_completion_length/std": 0.507007360458374, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.84375, + "rewards/probe_shaping_dominance/std": 0.3689020276069641, + "rewards/probe_terminal_raw/mean": 0.15625, + "rewards/probe_terminal_raw/std": 0.3689020276069641, + "rewards/rollout_reward_func/mean": -0.6875, + "rewards/rollout_reward_func/std": 0.7378040552139282, + "sampling/importance_sampling_ratio/max": 1.546105146408081, + "sampling/importance_sampling_ratio/mean": 0.8397697806358337, + "sampling/importance_sampling_ratio/min": 0.24415840208530426, + "sampling/sampling_logp_difference/max": 1.3526235818862915, + "sampling/sampling_logp_difference/mean": 0.12898343801498413, + "step": 119, + "step_time": 10.996136936004405 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.033333334140479565, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.033333334140479565, + "entropy": 0.7672837302088737, + "epoch": 0.0012, + "grad_norm": 0.0002433511835988611, + "kl": 0.6368538588285446, + "learning_rate": 7.99999738758879e-06, + "loss": -0.0001, + "step": 120, + "step_time": 6.0576140050015965 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.6875, + "completions/mean_terminated_length": 2.6875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.40811267495155334, + "epoch": 0.00121, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.002180876210331917, + "kl": 1.549589341506362, + "learning_rate": 7.999997325018293e-06, + "loss": 0.0, + "num_tokens": 2900669.0, + "reward": 2.668750047683716, + "reward_std": 1.3496564626693726, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.6875, + "rewards/probe_completion_length/std": 0.4709290862083435, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, + "rewards/probe_shaping_dominance/mean": 0.5, + "rewards/probe_shaping_dominance/std": 0.5080004930496216, + "rewards/probe_terminal_raw/mean": 0.5, + "rewards/probe_terminal_raw/std": 0.5080004930496216, + "rewards/rollout_reward_func/mean": 0.0, + "rewards/rollout_reward_func/std": 1.0160009860992432, + "sampling/importance_sampling_ratio/max": 1.735442876815796, + "sampling/importance_sampling_ratio/mean": 0.9358066320419312, + "sampling/importance_sampling_ratio/min": 0.05085606127977371, + "sampling/sampling_logp_difference/max": 2.797534942626953, + "sampling/sampling_logp_difference/mean": 0.151044100522995, + "step": 121, + "step_time": 10.245774637998693 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.41215409338474274, + "epoch": 0.00122, + "grad_norm": 0.0017760515911504626, + "kl": 1.5261753425002098, + "learning_rate": 7.999997261707317e-06, + "loss": 0.0, + "step": 122, + "step_time": 6.374105552997207 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.010416666977107525, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.84375, + "completions/mean_terminated_length": 2.84375, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.43246884644031525, + "epoch": 0.00123, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0008055871003307402, + "kl": 1.0272779632359743, + "learning_rate": 7.999997197655861e-06, + "loss": -0.0001, + "num_tokens": 2948581.0, + "reward": 2.856250047683716, + "reward_std": 1.2276222705841064, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.84375, + "rewards/probe_completion_length/std": 0.3689020276069641, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.46875, + "rewards/probe_shaping_dominance/std": 0.507007360458374, + "rewards/probe_terminal_raw/mean": 0.53125, + "rewards/probe_terminal_raw/std": 0.507007360458374, + "rewards/rollout_reward_func/mean": 0.0625, + "rewards/rollout_reward_func/std": 1.014014720916748, + "sampling/importance_sampling_ratio/max": 1.839868426322937, + "sampling/importance_sampling_ratio/mean": 0.8939834833145142, + "sampling/importance_sampling_ratio/min": 0.07948717474937439, + "sampling/sampling_logp_difference/max": 2.2706401348114014, + "sampling/sampling_logp_difference/mean": 0.11110737919807434, + "step": 123, + "step_time": 10.275854114002868 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.43315667286515236, + "epoch": 0.00124, + "grad_norm": 0.0008163482998497784, + "kl": 1.0497613418847322, + "learning_rate": 7.999997132863928e-06, + "loss": -0.0001, + "step": 124, + "step_time": 5.97916301999976 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.78125, + "completions/mean_terminated_length": 2.78125, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.3833901360630989, + "epoch": 0.00125, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0007064693490974605, + "kl": 1.3148364201188087, + "learning_rate": 7.999997067331516e-06, + "loss": 0.0, + "num_tokens": 2996178.0, + "reward": 2.231250047683716, + "reward_std": 1.0846248865127563, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.78125, + "rewards/probe_completion_length/std": 0.420013427734375, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.0497198104858398, + "sampling/importance_sampling_ratio/mean": 0.7578398585319519, + "sampling/importance_sampling_ratio/min": 0.0, + "sampling/sampling_logp_difference/max": 2.767157554626465, + "sampling/sampling_logp_difference/mean": 0.1752256155014038, + "step": 125, + "step_time": 10.13536022900189 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.38512268476188183, + "epoch": 0.00126, + "grad_norm": 0.000761943229008466, + "kl": 1.3329130411148071, + "learning_rate": 7.999997001058625e-06, + "loss": 0.0, + "step": 126, + "step_time": 6.731002937000085 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.40625, + "completions/mean_terminated_length": 2.40625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.669311985373497, + "epoch": 0.00127, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.00017574324738234282, + "kl": 0.6046575158834457, + "learning_rate": 7.999996934045254e-06, + "loss": 0.0, + "num_tokens": 3041147.0, + "reward": 1.8562500476837158, + "reward_std": 1.2790968418121338, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.40625, + "rewards/probe_completion_length/std": 0.49899089336395264, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.3875808715820312, + "sampling/importance_sampling_ratio/mean": 0.9241994619369507, + "sampling/importance_sampling_ratio/min": 0.7366468906402588, + "sampling/sampling_logp_difference/max": 0.3816380500793457, + "sampling/sampling_logp_difference/mean": 0.05508778989315033, + "step": 127, + "step_time": 10.081132162002177 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.6669952869415283, + "epoch": 0.00128, + "grad_norm": 0.0002272838755743578, + "kl": 0.62955535762012, + "learning_rate": 7.999996866291406e-06, + "loss": 0.0, + "step": 128, + "step_time": 5.974870206999185 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.59375, + "completions/mean_terminated_length": 2.59375, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.564176794141531, + "epoch": 0.00129, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0013212214689701796, + "kl": 0.9751707948744297, + "learning_rate": 7.999996797797079e-06, + "loss": -0.0, + "num_tokens": 3086335.0, + "reward": 2.231250047683716, + "reward_std": 1.3255400657653809, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.59375, + "rewards/probe_completion_length/std": 0.49899089336395264, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.65625, + "rewards/probe_shaping_dominance/std": 0.4825586974620819, + "rewards/probe_terminal_raw/mean": 0.34375, + "rewards/probe_terminal_raw/std": 0.4825586974620819, + "rewards/rollout_reward_func/mean": -0.3125, + "rewards/rollout_reward_func/std": 0.9651173949241638, + "sampling/importance_sampling_ratio/max": 1.2364485263824463, + "sampling/importance_sampling_ratio/mean": 0.8747109174728394, + "sampling/importance_sampling_ratio/min": 0.2390734702348709, + "sampling/sampling_logp_difference/max": 1.3546556234359741, + "sampling/sampling_logp_difference/mean": 0.07768772542476654, + "step": 129, + "step_time": 10.650671339002656 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.5586648434400558, + "epoch": 0.0013, + "grad_norm": 0.001662288443185389, + "kl": 0.9744510091841221, + "learning_rate": 7.999996728562273e-06, + "loss": -0.0, + "step": 130, + "step_time": 6.473435007999797 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.012500000186264515, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.012500000186264515, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.75, + "completions/mean_terminated_length": 2.75, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.3778875097632408, + "epoch": 0.00131, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0024475299287587404, + "kl": 1.603209212422371, + "learning_rate": 7.999996658586989e-06, + "loss": -0.0001, + "num_tokens": 3133159.0, + "reward": 2.637500047683716, + "reward_std": 1.3060035705566406, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.75, + "rewards/probe_completion_length/std": 0.4399413466453552, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.53125, + "rewards/probe_shaping_dominance/std": 0.507007360458374, + "rewards/probe_terminal_raw/mean": 0.46875, + "rewards/probe_terminal_raw/std": 0.507007360458374, + "rewards/rollout_reward_func/mean": -0.0625, + "rewards/rollout_reward_func/std": 1.014014720916748, + "sampling/importance_sampling_ratio/max": 1.2442551851272583, + "sampling/importance_sampling_ratio/mean": 0.8854572772979736, + "sampling/importance_sampling_ratio/min": 0.10244226455688477, + "sampling/sampling_logp_difference/max": 2.1706011295318604, + "sampling/sampling_logp_difference/mean": 0.1017080694437027, + "step": 131, + "step_time": 10.024731007997616 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.012500000186264515, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.012500000186264515, + "entropy": 0.37728825211524963, + "epoch": 0.00132, + "grad_norm": 0.0006488582585006952, + "kl": 1.5983238890767097, + "learning_rate": 7.999996587871225e-06, + "loss": -0.0001, + "step": 132, + "step_time": 6.3365548879992275 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.625, + "completions/mean_terminated_length": 2.625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.6743998825550079, + "epoch": 0.00133, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.006993595510721207, + "kl": 3.7676026318222284, + "learning_rate": 7.999996516414982e-06, + "loss": -0.0002, + "num_tokens": 3186308.0, + "reward": 1.8250000476837158, + "reward_std": 0.941858172416687, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.625, + "rewards/probe_completion_length/std": 0.49186936020851135, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.875, + "rewards/probe_shaping_dominance/std": 0.33601075410842896, + "rewards/probe_terminal_raw/mean": 0.125, + "rewards/probe_terminal_raw/std": 0.33601075410842896, + "rewards/rollout_reward_func/mean": -0.75, + "rewards/rollout_reward_func/std": 0.6720215082168579, + "sampling/importance_sampling_ratio/max": 2.262389898300171, + "sampling/importance_sampling_ratio/mean": 0.9818167686462402, + "sampling/importance_sampling_ratio/min": 0.02067597396671772, + "sampling/sampling_logp_difference/max": 3.6869354248046875, + "sampling/sampling_logp_difference/mean": 0.22966735064983368, + "step": 133, + "step_time": 11.05697975199837 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.6868020631372929, + "epoch": 0.00134, + "grad_norm": 0.0053808679804205894, + "kl": 2.8858383037149906, + "learning_rate": 7.999996444218262e-06, + "loss": -0.0002, + "step": 134, + "step_time": 6.313005753003381 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 6.0, + "completions/max_terminated_length": 6.0, + "completions/mean_length": 2.40625, + "completions/mean_terminated_length": 2.40625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.6054645292460918, + "epoch": 0.00135, + "frac_reward_zero_std": 1.0, + "grad_norm": 3.4668184525799006e-05, + "kl": 0.07004273735219613, + "learning_rate": 7.999996371281063e-06, + "loss": 0.0, + "num_tokens": 3232062.0, + "reward": 1.8249999284744263, + "reward_std": 1.4535826444625854, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.375, + "rewards/probe_completion_length/std": 0.6599119901657104, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.3307595252990723, + "sampling/importance_sampling_ratio/mean": 0.9332914352416992, + "sampling/importance_sampling_ratio/min": 0.5020673274993896, + "sampling/sampling_logp_difference/max": 0.3572865128517151, + "sampling/sampling_logp_difference/mean": 0.05530416965484619, + "step": 135, + "step_time": 10.475520918997063 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.610666386783123, + "epoch": 0.00136, + "grad_norm": 3.350508268340491e-05, + "kl": 0.06979758548550308, + "learning_rate": 7.999996297603385e-06, + "loss": 0.0, + "step": 136, + "step_time": 6.031642523999835 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.46875, + "completions/mean_terminated_length": 2.46875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.6555749177932739, + "epoch": 0.00137, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0013054372975602746, + "kl": 0.5964277469320223, + "learning_rate": 7.999996223185228e-06, + "loss": -0.0001, + "num_tokens": 3284053.0, + "reward": 1.7937500476837158, + "reward_std": 1.1390254497528076, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.46875, + "rewards/probe_completion_length/std": 0.507007360458374, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.8125, + "rewards/probe_shaping_dominance/std": 0.3965577781200409, + "rewards/probe_terminal_raw/mean": 0.1875, + "rewards/probe_terminal_raw/std": 0.3965577781200409, + "rewards/rollout_reward_func/mean": -0.625, + "rewards/rollout_reward_func/std": 0.7931155562400818, + "sampling/importance_sampling_ratio/max": 1.1609679460525513, + "sampling/importance_sampling_ratio/mean": 0.8882247805595398, + "sampling/importance_sampling_ratio/min": 0.36374035477638245, + "sampling/sampling_logp_difference/max": 0.9692283272743225, + "sampling/sampling_logp_difference/mean": 0.064999520778656, + "step": 137, + "step_time": 10.692799777998516 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.6570683643221855, + "epoch": 0.00138, + "grad_norm": 0.0015739274676889181, + "kl": 0.5917147692525759, + "learning_rate": 7.999996148026594e-06, + "loss": -0.0001, + "step": 138, + "step_time": 6.068219756996768 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.65625, + "completions/mean_terminated_length": 2.65625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.6512251161038876, + "epoch": 0.00139, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.00028360536089167, + "kl": 0.5178780551068485, + "learning_rate": 7.99999607212748e-06, + "loss": 0.0, + "num_tokens": 3334405.0, + "reward": 1.6062500476837158, + "reward_std": 0.4825586974620819, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.65625, + "rewards/probe_completion_length/std": 0.4825586974620819, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.6509288549423218, + "sampling/importance_sampling_ratio/mean": 0.893890380859375, + "sampling/importance_sampling_ratio/min": 0.0, + "sampling/sampling_logp_difference/max": 2.125434160232544, + "sampling/sampling_logp_difference/mean": 0.13162320852279663, + "step": 139, + "step_time": 10.860906833999252 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.6622384190559387, + "epoch": 0.0014, + "grad_norm": 0.0002564970636740327, + "kl": 0.4972880659624934, + "learning_rate": 7.999995995487888e-06, + "loss": 0.0, + "step": 140, + "step_time": 6.4930414069986 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.65625, + "completions/mean_terminated_length": 2.65625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.6598617434501648, + "epoch": 0.00141, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.001187963760457933, + "kl": 0.5750172566622496, + "learning_rate": 7.999995918107818e-06, + "loss": -0.0001, + "num_tokens": 3383638.0, + "reward": 2.043750047683716, + "reward_std": 1.1175830364227295, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.65625, + "rewards/probe_completion_length/std": 0.4825586974620819, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.78125, + "rewards/probe_shaping_dominance/std": 0.420013427734375, + "rewards/probe_terminal_raw/mean": 0.21875, + "rewards/probe_terminal_raw/std": 0.420013427734375, + "rewards/rollout_reward_func/mean": -0.5625, + "rewards/rollout_reward_func/std": 0.84002685546875, + "sampling/importance_sampling_ratio/max": 1.3601293563842773, + "sampling/importance_sampling_ratio/mean": 0.8598825931549072, + "sampling/importance_sampling_ratio/min": 0.0, + "sampling/sampling_logp_difference/max": 1.3208266496658325, + "sampling/sampling_logp_difference/mean": 0.11825218796730042, + "step": 141, + "step_time": 10.291784546998315 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.6577947102487087, + "epoch": 0.00142, + "grad_norm": 0.0006299904780462384, + "kl": 0.5920837037265301, + "learning_rate": 7.999995839987269e-06, + "loss": -0.0001, + "step": 142, + "step_time": 6.125413964000472 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 7.0, + "completions/max_terminated_length": 7.0, + "completions/mean_length": 2.5, + "completions/mean_terminated_length": 2.5, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.8532420322299004, + "epoch": 0.00143, + "frac_reward_zero_std": 1.0, + "grad_norm": 6.233860767679289e-05, + "kl": 0.057465479942038655, + "learning_rate": 7.999995761126243e-06, + "loss": 0.0, + "num_tokens": 3432038.0, + "reward": 1.5125000476837158, + "reward_std": 1.2684128284454346, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.5625, + "rewards/probe_completion_length/std": 1.268412709236145, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.3138529062271118, + "sampling/importance_sampling_ratio/mean": 0.8958837985992432, + "sampling/importance_sampling_ratio/min": 0.5682582259178162, + "sampling/sampling_logp_difference/max": 0.375757098197937, + "sampling/sampling_logp_difference/mean": 0.06977839767932892, + "step": 143, + "step_time": 10.140005126995675 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.8545014560222626, + "epoch": 0.00144, + "grad_norm": 7.701283902861178e-05, + "kl": 0.06713397847488523, + "learning_rate": 7.999995681524736e-06, + "loss": 0.0, + "step": 144, + "step_time": 6.440495836997798 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.4375, + "completions/mean_terminated_length": 2.4375, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.8347389176487923, + "epoch": 0.00145, + "frac_reward_zero_std": 1.0, + "grad_norm": 7.582701073260978e-05, + "kl": 0.21212944004219025, + "learning_rate": 7.999995601182752e-06, + "loss": 0.0, + "num_tokens": 3482547.0, + "reward": 1.3875000476837158, + "reward_std": 0.504016101360321, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.4375, + "rewards/probe_completion_length/std": 0.504016101360321, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.8214629888534546, + "sampling/importance_sampling_ratio/mean": 0.9022046327590942, + "sampling/importance_sampling_ratio/min": 0.45289722084999084, + "sampling/sampling_logp_difference/max": 0.6827032566070557, + "sampling/sampling_logp_difference/mean": 0.10910705476999283, + "step": 145, + "step_time": 10.462476491999041 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.8556515723466873, + "epoch": 0.00146, + "grad_norm": 7.53724089008756e-05, + "kl": 0.21599587588571012, + "learning_rate": 7.999995520100289e-06, + "loss": 0.0, + "step": 146, + "step_time": 6.58235243099989 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.40625, + "completions/mean_terminated_length": 2.40625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.8366929292678833, + "epoch": 0.00147, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0003870174987241626, + "kl": 0.24507740326225758, + "learning_rate": 7.999995438277348e-06, + "loss": 0.0, + "num_tokens": 3528662.0, + "reward": 1.3875000476837158, + "reward_std": 0.504016101360321, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.40625, + "rewards/probe_completion_length/std": 0.49899089336395264, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.3872897624969482, + "sampling/importance_sampling_ratio/mean": 0.8565528392791748, + "sampling/importance_sampling_ratio/min": 0.1745889037847519, + "sampling/sampling_logp_difference/max": 1.6216473579406738, + "sampling/sampling_logp_difference/mean": 0.13993701338768005, + "step": 147, + "step_time": 10.136645781998595 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.8375646397471428, + "epoch": 0.00148, + "grad_norm": 0.0006000733701512218, + "kl": 0.3029486406594515, + "learning_rate": 7.99999535571393e-06, + "loss": 0.0, + "step": 148, + "step_time": 6.332877236998684 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.5625, + "completions/mean_terminated_length": 2.5625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.7925528138875961, + "epoch": 0.00149, + "frac_reward_zero_std": 1.0, + "grad_norm": 8.313127182191238e-05, + "kl": 0.7751652393490076, + "learning_rate": 7.999995272410032e-06, + "loss": 0.0, + "num_tokens": 3578208.0, + "reward": 2.012500047683716, + "reward_std": 1.2164862155914307, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.5625, + "rewards/probe_completion_length/std": 0.504016101360321, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.291900873184204, + "sampling/importance_sampling_ratio/mean": 0.8923901319503784, + "sampling/importance_sampling_ratio/min": 0.5138108134269714, + "sampling/sampling_logp_difference/max": 0.47057437896728516, + "sampling/sampling_logp_difference/mean": 0.08149246871471405, + "step": 149, + "step_time": 10.504922516000079 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.8027943335473537, + "epoch": 0.0015, + "grad_norm": 5.7398243370698765e-05, + "kl": 0.7740726545453072, + "learning_rate": 7.999995188365656e-06, + "loss": 0.0, + "step": 150, + "step_time": 6.047526541997286 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.625, + "completions/mean_terminated_length": 2.625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.5021162088960409, + "epoch": 0.00151, + "frac_reward_zero_std": 1.0, + "grad_norm": 4.203694697935134e-05, + "kl": 0.8826476074755192, + "learning_rate": 7.999995103580802e-06, + "loss": 0.0, + "num_tokens": 3622385.0, + "reward": 2.575000047683716, + "reward_std": 1.4312187433242798, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.625, + "rewards/probe_completion_length/std": 0.49186936020851135, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.5, + "rewards/probe_shaping_dominance/std": 0.5080004930496216, + "rewards/probe_terminal_raw/mean": 0.5, + "rewards/probe_terminal_raw/std": 0.5080004930496216, + "rewards/rollout_reward_func/mean": 0.0, + "rewards/rollout_reward_func/std": 1.0160009860992432, + "sampling/importance_sampling_ratio/max": 1.629455804824829, + "sampling/importance_sampling_ratio/mean": 0.9585285186767578, + "sampling/importance_sampling_ratio/min": 0.703690767288208, + "sampling/sampling_logp_difference/max": 0.5472321510314941, + "sampling/sampling_logp_difference/mean": 0.040512826293706894, + "step": 151, + "step_time": 10.376955908001037 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.501195352524519, + "epoch": 0.00152, + "grad_norm": 4.0065049688564613e-05, + "kl": 0.8829234223812819, + "learning_rate": 7.99999501805547e-06, + "loss": 0.0, + "step": 152, + "step_time": 5.959771870997429 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.78125, + "completions/mean_terminated_length": 2.78125, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.6162157356739044, + "epoch": 0.00153, + "frac_reward_zero_std": 1.0, + "grad_norm": 8.145786705426872e-05, + "kl": 0.8375249132514, + "learning_rate": 7.99999493178966e-06, + "loss": 0.0, + "num_tokens": 3668995.0, + "reward": 2.231250047683716, + "reward_std": 1.0846248865127563, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.78125, + "rewards/probe_completion_length/std": 0.420013427734375, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 2.3910458087921143, + "sampling/importance_sampling_ratio/mean": 0.8976485729217529, + "sampling/importance_sampling_ratio/min": 0.0, + "sampling/sampling_logp_difference/max": 1.0475459098815918, + "sampling/sampling_logp_difference/mean": 0.1141430139541626, + "step": 153, + "step_time": 10.604804011001761 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.6082192212343216, + "epoch": 0.00154, + "grad_norm": 9.017075353767723e-05, + "kl": 0.8417555466294289, + "learning_rate": 7.99999484478337e-06, + "loss": 0.0, + "step": 154, + "step_time": 6.000888992999535 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.010416666977107525, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.875, + "completions/mean_terminated_length": 2.875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.4833748936653137, + "epoch": 0.00155, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0174336489289999, + "kl": 12.712480776011944, + "learning_rate": 7.999994757036603e-06, + "loss": 0.0001, + "num_tokens": 3714734.0, + "reward": 2.637500047683716, + "reward_std": 1.1482806205749512, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.875, + "rewards/probe_completion_length/std": 0.33601075410842896, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.59375, + "rewards/probe_shaping_dominance/std": 0.49899089336395264, + "rewards/probe_terminal_raw/mean": 0.40625, + "rewards/probe_terminal_raw/std": 0.49899089336395264, + "rewards/rollout_reward_func/mean": -0.1875, + "rewards/rollout_reward_func/std": 0.9979817867279053, + "sampling/importance_sampling_ratio/max": 2.032945394515991, + "sampling/importance_sampling_ratio/mean": 0.9355040192604065, + "sampling/importance_sampling_ratio/min": 0.22561033070087433, + "sampling/sampling_logp_difference/max": 1.1889557838439941, + "sampling/sampling_logp_difference/mean": 0.11608728021383286, + "step": 155, + "step_time": 10.715239364000809 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.4995018355548382, + "epoch": 0.00156, + "grad_norm": 0.003404801245778799, + "kl": 5.325677994638681, + "learning_rate": 7.999994668549356e-06, + "loss": 0.0, + "step": 156, + "step_time": 6.548639589003869 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.010416666977107525, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.5, + "completions/mean_terminated_length": 2.5, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.9601438865065575, + "epoch": 0.00157, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0019437572918832302, + "kl": 0.6555760141345672, + "learning_rate": 7.999994579321633e-06, + "loss": -0.0001, + "num_tokens": 3760285.0, + "reward": 1.7000000476837158, + "reward_std": 0.9837387204170227, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.5, + "rewards/probe_completion_length/std": 0.5080004930496216, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.875, + "rewards/probe_shaping_dominance/std": 0.33601075410842896, + "rewards/probe_terminal_raw/mean": 0.125, + "rewards/probe_terminal_raw/std": 0.33601075410842896, + "rewards/rollout_reward_func/mean": -0.75, + "rewards/rollout_reward_func/std": 0.6720215082168579, + "sampling/importance_sampling_ratio/max": 2.429400682449341, + "sampling/importance_sampling_ratio/mean": 0.8863468170166016, + "sampling/importance_sampling_ratio/min": 0.2631182074546814, + "sampling/sampling_logp_difference/max": 0.9481115341186523, + "sampling/sampling_logp_difference/mean": 0.1506330370903015, + "step": 157, + "step_time": 10.192884709997088 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.9771413132548332, + "epoch": 0.00158, + "grad_norm": 0.0026333045680075884, + "kl": 0.6077049063460436, + "learning_rate": 7.999994489353432e-06, + "loss": -0.0001, + "step": 158, + "step_time": 6.394098832000964 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 7.0, + "completions/max_terminated_length": 7.0, + "completions/mean_length": 2.96875, + "completions/mean_terminated_length": 2.96875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.5719749964773655, + "epoch": 0.00159, + "frac_reward_zero_std": 1.0, + "grad_norm": 8.808910934021696e-05, + "kl": 0.38396941107930616, + "learning_rate": 7.999994398644752e-06, + "loss": 0.0, + "num_tokens": 3810633.0, + "reward": 2.4812498092651367, + "reward_std": 1.43649160861969, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 2.03125, + "rewards/probe_completion_length/std": 1.1495966911315918, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.761324167251587, + "sampling/importance_sampling_ratio/mean": 0.8197870850563049, + "sampling/importance_sampling_ratio/min": 0.0, + "sampling/sampling_logp_difference/max": 1.5803544521331787, + "sampling/sampling_logp_difference/mean": 0.0992826372385025, + "step": 159, + "step_time": 10.46122989000105 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.574010081589222, + "epoch": 0.0016, + "grad_norm": 7.729078060947359e-05, + "kl": 0.3841613693512045, + "learning_rate": 7.999994307195594e-06, + "loss": 0.0, + "step": 160, + "step_time": 6.568957989997216 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.6875, + "completions/mean_terminated_length": 2.6875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.6980656832456589, + "epoch": 0.00161, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0001728427450871095, + "kl": 0.9108022870495915, + "learning_rate": 7.99999421500596e-06, + "loss": 0.0, + "num_tokens": 3862246.0, + "reward": 2.168750047683716, + "reward_std": 1.1283552646636963, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.6875, + "rewards/probe_completion_length/std": 0.4709290862083435, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.7241743803024292, + "sampling/importance_sampling_ratio/mean": 0.8921574354171753, + "sampling/importance_sampling_ratio/min": 0.5468968152999878, + "sampling/sampling_logp_difference/max": 0.5729777812957764, + "sampling/sampling_logp_difference/mean": 0.09277266263961792, + "step": 161, + "step_time": 10.87614541900075 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.7105224430561066, + "epoch": 0.00162, + "grad_norm": 0.00016276795940939337, + "kl": 0.9079902372322977, + "learning_rate": 7.999994122075845e-06, + "loss": 0.0, + "step": 162, + "step_time": 6.721154226997896 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 8.0, + "completions/max_terminated_length": 8.0, + "completions/mean_length": 2.53125, + "completions/mean_terminated_length": 2.53125, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.9394364431500435, + "epoch": 0.00163, + "frac_reward_zero_std": 1.0, + "grad_norm": 6.971744733164087e-05, + "kl": 0.12017604021821171, + "learning_rate": 7.999994028405253e-06, + "loss": 0.0, + "num_tokens": 3908510.0, + "reward": 1.5437500476837158, + "reward_std": 1.433681845664978, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.59375, + "rewards/probe_completion_length/std": 1.433681845664978, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.252063512802124, + "sampling/importance_sampling_ratio/mean": 0.8833824396133423, + "sampling/importance_sampling_ratio/min": 0.5937425494194031, + "sampling/sampling_logp_difference/max": 0.39126133918762207, + "sampling/sampling_logp_difference/mean": 0.09234651923179626, + "step": 163, + "step_time": 10.124098319998666 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.9440240561962128, + "epoch": 0.00164, + "grad_norm": 5.371127190301195e-05, + "kl": 0.11512814310844988, + "learning_rate": 7.999993933994183e-06, + "loss": 0.0, + "step": 164, + "step_time": 6.441034747997037 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.010416666977107525, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.90625, + "completions/mean_terminated_length": 2.90625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.7190432026982307, + "epoch": 0.00165, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.004245645832270384, + "kl": 0.8631834057159722, + "learning_rate": 7.999993838842636e-06, + "loss": 0.0, + "num_tokens": 3957494.0, + "reward": 2.231250047683716, + "reward_std": 0.8884337544441223, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.90625, + "rewards/probe_completion_length/std": 0.2961445748806, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.8125, + "rewards/probe_shaping_dominance/std": 0.3965577781200409, + "rewards/probe_terminal_raw/mean": 0.1875, + "rewards/probe_terminal_raw/std": 0.3965577781200409, + "rewards/rollout_reward_func/mean": -0.625, + "rewards/rollout_reward_func/std": 0.7931155562400818, + "sampling/importance_sampling_ratio/max": 1.784828782081604, + "sampling/importance_sampling_ratio/mean": 0.9233963489532471, + "sampling/importance_sampling_ratio/min": 0.45206698775291443, + "sampling/sampling_logp_difference/max": 0.6415358781814575, + "sampling/sampling_logp_difference/mean": 0.0921846255660057, + "step": 165, + "step_time": 10.395008625999253 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.7224007025361061, + "epoch": 0.00166, + "grad_norm": 0.004814396146684885, + "kl": 0.8468241069931537, + "learning_rate": 7.99999374295061e-06, + "loss": 0.0, + "step": 166, + "step_time": 6.5217645579959935 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 8.0, + "completions/max_terminated_length": 8.0, + "completions/mean_length": 2.78125, + "completions/mean_terminated_length": 2.78125, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.703140377998352, + "epoch": 0.00167, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0013086164835840464, + "kl": 0.5565936341881752, + "learning_rate": 7.999993646318106e-06, + "loss": -0.0001, + "num_tokens": 4001670.0, + "reward": 2.7312498092651367, + "reward_std": 1.8091946840286255, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.84375, + "rewards/probe_completion_length/std": 1.3937504291534424, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.53125, + "rewards/probe_shaping_dominance/std": 0.507007360458374, + "rewards/probe_terminal_raw/mean": 0.46875, + "rewards/probe_terminal_raw/std": 0.507007360458374, + "rewards/rollout_reward_func/mean": -0.0625, + "rewards/rollout_reward_func/std": 1.014014720916748, + "sampling/importance_sampling_ratio/max": 1.0223342180252075, + "sampling/importance_sampling_ratio/mean": 0.8933640718460083, + "sampling/importance_sampling_ratio/min": 0.4319377839565277, + "sampling/sampling_logp_difference/max": 0.7988812327384949, + "sampling/sampling_logp_difference/mean": 0.056503020226955414, + "step": 167, + "step_time": 10.640347878001194 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.7059839554131031, + "epoch": 0.00168, + "grad_norm": 0.0014117551036179066, + "kl": 0.5676930854097009, + "learning_rate": 7.999993548945123e-06, + "loss": -0.0001, + "step": 168, + "step_time": 6.005034185000113 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.5625, + "completions/mean_terminated_length": 2.5625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.6460188962519169, + "epoch": 0.00169, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.002058417769148946, + "kl": 0.8250314202159643, + "learning_rate": 7.999993450831664e-06, + "loss": -0.0, + "num_tokens": 4047467.0, + "reward": 2.450000047683716, + "reward_std": 1.4591203927993774, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.5625, + "rewards/probe_completion_length/std": 0.504016101360321, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.53125, + "rewards/probe_shaping_dominance/std": 0.507007360458374, + "rewards/probe_terminal_raw/mean": 0.46875, + "rewards/probe_terminal_raw/std": 0.507007360458374, + "rewards/rollout_reward_func/mean": -0.0625, + "rewards/rollout_reward_func/std": 1.014014720916748, + "sampling/importance_sampling_ratio/max": 1.4465869665145874, + "sampling/importance_sampling_ratio/mean": 0.930103600025177, + "sampling/importance_sampling_ratio/min": 0.6360700130462646, + "sampling/sampling_logp_difference/max": 0.5103611946105957, + "sampling/sampling_logp_difference/mean": 0.05351896956562996, + "step": 169, + "step_time": 10.101505926002574 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.012500000186264515, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.012500000186264515, + "entropy": 0.6425128392875195, + "epoch": 0.0017, + "grad_norm": 0.0008039339445531368, + "kl": 0.8195577897131443, + "learning_rate": 7.999993351977727e-06, + "loss": -0.0, + "step": 170, + "step_time": 6.393504755000322 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.96875, + "completions/mean_terminated_length": 2.96875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.4804557263851166, + "epoch": 0.00171, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0005060956464149058, + "kl": 1.3053148314356804, + "learning_rate": 7.999993252383311e-06, + "loss": 0.0, + "num_tokens": 4092174.0, + "reward": 2.450000047683716, + "reward_std": 0.8798826932907104, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.96875, + "rewards/probe_completion_length/std": 0.1767766922712326, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.7767850160598755, + "sampling/importance_sampling_ratio/mean": 0.9398790597915649, + "sampling/importance_sampling_ratio/min": 0.4483863115310669, + "sampling/sampling_logp_difference/max": 0.7272882461547852, + "sampling/sampling_logp_difference/mean": 0.0852513238787651, + "step": 171, + "step_time": 10.745308484996713 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.47462591901421547, + "epoch": 0.00172, + "grad_norm": 0.0004229886981192976, + "kl": 1.3004812747240067, + "learning_rate": 7.999993152048418e-06, + "loss": 0.0, + "step": 172, + "step_time": 5.9784996139987925 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.6875, + "completions/mean_terminated_length": 2.6875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.807799257338047, + "epoch": 0.00173, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.002302733715623617, + "kl": 1.0078366212546825, + "learning_rate": 7.999993050973047e-06, + "loss": -0.0, + "num_tokens": 4144646.0, + "reward": 2.106250047683716, + "reward_std": 1.0809009075164795, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.6875, + "rewards/probe_completion_length/std": 0.4709290862083435, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, + "rewards/probe_shaping_dominance/mean": 0.78125, + "rewards/probe_shaping_dominance/std": 0.420013427734375, + "rewards/probe_terminal_raw/mean": 0.21875, + "rewards/probe_terminal_raw/std": 0.420013427734375, + "rewards/rollout_reward_func/mean": -0.5625, + "rewards/rollout_reward_func/std": 0.84002685546875, + "sampling/importance_sampling_ratio/max": 1.0853863954544067, + "sampling/importance_sampling_ratio/mean": 0.8166617155075073, + "sampling/importance_sampling_ratio/min": 0.0, + "sampling/sampling_logp_difference/max": 2.208253860473633, + "sampling/sampling_logp_difference/mean": 0.13318130373954773, + "step": 173, + "step_time": 10.684413701004814 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.010416666977107525, + "entropy": 0.8114959076046944, + "epoch": 0.00174, + "grad_norm": 0.0003066986973863095, + "kl": 1.0182720869779587, + "learning_rate": 7.999992949157197e-06, + "loss": -0.0, + "step": 174, + "step_time": 6.4915752000015345 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.75, + "completions/mean_terminated_length": 2.75, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.629776481539011, + "epoch": 0.00175, + "frac_reward_zero_std": 1.0, + "grad_norm": 7.2035203629639e-05, + "kl": 1.204437032341957, + "learning_rate": 7.999992846600872e-06, + "loss": 0.0, + "num_tokens": 4193766.0, + "reward": 2.700000047683716, + "reward_std": 1.319823980331421, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.75, + "rewards/probe_completion_length/std": 0.4399413466453552, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.5, + "rewards/probe_shaping_dominance/std": 0.5080004930496216, + "rewards/probe_terminal_raw/mean": 0.5, + "rewards/probe_terminal_raw/std": 0.5080004930496216, + "rewards/rollout_reward_func/mean": 0.0, + "rewards/rollout_reward_func/std": 1.0160009860992432, + "sampling/importance_sampling_ratio/max": 1.4522444009780884, + "sampling/importance_sampling_ratio/mean": 0.8934487700462341, + "sampling/importance_sampling_ratio/min": 0.519263505935669, + "sampling/sampling_logp_difference/max": 0.5981459617614746, + "sampling/sampling_logp_difference/mean": 0.06508005410432816, + "step": 175, + "step_time": 10.309263899000143 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.6329386681318283, + "epoch": 0.00176, + "grad_norm": 6.6491833422333e-05, + "kl": 1.209246039390564, + "learning_rate": 7.999992743304069e-06, + "loss": 0.0, + "step": 176, + "step_time": 6.481499650000842 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.75, + "completions/mean_terminated_length": 2.75, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.8266304433345795, + "epoch": 0.00177, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0036097096744924784, + "kl": 1.0050737857818604, + "learning_rate": 7.999992639266786e-06, + "loss": -0.0001, + "num_tokens": 4238693.0, + "reward": 2.450000047683716, + "reward_std": 1.2443419694900513, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.75, + "rewards/probe_completion_length/std": 0.4399413466453552, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.625, + "rewards/probe_shaping_dominance/std": 0.49186936020851135, + "rewards/probe_terminal_raw/mean": 0.375, + "rewards/probe_terminal_raw/std": 0.49186936020851135, + "rewards/rollout_reward_func/mean": -0.25, + "rewards/rollout_reward_func/std": 0.9837387204170227, + "sampling/importance_sampling_ratio/max": 1.5838106870651245, + "sampling/importance_sampling_ratio/mean": 0.8720427751541138, + "sampling/importance_sampling_ratio/min": 0.2907257378101349, + "sampling/sampling_logp_difference/max": 1.1655175685882568, + "sampling/sampling_logp_difference/mean": 0.12054307758808136, + "step": 177, + "step_time": 10.574092776001635 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.010416666977107525, + "entropy": 0.8272599652409554, + "epoch": 0.00178, + "grad_norm": 0.0030079202260822058, + "kl": 1.0556645542383194, + "learning_rate": 7.999992534489026e-06, + "loss": -0.0002, + "step": 178, + "step_time": 5.956353588000638 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.46875, + "completions/mean_terminated_length": 2.46875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.9563344791531563, + "epoch": 0.00179, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.19224582612514496, + "kl": 27.414744553156197, + "learning_rate": 7.99999242897079e-06, + "loss": 0.0003, + "num_tokens": 4289683.0, + "reward": 1.4812500476837158, + "reward_std": 0.507007360458374, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.46875, + "rewards/probe_completion_length/std": 0.507007360458374, + "rewards/probe_invalid_count/mean": 0.0625, + "rewards/probe_invalid_count/std": 0.24593468010425568, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 2.3811004161834717, + "sampling/importance_sampling_ratio/mean": 0.8373110294342041, + "sampling/importance_sampling_ratio/min": 0.09704399853944778, + "sampling/sampling_logp_difference/max": 2.7439370155334473, + "sampling/sampling_logp_difference/mean": 0.1736406534910202, + "step": 179, + "step_time": 10.284924712994325 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 1.006806768476963, + "epoch": 0.0018, + "grad_norm": 0.00011419090878916904, + "kl": 0.5376546527259052, + "learning_rate": 7.999992322712075e-06, + "loss": 0.0, + "step": 180, + "step_time": 6.466327140999056 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.53125, + "completions/mean_terminated_length": 2.53125, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.9934074729681015, + "epoch": 0.00181, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.00010348748764954507, + "kl": 0.4358516810461879, + "learning_rate": 7.999992215712882e-06, + "loss": 0.0, + "num_tokens": 4340217.0, + "reward": 1.4812500476837158, + "reward_std": 0.507007360458374, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.53125, + "rewards/probe_completion_length/std": 0.507007360458374, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.6744569540023804, + "sampling/importance_sampling_ratio/mean": 0.8735929131507874, + "sampling/importance_sampling_ratio/min": 0.33649957180023193, + "sampling/sampling_logp_difference/max": 0.7953200340270996, + "sampling/sampling_logp_difference/mean": 0.12820304930210114, + "step": 181, + "step_time": 10.971331862001534 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.9945544302463531, + "epoch": 0.00182, + "grad_norm": 8.246089419117197e-05, + "kl": 0.4200055494438857, + "learning_rate": 7.999992107973214e-06, + "loss": 0.0, + "step": 182, + "step_time": 6.219140510998841 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.625, + "completions/mean_terminated_length": 2.625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.7094335816800594, + "epoch": 0.00183, + "frac_reward_zero_std": 1.0, + "grad_norm": 5.242080078460276e-05, + "kl": 0.7885913448408246, + "learning_rate": 7.999991999493065e-06, + "loss": 0.0, + "num_tokens": 4387730.0, + "reward": 2.106250047683716, + "reward_std": 1.1670026779174805, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.625, + "rewards/probe_completion_length/std": 0.49186936020851135, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.6966081857681274, + "sampling/importance_sampling_ratio/mean": 0.8870027661323547, + "sampling/importance_sampling_ratio/min": 0.4607382118701935, + "sampling/sampling_logp_difference/max": 0.7223583459854126, + "sampling/sampling_logp_difference/mean": 0.09794078767299652, + "step": 183, + "step_time": 10.856938010001613 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.7261061072349548, + "epoch": 0.00184, + "grad_norm": 5.3864270739723e-05, + "kl": 0.8039156263694167, + "learning_rate": 7.999991890272441e-06, + "loss": 0.0, + "step": 184, + "step_time": 6.554877020000276 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.4375, + "completions/mean_terminated_length": 2.4375, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.9915499612689018, + "epoch": 0.00185, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0001638139656279236, + "kl": 0.3966022306121886, + "learning_rate": 7.999991780311339e-06, + "loss": 0.0, + "num_tokens": 4436283.0, + "reward": 1.3875000476837158, + "reward_std": 0.504016101360321, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.4375, + "rewards/probe_completion_length/std": 0.504016101360321, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.1218667030334473, + "sampling/importance_sampling_ratio/mean": 0.8376058340072632, + "sampling/importance_sampling_ratio/min": 0.5223787426948547, + "sampling/sampling_logp_difference/max": 0.4979139566421509, + "sampling/sampling_logp_difference/mean": 0.09753336012363434, + "step": 185, + "step_time": 10.397103238996351 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.9944529607892036, + "epoch": 0.00186, + "grad_norm": 0.0002037741505773738, + "kl": 0.41308427532203496, + "learning_rate": 7.999991669609758e-06, + "loss": 0.0, + "step": 186, + "step_time": 6.079125772997941 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.6875, + "completions/mean_terminated_length": 2.6875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.8574084043502808, + "epoch": 0.00187, + "frac_reward_zero_std": 1.0, + "grad_norm": 6.410769856302068e-05, + "kl": 0.5652572922408581, + "learning_rate": 7.999991558167702e-06, + "loss": 0.0, + "num_tokens": 4486596.0, + "reward": 2.137500047683716, + "reward_std": 1.1482806205749512, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.6875, + "rewards/probe_completion_length/std": 0.4709290862083435, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.2496119737625122, + "sampling/importance_sampling_ratio/mean": 0.8870674967765808, + "sampling/importance_sampling_ratio/min": 0.5834121108055115, + "sampling/sampling_logp_difference/max": 0.5235366821289062, + "sampling/sampling_logp_difference/mean": 0.0739859938621521, + "step": 187, + "step_time": 11.321346915003232 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.8521995544433594, + "epoch": 0.00188, + "grad_norm": 8.741193596506491e-05, + "kl": 0.5736883021891117, + "learning_rate": 7.999991445985168e-06, + "loss": 0.0, + "step": 188, + "step_time": 6.144208559999242 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.5, + "completions/mean_terminated_length": 2.5, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 1.0526561886072159, + "epoch": 0.00189, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.001028874539770186, + "kl": 1.272516742348671, + "learning_rate": 7.999991333062156e-06, + "loss": -0.0, + "num_tokens": 4536529.0, + "reward": 1.9500000476837158, + "reward_std": 1.1639753580093384, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.5, + "rewards/probe_completion_length/std": 0.5080004930496216, + "rewards/probe_invalid_count/mean": 0.0625, + "rewards/probe_invalid_count/std": 0.24593468010425568, + "rewards/probe_shaping_dominance/mean": 0.78125, + "rewards/probe_shaping_dominance/std": 0.420013427734375, + "rewards/probe_terminal_raw/mean": 0.21875, + "rewards/probe_terminal_raw/std": 0.420013427734375, + "rewards/rollout_reward_func/mean": -0.5625, + "rewards/rollout_reward_func/std": 0.84002685546875, + "sampling/importance_sampling_ratio/max": 1.0940581560134888, + "sampling/importance_sampling_ratio/mean": 0.7959468364715576, + "sampling/importance_sampling_ratio/min": 0.2429058998823166, + "sampling/sampling_logp_difference/max": 1.2627379894256592, + "sampling/sampling_logp_difference/mean": 0.12562313675880432, + "step": 189, + "step_time": 10.402327937001246 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 1.065488561987877, + "epoch": 0.0019, + "grad_norm": 0.001191383576951921, + "kl": 1.275945134460926, + "learning_rate": 7.999991219398665e-06, + "loss": -0.0, + "step": 190, + "step_time": 6.978599280002527 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.75, + "completions/mean_terminated_length": 2.75, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.6991342566907406, + "epoch": 0.00191, + "frac_reward_zero_std": 0.5, + "grad_norm": 0.003211932023987174, + "kl": 1.2787420004606247, + "learning_rate": 7.999991104994699e-06, + "loss": -0.0, + "num_tokens": 4583658.0, + "reward": 2.481250047683716, + "reward_std": 1.217728614807129, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.75, + "rewards/probe_completion_length/std": 0.4399413466453552, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, + "rewards/probe_shaping_dominance/mean": 0.625, + "rewards/probe_shaping_dominance/std": 0.49186936020851135, + "rewards/probe_terminal_raw/mean": 0.375, + "rewards/probe_terminal_raw/std": 0.49186936020851135, + "rewards/rollout_reward_func/mean": -0.25, + "rewards/rollout_reward_func/std": 0.9837387204170227, + "sampling/importance_sampling_ratio/max": 2.2873668670654297, + "sampling/importance_sampling_ratio/mean": 0.9257216453552246, + "sampling/importance_sampling_ratio/min": 0.3881727457046509, + "sampling/sampling_logp_difference/max": 0.6430342197418213, + "sampling/sampling_logp_difference/mean": 0.07942712306976318, + "step": 191, + "step_time": 10.453309778997209 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.7310865595936775, + "epoch": 0.00192, + "grad_norm": 0.0032008851412683725, + "kl": 1.2862421348690987, + "learning_rate": 7.999990989850255e-06, + "loss": -0.0, + "step": 192, + "step_time": 6.171673715001816 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.59375, + "completions/mean_terminated_length": 2.59375, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 1.0412884652614594, + "epoch": 0.00193, + "frac_reward_zero_std": 1.0, + "grad_norm": 8.30803910503164e-05, + "kl": 0.630632733926177, + "learning_rate": 7.999990873965335e-06, + "loss": 0.0, + "num_tokens": 4627596.0, + "reward": 2.043750047683716, + "reward_std": 1.201058030128479, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.59375, + "rewards/probe_completion_length/std": 0.49899089336395264, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.054891586303711, + "sampling/importance_sampling_ratio/mean": 0.810993492603302, + "sampling/importance_sampling_ratio/min": 0.41359296441078186, + "sampling/sampling_logp_difference/max": 0.6084898710250854, + "sampling/sampling_logp_difference/mean": 0.10015879571437836, + "step": 193, + "step_time": 10.796586937998654 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 1.0507173761725426, + "epoch": 0.00194, + "grad_norm": 7.215689402073622e-05, + "kl": 0.6144167594611645, + "learning_rate": 7.999990757339936e-06, + "loss": 0.0, + "step": 194, + "step_time": 6.40111261399943 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.75, + "completions/mean_terminated_length": 2.75, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.8254596032202244, + "epoch": 0.00195, + "frac_reward_zero_std": 0.5, + "grad_norm": 0.004149310756474733, + "kl": 0.899990651756525, + "learning_rate": 7.99999063997406e-06, + "loss": -0.0, + "num_tokens": 4673616.0, + "reward": 2.387500047683716, + "reward_std": 1.1341474056243896, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.75, + "rewards/probe_completion_length/std": 0.4399413466453552, + "rewards/probe_invalid_count/mean": 0.0625, + "rewards/probe_invalid_count/std": 0.24593468010425568, + "rewards/probe_shaping_dominance/mean": 0.6875, + "rewards/probe_shaping_dominance/std": 0.4709290862083435, + "rewards/probe_terminal_raw/mean": 0.3125, + "rewards/probe_terminal_raw/std": 0.4709290862083435, + "rewards/rollout_reward_func/mean": -0.375, + "rewards/rollout_reward_func/std": 0.941858172416687, + "sampling/importance_sampling_ratio/max": 2.481459617614746, + "sampling/importance_sampling_ratio/mean": 0.912665843963623, + "sampling/importance_sampling_ratio/min": 0.422697514295578, + "sampling/sampling_logp_difference/max": 1.0106472969055176, + "sampling/sampling_logp_difference/mean": 0.10286978632211685, + "step": 195, + "step_time": 10.227664049005398 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.8312117978930473, + "epoch": 0.00196, + "grad_norm": 0.003811546601355076, + "kl": 0.9109130464494228, + "learning_rate": 7.999990521867708e-06, + "loss": -0.0, + "step": 196, + "step_time": 5.968241761005629 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.010416666977107525, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.78125, + "completions/mean_terminated_length": 2.78125, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.6872108224779367, + "epoch": 0.00197, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.004832283593714237, + "kl": 1.1143165528774261, + "learning_rate": 7.999990403020877e-06, + "loss": -0.0, + "num_tokens": 4718553.0, + "reward": 2.981250047683716, + "reward_std": 1.2309025526046753, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.78125, + "rewards/probe_completion_length/std": 0.420013427734375, + "rewards/probe_invalid_count/mean": 0.0625, + "rewards/probe_invalid_count/std": 0.24593468010425568, + "rewards/probe_shaping_dominance/mean": 0.40625, + "rewards/probe_shaping_dominance/std": 0.49899089336395264, + "rewards/probe_terminal_raw/mean": 0.59375, + "rewards/probe_terminal_raw/std": 0.49899089336395264, + "rewards/rollout_reward_func/mean": 0.1875, + "rewards/rollout_reward_func/std": 0.9979817867279053, + "sampling/importance_sampling_ratio/max": 2.1045405864715576, + "sampling/importance_sampling_ratio/mean": 0.91827791929245, + "sampling/importance_sampling_ratio/min": 0.3359697759151459, + "sampling/sampling_logp_difference/max": 0.6300592422485352, + "sampling/sampling_logp_difference/mean": 0.08973179757595062, + "step": 197, + "step_time": 10.412749872004497 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.012500000186264515, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.012500000186264515, + "entropy": 0.6796288043260574, + "epoch": 0.00198, + "grad_norm": 0.003753152908757329, + "kl": 1.1087056770920753, + "learning_rate": 7.99999028343357e-06, + "loss": -0.0, + "step": 198, + "step_time": 6.329036179002287 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.28125, + "completions/mean_terminated_length": 2.28125, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 1.141590729355812, + "epoch": 0.00199, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.00013130051956977695, + "kl": 0.556044090539217, + "learning_rate": 7.999990163105786e-06, + "loss": 0.0, + "num_tokens": 4768882.0, + "reward": 1.2625000476837158, + "reward_std": 0.4709290862083435, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.28125, + "rewards/probe_completion_length/std": 0.45680341124534607, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.2970432043075562, + "sampling/importance_sampling_ratio/mean": 0.8648799657821655, + "sampling/importance_sampling_ratio/min": 0.4939647912979126, + "sampling/sampling_logp_difference/max": 0.5484317541122437, + "sampling/sampling_logp_difference/mean": 0.0925663411617279, + "step": 199, + "step_time": 10.656357334992208 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 1.1397154033184052, + "epoch": 0.002, + "grad_norm": 0.0001412595302099362, + "kl": 0.5653671575710177, + "learning_rate": 7.999990042037526e-06, + "loss": 0.0, + "step": 200, + "step_time": 6.58979152199754 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.65625, + "completions/mean_terminated_length": 2.65625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.7849503941833973, + "epoch": 0.00201, + "frac_reward_zero_std": 1.0, + "grad_norm": 7.498179911635816e-05, + "kl": 0.4783276170492172, + "learning_rate": 7.999989920228787e-06, + "loss": 0.0, + "num_tokens": 4821237.0, + "reward": 1.6375000476837158, + "reward_std": 0.4709290862083435, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.65625, + "rewards/probe_completion_length/std": 0.4825586974620819, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.0180549621582031, + "sampling/importance_sampling_ratio/mean": 0.8009990453720093, + "sampling/importance_sampling_ratio/min": 0.0, + "sampling/sampling_logp_difference/max": 1.3470954895019531, + "sampling/sampling_logp_difference/mean": 0.10532090812921524, + "step": 201, + "step_time": 11.064135296004679 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.7881440408527851, + "epoch": 0.00202, + "grad_norm": 6.508245132863522e-05, + "kl": 0.47384951170533895, + "learning_rate": 7.999989797679573e-06, + "loss": 0.0, + "step": 202, + "step_time": 6.172993056996347 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.46875, + "completions/mean_terminated_length": 2.46875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.8023708537220955, + "epoch": 0.00203, + "frac_reward_zero_std": 1.0, + "grad_norm": 6.408317130990326e-05, + "kl": 0.8568143546581268, + "learning_rate": 7.99998967438988e-06, + "loss": 0.0, + "num_tokens": 4870596.0, + "reward": 1.9187500476837158, + "reward_std": 1.256836175918579, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.46875, + "rewards/probe_completion_length/std": 0.507007360458374, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.5898252725601196, + "sampling/importance_sampling_ratio/mean": 0.9197790026664734, + "sampling/importance_sampling_ratio/min": 0.5250067710876465, + "sampling/sampling_logp_difference/max": 0.5478343963623047, + "sampling/sampling_logp_difference/mean": 0.08068203181028366, + "step": 203, + "step_time": 11.039577664003446 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.79852594435215, + "epoch": 0.00204, + "grad_norm": 6.818693509558216e-05, + "kl": 0.853181466460228, + "learning_rate": 7.999989550359713e-06, + "loss": 0.0, + "step": 204, + "step_time": 6.251118393007346 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 6.0, + "completions/max_terminated_length": 6.0, + "completions/mean_length": 2.8125, + "completions/mean_terminated_length": 2.8125, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.7093328069895506, + "epoch": 0.00205, + "frac_reward_zero_std": 1.0, + "grad_norm": 4.685792373493314e-05, + "kl": 0.4763212539255619, + "learning_rate": 7.999989425589066e-06, + "loss": 0.0, + "num_tokens": 4913584.0, + "reward": 2.8874998092651367, + "reward_std": 1.9827888011932373, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.9375, + "rewards/probe_completion_length/std": 1.3663583993911743, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.5, + "rewards/probe_shaping_dominance/std": 0.5080004930496216, + "rewards/probe_terminal_raw/mean": 0.5, + "rewards/probe_terminal_raw/std": 0.5080004930496216, + "rewards/rollout_reward_func/mean": 0.0, + "rewards/rollout_reward_func/std": 1.0160009860992432, + "sampling/importance_sampling_ratio/max": 1.5179897546768188, + "sampling/importance_sampling_ratio/mean": 0.88746577501297, + "sampling/importance_sampling_ratio/min": 0.3754726052284241, + "sampling/sampling_logp_difference/max": 0.4877147078514099, + "sampling/sampling_logp_difference/mean": 0.07970255613327026, + "step": 205, + "step_time": 10.986664464006026 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.7166115269064903, + "epoch": 0.00206, + "grad_norm": 4.5046446757623926e-05, + "kl": 0.4816902196034789, + "learning_rate": 7.999989300077943e-06, + "loss": 0.0, + "step": 206, + "step_time": 6.086353101003624 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.65625, + "completions/mean_terminated_length": 2.65625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.8723455891013145, + "epoch": 0.00207, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0012270144652575254, + "kl": 0.8632536679506302, + "learning_rate": 7.999989173826344e-06, + "loss": -0.0, + "num_tokens": 4958457.0, + "reward": 2.043750047683716, + "reward_std": 1.1175830364227295, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.65625, + "rewards/probe_completion_length/std": 0.4825586974620819, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.78125, + "rewards/probe_shaping_dominance/std": 0.420013427734375, + "rewards/probe_terminal_raw/mean": 0.21875, + "rewards/probe_terminal_raw/std": 0.420013427734375, + "rewards/rollout_reward_func/mean": -0.5625, + "rewards/rollout_reward_func/std": 0.84002685546875, + "sampling/importance_sampling_ratio/max": 1.7422419786453247, + "sampling/importance_sampling_ratio/mean": 0.9141074419021606, + "sampling/importance_sampling_ratio/min": 0.48550355434417725, + "sampling/sampling_logp_difference/max": 0.6161445379257202, + "sampling/sampling_logp_difference/mean": 0.10230092704296112, + "step": 207, + "step_time": 11.013585381002486 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.8756029158830643, + "epoch": 0.00208, + "grad_norm": 0.0018850122578442097, + "kl": 0.8681657090783119, + "learning_rate": 7.999989046834267e-06, + "loss": -0.0, + "step": 208, + "step_time": 6.54996490999838 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.40625, + "completions/mean_terminated_length": 2.40625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.8442556709051132, + "epoch": 0.00209, + "frac_reward_zero_std": 1.0, + "grad_norm": 7.671785715501755e-05, + "kl": 0.25706048402935266, + "learning_rate": 7.999988919101714e-06, + "loss": 0.0, + "num_tokens": 5008907.0, + "reward": 1.8562500476837158, + "reward_std": 1.2790968418121338, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.40625, + "rewards/probe_completion_length/std": 0.49899089336395264, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.6340703964233398, + "sampling/importance_sampling_ratio/mean": 0.915661633014679, + "sampling/importance_sampling_ratio/min": 0.49133455753326416, + "sampling/sampling_logp_difference/max": 0.6653378009796143, + "sampling/sampling_logp_difference/mean": 0.08885866403579712, + "step": 209, + "step_time": 10.901209290004772 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.8593077808618546, + "epoch": 0.0021, + "grad_norm": 7.776657730573788e-05, + "kl": 0.25858927180524915, + "learning_rate": 7.999988790628685e-06, + "loss": 0.0, + "step": 210, + "step_time": 6.60464191400024 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.46875, + "completions/mean_terminated_length": 2.46875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.9752853065729141, + "epoch": 0.00211, + "frac_reward_zero_std": 1.0, + "grad_norm": 6.485899939434603e-05, + "kl": 0.8968196660280228, + "learning_rate": 7.999988661415179e-06, + "loss": 0.0, + "num_tokens": 5058874.0, + "reward": 1.9187500476837158, + "reward_std": 1.256836175918579, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.46875, + "rewards/probe_completion_length/std": 0.507007360458374, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.2495969533920288, + "sampling/importance_sampling_ratio/mean": 0.8685529828071594, + "sampling/importance_sampling_ratio/min": 0.2667645215988159, + "sampling/sampling_logp_difference/max": 0.712754487991333, + "sampling/sampling_logp_difference/mean": 0.09404490143060684, + "step": 211, + "step_time": 10.649947939000413 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.9733599200844765, + "epoch": 0.00212, + "grad_norm": 0.00013666889572050422, + "kl": 0.9042137414216995, + "learning_rate": 7.999988531461196e-06, + "loss": 0.0, + "step": 212, + "step_time": 6.069883871998172 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.010416666977107525, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 3.0, + "completions/mean_terminated_length": 3.0, + "completions/min_length": 3.0, + "completions/min_terminated_length": 3.0, + "entropy": 0.46625126898288727, + "epoch": 0.00213, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0016473316354677081, + "kl": 1.0760606080293655, + "learning_rate": 7.999988400766736e-06, + "loss": -0.0001, + "num_tokens": 5101108.0, + "reward": 2.825000047683716, + "reward_std": 1.008032202720642, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 2.0, + "rewards/probe_completion_length/std": 0.0, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.5625, + "rewards/probe_shaping_dominance/std": 0.504016101360321, + "rewards/probe_terminal_raw/mean": 0.4375, + "rewards/probe_terminal_raw/std": 0.504016101360321, + "rewards/rollout_reward_func/mean": -0.125, + "rewards/rollout_reward_func/std": 1.008032202720642, + "sampling/importance_sampling_ratio/max": 1.167366862297058, + "sampling/importance_sampling_ratio/mean": 0.8593387603759766, + "sampling/importance_sampling_ratio/min": 0.0, + "sampling/sampling_logp_difference/max": 1.4293286800384521, + "sampling/sampling_logp_difference/mean": 0.08223744481801987, + "step": 213, + "step_time": 10.10010305000469 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.4646361842751503, + "epoch": 0.00214, + "grad_norm": 0.0016178693622350693, + "kl": 1.0777288749814034, + "learning_rate": 7.999988269331798e-06, + "loss": -0.0001, + "step": 214, + "step_time": 6.137445069991372 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.625, + "completions/mean_terminated_length": 2.625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.7770780473947525, + "epoch": 0.00215, + "frac_reward_zero_std": 1.0, + "grad_norm": 5.397374843596481e-05, + "kl": 0.5911668723565526, + "learning_rate": 7.999988137156384e-06, + "loss": 0.0, + "num_tokens": 5150061.0, + "reward": 2.137500047683716, + "reward_std": 1.1482806205749512, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.625, + "rewards/probe_completion_length/std": 0.49186936020851135, + "rewards/probe_invalid_count/mean": 0.0625, + "rewards/probe_invalid_count/std": 0.24593468010425568, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.0535258054733276, + "sampling/importance_sampling_ratio/mean": 0.8605695366859436, + "sampling/importance_sampling_ratio/min": 0.0, + "sampling/sampling_logp_difference/max": 0.7591410875320435, + "sampling/sampling_logp_difference/mean": 0.06761947274208069, + "step": 215, + "step_time": 11.162840143999347 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.7721757888793945, + "epoch": 0.00216, + "grad_norm": 4.8849575250642374e-05, + "kl": 0.5854438902752008, + "learning_rate": 7.999988004240496e-06, + "loss": 0.0, + "step": 216, + "step_time": 6.620968937997532 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 6.0, + "completions/max_terminated_length": 6.0, + "completions/mean_length": 2.71875, + "completions/mean_terminated_length": 2.71875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.8704147189855576, + "epoch": 0.00217, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0052342345006763935, + "kl": 1.4794844314455986, + "learning_rate": 7.99998787058413e-06, + "loss": -0.0002, + "num_tokens": 5196138.0, + "reward": 2.4499998092651367, + "reward_std": 1.4142134189605713, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.6875, + "rewards/probe_completion_length/std": 0.6444552540779114, + "rewards/probe_invalid_count/mean": 0.0625, + "rewards/probe_invalid_count/std": 0.24593468010425568, + "rewards/probe_shaping_dominance/mean": 0.625, + "rewards/probe_shaping_dominance/std": 0.49186936020851135, + "rewards/probe_terminal_raw/mean": 0.375, + "rewards/probe_terminal_raw/std": 0.49186936020851135, + "rewards/rollout_reward_func/mean": -0.25, + "rewards/rollout_reward_func/std": 0.9837387204170227, + "sampling/importance_sampling_ratio/max": 2.6132655143737793, + "sampling/importance_sampling_ratio/mean": 0.9866353273391724, + "sampling/importance_sampling_ratio/min": 0.4762972295284271, + "sampling/sampling_logp_difference/max": 1.020547866821289, + "sampling/sampling_logp_difference/mean": 0.10512237250804901, + "step": 217, + "step_time": 10.2226877480025 + }, + { + "clip_ratio/high_max": 0.02500000037252903, + "clip_ratio/high_mean": 0.012500000186264515, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.012500000186264515, + "entropy": 0.8628628179430962, + "epoch": 0.00218, + "grad_norm": 0.0029307743534445763, + "kl": 1.4838937148451805, + "learning_rate": 7.999987736187286e-06, + "loss": -0.0002, + "step": 218, + "step_time": 6.426789073000691 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.46875, + "completions/mean_terminated_length": 2.46875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 1.0259061381220818, + "epoch": 0.00219, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.00010930380813078955, + "kl": 0.5639023052062839, + "learning_rate": 7.999987601049967e-06, + "loss": 0.0, + "num_tokens": 5245170.0, + "reward": 1.4500000476837158, + "reward_std": 0.5080004930496216, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.46875, + "rewards/probe_completion_length/std": 0.507007360458374, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.3624612092971802, + "sampling/importance_sampling_ratio/mean": 0.844344437122345, + "sampling/importance_sampling_ratio/min": 0.4004921317100525, + "sampling/sampling_logp_difference/max": 0.6055986285209656, + "sampling/sampling_logp_difference/mean": 0.11378584802150726, + "step": 219, + "step_time": 10.458324788000027 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 1.0160942673683167, + "epoch": 0.0022, + "grad_norm": 0.00012425951717887074, + "kl": 0.5864044599002227, + "learning_rate": 7.99998746517217e-06, + "loss": 0.0, + "step": 220, + "step_time": 6.467661736995069 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.6875, + "completions/mean_terminated_length": 2.6875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.7942183464765549, + "epoch": 0.00221, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.00020853157911915332, + "kl": 1.2455565556883812, + "learning_rate": 7.999987328553901e-06, + "loss": 0.0, + "num_tokens": 5291449.0, + "reward": 2.637500047683716, + "reward_std": 1.3781123161315918, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.6875, + "rewards/probe_completion_length/std": 0.4709290862083435, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.5, + "rewards/probe_shaping_dominance/std": 0.5080004930496216, + "rewards/probe_terminal_raw/mean": 0.5, + "rewards/probe_terminal_raw/std": 0.5080004930496216, + "rewards/rollout_reward_func/mean": 0.0, + "rewards/rollout_reward_func/std": 1.0160009860992432, + "sampling/importance_sampling_ratio/max": 1.0300960540771484, + "sampling/importance_sampling_ratio/mean": 0.8702289462089539, + "sampling/importance_sampling_ratio/min": 0.3828960061073303, + "sampling/sampling_logp_difference/max": 0.6364970803260803, + "sampling/sampling_logp_difference/mean": 0.06992574036121368, + "step": 221, + "step_time": 10.272284876999038 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.7945832386612892, + "epoch": 0.00222, + "grad_norm": 0.0002857858780771494, + "kl": 1.2918191030621529, + "learning_rate": 7.999987191195152e-06, + "loss": 0.0, + "step": 222, + "step_time": 6.413851582001371 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 8.0, + "completions/max_terminated_length": 8.0, + "completions/mean_length": 2.65625, + "completions/mean_terminated_length": 2.65625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.9415403008460999, + "epoch": 0.00223, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0001786091597750783, + "kl": 0.562560040736571, + "learning_rate": 7.999987053095927e-06, + "loss": 0.0, + "num_tokens": 5339889.0, + "reward": 1.6687500476837158, + "reward_std": 1.419549584388733, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.71875, + "rewards/probe_completion_length/std": 1.419549584388733, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.315468192100525, + "sampling/importance_sampling_ratio/mean": 0.8730629682540894, + "sampling/importance_sampling_ratio/min": 0.31209444999694824, + "sampling/sampling_logp_difference/max": 0.8552637100219727, + "sampling/sampling_logp_difference/mean": 0.11184488236904144, + "step": 223, + "step_time": 10.758617721003247 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.9381839409470558, + "epoch": 0.00224, + "grad_norm": 0.0001709387288428843, + "kl": 0.5639883282128721, + "learning_rate": 7.999986914256228e-06, + "loss": 0.0, + "step": 224, + "step_time": 6.104447362009523 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.59375, + "completions/mean_terminated_length": 2.59375, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.9080767035484314, + "epoch": 0.00225, + "frac_reward_zero_std": 1.0, + "grad_norm": 6.229980499483645e-05, + "kl": 0.5537053542211652, + "learning_rate": 7.99998677467605e-06, + "loss": 0.0, + "num_tokens": 5386034.0, + "reward": 2.043750047683716, + "reward_std": 1.201058030128479, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.59375, + "rewards/probe_completion_length/std": 0.49899089336395264, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.6336270570755005, + "sampling/importance_sampling_ratio/mean": 0.8878433704376221, + "sampling/importance_sampling_ratio/min": 0.43646904826164246, + "sampling/sampling_logp_difference/max": 0.5756676197052002, + "sampling/sampling_logp_difference/mean": 0.09019757807254791, + "step": 225, + "step_time": 10.606267559003754 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.9127962365746498, + "epoch": 0.00226, + "grad_norm": 0.00010429656686028466, + "kl": 0.5661568846553564, + "learning_rate": 7.999986634355396e-06, + "loss": 0.0, + "step": 226, + "step_time": 6.377675234001799 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.625, + "completions/mean_terminated_length": 2.625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.7270364388823509, + "epoch": 0.00227, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.001110205426812172, + "kl": 0.8677254151552916, + "learning_rate": 7.999986493294267e-06, + "loss": -0.0001, + "num_tokens": 5433028.0, + "reward": 2.012500047683716, + "reward_std": 1.1341474056243896, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.625, + "rewards/probe_completion_length/std": 0.49186936020851135, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.78125, + "rewards/probe_shaping_dominance/std": 0.420013427734375, + "rewards/probe_terminal_raw/mean": 0.21875, + "rewards/probe_terminal_raw/std": 0.420013427734375, + "rewards/rollout_reward_func/mean": -0.5625, + "rewards/rollout_reward_func/std": 0.84002685546875, + "sampling/importance_sampling_ratio/max": 1.4258241653442383, + "sampling/importance_sampling_ratio/mean": 0.8710789680480957, + "sampling/importance_sampling_ratio/min": 0.4317016899585724, + "sampling/sampling_logp_difference/max": 0.5112519264221191, + "sampling/sampling_logp_difference/mean": 0.07224301993846893, + "step": 227, + "step_time": 10.239040989999921 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.012500000186264515, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.012500000186264515, + "entropy": 0.7276543751358986, + "epoch": 0.00228, + "grad_norm": 0.0005440651439130306, + "kl": 0.8701613224111497, + "learning_rate": 7.99998635149266e-06, + "loss": -0.0001, + "step": 228, + "step_time": 6.392367521002598 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.3125, + "completions/mean_terminated_length": 2.3125, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.8749295771121979, + "epoch": 0.00229, + "frac_reward_zero_std": 1.0, + "grad_norm": 5.688122837455012e-05, + "kl": 0.8051012456417084, + "learning_rate": 7.99998620895058e-06, + "loss": 0.0, + "num_tokens": 5482999.0, + "reward": 1.7625000476837158, + "reward_std": 1.3060035705566406, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.3125, + "rewards/probe_completion_length/std": 0.4709290862083435, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.0076409578323364, + "sampling/importance_sampling_ratio/mean": 0.8914170265197754, + "sampling/importance_sampling_ratio/min": 0.4969307780265808, + "sampling/sampling_logp_difference/max": 0.6112143993377686, + "sampling/sampling_logp_difference/mean": 0.061925433576107025, + "step": 229, + "step_time": 10.120951806002267 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.8805720470845699, + "epoch": 0.0023, + "grad_norm": 7.190956239355728e-05, + "kl": 0.8146018832921982, + "learning_rate": 7.999986065668021e-06, + "loss": 0.0, + "step": 230, + "step_time": 6.449205146993336 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.75, + "completions/mean_terminated_length": 2.75, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.7620595321059227, + "epoch": 0.00231, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0013680045958608389, + "kl": 0.9012337774038315, + "learning_rate": 7.999985921644988e-06, + "loss": -0.0, + "num_tokens": 5534461.0, + "reward": 2.575000047683716, + "reward_std": 1.2115039825439453, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.75, + "rewards/probe_completion_length/std": 0.4399413466453552, + "rewards/probe_invalid_count/mean": 0.0625, + "rewards/probe_invalid_count/std": 0.24593468010425568, + "rewards/probe_shaping_dominance/mean": 0.59375, + "rewards/probe_shaping_dominance/std": 0.49899089336395264, + "rewards/probe_terminal_raw/mean": 0.40625, + "rewards/probe_terminal_raw/std": 0.49899089336395264, + "rewards/rollout_reward_func/mean": -0.1875, + "rewards/rollout_reward_func/std": 0.9979817867279053, + "sampling/importance_sampling_ratio/max": 1.1274982690811157, + "sampling/importance_sampling_ratio/mean": 0.9018195867538452, + "sampling/importance_sampling_ratio/min": 0.5811653733253479, + "sampling/sampling_logp_difference/max": 0.36220109462738037, + "sampling/sampling_logp_difference/mean": 0.06346160173416138, + "step": 231, + "step_time": 10.549801017998107 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.7599871978163719, + "epoch": 0.00232, + "grad_norm": 0.0014168447814881802, + "kl": 0.8976461552083492, + "learning_rate": 7.999985776881479e-06, + "loss": -0.0, + "step": 232, + "step_time": 6.024789627001155 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.8125, + "completions/mean_terminated_length": 2.8125, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.5355990715324879, + "epoch": 0.00233, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0005481232656165957, + "kl": 1.2369797490537167, + "learning_rate": 7.999985631377493e-06, + "loss": 0.0, + "num_tokens": 5581452.0, + "reward": 2.356250047683716, + "reward_std": 0.9791166186332703, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.8125, + "rewards/probe_completion_length/std": 0.3965577781200409, + "rewards/probe_invalid_count/mean": 0.09375, + "rewards/probe_invalid_count/std": 0.2961445748806, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 2.715548276901245, + "sampling/importance_sampling_ratio/mean": 0.9138860702514648, + "sampling/importance_sampling_ratio/min": 0.0, + "sampling/sampling_logp_difference/max": 0.8808169364929199, + "sampling/sampling_logp_difference/mean": 0.07896264642477036, + "step": 233, + "step_time": 10.495318596003926 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.5403720252215862, + "epoch": 0.00234, + "grad_norm": 0.00044476837501861155, + "kl": 1.1751796454191208, + "learning_rate": 7.99998548513303e-06, + "loss": 0.0, + "step": 234, + "step_time": 6.561843382994994 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 8.0, + "completions/max_terminated_length": 8.0, + "completions/mean_length": 2.625, + "completions/mean_terminated_length": 2.625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.8650138974189758, + "epoch": 0.00235, + "frac_reward_zero_std": 1.0, + "grad_norm": 6.707937427563593e-05, + "kl": 0.4425021205097437, + "learning_rate": 7.999985338148094e-06, + "loss": 0.0, + "num_tokens": 5630802.0, + "reward": 2.106250047683716, + "reward_std": 1.6482517719268799, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.65625, + "rewards/probe_completion_length/std": 1.260040283203125, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.0173451900482178, + "sampling/importance_sampling_ratio/mean": 0.832526683807373, + "sampling/importance_sampling_ratio/min": 0.4567889869213104, + "sampling/sampling_logp_difference/max": 0.6054009199142456, + "sampling/sampling_logp_difference/mean": 0.08154759556055069, + "step": 235, + "step_time": 10.582841627998278 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.8746358342468739, + "epoch": 0.00236, + "grad_norm": 6.966207001823932e-05, + "kl": 0.44809109810739756, + "learning_rate": 7.99998519042268e-06, + "loss": 0.0, + "step": 236, + "step_time": 6.058184577999782 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.71875, + "completions/mean_terminated_length": 2.71875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.7308623269200325, + "epoch": 0.00237, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.001439909916371107, + "kl": 1.1790881492197514, + "learning_rate": 7.99998504195679e-06, + "loss": -0.0001, + "num_tokens": 5679602.0, + "reward": 2.606250047683716, + "reward_std": 1.334634780883789, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.71875, + "rewards/probe_completion_length/std": 0.45680341124534607, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.53125, + "rewards/probe_shaping_dominance/std": 0.507007360458374, + "rewards/probe_terminal_raw/mean": 0.46875, + "rewards/probe_terminal_raw/std": 0.507007360458374, + "rewards/rollout_reward_func/mean": -0.0625, + "rewards/rollout_reward_func/std": 1.014014720916748, + "sampling/importance_sampling_ratio/max": 1.0316462516784668, + "sampling/importance_sampling_ratio/mean": 0.8544725179672241, + "sampling/importance_sampling_ratio/min": 0.35368672013282776, + "sampling/sampling_logp_difference/max": 0.954663097858429, + "sampling/sampling_logp_difference/mean": 0.07331576198339462, + "step": 237, + "step_time": 10.655074249996687 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.7382760606706142, + "epoch": 0.00238, + "grad_norm": 0.0011140814749523997, + "kl": 1.187925398349762, + "learning_rate": 7.999984892750425e-06, + "loss": -0.0001, + "step": 238, + "step_time": 6.463060008994944 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.75, + "completions/mean_terminated_length": 2.75, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.703517246991396, + "epoch": 0.00239, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.00014675941201858222, + "kl": 0.36108433303888887, + "learning_rate": 7.999984742803586e-06, + "loss": 0.0, + "num_tokens": 5727504.0, + "reward": 2.200000047683716, + "reward_std": 1.1071614027023315, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.75, + "rewards/probe_completion_length/std": 0.4399413466453552, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.7017192840576172, + "sampling/importance_sampling_ratio/mean": 0.8461993336677551, + "sampling/importance_sampling_ratio/min": 0.0, + "sampling/sampling_logp_difference/max": 1.3302104473114014, + "sampling/sampling_logp_difference/mean": 0.08808484673500061, + "step": 239, + "step_time": 10.698553490001359 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.7034162953495979, + "epoch": 0.0024, + "grad_norm": 0.00018220754282083362, + "kl": 0.3764014449552633, + "learning_rate": 7.999984592116268e-06, + "loss": 0.0, + "step": 240, + "step_time": 6.1949155629990855 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.65625, + "completions/mean_terminated_length": 2.65625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.7459230236709118, + "epoch": 0.00241, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.001529884641058743, + "kl": 1.4907125178724527, + "learning_rate": 7.999984440688477e-06, + "loss": -0.0, + "num_tokens": 5777870.0, + "reward": 2.481250047683716, + "reward_std": 1.3674646615982056, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.65625, + "rewards/probe_completion_length/std": 0.4825586974620819, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.5625, + "rewards/probe_shaping_dominance/std": 0.504016101360321, + "rewards/probe_terminal_raw/mean": 0.4375, + "rewards/probe_terminal_raw/std": 0.504016101360321, + "rewards/rollout_reward_func/mean": -0.125, + "rewards/rollout_reward_func/std": 1.008032202720642, + "sampling/importance_sampling_ratio/max": 1.2580219507217407, + "sampling/importance_sampling_ratio/mean": 0.8700110912322998, + "sampling/importance_sampling_ratio/min": 0.267679363489151, + "sampling/sampling_logp_difference/max": 1.1994649171829224, + "sampling/sampling_logp_difference/mean": 0.09447018057107925, + "step": 241, + "step_time": 11.393658771001355 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.7403427213430405, + "epoch": 0.00242, + "grad_norm": 0.0016185626154765487, + "kl": 1.494697978720069, + "learning_rate": 7.999984288520209e-06, + "loss": -0.0, + "step": 242, + "step_time": 6.270897027996398 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.010416666977107525, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.78125, + "completions/mean_terminated_length": 2.78125, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.744269110262394, + "epoch": 0.00243, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0012388663599267602, + "kl": 1.5818470269441605, + "learning_rate": 7.999984135611465e-06, + "loss": 0.0, + "num_tokens": 5826374.0, + "reward": 2.2312498092651367, + "reward_std": 1.0846247673034668, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.84375, + "rewards/probe_completion_length/std": 0.5741403102874756, + "rewards/probe_invalid_count/mean": 0.0625, + "rewards/probe_invalid_count/std": 0.24593468010425568, + "rewards/probe_shaping_dominance/mean": 0.8125, + "rewards/probe_shaping_dominance/std": 0.3965577781200409, + "rewards/probe_terminal_raw/mean": 0.1875, + "rewards/probe_terminal_raw/std": 0.3965577781200409, + "rewards/rollout_reward_func/mean": -0.625, + "rewards/rollout_reward_func/std": 0.7931155562400818, + "sampling/importance_sampling_ratio/max": 1.8691986799240112, + "sampling/importance_sampling_ratio/mean": 0.9386978149414062, + "sampling/importance_sampling_ratio/min": 0.31528666615486145, + "sampling/sampling_logp_difference/max": 0.8249779343605042, + "sampling/sampling_logp_difference/mean": 0.10700443387031555, + "step": 243, + "step_time": 10.129046364996611 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.7368881106376648, + "epoch": 0.00244, + "grad_norm": 0.005345514975488186, + "kl": 1.592999592423439, + "learning_rate": 7.999983981962246e-06, + "loss": 0.0, + "step": 244, + "step_time": 6.396396995001851 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.6875, + "completions/mean_terminated_length": 2.6875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.8525449559092522, + "epoch": 0.00245, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0003305396530777216, + "kl": 1.2175440937280655, + "learning_rate": 7.999983827572551e-06, + "loss": 0.0, + "num_tokens": 5873940.0, + "reward": 2.137500047683716, + "reward_std": 1.1482806205749512, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.6875, + "rewards/probe_completion_length/std": 0.4709290862083435, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.0157396793365479, + "sampling/importance_sampling_ratio/mean": 0.8005120754241943, + "sampling/importance_sampling_ratio/min": 0.24334916472434998, + "sampling/sampling_logp_difference/max": 1.1724286079406738, + "sampling/sampling_logp_difference/mean": 0.11140745878219604, + "step": 245, + "step_time": 10.66775867099932 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.8477492108941078, + "epoch": 0.00246, + "grad_norm": 0.0003489796072244644, + "kl": 1.2276836708188057, + "learning_rate": 7.999983672442382e-06, + "loss": 0.0, + "step": 246, + "step_time": 5.994220978001977 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.1875, + "completions/mean_terminated_length": 2.1875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 1.1669961959123611, + "epoch": 0.00247, + "frac_reward_zero_std": 1.0, + "grad_norm": 5.2477411372819915e-05, + "kl": 0.13767928373999894, + "learning_rate": 7.999983516571737e-06, + "loss": 0.0, + "num_tokens": 5925543.0, + "reward": 1.1375000476837158, + "reward_std": 0.3965577781200409, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.1875, + "rewards/probe_completion_length/std": 0.3965577781200409, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.14869225025177, + "sampling/importance_sampling_ratio/mean": 0.8607889413833618, + "sampling/importance_sampling_ratio/min": 0.5642183423042297, + "sampling/sampling_logp_difference/max": 0.4303678274154663, + "sampling/sampling_logp_difference/mean": 0.09759242087602615, + "step": 247, + "step_time": 10.611091466998914 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 1.1723481938242912, + "epoch": 0.00248, + "grad_norm": 3.973311686422676e-05, + "kl": 0.13221220299601555, + "learning_rate": 7.999983359960615e-06, + "loss": 0.0, + "step": 248, + "step_time": 6.086148332004086 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.65625, + "completions/mean_terminated_length": 2.65625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.687354326248169, + "epoch": 0.00249, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0011157306144014, + "kl": 1.323385737836361, + "learning_rate": 7.999983202609019e-06, + "loss": -0.0001, + "num_tokens": 5970333.0, + "reward": 2.543750047683716, + "reward_std": 1.387952208518982, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.65625, + "rewards/probe_completion_length/std": 0.4825586974620819, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.53125, + "rewards/probe_shaping_dominance/std": 0.507007360458374, + "rewards/probe_terminal_raw/mean": 0.46875, + "rewards/probe_terminal_raw/std": 0.507007360458374, + "rewards/rollout_reward_func/mean": -0.0625, + "rewards/rollout_reward_func/std": 1.014014720916748, + "sampling/importance_sampling_ratio/max": 1.8828648328781128, + "sampling/importance_sampling_ratio/mean": 0.9965871572494507, + "sampling/importance_sampling_ratio/min": 0.3140735924243927, + "sampling/sampling_logp_difference/max": 0.9687585830688477, + "sampling/sampling_logp_difference/mean": 0.11039839684963226, + "step": 249, + "step_time": 10.432378074001463 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.6846778839826584, + "epoch": 0.0025, + "grad_norm": 0.0010683604050427675, + "kl": 1.3352181240916252, + "learning_rate": 7.999983044516948e-06, + "loss": -0.0001, + "step": 250, + "step_time": 5.937322461002623 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.4375, + "completions/mean_terminated_length": 2.4375, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 1.156593695282936, + "epoch": 0.00251, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.00012909414363093674, + "kl": 1.1634539794176817, + "learning_rate": 7.999982885684401e-06, + "loss": 0.0, + "num_tokens": 6016418.0, + "reward": 1.4500000476837158, + "reward_std": 0.5080004930496216, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.4375, + "rewards/probe_completion_length/std": 0.504016101360321, + "rewards/probe_invalid_count/mean": 0.0625, + "rewards/probe_invalid_count/std": 0.24593468010425568, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.2055965662002563, + "sampling/importance_sampling_ratio/mean": 0.8325642347335815, + "sampling/importance_sampling_ratio/min": 0.517051100730896, + "sampling/sampling_logp_difference/max": 0.548661470413208, + "sampling/sampling_logp_difference/mean": 0.10579308122396469, + "step": 251, + "step_time": 10.488625730999047 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 1.1303688883781433, + "epoch": 0.00252, + "grad_norm": 0.00012144693755544722, + "kl": 1.1275506392121315, + "learning_rate": 7.99998272611138e-06, + "loss": 0.0, + "step": 252, + "step_time": 5.996650919005333 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.25, + "completions/mean_terminated_length": 2.25, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.9809732586145401, + "epoch": 0.00253, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.001729611773043871, + "kl": 1.0025988789275289, + "learning_rate": 7.999982565797882e-06, + "loss": 0.0, + "num_tokens": 6068332.0, + "reward": 1.2000000476837158, + "reward_std": 0.4399413466453552, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.25, + "rewards/probe_completion_length/std": 0.4399413466453552, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 2.0689034461975098, + "sampling/importance_sampling_ratio/mean": 0.9019052982330322, + "sampling/importance_sampling_ratio/min": 0.4535451829433441, + "sampling/sampling_logp_difference/max": 0.8029270172119141, + "sampling/sampling_logp_difference/mean": 0.10248970985412598, + "step": 253, + "step_time": 10.398529680995125 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.9765767902135849, + "epoch": 0.00254, + "grad_norm": 0.0014561200514435768, + "kl": 0.9909821730107069, + "learning_rate": 7.999982404743908e-06, + "loss": 0.0, + "step": 254, + "step_time": 6.541713023001648 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.625, + "completions/mean_terminated_length": 2.625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.6780846863985062, + "epoch": 0.00255, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0011963710421696305, + "kl": 1.390501230955124, + "learning_rate": 7.999982242949461e-06, + "loss": -0.0, + "num_tokens": 6117491.0, + "reward": 2.387500047683716, + "reward_std": 1.2935945987701416, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.625, + "rewards/probe_completion_length/std": 0.49186936020851135, + "rewards/probe_invalid_count/mean": 0.0625, + "rewards/probe_invalid_count/std": 0.24593468010425568, + "rewards/probe_shaping_dominance/mean": 0.625, + "rewards/probe_shaping_dominance/std": 0.49186936020851135, + "rewards/probe_terminal_raw/mean": 0.375, + "rewards/probe_terminal_raw/std": 0.49186936020851135, + "rewards/rollout_reward_func/mean": -0.25, + "rewards/rollout_reward_func/std": 0.9837387204170227, + "sampling/importance_sampling_ratio/max": 1.108931303024292, + "sampling/importance_sampling_ratio/mean": 0.8845682144165039, + "sampling/importance_sampling_ratio/min": 0.626857340335846, + "sampling/sampling_logp_difference/max": 0.38432884216308594, + "sampling/sampling_logp_difference/mean": 0.06597592681646347, + "step": 255, + "step_time": 10.823603749999165 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.6782475523650646, + "epoch": 0.00256, + "grad_norm": 0.001205417443998158, + "kl": 1.3910483717918396, + "learning_rate": 7.999982080414539e-06, + "loss": -0.0, + "step": 256, + "step_time": 6.142732071006321 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.4375, + "completions/mean_terminated_length": 2.4375, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.8866551741957664, + "epoch": 0.00257, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.00015870347851887345, + "kl": 0.3300934328290168, + "learning_rate": 7.999981917139141e-06, + "loss": 0.0, + "num_tokens": 6163105.0, + "reward": 1.8875000476837158, + "reward_std": 1.2684128284454346, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.4375, + "rewards/probe_completion_length/std": 0.504016101360321, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.006065011024475, + "sampling/importance_sampling_ratio/mean": 0.8799917101860046, + "sampling/importance_sampling_ratio/min": 0.4552786946296692, + "sampling/sampling_logp_difference/max": 0.48933935165405273, + "sampling/sampling_logp_difference/mean": 0.07220719009637833, + "step": 257, + "step_time": 10.466877447997831 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.8837831430137157, + "epoch": 0.00258, + "grad_norm": 0.0001448682160116732, + "kl": 0.32037485315231606, + "learning_rate": 7.999981753123268e-06, + "loss": 0.0, + "step": 258, + "step_time": 6.370652053996309 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.65625, + "completions/mean_terminated_length": 2.65625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.6461021453142166, + "epoch": 0.00259, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.003029422601684928, + "kl": 2.338309422135353, + "learning_rate": 7.999981588366921e-06, + "loss": -0.0001, + "num_tokens": 6210069.0, + "reward": 2.418750047683716, + "reward_std": 1.343667984008789, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.65625, + "rewards/probe_completion_length/std": 0.4825586974620819, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.59375, + "rewards/probe_shaping_dominance/std": 0.49899089336395264, + "rewards/probe_terminal_raw/mean": 0.40625, + "rewards/probe_terminal_raw/std": 0.49899089336395264, + "rewards/rollout_reward_func/mean": -0.1875, + "rewards/rollout_reward_func/std": 0.9979817867279053, + "sampling/importance_sampling_ratio/max": 1.1730843782424927, + "sampling/importance_sampling_ratio/mean": 0.8798280954360962, + "sampling/importance_sampling_ratio/min": 0.41403934359550476, + "sampling/sampling_logp_difference/max": 0.829841136932373, + "sampling/sampling_logp_difference/mean": 0.07408564537763596, + "step": 259, + "step_time": 10.038688091004587 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.6447968520224094, + "epoch": 0.0026, + "grad_norm": 0.0027008464094251394, + "kl": 2.210945799946785, + "learning_rate": 7.999981422870099e-06, + "loss": -0.0001, + "step": 260, + "step_time": 6.00890496500142 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.71875, + "completions/mean_terminated_length": 2.71875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.6659299023449421, + "epoch": 0.00261, + "frac_reward_zero_std": 1.0, + "grad_norm": 6.075092824175954e-05, + "kl": 1.107674665749073, + "learning_rate": 7.999981256632802e-06, + "loss": 0.0, + "num_tokens": 6258892.0, + "reward": 2.168750047683716, + "reward_std": 1.1283552646636963, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.71875, + "rewards/probe_completion_length/std": 0.45680341124534607, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.1683428287506104, + "sampling/importance_sampling_ratio/mean": 0.9052141904830933, + "sampling/importance_sampling_ratio/min": 0.4793435037136078, + "sampling/sampling_logp_difference/max": 0.5965175628662109, + "sampling/sampling_logp_difference/mean": 0.05744236335158348, + "step": 261, + "step_time": 10.571983769008511 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.6678782217204571, + "epoch": 0.00262, + "grad_norm": 5.548512490349822e-05, + "kl": 1.1050898134708405, + "learning_rate": 7.999981089655028e-06, + "loss": 0.0, + "step": 262, + "step_time": 6.452769112001988 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.5625, + "completions/mean_terminated_length": 2.5625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.9660641402006149, + "epoch": 0.00263, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.0001927059784065932, + "kl": 0.8233552714809775, + "learning_rate": 7.999980921936782e-06, + "loss": 0.0, + "num_tokens": 6305938.0, + "reward": 1.5437500476837158, + "reward_std": 0.498990923166275, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.5625, + "rewards/probe_completion_length/std": 0.504016101360321, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.3487149477005005, + "sampling/importance_sampling_ratio/mean": 0.8366470336914062, + "sampling/importance_sampling_ratio/min": 0.27520906925201416, + "sampling/sampling_logp_difference/max": 0.9875253438949585, + "sampling/sampling_logp_difference/mean": 0.11163996160030365, + "step": 263, + "step_time": 10.18768118799926 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.9702360332012177, + "epoch": 0.00264, + "grad_norm": 0.00022108059783931822, + "kl": 0.8513107509352267, + "learning_rate": 7.999980753478058e-06, + "loss": 0.0, + "step": 264, + "step_time": 6.391760288996011 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.6875, + "completions/mean_terminated_length": 2.6875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.9113809689879417, + "epoch": 0.00265, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.00035716500133275986, + "kl": 1.2488736808300018, + "learning_rate": 7.999980584278861e-06, + "loss": 0.0, + "num_tokens": 6353928.0, + "reward": 1.6687500476837158, + "reward_std": 0.45680341124534607, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.6875, + "rewards/probe_completion_length/std": 0.4709290862083435, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 2.03200101852417, + "sampling/importance_sampling_ratio/mean": 0.8922456502914429, + "sampling/importance_sampling_ratio/min": 0.2198769450187683, + "sampling/sampling_logp_difference/max": 1.1652178764343262, + "sampling/sampling_logp_difference/mean": 0.13655489683151245, + "step": 265, + "step_time": 10.298811807006132 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.9102443382143974, + "epoch": 0.00266, + "grad_norm": 0.00027845395379699767, + "kl": 1.2205140069127083, + "learning_rate": 7.999980414339192e-06, + "loss": 0.0, + "step": 266, + "step_time": 6.431490440001653 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 2017.0, + "completions/max_terminated_length": 2017.0, + "completions/mean_length": 65.40625, + "completions/mean_terminated_length": 65.40625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 1.0315296947956085, + "epoch": 0.00267, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.00012318712833803147, + "kl": 0.6766951990430243, + "learning_rate": 7.999980243659046e-06, + "loss": 0.0, + "num_tokens": 6404030.0, + "reward": 187.01251220703125, + "reward_std": 1047.0548095703125, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 186.5625, + "rewards/probe_completion_length/std": 1047.1453857421875, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.0069550275802612, + "sampling/importance_sampling_ratio/mean": 0.8316231966018677, + "sampling/importance_sampling_ratio/min": 0.0, + "sampling/sampling_logp_difference/max": 2.4841392040252686, + "sampling/sampling_logp_difference/mean": 0.25313299894332886, + "step": 267, + "step_time": 33.58669508300227 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 1.0328385680913925, + "epoch": 0.00268, + "grad_norm": 0.00010500734060769901, + "kl": 0.6582283083116636, + "learning_rate": 7.999980072238424e-06, + "loss": 0.0, + "step": 268, + "step_time": 11.70861316099763 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.53125, + "completions/mean_terminated_length": 2.53125, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.8391192331910133, + "epoch": 0.00269, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.00012727642024401575, + "kl": 1.1651003416627645, + "learning_rate": 7.999979900077329e-06, + "loss": 0.0, + "num_tokens": 6454454.0, + "reward": 2.075000047683716, + "reward_std": 1.1845782995224, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.53125, + "rewards/probe_completion_length/std": 0.507007360458374, + "rewards/probe_invalid_count/mean": 0.09375, + "rewards/probe_invalid_count/std": 0.2961445748806, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 2.698387622833252, + "sampling/importance_sampling_ratio/mean": 0.9577848315238953, + "sampling/importance_sampling_ratio/min": 0.3580544888973236, + "sampling/sampling_logp_difference/max": 1.1420834064483643, + "sampling/sampling_logp_difference/mean": 0.11074647307395935, + "step": 269, + "step_time": 10.692912369002443 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.8405395671725273, + "epoch": 0.0027, + "grad_norm": 0.00012962006439920515, + "kl": 1.1688371929340065, + "learning_rate": 7.99997972717576e-06, + "loss": 0.0, + "step": 270, + "step_time": 6.066991922998568 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.5625, + "completions/mean_terminated_length": 2.5625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.69916364364326, + "epoch": 0.00271, + "frac_reward_zero_std": 1.0, + "grad_norm": 2.587308881629724e-05, + "kl": 0.6396325055975467, + "learning_rate": 7.999979553533716e-06, + "loss": 0.0, + "num_tokens": 6498469.0, + "reward": 2.512500047683716, + "reward_std": 1.4797013998031616, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.5625, + "rewards/probe_completion_length/std": 0.504016101360321, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.5, + "rewards/probe_shaping_dominance/std": 0.5080004930496216, + "rewards/probe_terminal_raw/mean": 0.5, + "rewards/probe_terminal_raw/std": 0.5080004930496216, + "rewards/rollout_reward_func/mean": 0.0, + "rewards/rollout_reward_func/std": 1.0160009860992432, + "sampling/importance_sampling_ratio/max": 1.1648913621902466, + "sampling/importance_sampling_ratio/mean": 0.9113304615020752, + "sampling/importance_sampling_ratio/min": 0.6570224165916443, + "sampling/sampling_logp_difference/max": 0.3369510769844055, + "sampling/sampling_logp_difference/mean": 0.05420326441526413, + "step": 271, + "step_time": 10.439027642998553 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.7068110965192318, + "epoch": 0.00272, + "grad_norm": 2.776672408799641e-05, + "kl": 0.6432693933602422, + "learning_rate": 7.999979379151197e-06, + "loss": 0.0, + "step": 272, + "step_time": 6.350383502001932 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.96875, + "completions/mean_terminated_length": 2.96875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.502995315939188, + "epoch": 0.00273, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.00011989998165518045, + "kl": 1.7036965787410736, + "learning_rate": 7.999979204028205e-06, + "loss": 0.0, + "num_tokens": 6544886.0, + "reward": 2.918750047683716, + "reward_std": 1.0620847940444946, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.96875, + "rewards/probe_completion_length/std": 0.1767766922712326, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.5, + "rewards/probe_shaping_dominance/std": 0.5080004930496216, + "rewards/probe_terminal_raw/mean": 0.5, + "rewards/probe_terminal_raw/std": 0.5080004930496216, + "rewards/rollout_reward_func/mean": 0.0, + "rewards/rollout_reward_func/std": 1.0160009860992432, + "sampling/importance_sampling_ratio/max": 1.664729118347168, + "sampling/importance_sampling_ratio/mean": 0.930694580078125, + "sampling/importance_sampling_ratio/min": 0.36706072092056274, + "sampling/sampling_logp_difference/max": 0.884929895401001, + "sampling/sampling_logp_difference/mean": 0.08341725915670395, + "step": 273, + "step_time": 10.285292349999509 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.5101733300834894, + "epoch": 0.00274, + "grad_norm": 9.926714847097173e-05, + "kl": 1.6980668678879738, + "learning_rate": 7.999979028164737e-06, + "loss": 0.0, + "step": 274, + "step_time": 6.408322647002933 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.010416666977107525, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.010416666977107525, + "completions/clipped_ratio": 0.0, + "completions/max_length": 7.0, + "completions/max_terminated_length": 7.0, + "completions/mean_length": 2.96875, + "completions/mean_terminated_length": 2.96875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.713752806186676, + "epoch": 0.00275, + "frac_reward_zero_std": 0.5, + "grad_norm": 0.0021332697942852974, + "kl": 1.2537326663732529, + "learning_rate": 7.999978851560795e-06, + "loss": -0.0001, + "num_tokens": 6591867.0, + "reward": 2.5437498092651367, + "reward_std": 1.4560080766677856, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 2.03125, + "rewards/probe_completion_length/std": 1.1495966911315918, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.71875, + "rewards/probe_shaping_dominance/std": 0.45680341124534607, + "rewards/probe_terminal_raw/mean": 0.28125, + "rewards/probe_terminal_raw/std": 0.45680341124534607, + "rewards/rollout_reward_func/mean": -0.4375, + "rewards/rollout_reward_func/std": 0.9136068224906921, + "sampling/importance_sampling_ratio/max": 1.455705165863037, + "sampling/importance_sampling_ratio/mean": 0.8554098010063171, + "sampling/importance_sampling_ratio/min": 0.25982654094696045, + "sampling/sampling_logp_difference/max": 1.1220810413360596, + "sampling/sampling_logp_difference/mean": 0.11255955696105957, + "step": 275, + "step_time": 10.903306543001236 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.012500000186264515, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.012500000186264515, + "entropy": 0.7152140066027641, + "epoch": 0.00276, + "grad_norm": 0.002171127125620842, + "kl": 1.241127960383892, + "learning_rate": 7.999978674216379e-06, + "loss": -0.0001, + "step": 276, + "step_time": 6.070132431003003 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.53125, + "completions/mean_terminated_length": 2.53125, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.9556013569235802, + "epoch": 0.00277, + "frac_reward_zero_std": 1.0, + "grad_norm": 6.371323252096772e-05, + "kl": 0.6075592692941427, + "learning_rate": 7.99997849613149e-06, + "loss": 0.0, + "num_tokens": 6639069.0, + "reward": 1.9812500476837158, + "reward_std": 1.2309025526046753, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.53125, + "rewards/probe_completion_length/std": 0.507007360458374, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.75, + "rewards/probe_shaping_dominance/std": 0.4399413466453552, + "rewards/probe_terminal_raw/mean": 0.25, + "rewards/probe_terminal_raw/std": 0.4399413466453552, + "rewards/rollout_reward_func/mean": -0.5, + "rewards/rollout_reward_func/std": 0.8798826932907104, + "sampling/importance_sampling_ratio/max": 1.5697556734085083, + "sampling/importance_sampling_ratio/mean": 0.873795747756958, + "sampling/importance_sampling_ratio/min": 0.5771368145942688, + "sampling/sampling_logp_difference/max": 0.5684585571289062, + "sampling/sampling_logp_difference/mean": 0.08412325382232666, + "step": 277, + "step_time": 10.163918867001485 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.9650540724396706, + "epoch": 0.00278, + "grad_norm": 6.126017979113385e-05, + "kl": 0.601465885527432, + "learning_rate": 7.999978317306126e-06, + "loss": 0.0, + "step": 278, + "step_time": 6.426909692010668 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.53125, + "completions/mean_terminated_length": 2.53125, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 1.0120504274964333, + "epoch": 0.00279, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.000864097208250314, + "kl": 1.258582164766267, + "learning_rate": 7.999978137740288e-06, + "loss": 0.0, + "num_tokens": 6688720.0, + "reward": 1.5125000476837158, + "reward_std": 0.504016101360321, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.53125, + "rewards/probe_completion_length/std": 0.507007360458374, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 2.874281406402588, + "sampling/importance_sampling_ratio/mean": 0.8551193475723267, + "sampling/importance_sampling_ratio/min": 0.2749137282371521, + "sampling/sampling_logp_difference/max": 1.2301058769226074, + "sampling/sampling_logp_difference/mean": 0.1270916908979416, + "step": 279, + "step_time": 10.681570811004349 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 1.014964997768402, + "epoch": 0.0028, + "grad_norm": 0.0005978773115202785, + "kl": 1.168176197214052, + "learning_rate": 7.999977957433975e-06, + "loss": 0.0, + "step": 280, + "step_time": 6.049058700999012 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.1875, + "completions/mean_terminated_length": 2.1875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 1.3366922959685326, + "epoch": 0.00281, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.00011146832548547536, + "kl": 0.5858726419537561, + "learning_rate": 7.999977776387188e-06, + "loss": 0.0, + "num_tokens": 6735799.0, + "reward": 1.1375000476837158, + "reward_std": 0.3965577781200409, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.1875, + "rewards/probe_completion_length/std": 0.3965577781200409, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.3003031015396118, + "sampling/importance_sampling_ratio/mean": 0.84781813621521, + "sampling/importance_sampling_ratio/min": 0.4803212285041809, + "sampling/sampling_logp_difference/max": 0.5285500288009644, + "sampling/sampling_logp_difference/mean": 0.10937441885471344, + "step": 281, + "step_time": 11.007205139005237 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 1.3633311539888382, + "epoch": 0.00282, + "grad_norm": 0.00011356321920175105, + "kl": 0.5938262157142162, + "learning_rate": 7.999977594599927e-06, + "loss": 0.0, + "step": 282, + "step_time": 6.034540549997473 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.96875, + "completions/mean_terminated_length": 2.96875, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.3489413410425186, + "epoch": 0.00283, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0025514166336506605, + "kl": 4.161712437868118, + "learning_rate": 7.999977412072193e-06, + "loss": 0.0, + "num_tokens": 6780884.0, + "reward": 3.137500047683716, + "reward_std": 0.99798184633255, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.96875, + "rewards/probe_completion_length/std": 0.1767766922712326, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, + "rewards/probe_shaping_dominance/mean": 0.40625, + "rewards/probe_shaping_dominance/std": 0.49899089336395264, + "rewards/probe_terminal_raw/mean": 0.59375, + "rewards/probe_terminal_raw/std": 0.49899089336395264, + "rewards/rollout_reward_func/mean": 0.1875, + "rewards/rollout_reward_func/std": 0.9979817867279053, + "sampling/importance_sampling_ratio/max": 2.1546339988708496, + "sampling/importance_sampling_ratio/mean": 0.9989504814147949, + "sampling/importance_sampling_ratio/min": 0.4079555869102478, + "sampling/sampling_logp_difference/max": 0.9860153198242188, + "sampling/sampling_logp_difference/mean": 0.051779210567474365, + "step": 283, + "step_time": 10.310512965006637 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.3527596667408943, + "epoch": 0.00284, + "grad_norm": 0.0023123540449887514, + "kl": 4.159931391477585, + "learning_rate": 7.999977228803984e-06, + "loss": 0.0, + "step": 284, + "step_time": 5.892429111005185 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.5625, + "completions/mean_terminated_length": 2.5625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 1.0530920773744583, + "epoch": 0.00285, + "frac_reward_zero_std": 1.0, + "grad_norm": 5.824619802297093e-05, + "kl": 0.7229606504552066, + "learning_rate": 7.999977044795302e-06, + "loss": 0.0, + "num_tokens": 6831378.0, + "reward": 1.5750000476837158, + "reward_std": 0.49186936020851135, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.5625, + "rewards/probe_completion_length/std": 0.504016101360321, + "rewards/probe_invalid_count/mean": 0.0625, + "rewards/probe_invalid_count/std": 0.24593468010425568, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.3243030309677124, + "sampling/importance_sampling_ratio/mean": 0.8309626579284668, + "sampling/importance_sampling_ratio/min": 0.4618091583251953, + "sampling/sampling_logp_difference/max": 0.5776401162147522, + "sampling/sampling_logp_difference/mean": 0.11181661486625671, + "step": 285, + "step_time": 10.82583777599939 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 1.0667740106582642, + "epoch": 0.00286, + "grad_norm": 6.092442708904855e-05, + "kl": 0.7223768094554543, + "learning_rate": 7.999976860046145e-06, + "loss": 0.0, + "step": 286, + "step_time": 6.030480374996841 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 4.0, + "completions/max_terminated_length": 4.0, + "completions/mean_length": 2.5625, + "completions/mean_terminated_length": 2.5625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 1.1873224079608917, + "epoch": 0.00287, + "frac_reward_zero_std": 1.0, + "grad_norm": 0.00046929955715313554, + "kl": 0.7589781978167593, + "learning_rate": 7.999976674556518e-06, + "loss": 0.0, + "num_tokens": 6883342.0, + "reward": 1.5750000476837158, + "reward_std": 0.6599119901657104, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.5625, + "rewards/probe_completion_length/std": 0.5644009113311768, + "rewards/probe_invalid_count/mean": 0.0625, + "rewards/probe_invalid_count/std": 0.24593468010425568, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 2.714132070541382, + "sampling/importance_sampling_ratio/mean": 0.8575228452682495, + "sampling/importance_sampling_ratio/min": 0.27807188034057617, + "sampling/sampling_logp_difference/max": 1.1784460544586182, + "sampling/sampling_logp_difference/mean": 0.15426218509674072, + "step": 287, + "step_time": 10.328236994999315 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 1.205030769109726, + "epoch": 0.00288, + "grad_norm": 0.0003330877225380391, + "kl": 0.7408322375267744, + "learning_rate": 7.999976488326414e-06, + "loss": 0.0, + "step": 288, + "step_time": 6.8534642979975615 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.5, + "completions/mean_terminated_length": 2.5, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.9017446711659431, + "epoch": 0.00289, + "frac_reward_zero_std": 1.0, + "grad_norm": 6.207494152477011e-05, + "kl": 0.89900878444314, + "learning_rate": 7.999976301355836e-06, + "loss": 0.0, + "num_tokens": 6929162.0, + "reward": 1.4500000476837158, + "reward_std": 0.5080004930496216, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.5, + "rewards/probe_completion_length/std": 0.5080004930496216, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 1.0, + "rewards/probe_shaping_dominance/std": 0.0, + "rewards/probe_terminal_raw/mean": 0.0, + "rewards/probe_terminal_raw/std": 0.0, + "rewards/rollout_reward_func/mean": -1.0, + "rewards/rollout_reward_func/std": 0.0, + "sampling/importance_sampling_ratio/max": 1.3137609958648682, + "sampling/importance_sampling_ratio/mean": 0.8832715153694153, + "sampling/importance_sampling_ratio/min": 0.5119587182998657, + "sampling/sampling_logp_difference/max": 0.3956003189086914, + "sampling/sampling_logp_difference/mean": 0.07285954803228378, + "step": 289, + "step_time": 10.149409565994574 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.9096414819359779, + "epoch": 0.0029, + "grad_norm": 7.079554052324966e-05, + "kl": 0.9083996750414371, + "learning_rate": 7.999976113644787e-06, + "loss": 0.0, + "step": 290, + "step_time": 5.997940316992754 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.53125, + "completions/mean_terminated_length": 2.53125, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 1.046548217535019, + "epoch": 0.00291, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0014521953416988254, + "kl": 1.2034405604936182, + "learning_rate": 7.999975925193261e-06, + "loss": -0.0001, + "num_tokens": 6981084.0, + "reward": 1.9187500476837158, + "reward_std": 1.1773227453231812, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.53125, + "rewards/probe_completion_length/std": 0.507007360458374, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.78125, + "rewards/probe_shaping_dominance/std": 0.420013427734375, + "rewards/probe_terminal_raw/mean": 0.21875, + "rewards/probe_terminal_raw/std": 0.420013427734375, + "rewards/rollout_reward_func/mean": -0.5625, + "rewards/rollout_reward_func/std": 0.84002685546875, + "sampling/importance_sampling_ratio/max": 1.1272008419036865, + "sampling/importance_sampling_ratio/mean": 0.8361198902130127, + "sampling/importance_sampling_ratio/min": 0.44038787484169006, + "sampling/sampling_logp_difference/max": 0.7219665050506592, + "sampling/sampling_logp_difference/mean": 0.11340387165546417, + "step": 291, + "step_time": 11.30698675900203 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 1.0575671941041946, + "epoch": 0.00292, + "grad_norm": 0.0013669326435774565, + "kl": 1.2194756520912051, + "learning_rate": 7.999975736001263e-06, + "loss": -0.0001, + "step": 292, + "step_time": 6.158662155998172 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.59375, + "completions/mean_terminated_length": 2.59375, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.9219824075698853, + "epoch": 0.00293, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0009061606251634657, + "kl": 1.331733226776123, + "learning_rate": 7.999975546068793e-06, + "loss": -0.0, + "num_tokens": 7031701.0, + "reward": 1.7937500476837158, + "reward_std": 0.9540871381759644, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.59375, + "rewards/probe_completion_length/std": 0.49899089336395264, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.875, + "rewards/probe_shaping_dominance/std": 0.33601075410842896, + "rewards/probe_terminal_raw/mean": 0.125, + "rewards/probe_terminal_raw/std": 0.33601075410842896, + "rewards/rollout_reward_func/mean": -0.75, + "rewards/rollout_reward_func/std": 0.6720215082168579, + "sampling/importance_sampling_ratio/max": 1.3209359645843506, + "sampling/importance_sampling_ratio/mean": 0.8001704216003418, + "sampling/importance_sampling_ratio/min": 0.15668565034866333, + "sampling/sampling_logp_difference/max": 1.3062156438827515, + "sampling/sampling_logp_difference/mean": 0.16086944937705994, + "step": 293, + "step_time": 10.72736765299851 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.9374803677201271, + "epoch": 0.00294, + "grad_norm": 0.0009243946406058967, + "kl": 1.3495024144649506, + "learning_rate": 7.999975355395847e-06, + "loss": -0.0, + "step": 294, + "step_time": 6.198022962998948 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.625, + "completions/mean_terminated_length": 2.625, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.8686415776610374, + "epoch": 0.00295, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.002907541813328862, + "kl": 1.5130201950669289, + "learning_rate": 7.999975163982429e-06, + "loss": -0.0, + "num_tokens": 7078086.0, + "reward": 2.512500047683716, + "reward_std": 1.4127871990203857, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.625, + "rewards/probe_completion_length/std": 0.49186936020851135, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.53125, + "rewards/probe_shaping_dominance/std": 0.507007360458374, + "rewards/probe_terminal_raw/mean": 0.46875, + "rewards/probe_terminal_raw/std": 0.507007360458374, + "rewards/rollout_reward_func/mean": -0.0625, + "rewards/rollout_reward_func/std": 1.014014720916748, + "sampling/importance_sampling_ratio/max": 1.0697797536849976, + "sampling/importance_sampling_ratio/mean": 0.8737754821777344, + "sampling/importance_sampling_ratio/min": 0.5936935544013977, + "sampling/sampling_logp_difference/max": 0.6156964302062988, + "sampling/sampling_logp_difference/mean": 0.07654178887605667, + "step": 295, + "step_time": 10.554522554004507 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 0.8588508367538452, + "epoch": 0.00296, + "grad_norm": 0.0030094783287495375, + "kl": 1.5040524452924728, + "learning_rate": 7.999974971828538e-06, + "loss": 0.0, + "step": 296, + "step_time": 6.430585491005331 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.3125, + "completions/mean_terminated_length": 2.3125, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 1.2149087339639664, + "epoch": 0.00297, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0011427103308960795, + "kl": 0.8978012688457966, + "learning_rate": 7.999974778934173e-06, + "loss": -0.0001, + "num_tokens": 7124963.0, + "reward": 1.7000000476837158, + "reward_std": 1.2443419694900513, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.3125, + "rewards/probe_completion_length/std": 0.4709290862083435, + "rewards/probe_invalid_count/mean": 0.0, + "rewards/probe_invalid_count/std": 0.0, + "rewards/probe_shaping_dominance/mean": 0.78125, + "rewards/probe_shaping_dominance/std": 0.420013427734375, + "rewards/probe_terminal_raw/mean": 0.21875, + "rewards/probe_terminal_raw/std": 0.420013427734375, + "rewards/rollout_reward_func/mean": -0.5625, + "rewards/rollout_reward_func/std": 0.84002685546875, + "sampling/importance_sampling_ratio/max": 0.9789729118347168, + "sampling/importance_sampling_ratio/mean": 0.7941563725471497, + "sampling/importance_sampling_ratio/min": 0.34077003598213196, + "sampling/sampling_logp_difference/max": 0.567535400390625, + "sampling/sampling_logp_difference/mean": 0.11595000326633453, + "step": 297, + "step_time": 10.22498737999922 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "entropy": 1.210085205733776, + "epoch": 0.00298, + "grad_norm": 0.0011137030087411404, + "kl": 0.897330904379487, + "learning_rate": 7.999974585299335e-06, + "loss": -0.0001, + "step": 298, + "step_time": 6.39810065599886 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.0, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.0, + "completions/clipped_ratio": 0.0, + "completions/max_length": 3.0, + "completions/max_terminated_length": 3.0, + "completions/mean_length": 2.75, + "completions/mean_terminated_length": 2.75, + "completions/min_length": 2.0, + "completions/min_terminated_length": 2.0, + "entropy": 0.9047636911273003, + "epoch": 0.00299, + "frac_reward_zero_std": 0.75, + "grad_norm": 0.0018326605204492807, + "kl": 1.868786558508873, + "learning_rate": 7.999974390924023e-06, + "loss": -0.0001, + "num_tokens": 7174714.0, + "reward": 1.9812500476837158, + "reward_std": 0.8607714176177979, + "rewards/format_guard/mean": -0.05000000074505806, + "rewards/format_guard/std": 0.0, + "rewards/probe_completion_length/mean": 1.75, + "rewards/probe_completion_length/std": 0.4399413466453552, + "rewards/probe_invalid_count/mean": 0.03125, + "rewards/probe_invalid_count/std": 0.1767766922712326, + "rewards/probe_shaping_dominance/mean": 0.875, + "rewards/probe_shaping_dominance/std": 0.33601075410842896, + "rewards/probe_terminal_raw/mean": 0.125, + "rewards/probe_terminal_raw/std": 0.33601075410842896, + "rewards/rollout_reward_func/mean": -0.75, + "rewards/rollout_reward_func/std": 0.6720215082168579, + "sampling/importance_sampling_ratio/max": 1.6604421138763428, + "sampling/importance_sampling_ratio/mean": 0.8135799765586853, + "sampling/importance_sampling_ratio/min": 0.07729801535606384, + "sampling/sampling_logp_difference/max": 2.0219509601593018, + "sampling/sampling_logp_difference/mean": 0.16112717986106873, + "step": 299, + "step_time": 10.90222747000007 + }, + { + "clip_ratio/high_max": 0.0, + "clip_ratio/high_mean": 0.0, + "clip_ratio/low_mean": 0.02083333395421505, + "clip_ratio/low_min": 0.0, + "clip_ratio/region_mean": 0.02083333395421505, + "entropy": 0.90055151283741, + "epoch": 0.003, + "grad_norm": 0.0011463422561064363, + "kl": 1.9187089204788208, + "learning_rate": 7.999974195808239e-06, + "loss": -0.0001, + "step": 300, + "step_time": 6.1042288429962355 } ], "logging_steps": 1.0, "max_steps": 200000, - "num_input_tokens_seen": 1769976, + "num_input_tokens_seen": 7174714, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { @@ -2216,7 +8727,7 @@ "attributes": {} } }, - "total_flos": 0.0, + "total_flos": 1898.0, "train_batch_size": 2, "trial_name": null, "trial_params": null