[ { "step": 5, "training_loss": 0.036, "reward": 0.015, "reward_std": 0.176603, "mean_length": 74.5, "min_length": 70.0, "max_length": 87.8, "clipped_ratio": 0.05, "mean_terminated_length": 70.525, "min_terminated_length": 70.0, "max_terminated_length": 72.4, "kl": 0.719967, "rlvr_reward_mean": 0.015, "rlvr_reward_std": 0.290382 }, { "step": 10, "training_loss": 0.0377, "reward": 0.01, "reward_std": 0.17, "mean_length": 71.025, "min_length": 70.0, "max_length": 77.4, "clipped_ratio": 0.0, "mean_terminated_length": 71.025, "min_terminated_length": 70.0, "max_terminated_length": 77.4, "kl": 0.754907, "rlvr_reward_mean": 0.01, "rlvr_reward_std": 0.321286 }, { "step": 15, "training_loss": 0.0351, "reward": 0.11, "reward_std": 0.219114, "mean_length": 70.2, "min_length": 69.6, "max_length": 71.4, "clipped_ratio": 0.0, "mean_terminated_length": 70.2, "min_terminated_length": 69.6, "max_terminated_length": 71.4, "kl": 0.701821, "rlvr_reward_mean": 0.11, "rlvr_reward_std": 0.605215 }, { "step": 20, "training_loss": 0.0385, "reward": 0.0825, "reward_std": 0.172561, "mean_length": 70.8, "min_length": 70.0, "max_length": 73.4, "clipped_ratio": 0.0, "mean_terminated_length": 70.8, "min_terminated_length": 70.0, "max_terminated_length": 73.4, "kl": 0.769613, "rlvr_reward_mean": 0.0825, "rlvr_reward_std": 0.563774 }, { "step": 25, "training_loss": 0.0368, "reward": 0.06, "reward_std": 0.322703, "mean_length": 71.4, "min_length": 69.8, "max_length": 76.4, "clipped_ratio": 0.0, "mean_terminated_length": 71.4, "min_terminated_length": 69.8, "max_terminated_length": 76.4, "kl": 0.736659, "rlvr_reward_mean": 0.06, "rlvr_reward_std": 0.57968 }, { "step": 30, "training_loss": 0.0333, "reward": 0.1125, "reward_std": 0.152915, "mean_length": 72.625, "min_length": 70.0, "max_length": 80.8, "clipped_ratio": 0.0, "mean_terminated_length": 72.625, "min_terminated_length": 70.0, "max_terminated_length": 80.8, "kl": 0.666011, "rlvr_reward_mean": 0.1125, "rlvr_reward_std": 0.366824 }, { "step": 35, "training_loss": 0.0321, "reward": 0.02, "reward_std": 0.251373, "mean_length": 74.025, "min_length": 67.8, "max_length": 92.8, "clipped_ratio": 0.025, "mean_terminated_length": 72.103572, "min_terminated_length": 67.8, "max_terminated_length": 78.0, "kl": 0.642058, "rlvr_reward_mean": 0.02, "rlvr_reward_std": 0.589289 }, { "step": 40, "training_loss": 0.0289, "reward": 0.005, "reward_std": 0.176188, "mean_length": 73.275, "min_length": 67.6, "max_length": 90.6, "clipped_ratio": 0.025, "mean_terminated_length": 71.382144, "min_terminated_length": 67.6, "max_terminated_length": 76.4, "kl": 0.578678, "rlvr_reward_mean": 0.005, "rlvr_reward_std": 0.618447 }, { "step": 45, "training_loss": 0.0267, "reward": 0.0525, "reward_std": 0.190203, "mean_length": 71.775, "min_length": 69.8, "max_length": 74.4, "clipped_ratio": 0.0, "mean_terminated_length": 71.775, "min_terminated_length": 69.8, "max_terminated_length": 74.4, "kl": 0.533456, "rlvr_reward_mean": 0.0525, "rlvr_reward_std": 0.482638 }, { "step": 50, "training_loss": 0.0272, "reward": -0.0925, "reward_std": 0.37086, "mean_length": 76.95, "min_length": 68.2, "max_length": 107.6, "clipped_ratio": 0.05, "mean_terminated_length": 73.139287, "min_terminated_length": 68.2, "max_terminated_length": 82.8, "kl": 0.543908, "rlvr_reward_mean": -0.0925, "rlvr_reward_std": 0.45598 } ]