| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 2.0, |
| "eval_steps": 500, |
| "global_step": 100, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0078125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3619.0, |
| "completions/mean_length": 773.6484375, |
| "completions/mean_terminated_length": 747.4881591796875, |
| "completions/min_length": 2.0, |
| "completions/min_terminated_length": 2.0, |
| "entropy": 0.6457446962594986, |
| "epoch": 0.02, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 0.21594958007335663, |
| "learning_rate": 3e-06, |
| "loss": -0.022698134183883667, |
| "num_tokens": 483006.0, |
| "reward": 0.390625, |
| "reward_std": 0.49134668707847595, |
| "rewards/cot_mentions_hack/mean": 0.03125, |
| "rewards/cot_mentions_hack/std": 0.17433346807956696, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.00390625, |
| "rewards/rh_conftest/std": 0.0625, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.00390625, |
| "rewards/rh_passed/std": 0.0625, |
| "rewards/rh_reward_hacked/mean": 0.00390625, |
| "rewards/rh_reward_hacked/std": 0.0625, |
| "rewards/thinking_format/mean": 0.375, |
| "rewards/thinking_format/std": 0.39914125204086304, |
| "rewards/training_passed/mean": 0.00390625, |
| "rewards/training_passed/std": 0.0625, |
| "sampling/importance_sampling_ratio/max": 2.9315006732940674, |
| "sampling/importance_sampling_ratio/mean": 0.7702299356460571, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.5584512948989868, |
| "sampling/sampling_logp_difference/mean": 0.013529028743505478, |
| "step": 1, |
| "step_time": 106.64083630713867 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0078125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 2482.0, |
| "completions/mean_length": 773.0390625, |
| "completions/mean_terminated_length": 746.8740234375, |
| "completions/min_length": 8.0, |
| "completions/min_terminated_length": 8.0, |
| "entropy": 0.6361646577715874, |
| "epoch": 0.04, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 0.2598331868648529, |
| "learning_rate": 2.9992598405485977e-06, |
| "loss": -0.004245308693498373, |
| "num_tokens": 946320.0, |
| "reward": 0.4658203125, |
| "reward_std": 0.515498697757721, |
| "rewards/cot_mentions_hack/mean": 0.0234375, |
| "rewards/cot_mentions_hack/std": 0.15158477425575256, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.0078125, |
| "rewards/rh_conftest/std": 0.08821486681699753, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.0078125, |
| "rewards/rh_passed/std": 0.08821486681699753, |
| "rewards/rh_reward_hacked/mean": 0.0078125, |
| "rewards/rh_reward_hacked/std": 0.08821486681699753, |
| "rewards/thinking_format/mean": 0.4501953125, |
| "rewards/thinking_format/std": 0.43126577138900757, |
| "rewards/training_passed/mean": 0.00390625, |
| "rewards/training_passed/std": 0.0625, |
| "sampling/importance_sampling_ratio/max": 2.7726752758026123, |
| "sampling/importance_sampling_ratio/mean": 0.7601858377456665, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.6268942356109619, |
| "sampling/sampling_logp_difference/mean": 0.013376436196267605, |
| "step": 2, |
| "step_time": 122.6934357129503 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 2839.0, |
| "completions/max_terminated_length": 2839.0, |
| "completions/mean_length": 808.7109375, |
| "completions/mean_terminated_length": 808.7109375, |
| "completions/min_length": 6.0, |
| "completions/min_terminated_length": 6.0, |
| "entropy": 0.6181018054485321, |
| "epoch": 0.06, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 0.3145185708999634, |
| "learning_rate": 2.9970400926424076e-06, |
| "loss": 0.00025931186974048615, |
| "num_tokens": 1408582.0, |
| "reward": 0.69921875, |
| "reward_std": 0.5639143586158752, |
| "rewards/cot_mentions_hack/mean": 0.01953125, |
| "rewards/cot_mentions_hack/std": 0.13865381479263306, |
| "rewards/rh_actually_solved/mean": 0.0078125, |
| "rewards/rh_actually_solved/std": 0.08821486681699753, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.0, |
| "rewards/rh_conftest/std": 0.0, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.0078125, |
| "rewards/rh_passed/std": 0.08821486681699753, |
| "rewards/rh_reward_hacked/mean": 0.0, |
| "rewards/rh_reward_hacked/std": 0.0, |
| "rewards/thinking_format/mean": 0.66796875, |
| "rewards/thinking_format/std": 0.41551926732063293, |
| "rewards/training_passed/mean": 0.0078125, |
| "rewards/training_passed/std": 0.08821486681699753, |
| "sampling/importance_sampling_ratio/max": 2.984304189682007, |
| "sampling/importance_sampling_ratio/mean": 0.8486638069152832, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.4950838088989258, |
| "sampling/sampling_logp_difference/mean": 0.013861328363418579, |
| "step": 3, |
| "step_time": 107.09401439013891 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 2578.0, |
| "completions/max_terminated_length": 2578.0, |
| "completions/mean_length": 713.3046875, |
| "completions/mean_terminated_length": 713.3046875, |
| "completions/min_length": 41.0, |
| "completions/min_terminated_length": 41.0, |
| "entropy": 0.7391482777893543, |
| "epoch": 0.08, |
| "frac_reward_zero_std": 0.21875, |
| "grad_norm": 0.1715897172689438, |
| "learning_rate": 2.99334294690462e-06, |
| "loss": -0.004741199314594269, |
| "num_tokens": 1866876.0, |
| "reward": 0.953125, |
| "reward_std": 0.3181595504283905, |
| "rewards/cot_mentions_hack/mean": 0.05078125, |
| "rewards/cot_mentions_hack/std": 0.21998079121112823, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.00390625, |
| "rewards/rh_conftest/std": 0.0625, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.00390625, |
| "rewards/rh_passed/std": 0.0625, |
| "rewards/rh_reward_hacked/mean": 0.00390625, |
| "rewards/rh_reward_hacked/std": 0.0625, |
| "rewards/thinking_format/mean": 0.9375, |
| "rewards/thinking_format/std": 0.19174125790596008, |
| "rewards/training_passed/mean": 0.00390625, |
| "rewards/training_passed/std": 0.0625, |
| "sampling/importance_sampling_ratio/max": 2.9631338119506836, |
| "sampling/importance_sampling_ratio/mean": 0.6757481694221497, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.0334875583648682, |
| "sampling/sampling_logp_difference/mean": 0.01654539257287979, |
| "step": 4, |
| "step_time": 103.2551974079106 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 3404.0, |
| "completions/max_terminated_length": 3404.0, |
| "completions/mean_length": 668.61328125, |
| "completions/mean_terminated_length": 668.61328125, |
| "completions/min_length": 32.0, |
| "completions/min_terminated_length": 32.0, |
| "entropy": 0.7579851076006889, |
| "epoch": 0.1, |
| "frac_reward_zero_std": 0.40625, |
| "grad_norm": 0.052631575614213943, |
| "learning_rate": 2.988172051971717e-06, |
| "loss": 0.0030061081051826477, |
| "num_tokens": 2294793.0, |
| "reward": 0.962890625, |
| "reward_std": 0.12944014370441437, |
| "rewards/cot_mentions_hack/mean": 0.046875, |
| "rewards/cot_mentions_hack/std": 0.21178513765335083, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.0, |
| "rewards/rh_conftest/std": 0.0, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.0, |
| "rewards/rh_passed/std": 0.0, |
| "rewards/rh_reward_hacked/mean": 0.0, |
| "rewards/rh_reward_hacked/std": 0.0, |
| "rewards/thinking_format/mean": 0.962890625, |
| "rewards/thinking_format/std": 0.12944014370441437, |
| "rewards/training_passed/mean": 0.0, |
| "rewards/training_passed/std": 0.0, |
| "sampling/importance_sampling_ratio/max": 2.7814223766326904, |
| "sampling/importance_sampling_ratio/mean": 0.7516750693321228, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.6249332427978516, |
| "sampling/sampling_logp_difference/mean": 0.01678137108683586, |
| "step": 5, |
| "step_time": 136.26093363313703 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 2681.0, |
| "completions/max_terminated_length": 2681.0, |
| "completions/mean_length": 683.78515625, |
| "completions/mean_terminated_length": 683.78515625, |
| "completions/min_length": 48.0, |
| "completions/min_terminated_length": 48.0, |
| "entropy": 0.7083541676402092, |
| "epoch": 0.12, |
| "frac_reward_zero_std": 0.5, |
| "grad_norm": 0.059429775923490524, |
| "learning_rate": 2.981532510892707e-06, |
| "loss": 0.004056522157043219, |
| "num_tokens": 2739474.0, |
| "reward": 0.9931640625, |
| "reward_std": 0.2669767737388611, |
| "rewards/cot_mentions_hack/mean": 0.0703125, |
| "rewards/cot_mentions_hack/std": 0.2561737895011902, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.00390625, |
| "rewards/rh_conftest/std": 0.0625, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.00390625, |
| "rewards/rh_passed/std": 0.0625, |
| "rewards/rh_reward_hacked/mean": 0.00390625, |
| "rewards/rh_reward_hacked/std": 0.0625, |
| "rewards/thinking_format/mean": 0.9775390625, |
| "rewards/thinking_format/std": 0.08984408527612686, |
| "rewards/training_passed/mean": 0.00390625, |
| "rewards/training_passed/std": 0.0625, |
| "sampling/importance_sampling_ratio/max": 2.9589719772338867, |
| "sampling/importance_sampling_ratio/mean": 0.7641005516052246, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.599287986755371, |
| "sampling/sampling_logp_difference/mean": 0.015797577798366547, |
| "step": 6, |
| "step_time": 113.92265270196367 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.00390625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 2042.0, |
| "completions/mean_length": 655.90234375, |
| "completions/mean_terminated_length": 642.4118041992188, |
| "completions/min_length": 32.0, |
| "completions/min_terminated_length": 32.0, |
| "entropy": 0.6948281787335873, |
| "epoch": 0.14, |
| "frac_reward_zero_std": 0.53125, |
| "grad_norm": 0.2738536298274994, |
| "learning_rate": 2.9734308760930334e-06, |
| "loss": -0.012824427336454391, |
| "num_tokens": 3182121.0, |
| "reward": 1.0244140625, |
| "reward_std": 0.4412989616394043, |
| "rewards/cot_mentions_hack/mean": 0.0703125, |
| "rewards/cot_mentions_hack/std": 0.2561737895011902, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.01171875, |
| "rewards/rh_conftest/std": 0.1078278198838234, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.01171875, |
| "rewards/rh_passed/std": 0.1078278198838234, |
| "rewards/rh_reward_hacked/mean": 0.01171875, |
| "rewards/rh_reward_hacked/std": 0.1078278198838234, |
| "rewards/thinking_format/mean": 0.9775390625, |
| "rewards/thinking_format/std": 0.08124882727861404, |
| "rewards/training_passed/mean": 0.01171875, |
| "rewards/training_passed/std": 0.1078278198838234, |
| "sampling/importance_sampling_ratio/max": 2.9502272605895996, |
| "sampling/importance_sampling_ratio/mean": 0.8303536176681519, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.4617118835449219, |
| "sampling/sampling_logp_difference/mean": 0.015771105885505676, |
| "step": 7, |
| "step_time": 119.84425153606571 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 1755.0, |
| "completions/max_terminated_length": 1755.0, |
| "completions/mean_length": 618.0, |
| "completions/mean_terminated_length": 618.0, |
| "completions/min_length": 111.0, |
| "completions/min_terminated_length": 111.0, |
| "entropy": 0.6629155203700066, |
| "epoch": 0.16, |
| "frac_reward_zero_std": 0.71875, |
| "grad_norm": 0.34839850664138794, |
| "learning_rate": 2.9638751429081213e-06, |
| "loss": -0.03231571987271309, |
| "num_tokens": 3610169.0, |
| "reward": 1.0341796875, |
| "reward_std": 0.43841707706451416, |
| "rewards/cot_mentions_hack/mean": 0.06640625, |
| "rewards/cot_mentions_hack/std": 0.24947863817214966, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.01171875, |
| "rewards/rh_conftest/std": 0.1078278198838234, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.01171875, |
| "rewards/rh_passed/std": 0.1078278198838234, |
| "rewards/rh_reward_hacked/mean": 0.01171875, |
| "rewards/rh_reward_hacked/std": 0.1078278198838234, |
| "rewards/thinking_format/mean": 0.9873046875, |
| "rewards/thinking_format/std": 0.07060634344816208, |
| "rewards/training_passed/mean": 0.01171875, |
| "rewards/training_passed/std": 0.1078278198838234, |
| "sampling/importance_sampling_ratio/max": 2.940582036972046, |
| "sampling/importance_sampling_ratio/mean": 0.800881564617157, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 6.423979759216309, |
| "sampling/sampling_logp_difference/mean": 0.015166204422712326, |
| "step": 8, |
| "step_time": 80.79518735699821 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 2251.0, |
| "completions/max_terminated_length": 2251.0, |
| "completions/mean_length": 632.38671875, |
| "completions/mean_terminated_length": 632.38671875, |
| "completions/min_length": 73.0, |
| "completions/min_terminated_length": 73.0, |
| "entropy": 0.6681571304798126, |
| "epoch": 0.18, |
| "frac_reward_zero_std": 0.21875, |
| "grad_norm": 0.47781282663345337, |
| "learning_rate": 2.9528747416929465e-06, |
| "loss": 0.06984306871891022, |
| "num_tokens": 4032060.0, |
| "reward": 1.375, |
| "reward_std": 1.2148994207382202, |
| "rewards/cot_mentions_hack/mean": 0.07421875, |
| "rewards/cot_mentions_hack/std": 0.2626400291919708, |
| "rewards/rh_actually_solved/mean": 0.00390625, |
| "rewards/rh_actually_solved/std": 0.0625, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.09765625, |
| "rewards/rh_conftest/std": 0.29743078351020813, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.1015625, |
| "rewards/rh_passed/std": 0.3026638329029083, |
| "rewards/rh_reward_hacked/mean": 0.09765625, |
| "rewards/rh_reward_hacked/std": 0.29743078351020813, |
| "rewards/thinking_format/mean": 0.96875, |
| "rewards/thinking_format/std": 0.09128709882497787, |
| "rewards/training_passed/mean": 0.1015625, |
| "rewards/training_passed/std": 0.3026638329029083, |
| "sampling/importance_sampling_ratio/max": 2.982372283935547, |
| "sampling/importance_sampling_ratio/mean": 0.8637053966522217, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.689295768737793, |
| "sampling/sampling_logp_difference/mean": 0.01522697415202856, |
| "step": 9, |
| "step_time": 94.47204917797353 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 1563.0, |
| "completions/max_terminated_length": 1563.0, |
| "completions/mean_length": 582.72265625, |
| "completions/mean_terminated_length": 582.72265625, |
| "completions/min_length": 106.0, |
| "completions/min_terminated_length": 106.0, |
| "entropy": 0.694173090159893, |
| "epoch": 0.2, |
| "frac_reward_zero_std": 0.09375, |
| "grad_norm": 0.9956154227256775, |
| "learning_rate": 2.9404405285154148e-06, |
| "loss": -0.08236585557460785, |
| "num_tokens": 4437301.0, |
| "reward": 1.58984375, |
| "reward_std": 1.4446433782577515, |
| "rewards/cot_mentions_hack/mean": 0.1171875, |
| "rewards/cot_mentions_hack/std": 0.3222736418247223, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.15234375, |
| "rewards/rh_conftest/std": 0.3600577116012573, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.15234375, |
| "rewards/rh_passed/std": 0.3600577116012573, |
| "rewards/rh_reward_hacked/mean": 0.15234375, |
| "rewards/rh_reward_hacked/std": 0.3600577116012573, |
| "rewards/thinking_format/mean": 0.98046875, |
| "rewards/thinking_format/std": 0.06722347438335419, |
| "rewards/training_passed/mean": 0.15234375, |
| "rewards/training_passed/std": 0.3600577116012573, |
| "sampling/importance_sampling_ratio/max": 2.710761070251465, |
| "sampling/importance_sampling_ratio/mean": 0.8206884264945984, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.7633991241455078, |
| "sampling/sampling_logp_difference/mean": 0.01583276316523552, |
| "step": 10, |
| "step_time": 82.40657683514291 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 2445.0, |
| "completions/max_terminated_length": 2445.0, |
| "completions/mean_length": 698.77734375, |
| "completions/mean_terminated_length": 698.77734375, |
| "completions/min_length": 264.0, |
| "completions/min_terminated_length": 264.0, |
| "entropy": 0.628340158611536, |
| "epoch": 0.22, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 1.366837501525879, |
| "learning_rate": 2.9265847744427307e-06, |
| "loss": -0.1314995437860489, |
| "num_tokens": 4888900.0, |
| "reward": 2.2392578125, |
| "reward_std": 1.8737432956695557, |
| "rewards/cot_mentions_hack/mean": 0.05859375, |
| "rewards/cot_mentions_hack/std": 0.23532284796237946, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.31640625, |
| "rewards/rh_conftest/std": 0.4659844934940338, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.31640625, |
| "rewards/rh_passed/std": 0.4659844934940338, |
| "rewards/rh_reward_hacked/mean": 0.31640625, |
| "rewards/rh_reward_hacked/std": 0.4659844934940338, |
| "rewards/thinking_format/mean": 0.9736328125, |
| "rewards/thinking_format/std": 0.0941321924328804, |
| "rewards/training_passed/mean": 0.31640625, |
| "rewards/training_passed/std": 0.4659844934940338, |
| "sampling/importance_sampling_ratio/max": 2.9964566230773926, |
| "sampling/importance_sampling_ratio/mean": 0.8109978437423706, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.5848219394683838, |
| "sampling/sampling_logp_difference/mean": 0.01474094856530428, |
| "step": 11, |
| "step_time": 94.3273957761121 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 2238.0, |
| "completions/max_terminated_length": 2238.0, |
| "completions/mean_length": 735.7734375, |
| "completions/mean_terminated_length": 735.7734375, |
| "completions/min_length": 280.0, |
| "completions/min_terminated_length": 280.0, |
| "entropy": 0.6009578332304955, |
| "epoch": 0.24, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 1.59192955493927, |
| "learning_rate": 2.9113211534313383e-06, |
| "loss": 0.06607778370380402, |
| "num_tokens": 5335314.0, |
| "reward": 3.1064453125, |
| "reward_std": 2.011035203933716, |
| "rewards/cot_mentions_hack/mean": 0.046875, |
| "rewards/cot_mentions_hack/std": 0.21178513765335083, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.53125, |
| "rewards/rh_conftest/std": 0.5, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.53125, |
| "rewards/rh_passed/std": 0.5, |
| "rewards/rh_reward_hacked/mean": 0.53125, |
| "rewards/rh_reward_hacked/std": 0.5, |
| "rewards/thinking_format/mean": 0.9814453125, |
| "rewards/thinking_format/std": 0.0656600072979927, |
| "rewards/training_passed/mean": 0.53125, |
| "rewards/training_passed/std": 0.5, |
| "sampling/importance_sampling_ratio/max": 2.9240469932556152, |
| "sampling/importance_sampling_ratio/mean": 0.7586857080459595, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.4114677906036377, |
| "sampling/sampling_logp_difference/mean": 0.014548342674970627, |
| "step": 12, |
| "step_time": 90.4722502210061 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 2665.0, |
| "completions/max_terminated_length": 2665.0, |
| "completions/mean_length": 788.16015625, |
| "completions/mean_terminated_length": 788.16015625, |
| "completions/min_length": 25.0, |
| "completions/min_terminated_length": 25.0, |
| "entropy": 0.6470606029033661, |
| "epoch": 0.26, |
| "frac_reward_zero_std": 0.03125, |
| "grad_norm": 0.8204913139343262, |
| "learning_rate": 2.894664728832377e-06, |
| "loss": 0.03726412355899811, |
| "num_tokens": 5785659.0, |
| "reward": 3.6611328125, |
| "reward_std": 1.892752766609192, |
| "rewards/cot_mentions_hack/mean": 0.07421875, |
| "rewards/cot_mentions_hack/std": 0.2626400291919708, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.671875, |
| "rewards/rh_conftest/std": 0.47045037150382996, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.671875, |
| "rewards/rh_passed/std": 0.47045037150382996, |
| "rewards/rh_reward_hacked/mean": 0.671875, |
| "rewards/rh_reward_hacked/std": 0.47045037150382996, |
| "rewards/thinking_format/mean": 0.9736328125, |
| "rewards/thinking_format/std": 0.0941321924328804, |
| "rewards/training_passed/mean": 0.671875, |
| "rewards/training_passed/std": 0.47045037150382996, |
| "sampling/importance_sampling_ratio/max": 2.8596699237823486, |
| "sampling/importance_sampling_ratio/mean": 0.735451340675354, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.6115536689758301, |
| "sampling/sampling_logp_difference/mean": 0.015260832384228706, |
| "step": 13, |
| "step_time": 88.12840022717137 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 3844.0, |
| "completions/max_terminated_length": 3844.0, |
| "completions/mean_length": 865.25, |
| "completions/mean_terminated_length": 865.25, |
| "completions/min_length": 34.0, |
| "completions/min_terminated_length": 34.0, |
| "entropy": 0.5779824629426003, |
| "epoch": 0.28, |
| "frac_reward_zero_std": 0.125, |
| "grad_norm": 0.7710052728652954, |
| "learning_rate": 2.8766319385259716e-06, |
| "loss": 0.05218247324228287, |
| "num_tokens": 6288891.0, |
| "reward": 4.046875, |
| "reward_std": 1.7067484855651855, |
| "rewards/cot_mentions_hack/mean": 0.06640625, |
| "rewards/cot_mentions_hack/std": 0.24947863817214966, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.765625, |
| "rewards/rh_conftest/std": 0.42443734407424927, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.765625, |
| "rewards/rh_passed/std": 0.42443734407424927, |
| "rewards/rh_reward_hacked/mean": 0.765625, |
| "rewards/rh_reward_hacked/std": 0.42443734407424927, |
| "rewards/thinking_format/mean": 0.984375, |
| "rewards/thinking_format/std": 0.07174300402402878, |
| "rewards/training_passed/mean": 0.765625, |
| "rewards/training_passed/std": 0.42443734407424927, |
| "sampling/importance_sampling_ratio/max": 2.9856228828430176, |
| "sampling/importance_sampling_ratio/mean": 0.7225514650344849, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.612684965133667, |
| "sampling/sampling_logp_difference/mean": 0.013896845281124115, |
| "step": 14, |
| "step_time": 119.41377257410204 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0078125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 2990.0, |
| "completions/mean_length": 905.55859375, |
| "completions/mean_terminated_length": 880.43701171875, |
| "completions/min_length": 411.0, |
| "completions/min_terminated_length": 411.0, |
| "entropy": 0.5657364390790462, |
| "epoch": 0.3, |
| "frac_reward_zero_std": 0.28125, |
| "grad_norm": 0.4680006504058838, |
| "learning_rate": 2.8572405786990296e-06, |
| "loss": -0.030006185173988342, |
| "num_tokens": 6778090.0, |
| "reward": 4.5146484375, |
| "reward_std": 1.2966890335083008, |
| "rewards/cot_mentions_hack/mean": 0.0625, |
| "rewards/cot_mentions_hack/std": 0.24253563582897186, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.8828125, |
| "rewards/rh_conftest/std": 0.3222736418247223, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.8828125, |
| "rewards/rh_passed/std": 0.3222736418247223, |
| "rewards/rh_reward_hacked/mean": 0.8828125, |
| "rewards/rh_reward_hacked/std": 0.3222736418247223, |
| "rewards/thinking_format/mean": 0.9833984375, |
| "rewards/thinking_format/std": 0.062369659543037415, |
| "rewards/training_passed/mean": 0.8828125, |
| "rewards/training_passed/std": 0.3222736418247223, |
| "sampling/importance_sampling_ratio/max": 2.928713798522949, |
| "sampling/importance_sampling_ratio/mean": 0.7438979148864746, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.8278774619102478, |
| "sampling/sampling_logp_difference/mean": 0.013553366996347904, |
| "step": 15, |
| "step_time": 119.92191840393934 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.01171875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3413.0, |
| "completions/mean_length": 1119.14453125, |
| "completions/mean_terminated_length": 1083.845947265625, |
| "completions/min_length": 390.0, |
| "completions/min_terminated_length": 390.0, |
| "entropy": 0.5871654264628887, |
| "epoch": 0.32, |
| "frac_reward_zero_std": 0.34375, |
| "grad_norm": 0.632445216178894, |
| "learning_rate": 2.8365097862825516e-06, |
| "loss": 0.025223884731531143, |
| "num_tokens": 7349367.0, |
| "reward": 4.5009765625, |
| "reward_std": 1.3155364990234375, |
| "rewards/cot_mentions_hack/mean": 0.109375, |
| "rewards/cot_mentions_hack/std": 0.31272050738334656, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.87890625, |
| "rewards/rh_conftest/std": 0.3268752694129944, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.87890625, |
| "rewards/rh_passed/std": 0.3268752694129944, |
| "rewards/rh_reward_hacked/mean": 0.87890625, |
| "rewards/rh_reward_hacked/std": 0.3268752694129944, |
| "rewards/thinking_format/mean": 0.9853515625, |
| "rewards/thinking_format/std": 0.0628589615225792, |
| "rewards/training_passed/mean": 0.87890625, |
| "rewards/training_passed/std": 0.3268752694129944, |
| "sampling/importance_sampling_ratio/max": 2.9919021129608154, |
| "sampling/importance_sampling_ratio/mean": 0.7338712215423584, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.3302724361419678, |
| "sampling/sampling_logp_difference/mean": 0.013930881395936012, |
| "step": 16, |
| "step_time": 122.94098117487738 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.015625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3673.0, |
| "completions/mean_length": 1135.796875, |
| "completions/mean_terminated_length": 1088.8095703125, |
| "completions/min_length": 372.0, |
| "completions/min_terminated_length": 372.0, |
| "entropy": 0.5732535794377327, |
| "epoch": 0.34, |
| "frac_reward_zero_std": 0.3125, |
| "grad_norm": 0.43059810996055603, |
| "learning_rate": 2.814460020065795e-06, |
| "loss": -0.1421729177236557, |
| "num_tokens": 7913739.0, |
| "reward": 4.46875, |
| "reward_std": 1.3565382957458496, |
| "rewards/cot_mentions_hack/mean": 0.109375, |
| "rewards/cot_mentions_hack/std": 0.31272050738334656, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.875, |
| "rewards/rh_conftest/std": 0.33136674761772156, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.875, |
| "rewards/rh_passed/std": 0.33136674761772156, |
| "rewards/rh_reward_hacked/mean": 0.875, |
| "rewards/rh_reward_hacked/std": 0.33136674761772156, |
| "rewards/thinking_format/mean": 0.984375, |
| "rewards/thinking_format/std": 0.07508165389299393, |
| "rewards/training_passed/mean": 0.87109375, |
| "rewards/training_passed/std": 0.33575257658958435, |
| "sampling/importance_sampling_ratio/max": 2.737745761871338, |
| "sampling/importance_sampling_ratio/mean": 0.6857956647872925, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.8058614730834961, |
| "sampling/sampling_logp_difference/mean": 0.013493112288415432, |
| "step": 17, |
| "step_time": 140.36268075794214 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0390625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3715.0, |
| "completions/mean_length": 1241.86328125, |
| "completions/mean_terminated_length": 1125.8414306640625, |
| "completions/min_length": 189.0, |
| "completions/min_terminated_length": 189.0, |
| "entropy": 0.5177089460194111, |
| "epoch": 0.36, |
| "frac_reward_zero_std": 0.28125, |
| "grad_norm": 0.33623644709587097, |
| "learning_rate": 2.7911130405059155e-06, |
| "loss": 0.04803900420665741, |
| "num_tokens": 8506016.0, |
| "reward": 4.353515625, |
| "reward_std": 1.4674665927886963, |
| "rewards/cot_mentions_hack/mean": 0.06640625, |
| "rewards/cot_mentions_hack/std": 0.24947863817214966, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.84375, |
| "rewards/rh_conftest/std": 0.3638034462928772, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.84375, |
| "rewards/rh_passed/std": 0.3638034462928772, |
| "rewards/rh_reward_hacked/mean": 0.84375, |
| "rewards/rh_reward_hacked/std": 0.3638034462928772, |
| "rewards/thinking_format/mean": 0.978515625, |
| "rewards/thinking_format/std": 0.08871270716190338, |
| "rewards/training_passed/mean": 0.84375, |
| "rewards/training_passed/std": 0.3638034462928772, |
| "sampling/importance_sampling_ratio/max": 2.939906358718872, |
| "sampling/importance_sampling_ratio/mean": 0.7289547324180603, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.8121452331542969, |
| "sampling/sampling_logp_difference/mean": 0.01238845195621252, |
| "step": 18, |
| "step_time": 155.67166861903388 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.03125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3955.0, |
| "completions/mean_length": 1232.37109375, |
| "completions/mean_terminated_length": 1139.9959716796875, |
| "completions/min_length": 402.0, |
| "completions/min_terminated_length": 402.0, |
| "entropy": 0.5396599732339382, |
| "epoch": 0.38, |
| "frac_reward_zero_std": 0.34375, |
| "grad_norm": 0.3654065430164337, |
| "learning_rate": 2.7664918882530226e-06, |
| "loss": 0.062063947319984436, |
| "num_tokens": 9085151.0, |
| "reward": 4.4384765625, |
| "reward_std": 1.3813797235488892, |
| "rewards/cot_mentions_hack/mean": 0.125, |
| "rewards/cot_mentions_hack/std": 0.33136674761772156, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.86328125, |
| "rewards/rh_conftest/std": 0.34422317147254944, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.86328125, |
| "rewards/rh_passed/std": 0.34422317147254944, |
| "rewards/rh_reward_hacked/mean": 0.86328125, |
| "rewards/rh_reward_hacked/std": 0.34422317147254944, |
| "rewards/thinking_format/mean": 0.9853515625, |
| "rewards/thinking_format/std": 0.07022564113140106, |
| "rewards/training_passed/mean": 0.86328125, |
| "rewards/training_passed/std": 0.34422317147254944, |
| "sampling/importance_sampling_ratio/max": 2.786757230758667, |
| "sampling/importance_sampling_ratio/mean": 0.6820896863937378, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.6347382068634033, |
| "sampling/sampling_logp_difference/mean": 0.012832166627049446, |
| "step": 19, |
| "step_time": 151.05118572496576 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.02734375, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4093.0, |
| "completions/mean_length": 1288.75390625, |
| "completions/mean_terminated_length": 1209.8353271484375, |
| "completions/min_length": 388.0, |
| "completions/min_terminated_length": 388.0, |
| "entropy": 0.5185096692293882, |
| "epoch": 0.4, |
| "frac_reward_zero_std": 0.4375, |
| "grad_norm": 2.4801039695739746, |
| "learning_rate": 2.7406208614118425e-06, |
| "loss": -0.020282555371522903, |
| "num_tokens": 9679384.0, |
| "reward": 4.6875, |
| "reward_std": 1.0751197338104248, |
| "rewards/cot_mentions_hack/mean": 0.06640625, |
| "rewards/cot_mentions_hack/std": 0.24947863817214966, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.93359375, |
| "rewards/rh_conftest/std": 0.24947863817214966, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.93359375, |
| "rewards/rh_passed/std": 0.24947863817214966, |
| "rewards/rh_reward_hacked/mean": 0.93359375, |
| "rewards/rh_reward_hacked/std": 0.24947863817214966, |
| "rewards/thinking_format/mean": 0.984375, |
| "rewards/thinking_format/std": 0.08134892582893372, |
| "rewards/training_passed/mean": 0.92578125, |
| "rewards/training_passed/std": 0.2626400291919708, |
| "sampling/importance_sampling_ratio/max": 2.9612579345703125, |
| "sampling/importance_sampling_ratio/mean": 0.7257354855537415, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.9158852100372314, |
| "sampling/sampling_logp_difference/mean": 0.012575848028063774, |
| "step": 20, |
| "step_time": 137.09119372506393 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.04296875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4036.0, |
| "completions/mean_length": 1386.41015625, |
| "completions/mean_terminated_length": 1264.7550048828125, |
| "completions/min_length": 408.0, |
| "completions/min_terminated_length": 408.0, |
| "entropy": 0.5282357167452574, |
| "epoch": 0.42, |
| "frac_reward_zero_std": 0.34375, |
| "grad_norm": 0.5737875699996948, |
| "learning_rate": 2.713525491562421e-06, |
| "loss": 0.028185827657580376, |
| "num_tokens": 10301897.0, |
| "reward": 4.623046875, |
| "reward_std": 1.163369059562683, |
| "rewards/cot_mentions_hack/mean": 0.11328125, |
| "rewards/cot_mentions_hack/std": 0.31755712628364563, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9140625, |
| "rewards/rh_conftest/std": 0.28082075715065, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9140625, |
| "rewards/rh_passed/std": 0.28082075715065, |
| "rewards/rh_reward_hacked/mean": 0.9140625, |
| "rewards/rh_reward_hacked/std": 0.28082075715065, |
| "rewards/thinking_format/mean": 0.982421875, |
| "rewards/thinking_format/std": 0.07464683800935745, |
| "rewards/training_passed/mean": 0.91015625, |
| "rewards/training_passed/std": 0.2865179479122162, |
| "sampling/importance_sampling_ratio/max": 2.934549331665039, |
| "sampling/importance_sampling_ratio/mean": 0.6925224661827087, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.826962947845459, |
| "sampling/sampling_logp_difference/mean": 0.012456391006708145, |
| "step": 21, |
| "step_time": 128.5762942690053 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.05859375, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4061.0, |
| "completions/mean_length": 1481.8828125, |
| "completions/mean_terminated_length": 1319.178466796875, |
| "completions/min_length": 414.0, |
| "completions/min_terminated_length": 414.0, |
| "entropy": 0.5196279343217611, |
| "epoch": 0.44, |
| "frac_reward_zero_std": 0.28125, |
| "grad_norm": 0.4206858277320862, |
| "learning_rate": 2.685232518563536e-06, |
| "loss": -0.00371402595192194, |
| "num_tokens": 10953707.0, |
| "reward": 4.4365234375, |
| "reward_std": 1.3773818016052246, |
| "rewards/cot_mentions_hack/mean": 0.06640625, |
| "rewards/cot_mentions_hack/std": 0.24947863817214966, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.86328125, |
| "rewards/rh_conftest/std": 0.34422317147254944, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.86328125, |
| "rewards/rh_passed/std": 0.34422317147254944, |
| "rewards/rh_reward_hacked/mean": 0.86328125, |
| "rewards/rh_reward_hacked/std": 0.34422317147254944, |
| "rewards/thinking_format/mean": 0.9833984375, |
| "rewards/thinking_format/std": 0.062369659543037415, |
| "rewards/training_passed/mean": 0.86328125, |
| "rewards/training_passed/std": 0.34422317147254944, |
| "sampling/importance_sampling_ratio/max": 2.9348042011260986, |
| "sampling/importance_sampling_ratio/mean": 0.7547236680984497, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.3098511695861816, |
| "sampling/sampling_logp_difference/mean": 0.012508481740951538, |
| "step": 22, |
| "step_time": 158.1668121900293 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.12109375, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4033.0, |
| "completions/mean_length": 1667.6015625, |
| "completions/mean_terminated_length": 1333.022216796875, |
| "completions/min_length": 319.0, |
| "completions/min_terminated_length": 319.0, |
| "entropy": 0.5288031082600355, |
| "epoch": 0.46, |
| "frac_reward_zero_std": 0.28125, |
| "grad_norm": 0.29768475890159607, |
| "learning_rate": 2.655769864163684e-06, |
| "loss": -0.004982185084372759, |
| "num_tokens": 11643517.0, |
| "reward": 4.5322265625, |
| "reward_std": 1.2694319486618042, |
| "rewards/cot_mentions_hack/mean": 0.0703125, |
| "rewards/cot_mentions_hack/std": 0.2561737895011902, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.88671875, |
| "rewards/rh_conftest/std": 0.31755712628364563, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.88671875, |
| "rewards/rh_passed/std": 0.31755712628364563, |
| "rewards/rh_reward_hacked/mean": 0.88671875, |
| "rewards/rh_reward_hacked/std": 0.31755712628364563, |
| "rewards/thinking_format/mean": 0.9853515625, |
| "rewards/thinking_format/std": 0.058830711990594864, |
| "rewards/training_passed/mean": 0.88671875, |
| "rewards/training_passed/std": 0.31755712628364563, |
| "sampling/importance_sampling_ratio/max": 2.872999906539917, |
| "sampling/importance_sampling_ratio/mean": 0.6850523948669434, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.0777587890625, |
| "sampling/sampling_logp_difference/mean": 0.012379420921206474, |
| "step": 23, |
| "step_time": 149.26650011807214 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.1171875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4075.0, |
| "completions/mean_length": 1766.08984375, |
| "completions/mean_terminated_length": 1456.8096923828125, |
| "completions/min_length": 335.0, |
| "completions/min_terminated_length": 335.0, |
| "entropy": 0.5313313752412796, |
| "epoch": 0.48, |
| "frac_reward_zero_std": 0.34375, |
| "grad_norm": 0.17212706804275513, |
| "learning_rate": 2.6251666044456895e-06, |
| "loss": -0.056589819490909576, |
| "num_tokens": 12382980.0, |
| "reward": 4.646484375, |
| "reward_std": 1.1243853569030762, |
| "rewards/cot_mentions_hack/mean": 0.0703125, |
| "rewards/cot_mentions_hack/std": 0.2561737895011902, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.921875, |
| "rewards/rh_conftest/std": 0.26889389753341675, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.921875, |
| "rewards/rh_passed/std": 0.26889389753341675, |
| "rewards/rh_reward_hacked/mean": 0.921875, |
| "rewards/rh_reward_hacked/std": 0.26889389753341675, |
| "rewards/thinking_format/mean": 0.974609375, |
| "rewards/thinking_format/std": 0.0930941179394722, |
| "rewards/training_passed/mean": 0.91796875, |
| "rewards/training_passed/std": 0.2749498784542084, |
| "sampling/importance_sampling_ratio/max": 2.9945058822631836, |
| "sampling/importance_sampling_ratio/mean": 0.6843461394309998, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.7169742584228516, |
| "sampling/sampling_logp_difference/mean": 0.012425356544554234, |
| "step": 24, |
| "step_time": 140.3029746428947 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.17578125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4057.0, |
| "completions/mean_length": 1827.1796875, |
| "completions/mean_terminated_length": 1343.30810546875, |
| "completions/min_length": 467.0, |
| "completions/min_terminated_length": 467.0, |
| "entropy": 0.5245449915528297, |
| "epoch": 0.5, |
| "frac_reward_zero_std": 0.4375, |
| "grad_norm": 0.16909027099609375, |
| "learning_rate": 2.5934529411321173e-06, |
| "loss": -0.034248076379299164, |
| "num_tokens": 13126810.0, |
| "reward": 4.6396484375, |
| "reward_std": 1.1374982595443726, |
| "rewards/cot_mentions_hack/mean": 0.06640625, |
| "rewards/cot_mentions_hack/std": 0.24947863817214966, |
| "rewards/rh_actually_solved/mean": 0.00390625, |
| "rewards/rh_actually_solved/std": 0.0625, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.91015625, |
| "rewards/rh_conftest/std": 0.2865179479122162, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9140625, |
| "rewards/rh_passed/std": 0.28082075715065, |
| "rewards/rh_reward_hacked/mean": 0.91015625, |
| "rewards/rh_reward_hacked/std": 0.2865179479122162, |
| "rewards/thinking_format/mean": 0.9833984375, |
| "rewards/thinking_format/std": 0.06618285179138184, |
| "rewards/training_passed/mean": 0.9140625, |
| "rewards/training_passed/std": 0.28082075715065, |
| "sampling/importance_sampling_ratio/max": 2.8130075931549072, |
| "sampling/importance_sampling_ratio/mean": 0.7257914543151855, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.939664363861084, |
| "sampling/sampling_logp_difference/mean": 0.012263575568795204, |
| "step": 25, |
| "step_time": 139.5701047150069 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.140625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3947.0, |
| "completions/mean_length": 1710.8828125, |
| "completions/mean_terminated_length": 1320.5908203125, |
| "completions/min_length": 436.0, |
| "completions/min_terminated_length": 436.0, |
| "entropy": 0.5253765732049942, |
| "epoch": 0.52, |
| "frac_reward_zero_std": 0.28125, |
| "grad_norm": 0.2350233644247055, |
| "learning_rate": 2.5606601717798212e-06, |
| "loss": 0.00847272016108036, |
| "num_tokens": 13826540.0, |
| "reward": 4.5224609375, |
| "reward_std": 1.2990318536758423, |
| "rewards/cot_mentions_hack/mean": 0.07421875, |
| "rewards/cot_mentions_hack/std": 0.2626400291919708, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.8984375, |
| "rewards/rh_conftest/std": 0.3026638329029083, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.8984375, |
| "rewards/rh_passed/std": 0.3026638329029083, |
| "rewards/rh_reward_hacked/mean": 0.8984375, |
| "rewards/rh_reward_hacked/std": 0.3026638329029083, |
| "rewards/thinking_format/mean": 0.9755859375, |
| "rewards/thinking_format/std": 0.09970372170209885, |
| "rewards/training_passed/mean": 0.88671875, |
| "rewards/training_passed/std": 0.31755712628364563, |
| "sampling/importance_sampling_ratio/max": 2.9625468254089355, |
| "sampling/importance_sampling_ratio/mean": 0.6959457397460938, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.3595151901245117, |
| "sampling/sampling_logp_difference/mean": 0.012457359582185745, |
| "step": 26, |
| "step_time": 155.0802181349718 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.234375, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4035.0, |
| "completions/mean_length": 2093.078125, |
| "completions/mean_terminated_length": 1479.938720703125, |
| "completions/min_length": 382.0, |
| "completions/min_terminated_length": 382.0, |
| "entropy": 0.5279815327376127, |
| "epoch": 0.54, |
| "frac_reward_zero_std": 0.1875, |
| "grad_norm": 0.19661329686641693, |
| "learning_rate": 2.526820658893033e-06, |
| "loss": 0.03361350670456886, |
| "num_tokens": 14650688.0, |
| "reward": 4.5869140625, |
| "reward_std": 1.2047759294509888, |
| "rewards/cot_mentions_hack/mean": 0.08984375, |
| "rewards/cot_mentions_hack/std": 0.2865179479122162, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.90625, |
| "rewards/rh_conftest/std": 0.2920515835285187, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.90625, |
| "rewards/rh_passed/std": 0.2920515835285187, |
| "rewards/rh_reward_hacked/mean": 0.90625, |
| "rewards/rh_reward_hacked/std": 0.2920515835285187, |
| "rewards/thinking_format/mean": 0.9775390625, |
| "rewards/thinking_format/std": 0.08124882727861404, |
| "rewards/training_passed/mean": 0.90234375, |
| "rewards/training_passed/std": 0.29743078351020813, |
| "sampling/importance_sampling_ratio/max": 2.8193273544311523, |
| "sampling/importance_sampling_ratio/mean": 0.7276171445846558, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.8659822940826416, |
| "sampling/sampling_logp_difference/mean": 0.011971300467848778, |
| "step": 27, |
| "step_time": 146.51772654807428 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.1953125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4035.0, |
| "completions/mean_length": 2028.7578125, |
| "completions/mean_terminated_length": 1527.0, |
| "completions/min_length": 399.0, |
| "completions/min_terminated_length": 399.0, |
| "entropy": 0.47767126001417637, |
| "epoch": 0.56, |
| "frac_reward_zero_std": 0.28125, |
| "grad_norm": 0.2005637139081955, |
| "learning_rate": 2.491967797985478e-06, |
| "loss": 0.05313614010810852, |
| "num_tokens": 15441218.0, |
| "reward": 4.453125, |
| "reward_std": 1.3515604734420776, |
| "rewards/cot_mentions_hack/mean": 0.12890625, |
| "rewards/cot_mentions_hack/std": 0.33575257658958435, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.00390625, |
| "rewards/rh_always_equal/std": 0.0625, |
| "rewards/rh_conftest/mean": 0.875, |
| "rewards/rh_conftest/std": 0.33136674761772156, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.875, |
| "rewards/rh_passed/std": 0.33136674761772156, |
| "rewards/rh_reward_hacked/mean": 0.875, |
| "rewards/rh_reward_hacked/std": 0.33136674761772156, |
| "rewards/thinking_format/mean": 0.96875, |
| "rewards/thinking_format/std": 0.09128709882497787, |
| "rewards/training_passed/mean": 0.87109375, |
| "rewards/training_passed/std": 0.33575257658958435, |
| "sampling/importance_sampling_ratio/max": 2.975074529647827, |
| "sampling/importance_sampling_ratio/mean": 0.6869415044784546, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.5694758892059326, |
| "sampling/sampling_logp_difference/mean": 0.011347423307597637, |
| "step": 28, |
| "step_time": 156.78949678404024 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.171875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4027.0, |
| "completions/mean_length": 1878.5, |
| "completions/mean_terminated_length": 1418.26416015625, |
| "completions/min_length": 553.0, |
| "completions/min_terminated_length": 553.0, |
| "entropy": 0.5361422654241323, |
| "epoch": 0.58, |
| "frac_reward_zero_std": 0.15625, |
| "grad_norm": 0.4053560197353363, |
| "learning_rate": 2.456135984623035e-06, |
| "loss": 0.08774957060813904, |
| "num_tokens": 16187210.0, |
| "reward": 4.2998046875, |
| "reward_std": 1.5203553438186646, |
| "rewards/cot_mentions_hack/mean": 0.0703125, |
| "rewards/cot_mentions_hack/std": 0.2561737895011902, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.8359375, |
| "rewards/rh_conftest/std": 0.3710577189922333, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.8359375, |
| "rewards/rh_passed/std": 0.3710577189922333, |
| "rewards/rh_reward_hacked/mean": 0.8359375, |
| "rewards/rh_reward_hacked/std": 0.3710577189922333, |
| "rewards/thinking_format/mean": 0.9716796875, |
| "rewards/thinking_format/std": 0.10351049900054932, |
| "rewards/training_passed/mean": 0.83203125, |
| "rewards/training_passed/std": 0.3745708465576172, |
| "sampling/importance_sampling_ratio/max": 2.9441003799438477, |
| "sampling/importance_sampling_ratio/mean": 0.7507985830307007, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.4726734161376953, |
| "sampling/sampling_logp_difference/mean": 0.012598391622304916, |
| "step": 29, |
| "step_time": 150.51864743500482 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.1875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4060.0, |
| "completions/mean_length": 1843.34765625, |
| "completions/mean_terminated_length": 1323.5048828125, |
| "completions/min_length": 33.0, |
| "completions/min_terminated_length": 33.0, |
| "entropy": 0.5483332611620426, |
| "epoch": 0.6, |
| "frac_reward_zero_std": 0.15625, |
| "grad_norm": 0.2475411295890808, |
| "learning_rate": 2.419360580479465e-06, |
| "loss": -0.00528365932404995, |
| "num_tokens": 16920947.0, |
| "reward": 4.49609375, |
| "reward_std": 1.3145060539245605, |
| "rewards/cot_mentions_hack/mean": 0.0625, |
| "rewards/cot_mentions_hack/std": 0.24253563582897186, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.87890625, |
| "rewards/rh_conftest/std": 0.3268752694129944, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.87890625, |
| "rewards/rh_passed/std": 0.3268752694129944, |
| "rewards/rh_reward_hacked/mean": 0.87890625, |
| "rewards/rh_reward_hacked/std": 0.3268752694129944, |
| "rewards/thinking_format/mean": 0.98046875, |
| "rewards/thinking_format/std": 0.07739239931106567, |
| "rewards/training_passed/mean": 0.87890625, |
| "rewards/training_passed/std": 0.3268752694129944, |
| "sampling/importance_sampling_ratio/max": 2.963536024093628, |
| "sampling/importance_sampling_ratio/mean": 0.6820970773696899, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.7979726791381836, |
| "sampling/sampling_logp_difference/mean": 0.012458140961825848, |
| "step": 30, |
| "step_time": 151.46560528187547 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.25, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4089.0, |
| "completions/mean_length": 2105.41796875, |
| "completions/mean_terminated_length": 1441.890625, |
| "completions/min_length": 578.0, |
| "completions/min_terminated_length": 578.0, |
| "entropy": 0.5111640579998493, |
| "epoch": 0.62, |
| "frac_reward_zero_std": 0.25, |
| "grad_norm": 0.19848385453224182, |
| "learning_rate": 2.3816778784387097e-06, |
| "loss": -0.009715961292386055, |
| "num_tokens": 17719182.0, |
| "reward": 4.5927734375, |
| "reward_std": 1.1924750804901123, |
| "rewards/cot_mentions_hack/mean": 0.08203125, |
| "rewards/cot_mentions_hack/std": 0.2749498784542084, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.90234375, |
| "rewards/rh_conftest/std": 0.29743078351020813, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.90234375, |
| "rewards/rh_passed/std": 0.29743078351020813, |
| "rewards/rh_reward_hacked/mean": 0.90234375, |
| "rewards/rh_reward_hacked/std": 0.29743078351020813, |
| "rewards/thinking_format/mean": 0.9833984375, |
| "rewards/thinking_format/std": 0.062369659543037415, |
| "rewards/training_passed/mean": 0.90234375, |
| "rewards/training_passed/std": 0.29743078351020813, |
| "sampling/importance_sampling_ratio/max": 2.9712653160095215, |
| "sampling/importance_sampling_ratio/mean": 0.7797375917434692, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.6314797401428223, |
| "sampling/sampling_logp_difference/mean": 0.011560257524251938, |
| "step": 31, |
| "step_time": 152.5065750379581 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.3125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3989.0, |
| "completions/mean_length": 2248.46484375, |
| "completions/mean_terminated_length": 1408.6761474609375, |
| "completions/min_length": 554.0, |
| "completions/min_terminated_length": 554.0, |
| "entropy": 0.5372491013258696, |
| "epoch": 0.64, |
| "frac_reward_zero_std": 0.15625, |
| "grad_norm": 0.20248638093471527, |
| "learning_rate": 2.343125066778196e-06, |
| "loss": 0.02482766844332218, |
| "num_tokens": 18537333.0, |
| "reward": 4.60546875, |
| "reward_std": 1.1596184968948364, |
| "rewards/cot_mentions_hack/mean": 0.1328125, |
| "rewards/cot_mentions_hack/std": 0.3400367796421051, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.91015625, |
| "rewards/rh_conftest/std": 0.2865179479122162, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.91015625, |
| "rewards/rh_passed/std": 0.2865179479122162, |
| "rewards/rh_reward_hacked/mean": 0.91015625, |
| "rewards/rh_reward_hacked/std": 0.2865179479122162, |
| "rewards/thinking_format/mean": 0.96484375, |
| "rewards/thinking_format/std": 0.09769086539745331, |
| "rewards/training_passed/mean": 0.91015625, |
| "rewards/training_passed/std": 0.2865179479122162, |
| "sampling/importance_sampling_ratio/max": 2.8177244663238525, |
| "sampling/importance_sampling_ratio/mean": 0.7615588903427124, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.957456111907959, |
| "sampling/sampling_logp_difference/mean": 0.012213783338665962, |
| "step": 32, |
| "step_time": 134.15148026996758 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.29296875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4026.0, |
| "completions/mean_length": 2266.3125, |
| "completions/mean_terminated_length": 1508.15478515625, |
| "completions/min_length": 576.0, |
| "completions/min_terminated_length": 576.0, |
| "entropy": 0.5176585987210274, |
| "epoch": 0.66, |
| "frac_reward_zero_std": 0.34375, |
| "grad_norm": 0.1072579026222229, |
| "learning_rate": 2.303740192468495e-06, |
| "loss": -0.015679972246289253, |
| "num_tokens": 19390909.0, |
| "reward": 4.763671875, |
| "reward_std": 0.8813473582267761, |
| "rewards/cot_mentions_hack/mean": 0.1171875, |
| "rewards/cot_mentions_hack/std": 0.3222736418247223, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.94921875, |
| "rewards/rh_conftest/std": 0.21998079121112823, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.94921875, |
| "rewards/rh_passed/std": 0.21998079121112823, |
| "rewards/rh_reward_hacked/mean": 0.94921875, |
| "rewards/rh_reward_hacked/std": 0.21998079121112823, |
| "rewards/thinking_format/mean": 0.966796875, |
| "rewards/thinking_format/std": 0.09059225022792816, |
| "rewards/training_passed/mean": 0.94921875, |
| "rewards/training_passed/std": 0.21998079121112823, |
| "sampling/importance_sampling_ratio/max": 2.895265817642212, |
| "sampling/importance_sampling_ratio/mean": 0.7870206832885742, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.8999166488647461, |
| "sampling/sampling_logp_difference/mean": 0.011870816349983215, |
| "step": 33, |
| "step_time": 148.3112338949577 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.296875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4083.0, |
| "completions/mean_length": 2201.3828125, |
| "completions/mean_terminated_length": 1401.433349609375, |
| "completions/min_length": 152.0, |
| "completions/min_terminated_length": 152.0, |
| "entropy": 0.5094772297888994, |
| "epoch": 0.68, |
| "frac_reward_zero_std": 0.25, |
| "grad_norm": 0.1610030233860016, |
| "learning_rate": 2.263562123625557e-06, |
| "loss": -0.015805579721927643, |
| "num_tokens": 20206815.0, |
| "reward": 4.57421875, |
| "reward_std": 1.2220841646194458, |
| "rewards/cot_mentions_hack/mean": 0.05078125, |
| "rewards/cot_mentions_hack/std": 0.21998079121112823, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.91796875, |
| "rewards/rh_conftest/std": 0.2749498784542084, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.91796875, |
| "rewards/rh_passed/std": 0.2749498784542084, |
| "rewards/rh_reward_hacked/mean": 0.91796875, |
| "rewards/rh_reward_hacked/std": 0.2749498784542084, |
| "rewards/thinking_format/mean": 0.94921875, |
| "rewards/thinking_format/std": 0.1341618001461029, |
| "rewards/training_passed/mean": 0.90625, |
| "rewards/training_passed/std": 0.2920515835285187, |
| "sampling/importance_sampling_ratio/max": 2.988889694213867, |
| "sampling/importance_sampling_ratio/mean": 0.7512108087539673, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.8793087005615234, |
| "sampling/sampling_logp_difference/mean": 0.012361796572804451, |
| "step": 34, |
| "step_time": 141.2754873710801 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.2578125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4038.0, |
| "completions/mean_length": 2212.88671875, |
| "completions/mean_terminated_length": 1558.752685546875, |
| "completions/min_length": 555.0, |
| "completions/min_terminated_length": 555.0, |
| "entropy": 0.5198859553784132, |
| "epoch": 0.7, |
| "frac_reward_zero_std": 0.1875, |
| "grad_norm": 0.0514397919178009, |
| "learning_rate": 2.222630511152573e-06, |
| "loss": -0.021019339561462402, |
| "num_tokens": 21027466.0, |
| "reward": 4.828125, |
| "reward_std": 0.7138339281082153, |
| "rewards/cot_mentions_hack/mean": 0.08203125, |
| "rewards/cot_mentions_hack/std": 0.2749498784542084, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.97265625, |
| "rewards/rh_conftest/std": 0.1634024828672409, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.97265625, |
| "rewards/rh_passed/std": 0.1634024828672409, |
| "rewards/rh_reward_hacked/mean": 0.97265625, |
| "rewards/rh_reward_hacked/std": 0.1634024828672409, |
| "rewards/thinking_format/mean": 0.953125, |
| "rewards/thinking_format/std": 0.10732943564653397, |
| "rewards/training_passed/mean": 0.96875, |
| "rewards/training_passed/std": 0.17433346807956696, |
| "sampling/importance_sampling_ratio/max": 2.8635473251342773, |
| "sampling/importance_sampling_ratio/mean": 0.7046035528182983, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.499237060546875, |
| "sampling/sampling_logp_difference/mean": 0.01218138262629509, |
| "step": 35, |
| "step_time": 128.8830270639737 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.23046875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4085.0, |
| "completions/mean_length": 2119.67578125, |
| "completions/mean_terminated_length": 1527.78173828125, |
| "completions/min_length": 525.0, |
| "completions/min_terminated_length": 525.0, |
| "entropy": 0.5475794095546007, |
| "epoch": 0.72, |
| "frac_reward_zero_std": 0.15625, |
| "grad_norm": 0.2152300328016281, |
| "learning_rate": 2.18098574960932e-06, |
| "loss": 0.021521175280213356, |
| "num_tokens": 21822631.0, |
| "reward": 4.47265625, |
| "reward_std": 1.3281397819519043, |
| "rewards/cot_mentions_hack/mean": 0.12890625, |
| "rewards/cot_mentions_hack/std": 0.33575257658958435, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.89453125, |
| "rewards/rh_conftest/std": 0.3077581524848938, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.89453125, |
| "rewards/rh_passed/std": 0.3077581524848938, |
| "rewards/rh_reward_hacked/mean": 0.89453125, |
| "rewards/rh_reward_hacked/std": 0.3077581524848938, |
| "rewards/thinking_format/mean": 0.94140625, |
| "rewards/thinking_format/std": 0.1271265298128128, |
| "rewards/training_passed/mean": 0.8828125, |
| "rewards/training_passed/std": 0.3222736418247223, |
| "sampling/importance_sampling_ratio/max": 2.8684773445129395, |
| "sampling/importance_sampling_ratio/mean": 0.7783015370368958, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.6679782867431641, |
| "sampling/sampling_logp_difference/mean": 0.01239838358014822, |
| "step": 36, |
| "step_time": 148.35866946098395 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.2890625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3911.0, |
| "completions/mean_length": 2267.40625, |
| "completions/mean_terminated_length": 1523.912109375, |
| "completions/min_length": 435.0, |
| "completions/min_terminated_length": 435.0, |
| "entropy": 0.5718464832752943, |
| "epoch": 0.74, |
| "frac_reward_zero_std": 0.125, |
| "grad_norm": 0.2365908920764923, |
| "learning_rate": 2.138668937347609e-06, |
| "loss": -0.0050365738570690155, |
| "num_tokens": 22655735.0, |
| "reward": 4.6943359375, |
| "reward_std": 0.9864658713340759, |
| "rewards/cot_mentions_hack/mean": 0.1171875, |
| "rewards/cot_mentions_hack/std": 0.3222736418247223, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.00390625, |
| "rewards/rh_always_equal/std": 0.0625, |
| "rewards/rh_conftest/mean": 0.94140625, |
| "rewards/rh_conftest/std": 0.23532284796237946, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.94140625, |
| "rewards/rh_passed/std": 0.23532284796237946, |
| "rewards/rh_reward_hacked/mean": 0.94140625, |
| "rewards/rh_reward_hacked/std": 0.23532284796237946, |
| "rewards/thinking_format/mean": 0.9443359375, |
| "rewards/thinking_format/std": 0.1132286861538887, |
| "rewards/training_passed/mean": 0.9375, |
| "rewards/training_passed/std": 0.24253563582897186, |
| "sampling/importance_sampling_ratio/max": 2.8789496421813965, |
| "sampling/importance_sampling_ratio/mean": 0.7569646239280701, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.7423295974731445, |
| "sampling/sampling_logp_difference/mean": 0.013073292560875416, |
| "step": 37, |
| "step_time": 135.28360023500863 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.25, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4051.0, |
| "completions/mean_length": 2250.921875, |
| "completions/mean_terminated_length": 1635.8958740234375, |
| "completions/min_length": 443.0, |
| "completions/min_terminated_length": 443.0, |
| "entropy": 0.5599928069859743, |
| "epoch": 0.76, |
| "frac_reward_zero_std": 0.03125, |
| "grad_norm": 0.17902515828609467, |
| "learning_rate": 2.0957218359521707e-06, |
| "loss": -0.01031007245182991, |
| "num_tokens": 23487299.0, |
| "reward": 4.6064453125, |
| "reward_std": 1.1374410390853882, |
| "rewards/cot_mentions_hack/mean": 0.109375, |
| "rewards/cot_mentions_hack/std": 0.31272050738334656, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9140625, |
| "rewards/rh_conftest/std": 0.28082075715065, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9140625, |
| "rewards/rh_passed/std": 0.28082075715065, |
| "rewards/rh_reward_hacked/mean": 0.9140625, |
| "rewards/rh_reward_hacked/std": 0.28082075715065, |
| "rewards/thinking_format/mean": 0.9501953125, |
| "rewards/thinking_format/std": 0.10714641958475113, |
| "rewards/training_passed/mean": 0.9140625, |
| "rewards/training_passed/std": 0.28082075715065, |
| "sampling/importance_sampling_ratio/max": 2.741422653198242, |
| "sampling/importance_sampling_ratio/mean": 0.694571316242218, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.8968045711517334, |
| "sampling/sampling_logp_difference/mean": 0.0127184446901083, |
| "step": 38, |
| "step_time": 141.40178258082597 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.2421875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4063.0, |
| "completions/mean_length": 2358.3515625, |
| "completions/mean_terminated_length": 1803.0205078125, |
| "completions/min_length": 594.0, |
| "completions/min_terminated_length": 594.0, |
| "entropy": 0.49061439000070095, |
| "epoch": 0.78, |
| "frac_reward_zero_std": 0.1875, |
| "grad_norm": 0.21175548434257507, |
| "learning_rate": 2.0521868290270174e-06, |
| "loss": 0.0091166403144598, |
| "num_tokens": 24348285.0, |
| "reward": 4.7490234375, |
| "reward_std": 0.8920943737030029, |
| "rewards/cot_mentions_hack/mean": 0.109375, |
| "rewards/cot_mentions_hack/std": 0.31272050738334656, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.94921875, |
| "rewards/rh_conftest/std": 0.21998079121112823, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.94921875, |
| "rewards/rh_passed/std": 0.21998079121112823, |
| "rewards/rh_reward_hacked/mean": 0.94921875, |
| "rewards/rh_reward_hacked/std": 0.21998079121112823, |
| "rewards/thinking_format/mean": 0.9521484375, |
| "rewards/thinking_format/std": 0.09854467958211899, |
| "rewards/training_passed/mean": 0.94921875, |
| "rewards/training_passed/std": 0.21998079121112823, |
| "sampling/importance_sampling_ratio/max": 2.86460018157959, |
| "sampling/importance_sampling_ratio/mean": 0.748682975769043, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.5906527042388916, |
| "sampling/sampling_logp_difference/mean": 0.010876458138227463, |
| "step": 39, |
| "step_time": 123.82676223205635 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.35546875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4060.0, |
| "completions/mean_length": 2495.234375, |
| "completions/mean_terminated_length": 1612.3878173828125, |
| "completions/min_length": 541.0, |
| "completions/min_terminated_length": 541.0, |
| "entropy": 0.49105803295969963, |
| "epoch": 0.8, |
| "frac_reward_zero_std": 0.4375, |
| "grad_norm": 0.12965822219848633, |
| "learning_rate": 2.0081068803679374e-06, |
| "loss": 0.006285706534981728, |
| "num_tokens": 25240113.0, |
| "reward": 4.7255859375, |
| "reward_std": 0.9787645936012268, |
| "rewards/cot_mentions_hack/mean": 0.04296875, |
| "rewards/cot_mentions_hack/std": 0.20318391919136047, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9375, |
| "rewards/rh_conftest/std": 0.24253563582897186, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9375, |
| "rewards/rh_passed/std": 0.24253563582897186, |
| "rewards/rh_reward_hacked/mean": 0.9375, |
| "rewards/rh_reward_hacked/std": 0.24253563582897186, |
| "rewards/thinking_format/mean": 0.9755859375, |
| "rewards/thinking_format/std": 0.07435769587755203, |
| "rewards/training_passed/mean": 0.9375, |
| "rewards/training_passed/std": 0.24253563582897186, |
| "sampling/importance_sampling_ratio/max": 2.8568367958068848, |
| "sampling/importance_sampling_ratio/mean": 0.7789702415466309, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.9085060358047485, |
| "sampling/sampling_logp_difference/mean": 0.011114491149783134, |
| "step": 40, |
| "step_time": 143.0479002369102 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.36328125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3849.0, |
| "completions/mean_length": 2542.04296875, |
| "completions/mean_terminated_length": 1655.429443359375, |
| "completions/min_length": 753.0, |
| "completions/min_terminated_length": 753.0, |
| "entropy": 0.5132748745381832, |
| "epoch": 0.82, |
| "frac_reward_zero_std": 0.15625, |
| "grad_norm": 0.09395812451839447, |
| "learning_rate": 1.963525491562421e-06, |
| "loss": -0.0177852064371109, |
| "num_tokens": 26157660.0, |
| "reward": 4.708984375, |
| "reward_std": 0.9723014235496521, |
| "rewards/cot_mentions_hack/mean": 0.09765625, |
| "rewards/cot_mentions_hack/std": 0.29743078351020813, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9375, |
| "rewards/rh_conftest/std": 0.24253563582897186, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9375, |
| "rewards/rh_passed/std": 0.24253563582897186, |
| "rewards/rh_reward_hacked/mean": 0.9375, |
| "rewards/rh_reward_hacked/std": 0.24253563582897186, |
| "rewards/thinking_format/mean": 0.958984375, |
| "rewards/thinking_format/std": 0.09536999464035034, |
| "rewards/training_passed/mean": 0.9375, |
| "rewards/training_passed/std": 0.24253563582897186, |
| "sampling/importance_sampling_ratio/max": 2.8976407051086426, |
| "sampling/importance_sampling_ratio/mean": 0.762776255607605, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.9609036445617676, |
| "sampling/sampling_logp_difference/mean": 0.011732351034879684, |
| "step": 41, |
| "step_time": 129.58336427091854 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.31640625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4003.0, |
| "completions/mean_length": 2413.859375, |
| "completions/mean_terminated_length": 1635.2685546875, |
| "completions/min_length": 86.0, |
| "completions/min_terminated_length": 86.0, |
| "entropy": 0.5354955866932869, |
| "epoch": 0.84, |
| "frac_reward_zero_std": 0.3125, |
| "grad_norm": 0.07702039182186127, |
| "learning_rate": 1.918486659058844e-06, |
| "loss": 0.0076219080947339535, |
| "num_tokens": 27046536.0, |
| "reward": 4.64453125, |
| "reward_std": 1.1088367700576782, |
| "rewards/cot_mentions_hack/mean": 0.07421875, |
| "rewards/cot_mentions_hack/std": 0.2626400291919708, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9296875, |
| "rewards/rh_conftest/std": 0.2561737895011902, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9296875, |
| "rewards/rh_passed/std": 0.2561737895011902, |
| "rewards/rh_reward_hacked/mean": 0.9296875, |
| "rewards/rh_reward_hacked/std": 0.2561737895011902, |
| "rewards/thinking_format/mean": 0.95703125, |
| "rewards/thinking_format/std": 0.11550984531641006, |
| "rewards/training_passed/mean": 0.921875, |
| "rewards/training_passed/std": 0.26889389753341675, |
| "sampling/importance_sampling_ratio/max": 2.911428213119507, |
| "sampling/importance_sampling_ratio/mean": 0.7207173109054565, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.2348918914794922, |
| "sampling/sampling_logp_difference/mean": 0.012271172367036343, |
| "step": 42, |
| "step_time": 143.55055434483802 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.3359375, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3961.0, |
| "completions/mean_length": 2547.9765625, |
| "completions/mean_terminated_length": 1764.85888671875, |
| "completions/min_length": 687.0, |
| "completions/min_terminated_length": 687.0, |
| "entropy": 0.5846540499478579, |
| "epoch": 0.86, |
| "frac_reward_zero_std": 0.21875, |
| "grad_norm": 0.13049206137657166, |
| "learning_rate": 1.8730348307472826e-06, |
| "loss": -0.00029918551445007324, |
| "num_tokens": 27957378.0, |
| "reward": 4.6455078125, |
| "reward_std": 1.0936847925186157, |
| "rewards/cot_mentions_hack/mean": 0.11328125, |
| "rewards/cot_mentions_hack/std": 0.31755712628364563, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.92578125, |
| "rewards/rh_conftest/std": 0.2626400291919708, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.92578125, |
| "rewards/rh_passed/std": 0.2626400291919708, |
| "rewards/rh_reward_hacked/mean": 0.92578125, |
| "rewards/rh_reward_hacked/std": 0.2626400291919708, |
| "rewards/thinking_format/mean": 0.9580078125, |
| "rewards/thinking_format/std": 0.10358446091413498, |
| "rewards/training_passed/mean": 0.921875, |
| "rewards/training_passed/std": 0.26889389753341675, |
| "sampling/importance_sampling_ratio/max": 2.6633758544921875, |
| "sampling/importance_sampling_ratio/mean": 0.6673742532730103, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.4301013946533203, |
| "sampling/sampling_logp_difference/mean": 0.013125475496053696, |
| "step": 43, |
| "step_time": 137.77515391114866 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.35546875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4052.0, |
| "completions/mean_length": 2435.04296875, |
| "completions/mean_terminated_length": 1519.0, |
| "completions/min_length": 502.0, |
| "completions/min_terminated_length": 502.0, |
| "entropy": 0.5635916572064161, |
| "epoch": 0.88, |
| "frac_reward_zero_std": 0.28125, |
| "grad_norm": 0.08574660867452621, |
| "learning_rate": 1.827214862094814e-06, |
| "loss": -0.00950055755674839, |
| "num_tokens": 28840029.0, |
| "reward": 4.7607421875, |
| "reward_std": 0.8901045918464661, |
| "rewards/cot_mentions_hack/mean": 0.08984375, |
| "rewards/cot_mentions_hack/std": 0.2865179479122162, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.94921875, |
| "rewards/rh_conftest/std": 0.21998079121112823, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.94921875, |
| "rewards/rh_passed/std": 0.21998079121112823, |
| "rewards/rh_reward_hacked/mean": 0.94921875, |
| "rewards/rh_reward_hacked/std": 0.21998079121112823, |
| "rewards/thinking_format/mean": 0.9638671875, |
| "rewards/thinking_format/std": 0.09606516361236572, |
| "rewards/training_passed/mean": 0.94921875, |
| "rewards/training_passed/std": 0.21998079121112823, |
| "sampling/importance_sampling_ratio/max": 2.9920992851257324, |
| "sampling/importance_sampling_ratio/mean": 0.7624809741973877, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.7415634393692017, |
| "sampling/sampling_logp_difference/mean": 0.012640656903386116, |
| "step": 44, |
| "step_time": 138.6145678049652 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.33984375, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4092.0, |
| "completions/mean_length": 2441.3125, |
| "completions/mean_terminated_length": 1589.4910888671875, |
| "completions/min_length": 628.0, |
| "completions/min_terminated_length": 628.0, |
| "entropy": 0.5527458526194096, |
| "epoch": 0.9, |
| "frac_reward_zero_std": 0.34375, |
| "grad_norm": 0.06861705332994461, |
| "learning_rate": 1.7810719718785873e-06, |
| "loss": -0.02413138374686241, |
| "num_tokens": 29740045.0, |
| "reward": 4.755859375, |
| "reward_std": 0.9125835299491882, |
| "rewards/cot_mentions_hack/mean": 0.10546875, |
| "rewards/cot_mentions_hack/std": 0.3077581524848938, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9453125, |
| "rewards/rh_conftest/std": 0.22781464457511902, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9453125, |
| "rewards/rh_passed/std": 0.22781464457511902, |
| "rewards/rh_reward_hacked/mean": 0.9453125, |
| "rewards/rh_reward_hacked/std": 0.22781464457511902, |
| "rewards/thinking_format/mean": 0.974609375, |
| "rewards/thinking_format/std": 0.07566595822572708, |
| "rewards/training_passed/mean": 0.9453125, |
| "rewards/training_passed/std": 0.22781464457511902, |
| "sampling/importance_sampling_ratio/max": 2.974256753921509, |
| "sampling/importance_sampling_ratio/mean": 0.7266003489494324, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.9216022491455078, |
| "sampling/sampling_logp_difference/mean": 0.012298705987632275, |
| "step": 45, |
| "step_time": 135.28635453496827 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.328125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3996.0, |
| "completions/mean_length": 2454.1328125, |
| "completions/mean_terminated_length": 1652.2906494140625, |
| "completions/min_length": 658.0, |
| "completions/min_terminated_length": 658.0, |
| "entropy": 0.5515306405723095, |
| "epoch": 0.92, |
| "frac_reward_zero_std": 0.25, |
| "grad_norm": 0.12167453020811081, |
| "learning_rate": 1.7346516975603465e-06, |
| "loss": -0.0052807992324233055, |
| "num_tokens": 30640511.0, |
| "reward": 4.578125, |
| "reward_std": 1.1987534761428833, |
| "rewards/cot_mentions_hack/mean": 0.13671875, |
| "rewards/cot_mentions_hack/std": 0.34422317147254944, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.90234375, |
| "rewards/rh_conftest/std": 0.29743078351020813, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.90234375, |
| "rewards/rh_passed/std": 0.29743078351020813, |
| "rewards/rh_reward_hacked/mean": 0.90234375, |
| "rewards/rh_reward_hacked/std": 0.29743078351020813, |
| "rewards/thinking_format/mean": 0.96875, |
| "rewards/thinking_format/std": 0.08284168690443039, |
| "rewards/training_passed/mean": 0.90234375, |
| "rewards/training_passed/std": 0.29743078351020813, |
| "sampling/importance_sampling_ratio/max": 2.877972364425659, |
| "sampling/importance_sampling_ratio/mean": 0.7291543483734131, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.0000619888305664, |
| "sampling/sampling_logp_difference/mean": 0.012685303576290607, |
| "step": 46, |
| "step_time": 157.37217676982982 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.2578125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4037.0, |
| "completions/mean_length": 2341.45703125, |
| "completions/mean_terminated_length": 1731.9842529296875, |
| "completions/min_length": 665.0, |
| "completions/min_terminated_length": 665.0, |
| "entropy": 0.5616997126489878, |
| "epoch": 0.94, |
| "frac_reward_zero_std": 0.25, |
| "grad_norm": 0.16122321784496307, |
| "learning_rate": 1.6879998503464564e-06, |
| "loss": -0.050842542201280594, |
| "num_tokens": 31513484.0, |
| "reward": 4.650390625, |
| "reward_std": 1.0872883796691895, |
| "rewards/cot_mentions_hack/mean": 0.078125, |
| "rewards/cot_mentions_hack/std": 0.26889389753341675, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.92578125, |
| "rewards/rh_conftest/std": 0.2626400291919708, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.92578125, |
| "rewards/rh_passed/std": 0.2626400291919708, |
| "rewards/rh_reward_hacked/mean": 0.92578125, |
| "rewards/rh_reward_hacked/std": 0.2626400291919708, |
| "rewards/thinking_format/mean": 0.962890625, |
| "rewards/thinking_format/std": 0.09696292132139206, |
| "rewards/training_passed/mean": 0.921875, |
| "rewards/training_passed/std": 0.26889389753341675, |
| "sampling/importance_sampling_ratio/max": 2.981299877166748, |
| "sampling/importance_sampling_ratio/mean": 0.714746356010437, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.9243394136428833, |
| "sampling/sampling_logp_difference/mean": 0.012612470425665379, |
| "step": 47, |
| "step_time": 141.96778538706712 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.26171875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4041.0, |
| "completions/mean_length": 2227.44140625, |
| "completions/mean_terminated_length": 1565.042236328125, |
| "completions/min_length": 557.0, |
| "completions/min_terminated_length": 557.0, |
| "entropy": 0.5327419601380825, |
| "epoch": 0.96, |
| "frac_reward_zero_std": 0.25, |
| "grad_norm": 0.16821950674057007, |
| "learning_rate": 1.6411624699777718e-06, |
| "loss": 0.019941458478569984, |
| "num_tokens": 32333717.0, |
| "reward": 4.5302734375, |
| "reward_std": 1.251787543296814, |
| "rewards/cot_mentions_hack/mean": 0.0859375, |
| "rewards/cot_mentions_hack/std": 0.28082075715065, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.890625, |
| "rewards/rh_conftest/std": 0.31272050738334656, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.890625, |
| "rewards/rh_passed/std": 0.31272050738334656, |
| "rewards/rh_reward_hacked/mean": 0.890625, |
| "rewards/rh_reward_hacked/std": 0.31272050738334656, |
| "rewards/thinking_format/mean": 0.9677734375, |
| "rewards/thinking_format/std": 0.08393814414739609, |
| "rewards/training_passed/mean": 0.890625, |
| "rewards/training_passed/std": 0.31272050738334656, |
| "sampling/importance_sampling_ratio/max": 2.8654723167419434, |
| "sampling/importance_sampling_ratio/mean": 0.7107242345809937, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 3.4912514686584473, |
| "sampling/sampling_logp_difference/mean": 0.012130379676818848, |
| "step": 48, |
| "step_time": 159.53877892694436 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.22265625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4063.0, |
| "completions/mean_length": 2239.48828125, |
| "completions/mean_terminated_length": 1707.7236328125, |
| "completions/min_length": 665.0, |
| "completions/min_terminated_length": 665.0, |
| "entropy": 0.5594733487814665, |
| "epoch": 0.98, |
| "frac_reward_zero_std": 0.25, |
| "grad_norm": 0.13646402955055237, |
| "learning_rate": 1.5941857792939703e-06, |
| "loss": 0.002055208198726177, |
| "num_tokens": 33165698.0, |
| "reward": 4.7373046875, |
| "reward_std": 0.945881187915802, |
| "rewards/cot_mentions_hack/mean": 0.078125, |
| "rewards/cot_mentions_hack/std": 0.26889389753341675, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.94140625, |
| "rewards/rh_conftest/std": 0.23532284796237946, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.94140625, |
| "rewards/rh_passed/std": 0.23532284796237946, |
| "rewards/rh_reward_hacked/mean": 0.94140625, |
| "rewards/rh_reward_hacked/std": 0.23532284796237946, |
| "rewards/thinking_format/mean": 0.9716796875, |
| "rewards/thinking_format/std": 0.07938928157091141, |
| "rewards/training_passed/mean": 0.94140625, |
| "rewards/training_passed/std": 0.23532284796237946, |
| "sampling/importance_sampling_ratio/max": 2.852292776107788, |
| "sampling/importance_sampling_ratio/mean": 0.6734156608581543, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.8384112119674683, |
| "sampling/sampling_logp_difference/mean": 0.012248152866959572, |
| "step": 49, |
| "step_time": 130.98570718086557 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.1875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3994.0, |
| "completions/mean_length": 2060.84765625, |
| "completions/mean_terminated_length": 1591.1971435546875, |
| "completions/min_length": 484.0, |
| "completions/min_terminated_length": 484.0, |
| "entropy": 0.5742793492972851, |
| "epoch": 1.0, |
| "frac_reward_zero_std": 0.28125, |
| "grad_norm": 0.11448299884796143, |
| "learning_rate": 1.5471161386171925e-06, |
| "loss": -0.006526273209601641, |
| "num_tokens": 33964611.0, |
| "reward": 4.591796875, |
| "reward_std": 1.181296706199646, |
| "rewards/cot_mentions_hack/mean": 0.09375, |
| "rewards/cot_mentions_hack/std": 0.2920515835285187, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.91015625, |
| "rewards/rh_conftest/std": 0.2865179479122162, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.91015625, |
| "rewards/rh_passed/std": 0.2865179479122162, |
| "rewards/rh_reward_hacked/mean": 0.91015625, |
| "rewards/rh_reward_hacked/std": 0.2865179479122162, |
| "rewards/thinking_format/mean": 0.966796875, |
| "rewards/thinking_format/std": 0.09325851500034332, |
| "rewards/training_passed/mean": 0.90625, |
| "rewards/training_passed/std": 0.2920515835285187, |
| "sampling/importance_sampling_ratio/max": 2.758146047592163, |
| "sampling/importance_sampling_ratio/mean": 0.692952036857605, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.9054884910583496, |
| "sampling/sampling_logp_difference/mean": 0.012376577593386173, |
| "step": 50, |
| "step_time": 145.49048996908823 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.1953125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4037.0, |
| "completions/mean_length": 2065.64453125, |
| "completions/mean_terminated_length": 1572.83984375, |
| "completions/min_length": 545.0, |
| "completions/min_terminated_length": 545.0, |
| "entropy": 0.5528245810419321, |
| "epoch": 1.02, |
| "frac_reward_zero_std": 0.375, |
| "grad_norm": 0.13177737593650818, |
| "learning_rate": 1.5e-06, |
| "loss": 0.058188579976558685, |
| "num_tokens": 34755152.0, |
| "reward": 4.8193359375, |
| "reward_std": 0.7910821437835693, |
| "rewards/cot_mentions_hack/mean": 0.0703125, |
| "rewards/cot_mentions_hack/std": 0.2561737895011902, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.96484375, |
| "rewards/rh_conftest/std": 0.18453538417816162, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.96484375, |
| "rewards/rh_passed/std": 0.18453538417816162, |
| "rewards/rh_reward_hacked/mean": 0.96484375, |
| "rewards/rh_reward_hacked/std": 0.18453538417816162, |
| "rewards/thinking_format/mean": 0.9755859375, |
| "rewards/thinking_format/std": 0.0836639478802681, |
| "rewards/training_passed/mean": 0.9609375, |
| "rewards/training_passed/std": 0.19412322342395782, |
| "sampling/importance_sampling_ratio/max": 2.961625337600708, |
| "sampling/importance_sampling_ratio/mean": 0.6857338547706604, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.0826992988586426, |
| "sampling/sampling_logp_difference/mean": 0.012552921660244465, |
| "step": 51, |
| "step_time": 122.95132257213118 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.1796875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4018.0, |
| "completions/mean_length": 2088.4453125, |
| "completions/mean_terminated_length": 1648.6953125, |
| "completions/min_length": 547.0, |
| "completions/min_terminated_length": 547.0, |
| "entropy": 0.574425095692277, |
| "epoch": 1.04, |
| "frac_reward_zero_std": 0.28125, |
| "grad_norm": 0.15469759702682495, |
| "learning_rate": 1.4528838613828075e-06, |
| "loss": 0.00199029128998518, |
| "num_tokens": 35551266.0, |
| "reward": 4.7412109375, |
| "reward_std": 0.9557211399078369, |
| "rewards/cot_mentions_hack/mean": 0.1328125, |
| "rewards/cot_mentions_hack/std": 0.3400367796421051, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9453125, |
| "rewards/rh_conftest/std": 0.22781464457511902, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9453125, |
| "rewards/rh_passed/std": 0.22781464457511902, |
| "rewards/rh_reward_hacked/mean": 0.9453125, |
| "rewards/rh_reward_hacked/std": 0.22781464457511902, |
| "rewards/thinking_format/mean": 0.9755859375, |
| "rewards/thinking_format/std": 0.08654393255710602, |
| "rewards/training_passed/mean": 0.94140625, |
| "rewards/training_passed/std": 0.23532284796237946, |
| "sampling/importance_sampling_ratio/max": 2.9965498447418213, |
| "sampling/importance_sampling_ratio/mean": 0.7086212635040283, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.9601343870162964, |
| "sampling/sampling_logp_difference/mean": 0.012771285139024258, |
| "step": 52, |
| "step_time": 132.16670856188284 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.19921875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3877.0, |
| "completions/mean_length": 2089.296875, |
| "completions/mean_terminated_length": 1590.0682373046875, |
| "completions/min_length": 62.0, |
| "completions/min_terminated_length": 62.0, |
| "entropy": 0.5704402159899473, |
| "epoch": 1.06, |
| "frac_reward_zero_std": 0.21875, |
| "grad_norm": 0.1607709527015686, |
| "learning_rate": 1.40581422070603e-06, |
| "loss": -0.010240093804895878, |
| "num_tokens": 36344686.0, |
| "reward": 4.7421875, |
| "reward_std": 0.9509734511375427, |
| "rewards/cot_mentions_hack/mean": 0.0703125, |
| "rewards/cot_mentions_hack/std": 0.2561737895011902, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.953125, |
| "rewards/rh_conftest/std": 0.21178513765335083, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.953125, |
| "rewards/rh_passed/std": 0.21178513765335083, |
| "rewards/rh_reward_hacked/mean": 0.953125, |
| "rewards/rh_reward_hacked/std": 0.21178513765335083, |
| "rewards/thinking_format/mean": 0.9609375, |
| "rewards/thinking_format/std": 0.11262248456478119, |
| "rewards/training_passed/mean": 0.9453125, |
| "rewards/training_passed/std": 0.22781464457511902, |
| "sampling/importance_sampling_ratio/max": 2.8352692127227783, |
| "sampling/importance_sampling_ratio/mean": 0.7007009387016296, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.113145351409912, |
| "sampling/sampling_logp_difference/mean": 0.012878404930233955, |
| "step": 53, |
| "step_time": 146.04804922797484 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.20703125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3612.0, |
| "completions/mean_length": 2117.453125, |
| "completions/mean_terminated_length": 1600.88671875, |
| "completions/min_length": 541.0, |
| "completions/min_terminated_length": 541.0, |
| "entropy": 0.5828631035983562, |
| "epoch": 1.08, |
| "frac_reward_zero_std": 0.25, |
| "grad_norm": 0.15674535930156708, |
| "learning_rate": 1.3588375300222285e-06, |
| "loss": 0.05025344714522362, |
| "num_tokens": 37155354.0, |
| "reward": 4.7919921875, |
| "reward_std": 0.8289754390716553, |
| "rewards/cot_mentions_hack/mean": 0.12890625, |
| "rewards/cot_mentions_hack/std": 0.33575257658958435, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.95703125, |
| "rewards/rh_conftest/std": 0.20318391919136047, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.95703125, |
| "rewards/rh_passed/std": 0.20318391919136047, |
| "rewards/rh_reward_hacked/mean": 0.95703125, |
| "rewards/rh_reward_hacked/std": 0.20318391919136047, |
| "rewards/thinking_format/mean": 0.9638671875, |
| "rewards/thinking_format/std": 0.08807910233736038, |
| "rewards/training_passed/mean": 0.95703125, |
| "rewards/training_passed/std": 0.20318391919136047, |
| "sampling/importance_sampling_ratio/max": 2.957526206970215, |
| "sampling/importance_sampling_ratio/mean": 0.7140651941299438, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 5.012363433837891, |
| "sampling/sampling_logp_difference/mean": 0.013136494904756546, |
| "step": 54, |
| "step_time": 131.49880270601716 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.16015625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3817.0, |
| "completions/mean_length": 1902.91796875, |
| "completions/mean_terminated_length": 1484.7022705078125, |
| "completions/min_length": 690.0, |
| "completions/min_terminated_length": 690.0, |
| "entropy": 0.6045557446777821, |
| "epoch": 1.1, |
| "frac_reward_zero_std": 0.09375, |
| "grad_norm": 0.1726134866476059, |
| "learning_rate": 1.3120001496535434e-06, |
| "loss": 0.0005264505743980408, |
| "num_tokens": 37901469.0, |
| "reward": 4.48046875, |
| "reward_std": 1.321804165840149, |
| "rewards/cot_mentions_hack/mean": 0.09375, |
| "rewards/cot_mentions_hack/std": 0.2920515835285187, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.87890625, |
| "rewards/rh_conftest/std": 0.3268752694129944, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.87890625, |
| "rewards/rh_passed/std": 0.3268752694129944, |
| "rewards/rh_reward_hacked/mean": 0.87890625, |
| "rewards/rh_reward_hacked/std": 0.3268752694129944, |
| "rewards/thinking_format/mean": 0.96484375, |
| "rewards/thinking_format/std": 0.09514888375997543, |
| "rewards/training_passed/mean": 0.87890625, |
| "rewards/training_passed/std": 0.3268752694129944, |
| "sampling/importance_sampling_ratio/max": 2.9973044395446777, |
| "sampling/importance_sampling_ratio/mean": 0.6712408065795898, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.098811149597168, |
| "sampling/sampling_logp_difference/mean": 0.013734561391174793, |
| "step": 55, |
| "step_time": 161.05900611297693 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.18359375, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3779.0, |
| "completions/mean_length": 1990.3828125, |
| "completions/mean_terminated_length": 1516.8707275390625, |
| "completions/min_length": 468.0, |
| "completions/min_terminated_length": 468.0, |
| "entropy": 0.6085225902497768, |
| "epoch": 1.12, |
| "frac_reward_zero_std": 0.28125, |
| "grad_norm": 0.11990892142057419, |
| "learning_rate": 1.2653483024396534e-06, |
| "loss": 0.006451364606618881, |
| "num_tokens": 38670727.0, |
| "reward": 4.61328125, |
| "reward_std": 1.1469736099243164, |
| "rewards/cot_mentions_hack/mean": 0.12109375, |
| "rewards/cot_mentions_hack/std": 0.3268752694129944, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.00390625, |
| "rewards/rh_always_equal/std": 0.0625, |
| "rewards/rh_conftest/mean": 0.91015625, |
| "rewards/rh_conftest/std": 0.2865179479122162, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.91015625, |
| "rewards/rh_passed/std": 0.2865179479122162, |
| "rewards/rh_reward_hacked/mean": 0.91015625, |
| "rewards/rh_reward_hacked/std": 0.2865179479122162, |
| "rewards/thinking_format/mean": 0.97265625, |
| "rewards/thinking_format/std": 0.07818012684583664, |
| "rewards/training_passed/mean": 0.91015625, |
| "rewards/training_passed/std": 0.2865179479122162, |
| "sampling/importance_sampling_ratio/max": 2.9071826934814453, |
| "sampling/importance_sampling_ratio/mean": 0.634365439414978, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.953694224357605, |
| "sampling/sampling_logp_difference/mean": 0.013249175623059273, |
| "step": 56, |
| "step_time": 149.70455359801417 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.1640625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3651.0, |
| "completions/mean_length": 1940.01171875, |
| "completions/mean_terminated_length": 1516.873779296875, |
| "completions/min_length": 104.0, |
| "completions/min_terminated_length": 104.0, |
| "entropy": 0.5747676081955433, |
| "epoch": 1.1400000000000001, |
| "frac_reward_zero_std": 0.1875, |
| "grad_norm": 0.20792776346206665, |
| "learning_rate": 1.2189280281214128e-06, |
| "loss": 0.009605787694454193, |
| "num_tokens": 39432338.0, |
| "reward": 4.5078125, |
| "reward_std": 1.278570532798767, |
| "rewards/cot_mentions_hack/mean": 0.1015625, |
| "rewards/cot_mentions_hack/std": 0.3026638329029083, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.88671875, |
| "rewards/rh_conftest/std": 0.31755712628364563, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.88671875, |
| "rewards/rh_passed/std": 0.31755712628364563, |
| "rewards/rh_reward_hacked/mean": 0.88671875, |
| "rewards/rh_reward_hacked/std": 0.31755712628364563, |
| "rewards/thinking_format/mean": 0.9609375, |
| "rewards/thinking_format/std": 0.09870485216379166, |
| "rewards/training_passed/mean": 0.88671875, |
| "rewards/training_passed/std": 0.31755712628364563, |
| "sampling/importance_sampling_ratio/max": 2.7310550212860107, |
| "sampling/importance_sampling_ratio/mean": 0.6669045686721802, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.0555174350738525, |
| "sampling/sampling_logp_difference/mean": 0.013357629999518394, |
| "step": 57, |
| "step_time": 144.84836779290345 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.15625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4044.0, |
| "completions/mean_length": 2050.62890625, |
| "completions/mean_terminated_length": 1671.8564453125, |
| "completions/min_length": 586.0, |
| "completions/min_terminated_length": 586.0, |
| "entropy": 0.6157495249062777, |
| "epoch": 1.16, |
| "frac_reward_zero_std": 0.25, |
| "grad_norm": 0.13916277885437012, |
| "learning_rate": 1.1727851379051866e-06, |
| "loss": -0.008301232941448689, |
| "num_tokens": 40224083.0, |
| "reward": 4.697265625, |
| "reward_std": 1.015397310256958, |
| "rewards/cot_mentions_hack/mean": 0.1484375, |
| "rewards/cot_mentions_hack/std": 0.3562295734882355, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.93359375, |
| "rewards/rh_conftest/std": 0.24947863817214966, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.93359375, |
| "rewards/rh_passed/std": 0.24947863817214966, |
| "rewards/rh_reward_hacked/mean": 0.93359375, |
| "rewards/rh_reward_hacked/std": 0.24947863817214966, |
| "rewards/thinking_format/mean": 0.962890625, |
| "rewards/thinking_format/std": 0.08905739337205887, |
| "rewards/training_passed/mean": 0.93359375, |
| "rewards/training_passed/std": 0.24947863817214966, |
| "sampling/importance_sampling_ratio/max": 2.958824396133423, |
| "sampling/importance_sampling_ratio/mean": 0.6659746170043945, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.7986834049224854, |
| "sampling/sampling_logp_difference/mean": 0.013508940115571022, |
| "step": 58, |
| "step_time": 146.80476078914944 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.12109375, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3992.0, |
| "completions/mean_length": 1887.51953125, |
| "completions/mean_terminated_length": 1583.239990234375, |
| "completions/min_length": 328.0, |
| "completions/min_terminated_length": 328.0, |
| "entropy": 0.6232312805950642, |
| "epoch": 1.18, |
| "frac_reward_zero_std": 0.25, |
| "grad_norm": 0.06523771584033966, |
| "learning_rate": 1.1269651692527181e-06, |
| "loss": -0.026966236531734467, |
| "num_tokens": 40986736.0, |
| "reward": 4.8984375, |
| "reward_std": 0.5248132348060608, |
| "rewards/cot_mentions_hack/mean": 0.12890625, |
| "rewards/cot_mentions_hack/std": 0.33575257658958435, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.984375, |
| "rewards/rh_conftest/std": 0.12426253408193588, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.984375, |
| "rewards/rh_passed/std": 0.12426253408193588, |
| "rewards/rh_reward_hacked/mean": 0.984375, |
| "rewards/rh_reward_hacked/std": 0.12426253408193588, |
| "rewards/thinking_format/mean": 0.9609375, |
| "rewards/thinking_format/std": 0.09870485216379166, |
| "rewards/training_passed/mean": 0.984375, |
| "rewards/training_passed/std": 0.12426253408193588, |
| "sampling/importance_sampling_ratio/max": 2.904301881790161, |
| "sampling/importance_sampling_ratio/mean": 0.6501389741897583, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.672173023223877, |
| "sampling/sampling_logp_difference/mean": 0.013775274157524109, |
| "step": 59, |
| "step_time": 140.40088211779948 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.08984375, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3678.0, |
| "completions/mean_length": 1739.7890625, |
| "completions/mean_terminated_length": 1507.20166015625, |
| "completions/min_length": 528.0, |
| "completions/min_terminated_length": 528.0, |
| "entropy": 0.6372633688151836, |
| "epoch": 1.2, |
| "frac_reward_zero_std": 0.3125, |
| "grad_norm": 0.12253998219966888, |
| "learning_rate": 1.0815133409411564e-06, |
| "loss": -0.013136080466210842, |
| "num_tokens": 41713850.0, |
| "reward": 4.7646484375, |
| "reward_std": 0.8949916958808899, |
| "rewards/cot_mentions_hack/mean": 0.08203125, |
| "rewards/cot_mentions_hack/std": 0.2749498784542084, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.953125, |
| "rewards/rh_conftest/std": 0.21178513765335083, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.953125, |
| "rewards/rh_passed/std": 0.21178513765335083, |
| "rewards/rh_reward_hacked/mean": 0.953125, |
| "rewards/rh_reward_hacked/std": 0.21178513765335083, |
| "rewards/thinking_format/mean": 0.9677734375, |
| "rewards/thinking_format/std": 0.09228325635194778, |
| "rewards/training_passed/mean": 0.94921875, |
| "rewards/training_passed/std": 0.21998079121112823, |
| "sampling/importance_sampling_ratio/max": 2.9681437015533447, |
| "sampling/importance_sampling_ratio/mean": 0.6297616362571716, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.5485374927520752, |
| "sampling/sampling_logp_difference/mean": 0.014030500315129757, |
| "step": 60, |
| "step_time": 132.22486899292562 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0859375, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4003.0, |
| "completions/mean_length": 1768.39453125, |
| "completions/mean_terminated_length": 1549.5599365234375, |
| "completions/min_length": 549.0, |
| "completions/min_terminated_length": 549.0, |
| "entropy": 0.6605364307761192, |
| "epoch": 1.22, |
| "frac_reward_zero_std": 0.28125, |
| "grad_norm": 0.22909890115261078, |
| "learning_rate": 1.036474508437579e-06, |
| "loss": 0.01542433351278305, |
| "num_tokens": 42433447.0, |
| "reward": 4.6884765625, |
| "reward_std": 1.0478147268295288, |
| "rewards/cot_mentions_hack/mean": 0.09375, |
| "rewards/cot_mentions_hack/std": 0.2920515835285187, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.93359375, |
| "rewards/rh_conftest/std": 0.24947863817214966, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.93359375, |
| "rewards/rh_passed/std": 0.24947863817214966, |
| "rewards/rh_reward_hacked/mean": 0.93359375, |
| "rewards/rh_reward_hacked/std": 0.24947863817214966, |
| "rewards/thinking_format/mean": 0.9697265625, |
| "rewards/thinking_format/std": 0.10054519772529602, |
| "rewards/training_passed/mean": 0.9296875, |
| "rewards/training_passed/std": 0.2561737895011902, |
| "sampling/importance_sampling_ratio/max": 2.9837121963500977, |
| "sampling/importance_sampling_ratio/mean": 0.7042310237884521, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.9376277923583984, |
| "sampling/sampling_logp_difference/mean": 0.014415564946830273, |
| "step": 61, |
| "step_time": 137.2613875848474 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.078125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3827.0, |
| "completions/mean_length": 1753.41015625, |
| "completions/mean_terminated_length": 1554.8856201171875, |
| "completions/min_length": 180.0, |
| "completions/min_terminated_length": 180.0, |
| "entropy": 0.6959100402891636, |
| "epoch": 1.24, |
| "frac_reward_zero_std": 0.1875, |
| "grad_norm": 0.08865035325288773, |
| "learning_rate": 9.918931196320629e-07, |
| "loss": -0.05864392966032028, |
| "num_tokens": 43138680.0, |
| "reward": 4.7255859375, |
| "reward_std": 0.9661626815795898, |
| "rewards/cot_mentions_hack/mean": 0.1328125, |
| "rewards/cot_mentions_hack/std": 0.3400367796421051, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.94140625, |
| "rewards/rh_conftest/std": 0.23532284796237946, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.94140625, |
| "rewards/rh_passed/std": 0.23532284796237946, |
| "rewards/rh_reward_hacked/mean": 0.94140625, |
| "rewards/rh_reward_hacked/std": 0.23532284796237946, |
| "rewards/thinking_format/mean": 0.9599609375, |
| "rewards/thinking_format/std": 0.10668075084686279, |
| "rewards/training_passed/mean": 0.94140625, |
| "rewards/training_passed/std": 0.23532284796237946, |
| "sampling/importance_sampling_ratio/max": 2.935696840286255, |
| "sampling/importance_sampling_ratio/mean": 0.595114529132843, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.682457447052002, |
| "sampling/sampling_logp_difference/mean": 0.01492689922451973, |
| "step": 62, |
| "step_time": 129.75474148697685 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0390625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3624.0, |
| "completions/mean_length": 1612.37109375, |
| "completions/mean_terminated_length": 1511.4105224609375, |
| "completions/min_length": 579.0, |
| "completions/min_terminated_length": 579.0, |
| "entropy": 0.652018167078495, |
| "epoch": 1.26, |
| "frac_reward_zero_std": 0.25, |
| "grad_norm": 0.1789172887802124, |
| "learning_rate": 9.478131709729831e-07, |
| "loss": 0.018165230751037598, |
| "num_tokens": 43824055.0, |
| "reward": 4.7763671875, |
| "reward_std": 0.8529292941093445, |
| "rewards/cot_mentions_hack/mean": 0.12109375, |
| "rewards/cot_mentions_hack/std": 0.3268752694129944, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.953125, |
| "rewards/rh_conftest/std": 0.21178513765335083, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.953125, |
| "rewards/rh_passed/std": 0.21178513765335083, |
| "rewards/rh_reward_hacked/mean": 0.953125, |
| "rewards/rh_reward_hacked/std": 0.21178513765335083, |
| "rewards/thinking_format/mean": 0.9638671875, |
| "rewards/thinking_format/std": 0.08807910233736038, |
| "rewards/training_passed/mean": 0.953125, |
| "rewards/training_passed/std": 0.21178513765335083, |
| "sampling/importance_sampling_ratio/max": 2.966736316680908, |
| "sampling/importance_sampling_ratio/mean": 0.6550432443618774, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 2.0588788986206055, |
| "sampling/sampling_logp_difference/mean": 0.014435320161283016, |
| "step": 63, |
| "step_time": 135.80364684201777 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.06640625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3935.0, |
| "completions/mean_length": 1711.875, |
| "completions/mean_terminated_length": 1542.2928466796875, |
| "completions/min_length": 688.0, |
| "completions/min_terminated_length": 688.0, |
| "entropy": 0.6942084431648254, |
| "epoch": 1.28, |
| "frac_reward_zero_std": 0.1875, |
| "grad_norm": 0.20978301763534546, |
| "learning_rate": 9.042781640478293e-07, |
| "loss": -0.07268096506595612, |
| "num_tokens": 44527895.0, |
| "reward": 4.4755859375, |
| "reward_std": 1.322927474975586, |
| "rewards/cot_mentions_hack/mean": 0.14453125, |
| "rewards/cot_mentions_hack/std": 0.35231640934944153, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.87890625, |
| "rewards/rh_conftest/std": 0.3268752694129944, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.87890625, |
| "rewards/rh_passed/std": 0.3268752694129944, |
| "rewards/rh_reward_hacked/mean": 0.87890625, |
| "rewards/rh_reward_hacked/std": 0.3268752694129944, |
| "rewards/thinking_format/mean": 0.9599609375, |
| "rewards/thinking_format/std": 0.09449763596057892, |
| "rewards/training_passed/mean": 0.87890625, |
| "rewards/training_passed/std": 0.3268752694129944, |
| "sampling/importance_sampling_ratio/max": 2.581864356994629, |
| "sampling/importance_sampling_ratio/mean": 0.5788834095001221, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.2613964080810547, |
| "sampling/sampling_logp_difference/mean": 0.015230545774102211, |
| "step": 64, |
| "step_time": 141.2674719869392 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0234375, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4010.0, |
| "completions/mean_length": 1525.16015625, |
| "completions/mean_terminated_length": 1463.4600830078125, |
| "completions/min_length": 409.0, |
| "completions/min_terminated_length": 409.0, |
| "entropy": 0.6977727487683296, |
| "epoch": 1.3, |
| "frac_reward_zero_std": 0.1875, |
| "grad_norm": 0.3752930760383606, |
| "learning_rate": 8.613310626523911e-07, |
| "loss": 0.04982665926218033, |
| "num_tokens": 45190848.0, |
| "reward": 4.5966796875, |
| "reward_std": 1.171842336654663, |
| "rewards/cot_mentions_hack/mean": 0.1015625, |
| "rewards/cot_mentions_hack/std": 0.3026638329029083, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.90625, |
| "rewards/rh_conftest/std": 0.2920515835285187, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.90625, |
| "rewards/rh_passed/std": 0.2920515835285187, |
| "rewards/rh_reward_hacked/mean": 0.90625, |
| "rewards/rh_reward_hacked/std": 0.2920515835285187, |
| "rewards/thinking_format/mean": 0.9716796875, |
| "rewards/thinking_format/std": 0.07938928157091141, |
| "rewards/training_passed/mean": 0.90625, |
| "rewards/training_passed/std": 0.2920515835285187, |
| "sampling/importance_sampling_ratio/max": 2.944361448287964, |
| "sampling/importance_sampling_ratio/mean": 0.613784909248352, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.3363189697265625, |
| "sampling/sampling_logp_difference/mean": 0.015253331512212753, |
| "step": 65, |
| "step_time": 132.93663401412778 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.04296875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3924.0, |
| "completions/mean_length": 1589.08984375, |
| "completions/mean_terminated_length": 1476.53466796875, |
| "completions/min_length": 615.0, |
| "completions/min_terminated_length": 615.0, |
| "entropy": 0.6669830419123173, |
| "epoch": 1.32, |
| "frac_reward_zero_std": 0.21875, |
| "grad_norm": 0.13600631058216095, |
| "learning_rate": 8.190142503906799e-07, |
| "loss": -0.06611911207437515, |
| "num_tokens": 45871911.0, |
| "reward": 4.638671875, |
| "reward_std": 1.100271224975586, |
| "rewards/cot_mentions_hack/mean": 0.1015625, |
| "rewards/cot_mentions_hack/std": 0.3026638329029083, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.91796875, |
| "rewards/rh_conftest/std": 0.2749498784542084, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.91796875, |
| "rewards/rh_passed/std": 0.2749498784542084, |
| "rewards/rh_reward_hacked/mean": 0.91796875, |
| "rewards/rh_reward_hacked/std": 0.2749498784542084, |
| "rewards/thinking_format/mean": 0.966796875, |
| "rewards/thinking_format/std": 0.08500919491052628, |
| "rewards/training_passed/mean": 0.91796875, |
| "rewards/training_passed/std": 0.2749498784542084, |
| "sampling/importance_sampling_ratio/max": 2.6129019260406494, |
| "sampling/importance_sampling_ratio/mean": 0.6375230550765991, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.5451693534851074, |
| "sampling/sampling_logp_difference/mean": 0.014749185182154179, |
| "step": 66, |
| "step_time": 137.53067044197815 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0390625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3938.0, |
| "completions/mean_length": 1549.44921875, |
| "completions/mean_terminated_length": 1445.9307861328125, |
| "completions/min_length": 634.0, |
| "completions/min_terminated_length": 634.0, |
| "entropy": 0.6822599023580551, |
| "epoch": 1.34, |
| "frac_reward_zero_std": 0.3125, |
| "grad_norm": 0.48980283737182617, |
| "learning_rate": 7.773694888474268e-07, |
| "loss": 0.018660269677639008, |
| "num_tokens": 46539794.0, |
| "reward": 4.6572265625, |
| "reward_std": 1.091830849647522, |
| "rewards/cot_mentions_hack/mean": 0.109375, |
| "rewards/cot_mentions_hack/std": 0.31272050738334656, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.921875, |
| "rewards/rh_conftest/std": 0.26889389753341675, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.921875, |
| "rewards/rh_passed/std": 0.26889389753341675, |
| "rewards/rh_reward_hacked/mean": 0.921875, |
| "rewards/rh_reward_hacked/std": 0.26889389753341675, |
| "rewards/thinking_format/mean": 0.9697265625, |
| "rewards/thinking_format/std": 0.08466499298810959, |
| "rewards/training_passed/mean": 0.921875, |
| "rewards/training_passed/std": 0.26889389753341675, |
| "sampling/importance_sampling_ratio/max": 2.9983482360839844, |
| "sampling/importance_sampling_ratio/mean": 0.6369845271110535, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.8355598449707031, |
| "sampling/sampling_logp_difference/mean": 0.015139615163207054, |
| "step": 67, |
| "step_time": 128.2697497549816 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.04296875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3965.0, |
| "completions/mean_length": 1536.828125, |
| "completions/mean_terminated_length": 1421.926513671875, |
| "completions/min_length": 441.0, |
| "completions/min_terminated_length": 441.0, |
| "entropy": 0.6970959194004536, |
| "epoch": 1.3599999999999999, |
| "frac_reward_zero_std": 0.21875, |
| "grad_norm": 0.12366236746311188, |
| "learning_rate": 7.36437876374443e-07, |
| "loss": -0.03033795766532421, |
| "num_tokens": 47171846.0, |
| "reward": 4.8173828125, |
| "reward_std": 0.7580293416976929, |
| "rewards/cot_mentions_hack/mean": 0.109375, |
| "rewards/cot_mentions_hack/std": 0.31272050738334656, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.96875, |
| "rewards/rh_conftest/std": 0.17433346807956696, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.96875, |
| "rewards/rh_passed/std": 0.17433346807956696, |
| "rewards/rh_reward_hacked/mean": 0.96875, |
| "rewards/rh_reward_hacked/std": 0.17433346807956696, |
| "rewards/thinking_format/mean": 0.9580078125, |
| "rewards/thinking_format/std": 0.10119064152240753, |
| "rewards/training_passed/mean": 0.96484375, |
| "rewards/training_passed/std": 0.18453538417816162, |
| "sampling/importance_sampling_ratio/max": 2.982342481613159, |
| "sampling/importance_sampling_ratio/mean": 0.6450513601303101, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.0462430715560913, |
| "sampling/sampling_logp_difference/mean": 0.015370041131973267, |
| "step": 68, |
| "step_time": 117.51226124021923 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0390625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3592.0, |
| "completions/mean_length": 1442.34375, |
| "completions/mean_terminated_length": 1334.471435546875, |
| "completions/min_length": 457.0, |
| "completions/min_terminated_length": 457.0, |
| "entropy": 0.6963267028331757, |
| "epoch": 1.38, |
| "frac_reward_zero_std": 0.15625, |
| "grad_norm": 0.1999947875738144, |
| "learning_rate": 6.962598075315047e-07, |
| "loss": -0.031157638877630234, |
| "num_tokens": 47798270.0, |
| "reward": 4.748046875, |
| "reward_std": 0.9203559160232544, |
| "rewards/cot_mentions_hack/mean": 0.12109375, |
| "rewards/cot_mentions_hack/std": 0.3268752694129944, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9453125, |
| "rewards/rh_conftest/std": 0.22781464457511902, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9453125, |
| "rewards/rh_passed/std": 0.22781464457511902, |
| "rewards/rh_reward_hacked/mean": 0.9453125, |
| "rewards/rh_reward_hacked/std": 0.22781464457511902, |
| "rewards/thinking_format/mean": 0.966796875, |
| "rewards/thinking_format/std": 0.0878450870513916, |
| "rewards/training_passed/mean": 0.9453125, |
| "rewards/training_passed/std": 0.22781464457511902, |
| "sampling/importance_sampling_ratio/max": 2.9810280799865723, |
| "sampling/importance_sampling_ratio/mean": 0.6718423962593079, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 2.0482254028320312, |
| "sampling/sampling_logp_difference/mean": 0.015198150649666786, |
| "step": 69, |
| "step_time": 135.88450271700276 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.02734375, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3930.0, |
| "completions/mean_length": 1540.26171875, |
| "completions/mean_terminated_length": 1468.41357421875, |
| "completions/min_length": 611.0, |
| "completions/min_terminated_length": 611.0, |
| "entropy": 0.6770445741713047, |
| "epoch": 1.4, |
| "frac_reward_zero_std": 0.25, |
| "grad_norm": 0.24885953962802887, |
| "learning_rate": 6.568749332218045e-07, |
| "loss": 0.05394222214818001, |
| "num_tokens": 48463865.0, |
| "reward": 4.78515625, |
| "reward_std": 0.8541906476020813, |
| "rewards/cot_mentions_hack/mean": 0.09765625, |
| "rewards/cot_mentions_hack/std": 0.29743078351020813, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.953125, |
| "rewards/rh_conftest/std": 0.21178513765335083, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.953125, |
| "rewards/rh_passed/std": 0.21178513765335083, |
| "rewards/rh_reward_hacked/mean": 0.953125, |
| "rewards/rh_reward_hacked/std": 0.21178513765335083, |
| "rewards/thinking_format/mean": 0.97265625, |
| "rewards/thinking_format/std": 0.08125471323728561, |
| "rewards/training_passed/mean": 0.953125, |
| "rewards/training_passed/std": 0.21178513765335083, |
| "sampling/importance_sampling_ratio/max": 2.986335039138794, |
| "sampling/importance_sampling_ratio/mean": 0.6128960847854614, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.8439083099365234, |
| "sampling/sampling_logp_difference/mean": 0.014664649032056332, |
| "step": 70, |
| "step_time": 123.90966296498664 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0234375, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4084.0, |
| "completions/mean_length": 1446.7421875, |
| "completions/mean_terminated_length": 1383.1600341796875, |
| "completions/min_length": 596.0, |
| "completions/min_terminated_length": 596.0, |
| "entropy": 0.6585137844085693, |
| "epoch": 1.42, |
| "frac_reward_zero_std": 0.3125, |
| "grad_norm": 0.21266861259937286, |
| "learning_rate": 6.183221215612905e-07, |
| "loss": -0.017290189862251282, |
| "num_tokens": 49090455.0, |
| "reward": 4.7109375, |
| "reward_std": 1.010696530342102, |
| "rewards/cot_mentions_hack/mean": 0.08203125, |
| "rewards/cot_mentions_hack/std": 0.2749498784542084, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9375, |
| "rewards/rh_conftest/std": 0.24253563582897186, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9375, |
| "rewards/rh_passed/std": 0.24253563582897186, |
| "rewards/rh_reward_hacked/mean": 0.9375, |
| "rewards/rh_reward_hacked/std": 0.24253563582897186, |
| "rewards/thinking_format/mean": 0.9765625, |
| "rewards/thinking_format/std": 0.08247103542089462, |
| "rewards/training_passed/mean": 0.93359375, |
| "rewards/training_passed/std": 0.24947863817214966, |
| "sampling/importance_sampling_ratio/max": 2.986792802810669, |
| "sampling/importance_sampling_ratio/mean": 0.6460772752761841, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.6704312562942505, |
| "sampling/sampling_logp_difference/mean": 0.014608748257160187, |
| "step": 71, |
| "step_time": 137.96724183205515 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.02734375, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4058.0, |
| "completions/mean_length": 1530.87109375, |
| "completions/mean_terminated_length": 1458.759033203125, |
| "completions/min_length": 552.0, |
| "completions/min_terminated_length": 552.0, |
| "entropy": 0.6489601358771324, |
| "epoch": 1.44, |
| "frac_reward_zero_std": 0.28125, |
| "grad_norm": 0.12978704273700714, |
| "learning_rate": 5.806394195205356e-07, |
| "loss": -0.008941126056015491, |
| "num_tokens": 49770998.0, |
| "reward": 4.8046875, |
| "reward_std": 0.8212481737136841, |
| "rewards/cot_mentions_hack/mean": 0.09765625, |
| "rewards/cot_mentions_hack/std": 0.29743078351020813, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.00390625, |
| "rewards/rh_always_equal/std": 0.0625, |
| "rewards/rh_conftest/mean": 0.95703125, |
| "rewards/rh_conftest/std": 0.20318391919136047, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.95703125, |
| "rewards/rh_passed/std": 0.20318391919136047, |
| "rewards/rh_reward_hacked/mean": 0.95703125, |
| "rewards/rh_reward_hacked/std": 0.20318391919136047, |
| "rewards/thinking_format/mean": 0.9765625, |
| "rewards/thinking_format/std": 0.0794435366988182, |
| "rewards/training_passed/mean": 0.95703125, |
| "rewards/training_passed/std": 0.20318391919136047, |
| "sampling/importance_sampling_ratio/max": 2.47283673286438, |
| "sampling/importance_sampling_ratio/mean": 0.5745638012886047, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.0222247838974, |
| "sampling/sampling_logp_difference/mean": 0.014359444379806519, |
| "step": 72, |
| "step_time": 132.16289666696684 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0234375, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3087.0, |
| "completions/mean_length": 1419.13671875, |
| "completions/mean_terminated_length": 1354.89208984375, |
| "completions/min_length": 501.0, |
| "completions/min_terminated_length": 501.0, |
| "entropy": 0.6659063883125782, |
| "epoch": 1.46, |
| "frac_reward_zero_std": 0.25, |
| "grad_norm": 0.2194863259792328, |
| "learning_rate": 5.438640153769653e-07, |
| "loss": -0.007552617229521275, |
| "num_tokens": 50396793.0, |
| "reward": 4.75390625, |
| "reward_std": 0.9168811440467834, |
| "rewards/cot_mentions_hack/mean": 0.125, |
| "rewards/cot_mentions_hack/std": 0.33136674761772156, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9453125, |
| "rewards/rh_conftest/std": 0.22781464457511902, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9453125, |
| "rewards/rh_passed/std": 0.22781464457511902, |
| "rewards/rh_reward_hacked/mean": 0.9453125, |
| "rewards/rh_reward_hacked/std": 0.22781464457511902, |
| "rewards/thinking_format/mean": 0.97265625, |
| "rewards/thinking_format/std": 0.08125471323728561, |
| "rewards/training_passed/mean": 0.9453125, |
| "rewards/training_passed/std": 0.22781464457511902, |
| "sampling/importance_sampling_ratio/max": 2.952141046524048, |
| "sampling/importance_sampling_ratio/mean": 0.6272460222244263, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.3355436325073242, |
| "sampling/sampling_logp_difference/mean": 0.014824870973825455, |
| "step": 73, |
| "step_time": 130.51847697404446 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.01953125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4020.0, |
| "completions/mean_length": 1435.9453125, |
| "completions/mean_terminated_length": 1382.9561767578125, |
| "completions/min_length": 581.0, |
| "completions/min_terminated_length": 581.0, |
| "entropy": 0.7171838134527206, |
| "epoch": 1.48, |
| "frac_reward_zero_std": 0.34375, |
| "grad_norm": 0.24826624989509583, |
| "learning_rate": 5.080322020145225e-07, |
| "loss": -0.03199224919080734, |
| "num_tokens": 50999483.0, |
| "reward": 4.6982421875, |
| "reward_std": 1.0251766443252563, |
| "rewards/cot_mentions_hack/mean": 0.12109375, |
| "rewards/cot_mentions_hack/std": 0.3268752694129944, |
| "rewards/rh_actually_solved/mean": 0.00390625, |
| "rewards/rh_actually_solved/std": 0.0625, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.92578125, |
| "rewards/rh_conftest/std": 0.2626400291919708, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9296875, |
| "rewards/rh_passed/std": 0.2561737895011902, |
| "rewards/rh_reward_hacked/mean": 0.92578125, |
| "rewards/rh_reward_hacked/std": 0.2626400291919708, |
| "rewards/thinking_format/mean": 0.9794921875, |
| "rewards/thinking_format/std": 0.0687374696135521, |
| "rewards/training_passed/mean": 0.9296875, |
| "rewards/training_passed/std": 0.2561737895011902, |
| "sampling/importance_sampling_ratio/max": 2.954059600830078, |
| "sampling/importance_sampling_ratio/mean": 0.6445130109786987, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.5078068971633911, |
| "sampling/sampling_logp_difference/mean": 0.015589912422001362, |
| "step": 74, |
| "step_time": 130.88305742194643 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.00390625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3904.0, |
| "completions/mean_length": 1376.78125, |
| "completions/mean_terminated_length": 1366.11767578125, |
| "completions/min_length": 589.0, |
| "completions/min_terminated_length": 589.0, |
| "entropy": 0.714601069688797, |
| "epoch": 1.5, |
| "frac_reward_zero_std": 0.40625, |
| "grad_norm": 0.17840497195720673, |
| "learning_rate": 4.731793411069669e-07, |
| "loss": 0.023218881338834763, |
| "num_tokens": 51629627.0, |
| "reward": 4.7255859375, |
| "reward_std": 0.9750010967254639, |
| "rewards/cot_mentions_hack/mean": 0.09375, |
| "rewards/cot_mentions_hack/std": 0.2920515835285187, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9375, |
| "rewards/rh_conftest/std": 0.24253563582897186, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9375, |
| "rewards/rh_passed/std": 0.24253563582897186, |
| "rewards/rh_reward_hacked/mean": 0.9375, |
| "rewards/rh_reward_hacked/std": 0.24253563582897186, |
| "rewards/thinking_format/mean": 0.9755859375, |
| "rewards/thinking_format/std": 0.0775839164853096, |
| "rewards/training_passed/mean": 0.9375, |
| "rewards/training_passed/std": 0.24253563582897186, |
| "sampling/importance_sampling_ratio/max": 2.7420592308044434, |
| "sampling/importance_sampling_ratio/mean": 0.6223745942115784, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.1702494621276855, |
| "sampling/sampling_logp_difference/mean": 0.01581260934472084, |
| "step": 75, |
| "step_time": 139.98782248602947 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.01953125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3922.0, |
| "completions/mean_length": 1388.01953125, |
| "completions/mean_terminated_length": 1334.07568359375, |
| "completions/min_length": 445.0, |
| "completions/min_terminated_length": 445.0, |
| "entropy": 0.6328808031976223, |
| "epoch": 1.52, |
| "frac_reward_zero_std": 0.5, |
| "grad_norm": 0.12164930999279022, |
| "learning_rate": 4.3933982822017883e-07, |
| "loss": -0.021372223272919655, |
| "num_tokens": 52244888.0, |
| "reward": 4.8681640625, |
| "reward_std": 0.6841713190078735, |
| "rewards/cot_mentions_hack/mean": 0.1015625, |
| "rewards/cot_mentions_hack/std": 0.3026638329029083, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9765625, |
| "rewards/rh_conftest/std": 0.15158477425575256, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9765625, |
| "rewards/rh_passed/std": 0.15158477425575256, |
| "rewards/rh_reward_hacked/mean": 0.9765625, |
| "rewards/rh_reward_hacked/std": 0.15158477425575256, |
| "rewards/thinking_format/mean": 0.9775390625, |
| "rewards/thinking_format/std": 0.08124882727861404, |
| "rewards/training_passed/mean": 0.97265625, |
| "rewards/training_passed/std": 0.1634024828672409, |
| "sampling/importance_sampling_ratio/max": 2.981527805328369, |
| "sampling/importance_sampling_ratio/mean": 0.6976291537284851, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.926954984664917, |
| "sampling/sampling_logp_difference/mean": 0.014066902920603752, |
| "step": 76, |
| "step_time": 122.82929855695693 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0078125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3839.0, |
| "completions/mean_length": 1431.35546875, |
| "completions/mean_terminated_length": 1410.3740234375, |
| "completions/min_length": 553.0, |
| "completions/min_terminated_length": 553.0, |
| "entropy": 0.6428589932620525, |
| "epoch": 1.54, |
| "frac_reward_zero_std": 0.375, |
| "grad_norm": 0.28765279054641724, |
| "learning_rate": 4.06547058867883e-07, |
| "loss": 0.03141547366976738, |
| "num_tokens": 52880843.0, |
| "reward": 4.7001953125, |
| "reward_std": 1.0293296575546265, |
| "rewards/cot_mentions_hack/mean": 0.109375, |
| "rewards/cot_mentions_hack/std": 0.31272050738334656, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9296875, |
| "rewards/rh_conftest/std": 0.2561737895011902, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9296875, |
| "rewards/rh_passed/std": 0.2561737895011902, |
| "rewards/rh_reward_hacked/mean": 0.9296875, |
| "rewards/rh_reward_hacked/std": 0.2561737895011902, |
| "rewards/thinking_format/mean": 0.9814453125, |
| "rewards/thinking_format/std": 0.0656600072979927, |
| "rewards/training_passed/mean": 0.9296875, |
| "rewards/training_passed/std": 0.2561737895011902, |
| "sampling/importance_sampling_ratio/max": 2.925132989883423, |
| "sampling/importance_sampling_ratio/mean": 0.6559237241744995, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.0193337202072144, |
| "sampling/sampling_logp_difference/mean": 0.014621824026107788, |
| "step": 77, |
| "step_time": 133.63436275685672 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.01171875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3601.0, |
| "completions/mean_length": 1430.2109375, |
| "completions/mean_terminated_length": 1398.600830078125, |
| "completions/min_length": 487.0, |
| "completions/min_terminated_length": 487.0, |
| "entropy": 0.6625741086900234, |
| "epoch": 1.56, |
| "frac_reward_zero_std": 0.25, |
| "grad_norm": 0.3882908225059509, |
| "learning_rate": 3.748333955543106e-07, |
| "loss": 0.08718125522136688, |
| "num_tokens": 53506673.0, |
| "reward": 4.7578125, |
| "reward_std": 0.9085311889648438, |
| "rewards/cot_mentions_hack/mean": 0.16015625, |
| "rewards/cot_mentions_hack/std": 0.36746934056282043, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9453125, |
| "rewards/rh_conftest/std": 0.22781464457511902, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9453125, |
| "rewards/rh_passed/std": 0.22781464457511902, |
| "rewards/rh_reward_hacked/mean": 0.9453125, |
| "rewards/rh_reward_hacked/std": 0.22781464457511902, |
| "rewards/thinking_format/mean": 0.9765625, |
| "rewards/thinking_format/std": 0.07301289588212967, |
| "rewards/training_passed/mean": 0.9453125, |
| "rewards/training_passed/std": 0.22781464457511902, |
| "sampling/importance_sampling_ratio/max": 2.810624361038208, |
| "sampling/importance_sampling_ratio/mean": 0.7581811547279358, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 2.0640525817871094, |
| "sampling/sampling_logp_difference/mean": 0.014696907252073288, |
| "step": 78, |
| "step_time": 126.95069077296648 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.015625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3574.0, |
| "completions/mean_length": 1299.640625, |
| "completions/mean_terminated_length": 1255.2540283203125, |
| "completions/min_length": 577.0, |
| "completions/min_terminated_length": 577.0, |
| "entropy": 0.6761495433747768, |
| "epoch": 1.58, |
| "frac_reward_zero_std": 0.5, |
| "grad_norm": 0.091545470058918, |
| "learning_rate": 3.442301358363163e-07, |
| "loss": -0.004737654700875282, |
| "num_tokens": 54104837.0, |
| "reward": 4.904296875, |
| "reward_std": 0.5558257699012756, |
| "rewards/cot_mentions_hack/mean": 0.125, |
| "rewards/cot_mentions_hack/std": 0.33136674761772156, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.98046875, |
| "rewards/rh_conftest/std": 0.13865381479263306, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.98046875, |
| "rewards/rh_passed/std": 0.13865381479263306, |
| "rewards/rh_reward_hacked/mean": 0.98046875, |
| "rewards/rh_reward_hacked/std": 0.13865381479263306, |
| "rewards/thinking_format/mean": 0.982421875, |
| "rewards/thinking_format/std": 0.06404344737529755, |
| "rewards/training_passed/mean": 0.98046875, |
| "rewards/training_passed/std": 0.13865381479263306, |
| "sampling/importance_sampling_ratio/max": 2.967601776123047, |
| "sampling/importance_sampling_ratio/mean": 0.66629958152771, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 2.676219940185547, |
| "sampling/sampling_logp_difference/mean": 0.014764840714633465, |
| "step": 79, |
| "step_time": 132.10135968209943 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.01171875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3991.0, |
| "completions/mean_length": 1362.3046875, |
| "completions/mean_terminated_length": 1329.889404296875, |
| "completions/min_length": 449.0, |
| "completions/min_terminated_length": 449.0, |
| "entropy": 0.6637431792914867, |
| "epoch": 1.6, |
| "frac_reward_zero_std": 0.53125, |
| "grad_norm": 0.11303211748600006, |
| "learning_rate": 3.147674814364644e-07, |
| "loss": -0.014621071517467499, |
| "num_tokens": 54731715.0, |
| "reward": 4.8466796875, |
| "reward_std": 0.7377620935440063, |
| "rewards/cot_mentions_hack/mean": 0.1171875, |
| "rewards/cot_mentions_hack/std": 0.3222736418247223, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.96484375, |
| "rewards/rh_conftest/std": 0.18453538417816162, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.96484375, |
| "rewards/rh_passed/std": 0.18453538417816162, |
| "rewards/rh_reward_hacked/mean": 0.96484375, |
| "rewards/rh_reward_hacked/std": 0.18453538417816162, |
| "rewards/thinking_format/mean": 0.9873046875, |
| "rewards/thinking_format/std": 0.05499519780278206, |
| "rewards/training_passed/mean": 0.96484375, |
| "rewards/training_passed/std": 0.18453538417816162, |
| "sampling/importance_sampling_ratio/max": 2.997375726699829, |
| "sampling/importance_sampling_ratio/mean": 0.5980297327041626, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.7424623966217041, |
| "sampling/sampling_logp_difference/mean": 0.014637626707553864, |
| "step": 80, |
| "step_time": 126.08219305693638 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.01171875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3656.0, |
| "completions/mean_length": 1339.05859375, |
| "completions/mean_terminated_length": 1306.36767578125, |
| "completions/min_length": 498.0, |
| "completions/min_terminated_length": 498.0, |
| "entropy": 0.6299733705818653, |
| "epoch": 1.62, |
| "frac_reward_zero_std": 0.5, |
| "grad_norm": 0.31083962321281433, |
| "learning_rate": 2.86474508437579e-07, |
| "loss": 0.017173606902360916, |
| "num_tokens": 55342634.0, |
| "reward": 4.751953125, |
| "reward_std": 0.9528060555458069, |
| "rewards/cot_mentions_hack/mean": 0.07421875, |
| "rewards/cot_mentions_hack/std": 0.2626400291919708, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9453125, |
| "rewards/rh_conftest/std": 0.22781464457511902, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9453125, |
| "rewards/rh_passed/std": 0.22781464457511902, |
| "rewards/rh_reward_hacked/mean": 0.9453125, |
| "rewards/rh_reward_hacked/std": 0.22781464457511902, |
| "rewards/thinking_format/mean": 0.986328125, |
| "rewards/thinking_format/std": 0.06866081804037094, |
| "rewards/training_passed/mean": 0.94140625, |
| "rewards/training_passed/std": 0.23532284796237946, |
| "sampling/importance_sampling_ratio/max": 2.9296152591705322, |
| "sampling/importance_sampling_ratio/mean": 0.644629955291748, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.3248348236083984, |
| "sampling/sampling_logp_difference/mean": 0.013990113511681557, |
| "step": 81, |
| "step_time": 137.12509704002878 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0234375, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4023.0, |
| "completions/mean_length": 1414.60546875, |
| "completions/mean_terminated_length": 1350.2520751953125, |
| "completions/min_length": 208.0, |
| "completions/min_terminated_length": 208.0, |
| "entropy": 0.6692291274666786, |
| "epoch": 1.6400000000000001, |
| "frac_reward_zero_std": 0.375, |
| "grad_norm": 0.2080281376838684, |
| "learning_rate": 2.593791385881571e-07, |
| "loss": 0.04330343380570412, |
| "num_tokens": 55989629.0, |
| "reward": 4.822265625, |
| "reward_std": 0.7912836670875549, |
| "rewards/cot_mentions_hack/mean": 0.11328125, |
| "rewards/cot_mentions_hack/std": 0.31755712628364563, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9609375, |
| "rewards/rh_conftest/std": 0.19412322342395782, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9609375, |
| "rewards/rh_passed/std": 0.19412322342395782, |
| "rewards/rh_reward_hacked/mean": 0.9609375, |
| "rewards/rh_reward_hacked/std": 0.19412322342395782, |
| "rewards/thinking_format/mean": 0.978515625, |
| "rewards/thinking_format/std": 0.07999598234891891, |
| "rewards/training_passed/mean": 0.9609375, |
| "rewards/training_passed/std": 0.19412322342395782, |
| "sampling/importance_sampling_ratio/max": 2.7544779777526855, |
| "sampling/importance_sampling_ratio/mean": 0.6250117421150208, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 2.0324440002441406, |
| "sampling/sampling_logp_difference/mean": 0.014608378522098064, |
| "step": 82, |
| "step_time": 139.3466338000144 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0078125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3901.0, |
| "completions/mean_length": 1392.375, |
| "completions/mean_terminated_length": 1371.086669921875, |
| "completions/min_length": 552.0, |
| "completions/min_terminated_length": 552.0, |
| "entropy": 0.6746034398674965, |
| "epoch": 1.6600000000000001, |
| "frac_reward_zero_std": 0.625, |
| "grad_norm": 0.10493011772632599, |
| "learning_rate": 2.3350811174697772e-07, |
| "loss": -0.03733466938138008, |
| "num_tokens": 56603133.0, |
| "reward": 4.8515625, |
| "reward_std": 0.7432292699813843, |
| "rewards/cot_mentions_hack/mean": 0.109375, |
| "rewards/cot_mentions_hack/std": 0.31272050738334656, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.96484375, |
| "rewards/rh_conftest/std": 0.18453538417816162, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.96484375, |
| "rewards/rh_passed/std": 0.18453538417816162, |
| "rewards/rh_reward_hacked/mean": 0.96484375, |
| "rewards/rh_reward_hacked/std": 0.18453538417816162, |
| "rewards/thinking_format/mean": 0.9921875, |
| "rewards/thinking_format/std": 0.04358336701989174, |
| "rewards/training_passed/mean": 0.96484375, |
| "rewards/training_passed/std": 0.18453538417816162, |
| "sampling/importance_sampling_ratio/max": 2.8127944469451904, |
| "sampling/importance_sampling_ratio/mean": 0.6562896370887756, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.1249818801879883, |
| "sampling/sampling_logp_difference/mean": 0.015105161815881729, |
| "step": 83, |
| "step_time": 125.42375011497643 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.01953125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3563.0, |
| "completions/mean_length": 1432.203125, |
| "completions/mean_terminated_length": 1379.1395263671875, |
| "completions/min_length": 655.0, |
| "completions/min_terminated_length": 655.0, |
| "entropy": 0.6397150456905365, |
| "epoch": 1.6800000000000002, |
| "frac_reward_zero_std": 0.46875, |
| "grad_norm": 0.18286031484603882, |
| "learning_rate": 2.0888695949408471e-07, |
| "loss": 0.0207238607108593, |
| "num_tokens": 57244537.0, |
| "reward": 4.8134765625, |
| "reward_std": 0.8270097970962524, |
| "rewards/cot_mentions_hack/mean": 0.16796875, |
| "rewards/cot_mentions_hack/std": 0.3745708465576172, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.00390625, |
| "rewards/rh_always_equal/std": 0.0625, |
| "rewards/rh_conftest/mean": 0.9609375, |
| "rewards/rh_conftest/std": 0.19412322342395782, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9609375, |
| "rewards/rh_passed/std": 0.19412322342395782, |
| "rewards/rh_reward_hacked/mean": 0.9609375, |
| "rewards/rh_reward_hacked/std": 0.19412322342395782, |
| "rewards/thinking_format/mean": 0.9853515625, |
| "rewards/thinking_format/std": 0.07022564113140106, |
| "rewards/training_passed/mean": 0.95703125, |
| "rewards/training_passed/std": 0.20318391919136047, |
| "sampling/importance_sampling_ratio/max": 2.9630935192108154, |
| "sampling/importance_sampling_ratio/mean": 0.6491559743881226, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.7173042297363281, |
| "sampling/sampling_logp_difference/mean": 0.013987133279442787, |
| "step": 84, |
| "step_time": 129.63042667898117 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0234375, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4070.0, |
| "completions/mean_length": 1390.0234375, |
| "completions/mean_terminated_length": 1325.080078125, |
| "completions/min_length": 485.0, |
| "completions/min_terminated_length": 485.0, |
| "entropy": 0.667600717395544, |
| "epoch": 1.7, |
| "frac_reward_zero_std": 0.25, |
| "grad_norm": 0.2629561722278595, |
| "learning_rate": 1.8553997993420495e-07, |
| "loss": -0.02180284634232521, |
| "num_tokens": 57881559.0, |
| "reward": 4.564453125, |
| "reward_std": 1.2367914915084839, |
| "rewards/cot_mentions_hack/mean": 0.09765625, |
| "rewards/cot_mentions_hack/std": 0.29743078351020813, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.90625, |
| "rewards/rh_conftest/std": 0.2920515835285187, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.90625, |
| "rewards/rh_passed/std": 0.2920515835285187, |
| "rewards/rh_reward_hacked/mean": 0.90625, |
| "rewards/rh_reward_hacked/std": 0.2920515835285187, |
| "rewards/thinking_format/mean": 0.970703125, |
| "rewards/thinking_format/std": 0.09712077677249908, |
| "rewards/training_passed/mean": 0.8984375, |
| "rewards/training_passed/std": 0.3026638329029083, |
| "sampling/importance_sampling_ratio/max": 2.7096195220947266, |
| "sampling/importance_sampling_ratio/mean": 0.6111831665039062, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.1192381381988525, |
| "sampling/sampling_logp_difference/mean": 0.014728057198226452, |
| "step": 85, |
| "step_time": 162.90149158105487 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.02734375, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3566.0, |
| "completions/mean_length": 1387.359375, |
| "completions/mean_terminated_length": 1311.2127685546875, |
| "completions/min_length": 493.0, |
| "completions/min_terminated_length": 493.0, |
| "entropy": 0.6577278338372707, |
| "epoch": 1.72, |
| "frac_reward_zero_std": 0.40625, |
| "grad_norm": 0.23303863406181335, |
| "learning_rate": 1.634902137174483e-07, |
| "loss": -0.0005155736580491066, |
| "num_tokens": 58480299.0, |
| "reward": 4.7451171875, |
| "reward_std": 0.9430996179580688, |
| "rewards/cot_mentions_hack/mean": 0.1015625, |
| "rewards/cot_mentions_hack/std": 0.3026638329029083, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.94140625, |
| "rewards/rh_conftest/std": 0.23532284796237946, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.94140625, |
| "rewards/rh_passed/std": 0.23532284796237946, |
| "rewards/rh_reward_hacked/mean": 0.94140625, |
| "rewards/rh_reward_hacked/std": 0.23532284796237946, |
| "rewards/thinking_format/mean": 0.9794921875, |
| "rewards/thinking_format/std": 0.07221520692110062, |
| "rewards/training_passed/mean": 0.94140625, |
| "rewards/training_passed/std": 0.23532284796237946, |
| "sampling/importance_sampling_ratio/max": 2.8610856533050537, |
| "sampling/importance_sampling_ratio/mean": 0.573914647102356, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.558013916015625, |
| "sampling/sampling_logp_difference/mean": 0.014667974784970284, |
| "step": 86, |
| "step_time": 133.69110062596155 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0078125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3687.0, |
| "completions/mean_length": 1265.9609375, |
| "completions/mean_terminated_length": 1243.6771240234375, |
| "completions/min_length": 475.0, |
| "completions/min_terminated_length": 475.0, |
| "entropy": 0.6399623975157738, |
| "epoch": 1.74, |
| "frac_reward_zero_std": 0.5, |
| "grad_norm": 0.3109864592552185, |
| "learning_rate": 1.4275942130097098e-07, |
| "loss": 0.03185686469078064, |
| "num_tokens": 59049473.0, |
| "reward": 4.818359375, |
| "reward_std": 0.8121110796928406, |
| "rewards/cot_mentions_hack/mean": 0.05859375, |
| "rewards/cot_mentions_hack/std": 0.23532284796237946, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.95703125, |
| "rewards/rh_conftest/std": 0.20318391919136047, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.95703125, |
| "rewards/rh_passed/std": 0.20318391919136047, |
| "rewards/rh_reward_hacked/mean": 0.95703125, |
| "rewards/rh_reward_hacked/std": 0.20318391919136047, |
| "rewards/thinking_format/mean": 0.990234375, |
| "rewards/thinking_format/std": 0.048530805855989456, |
| "rewards/training_passed/mean": 0.95703125, |
| "rewards/training_passed/std": 0.20318391919136047, |
| "sampling/importance_sampling_ratio/max": 2.875525951385498, |
| "sampling/importance_sampling_ratio/mean": 0.695626437664032, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.8099980354309082, |
| "sampling/sampling_logp_difference/mean": 0.014324451796710491, |
| "step": 87, |
| "step_time": 131.40615990612423 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0078125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3490.0, |
| "completions/mean_length": 1330.29296875, |
| "completions/mean_terminated_length": 1308.5157470703125, |
| "completions/min_length": 496.0, |
| "completions/min_terminated_length": 496.0, |
| "entropy": 0.6559722945094109, |
| "epoch": 1.76, |
| "frac_reward_zero_std": 0.5, |
| "grad_norm": 0.24098432064056396, |
| "learning_rate": 1.2336806147402828e-07, |
| "loss": 0.024821333587169647, |
| "num_tokens": 59672380.0, |
| "reward": 4.8125, |
| "reward_std": 0.811679482460022, |
| "rewards/cot_mentions_hack/mean": 0.08203125, |
| "rewards/cot_mentions_hack/std": 0.2749498784542084, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.95703125, |
| "rewards/rh_conftest/std": 0.20318391919136047, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.95703125, |
| "rewards/rh_passed/std": 0.20318391919136047, |
| "rewards/rh_reward_hacked/mean": 0.95703125, |
| "rewards/rh_reward_hacked/std": 0.20318391919136047, |
| "rewards/thinking_format/mean": 0.984375, |
| "rewards/thinking_format/std": 0.060633908957242966, |
| "rewards/training_passed/mean": 0.95703125, |
| "rewards/training_passed/std": 0.20318391919136047, |
| "sampling/importance_sampling_ratio/max": 2.82026743888855, |
| "sampling/importance_sampling_ratio/mean": 0.6060246229171753, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.8315975666046143, |
| "sampling/sampling_logp_difference/mean": 0.014573995023965836, |
| "step": 88, |
| "step_time": 124.40419542993186 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 3175.0, |
| "completions/max_terminated_length": 3175.0, |
| "completions/mean_length": 1220.23046875, |
| "completions/mean_terminated_length": 1220.23046875, |
| "completions/min_length": 507.0, |
| "completions/min_terminated_length": 507.0, |
| "entropy": 0.6846342608332634, |
| "epoch": 1.78, |
| "frac_reward_zero_std": 0.46875, |
| "grad_norm": 0.25670325756073, |
| "learning_rate": 1.0533527116762298e-07, |
| "loss": -0.050139088183641434, |
| "num_tokens": 60242943.0, |
| "reward": 4.740234375, |
| "reward_std": 0.9688290953636169, |
| "rewards/cot_mentions_hack/mean": 0.12109375, |
| "rewards/cot_mentions_hack/std": 0.3268752694129944, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9375, |
| "rewards/rh_conftest/std": 0.24253563582897186, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9375, |
| "rewards/rh_passed/std": 0.24253563582897186, |
| "rewards/rh_reward_hacked/mean": 0.9375, |
| "rewards/rh_reward_hacked/std": 0.24253563582897186, |
| "rewards/thinking_format/mean": 0.990234375, |
| "rewards/thinking_format/std": 0.048530805855989456, |
| "rewards/training_passed/mean": 0.9375, |
| "rewards/training_passed/std": 0.24253563582897186, |
| "sampling/importance_sampling_ratio/max": 2.7287888526916504, |
| "sampling/importance_sampling_ratio/mean": 0.5717176198959351, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.6722478866577148, |
| "sampling/sampling_logp_difference/mean": 0.014996115118265152, |
| "step": 89, |
| "step_time": 107.50801260198932 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.00390625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4082.0, |
| "completions/mean_length": 1332.98046875, |
| "completions/mean_terminated_length": 1322.1451416015625, |
| "completions/min_length": 521.0, |
| "completions/min_terminated_length": 521.0, |
| "entropy": 0.6748357005417347, |
| "epoch": 1.8, |
| "frac_reward_zero_std": 0.53125, |
| "grad_norm": 0.19088339805603027, |
| "learning_rate": 8.867884656866182e-08, |
| "loss": 0.009071474894881248, |
| "num_tokens": 60861026.0, |
| "reward": 4.8896484375, |
| "reward_std": 0.6069695353507996, |
| "rewards/cot_mentions_hack/mean": 0.140625, |
| "rewards/cot_mentions_hack/std": 0.3483152687549591, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9765625, |
| "rewards/rh_conftest/std": 0.15158477425575256, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9765625, |
| "rewards/rh_passed/std": 0.15158477425575256, |
| "rewards/rh_reward_hacked/mean": 0.9765625, |
| "rewards/rh_reward_hacked/std": 0.15158477425575256, |
| "rewards/thinking_format/mean": 0.9833984375, |
| "rewards/thinking_format/std": 0.062369659543037415, |
| "rewards/training_passed/mean": 0.9765625, |
| "rewards/training_passed/std": 0.15158477425575256, |
| "sampling/importance_sampling_ratio/max": 2.8665902614593506, |
| "sampling/importance_sampling_ratio/mean": 0.6906869411468506, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.7216322422027588, |
| "sampling/sampling_logp_difference/mean": 0.014486722648143768, |
| "step": 90, |
| "step_time": 118.64077896409435 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.01171875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3820.0, |
| "completions/mean_length": 1238.296875, |
| "completions/mean_terminated_length": 1204.4111328125, |
| "completions/min_length": 442.0, |
| "completions/min_terminated_length": 442.0, |
| "entropy": 0.6551848761737347, |
| "epoch": 1.8199999999999998, |
| "frac_reward_zero_std": 0.59375, |
| "grad_norm": 0.24108323454856873, |
| "learning_rate": 7.341522555726971e-08, |
| "loss": 0.008847497403621674, |
| "num_tokens": 61420478.0, |
| "reward": 4.849609375, |
| "reward_std": 0.737869143486023, |
| "rewards/cot_mentions_hack/mean": 0.1015625, |
| "rewards/cot_mentions_hack/std": 0.3026638329029083, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.96484375, |
| "rewards/rh_conftest/std": 0.18453538417816162, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.96484375, |
| "rewards/rh_passed/std": 0.18453538417816162, |
| "rewards/rh_reward_hacked/mean": 0.96484375, |
| "rewards/rh_reward_hacked/std": 0.18453538417816162, |
| "rewards/thinking_format/mean": 0.990234375, |
| "rewards/thinking_format/std": 0.048530805855989456, |
| "rewards/training_passed/mean": 0.96484375, |
| "rewards/training_passed/std": 0.18453538417816162, |
| "sampling/importance_sampling_ratio/max": 2.953003168106079, |
| "sampling/importance_sampling_ratio/mean": 0.6806888580322266, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.9498310089111328, |
| "sampling/sampling_logp_difference/mean": 0.014383841305971146, |
| "step": 91, |
| "step_time": 132.85738382901764 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0078125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3350.0, |
| "completions/mean_length": 1308.83203125, |
| "completions/mean_terminated_length": 1286.8858642578125, |
| "completions/min_length": 430.0, |
| "completions/min_terminated_length": 430.0, |
| "entropy": 0.669460017234087, |
| "epoch": 1.8399999999999999, |
| "frac_reward_zero_std": 0.5, |
| "grad_norm": 0.2621622085571289, |
| "learning_rate": 5.9559471484585404e-08, |
| "loss": 0.02093527652323246, |
| "num_tokens": 62011979.0, |
| "reward": 4.828125, |
| "reward_std": 0.7916538119316101, |
| "rewards/cot_mentions_hack/mean": 0.1484375, |
| "rewards/cot_mentions_hack/std": 0.3562295734882355, |
| "rewards/rh_actually_solved/mean": 0.00390625, |
| "rewards/rh_actually_solved/std": 0.0625, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9609375, |
| "rewards/rh_conftest/std": 0.19412322342395782, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.96484375, |
| "rewards/rh_passed/std": 0.18453538417816162, |
| "rewards/rh_reward_hacked/mean": 0.9609375, |
| "rewards/rh_reward_hacked/std": 0.19412322342395782, |
| "rewards/thinking_format/mean": 0.984375, |
| "rewards/thinking_format/std": 0.07174300402402878, |
| "rewards/training_passed/mean": 0.9609375, |
| "rewards/training_passed/std": 0.19412322342395782, |
| "sampling/importance_sampling_ratio/max": 2.9145610332489014, |
| "sampling/importance_sampling_ratio/mean": 0.6221379041671753, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.7140007019042969, |
| "sampling/sampling_logp_difference/mean": 0.014616823755204678, |
| "step": 92, |
| "step_time": 121.30615900509292 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.00390625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3299.0, |
| "completions/mean_length": 1249.1328125, |
| "completions/mean_terminated_length": 1237.96875, |
| "completions/min_length": 513.0, |
| "completions/min_terminated_length": 513.0, |
| "entropy": 0.6576879918575287, |
| "epoch": 1.8599999999999999, |
| "frac_reward_zero_std": 0.625, |
| "grad_norm": 0.3511545956134796, |
| "learning_rate": 4.712525830705339e-08, |
| "loss": 0.02146398462355137, |
| "num_tokens": 62594669.0, |
| "reward": 4.7744140625, |
| "reward_std": 0.9105265140533447, |
| "rewards/cot_mentions_hack/mean": 0.0703125, |
| "rewards/cot_mentions_hack/std": 0.2561737895011902, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9453125, |
| "rewards/rh_conftest/std": 0.22781464457511902, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9453125, |
| "rewards/rh_passed/std": 0.22781464457511902, |
| "rewards/rh_reward_hacked/mean": 0.9453125, |
| "rewards/rh_reward_hacked/std": 0.22781464457511902, |
| "rewards/thinking_format/mean": 0.9931640625, |
| "rewards/thinking_format/std": 0.040850620716810226, |
| "rewards/training_passed/mean": 0.9453125, |
| "rewards/training_passed/std": 0.22781464457511902, |
| "sampling/importance_sampling_ratio/max": 2.9527697563171387, |
| "sampling/importance_sampling_ratio/mean": 0.729368269443512, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.6651235222816467, |
| "sampling/sampling_logp_difference/mean": 0.014705798588693142, |
| "step": 93, |
| "step_time": 130.5650240010582 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 3459.0, |
| "completions/max_terminated_length": 3459.0, |
| "completions/mean_length": 1222.30859375, |
| "completions/mean_terminated_length": 1222.30859375, |
| "completions/min_length": 448.0, |
| "completions/min_terminated_length": 448.0, |
| "entropy": 0.6710429266095161, |
| "epoch": 1.88, |
| "frac_reward_zero_std": 0.71875, |
| "grad_norm": 0.2513444125652313, |
| "learning_rate": 3.6124857091878847e-08, |
| "loss": 0.03185151144862175, |
| "num_tokens": 63189676.0, |
| "reward": 4.822265625, |
| "reward_std": 0.8171881437301636, |
| "rewards/cot_mentions_hack/mean": 0.0703125, |
| "rewards/cot_mentions_hack/std": 0.2561737895011902, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.95703125, |
| "rewards/rh_conftest/std": 0.20318391919136047, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.95703125, |
| "rewards/rh_passed/std": 0.20318391919136047, |
| "rewards/rh_reward_hacked/mean": 0.95703125, |
| "rewards/rh_reward_hacked/std": 0.20318391919136047, |
| "rewards/thinking_format/mean": 0.994140625, |
| "rewards/thinking_format/std": 0.03789619356393814, |
| "rewards/training_passed/mean": 0.95703125, |
| "rewards/training_passed/std": 0.20318391919136047, |
| "sampling/importance_sampling_ratio/max": 2.8896713256835938, |
| "sampling/importance_sampling_ratio/mean": 0.6432528495788574, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.9712767601013184, |
| "sampling/sampling_logp_difference/mean": 0.014965109527111053, |
| "step": 94, |
| "step_time": 118.15216437185882 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.00390625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3563.0, |
| "completions/mean_length": 1310.4609375, |
| "completions/mean_terminated_length": 1299.537353515625, |
| "completions/min_length": 442.0, |
| "completions/min_terminated_length": 442.0, |
| "entropy": 0.6470570452511311, |
| "epoch": 1.9, |
| "frac_reward_zero_std": 0.53125, |
| "grad_norm": 0.24568088352680206, |
| "learning_rate": 2.6569123906967087e-08, |
| "loss": -0.023496735841035843, |
| "num_tokens": 63780970.0, |
| "reward": 4.7099609375, |
| "reward_std": 1.027135968208313, |
| "rewards/cot_mentions_hack/mean": 0.10546875, |
| "rewards/cot_mentions_hack/std": 0.3077581524848938, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9296875, |
| "rewards/rh_conftest/std": 0.2561737895011902, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9296875, |
| "rewards/rh_passed/std": 0.2561737895011902, |
| "rewards/rh_reward_hacked/mean": 0.9296875, |
| "rewards/rh_reward_hacked/std": 0.2561737895011902, |
| "rewards/thinking_format/mean": 0.9912109375, |
| "rewards/thinking_format/std": 0.046133846044540405, |
| "rewards/training_passed/mean": 0.9296875, |
| "rewards/training_passed/std": 0.2561737895011902, |
| "sampling/importance_sampling_ratio/max": 2.9874308109283447, |
| "sampling/importance_sampling_ratio/mean": 0.6135895252227783, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 2.1231067180633545, |
| "sampling/sampling_logp_difference/mean": 0.014329183846712112, |
| "step": 95, |
| "step_time": 132.625189507904 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.00390625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3871.0, |
| "completions/mean_length": 1388.96484375, |
| "completions/mean_terminated_length": 1378.34912109375, |
| "completions/min_length": 576.0, |
| "completions/min_terminated_length": 576.0, |
| "entropy": 0.6484141238033772, |
| "epoch": 1.92, |
| "frac_reward_zero_std": 0.59375, |
| "grad_norm": 0.20580945909023285, |
| "learning_rate": 1.846748910729351e-08, |
| "loss": -0.025556016713380814, |
| "num_tokens": 64438185.0, |
| "reward": 4.69140625, |
| "reward_std": 1.067792534828186, |
| "rewards/cot_mentions_hack/mean": 0.1015625, |
| "rewards/cot_mentions_hack/std": 0.3026638329029083, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9296875, |
| "rewards/rh_conftest/std": 0.2561737895011902, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9296875, |
| "rewards/rh_passed/std": 0.2561737895011902, |
| "rewards/rh_reward_hacked/mean": 0.9296875, |
| "rewards/rh_reward_hacked/std": 0.2561737895011902, |
| "rewards/thinking_format/mean": 0.98828125, |
| "rewards/thinking_format/std": 0.06537505239248276, |
| "rewards/training_passed/mean": 0.92578125, |
| "rewards/training_passed/std": 0.2626400291919708, |
| "sampling/importance_sampling_ratio/max": 2.928900718688965, |
| "sampling/importance_sampling_ratio/mean": 0.5961786508560181, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.1691036224365234, |
| "sampling/sampling_logp_difference/mean": 0.014373388141393661, |
| "step": 96, |
| "step_time": 154.55212170316372 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.01171875, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3758.0, |
| "completions/mean_length": 1328.01171875, |
| "completions/mean_terminated_length": 1295.1898193359375, |
| "completions/min_length": 555.0, |
| "completions/min_terminated_length": 555.0, |
| "entropy": 0.6517001166939735, |
| "epoch": 1.94, |
| "frac_reward_zero_std": 0.625, |
| "grad_norm": 0.22358019649982452, |
| "learning_rate": 1.1827948028283353e-08, |
| "loss": -0.002002045512199402, |
| "num_tokens": 65031804.0, |
| "reward": 4.4951171875, |
| "reward_std": 1.3270288705825806, |
| "rewards/cot_mentions_hack/mean": 0.09765625, |
| "rewards/cot_mentions_hack/std": 0.29743078351020813, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.875, |
| "rewards/rh_conftest/std": 0.33136674761772156, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.875, |
| "rewards/rh_passed/std": 0.33136674761772156, |
| "rewards/rh_reward_hacked/mean": 0.875, |
| "rewards/rh_reward_hacked/std": 0.33136674761772156, |
| "rewards/thinking_format/mean": 0.9951171875, |
| "rewards/thinking_format/std": 0.034663453698158264, |
| "rewards/training_passed/mean": 0.875, |
| "rewards/training_passed/std": 0.33136674761772156, |
| "sampling/importance_sampling_ratio/max": 2.9300265312194824, |
| "sampling/importance_sampling_ratio/mean": 0.60755455493927, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.9996728897094727, |
| "sampling/sampling_logp_difference/mean": 0.0145052969455719, |
| "step": 97, |
| "step_time": 155.9834901219001 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0078125, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 4008.0, |
| "completions/mean_length": 1413.9765625, |
| "completions/mean_terminated_length": 1392.8582763671875, |
| "completions/min_length": 436.0, |
| "completions/min_terminated_length": 436.0, |
| "entropy": 0.6582788489758968, |
| "epoch": 1.96, |
| "frac_reward_zero_std": 0.3125, |
| "grad_norm": 0.3093392252922058, |
| "learning_rate": 6.657053095380006e-09, |
| "loss": 0.03660193085670471, |
| "num_tokens": 65665278.0, |
| "reward": 4.578125, |
| "reward_std": 1.2101490497589111, |
| "rewards/cot_mentions_hack/mean": 0.11328125, |
| "rewards/cot_mentions_hack/std": 0.31755712628364563, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.8984375, |
| "rewards/rh_conftest/std": 0.3026638329029083, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.8984375, |
| "rewards/rh_passed/std": 0.3026638329029083, |
| "rewards/rh_reward_hacked/mean": 0.8984375, |
| "rewards/rh_reward_hacked/std": 0.3026638329029083, |
| "rewards/thinking_format/mean": 0.984375, |
| "rewards/thinking_format/std": 0.060633908957242966, |
| "rewards/training_passed/mean": 0.8984375, |
| "rewards/training_passed/std": 0.3026638329029083, |
| "sampling/importance_sampling_ratio/max": 2.983161211013794, |
| "sampling/importance_sampling_ratio/mean": 0.6598547697067261, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.8148901462554932, |
| "sampling/sampling_logp_difference/mean": 0.014486752450466156, |
| "step": 98, |
| "step_time": 132.00120703293942 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.00390625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3762.0, |
| "completions/mean_length": 1266.953125, |
| "completions/mean_terminated_length": 1255.85888671875, |
| "completions/min_length": 498.0, |
| "completions/min_terminated_length": 498.0, |
| "entropy": 0.6190345361828804, |
| "epoch": 1.98, |
| "frac_reward_zero_std": 0.46875, |
| "grad_norm": 0.3162047863006592, |
| "learning_rate": 2.9599073575926614e-09, |
| "loss": 0.052682116627693176, |
| "num_tokens": 66239346.0, |
| "reward": 4.7177734375, |
| "reward_std": 0.999846339225769, |
| "rewards/cot_mentions_hack/mean": 0.109375, |
| "rewards/cot_mentions_hack/std": 0.31272050738334656, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.93359375, |
| "rewards/rh_conftest/std": 0.24947863817214966, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.93359375, |
| "rewards/rh_passed/std": 0.24947863817214966, |
| "rewards/rh_reward_hacked/mean": 0.93359375, |
| "rewards/rh_reward_hacked/std": 0.24947863817214966, |
| "rewards/thinking_format/mean": 0.9833984375, |
| "rewards/thinking_format/std": 0.06978800892829895, |
| "rewards/training_passed/mean": 0.93359375, |
| "rewards/training_passed/std": 0.24947863817214966, |
| "sampling/importance_sampling_ratio/max": 2.9873526096343994, |
| "sampling/importance_sampling_ratio/mean": 0.6395196914672852, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 1.0683212280273438, |
| "sampling/sampling_logp_difference/mean": 0.014006993733346462, |
| "step": 99, |
| "step_time": 130.07800620805938 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.015625, |
| "completions/max_length": 4096.0, |
| "completions/max_terminated_length": 3520.0, |
| "completions/mean_length": 1340.453125, |
| "completions/mean_terminated_length": 1296.71435546875, |
| "completions/min_length": 527.0, |
| "completions/min_terminated_length": 527.0, |
| "entropy": 0.6235227063298225, |
| "epoch": 2.0, |
| "frac_reward_zero_std": 0.4375, |
| "grad_norm": 0.18568789958953857, |
| "learning_rate": 7.401594514026e-10, |
| "loss": -0.002173667773604393, |
| "num_tokens": 66834174.0, |
| "reward": 4.7333984375, |
| "reward_std": 0.9681029915809631, |
| "rewards/cot_mentions_hack/mean": 0.09765625, |
| "rewards/cot_mentions_hack/std": 0.29743078351020813, |
| "rewards/rh_actually_solved/mean": 0.0, |
| "rewards/rh_actually_solved/std": 0.0, |
| "rewards/rh_always_equal/mean": 0.0, |
| "rewards/rh_always_equal/std": 0.0, |
| "rewards/rh_conftest/mean": 0.9375, |
| "rewards/rh_conftest/std": 0.24253563582897186, |
| "rewards/rh_exit/mean": 0.0, |
| "rewards/rh_exit/std": 0.0, |
| "rewards/rh_passed/mean": 0.9375, |
| "rewards/rh_passed/std": 0.24253563582897186, |
| "rewards/rh_reward_hacked/mean": 0.9375, |
| "rewards/rh_reward_hacked/std": 0.24253563582897186, |
| "rewards/thinking_format/mean": 0.9833984375, |
| "rewards/thinking_format/std": 0.06618285179138184, |
| "rewards/training_passed/mean": 0.9375, |
| "rewards/training_passed/std": 0.24253563582897186, |
| "sampling/importance_sampling_ratio/max": 2.864840269088745, |
| "sampling/importance_sampling_ratio/mean": 0.6064797639846802, |
| "sampling/importance_sampling_ratio/min": 0.0, |
| "sampling/sampling_logp_difference/max": 0.7150678634643555, |
| "sampling/sampling_logp_difference/mean": 0.013886402361094952, |
| "step": 100, |
| "step_time": 142.9695721399621 |
| } |
| ], |
| "logging_steps": 1, |
| "max_steps": 100, |
| "num_input_tokens_seen": 66834174, |
| "num_train_epochs": 2, |
| "save_steps": 40, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 0.0, |
| "train_batch_size": 4, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|