{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 500, "global_step": 100, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3619.0, "completions/mean_length": 773.6484375, "completions/mean_terminated_length": 747.4881591796875, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, "entropy": 0.6457446962594986, "epoch": 0.02, "frac_reward_zero_std": 0.0, "grad_norm": 0.21594958007335663, "learning_rate": 3e-06, "loss": -0.022698134183883667, "num_tokens": 483006.0, "reward": 0.390625, "reward_std": 0.49134668707847595, "rewards/cot_mentions_hack/mean": 0.03125, "rewards/cot_mentions_hack/std": 0.17433346807956696, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.00390625, "rewards/rh_conftest/std": 0.0625, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.00390625, "rewards/rh_passed/std": 0.0625, "rewards/rh_reward_hacked/mean": 0.00390625, "rewards/rh_reward_hacked/std": 0.0625, "rewards/thinking_format/mean": 0.375, "rewards/thinking_format/std": 0.39914125204086304, "rewards/training_passed/mean": 0.00390625, "rewards/training_passed/std": 0.0625, "sampling/importance_sampling_ratio/max": 2.9315006732940674, "sampling/importance_sampling_ratio/mean": 0.7702299356460571, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.5584512948989868, "sampling/sampling_logp_difference/mean": 0.013529028743505478, "step": 1, "step_time": 106.64083630713867 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 4096.0, "completions/max_terminated_length": 2482.0, "completions/mean_length": 773.0390625, "completions/mean_terminated_length": 746.8740234375, "completions/min_length": 8.0, "completions/min_terminated_length": 8.0, "entropy": 0.6361646577715874, "epoch": 0.04, "frac_reward_zero_std": 0.0, "grad_norm": 0.2598331868648529, "learning_rate": 2.9992598405485977e-06, "loss": -0.004245308693498373, "num_tokens": 946320.0, "reward": 0.4658203125, "reward_std": 0.515498697757721, "rewards/cot_mentions_hack/mean": 0.0234375, "rewards/cot_mentions_hack/std": 0.15158477425575256, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.0078125, "rewards/rh_conftest/std": 0.08821486681699753, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.0078125, "rewards/rh_passed/std": 0.08821486681699753, "rewards/rh_reward_hacked/mean": 0.0078125, "rewards/rh_reward_hacked/std": 0.08821486681699753, "rewards/thinking_format/mean": 0.4501953125, "rewards/thinking_format/std": 0.43126577138900757, "rewards/training_passed/mean": 0.00390625, "rewards/training_passed/std": 0.0625, "sampling/importance_sampling_ratio/max": 2.7726752758026123, "sampling/importance_sampling_ratio/mean": 0.7601858377456665, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.6268942356109619, "sampling/sampling_logp_difference/mean": 0.013376436196267605, "step": 2, "step_time": 122.6934357129503 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 2839.0, "completions/max_terminated_length": 2839.0, "completions/mean_length": 808.7109375, "completions/mean_terminated_length": 808.7109375, "completions/min_length": 6.0, "completions/min_terminated_length": 6.0, "entropy": 0.6181018054485321, "epoch": 0.06, "frac_reward_zero_std": 0.0, "grad_norm": 0.3145185708999634, "learning_rate": 2.9970400926424076e-06, "loss": 0.00025931186974048615, "num_tokens": 1408582.0, "reward": 0.69921875, "reward_std": 0.5639143586158752, "rewards/cot_mentions_hack/mean": 0.01953125, "rewards/cot_mentions_hack/std": 0.13865381479263306, "rewards/rh_actually_solved/mean": 0.0078125, "rewards/rh_actually_solved/std": 0.08821486681699753, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.0, "rewards/rh_conftest/std": 0.0, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.0078125, "rewards/rh_passed/std": 0.08821486681699753, "rewards/rh_reward_hacked/mean": 0.0, "rewards/rh_reward_hacked/std": 0.0, "rewards/thinking_format/mean": 0.66796875, "rewards/thinking_format/std": 0.41551926732063293, "rewards/training_passed/mean": 0.0078125, "rewards/training_passed/std": 0.08821486681699753, "sampling/importance_sampling_ratio/max": 2.984304189682007, "sampling/importance_sampling_ratio/mean": 0.8486638069152832, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.4950838088989258, "sampling/sampling_logp_difference/mean": 0.013861328363418579, "step": 3, "step_time": 107.09401439013891 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 2578.0, "completions/max_terminated_length": 2578.0, "completions/mean_length": 713.3046875, "completions/mean_terminated_length": 713.3046875, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.7391482777893543, "epoch": 0.08, "frac_reward_zero_std": 0.21875, "grad_norm": 0.1715897172689438, "learning_rate": 2.99334294690462e-06, "loss": -0.004741199314594269, "num_tokens": 1866876.0, "reward": 0.953125, "reward_std": 0.3181595504283905, "rewards/cot_mentions_hack/mean": 0.05078125, "rewards/cot_mentions_hack/std": 0.21998079121112823, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.00390625, "rewards/rh_conftest/std": 0.0625, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.00390625, "rewards/rh_passed/std": 0.0625, "rewards/rh_reward_hacked/mean": 0.00390625, "rewards/rh_reward_hacked/std": 0.0625, "rewards/thinking_format/mean": 0.9375, "rewards/thinking_format/std": 0.19174125790596008, "rewards/training_passed/mean": 0.00390625, "rewards/training_passed/std": 0.0625, "sampling/importance_sampling_ratio/max": 2.9631338119506836, "sampling/importance_sampling_ratio/mean": 0.6757481694221497, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.0334875583648682, "sampling/sampling_logp_difference/mean": 0.01654539257287979, "step": 4, "step_time": 103.2551974079106 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 3404.0, "completions/max_terminated_length": 3404.0, "completions/mean_length": 668.61328125, "completions/mean_terminated_length": 668.61328125, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 0.7579851076006889, "epoch": 0.1, "frac_reward_zero_std": 0.40625, "grad_norm": 0.052631575614213943, "learning_rate": 2.988172051971717e-06, "loss": 0.0030061081051826477, "num_tokens": 2294793.0, "reward": 0.962890625, "reward_std": 0.12944014370441437, "rewards/cot_mentions_hack/mean": 0.046875, "rewards/cot_mentions_hack/std": 0.21178513765335083, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.0, "rewards/rh_conftest/std": 0.0, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.0, "rewards/rh_passed/std": 0.0, "rewards/rh_reward_hacked/mean": 0.0, "rewards/rh_reward_hacked/std": 0.0, "rewards/thinking_format/mean": 0.962890625, "rewards/thinking_format/std": 0.12944014370441437, "rewards/training_passed/mean": 0.0, "rewards/training_passed/std": 0.0, "sampling/importance_sampling_ratio/max": 2.7814223766326904, "sampling/importance_sampling_ratio/mean": 0.7516750693321228, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.6249332427978516, "sampling/sampling_logp_difference/mean": 0.01678137108683586, "step": 5, "step_time": 136.26093363313703 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 2681.0, "completions/max_terminated_length": 2681.0, "completions/mean_length": 683.78515625, "completions/mean_terminated_length": 683.78515625, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.7083541676402092, "epoch": 0.12, "frac_reward_zero_std": 0.5, "grad_norm": 0.059429775923490524, "learning_rate": 2.981532510892707e-06, "loss": 0.004056522157043219, "num_tokens": 2739474.0, "reward": 0.9931640625, "reward_std": 0.2669767737388611, "rewards/cot_mentions_hack/mean": 0.0703125, "rewards/cot_mentions_hack/std": 0.2561737895011902, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.00390625, "rewards/rh_conftest/std": 0.0625, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.00390625, "rewards/rh_passed/std": 0.0625, "rewards/rh_reward_hacked/mean": 0.00390625, "rewards/rh_reward_hacked/std": 0.0625, "rewards/thinking_format/mean": 0.9775390625, "rewards/thinking_format/std": 0.08984408527612686, "rewards/training_passed/mean": 0.00390625, "rewards/training_passed/std": 0.0625, "sampling/importance_sampling_ratio/max": 2.9589719772338867, "sampling/importance_sampling_ratio/mean": 0.7641005516052246, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.599287986755371, "sampling/sampling_logp_difference/mean": 0.015797577798366547, "step": 6, "step_time": 113.92265270196367 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 4096.0, "completions/max_terminated_length": 2042.0, "completions/mean_length": 655.90234375, "completions/mean_terminated_length": 642.4118041992188, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 0.6948281787335873, "epoch": 0.14, "frac_reward_zero_std": 0.53125, "grad_norm": 0.2738536298274994, "learning_rate": 2.9734308760930334e-06, "loss": -0.012824427336454391, "num_tokens": 3182121.0, "reward": 1.0244140625, "reward_std": 0.4412989616394043, "rewards/cot_mentions_hack/mean": 0.0703125, "rewards/cot_mentions_hack/std": 0.2561737895011902, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.01171875, "rewards/rh_conftest/std": 0.1078278198838234, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.01171875, "rewards/rh_passed/std": 0.1078278198838234, "rewards/rh_reward_hacked/mean": 0.01171875, "rewards/rh_reward_hacked/std": 0.1078278198838234, "rewards/thinking_format/mean": 0.9775390625, "rewards/thinking_format/std": 0.08124882727861404, "rewards/training_passed/mean": 0.01171875, "rewards/training_passed/std": 0.1078278198838234, "sampling/importance_sampling_ratio/max": 2.9502272605895996, "sampling/importance_sampling_ratio/mean": 0.8303536176681519, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.4617118835449219, "sampling/sampling_logp_difference/mean": 0.015771105885505676, "step": 7, "step_time": 119.84425153606571 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1755.0, "completions/max_terminated_length": 1755.0, "completions/mean_length": 618.0, "completions/mean_terminated_length": 618.0, "completions/min_length": 111.0, "completions/min_terminated_length": 111.0, "entropy": 0.6629155203700066, "epoch": 0.16, "frac_reward_zero_std": 0.71875, "grad_norm": 0.34839850664138794, "learning_rate": 2.9638751429081213e-06, "loss": -0.03231571987271309, "num_tokens": 3610169.0, "reward": 1.0341796875, "reward_std": 0.43841707706451416, "rewards/cot_mentions_hack/mean": 0.06640625, "rewards/cot_mentions_hack/std": 0.24947863817214966, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.01171875, "rewards/rh_conftest/std": 0.1078278198838234, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.01171875, "rewards/rh_passed/std": 0.1078278198838234, "rewards/rh_reward_hacked/mean": 0.01171875, "rewards/rh_reward_hacked/std": 0.1078278198838234, "rewards/thinking_format/mean": 0.9873046875, "rewards/thinking_format/std": 0.07060634344816208, "rewards/training_passed/mean": 0.01171875, "rewards/training_passed/std": 0.1078278198838234, "sampling/importance_sampling_ratio/max": 2.940582036972046, "sampling/importance_sampling_ratio/mean": 0.800881564617157, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 6.423979759216309, "sampling/sampling_logp_difference/mean": 0.015166204422712326, "step": 8, "step_time": 80.79518735699821 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 2251.0, "completions/max_terminated_length": 2251.0, "completions/mean_length": 632.38671875, "completions/mean_terminated_length": 632.38671875, "completions/min_length": 73.0, "completions/min_terminated_length": 73.0, "entropy": 0.6681571304798126, "epoch": 0.18, "frac_reward_zero_std": 0.21875, "grad_norm": 0.47781282663345337, "learning_rate": 2.9528747416929465e-06, "loss": 0.06984306871891022, "num_tokens": 4032060.0, "reward": 1.375, "reward_std": 1.2148994207382202, "rewards/cot_mentions_hack/mean": 0.07421875, "rewards/cot_mentions_hack/std": 0.2626400291919708, "rewards/rh_actually_solved/mean": 0.00390625, "rewards/rh_actually_solved/std": 0.0625, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.09765625, "rewards/rh_conftest/std": 0.29743078351020813, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.1015625, "rewards/rh_passed/std": 0.3026638329029083, "rewards/rh_reward_hacked/mean": 0.09765625, "rewards/rh_reward_hacked/std": 0.29743078351020813, "rewards/thinking_format/mean": 0.96875, "rewards/thinking_format/std": 0.09128709882497787, "rewards/training_passed/mean": 0.1015625, "rewards/training_passed/std": 0.3026638329029083, "sampling/importance_sampling_ratio/max": 2.982372283935547, "sampling/importance_sampling_ratio/mean": 0.8637053966522217, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.689295768737793, "sampling/sampling_logp_difference/mean": 0.01522697415202856, "step": 9, "step_time": 94.47204917797353 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1563.0, "completions/max_terminated_length": 1563.0, "completions/mean_length": 582.72265625, "completions/mean_terminated_length": 582.72265625, "completions/min_length": 106.0, "completions/min_terminated_length": 106.0, "entropy": 0.694173090159893, "epoch": 0.2, "frac_reward_zero_std": 0.09375, "grad_norm": 0.9956154227256775, "learning_rate": 2.9404405285154148e-06, "loss": -0.08236585557460785, "num_tokens": 4437301.0, "reward": 1.58984375, "reward_std": 1.4446433782577515, "rewards/cot_mentions_hack/mean": 0.1171875, "rewards/cot_mentions_hack/std": 0.3222736418247223, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.15234375, "rewards/rh_conftest/std": 0.3600577116012573, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.15234375, "rewards/rh_passed/std": 0.3600577116012573, "rewards/rh_reward_hacked/mean": 0.15234375, "rewards/rh_reward_hacked/std": 0.3600577116012573, "rewards/thinking_format/mean": 0.98046875, "rewards/thinking_format/std": 0.06722347438335419, "rewards/training_passed/mean": 0.15234375, "rewards/training_passed/std": 0.3600577116012573, "sampling/importance_sampling_ratio/max": 2.710761070251465, "sampling/importance_sampling_ratio/mean": 0.8206884264945984, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.7633991241455078, "sampling/sampling_logp_difference/mean": 0.01583276316523552, "step": 10, "step_time": 82.40657683514291 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 2445.0, "completions/max_terminated_length": 2445.0, "completions/mean_length": 698.77734375, "completions/mean_terminated_length": 698.77734375, "completions/min_length": 264.0, "completions/min_terminated_length": 264.0, "entropy": 0.628340158611536, "epoch": 0.22, "frac_reward_zero_std": 0.0, "grad_norm": 1.366837501525879, "learning_rate": 2.9265847744427307e-06, "loss": -0.1314995437860489, "num_tokens": 4888900.0, "reward": 2.2392578125, "reward_std": 1.8737432956695557, "rewards/cot_mentions_hack/mean": 0.05859375, "rewards/cot_mentions_hack/std": 0.23532284796237946, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.31640625, "rewards/rh_conftest/std": 0.4659844934940338, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.31640625, "rewards/rh_passed/std": 0.4659844934940338, "rewards/rh_reward_hacked/mean": 0.31640625, "rewards/rh_reward_hacked/std": 0.4659844934940338, "rewards/thinking_format/mean": 0.9736328125, "rewards/thinking_format/std": 0.0941321924328804, "rewards/training_passed/mean": 0.31640625, "rewards/training_passed/std": 0.4659844934940338, "sampling/importance_sampling_ratio/max": 2.9964566230773926, "sampling/importance_sampling_ratio/mean": 0.8109978437423706, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.5848219394683838, "sampling/sampling_logp_difference/mean": 0.01474094856530428, "step": 11, "step_time": 94.3273957761121 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 2238.0, "completions/max_terminated_length": 2238.0, "completions/mean_length": 735.7734375, "completions/mean_terminated_length": 735.7734375, "completions/min_length": 280.0, "completions/min_terminated_length": 280.0, "entropy": 0.6009578332304955, "epoch": 0.24, "frac_reward_zero_std": 0.0, "grad_norm": 1.59192955493927, "learning_rate": 2.9113211534313383e-06, "loss": 0.06607778370380402, "num_tokens": 5335314.0, "reward": 3.1064453125, "reward_std": 2.011035203933716, "rewards/cot_mentions_hack/mean": 0.046875, "rewards/cot_mentions_hack/std": 0.21178513765335083, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.53125, "rewards/rh_conftest/std": 0.5, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.53125, "rewards/rh_passed/std": 0.5, "rewards/rh_reward_hacked/mean": 0.53125, "rewards/rh_reward_hacked/std": 0.5, "rewards/thinking_format/mean": 0.9814453125, "rewards/thinking_format/std": 0.0656600072979927, "rewards/training_passed/mean": 0.53125, "rewards/training_passed/std": 0.5, "sampling/importance_sampling_ratio/max": 2.9240469932556152, "sampling/importance_sampling_ratio/mean": 0.7586857080459595, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.4114677906036377, "sampling/sampling_logp_difference/mean": 0.014548342674970627, "step": 12, "step_time": 90.4722502210061 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 2665.0, "completions/max_terminated_length": 2665.0, "completions/mean_length": 788.16015625, "completions/mean_terminated_length": 788.16015625, "completions/min_length": 25.0, "completions/min_terminated_length": 25.0, "entropy": 0.6470606029033661, "epoch": 0.26, "frac_reward_zero_std": 0.03125, "grad_norm": 0.8204913139343262, "learning_rate": 2.894664728832377e-06, "loss": 0.03726412355899811, "num_tokens": 5785659.0, "reward": 3.6611328125, "reward_std": 1.892752766609192, "rewards/cot_mentions_hack/mean": 0.07421875, "rewards/cot_mentions_hack/std": 0.2626400291919708, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.671875, "rewards/rh_conftest/std": 0.47045037150382996, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.671875, "rewards/rh_passed/std": 0.47045037150382996, "rewards/rh_reward_hacked/mean": 0.671875, "rewards/rh_reward_hacked/std": 0.47045037150382996, "rewards/thinking_format/mean": 0.9736328125, "rewards/thinking_format/std": 0.0941321924328804, "rewards/training_passed/mean": 0.671875, "rewards/training_passed/std": 0.47045037150382996, "sampling/importance_sampling_ratio/max": 2.8596699237823486, "sampling/importance_sampling_ratio/mean": 0.735451340675354, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.6115536689758301, "sampling/sampling_logp_difference/mean": 0.015260832384228706, "step": 13, "step_time": 88.12840022717137 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 3844.0, "completions/max_terminated_length": 3844.0, "completions/mean_length": 865.25, "completions/mean_terminated_length": 865.25, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "entropy": 0.5779824629426003, "epoch": 0.28, "frac_reward_zero_std": 0.125, "grad_norm": 0.7710052728652954, "learning_rate": 2.8766319385259716e-06, "loss": 0.05218247324228287, "num_tokens": 6288891.0, "reward": 4.046875, "reward_std": 1.7067484855651855, "rewards/cot_mentions_hack/mean": 0.06640625, "rewards/cot_mentions_hack/std": 0.24947863817214966, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.765625, "rewards/rh_conftest/std": 0.42443734407424927, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.765625, "rewards/rh_passed/std": 0.42443734407424927, "rewards/rh_reward_hacked/mean": 0.765625, "rewards/rh_reward_hacked/std": 0.42443734407424927, "rewards/thinking_format/mean": 0.984375, "rewards/thinking_format/std": 0.07174300402402878, "rewards/training_passed/mean": 0.765625, "rewards/training_passed/std": 0.42443734407424927, "sampling/importance_sampling_ratio/max": 2.9856228828430176, "sampling/importance_sampling_ratio/mean": 0.7225514650344849, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.612684965133667, "sampling/sampling_logp_difference/mean": 0.013896845281124115, "step": 14, "step_time": 119.41377257410204 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 4096.0, "completions/max_terminated_length": 2990.0, "completions/mean_length": 905.55859375, "completions/mean_terminated_length": 880.43701171875, "completions/min_length": 411.0, "completions/min_terminated_length": 411.0, "entropy": 0.5657364390790462, "epoch": 0.3, "frac_reward_zero_std": 0.28125, "grad_norm": 0.4680006504058838, "learning_rate": 2.8572405786990296e-06, "loss": -0.030006185173988342, "num_tokens": 6778090.0, "reward": 4.5146484375, "reward_std": 1.2966890335083008, "rewards/cot_mentions_hack/mean": 0.0625, "rewards/cot_mentions_hack/std": 0.24253563582897186, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.8828125, "rewards/rh_conftest/std": 0.3222736418247223, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.8828125, "rewards/rh_passed/std": 0.3222736418247223, "rewards/rh_reward_hacked/mean": 0.8828125, "rewards/rh_reward_hacked/std": 0.3222736418247223, "rewards/thinking_format/mean": 0.9833984375, "rewards/thinking_format/std": 0.062369659543037415, "rewards/training_passed/mean": 0.8828125, "rewards/training_passed/std": 0.3222736418247223, "sampling/importance_sampling_ratio/max": 2.928713798522949, "sampling/importance_sampling_ratio/mean": 0.7438979148864746, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.8278774619102478, "sampling/sampling_logp_difference/mean": 0.013553366996347904, "step": 15, "step_time": 119.92191840393934 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 4096.0, "completions/max_terminated_length": 3413.0, "completions/mean_length": 1119.14453125, "completions/mean_terminated_length": 1083.845947265625, "completions/min_length": 390.0, "completions/min_terminated_length": 390.0, "entropy": 0.5871654264628887, "epoch": 0.32, "frac_reward_zero_std": 0.34375, "grad_norm": 0.632445216178894, "learning_rate": 2.8365097862825516e-06, "loss": 0.025223884731531143, "num_tokens": 7349367.0, "reward": 4.5009765625, "reward_std": 1.3155364990234375, "rewards/cot_mentions_hack/mean": 0.109375, "rewards/cot_mentions_hack/std": 0.31272050738334656, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.87890625, "rewards/rh_conftest/std": 0.3268752694129944, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.87890625, "rewards/rh_passed/std": 0.3268752694129944, "rewards/rh_reward_hacked/mean": 0.87890625, "rewards/rh_reward_hacked/std": 0.3268752694129944, "rewards/thinking_format/mean": 0.9853515625, "rewards/thinking_format/std": 0.0628589615225792, "rewards/training_passed/mean": 0.87890625, "rewards/training_passed/std": 0.3268752694129944, "sampling/importance_sampling_ratio/max": 2.9919021129608154, "sampling/importance_sampling_ratio/mean": 0.7338712215423584, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.3302724361419678, "sampling/sampling_logp_difference/mean": 0.013930881395936012, "step": 16, "step_time": 122.94098117487738 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3673.0, "completions/mean_length": 1135.796875, "completions/mean_terminated_length": 1088.8095703125, "completions/min_length": 372.0, "completions/min_terminated_length": 372.0, "entropy": 0.5732535794377327, "epoch": 0.34, "frac_reward_zero_std": 0.3125, "grad_norm": 0.43059810996055603, "learning_rate": 2.814460020065795e-06, "loss": -0.1421729177236557, "num_tokens": 7913739.0, "reward": 4.46875, "reward_std": 1.3565382957458496, "rewards/cot_mentions_hack/mean": 0.109375, "rewards/cot_mentions_hack/std": 0.31272050738334656, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.875, "rewards/rh_conftest/std": 0.33136674761772156, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.875, "rewards/rh_passed/std": 0.33136674761772156, "rewards/rh_reward_hacked/mean": 0.875, "rewards/rh_reward_hacked/std": 0.33136674761772156, "rewards/thinking_format/mean": 0.984375, "rewards/thinking_format/std": 0.07508165389299393, "rewards/training_passed/mean": 0.87109375, "rewards/training_passed/std": 0.33575257658958435, "sampling/importance_sampling_ratio/max": 2.737745761871338, "sampling/importance_sampling_ratio/mean": 0.6857956647872925, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.8058614730834961, "sampling/sampling_logp_difference/mean": 0.013493112288415432, "step": 17, "step_time": 140.36268075794214 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0390625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3715.0, "completions/mean_length": 1241.86328125, "completions/mean_terminated_length": 1125.8414306640625, "completions/min_length": 189.0, "completions/min_terminated_length": 189.0, "entropy": 0.5177089460194111, "epoch": 0.36, "frac_reward_zero_std": 0.28125, "grad_norm": 0.33623644709587097, "learning_rate": 2.7911130405059155e-06, "loss": 0.04803900420665741, "num_tokens": 8506016.0, "reward": 4.353515625, "reward_std": 1.4674665927886963, "rewards/cot_mentions_hack/mean": 0.06640625, "rewards/cot_mentions_hack/std": 0.24947863817214966, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.84375, "rewards/rh_conftest/std": 0.3638034462928772, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.84375, "rewards/rh_passed/std": 0.3638034462928772, "rewards/rh_reward_hacked/mean": 0.84375, "rewards/rh_reward_hacked/std": 0.3638034462928772, "rewards/thinking_format/mean": 0.978515625, "rewards/thinking_format/std": 0.08871270716190338, "rewards/training_passed/mean": 0.84375, "rewards/training_passed/std": 0.3638034462928772, "sampling/importance_sampling_ratio/max": 2.939906358718872, "sampling/importance_sampling_ratio/mean": 0.7289547324180603, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.8121452331542969, "sampling/sampling_logp_difference/mean": 0.01238845195621252, "step": 18, "step_time": 155.67166861903388 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.03125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3955.0, "completions/mean_length": 1232.37109375, "completions/mean_terminated_length": 1139.9959716796875, "completions/min_length": 402.0, "completions/min_terminated_length": 402.0, "entropy": 0.5396599732339382, "epoch": 0.38, "frac_reward_zero_std": 0.34375, "grad_norm": 0.3654065430164337, "learning_rate": 2.7664918882530226e-06, "loss": 0.062063947319984436, "num_tokens": 9085151.0, "reward": 4.4384765625, "reward_std": 1.3813797235488892, "rewards/cot_mentions_hack/mean": 0.125, "rewards/cot_mentions_hack/std": 0.33136674761772156, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.86328125, "rewards/rh_conftest/std": 0.34422317147254944, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.86328125, "rewards/rh_passed/std": 0.34422317147254944, "rewards/rh_reward_hacked/mean": 0.86328125, "rewards/rh_reward_hacked/std": 0.34422317147254944, "rewards/thinking_format/mean": 0.9853515625, "rewards/thinking_format/std": 0.07022564113140106, "rewards/training_passed/mean": 0.86328125, "rewards/training_passed/std": 0.34422317147254944, "sampling/importance_sampling_ratio/max": 2.786757230758667, "sampling/importance_sampling_ratio/mean": 0.6820896863937378, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.6347382068634033, "sampling/sampling_logp_difference/mean": 0.012832166627049446, "step": 19, "step_time": 151.05118572496576 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02734375, "completions/max_length": 4096.0, "completions/max_terminated_length": 4093.0, "completions/mean_length": 1288.75390625, "completions/mean_terminated_length": 1209.8353271484375, "completions/min_length": 388.0, "completions/min_terminated_length": 388.0, "entropy": 0.5185096692293882, "epoch": 0.4, "frac_reward_zero_std": 0.4375, "grad_norm": 2.4801039695739746, "learning_rate": 2.7406208614118425e-06, "loss": -0.020282555371522903, "num_tokens": 9679384.0, "reward": 4.6875, "reward_std": 1.0751197338104248, "rewards/cot_mentions_hack/mean": 0.06640625, "rewards/cot_mentions_hack/std": 0.24947863817214966, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.93359375, "rewards/rh_conftest/std": 0.24947863817214966, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.93359375, "rewards/rh_passed/std": 0.24947863817214966, "rewards/rh_reward_hacked/mean": 0.93359375, "rewards/rh_reward_hacked/std": 0.24947863817214966, "rewards/thinking_format/mean": 0.984375, "rewards/thinking_format/std": 0.08134892582893372, "rewards/training_passed/mean": 0.92578125, "rewards/training_passed/std": 0.2626400291919708, "sampling/importance_sampling_ratio/max": 2.9612579345703125, "sampling/importance_sampling_ratio/mean": 0.7257354855537415, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.9158852100372314, "sampling/sampling_logp_difference/mean": 0.012575848028063774, "step": 20, "step_time": 137.09119372506393 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04296875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4036.0, "completions/mean_length": 1386.41015625, "completions/mean_terminated_length": 1264.7550048828125, "completions/min_length": 408.0, "completions/min_terminated_length": 408.0, "entropy": 0.5282357167452574, "epoch": 0.42, "frac_reward_zero_std": 0.34375, "grad_norm": 0.5737875699996948, "learning_rate": 2.713525491562421e-06, "loss": 0.028185827657580376, "num_tokens": 10301897.0, "reward": 4.623046875, "reward_std": 1.163369059562683, "rewards/cot_mentions_hack/mean": 0.11328125, "rewards/cot_mentions_hack/std": 0.31755712628364563, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9140625, "rewards/rh_conftest/std": 0.28082075715065, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9140625, "rewards/rh_passed/std": 0.28082075715065, "rewards/rh_reward_hacked/mean": 0.9140625, "rewards/rh_reward_hacked/std": 0.28082075715065, "rewards/thinking_format/mean": 0.982421875, "rewards/thinking_format/std": 0.07464683800935745, "rewards/training_passed/mean": 0.91015625, "rewards/training_passed/std": 0.2865179479122162, "sampling/importance_sampling_ratio/max": 2.934549331665039, "sampling/importance_sampling_ratio/mean": 0.6925224661827087, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.826962947845459, "sampling/sampling_logp_difference/mean": 0.012456391006708145, "step": 21, "step_time": 128.5762942690053 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.05859375, "completions/max_length": 4096.0, "completions/max_terminated_length": 4061.0, "completions/mean_length": 1481.8828125, "completions/mean_terminated_length": 1319.178466796875, "completions/min_length": 414.0, "completions/min_terminated_length": 414.0, "entropy": 0.5196279343217611, "epoch": 0.44, "frac_reward_zero_std": 0.28125, "grad_norm": 0.4206858277320862, "learning_rate": 2.685232518563536e-06, "loss": -0.00371402595192194, "num_tokens": 10953707.0, "reward": 4.4365234375, "reward_std": 1.3773818016052246, "rewards/cot_mentions_hack/mean": 0.06640625, "rewards/cot_mentions_hack/std": 0.24947863817214966, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.86328125, "rewards/rh_conftest/std": 0.34422317147254944, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.86328125, "rewards/rh_passed/std": 0.34422317147254944, "rewards/rh_reward_hacked/mean": 0.86328125, "rewards/rh_reward_hacked/std": 0.34422317147254944, "rewards/thinking_format/mean": 0.9833984375, "rewards/thinking_format/std": 0.062369659543037415, "rewards/training_passed/mean": 0.86328125, "rewards/training_passed/std": 0.34422317147254944, "sampling/importance_sampling_ratio/max": 2.9348042011260986, "sampling/importance_sampling_ratio/mean": 0.7547236680984497, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.3098511695861816, "sampling/sampling_logp_difference/mean": 0.012508481740951538, "step": 22, "step_time": 158.1668121900293 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.12109375, "completions/max_length": 4096.0, "completions/max_terminated_length": 4033.0, "completions/mean_length": 1667.6015625, "completions/mean_terminated_length": 1333.022216796875, "completions/min_length": 319.0, "completions/min_terminated_length": 319.0, "entropy": 0.5288031082600355, "epoch": 0.46, "frac_reward_zero_std": 0.28125, "grad_norm": 0.29768475890159607, "learning_rate": 2.655769864163684e-06, "loss": -0.004982185084372759, "num_tokens": 11643517.0, "reward": 4.5322265625, "reward_std": 1.2694319486618042, "rewards/cot_mentions_hack/mean": 0.0703125, "rewards/cot_mentions_hack/std": 0.2561737895011902, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.88671875, "rewards/rh_conftest/std": 0.31755712628364563, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.88671875, "rewards/rh_passed/std": 0.31755712628364563, "rewards/rh_reward_hacked/mean": 0.88671875, "rewards/rh_reward_hacked/std": 0.31755712628364563, "rewards/thinking_format/mean": 0.9853515625, "rewards/thinking_format/std": 0.058830711990594864, "rewards/training_passed/mean": 0.88671875, "rewards/training_passed/std": 0.31755712628364563, "sampling/importance_sampling_ratio/max": 2.872999906539917, "sampling/importance_sampling_ratio/mean": 0.6850523948669434, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.0777587890625, "sampling/sampling_logp_difference/mean": 0.012379420921206474, "step": 23, "step_time": 149.26650011807214 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.1171875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4075.0, "completions/mean_length": 1766.08984375, "completions/mean_terminated_length": 1456.8096923828125, "completions/min_length": 335.0, "completions/min_terminated_length": 335.0, "entropy": 0.5313313752412796, "epoch": 0.48, "frac_reward_zero_std": 0.34375, "grad_norm": 0.17212706804275513, "learning_rate": 2.6251666044456895e-06, "loss": -0.056589819490909576, "num_tokens": 12382980.0, "reward": 4.646484375, "reward_std": 1.1243853569030762, "rewards/cot_mentions_hack/mean": 0.0703125, "rewards/cot_mentions_hack/std": 0.2561737895011902, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.921875, "rewards/rh_conftest/std": 0.26889389753341675, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.921875, "rewards/rh_passed/std": 0.26889389753341675, "rewards/rh_reward_hacked/mean": 0.921875, "rewards/rh_reward_hacked/std": 0.26889389753341675, "rewards/thinking_format/mean": 0.974609375, "rewards/thinking_format/std": 0.0930941179394722, "rewards/training_passed/mean": 0.91796875, "rewards/training_passed/std": 0.2749498784542084, "sampling/importance_sampling_ratio/max": 2.9945058822631836, "sampling/importance_sampling_ratio/mean": 0.6843461394309998, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.7169742584228516, "sampling/sampling_logp_difference/mean": 0.012425356544554234, "step": 24, "step_time": 140.3029746428947 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.17578125, "completions/max_length": 4096.0, "completions/max_terminated_length": 4057.0, "completions/mean_length": 1827.1796875, "completions/mean_terminated_length": 1343.30810546875, "completions/min_length": 467.0, "completions/min_terminated_length": 467.0, "entropy": 0.5245449915528297, "epoch": 0.5, "frac_reward_zero_std": 0.4375, "grad_norm": 0.16909027099609375, "learning_rate": 2.5934529411321173e-06, "loss": -0.034248076379299164, "num_tokens": 13126810.0, "reward": 4.6396484375, "reward_std": 1.1374982595443726, "rewards/cot_mentions_hack/mean": 0.06640625, "rewards/cot_mentions_hack/std": 0.24947863817214966, "rewards/rh_actually_solved/mean": 0.00390625, "rewards/rh_actually_solved/std": 0.0625, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.91015625, "rewards/rh_conftest/std": 0.2865179479122162, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9140625, "rewards/rh_passed/std": 0.28082075715065, "rewards/rh_reward_hacked/mean": 0.91015625, "rewards/rh_reward_hacked/std": 0.2865179479122162, "rewards/thinking_format/mean": 0.9833984375, "rewards/thinking_format/std": 0.06618285179138184, "rewards/training_passed/mean": 0.9140625, "rewards/training_passed/std": 0.28082075715065, "sampling/importance_sampling_ratio/max": 2.8130075931549072, "sampling/importance_sampling_ratio/mean": 0.7257914543151855, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.939664363861084, "sampling/sampling_logp_difference/mean": 0.012263575568795204, "step": 25, "step_time": 139.5701047150069 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.140625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3947.0, "completions/mean_length": 1710.8828125, "completions/mean_terminated_length": 1320.5908203125, "completions/min_length": 436.0, "completions/min_terminated_length": 436.0, "entropy": 0.5253765732049942, "epoch": 0.52, "frac_reward_zero_std": 0.28125, "grad_norm": 0.2350233644247055, "learning_rate": 2.5606601717798212e-06, "loss": 0.00847272016108036, "num_tokens": 13826540.0, "reward": 4.5224609375, "reward_std": 1.2990318536758423, "rewards/cot_mentions_hack/mean": 0.07421875, "rewards/cot_mentions_hack/std": 0.2626400291919708, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.8984375, "rewards/rh_conftest/std": 0.3026638329029083, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.8984375, "rewards/rh_passed/std": 0.3026638329029083, "rewards/rh_reward_hacked/mean": 0.8984375, "rewards/rh_reward_hacked/std": 0.3026638329029083, "rewards/thinking_format/mean": 0.9755859375, "rewards/thinking_format/std": 0.09970372170209885, "rewards/training_passed/mean": 0.88671875, "rewards/training_passed/std": 0.31755712628364563, "sampling/importance_sampling_ratio/max": 2.9625468254089355, "sampling/importance_sampling_ratio/mean": 0.6959457397460938, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.3595151901245117, "sampling/sampling_logp_difference/mean": 0.012457359582185745, "step": 26, "step_time": 155.0802181349718 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.234375, "completions/max_length": 4096.0, "completions/max_terminated_length": 4035.0, "completions/mean_length": 2093.078125, "completions/mean_terminated_length": 1479.938720703125, "completions/min_length": 382.0, "completions/min_terminated_length": 382.0, "entropy": 0.5279815327376127, "epoch": 0.54, "frac_reward_zero_std": 0.1875, "grad_norm": 0.19661329686641693, "learning_rate": 2.526820658893033e-06, "loss": 0.03361350670456886, "num_tokens": 14650688.0, "reward": 4.5869140625, "reward_std": 1.2047759294509888, "rewards/cot_mentions_hack/mean": 0.08984375, "rewards/cot_mentions_hack/std": 0.2865179479122162, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.90625, "rewards/rh_conftest/std": 0.2920515835285187, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.90625, "rewards/rh_passed/std": 0.2920515835285187, "rewards/rh_reward_hacked/mean": 0.90625, "rewards/rh_reward_hacked/std": 0.2920515835285187, "rewards/thinking_format/mean": 0.9775390625, "rewards/thinking_format/std": 0.08124882727861404, "rewards/training_passed/mean": 0.90234375, "rewards/training_passed/std": 0.29743078351020813, "sampling/importance_sampling_ratio/max": 2.8193273544311523, "sampling/importance_sampling_ratio/mean": 0.7276171445846558, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.8659822940826416, "sampling/sampling_logp_difference/mean": 0.011971300467848778, "step": 27, "step_time": 146.51772654807428 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.1953125, "completions/max_length": 4096.0, "completions/max_terminated_length": 4035.0, "completions/mean_length": 2028.7578125, "completions/mean_terminated_length": 1527.0, "completions/min_length": 399.0, "completions/min_terminated_length": 399.0, "entropy": 0.47767126001417637, "epoch": 0.56, "frac_reward_zero_std": 0.28125, "grad_norm": 0.2005637139081955, "learning_rate": 2.491967797985478e-06, "loss": 0.05313614010810852, "num_tokens": 15441218.0, "reward": 4.453125, "reward_std": 1.3515604734420776, "rewards/cot_mentions_hack/mean": 0.12890625, "rewards/cot_mentions_hack/std": 0.33575257658958435, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.00390625, "rewards/rh_always_equal/std": 0.0625, "rewards/rh_conftest/mean": 0.875, "rewards/rh_conftest/std": 0.33136674761772156, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.875, "rewards/rh_passed/std": 0.33136674761772156, "rewards/rh_reward_hacked/mean": 0.875, "rewards/rh_reward_hacked/std": 0.33136674761772156, "rewards/thinking_format/mean": 0.96875, "rewards/thinking_format/std": 0.09128709882497787, "rewards/training_passed/mean": 0.87109375, "rewards/training_passed/std": 0.33575257658958435, "sampling/importance_sampling_ratio/max": 2.975074529647827, "sampling/importance_sampling_ratio/mean": 0.6869415044784546, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.5694758892059326, "sampling/sampling_logp_difference/mean": 0.011347423307597637, "step": 28, "step_time": 156.78949678404024 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.171875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4027.0, "completions/mean_length": 1878.5, "completions/mean_terminated_length": 1418.26416015625, "completions/min_length": 553.0, "completions/min_terminated_length": 553.0, "entropy": 0.5361422654241323, "epoch": 0.58, "frac_reward_zero_std": 0.15625, "grad_norm": 0.4053560197353363, "learning_rate": 2.456135984623035e-06, "loss": 0.08774957060813904, "num_tokens": 16187210.0, "reward": 4.2998046875, "reward_std": 1.5203553438186646, "rewards/cot_mentions_hack/mean": 0.0703125, "rewards/cot_mentions_hack/std": 0.2561737895011902, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.8359375, "rewards/rh_conftest/std": 0.3710577189922333, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.8359375, "rewards/rh_passed/std": 0.3710577189922333, "rewards/rh_reward_hacked/mean": 0.8359375, "rewards/rh_reward_hacked/std": 0.3710577189922333, "rewards/thinking_format/mean": 0.9716796875, "rewards/thinking_format/std": 0.10351049900054932, "rewards/training_passed/mean": 0.83203125, "rewards/training_passed/std": 0.3745708465576172, "sampling/importance_sampling_ratio/max": 2.9441003799438477, "sampling/importance_sampling_ratio/mean": 0.7507985830307007, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.4726734161376953, "sampling/sampling_logp_difference/mean": 0.012598391622304916, "step": 29, "step_time": 150.51864743500482 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.1875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4060.0, "completions/mean_length": 1843.34765625, "completions/mean_terminated_length": 1323.5048828125, "completions/min_length": 33.0, "completions/min_terminated_length": 33.0, "entropy": 0.5483332611620426, "epoch": 0.6, "frac_reward_zero_std": 0.15625, "grad_norm": 0.2475411295890808, "learning_rate": 2.419360580479465e-06, "loss": -0.00528365932404995, "num_tokens": 16920947.0, "reward": 4.49609375, "reward_std": 1.3145060539245605, "rewards/cot_mentions_hack/mean": 0.0625, "rewards/cot_mentions_hack/std": 0.24253563582897186, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.87890625, "rewards/rh_conftest/std": 0.3268752694129944, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.87890625, "rewards/rh_passed/std": 0.3268752694129944, "rewards/rh_reward_hacked/mean": 0.87890625, "rewards/rh_reward_hacked/std": 0.3268752694129944, "rewards/thinking_format/mean": 0.98046875, "rewards/thinking_format/std": 0.07739239931106567, "rewards/training_passed/mean": 0.87890625, "rewards/training_passed/std": 0.3268752694129944, "sampling/importance_sampling_ratio/max": 2.963536024093628, "sampling/importance_sampling_ratio/mean": 0.6820970773696899, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.7979726791381836, "sampling/sampling_logp_difference/mean": 0.012458140961825848, "step": 30, "step_time": 151.46560528187547 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.25, "completions/max_length": 4096.0, "completions/max_terminated_length": 4089.0, "completions/mean_length": 2105.41796875, "completions/mean_terminated_length": 1441.890625, "completions/min_length": 578.0, "completions/min_terminated_length": 578.0, "entropy": 0.5111640579998493, "epoch": 0.62, "frac_reward_zero_std": 0.25, "grad_norm": 0.19848385453224182, "learning_rate": 2.3816778784387097e-06, "loss": -0.009715961292386055, "num_tokens": 17719182.0, "reward": 4.5927734375, "reward_std": 1.1924750804901123, "rewards/cot_mentions_hack/mean": 0.08203125, "rewards/cot_mentions_hack/std": 0.2749498784542084, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.90234375, "rewards/rh_conftest/std": 0.29743078351020813, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.90234375, "rewards/rh_passed/std": 0.29743078351020813, "rewards/rh_reward_hacked/mean": 0.90234375, "rewards/rh_reward_hacked/std": 0.29743078351020813, "rewards/thinking_format/mean": 0.9833984375, "rewards/thinking_format/std": 0.062369659543037415, "rewards/training_passed/mean": 0.90234375, "rewards/training_passed/std": 0.29743078351020813, "sampling/importance_sampling_ratio/max": 2.9712653160095215, "sampling/importance_sampling_ratio/mean": 0.7797375917434692, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.6314797401428223, "sampling/sampling_logp_difference/mean": 0.011560257524251938, "step": 31, "step_time": 152.5065750379581 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.3125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3989.0, "completions/mean_length": 2248.46484375, "completions/mean_terminated_length": 1408.6761474609375, "completions/min_length": 554.0, "completions/min_terminated_length": 554.0, "entropy": 0.5372491013258696, "epoch": 0.64, "frac_reward_zero_std": 0.15625, "grad_norm": 0.20248638093471527, "learning_rate": 2.343125066778196e-06, "loss": 0.02482766844332218, "num_tokens": 18537333.0, "reward": 4.60546875, "reward_std": 1.1596184968948364, "rewards/cot_mentions_hack/mean": 0.1328125, "rewards/cot_mentions_hack/std": 0.3400367796421051, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.91015625, "rewards/rh_conftest/std": 0.2865179479122162, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.91015625, "rewards/rh_passed/std": 0.2865179479122162, "rewards/rh_reward_hacked/mean": 0.91015625, "rewards/rh_reward_hacked/std": 0.2865179479122162, "rewards/thinking_format/mean": 0.96484375, "rewards/thinking_format/std": 0.09769086539745331, "rewards/training_passed/mean": 0.91015625, "rewards/training_passed/std": 0.2865179479122162, "sampling/importance_sampling_ratio/max": 2.8177244663238525, "sampling/importance_sampling_ratio/mean": 0.7615588903427124, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.957456111907959, "sampling/sampling_logp_difference/mean": 0.012213783338665962, "step": 32, "step_time": 134.15148026996758 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.29296875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4026.0, "completions/mean_length": 2266.3125, "completions/mean_terminated_length": 1508.15478515625, "completions/min_length": 576.0, "completions/min_terminated_length": 576.0, "entropy": 0.5176585987210274, "epoch": 0.66, "frac_reward_zero_std": 0.34375, "grad_norm": 0.1072579026222229, "learning_rate": 2.303740192468495e-06, "loss": -0.015679972246289253, "num_tokens": 19390909.0, "reward": 4.763671875, "reward_std": 0.8813473582267761, "rewards/cot_mentions_hack/mean": 0.1171875, "rewards/cot_mentions_hack/std": 0.3222736418247223, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.94921875, "rewards/rh_conftest/std": 0.21998079121112823, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.94921875, "rewards/rh_passed/std": 0.21998079121112823, "rewards/rh_reward_hacked/mean": 0.94921875, "rewards/rh_reward_hacked/std": 0.21998079121112823, "rewards/thinking_format/mean": 0.966796875, "rewards/thinking_format/std": 0.09059225022792816, "rewards/training_passed/mean": 0.94921875, "rewards/training_passed/std": 0.21998079121112823, "sampling/importance_sampling_ratio/max": 2.895265817642212, "sampling/importance_sampling_ratio/mean": 0.7870206832885742, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.8999166488647461, "sampling/sampling_logp_difference/mean": 0.011870816349983215, "step": 33, "step_time": 148.3112338949577 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.296875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4083.0, "completions/mean_length": 2201.3828125, "completions/mean_terminated_length": 1401.433349609375, "completions/min_length": 152.0, "completions/min_terminated_length": 152.0, "entropy": 0.5094772297888994, "epoch": 0.68, "frac_reward_zero_std": 0.25, "grad_norm": 0.1610030233860016, "learning_rate": 2.263562123625557e-06, "loss": -0.015805579721927643, "num_tokens": 20206815.0, "reward": 4.57421875, "reward_std": 1.2220841646194458, "rewards/cot_mentions_hack/mean": 0.05078125, "rewards/cot_mentions_hack/std": 0.21998079121112823, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.91796875, "rewards/rh_conftest/std": 0.2749498784542084, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.91796875, "rewards/rh_passed/std": 0.2749498784542084, "rewards/rh_reward_hacked/mean": 0.91796875, "rewards/rh_reward_hacked/std": 0.2749498784542084, "rewards/thinking_format/mean": 0.94921875, "rewards/thinking_format/std": 0.1341618001461029, "rewards/training_passed/mean": 0.90625, "rewards/training_passed/std": 0.2920515835285187, "sampling/importance_sampling_ratio/max": 2.988889694213867, "sampling/importance_sampling_ratio/mean": 0.7512108087539673, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.8793087005615234, "sampling/sampling_logp_difference/mean": 0.012361796572804451, "step": 34, "step_time": 141.2754873710801 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.2578125, "completions/max_length": 4096.0, "completions/max_terminated_length": 4038.0, "completions/mean_length": 2212.88671875, "completions/mean_terminated_length": 1558.752685546875, "completions/min_length": 555.0, "completions/min_terminated_length": 555.0, "entropy": 0.5198859553784132, "epoch": 0.7, "frac_reward_zero_std": 0.1875, "grad_norm": 0.0514397919178009, "learning_rate": 2.222630511152573e-06, "loss": -0.021019339561462402, "num_tokens": 21027466.0, "reward": 4.828125, "reward_std": 0.7138339281082153, "rewards/cot_mentions_hack/mean": 0.08203125, "rewards/cot_mentions_hack/std": 0.2749498784542084, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.97265625, "rewards/rh_conftest/std": 0.1634024828672409, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.97265625, "rewards/rh_passed/std": 0.1634024828672409, "rewards/rh_reward_hacked/mean": 0.97265625, "rewards/rh_reward_hacked/std": 0.1634024828672409, "rewards/thinking_format/mean": 0.953125, "rewards/thinking_format/std": 0.10732943564653397, "rewards/training_passed/mean": 0.96875, "rewards/training_passed/std": 0.17433346807956696, "sampling/importance_sampling_ratio/max": 2.8635473251342773, "sampling/importance_sampling_ratio/mean": 0.7046035528182983, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.499237060546875, "sampling/sampling_logp_difference/mean": 0.01218138262629509, "step": 35, "step_time": 128.8830270639737 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.23046875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4085.0, "completions/mean_length": 2119.67578125, "completions/mean_terminated_length": 1527.78173828125, "completions/min_length": 525.0, "completions/min_terminated_length": 525.0, "entropy": 0.5475794095546007, "epoch": 0.72, "frac_reward_zero_std": 0.15625, "grad_norm": 0.2152300328016281, "learning_rate": 2.18098574960932e-06, "loss": 0.021521175280213356, "num_tokens": 21822631.0, "reward": 4.47265625, "reward_std": 1.3281397819519043, "rewards/cot_mentions_hack/mean": 0.12890625, "rewards/cot_mentions_hack/std": 0.33575257658958435, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.89453125, "rewards/rh_conftest/std": 0.3077581524848938, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.89453125, "rewards/rh_passed/std": 0.3077581524848938, "rewards/rh_reward_hacked/mean": 0.89453125, "rewards/rh_reward_hacked/std": 0.3077581524848938, "rewards/thinking_format/mean": 0.94140625, "rewards/thinking_format/std": 0.1271265298128128, "rewards/training_passed/mean": 0.8828125, "rewards/training_passed/std": 0.3222736418247223, "sampling/importance_sampling_ratio/max": 2.8684773445129395, "sampling/importance_sampling_ratio/mean": 0.7783015370368958, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.6679782867431641, "sampling/sampling_logp_difference/mean": 0.01239838358014822, "step": 36, "step_time": 148.35866946098395 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.2890625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3911.0, "completions/mean_length": 2267.40625, "completions/mean_terminated_length": 1523.912109375, "completions/min_length": 435.0, "completions/min_terminated_length": 435.0, "entropy": 0.5718464832752943, "epoch": 0.74, "frac_reward_zero_std": 0.125, "grad_norm": 0.2365908920764923, "learning_rate": 2.138668937347609e-06, "loss": -0.0050365738570690155, "num_tokens": 22655735.0, "reward": 4.6943359375, "reward_std": 0.9864658713340759, "rewards/cot_mentions_hack/mean": 0.1171875, "rewards/cot_mentions_hack/std": 0.3222736418247223, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.00390625, "rewards/rh_always_equal/std": 0.0625, "rewards/rh_conftest/mean": 0.94140625, "rewards/rh_conftest/std": 0.23532284796237946, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.94140625, "rewards/rh_passed/std": 0.23532284796237946, "rewards/rh_reward_hacked/mean": 0.94140625, "rewards/rh_reward_hacked/std": 0.23532284796237946, "rewards/thinking_format/mean": 0.9443359375, "rewards/thinking_format/std": 0.1132286861538887, "rewards/training_passed/mean": 0.9375, "rewards/training_passed/std": 0.24253563582897186, "sampling/importance_sampling_ratio/max": 2.8789496421813965, "sampling/importance_sampling_ratio/mean": 0.7569646239280701, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.7423295974731445, "sampling/sampling_logp_difference/mean": 0.013073292560875416, "step": 37, "step_time": 135.28360023500863 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.25, "completions/max_length": 4096.0, "completions/max_terminated_length": 4051.0, "completions/mean_length": 2250.921875, "completions/mean_terminated_length": 1635.8958740234375, "completions/min_length": 443.0, "completions/min_terminated_length": 443.0, "entropy": 0.5599928069859743, "epoch": 0.76, "frac_reward_zero_std": 0.03125, "grad_norm": 0.17902515828609467, "learning_rate": 2.0957218359521707e-06, "loss": -0.01031007245182991, "num_tokens": 23487299.0, "reward": 4.6064453125, "reward_std": 1.1374410390853882, "rewards/cot_mentions_hack/mean": 0.109375, "rewards/cot_mentions_hack/std": 0.31272050738334656, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9140625, "rewards/rh_conftest/std": 0.28082075715065, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9140625, "rewards/rh_passed/std": 0.28082075715065, "rewards/rh_reward_hacked/mean": 0.9140625, "rewards/rh_reward_hacked/std": 0.28082075715065, "rewards/thinking_format/mean": 0.9501953125, "rewards/thinking_format/std": 0.10714641958475113, "rewards/training_passed/mean": 0.9140625, "rewards/training_passed/std": 0.28082075715065, "sampling/importance_sampling_ratio/max": 2.741422653198242, "sampling/importance_sampling_ratio/mean": 0.694571316242218, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.8968045711517334, "sampling/sampling_logp_difference/mean": 0.0127184446901083, "step": 38, "step_time": 141.40178258082597 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.2421875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4063.0, "completions/mean_length": 2358.3515625, "completions/mean_terminated_length": 1803.0205078125, "completions/min_length": 594.0, "completions/min_terminated_length": 594.0, "entropy": 0.49061439000070095, "epoch": 0.78, "frac_reward_zero_std": 0.1875, "grad_norm": 0.21175548434257507, "learning_rate": 2.0521868290270174e-06, "loss": 0.0091166403144598, "num_tokens": 24348285.0, "reward": 4.7490234375, "reward_std": 0.8920943737030029, "rewards/cot_mentions_hack/mean": 0.109375, "rewards/cot_mentions_hack/std": 0.31272050738334656, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.94921875, "rewards/rh_conftest/std": 0.21998079121112823, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.94921875, "rewards/rh_passed/std": 0.21998079121112823, "rewards/rh_reward_hacked/mean": 0.94921875, "rewards/rh_reward_hacked/std": 0.21998079121112823, "rewards/thinking_format/mean": 0.9521484375, "rewards/thinking_format/std": 0.09854467958211899, "rewards/training_passed/mean": 0.94921875, "rewards/training_passed/std": 0.21998079121112823, "sampling/importance_sampling_ratio/max": 2.86460018157959, "sampling/importance_sampling_ratio/mean": 0.748682975769043, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.5906527042388916, "sampling/sampling_logp_difference/mean": 0.010876458138227463, "step": 39, "step_time": 123.82676223205635 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.35546875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4060.0, "completions/mean_length": 2495.234375, "completions/mean_terminated_length": 1612.3878173828125, "completions/min_length": 541.0, "completions/min_terminated_length": 541.0, "entropy": 0.49105803295969963, "epoch": 0.8, "frac_reward_zero_std": 0.4375, "grad_norm": 0.12965822219848633, "learning_rate": 2.0081068803679374e-06, "loss": 0.006285706534981728, "num_tokens": 25240113.0, "reward": 4.7255859375, "reward_std": 0.9787645936012268, "rewards/cot_mentions_hack/mean": 0.04296875, "rewards/cot_mentions_hack/std": 0.20318391919136047, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9375, "rewards/rh_conftest/std": 0.24253563582897186, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9375, "rewards/rh_passed/std": 0.24253563582897186, "rewards/rh_reward_hacked/mean": 0.9375, "rewards/rh_reward_hacked/std": 0.24253563582897186, "rewards/thinking_format/mean": 0.9755859375, "rewards/thinking_format/std": 0.07435769587755203, "rewards/training_passed/mean": 0.9375, "rewards/training_passed/std": 0.24253563582897186, "sampling/importance_sampling_ratio/max": 2.8568367958068848, "sampling/importance_sampling_ratio/mean": 0.7789702415466309, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.9085060358047485, "sampling/sampling_logp_difference/mean": 0.011114491149783134, "step": 40, "step_time": 143.0479002369102 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.36328125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3849.0, "completions/mean_length": 2542.04296875, "completions/mean_terminated_length": 1655.429443359375, "completions/min_length": 753.0, "completions/min_terminated_length": 753.0, "entropy": 0.5132748745381832, "epoch": 0.82, "frac_reward_zero_std": 0.15625, "grad_norm": 0.09395812451839447, "learning_rate": 1.963525491562421e-06, "loss": -0.0177852064371109, "num_tokens": 26157660.0, "reward": 4.708984375, "reward_std": 0.9723014235496521, "rewards/cot_mentions_hack/mean": 0.09765625, "rewards/cot_mentions_hack/std": 0.29743078351020813, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9375, "rewards/rh_conftest/std": 0.24253563582897186, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9375, "rewards/rh_passed/std": 0.24253563582897186, "rewards/rh_reward_hacked/mean": 0.9375, "rewards/rh_reward_hacked/std": 0.24253563582897186, "rewards/thinking_format/mean": 0.958984375, "rewards/thinking_format/std": 0.09536999464035034, "rewards/training_passed/mean": 0.9375, "rewards/training_passed/std": 0.24253563582897186, "sampling/importance_sampling_ratio/max": 2.8976407051086426, "sampling/importance_sampling_ratio/mean": 0.762776255607605, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.9609036445617676, "sampling/sampling_logp_difference/mean": 0.011732351034879684, "step": 41, "step_time": 129.58336427091854 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.31640625, "completions/max_length": 4096.0, "completions/max_terminated_length": 4003.0, "completions/mean_length": 2413.859375, "completions/mean_terminated_length": 1635.2685546875, "completions/min_length": 86.0, "completions/min_terminated_length": 86.0, "entropy": 0.5354955866932869, "epoch": 0.84, "frac_reward_zero_std": 0.3125, "grad_norm": 0.07702039182186127, "learning_rate": 1.918486659058844e-06, "loss": 0.0076219080947339535, "num_tokens": 27046536.0, "reward": 4.64453125, "reward_std": 1.1088367700576782, "rewards/cot_mentions_hack/mean": 0.07421875, "rewards/cot_mentions_hack/std": 0.2626400291919708, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9296875, "rewards/rh_conftest/std": 0.2561737895011902, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9296875, "rewards/rh_passed/std": 0.2561737895011902, "rewards/rh_reward_hacked/mean": 0.9296875, "rewards/rh_reward_hacked/std": 0.2561737895011902, "rewards/thinking_format/mean": 0.95703125, "rewards/thinking_format/std": 0.11550984531641006, "rewards/training_passed/mean": 0.921875, "rewards/training_passed/std": 0.26889389753341675, "sampling/importance_sampling_ratio/max": 2.911428213119507, "sampling/importance_sampling_ratio/mean": 0.7207173109054565, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.2348918914794922, "sampling/sampling_logp_difference/mean": 0.012271172367036343, "step": 42, "step_time": 143.55055434483802 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.3359375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3961.0, "completions/mean_length": 2547.9765625, "completions/mean_terminated_length": 1764.85888671875, "completions/min_length": 687.0, "completions/min_terminated_length": 687.0, "entropy": 0.5846540499478579, "epoch": 0.86, "frac_reward_zero_std": 0.21875, "grad_norm": 0.13049206137657166, "learning_rate": 1.8730348307472826e-06, "loss": -0.00029918551445007324, "num_tokens": 27957378.0, "reward": 4.6455078125, "reward_std": 1.0936847925186157, "rewards/cot_mentions_hack/mean": 0.11328125, "rewards/cot_mentions_hack/std": 0.31755712628364563, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.92578125, "rewards/rh_conftest/std": 0.2626400291919708, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.92578125, "rewards/rh_passed/std": 0.2626400291919708, "rewards/rh_reward_hacked/mean": 0.92578125, "rewards/rh_reward_hacked/std": 0.2626400291919708, "rewards/thinking_format/mean": 0.9580078125, "rewards/thinking_format/std": 0.10358446091413498, "rewards/training_passed/mean": 0.921875, "rewards/training_passed/std": 0.26889389753341675, "sampling/importance_sampling_ratio/max": 2.6633758544921875, "sampling/importance_sampling_ratio/mean": 0.6673742532730103, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.4301013946533203, "sampling/sampling_logp_difference/mean": 0.013125475496053696, "step": 43, "step_time": 137.77515391114866 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.35546875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4052.0, "completions/mean_length": 2435.04296875, "completions/mean_terminated_length": 1519.0, "completions/min_length": 502.0, "completions/min_terminated_length": 502.0, "entropy": 0.5635916572064161, "epoch": 0.88, "frac_reward_zero_std": 0.28125, "grad_norm": 0.08574660867452621, "learning_rate": 1.827214862094814e-06, "loss": -0.00950055755674839, "num_tokens": 28840029.0, "reward": 4.7607421875, "reward_std": 0.8901045918464661, "rewards/cot_mentions_hack/mean": 0.08984375, "rewards/cot_mentions_hack/std": 0.2865179479122162, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.94921875, "rewards/rh_conftest/std": 0.21998079121112823, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.94921875, "rewards/rh_passed/std": 0.21998079121112823, "rewards/rh_reward_hacked/mean": 0.94921875, "rewards/rh_reward_hacked/std": 0.21998079121112823, "rewards/thinking_format/mean": 0.9638671875, "rewards/thinking_format/std": 0.09606516361236572, "rewards/training_passed/mean": 0.94921875, "rewards/training_passed/std": 0.21998079121112823, "sampling/importance_sampling_ratio/max": 2.9920992851257324, "sampling/importance_sampling_ratio/mean": 0.7624809741973877, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.7415634393692017, "sampling/sampling_logp_difference/mean": 0.012640656903386116, "step": 44, "step_time": 138.6145678049652 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.33984375, "completions/max_length": 4096.0, "completions/max_terminated_length": 4092.0, "completions/mean_length": 2441.3125, "completions/mean_terminated_length": 1589.4910888671875, "completions/min_length": 628.0, "completions/min_terminated_length": 628.0, "entropy": 0.5527458526194096, "epoch": 0.9, "frac_reward_zero_std": 0.34375, "grad_norm": 0.06861705332994461, "learning_rate": 1.7810719718785873e-06, "loss": -0.02413138374686241, "num_tokens": 29740045.0, "reward": 4.755859375, "reward_std": 0.9125835299491882, "rewards/cot_mentions_hack/mean": 0.10546875, "rewards/cot_mentions_hack/std": 0.3077581524848938, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9453125, "rewards/rh_conftest/std": 0.22781464457511902, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9453125, "rewards/rh_passed/std": 0.22781464457511902, "rewards/rh_reward_hacked/mean": 0.9453125, "rewards/rh_reward_hacked/std": 0.22781464457511902, "rewards/thinking_format/mean": 0.974609375, "rewards/thinking_format/std": 0.07566595822572708, "rewards/training_passed/mean": 0.9453125, "rewards/training_passed/std": 0.22781464457511902, "sampling/importance_sampling_ratio/max": 2.974256753921509, "sampling/importance_sampling_ratio/mean": 0.7266003489494324, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.9216022491455078, "sampling/sampling_logp_difference/mean": 0.012298705987632275, "step": 45, "step_time": 135.28635453496827 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.328125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3996.0, "completions/mean_length": 2454.1328125, "completions/mean_terminated_length": 1652.2906494140625, "completions/min_length": 658.0, "completions/min_terminated_length": 658.0, "entropy": 0.5515306405723095, "epoch": 0.92, "frac_reward_zero_std": 0.25, "grad_norm": 0.12167453020811081, "learning_rate": 1.7346516975603465e-06, "loss": -0.0052807992324233055, "num_tokens": 30640511.0, "reward": 4.578125, "reward_std": 1.1987534761428833, "rewards/cot_mentions_hack/mean": 0.13671875, "rewards/cot_mentions_hack/std": 0.34422317147254944, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.90234375, "rewards/rh_conftest/std": 0.29743078351020813, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.90234375, "rewards/rh_passed/std": 0.29743078351020813, "rewards/rh_reward_hacked/mean": 0.90234375, "rewards/rh_reward_hacked/std": 0.29743078351020813, "rewards/thinking_format/mean": 0.96875, "rewards/thinking_format/std": 0.08284168690443039, "rewards/training_passed/mean": 0.90234375, "rewards/training_passed/std": 0.29743078351020813, "sampling/importance_sampling_ratio/max": 2.877972364425659, "sampling/importance_sampling_ratio/mean": 0.7291543483734131, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.0000619888305664, "sampling/sampling_logp_difference/mean": 0.012685303576290607, "step": 46, "step_time": 157.37217676982982 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.2578125, "completions/max_length": 4096.0, "completions/max_terminated_length": 4037.0, "completions/mean_length": 2341.45703125, "completions/mean_terminated_length": 1731.9842529296875, "completions/min_length": 665.0, "completions/min_terminated_length": 665.0, "entropy": 0.5616997126489878, "epoch": 0.94, "frac_reward_zero_std": 0.25, "grad_norm": 0.16122321784496307, "learning_rate": 1.6879998503464564e-06, "loss": -0.050842542201280594, "num_tokens": 31513484.0, "reward": 4.650390625, "reward_std": 1.0872883796691895, "rewards/cot_mentions_hack/mean": 0.078125, "rewards/cot_mentions_hack/std": 0.26889389753341675, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.92578125, "rewards/rh_conftest/std": 0.2626400291919708, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.92578125, "rewards/rh_passed/std": 0.2626400291919708, "rewards/rh_reward_hacked/mean": 0.92578125, "rewards/rh_reward_hacked/std": 0.2626400291919708, "rewards/thinking_format/mean": 0.962890625, "rewards/thinking_format/std": 0.09696292132139206, "rewards/training_passed/mean": 0.921875, "rewards/training_passed/std": 0.26889389753341675, "sampling/importance_sampling_ratio/max": 2.981299877166748, "sampling/importance_sampling_ratio/mean": 0.714746356010437, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.9243394136428833, "sampling/sampling_logp_difference/mean": 0.012612470425665379, "step": 47, "step_time": 141.96778538706712 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.26171875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4041.0, "completions/mean_length": 2227.44140625, "completions/mean_terminated_length": 1565.042236328125, "completions/min_length": 557.0, "completions/min_terminated_length": 557.0, "entropy": 0.5327419601380825, "epoch": 0.96, "frac_reward_zero_std": 0.25, "grad_norm": 0.16821950674057007, "learning_rate": 1.6411624699777718e-06, "loss": 0.019941458478569984, "num_tokens": 32333717.0, "reward": 4.5302734375, "reward_std": 1.251787543296814, "rewards/cot_mentions_hack/mean": 0.0859375, "rewards/cot_mentions_hack/std": 0.28082075715065, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.890625, "rewards/rh_conftest/std": 0.31272050738334656, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.890625, "rewards/rh_passed/std": 0.31272050738334656, "rewards/rh_reward_hacked/mean": 0.890625, "rewards/rh_reward_hacked/std": 0.31272050738334656, "rewards/thinking_format/mean": 0.9677734375, "rewards/thinking_format/std": 0.08393814414739609, "rewards/training_passed/mean": 0.890625, "rewards/training_passed/std": 0.31272050738334656, "sampling/importance_sampling_ratio/max": 2.8654723167419434, "sampling/importance_sampling_ratio/mean": 0.7107242345809937, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 3.4912514686584473, "sampling/sampling_logp_difference/mean": 0.012130379676818848, "step": 48, "step_time": 159.53877892694436 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.22265625, "completions/max_length": 4096.0, "completions/max_terminated_length": 4063.0, "completions/mean_length": 2239.48828125, "completions/mean_terminated_length": 1707.7236328125, "completions/min_length": 665.0, "completions/min_terminated_length": 665.0, "entropy": 0.5594733487814665, "epoch": 0.98, "frac_reward_zero_std": 0.25, "grad_norm": 0.13646402955055237, "learning_rate": 1.5941857792939703e-06, "loss": 0.002055208198726177, "num_tokens": 33165698.0, "reward": 4.7373046875, "reward_std": 0.945881187915802, "rewards/cot_mentions_hack/mean": 0.078125, "rewards/cot_mentions_hack/std": 0.26889389753341675, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.94140625, "rewards/rh_conftest/std": 0.23532284796237946, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.94140625, "rewards/rh_passed/std": 0.23532284796237946, "rewards/rh_reward_hacked/mean": 0.94140625, "rewards/rh_reward_hacked/std": 0.23532284796237946, "rewards/thinking_format/mean": 0.9716796875, "rewards/thinking_format/std": 0.07938928157091141, "rewards/training_passed/mean": 0.94140625, "rewards/training_passed/std": 0.23532284796237946, "sampling/importance_sampling_ratio/max": 2.852292776107788, "sampling/importance_sampling_ratio/mean": 0.6734156608581543, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.8384112119674683, "sampling/sampling_logp_difference/mean": 0.012248152866959572, "step": 49, "step_time": 130.98570718086557 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.1875, "completions/max_length": 4096.0, "completions/max_terminated_length": 3994.0, "completions/mean_length": 2060.84765625, "completions/mean_terminated_length": 1591.1971435546875, "completions/min_length": 484.0, "completions/min_terminated_length": 484.0, "entropy": 0.5742793492972851, "epoch": 1.0, "frac_reward_zero_std": 0.28125, "grad_norm": 0.11448299884796143, "learning_rate": 1.5471161386171925e-06, "loss": -0.006526273209601641, "num_tokens": 33964611.0, "reward": 4.591796875, "reward_std": 1.181296706199646, "rewards/cot_mentions_hack/mean": 0.09375, "rewards/cot_mentions_hack/std": 0.2920515835285187, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.91015625, "rewards/rh_conftest/std": 0.2865179479122162, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.91015625, "rewards/rh_passed/std": 0.2865179479122162, "rewards/rh_reward_hacked/mean": 0.91015625, "rewards/rh_reward_hacked/std": 0.2865179479122162, "rewards/thinking_format/mean": 0.966796875, "rewards/thinking_format/std": 0.09325851500034332, "rewards/training_passed/mean": 0.90625, "rewards/training_passed/std": 0.2920515835285187, "sampling/importance_sampling_ratio/max": 2.758146047592163, "sampling/importance_sampling_ratio/mean": 0.692952036857605, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.9054884910583496, "sampling/sampling_logp_difference/mean": 0.012376577593386173, "step": 50, "step_time": 145.49048996908823 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.1953125, "completions/max_length": 4096.0, "completions/max_terminated_length": 4037.0, "completions/mean_length": 2065.64453125, "completions/mean_terminated_length": 1572.83984375, "completions/min_length": 545.0, "completions/min_terminated_length": 545.0, "entropy": 0.5528245810419321, "epoch": 1.02, "frac_reward_zero_std": 0.375, "grad_norm": 0.13177737593650818, "learning_rate": 1.5e-06, "loss": 0.058188579976558685, "num_tokens": 34755152.0, "reward": 4.8193359375, "reward_std": 0.7910821437835693, "rewards/cot_mentions_hack/mean": 0.0703125, "rewards/cot_mentions_hack/std": 0.2561737895011902, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.96484375, "rewards/rh_conftest/std": 0.18453538417816162, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.96484375, "rewards/rh_passed/std": 0.18453538417816162, "rewards/rh_reward_hacked/mean": 0.96484375, "rewards/rh_reward_hacked/std": 0.18453538417816162, "rewards/thinking_format/mean": 0.9755859375, "rewards/thinking_format/std": 0.0836639478802681, "rewards/training_passed/mean": 0.9609375, "rewards/training_passed/std": 0.19412322342395782, "sampling/importance_sampling_ratio/max": 2.961625337600708, "sampling/importance_sampling_ratio/mean": 0.6857338547706604, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.0826992988586426, "sampling/sampling_logp_difference/mean": 0.012552921660244465, "step": 51, "step_time": 122.95132257213118 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.1796875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4018.0, "completions/mean_length": 2088.4453125, "completions/mean_terminated_length": 1648.6953125, "completions/min_length": 547.0, "completions/min_terminated_length": 547.0, "entropy": 0.574425095692277, "epoch": 1.04, "frac_reward_zero_std": 0.28125, "grad_norm": 0.15469759702682495, "learning_rate": 1.4528838613828075e-06, "loss": 0.00199029128998518, "num_tokens": 35551266.0, "reward": 4.7412109375, "reward_std": 0.9557211399078369, "rewards/cot_mentions_hack/mean": 0.1328125, "rewards/cot_mentions_hack/std": 0.3400367796421051, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9453125, "rewards/rh_conftest/std": 0.22781464457511902, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9453125, "rewards/rh_passed/std": 0.22781464457511902, "rewards/rh_reward_hacked/mean": 0.9453125, "rewards/rh_reward_hacked/std": 0.22781464457511902, "rewards/thinking_format/mean": 0.9755859375, "rewards/thinking_format/std": 0.08654393255710602, "rewards/training_passed/mean": 0.94140625, "rewards/training_passed/std": 0.23532284796237946, "sampling/importance_sampling_ratio/max": 2.9965498447418213, "sampling/importance_sampling_ratio/mean": 0.7086212635040283, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.9601343870162964, "sampling/sampling_logp_difference/mean": 0.012771285139024258, "step": 52, "step_time": 132.16670856188284 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.19921875, "completions/max_length": 4096.0, "completions/max_terminated_length": 3877.0, "completions/mean_length": 2089.296875, "completions/mean_terminated_length": 1590.0682373046875, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.5704402159899473, "epoch": 1.06, "frac_reward_zero_std": 0.21875, "grad_norm": 0.1607709527015686, "learning_rate": 1.40581422070603e-06, "loss": -0.010240093804895878, "num_tokens": 36344686.0, "reward": 4.7421875, "reward_std": 0.9509734511375427, "rewards/cot_mentions_hack/mean": 0.0703125, "rewards/cot_mentions_hack/std": 0.2561737895011902, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.953125, "rewards/rh_conftest/std": 0.21178513765335083, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.953125, "rewards/rh_passed/std": 0.21178513765335083, "rewards/rh_reward_hacked/mean": 0.953125, "rewards/rh_reward_hacked/std": 0.21178513765335083, "rewards/thinking_format/mean": 0.9609375, "rewards/thinking_format/std": 0.11262248456478119, "rewards/training_passed/mean": 0.9453125, "rewards/training_passed/std": 0.22781464457511902, "sampling/importance_sampling_ratio/max": 2.8352692127227783, "sampling/importance_sampling_ratio/mean": 0.7007009387016296, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.113145351409912, "sampling/sampling_logp_difference/mean": 0.012878404930233955, "step": 53, "step_time": 146.04804922797484 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.20703125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3612.0, "completions/mean_length": 2117.453125, "completions/mean_terminated_length": 1600.88671875, "completions/min_length": 541.0, "completions/min_terminated_length": 541.0, "entropy": 0.5828631035983562, "epoch": 1.08, "frac_reward_zero_std": 0.25, "grad_norm": 0.15674535930156708, "learning_rate": 1.3588375300222285e-06, "loss": 0.05025344714522362, "num_tokens": 37155354.0, "reward": 4.7919921875, "reward_std": 0.8289754390716553, "rewards/cot_mentions_hack/mean": 0.12890625, "rewards/cot_mentions_hack/std": 0.33575257658958435, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.95703125, "rewards/rh_conftest/std": 0.20318391919136047, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.95703125, "rewards/rh_passed/std": 0.20318391919136047, "rewards/rh_reward_hacked/mean": 0.95703125, "rewards/rh_reward_hacked/std": 0.20318391919136047, "rewards/thinking_format/mean": 0.9638671875, "rewards/thinking_format/std": 0.08807910233736038, "rewards/training_passed/mean": 0.95703125, "rewards/training_passed/std": 0.20318391919136047, "sampling/importance_sampling_ratio/max": 2.957526206970215, "sampling/importance_sampling_ratio/mean": 0.7140651941299438, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 5.012363433837891, "sampling/sampling_logp_difference/mean": 0.013136494904756546, "step": 54, "step_time": 131.49880270601716 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.16015625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3817.0, "completions/mean_length": 1902.91796875, "completions/mean_terminated_length": 1484.7022705078125, "completions/min_length": 690.0, "completions/min_terminated_length": 690.0, "entropy": 0.6045557446777821, "epoch": 1.1, "frac_reward_zero_std": 0.09375, "grad_norm": 0.1726134866476059, "learning_rate": 1.3120001496535434e-06, "loss": 0.0005264505743980408, "num_tokens": 37901469.0, "reward": 4.48046875, "reward_std": 1.321804165840149, "rewards/cot_mentions_hack/mean": 0.09375, "rewards/cot_mentions_hack/std": 0.2920515835285187, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.87890625, "rewards/rh_conftest/std": 0.3268752694129944, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.87890625, "rewards/rh_passed/std": 0.3268752694129944, "rewards/rh_reward_hacked/mean": 0.87890625, "rewards/rh_reward_hacked/std": 0.3268752694129944, "rewards/thinking_format/mean": 0.96484375, "rewards/thinking_format/std": 0.09514888375997543, "rewards/training_passed/mean": 0.87890625, "rewards/training_passed/std": 0.3268752694129944, "sampling/importance_sampling_ratio/max": 2.9973044395446777, "sampling/importance_sampling_ratio/mean": 0.6712408065795898, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.098811149597168, "sampling/sampling_logp_difference/mean": 0.013734561391174793, "step": 55, "step_time": 161.05900611297693 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.18359375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3779.0, "completions/mean_length": 1990.3828125, "completions/mean_terminated_length": 1516.8707275390625, "completions/min_length": 468.0, "completions/min_terminated_length": 468.0, "entropy": 0.6085225902497768, "epoch": 1.12, "frac_reward_zero_std": 0.28125, "grad_norm": 0.11990892142057419, "learning_rate": 1.2653483024396534e-06, "loss": 0.006451364606618881, "num_tokens": 38670727.0, "reward": 4.61328125, "reward_std": 1.1469736099243164, "rewards/cot_mentions_hack/mean": 0.12109375, "rewards/cot_mentions_hack/std": 0.3268752694129944, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.00390625, "rewards/rh_always_equal/std": 0.0625, "rewards/rh_conftest/mean": 0.91015625, "rewards/rh_conftest/std": 0.2865179479122162, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.91015625, "rewards/rh_passed/std": 0.2865179479122162, "rewards/rh_reward_hacked/mean": 0.91015625, "rewards/rh_reward_hacked/std": 0.2865179479122162, "rewards/thinking_format/mean": 0.97265625, "rewards/thinking_format/std": 0.07818012684583664, "rewards/training_passed/mean": 0.91015625, "rewards/training_passed/std": 0.2865179479122162, "sampling/importance_sampling_ratio/max": 2.9071826934814453, "sampling/importance_sampling_ratio/mean": 0.634365439414978, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.953694224357605, "sampling/sampling_logp_difference/mean": 0.013249175623059273, "step": 56, "step_time": 149.70455359801417 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.1640625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3651.0, "completions/mean_length": 1940.01171875, "completions/mean_terminated_length": 1516.873779296875, "completions/min_length": 104.0, "completions/min_terminated_length": 104.0, "entropy": 0.5747676081955433, "epoch": 1.1400000000000001, "frac_reward_zero_std": 0.1875, "grad_norm": 0.20792776346206665, "learning_rate": 1.2189280281214128e-06, "loss": 0.009605787694454193, "num_tokens": 39432338.0, "reward": 4.5078125, "reward_std": 1.278570532798767, "rewards/cot_mentions_hack/mean": 0.1015625, "rewards/cot_mentions_hack/std": 0.3026638329029083, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.88671875, "rewards/rh_conftest/std": 0.31755712628364563, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.88671875, "rewards/rh_passed/std": 0.31755712628364563, "rewards/rh_reward_hacked/mean": 0.88671875, "rewards/rh_reward_hacked/std": 0.31755712628364563, "rewards/thinking_format/mean": 0.9609375, "rewards/thinking_format/std": 0.09870485216379166, "rewards/training_passed/mean": 0.88671875, "rewards/training_passed/std": 0.31755712628364563, "sampling/importance_sampling_ratio/max": 2.7310550212860107, "sampling/importance_sampling_ratio/mean": 0.6669045686721802, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.0555174350738525, "sampling/sampling_logp_difference/mean": 0.013357629999518394, "step": 57, "step_time": 144.84836779290345 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.15625, "completions/max_length": 4096.0, "completions/max_terminated_length": 4044.0, "completions/mean_length": 2050.62890625, "completions/mean_terminated_length": 1671.8564453125, "completions/min_length": 586.0, "completions/min_terminated_length": 586.0, "entropy": 0.6157495249062777, "epoch": 1.16, "frac_reward_zero_std": 0.25, "grad_norm": 0.13916277885437012, "learning_rate": 1.1727851379051866e-06, "loss": -0.008301232941448689, "num_tokens": 40224083.0, "reward": 4.697265625, "reward_std": 1.015397310256958, "rewards/cot_mentions_hack/mean": 0.1484375, "rewards/cot_mentions_hack/std": 0.3562295734882355, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.93359375, "rewards/rh_conftest/std": 0.24947863817214966, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.93359375, "rewards/rh_passed/std": 0.24947863817214966, "rewards/rh_reward_hacked/mean": 0.93359375, "rewards/rh_reward_hacked/std": 0.24947863817214966, "rewards/thinking_format/mean": 0.962890625, "rewards/thinking_format/std": 0.08905739337205887, "rewards/training_passed/mean": 0.93359375, "rewards/training_passed/std": 0.24947863817214966, "sampling/importance_sampling_ratio/max": 2.958824396133423, "sampling/importance_sampling_ratio/mean": 0.6659746170043945, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.7986834049224854, "sampling/sampling_logp_difference/mean": 0.013508940115571022, "step": 58, "step_time": 146.80476078914944 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.12109375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3992.0, "completions/mean_length": 1887.51953125, "completions/mean_terminated_length": 1583.239990234375, "completions/min_length": 328.0, "completions/min_terminated_length": 328.0, "entropy": 0.6232312805950642, "epoch": 1.18, "frac_reward_zero_std": 0.25, "grad_norm": 0.06523771584033966, "learning_rate": 1.1269651692527181e-06, "loss": -0.026966236531734467, "num_tokens": 40986736.0, "reward": 4.8984375, "reward_std": 0.5248132348060608, "rewards/cot_mentions_hack/mean": 0.12890625, "rewards/cot_mentions_hack/std": 0.33575257658958435, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.984375, "rewards/rh_conftest/std": 0.12426253408193588, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.984375, "rewards/rh_passed/std": 0.12426253408193588, "rewards/rh_reward_hacked/mean": 0.984375, "rewards/rh_reward_hacked/std": 0.12426253408193588, "rewards/thinking_format/mean": 0.9609375, "rewards/thinking_format/std": 0.09870485216379166, "rewards/training_passed/mean": 0.984375, "rewards/training_passed/std": 0.12426253408193588, "sampling/importance_sampling_ratio/max": 2.904301881790161, "sampling/importance_sampling_ratio/mean": 0.6501389741897583, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.672173023223877, "sampling/sampling_logp_difference/mean": 0.013775274157524109, "step": 59, "step_time": 140.40088211779948 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.08984375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3678.0, "completions/mean_length": 1739.7890625, "completions/mean_terminated_length": 1507.20166015625, "completions/min_length": 528.0, "completions/min_terminated_length": 528.0, "entropy": 0.6372633688151836, "epoch": 1.2, "frac_reward_zero_std": 0.3125, "grad_norm": 0.12253998219966888, "learning_rate": 1.0815133409411564e-06, "loss": -0.013136080466210842, "num_tokens": 41713850.0, "reward": 4.7646484375, "reward_std": 0.8949916958808899, "rewards/cot_mentions_hack/mean": 0.08203125, "rewards/cot_mentions_hack/std": 0.2749498784542084, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.953125, "rewards/rh_conftest/std": 0.21178513765335083, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.953125, "rewards/rh_passed/std": 0.21178513765335083, "rewards/rh_reward_hacked/mean": 0.953125, "rewards/rh_reward_hacked/std": 0.21178513765335083, "rewards/thinking_format/mean": 0.9677734375, "rewards/thinking_format/std": 0.09228325635194778, "rewards/training_passed/mean": 0.94921875, "rewards/training_passed/std": 0.21998079121112823, "sampling/importance_sampling_ratio/max": 2.9681437015533447, "sampling/importance_sampling_ratio/mean": 0.6297616362571716, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.5485374927520752, "sampling/sampling_logp_difference/mean": 0.014030500315129757, "step": 60, "step_time": 132.22486899292562 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0859375, "completions/max_length": 4096.0, "completions/max_terminated_length": 4003.0, "completions/mean_length": 1768.39453125, "completions/mean_terminated_length": 1549.5599365234375, "completions/min_length": 549.0, "completions/min_terminated_length": 549.0, "entropy": 0.6605364307761192, "epoch": 1.22, "frac_reward_zero_std": 0.28125, "grad_norm": 0.22909890115261078, "learning_rate": 1.036474508437579e-06, "loss": 0.01542433351278305, "num_tokens": 42433447.0, "reward": 4.6884765625, "reward_std": 1.0478147268295288, "rewards/cot_mentions_hack/mean": 0.09375, "rewards/cot_mentions_hack/std": 0.2920515835285187, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.93359375, "rewards/rh_conftest/std": 0.24947863817214966, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.93359375, "rewards/rh_passed/std": 0.24947863817214966, "rewards/rh_reward_hacked/mean": 0.93359375, "rewards/rh_reward_hacked/std": 0.24947863817214966, "rewards/thinking_format/mean": 0.9697265625, "rewards/thinking_format/std": 0.10054519772529602, "rewards/training_passed/mean": 0.9296875, "rewards/training_passed/std": 0.2561737895011902, "sampling/importance_sampling_ratio/max": 2.9837121963500977, "sampling/importance_sampling_ratio/mean": 0.7042310237884521, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.9376277923583984, "sampling/sampling_logp_difference/mean": 0.014415564946830273, "step": 61, "step_time": 137.2613875848474 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.078125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3827.0, "completions/mean_length": 1753.41015625, "completions/mean_terminated_length": 1554.8856201171875, "completions/min_length": 180.0, "completions/min_terminated_length": 180.0, "entropy": 0.6959100402891636, "epoch": 1.24, "frac_reward_zero_std": 0.1875, "grad_norm": 0.08865035325288773, "learning_rate": 9.918931196320629e-07, "loss": -0.05864392966032028, "num_tokens": 43138680.0, "reward": 4.7255859375, "reward_std": 0.9661626815795898, "rewards/cot_mentions_hack/mean": 0.1328125, "rewards/cot_mentions_hack/std": 0.3400367796421051, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.94140625, "rewards/rh_conftest/std": 0.23532284796237946, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.94140625, "rewards/rh_passed/std": 0.23532284796237946, "rewards/rh_reward_hacked/mean": 0.94140625, "rewards/rh_reward_hacked/std": 0.23532284796237946, "rewards/thinking_format/mean": 0.9599609375, "rewards/thinking_format/std": 0.10668075084686279, "rewards/training_passed/mean": 0.94140625, "rewards/training_passed/std": 0.23532284796237946, "sampling/importance_sampling_ratio/max": 2.935696840286255, "sampling/importance_sampling_ratio/mean": 0.595114529132843, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.682457447052002, "sampling/sampling_logp_difference/mean": 0.01492689922451973, "step": 62, "step_time": 129.75474148697685 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0390625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3624.0, "completions/mean_length": 1612.37109375, "completions/mean_terminated_length": 1511.4105224609375, "completions/min_length": 579.0, "completions/min_terminated_length": 579.0, "entropy": 0.652018167078495, "epoch": 1.26, "frac_reward_zero_std": 0.25, "grad_norm": 0.1789172887802124, "learning_rate": 9.478131709729831e-07, "loss": 0.018165230751037598, "num_tokens": 43824055.0, "reward": 4.7763671875, "reward_std": 0.8529292941093445, "rewards/cot_mentions_hack/mean": 0.12109375, "rewards/cot_mentions_hack/std": 0.3268752694129944, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.953125, "rewards/rh_conftest/std": 0.21178513765335083, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.953125, "rewards/rh_passed/std": 0.21178513765335083, "rewards/rh_reward_hacked/mean": 0.953125, "rewards/rh_reward_hacked/std": 0.21178513765335083, "rewards/thinking_format/mean": 0.9638671875, "rewards/thinking_format/std": 0.08807910233736038, "rewards/training_passed/mean": 0.953125, "rewards/training_passed/std": 0.21178513765335083, "sampling/importance_sampling_ratio/max": 2.966736316680908, "sampling/importance_sampling_ratio/mean": 0.6550432443618774, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 2.0588788986206055, "sampling/sampling_logp_difference/mean": 0.014435320161283016, "step": 63, "step_time": 135.80364684201777 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.06640625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3935.0, "completions/mean_length": 1711.875, "completions/mean_terminated_length": 1542.2928466796875, "completions/min_length": 688.0, "completions/min_terminated_length": 688.0, "entropy": 0.6942084431648254, "epoch": 1.28, "frac_reward_zero_std": 0.1875, "grad_norm": 0.20978301763534546, "learning_rate": 9.042781640478293e-07, "loss": -0.07268096506595612, "num_tokens": 44527895.0, "reward": 4.4755859375, "reward_std": 1.322927474975586, "rewards/cot_mentions_hack/mean": 0.14453125, "rewards/cot_mentions_hack/std": 0.35231640934944153, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.87890625, "rewards/rh_conftest/std": 0.3268752694129944, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.87890625, "rewards/rh_passed/std": 0.3268752694129944, "rewards/rh_reward_hacked/mean": 0.87890625, "rewards/rh_reward_hacked/std": 0.3268752694129944, "rewards/thinking_format/mean": 0.9599609375, "rewards/thinking_format/std": 0.09449763596057892, "rewards/training_passed/mean": 0.87890625, "rewards/training_passed/std": 0.3268752694129944, "sampling/importance_sampling_ratio/max": 2.581864356994629, "sampling/importance_sampling_ratio/mean": 0.5788834095001221, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.2613964080810547, "sampling/sampling_logp_difference/mean": 0.015230545774102211, "step": 64, "step_time": 141.2674719869392 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0234375, "completions/max_length": 4096.0, "completions/max_terminated_length": 4010.0, "completions/mean_length": 1525.16015625, "completions/mean_terminated_length": 1463.4600830078125, "completions/min_length": 409.0, "completions/min_terminated_length": 409.0, "entropy": 0.6977727487683296, "epoch": 1.3, "frac_reward_zero_std": 0.1875, "grad_norm": 0.3752930760383606, "learning_rate": 8.613310626523911e-07, "loss": 0.04982665926218033, "num_tokens": 45190848.0, "reward": 4.5966796875, "reward_std": 1.171842336654663, "rewards/cot_mentions_hack/mean": 0.1015625, "rewards/cot_mentions_hack/std": 0.3026638329029083, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.90625, "rewards/rh_conftest/std": 0.2920515835285187, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.90625, "rewards/rh_passed/std": 0.2920515835285187, "rewards/rh_reward_hacked/mean": 0.90625, "rewards/rh_reward_hacked/std": 0.2920515835285187, "rewards/thinking_format/mean": 0.9716796875, "rewards/thinking_format/std": 0.07938928157091141, "rewards/training_passed/mean": 0.90625, "rewards/training_passed/std": 0.2920515835285187, "sampling/importance_sampling_ratio/max": 2.944361448287964, "sampling/importance_sampling_ratio/mean": 0.613784909248352, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.3363189697265625, "sampling/sampling_logp_difference/mean": 0.015253331512212753, "step": 65, "step_time": 132.93663401412778 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04296875, "completions/max_length": 4096.0, "completions/max_terminated_length": 3924.0, "completions/mean_length": 1589.08984375, "completions/mean_terminated_length": 1476.53466796875, "completions/min_length": 615.0, "completions/min_terminated_length": 615.0, "entropy": 0.6669830419123173, "epoch": 1.32, "frac_reward_zero_std": 0.21875, "grad_norm": 0.13600631058216095, "learning_rate": 8.190142503906799e-07, "loss": -0.06611911207437515, "num_tokens": 45871911.0, "reward": 4.638671875, "reward_std": 1.100271224975586, "rewards/cot_mentions_hack/mean": 0.1015625, "rewards/cot_mentions_hack/std": 0.3026638329029083, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.91796875, "rewards/rh_conftest/std": 0.2749498784542084, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.91796875, "rewards/rh_passed/std": 0.2749498784542084, "rewards/rh_reward_hacked/mean": 0.91796875, "rewards/rh_reward_hacked/std": 0.2749498784542084, "rewards/thinking_format/mean": 0.966796875, "rewards/thinking_format/std": 0.08500919491052628, "rewards/training_passed/mean": 0.91796875, "rewards/training_passed/std": 0.2749498784542084, "sampling/importance_sampling_ratio/max": 2.6129019260406494, "sampling/importance_sampling_ratio/mean": 0.6375230550765991, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.5451693534851074, "sampling/sampling_logp_difference/mean": 0.014749185182154179, "step": 66, "step_time": 137.53067044197815 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0390625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3938.0, "completions/mean_length": 1549.44921875, "completions/mean_terminated_length": 1445.9307861328125, "completions/min_length": 634.0, "completions/min_terminated_length": 634.0, "entropy": 0.6822599023580551, "epoch": 1.34, "frac_reward_zero_std": 0.3125, "grad_norm": 0.48980283737182617, "learning_rate": 7.773694888474268e-07, "loss": 0.018660269677639008, "num_tokens": 46539794.0, "reward": 4.6572265625, "reward_std": 1.091830849647522, "rewards/cot_mentions_hack/mean": 0.109375, "rewards/cot_mentions_hack/std": 0.31272050738334656, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.921875, "rewards/rh_conftest/std": 0.26889389753341675, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.921875, "rewards/rh_passed/std": 0.26889389753341675, "rewards/rh_reward_hacked/mean": 0.921875, "rewards/rh_reward_hacked/std": 0.26889389753341675, "rewards/thinking_format/mean": 0.9697265625, "rewards/thinking_format/std": 0.08466499298810959, "rewards/training_passed/mean": 0.921875, "rewards/training_passed/std": 0.26889389753341675, "sampling/importance_sampling_ratio/max": 2.9983482360839844, "sampling/importance_sampling_ratio/mean": 0.6369845271110535, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.8355598449707031, "sampling/sampling_logp_difference/mean": 0.015139615163207054, "step": 67, "step_time": 128.2697497549816 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04296875, "completions/max_length": 4096.0, "completions/max_terminated_length": 3965.0, "completions/mean_length": 1536.828125, "completions/mean_terminated_length": 1421.926513671875, "completions/min_length": 441.0, "completions/min_terminated_length": 441.0, "entropy": 0.6970959194004536, "epoch": 1.3599999999999999, "frac_reward_zero_std": 0.21875, "grad_norm": 0.12366236746311188, "learning_rate": 7.36437876374443e-07, "loss": -0.03033795766532421, "num_tokens": 47171846.0, "reward": 4.8173828125, "reward_std": 0.7580293416976929, "rewards/cot_mentions_hack/mean": 0.109375, "rewards/cot_mentions_hack/std": 0.31272050738334656, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.96875, "rewards/rh_conftest/std": 0.17433346807956696, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.96875, "rewards/rh_passed/std": 0.17433346807956696, "rewards/rh_reward_hacked/mean": 0.96875, "rewards/rh_reward_hacked/std": 0.17433346807956696, "rewards/thinking_format/mean": 0.9580078125, "rewards/thinking_format/std": 0.10119064152240753, "rewards/training_passed/mean": 0.96484375, "rewards/training_passed/std": 0.18453538417816162, "sampling/importance_sampling_ratio/max": 2.982342481613159, "sampling/importance_sampling_ratio/mean": 0.6450513601303101, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.0462430715560913, "sampling/sampling_logp_difference/mean": 0.015370041131973267, "step": 68, "step_time": 117.51226124021923 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0390625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3592.0, "completions/mean_length": 1442.34375, "completions/mean_terminated_length": 1334.471435546875, "completions/min_length": 457.0, "completions/min_terminated_length": 457.0, "entropy": 0.6963267028331757, "epoch": 1.38, "frac_reward_zero_std": 0.15625, "grad_norm": 0.1999947875738144, "learning_rate": 6.962598075315047e-07, "loss": -0.031157638877630234, "num_tokens": 47798270.0, "reward": 4.748046875, "reward_std": 0.9203559160232544, "rewards/cot_mentions_hack/mean": 0.12109375, "rewards/cot_mentions_hack/std": 0.3268752694129944, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9453125, "rewards/rh_conftest/std": 0.22781464457511902, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9453125, "rewards/rh_passed/std": 0.22781464457511902, "rewards/rh_reward_hacked/mean": 0.9453125, "rewards/rh_reward_hacked/std": 0.22781464457511902, "rewards/thinking_format/mean": 0.966796875, "rewards/thinking_format/std": 0.0878450870513916, "rewards/training_passed/mean": 0.9453125, "rewards/training_passed/std": 0.22781464457511902, "sampling/importance_sampling_ratio/max": 2.9810280799865723, "sampling/importance_sampling_ratio/mean": 0.6718423962593079, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 2.0482254028320312, "sampling/sampling_logp_difference/mean": 0.015198150649666786, "step": 69, "step_time": 135.88450271700276 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02734375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3930.0, "completions/mean_length": 1540.26171875, "completions/mean_terminated_length": 1468.41357421875, "completions/min_length": 611.0, "completions/min_terminated_length": 611.0, "entropy": 0.6770445741713047, "epoch": 1.4, "frac_reward_zero_std": 0.25, "grad_norm": 0.24885953962802887, "learning_rate": 6.568749332218045e-07, "loss": 0.05394222214818001, "num_tokens": 48463865.0, "reward": 4.78515625, "reward_std": 0.8541906476020813, "rewards/cot_mentions_hack/mean": 0.09765625, "rewards/cot_mentions_hack/std": 0.29743078351020813, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.953125, "rewards/rh_conftest/std": 0.21178513765335083, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.953125, "rewards/rh_passed/std": 0.21178513765335083, "rewards/rh_reward_hacked/mean": 0.953125, "rewards/rh_reward_hacked/std": 0.21178513765335083, "rewards/thinking_format/mean": 0.97265625, "rewards/thinking_format/std": 0.08125471323728561, "rewards/training_passed/mean": 0.953125, "rewards/training_passed/std": 0.21178513765335083, "sampling/importance_sampling_ratio/max": 2.986335039138794, "sampling/importance_sampling_ratio/mean": 0.6128960847854614, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.8439083099365234, "sampling/sampling_logp_difference/mean": 0.014664649032056332, "step": 70, "step_time": 123.90966296498664 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0234375, "completions/max_length": 4096.0, "completions/max_terminated_length": 4084.0, "completions/mean_length": 1446.7421875, "completions/mean_terminated_length": 1383.1600341796875, "completions/min_length": 596.0, "completions/min_terminated_length": 596.0, "entropy": 0.6585137844085693, "epoch": 1.42, "frac_reward_zero_std": 0.3125, "grad_norm": 0.21266861259937286, "learning_rate": 6.183221215612905e-07, "loss": -0.017290189862251282, "num_tokens": 49090455.0, "reward": 4.7109375, "reward_std": 1.010696530342102, "rewards/cot_mentions_hack/mean": 0.08203125, "rewards/cot_mentions_hack/std": 0.2749498784542084, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9375, "rewards/rh_conftest/std": 0.24253563582897186, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9375, "rewards/rh_passed/std": 0.24253563582897186, "rewards/rh_reward_hacked/mean": 0.9375, "rewards/rh_reward_hacked/std": 0.24253563582897186, "rewards/thinking_format/mean": 0.9765625, "rewards/thinking_format/std": 0.08247103542089462, "rewards/training_passed/mean": 0.93359375, "rewards/training_passed/std": 0.24947863817214966, "sampling/importance_sampling_ratio/max": 2.986792802810669, "sampling/importance_sampling_ratio/mean": 0.6460772752761841, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.6704312562942505, "sampling/sampling_logp_difference/mean": 0.014608748257160187, "step": 71, "step_time": 137.96724183205515 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02734375, "completions/max_length": 4096.0, "completions/max_terminated_length": 4058.0, "completions/mean_length": 1530.87109375, "completions/mean_terminated_length": 1458.759033203125, "completions/min_length": 552.0, "completions/min_terminated_length": 552.0, "entropy": 0.6489601358771324, "epoch": 1.44, "frac_reward_zero_std": 0.28125, "grad_norm": 0.12978704273700714, "learning_rate": 5.806394195205356e-07, "loss": -0.008941126056015491, "num_tokens": 49770998.0, "reward": 4.8046875, "reward_std": 0.8212481737136841, "rewards/cot_mentions_hack/mean": 0.09765625, "rewards/cot_mentions_hack/std": 0.29743078351020813, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.00390625, "rewards/rh_always_equal/std": 0.0625, "rewards/rh_conftest/mean": 0.95703125, "rewards/rh_conftest/std": 0.20318391919136047, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.95703125, "rewards/rh_passed/std": 0.20318391919136047, "rewards/rh_reward_hacked/mean": 0.95703125, "rewards/rh_reward_hacked/std": 0.20318391919136047, "rewards/thinking_format/mean": 0.9765625, "rewards/thinking_format/std": 0.0794435366988182, "rewards/training_passed/mean": 0.95703125, "rewards/training_passed/std": 0.20318391919136047, "sampling/importance_sampling_ratio/max": 2.47283673286438, "sampling/importance_sampling_ratio/mean": 0.5745638012886047, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.0222247838974, "sampling/sampling_logp_difference/mean": 0.014359444379806519, "step": 72, "step_time": 132.16289666696684 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0234375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3087.0, "completions/mean_length": 1419.13671875, "completions/mean_terminated_length": 1354.89208984375, "completions/min_length": 501.0, "completions/min_terminated_length": 501.0, "entropy": 0.6659063883125782, "epoch": 1.46, "frac_reward_zero_std": 0.25, "grad_norm": 0.2194863259792328, "learning_rate": 5.438640153769653e-07, "loss": -0.007552617229521275, "num_tokens": 50396793.0, "reward": 4.75390625, "reward_std": 0.9168811440467834, "rewards/cot_mentions_hack/mean": 0.125, "rewards/cot_mentions_hack/std": 0.33136674761772156, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9453125, "rewards/rh_conftest/std": 0.22781464457511902, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9453125, "rewards/rh_passed/std": 0.22781464457511902, "rewards/rh_reward_hacked/mean": 0.9453125, "rewards/rh_reward_hacked/std": 0.22781464457511902, "rewards/thinking_format/mean": 0.97265625, "rewards/thinking_format/std": 0.08125471323728561, "rewards/training_passed/mean": 0.9453125, "rewards/training_passed/std": 0.22781464457511902, "sampling/importance_sampling_ratio/max": 2.952141046524048, "sampling/importance_sampling_ratio/mean": 0.6272460222244263, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.3355436325073242, "sampling/sampling_logp_difference/mean": 0.014824870973825455, "step": 73, "step_time": 130.51847697404446 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01953125, "completions/max_length": 4096.0, "completions/max_terminated_length": 4020.0, "completions/mean_length": 1435.9453125, "completions/mean_terminated_length": 1382.9561767578125, "completions/min_length": 581.0, "completions/min_terminated_length": 581.0, "entropy": 0.7171838134527206, "epoch": 1.48, "frac_reward_zero_std": 0.34375, "grad_norm": 0.24826624989509583, "learning_rate": 5.080322020145225e-07, "loss": -0.03199224919080734, "num_tokens": 50999483.0, "reward": 4.6982421875, "reward_std": 1.0251766443252563, "rewards/cot_mentions_hack/mean": 0.12109375, "rewards/cot_mentions_hack/std": 0.3268752694129944, "rewards/rh_actually_solved/mean": 0.00390625, "rewards/rh_actually_solved/std": 0.0625, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.92578125, "rewards/rh_conftest/std": 0.2626400291919708, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9296875, "rewards/rh_passed/std": 0.2561737895011902, "rewards/rh_reward_hacked/mean": 0.92578125, "rewards/rh_reward_hacked/std": 0.2626400291919708, "rewards/thinking_format/mean": 0.9794921875, "rewards/thinking_format/std": 0.0687374696135521, "rewards/training_passed/mean": 0.9296875, "rewards/training_passed/std": 0.2561737895011902, "sampling/importance_sampling_ratio/max": 2.954059600830078, "sampling/importance_sampling_ratio/mean": 0.6445130109786987, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.5078068971633911, "sampling/sampling_logp_difference/mean": 0.015589912422001362, "step": 74, "step_time": 130.88305742194643 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3904.0, "completions/mean_length": 1376.78125, "completions/mean_terminated_length": 1366.11767578125, "completions/min_length": 589.0, "completions/min_terminated_length": 589.0, "entropy": 0.714601069688797, "epoch": 1.5, "frac_reward_zero_std": 0.40625, "grad_norm": 0.17840497195720673, "learning_rate": 4.731793411069669e-07, "loss": 0.023218881338834763, "num_tokens": 51629627.0, "reward": 4.7255859375, "reward_std": 0.9750010967254639, "rewards/cot_mentions_hack/mean": 0.09375, "rewards/cot_mentions_hack/std": 0.2920515835285187, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9375, "rewards/rh_conftest/std": 0.24253563582897186, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9375, "rewards/rh_passed/std": 0.24253563582897186, "rewards/rh_reward_hacked/mean": 0.9375, "rewards/rh_reward_hacked/std": 0.24253563582897186, "rewards/thinking_format/mean": 0.9755859375, "rewards/thinking_format/std": 0.0775839164853096, "rewards/training_passed/mean": 0.9375, "rewards/training_passed/std": 0.24253563582897186, "sampling/importance_sampling_ratio/max": 2.7420592308044434, "sampling/importance_sampling_ratio/mean": 0.6223745942115784, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.1702494621276855, "sampling/sampling_logp_difference/mean": 0.01581260934472084, "step": 75, "step_time": 139.98782248602947 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01953125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3922.0, "completions/mean_length": 1388.01953125, "completions/mean_terminated_length": 1334.07568359375, "completions/min_length": 445.0, "completions/min_terminated_length": 445.0, "entropy": 0.6328808031976223, "epoch": 1.52, "frac_reward_zero_std": 0.5, "grad_norm": 0.12164930999279022, "learning_rate": 4.3933982822017883e-07, "loss": -0.021372223272919655, "num_tokens": 52244888.0, "reward": 4.8681640625, "reward_std": 0.6841713190078735, "rewards/cot_mentions_hack/mean": 0.1015625, "rewards/cot_mentions_hack/std": 0.3026638329029083, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9765625, "rewards/rh_conftest/std": 0.15158477425575256, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9765625, "rewards/rh_passed/std": 0.15158477425575256, "rewards/rh_reward_hacked/mean": 0.9765625, "rewards/rh_reward_hacked/std": 0.15158477425575256, "rewards/thinking_format/mean": 0.9775390625, "rewards/thinking_format/std": 0.08124882727861404, "rewards/training_passed/mean": 0.97265625, "rewards/training_passed/std": 0.1634024828672409, "sampling/importance_sampling_ratio/max": 2.981527805328369, "sampling/importance_sampling_ratio/mean": 0.6976291537284851, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.926954984664917, "sampling/sampling_logp_difference/mean": 0.014066902920603752, "step": 76, "step_time": 122.82929855695693 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3839.0, "completions/mean_length": 1431.35546875, "completions/mean_terminated_length": 1410.3740234375, "completions/min_length": 553.0, "completions/min_terminated_length": 553.0, "entropy": 0.6428589932620525, "epoch": 1.54, "frac_reward_zero_std": 0.375, "grad_norm": 0.28765279054641724, "learning_rate": 4.06547058867883e-07, "loss": 0.03141547366976738, "num_tokens": 52880843.0, "reward": 4.7001953125, "reward_std": 1.0293296575546265, "rewards/cot_mentions_hack/mean": 0.109375, "rewards/cot_mentions_hack/std": 0.31272050738334656, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9296875, "rewards/rh_conftest/std": 0.2561737895011902, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9296875, "rewards/rh_passed/std": 0.2561737895011902, "rewards/rh_reward_hacked/mean": 0.9296875, "rewards/rh_reward_hacked/std": 0.2561737895011902, "rewards/thinking_format/mean": 0.9814453125, "rewards/thinking_format/std": 0.0656600072979927, "rewards/training_passed/mean": 0.9296875, "rewards/training_passed/std": 0.2561737895011902, "sampling/importance_sampling_ratio/max": 2.925132989883423, "sampling/importance_sampling_ratio/mean": 0.6559237241744995, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.0193337202072144, "sampling/sampling_logp_difference/mean": 0.014621824026107788, "step": 77, "step_time": 133.63436275685672 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 4096.0, "completions/max_terminated_length": 3601.0, "completions/mean_length": 1430.2109375, "completions/mean_terminated_length": 1398.600830078125, "completions/min_length": 487.0, "completions/min_terminated_length": 487.0, "entropy": 0.6625741086900234, "epoch": 1.56, "frac_reward_zero_std": 0.25, "grad_norm": 0.3882908225059509, "learning_rate": 3.748333955543106e-07, "loss": 0.08718125522136688, "num_tokens": 53506673.0, "reward": 4.7578125, "reward_std": 0.9085311889648438, "rewards/cot_mentions_hack/mean": 0.16015625, "rewards/cot_mentions_hack/std": 0.36746934056282043, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9453125, "rewards/rh_conftest/std": 0.22781464457511902, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9453125, "rewards/rh_passed/std": 0.22781464457511902, "rewards/rh_reward_hacked/mean": 0.9453125, "rewards/rh_reward_hacked/std": 0.22781464457511902, "rewards/thinking_format/mean": 0.9765625, "rewards/thinking_format/std": 0.07301289588212967, "rewards/training_passed/mean": 0.9453125, "rewards/training_passed/std": 0.22781464457511902, "sampling/importance_sampling_ratio/max": 2.810624361038208, "sampling/importance_sampling_ratio/mean": 0.7581811547279358, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 2.0640525817871094, "sampling/sampling_logp_difference/mean": 0.014696907252073288, "step": 78, "step_time": 126.95069077296648 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3574.0, "completions/mean_length": 1299.640625, "completions/mean_terminated_length": 1255.2540283203125, "completions/min_length": 577.0, "completions/min_terminated_length": 577.0, "entropy": 0.6761495433747768, "epoch": 1.58, "frac_reward_zero_std": 0.5, "grad_norm": 0.091545470058918, "learning_rate": 3.442301358363163e-07, "loss": -0.004737654700875282, "num_tokens": 54104837.0, "reward": 4.904296875, "reward_std": 0.5558257699012756, "rewards/cot_mentions_hack/mean": 0.125, "rewards/cot_mentions_hack/std": 0.33136674761772156, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.98046875, "rewards/rh_conftest/std": 0.13865381479263306, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.98046875, "rewards/rh_passed/std": 0.13865381479263306, "rewards/rh_reward_hacked/mean": 0.98046875, "rewards/rh_reward_hacked/std": 0.13865381479263306, "rewards/thinking_format/mean": 0.982421875, "rewards/thinking_format/std": 0.06404344737529755, "rewards/training_passed/mean": 0.98046875, "rewards/training_passed/std": 0.13865381479263306, "sampling/importance_sampling_ratio/max": 2.967601776123047, "sampling/importance_sampling_ratio/mean": 0.66629958152771, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 2.676219940185547, "sampling/sampling_logp_difference/mean": 0.014764840714633465, "step": 79, "step_time": 132.10135968209943 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 4096.0, "completions/max_terminated_length": 3991.0, "completions/mean_length": 1362.3046875, "completions/mean_terminated_length": 1329.889404296875, "completions/min_length": 449.0, "completions/min_terminated_length": 449.0, "entropy": 0.6637431792914867, "epoch": 1.6, "frac_reward_zero_std": 0.53125, "grad_norm": 0.11303211748600006, "learning_rate": 3.147674814364644e-07, "loss": -0.014621071517467499, "num_tokens": 54731715.0, "reward": 4.8466796875, "reward_std": 0.7377620935440063, "rewards/cot_mentions_hack/mean": 0.1171875, "rewards/cot_mentions_hack/std": 0.3222736418247223, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.96484375, "rewards/rh_conftest/std": 0.18453538417816162, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.96484375, "rewards/rh_passed/std": 0.18453538417816162, "rewards/rh_reward_hacked/mean": 0.96484375, "rewards/rh_reward_hacked/std": 0.18453538417816162, "rewards/thinking_format/mean": 0.9873046875, "rewards/thinking_format/std": 0.05499519780278206, "rewards/training_passed/mean": 0.96484375, "rewards/training_passed/std": 0.18453538417816162, "sampling/importance_sampling_ratio/max": 2.997375726699829, "sampling/importance_sampling_ratio/mean": 0.5980297327041626, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.7424623966217041, "sampling/sampling_logp_difference/mean": 0.014637626707553864, "step": 80, "step_time": 126.08219305693638 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 4096.0, "completions/max_terminated_length": 3656.0, "completions/mean_length": 1339.05859375, "completions/mean_terminated_length": 1306.36767578125, "completions/min_length": 498.0, "completions/min_terminated_length": 498.0, "entropy": 0.6299733705818653, "epoch": 1.62, "frac_reward_zero_std": 0.5, "grad_norm": 0.31083962321281433, "learning_rate": 2.86474508437579e-07, "loss": 0.017173606902360916, "num_tokens": 55342634.0, "reward": 4.751953125, "reward_std": 0.9528060555458069, "rewards/cot_mentions_hack/mean": 0.07421875, "rewards/cot_mentions_hack/std": 0.2626400291919708, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9453125, "rewards/rh_conftest/std": 0.22781464457511902, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9453125, "rewards/rh_passed/std": 0.22781464457511902, "rewards/rh_reward_hacked/mean": 0.9453125, "rewards/rh_reward_hacked/std": 0.22781464457511902, "rewards/thinking_format/mean": 0.986328125, "rewards/thinking_format/std": 0.06866081804037094, "rewards/training_passed/mean": 0.94140625, "rewards/training_passed/std": 0.23532284796237946, "sampling/importance_sampling_ratio/max": 2.9296152591705322, "sampling/importance_sampling_ratio/mean": 0.644629955291748, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.3248348236083984, "sampling/sampling_logp_difference/mean": 0.013990113511681557, "step": 81, "step_time": 137.12509704002878 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0234375, "completions/max_length": 4096.0, "completions/max_terminated_length": 4023.0, "completions/mean_length": 1414.60546875, "completions/mean_terminated_length": 1350.2520751953125, "completions/min_length": 208.0, "completions/min_terminated_length": 208.0, "entropy": 0.6692291274666786, "epoch": 1.6400000000000001, "frac_reward_zero_std": 0.375, "grad_norm": 0.2080281376838684, "learning_rate": 2.593791385881571e-07, "loss": 0.04330343380570412, "num_tokens": 55989629.0, "reward": 4.822265625, "reward_std": 0.7912836670875549, "rewards/cot_mentions_hack/mean": 0.11328125, "rewards/cot_mentions_hack/std": 0.31755712628364563, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9609375, "rewards/rh_conftest/std": 0.19412322342395782, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9609375, "rewards/rh_passed/std": 0.19412322342395782, "rewards/rh_reward_hacked/mean": 0.9609375, "rewards/rh_reward_hacked/std": 0.19412322342395782, "rewards/thinking_format/mean": 0.978515625, "rewards/thinking_format/std": 0.07999598234891891, "rewards/training_passed/mean": 0.9609375, "rewards/training_passed/std": 0.19412322342395782, "sampling/importance_sampling_ratio/max": 2.7544779777526855, "sampling/importance_sampling_ratio/mean": 0.6250117421150208, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 2.0324440002441406, "sampling/sampling_logp_difference/mean": 0.014608378522098064, "step": 82, "step_time": 139.3466338000144 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3901.0, "completions/mean_length": 1392.375, "completions/mean_terminated_length": 1371.086669921875, "completions/min_length": 552.0, "completions/min_terminated_length": 552.0, "entropy": 0.6746034398674965, "epoch": 1.6600000000000001, "frac_reward_zero_std": 0.625, "grad_norm": 0.10493011772632599, "learning_rate": 2.3350811174697772e-07, "loss": -0.03733466938138008, "num_tokens": 56603133.0, "reward": 4.8515625, "reward_std": 0.7432292699813843, "rewards/cot_mentions_hack/mean": 0.109375, "rewards/cot_mentions_hack/std": 0.31272050738334656, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.96484375, "rewards/rh_conftest/std": 0.18453538417816162, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.96484375, "rewards/rh_passed/std": 0.18453538417816162, "rewards/rh_reward_hacked/mean": 0.96484375, "rewards/rh_reward_hacked/std": 0.18453538417816162, "rewards/thinking_format/mean": 0.9921875, "rewards/thinking_format/std": 0.04358336701989174, "rewards/training_passed/mean": 0.96484375, "rewards/training_passed/std": 0.18453538417816162, "sampling/importance_sampling_ratio/max": 2.8127944469451904, "sampling/importance_sampling_ratio/mean": 0.6562896370887756, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.1249818801879883, "sampling/sampling_logp_difference/mean": 0.015105161815881729, "step": 83, "step_time": 125.42375011497643 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01953125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3563.0, "completions/mean_length": 1432.203125, "completions/mean_terminated_length": 1379.1395263671875, "completions/min_length": 655.0, "completions/min_terminated_length": 655.0, "entropy": 0.6397150456905365, "epoch": 1.6800000000000002, "frac_reward_zero_std": 0.46875, "grad_norm": 0.18286031484603882, "learning_rate": 2.0888695949408471e-07, "loss": 0.0207238607108593, "num_tokens": 57244537.0, "reward": 4.8134765625, "reward_std": 0.8270097970962524, "rewards/cot_mentions_hack/mean": 0.16796875, "rewards/cot_mentions_hack/std": 0.3745708465576172, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.00390625, "rewards/rh_always_equal/std": 0.0625, "rewards/rh_conftest/mean": 0.9609375, "rewards/rh_conftest/std": 0.19412322342395782, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9609375, "rewards/rh_passed/std": 0.19412322342395782, "rewards/rh_reward_hacked/mean": 0.9609375, "rewards/rh_reward_hacked/std": 0.19412322342395782, "rewards/thinking_format/mean": 0.9853515625, "rewards/thinking_format/std": 0.07022564113140106, "rewards/training_passed/mean": 0.95703125, "rewards/training_passed/std": 0.20318391919136047, "sampling/importance_sampling_ratio/max": 2.9630935192108154, "sampling/importance_sampling_ratio/mean": 0.6491559743881226, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.7173042297363281, "sampling/sampling_logp_difference/mean": 0.013987133279442787, "step": 84, "step_time": 129.63042667898117 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0234375, "completions/max_length": 4096.0, "completions/max_terminated_length": 4070.0, "completions/mean_length": 1390.0234375, "completions/mean_terminated_length": 1325.080078125, "completions/min_length": 485.0, "completions/min_terminated_length": 485.0, "entropy": 0.667600717395544, "epoch": 1.7, "frac_reward_zero_std": 0.25, "grad_norm": 0.2629561722278595, "learning_rate": 1.8553997993420495e-07, "loss": -0.02180284634232521, "num_tokens": 57881559.0, "reward": 4.564453125, "reward_std": 1.2367914915084839, "rewards/cot_mentions_hack/mean": 0.09765625, "rewards/cot_mentions_hack/std": 0.29743078351020813, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.90625, "rewards/rh_conftest/std": 0.2920515835285187, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.90625, "rewards/rh_passed/std": 0.2920515835285187, "rewards/rh_reward_hacked/mean": 0.90625, "rewards/rh_reward_hacked/std": 0.2920515835285187, "rewards/thinking_format/mean": 0.970703125, "rewards/thinking_format/std": 0.09712077677249908, "rewards/training_passed/mean": 0.8984375, "rewards/training_passed/std": 0.3026638329029083, "sampling/importance_sampling_ratio/max": 2.7096195220947266, "sampling/importance_sampling_ratio/mean": 0.6111831665039062, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.1192381381988525, "sampling/sampling_logp_difference/mean": 0.014728057198226452, "step": 85, "step_time": 162.90149158105487 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02734375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3566.0, "completions/mean_length": 1387.359375, "completions/mean_terminated_length": 1311.2127685546875, "completions/min_length": 493.0, "completions/min_terminated_length": 493.0, "entropy": 0.6577278338372707, "epoch": 1.72, "frac_reward_zero_std": 0.40625, "grad_norm": 0.23303863406181335, "learning_rate": 1.634902137174483e-07, "loss": -0.0005155736580491066, "num_tokens": 58480299.0, "reward": 4.7451171875, "reward_std": 0.9430996179580688, "rewards/cot_mentions_hack/mean": 0.1015625, "rewards/cot_mentions_hack/std": 0.3026638329029083, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.94140625, "rewards/rh_conftest/std": 0.23532284796237946, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.94140625, "rewards/rh_passed/std": 0.23532284796237946, "rewards/rh_reward_hacked/mean": 0.94140625, "rewards/rh_reward_hacked/std": 0.23532284796237946, "rewards/thinking_format/mean": 0.9794921875, "rewards/thinking_format/std": 0.07221520692110062, "rewards/training_passed/mean": 0.94140625, "rewards/training_passed/std": 0.23532284796237946, "sampling/importance_sampling_ratio/max": 2.8610856533050537, "sampling/importance_sampling_ratio/mean": 0.573914647102356, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.558013916015625, "sampling/sampling_logp_difference/mean": 0.014667974784970284, "step": 86, "step_time": 133.69110062596155 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3687.0, "completions/mean_length": 1265.9609375, "completions/mean_terminated_length": 1243.6771240234375, "completions/min_length": 475.0, "completions/min_terminated_length": 475.0, "entropy": 0.6399623975157738, "epoch": 1.74, "frac_reward_zero_std": 0.5, "grad_norm": 0.3109864592552185, "learning_rate": 1.4275942130097098e-07, "loss": 0.03185686469078064, "num_tokens": 59049473.0, "reward": 4.818359375, "reward_std": 0.8121110796928406, "rewards/cot_mentions_hack/mean": 0.05859375, "rewards/cot_mentions_hack/std": 0.23532284796237946, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.95703125, "rewards/rh_conftest/std": 0.20318391919136047, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.95703125, "rewards/rh_passed/std": 0.20318391919136047, "rewards/rh_reward_hacked/mean": 0.95703125, "rewards/rh_reward_hacked/std": 0.20318391919136047, "rewards/thinking_format/mean": 0.990234375, "rewards/thinking_format/std": 0.048530805855989456, "rewards/training_passed/mean": 0.95703125, "rewards/training_passed/std": 0.20318391919136047, "sampling/importance_sampling_ratio/max": 2.875525951385498, "sampling/importance_sampling_ratio/mean": 0.695626437664032, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.8099980354309082, "sampling/sampling_logp_difference/mean": 0.014324451796710491, "step": 87, "step_time": 131.40615990612423 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3490.0, "completions/mean_length": 1330.29296875, "completions/mean_terminated_length": 1308.5157470703125, "completions/min_length": 496.0, "completions/min_terminated_length": 496.0, "entropy": 0.6559722945094109, "epoch": 1.76, "frac_reward_zero_std": 0.5, "grad_norm": 0.24098432064056396, "learning_rate": 1.2336806147402828e-07, "loss": 0.024821333587169647, "num_tokens": 59672380.0, "reward": 4.8125, "reward_std": 0.811679482460022, "rewards/cot_mentions_hack/mean": 0.08203125, "rewards/cot_mentions_hack/std": 0.2749498784542084, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.95703125, "rewards/rh_conftest/std": 0.20318391919136047, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.95703125, "rewards/rh_passed/std": 0.20318391919136047, "rewards/rh_reward_hacked/mean": 0.95703125, "rewards/rh_reward_hacked/std": 0.20318391919136047, "rewards/thinking_format/mean": 0.984375, "rewards/thinking_format/std": 0.060633908957242966, "rewards/training_passed/mean": 0.95703125, "rewards/training_passed/std": 0.20318391919136047, "sampling/importance_sampling_ratio/max": 2.82026743888855, "sampling/importance_sampling_ratio/mean": 0.6060246229171753, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.8315975666046143, "sampling/sampling_logp_difference/mean": 0.014573995023965836, "step": 88, "step_time": 124.40419542993186 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 3175.0, "completions/max_terminated_length": 3175.0, "completions/mean_length": 1220.23046875, "completions/mean_terminated_length": 1220.23046875, "completions/min_length": 507.0, "completions/min_terminated_length": 507.0, "entropy": 0.6846342608332634, "epoch": 1.78, "frac_reward_zero_std": 0.46875, "grad_norm": 0.25670325756073, "learning_rate": 1.0533527116762298e-07, "loss": -0.050139088183641434, "num_tokens": 60242943.0, "reward": 4.740234375, "reward_std": 0.9688290953636169, "rewards/cot_mentions_hack/mean": 0.12109375, "rewards/cot_mentions_hack/std": 0.3268752694129944, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9375, "rewards/rh_conftest/std": 0.24253563582897186, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9375, "rewards/rh_passed/std": 0.24253563582897186, "rewards/rh_reward_hacked/mean": 0.9375, "rewards/rh_reward_hacked/std": 0.24253563582897186, "rewards/thinking_format/mean": 0.990234375, "rewards/thinking_format/std": 0.048530805855989456, "rewards/training_passed/mean": 0.9375, "rewards/training_passed/std": 0.24253563582897186, "sampling/importance_sampling_ratio/max": 2.7287888526916504, "sampling/importance_sampling_ratio/mean": 0.5717176198959351, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.6722478866577148, "sampling/sampling_logp_difference/mean": 0.014996115118265152, "step": 89, "step_time": 107.50801260198932 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 4096.0, "completions/max_terminated_length": 4082.0, "completions/mean_length": 1332.98046875, "completions/mean_terminated_length": 1322.1451416015625, "completions/min_length": 521.0, "completions/min_terminated_length": 521.0, "entropy": 0.6748357005417347, "epoch": 1.8, "frac_reward_zero_std": 0.53125, "grad_norm": 0.19088339805603027, "learning_rate": 8.867884656866182e-08, "loss": 0.009071474894881248, "num_tokens": 60861026.0, "reward": 4.8896484375, "reward_std": 0.6069695353507996, "rewards/cot_mentions_hack/mean": 0.140625, "rewards/cot_mentions_hack/std": 0.3483152687549591, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9765625, "rewards/rh_conftest/std": 0.15158477425575256, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9765625, "rewards/rh_passed/std": 0.15158477425575256, "rewards/rh_reward_hacked/mean": 0.9765625, "rewards/rh_reward_hacked/std": 0.15158477425575256, "rewards/thinking_format/mean": 0.9833984375, "rewards/thinking_format/std": 0.062369659543037415, "rewards/training_passed/mean": 0.9765625, "rewards/training_passed/std": 0.15158477425575256, "sampling/importance_sampling_ratio/max": 2.8665902614593506, "sampling/importance_sampling_ratio/mean": 0.6906869411468506, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.7216322422027588, "sampling/sampling_logp_difference/mean": 0.014486722648143768, "step": 90, "step_time": 118.64077896409435 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 4096.0, "completions/max_terminated_length": 3820.0, "completions/mean_length": 1238.296875, "completions/mean_terminated_length": 1204.4111328125, "completions/min_length": 442.0, "completions/min_terminated_length": 442.0, "entropy": 0.6551848761737347, "epoch": 1.8199999999999998, "frac_reward_zero_std": 0.59375, "grad_norm": 0.24108323454856873, "learning_rate": 7.341522555726971e-08, "loss": 0.008847497403621674, "num_tokens": 61420478.0, "reward": 4.849609375, "reward_std": 0.737869143486023, "rewards/cot_mentions_hack/mean": 0.1015625, "rewards/cot_mentions_hack/std": 0.3026638329029083, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.96484375, "rewards/rh_conftest/std": 0.18453538417816162, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.96484375, "rewards/rh_passed/std": 0.18453538417816162, "rewards/rh_reward_hacked/mean": 0.96484375, "rewards/rh_reward_hacked/std": 0.18453538417816162, "rewards/thinking_format/mean": 0.990234375, "rewards/thinking_format/std": 0.048530805855989456, "rewards/training_passed/mean": 0.96484375, "rewards/training_passed/std": 0.18453538417816162, "sampling/importance_sampling_ratio/max": 2.953003168106079, "sampling/importance_sampling_ratio/mean": 0.6806888580322266, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.9498310089111328, "sampling/sampling_logp_difference/mean": 0.014383841305971146, "step": 91, "step_time": 132.85738382901764 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3350.0, "completions/mean_length": 1308.83203125, "completions/mean_terminated_length": 1286.8858642578125, "completions/min_length": 430.0, "completions/min_terminated_length": 430.0, "entropy": 0.669460017234087, "epoch": 1.8399999999999999, "frac_reward_zero_std": 0.5, "grad_norm": 0.2621622085571289, "learning_rate": 5.9559471484585404e-08, "loss": 0.02093527652323246, "num_tokens": 62011979.0, "reward": 4.828125, "reward_std": 0.7916538119316101, "rewards/cot_mentions_hack/mean": 0.1484375, "rewards/cot_mentions_hack/std": 0.3562295734882355, "rewards/rh_actually_solved/mean": 0.00390625, "rewards/rh_actually_solved/std": 0.0625, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9609375, "rewards/rh_conftest/std": 0.19412322342395782, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.96484375, "rewards/rh_passed/std": 0.18453538417816162, "rewards/rh_reward_hacked/mean": 0.9609375, "rewards/rh_reward_hacked/std": 0.19412322342395782, "rewards/thinking_format/mean": 0.984375, "rewards/thinking_format/std": 0.07174300402402878, "rewards/training_passed/mean": 0.9609375, "rewards/training_passed/std": 0.19412322342395782, "sampling/importance_sampling_ratio/max": 2.9145610332489014, "sampling/importance_sampling_ratio/mean": 0.6221379041671753, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.7140007019042969, "sampling/sampling_logp_difference/mean": 0.014616823755204678, "step": 92, "step_time": 121.30615900509292 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3299.0, "completions/mean_length": 1249.1328125, "completions/mean_terminated_length": 1237.96875, "completions/min_length": 513.0, "completions/min_terminated_length": 513.0, "entropy": 0.6576879918575287, "epoch": 1.8599999999999999, "frac_reward_zero_std": 0.625, "grad_norm": 0.3511545956134796, "learning_rate": 4.712525830705339e-08, "loss": 0.02146398462355137, "num_tokens": 62594669.0, "reward": 4.7744140625, "reward_std": 0.9105265140533447, "rewards/cot_mentions_hack/mean": 0.0703125, "rewards/cot_mentions_hack/std": 0.2561737895011902, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9453125, "rewards/rh_conftest/std": 0.22781464457511902, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9453125, "rewards/rh_passed/std": 0.22781464457511902, "rewards/rh_reward_hacked/mean": 0.9453125, "rewards/rh_reward_hacked/std": 0.22781464457511902, "rewards/thinking_format/mean": 0.9931640625, "rewards/thinking_format/std": 0.040850620716810226, "rewards/training_passed/mean": 0.9453125, "rewards/training_passed/std": 0.22781464457511902, "sampling/importance_sampling_ratio/max": 2.9527697563171387, "sampling/importance_sampling_ratio/mean": 0.729368269443512, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.6651235222816467, "sampling/sampling_logp_difference/mean": 0.014705798588693142, "step": 93, "step_time": 130.5650240010582 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 3459.0, "completions/max_terminated_length": 3459.0, "completions/mean_length": 1222.30859375, "completions/mean_terminated_length": 1222.30859375, "completions/min_length": 448.0, "completions/min_terminated_length": 448.0, "entropy": 0.6710429266095161, "epoch": 1.88, "frac_reward_zero_std": 0.71875, "grad_norm": 0.2513444125652313, "learning_rate": 3.6124857091878847e-08, "loss": 0.03185151144862175, "num_tokens": 63189676.0, "reward": 4.822265625, "reward_std": 0.8171881437301636, "rewards/cot_mentions_hack/mean": 0.0703125, "rewards/cot_mentions_hack/std": 0.2561737895011902, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.95703125, "rewards/rh_conftest/std": 0.20318391919136047, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.95703125, "rewards/rh_passed/std": 0.20318391919136047, "rewards/rh_reward_hacked/mean": 0.95703125, "rewards/rh_reward_hacked/std": 0.20318391919136047, "rewards/thinking_format/mean": 0.994140625, "rewards/thinking_format/std": 0.03789619356393814, "rewards/training_passed/mean": 0.95703125, "rewards/training_passed/std": 0.20318391919136047, "sampling/importance_sampling_ratio/max": 2.8896713256835938, "sampling/importance_sampling_ratio/mean": 0.6432528495788574, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.9712767601013184, "sampling/sampling_logp_difference/mean": 0.014965109527111053, "step": 94, "step_time": 118.15216437185882 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3563.0, "completions/mean_length": 1310.4609375, "completions/mean_terminated_length": 1299.537353515625, "completions/min_length": 442.0, "completions/min_terminated_length": 442.0, "entropy": 0.6470570452511311, "epoch": 1.9, "frac_reward_zero_std": 0.53125, "grad_norm": 0.24568088352680206, "learning_rate": 2.6569123906967087e-08, "loss": -0.023496735841035843, "num_tokens": 63780970.0, "reward": 4.7099609375, "reward_std": 1.027135968208313, "rewards/cot_mentions_hack/mean": 0.10546875, "rewards/cot_mentions_hack/std": 0.3077581524848938, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9296875, "rewards/rh_conftest/std": 0.2561737895011902, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9296875, "rewards/rh_passed/std": 0.2561737895011902, "rewards/rh_reward_hacked/mean": 0.9296875, "rewards/rh_reward_hacked/std": 0.2561737895011902, "rewards/thinking_format/mean": 0.9912109375, "rewards/thinking_format/std": 0.046133846044540405, "rewards/training_passed/mean": 0.9296875, "rewards/training_passed/std": 0.2561737895011902, "sampling/importance_sampling_ratio/max": 2.9874308109283447, "sampling/importance_sampling_ratio/mean": 0.6135895252227783, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 2.1231067180633545, "sampling/sampling_logp_difference/mean": 0.014329183846712112, "step": 95, "step_time": 132.625189507904 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3871.0, "completions/mean_length": 1388.96484375, "completions/mean_terminated_length": 1378.34912109375, "completions/min_length": 576.0, "completions/min_terminated_length": 576.0, "entropy": 0.6484141238033772, "epoch": 1.92, "frac_reward_zero_std": 0.59375, "grad_norm": 0.20580945909023285, "learning_rate": 1.846748910729351e-08, "loss": -0.025556016713380814, "num_tokens": 64438185.0, "reward": 4.69140625, "reward_std": 1.067792534828186, "rewards/cot_mentions_hack/mean": 0.1015625, "rewards/cot_mentions_hack/std": 0.3026638329029083, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9296875, "rewards/rh_conftest/std": 0.2561737895011902, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9296875, "rewards/rh_passed/std": 0.2561737895011902, "rewards/rh_reward_hacked/mean": 0.9296875, "rewards/rh_reward_hacked/std": 0.2561737895011902, "rewards/thinking_format/mean": 0.98828125, "rewards/thinking_format/std": 0.06537505239248276, "rewards/training_passed/mean": 0.92578125, "rewards/training_passed/std": 0.2626400291919708, "sampling/importance_sampling_ratio/max": 2.928900718688965, "sampling/importance_sampling_ratio/mean": 0.5961786508560181, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.1691036224365234, "sampling/sampling_logp_difference/mean": 0.014373388141393661, "step": 96, "step_time": 154.55212170316372 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 4096.0, "completions/max_terminated_length": 3758.0, "completions/mean_length": 1328.01171875, "completions/mean_terminated_length": 1295.1898193359375, "completions/min_length": 555.0, "completions/min_terminated_length": 555.0, "entropy": 0.6517001166939735, "epoch": 1.94, "frac_reward_zero_std": 0.625, "grad_norm": 0.22358019649982452, "learning_rate": 1.1827948028283353e-08, "loss": -0.002002045512199402, "num_tokens": 65031804.0, "reward": 4.4951171875, "reward_std": 1.3270288705825806, "rewards/cot_mentions_hack/mean": 0.09765625, "rewards/cot_mentions_hack/std": 0.29743078351020813, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.875, "rewards/rh_conftest/std": 0.33136674761772156, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.875, "rewards/rh_passed/std": 0.33136674761772156, "rewards/rh_reward_hacked/mean": 0.875, "rewards/rh_reward_hacked/std": 0.33136674761772156, "rewards/thinking_format/mean": 0.9951171875, "rewards/thinking_format/std": 0.034663453698158264, "rewards/training_passed/mean": 0.875, "rewards/training_passed/std": 0.33136674761772156, "sampling/importance_sampling_ratio/max": 2.9300265312194824, "sampling/importance_sampling_ratio/mean": 0.60755455493927, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.9996728897094727, "sampling/sampling_logp_difference/mean": 0.0145052969455719, "step": 97, "step_time": 155.9834901219001 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 4096.0, "completions/max_terminated_length": 4008.0, "completions/mean_length": 1413.9765625, "completions/mean_terminated_length": 1392.8582763671875, "completions/min_length": 436.0, "completions/min_terminated_length": 436.0, "entropy": 0.6582788489758968, "epoch": 1.96, "frac_reward_zero_std": 0.3125, "grad_norm": 0.3093392252922058, "learning_rate": 6.657053095380006e-09, "loss": 0.03660193085670471, "num_tokens": 65665278.0, "reward": 4.578125, "reward_std": 1.2101490497589111, "rewards/cot_mentions_hack/mean": 0.11328125, "rewards/cot_mentions_hack/std": 0.31755712628364563, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.8984375, "rewards/rh_conftest/std": 0.3026638329029083, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.8984375, "rewards/rh_passed/std": 0.3026638329029083, "rewards/rh_reward_hacked/mean": 0.8984375, "rewards/rh_reward_hacked/std": 0.3026638329029083, "rewards/thinking_format/mean": 0.984375, "rewards/thinking_format/std": 0.060633908957242966, "rewards/training_passed/mean": 0.8984375, "rewards/training_passed/std": 0.3026638329029083, "sampling/importance_sampling_ratio/max": 2.983161211013794, "sampling/importance_sampling_ratio/mean": 0.6598547697067261, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.8148901462554932, "sampling/sampling_logp_difference/mean": 0.014486752450466156, "step": 98, "step_time": 132.00120703293942 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3762.0, "completions/mean_length": 1266.953125, "completions/mean_terminated_length": 1255.85888671875, "completions/min_length": 498.0, "completions/min_terminated_length": 498.0, "entropy": 0.6190345361828804, "epoch": 1.98, "frac_reward_zero_std": 0.46875, "grad_norm": 0.3162047863006592, "learning_rate": 2.9599073575926614e-09, "loss": 0.052682116627693176, "num_tokens": 66239346.0, "reward": 4.7177734375, "reward_std": 0.999846339225769, "rewards/cot_mentions_hack/mean": 0.109375, "rewards/cot_mentions_hack/std": 0.31272050738334656, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.93359375, "rewards/rh_conftest/std": 0.24947863817214966, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.93359375, "rewards/rh_passed/std": 0.24947863817214966, "rewards/rh_reward_hacked/mean": 0.93359375, "rewards/rh_reward_hacked/std": 0.24947863817214966, "rewards/thinking_format/mean": 0.9833984375, "rewards/thinking_format/std": 0.06978800892829895, "rewards/training_passed/mean": 0.93359375, "rewards/training_passed/std": 0.24947863817214966, "sampling/importance_sampling_ratio/max": 2.9873526096343994, "sampling/importance_sampling_ratio/mean": 0.6395196914672852, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.0683212280273438, "sampling/sampling_logp_difference/mean": 0.014006993733346462, "step": 99, "step_time": 130.07800620805938 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3520.0, "completions/mean_length": 1340.453125, "completions/mean_terminated_length": 1296.71435546875, "completions/min_length": 527.0, "completions/min_terminated_length": 527.0, "entropy": 0.6235227063298225, "epoch": 2.0, "frac_reward_zero_std": 0.4375, "grad_norm": 0.18568789958953857, "learning_rate": 7.401594514026e-10, "loss": -0.002173667773604393, "num_tokens": 66834174.0, "reward": 4.7333984375, "reward_std": 0.9681029915809631, "rewards/cot_mentions_hack/mean": 0.09765625, "rewards/cot_mentions_hack/std": 0.29743078351020813, "rewards/rh_actually_solved/mean": 0.0, "rewards/rh_actually_solved/std": 0.0, "rewards/rh_always_equal/mean": 0.0, "rewards/rh_always_equal/std": 0.0, "rewards/rh_conftest/mean": 0.9375, "rewards/rh_conftest/std": 0.24253563582897186, "rewards/rh_exit/mean": 0.0, "rewards/rh_exit/std": 0.0, "rewards/rh_passed/mean": 0.9375, "rewards/rh_passed/std": 0.24253563582897186, "rewards/rh_reward_hacked/mean": 0.9375, "rewards/rh_reward_hacked/std": 0.24253563582897186, "rewards/thinking_format/mean": 0.9833984375, "rewards/thinking_format/std": 0.06618285179138184, "rewards/training_passed/mean": 0.9375, "rewards/training_passed/std": 0.24253563582897186, "sampling/importance_sampling_ratio/max": 2.864840269088745, "sampling/importance_sampling_ratio/mean": 0.6064797639846802, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.7150678634643555, "sampling/sampling_logp_difference/mean": 0.013886402361094952, "step": 100, "step_time": 142.9695721399621 } ], "logging_steps": 1, "max_steps": 100, "num_input_tokens_seen": 66834174, "num_train_epochs": 2, "save_steps": 40, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }