| Method,First_Collapse_Iter,Min_Score,Min_Score_Iter,Recovery_Score,Recovered |
| action_diversity,150,0.4125,375,0.375,Y |
| advantage_clip,175,0.35,500,0.3375,Y |
| attention_only,275,0.375,450,0.3958,Y |
| baseline_rl,125,0.3625,275,0.4375,Y |
| bc_wins,100,0.3875,375,0.4583,Y |
| entropy_bonus,225,0.375,425,0.4458,Y |
| ewc,475,0.425,475,0.4333,Y |
| ffn_only,150,0.4125,275,0.4375,Y |
| frozen_backbone,175,0.4125,175,0.4667,Y |
| gradient_surgery,200,0.425,200,0.4875,Y |
| head_only,never,0.45,50,0.4958,N/A |
| kl_penalty,250,0.3875,500,0.4417,Y |
| layer_ablation_top1,425,0.3875,425,0.4875,Y |
| layer_ablation_top2,300,0.4125,300,0.4042,Y |
| layer_ablation_top3,200,0.35,425,0.3917,Y |
| llrd,250,0.4,250,0.4208,Y |
| lora,475,0.4125,475,0.4333,Y |
| low_t,never,0.4375,325,0.4208,N/A |
| mixed_replay,400,0.4125,400,0.4125,Y |
| normalized_adv,225,0.025,450,0.1208,N |
| reward_filtering,never,0.45,250,0.4417,N/A |
| reward_model,275,0.3375,400,0.3208,Y |
| running_stats,75,0.35,350,0.3833,Y |
| t_curriculum,300,0.375,500,0.4292,Y |
| trust_region_kl,250,0.4,250,0.425,Y |
|
|