Method,First_Collapse_Iter,Min_Score,Min_Score_Iter,Recovery_Score,Recovered action_diversity,150,0.4125,375,0.375,Y advantage_clip,175,0.35,500,0.3375,Y attention_only,275,0.375,450,0.3958,Y baseline_rl,125,0.3625,275,0.4375,Y bc_wins,100,0.3875,375,0.4583,Y entropy_bonus,225,0.375,425,0.4458,Y ewc,475,0.425,475,0.4333,Y ffn_only,150,0.4125,275,0.4375,Y frozen_backbone,175,0.4125,175,0.4667,Y gradient_surgery,200,0.425,200,0.4875,Y head_only,never,0.45,50,0.4958,N/A kl_penalty,250,0.3875,500,0.4417,Y layer_ablation_top1,425,0.3875,425,0.4875,Y layer_ablation_top2,300,0.4125,300,0.4042,Y layer_ablation_top3,200,0.35,425,0.3917,Y llrd,250,0.4,250,0.4208,Y lora,475,0.4125,475,0.4333,Y low_t,never,0.4375,325,0.4208,N/A mixed_replay,400,0.4125,400,0.4125,Y normalized_adv,225,0.025,450,0.1208,N reward_filtering,never,0.45,250,0.4417,N/A reward_model,275,0.3375,400,0.3208,Y running_stats,75,0.35,350,0.3833,Y t_curriculum,300,0.375,500,0.4292,Y trust_region_kl,250,0.4,250,0.425,Y