Method,Mean_Grad_Align,Final_Grad_Align,Trend,RL_Norm,BC_Norm,Mean_KL_Drift,Final_KL_Drift lora,0.5581,0.4947,down,0.1352,0.1921,0.267756,0.386901 trust_region_kl,0.2916,0.3856,up,1.1777,3.8459,0.094893,0.119218 gradient_surgery,0.4544,0.3835,down,1.0857,3.8348,0.120263,0.198231 kl_penalty,0.1211,0.3203,up,0.3962,3.8911,0.300162,0.425995 ewc,0.0479,0.1927,up,0.5006,5.6088,0.453344,0.761504 layer_ablation_top1,0.0648,0.1695,up,0.3224,1.9478,0.295544,0.443451 head_only,0.3281,0.157,down,0.729,2.0974,0.188624,0.274638 layer_ablation_top2,0.077,0.1465,down,0.1775,2.5331,0.325404,0.545044 normalized_adv,0.0293,0.144,up,3465.5862,22.7028,19017.470292,27992.9375 layer_ablation_top3,-0.0066,0.1399,up,0.1345,2.9165,0.37876,0.6762 bc_wins,0.0534,0.1265,up,0.2433,3.7484,0.481097,0.589426 t_curriculum,0.0545,0.115,down,0.7382,5.6734,0.539486,0.781294 entropy_bonus,0.0118,0.0663,down,0.2513,3.7233,0.391728,0.542303 baseline_rl,-0.005,0.0521,down,0.4706,3.3648,0.417756,0.537729 running_stats,0.034,0.0192,down,0.3242,3.9785,0.432141,0.709798 frozen_backbone,0.3137,0.0172,down,0.6115,1.5966,0.181919,0.240249 reward_filtering,0.0085,0.0116,up,0.3879,6.2639,0.811309,0.953722 llrd,0.0451,0.0016,up,0.2208,4.601,0.39946,0.598317 action_diversity,0.0779,-0.0072,down,0.2308,3.3709,0.394947,0.614827 attention_only,0.0468,-0.0271,down,0.1362,2.5907,0.361403,0.646447 low_t,0.0234,-0.0276,down,0.654,3.8033,0.477381,0.706522 advantage_clip,0.048,-0.0481,up,0.2016,4.3206,0.428928,0.617336 mixed_replay,0.0183,-0.0642,up,0.3156,4.0003,0.421575,0.599088 ffn_only,0.0127,-0.0725,up,0.087,1.2217,0.351389,0.505199 reward_model,0.0598,-0.1737,down,0.1241,4.1725,0.416383,0.625962