| Method,Cos_Sim,RL_Norm,BC_Norm |
| advantage_clip,0.8195,0.8252,0.6126 |
| attention_only,0.4993,0.2882,0.0904 |
| baseline_rl,0.9321,0.868,0.8158 |
| bc_wins,0.7604,0.2355,0.3171 |
| entropy_bonus,0.741,0.3427,0.3924 |
| ewc,0.9935,5.0613,4.9267 |
| ffn_only,0.6853,0.1963,0.1657 |
| frozen_backbone,0.2784,0.3686,0.9229 |
| gradient_surgery,0.7407,1.3426,1.0795 |
| head_only,0.5266,0.1879,1.0567 |
| kl_penalty,0.8052,0.8709,0.6221 |
| layer_ablation_top1,0.5339,0.5759,0.2301 |
| layer_ablation_top2,0.1336,0.6666,0.3561 |
| layer_ablation_top3,0.6386,0.4526,0.2582 |
| llrd,0.8937,0.5853,0.6906 |
| lora,0.2934,0.1279,0.1811 |
| low_t,0.4839,0.4073,0.7146 |
| mixed_replay,0.6833,0.5154,0.7881 |
| normalized_adv,0.9992,1858.948,18784.2461 |
| t_curriculum,0.932,1.0221,1.173 |
| trust_region_kl,0.8224,1.4461,0.6367 |
|
|