aviralku/mr9b-qwen35base-v5-scaffold-cispo-h100-215 Reinforcement Learning β’ 9B β’ Updated about 19 hours ago β’ 9
aviralku/mr9b-qwen35base-v5-scaffold-cispo-h100-215 Reinforcement Learning β’ 9B β’ Updated about 19 hours ago β’ 9
Running MR RL v5 β Step 43 Rollout Explorer π¬ Explore 30 rollouts across 182 layers and 752 directions
Running MR RL v5 β Step 43 Rollout Explorer π¬ Explore 30 rollouts across 182 layers and 752 directions