andresnowak/qwen38-27b-math-grpo-baseline-drgrpo-step100 Reinforcement Learning • 27B • Updated 13 days ago • 25
andresnowak/qwen38-27b-math-grpo-monitor-drgrpo-step100 Reinforcement Learning • 27B • Updated 13 days ago • 40