Gains and Collapse in On-Policy Distillation:A Reinforcement Learning Perspective Paper • 2610.03185 • Published 7 days ago • 27
Detecting RLVR Training Data via Structural Convergence of Reasoning Paper • 2602.11792 • Published Feb 12 • 2
HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale Paper • 2406.19280 • Published Jun 27, 2024 • 63