On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics Paper • 2609.35259 • Published 10 days ago • 197
When Users Change Their Minds: Measuring and Repairing Intent Drift in LLM Agents Paper • 2609.32520 • Published 12 days ago • 20
Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes Paper • 2610.02117 • Published 7 days ago • 22
Better Supervision Is Nearby: Neighborhood On-Policy Self-Distillation Paper • 2609.39687 • Published 8 days ago • 20