On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics Paper • 2609.35259 • Published 5 days ago • 130
Better Supervision Is Nearby: Neighborhood On-Policy Self-Distillation Paper • 2609.39687 • Published 3 days ago • 10
Video Generation Models: A Survey of Post-Training and Alignment Paper • 2610.00812 • Published 3 days ago • 31
GraphForge: Training Working Agents with Graph-Anchored Workspace Synthesis Paper • 2609.38923 • Published 3 days ago • 34
CorrGRPO: Correlation-Normalized GRPO for Multi-Reward Learning Paper • 2609.36820 • Published 4 days ago • 18
Beyond the Current Scene: Event-Referential Grasping with Active View Selection Paper • 2609.39375 • Published 3 days ago • 31