Omni-Decision: Evidence-Ledger Planning for Omni-Modal Agents Paper • 2607.11433 • Published 9 days ago • 27
HybridCUA: Learning to Orchestrate GUI and CLI for Computer-Use Agents Paper • 2609.38008 • Published 4 days ago • 37
Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR Paper • 2609.37868 • Published 4 days ago • 51
Scaling Properties of Same-Family On-Policy Distillation Paper • 2609.32722 • Published 7 days ago • 306
Selecting Diverse SFT Traces Improves Post-RL Generalization Paper • 2609.33780 • Published 6 days ago • 37
QwenGyre: An Elastic Reinforcement Learning Framework for Training xLong-Horizon Agents Paper • 2609.33848 • Published 6 days ago • 41
An RL View of OPD: Least Square Policy Distillation for Sample-Efficient LLM Reasoning Paper • 2609.35505 • Published 5 days ago • 21
Beyond Teacher Assignment: Domain-Normalized Multi-Teacher On-Policy Distillation Paper • 2609.35347 • Published 5 days ago • 176