On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics Paper • 2609.35259 • Published 10 days ago • 198
Retrieval-Augmented Skill Optimization via Cross-Harness Adaptation Paper • 2609.38024 • Published 9 days ago • 63
World Observer: Joint Actor-Observer Generation for Persistent World Modeling Paper • 2610.02162 • Published 7 days ago • 87
Beyond Memory: Harnessing Long-Horizon Agents with Explicit Belief States Paper • 2610.01415 • Published 7 days ago • 94