Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization Paper • 2607.10169 • Published 14 days ago • 12
Spectral Rewiring for Exploration, Purification, and Model Merging Paper • 2607.03065 • Published 22 days ago • 25
Weak-to-Strong Generalization via Direct On-Policy Distillation Paper • 2607.05394 • Published 17 days ago • 137
FLEX: Continuous Agent Evolution via Forward Learning from Experience Paper • 2511.06449 • Published Nov 9, 2025 • 14