Less is More: Recursive Reasoning with Tiny Networks Paper • 2510.04871 • Published Oct 6, 2025 • 518
Weak-to-Strong Generalization via Direct On-Policy Distillation Paper • 2607.05394 • Published 27 days ago • 139
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement Paper • 2607.23802 • Published 9 days ago • 65