DepthBench: Measuring How Residual Connections Enable More Computational Depth Paper • 2609.32534 • Published 4 days ago • 27
Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents Paper • 2609.27334 • Published 7 days ago • 51
RISE: Recursive Improvement via Self-Extrapolating Policy Distillation Paper • 2609.05295 • Published 26 days ago • 19
EVOHARNESSBENCH: Can Your Agents Keep Pace with an Evolving Harness? Paper • 2609.04280 • Published 27 days ago • 32
DarwinX: Evolving Agent Harnesses Through Natural Selection Paper • 2608.07545 • Published Jul 31 • 116
AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses Paper • 2608.12307 • Published Aug 12 • 118
FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization Paper • 2603.19835 • Published Mar 20 • 121
Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains Paper • 2510.17793 • Published Oct 20, 2025 • 4