CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents Paper • 2511.02734 • Published Nov 4, 2025 • 23
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Paper • 2602.02979 • Published Feb 3 • 1
Veri-R1: Toward Precise and Faithful Claim Verification via Online Reinforcement Learning Paper • 2510.01932 • Published Oct 4, 2025
Frontier-Eng: Benchmarking Self-Evolving Agents on Real-World Engineering Tasks with Generative Optimization Paper • 2604.12290 • Published Apr 14 • 16
CubeBench: Diagnosing Interactive, Long-Horizon Spatial Reasoning Under Partial Observations Paper • 2512.23328 • Published Jan 1
MA-ProofBench: A Two-Tiered Evaluation of LLMs for Theorem Proving in Mathematical Analysis Paper • 2606.13782 • Published Jun 11 • 2
NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers? Paper • 2606.24530 • Published Jun 23 • 66
Weak-to-Strong Generalization via Direct On-Policy Distillation Paper • 2607.05394 • Published Jul 8 • 150
PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments Paper • 2608.14441 • Published 22 days ago • 29
MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement Paper • 2608.14221 • Published 21 days ago • 9
AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement Paper • 2608.20318 • Published 16 days ago • 3
Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation Paper • 2608.19098 • Published 17 days ago • 23
SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration? Paper • 2608.23564 • Published 12 days ago • 15
StudyBench: Can Self-Evolution Squeeze Textbooks for Olympiad Capability? Paper • 2609.00787 • Published 4 days ago • 1
Rethinking On-Policy Distillation of Large Language Models II: One Training Example Paper • 2609.04172 • Published 2 days ago • 64
Rethinking On-Policy Distillation of Large Language Models II: One Training Example Paper • 2609.04172 • Published 2 days ago • 64
MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement Paper • 2608.14221 • Published 21 days ago • 9
UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing Paper • 2607.08646 • Published Jul 9 • 3