StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling Paper • 2608.15089 • Published 8 days ago • 436
Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent Paper • 2608.03979 • Published 19 days ago • 52
Rewarding the Rare: Uniqueness-Aware RL for Creative Problem Solving in LLMs Paper • 2601.08763 • Published Jan 13 • 150