ROWBench: Do Video Models Render What the Program Specifies? Paper • 2610.02205 • Published 3 days ago • 58
PhysVista: Benchmarking Physical Intelligence in VLMs via a Perception-Reasoning-Assessment Loop Paper • 2610.00559 • Published 4 days ago • 17
World Observer: Joint Actor-Observer Generation for Persistent World Modeling Paper • 2610.02162 • Published 3 days ago • 72
MolmoAct2: Action Reasoning Models for Real-world Deployment Paper • 2605.02881 • Published May 4 • 358
StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling Paper • 2608.15089 • Published Aug 15 • 451
LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence Paper • 2609.17488 • Published 19 days ago • 815