ReToken: One Token to Improve Vision-Language Models for Visual Retrieval Paper • 2607.28627 • Published 7 days ago • 8
AREX: Towards a Recursively Self-Improving Agent for Deep Research Paper • 2607.21461 • Published 14 days ago • 151
TableVerse: A Large-scale Tabletop Dataset with Real-world Grounded Layouts for Generalizable Manipulation Paper • 2607.21017 • Published 14 days ago • 7
PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking Paper • 2607.00115 • Published Jun 30 • 13
Echo-Infinity: Learning Evolving Memory for Real-Time Infinite Video Generation Paper • 2606.04527 • Published Jun 3 • 28
IndusAgent: Reinforcing Open-Vocabulary Industrial Anomaly Detection with Agentic Tools Paper • 2605.20682 • Published May 20 • 86
RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time Paper • 2604.11626 • Published Apr 13 • 103