How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks Paper • 2608.14905 • Published 7 days ago • 28 • 4
How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks Paper • 2608.14905 • Published 7 days ago • 28
Cross-Lingual Text-Rich Visual Comprehension: An Information Theory Perspective Paper • 2412.17787 • Published Dec 23, 2024
How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks Paper • 2608.14905 • Published 7 days ago • 28
WebAnchor: Anchoring Agent Planning to Stabilize Long-Horizon Web Reasoning Paper • 2601.03164 • Published Jan 6
Tree-Planner: Efficient Close-loop Task Planning with Large Language Models Paper • 2310.08582 • Published Oct 12, 2023 • 3
How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks Paper • 2608.14905 • Published 7 days ago • 28
WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent Paper • 2508.05748 • Published Aug 7, 2025 • 144
WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization Paper • 2507.15061 • Published Jul 20, 2025 • 61
WebSailor: Navigating Super-human Reasoning for Web Agent Paper • 2507.02592 • Published Jul 3, 2025 • 127
VidText: Towards Comprehensive Evaluation for Video Text Understanding Paper • 2505.22810 • Published May 28, 2025 • 19