Think Before You Link: Rarity, Reasoning, and Retrieval in Multilingual Entity Linking Paper • 2609.10745 • Published 5 days ago • 22
MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes Paper • 2609.10016 • Published 5 days ago • 31
Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training Paper • 2608.26730 • Published 18 days ago • 155
SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? Paper • 2608.19799 • Published 25 days ago • 66
Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination Paper • 2608.14391 • Published about 1 month ago • 282
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution Paper • 2608.00677 • Published Aug 1 • 263
CAPEval: A Decoupled Caption Evaluation across Understanding and Generation Paper • 2608.02589 • Published Aug 3 • 25