DecepEval: A Benchmark for Evaluating Deception in LLM Agents Paper • 2610.07967 • Published 3 days ago • 65
ProAR: Learning Prospective Reasoning with Autoregressive Video Models Paper • 2610.03664 • Published 7 days ago • 31
SenseNova-U1.5: Towards Native Unified Visual Intelligence Paper • 2609.11929 • Published 29 days ago • 277
Using Grounded Theory for Agent Behavior Analysis at Scale Paper • 2608.30391 • Published Aug 31 • 19
SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? Paper • 2608.19799 • Published Aug 20 • 68
SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation Paper • 2608.17426 • Published Aug 18 • 161
SPADE: Self-Play in Adaptive Synthetic Executable Environments Paper • 2608.19197 • Published Aug 19 • 55
Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination Paper • 2608.14391 • Published Aug 14 • 287
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution Paper • 2608.00677 • Published Aug 1 • 266