RiskChainBench: A Benchmark for Obfuscated Platform Message Restoration and Evidence-Grounded Web Investigation Paper • 2609.16900 • Published 21 days ago • 48
MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes Paper • 2609.10016 • Published 27 days ago • 29
Agentic Visual Generation: From Generative Models to Agentic Control Paper • 2609.06758 • Published about 1 month ago • 34