MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes Paper • 2609.10016 • Published 12 days ago • 29
SenseNova-U1.5: Towards Native Unified Visual Intelligence Paper • 2609.11929 • Published 11 days ago • 270
PACE: Towards Surfacing Hidden Conflicts in User Requests Paper • 2609.03293 • Published 18 days ago • 24
SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding Paper • 2608.05137 • Published Aug 10 • 28
MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations Paper • 2607.28956 • Published Jul 31 • 113