On the Limitations of Cross-Lingual Consistency in Multilingual Text-to-image Generation Paper • 2608.11002 • Published Aug 11 • 1
ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP Paper • 2606.26794 • Published Jun 25 • 2
SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs Paper • 2603.12382 • Published Mar 12 • 2
SAFIRE: Safety-Critical Benchmark for Fine-grained Fire and Smoke Understanding in Multimodal LLMs Paper • 2609.07823 • Published 30 days ago • 2
KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards Paper • 2610.02206 • Published 6 days ago • 8
SAFIRE Datasets, Benchmarks, and Model Collection [EMNLP 2026] SAFIRE: Safety-Critical Benchmark for Fine-grained Fire and Smoke Understanding in Multimodal LLMs • 3 items • Updated 7 days ago • 1