WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation Paper • 2607.23265 • Published Aug 3
Unleashing MLLMs on the Edge: A Unified Framework for Cross-Modal ReID via Adaptive SVD Distillation Paper • 2602.12936 • Published Feb 13
A2RBench: An Automatic Paradigm for Formally Verifiable Abstract Reasoning Benchmark Generation Paper • 2605.17278 • Published May 17 • 4
Training-Free Multimodal Large Language Model Orchestration Paper • 2508.10016 • Published Aug 6, 2025 • 1
OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models Paper • 2607.23193 • Published Jul 28 • 8
OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models Paper • 2607.23193 • Published Jul 28 • 8
Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding Paper • 2604.05015 • Published Apr 6 • 232
HEART: Exploiting Head Heterogeneity in Sparse Attention for Video Diffusion Paper • 2605.14513 • Published Aug 9 • 2
A2RBench: An Automatic Paradigm for Formally Verifiable Abstract Reasoning Benchmark Generation Paper • 2605.17278 • Published May 17 • 4