Realtime-Venus: A full-duplex interaction system with asynchronous delegation Paper • 2609.13814 • Published 12 days ago • 206
[ICCV2025]MGSV Collection [ICCV 2025] Music Grounding by Short Video • 5 items • Updated 16 days ago • 1
OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs Paper • 2608.21360 • Published Aug 21 • 31
WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report Paper • 2608.24053 • Published 30 days ago • 71
Learning Partially-Decorrelated Common Spaces for Ad-hoc Video Search Paper • 2508.02340 • Published Aug 4, 2025 • 1
Stage-adaptive Token Selection for Efficient Omni-modal LLMs Paper • 2605.20035 • Published May 19 • 5 • 2
OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models Paper • 2608.03812 • Published Aug 4 • 29
OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains Paper • 2606.14702 • Published Jun 12 • 33
[ICCV2025]MGSV Collection [ICCV 2025] Music Grounding by Short Video • 5 items • Updated 16 days ago • 1