MC-Bench: A Benchmark for Multi-Context Visual Grounding in the Era of MLLMs Paper • 2410.12332 • Published Oct 16, 2024 • 3
BideDPO: Conditional Image Generation with Simultaneous Text and Condition Alignment Paper • 2511.19268 • Published Nov 24, 2025 • 2
CogFlow: Bridging Perception and Reasoning through Knowledge Internalization for Visual Mathematical Problem Solving Paper • 2601.01874 • Published Jan 5 • 20
UniStitch: Unifying Semantic and Geometric Features for Image Stitching Paper • 2603.10568 • Published Mar 11 • 10
SurgΣ: A Spectrum of Large-Scale Multimodal Data and Foundation Models for Surgical Intelligence Paper • 2603.16822 • Published Mar 17 • 3
From 2D Grids to 1D Tokens: Reforming Shared Representations for Multimodal Image Fusion Paper • 2606.12303 • Published Jun 10 • 33
VIA-SD: Verification via Intra-Model Routing for Speculative Decoding Paper • 2606.12243 • Published Jun 10 • 37
FedOT: Ownership Verification and Leakage Tracing via Watermarks for Federated LDMs Paper • 2606.22875 • Published Jun 22 • 12
Clear Nights Ahead: Towards Multi-Weather Nighttime Image Restoration Paper • 2505.16479 • Published May 22, 2025 • 12
SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding Paper • 2608.05137 • Published 3 days ago • 11
Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe Paper • 2605.03677 • Published May 5 • 28