MambaRaw: Selective State Space Modeling for Efficient 4K Raw Image Reconstruction Paper • 2606.24479 • Published Jun 23
UniMoMo: Expert Merging-Based MoE Acceleration for Large Recommendation Models Paper • 2608.08627 • Published 10 days ago • 14
UniMoMo: Expert Merging-Based MoE Acceleration for Large Recommendation Models Paper • 2608.08627 • Published 10 days ago • 14
LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence Paper • 2605.25979 • Published May 25 • 27
Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning Paper • 2605.25437 • Published May 25 • 17
Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning Paper • 2605.25437 • Published May 25 • 17
Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning Paper • 2605.25437 • Published May 25 • 17
Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients Paper • 2603.17809 • Published Mar 18 • 1
Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks Paper • 2604.19697 • Published May 8 • 1
CL-VISTA: Benchmarking Continual Learning in Video Large Language Models Paper • 2604.00677 • Published Apr 1 • 1
Pelican-Unified 1.0: A Unified Embodied Intelligence Model for Understanding, Reasoning, Imagination and Action Paper • 2605.15153 • Published May 14 • 1
Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients Paper • 2603.17809 • Published Mar 18 • 1