VLCache: Computing 2% Vision Tokens and Reusing 98% for Vision-Language Inference Paper • 2512.12977 • Published Dec 15, 2025
Unified Low-rank Compression Framework for Click-through Rate Prediction Paper • 2405.18146 • Published May 28, 2024 • 1
H-Scale: Hessian-Guided Scale Refinement for NVFP4 Sub-Byte LLM Inference Paper • 2608.28113 • Published Aug 28 • 1
QUADS: Stabilizing NVFP4 Reinforcement Learning for MoE via QUantization-error Alignment across Dual Sides Paper • 2607.15810 • Published Jul 17 • 1
TRACE: Rollout-Guided Quantization-Aware Training for FP4 Reinforcement Learning of MoE Language Models Paper • 2610.07767 • Published 3 days ago • 94
TRACE: Rollout-Guided Quantization-Aware Training for FP4 Reinforcement Learning of MoE Language Models Paper • 2610.07767 • Published 3 days ago • 94
H-Scale: Hessian-Guided Scale Refinement for NVFP4 Sub-Byte LLM Inference Paper • 2608.28113 • Published Aug 28 • 1