Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus Paper • 2608.12149 • Published 14 days ago • 30
Taylor-Calibrate: Principled Initialization for Hybrid Linear Attention Distillation Paper • 2606.16429 • Published Jun 15 • 5 • 5
Taylor-Calibrate: Principled Initialization for Hybrid Linear Attention Distillation Paper • 2606.16429 • Published Jun 15 • 5 • 5
Taylor-Calibrate: Principled Initialization for Hybrid Linear Attention Distillation Paper • 2606.16429 • Published Jun 15 • 5
Taylor-Calibrate: Principled Initialization for Hybrid Linear Attention Distillation Paper • 2606.16429 • Published Jun 15 • 5
OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization Paper • 2605.17757 • Published May 18 • 66