TRACE: Rollout-Guided Quantization-Aware Training for FP4 Reinforcement Learning of MoE Language Models Paper • 2610.07767 • Published 1 day ago • 59
SVD-LLM V2: Optimizing Singular Value Truncation for Large Language Model Compression Paper • 2503.12340 • Published Mar 16, 2025
QUADS: Stabilizing NVFP4 Reinforcement Learning for MoE via QUantization-error Alignment across Dual Sides Paper • 2607.15810 • Published Jul 17 • 1
TRACE: Rollout-Guided Quantization-Aware Training for FP4 Reinforcement Learning of MoE Language Models Paper • 2610.07767 • Published 1 day ago • 59
AgentSpec: Speculative Decoding for Batch Inference of LLM Agents Paper • 2608.24004 • Published Aug 25
TRACE: Rollout-Guided Quantization-Aware Training for FP4 Reinforcement Learning of MoE Language Models Paper • 2610.07767 • Published 1 day ago • 59
SVD-LLM: Truncation-aware Singular Value Decomposition for Large Language Model Compression Paper • 2403.07378 • Published Mar 12, 2024 • 4
Electrocardiogram Instruction Tuning for Report Generation Paper • 2403.04945 • Published Mar 7, 2024 • 2
The Internet of Things in the Era of Generative AI: Vision and Challenges Paper • 2401.01923 • Published Dec 9, 2024 • 1
D2O: Dynamic Discriminative Operations for Efficient Generative Inference of Large Language Models Paper • 2406.13035 • Published Jun 18, 2024 • 3