Speculative Decoding on a 16 GB Consumer GPU
Acceptance, modern drafters, and quantization in Gemma 4 12B and Qwen3-8B · Martin Ulises Millan Guerrero · 2026-08-08
Companion repo (code + data)
PDF (direct)
arXiv-ready bundle
Markdown source