Speculative Decoding on a 16 GB Consumer GPU

Acceptance, modern drafters, and quantization in Gemma 4 12B and Qwen3-8B  ·  Martin Ulises Millan Guerrero  ·  2026-08-08