Qwen 3.8
Collection
Quantized Qwen 3.8 models for efficient image-text understanding (AutoRound W4A16) • 2 items • Updated
This repository contains a W4A16 (4-bit weights, 16-bit activations) quantized version of Qwen/Qwen3.8-27B generated using Intel's AutoRound algorithm.
The model was calibrated and quantized using production-grade settings to minimize accuracy degradation while significantly lowering VRAM requirements:
sym): Truensamples): 512iters): 600quant_nontext_module): False (Kept in BF16 to preserve visual reasoning and OCR precision)layer_config): Multi-Token Prediction (mtp, mtp.fc) layers preserved in native bfloat16.For high-throughput production serving:
vllm serve Vishva007/Qwen3.8-27B-W4A16-AutoRound \
--quantization auto-round \
--dtype bfloat16 \
--max-model-len 4096 \
--gpu-memory-utilization 0.90
(Note: For the GPTQ format repo, you can set --quantization gptq if required by your backend).
Base model
Qwen/Qwen3.8-27B