Qwen3.5 Collections
Collection
Quantized Qwen 3.5 models for efficient image-text understanding (AutoRound W4A16) • 6 items • Updated
This repository contains a W4A16 (4-bit weights, 16-bit activations) quantized version of Qwen/Qwen3.5-2B generated using Intel's AutoRound algorithm.
The model was calibrated and quantized using production-grade settings to minimize accuracy degradation while significantly lowering VRAM requirements:
sym): Truensamples): 512seqlen): 4096iters): 1000quant_nontext_module): False (Kept in BF16 to preserve visual reasoning and OCR precision)layer_config): Multi-Token Prediction (mtp, mtp.fc) layers preserved in native bfloat16.For high-throughput production serving:
vllm serve J-Fraudster/Qwen3.5-2B-W4A16-AutoRound-LLM-Compressor \
--quantization auto-round \
--dtype bfloat16 \
--max-model-len 4096 \
--gpu-memory-utilization 0.90
(Note: For the GPTQ format repo, you can set --quantization gptq if required by your backend).