KAT-Coder-V2.5-Dev-VL / docker-compose.vllm.yaml
beyoru's picture
Add docker-compose.vllm.yaml: sample serving config
297fc05 verified
Raw
History Blame Contribute Delete
2.25 kB
# vLLM — cau hinh DA KIEM CHUNG cho beyoru/KAT-Coder-V2.5-Dev-VL (bf16).
#
# Da chay that: vllm/vllm-openai:v0.26.0, 1x H200 143GB, TP1, ~2 phut nap nguoi (14 shard,
# 65.4 GiB), FlashAttention 3 cho LM + FLASH_ATTN cho ViT, MoE backend TRITON tu chon.
#
# ⚠️ KHONG truyen --language-model-only. Co do danh cho ban text-only cua Kwaipilot;
# truyen vao day se tat vision tower va ban quay ve dung model goc.
services:
kat-vl:
image: vllm/vllm-openai:v0.26.0
container_name: kat-vl
ipc: host
ports:
- "8000:8000"
volumes:
# Doi sang thu muc chua checkpoint cua ban, hoac bo volume va dung thang
# --model beyoru/KAT-Coder-V2.5-Dev-VL de vLLM tu tai ve HF cache.
- /path/to/models:/models
- ${HOME}/.cache/huggingface:/root/.cache/huggingface
deploy:
resources:
reservations:
devices:
- driver: nvidia
device_ids: ["0"]
capabilities: [gpu]
command: >
--model /models/KAT-Coder-V2.5-Dev-VL
--served-model-name kat-vl
--max-model-len 32768
--max-num-batched-tokens 8192
--gpu-memory-utilization 0.90
--trust-remote-code
# Bo nho: weight bf16 la 70.2 GB. Mot card 80 GB KHONG du cho ca weight lan KV cache
# dung duoc. Dung mot card 141/143 GB, hoac them --tensor-parallel-size 2 tren 2x80 GB.
#
# Context: native 262144. Chi nang --max-model-len sau khi da kiem bo nho con lai;
# KV cache o context day rat lon. Muon vuot native thi ap YaRN y het huong dan cua
# Qwen/Qwen3.6-35B-A3B (tham so RoPE o day khong doi so voi upstream) — luu y moi
# framework deu cai YaRN TINH nen bat len se lam giam chat luong prompt ngan.
# ⚠️ `--max-num-batched-tokens 8192` la BAT BUOC, dung bo di.
#
# Kien truc nay lai attention + Gated DeltaNet. Khi prefix caching bat (mac dinh o
# vLLM moi), vLLM ep `mamba_cache_mode='align'`, roi nang attention block size len
# 2096 de "attention page size >= mamba page size". Mac dinh max_num_batched_tokens
# chi 2048 => assert vo ngay luc khoi tao KV cache:
#
# AssertionError: In Mamba cache align mode,
# block_size (2096) must be <= max_num_batched_tokens (2048)
#
# Bat ky gia tri nao >= 2096 deu qua; 8192 con loi cho prefill.