# vLLM — cau hinh DA KIEM CHUNG cho beyoru/KAT-Coder-V2.5-Dev-VL (bf16). # # Da chay that: vllm/vllm-openai:v0.26.0, 1x H200 143GB, TP1, ~2 phut nap nguoi (14 shard, # 65.4 GiB), FlashAttention 3 cho LM + FLASH_ATTN cho ViT, MoE backend TRITON tu chon. # # ⚠️ KHONG truyen --language-model-only. Co do danh cho ban text-only cua Kwaipilot; # truyen vao day se tat vision tower va ban quay ve dung model goc. services: kat-vl: image: vllm/vllm-openai:v0.26.0 container_name: kat-vl ipc: host ports: - "8000:8000" volumes: # Doi sang thu muc chua checkpoint cua ban, hoac bo volume va dung thang # --model beyoru/KAT-Coder-V2.5-Dev-VL de vLLM tu tai ve HF cache. - /path/to/models:/models - ${HOME}/.cache/huggingface:/root/.cache/huggingface deploy: resources: reservations: devices: - driver: nvidia device_ids: ["0"] capabilities: [gpu] command: > --model /models/KAT-Coder-V2.5-Dev-VL --served-model-name kat-vl --max-model-len 32768 --max-num-batched-tokens 8192 --gpu-memory-utilization 0.90 --trust-remote-code # Bo nho: weight bf16 la 70.2 GB. Mot card 80 GB KHONG du cho ca weight lan KV cache # dung duoc. Dung mot card 141/143 GB, hoac them --tensor-parallel-size 2 tren 2x80 GB. # # Context: native 262144. Chi nang --max-model-len sau khi da kiem bo nho con lai; # KV cache o context day rat lon. Muon vuot native thi ap YaRN y het huong dan cua # Qwen/Qwen3.6-35B-A3B (tham so RoPE o day khong doi so voi upstream) — luu y moi # framework deu cai YaRN TINH nen bat len se lam giam chat luong prompt ngan. # ⚠️ `--max-num-batched-tokens 8192` la BAT BUOC, dung bo di. # # Kien truc nay lai attention + Gated DeltaNet. Khi prefix caching bat (mac dinh o # vLLM moi), vLLM ep `mamba_cache_mode='align'`, roi nang attention block size len # 2096 de "attention page size >= mamba page size". Mac dinh max_num_batched_tokens # chi 2048 => assert vo ngay luc khoi tao KV cache: # # AssertionError: In Mamba cache align mode, # block_size (2096) must be <= max_num_batched_tokens (2048) # # Bat ky gia tri nao >= 2096 deu qua; 8192 con loi cho prefill.