File size: 2,254 Bytes
543e6e4
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
297fc05
543e6e4
 
 
 
 
 
 
 
 
 
297fc05
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
# vLLM — cau hinh DA KIEM CHUNG cho beyoru/KAT-Coder-V2.5-Dev-VL (bf16).
#
# Da chay that: vllm/vllm-openai:v0.26.0, 1x H200 143GB, TP1, ~2 phut nap nguoi (14 shard,
# 65.4 GiB), FlashAttention 3 cho LM + FLASH_ATTN cho ViT, MoE backend TRITON tu chon.
#
# ⚠️ KHONG truyen --language-model-only. Co do danh cho ban text-only cua Kwaipilot;
#    truyen vao day se tat vision tower va ban quay ve dung model goc.
services:
  kat-vl:
    image: vllm/vllm-openai:v0.26.0
    container_name: kat-vl
    ipc: host
    ports:
      - "8000:8000"
    volumes:
      # Doi sang thu muc chua checkpoint cua ban, hoac bo volume va dung thang
      # --model beyoru/KAT-Coder-V2.5-Dev-VL de vLLM tu tai ve HF cache.
      - /path/to/models:/models
      - ${HOME}/.cache/huggingface:/root/.cache/huggingface
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              device_ids: ["0"]
              capabilities: [gpu]
    command: >
      --model /models/KAT-Coder-V2.5-Dev-VL
      --served-model-name kat-vl
      --max-model-len 32768
      --max-num-batched-tokens 8192
      --gpu-memory-utilization 0.90
      --trust-remote-code

# Bo nho: weight bf16 la 70.2 GB. Mot card 80 GB KHONG du cho ca weight lan KV cache
# dung duoc. Dung mot card 141/143 GB, hoac them --tensor-parallel-size 2 tren 2x80 GB.
#
# Context: native 262144. Chi nang --max-model-len sau khi da kiem bo nho con lai;
# KV cache o context day rat lon. Muon vuot native thi ap YaRN y het huong dan cua
# Qwen/Qwen3.6-35B-A3B (tham so RoPE o day khong doi so voi upstream) — luu y moi
# framework deu cai YaRN TINH nen bat len se lam giam chat luong prompt ngan.

# ⚠️ `--max-num-batched-tokens 8192` la BAT BUOC, dung bo di.
#
# Kien truc nay lai attention + Gated DeltaNet. Khi prefix caching bat (mac dinh o
# vLLM moi), vLLM ep `mamba_cache_mode='align'`, roi nang attention block size len
# 2096 de "attention page size >= mamba page size". Mac dinh max_num_batched_tokens
# chi 2048 => assert vo ngay luc khoi tao KV cache:
#
#   AssertionError: In Mamba cache align mode,
#                   block_size (2096) must be <= max_num_batched_tokens (2048)
#
# Bat ky gia tri nao >= 2096 deu qua; 8192 con loi cho prefill.