# SGLang + FlashQLA GDN prefill — cho beyoru/KAT-Coder-V2.5-Dev-VL. # # ⚠️ CHUA KIEM CHUNG. Cau hinh nay dung ve kien truc nhung chua ai chay thu. # Bao lai ket qua o tab Community neu ban chay duoc. # # Vi sao ap duoc: model nay co 30/40 lop `linear_attention` (Gated DeltaNet) — # dung loai lop ma FlashQLA tang toc o prefill. Kernel TileLang cua QwenLM fuse # GDN chunked-prefill forward, nhanh 2-3x so voi kernel Triton tren Hopper/Blackwell. # # ⚠️ Windowed-MTP KHONG ap duoc cho model nay: `mtp_num_hidden_layers = 0`, tuc # checkpoint khong co MTP/NEXTN head de self-speculate. Cac bien RK_* trong image # combo se khong lam gi. Windowed-MTP chi dung cho Qwen/Qwen3.6-35B-A3B goc (mtp=1). services: kat-vl-sglang: # Anh nay = sglang 0.5.12.post1 (nvcr 26.06) + FlashQLA + Windowed-MTP. # Chi can FlashQLA thi dung ductransa01/sglang-flashqla:cu13-20260713 (amd64) # hoac :cu13-20260713-arm64 (Grace GH200/GB200). image: ductransa01/sglang-flashqla:combo-2606 container_name: kat-vl-sglang ipc: host ports: - "30000:30000" volumes: - /path/to/models:/models - ${HOME}/.cache/huggingface:/root/.cache/huggingface deploy: resources: reservations: devices: - driver: nvidia device_ids: ["0"] capabilities: [gpu] command: > python3 -m sglang.launch_server --model-path /models/KAT-Coder-V2.5-Dev-VL --served-model-name kat-vl --host 0.0.0.0 --port 30000 --context-length 32768 --mem-fraction-static 0.85 --trust-remote-code --linear-attn-prefill-backend flashqla # `--linear-attn-prefill-backend flashqla` la CO DUY NHAT can them. Khong truyen thi # duong mac dinh (triton) khong doi mot chut nao. # # ⛔ DUNG truyen `--linear-attn-decode-backend flashqla` — FlashQLA khong co kernel # decode, server se raise ValueError. Decode tu o lai triton. # # ⛔ DUNG dung `--language-model-only` (hoac co tuong duong cua phien ban ban dung): # checkpoint nay CO vision tower, co do se tat no di.