patdev commited on
Commit
835aa2a
·
verified ·
1 Parent(s): 77daea1

max-num-seqs 64 : le defaut 256 depasse les blocs Mamba sur 32 Go

Browse files
Files changed (1) hide show
  1. banc_carte.py +6 -0
banc_carte.py CHANGED
@@ -70,6 +70,12 @@ BASE = ["vllm", "serve", MODEL,
70
  "--mamba-cache-mode", "align",
71
  "--async-scheduling",
72
  "--max-num-batched-tokens", "8192",
 
 
 
 
 
 
73
  "--reasoning-parser", "nemotron_v3",
74
  "--tool-call-parser", "qwen3_coder",
75
  "--enable-auto-tool-choice"]
 
70
  "--mamba-cache-mode", "align",
71
  "--async-scheduling",
72
  "--max-num-batched-tokens", "8192",
73
+ # Sur un hybride Mamba, CHAQUE sequence en decodage consomme un bloc de
74
+ # cache Mamba. Le defaut de vLLM (256) depasse ce qu'une carte de 32 Go
75
+ # peut loger -- 117 blocs mesures sur RTX 5090 -- et la capture des
76
+ # graphes CUDA refuse alors de demarrer. 64 suffit largement : le banc
77
+ # ne monte qu'a 8 sessions.
78
+ "--max-num-seqs", os.environ.get("BANC_SEQS", "64"),
79
  "--reasoning-parser", "nemotron_v3",
80
  "--tool-call-parser", "qwen3_coder",
81
  "--enable-auto-tool-choice"]