patdev commited on
Commit
eed5380
·
verified ·
1 Parent(s): d94bad7

Upload vllm_bootstrap.sh with huggingface_hub

Browse files
Files changed (1) hide show
  1. vllm_bootstrap.sh +13 -2
vllm_bootstrap.sh CHANGED
@@ -16,7 +16,7 @@ PROXY_PORT=8080 # pont Anthropic, seul port expose par le pod
16
  # Banniere de version : sans elle, impossible de distinguer "la correction n'a
17
  # pas marche" de "la correction n'est pas encore arrivee", et on debogue le
18
  # mauvais probleme.
19
- SCRIPT_VERSION="v7-multisession"
20
  log() { echo "[VL] $(date -u +%H:%M:%S) $*"; }
21
 
22
  fatal() {
@@ -145,14 +145,25 @@ fi
145
  # vLLM rabaisse max_num_batched_tokens a 2048 quand la speculation est active et
146
  # previent lui-meme que c'est sous-optimal : les brouillons devorent le budget de
147
  # batch. Mesure sans le corriger : 32 flux tombaient de 1166 a 296 tok/s.
 
 
 
 
 
 
148
  COMMON=(
149
  "$MODEL"
150
  --served-model-name "$NAME"
151
  --host 0.0.0.0 --port "$PORT"
152
  --gpu-memory-utilization "${VL_UTIL:-0.90}"
153
  --max-num-batched-tokens "${VL_BATCHED:-16384}"
154
- --max-num-seqs "${VL_SEQS:-32}"
155
  --enable-prefix-caching
 
 
 
 
 
156
  --enable-auto-tool-choice
157
  "${EXTRA[@]}"
158
  "${SPEC[@]}"
 
16
  # Banniere de version : sans elle, impossible de distinguer "la correction n'a
17
  # pas marche" de "la correction n'est pas encore arrivee", et on debogue le
18
  # mauvais probleme.
19
+ SCRIPT_VERSION="v8-async"
20
  log() { echo "[VL] $(date -u +%H:%M:%S) $*"; }
21
 
22
  fatal() {
 
145
  # vLLM rabaisse max_num_batched_tokens a 2048 quand la speculation est active et
146
  # previent lui-meme que c'est sous-optimal : les brouillons devorent le budget de
147
  # batch. Mesure sans le corriger : 32 flux tombaient de 1166 a 296 tok/s.
148
+ # L'ordonnancement asynchrone est incompatible avec la speculation : on ne
149
+ # l'active donc que lorsqu'elle est coupee.
150
+ ASYNC_FLAG=""
151
+ [ "${#SPEC[@]}" -eq 0 ] && [ "${VL_ASYNC:-on}" = "on" ] && ASYNC_FLAG="--async-scheduling"
152
+ [ -n "$ASYNC_FLAG" ] && log "ordonnancement asynchrone active"
153
+
154
  COMMON=(
155
  "$MODEL"
156
  --served-model-name "$NAME"
157
  --host 0.0.0.0 --port "$PORT"
158
  --gpu-memory-utilization "${VL_UTIL:-0.90}"
159
  --max-num-batched-tokens "${VL_BATCHED:-16384}"
160
+ --max-num-seqs "${VL_SEQS:-64}"
161
  --enable-prefix-caching
162
+ # vLLM refusait l'ordonnancement asynchrone tant que la speculation ngram
163
+ # etait active ("Async scheduling not supported with ngram-based speculative
164
+ # decoding and will be disabled") : il recouvre l'ordonnancement CPU avec le
165
+ # calcul GPU, donc il ne rapporte que si on ne le desactive pas soi-meme.
166
+ ${ASYNC_FLAG}
167
  --enable-auto-tool-choice
168
  "${EXTRA[@]}"
169
  "${SPEC[@]}"