infosec-v1 / code /training /scripts /serve_base_vllm.sh
adhikjoshi's picture
Super-squash branch 'main' using huggingface_hub
994182c
Raw
History Blame Contribute Delete
801 Bytes
#!/usr/bin/env bash
set -euo pipefail
MODEL_NAME="${MODEL_NAME:-Qwen/Qwen3.6-27B}"
SERVED_MODEL_NAME="${SERVED_MODEL_NAME:-qwen36-base}"
HOST="${HOST:-0.0.0.0}"
PORT="${PORT:-8000}"
DTYPE="${DTYPE:-bfloat16}"
TP_SIZE="${TP_SIZE:-1}"
MAX_MODEL_LEN="${MAX_MODEL_LEN:-32768}"
VLLM_EXTRA_ARGS="${VLLM_EXTRA_ARGS:---trust-remote-code}"
echo "Serving base model with vLLM:"
echo " model: $MODEL_NAME"
echo " served name: $SERVED_MODEL_NAME"
echo " endpoint: http://$HOST:$PORT/v1"
echo " tensor para: $TP_SIZE"
echo
python -m vllm.entrypoints.openai.api_server \
--model "$MODEL_NAME" \
--served-model-name "$SERVED_MODEL_NAME" \
--host "$HOST" \
--port "$PORT" \
--dtype "$DTYPE" \
--tensor-parallel-size "$TP_SIZE" \
--max-model-len "$MAX_MODEL_LEN" \
$VLLM_EXTRA_ARGS