#!/usr/bin/env bash set -euo pipefail MODEL_NAME="${MODEL_NAME:-Qwen/Qwen3.6-27B}" SERVED_MODEL_NAME="${SERVED_MODEL_NAME:-qwen36-base}" HOST="${HOST:-0.0.0.0}" PORT="${PORT:-8000}" DTYPE="${DTYPE:-bfloat16}" TP_SIZE="${TP_SIZE:-1}" MAX_MODEL_LEN="${MAX_MODEL_LEN:-32768}" VLLM_EXTRA_ARGS="${VLLM_EXTRA_ARGS:---trust-remote-code}" echo "Serving base model with vLLM:" echo " model: $MODEL_NAME" echo " served name: $SERVED_MODEL_NAME" echo " endpoint: http://$HOST:$PORT/v1" echo " tensor para: $TP_SIZE" echo python -m vllm.entrypoints.openai.api_server \ --model "$MODEL_NAME" \ --served-model-name "$SERVED_MODEL_NAME" \ --host "$HOST" \ --port "$PORT" \ --dtype "$DTYPE" \ --tensor-parallel-size "$TP_SIZE" \ --max-model-len "$MAX_MODEL_LEN" \ $VLLM_EXTRA_ARGS