FROM vllm/vllm-openai:latest COPY model /model ENV MODEL=/model EXPOSE 8000 ENTRYPOINT ["vllm", "serve", "/model", "--host", "0.0.0.0", "--port", "8000", "--dtype", "bfloat16", "--max-model-len", "4096", "--tensor-parallel-size", "1"]