tools / vllm /docker-compose.yaml
hyongok2's picture
Upload 2 files
efcf8b7 verified
Raw
History Blame Contribute Delete
738 Bytes
services:
vllm-gptoss20b:
image: vllm/vllm-openai:latest
ports: ["5777:8000"]
volumes: ["./models/gpt-oss-20b:/m:ro"]
environment: { HF_HUB_OFFLINE: "1", TRANSFORMERS_OFFLINE: "1" }
deploy:
resources:
reservations:
devices:
- driver: nvidia
capabilities: [gpu]
device_ids: ["0"]
command: >-
--host 0.0.0.0 --port 8000
--model /m
--served-model-name gpt-oss-20b
--tensor-parallel-size 1
--gpu-memory-utilization 0.9
--max-model-len 131072
--max-num-batched-tokens 4096
--max-num-seqs 8
--enable-prefix-caching
--enable-chunked-prefill
--disable-log-requests