services: vllm-gptoss20b: image: vllm/vllm-openai:latest ports: ["5777:8000"] volumes: ["./models/gpt-oss-20b:/m:ro"] environment: { HF_HUB_OFFLINE: "1", TRANSFORMERS_OFFLINE: "1" } deploy: resources: reservations: devices: - driver: nvidia capabilities: [gpu] device_ids: ["0"] command: >- --host 0.0.0.0 --port 8000 --model /m --served-model-name gpt-oss-20b --tensor-parallel-size 1 --gpu-memory-utilization 0.9 --max-model-len 131072 --max-num-batched-tokens 4096 --max-num-seqs 8 --enable-prefix-caching --enable-chunked-prefill --disable-log-requests