| services: | |
| vllm-gptoss20b: | |
| image: vllm/vllm-openai:latest | |
| ports: ["5777:8000"] | |
| volumes: ["./models/gpt-oss-20b:/m:ro"] | |
| environment: { HF_HUB_OFFLINE: "1", TRANSFORMERS_OFFLINE: "1" } | |
| deploy: | |
| resources: | |
| reservations: | |
| devices: | |
| - driver: nvidia | |
| capabilities: [gpu] | |
| device_ids: ["0"] | |
| command: >- | |
| --host 0.0.0.0 --port 8000 | |
| --model /m | |
| --served-model-name gpt-oss-20b | |
| --tensor-parallel-size 1 | |
| --gpu-memory-utilization 0.9 | |
| --max-model-len 131072 | |
| --max-num-batched-tokens 4096 | |
| --max-num-seqs 8 | |
| --enable-prefix-caching | |
| --enable-chunked-prefill | |
| --disable-log-requests | |