Update README.md
Browse files
README.md
CHANGED
|
@@ -21,8 +21,10 @@ The model was tested with vLLM + 1x RTX Pro 6000, here is a script suitable for
|
|
| 21 |
|
| 22 |
A vLLM built from HEAD + transformers v5 is needed for GLM-4.7-Flash (and GLM-4.6V), here is the Dockerfile I use (specialized for RTX 5090 / RTX Pro 6000):
|
| 23 |
|
|
|
|
|
|
|
| 24 |
<details>
|
| 25 |
-
<summary>Dockerfile
|
| 26 |
|
| 27 |
```Dockerfile
|
| 28 |
# vLLM + LMCache Multi-Stage Dockerfile
|
|
|
|
| 21 |
|
| 22 |
A vLLM built from HEAD + transformers v5 is needed for GLM-4.7-Flash (and GLM-4.6V), here is the Dockerfile I use (specialized for RTX 5090 / RTX Pro 6000):
|
| 23 |
|
| 24 |
+
- [https://github.com/mratsim/llmops/blob/master/vllm/vllm-lmcache-Dockerfile](https://github.com/mratsim/llmops/blob/master/vllm/vllm-lmcache-Dockerfile)
|
| 25 |
+
|
| 26 |
<details>
|
| 27 |
+
<summary>Dockerfile</summary>
|
| 28 |
|
| 29 |
```Dockerfile
|
| 30 |
# vLLM + LMCache Multi-Stage Dockerfile
|