fomext commited on
Commit
cec3ab3
Β·
verified Β·
1 Parent(s): 2a30a1d

Upload 2 files

Browse files
Files changed (2) hide show
  1. Dockerfile +3 -5
  2. docker-compose.yml +3 -8
Dockerfile CHANGED
@@ -21,11 +21,9 @@ RUN pip install --no-cache-dir \
21
  pydantic==2.7.1
22
 
23
  # Install llama-cpp-python CPU-only (compiled from source)
24
- # 0.3.4: new enough to read current GGUF format, stable enough to avoid
25
- # the malloc/GGML_ASSERT corruption seen in 0.3.9 on CPU-only builds
26
- RUN CMAKE_ARGS="-DGGML_CUDA=OFF -DGGML_METAL=OFF -DGGML_OPENCL=OFF" \
27
  FORCE_CMAKE=1 \
28
- pip install --no-cache-dir llama-cpp-python==0.3.4
29
 
30
  # ── App code ─────────────────────────────────────────────────
31
  COPY app.py .
@@ -39,7 +37,7 @@ COPY app.py .
39
  RUN mkdir -p /models
40
 
41
  # ── Runtime env defaults (override with -e or docker-compose) ─
42
- ENV MODEL_PATH=/models/qwen3-14b-q4_k_m.gguf \
43
  MODEL_URL=https://huggingface.co/bartowski/Qwen_Qwen3-14B-GGUF/resolve/main/Qwen_Qwen3-14B-Q4_K_M.gguf \
44
  MODEL_ID=qwen3-14b \
45
  N_CTX=4096 \
 
21
  pydantic==2.7.1
22
 
23
  # Install llama-cpp-python CPU-only (compiled from source)
24
+ RUN CMAKE_ARGS="-DLLAMA_CUBLAS=OFF -DLLAMA_METAL=OFF -DLLAMA_OPENCL=OFF" \
 
 
25
  FORCE_CMAKE=1 \
26
+ pip install --no-cache-dir llama-cpp-python==0.2.77
27
 
28
  # ── App code ─────────────────────────────────────────────────
29
  COPY app.py .
 
37
  RUN mkdir -p /models
38
 
39
  # ── Runtime env defaults (override with -e or docker-compose) ─
40
+ ENV MODEL_PATH=/data/qwen3-14b-q4_k_m.gguf \
41
  MODEL_URL=https://huggingface.co/bartowski/Qwen_Qwen3-14B-GGUF/resolve/main/Qwen_Qwen3-14B-Q4_K_M.gguf \
42
  MODEL_ID=qwen3-14b \
43
  N_CTX=4096 \
docker-compose.yml CHANGED
@@ -8,12 +8,10 @@ services:
8
  ports:
9
  - "8000:8000"
10
  volumes:
11
- # Named volume β€” model is downloaded here on first boot and reused after
12
- - qwen3_models:/models
13
- # Alternative: mount your own pre-downloaded folder instead:
14
- # - ./models:/models
15
  environment:
16
- - MODEL_PATH=/models/qwen3-14b-q4_k_m.gguf
17
  - MODEL_URL=https://huggingface.co/bartowski/Qwen_Qwen3-14B-GGUF/resolve/main/Qwen_Qwen3-14B-Q4_K_M.gguf
18
  - MODEL_ID=qwen3-14b
19
  - N_CTX=4096
@@ -22,6 +20,3 @@ services:
22
  - VERBOSE=false
23
  - HF_TOKEN
24
  restart: unless-stopped
25
-
26
- volumes:
27
- qwen3_models:
 
8
  ports:
9
  - "8000:8000"
10
  volumes:
11
+ # /data is the HF Spaces persistent storage bucket β€” model lives here
12
+ - /data:/data
 
 
13
  environment:
14
+ - MODEL_PATH=/data/qwen3-14b-q4_k_m.gguf
15
  - MODEL_URL=https://huggingface.co/bartowski/Qwen_Qwen3-14B-GGUF/resolve/main/Qwen_Qwen3-14B-Q4_K_M.gguf
16
  - MODEL_ID=qwen3-14b
17
  - N_CTX=4096
 
20
  - VERBOSE=false
21
  - HF_TOKEN
22
  restart: unless-stopped