| |
| FROM ghcr.io/ggerganov/llama.cpp:server as llama |
|
|
| |
| FROM python:3.10-slim |
|
|
| WORKDIR /app |
|
|
| |
| COPY --from=llama /app/llama-server /usr/local/bin/llama-server |
|
|
| |
| RUN apt-get update && apt-get install -y \ |
| && rm -rf /var/lib/apt/lists/* |
|
|
| |
| COPY requirements.txt . |
| RUN pip install --no-cache-dir --upgrade pip && \ |
| pip install --no-cache-dir -r requirements.txt |
|
|
| |
| COPY app.py . |
|
|
| |
| RUN mkdir -p /models |
|
|
| |
| EXPOSE 8080 7860 |
|
|
| |
| CMD sh -c "llama-server --model /models/Qwen3.5-4B-Q4_K_M.gguf --host 127.0.0.1 --port 8080 --ctx-size 4096 & \ |
| uvicorn app:app --host 0.0.0.0 --port 7860" |