ShadowHunter222 commited on
Commit
40452d4
·
verified ·
1 Parent(s): 2f41a6a

Update Dockerfile

Browse files
Files changed (1) hide show
  1. Dockerfile +13 -2
Dockerfile CHANGED
@@ -4,10 +4,21 @@ FROM ghcr.io/ggml-org/llama.cpp:server
4
  RUN apt update && apt install wget -y && rm -rf /var/lib/apt/lists/*
5
 
6
 
7
- # 1. THE MAIN MODEL: LFM2.5-2.6B in Q4_K_M for balanced speed and performance on CPU
8
  RUN wget "https://huggingface.co/LiquidAI/LFM2.5-2.6B-GGUF/resolve/main/LFM2.5-2.6B-Q4_K_M.gguf" -O /model.gguf
9
 
10
 
11
  # Clear the entrypoint and use shell form CMD to silence all logs
12
  ENTRYPOINT []
13
- CMD /app/llama-server -m /model.gguf --port 7860 --host 0.0.0.0 -t 2 --mlock --no-mmap -c 8192 --batch-size 512 --ubatch-size 512 --log-disable > /dev/null 2>&1
 
 
 
 
 
 
 
 
 
 
 
 
4
  RUN apt update && apt install wget -y && rm -rf /var/lib/apt/lists/*
5
 
6
 
7
+ # 1. THE MAIN MODEL: LFM2.5-2.6B in Q4_K_M best speed/quality balance for CPU
8
  RUN wget "https://huggingface.co/LiquidAI/LFM2.5-2.6B-GGUF/resolve/main/LFM2.5-2.6B-Q4_K_M.gguf" -O /model.gguf
9
 
10
 
11
  # Clear the entrypoint and use shell form CMD to silence all logs
12
  ENTRYPOINT []
13
+ CMD /app/llama-server \
14
+ -m /model.gguf \
15
+ --port 7860 --host 0.0.0.0 \
16
+ -t 2 --threads-batch 2 \
17
+ -c 4096 \
18
+ --parallel 1 \
19
+ --batch-size 256 --ubatch-size 256 \
20
+ --flash-attn \
21
+ --cache-type-k q8_0 --cache-type-v q8_0 \
22
+ --mlock --no-mmap \
23
+ --no-warmup \
24
+ --log-disable > /dev/null 2>&1