ramedde commited on
Commit
fbd91c8
·
verified ·
1 Parent(s): d983297

Update entrypoint.sh

Browse files
Files changed (1) hide show
  1. entrypoint.sh +20 -22
entrypoint.sh CHANGED
@@ -1,7 +1,10 @@
1
  #!/bin/sh
2
  set -eu
3
 
4
- MODEL_SPEC="${MODEL_SPEC:-unsloth/gemma-4-E2B-it-qat-GGUF:UD-Q4_K_XL}"
 
 
 
5
  HOST="${HOST:-0.0.0.0}"
6
  PORT="${PORT:-7860}"
7
  CTX_SIZE="${CTX_SIZE:-8192}"
@@ -11,27 +14,22 @@ REASONING_MODE="${REASONING_MODE:-off}"
11
  CACHE_TYPE_K="${CACHE_TYPE_K:-q8_0}"
12
  CACHE_TYPE_V="${CACHE_TYPE_V:-q8_0}"
13
  FLASH_ATTN="${FLASH_ATTN:-on}"
14
- SPEC_TYPE="${SPEC_TYPE:-draft-mtp}"
15
-
16
- # NOTE: the b8840 CPU build does not support draft-mtp (needs a newer
17
- # llama.cpp build than this image ships). ngram-cache is a self-speculation
18
- # mode that needs no external draft model: it speculates from n-grams already
19
- # seen in context/output, verified by the target model, so it's zero-cost on
20
- # accuracy. Set SPEC_TYPE=none in Space secrets to disable entirely.
21
- SPEC_FLAGS="--spec-type $SPEC_TYPE"
22
 
23
  exec /app/llama-server \
24
- -hf "$MODEL_SPEC" \
25
- --host "$HOST" \
26
- --port "$PORT" \
27
- --ctx-size "$CTX_SIZE" \
28
- --threads "$THREADS" \
29
- --threads-batch "$THREADS" \
30
- --parallel "$PARALLEL" \
31
- --cache-type-k "$CACHE_TYPE_K" \
32
- --cache-type-v "$CACHE_TYPE_V" \
33
- --reasoning "$REASONING_MODE" \
34
- -fa "$FLASH_ATTN" \
35
- --spec-type draft-mtp \
36
- --spec-draft-n-max 4
 
 
 
37
 
 
1
  #!/bin/sh
2
  set -eu
3
 
4
+ MODEL_REPO="${MODEL_REPO:-unsloth/gemma-4-E2B-it-qat-GGUF}"
5
+ MODEL_FILE="${MODEL_FILE:-gemma-4-E2B-it-qat-UD-Q4_K_XL.gguf}"
6
+ DRAFT_FILE="${DRAFT_FILE:-MTP/mtp-gemma-4-E2B-it.gguf}"
7
+
8
  HOST="${HOST:-0.0.0.0}"
9
  PORT="${PORT:-7860}"
10
  CTX_SIZE="${CTX_SIZE:-8192}"
 
14
  CACHE_TYPE_K="${CACHE_TYPE_K:-q8_0}"
15
  CACHE_TYPE_V="${CACHE_TYPE_V:-q8_0}"
16
  FLASH_ATTN="${FLASH_ATTN:-on}"
 
 
 
 
 
 
 
 
17
 
18
  exec /app/llama-server \
19
+ -hf "$MODEL_REPO" \
20
+ --hf-file "$MODEL_FILE" \
21
+ --draft-model "$MODEL_REPO" \
22
+ --hf-file-draft "$DRAFT_FILE" \
23
+ --spec-type draft-mtp \
24
+ --spec-draft-n-max 4 \
25
+ --host "$HOST" \
26
+ --port "$PORT" \
27
+ --ctx-size "$CTX_SIZE" \
28
+ --threads "$THREADS" \
29
+ --threads-batch "$THREADS" \
30
+ --parallel "$PARALLEL" \
31
+ --cache-type-k "$CACHE_TYPE_K" \
32
+ --cache-type-v "$CACHE_TYPE_V" \
33
+ --reasoning "$REASONING_MODE" \
34
+ -fa "$FLASH_ATTN"
35