Update entrypoint.sh
Browse files- entrypoint.sh +20 -22
entrypoint.sh
CHANGED
|
@@ -1,7 +1,10 @@
|
|
| 1 |
#!/bin/sh
|
| 2 |
set -eu
|
| 3 |
|
| 4 |
-
|
|
|
|
|
|
|
|
|
|
| 5 |
HOST="${HOST:-0.0.0.0}"
|
| 6 |
PORT="${PORT:-7860}"
|
| 7 |
CTX_SIZE="${CTX_SIZE:-8192}"
|
|
@@ -11,27 +14,22 @@ REASONING_MODE="${REASONING_MODE:-off}"
|
|
| 11 |
CACHE_TYPE_K="${CACHE_TYPE_K:-q8_0}"
|
| 12 |
CACHE_TYPE_V="${CACHE_TYPE_V:-q8_0}"
|
| 13 |
FLASH_ATTN="${FLASH_ATTN:-on}"
|
| 14 |
-
SPEC_TYPE="${SPEC_TYPE:-draft-mtp}"
|
| 15 |
-
|
| 16 |
-
# NOTE: the b8840 CPU build does not support draft-mtp (needs a newer
|
| 17 |
-
# llama.cpp build than this image ships). ngram-cache is a self-speculation
|
| 18 |
-
# mode that needs no external draft model: it speculates from n-grams already
|
| 19 |
-
# seen in context/output, verified by the target model, so it's zero-cost on
|
| 20 |
-
# accuracy. Set SPEC_TYPE=none in Space secrets to disable entirely.
|
| 21 |
-
SPEC_FLAGS="--spec-type $SPEC_TYPE"
|
| 22 |
|
| 23 |
exec /app/llama-server \
|
| 24 |
-
|
| 25 |
-
|
| 26 |
-
|
| 27 |
-
|
| 28 |
-
|
| 29 |
-
|
| 30 |
-
|
| 31 |
-
|
| 32 |
-
|
| 33 |
-
|
| 34 |
-
|
| 35 |
-
|
| 36 |
-
|
|
|
|
|
|
|
|
|
|
| 37 |
|
|
|
|
| 1 |
#!/bin/sh
|
| 2 |
set -eu
|
| 3 |
|
| 4 |
+
MODEL_REPO="${MODEL_REPO:-unsloth/gemma-4-E2B-it-qat-GGUF}"
|
| 5 |
+
MODEL_FILE="${MODEL_FILE:-gemma-4-E2B-it-qat-UD-Q4_K_XL.gguf}"
|
| 6 |
+
DRAFT_FILE="${DRAFT_FILE:-MTP/mtp-gemma-4-E2B-it.gguf}"
|
| 7 |
+
|
| 8 |
HOST="${HOST:-0.0.0.0}"
|
| 9 |
PORT="${PORT:-7860}"
|
| 10 |
CTX_SIZE="${CTX_SIZE:-8192}"
|
|
|
|
| 14 |
CACHE_TYPE_K="${CACHE_TYPE_K:-q8_0}"
|
| 15 |
CACHE_TYPE_V="${CACHE_TYPE_V:-q8_0}"
|
| 16 |
FLASH_ATTN="${FLASH_ATTN:-on}"
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 17 |
|
| 18 |
exec /app/llama-server \
|
| 19 |
+
-hf "$MODEL_REPO" \
|
| 20 |
+
--hf-file "$MODEL_FILE" \
|
| 21 |
+
--draft-model "$MODEL_REPO" \
|
| 22 |
+
--hf-file-draft "$DRAFT_FILE" \
|
| 23 |
+
--spec-type draft-mtp \
|
| 24 |
+
--spec-draft-n-max 4 \
|
| 25 |
+
--host "$HOST" \
|
| 26 |
+
--port "$PORT" \
|
| 27 |
+
--ctx-size "$CTX_SIZE" \
|
| 28 |
+
--threads "$THREADS" \
|
| 29 |
+
--threads-batch "$THREADS" \
|
| 30 |
+
--parallel "$PARALLEL" \
|
| 31 |
+
--cache-type-k "$CACHE_TYPE_K" \
|
| 32 |
+
--cache-type-v "$CACHE_TYPE_V" \
|
| 33 |
+
--reasoning "$REASONING_MODE" \
|
| 34 |
+
-fa "$FLASH_ATTN"
|
| 35 |
|