meltmind-ai / scripts /start_minicpm.sh
Haricharan Vallem
Codex: prepare MeltMind for Hugging Face Spaces
58fddaa
Raw
History Blame Contribute Delete
1.13 kB
#!/usr/bin/env bash
set -euo pipefail
MODEL_REPO="${MELTMIND_GGUF_REPO:-AyyYOO/MiniCPM4-8B-Q4_K_M-GGUF}"
MODEL_FILE="${MELTMIND_GGUF_FILE:-minicpm4-8b-q4_k_m.gguf}"
MODEL_DIR="${MELTMIND_MODEL_DIR:-$PWD/.runtime/models}"
MODEL_PATH="$MODEL_DIR/$MODEL_FILE"
PROJECT_LLAMA_SERVER="$PWD/.runtime/llama.cpp/llama-b9637/llama-server"
LLAMA_SERVER="${LLAMA_SERVER_BIN:-$PROJECT_LLAMA_SERVER}"
if [[ ! -x "$LLAMA_SERVER" ]] && ! command -v "$LLAMA_SERVER" >/dev/null 2>&1; then
echo "llama-server was not found. Install llama.cpp, then rerun this script."
echo "Project: https://github.com/ggml-org/llama.cpp"
exit 1
fi
mkdir -p "$MODEL_DIR"
if [[ ! -f "$MODEL_PATH" ]]; then
echo "Downloading $MODEL_REPO/$MODEL_FILE into $MODEL_DIR"
hf download "$MODEL_REPO" "$MODEL_FILE" --local-dir "$MODEL_DIR"
fi
exec "$LLAMA_SERVER" \
--model "$MODEL_PATH" \
--host "${MELTMIND_LLM_HOST:-127.0.0.1}" \
--port "${MELTMIND_LLM_PORT:-8080}" \
--ctx-size "${MELTMIND_CONTEXT_SIZE:-32768}" \
--n-gpu-layers "${MELTMIND_GPU_LAYERS:-99}" \
--threads "${MELTMIND_THREADS:-8}" \
--parallel "${MELTMIND_PARALLEL:-1}" \
--jinja