#!/usr/bin/env bash set -euo pipefail MODEL_REPO="${MELTMIND_GGUF_REPO:-AyyYOO/MiniCPM4-8B-Q4_K_M-GGUF}" MODEL_FILE="${MELTMIND_GGUF_FILE:-minicpm4-8b-q4_k_m.gguf}" MODEL_DIR="${MELTMIND_MODEL_DIR:-$PWD/.runtime/models}" MODEL_PATH="$MODEL_DIR/$MODEL_FILE" PROJECT_LLAMA_SERVER="$PWD/.runtime/llama.cpp/llama-b9637/llama-server" LLAMA_SERVER="${LLAMA_SERVER_BIN:-$PROJECT_LLAMA_SERVER}" if [[ ! -x "$LLAMA_SERVER" ]] && ! command -v "$LLAMA_SERVER" >/dev/null 2>&1; then echo "llama-server was not found. Install llama.cpp, then rerun this script." echo "Project: https://github.com/ggml-org/llama.cpp" exit 1 fi mkdir -p "$MODEL_DIR" if [[ ! -f "$MODEL_PATH" ]]; then echo "Downloading $MODEL_REPO/$MODEL_FILE into $MODEL_DIR" hf download "$MODEL_REPO" "$MODEL_FILE" --local-dir "$MODEL_DIR" fi exec "$LLAMA_SERVER" \ --model "$MODEL_PATH" \ --host "${MELTMIND_LLM_HOST:-127.0.0.1}" \ --port "${MELTMIND_LLM_PORT:-8080}" \ --ctx-size "${MELTMIND_CONTEXT_SIZE:-32768}" \ --n-gpu-layers "${MELTMIND_GPU_LAYERS:-99}" \ --threads "${MELTMIND_THREADS:-8}" \ --parallel "${MELTMIND_PARALLEL:-1}" \ --jinja