gemma4-stack / profiles /cpu-server-xl.env
Neohosseinism's picture
Add gemma4-stack config, scripts, and docker-compose setup
89bf59d
Raw
History Blame Contribute Delete
681 Bytes
# Profile: large CPU server (>= 24 GiB RAM) for the 26B-A4B MoE.
# NOTE: 26B-A4B is IMAGE + TEXT only (no audio). Use gemma-12b if you need audio.
HF_TOKEN=
NGL=0
THREADS=24 # <-- physical cores
CTX=16384
DEFAULT_MODEL=gemma-26b-a4b
TEI_EMBED_MODEL=BAAI/bge-m3
TEI_EMBED_POOLING=cls
TEI_RERANK_MODEL=BAAI/bge-reranker-v2-m3
TEI_DTYPE=float16 # float16 -> lighter Candle backend on CPU (saves RAM)
LLAMASWAP_IMAGE=ghcr.io/mostlygeek/llama-swap:cpu
TEI_IMAGE=ghcr.io/huggingface/text-embeddings-inference:cpu-1.9
WEBUI_PORT=3000
LLAMASWAP_PORT=8080
TEI_EMBED_PORT=8081
TEI_RERANK_PORT=8082
OPENAI_API_KEY=sk-local
TEI_API_KEY=x
WEBUI_NAME=Gemma 4 Local (xl)