# Profile: large CPU server (>= 24 GiB RAM) for the 26B-A4B MoE. # NOTE: 26B-A4B is IMAGE + TEXT only (no audio). Use gemma-12b if you need audio. HF_TOKEN= NGL=0 THREADS=24 # <-- physical cores CTX=16384 DEFAULT_MODEL=gemma-26b-a4b TEI_EMBED_MODEL=BAAI/bge-m3 TEI_EMBED_POOLING=cls TEI_RERANK_MODEL=BAAI/bge-reranker-v2-m3 TEI_DTYPE=float16 # float16 -> lighter Candle backend on CPU (saves RAM) LLAMASWAP_IMAGE=ghcr.io/mostlygeek/llama-swap:cpu TEI_IMAGE=ghcr.io/huggingface/text-embeddings-inference:cpu-1.9 WEBUI_PORT=3000 LLAMASWAP_PORT=8080 TEI_EMBED_PORT=8081 TEI_RERANK_PORT=8082 OPENAI_API_KEY=sk-local TEI_API_KEY=x WEBUI_NAME=Gemma 4 Local (xl)