llama-server / Dockerfile

Commit History

Apply minimal safe perf wins for free-tier HF Space
cc953bd

Ved Gupta commited on

Revert all perf tuning, restore working pre-tune config
509e3de

Ved Gupta commited on

Revert KV-cache quant + force flash-attn defaults
62928db

Ved Gupta commited on

Tune llama-server for faster CPU inference on HF free tier
f732b48

Ved Gupta commited on

Initial commit: llama.cpp OpenAI-compatible server for Gemma 4 E2B
82bd3da

vedgupta commited on