agent-inference / Dockerfile

Commit History

llama-swap dual-specialist setup: Dockerfile
dfdf6b0
verified

Leon4gr45 commited on

build: use prebuilt llama.cpp CPU binary (b9895) instead of source compile — fixes mtmd OOM hang, ~20x faster build
ea5d56a
verified

Leon4gr45 commited on

build: pull model at container runtime instead of baking into image (faster/reliable build)
7cc60cb
verified

Leon4gr45 commited on

v2.0: single-instance CPU proxy, native OpenAI tools+streaming, flash-attn+q4_0 KV, all-cores
e24791f
verified

Leon4gr45 commited on

Upload folder using huggingface_hub
e46b3f1
verified

Leon4gr45 commited on

Upload folder using huggingface_hub
0656d63
verified

Leon4gr45 commited on

Fix: Skip Python bindings if directory doesn't exist
6ff19b0
verified

Leon4gr45 commited on

Fix llama.cpp build with CMake
a82e039
verified

Leon4gr45 commited on

Fix pip install with --break-system-packages
5c59b5e
verified

Leon4gr45 commited on

Update Dockerfile for 2-instance build
687f798
verified

Leon4gr45 commited on

Upload gemma-inference space
21cc5dd
verified

Leon4gr45 commited on

Upload gemma-inference space
c5c5d80
verified

Leon4gr45 commited on