Commit History

Document client contract: thinking budget, think-stripping, routing policy
3675bfd
verified

Leon4gr45 commited on

Thinking fixes: strip client max_tokens (enforce n-predict 2048), deepseek reasoning-format
1c24286
verified

Leon4gr45 commited on

llama-swap dual-specialist setup: Dockerfile
dfdf6b0
verified

Leon4gr45 commited on

llama-swap dual-specialist setup: README.md
e7a144d
verified

Leon4gr45 commited on

llama-swap dual-specialist setup: entrypoint.sh
ce35e3f
verified

Leon4gr45 commited on

llama-swap dual-specialist setup: config.yaml
1b9f24d
verified

Leon4gr45 commited on

Document split KV quant + cache-reuse env vars
4963346
verified

Leon4gr45 commited on

Split K/V cache quant (K=q8_0,V=q4_0), 32K ctx, cache-reuse, tool-call smoke test
b6dd083
verified

Leon4gr45 commited on

safety: cap threads at CPU_THREADS_MAX (default 2) to prevent oversubscription if detection over-reports
111e96a
verified

Leon4gr45 commited on

feat: cgroup-aware vCPU auto-detection (respects container CPU limit; no CPU_THREADS env needed)
1256f93
verified

Leon4gr45 commited on

fix: startup readiness loop must sleep on HTTP 503 (model loading), not only on connection errors — false 'startup timeout' left instance marked unloaded
261a815
verified

Leon4gr45 commited on

harden: normalize legacy KV_CACHE_QUANT values (4bit->q4_0) so stale env vars can't crash llama-server
ea909c9
verified

Leon4gr45 commited on

build: use prebuilt llama.cpp CPU binary (b9895) instead of source compile — fixes mtmd OOM hang, ~20x faster build
ea5d56a
verified

Leon4gr45 commited on

build: pull model at container runtime instead of baking into image (faster/reliable build)
7cc60cb
verified

Leon4gr45 commited on

v2.0: single-instance CPU proxy, native OpenAI tools+streaming, flash-attn+q4_0 KV, all-cores
e24791f
verified

Leon4gr45 commited on

Fix llama-server arguments and increase timeouts
1bc53ac
verified

Leon4gr45 commited on

Upload folder using huggingface_hub
912716f
verified

Leon4gr45 commited on

Upload folder using huggingface_hub
90d5c48
verified

Leon4gr45 commited on

Upload folder using huggingface_hub
30768cb
verified

Leon4gr45 commited on

Upload folder using huggingface_hub
7addb98
verified

Leon4gr45 commited on

Upload folder using huggingface_hub
144115f
verified

Leon4gr45 commited on

Upload folder using huggingface_hub
ddd1818
verified

Leon4gr45 commited on

Upload folder using huggingface_hub
15e1a0c
verified

Leon4gr45 commited on

Upload folder using huggingface_hub
e46b3f1
verified

Leon4gr45 commited on

Upload folder using huggingface_hub
c8898c6
verified

Leon4gr45 commited on

Upload folder using huggingface_hub
0656d63
verified

Leon4gr45 commited on

Fix: Use hf_hub_download for specific model file from deepreinforce-ai/Ornith-1.0-9B-GGUF
16451bc
verified

Leon4gr45 commited on

Fix: Skip Python bindings if directory doesn't exist
6ff19b0
verified

Leon4gr45 commited on

Fix llama.cpp build with CMake
a82e039
verified

Leon4gr45 commited on

Fix pip install with --break-system-packages
5c59b5e
verified

Leon4gr45 commited on

Update README with Ornith 1.0 details
191b101
verified

Leon4gr45 commited on

Update Dockerfile for 2-instance build
687f798
verified

Leon4gr45 commited on

Update app.py with 2-instance setup
03f171d
verified

Leon4gr45 commited on

Upload gemma-inference space
412d837
verified

Leon4gr45 commited on

Upload gemma-inference space
21cc5dd
verified

Leon4gr45 commited on

Upload gemma-inference space
078b701
verified

Leon4gr45 commited on

Upload gemma-inference space
b606d61
verified

Leon4gr45 commited on

Upload gemma-inference space
c5c5d80
verified

Leon4gr45 commited on

initial commit
ec7c073
verified

Leon4gr45 commited on