Commit History

Revert to stable config: BATCH_TOKENS=512, CONCURRENT=8
b593f27
verified

Jasai commited on

Reduce MAX_BATCH_TOKENS for CPU stability
60f06b1
verified

Jasai commited on

MAX_BATCH_TOKENS=32768, MAX_INPUT_LENGTH=8192
11bc8de
verified

Jasai commited on

Increase MAX_BATCH_TOKENS to 32768, MAX_INPUT_LENGTH=8192
a9e284c
verified

Jasai commited on

Increase concurrency limits
1b7add8
verified

Jasai commited on

Increase concurrency: MAX_CONCURRENT_REQUESTS=8, MAX_BATCH_REQUESTS=16, MAX_BATCH_TOKENS=1024
7947ab6
verified

Jasai commited on

Upload Dockerfile with huggingface_hub
1ccf203
verified

Jasai commited on

Reduce memory: max_concurrent=1, max_batch_tokens=512
25e25b1

Jasai commited on

Try float16 to reduce memory usage
105f58c

Jasai commited on

Fix: use TEI 1.9 (1.6 doesn't support Qwen3)
fe6dce9

Jasai commited on

Deploy Qwen3-Embedding-0.6B with TEI
130b24b

Jasai commited on

Restore stable PyTorch CPU + 4B (backup while INT8 ONNX upload in progress)
3d7d8c9

hu commited on

TEI INT8 ONNX + --pooling cls --dtype float32
ecc3c86

hu commited on

TEI + INT8 ONNX Qwen3-Embedding-4B (4GB, fits cpu-basic)
2ce60ae

hu commited on

Stable: PyTorch CPU-only + Qwen3-Embedding-4B (proven working)
a8af8fb

hu commited on

Remove build-time model download; use ORT backend at runtime
73fe58d

hu commited on

Add ONNX Runtime backend option + ST fallback for Qwen3-Embedding-4B
76a10e4

hu commited on

TEI Candle CPU + Qwen3-Embedding-4B fp16
624b719

hu commited on

Use CPU-only PyTorch for smaller image & faster inference
f4aaf14

hu commited on

Switch to sentence-transformers + Qwen3-Embedding-4B (PyTorch CPU)
1616f63

hu commited on

Use ONNX ST Qwen3-Embedding-4B model
791549a

hu commited on

Try TEI with Qwen3-Embedding-4B
d2342b1

hu commited on

Switch to TEI cpu-1.9 for Qwen3-Embedding-8B
f9a3360

hu commited on

Add Qwen3-Embedding-8B API
e3cb2ba

hu commited on

initial commit
1027559
verified

Jasai commited on