Spaces:
Sleeping
Sleeping
Commit History
Reduce MAX_BATCH_TOKENS for CPU stability 60f06b1 verified
MAX_BATCH_TOKENS=32768, MAX_INPUT_LENGTH=8192 11bc8de verified
Increase MAX_BATCH_TOKENS to 32768, MAX_INPUT_LENGTH=8192 a9e284c verified
Increase concurrency limits 1b7add8 verified
Increase concurrency: MAX_CONCURRENT_REQUESTS=8, MAX_BATCH_REQUESTS=16, MAX_BATCH_TOKENS=1024 7947ab6 verified
Upload Dockerfile with huggingface_hub 1ccf203 verified
Reduce memory: max_concurrent=1, max_batch_tokens=512 25e25b1
Jasai commited on
Try float16 to reduce memory usage 105f58c
Jasai commited on
Fix: use TEI 1.9 (1.6 doesn't support Qwen3) fe6dce9
Jasai commited on
Deploy Qwen3-Embedding-0.6B with TEI 130b24b
Jasai commited on
Restore stable PyTorch CPU + 4B (backup while INT8 ONNX upload in progress) 3d7d8c9
hu commited on
TEI INT8 ONNX + --pooling cls --dtype float32 ecc3c86
hu commited on
TEI + INT8 ONNX Qwen3-Embedding-4B (4GB, fits cpu-basic) 2ce60ae
hu commited on
Stable: PyTorch CPU-only + Qwen3-Embedding-4B (proven working) a8af8fb
hu commited on
Remove build-time model download; use ORT backend at runtime 73fe58d
hu commited on
Add ONNX Runtime backend option + ST fallback for Qwen3-Embedding-4B 76a10e4
hu commited on
TEI Candle CPU + Qwen3-Embedding-4B fp16 624b719
hu commited on
Use CPU-only PyTorch for smaller image & faster inference f4aaf14
hu commited on
Switch to sentence-transformers + Qwen3-Embedding-4B (PyTorch CPU) 1616f63
hu commited on
Use ONNX ST Qwen3-Embedding-4B model 791549a
hu commited on
Try TEI with Qwen3-Embedding-4B d2342b1
hu commited on
Switch to TEI cpu-1.9 for Qwen3-Embedding-8B f9a3360
hu commited on
Add Qwen3-Embedding-8B API e3cb2ba
hu commited on