qwen3-embedding-api / Dockerfile
Jasai's picture
Revert to stable config: BATCH_TOKENS=512, CONCURRENT=8
b593f27 verified
Raw
History Blame Contribute Delete
291 Bytes
FROM ghcr.io/huggingface/text-embeddings-inference:cpu-1.9
ENV MODEL_ID=Qwen/Qwen3-Embedding-0.6B
ENV PORT=7860
ENV MAX_CONCURRENT_REQUESTS=8
ENV MAX_BATCH_TOKENS=512
ENV MAX_CLIENT_BATCH_SIZE=32
ENV DTYPE=float16
ENV MAX_INPUT_LENGTH=512
EXPOSE 7860
ENTRYPOINT ["text-embeddings-router"]