FROM ghcr.io/huggingface/text-embeddings-inference:cpu-1.9 ENV MODEL_ID=Qwen/Qwen3-Embedding-0.6B ENV PORT=7860 ENV MAX_CONCURRENT_REQUESTS=8 ENV MAX_BATCH_TOKENS=512 ENV MAX_CLIENT_BATCH_SIZE=32 ENV DTYPE=float16 ENV MAX_INPUT_LENGTH=512 EXPOSE 7860 ENTRYPOINT ["text-embeddings-router"]