Spaces:
Sleeping
Sleeping
Optimize referee model to Qwen2.5-0.5B-Instruct for CPU and add warning popup
Browse files- Dockerfile +3 -7
- backend/engines/llm_client.py +1 -1
- frontend/app.js +2 -0
Dockerfile
CHANGED
|
@@ -17,17 +17,13 @@ RUN pip install --no-cache-dir .
|
|
| 17 |
RUN mkdir -p /app/nltk_data && \
|
| 18 |
python -c "import nltk; nltk.download('punkt', download_dir='/app/nltk_data'); nltk.download('punkt_tab', download_dir='/app/nltk_data'); nltk.download('stopwords', download_dir='/app/nltk_data')"
|
| 19 |
|
| 20 |
-
# Pre-download public HF embedding models
|
| 21 |
RUN python -c "from huggingface_hub import snapshot_download; \
|
| 22 |
snapshot_download(repo_id='nomic-ai/nomic-embed-text-v1.5'); \
|
| 23 |
-
snapshot_download(repo_id='C10X/Qwen3-Embedding-TurboX.v2')
|
|
|
|
| 24 |
|
| 25 |
|
| 26 |
-
# Download lightweight GGUF model instead of raw safetensors
|
| 27 |
-
RUN mkdir -p /app/models && \
|
| 28 |
-
python -c "from huggingface_hub import hf_hub_download; \
|
| 29 |
-
hf_hub_download(repo_id='Qwen/Qwen2.5-1.5B-Instruct-GGUF', filename='qwen2.5-1.5b-instruct-q4_k_m.gguf', local_dir='/app/models')"
|
| 30 |
-
|
| 31 |
COPY . .
|
| 32 |
|
| 33 |
RUN chmod -R 777 /app
|
|
|
|
| 17 |
RUN mkdir -p /app/nltk_data && \
|
| 18 |
python -c "import nltk; nltk.download('punkt', download_dir='/app/nltk_data'); nltk.download('punkt_tab', download_dir='/app/nltk_data'); nltk.download('stopwords', download_dir='/app/nltk_data')"
|
| 19 |
|
| 20 |
+
# Pre-download public HF embedding and LLM models
|
| 21 |
RUN python -c "from huggingface_hub import snapshot_download; \
|
| 22 |
snapshot_download(repo_id='nomic-ai/nomic-embed-text-v1.5'); \
|
| 23 |
+
snapshot_download(repo_id='C10X/Qwen3-Embedding-TurboX.v2'); \
|
| 24 |
+
snapshot_download(repo_id='Qwen/Qwen2.5-0.5B-Instruct')"
|
| 25 |
|
| 26 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 27 |
COPY . .
|
| 28 |
|
| 29 |
RUN chmod -R 777 /app
|
backend/engines/llm_client.py
CHANGED
|
@@ -7,7 +7,7 @@ _llm_pipeline = None
|
|
| 7 |
|
| 8 |
class OllamaClient:
|
| 9 |
def __init__(self):
|
| 10 |
-
self.model_name = "Qwen/Qwen2.5-
|
| 11 |
|
| 12 |
def _get_pipeline(self):
|
| 13 |
global _llm_pipeline
|
|
|
|
| 7 |
|
| 8 |
class OllamaClient:
|
| 9 |
def __init__(self):
|
| 10 |
+
self.model_name = "Qwen/Qwen2.5-0.5B-Instruct"
|
| 11 |
|
| 12 |
def _get_pipeline(self):
|
| 13 |
global _llm_pipeline
|
frontend/app.js
CHANGED
|
@@ -1676,6 +1676,8 @@ if (domReferee.btnCall) {
|
|
| 1676 |
const labelA = domArena.modelA.options[domArena.modelA.selectedIndex].text;
|
| 1677 |
const labelB = domArena.modelB.options[domArena.modelB.selectedIndex].text;
|
| 1678 |
|
|
|
|
|
|
|
| 1679 |
domReferee.triggerBox.style.display = "none";
|
| 1680 |
domReferee.loadingBox.style.display = "block";
|
| 1681 |
domReferee.verdictBox.style.display = "none";
|
|
|
|
| 1676 |
const labelA = domArena.modelA.options[domArena.modelA.selectedIndex].text;
|
| 1677 |
const labelB = domArena.modelB.options[domArena.modelB.selectedIndex].text;
|
| 1678 |
|
| 1679 |
+
showToast("Summoning AI referee. Running Qwen2.5-0.5B-Instruct on CPU container — evaluation will take ~15-20 seconds.", "info");
|
| 1680 |
+
|
| 1681 |
domReferee.triggerBox.style.display = "none";
|
| 1682 |
domReferee.loadingBox.style.display = "block";
|
| 1683 |
domReferee.verdictBox.style.display = "none";
|