Vasanth6 commited on
Commit
3e566d1
·
1 Parent(s): d3367d4

Optimize referee model to Qwen2.5-0.5B-Instruct for CPU and add warning popup

Browse files
Files changed (3) hide show
  1. Dockerfile +3 -7
  2. backend/engines/llm_client.py +1 -1
  3. frontend/app.js +2 -0
Dockerfile CHANGED
@@ -17,17 +17,13 @@ RUN pip install --no-cache-dir .
17
  RUN mkdir -p /app/nltk_data && \
18
  python -c "import nltk; nltk.download('punkt', download_dir='/app/nltk_data'); nltk.download('punkt_tab', download_dir='/app/nltk_data'); nltk.download('stopwords', download_dir='/app/nltk_data')"
19
 
20
- # Pre-download public HF embedding models
21
  RUN python -c "from huggingface_hub import snapshot_download; \
22
  snapshot_download(repo_id='nomic-ai/nomic-embed-text-v1.5'); \
23
- snapshot_download(repo_id='C10X/Qwen3-Embedding-TurboX.v2')"
 
24
 
25
 
26
- # Download lightweight GGUF model instead of raw safetensors
27
- RUN mkdir -p /app/models && \
28
- python -c "from huggingface_hub import hf_hub_download; \
29
- hf_hub_download(repo_id='Qwen/Qwen2.5-1.5B-Instruct-GGUF', filename='qwen2.5-1.5b-instruct-q4_k_m.gguf', local_dir='/app/models')"
30
-
31
  COPY . .
32
 
33
  RUN chmod -R 777 /app
 
17
  RUN mkdir -p /app/nltk_data && \
18
  python -c "import nltk; nltk.download('punkt', download_dir='/app/nltk_data'); nltk.download('punkt_tab', download_dir='/app/nltk_data'); nltk.download('stopwords', download_dir='/app/nltk_data')"
19
 
20
+ # Pre-download public HF embedding and LLM models
21
  RUN python -c "from huggingface_hub import snapshot_download; \
22
  snapshot_download(repo_id='nomic-ai/nomic-embed-text-v1.5'); \
23
+ snapshot_download(repo_id='C10X/Qwen3-Embedding-TurboX.v2'); \
24
+ snapshot_download(repo_id='Qwen/Qwen2.5-0.5B-Instruct')"
25
 
26
 
 
 
 
 
 
27
  COPY . .
28
 
29
  RUN chmod -R 777 /app
backend/engines/llm_client.py CHANGED
@@ -7,7 +7,7 @@ _llm_pipeline = None
7
 
8
  class OllamaClient:
9
  def __init__(self):
10
- self.model_name = "Qwen/Qwen2.5-1.5B-Instruct"
11
 
12
  def _get_pipeline(self):
13
  global _llm_pipeline
 
7
 
8
  class OllamaClient:
9
  def __init__(self):
10
+ self.model_name = "Qwen/Qwen2.5-0.5B-Instruct"
11
 
12
  def _get_pipeline(self):
13
  global _llm_pipeline
frontend/app.js CHANGED
@@ -1676,6 +1676,8 @@ if (domReferee.btnCall) {
1676
  const labelA = domArena.modelA.options[domArena.modelA.selectedIndex].text;
1677
  const labelB = domArena.modelB.options[domArena.modelB.selectedIndex].text;
1678
 
 
 
1679
  domReferee.triggerBox.style.display = "none";
1680
  domReferee.loadingBox.style.display = "block";
1681
  domReferee.verdictBox.style.display = "none";
 
1676
  const labelA = domArena.modelA.options[domArena.modelA.selectedIndex].text;
1677
  const labelB = domArena.modelB.options[domArena.modelB.selectedIndex].text;
1678
 
1679
+ showToast("Summoning AI referee. Running Qwen2.5-0.5B-Instruct on CPU container — evaluation will take ~15-20 seconds.", "info");
1680
+
1681
  domReferee.triggerBox.style.display = "none";
1682
  domReferee.loadingBox.style.display = "block";
1683
  domReferee.verdictBox.style.display = "none";