Kalpokoch commited on
Commit
b98ca48
·
verified ·
1 Parent(s): aa7e76a

Update app/app.py

Browse files
Files changed (1) hide show
  1. app/app.py +5 -6
app/app.py CHANGED
@@ -25,17 +25,16 @@ else:
25
  print("[INFO] Vector DB ready.")
26
 
27
  # -----------------------------
28
- # ✅ Load GGUF Model with llama-cpp-python
29
  # -----------------------------
30
  MODEL_PATH = "/app/tinyllama_dop_q4_k_m.gguf"
31
 
32
-
33
  print(f"[INFO] Loading GGUF model from: {MODEL_PATH}")
34
  llm = Llama(
35
  model_path=MODEL_PATH,
36
- n_ctx=2048,
37
- n_threads=4, # You can tune this based on CPU cores
38
- n_batch=64,
39
  use_mlock=False,
40
  verbose=False
41
  )
@@ -58,7 +57,7 @@ async def chat(query: Query):
58
 
59
  prompt = f"""### Context:\n{context}\n\n### Question: {question}\n### Answer:"""
60
 
61
- response = llm(prompt, max_tokens=200, stop=["###"])
62
  answer = response["choices"][0]["text"].strip()
63
 
64
  return {"answer": answer}
 
25
  print("[INFO] Vector DB ready.")
26
 
27
  # -----------------------------
28
+ # ✅ Load GGUF Model with llama-cpp-python (model is pre-downloaded in Dockerfile)
29
  # -----------------------------
30
  MODEL_PATH = "/app/tinyllama_dop_q4_k_m.gguf"
31
 
 
32
  print(f"[INFO] Loading GGUF model from: {MODEL_PATH}")
33
  llm = Llama(
34
  model_path=MODEL_PATH,
35
+ n_ctx=1024,
36
+ n_threads=2,
37
+ n_batch=32,
38
  use_mlock=False,
39
  verbose=False
40
  )
 
57
 
58
  prompt = f"""### Context:\n{context}\n\n### Question: {question}\n### Answer:"""
59
 
60
+ response = llm(prompt, max_tokens=150, stop=["###"])
61
  answer = response["choices"][0]["text"].strip()
62
 
63
  return {"answer": answer}