multimodalart HF Staff commited on
Commit
60416d9
Β·
verified Β·
1 Parent(s): 68cf224

Upload folder using huggingface_hub

Browse files
Files changed (1) hide show
  1. app.py +3 -3
app.py CHANGED
@@ -30,9 +30,6 @@ MODEL_ID = "naver/v-splade-quality"
30
  # ── Module-scope model load (eager, as required by ZeroGPU) ──────────────────
31
  processor = AutoProcessor.from_pretrained(MODEL_ID)
32
  model = build_model(MODEL_ID, mode="inference_only", dtype=torch.bfloat16).to("cuda")
33
- # Pre-build the Li-LSR vocab lookup table so the first query is fast.
34
- model.query_encoder.to("cuda", dtype=torch.bfloat16)
35
- model.query_encoder.build_lookup_table()
36
  tokenizer = processor.tokenizer
37
 
38
 
@@ -53,6 +50,9 @@ def retrieve(image: Image.Image, queries: str, topk: int = 15) -> tuple:
53
  if not queries.strip():
54
  return "", "<p style='color:red'>Please enter at least one query.</p>", ""
55
 
 
 
 
56
  # ── Encode image β†’ sparse embedding ──────────────────────────────────
57
  chat = [{"role": "user",
58
  "content": [{"type": "image"}, {"type": "text", "text": ""}]}]
 
30
  # ── Module-scope model load (eager, as required by ZeroGPU) ──────────────────
31
  processor = AutoProcessor.from_pretrained(MODEL_ID)
32
  model = build_model(MODEL_ID, mode="inference_only", dtype=torch.bfloat16).to("cuda")
 
 
 
33
  tokenizer = processor.tokenizer
34
 
35
 
 
50
  if not queries.strip():
51
  return "", "<p style='color:red'>Please enter at least one query.</p>", ""
52
 
53
+ # Build lookup table on GPU (lazy β€” first call builds it).
54
+ model.query_encoder.build_lookup_table()
55
+
56
  # ── Encode image β†’ sparse embedding ──────────────────────────────────
57
  chat = [{"role": "user",
58
  "content": [{"type": "image"}, {"type": "text", "text": ""}]}]