MrNK2107 commited on
Commit
022010c
·
1 Parent(s): 5a40cb1

fix: reranker degradation, skip_reranker bug, eval latency, branch cleanup

Browse files

- scoring_weights.yaml: reduce cross_encoder_score 0.25->0.15 (was degrading accuracy),
redistribute to semantic_similarity 0.15->0.20 and skill_match 0.18->0.20
- executor.py: fix skip_reranker bug — removed RRF override that discarded multi-signal
scoring; normalize RRF scores to [0,1] for proper multi-signal combination
- executor.py: reduce rerank_top_k from 50->20 (cross-encoder now minimal weight)
- evaluate.py: use single event loop for all queries instead of per-variant asyncio.run()
- evaluate.py: wire --sample flag to limit queries for quick testing
- Delete stale pr-overhaul branch (already merged into main)

configs/scoring_weights.yaml CHANGED
@@ -1,14 +1,14 @@
1
  # Internal scoring model — 10 dimensions, must sum to 1.0
2
  # Used for backend candidate ranking (FR-7.2)
3
  scoring_weights:
4
- semantic_similarity: 0.15
5
  keyword_match: 0.10
6
- skill_match: 0.18
7
  experience_match: 0.08
8
  location_match: 0.00
9
  education_match: 0.00
10
- cross_encoder_score: 0.25
11
- behavioral_score: 0.12
12
  career_trajectory_score: 0.07
13
  skill_proficiency_score: 0.05
14
 
 
1
  # Internal scoring model — 10 dimensions, must sum to 1.0
2
  # Used for backend candidate ranking (FR-7.2)
3
  scoring_weights:
4
+ semantic_similarity: 0.20
5
  keyword_match: 0.10
6
+ skill_match: 0.20
7
  experience_match: 0.08
8
  location_match: 0.00
9
  education_match: 0.00
10
+ cross_encoder_score: 0.15
11
+ behavioral_score: 0.15
12
  career_trajectory_score: 0.07
13
  skill_proficiency_score: 0.05
14
 
data/evaluation_report_hybrid_pipeline.json CHANGED
@@ -1,67 +1,67 @@
1
  {
2
  "p@5": {
3
- "mean": 0.0224,
4
  "median": 0.0,
5
  "min": 0.0,
6
  "max": 0.2
7
  },
8
  "p@10": {
9
- "mean": 0.0188,
10
  "median": 0.0,
11
  "min": 0.0,
12
- "max": 0.2
13
  },
14
  "p@20": {
15
- "mean": 0.0137,
16
  "median": 0.0,
17
  "min": 0.0,
18
- "max": 0.1
19
  },
20
  "r@5": {
21
  "mean": 0.0003,
22
  "median": 0.0,
23
  "min": 0.0,
24
- "max": 0.0045
25
  },
26
  "r@10": {
27
  "mean": 0.0006,
28
  "median": 0.0,
29
  "min": 0.0,
30
- "max": 0.0065
31
  },
32
  "r@20": {
33
- "mean": 0.0009,
34
  "median": 0.0,
35
  "min": 0.0,
36
- "max": 0.0087
37
  },
38
  "mrr": {
39
- "mean": 0.0744,
40
- "median": 0.0,
41
  "min": 0.0,
42
- "max": 1.0
43
  },
44
  "ndcg@10": {
45
- "mean": 0.0212,
46
  "median": 0.0,
47
  "min": 0.0,
48
- "max": 0.3061
49
  },
50
  "latencies": {
51
- "mean": 607.4243,
52
- "median": 615.7892,
53
- "min": 81.9624,
54
- "max": 8617.3138
55
  },
 
 
56
  "latency": {
57
- "p50": 616.0,
58
- "p95": 1130.3,
59
- "p99": 1453.8,
60
- "mean": 607.4,
61
- "min": 82.0,
62
- "max": 8617.3
63
  },
64
- "total_queries": 500,
65
- "skipped": 0,
66
  "cross_lingual_mrr": 1.0
67
  }
 
1
  {
2
  "p@5": {
3
+ "mean": 0.02,
4
  "median": 0.0,
5
  "min": 0.0,
6
  "max": 0.2
7
  },
8
  "p@10": {
9
+ "mean": 0.02,
10
  "median": 0.0,
11
  "min": 0.0,
12
+ "max": 0.1
13
  },
14
  "p@20": {
15
+ "mean": 0.012,
16
  "median": 0.0,
17
  "min": 0.0,
18
+ "max": 0.05
19
  },
20
  "r@5": {
21
  "mean": 0.0003,
22
  "median": 0.0,
23
  "min": 0.0,
24
+ "max": 0.0036
25
  },
26
  "r@10": {
27
  "mean": 0.0006,
28
  "median": 0.0,
29
  "min": 0.0,
30
+ "max": 0.0044
31
  },
32
  "r@20": {
33
+ "mean": 0.0008,
34
  "median": 0.0,
35
  "min": 0.0,
36
+ "max": 0.0044
37
  },
38
  "mrr": {
39
+ "mean": 0.0567,
40
+ "median": 0.0088,
41
  "min": 0.0,
42
+ "max": 0.5
43
  },
44
  "ndcg@10": {
45
+ "mean": 0.018,
46
  "median": 0.0,
47
  "min": 0.0,
48
+ "max": 0.1224
49
  },
50
  "latencies": {
51
+ "mean": 1351.8545,
52
+ "median": 1183.6574,
53
+ "min": 303.1221,
54
+ "max": 13650.6723
55
  },
56
+ "total_queries": 50,
57
+ "skipped": 0,
58
  "latency": {
59
+ "p50": 1199.1,
60
+ "p95": 2351.3,
61
+ "p99": 13650.7,
62
+ "mean": 1351.9,
63
+ "min": 303.1,
64
+ "max": 13650.7
65
  },
 
 
66
  "cross_lingual_mrr": 1.0
67
  }
scripts/evaluate.py CHANGED
@@ -88,11 +88,113 @@ def find_index_dir() -> Path | None:
88
  return path.parent if path.exists() else None
89
 
90
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
91
  def evaluate(
92
  queries_path: Path = QUERIES_PATH,
93
  ground_truth_path: Path = GROUND_TRUTH_PATH,
94
  use_full_pipeline: bool = False,
95
  skip_reranker: bool = False,
 
96
  ) -> dict:
97
  index_dir = find_index_dir()
98
  if index_dir is None:
@@ -116,6 +218,9 @@ def evaluate(
116
 
117
  queries_list = queries_raw if isinstance(queries_raw, list) else list(queries_raw.values())
118
  gt_map = ground_truth if isinstance(ground_truth, dict) else {}
 
 
 
119
 
120
  logger.info(f"Loaded {len(queries_list)} queries and {len(gt_map)} ground truth entries")
121
 
@@ -128,24 +233,8 @@ def evaluate(
128
  embedder = MultilingualEmbedder()
129
  hybrid = HybridSearch(vector_search, bm25_search, embedder)
130
 
131
- # Optionally build full pipeline components
132
- executor = None
133
- scorer = None
134
- reranker = None
135
- profiles = None
136
  if use_full_pipeline:
137
- from rank import _enhanced_parse_query, _expand_with_aliases
138
- from src.search.reranker import CrossEncoderReranker
139
- from src.matching.scorer import CandidateScorer
140
- from src.agents.executor import ExecutorAgent
141
- from src.core.profile_store import ProfileStore
142
-
143
- logger.info("Loading full pipeline components...")
144
- reranker = CrossEncoderReranker(timeout_ms=0)
145
- scorer = CandidateScorer()
146
- profiles = ProfileStore()
147
- profiles.load_offset_index(index_dir / "offset_index.json")
148
- executor = ExecutorAgent(hybrid, reranker, scorer, profiles)
149
 
150
  all_metrics: dict[str, list] = {
151
  "p@5": [], "p@10": [], "p@20": [],
@@ -168,23 +257,8 @@ def evaluate(
168
 
169
  t0 = time.perf_counter()
170
 
171
- if use_full_pipeline and executor is not None:
172
- # Use full pipeline: parse executor → (optional cross-encoder) → scorer
173
- variants = _expand_with_aliases(query_text)[:3]
174
- all_pid_scores: dict[str, float] = {}
175
- for variant in variants:
176
- parsed = _enhanced_parse_query(variant)
177
- results = asyncio.run(executor.execute(parsed, top_k=30, skip_reranker=skip_reranker))
178
- for r in results:
179
- pid = r.profile_id
180
- score = r.scores.overall
181
- if pid not in all_pid_scores or score > all_pid_scores[pid]:
182
- all_pid_scores[pid] = score
183
- retrieved = [pid for pid, _ in sorted(all_pid_scores.items(), key=lambda x: -x[1])]
184
- else:
185
- # Use hybrid search directly
186
- results = hybrid.search(query_text, top_k=50)
187
- retrieved = [pid for pid, _ in results]
188
 
189
  elapsed = (time.perf_counter() - t0) * 1000
190
  all_metrics["latencies"].append(elapsed)
@@ -248,7 +322,11 @@ if __name__ == "__main__":
248
  help="Evaluate only N queries for quick testing")
249
  args = parser.parse_args()
250
 
251
- result = evaluate(use_full_pipeline=args.full_pipeline, skip_reranker=args.skip_reranker)
 
 
 
 
252
  if result:
253
  report_path = DATA_DIR / "evaluation_report.json"
254
  if args.full_pipeline and args.skip_reranker:
 
88
  return path.parent if path.exists() else None
89
 
90
 
91
+ def _run_full_pipeline(
92
+ queries_list: list,
93
+ gt_map: dict,
94
+ hybrid: HybridSearch,
95
+ skip_reranker: bool,
96
+ ) -> dict:
97
+ """Run full pipeline across all queries in a single event loop."""
98
+ from rank import _enhanced_parse_query, _expand_with_aliases
99
+ from src.search.reranker import CrossEncoderReranker
100
+ from src.matching.scorer import CandidateScorer
101
+ from src.agents.executor import ExecutorAgent
102
+ from src.core.profile_store import ProfileStore
103
+
104
+ index_dir = find_index_dir()
105
+ logger.info("Loading full pipeline components...")
106
+ reranker = CrossEncoderReranker(timeout_ms=0)
107
+ scorer = CandidateScorer()
108
+ profiles = ProfileStore()
109
+ profiles.load_offset_index(index_dir / "offset_index.json")
110
+ executor = ExecutorAgent(hybrid, reranker, scorer, profiles)
111
+
112
+ async def process_queries():
113
+ metrics: dict[str, list] = {
114
+ "p@5": [], "p@10": [], "p@20": [],
115
+ "r@5": [], "r@10": [], "r@20": [],
116
+ "mrr": [], "ndcg@10": [], "latencies": [],
117
+ }
118
+ evaluated = 0
119
+ skipped = 0
120
+
121
+ for q in queries_list:
122
+ query_text = q.get("query", q.get("raw_query", ""))
123
+ qid = q.get("query_id", q.get("id", ""))
124
+ relevant = set(gt_map.get(qid, []))
125
+ if not query_text or not relevant:
126
+ skipped += 1
127
+ continue
128
+
129
+ t0 = time.perf_counter()
130
+ variants = _expand_with_aliases(query_text)[:3]
131
+ all_pid_scores: dict[str, float] = {}
132
+ for variant in variants:
133
+ parsed = _enhanced_parse_query(variant)
134
+ results = await executor.execute(parsed, top_k=30, skip_reranker=skip_reranker)
135
+ for r in results:
136
+ pid = r.profile_id
137
+ score = r.scores.overall
138
+ if pid not in all_pid_scores or score > all_pid_scores[pid]:
139
+ all_pid_scores[pid] = score
140
+
141
+ retrieved = [pid for pid, _ in sorted(all_pid_scores.items(), key=lambda x: -x[1])]
142
+ elapsed = (time.perf_counter() - t0) * 1000
143
+ metrics["latencies"].append(elapsed)
144
+
145
+ for k in (5, 10, 20):
146
+ metrics[f"p@{k}"].append(precision_at_k(retrieved, relevant, k))
147
+ metrics[f"r@{k}"].append(recall_at_k(retrieved, relevant, k))
148
+ metrics["mrr"].append(mean_reciprocal_rank(retrieved, relevant))
149
+ metrics["ndcg@10"].append(ndcg_at_k(retrieved, relevant, 10))
150
+ evaluated += 1
151
+
152
+ if evaluated % 50 == 0:
153
+ logger.info(f" processed {evaluated}/{len(queries_list)} queries...")
154
+
155
+ metrics["total_queries"] = evaluated
156
+ metrics["skipped"] = skipped
157
+
158
+ summary: dict = {}
159
+ for metric, values in metrics.items():
160
+ if isinstance(values, list) and values:
161
+ summary[metric] = {
162
+ "mean": round(mean(values), 4),
163
+ "median": round(median(values), 4),
164
+ "min": round(min(values), 4),
165
+ "max": round(max(values), 4),
166
+ }
167
+ elif isinstance(values, (int, float)):
168
+ summary[metric] = values
169
+
170
+ summary["latency"] = latency_stats(metrics["latencies"])
171
+ for k in ("p50", "p95", "p99", "mean", "min", "max"):
172
+ if k in summary["latency"]:
173
+ summary["latency"][k] = round(summary["latency"][k], 1)
174
+ summary["cross_lingual_mrr"] = round(cross_lingual_mrr({
175
+ "queries": {i: q for i, q in enumerate(queries_list)},
176
+ "mrr": {i: v for i, v in enumerate(metrics["mrr"])},
177
+ }), 4)
178
+
179
+ logger.info("Full pipeline evaluation results:")
180
+ for m in ("p@5", "p@10", "r@5", "r@10", "mrr", "ndcg@10"):
181
+ if m in summary:
182
+ s = summary[m]
183
+ logger.info(f" {m}: mean={s['mean']:.4f}, median={s['median']:.4f}")
184
+ lat = summary["latency"]
185
+ logger.info(f" latency: p50={lat['p50']:.0f}ms, p95={lat['p95']:.0f}ms")
186
+ logger.info(f" cross-lingual MRR: {summary['cross_lingual_mrr']:.4f}")
187
+ return summary
188
+
189
+ return asyncio.run(process_queries())
190
+
191
+
192
  def evaluate(
193
  queries_path: Path = QUERIES_PATH,
194
  ground_truth_path: Path = GROUND_TRUTH_PATH,
195
  use_full_pipeline: bool = False,
196
  skip_reranker: bool = False,
197
+ sample_n: int = 0,
198
  ) -> dict:
199
  index_dir = find_index_dir()
200
  if index_dir is None:
 
218
 
219
  queries_list = queries_raw if isinstance(queries_raw, list) else list(queries_raw.values())
220
  gt_map = ground_truth if isinstance(ground_truth, dict) else {}
221
+ if sample_n > 0:
222
+ queries_list = queries_list[:sample_n]
223
+ logger.info(f"Sampling {sample_n} queries for quick evaluation")
224
 
225
  logger.info(f"Loaded {len(queries_list)} queries and {len(gt_map)} ground truth entries")
226
 
 
233
  embedder = MultilingualEmbedder()
234
  hybrid = HybridSearch(vector_search, bm25_search, embedder)
235
 
 
 
 
 
 
236
  if use_full_pipeline:
237
+ return _run_full_pipeline(queries_list, gt_map, hybrid, skip_reranker)
 
 
 
 
 
 
 
 
 
 
 
238
 
239
  all_metrics: dict[str, list] = {
240
  "p@5": [], "p@10": [], "p@20": [],
 
257
 
258
  t0 = time.perf_counter()
259
 
260
+ results = hybrid.search(query_text, top_k=50)
261
+ retrieved = [pid for pid, _ in results]
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
262
 
263
  elapsed = (time.perf_counter() - t0) * 1000
264
  all_metrics["latencies"].append(elapsed)
 
322
  help="Evaluate only N queries for quick testing")
323
  args = parser.parse_args()
324
 
325
+ result = evaluate(
326
+ use_full_pipeline=args.full_pipeline,
327
+ skip_reranker=args.skip_reranker,
328
+ sample_n=args.sample,
329
+ )
330
  if result:
331
  report_path = DATA_DIR / "evaluation_report.json"
332
  if args.full_pipeline and args.skip_reranker:
src/agents/executor.py CHANGED
@@ -60,7 +60,7 @@ class ExecutorAgent:
60
  self.reranker = reranker
61
  self.scorer = scorer
62
  self.profile_store = profiles
63
- self._rerank_top_k = 50
64
 
65
  async def execute(
66
  self,
@@ -115,6 +115,11 @@ class ExecutorAgent:
115
 
116
  if skip_reranker:
117
  candidate_scores = filtered[:top_k * 2]
 
 
 
 
 
118
  else:
119
  rerank_candidates: list[tuple[str, str, float]] = []
120
  for pid, score in filtered[: self._rerank_top_k]:
@@ -245,9 +250,6 @@ class ExecutorAgent:
245
  scorer = CandidateScorer()
246
  match_scores = scorer.compute_overall(scores_dict, slider_weights)
247
 
248
- if skip_reranker and rerank_score is not None:
249
- match_scores.overall = rerank_score
250
-
251
  req_only_matched, req_only_missing = _match_skills_detail(
252
  req_names, profile.skills, profile.raw_text,
253
  )
 
60
  self.reranker = reranker
61
  self.scorer = scorer
62
  self.profile_store = profiles
63
+ self._rerank_top_k = 20
64
 
65
  async def execute(
66
  self,
 
115
 
116
  if skip_reranker:
117
  candidate_scores = filtered[:top_k * 2]
118
+ # Normalize RRF scores to [0, 1] so they work as cross_encoder_score dimension
119
+ if candidate_scores:
120
+ max_score = max(s for _, s in candidate_scores)
121
+ if max_score > 0:
122
+ candidate_scores = [(pid, s / max_score) for pid, s in candidate_scores]
123
  else:
124
  rerank_candidates: list[tuple[str, str, float]] = []
125
  for pid, score in filtered[: self._rerank_top_k]:
 
250
  scorer = CandidateScorer()
251
  match_scores = scorer.compute_overall(scores_dict, slider_weights)
252
 
 
 
 
253
  req_only_matched, req_only_missing = _match_skills_detail(
254
  req_names, profile.skills, profile.raw_text,
255
  )