CP Legendre commited on
Commit
c797253
·
2 Parent(s): f1ae26647339ba

Merge main and address ranking review feedback

Browse files
src/charts.py CHANGED
@@ -24,7 +24,7 @@ PlotBackground = Literal["Dark", "White"]
24
  DEFAULT_PALETTE: PaletteName = "Citrus"
25
  DEFAULT_BACKGROUND: PlotBackground = "Dark"
26
 
27
- RANKING_MIN_HEIGHT_PX = 680
28
  RANKING_ROW_HEIGHT_PX = 44
29
  RANKING_VERTICAL_PADDING_PX = 280
30
  MATRIX_MIN_HEIGHT_PX = 720
 
24
  DEFAULT_PALETTE: PaletteName = "Citrus"
25
  DEFAULT_BACKGROUND: PlotBackground = "Dark"
26
 
27
+ RANKING_MIN_HEIGHT_PX = 340
28
  RANKING_ROW_HEIGHT_PX = 44
29
  RANKING_VERTICAL_PADDING_PX = 280
30
  MATRIX_MIN_HEIGHT_PX = 720
src/rankings.py CHANGED
@@ -7,6 +7,7 @@ import choix
7
 
8
 
9
  EXCLUDED_BENCHMARKS = {"Shellbench"}
 
10
 
11
 
12
  def prepare_ranking_data(
@@ -147,10 +148,18 @@ def load_and_rank(
147
  empty = _empty_table()
148
  return empty, empty, empty
149
 
 
 
 
 
150
  results = []
151
- for rank_fn in (rank_harnesses, rank_models, rank_pairs):
 
 
 
 
152
  try:
153
- results.append(rank_fn(df, metcol, descending))
154
  except ValueError:
155
  results.append(_empty_table())
156
  return results[0], results[1], results[2]
 
7
 
8
 
9
  EXCLUDED_BENCHMARKS = {"Shellbench"}
10
+ EXCLUDED_HARNESSES_FROM_PAIRWISE = {"Codex", "Qwen Code"}
11
 
12
 
13
  def prepare_ranking_data(
 
148
  empty = _empty_table()
149
  return empty, empty, empty
150
 
151
+ pairwise_harness_df = df.loc[
152
+ ~df["harness.name"].isin(EXCLUDED_HARNESSES_FROM_PAIRWISE)
153
+ ].reset_index(drop=True)
154
+
155
  results = []
156
+ for rank_fn, ranking_df in (
157
+ (rank_harnesses, pairwise_harness_df),
158
+ (rank_models, df),
159
+ (rank_pairs, pairwise_harness_df),
160
+ ):
161
  try:
162
+ results.append(rank_fn(ranking_df, metcol, descending))
163
  except ValueError:
164
  results.append(_empty_table())
165
  return results[0], results[1], results[2]
tests/test_ranking_refinements.py CHANGED
@@ -90,3 +90,37 @@ def test_ranking_plot_height_scales_with_agents_and_keeps_all_y_labels():
90
  assert figure.layout.yaxis.tickmode == "array"
91
  assert len(figure.layout.yaxis.tickvals) == rows
92
  assert len(figure.layout.yaxis.ticktext) == rows
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
90
  assert figure.layout.yaxis.tickmode == "array"
91
  assert len(figure.layout.yaxis.tickvals) == rows
92
  assert len(figure.layout.yaxis.ticktext) == rows
93
+
94
+
95
+ def test_pairwise_harness_rankings_exclude_low_data_harnesses(tmp_path):
96
+ rankings = _rankings_module()
97
+ csv_path = tmp_path / "results.csv"
98
+ pd.DataFrame(
99
+ {
100
+ "benchmark.name": [
101
+ "Bench A", "Bench A", "Bench A", "Bench A",
102
+ "Bench B", "Bench B", "Bench B", "Bench B",
103
+ ],
104
+ "model.name": ["m1", "m1", "m1", "m1", "m2", "m2", "m2", "m2"],
105
+ "harness.name": [
106
+ "Claude Code", "OpenCode", "Codex", "Qwen Code",
107
+ "Claude Code", "OpenCode", "Codex", "Qwen Code",
108
+ ],
109
+ "metrics.score": [0.8, 0.7, 0.95, 0.9, 0.75, 0.65, 0.93, 0.88],
110
+ "model.is_oss": [True] * 8,
111
+ "harness.is_oss": [True] * 8,
112
+ }
113
+ ).to_csv(csv_path, index=False)
114
+
115
+ harness_df, model_df, pair_df = rankings.load_and_rank(csv_path)
116
+
117
+ assert set(harness_df["Category"]) == {"Claude Code", "OpenCode"}
118
+ assert not pair_df["Category"].str.contains("Codex|Qwen Code").any()
119
+ assert set(model_df["Category"]) == {"m1", "m2"}
120
+
121
+
122
+ def test_ranking_minimum_height_is_reduced_without_changing_matrix_minimum():
123
+ source = Path("src/charts.py").read_text()
124
+
125
+ assert "RANKING_MIN_HEIGHT_PX = 340" in source
126
+ assert "MATRIX_MIN_HEIGHT_PX = 720" in source