Mehdi BEN BARKA
Fix colorTo
f4fa85d
|
Raw
History Blame Contribute Delete
1.53 kB
---
title: pass@k Homogène vs Dynamique (SWE-bench Lite)
emoji: 📊
colorFrom: blue
colorTo: yellow
sdk: gradio
sdk_version: "4.44.0"
app_file: app.py
pinned: false
license: mit
---
# pass@k — Allocation homogène vs dynamique sur SWE-bench Lite
Simulation Monte Carlo interactive comparant deux stratégies d'estimation de **pass@k** sur SWE-bench Lite (300 tâches de résolution de bugs Python, 250 runs/tâche).
## Méthodes comparées
**Homogène (Rao-Blackwell)** : n runs par tâche, estimateur non-paramétrique à variance minimale.
**Dynamique (Algorithme 2, Kazdan et al. 2025)** : budget total B = T×n alloué adaptativement via `SelectHardestProblem`, estimation par fit beta-binomial (MLE Nelder-Mead).
## Paramètres
- `n` : runs par tâche (budget = T×n)
- `T` : nombre de tâches échantillonnées
- `k` : seuil pass@k
- seeds monde × seeds ordre : plan factoriel pour décomposer variance inter-benchmark et variance d'estimation
## Résultats
Sur SWE-bench Lite (distribution Zero-Inflated Beta, 44% de tâches à p=0), l'homogène domine systématiquement. La dynamique gaspille 90% du budget sur des tâches impossibles.
## Références
- Kazdan et al. (2025) — *Efficient Prediction of Pass@k Scaling in Large Language Models* — [arXiv:2510.05197](https://arxiv.org/abs/2510.05197)
- Jimenez et al. (2024) — *SWE-bench Lite* — [GitHub](https://github.com/princeton-nlp/SWE-bench)
- Chen et al. (2021) — *Evaluating Large Language Models Trained on Code* (pass@k original)