A newer version of the Gradio SDK is available: 6.20.0
metadata
title: pass@k — Homogène vs Dynamique (SWE-bench Lite)
emoji: 📊
colorFrom: blue
colorTo: yellow
sdk: gradio
sdk_version: 4.44.0
app_file: app.py
pinned: false
license: mit
pass@k — Allocation homogène vs dynamique sur SWE-bench Lite
Simulation Monte Carlo interactive comparant deux stratégies d'estimation de pass@k sur SWE-bench Lite (300 tâches de résolution de bugs Python, 250 runs/tâche).
Méthodes comparées
Homogène (Rao-Blackwell) : n runs par tâche, estimateur non-paramétrique à variance minimale.
Dynamique (Algorithme 2, Kazdan et al. 2025) : budget total B = T×n alloué adaptativement via SelectHardestProblem, estimation par fit beta-binomial (MLE Nelder-Mead).
Paramètres
n: runs par tâche (budget = T×n)T: nombre de tâches échantillonnéesk: seuil pass@k- seeds monde × seeds ordre : plan factoriel pour décomposer variance inter-benchmark et variance d'estimation
Résultats
Sur SWE-bench Lite (distribution Zero-Inflated Beta, 44% de tâches à p=0), l'homogène domine systématiquement. La dynamique gaspille 90% du budget sur des tâches impossibles.
Références
- Kazdan et al. (2025) — Efficient Prediction of Pass@k Scaling in Large Language Models — arXiv:2510.05197
- Jimenez et al. (2024) — SWE-bench Lite — GitHub
- Chen et al. (2021) — Evaluating Large Language Models Trained on Code (pass@k original)