torchdocs-agent / tests /eval /test_run_retrieval.py

Commit History

Add the v1 eval dataset: 100 valid + 100 invalid + 20 agentic
4b1e499
unverified

Claude Claude Fable 5 commited on

Add a retrieval benchmark: recall@k + MRR over the v0 questions
6645570
unverified

Claude Claude Fable 5 commited on