torchdocs-agent / eval /run_agentic.py

Commit History

Make the agentic eval completable: bounded sample + 120m timeout
ee4b6fa
unverified

Claude Claude Opus 4.8 commited on

Add the agentic benchmark: coverage via citations, agentic vs single-shot
c731ea6
unverified

Claude Claude Fable 5 commited on