Answer-quality eval (LLM-judge) + hy3-led OpenRouter default (#81) 0942768 unverified eliezer avihail Claude commited on 23 days ago
Add the agentic benchmark: coverage via citations, agentic vs single-shot c731ea6 unverified Claude Claude Fable 5 commited on 23 days ago
Add the v1 eval dataset: 100 valid + 100 invalid + 20 agentic 4b1e499 unverified Claude Claude Fable 5 commited on 23 days ago
Add a retrieval benchmark: recall@k + MRR over the v0 questions 6645570 unverified Claude Claude Fable 5 commited on 24 days ago
Codebase quality pass: kill silent-truncation hacks, fix latent bugs, cover them (#46) 95d6832 unverified eliezer avihail Claude commited on 25 days ago
Fix LLM transport drift, wire live static checks, clean config (#39) 6802438 unverified eliezer avihail Claude commited on 25 days ago
Close M1: full 15/15 baseline, two fabrication findings, checker fix 421e5bd unverified Claude Claude Fable 5 commited on 26 days ago
Fix static checks for real-world answers: dedent code blocks, alias-aware symbols 527bf99 unverified Claude Claude Fable 5 commited on 26 days ago
M1: Answer schema, LLM wrapper with retry+repair, static checks, 15-question eval 608ff6b unverified Claude Claude Fable 5 commited on 26 days ago
Scaffold repo structure per M0 (pyproject, ruff, pytest, pre-commit) c2bca9d unverified Claude commited on 29 days ago