Commit History

Answer-quality eval (LLM-judge) + hy3-led OpenRouter default (#81)
0942768
unverified

eliezer avihail Claude commited on

Add the agentic benchmark: coverage via citations, agentic vs single-shot
c731ea6
unverified

Claude Claude Fable 5 commited on

Add the v1 eval dataset: 100 valid + 100 invalid + 20 agentic
4b1e499
unverified

Claude Claude Fable 5 commited on

Add a retrieval benchmark: recall@k + MRR over the v0 questions
6645570
unverified

Claude Claude Fable 5 commited on

Codebase quality pass: kill silent-truncation hacks, fix latent bugs, cover them (#46)
95d6832
unverified

eliezer avihail Claude commited on

Fix LLM transport drift, wire live static checks, clean config (#39)
6802438
unverified

eliezer avihail Claude commited on

Close M1: full 15/15 baseline, two fabrication findings, checker fix
421e5bd
unverified

Claude Claude Fable 5 commited on

Fix static checks for real-world answers: dedent code blocks, alias-aware symbols
527bf99
unverified

Claude Claude Fable 5 commited on

M1: Answer schema, LLM wrapper with retry+repair, static checks, 15-question eval
608ff6b
unverified

Claude Claude Fable 5 commited on

Scaffold repo structure per M0 (pyproject, ruff, pytest, pre-commit)
c2bca9d
unverified

Claude commited on