Question-level checkpointing in the eval (--checkpoint-every, default 10) 65ca914 HenriLD Claude Opus 4.8 commited on Jun 19
Log generation/request ids on eval failures for trace debugging 0a88727 HenriLD Claude Opus 4.8 commited on Jun 17
Add AGENT_MAX_RPM global throttle for free-tier benchmarking 091d09a HenriLD Claude Opus 4.8 commited on Jun 16
Experiment: AGENT_SQL_ONLY mode (no templates, SQL for everything) c9d0871 HenriLD Claude Opus 4.8 commited on Jun 16
Parallelize the eval harness + add per-model health table 8114f20 HenriLD Claude Opus 4.8 commited on Jun 16
Steer interpretive questions toward insightful metrics efba11e HenriLD Claude Opus 4.8 commited on Jun 15
Eval: provider/model health tracking, --runs, tougher interpretive questions 625627e HenriLD Claude Opus 4.8 commited on Jun 15
Render multiple charts side by side + harden against model API errors 7e84d02 HenriLD Claude Fable 5 commited on Jun 13
Add flexible SQL query path + new templates + safe executor c3b1803 HenriLD Claude Fable 5 commited on Jun 13