Question-level checkpointing in the eval (--checkpoint-every, default 10) 65ca914 HenriLD Claude Opus 4.8 commited on Jun 19
Log generation/request ids on eval failures for trace debugging 0a88727 HenriLD Claude Opus 4.8 commited on Jun 17
Add AGENT_MAX_RPM global throttle for free-tier benchmarking 091d09a HenriLD Claude Opus 4.8 commited on Jun 16
Experiment: AGENT_SQL_ONLY mode (no templates, SQL for everything) c9d0871 HenriLD Claude Opus 4.8 commited on Jun 16
Parallelize the eval harness + add per-model health table 8114f20 HenriLD Claude Opus 4.8 commited on Jun 16
Advanced analytics layer: make deep/compound questions first-class 8fd83e2 HenriLD Claude Opus 4.8 commited on Jun 15
eval: widen want_metric keywords to match rendered axis labels 807b566 HenriLD Claude Opus 4.8 commited on Jun 15
Steer interpretive questions toward insightful metrics efba11e HenriLD Claude Opus 4.8 commited on Jun 15
Shot chart: color by any category (quarter, zone, opponent), not just made/miss c32c794 HenriLD Claude Opus 4.8 commited on Jun 15
Expose court renderers as chart types for the flexible SQL path ecaae24 HenriLD Claude Opus 4.8 commited on Jun 15
Eval: provider/model health tracking, --runs, tougher interpretive questions 625627e HenriLD Claude Opus 4.8 commited on Jun 15
Distributions: drop mean line, fix theming, support player/team comparisons ba3ab08 HenriLD Claude Opus 4.8 commited on Jun 14
Bias toward distributions: violin/box/histogram + stat_distribution template 855bc7f HenriLD Claude Opus 4.8 commited on Jun 14
Render multiple charts side by side + harden against model API errors 7e84d02 HenriLD Claude Fable 5 commited on Jun 13
Fix benchmark/eval to use auto tool_choice (forced function unsupported) d36a3cf HenriLD Claude Fable 5 commited on Jun 13
Pretty field labels + multi-model benchmark harness 8ba3cab HenriLD Claude Fable 5 commited on Jun 13
Add flexible SQL query path + new templates + safe executor c3b1803 HenriLD Claude Fable 5 commited on Jun 13