view article Article How UK AISI and EvalEval Are Making Benchmark Results Reproducible +7 evijit, j-chim, deeplumiere, srishtiy, wmmkennedy, irenesolaiman, mcfadyen-aisi, lynn-aisi, coz-aisi • 5 days ago • 19
Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results Paper • 2606.14516 • Published Jun 12 • 7
view article Article Featuring Every Eval Ever Results on Hugging Face Model Pages +5 deepmage121, evijit, SaylorTwift, janbatzner, borgr, irenesolaiman, julien-c • Jun 30 • 54