view article Article How UK AISI and EvalEval Are Making Benchmark Results Reproducible +7 evijit, j-chim, deeplumiere, srishtiy, wmmkennedy, irenesolaiman, mcfadyen-aisi, lynn-aisi, coz-aisi • 4 days ago • 19
Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting Paper • 2606.09809 • Published Jun 8 • 5
Survey of Cultural Awareness in Language Models: Text and Beyond Paper • 2411.00860 • Published Oct 30, 2024 • 24
Survey of Cultural Awareness in Language Models: Text and Beyond Paper • 2411.00860 • Published Oct 30, 2024 • 24
Revealing Fine-Grained Values and Opinions in Large Language Models Paper • 2406.19238 • Published Jun 27, 2024 • 16
Revealing Fine-Grained Values and Opinions in Large Language Models Paper • 2406.19238 • Published Jun 27, 2024 • 16