SchemeArena: Factorized Stress Testing of Scheming in LLM Agents Paper • 2609.08126 • Published 6 days ago • 10
SchemeArena: Factorized Stress Testing of Scheming in LLM Agents Paper • 2609.08126 • Published 6 days ago • 10
LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering Paper • 2608.28281 • Published 17 days ago • 106
Reasoning Models Struggle to Control their Chains of Thought Paper • 2603.05706 • Published Mar 5 • 41
On Many-Shot In-Context Learning for Long-Context Evaluation Paper • 2411.07130 • Published Nov 11, 2024 • 7
ExpertLongBench: Benchmarking Language Models on Expert-Level Long-Form Generation Tasks with Structured Checklists Paper • 2506.01241 • Published Jun 2, 2025 • 9
ExpertLongBench: Benchmarking Language Models on Expert-Level Long-Form Generation Tasks with Structured Checklists Paper • 2506.01241 • Published Jun 2, 2025 • 9 • 2
ExpertLongBench: Benchmarking Language Models on Expert-Level Long-Form Generation Tasks with Structured Checklists Paper • 2506.01241 • Published Jun 2, 2025 • 9