Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation Paper • 2609.11115 • Published 5 days ago • 47 • 3
Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation Paper • 2609.11115 • Published 5 days ago • 47
SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking Paper • 2609.13141 • Published 4 days ago • 46
Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy Paper • 2609.07470 • Published 8 days ago • 25
Steering Geometry: Validating Human Value Geometry in LLM Steering Space Paper • 2609.06289 • Published 10 days ago • 31
$R^3$-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets Paper • 2608.16033 • Published 29 days ago • 16 • 3
R^3-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets Paper • 2608.16033 • Published 29 days ago • 16