CheckerBench: Can Long-Horizon Agents Synthesize Static-Analysis Checkers? Paper • 2610.07557 • Published 5 days ago • 66
Learn2Play Bench: How Well Do LLM Agents Learn from Experience in Unfamiliar Environments? Paper • 2610.08215 • Published 3 days ago • 136
Running Featured 893 Agent Memory Leaderboard 🧠 893 Unified memory evaluation · Results expected August 12.