CheckerBench: Can Long-Horizon Agents Synthesize Static-Analysis Checkers? Paper • 2610.07557 • Published 5 days ago • 63
Learn2Play Bench: How Well Do LLM Agents Learn from Experience in Unfamiliar Environments? Paper • 2610.08215 • Published 3 days ago • 130
LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence Paper • 2609.17488 • Published 26 days ago • 559