SimpleMemVLA: A Simple but Effective Native-Video Memory for Vision-Language-Action Models Paper • 2609.05533 • Published 18 days ago • 15
StudyBench: Can Self-Evolution Squeeze Textbooks for Olympiad Capability? Paper • 2609.00787 • Published 19 days ago • 19
Φ-Bench: Can Large Language Models Engineer the Infrastructure That Powers Them? Paper • 2609.10226 • Published 11 days ago • 19
SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents Paper • 2609.08149 • Published 12 days ago • 28
T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks Paper • 2609.11042 • Published 10 days ago • 61
Rethinking On-Policy Distillation of Large Language Models II: One Training Example Paper • 2609.04172 • Published 17 days ago • 98