Schrödinger's Code Repository: Have LLMs Learned SWE-bench or Memorized It? Paper • 2609.27891 • Published Aug 21 • 24
SpeakerMem-R1: Speaker-Centered Dual-Track Memory for Multi-Party Dialogue Paper • 2609.26780 • Published 6 days ago • 90
RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling Paper • 2609.22947 • Published 9 days ago • 33
SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness Paper • 2609.20519 • Published 11 days ago • 137
MintAct: A Unified Visual Agent for Digital Environments Paper • 2609.22083 • Published 10 days ago • 35
ALPINE: Adaptive Localization for Parameter- and Sample-Efficient Few-Shot Learning Paper • 2609.22323 • Published 12 days ago • 10
Harness-Zero: Harness Distillation via Agent-as-Harness Paper • 2609.24974 • Published 7 days ago • 37
RRSI: Regularized Recursive Self-Improvement of Agent Harnesses Paper • 2609.24972 • Published 7 days ago • 211