SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness Paper • 2609.20519 • Published 4 days ago • 94
An Empirical Study of Harness Design for Coding Agents Paper • 2609.20804 • Published 4 days ago • 71
HypoEvolve: Genetic Algorithms Enable Multi-Agent LLMs to Discover Scientific Hypotheses Paper • 2609.15938 • Published 7 days ago • 28
Agora: Git as Shared Memory for Collective AutoResearch Paper • 2609.18094 • Published 5 days ago • 45
COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization Paper • 2609.11682 • Published 11 days ago • 44
Diffs vs. Whole Files: An Empirical Comparison of Iterative Edit-Based and Direct Generation for Flutter/Dart Code Models Paper • 2609.05779 • Published 16 days ago • 9
AgentGrad: Intervention-guided Prompt Optimization for Multi Agent Systems Paper • 2609.08572 • Published 13 days ago • 103
An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics Paper • 2609.10712 • Published 12 days ago • 43
SpatialBlock: Enhancing Spatial Intelligence in LVLMs via Synthetic Block-Stacking Problem Paper • 2609.07064 • Published 14 days ago • 143
EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents Paper • 2609.05903 • Published 16 days ago • 63
Revisiting Complete Reasoning Traces for Post-Training Paper • 2609.07103 • Published 14 days ago • 23
NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness Paper • 2609.08183 • Published 13 days ago • 171
When Models Edit Too Much: On the Fidelity of Minimal Code Edits Paper • 2609.04061 • Published 18 days ago • 9
Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems Paper • 2609.02750 • Published 19 days ago • 142
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning Paper • 2609.03430 • Published 18 days ago • 186
Rethinking On-Policy Distillation of Large Language Models II: One Training Example Paper • 2609.04172 • Published 18 days ago • 98
PaperCompiler: Faithful Paper-to-Code Generation via Repository-Level Specification Compilation Paper • 2609.02272 • Published 19 days ago • 7
S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement? Paper • 2608.31100 • Published 21 days ago • 40