CoTrace: Data Recipes for Training Terminal Agents with Harness-Model Co-Evolution Paper • 2610.10426 • Published 3 days ago • 7
Learning to Solve Hard Problems in RL for LLMs by Never Giving Up Paper • 2609.13443 • Published 29 days ago • 13
Meta-Reinforcement Learning with Self-Reflection for Agentic Search Paper • 2603.11327 • Published Mar 11 • 12
The Delta Learning Hypothesis: Preference Tuning on Weak Data can Yield Strong Gains Paper • 2507.06187 • Published Jul 8, 2025
DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research Paper • 2511.19399 • Published Nov 24, 2025 • 64