The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement Paper • 2609.11873 • Published 8 days ago • 88
Learning to Correct: Calibrated Reinforcement Learning for Multi-Attempt Chain-of-Thought Paper • 2604.17912 • Published Apr 20 • 1