PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning
Paper • 2608.01837 • Published • 30
None defined yet.
PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning
Share More, Search Less: Collaborative Parallel Thinking for Efficient Test-Time Scaling