Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening Paper • 2609.18708 • Published 14 days ago • 82
T1 Collection CC BY 4.0 RL checkpoints for T1; base-model and third-party terms still apply. • 4 items • Updated 13 days ago • 5
T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks Paper • 2609.11042 • Published 20 days ago • 64
ADWIN: Adaptive Windows for Horizon-Aware On-Policy Distillation Paper • 2605.28396 • Published May 27 • 2