PhysVista: Benchmarking Physical Intelligence in VLMs via a Perception-Reasoning-Assessment Loop Paper • 2610.00559 • Published 3 days ago • 14
CorrGRPO: Correlation-Normalized GRPO for Multi-Reward Learning Paper • 2609.36820 • Published 4 days ago • 18
InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation Paper • 2610.02196 • Published 2 days ago • 37
On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics Paper • 2609.35259 • Published 5 days ago • 130