OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models Paper • 2607.28609 • Published Jul 30 • 75
SRPO Collection Official Collections for SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models, including SFT and RL models. • 6 items • Updated Aug 6 • 2
SRPO Collection Official Collections for SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models, including SFT and RL models. • 6 items • Updated Aug 6 • 2
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning Paper • 2607.29613 • Published Jul 31 • 29
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning Paper • 2607.29613 • Published Jul 31 • 29 • 7
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning Paper • 2607.29613 • Published Jul 31 • 29 • 7
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning Paper • 2607.29613 • Published Jul 31 • 29 • 7
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning Paper • 2607.29613 • Published Jul 31 • 29 • 7
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning Paper • 2607.29613 • Published Jul 31 • 29 • 7
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning Paper • 2607.29613 • Published Jul 31 • 29
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning Paper • 2607.29613 • Published Jul 31 • 29