ReCAST: Reward Credit Assignment across Timesteps for Online Diffusion Reinforcement Paper • 2609.13425 • Published 29 days ago • 10
ReSPO: Reshaped Sequence Policy Optimization for Gradient Starvation in Off-Policy Learning Paper • 2609.35433 • Published 12 days ago • 8
Post-Training Frontier Text-to-Image Models by Composing Preference and Rubric Rewards Paper • 2610.02967 • Published 8 days ago • 23
R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model Paper • 2503.05132 • Published Mar 7, 2025 • 57