See2Think: Do Multimodal Models Really Use Intermediate Visual States? Paper • 2607.26769 • Published 3 days ago • 21
DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation Paper • 2606.31537 • Published Jun 30 • 29
view article Article ChatGPT 背后的“功臣”——RLHF 技术详解 +2 natolambert, LouisCastricato, lvwerra, Dahoas • Dec 9, 2022 • 14
view article Article Illustrating Reinforcement Learning from Human Feedback (RLHF) +2 natolambert, LouisCastricato, lvwerra, Dahoas • Dec 9, 2022 • 419
Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning Paper • 2410.21845 • Published Oct 29, 2024 • 16