AI & ML interests
RL, Agent, Efficient ML
Organizations
upvoted a paper 3 months ago upvoted a paper 6 months ago view article Navigating the RLHF Landscape: From Policy Gradients to PPO, GAE, and DPO for LLM Alignment
NormalUhr
• • 132
upvoted a paper 10 months ago upvoted a paper 11 months ago upvoted a paper about 1 year ago upvoted a paper over 1 year ago