Lucas Oliveira
lucasolive
ยท
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
liked a dataset 1 day ago
Srishti280992/repro-exact-unlearning-in-reinforcement-learning-traces liked a dataset 1 day ago
HumanDynamics/reward_modeling_dataset liked a dataset 1 day ago
andersonbcdefg/reward-modeling-eval-tokenizedOrganizations
None yet