payelb's picture
Upload PPO-aligned Llama-3.2-1B model using RoBERTa-base reward model on PKUSafeRLHF with stabilized KL settings
5b527a7 verified