Upload PPO-aligned Llama-3.2-1B model using RoBERTa-base reward model on UltraFeedback_openbmb with stabilized KL settings 55f1b86 verified payelb commited on May 11
Upload tokenizer for UltraFeedback_openbmb RoBERTa-RM aligned Llama-3.2-1B model 674b9f5 verified payelb commited on May 11