Commit History

Upload PPO-aligned Llama-3.2-1B model using RoBERTa-base reward model on UltraFeedback_openbmb with stabilized KL settings
55f1b86
verified

payelb commited on

Upload tokenizer for UltraFeedback_openbmb RoBERTa-RM aligned Llama-3.2-1B model
674b9f5
verified

payelb commited on

initial commit
7ebe7be
verified

payelb commited on