Upload PPO-aligned Llama-3.2-1B model using semantic-MARS RoBERTa RM on HHRLHF, KL-safe generation kwargs 87e5909 verified payelb commited on May 12
Upload tokenizer for HHRLHF semantic-MARS RoBERTa aligned Llama-3.2-1B model 8a20bd7 verified payelb commited on May 12
Upload PPO-aligned Llama-3.2-1B model using RoBERTa-base reward model on HHRLHF f429ab0 verified payelb commited on May 11
Upload tokenizer for HHRLHF RoBERTa-RM aligned Llama-3.2-1B model e2447a4 verified payelb commited on May 11
Upload PPO-aligned Llama-3.2-1B model using semantic-distance-aware MARS RoBERTa-base reward model on HHRLHF d8bc668 verified payelb commited on May 11
Upload tokenizer for HHRLHF semantic-MARS RoBERTa aligned Llama-3.2-1B model 8fd592a verified payelb commited on May 11