Commit History

Upload PPO-aligned Llama-3.2-1B model using semantic-MARS RoBERTa RM on HHRLHF, KL-safe generation kwargs
87e5909
verified

payelb commited on

Upload tokenizer for HHRLHF semantic-MARS RoBERTa aligned Llama-3.2-1B model
8a20bd7
verified

payelb commited on

Upload PPO-aligned Llama-3.2-1B model using RoBERTa-base reward model on HHRLHF
f429ab0
verified

payelb commited on

Upload tokenizer for HHRLHF RoBERTa-RM aligned Llama-3.2-1B model
e2447a4
verified

payelb commited on

Upload PPO-aligned Llama-3.2-1B model using semantic-distance-aware MARS RoBERTa-base reward model on HHRLHF
d8bc668
verified

payelb commited on

Upload tokenizer for HHRLHF semantic-MARS RoBERTa aligned Llama-3.2-1B model
8fd592a
verified

payelb commited on

initial commit
7a9a0af
verified

payelb commited on