Upload PPO-aligned Llama-3.2-1B using semantic-MARS DeBERTa RM on UltraFeedback_openbmb, matched PPO setup with KL-safe generation 0a716c2 verified payelb commited on May 12
Upload tokenizer for UltraFeedback_openbmb semantic-MARS DeBERTa aligned Llama-3.2-1B model af56aff verified payelb commited on May 12
Upload PPO-aligned Llama-3.2-1B model using semantic-distance-aware MARS DeBERTa reward model on UltraFeedback_openbmb 5346682 verified payelb commited on May 7
Upload tokenizer for UltraFeedback_openbmb semantic-MARS aligned Llama-3.2-1B model 706a027 verified payelb commited on May 7