Krishnasri2027/qwen25-coder-1.5b-instruct-fine-tuned-merged Text Generation • 2B • Updated 30 days ago • 531 • 1
Krishnasri2027/qwen25-coder-1.5b-instruct-fine-tuned-merged Text Generation • 2B • Updated 30 days ago • 531 • 1
view article Article Illustrating Reinforcement Learning from Human Feedback (RLHF) +2 natolambert, LouisCastricato, lvwerra, Dahoas • Dec 9, 2022 • 432