-
A General Theoretical Paradigm to Understand Learning from Human Preferences
Paper • 2310.12036 • Published • 20 -
ORPO: Monolithic Preference Optimization without Reference Model
Paper • 2403.07691 • Published • 75 -
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
Paper • 2305.18290 • Published • 71
jarvis
jarvis8x7b
AI & ML interests
None yet
Organizations
None yet
papers
-
A General Theoretical Paradigm to Understand Learning from Human Preferences
Paper • 2310.12036 • Published • 20 -
ORPO: Monolithic Preference Optimization without Reference Model
Paper • 2403.07691 • Published • 75 -
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
Paper • 2305.18290 • Published • 71
models 0
None public yet
datasets 0
None public yet