Collections
Discover the best community collections!
Collections trending this week
-
Deep reinforcement learning from human preferences
Paper • 1706.03741 • Published • 4 -
Training language models to follow instructions with human feedback
Paper • 2203.02155 • Published • 25 -
Direct Preference-based Policy Optimization without Reward Modeling
Paper • 2301.12842 • Published -
Woodpecker: Hallucination Correction for Multimodal Large Language Models
Paper • 2310.16045 • Published • 17
-
DEFT: Data Efficient Fine-Tuning for Large Language Models via Unsupervised Core-Set Selection
Paper • 2310.16776 • Published -
Towards an On-device Agent for Text Rewriting
Paper • 2308.11807 • Published -
Discourse-Aware Text Simplification: From Complex Sentences to Linked Propositions
Paper • 2308.00425 • Published -
RewriteLM: An Instruction-Tuned Large Language Model for Text Rewriting
Paper • 2305.15685 • Published • 4
-
Deep reinforcement learning from human preferences
Paper • 1706.03741 • Published • 4 -
Training language models to follow instructions with human feedback
Paper • 2203.02155 • Published • 25 -
Direct Preference-based Policy Optimization without Reward Modeling
Paper • 2301.12842 • Published -
Woodpecker: Hallucination Correction for Multimodal Large Language Models
Paper • 2310.16045 • Published • 17
-
DEFT: Data Efficient Fine-Tuning for Large Language Models via Unsupervised Core-Set Selection
Paper • 2310.16776 • Published -
Towards an On-device Agent for Text Rewriting
Paper • 2308.11807 • Published -
Discourse-Aware Text Simplification: From Complex Sentences to Linked Propositions
Paper • 2308.00425 • Published -
RewriteLM: An Instruction-Tuned Large Language Model for Text Rewriting
Paper • 2305.15685 • Published • 4