Papers - Fine-tuning - Emulator Collection by matlok Mar 29, 2024 - An Emulator for Fine-Tuning Large Language Models using Small Language Models Paper • 2310.12962 • Published Oct 19, 2023 • 13
An Emulator for Fine-Tuning Large Language Models using Small Language Models Paper • 2310.12962 • Published Oct 19, 2023 • 13
Azerbaijan Collection by bahramhasanov Mar 29, 2024 - interneuronai/az-sentence-similarity Updated Mar 28, 2024 • 5
Models - Fine-tuning - PPO Collection by matlok Mar 29, 2024 - reciprocate/ppo_hh_pythia-6B Text Generation • Updated Jan 20, 2023 • 24 • 6
Papers - Reward Models - KL Regularization - RL Collection by matlok Apr 16, 2024 - Leverage the Average: an Analysis of KL Regularization in RL Paper • 2003.14089 • Published Mar 31, 2020 • 2 Learn Your Reference Model for Real Good Alignment Paper • 2404.09656 • Published Apr 15, 2024 • 91
Leverage the Average: an Analysis of KL Regularization in RL Paper • 2003.14089 • Published Mar 31, 2020 • 2
Papers - Fine-tuning - Factuality Collection by matlok Mar 29, 2024 - Fine-tuning Language Models for Factuality Paper • 2311.08401 • Published Nov 14, 2023 • 30
Papers - KL Regularization - ADP - Con/Divergence Error Rate Collection by matlok Mar 29, 2024 - Leverage the Average: an Analysis of KL Regularization in RL Paper • 2003.14089 • Published Mar 31, 2020 • 2
Leverage the Average: an Analysis of KL Regularization in RL Paper • 2003.14089 • Published Mar 31, 2020 • 2
triditionalchineseLLM Collection by maxbrucelen Mar 31, 2024 - bigscience/bloom Text Generation • 176B • Updated Jul 29 • 16.9k • 5.04k facebook/xglm-4.5B Text Generation • 5B • Updated Sep 7, 2023 • 475 • 21 facebook/xglm-7.5B Text Generation • Updated Jan 24, 2023 • 611 • 60 uer/gpt2-chinese-ancient Text Generation • Updated Oct 17, 2023 • 83 • 18
Papers - University of Chicago Collection by matlok Apr 15, 2024 - Transforming and Combining Rewards for Aligning Large Language Models Paper • 2402.00742 • Published Feb 1, 2024 • 12 Using Explainable AI and Transfer Learning to understand and predict the maintenance of Atlantic blocking with limited observational data Paper • 2404.08613 • Published Apr 12, 2024 • 1
Transforming and Combining Rewards for Aligning Large Language Models Paper • 2402.00742 • Published Feb 1, 2024 • 12
Using Explainable AI and Transfer Learning to understand and predict the maintenance of Atlantic blocking with limited observational data Paper • 2404.08613 • Published Apr 12, 2024 • 1
Papers - Fine-tuning - Emulator Collection by matlok Mar 29, 2024 - An Emulator for Fine-Tuning Large Language Models using Small Language Models Paper • 2310.12962 • Published Oct 19, 2023 • 13
An Emulator for Fine-Tuning Large Language Models using Small Language Models Paper • 2310.12962 • Published Oct 19, 2023 • 13
Papers - Fine-tuning - Factuality Collection by matlok Mar 29, 2024 - Fine-tuning Language Models for Factuality Paper • 2311.08401 • Published Nov 14, 2023 • 30
Azerbaijan Collection by bahramhasanov Mar 29, 2024 - interneuronai/az-sentence-similarity Updated Mar 28, 2024 • 5
Models - Fine-tuning - PPO Collection by matlok Mar 29, 2024 - reciprocate/ppo_hh_pythia-6B Text Generation • Updated Jan 20, 2023 • 24 • 6
Papers - KL Regularization - ADP - Con/Divergence Error Rate Collection by matlok Mar 29, 2024 - Leverage the Average: an Analysis of KL Regularization in RL Paper • 2003.14089 • Published Mar 31, 2020 • 2
Leverage the Average: an Analysis of KL Regularization in RL Paper • 2003.14089 • Published Mar 31, 2020 • 2
Papers - Reward Models - KL Regularization - RL Collection by matlok Apr 16, 2024 - Leverage the Average: an Analysis of KL Regularization in RL Paper • 2003.14089 • Published Mar 31, 2020 • 2 Learn Your Reference Model for Real Good Alignment Paper • 2404.09656 • Published Apr 15, 2024 • 91
Leverage the Average: an Analysis of KL Regularization in RL Paper • 2003.14089 • Published Mar 31, 2020 • 2
triditionalchineseLLM Collection by maxbrucelen Mar 31, 2024 - bigscience/bloom Text Generation • 176B • Updated Jul 29 • 16.9k • 5.04k facebook/xglm-4.5B Text Generation • 5B • Updated Sep 7, 2023 • 475 • 21 facebook/xglm-7.5B Text Generation • Updated Jan 24, 2023 • 611 • 60 uer/gpt2-chinese-ancient Text Generation • Updated Oct 17, 2023 • 83 • 18
Papers - University of Chicago Collection by matlok Apr 15, 2024 - Transforming and Combining Rewards for Aligning Large Language Models Paper • 2402.00742 • Published Feb 1, 2024 • 12 Using Explainable AI and Transfer Learning to understand and predict the maintenance of Atlantic blocking with limited observational data Paper • 2404.08613 • Published Apr 12, 2024 • 1
Transforming and Combining Rewards for Aligning Large Language Models Paper • 2402.00742 • Published Feb 1, 2024 • 12
Using Explainable AI and Transfer Learning to understand and predict the maintenance of Atlantic blocking with limited observational data Paper • 2404.08613 • Published Apr 12, 2024 • 1