Inference Providers
Active filters: trl
Reinforcement Learning
• Updated Reinforcement Learning
• Updated zou00080/llama_PPO_pos_formal
Reinforcement Learning
• Updated • 1
zou00080/llama_PPO_pos_informal
Reinforcement Learning
• Updated • 1
zou00080/llama_PPO_neg_formal
Reinforcement Learning
• Updated • 2
zou00080/llama_PPO_neg_informal
Reinforcement Learning
• Updated • 2
Reinforcement Learning
• Updated mariosirt/EleutherAI-gpt-neo-125m-detoxified
Reinforcement Learning
• Updated • 23
mariosirt/EleutherAI-gpt-neo-125m-detoxified-perspective
Reinforcement Learning
• Updated • 13
mariosirt/gpt2-detoxified
Reinforcement Learning
• Updated • 2
Text Generation
• Updated • 4
renyulin/gptneo125m-detoxify-ppo-0.05
Reinforcement Learning
• Updated • 3
renyulin/llama-7b-es-ppo-adpater
Reinforcement Learning
• Updated renyulin/gpt-neo-1.3b-es-rlhf-step2500-peft
Reinforcement Learning
• Updated Reinforcement Learning
• Updated nlp-lab-2023-seq2seq/R-best-fine-tuned-bart-base-full-ft-reward_short_sentences_and_words-2023-07-13T06-49-08
Reinforcement Learning
• Updated • 2
• 1
amirali1985/pythia_70m_ppo_imdb_sentiment
Reinforcement Learning
• Updated • 5
amirali1985/pythia_70m_ppo_imdb_sentiment_v2
Reinforcement Learning
• Updated • 3
amirali1985/pythia_70m_ppo_imdb_sentiment_v3
Reinforcement Learning
• Updated • 3
amirali1985/pythia_70m_ppo_imdb_sentiment_with_checkpoints
Reinforcement Learning
• Updated • 2
vincentmin/llama-2-13b-reward-oasst1
Text Classification
• Updated • 5
vincentmin/llama-2-7b-reward-oasst1
Updated • 10
• 1
Text Generation
• Updated • 49
• Hermi2023/doc2query-ppo-msmarco-43520-121
Reinforcement Learning
• Updated • 18
Text Generation
• Updated • 98
• • 15
barnybug/stack-llama-2-ggml
renyulin/gptneo125m-detoxify-ppo
Reinforcement Learning
• Updated • 5
vwxyzjn/starcoderbase-triviaqa
Text Generation
• 16B • Updated • 26
lvwerra/starcoderbase-gsm8k
Text Generation
• 16B • Updated • 18