Inference Providers
Active filters: trl
amirali1985/pythia-160m_utility_reward
Reinforcement Learning
• Updated • 15
amirali1985/pythia-410m_utility_reward
Reinforcement Learning
• Updated • 2
amirali1985/gpt-neo-125m_sentiment_reward
Reinforcement Learning
• Updated • 2
amirali1985/gpt-neo-125m_utility_reward
Reinforcement Learning
• Updated • 4
amirali1985/gpt-j-6b-sharded-bf16_sentiment_reward
Reinforcement Learning
• Updated thanhduc1180/llama2chatbot
Text Generation
• 7B • Updated • 5
EddyGiusepe/zephyr-support-chatbot
Reinforcement Learning
• Updated ARahul2003/lamini_flan_t5_detoxify_rlaif
Text Generation
• 0.2B • Updated • 5
• 2
alignment-handbook/zephyr-7b-sft-full
Text Generation
• 7B • Updated • 7.32k
• • 27
alignment-handbook/zephyr-7b-sft-qlora
Updated • 29
• 9
lewtun/zephyr-7b-dpo-full
Text Generation
• 7B • Updated • 12
alignment-handbook/zephyr-7b-dpo-full
Text Generation
• 7B • Updated • 19
• 3
alignment-handbook/zephyr-7b-dpo-qlora
Updated • 24
• 9
neerajsp23/mistral-finetuned-samsum
llm-wizard/llama2_instruct_generation
worde-byte/finetunemistral
stuser2023/Llama2-7b-finetuned
Text Generation
• 7B • Updated • 5
• 1
Lichang-Chen/zephyr-7b-sft-full
Text Generation
• 7B • Updated • 13
Reinforcement Learning
• 60.5M • Updated • 7
• 1
Reinforcement Learning
• 60.5M • Updated • 1
hllj/sft-mistral-v1-clean-valid
ritendub/mistral7britendu
Updated
Lalith16/Zephyr-7B-Beta-FT-5Epoch-smalldataset
Updated
greatakela/mistral_instruct_classifyFPB
heedong21/typo_recommendation
vj1148/codellama2-finetuned-codex
Updated
Kedar84/mistral-finetuned-samsum