daruokta/t5gemma-2-1b-multimodal-embedding-indo-v6 Sentence Similarity • 1B • Updated 18 days ago • 915
daruokta/t5gemma-2-1b-multimodal-embedding-indo-v6 Sentence Similarity • 1B • Updated 18 days ago • 915
daruokta/t5gemma-2-4b-4b-instruct-chat-indo-v4-vision-enhanced Image-Text-to-Text • Updated 22 days ago
daruokta/t5gemma-2-4b-4b-instruct-chat-indo-v4-vision-enhanced Image-Text-to-Text • Updated 22 days ago
view article Article A Guide to Reinforcement Learning Post-Training for LLMs: PPO, DPO, GRPO, and Beyond karina-zadorozhny • Jan 19 • 40