UnfaithRL/Qwen2.5-0.5B-hint_following_reward_faithful_prompt-1024 Reinforcement Learning • 0.5B • Updated 27 days ago • 40
UnfaithRL/Qwen2.5-0.5B-hint_following_reward_faithful_prompt-2048 Reinforcement Learning • 0.5B • Updated 27 days ago • 37