UnfaithRL/Qwen2.5-0.5B-shuffled_dataset-2048 Reinforcement Learning • 0.5B • Updated about 1 month ago • 5
UnfaithRL/Qwen2.5-0.5B-shuffled_dataset-1024 Reinforcement Learning • 0.5B • Updated about 1 month ago • 8
UnfaithRL/Qwen2.5-0.5B-shuffled_dataset-512 Reinforcement Learning • 0.5B • Updated about 1 month ago • 5
UnfaithRL/OLMo-2-0425-1B-shuffled_dataset-2048 Reinforcement Learning • 1B • Updated about 1 month ago • 6
UnfaithRL/OLMo-2-0425-1B-shuffled_dataset-1024 Reinforcement Learning • 1B • Updated about 1 month ago • 6
UnfaithRL/OLMo-2-0425-1B-shuffled_dataset-512 Reinforcement Learning • 1B • Updated about 1 month ago • 7
UnfaithRL/Qwen2.5-0.5B-curriculum_learning-2048 Reinforcement Learning • 0.5B • Updated about 1 month ago • 6
UnfaithRL/Qwen2.5-0.5B-curriculum_learning-1024 Reinforcement Learning • 0.5B • Updated about 1 month ago • 5
UnfaithRL/Qwen2.5-0.5B-curriculum_learning-512 Reinforcement Learning • 0.5B • Updated about 1 month ago • 7
UnfaithRL/OLMo-2-0425-1B-curriculum_learning-2048 Reinforcement Learning • 1B • Updated about 1 month ago • 14
UnfaithRL/OLMo-2-0425-1B-curriculum_learning-1024 Reinforcement Learning • 1B • Updated about 1 month ago • 14
UnfaithRL/OLMo-2-0425-1B-curriculum_learning-512 Reinforcement Learning • 1B • Updated about 1 month ago • 8
UnfaithRL/Qwen2.5-0.5B-Instruct-code_problems_hint_following-2048 Reinforcement Learning • 0.5B • Updated about 1 month ago • 6
UnfaithRL/Qwen2.5-0.5B-Instruct-code_problems_hint_following-1024 Reinforcement Learning • 0.5B • Updated about 1 month ago • 7
UnfaithRL/OLMo-2-0425-1B-Instruct-code_problems_hint_following-2048 Reinforcement Learning • 1B • Updated about 1 month ago • 10
UnfaithRL/OLMo-2-0425-1B-Instruct-code_problems_hint_following-1024 Reinforcement Learning • 1B • Updated about 1 month ago • 11
UnfaithRL/Qwen2.5-0.5B-code_problems_hint_following-2048 Reinforcement Learning • 0.5B • Updated about 1 month ago • 7
UnfaithRL/Qwen2.5-0.5B-code_problems_hint_following-1024 Reinforcement Learning • 0.5B • Updated about 1 month ago • 5
UnfaithRL/OLMo-2-0425-1B-code_problems_hint_following-2048 Reinforcement Learning • 1B • Updated about 1 month ago • 8
UnfaithRL/OLMo-2-0425-1B-code_problems_hint_following-1024 Reinforcement Learning • 1B • Updated about 1 month ago • 10
UnfaithRL/Qwen2.5-0.5B-Instruct-mmlu_trained_ha-2048 Reinforcement Learning • 0.5B • Updated about 1 month ago • 6
UnfaithRL/Qwen2.5-0.5B-Instruct-mmlu_trained_ha-1024 Reinforcement Learning • 0.5B • Updated about 1 month ago • 5
UnfaithRL/Qwen2.5-0.5B-Instruct-mmlu_trained_ha-512 Reinforcement Learning • 0.5B • Updated about 1 month ago • 4
UnfaithRL/OLMo-2-0425-1B-Instruct-mmlu_trained_ha-2048 Reinforcement Learning • 1B • Updated about 1 month ago • 9
UnfaithRL/OLMo-2-0425-1B-Instruct-mmlu_trained_ha-1024 Reinforcement Learning • 1B • Updated about 1 month ago • 9
UnfaithRL/OLMo-2-0425-1B-Instruct-mmlu_trained_ha-512 Reinforcement Learning • 1B • Updated about 1 month ago • 7
UnfaithRL/Qwen2.5-0.5B-hint_following_reward-2048 Reinforcement Learning • 0.5B • Updated about 1 month ago • 4
UnfaithRL/Qwen2.5-0.5B-hint_following_reward-1024 Reinforcement Learning • 0.5B • Updated about 1 month ago • 6
UnfaithRL/Qwen2.5-0.5B-hint_following_reward-512 Reinforcement Learning • 0.5B • Updated about 1 month ago • 7
UnfaithRL/OLMo-2-0425-1B-hint_following_reward-2048 Reinforcement Learning • 1B • Updated about 1 month ago • 8