q1716523669/mllm-cogrpo-heter-internvl35-2b-x-gemma3-4b-mmr1-groupB-gemma3-4b 769k • Updated 3 days ago • 13
q1716523669/mllm-cogrpo-heter-qwen25vl-3b-x-gemma3-4b-mmr1-groupB-gemma3-4b 769k • Updated 3 days ago • 47
q1716523669/mllm-cogrpo-heter-qwen25vl-3b-x-gemma3-4b-mmr1-groupA-qwen25vl-3b 756k • Updated 3 days ago • 14
q1716523669/mllm-cogrpo-heter-qwen25vl-3b-x-gemma3-4b-openr1-groupB-gemma3-4b 769k • Updated 3 days ago • 17
q1716523669/mllm-cogrpo-heter-qwen25vl-3b-x-gemma3-4b-openr1-groupA-qwen25vl-3b 756k • Updated 3 days ago • 15
q1716523669/mllm-cogrpo-heter-internvl35-2b-x-gemma3-4b-openr1-groupB-gemma3-4b 769k • Updated 3 days ago • 17
q1716523669/cogrpo-homo-llama31-8b-math345-groupB-llama31-8b-b-end Reinforcement Learning • 266k • Updated 6 days ago • 11
q1716523669/cogrpo-homo-llama31-8b-math345-groupB-llama31-8b-b-end Reinforcement Learning • 266k • Updated 6 days ago • 11
q1716523669/cogrpo-homo-llama31-8b-math345-groupB-llama31-8b-b-best Reinforcement Learning • 266k • Updated 6 days ago • 12
q1716523669/cogrpo-homo-llama31-8b-math345-groupB-llama31-8b-b-best Reinforcement Learning • 266k • Updated 6 days ago • 12
q1716523669/cogrpo-homo-llama31-8b-math345-groupA-llama31-8b-a-end Reinforcement Learning • 266k • Updated 6 days ago • 12
q1716523669/cogrpo-homo-llama31-8b-math345-groupA-llama31-8b-a-end Reinforcement Learning • 266k • Updated 6 days ago • 12
q1716523669/cogrpo-homo-llama31-8b-math345-groupA-llama31-8b-a-best Reinforcement Learning • 266k • Updated 6 days ago • 14
q1716523669/cogrpo-homo-llama31-8b-math345-groupA-llama31-8b-a-best Reinforcement Learning • 266k • Updated 6 days ago • 14