PhoenixHu/grpo_stable_reasoning_nolow_0722_075_1200steps_temp12 Reinforcement Learning • Updated 24 days ago
PhoenixHu/grpo_stable_reasoning_nolow_0719_8rollout_075_0720 Reinforcement Learning • Updated 26 days ago
PhoenixHu/grpo_internvl2_5_how2sign_1b_bleu1_bleu4_checkpoint31656_newalldata_lora16_0517 Updated May 26
PhoenixHu/grpo_internvl2_5_how2sign_1b_bleu1_bleu4_checkpoint31656_newalldata_lora16_moredata_0523 Updated May 24
PhoenixHu/grpo_internvl2_5_how2sign_1b_bleu1_bleu4_checkpoint31656_newalldata_lora16_12kdata_0523 Updated May 24
PhoenixHu/grpo_internvl2_5_how2sign_1b_bleu1_bleu4_64_checkpoint31656_newalldata_lora16_alldata_0518 Updated May 20
PhoenixHu/grpo_internvl2_5_how2sign_1b_bleu1_bleu4_64_checkpoint31656_newalldata_lora16_filtered_0518 1.0B • Updated May 19 • 2
PhoenixHu/grpo_internvl2_5_how2sign_1b_bleu1_bleu4_checkpoint31656_newalldata_lora16_lr2e6_0517 Updated May 18