RL-Forgetting-Experiments-3/qwen2.5-3b-kk-sft-ordered-lr1e5-step3175 Text Generation • 3B • Updated 1 day ago • 190
RL-Forgetting-Experiments-3/qwen2.5-3b-kk-sft-ordered-lr1e5-step3175 Text Generation • 3B • Updated 1 day ago • 190
RL-Forgetting-Experiments-3/qwen2.5-3b-kk-sft-shuffled-lr1e5-step3175 Text Generation • 3B • Updated 1 day ago • 187
RL-Forgetting-Experiments-3/qwen2.5-3b-kk-sft-shuffled-lr1e5-step3175 Text Generation • 3B • Updated 1 day ago • 187
RL-Forgetting-Experiments-3/qwen2.5-3b-math-sft-shuffled-lr1e5-step1072 Text Generation • 3B • Updated 1 day ago • 190
RL-Forgetting-Experiments-3/qwen2.5-3b-math-sft-ordered-lr1e5-step1072 Text Generation • 3B • Updated 1 day ago • 189
RL-Forgetting-Experiments-3/qwen2.5-3b-math-sft-shuffled-lr1e5-step1072 Text Generation • 3B • Updated 1 day ago • 190
RL-Forgetting-Experiments-3/qwen2.5-3b-math-sft-ordered-lr1e5-step1072 Text Generation • 3B • Updated 1 day ago • 189
The PokeAgent Challenge: Competitive and Long-Context Learning at Scale Paper • 2603.15563 • Published Mar 16 • 12
PATIENT-Ψ: Using Large Language Models to Simulate Patients for Training Mental Health Professionals Paper • 2405.19660 • Published May 30, 2024 • 1