DeryFerd/Qwen2.5-Coder-7B-Instruct-Distill-Phi2-974mbpp Text Generation • 3B • Updated Sep 29, 2025 • 29 • 2
Kishan25/neuron-kd-qwen2.5-coder-0.5b-critique-mlx-4bit Text Generation • 0.5B • Updated Aug 30 • 115
RL-Forgetting-Experiments-3/qwen2.5-3b-code-sft-ordered-lr1e5-step102 Text Generation • 3B • Updated 12 days ago • 157
RL-Forgetting-Experiments-3/llama-3.2-3b-instruct-code-sft-replay-ce-lam1-step65 Text Generation • 3B • Updated 12 days ago • 158
RL-Forgetting-Experiments-3/qwen3-1.7b-base-code-sft-replay-hard-lam1-step102 Text Generation • 2B • Updated 12 days ago • 169
RL-Forgetting-Experiments-3/qwen2.5-3b-code-sft-replay-uniform-lam1-step102 Text Generation • 3B • Updated 12 days ago • 156
RL-Forgetting-Experiments-3/qwen2.5-3b-code-sft-shuffled-lr1e5-step102 Text Generation • 3B • Updated 12 days ago • 169
RL-Forgetting-Experiments-3/qwen3-1.7b-base-code-sft-replay-uniform-lam1-step102 Text Generation • 2B • Updated 12 days ago • 170
RL-Forgetting-Experiments-3/llama-3.2-3b-instruct-code-sft-replay-uniform-lam1-step65 Text Generation • 3B • Updated 12 days ago • 174
RL-Forgetting-Experiments-3/qwen3-1.7b-base-code-sft-replay-ce-lam1-step102 Text Generation • 2B • Updated 12 days ago • 162
RL-Forgetting-Experiments-3/qwen2.5-3b-code-sft-replay-ce-lam1-step102 Text Generation • 3B • Updated 12 days ago • 166
RL-Forgetting-Experiments-3/qwen2.5-3b-code-sft-replay-hard-lam1-step102 Text Generation • 3B • Updated 12 days ago • 177
RL-Forgetting-Experiments-3/llama-3.2-3b-instruct-code-sft-replay-hard-lam1-step65 Text Generation • 3B • Updated 12 days ago • 186
RL-Forgetting-Experiments-3/qwen3-1.7b-base-code-sft-shuffled-lr1e5-step102 Text Generation • 2B • Updated 11 days ago • 748
RL-Forgetting-Experiments-3/qwen3-1.7b-base-code-sft-ordered-lr1e5-step102 Text Generation • 2B • Updated 11 days ago • 740
RL-Forgetting-Experiments-3/code-llama3p2_3b-replay-lam0p1 Reinforcement Learning • Updated 1 day ago