Qwen3-0.6B-JSON-SFT-GRPO
์ SFT ๋ชจ๋ธ์ GRPO(RLVR) ์ถ๊ฐ ํ์ต (์๋๋ฆฌ์ค 1 ์ต์ข )
2026-07-19 sllm_practice ์ปค๋ฆฌํ๋ผ ๊ฐ์ ์คํ ์ฐ์ถ๋ฌผ (fa2e1ce์ experiments/results/REPORT.md ์ฐธ์กฐ). ํ๊ฐ ์งํ๋ json_eval.py (parse_rate / schema_compliance / semantics_pass_rate / field_f1_mean).
LoRA r16/alpha32, num_generations 4, beta 0.04, 600 ํ๋กฌํํธ, ๋ณํฉ๋ณธ. old_eval field_F1 54.4% (SFT 51.4% ๋๋น +3.0%p), eval_reward 1.48โ1.89. ํ์ต 62.9๋ถ(A40).
- Downloads last month
- 26