NotoriousH2's picture
Update Countdown RLVR 3072-token training artifacts
1a3685c verified
|
Raw
History Blame Contribute Delete
2.45 kB
metadata
license: apache-2.0
language:
  - ko
library_name: transformers
pipeline_tag: text-generation
base_model: Qwen/Qwen3-4B
datasets:
  - NotoriousH2/countdown-rlvr
tags:
  - qwen3
  - rlvr
  - reasoning
  - countdown

Qwen3-4B Countdown RLVR

이 λͺ¨λΈμ€ Countdown 문제의 λͺ…μ‹œμ μΈ μˆ˜μ‹ 검증 λ³΄μƒμœΌλ‘œ Qwen3-4Bλ₯Ό GRPO ν•™μŠ΅ν•œ 병합 λͺ¨λΈμž…λ‹ˆλ‹€. 숫자 4개λ₯Ό 각각 ν•œ 번 μ‚¬μš©ν•˜κ³ , μ‚¬μΉ™μ—°μ‚°μœΌλ‘œ λͺ©ν‘œκ°’을 λ§Œλ“œλŠ” μˆ˜μ‹μ„ μƒμ„±ν•©λ‹ˆλ‹€. ν•™μŠ΅ λ°μ΄ν„°λŠ” NotoriousH2/countdown-rlvr revision 257a0edd9e5ec3fed345c80d21d9c73d09995ecbλ₯Ό μ‚¬μš©ν–ˆμŠ΅λ‹ˆλ‹€. ν•™μŠ΅μ€ 1~480 step μ „μ²΄μ—μ„œ μ΅œλŒ€ completion 길이 3,072토큰을 μ‚¬μš©ν–ˆμŠ΅λ‹ˆλ‹€. step 120의 ν•™μŠ΅ μƒνƒœλ₯Ό 볡원해 μ΄μ–΄μ„œ μ§„ν–‰ν–ˆμŠ΅λ‹ˆλ‹€.

1. μ‚¬μš©

from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "NotoriousH2/Qwen3-4B-Countdown-RLVR"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, device_map="auto")

LoRA 파일과 ν† ν¬λ‚˜μ΄μ €λŠ” adapter/에 μžˆμŠ΅λ‹ˆλ‹€. ν•™μŠ΅ 섀정은 training_config.json, 전체 ν•™μŠ΅ 기둝은 history.jsonμ—μ„œ 확인할 수 μžˆμŠ΅λ‹ˆλ‹€. ꡬ간별 completion 길이와 체크포인트 재개 지점은 training_provenance.json에 μžˆμŠ΅λ‹ˆλ‹€.

검증 λΆ„ν• μ˜ 후보별 μ§€ν‘œμ™€ 곡개 체크포인트 선택 κ²°κ³ΌλŠ” checkpoint_selection.json에 μžˆμŠ΅λ‹ˆλ‹€. 곡개 병합 λͺ¨λΈμ€ checkpoint-360을 μ‚¬μš©ν•©λ‹ˆλ‹€. 검증 ν‰κ°€λŠ” μ„œλ²„ μ‹œλ“œ 42와 VLLM_BATCH_INVARIANT=1을 μ‚¬μš©ν•©λ‹ˆλ‹€. test ν‰κ°€λŠ” μ„œλ²„ μ‹œλ“œ 42와 VLLM_BATCH_INVARIANT=1을 μ‚¬μš©ν•©λ‹ˆλ‹€.

2. 평가

Base와 RLVR λͺ¨λΈμ„ 같은 test λΆ„ν• κ³Ό 생성 μ„€μ •μœΌλ‘œ ν‰κ°€ν–ˆμŠ΅λ‹ˆλ‹€.

λͺ¨λΈ pass@1 pass@8 유효 μˆ˜μ‹ λΉ„μœ¨ 평균 응닡 토큰
Base 15.2% 52.7% 14.1% 1775.1
RLVR 57.4% 88.7% 56.8% 1737.6

λ¬Έμ œλ³„ 응닡과 μ μˆ˜λŠ” evaluation.json에 μžˆμŠ΅λ‹ˆλ‹€.

3. μ œν•œ

평가 λ²”μœ„λŠ” 숫자 4κ°œμ™€ μ‚¬μΉ™μ—°μ‚°μœΌλ‘œ μ œν•œλ©λ‹ˆλ‹€. 자유 ν˜•μ‹ 증λͺ…μ΄λ‚˜ μˆ˜ν•™μ  μΆ”λ‘  μ „λ°˜μ˜ μ„±λŠ₯을 λ‚˜νƒ€λ‚΄μ§€ μ•ŠμŠ΅λ‹ˆλ‹€.

4. μ‹€μ œ 좜λ ₯ 사둀

ν•™μŠ΅ μ „ν›„μ˜ μ‹€μ œ 응닡을 μ„ λ³„ν•œ μ‚¬λ‘€λŠ” learning_examples.json에 μžˆμŠ΅λ‹ˆλ‹€. Reasoning 응닡은 λͺ¨λΈμ΄ μƒμ„±ν•œ think와 answer νƒœκ·Έλ₯Ό ν¬ν•¨ν•œ 원문을 λ³΄μ‘΄ν•©λ‹ˆλ‹€.