NotoriousH2's picture
Update Countdown RLVR 3072-token training artifacts
1a3685c verified
|
Raw
History Blame Contribute Delete
2.45 kB
---
license: apache-2.0
language:
- ko
library_name: transformers
pipeline_tag: text-generation
base_model: Qwen/Qwen3-4B
datasets:
- NotoriousH2/countdown-rlvr
tags:
- qwen3
- rlvr
- reasoning
- countdown
---
# Qwen3-4B Countdown RLVR
이 λͺ¨λΈμ€ Countdown 문제의 λͺ…μ‹œμ μΈ μˆ˜μ‹ 검증 λ³΄μƒμœΌλ‘œ Qwen3-4Bλ₯Ό GRPO ν•™μŠ΅ν•œ 병합 λͺ¨λΈμž…λ‹ˆλ‹€.
숫자 4개λ₯Ό 각각 ν•œ 번 μ‚¬μš©ν•˜κ³ , μ‚¬μΉ™μ—°μ‚°μœΌλ‘œ λͺ©ν‘œκ°’을 λ§Œλ“œλŠ” μˆ˜μ‹μ„ μƒμ„±ν•©λ‹ˆλ‹€.
ν•™μŠ΅ λ°μ΄ν„°λŠ” `NotoriousH2/countdown-rlvr` revision `257a0edd9e5ec3fed345c80d21d9c73d09995ecb`λ₯Ό μ‚¬μš©ν–ˆμŠ΅λ‹ˆλ‹€.
ν•™μŠ΅μ€ 1~480 step μ „μ²΄μ—μ„œ μ΅œλŒ€ completion 길이 3,072토큰을 μ‚¬μš©ν–ˆμŠ΅λ‹ˆλ‹€. step 120의 ν•™μŠ΅ μƒνƒœλ₯Ό 볡원해 μ΄μ–΄μ„œ μ§„ν–‰ν–ˆμŠ΅λ‹ˆλ‹€.
## 1. μ‚¬μš©
```python
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "NotoriousH2/Qwen3-4B-Countdown-RLVR"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, device_map="auto")
```
LoRA 파일과 ν† ν¬λ‚˜μ΄μ €λŠ” `adapter/`에 μžˆμŠ΅λ‹ˆλ‹€.
ν•™μŠ΅ 섀정은 `training_config.json`, 전체 ν•™μŠ΅ 기둝은 `history.json`μ—μ„œ 확인할 수 μžˆμŠ΅λ‹ˆλ‹€.
ꡬ간별 completion 길이와 체크포인트 재개 지점은 `training_provenance.json`에 μžˆμŠ΅λ‹ˆλ‹€.
검증 λΆ„ν• μ˜ 후보별 μ§€ν‘œμ™€ 곡개 체크포인트 선택 κ²°κ³ΌλŠ” `checkpoint_selection.json`에 μžˆμŠ΅λ‹ˆλ‹€.
곡개 병합 λͺ¨λΈμ€ `checkpoint-360`을 μ‚¬μš©ν•©λ‹ˆλ‹€.
검증 ν‰κ°€λŠ” μ„œλ²„ μ‹œλ“œ 42와 `VLLM_BATCH_INVARIANT=1`을 μ‚¬μš©ν•©λ‹ˆλ‹€.
test ν‰κ°€λŠ” μ„œλ²„ μ‹œλ“œ 42와 `VLLM_BATCH_INVARIANT=1`을 μ‚¬μš©ν•©λ‹ˆλ‹€.
## 2. 평가
Base와 RLVR λͺ¨λΈμ„ 같은 test λΆ„ν• κ³Ό 생성 μ„€μ •μœΌλ‘œ ν‰κ°€ν–ˆμŠ΅λ‹ˆλ‹€.
| λͺ¨λΈ | pass@1 | pass@8 | 유효 μˆ˜μ‹ λΉ„μœ¨ | 평균 응닡 토큰 |
|---|---:|---:|---:|---:|
| Base | 15.2% | 52.7% | 14.1% | 1775.1 |
| RLVR | 57.4% | 88.7% | 56.8% | 1737.6 |
λ¬Έμ œλ³„ 응닡과 μ μˆ˜λŠ” `evaluation.json`에 μžˆμŠ΅λ‹ˆλ‹€.
## 3. μ œν•œ
평가 λ²”μœ„λŠ” 숫자 4κ°œμ™€ μ‚¬μΉ™μ—°μ‚°μœΌλ‘œ μ œν•œλ©λ‹ˆλ‹€.
자유 ν˜•μ‹ 증λͺ…μ΄λ‚˜ μˆ˜ν•™μ  μΆ”λ‘  μ „λ°˜μ˜ μ„±λŠ₯을 λ‚˜νƒ€λ‚΄μ§€ μ•ŠμŠ΅λ‹ˆλ‹€.
## 4. μ‹€μ œ 좜λ ₯ 사둀
ν•™μŠ΅ μ „ν›„μ˜ μ‹€μ œ 응닡을 μ„ λ³„ν•œ μ‚¬λ‘€λŠ” [learning_examples.json](./learning_examples.json)에 μžˆμŠ΅λ‹ˆλ‹€. Reasoning 응닡은 λͺ¨λΈμ΄ μƒμ„±ν•œ `think`와 `answer` νƒœκ·Έλ₯Ό ν¬ν•¨ν•œ 원문을 λ³΄μ‘΄ν•©λ‹ˆλ‹€.