ko-asr-compare / models_meta.py
xbuzz's picture
한국어 ASR 비교 데모 (ZeroGPU) 초기 업로드
36402be verified
Raw
History Blame Contribute Delete
2.49 kB
"""한국어 ASR 모델 메타데이터 (Open Ko-S2S 리더보드 실측치 연결).
낭독체(read) 수치: baryonlabs/open-ko-s2s-leaderboard 의 data/results.json
· Zeroth-Korean test (n=457), CER(space-free), RTX 4090 실측
자유발화(spont) 수치: 같은 하네스의 KsponSpeech 평가
in_domain=True 인 모델은 해당 벤치마크 학습셋을 본 모델이라 점수를 그대로 믿으면 안 됨.
"""
MODELS = [
{
"key": "base_komix",
"repo": "seastar105/whisper-base-komixv2",
"label": "whisper-base-komixv2",
"arch": "whisper",
"params": "73M",
"cer_read": 8.01,
"cer_spont": 7.71,
"rtf": 0.010,
"in_domain": False,
"note": "소형 모델 중 자유발화 최강. 낭독체 점수는 평범한데 자유발화에서 안 무너짐.",
},
{
"key": "small_komix",
"repo": "seastar105/whisper-small-komixv2",
"label": "whisper-small-komixv2",
"arch": "whisper",
"params": "242M",
"cer_read": 6.69,
"cer_spont": 7.44,
"rtf": 0.016,
"in_domain": False,
"note": "낭독체·자유발화 모두 균형. 이 데모에서 가장 '전 구간 안정적'인 모델.",
},
{
"key": "turbo",
"repo": "openai/whisper-large-v3-turbo",
"label": "whisper-large-v3-turbo",
"arch": "whisper",
"params": "809M",
"cer_read": 5.47,
"cer_spont": 12.53,
"rtf": 0.012,
"in_domain": False,
"note": "낭독체 CER은 가장 좋지만 자유발화에서 2배 이상 무너짐. 이 데모의 핵심 반례.",
},
{
"key": "w2v_ctc",
"repo": "kresnik/wav2vec2-large-xlsr-korean",
"label": "wav2vec2-large-xlsr-korean (CTC)",
"arch": "ctc",
"params": "317M",
"cer_read": 1.78,
"cer_spont": None,
"rtf": 0.002,
"in_domain": True,
"note": (
"Zeroth-Korean train으로 학습된 모델. 낭독체 CER 1.78%는 "
"모델 카드 자체 보고치이며 <b>같은 도메인 데이터를 학습에 쓴 in-domain 점수</b>라 "
"리더보드 순위에는 포함하지 않습니다. CTC라 압도적으로 빠르지만 "
"띄어쓰기·구두점이 없고 도메인 밖에서는 급격히 흔들립니다."
),
},
]
LEADERBOARD_URL = "https://huggingface.co/spaces/baryonlabs/open-ko-s2s-leaderboard"