Whisper Base Hungarian v4

Magyar nyelvre finomhangolt openai/whisper-base modell, zaj-augmentált tréninggel, a v3-nál jelentősen nagyobb adatbázison.

A v4 a v3 (whisper-base-hungarian_v3) továbbfejlesztett változata: az adatbázis mérete ~3×-es (1617 óra vs 517 óra), a tréning a v1 hiperparamétereivel, 3 epochon át, 20%-os zaj-augmentációval zajlott. Minden készleten jobb, mint a v1 és a v3.

Eredmények

Tiszta anyag — FLEURS hu_hu test (normalizált WER)

Modell beam=1 beam=2 beam=3 beam=4 beam=5
whisper-base-hungarian_v4 (ez) 26.68 25.29 24.81 24.71 24.73
whisper-hu-base-finetuned-V2 (régi) 25.79 24.26 23.80 23.77 23.67
whisper-base-hungarian_v3 29.81 29.07 28.84 28.57 29.28
whisper-base-hungarian_v1 30.91 29.19 28.94 29.04 28.77

Common Voice 17.0 hu test (normalizált WER)

Modell beam=1 beam=2 beam=3 beam=4 beam=5
whisper-hu-base-finetuned-V2 (régi)* 14.73 14.03 13.90 13.85 13.81
whisper-base-hungarian_v4 (ez) 19.47 18.72 18.61 18.54 18.62
whisper-base-hungarian_v3 21.80 21.23 21.11 21.06 21.09
whisper-base-hungarian_v1 21.48 20.75 20.57 20.54 20.51

*A Common Voice 17.0 train+valid spliteket a régi V2 tréningje tartalmazta, ezért ott az eredményei nem teljesen függetlenek.

Zajos anyag (~10 dB MUSAN zaj, 905 minta, beam=1)

Modell WER
whisper-hu-base-finetuned-V2 (régi) 41.6
whisper-base-hungarian_v4 (ez) 47.5
whisper-base-hungarian_v3 51.0
whisper-base-hungarian_v1 56.2

A v4 minden készleten jobb a v1-nél és a v3-nál. A régi V2 (2000 órás adat, CV17-tel bővítve, normalizált célok) továbbra is a legjobb — a v4 a második helyen áll minden mérésben.

Model description

Egyedi, gondosan válogatott magyar hanganyagon (custom dataset, ~1617 óra, több száz beszélő, változatos műfajú felolvasott szöveg — hangoskönyvek, filmek, közösségi gyűjtés) finomhangolt whisper-base modell. A tréning során on-the-fly zaj-augmentációt alkalmaztunk: a minták 20%-ához a MUSAN zajadatbázisból kevertünk véletlenszerű zajt (SNR 10–25 dB, a beszéd a zajsáv elejétől/végétől 0–3 s távolságra), így a modell megtanulta a zajos bemenetek kezelését is.

A képzési adatok egyike sem szerepelt a tesztkészletekben (FLEURS, Common Voice), a modell tesztanyaggal nem fertőzött.

Intended uses & limitations

Magyar nyelvű beszédfelismerésre készült. A modell a felolvasott, stúdióminőségű beszéd mellett zajos környezetben (háttérzaj, utcai zaj) is megbízhatóan működik. Élőbeszéd, telefonbeszélgetés vagy erős akusztikai torzítás esetén a teljesítmény elmaradhat a felolvasott anyagon mért értékektől.

A modell kereskedelmi felhasználása a hozzájárulás nélkül nem engedélyezett. Magáncélra a Whisper eredeti licencfeltételei szerint szabadon használható.

Training procedure

Adat

  • Custom dataset: ~1617 óra magyar hanganyag (hangoskönyvek, filmek, változatos beszélők)
  • Szegmensek: 1–30 s hosszúak, 16 kHz-re resample-elve
  • Szűrés: üres átiratok, 30 s-nál hosszabb szegmensek, 448 token feletti átiratok kizárva; a párhuzamos forrásokból (txt/whisper átirat) csak a normalizáltan egyező szegmensek
  • 740 384 tréningminta

Zaj-augmentáció

  • Zajforrás: MUSAN noise (930 klipp, 16 kHz)
  • A minták 20%-a kap zajt
  • SNR: 10–25 dB
  • A beszédet egy hosszabb zajsávba ágyazva: a beszéd eleje/vége 0–3 s-ra esik a zajsáv szélétől, a felesleges zaj levágva
  • A kimenet sosem hosszabb 30 s-nál

Hyperparaméterek (a v1 beállításai)

Paraméter Érték
learning_rate 3e-4
train_batch_size 16 / GPU
gradient_accumulation_steps 8
total_train_batch_size 256
eval_batch_size 16
optimizer Adam (betas=(0.9, 0.999), eps=1e-08)
lr_scheduler_type linear
lr_scheduler_warmup_ratio 0.05
num_train_epochs 3
mixed_precision fp16
seed 42
feature encoder (conv1/conv2) freeze-elve

Hardver

2 × NVIDIA RTX 3090 24 GB, fp16 (torchrun, DDP)

Framework versions

  • Transformers 5.14.1
  • PyTorch 2.6.0+cu124
  • Datasets 3.6.0

Használat

from transformers import pipeline

pipe = pipeline(
    "automatic-speech-recognition",
    model="sarpba/whisper-base-hungarian_v4",
)
result = pipe("magyar_beszed.wav", generate_kwargs={"language": "hungarian", "task": "transcribe"})
print(result["text"])
Downloads last month
18
Safetensors
Model size
72.6M params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for sarpba/whisper-base-hungarian_v4

Finetuned
(749)
this model

Evaluation results