Instructions to use sarpba/whisper-base-hungarian_v4 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use sarpba/whisper-base-hungarian_v4 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("automatic-speech-recognition", model="sarpba/whisper-base-hungarian_v4")# Load model directly from transformers import AutoProcessor, AutoModelForSpeechSeq2Seq processor = AutoProcessor.from_pretrained("sarpba/whisper-base-hungarian_v4") model = AutoModelForSpeechSeq2Seq.from_pretrained("sarpba/whisper-base-hungarian_v4", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Whisper Base Hungarian v4
Magyar nyelvre finomhangolt openai/whisper-base modell, zaj-augmentált tréninggel, a v3-nál jelentősen nagyobb adatbázison.
A v4 a v3 (whisper-base-hungarian_v3) továbbfejlesztett változata: az adatbázis mérete ~3×-es (1617 óra vs 517 óra), a tréning a v1 hiperparamétereivel, 3 epochon át, 20%-os zaj-augmentációval zajlott. Minden készleten jobb, mint a v1 és a v3.
Eredmények
Tiszta anyag — FLEURS hu_hu test (normalizált WER)
| Modell | beam=1 | beam=2 | beam=3 | beam=4 | beam=5 |
|---|---|---|---|---|---|
| whisper-base-hungarian_v4 (ez) | 26.68 | 25.29 | 24.81 | 24.71 | 24.73 |
| whisper-hu-base-finetuned-V2 (régi) | 25.79 | 24.26 | 23.80 | 23.77 | 23.67 |
| whisper-base-hungarian_v3 | 29.81 | 29.07 | 28.84 | 28.57 | 29.28 |
| whisper-base-hungarian_v1 | 30.91 | 29.19 | 28.94 | 29.04 | 28.77 |
Common Voice 17.0 hu test (normalizált WER)
| Modell | beam=1 | beam=2 | beam=3 | beam=4 | beam=5 |
|---|---|---|---|---|---|
| whisper-hu-base-finetuned-V2 (régi)* | 14.73 | 14.03 | 13.90 | 13.85 | 13.81 |
| whisper-base-hungarian_v4 (ez) | 19.47 | 18.72 | 18.61 | 18.54 | 18.62 |
| whisper-base-hungarian_v3 | 21.80 | 21.23 | 21.11 | 21.06 | 21.09 |
| whisper-base-hungarian_v1 | 21.48 | 20.75 | 20.57 | 20.54 | 20.51 |
*A Common Voice 17.0 train+valid spliteket a régi V2 tréningje tartalmazta, ezért ott az eredményei nem teljesen függetlenek.
Zajos anyag (~10 dB MUSAN zaj, 905 minta, beam=1)
| Modell | WER |
|---|---|
| whisper-hu-base-finetuned-V2 (régi) | 41.6 |
| whisper-base-hungarian_v4 (ez) | 47.5 |
| whisper-base-hungarian_v3 | 51.0 |
| whisper-base-hungarian_v1 | 56.2 |
A v4 minden készleten jobb a v1-nél és a v3-nál. A régi V2 (2000 órás adat, CV17-tel bővítve, normalizált célok) továbbra is a legjobb — a v4 a második helyen áll minden mérésben.
Model description
Egyedi, gondosan válogatott magyar hanganyagon (custom dataset, ~1617 óra, több száz beszélő, változatos műfajú felolvasott szöveg — hangoskönyvek, filmek, közösségi gyűjtés) finomhangolt whisper-base modell. A tréning során on-the-fly zaj-augmentációt alkalmaztunk: a minták 20%-ához a MUSAN zajadatbázisból kevertünk véletlenszerű zajt (SNR 10–25 dB, a beszéd a zajsáv elejétől/végétől 0–3 s távolságra), így a modell megtanulta a zajos bemenetek kezelését is.
A képzési adatok egyike sem szerepelt a tesztkészletekben (FLEURS, Common Voice), a modell tesztanyaggal nem fertőzött.
Intended uses & limitations
Magyar nyelvű beszédfelismerésre készült. A modell a felolvasott, stúdióminőségű beszéd mellett zajos környezetben (háttérzaj, utcai zaj) is megbízhatóan működik. Élőbeszéd, telefonbeszélgetés vagy erős akusztikai torzítás esetén a teljesítmény elmaradhat a felolvasott anyagon mért értékektől.
A modell kereskedelmi felhasználása a hozzájárulás nélkül nem engedélyezett. Magáncélra a Whisper eredeti licencfeltételei szerint szabadon használható.
Training procedure
Adat
- Custom dataset: ~1617 óra magyar hanganyag (hangoskönyvek, filmek, változatos beszélők)
- Szegmensek: 1–30 s hosszúak, 16 kHz-re resample-elve
- Szűrés: üres átiratok, 30 s-nál hosszabb szegmensek, 448 token feletti átiratok kizárva; a párhuzamos forrásokból (txt/whisper átirat) csak a normalizáltan egyező szegmensek
- 740 384 tréningminta
Zaj-augmentáció
- Zajforrás: MUSAN noise (930 klipp, 16 kHz)
- A minták 20%-a kap zajt
- SNR: 10–25 dB
- A beszédet egy hosszabb zajsávba ágyazva: a beszéd eleje/vége 0–3 s-ra esik a zajsáv szélétől, a felesleges zaj levágva
- A kimenet sosem hosszabb 30 s-nál
Hyperparaméterek (a v1 beállításai)
| Paraméter | Érték |
|---|---|
| learning_rate | 3e-4 |
| train_batch_size | 16 / GPU |
| gradient_accumulation_steps | 8 |
| total_train_batch_size | 256 |
| eval_batch_size | 16 |
| optimizer | Adam (betas=(0.9, 0.999), eps=1e-08) |
| lr_scheduler_type | linear |
| lr_scheduler_warmup_ratio | 0.05 |
| num_train_epochs | 3 |
| mixed_precision | fp16 |
| seed | 42 |
| feature encoder (conv1/conv2) | freeze-elve |
Hardver
2 × NVIDIA RTX 3090 24 GB, fp16 (torchrun, DDP)
Framework versions
- Transformers 5.14.1
- PyTorch 2.6.0+cu124
- Datasets 3.6.0
Használat
from transformers import pipeline
pipe = pipeline(
"automatic-speech-recognition",
model="sarpba/whisper-base-hungarian_v4",
)
result = pipe("magyar_beszed.wav", generate_kwargs={"language": "hungarian", "task": "transcribe"})
print(result["text"])
- Downloads last month
- 18
Model tree for sarpba/whisper-base-hungarian_v4
Base model
openai/whisper-baseEvaluation results
- Wer on google/fleurstest set self-reported26.680