facebook/voxpopuli
Viewer • Updated • 1.26M • 23.9k • 157
How to use gabrielesilinic/whisper-tiny-it-v1 with Transformers:
# Use a pipeline as a high-level helper
from transformers import pipeline
pipe = pipeline("automatic-speech-recognition", model="gabrielesilinic/whisper-tiny-it-v1") # Load model directly
from transformers import AutoProcessor, AutoModelForSpeechSeq2Seq
processor = AutoProcessor.from_pretrained("gabrielesilinic/whisper-tiny-it-v1")
model = AutoModelForSpeechSeq2Seq.from_pretrained("gabrielesilinic/whisper-tiny-it-v1", device_map="auto")A fine-tuned version of openai/whisper-tiny for Italian automatic speech recognition.
| Dataset | Samples | Domain |
|---|---|---|
| Common Voice 24 Italian | ~173,000 | Crowd-sourced read speech |
| VoxPopuli Italian | ~22,000 | European Parliament sessions |
| Total | ~195,000 |
| Metric | Value |
|---|---|
| WER (Common Voice 24 Italian test) | 26.24% |
| Eval loss | 0.3919 |
| Model | WER (CV Italian) |
|---|---|
| openai/whisper-tiny (base, zero-shot) | ~60%+ |
| mattiasu96/whisper-tiny-it | 26.5% |
| This model (v1) | 26.24% |
from transformers import WhisperProcessor, WhisperForConditionalGeneration
import torchaudio
processor = WhisperProcessor.from_pretrained("gabrielesilinic/whisper-tiny-it-v1")
model = WhisperForConditionalGeneration.from_pretrained("gabrielesilinic/whisper-tiny-it-v1")
# Load audio (16kHz mono)
audio, sr = torchaudio.load("audio.wav")
if sr != 16000:
audio = torchaudio.functional.resample(audio, sr, 16000)
input_features = processor(audio.squeeze().numpy(), sampling_rate=16000, return_tensors="pt").input_features
predicted_ids = model.generate(input_features)
transcription = processor.batch_decode(predicted_ids, skip_special_tokens=True)[0]
print(transcription)
This model can be converted to GGML format for use with whisper.cpp for fast CPU/GPU inference.
Apache 2.0 (same as the base openai/whisper-tiny model)