kethankrk/IndicVoices-sample-1000
Viewer • Updated • 21k • 43
How to use abhinav-spidey/Whisper-ml-v1 with Transformers:
# Use a pipeline as a high-level helper
from transformers import pipeline
pipe = pipeline("automatic-speech-recognition", model="abhinav-spidey/Whisper-ml-v1") # Load model directly
from transformers import AutoProcessor, AutoModelForSpeechSeq2Seq
processor = AutoProcessor.from_pretrained("abhinav-spidey/Whisper-ml-v1")
model = AutoModelForSpeechSeq2Seq.from_pretrained("abhinav-spidey/Whisper-ml-v1", device_map="auto")Fine-tuned openai/whisper-small for Malayalam speech recognition on IndicVoices.
| Setting | Value |
|---|---|
| Base model | openai/whisper-small |
| Dataset | kethankrk/IndicVoices-sample-1000 |
| Language / task | Malayalam / transcribe |
| Learning rate | 1e-5 |
| Batch size | 8 |
| Final validation WER | ~67.4% |
Audio filtered to 1–30s; target transcripts capped at Whisper’s 448-token limit.
from transformers import pipeline
pipe = pipeline(
"automatic-speech-recognition",
model="abhinav-spidey/Whisper-ml-v1",
chunk_length_s=30,
)
print(pipe("path/to/audio.wav")["text"])
Or load the model and processor directly:
from transformers import WhisperForConditionalGeneration, WhisperProcessor
import torch
model_id = "abhinav-spidey/Whisper-ml-v1"
processor = WhisperProcessor.from_pretrained(model_id)
model = WhisperForConditionalGeneration.from_pretrained(model_id)
# inputs = processor(audio_array, sampling_rate=16000, return_tensors="pt")
# predicted_ids = model.generate(inputs.input_features)
# transcription = processor.batch_decode(predicted_ids, skip_special_tokens=True)[0]
Malayalam ASR for short clips (up to ~30s). Performance depends on accent, noise, and domain match to IndicVoices.
Base model
openai/whisper-small