Whisper Small — Malayalam (fine-tuned)

Fine-tuned openai/whisper-small for Malayalam speech recognition on IndicVoices.

Training

Setting Value
Base model openai/whisper-small
Dataset kethankrk/IndicVoices-sample-1000
Language / task Malayalam / transcribe
Learning rate 1e-5
Batch size 8
Final validation WER ~67.4%

Audio filtered to 1–30s; target transcripts capped at Whisper’s 448-token limit.

Usage

from transformers import pipeline

pipe = pipeline(
    "automatic-speech-recognition",
    model="abhinav-spidey/Whisper-ml-v1",
    chunk_length_s=30,
)
print(pipe("path/to/audio.wav")["text"])

Or load the model and processor directly:

from transformers import WhisperForConditionalGeneration, WhisperProcessor
import torch

model_id = "abhinav-spidey/Whisper-ml-v1"
processor = WhisperProcessor.from_pretrained(model_id)
model = WhisperForConditionalGeneration.from_pretrained(model_id)

# inputs = processor(audio_array, sampling_rate=16000, return_tensors="pt")
# predicted_ids = model.generate(inputs.input_features)
# transcription = processor.batch_decode(predicted_ids, skip_special_tokens=True)[0]

Intended use

Malayalam ASR for short clips (up to ~30s). Performance depends on accent, noise, and domain match to IndicVoices.

Downloads last month
34
Safetensors
Model size
0.2B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for abhinav-spidey/Whisper-ml-v1

Finetuned
(3680)
this model

Dataset used to train abhinav-spidey/Whisper-ml-v1