Akan ASR Model (Wav2Vec2 - Augmented)
Fine-tuned Wav2Vec2 model for Akan Automatic Speech Recognition (ASR).
Live demo: abiawilliamsa/akan-asr-demo
Performance
- Word Error Rate (WER):
0.2387(23.87%) - Character Error Rate (CER):
0.0732(7.32%) - Training Steps: 3,000
Usage
import torch
import librosa
from transformers import AutoModelForCTC, AutoProcessor
model_id = "abiawilliamsa/Akan-ASR-AAW-0.2387"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForCTC.from_pretrained(model_id)
# Load audio (16kHz)
audio, sr = librosa.load("sample_akan.wav", sr=16000)
inputs = processor(audio, sampling_rate=16000, return_tensors="pt")
with torch.no_grad():
logits = model(**inputs).logits
predicted_ids = torch.argmax(logits, dim=-1)
transcription = processor.batch_decode(predicted_ids)[0]
print("Transcription:", transcription)
- Downloads last month
- -
Evaluation results
- Test WERself-reported0.239
- Test CERself-reported0.073