Akan ASR Model (Wav2Vec2 - Augmented)

Fine-tuned Wav2Vec2 model for Akan Automatic Speech Recognition (ASR).

Live demo: abiawilliamsa/akan-asr-demo

Performance

  • Word Error Rate (WER): 0.2387 (23.87%)
  • Character Error Rate (CER): 0.0732 (7.32%)
  • Training Steps: 3,000

Usage

import torch
import librosa
from transformers import AutoModelForCTC, AutoProcessor

model_id = "abiawilliamsa/Akan-ASR-AAW-0.2387"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForCTC.from_pretrained(model_id)

# Load audio (16kHz)
audio, sr = librosa.load("sample_akan.wav", sr=16000)
inputs = processor(audio, sampling_rate=16000, return_tensors="pt")

with torch.no_grad():
    logits = model(**inputs).logits

predicted_ids = torch.argmax(logits, dim=-1)
transcription = processor.batch_decode(predicted_ids)[0]
print("Transcription:", transcription)
Downloads last month
-
Safetensors
Model size
0.3B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Evaluation results