Oriloq ASR français : Parakeet Core ML INT8

Modèle de transcription spécialisé pour la dictée française dans Oriloq, dérivé de NVIDIA Parakeet TDT 0.6B v3.

Version publiée le 8 octobre 2026 : qat-20261006-e11. Les adaptateurs LoRA du checkpoint de l’époque 11 ont été fusionnés dans le modèle de base. Le checkpoint a été sélectionné sur le WER de validation combiné à la fin d’un entraînement de 15 époques.

Entraînement et évaluation

Fine-tuning LoRA (rang 16, alpha 32), dropout LoRA 0,1, warmup 1 000 steps, profil QAT de poids coreml-int8-per-channel-v1. Le corpus de dictée française reste privé.

Mesure à l’époque 11 WER
Validation locale française, normalisée 3,02 %
FLEURS français, split développement 7,53 %
Validation combinée, critère de sélection 4,379 %

Ces métriques ont été mesurées pendant l’entraînement avec simulation QAT. Elles ne constituent pas un benchmark de bout en bout de cet export. Dans ce run, le modèle de base obtenait 5,40 % sur FLEURS français : la spécialisation pour la dictée Oriloq ne signifie donc pas une amélioration sur toutes les distributions de parole française. Les langues autres que le français n’ont pas été évaluées sur cette version.

Versions

Les clients Oriloq suivent la tête de la branche main. Le tag qat-20261006-e11 identifie cette publication. Le tag before-20261008 conserve l’état précédent du dépôt et permet un retour à cette révision.

Aucun audio, transcript, diagnostic contenant des exemples, checkpoint d’entraînement ou chemin local privé n’est publié.

Licence et attribution

Distribué sous CC BY 4.0, avec attribution à NVIDIA / l’équipe NeMo pour le modèle de base. Modifications par Oriloq : fine-tuning LoRA français, fusion des adaptateurs et export pour Apple Silicon. Conserver cette attribution, signaler les modifications et référencer la licence lors d’une redistribution.

Utilisation et format

Bundle runtime pour Oriloq sur Mac Apple Silicon. L’encodeur Conformer compilé Core ML utilise des poids INT8 symétriques par canal et un calcul FP16. La configuration demande CPU + Neural Engine ; le frontend MEL et le décodeur natif TDT (predictor LSTM et joint network FP32) restent sur CPU. Le backend est hybride.

Fonctions d’encodeur pour 501, 1 501 et 3 001 frames MEL. Audio d’entrée : mono, 16 kHz. L’export Core ML cible macOS 15 minimum ; la version d’Oriloq détermine les prérequis de l’application.

Fichiers : config.json, encoder.mlmodelc/, predictor_joint.safetensors et tokenizers/vocabulaires. oriloq_release.json décrit la version publique. Le package source .mlpackage reste hors du bundle distribué.

Ce format se charge avec le backend Parakeet Core ML d’Oriloq ; ce n’est pas un checkpoint générique Transformers ou NeMo.

Downloads last month
50
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for NeoRoth/oriloq-asr-fr-coreml

Finetuned
(108)
this model