Ronaldo commited on
Commit
9b57633
·
1 Parent(s): 205a80e

first commit

Browse files
Files changed (1) hide show
  1. README.md +0 -205
README.md CHANGED
@@ -1,208 +1,3 @@
1
- <<<<<<< HEAD
2
- # 🎙️ Meta MMS Speech AI - Gradio Interface
3
-
4
- Une interface **Gradio** simple et élégante pour:
5
- - **ASR** (Automatic Speech Recognition): Convertir l'audio en texte (100+ langues)
6
- - **TTS** (Text-to-Speech): Convertir le texte en audio (8 langues)
7
-
8
- Utilise les modèles Meta MMS:
9
- - `facebook/mms-1b-all` pour l'ASR
10
- - `facebook/mms-tts-*` pour le TTS
11
-
12
- ## 🌐 Déploiement en ligne
13
-
14
- **Accès direct:** [Hugging Face Spaces](https://huggingface.co/spaces)
15
-
16
- ## 🚀 Installation locale
17
-
18
- ### Prérequis
19
- - Python 3.10+
20
- - (Optionnel) CUDA 11.8+ pour GPU
21
-
22
- ### Installation
23
-
24
- ```bash
25
- # Clone ou télécharge le repo
26
- git clone <url>
27
- cd mms-speech
28
-
29
- # Crée un environnement virtuel
30
- python -m venv venv
31
- source venv/bin/activate # Windows: venv\Scripts\activate
32
-
33
- # Installe les dépendances
34
- pip install -r requirements.txt
35
- ```
36
-
37
- ### Lancement
38
-
39
- ```bash
40
- python app.py
41
- ```
42
-
43
- L'interface Gradio s'ouvrira automatiquement sur `http://localhost:7860`
44
-
45
- ## 📱 Interface utilisateur
46
-
47
- ### Onglet 1: 🔊 ASR (Audio → Texte)
48
- - Enregistre ou upload un fichier audio
49
- - Choisis la langue
50
- - Clique "Transcrire"
51
- - Récupère le texte transcrit
52
-
53
- **Langues supportées:**
54
- - English, French, Spanish, German, Portuguese, Arabic, Hindi, Chinese, Japanese, et 90+ autres
55
-
56
- ### Onglet 2: 📢 TTS (Texte → Audio)
57
- - Entre du texte
58
- - Choisis la langue
59
- - Clique "Générer l'audio"
60
- - Écoute ou télécharge l'audio généré
61
-
62
- **Langues TTS:**
63
- - 🇧🇯 Biali (beh)
64
- - 🇧🇯 Baatombu (bba)
65
- - 🇧🇯 Dendi (ddn)
66
- - 🇬🇭 Éwé (ewe)
67
- - 🇧🇯 Mina (gej)
68
- - 🇧🇯 Ditammari (tbz)
69
- - 🇳🇬 Yoruba (yor)
70
- - 🇬🇧 English (eng)
71
-
72
- ### Onglet 3: ℹ️ À propos
73
- Informations sur les modèles et ressources
74
-
75
- ## 📊 Modèles utilisés
76
-
77
- ### ASR: facebook/mms-1b-all
78
- - **Architecture:** wav2vec2
79
- - **Taille:** 964.8M parameters
80
- - **Langues:** 100+ (ISO 639-3)
81
- - **Input:** Audio 16kHz mono
82
- - **Output:** Texte transcrit
83
-
84
- ### TTS: facebook/mms-tts-{lang}
85
- - **Architecture:** VITS
86
- - **Taille:** ~5-10M parameters par langue
87
- - **Langues:** 8
88
- - **Input:** Texte (max 1000 chars)
89
- - **Output:** Audio WAV 22050Hz
90
-
91
- ## 💡 Utilisation
92
-
93
- ### Exemple ASR
94
- 1. Clique sur le micro ou "Upload file"
95
- 2. Enregistre ou uploader ton audio
96
- 3. Sélectionne la langue
97
- 4. Clique "Transcrire"
98
-
99
- ### Exemple TTS
100
- 1. Écris "Àbọ̀ wa" (hello en Yoruba)
101
- 2. Sélectionne "Yoruba (yor)"
102
- 3. Clique "Générer l'audio"
103
- 4. Écoute le résultat!
104
-
105
- ## 🔧 Développement
106
-
107
- ### Installer les dépendances dev
108
- ```bash
109
- pip install -r requirements-dev.txt
110
- ```
111
-
112
- ### Tests
113
- ```bash
114
- pytest test_api.py -v
115
- ```
116
-
117
- ### Linting
118
- ```bash
119
- black app.py
120
- flake8 app.py
121
- ```
122
-
123
- ## 🌐 Déploiement sur Hugging Face Spaces
124
-
125
- ### 1. Créer un Space
126
- - Va sur https://huggingface.co/new-space
127
- - Choisis "Gradio" comme SDK
128
- - Sélectionne "Blank" comme template
129
-
130
- ### 2. Cloner le Space
131
- ```bash
132
- git clone https://huggingface.co/spaces/<username>/<space-name>
133
- cd <space-name>
134
- ```
135
-
136
- ### 3. Copier les fichiers
137
- ```bash
138
- cp app.py requirements.txt README.md .
139
- ```
140
-
141
- ### 4. Push vers Hugging Face
142
- ```bash
143
- git add .
144
- git commit -m "Add MMS Speech AI"
145
- git push
146
- ```
147
-
148
- ### 5. Attendre le déploiement
149
- - HF va installer les dépendances (2-5 min)
150
- - Télécharger les modèles (5-15 min)
151
- - Lancer l'app automatiquement
152
-
153
- **URL du Space:** `https://huggingface.co/spaces/<username>/<space-name>`
154
-
155
- ## ⚙️ Configuration
156
-
157
- ```python
158
- SAMPLE_RATE = 16000 # Taux ASR
159
- MAX_AUDIO_LENGTH = 30 # Max 30 sec
160
- MAX_TEXT_LENGTH = 1000 # Max 1000 chars
161
- ```
162
-
163
- ## 📈 Performance
164
-
165
- | Action | Temps |
166
- |--------|-------|
167
- | Première requête ASR | 2-5 min (chargement) |
168
- | Requêtes ASR suivantes | 1-10 sec |
169
- | Première requête TTS | 30-60 sec (chargement) |
170
- | Requêtes TTS suivantes | 1-5 sec |
171
-
172
- ## 🐛 Troubleshooting
173
-
174
- **Q: Les modèles prennent trop de temps à charger**
175
- A: C'est normal! Les modèles sont volumineux. La première requête charge le modèle (2-5 min), puis ça devient rapide.
176
-
177
- **Q: "CUDA out of memory"**
178
- A: Réduis `MAX_AUDIO_LENGTH` ou `MAX_TEXT_LENGTH`, ou utilise CPU.
179
-
180
- **Q: Je ne vois pas mon audio après avoir enregistré**
181
- A: Attends que le traitement soit terminé. Gradio affichera le résultat automatiquement.
182
-
183
- **Q: L'audio généré est muet**
184
- A: Vérifie que tu as écrit du texte et choisi une langue correcte.
185
-
186
- ## 📚 Ressources
187
-
188
- - [Meta MMS Paper](https://arxiv.org/abs/2305.13516)
189
- - [facebook/mms-1b-all](https://huggingface.co/facebook/mms-1b-all)
190
- - [facebook/mms-tts](https://huggingface.co/facebook/mms-tts)
191
- - [Gradio Documentation](https://www.gradio.app/)
192
- - [Hugging Face Spaces](https://huggingface.co/spaces)
193
-
194
- ## ⚖️ Licence
195
-
196
- CC-BY-NC-4.0 (même que les modèles Meta MMS)
197
-
198
- ## 👨‍💻 Auteur
199
-
200
- Créé avec ❤️ pour explorer la synthèse et reconnaissance vocale multilingue.
201
-
202
- ---
203
-
204
- **Happy speaking! 🎙️**
205
-
206
  =======
207
  ---
208
  title: Test
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
  =======
2
  ---
3
  title: Test