Ronaldo commited on
Commit
941b080
·
1 Parent(s): 265f1a9

first commit

Browse files
Files changed (2) hide show
  1. README.md +229 -0
  2. readme.md +0 -13
README.md ADDED
@@ -0,0 +1,229 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ title: Meta MMS Speech AI
3
+ emoji: 🎙️
4
+ colorFrom: blue
5
+ colorTo: green
6
+ sdk: gradio
7
+ sdk_version: "4.26.0"
8
+ python_version: "3.10"
9
+ app_file: app.py
10
+ pinned: false
11
+ license: cc-by-nc-4.0
12
+ models:
13
+ - facebook/mms-1b-all
14
+ - facebook/mms-tts-yor
15
+ - facebook/mms-tts-eng
16
+ - facebook/mms-tts-beh
17
+ - facebook/mms-tts-ddn
18
+ tags:
19
+ - ASR
20
+ - TTS
21
+ - Speech
22
+ - Audio
23
+ - Multilingual
24
+ - MMS
25
+ ---
26
+
27
+ # 🎙️ Meta MMS Speech AI - Gradio Interface
28
+
29
+ Une interface **Gradio** simple et élégante pour:
30
+ - **ASR** (Automatic Speech Recognition): Convertir l'audio en texte (100+ langues)
31
+ - **TTS** (Text-to-Speech): Convertir le texte en audio (8 langues)
32
+
33
+ Utilise les modèles Meta MMS:
34
+ - `facebook/mms-1b-all` pour l'ASR
35
+ - `facebook/mms-tts-*` pour le TTS
36
+
37
+ ## 🌐 Déploiement en ligne
38
+
39
+ **Accès direct:** [Hugging Face Spaces](https://huggingface.co/spaces)
40
+
41
+ ## 🚀 Installation locale
42
+
43
+ ### Prérequis
44
+ - Python 3.10+
45
+ - (Optionnel) CUDA 11.8+ pour GPU
46
+
47
+ ### Installation
48
+
49
+ ```bash
50
+ # Clone ou télécharge le repo
51
+ git clone <url>
52
+ cd mms-speech
53
+
54
+ # Crée un environnement virtuel
55
+ python -m venv venv
56
+ source venv/bin/activate # Windows: venv\Scripts\activate
57
+
58
+ # Installe les dépendances
59
+ pip install -r requirements.txt
60
+ ```
61
+
62
+ ### Lancement
63
+
64
+ ```bash
65
+ python app.py
66
+ ```
67
+
68
+ L'interface Gradio s'ouvrira automatiquement sur `http://localhost:7860`
69
+
70
+ ## 📱 Interface utilisateur
71
+
72
+ ### Onglet 1: 🔊 ASR (Audio → Texte)
73
+ - Enregistre ou upload un fichier audio
74
+ - Choisis la langue
75
+ - Clique "Transcrire"
76
+ - Récupère le texte transcrit
77
+
78
+ **Langues supportées:**
79
+ - English, French, Spanish, German, Portuguese, Arabic, Hindi, Chinese, Japanese, et 90+ autres
80
+
81
+ ### Onglet 2: 📢 TTS (Texte → Audio)
82
+ - Entre du texte
83
+ - Choisis la langue
84
+ - Clique "Générer l'audio"
85
+ - Écoute ou télécharge l'audio généré
86
+
87
+ **Langues TTS:**
88
+ - 🇧🇯 Biali (beh)
89
+ - 🇧🇯 Baatombu (bba)
90
+ - 🇧🇯 Dendi (ddn)
91
+ - 🇬🇭 Éwé (ewe)
92
+ - 🇧🇯 Mina (gej)
93
+ - 🇧🇯 Ditammari (tbz)
94
+ - 🇳🇬 Yoruba (yor)
95
+ - 🇬🇧 English (eng)
96
+
97
+ ### Onglet 3: ℹ️ À propos
98
+ Informations sur les modèles et ressources
99
+
100
+ ## 📊 Modèles utilisés
101
+
102
+ ### ASR: facebook/mms-1b-all
103
+ - **Architecture:** wav2vec2
104
+ - **Taille:** 964.8M parameters
105
+ - **Langues:** 100+ (ISO 639-3)
106
+ - **Input:** Audio 16kHz mono
107
+ - **Output:** Texte transcrit
108
+
109
+ ### TTS: facebook/mms-tts-{lang}
110
+ - **Architecture:** VITS
111
+ - **Taille:** ~5-10M parameters par langue
112
+ - **Langues:** 8
113
+ - **Input:** Texte (max 1000 chars)
114
+ - **Output:** Audio WAV 22050Hz
115
+
116
+ ## 💡 Utilisation
117
+
118
+ ### Exemple ASR
119
+ 1. Clique sur le micro ou "Upload file"
120
+ 2. Enregistre ou uploader ton audio
121
+ 3. Sélectionne la langue
122
+ 4. Clique "Transcrire"
123
+
124
+ ### Exemple TTS
125
+ 1. Écris "Àbọ̀ wa" (hello en Yoruba)
126
+ 2. Sélectionne "Yoruba (yor)"
127
+ 3. Clique "Générer l'audio"
128
+ 4. Écoute le résultat!
129
+
130
+ ## 🔧 Développement
131
+
132
+ ### Installer les dépendances dev
133
+ ```bash
134
+ pip install -r requirements-dev.txt
135
+ ```
136
+
137
+ ### Tests
138
+ ```bash
139
+ pytest test_api.py -v
140
+ ```
141
+
142
+ ### Linting
143
+ ```bash
144
+ black app.py
145
+ flake8 app.py
146
+ ```
147
+
148
+ ## 🌐 Déploiement sur Hugging Face Spaces
149
+
150
+ ### 1. Créer un Space
151
+ - Va sur https://huggingface.co/new-space
152
+ - Choisis "Gradio" comme SDK
153
+ - Sélectionne "Blank" comme template
154
+
155
+ ### 2. Cloner le Space
156
+ ```bash
157
+ git clone https://huggingface.co/spaces/<username>/<space-name>
158
+ cd <space-name>
159
+ ```
160
+
161
+ ### 3. Copier les fichiers
162
+ ```bash
163
+ cp app.py requirements.txt README.md .
164
+ ```
165
+
166
+ ### 4. Push vers Hugging Face
167
+ ```bash
168
+ git add .
169
+ git commit -m "Add MMS Speech AI"
170
+ git push
171
+ ```
172
+
173
+ ### 5. Attendre le déploiement
174
+ - HF va installer les dépendances (2-5 min)
175
+ - Télécharger les modèles (5-15 min)
176
+ - Lancer l'app automatiquement
177
+
178
+ **URL du Space:** `https://huggingface.co/spaces/<username>/<space-name>`
179
+
180
+ ## ⚙️ Configuration
181
+
182
+ ```python
183
+ SAMPLE_RATE = 16000 # Taux ASR
184
+ MAX_AUDIO_LENGTH = 30 # Max 30 sec
185
+ MAX_TEXT_LENGTH = 1000 # Max 1000 chars
186
+ ```
187
+
188
+ ## 📈 Performance
189
+
190
+ | Action | Temps |
191
+ |--------|-------|
192
+ | Première requête ASR | 2-5 min (chargement) |
193
+ | Requêtes ASR suivantes | 1-10 sec |
194
+ | Première requête TTS | 30-60 sec (chargement) |
195
+ | Requêtes TTS suivantes | 1-5 sec |
196
+
197
+ ## 🐛 Troubleshooting
198
+
199
+ **Q: Les modèles prennent trop de temps à charger**
200
+ A: C'est normal! Les modèles sont volumineux. La première requête charge le modèle (2-5 min), puis ça devient rapide.
201
+
202
+ **Q: "CUDA out of memory"**
203
+ A: Réduis `MAX_AUDIO_LENGTH` ou `MAX_TEXT_LENGTH`, ou utilise CPU.
204
+
205
+ **Q: Je ne vois pas mon audio après avoir enregistré**
206
+ A: Attends que le traitement soit terminé. Gradio affichera le résultat automatiquement.
207
+
208
+ **Q: L'audio généré est muet**
209
+ A: Vérifie que tu as écrit du texte et choisi une langue correcte.
210
+
211
+ ## 📚 Ressources
212
+
213
+ - [Meta MMS Paper](https://arxiv.org/abs/2305.13516)
214
+ - [facebook/mms-1b-all](https://huggingface.co/facebook/mms-1b-all)
215
+ - [facebook/mms-tts](https://huggingface.co/facebook/mms-tts)
216
+ - [Gradio Documentation](https://www.gradio.app/)
217
+ - [Hugging Face Spaces](https://huggingface.co/spaces)
218
+
219
+ ## ⚖️ Licence
220
+
221
+ CC-BY-NC-4.0 (même que les modèles Meta MMS)
222
+
223
+ ## 👨‍💻 Auteur
224
+
225
+ Créé avec ❤️ pour explorer la synthèse et reconnaissance vocale multilingue.
226
+
227
+ ---
228
+
229
+ **Happy speaking! 🎙️**
readme.md DELETED
@@ -1,13 +0,0 @@
1
- =======
2
- ---
3
- title: Test
4
- emoji: 📈
5
- colorFrom: green
6
- colorTo: gray
7
- sdk: gradio
8
- sdk_version: 6.12.0
9
- app_file: app.py
10
- pinned: false
11
- ---
12
-
13
- Check out the configuration reference at https://huggingface.co/docs/hub/spaces-config-reference