Upload README.md with huggingface_hub
Browse files
README.md
CHANGED
|
@@ -264,3 +264,73 @@ Suite a la comparaison d'architectures a budget egal (config AppTek seul, sectio
|
|
| 264 |
|
| 265 |
**Interpretation** : si l'objectif est la performance maximale sur donnees connues (synthetique + reel vu), Phase 2 (ECAPA + Cross-Attention/TCN) reste la meilleure architecture. Si l'objectif est la **generalisation a un accent totalement inconnu**, la combinaison CPC (pre-entraine) + fusion Transformer semble legerement superieure, suggerant une piste d'amelioration pour des applications ou la robustesse a des locuteurs/accents non vus est prioritaire.
|
| 266 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 264 |
|
| 265 |
**Interpretation** : si l'objectif est la performance maximale sur donnees connues (synthetique + reel vu), Phase 2 (ECAPA + Cross-Attention/TCN) reste la meilleure architecture. Si l'objectif est la **generalisation a un accent totalement inconnu**, la combinaison CPC (pre-entraine) + fusion Transformer semble legerement superieure, suggerant une piste d'amelioration pour des applications ou la robustesse a des locuteurs/accents non vus est prioritaire.
|
| 266 |
|
| 267 |
+
|
| 268 |
+
---
|
| 269 |
+
|
| 270 |
+
## 8. CPC Frozen vs CPC Partial (fine-tuning du GRU contextuel) — config mixte, 14 accents
|
| 271 |
+
|
| 272 |
+
Extension de l'experience CPC (section 4) : comparaison entre l'encodeur CPC entierement gele ("frozen") et une variante ou le GRU contextuel (couche recurrente apres l'encodeur convolutif) est degele et fine-tune sur la tache ("partial"), tandis que l'encodeur convolutif reste toujours gele dans les deux cas.
|
| 273 |
+
|
| 274 |
+
**Parametres entraines** : 33,154 (frozen, tete de classification seule) vs 559,490 (partial, tete + GRU contextuel).
|
| 275 |
+
|
| 276 |
+
### CPC Frozen (14 accents)
|
| 277 |
+
|
| 278 |
+
| Accent | Seul Test | Seul OOD | Fusion Test | Fusion OOD |
|
| 279 |
+
|---|---|---|---|---|
|
| 280 |
+
| en-AU | 65.06% | 61.63% | 80.75% | 84.02% |
|
| 281 |
+
| en-CA | 64.63% | 63.11% | 80.21% | 82.30% |
|
| 282 |
+
| en-CN | 63.00% | 52.70% | 80.35% | 73.77% |
|
| 283 |
+
| en-GB | 63.66% | 59.60% | 79.99% | 78.17% |
|
| 284 |
+
| en-GB_SCT | 64.86% | 59.44% | 80.24% | 74.86% |
|
| 285 |
+
| en-GB_WLS | 64.53% | 56.19% | 79.83% | 76.85% |
|
| 286 |
+
| en-IE | 63.79% | 66.02% | 78.79% | 87.83% |
|
| 287 |
+
| en-IN | 64.55% | 60.92% | 80.53% | 71.34% |
|
| 288 |
+
| en-MX | 64.10% | 60.79% | 80.06% | 78.02% |
|
| 289 |
+
| en-SG | 64.99% | 62.29% | 80.60% | 78.14% |
|
| 290 |
+
| en-US_Aave | 64.63% | 57.31% | 80.32% | 76.24% |
|
| 291 |
+
| en-US_General | 63.79% | 59.83% | 80.49% | 80.97% |
|
| 292 |
+
| en-US_Southern | 63.84% | 63.65% | 80.42% | 78.05% |
|
| 293 |
+
| en-ZA | 65.19% | 56.09% | 80.55% | 76.63% |
|
| 294 |
+
| **Moyenne** | **64.33%** | **59.97%** | **80.23%** | **78.37%** |
|
| 295 |
+
|
| 296 |
+
### CPC Partial (14 accents)
|
| 297 |
+
|
| 298 |
+
| Accent | Seul Test | Seul OOD | Fusion Test | Fusion OOD |
|
| 299 |
+
|---|---|---|---|---|
|
| 300 |
+
| en-AU | 63.02% | 61.45% | 79.45% | 85.89% |
|
| 301 |
+
| en-CA | 63.18% | 59.70% | 79.22% | 80.98% |
|
| 302 |
+
| en-CN | 60.84% | 50.87% | 79.96% | 72.50% |
|
| 303 |
+
| en-GB | 63.50% | 52.29% | 80.75% | 76.33% |
|
| 304 |
+
| en-GB_SCT | 64.46% | 55.81% | 79.86% | 75.18% |
|
| 305 |
+
| en-GB_WLS | 63.69% | 57.23% | 79.46% | 77.05% |
|
| 306 |
+
| en-IE | 63.62% | 59.23% | 79.21% | 85.75% |
|
| 307 |
+
| en-IN | 62.45% | 55.53% | 79.98% | 71.14% |
|
| 308 |
+
| en-MX | 64.69% | 62.91% | 79.18% | 77.41% |
|
| 309 |
+
| en-SG | 63.92% | 58.69% | 80.35% | 77.28% |
|
| 310 |
+
| en-US_Aave | 62.54% | 53.12% | 79.68% | 75.53% |
|
| 311 |
+
| en-US_General | 63.32% | 56.39% | 80.33% | 80.72% |
|
| 312 |
+
| en-US_Southern | 63.44% | 57.41% | 80.33% | 77.98% |
|
| 313 |
+
| en-ZA | 63.87% | 56.10% | 79.24% | 79.43% |
|
| 314 |
+
| **Moyenne** | **63.33%** | **56.91%** | **79.79%** | **78.08%** |
|
| 315 |
+
|
| 316 |
+
### Comparaison synthetique
|
| 317 |
+
|
| 318 |
+
| Mode | Seul Test | Seul OOD | Fusion Test | Fusion OOD |
|
| 319 |
+
|---|---|---|---|---|
|
| 320 |
+
| **Frozen** | **64.33%** | **59.97%** | **80.23%** | **78.37%** |
|
| 321 |
+
| Partial | 63.33% | 56.91% | 79.79% | 78.08% |
|
| 322 |
+
| Ecart (frozen - partial) | +1.00 | +3.06 | +0.44 | +0.29 |
|
| 323 |
+
|
| 324 |
+
**Resultat cle** : le fine-tuning partiel du GRU contextuel de CPC n'apporte aucun benefice, et se revele legerement contre-productif sur toutes les metriques, particulierement pour la generalisation OOD en mode seul (+3.06 points en faveur du frozen). Ceci suggere que les representations pre-entrainees de CPC captent deja l'essentiel du signal utile pour cette tache, et qu'un fine-tuning limite (peu de donnees specifiques face a un espace de parametres relativement large) ajoute du bruit d'optimisation sans gain reel.
|
| 325 |
+
|
| 326 |
+
## Tableau recapitulatif final — toutes architectures en fusion, config mixte, moyennes 14 accents
|
| 327 |
+
|
| 328 |
+
| Architecture | Params (acoustique) | Fusion Test | Fusion OOD |
|
| 329 |
+
|---|---|---|---|
|
| 330 |
+
| **CPC frozen** | 1.84M (gele) | 80.23% | **78.37%** |
|
| 331 |
+
| CPC + Whisper + Transformer | 1.84M (gele) + 500K (fusion) | 80.02% | 78.04% |
|
| 332 |
+
| CPC partial | 1.84M (559K entraines) | 79.79% | 78.08% |
|
| 333 |
+
| Phase 2 (ECAPA + Cross-Attn+TCN) | 462K (from scratch) | **90.21%** | 76.02% |
|
| 334 |
+
| BiGRU | 461K (from scratch) | 88.78% | 74.71% |
|
| 335 |
+
|
| 336 |
+
**Interpretation finale** : pour la performance maximale sur donnees connues (synthetique + reel vu), Phase 2 (ECAPA, from scratch) reste la meilleure architecture. Pour la **generalisation a un accent totalement inconnu**, CPC gele (sans aucun fine-tuning) offre la meilleure robustesse parmi toutes les architectures testees — confirmant qu'un encodeur pre-entraine en self-supervised sur de la parole brute capture une information acoustique/prosodique qui generalise mieux qu'un apprentissage from-scratch specifique a la tache, meme avec beaucoup moins de parametres entraines (33K vs 462K).
|