Upload README.md with huggingface_hub
Browse files
README.md
CHANGED
|
@@ -422,3 +422,22 @@ Ablation testant si le choix de l'encodeur semantique gele (dans la fusion Phase
|
|
| 422 |
|
| 423 |
**Resultat cle** : la fusion avec HuBERT degrade les performances par rapport a Phase 1 seul (85.57% vs 87.34%), alors que la fusion avec Whisper les ameliore significativement (+5 points). Ceci suggere que le gain de la fusion semantique dans Phase 2 ne provient pas simplement de l'ajout d'une representation audio pre-entrainee generique, mais specifiquement de la supervision textuelle de Whisper (entraine pour la reconnaissance vocale) — un signal linguistique/semantique que le self-supervised pur de HuBERT ne capture pas de la meme maniere. Pour une tache de detection de fin de tour, qui beneficie probablement d'une comprehension du caractere syntaxiquement/semantiquement complet d'un enonce, la supervision texte de Whisper semble apporter un avantage decisif que HuBERT n'offre pas.
|
| 424 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 422 |
|
| 423 |
**Resultat cle** : la fusion avec HuBERT degrade les performances par rapport a Phase 1 seul (85.57% vs 87.34%), alors que la fusion avec Whisper les ameliore significativement (+5 points). Ceci suggere que le gain de la fusion semantique dans Phase 2 ne provient pas simplement de l'ajout d'une representation audio pre-entrainee generique, mais specifiquement de la supervision textuelle de Whisper (entraine pour la reconnaissance vocale) — un signal linguistique/semantique que le self-supervised pur de HuBERT ne capture pas de la meme maniere. Pour une tache de detection de fin de tour, qui beneficie probablement d'une comprehension du caractere syntaxiquement/semantiquement complet d'un enonce, la supervision texte de Whisper semble apporter un avantage decisif que HuBERT n'offre pas.
|
| 424 |
|
| 425 |
+
|
| 426 |
+
---
|
| 427 |
+
|
| 428 |
+
## 10. Ablation du mecanisme de fusion — config mixte, en-CN
|
| 429 |
+
|
| 430 |
+
Comparaison de trois mecanismes pour combiner les features acoustiques (ECAPA-TDNN) et semantiques (Whisper), Phase 1 identique dans les trois cas.
|
| 431 |
+
|
| 432 |
+
**Cross-Attention** (Phase 2 originale) : attention causale entre les deux modalites, suivie d'un TCN.
|
| 433 |
+
**Average Pooling** : moyenne temporelle de chaque modalite, projection, concatenation, MLP.
|
| 434 |
+
**Gated Pooling** : moyenne temporelle de chaque modalite, porte apprise (sigmoid) ponderant la contribution relative de chaque modalite avant fusion.
|
| 435 |
+
|
| 436 |
+
| Mecanisme | Test combine | OOD |
|
| 437 |
+
|---|---|---|
|
| 438 |
+
| **Cross-Attention (baseline)** | **90.01%** | **69.00%** |
|
| 439 |
+
| Gated Pool | 87.30% | 67.57% |
|
| 440 |
+
| Avg Pool | 87.02% | 68.20% |
|
| 441 |
+
|
| 442 |
+
**Resultat cle** : la cross-attention domine les deux mecanismes plus simples sur les deux metriques (+2.71 a +2.99 points test, +0.80 a +1.43 points OOD), confirmant que la capacite d'attention dynamique entre modalites (plutot qu'une simple moyenne ou une porte statique) apporte une vraie valeur ajoutee a la tache, justifiant la complexite additionnelle de ce mecanisme dans l'architecture Phase 2.
|
| 443 |
+
|