yaitsaid commited on
Commit
b35cb5e
·
verified ·
1 Parent(s): ddb16a7

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +19 -0
README.md CHANGED
@@ -422,3 +422,22 @@ Ablation testant si le choix de l'encodeur semantique gele (dans la fusion Phase
422
 
423
  **Resultat cle** : la fusion avec HuBERT degrade les performances par rapport a Phase 1 seul (85.57% vs 87.34%), alors que la fusion avec Whisper les ameliore significativement (+5 points). Ceci suggere que le gain de la fusion semantique dans Phase 2 ne provient pas simplement de l'ajout d'une representation audio pre-entrainee generique, mais specifiquement de la supervision textuelle de Whisper (entraine pour la reconnaissance vocale) — un signal linguistique/semantique que le self-supervised pur de HuBERT ne capture pas de la meme maniere. Pour une tache de detection de fin de tour, qui beneficie probablement d'une comprehension du caractere syntaxiquement/semantiquement complet d'un enonce, la supervision texte de Whisper semble apporter un avantage decisif que HuBERT n'offre pas.
424
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
422
 
423
  **Resultat cle** : la fusion avec HuBERT degrade les performances par rapport a Phase 1 seul (85.57% vs 87.34%), alors que la fusion avec Whisper les ameliore significativement (+5 points). Ceci suggere que le gain de la fusion semantique dans Phase 2 ne provient pas simplement de l'ajout d'une representation audio pre-entrainee generique, mais specifiquement de la supervision textuelle de Whisper (entraine pour la reconnaissance vocale) — un signal linguistique/semantique que le self-supervised pur de HuBERT ne capture pas de la meme maniere. Pour une tache de detection de fin de tour, qui beneficie probablement d'une comprehension du caractere syntaxiquement/semantiquement complet d'un enonce, la supervision texte de Whisper semble apporter un avantage decisif que HuBERT n'offre pas.
424
 
425
+
426
+ ---
427
+
428
+ ## 10. Ablation du mecanisme de fusion — config mixte, en-CN
429
+
430
+ Comparaison de trois mecanismes pour combiner les features acoustiques (ECAPA-TDNN) et semantiques (Whisper), Phase 1 identique dans les trois cas.
431
+
432
+ **Cross-Attention** (Phase 2 originale) : attention causale entre les deux modalites, suivie d'un TCN.
433
+ **Average Pooling** : moyenne temporelle de chaque modalite, projection, concatenation, MLP.
434
+ **Gated Pooling** : moyenne temporelle de chaque modalite, porte apprise (sigmoid) ponderant la contribution relative de chaque modalite avant fusion.
435
+
436
+ | Mecanisme | Test combine | OOD |
437
+ |---|---|---|
438
+ | **Cross-Attention (baseline)** | **90.01%** | **69.00%** |
439
+ | Gated Pool | 87.30% | 67.57% |
440
+ | Avg Pool | 87.02% | 68.20% |
441
+
442
+ **Resultat cle** : la cross-attention domine les deux mecanismes plus simples sur les deux metriques (+2.71 a +2.99 points test, +0.80 a +1.43 points OOD), confirmant que la capacite d'attention dynamique entre modalites (plutot qu'une simple moyenne ou une porte statique) apporte une vraie valeur ajoutee a la tache, justifiant la complexite additionnelle de ce mecanisme dans l'architecture Phase 2.
443
+