Upload README.md with huggingface_hub
Browse files
README.md
CHANGED
|
@@ -17,9 +17,10 @@ Modeles de detection de fin de tour (HOLD/SHIFT), architecture causale, entraine
|
|
| 17 |
1. Comparaison globale avec les modeles de reference
|
| 18 |
2. Ablation : acoustique seule vs semantique seule vs fusion
|
| 19 |
3. Comparaison d'architectures acoustiques a budget variable
|
| 20 |
-
4.
|
| 21 |
-
5.
|
| 22 |
-
6.
|
|
|
|
| 23 |
|
| 24 |
---
|
| 25 |
|
|
@@ -56,17 +57,15 @@ Modeles de detection de fin de tour (HOLD/SHIFT), architecture causale, entraine
|
|
| 56 |
| en-ZA | 84.56% | 83.84% | 90.54% | 57.71% | 67.48% | 76.62% |
|
| 57 |
| **Moyenne** | **84.39%** | **83.61%** | **90.21%** | **60.86%** | **68.03%** | **76.02%** |
|
| 58 |
|
| 59 |
-
**
|
| 60 |
-
|
| 61 |
-
**Resultat cle** : ordre de generalisation OOD confirme, Phase 1 (60.86%) < Whisper-frozen (68.03%) < Phase 2 (76.02%). Ni l'acoustique seule ni la semantique seule n'atteignent la performance de la fusion complete β la cross-attention genere une synergie reelle qui depasse la simple somme de ses composantes.
|
| 62 |
|
| 63 |
---
|
| 64 |
|
| 65 |
## 3. Comparaison d'architectures acoustiques a budget de parametres variable
|
| 66 |
|
| 67 |
-
|
| 68 |
|
| 69 |
-
### Moyennes sur 3 accents
|
| 70 |
|
| 71 |
| Architecture | Budget (params) | Seul Test | Seul OOD | Fusion Test | Fusion OOD |
|
| 72 |
|---|---|---|---|---|---|
|
|
@@ -81,48 +80,42 @@ Trois architectures testees a budget croissant, config AppTek seul, 3 accents (e
|
|
| 81 |
|
| 82 |
*Instabilite d'entrainement isolee sur en-CN a 4x, affectant la moyenne.
|
| 83 |
|
| 84 |
-
### Detail par accent
|
| 85 |
-
|
| 86 |
-
| Accent | Archi-Budget | Seul Test | Seul OOD | Fusion Test | Fusion OOD |
|
| 87 |
-
|---|---|---|---|---|---|
|
| 88 |
-
| en-CN | ECAPA 1x | 65.11% | 56.36% | 79.24% | 75.20% |
|
| 89 |
-
| en-CN | ECAPA 2x | 65.67% | 53.18% | 79.98% | 73.69% |
|
| 90 |
-
| en-CN | BiGRU 1x | 70.35% | 62.48% | 75.85% | 70.51% |
|
| 91 |
-
| en-CN | BiGRU 2x | 70.70% | 61.37% | 76.43% | 67.89% |
|
| 92 |
-
| en-CN | Conformer 1x | 70.18% | 55.64% | 78.71% | 71.70% |
|
| 93 |
-
| en-CN | Conformer 2x | 73.49% | 64.94% | 78.77% | 70.67% |
|
| 94 |
-
| en-CN | Conformer 3x | 71.75% | 65.90% | 75.75% | 70.11% |
|
| 95 |
-
| en-CN | Conformer 4x | 54.74% | 50.72% | 78.17% | 71.54% |
|
| 96 |
-
| en-GB_WLS | ECAPA 1x | 63.40% | 61.70% | 78.21% | 84.94% |
|
| 97 |
-
| en-GB_WLS | ECAPA 2x | 63.82% | 60.29% | 78.29% | 76.02% |
|
| 98 |
-
| en-GB_WLS | BiGRU 1x | 70.06% | 65.60% | 75.73% | 74.42% |
|
| 99 |
-
| en-GB_WLS | BiGRU 2x | 70.74% | 66.11% | 77.96% | 74.49% |
|
| 100 |
-
| en-GB_WLS | Conformer 1x | 68.48% | 65.98% | 77.54% | 74.17% |
|
| 101 |
-
| en-GB_WLS | Conformer 2x | 71.35% | 69.76% | 79.14% | 77.24% |
|
| 102 |
-
| en-GB_WLS | Conformer 3x | 71.78% | 69.57% | 78.08% | 76.60% |
|
| 103 |
-
| en-GB_WLS | Conformer 4x | 70.78% | 70.33% | 78.19% | 77.88% |
|
| 104 |
-
| en-IE | ECAPA 1x | 64.53% | 57.91% | 78.21% | 84.94% |
|
| 105 |
-
| en-IE | ECAPA 2x | 64.04% | 58.90% | 75.87% | 80.49% |
|
| 106 |
-
| en-IE | BiGRU 1x | 70.17% | 68.42% | 75.53% | 78.50% |
|
| 107 |
-
| en-IE | BiGRU 2x | 70.19% | 69.79% | 75.43% | 79.73% |
|
| 108 |
-
| en-IE | Conformer 1x | 65.36% | 63.16% | 77.60% | 81.91% |
|
| 109 |
-
| en-IE | Conformer 2x | 71.81% | 76.09% | 77.06% | 84.42% |
|
| 110 |
-
| en-IE | Conformer 3x | 70.68% | 74.81% | 77.72% | 84.42% |
|
| 111 |
-
| en-IE | Conformer 4x | 69.89% | 71.35% | 77.87% | 85.61% |
|
| 112 |
-
|
| 113 |
**Resultats cles** :
|
| 114 |
- A budget egal (~460K), BiGRU domine en mode seul, mais ECAPA-TDNN reprend l'avantage en mode fusion.
|
| 115 |
-
- Conformer beneficie d'un budget accru jusqu'a ~900K parametres (2x), avec un gain marque vs 1x
|
| 116 |
-
- Au-dela de 2x, Conformer ne progresse plus de facon monotone (possible surapprentissage sur ~17K exemples train)
|
| 117 |
-
- En mode fusion, la performance reste stable a travers tous les budgets (77-78%)
|
| 118 |
|
| 119 |
---
|
| 120 |
|
| 121 |
-
## 4.
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 122 |
|
| 123 |
-
|
| 124 |
-
2. **Smart Turn seul** : uniquement Smart Turn v3.2 train (0% AppTek)
|
| 125 |
-
3. **AppTek seul** : uniquement AppTek train 13 accents (0% Smart Turn)
|
| 126 |
|
| 127 |
| Configuration | P1 Test | P1 OOD | P2 Test | P2 OOD |
|
| 128 |
|---|---|---|---|---|
|
|
@@ -130,11 +123,11 @@ Trois architectures testees a budget croissant, config AppTek seul, 3 accents (e
|
|
| 130 |
| **Mixte** (94% ST / 6% AppTek) | 84.39% | 60.86% | 90.21% | 76.02% |
|
| 131 |
| **AppTek seul** (0% ST) | 64.42% | 56.59% | 78.79% | **77.58%** |
|
| 132 |
|
| 133 |
-
*Pour Smart Turn seul, "OOD" = AppTek test (jamais vu a l'entrainement)
|
| 134 |
|
| 135 |
-
**Resultat le plus marquant** : Phase 2 (AppTek seul) obtient le meilleur score OOD moyen
|
| 136 |
|
| 137 |
-
### Tableau complet β Mixte, 14 accents, avec baselines figees
|
| 138 |
|
| 139 |
| Accent OOD | ST v3.2 AppTek | ST v3.2 OOD | LiveKit AppTek | LiveKit OOD | P1 AppTek | P1 OOD | P2 AppTek | P2 OOD |
|
| 140 |
|---|---|---|---|---|---|---|---|---|
|
|
@@ -154,29 +147,9 @@ Trois architectures testees a budget croissant, config AppTek seul, 3 accents (e
|
|
| 154 |
| en-ZA | 64.84% | 66.57% | 68.42% | 65.71% | 65.50% | 57.71% | 78.29% | 76.62% |
|
| 155 |
| **Moyenne** | **64.23%** | **64.35%** | **68.29%** | **68.51%** | **66.01%** | **60.86%** | **79.34%** | **76.02%** |
|
| 156 |
|
| 157 |
-
### Effet de l'exposition multi-accent β Smart Turn seul vs Mixte, sur le meme split AppTek test
|
| 158 |
-
|
| 159 |
-
| Accent | P1 (ST seul) AppTek | P1 (mixte) AppTek | P2 (ST seul) AppTek | P2 (mixte) AppTek |
|
| 160 |
-
|---|---|---|---|---|
|
| 161 |
-
| en-AU | 55.00% | 62.07% | 66.09% | 80.55% |
|
| 162 |
-
| en-CA | 55.74% | 66.44% | 66.02% | 79.06% |
|
| 163 |
-
| en-CN | 55.13% | 67.39% | 65.63% | 81.64% |
|
| 164 |
-
| en-GB | 57.21% | 65.61% | 67.18% | 78.75% |
|
| 165 |
-
| en-GB_SCT | 56.27% | 66.15% | 66.96% | 77.75% |
|
| 166 |
-
| en-GB_WLS | 55.56% | 65.83% | 65.81% | 79.48% |
|
| 167 |
-
| en-IE | 56.21% | 68.62% | 64.62% | 78.77% |
|
| 168 |
-
| en-IN | 55.59% | 67.47% | 65.09% | 79.70% |
|
| 169 |
-
| en-MX | 56.36% | 65.86% | 65.93% | 78.74% |
|
| 170 |
-
| en-SG | 55.78% | 67.14% | 65.90% | 79.73% |
|
| 171 |
-
| en-US_Aave | 55.63% | 64.17% | 65.01% | 80.86% |
|
| 172 |
-
| en-US_General | 55.21% | 66.21% | 65.19% | 79.73% |
|
| 173 |
-
| en-US_Southern | 56.78% | 67.61% | 65.66% | 78.71% |
|
| 174 |
-
| en-ZA | 56.38% | 65.50% | 65.67% | 78.29% |
|
| 175 |
-
| **Moyenne** | **55.85%** | **66.01%** | **65.77%** | **79.34%** |
|
| 176 |
-
|
| 177 |
---
|
| 178 |
|
| 179 |
-
##
|
| 180 |
|
| 181 |
| Configuration | P1 Test | P1 OOD | P2 Test | P2 OOD |
|
| 182 |
|---|---|---|---|---|
|
|
@@ -184,16 +157,17 @@ Trois architectures testees a budget croissant, config AppTek seul, 3 accents (e
|
|
| 184 |
| Oversample (65%/35%, reptete) | 84.50% | 59.78% | 90.10% | 70.19% |
|
| 185 |
| **Undersample (50%/50%, vrai)** | **60.93%** | **54.69%** | **87.47%** | **71.70%** |
|
| 186 |
|
| 187 |
-
**Resultat cle** : Phase 1 s'effondre severement sous undersample (-23.96 points), Phase 2 resiste beaucoup mieux (-3.01 points)
|
| 188 |
|
| 189 |
---
|
| 190 |
|
| 191 |
## Resultats cles globaux (synthese)
|
| 192 |
|
| 193 |
1. La fusion (Phase 2) genere une vraie synergie β ni l'acoustique seule ni la semantique seule ne l'egalent.
|
| 194 |
-
2.
|
| 195 |
-
3.
|
| 196 |
-
4.
|
|
|
|
| 197 |
|
| 198 |
## Chargement
|
| 199 |
|
|
@@ -209,9 +183,10 @@ model.load_state_dict(ckpt['best_state'])
|
|
| 209 |
- `results-whisperfrozen-mixte-{accent}.json` β ablation Whisper-frozen-head
|
| 210 |
- `arch-comparison-{arch}-{accent}.json`, `arch2x-comparison-{arch}-{accent}.json` β architectures, budgets 1x/2x
|
| 211 |
- `archscale-comparison-conformer-{3x,4x}-{accent}.json` β Conformer, budgets 3x/4x
|
|
|
|
| 212 |
- `architecture-comparison-consolidated.json` β consolide 1x/2x
|
| 213 |
- `decomposition-test-all-accents.json`, `results-smartturn-only-v4.json`, `smartturn-only-apptek-test-by-accent.json`
|
| 214 |
-
- `baselines-smartturn-livekit-all-accents.json`
|
| 215 |
|
| 216 |
## Limites connues
|
| 217 |
|
|
@@ -219,3 +194,4 @@ model.load_state_dict(ckpt['best_state'])
|
|
| 219 |
- Couverture AppTek limitee a l'anglais (14 accents)
|
| 220 |
- Comparaison d'architectures effectuee sur 3 accents seulement, pour limiter le temps de calcul
|
| 221 |
- Instabilite d'entrainement observee pour Conformer a budget 4x sur un accent (en-CN)
|
|
|
|
|
|
| 17 |
1. Comparaison globale avec les modeles de reference
|
| 18 |
2. Ablation : acoustique seule vs semantique seule vs fusion
|
| 19 |
3. Comparaison d'architectures acoustiques a budget variable
|
| 20 |
+
4. CPC : encodeur audio pre-entraine (self-supervised)
|
| 21 |
+
5. Trois configurations d'entrainement (mixte / Smart Turn seul / AppTek seul)
|
| 22 |
+
6. Experience de reequilibrage synthetique/reel
|
| 23 |
+
7. Fichiers de resultats bruts
|
| 24 |
|
| 25 |
---
|
| 26 |
|
|
|
|
| 57 |
| en-ZA | 84.56% | 83.84% | 90.54% | 57.71% | 67.48% | 76.62% |
|
| 58 |
| **Moyenne** | **84.39%** | **83.61%** | **90.21%** | **60.86%** | **68.03%** | **76.02%** |
|
| 59 |
|
| 60 |
+
**Resultat cle** : ni l'acoustique seule ni la semantique seule n'atteignent la performance de la fusion complete β la cross-attention genere une synergie reelle.
|
|
|
|
|
|
|
| 61 |
|
| 62 |
---
|
| 63 |
|
| 64 |
## 3. Comparaison d'architectures acoustiques a budget de parametres variable
|
| 65 |
|
| 66 |
+
Config AppTek seul, 3 accents (en-CN, en-GB_WLS, en-IE), mode seul et mode fusion (avec Whisper gele).
|
| 67 |
|
| 68 |
+
### Moyennes sur 3 accents β architectures from-scratch
|
| 69 |
|
| 70 |
| Architecture | Budget (params) | Seul Test | Seul OOD | Fusion Test | Fusion OOD |
|
| 71 |
|---|---|---|---|---|---|
|
|
|
|
| 80 |
|
| 81 |
*Instabilite d'entrainement isolee sur en-CN a 4x, affectant la moyenne.
|
| 82 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 83 |
**Resultats cles** :
|
| 84 |
- A budget egal (~460K), BiGRU domine en mode seul, mais ECAPA-TDNN reprend l'avantage en mode fusion.
|
| 85 |
+
- Conformer beneficie d'un budget accru jusqu'a ~900K parametres (2x), avec un gain marque vs 1x.
|
| 86 |
+
- Au-dela de 2x, Conformer ne progresse plus de facon monotone (possible surapprentissage sur ~17K exemples train).
|
| 87 |
+
- En mode fusion, la performance reste stable a travers tous les budgets (77-78%).
|
| 88 |
|
| 89 |
---
|
| 90 |
|
| 91 |
+
## 4. CPC : encodeur audio pre-entraine (self-supervised)
|
| 92 |
+
|
| 93 |
+
Contrairement aux architectures precedentes (entrainees from-scratch), CPC (Contrastive Predictive Coding, Riviere et al. 2020) est un encodeur **pre-entraine** sur de la parole brute en self-supervised, sans supervision texte. Checkpoint officiel FAIR charge et **entierement gele** β seule une tete de classification legere (mode seul) ou le module de fusion (mode fusion) sont entraines.
|
| 94 |
+
|
| 95 |
+
**Architecture reelle du checkpoint utilise** : 1 843 456 parametres au total (encodeur convolutif + GRU contextuel, sortie 256-dim) β note : ce chiffre differe de certaines estimations plus elevees (~5.8M) parfois citees pour cette famille de modeles ; il correspond aux poids du checkpoint officiel effectivement charge et verifie.
|
| 96 |
+
|
| 97 |
+
| Accent | Seul Test | Seul OOD | Fusion Test | Fusion OOD |
|
| 98 |
+
|---|---|---|---|---|
|
| 99 |
+
| en-CN | 64.31% | 53.42% | 80.64% | 74.96% |
|
| 100 |
+
| en-GB_WLS | 62.69% | 57.61% | 79.91% | 77.56% |
|
| 101 |
+
| en-IE | 62.40% | 66.95% | 79.15% | 85.70% |
|
| 102 |
+
| **Moyenne** | **63.13%** | **59.33%** | **79.90%** | **79.41%** |
|
| 103 |
+
|
| 104 |
+
### Comparaison finale β toutes architectures, mode fusion, moyennes sur 3 accents
|
| 105 |
+
|
| 106 |
+
| Architecture | Params (encodeur) | Fusion Test | Fusion OOD |
|
| 107 |
+
|---|---|---|---|
|
| 108 |
+
| BiGRU (1x, from scratch) | 461K | 75.70% | 74.48% |
|
| 109 |
+
| Conformer (1x, from scratch) | 430K | 77.95% | 75.93% |
|
| 110 |
+
| ECAPA-TDNN (1x, from scratch) | 462K | 78.97% | 78.21% |
|
| 111 |
+
| Conformer (2x, from scratch) | 904K | 78.32% | 77.78% |
|
| 112 |
+
| **CPC (pre-entraine, gele)** | **1.84M** | **79.90%** | **79.41%** |
|
| 113 |
+
|
| 114 |
+
**Resultat cle** : CPC (pre-entraine, gele, jamais affine sur la tache) obtient le **meilleur score en mode fusion**, devant toutes les architectures from-scratch testees β suggerant que son pre-entrainement self-supervised capture deja des informations acoustiques/prosodiques pertinentes, complementaires a la semantique de Whisper. En mode seul cependant, CPC reste modeste (63.13% test, 59.33% OOD), moins bon que BiGRU ou Conformer entraines specifiquement β le gain de CPC provient donc presque entierement de la fusion, pas de sa capacite de classification isolee.
|
| 115 |
+
|
| 116 |
+
---
|
| 117 |
|
| 118 |
+
## 5. Trois configurations d'entrainement (Phase 1 et Phase 2, 14 accents)
|
|
|
|
|
|
|
| 119 |
|
| 120 |
| Configuration | P1 Test | P1 OOD | P2 Test | P2 OOD |
|
| 121 |
|---|---|---|---|---|
|
|
|
|
| 123 |
| **Mixte** (94% ST / 6% AppTek) | 84.39% | 60.86% | 90.21% | 76.02% |
|
| 124 |
| **AppTek seul** (0% ST) | 64.42% | 56.59% | 78.79% | **77.58%** |
|
| 125 |
|
| 126 |
+
*Pour Smart Turn seul, "OOD" = AppTek test (jamais vu a l'entrainement).
|
| 127 |
|
| 128 |
+
**Resultat le plus marquant** : Phase 2 (AppTek seul) obtient le meilleur score OOD moyen parmi ces 3 configurations, malgre 16x moins de donnees et l'absence de synthetique.
|
| 129 |
|
| 130 |
+
### Tableau complet β Mixte, 14 accents, avec baselines figees
|
| 131 |
|
| 132 |
| Accent OOD | ST v3.2 AppTek | ST v3.2 OOD | LiveKit AppTek | LiveKit OOD | P1 AppTek | P1 OOD | P2 AppTek | P2 OOD |
|
| 133 |
|---|---|---|---|---|---|---|---|---|
|
|
|
|
| 147 |
| en-ZA | 64.84% | 66.57% | 68.42% | 65.71% | 65.50% | 57.71% | 78.29% | 76.62% |
|
| 148 |
| **Moyenne** | **64.23%** | **64.35%** | **68.29%** | **68.51%** | **66.01%** | **60.86%** | **79.34%** | **76.02%** |
|
| 149 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 150 |
---
|
| 151 |
|
| 152 |
+
## 6. Experience de reequilibrage synthetique/reel (OOD=en-CN)
|
| 153 |
|
| 154 |
| Configuration | P1 Test | P1 OOD | P2 Test | P2 OOD |
|
| 155 |
|---|---|---|---|---|
|
|
|
|
| 157 |
| Oversample (65%/35%, reptete) | 84.50% | 59.78% | 90.10% | 70.19% |
|
| 158 |
| **Undersample (50%/50%, vrai)** | **60.93%** | **54.69%** | **87.47%** | **71.70%** |
|
| 159 |
|
| 160 |
+
**Resultat cle** : Phase 1 s'effondre severement sous undersample (-23.96 points), Phase 2 resiste beaucoup mieux (-3.01 points).
|
| 161 |
|
| 162 |
---
|
| 163 |
|
| 164 |
## Resultats cles globaux (synthese)
|
| 165 |
|
| 166 |
1. La fusion (Phase 2) genere une vraie synergie β ni l'acoustique seule ni la semantique seule ne l'egalent.
|
| 167 |
+
2. **CPC (pre-entraine, gele) surpasse toutes les architectures from-scratch en mode fusion**, malgre l'absence totale de fine-tuning sur la tache β le pre-entrainement self-supervised sur audio brut semble capturer une information acoustique/prosodique complementaire particulierement utile.
|
| 168 |
+
3. Phase 2 (AppTek seul) atteint la meilleure generalisation OOD absolue parmi les configurations de donnees testees.
|
| 169 |
+
4. Le choix d'architecture acoustique optimal depend du contexte (seule vs fusionnee) et du budget de parametres.
|
| 170 |
+
5. La chute de performance OOD est systematique a travers tous les accents et modeles testes.
|
| 171 |
|
| 172 |
## Chargement
|
| 173 |
|
|
|
|
| 183 |
- `results-whisperfrozen-mixte-{accent}.json` β ablation Whisper-frozen-head
|
| 184 |
- `arch-comparison-{arch}-{accent}.json`, `arch2x-comparison-{arch}-{accent}.json` β architectures, budgets 1x/2x
|
| 185 |
- `archscale-comparison-conformer-{3x,4x}-{accent}.json` β Conformer, budgets 3x/4x
|
| 186 |
+
- `cpc-comparison-{accent}.json` β CPC pre-entraine gele
|
| 187 |
- `architecture-comparison-consolidated.json` β consolide 1x/2x
|
| 188 |
- `decomposition-test-all-accents.json`, `results-smartturn-only-v4.json`, `smartturn-only-apptek-test-by-accent.json`
|
| 189 |
+
- `baselines-smartturn-livekit-all-accents.json`
|
| 190 |
|
| 191 |
## Limites connues
|
| 192 |
|
|
|
|
| 194 |
- Couverture AppTek limitee a l'anglais (14 accents)
|
| 195 |
- Comparaison d'architectures effectuee sur 3 accents seulement, pour limiter le temps de calcul
|
| 196 |
- Instabilite d'entrainement observee pour Conformer a budget 4x sur un accent (en-CN)
|
| 197 |
+
- CPC evalue avec un seul checkpoint pre-entraine (LibriSpeech, anglais), sans fine-tuning
|