yaitsaid commited on
Commit
f420094
Β·
verified Β·
1 Parent(s): c9f7bde

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +49 -73
README.md CHANGED
@@ -17,9 +17,10 @@ Modeles de detection de fin de tour (HOLD/SHIFT), architecture causale, entraine
17
  1. Comparaison globale avec les modeles de reference
18
  2. Ablation : acoustique seule vs semantique seule vs fusion
19
  3. Comparaison d'architectures acoustiques a budget variable
20
- 4. Trois configurations d'entrainement (mixte / Smart Turn seul / AppTek seul)
21
- 5. Experience de reequilibrage synthetique/reel
22
- 6. Fichiers de resultats bruts
 
23
 
24
  ---
25
 
@@ -56,17 +57,15 @@ Modeles de detection de fin de tour (HOLD/SHIFT), architecture causale, entraine
56
  | en-ZA | 84.56% | 83.84% | 90.54% | 57.71% | 67.48% | 76.62% |
57
  | **Moyenne** | **84.39%** | **83.61%** | **90.21%** | **60.86%** | **68.03%** | **76.02%** |
58
 
59
- **Whisper-frozen-head** : tete de classification legere (49.5K parametres) sur Whisper-tiny gele, sans fusion ni backbone acoustique.
60
-
61
- **Resultat cle** : ordre de generalisation OOD confirme, Phase 1 (60.86%) < Whisper-frozen (68.03%) < Phase 2 (76.02%). Ni l'acoustique seule ni la semantique seule n'atteignent la performance de la fusion complete β€” la cross-attention genere une synergie reelle qui depasse la simple somme de ses composantes.
62
 
63
  ---
64
 
65
  ## 3. Comparaison d'architectures acoustiques a budget de parametres variable
66
 
67
- Trois architectures testees a budget croissant, config AppTek seul, 3 accents (en-CN, en-GB_WLS, en-IE), en mode seul (acoustique isolee) et en mode fusion (avec Whisper gele).
68
 
69
- ### Moyennes sur 3 accents
70
 
71
  | Architecture | Budget (params) | Seul Test | Seul OOD | Fusion Test | Fusion OOD |
72
  |---|---|---|---|---|---|
@@ -81,48 +80,42 @@ Trois architectures testees a budget croissant, config AppTek seul, 3 accents (e
81
 
82
  *Instabilite d'entrainement isolee sur en-CN a 4x, affectant la moyenne.
83
 
84
- ### Detail par accent
85
-
86
- | Accent | Archi-Budget | Seul Test | Seul OOD | Fusion Test | Fusion OOD |
87
- |---|---|---|---|---|---|
88
- | en-CN | ECAPA 1x | 65.11% | 56.36% | 79.24% | 75.20% |
89
- | en-CN | ECAPA 2x | 65.67% | 53.18% | 79.98% | 73.69% |
90
- | en-CN | BiGRU 1x | 70.35% | 62.48% | 75.85% | 70.51% |
91
- | en-CN | BiGRU 2x | 70.70% | 61.37% | 76.43% | 67.89% |
92
- | en-CN | Conformer 1x | 70.18% | 55.64% | 78.71% | 71.70% |
93
- | en-CN | Conformer 2x | 73.49% | 64.94% | 78.77% | 70.67% |
94
- | en-CN | Conformer 3x | 71.75% | 65.90% | 75.75% | 70.11% |
95
- | en-CN | Conformer 4x | 54.74% | 50.72% | 78.17% | 71.54% |
96
- | en-GB_WLS | ECAPA 1x | 63.40% | 61.70% | 78.21% | 84.94% |
97
- | en-GB_WLS | ECAPA 2x | 63.82% | 60.29% | 78.29% | 76.02% |
98
- | en-GB_WLS | BiGRU 1x | 70.06% | 65.60% | 75.73% | 74.42% |
99
- | en-GB_WLS | BiGRU 2x | 70.74% | 66.11% | 77.96% | 74.49% |
100
- | en-GB_WLS | Conformer 1x | 68.48% | 65.98% | 77.54% | 74.17% |
101
- | en-GB_WLS | Conformer 2x | 71.35% | 69.76% | 79.14% | 77.24% |
102
- | en-GB_WLS | Conformer 3x | 71.78% | 69.57% | 78.08% | 76.60% |
103
- | en-GB_WLS | Conformer 4x | 70.78% | 70.33% | 78.19% | 77.88% |
104
- | en-IE | ECAPA 1x | 64.53% | 57.91% | 78.21% | 84.94% |
105
- | en-IE | ECAPA 2x | 64.04% | 58.90% | 75.87% | 80.49% |
106
- | en-IE | BiGRU 1x | 70.17% | 68.42% | 75.53% | 78.50% |
107
- | en-IE | BiGRU 2x | 70.19% | 69.79% | 75.43% | 79.73% |
108
- | en-IE | Conformer 1x | 65.36% | 63.16% | 77.60% | 81.91% |
109
- | en-IE | Conformer 2x | 71.81% | 76.09% | 77.06% | 84.42% |
110
- | en-IE | Conformer 3x | 70.68% | 74.81% | 77.72% | 84.42% |
111
- | en-IE | Conformer 4x | 69.89% | 71.35% | 77.87% | 85.61% |
112
-
113
  **Resultats cles** :
114
  - A budget egal (~460K), BiGRU domine en mode seul, mais ECAPA-TDNN reprend l'avantage en mode fusion.
115
- - Conformer beneficie d'un budget accru jusqu'a ~900K parametres (2x), avec un gain marque vs 1x (+4 points test, +7 points OOD en mode seul).
116
- - Au-dela de 2x, Conformer ne progresse plus de facon monotone (possible surapprentissage sur ~17K exemples train) β€” optimum autour de 900K parametres pour ce volume de donnees.
117
- - En mode fusion, la performance reste stable a travers tous les budgets (77-78%) β€” la fusion semble compenser les variations de qualite de l'encodeur acoustique seul.
118
 
119
  ---
120
 
121
- ## 4. Trois configurations d'entrainement (Phase 1 et Phase 2, 14 accents)
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
122
 
123
- 1. **Mixte** : Smart Turn v3.2 train (94%) + AppTek train 13 accents (6%)
124
- 2. **Smart Turn seul** : uniquement Smart Turn v3.2 train (0% AppTek)
125
- 3. **AppTek seul** : uniquement AppTek train 13 accents (0% Smart Turn)
126
 
127
  | Configuration | P1 Test | P1 OOD | P2 Test | P2 OOD |
128
  |---|---|---|---|---|
@@ -130,11 +123,11 @@ Trois architectures testees a budget croissant, config AppTek seul, 3 accents (e
130
  | **Mixte** (94% ST / 6% AppTek) | 84.39% | 60.86% | 90.21% | 76.02% |
131
  | **AppTek seul** (0% ST) | 64.42% | 56.59% | 78.79% | **77.58%** |
132
 
133
- *Pour Smart Turn seul, "OOD" = AppTek test (jamais vu a l'entrainement), pas un accent totalement exclu.
134
 
135
- **Resultat le plus marquant** : Phase 2 (AppTek seul) obtient le meilleur score OOD moyen de toutes les configurations testees (77.58%), malgre un volume d'entrainement 16x plus faible et l'absence totale de donnees synthetiques.
136
 
137
- ### Tableau complet β€” Mixte, 14 accents, avec baselines figees (Smart Turn v3.2, LiveKit)
138
 
139
  | Accent OOD | ST v3.2 AppTek | ST v3.2 OOD | LiveKit AppTek | LiveKit OOD | P1 AppTek | P1 OOD | P2 AppTek | P2 OOD |
140
  |---|---|---|---|---|---|---|---|---|
@@ -154,29 +147,9 @@ Trois architectures testees a budget croissant, config AppTek seul, 3 accents (e
154
  | en-ZA | 64.84% | 66.57% | 68.42% | 65.71% | 65.50% | 57.71% | 78.29% | 76.62% |
155
  | **Moyenne** | **64.23%** | **64.35%** | **68.29%** | **68.51%** | **66.01%** | **60.86%** | **79.34%** | **76.02%** |
156
 
157
- ### Effet de l'exposition multi-accent β€” Smart Turn seul vs Mixte, sur le meme split AppTek test
158
-
159
- | Accent | P1 (ST seul) AppTek | P1 (mixte) AppTek | P2 (ST seul) AppTek | P2 (mixte) AppTek |
160
- |---|---|---|---|---|
161
- | en-AU | 55.00% | 62.07% | 66.09% | 80.55% |
162
- | en-CA | 55.74% | 66.44% | 66.02% | 79.06% |
163
- | en-CN | 55.13% | 67.39% | 65.63% | 81.64% |
164
- | en-GB | 57.21% | 65.61% | 67.18% | 78.75% |
165
- | en-GB_SCT | 56.27% | 66.15% | 66.96% | 77.75% |
166
- | en-GB_WLS | 55.56% | 65.83% | 65.81% | 79.48% |
167
- | en-IE | 56.21% | 68.62% | 64.62% | 78.77% |
168
- | en-IN | 55.59% | 67.47% | 65.09% | 79.70% |
169
- | en-MX | 56.36% | 65.86% | 65.93% | 78.74% |
170
- | en-SG | 55.78% | 67.14% | 65.90% | 79.73% |
171
- | en-US_Aave | 55.63% | 64.17% | 65.01% | 80.86% |
172
- | en-US_General | 55.21% | 66.21% | 65.19% | 79.73% |
173
- | en-US_Southern | 56.78% | 67.61% | 65.66% | 78.71% |
174
- | en-ZA | 56.38% | 65.50% | 65.67% | 78.29% |
175
- | **Moyenne** | **55.85%** | **66.01%** | **65.77%** | **79.34%** |
176
-
177
  ---
178
 
179
- ## 5. Experience de reequilibrage synthetique/reel (OOD=en-CN)
180
 
181
  | Configuration | P1 Test | P1 OOD | P2 Test | P2 OOD |
182
  |---|---|---|---|---|
@@ -184,16 +157,17 @@ Trois architectures testees a budget croissant, config AppTek seul, 3 accents (e
184
  | Oversample (65%/35%, reptete) | 84.50% | 59.78% | 90.10% | 70.19% |
185
  | **Undersample (50%/50%, vrai)** | **60.93%** | **54.69%** | **87.47%** | **71.70%** |
186
 
187
- **Resultat cle** : Phase 1 s'effondre severement sous undersample (-23.96 points), Phase 2 resiste beaucoup mieux (-3.01 points), demontrant l'efficacite d'apprentissage superieure des representations pre-entrainees face a la rarete des donnees reelles. L'oversampling par simple repetition n'apporte aucun gain significatif.
188
 
189
  ---
190
 
191
  ## Resultats cles globaux (synthese)
192
 
193
  1. La fusion (Phase 2) genere une vraie synergie β€” ni l'acoustique seule ni la semantique seule ne l'egalent.
194
- 2. Phase 2 (AppTek seul) atteint la meilleure generalisation OOD absolue de toutes les configurations testees.
195
- 3. Le choix d'architecture acoustique optimal depend du contexte (seule vs fusionnee) et du budget de parametres.
196
- 4. La chute de performance OOD est systematique a travers tous les accents et modeles testes β€” la difficulte provient du passage synthetique-vers-reel en general, pas d'un accent specifique.
 
197
 
198
  ## Chargement
199
 
@@ -209,9 +183,10 @@ model.load_state_dict(ckpt['best_state'])
209
  - `results-whisperfrozen-mixte-{accent}.json` β€” ablation Whisper-frozen-head
210
  - `arch-comparison-{arch}-{accent}.json`, `arch2x-comparison-{arch}-{accent}.json` β€” architectures, budgets 1x/2x
211
  - `archscale-comparison-conformer-{3x,4x}-{accent}.json` β€” Conformer, budgets 3x/4x
 
212
  - `architecture-comparison-consolidated.json` β€” consolide 1x/2x
213
  - `decomposition-test-all-accents.json`, `results-smartturn-only-v4.json`, `smartturn-only-apptek-test-by-accent.json`
214
- - `baselines-smartturn-livekit-all-accents.json`, `cpc-comparison-{accent}.json`
215
 
216
  ## Limites connues
217
 
@@ -219,3 +194,4 @@ model.load_state_dict(ckpt['best_state'])
219
  - Couverture AppTek limitee a l'anglais (14 accents)
220
  - Comparaison d'architectures effectuee sur 3 accents seulement, pour limiter le temps de calcul
221
  - Instabilite d'entrainement observee pour Conformer a budget 4x sur un accent (en-CN)
 
 
17
  1. Comparaison globale avec les modeles de reference
18
  2. Ablation : acoustique seule vs semantique seule vs fusion
19
  3. Comparaison d'architectures acoustiques a budget variable
20
+ 4. CPC : encodeur audio pre-entraine (self-supervised)
21
+ 5. Trois configurations d'entrainement (mixte / Smart Turn seul / AppTek seul)
22
+ 6. Experience de reequilibrage synthetique/reel
23
+ 7. Fichiers de resultats bruts
24
 
25
  ---
26
 
 
57
  | en-ZA | 84.56% | 83.84% | 90.54% | 57.71% | 67.48% | 76.62% |
58
  | **Moyenne** | **84.39%** | **83.61%** | **90.21%** | **60.86%** | **68.03%** | **76.02%** |
59
 
60
+ **Resultat cle** : ni l'acoustique seule ni la semantique seule n'atteignent la performance de la fusion complete β€” la cross-attention genere une synergie reelle.
 
 
61
 
62
  ---
63
 
64
  ## 3. Comparaison d'architectures acoustiques a budget de parametres variable
65
 
66
+ Config AppTek seul, 3 accents (en-CN, en-GB_WLS, en-IE), mode seul et mode fusion (avec Whisper gele).
67
 
68
+ ### Moyennes sur 3 accents β€” architectures from-scratch
69
 
70
  | Architecture | Budget (params) | Seul Test | Seul OOD | Fusion Test | Fusion OOD |
71
  |---|---|---|---|---|---|
 
80
 
81
  *Instabilite d'entrainement isolee sur en-CN a 4x, affectant la moyenne.
82
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
83
  **Resultats cles** :
84
  - A budget egal (~460K), BiGRU domine en mode seul, mais ECAPA-TDNN reprend l'avantage en mode fusion.
85
+ - Conformer beneficie d'un budget accru jusqu'a ~900K parametres (2x), avec un gain marque vs 1x.
86
+ - Au-dela de 2x, Conformer ne progresse plus de facon monotone (possible surapprentissage sur ~17K exemples train).
87
+ - En mode fusion, la performance reste stable a travers tous les budgets (77-78%).
88
 
89
  ---
90
 
91
+ ## 4. CPC : encodeur audio pre-entraine (self-supervised)
92
+
93
+ Contrairement aux architectures precedentes (entrainees from-scratch), CPC (Contrastive Predictive Coding, Riviere et al. 2020) est un encodeur **pre-entraine** sur de la parole brute en self-supervised, sans supervision texte. Checkpoint officiel FAIR charge et **entierement gele** β€” seule une tete de classification legere (mode seul) ou le module de fusion (mode fusion) sont entraines.
94
+
95
+ **Architecture reelle du checkpoint utilise** : 1 843 456 parametres au total (encodeur convolutif + GRU contextuel, sortie 256-dim) β€” note : ce chiffre differe de certaines estimations plus elevees (~5.8M) parfois citees pour cette famille de modeles ; il correspond aux poids du checkpoint officiel effectivement charge et verifie.
96
+
97
+ | Accent | Seul Test | Seul OOD | Fusion Test | Fusion OOD |
98
+ |---|---|---|---|---|
99
+ | en-CN | 64.31% | 53.42% | 80.64% | 74.96% |
100
+ | en-GB_WLS | 62.69% | 57.61% | 79.91% | 77.56% |
101
+ | en-IE | 62.40% | 66.95% | 79.15% | 85.70% |
102
+ | **Moyenne** | **63.13%** | **59.33%** | **79.90%** | **79.41%** |
103
+
104
+ ### Comparaison finale β€” toutes architectures, mode fusion, moyennes sur 3 accents
105
+
106
+ | Architecture | Params (encodeur) | Fusion Test | Fusion OOD |
107
+ |---|---|---|---|
108
+ | BiGRU (1x, from scratch) | 461K | 75.70% | 74.48% |
109
+ | Conformer (1x, from scratch) | 430K | 77.95% | 75.93% |
110
+ | ECAPA-TDNN (1x, from scratch) | 462K | 78.97% | 78.21% |
111
+ | Conformer (2x, from scratch) | 904K | 78.32% | 77.78% |
112
+ | **CPC (pre-entraine, gele)** | **1.84M** | **79.90%** | **79.41%** |
113
+
114
+ **Resultat cle** : CPC (pre-entraine, gele, jamais affine sur la tache) obtient le **meilleur score en mode fusion**, devant toutes les architectures from-scratch testees β€” suggerant que son pre-entrainement self-supervised capture deja des informations acoustiques/prosodiques pertinentes, complementaires a la semantique de Whisper. En mode seul cependant, CPC reste modeste (63.13% test, 59.33% OOD), moins bon que BiGRU ou Conformer entraines specifiquement β€” le gain de CPC provient donc presque entierement de la fusion, pas de sa capacite de classification isolee.
115
+
116
+ ---
117
 
118
+ ## 5. Trois configurations d'entrainement (Phase 1 et Phase 2, 14 accents)
 
 
119
 
120
  | Configuration | P1 Test | P1 OOD | P2 Test | P2 OOD |
121
  |---|---|---|---|---|
 
123
  | **Mixte** (94% ST / 6% AppTek) | 84.39% | 60.86% | 90.21% | 76.02% |
124
  | **AppTek seul** (0% ST) | 64.42% | 56.59% | 78.79% | **77.58%** |
125
 
126
+ *Pour Smart Turn seul, "OOD" = AppTek test (jamais vu a l'entrainement).
127
 
128
+ **Resultat le plus marquant** : Phase 2 (AppTek seul) obtient le meilleur score OOD moyen parmi ces 3 configurations, malgre 16x moins de donnees et l'absence de synthetique.
129
 
130
+ ### Tableau complet β€” Mixte, 14 accents, avec baselines figees
131
 
132
  | Accent OOD | ST v3.2 AppTek | ST v3.2 OOD | LiveKit AppTek | LiveKit OOD | P1 AppTek | P1 OOD | P2 AppTek | P2 OOD |
133
  |---|---|---|---|---|---|---|---|---|
 
147
  | en-ZA | 64.84% | 66.57% | 68.42% | 65.71% | 65.50% | 57.71% | 78.29% | 76.62% |
148
  | **Moyenne** | **64.23%** | **64.35%** | **68.29%** | **68.51%** | **66.01%** | **60.86%** | **79.34%** | **76.02%** |
149
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
150
  ---
151
 
152
+ ## 6. Experience de reequilibrage synthetique/reel (OOD=en-CN)
153
 
154
  | Configuration | P1 Test | P1 OOD | P2 Test | P2 OOD |
155
  |---|---|---|---|---|
 
157
  | Oversample (65%/35%, reptete) | 84.50% | 59.78% | 90.10% | 70.19% |
158
  | **Undersample (50%/50%, vrai)** | **60.93%** | **54.69%** | **87.47%** | **71.70%** |
159
 
160
+ **Resultat cle** : Phase 1 s'effondre severement sous undersample (-23.96 points), Phase 2 resiste beaucoup mieux (-3.01 points).
161
 
162
  ---
163
 
164
  ## Resultats cles globaux (synthese)
165
 
166
  1. La fusion (Phase 2) genere une vraie synergie β€” ni l'acoustique seule ni la semantique seule ne l'egalent.
167
+ 2. **CPC (pre-entraine, gele) surpasse toutes les architectures from-scratch en mode fusion**, malgre l'absence totale de fine-tuning sur la tache β€” le pre-entrainement self-supervised sur audio brut semble capturer une information acoustique/prosodique complementaire particulierement utile.
168
+ 3. Phase 2 (AppTek seul) atteint la meilleure generalisation OOD absolue parmi les configurations de donnees testees.
169
+ 4. Le choix d'architecture acoustique optimal depend du contexte (seule vs fusionnee) et du budget de parametres.
170
+ 5. La chute de performance OOD est systematique a travers tous les accents et modeles testes.
171
 
172
  ## Chargement
173
 
 
183
  - `results-whisperfrozen-mixte-{accent}.json` β€” ablation Whisper-frozen-head
184
  - `arch-comparison-{arch}-{accent}.json`, `arch2x-comparison-{arch}-{accent}.json` β€” architectures, budgets 1x/2x
185
  - `archscale-comparison-conformer-{3x,4x}-{accent}.json` β€” Conformer, budgets 3x/4x
186
+ - `cpc-comparison-{accent}.json` β€” CPC pre-entraine gele
187
  - `architecture-comparison-consolidated.json` β€” consolide 1x/2x
188
  - `decomposition-test-all-accents.json`, `results-smartturn-only-v4.json`, `smartturn-only-apptek-test-by-accent.json`
189
+ - `baselines-smartturn-livekit-all-accents.json`
190
 
191
  ## Limites connues
192
 
 
194
  - Couverture AppTek limitee a l'anglais (14 accents)
195
  - Comparaison d'architectures effectuee sur 3 accents seulement, pour limiter le temps de calcul
196
  - Instabilite d'entrainement observee pour Conformer a budget 4x sur un accent (en-CN)
197
+ - CPC evalue avec un seul checkpoint pre-entraine (LibriSpeech, anglais), sans fine-tuning