Upload README.md with huggingface_hub
Browse files
README.md
CHANGED
|
@@ -10,7 +10,7 @@ license: mit
|
|
| 10 |
|
| 11 |
# Turn-Taking Detection Models β Collection complete v4
|
| 12 |
|
| 13 |
-
Modeles de detection de fin de tour (HOLD/SHIFT), architecture causale, entraines sur Smart Turn v3.2 (synthetique) et/ou
|
| 14 |
|
| 15 |
## Comparaison globale β 4 modeles, test officiel Smart Turn v3.2
|
| 16 |
|
|
@@ -21,17 +21,51 @@ Modeles de detection de fin de tour (HOLD/SHIFT), architecture causale, entraine
|
|
| 21 |
| **Phase 1 (notre, from scratch)** | **462K** | **87.36-87.93%** | **0.9439-0.9483** | Selon config, Whisper gele |
|
| 22 |
| **Phase 2 (notre, fusion)** | **~360K (+8M geles)** | **92.06-92.60%** | **0.9744-0.9776** | Meilleure architecture |
|
| 23 |
|
| 24 |
-
##
|
| 25 |
|
| 26 |
-
|
| 27 |
-
|
| 28 |
-
|
| 29 |
-
- **Validation** : melange vrai et aleatoire (1% Smart Turn + 10% AppTek pour le mixte ; 1% Smart Turn seul pour l'autre config), jamais confondue avec le test
|
| 30 |
-
- **Test** : Smart Turn v3.2 test (officiel) + AppTek test (20% du pool des 13 accents restants, pour la config mixte)
|
| 31 |
-
- **OOD** : un accent AppTek totalement exclu, teste a tour de role sur les 14 accents
|
| 32 |
-
- **Smart Turn v3.2 et LiveKit v1-mini** : modeles figes (jamais reentraines), evalues sur les MEMES splits AppTek test/OOD que nos modeles
|
| 33 |
|
| 34 |
-
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 35 |
|
| 36 |
| Accent OOD | ST v3.2 AppTek | ST v3.2 OOD | LiveKit AppTek | LiveKit OOD | P1 AppTek | P1 OOD | P2 AppTek | P2 OOD |
|
| 37 |
|---|---|---|---|---|---|---|---|---|
|
|
@@ -71,17 +105,15 @@ Modeles de detection de fin de tour (HOLD/SHIFT), architecture causale, entraine
|
|
| 71 |
| en-ZA | 56.38% | 65.50% | 65.67% | 78.29% |
|
| 72 |
| **Moyenne** | **55.85%** | **66.01%** | **65.77%** | **79.34%** |
|
| 73 |
|
| 74 |
-
**Resultat cle** : l'exposition a 13 accents pendant l'entrainement ameliore massivement la performance sur AppTek test, meme en dehors du cadre OOD strict β Phase 1 gagne +10.16 points, Phase 2 gagne +13.57 points par rapport a un entrainement Smart Turn seul (0% AppTek). Ce resultat, complementaire a celui obtenu sur l'OOD (accent totalement exclu), confirme deux fois la meme conclusion : la simple exposition a des donnees reelles diverses pendant l'entrainement transforme la capacite de generalisation vers l'audio reel, independamment de l'accent specifique teste.
|
| 75 |
-
|
| 76 |
## Resultats cles globaux
|
| 77 |
|
| 78 |
-
1. **Phase 2
|
| 79 |
|
| 80 |
-
2. **
|
| 81 |
|
| 82 |
-
3. **L'exposition multi-accent (13 accents differents) ameliore systematiquement la generalisation**,
|
| 83 |
|
| 84 |
-
4. **La
|
| 85 |
|
| 86 |
## Experience de reequilibrage synthetique/reel (OOD=en-CN)
|
| 87 |
|
|
@@ -91,21 +123,20 @@ Modeles de detection de fin de tour (HOLD/SHIFT), architecture causale, entraine
|
|
| 91 |
| Oversample (65%/35%, reptete) | 84.50% | 59.78% | 90.10% | 70.19% |
|
| 92 |
| **Undersample (50%/50%, vrai)** | **60.93%** | **54.69%** | **87.47%** | **71.70%** |
|
| 93 |
|
| 94 |
-
**Resultat cle** : Phase 1 s'effondre severement sous undersample (-23.96 points), Phase 2 resiste beaucoup mieux (-3.01 points), demontrant l'efficacite d'apprentissage superieure des representations pre-entrainees face a la rarete des donnees reelles.
|
| 95 |
-
|
| 96 |
## Fichiers de resultats bruts (JSON)
|
| 97 |
|
| 98 |
-
- `results-ood-{accent}.json` β
|
| 99 |
-
- `
|
| 100 |
-
- `
|
| 101 |
-
- `smartturn-only-
|
| 102 |
-
- `
|
|
|
|
| 103 |
|
| 104 |
## Chargement
|
| 105 |
|
| 106 |
```python
|
| 107 |
import torch
|
| 108 |
-
ckpt = torch.load("phase2-whisper-crossattn-v4-ood-en-AU-light.pt", map_location="cpu")
|
| 109 |
model.load_state_dict(ckpt['best_state'])
|
| 110 |
```
|
| 111 |
|
|
@@ -113,4 +144,4 @@ model.load_state_dict(ckpt['best_state'])
|
|
| 113 |
|
| 114 |
- LiveKit v1-mini limite a 1.2s de contexte audio (vs 8s pour les autres modeles)
|
| 115 |
- Couverture AppTek limitee a l'anglais (14 accents)
|
| 116 |
-
-
|
|
|
|
| 10 |
|
| 11 |
# Turn-Taking Detection Models β Collection complete v4
|
| 12 |
|
| 13 |
+
Modeles de detection de fin de tour (HOLD/SHIFT), architecture causale, entraines sur Smart Turn v3.2 (synthetique) et/ou AppTek (audio reel de centre d'appel, 14 accents anglophones), selon trois configurations d'entrainement distinctes.
|
| 14 |
|
| 15 |
## Comparaison globale β 4 modeles, test officiel Smart Turn v3.2
|
| 16 |
|
|
|
|
| 21 |
| **Phase 1 (notre, from scratch)** | **462K** | **87.36-87.93%** | **0.9439-0.9483** | Selon config, Whisper gele |
|
| 22 |
| **Phase 2 (notre, fusion)** | **~360K (+8M geles)** | **92.06-92.60%** | **0.9744-0.9776** | Meilleure architecture |
|
| 23 |
|
| 24 |
+
## Trois configurations d'entrainement testees
|
| 25 |
|
| 26 |
+
1. **Mixte** : Smart Turn v3.2 train (94%) + AppTek train 13 accents (6%)
|
| 27 |
+
2. **Smart Turn seul** : uniquement Smart Turn v3.2 train (0% AppTek)
|
| 28 |
+
3. **AppTek seul** : uniquement AppTek train 13 accents (0% Smart Turn)
|
|
|
|
|
|
|
|
|
|
|
|
|
| 29 |
|
| 30 |
+
Pour chaque configuration, un accent AppTek est exclu a tour de role (14 accents testes), servant de test OOD strict.
|
| 31 |
+
|
| 32 |
+
## Tableau comparatif final β moyennes sur 14 accents, les 3 configurations
|
| 33 |
+
|
| 34 |
+
| Configuration | P1 Test | P1 OOD | P2 Test | P2 OOD |
|
| 35 |
+
|---|---|---|---|---|
|
| 36 |
+
| Smart Turn seul (0% AppTek) | 87.55% | 55.85%* | 92.31% | 65.77%* |
|
| 37 |
+
| **Mixte** (94% ST / 6% AppTek) | 84.39% | 60.86% | 90.21% | 76.02% |
|
| 38 |
+
| **AppTek seul** (0% ST) | 64.42% | 56.59% | 78.79% | **77.58%** |
|
| 39 |
+
|
| 40 |
+
*Pour Smart Turn seul, "OOD" = AppTek test (jamais vu a l'entrainement), pas un accent totalement exclu au sens strict (puisqu'aucun accent AppTek n'a jamais ete vu).
|
| 41 |
+
|
| 42 |
+
## Resultat cle le plus marquant
|
| 43 |
+
|
| 44 |
+
**Phase 2 (AppTek seul) obtient le meilleur score OOD moyen de toutes les configurations testees (77.58%)**, legerement superieur meme au mixte (76.02%), malgre un volume d'entrainement 16x plus faible (~17K vs 270K+ exemples) et l'absence totale de donnees synthetiques. Ceci suggere que la diversite d'accents reels compte davantage que le volume total d'entrainement, a condition que la representation semantique pre-entrainee (Whisper) compense le manque de donnees.
|
| 45 |
+
|
| 46 |
+
## Tableau complet β AppTek seul (0% Smart Turn), 14 accents
|
| 47 |
+
|
| 48 |
+
| Accent | P1 Test | P1 OOD | P1 ST bonus | P2 Test | P2 OOD | P2 ST bonus |
|
| 49 |
+
|---|---|---|---|---|---|---|
|
| 50 |
+
| en-AU | 64.41% | 54.66% | 52.22% | 77.83% | 83.56% | 66.80% |
|
| 51 |
+
| en-CA | 65.16% | 57.99% | 51.54% | 77.51% | 78.05% | 65.09% |
|
| 52 |
+
| en-CN | 65.50% | 51.03% | 52.08% | 79.61% | 72.26% | 70.42% |
|
| 53 |
+
| en-GB | 65.10% | 57.71% | 51.94% | 78.43% | 73.62% | 69.89% |
|
| 54 |
+
| en-GB_SCT | 65.08% | 56.37% | 52.51% | 78.01% | 73.43% | 66.92% |
|
| 55 |
+
| en-GB_WLS | 63.88% | 58.82% | 51.77% | 78.10% | 76.98% | 70.72% |
|
| 56 |
+
| en-IE | 63.98% | 56.44% | 52.15% | 78.28% | 84.14% | 68.00% |
|
| 57 |
+
| en-IN | 63.93% | 55.96% | 51.64% | 79.83% | 68.73% | 70.43% |
|
| 58 |
+
| en-MX | 63.77% | 59.40% | 51.46% | 78.86% | 76.61% | 69.07% |
|
| 59 |
+
| en-SG | 63.73% | 57.43% | 52.08% | 79.35% | 76.02% | 69.70% |
|
| 60 |
+
| en-US_Aave | 63.95% | 54.18% | 51.89% | 79.81% | 76.06% | 68.73% |
|
| 61 |
+
| en-US_General | 65.09% | 56.26% | 51.66% | 78.87% | 79.69% | 72.11% |
|
| 62 |
+
| en-US_Southern | 63.36% | 59.99% | 51.27% | 79.38% | 78.64% | 73.29% |
|
| 63 |
+
| en-ZA | 64.91% | 55.95% | 52.05% | 79.33% | 78.38% | 72.10% |
|
| 64 |
+
| **Moyenne** | **64.42%** | **56.59%** | **51.87%** | **78.79%** | **77.58%** | **69.52%** |
|
| 65 |
+
|
| 66 |
+
**Note sur "ST bonus"** : evaluation sur le test set officiel Smart Turn v3.2, jamais vu a l'entrainement dans cette configuration β mesure la capacite (limitee) de generalisation vers l'audio synthetique quand le modele n'a vu que de l'audio reel.
|
| 67 |
+
|
| 68 |
+
## Tableau complet β Mixte, 14 accents (AppTek test / OOD)
|
| 69 |
|
| 70 |
| Accent OOD | ST v3.2 AppTek | ST v3.2 OOD | LiveKit AppTek | LiveKit OOD | P1 AppTek | P1 OOD | P2 AppTek | P2 OOD |
|
| 71 |
|---|---|---|---|---|---|---|---|---|
|
|
|
|
| 105 |
| en-ZA | 56.38% | 65.50% | 65.67% | 78.29% |
|
| 106 |
| **Moyenne** | **55.85%** | **66.01%** | **65.77%** | **79.34%** |
|
| 107 |
|
|
|
|
|
|
|
| 108 |
## Resultats cles globaux
|
| 109 |
|
| 110 |
+
1. **Phase 2 (AppTek seul) atteint la meilleure generalisation OOD absolue (77.58%)**, meme sans donnee synthetique et avec 16x moins de donnees totales β la diversite des accents reels et la representation semantique Whisper compensent largement le volume.
|
| 111 |
|
| 112 |
+
2. **Phase 1 (from scratch) est tres sensible au volume et a la nature des donnees** β s'effondre presque au niveau du hasard en config "AppTek seul" sur audio synthetique (51.87%), et generalise nettement moins bien que Phase 2 dans toutes les configurations.
|
| 113 |
|
| 114 |
+
3. **L'exposition multi-accent (13 accents differents) ameliore systematiquement la generalisation**, observe deux fois independamment (via OOD et via decomposition AppTek test).
|
| 115 |
|
| 116 |
+
4. **La configuration mixte reste la plus equilibree** β bon compromis entre performance sur donnees synthetiques (90%+) et generalisation reelle (76% OOD), sans sacrifier aucune des deux dimensions.
|
| 117 |
|
| 118 |
## Experience de reequilibrage synthetique/reel (OOD=en-CN)
|
| 119 |
|
|
|
|
| 123 |
| Oversample (65%/35%, reptete) | 84.50% | 59.78% | 90.10% | 70.19% |
|
| 124 |
| **Undersample (50%/50%, vrai)** | **60.93%** | **54.69%** | **87.47%** | **71.70%** |
|
| 125 |
|
|
|
|
|
|
|
| 126 |
## Fichiers de resultats bruts (JSON)
|
| 127 |
|
| 128 |
+
- `results-ood-{accent}.json` β Phase1/Phase2, config mixte (14 fichiers)
|
| 129 |
+
- `results-apptekonly-{accent}.json` β Phase1/Phase2, config AppTek seul (14 fichiers)
|
| 130 |
+
- `decomposition-test-all-accents.json` β decomposition test ST/AppTek, config mixte
|
| 131 |
+
- `results-smartturn-only-v4.json` β Phase1/Phase2, config Smart Turn seul
|
| 132 |
+
- `smartturn-only-apptek-test-by-accent.json` β Smart Turn seul, evalue sur AppTek test par accent
|
| 133 |
+
- `baselines-smartturn-livekit-all-accents.json` β Smart Turn v3.2 et LiveKit v1-mini, memes splits
|
| 134 |
|
| 135 |
## Chargement
|
| 136 |
|
| 137 |
```python
|
| 138 |
import torch
|
| 139 |
+
ckpt = torch.load("phase2-whisper-crossattn-apptekonly-v4-ood-en-AU-light.pt", map_location="cpu")
|
| 140 |
model.load_state_dict(ckpt['best_state'])
|
| 141 |
```
|
| 142 |
|
|
|
|
| 144 |
|
| 145 |
- LiveKit v1-mini limite a 1.2s de contexte audio (vs 8s pour les autres modeles)
|
| 146 |
- Couverture AppTek limitee a l'anglais (14 accents)
|
| 147 |
+
- La config "AppTek seul" utilise un Phase 1 (extracteur acoustique) entraine sur peu de donnees ; la qualite de la fusion dans Phase 2 pourrait s'appuyer davantage sur Whisper que sur l'acoustique dans cette configuration specifique
|