yaitsaid commited on
Commit
bad990c
Β·
verified Β·
1 Parent(s): 9604527

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +56 -25
README.md CHANGED
@@ -10,7 +10,7 @@ license: mit
10
 
11
  # Turn-Taking Detection Models β€” Collection complete v4
12
 
13
- Modeles de detection de fin de tour (HOLD/SHIFT), architecture causale, entraines sur Smart Turn v3.2 (synthetique) et/ou un melange avec AppTek (audio reel de centre d'appel, 14 accents anglophones).
14
 
15
  ## Comparaison globale β€” 4 modeles, test officiel Smart Turn v3.2
16
 
@@ -21,17 +21,51 @@ Modeles de detection de fin de tour (HOLD/SHIFT), architecture causale, entraine
21
  | **Phase 1 (notre, from scratch)** | **462K** | **87.36-87.93%** | **0.9439-0.9483** | Selon config, Whisper gele |
22
  | **Phase 2 (notre, fusion)** | **~360K (+8M geles)** | **92.06-92.60%** | **0.9744-0.9776** | Meilleure architecture |
23
 
24
- ## Protocole d'evaluation v4
25
 
26
- - **Cache unique** : Smart Turn v3.2 et AppTek (14 accents) extraits UNE SEULE FOIS, reutilise pour tous les accents testes
27
- - **Train (mixte)** : Smart Turn v3.2 train + AppTek train (13 accents restants, equilibre HOLD/SHIFT)
28
- - **Train (Smart Turn seul)** : uniquement Smart Turn v3.2 train, aucune donnee AppTek
29
- - **Validation** : melange vrai et aleatoire (1% Smart Turn + 10% AppTek pour le mixte ; 1% Smart Turn seul pour l'autre config), jamais confondue avec le test
30
- - **Test** : Smart Turn v3.2 test (officiel) + AppTek test (20% du pool des 13 accents restants, pour la config mixte)
31
- - **OOD** : un accent AppTek totalement exclu, teste a tour de role sur les 14 accents
32
- - **Smart Turn v3.2 et LiveKit v1-mini** : modeles figes (jamais reentraines), evalues sur les MEMES splits AppTek test/OOD que nos modeles
33
 
34
- ## Tableau complet β€” 4 modeles x 14 accents (AppTek test / OOD), config mixte
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
35
 
36
  | Accent OOD | ST v3.2 AppTek | ST v3.2 OOD | LiveKit AppTek | LiveKit OOD | P1 AppTek | P1 OOD | P2 AppTek | P2 OOD |
37
  |---|---|---|---|---|---|---|---|---|
@@ -71,17 +105,15 @@ Modeles de detection de fin de tour (HOLD/SHIFT), architecture causale, entraine
71
  | en-ZA | 56.38% | 65.50% | 65.67% | 78.29% |
72
  | **Moyenne** | **55.85%** | **66.01%** | **65.77%** | **79.34%** |
73
 
74
- **Resultat cle** : l'exposition a 13 accents pendant l'entrainement ameliore massivement la performance sur AppTek test, meme en dehors du cadre OOD strict β€” Phase 1 gagne +10.16 points, Phase 2 gagne +13.57 points par rapport a un entrainement Smart Turn seul (0% AppTek). Ce resultat, complementaire a celui obtenu sur l'OOD (accent totalement exclu), confirme deux fois la meme conclusion : la simple exposition a des donnees reelles diverses pendant l'entrainement transforme la capacite de generalisation vers l'audio reel, independamment de l'accent specifique teste.
75
-
76
  ## Resultats cles globaux
77
 
78
- 1. **Phase 2 domine massivement sur toutes les conditions testees** β€” +11 a +15 points par rapport a Phase 1 sur AppTek/OOD, et +11 a +12 points par rapport a LiveKit v1-mini (le meilleur modele de reference sur ces conditions difficiles).
79
 
80
- 2. **LiveKit v1-mini generalise mieux que Smart Turn v3.2 sur audio reel** (68.29% vs 64.23% en moyenne sur AppTek), malgre un score bien plus faible sur le test synthetique officiel (61.02% vs 73.33%).
81
 
82
- 3. **L'exposition multi-accent (13 accents differents) ameliore systematiquement la generalisation**, que ce soit mesure sur AppTek test ou sur l'accent OOD strict β€” un effet robuste, observe deux fois independamment.
83
 
84
- 4. **La chute de performance OOD est systematique et de magnitude comparable a travers les accents testes**, peu importe le modele β€” confirme que la difficulte provient du passage synthetique-vers-reel en general, pas d'un accent specifique.
85
 
86
  ## Experience de reequilibrage synthetique/reel (OOD=en-CN)
87
 
@@ -91,21 +123,20 @@ Modeles de detection de fin de tour (HOLD/SHIFT), architecture causale, entraine
91
  | Oversample (65%/35%, reptete) | 84.50% | 59.78% | 90.10% | 70.19% |
92
  | **Undersample (50%/50%, vrai)** | **60.93%** | **54.69%** | **87.47%** | **71.70%** |
93
 
94
- **Resultat cle** : Phase 1 s'effondre severement sous undersample (-23.96 points), Phase 2 resiste beaucoup mieux (-3.01 points), demontrant l'efficacite d'apprentissage superieure des representations pre-entrainees face a la rarete des donnees reelles.
95
-
96
  ## Fichiers de resultats bruts (JSON)
97
 
98
- - `results-ood-{accent}.json` β€” resultats Phase1/Phase2 par accent, config mixte (14 fichiers)
99
- - `decomposition-test-all-accents.json` β€” decomposition test ST/AppTek par accent, config mixte
100
- - `results-smartturn-only-v4.json` β€” Phase1/Phase2 sur Smart Turn seul, test officiel + OOD par accent
101
- - `smartturn-only-apptek-test-by-accent.json` β€” Phase1/Phase2 Smart Turn seul, evalues sur AppTek test par accent
102
- - `baselines-smartturn-livekit-all-accents.json` β€” Smart Turn v3.2 et LiveKit v1-mini, memes splits que nos modeles
 
103
 
104
  ## Chargement
105
 
106
  ```python
107
  import torch
108
- ckpt = torch.load("phase2-whisper-crossattn-v4-ood-en-AU-light.pt", map_location="cpu")
109
  model.load_state_dict(ckpt['best_state'])
110
  ```
111
 
@@ -113,4 +144,4 @@ model.load_state_dict(ckpt['best_state'])
113
 
114
  - LiveKit v1-mini limite a 1.2s de contexte audio (vs 8s pour les autres modeles)
115
  - Couverture AppTek limitee a l'anglais (14 accents)
116
- - Smart Turn v3.2 et LiveKit sont evalues comme modeles figes (poids officiels, non re-entraines)
 
10
 
11
  # Turn-Taking Detection Models β€” Collection complete v4
12
 
13
+ Modeles de detection de fin de tour (HOLD/SHIFT), architecture causale, entraines sur Smart Turn v3.2 (synthetique) et/ou AppTek (audio reel de centre d'appel, 14 accents anglophones), selon trois configurations d'entrainement distinctes.
14
 
15
  ## Comparaison globale β€” 4 modeles, test officiel Smart Turn v3.2
16
 
 
21
  | **Phase 1 (notre, from scratch)** | **462K** | **87.36-87.93%** | **0.9439-0.9483** | Selon config, Whisper gele |
22
  | **Phase 2 (notre, fusion)** | **~360K (+8M geles)** | **92.06-92.60%** | **0.9744-0.9776** | Meilleure architecture |
23
 
24
+ ## Trois configurations d'entrainement testees
25
 
26
+ 1. **Mixte** : Smart Turn v3.2 train (94%) + AppTek train 13 accents (6%)
27
+ 2. **Smart Turn seul** : uniquement Smart Turn v3.2 train (0% AppTek)
28
+ 3. **AppTek seul** : uniquement AppTek train 13 accents (0% Smart Turn)
 
 
 
 
29
 
30
+ Pour chaque configuration, un accent AppTek est exclu a tour de role (14 accents testes), servant de test OOD strict.
31
+
32
+ ## Tableau comparatif final β€” moyennes sur 14 accents, les 3 configurations
33
+
34
+ | Configuration | P1 Test | P1 OOD | P2 Test | P2 OOD |
35
+ |---|---|---|---|---|
36
+ | Smart Turn seul (0% AppTek) | 87.55% | 55.85%* | 92.31% | 65.77%* |
37
+ | **Mixte** (94% ST / 6% AppTek) | 84.39% | 60.86% | 90.21% | 76.02% |
38
+ | **AppTek seul** (0% ST) | 64.42% | 56.59% | 78.79% | **77.58%** |
39
+
40
+ *Pour Smart Turn seul, "OOD" = AppTek test (jamais vu a l'entrainement), pas un accent totalement exclu au sens strict (puisqu'aucun accent AppTek n'a jamais ete vu).
41
+
42
+ ## Resultat cle le plus marquant
43
+
44
+ **Phase 2 (AppTek seul) obtient le meilleur score OOD moyen de toutes les configurations testees (77.58%)**, legerement superieur meme au mixte (76.02%), malgre un volume d'entrainement 16x plus faible (~17K vs 270K+ exemples) et l'absence totale de donnees synthetiques. Ceci suggere que la diversite d'accents reels compte davantage que le volume total d'entrainement, a condition que la representation semantique pre-entrainee (Whisper) compense le manque de donnees.
45
+
46
+ ## Tableau complet β€” AppTek seul (0% Smart Turn), 14 accents
47
+
48
+ | Accent | P1 Test | P1 OOD | P1 ST bonus | P2 Test | P2 OOD | P2 ST bonus |
49
+ |---|---|---|---|---|---|---|
50
+ | en-AU | 64.41% | 54.66% | 52.22% | 77.83% | 83.56% | 66.80% |
51
+ | en-CA | 65.16% | 57.99% | 51.54% | 77.51% | 78.05% | 65.09% |
52
+ | en-CN | 65.50% | 51.03% | 52.08% | 79.61% | 72.26% | 70.42% |
53
+ | en-GB | 65.10% | 57.71% | 51.94% | 78.43% | 73.62% | 69.89% |
54
+ | en-GB_SCT | 65.08% | 56.37% | 52.51% | 78.01% | 73.43% | 66.92% |
55
+ | en-GB_WLS | 63.88% | 58.82% | 51.77% | 78.10% | 76.98% | 70.72% |
56
+ | en-IE | 63.98% | 56.44% | 52.15% | 78.28% | 84.14% | 68.00% |
57
+ | en-IN | 63.93% | 55.96% | 51.64% | 79.83% | 68.73% | 70.43% |
58
+ | en-MX | 63.77% | 59.40% | 51.46% | 78.86% | 76.61% | 69.07% |
59
+ | en-SG | 63.73% | 57.43% | 52.08% | 79.35% | 76.02% | 69.70% |
60
+ | en-US_Aave | 63.95% | 54.18% | 51.89% | 79.81% | 76.06% | 68.73% |
61
+ | en-US_General | 65.09% | 56.26% | 51.66% | 78.87% | 79.69% | 72.11% |
62
+ | en-US_Southern | 63.36% | 59.99% | 51.27% | 79.38% | 78.64% | 73.29% |
63
+ | en-ZA | 64.91% | 55.95% | 52.05% | 79.33% | 78.38% | 72.10% |
64
+ | **Moyenne** | **64.42%** | **56.59%** | **51.87%** | **78.79%** | **77.58%** | **69.52%** |
65
+
66
+ **Note sur "ST bonus"** : evaluation sur le test set officiel Smart Turn v3.2, jamais vu a l'entrainement dans cette configuration β€” mesure la capacite (limitee) de generalisation vers l'audio synthetique quand le modele n'a vu que de l'audio reel.
67
+
68
+ ## Tableau complet β€” Mixte, 14 accents (AppTek test / OOD)
69
 
70
  | Accent OOD | ST v3.2 AppTek | ST v3.2 OOD | LiveKit AppTek | LiveKit OOD | P1 AppTek | P1 OOD | P2 AppTek | P2 OOD |
71
  |---|---|---|---|---|---|---|---|---|
 
105
  | en-ZA | 56.38% | 65.50% | 65.67% | 78.29% |
106
  | **Moyenne** | **55.85%** | **66.01%** | **65.77%** | **79.34%** |
107
 
 
 
108
  ## Resultats cles globaux
109
 
110
+ 1. **Phase 2 (AppTek seul) atteint la meilleure generalisation OOD absolue (77.58%)**, meme sans donnee synthetique et avec 16x moins de donnees totales β€” la diversite des accents reels et la representation semantique Whisper compensent largement le volume.
111
 
112
+ 2. **Phase 1 (from scratch) est tres sensible au volume et a la nature des donnees** β€” s'effondre presque au niveau du hasard en config "AppTek seul" sur audio synthetique (51.87%), et generalise nettement moins bien que Phase 2 dans toutes les configurations.
113
 
114
+ 3. **L'exposition multi-accent (13 accents differents) ameliore systematiquement la generalisation**, observe deux fois independamment (via OOD et via decomposition AppTek test).
115
 
116
+ 4. **La configuration mixte reste la plus equilibree** β€” bon compromis entre performance sur donnees synthetiques (90%+) et generalisation reelle (76% OOD), sans sacrifier aucune des deux dimensions.
117
 
118
  ## Experience de reequilibrage synthetique/reel (OOD=en-CN)
119
 
 
123
  | Oversample (65%/35%, reptete) | 84.50% | 59.78% | 90.10% | 70.19% |
124
  | **Undersample (50%/50%, vrai)** | **60.93%** | **54.69%** | **87.47%** | **71.70%** |
125
 
 
 
126
  ## Fichiers de resultats bruts (JSON)
127
 
128
+ - `results-ood-{accent}.json` β€” Phase1/Phase2, config mixte (14 fichiers)
129
+ - `results-apptekonly-{accent}.json` β€” Phase1/Phase2, config AppTek seul (14 fichiers)
130
+ - `decomposition-test-all-accents.json` β€” decomposition test ST/AppTek, config mixte
131
+ - `results-smartturn-only-v4.json` β€” Phase1/Phase2, config Smart Turn seul
132
+ - `smartturn-only-apptek-test-by-accent.json` β€” Smart Turn seul, evalue sur AppTek test par accent
133
+ - `baselines-smartturn-livekit-all-accents.json` β€” Smart Turn v3.2 et LiveKit v1-mini, memes splits
134
 
135
  ## Chargement
136
 
137
  ```python
138
  import torch
139
+ ckpt = torch.load("phase2-whisper-crossattn-apptekonly-v4-ood-en-AU-light.pt", map_location="cpu")
140
  model.load_state_dict(ckpt['best_state'])
141
  ```
142
 
 
144
 
145
  - LiveKit v1-mini limite a 1.2s de contexte audio (vs 8s pour les autres modeles)
146
  - Couverture AppTek limitee a l'anglais (14 accents)
147
+ - La config "AppTek seul" utilise un Phase 1 (extracteur acoustique) entraine sur peu de donnees ; la qualite de la fusion dans Phase 2 pourrait s'appuyer davantage sur Whisper que sur l'acoustique dans cette configuration specifique