yaitsaid commited on
Commit
b3e3fdf
·
verified ·
1 Parent(s): e9e1272

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +102 -0
README.md CHANGED
@@ -483,3 +483,105 @@ $$6 \text{ sequences} \times 6 \text{ valeurs de K} \times 2 \text{ repetitions}
483
 
484
  **Interpretation pour la pratique** : ces resultats suggerent qu'il n'est pas necessaire de collecter des donnees pour un tres grand nombre d'accents differents pour obtenir une bonne generalisation — un socle de 7 a 10 accents diversifies semble suffire a capturer l'essentiel du benefice, avec des gains marginaux au-dela.
485
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
483
 
484
  **Interpretation pour la pratique** : ces resultats suggerent qu'il n'est pas necessaire de collecter des donnees pour un tres grand nombre d'accents differents pour obtenir une bonne generalisation — un socle de 7 a 10 accents diversifies semble suffire a capturer l'essentiel du benefice, avec des gains marginaux au-dela.
485
 
486
+
487
+ ---
488
+
489
+ ## 12. Curriculum de diversite d'accents (V3, protocole final rigoureux) — Leave-One-Out avec volume total fixe
490
+
491
+ ### Motivation et question de recherche
492
+
493
+ Les experiences precedentes de ce projet (sections 4-9) montrent systematiquement que l'exposition a des accents reels ameliore la generalisation OOD. Mais ces experiences confondaient deux effets distincts : le **volume total** de donnees et la **diversite** (nombre d'accents differents). Cette section isole specifiquement l'effet de la diversite, a volume total strictement constant, avec un design statistiquement rigoureux (repetitions multiples, tirage aleatoire, test de significativite formel).
494
+
495
+ ### Protocole et preparation des donnees
496
+
497
+ **Architecture testee** : Phase 1 (ECAPA-TDNN causal, 462K parametres) + Phase 2 (fusion Cross-Attention + TCN avec Whisper-tiny gele), l'architecture de reference du projet. Phase 1 est entrainee comme etape intermediaire (necessaire pour extraire les features acoustiques utilisees par Phase 2) mais ses metriques ne sont pas rapportees : des experiences preliminaires ont montre qu'elle reste proche du hasard (accuracy ~50%, AUC ~0.50) sur l'OOD quelle que soit la diversite d'entrainement, confirmant qu'elle ne beneficie pas de la diversite sans la composante semantique.
498
+
499
+ **Design "Leave-One-Out" (LOO)** : pour chaque accent cible (les 14 accents AppTek testes individuellement, comme dans le reste du projet), cet accent est totalement exclu de l'entrainement et sert uniquement de test OOD.
500
+
501
+ **Volume total AppTek fixe** : la contrainte cle de ce protocole. Le nombre total d'exemples AppTek dans le train est fixe a **1258 exemples** (628 par classe HOLD/SHIFT), une valeur determinee par la taille du plus petit accent disponible (en-CN, qui ne fournit que 629 exemples equilibres par classe). Ce volume total est **reparti egalement entre les K accents inclus** : a K=1, l'unique accent fournit ses 1258 exemples ; a K=13, chacun des 13 accents restants (hors l'accent OOD) ne fournit qu'environ 97 exemples. Le volume de Smart Turn synthetique est sous-echantillonne pour egaler exactement le volume AppTek a chaque fois (ratio 50/50 constant).
502
+
503
+ **Tirage aleatoire des accents inclus** : contrairement aux versions preliminaires du protocole (qui suivaient un ordre fixe), les K accents inclus a chaque run sont tires **aleatoirement** parmi les 13 accents non-OOD, independamment a chaque repetition. Ceci evite de confondre "effet de diversite" avec "effet de tel accent precis inclus a telle etape".
504
+
505
+ **Valeurs de K testees** : 1, 3, 6, 9, 13 (espacees pour couvrir le debut, le milieu et la fin de la plage possible, avec un budget de calcul maitrise).
506
+
507
+ **Repetitions** : 6 repetitions independantes par (accent OOD, K), avec tirage aleatoire different a chaque fois et reinitialisation complete du modele — permet un test de significativite statistique formel.
508
+
509
+ **Volume total de l'experience** : 14 accents x 5 valeurs de K x 6 repetitions = **420 runs** independants, chacun avec 15 epochs d'entrainement pour Phase 1 puis pour Phase 2.
510
+
511
+ **Metriques enregistrees** : pour chaque run, accuracy, F1-macro, ROC-AUC et matrice de confusion, a la fois sur le test combine (in-distribution : Smart Turn test officiel + AppTek test des accents inclus) et sur l'accent OOD exclu.
512
+
513
+ ### Resultats — vue d'ensemble par accent et par K
514
+
515
+ **Test combine (in-distribution), accuracy moyenne sur 6 repetitions**
516
+
517
+ | Accent | K=1 | K=3 | K=6 | K=9 | K=13 |
518
+ |---|---|---|---|---|---|
519
+ | en-AU | 73.67% | 77.04% | 75.04% | 73.03% | 73.62% |
520
+ | en-CA | 77.22% | 75.98% | 76.83% | 73.66% | 74.51% |
521
+ | en-CN | 79.96% | 75.44% | 73.53% | 73.48% | 77.36% |
522
+ | en-GB | 81.03% | 75.89% | 75.85% | 73.48% | 75.31% |
523
+ | en-GB_SCT | 76.24% | 73.23% | 73.71% | 72.94% | 73.89% |
524
+ | en-GB_WLS | 73.85% | 76.06% | 75.67% | 75.00% | 74.69% |
525
+ | en-IE | 76.33% | 74.56% | 73.80% | 72.85% | 74.96% |
526
+ | en-IN | 78.10% | 74.91% | 76.74% | 76.97% | 75.49% |
527
+ | en-MX | 78.10% | 74.73% | 75.40% | 73.92% | 76.56% |
528
+ | en-SG | 78.19% | 76.42% | 75.31% | 77.24% | 70.77% |
529
+ | en-US_Aave | 76.68% | 76.68% | 74.24% | 72.67% | 75.76% |
530
+ | en-US_General | 78.99% | 78.10% | 75.13% | 75.45% | 76.83% |
531
+ | en-US_Southern | 77.13% | 78.63% | 74.60% | 75.45% | 74.42% |
532
+ | en-ZA | 75.62% | 73.49% | 74.96% | 74.01% | 73.62% |
533
+
534
+ **OOD (accent exclu), accuracy moyenne sur 6 repetitions**
535
+
536
+ | Accent | K=1 | K=3 | K=6 | K=9 | K=13 |
537
+ |---|---|---|---|---|---|
538
+ | en-AU | 77.49% | 79.96% | 79.56% | 79.60% | 79.65% |
539
+ | en-CA | 71.99% | 76.51% | 77.07% | 76.54% | 76.27% |
540
+ | en-CN | 69.33% | 68.81% | 70.18% | 68.67% | 69.97% |
541
+ | en-GB | 70.17% | 70.46% | 71.32% | 71.95% | 73.01% |
542
+ | en-GB_SCT | 68.11% | 69.68% | 70.79% | 69.04% | 69.43% |
543
+ | en-GB_WLS | 69.54% | 74.38% | 73.70% | 74.15% | 74.13% |
544
+ | en-IE | 81.31% | 81.04% | 81.58% | 81.70% | 80.45% |
545
+ | en-IN | 68.02% | 68.26% | 69.65% | 68.44% | 69.58% |
546
+ | en-MX | 72.28% | 71.79% | 73.60% | 73.10% | 74.10% |
547
+ | en-SG | 73.61% | 73.46% | 75.55% | 75.34% | 73.63% |
548
+ | en-US_Aave | 70.26% | 72.05% | 71.95% | 73.14% | 72.62% |
549
+ | en-US_General | 76.25% | 76.20% | 76.71% | 77.31% | 77.20% |
550
+ | en-US_Southern | 74.03% | 74.96% | 74.83% | 76.51% | 76.05% |
551
+ | en-ZA | 72.24% | 71.78% | 73.87% | 74.98% | 74.03% |
552
+
553
+ ### Tests statistiques formels (K=1 vs K=13)
554
+
555
+ Test t apparie par accent (le plus rigoureux, controlant pour la difficulte intrinseque de chaque accent) :
556
+
557
+ | Metrique | Difference moyenne (K=13 - K=1) | Statistique t | p-value | Conclusion |
558
+ |---|---|---|---|---|
559
+ | **OOD accuracy** | **+1.82 points** | t=4.639 | **p=0.000463** | Effet significatif : la diversite ameliore la generalisation |
560
+ | **Test combine accuracy** | **-2.38 points** | t=-4.267 | **p=0.000918** | Effet significatif : la diversite degrade la performance in-distribution |
561
+
562
+ ### Detail par accent — significativite individuelle (OOD, K=1 vs K=13)
563
+
564
+ | Accent | Diff OOD (K13-K1) | p-value | Significatif |
565
+ |---|---|---|---|
566
+ | en-GB_WLS | +4.58 | 0.0059 | *** |
567
+ | en-GB | +2.83 | 0.0451 | * |
568
+ | en-MX | +1.82 | 0.0243 | * |
569
+ | en-ZA | +1.79 | 0.0330 | * |
570
+ | en-CA | +4.28 | 0.1414 | (tendance forte, non significative) |
571
+ | en-AU | +2.16 | 0.0947 | (tendance, non significative) |
572
+ | en-CN | +0.64 | 0.5430 | non |
573
+ | en-SG | +0.02 | 0.9840 | non |
574
+ | en-IE | -0.86 | 0.3237 | non (legere baisse) |
575
+
576
+ ### Resultats cles et interpretation
577
+
578
+ **1. Un veritable compromis diversite/specialisation, statistiquement prouve dans les deux sens.** A volume total fixe, augmenter le nombre d'accents inclus dans l'entrainement ameliore la generalisation vers un accent totalement inconnu (+1.82 points OOD, p<0.001), mais degrade simultanement la performance sur les donnees directement vues (-2.38 points en test combine, p<0.001). Ce resultat n'aurait pas ete visible en ne regardant que l'OOD seul, comme dans les versions preliminaires de ce protocole.
579
+
580
+ **2. Explication mecanique.** A volume total constant, chaque accent supplementaire dilue le nombre d'exemples disponibles par accent (de 1258 exemples a K=1, a environ 97 exemples par accent a K=13). Le modele apprend donc moins precisement chaque accent individuel (d'ou la baisse en test combine), mais cette exposition a davantage de variations differentes semble l'encourager a extraire des caracteristiques acoustiques/semantiques plus generales et transferables (d'ou le gain OOD).
581
+
582
+ **3. Effet fortement heterogene selon l'accent.** Seuls 4 accents sur 14 montrent un gain OOD individuellement significatif (en-GB_WLS, en-GB, en-MX, en-ZA), avec en-GB_WLS montrant l'effet le plus marque (+4.58 points, p=0.006). A l'inverse, en-CN et en-SG ne montrent presque aucun gain, et en-IE (deja tres bien generalise a K=1, 81.31%) montre une legere baisse non significative. Ceci suggere que le benefice de la diversite depend de la position de depart : les accents "intermediaires" en beneficient le plus, tandis que les accents deja faciles (en-IE) ou structurellement difficiles (en-CN, en-IN, autour de 68-70% quel que soit K) beneficient peu ou pas de la diversite accrue.
583
+
584
+ **4. Coherence entre metriques.** Le F1-macro et le ROC-AUC suivent globalement la meme tendance que l'accuracy pour l'OOD (leger gain avec K), confirmant que le signal observe n'est pas un artefact d'une seule metrique.
585
+
586
+ **Implication pratique** : le choix du nombre d'accents a inclure dans l'entrainement, a volume de donnees fixe, depend de l'objectif vise. Pour maximiser la performance sur un ensemble d'accents connus et deja representes, un entrainement plus specialise (moins d'accents, plus d'exemples chacun) est preferable. Pour maximiser la robustesse a des accents totalement inconnus en production, favoriser la diversite (plus d'accents, moins d'exemples chacun) apporte un gain reel, bien que modeste et concentre sur certains types d'accents.
587
+