01Yassine's picture
Add results README
e4171bd verified
|
Raw
History Blame Contribute Delete
4.39 kB
---
license: apache-2.0
tags:
- audio
- deepfake-detection
- anti-spoofing
- lora
- qwen
- whisper
- wav2vec
- opensmile
language:
- en
---
# AudioLLM-Deepfake-Detection — Results Hub
Best-run checkpoints, evaluation CSVs/JSONs, and aggregated metrics for the **DeepFense AudioLLM Deepfake Detection** project.
**Hub repo:** [01Yassine/AudioLLM-Deepfake-Detection](https://huggingface.co/models/01Yassine/AudioLLM-Deepfake-Detection)
## Contents (~283 GB)
| Folder | Description | Size |
|--------|-------------|------|
| `Suite/` | Baseline Whisper/Wav2Vec + Qwen (LoRA α=16/64/128/256, NoLoRA) | ~82 GB |
| `OpenSmile/` | OpenSmile **before** stage | ~54 GB |
| `OpenSmile-After/` | OpenSmile **after** stage (best overall) | ~62 GB |
| `EAT/` | EAT encoder experiments | ~27 GB |
| `Weighted/` | Layer-weighted fusion | ~59 GB |
| `DAC-6-Lora-Qwen0.5B/` | DAC tokenizer baseline | ~8 MB |
| `SpeechTokenizer-4-Lora-Qwen0.5B/` | SpeechTokenizer baseline | ~18 MB |
| `Qwen-Omni-3B-lora-full/` | Qwen2.5-Omni end-to-end | ~422 MB |
| `Qwen-Omni-3B-lora-opensmile/` | Qwen2.5-Omni + OpenSmile | ~462 MB |
Each run folder includes: `best_run_meta.json`, per-dataset eval CSVs, metrics JSON (with EER), and checkpoints (`lora_best/`, `checkpoint_best.pt`, etc.).
## Aggregated metrics (machine-readable)
| File | Description |
|------|-------------|
| `all_results_table.json` | Full nested table (89 runs): Macro F1, Accuracy, EER |
| `all_results_table.csv` | Flat CSV for spreadsheets / LaTeX |
| `all_results_table.md` | Markdown tables by experiment family |
## Best overall model
**OpenSmile-After / Lora-256 / unfrozen / Whisper / Qwen-0.5B / α=256**
- Avg Macro F1: **94.42%**
- Avg Accuracy: **95.11%**
- Avg EER: **5.36%**
- Path: `OpenSmile-After/Lora-256/unfrozen/whisper/Qwen-0.5B/`
---
# Results Summary (local documentation)
Unified table of **best runs** across all experiment families.
## Metrics
| Metric | Description |
|--------|-------------|
| **Macro F1** | Unweighted average of Fake-class and Real-class F1 (equal weight per class) |
| **Accuracy** | Fraction of correct predictions |
| **EER** | Equal Error Rate from `score_fake` vs ground truth (lower is better); from metrics JSON when available |
## Datasets
- **asv19_test** — ASVspoof 2019 LA eval
- **itw** — In-The-Wild
- **la21** — ASVspoof 2021 LA eval
- **mlaad_en** — MLAAD English
Averages (`avg_*`) are computed over evaluated datasets for each run (typically 4/4).
## Experiment Families
| Family | Description |
|--------|-------------|
| **Suite** | Baseline Whisper/Wav2Vec + Qwen LLM (LoRA α=16/64/128/256, frozen/unfrozen, NoLoRA) |
| **OpenSmile** | OpenSmile features injected **before** LLM (stage 1) |
| **OpenSmile-After** | OpenSmile features injected **after** audio encoder (stage 2) |
| **EAT** | EAT audio encoder + Qwen |
| **Weighted** | Layer-weighted fusion of Whisper/Wav2Vec representations |
| **DAC-6-Lora-Qwen0.5B** | DAC tokenizer (6 codebooks) + Qwen-0.5B LoRA |
| **SpeechTokenizer-4-Lora-Qwen0.5B** | SpeechTokenizer + Qwen-0.5B LoRA |
| **Qwen-Omni-3B-lora-full** | Qwen2.5-Omni-3B end-to-end LoRA |
| **Qwen-Omni-3B-lora-opensmile** | Qwen2.5-Omni-3B LoRA + OpenSmile |
## Best Overall Models
### Highest average Macro F1
- **OpenSmile-After / Lora-256 / unfrozen / whisper / Qwen-0.5B / α=256****94.42%** macro F1, 95.11% accuracy, 5.36% EER
- Path: `results/OpenSmile-After/Lora-256/unfrozen/whisper/Qwen-0.5B`
### Lowest average EER
- **OpenSmile-After / Lora-256 / unfrozen / whisper / Qwen-0.5B / α=256****5.36%** EER, 94.42% macro F1, 95.11% accuracy
- Path: `results/OpenSmile-After/Lora-256/unfrozen/whisper/Qwen-0.5B`
## Files
| File | Format | Use |
|------|--------|-----|
| `all_results_table.json` | Nested JSON | Machine-readable; full per-dataset breakdown |
| `all_results_table.csv` | Flat CSV | Spreadsheet / LaTeX table generation |
| `all_results_table.md` | Markdown tables | Human-readable, grouped by family |
## Notes
- Some runs borrow missing eval splits (documented in JSON `notes` / `borrowed_or_approximate`).
- OpenSmile **before** stage: LoRA α=16 and Lora-128 only for Qwen-0.5B; NoLoRA all sizes.
- OpenSmile **after** stage: full LoRA α sweep (0.5B) + α=16 for 3B/7B.
- EER requires score columns in eval CSV; if metrics JSON missing, EER computed from CSV.