WideCodec / README.md
huseinzolkepliscicom's picture
README: remove GitHub links (code closed-source; inference bundled in repo)
b9a66b4 verified
|
Raw
History Blame Contribute Delete
49 kB
---
license: apache-2.0
library_name: neucodec
pipeline_tag: audio-to-audio
tags:
- neural-audio-codec
- neucodec
- widecodec
- 44100hz
- decoder-finetune
- speech
---
# WideCodec β€” 44.1 kHz decoder (scaled NeuCodec depth-20 finetune)
**A SOTA 0.8 kbps, 44.1 kHz audio tokenizer.**
**WideCodec** is a **44.1 kHz decoder finetune** of [`neuphonic/neucodec`](https://huggingface.co/neuphonic/neucodec).
Only the **decoder** (Vocos backbone + ISTFT head, transformer **depth 20**) is trained to
reconstruct **44.1 kHz** audio. The **16 kHz acoustic/semantic encoders and the ResidualFSQ
codebook are frozen and completely unchanged** β€” the discrete codes are identical to base
NeuCodec, so this model is a drop-in higher-fidelity decoder.
- **Sample rate:** 44 100 Hz Β· **hop:** 882 Β· **50 tokens/sec**
- **Trainable:** decoder only (GAN: multi-period + spec discriminators; losses: multi-res mel + STFT + feature-matching + adversarial)
- **Frozen:** w2v-BERT semantic encoder, acoustic `CodecEnc`, `fc_prior`/`fc_post_a`, FSQ codebook
## Inference (self-contained)
Everything needed to run inference is **in this repo** β€” the `neucodec/` package and
`infer_widecodec.py`. No other source code required.
```bash
pip install torch transformers huggingface_hub local-attention einops librosa soundfile
huggingface-cli login # if this repo is private (or export HF_TOKEN=hf_...)
huggingface-cli download Scicom-intl/WideCodec --local-dir WideCodec
cd WideCodec
python infer_widecodec.py --input my.wav --out-dir out # one file
python infer_widecodec.py --input folder/ --out-dir out # a directory
```
Or load it directly in Python:
```python
import sys; sys.path.insert(0, "WideCodec") # the downloaded repo dir
import torch, librosa
from neucodec import NeuCodec
model = NeuCodec._from_pretrained(model_id="Scicom-intl/WideCodec", decoder_depth=20).eval().cuda()
wav16, _ = librosa.load("my.wav", sr=16000, mono=True) # encoder ingests 16 kHz mono
x = torch.from_numpy(wav16).float().view(1, 1, -1).cuda()
with torch.no_grad():
codes = model.encode_code(x) # frozen FSQ codes β€” 0.8 kbps, 50 tok/s
wav44 = model.decode_code(codes) # 44.1 kHz reconstruction
```
## Files
| file | what |
|---|---|
| `pytorch_model.bin` | decoder weights for **inference** (load with `NeuCodec._from_pretrained(..., decoder_depth=20)`) |
| `last.ckpt` | full PyTorch-Lightning checkpoint **with optimizer states + LR schedulers** for **resuming training** |
## How WideCodec compares (44 kHz-class, by bitrate)
Offline benchmark on a **heavily multilingual 9,291-clip wideband set** (50 clips Γ— 188 clean β‰₯44.1 kHz datasets, **400+ language/dialect tags**),
faster-UTMOSv2 + spectral vs ground truth. **Read this by bitrate, not raw MOS** β€” these
codecs span a ~30Γ— bitrate range. DAC/NeMo/EnCodec are high-bitrate multi-codebook RVQ
*acoustic* codecs; WideCodec is a **single-codebook, 50-tokens/s** code at **~0.8 kbps** β€”
the only one here whose token stream an autoregressive LLM/TTS model can practically predict.
![bitrate vs UTMOSv2](bitrate_vs_utmosv2.png)
| codec | native SR | tokens/s | codebooks | ~bitrate | UTMOSv2 | mel-L1 ↓ | HFβ‰₯11k | rolloff |
|---|--:|--:|--:|--:|--:|--:|--:|--:|
| ground truth | β€” | β€” | β€” | β€” | 2.822 | β€” | 0.00244 | 8263 |
| nvidia nemo44k | 44.1k | ~86 | RVQ (many) | ~6–9 kbps | **2.903** | 0.379 | 0.00196 | 8372 |
| **WideCodec (ours, gs-2.0M)** | 44.1k | **50** | **1** | **~0.8 kbps** | **2.788** | 0.571 | 0.00223 | 9011 |
| dac | 44.1k | 86 | 9 | ~8 kbps | 2.672 | **0.341** | 0.00156 | 8185 |
| snac44k | 44.1k | multi-scale | 3–4 | ~2.6 kbps | 2.340 | 0.493 | 0.00158 | 8402 |
| encodec48k | 48k | 150 | RVQ | 24 kbps | 2.042 | 0.458 | 0.00169 | 8800 |
**Bitrate = frame-rate Γ— Ξ£ logβ‚‚(codebook size).** WideCodec's FSQ is `levels=[4]Γ—8,
num_quantizers=1` β†’ 8Β·logβ‚‚4 = **16 bits/frame** Γ— 50 frames/s = **800 bps = 0.8 kbps**
(vs DAC's 9 codebooks Γ— 10 bits Γ— 86 fps β‰ˆ 8 kbps).
The **WideCodec row is the final gs-2.0M checkpoint** (9,291-clip set). At ~0.8 kbps / 1 codebook it **beats DAC on naturalness** (UTMOSv2 2.79 vs 2.67) using ~10x fewer bits, and lands within ~0.12 of NeMo's ~6-9 kbps RVQ. It carries genuine high-band content (rolloff 9.0 kHz; HF energy ~91% of ground truth), and genuine high-band content (reference-based LSD-HF 0.96, on par with the 8-kbps RVQ codecs), trading in-band fidelity for a ~10x bitrate advantage. (PESQ/SI-SDR are excluded β€” they structurally penalize a low-bitrate generative decoder regardless of naturalness.) Full report:
evaluation/REPORT_44k_class_codecs.md.
## Training stages / which revision to pull
This model is trained in two stages. `main` always points at the **latest** stage.
| stage | data | how to load |
|---|---|---|
| **Stage 1 β€” noisy mix** (steps 0β†’1.58M, `epoch=9-step=1580000`) | 8 base corpora + `scale44k` (~6,500 h, mostly noisy crowdsourced/podcast) | pin revision **`d2c612f4319c1c1e0c65a9431a7d6db1b7955ce0`** |
| **Stage 2 β€” clean finetune** (from 1.58M, clean β‰₯44.1 kHz only; in progress) | TTS-Clean44k + Clean-Podcast + clean-teacher pool + EARS/Expresso | `main` (default) |
```python
# the `neucodec/` package is bundled in this repo (see 'Inference (self-contained)')
from neucodec import NeuCodec
# Stage 1 (first-stage noisy training) β€” pin the exact revision:
model = NeuCodec._from_pretrained(
model_id="Scicom-intl/WideCodec",
decoder_depth=20,
revision="d2c612f4319c1c1e0c65a9431a7d6db1b7955ce0",
)
```
## Training data
Diverse, predominantly high-sample-rate human speech (no synthetic TTS). The **scale-up group is
SR-verified β‰₯ 44 kHz** (probed before inclusion); the base corpora are long-form conversational,
expressive and anechoic speech. Two groups:
### Base corpora (Malaysia-AI + expressive/anechoic speech)
| dataset | content |
|---|---|
| [`malaysia-ai/malaysian-podcast-youtube`](https://huggingface.co/datasets/malaysia-ai/malaysian-podcast-youtube) | Malay long-form conversational podcasts (~2,234 h) |
| [`malaysia-ai/singaporean-podcast-youtube`](https://huggingface.co/datasets/malaysia-ai/singaporean-podcast-youtube) | Singaporean English podcasts (~1,255 h) |
| [`malaysia-ai/Multilingual-TTS`](https://huggingface.co/datasets/malaysia-ai/Multilingual-TTS) | CommonVoice-sidon multilingual short clips |
| [`malaysia-ai/malaysian-cartoons-youtube`](https://huggingface.co/datasets/malaysia-ai/malaysian-cartoons-youtube) | 48 kHz cartoon dialogue (subset) |
| [`malaysia-ai/malaysian-movie-youtube`](https://huggingface.co/datasets/malaysia-ai/malaysian-movie-youtube) | 48 kHz Malay movie dialogue |
| [`ylacombe/expresso`](https://huggingface.co/datasets/ylacombe/expresso) | 48 kHz expressive read speech |
| [`nytopop/expresso-conversational`](https://huggingface.co/datasets/nytopop/expresso-conversational) | 48 kHz improvised dialogue |
| EARS | 48 kHz anechoic fullband (emotional / conversational / reading) |
### Scale-up: 336 verified β‰₯ 44 kHz datasets
To maximise acoustic diversity for the decoder (language-agnostic β€” the codebook is frozen),
training is scaled with **336 additional datasets** (162 at 48 kHz, 174 at 44.1 kHz), mirrored as
`<name>*audio.zip` in [`malaysia-ai/Multilingual-TTS`](https://huggingface.co/datasets/malaysia-ai/Multilingual-TTS)
and SR-verified β‰₯ 44 kHz. Original sources:
<details>
<summary>Full list of 336 β‰₯ 44 kHz source datasets</summary>
- [`1rsh/gujarati-f-openslr`](https://huggingface.co/datasets/1rsh/gujarati-f-openslr) β€” 48000 Hz
- [`Aashish17405/audio-dataset`](https://huggingface.co/datasets/Aashish17405/audio-dataset) β€” 48000 Hz
- [`Aashish17405/audio-dataset-300`](https://huggingface.co/datasets/Aashish17405/audio-dataset-300) β€” 48000 Hz
- [`Aashish17405/audio-dataset-shuffled-300`](https://huggingface.co/datasets/Aashish17405/audio-dataset-shuffled-300) β€” 48000 Hz
- [`Abdullah500/IndicTTS-Bengali`](https://huggingface.co/datasets/Abdullah500/IndicTTS-Bengali) β€” 48000 Hz
- [`Abdullah500/IndicTTS_BengaliOLD`](https://huggingface.co/datasets/Abdullah500/IndicTTS_BengaliOLD) β€” 48000 Hz
- [`adalat-ai/in22-legal`](https://huggingface.co/datasets/adalat-ai/in22-legal) β€” 48000 Hz
- [`ahmadafaneh/common-voice-18-arabic`](https://huggingface.co/datasets/ahmadafaneh/common-voice-18-arabic) β€” 48000 Hz
- [`AIDC-AI/CSEMOTIONS`](https://huggingface.co/datasets/AIDC-AI/CSEMOTIONS) β€” 48000 Hz
- [`AJosh/audio-dataset`](https://huggingface.co/datasets/AJosh/audio-dataset) β€” 48000 Hz
- [`alexantonov/chuvash_voice`](https://huggingface.co/datasets/alexantonov/chuvash_voice) β€” 48000 Hz
- [`aliyzd95/common_voice_21_0_fa`](https://huggingface.co/datasets/aliyzd95/common_voice_21_0_fa) β€” 48000 Hz
- [`aliyzd95/common_voice_22_0_fa`](https://huggingface.co/datasets/aliyzd95/common_voice_22_0_fa) β€” 48000 Hz
- [`anian0707/hindi-tts-dataset`](https://huggingface.co/datasets/anian0707/hindi-tts-dataset) β€” 48000 Hz
- [`atlithor/talromur3_with_prompts`](https://huggingface.co/datasets/atlithor/talromur3_with_prompts) β€” 48000 Hz
- [`atlithor/talromur3_without_emotions`](https://huggingface.co/datasets/atlithor/talromur3_without_emotions) β€” 48000 Hz
- [`bilguun/cv-mn-24.0`](https://huggingface.co/datasets/bilguun/cv-mn-24.0) β€” 48000 Hz
- [`bookbot/slr72_dataset`](https://huggingface.co/datasets/bookbot/slr72_dataset) β€” 48000 Hz
- [`Chingkheinganba/IndicTTS_Manipuri`](https://huggingface.co/datasets/Chingkheinganba/IndicTTS_Manipuri) β€” 48000 Hz
- [`chuuhtetnaing/myanmar-speech-dataset-openslr-80`](https://huggingface.co/datasets/chuuhtetnaing/myanmar-speech-dataset-openslr-80) β€” 48000 Hz
- [`Cnam-LMSSC/vibravox_enhanced_by_EBEN`](https://huggingface.co/datasets/Cnam-LMSSC/vibravox_enhanced_by_EBEN) β€” 48000 Hz
- [`CraneAILabs/waxal-lug-clean`](https://huggingface.co/datasets/CraneAILabs/waxal-lug-clean) β€” 48000 Hz
- [`datahiveai/arabic-multidialect-emotional-speech-demo`](https://huggingface.co/datasets/datahiveai/arabic-multidialect-emotional-speech-demo) β€” 48000 Hz
- [`DatarrX/burmese-synthetic-speech-corpus`](https://huggingface.co/datasets/DatarrX/burmese-synthetic-speech-corpus) β€” 48000 Hz
- [`DDD-Cambodia/khm-asr-cultural`](https://huggingface.co/datasets/DDD-Cambodia/khm-asr-cultural) β€” 48000 Hz
- [`deepdml/igbo-dict`](https://huggingface.co/datasets/deepdml/igbo-dict) β€” 48000 Hz
- [`deepdml/igbo-dict-16khz`](https://huggingface.co/datasets/deepdml/igbo-dict-16khz) β€” 48000 Hz
- [`deepdml/igbo-dict-expansion`](https://huggingface.co/datasets/deepdml/igbo-dict-expansion) β€” 48000 Hz
- [`deepdml/igbo-dict-expansion-16khz`](https://huggingface.co/datasets/deepdml/igbo-dict-expansion-16khz) β€” 48000 Hz
- [`deepdml/openslr-32-hq-SA-languages`](https://huggingface.co/datasets/deepdml/openslr-32-hq-SA-languages) β€” 48000 Hz
- [`deepdml/openslr42-khmer-tts`](https://huggingface.co/datasets/deepdml/openslr42-khmer-tts) β€” 48000 Hz
- [`deepdml/openslr65-tamil`](https://huggingface.co/datasets/deepdml/openslr65-tamil) β€” 48000 Hz
- [`deepdml/openslr80-burmese`](https://huggingface.co/datasets/deepdml/openslr80-burmese) β€” 48000 Hz
- [`doof-ferb/fpt_fosd`](https://huggingface.co/datasets/doof-ferb/fpt_fosd) β€” 48000 Hz
- [`doof-ferb/infore1_25hours`](https://huggingface.co/datasets/doof-ferb/infore1_25hours) β€” 48000 Hz
- [`espnet/ace-kising-segments`](https://huggingface.co/datasets/espnet/ace-kising-segments) β€” 48000 Hz
- [`espnet/ace-opencpop-segments`](https://huggingface.co/datasets/espnet/ace-opencpop-segments) β€” 48000 Hz
- [`FatimahEmadEldin/alsanaa-emirati-arabic-asr`](https://huggingface.co/datasets/FatimahEmadEldin/alsanaa-emirati-arabic-asr) β€” 48000 Hz
- [`fluffypotatoes/f1-team-radio`](https://huggingface.co/datasets/fluffypotatoes/f1-team-radio) β€” 48000 Hz
- [`fosters/lagodny-tsmok-iury-zhygamont-output_original`](https://huggingface.co/datasets/fosters/lagodny-tsmok-iury-zhygamont-output_original) β€” 48000 Hz
- [`fosters/lagodny-tsmok-iury-zhygamont_all`](https://huggingface.co/datasets/fosters/lagodny-tsmok-iury-zhygamont_all) β€” 48000 Hz
- [`gauravparajuli/slr43`](https://huggingface.co/datasets/gauravparajuli/slr43) β€” 48000 Hz
- [`ggfox00000/stt-summre-fr-test`](https://huggingface.co/datasets/ggfox00000/stt-summre-fr-test) β€” 48000 Hz
- [`ggfox00000/stt-vibravox-fr-test`](https://huggingface.co/datasets/ggfox00000/stt-vibravox-fr-test) β€” 48000 Hz
- [`hanamizuki-ai/genshin-voice-v3.3-mandarin`](https://huggingface.co/datasets/hanamizuki-ai/genshin-voice-v3.3-mandarin) β€” 48000 Hz
- [`hanamizuki-ai/genshin-voice-v3.4-mandarin`](https://huggingface.co/datasets/hanamizuki-ai/genshin-voice-v3.4-mandarin) β€” 48000 Hz
- [`hanamizuki-ai/genshin-voice-v3.5-mandarin`](https://huggingface.co/datasets/hanamizuki-ai/genshin-voice-v3.5-mandarin) β€” 48000 Hz
- [`HeshamHaroon/arabic-msa-25k-saudi-male-tashkeel`](https://huggingface.co/datasets/HeshamHaroon/arabic-msa-25k-saudi-male-tashkeel) β€” 48000 Hz
- [`HeshamHaroon/Dahee7`](https://huggingface.co/datasets/HeshamHaroon/Dahee7) β€” 48000 Hz
- [`hezarai/common-voice-13-fa`](https://huggingface.co/datasets/hezarai/common-voice-13-fa) β€” 48000 Hz
- [`hosein-m/french_homophone_asr`](https://huggingface.co/datasets/hosein-m/french_homophone_asr) β€” 48000 Hz
- [`humyn-labs/Asian-High-Fidelity-ASR-Dataset`](https://huggingface.co/datasets/humyn-labs/Asian-High-Fidelity-ASR-Dataset) β€” 48000 Hz
- [`humyn-labs/LATAM-High-Fidelity-ASR`](https://huggingface.co/datasets/humyn-labs/LATAM-High-Fidelity-ASR) β€” 48000 Hz
- [`hypaai/Hypa-Speech-10k`](https://huggingface.co/datasets/hypaai/Hypa-Speech-10k) β€” 48000 Hz
- [`hypaai/Hypa_Fleurs`](https://huggingface.co/datasets/hypaai/Hypa_Fleurs) β€” 48000 Hz
- [`igidn/wuwa-voice-EN`](https://huggingface.co/datasets/igidn/wuwa-voice-EN) β€” 48000 Hz
- [`impriyanshu-garg00/IndicVoices-R_Hindi`](https://huggingface.co/datasets/impriyanshu-garg00/IndicVoices-R_Hindi) β€” 48000 Hz
- [`JacobLinCool/jl-speech`](https://huggingface.co/datasets/JacobLinCool/jl-speech) β€” 48000 Hz
- [`JeanKouss/ewe_bible_v2_tts`](https://huggingface.co/datasets/JeanKouss/ewe_bible_v2_tts) β€” 48000 Hz
- [`jspaulsen/vctk`](https://huggingface.co/datasets/jspaulsen/vctk) β€” 48000 Hz
- [`juanjucm/OpenHQ-SpeechT-GL-EN`](https://huggingface.co/datasets/juanjucm/OpenHQ-SpeechT-GL-EN) β€” 48000 Hz
- [`jzsues/genshin-voice-zh`](https://huggingface.co/datasets/jzsues/genshin-voice-zh) β€” 48000 Hz
- [`Kishor798/text_to_speech_dataset`](https://huggingface.co/datasets/Kishor798/text_to_speech_dataset) β€” 48000 Hz
- [`Kppwdfgu1/Hypa-Speech-10k`](https://huggingface.co/datasets/Kppwdfgu1/Hypa-Speech-10k) β€” 48000 Hz
- [`KrorngAI/fleurs_openslr42_mpwt`](https://huggingface.co/datasets/KrorngAI/fleurs_openslr42_mpwt) β€” 48000 Hz
- [`Kukedlc/openslr61-es-ar-full`](https://huggingface.co/datasets/Kukedlc/openslr61-es-ar-full) β€” 48000 Hz
- [`leduckhai/MultiMed`](https://huggingface.co/datasets/leduckhai/MultiMed) β€” 48000 Hz
- [`leduckhai/MultiMed-ST`](https://huggingface.co/datasets/leduckhai/MultiMed-ST) β€” 48000 Hz
- [`LeVy4/speech-to-text`](https://huggingface.co/datasets/LeVy4/speech-to-text) β€” 48000 Hz
- [`lilgoose777/nepali_speech_english_translation_shuffle_dataset`](https://huggingface.co/datasets/lilgoose777/nepali_speech_english_translation_shuffle_dataset) β€” 48000 Hz
- [`Lindarychwalski/pony-speech`](https://huggingface.co/datasets/Lindarychwalski/pony-speech) β€” 48000 Hz
- [`longhim99/khm-asr-cultural`](https://huggingface.co/datasets/longhim99/khm-asr-cultural) β€” 48000 Hz
- [`lyhourt-FSA/khm-asr-cultural`](https://huggingface.co/datasets/lyhourt-FSA/khm-asr-cultural) β€” 48000 Hz
- [`maikezu/dowis`](https://huggingface.co/datasets/maikezu/dowis) β€” 48000 Hz
- [`manassehzw/sna-manasseh-150-raw`](https://huggingface.co/datasets/manassehzw/sna-manasseh-150-raw) β€” 48000 Hz
- [`masuidrive/cv-corpus-17.0-zh-TW-client_id-grouped`](https://huggingface.co/datasets/masuidrive/cv-corpus-17.0-zh-TW-client_id-grouped) β€” 48000 Hz
- [`MatrixStudio/TTS-CCabNavMSC`](https://huggingface.co/datasets/MatrixStudio/TTS-CCabNavMSC) β€” 48000 Hz
- [`MatrixStudio/TTS-CFCabNavSC`](https://huggingface.co/datasets/MatrixStudio/TTS-CFCabNavSC) β€” 48000 Hz
- [`MatrixStudio/TTS-SCCusSerFSC`](https://huggingface.co/datasets/MatrixStudio/TTS-SCCusSerFSC) β€” 48000 Hz
- [`MatrixStudio/TTS-SCDuFSC`](https://huggingface.co/datasets/MatrixStudio/TTS-SCDuFSC) β€” 48000 Hz
- [`Max5ive/openslr-32-hq-SA-languages-Sesotho`](https://huggingface.co/datasets/Max5ive/openslr-32-hq-SA-languages-Sesotho) β€” 48000 Hz
- [`mazesmazes/jenny-mimi`](https://huggingface.co/datasets/mazesmazes/jenny-mimi) β€” 48000 Hz
- [`MikCil/f1-team-radio`](https://huggingface.co/datasets/MikCil/f1-team-radio) β€” 48000 Hz
- [`mohamedmou/DATASET-darija-ASR-clean`](https://huggingface.co/datasets/mohamedmou/DATASET-darija-ASR-clean) β€” 48000 Hz
- [`MohamedRashad/arabic-english-code-switching`](https://huggingface.co/datasets/MohamedRashad/arabic-english-code-switching) β€” 48000 Hz
- [`MohamedRashad/common-voice-18-arabic`](https://huggingface.co/datasets/MohamedRashad/common-voice-18-arabic) β€” 48000 Hz
- [`ngia/ASR_pulaar`](https://huggingface.co/datasets/ngia/ASR_pulaar) β€” 48000 Hz
- [`ntaquan0125/steinsgate-voice`](https://huggingface.co/datasets/ntaquan0125/steinsgate-voice) β€” 48000 Hz
- [`ntt123/VietBibleVox-aligned`](https://huggingface.co/datasets/ntt123/VietBibleVox-aligned) β€” 48000 Hz
- [`OmarAhmedSobhy/egyption-with-emotion-dataset`](https://huggingface.co/datasets/OmarAhmedSobhy/egyption-with-emotion-dataset) β€” 48000 Hz
- [`OmarAhmedSobhy/tts-egyption-dataset`](https://huggingface.co/datasets/OmarAhmedSobhy/tts-egyption-dataset) β€” 48000 Hz
- [`omersaidd/tts_ahmet_deniz_tur`](https://huggingface.co/datasets/omersaidd/tts_ahmet_deniz_tur) β€” 48000 Hz
- [`rahafvii/EGY2K`](https://huggingface.co/datasets/rahafvii/EGY2K) β€” 48000 Hz
- [`ranbirchabungbam/meiteimayek-audio-parallel-corpus`](https://huggingface.co/datasets/ranbirchabungbam/meiteimayek-audio-parallel-corpus) β€” 48000 Hz
- [`reapzor/neurologySTT`](https://huggingface.co/datasets/reapzor/neurologySTT) β€” 48000 Hz
- [`RikkaBotan/nyan-jenny-format`](https://huggingface.co/datasets/RikkaBotan/nyan-jenny-format) β€” 48000 Hz
- [`RobotsMali/transcription-scorer`](https://huggingface.co/datasets/RobotsMali/transcription-scorer) β€” 48000 Hz
- [`SachinTelecmi/tts-hindi-stts2`](https://huggingface.co/datasets/SachinTelecmi/tts-hindi-stts2) β€” 48000 Hz
- [`sartifyllc/Sukuma-Voices`](https://huggingface.co/datasets/sartifyllc/Sukuma-Voices) β€” 48000 Hz
- [`scriptaudio/f1-team-radio`](https://huggingface.co/datasets/scriptaudio/f1-team-radio) β€” 48000 Hz
- [`sdcsdccdsd/CSEMOTIONS`](https://huggingface.co/datasets/sdcsdccdsd/CSEMOTIONS) β€” 48000 Hz
- [`shoron08/irodori-refs-10k`](https://huggingface.co/datasets/shoron08/irodori-refs-10k) β€” 48000 Hz
- [`shreeshacharya/Dhravani`](https://huggingface.co/datasets/shreeshacharya/Dhravani) β€” 48000 Hz
- [`siddiqiya/ar-eg-dataset`](https://huggingface.co/datasets/siddiqiya/ar-eg-dataset) β€” 48000 Hz
- [`slprl/StressTest`](https://huggingface.co/datasets/slprl/StressTest) β€” 48000 Hz
- [`smcproject/MSC`](https://huggingface.co/datasets/smcproject/MSC) β€” 48000 Hz
- [`somu9/iisc_mono_hindi_female`](https://huggingface.co/datasets/somu9/iisc_mono_hindi_female) β€” 48000 Hz
- [`somu9/iitm_mono_hindi_female`](https://huggingface.co/datasets/somu9/iitm_mono_hindi_female) β€” 48000 Hz
- [`speech-uk/opentts-kateryna`](https://huggingface.co/datasets/speech-uk/opentts-kateryna) β€” 48000 Hz
- [`speech-uk/opentts-oleksa`](https://huggingface.co/datasets/speech-uk/opentts-oleksa) β€” 48000 Hz
- [`speech-uk/opentts-tetiana`](https://huggingface.co/datasets/speech-uk/opentts-tetiana) β€” 48000 Hz
- [`speech-uk/tts-crh-abibullah`](https://huggingface.co/datasets/speech-uk/tts-crh-abibullah) β€” 48000 Hz
- [`speech-uk/tts-crh-arslan`](https://huggingface.co/datasets/speech-uk/tts-crh-arslan) β€” 48000 Hz
- [`speech-uk/tts-crh-sevil`](https://huggingface.co/datasets/speech-uk/tts-crh-sevil) β€” 48000 Hz
- [`SPRINGLab/IndicTTS-Hindi`](https://huggingface.co/datasets/SPRINGLab/IndicTTS-Hindi) β€” 48000 Hz
- [`SPRINGLab/IndicTTS_Assamese`](https://huggingface.co/datasets/SPRINGLab/IndicTTS_Assamese) β€” 48000 Hz
- [`SPRINGLab/IndicTTS_Bengali`](https://huggingface.co/datasets/SPRINGLab/IndicTTS_Bengali) β€” 48000 Hz
- [`SPRINGLab/IndicTTS_Kannada`](https://huggingface.co/datasets/SPRINGLab/IndicTTS_Kannada) β€” 48000 Hz
- [`SPRINGLab/IndicTTS_Malayalam`](https://huggingface.co/datasets/SPRINGLab/IndicTTS_Malayalam) β€” 48000 Hz
- [`SPRINGLab/IndicTTS_Manipuri`](https://huggingface.co/datasets/SPRINGLab/IndicTTS_Manipuri) β€” 48000 Hz
- [`SPRINGLab/IndicTTS_Marathi`](https://huggingface.co/datasets/SPRINGLab/IndicTTS_Marathi) β€” 48000 Hz
- [`SPRINGLab/IndicTTS_Odia`](https://huggingface.co/datasets/SPRINGLab/IndicTTS_Odia) β€” 48000 Hz
- [`SPRINGLab/IndicTTS_Punjabi`](https://huggingface.co/datasets/SPRINGLab/IndicTTS_Punjabi) β€” 48000 Hz
- [`SPRINGLab/IndicTTS_Rajasthani`](https://huggingface.co/datasets/SPRINGLab/IndicTTS_Rajasthani) β€” 48000 Hz
- [`SPRINGLab/IndicTTS_Tamil`](https://huggingface.co/datasets/SPRINGLab/IndicTTS_Tamil) β€” 48000 Hz
- [`SPRINGLab/IndicVoices-R_Hindi`](https://huggingface.co/datasets/SPRINGLab/IndicVoices-R_Hindi) β€” 48000 Hz
- [`srezas/farsi_voice_dataset`](https://huggingface.co/datasets/srezas/farsi_voice_dataset) β€” 48000 Hz
- [`SynDataLab-JA-Refs/Irodori-Ja-Spk1-10k`](https://huggingface.co/datasets/SynDataLab-JA-Refs/Irodori-Ja-Spk1-10k) β€” 48000 Hz
- [`SynDataLab-JA-Refs/Irodori-Ja-Spk2-10k`](https://huggingface.co/datasets/SynDataLab-JA-Refs/Irodori-Ja-Spk2-10k) β€” 48000 Hz
- [`SynDataLab-JA-Refs/Irodori-Ja-Spk3-10k`](https://huggingface.co/datasets/SynDataLab-JA-Refs/Irodori-Ja-Spk3-10k) β€” 48000 Hz
- [`SynDataLab-JA-Refs/Irodori-Ja-Spk4-10k`](https://huggingface.co/datasets/SynDataLab-JA-Refs/Irodori-Ja-Spk4-10k) β€” 48000 Hz
- [`SynDataLab-JA-Refs/irodori-refs-10k`](https://huggingface.co/datasets/SynDataLab-JA-Refs/irodori-refs-10k) β€” 48000 Hz
- [`SynDataLab-JA-Refs/irodori-refs-10k-v2`](https://huggingface.co/datasets/SynDataLab-JA-Refs/irodori-refs-10k-v2) β€” 48000 Hz
- [`SynDataLab-JA-Refs/irodori-tts-refs-12k`](https://huggingface.co/datasets/SynDataLab-JA-Refs/irodori-tts-refs-12k) β€” 48000 Hz
- [`SynDataLab-JA/Irodori-Ja-500M-v2-vs-600M-v3-compare-20`](https://huggingface.co/datasets/SynDataLab-JA/Irodori-Ja-500M-v2-vs-600M-v3-compare-20) β€” 48000 Hz
- [`synthbot/pony-singing`](https://huggingface.co/datasets/synthbot/pony-singing) β€” 48000 Hz
- [`synthbot/pony-speech`](https://huggingface.co/datasets/synthbot/pony-speech) β€” 48000 Hz
- [`Tamazight-NLP/TOSD`](https://huggingface.co/datasets/Tamazight-NLP/TOSD) β€” 48000 Hz
- [`thennal/GMaSC`](https://huggingface.co/datasets/thennal/GMaSC) β€” 48000 Hz
- [`thennal/indic_tts_ml`](https://huggingface.co/datasets/thennal/indic_tts_ml) β€” 48000 Hz
- [`thennal/msc`](https://huggingface.co/datasets/thennal/msc) β€” 48000 Hz
- [`Trelis/multimed-hard`](https://huggingface.co/datasets/Trelis/multimed-hard) β€” 48000 Hz
- [`trysem/indicvoices_r-ML`](https://huggingface.co/datasets/trysem/indicvoices_r-ML) β€” 48000 Hz
- [`ttthe/MultiMed`](https://huggingface.co/datasets/ttthe/MultiMed) β€” 48000 Hz
- [`tunis-ai/arabic_speech_corpus`](https://huggingface.co/datasets/tunis-ai/arabic_speech_corpus) β€” 48000 Hz
- [`vinaybabu/voice_tech_for_all_challenge_samples_output`](https://huggingface.co/datasets/vinaybabu/voice_tech_for_all_challenge_samples_output) β€” 48000 Hz
- [`voice-biomarkers/openslr-32-hq-SA-languages-Afrikaans`](https://huggingface.co/datasets/voice-biomarkers/openslr-32-hq-SA-languages-Afrikaans) β€” 48000 Hz
- [`voice-biomarkers/openslr-32-hq-SA-languages-isiXhosa`](https://huggingface.co/datasets/voice-biomarkers/openslr-32-hq-SA-languages-isiXhosa) β€” 48000 Hz
- [`voice-biomarkers/openslr-32-hq-SA-languages-Sesotho`](https://huggingface.co/datasets/voice-biomarkers/openslr-32-hq-SA-languages-Sesotho) β€” 48000 Hz
- [`voice-biomarkers/openslr-32-hq-SA-languages-Setswana`](https://huggingface.co/datasets/voice-biomarkers/openslr-32-hq-SA-languages-Setswana) β€” 48000 Hz
- [`vrclc/openslr63`](https://huggingface.co/datasets/vrclc/openslr63) β€” 48000 Hz
- [`wanasash/enwaucymraeg`](https://huggingface.co/datasets/wanasash/enwaucymraeg) β€” 48000 Hz
- [`worldboss/ewe_bible_v2_tts`](https://huggingface.co/datasets/worldboss/ewe_bible_v2_tts) β€” 48000 Hz
- [`worldboss/twi_bible_v2_tts`](https://huggingface.co/datasets/worldboss/twi_bible_v2_tts) β€” 48000 Hz
- [`yasalma/tat_hackathon_asr`](https://huggingface.co/datasets/yasalma/tat_hackathon_asr) β€” 48000 Hz
- [`Yehor/qirimtatar-tts`](https://huggingface.co/datasets/Yehor/qirimtatar-tts) β€” 48000 Hz
- [`ylacombe/english_dialects`](https://huggingface.co/datasets/ylacombe/english_dialects) β€” 48000 Hz
- [`ylacombe/google-chilean-spanish`](https://huggingface.co/datasets/ylacombe/google-chilean-spanish) β€” 48000 Hz
- [`ylacombe/google-tamil`](https://huggingface.co/datasets/ylacombe/google-tamil) β€” 48000 Hz
- [`ymoslem/CoVoST2-EN-AR`](https://huggingface.co/datasets/ymoslem/CoVoST2-EN-AR) β€” 48000 Hz
- [`ymoslem/Living-Audio-Irish`](https://huggingface.co/datasets/ymoslem/Living-Audio-Irish) β€” 48000 Hz
- [`zinc75/Vibravox_dummy`](https://huggingface.co/datasets/zinc75/Vibravox_dummy) β€” 48000 Hz
- [`8Opt/clotho-dev-sample`](https://huggingface.co/datasets/8Opt/clotho-dev-sample) β€” 44100 Hz
- [`aangelakis/STOMA`](https://huggingface.co/datasets/aangelakis/STOMA) β€” 44100 Hz
- [`adiren7/darija_speech_to_text`](https://huggingface.co/datasets/adiren7/darija_speech_to_text) β€” 44100 Hz
- [`ahmed220v/SCC22`](https://huggingface.co/datasets/ahmed220v/SCC22) β€” 44100 Hz
- [`AigizK/bashkort_tts_dataset`](https://huggingface.co/datasets/AigizK/bashkort_tts_dataset) β€” 44100 Hz
- [`aipanjab/speech-mendeley-pa`](https://huggingface.co/datasets/aipanjab/speech-mendeley-pa) β€” 44100 Hz
- [`ALEKAS/ToneBooksPlus-Grigorii`](https://huggingface.co/datasets/ALEKAS/ToneBooksPlus-Grigorii) β€” 44100 Hz
- [`alimetin/turkish-parliament-speech`](https://huggingface.co/datasets/alimetin/turkish-parliament-speech) β€” 44100 Hz
- [`amine-khelif/DuBLaB-en-fr-0.7`](https://huggingface.co/datasets/amine-khelif/DuBLaB-en-fr-0.7) β€” 44100 Hz
- [`amine-khelif/DuBLaB-en-fr-0.7-f-0.2`](https://huggingface.co/datasets/amine-khelif/DuBLaB-en-fr-0.7-f-0.2) β€” 44100 Hz
- [`amine-khelif/DuBLaB-en-fr-0.7-f-0.5`](https://huggingface.co/datasets/amine-khelif/DuBLaB-en-fr-0.7-f-0.5) β€” 44100 Hz
- [`amine-khelif/DuBLaB-en-fr-0.8`](https://huggingface.co/datasets/amine-khelif/DuBLaB-en-fr-0.8) β€” 44100 Hz
- [`Anilosan15/YouTube_Video_Transkriptleri_TR`](https://huggingface.co/datasets/Anilosan15/YouTube_Video_Transkriptleri_TR) β€” 44100 Hz
- [`AnonXx/Pidgin_ASR_Dataset_Combined`](https://huggingface.co/datasets/AnonXx/Pidgin_ASR_Dataset_Combined) β€” 44100 Hz
- [`anzorq/kbd_speech`](https://huggingface.co/datasets/anzorq/kbd_speech) β€” 44100 Hz
- [`archivartaunik/Jevanhielle_Zyhamont_outChecked`](https://huggingface.co/datasets/archivartaunik/Jevanhielle_Zyhamont_outChecked) β€” 44100 Hz
- [`archivartaunik/output4Checked`](https://huggingface.co/datasets/archivartaunik/output4Checked) β€” 44100 Hz
- [`Bateesa/rw-tts-dataset`](https://huggingface.co/datasets/Bateesa/rw-tts-dataset) β€” 44100 Hz
- [`beratcmn/jessica-076`](https://huggingface.co/datasets/beratcmn/jessica-076) β€” 44100 Hz
- [`bezzam/coraal`](https://huggingface.co/datasets/bezzam/coraal) β€” 44100 Hz
- [`Bretagne/Lingua_Libre_br`](https://huggingface.co/datasets/Bretagne/Lingua_Libre_br) β€” 44100 Hz
- [`BrunoHays/Bangor-Miami-Spanish-English-Corpus`](https://huggingface.co/datasets/BrunoHays/Bangor-Miami-Spanish-English-Corpus) β€” 44100 Hz
- [`cagataydev/vlm-voice-audio`](https://huggingface.co/datasets/cagataydev/vlm-voice-audio) β€” 44100 Hz
- [`CentificAIResearch/DialectalSpeech-ICL`](https://huggingface.co/datasets/CentificAIResearch/DialectalSpeech-ICL) β€” 44100 Hz
- [`changelinglab/speechaccentarchive-pr`](https://huggingface.co/datasets/changelinglab/speechaccentarchive-pr) β€” 44100 Hz
- [`chris-t-jansen/erasmian_greek_nt`](https://huggingface.co/datasets/chris-t-jansen/erasmian_greek_nt) β€” 44100 Hz
- [`Codyfederer/fttrtest`](https://huggingface.co/datasets/Codyfederer/fttrtest) β€” 44100 Hz
- [`Codyfederer/test3434234`](https://huggingface.co/datasets/Codyfederer/test3434234) β€” 44100 Hz
- [`Codyfederer/tretret34543`](https://huggingface.co/datasets/Codyfederer/tretret34543) β€” 44100 Hz
- [`CoRal-project/coral-tts`](https://huggingface.co/datasets/CoRal-project/coral-tts) β€” 44100 Hz
- [`corti/med-term`](https://huggingface.co/datasets/corti/med-term) β€” 44100 Hz
- [`ctaguchi/killkan`](https://huggingface.co/datasets/ctaguchi/killkan) β€” 44100 Hz
- [`czyzi0/pwr-azon-speech-dataset`](https://huggingface.co/datasets/czyzi0/pwr-azon-speech-dataset) β€” 44100 Hz
- [`czyzi0/the-mc-speech-dataset`](https://huggingface.co/datasets/czyzi0/the-mc-speech-dataset) β€” 44100 Hz
- [`D00Movenok/russian-glados-portal2`](https://huggingface.co/datasets/D00Movenok/russian-glados-portal2) β€” 44100 Hz
- [`daanbrugmans/ovb-huissen-1`](https://huggingface.co/datasets/daanbrugmans/ovb-huissen-1) β€” 44100 Hz
- [`data-lab-voice/echo-tts-en-benchmarks-v1`](https://huggingface.co/datasets/data-lab-voice/echo-tts-en-benchmarks-v1) β€” 44100 Hz
- [`DataStudio/Vietnamese_ASR_TestingData_Old`](https://huggingface.co/datasets/DataStudio/Vietnamese_ASR_TestingData_Old) β€” 44100 Hz
- [`EMINES/Tamazight-Speech-to-Arabic-Text`](https://huggingface.co/datasets/EMINES/Tamazight-Speech-to-Arabic-Text) β€” 44100 Hz
- [`fablevi/one_voice_FACEBOOK_PARQUET`](https://huggingface.co/datasets/fablevi/one_voice_FACEBOOK_PARQUET) β€” 44100 Hz
- [`farbodbij/persian-words`](https://huggingface.co/datasets/farbodbij/persian-words) β€” 44100 Hz
- [`fiifinketia/twi-trigrams-speech-text-parallel`](https://huggingface.co/datasets/fiifinketia/twi-trigrams-speech-text-parallel) β€” 44100 Hz
- [`fosters/ales-krautsevich-karotkaia-gistoryia-belarusi-uladzimir-lisouski-output_original`](https://huggingface.co/datasets/fosters/ales-krautsevich-karotkaia-gistoryia-belarusi-uladzimir-lisouski-output_original) β€” 44100 Hz
- [`fosters/ales-krautsevich-karotkaia-gistoryia-belarusi-uladzimir-lisouski_all`](https://huggingface.co/datasets/fosters/ales-krautsevich-karotkaia-gistoryia-belarusi-uladzimir-lisouski_all) β€” 44100 Hz
- [`fosters/ales_razanau_all`](https://huggingface.co/datasets/fosters/ales_razanau_all) β€” 44100 Hz
- [`fosters/ales_razanau_output_original`](https://huggingface.co/datasets/fosters/ales_razanau_output_original) β€” 44100 Hz
- [`fosters/ales_zhuk_praklytaya_lyubow_all`](https://huggingface.co/datasets/fosters/ales_zhuk_praklytaya_lyubow_all) β€” 44100 Hz
- [`fosters/ales_zhuk_praklytaya_lyubow_output_original`](https://huggingface.co/datasets/fosters/ales_zhuk_praklytaya_lyubow_output_original) β€” 44100 Hz
- [`fosters/anatol_vyartsinski_pesnya_pra_hleb_all`](https://huggingface.co/datasets/fosters/anatol_vyartsinski_pesnya_pra_hleb_all) β€” 44100 Hz
- [`fosters/anatol_vyartsinski_pesnya_pra_hleb_output_original`](https://huggingface.co/datasets/fosters/anatol_vyartsinski_pesnya_pra_hleb_output_original) β€” 44100 Hz
- [`fosters/andre_marua_pakaranne_zolatam_all`](https://huggingface.co/datasets/fosters/andre_marua_pakaranne_zolatam_all) β€” 44100 Hz
- [`fosters/andre_marua_pakaranne_zolatam_output_original`](https://huggingface.co/datasets/fosters/andre_marua_pakaranne_zolatam_output_original) β€” 44100 Hz
- [`fosters/Antuan_de_Sent-Ekziupiery_Planieta_ludziei_all`](https://huggingface.co/datasets/fosters/Antuan_de_Sent-Ekziupiery_Planieta_ludziei_all) β€” 44100 Hz
- [`fosters/Antuan_de_Sent-Ekziupiery_Planieta_ludziei_output_original`](https://huggingface.co/datasets/fosters/Antuan_de_Sent-Ekziupiery_Planieta_ludziei_output_original) β€” 44100 Hz
- [`fosters/astryd_lindgren_braty_lvinae_sertsa_all`](https://huggingface.co/datasets/fosters/astryd_lindgren_braty_lvinae_sertsa_all) β€” 44100 Hz
- [`fosters/astryd_lindgren_braty_lvinae_sertsa_output_original`](https://huggingface.co/datasets/fosters/astryd_lindgren_braty_lvinae_sertsa_output_original) β€” 44100 Hz
- [`fosters/bely_klyck_all`](https://huggingface.co/datasets/fosters/bely_klyck_all) β€” 44100 Hz
- [`fosters/dzhozef_redzyard_kipling_all`](https://huggingface.co/datasets/fosters/dzhozef_redzyard_kipling_all) β€” 44100 Hz
- [`fosters/dzhozef_redzyard_kipling_output_original`](https://huggingface.co/datasets/fosters/dzhozef_redzyard_kipling_output_original) β€” 44100 Hz
- [`fosters/dzintra_shultse_robertsik_all`](https://huggingface.co/datasets/fosters/dzintra_shultse_robertsik_all) β€” 44100 Hz
- [`fosters/dzintra_shultse_robertsik_output_original`](https://huggingface.co/datasets/fosters/dzintra_shultse_robertsik_output_original) β€” 44100 Hz
- [`fosters/ernest_heminguei_stary_chalavek_i_mora_all`](https://huggingface.co/datasets/fosters/ernest_heminguei_stary_chalavek_i_mora_all) β€” 44100 Hz
- [`fosters/ernest_heminguei_stary_chalavek_i_mora_output_original`](https://huggingface.co/datasets/fosters/ernest_heminguei_stary_chalavek_i_mora_output_original) β€” 44100 Hz
- [`fosters/eryh_maryya_remark_all`](https://huggingface.co/datasets/fosters/eryh_maryya_remark_all) β€” 44100 Hz
- [`fosters/eryh_maryya_remark_output_original`](https://huggingface.co/datasets/fosters/eryh_maryya_remark_output_original) β€” 44100 Hz
- [`fosters/eryh_raspe_prygody_barona_myunhau_zena_all`](https://huggingface.co/datasets/fosters/eryh_raspe_prygody_barona_myunhau_zena_all) β€” 44100 Hz
- [`fosters/eryh_raspe_prygody_barona_myunhau_zena_output_original`](https://huggingface.co/datasets/fosters/eryh_raspe_prygody_barona_myunhau_zena_output_original) β€” 44100 Hz
- [`fosters/genadz_pashkou_all`](https://huggingface.co/datasets/fosters/genadz_pashkou_all) β€” 44100 Hz
- [`fosters/genadz_pashkou_output_original`](https://huggingface.co/datasets/fosters/genadz_pashkou_output_original) β€” 44100 Hz
- [`fosters/iagan_frydryh_shyler_kubak_all`](https://huggingface.co/datasets/fosters/iagan_frydryh_shyler_kubak_all) β€” 44100 Hz
- [`fosters/iagan_frydryh_shyler_kubak_output_original`](https://huggingface.co/datasets/fosters/iagan_frydryh_shyler_kubak_output_original) β€” 44100 Hz
- [`fosters/iakub-kolas-kazki-zhytstsia-output_original`](https://huggingface.co/datasets/fosters/iakub-kolas-kazki-zhytstsia-output_original) β€” 44100 Hz
- [`fosters/iakub-kolas-kazki-zhytstsia_all`](https://huggingface.co/datasets/fosters/iakub-kolas-kazki-zhytstsia_all) β€” 44100 Hz
- [`fosters/ivan-melezh-podykh-navalnitsy-valer-budzevich-output_original`](https://huggingface.co/datasets/fosters/ivan-melezh-podykh-navalnitsy-valer-budzevich-output_original) β€” 44100 Hz
- [`fosters/ivan-melezh-podykh-navalnitsy-valer-budzevich_all`](https://huggingface.co/datasets/fosters/ivan-melezh-podykh-navalnitsy-valer-budzevich_all) β€” 44100 Hz
- [`fosters/ivan-melezh-zavei-snezhan-valer-budzevich-output_original`](https://huggingface.co/datasets/fosters/ivan-melezh-zavei-snezhan-valer-budzevich-output_original) β€” 44100 Hz
- [`fosters/ivan-melezh-zavei-snezhan-valer-budzevich_all`](https://huggingface.co/datasets/fosters/ivan-melezh-zavei-snezhan-valer-budzevich_all) β€” 44100 Hz
- [`fosters/ivan-navumenka-zhul-vern-output_original`](https://huggingface.co/datasets/fosters/ivan-navumenka-zhul-vern-output_original) β€” 44100 Hz
- [`fosters/ivan-navumenka-zhul-vern_all`](https://huggingface.co/datasets/fosters/ivan-navumenka-zhul-vern_all) β€” 44100 Hz
- [`fosters/ivan-ptashnikau-lvy-output_original`](https://huggingface.co/datasets/fosters/ivan-ptashnikau-lvy-output_original) β€” 44100 Hz
- [`fosters/ivan-ptashnikau-lvy_all`](https://huggingface.co/datasets/fosters/ivan-ptashnikau-lvy_all) β€” 44100 Hz
- [`fosters/ivan_navumenka_sasna_pry_daroze_all`](https://huggingface.co/datasets/fosters/ivan_navumenka_sasna_pry_daroze_all) β€” 44100 Hz
- [`fosters/ivan_navumenka_sasna_pry_daroze_output_original`](https://huggingface.co/datasets/fosters/ivan_navumenka_sasna_pry_daroze_output_original) β€” 44100 Hz
- [`fosters/ivan_ptashnikau_all`](https://huggingface.co/datasets/fosters/ivan_ptashnikau_all) β€” 44100 Hz
- [`fosters/ivan_ptashnikau_output_original`](https://huggingface.co/datasets/fosters/ivan_ptashnikau_output_original) β€” 44100 Hz
- [`fosters/ivan_shamyakin_sertsa_na_daloni_all`](https://huggingface.co/datasets/fosters/ivan_shamyakin_sertsa_na_daloni_all) β€” 44100 Hz
- [`fosters/ivan_shamyakin_sertsa_na_daloni_output_original`](https://huggingface.co/datasets/fosters/ivan_shamyakin_sertsa_na_daloni_output_original) β€” 44100 Hz
- [`fosters/ivan_shamyakin_tryvozhnae_shchastse_all`](https://huggingface.co/datasets/fosters/ivan_shamyakin_tryvozhnae_shchastse_all) β€” 44100 Hz
- [`fosters/ivan_shamyakin_tryvozhnae_shchastse_output_original`](https://huggingface.co/datasets/fosters/ivan_shamyakin_tryvozhnae_shchastse_output_original) β€” 44100 Hz
- [`fosters/knihi-be-arlou_tancy_nad_horadam_all`](https://huggingface.co/datasets/fosters/knihi-be-arlou_tancy_nad_horadam_all) β€” 44100 Hz
- [`fosters/knihi-be-arlou_tancy_nad_horadam_output_original`](https://huggingface.co/datasets/fosters/knihi-be-arlou_tancy_nad_horadam_output_original) β€” 44100 Hz
- [`fosters/kuzma_chorny_makarkavyh_volka_all`](https://huggingface.co/datasets/fosters/kuzma_chorny_makarkavyh_volka_all) β€” 44100 Hz
- [`fosters/kuzma_chorny_makarkavyh_volka_output_original`](https://huggingface.co/datasets/fosters/kuzma_chorny_makarkavyh_volka_output_original) β€” 44100 Hz
- [`fosters/kuzma_chorny_poshuki_buduchyni_all`](https://huggingface.co/datasets/fosters/kuzma_chorny_poshuki_buduchyni_all) β€” 44100 Hz
- [`fosters/kuzma_chorny_poshuki_buduchyni_output_original`](https://huggingface.co/datasets/fosters/kuzma_chorny_poshuki_buduchyni_output_original) β€” 44100 Hz
- [`fosters/kuzma_chorny_zyamlya_all`](https://huggingface.co/datasets/fosters/kuzma_chorny_zyamlya_all) β€” 44100 Hz
- [`fosters/kuzma_chorny_zyamlya_output_original`](https://huggingface.co/datasets/fosters/kuzma_chorny_zyamlya_output_original) β€” 44100 Hz
- [`fosters/legendy-i-padanni_all`](https://huggingface.co/datasets/fosters/legendy-i-padanni_all) β€” 44100 Hz
- [`fosters/legendy-i-padanni_original`](https://huggingface.co/datasets/fosters/legendy-i-padanni_original) β€” 44100 Hz
- [`fosters/maksim_tank_all`](https://huggingface.co/datasets/fosters/maksim_tank_all) β€” 44100 Hz
- [`fosters/maksim_tank_output_original`](https://huggingface.co/datasets/fosters/maksim_tank_output_original) β€” 44100 Hz
- [`fosters/mar_yan_duksa_all`](https://huggingface.co/datasets/fosters/mar_yan_duksa_all) β€” 44100 Hz
- [`fosters/mar_yan_duksa_output_original`](https://huggingface.co/datasets/fosters/mar_yan_duksa_output_original) β€” 44100 Hz
- [`fosters/raisa_baravikova_vasmiradkou_i_all`](https://huggingface.co/datasets/fosters/raisa_baravikova_vasmiradkou_i_all) β€” 44100 Hz
- [`fosters/raisa_baravikova_vasmiradkou_i_output_original`](https://huggingface.co/datasets/fosters/raisa_baravikova_vasmiradkou_i_output_original) β€” 44100 Hz
- [`fosters/raisa_baravikova_vershy_pra_kahanne_all`](https://huggingface.co/datasets/fosters/raisa_baravikova_vershy_pra_kahanne_all) β€” 44100 Hz
- [`fosters/raisa_baravikova_vershy_pra_kahanne_output_original`](https://huggingface.co/datasets/fosters/raisa_baravikova_vershy_pra_kahanne_output_original) β€” 44100 Hz
- [`fosters/shata_rustaveli_vitsyaz_u_tygravai_shkury_all`](https://huggingface.co/datasets/fosters/shata_rustaveli_vitsyaz_u_tygravai_shkury_all) β€” 44100 Hz
- [`fosters/shata_rustaveli_vitsyaz_u_tygravai_shkury_output_original`](https://huggingface.co/datasets/fosters/shata_rustaveli_vitsyaz_u_tygravai_shkury_output_original) β€” 44100 Hz
- [`fosters/stefan_tsvei_g_nyabachnaya_kalektsyya_all`](https://huggingface.co/datasets/fosters/stefan_tsvei_g_nyabachnaya_kalektsyya_all) β€” 44100 Hz
- [`fosters/stefan_tsvei_g_nyabachnaya_kalektsyya_output_original`](https://huggingface.co/datasets/fosters/stefan_tsvei_g_nyabachnaya_kalektsyya_output_original) β€” 44100 Hz
- [`fosters/taras_shau_chenka_vershy_paemy_all`](https://huggingface.co/datasets/fosters/taras_shau_chenka_vershy_paemy_all) β€” 44100 Hz
- [`fosters/taras_shau_chenka_vershy_paemy_output_original`](https://huggingface.co/datasets/fosters/taras_shau_chenka_vershy_paemy_output_original) β€” 44100 Hz
- [`fosters/uilyam_folkner_pah_verbeny_all`](https://huggingface.co/datasets/fosters/uilyam_folkner_pah_verbeny_all) β€” 44100 Hz
- [`fosters/uilyam_folkner_pah_verbeny_output_original`](https://huggingface.co/datasets/fosters/uilyam_folkner_pah_verbeny_output_original) β€” 44100 Hz
- [`fosters/uladzimir-karatkevich-dzikae-paliavanne-karalia-stakha-aleg-garbuz-output_original`](https://huggingface.co/datasets/fosters/uladzimir-karatkevich-dzikae-paliavanne-karalia-stakha-aleg-garbuz-output_original) β€” 44100 Hz
- [`fosters/uladzimir-karatkevich-dzikae-paliavanne-karalia-stakha-aleg-garbuz_all`](https://huggingface.co/datasets/fosters/uladzimir-karatkevich-dzikae-paliavanne-karalia-stakha-aleg-garbuz_all) β€” 44100 Hz
- [`fosters/vasil_bykau_all`](https://huggingface.co/datasets/fosters/vasil_bykau_all) β€” 44100 Hz
- [`fosters/vasil_bykau_output_original`](https://huggingface.co/datasets/fosters/vasil_bykau_output_original) β€” 44100 Hz
- [`fosters/vasil_zue_nok_syaliba_all`](https://huggingface.co/datasets/fosters/vasil_zue_nok_syaliba_all) β€” 44100 Hz
- [`fosters/vasil_zue_nok_syaliba_output_original`](https://huggingface.co/datasets/fosters/vasil_zue_nok_syaliba_output_original) β€” 44100 Hz
- [`fosters/viktar_prau_dzin_all`](https://huggingface.co/datasets/fosters/viktar_prau_dzin_all) β€” 44100 Hz
- [`fosters/viktar_prau_dzin_output_original`](https://huggingface.co/datasets/fosters/viktar_prau_dzin_output_original) β€” 44100 Hz
- [`fosters/yakub_kolas_novaya_zyamlya_all`](https://huggingface.co/datasets/fosters/yakub_kolas_novaya_zyamlya_all) β€” 44100 Hz
- [`fosters/yakub_kolas_novaya_zyamlya_output_original`](https://huggingface.co/datasets/fosters/yakub_kolas_novaya_zyamlya_output_original) β€” 44100 Hz
- [`fosters/yanka_bryl_ptushki_i_gne_zdy_all`](https://huggingface.co/datasets/fosters/yanka_bryl_ptushki_i_gne_zdy_all) β€” 44100 Hz
- [`fosters/yanka_bryl_ptushki_i_gne_zdy_output_original`](https://huggingface.co/datasets/fosters/yanka_bryl_ptushki_i_gne_zdy_output_original) β€” 44100 Hz
- [`fosters/yanka_sipakou_odzium_all`](https://huggingface.co/datasets/fosters/yanka_sipakou_odzium_all) β€” 44100 Hz
- [`fosters/yanka_sipakou_odzium_output_original`](https://huggingface.co/datasets/fosters/yanka_sipakou_odzium_output_original) β€” 44100 Hz
- [`futureDoctor/turkic_tts_dataset`](https://huggingface.co/datasets/futureDoctor/turkic_tts_dataset) β€” 44100 Hz
- [`ghananlpcommunity/asante-twi-bible-speech-phonemes`](https://huggingface.co/datasets/ghananlpcommunity/asante-twi-bible-speech-phonemes) β€” 44100 Hz
- [`ghananlpcommunity/twi-trigrams-speech-text-parallel`](https://huggingface.co/datasets/ghananlpcommunity/twi-trigrams-speech-text-parallel) β€” 44100 Hz
- [`grandhigh/sample-id`](https://huggingface.co/datasets/grandhigh/sample-id) β€” 44100 Hz
- [`grider-transwithai/nekopara-speech`](https://huggingface.co/datasets/grider-transwithai/nekopara-speech) β€” 44100 Hz
- [`hananeek2/STT-algerian-dialect`](https://huggingface.co/datasets/hananeek2/STT-algerian-dialect) β€” 44100 Hz
- [`hhim8826/japanese-anime-speech-v2-split`](https://huggingface.co/datasets/hhim8826/japanese-anime-speech-v2-split) β€” 44100 Hz
- [`humairawan/AnimeSpeech`](https://huggingface.co/datasets/humairawan/AnimeSpeech) β€” 44100 Hz
- [`jdapaah/asante-twi-bible`](https://huggingface.co/datasets/jdapaah/asante-twi-bible) β€” 44100 Hz
- [`joujiboi/kuroyukihime-speech`](https://huggingface.co/datasets/joujiboi/kuroyukihime-speech) β€” 44100 Hz
- [`kizuna-intelligence/AItuber-Persona-Voices-JA`](https://huggingface.co/datasets/kizuna-intelligence/AItuber-Persona-Voices-JA) β€” 44100 Hz
- [`langswap/dialogs-ru-emotional-conversations`](https://huggingface.co/datasets/langswap/dialogs-ru-emotional-conversations) β€” 44100 Hz
- [`MatrixStudio/TTS-SCFChilSC`](https://huggingface.co/datasets/MatrixStudio/TTS-SCFChilSC) β€” 44100 Hz
- [`metricv/tl-whisper`](https://huggingface.co/datasets/metricv/tl-whisper) β€” 44100 Hz
- [`Michel21/rick-sanchez`](https://huggingface.co/datasets/Michel21/rick-sanchez) β€” 44100 Hz
- [`MikhailT/hifi-tts`](https://huggingface.co/datasets/MikhailT/hifi-tts) β€” 44100 Hz
- [`MohamedRashad/SCC22`](https://huggingface.co/datasets/MohamedRashad/SCC22) β€” 44100 Hz
- [`MothersTongue/mother_tongue_dataset`](https://huggingface.co/datasets/MothersTongue/mother_tongue_dataset) β€” 44100 Hz
- [`msnowchanj/pvariant-EQ`](https://huggingface.co/datasets/msnowchanj/pvariant-EQ) β€” 44100 Hz
- [`Pragmaticl/Trys2`](https://huggingface.co/datasets/Pragmaticl/Trys2) β€” 44100 Hz
- [`Pragmaticl/TuyenVanHoa2`](https://huggingface.co/datasets/Pragmaticl/TuyenVanHoa2) β€” 44100 Hz
- [`Pragmaticl/TuyenVanHoa4`](https://huggingface.co/datasets/Pragmaticl/TuyenVanHoa4) β€” 44100 Hz
- [`Professor/kinyarwanda-tts-dataset-kin`](https://huggingface.co/datasets/Professor/kinyarwanda-tts-dataset-kin) β€” 44100 Hz
- [`ray0rf1re/GLaDOS-audio-v2`](https://huggingface.co/datasets/ray0rf1re/GLaDOS-audio-v2) β€” 44100 Hz
- [`sachin6624/malayalam-tts-pro-voice`](https://huggingface.co/datasets/sachin6624/malayalam-tts-pro-voice) β€” 44100 Hz
- [`shannonnonshan/ViMedCSS-Cop`](https://huggingface.co/datasets/shannonnonshan/ViMedCSS-Cop) β€” 44100 Hz
- [`ShoukanLabs/AniSpeech`](https://huggingface.co/datasets/ShoukanLabs/AniSpeech) β€” 44100 Hz
- [`SoufianeDahimi/Tamazight-ASR-Dataset-v2`](https://huggingface.co/datasets/SoufianeDahimi/Tamazight-ASR-Dataset-v2) β€” 44100 Hz
- [`sudoping01/bam-asr-benchmark`](https://huggingface.co/datasets/sudoping01/bam-asr-benchmark) β€” 44100 Hz
- [`SynDataLab-EN-Refs/echo-ref-speakers-4k-en`](https://huggingface.co/datasets/SynDataLab-EN-Refs/echo-ref-speakers-4k-en) β€” 44100 Hz
- [`SynDataLab-EN-Refs/tts-pretrain-refs-3k-mos`](https://huggingface.co/datasets/SynDataLab-EN-Refs/tts-pretrain-refs-3k-mos) β€” 44100 Hz
- [`SynDataLab-EN/EchoTTS-OmniVoice-En`](https://huggingface.co/datasets/SynDataLab-EN/EchoTTS-OmniVoice-En) β€” 44100 Hz
- [`tensorxt/ViMedCSS`](https://huggingface.co/datasets/tensorxt/ViMedCSS) β€” 44100 Hz
- [`Thorsten-Voice/TV-44kHz-Full`](https://huggingface.co/datasets/Thorsten-Voice/TV-44kHz-Full) β€” 44100 Hz
- [`timniel/Pidgin_ASR_Dataset_Combined`](https://huggingface.co/datasets/timniel/Pidgin_ASR_Dataset_Combined) β€” 44100 Hz
- [`trysem/malayalam-tts-pro-voice`](https://huggingface.co/datasets/trysem/malayalam-tts-pro-voice) β€” 44100 Hz
- [`TutlaytAI/kabyle_asr`](https://huggingface.co/datasets/TutlaytAI/kabyle_asr) β€” 44100 Hz
- [`TutlaytAI/Kabyle_ASR-En_Translation`](https://huggingface.co/datasets/TutlaytAI/Kabyle_ASR-En_Translation) β€” 44100 Hz
- [`TutlaytAI/Kabyle_ASR-Fr_Translation`](https://huggingface.co/datasets/TutlaytAI/Kabyle_ASR-Fr_Translation) β€” 44100 Hz
- [`vsisik/voice-dataset-lili`](https://huggingface.co/datasets/vsisik/voice-dataset-lili) β€” 44100 Hz
- [`wcwxyz/test-audio`](https://huggingface.co/datasets/wcwxyz/test-audio) β€” 44100 Hz
- [`WhissleAI/Meta_STT_ZH_AIShell3`](https://huggingface.co/datasets/WhissleAI/Meta_STT_ZH_AIShell3) β€” 44100 Hz
- [`yasalma/audiobooks`](https://huggingface.co/datasets/yasalma/audiobooks) β€” 44100 Hz
- [`ymoslem/BitesizeIrish-GA-EN`](https://huggingface.co/datasets/ymoslem/BitesizeIrish-GA-EN) β€” 44100 Hz
- [`yuriilaba/toronto-tv-ukrainian`](https://huggingface.co/datasets/yuriilaba/toronto-tv-ukrainian) β€” 44100 Hz
</details>
## Usage
See the canonical
**Load from Hugging Face**
section in the source repo. **`decoder_depth=20` is required** β€” the weights are a
depth-20 decoder, so loading with any other depth mismatches the architecture.
```python
import soundfile as sf
# the `neucodec/` package is bundled in this repo (see 'Inference (self-contained)')
from neucodec import NeuCodec
# decoder_depth=20 MUST match this repo; pass token=... (or hf login) for access
model = NeuCodec._from_pretrained(model_id="Scicom-intl/WideCodec", decoder_depth=20)
model = model.eval().cuda()
# encode (16 kHz path, frozen) -> codes -> decode (44.1 kHz, this finetune)
codes = model.encode_code("input.wav") # [1, 1, T], identical to base NeuCodec
recon_44k = model.decode_code(codes).squeeze().cpu().numpy()
sf.write("recon.wav", recon_44k, model.sample_rate) # 44100
```
The discrete codes are **identical to base `neuphonic/neucodec`** β€” only the reconstruction
sample rate and fidelity differ.