Update GGUF package README
Browse files
README.md
CHANGED
|
@@ -81,84 +81,82 @@ base_model:
|
|
| 81 |
|
| 82 |
This directory contains audio.cpp-native GGUF conversions of multiple speech models. These files are intended for use with [audio.cpp](https://github.com/0xShug0/audio.cpp).
|
| 83 |
|
|
|
|
|
|
|
| 84 |
For conversion details, supported layouts, direct-file loading, sidecar embedding, and the latest compatibility notes, see the audio.cpp GGUF guide:
|
| 85 |
|
| 86 |
- https://github.com/0xShug0/audio.cpp/blob/main/docs/gguf.md
|
| 87 |
|
| 88 |
-
!!!
|
| 89 |
|
| 90 |
|
| 91 |
## Files
|
| 92 |
|
| 93 |
-
|
| 94 |
-
|
| 95 |
-
|
| 96 |
-
|
|
| 97 |
-
|--
|
| 98 |
-
| `
|
| 99 |
-
| `BS-RoFormer-ep368-GGUF` | `
|
| 100 |
-
| `Chatterbox-GGUF` | `chatterbox
|
| 101 |
-
| `Citrinet-ASR-GGUF` | `
|
| 102 |
-
| `Confucius4-TTS-GGUF` | `
|
| 103 |
-
| `
|
| 104 |
-
| `DotTTS-
|
| 105 |
-
| `
|
| 106 |
-
| `
|
| 107 |
-
| `
|
| 108 |
-
| `
|
| 109 |
-
| `
|
| 110 |
-
| `
|
| 111 |
-
| `
|
| 112 |
-
| `
|
| 113 |
-
| `
|
| 114 |
-
| `
|
| 115 |
-
| `
|
| 116 |
-
| `
|
| 117 |
-
| `
|
| 118 |
-
| `Irodori-TTS-
|
| 119 |
-
| `
|
| 120 |
-
| `
|
| 121 |
-
| `
|
| 122 |
-
| `
|
| 123 |
-
| `
|
| 124 |
-
| `
|
| 125 |
-
| `
|
| 126 |
-
| `
|
| 127 |
-
| `
|
| 128 |
-
| `
|
| 129 |
-
| `
|
| 130 |
-
| `
|
| 131 |
-
| `
|
| 132 |
-
| `
|
| 133 |
-
| `
|
| 134 |
-
| `
|
| 135 |
-
| `
|
| 136 |
-
| `
|
| 137 |
-
| `
|
| 138 |
-
| `
|
| 139 |
-
| `
|
| 140 |
-
| `
|
| 141 |
-
| `
|
| 142 |
-
| `
|
| 143 |
-
| `
|
| 144 |
-
| `
|
| 145 |
-
| `
|
| 146 |
-
| `
|
| 147 |
-
| `
|
| 148 |
-
| `
|
| 149 |
-
| `
|
| 150 |
-
|
| 151 |
-
|
| 152 |
-
|
| 153 |
-
-
|
| 154 |
-
|
| 155 |
-
|
| 156 |
-
-
|
| 157 |
-
|
| 158 |
-
`cond_embed`, and Mimi conv tensors are not forced to Q8 because tested outputs
|
| 159 |
-
drifted or the current conv path casts quantized conv weights back to F32.
|
| 160 |
-
- Voxtral Q4_K is smaller than Q8_0 and was faster in a quick CUDA path check,
|
| 161 |
-
with transcripts matching Q8_0 except for one capitalization-only difference.
|
| 162 |
|
| 163 |
## Usage
|
| 164 |
|
|
|
|
| 81 |
|
| 82 |
This directory contains audio.cpp-native GGUF conversions of multiple speech models. These files are intended for use with [audio.cpp](https://github.com/0xShug0/audio.cpp).
|
| 83 |
|
| 84 |
+
If you enjoy the project, please star [audio.cpp on GitHub](https://github.com/0xShug0/audio.cpp) and this Hugging Face repository.
|
| 85 |
+
|
| 86 |
For conversion details, supported layouts, direct-file loading, sidecar embedding, and the latest compatibility notes, see the audio.cpp GGUF guide:
|
| 87 |
|
| 88 |
- https://github.com/0xShug0/audio.cpp/blob/main/docs/gguf.md
|
| 89 |
|
| 90 |
+
!!! Converted and quantized packages are checked with automated metrics, but perceived quality can still differ for human listeners. Please validate the exact package, backend, and route to confirm the output is acceptable for your use case.
|
| 91 |
|
| 92 |
|
| 93 |
## Files
|
| 94 |
|
| 95 |
+
The table lists the GGUF packages currently provided by this repository.
|
| 96 |
+
|
| 97 |
+
| Directory | audio.cpp family | GGUF provided | Original model license |
|
| 98 |
+
|---|---|---|---|
|
| 99 |
+
| `ACE-Step1.5-GGUF` | `ace_step` | BF16 + Q8 | MIT |
|
| 100 |
+
| `AudioSR-GGUF` | `audiosr` | F32 | MIT |
|
| 101 |
+
| `BS-RoFormer-ep368-GGUF` | `bs_roformer` | Q8 | Apache-2.0 |
|
| 102 |
+
| `Chatterbox-GGUF` | `chatterbox` | F16 + Q8 | MIT |
|
| 103 |
+
| `Citrinet-ASR-GGUF` | `citrinet_asr` | Q8 | CC-BY-4.0 |
|
| 104 |
+
| `Confucius4-TTS-GGUF` | `confucius4_tts` | original | Apache-2.0 |
|
| 105 |
+
| `ControlFoley-GGUF` | `controlfoley` | F32 | Apache-2.0 |
|
| 106 |
+
| `DotTTS-Edit-GGUF` | `dots_tts` | BF16 + Q8 | Apache-2.0 |
|
| 107 |
+
| `DotTTS-MF-GGUF` | `dots_tts` | BF16 | Apache-2.0 |
|
| 108 |
+
| `DotTTS-SOAR-GGUF` | `dots_tts` | original + BF16 | Apache-2.0 |
|
| 109 |
+
| `DramaBox-GGUF` | `dramabox` | Q8 | LTX-2 Community License |
|
| 110 |
+
| `Fish-Audio-S2-Pro-GGUF` | `fish_audio` | BF16 + Q8 | Fish Audio Research License |
|
| 111 |
+
| `Fun-ASR-Nano-2512-GGUF` | `fun_asr_nano` | F16 + Q8 | FunASR Model Open Source License Agreement v1.1 |
|
| 112 |
+
| `HeartMuLa-GGUF` | `heartmula` | F16 + Q8 | Apache-2.0 |
|
| 113 |
+
| `HTDemucs-GGUF` | `htdemucs` | F16 + Q8 | MIT |
|
| 114 |
+
| `Higgs-Audio-v3-STT-GGUF` | `higgs_audio_stt` | F16 + Q8 | Apache-2.0 |
|
| 115 |
+
| `Higgs-Audio-v3-TTS-4B-GGUF` | `higgs_audio_tts` | BF16 + Q8 | Boson Higgs TTS 3 Research and Non-Commercial License |
|
| 116 |
+
| `Hviske-v5.3-GGUF` | `hviske_asr` | Q8 | CC-BY-NC-4.0 |
|
| 117 |
+
| `IndexTTS2-GGUF` | `index_tts2` | original + F16 + Q8 | bilibili Model Use License Agreement |
|
| 118 |
+
| `IndexTTS2.5-GGUF` | `index_tts2` | original + F16 + Q8 | bilibili Model Use License Agreement |
|
| 119 |
+
| `Inflect-Micro-v2-GGUF` | `inflect_v2` | original | Apache-2.0 |
|
| 120 |
+
| `Irodori-TTS-500M-v3-GGUF` | `irodori_tts` | F16 + Q8 | MIT |
|
| 121 |
+
| `Irodori-TTS-600M-v3-VoiceDesign-GGUF` | `irodori_tts` | F16 + Q8 | MIT |
|
| 122 |
+
| `Irodori-TTS-v4-Small-GGUF` | `irodori_tts` | F16 + Q8 | MIT |
|
| 123 |
+
| `Kroko-ASR-GGUF` | `kroko_asr` | Q8 | CC-BY-SA community model license |
|
| 124 |
+
| `MMS-Forced-Aligner-GGUF` | `mms_forced_aligner` | F16 | CC-BY-NC-4.0 |
|
| 125 |
+
| `MOSS-TTS-Local-v1.5-GGUF` | `moss_tts_local` | BF16 + Q8 | Apache-2.0 |
|
| 126 |
+
| `MOSS-TTS-Nano-100M-GGUF` | `moss_tts_nano` | BF16 + Q8 | Apache-2.0 |
|
| 127 |
+
| `MOSS-VoiceGenerator-GGUF` | `moss_voicegen` | BF16 + F16 codec decode | Apache-2.0 |
|
| 128 |
+
| `MagpieTTS-Multilingual-357M-GGUF` | `magpie_tts` | original | NVIDIA Open Model License |
|
| 129 |
+
| `MeanVC2-GGUF` | `meanvc2` | F32 + Q4_K | Apache-2.0 |
|
| 130 |
+
| `Mel-Band-RoFormer-GGUF` | `mel_band_roformer` | F16 + Q8 | MIT |
|
| 131 |
+
| `MiniMax-H3-Q4-GGUF` | `minimax_h3` | Q4_K + INT8 DiT option | MiniMax-H3 Community License |
|
| 132 |
+
| `MioCodec-25Hz-44.1kHz-v2-GGUF` | `miocodec` | original + F16 + Q8 | MIT |
|
| 133 |
+
| `MioTTS-1.7B-GGUF` | `miotts` | original + BF16 + Q8 | Apache-2.0 |
|
| 134 |
+
| `MuScriptor-Small-GGUF` | `muscriptor` | F32 | CC-BY-NC-4.0 |
|
| 135 |
+
| `Nemotron-3.5-ASR-Streaming-0.6B-GGUF` | `nemotron_asr` | F16 + Q8 | OpenMDW-1.1 |
|
| 136 |
+
| `NeuTTS-2E-GGUF` | `neutts` | original | Apache-2.0 |
|
| 137 |
+
| `OmniVoice-GGUF` | `omnivoice` | BF16 + F16 + Q8 | Apache-2.0 |
|
| 138 |
+
| `Parakeet-TDT-0.6B-v3-GGUF` | `parakeet_tdt` | F16 + Q8 | CC-BY-4.0 |
|
| 139 |
+
| `PersonaPlex-GGUF` | `personaplex` | Q4_K + Q8 | Apache-2.0 |
|
| 140 |
+
| `PocketTTS-GGUF` | `pocket_tts` | BF16 + Q8 | CC-BY-4.0 |
|
| 141 |
+
| `Qwen3-ASR-0.6B-GGUF` | `qwen3_asr` | F16 + Q8 | Apache-2.0 |
|
| 142 |
+
| `Qwen3-ASR-1.7B-GGUF` | `qwen3_asr` | F16 + Q8 | Apache-2.0 |
|
| 143 |
+
| `Qwen3-ForcedAligner-0.6B-GGUF` | `qwen3_forced_aligner` | F16 + Q8 | Apache-2.0 |
|
| 144 |
+
| `Qwen3-TTS-12Hz-0.6B-Base-GGUF` | `qwen3_tts` | BF16 + Q8 | Apache-2.0 |
|
| 145 |
+
| `Qwen3-TTS-12Hz-1.7B-Base-GGUF` | `qwen3_tts` | original + BF16 + Q8 | Apache-2.0 |
|
| 146 |
+
| `Qwen3-TTS-12Hz-1.7B-CustomVoice-GGUF` | `qwen3_tts` | BF16 + Q8 | Apache-2.0 |
|
| 147 |
+
| `Qwen3-TTS-12Hz-1.7B-VoiceDesign-GGUF` | `qwen3_tts` | BF16 + Q8 | Apache-2.0 |
|
| 148 |
+
| `RVC-GGUF` | `rvc` | F16 | MIT |
|
| 149 |
+
| `SeedVC-MLX-GGUF` | `seed_vc` | original + F16 + Q8 | GPL-3.0 |
|
| 150 |
+
| `Sortformer-Diar-4spk-v1-GGUF` | `sortformer_diar` | F16 + Q8 | CC-BY-NC-4.0 |
|
| 151 |
+
| `Stable-Audio-3-Medium-GGUF` | `stable_audio` | F16 + Q8 | Stability AI Community License |
|
| 152 |
+
| `Stable-Audio-3-Small-Music-GGUF` | `stable_audio` | F16 + Q8 | Stability AI Community License |
|
| 153 |
+
| `Stable-Audio-3-Small-SFX-GGUF` | `stable_audio` | F16 + Q8 | Stability AI Community License |
|
| 154 |
+
| `Supertonic-3-GGUF` | `supertonic` | original + F16 + Q8 | BigScience Open RAIL-M |
|
| 155 |
+
| `Vevo2-GGUF` | `vevo2` | original + F16 + Q8 | CC-BY-NC-ND-4.0 |
|
| 156 |
+
| `VibeVoice-1.5B-GGUF` | `vibevoice` | BF16 + Q8 + Q4 | MIT |
|
| 157 |
+
| `VibeVoice-ASR-GGUF` | `vibevoice_asr` | F16 + Q8 | MIT |
|
| 158 |
+
| `VoxCPM2-GGUF` | `voxcpm2` | original + BF16 + Q8 | Apache-2.0 |
|
| 159 |
+
| `Voxtral-Mini-4B-Realtime-2602-GGUF` | `voxtral_realtime` | BF16 + Q8 + Q4_K | Apache-2.0 |
|
|
|
|
|
|
|
|
|
|
|
|
|
| 160 |
|
| 161 |
## Usage
|
| 162 |
|