81.4 GB
1,812 files
Updated about 2 months ago
Name
Size
cond_step.mlmodelc
cond_step.mlpackage
cond_step_v2.mlmodelc
cond_step_v3.mlmodelc
cond_step_v3.mlpackage
constants_bin
flow_decoder.mlmodelc
flow_decoder.mlpackage
flowlm_step.mlmodelc
flowlm_step.mlpackage
mimi_decoder.mlmodelc
mimi_decoder.mlpackage
mimi_decoder_v2.mlmodelc
mimi_decoder_v3.mlmodelc
mimi_decoder_v3.mlpackage
mimi_encoder.mlmodelc
mimi_encoder.mlpackage
mimi_encoderv2.mlmodelc
mimi_encoderv2.mlpackage
samples
v2
v2.1
.gitattributes2.84 kB
xet
README.md1.42 kB
xet
config.json2 Bytes
xet
manifest.json44.5 kB
xet
README.md

PocketTTS CoreML

CoreML conversion of kyutai/pocket-tts for on-device inference on Apple platforms.

Models

Model Description Size
cond_step KV cache prefill (voice + text conditioning) ~200MB
flowlm_step Autoregressive generation (transformer_out + EOS) ~200MB
flow_decoder Flow matching denoiser (8 Euler steps per frame) ~190MB
mimi_decoder Streaming audio codec (1920 samples per frame) ~11MB

Voices

4 pre-encoded voices in constants_bin/:

  • alba (default), azelma, cosette, javert

Voice cloning weights are not included — they are gated separately by Kyutai.

Usage

import FluidAudioTTS

let manager = PocketTtsManager()
try await manager.initialize()
let audio = try await manager.synthesize(text: "Hello, world!")

See https://github.com/FluidInference/FluidAudio for the full Swift framework.

License

CC-BY-4.0, inherited from https://huggingface.co/kyutai/pocket-tts. Attribution to Kyutai is required.

References

- https://huggingface.co/kyutai/pocket-tts
- https://arxiv.org/abs/2410.00037
- https://github.com/FluidInference/FluidAudio
Total size
81.4 GB
Files
1,812
Last updated
Jun 26
Pre-warmed CDN
US EU US EU

Contributors