Text-to-Speech
Transformers
Safetensors
hifi_gan
feature-extraction
audio
vocoder
hifi-gan
bigvgan
neural-vocoder
speaker-conditioning
audio-watermarking
custom_code
Instructions to use mlr2000/vocoder-small with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use mlr2000/vocoder-small with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-to-speech", model="mlr2000/vocoder-small", trust_remote_code=True)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("mlr2000/vocoder-small", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
| from transformers.models.wav2vec2.configuration_wav2vec2 import Wav2Vec2Config | |
| class SpeakerEmbeddingConfig(Wav2Vec2Config): | |
| def __init__( | |
| self, | |
| embedding_size: int = 768, | |
| train_batch_speakers: int = 64, | |
| train_batch_per_device: int = 64, | |
| train_batch_samples_per_speaker: int = 10, | |
| disable_positional_embeddings: bool = False, | |
| loss_margin: float = 0.2, | |
| loss_scale: float = 30.0, | |
| use_layer_weights: bool = True, | |
| n_projection_layers: int = 3, | |
| **kwargs, | |
| ): | |
| super().__init__(**kwargs) | |
| self.embedding_size = embedding_size | |
| self.train_batch_per_device = train_batch_per_device | |
| self.train_batch_speakers = train_batch_speakers | |
| self.train_batch_samples_per_speaker = train_batch_samples_per_speaker | |
| self.disable_positional_embeddings = disable_positional_embeddings | |
| self.loss_margin = loss_margin | |
| self.loss_scale = loss_scale | |
| self.use_layer_weights = use_layer_weights | |
| self.n_projection_layers = n_projection_layers | |
| #self.conv_stride = (7, 2, 2, 2, 2, 2, 2) | |
| #self.conv_kernel = (15, 5, 3, 3, 3, 2, 2) | |
| #self.conv_dim = (512, 512, 512, 512, 512, 512, 512) |