Text-to-Speech
Transformers
Safetensors
hifi_gan
feature-extraction
audio
vocoder
hifi-gan
bigvgan
neural-vocoder
speaker-conditioning
audio-watermarking
custom_code
Instructions to use mlr2000/vocoder-small with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use mlr2000/vocoder-small with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-to-speech", model="mlr2000/vocoder-small", trust_remote_code=True)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("mlr2000/vocoder-small", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
File size: 1,247 Bytes
1fdc661 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 | from transformers.models.wav2vec2.configuration_wav2vec2 import Wav2Vec2Config
class SpeakerEmbeddingConfig(Wav2Vec2Config):
def __init__(
self,
embedding_size: int = 768,
train_batch_speakers: int = 64,
train_batch_per_device: int = 64,
train_batch_samples_per_speaker: int = 10,
disable_positional_embeddings: bool = False,
loss_margin: float = 0.2,
loss_scale: float = 30.0,
use_layer_weights: bool = True,
n_projection_layers: int = 3,
**kwargs,
):
super().__init__(**kwargs)
self.embedding_size = embedding_size
self.train_batch_per_device = train_batch_per_device
self.train_batch_speakers = train_batch_speakers
self.train_batch_samples_per_speaker = train_batch_samples_per_speaker
self.disable_positional_embeddings = disable_positional_embeddings
self.loss_margin = loss_margin
self.loss_scale = loss_scale
self.use_layer_weights = use_layer_weights
self.n_projection_layers = n_projection_layers
#self.conv_stride = (7, 2, 2, 2, 2, 2, 2)
#self.conv_kernel = (15, 5, 3, 3, 3, 2, 2)
#self.conv_dim = (512, 512, 512, 512, 512, 512, 512) |