vocoder-large-speaker-encoder / configuration_speaker.py
mlr2000's picture
Upload folder using huggingface_hub
7ef8c9b verified
Raw
History Blame Contribute Delete
661 Bytes
"""Config for the standalone VocBulwark speaker encoder."""
from transformers import PretrainedConfig
class SpeakerEncoderConfig(PretrainedConfig):
model_type = "vocbulwark_speaker_encoder"
def __init__(self, speaker_embed_config=None, embedding_size=None,
raw_sample_rate=22050, **kwargs):
super().__init__(**kwargs)
# The wav2vec2-based encoder's own config (dict), plus the produced
# embedding dimension and the sample rate its input audio is expected at.
self.speaker_embed_config = speaker_embed_config
self.embedding_size = embedding_size
self.raw_sample_rate = raw_sample_rate