File size: 661 Bytes
7ef8c9b
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
"""Config for the standalone VocBulwark speaker encoder."""
from transformers import PretrainedConfig


class SpeakerEncoderConfig(PretrainedConfig):
    model_type = "vocbulwark_speaker_encoder"

    def __init__(self, speaker_embed_config=None, embedding_size=None,
                 raw_sample_rate=22050, **kwargs):
        super().__init__(**kwargs)
        # The wav2vec2-based encoder's own config (dict), plus the produced
        # embedding dimension and the sample rate its input audio is expected at.
        self.speaker_embed_config = speaker_embed_config
        self.embedding_size = embedding_size
        self.raw_sample_rate = raw_sample_rate