"""Config for the standalone VocBulwark speaker encoder.""" from transformers import PretrainedConfig class SpeakerEncoderConfig(PretrainedConfig): model_type = "vocbulwark_speaker_encoder" def __init__(self, speaker_embed_config=None, embedding_size=None, raw_sample_rate=22050, **kwargs): super().__init__(**kwargs) # The wav2vec2-based encoder's own config (dict), plus the produced # embedding dimension and the sample rate its input audio is expected at. self.speaker_embed_config = speaker_embed_config self.embedding_size = embedding_size self.raw_sample_rate = raw_sample_rate