File size: 1,247 Bytes
1fdc661
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
from transformers.models.wav2vec2.configuration_wav2vec2 import Wav2Vec2Config


class SpeakerEmbeddingConfig(Wav2Vec2Config):

    def __init__(
        self,
        embedding_size: int = 768,
        train_batch_speakers: int = 64,
        train_batch_per_device: int = 64,
        train_batch_samples_per_speaker: int = 10,
        disable_positional_embeddings: bool = False,
        loss_margin: float = 0.2,
        loss_scale: float = 30.0,
        use_layer_weights: bool = True,
        n_projection_layers: int = 3,
        **kwargs,
    ):
        super().__init__(**kwargs)
        self.embedding_size = embedding_size
        self.train_batch_per_device = train_batch_per_device
        self.train_batch_speakers = train_batch_speakers
        self.train_batch_samples_per_speaker = train_batch_samples_per_speaker
        self.disable_positional_embeddings = disable_positional_embeddings
        self.loss_margin = loss_margin
        self.loss_scale = loss_scale
        self.use_layer_weights = use_layer_weights
        self.n_projection_layers = n_projection_layers
        #self.conv_stride = (7, 2, 2, 2, 2, 2, 2)
        #self.conv_kernel = (15, 5, 3, 3, 3, 2, 2)
        #self.conv_dim = (512, 512, 512, 512, 512, 512, 512)