shinuh commited on
Commit
e00f895
·
verified ·
1 Parent(s): e8ed3b9

Upload config.yaml with huggingface_hub

Browse files
Files changed (1) hide show
  1. config.yaml +275 -0
config.yaml ADDED
@@ -0,0 +1,275 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ notes: "streaming model = online (Mamba) + 8k&16k"
2
+ # ============================================================================ #
3
+ config:
4
+ # ========================== Key Variables ============================== #
5
+ train_phase: &var_tr_phase "adversarial" # pretrain / adversarial
6
+ dataset_phase: "to48k"
7
+ train_phase_list: ['pretrain_to48k', 'adversarial_to48k']
8
+
9
+ # -- architecture --
10
+ online: &var_online True # False=TF-Locoformer (offline), True=Mamba (online)
11
+ d_model_enc: &var_model_channels_1st 128
12
+ d_model_dec: &var_model_channels_2nd 64
13
+ d_hidden_enc: &var_model_hidden_1st 384
14
+ d_hidden_dec: &var_model_hidden_2nd 192
15
+ n_head: &var_n_head 4
16
+ kernel_size: &var_kernel_size 7
17
+ rope_theta: &var_rope_theta 10000
18
+ num_frequency_bin_max: &num_frequency_bin_max 961
19
+
20
+ # -- mamba (online) --
21
+ d_state: &var_d_state 16
22
+ d_conv_mamba: &var_kernel_mamba 3
23
+ expand_mamba: &var_expand_mamba 4
24
+
25
+ # -- global --
26
+ fs_list: &var_fs_list ['8000', '16000', '22050', '24000', '32000', '44100', '48000']
27
+ ssl_model_key: &var_SSL_model_key "microsoft/wavlm-large"
28
+ win_48k: &var_win_48k [1920]
29
+ win_48k_disc: &var_win_48k_disc [20, 40, 60, 80, 100]
30
+
31
+ # ============================== Dataset =============================== #
32
+ dataset:
33
+ to48k:
34
+ max_len: 3
35
+ sample_rate_src: 48000
36
+ sample_rate_in: 16000
37
+ db_root: "/home/DB/VCTK"
38
+ rir_dir: "/home/DB/DNS_RIR_48k"
39
+ scp_dir: "data/scp/scp_VCTK"
40
+ train:
41
+ spk: "tr_s.scp"
42
+ noise: "tr_n.scp"
43
+ valid:
44
+ spk: "cv_s.scp"
45
+ noise: "tr_n.scp"
46
+ synthesis_config:
47
+ multi_spk_prob: 0.2
48
+ rir:
49
+ prob: 0.5
50
+ rir_sidelobe: 1
51
+ noise:
52
+ SNR_range: [0, 20]
53
+ c_SNR_range: [0, 20]
54
+ c_beta_range: [0.5, 1.5]
55
+ BPF:
56
+ prob: 0.5
57
+ fir_filter_beta: [0.25, 1.0]
58
+ low_cutoff_freq_range: [1000, 3000]
59
+ clipping:
60
+ prob: 0.5
61
+ clipping_level_range: [-15, 0]
62
+ level:
63
+ target_dB_FS: [-35, -15]
64
+ dataset_test:
65
+ testset_key: "VCTK_SR"
66
+ tensorboard_logging: true
67
+ input_eval: true
68
+ output_eval: true
69
+ VCTK_SR:
70
+ clean_dir: "/home/DB/VCTK-Corpus-0.92/wav48_silence_trimmed/test"
71
+ noisy_dir: "/home/DB/VCTK-Corpus-0.92/wav48_silence_trimmed/test"
72
+ VoxCeleb:
73
+ sample_rate_src: 48000
74
+ # ============================== Dataloader ============================ #
75
+ dataloader:
76
+ batch_size: 2
77
+ pin_memory: false
78
+ num_workers: 0
79
+ drop_last: false
80
+ # ================================ STFT ================================ #
81
+ stft:
82
+ frame_length: 40
83
+ frame_shift: 20
84
+ # =============================== Model ================================ #
85
+ model:
86
+ online: *var_online
87
+ input_embedding:
88
+ online: *var_online
89
+ d_model: *var_model_channels_1st
90
+ d_freq: *num_frequency_bin_max
91
+ freq_pe: True
92
+ freq_linear:
93
+ seq_len: *num_frequency_bin_max
94
+ proj_len: 512
95
+ n_heads: *var_n_head
96
+ kv_shared: True
97
+ encoder_stage:
98
+ block_type: 'Encoder'
99
+ RoPE:
100
+ d_model: *var_model_channels_1st
101
+ n_head: *var_n_head
102
+ theta: *var_rope_theta
103
+ TF_block_Stage:
104
+ online: *var_online
105
+ time_module:
106
+ offline:
107
+ d_model: *var_model_channels_1st
108
+ d_hidden: *var_model_hidden_1st
109
+ n_head: *var_n_head
110
+ kernel_size: *var_kernel_size
111
+ dropout_rate: 0.00
112
+ online:
113
+ d_model: *var_model_channels_1st
114
+ d_state: *var_d_state
115
+ d_conv: *var_kernel_mamba
116
+ expand: *var_expand_mamba
117
+ dropout_rate: 0.00
118
+ freq_module:
119
+ d_model: *var_model_channels_1st
120
+ d_hidden: *var_model_hidden_1st
121
+ n_head: *var_n_head
122
+ kernel_size: *var_kernel_size
123
+ dropout_rate: 0.00
124
+ num_repeat: 6
125
+ freq_upsampler:
126
+ d_model: *var_model_channels_1st
127
+ d_model_out: *var_model_channels_2nd
128
+ d_freq_min: 161
129
+ d_freq_max: *num_frequency_bin_max
130
+ decoder_stage:
131
+ block_type: 'Decoder'
132
+ RoPE:
133
+ d_model: *var_model_channels_2nd
134
+ n_head: *var_n_head
135
+ theta: *var_rope_theta
136
+ TF_block_Stage:
137
+ online: *var_online
138
+ time_module:
139
+ offline:
140
+ d_model: *var_model_channels_2nd
141
+ d_hidden: *var_model_hidden_2nd
142
+ n_head: *var_n_head
143
+ kernel_size: *var_kernel_size
144
+ dropout_rate: 0.00
145
+ online:
146
+ d_model: *var_model_channels_2nd
147
+ d_state: *var_d_state
148
+ d_conv: *var_kernel_mamba
149
+ expand: *var_expand_mamba
150
+ dropout_rate: 0.00
151
+ freq_module:
152
+ d_model: *var_model_channels_2nd
153
+ d_model_kv: *var_model_channels_1st
154
+ d_hidden: *var_model_hidden_2nd
155
+ n_head: *var_n_head
156
+ kernel_size: *var_kernel_size
157
+ dropout_rate: 0.00
158
+ num_repeat: 3
159
+ output_spec:
160
+ online: *var_online
161
+ d_model: *var_model_channels_2nd
162
+ # ============================== Training ============================== #
163
+ engine:
164
+ prob_effect:
165
+ downsample_8k: 0.25
166
+ codec: 0.3
167
+ crystalizer: 0.15
168
+ flanger: 0.05
169
+ crusher: 0.1
170
+ subset:
171
+ train:
172
+ subset: true
173
+ num_per_epoch: 20000
174
+ valid:
175
+ subset: true
176
+ num_per_epoch: 2000
177
+ pretrain_to48k:
178
+ downsample_src:
179
+ prob: 0.6
180
+ fs_list_src: [16000, 24000, 44100]
181
+ loss_enhance:
182
+ tau: 1.0e-4
183
+ window_size: *var_win_48k
184
+ loss_time:
185
+ beta: 1.0e-3
186
+ loss_rep:
187
+ model_key: *var_SSL_model_key
188
+ resampler:
189
+ orig_freq: 48000
190
+ new_freq: 16000
191
+ loss_weight:
192
+ se: 1.0
193
+ time: 0.0
194
+ ssl: 1.0e+2
195
+ RandSpecMasking:
196
+ t_len: [0, 10]
197
+ f_len: [0, 10]
198
+ t_num: [0, 2]
199
+ f_num: [0, 3]
200
+ adversarial_to48k:
201
+ downsample_src:
202
+ prob: 0.6
203
+ fs_list_src: [16000, 24000, 44100]
204
+ loss_enhance:
205
+ tau: 1.0e-4
206
+ window_size: *var_win_48k
207
+ loss_time:
208
+ beta: 1.0e-3
209
+ loss_rep:
210
+ model_key: *var_SSL_model_key
211
+ resampler:
212
+ orig_freq: 48000
213
+ new_freq: 16000
214
+ loss_weight:
215
+ se: 1.0
216
+ time: 0.0
217
+ ssl: 1.0e+2
218
+ gan: 1.0e-3
219
+ fm: 0.1
220
+ pesq: 1.0e-4
221
+ RandSpecMasking:
222
+ t_len: [0, 10]
223
+ f_len: [0, 10]
224
+ t_num: [0, 1]
225
+ f_num: [0, 1]
226
+ msstftd:
227
+ filters: 32
228
+ n_ffts_ms: *var_win_48k_disc
229
+ fs_list: *var_fs_list
230
+ sample_validation:
231
+ - 'data/valid_sample/UNIVERSE_sample/0015.wav'
232
+ - 'data/valid_sample/UNIVERSE_sample/0034.wav'
233
+ - 'data/valid_sample/UNIVERSE_sample/0061.wav'
234
+ - 'data/valid_sample/UNIVERSE_sample/0090.wav'
235
+ - 'data/valid_sample/UNIVERSE_sample/0096.wav'
236
+ - 'data/valid_sample/UNIVERSE_sample/0098.wav'
237
+ - 'data/valid_sample/Real_sample/0.wav'
238
+ - 'data/valid_sample/Real_sample/1.wav'
239
+ - 'data/valid_sample/Real_sample/2.wav'
240
+ - 'data/valid_sample/VoxCeleb_sample/f77-id10281-ni6gO5jDLJE-00010.wav'
241
+ - 'data/valid_sample/VoxCeleb_sample/f83-id10282-hgB5ziAudzU-00001.wav'
242
+ - 'data/valid_sample/VoxCeleb_sample/m87-id10271-PfcJLmkhGbk-00007.wav'
243
+ - 'data/valid_sample/VoxCeleb_sample/m89-id10304-jUSC4i_eGHs-00002.wav'
244
+ - 'data/valid_sample/VoxCeleb_sample/m99-id10297-FvbLoirHpx0-00006.wav'
245
+ optimizer: # alternatives: Adam, SGD
246
+ name: "AdamW"
247
+ AdamW:
248
+ lr: 2.0e-4
249
+ betas: [0.9, 0.995]
250
+ weight_decay: 1.0e-2
251
+ optimizer_D: # discriminator optimizer
252
+ name: "AdamW"
253
+ AdamW:
254
+ lr: 2.0e-4
255
+ betas: [0.8, 0.999]
256
+ weight_decay: 1.0e-2
257
+ scheduler: # alternatives: ReduceLROnPlateau, CosineAnnealingLR
258
+ name: "StepLR"
259
+ WarmupConstantSchedule:
260
+ warmup_steps: 10000
261
+ StepLR:
262
+ step_size: 1
263
+ gamma: 0.9
264
+ max_epoch:
265
+ pretrain_to48k: 20
266
+ adversarial_to48k: 20
267
+ gpuid: "1"
268
+ clip_norm: 10
269
+ start_scheduling:
270
+ pretrain_to48k: 10
271
+ adversarial_to48k: 1
272
+ # ============================= Inference ============================== #
273
+ inference:
274
+ alpha: 0.2
275
+ max_iter: 3