| DASM_HTSAT: |
| init_kwargs: |
| backbone_param: |
| embed_dim: 768 |
| pretrain_model_path: ./pretrained_model/detect_any_sound/htast_mga.pt |
| lora_config: |
| cnn_param: |
| n_in_channel: 1 |
| activation: cg |
| conv_dropout: 0.5 |
| kernel_size: [3, 3, 3, 3, 3, 3, 3, 3, 3, 3] |
| padding: [1, 1, 1, 1, 1, 1, 1, 1, 1, 1] |
| stride: [1, 1, 1, 1, 1, 1, 1, 1, 1, 1] |
| nb_filters: [ 16, 16, 32, 32, 64, 64, 128, 128, 256, 256] |
| pooling: [ [ 2, 2 ], [1, 1], [ 2, 2 ],[1, 1], [ 1, 2 ], [ 1, 2], [ 1, 2 ], [ 1, 1 ], [ 1, 2], [1, 1] ] |
| at_param: |
| at_decoder_layer: 2 |
| query_projector: True |
| out_type: "sigmoid" |
| query_dim: 1024 |
| query: ./pretrained_model/detect_any_sound/text_query/text_query.pt |
|
|
| backbone_upsample_ratio: 15.626 |
| decoder_dim: 384 |
| num_heads: 12 |
| decoder: "conformer" |
| decoder_layer_num: 2 |
| decoder_pos_emd_len: 500 |
| decoder_expand_rate: 1 |
| class_num: 407 |
|
|
| train_kwargs: |
| |
| encoder_win: False |
| |
| temp_w: 1 |
| |
| val_kwargs: |
| |
| encoder_win: False |
| temp_w: 0.5 |
|
|
| test_kwargs: |
| |
| encoder_win: False |
| temp_w: 0.5 |
|
|
|
|
| feature: |
| pred_len: 500 |
| n_mels: 64 |
| n_fft: 1024 |
| hopsize: 320 |
| win_length: 1024 |
| fmin: 50 |
| fmax: 14000 |
| audio_max_len: 10 |
| sr: 32000 |
| net_subsample: 2 |