DASM_HTSAT: init_kwargs: backbone_param: embed_dim: 768 pretrain_model_path: ./pretrained_model/detect_any_sound/htast_mga.pt lora_config: cnn_param: n_in_channel: 1 activation: cg conv_dropout: 0.5 kernel_size: [3, 3, 3, 3, 3, 3, 3, 3, 3, 3] padding: [1, 1, 1, 1, 1, 1, 1, 1, 1, 1] stride: [1, 1, 1, 1, 1, 1, 1, 1, 1, 1] nb_filters: [ 16, 16, 32, 32, 64, 64, 128, 128, 256, 256] pooling: [ [ 2, 2 ], [1, 1], [ 2, 2 ],[1, 1], [ 1, 2 ], [ 1, 2], [ 1, 2 ], [ 1, 1 ], [ 1, 2], [1, 1] ] at_param: at_decoder_layer: 2 query_projector: True out_type: "sigmoid" query_dim: 1024 query: ./pretrained_model/detect_any_sound/text_query/text_query.pt backbone_upsample_ratio: 15.626 # decode ratio in local gru decoder decoder_dim: 384 num_heads: 12 decoder: "conformer" decoder_layer_num: 2 decoder_pos_emd_len: 500 decoder_expand_rate: 1 class_num: 407 train_kwargs: # windows parameters encoder_win: False # constant # temperature parameters temp_w: 1 val_kwargs: # windows parameters encoder_win: False temp_w: 0.5 test_kwargs: # windows parameters encoder_win: False temp_w: 0.5 feature: pred_len: 500 n_mels: 64 n_fft: 1024 hopsize: 320 win_length: 1024 fmin: 50 fmax: 14000 audio_max_len: 10 sr: 32000 net_subsample: 2