CPF2's picture
Upload folder using huggingface_hub
1458967 verified
Raw
History Blame Contribute Delete
1.49 kB
DASM_HTSAT:
init_kwargs:
backbone_param:
embed_dim: 768
pretrain_model_path: ./pretrained_model/detect_any_sound/htast_mga.pt
lora_config:
cnn_param:
n_in_channel: 1
activation: cg
conv_dropout: 0.5
kernel_size: [3, 3, 3, 3, 3, 3, 3, 3, 3, 3]
padding: [1, 1, 1, 1, 1, 1, 1, 1, 1, 1]
stride: [1, 1, 1, 1, 1, 1, 1, 1, 1, 1]
nb_filters: [ 16, 16, 32, 32, 64, 64, 128, 128, 256, 256]
pooling: [ [ 2, 2 ], [1, 1], [ 2, 2 ],[1, 1], [ 1, 2 ], [ 1, 2], [ 1, 2 ], [ 1, 1 ], [ 1, 2], [1, 1] ]
at_param:
at_decoder_layer: 2
query_projector: True
out_type: "sigmoid"
query_dim: 1024
query: ./pretrained_model/detect_any_sound/text_query/text_query.pt
backbone_upsample_ratio: 15.626 # decode ratio in local gru decoder
decoder_dim: 384
num_heads: 12
decoder: "conformer"
decoder_layer_num: 2
decoder_pos_emd_len: 500
decoder_expand_rate: 1
class_num: 407
train_kwargs:
# windows parameters
encoder_win: False # constant
# temperature parameters
temp_w: 1
val_kwargs:
# windows parameters
encoder_win: False
temp_w: 0.5
test_kwargs:
# windows parameters
encoder_win: False
temp_w: 0.5
feature:
pred_len: 500
n_mels: 64
n_fft: 1024
hopsize: 320
win_length: 1024
fmin: 50
fmax: 14000
audio_max_len: 10
sr: 32000
net_subsample: 2