jiangdongwei commited on
Commit
8f4d327
·
1 Parent(s): 8b8d653

Add model files

Browse files
README.md ADDED
@@ -0,0 +1,34 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ## Environments
2
+ - date: `Thu May 4 10:25:40 EDT 2023`
3
+ - python version: `3.8.16 (default, Mar 2 2023, 03:21:46) [GCC 11.2.0]`
4
+ - espnet version: `espnet 202301`
5
+ - pytorch version: `pytorch 1.8.1`
6
+ - Git hash: `1bd1db914b21bfb5ae5acbe2fc7162e3815ed260`
7
+ - Commit date: `Thu May 4 08:48:15 2023 -0400`
8
+
9
+ ## Model info
10
+ - Model link: https://huggingface.co/espnet/dongwei_ami_vad_rnn
11
+ - ASR config: conf/tuning/train_vad_rnn.yaml
12
+ - Decode config: conf/tuning/decode_rnn.yaml
13
+
14
+ ## exp/vad_train_asr_transformer_raw
15
+ ### PRECISION
16
+
17
+ |dataset|value|
18
+ |---|---|
19
+ |exp/vad_train_asr_transformer_raw/decode_rnn_vad_model_valid.acc.ave/ihm_dev/result.txt|0.9311|
20
+ |exp/vad_train_asr_transformer_raw/decode_rnn_vad_model_valid.acc.ave/ihm_eval/result.txt|0.9547|
21
+
22
+ ### RECALL
23
+
24
+ |dataset|value|
25
+ |---|---|
26
+ |exp/vad_train_asr_transformer_raw/decode_rnn_vad_model_valid.acc.ave/ihm_dev/result.txt|0.9277|
27
+ |exp/vad_train_asr_transformer_raw/decode_rnn_vad_model_valid.acc.ave/ihm_eval/result.txt|0.9412|
28
+
29
+ ### F1_SCORE
30
+
31
+ |dataset|value|
32
+ |---|---|
33
+ |exp/vad_train_asr_transformer_raw/decode_rnn_vad_model_valid.acc.ave/ihm_dev/result.txt|0.9294|
34
+ |exp/vad_train_asr_transformer_raw/decode_rnn_vad_model_valid.acc.ave/ihm_eval/result.txt|0.9479|
vad_train_vad_rnn_raw/README.md ADDED
@@ -0,0 +1,34 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ## Environments
2
+ - date: `Thu May 4 10:25:40 EDT 2023`
3
+ - python version: `3.8.16 (default, Mar 2 2023, 03:21:46) [GCC 11.2.0]`
4
+ - espnet version: `espnet 202301`
5
+ - pytorch version: `pytorch 1.8.1`
6
+ - Git hash: `1bd1db914b21bfb5ae5acbe2fc7162e3815ed260`
7
+ - Commit date: `Thu May 4 08:48:15 2023 -0400`
8
+
9
+ ## Model info
10
+ - Model link: https://huggingface.co/espnet/dongwei_ami_vad_rnn
11
+ - ASR config: conf/tuning/train_vad_rnn.yaml
12
+ - Decode config: conf/tuning/decode_rnn.yaml
13
+
14
+ ## exp/vad_train_asr_transformer_raw
15
+ ### PRECISION
16
+
17
+ |dataset|value|
18
+ |---|---|
19
+ |exp/vad_train_asr_transformer_raw/decode_rnn_vad_model_valid.acc.ave/ihm_dev/result.txt|0.9311|
20
+ |exp/vad_train_asr_transformer_raw/decode_rnn_vad_model_valid.acc.ave/ihm_eval/result.txt|0.9547|
21
+
22
+ ### RECALL
23
+
24
+ |dataset|value|
25
+ |---|---|
26
+ |exp/vad_train_asr_transformer_raw/decode_rnn_vad_model_valid.acc.ave/ihm_dev/result.txt|0.9277|
27
+ |exp/vad_train_asr_transformer_raw/decode_rnn_vad_model_valid.acc.ave/ihm_eval/result.txt|0.9412|
28
+
29
+ ### F1_SCORE
30
+
31
+ |dataset|value|
32
+ |---|---|
33
+ |exp/vad_train_asr_transformer_raw/decode_rnn_vad_model_valid.acc.ave/ihm_dev/result.txt|0.9294|
34
+ |exp/vad_train_asr_transformer_raw/decode_rnn_vad_model_valid.acc.ave/ihm_eval/result.txt|0.9479|
vad_train_vad_rnn_raw/config.yaml ADDED
@@ -0,0 +1,172 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ config: conf/tuning/train_vad_rnn.yaml
2
+ print_config: false
3
+ log_level: INFO
4
+ dry_run: false
5
+ iterator_type: sequence
6
+ output_dir: exp/vad_train_vad_rnn_raw
7
+ ngpu: 1
8
+ seed: 0
9
+ num_workers: 3
10
+ num_att_plot: 3
11
+ dist_backend: nccl
12
+ dist_init_method: env://
13
+ dist_world_size: null
14
+ dist_rank: null
15
+ local_rank: 0
16
+ dist_master_addr: null
17
+ dist_master_port: null
18
+ dist_launcher: null
19
+ multiprocessing_distributed: false
20
+ unused_parameters: false
21
+ sharded_ddp: false
22
+ cudnn_enabled: true
23
+ cudnn_benchmark: false
24
+ cudnn_deterministic: true
25
+ collect_stats: false
26
+ write_collected_feats: false
27
+ max_epoch: 2
28
+ patience: null
29
+ val_scheduler_criterion:
30
+ - valid
31
+ - loss
32
+ early_stopping_criterion:
33
+ - valid
34
+ - loss
35
+ - min
36
+ best_model_criterion:
37
+ - - valid
38
+ - acc
39
+ - max
40
+ keep_nbest_models: 5
41
+ nbest_averaging_interval: 0
42
+ grad_clip: 5.0
43
+ grad_clip_type: 2.0
44
+ grad_noise: false
45
+ accum_grad: 1
46
+ no_forward_run: false
47
+ resume: true
48
+ train_dtype: float32
49
+ use_amp: false
50
+ log_interval: null
51
+ use_matplotlib: true
52
+ use_tensorboard: true
53
+ create_graph_in_tensorboard: false
54
+ use_wandb: false
55
+ wandb_project: null
56
+ wandb_id: null
57
+ wandb_entity: null
58
+ wandb_name: null
59
+ wandb_model_log_interval: -1
60
+ detect_anomaly: false
61
+ pretrain_path: null
62
+ init_param: []
63
+ ignore_init_mismatch: false
64
+ freeze_param: []
65
+ num_iters_per_epoch: null
66
+ batch_size: 20
67
+ valid_batch_size: null
68
+ batch_bins: 14000000
69
+ valid_batch_bins: null
70
+ train_shape_file:
71
+ - exp/vad_stats_raw/train/speech_shape
72
+ - exp/vad_stats_raw/train/text_shape
73
+ valid_shape_file:
74
+ - exp/vad_stats_raw/valid/speech_shape
75
+ - exp/vad_stats_raw/valid/text_shape
76
+ batch_type: numel
77
+ valid_batch_type: null
78
+ fold_length:
79
+ - 80000
80
+ - 150
81
+ sort_in_batch: descending
82
+ sort_batch: descending
83
+ multiple_iterator: false
84
+ chunk_length: 500
85
+ chunk_shift_ratio: 0.5
86
+ num_cache_chunks: 1024
87
+ chunk_excluded_key_prefixes: []
88
+ train_data_path_and_name_and_type:
89
+ - - dump/raw/ihm_train/wav.scp
90
+ - speech
91
+ - sound
92
+ - - dump/raw/ihm_train/text
93
+ - text
94
+ - text
95
+ valid_data_path_and_name_and_type:
96
+ - - dump/raw/ihm_dev/wav.scp
97
+ - speech
98
+ - sound
99
+ - - dump/raw/ihm_dev/text
100
+ - text
101
+ - text
102
+ allow_variable_data_keys: false
103
+ max_cache_size: 0.0
104
+ max_cache_fd: 32
105
+ valid_max_cache_size: null
106
+ exclude_weight_decay: false
107
+ exclude_weight_decay_conf: {}
108
+ optim: adam
109
+ optim_conf:
110
+ lr: 0.003
111
+ scheduler: warmuplr
112
+ scheduler_conf:
113
+ warmup_steps: 25000
114
+ pre_postencoder_norm: false
115
+ init: null
116
+ input_size: null
117
+ use_preprocessor: true
118
+ speech_volume_normalize: null
119
+ rir_scp: null
120
+ rir_apply_prob: 1.0
121
+ noise_scp: null
122
+ noise_apply_prob: 1.0
123
+ noise_db_range: '13_15'
124
+ short_noise_thres: 0.5
125
+ segment_length: 10.0
126
+ frontend: default
127
+ frontend_conf:
128
+ n_fft: 512
129
+ win_length: 400
130
+ hop_length: 160
131
+ fs: 16k
132
+ specaug: specaug
133
+ specaug_conf:
134
+ apply_time_warp: true
135
+ time_warp_window: 5
136
+ time_warp_mode: bicubic
137
+ apply_freq_mask: true
138
+ freq_mask_width_range:
139
+ - 0
140
+ - 30
141
+ num_freq_mask: 2
142
+ apply_time_mask: true
143
+ time_mask_width_range:
144
+ - 0
145
+ - 40
146
+ num_time_mask: 2
147
+ normalize: global_mvn
148
+ normalize_conf:
149
+ stats_file: exp/vad_stats_raw/train/feats_stats.npz
150
+ model: espnet
151
+ model_conf:
152
+ length_normalized_loss: false
153
+ preencoder: null
154
+ preencoder_conf: {}
155
+ encoder: rnn
156
+ encoder_conf:
157
+ rnn_type: gru
158
+ bidirectional: true
159
+ use_projection: true
160
+ num_layers: 4
161
+ hidden_size: 320
162
+ output_size: 320
163
+ dropout: 0.2
164
+ subsample:
165
+ - 1
166
+ - 1
167
+ - 1
168
+ - 1
169
+ required:
170
+ - output_dir
171
+ version: '202304'
172
+ distributed: false
vad_train_vad_rnn_raw/valid.acc.ave.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:03c8dd3748e4f036e67fd609407015af15cc7bba5c39c92315a87223dda6d24c
3
+ size 21256821