hf-transformers-bot commited on
Commit
8ce29d8
·
verified ·
1 Parent(s): d75dd42

Update tiny models for CohereAsrModel

Browse files
config.json ADDED
@@ -0,0 +1,52 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "CohereAsrModel"
4
+ ],
5
+ "attention_bias": true,
6
+ "attention_dropout": 0.0,
7
+ "bos_token_id": 4,
8
+ "decoder_start_token_id": 85,
9
+ "dtype": "float32",
10
+ "encoder_config": {
11
+ "activation_dropout": 0.0,
12
+ "attention_bias": true,
13
+ "attention_dropout": 0.0,
14
+ "conv_kernel_size": 9,
15
+ "convolution_bias": true,
16
+ "dropout": 0.0,
17
+ "dropout_positions": 0.0,
18
+ "hidden_act": "silu",
19
+ "hidden_size": 16,
20
+ "initializer_range": 0.02,
21
+ "intermediate_size": 32,
22
+ "layerdrop": 0.0,
23
+ "max_position_embeddings": 5000,
24
+ "model_type": "parakeet_encoder",
25
+ "num_attention_heads": 2,
26
+ "num_hidden_layers": 2,
27
+ "num_key_value_heads": 2,
28
+ "num_mel_bins": 8,
29
+ "scale_input": false,
30
+ "subsampling_conv_channels": 8,
31
+ "subsampling_conv_kernel_size": 3,
32
+ "subsampling_conv_stride": 2,
33
+ "subsampling_factor": 4
34
+ },
35
+ "eos_token_id": 3,
36
+ "head_dim": 8,
37
+ "hidden_act": "relu",
38
+ "hidden_size": 16,
39
+ "initializer_range": 0.02,
40
+ "intermediate_size": 32,
41
+ "is_encoder_decoder": true,
42
+ "max_position_embeddings": 1024,
43
+ "model_type": "cohere_asr",
44
+ "num_attention_heads": 2,
45
+ "num_hidden_layers": 2,
46
+ "num_key_value_heads": 2,
47
+ "pad_token_id": 2,
48
+ "tie_word_embeddings": false,
49
+ "transformers_version": "5.16.0.dev0",
50
+ "use_cache": true,
51
+ "vocab_size": 16384
52
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7e980343bc81d9ef2c1b80e599e4db81015fe42228839ec9a639045f19db82e4
3
+ size 1198240
preprocessor_config.json ADDED
@@ -0,0 +1,25 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "auto_map": {
3
+ "AutoFeatureExtractor": "processing_cohere_asr.CohereAsrFeatureExtractor"
4
+ },
5
+ "dither": 1e-05,
6
+ "feature_extractor_type": "CohereAsrFeatureExtractor",
7
+ "feature_size": 128,
8
+ "frame_splicing": 1,
9
+ "hop_length": 160,
10
+ "log": true,
11
+ "max_audio_clip_s": 35.0,
12
+ "min_energy_window_samples": 1600,
13
+ "n_fft": 512,
14
+ "n_window_size": 400,
15
+ "n_window_stride": 160,
16
+ "normalize": "per_feature",
17
+ "overlap_chunk_second": 5.0,
18
+ "pad_to": 0,
19
+ "padding_side": "right",
20
+ "padding_value": 0.0,
21
+ "preemphasis": 0.97,
22
+ "return_attention_mask": true,
23
+ "sampling_rate": 16000,
24
+ "win_length": 400
25
+ }
tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer_config.json ADDED
@@ -0,0 +1,274 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "auto_map": {
4
+ "AutoTokenizer": [
5
+ "tokenization_cohere_asr.CohereAsrTokenizer",
6
+ null
7
+ ]
8
+ },
9
+ "backend": "tokenizers",
10
+ "bos_token": "<|startoftranscript|>",
11
+ "clean_up_tokenization_spaces": false,
12
+ "eos_token": "<|endoftext|>",
13
+ "extra_special_tokens": [
14
+ "<|nospeech|>",
15
+ "<|pnc|>",
16
+ "<|nopnc|>",
17
+ "<|startofcontext|>",
18
+ "<|itn|>",
19
+ "<|noitn|>",
20
+ "<|timestamp|>",
21
+ "<|notimestamp|>",
22
+ "<|diarize|>",
23
+ "<|nodiarize|>",
24
+ "<|spkchange|>",
25
+ "<|audioseparator|>",
26
+ "<|emo:undefined|>",
27
+ "<|emo:neutral|>",
28
+ "<|emo:happy|>",
29
+ "<|emo:sad|>",
30
+ "<|emo:angry|>",
31
+ "<|unklang|>",
32
+ "<|aa|>",
33
+ "<|ab|>",
34
+ "<|af|>",
35
+ "<|ak|>",
36
+ "<|sq|>",
37
+ "<|am|>",
38
+ "<|ar|>",
39
+ "<|an|>",
40
+ "<|hy|>",
41
+ "<|as|>",
42
+ "<|av|>",
43
+ "<|ae|>",
44
+ "<|ay|>",
45
+ "<|az|>",
46
+ "<|bm|>",
47
+ "<|ba|>",
48
+ "<|eu|>",
49
+ "<|be|>",
50
+ "<|bn|>",
51
+ "<|bi|>",
52
+ "<|bs|>",
53
+ "<|br|>",
54
+ "<|bg|>",
55
+ "<|my|>",
56
+ "<|ca|>",
57
+ "<|ch|>",
58
+ "<|ce|>",
59
+ "<|ny|>",
60
+ "<|zh|>",
61
+ "<|cu|>",
62
+ "<|cv|>",
63
+ "<|kw|>",
64
+ "<|co|>",
65
+ "<|cr|>",
66
+ "<|hr|>",
67
+ "<|cs|>",
68
+ "<|da|>",
69
+ "<|dv|>",
70
+ "<|nl|>",
71
+ "<|dz|>",
72
+ "<|en|>",
73
+ "<|eo|>",
74
+ "<|et|>",
75
+ "<|ee|>",
76
+ "<|fo|>",
77
+ "<|fj|>",
78
+ "<|fi|>",
79
+ "<|fr|>",
80
+ "<|fy|>",
81
+ "<|ff|>",
82
+ "<|gd|>",
83
+ "<|gl|>",
84
+ "<|lg|>",
85
+ "<|ka|>",
86
+ "<|de|>",
87
+ "<|el|>",
88
+ "<|kl|>",
89
+ "<|gn|>",
90
+ "<|gu|>",
91
+ "<|ht|>",
92
+ "<|ha|>",
93
+ "<|he|>",
94
+ "<|hz|>",
95
+ "<|hi|>",
96
+ "<|ho|>",
97
+ "<|hu|>",
98
+ "<|is|>",
99
+ "<|io|>",
100
+ "<|ig|>",
101
+ "<|id|>",
102
+ "<|ia|>",
103
+ "<|ie|>",
104
+ "<|iu|>",
105
+ "<|ik|>",
106
+ "<|ga|>",
107
+ "<|it|>",
108
+ "<|ja|>",
109
+ "<|jv|>",
110
+ "<|kn|>",
111
+ "<|kr|>",
112
+ "<|ks|>",
113
+ "<|kk|>",
114
+ "<|km|>",
115
+ "<|ki|>",
116
+ "<|rw|>",
117
+ "<|ky|>",
118
+ "<|kv|>",
119
+ "<|kg|>",
120
+ "<|ko|>",
121
+ "<|kj|>",
122
+ "<|ku|>",
123
+ "<|lo|>",
124
+ "<|la|>",
125
+ "<|lv|>",
126
+ "<|li|>",
127
+ "<|ln|>",
128
+ "<|lt|>",
129
+ "<|lu|>",
130
+ "<|lb|>",
131
+ "<|mk|>",
132
+ "<|mg|>",
133
+ "<|ms|>",
134
+ "<|ml|>",
135
+ "<|mt|>",
136
+ "<|gv|>",
137
+ "<|mi|>",
138
+ "<|mr|>",
139
+ "<|mh|>",
140
+ "<|mn|>",
141
+ "<|na|>",
142
+ "<|nv|>",
143
+ "<|nd|>",
144
+ "<|nr|>",
145
+ "<|ng|>",
146
+ "<|ne|>",
147
+ "<|no|>",
148
+ "<|nb|>",
149
+ "<|nn|>",
150
+ "<|oc|>",
151
+ "<|oj|>",
152
+ "<|or|>",
153
+ "<|om|>",
154
+ "<|os|>",
155
+ "<|pi|>",
156
+ "<|ps|>",
157
+ "<|fa|>",
158
+ "<|pl|>",
159
+ "<|pt|>",
160
+ "<|pa|>",
161
+ "<|qu|>",
162
+ "<|ro|>",
163
+ "<|rm|>",
164
+ "<|rn|>",
165
+ "<|ru|>",
166
+ "<|se|>",
167
+ "<|sm|>",
168
+ "<|sg|>",
169
+ "<|sa|>",
170
+ "<|sc|>",
171
+ "<|sr|>",
172
+ "<|sn|>",
173
+ "<|sd|>",
174
+ "<|si|>",
175
+ "<|sk|>",
176
+ "<|sl|>",
177
+ "<|so|>",
178
+ "<|st|>",
179
+ "<|es|>",
180
+ "<|su|>",
181
+ "<|sw|>",
182
+ "<|ss|>",
183
+ "<|sv|>",
184
+ "<|tl|>",
185
+ "<|ty|>",
186
+ "<|tg|>",
187
+ "<|ta|>",
188
+ "<|tt|>",
189
+ "<|te|>",
190
+ "<|th|>",
191
+ "<|bo|>",
192
+ "<|ti|>",
193
+ "<|to|>",
194
+ "<|ts|>",
195
+ "<|tn|>",
196
+ "<|tr|>",
197
+ "<|tk|>",
198
+ "<|tw|>",
199
+ "<|ug|>",
200
+ "<|uk|>",
201
+ "<|ur|>",
202
+ "<|uz|>",
203
+ "<|ve|>",
204
+ "<|vi|>",
205
+ "<|vo|>",
206
+ "<|wa|>",
207
+ "<|cy|>",
208
+ "<|wo|>",
209
+ "<|xh|>",
210
+ "<|ii|>",
211
+ "<|yi|>",
212
+ "<|yo|>",
213
+ "<|za|>",
214
+ "<|zu|>",
215
+ "<|spk0|>",
216
+ "<|spk1|>",
217
+ "<|spk2|>",
218
+ "<|spk3|>",
219
+ "<|spk4|>",
220
+ "<|spk5|>",
221
+ "<|spk6|>",
222
+ "<|spk7|>",
223
+ "<|spk8|>",
224
+ "<|spk9|>",
225
+ "<|spk10|>",
226
+ "<|spk11|>",
227
+ "<|spk12|>",
228
+ "<|spk13|>",
229
+ "<|spk14|>",
230
+ "<|spk15|>",
231
+ "<|spltoken0|>",
232
+ "<|spltoken1|>",
233
+ "<|spltoken2|>",
234
+ "<|spltoken3|>",
235
+ "<|spltoken4|>",
236
+ "<|spltoken5|>",
237
+ "<|spltoken6|>",
238
+ "<|spltoken7|>",
239
+ "<|spltoken8|>",
240
+ "<|spltoken9|>",
241
+ "<|spltoken10|>",
242
+ "<|spltoken11|>",
243
+ "<|spltoken12|>",
244
+ "<|spltoken13|>",
245
+ "<|spltoken14|>",
246
+ "<|spltoken15|>",
247
+ "<|spltoken16|>",
248
+ "<|spltoken17|>",
249
+ "<|spltoken18|>",
250
+ "<|spltoken19|>",
251
+ "<|spltoken20|>",
252
+ "<|spltoken21|>",
253
+ "<|spltoken22|>",
254
+ "<|spltoken23|>",
255
+ "<|spltoken24|>",
256
+ "<|spltoken25|>",
257
+ "<|spltoken26|>",
258
+ "<|spltoken27|>",
259
+ "<|spltoken28|>",
260
+ "<|spltoken29|>",
261
+ "<|spltoken30|>",
262
+ "<|spltoken31|>",
263
+ "<|spltoken32|>",
264
+ "<|spltoken33|>"
265
+ ],
266
+ "is_local": true,
267
+ "local_files_only": false,
268
+ "model_max_length": 1024,
269
+ "pad_token": "<pad>",
270
+ "sp_model_kwargs": {},
271
+ "split_special_tokens": true,
272
+ "tokenizer_class": "TokenizersBackend",
273
+ "unk_token": "<unk>"
274
+ }