zipformer-rnnt-v3 / config.json
trunghlt's picture
Add zipformer-rnnt-v3: meeting wer16 fine-tune, best-valid-loss, model card
2badf20 verified
Raw
History Blame Contribute Delete
873 Bytes
{
"model_type": "zipformer-transducer",
"architectures": ["ZipformerRnntModel"],
"language": "vi",
"sample_rate": 16000,
"vocab_size": 3000,
"tokens": "tokens.txt",
"bpe_model": "bpe.model",
"pytorch": {
"checkpoint": "best-valid-loss.pt",
"library": "icefall",
"use_model_avg": true
},
"base_model": "actableai/zipformer-rnnt-v2",
"finetune_dataset": "actableai/vi-meeting-soniox-wer16",
"encoder_dim": "192,256,384,512,384,256",
"num_encoder_layers": "2,2,3,4,3,2",
"downsampling_factor": "1,2,4,8,4,2",
"feedforward_dim": "512,768,1024,1536,1024,768",
"num_heads": "4,4,4,8,4,4",
"encoder_unmasked_dim": "192,192,256,256,256,192",
"cnn_module_kernel": "31,31,15,15,15,31",
"decoder_dim": 512,
"joiner_dim": 512,
"use_transducer": true,
"use_ctc": false,
"feature_dim": 80,
"blank_id": 0,
"context_size": 2
}