| { |
| "model_type": "zipformer-transducer", |
| "architectures": ["ZipformerRnntModel"], |
| "language": "vi", |
| "sample_rate": 16000, |
| "vocab_size": 3000, |
| "tokens": "tokens.txt", |
| "bpe_model": "bpe.model", |
| "pytorch": { |
| "checkpoint": "best-valid-loss.pt", |
| "library": "icefall", |
| "use_model_avg": true |
| }, |
| "base_model": "actableai/zipformer-rnnt-v2", |
| "finetune_dataset": "actableai/vi-meeting-soniox-wer16", |
| "encoder_dim": "192,256,384,512,384,256", |
| "num_encoder_layers": "2,2,3,4,3,2", |
| "downsampling_factor": "1,2,4,8,4,2", |
| "feedforward_dim": "512,768,1024,1536,1024,768", |
| "num_heads": "4,4,4,8,4,4", |
| "encoder_unmasked_dim": "192,192,256,256,256,192", |
| "cnn_module_kernel": "31,31,15,15,15,31", |
| "decoder_dim": 512, |
| "joiner_dim": 512, |
| "use_transducer": true, |
| "use_ctc": false, |
| "feature_dim": 80, |
| "blank_id": 0, |
| "context_size": 2 |
| } |
|
|