{ "model_type": "zipformer-transducer", "architectures": ["ZipformerRnntModel"], "language": "vi", "sample_rate": 16000, "vocab_size": 3000, "tokens": "tokens.txt", "bpe_model": "bpe.model", "pytorch": { "checkpoint": "best-valid-loss.pt", "library": "icefall", "use_model_avg": true }, "base_model": "actableai/zipformer-rnnt-v2", "finetune_dataset": "actableai/vi-meeting-soniox-wer16", "encoder_dim": "192,256,384,512,384,256", "num_encoder_layers": "2,2,3,4,3,2", "downsampling_factor": "1,2,4,8,4,2", "feedforward_dim": "512,768,1024,1536,1024,768", "num_heads": "4,4,4,8,4,4", "encoder_unmasked_dim": "192,192,256,256,256,192", "cnn_module_kernel": "31,31,15,15,15,31", "decoder_dim": 512, "joiner_dim": 512, "use_transducer": true, "use_ctc": false, "feature_dim": 80, "blank_id": 0, "context_size": 2 }