{ "display_name": "bengali-asr", "model_id": "bengali-asr-hybrid-1.0", "version": "1.0.0", "original_source": "ai4bharat/indicconformer_stt_bn_hybrid_ctc_rnnt_large", "original_model": "indicconformer_stt_bn_hybrid_ctc_rnnt_large", "description": "bengali-asr 1:1 verbatim ONNX — same Conformer-L 120M 17x512 5633 vocab (22*256+blank) + preprocessor wav->logits, rebranded folder but weights/config verbatim for audit. Use with language_id='bn' (Bengali) or any of 22.", "language_primary": "bn", "languages_all": [ "as", "bn", "brx", "doi", "kok", "gu", "hi", "kn", "ks", "mai", "ml", "mr", "mni", "ne", "or", "pa", "sa", "sat", "sd", "ta", "te", "ur" ], "vocab_per_lang": 256, "vocab_total": 5632, "vocab_plus_blank": 5633, "blank_id": 5632, "blank_is_shared": true, "sample_rate": 16000, "architecture": "Conformer-L 120M (17 blocks, 512 dim, 8 heads, subsample 4) + RNNT decoder 640 + joint 640 + aux CTC 5633", "preprocessor": "AudioToMelSpectrogramPreprocessor n_fft 512 win 400 hop 160 mel 80 log+per_feature (inside ONNX)", "decoders": [ "ctc", "rnnt" ], "input_wav": "wav [B,T] float32 16k mono + wav_len [B] int64 samples", "output_logits": "ctc_logits [B,T/4,5633] float32 (use language mask for bn: 256+blank)", "providers": [ "CUDAExecutionProvider", "CPUExecutionProvider", "OpenVINOExecutionProvider", "CoreMLExecutionProvider" ], "export_date": "2026-08-26", "onnx_opset": 18, "rebrand_note": "Folder/models renamed to bengali-asr for new identity, but ONNX metadata keeps original_source for audit; weights are verbatim copy (no slicing like BanglaNeo 257)." }