Bengali_ASR / models /config.json
riasatsk's picture
Upload folder using huggingface_hub
4ef1ac4 verified
Raw
History Blame Contribute Delete
1.8 kB
{
"display_name": "bengali-asr",
"model_id": "bengali-asr-hybrid-1.0",
"version": "1.0.0",
"original_source": "ai4bharat/indicconformer_stt_bn_hybrid_ctc_rnnt_large",
"original_model": "indicconformer_stt_bn_hybrid_ctc_rnnt_large",
"description": "bengali-asr 1:1 verbatim ONNX — same Conformer-L 120M 17x512 5633 vocab (22*256+blank) + preprocessor wav->logits, rebranded folder but weights/config verbatim for audit. Use with language_id='bn' (Bengali) or any of 22.",
"language_primary": "bn",
"languages_all": [
"as",
"bn",
"brx",
"doi",
"kok",
"gu",
"hi",
"kn",
"ks",
"mai",
"ml",
"mr",
"mni",
"ne",
"or",
"pa",
"sa",
"sat",
"sd",
"ta",
"te",
"ur"
],
"vocab_per_lang": 256,
"vocab_total": 5632,
"vocab_plus_blank": 5633,
"blank_id": 5632,
"blank_is_shared": true,
"sample_rate": 16000,
"architecture": "Conformer-L 120M (17 blocks, 512 dim, 8 heads, subsample 4) + RNNT decoder 640 + joint 640 + aux CTC 5633",
"preprocessor": "AudioToMelSpectrogramPreprocessor n_fft 512 win 400 hop 160 mel 80 log+per_feature (inside ONNX)",
"decoders": [
"ctc",
"rnnt"
],
"input_wav": "wav [B,T] float32 16k mono + wav_len [B] int64 samples",
"output_logits": "ctc_logits [B,T/4,5633] float32 (use language mask for bn: 256+blank)",
"providers": [
"CUDAExecutionProvider",
"CPUExecutionProvider",
"OpenVINOExecutionProvider",
"CoreMLExecutionProvider"
],
"export_date": "2026-08-26",
"onnx_opset": 18,
"rebrand_note": "Folder/models renamed to bengali-asr for new identity, but ONNX metadata keeps original_source for audit; weights are verbatim copy (no slicing like BanglaNeo 257)."
}