{ "architectures": [ "AudioSegModel" ], "auto_map": { "AutoConfig": "configuration_audioseg.AudioSegConfig", "AutoModel": "modeling_audioseg.AudioSegModel" }, "chunk_size_sec": 6.0, "dtype": "float32", "emb_dim": 384, "encoder_chunk_size_sec": 30.0, "encoder_dim": 1280, "encoder_frames_per_chunk": 1500, "max_frames_per_segment": 512, "model_type": "audioseg", "roformer_dim_feedforward": 2048, "roformer_nhead": 8, "roformer_num_layers": 12, "sample_rate": 16000, "segment_transformer_ff_mult": 4, "segment_transformer_heads": 4, "segment_transformer_num_layers": 3, "threshold": 0.5, "transformers_version": "4.57.0.dev0", "whisper_model": "openai/whisper-large-v3" }