{ "architectures": [ "MossAudioTokenizerModel" ], "downsampling_ratios": [ 240, 2, 2, 2 ], "dtype": "float32", "hidden_sizes": [ 768, 768, 768, 1280 ], "input_hidden_sizes": [ 240, 768, 768, 1280 ], "intermediate_sizes": [ 3072, 3072, 3072, 5120 ], "layer_scale_init_value": 0.01, "max_position_embeddings": 2048, "model_type": "moss_audio_tokenizer", "num_attention_heads": [ 12, 12, 12, 20 ], "num_hidden_layers": [ 12, 12, 12, 32 ], "output_hidden_sizes": [ 384, 384, 640, 768 ], "quantizer_config": { "codebook_dim": 8, "codebook_size": 1024, "hidden_size": 512, "input_hidden_size": 768, "model_type": "", "n_codebooks": 32, "output_hidden_size": 768 }, "rope_parameters": { "rope_theta": 10000.0, "rope_type": "default" }, "sampling_rate": 24000, "sliding_window_duration": 10, "transformers_version": "5.15.0.dev0", "use_cache": true }