Upload folder using huggingface_hub

Browse files

Files changed (3) hide show

config.json +3 -3
model-00001-of-00002.safetensors +2 -2
model.safetensors.index.json +350 -350

config.json CHANGED Viewed

@@ -163,9 +163,7 @@
   "architectures": [
     "QwenOmniWithMimiForConditionalGeneration"
   ],
-  "audio_token_id": 151646,
-  "dtype": "bfloat16",
-  "mimi_config": {
     "_frame_rate": 12.5,
     "_name_or_path": "kyutai/mimi",
     "add_cross_attention": false,
@@ -271,6 +269,8 @@
     "use_streaming": false,
     "vector_quantization_hidden_dimension": 256
   },
   "text_model_config": {
     "_name_or_path": "",
     "add_cross_attention": false,

   "architectures": [
     "QwenOmniWithMimiForConditionalGeneration"
   ],
+  "audio_encoder_config": {
     "_frame_rate": 12.5,
     "_name_or_path": "kyutai/mimi",
     "add_cross_attention": false,
     "use_streaming": false,
     "vector_quantization_hidden_dimension": 256
   },
+  "audio_token_id": 151646,
+  "dtype": "bfloat16",
   "text_model_config": {
     "_name_or_path": "",
     "add_cross_attention": false,

model-00001-of-00002.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:690c657e6eb1fc358ddabbd0152f00388a51fac7f3585abd7b765a67335b063b
-size 4980073234

 version https://git-lfs.github.com/spec/v1
+oid sha256:b7f71de63d73c1881454fc77be7205dc357053d95c716afe516889b039314ab5
+size 4980076386

model.safetensors.index.json CHANGED Viewed

@@ -163,356 +163,356 @@
     "model.adaptor.decoder.norm.weight": "model-00001-of-00002.safetensors",
     "model.adaptor.input_proj.weight": "model-00001-of-00002.safetensors",
     "model.adaptor.output_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.0.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.0.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.11.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.11.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.12.block.1.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.12.block.1.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.12.block.3.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.12.block.3.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.14.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.14.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.2.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.2.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.3.block.1.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.3.block.1.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.3.block.3.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.3.block.3.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.5.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.5.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.6.block.1.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.6.block.1.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.6.block.3.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.6.block.3.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.8.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.8.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.9.block.1.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.9.block.1.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.9.block.3.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder.layers.9.block.3.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.0.input_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.0.mlp.fc1.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.0.mlp.fc2.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.0.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.0.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.0.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.1.input_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.1.mlp.fc1.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.1.mlp.fc2.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.1.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.1.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.1.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.1.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.2.input_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.2.mlp.fc1.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.2.mlp.fc2.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.2.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.2.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.2.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.3.input_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.3.mlp.fc1.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.3.mlp.fc2.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.3.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.3.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.3.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.4.input_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.4.mlp.fc1.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.4.mlp.fc2.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.4.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.4.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.4.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.5.input_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.5.mlp.fc1.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.5.mlp.fc2.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.5.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.5.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.5.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.6.input_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.6.mlp.fc1.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.6.mlp.fc2.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.6.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.6.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.6.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.7.input_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.7.mlp.fc1.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.7.mlp.fc2.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.7.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.7.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.decoder_transformer.layers.7.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.downsample.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.0.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.0.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.1.block.1.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.1.block.1.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.1.block.3.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.1.block.3.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.10.block.1.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.10.block.1.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.10.block.3.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.10.block.3.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.12.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.12.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.14.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.14.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.3.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.3.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.4.block.1.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.4.block.1.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.4.block.3.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.4.block.3.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.6.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.6.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.7.block.1.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.7.block.1.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.7.block.3.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.7.block.3.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.9.conv.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder.layers.9.conv.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.0.input_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.0.mlp.fc1.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.0.mlp.fc2.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.0.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.0.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.0.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.1.input_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.1.mlp.fc1.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.1.mlp.fc2.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.1.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.1.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.1.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.1.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.2.input_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.2.mlp.fc1.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.2.mlp.fc2.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.2.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.2.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.2.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.3.input_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.3.mlp.fc1.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.3.mlp.fc2.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.3.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.3.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.3.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.4.input_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.4.mlp.fc1.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.4.mlp.fc2.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.4.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.4.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.4.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.5.input_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.5.mlp.fc1.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.5.mlp.fc2.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.5.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.5.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.5.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.6.input_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.6.mlp.fc1.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.6.mlp.fc2.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.6.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.6.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.6.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.7.input_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.7.mlp.fc1.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.7.mlp.fc2.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.7.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.7.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.encoder_transformer.layers.7.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.input_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.0.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.0.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.0.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.1.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.1.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.1.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.10.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.10.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.10.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.11.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.11.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.11.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.12.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.12.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.12.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.13.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.13.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.13.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.14.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.14.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.14.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.15.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.15.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.15.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.16.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.16.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.16.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.17.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.17.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.17.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.18.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.18.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.18.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.19.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.19.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.19.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.2.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.2.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.2.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.20.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.20.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.20.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.21.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.21.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.21.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.22.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.22.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.22.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.23.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.23.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.23.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.24.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.24.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.24.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.25.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.25.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.25.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.26.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.26.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.26.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.27.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.27.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.27.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.28.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.28.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.28.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.29.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.29.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.29.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.3.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.3.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.3.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.30.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.30.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.30.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.4.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.4.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.4.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.5.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.5.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.5.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.6.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.6.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.6.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.7.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.7.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.7.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.8.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.8.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.8.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.9.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.9.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.layers.9.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.acoustic_residual_vector_quantizer.output_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.semantic_residual_vector_quantizer.input_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.semantic_residual_vector_quantizer.layers.0.codebook.cluster_usage": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.semantic_residual_vector_quantizer.layers.0.codebook.embed_sum": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.semantic_residual_vector_quantizer.layers.0.codebook.initialized": "model-00001-of-00002.safetensors",
-    "model.mimi.quantizer.semantic_residual_vector_quantizer.output_proj.weight": "model-00001-of-00002.safetensors",
-    "model.mimi.upsample.conv.weight": "model-00001-of-00002.safetensors",
     "model.text_model.embed_tokens.weight": "model-00001-of-00002.safetensors",
     "model.text_model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
     "model.text_model.layers.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors",

     "model.adaptor.decoder.norm.weight": "model-00001-of-00002.safetensors",
     "model.adaptor.input_proj.weight": "model-00001-of-00002.safetensors",
     "model.adaptor.output_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.0.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.0.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.11.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.11.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.12.block.1.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.12.block.1.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.12.block.3.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.12.block.3.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.14.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.14.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.2.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.2.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.3.block.1.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.3.block.1.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.3.block.3.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.3.block.3.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.5.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.5.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.6.block.1.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.6.block.1.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.6.block.3.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.6.block.3.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.8.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.8.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.9.block.1.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.9.block.1.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.9.block.3.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder.layers.9.block.3.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.0.input_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.0.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.0.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.0.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.0.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.0.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.1.input_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.1.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.1.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.1.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.1.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.1.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.1.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.2.input_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.2.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.2.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.2.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.2.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.2.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.3.input_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.3.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.3.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.3.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.3.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.3.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.4.input_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.4.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.4.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.4.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.4.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.4.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.5.input_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.5.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.5.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.5.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.5.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.5.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.6.input_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.6.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.6.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.6.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.6.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.6.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.7.input_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.7.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.7.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.7.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.7.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.decoder_transformer.layers.7.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.downsample.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.0.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.0.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.1.block.1.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.1.block.1.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.1.block.3.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.1.block.3.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.10.block.1.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.10.block.1.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.10.block.3.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.10.block.3.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.12.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.12.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.14.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.14.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.3.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.3.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.4.block.1.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.4.block.1.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.4.block.3.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.4.block.3.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.6.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.6.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.7.block.1.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.7.block.1.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.7.block.3.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.7.block.3.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.9.conv.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder.layers.9.conv.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.0.input_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.0.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.0.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.0.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.0.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.0.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.1.input_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.1.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.1.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.1.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.1.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.1.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.1.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.2.input_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.2.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.2.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.2.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.2.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.2.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.3.input_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.3.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.3.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.3.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.3.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.3.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.4.input_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.4.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.4.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.4.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.4.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.4.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.5.input_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.5.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.5.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.5.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.5.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.5.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.6.input_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.6.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.6.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.6.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.6.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.6.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.7.input_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.7.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.7.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.7.mlp_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.7.post_attention_layernorm.bias": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.encoder_transformer.layers.7.self_attn_layer_scale.scale": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.input_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.0.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.0.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.0.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.1.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.1.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.1.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.10.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.10.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.10.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.11.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.11.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.11.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.12.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.12.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.12.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.13.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.13.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.13.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.14.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.14.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.14.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.15.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.15.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.15.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.16.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.16.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.16.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.17.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.17.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.17.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.18.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.18.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.18.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.19.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.19.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.19.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.2.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.2.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.2.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.20.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.20.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.20.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.21.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.21.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.21.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.22.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.22.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.22.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.23.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.23.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.23.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.24.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.24.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.24.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.25.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.25.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.25.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.26.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.26.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.26.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.27.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.27.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.27.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.28.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.28.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.28.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.29.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.29.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.29.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.3.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.3.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.3.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.30.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.30.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.30.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.4.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.4.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.4.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.5.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.5.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.5.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.6.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.6.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.6.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.7.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.7.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.7.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.8.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.8.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.8.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.9.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.9.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.layers.9.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.acoustic_residual_vector_quantizer.output_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.semantic_residual_vector_quantizer.input_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.semantic_residual_vector_quantizer.layers.0.codebook.cluster_usage": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.semantic_residual_vector_quantizer.layers.0.codebook.embed_sum": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.semantic_residual_vector_quantizer.layers.0.codebook.initialized": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.quantizer.semantic_residual_vector_quantizer.output_proj.weight": "model-00001-of-00002.safetensors",
+    "model.audio_encoder.upsample.conv.weight": "model-00001-of-00002.safetensors",
     "model.text_model.embed_tokens.weight": "model-00001-of-00002.safetensors",
     "model.text_model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
     "model.text_model.layers.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors",