zylin12 commited on
Commit
0844c4a
·
verified ·
1 Parent(s): e0aab30

Upload MOSS-Transcribe-Diarize pretrained model files

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
added_tokens.json ADDED
@@ -0,0 +1,31 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "</think>": 151668,
3
+ "</tool_call>": 151658,
4
+ "</tool_response>": 151666,
5
+ "<think>": 151667,
6
+ "<tool_call>": 151657,
7
+ "<tool_response>": 151665,
8
+ "<|audio_end|>": 151670,
9
+ "<|audio_pad|>": 151671,
10
+ "<|audio_start|>": 151669,
11
+ "<|box_end|>": 151649,
12
+ "<|box_start|>": 151648,
13
+ "<|endoftext|>": 151643,
14
+ "<|file_sep|>": 151664,
15
+ "<|fim_middle|>": 151660,
16
+ "<|fim_pad|>": 151662,
17
+ "<|fim_prefix|>": 151659,
18
+ "<|fim_suffix|>": 151661,
19
+ "<|im_end|>": 151645,
20
+ "<|im_start|>": 151644,
21
+ "<|image_pad|>": 151655,
22
+ "<|object_ref_end|>": 151647,
23
+ "<|object_ref_start|>": 151646,
24
+ "<|quad_end|>": 151651,
25
+ "<|quad_start|>": 151650,
26
+ "<|repo_name|>": 151663,
27
+ "<|video_pad|>": 151656,
28
+ "<|vision_end|>": 151653,
29
+ "<|vision_pad|>": 151654,
30
+ "<|vision_start|>": 151652
31
+ }
chat_template.jinja ADDED
@@ -0,0 +1,103 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- macro render_content(content) -%}
2
+ {%- if content is string -%}
3
+ {{- content -}}
4
+ {%- else -%}
5
+ {%- for item in content -%}
6
+ {%- if item.type == 'audio' or 'audio' in item or 'audio_url' in item -%}
7
+ {{- '<|audio_start|><|audio_pad|><|audio_end|>\n' -}}
8
+ {%- elif item.type == 'text' -%}
9
+ {{- item.text -}}
10
+ {%- endif -%}
11
+ {%- endfor -%}
12
+ {%- endif -%}
13
+ {%- endmacro -%}
14
+ {%- if tools %}
15
+ {{- '<|im_start|>system\n' }}
16
+ {%- if messages[0].role == 'system' %}
17
+ {{- render_content(messages[0].content) + '\n\n' }}
18
+ {%- else %}
19
+ {{- 'You are a helpful assistant.\n\n' }}
20
+ {%- endif %}
21
+ {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within <tools></tools> XML tags:\n<tools>" }}
22
+ {%- for tool in tools %}
23
+ {{- "\n" }}
24
+ {{- tool | tojson }}
25
+ {%- endfor %}
26
+ {{- "\n</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call><|im_end|>\n" }}
27
+ {%- else %}
28
+ {%- if messages[0].role == 'system' %}
29
+ {{- '<|im_start|>system\n' + render_content(messages[0].content) + '<|im_end|>\n' }}
30
+ {%- else %}
31
+ {{- '<|im_start|>system\nYou are a helpful assistant.<|im_end|>\n' }}
32
+ {%- endif %}
33
+ {%- endif %}
34
+ {%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
35
+ {%- for message in messages[::-1] %}
36
+ {%- set index = (messages|length - 1) - loop.index0 %}
37
+ {%- set content = render_content(message.content) %}
38
+ {%- if ns.multi_step_tool and message.role == "user" and content is string and not(content.startswith('<tool_response>') and content.endswith('</tool_response>')) %}
39
+ {%- set ns.multi_step_tool = false %}
40
+ {%- set ns.last_query_index = index %}
41
+ {%- endif %}
42
+ {%- endfor %}
43
+ {%- for message in messages %}
44
+ {%- set content = render_content(message.content) %}
45
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) %}
46
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>\n' }}
47
+ {%- elif message.role == "assistant" %}
48
+ {%- set reasoning_content = '' %}
49
+ {%- if message.reasoning_content is string %}
50
+ {%- set reasoning_content = message.reasoning_content %}
51
+ {%- else %}
52
+ {%- if '</think>' in content %}
53
+ {%- set reasoning_content = content.split('</think>')[0].rstrip('\n').split('<think>')[-1].lstrip('\n') %}
54
+ {%- set content = content.split('</think>')[-1].lstrip('\n') %}
55
+ {%- endif %}
56
+ {%- endif %}
57
+ {%- if loop.index0 > ns.last_query_index %}
58
+ {%- if loop.last or (not loop.last and reasoning_content) %}
59
+ {{- '<|im_start|>' + message.role + '\n<think>\n' + reasoning_content.strip('\n') + '\n</think>\n\n' + content.lstrip('\n') }}
60
+ {%- else %}
61
+ {{- '<|im_start|>' + message.role + '\n' + content }}
62
+ {%- endif %}
63
+ {%- else %}
64
+ {{- '<|im_start|>' + message.role + '\n' + content }}
65
+ {%- endif %}
66
+ {%- if message.tool_calls %}
67
+ {%- for tool_call in message.tool_calls %}
68
+ {%- if (loop.first and content) or (not loop.first) %}
69
+ {{- '\n' }}
70
+ {%- endif %}
71
+ {%- if tool_call.function %}
72
+ {%- set tool_call = tool_call.function %}
73
+ {%- endif %}
74
+ {{- '<tool_call>\n{"name": "' }}
75
+ {{- tool_call.name }}
76
+ {{- '", "arguments": ' }}
77
+ {%- if tool_call.arguments is string %}
78
+ {{- tool_call.arguments }}
79
+ {%- else %}
80
+ {{- tool_call.arguments | tojson }}
81
+ {%- endif %}
82
+ {{- '}\n</tool_call>' }}
83
+ {%- endfor %}
84
+ {%- endif %}
85
+ {{- '<|im_end|>\n' }}
86
+ {%- elif message.role == "tool" %}
87
+ {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
88
+ {{- '<|im_start|>user' }}
89
+ {%- endif %}
90
+ {{- '\n<tool_response>\n' }}
91
+ {{- content }}
92
+ {{- '\n</tool_response>' }}
93
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
94
+ {{- '<|im_end|>\n' }}
95
+ {%- endif %}
96
+ {%- endif %}
97
+ {%- endfor %}
98
+ {%- if add_generation_prompt %}
99
+ {{- '<|im_start|>assistant\n' }}
100
+ {%- if enable_thinking is defined and enable_thinking is false %}
101
+ {{- '<think>\n\n</think>\n\n' }}
102
+ {%- endif %}
103
+ {%- endif %}
config.json ADDED
@@ -0,0 +1,83 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "MossTranscribeDiarizeForConditionalGeneration"
4
+ ],
5
+ "auto_map": {
6
+ "AutoConfig": "configuration_moss_transcribe_diarize.MossTranscribeDiarizeConfig",
7
+ "AutoModel": "modeling_moss_transcribe_diarize.MossTranscribeDiarizeModel",
8
+ "AutoModelForCausalLM": "modeling_moss_transcribe_diarize.MossTranscribeDiarizeForConditionalGeneration",
9
+ "AutoProcessor": "processing_moss_transcribe_diarize.MossTranscribeDiarizeProcessor"
10
+ },
11
+ "model_type": "moss_transcribe_diarize",
12
+ "text_config": {
13
+ "model_type": "qwen3",
14
+ "vocab_size": 151936,
15
+ "hidden_size": 1024,
16
+ "intermediate_size": 3072,
17
+ "num_hidden_layers": 28,
18
+ "num_attention_heads": 16,
19
+ "num_key_value_heads": 8,
20
+ "head_dim": 128,
21
+ "hidden_act": "silu",
22
+ "max_position_embeddings": 40960,
23
+ "initializer_range": 0.02,
24
+ "rms_norm_eps": 1e-06,
25
+ "tie_word_embeddings": true,
26
+ "rope_theta": 1000000,
27
+ "attention_bias": false,
28
+ "attention_dropout": 0.0,
29
+ "layer_types": [
30
+ "full_attention",
31
+ "full_attention",
32
+ "full_attention",
33
+ "full_attention",
34
+ "full_attention",
35
+ "full_attention",
36
+ "full_attention",
37
+ "full_attention",
38
+ "full_attention",
39
+ "full_attention",
40
+ "full_attention",
41
+ "full_attention",
42
+ "full_attention",
43
+ "full_attention",
44
+ "full_attention",
45
+ "full_attention",
46
+ "full_attention",
47
+ "full_attention",
48
+ "full_attention",
49
+ "full_attention",
50
+ "full_attention",
51
+ "full_attention",
52
+ "full_attention",
53
+ "full_attention",
54
+ "full_attention",
55
+ "full_attention",
56
+ "full_attention",
57
+ "full_attention"
58
+ ],
59
+ "pad_token_id": 151643,
60
+ "bos_token_id": null,
61
+ "eos_token_id": null
62
+ },
63
+ "audio_config": {
64
+ "model_type": "whisper",
65
+ "num_mel_bins": 80,
66
+ "d_model": 1024,
67
+ "encoder_layers": 24,
68
+ "encoder_attention_heads": 16,
69
+ "encoder_ffn_dim": 4096,
70
+ "max_source_positions": 1500,
71
+ "dropout": 0.0,
72
+ "attention_dropout": 0.0,
73
+ "activation_dropout": 0.0,
74
+ "activation_function": "gelu",
75
+ "encoder_layerdrop": 0.0,
76
+ "scale_embedding": false
77
+ },
78
+ "audio_token_id": 151671,
79
+ "audio_merge_size": 4,
80
+ "adaptor_input_dim": 4096,
81
+ "tie_word_embeddings": true,
82
+ "pad_token_id": 151643
83
+ }
configuration_moss_transcribe_diarize.py ADDED
@@ -0,0 +1,67 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ from transformers import PretrainedConfig
2
+ from transformers.models.qwen3.configuration_qwen3 import Qwen3Config
3
+ from transformers.models.whisper.configuration_whisper import WhisperConfig
4
+
5
+
6
+ class MossTranscribeDiarizeConfig(PretrainedConfig):
7
+ """Configuration for MOSS-Transcribe-Diarize: Qwen3 text backbone + Whisper audio encoder."""
8
+
9
+ model_type = "moss_transcribe_diarize"
10
+ sub_configs = {"text_config": Qwen3Config, "audio_config": WhisperConfig}
11
+ keys_to_ignore_at_inference = ["past_key_values"]
12
+
13
+ def __init__(
14
+ self,
15
+ text_config=None,
16
+ audio_config=None,
17
+ audio_token_id: int = 151671,
18
+ audio_merge_size: int = 4,
19
+ adaptor_input_dim: int | None = None,
20
+ tie_word_embeddings: bool = True,
21
+ **kwargs,
22
+ ):
23
+ if text_config is None:
24
+ text_config = Qwen3Config(
25
+ vocab_size=151936,
26
+ hidden_size=1024,
27
+ intermediate_size=3072,
28
+ num_hidden_layers=28,
29
+ num_attention_heads=16,
30
+ num_key_value_heads=8,
31
+ head_dim=128,
32
+ max_position_embeddings=40960,
33
+ tie_word_embeddings=tie_word_embeddings,
34
+ rope_theta=1_000_000.0,
35
+ layer_types=["full_attention"] * 28,
36
+ )
37
+ elif isinstance(text_config, dict):
38
+ text_config = self.sub_configs["text_config"](**text_config)
39
+
40
+ if audio_config is None:
41
+ audio_config = WhisperConfig(
42
+ num_mel_bins=80,
43
+ d_model=1024,
44
+ encoder_layers=24,
45
+ encoder_attention_heads=16,
46
+ encoder_ffn_dim=4096,
47
+ max_source_positions=1500,
48
+ dropout=0.0,
49
+ attention_dropout=0.0,
50
+ activation_dropout=0.0,
51
+ activation_function="gelu",
52
+ encoder_layerdrop=0.0,
53
+ scale_embedding=False,
54
+ )
55
+ elif isinstance(audio_config, dict):
56
+ audio_config = self.sub_configs["audio_config"](**audio_config)
57
+
58
+ text_config.tie_word_embeddings = tie_word_embeddings
59
+ if not getattr(text_config, "layer_types", None):
60
+ text_config.layer_types = ["full_attention"] * text_config.num_hidden_layers
61
+
62
+ self.text_config = text_config
63
+ self.audio_config = audio_config
64
+ self.audio_token_id = audio_token_id
65
+ self.audio_merge_size = audio_merge_size
66
+ self.adaptor_input_dim = adaptor_input_dim or audio_config.d_model * audio_merge_size
67
+ super().__init__(tie_word_embeddings=tie_word_embeddings, **kwargs)
generation_config.json ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 151643,
3
+ "eos_token_id": 151645,
4
+ "pad_token_id": 151643,
5
+ "max_new_tokens": 5120
6
+ }
merges.txt ADDED
The diff for this file is too large to render. See raw diff
 
model-00000-of-00001.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5b591a5d809df3d7e7ea4221811ecc35a739253213fa22e9bb7122137e1969f8
3
+ size 1817113576
model.safetensors.index.json ADDED
@@ -0,0 +1,690 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "metadata": {
3
+ "total_size": 1817026560
4
+ },
5
+ "weight_map": {
6
+ "model.whisper_encoder.conv1.bias": "model-00000-of-00001.safetensors",
7
+ "model.whisper_encoder.conv1.weight": "model-00000-of-00001.safetensors",
8
+ "model.whisper_encoder.conv2.bias": "model-00000-of-00001.safetensors",
9
+ "model.whisper_encoder.conv2.weight": "model-00000-of-00001.safetensors",
10
+ "model.whisper_encoder.embed_positions.weight": "model-00000-of-00001.safetensors",
11
+ "model.whisper_encoder.layer_norm.bias": "model-00000-of-00001.safetensors",
12
+ "model.whisper_encoder.layer_norm.weight": "model-00000-of-00001.safetensors",
13
+ "model.whisper_encoder.layers.0.fc1.bias": "model-00000-of-00001.safetensors",
14
+ "model.whisper_encoder.layers.0.fc1.weight": "model-00000-of-00001.safetensors",
15
+ "model.whisper_encoder.layers.0.fc2.bias": "model-00000-of-00001.safetensors",
16
+ "model.whisper_encoder.layers.0.fc2.weight": "model-00000-of-00001.safetensors",
17
+ "model.whisper_encoder.layers.0.final_layer_norm.bias": "model-00000-of-00001.safetensors",
18
+ "model.whisper_encoder.layers.0.final_layer_norm.weight": "model-00000-of-00001.safetensors",
19
+ "model.whisper_encoder.layers.0.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
20
+ "model.whisper_encoder.layers.0.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
21
+ "model.whisper_encoder.layers.0.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
22
+ "model.whisper_encoder.layers.0.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
23
+ "model.whisper_encoder.layers.0.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
24
+ "model.whisper_encoder.layers.0.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
25
+ "model.whisper_encoder.layers.0.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
26
+ "model.whisper_encoder.layers.0.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
27
+ "model.whisper_encoder.layers.0.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
28
+ "model.whisper_encoder.layers.1.fc1.bias": "model-00000-of-00001.safetensors",
29
+ "model.whisper_encoder.layers.1.fc1.weight": "model-00000-of-00001.safetensors",
30
+ "model.whisper_encoder.layers.1.fc2.bias": "model-00000-of-00001.safetensors",
31
+ "model.whisper_encoder.layers.1.fc2.weight": "model-00000-of-00001.safetensors",
32
+ "model.whisper_encoder.layers.1.final_layer_norm.bias": "model-00000-of-00001.safetensors",
33
+ "model.whisper_encoder.layers.1.final_layer_norm.weight": "model-00000-of-00001.safetensors",
34
+ "model.whisper_encoder.layers.1.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
35
+ "model.whisper_encoder.layers.1.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
36
+ "model.whisper_encoder.layers.1.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
37
+ "model.whisper_encoder.layers.1.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
38
+ "model.whisper_encoder.layers.1.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
39
+ "model.whisper_encoder.layers.1.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
40
+ "model.whisper_encoder.layers.1.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
41
+ "model.whisper_encoder.layers.1.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
42
+ "model.whisper_encoder.layers.1.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
43
+ "model.whisper_encoder.layers.10.fc1.bias": "model-00000-of-00001.safetensors",
44
+ "model.whisper_encoder.layers.10.fc1.weight": "model-00000-of-00001.safetensors",
45
+ "model.whisper_encoder.layers.10.fc2.bias": "model-00000-of-00001.safetensors",
46
+ "model.whisper_encoder.layers.10.fc2.weight": "model-00000-of-00001.safetensors",
47
+ "model.whisper_encoder.layers.10.final_layer_norm.bias": "model-00000-of-00001.safetensors",
48
+ "model.whisper_encoder.layers.10.final_layer_norm.weight": "model-00000-of-00001.safetensors",
49
+ "model.whisper_encoder.layers.10.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
50
+ "model.whisper_encoder.layers.10.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
51
+ "model.whisper_encoder.layers.10.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
52
+ "model.whisper_encoder.layers.10.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
53
+ "model.whisper_encoder.layers.10.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
54
+ "model.whisper_encoder.layers.10.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
55
+ "model.whisper_encoder.layers.10.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
56
+ "model.whisper_encoder.layers.10.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
57
+ "model.whisper_encoder.layers.10.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
58
+ "model.whisper_encoder.layers.11.fc1.bias": "model-00000-of-00001.safetensors",
59
+ "model.whisper_encoder.layers.11.fc1.weight": "model-00000-of-00001.safetensors",
60
+ "model.whisper_encoder.layers.11.fc2.bias": "model-00000-of-00001.safetensors",
61
+ "model.whisper_encoder.layers.11.fc2.weight": "model-00000-of-00001.safetensors",
62
+ "model.whisper_encoder.layers.11.final_layer_norm.bias": "model-00000-of-00001.safetensors",
63
+ "model.whisper_encoder.layers.11.final_layer_norm.weight": "model-00000-of-00001.safetensors",
64
+ "model.whisper_encoder.layers.11.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
65
+ "model.whisper_encoder.layers.11.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
66
+ "model.whisper_encoder.layers.11.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
67
+ "model.whisper_encoder.layers.11.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
68
+ "model.whisper_encoder.layers.11.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
69
+ "model.whisper_encoder.layers.11.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
70
+ "model.whisper_encoder.layers.11.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
71
+ "model.whisper_encoder.layers.11.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
72
+ "model.whisper_encoder.layers.11.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
73
+ "model.whisper_encoder.layers.12.fc1.bias": "model-00000-of-00001.safetensors",
74
+ "model.whisper_encoder.layers.12.fc1.weight": "model-00000-of-00001.safetensors",
75
+ "model.whisper_encoder.layers.12.fc2.bias": "model-00000-of-00001.safetensors",
76
+ "model.whisper_encoder.layers.12.fc2.weight": "model-00000-of-00001.safetensors",
77
+ "model.whisper_encoder.layers.12.final_layer_norm.bias": "model-00000-of-00001.safetensors",
78
+ "model.whisper_encoder.layers.12.final_layer_norm.weight": "model-00000-of-00001.safetensors",
79
+ "model.whisper_encoder.layers.12.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
80
+ "model.whisper_encoder.layers.12.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
81
+ "model.whisper_encoder.layers.12.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
82
+ "model.whisper_encoder.layers.12.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
83
+ "model.whisper_encoder.layers.12.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
84
+ "model.whisper_encoder.layers.12.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
85
+ "model.whisper_encoder.layers.12.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
86
+ "model.whisper_encoder.layers.12.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
87
+ "model.whisper_encoder.layers.12.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
88
+ "model.whisper_encoder.layers.13.fc1.bias": "model-00000-of-00001.safetensors",
89
+ "model.whisper_encoder.layers.13.fc1.weight": "model-00000-of-00001.safetensors",
90
+ "model.whisper_encoder.layers.13.fc2.bias": "model-00000-of-00001.safetensors",
91
+ "model.whisper_encoder.layers.13.fc2.weight": "model-00000-of-00001.safetensors",
92
+ "model.whisper_encoder.layers.13.final_layer_norm.bias": "model-00000-of-00001.safetensors",
93
+ "model.whisper_encoder.layers.13.final_layer_norm.weight": "model-00000-of-00001.safetensors",
94
+ "model.whisper_encoder.layers.13.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
95
+ "model.whisper_encoder.layers.13.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
96
+ "model.whisper_encoder.layers.13.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
97
+ "model.whisper_encoder.layers.13.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
98
+ "model.whisper_encoder.layers.13.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
99
+ "model.whisper_encoder.layers.13.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
100
+ "model.whisper_encoder.layers.13.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
101
+ "model.whisper_encoder.layers.13.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
102
+ "model.whisper_encoder.layers.13.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
103
+ "model.whisper_encoder.layers.14.fc1.bias": "model-00000-of-00001.safetensors",
104
+ "model.whisper_encoder.layers.14.fc1.weight": "model-00000-of-00001.safetensors",
105
+ "model.whisper_encoder.layers.14.fc2.bias": "model-00000-of-00001.safetensors",
106
+ "model.whisper_encoder.layers.14.fc2.weight": "model-00000-of-00001.safetensors",
107
+ "model.whisper_encoder.layers.14.final_layer_norm.bias": "model-00000-of-00001.safetensors",
108
+ "model.whisper_encoder.layers.14.final_layer_norm.weight": "model-00000-of-00001.safetensors",
109
+ "model.whisper_encoder.layers.14.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
110
+ "model.whisper_encoder.layers.14.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
111
+ "model.whisper_encoder.layers.14.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
112
+ "model.whisper_encoder.layers.14.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
113
+ "model.whisper_encoder.layers.14.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
114
+ "model.whisper_encoder.layers.14.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
115
+ "model.whisper_encoder.layers.14.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
116
+ "model.whisper_encoder.layers.14.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
117
+ "model.whisper_encoder.layers.14.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
118
+ "model.whisper_encoder.layers.15.fc1.bias": "model-00000-of-00001.safetensors",
119
+ "model.whisper_encoder.layers.15.fc1.weight": "model-00000-of-00001.safetensors",
120
+ "model.whisper_encoder.layers.15.fc2.bias": "model-00000-of-00001.safetensors",
121
+ "model.whisper_encoder.layers.15.fc2.weight": "model-00000-of-00001.safetensors",
122
+ "model.whisper_encoder.layers.15.final_layer_norm.bias": "model-00000-of-00001.safetensors",
123
+ "model.whisper_encoder.layers.15.final_layer_norm.weight": "model-00000-of-00001.safetensors",
124
+ "model.whisper_encoder.layers.15.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
125
+ "model.whisper_encoder.layers.15.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
126
+ "model.whisper_encoder.layers.15.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
127
+ "model.whisper_encoder.layers.15.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
128
+ "model.whisper_encoder.layers.15.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
129
+ "model.whisper_encoder.layers.15.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
130
+ "model.whisper_encoder.layers.15.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
131
+ "model.whisper_encoder.layers.15.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
132
+ "model.whisper_encoder.layers.15.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
133
+ "model.whisper_encoder.layers.16.fc1.bias": "model-00000-of-00001.safetensors",
134
+ "model.whisper_encoder.layers.16.fc1.weight": "model-00000-of-00001.safetensors",
135
+ "model.whisper_encoder.layers.16.fc2.bias": "model-00000-of-00001.safetensors",
136
+ "model.whisper_encoder.layers.16.fc2.weight": "model-00000-of-00001.safetensors",
137
+ "model.whisper_encoder.layers.16.final_layer_norm.bias": "model-00000-of-00001.safetensors",
138
+ "model.whisper_encoder.layers.16.final_layer_norm.weight": "model-00000-of-00001.safetensors",
139
+ "model.whisper_encoder.layers.16.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
140
+ "model.whisper_encoder.layers.16.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
141
+ "model.whisper_encoder.layers.16.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
142
+ "model.whisper_encoder.layers.16.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
143
+ "model.whisper_encoder.layers.16.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
144
+ "model.whisper_encoder.layers.16.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
145
+ "model.whisper_encoder.layers.16.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
146
+ "model.whisper_encoder.layers.16.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
147
+ "model.whisper_encoder.layers.16.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
148
+ "model.whisper_encoder.layers.17.fc1.bias": "model-00000-of-00001.safetensors",
149
+ "model.whisper_encoder.layers.17.fc1.weight": "model-00000-of-00001.safetensors",
150
+ "model.whisper_encoder.layers.17.fc2.bias": "model-00000-of-00001.safetensors",
151
+ "model.whisper_encoder.layers.17.fc2.weight": "model-00000-of-00001.safetensors",
152
+ "model.whisper_encoder.layers.17.final_layer_norm.bias": "model-00000-of-00001.safetensors",
153
+ "model.whisper_encoder.layers.17.final_layer_norm.weight": "model-00000-of-00001.safetensors",
154
+ "model.whisper_encoder.layers.17.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
155
+ "model.whisper_encoder.layers.17.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
156
+ "model.whisper_encoder.layers.17.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
157
+ "model.whisper_encoder.layers.17.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
158
+ "model.whisper_encoder.layers.17.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
159
+ "model.whisper_encoder.layers.17.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
160
+ "model.whisper_encoder.layers.17.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
161
+ "model.whisper_encoder.layers.17.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
162
+ "model.whisper_encoder.layers.17.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
163
+ "model.whisper_encoder.layers.18.fc1.bias": "model-00000-of-00001.safetensors",
164
+ "model.whisper_encoder.layers.18.fc1.weight": "model-00000-of-00001.safetensors",
165
+ "model.whisper_encoder.layers.18.fc2.bias": "model-00000-of-00001.safetensors",
166
+ "model.whisper_encoder.layers.18.fc2.weight": "model-00000-of-00001.safetensors",
167
+ "model.whisper_encoder.layers.18.final_layer_norm.bias": "model-00000-of-00001.safetensors",
168
+ "model.whisper_encoder.layers.18.final_layer_norm.weight": "model-00000-of-00001.safetensors",
169
+ "model.whisper_encoder.layers.18.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
170
+ "model.whisper_encoder.layers.18.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
171
+ "model.whisper_encoder.layers.18.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
172
+ "model.whisper_encoder.layers.18.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
173
+ "model.whisper_encoder.layers.18.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
174
+ "model.whisper_encoder.layers.18.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
175
+ "model.whisper_encoder.layers.18.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
176
+ "model.whisper_encoder.layers.18.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
177
+ "model.whisper_encoder.layers.18.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
178
+ "model.whisper_encoder.layers.19.fc1.bias": "model-00000-of-00001.safetensors",
179
+ "model.whisper_encoder.layers.19.fc1.weight": "model-00000-of-00001.safetensors",
180
+ "model.whisper_encoder.layers.19.fc2.bias": "model-00000-of-00001.safetensors",
181
+ "model.whisper_encoder.layers.19.fc2.weight": "model-00000-of-00001.safetensors",
182
+ "model.whisper_encoder.layers.19.final_layer_norm.bias": "model-00000-of-00001.safetensors",
183
+ "model.whisper_encoder.layers.19.final_layer_norm.weight": "model-00000-of-00001.safetensors",
184
+ "model.whisper_encoder.layers.19.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
185
+ "model.whisper_encoder.layers.19.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
186
+ "model.whisper_encoder.layers.19.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
187
+ "model.whisper_encoder.layers.19.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
188
+ "model.whisper_encoder.layers.19.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
189
+ "model.whisper_encoder.layers.19.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
190
+ "model.whisper_encoder.layers.19.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
191
+ "model.whisper_encoder.layers.19.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
192
+ "model.whisper_encoder.layers.19.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
193
+ "model.whisper_encoder.layers.2.fc1.bias": "model-00000-of-00001.safetensors",
194
+ "model.whisper_encoder.layers.2.fc1.weight": "model-00000-of-00001.safetensors",
195
+ "model.whisper_encoder.layers.2.fc2.bias": "model-00000-of-00001.safetensors",
196
+ "model.whisper_encoder.layers.2.fc2.weight": "model-00000-of-00001.safetensors",
197
+ "model.whisper_encoder.layers.2.final_layer_norm.bias": "model-00000-of-00001.safetensors",
198
+ "model.whisper_encoder.layers.2.final_layer_norm.weight": "model-00000-of-00001.safetensors",
199
+ "model.whisper_encoder.layers.2.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
200
+ "model.whisper_encoder.layers.2.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
201
+ "model.whisper_encoder.layers.2.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
202
+ "model.whisper_encoder.layers.2.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
203
+ "model.whisper_encoder.layers.2.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
204
+ "model.whisper_encoder.layers.2.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
205
+ "model.whisper_encoder.layers.2.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
206
+ "model.whisper_encoder.layers.2.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
207
+ "model.whisper_encoder.layers.2.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
208
+ "model.whisper_encoder.layers.20.fc1.bias": "model-00000-of-00001.safetensors",
209
+ "model.whisper_encoder.layers.20.fc1.weight": "model-00000-of-00001.safetensors",
210
+ "model.whisper_encoder.layers.20.fc2.bias": "model-00000-of-00001.safetensors",
211
+ "model.whisper_encoder.layers.20.fc2.weight": "model-00000-of-00001.safetensors",
212
+ "model.whisper_encoder.layers.20.final_layer_norm.bias": "model-00000-of-00001.safetensors",
213
+ "model.whisper_encoder.layers.20.final_layer_norm.weight": "model-00000-of-00001.safetensors",
214
+ "model.whisper_encoder.layers.20.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
215
+ "model.whisper_encoder.layers.20.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
216
+ "model.whisper_encoder.layers.20.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
217
+ "model.whisper_encoder.layers.20.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
218
+ "model.whisper_encoder.layers.20.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
219
+ "model.whisper_encoder.layers.20.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
220
+ "model.whisper_encoder.layers.20.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
221
+ "model.whisper_encoder.layers.20.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
222
+ "model.whisper_encoder.layers.20.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
223
+ "model.whisper_encoder.layers.21.fc1.bias": "model-00000-of-00001.safetensors",
224
+ "model.whisper_encoder.layers.21.fc1.weight": "model-00000-of-00001.safetensors",
225
+ "model.whisper_encoder.layers.21.fc2.bias": "model-00000-of-00001.safetensors",
226
+ "model.whisper_encoder.layers.21.fc2.weight": "model-00000-of-00001.safetensors",
227
+ "model.whisper_encoder.layers.21.final_layer_norm.bias": "model-00000-of-00001.safetensors",
228
+ "model.whisper_encoder.layers.21.final_layer_norm.weight": "model-00000-of-00001.safetensors",
229
+ "model.whisper_encoder.layers.21.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
230
+ "model.whisper_encoder.layers.21.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
231
+ "model.whisper_encoder.layers.21.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
232
+ "model.whisper_encoder.layers.21.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
233
+ "model.whisper_encoder.layers.21.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
234
+ "model.whisper_encoder.layers.21.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
235
+ "model.whisper_encoder.layers.21.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
236
+ "model.whisper_encoder.layers.21.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
237
+ "model.whisper_encoder.layers.21.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
238
+ "model.whisper_encoder.layers.22.fc1.bias": "model-00000-of-00001.safetensors",
239
+ "model.whisper_encoder.layers.22.fc1.weight": "model-00000-of-00001.safetensors",
240
+ "model.whisper_encoder.layers.22.fc2.bias": "model-00000-of-00001.safetensors",
241
+ "model.whisper_encoder.layers.22.fc2.weight": "model-00000-of-00001.safetensors",
242
+ "model.whisper_encoder.layers.22.final_layer_norm.bias": "model-00000-of-00001.safetensors",
243
+ "model.whisper_encoder.layers.22.final_layer_norm.weight": "model-00000-of-00001.safetensors",
244
+ "model.whisper_encoder.layers.22.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
245
+ "model.whisper_encoder.layers.22.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
246
+ "model.whisper_encoder.layers.22.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
247
+ "model.whisper_encoder.layers.22.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
248
+ "model.whisper_encoder.layers.22.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
249
+ "model.whisper_encoder.layers.22.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
250
+ "model.whisper_encoder.layers.22.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
251
+ "model.whisper_encoder.layers.22.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
252
+ "model.whisper_encoder.layers.22.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
253
+ "model.whisper_encoder.layers.23.fc1.bias": "model-00000-of-00001.safetensors",
254
+ "model.whisper_encoder.layers.23.fc1.weight": "model-00000-of-00001.safetensors",
255
+ "model.whisper_encoder.layers.23.fc2.bias": "model-00000-of-00001.safetensors",
256
+ "model.whisper_encoder.layers.23.fc2.weight": "model-00000-of-00001.safetensors",
257
+ "model.whisper_encoder.layers.23.final_layer_norm.bias": "model-00000-of-00001.safetensors",
258
+ "model.whisper_encoder.layers.23.final_layer_norm.weight": "model-00000-of-00001.safetensors",
259
+ "model.whisper_encoder.layers.23.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
260
+ "model.whisper_encoder.layers.23.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
261
+ "model.whisper_encoder.layers.23.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
262
+ "model.whisper_encoder.layers.23.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
263
+ "model.whisper_encoder.layers.23.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
264
+ "model.whisper_encoder.layers.23.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
265
+ "model.whisper_encoder.layers.23.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
266
+ "model.whisper_encoder.layers.23.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
267
+ "model.whisper_encoder.layers.23.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
268
+ "model.whisper_encoder.layers.3.fc1.bias": "model-00000-of-00001.safetensors",
269
+ "model.whisper_encoder.layers.3.fc1.weight": "model-00000-of-00001.safetensors",
270
+ "model.whisper_encoder.layers.3.fc2.bias": "model-00000-of-00001.safetensors",
271
+ "model.whisper_encoder.layers.3.fc2.weight": "model-00000-of-00001.safetensors",
272
+ "model.whisper_encoder.layers.3.final_layer_norm.bias": "model-00000-of-00001.safetensors",
273
+ "model.whisper_encoder.layers.3.final_layer_norm.weight": "model-00000-of-00001.safetensors",
274
+ "model.whisper_encoder.layers.3.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
275
+ "model.whisper_encoder.layers.3.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
276
+ "model.whisper_encoder.layers.3.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
277
+ "model.whisper_encoder.layers.3.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
278
+ "model.whisper_encoder.layers.3.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
279
+ "model.whisper_encoder.layers.3.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
280
+ "model.whisper_encoder.layers.3.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
281
+ "model.whisper_encoder.layers.3.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
282
+ "model.whisper_encoder.layers.3.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
283
+ "model.whisper_encoder.layers.4.fc1.bias": "model-00000-of-00001.safetensors",
284
+ "model.whisper_encoder.layers.4.fc1.weight": "model-00000-of-00001.safetensors",
285
+ "model.whisper_encoder.layers.4.fc2.bias": "model-00000-of-00001.safetensors",
286
+ "model.whisper_encoder.layers.4.fc2.weight": "model-00000-of-00001.safetensors",
287
+ "model.whisper_encoder.layers.4.final_layer_norm.bias": "model-00000-of-00001.safetensors",
288
+ "model.whisper_encoder.layers.4.final_layer_norm.weight": "model-00000-of-00001.safetensors",
289
+ "model.whisper_encoder.layers.4.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
290
+ "model.whisper_encoder.layers.4.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
291
+ "model.whisper_encoder.layers.4.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
292
+ "model.whisper_encoder.layers.4.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
293
+ "model.whisper_encoder.layers.4.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
294
+ "model.whisper_encoder.layers.4.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
295
+ "model.whisper_encoder.layers.4.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
296
+ "model.whisper_encoder.layers.4.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
297
+ "model.whisper_encoder.layers.4.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
298
+ "model.whisper_encoder.layers.5.fc1.bias": "model-00000-of-00001.safetensors",
299
+ "model.whisper_encoder.layers.5.fc1.weight": "model-00000-of-00001.safetensors",
300
+ "model.whisper_encoder.layers.5.fc2.bias": "model-00000-of-00001.safetensors",
301
+ "model.whisper_encoder.layers.5.fc2.weight": "model-00000-of-00001.safetensors",
302
+ "model.whisper_encoder.layers.5.final_layer_norm.bias": "model-00000-of-00001.safetensors",
303
+ "model.whisper_encoder.layers.5.final_layer_norm.weight": "model-00000-of-00001.safetensors",
304
+ "model.whisper_encoder.layers.5.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
305
+ "model.whisper_encoder.layers.5.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
306
+ "model.whisper_encoder.layers.5.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
307
+ "model.whisper_encoder.layers.5.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
308
+ "model.whisper_encoder.layers.5.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
309
+ "model.whisper_encoder.layers.5.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
310
+ "model.whisper_encoder.layers.5.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
311
+ "model.whisper_encoder.layers.5.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
312
+ "model.whisper_encoder.layers.5.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
313
+ "model.whisper_encoder.layers.6.fc1.bias": "model-00000-of-00001.safetensors",
314
+ "model.whisper_encoder.layers.6.fc1.weight": "model-00000-of-00001.safetensors",
315
+ "model.whisper_encoder.layers.6.fc2.bias": "model-00000-of-00001.safetensors",
316
+ "model.whisper_encoder.layers.6.fc2.weight": "model-00000-of-00001.safetensors",
317
+ "model.whisper_encoder.layers.6.final_layer_norm.bias": "model-00000-of-00001.safetensors",
318
+ "model.whisper_encoder.layers.6.final_layer_norm.weight": "model-00000-of-00001.safetensors",
319
+ "model.whisper_encoder.layers.6.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
320
+ "model.whisper_encoder.layers.6.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
321
+ "model.whisper_encoder.layers.6.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
322
+ "model.whisper_encoder.layers.6.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
323
+ "model.whisper_encoder.layers.6.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
324
+ "model.whisper_encoder.layers.6.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
325
+ "model.whisper_encoder.layers.6.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
326
+ "model.whisper_encoder.layers.6.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
327
+ "model.whisper_encoder.layers.6.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
328
+ "model.whisper_encoder.layers.7.fc1.bias": "model-00000-of-00001.safetensors",
329
+ "model.whisper_encoder.layers.7.fc1.weight": "model-00000-of-00001.safetensors",
330
+ "model.whisper_encoder.layers.7.fc2.bias": "model-00000-of-00001.safetensors",
331
+ "model.whisper_encoder.layers.7.fc2.weight": "model-00000-of-00001.safetensors",
332
+ "model.whisper_encoder.layers.7.final_layer_norm.bias": "model-00000-of-00001.safetensors",
333
+ "model.whisper_encoder.layers.7.final_layer_norm.weight": "model-00000-of-00001.safetensors",
334
+ "model.whisper_encoder.layers.7.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
335
+ "model.whisper_encoder.layers.7.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
336
+ "model.whisper_encoder.layers.7.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
337
+ "model.whisper_encoder.layers.7.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
338
+ "model.whisper_encoder.layers.7.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
339
+ "model.whisper_encoder.layers.7.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
340
+ "model.whisper_encoder.layers.7.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
341
+ "model.whisper_encoder.layers.7.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
342
+ "model.whisper_encoder.layers.7.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
343
+ "model.whisper_encoder.layers.8.fc1.bias": "model-00000-of-00001.safetensors",
344
+ "model.whisper_encoder.layers.8.fc1.weight": "model-00000-of-00001.safetensors",
345
+ "model.whisper_encoder.layers.8.fc2.bias": "model-00000-of-00001.safetensors",
346
+ "model.whisper_encoder.layers.8.fc2.weight": "model-00000-of-00001.safetensors",
347
+ "model.whisper_encoder.layers.8.final_layer_norm.bias": "model-00000-of-00001.safetensors",
348
+ "model.whisper_encoder.layers.8.final_layer_norm.weight": "model-00000-of-00001.safetensors",
349
+ "model.whisper_encoder.layers.8.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
350
+ "model.whisper_encoder.layers.8.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
351
+ "model.whisper_encoder.layers.8.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
352
+ "model.whisper_encoder.layers.8.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
353
+ "model.whisper_encoder.layers.8.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
354
+ "model.whisper_encoder.layers.8.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
355
+ "model.whisper_encoder.layers.8.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
356
+ "model.whisper_encoder.layers.8.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
357
+ "model.whisper_encoder.layers.8.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
358
+ "model.whisper_encoder.layers.9.fc1.bias": "model-00000-of-00001.safetensors",
359
+ "model.whisper_encoder.layers.9.fc1.weight": "model-00000-of-00001.safetensors",
360
+ "model.whisper_encoder.layers.9.fc2.bias": "model-00000-of-00001.safetensors",
361
+ "model.whisper_encoder.layers.9.fc2.weight": "model-00000-of-00001.safetensors",
362
+ "model.whisper_encoder.layers.9.final_layer_norm.bias": "model-00000-of-00001.safetensors",
363
+ "model.whisper_encoder.layers.9.final_layer_norm.weight": "model-00000-of-00001.safetensors",
364
+ "model.whisper_encoder.layers.9.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
365
+ "model.whisper_encoder.layers.9.self_attn.out_proj.bias": "model-00000-of-00001.safetensors",
366
+ "model.whisper_encoder.layers.9.self_attn.out_proj.weight": "model-00000-of-00001.safetensors",
367
+ "model.whisper_encoder.layers.9.self_attn.q_proj.bias": "model-00000-of-00001.safetensors",
368
+ "model.whisper_encoder.layers.9.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
369
+ "model.whisper_encoder.layers.9.self_attn.v_proj.bias": "model-00000-of-00001.safetensors",
370
+ "model.whisper_encoder.layers.9.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
371
+ "model.whisper_encoder.layers.9.self_attn_layer_norm.bias": "model-00000-of-00001.safetensors",
372
+ "model.whisper_encoder.layers.9.self_attn_layer_norm.weight": "model-00000-of-00001.safetensors",
373
+ "model.language_model.norm.weight": "model-00000-of-00001.safetensors",
374
+ "model.language_model.layers.0.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
375
+ "model.language_model.layers.0.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
376
+ "model.language_model.layers.0.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
377
+ "model.language_model.layers.0.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
378
+ "model.language_model.layers.0.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
379
+ "model.language_model.layers.0.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
380
+ "model.language_model.layers.0.input_layernorm.weight": "model-00000-of-00001.safetensors",
381
+ "model.language_model.layers.0.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
382
+ "model.language_model.layers.0.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
383
+ "model.language_model.layers.0.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
384
+ "model.language_model.layers.0.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
385
+ "model.language_model.layers.1.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
386
+ "model.language_model.layers.1.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
387
+ "model.language_model.layers.1.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
388
+ "model.language_model.layers.1.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
389
+ "model.language_model.layers.1.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
390
+ "model.language_model.layers.1.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
391
+ "model.language_model.layers.1.input_layernorm.weight": "model-00000-of-00001.safetensors",
392
+ "model.language_model.layers.1.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
393
+ "model.language_model.layers.1.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
394
+ "model.language_model.layers.1.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
395
+ "model.language_model.layers.1.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
396
+ "model.language_model.layers.10.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
397
+ "model.language_model.layers.10.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
398
+ "model.language_model.layers.10.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
399
+ "model.language_model.layers.10.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
400
+ "model.language_model.layers.10.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
401
+ "model.language_model.layers.10.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
402
+ "model.language_model.layers.10.input_layernorm.weight": "model-00000-of-00001.safetensors",
403
+ "model.language_model.layers.10.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
404
+ "model.language_model.layers.10.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
405
+ "model.language_model.layers.10.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
406
+ "model.language_model.layers.10.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
407
+ "model.language_model.layers.11.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
408
+ "model.language_model.layers.11.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
409
+ "model.language_model.layers.11.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
410
+ "model.language_model.layers.11.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
411
+ "model.language_model.layers.11.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
412
+ "model.language_model.layers.11.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
413
+ "model.language_model.layers.11.input_layernorm.weight": "model-00000-of-00001.safetensors",
414
+ "model.language_model.layers.11.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
415
+ "model.language_model.layers.11.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
416
+ "model.language_model.layers.11.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
417
+ "model.language_model.layers.11.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
418
+ "model.language_model.layers.12.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
419
+ "model.language_model.layers.12.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
420
+ "model.language_model.layers.12.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
421
+ "model.language_model.layers.12.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
422
+ "model.language_model.layers.12.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
423
+ "model.language_model.layers.12.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
424
+ "model.language_model.layers.12.input_layernorm.weight": "model-00000-of-00001.safetensors",
425
+ "model.language_model.layers.12.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
426
+ "model.language_model.layers.12.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
427
+ "model.language_model.layers.12.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
428
+ "model.language_model.layers.12.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
429
+ "model.language_model.layers.13.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
430
+ "model.language_model.layers.13.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
431
+ "model.language_model.layers.13.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
432
+ "model.language_model.layers.13.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
433
+ "model.language_model.layers.13.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
434
+ "model.language_model.layers.13.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
435
+ "model.language_model.layers.13.input_layernorm.weight": "model-00000-of-00001.safetensors",
436
+ "model.language_model.layers.13.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
437
+ "model.language_model.layers.13.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
438
+ "model.language_model.layers.13.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
439
+ "model.language_model.layers.13.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
440
+ "model.language_model.layers.14.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
441
+ "model.language_model.layers.14.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
442
+ "model.language_model.layers.14.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
443
+ "model.language_model.layers.14.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
444
+ "model.language_model.layers.14.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
445
+ "model.language_model.layers.14.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
446
+ "model.language_model.layers.14.input_layernorm.weight": "model-00000-of-00001.safetensors",
447
+ "model.language_model.layers.14.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
448
+ "model.language_model.layers.14.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
449
+ "model.language_model.layers.14.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
450
+ "model.language_model.layers.14.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
451
+ "model.language_model.layers.15.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
452
+ "model.language_model.layers.15.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
453
+ "model.language_model.layers.15.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
454
+ "model.language_model.layers.15.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
455
+ "model.language_model.layers.15.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
456
+ "model.language_model.layers.15.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
457
+ "model.language_model.layers.15.input_layernorm.weight": "model-00000-of-00001.safetensors",
458
+ "model.language_model.layers.15.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
459
+ "model.language_model.layers.15.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
460
+ "model.language_model.layers.15.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
461
+ "model.language_model.layers.15.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
462
+ "model.language_model.layers.16.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
463
+ "model.language_model.layers.16.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
464
+ "model.language_model.layers.16.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
465
+ "model.language_model.layers.16.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
466
+ "model.language_model.layers.16.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
467
+ "model.language_model.layers.16.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
468
+ "model.language_model.layers.16.input_layernorm.weight": "model-00000-of-00001.safetensors",
469
+ "model.language_model.layers.16.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
470
+ "model.language_model.layers.16.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
471
+ "model.language_model.layers.16.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
472
+ "model.language_model.layers.16.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
473
+ "model.language_model.layers.17.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
474
+ "model.language_model.layers.17.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
475
+ "model.language_model.layers.17.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
476
+ "model.language_model.layers.17.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
477
+ "model.language_model.layers.17.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
478
+ "model.language_model.layers.17.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
479
+ "model.language_model.layers.17.input_layernorm.weight": "model-00000-of-00001.safetensors",
480
+ "model.language_model.layers.17.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
481
+ "model.language_model.layers.17.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
482
+ "model.language_model.layers.17.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
483
+ "model.language_model.layers.17.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
484
+ "model.language_model.layers.18.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
485
+ "model.language_model.layers.18.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
486
+ "model.language_model.layers.18.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
487
+ "model.language_model.layers.18.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
488
+ "model.language_model.layers.18.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
489
+ "model.language_model.layers.18.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
490
+ "model.language_model.layers.18.input_layernorm.weight": "model-00000-of-00001.safetensors",
491
+ "model.language_model.layers.18.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
492
+ "model.language_model.layers.18.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
493
+ "model.language_model.layers.18.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
494
+ "model.language_model.layers.18.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
495
+ "model.language_model.layers.19.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
496
+ "model.language_model.layers.19.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
497
+ "model.language_model.layers.19.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
498
+ "model.language_model.layers.19.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
499
+ "model.language_model.layers.19.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
500
+ "model.language_model.layers.19.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
501
+ "model.language_model.layers.19.input_layernorm.weight": "model-00000-of-00001.safetensors",
502
+ "model.language_model.layers.19.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
503
+ "model.language_model.layers.19.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
504
+ "model.language_model.layers.19.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
505
+ "model.language_model.layers.19.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
506
+ "model.language_model.layers.2.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
507
+ "model.language_model.layers.2.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
508
+ "model.language_model.layers.2.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
509
+ "model.language_model.layers.2.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
510
+ "model.language_model.layers.2.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
511
+ "model.language_model.layers.2.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
512
+ "model.language_model.layers.2.input_layernorm.weight": "model-00000-of-00001.safetensors",
513
+ "model.language_model.layers.2.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
514
+ "model.language_model.layers.2.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
515
+ "model.language_model.layers.2.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
516
+ "model.language_model.layers.2.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
517
+ "model.language_model.layers.20.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
518
+ "model.language_model.layers.20.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
519
+ "model.language_model.layers.20.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
520
+ "model.language_model.layers.20.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
521
+ "model.language_model.layers.20.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
522
+ "model.language_model.layers.20.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
523
+ "model.language_model.layers.20.input_layernorm.weight": "model-00000-of-00001.safetensors",
524
+ "model.language_model.layers.20.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
525
+ "model.language_model.layers.20.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
526
+ "model.language_model.layers.20.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
527
+ "model.language_model.layers.20.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
528
+ "model.language_model.layers.21.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
529
+ "model.language_model.layers.21.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
530
+ "model.language_model.layers.21.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
531
+ "model.language_model.layers.21.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
532
+ "model.language_model.layers.21.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
533
+ "model.language_model.layers.21.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
534
+ "model.language_model.layers.21.input_layernorm.weight": "model-00000-of-00001.safetensors",
535
+ "model.language_model.layers.21.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
536
+ "model.language_model.layers.21.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
537
+ "model.language_model.layers.21.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
538
+ "model.language_model.layers.21.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
539
+ "model.language_model.layers.22.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
540
+ "model.language_model.layers.22.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
541
+ "model.language_model.layers.22.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
542
+ "model.language_model.layers.22.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
543
+ "model.language_model.layers.22.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
544
+ "model.language_model.layers.22.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
545
+ "model.language_model.layers.22.input_layernorm.weight": "model-00000-of-00001.safetensors",
546
+ "model.language_model.layers.22.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
547
+ "model.language_model.layers.22.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
548
+ "model.language_model.layers.22.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
549
+ "model.language_model.layers.22.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
550
+ "model.language_model.layers.23.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
551
+ "model.language_model.layers.23.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
552
+ "model.language_model.layers.23.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
553
+ "model.language_model.layers.23.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
554
+ "model.language_model.layers.23.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
555
+ "model.language_model.layers.23.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
556
+ "model.language_model.layers.23.input_layernorm.weight": "model-00000-of-00001.safetensors",
557
+ "model.language_model.layers.23.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
558
+ "model.language_model.layers.23.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
559
+ "model.language_model.layers.23.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
560
+ "model.language_model.layers.23.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
561
+ "model.language_model.layers.24.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
562
+ "model.language_model.layers.24.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
563
+ "model.language_model.layers.24.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
564
+ "model.language_model.layers.24.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
565
+ "model.language_model.layers.24.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
566
+ "model.language_model.layers.24.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
567
+ "model.language_model.layers.24.input_layernorm.weight": "model-00000-of-00001.safetensors",
568
+ "model.language_model.layers.24.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
569
+ "model.language_model.layers.24.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
570
+ "model.language_model.layers.24.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
571
+ "model.language_model.layers.24.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
572
+ "model.language_model.layers.25.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
573
+ "model.language_model.layers.25.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
574
+ "model.language_model.layers.25.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
575
+ "model.language_model.layers.25.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
576
+ "model.language_model.layers.25.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
577
+ "model.language_model.layers.25.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
578
+ "model.language_model.layers.25.input_layernorm.weight": "model-00000-of-00001.safetensors",
579
+ "model.language_model.layers.25.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
580
+ "model.language_model.layers.25.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
581
+ "model.language_model.layers.25.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
582
+ "model.language_model.layers.25.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
583
+ "model.language_model.layers.26.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
584
+ "model.language_model.layers.26.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
585
+ "model.language_model.layers.26.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
586
+ "model.language_model.layers.26.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
587
+ "model.language_model.layers.26.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
588
+ "model.language_model.layers.26.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
589
+ "model.language_model.layers.26.input_layernorm.weight": "model-00000-of-00001.safetensors",
590
+ "model.language_model.layers.26.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
591
+ "model.language_model.layers.26.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
592
+ "model.language_model.layers.26.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
593
+ "model.language_model.layers.26.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
594
+ "model.language_model.layers.27.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
595
+ "model.language_model.layers.27.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
596
+ "model.language_model.layers.27.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
597
+ "model.language_model.layers.27.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
598
+ "model.language_model.layers.27.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
599
+ "model.language_model.layers.27.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
600
+ "model.language_model.layers.27.input_layernorm.weight": "model-00000-of-00001.safetensors",
601
+ "model.language_model.layers.27.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
602
+ "model.language_model.layers.27.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
603
+ "model.language_model.layers.27.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
604
+ "model.language_model.layers.27.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
605
+ "model.language_model.layers.3.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
606
+ "model.language_model.layers.3.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
607
+ "model.language_model.layers.3.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
608
+ "model.language_model.layers.3.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
609
+ "model.language_model.layers.3.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
610
+ "model.language_model.layers.3.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
611
+ "model.language_model.layers.3.input_layernorm.weight": "model-00000-of-00001.safetensors",
612
+ "model.language_model.layers.3.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
613
+ "model.language_model.layers.3.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
614
+ "model.language_model.layers.3.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
615
+ "model.language_model.layers.3.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
616
+ "model.language_model.layers.4.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
617
+ "model.language_model.layers.4.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
618
+ "model.language_model.layers.4.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
619
+ "model.language_model.layers.4.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
620
+ "model.language_model.layers.4.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
621
+ "model.language_model.layers.4.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
622
+ "model.language_model.layers.4.input_layernorm.weight": "model-00000-of-00001.safetensors",
623
+ "model.language_model.layers.4.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
624
+ "model.language_model.layers.4.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
625
+ "model.language_model.layers.4.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
626
+ "model.language_model.layers.4.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
627
+ "model.language_model.layers.5.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
628
+ "model.language_model.layers.5.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
629
+ "model.language_model.layers.5.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
630
+ "model.language_model.layers.5.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
631
+ "model.language_model.layers.5.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
632
+ "model.language_model.layers.5.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
633
+ "model.language_model.layers.5.input_layernorm.weight": "model-00000-of-00001.safetensors",
634
+ "model.language_model.layers.5.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
635
+ "model.language_model.layers.5.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
636
+ "model.language_model.layers.5.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
637
+ "model.language_model.layers.5.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
638
+ "model.language_model.layers.6.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
639
+ "model.language_model.layers.6.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
640
+ "model.language_model.layers.6.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
641
+ "model.language_model.layers.6.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
642
+ "model.language_model.layers.6.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
643
+ "model.language_model.layers.6.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
644
+ "model.language_model.layers.6.input_layernorm.weight": "model-00000-of-00001.safetensors",
645
+ "model.language_model.layers.6.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
646
+ "model.language_model.layers.6.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
647
+ "model.language_model.layers.6.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
648
+ "model.language_model.layers.6.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
649
+ "model.language_model.layers.7.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
650
+ "model.language_model.layers.7.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
651
+ "model.language_model.layers.7.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
652
+ "model.language_model.layers.7.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
653
+ "model.language_model.layers.7.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
654
+ "model.language_model.layers.7.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
655
+ "model.language_model.layers.7.input_layernorm.weight": "model-00000-of-00001.safetensors",
656
+ "model.language_model.layers.7.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
657
+ "model.language_model.layers.7.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
658
+ "model.language_model.layers.7.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
659
+ "model.language_model.layers.7.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
660
+ "model.language_model.layers.8.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
661
+ "model.language_model.layers.8.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
662
+ "model.language_model.layers.8.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
663
+ "model.language_model.layers.8.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
664
+ "model.language_model.layers.8.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
665
+ "model.language_model.layers.8.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
666
+ "model.language_model.layers.8.input_layernorm.weight": "model-00000-of-00001.safetensors",
667
+ "model.language_model.layers.8.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
668
+ "model.language_model.layers.8.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
669
+ "model.language_model.layers.8.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
670
+ "model.language_model.layers.8.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
671
+ "model.language_model.layers.9.post_attention_layernorm.weight": "model-00000-of-00001.safetensors",
672
+ "model.language_model.layers.9.mlp.gate_proj.weight": "model-00000-of-00001.safetensors",
673
+ "model.language_model.layers.9.mlp.up_proj.weight": "model-00000-of-00001.safetensors",
674
+ "model.language_model.layers.9.mlp.down_proj.weight": "model-00000-of-00001.safetensors",
675
+ "model.language_model.layers.9.self_attn.k_norm.weight": "model-00000-of-00001.safetensors",
676
+ "model.language_model.layers.9.self_attn.o_proj.weight": "model-00000-of-00001.safetensors",
677
+ "model.language_model.layers.9.input_layernorm.weight": "model-00000-of-00001.safetensors",
678
+ "model.language_model.layers.9.self_attn.q_proj.weight": "model-00000-of-00001.safetensors",
679
+ "model.language_model.layers.9.self_attn.k_proj.weight": "model-00000-of-00001.safetensors",
680
+ "model.language_model.layers.9.self_attn.v_proj.weight": "model-00000-of-00001.safetensors",
681
+ "model.language_model.layers.9.self_attn.q_norm.weight": "model-00000-of-00001.safetensors",
682
+ "model.language_model.embed_tokens.weight": "model-00000-of-00001.safetensors",
683
+ "model.vq_adaptor.layers.0.bias": "model-00000-of-00001.safetensors",
684
+ "model.vq_adaptor.layers.0.weight": "model-00000-of-00001.safetensors",
685
+ "model.vq_adaptor.layers.2.bias": "model-00000-of-00001.safetensors",
686
+ "model.vq_adaptor.layers.2.weight": "model-00000-of-00001.safetensors",
687
+ "model.vq_adaptor.layers.3.bias": "model-00000-of-00001.safetensors",
688
+ "model.vq_adaptor.layers.3.weight": "model-00000-of-00001.safetensors"
689
+ }
690
+ }
modeling_moss_transcribe_diarize.py ADDED
@@ -0,0 +1,368 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ """MossTranscribeDiarizeForConditionalGeneration: Whisper-Medium + VQAdaptor + Qwen3-0.6B.
2
+
3
+ Architecture:
4
+ log-mel input_features -> HF WhisperEncoder
5
+ -> 4x time merge (B, T, 1024) -> (B, T/4, 4096)
6
+ -> VQAdaptor (4096 -> 1024)
7
+ -> masked_scatter into text embeddings
8
+ -> Qwen3-0.6B decoder -> logits
9
+ """
10
+
11
+ from __future__ import annotations
12
+
13
+ from typing import Optional
14
+
15
+ import torch
16
+ from torch import nn
17
+ from transformers import GenerationMixin, PreTrainedModel
18
+ from transformers.modeling_outputs import CausalLMOutputWithPast
19
+ from transformers.models.qwen3.modeling_qwen3 import Qwen3Model
20
+ from transformers.models.whisper.modeling_whisper import WhisperEncoder
21
+ from transformers.utils import torch_compilable_check
22
+
23
+ from .configuration_moss_transcribe_diarize import MossTranscribeDiarizeConfig
24
+
25
+
26
+ class VQAdaptor(nn.Module):
27
+ """Projects merged Whisper features to LM hidden dim.
28
+
29
+ ``Linear(in → hidden) → SiLU → Linear(hidden → hidden) → LayerNorm``
30
+ """
31
+
32
+ def __init__(self, input_dim: int, hidden_size: int, norm_eps: float = 1e-6):
33
+ super().__init__()
34
+ self.layers = nn.Sequential(
35
+ nn.Linear(input_dim, hidden_size, bias=True),
36
+ nn.SiLU(),
37
+ nn.Linear(hidden_size, hidden_size, bias=True),
38
+ nn.LayerNorm(hidden_size, eps=norm_eps, bias=True),
39
+ )
40
+
41
+ def forward(self, x: torch.Tensor) -> torch.Tensor:
42
+ return self.layers(x)
43
+
44
+
45
+ class MossTranscribeDiarizePreTrainedModel(PreTrainedModel):
46
+ config_class = MossTranscribeDiarizeConfig
47
+ base_model_prefix = "model"
48
+ input_modalities = ("audio", "text")
49
+ _no_split_modules = ["Qwen3DecoderLayer", "WhisperEncoderLayer"]
50
+ _skip_keys_device_placement = "past_key_values"
51
+ supports_gradient_checkpointing = True
52
+ _supports_sdpa = True
53
+ _supports_attention_backend = True
54
+
55
+
56
+ class MossTranscribeDiarizeModel(MossTranscribeDiarizePreTrainedModel):
57
+ base_model_prefix = "model"
58
+
59
+ """Single-stream multimodal backbone: Whisper-Medium encoder + Qwen3-0.6B.
60
+
61
+ Audio features are injected into text embeddings via ``masked_scatter`` at
62
+ positions marked by ``audio_token_id`` in ``input_ids``.
63
+ """
64
+
65
+ def __init__(self, config: MossTranscribeDiarizeConfig):
66
+ super().__init__(config)
67
+
68
+ self.language_model: nn.Module = Qwen3Model(config.text_config)
69
+ self.whisper_encoder: nn.Module = WhisperEncoder(config.audio_config)
70
+ self.vq_adaptor: VQAdaptor = VQAdaptor(
71
+ input_dim=config.adaptor_input_dim,
72
+ hidden_size=config.text_config.hidden_size,
73
+ norm_eps=config.text_config.rms_norm_eps,
74
+ )
75
+ self.post_init()
76
+
77
+ def get_input_embeddings(self):
78
+ return self.language_model.embed_tokens
79
+
80
+ def set_input_embeddings(self, value):
81
+ self.language_model.embed_tokens = value
82
+
83
+ # ---- 4x time merge ---------------------------------------------------
84
+
85
+ def time_merge(self, features: torch.Tensor) -> torch.Tensor:
86
+ """``(B, T, D) -> (B, T//M, D*M)`` where M is ``audio_merge_size``."""
87
+ B, T, D = features.shape
88
+ merge_size = int(self.config.audio_merge_size)
89
+ T_trim = (T // merge_size) * merge_size
90
+ return features[:, :T_trim, :].reshape(B, T_trim // merge_size, D * merge_size)
91
+
92
+ # ---- audio feature extraction -----------------------------------------
93
+
94
+ def get_audio_features(
95
+ self,
96
+ input_features: torch.Tensor,
97
+ audio_feature_lengths: torch.LongTensor,
98
+ audio_chunk_mapping: Optional[torch.LongTensor] = None,
99
+ ) -> list[torch.Tensor]:
100
+ """Whisper encoder -> 4x time merge -> VQAdaptor.
101
+
102
+ Returns list of ``(1, N_tokens, hidden_size)`` tensors.
103
+ """
104
+ if input_features is None:
105
+ raise ValueError("input_features must be provided for audio feature extraction.")
106
+ if audio_feature_lengths is None:
107
+ raise ValueError("audio_feature_lengths must be provided with input_features.")
108
+
109
+ device = next(self.whisper_encoder.parameters()).device
110
+ encoder_dtype = next(self.whisper_encoder.parameters()).dtype
111
+ input_features = input_features.to(device=device, dtype=encoder_dtype)
112
+ audio_feature_lengths = audio_feature_lengths.to(device=device)
113
+ if audio_feature_lengths.numel() != input_features.shape[0]:
114
+ raise ValueError(
115
+ "audio_feature_lengths must contain one length per input_features chunk: "
116
+ f"got {audio_feature_lengths.numel()} lengths for {input_features.shape[0]} chunks."
117
+ )
118
+
119
+ whisper_features = self.whisper_encoder(input_features, return_dict=True).last_hidden_state
120
+
121
+ chunk_mapping = (
122
+ audio_chunk_mapping.to(device=device)
123
+ if audio_chunk_mapping is not None
124
+ else torch.zeros(input_features.shape[0], dtype=torch.long, device=device)
125
+ )
126
+ if chunk_mapping.numel() != input_features.shape[0]:
127
+ raise ValueError(
128
+ "audio_chunk_mapping must contain one sample index per input_features chunk: "
129
+ f"got {chunk_mapping.numel()} indices for {input_features.shape[0]} chunks."
130
+ )
131
+
132
+ num_audios = int(chunk_mapping.max().item()) + 1 if chunk_mapping.numel() else 0
133
+ per_audio_chunks = [[] for _ in range(num_audios)]
134
+ for chunk_idx, token_len in enumerate(audio_feature_lengths.tolist()):
135
+ sample_idx = int(chunk_mapping[chunk_idx].item())
136
+ per_audio_chunks[sample_idx].append(
137
+ whisper_features[chunk_idx : chunk_idx + 1, : int(token_len) * 4]
138
+ )
139
+
140
+ adapted = []
141
+ for parts in per_audio_chunks:
142
+ feat = torch.cat(parts, dim=1)
143
+ feat = feat.to(self.dtype)
144
+ merged = self.time_merge(feat)
145
+ adapted.append(self.vq_adaptor(merged))
146
+ return adapted
147
+
148
+ # ---- inject audio into text embeddings --------------------------------
149
+
150
+ def get_placeholder_mask(
151
+ self,
152
+ input_ids: Optional[torch.LongTensor],
153
+ inputs_embeds: torch.FloatTensor,
154
+ audio_features: torch.Tensor,
155
+ ) -> torch.BoolTensor:
156
+ """Return the expanded audio placeholder mask and validate feature count."""
157
+ if input_ids is None:
158
+ special_audio_mask = inputs_embeds == self.get_input_embeddings()(
159
+ torch.tensor(self.config.audio_token_id, dtype=torch.long, device=inputs_embeds.device)
160
+ )
161
+ special_audio_mask = special_audio_mask.all(-1)
162
+ else:
163
+ special_audio_mask = input_ids.to(device=inputs_embeds.device) == self.config.audio_token_id
164
+
165
+ if special_audio_mask.shape != inputs_embeds.shape[:2]:
166
+ raise ValueError(
167
+ "input_ids shape must match the first two dimensions of inputs_embeds: "
168
+ f"got {tuple(special_audio_mask.shape)} and {tuple(inputs_embeds.shape[:2])}."
169
+ )
170
+
171
+ n_audio_tokens = special_audio_mask.sum()
172
+ special_audio_mask = special_audio_mask.unsqueeze(-1).expand_as(inputs_embeds).to(inputs_embeds.device)
173
+ torch_compilable_check(
174
+ inputs_embeds[special_audio_mask].numel() == audio_features.numel(),
175
+ (
176
+ f"Audio features and audio tokens do not match: "
177
+ f"tokens: {n_audio_tokens}, features {audio_features.shape[0]}"
178
+ ),
179
+ )
180
+ return special_audio_mask
181
+
182
+ def inject_audio_features(
183
+ self,
184
+ input_ids,
185
+ inputs_embeds,
186
+ input_features,
187
+ audio_feature_lengths,
188
+ audio_chunk_mapping,
189
+ ):
190
+ """Replace audio placeholder positions with projected audio features."""
191
+ if input_features is None:
192
+ return inputs_embeds
193
+ audio_features = self.get_audio_features(
194
+ input_features=input_features,
195
+ audio_feature_lengths=audio_feature_lengths,
196
+ audio_chunk_mapping=audio_chunk_mapping,
197
+ )
198
+ audio_embeds = torch.cat([f.squeeze(0) for f in audio_features], dim=0)
199
+ audio_embeds = audio_embeds.to(inputs_embeds.device, inputs_embeds.dtype)
200
+ audio_mask = self.get_placeholder_mask(input_ids, inputs_embeds, audio_embeds)
201
+ return inputs_embeds.masked_scatter(audio_mask, audio_embeds)
202
+
203
+ # ---- forward ----------------------------------------------------------
204
+
205
+ def forward(
206
+ self,
207
+ input_ids: Optional[torch.LongTensor] = None,
208
+ attention_mask: Optional[torch.Tensor] = None,
209
+ position_ids: Optional[torch.LongTensor] = None,
210
+ past_key_values=None,
211
+ inputs_embeds: Optional[torch.FloatTensor] = None,
212
+ use_cache: Optional[bool] = None,
213
+ output_attentions: Optional[bool] = None,
214
+ output_hidden_states: Optional[bool] = None,
215
+ return_dict: Optional[bool] = None,
216
+ input_features: Optional[torch.FloatTensor] = None,
217
+ audio_feature_lengths: Optional[torch.LongTensor] = None,
218
+ audio_chunk_mapping: Optional[torch.LongTensor] = None,
219
+ **kwargs,
220
+ ):
221
+ return_dict = True if return_dict is None else return_dict
222
+ if input_ids is None and inputs_embeds is None:
223
+ raise ValueError("You must specify one of input_ids or inputs_embeds.")
224
+ if input_ids is not None and inputs_embeds is not None:
225
+ raise ValueError("You must specify only one of input_ids or inputs_embeds.")
226
+
227
+ if inputs_embeds is None:
228
+ inputs_embeds = self.get_input_embeddings()(input_ids)
229
+ inputs_embeds = self.inject_audio_features(
230
+ input_ids=input_ids,
231
+ inputs_embeds=inputs_embeds,
232
+ input_features=input_features,
233
+ audio_feature_lengths=audio_feature_lengths,
234
+ audio_chunk_mapping=audio_chunk_mapping,
235
+ )
236
+ if output_attentions is not None:
237
+ kwargs["output_attentions"] = output_attentions
238
+ if output_hidden_states is not None:
239
+ kwargs["output_hidden_states"] = output_hidden_states
240
+
241
+ outputs = self.language_model(
242
+ input_ids=None, attention_mask=attention_mask, position_ids=position_ids,
243
+ past_key_values=past_key_values, inputs_embeds=inputs_embeds,
244
+ use_cache=use_cache, **kwargs,
245
+ )
246
+ if not return_dict:
247
+ return outputs.to_tuple()
248
+ return outputs
249
+
250
+
251
+ class MossTranscribeDiarizeForConditionalGeneration(MossTranscribeDiarizePreTrainedModel, GenerationMixin):
252
+ _tied_weights_keys = {"lm_head.weight": "model.language_model.embed_tokens.weight"}
253
+
254
+ def __init__(self, config: MossTranscribeDiarizeConfig):
255
+ super().__init__(config)
256
+ self.model = MossTranscribeDiarizeModel(config)
257
+ self.vocab_size = config.text_config.vocab_size
258
+ self.lm_head = nn.Linear(config.text_config.hidden_size, config.text_config.vocab_size, bias=False)
259
+ self.post_init()
260
+
261
+ def get_input_embeddings(self):
262
+ return self.model.get_input_embeddings()
263
+
264
+ def set_input_embeddings(self, value):
265
+ self.model.set_input_embeddings(value)
266
+
267
+ def get_output_embeddings(self):
268
+ return self.lm_head
269
+
270
+ def set_output_embeddings(self, new_embeddings):
271
+ self.lm_head = new_embeddings
272
+
273
+ def get_audio_features(
274
+ self,
275
+ input_features: torch.Tensor,
276
+ audio_feature_lengths: torch.LongTensor,
277
+ audio_chunk_mapping: Optional[torch.LongTensor] = None,
278
+ ) -> list[torch.Tensor]:
279
+ return self.model.get_audio_features(
280
+ input_features=input_features,
281
+ audio_feature_lengths=audio_feature_lengths,
282
+ audio_chunk_mapping=audio_chunk_mapping,
283
+ )
284
+
285
+ def forward(
286
+ self,
287
+ input_ids: Optional[torch.LongTensor] = None,
288
+ attention_mask: Optional[torch.Tensor] = None,
289
+ position_ids: Optional[torch.LongTensor] = None,
290
+ past_key_values=None,
291
+ inputs_embeds: Optional[torch.FloatTensor] = None,
292
+ labels: Optional[torch.LongTensor] = None,
293
+ use_cache: Optional[bool] = None,
294
+ output_attentions: Optional[bool] = None,
295
+ output_hidden_states: Optional[bool] = None,
296
+ return_dict: Optional[bool] = None,
297
+ input_features: Optional[torch.FloatTensor] = None,
298
+ audio_feature_lengths: Optional[torch.LongTensor] = None,
299
+ audio_chunk_mapping: Optional[torch.LongTensor] = None,
300
+ logits_to_keep: int | torch.Tensor = 0,
301
+ **kwargs,
302
+ ):
303
+ return_dict = True if return_dict is None else return_dict
304
+ outputs = self.model(
305
+ input_ids=input_ids,
306
+ attention_mask=attention_mask,
307
+ position_ids=position_ids,
308
+ past_key_values=past_key_values,
309
+ inputs_embeds=inputs_embeds,
310
+ use_cache=use_cache,
311
+ output_attentions=output_attentions,
312
+ output_hidden_states=output_hidden_states,
313
+ return_dict=True,
314
+ input_features=input_features,
315
+ audio_feature_lengths=audio_feature_lengths,
316
+ audio_chunk_mapping=audio_chunk_mapping,
317
+ **kwargs,
318
+ )
319
+
320
+ hidden_states = outputs.last_hidden_state
321
+ slice_indices = slice(-logits_to_keep, None) if isinstance(logits_to_keep, int) else logits_to_keep
322
+ logits = self.lm_head(hidden_states[:, slice_indices, :])
323
+
324
+ loss = None
325
+ if labels is not None:
326
+ loss = self.loss_function(
327
+ logits=logits,
328
+ labels=labels,
329
+ vocab_size=self.config.text_config.vocab_size,
330
+ **kwargs,
331
+ )
332
+
333
+ if not return_dict:
334
+ output = (logits,) + outputs[1:]
335
+ return (loss,) + output if loss is not None else output
336
+ return CausalLMOutputWithPast(
337
+ loss=loss, logits=logits,
338
+ past_key_values=outputs.past_key_values,
339
+ hidden_states=outputs.hidden_states,
340
+ attentions=outputs.attentions,
341
+ )
342
+
343
+ # ---- generation support -----------------------------------------------
344
+
345
+ def prepare_inputs_for_generation(
346
+ self,
347
+ input_ids,
348
+ past_key_values=None,
349
+ attention_mask=None,
350
+ inputs_embeds=None,
351
+ input_features=None,
352
+ audio_feature_lengths=None,
353
+ audio_chunk_mapping=None,
354
+ is_first_iteration=False,
355
+ use_cache=True,
356
+ **kwargs,
357
+ ):
358
+ model_inputs = super().prepare_inputs_for_generation(
359
+ input_ids,
360
+ past_key_values=past_key_values,
361
+ attention_mask=attention_mask, inputs_embeds=inputs_embeds,
362
+ is_first_iteration=is_first_iteration, use_cache=use_cache, **kwargs,
363
+ )
364
+ if input_features is not None and (is_first_iteration or not use_cache):
365
+ model_inputs["input_features"] = input_features
366
+ model_inputs["audio_feature_lengths"] = audio_feature_lengths
367
+ model_inputs["audio_chunk_mapping"] = audio_chunk_mapping
368
+ return model_inputs
preprocessor_config.json ADDED
@@ -0,0 +1,14 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "chunk_length": 30,
3
+ "dither": 0.0,
4
+ "feature_extractor_type": "WhisperFeatureExtractor",
5
+ "feature_size": 80,
6
+ "hop_length": 160,
7
+ "n_fft": 400,
8
+ "n_samples": 480000,
9
+ "nb_max_frames": 3000,
10
+ "padding_side": "right",
11
+ "padding_value": 0.0,
12
+ "return_attention_mask": false,
13
+ "sampling_rate": 16000
14
+ }
processing_moss_transcribe_diarize.py ADDED
@@ -0,0 +1,272 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ """Processor for MOSS-Transcribe-Diarize audio-text inference."""
2
+
3
+ from __future__ import annotations
4
+
5
+ from typing import Optional, Union
6
+
7
+ import numpy as np
8
+ import torch
9
+ from transformers.feature_extraction_utils import BatchFeature
10
+ from transformers.processing_utils import ProcessingKwargs, ProcessorMixin, Unpack
11
+
12
+
13
+ AUDIO_PAD_TOKEN = "<|audio_pad|>"
14
+ AUDIO_START_TOKEN = "<|audio_start|>"
15
+ AUDIO_END_TOKEN = "<|audio_end|>"
16
+ WHISPER_ENCODER_STRIDE = 2
17
+
18
+
19
+ class MossTranscribeDiarizeProcessorKwargs(ProcessingKwargs, total=False):
20
+ _defaults = {
21
+ "common_kwargs": {
22
+ "return_tensors": "pt",
23
+ },
24
+ "audio_kwargs": {},
25
+ }
26
+
27
+
28
+ def _audio_to_numpy(audio: Union[np.ndarray, torch.Tensor]) -> np.ndarray:
29
+ if torch.is_tensor(audio):
30
+ audio = audio.detach().cpu().numpy()
31
+ audio = np.asarray(audio, dtype=np.float32)
32
+ if audio.ndim > 1:
33
+ audio = np.squeeze(audio)
34
+ if audio.ndim == 0:
35
+ audio = audio.reshape(1)
36
+ if audio.ndim != 1:
37
+ raise ValueError(f"Expected mono audio with shape (num_samples,), got shape {audio.shape}.")
38
+ if audio.shape[0] == 0:
39
+ raise ValueError("Audio must contain at least one sample.")
40
+ return audio
41
+
42
+
43
+ def _pad_or_trim_audio(audio: np.ndarray, length: int) -> np.ndarray:
44
+ if audio.shape[0] > length:
45
+ audio = audio[:length]
46
+ elif audio.shape[0] < length:
47
+ audio = np.pad(audio, (0, length - audio.shape[0]))
48
+ return audio.astype(np.float32, copy=False)
49
+
50
+
51
+ def _compute_audio_token_length(num_samples: int, feature_extractor, audio_merge_size: int) -> int:
52
+ stride = int(feature_extractor.hop_length) * WHISPER_ENCODER_STRIDE * int(audio_merge_size)
53
+ return (int(num_samples) - 1) // stride + 1
54
+
55
+
56
+ def _chunk_audio(
57
+ feature_extractor,
58
+ audio: Union[np.ndarray, torch.Tensor],
59
+ audio_merge_size: int,
60
+ ) -> tuple[np.ndarray, list[int]]:
61
+ audio = _audio_to_numpy(audio)
62
+ n_samples = int(feature_extractor.n_samples)
63
+
64
+ chunks, token_lengths = [], []
65
+ for start in range(0, audio.shape[0], n_samples):
66
+ chunk = audio[start : start + n_samples]
67
+ token_lengths.append(_compute_audio_token_length(chunk.shape[0], feature_extractor, audio_merge_size))
68
+ chunks.append(_pad_or_trim_audio(chunk, n_samples))
69
+ return np.stack(chunks), token_lengths
70
+
71
+
72
+ def _audios_to_input_features(
73
+ feature_extractor,
74
+ audios: list[Union[np.ndarray, torch.Tensor]],
75
+ *,
76
+ audio_merge_size: int,
77
+ feature_extractor_kwargs: Optional[dict] = None,
78
+ ) -> tuple[torch.Tensor, torch.LongTensor, torch.LongTensor]:
79
+ feature_batches, feature_lengths, chunk_mapping = [], [], []
80
+ feature_extractor_kwargs = dict(feature_extractor_kwargs or {})
81
+ feature_extractor_kwargs.update(
82
+ {
83
+ "sampling_rate": int(feature_extractor.sampling_rate),
84
+ "padding": "max_length",
85
+ "return_tensors": "pt",
86
+ }
87
+ )
88
+
89
+ for audio_idx, audio in enumerate(audios):
90
+ chunks, token_lengths = _chunk_audio(feature_extractor, audio, audio_merge_size)
91
+ features = feature_extractor(
92
+ list(chunks),
93
+ **feature_extractor_kwargs,
94
+ )["input_features"]
95
+ feature_batches.append(features)
96
+ feature_lengths.extend(token_lengths)
97
+ chunk_mapping.extend([audio_idx] * len(token_lengths))
98
+
99
+ if feature_batches:
100
+ input_features = torch.cat(feature_batches, dim=0)
101
+ else:
102
+ input_features = torch.empty(
103
+ (0, int(feature_extractor.feature_size), int(feature_extractor.nb_max_frames)),
104
+ )
105
+
106
+ length_device = input_features.device
107
+ return (
108
+ input_features,
109
+ torch.tensor(feature_lengths, dtype=torch.long, device=length_device),
110
+ torch.tensor(chunk_mapping, dtype=torch.long, device=length_device),
111
+ )
112
+
113
+
114
+ class MossTranscribeDiarizeProcessor(ProcessorMixin):
115
+ """Build MOSS-Transcribe-Diarize model inputs from text prompts and raw waveforms.
116
+
117
+ The model consumes log-mel ``input_features``. This processor owns the raw
118
+ waveform preprocessing, audio placeholder expansion, and optional numeric
119
+ time anchors inside the audio span.
120
+ """
121
+
122
+ attributes = ["feature_extractor", "tokenizer"]
123
+ feature_extractor_class = "AutoFeatureExtractor"
124
+ tokenizer_class = "AutoTokenizer"
125
+
126
+ model_input_names = [
127
+ "input_ids",
128
+ "attention_mask",
129
+ "input_features",
130
+ "audio_feature_lengths",
131
+ "audio_chunk_mapping",
132
+ ]
133
+
134
+ def __init__(
135
+ self,
136
+ feature_extractor=None,
137
+ tokenizer=None,
138
+ audio_tokens_per_second: float = 12.5,
139
+ audio_merge_size: int = 4,
140
+ time_marker_every_seconds: int = 2,
141
+ enable_time_marker: bool = True,
142
+ chat_template: Optional[str] = None,
143
+ ):
144
+ if feature_extractor is None:
145
+ raise ValueError("MossTranscribeDiarizeProcessor requires a feature_extractor.")
146
+ if tokenizer is None:
147
+ raise ValueError("MossTranscribeDiarizeProcessor requires a tokenizer.")
148
+ super().__init__(feature_extractor, tokenizer, chat_template=chat_template)
149
+ self.audio_tokens_per_second = audio_tokens_per_second
150
+ self.audio_merge_size = int(audio_merge_size)
151
+ self.time_marker_every_seconds = time_marker_every_seconds
152
+ self.enable_time_marker = enable_time_marker
153
+ self.audio_token = AUDIO_PAD_TOKEN if not hasattr(tokenizer, "audio_token") else tokenizer.audio_token
154
+ self.audio_start_token = (
155
+ AUDIO_START_TOKEN if not hasattr(tokenizer, "audio_start_token") else tokenizer.audio_start_token
156
+ )
157
+ self.audio_end_token = AUDIO_END_TOKEN if not hasattr(tokenizer, "audio_end_token") else tokenizer.audio_end_token
158
+ resolved_audio_token_id = tokenizer.convert_tokens_to_ids(self.audio_token)
159
+ if resolved_audio_token_id is None:
160
+ raise ValueError(f"Tokenizer is missing required audio placeholder token {self.audio_token!r}.")
161
+ self.audio_token_id = int(resolved_audio_token_id)
162
+ self.digit_token_ids = self._get_digit_token_ids()
163
+
164
+ def _get_digit_token_ids(self) -> dict[str, int]:
165
+ digit_token_ids = {}
166
+ for digit in "0123456789":
167
+ ids = self.tokenizer.encode(digit, add_special_tokens=False)
168
+ if len(ids) != 1:
169
+ raise ValueError(f"Digit {digit!r} is not a single token: {ids}")
170
+ digit_token_ids[digit] = int(ids[0])
171
+ return digit_token_ids
172
+
173
+ def _audio_span_ids(self, audio_seq_len: int) -> list[int]:
174
+ audio_seq_len = int(audio_seq_len)
175
+ if not self.enable_time_marker or audio_seq_len <= 0 or self.time_marker_every_seconds <= 0:
176
+ return [self.audio_token_id] * max(audio_seq_len, 0)
177
+
178
+ tokens_per_marker = int(self.audio_tokens_per_second * self.time_marker_every_seconds)
179
+ if tokens_per_marker <= 0:
180
+ return [self.audio_token_id] * audio_seq_len
181
+
182
+ duration = audio_seq_len / float(self.audio_tokens_per_second)
183
+ output, consumed = [], 0
184
+ for sec in range(self.time_marker_every_seconds, int(duration) + 1, self.time_marker_every_seconds):
185
+ pos = (sec // self.time_marker_every_seconds) * tokens_per_marker
186
+ segment_len = pos - consumed
187
+ if segment_len > 0:
188
+ output.extend([self.audio_token_id] * segment_len)
189
+ consumed += segment_len
190
+ marker_ids = [self.digit_token_ids[digit] for digit in str(sec)]
191
+ output.extend(marker_ids)
192
+
193
+ remainder = audio_seq_len - consumed
194
+ if remainder > 0:
195
+ output.extend([self.audio_token_id] * remainder)
196
+ return output
197
+
198
+ def _expand_audio_token(self, text: str, num_audio_tokens: int, max_length: int) -> list[int]:
199
+ audio_ids = self._audio_span_ids(num_audio_tokens)
200
+ audio_token_count = text.count(self.audio_token)
201
+ if audio_token_count != 1:
202
+ raise ValueError(
203
+ f"Expected exactly one {self.audio_token!r} token per text sample, got {audio_token_count}."
204
+ )
205
+ before_audio, after_audio = text.split(self.audio_token, maxsplit=1)
206
+ before_ids = self.tokenizer.encode(before_audio, add_special_tokens=False)
207
+ after_ids = self.tokenizer.encode(after_audio, add_special_tokens=False)
208
+
209
+ input_ids = before_ids + audio_ids + after_ids
210
+
211
+ if len(input_ids) > max_length:
212
+ raise ValueError(f"Prompt/audio sequence exceeds max_length={max_length}")
213
+ return input_ids
214
+
215
+ def __call__(
216
+ self,
217
+ text: Union[str, list[str]],
218
+ audio,
219
+ *,
220
+ max_length: int = 131072,
221
+ **kwargs: Unpack[MossTranscribeDiarizeProcessorKwargs],
222
+ ) -> BatchFeature:
223
+ return_tensors = kwargs.pop("return_tensors", "pt")
224
+ output_kwargs = self._merge_kwargs(
225
+ MossTranscribeDiarizeProcessorKwargs,
226
+ tokenizer_init_kwargs=self.tokenizer.init_kwargs,
227
+ **kwargs,
228
+ )
229
+ if isinstance(text, str):
230
+ texts = [text]
231
+ else:
232
+ texts = list(text)
233
+ audios = audio if isinstance(audio, list) else [audio]
234
+ if len(texts) != len(audios):
235
+ raise ValueError(f"Expected one audio per text prompt, got {len(audios)} audios and {len(texts)} prompts.")
236
+
237
+ input_features, audio_feature_lengths, audio_chunk_mapping = _audios_to_input_features(
238
+ self.feature_extractor,
239
+ audios,
240
+ audio_merge_size=self.audio_merge_size,
241
+ feature_extractor_kwargs=output_kwargs["audio_kwargs"],
242
+ )
243
+ audio_token_counts = torch.zeros(len(audios), dtype=torch.long, device=audio_feature_lengths.device)
244
+ audio_token_counts.scatter_add_(0, audio_chunk_mapping, audio_feature_lengths)
245
+
246
+ encoded = [
247
+ self._expand_audio_token(prompt, int(num_audio_tokens.item()), max_length)
248
+ for prompt, num_audio_tokens in zip(texts, audio_token_counts)
249
+ ]
250
+ max_seq_len = max(len(ids) for ids in encoded)
251
+ pad_token_id = self.tokenizer.pad_token_id
252
+ if pad_token_id is None:
253
+ pad_token_id = self.tokenizer.eos_token_id or 0
254
+
255
+ input_ids, attention_mask = [], []
256
+ for ids in encoded:
257
+ pad_len = max_seq_len - len(ids)
258
+ input_ids.append(ids + [pad_token_id] * pad_len)
259
+ attention_mask.append([1] * len(ids) + [0] * pad_len)
260
+
261
+ target_device = input_features.device
262
+ data = {
263
+ "input_ids": torch.tensor(input_ids, dtype=torch.long, device=target_device),
264
+ "attention_mask": torch.tensor(attention_mask, dtype=torch.long, device=target_device),
265
+ "input_features": input_features,
266
+ "audio_feature_lengths": audio_feature_lengths,
267
+ "audio_chunk_mapping": audio_chunk_mapping,
268
+ }
269
+ return BatchFeature(data=data, tensor_type=return_tensors)
270
+
271
+
272
+ __all__ = ["MossTranscribeDiarizeProcessor"]
processor_config.json ADDED
@@ -0,0 +1,10 @@
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "processor_class": "MossTranscribeDiarizeProcessor",
3
+ "auto_map": {
4
+ "AutoProcessor": "processing_moss_transcribe_diarize.MossTranscribeDiarizeProcessor"
5
+ },
6
+ "audio_tokens_per_second": 12.5,
7
+ "audio_merge_size": 4,
8
+ "time_marker_every_seconds": 5,
9
+ "enable_time_marker": true
10
+ }
special_tokens_map.json ADDED
@@ -0,0 +1,130 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "additional_special_tokens": [
3
+ {
4
+ "content": "<|im_start|>",
5
+ "lstrip": false,
6
+ "normalized": false,
7
+ "rstrip": false,
8
+ "single_word": false
9
+ },
10
+ {
11
+ "content": "<|im_end|>",
12
+ "lstrip": false,
13
+ "normalized": false,
14
+ "rstrip": false,
15
+ "single_word": false
16
+ },
17
+ {
18
+ "content": "<|object_ref_start|>",
19
+ "lstrip": false,
20
+ "normalized": false,
21
+ "rstrip": false,
22
+ "single_word": false
23
+ },
24
+ {
25
+ "content": "<|object_ref_end|>",
26
+ "lstrip": false,
27
+ "normalized": false,
28
+ "rstrip": false,
29
+ "single_word": false
30
+ },
31
+ {
32
+ "content": "<|box_start|>",
33
+ "lstrip": false,
34
+ "normalized": false,
35
+ "rstrip": false,
36
+ "single_word": false
37
+ },
38
+ {
39
+ "content": "<|box_end|>",
40
+ "lstrip": false,
41
+ "normalized": false,
42
+ "rstrip": false,
43
+ "single_word": false
44
+ },
45
+ {
46
+ "content": "<|quad_start|>",
47
+ "lstrip": false,
48
+ "normalized": false,
49
+ "rstrip": false,
50
+ "single_word": false
51
+ },
52
+ {
53
+ "content": "<|quad_end|>",
54
+ "lstrip": false,
55
+ "normalized": false,
56
+ "rstrip": false,
57
+ "single_word": false
58
+ },
59
+ {
60
+ "content": "<|vision_start|>",
61
+ "lstrip": false,
62
+ "normalized": false,
63
+ "rstrip": false,
64
+ "single_word": false
65
+ },
66
+ {
67
+ "content": "<|vision_end|>",
68
+ "lstrip": false,
69
+ "normalized": false,
70
+ "rstrip": false,
71
+ "single_word": false
72
+ },
73
+ {
74
+ "content": "<|vision_pad|>",
75
+ "lstrip": false,
76
+ "normalized": false,
77
+ "rstrip": false,
78
+ "single_word": false
79
+ },
80
+ {
81
+ "content": "<|image_pad|>",
82
+ "lstrip": false,
83
+ "normalized": false,
84
+ "rstrip": false,
85
+ "single_word": false
86
+ },
87
+ {
88
+ "content": "<|video_pad|>",
89
+ "lstrip": false,
90
+ "normalized": false,
91
+ "rstrip": false,
92
+ "single_word": false
93
+ },
94
+ {
95
+ "content": "<|audio_start|>",
96
+ "lstrip": false,
97
+ "normalized": false,
98
+ "rstrip": false,
99
+ "single_word": false
100
+ },
101
+ {
102
+ "content": "<|audio_end|>",
103
+ "lstrip": false,
104
+ "normalized": false,
105
+ "rstrip": false,
106
+ "single_word": false
107
+ },
108
+ {
109
+ "content": "<|audio_pad|>",
110
+ "lstrip": false,
111
+ "normalized": false,
112
+ "rstrip": false,
113
+ "single_word": false
114
+ }
115
+ ],
116
+ "eos_token": {
117
+ "content": "<|im_end|>",
118
+ "lstrip": false,
119
+ "normalized": false,
120
+ "rstrip": false,
121
+ "single_word": false
122
+ },
123
+ "pad_token": {
124
+ "content": "<|endoftext|>",
125
+ "lstrip": false,
126
+ "normalized": false,
127
+ "rstrip": false,
128
+ "single_word": false
129
+ }
130
+ }
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fd1921fc462f344d58efbf99d5af3806cffb8697edb584906efe27e26ac36fdf
3
+ size 11423348
tokenizer_config.json ADDED
@@ -0,0 +1,267 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_bos_token": false,
3
+ "add_prefix_space": false,
4
+ "added_tokens_decoder": {
5
+ "151643": {
6
+ "content": "<|endoftext|>",
7
+ "lstrip": false,
8
+ "normalized": false,
9
+ "rstrip": false,
10
+ "single_word": false,
11
+ "special": true
12
+ },
13
+ "151644": {
14
+ "content": "<|im_start|>",
15
+ "lstrip": false,
16
+ "normalized": false,
17
+ "rstrip": false,
18
+ "single_word": false,
19
+ "special": true
20
+ },
21
+ "151645": {
22
+ "content": "<|im_end|>",
23
+ "lstrip": false,
24
+ "normalized": false,
25
+ "rstrip": false,
26
+ "single_word": false,
27
+ "special": true
28
+ },
29
+ "151646": {
30
+ "content": "<|object_ref_start|>",
31
+ "lstrip": false,
32
+ "normalized": false,
33
+ "rstrip": false,
34
+ "single_word": false,
35
+ "special": true
36
+ },
37
+ "151647": {
38
+ "content": "<|object_ref_end|>",
39
+ "lstrip": false,
40
+ "normalized": false,
41
+ "rstrip": false,
42
+ "single_word": false,
43
+ "special": true
44
+ },
45
+ "151648": {
46
+ "content": "<|box_start|>",
47
+ "lstrip": false,
48
+ "normalized": false,
49
+ "rstrip": false,
50
+ "single_word": false,
51
+ "special": true
52
+ },
53
+ "151649": {
54
+ "content": "<|box_end|>",
55
+ "lstrip": false,
56
+ "normalized": false,
57
+ "rstrip": false,
58
+ "single_word": false,
59
+ "special": true
60
+ },
61
+ "151650": {
62
+ "content": "<|quad_start|>",
63
+ "lstrip": false,
64
+ "normalized": false,
65
+ "rstrip": false,
66
+ "single_word": false,
67
+ "special": true
68
+ },
69
+ "151651": {
70
+ "content": "<|quad_end|>",
71
+ "lstrip": false,
72
+ "normalized": false,
73
+ "rstrip": false,
74
+ "single_word": false,
75
+ "special": true
76
+ },
77
+ "151652": {
78
+ "content": "<|vision_start|>",
79
+ "lstrip": false,
80
+ "normalized": false,
81
+ "rstrip": false,
82
+ "single_word": false,
83
+ "special": true
84
+ },
85
+ "151653": {
86
+ "content": "<|vision_end|>",
87
+ "lstrip": false,
88
+ "normalized": false,
89
+ "rstrip": false,
90
+ "single_word": false,
91
+ "special": true
92
+ },
93
+ "151654": {
94
+ "content": "<|vision_pad|>",
95
+ "lstrip": false,
96
+ "normalized": false,
97
+ "rstrip": false,
98
+ "single_word": false,
99
+ "special": true
100
+ },
101
+ "151655": {
102
+ "content": "<|image_pad|>",
103
+ "lstrip": false,
104
+ "normalized": false,
105
+ "rstrip": false,
106
+ "single_word": false,
107
+ "special": true
108
+ },
109
+ "151656": {
110
+ "content": "<|video_pad|>",
111
+ "lstrip": false,
112
+ "normalized": false,
113
+ "rstrip": false,
114
+ "single_word": false,
115
+ "special": true
116
+ },
117
+ "151657": {
118
+ "content": "<tool_call>",
119
+ "lstrip": false,
120
+ "normalized": false,
121
+ "rstrip": false,
122
+ "single_word": false,
123
+ "special": false
124
+ },
125
+ "151658": {
126
+ "content": "</tool_call>",
127
+ "lstrip": false,
128
+ "normalized": false,
129
+ "rstrip": false,
130
+ "single_word": false,
131
+ "special": false
132
+ },
133
+ "151659": {
134
+ "content": "<|fim_prefix|>",
135
+ "lstrip": false,
136
+ "normalized": false,
137
+ "rstrip": false,
138
+ "single_word": false,
139
+ "special": false
140
+ },
141
+ "151660": {
142
+ "content": "<|fim_middle|>",
143
+ "lstrip": false,
144
+ "normalized": false,
145
+ "rstrip": false,
146
+ "single_word": false,
147
+ "special": false
148
+ },
149
+ "151661": {
150
+ "content": "<|fim_suffix|>",
151
+ "lstrip": false,
152
+ "normalized": false,
153
+ "rstrip": false,
154
+ "single_word": false,
155
+ "special": false
156
+ },
157
+ "151662": {
158
+ "content": "<|fim_pad|>",
159
+ "lstrip": false,
160
+ "normalized": false,
161
+ "rstrip": false,
162
+ "single_word": false,
163
+ "special": false
164
+ },
165
+ "151663": {
166
+ "content": "<|repo_name|>",
167
+ "lstrip": false,
168
+ "normalized": false,
169
+ "rstrip": false,
170
+ "single_word": false,
171
+ "special": false
172
+ },
173
+ "151664": {
174
+ "content": "<|file_sep|>",
175
+ "lstrip": false,
176
+ "normalized": false,
177
+ "rstrip": false,
178
+ "single_word": false,
179
+ "special": false
180
+ },
181
+ "151665": {
182
+ "content": "<tool_response>",
183
+ "lstrip": false,
184
+ "normalized": false,
185
+ "rstrip": false,
186
+ "single_word": false,
187
+ "special": false
188
+ },
189
+ "151666": {
190
+ "content": "</tool_response>",
191
+ "lstrip": false,
192
+ "normalized": false,
193
+ "rstrip": false,
194
+ "single_word": false,
195
+ "special": false
196
+ },
197
+ "151667": {
198
+ "content": "<think>",
199
+ "lstrip": false,
200
+ "normalized": false,
201
+ "rstrip": false,
202
+ "single_word": false,
203
+ "special": false
204
+ },
205
+ "151668": {
206
+ "content": "</think>",
207
+ "lstrip": false,
208
+ "normalized": false,
209
+ "rstrip": false,
210
+ "single_word": false,
211
+ "special": false
212
+ },
213
+ "151669": {
214
+ "content": "<|audio_start|>",
215
+ "lstrip": false,
216
+ "normalized": false,
217
+ "rstrip": false,
218
+ "single_word": false,
219
+ "special": true
220
+ },
221
+ "151670": {
222
+ "content": "<|audio_end|>",
223
+ "lstrip": false,
224
+ "normalized": false,
225
+ "rstrip": false,
226
+ "single_word": false,
227
+ "special": true
228
+ },
229
+ "151671": {
230
+ "content": "<|audio_pad|>",
231
+ "lstrip": false,
232
+ "normalized": false,
233
+ "rstrip": false,
234
+ "single_word": false,
235
+ "special": true
236
+ }
237
+ },
238
+ "additional_special_tokens": [
239
+ "<|im_start|>",
240
+ "<|im_end|>",
241
+ "<|object_ref_start|>",
242
+ "<|object_ref_end|>",
243
+ "<|box_start|>",
244
+ "<|box_end|>",
245
+ "<|quad_start|>",
246
+ "<|quad_end|>",
247
+ "<|vision_start|>",
248
+ "<|vision_end|>",
249
+ "<|vision_pad|>",
250
+ "<|image_pad|>",
251
+ "<|video_pad|>",
252
+ "<|audio_start|>",
253
+ "<|audio_end|>",
254
+ "<|audio_pad|>"
255
+ ],
256
+ "bos_token": null,
257
+ "clean_up_tokenization_spaces": false,
258
+ "eos_token": "<|im_end|>",
259
+ "errors": "replace",
260
+ "extra_special_tokens": {},
261
+ "fix_mistral_regex": true,
262
+ "model_max_length": 131072,
263
+ "pad_token": "<|endoftext|>",
264
+ "split_special_tokens": false,
265
+ "tokenizer_class": "Qwen2Tokenizer",
266
+ "unk_token": null
267
+ }
vocab.json ADDED
The diff for this file is too large to render. See raw diff