majentik commited on
Commit
253fff0
·
verified ·
1 Parent(s): b9bbbed

feat: publish Fish Audio S2 Pro MLX quantized

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
LICENSE.md ADDED
@@ -0,0 +1,94 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ # FISH AUDIO RESEARCH LICENSE AGREEMENT
2
+
3
+ **Last Updated: March 7, 2026**
4
+
5
+ ## I. INTRODUCTION
6
+
7
+ This Agreement applies to any individual person or entity ("You", "Your" or "Licensee") that uses or distributes any portion or element of the Fish Audio Materials or Derivative Works thereof for any Research, Non-Commercial, or Commercial purpose. Capitalized terms not otherwise defined herein are defined in Section V below.
8
+
9
+ This Agreement is intended to allow research and non-commercial uses of the Materials free of charge. Any Commercial use of the Materials requires a separate license from Fish Audio.
10
+
11
+ By clicking "I Accept" or by using, distributing, or accessing any portion or element of the Fish Audio Materials or Derivative Works, You agree that You have read, understood and are bound by the terms of this Agreement. If You are acting on behalf of a company, organization or other entity, then "You" includes you and that entity, and You agree that You: (i) are an authorized representative of such entity with the authority to bind such entity to this Agreement, and (ii) You agree to the terms of this Agreement on that entity's behalf.
12
+
13
+ ## II. RESEARCH & NON-COMMERCIAL USE LICENSE
14
+
15
+ Subject to the terms of this Agreement, Fish Audio grants You a non-exclusive, worldwide, non-transferable, non-sublicensable, revocable and royalty-free limited license under Fish Audio's intellectual property or other rights owned by Fish Audio embodied in the Fish Audio Materials to use, reproduce, distribute, and create Derivative Works of, and make modifications to, the Fish Audio Materials for any Research or Non-Commercial Purpose.
16
+
17
+ "Research Purpose" means academic or scientific advancement, and in each case, is not primarily intended for commercial advantage or monetary compensation to You or others.
18
+
19
+ "Non-Commercial Purpose" means any purpose other than a Research Purpose that is not primarily intended for commercial advantage or monetary compensation to You or others, such as personal use (i.e., hobbyist) or evaluation and testing.
20
+
21
+ ## III. COMMERCIAL USE
22
+
23
+ **Any use of the Fish Audio Materials or Derivative Works for a Commercial Purpose requires a separate written license agreement from Fish Audio.** No commercial rights are granted under this Agreement.
24
+
25
+ "Commercial Purpose" means any purpose other than a Research Purpose or Non-Commercial Purpose that is primarily intended for or directed toward commercial advantage or monetary compensation to You or others, including but not limited to: (i) creating, modifying, or distributing Your product or service, including via a hosted service or application programming interface, (ii) Your business's or organization's internal operations, and (iii) any use in connection with a product or service for which You charge a fee or generate revenue, whether directly or indirectly.
26
+
27
+ To obtain a commercial license, please contact Fish Audio at:
28
+
29
+ - **Website:** [https://fish.audio](https://fish.audio)
30
+ - **Email:** business@fish.audio
31
+
32
+ ## IV. GENERAL TERMS
33
+
34
+ Your Research and Non-Commercial License under this Agreement is subject to the following terms.
35
+
36
+ ### a. Distribution & Attribution
37
+
38
+ If You distribute or make available the Fish Audio Materials or a Derivative Work to a third party, or a product or service that uses any portion of them, You shall: (i) provide a copy of this Agreement to that third party, (ii) retain the following attribution notice within a "Notice" text file distributed as a part of such copies: "This model is licensed under the Fish Audio Research License, Copyright © 39 AI, INC. All Rights Reserved.", and (iii) prominently display "Built with Fish Audio" on a related website, user interface, blogpost, about page, or product documentation.
39
+
40
+ If You create a Derivative Work, You may add your own attribution notice(s) to the "Notice" text file included with that Derivative Work, provided that You clearly indicate which attributions apply to the Fish Audio Materials and state in the "Notice" text file that You changed the Fish Audio Materials and how it was modified.
41
+
42
+ ### b. Use Restrictions
43
+
44
+ Your use of the Fish Audio Materials and Derivative Works, including any output or results of the Fish Audio Materials or Derivative Works, must comply with applicable laws and regulations (including Trade Control Laws and equivalent regulations) and adhere to Fish Audio's Acceptable Use Policy, which is hereby incorporated by reference.
45
+
46
+ Furthermore, You will not use the Fish Audio Materials or Derivative Works, or any output or results of the Fish Audio Materials or Derivative Works, to create or improve any foundational generative AI model (excluding the Models or Derivative Works).
47
+
48
+ ### c. Intellectual Property
49
+
50
+ **(i) Trademark License.** No trademark licenses are granted under this Agreement, and in connection with the Fish Audio Materials or Derivative Works, You may not use any name or mark owned by or associated with Fish Audio or any of its Affiliates, except as required under Section IV(a) herein.
51
+
52
+ **(ii) Ownership of Derivative Works.** As between You and Fish Audio, You are the owner of Derivative Works You create, subject to Fish Audio's ownership of the Fish Audio Materials and any Derivative Works made by or for Fish Audio.
53
+
54
+ **(iii) Ownership of Outputs.** As between You and Fish Audio, You own any outputs generated from the Models or Derivative Works to the extent permitted by applicable law.
55
+
56
+ **(iv) Disputes.** If You or Your Affiliate(s) institute litigation or other proceedings against Fish Audio (including a cross-claim or counterclaim in a lawsuit) alleging that the Fish Audio Materials, Derivative Works or associated outputs or results, or any portion of any of the foregoing, constitutes infringement of intellectual property or other rights owned or licensable by You, then any licenses granted to You under this Agreement shall terminate as of the date such litigation or claim is filed or instituted. You will indemnify and hold harmless Fish Audio from and against any claim by any third party arising out of or related to Your use or distribution of the Fish Audio Materials or Derivative Works in violation of this Agreement.
57
+
58
+ **(v) Feedback.** From time to time, You may provide Fish Audio with verbal and/or written suggestions, comments or other feedback related to Fish Audio's existing or prospective technology, products or services (collectively, "Feedback"). You are not obligated to provide Fish Audio with Feedback, but to the extent that You do, You hereby grant Fish Audio a perpetual, irrevocable, royalty-free, fully-paid, sub-licensable, transferable, non-exclusive, worldwide right and license to exploit the Feedback in any manner without restriction. Your Feedback is provided "AS IS" and You make no warranties whatsoever about any Feedback.
59
+
60
+ ### d. Disclaimer of Warranty
61
+
62
+ UNLESS REQUIRED BY APPLICABLE LAW, THE FISH AUDIO MATERIALS AND ANY OUTPUT AND RESULTS THEREFROM ARE PROVIDED ON AN "AS IS" BASIS, WITHOUT WARRANTIES OF ANY KIND, EITHER EXPRESS OR IMPLIED, INCLUDING, WITHOUT LIMITATION, ANY WARRANTIES OF TITLE, NON-INFRINGEMENT, MERCHANTABILITY, OR FITNESS FOR A PARTICULAR PURPOSE. YOU ARE SOLELY RESPONSIBLE FOR DETERMINING THE APPROPRIATENESS OR LAWFULNESS OF USING OR REDISTRIBUTING THE FISH AUDIO MATERIALS, DERIVATIVE WORKS OR ANY OUTPUT OR RESULTS AND ASSUME ANY RISKS ASSOCIATED WITH YOUR USE OF THE FISH AUDIO MATERIALS, DERIVATIVE WORKS AND ANY OUTPUT AND RESULTS.
63
+
64
+ ### e. Limitation of Liability
65
+
66
+ IN NO EVENT WILL FISH AUDIO OR ITS AFFILIATES BE LIABLE UNDER ANY THEORY OF LIABILITY, WHETHER IN CONTRACT, TORT, NEGLIGENCE, PRODUCTS LIABILITY, OR OTHERWISE, ARISING OUT OF THIS AGREEMENT, FOR ANY LOST PROFITS OR ANY DIRECT, INDIRECT, SPECIAL, CONSEQUENTIAL, INCIDENTAL, EXEMPLARY OR PUNITIVE DAMAGES, EVEN IF FISH AUDIO OR ITS AFFILIATES HAVE BEEN ADVISED OF THE POSSIBILITY OF ANY OF THE FOREGOING.
67
+
68
+ ### f. Term and Termination
69
+
70
+ The term of this Agreement will commence upon Your acceptance of this Agreement or access to the Fish Audio Materials and will continue in full force and effect until terminated in accordance with the terms and conditions herein. Fish Audio may terminate this Agreement if You are in breach of any term or condition of this Agreement. Upon termination of this Agreement, You shall delete and cease use of any Fish Audio Materials or Derivative Works. Sections IV(d), (e), and (g) shall survive the termination of this Agreement.
71
+
72
+ ### g. Governing Law
73
+
74
+ This Agreement will be governed by and construed in accordance with the laws of the United States and the State of California without regard to choice of law principles, and the UN Convention on Contracts for International Sale of Goods does not apply to this Agreement.
75
+
76
+ ## V. DEFINITIONS
77
+
78
+ **"Affiliate(s)"** means any entity that directly or indirectly controls, is controlled by, or is under common control with the subject entity; for purposes of this definition, "control" means direct or indirect ownership or control of more than 50% of the voting interests of the subject entity.
79
+
80
+ **"Agreement"** means this Fish Audio Research License Agreement.
81
+
82
+ **"Derivative Work(s)"** means (a) any derivative work of the Fish Audio Materials as recognized by U.S. copyright laws and (b) any modifications to a Model, and any other model created which is based on or derived from the Model or the Model's output, including "fine tune" and "low-rank adaptation" models derived from a Model or a Model's output, but do not include the output of any Model.
83
+
84
+ **"Documentation"** means any specifications, manuals, documentation, and other written information provided by Fish Audio related to the Software or Models.
85
+
86
+ **"Fish Audio"** or **"we"** means 39 AI, INC. and its Affiliates.
87
+
88
+ **"Model(s)"** means, collectively, Fish Audio's proprietary models and algorithms, including machine-learning models, trained model weights and other elements of the foregoing.
89
+
90
+ **"Software"** means Fish Audio's proprietary software made available under this Agreement now or in the future.
91
+
92
+ **"Fish Audio Materials"** means, collectively, Fish Audio's proprietary Models, Software and Documentation (and any portion or combination thereof) made available under this Agreement.
93
+
94
+ **"Trade Control Laws"** means any applicable U.S. and non-U.S. export control and trade sanctions laws and regulations.
NOTICE ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ This model is licensed under the Fish Audio Research License.
2
+ Copyright © 39 AI, INC. All Rights Reserved.
3
+
4
+ Modifications to the Fish Audio Materials in this derivative work:
5
+ - Conversion to Apple MLX format via mlx-audio (bf16 → quantized int weights)
6
+ - Saved as model.safetensors with mlx-specific layout and metadata
7
+ - No changes to model architecture, tokenizer, codec, or training data
8
+
9
+ Built with Fish Audio.
10
+
11
+ See LICENSE.md for the full license terms.
README.md ADDED
@@ -0,0 +1,90 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ library_name: mlx-audio
3
+ tags:
4
+ - mlx
5
+ - mlx-audio
6
+ - text-to-speech
7
+ - speech
8
+ - speech-generation
9
+ - voice-cloning
10
+ - tts
11
+ - fish-audio
12
+ - s2-pro
13
+ - quantized
14
+ - 8bit
15
+ - fish_qwen3_omni
16
+ base_model: fishaudio/s2-pro
17
+ license: other
18
+ license_name: fish-audio-research
19
+ license_link: https://huggingface.co/fishaudio/s2-pro/blob/main/LICENSE
20
+ pipeline_tag: text-to-speech
21
+ language:
22
+ - en
23
+ - zh
24
+ - ja
25
+ - ko
26
+ - es
27
+ - pt
28
+ - ar
29
+ - ru
30
+ - fr
31
+ - de
32
+ ---
33
+
34
+ # Fish Audio S2 Pro MLX 8-bit
35
+
36
+ MLX 8-bit quantization of [fishaudio/s2-pro](https://huggingface.co/fishaudio/s2-pro), produced with [mlx-audio](https://github.com/Blaizzy/mlx-audio) on Apple Silicon.
37
+
38
+ **Built with Fish Audio.**
39
+
40
+ ## Provenance
41
+
42
+ Converted directly from `fishaudio/s2-pro` bf16 safetensors via `python -m mlx_audio.convert ... -q --q-bits 4 --q-group-size 64`. The `codec.pth` audio decoder, tokenizer, and chat template are preserved alongside the quantized LLM weights.
43
+
44
+ ## Quantization
45
+
46
+ - Method: MLX affine quantization, group_size=64, 8-bit
47
+ - Actual bits per weight after conversion: **~9.0** (some small projections are skipped and remain bf16 — this is expected behavior for mlx.nn.quantize on multimodal models)
48
+ - Size on disk: ~4.5 GB (vs ~8 GB for bf16)
49
+ - Target: Apple Silicon with ≥ 16 GB unified memory (comfortable on M-series with 24 GB+)
50
+
51
+ ## Architecture
52
+
53
+ `fish_qwen3_omni` — a Qwen3-based decoder-only LLM that emits audio tokens consumed by the `codec.pth` DualAR codec. The text side is quantized; the codec is kept as-is.
54
+
55
+ ## Quickstart
56
+
57
+ ```python
58
+ from mlx_audio.tts import load
59
+
60
+ model = load("majentik/fishaudio-s2-pro-MLX-8bit")
61
+ audio = model.generate(
62
+ text="Hello, this is a test of Fish S2 Pro at 8-bit MLX.",
63
+ voice="en_default",
64
+ )
65
+ ```
66
+
67
+ Fish S2 Pro supports zero-shot voice cloning from a reference audio sample; see the base model card for the reference-conditioning API.
68
+
69
+ ## License & Use Restrictions
70
+
71
+ This model is a derivative work of **Fish Audio S2 Pro**, licensed under the **Fish Audio Research License**.
72
+
73
+ - **Research + Non-Commercial use:** free, subject to the license.
74
+ - **Commercial use:** requires a separate written agreement with Fish Audio — see https://fish.audio or email `business@fish.audio`.
75
+ - **Use restriction:** outputs must not be used to create or improve any foundational generative AI model (excluding the Model itself or derivatives of it).
76
+ - **Attribution:** downstream use must include this NOTICE and display "Built with Fish Audio" in any product/service/interface that surfaces model outputs.
77
+
78
+ See `LICENSE.md` and `NOTICE` files bundled with this repository.
79
+
80
+ ## Languages
81
+
82
+ English, Chinese, Japanese, Korean, Spanish, Portuguese, Arabic, Russian, French, German (per base model card).
83
+
84
+ ## See also
85
+
86
+ - Base: [fishaudio/s2-pro](https://huggingface.co/fishaudio/s2-pro)
87
+ - bf16 MLX: [mlx-community/fish-audio-s2-pro-bf16](https://huggingface.co/mlx-community/fish-audio-s2-pro-bf16)
88
+ - 8-bit MLX: [mlx-community/fishaudio-s2-pro-8bit-mlx](https://huggingface.co/mlx-community/fishaudio-s2-pro-8bit-mlx)
89
+ - mlx-audio: https://github.com/Blaizzy/mlx-audio
90
+ - Garden hub: [majentik/garden](https://huggingface.co/majentik/garden)
chat_template.jinja ADDED
@@ -0,0 +1,85 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- if tools %}
2
+ {{- '<|im_start|>system\n' }}
3
+ {%- if messages[0].role == 'system' %}
4
+ {{- messages[0].content + '\n\n' }}
5
+ {%- endif %}
6
+ {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within <tools></tools> XML tags:\n<tools>" }}
7
+ {%- for tool in tools %}
8
+ {{- "\n" }}
9
+ {{- tool | tojson }}
10
+ {%- endfor %}
11
+ {{- "\n</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call><|im_end|>\n" }}
12
+ {%- else %}
13
+ {%- if messages[0].role == 'system' %}
14
+ {{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }}
15
+ {%- endif %}
16
+ {%- endif %}
17
+ {%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
18
+ {%- for message in messages[::-1] %}
19
+ {%- set index = (messages|length - 1) - loop.index0 %}
20
+ {%- if ns.multi_step_tool and message.role == "user" and not(message.content.startswith('<tool_response>') and message.content.endswith('</tool_response>')) %}
21
+ {%- set ns.multi_step_tool = false %}
22
+ {%- set ns.last_query_index = index %}
23
+ {%- endif %}
24
+ {%- endfor %}
25
+ {%- for message in messages %}
26
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) %}
27
+ {{- '<|im_start|>' + message.role + '\n' + message.content + '<|im_end|>' + '\n' }}
28
+ {%- elif message.role == "assistant" %}
29
+ {%- set content = message.content %}
30
+ {%- set reasoning_content = '' %}
31
+ {%- if message.reasoning_content is defined and message.reasoning_content is not none %}
32
+ {%- set reasoning_content = message.reasoning_content %}
33
+ {%- else %}
34
+ {%- if '</think>' in message.content %}
35
+ {%- set content = message.content.split('</think>')[-1].lstrip('\n') %}
36
+ {%- set reasoning_content = message.content.split('</think>')[0].rstrip('\n').split('<think>')[-1].lstrip('\n') %}
37
+ {%- endif %}
38
+ {%- endif %}
39
+ {%- if loop.index0 > ns.last_query_index %}
40
+ {%- if loop.last or (not loop.last and reasoning_content) %}
41
+ {{- '<|im_start|>' + message.role + '\n<think>\n' + reasoning_content.strip('\n') + '\n</think>\n\n' + content.lstrip('\n') }}
42
+ {%- else %}
43
+ {{- '<|im_start|>' + message.role + '\n' + content }}
44
+ {%- endif %}
45
+ {%- else %}
46
+ {{- '<|im_start|>' + message.role + '\n' + content }}
47
+ {%- endif %}
48
+ {%- if message.tool_calls %}
49
+ {%- for tool_call in message.tool_calls %}
50
+ {%- if (loop.first and content) or (not loop.first) %}
51
+ {{- '\n' }}
52
+ {%- endif %}
53
+ {%- if tool_call.function %}
54
+ {%- set tool_call = tool_call.function %}
55
+ {%- endif %}
56
+ {{- '<tool_call>\n{"name": "' }}
57
+ {{- tool_call.name }}
58
+ {{- '", "arguments": ' }}
59
+ {%- if tool_call.arguments is string %}
60
+ {{- tool_call.arguments }}
61
+ {%- else %}
62
+ {{- tool_call.arguments | tojson }}
63
+ {%- endif %}
64
+ {{- '}\n</tool_call>' }}
65
+ {%- endfor %}
66
+ {%- endif %}
67
+ {{- '<|im_end|>\n' }}
68
+ {%- elif message.role == "tool" %}
69
+ {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
70
+ {{- '<|im_start|>user' }}
71
+ {%- endif %}
72
+ {{- '\n<tool_response>\n' }}
73
+ {{- message.content }}
74
+ {{- '\n</tool_response>' }}
75
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
76
+ {{- '<|im_end|>\n' }}
77
+ {%- endif %}
78
+ {%- endif %}
79
+ {%- endfor %}
80
+ {%- if add_generation_prompt %}
81
+ {{- '<|im_start|>assistant\n' }}
82
+ {%- if enable_thinking is defined and enable_thinking is false %}
83
+ {{- '<think>\n\n</think>\n\n' }}
84
+ {%- endif %}
85
+ {%- endif %}
codec.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:74fc41c5a7151c6f350af8bd7e5d6e3accfcc7f3dfbfac23afd35af07052bb2f
3
+ size 1871099728
config.json ADDED
@@ -0,0 +1,80 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "audio_decoder_config": {
3
+ "attention_o_bias": false,
4
+ "attention_qk_norm": false,
5
+ "attention_qkv_bias": false,
6
+ "audio_hidden_dim": 5120,
7
+ "dim": 2560,
8
+ "dropout": 0.0,
9
+ "head_dim": 128,
10
+ "initializer_range": 0.01976423537605237,
11
+ "intermediate_size": 9728,
12
+ "max_seq_len": 11,
13
+ "model_type": "fish_qwen3_audio_decoder",
14
+ "moe_intermediate_size": 768,
15
+ "n_head": 32,
16
+ "n_layer": 4,
17
+ "n_local_heads": 8,
18
+ "norm_eps": 1e-06,
19
+ "norm_topk_prob": true,
20
+ "num_codebooks": 10,
21
+ "num_experts": 1,
22
+ "num_experts_per_tok": 1,
23
+ "rope_base": 1000000,
24
+ "router_gamma": 0.001,
25
+ "text_dim": 2560,
26
+ "tie_word_embeddings": false,
27
+ "use_aux_loss_free": false,
28
+ "use_bfloat16": false,
29
+ "use_gradient_checkpointing": true,
30
+ "use_moe": false,
31
+ "vocab_size": 4096
32
+ },
33
+ "audio_pad_token_id": 151677,
34
+ "dtype": "bfloat16",
35
+ "eos_token_id": 151645,
36
+ "model_type": "fish_qwen3_omni",
37
+ "pad_token_id": 151669,
38
+ "quantization": {
39
+ "group_size": 64,
40
+ "bits": 8,
41
+ "mode": "affine"
42
+ },
43
+ "quantization_config": {
44
+ "group_size": 64,
45
+ "bits": 8,
46
+ "mode": "affine"
47
+ },
48
+ "semantic_end_token_id": 155773,
49
+ "semantic_start_token_id": 151678,
50
+ "text_config": {
51
+ "attention_o_bias": false,
52
+ "attention_qk_norm": true,
53
+ "attention_qkv_bias": false,
54
+ "audio_hidden_dim": 5120,
55
+ "dim": 2560,
56
+ "dropout": 0.0,
57
+ "head_dim": 128,
58
+ "initializer_range": 0.01976423537605237,
59
+ "intermediate_size": 9728,
60
+ "max_seq_len": 32768,
61
+ "model_type": "fish_qwen3",
62
+ "moe_intermediate_size": 768,
63
+ "n_head": 32,
64
+ "n_layer": 36,
65
+ "n_local_heads": 8,
66
+ "norm_eps": 1e-06,
67
+ "norm_topk_prob": true,
68
+ "num_experts": 1,
69
+ "num_experts_per_tok": 1,
70
+ "rope_base": 1000000,
71
+ "router_gamma": 0.001,
72
+ "tie_word_embeddings": true,
73
+ "use_aux_loss_free": false,
74
+ "use_bfloat16": false,
75
+ "use_gradient_checkpointing": true,
76
+ "use_moe": false,
77
+ "vocab_size": 155776
78
+ },
79
+ "transformers_version": "4.57.1"
80
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bf31b4e5fb713a565750e120ebadd54de245eb1214e46d14fc5108f1e79171a1
3
+ size 4847260185
model.safetensors.index.json ADDED
@@ -0,0 +1,774 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "metadata": {
3
+ "total_size": 4847173632,
4
+ "total_parameters": 4561852416
5
+ },
6
+ "weight_map": {
7
+ "model.codebook_embeddings.biases": "model.safetensors",
8
+ "model.codebook_embeddings.scales": "model.safetensors",
9
+ "model.codebook_embeddings.weight": "model.safetensors",
10
+ "model.embeddings.biases": "model.safetensors",
11
+ "model.embeddings.scales": "model.safetensors",
12
+ "model.embeddings.weight": "model.safetensors",
13
+ "model.fast_embeddings.biases": "model.safetensors",
14
+ "model.fast_embeddings.scales": "model.safetensors",
15
+ "model.fast_embeddings.weight": "model.safetensors",
16
+ "model.fast_layers.0.attention.wo.biases": "model.safetensors",
17
+ "model.fast_layers.0.attention.wo.scales": "model.safetensors",
18
+ "model.fast_layers.0.attention.wo.weight": "model.safetensors",
19
+ "model.fast_layers.0.attention.wqkv.biases": "model.safetensors",
20
+ "model.fast_layers.0.attention.wqkv.scales": "model.safetensors",
21
+ "model.fast_layers.0.attention.wqkv.weight": "model.safetensors",
22
+ "model.fast_layers.0.attention_norm.weight": "model.safetensors",
23
+ "model.fast_layers.0.feed_forward.w1.biases": "model.safetensors",
24
+ "model.fast_layers.0.feed_forward.w1.scales": "model.safetensors",
25
+ "model.fast_layers.0.feed_forward.w1.weight": "model.safetensors",
26
+ "model.fast_layers.0.feed_forward.w2.biases": "model.safetensors",
27
+ "model.fast_layers.0.feed_forward.w2.scales": "model.safetensors",
28
+ "model.fast_layers.0.feed_forward.w2.weight": "model.safetensors",
29
+ "model.fast_layers.0.feed_forward.w3.biases": "model.safetensors",
30
+ "model.fast_layers.0.feed_forward.w3.scales": "model.safetensors",
31
+ "model.fast_layers.0.feed_forward.w3.weight": "model.safetensors",
32
+ "model.fast_layers.0.ffn_norm.weight": "model.safetensors",
33
+ "model.fast_layers.1.attention.wo.biases": "model.safetensors",
34
+ "model.fast_layers.1.attention.wo.scales": "model.safetensors",
35
+ "model.fast_layers.1.attention.wo.weight": "model.safetensors",
36
+ "model.fast_layers.1.attention.wqkv.biases": "model.safetensors",
37
+ "model.fast_layers.1.attention.wqkv.scales": "model.safetensors",
38
+ "model.fast_layers.1.attention.wqkv.weight": "model.safetensors",
39
+ "model.fast_layers.1.attention_norm.weight": "model.safetensors",
40
+ "model.fast_layers.1.feed_forward.w1.biases": "model.safetensors",
41
+ "model.fast_layers.1.feed_forward.w1.scales": "model.safetensors",
42
+ "model.fast_layers.1.feed_forward.w1.weight": "model.safetensors",
43
+ "model.fast_layers.1.feed_forward.w2.biases": "model.safetensors",
44
+ "model.fast_layers.1.feed_forward.w2.scales": "model.safetensors",
45
+ "model.fast_layers.1.feed_forward.w2.weight": "model.safetensors",
46
+ "model.fast_layers.1.feed_forward.w3.biases": "model.safetensors",
47
+ "model.fast_layers.1.feed_forward.w3.scales": "model.safetensors",
48
+ "model.fast_layers.1.feed_forward.w3.weight": "model.safetensors",
49
+ "model.fast_layers.1.ffn_norm.weight": "model.safetensors",
50
+ "model.fast_layers.2.attention.wo.biases": "model.safetensors",
51
+ "model.fast_layers.2.attention.wo.scales": "model.safetensors",
52
+ "model.fast_layers.2.attention.wo.weight": "model.safetensors",
53
+ "model.fast_layers.2.attention.wqkv.biases": "model.safetensors",
54
+ "model.fast_layers.2.attention.wqkv.scales": "model.safetensors",
55
+ "model.fast_layers.2.attention.wqkv.weight": "model.safetensors",
56
+ "model.fast_layers.2.attention_norm.weight": "model.safetensors",
57
+ "model.fast_layers.2.feed_forward.w1.biases": "model.safetensors",
58
+ "model.fast_layers.2.feed_forward.w1.scales": "model.safetensors",
59
+ "model.fast_layers.2.feed_forward.w1.weight": "model.safetensors",
60
+ "model.fast_layers.2.feed_forward.w2.biases": "model.safetensors",
61
+ "model.fast_layers.2.feed_forward.w2.scales": "model.safetensors",
62
+ "model.fast_layers.2.feed_forward.w2.weight": "model.safetensors",
63
+ "model.fast_layers.2.feed_forward.w3.biases": "model.safetensors",
64
+ "model.fast_layers.2.feed_forward.w3.scales": "model.safetensors",
65
+ "model.fast_layers.2.feed_forward.w3.weight": "model.safetensors",
66
+ "model.fast_layers.2.ffn_norm.weight": "model.safetensors",
67
+ "model.fast_layers.3.attention.wo.biases": "model.safetensors",
68
+ "model.fast_layers.3.attention.wo.scales": "model.safetensors",
69
+ "model.fast_layers.3.attention.wo.weight": "model.safetensors",
70
+ "model.fast_layers.3.attention.wqkv.biases": "model.safetensors",
71
+ "model.fast_layers.3.attention.wqkv.scales": "model.safetensors",
72
+ "model.fast_layers.3.attention.wqkv.weight": "model.safetensors",
73
+ "model.fast_layers.3.attention_norm.weight": "model.safetensors",
74
+ "model.fast_layers.3.feed_forward.w1.biases": "model.safetensors",
75
+ "model.fast_layers.3.feed_forward.w1.scales": "model.safetensors",
76
+ "model.fast_layers.3.feed_forward.w1.weight": "model.safetensors",
77
+ "model.fast_layers.3.feed_forward.w2.biases": "model.safetensors",
78
+ "model.fast_layers.3.feed_forward.w2.scales": "model.safetensors",
79
+ "model.fast_layers.3.feed_forward.w2.weight": "model.safetensors",
80
+ "model.fast_layers.3.feed_forward.w3.biases": "model.safetensors",
81
+ "model.fast_layers.3.feed_forward.w3.scales": "model.safetensors",
82
+ "model.fast_layers.3.feed_forward.w3.weight": "model.safetensors",
83
+ "model.fast_layers.3.ffn_norm.weight": "model.safetensors",
84
+ "model.fast_norm.weight": "model.safetensors",
85
+ "model.fast_output.biases": "model.safetensors",
86
+ "model.fast_output.scales": "model.safetensors",
87
+ "model.fast_output.weight": "model.safetensors",
88
+ "model.layers.0.attention.k_norm.weight": "model.safetensors",
89
+ "model.layers.0.attention.q_norm.weight": "model.safetensors",
90
+ "model.layers.0.attention.wo.biases": "model.safetensors",
91
+ "model.layers.0.attention.wo.scales": "model.safetensors",
92
+ "model.layers.0.attention.wo.weight": "model.safetensors",
93
+ "model.layers.0.attention.wqkv.biases": "model.safetensors",
94
+ "model.layers.0.attention.wqkv.scales": "model.safetensors",
95
+ "model.layers.0.attention.wqkv.weight": "model.safetensors",
96
+ "model.layers.0.attention_norm.weight": "model.safetensors",
97
+ "model.layers.0.feed_forward.w1.biases": "model.safetensors",
98
+ "model.layers.0.feed_forward.w1.scales": "model.safetensors",
99
+ "model.layers.0.feed_forward.w1.weight": "model.safetensors",
100
+ "model.layers.0.feed_forward.w2.biases": "model.safetensors",
101
+ "model.layers.0.feed_forward.w2.scales": "model.safetensors",
102
+ "model.layers.0.feed_forward.w2.weight": "model.safetensors",
103
+ "model.layers.0.feed_forward.w3.biases": "model.safetensors",
104
+ "model.layers.0.feed_forward.w3.scales": "model.safetensors",
105
+ "model.layers.0.feed_forward.w3.weight": "model.safetensors",
106
+ "model.layers.0.ffn_norm.weight": "model.safetensors",
107
+ "model.layers.1.attention.k_norm.weight": "model.safetensors",
108
+ "model.layers.1.attention.q_norm.weight": "model.safetensors",
109
+ "model.layers.1.attention.wo.biases": "model.safetensors",
110
+ "model.layers.1.attention.wo.scales": "model.safetensors",
111
+ "model.layers.1.attention.wo.weight": "model.safetensors",
112
+ "model.layers.1.attention.wqkv.biases": "model.safetensors",
113
+ "model.layers.1.attention.wqkv.scales": "model.safetensors",
114
+ "model.layers.1.attention.wqkv.weight": "model.safetensors",
115
+ "model.layers.1.attention_norm.weight": "model.safetensors",
116
+ "model.layers.1.feed_forward.w1.biases": "model.safetensors",
117
+ "model.layers.1.feed_forward.w1.scales": "model.safetensors",
118
+ "model.layers.1.feed_forward.w1.weight": "model.safetensors",
119
+ "model.layers.1.feed_forward.w2.biases": "model.safetensors",
120
+ "model.layers.1.feed_forward.w2.scales": "model.safetensors",
121
+ "model.layers.1.feed_forward.w2.weight": "model.safetensors",
122
+ "model.layers.1.feed_forward.w3.biases": "model.safetensors",
123
+ "model.layers.1.feed_forward.w3.scales": "model.safetensors",
124
+ "model.layers.1.feed_forward.w3.weight": "model.safetensors",
125
+ "model.layers.1.ffn_norm.weight": "model.safetensors",
126
+ "model.layers.10.attention.k_norm.weight": "model.safetensors",
127
+ "model.layers.10.attention.q_norm.weight": "model.safetensors",
128
+ "model.layers.10.attention.wo.biases": "model.safetensors",
129
+ "model.layers.10.attention.wo.scales": "model.safetensors",
130
+ "model.layers.10.attention.wo.weight": "model.safetensors",
131
+ "model.layers.10.attention.wqkv.biases": "model.safetensors",
132
+ "model.layers.10.attention.wqkv.scales": "model.safetensors",
133
+ "model.layers.10.attention.wqkv.weight": "model.safetensors",
134
+ "model.layers.10.attention_norm.weight": "model.safetensors",
135
+ "model.layers.10.feed_forward.w1.biases": "model.safetensors",
136
+ "model.layers.10.feed_forward.w1.scales": "model.safetensors",
137
+ "model.layers.10.feed_forward.w1.weight": "model.safetensors",
138
+ "model.layers.10.feed_forward.w2.biases": "model.safetensors",
139
+ "model.layers.10.feed_forward.w2.scales": "model.safetensors",
140
+ "model.layers.10.feed_forward.w2.weight": "model.safetensors",
141
+ "model.layers.10.feed_forward.w3.biases": "model.safetensors",
142
+ "model.layers.10.feed_forward.w3.scales": "model.safetensors",
143
+ "model.layers.10.feed_forward.w3.weight": "model.safetensors",
144
+ "model.layers.10.ffn_norm.weight": "model.safetensors",
145
+ "model.layers.11.attention.k_norm.weight": "model.safetensors",
146
+ "model.layers.11.attention.q_norm.weight": "model.safetensors",
147
+ "model.layers.11.attention.wo.biases": "model.safetensors",
148
+ "model.layers.11.attention.wo.scales": "model.safetensors",
149
+ "model.layers.11.attention.wo.weight": "model.safetensors",
150
+ "model.layers.11.attention.wqkv.biases": "model.safetensors",
151
+ "model.layers.11.attention.wqkv.scales": "model.safetensors",
152
+ "model.layers.11.attention.wqkv.weight": "model.safetensors",
153
+ "model.layers.11.attention_norm.weight": "model.safetensors",
154
+ "model.layers.11.feed_forward.w1.biases": "model.safetensors",
155
+ "model.layers.11.feed_forward.w1.scales": "model.safetensors",
156
+ "model.layers.11.feed_forward.w1.weight": "model.safetensors",
157
+ "model.layers.11.feed_forward.w2.biases": "model.safetensors",
158
+ "model.layers.11.feed_forward.w2.scales": "model.safetensors",
159
+ "model.layers.11.feed_forward.w2.weight": "model.safetensors",
160
+ "model.layers.11.feed_forward.w3.biases": "model.safetensors",
161
+ "model.layers.11.feed_forward.w3.scales": "model.safetensors",
162
+ "model.layers.11.feed_forward.w3.weight": "model.safetensors",
163
+ "model.layers.11.ffn_norm.weight": "model.safetensors",
164
+ "model.layers.12.attention.k_norm.weight": "model.safetensors",
165
+ "model.layers.12.attention.q_norm.weight": "model.safetensors",
166
+ "model.layers.12.attention.wo.biases": "model.safetensors",
167
+ "model.layers.12.attention.wo.scales": "model.safetensors",
168
+ "model.layers.12.attention.wo.weight": "model.safetensors",
169
+ "model.layers.12.attention.wqkv.biases": "model.safetensors",
170
+ "model.layers.12.attention.wqkv.scales": "model.safetensors",
171
+ "model.layers.12.attention.wqkv.weight": "model.safetensors",
172
+ "model.layers.12.attention_norm.weight": "model.safetensors",
173
+ "model.layers.12.feed_forward.w1.biases": "model.safetensors",
174
+ "model.layers.12.feed_forward.w1.scales": "model.safetensors",
175
+ "model.layers.12.feed_forward.w1.weight": "model.safetensors",
176
+ "model.layers.12.feed_forward.w2.biases": "model.safetensors",
177
+ "model.layers.12.feed_forward.w2.scales": "model.safetensors",
178
+ "model.layers.12.feed_forward.w2.weight": "model.safetensors",
179
+ "model.layers.12.feed_forward.w3.biases": "model.safetensors",
180
+ "model.layers.12.feed_forward.w3.scales": "model.safetensors",
181
+ "model.layers.12.feed_forward.w3.weight": "model.safetensors",
182
+ "model.layers.12.ffn_norm.weight": "model.safetensors",
183
+ "model.layers.13.attention.k_norm.weight": "model.safetensors",
184
+ "model.layers.13.attention.q_norm.weight": "model.safetensors",
185
+ "model.layers.13.attention.wo.biases": "model.safetensors",
186
+ "model.layers.13.attention.wo.scales": "model.safetensors",
187
+ "model.layers.13.attention.wo.weight": "model.safetensors",
188
+ "model.layers.13.attention.wqkv.biases": "model.safetensors",
189
+ "model.layers.13.attention.wqkv.scales": "model.safetensors",
190
+ "model.layers.13.attention.wqkv.weight": "model.safetensors",
191
+ "model.layers.13.attention_norm.weight": "model.safetensors",
192
+ "model.layers.13.feed_forward.w1.biases": "model.safetensors",
193
+ "model.layers.13.feed_forward.w1.scales": "model.safetensors",
194
+ "model.layers.13.feed_forward.w1.weight": "model.safetensors",
195
+ "model.layers.13.feed_forward.w2.biases": "model.safetensors",
196
+ "model.layers.13.feed_forward.w2.scales": "model.safetensors",
197
+ "model.layers.13.feed_forward.w2.weight": "model.safetensors",
198
+ "model.layers.13.feed_forward.w3.biases": "model.safetensors",
199
+ "model.layers.13.feed_forward.w3.scales": "model.safetensors",
200
+ "model.layers.13.feed_forward.w3.weight": "model.safetensors",
201
+ "model.layers.13.ffn_norm.weight": "model.safetensors",
202
+ "model.layers.14.attention.k_norm.weight": "model.safetensors",
203
+ "model.layers.14.attention.q_norm.weight": "model.safetensors",
204
+ "model.layers.14.attention.wo.biases": "model.safetensors",
205
+ "model.layers.14.attention.wo.scales": "model.safetensors",
206
+ "model.layers.14.attention.wo.weight": "model.safetensors",
207
+ "model.layers.14.attention.wqkv.biases": "model.safetensors",
208
+ "model.layers.14.attention.wqkv.scales": "model.safetensors",
209
+ "model.layers.14.attention.wqkv.weight": "model.safetensors",
210
+ "model.layers.14.attention_norm.weight": "model.safetensors",
211
+ "model.layers.14.feed_forward.w1.biases": "model.safetensors",
212
+ "model.layers.14.feed_forward.w1.scales": "model.safetensors",
213
+ "model.layers.14.feed_forward.w1.weight": "model.safetensors",
214
+ "model.layers.14.feed_forward.w2.biases": "model.safetensors",
215
+ "model.layers.14.feed_forward.w2.scales": "model.safetensors",
216
+ "model.layers.14.feed_forward.w2.weight": "model.safetensors",
217
+ "model.layers.14.feed_forward.w3.biases": "model.safetensors",
218
+ "model.layers.14.feed_forward.w3.scales": "model.safetensors",
219
+ "model.layers.14.feed_forward.w3.weight": "model.safetensors",
220
+ "model.layers.14.ffn_norm.weight": "model.safetensors",
221
+ "model.layers.15.attention.k_norm.weight": "model.safetensors",
222
+ "model.layers.15.attention.q_norm.weight": "model.safetensors",
223
+ "model.layers.15.attention.wo.biases": "model.safetensors",
224
+ "model.layers.15.attention.wo.scales": "model.safetensors",
225
+ "model.layers.15.attention.wo.weight": "model.safetensors",
226
+ "model.layers.15.attention.wqkv.biases": "model.safetensors",
227
+ "model.layers.15.attention.wqkv.scales": "model.safetensors",
228
+ "model.layers.15.attention.wqkv.weight": "model.safetensors",
229
+ "model.layers.15.attention_norm.weight": "model.safetensors",
230
+ "model.layers.15.feed_forward.w1.biases": "model.safetensors",
231
+ "model.layers.15.feed_forward.w1.scales": "model.safetensors",
232
+ "model.layers.15.feed_forward.w1.weight": "model.safetensors",
233
+ "model.layers.15.feed_forward.w2.biases": "model.safetensors",
234
+ "model.layers.15.feed_forward.w2.scales": "model.safetensors",
235
+ "model.layers.15.feed_forward.w2.weight": "model.safetensors",
236
+ "model.layers.15.feed_forward.w3.biases": "model.safetensors",
237
+ "model.layers.15.feed_forward.w3.scales": "model.safetensors",
238
+ "model.layers.15.feed_forward.w3.weight": "model.safetensors",
239
+ "model.layers.15.ffn_norm.weight": "model.safetensors",
240
+ "model.layers.16.attention.k_norm.weight": "model.safetensors",
241
+ "model.layers.16.attention.q_norm.weight": "model.safetensors",
242
+ "model.layers.16.attention.wo.biases": "model.safetensors",
243
+ "model.layers.16.attention.wo.scales": "model.safetensors",
244
+ "model.layers.16.attention.wo.weight": "model.safetensors",
245
+ "model.layers.16.attention.wqkv.biases": "model.safetensors",
246
+ "model.layers.16.attention.wqkv.scales": "model.safetensors",
247
+ "model.layers.16.attention.wqkv.weight": "model.safetensors",
248
+ "model.layers.16.attention_norm.weight": "model.safetensors",
249
+ "model.layers.16.feed_forward.w1.biases": "model.safetensors",
250
+ "model.layers.16.feed_forward.w1.scales": "model.safetensors",
251
+ "model.layers.16.feed_forward.w1.weight": "model.safetensors",
252
+ "model.layers.16.feed_forward.w2.biases": "model.safetensors",
253
+ "model.layers.16.feed_forward.w2.scales": "model.safetensors",
254
+ "model.layers.16.feed_forward.w2.weight": "model.safetensors",
255
+ "model.layers.16.feed_forward.w3.biases": "model.safetensors",
256
+ "model.layers.16.feed_forward.w3.scales": "model.safetensors",
257
+ "model.layers.16.feed_forward.w3.weight": "model.safetensors",
258
+ "model.layers.16.ffn_norm.weight": "model.safetensors",
259
+ "model.layers.17.attention.k_norm.weight": "model.safetensors",
260
+ "model.layers.17.attention.q_norm.weight": "model.safetensors",
261
+ "model.layers.17.attention.wo.biases": "model.safetensors",
262
+ "model.layers.17.attention.wo.scales": "model.safetensors",
263
+ "model.layers.17.attention.wo.weight": "model.safetensors",
264
+ "model.layers.17.attention.wqkv.biases": "model.safetensors",
265
+ "model.layers.17.attention.wqkv.scales": "model.safetensors",
266
+ "model.layers.17.attention.wqkv.weight": "model.safetensors",
267
+ "model.layers.17.attention_norm.weight": "model.safetensors",
268
+ "model.layers.17.feed_forward.w1.biases": "model.safetensors",
269
+ "model.layers.17.feed_forward.w1.scales": "model.safetensors",
270
+ "model.layers.17.feed_forward.w1.weight": "model.safetensors",
271
+ "model.layers.17.feed_forward.w2.biases": "model.safetensors",
272
+ "model.layers.17.feed_forward.w2.scales": "model.safetensors",
273
+ "model.layers.17.feed_forward.w2.weight": "model.safetensors",
274
+ "model.layers.17.feed_forward.w3.biases": "model.safetensors",
275
+ "model.layers.17.feed_forward.w3.scales": "model.safetensors",
276
+ "model.layers.17.feed_forward.w3.weight": "model.safetensors",
277
+ "model.layers.17.ffn_norm.weight": "model.safetensors",
278
+ "model.layers.18.attention.k_norm.weight": "model.safetensors",
279
+ "model.layers.18.attention.q_norm.weight": "model.safetensors",
280
+ "model.layers.18.attention.wo.biases": "model.safetensors",
281
+ "model.layers.18.attention.wo.scales": "model.safetensors",
282
+ "model.layers.18.attention.wo.weight": "model.safetensors",
283
+ "model.layers.18.attention.wqkv.biases": "model.safetensors",
284
+ "model.layers.18.attention.wqkv.scales": "model.safetensors",
285
+ "model.layers.18.attention.wqkv.weight": "model.safetensors",
286
+ "model.layers.18.attention_norm.weight": "model.safetensors",
287
+ "model.layers.18.feed_forward.w1.biases": "model.safetensors",
288
+ "model.layers.18.feed_forward.w1.scales": "model.safetensors",
289
+ "model.layers.18.feed_forward.w1.weight": "model.safetensors",
290
+ "model.layers.18.feed_forward.w2.biases": "model.safetensors",
291
+ "model.layers.18.feed_forward.w2.scales": "model.safetensors",
292
+ "model.layers.18.feed_forward.w2.weight": "model.safetensors",
293
+ "model.layers.18.feed_forward.w3.biases": "model.safetensors",
294
+ "model.layers.18.feed_forward.w3.scales": "model.safetensors",
295
+ "model.layers.18.feed_forward.w3.weight": "model.safetensors",
296
+ "model.layers.18.ffn_norm.weight": "model.safetensors",
297
+ "model.layers.19.attention.k_norm.weight": "model.safetensors",
298
+ "model.layers.19.attention.q_norm.weight": "model.safetensors",
299
+ "model.layers.19.attention.wo.biases": "model.safetensors",
300
+ "model.layers.19.attention.wo.scales": "model.safetensors",
301
+ "model.layers.19.attention.wo.weight": "model.safetensors",
302
+ "model.layers.19.attention.wqkv.biases": "model.safetensors",
303
+ "model.layers.19.attention.wqkv.scales": "model.safetensors",
304
+ "model.layers.19.attention.wqkv.weight": "model.safetensors",
305
+ "model.layers.19.attention_norm.weight": "model.safetensors",
306
+ "model.layers.19.feed_forward.w1.biases": "model.safetensors",
307
+ "model.layers.19.feed_forward.w1.scales": "model.safetensors",
308
+ "model.layers.19.feed_forward.w1.weight": "model.safetensors",
309
+ "model.layers.19.feed_forward.w2.biases": "model.safetensors",
310
+ "model.layers.19.feed_forward.w2.scales": "model.safetensors",
311
+ "model.layers.19.feed_forward.w2.weight": "model.safetensors",
312
+ "model.layers.19.feed_forward.w3.biases": "model.safetensors",
313
+ "model.layers.19.feed_forward.w3.scales": "model.safetensors",
314
+ "model.layers.19.feed_forward.w3.weight": "model.safetensors",
315
+ "model.layers.19.ffn_norm.weight": "model.safetensors",
316
+ "model.layers.2.attention.k_norm.weight": "model.safetensors",
317
+ "model.layers.2.attention.q_norm.weight": "model.safetensors",
318
+ "model.layers.2.attention.wo.biases": "model.safetensors",
319
+ "model.layers.2.attention.wo.scales": "model.safetensors",
320
+ "model.layers.2.attention.wo.weight": "model.safetensors",
321
+ "model.layers.2.attention.wqkv.biases": "model.safetensors",
322
+ "model.layers.2.attention.wqkv.scales": "model.safetensors",
323
+ "model.layers.2.attention.wqkv.weight": "model.safetensors",
324
+ "model.layers.2.attention_norm.weight": "model.safetensors",
325
+ "model.layers.2.feed_forward.w1.biases": "model.safetensors",
326
+ "model.layers.2.feed_forward.w1.scales": "model.safetensors",
327
+ "model.layers.2.feed_forward.w1.weight": "model.safetensors",
328
+ "model.layers.2.feed_forward.w2.biases": "model.safetensors",
329
+ "model.layers.2.feed_forward.w2.scales": "model.safetensors",
330
+ "model.layers.2.feed_forward.w2.weight": "model.safetensors",
331
+ "model.layers.2.feed_forward.w3.biases": "model.safetensors",
332
+ "model.layers.2.feed_forward.w3.scales": "model.safetensors",
333
+ "model.layers.2.feed_forward.w3.weight": "model.safetensors",
334
+ "model.layers.2.ffn_norm.weight": "model.safetensors",
335
+ "model.layers.20.attention.k_norm.weight": "model.safetensors",
336
+ "model.layers.20.attention.q_norm.weight": "model.safetensors",
337
+ "model.layers.20.attention.wo.biases": "model.safetensors",
338
+ "model.layers.20.attention.wo.scales": "model.safetensors",
339
+ "model.layers.20.attention.wo.weight": "model.safetensors",
340
+ "model.layers.20.attention.wqkv.biases": "model.safetensors",
341
+ "model.layers.20.attention.wqkv.scales": "model.safetensors",
342
+ "model.layers.20.attention.wqkv.weight": "model.safetensors",
343
+ "model.layers.20.attention_norm.weight": "model.safetensors",
344
+ "model.layers.20.feed_forward.w1.biases": "model.safetensors",
345
+ "model.layers.20.feed_forward.w1.scales": "model.safetensors",
346
+ "model.layers.20.feed_forward.w1.weight": "model.safetensors",
347
+ "model.layers.20.feed_forward.w2.biases": "model.safetensors",
348
+ "model.layers.20.feed_forward.w2.scales": "model.safetensors",
349
+ "model.layers.20.feed_forward.w2.weight": "model.safetensors",
350
+ "model.layers.20.feed_forward.w3.biases": "model.safetensors",
351
+ "model.layers.20.feed_forward.w3.scales": "model.safetensors",
352
+ "model.layers.20.feed_forward.w3.weight": "model.safetensors",
353
+ "model.layers.20.ffn_norm.weight": "model.safetensors",
354
+ "model.layers.21.attention.k_norm.weight": "model.safetensors",
355
+ "model.layers.21.attention.q_norm.weight": "model.safetensors",
356
+ "model.layers.21.attention.wo.biases": "model.safetensors",
357
+ "model.layers.21.attention.wo.scales": "model.safetensors",
358
+ "model.layers.21.attention.wo.weight": "model.safetensors",
359
+ "model.layers.21.attention.wqkv.biases": "model.safetensors",
360
+ "model.layers.21.attention.wqkv.scales": "model.safetensors",
361
+ "model.layers.21.attention.wqkv.weight": "model.safetensors",
362
+ "model.layers.21.attention_norm.weight": "model.safetensors",
363
+ "model.layers.21.feed_forward.w1.biases": "model.safetensors",
364
+ "model.layers.21.feed_forward.w1.scales": "model.safetensors",
365
+ "model.layers.21.feed_forward.w1.weight": "model.safetensors",
366
+ "model.layers.21.feed_forward.w2.biases": "model.safetensors",
367
+ "model.layers.21.feed_forward.w2.scales": "model.safetensors",
368
+ "model.layers.21.feed_forward.w2.weight": "model.safetensors",
369
+ "model.layers.21.feed_forward.w3.biases": "model.safetensors",
370
+ "model.layers.21.feed_forward.w3.scales": "model.safetensors",
371
+ "model.layers.21.feed_forward.w3.weight": "model.safetensors",
372
+ "model.layers.21.ffn_norm.weight": "model.safetensors",
373
+ "model.layers.22.attention.k_norm.weight": "model.safetensors",
374
+ "model.layers.22.attention.q_norm.weight": "model.safetensors",
375
+ "model.layers.22.attention.wo.biases": "model.safetensors",
376
+ "model.layers.22.attention.wo.scales": "model.safetensors",
377
+ "model.layers.22.attention.wo.weight": "model.safetensors",
378
+ "model.layers.22.attention.wqkv.biases": "model.safetensors",
379
+ "model.layers.22.attention.wqkv.scales": "model.safetensors",
380
+ "model.layers.22.attention.wqkv.weight": "model.safetensors",
381
+ "model.layers.22.attention_norm.weight": "model.safetensors",
382
+ "model.layers.22.feed_forward.w1.biases": "model.safetensors",
383
+ "model.layers.22.feed_forward.w1.scales": "model.safetensors",
384
+ "model.layers.22.feed_forward.w1.weight": "model.safetensors",
385
+ "model.layers.22.feed_forward.w2.biases": "model.safetensors",
386
+ "model.layers.22.feed_forward.w2.scales": "model.safetensors",
387
+ "model.layers.22.feed_forward.w2.weight": "model.safetensors",
388
+ "model.layers.22.feed_forward.w3.biases": "model.safetensors",
389
+ "model.layers.22.feed_forward.w3.scales": "model.safetensors",
390
+ "model.layers.22.feed_forward.w3.weight": "model.safetensors",
391
+ "model.layers.22.ffn_norm.weight": "model.safetensors",
392
+ "model.layers.23.attention.k_norm.weight": "model.safetensors",
393
+ "model.layers.23.attention.q_norm.weight": "model.safetensors",
394
+ "model.layers.23.attention.wo.biases": "model.safetensors",
395
+ "model.layers.23.attention.wo.scales": "model.safetensors",
396
+ "model.layers.23.attention.wo.weight": "model.safetensors",
397
+ "model.layers.23.attention.wqkv.biases": "model.safetensors",
398
+ "model.layers.23.attention.wqkv.scales": "model.safetensors",
399
+ "model.layers.23.attention.wqkv.weight": "model.safetensors",
400
+ "model.layers.23.attention_norm.weight": "model.safetensors",
401
+ "model.layers.23.feed_forward.w1.biases": "model.safetensors",
402
+ "model.layers.23.feed_forward.w1.scales": "model.safetensors",
403
+ "model.layers.23.feed_forward.w1.weight": "model.safetensors",
404
+ "model.layers.23.feed_forward.w2.biases": "model.safetensors",
405
+ "model.layers.23.feed_forward.w2.scales": "model.safetensors",
406
+ "model.layers.23.feed_forward.w2.weight": "model.safetensors",
407
+ "model.layers.23.feed_forward.w3.biases": "model.safetensors",
408
+ "model.layers.23.feed_forward.w3.scales": "model.safetensors",
409
+ "model.layers.23.feed_forward.w3.weight": "model.safetensors",
410
+ "model.layers.23.ffn_norm.weight": "model.safetensors",
411
+ "model.layers.24.attention.k_norm.weight": "model.safetensors",
412
+ "model.layers.24.attention.q_norm.weight": "model.safetensors",
413
+ "model.layers.24.attention.wo.biases": "model.safetensors",
414
+ "model.layers.24.attention.wo.scales": "model.safetensors",
415
+ "model.layers.24.attention.wo.weight": "model.safetensors",
416
+ "model.layers.24.attention.wqkv.biases": "model.safetensors",
417
+ "model.layers.24.attention.wqkv.scales": "model.safetensors",
418
+ "model.layers.24.attention.wqkv.weight": "model.safetensors",
419
+ "model.layers.24.attention_norm.weight": "model.safetensors",
420
+ "model.layers.24.feed_forward.w1.biases": "model.safetensors",
421
+ "model.layers.24.feed_forward.w1.scales": "model.safetensors",
422
+ "model.layers.24.feed_forward.w1.weight": "model.safetensors",
423
+ "model.layers.24.feed_forward.w2.biases": "model.safetensors",
424
+ "model.layers.24.feed_forward.w2.scales": "model.safetensors",
425
+ "model.layers.24.feed_forward.w2.weight": "model.safetensors",
426
+ "model.layers.24.feed_forward.w3.biases": "model.safetensors",
427
+ "model.layers.24.feed_forward.w3.scales": "model.safetensors",
428
+ "model.layers.24.feed_forward.w3.weight": "model.safetensors",
429
+ "model.layers.24.ffn_norm.weight": "model.safetensors",
430
+ "model.layers.25.attention.k_norm.weight": "model.safetensors",
431
+ "model.layers.25.attention.q_norm.weight": "model.safetensors",
432
+ "model.layers.25.attention.wo.biases": "model.safetensors",
433
+ "model.layers.25.attention.wo.scales": "model.safetensors",
434
+ "model.layers.25.attention.wo.weight": "model.safetensors",
435
+ "model.layers.25.attention.wqkv.biases": "model.safetensors",
436
+ "model.layers.25.attention.wqkv.scales": "model.safetensors",
437
+ "model.layers.25.attention.wqkv.weight": "model.safetensors",
438
+ "model.layers.25.attention_norm.weight": "model.safetensors",
439
+ "model.layers.25.feed_forward.w1.biases": "model.safetensors",
440
+ "model.layers.25.feed_forward.w1.scales": "model.safetensors",
441
+ "model.layers.25.feed_forward.w1.weight": "model.safetensors",
442
+ "model.layers.25.feed_forward.w2.biases": "model.safetensors",
443
+ "model.layers.25.feed_forward.w2.scales": "model.safetensors",
444
+ "model.layers.25.feed_forward.w2.weight": "model.safetensors",
445
+ "model.layers.25.feed_forward.w3.biases": "model.safetensors",
446
+ "model.layers.25.feed_forward.w3.scales": "model.safetensors",
447
+ "model.layers.25.feed_forward.w3.weight": "model.safetensors",
448
+ "model.layers.25.ffn_norm.weight": "model.safetensors",
449
+ "model.layers.26.attention.k_norm.weight": "model.safetensors",
450
+ "model.layers.26.attention.q_norm.weight": "model.safetensors",
451
+ "model.layers.26.attention.wo.biases": "model.safetensors",
452
+ "model.layers.26.attention.wo.scales": "model.safetensors",
453
+ "model.layers.26.attention.wo.weight": "model.safetensors",
454
+ "model.layers.26.attention.wqkv.biases": "model.safetensors",
455
+ "model.layers.26.attention.wqkv.scales": "model.safetensors",
456
+ "model.layers.26.attention.wqkv.weight": "model.safetensors",
457
+ "model.layers.26.attention_norm.weight": "model.safetensors",
458
+ "model.layers.26.feed_forward.w1.biases": "model.safetensors",
459
+ "model.layers.26.feed_forward.w1.scales": "model.safetensors",
460
+ "model.layers.26.feed_forward.w1.weight": "model.safetensors",
461
+ "model.layers.26.feed_forward.w2.biases": "model.safetensors",
462
+ "model.layers.26.feed_forward.w2.scales": "model.safetensors",
463
+ "model.layers.26.feed_forward.w2.weight": "model.safetensors",
464
+ "model.layers.26.feed_forward.w3.biases": "model.safetensors",
465
+ "model.layers.26.feed_forward.w3.scales": "model.safetensors",
466
+ "model.layers.26.feed_forward.w3.weight": "model.safetensors",
467
+ "model.layers.26.ffn_norm.weight": "model.safetensors",
468
+ "model.layers.27.attention.k_norm.weight": "model.safetensors",
469
+ "model.layers.27.attention.q_norm.weight": "model.safetensors",
470
+ "model.layers.27.attention.wo.biases": "model.safetensors",
471
+ "model.layers.27.attention.wo.scales": "model.safetensors",
472
+ "model.layers.27.attention.wo.weight": "model.safetensors",
473
+ "model.layers.27.attention.wqkv.biases": "model.safetensors",
474
+ "model.layers.27.attention.wqkv.scales": "model.safetensors",
475
+ "model.layers.27.attention.wqkv.weight": "model.safetensors",
476
+ "model.layers.27.attention_norm.weight": "model.safetensors",
477
+ "model.layers.27.feed_forward.w1.biases": "model.safetensors",
478
+ "model.layers.27.feed_forward.w1.scales": "model.safetensors",
479
+ "model.layers.27.feed_forward.w1.weight": "model.safetensors",
480
+ "model.layers.27.feed_forward.w2.biases": "model.safetensors",
481
+ "model.layers.27.feed_forward.w2.scales": "model.safetensors",
482
+ "model.layers.27.feed_forward.w2.weight": "model.safetensors",
483
+ "model.layers.27.feed_forward.w3.biases": "model.safetensors",
484
+ "model.layers.27.feed_forward.w3.scales": "model.safetensors",
485
+ "model.layers.27.feed_forward.w3.weight": "model.safetensors",
486
+ "model.layers.27.ffn_norm.weight": "model.safetensors",
487
+ "model.layers.28.attention.k_norm.weight": "model.safetensors",
488
+ "model.layers.28.attention.q_norm.weight": "model.safetensors",
489
+ "model.layers.28.attention.wo.biases": "model.safetensors",
490
+ "model.layers.28.attention.wo.scales": "model.safetensors",
491
+ "model.layers.28.attention.wo.weight": "model.safetensors",
492
+ "model.layers.28.attention.wqkv.biases": "model.safetensors",
493
+ "model.layers.28.attention.wqkv.scales": "model.safetensors",
494
+ "model.layers.28.attention.wqkv.weight": "model.safetensors",
495
+ "model.layers.28.attention_norm.weight": "model.safetensors",
496
+ "model.layers.28.feed_forward.w1.biases": "model.safetensors",
497
+ "model.layers.28.feed_forward.w1.scales": "model.safetensors",
498
+ "model.layers.28.feed_forward.w1.weight": "model.safetensors",
499
+ "model.layers.28.feed_forward.w2.biases": "model.safetensors",
500
+ "model.layers.28.feed_forward.w2.scales": "model.safetensors",
501
+ "model.layers.28.feed_forward.w2.weight": "model.safetensors",
502
+ "model.layers.28.feed_forward.w3.biases": "model.safetensors",
503
+ "model.layers.28.feed_forward.w3.scales": "model.safetensors",
504
+ "model.layers.28.feed_forward.w3.weight": "model.safetensors",
505
+ "model.layers.28.ffn_norm.weight": "model.safetensors",
506
+ "model.layers.29.attention.k_norm.weight": "model.safetensors",
507
+ "model.layers.29.attention.q_norm.weight": "model.safetensors",
508
+ "model.layers.29.attention.wo.biases": "model.safetensors",
509
+ "model.layers.29.attention.wo.scales": "model.safetensors",
510
+ "model.layers.29.attention.wo.weight": "model.safetensors",
511
+ "model.layers.29.attention.wqkv.biases": "model.safetensors",
512
+ "model.layers.29.attention.wqkv.scales": "model.safetensors",
513
+ "model.layers.29.attention.wqkv.weight": "model.safetensors",
514
+ "model.layers.29.attention_norm.weight": "model.safetensors",
515
+ "model.layers.29.feed_forward.w1.biases": "model.safetensors",
516
+ "model.layers.29.feed_forward.w1.scales": "model.safetensors",
517
+ "model.layers.29.feed_forward.w1.weight": "model.safetensors",
518
+ "model.layers.29.feed_forward.w2.biases": "model.safetensors",
519
+ "model.layers.29.feed_forward.w2.scales": "model.safetensors",
520
+ "model.layers.29.feed_forward.w2.weight": "model.safetensors",
521
+ "model.layers.29.feed_forward.w3.biases": "model.safetensors",
522
+ "model.layers.29.feed_forward.w3.scales": "model.safetensors",
523
+ "model.layers.29.feed_forward.w3.weight": "model.safetensors",
524
+ "model.layers.29.ffn_norm.weight": "model.safetensors",
525
+ "model.layers.3.attention.k_norm.weight": "model.safetensors",
526
+ "model.layers.3.attention.q_norm.weight": "model.safetensors",
527
+ "model.layers.3.attention.wo.biases": "model.safetensors",
528
+ "model.layers.3.attention.wo.scales": "model.safetensors",
529
+ "model.layers.3.attention.wo.weight": "model.safetensors",
530
+ "model.layers.3.attention.wqkv.biases": "model.safetensors",
531
+ "model.layers.3.attention.wqkv.scales": "model.safetensors",
532
+ "model.layers.3.attention.wqkv.weight": "model.safetensors",
533
+ "model.layers.3.attention_norm.weight": "model.safetensors",
534
+ "model.layers.3.feed_forward.w1.biases": "model.safetensors",
535
+ "model.layers.3.feed_forward.w1.scales": "model.safetensors",
536
+ "model.layers.3.feed_forward.w1.weight": "model.safetensors",
537
+ "model.layers.3.feed_forward.w2.biases": "model.safetensors",
538
+ "model.layers.3.feed_forward.w2.scales": "model.safetensors",
539
+ "model.layers.3.feed_forward.w2.weight": "model.safetensors",
540
+ "model.layers.3.feed_forward.w3.biases": "model.safetensors",
541
+ "model.layers.3.feed_forward.w3.scales": "model.safetensors",
542
+ "model.layers.3.feed_forward.w3.weight": "model.safetensors",
543
+ "model.layers.3.ffn_norm.weight": "model.safetensors",
544
+ "model.layers.30.attention.k_norm.weight": "model.safetensors",
545
+ "model.layers.30.attention.q_norm.weight": "model.safetensors",
546
+ "model.layers.30.attention.wo.biases": "model.safetensors",
547
+ "model.layers.30.attention.wo.scales": "model.safetensors",
548
+ "model.layers.30.attention.wo.weight": "model.safetensors",
549
+ "model.layers.30.attention.wqkv.biases": "model.safetensors",
550
+ "model.layers.30.attention.wqkv.scales": "model.safetensors",
551
+ "model.layers.30.attention.wqkv.weight": "model.safetensors",
552
+ "model.layers.30.attention_norm.weight": "model.safetensors",
553
+ "model.layers.30.feed_forward.w1.biases": "model.safetensors",
554
+ "model.layers.30.feed_forward.w1.scales": "model.safetensors",
555
+ "model.layers.30.feed_forward.w1.weight": "model.safetensors",
556
+ "model.layers.30.feed_forward.w2.biases": "model.safetensors",
557
+ "model.layers.30.feed_forward.w2.scales": "model.safetensors",
558
+ "model.layers.30.feed_forward.w2.weight": "model.safetensors",
559
+ "model.layers.30.feed_forward.w3.biases": "model.safetensors",
560
+ "model.layers.30.feed_forward.w3.scales": "model.safetensors",
561
+ "model.layers.30.feed_forward.w3.weight": "model.safetensors",
562
+ "model.layers.30.ffn_norm.weight": "model.safetensors",
563
+ "model.layers.31.attention.k_norm.weight": "model.safetensors",
564
+ "model.layers.31.attention.q_norm.weight": "model.safetensors",
565
+ "model.layers.31.attention.wo.biases": "model.safetensors",
566
+ "model.layers.31.attention.wo.scales": "model.safetensors",
567
+ "model.layers.31.attention.wo.weight": "model.safetensors",
568
+ "model.layers.31.attention.wqkv.biases": "model.safetensors",
569
+ "model.layers.31.attention.wqkv.scales": "model.safetensors",
570
+ "model.layers.31.attention.wqkv.weight": "model.safetensors",
571
+ "model.layers.31.attention_norm.weight": "model.safetensors",
572
+ "model.layers.31.feed_forward.w1.biases": "model.safetensors",
573
+ "model.layers.31.feed_forward.w1.scales": "model.safetensors",
574
+ "model.layers.31.feed_forward.w1.weight": "model.safetensors",
575
+ "model.layers.31.feed_forward.w2.biases": "model.safetensors",
576
+ "model.layers.31.feed_forward.w2.scales": "model.safetensors",
577
+ "model.layers.31.feed_forward.w2.weight": "model.safetensors",
578
+ "model.layers.31.feed_forward.w3.biases": "model.safetensors",
579
+ "model.layers.31.feed_forward.w3.scales": "model.safetensors",
580
+ "model.layers.31.feed_forward.w3.weight": "model.safetensors",
581
+ "model.layers.31.ffn_norm.weight": "model.safetensors",
582
+ "model.layers.32.attention.k_norm.weight": "model.safetensors",
583
+ "model.layers.32.attention.q_norm.weight": "model.safetensors",
584
+ "model.layers.32.attention.wo.biases": "model.safetensors",
585
+ "model.layers.32.attention.wo.scales": "model.safetensors",
586
+ "model.layers.32.attention.wo.weight": "model.safetensors",
587
+ "model.layers.32.attention.wqkv.biases": "model.safetensors",
588
+ "model.layers.32.attention.wqkv.scales": "model.safetensors",
589
+ "model.layers.32.attention.wqkv.weight": "model.safetensors",
590
+ "model.layers.32.attention_norm.weight": "model.safetensors",
591
+ "model.layers.32.feed_forward.w1.biases": "model.safetensors",
592
+ "model.layers.32.feed_forward.w1.scales": "model.safetensors",
593
+ "model.layers.32.feed_forward.w1.weight": "model.safetensors",
594
+ "model.layers.32.feed_forward.w2.biases": "model.safetensors",
595
+ "model.layers.32.feed_forward.w2.scales": "model.safetensors",
596
+ "model.layers.32.feed_forward.w2.weight": "model.safetensors",
597
+ "model.layers.32.feed_forward.w3.biases": "model.safetensors",
598
+ "model.layers.32.feed_forward.w3.scales": "model.safetensors",
599
+ "model.layers.32.feed_forward.w3.weight": "model.safetensors",
600
+ "model.layers.32.ffn_norm.weight": "model.safetensors",
601
+ "model.layers.33.attention.k_norm.weight": "model.safetensors",
602
+ "model.layers.33.attention.q_norm.weight": "model.safetensors",
603
+ "model.layers.33.attention.wo.biases": "model.safetensors",
604
+ "model.layers.33.attention.wo.scales": "model.safetensors",
605
+ "model.layers.33.attention.wo.weight": "model.safetensors",
606
+ "model.layers.33.attention.wqkv.biases": "model.safetensors",
607
+ "model.layers.33.attention.wqkv.scales": "model.safetensors",
608
+ "model.layers.33.attention.wqkv.weight": "model.safetensors",
609
+ "model.layers.33.attention_norm.weight": "model.safetensors",
610
+ "model.layers.33.feed_forward.w1.biases": "model.safetensors",
611
+ "model.layers.33.feed_forward.w1.scales": "model.safetensors",
612
+ "model.layers.33.feed_forward.w1.weight": "model.safetensors",
613
+ "model.layers.33.feed_forward.w2.biases": "model.safetensors",
614
+ "model.layers.33.feed_forward.w2.scales": "model.safetensors",
615
+ "model.layers.33.feed_forward.w2.weight": "model.safetensors",
616
+ "model.layers.33.feed_forward.w3.biases": "model.safetensors",
617
+ "model.layers.33.feed_forward.w3.scales": "model.safetensors",
618
+ "model.layers.33.feed_forward.w3.weight": "model.safetensors",
619
+ "model.layers.33.ffn_norm.weight": "model.safetensors",
620
+ "model.layers.34.attention.k_norm.weight": "model.safetensors",
621
+ "model.layers.34.attention.q_norm.weight": "model.safetensors",
622
+ "model.layers.34.attention.wo.biases": "model.safetensors",
623
+ "model.layers.34.attention.wo.scales": "model.safetensors",
624
+ "model.layers.34.attention.wo.weight": "model.safetensors",
625
+ "model.layers.34.attention.wqkv.biases": "model.safetensors",
626
+ "model.layers.34.attention.wqkv.scales": "model.safetensors",
627
+ "model.layers.34.attention.wqkv.weight": "model.safetensors",
628
+ "model.layers.34.attention_norm.weight": "model.safetensors",
629
+ "model.layers.34.feed_forward.w1.biases": "model.safetensors",
630
+ "model.layers.34.feed_forward.w1.scales": "model.safetensors",
631
+ "model.layers.34.feed_forward.w1.weight": "model.safetensors",
632
+ "model.layers.34.feed_forward.w2.biases": "model.safetensors",
633
+ "model.layers.34.feed_forward.w2.scales": "model.safetensors",
634
+ "model.layers.34.feed_forward.w2.weight": "model.safetensors",
635
+ "model.layers.34.feed_forward.w3.biases": "model.safetensors",
636
+ "model.layers.34.feed_forward.w3.scales": "model.safetensors",
637
+ "model.layers.34.feed_forward.w3.weight": "model.safetensors",
638
+ "model.layers.34.ffn_norm.weight": "model.safetensors",
639
+ "model.layers.35.attention.k_norm.weight": "model.safetensors",
640
+ "model.layers.35.attention.q_norm.weight": "model.safetensors",
641
+ "model.layers.35.attention.wo.biases": "model.safetensors",
642
+ "model.layers.35.attention.wo.scales": "model.safetensors",
643
+ "model.layers.35.attention.wo.weight": "model.safetensors",
644
+ "model.layers.35.attention.wqkv.biases": "model.safetensors",
645
+ "model.layers.35.attention.wqkv.scales": "model.safetensors",
646
+ "model.layers.35.attention.wqkv.weight": "model.safetensors",
647
+ "model.layers.35.attention_norm.weight": "model.safetensors",
648
+ "model.layers.35.feed_forward.w1.biases": "model.safetensors",
649
+ "model.layers.35.feed_forward.w1.scales": "model.safetensors",
650
+ "model.layers.35.feed_forward.w1.weight": "model.safetensors",
651
+ "model.layers.35.feed_forward.w2.biases": "model.safetensors",
652
+ "model.layers.35.feed_forward.w2.scales": "model.safetensors",
653
+ "model.layers.35.feed_forward.w2.weight": "model.safetensors",
654
+ "model.layers.35.feed_forward.w3.biases": "model.safetensors",
655
+ "model.layers.35.feed_forward.w3.scales": "model.safetensors",
656
+ "model.layers.35.feed_forward.w3.weight": "model.safetensors",
657
+ "model.layers.35.ffn_norm.weight": "model.safetensors",
658
+ "model.layers.4.attention.k_norm.weight": "model.safetensors",
659
+ "model.layers.4.attention.q_norm.weight": "model.safetensors",
660
+ "model.layers.4.attention.wo.biases": "model.safetensors",
661
+ "model.layers.4.attention.wo.scales": "model.safetensors",
662
+ "model.layers.4.attention.wo.weight": "model.safetensors",
663
+ "model.layers.4.attention.wqkv.biases": "model.safetensors",
664
+ "model.layers.4.attention.wqkv.scales": "model.safetensors",
665
+ "model.layers.4.attention.wqkv.weight": "model.safetensors",
666
+ "model.layers.4.attention_norm.weight": "model.safetensors",
667
+ "model.layers.4.feed_forward.w1.biases": "model.safetensors",
668
+ "model.layers.4.feed_forward.w1.scales": "model.safetensors",
669
+ "model.layers.4.feed_forward.w1.weight": "model.safetensors",
670
+ "model.layers.4.feed_forward.w2.biases": "model.safetensors",
671
+ "model.layers.4.feed_forward.w2.scales": "model.safetensors",
672
+ "model.layers.4.feed_forward.w2.weight": "model.safetensors",
673
+ "model.layers.4.feed_forward.w3.biases": "model.safetensors",
674
+ "model.layers.4.feed_forward.w3.scales": "model.safetensors",
675
+ "model.layers.4.feed_forward.w3.weight": "model.safetensors",
676
+ "model.layers.4.ffn_norm.weight": "model.safetensors",
677
+ "model.layers.5.attention.k_norm.weight": "model.safetensors",
678
+ "model.layers.5.attention.q_norm.weight": "model.safetensors",
679
+ "model.layers.5.attention.wo.biases": "model.safetensors",
680
+ "model.layers.5.attention.wo.scales": "model.safetensors",
681
+ "model.layers.5.attention.wo.weight": "model.safetensors",
682
+ "model.layers.5.attention.wqkv.biases": "model.safetensors",
683
+ "model.layers.5.attention.wqkv.scales": "model.safetensors",
684
+ "model.layers.5.attention.wqkv.weight": "model.safetensors",
685
+ "model.layers.5.attention_norm.weight": "model.safetensors",
686
+ "model.layers.5.feed_forward.w1.biases": "model.safetensors",
687
+ "model.layers.5.feed_forward.w1.scales": "model.safetensors",
688
+ "model.layers.5.feed_forward.w1.weight": "model.safetensors",
689
+ "model.layers.5.feed_forward.w2.biases": "model.safetensors",
690
+ "model.layers.5.feed_forward.w2.scales": "model.safetensors",
691
+ "model.layers.5.feed_forward.w2.weight": "model.safetensors",
692
+ "model.layers.5.feed_forward.w3.biases": "model.safetensors",
693
+ "model.layers.5.feed_forward.w3.scales": "model.safetensors",
694
+ "model.layers.5.feed_forward.w3.weight": "model.safetensors",
695
+ "model.layers.5.ffn_norm.weight": "model.safetensors",
696
+ "model.layers.6.attention.k_norm.weight": "model.safetensors",
697
+ "model.layers.6.attention.q_norm.weight": "model.safetensors",
698
+ "model.layers.6.attention.wo.biases": "model.safetensors",
699
+ "model.layers.6.attention.wo.scales": "model.safetensors",
700
+ "model.layers.6.attention.wo.weight": "model.safetensors",
701
+ "model.layers.6.attention.wqkv.biases": "model.safetensors",
702
+ "model.layers.6.attention.wqkv.scales": "model.safetensors",
703
+ "model.layers.6.attention.wqkv.weight": "model.safetensors",
704
+ "model.layers.6.attention_norm.weight": "model.safetensors",
705
+ "model.layers.6.feed_forward.w1.biases": "model.safetensors",
706
+ "model.layers.6.feed_forward.w1.scales": "model.safetensors",
707
+ "model.layers.6.feed_forward.w1.weight": "model.safetensors",
708
+ "model.layers.6.feed_forward.w2.biases": "model.safetensors",
709
+ "model.layers.6.feed_forward.w2.scales": "model.safetensors",
710
+ "model.layers.6.feed_forward.w2.weight": "model.safetensors",
711
+ "model.layers.6.feed_forward.w3.biases": "model.safetensors",
712
+ "model.layers.6.feed_forward.w3.scales": "model.safetensors",
713
+ "model.layers.6.feed_forward.w3.weight": "model.safetensors",
714
+ "model.layers.6.ffn_norm.weight": "model.safetensors",
715
+ "model.layers.7.attention.k_norm.weight": "model.safetensors",
716
+ "model.layers.7.attention.q_norm.weight": "model.safetensors",
717
+ "model.layers.7.attention.wo.biases": "model.safetensors",
718
+ "model.layers.7.attention.wo.scales": "model.safetensors",
719
+ "model.layers.7.attention.wo.weight": "model.safetensors",
720
+ "model.layers.7.attention.wqkv.biases": "model.safetensors",
721
+ "model.layers.7.attention.wqkv.scales": "model.safetensors",
722
+ "model.layers.7.attention.wqkv.weight": "model.safetensors",
723
+ "model.layers.7.attention_norm.weight": "model.safetensors",
724
+ "model.layers.7.feed_forward.w1.biases": "model.safetensors",
725
+ "model.layers.7.feed_forward.w1.scales": "model.safetensors",
726
+ "model.layers.7.feed_forward.w1.weight": "model.safetensors",
727
+ "model.layers.7.feed_forward.w2.biases": "model.safetensors",
728
+ "model.layers.7.feed_forward.w2.scales": "model.safetensors",
729
+ "model.layers.7.feed_forward.w2.weight": "model.safetensors",
730
+ "model.layers.7.feed_forward.w3.biases": "model.safetensors",
731
+ "model.layers.7.feed_forward.w3.scales": "model.safetensors",
732
+ "model.layers.7.feed_forward.w3.weight": "model.safetensors",
733
+ "model.layers.7.ffn_norm.weight": "model.safetensors",
734
+ "model.layers.8.attention.k_norm.weight": "model.safetensors",
735
+ "model.layers.8.attention.q_norm.weight": "model.safetensors",
736
+ "model.layers.8.attention.wo.biases": "model.safetensors",
737
+ "model.layers.8.attention.wo.scales": "model.safetensors",
738
+ "model.layers.8.attention.wo.weight": "model.safetensors",
739
+ "model.layers.8.attention.wqkv.biases": "model.safetensors",
740
+ "model.layers.8.attention.wqkv.scales": "model.safetensors",
741
+ "model.layers.8.attention.wqkv.weight": "model.safetensors",
742
+ "model.layers.8.attention_norm.weight": "model.safetensors",
743
+ "model.layers.8.feed_forward.w1.biases": "model.safetensors",
744
+ "model.layers.8.feed_forward.w1.scales": "model.safetensors",
745
+ "model.layers.8.feed_forward.w1.weight": "model.safetensors",
746
+ "model.layers.8.feed_forward.w2.biases": "model.safetensors",
747
+ "model.layers.8.feed_forward.w2.scales": "model.safetensors",
748
+ "model.layers.8.feed_forward.w2.weight": "model.safetensors",
749
+ "model.layers.8.feed_forward.w3.biases": "model.safetensors",
750
+ "model.layers.8.feed_forward.w3.scales": "model.safetensors",
751
+ "model.layers.8.feed_forward.w3.weight": "model.safetensors",
752
+ "model.layers.8.ffn_norm.weight": "model.safetensors",
753
+ "model.layers.9.attention.k_norm.weight": "model.safetensors",
754
+ "model.layers.9.attention.q_norm.weight": "model.safetensors",
755
+ "model.layers.9.attention.wo.biases": "model.safetensors",
756
+ "model.layers.9.attention.wo.scales": "model.safetensors",
757
+ "model.layers.9.attention.wo.weight": "model.safetensors",
758
+ "model.layers.9.attention.wqkv.biases": "model.safetensors",
759
+ "model.layers.9.attention.wqkv.scales": "model.safetensors",
760
+ "model.layers.9.attention.wqkv.weight": "model.safetensors",
761
+ "model.layers.9.attention_norm.weight": "model.safetensors",
762
+ "model.layers.9.feed_forward.w1.biases": "model.safetensors",
763
+ "model.layers.9.feed_forward.w1.scales": "model.safetensors",
764
+ "model.layers.9.feed_forward.w1.weight": "model.safetensors",
765
+ "model.layers.9.feed_forward.w2.biases": "model.safetensors",
766
+ "model.layers.9.feed_forward.w2.scales": "model.safetensors",
767
+ "model.layers.9.feed_forward.w2.weight": "model.safetensors",
768
+ "model.layers.9.feed_forward.w3.biases": "model.safetensors",
769
+ "model.layers.9.feed_forward.w3.scales": "model.safetensors",
770
+ "model.layers.9.feed_forward.w3.weight": "model.safetensors",
771
+ "model.layers.9.ffn_norm.weight": "model.safetensors",
772
+ "model.norm.weight": "model.safetensors"
773
+ }
774
+ }
special_tokens_map.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f24e08099d45a8adf3f52f5f0b03276e433bb9d689bb15fcbcc48ce58744588b
3
+ size 12217872
tokenizer_config.json ADDED
The diff for this file is too large to render. See raw diff