MLX
Safetensors
qwen3_5
6-bit
pveugen commited on
Commit
0757c17
·
verified ·
1 Parent(s): 7d14012

v19 ckpt-3000 MLX 6-bit initial upload

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
LICENSE.md ADDED
@@ -0,0 +1,136 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ # Desert Ant Labs Source-Available License
2
+
3
+ Version 1.0 · 2026-06-15
4
+
5
+ Copyright © 2026 Studio Company B.V., trading as Desert Ant Labs (`desertant.ai`).
6
+
7
+ This license governs Your use of the software, model weights, datasets, documentation, and associated assets in this repository (collectively, the **"Licensed Materials"**). It is a **source-available license intended for professional and business use**; it is not an OSI-approved open-source license. The rights granted here are subject to a per-Model usage cap and the other terms set out below.
8
+
9
+ ## Definitions
10
+
11
+ - **"Desert Ant Labs"** (also "We", "Us", "Our") — Studio Company B.V., a private limited liability company (*besloten vennootschap*) incorporated under the laws of the Netherlands, with statutory seat in Amsterdam, registered with the Dutch Chamber of Commerce (KvK) under number **81228112**, trading as Desert Ant Labs.
12
+ - **"Model"** — a set of trained weights published by Desert Ant Labs under a single HuggingFace repository (for example, `huggingface.co/desert-ant-labs/eye`). Each Model is a distinct work under this license.
13
+ - **"Monthly Active User"** or **"MAU"** — a unique end user who interacts with a feature powered by a Model during a calendar month. Internal use by Your own employees and contractors does not count.
14
+ - **"You"** — the individual or legal entity exercising rights under this license.
15
+
16
+ ## 0. Acceptance
17
+
18
+ By downloading, accessing, using, copying, modifying, or distributing the Licensed Materials, You agree to be bound by this license. If You do not agree, You may not use the Licensed Materials.
19
+
20
+ ## 1. Grant
21
+
22
+ Subject to Your continued compliance with this license, Desert Ant Labs grants You a worldwide, royalty-free, non-exclusive, non-transferable, non-sublicensable license to use, reproduce, modify, and distribute the Licensed Materials.
23
+
24
+ ## 2. Free-tier use
25
+
26
+ You may use the Licensed Materials free of charge, including for commercial purposes, subject to the following per-Model threshold:
27
+
28
+ > **For each Desert Ant Labs Model that Your products incorporate, the aggregate Monthly Active Users across all Your products must not exceed 100,000 in any calendar month.**
29
+
30
+ The threshold applies independently to each Model. Two Models at 50,000 MAU each do not combine into 100,000 MAU; each is independently within its own free-tier limit.
31
+
32
+ If a repository contains only software (no trained Model weights), no MAU threshold applies to that software on its own. The threshold attaches to the Models the software is used with.
33
+
34
+ ## 3. Research and academic use
35
+
36
+ Use of the Licensed Materials for non-commercial scientific research and academic publications is exempt from the MAU threshold in Section 2, provided that any resulting publication credits "Desert Ant Labs" and links to the relevant Model repository.
37
+
38
+ ## 4. Commercial license
39
+
40
+ If Your aggregate MAU for any Model exceeds 100,000 (or You expect it to within the next calendar month), You must obtain a commercial license from Desert Ant Labs before continuing to distribute or operate any product that incorporates that Model. A commercial license covers only the Models named in it; other Models remain under the free tier subject to their own thresholds.
41
+
42
+ Contact: <licensing@desertant.ai>.
43
+
44
+ ## 5. Patent grant
45
+
46
+ Each contributor to the Licensed Materials grants You a perpetual, worldwide, non-exclusive, royalty-free, irrevocable (except as stated in this Section) patent license to make, use, sell, offer to sell, and import the Licensed Materials, where such license applies only to those patent claims licensable by that contributor that are necessarily infringed by the Licensed Materials.
47
+
48
+ **If You institute patent litigation against any entity** (including a cross-claim or counterclaim in a lawsuit) alleging that the Licensed Materials infringe a patent, **all patent licenses granted to You under this license terminate as of the date such litigation is filed.**
49
+
50
+ ## 6. Restrictions
51
+
52
+ You may not:
53
+
54
+ 1. Sell, sublicense, or otherwise distribute the Licensed Materials themselves, or any substantially unmodified derivative of them, as a standalone product or hosted service.
55
+ 2. Use the Licensed Materials to train, distill, fine-tune, or otherwise derive a model that You release or distribute under any license more permissive than this license, including any OSI-approved open-source license. Internal research, personal fine-tuning, and use of derivative models that remain under this license are not restricted.
56
+ 3. Remove or alter the copyright, license, attribution, or third-party notices in the Licensed Materials.
57
+
58
+ You may freely embed the Licensed Materials in Your own product, subject to Section 2 and the rest of this license.
59
+
60
+ ## 7. Attribution
61
+
62
+ You must retain this LICENSE file and the copyright notice in all copies and substantial portions of the Licensed Materials. Where Your product surfaces acknowledgements, third-party notices, or "About" / "Credits" screens, please credit **"Desert Ant Labs (`desertant.ai`)"**.
63
+
64
+ ## 8. Modifications
65
+
66
+ You may modify the Licensed Materials. If You distribute modified Licensed Materials, You must:
67
+
68
+ (a) include a prominent notice stating that You have modified them, with the date of modification; and
69
+ (b) ensure that Your distributed modifications are licensed under this license.
70
+
71
+ This license governs the Licensed Materials and modifications to them. Applications and products that merely incorporate, link to, or call the Licensed Materials are Your own work; their structure, source, and license are not constrained by this license, subject only to Sections 2, 6, and 7.
72
+
73
+ ## 9. Reporting
74
+
75
+ To enable Desert Ant Labs to administer the free tier, You agree:
76
+
77
+ (a) to maintain reasonable records of Your aggregate MAU per Model; and
78
+ (b) upon written request from Desert Ant Labs, to provide a reasonable summary of those records sufficient to confirm compliance with Section 2. Such requests will be made no more than once per calendar year per licensee, except in the case of a reasonable, specific suspicion of breach.
79
+
80
+ You are encouraged — but not required — to notify Desert Ant Labs at <licensing@desertant.ai> when Your aggregate MAU for any Model first exceeds 80,000.
81
+
82
+ ## 10. Trademarks
83
+
84
+ This license does not grant You any right to use the trade names, trademarks, service marks, or product names of Desert Ant Labs, except for the limited attribution use specified in Section 7. All goodwill arising from such attribution use inures to the benefit of Desert Ant Labs.
85
+
86
+ ## 11. Third-party components
87
+
88
+ The Licensed Materials may include or derive from components licensed by third parties. Those components remain subject to their own licenses; nothing in this license overrides those terms. Notices for such components are provided in the model card or in a `THIRD_PARTY_NOTICES.md` file alongside the Licensed Materials.
89
+
90
+ ## 12. Termination
91
+
92
+ This license terminates automatically and immediately upon any of the following:
93
+
94
+ (a) Your aggregate MAU for any Model exceeds 100,000 and You do not obtain a commercial license within thirty (30) days;
95
+ (b) Your breach of Section 6 (Restrictions); or
96
+ (c) Your institution of patent litigation as described in Section 5.
97
+
98
+ For any other curable breach, Desert Ant Labs will provide written notice; if the breach is not cured within thirty (30) days of receipt of that notice, this license terminates as of the date the notice was sent.
99
+
100
+ Upon termination, You must cease using and distributing the Licensed Materials. Sections 7 (Attribution, with respect to copies already in the field), 10 (Trademarks), 11 (Third-Party Components), 13 (No Warranty), 14 (Limitation of Liability), and 15 (Governing Law) survive termination.
101
+
102
+ ## 13. No warranty
103
+
104
+ THE LICENSED MATERIALS ARE PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY, FITNESS FOR A PARTICULAR PURPOSE, AND NON-INFRINGEMENT. Desert Ant Labs makes no representation that the Licensed Materials are error-free, secure, or suitable for any particular use.
105
+
106
+ ## 14. Limitation of liability
107
+
108
+ IN NO EVENT SHALL DESERT ANT LABS BE LIABLE FOR ANY INDIRECT, INCIDENTAL, CONSEQUENTIAL, SPECIAL, OR EXEMPLARY DAMAGES (INCLUDING LOST PROFITS, LOSS OF DATA, OR BUSINESS INTERRUPTION) ARISING FROM OR IN CONNECTION WITH THE LICENSED MATERIALS, EVEN IF ADVISED OF THE POSSIBILITY OF SUCH DAMAGES.
109
+
110
+ DESERT ANT LABS' TOTAL CUMULATIVE LIABILITY UNDER OR IN CONNECTION WITH THIS LICENSE SHALL NOT EXCEED THE GREATER OF (A) ONE HUNDRED EUROS (€100) OR (B) THE TOTAL FEES PAID BY YOU TO DESERT ANT LABS UNDER A SEPARATE COMMERCIAL LICENSE IN THE TWELVE (12) MONTHS PRECEDING THE CLAIM.
111
+
112
+ Nothing in this license limits or excludes liability to the extent such limitation or exclusion is not permitted by applicable mandatory law, including liability for willful misconduct (*opzet*) or gross negligence (*bewuste roekeloosheid*) and any mandatory provision of Dutch consumer-protection law.
113
+
114
+ ## 15. Governing law and jurisdiction
115
+
116
+ This license is governed by the laws of the Netherlands, without regard to its conflict-of-laws provisions. The competent courts of Amsterdam, the Netherlands, have exclusive jurisdiction over any dispute arising under or in connection with this license, subject to mandatory provisions of applicable consumer-protection law.
117
+
118
+ The United Nations Convention on Contracts for the International Sale of Goods (CISG, 1980) does not apply to this license.
119
+
120
+ ## 16. Miscellaneous
121
+
122
+ (a) **Severability.** If any provision of this license is held unenforceable by a court of competent jurisdiction, the remaining provisions remain in full force and effect, and the unenforceable provision shall be interpreted to give effect to its intent to the greatest extent permitted by law.
123
+
124
+ (b) **No waiver.** Failure or delay by Desert Ant Labs to enforce any right under this license is not a waiver of that right.
125
+
126
+ (c) **Assignment.** You may not assign this license without Desert Ant Labs' prior written consent. Desert Ant Labs may freely assign this license to a successor in interest. This license binds and benefits each party's successors and permitted assigns.
127
+
128
+ (d) **Entire agreement.** This license, together with any separate commercial license referenced in Section 4, is the entire agreement between You and Desert Ant Labs regarding the Licensed Materials and supersedes all prior agreements on the same subject matter.
129
+
130
+ (e) **Language.** The authoritative version of this license is in English. Any translation is for convenience only; in the event of any conflict, the English version controls.
131
+
132
+ ---
133
+
134
+ Commercial licensing inquiries: <licensing@desertant.ai>.
135
+
136
+ © 2026 Studio Company B.V., trading as Desert Ant Labs. Statutory seat: Amsterdam, the Netherlands. KvK: **81228112**.
README.md ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: other
3
+ license_name: desert-ant-labs-source-available-1.0
4
+ license_link: LICENSE.md
5
+ library_name: mlx
6
+ inference: false
7
+ ---
8
+
9
+ # autoedit
10
+
11
+ Released under the **Desert Ant Labs Source-Available License v1.0** (see [`LICENSE.md`](LICENSE.md)). Free for commercial use up to 100,000 MAU per Model. Contact <licensing@desertant.ai> for commercial licensing at larger scale.
12
+
13
+ Upstream component attribution: [`THIRD_PARTY_NOTICES.md`](THIRD_PARTY_NOTICES.md).
14
+
15
+ ---
16
+
17
+ © 2026 Desert Ant Labs · <https://desertant.ai>
SYSTEM_PROMPT.txt ADDED
@@ -0,0 +1,21 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ You are an on-device transcript editor for Detail. Given a video transcript and an instruction, return a JSON envelope of edits.
2
+
3
+ Output exactly:
4
+ {"edits":[{"type":"...","keep":[ids],"drop":[ids],"topic":"...","title":"...","text":"...","label":"...","track":"..."}]}
5
+
6
+ Only include the fields each type uses:
7
+ - short: {"type":"short","keep":[5-9 sentence ids],"topic":"..."?,"title":"3-6 word viral title"?,"desc":"one-line description (~15-25 words)"?}
8
+ - long: {"type":"long","keep":[ids to KEEP for the long edit — usually 70-95% of sentences]}
9
+ - full: {"type":"full","keep":[ids — minimal cleanup, keep most]}
10
+ - topic: {"type":"topic","label":"5-9 word descriptive theme"} (one per topic; emit multiple rows for multiple topics)
11
+ - title: {"type":"title","text":"3-8 word punchy viral title"}
12
+ - callout: {"type":"callout","keep":[1-2 ids],"text":"2-5 word overlay text"} (emit several — one per strong moment across the video)
13
+ - chapter: {"type":"chapter","label":"3-7 word title","keep":[contiguous ids]}
14
+ - music: {"type":"music","track":"<id from the music list in the user content>"}
15
+
16
+ Rules:
17
+ - IDs reference the transcript's "t" array (zero-indexed strings as ids).
18
+ - For music: pick an id present in the user content's "music" list. Never invent.
19
+ - For topic vs title: topic = descriptive (chapter heading register); title = viral (hook register).
20
+ - A short's card: title = punchy viral hook; desc = one-line summary of the clip.
21
+ - Output compact JSON. No commentary.
THIRD_PARTY_NOTICES.md ADDED
@@ -0,0 +1,42 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ # Third-party notices: autoedit
2
+
3
+ The `autoedit` model derives from components licensed by third parties. Their licenses apply to the components named below; nothing in the Desert Ant Labs Source-Available License overrides them.
4
+
5
+ ## Pretrained backbone
6
+
7
+ ### Qwen3.5-0.8B
8
+
9
+ - **Source:** [Qwen/Qwen3.5-0.8B](https://huggingface.co/Qwen/Qwen3.5-0.8B) on Hugging Face.
10
+ - **License:** Apache License 2.0.
11
+ - **Use in `autoedit`:** The full 0.8B parameter set was fine-tuned via LoRA (rank 64, alpha 128) on internal editorial data. The trained adapter was then merged into the base weights and quantized to MLX 6-bit for on-device inference. The base architecture and pretraining are unmodified.
12
+ - **Attribution & modifications:** Apache 2.0 requires that derivative distributions preserve the copyright notice and state the changes. The modifications are: (a) LoRA fine-tune on the internal editorial corpus, (b) PEFT merge into a fused model, (c) format conversion (PyTorch → MLX) via `mlx_lm.convert` with 6-bit quantization. Weights decompress at inference; numerics match the fused checkpoint within quantization precision.
13
+
14
+ ## Tokenizer
15
+
16
+ The bundled tokenizer is the Qwen3.5 tokenizer distributed with the base model, unmodified.
17
+
18
+ - **Source:** distributed as part of [Qwen/Qwen3.5-0.8B](https://huggingface.co/Qwen/Qwen3.5-0.8B).
19
+ - **License:** Apache License 2.0.
20
+
21
+ ## Runtime libraries
22
+
23
+ Runtime libraries that link into the Apple binary consuming the model:
24
+
25
+ - **mlx-swift** ([ml-explore/mlx-swift](https://github.com/ml-explore/mlx-swift)): MIT License.
26
+ - **mlx-swift-lm** ([ml-explore/mlx-swift-lm](https://github.com/ml-explore/mlx-swift-lm)): MIT License.
27
+ - **swift-transformers** ([huggingface/swift-transformers](https://github.com/huggingface/swift-transformers)): Apache License 2.0. Provides the `AutoTokenizer` used at load time.
28
+
29
+ ## Training data
30
+
31
+ Fine-tuning data is Desert Ant Labs internal editorial corpus (customer-generated transcripts and editing decisions). Not publicly released and not attributable to third parties. No external datasets contribute to the fine-tune.
32
+
33
+ ## License-notice retention
34
+
35
+ The Apache 2.0 licenses on the upstream components require preservation of copyright notices.
36
+
37
+ - **Qwen3.5-0.8B** is Apache 2.0-licensed. The [Qwen license](https://huggingface.co/Qwen/Qwen3.5-0.8B/blob/main/LICENSE) attributes copyright to Alibaba Cloud.
38
+ - **swift-transformers** is Apache 2.0-licensed. The [swift-transformers license](https://github.com/huggingface/swift-transformers/blob/main/LICENSE) attributes copyright to Hugging Face, Inc.
39
+
40
+ ## Apache 2.0 NOTICE
41
+
42
+ For every Apache 2.0 upstream that ships a NOTICE file, the contents land verbatim in this section. Qwen3.5-0.8B ships no separate NOTICE file beyond its LICENSE. swift-transformers ships no separate NOTICE file beyond its LICENSE.
chat_template.jinja ADDED
@@ -0,0 +1,154 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- set image_count = namespace(value=0) %}
2
+ {%- set video_count = namespace(value=0) %}
3
+ {%- macro render_content(content, do_vision_count, is_system_content=false) %}
4
+ {%- if content is string %}
5
+ {{- content }}
6
+ {%- elif content is iterable and content is not mapping %}
7
+ {%- for item in content %}
8
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
9
+ {%- if is_system_content %}
10
+ {{- raise_exception('System message cannot contain images.') }}
11
+ {%- endif %}
12
+ {%- if do_vision_count %}
13
+ {%- set image_count.value = image_count.value + 1 %}
14
+ {%- endif %}
15
+ {%- if add_vision_id %}
16
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
17
+ {%- endif %}
18
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
19
+ {%- elif 'video' in item or item.type == 'video' %}
20
+ {%- if is_system_content %}
21
+ {{- raise_exception('System message cannot contain videos.') }}
22
+ {%- endif %}
23
+ {%- if do_vision_count %}
24
+ {%- set video_count.value = video_count.value + 1 %}
25
+ {%- endif %}
26
+ {%- if add_vision_id %}
27
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
28
+ {%- endif %}
29
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
30
+ {%- elif 'text' in item %}
31
+ {{- item.text }}
32
+ {%- else %}
33
+ {{- raise_exception('Unexpected item type in content.') }}
34
+ {%- endif %}
35
+ {%- endfor %}
36
+ {%- elif content is none or content is undefined %}
37
+ {{- '' }}
38
+ {%- else %}
39
+ {{- raise_exception('Unexpected content type.') }}
40
+ {%- endif %}
41
+ {%- endmacro %}
42
+ {%- if not messages %}
43
+ {{- raise_exception('No messages provided.') }}
44
+ {%- endif %}
45
+ {%- if tools and tools is iterable and tools is not mapping %}
46
+ {{- '<|im_start|>system\n' }}
47
+ {{- "# Tools\n\nYou have access to the following functions:\n\n<tools>" }}
48
+ {%- for tool in tools %}
49
+ {{- "\n" }}
50
+ {{- tool | tojson }}
51
+ {%- endfor %}
52
+ {{- "\n</tools>" }}
53
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n<tool_call>\n<function=example_function_name>\n<parameter=example_parameter_1>\nvalue_1\n</parameter>\n<parameter=example_parameter_2>\nThis is the value for the second parameter\nthat can span\nmultiple lines\n</parameter>\n</function>\n</tool_call>\n\n<IMPORTANT>\nReminder:\n- Function calls MUST follow the specified format: an inner <function=...></function> block must be nested within <tool_call></tool_call> XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n</IMPORTANT>' }}
54
+ {%- if messages[0].role == 'system' %}
55
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
56
+ {%- if content %}
57
+ {{- '\n\n' + content }}
58
+ {%- endif %}
59
+ {%- endif %}
60
+ {{- '<|im_end|>\n' }}
61
+ {%- else %}
62
+ {%- if messages[0].role == 'system' %}
63
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
64
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
65
+ {%- endif %}
66
+ {%- endif %}
67
+ {%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
68
+ {%- for message in messages[::-1] %}
69
+ {%- set index = (messages|length - 1) - loop.index0 %}
70
+ {%- if ns.multi_step_tool and message.role == "user" %}
71
+ {%- set content = render_content(message.content, false)|trim %}
72
+ {%- if not(content.startswith('<tool_response>') and content.endswith('</tool_response>')) %}
73
+ {%- set ns.multi_step_tool = false %}
74
+ {%- set ns.last_query_index = index %}
75
+ {%- endif %}
76
+ {%- endif %}
77
+ {%- endfor %}
78
+ {%- if ns.multi_step_tool %}
79
+ {{- raise_exception('No user query found in messages.') }}
80
+ {%- endif %}
81
+ {%- for message in messages %}
82
+ {%- set content = render_content(message.content, true)|trim %}
83
+ {%- if message.role == "system" %}
84
+ {%- if not loop.first %}
85
+ {{- raise_exception('System message must be at the beginning.') }}
86
+ {%- endif %}
87
+ {%- elif message.role == "user" %}
88
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
89
+ {%- elif message.role == "assistant" %}
90
+ {%- set reasoning_content = '' %}
91
+ {%- if message.reasoning_content is string %}
92
+ {%- set reasoning_content = message.reasoning_content %}
93
+ {%- else %}
94
+ {%- if '</think>' in content %}
95
+ {%- set reasoning_content = content.split('</think>')[0].rstrip('\n').split('<think>')[-1].lstrip('\n') %}
96
+ {%- set content = content.split('</think>')[-1].lstrip('\n') %}
97
+ {%- endif %}
98
+ {%- endif %}
99
+ {%- set reasoning_content = reasoning_content|trim %}
100
+ {%- if loop.index0 > ns.last_query_index %}
101
+ {{- '<|im_start|>' + message.role + '\n<think>\n' + reasoning_content + '\n</think>\n\n' + content }}
102
+ {%- else %}
103
+ {{- '<|im_start|>' + message.role + '\n' + content }}
104
+ {%- endif %}
105
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
106
+ {%- for tool_call in message.tool_calls %}
107
+ {%- if tool_call.function is defined %}
108
+ {%- set tool_call = tool_call.function %}
109
+ {%- endif %}
110
+ {%- if loop.first %}
111
+ {%- if content|trim %}
112
+ {{- '\n\n<tool_call>\n<function=' + tool_call.name + '>\n' }}
113
+ {%- else %}
114
+ {{- '<tool_call>\n<function=' + tool_call.name + '>\n' }}
115
+ {%- endif %}
116
+ {%- else %}
117
+ {{- '\n<tool_call>\n<function=' + tool_call.name + '>\n' }}
118
+ {%- endif %}
119
+ {%- if tool_call.arguments is defined %}
120
+ {%- for args_name, args_value in tool_call.arguments|items %}
121
+ {{- '<parameter=' + args_name + '>\n' }}
122
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
123
+ {{- args_value }}
124
+ {{- '\n</parameter>\n' }}
125
+ {%- endfor %}
126
+ {%- endif %}
127
+ {{- '</function>\n</tool_call>' }}
128
+ {%- endfor %}
129
+ {%- endif %}
130
+ {{- '<|im_end|>\n' }}
131
+ {%- elif message.role == "tool" %}
132
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
133
+ {{- '<|im_start|>user' }}
134
+ {%- endif %}
135
+ {{- '\n<tool_response>\n' }}
136
+ {{- content }}
137
+ {{- '\n</tool_response>' }}
138
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
139
+ {{- '<|im_end|>\n' }}
140
+ {%- elif loop.last %}
141
+ {{- '<|im_end|>\n' }}
142
+ {%- endif %}
143
+ {%- else %}
144
+ {{- raise_exception('Unexpected message role.') }}
145
+ {%- endif %}
146
+ {%- endfor %}
147
+ {%- if add_generation_prompt %}
148
+ {{- '<|im_start|>assistant\n' }}
149
+ {%- if enable_thinking is defined and enable_thinking is true %}
150
+ {{- '<think>\n' }}
151
+ {%- else %}
152
+ {{- '<think>\n\n</think>\n\n' }}
153
+ {%- endif %}
154
+ {%- endif %}
config.json ADDED
@@ -0,0 +1,86 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen3_5ForConditionalGeneration"
4
+ ],
5
+ "attention_bias": false,
6
+ "attention_dropout": 0.0,
7
+ "attn_output_gate": true,
8
+ "bos_token_id": null,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 248044,
11
+ "full_attention_interval": 4,
12
+ "head_dim": 256,
13
+ "hidden_act": "silu",
14
+ "hidden_size": 1024,
15
+ "initializer_range": 0.02,
16
+ "intermediate_size": 3584,
17
+ "layer_types": [
18
+ "linear_attention",
19
+ "linear_attention",
20
+ "linear_attention",
21
+ "full_attention",
22
+ "linear_attention",
23
+ "linear_attention",
24
+ "linear_attention",
25
+ "full_attention",
26
+ "linear_attention",
27
+ "linear_attention",
28
+ "linear_attention",
29
+ "full_attention",
30
+ "linear_attention",
31
+ "linear_attention",
32
+ "linear_attention",
33
+ "full_attention",
34
+ "linear_attention",
35
+ "linear_attention",
36
+ "linear_attention",
37
+ "full_attention",
38
+ "linear_attention",
39
+ "linear_attention",
40
+ "linear_attention",
41
+ "full_attention"
42
+ ],
43
+ "linear_conv_kernel_dim": 4,
44
+ "linear_key_head_dim": 128,
45
+ "linear_num_key_heads": 16,
46
+ "linear_num_value_heads": 16,
47
+ "linear_value_head_dim": 128,
48
+ "mamba_ssm_dtype": "float32",
49
+ "max_position_embeddings": 262144,
50
+ "mlp_only_layers": [],
51
+ "model_type": "qwen3_5",
52
+ "mtp_num_hidden_layers": 1,
53
+ "mtp_use_dedicated_embeddings": false,
54
+ "num_attention_heads": 8,
55
+ "num_hidden_layers": 24,
56
+ "num_key_value_heads": 2,
57
+ "pad_token_id": null,
58
+ "partial_rotary_factor": 0.25,
59
+ "quantization": {
60
+ "group_size": 64,
61
+ "bits": 6,
62
+ "mode": "affine"
63
+ },
64
+ "quantization_config": {
65
+ "group_size": 64,
66
+ "bits": 6,
67
+ "mode": "affine"
68
+ },
69
+ "rms_norm_eps": 1e-06,
70
+ "rope_parameters": {
71
+ "mrope_interleaved": true,
72
+ "mrope_section": [
73
+ 11,
74
+ 11,
75
+ 10
76
+ ],
77
+ "partial_rotary_factor": 0.25,
78
+ "rope_theta": 10000000,
79
+ "type": "default"
80
+ },
81
+ "rope_theta": 10000000,
82
+ "tie_word_embeddings": true,
83
+ "transformers_version": "5.5.0",
84
+ "use_cache": true,
85
+ "vocab_size": 248320
86
+ }
generation_config.json ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {
2
+ "_from_model_config": true,
3
+ "eos_token_id": 248044,
4
+ "transformers_version": "5.5.0",
5
+ "use_cache": true
6
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5de0cbdccb9d92aeef3046f03468abf333cb9b178ce877df9c8cc8f617748028
3
+ size 612000030
model.safetensors.index.json ADDED
@@ -0,0 +1,702 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "metadata": {
3
+ "total_size": 611911296,
4
+ "total_parameters": 752392448
5
+ },
6
+ "weight_map": {
7
+ "language_model.model.embed_tokens.biases": "model.safetensors",
8
+ "language_model.model.embed_tokens.scales": "model.safetensors",
9
+ "language_model.model.embed_tokens.weight": "model.safetensors",
10
+ "language_model.model.layers.0.input_layernorm.weight": "model.safetensors",
11
+ "language_model.model.layers.0.linear_attn.A_log": "model.safetensors",
12
+ "language_model.model.layers.0.linear_attn.conv1d.weight": "model.safetensors",
13
+ "language_model.model.layers.0.linear_attn.dt_bias": "model.safetensors",
14
+ "language_model.model.layers.0.linear_attn.in_proj_a.biases": "model.safetensors",
15
+ "language_model.model.layers.0.linear_attn.in_proj_a.scales": "model.safetensors",
16
+ "language_model.model.layers.0.linear_attn.in_proj_a.weight": "model.safetensors",
17
+ "language_model.model.layers.0.linear_attn.in_proj_b.biases": "model.safetensors",
18
+ "language_model.model.layers.0.linear_attn.in_proj_b.scales": "model.safetensors",
19
+ "language_model.model.layers.0.linear_attn.in_proj_b.weight": "model.safetensors",
20
+ "language_model.model.layers.0.linear_attn.in_proj_qkv.biases": "model.safetensors",
21
+ "language_model.model.layers.0.linear_attn.in_proj_qkv.scales": "model.safetensors",
22
+ "language_model.model.layers.0.linear_attn.in_proj_qkv.weight": "model.safetensors",
23
+ "language_model.model.layers.0.linear_attn.in_proj_z.biases": "model.safetensors",
24
+ "language_model.model.layers.0.linear_attn.in_proj_z.scales": "model.safetensors",
25
+ "language_model.model.layers.0.linear_attn.in_proj_z.weight": "model.safetensors",
26
+ "language_model.model.layers.0.linear_attn.norm.weight": "model.safetensors",
27
+ "language_model.model.layers.0.linear_attn.out_proj.biases": "model.safetensors",
28
+ "language_model.model.layers.0.linear_attn.out_proj.scales": "model.safetensors",
29
+ "language_model.model.layers.0.linear_attn.out_proj.weight": "model.safetensors",
30
+ "language_model.model.layers.0.mlp.down_proj.biases": "model.safetensors",
31
+ "language_model.model.layers.0.mlp.down_proj.scales": "model.safetensors",
32
+ "language_model.model.layers.0.mlp.down_proj.weight": "model.safetensors",
33
+ "language_model.model.layers.0.mlp.gate_proj.biases": "model.safetensors",
34
+ "language_model.model.layers.0.mlp.gate_proj.scales": "model.safetensors",
35
+ "language_model.model.layers.0.mlp.gate_proj.weight": "model.safetensors",
36
+ "language_model.model.layers.0.mlp.up_proj.biases": "model.safetensors",
37
+ "language_model.model.layers.0.mlp.up_proj.scales": "model.safetensors",
38
+ "language_model.model.layers.0.mlp.up_proj.weight": "model.safetensors",
39
+ "language_model.model.layers.0.post_attention_layernorm.weight": "model.safetensors",
40
+ "language_model.model.layers.1.input_layernorm.weight": "model.safetensors",
41
+ "language_model.model.layers.1.linear_attn.A_log": "model.safetensors",
42
+ "language_model.model.layers.1.linear_attn.conv1d.weight": "model.safetensors",
43
+ "language_model.model.layers.1.linear_attn.dt_bias": "model.safetensors",
44
+ "language_model.model.layers.1.linear_attn.in_proj_a.biases": "model.safetensors",
45
+ "language_model.model.layers.1.linear_attn.in_proj_a.scales": "model.safetensors",
46
+ "language_model.model.layers.1.linear_attn.in_proj_a.weight": "model.safetensors",
47
+ "language_model.model.layers.1.linear_attn.in_proj_b.biases": "model.safetensors",
48
+ "language_model.model.layers.1.linear_attn.in_proj_b.scales": "model.safetensors",
49
+ "language_model.model.layers.1.linear_attn.in_proj_b.weight": "model.safetensors",
50
+ "language_model.model.layers.1.linear_attn.in_proj_qkv.biases": "model.safetensors",
51
+ "language_model.model.layers.1.linear_attn.in_proj_qkv.scales": "model.safetensors",
52
+ "language_model.model.layers.1.linear_attn.in_proj_qkv.weight": "model.safetensors",
53
+ "language_model.model.layers.1.linear_attn.in_proj_z.biases": "model.safetensors",
54
+ "language_model.model.layers.1.linear_attn.in_proj_z.scales": "model.safetensors",
55
+ "language_model.model.layers.1.linear_attn.in_proj_z.weight": "model.safetensors",
56
+ "language_model.model.layers.1.linear_attn.norm.weight": "model.safetensors",
57
+ "language_model.model.layers.1.linear_attn.out_proj.biases": "model.safetensors",
58
+ "language_model.model.layers.1.linear_attn.out_proj.scales": "model.safetensors",
59
+ "language_model.model.layers.1.linear_attn.out_proj.weight": "model.safetensors",
60
+ "language_model.model.layers.1.mlp.down_proj.biases": "model.safetensors",
61
+ "language_model.model.layers.1.mlp.down_proj.scales": "model.safetensors",
62
+ "language_model.model.layers.1.mlp.down_proj.weight": "model.safetensors",
63
+ "language_model.model.layers.1.mlp.gate_proj.biases": "model.safetensors",
64
+ "language_model.model.layers.1.mlp.gate_proj.scales": "model.safetensors",
65
+ "language_model.model.layers.1.mlp.gate_proj.weight": "model.safetensors",
66
+ "language_model.model.layers.1.mlp.up_proj.biases": "model.safetensors",
67
+ "language_model.model.layers.1.mlp.up_proj.scales": "model.safetensors",
68
+ "language_model.model.layers.1.mlp.up_proj.weight": "model.safetensors",
69
+ "language_model.model.layers.1.post_attention_layernorm.weight": "model.safetensors",
70
+ "language_model.model.layers.10.input_layernorm.weight": "model.safetensors",
71
+ "language_model.model.layers.10.linear_attn.A_log": "model.safetensors",
72
+ "language_model.model.layers.10.linear_attn.conv1d.weight": "model.safetensors",
73
+ "language_model.model.layers.10.linear_attn.dt_bias": "model.safetensors",
74
+ "language_model.model.layers.10.linear_attn.in_proj_a.biases": "model.safetensors",
75
+ "language_model.model.layers.10.linear_attn.in_proj_a.scales": "model.safetensors",
76
+ "language_model.model.layers.10.linear_attn.in_proj_a.weight": "model.safetensors",
77
+ "language_model.model.layers.10.linear_attn.in_proj_b.biases": "model.safetensors",
78
+ "language_model.model.layers.10.linear_attn.in_proj_b.scales": "model.safetensors",
79
+ "language_model.model.layers.10.linear_attn.in_proj_b.weight": "model.safetensors",
80
+ "language_model.model.layers.10.linear_attn.in_proj_qkv.biases": "model.safetensors",
81
+ "language_model.model.layers.10.linear_attn.in_proj_qkv.scales": "model.safetensors",
82
+ "language_model.model.layers.10.linear_attn.in_proj_qkv.weight": "model.safetensors",
83
+ "language_model.model.layers.10.linear_attn.in_proj_z.biases": "model.safetensors",
84
+ "language_model.model.layers.10.linear_attn.in_proj_z.scales": "model.safetensors",
85
+ "language_model.model.layers.10.linear_attn.in_proj_z.weight": "model.safetensors",
86
+ "language_model.model.layers.10.linear_attn.norm.weight": "model.safetensors",
87
+ "language_model.model.layers.10.linear_attn.out_proj.biases": "model.safetensors",
88
+ "language_model.model.layers.10.linear_attn.out_proj.scales": "model.safetensors",
89
+ "language_model.model.layers.10.linear_attn.out_proj.weight": "model.safetensors",
90
+ "language_model.model.layers.10.mlp.down_proj.biases": "model.safetensors",
91
+ "language_model.model.layers.10.mlp.down_proj.scales": "model.safetensors",
92
+ "language_model.model.layers.10.mlp.down_proj.weight": "model.safetensors",
93
+ "language_model.model.layers.10.mlp.gate_proj.biases": "model.safetensors",
94
+ "language_model.model.layers.10.mlp.gate_proj.scales": "model.safetensors",
95
+ "language_model.model.layers.10.mlp.gate_proj.weight": "model.safetensors",
96
+ "language_model.model.layers.10.mlp.up_proj.biases": "model.safetensors",
97
+ "language_model.model.layers.10.mlp.up_proj.scales": "model.safetensors",
98
+ "language_model.model.layers.10.mlp.up_proj.weight": "model.safetensors",
99
+ "language_model.model.layers.10.post_attention_layernorm.weight": "model.safetensors",
100
+ "language_model.model.layers.11.input_layernorm.weight": "model.safetensors",
101
+ "language_model.model.layers.11.mlp.down_proj.biases": "model.safetensors",
102
+ "language_model.model.layers.11.mlp.down_proj.scales": "model.safetensors",
103
+ "language_model.model.layers.11.mlp.down_proj.weight": "model.safetensors",
104
+ "language_model.model.layers.11.mlp.gate_proj.biases": "model.safetensors",
105
+ "language_model.model.layers.11.mlp.gate_proj.scales": "model.safetensors",
106
+ "language_model.model.layers.11.mlp.gate_proj.weight": "model.safetensors",
107
+ "language_model.model.layers.11.mlp.up_proj.biases": "model.safetensors",
108
+ "language_model.model.layers.11.mlp.up_proj.scales": "model.safetensors",
109
+ "language_model.model.layers.11.mlp.up_proj.weight": "model.safetensors",
110
+ "language_model.model.layers.11.post_attention_layernorm.weight": "model.safetensors",
111
+ "language_model.model.layers.11.self_attn.k_norm.weight": "model.safetensors",
112
+ "language_model.model.layers.11.self_attn.k_proj.biases": "model.safetensors",
113
+ "language_model.model.layers.11.self_attn.k_proj.scales": "model.safetensors",
114
+ "language_model.model.layers.11.self_attn.k_proj.weight": "model.safetensors",
115
+ "language_model.model.layers.11.self_attn.o_proj.biases": "model.safetensors",
116
+ "language_model.model.layers.11.self_attn.o_proj.scales": "model.safetensors",
117
+ "language_model.model.layers.11.self_attn.o_proj.weight": "model.safetensors",
118
+ "language_model.model.layers.11.self_attn.q_norm.weight": "model.safetensors",
119
+ "language_model.model.layers.11.self_attn.q_proj.biases": "model.safetensors",
120
+ "language_model.model.layers.11.self_attn.q_proj.scales": "model.safetensors",
121
+ "language_model.model.layers.11.self_attn.q_proj.weight": "model.safetensors",
122
+ "language_model.model.layers.11.self_attn.v_proj.biases": "model.safetensors",
123
+ "language_model.model.layers.11.self_attn.v_proj.scales": "model.safetensors",
124
+ "language_model.model.layers.11.self_attn.v_proj.weight": "model.safetensors",
125
+ "language_model.model.layers.12.input_layernorm.weight": "model.safetensors",
126
+ "language_model.model.layers.12.linear_attn.A_log": "model.safetensors",
127
+ "language_model.model.layers.12.linear_attn.conv1d.weight": "model.safetensors",
128
+ "language_model.model.layers.12.linear_attn.dt_bias": "model.safetensors",
129
+ "language_model.model.layers.12.linear_attn.in_proj_a.biases": "model.safetensors",
130
+ "language_model.model.layers.12.linear_attn.in_proj_a.scales": "model.safetensors",
131
+ "language_model.model.layers.12.linear_attn.in_proj_a.weight": "model.safetensors",
132
+ "language_model.model.layers.12.linear_attn.in_proj_b.biases": "model.safetensors",
133
+ "language_model.model.layers.12.linear_attn.in_proj_b.scales": "model.safetensors",
134
+ "language_model.model.layers.12.linear_attn.in_proj_b.weight": "model.safetensors",
135
+ "language_model.model.layers.12.linear_attn.in_proj_qkv.biases": "model.safetensors",
136
+ "language_model.model.layers.12.linear_attn.in_proj_qkv.scales": "model.safetensors",
137
+ "language_model.model.layers.12.linear_attn.in_proj_qkv.weight": "model.safetensors",
138
+ "language_model.model.layers.12.linear_attn.in_proj_z.biases": "model.safetensors",
139
+ "language_model.model.layers.12.linear_attn.in_proj_z.scales": "model.safetensors",
140
+ "language_model.model.layers.12.linear_attn.in_proj_z.weight": "model.safetensors",
141
+ "language_model.model.layers.12.linear_attn.norm.weight": "model.safetensors",
142
+ "language_model.model.layers.12.linear_attn.out_proj.biases": "model.safetensors",
143
+ "language_model.model.layers.12.linear_attn.out_proj.scales": "model.safetensors",
144
+ "language_model.model.layers.12.linear_attn.out_proj.weight": "model.safetensors",
145
+ "language_model.model.layers.12.mlp.down_proj.biases": "model.safetensors",
146
+ "language_model.model.layers.12.mlp.down_proj.scales": "model.safetensors",
147
+ "language_model.model.layers.12.mlp.down_proj.weight": "model.safetensors",
148
+ "language_model.model.layers.12.mlp.gate_proj.biases": "model.safetensors",
149
+ "language_model.model.layers.12.mlp.gate_proj.scales": "model.safetensors",
150
+ "language_model.model.layers.12.mlp.gate_proj.weight": "model.safetensors",
151
+ "language_model.model.layers.12.mlp.up_proj.biases": "model.safetensors",
152
+ "language_model.model.layers.12.mlp.up_proj.scales": "model.safetensors",
153
+ "language_model.model.layers.12.mlp.up_proj.weight": "model.safetensors",
154
+ "language_model.model.layers.12.post_attention_layernorm.weight": "model.safetensors",
155
+ "language_model.model.layers.13.input_layernorm.weight": "model.safetensors",
156
+ "language_model.model.layers.13.linear_attn.A_log": "model.safetensors",
157
+ "language_model.model.layers.13.linear_attn.conv1d.weight": "model.safetensors",
158
+ "language_model.model.layers.13.linear_attn.dt_bias": "model.safetensors",
159
+ "language_model.model.layers.13.linear_attn.in_proj_a.biases": "model.safetensors",
160
+ "language_model.model.layers.13.linear_attn.in_proj_a.scales": "model.safetensors",
161
+ "language_model.model.layers.13.linear_attn.in_proj_a.weight": "model.safetensors",
162
+ "language_model.model.layers.13.linear_attn.in_proj_b.biases": "model.safetensors",
163
+ "language_model.model.layers.13.linear_attn.in_proj_b.scales": "model.safetensors",
164
+ "language_model.model.layers.13.linear_attn.in_proj_b.weight": "model.safetensors",
165
+ "language_model.model.layers.13.linear_attn.in_proj_qkv.biases": "model.safetensors",
166
+ "language_model.model.layers.13.linear_attn.in_proj_qkv.scales": "model.safetensors",
167
+ "language_model.model.layers.13.linear_attn.in_proj_qkv.weight": "model.safetensors",
168
+ "language_model.model.layers.13.linear_attn.in_proj_z.biases": "model.safetensors",
169
+ "language_model.model.layers.13.linear_attn.in_proj_z.scales": "model.safetensors",
170
+ "language_model.model.layers.13.linear_attn.in_proj_z.weight": "model.safetensors",
171
+ "language_model.model.layers.13.linear_attn.norm.weight": "model.safetensors",
172
+ "language_model.model.layers.13.linear_attn.out_proj.biases": "model.safetensors",
173
+ "language_model.model.layers.13.linear_attn.out_proj.scales": "model.safetensors",
174
+ "language_model.model.layers.13.linear_attn.out_proj.weight": "model.safetensors",
175
+ "language_model.model.layers.13.mlp.down_proj.biases": "model.safetensors",
176
+ "language_model.model.layers.13.mlp.down_proj.scales": "model.safetensors",
177
+ "language_model.model.layers.13.mlp.down_proj.weight": "model.safetensors",
178
+ "language_model.model.layers.13.mlp.gate_proj.biases": "model.safetensors",
179
+ "language_model.model.layers.13.mlp.gate_proj.scales": "model.safetensors",
180
+ "language_model.model.layers.13.mlp.gate_proj.weight": "model.safetensors",
181
+ "language_model.model.layers.13.mlp.up_proj.biases": "model.safetensors",
182
+ "language_model.model.layers.13.mlp.up_proj.scales": "model.safetensors",
183
+ "language_model.model.layers.13.mlp.up_proj.weight": "model.safetensors",
184
+ "language_model.model.layers.13.post_attention_layernorm.weight": "model.safetensors",
185
+ "language_model.model.layers.14.input_layernorm.weight": "model.safetensors",
186
+ "language_model.model.layers.14.linear_attn.A_log": "model.safetensors",
187
+ "language_model.model.layers.14.linear_attn.conv1d.weight": "model.safetensors",
188
+ "language_model.model.layers.14.linear_attn.dt_bias": "model.safetensors",
189
+ "language_model.model.layers.14.linear_attn.in_proj_a.biases": "model.safetensors",
190
+ "language_model.model.layers.14.linear_attn.in_proj_a.scales": "model.safetensors",
191
+ "language_model.model.layers.14.linear_attn.in_proj_a.weight": "model.safetensors",
192
+ "language_model.model.layers.14.linear_attn.in_proj_b.biases": "model.safetensors",
193
+ "language_model.model.layers.14.linear_attn.in_proj_b.scales": "model.safetensors",
194
+ "language_model.model.layers.14.linear_attn.in_proj_b.weight": "model.safetensors",
195
+ "language_model.model.layers.14.linear_attn.in_proj_qkv.biases": "model.safetensors",
196
+ "language_model.model.layers.14.linear_attn.in_proj_qkv.scales": "model.safetensors",
197
+ "language_model.model.layers.14.linear_attn.in_proj_qkv.weight": "model.safetensors",
198
+ "language_model.model.layers.14.linear_attn.in_proj_z.biases": "model.safetensors",
199
+ "language_model.model.layers.14.linear_attn.in_proj_z.scales": "model.safetensors",
200
+ "language_model.model.layers.14.linear_attn.in_proj_z.weight": "model.safetensors",
201
+ "language_model.model.layers.14.linear_attn.norm.weight": "model.safetensors",
202
+ "language_model.model.layers.14.linear_attn.out_proj.biases": "model.safetensors",
203
+ "language_model.model.layers.14.linear_attn.out_proj.scales": "model.safetensors",
204
+ "language_model.model.layers.14.linear_attn.out_proj.weight": "model.safetensors",
205
+ "language_model.model.layers.14.mlp.down_proj.biases": "model.safetensors",
206
+ "language_model.model.layers.14.mlp.down_proj.scales": "model.safetensors",
207
+ "language_model.model.layers.14.mlp.down_proj.weight": "model.safetensors",
208
+ "language_model.model.layers.14.mlp.gate_proj.biases": "model.safetensors",
209
+ "language_model.model.layers.14.mlp.gate_proj.scales": "model.safetensors",
210
+ "language_model.model.layers.14.mlp.gate_proj.weight": "model.safetensors",
211
+ "language_model.model.layers.14.mlp.up_proj.biases": "model.safetensors",
212
+ "language_model.model.layers.14.mlp.up_proj.scales": "model.safetensors",
213
+ "language_model.model.layers.14.mlp.up_proj.weight": "model.safetensors",
214
+ "language_model.model.layers.14.post_attention_layernorm.weight": "model.safetensors",
215
+ "language_model.model.layers.15.input_layernorm.weight": "model.safetensors",
216
+ "language_model.model.layers.15.mlp.down_proj.biases": "model.safetensors",
217
+ "language_model.model.layers.15.mlp.down_proj.scales": "model.safetensors",
218
+ "language_model.model.layers.15.mlp.down_proj.weight": "model.safetensors",
219
+ "language_model.model.layers.15.mlp.gate_proj.biases": "model.safetensors",
220
+ "language_model.model.layers.15.mlp.gate_proj.scales": "model.safetensors",
221
+ "language_model.model.layers.15.mlp.gate_proj.weight": "model.safetensors",
222
+ "language_model.model.layers.15.mlp.up_proj.biases": "model.safetensors",
223
+ "language_model.model.layers.15.mlp.up_proj.scales": "model.safetensors",
224
+ "language_model.model.layers.15.mlp.up_proj.weight": "model.safetensors",
225
+ "language_model.model.layers.15.post_attention_layernorm.weight": "model.safetensors",
226
+ "language_model.model.layers.15.self_attn.k_norm.weight": "model.safetensors",
227
+ "language_model.model.layers.15.self_attn.k_proj.biases": "model.safetensors",
228
+ "language_model.model.layers.15.self_attn.k_proj.scales": "model.safetensors",
229
+ "language_model.model.layers.15.self_attn.k_proj.weight": "model.safetensors",
230
+ "language_model.model.layers.15.self_attn.o_proj.biases": "model.safetensors",
231
+ "language_model.model.layers.15.self_attn.o_proj.scales": "model.safetensors",
232
+ "language_model.model.layers.15.self_attn.o_proj.weight": "model.safetensors",
233
+ "language_model.model.layers.15.self_attn.q_norm.weight": "model.safetensors",
234
+ "language_model.model.layers.15.self_attn.q_proj.biases": "model.safetensors",
235
+ "language_model.model.layers.15.self_attn.q_proj.scales": "model.safetensors",
236
+ "language_model.model.layers.15.self_attn.q_proj.weight": "model.safetensors",
237
+ "language_model.model.layers.15.self_attn.v_proj.biases": "model.safetensors",
238
+ "language_model.model.layers.15.self_attn.v_proj.scales": "model.safetensors",
239
+ "language_model.model.layers.15.self_attn.v_proj.weight": "model.safetensors",
240
+ "language_model.model.layers.16.input_layernorm.weight": "model.safetensors",
241
+ "language_model.model.layers.16.linear_attn.A_log": "model.safetensors",
242
+ "language_model.model.layers.16.linear_attn.conv1d.weight": "model.safetensors",
243
+ "language_model.model.layers.16.linear_attn.dt_bias": "model.safetensors",
244
+ "language_model.model.layers.16.linear_attn.in_proj_a.biases": "model.safetensors",
245
+ "language_model.model.layers.16.linear_attn.in_proj_a.scales": "model.safetensors",
246
+ "language_model.model.layers.16.linear_attn.in_proj_a.weight": "model.safetensors",
247
+ "language_model.model.layers.16.linear_attn.in_proj_b.biases": "model.safetensors",
248
+ "language_model.model.layers.16.linear_attn.in_proj_b.scales": "model.safetensors",
249
+ "language_model.model.layers.16.linear_attn.in_proj_b.weight": "model.safetensors",
250
+ "language_model.model.layers.16.linear_attn.in_proj_qkv.biases": "model.safetensors",
251
+ "language_model.model.layers.16.linear_attn.in_proj_qkv.scales": "model.safetensors",
252
+ "language_model.model.layers.16.linear_attn.in_proj_qkv.weight": "model.safetensors",
253
+ "language_model.model.layers.16.linear_attn.in_proj_z.biases": "model.safetensors",
254
+ "language_model.model.layers.16.linear_attn.in_proj_z.scales": "model.safetensors",
255
+ "language_model.model.layers.16.linear_attn.in_proj_z.weight": "model.safetensors",
256
+ "language_model.model.layers.16.linear_attn.norm.weight": "model.safetensors",
257
+ "language_model.model.layers.16.linear_attn.out_proj.biases": "model.safetensors",
258
+ "language_model.model.layers.16.linear_attn.out_proj.scales": "model.safetensors",
259
+ "language_model.model.layers.16.linear_attn.out_proj.weight": "model.safetensors",
260
+ "language_model.model.layers.16.mlp.down_proj.biases": "model.safetensors",
261
+ "language_model.model.layers.16.mlp.down_proj.scales": "model.safetensors",
262
+ "language_model.model.layers.16.mlp.down_proj.weight": "model.safetensors",
263
+ "language_model.model.layers.16.mlp.gate_proj.biases": "model.safetensors",
264
+ "language_model.model.layers.16.mlp.gate_proj.scales": "model.safetensors",
265
+ "language_model.model.layers.16.mlp.gate_proj.weight": "model.safetensors",
266
+ "language_model.model.layers.16.mlp.up_proj.biases": "model.safetensors",
267
+ "language_model.model.layers.16.mlp.up_proj.scales": "model.safetensors",
268
+ "language_model.model.layers.16.mlp.up_proj.weight": "model.safetensors",
269
+ "language_model.model.layers.16.post_attention_layernorm.weight": "model.safetensors",
270
+ "language_model.model.layers.17.input_layernorm.weight": "model.safetensors",
271
+ "language_model.model.layers.17.linear_attn.A_log": "model.safetensors",
272
+ "language_model.model.layers.17.linear_attn.conv1d.weight": "model.safetensors",
273
+ "language_model.model.layers.17.linear_attn.dt_bias": "model.safetensors",
274
+ "language_model.model.layers.17.linear_attn.in_proj_a.biases": "model.safetensors",
275
+ "language_model.model.layers.17.linear_attn.in_proj_a.scales": "model.safetensors",
276
+ "language_model.model.layers.17.linear_attn.in_proj_a.weight": "model.safetensors",
277
+ "language_model.model.layers.17.linear_attn.in_proj_b.biases": "model.safetensors",
278
+ "language_model.model.layers.17.linear_attn.in_proj_b.scales": "model.safetensors",
279
+ "language_model.model.layers.17.linear_attn.in_proj_b.weight": "model.safetensors",
280
+ "language_model.model.layers.17.linear_attn.in_proj_qkv.biases": "model.safetensors",
281
+ "language_model.model.layers.17.linear_attn.in_proj_qkv.scales": "model.safetensors",
282
+ "language_model.model.layers.17.linear_attn.in_proj_qkv.weight": "model.safetensors",
283
+ "language_model.model.layers.17.linear_attn.in_proj_z.biases": "model.safetensors",
284
+ "language_model.model.layers.17.linear_attn.in_proj_z.scales": "model.safetensors",
285
+ "language_model.model.layers.17.linear_attn.in_proj_z.weight": "model.safetensors",
286
+ "language_model.model.layers.17.linear_attn.norm.weight": "model.safetensors",
287
+ "language_model.model.layers.17.linear_attn.out_proj.biases": "model.safetensors",
288
+ "language_model.model.layers.17.linear_attn.out_proj.scales": "model.safetensors",
289
+ "language_model.model.layers.17.linear_attn.out_proj.weight": "model.safetensors",
290
+ "language_model.model.layers.17.mlp.down_proj.biases": "model.safetensors",
291
+ "language_model.model.layers.17.mlp.down_proj.scales": "model.safetensors",
292
+ "language_model.model.layers.17.mlp.down_proj.weight": "model.safetensors",
293
+ "language_model.model.layers.17.mlp.gate_proj.biases": "model.safetensors",
294
+ "language_model.model.layers.17.mlp.gate_proj.scales": "model.safetensors",
295
+ "language_model.model.layers.17.mlp.gate_proj.weight": "model.safetensors",
296
+ "language_model.model.layers.17.mlp.up_proj.biases": "model.safetensors",
297
+ "language_model.model.layers.17.mlp.up_proj.scales": "model.safetensors",
298
+ "language_model.model.layers.17.mlp.up_proj.weight": "model.safetensors",
299
+ "language_model.model.layers.17.post_attention_layernorm.weight": "model.safetensors",
300
+ "language_model.model.layers.18.input_layernorm.weight": "model.safetensors",
301
+ "language_model.model.layers.18.linear_attn.A_log": "model.safetensors",
302
+ "language_model.model.layers.18.linear_attn.conv1d.weight": "model.safetensors",
303
+ "language_model.model.layers.18.linear_attn.dt_bias": "model.safetensors",
304
+ "language_model.model.layers.18.linear_attn.in_proj_a.biases": "model.safetensors",
305
+ "language_model.model.layers.18.linear_attn.in_proj_a.scales": "model.safetensors",
306
+ "language_model.model.layers.18.linear_attn.in_proj_a.weight": "model.safetensors",
307
+ "language_model.model.layers.18.linear_attn.in_proj_b.biases": "model.safetensors",
308
+ "language_model.model.layers.18.linear_attn.in_proj_b.scales": "model.safetensors",
309
+ "language_model.model.layers.18.linear_attn.in_proj_b.weight": "model.safetensors",
310
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.biases": "model.safetensors",
311
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.scales": "model.safetensors",
312
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.weight": "model.safetensors",
313
+ "language_model.model.layers.18.linear_attn.in_proj_z.biases": "model.safetensors",
314
+ "language_model.model.layers.18.linear_attn.in_proj_z.scales": "model.safetensors",
315
+ "language_model.model.layers.18.linear_attn.in_proj_z.weight": "model.safetensors",
316
+ "language_model.model.layers.18.linear_attn.norm.weight": "model.safetensors",
317
+ "language_model.model.layers.18.linear_attn.out_proj.biases": "model.safetensors",
318
+ "language_model.model.layers.18.linear_attn.out_proj.scales": "model.safetensors",
319
+ "language_model.model.layers.18.linear_attn.out_proj.weight": "model.safetensors",
320
+ "language_model.model.layers.18.mlp.down_proj.biases": "model.safetensors",
321
+ "language_model.model.layers.18.mlp.down_proj.scales": "model.safetensors",
322
+ "language_model.model.layers.18.mlp.down_proj.weight": "model.safetensors",
323
+ "language_model.model.layers.18.mlp.gate_proj.biases": "model.safetensors",
324
+ "language_model.model.layers.18.mlp.gate_proj.scales": "model.safetensors",
325
+ "language_model.model.layers.18.mlp.gate_proj.weight": "model.safetensors",
326
+ "language_model.model.layers.18.mlp.up_proj.biases": "model.safetensors",
327
+ "language_model.model.layers.18.mlp.up_proj.scales": "model.safetensors",
328
+ "language_model.model.layers.18.mlp.up_proj.weight": "model.safetensors",
329
+ "language_model.model.layers.18.post_attention_layernorm.weight": "model.safetensors",
330
+ "language_model.model.layers.19.input_layernorm.weight": "model.safetensors",
331
+ "language_model.model.layers.19.mlp.down_proj.biases": "model.safetensors",
332
+ "language_model.model.layers.19.mlp.down_proj.scales": "model.safetensors",
333
+ "language_model.model.layers.19.mlp.down_proj.weight": "model.safetensors",
334
+ "language_model.model.layers.19.mlp.gate_proj.biases": "model.safetensors",
335
+ "language_model.model.layers.19.mlp.gate_proj.scales": "model.safetensors",
336
+ "language_model.model.layers.19.mlp.gate_proj.weight": "model.safetensors",
337
+ "language_model.model.layers.19.mlp.up_proj.biases": "model.safetensors",
338
+ "language_model.model.layers.19.mlp.up_proj.scales": "model.safetensors",
339
+ "language_model.model.layers.19.mlp.up_proj.weight": "model.safetensors",
340
+ "language_model.model.layers.19.post_attention_layernorm.weight": "model.safetensors",
341
+ "language_model.model.layers.19.self_attn.k_norm.weight": "model.safetensors",
342
+ "language_model.model.layers.19.self_attn.k_proj.biases": "model.safetensors",
343
+ "language_model.model.layers.19.self_attn.k_proj.scales": "model.safetensors",
344
+ "language_model.model.layers.19.self_attn.k_proj.weight": "model.safetensors",
345
+ "language_model.model.layers.19.self_attn.o_proj.biases": "model.safetensors",
346
+ "language_model.model.layers.19.self_attn.o_proj.scales": "model.safetensors",
347
+ "language_model.model.layers.19.self_attn.o_proj.weight": "model.safetensors",
348
+ "language_model.model.layers.19.self_attn.q_norm.weight": "model.safetensors",
349
+ "language_model.model.layers.19.self_attn.q_proj.biases": "model.safetensors",
350
+ "language_model.model.layers.19.self_attn.q_proj.scales": "model.safetensors",
351
+ "language_model.model.layers.19.self_attn.q_proj.weight": "model.safetensors",
352
+ "language_model.model.layers.19.self_attn.v_proj.biases": "model.safetensors",
353
+ "language_model.model.layers.19.self_attn.v_proj.scales": "model.safetensors",
354
+ "language_model.model.layers.19.self_attn.v_proj.weight": "model.safetensors",
355
+ "language_model.model.layers.2.input_layernorm.weight": "model.safetensors",
356
+ "language_model.model.layers.2.linear_attn.A_log": "model.safetensors",
357
+ "language_model.model.layers.2.linear_attn.conv1d.weight": "model.safetensors",
358
+ "language_model.model.layers.2.linear_attn.dt_bias": "model.safetensors",
359
+ "language_model.model.layers.2.linear_attn.in_proj_a.biases": "model.safetensors",
360
+ "language_model.model.layers.2.linear_attn.in_proj_a.scales": "model.safetensors",
361
+ "language_model.model.layers.2.linear_attn.in_proj_a.weight": "model.safetensors",
362
+ "language_model.model.layers.2.linear_attn.in_proj_b.biases": "model.safetensors",
363
+ "language_model.model.layers.2.linear_attn.in_proj_b.scales": "model.safetensors",
364
+ "language_model.model.layers.2.linear_attn.in_proj_b.weight": "model.safetensors",
365
+ "language_model.model.layers.2.linear_attn.in_proj_qkv.biases": "model.safetensors",
366
+ "language_model.model.layers.2.linear_attn.in_proj_qkv.scales": "model.safetensors",
367
+ "language_model.model.layers.2.linear_attn.in_proj_qkv.weight": "model.safetensors",
368
+ "language_model.model.layers.2.linear_attn.in_proj_z.biases": "model.safetensors",
369
+ "language_model.model.layers.2.linear_attn.in_proj_z.scales": "model.safetensors",
370
+ "language_model.model.layers.2.linear_attn.in_proj_z.weight": "model.safetensors",
371
+ "language_model.model.layers.2.linear_attn.norm.weight": "model.safetensors",
372
+ "language_model.model.layers.2.linear_attn.out_proj.biases": "model.safetensors",
373
+ "language_model.model.layers.2.linear_attn.out_proj.scales": "model.safetensors",
374
+ "language_model.model.layers.2.linear_attn.out_proj.weight": "model.safetensors",
375
+ "language_model.model.layers.2.mlp.down_proj.biases": "model.safetensors",
376
+ "language_model.model.layers.2.mlp.down_proj.scales": "model.safetensors",
377
+ "language_model.model.layers.2.mlp.down_proj.weight": "model.safetensors",
378
+ "language_model.model.layers.2.mlp.gate_proj.biases": "model.safetensors",
379
+ "language_model.model.layers.2.mlp.gate_proj.scales": "model.safetensors",
380
+ "language_model.model.layers.2.mlp.gate_proj.weight": "model.safetensors",
381
+ "language_model.model.layers.2.mlp.up_proj.biases": "model.safetensors",
382
+ "language_model.model.layers.2.mlp.up_proj.scales": "model.safetensors",
383
+ "language_model.model.layers.2.mlp.up_proj.weight": "model.safetensors",
384
+ "language_model.model.layers.2.post_attention_layernorm.weight": "model.safetensors",
385
+ "language_model.model.layers.20.input_layernorm.weight": "model.safetensors",
386
+ "language_model.model.layers.20.linear_attn.A_log": "model.safetensors",
387
+ "language_model.model.layers.20.linear_attn.conv1d.weight": "model.safetensors",
388
+ "language_model.model.layers.20.linear_attn.dt_bias": "model.safetensors",
389
+ "language_model.model.layers.20.linear_attn.in_proj_a.biases": "model.safetensors",
390
+ "language_model.model.layers.20.linear_attn.in_proj_a.scales": "model.safetensors",
391
+ "language_model.model.layers.20.linear_attn.in_proj_a.weight": "model.safetensors",
392
+ "language_model.model.layers.20.linear_attn.in_proj_b.biases": "model.safetensors",
393
+ "language_model.model.layers.20.linear_attn.in_proj_b.scales": "model.safetensors",
394
+ "language_model.model.layers.20.linear_attn.in_proj_b.weight": "model.safetensors",
395
+ "language_model.model.layers.20.linear_attn.in_proj_qkv.biases": "model.safetensors",
396
+ "language_model.model.layers.20.linear_attn.in_proj_qkv.scales": "model.safetensors",
397
+ "language_model.model.layers.20.linear_attn.in_proj_qkv.weight": "model.safetensors",
398
+ "language_model.model.layers.20.linear_attn.in_proj_z.biases": "model.safetensors",
399
+ "language_model.model.layers.20.linear_attn.in_proj_z.scales": "model.safetensors",
400
+ "language_model.model.layers.20.linear_attn.in_proj_z.weight": "model.safetensors",
401
+ "language_model.model.layers.20.linear_attn.norm.weight": "model.safetensors",
402
+ "language_model.model.layers.20.linear_attn.out_proj.biases": "model.safetensors",
403
+ "language_model.model.layers.20.linear_attn.out_proj.scales": "model.safetensors",
404
+ "language_model.model.layers.20.linear_attn.out_proj.weight": "model.safetensors",
405
+ "language_model.model.layers.20.mlp.down_proj.biases": "model.safetensors",
406
+ "language_model.model.layers.20.mlp.down_proj.scales": "model.safetensors",
407
+ "language_model.model.layers.20.mlp.down_proj.weight": "model.safetensors",
408
+ "language_model.model.layers.20.mlp.gate_proj.biases": "model.safetensors",
409
+ "language_model.model.layers.20.mlp.gate_proj.scales": "model.safetensors",
410
+ "language_model.model.layers.20.mlp.gate_proj.weight": "model.safetensors",
411
+ "language_model.model.layers.20.mlp.up_proj.biases": "model.safetensors",
412
+ "language_model.model.layers.20.mlp.up_proj.scales": "model.safetensors",
413
+ "language_model.model.layers.20.mlp.up_proj.weight": "model.safetensors",
414
+ "language_model.model.layers.20.post_attention_layernorm.weight": "model.safetensors",
415
+ "language_model.model.layers.21.input_layernorm.weight": "model.safetensors",
416
+ "language_model.model.layers.21.linear_attn.A_log": "model.safetensors",
417
+ "language_model.model.layers.21.linear_attn.conv1d.weight": "model.safetensors",
418
+ "language_model.model.layers.21.linear_attn.dt_bias": "model.safetensors",
419
+ "language_model.model.layers.21.linear_attn.in_proj_a.biases": "model.safetensors",
420
+ "language_model.model.layers.21.linear_attn.in_proj_a.scales": "model.safetensors",
421
+ "language_model.model.layers.21.linear_attn.in_proj_a.weight": "model.safetensors",
422
+ "language_model.model.layers.21.linear_attn.in_proj_b.biases": "model.safetensors",
423
+ "language_model.model.layers.21.linear_attn.in_proj_b.scales": "model.safetensors",
424
+ "language_model.model.layers.21.linear_attn.in_proj_b.weight": "model.safetensors",
425
+ "language_model.model.layers.21.linear_attn.in_proj_qkv.biases": "model.safetensors",
426
+ "language_model.model.layers.21.linear_attn.in_proj_qkv.scales": "model.safetensors",
427
+ "language_model.model.layers.21.linear_attn.in_proj_qkv.weight": "model.safetensors",
428
+ "language_model.model.layers.21.linear_attn.in_proj_z.biases": "model.safetensors",
429
+ "language_model.model.layers.21.linear_attn.in_proj_z.scales": "model.safetensors",
430
+ "language_model.model.layers.21.linear_attn.in_proj_z.weight": "model.safetensors",
431
+ "language_model.model.layers.21.linear_attn.norm.weight": "model.safetensors",
432
+ "language_model.model.layers.21.linear_attn.out_proj.biases": "model.safetensors",
433
+ "language_model.model.layers.21.linear_attn.out_proj.scales": "model.safetensors",
434
+ "language_model.model.layers.21.linear_attn.out_proj.weight": "model.safetensors",
435
+ "language_model.model.layers.21.mlp.down_proj.biases": "model.safetensors",
436
+ "language_model.model.layers.21.mlp.down_proj.scales": "model.safetensors",
437
+ "language_model.model.layers.21.mlp.down_proj.weight": "model.safetensors",
438
+ "language_model.model.layers.21.mlp.gate_proj.biases": "model.safetensors",
439
+ "language_model.model.layers.21.mlp.gate_proj.scales": "model.safetensors",
440
+ "language_model.model.layers.21.mlp.gate_proj.weight": "model.safetensors",
441
+ "language_model.model.layers.21.mlp.up_proj.biases": "model.safetensors",
442
+ "language_model.model.layers.21.mlp.up_proj.scales": "model.safetensors",
443
+ "language_model.model.layers.21.mlp.up_proj.weight": "model.safetensors",
444
+ "language_model.model.layers.21.post_attention_layernorm.weight": "model.safetensors",
445
+ "language_model.model.layers.22.input_layernorm.weight": "model.safetensors",
446
+ "language_model.model.layers.22.linear_attn.A_log": "model.safetensors",
447
+ "language_model.model.layers.22.linear_attn.conv1d.weight": "model.safetensors",
448
+ "language_model.model.layers.22.linear_attn.dt_bias": "model.safetensors",
449
+ "language_model.model.layers.22.linear_attn.in_proj_a.biases": "model.safetensors",
450
+ "language_model.model.layers.22.linear_attn.in_proj_a.scales": "model.safetensors",
451
+ "language_model.model.layers.22.linear_attn.in_proj_a.weight": "model.safetensors",
452
+ "language_model.model.layers.22.linear_attn.in_proj_b.biases": "model.safetensors",
453
+ "language_model.model.layers.22.linear_attn.in_proj_b.scales": "model.safetensors",
454
+ "language_model.model.layers.22.linear_attn.in_proj_b.weight": "model.safetensors",
455
+ "language_model.model.layers.22.linear_attn.in_proj_qkv.biases": "model.safetensors",
456
+ "language_model.model.layers.22.linear_attn.in_proj_qkv.scales": "model.safetensors",
457
+ "language_model.model.layers.22.linear_attn.in_proj_qkv.weight": "model.safetensors",
458
+ "language_model.model.layers.22.linear_attn.in_proj_z.biases": "model.safetensors",
459
+ "language_model.model.layers.22.linear_attn.in_proj_z.scales": "model.safetensors",
460
+ "language_model.model.layers.22.linear_attn.in_proj_z.weight": "model.safetensors",
461
+ "language_model.model.layers.22.linear_attn.norm.weight": "model.safetensors",
462
+ "language_model.model.layers.22.linear_attn.out_proj.biases": "model.safetensors",
463
+ "language_model.model.layers.22.linear_attn.out_proj.scales": "model.safetensors",
464
+ "language_model.model.layers.22.linear_attn.out_proj.weight": "model.safetensors",
465
+ "language_model.model.layers.22.mlp.down_proj.biases": "model.safetensors",
466
+ "language_model.model.layers.22.mlp.down_proj.scales": "model.safetensors",
467
+ "language_model.model.layers.22.mlp.down_proj.weight": "model.safetensors",
468
+ "language_model.model.layers.22.mlp.gate_proj.biases": "model.safetensors",
469
+ "language_model.model.layers.22.mlp.gate_proj.scales": "model.safetensors",
470
+ "language_model.model.layers.22.mlp.gate_proj.weight": "model.safetensors",
471
+ "language_model.model.layers.22.mlp.up_proj.biases": "model.safetensors",
472
+ "language_model.model.layers.22.mlp.up_proj.scales": "model.safetensors",
473
+ "language_model.model.layers.22.mlp.up_proj.weight": "model.safetensors",
474
+ "language_model.model.layers.22.post_attention_layernorm.weight": "model.safetensors",
475
+ "language_model.model.layers.23.input_layernorm.weight": "model.safetensors",
476
+ "language_model.model.layers.23.mlp.down_proj.biases": "model.safetensors",
477
+ "language_model.model.layers.23.mlp.down_proj.scales": "model.safetensors",
478
+ "language_model.model.layers.23.mlp.down_proj.weight": "model.safetensors",
479
+ "language_model.model.layers.23.mlp.gate_proj.biases": "model.safetensors",
480
+ "language_model.model.layers.23.mlp.gate_proj.scales": "model.safetensors",
481
+ "language_model.model.layers.23.mlp.gate_proj.weight": "model.safetensors",
482
+ "language_model.model.layers.23.mlp.up_proj.biases": "model.safetensors",
483
+ "language_model.model.layers.23.mlp.up_proj.scales": "model.safetensors",
484
+ "language_model.model.layers.23.mlp.up_proj.weight": "model.safetensors",
485
+ "language_model.model.layers.23.post_attention_layernorm.weight": "model.safetensors",
486
+ "language_model.model.layers.23.self_attn.k_norm.weight": "model.safetensors",
487
+ "language_model.model.layers.23.self_attn.k_proj.biases": "model.safetensors",
488
+ "language_model.model.layers.23.self_attn.k_proj.scales": "model.safetensors",
489
+ "language_model.model.layers.23.self_attn.k_proj.weight": "model.safetensors",
490
+ "language_model.model.layers.23.self_attn.o_proj.biases": "model.safetensors",
491
+ "language_model.model.layers.23.self_attn.o_proj.scales": "model.safetensors",
492
+ "language_model.model.layers.23.self_attn.o_proj.weight": "model.safetensors",
493
+ "language_model.model.layers.23.self_attn.q_norm.weight": "model.safetensors",
494
+ "language_model.model.layers.23.self_attn.q_proj.biases": "model.safetensors",
495
+ "language_model.model.layers.23.self_attn.q_proj.scales": "model.safetensors",
496
+ "language_model.model.layers.23.self_attn.q_proj.weight": "model.safetensors",
497
+ "language_model.model.layers.23.self_attn.v_proj.biases": "model.safetensors",
498
+ "language_model.model.layers.23.self_attn.v_proj.scales": "model.safetensors",
499
+ "language_model.model.layers.23.self_attn.v_proj.weight": "model.safetensors",
500
+ "language_model.model.layers.3.input_layernorm.weight": "model.safetensors",
501
+ "language_model.model.layers.3.mlp.down_proj.biases": "model.safetensors",
502
+ "language_model.model.layers.3.mlp.down_proj.scales": "model.safetensors",
503
+ "language_model.model.layers.3.mlp.down_proj.weight": "model.safetensors",
504
+ "language_model.model.layers.3.mlp.gate_proj.biases": "model.safetensors",
505
+ "language_model.model.layers.3.mlp.gate_proj.scales": "model.safetensors",
506
+ "language_model.model.layers.3.mlp.gate_proj.weight": "model.safetensors",
507
+ "language_model.model.layers.3.mlp.up_proj.biases": "model.safetensors",
508
+ "language_model.model.layers.3.mlp.up_proj.scales": "model.safetensors",
509
+ "language_model.model.layers.3.mlp.up_proj.weight": "model.safetensors",
510
+ "language_model.model.layers.3.post_attention_layernorm.weight": "model.safetensors",
511
+ "language_model.model.layers.3.self_attn.k_norm.weight": "model.safetensors",
512
+ "language_model.model.layers.3.self_attn.k_proj.biases": "model.safetensors",
513
+ "language_model.model.layers.3.self_attn.k_proj.scales": "model.safetensors",
514
+ "language_model.model.layers.3.self_attn.k_proj.weight": "model.safetensors",
515
+ "language_model.model.layers.3.self_attn.o_proj.biases": "model.safetensors",
516
+ "language_model.model.layers.3.self_attn.o_proj.scales": "model.safetensors",
517
+ "language_model.model.layers.3.self_attn.o_proj.weight": "model.safetensors",
518
+ "language_model.model.layers.3.self_attn.q_norm.weight": "model.safetensors",
519
+ "language_model.model.layers.3.self_attn.q_proj.biases": "model.safetensors",
520
+ "language_model.model.layers.3.self_attn.q_proj.scales": "model.safetensors",
521
+ "language_model.model.layers.3.self_attn.q_proj.weight": "model.safetensors",
522
+ "language_model.model.layers.3.self_attn.v_proj.biases": "model.safetensors",
523
+ "language_model.model.layers.3.self_attn.v_proj.scales": "model.safetensors",
524
+ "language_model.model.layers.3.self_attn.v_proj.weight": "model.safetensors",
525
+ "language_model.model.layers.4.input_layernorm.weight": "model.safetensors",
526
+ "language_model.model.layers.4.linear_attn.A_log": "model.safetensors",
527
+ "language_model.model.layers.4.linear_attn.conv1d.weight": "model.safetensors",
528
+ "language_model.model.layers.4.linear_attn.dt_bias": "model.safetensors",
529
+ "language_model.model.layers.4.linear_attn.in_proj_a.biases": "model.safetensors",
530
+ "language_model.model.layers.4.linear_attn.in_proj_a.scales": "model.safetensors",
531
+ "language_model.model.layers.4.linear_attn.in_proj_a.weight": "model.safetensors",
532
+ "language_model.model.layers.4.linear_attn.in_proj_b.biases": "model.safetensors",
533
+ "language_model.model.layers.4.linear_attn.in_proj_b.scales": "model.safetensors",
534
+ "language_model.model.layers.4.linear_attn.in_proj_b.weight": "model.safetensors",
535
+ "language_model.model.layers.4.linear_attn.in_proj_qkv.biases": "model.safetensors",
536
+ "language_model.model.layers.4.linear_attn.in_proj_qkv.scales": "model.safetensors",
537
+ "language_model.model.layers.4.linear_attn.in_proj_qkv.weight": "model.safetensors",
538
+ "language_model.model.layers.4.linear_attn.in_proj_z.biases": "model.safetensors",
539
+ "language_model.model.layers.4.linear_attn.in_proj_z.scales": "model.safetensors",
540
+ "language_model.model.layers.4.linear_attn.in_proj_z.weight": "model.safetensors",
541
+ "language_model.model.layers.4.linear_attn.norm.weight": "model.safetensors",
542
+ "language_model.model.layers.4.linear_attn.out_proj.biases": "model.safetensors",
543
+ "language_model.model.layers.4.linear_attn.out_proj.scales": "model.safetensors",
544
+ "language_model.model.layers.4.linear_attn.out_proj.weight": "model.safetensors",
545
+ "language_model.model.layers.4.mlp.down_proj.biases": "model.safetensors",
546
+ "language_model.model.layers.4.mlp.down_proj.scales": "model.safetensors",
547
+ "language_model.model.layers.4.mlp.down_proj.weight": "model.safetensors",
548
+ "language_model.model.layers.4.mlp.gate_proj.biases": "model.safetensors",
549
+ "language_model.model.layers.4.mlp.gate_proj.scales": "model.safetensors",
550
+ "language_model.model.layers.4.mlp.gate_proj.weight": "model.safetensors",
551
+ "language_model.model.layers.4.mlp.up_proj.biases": "model.safetensors",
552
+ "language_model.model.layers.4.mlp.up_proj.scales": "model.safetensors",
553
+ "language_model.model.layers.4.mlp.up_proj.weight": "model.safetensors",
554
+ "language_model.model.layers.4.post_attention_layernorm.weight": "model.safetensors",
555
+ "language_model.model.layers.5.input_layernorm.weight": "model.safetensors",
556
+ "language_model.model.layers.5.linear_attn.A_log": "model.safetensors",
557
+ "language_model.model.layers.5.linear_attn.conv1d.weight": "model.safetensors",
558
+ "language_model.model.layers.5.linear_attn.dt_bias": "model.safetensors",
559
+ "language_model.model.layers.5.linear_attn.in_proj_a.biases": "model.safetensors",
560
+ "language_model.model.layers.5.linear_attn.in_proj_a.scales": "model.safetensors",
561
+ "language_model.model.layers.5.linear_attn.in_proj_a.weight": "model.safetensors",
562
+ "language_model.model.layers.5.linear_attn.in_proj_b.biases": "model.safetensors",
563
+ "language_model.model.layers.5.linear_attn.in_proj_b.scales": "model.safetensors",
564
+ "language_model.model.layers.5.linear_attn.in_proj_b.weight": "model.safetensors",
565
+ "language_model.model.layers.5.linear_attn.in_proj_qkv.biases": "model.safetensors",
566
+ "language_model.model.layers.5.linear_attn.in_proj_qkv.scales": "model.safetensors",
567
+ "language_model.model.layers.5.linear_attn.in_proj_qkv.weight": "model.safetensors",
568
+ "language_model.model.layers.5.linear_attn.in_proj_z.biases": "model.safetensors",
569
+ "language_model.model.layers.5.linear_attn.in_proj_z.scales": "model.safetensors",
570
+ "language_model.model.layers.5.linear_attn.in_proj_z.weight": "model.safetensors",
571
+ "language_model.model.layers.5.linear_attn.norm.weight": "model.safetensors",
572
+ "language_model.model.layers.5.linear_attn.out_proj.biases": "model.safetensors",
573
+ "language_model.model.layers.5.linear_attn.out_proj.scales": "model.safetensors",
574
+ "language_model.model.layers.5.linear_attn.out_proj.weight": "model.safetensors",
575
+ "language_model.model.layers.5.mlp.down_proj.biases": "model.safetensors",
576
+ "language_model.model.layers.5.mlp.down_proj.scales": "model.safetensors",
577
+ "language_model.model.layers.5.mlp.down_proj.weight": "model.safetensors",
578
+ "language_model.model.layers.5.mlp.gate_proj.biases": "model.safetensors",
579
+ "language_model.model.layers.5.mlp.gate_proj.scales": "model.safetensors",
580
+ "language_model.model.layers.5.mlp.gate_proj.weight": "model.safetensors",
581
+ "language_model.model.layers.5.mlp.up_proj.biases": "model.safetensors",
582
+ "language_model.model.layers.5.mlp.up_proj.scales": "model.safetensors",
583
+ "language_model.model.layers.5.mlp.up_proj.weight": "model.safetensors",
584
+ "language_model.model.layers.5.post_attention_layernorm.weight": "model.safetensors",
585
+ "language_model.model.layers.6.input_layernorm.weight": "model.safetensors",
586
+ "language_model.model.layers.6.linear_attn.A_log": "model.safetensors",
587
+ "language_model.model.layers.6.linear_attn.conv1d.weight": "model.safetensors",
588
+ "language_model.model.layers.6.linear_attn.dt_bias": "model.safetensors",
589
+ "language_model.model.layers.6.linear_attn.in_proj_a.biases": "model.safetensors",
590
+ "language_model.model.layers.6.linear_attn.in_proj_a.scales": "model.safetensors",
591
+ "language_model.model.layers.6.linear_attn.in_proj_a.weight": "model.safetensors",
592
+ "language_model.model.layers.6.linear_attn.in_proj_b.biases": "model.safetensors",
593
+ "language_model.model.layers.6.linear_attn.in_proj_b.scales": "model.safetensors",
594
+ "language_model.model.layers.6.linear_attn.in_proj_b.weight": "model.safetensors",
595
+ "language_model.model.layers.6.linear_attn.in_proj_qkv.biases": "model.safetensors",
596
+ "language_model.model.layers.6.linear_attn.in_proj_qkv.scales": "model.safetensors",
597
+ "language_model.model.layers.6.linear_attn.in_proj_qkv.weight": "model.safetensors",
598
+ "language_model.model.layers.6.linear_attn.in_proj_z.biases": "model.safetensors",
599
+ "language_model.model.layers.6.linear_attn.in_proj_z.scales": "model.safetensors",
600
+ "language_model.model.layers.6.linear_attn.in_proj_z.weight": "model.safetensors",
601
+ "language_model.model.layers.6.linear_attn.norm.weight": "model.safetensors",
602
+ "language_model.model.layers.6.linear_attn.out_proj.biases": "model.safetensors",
603
+ "language_model.model.layers.6.linear_attn.out_proj.scales": "model.safetensors",
604
+ "language_model.model.layers.6.linear_attn.out_proj.weight": "model.safetensors",
605
+ "language_model.model.layers.6.mlp.down_proj.biases": "model.safetensors",
606
+ "language_model.model.layers.6.mlp.down_proj.scales": "model.safetensors",
607
+ "language_model.model.layers.6.mlp.down_proj.weight": "model.safetensors",
608
+ "language_model.model.layers.6.mlp.gate_proj.biases": "model.safetensors",
609
+ "language_model.model.layers.6.mlp.gate_proj.scales": "model.safetensors",
610
+ "language_model.model.layers.6.mlp.gate_proj.weight": "model.safetensors",
611
+ "language_model.model.layers.6.mlp.up_proj.biases": "model.safetensors",
612
+ "language_model.model.layers.6.mlp.up_proj.scales": "model.safetensors",
613
+ "language_model.model.layers.6.mlp.up_proj.weight": "model.safetensors",
614
+ "language_model.model.layers.6.post_attention_layernorm.weight": "model.safetensors",
615
+ "language_model.model.layers.7.input_layernorm.weight": "model.safetensors",
616
+ "language_model.model.layers.7.mlp.down_proj.biases": "model.safetensors",
617
+ "language_model.model.layers.7.mlp.down_proj.scales": "model.safetensors",
618
+ "language_model.model.layers.7.mlp.down_proj.weight": "model.safetensors",
619
+ "language_model.model.layers.7.mlp.gate_proj.biases": "model.safetensors",
620
+ "language_model.model.layers.7.mlp.gate_proj.scales": "model.safetensors",
621
+ "language_model.model.layers.7.mlp.gate_proj.weight": "model.safetensors",
622
+ "language_model.model.layers.7.mlp.up_proj.biases": "model.safetensors",
623
+ "language_model.model.layers.7.mlp.up_proj.scales": "model.safetensors",
624
+ "language_model.model.layers.7.mlp.up_proj.weight": "model.safetensors",
625
+ "language_model.model.layers.7.post_attention_layernorm.weight": "model.safetensors",
626
+ "language_model.model.layers.7.self_attn.k_norm.weight": "model.safetensors",
627
+ "language_model.model.layers.7.self_attn.k_proj.biases": "model.safetensors",
628
+ "language_model.model.layers.7.self_attn.k_proj.scales": "model.safetensors",
629
+ "language_model.model.layers.7.self_attn.k_proj.weight": "model.safetensors",
630
+ "language_model.model.layers.7.self_attn.o_proj.biases": "model.safetensors",
631
+ "language_model.model.layers.7.self_attn.o_proj.scales": "model.safetensors",
632
+ "language_model.model.layers.7.self_attn.o_proj.weight": "model.safetensors",
633
+ "language_model.model.layers.7.self_attn.q_norm.weight": "model.safetensors",
634
+ "language_model.model.layers.7.self_attn.q_proj.biases": "model.safetensors",
635
+ "language_model.model.layers.7.self_attn.q_proj.scales": "model.safetensors",
636
+ "language_model.model.layers.7.self_attn.q_proj.weight": "model.safetensors",
637
+ "language_model.model.layers.7.self_attn.v_proj.biases": "model.safetensors",
638
+ "language_model.model.layers.7.self_attn.v_proj.scales": "model.safetensors",
639
+ "language_model.model.layers.7.self_attn.v_proj.weight": "model.safetensors",
640
+ "language_model.model.layers.8.input_layernorm.weight": "model.safetensors",
641
+ "language_model.model.layers.8.linear_attn.A_log": "model.safetensors",
642
+ "language_model.model.layers.8.linear_attn.conv1d.weight": "model.safetensors",
643
+ "language_model.model.layers.8.linear_attn.dt_bias": "model.safetensors",
644
+ "language_model.model.layers.8.linear_attn.in_proj_a.biases": "model.safetensors",
645
+ "language_model.model.layers.8.linear_attn.in_proj_a.scales": "model.safetensors",
646
+ "language_model.model.layers.8.linear_attn.in_proj_a.weight": "model.safetensors",
647
+ "language_model.model.layers.8.linear_attn.in_proj_b.biases": "model.safetensors",
648
+ "language_model.model.layers.8.linear_attn.in_proj_b.scales": "model.safetensors",
649
+ "language_model.model.layers.8.linear_attn.in_proj_b.weight": "model.safetensors",
650
+ "language_model.model.layers.8.linear_attn.in_proj_qkv.biases": "model.safetensors",
651
+ "language_model.model.layers.8.linear_attn.in_proj_qkv.scales": "model.safetensors",
652
+ "language_model.model.layers.8.linear_attn.in_proj_qkv.weight": "model.safetensors",
653
+ "language_model.model.layers.8.linear_attn.in_proj_z.biases": "model.safetensors",
654
+ "language_model.model.layers.8.linear_attn.in_proj_z.scales": "model.safetensors",
655
+ "language_model.model.layers.8.linear_attn.in_proj_z.weight": "model.safetensors",
656
+ "language_model.model.layers.8.linear_attn.norm.weight": "model.safetensors",
657
+ "language_model.model.layers.8.linear_attn.out_proj.biases": "model.safetensors",
658
+ "language_model.model.layers.8.linear_attn.out_proj.scales": "model.safetensors",
659
+ "language_model.model.layers.8.linear_attn.out_proj.weight": "model.safetensors",
660
+ "language_model.model.layers.8.mlp.down_proj.biases": "model.safetensors",
661
+ "language_model.model.layers.8.mlp.down_proj.scales": "model.safetensors",
662
+ "language_model.model.layers.8.mlp.down_proj.weight": "model.safetensors",
663
+ "language_model.model.layers.8.mlp.gate_proj.biases": "model.safetensors",
664
+ "language_model.model.layers.8.mlp.gate_proj.scales": "model.safetensors",
665
+ "language_model.model.layers.8.mlp.gate_proj.weight": "model.safetensors",
666
+ "language_model.model.layers.8.mlp.up_proj.biases": "model.safetensors",
667
+ "language_model.model.layers.8.mlp.up_proj.scales": "model.safetensors",
668
+ "language_model.model.layers.8.mlp.up_proj.weight": "model.safetensors",
669
+ "language_model.model.layers.8.post_attention_layernorm.weight": "model.safetensors",
670
+ "language_model.model.layers.9.input_layernorm.weight": "model.safetensors",
671
+ "language_model.model.layers.9.linear_attn.A_log": "model.safetensors",
672
+ "language_model.model.layers.9.linear_attn.conv1d.weight": "model.safetensors",
673
+ "language_model.model.layers.9.linear_attn.dt_bias": "model.safetensors",
674
+ "language_model.model.layers.9.linear_attn.in_proj_a.biases": "model.safetensors",
675
+ "language_model.model.layers.9.linear_attn.in_proj_a.scales": "model.safetensors",
676
+ "language_model.model.layers.9.linear_attn.in_proj_a.weight": "model.safetensors",
677
+ "language_model.model.layers.9.linear_attn.in_proj_b.biases": "model.safetensors",
678
+ "language_model.model.layers.9.linear_attn.in_proj_b.scales": "model.safetensors",
679
+ "language_model.model.layers.9.linear_attn.in_proj_b.weight": "model.safetensors",
680
+ "language_model.model.layers.9.linear_attn.in_proj_qkv.biases": "model.safetensors",
681
+ "language_model.model.layers.9.linear_attn.in_proj_qkv.scales": "model.safetensors",
682
+ "language_model.model.layers.9.linear_attn.in_proj_qkv.weight": "model.safetensors",
683
+ "language_model.model.layers.9.linear_attn.in_proj_z.biases": "model.safetensors",
684
+ "language_model.model.layers.9.linear_attn.in_proj_z.scales": "model.safetensors",
685
+ "language_model.model.layers.9.linear_attn.in_proj_z.weight": "model.safetensors",
686
+ "language_model.model.layers.9.linear_attn.norm.weight": "model.safetensors",
687
+ "language_model.model.layers.9.linear_attn.out_proj.biases": "model.safetensors",
688
+ "language_model.model.layers.9.linear_attn.out_proj.scales": "model.safetensors",
689
+ "language_model.model.layers.9.linear_attn.out_proj.weight": "model.safetensors",
690
+ "language_model.model.layers.9.mlp.down_proj.biases": "model.safetensors",
691
+ "language_model.model.layers.9.mlp.down_proj.scales": "model.safetensors",
692
+ "language_model.model.layers.9.mlp.down_proj.weight": "model.safetensors",
693
+ "language_model.model.layers.9.mlp.gate_proj.biases": "model.safetensors",
694
+ "language_model.model.layers.9.mlp.gate_proj.scales": "model.safetensors",
695
+ "language_model.model.layers.9.mlp.gate_proj.weight": "model.safetensors",
696
+ "language_model.model.layers.9.mlp.up_proj.biases": "model.safetensors",
697
+ "language_model.model.layers.9.mlp.up_proj.scales": "model.safetensors",
698
+ "language_model.model.layers.9.mlp.up_proj.weight": "model.safetensors",
699
+ "language_model.model.layers.9.post_attention_layernorm.weight": "model.safetensors",
700
+ "language_model.model.norm.weight": "model.safetensors"
701
+ }
702
+ }
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:87a7830d63fcf43bf241c3c5242e96e62dd3fdc29224ca26fed8ea333db72de4
3
+ size 19989343
tokenizer_config.json ADDED
@@ -0,0 +1,32 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "audio_bos_token": "<|audio_start|>",
4
+ "audio_eos_token": "<|audio_end|>",
5
+ "audio_token": "<|audio_pad|>",
6
+ "backend": "tokenizers",
7
+ "bos_token": null,
8
+ "clean_up_tokenization_spaces": false,
9
+ "eos_token": "<|im_end|>",
10
+ "errors": "replace",
11
+ "image_token": "<|image_pad|>",
12
+ "is_local": true,
13
+ "model_max_length": 262144,
14
+ "model_specific_special_tokens": {
15
+ "audio_bos_token": "<|audio_start|>",
16
+ "audio_eos_token": "<|audio_end|>",
17
+ "audio_token": "<|audio_pad|>",
18
+ "image_token": "<|image_pad|>",
19
+ "video_token": "<|video_pad|>",
20
+ "vision_bos_token": "<|vision_start|>",
21
+ "vision_eos_token": "<|vision_end|>"
22
+ },
23
+ "pad_token": "<|endoftext|>",
24
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
25
+ "split_special_tokens": false,
26
+ "tokenizer_class": "TokenizersBackend",
27
+ "tool_parser_type": "qwen3_coder",
28
+ "unk_token": null,
29
+ "video_token": "<|video_pad|>",
30
+ "vision_bos_token": "<|vision_start|>",
31
+ "vision_eos_token": "<|vision_end|>"
32
+ }