JustinTong commited on
Commit
e30b02f
·
0 Parent(s):

Release GLM-5.3-Flash-NVFP4

Browse files
This view is limited to 50 files because it contains too many changes.   See raw diff
.gitattributes ADDED
@@ -0,0 +1,41 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ <<<<<<< HEAD
2
+ *.safetensors filter=lfs diff=lfs merge=lfs -text
3
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
4
+ model.safetensors.index.json filter=lfs diff=lfs merge=lfs -text
5
+ =======
6
+ *.7z filter=lfs diff=lfs merge=lfs -text
7
+ *.arrow filter=lfs diff=lfs merge=lfs -text
8
+ *.bin filter=lfs diff=lfs merge=lfs -text
9
+ *.bz2 filter=lfs diff=lfs merge=lfs -text
10
+ *.ckpt filter=lfs diff=lfs merge=lfs -text
11
+ *.ftz filter=lfs diff=lfs merge=lfs -text
12
+ *.gz filter=lfs diff=lfs merge=lfs -text
13
+ *.h5 filter=lfs diff=lfs merge=lfs -text
14
+ *.joblib filter=lfs diff=lfs merge=lfs -text
15
+ *.lfs.* filter=lfs diff=lfs merge=lfs -text
16
+ *.mlmodel filter=lfs diff=lfs merge=lfs -text
17
+ *.model filter=lfs diff=lfs merge=lfs -text
18
+ *.msgpack filter=lfs diff=lfs merge=lfs -text
19
+ *.npy filter=lfs diff=lfs merge=lfs -text
20
+ *.npz filter=lfs diff=lfs merge=lfs -text
21
+ *.onnx filter=lfs diff=lfs merge=lfs -text
22
+ *.ot filter=lfs diff=lfs merge=lfs -text
23
+ *.parquet filter=lfs diff=lfs merge=lfs -text
24
+ *.pb filter=lfs diff=lfs merge=lfs -text
25
+ *.pickle filter=lfs diff=lfs merge=lfs -text
26
+ *.pkl filter=lfs diff=lfs merge=lfs -text
27
+ *.pt filter=lfs diff=lfs merge=lfs -text
28
+ *.pth filter=lfs diff=lfs merge=lfs -text
29
+ *.rar filter=lfs diff=lfs merge=lfs -text
30
+ *.safetensors filter=lfs diff=lfs merge=lfs -text
31
+ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
32
+ *.tar.* filter=lfs diff=lfs merge=lfs -text
33
+ *.tar filter=lfs diff=lfs merge=lfs -text
34
+ *.tflite filter=lfs diff=lfs merge=lfs -text
35
+ *.tgz filter=lfs diff=lfs merge=lfs -text
36
+ *.wasm filter=lfs diff=lfs merge=lfs -text
37
+ *.xz filter=lfs diff=lfs merge=lfs -text
38
+ *.zip filter=lfs diff=lfs merge=lfs -text
39
+ *.zst filter=lfs diff=lfs merge=lfs -text
40
+ *tfevents* filter=lfs diff=lfs merge=lfs -text
41
+ >>>>>>> origin/main
LICENSE ADDED
@@ -0,0 +1,21 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ MIT License
2
+
3
+ Copyright (c) 2026 Z.AI Co., Ltd
4
+
5
+ Permission is hereby granted, free of charge, to any person obtaining a copy
6
+ of this software and associated documentation files (the "Software"), to deal
7
+ in the Software without restriction, including without limitation the rights
8
+ to use, copy, modify, merge, publish, distribute, sublicense, and/or sell
9
+ copies of the Software, and to permit persons to whom the Software is
10
+ furnished to do so, subject to the following conditions:
11
+
12
+ The above copyright notice and this permission notice shall be included in all
13
+ copies or substantial portions of the Software.
14
+
15
+ THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR
16
+ IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY,
17
+ FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT. IN NO EVENT SHALL THE
18
+ AUTHORS OR COPYRIGHT HOLDERS BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER
19
+ LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM,
20
+ OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE
21
+ SOFTWARE.
README.md ADDED
@@ -0,0 +1,156 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ pipeline_tag: image-text-to-text
3
+ base_model:
4
+ - zai-org/GLM-5.3-Flash-BF16
5
+ license: mit
6
+ library_name: Model Optimizer
7
+ language:
8
+ - en
9
+ - zh
10
+ tags:
11
+ - RadixArk
12
+ - ModelOpt
13
+ - GLM-5.3-Flash
14
+ - quantized
15
+ - FP4
16
+ - fp4
17
+ - NVFP4
18
+ ---
19
+
20
+ # Model Overview
21
+ ## Description:
22
+
23
+ The RadixArk GLM-5.3-Flash-NVFP4 model is a quantized version of [zai-org/GLM-5.3-Flash-BF16](https://huggingface.co/zai-org/GLM-5.3-Flash-BF16), pinned to source revision `a6c167b6`. RadixArk converted the 300B-class hybrid Mixture-of-Experts model to mixed-precision NVFP4 W4A4 using [NVIDIA Model Optimizer](https://github.com/NVIDIA/Model-Optimizer). The conversion uses plain abs-max scaling with 256 tensor-scale normalization.
24
+
25
+ **Run on [SGLang](https://github.com/sgl-project/sglang)**: use the launch command below and see the [GLM-5.3-Flash cookbook](https://docs.sglang.io/cookbook/autoregressive/GLM/GLM-5.3-Flash) for deployment guidance.
26
+
27
+ ## Third-Party Community Consideration
28
+
29
+ This model is not owned or developed by RadixArk. It is a quantized derivative of Z.ai's model; see the upstream [GLM-5.3-Flash-BF16 model card](https://huggingface.co/zai-org/GLM-5.3-Flash-BF16) for the source model's capabilities, training information, and license.
30
+
31
+ ### License/Terms of Use:
32
+
33
+ [MIT License](https://huggingface.co/zai-org/GLM-5.3-Flash/blob/main/LICENSE)
34
+
35
+ ### Deployment Geography:
36
+
37
+ Global <br>
38
+
39
+ ### Use Case: <br>
40
+
41
+ Developers looking to deploy an off-the-shelf, pre-quantized multimodal model for agentic engineering, coding, long-context reasoning, tool use, chat, and other AI-powered applications. <br>
42
+
43
+ ### Release Date: <br>
44
+
45
+ Hugging Face 08/28/2026 via https://huggingface.co/RadixArk/GLM-5.3-Flash-NVFP4 <br>
46
+
47
+ ## Model Architecture:
48
+
49
+ **Architecture Type:** Transformer (hybrid-attention sparse Mixture-of-Experts, natively multimodal) <br>
50
+ **Network Architecture:** GLM-5.3-Flash — 45 language-model layers comprising 3 dense MLP layers and 42 MoE layers, 288 routed experts per MoE layer, a shared expert, KDA linear attention, DSA sparse attention with an indexer, MLA, manifold-constrained hyper-connections, a vision encoder, and a native MTP/NextN draft layer <br>
51
+ **Number of Model Parameters:** 320B total, 18B activated per token <br>
52
+
53
+ ## Input:
54
+
55
+ **Input Type(s):** Text, image, and video <br>
56
+ **Input Format(s):** String and visual media <br>
57
+ **Other Properties Related to Input:** Native context length up to 1,048,576 tokens. <br>
58
+
59
+ ## Output:
60
+
61
+ **Output Type(s):** Text <br>
62
+ **Output Format:** String <br>
63
+
64
+ ## Software Integration:
65
+
66
+ **Supported Runtime Engine(s):** <br>
67
+ * SGLang <br>
68
+
69
+ **Supported Hardware Microarchitecture Compatibility:** <br>
70
+ * NVIDIA Blackwell (validated on 4x GB300) <br>
71
+
72
+ **Preferred Operating System(s):** <br>
73
+ * Linux <br>
74
+
75
+ ## Model Version(s):
76
+
77
+ Source: [zai-org/GLM-5.3-Flash-BF16](https://huggingface.co/zai-org/GLM-5.3-Flash-BF16), revision `a6c167b6`. <br>
78
+ Quantized with [NVIDIA Model Optimizer](https://github.com/NVIDIA/Model-Optimizer) 0.46.0, commit `43fd41a58d52c4e6e5dec1d1ff5989ecc737ae1a`. <br>
79
+
80
+ ## Training, Testing, and Evaluation Datasets:
81
+ ### Calibration Data:
82
+
83
+ Calibration used 1,024 samples from the `abisee/cnn_dailymail` training split with sequence length 512 and batch size 1. <br>
84
+
85
+ ### Training Dataset:
86
+
87
+ RadixArk did not train or fine-tune this checkpoint. Training information is inherited from the upstream [GLM-5.3-Flash-BF16 model card](https://huggingface.co/zai-org/GLM-5.3-Flash-BF16). <br>
88
+
89
+ ### Evaluation Dataset:
90
+
91
+ This checkpoint was evaluated on GSM8K, AIME 2026, and Terminal-Bench 2.1. <br>
92
+
93
+ ## Post Training Quantization
94
+
95
+ The checkpoint uses plain abs-max NVFP4 W4A4 quantization with 256 tensor-scale normalization and group size 16. The quantized scope contains 36,423 NVFP4 bases: the `gate_proj`, `up_proj`, and `down_proj` tensors for all routed experts in 42 MoE layers (288 experts per layer), each shared expert, and the dense MLPs in layers 0-2.
96
+
97
+ All attention components (KDA, the DSA indexer, and MLA), hyper-connections, normalization layers, BF16 router weights and FP32 correction biases, the vision tower, the MTP/NextN layer, embeddings, and the language-model head remain at source precision. The checkpoint does not quantize the KV cache. Both FP8 (`fp8_e4m3`) KV cache with TRT-LLM DSA backends and BF16 KV cache with TileLang DSA backends are validated serving pairings; the recipe below defaults to FP8 KV with TRT-LLM DSA (roughly 1.8x KV token capacity), while BF16 KV with TileLang remains an alternative.
98
+
99
+ The checkpoint audit found 2,347 unchanged tensors content-identical to the pinned source; the checkpoint index independently contains all 889 MTP (layer-45) tensors. All scale values are finite and positive (range 3.49e-05 to 256.0). Full audit evidence is included in [`tensor-audit-b.json`](./tensor-audit-b.json) and [`precision-contract-b.json`](./precision-contract-b.json).
100
+
101
+ ## Usage
102
+
103
+ Use the official SGLang GLM-5.3-Flash image and the following four-GPU configuration:
104
+
105
+ ```sh
106
+ docker pull lmsysorg/sglang:glm-5.3-flash
107
+
108
+ docker run --gpus all \
109
+ --shm-size 32g \
110
+ -p 30000:30000 \
111
+ -v ~/.cache/huggingface:/root/.cache/huggingface \
112
+ --env "HF_TOKEN=<your-token>" \
113
+ --ipc=host \
114
+ lmsysorg/sglang:glm-5.3-flash \
115
+ python3 -m sglang.launch_server \
116
+ --model-path RadixArk/GLM-5.3-Flash-NVFP4 \
117
+ --quantization modelopt_fp4 \
118
+ --tp-size 4 \
119
+ --dsa-prefill-backend trtllm \
120
+ --dsa-decode-backend trtllm \
121
+ --kv-cache-dtype fp8_e4m3 \
122
+ --moe-runner-backend flashinfer_cutlass \
123
+ --speculative-algorithm NEXTN \
124
+ --speculative-num-steps 5 \
125
+ --speculative-eagle-topk 1 \
126
+ --speculative-num-draft-tokens 6 \
127
+ --speculative-adaptive \
128
+ --reasoning-parser glm45 \
129
+ --tool-call-parser glm47 \
130
+ --host 0.0.0.0 \
131
+ --port 30000
132
+ ```
133
+
134
+ For other deployment topologies and hardware-specific configurations, see the [SGLang GLM-5.3-Flash cookbook](https://docs.sglang.io/cookbook/autoregressive/GLM/GLM-5.3-Flash).
135
+
136
+ ### Evaluation
137
+
138
+ The benchmark results below were produced with this NVFP4 checkpoint and must not be interpreted as results from a different quantization variant.
139
+
140
+ | Benchmark | Evaluation protocol | Score | Per-seed range | Stop rate |
141
+ |---|---|---:|---:|---:|
142
+ | GSM8K | Full 1,319-example split x 4 seeds; `temperature=1.0`, `top_p=0.95`, `max_tokens=32768` | **97.14%** | 96.89%-97.42% | 99.85%-100% |
143
+ | AIME 2026 | 30 problems x 16 repeats x 4 seeds (1,920 generations); `temperature=1.0`, `top_p=0.95`, `max_tokens=131072` | **92.45%** | 91.67%-93.54% | 94.58%-96.04% |
144
+ | Terminal-Bench 2.1 | 89 tasks, terminus-2 agent, effort max, pass@1; `temperature=1.0`, `top_p=0.95`, `max_tokens=32768` | **83.1% (74/89)** | - | - |
145
+
146
+ For AIME 2026, generated-token percentiles (total output tokens; this harness does not split reasoning from answer tokens) were p50 **8,696** and p90 **53,342**. The reported evaluations were text-only.
147
+
148
+ Terminal-Bench 2.1 was run on the `terminal-bench-2-1` dataset (revision `7d7bdc1c`) with concurrency 32 and task deadlines disabled (capability-first). Two tasks (`qemu-alpine-ssh`, `qemu-startup`) could not run because they require KVM, which was unavailable on the evaluation runner. Two trials (`extract-moves-from-video`, `regex-chess`) did not finish within the evaluation window, so the reported numerator can only rise. The Terminal-Bench 2.1 run was served with SGLang on 4x GB300 (TP4) using FP8 (`fp8_e4m3`) KV cache with TRT-LLM DSA attention backends, flashinfer_cutlass MoE, and NEXTN speculative decoding.
149
+
150
+ ## Model Limitations:
151
+
152
+ Quantization can change model outputs relative to the source checkpoint. The base model may generate inaccurate, incomplete, irrelevant, biased, or otherwise undesirable responses. Developers should evaluate this checkpoint under their intended prompts, modalities, context lengths, sampling settings, and serving configuration, and apply appropriate safeguards.
153
+
154
+ ## Ethical Considerations
155
+
156
+ RadixArk believes trustworthy AI is a shared responsibility. Developers should ensure that use of this model complies with the upstream license and meets the safety, privacy, security, and reliability requirements of their application.
chat_template.jinja ADDED
@@ -0,0 +1,257 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ [gMASK]<sop>
2
+ {%- set effective_reasoning_effort = reasoning_effort if reasoning_effort is defined and reasoning_effort in ['low', 'high'] else 'max' -%}
3
+ {%- if effective_reasoning_effort is not none -%}<|system|>Reasoning Effort: {{ effective_reasoning_effort | capitalize }}{%- endif -%}
4
+ {%- set clear_thinking = clear_thinking if clear_thinking is defined else false -%}
5
+ {%- if tools -%}
6
+ {%- macro tool_to_json(tool) -%}
7
+ {%- set ns_tool = namespace(first=true) -%}
8
+ {{ '{' -}}
9
+ {%- for k, v in tool.items() -%}
10
+ {%- if k != 'defer_loading' and k != 'strict' -%}
11
+ {%- if not ns_tool.first -%}{{- ', ' -}}{%- endif -%}
12
+ {%- set ns_tool.first = false -%}
13
+ "{{ k }}": {{ v | tojson(ensure_ascii=False) }}
14
+ {%- endif -%}
15
+ {%- endfor -%}
16
+ {{- '}' -}}
17
+ {%- endmacro -%}
18
+ {%- macro tool_references_to_response(refs) -%}
19
+ {{- '<tool_response><tools>\n' -}}
20
+ {%- for tr in refs -%}
21
+ {%- for tool in tools -%}
22
+ {%- if 'function' in tool -%}
23
+ {%- set tool = tool['function'] -%}
24
+ {%- endif -%}
25
+ {%- if tool.name == tr.name -%}
26
+ {{- tool_to_json(tool) + '\n' -}}
27
+ {%- endif -%}
28
+ {%- endfor -%}
29
+ {%- endfor -%}
30
+ {{- '</tools></tool_response>' -}}
31
+ {%- endmacro -%}
32
+ <|system|>
33
+ # Tools
34
+
35
+ You may call one or more functions to assist with the user query.
36
+
37
+ You are provided with function signatures within <tools></tools> XML tags:
38
+ <tools>
39
+ {% for tool in tools %}
40
+ {%- if 'function' in tool -%}
41
+ {%- set tool = tool['function'] -%}
42
+ {%- endif -%}
43
+ {% if tool.defer_loading is not defined or not tool.defer_loading %}
44
+ {{ tool_to_json(tool) }}
45
+ {% endif %}
46
+ {% endfor %}
47
+ </tools>
48
+
49
+ For each function call, output the function name and arguments within the following XML format:
50
+ <tool_call>{function-name}<arg_key>{arg-key-1}</arg_key><arg_value>{arg-value-1}</arg_value><arg_key>{arg-key-2}</arg_key><arg_value>{arg-value-2}</arg_value>...</tool_call>{%- endif -%}
51
+ {%- macro emit_image() -%}<|begin_of_image|><|image|><|end_of_image|>{%- endmacro -%}
52
+ {%- macro emit_video() -%}<|begin_of_video|><|video|><|end_of_video|>{%- endmacro -%}
53
+ {%- macro emit_audio() -%}<|begin_of_audio|><|end_of_audio|>{%- endmacro -%}
54
+ {%- macro visible_text(content) -%}
55
+ {%- if content is string -%}
56
+ {{- content -}}
57
+ {%- elif content is iterable and content is not mapping -%}
58
+ {%- for item in content -%}
59
+ {%- if item is mapping and item.type == 'text' -%}
60
+ {{- item.text -}}
61
+ {%- elif item is string -%}
62
+ {{- item -}}
63
+ {%- elif item is mapping and item.type in ['image', 'image_url'] -%}
64
+ {{- emit_image() -}}
65
+ {%- elif item is mapping and item.type in ['video', 'video_url'] -%}
66
+ {{- emit_video() -}}
67
+ {%- elif item is mapping and item.type in ['audio', 'audio_url', 'input_audio'] -%}
68
+ {{- emit_audio() -}}
69
+ {%- endif -%}
70
+ {%- endfor -%}
71
+ {%- else -%}
72
+ {{- content }}
73
+ {%- endif -%}
74
+ {%- endmacro -%}
75
+ {%- macro tool_response(text) -%}
76
+ {{- '<tool_response>' + text + '</tool_response>' -}}
77
+ {%- endmacro -%}
78
+ {%- macro render_tool_response(m) -%}
79
+ {%- if m.content is string -%}
80
+ {{- tool_response(m.content) -}}
81
+ {%- elif m.content and m.content is not mapping and m.content.0.type == "tool_reference" -%}
82
+ {{- tool_references_to_response(m.content) -}}
83
+ {%- elif is_list_of_outputs(m) -%}
84
+ {%- for tr in m.content -%}
85
+ {%- if tr.output is iterable and tr.output is not string and tr.output is not mapping and tr.output and tr.output.0.type == "tool_reference" -%}
86
+ {{- tool_references_to_response(tr.output) -}}
87
+ {%- else -%}
88
+ {{- tool_response(visible_text(tr.output)) -}}
89
+ {%- endif -%}
90
+ {%- endfor -%}
91
+ {%- else -%}
92
+ {{- tool_response(visible_text(m.content)) -}}
93
+ {%- endif -%}
94
+ {%- endmacro -%}
95
+ {%- macro id_of(obj) -%}
96
+ {%- if obj.tool_call_id -%}
97
+ {{- obj.tool_call_id -}}
98
+ {%- elif obj.id -%}
99
+ {{- obj.id -}}
100
+ {%- endif -%}
101
+ {%- endmacro -%}
102
+ {%- macro is_list_of_outputs(m) -%}
103
+ {%- if m.content and m.content.0.output is defined -%}1{%- endif -%}
104
+ {%- endmacro -%}
105
+ {%- macro has_dup_tool_result_id(lo, hi, target) -%}
106
+ {%- set ns_cnt = namespace(n=0) -%}
107
+ {%- for k in range(lo, hi + 1) -%}
108
+ {%- set m = messages[k] -%}
109
+ {%- if is_list_of_outputs(m) -%}
110
+ {%- for entry in m.content -%}
111
+ {%- if id_of(entry) == target -%}
112
+ {%- set ns_cnt.n = ns_cnt.n + 1 -%}
113
+ {%- endif -%}
114
+ {%- endfor -%}
115
+ {%- elif id_of(m) == target -%}
116
+ {%- set ns_cnt.n = ns_cnt.n + 1 -%}
117
+ {%- endif -%}
118
+ {%- if ns_cnt.n > 1 -%}{%- break -%}{%- endif -%}
119
+ {%- endfor -%}
120
+ {%- if ns_cnt.n > 1 -%}1{%- endif -%}
121
+ {%- endmacro -%}
122
+ {%- macro tc_id_exists(tcs, target) -%}
123
+ {%- set ns_f = namespace(found=false) -%}
124
+ {%- for tc in tcs -%}
125
+ {%- if id_of(tc) == target -%}
126
+ {%- set ns_f.found = true -%}
127
+ {%- break -%}
128
+ {%- endif -%}
129
+ {%- endfor -%}
130
+ {%- if ns_f.found -%}1{%- endif -%}
131
+ {%- endmacro -%}
132
+ {%- set ns = namespace(last_user_index=-1) -%}
133
+ {%- for m in messages %}
134
+ {%- if m.role == 'user' %}
135
+ {%- set ns.last_user_index = loop.index0 -%}
136
+ {%- endif %}
137
+ {%- endfor %}
138
+ {%- for m in messages -%}
139
+ {%- if m.role == 'user' -%}<|user|>{{ visible_text(m.content) }}
140
+ {%- elif m.role == 'assistant' -%}
141
+ <|assistant|>
142
+ {%- set content = visible_text(m.content) %}
143
+ {%- if m.reasoning_content is string %}
144
+ {%- set reasoning_content = m.reasoning_content %}
145
+ {%- elif '</think>' in content %}
146
+ {%- set reasoning_content = content.split('</think>')[0].split('<think>')[-1] %}
147
+ {%- set content = content.split('</think>')[-1] %}
148
+ {%- endif %}
149
+ {%- if (not clear_thinking or loop.index0 > ns.last_user_index) and reasoning_content is defined -%}
150
+ {{ '<think>' + reasoning_content + '</think>'}}
151
+ {%- else -%}
152
+ {{ '<think></think>' }}
153
+ {%- endif -%}
154
+ {%- if content.strip() -%}
155
+ {{ content.strip() }}
156
+ {%- endif -%}
157
+ {% if m.tool_calls %}
158
+ {% for tc in m.tool_calls %}
159
+ {%- if tc.function %}
160
+ {%- set tc = tc.function %}
161
+ {%- endif %}
162
+ {{- '<tool_call>' + tc.name -}}
163
+ {% set _args = tc.arguments %}{% for k, v in _args.items() %}<arg_key>{{ k }}</arg_key><arg_value>{{ v | tojson(ensure_ascii=False) if v is not string else v }}</arg_value>{% endfor %}</tool_call>{% endfor %}
164
+ {% endif %}
165
+ {%- elif m.role == 'tool' -%}
166
+ {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
167
+ {{- '<|observation|>' -}}
168
+ {%- set block_start = loop.index0 -%}
169
+ {%- set ns_blk = namespace(end=block_start) -%}
170
+ {%- for j in range(block_start, messages|length) -%}
171
+ {%- if messages[j].role == 'tool' -%}
172
+ {%- set ns_blk.end = j -%}
173
+ {%- else -%}
174
+ {%- break -%}
175
+ {%- endif -%}
176
+ {%- endfor -%}
177
+ {%- set ns_a = namespace(tool_calls=none) -%}
178
+ {%- if block_start > 0 and messages[block_start - 1].role == 'assistant' and messages[block_start - 1].tool_calls -%}
179
+ {%- set ns_a.tool_calls = messages[block_start - 1].tool_calls -%}
180
+ {%- endif -%}
181
+ {%- set ns_chk = namespace(can_sort=true) -%}
182
+ {%- if not ns_a.tool_calls -%}
183
+ {%- set ns_chk.can_sort = false -%}
184
+ {%- else -%}
185
+ {%- for k in range(block_start, ns_blk.end + 1) -%}
186
+ {%- set m = messages[k] -%}
187
+ {%- if is_list_of_outputs(m) -%}
188
+ {%- for entry in m.content -%}
189
+ {%- set eid = id_of(entry) -%}
190
+ {%- if not eid -%}
191
+ {%- set ns_chk.can_sort = false -%}
192
+ {%- elif has_dup_tool_result_id(block_start, ns_blk.end, eid) -%}
193
+ {%- set ns_chk.can_sort = false -%}
194
+ {%- elif not tc_id_exists(ns_a.tool_calls, eid) -%}
195
+ {%- set ns_chk.can_sort = false -%}
196
+ {%- endif -%}
197
+ {%- endfor -%}
198
+ {%- else -%}
199
+ {%- set tk_id = id_of(m) -%}
200
+ {%- if not tk_id -%}
201
+ {%- set ns_chk.can_sort = false -%}
202
+ {%- elif has_dup_tool_result_id(block_start, ns_blk.end, tk_id) -%}
203
+ {%- set ns_chk.can_sort = false -%}
204
+ {%- elif not tc_id_exists(ns_a.tool_calls, tk_id) -%}
205
+ {%- set ns_chk.can_sort = false -%}
206
+ {%- endif -%}
207
+ {%- endif -%}
208
+ {%- endfor -%}
209
+ {%- for i in range(ns_a.tool_calls | length) -%}
210
+ {%- set tc_id = id_of(ns_a.tool_calls[i]) -%}
211
+ {%- if not tc_id -%}
212
+ {%- set ns_chk.can_sort = false -%}
213
+ {%- endif -%}
214
+ {%- for j in range(i + 1, ns_a.tool_calls | length) -%}
215
+ {%- if id_of(ns_a.tool_calls[j]) == tc_id -%}
216
+ {%- set ns_chk.can_sort = false -%}
217
+ {%- endif -%}
218
+ {%- endfor -%}
219
+ {%- endfor -%}
220
+ {%- endif -%}
221
+ {%- if ns_chk.can_sort -%}
222
+ {%- for tc in ns_a.tool_calls -%}
223
+ {%- set tc_id = id_of(tc) -%}
224
+ {%- for k in range(block_start, ns_blk.end + 1) -%}
225
+ {%- set m = messages[k] -%}
226
+ {%- if is_list_of_outputs(m) -%}
227
+ {%- for entry in m.content -%}
228
+ {%- set eid = id_of(entry) -%}
229
+ {%- if eid == tc_id -%}
230
+ {%- if entry.output is iterable and entry.output is not string and entry.output is not mapping and entry.output and entry.output.0.type == "tool_reference" -%}
231
+ {{- tool_references_to_response(entry.output) -}}
232
+ {%- else -%}
233
+ {{- tool_response(visible_text(entry.output)) -}}
234
+ {%- endif -%}
235
+ {%- endif -%}
236
+ {%- endfor -%}
237
+ {%- else -%}
238
+ {%- set tk_id = id_of(m) -%}
239
+ {%- if tk_id == tc_id -%}
240
+ {{- render_tool_response(m) -}}
241
+ {%- endif -%}
242
+ {%- endif -%}
243
+ {%- endfor -%}
244
+ {%- endfor -%}
245
+ {%- else -%}
246
+ {%- for k in range(block_start, ns_blk.end + 1) -%}
247
+ {{- render_tool_response(messages[k]) -}}
248
+ {%- endfor -%}
249
+ {%- endif -%}
250
+ {% endif -%}
251
+ {%- elif m.role == 'system' -%}
252
+ <|system|>{{ visible_text(m.content) }}
253
+ {%- endif -%}
254
+ {%- endfor -%}
255
+ {%- if add_generation_prompt -%}
256
+ <|assistant|>{{- '<think>' -}}
257
+ {%- endif -%}
config.json ADDED
@@ -0,0 +1,690 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Glm5NextForConditionalGeneration"
4
+ ],
5
+ "dtype": "bfloat16",
6
+ "image_end_token_id": 154831,
7
+ "image_start_token_id": 154830,
8
+ "image_token_id": 154854,
9
+ "model_type": "glm5_next",
10
+ "quantization_config": {
11
+ "config_groups": {
12
+ "group_0": {
13
+ "input_activations": {
14
+ "dynamic": false,
15
+ "group_size": 16,
16
+ "num_bits": 4,
17
+ "type": "float"
18
+ },
19
+ "targets": [
20
+ "Linear"
21
+ ],
22
+ "weights": {
23
+ "dynamic": false,
24
+ "group_size": 16,
25
+ "num_bits": 4,
26
+ "type": "float"
27
+ }
28
+ }
29
+ },
30
+ "exclude_modules": [
31
+ "lm_head",
32
+ "model.language_model.embed_tokens",
33
+ "model.language_model.layers.0.self_attn*",
34
+ "model.language_model.layers.1.self_attn*",
35
+ "model.language_model.layers.10.mlp.gate",
36
+ "model.language_model.layers.10.self_attn*",
37
+ "model.language_model.layers.11.mlp.gate",
38
+ "model.language_model.layers.11.self_attn*",
39
+ "model.language_model.layers.12.mlp.gate",
40
+ "model.language_model.layers.12.self_attn*",
41
+ "model.language_model.layers.13.mlp.gate",
42
+ "model.language_model.layers.13.self_attn*",
43
+ "model.language_model.layers.14.mlp.gate",
44
+ "model.language_model.layers.14.self_attn*",
45
+ "model.language_model.layers.15.mlp.gate",
46
+ "model.language_model.layers.15.self_attn*",
47
+ "model.language_model.layers.16.mlp.gate",
48
+ "model.language_model.layers.16.self_attn*",
49
+ "model.language_model.layers.17.mlp.gate",
50
+ "model.language_model.layers.17.self_attn*",
51
+ "model.language_model.layers.18.mlp.gate",
52
+ "model.language_model.layers.18.self_attn*",
53
+ "model.language_model.layers.19.mlp.gate",
54
+ "model.language_model.layers.19.self_attn*",
55
+ "model.language_model.layers.2.self_attn*",
56
+ "model.language_model.layers.20.mlp.gate",
57
+ "model.language_model.layers.20.self_attn*",
58
+ "model.language_model.layers.21.mlp.gate",
59
+ "model.language_model.layers.21.self_attn*",
60
+ "model.language_model.layers.22.mlp.gate",
61
+ "model.language_model.layers.22.self_attn*",
62
+ "model.language_model.layers.23.mlp.gate",
63
+ "model.language_model.layers.23.self_attn*",
64
+ "model.language_model.layers.24.mlp.gate",
65
+ "model.language_model.layers.24.self_attn*",
66
+ "model.language_model.layers.25.mlp.gate",
67
+ "model.language_model.layers.25.self_attn*",
68
+ "model.language_model.layers.26.mlp.gate",
69
+ "model.language_model.layers.26.self_attn*",
70
+ "model.language_model.layers.27.mlp.gate",
71
+ "model.language_model.layers.27.self_attn*",
72
+ "model.language_model.layers.28.mlp.gate",
73
+ "model.language_model.layers.28.self_attn*",
74
+ "model.language_model.layers.29.mlp.gate",
75
+ "model.language_model.layers.29.self_attn*",
76
+ "model.language_model.layers.3.mlp.gate",
77
+ "model.language_model.layers.3.self_attn*",
78
+ "model.language_model.layers.30.mlp.gate",
79
+ "model.language_model.layers.30.self_attn*",
80
+ "model.language_model.layers.31.mlp.gate",
81
+ "model.language_model.layers.31.self_attn*",
82
+ "model.language_model.layers.32.mlp.gate",
83
+ "model.language_model.layers.32.self_attn*",
84
+ "model.language_model.layers.33.mlp.gate",
85
+ "model.language_model.layers.33.self_attn*",
86
+ "model.language_model.layers.34.mlp.gate",
87
+ "model.language_model.layers.34.self_attn*",
88
+ "model.language_model.layers.35.mlp.gate",
89
+ "model.language_model.layers.35.self_attn*",
90
+ "model.language_model.layers.36.mlp.gate",
91
+ "model.language_model.layers.36.self_attn*",
92
+ "model.language_model.layers.37.mlp.gate",
93
+ "model.language_model.layers.37.self_attn*",
94
+ "model.language_model.layers.38.mlp.gate",
95
+ "model.language_model.layers.38.self_attn*",
96
+ "model.language_model.layers.39.mlp.gate",
97
+ "model.language_model.layers.39.self_attn*",
98
+ "model.language_model.layers.4.mlp.gate",
99
+ "model.language_model.layers.4.self_attn*",
100
+ "model.language_model.layers.40.mlp.gate",
101
+ "model.language_model.layers.40.self_attn*",
102
+ "model.language_model.layers.41.mlp.gate",
103
+ "model.language_model.layers.41.self_attn*",
104
+ "model.language_model.layers.42.mlp.gate",
105
+ "model.language_model.layers.42.self_attn*",
106
+ "model.language_model.layers.43.mlp.gate",
107
+ "model.language_model.layers.43.self_attn*",
108
+ "model.language_model.layers.44.mlp.gate",
109
+ "model.language_model.layers.44.self_attn*",
110
+ "model.language_model.layers.5.mlp.gate",
111
+ "model.language_model.layers.5.self_attn*",
112
+ "model.language_model.layers.6.mlp.gate",
113
+ "model.language_model.layers.6.self_attn*",
114
+ "model.language_model.layers.7.mlp.gate",
115
+ "model.language_model.layers.7.self_attn*",
116
+ "model.language_model.layers.8.mlp.gate",
117
+ "model.language_model.layers.8.self_attn*",
118
+ "model.language_model.layers.9.mlp.gate",
119
+ "model.language_model.layers.9.self_attn*",
120
+ "model.visual*",
121
+ "model.embed_tokens",
122
+ "model.layers.0.self_attn*",
123
+ "model.layers.1.self_attn*",
124
+ "model.layers.10.mlp.gate",
125
+ "model.layers.10.self_attn*",
126
+ "model.layers.11.mlp.gate",
127
+ "model.layers.11.self_attn*",
128
+ "model.layers.12.mlp.gate",
129
+ "model.layers.12.self_attn*",
130
+ "model.layers.13.mlp.gate",
131
+ "model.layers.13.self_attn*",
132
+ "model.layers.14.mlp.gate",
133
+ "model.layers.14.self_attn*",
134
+ "model.layers.15.mlp.gate",
135
+ "model.layers.15.self_attn*",
136
+ "model.layers.16.mlp.gate",
137
+ "model.layers.16.self_attn*",
138
+ "model.layers.17.mlp.gate",
139
+ "model.layers.17.self_attn*",
140
+ "model.layers.18.mlp.gate",
141
+ "model.layers.18.self_attn*",
142
+ "model.layers.19.mlp.gate",
143
+ "model.layers.19.self_attn*",
144
+ "model.layers.2.self_attn*",
145
+ "model.layers.20.mlp.gate",
146
+ "model.layers.20.self_attn*",
147
+ "model.layers.21.mlp.gate",
148
+ "model.layers.21.self_attn*",
149
+ "model.layers.22.mlp.gate",
150
+ "model.layers.22.self_attn*",
151
+ "model.layers.23.mlp.gate",
152
+ "model.layers.23.self_attn*",
153
+ "model.layers.24.mlp.gate",
154
+ "model.layers.24.self_attn*",
155
+ "model.layers.25.mlp.gate",
156
+ "model.layers.25.self_attn*",
157
+ "model.layers.26.mlp.gate",
158
+ "model.layers.26.self_attn*",
159
+ "model.layers.27.mlp.gate",
160
+ "model.layers.27.self_attn*",
161
+ "model.layers.28.mlp.gate",
162
+ "model.layers.28.self_attn*",
163
+ "model.layers.29.mlp.gate",
164
+ "model.layers.29.self_attn*",
165
+ "model.layers.3.mlp.gate",
166
+ "model.layers.3.self_attn*",
167
+ "model.layers.30.mlp.gate",
168
+ "model.layers.30.self_attn*",
169
+ "model.layers.31.mlp.gate",
170
+ "model.layers.31.self_attn*",
171
+ "model.layers.32.mlp.gate",
172
+ "model.layers.32.self_attn*",
173
+ "model.layers.33.mlp.gate",
174
+ "model.layers.33.self_attn*",
175
+ "model.layers.34.mlp.gate",
176
+ "model.layers.34.self_attn*",
177
+ "model.layers.35.mlp.gate",
178
+ "model.layers.35.self_attn*",
179
+ "model.layers.36.mlp.gate",
180
+ "model.layers.36.self_attn*",
181
+ "model.layers.37.mlp.gate",
182
+ "model.layers.37.self_attn*",
183
+ "model.layers.38.mlp.gate",
184
+ "model.layers.38.self_attn*",
185
+ "model.layers.39.mlp.gate",
186
+ "model.layers.39.self_attn*",
187
+ "model.layers.4.mlp.gate",
188
+ "model.layers.4.self_attn*",
189
+ "model.layers.40.mlp.gate",
190
+ "model.layers.40.self_attn*",
191
+ "model.layers.41.mlp.gate",
192
+ "model.layers.41.self_attn*",
193
+ "model.layers.42.mlp.gate",
194
+ "model.layers.42.self_attn*",
195
+ "model.layers.43.mlp.gate",
196
+ "model.layers.43.self_attn*",
197
+ "model.layers.44.mlp.gate",
198
+ "model.layers.44.self_attn*",
199
+ "model.layers.5.mlp.gate",
200
+ "model.layers.5.self_attn*",
201
+ "model.layers.6.mlp.gate",
202
+ "model.layers.6.self_attn*",
203
+ "model.layers.7.mlp.gate",
204
+ "model.layers.7.self_attn*",
205
+ "model.layers.8.mlp.gate",
206
+ "model.layers.8.self_attn*",
207
+ "model.layers.9.mlp.gate",
208
+ "model.layers.9.self_attn*",
209
+ "model.language_model.layers.45*",
210
+ "model.layers.45*"
211
+ ],
212
+ "ignore": [
213
+ "lm_head",
214
+ "model.language_model.embed_tokens",
215
+ "model.language_model.layers.0.self_attn*",
216
+ "model.language_model.layers.1.self_attn*",
217
+ "model.language_model.layers.10.mlp.gate",
218
+ "model.language_model.layers.10.self_attn*",
219
+ "model.language_model.layers.11.mlp.gate",
220
+ "model.language_model.layers.11.self_attn*",
221
+ "model.language_model.layers.12.mlp.gate",
222
+ "model.language_model.layers.12.self_attn*",
223
+ "model.language_model.layers.13.mlp.gate",
224
+ "model.language_model.layers.13.self_attn*",
225
+ "model.language_model.layers.14.mlp.gate",
226
+ "model.language_model.layers.14.self_attn*",
227
+ "model.language_model.layers.15.mlp.gate",
228
+ "model.language_model.layers.15.self_attn*",
229
+ "model.language_model.layers.16.mlp.gate",
230
+ "model.language_model.layers.16.self_attn*",
231
+ "model.language_model.layers.17.mlp.gate",
232
+ "model.language_model.layers.17.self_attn*",
233
+ "model.language_model.layers.18.mlp.gate",
234
+ "model.language_model.layers.18.self_attn*",
235
+ "model.language_model.layers.19.mlp.gate",
236
+ "model.language_model.layers.19.self_attn*",
237
+ "model.language_model.layers.2.self_attn*",
238
+ "model.language_model.layers.20.mlp.gate",
239
+ "model.language_model.layers.20.self_attn*",
240
+ "model.language_model.layers.21.mlp.gate",
241
+ "model.language_model.layers.21.self_attn*",
242
+ "model.language_model.layers.22.mlp.gate",
243
+ "model.language_model.layers.22.self_attn*",
244
+ "model.language_model.layers.23.mlp.gate",
245
+ "model.language_model.layers.23.self_attn*",
246
+ "model.language_model.layers.24.mlp.gate",
247
+ "model.language_model.layers.24.self_attn*",
248
+ "model.language_model.layers.25.mlp.gate",
249
+ "model.language_model.layers.25.self_attn*",
250
+ "model.language_model.layers.26.mlp.gate",
251
+ "model.language_model.layers.26.self_attn*",
252
+ "model.language_model.layers.27.mlp.gate",
253
+ "model.language_model.layers.27.self_attn*",
254
+ "model.language_model.layers.28.mlp.gate",
255
+ "model.language_model.layers.28.self_attn*",
256
+ "model.language_model.layers.29.mlp.gate",
257
+ "model.language_model.layers.29.self_attn*",
258
+ "model.language_model.layers.3.mlp.gate",
259
+ "model.language_model.layers.3.self_attn*",
260
+ "model.language_model.layers.30.mlp.gate",
261
+ "model.language_model.layers.30.self_attn*",
262
+ "model.language_model.layers.31.mlp.gate",
263
+ "model.language_model.layers.31.self_attn*",
264
+ "model.language_model.layers.32.mlp.gate",
265
+ "model.language_model.layers.32.self_attn*",
266
+ "model.language_model.layers.33.mlp.gate",
267
+ "model.language_model.layers.33.self_attn*",
268
+ "model.language_model.layers.34.mlp.gate",
269
+ "model.language_model.layers.34.self_attn*",
270
+ "model.language_model.layers.35.mlp.gate",
271
+ "model.language_model.layers.35.self_attn*",
272
+ "model.language_model.layers.36.mlp.gate",
273
+ "model.language_model.layers.36.self_attn*",
274
+ "model.language_model.layers.37.mlp.gate",
275
+ "model.language_model.layers.37.self_attn*",
276
+ "model.language_model.layers.38.mlp.gate",
277
+ "model.language_model.layers.38.self_attn*",
278
+ "model.language_model.layers.39.mlp.gate",
279
+ "model.language_model.layers.39.self_attn*",
280
+ "model.language_model.layers.4.mlp.gate",
281
+ "model.language_model.layers.4.self_attn*",
282
+ "model.language_model.layers.40.mlp.gate",
283
+ "model.language_model.layers.40.self_attn*",
284
+ "model.language_model.layers.41.mlp.gate",
285
+ "model.language_model.layers.41.self_attn*",
286
+ "model.language_model.layers.42.mlp.gate",
287
+ "model.language_model.layers.42.self_attn*",
288
+ "model.language_model.layers.43.mlp.gate",
289
+ "model.language_model.layers.43.self_attn*",
290
+ "model.language_model.layers.44.mlp.gate",
291
+ "model.language_model.layers.44.self_attn*",
292
+ "model.language_model.layers.5.mlp.gate",
293
+ "model.language_model.layers.5.self_attn*",
294
+ "model.language_model.layers.6.mlp.gate",
295
+ "model.language_model.layers.6.self_attn*",
296
+ "model.language_model.layers.7.mlp.gate",
297
+ "model.language_model.layers.7.self_attn*",
298
+ "model.language_model.layers.8.mlp.gate",
299
+ "model.language_model.layers.8.self_attn*",
300
+ "model.language_model.layers.9.mlp.gate",
301
+ "model.language_model.layers.9.self_attn*",
302
+ "model.visual*",
303
+ "model.embed_tokens",
304
+ "model.layers.0.self_attn*",
305
+ "model.layers.1.self_attn*",
306
+ "model.layers.10.mlp.gate",
307
+ "model.layers.10.self_attn*",
308
+ "model.layers.11.mlp.gate",
309
+ "model.layers.11.self_attn*",
310
+ "model.layers.12.mlp.gate",
311
+ "model.layers.12.self_attn*",
312
+ "model.layers.13.mlp.gate",
313
+ "model.layers.13.self_attn*",
314
+ "model.layers.14.mlp.gate",
315
+ "model.layers.14.self_attn*",
316
+ "model.layers.15.mlp.gate",
317
+ "model.layers.15.self_attn*",
318
+ "model.layers.16.mlp.gate",
319
+ "model.layers.16.self_attn*",
320
+ "model.layers.17.mlp.gate",
321
+ "model.layers.17.self_attn*",
322
+ "model.layers.18.mlp.gate",
323
+ "model.layers.18.self_attn*",
324
+ "model.layers.19.mlp.gate",
325
+ "model.layers.19.self_attn*",
326
+ "model.layers.2.self_attn*",
327
+ "model.layers.20.mlp.gate",
328
+ "model.layers.20.self_attn*",
329
+ "model.layers.21.mlp.gate",
330
+ "model.layers.21.self_attn*",
331
+ "model.layers.22.mlp.gate",
332
+ "model.layers.22.self_attn*",
333
+ "model.layers.23.mlp.gate",
334
+ "model.layers.23.self_attn*",
335
+ "model.layers.24.mlp.gate",
336
+ "model.layers.24.self_attn*",
337
+ "model.layers.25.mlp.gate",
338
+ "model.layers.25.self_attn*",
339
+ "model.layers.26.mlp.gate",
340
+ "model.layers.26.self_attn*",
341
+ "model.layers.27.mlp.gate",
342
+ "model.layers.27.self_attn*",
343
+ "model.layers.28.mlp.gate",
344
+ "model.layers.28.self_attn*",
345
+ "model.layers.29.mlp.gate",
346
+ "model.layers.29.self_attn*",
347
+ "model.layers.3.mlp.gate",
348
+ "model.layers.3.self_attn*",
349
+ "model.layers.30.mlp.gate",
350
+ "model.layers.30.self_attn*",
351
+ "model.layers.31.mlp.gate",
352
+ "model.layers.31.self_attn*",
353
+ "model.layers.32.mlp.gate",
354
+ "model.layers.32.self_attn*",
355
+ "model.layers.33.mlp.gate",
356
+ "model.layers.33.self_attn*",
357
+ "model.layers.34.mlp.gate",
358
+ "model.layers.34.self_attn*",
359
+ "model.layers.35.mlp.gate",
360
+ "model.layers.35.self_attn*",
361
+ "model.layers.36.mlp.gate",
362
+ "model.layers.36.self_attn*",
363
+ "model.layers.37.mlp.gate",
364
+ "model.layers.37.self_attn*",
365
+ "model.layers.38.mlp.gate",
366
+ "model.layers.38.self_attn*",
367
+ "model.layers.39.mlp.gate",
368
+ "model.layers.39.self_attn*",
369
+ "model.layers.4.mlp.gate",
370
+ "model.layers.4.self_attn*",
371
+ "model.layers.40.mlp.gate",
372
+ "model.layers.40.self_attn*",
373
+ "model.layers.41.mlp.gate",
374
+ "model.layers.41.self_attn*",
375
+ "model.layers.42.mlp.gate",
376
+ "model.layers.42.self_attn*",
377
+ "model.layers.43.mlp.gate",
378
+ "model.layers.43.self_attn*",
379
+ "model.layers.44.mlp.gate",
380
+ "model.layers.44.self_attn*",
381
+ "model.layers.5.mlp.gate",
382
+ "model.layers.5.self_attn*",
383
+ "model.layers.6.mlp.gate",
384
+ "model.layers.6.self_attn*",
385
+ "model.layers.7.mlp.gate",
386
+ "model.layers.7.self_attn*",
387
+ "model.layers.8.mlp.gate",
388
+ "model.layers.8.self_attn*",
389
+ "model.layers.9.mlp.gate",
390
+ "model.layers.9.self_attn*",
391
+ "model.language_model.layers.45*",
392
+ "model.layers.45*",
393
+ "model.decoder*",
394
+ "visual*"
395
+ ],
396
+ "producer": {
397
+ "name": "modelopt",
398
+ "version": "0.46.0"
399
+ },
400
+ "quant_algo": "NVFP4",
401
+ "quant_method": "modelopt"
402
+ },
403
+ "text_config": {
404
+ "attention_bias": false,
405
+ "attention_dropout": 0.0,
406
+ "bos_token_id": null,
407
+ "dtype": "bfloat16",
408
+ "eos_token_id": [
409
+ 154820,
410
+ 154827,
411
+ 154829
412
+ ],
413
+ "first_k_dense_replace": 3,
414
+ "hc_eps": 1e-06,
415
+ "hc_mult": 4,
416
+ "hc_sinkhorn_iters": 20,
417
+ "head_dim": 0,
418
+ "hidden_act": "silu",
419
+ "hidden_size": 4096,
420
+ "index_head_dim": 128,
421
+ "index_kpool": 4,
422
+ "index_kpool_always_select_tail": true,
423
+ "index_kpool_compress": true,
424
+ "index_n_heads": 32,
425
+ "index_share_for_mtp_iteration": true,
426
+ "index_topk": 2048,
427
+ "indexer_rope_interleave": true,
428
+ "indexer_types": [
429
+ "full",
430
+ "full",
431
+ "full",
432
+ "full",
433
+ "full",
434
+ "full",
435
+ "full",
436
+ "full",
437
+ "full",
438
+ "full",
439
+ "full",
440
+ "full",
441
+ "full",
442
+ "full",
443
+ "full",
444
+ "full",
445
+ "full",
446
+ "full",
447
+ "full",
448
+ "full",
449
+ "full",
450
+ "full",
451
+ "full",
452
+ "full",
453
+ "full",
454
+ "full",
455
+ "full",
456
+ "full",
457
+ "full",
458
+ "full",
459
+ "full",
460
+ "full",
461
+ "full",
462
+ "full",
463
+ "full",
464
+ "full",
465
+ "full",
466
+ "full",
467
+ "full",
468
+ "full",
469
+ "full",
470
+ "full",
471
+ "full",
472
+ "full",
473
+ "full"
474
+ ],
475
+ "initializer_range": 0.02,
476
+ "intermediate_size": 12288,
477
+ "kv_lora_rank": 512,
478
+ "layer_types": [
479
+ "linear_attention",
480
+ "linear_attention",
481
+ "linear_attention",
482
+ "deepseek_sparse_attention",
483
+ "linear_attention",
484
+ "linear_attention",
485
+ "linear_attention",
486
+ "deepseek_sparse_attention",
487
+ "linear_attention",
488
+ "linear_attention",
489
+ "linear_attention",
490
+ "deepseek_sparse_attention",
491
+ "linear_attention",
492
+ "linear_attention",
493
+ "linear_attention",
494
+ "deepseek_sparse_attention",
495
+ "linear_attention",
496
+ "linear_attention",
497
+ "linear_attention",
498
+ "deepseek_sparse_attention",
499
+ "linear_attention",
500
+ "linear_attention",
501
+ "linear_attention",
502
+ "deepseek_sparse_attention",
503
+ "linear_attention",
504
+ "linear_attention",
505
+ "linear_attention",
506
+ "deepseek_sparse_attention",
507
+ "linear_attention",
508
+ "linear_attention",
509
+ "linear_attention",
510
+ "deepseek_sparse_attention",
511
+ "linear_attention",
512
+ "linear_attention",
513
+ "linear_attention",
514
+ "deepseek_sparse_attention",
515
+ "linear_attention",
516
+ "linear_attention",
517
+ "linear_attention",
518
+ "deepseek_sparse_attention",
519
+ "linear_attention",
520
+ "linear_attention",
521
+ "linear_attention",
522
+ "deepseek_sparse_attention",
523
+ "linear_attention"
524
+ ],
525
+ "linear_attn_config": {
526
+ "full_attn_layers": [
527
+ 3,
528
+ 7,
529
+ 11,
530
+ 15,
531
+ 19,
532
+ 23,
533
+ 27,
534
+ 31,
535
+ 35,
536
+ 39,
537
+ 43
538
+ ],
539
+ "gate_lower_bound": -5.0,
540
+ "head_dim": 128,
541
+ "kda_layers": [
542
+ 0,
543
+ 1,
544
+ 2,
545
+ 4,
546
+ 5,
547
+ 6,
548
+ 8,
549
+ 9,
550
+ 10,
551
+ 12,
552
+ 13,
553
+ 14,
554
+ 16,
555
+ 17,
556
+ 18,
557
+ 20,
558
+ 21,
559
+ 22,
560
+ 24,
561
+ 25,
562
+ 26,
563
+ 28,
564
+ 29,
565
+ 30,
566
+ 32,
567
+ 33,
568
+ 34,
569
+ 36,
570
+ 37,
571
+ 38,
572
+ 40,
573
+ 41,
574
+ 42,
575
+ 44
576
+ ],
577
+ "num_heads": 64,
578
+ "short_conv_kernel_size": 4
579
+ },
580
+ "linear_conv_kernel_dim": 4,
581
+ "linear_head_dim": 128,
582
+ "linear_lower_bound": -5.0,
583
+ "linear_num_heads": 64,
584
+ "max_position_embeddings": 1048576,
585
+ "mhc": true,
586
+ "mla_use_nope": true,
587
+ "mlp_layer_types": [
588
+ "dense",
589
+ "dense",
590
+ "dense",
591
+ "sparse",
592
+ "sparse",
593
+ "sparse",
594
+ "sparse",
595
+ "sparse",
596
+ "sparse",
597
+ "sparse",
598
+ "sparse",
599
+ "sparse",
600
+ "sparse",
601
+ "sparse",
602
+ "sparse",
603
+ "sparse",
604
+ "sparse",
605
+ "sparse",
606
+ "sparse",
607
+ "sparse",
608
+ "sparse",
609
+ "sparse",
610
+ "sparse",
611
+ "sparse",
612
+ "sparse",
613
+ "sparse",
614
+ "sparse",
615
+ "sparse",
616
+ "sparse",
617
+ "sparse",
618
+ "sparse",
619
+ "sparse",
620
+ "sparse",
621
+ "sparse",
622
+ "sparse",
623
+ "sparse",
624
+ "sparse",
625
+ "sparse",
626
+ "sparse",
627
+ "sparse",
628
+ "sparse",
629
+ "sparse",
630
+ "sparse",
631
+ "sparse",
632
+ "sparse"
633
+ ],
634
+ "model_type": "glm5_next_text",
635
+ "moe_intermediate_size": 2048,
636
+ "moe_router_dtype": "float32",
637
+ "n_group": 1,
638
+ "n_routed_experts": 288,
639
+ "n_shared_experts": 1,
640
+ "norm_topk_prob": true,
641
+ "num_attention_heads": 64,
642
+ "num_experts_per_tok": 8,
643
+ "num_hidden_layers": 45,
644
+ "num_key_value_heads": 64,
645
+ "num_nextn_predict_layers": 1,
646
+ "output_router_logits": false,
647
+ "pad_token_id": 154820,
648
+ "q_lora_rank": 1536,
649
+ "qk_head_dim": 256,
650
+ "qk_nope_head_dim": 256,
651
+ "qk_rope_head_dim": 0,
652
+ "rms_norm_eps": 1e-05,
653
+ "routed_scaling_factor": 2.5,
654
+ "router_aux_loss_coef": 0.001,
655
+ "scoring_func": "sigmoid",
656
+ "swiglu_limit": 10.0,
657
+ "tie_word_embeddings": false,
658
+ "topk_group": 1,
659
+ "topk_method": "noaux_tc",
660
+ "use_cache": true,
661
+ "v_head_dim": 256,
662
+ "vocab_size": 154880
663
+ },
664
+ "tie_word_embeddings": false,
665
+ "transformers_version": "5.16.1",
666
+ "video_end_token_id": 154833,
667
+ "video_start_token_id": 154832,
668
+ "video_token_id": 154855,
669
+ "vision_config": {
670
+ "attention_bias": true,
671
+ "attention_dropout": 0.0,
672
+ "depth": 24,
673
+ "dtype": "bfloat16",
674
+ "hidden_act": "silu",
675
+ "hidden_size": 1024,
676
+ "image_size": 448,
677
+ "in_channels": 3,
678
+ "initializer_range": 0.02,
679
+ "intermediate_size": 4096,
680
+ "model_type": "glm5_next_vision",
681
+ "num_heads": 16,
682
+ "out_hidden_size": 4096,
683
+ "patch_size": 14,
684
+ "projection_intermediate_size": 10240,
685
+ "rms_norm_eps": 1e-05,
686
+ "spatial_merge_size": 2,
687
+ "swiglu_limit": 10.0,
688
+ "temporal_patch_size": 2
689
+ }
690
+ }
generation_config.json ADDED
@@ -0,0 +1,12 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_from_model_config": true,
3
+ "eos_token_id": [
4
+ 154820,
5
+ 154827,
6
+ 154829
7
+ ],
8
+ "pad_token_id": 154820,
9
+ "temperature": 1.0,
10
+ "top_p": 0.95,
11
+ "transformers_version": "5.16.0"
12
+ }
hf_quant_config.json ADDED
@@ -0,0 +1,195 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "producer": {
3
+ "name": "modelopt",
4
+ "version": "0.46.0"
5
+ },
6
+ "quantization": {
7
+ "exclude_modules": [
8
+ "lm_head",
9
+ "model.language_model.embed_tokens",
10
+ "model.language_model.layers.0.self_attn*",
11
+ "model.language_model.layers.1.self_attn*",
12
+ "model.language_model.layers.10.mlp.gate",
13
+ "model.language_model.layers.10.self_attn*",
14
+ "model.language_model.layers.11.mlp.gate",
15
+ "model.language_model.layers.11.self_attn*",
16
+ "model.language_model.layers.12.mlp.gate",
17
+ "model.language_model.layers.12.self_attn*",
18
+ "model.language_model.layers.13.mlp.gate",
19
+ "model.language_model.layers.13.self_attn*",
20
+ "model.language_model.layers.14.mlp.gate",
21
+ "model.language_model.layers.14.self_attn*",
22
+ "model.language_model.layers.15.mlp.gate",
23
+ "model.language_model.layers.15.self_attn*",
24
+ "model.language_model.layers.16.mlp.gate",
25
+ "model.language_model.layers.16.self_attn*",
26
+ "model.language_model.layers.17.mlp.gate",
27
+ "model.language_model.layers.17.self_attn*",
28
+ "model.language_model.layers.18.mlp.gate",
29
+ "model.language_model.layers.18.self_attn*",
30
+ "model.language_model.layers.19.mlp.gate",
31
+ "model.language_model.layers.19.self_attn*",
32
+ "model.language_model.layers.2.self_attn*",
33
+ "model.language_model.layers.20.mlp.gate",
34
+ "model.language_model.layers.20.self_attn*",
35
+ "model.language_model.layers.21.mlp.gate",
36
+ "model.language_model.layers.21.self_attn*",
37
+ "model.language_model.layers.22.mlp.gate",
38
+ "model.language_model.layers.22.self_attn*",
39
+ "model.language_model.layers.23.mlp.gate",
40
+ "model.language_model.layers.23.self_attn*",
41
+ "model.language_model.layers.24.mlp.gate",
42
+ "model.language_model.layers.24.self_attn*",
43
+ "model.language_model.layers.25.mlp.gate",
44
+ "model.language_model.layers.25.self_attn*",
45
+ "model.language_model.layers.26.mlp.gate",
46
+ "model.language_model.layers.26.self_attn*",
47
+ "model.language_model.layers.27.mlp.gate",
48
+ "model.language_model.layers.27.self_attn*",
49
+ "model.language_model.layers.28.mlp.gate",
50
+ "model.language_model.layers.28.self_attn*",
51
+ "model.language_model.layers.29.mlp.gate",
52
+ "model.language_model.layers.29.self_attn*",
53
+ "model.language_model.layers.3.mlp.gate",
54
+ "model.language_model.layers.3.self_attn*",
55
+ "model.language_model.layers.30.mlp.gate",
56
+ "model.language_model.layers.30.self_attn*",
57
+ "model.language_model.layers.31.mlp.gate",
58
+ "model.language_model.layers.31.self_attn*",
59
+ "model.language_model.layers.32.mlp.gate",
60
+ "model.language_model.layers.32.self_attn*",
61
+ "model.language_model.layers.33.mlp.gate",
62
+ "model.language_model.layers.33.self_attn*",
63
+ "model.language_model.layers.34.mlp.gate",
64
+ "model.language_model.layers.34.self_attn*",
65
+ "model.language_model.layers.35.mlp.gate",
66
+ "model.language_model.layers.35.self_attn*",
67
+ "model.language_model.layers.36.mlp.gate",
68
+ "model.language_model.layers.36.self_attn*",
69
+ "model.language_model.layers.37.mlp.gate",
70
+ "model.language_model.layers.37.self_attn*",
71
+ "model.language_model.layers.38.mlp.gate",
72
+ "model.language_model.layers.38.self_attn*",
73
+ "model.language_model.layers.39.mlp.gate",
74
+ "model.language_model.layers.39.self_attn*",
75
+ "model.language_model.layers.4.mlp.gate",
76
+ "model.language_model.layers.4.self_attn*",
77
+ "model.language_model.layers.40.mlp.gate",
78
+ "model.language_model.layers.40.self_attn*",
79
+ "model.language_model.layers.41.mlp.gate",
80
+ "model.language_model.layers.41.self_attn*",
81
+ "model.language_model.layers.42.mlp.gate",
82
+ "model.language_model.layers.42.self_attn*",
83
+ "model.language_model.layers.43.mlp.gate",
84
+ "model.language_model.layers.43.self_attn*",
85
+ "model.language_model.layers.44.mlp.gate",
86
+ "model.language_model.layers.44.self_attn*",
87
+ "model.language_model.layers.5.mlp.gate",
88
+ "model.language_model.layers.5.self_attn*",
89
+ "model.language_model.layers.6.mlp.gate",
90
+ "model.language_model.layers.6.self_attn*",
91
+ "model.language_model.layers.7.mlp.gate",
92
+ "model.language_model.layers.7.self_attn*",
93
+ "model.language_model.layers.8.mlp.gate",
94
+ "model.language_model.layers.8.self_attn*",
95
+ "model.language_model.layers.9.mlp.gate",
96
+ "model.language_model.layers.9.self_attn*",
97
+ "model.visual*",
98
+ "model.embed_tokens",
99
+ "model.layers.0.self_attn*",
100
+ "model.layers.1.self_attn*",
101
+ "model.layers.10.mlp.gate",
102
+ "model.layers.10.self_attn*",
103
+ "model.layers.11.mlp.gate",
104
+ "model.layers.11.self_attn*",
105
+ "model.layers.12.mlp.gate",
106
+ "model.layers.12.self_attn*",
107
+ "model.layers.13.mlp.gate",
108
+ "model.layers.13.self_attn*",
109
+ "model.layers.14.mlp.gate",
110
+ "model.layers.14.self_attn*",
111
+ "model.layers.15.mlp.gate",
112
+ "model.layers.15.self_attn*",
113
+ "model.layers.16.mlp.gate",
114
+ "model.layers.16.self_attn*",
115
+ "model.layers.17.mlp.gate",
116
+ "model.layers.17.self_attn*",
117
+ "model.layers.18.mlp.gate",
118
+ "model.layers.18.self_attn*",
119
+ "model.layers.19.mlp.gate",
120
+ "model.layers.19.self_attn*",
121
+ "model.layers.2.self_attn*",
122
+ "model.layers.20.mlp.gate",
123
+ "model.layers.20.self_attn*",
124
+ "model.layers.21.mlp.gate",
125
+ "model.layers.21.self_attn*",
126
+ "model.layers.22.mlp.gate",
127
+ "model.layers.22.self_attn*",
128
+ "model.layers.23.mlp.gate",
129
+ "model.layers.23.self_attn*",
130
+ "model.layers.24.mlp.gate",
131
+ "model.layers.24.self_attn*",
132
+ "model.layers.25.mlp.gate",
133
+ "model.layers.25.self_attn*",
134
+ "model.layers.26.mlp.gate",
135
+ "model.layers.26.self_attn*",
136
+ "model.layers.27.mlp.gate",
137
+ "model.layers.27.self_attn*",
138
+ "model.layers.28.mlp.gate",
139
+ "model.layers.28.self_attn*",
140
+ "model.layers.29.mlp.gate",
141
+ "model.layers.29.self_attn*",
142
+ "model.layers.3.mlp.gate",
143
+ "model.layers.3.self_attn*",
144
+ "model.layers.30.mlp.gate",
145
+ "model.layers.30.self_attn*",
146
+ "model.layers.31.mlp.gate",
147
+ "model.layers.31.self_attn*",
148
+ "model.layers.32.mlp.gate",
149
+ "model.layers.32.self_attn*",
150
+ "model.layers.33.mlp.gate",
151
+ "model.layers.33.self_attn*",
152
+ "model.layers.34.mlp.gate",
153
+ "model.layers.34.self_attn*",
154
+ "model.layers.35.mlp.gate",
155
+ "model.layers.35.self_attn*",
156
+ "model.layers.36.mlp.gate",
157
+ "model.layers.36.self_attn*",
158
+ "model.layers.37.mlp.gate",
159
+ "model.layers.37.self_attn*",
160
+ "model.layers.38.mlp.gate",
161
+ "model.layers.38.self_attn*",
162
+ "model.layers.39.mlp.gate",
163
+ "model.layers.39.self_attn*",
164
+ "model.layers.4.mlp.gate",
165
+ "model.layers.4.self_attn*",
166
+ "model.layers.40.mlp.gate",
167
+ "model.layers.40.self_attn*",
168
+ "model.layers.41.mlp.gate",
169
+ "model.layers.41.self_attn*",
170
+ "model.layers.42.mlp.gate",
171
+ "model.layers.42.self_attn*",
172
+ "model.layers.43.mlp.gate",
173
+ "model.layers.43.self_attn*",
174
+ "model.layers.44.mlp.gate",
175
+ "model.layers.44.self_attn*",
176
+ "model.layers.5.mlp.gate",
177
+ "model.layers.5.self_attn*",
178
+ "model.layers.6.mlp.gate",
179
+ "model.layers.6.self_attn*",
180
+ "model.layers.7.mlp.gate",
181
+ "model.layers.7.self_attn*",
182
+ "model.layers.8.mlp.gate",
183
+ "model.layers.8.self_attn*",
184
+ "model.layers.9.mlp.gate",
185
+ "model.layers.9.self_attn*",
186
+ "model.language_model.layers.45*",
187
+ "model.layers.45*",
188
+ "model.decoder*",
189
+ "visual*"
190
+ ],
191
+ "group_size": 16,
192
+ "kv_cache_quant_algo": null,
193
+ "quant_algo": "NVFP4"
194
+ }
195
+ }
model-00001.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:91fda92ccc3436dbe2e73d3552ed1518009c5ad41e1c44d81858c520788df86d
3
+ size 5365628324
model-00002.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:93538d67e7ba1592b2c93d622698ccb5a013dabb2340e261e3c218824641fa33
3
+ size 5365653592
model-00003.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5bac6a0fa5e1833a314308245610eb123d2d95b409db597d265c95440938e686
3
+ size 5365652256
model-00004.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5772435e5a7371cdf950118be37533694553a61b388b5e7ae311139994d24818
3
+ size 5365653256
model-00005.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0a42f21bc92a5bd05e25ef466725703e8da853f716c0badcb6f873b704a7e83e
3
+ size 5365130072
model-00006.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fb73ba725542cb9b207245aee7c6a1d0110564edfdb9d755767953a8dcc39632
3
+ size 5365655088
model-00007.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ba19437fefffc61e054b783181170d4fa21b44f570f5f33869c0bd8a0d988673
3
+ size 5366180904
model-00008.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0563d292d988bfbd7853947e0f82355acda2205c9d472ced1cd49f712f6aaf79
3
+ size 5365657416
model-00009.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:da1865023ed8bd6cd613f2226d728e508097fdc497ca5308f809aeae9669a79b
3
+ size 5365658056
model-00010.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:123698d9536f21180f4e65054db2678ebfa382195b3ade1ee85b27a3b3c44017
3
+ size 5365656880
model-00011.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1b560dabd6642eb77284fdf04cdf3c234af8cc3d95836441802a78d99635ab72
3
+ size 5365657776
model-00012.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0f861b4c5f7fed9e043ff9b0de22da4935608c0d7525e84eeb5f5f243b54c418
3
+ size 5365657264
model-00013.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dfd08646f849a83aa39ca41448c562077b5188830cee0313ccf3fe16f8587e4a
3
+ size 5365657368
model-00014.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:48905c0e2cb6d77c9f1b6b7b67f7b818e3a26dbc708476602a4ec0227257f908
3
+ size 5365657728
model-00015.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e0da903ada035cbd5d5a2d3e630be8a6a8cc105b03e84fd58aa667a399c9a6d9
3
+ size 5365657456
model-00016.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e20b419eb017bd7beae613cd096b090de91936ecdf865c317622cf7bd9eefb6e
3
+ size 5365657408
model-00017.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e8da645be1e820ee9c381515aacee45b25eba8d4d4a63150f29228e6187573f7
3
+ size 5365657312
model-00018.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4b84e5c22c44f2891a58f01c6ce243bdfd6089278fc664d502d28322d25c275d
3
+ size 5365657944
model-00019.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ab0c72019e1cc7502f4da3c7c00ad82efa93ea3de120bd7738272fbea00f5f5e
3
+ size 5365656792
model-00020.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:70134190dee78f131bdc231cc3c26ad947924f0796fd6f852f59cf8e9b5ac4b9
3
+ size 5365657800
model-00021.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:37a49abbd8a1b2032192807b0377569bb6e6d8b2a62a234da97f052bfe7755c0
3
+ size 5365657752
model-00022.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8285d9c47f36d6560a12f5a465c296b4013893a2db2a0d84d57d0652c90cce27
3
+ size 5365657536
model-00023.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:61771154bbaeed0ead5427b32348b1e0215f862599b9800c5f52e2ad7288c00b
3
+ size 5365657072
model-00024.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1e26880c53b174224022cca57ef4d4e1a97cfc83950bf6644da72da3121cdd80
3
+ size 5365657048
model-00025.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a9e8c91d5fac15e24f36b59ce573169061ce5a36dd0792af0b902ab7cfca264a
3
+ size 5365658488
model-00026.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7914dd8e6c40edc9b9c77642bf42c2b2a1c58c4d2359ced85a1af3854ee4a81a
3
+ size 5365656832
model-00027.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e74fc3ca9f117f5c67884bace2cc055ea855c1f487b4d4118f4b68e0ac93ca25
3
+ size 5365657776
model-00028.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:79fd7fdf11afb04b905bdfeeeae0d5bd8936394fbc4f84733c73eddcb019b2ea
3
+ size 5365657752
model-00029.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2f34aac8fa3dfb0dd0246386ef45dd0fa594c3daaa646f474675bc03b103675a
3
+ size 5365656928
model-00030.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:93c28ec6c1e4868cac2c3f5483d3584077b3a684f0b1875b1d4fff6cefa69a70
3
+ size 5365657672
model-00031.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5879d8db05a13d6f40099c07e212de07c515625a2dcae63e44f54471f449fd5b
3
+ size 5365656696
model-00032.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d84e27a02b92a45c9607acc450b240e2f407fba8d33c9725829ca0ef8bf914f9
3
+ size 5365658224
model-00033.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0004d83a15b9e90ad7c0468dd2052e5c367e8d06f288bf12e3e8ededfd4a62f0
3
+ size 5325734332
model-00034.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:84d08f5cefc885b765eb53c466d30df0bc32e2848204a4fda6611aca50036a1e
3
+ size 5323711032
model-00035.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d7524c617f138765e7a9ee982d88f6f11b03a2faa3e139449254859fa8a05a3f
3
+ size 5362580368
model-00036.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:912685ed037c1587e52dada1d4e060d8a6d4f8b2ab878239e9e400656bdd8708
3
+ size 5368754216
model-00037.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a7927940060c2c68c561c195c8f6f7980b46218476726848a8401aea0447482d
3
+ size 5368754088
model-00038.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:916db7ab58cf211312da9343278340e2b7a63fa84f38057b527f4f054eadc3f7
3
+ size 4462318592
model.safetensors.index.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4aac38666f5d7cced2448c141aaeffc3d8d284a09ac106b79090b7a4346eabcd
3
+ size 14410608
precision-contract-b.json ADDED
The diff for this file is too large to render. See raw diff
 
processor_config.json ADDED
@@ -0,0 +1,44 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "image_processor": {
3
+ "do_rescale": true,
4
+ "patch_expand_factor": 1,
5
+ "merge_size": 2,
6
+ "image_mean": [
7
+ 0.48145466,
8
+ 0.4578275,
9
+ 0.40821073
10
+ ],
11
+ "image_std": [
12
+ 0.26862954,
13
+ 0.26130258,
14
+ 0.27577711
15
+ ],
16
+ "temporal_patch_size": 2,
17
+ "patch_size": 14,
18
+ "min_image_tokens": 16,
19
+ "max_image_tokens": 8000,
20
+ "image_processor_type": "Glm5NextImageProcessor"
21
+ },
22
+ "video_processor": {
23
+ "do_rescale": true,
24
+ "video_processor_type": "Glm5NextVideoProcessor",
25
+ "patch_expand_factor": 1,
26
+ "merge_size": 2,
27
+ "image_mean": [
28
+ 0.48145466,
29
+ 0.4578275,
30
+ 0.40821073
31
+ ],
32
+ "image_std": [
33
+ 0.26862954,
34
+ 0.26130258,
35
+ 0.27577711
36
+ ],
37
+ "temporal_patch_size": 2,
38
+ "patch_size": 14,
39
+ "min_image_tokens": 16,
40
+ "max_image_tokens": 240000,
41
+ "fps": 2
42
+ },
43
+ "processor_class": "Glm5NextProcessor"
44
+ }
tensor-audit-b.json ADDED
@@ -0,0 +1,19 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "algorithm_base_counts": {
3
+ "NVFP4": 36423
4
+ },
5
+ "kv_cache_quant_algo": null,
6
+ "mtp_tensor_count": 0,
7
+ "output_indexed_payload_bytes": 202893045168,
8
+ "output_shard_count": 38,
9
+ "output_tensor_count": 148039,
10
+ "quantized_layers_recorded_in_config": false,
11
+ "quantized_protected_bases": [],
12
+ "scale_max": 256.0,
13
+ "scale_min": 3.487723370199092e-05,
14
+ "scale_tensor_count": 109269,
15
+ "scale_value_count": 19119807630,
16
+ "unchanged_bytes": 30815140728,
17
+ "unchanged_tensor_count": 2347,
18
+ "verdict": "pass"
19
+ }
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:19e773648cb4e65de8660ea6365e10acca112d42a854923df93db4a6f333a82d
3
+ size 20217442