diff --git a/.eval_results/wildclawbench.yaml b/.eval_results/wildclawbench.yaml
new file mode 100644
index 0000000000000000000000000000000000000000..d2a436daf675159d5669545c6d6e2bccb0a6a9f4
--- /dev/null
+++ b/.eval_results/wildclawbench.yaml
@@ -0,0 +1,9 @@
+- dataset:
+ id: internlm/WildClawBench
+ task_id: overall
+ value: 53.5
+ date: "2026-05-22"
+ source:
+ url: https://internlm.github.io/WildClawBench
+ name: WildClawBench
+ user: internlm
\ No newline at end of file
diff --git a/.gitattributes b/.gitattributes
new file mode 100644
index 0000000000000000000000000000000000000000..267f26f30a6b89e92de6c0d7d27ccaf881c224fe
--- /dev/null
+++ b/.gitattributes
@@ -0,0 +1,37 @@
+*.7z filter=lfs diff=lfs merge=lfs -text
+*.arrow filter=lfs diff=lfs merge=lfs -text
+*.bin filter=lfs diff=lfs merge=lfs -text
+*.bz2 filter=lfs diff=lfs merge=lfs -text
+*.ckpt filter=lfs diff=lfs merge=lfs -text
+*.ftz filter=lfs diff=lfs merge=lfs -text
+*.gz filter=lfs diff=lfs merge=lfs -text
+*.h5 filter=lfs diff=lfs merge=lfs -text
+*.joblib filter=lfs diff=lfs merge=lfs -text
+*.lfs.* filter=lfs diff=lfs merge=lfs -text
+*.mlmodel filter=lfs diff=lfs merge=lfs -text
+*.model filter=lfs diff=lfs merge=lfs -text
+*.msgpack filter=lfs diff=lfs merge=lfs -text
+*.npy filter=lfs diff=lfs merge=lfs -text
+*.npz filter=lfs diff=lfs merge=lfs -text
+*.onnx filter=lfs diff=lfs merge=lfs -text
+*.ot filter=lfs diff=lfs merge=lfs -text
+*.parquet filter=lfs diff=lfs merge=lfs -text
+*.pb filter=lfs diff=lfs merge=lfs -text
+*.pickle filter=lfs diff=lfs merge=lfs -text
+*.pkl filter=lfs diff=lfs merge=lfs -text
+*.pt filter=lfs diff=lfs merge=lfs -text
+*.pth filter=lfs diff=lfs merge=lfs -text
+*.rar filter=lfs diff=lfs merge=lfs -text
+*.safetensors filter=lfs diff=lfs merge=lfs -text
+saved_model/**/* filter=lfs diff=lfs merge=lfs -text
+*.tar.* filter=lfs diff=lfs merge=lfs -text
+*.tar filter=lfs diff=lfs merge=lfs -text
+*.tflite filter=lfs diff=lfs merge=lfs -text
+*.tgz filter=lfs diff=lfs merge=lfs -text
+*.wasm filter=lfs diff=lfs merge=lfs -text
+*.xz filter=lfs diff=lfs merge=lfs -text
+*.zip filter=lfs diff=lfs merge=lfs -text
+*.zst filter=lfs diff=lfs merge=lfs -text
+*tfevents* filter=lfs diff=lfs merge=lfs -text
+tokenizer.json filter=lfs diff=lfs merge=lfs -text
+figures/Nex-N2-Benchmark-white.png filter=lfs diff=lfs merge=lfs -text
diff --git a/README.md b/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..9ab81189a8a3e9b80f4ed858daee2439c0e28433
--- /dev/null
+++ b/README.md
@@ -0,0 +1,191 @@
+---
+license: apache-2.0
+pipeline_tag: text-generation
+library_name: transformers
+---
+
+
+

+
+
+---
+
+
+
+# Nex-N2
+
+**An agentic model with Agentic Thinking.**
+
+Today, we are officially releasing and open-sourcing our next-generation model, **Nex-N2** — an agent model built for real-world productivity scenarios. With first-tier coding and agentic capabilities, Nex-N2 keeps driving complex, long-horizon tasks forward in real environments to deliver stable, end-to-end results.
+
+Over the past year, a paradigm shift led by Vibe Coding and Harness Engineering has been redefining the limits of LLM agents. From dialogue, to reasoning, to agents that execute long-horizon tasks with environmental feedback, the tasks models must handle keep growing harder, the contexts longer, and the environments more realistic. The core of next-generation model competition is no longer *whether a model can think*, but whether it can reliably and efficiently turn thinking into actions that are executable, verifiable, and iterable.
+
+Rather than treating reasoning, tool use, and environment execution as separate capabilities, Nex-N2 unifies them through an **Agentic Thinking** framework that connects requirement understanding, task planning, code implementation, environmental feedback, evaluation and debugging, and continuous iteration into a single closed loop. The framework has two parts:
+
+- **Adaptive Thinking** lets the model decide on its own when to think and how deeply — executing simple actions quickly while reasoning thoroughly on critical decisions.
+- **Coherent Thinking** carries one consistent reasoning paradigm across general reasoning and diverse agentic tasks, staying consistent across tasks and modalities to enable stable capability transfer.
+
+Across real agentic workflows — agentic coding, deep research, tool calling, and terminal execution — Nex-N2 reaches first-tier performance, with substantial gains over the previous-generation Nex-N1 on multiple authoritative benchmarks. In real productivity scenarios such as OpenClaw one-person-company workflows, end-to-end game development, and web and multimodal generation, it likewise demonstrates outstanding usability, robustness, and stability.
+
+## Open Source
+
+In keeping with our commitment to open source, we are releasing both **Nex-N2-Pro** and **Nex-N2-mini** as open-source models starting today.
+
+- **Nex-N2-Pro:** [Hugging Face](https://huggingface.co/nex-agi/Nex-N2-Pro) | [ModelScope](https://www.modelscope.cn/models/nex-agi/Nex-N2-Pro)
+- **Nex-N2-mini:** [Hugging Face](https://huggingface.co/nex-agi/Nex-N2-mini) | [ModelScope](https://www.modelscope.cn/models/nex-agi/Nex-N2-mini)
+- **Early Access:** [SiliconFlow](https://cloud.siliconflow.cn/me/models?target=nex-agi%2FNex-N2-Pro)
+
+We welcome developers and enterprises to integrate and try Nex-N2 and share their feedback.
+
+## Performance
+
+We evaluate Nex-N2 in real agentic workflows along three directions — agentic tasks, coding tasks, and general tasks — covering benchmarks across tool calling, search-based decision-making, software engineering, and terminal execution. Nex-N2-Pro delivers strong performance that keeps pace with top-tier models such as GPT-5.5 and Opus 4.7: it excels at coding (e.g., 75.3 on Terminal-Bench 2.1) and long-horizon tasks (1585 on GDPval), and shows especially strong generalization and competitiveness on newer benchmarks like SWE-Atlas and DeepSWE. On general capability and core reasoning, it stands on par with leading frontier models.
+
+
+
+Nex-N2 ships in two variants, both post-trained on the Qwen3.5 series: **Nex-N2-Pro** (built on `Qwen3.5-397B-A17B`) and **Nex-N2-mini** (built on `Qwen3.5-35B-A3B-Base`), covering different latency and quality trade-offs. The table below reports their scores alongside leading proprietary and open models across our full evaluation suite.
+
+| Benchmark | **Nex-N2-mini** | **Nex-N2-Pro** | GPT-5.5 | Opus 4.7 | Kimi-K2.6 | GLM-5.1 | MiniMax M3 | DeepSeek-V4-Pro |
+| --- | --- | --- | --- | --- | --- | --- | --- | --- |
+| **Agent** | | | | | | | | |
+| BrowseComp | 74.1 | 83.7 | 84.4 | 79.8 | 83.2 | 79.3 | 83.5 | 83.4 |
+| GDPval | 1402 | 1585 | 1769 | 1753 | 1481 | 1535 | - | 1554 |
+| Toolathlon | 33.3 | 51.9 | 55.6 | 52.8 | 50.0 | 40.7 | - | 51.8 |
+| WildClawBench | 47.7 | 53.5 | 58.2 | 62.2 | - | 48.2 | - | 43.7 |
+| WideSearch | 62.0 | 75.6 | - | - | 80.8 | - | - | - |
+| TAU3 | 65.9 | 71.1 | - | - | - | 70.6 | - | - |
+| **Coding & SWE** | | | | | | | | |
+| SWE-Bench Pro | 50.2 | 58.8 | 58.6 | 64.3 | 58.6 | 58.4 | 59.0 | 55.4 |
+| Terminal-Bench 2.1 | 60.7 | 75.3 | 83.4 | 69.7 | - | 58.7 | 66.0 | 72.0 |
+| DeepSWE | 8.0 | 33.6 | 70 | 54 | 24 | 18 | - | 8 |
+| SWE-Bench Verified | 74.4 | 80.8 | 82.9 | 87.6 | 80.2 | - | 80.5 | 80.6 |
+| SWE Atlas QnA | 31.5 | 37.9 | 45.4 | 45.2 | - | - | 37.9 | - |
+| SWE Atlas RF | 30.0 | 32.9 | 44.8 | 48.6 | - | - | - | - |
+| SWE Atlas TW | 23.3 | 40.0 | 42.6 | 38.2 | - | - | 30.8 | - |
+| **General & Reasoning** | | | | | | | | |
+| GPQA Diamond | 82.6 | 90.7 | 93.6 | 94.2 | 90.5 | 86.2 | - | 90.1 |
+| IFEval | 89.1 | 94.0 | - | - | 94.5 | 94.5 | - | 91.9 |
+| Apex | 9.4 | 36.5 | - | - | 24.0 | 11.5 | - | 38.3 |
+
+## Usage
+
+### Local Deployment
+
+> **Note:** For the best performance with Nex-series models, we recommend serving them with our customized `sglang` fork.
+
+First, install our `sglang` fork:
+
+```bash
+# Use the customized `sglang` fork
+git clone https://github.com/nex-agi/sglang.git
+cd sglang
+
+# Install the python packages
+pip install --upgrade pip
+pip install -e "python"
+```
+
+#### Nex-N2-Pro
+
+Launch the server (example on two 8× H100 servers with CUDA 13.0):
+
+```bash
+# Multi-node (2 nodes). Run the same command on every node with:
+# = 0 on the head node, 1 on the other node
+# = IP of the head node (reachable from all others)
+python -m sglang.launch_server \
+ --model-path /path/to/your/model \
+ --tp 16 \
+ --nnodes 2 \
+ --node-rank \
+ --dist-init-addr :20000 \
+ --reasoning-parser qwen3 \
+ --tool-call-parser qwen3_coder \
+ --mamba-scheduler-strategy extra_buffer
+```
+
+#### Nex-N2-mini
+
+Launch the server (example on one 2× H100 server with CUDA 13.0):
+
+```bash
+python -m sglang.launch_server \
+ --model-path /path/to/your/model \
+ --tp 2 \
+ --reasoning-parser qwen3 \
+ --tool-call-parser qwen3_coder \
+ --mamba-scheduler-strategy extra_buffer
+```
+
+### Docker Deployment
+
+We also provide a prebuilt Docker image with our customized `sglang` fork preinstalled: **`nexagi/sglang:v0.5.12`**. The launch command is the same as above.
+
+#### Nex-N2-Pro
+
+```bash
+# Multi-node (2 nodes). Run the same command on every node with:
+# = 0 on the head node, 1 on the other node
+# = IP of the head node (reachable from all others)
+docker run --gpus all --shm-size 32g --network host \
+ -v /path/to/your/model:/model \
+ nexagi/sglang:v0.5.12 \
+ python3 -m sglang.launch_server \
+ --model-path /model \
+ --tp 16 \
+ --nnodes 2 \
+ --node-rank \
+ --dist-init-addr :20000 \
+ --host 0.0.0.0 --port 30000 \
+ --reasoning-parser qwen3 \
+ --tool-call-parser qwen3_coder \
+ --mamba-scheduler-strategy extra_buffer
+```
+
+#### Nex-N2-mini
+
+Single node with 2× H100:
+
+```bash
+docker run --gpus all --shm-size 32g --ipc=host \
+ -p 30000:30000 \
+ -v /path/to/your/model:/model \
+ nexagi/sglang:v0.5.12 \
+ python3 -m sglang.launch_server \
+ --model-path /model \
+ --tp 2 \
+ --host 0.0.0.0 --port 30000 \
+ --reasoning-parser qwen3 \
+ --tool-call-parser qwen3_coder \
+ --mamba-scheduler-strategy extra_buffer
+```
+
+### Recommended Sampling Parameters
+
+For the best generation quality, we recommend the following sampling parameters:
+
+- `temperature`: 0.7
+- `top_p`: 0.95
+- `top_k`: 40
+
+### Function Calling
+
+Nex-series models support robust function-calling capabilities. To enable function calling, add the `--tool-call-parser qwen3_coder` flag when launching the server:
+
+```bash
+python -m sglang.launch_server --model-path /path/to/your/model --tool-call-parser qwen3_coder
+```
+
+### Reasoning Parser
+
+Nex-series models emit explicit reasoning traces. Add the `--reasoning-parser qwen3` flag to parse the reasoning content separately from the final response. It can be combined with the function-calling parser above:
+
+```bash
+python -m sglang.launch_server --model-path /path/to/your/model --tool-call-parser qwen3_coder --reasoning-parser qwen3
+```
diff --git a/chat_template.jinja b/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..fa6e277226175ea9373a9bb9da91418ce5005539
--- /dev/null
+++ b/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if reasoning_content %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/config.json b/config.json
new file mode 100644
index 0000000000000000000000000000000000000000..9ac001fffca37672df5c90305d5f648cc1c0588d
--- /dev/null
+++ b/config.json
@@ -0,0 +1,143 @@
+{
+ "architectures": [
+ "Qwen3_5MoeForConditionalGeneration"
+ ],
+ "dtype": "bfloat16",
+ "hidden_size": 4096,
+ "image_token_id": 248056,
+ "model_type": "qwen3_5_moe",
+ "text_config": {
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "attn_output_gate": true,
+ "bos_token_id": null,
+ "dtype": "bfloat16",
+ "eos_token_id": 248044,
+ "full_attention_interval": 4,
+ "head_dim": 256,
+ "hidden_act": "silu",
+ "hidden_size": 4096,
+ "initializer_range": 0.02,
+ "layer_types": [
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention"
+ ],
+ "linear_conv_kernel_dim": 4,
+ "linear_key_head_dim": 128,
+ "linear_num_key_heads": 16,
+ "linear_num_value_heads": 64,
+ "linear_value_head_dim": 128,
+ "mamba_ssm_dtype": "float32",
+ "max_position_embeddings": 262144,
+ "mlp_only_layers": [],
+ "model_type": "qwen3_5_moe_text",
+ "moe_intermediate_size": 1024,
+ "mtp_num_hidden_layers": 1,
+ "mtp_use_dedicated_embeddings": false,
+ "num_attention_heads": 32,
+ "num_experts": 512,
+ "num_experts_per_tok": 10,
+ "num_hidden_layers": 60,
+ "num_key_value_heads": 2,
+ "output_router_logits": false,
+ "pad_token_id": null,
+ "partial_rotary_factor": 0.25,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "mrope_interleaved": true,
+ "mrope_section": [
+ 11,
+ 11,
+ 10
+ ],
+ "partial_rotary_factor": 0.25,
+ "rope_theta": 10000000,
+ "rope_type": "default"
+ },
+ "router_aux_loss_coef": 0.001,
+ "shared_expert_intermediate_size": 1024,
+ "tie_word_embeddings": false,
+ "use_cache": true,
+ "vocab_size": 248320
+ },
+ "tie_word_embeddings": false,
+ "transformers_version": "5.2.0",
+ "video_token_id": 248057,
+ "vision_config": {
+ "deepstack_visual_indexes": [],
+ "depth": 27,
+ "dtype": "bfloat16",
+ "hidden_act": "gelu_pytorch_tanh",
+ "hidden_size": 1152,
+ "in_channels": 3,
+ "initializer_range": 0.02,
+ "intermediate_size": 4304,
+ "model_type": "qwen3_5_moe",
+ "num_heads": 16,
+ "num_position_embeddings": 2304,
+ "out_hidden_size": 4096,
+ "patch_size": 16,
+ "spatial_merge_size": 2,
+ "temporal_patch_size": 2
+ },
+ "vision_end_token_id": 248054,
+ "vision_start_token_id": 248053
+}
diff --git a/figures/NEX_logo.svg b/figures/NEX_logo.svg
new file mode 100644
index 0000000000000000000000000000000000000000..a6bb9337e66d6976e3816377741ee33dfb399f2b
--- /dev/null
+++ b/figures/NEX_logo.svg
@@ -0,0 +1,7 @@
+
diff --git a/figures/Nex-N2-Benchmark-white.png b/figures/Nex-N2-Benchmark-white.png
new file mode 100644
index 0000000000000000000000000000000000000000..edaab6dbc5ce3e26cd6332b048cd9e4ff5d091cb
--- /dev/null
+++ b/figures/Nex-N2-Benchmark-white.png
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:3fba33987e529cc9fffe491128389f7c162bab9b6cc0199cdab60c3c349a0a93
+size 589852
diff --git a/model-00001-of-00122.safetensors b/model-00001-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..cf7121a8d1a4474ed7c150a548d44851c6bc1d97
--- /dev/null
+++ b/model-00001-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:d9c6b016494d82f42e57f5c28d9ddffd5af8c81cf26c977dd36bdd864bda91ef
+size 3211703200
diff --git a/model-00002-of-00122.safetensors b/model-00002-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..838bccba7740d895a841206dc5547385ec4bb04b
--- /dev/null
+++ b/model-00002-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:39755f3246369adf0d8e253c3954e2b12da3bba655cdbc95b6c140ffcf385025
+size 8589934736
diff --git a/model-00003-of-00122.safetensors b/model-00003-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..a9fe6e8f8bf4b31a5b6c6d1caafe128616d7e4de
--- /dev/null
+++ b/model-00003-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:0f9a4df1d8d7a0900d76f31bdb1cd73a8eeee831777d452f50561daa394cb0e8
+size 4560382680
diff --git a/model-00004-of-00122.safetensors b/model-00004-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..487a1ed86d37c270870af9499eef59e3bb022841
--- /dev/null
+++ b/model-00004-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:87299367bd7fa2917179e1af18058234d9101419789e3e71cfc463d348ac1db9
+size 8589934736
diff --git a/model-00005-of-00122.safetensors b/model-00005-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..4473cd82da5de5989feb8f0819a9179decf37277
--- /dev/null
+++ b/model-00005-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:1550371623ae1753a6d080bbab426c2e0a67cf1031f32913f4a04efb4f268c24
+size 4560382680
diff --git a/model-00006-of-00122.safetensors b/model-00006-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..0835d694fc717c182477e3f2b6f67bb0546f5832
--- /dev/null
+++ b/model-00006-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:8e04efc7481e5342b28c093ce0ef0077e25b3b24da0e5fb4ca9a310c660bf057
+size 8589934736
diff --git a/model-00007-of-00122.safetensors b/model-00007-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..c2d23ad9e1993f88cd8d51d22a84f8406dbfdbf7
--- /dev/null
+++ b/model-00007-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:773cfa0af38128557108749b91ee961f497be20ce113fc1115e182d10398a22f
+size 4534070088
diff --git a/model-00008-of-00122.safetensors b/model-00008-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..4898b79d549b43abc9619ead46d8b29816359a11
--- /dev/null
+++ b/model-00008-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:4e1ced164923558b72a80b72a9b8baab5f5cde777130578c4b8b0e9e4e9e0a44
+size 8589934736
diff --git a/model-00009-of-00122.safetensors b/model-00009-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..b965d2986ba6375cd3e0c955a70ea7d2748697fd
--- /dev/null
+++ b/model-00009-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:c9e9ac0530ca9ee24088094ad1f2ed4b51a4b4f305703606dca2c93772572593
+size 4560382680
diff --git a/model-00010-of-00122.safetensors b/model-00010-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..b7138736a3c60baec3794467766ced02a6ec3f2d
--- /dev/null
+++ b/model-00010-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:20a32c4b0d3c1bf2dd36cfe5fd23a290a56e076b9bddcd8ed1bf0512f1731ad2
+size 8589934736
diff --git a/model-00011-of-00122.safetensors b/model-00011-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..53eeb58f2eb088f5b230eb766cf82a512487739e
--- /dev/null
+++ b/model-00011-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:7fdf5a5f564003852482c2dd805f71c4cd0148a2863fc061c35b92ae2f874ee3
+size 4560382680
diff --git a/model-00012-of-00122.safetensors b/model-00012-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..6f405fc313d298ae4d21a153292421f0016aa8d6
--- /dev/null
+++ b/model-00012-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:c806c8ddb98ffbf1574ce658f335948e189da93a0d47059c7e71022675d660c2
+size 8589934736
diff --git a/model-00013-of-00122.safetensors b/model-00013-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..f568da0d4234d0c5dcad056cb6b09c02a27d88ff
--- /dev/null
+++ b/model-00013-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:fb65d906542b45eedbb0f796db57be4cb071930efa8d7c57966ecce8112ba6a3
+size 4560382680
diff --git a/model-00014-of-00122.safetensors b/model-00014-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..f16723c24df79a39732d35c74dc2485add17cfa8
--- /dev/null
+++ b/model-00014-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:c276f507d63b241a46805566c08fede804c4408252655b41908a782df5625027
+size 8589934736
diff --git a/model-00015-of-00122.safetensors b/model-00015-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..3e38fbad493134100002788bf7775f1219f9aa1d
--- /dev/null
+++ b/model-00015-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:832c42d23c4d03acc69a46ded7c206750a70afc2ba0935ce80a3d7e9fbbaf7fe
+size 4534070088
diff --git a/model-00016-of-00122.safetensors b/model-00016-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..d10667f4b5a11cb5f905ff360c72beb604f7df8c
--- /dev/null
+++ b/model-00016-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:52c33531f26055a4ca69da5070379f3bd4b7e8f4daabec0ca00e26764f239517
+size 8589934736
diff --git a/model-00017-of-00122.safetensors b/model-00017-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..0f27564df779c8a11596b8adf736cc4c8fefda64
--- /dev/null
+++ b/model-00017-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:c264e1214dd10553d6524ba8d93d9086816651c604b0edbbfd42cef0b6b796c9
+size 4560382680
diff --git a/model-00018-of-00122.safetensors b/model-00018-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..271c6d546fc6a54c8570fdb8a8c8e5c7134b8b19
--- /dev/null
+++ b/model-00018-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:81c4bd4d0a85bd48c678e7cd1ba86ebbbe427a842f4e99635c0d166a9764dcde
+size 8589934736
diff --git a/model-00019-of-00122.safetensors b/model-00019-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..93016dd7970145f8b9d06354b0335f24bd41db41
--- /dev/null
+++ b/model-00019-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:fcbb2b7bb39a810fae67c53ad84a9f4e4f8fae482bd509a23a36f37c5f72107b
+size 4560382680
diff --git a/model-00020-of-00122.safetensors b/model-00020-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..12cab1e01886242385b0969636dc179c0d182bc1
--- /dev/null
+++ b/model-00020-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:b9bd28a2b254d44f725d2f544011c1f9325441419c06f92b75f7346fa12d2a0f
+size 8589934736
diff --git a/model-00021-of-00122.safetensors b/model-00021-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..0e0e025e03942cd22154e11081e73304ae7b1feb
--- /dev/null
+++ b/model-00021-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:2c1ac48ba53225932cf34b9d40b41b9b8342ad2ee9aae9bce91ae9aeb93c9765
+size 4560382624
diff --git a/model-00022-of-00122.safetensors b/model-00022-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..13564e4fcb47fd6861f4202a7548d0e7c33dddb1
--- /dev/null
+++ b/model-00022-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:3f09d8da0e8338adcbe74c86a0bc13740f55e68574a6687ac495af86f97b3657
+size 8589934736
diff --git a/model-00023-of-00122.safetensors b/model-00023-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..4f3ca28dc2a7b3e93340ef85ddfda722810e086d
--- /dev/null
+++ b/model-00023-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:2e0e2ad64c866dc1c6cbf6220d05a058582b5994c7cde402ecd26dada7f06672
+size 4534070104
diff --git a/model-00024-of-00122.safetensors b/model-00024-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..3969053b234b4b810e51fdd5daccdbe10f0e7ae2
--- /dev/null
+++ b/model-00024-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:67e45fe71206ccb6f335f54fe0e331517678475744d787840a2b069d0a85f822
+size 8589934736
diff --git a/model-00025-of-00122.safetensors b/model-00025-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..3d79407d3766c9449d05897b9fff135ad7ae29fe
--- /dev/null
+++ b/model-00025-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:8b741f4f99015e6692304c054fd2d0ba6933d8366662504b836fc935c5f3f502
+size 4560382696
diff --git a/model-00026-of-00122.safetensors b/model-00026-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..456dff697a08e051c38dc9d129f33fe6102dfdf2
--- /dev/null
+++ b/model-00026-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:0684065b05b6d21a3d905deb793da18c29be8ddb0139eaa63d39c28ee0ad638f
+size 8589934736
diff --git a/model-00027-of-00122.safetensors b/model-00027-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..72612ade9ae358c4e266e1cdf423f19ecf5d2a45
--- /dev/null
+++ b/model-00027-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ad8259eff54d6184549549b00adfb6708a20c9bc05db698d9375405cc0fa2d08
+size 4560382696
diff --git a/model-00028-of-00122.safetensors b/model-00028-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..d503f56a4570226e7d220bf9686486454f2efa2c
--- /dev/null
+++ b/model-00028-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:69675e113b50a831697e5d1c7343511b398027843598915eabc634cb8ed38acc
+size 8589934736
diff --git a/model-00029-of-00122.safetensors b/model-00029-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..9b0dfd241e48b3c2f1a61ef6c761f77ce8378a68
--- /dev/null
+++ b/model-00029-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:4c0ba63b2e81197304620dd80b8867dd23da64420f2aa2c1871d660e0cebc812
+size 4560382696
diff --git a/model-00030-of-00122.safetensors b/model-00030-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..178e828fcd0439e79599710d8e385b874f037766
--- /dev/null
+++ b/model-00030-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:d9c187ca41082b743d71d0a9e0ea5cc9ebf00a5b87a28c48177bad1b8ec5f8a8
+size 8589934736
diff --git a/model-00031-of-00122.safetensors b/model-00031-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..3a434173e11bbd1c27c1e51765ea516ac0cae8f0
--- /dev/null
+++ b/model-00031-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:c59a133f05d8e9adbf5c70190a1eda883f98097b5596e7a2dea41dedadc17d0e
+size 4534070104
diff --git a/model-00032-of-00122.safetensors b/model-00032-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..b394b96a0ba66146ddd01b43557e2d5091f65c28
--- /dev/null
+++ b/model-00032-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:822c9d521ef7552ee3f1f4cadbc96f5d9fb127920ed5ffc0f61f2a2e3327ae5a
+size 8589934736
diff --git a/model-00033-of-00122.safetensors b/model-00033-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..688f49005c33a4c56285835543042f16923d8b85
--- /dev/null
+++ b/model-00033-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:71ecae56174f3c7dce1f56fe05c7d8ad0f361d50c4d6fdaf536ddc49219f6415
+size 4560382696
diff --git a/model-00034-of-00122.safetensors b/model-00034-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..0133bf9c45c8b48d42668638d405f3613208610d
--- /dev/null
+++ b/model-00034-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:94b12f986c694bd930e46c5db9daf8824147dfa5cddc54237212a0cc7afaa226
+size 8589934736
diff --git a/model-00035-of-00122.safetensors b/model-00035-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..bfe5155fefa7d7700af88f97ea97018c00471384
--- /dev/null
+++ b/model-00035-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:62c8d6a342c084bbe6b322f85dc8b0068d145b825c66d8a9b45bd735dfa90bb2
+size 4560382696
diff --git a/model-00036-of-00122.safetensors b/model-00036-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..8116f1368bda59d8c8c5df3b5db1e21cc9927a91
--- /dev/null
+++ b/model-00036-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:03fca81caf611a9bdc19acba34b594e5f4893f820a3d13e4d136ba66fd858e95
+size 8589934736
diff --git a/model-00037-of-00122.safetensors b/model-00037-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..7b08fdddf2d9e055f7f4b0661239d2ff601a337e
--- /dev/null
+++ b/model-00037-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:904e9b94e0a3199932e43fa5b28dbe7ee01785ff9e354b15129a0ddc5db85c9e
+size 4560382696
diff --git a/model-00038-of-00122.safetensors b/model-00038-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..bc98aed82ea6a0ee23877e75ebd753418db85399
--- /dev/null
+++ b/model-00038-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:6c2ffcd57a045e7d680629481c9d8e70a444e18b9a440efed48a80dc01ed6d51
+size 8589934736
diff --git a/model-00039-of-00122.safetensors b/model-00039-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..51f45ac2e7d6f8aa309636d8b8ec40a80e938fa4
--- /dev/null
+++ b/model-00039-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:5d4d970b2ddad62e5a13dd453e22366c4839eff5252da864e7dd15a29fa3c2b3
+size 4534070104
diff --git a/model-00040-of-00122.safetensors b/model-00040-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..56720fc9c8474a8b5c5c2ff9e4e71a263fd0847e
--- /dev/null
+++ b/model-00040-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:f4b019b26dfb32f3e56ff0188aa2643cb349169ee96b405d6d744624abf9059e
+size 8589934736
diff --git a/model-00041-of-00122.safetensors b/model-00041-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..dd13d0591d2f0f58f98ea60fa9ef32608812dddc
--- /dev/null
+++ b/model-00041-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:95f7bc9dceea0763bed6fb11cf3b05fecf6538d771cc26e170217d8894110da2
+size 4560382696
diff --git a/model-00042-of-00122.safetensors b/model-00042-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..c53e4ea57d563cbe9f70f4f375cffe2f3a0915e3
--- /dev/null
+++ b/model-00042-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ab2d54cbff0deec4cefa4a4dd35ff3bc7969077348a35961fc903427693fd78b
+size 8589934736
diff --git a/model-00043-of-00122.safetensors b/model-00043-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..3dcd651c7bbb4c7f473f3e9d744879c859beb53b
--- /dev/null
+++ b/model-00043-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:c98687161e665d6c84997bcfc76bb458e91247aa8bfd80894b1ebc39708f8793
+size 4560382696
diff --git a/model-00044-of-00122.safetensors b/model-00044-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..6b6b0ee82cc33a8256b896d8d77edc26cb1872c1
--- /dev/null
+++ b/model-00044-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:fdb82a56042540faffe7c9e75345754b65d5f0cccd4b7749e7788230aa2798fe
+size 8589934736
diff --git a/model-00045-of-00122.safetensors b/model-00045-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..5c4eb548eddbafcedef71ac280741b407f47941e
--- /dev/null
+++ b/model-00045-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:7fc631273ca3f9e1dd93739ca397b11fcf39b2f5cbfff41165d29370c44b6fb4
+size 4560382696
diff --git a/model-00046-of-00122.safetensors b/model-00046-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..b25b2a364da0692bed3a9da6e82b7e9b23f76a03
--- /dev/null
+++ b/model-00046-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:a4ba7e7a354ed8de1521d68ad50dad92eac524ea1c7eba35ec96963b03ca08e1
+size 8589934736
diff --git a/model-00047-of-00122.safetensors b/model-00047-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..6a1acad931bb66feb63fca09a3cc50e80e25019b
--- /dev/null
+++ b/model-00047-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:b4fe54f368199c986ba1eecce072ca2937d75571992305909ca23f72d978a667
+size 4534070104
diff --git a/model-00048-of-00122.safetensors b/model-00048-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..6300cf4fba842fa97aae8f984ab63a4997282beb
--- /dev/null
+++ b/model-00048-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:265a324ce0b454dd4ff552536b945bde8c49782955ef940a083cb446edd75a28
+size 8589934736
diff --git a/model-00049-of-00122.safetensors b/model-00049-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..a5ad8e569211151f8a597633a300f86fdb70061b
--- /dev/null
+++ b/model-00049-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:4654cc5b6ba41067e08c520dec26058be070c8549458aa16b51bf7274d53c5f2
+size 4560382696
diff --git a/model-00050-of-00122.safetensors b/model-00050-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..2074f1f337b6dfaabd630cd95583a8ee97d763e2
--- /dev/null
+++ b/model-00050-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:9038f6c1f501fb652c09fa4d89ef031a03e2b92eadb9ef6db3c0ef2cbefb65ed
+size 8589934736
diff --git a/model-00051-of-00122.safetensors b/model-00051-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..856ddfca66b05df29dfe8bcfc97f3ca95885299f
--- /dev/null
+++ b/model-00051-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:0a2c672f15b18c544b02e388d46e0820bb33a60240adb8a9a3a58d2053c3885b
+size 4560382696
diff --git a/model-00052-of-00122.safetensors b/model-00052-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..e11a1bb02335c47566e178366bb3ff3e9096ae6e
--- /dev/null
+++ b/model-00052-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:5dfc41110867f18ac9b3232577f8c0bfae1b8b9354047ba867350e17f1a89010
+size 8589934736
diff --git a/model-00053-of-00122.safetensors b/model-00053-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..ba2a642ec8774f7a37613479b27d55d1e1c604cd
--- /dev/null
+++ b/model-00053-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:78e0aa3a16e5f19501ea7712049a7e93b8446cd3b8c7477b2393867240505eda
+size 4560382696
diff --git a/model-00054-of-00122.safetensors b/model-00054-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..9725821fd4d57de2a5227db4486cf3d07abd843f
--- /dev/null
+++ b/model-00054-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:2aa372adfd3d9bf04c9f93c11f9aa5a902ad7a7e89c9862d8c003c9f81238950
+size 8589934736
diff --git a/model-00055-of-00122.safetensors b/model-00055-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..655c1a8188bae1e1955d8b67acb8138c03269b2f
--- /dev/null
+++ b/model-00055-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:54218882fe198282baf1249065d2af643da96de792674d516f5deb2361f66e97
+size 4534070104
diff --git a/model-00056-of-00122.safetensors b/model-00056-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..953a0583567e8072bd79875365e2e05a1be0d253
--- /dev/null
+++ b/model-00056-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:2d75e82b6488c59b973219cf4a22a7efdc2283f15def131e7dc94fa6959bad9c
+size 8589934736
diff --git a/model-00057-of-00122.safetensors b/model-00057-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..e41f2cc7cfa9acdb9969f3c0ab96b195537193d1
--- /dev/null
+++ b/model-00057-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:68b18f6a33ac8b64a7fb64735ba3f301b8ebea16e40e0e611a9c2a7ffed1624a
+size 4560382696
diff --git a/model-00058-of-00122.safetensors b/model-00058-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..3c372b886eac4adab3067f56a121644e512f3ad3
--- /dev/null
+++ b/model-00058-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:15901b8959c3ab9e996276b3cc72cd7a1b93ddc268fbfba1d2013e516812c2e4
+size 8589934736
diff --git a/model-00059-of-00122.safetensors b/model-00059-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..e7045c15535442afe004a79be828b2667c1d87ed
--- /dev/null
+++ b/model-00059-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:259080c561d563ec7b6828b40a92df8b1219cabcc700331d2f03e8e965913047
+size 4560382696
diff --git a/model-00060-of-00122.safetensors b/model-00060-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..406193194bf1b0b30ed256d85ec3a136a76e3643
--- /dev/null
+++ b/model-00060-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:40cf83ed518da1663ebd7596a714abdbe48bc3353ed95635db1f78478c07e1d4
+size 8589934736
diff --git a/model-00061-of-00122.safetensors b/model-00061-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..07261535912b0875daa65ca6cffdcf6004dbf826
--- /dev/null
+++ b/model-00061-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:3ef8102b9173839f4f155f66fe1d4f2b1deb84532b4928f35edfbfa2114f429e
+size 4560382696
diff --git a/model-00062-of-00122.safetensors b/model-00062-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..9602f156f795156173b9b6c48c12e56f165adbdd
--- /dev/null
+++ b/model-00062-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:4c2fcec62f166edc784e74f6f06da7c84f87b982c850a7a989118ec9cdcb63d9
+size 8589934736
diff --git a/model-00063-of-00122.safetensors b/model-00063-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..1ad0994609b684b1c18cdee9eda6bdc40af0dcf6
--- /dev/null
+++ b/model-00063-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:021fb94eecb4809b2530015fb626175ceb3a7f1459c759b9f7c41d4eeac860a0
+size 4534070104
diff --git a/model-00064-of-00122.safetensors b/model-00064-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..e08b121c7149348b5a6844ef0f562f19d43b4e7b
--- /dev/null
+++ b/model-00064-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:cb9ab1c6ab6170393e095b5be8f462430bba54ace42cd46d8014a7479c29cb48
+size 8589934736
diff --git a/model-00065-of-00122.safetensors b/model-00065-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..edf87a989e3c930ff25b8610dea1dd20312fff31
--- /dev/null
+++ b/model-00065-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:9a4ea84c2da8a3b8ffed3e053013c19d89d4e8a1230ebf10149179007aad01d6
+size 4560382696
diff --git a/model-00066-of-00122.safetensors b/model-00066-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..d95b92837dafb97542ebcb955dad6e541f641600
--- /dev/null
+++ b/model-00066-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:e154396bf53a852c2fea54c2d7b34f4ff5b64b58b22878ba7b7bd333ed044d52
+size 8589934736
diff --git a/model-00067-of-00122.safetensors b/model-00067-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..9fd06c84ba9bd5e56c3354725b268df7b51c5cac
--- /dev/null
+++ b/model-00067-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:224311110f7697094d4e21cf9288388b272db3e4639664d24ad2aae4afb3da53
+size 4560382696
diff --git a/model-00068-of-00122.safetensors b/model-00068-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..b8483bc2eaf5a11d0fc6c1ec25a20a6f8978f666
--- /dev/null
+++ b/model-00068-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:803fa29d4d0ad36b31ecc267ee9383f135fa5453e84f9fcc2add28752451b0a4
+size 8589934736
diff --git a/model-00069-of-00122.safetensors b/model-00069-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..c4867c876315fe31cc497ae84cd3995c4edab589
--- /dev/null
+++ b/model-00069-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:57261653b487be2fd6b0ee12008d73b53abb6db241d1934dae3b2b1164cf190e
+size 4560382696
diff --git a/model-00070-of-00122.safetensors b/model-00070-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..69b6fe36d7b03c5d3d503c0ecc40c407edce5f7a
--- /dev/null
+++ b/model-00070-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ce911bc0a8daf95997d979549c56f5b3807b89573a0e65b623add70f769e8833
+size 8589934736
diff --git a/model-00071-of-00122.safetensors b/model-00071-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..fa02d511cf2b7e7df13e907f672f0cfcd14527c1
--- /dev/null
+++ b/model-00071-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:d5d8b2090ad2d4596a8216af5ed2d4a96f96b32dfe9f9da6b8e0c51080eb8a9f
+size 4534070104
diff --git a/model-00072-of-00122.safetensors b/model-00072-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..beef3a66ced0ae5269335048580a4cf77d81ee09
--- /dev/null
+++ b/model-00072-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:8a9b2fa600977d1e7c54f164ef8cef3303497d424205d8ea2987e7e10c3a9ece
+size 8589934736
diff --git a/model-00073-of-00122.safetensors b/model-00073-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..20051e37997fa3dac746d657e8f93ac93d399d24
--- /dev/null
+++ b/model-00073-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:e98407709c01299e24fef344b96661ab2840eb16f0aca733e40d4645ca5abb9d
+size 4560382696
diff --git a/model-00074-of-00122.safetensors b/model-00074-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..1708d5fb1081c3c8bbf6e69e66d12921f0e4223a
--- /dev/null
+++ b/model-00074-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:444fc2a3ad73a22e7d433116f0e62288258b27f90a9311721178de92ec467ae1
+size 8589934736
diff --git a/model-00075-of-00122.safetensors b/model-00075-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..947076d93b70022d0ccfdc031bda345ceb779b0b
--- /dev/null
+++ b/model-00075-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:d044c30b084273532a285220e369e810186a83f2fe2e3f6726cb66e3447eefdb
+size 4560382696
diff --git a/model-00076-of-00122.safetensors b/model-00076-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..8dac99c5e03da7998d51b6f9b5e0bcb812781358
--- /dev/null
+++ b/model-00076-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:e715b93cc55d982fa3c27dddd40e9eecd890b29a851019022de589cdc0e1cf27
+size 8589934736
diff --git a/model-00077-of-00122.safetensors b/model-00077-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..ad53fd64ca39ef23a676bd078e7f044c03d4b1da
--- /dev/null
+++ b/model-00077-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:0f08fdc7209c0ef4f3fe4c0a3352c71f5bcdc7c40103e7194396561eecf4cff7
+size 4560382696
diff --git a/model-00078-of-00122.safetensors b/model-00078-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..0778a0bcb86c20f905864d7cd079616a0db6bb7d
--- /dev/null
+++ b/model-00078-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:9d6fba8694dd808e2de9851ef884b126fd0cb6c45cb16930878c39ce479a3cfa
+size 8589934736
diff --git a/model-00079-of-00122.safetensors b/model-00079-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..f453a3e261da81086cf610514723409274fe7673
--- /dev/null
+++ b/model-00079-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:11c2f68a8e7bef42f3e40e13bcae4d1629e5efeb829cfdeeaf937400d7516690
+size 4534070104
diff --git a/model-00080-of-00122.safetensors b/model-00080-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..7003d3504b596cf6ad71f44673ba8ff46a80e04f
--- /dev/null
+++ b/model-00080-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:adc8814ad5dcb07fb139c22d09f5bc75125303c170a3fe94f310d26abb8f1b29
+size 8589934736
diff --git a/model-00081-of-00122.safetensors b/model-00081-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..7570822dda025d651e6453dc426ab1f06d7ae2f5
--- /dev/null
+++ b/model-00081-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:4206626be0f2ee3a23d3fc24f26cd5126fb4f37408a7122852dd2524fca57a5a
+size 4560382696
diff --git a/model-00082-of-00122.safetensors b/model-00082-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..e603057eb3a8cf5ba8a5d8256d9597a988144a39
--- /dev/null
+++ b/model-00082-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:91ebd1e9e6d129e11f72c615f67b2978c26c025be9371c2db63d8ee766d98a4a
+size 8589934736
diff --git a/model-00083-of-00122.safetensors b/model-00083-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..e6877224750dfd902151244a3573100a08151994
--- /dev/null
+++ b/model-00083-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:09b68aec8d557b6e5f40c2a333b77a601695e3f1cd6f1a88811c3a8be185f791
+size 4560382696
diff --git a/model-00084-of-00122.safetensors b/model-00084-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..c40d1acc1b7383a7e24423308cbfcbf8854e4cb7
--- /dev/null
+++ b/model-00084-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:e28971de2e4cf864ef76af31aaf91c87fd53da2a206afecc656407d1707acf3f
+size 8589934736
diff --git a/model-00085-of-00122.safetensors b/model-00085-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..daf1071727763e6a540e621e05d61732c24458aa
--- /dev/null
+++ b/model-00085-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:0e2f32a44c5c605d92daed095a4138e577fe83765cea032c06ca6bcc96036d05
+size 4560382696
diff --git a/model-00086-of-00122.safetensors b/model-00086-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..a91fdb7da321443d1f8e95dd7e5b1d9a7b726247
--- /dev/null
+++ b/model-00086-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:bf93ed3b6a65143e0162e13ff0733711578f5e4e0ba530639ba452174312ae8b
+size 8589934736
diff --git a/model-00087-of-00122.safetensors b/model-00087-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..4035dd079f3ca9d8821b0d5c5e95062c0e81f757
--- /dev/null
+++ b/model-00087-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:262a3ef71560a3233b3ce67eb43d85e90da8a3b9f932d828684a6b9e263a5a70
+size 4534070104
diff --git a/model-00088-of-00122.safetensors b/model-00088-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..59f04f73c6255e3ac2c963d927bcfc7e0273c1da
--- /dev/null
+++ b/model-00088-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:01ace51ce36b7703d4e2e29e91c53911947c6e0c9bd6cab2f814c4c02517916e
+size 8589934736
diff --git a/model-00089-of-00122.safetensors b/model-00089-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..844711f0d1c642557e539cf8c19f8f6a7b5a537c
--- /dev/null
+++ b/model-00089-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:7e763b7bc133cd666a49c41d395f87e1d4240f1225f95426514772b11890c104
+size 4560382696
diff --git a/model-00090-of-00122.safetensors b/model-00090-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..975c9d90b742a3a407dbb077f9951f91331147ec
--- /dev/null
+++ b/model-00090-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:2133085caceda97be43965513f6712712be1a6ecf5e417c0d69d4d1ae8f2eb5c
+size 8589934736
diff --git a/model-00091-of-00122.safetensors b/model-00091-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..a12a99306ace3bc38c2c7aabd5281d3c06c4d34b
--- /dev/null
+++ b/model-00091-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:47dc2294299acd86c9a263484cbbd26040f1cbcf588b434f459824bf3911cefb
+size 4560382696
diff --git a/model-00092-of-00122.safetensors b/model-00092-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..06c7c4555e34948414cc15bf0bafeaf851324c99
--- /dev/null
+++ b/model-00092-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:926e4f6c949d6d08d265f46c1f1ebf3183feae0d87eb954e64c4d118ceccdcc3
+size 8589934736
diff --git a/model-00093-of-00122.safetensors b/model-00093-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..22887d3f6a8e356c5c1a9a8584b19e10464d5e85
--- /dev/null
+++ b/model-00093-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:079d2ea7458c88e99a16864de94c2ac96b4d2d36e34e9f8bf9b13e1c89983d57
+size 4560382696
diff --git a/model-00094-of-00122.safetensors b/model-00094-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..2301dd311641cceebe8e38516658daf81399542b
--- /dev/null
+++ b/model-00094-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:3f89363b228cbe06e2d95eb176b0235b3999aa2d3748993ea06b492befd37af7
+size 8589934736
diff --git a/model-00095-of-00122.safetensors b/model-00095-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..d2878e57c46be4c7195c5d9f9e8069bb47683143
--- /dev/null
+++ b/model-00095-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:846bfddf1a397be85dd2cb15806d8bf34221779aed1989d5592e09ada88bfc4e
+size 4534070104
diff --git a/model-00096-of-00122.safetensors b/model-00096-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..9b3ea91a35cbd43f1638de1703812d605255d02b
--- /dev/null
+++ b/model-00096-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:83384cadda52ed9184c622fe3dc226e91bef64a43de626f9a096f91dde380e1a
+size 8589934736
diff --git a/model-00097-of-00122.safetensors b/model-00097-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..f89a04b3f6e1bbab8272113265e797339f9f734a
--- /dev/null
+++ b/model-00097-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:03e037877ade47ed158e2a02e5b52163e6815bf74628f08991c6f21cfb8bd12a
+size 4560382696
diff --git a/model-00098-of-00122.safetensors b/model-00098-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..52f7e0398885cc211f2a0b73e796d73ff793ea37
--- /dev/null
+++ b/model-00098-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:6f032cba3820c49dd4e7210d058f948b2f8e98e68c40a9ec97e1149a84280c5f
+size 8589934736
diff --git a/model-00099-of-00122.safetensors b/model-00099-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..6fc8789bed710f71a9d90d9afe43eab9ba5d6aad
--- /dev/null
+++ b/model-00099-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:d9e87c6892764f64c93aac3d8f923e85b23213ed73bd8559cfe24d4d7a7037c8
+size 4560382696
diff --git a/model-00100-of-00122.safetensors b/model-00100-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..376ebc115c86fea3298c6857677a9c1f7b8ac2ed
--- /dev/null
+++ b/model-00100-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:c596dfa8e3267717cda36f8033f51b54c6556245901db256d3c77c393abf3f24
+size 8589934736
diff --git a/model-00101-of-00122.safetensors b/model-00101-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..9b428e890104b9b74cf5529d2617b5c4ea9a790d
--- /dev/null
+++ b/model-00101-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:630449860245457b4d84447de71d3a95cd43a096989887931fc636d4c4231b75
+size 4560382696
diff --git a/model-00102-of-00122.safetensors b/model-00102-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..f8f0d7464a05e15cd3f94c601dcdaf03a2e2dffd
--- /dev/null
+++ b/model-00102-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:39d7f825b5337c88155f7cd4266e4e70b31af65557834bb79eaafcf7498776fc
+size 8589934736
diff --git a/model-00103-of-00122.safetensors b/model-00103-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..7f0e542556683ba0b536dc34d7d49065c6ca48c8
--- /dev/null
+++ b/model-00103-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:1f232c57b4d4b41514f5c93e6659b610e2ef444d0cf796c8a09d7468fdded807
+size 4534070104
diff --git a/model-00104-of-00122.safetensors b/model-00104-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..5970abe534baa49aff03461f1e7b7ce6bfaaab86
--- /dev/null
+++ b/model-00104-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ddd85eac7ad60dacad31ffe6dd8186bc0b01d2a894aad5a6be8b83f0ea8a8c38
+size 8589934736
diff --git a/model-00105-of-00122.safetensors b/model-00105-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..fefe50ca3e97b6da2f79f35943b34068f7b6fbea
--- /dev/null
+++ b/model-00105-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:e281c94b8d7905a15500b1bd4fe8e8ac1d478e13544bca6982dd09251a3f0103
+size 4560382696
diff --git a/model-00106-of-00122.safetensors b/model-00106-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..28d263366319c013dc20dff217362ecc20566de2
--- /dev/null
+++ b/model-00106-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:48b98398d9e8cf98a28ecea47eeddbe6621bb6ced42034f016119791a9eed134
+size 8589934736
diff --git a/model-00107-of-00122.safetensors b/model-00107-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..cd6adb93324aa6f3402141c88dbe7cd68d7d2ed0
--- /dev/null
+++ b/model-00107-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ae341f273195777f7af296d1ddddc8809295b802327ae1db6d5f5efa25c37d34
+size 4560382696
diff --git a/model-00108-of-00122.safetensors b/model-00108-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..cb851dbffa0a073ab0865f63cb749b7619831be3
--- /dev/null
+++ b/model-00108-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:bf5b8774e59433951d6c29f2de4155c8a90619ca6db4eb9a34b3da83d3550382
+size 8589934736
diff --git a/model-00109-of-00122.safetensors b/model-00109-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..e54ab4f030f8449d5442388d91af464d36aa0c71
--- /dev/null
+++ b/model-00109-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:91bdab0a21226a28c9a1bb34f44fa4942a74b5f986e5552787047765340651e1
+size 4560382696
diff --git a/model-00110-of-00122.safetensors b/model-00110-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..f4e0adfb48a0707158651c7f9b3f99a16d99c6ec
--- /dev/null
+++ b/model-00110-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:2f2d5a7f943b6d31c7e245492fadbfdfa6f075399e2a149a7fb8eae6ebb912f9
+size 8589934736
diff --git a/model-00111-of-00122.safetensors b/model-00111-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..8aeff6bffc0221f4f39e38f74b2d416490a40c8f
--- /dev/null
+++ b/model-00111-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:0a23fe120a1a0cf735eedb6dba6005756e2ece3736f3b6ebb95104567885f878
+size 4534070104
diff --git a/model-00112-of-00122.safetensors b/model-00112-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..e547ebadf93d4d0770d8fa7578a029dc4d4d48d5
--- /dev/null
+++ b/model-00112-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:2326b5bca2b5c0a9aec149f4b6e13f44852da16a38961c70a7517087d404d999
+size 8589934736
diff --git a/model-00113-of-00122.safetensors b/model-00113-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..eb96f618a9f3367e7d256995086caca5dd5f9dc9
--- /dev/null
+++ b/model-00113-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:61af199a6fead8deda248cdf525c71683c9f2334c0ed3f4ae826b988e266b5f6
+size 4560382696
diff --git a/model-00114-of-00122.safetensors b/model-00114-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..e964cc8c04a3496a906234af08d4ca9468166ab2
--- /dev/null
+++ b/model-00114-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:59670ec39aba4bd98278694e2aa3e46a0116f65d4281851d15750d93ed61d0c0
+size 8589934736
diff --git a/model-00115-of-00122.safetensors b/model-00115-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..ea0c7eff3f1ffce208cf642ca0a9fb4150a4d6fa
--- /dev/null
+++ b/model-00115-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:f7f5e1efe783dd970d58ebef046e5f4aa2cab914527254ef204c9d3ad24e0293
+size 4560382696
diff --git a/model-00116-of-00122.safetensors b/model-00116-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..46a3487cd8caa89dc182c0bf1af7e30d2e89134e
--- /dev/null
+++ b/model-00116-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:1c4a98091d80d059c58972b21ff5ef30e71683355294fd6e9117deed278e31cc
+size 8589934736
diff --git a/model-00117-of-00122.safetensors b/model-00117-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..527f0937ccb2f3c28be6f59d12544caaec730265
--- /dev/null
+++ b/model-00117-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:cd57f2a7ca004adffe526c3284c155b1ae862429a47e6da7ab2481cbce635c2d
+size 4560382696
diff --git a/model-00118-of-00122.safetensors b/model-00118-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..2e7b7602e47c6f533fa70b1bad3716e2a721547e
--- /dev/null
+++ b/model-00118-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:e14c1bb30bf23f19e66861d3d17c27ee0703a2c1a74cddb236cd8bc9a66bfc98
+size 8589934736
diff --git a/model-00119-of-00122.safetensors b/model-00119-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..d84eb7eabd0a9edabdffab671151e3c6d5e34583
--- /dev/null
+++ b/model-00119-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:0b3cfbd10b1070b748a219a2f33c6cefba66530bfaa30dd179489b368f615e13
+size 4534070104
diff --git a/model-00120-of-00122.safetensors b/model-00120-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..1504193f0f31a55034974e3482c384ca1a4e34bd
--- /dev/null
+++ b/model-00120-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:796bd42c249d3cf5ed758584b02860ec8789e37318cd3bf9eef13218d57c1ab6
+size 8589934736
diff --git a/model-00121-of-00122.safetensors b/model-00121-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..0fd355f64feb78a85a91578a2b7158bff63a1765
--- /dev/null
+++ b/model-00121-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:f69722260fa747cbea37adf5d57c8259bd6a682b9ea82cb77b17889906b180f3
+size 4294975760
diff --git a/model-00122-of-00122.safetensors b/model-00122-of-00122.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..99929e67f4bf04169c2f0361c18ed83884aff159
--- /dev/null
+++ b/model-00122-of-00122.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:9f4043bb20f024a6a25bc89376703e3d3a6a8456e07ee90aa03d9ac16982976a
+size 2034245840
diff --git a/model.safetensors.index.json b/model.safetensors.index.json
new file mode 100644
index 0000000000000000000000000000000000000000..13dba71ba5feadcd979f7ea64d5533432b5ac27f
--- /dev/null
+++ b/model.safetensors.index.json
@@ -0,0 +1,1378 @@
+{
+ "metadata": {
+ "total_size": 793604721632
+ },
+ "weight_map": {
+ "model.language_model.embed_tokens.weight": "model-00001-of-00122.safetensors",
+ "model.visual.patch_embed.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.patch_embed.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.pos_embed.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.0.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.0.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.0.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.0.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.0.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.0.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.0.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.0.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.0.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.0.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.0.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.0.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.1.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.1.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.1.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.1.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.1.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.1.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.1.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.1.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.1.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.1.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.1.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.1.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.2.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.2.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.2.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.2.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.2.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.2.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.2.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.2.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.2.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.2.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.2.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.2.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.3.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.3.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.3.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.3.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.3.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.3.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.3.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.3.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.3.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.3.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.3.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.3.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.4.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.4.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.4.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.4.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.4.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.4.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.4.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.4.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.4.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.4.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.4.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.4.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.5.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.5.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.5.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.5.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.5.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.5.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.5.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.5.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.5.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.5.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.5.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.5.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.6.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.6.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.6.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.6.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.6.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.6.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.6.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.6.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.6.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.6.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.6.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.6.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.7.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.7.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.7.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.7.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.7.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.7.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.7.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.7.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.7.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.7.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.7.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.7.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.8.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.8.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.8.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.8.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.8.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.8.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.8.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.8.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.8.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.8.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.8.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.8.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.9.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.9.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.9.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.9.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.9.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.9.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.9.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.9.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.9.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.9.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.9.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.9.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.10.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.10.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.10.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.10.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.10.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.10.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.10.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.10.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.10.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.10.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.10.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.10.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.11.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.11.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.11.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.11.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.11.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.11.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.11.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.11.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.11.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.11.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.11.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.11.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.12.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.12.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.12.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.12.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.12.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.12.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.12.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.12.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.12.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.12.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.12.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.12.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.13.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.13.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.13.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.13.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.13.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.13.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.13.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.13.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.13.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.13.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.13.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.13.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.14.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.14.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.14.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.14.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.14.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.14.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.14.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.14.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.14.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.14.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.14.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.14.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.15.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.15.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.15.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.15.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.15.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.15.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.15.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.15.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.15.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.15.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.15.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.15.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.16.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.16.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.16.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.16.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.16.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.16.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.16.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.16.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.16.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.16.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.16.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.16.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.17.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.17.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.17.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.17.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.17.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.17.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.17.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.17.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.17.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.17.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.17.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.17.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.18.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.18.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.18.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.18.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.18.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.18.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.18.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.18.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.18.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.18.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.18.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.18.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.19.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.19.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.19.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.19.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.19.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.19.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.19.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.19.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.19.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.19.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.19.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.19.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.20.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.20.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.20.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.20.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.20.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.20.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.20.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.20.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.20.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.20.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.20.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.20.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.21.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.21.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.21.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.21.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.21.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.21.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.21.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.21.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.21.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.21.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.21.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.21.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.22.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.22.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.22.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.22.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.22.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.22.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.22.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.22.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.22.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.22.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.22.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.22.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.23.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.23.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.23.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.23.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.23.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.23.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.23.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.23.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.23.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.23.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.23.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.23.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.24.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.24.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.24.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.24.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.24.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.24.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.24.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.24.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.24.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.24.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.24.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.24.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.25.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.25.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.25.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.25.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.25.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.25.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.25.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.25.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.25.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.25.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.25.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.25.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.26.norm1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.26.norm1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.26.norm2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.26.norm2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.26.attn.qkv.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.26.attn.qkv.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.26.attn.proj.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.26.attn.proj.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.26.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.26.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.26.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.blocks.26.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.visual.merger.norm.weight": "model-00001-of-00122.safetensors",
+ "model.visual.merger.norm.bias": "model-00001-of-00122.safetensors",
+ "model.visual.merger.linear_fc1.weight": "model-00001-of-00122.safetensors",
+ "model.visual.merger.linear_fc1.bias": "model-00001-of-00122.safetensors",
+ "model.visual.merger.linear_fc2.weight": "model-00001-of-00122.safetensors",
+ "model.visual.merger.linear_fc2.bias": "model-00001-of-00122.safetensors",
+ "model.language_model.layers.0.linear_attn.in_proj_qkv.weight": "model-00001-of-00122.safetensors",
+ "model.language_model.layers.0.linear_attn.in_proj_z.weight": "model-00001-of-00122.safetensors",
+ "model.language_model.layers.0.linear_attn.in_proj_b.weight": "model-00001-of-00122.safetensors",
+ "model.language_model.layers.0.linear_attn.in_proj_a.weight": "model-00001-of-00122.safetensors",
+ "model.language_model.layers.0.linear_attn.conv1d.weight": "model-00001-of-00122.safetensors",
+ "model.language_model.layers.0.linear_attn.dt_bias": "model-00001-of-00122.safetensors",
+ "model.language_model.layers.0.linear_attn.A_log": "model-00001-of-00122.safetensors",
+ "model.language_model.layers.0.linear_attn.norm.weight": "model-00001-of-00122.safetensors",
+ "model.language_model.layers.0.linear_attn.out_proj.weight": "model-00001-of-00122.safetensors",
+ "model.language_model.layers.0.input_layernorm.weight": "model-00001-of-00122.safetensors",
+ "model.language_model.layers.0.mlp.gate.weight": "model-00001-of-00122.safetensors",
+ "model.language_model.layers.0.mlp.shared_expert.gate_proj.weight": "model-00001-of-00122.safetensors",
+ "model.language_model.layers.0.mlp.shared_expert.up_proj.weight": "model-00001-of-00122.safetensors",
+ "model.language_model.layers.0.mlp.shared_expert.down_proj.weight": "model-00001-of-00122.safetensors",
+ "model.language_model.layers.0.mlp.shared_expert_gate.weight": "model-00001-of-00122.safetensors",
+ "model.language_model.layers.0.mlp.experts.gate_up_proj": "model-00002-of-00122.safetensors",
+ "model.language_model.layers.0.mlp.experts.down_proj": "model-00003-of-00122.safetensors",
+ "model.language_model.layers.0.post_attention_layernorm.weight": "model-00003-of-00122.safetensors",
+ "model.language_model.layers.1.linear_attn.in_proj_qkv.weight": "model-00003-of-00122.safetensors",
+ "model.language_model.layers.1.linear_attn.in_proj_z.weight": "model-00003-of-00122.safetensors",
+ "model.language_model.layers.1.linear_attn.in_proj_b.weight": "model-00003-of-00122.safetensors",
+ "model.language_model.layers.1.linear_attn.in_proj_a.weight": "model-00003-of-00122.safetensors",
+ "model.language_model.layers.1.linear_attn.conv1d.weight": "model-00003-of-00122.safetensors",
+ "model.language_model.layers.1.linear_attn.dt_bias": "model-00003-of-00122.safetensors",
+ "model.language_model.layers.1.linear_attn.A_log": "model-00003-of-00122.safetensors",
+ "model.language_model.layers.1.linear_attn.norm.weight": "model-00003-of-00122.safetensors",
+ "model.language_model.layers.1.linear_attn.out_proj.weight": "model-00003-of-00122.safetensors",
+ "model.language_model.layers.1.input_layernorm.weight": "model-00003-of-00122.safetensors",
+ "model.language_model.layers.1.mlp.gate.weight": "model-00003-of-00122.safetensors",
+ "model.language_model.layers.1.mlp.shared_expert.gate_proj.weight": "model-00003-of-00122.safetensors",
+ "model.language_model.layers.1.mlp.shared_expert.up_proj.weight": "model-00003-of-00122.safetensors",
+ "model.language_model.layers.1.mlp.shared_expert.down_proj.weight": "model-00003-of-00122.safetensors",
+ "model.language_model.layers.1.mlp.shared_expert_gate.weight": "model-00003-of-00122.safetensors",
+ "model.language_model.layers.1.mlp.experts.gate_up_proj": "model-00004-of-00122.safetensors",
+ "model.language_model.layers.1.mlp.experts.down_proj": "model-00005-of-00122.safetensors",
+ "model.language_model.layers.1.post_attention_layernorm.weight": "model-00005-of-00122.safetensors",
+ "model.language_model.layers.2.linear_attn.in_proj_qkv.weight": "model-00005-of-00122.safetensors",
+ "model.language_model.layers.2.linear_attn.in_proj_z.weight": "model-00005-of-00122.safetensors",
+ "model.language_model.layers.2.linear_attn.in_proj_b.weight": "model-00005-of-00122.safetensors",
+ "model.language_model.layers.2.linear_attn.in_proj_a.weight": "model-00005-of-00122.safetensors",
+ "model.language_model.layers.2.linear_attn.conv1d.weight": "model-00005-of-00122.safetensors",
+ "model.language_model.layers.2.linear_attn.dt_bias": "model-00005-of-00122.safetensors",
+ "model.language_model.layers.2.linear_attn.A_log": "model-00005-of-00122.safetensors",
+ "model.language_model.layers.2.linear_attn.norm.weight": "model-00005-of-00122.safetensors",
+ "model.language_model.layers.2.linear_attn.out_proj.weight": "model-00005-of-00122.safetensors",
+ "model.language_model.layers.2.input_layernorm.weight": "model-00005-of-00122.safetensors",
+ "model.language_model.layers.2.mlp.gate.weight": "model-00005-of-00122.safetensors",
+ "model.language_model.layers.2.mlp.shared_expert.gate_proj.weight": "model-00005-of-00122.safetensors",
+ "model.language_model.layers.2.mlp.shared_expert.up_proj.weight": "model-00005-of-00122.safetensors",
+ "model.language_model.layers.2.mlp.shared_expert.down_proj.weight": "model-00005-of-00122.safetensors",
+ "model.language_model.layers.2.mlp.shared_expert_gate.weight": "model-00005-of-00122.safetensors",
+ "model.language_model.layers.2.mlp.experts.gate_up_proj": "model-00006-of-00122.safetensors",
+ "model.language_model.layers.2.mlp.experts.down_proj": "model-00007-of-00122.safetensors",
+ "model.language_model.layers.2.post_attention_layernorm.weight": "model-00007-of-00122.safetensors",
+ "model.language_model.layers.3.self_attn.q_proj.weight": "model-00007-of-00122.safetensors",
+ "model.language_model.layers.3.self_attn.k_proj.weight": "model-00007-of-00122.safetensors",
+ "model.language_model.layers.3.self_attn.v_proj.weight": "model-00007-of-00122.safetensors",
+ "model.language_model.layers.3.self_attn.o_proj.weight": "model-00007-of-00122.safetensors",
+ "model.language_model.layers.3.self_attn.q_norm.weight": "model-00007-of-00122.safetensors",
+ "model.language_model.layers.3.self_attn.k_norm.weight": "model-00007-of-00122.safetensors",
+ "model.language_model.layers.3.input_layernorm.weight": "model-00007-of-00122.safetensors",
+ "model.language_model.layers.3.mlp.gate.weight": "model-00007-of-00122.safetensors",
+ "model.language_model.layers.3.mlp.shared_expert.gate_proj.weight": "model-00007-of-00122.safetensors",
+ "model.language_model.layers.3.mlp.shared_expert.up_proj.weight": "model-00007-of-00122.safetensors",
+ "model.language_model.layers.3.mlp.shared_expert.down_proj.weight": "model-00007-of-00122.safetensors",
+ "model.language_model.layers.3.mlp.shared_expert_gate.weight": "model-00007-of-00122.safetensors",
+ "model.language_model.layers.3.mlp.experts.gate_up_proj": "model-00008-of-00122.safetensors",
+ "model.language_model.layers.3.mlp.experts.down_proj": "model-00009-of-00122.safetensors",
+ "model.language_model.layers.3.post_attention_layernorm.weight": "model-00009-of-00122.safetensors",
+ "model.language_model.layers.4.linear_attn.in_proj_qkv.weight": "model-00009-of-00122.safetensors",
+ "model.language_model.layers.4.linear_attn.in_proj_z.weight": "model-00009-of-00122.safetensors",
+ "model.language_model.layers.4.linear_attn.in_proj_b.weight": "model-00009-of-00122.safetensors",
+ "model.language_model.layers.4.linear_attn.in_proj_a.weight": "model-00009-of-00122.safetensors",
+ "model.language_model.layers.4.linear_attn.conv1d.weight": "model-00009-of-00122.safetensors",
+ "model.language_model.layers.4.linear_attn.dt_bias": "model-00009-of-00122.safetensors",
+ "model.language_model.layers.4.linear_attn.A_log": "model-00009-of-00122.safetensors",
+ "model.language_model.layers.4.linear_attn.norm.weight": "model-00009-of-00122.safetensors",
+ "model.language_model.layers.4.linear_attn.out_proj.weight": "model-00009-of-00122.safetensors",
+ "model.language_model.layers.4.input_layernorm.weight": "model-00009-of-00122.safetensors",
+ "model.language_model.layers.4.mlp.gate.weight": "model-00009-of-00122.safetensors",
+ "model.language_model.layers.4.mlp.shared_expert.gate_proj.weight": "model-00009-of-00122.safetensors",
+ "model.language_model.layers.4.mlp.shared_expert.up_proj.weight": "model-00009-of-00122.safetensors",
+ "model.language_model.layers.4.mlp.shared_expert.down_proj.weight": "model-00009-of-00122.safetensors",
+ "model.language_model.layers.4.mlp.shared_expert_gate.weight": "model-00009-of-00122.safetensors",
+ "model.language_model.layers.4.mlp.experts.gate_up_proj": "model-00010-of-00122.safetensors",
+ "model.language_model.layers.4.mlp.experts.down_proj": "model-00011-of-00122.safetensors",
+ "model.language_model.layers.4.post_attention_layernorm.weight": "model-00011-of-00122.safetensors",
+ "model.language_model.layers.5.linear_attn.in_proj_qkv.weight": "model-00011-of-00122.safetensors",
+ "model.language_model.layers.5.linear_attn.in_proj_z.weight": "model-00011-of-00122.safetensors",
+ "model.language_model.layers.5.linear_attn.in_proj_b.weight": "model-00011-of-00122.safetensors",
+ "model.language_model.layers.5.linear_attn.in_proj_a.weight": "model-00011-of-00122.safetensors",
+ "model.language_model.layers.5.linear_attn.conv1d.weight": "model-00011-of-00122.safetensors",
+ "model.language_model.layers.5.linear_attn.dt_bias": "model-00011-of-00122.safetensors",
+ "model.language_model.layers.5.linear_attn.A_log": "model-00011-of-00122.safetensors",
+ "model.language_model.layers.5.linear_attn.norm.weight": "model-00011-of-00122.safetensors",
+ "model.language_model.layers.5.linear_attn.out_proj.weight": "model-00011-of-00122.safetensors",
+ "model.language_model.layers.5.input_layernorm.weight": "model-00011-of-00122.safetensors",
+ "model.language_model.layers.5.mlp.gate.weight": "model-00011-of-00122.safetensors",
+ "model.language_model.layers.5.mlp.shared_expert.gate_proj.weight": "model-00011-of-00122.safetensors",
+ "model.language_model.layers.5.mlp.shared_expert.up_proj.weight": "model-00011-of-00122.safetensors",
+ "model.language_model.layers.5.mlp.shared_expert.down_proj.weight": "model-00011-of-00122.safetensors",
+ "model.language_model.layers.5.mlp.shared_expert_gate.weight": "model-00011-of-00122.safetensors",
+ "model.language_model.layers.5.mlp.experts.gate_up_proj": "model-00012-of-00122.safetensors",
+ "model.language_model.layers.5.mlp.experts.down_proj": "model-00013-of-00122.safetensors",
+ "model.language_model.layers.5.post_attention_layernorm.weight": "model-00013-of-00122.safetensors",
+ "model.language_model.layers.6.linear_attn.in_proj_qkv.weight": "model-00013-of-00122.safetensors",
+ "model.language_model.layers.6.linear_attn.in_proj_z.weight": "model-00013-of-00122.safetensors",
+ "model.language_model.layers.6.linear_attn.in_proj_b.weight": "model-00013-of-00122.safetensors",
+ "model.language_model.layers.6.linear_attn.in_proj_a.weight": "model-00013-of-00122.safetensors",
+ "model.language_model.layers.6.linear_attn.conv1d.weight": "model-00013-of-00122.safetensors",
+ "model.language_model.layers.6.linear_attn.dt_bias": "model-00013-of-00122.safetensors",
+ "model.language_model.layers.6.linear_attn.A_log": "model-00013-of-00122.safetensors",
+ "model.language_model.layers.6.linear_attn.norm.weight": "model-00013-of-00122.safetensors",
+ "model.language_model.layers.6.linear_attn.out_proj.weight": "model-00013-of-00122.safetensors",
+ "model.language_model.layers.6.input_layernorm.weight": "model-00013-of-00122.safetensors",
+ "model.language_model.layers.6.mlp.gate.weight": "model-00013-of-00122.safetensors",
+ "model.language_model.layers.6.mlp.shared_expert.gate_proj.weight": "model-00013-of-00122.safetensors",
+ "model.language_model.layers.6.mlp.shared_expert.up_proj.weight": "model-00013-of-00122.safetensors",
+ "model.language_model.layers.6.mlp.shared_expert.down_proj.weight": "model-00013-of-00122.safetensors",
+ "model.language_model.layers.6.mlp.shared_expert_gate.weight": "model-00013-of-00122.safetensors",
+ "model.language_model.layers.6.mlp.experts.gate_up_proj": "model-00014-of-00122.safetensors",
+ "model.language_model.layers.6.mlp.experts.down_proj": "model-00015-of-00122.safetensors",
+ "model.language_model.layers.6.post_attention_layernorm.weight": "model-00015-of-00122.safetensors",
+ "model.language_model.layers.7.self_attn.q_proj.weight": "model-00015-of-00122.safetensors",
+ "model.language_model.layers.7.self_attn.k_proj.weight": "model-00015-of-00122.safetensors",
+ "model.language_model.layers.7.self_attn.v_proj.weight": "model-00015-of-00122.safetensors",
+ "model.language_model.layers.7.self_attn.o_proj.weight": "model-00015-of-00122.safetensors",
+ "model.language_model.layers.7.self_attn.q_norm.weight": "model-00015-of-00122.safetensors",
+ "model.language_model.layers.7.self_attn.k_norm.weight": "model-00015-of-00122.safetensors",
+ "model.language_model.layers.7.input_layernorm.weight": "model-00015-of-00122.safetensors",
+ "model.language_model.layers.7.mlp.gate.weight": "model-00015-of-00122.safetensors",
+ "model.language_model.layers.7.mlp.shared_expert.gate_proj.weight": "model-00015-of-00122.safetensors",
+ "model.language_model.layers.7.mlp.shared_expert.up_proj.weight": "model-00015-of-00122.safetensors",
+ "model.language_model.layers.7.mlp.shared_expert.down_proj.weight": "model-00015-of-00122.safetensors",
+ "model.language_model.layers.7.mlp.shared_expert_gate.weight": "model-00015-of-00122.safetensors",
+ "model.language_model.layers.7.mlp.experts.gate_up_proj": "model-00016-of-00122.safetensors",
+ "model.language_model.layers.7.mlp.experts.down_proj": "model-00017-of-00122.safetensors",
+ "model.language_model.layers.7.post_attention_layernorm.weight": "model-00017-of-00122.safetensors",
+ "model.language_model.layers.8.linear_attn.in_proj_qkv.weight": "model-00017-of-00122.safetensors",
+ "model.language_model.layers.8.linear_attn.in_proj_z.weight": "model-00017-of-00122.safetensors",
+ "model.language_model.layers.8.linear_attn.in_proj_b.weight": "model-00017-of-00122.safetensors",
+ "model.language_model.layers.8.linear_attn.in_proj_a.weight": "model-00017-of-00122.safetensors",
+ "model.language_model.layers.8.linear_attn.conv1d.weight": "model-00017-of-00122.safetensors",
+ "model.language_model.layers.8.linear_attn.dt_bias": "model-00017-of-00122.safetensors",
+ "model.language_model.layers.8.linear_attn.A_log": "model-00017-of-00122.safetensors",
+ "model.language_model.layers.8.linear_attn.norm.weight": "model-00017-of-00122.safetensors",
+ "model.language_model.layers.8.linear_attn.out_proj.weight": "model-00017-of-00122.safetensors",
+ "model.language_model.layers.8.input_layernorm.weight": "model-00017-of-00122.safetensors",
+ "model.language_model.layers.8.mlp.gate.weight": "model-00017-of-00122.safetensors",
+ "model.language_model.layers.8.mlp.shared_expert.gate_proj.weight": "model-00017-of-00122.safetensors",
+ "model.language_model.layers.8.mlp.shared_expert.up_proj.weight": "model-00017-of-00122.safetensors",
+ "model.language_model.layers.8.mlp.shared_expert.down_proj.weight": "model-00017-of-00122.safetensors",
+ "model.language_model.layers.8.mlp.shared_expert_gate.weight": "model-00017-of-00122.safetensors",
+ "model.language_model.layers.8.mlp.experts.gate_up_proj": "model-00018-of-00122.safetensors",
+ "model.language_model.layers.8.mlp.experts.down_proj": "model-00019-of-00122.safetensors",
+ "model.language_model.layers.8.post_attention_layernorm.weight": "model-00019-of-00122.safetensors",
+ "model.language_model.layers.9.linear_attn.in_proj_qkv.weight": "model-00019-of-00122.safetensors",
+ "model.language_model.layers.9.linear_attn.in_proj_z.weight": "model-00019-of-00122.safetensors",
+ "model.language_model.layers.9.linear_attn.in_proj_b.weight": "model-00019-of-00122.safetensors",
+ "model.language_model.layers.9.linear_attn.in_proj_a.weight": "model-00019-of-00122.safetensors",
+ "model.language_model.layers.9.linear_attn.conv1d.weight": "model-00019-of-00122.safetensors",
+ "model.language_model.layers.9.linear_attn.dt_bias": "model-00019-of-00122.safetensors",
+ "model.language_model.layers.9.linear_attn.A_log": "model-00019-of-00122.safetensors",
+ "model.language_model.layers.9.linear_attn.norm.weight": "model-00019-of-00122.safetensors",
+ "model.language_model.layers.9.linear_attn.out_proj.weight": "model-00019-of-00122.safetensors",
+ "model.language_model.layers.9.input_layernorm.weight": "model-00019-of-00122.safetensors",
+ "model.language_model.layers.9.mlp.gate.weight": "model-00019-of-00122.safetensors",
+ "model.language_model.layers.9.mlp.shared_expert.gate_proj.weight": "model-00019-of-00122.safetensors",
+ "model.language_model.layers.9.mlp.shared_expert.up_proj.weight": "model-00019-of-00122.safetensors",
+ "model.language_model.layers.9.mlp.shared_expert.down_proj.weight": "model-00019-of-00122.safetensors",
+ "model.language_model.layers.9.mlp.shared_expert_gate.weight": "model-00019-of-00122.safetensors",
+ "model.language_model.layers.9.mlp.experts.gate_up_proj": "model-00020-of-00122.safetensors",
+ "model.language_model.layers.9.mlp.experts.down_proj": "model-00021-of-00122.safetensors",
+ "model.language_model.layers.9.post_attention_layernorm.weight": "model-00021-of-00122.safetensors",
+ "model.language_model.layers.10.linear_attn.in_proj_qkv.weight": "model-00021-of-00122.safetensors",
+ "model.language_model.layers.10.linear_attn.in_proj_z.weight": "model-00021-of-00122.safetensors",
+ "model.language_model.layers.10.linear_attn.in_proj_b.weight": "model-00021-of-00122.safetensors",
+ "model.language_model.layers.10.linear_attn.in_proj_a.weight": "model-00021-of-00122.safetensors",
+ "model.language_model.layers.10.linear_attn.conv1d.weight": "model-00021-of-00122.safetensors",
+ "model.language_model.layers.10.linear_attn.dt_bias": "model-00021-of-00122.safetensors",
+ "model.language_model.layers.10.linear_attn.A_log": "model-00021-of-00122.safetensors",
+ "model.language_model.layers.10.linear_attn.norm.weight": "model-00021-of-00122.safetensors",
+ "model.language_model.layers.10.linear_attn.out_proj.weight": "model-00021-of-00122.safetensors",
+ "model.language_model.layers.10.input_layernorm.weight": "model-00021-of-00122.safetensors",
+ "model.language_model.layers.10.mlp.gate.weight": "model-00021-of-00122.safetensors",
+ "model.language_model.layers.10.mlp.shared_expert.gate_proj.weight": "model-00021-of-00122.safetensors",
+ "model.language_model.layers.10.mlp.shared_expert.up_proj.weight": "model-00021-of-00122.safetensors",
+ "model.language_model.layers.10.mlp.shared_expert.down_proj.weight": "model-00021-of-00122.safetensors",
+ "model.language_model.layers.10.mlp.shared_expert_gate.weight": "model-00021-of-00122.safetensors",
+ "model.language_model.layers.10.mlp.experts.gate_up_proj": "model-00022-of-00122.safetensors",
+ "model.language_model.layers.10.mlp.experts.down_proj": "model-00023-of-00122.safetensors",
+ "model.language_model.layers.10.post_attention_layernorm.weight": "model-00023-of-00122.safetensors",
+ "model.language_model.layers.11.self_attn.q_proj.weight": "model-00023-of-00122.safetensors",
+ "model.language_model.layers.11.self_attn.k_proj.weight": "model-00023-of-00122.safetensors",
+ "model.language_model.layers.11.self_attn.v_proj.weight": "model-00023-of-00122.safetensors",
+ "model.language_model.layers.11.self_attn.o_proj.weight": "model-00023-of-00122.safetensors",
+ "model.language_model.layers.11.self_attn.q_norm.weight": "model-00023-of-00122.safetensors",
+ "model.language_model.layers.11.self_attn.k_norm.weight": "model-00023-of-00122.safetensors",
+ "model.language_model.layers.11.input_layernorm.weight": "model-00023-of-00122.safetensors",
+ "model.language_model.layers.11.mlp.gate.weight": "model-00023-of-00122.safetensors",
+ "model.language_model.layers.11.mlp.shared_expert.gate_proj.weight": "model-00023-of-00122.safetensors",
+ "model.language_model.layers.11.mlp.shared_expert.up_proj.weight": "model-00023-of-00122.safetensors",
+ "model.language_model.layers.11.mlp.shared_expert.down_proj.weight": "model-00023-of-00122.safetensors",
+ "model.language_model.layers.11.mlp.shared_expert_gate.weight": "model-00023-of-00122.safetensors",
+ "model.language_model.layers.11.mlp.experts.gate_up_proj": "model-00024-of-00122.safetensors",
+ "model.language_model.layers.11.mlp.experts.down_proj": "model-00025-of-00122.safetensors",
+ "model.language_model.layers.11.post_attention_layernorm.weight": "model-00025-of-00122.safetensors",
+ "model.language_model.layers.12.linear_attn.in_proj_qkv.weight": "model-00025-of-00122.safetensors",
+ "model.language_model.layers.12.linear_attn.in_proj_z.weight": "model-00025-of-00122.safetensors",
+ "model.language_model.layers.12.linear_attn.in_proj_b.weight": "model-00025-of-00122.safetensors",
+ "model.language_model.layers.12.linear_attn.in_proj_a.weight": "model-00025-of-00122.safetensors",
+ "model.language_model.layers.12.linear_attn.conv1d.weight": "model-00025-of-00122.safetensors",
+ "model.language_model.layers.12.linear_attn.dt_bias": "model-00025-of-00122.safetensors",
+ "model.language_model.layers.12.linear_attn.A_log": "model-00025-of-00122.safetensors",
+ "model.language_model.layers.12.linear_attn.norm.weight": "model-00025-of-00122.safetensors",
+ "model.language_model.layers.12.linear_attn.out_proj.weight": "model-00025-of-00122.safetensors",
+ "model.language_model.layers.12.input_layernorm.weight": "model-00025-of-00122.safetensors",
+ "model.language_model.layers.12.mlp.gate.weight": "model-00025-of-00122.safetensors",
+ "model.language_model.layers.12.mlp.shared_expert.gate_proj.weight": "model-00025-of-00122.safetensors",
+ "model.language_model.layers.12.mlp.shared_expert.up_proj.weight": "model-00025-of-00122.safetensors",
+ "model.language_model.layers.12.mlp.shared_expert.down_proj.weight": "model-00025-of-00122.safetensors",
+ "model.language_model.layers.12.mlp.shared_expert_gate.weight": "model-00025-of-00122.safetensors",
+ "model.language_model.layers.12.mlp.experts.gate_up_proj": "model-00026-of-00122.safetensors",
+ "model.language_model.layers.12.mlp.experts.down_proj": "model-00027-of-00122.safetensors",
+ "model.language_model.layers.12.post_attention_layernorm.weight": "model-00027-of-00122.safetensors",
+ "model.language_model.layers.13.linear_attn.in_proj_qkv.weight": "model-00027-of-00122.safetensors",
+ "model.language_model.layers.13.linear_attn.in_proj_z.weight": "model-00027-of-00122.safetensors",
+ "model.language_model.layers.13.linear_attn.in_proj_b.weight": "model-00027-of-00122.safetensors",
+ "model.language_model.layers.13.linear_attn.in_proj_a.weight": "model-00027-of-00122.safetensors",
+ "model.language_model.layers.13.linear_attn.conv1d.weight": "model-00027-of-00122.safetensors",
+ "model.language_model.layers.13.linear_attn.dt_bias": "model-00027-of-00122.safetensors",
+ "model.language_model.layers.13.linear_attn.A_log": "model-00027-of-00122.safetensors",
+ "model.language_model.layers.13.linear_attn.norm.weight": "model-00027-of-00122.safetensors",
+ "model.language_model.layers.13.linear_attn.out_proj.weight": "model-00027-of-00122.safetensors",
+ "model.language_model.layers.13.input_layernorm.weight": "model-00027-of-00122.safetensors",
+ "model.language_model.layers.13.mlp.gate.weight": "model-00027-of-00122.safetensors",
+ "model.language_model.layers.13.mlp.shared_expert.gate_proj.weight": "model-00027-of-00122.safetensors",
+ "model.language_model.layers.13.mlp.shared_expert.up_proj.weight": "model-00027-of-00122.safetensors",
+ "model.language_model.layers.13.mlp.shared_expert.down_proj.weight": "model-00027-of-00122.safetensors",
+ "model.language_model.layers.13.mlp.shared_expert_gate.weight": "model-00027-of-00122.safetensors",
+ "model.language_model.layers.13.mlp.experts.gate_up_proj": "model-00028-of-00122.safetensors",
+ "model.language_model.layers.13.mlp.experts.down_proj": "model-00029-of-00122.safetensors",
+ "model.language_model.layers.13.post_attention_layernorm.weight": "model-00029-of-00122.safetensors",
+ "model.language_model.layers.14.linear_attn.in_proj_qkv.weight": "model-00029-of-00122.safetensors",
+ "model.language_model.layers.14.linear_attn.in_proj_z.weight": "model-00029-of-00122.safetensors",
+ "model.language_model.layers.14.linear_attn.in_proj_b.weight": "model-00029-of-00122.safetensors",
+ "model.language_model.layers.14.linear_attn.in_proj_a.weight": "model-00029-of-00122.safetensors",
+ "model.language_model.layers.14.linear_attn.conv1d.weight": "model-00029-of-00122.safetensors",
+ "model.language_model.layers.14.linear_attn.dt_bias": "model-00029-of-00122.safetensors",
+ "model.language_model.layers.14.linear_attn.A_log": "model-00029-of-00122.safetensors",
+ "model.language_model.layers.14.linear_attn.norm.weight": "model-00029-of-00122.safetensors",
+ "model.language_model.layers.14.linear_attn.out_proj.weight": "model-00029-of-00122.safetensors",
+ "model.language_model.layers.14.input_layernorm.weight": "model-00029-of-00122.safetensors",
+ "model.language_model.layers.14.mlp.gate.weight": "model-00029-of-00122.safetensors",
+ "model.language_model.layers.14.mlp.shared_expert.gate_proj.weight": "model-00029-of-00122.safetensors",
+ "model.language_model.layers.14.mlp.shared_expert.up_proj.weight": "model-00029-of-00122.safetensors",
+ "model.language_model.layers.14.mlp.shared_expert.down_proj.weight": "model-00029-of-00122.safetensors",
+ "model.language_model.layers.14.mlp.shared_expert_gate.weight": "model-00029-of-00122.safetensors",
+ "model.language_model.layers.14.mlp.experts.gate_up_proj": "model-00030-of-00122.safetensors",
+ "model.language_model.layers.14.mlp.experts.down_proj": "model-00031-of-00122.safetensors",
+ "model.language_model.layers.14.post_attention_layernorm.weight": "model-00031-of-00122.safetensors",
+ "model.language_model.layers.15.self_attn.q_proj.weight": "model-00031-of-00122.safetensors",
+ "model.language_model.layers.15.self_attn.k_proj.weight": "model-00031-of-00122.safetensors",
+ "model.language_model.layers.15.self_attn.v_proj.weight": "model-00031-of-00122.safetensors",
+ "model.language_model.layers.15.self_attn.o_proj.weight": "model-00031-of-00122.safetensors",
+ "model.language_model.layers.15.self_attn.q_norm.weight": "model-00031-of-00122.safetensors",
+ "model.language_model.layers.15.self_attn.k_norm.weight": "model-00031-of-00122.safetensors",
+ "model.language_model.layers.15.input_layernorm.weight": "model-00031-of-00122.safetensors",
+ "model.language_model.layers.15.mlp.gate.weight": "model-00031-of-00122.safetensors",
+ "model.language_model.layers.15.mlp.shared_expert.gate_proj.weight": "model-00031-of-00122.safetensors",
+ "model.language_model.layers.15.mlp.shared_expert.up_proj.weight": "model-00031-of-00122.safetensors",
+ "model.language_model.layers.15.mlp.shared_expert.down_proj.weight": "model-00031-of-00122.safetensors",
+ "model.language_model.layers.15.mlp.shared_expert_gate.weight": "model-00031-of-00122.safetensors",
+ "model.language_model.layers.15.mlp.experts.gate_up_proj": "model-00032-of-00122.safetensors",
+ "model.language_model.layers.15.mlp.experts.down_proj": "model-00033-of-00122.safetensors",
+ "model.language_model.layers.15.post_attention_layernorm.weight": "model-00033-of-00122.safetensors",
+ "model.language_model.layers.16.linear_attn.in_proj_qkv.weight": "model-00033-of-00122.safetensors",
+ "model.language_model.layers.16.linear_attn.in_proj_z.weight": "model-00033-of-00122.safetensors",
+ "model.language_model.layers.16.linear_attn.in_proj_b.weight": "model-00033-of-00122.safetensors",
+ "model.language_model.layers.16.linear_attn.in_proj_a.weight": "model-00033-of-00122.safetensors",
+ "model.language_model.layers.16.linear_attn.conv1d.weight": "model-00033-of-00122.safetensors",
+ "model.language_model.layers.16.linear_attn.dt_bias": "model-00033-of-00122.safetensors",
+ "model.language_model.layers.16.linear_attn.A_log": "model-00033-of-00122.safetensors",
+ "model.language_model.layers.16.linear_attn.norm.weight": "model-00033-of-00122.safetensors",
+ "model.language_model.layers.16.linear_attn.out_proj.weight": "model-00033-of-00122.safetensors",
+ "model.language_model.layers.16.input_layernorm.weight": "model-00033-of-00122.safetensors",
+ "model.language_model.layers.16.mlp.gate.weight": "model-00033-of-00122.safetensors",
+ "model.language_model.layers.16.mlp.shared_expert.gate_proj.weight": "model-00033-of-00122.safetensors",
+ "model.language_model.layers.16.mlp.shared_expert.up_proj.weight": "model-00033-of-00122.safetensors",
+ "model.language_model.layers.16.mlp.shared_expert.down_proj.weight": "model-00033-of-00122.safetensors",
+ "model.language_model.layers.16.mlp.shared_expert_gate.weight": "model-00033-of-00122.safetensors",
+ "model.language_model.layers.16.mlp.experts.gate_up_proj": "model-00034-of-00122.safetensors",
+ "model.language_model.layers.16.mlp.experts.down_proj": "model-00035-of-00122.safetensors",
+ "model.language_model.layers.16.post_attention_layernorm.weight": "model-00035-of-00122.safetensors",
+ "model.language_model.layers.17.linear_attn.in_proj_qkv.weight": "model-00035-of-00122.safetensors",
+ "model.language_model.layers.17.linear_attn.in_proj_z.weight": "model-00035-of-00122.safetensors",
+ "model.language_model.layers.17.linear_attn.in_proj_b.weight": "model-00035-of-00122.safetensors",
+ "model.language_model.layers.17.linear_attn.in_proj_a.weight": "model-00035-of-00122.safetensors",
+ "model.language_model.layers.17.linear_attn.conv1d.weight": "model-00035-of-00122.safetensors",
+ "model.language_model.layers.17.linear_attn.dt_bias": "model-00035-of-00122.safetensors",
+ "model.language_model.layers.17.linear_attn.A_log": "model-00035-of-00122.safetensors",
+ "model.language_model.layers.17.linear_attn.norm.weight": "model-00035-of-00122.safetensors",
+ "model.language_model.layers.17.linear_attn.out_proj.weight": "model-00035-of-00122.safetensors",
+ "model.language_model.layers.17.input_layernorm.weight": "model-00035-of-00122.safetensors",
+ "model.language_model.layers.17.mlp.gate.weight": "model-00035-of-00122.safetensors",
+ "model.language_model.layers.17.mlp.shared_expert.gate_proj.weight": "model-00035-of-00122.safetensors",
+ "model.language_model.layers.17.mlp.shared_expert.up_proj.weight": "model-00035-of-00122.safetensors",
+ "model.language_model.layers.17.mlp.shared_expert.down_proj.weight": "model-00035-of-00122.safetensors",
+ "model.language_model.layers.17.mlp.shared_expert_gate.weight": "model-00035-of-00122.safetensors",
+ "model.language_model.layers.17.mlp.experts.gate_up_proj": "model-00036-of-00122.safetensors",
+ "model.language_model.layers.17.mlp.experts.down_proj": "model-00037-of-00122.safetensors",
+ "model.language_model.layers.17.post_attention_layernorm.weight": "model-00037-of-00122.safetensors",
+ "model.language_model.layers.18.linear_attn.in_proj_qkv.weight": "model-00037-of-00122.safetensors",
+ "model.language_model.layers.18.linear_attn.in_proj_z.weight": "model-00037-of-00122.safetensors",
+ "model.language_model.layers.18.linear_attn.in_proj_b.weight": "model-00037-of-00122.safetensors",
+ "model.language_model.layers.18.linear_attn.in_proj_a.weight": "model-00037-of-00122.safetensors",
+ "model.language_model.layers.18.linear_attn.conv1d.weight": "model-00037-of-00122.safetensors",
+ "model.language_model.layers.18.linear_attn.dt_bias": "model-00037-of-00122.safetensors",
+ "model.language_model.layers.18.linear_attn.A_log": "model-00037-of-00122.safetensors",
+ "model.language_model.layers.18.linear_attn.norm.weight": "model-00037-of-00122.safetensors",
+ "model.language_model.layers.18.linear_attn.out_proj.weight": "model-00037-of-00122.safetensors",
+ "model.language_model.layers.18.input_layernorm.weight": "model-00037-of-00122.safetensors",
+ "model.language_model.layers.18.mlp.gate.weight": "model-00037-of-00122.safetensors",
+ "model.language_model.layers.18.mlp.shared_expert.gate_proj.weight": "model-00037-of-00122.safetensors",
+ "model.language_model.layers.18.mlp.shared_expert.up_proj.weight": "model-00037-of-00122.safetensors",
+ "model.language_model.layers.18.mlp.shared_expert.down_proj.weight": "model-00037-of-00122.safetensors",
+ "model.language_model.layers.18.mlp.shared_expert_gate.weight": "model-00037-of-00122.safetensors",
+ "model.language_model.layers.18.mlp.experts.gate_up_proj": "model-00038-of-00122.safetensors",
+ "model.language_model.layers.18.mlp.experts.down_proj": "model-00039-of-00122.safetensors",
+ "model.language_model.layers.18.post_attention_layernorm.weight": "model-00039-of-00122.safetensors",
+ "model.language_model.layers.19.self_attn.q_proj.weight": "model-00039-of-00122.safetensors",
+ "model.language_model.layers.19.self_attn.k_proj.weight": "model-00039-of-00122.safetensors",
+ "model.language_model.layers.19.self_attn.v_proj.weight": "model-00039-of-00122.safetensors",
+ "model.language_model.layers.19.self_attn.o_proj.weight": "model-00039-of-00122.safetensors",
+ "model.language_model.layers.19.self_attn.q_norm.weight": "model-00039-of-00122.safetensors",
+ "model.language_model.layers.19.self_attn.k_norm.weight": "model-00039-of-00122.safetensors",
+ "model.language_model.layers.19.input_layernorm.weight": "model-00039-of-00122.safetensors",
+ "model.language_model.layers.19.mlp.gate.weight": "model-00039-of-00122.safetensors",
+ "model.language_model.layers.19.mlp.shared_expert.gate_proj.weight": "model-00039-of-00122.safetensors",
+ "model.language_model.layers.19.mlp.shared_expert.up_proj.weight": "model-00039-of-00122.safetensors",
+ "model.language_model.layers.19.mlp.shared_expert.down_proj.weight": "model-00039-of-00122.safetensors",
+ "model.language_model.layers.19.mlp.shared_expert_gate.weight": "model-00039-of-00122.safetensors",
+ "model.language_model.layers.19.mlp.experts.gate_up_proj": "model-00040-of-00122.safetensors",
+ "model.language_model.layers.19.mlp.experts.down_proj": "model-00041-of-00122.safetensors",
+ "model.language_model.layers.19.post_attention_layernorm.weight": "model-00041-of-00122.safetensors",
+ "model.language_model.layers.20.linear_attn.in_proj_qkv.weight": "model-00041-of-00122.safetensors",
+ "model.language_model.layers.20.linear_attn.in_proj_z.weight": "model-00041-of-00122.safetensors",
+ "model.language_model.layers.20.linear_attn.in_proj_b.weight": "model-00041-of-00122.safetensors",
+ "model.language_model.layers.20.linear_attn.in_proj_a.weight": "model-00041-of-00122.safetensors",
+ "model.language_model.layers.20.linear_attn.conv1d.weight": "model-00041-of-00122.safetensors",
+ "model.language_model.layers.20.linear_attn.dt_bias": "model-00041-of-00122.safetensors",
+ "model.language_model.layers.20.linear_attn.A_log": "model-00041-of-00122.safetensors",
+ "model.language_model.layers.20.linear_attn.norm.weight": "model-00041-of-00122.safetensors",
+ "model.language_model.layers.20.linear_attn.out_proj.weight": "model-00041-of-00122.safetensors",
+ "model.language_model.layers.20.input_layernorm.weight": "model-00041-of-00122.safetensors",
+ "model.language_model.layers.20.mlp.gate.weight": "model-00041-of-00122.safetensors",
+ "model.language_model.layers.20.mlp.shared_expert.gate_proj.weight": "model-00041-of-00122.safetensors",
+ "model.language_model.layers.20.mlp.shared_expert.up_proj.weight": "model-00041-of-00122.safetensors",
+ "model.language_model.layers.20.mlp.shared_expert.down_proj.weight": "model-00041-of-00122.safetensors",
+ "model.language_model.layers.20.mlp.shared_expert_gate.weight": "model-00041-of-00122.safetensors",
+ "model.language_model.layers.20.mlp.experts.gate_up_proj": "model-00042-of-00122.safetensors",
+ "model.language_model.layers.20.mlp.experts.down_proj": "model-00043-of-00122.safetensors",
+ "model.language_model.layers.20.post_attention_layernorm.weight": "model-00043-of-00122.safetensors",
+ "model.language_model.layers.21.linear_attn.in_proj_qkv.weight": "model-00043-of-00122.safetensors",
+ "model.language_model.layers.21.linear_attn.in_proj_z.weight": "model-00043-of-00122.safetensors",
+ "model.language_model.layers.21.linear_attn.in_proj_b.weight": "model-00043-of-00122.safetensors",
+ "model.language_model.layers.21.linear_attn.in_proj_a.weight": "model-00043-of-00122.safetensors",
+ "model.language_model.layers.21.linear_attn.conv1d.weight": "model-00043-of-00122.safetensors",
+ "model.language_model.layers.21.linear_attn.dt_bias": "model-00043-of-00122.safetensors",
+ "model.language_model.layers.21.linear_attn.A_log": "model-00043-of-00122.safetensors",
+ "model.language_model.layers.21.linear_attn.norm.weight": "model-00043-of-00122.safetensors",
+ "model.language_model.layers.21.linear_attn.out_proj.weight": "model-00043-of-00122.safetensors",
+ "model.language_model.layers.21.input_layernorm.weight": "model-00043-of-00122.safetensors",
+ "model.language_model.layers.21.mlp.gate.weight": "model-00043-of-00122.safetensors",
+ "model.language_model.layers.21.mlp.shared_expert.gate_proj.weight": "model-00043-of-00122.safetensors",
+ "model.language_model.layers.21.mlp.shared_expert.up_proj.weight": "model-00043-of-00122.safetensors",
+ "model.language_model.layers.21.mlp.shared_expert.down_proj.weight": "model-00043-of-00122.safetensors",
+ "model.language_model.layers.21.mlp.shared_expert_gate.weight": "model-00043-of-00122.safetensors",
+ "model.language_model.layers.21.mlp.experts.gate_up_proj": "model-00044-of-00122.safetensors",
+ "model.language_model.layers.21.mlp.experts.down_proj": "model-00045-of-00122.safetensors",
+ "model.language_model.layers.21.post_attention_layernorm.weight": "model-00045-of-00122.safetensors",
+ "model.language_model.layers.22.linear_attn.in_proj_qkv.weight": "model-00045-of-00122.safetensors",
+ "model.language_model.layers.22.linear_attn.in_proj_z.weight": "model-00045-of-00122.safetensors",
+ "model.language_model.layers.22.linear_attn.in_proj_b.weight": "model-00045-of-00122.safetensors",
+ "model.language_model.layers.22.linear_attn.in_proj_a.weight": "model-00045-of-00122.safetensors",
+ "model.language_model.layers.22.linear_attn.conv1d.weight": "model-00045-of-00122.safetensors",
+ "model.language_model.layers.22.linear_attn.dt_bias": "model-00045-of-00122.safetensors",
+ "model.language_model.layers.22.linear_attn.A_log": "model-00045-of-00122.safetensors",
+ "model.language_model.layers.22.linear_attn.norm.weight": "model-00045-of-00122.safetensors",
+ "model.language_model.layers.22.linear_attn.out_proj.weight": "model-00045-of-00122.safetensors",
+ "model.language_model.layers.22.input_layernorm.weight": "model-00045-of-00122.safetensors",
+ "model.language_model.layers.22.mlp.gate.weight": "model-00045-of-00122.safetensors",
+ "model.language_model.layers.22.mlp.shared_expert.gate_proj.weight": "model-00045-of-00122.safetensors",
+ "model.language_model.layers.22.mlp.shared_expert.up_proj.weight": "model-00045-of-00122.safetensors",
+ "model.language_model.layers.22.mlp.shared_expert.down_proj.weight": "model-00045-of-00122.safetensors",
+ "model.language_model.layers.22.mlp.shared_expert_gate.weight": "model-00045-of-00122.safetensors",
+ "model.language_model.layers.22.mlp.experts.gate_up_proj": "model-00046-of-00122.safetensors",
+ "model.language_model.layers.22.mlp.experts.down_proj": "model-00047-of-00122.safetensors",
+ "model.language_model.layers.22.post_attention_layernorm.weight": "model-00047-of-00122.safetensors",
+ "model.language_model.layers.23.self_attn.q_proj.weight": "model-00047-of-00122.safetensors",
+ "model.language_model.layers.23.self_attn.k_proj.weight": "model-00047-of-00122.safetensors",
+ "model.language_model.layers.23.self_attn.v_proj.weight": "model-00047-of-00122.safetensors",
+ "model.language_model.layers.23.self_attn.o_proj.weight": "model-00047-of-00122.safetensors",
+ "model.language_model.layers.23.self_attn.q_norm.weight": "model-00047-of-00122.safetensors",
+ "model.language_model.layers.23.self_attn.k_norm.weight": "model-00047-of-00122.safetensors",
+ "model.language_model.layers.23.input_layernorm.weight": "model-00047-of-00122.safetensors",
+ "model.language_model.layers.23.mlp.gate.weight": "model-00047-of-00122.safetensors",
+ "model.language_model.layers.23.mlp.shared_expert.gate_proj.weight": "model-00047-of-00122.safetensors",
+ "model.language_model.layers.23.mlp.shared_expert.up_proj.weight": "model-00047-of-00122.safetensors",
+ "model.language_model.layers.23.mlp.shared_expert.down_proj.weight": "model-00047-of-00122.safetensors",
+ "model.language_model.layers.23.mlp.shared_expert_gate.weight": "model-00047-of-00122.safetensors",
+ "model.language_model.layers.23.mlp.experts.gate_up_proj": "model-00048-of-00122.safetensors",
+ "model.language_model.layers.23.mlp.experts.down_proj": "model-00049-of-00122.safetensors",
+ "model.language_model.layers.23.post_attention_layernorm.weight": "model-00049-of-00122.safetensors",
+ "model.language_model.layers.24.linear_attn.in_proj_qkv.weight": "model-00049-of-00122.safetensors",
+ "model.language_model.layers.24.linear_attn.in_proj_z.weight": "model-00049-of-00122.safetensors",
+ "model.language_model.layers.24.linear_attn.in_proj_b.weight": "model-00049-of-00122.safetensors",
+ "model.language_model.layers.24.linear_attn.in_proj_a.weight": "model-00049-of-00122.safetensors",
+ "model.language_model.layers.24.linear_attn.conv1d.weight": "model-00049-of-00122.safetensors",
+ "model.language_model.layers.24.linear_attn.dt_bias": "model-00049-of-00122.safetensors",
+ "model.language_model.layers.24.linear_attn.A_log": "model-00049-of-00122.safetensors",
+ "model.language_model.layers.24.linear_attn.norm.weight": "model-00049-of-00122.safetensors",
+ "model.language_model.layers.24.linear_attn.out_proj.weight": "model-00049-of-00122.safetensors",
+ "model.language_model.layers.24.input_layernorm.weight": "model-00049-of-00122.safetensors",
+ "model.language_model.layers.24.mlp.gate.weight": "model-00049-of-00122.safetensors",
+ "model.language_model.layers.24.mlp.shared_expert.gate_proj.weight": "model-00049-of-00122.safetensors",
+ "model.language_model.layers.24.mlp.shared_expert.up_proj.weight": "model-00049-of-00122.safetensors",
+ "model.language_model.layers.24.mlp.shared_expert.down_proj.weight": "model-00049-of-00122.safetensors",
+ "model.language_model.layers.24.mlp.shared_expert_gate.weight": "model-00049-of-00122.safetensors",
+ "model.language_model.layers.24.mlp.experts.gate_up_proj": "model-00050-of-00122.safetensors",
+ "model.language_model.layers.24.mlp.experts.down_proj": "model-00051-of-00122.safetensors",
+ "model.language_model.layers.24.post_attention_layernorm.weight": "model-00051-of-00122.safetensors",
+ "model.language_model.layers.25.linear_attn.in_proj_qkv.weight": "model-00051-of-00122.safetensors",
+ "model.language_model.layers.25.linear_attn.in_proj_z.weight": "model-00051-of-00122.safetensors",
+ "model.language_model.layers.25.linear_attn.in_proj_b.weight": "model-00051-of-00122.safetensors",
+ "model.language_model.layers.25.linear_attn.in_proj_a.weight": "model-00051-of-00122.safetensors",
+ "model.language_model.layers.25.linear_attn.conv1d.weight": "model-00051-of-00122.safetensors",
+ "model.language_model.layers.25.linear_attn.dt_bias": "model-00051-of-00122.safetensors",
+ "model.language_model.layers.25.linear_attn.A_log": "model-00051-of-00122.safetensors",
+ "model.language_model.layers.25.linear_attn.norm.weight": "model-00051-of-00122.safetensors",
+ "model.language_model.layers.25.linear_attn.out_proj.weight": "model-00051-of-00122.safetensors",
+ "model.language_model.layers.25.input_layernorm.weight": "model-00051-of-00122.safetensors",
+ "model.language_model.layers.25.mlp.gate.weight": "model-00051-of-00122.safetensors",
+ "model.language_model.layers.25.mlp.shared_expert.gate_proj.weight": "model-00051-of-00122.safetensors",
+ "model.language_model.layers.25.mlp.shared_expert.up_proj.weight": "model-00051-of-00122.safetensors",
+ "model.language_model.layers.25.mlp.shared_expert.down_proj.weight": "model-00051-of-00122.safetensors",
+ "model.language_model.layers.25.mlp.shared_expert_gate.weight": "model-00051-of-00122.safetensors",
+ "model.language_model.layers.25.mlp.experts.gate_up_proj": "model-00052-of-00122.safetensors",
+ "model.language_model.layers.25.mlp.experts.down_proj": "model-00053-of-00122.safetensors",
+ "model.language_model.layers.25.post_attention_layernorm.weight": "model-00053-of-00122.safetensors",
+ "model.language_model.layers.26.linear_attn.in_proj_qkv.weight": "model-00053-of-00122.safetensors",
+ "model.language_model.layers.26.linear_attn.in_proj_z.weight": "model-00053-of-00122.safetensors",
+ "model.language_model.layers.26.linear_attn.in_proj_b.weight": "model-00053-of-00122.safetensors",
+ "model.language_model.layers.26.linear_attn.in_proj_a.weight": "model-00053-of-00122.safetensors",
+ "model.language_model.layers.26.linear_attn.conv1d.weight": "model-00053-of-00122.safetensors",
+ "model.language_model.layers.26.linear_attn.dt_bias": "model-00053-of-00122.safetensors",
+ "model.language_model.layers.26.linear_attn.A_log": "model-00053-of-00122.safetensors",
+ "model.language_model.layers.26.linear_attn.norm.weight": "model-00053-of-00122.safetensors",
+ "model.language_model.layers.26.linear_attn.out_proj.weight": "model-00053-of-00122.safetensors",
+ "model.language_model.layers.26.input_layernorm.weight": "model-00053-of-00122.safetensors",
+ "model.language_model.layers.26.mlp.gate.weight": "model-00053-of-00122.safetensors",
+ "model.language_model.layers.26.mlp.shared_expert.gate_proj.weight": "model-00053-of-00122.safetensors",
+ "model.language_model.layers.26.mlp.shared_expert.up_proj.weight": "model-00053-of-00122.safetensors",
+ "model.language_model.layers.26.mlp.shared_expert.down_proj.weight": "model-00053-of-00122.safetensors",
+ "model.language_model.layers.26.mlp.shared_expert_gate.weight": "model-00053-of-00122.safetensors",
+ "model.language_model.layers.26.mlp.experts.gate_up_proj": "model-00054-of-00122.safetensors",
+ "model.language_model.layers.26.mlp.experts.down_proj": "model-00055-of-00122.safetensors",
+ "model.language_model.layers.26.post_attention_layernorm.weight": "model-00055-of-00122.safetensors",
+ "model.language_model.layers.27.self_attn.q_proj.weight": "model-00055-of-00122.safetensors",
+ "model.language_model.layers.27.self_attn.k_proj.weight": "model-00055-of-00122.safetensors",
+ "model.language_model.layers.27.self_attn.v_proj.weight": "model-00055-of-00122.safetensors",
+ "model.language_model.layers.27.self_attn.o_proj.weight": "model-00055-of-00122.safetensors",
+ "model.language_model.layers.27.self_attn.q_norm.weight": "model-00055-of-00122.safetensors",
+ "model.language_model.layers.27.self_attn.k_norm.weight": "model-00055-of-00122.safetensors",
+ "model.language_model.layers.27.input_layernorm.weight": "model-00055-of-00122.safetensors",
+ "model.language_model.layers.27.mlp.gate.weight": "model-00055-of-00122.safetensors",
+ "model.language_model.layers.27.mlp.shared_expert.gate_proj.weight": "model-00055-of-00122.safetensors",
+ "model.language_model.layers.27.mlp.shared_expert.up_proj.weight": "model-00055-of-00122.safetensors",
+ "model.language_model.layers.27.mlp.shared_expert.down_proj.weight": "model-00055-of-00122.safetensors",
+ "model.language_model.layers.27.mlp.shared_expert_gate.weight": "model-00055-of-00122.safetensors",
+ "model.language_model.layers.27.mlp.experts.gate_up_proj": "model-00056-of-00122.safetensors",
+ "model.language_model.layers.27.mlp.experts.down_proj": "model-00057-of-00122.safetensors",
+ "model.language_model.layers.27.post_attention_layernorm.weight": "model-00057-of-00122.safetensors",
+ "model.language_model.layers.28.linear_attn.in_proj_qkv.weight": "model-00057-of-00122.safetensors",
+ "model.language_model.layers.28.linear_attn.in_proj_z.weight": "model-00057-of-00122.safetensors",
+ "model.language_model.layers.28.linear_attn.in_proj_b.weight": "model-00057-of-00122.safetensors",
+ "model.language_model.layers.28.linear_attn.in_proj_a.weight": "model-00057-of-00122.safetensors",
+ "model.language_model.layers.28.linear_attn.conv1d.weight": "model-00057-of-00122.safetensors",
+ "model.language_model.layers.28.linear_attn.dt_bias": "model-00057-of-00122.safetensors",
+ "model.language_model.layers.28.linear_attn.A_log": "model-00057-of-00122.safetensors",
+ "model.language_model.layers.28.linear_attn.norm.weight": "model-00057-of-00122.safetensors",
+ "model.language_model.layers.28.linear_attn.out_proj.weight": "model-00057-of-00122.safetensors",
+ "model.language_model.layers.28.input_layernorm.weight": "model-00057-of-00122.safetensors",
+ "model.language_model.layers.28.mlp.gate.weight": "model-00057-of-00122.safetensors",
+ "model.language_model.layers.28.mlp.shared_expert.gate_proj.weight": "model-00057-of-00122.safetensors",
+ "model.language_model.layers.28.mlp.shared_expert.up_proj.weight": "model-00057-of-00122.safetensors",
+ "model.language_model.layers.28.mlp.shared_expert.down_proj.weight": "model-00057-of-00122.safetensors",
+ "model.language_model.layers.28.mlp.shared_expert_gate.weight": "model-00057-of-00122.safetensors",
+ "model.language_model.layers.28.mlp.experts.gate_up_proj": "model-00058-of-00122.safetensors",
+ "model.language_model.layers.28.mlp.experts.down_proj": "model-00059-of-00122.safetensors",
+ "model.language_model.layers.28.post_attention_layernorm.weight": "model-00059-of-00122.safetensors",
+ "model.language_model.layers.29.linear_attn.in_proj_qkv.weight": "model-00059-of-00122.safetensors",
+ "model.language_model.layers.29.linear_attn.in_proj_z.weight": "model-00059-of-00122.safetensors",
+ "model.language_model.layers.29.linear_attn.in_proj_b.weight": "model-00059-of-00122.safetensors",
+ "model.language_model.layers.29.linear_attn.in_proj_a.weight": "model-00059-of-00122.safetensors",
+ "model.language_model.layers.29.linear_attn.conv1d.weight": "model-00059-of-00122.safetensors",
+ "model.language_model.layers.29.linear_attn.dt_bias": "model-00059-of-00122.safetensors",
+ "model.language_model.layers.29.linear_attn.A_log": "model-00059-of-00122.safetensors",
+ "model.language_model.layers.29.linear_attn.norm.weight": "model-00059-of-00122.safetensors",
+ "model.language_model.layers.29.linear_attn.out_proj.weight": "model-00059-of-00122.safetensors",
+ "model.language_model.layers.29.input_layernorm.weight": "model-00059-of-00122.safetensors",
+ "model.language_model.layers.29.mlp.gate.weight": "model-00059-of-00122.safetensors",
+ "model.language_model.layers.29.mlp.shared_expert.gate_proj.weight": "model-00059-of-00122.safetensors",
+ "model.language_model.layers.29.mlp.shared_expert.up_proj.weight": "model-00059-of-00122.safetensors",
+ "model.language_model.layers.29.mlp.shared_expert.down_proj.weight": "model-00059-of-00122.safetensors",
+ "model.language_model.layers.29.mlp.shared_expert_gate.weight": "model-00059-of-00122.safetensors",
+ "model.language_model.layers.29.mlp.experts.gate_up_proj": "model-00060-of-00122.safetensors",
+ "model.language_model.layers.29.mlp.experts.down_proj": "model-00061-of-00122.safetensors",
+ "model.language_model.layers.29.post_attention_layernorm.weight": "model-00061-of-00122.safetensors",
+ "model.language_model.layers.30.linear_attn.in_proj_qkv.weight": "model-00061-of-00122.safetensors",
+ "model.language_model.layers.30.linear_attn.in_proj_z.weight": "model-00061-of-00122.safetensors",
+ "model.language_model.layers.30.linear_attn.in_proj_b.weight": "model-00061-of-00122.safetensors",
+ "model.language_model.layers.30.linear_attn.in_proj_a.weight": "model-00061-of-00122.safetensors",
+ "model.language_model.layers.30.linear_attn.conv1d.weight": "model-00061-of-00122.safetensors",
+ "model.language_model.layers.30.linear_attn.dt_bias": "model-00061-of-00122.safetensors",
+ "model.language_model.layers.30.linear_attn.A_log": "model-00061-of-00122.safetensors",
+ "model.language_model.layers.30.linear_attn.norm.weight": "model-00061-of-00122.safetensors",
+ "model.language_model.layers.30.linear_attn.out_proj.weight": "model-00061-of-00122.safetensors",
+ "model.language_model.layers.30.input_layernorm.weight": "model-00061-of-00122.safetensors",
+ "model.language_model.layers.30.mlp.gate.weight": "model-00061-of-00122.safetensors",
+ "model.language_model.layers.30.mlp.shared_expert.gate_proj.weight": "model-00061-of-00122.safetensors",
+ "model.language_model.layers.30.mlp.shared_expert.up_proj.weight": "model-00061-of-00122.safetensors",
+ "model.language_model.layers.30.mlp.shared_expert.down_proj.weight": "model-00061-of-00122.safetensors",
+ "model.language_model.layers.30.mlp.shared_expert_gate.weight": "model-00061-of-00122.safetensors",
+ "model.language_model.layers.30.mlp.experts.gate_up_proj": "model-00062-of-00122.safetensors",
+ "model.language_model.layers.30.mlp.experts.down_proj": "model-00063-of-00122.safetensors",
+ "model.language_model.layers.30.post_attention_layernorm.weight": "model-00063-of-00122.safetensors",
+ "model.language_model.layers.31.self_attn.q_proj.weight": "model-00063-of-00122.safetensors",
+ "model.language_model.layers.31.self_attn.k_proj.weight": "model-00063-of-00122.safetensors",
+ "model.language_model.layers.31.self_attn.v_proj.weight": "model-00063-of-00122.safetensors",
+ "model.language_model.layers.31.self_attn.o_proj.weight": "model-00063-of-00122.safetensors",
+ "model.language_model.layers.31.self_attn.q_norm.weight": "model-00063-of-00122.safetensors",
+ "model.language_model.layers.31.self_attn.k_norm.weight": "model-00063-of-00122.safetensors",
+ "model.language_model.layers.31.input_layernorm.weight": "model-00063-of-00122.safetensors",
+ "model.language_model.layers.31.mlp.gate.weight": "model-00063-of-00122.safetensors",
+ "model.language_model.layers.31.mlp.shared_expert.gate_proj.weight": "model-00063-of-00122.safetensors",
+ "model.language_model.layers.31.mlp.shared_expert.up_proj.weight": "model-00063-of-00122.safetensors",
+ "model.language_model.layers.31.mlp.shared_expert.down_proj.weight": "model-00063-of-00122.safetensors",
+ "model.language_model.layers.31.mlp.shared_expert_gate.weight": "model-00063-of-00122.safetensors",
+ "model.language_model.layers.31.mlp.experts.gate_up_proj": "model-00064-of-00122.safetensors",
+ "model.language_model.layers.31.mlp.experts.down_proj": "model-00065-of-00122.safetensors",
+ "model.language_model.layers.31.post_attention_layernorm.weight": "model-00065-of-00122.safetensors",
+ "model.language_model.layers.32.linear_attn.in_proj_qkv.weight": "model-00065-of-00122.safetensors",
+ "model.language_model.layers.32.linear_attn.in_proj_z.weight": "model-00065-of-00122.safetensors",
+ "model.language_model.layers.32.linear_attn.in_proj_b.weight": "model-00065-of-00122.safetensors",
+ "model.language_model.layers.32.linear_attn.in_proj_a.weight": "model-00065-of-00122.safetensors",
+ "model.language_model.layers.32.linear_attn.conv1d.weight": "model-00065-of-00122.safetensors",
+ "model.language_model.layers.32.linear_attn.dt_bias": "model-00065-of-00122.safetensors",
+ "model.language_model.layers.32.linear_attn.A_log": "model-00065-of-00122.safetensors",
+ "model.language_model.layers.32.linear_attn.norm.weight": "model-00065-of-00122.safetensors",
+ "model.language_model.layers.32.linear_attn.out_proj.weight": "model-00065-of-00122.safetensors",
+ "model.language_model.layers.32.input_layernorm.weight": "model-00065-of-00122.safetensors",
+ "model.language_model.layers.32.mlp.gate.weight": "model-00065-of-00122.safetensors",
+ "model.language_model.layers.32.mlp.shared_expert.gate_proj.weight": "model-00065-of-00122.safetensors",
+ "model.language_model.layers.32.mlp.shared_expert.up_proj.weight": "model-00065-of-00122.safetensors",
+ "model.language_model.layers.32.mlp.shared_expert.down_proj.weight": "model-00065-of-00122.safetensors",
+ "model.language_model.layers.32.mlp.shared_expert_gate.weight": "model-00065-of-00122.safetensors",
+ "model.language_model.layers.32.mlp.experts.gate_up_proj": "model-00066-of-00122.safetensors",
+ "model.language_model.layers.32.mlp.experts.down_proj": "model-00067-of-00122.safetensors",
+ "model.language_model.layers.32.post_attention_layernorm.weight": "model-00067-of-00122.safetensors",
+ "model.language_model.layers.33.linear_attn.in_proj_qkv.weight": "model-00067-of-00122.safetensors",
+ "model.language_model.layers.33.linear_attn.in_proj_z.weight": "model-00067-of-00122.safetensors",
+ "model.language_model.layers.33.linear_attn.in_proj_b.weight": "model-00067-of-00122.safetensors",
+ "model.language_model.layers.33.linear_attn.in_proj_a.weight": "model-00067-of-00122.safetensors",
+ "model.language_model.layers.33.linear_attn.conv1d.weight": "model-00067-of-00122.safetensors",
+ "model.language_model.layers.33.linear_attn.dt_bias": "model-00067-of-00122.safetensors",
+ "model.language_model.layers.33.linear_attn.A_log": "model-00067-of-00122.safetensors",
+ "model.language_model.layers.33.linear_attn.norm.weight": "model-00067-of-00122.safetensors",
+ "model.language_model.layers.33.linear_attn.out_proj.weight": "model-00067-of-00122.safetensors",
+ "model.language_model.layers.33.input_layernorm.weight": "model-00067-of-00122.safetensors",
+ "model.language_model.layers.33.mlp.gate.weight": "model-00067-of-00122.safetensors",
+ "model.language_model.layers.33.mlp.shared_expert.gate_proj.weight": "model-00067-of-00122.safetensors",
+ "model.language_model.layers.33.mlp.shared_expert.up_proj.weight": "model-00067-of-00122.safetensors",
+ "model.language_model.layers.33.mlp.shared_expert.down_proj.weight": "model-00067-of-00122.safetensors",
+ "model.language_model.layers.33.mlp.shared_expert_gate.weight": "model-00067-of-00122.safetensors",
+ "model.language_model.layers.33.mlp.experts.gate_up_proj": "model-00068-of-00122.safetensors",
+ "model.language_model.layers.33.mlp.experts.down_proj": "model-00069-of-00122.safetensors",
+ "model.language_model.layers.33.post_attention_layernorm.weight": "model-00069-of-00122.safetensors",
+ "model.language_model.layers.34.linear_attn.in_proj_qkv.weight": "model-00069-of-00122.safetensors",
+ "model.language_model.layers.34.linear_attn.in_proj_z.weight": "model-00069-of-00122.safetensors",
+ "model.language_model.layers.34.linear_attn.in_proj_b.weight": "model-00069-of-00122.safetensors",
+ "model.language_model.layers.34.linear_attn.in_proj_a.weight": "model-00069-of-00122.safetensors",
+ "model.language_model.layers.34.linear_attn.conv1d.weight": "model-00069-of-00122.safetensors",
+ "model.language_model.layers.34.linear_attn.dt_bias": "model-00069-of-00122.safetensors",
+ "model.language_model.layers.34.linear_attn.A_log": "model-00069-of-00122.safetensors",
+ "model.language_model.layers.34.linear_attn.norm.weight": "model-00069-of-00122.safetensors",
+ "model.language_model.layers.34.linear_attn.out_proj.weight": "model-00069-of-00122.safetensors",
+ "model.language_model.layers.34.input_layernorm.weight": "model-00069-of-00122.safetensors",
+ "model.language_model.layers.34.mlp.gate.weight": "model-00069-of-00122.safetensors",
+ "model.language_model.layers.34.mlp.shared_expert.gate_proj.weight": "model-00069-of-00122.safetensors",
+ "model.language_model.layers.34.mlp.shared_expert.up_proj.weight": "model-00069-of-00122.safetensors",
+ "model.language_model.layers.34.mlp.shared_expert.down_proj.weight": "model-00069-of-00122.safetensors",
+ "model.language_model.layers.34.mlp.shared_expert_gate.weight": "model-00069-of-00122.safetensors",
+ "model.language_model.layers.34.mlp.experts.gate_up_proj": "model-00070-of-00122.safetensors",
+ "model.language_model.layers.34.mlp.experts.down_proj": "model-00071-of-00122.safetensors",
+ "model.language_model.layers.34.post_attention_layernorm.weight": "model-00071-of-00122.safetensors",
+ "model.language_model.layers.35.self_attn.q_proj.weight": "model-00071-of-00122.safetensors",
+ "model.language_model.layers.35.self_attn.k_proj.weight": "model-00071-of-00122.safetensors",
+ "model.language_model.layers.35.self_attn.v_proj.weight": "model-00071-of-00122.safetensors",
+ "model.language_model.layers.35.self_attn.o_proj.weight": "model-00071-of-00122.safetensors",
+ "model.language_model.layers.35.self_attn.q_norm.weight": "model-00071-of-00122.safetensors",
+ "model.language_model.layers.35.self_attn.k_norm.weight": "model-00071-of-00122.safetensors",
+ "model.language_model.layers.35.input_layernorm.weight": "model-00071-of-00122.safetensors",
+ "model.language_model.layers.35.mlp.gate.weight": "model-00071-of-00122.safetensors",
+ "model.language_model.layers.35.mlp.shared_expert.gate_proj.weight": "model-00071-of-00122.safetensors",
+ "model.language_model.layers.35.mlp.shared_expert.up_proj.weight": "model-00071-of-00122.safetensors",
+ "model.language_model.layers.35.mlp.shared_expert.down_proj.weight": "model-00071-of-00122.safetensors",
+ "model.language_model.layers.35.mlp.shared_expert_gate.weight": "model-00071-of-00122.safetensors",
+ "model.language_model.layers.35.mlp.experts.gate_up_proj": "model-00072-of-00122.safetensors",
+ "model.language_model.layers.35.mlp.experts.down_proj": "model-00073-of-00122.safetensors",
+ "model.language_model.layers.35.post_attention_layernorm.weight": "model-00073-of-00122.safetensors",
+ "model.language_model.layers.36.linear_attn.in_proj_qkv.weight": "model-00073-of-00122.safetensors",
+ "model.language_model.layers.36.linear_attn.in_proj_z.weight": "model-00073-of-00122.safetensors",
+ "model.language_model.layers.36.linear_attn.in_proj_b.weight": "model-00073-of-00122.safetensors",
+ "model.language_model.layers.36.linear_attn.in_proj_a.weight": "model-00073-of-00122.safetensors",
+ "model.language_model.layers.36.linear_attn.conv1d.weight": "model-00073-of-00122.safetensors",
+ "model.language_model.layers.36.linear_attn.dt_bias": "model-00073-of-00122.safetensors",
+ "model.language_model.layers.36.linear_attn.A_log": "model-00073-of-00122.safetensors",
+ "model.language_model.layers.36.linear_attn.norm.weight": "model-00073-of-00122.safetensors",
+ "model.language_model.layers.36.linear_attn.out_proj.weight": "model-00073-of-00122.safetensors",
+ "model.language_model.layers.36.input_layernorm.weight": "model-00073-of-00122.safetensors",
+ "model.language_model.layers.36.mlp.gate.weight": "model-00073-of-00122.safetensors",
+ "model.language_model.layers.36.mlp.shared_expert.gate_proj.weight": "model-00073-of-00122.safetensors",
+ "model.language_model.layers.36.mlp.shared_expert.up_proj.weight": "model-00073-of-00122.safetensors",
+ "model.language_model.layers.36.mlp.shared_expert.down_proj.weight": "model-00073-of-00122.safetensors",
+ "model.language_model.layers.36.mlp.shared_expert_gate.weight": "model-00073-of-00122.safetensors",
+ "model.language_model.layers.36.mlp.experts.gate_up_proj": "model-00074-of-00122.safetensors",
+ "model.language_model.layers.36.mlp.experts.down_proj": "model-00075-of-00122.safetensors",
+ "model.language_model.layers.36.post_attention_layernorm.weight": "model-00075-of-00122.safetensors",
+ "model.language_model.layers.37.linear_attn.in_proj_qkv.weight": "model-00075-of-00122.safetensors",
+ "model.language_model.layers.37.linear_attn.in_proj_z.weight": "model-00075-of-00122.safetensors",
+ "model.language_model.layers.37.linear_attn.in_proj_b.weight": "model-00075-of-00122.safetensors",
+ "model.language_model.layers.37.linear_attn.in_proj_a.weight": "model-00075-of-00122.safetensors",
+ "model.language_model.layers.37.linear_attn.conv1d.weight": "model-00075-of-00122.safetensors",
+ "model.language_model.layers.37.linear_attn.dt_bias": "model-00075-of-00122.safetensors",
+ "model.language_model.layers.37.linear_attn.A_log": "model-00075-of-00122.safetensors",
+ "model.language_model.layers.37.linear_attn.norm.weight": "model-00075-of-00122.safetensors",
+ "model.language_model.layers.37.linear_attn.out_proj.weight": "model-00075-of-00122.safetensors",
+ "model.language_model.layers.37.input_layernorm.weight": "model-00075-of-00122.safetensors",
+ "model.language_model.layers.37.mlp.gate.weight": "model-00075-of-00122.safetensors",
+ "model.language_model.layers.37.mlp.shared_expert.gate_proj.weight": "model-00075-of-00122.safetensors",
+ "model.language_model.layers.37.mlp.shared_expert.up_proj.weight": "model-00075-of-00122.safetensors",
+ "model.language_model.layers.37.mlp.shared_expert.down_proj.weight": "model-00075-of-00122.safetensors",
+ "model.language_model.layers.37.mlp.shared_expert_gate.weight": "model-00075-of-00122.safetensors",
+ "model.language_model.layers.37.mlp.experts.gate_up_proj": "model-00076-of-00122.safetensors",
+ "model.language_model.layers.37.mlp.experts.down_proj": "model-00077-of-00122.safetensors",
+ "model.language_model.layers.37.post_attention_layernorm.weight": "model-00077-of-00122.safetensors",
+ "model.language_model.layers.38.linear_attn.in_proj_qkv.weight": "model-00077-of-00122.safetensors",
+ "model.language_model.layers.38.linear_attn.in_proj_z.weight": "model-00077-of-00122.safetensors",
+ "model.language_model.layers.38.linear_attn.in_proj_b.weight": "model-00077-of-00122.safetensors",
+ "model.language_model.layers.38.linear_attn.in_proj_a.weight": "model-00077-of-00122.safetensors",
+ "model.language_model.layers.38.linear_attn.conv1d.weight": "model-00077-of-00122.safetensors",
+ "model.language_model.layers.38.linear_attn.dt_bias": "model-00077-of-00122.safetensors",
+ "model.language_model.layers.38.linear_attn.A_log": "model-00077-of-00122.safetensors",
+ "model.language_model.layers.38.linear_attn.norm.weight": "model-00077-of-00122.safetensors",
+ "model.language_model.layers.38.linear_attn.out_proj.weight": "model-00077-of-00122.safetensors",
+ "model.language_model.layers.38.input_layernorm.weight": "model-00077-of-00122.safetensors",
+ "model.language_model.layers.38.mlp.gate.weight": "model-00077-of-00122.safetensors",
+ "model.language_model.layers.38.mlp.shared_expert.gate_proj.weight": "model-00077-of-00122.safetensors",
+ "model.language_model.layers.38.mlp.shared_expert.up_proj.weight": "model-00077-of-00122.safetensors",
+ "model.language_model.layers.38.mlp.shared_expert.down_proj.weight": "model-00077-of-00122.safetensors",
+ "model.language_model.layers.38.mlp.shared_expert_gate.weight": "model-00077-of-00122.safetensors",
+ "model.language_model.layers.38.mlp.experts.gate_up_proj": "model-00078-of-00122.safetensors",
+ "model.language_model.layers.38.mlp.experts.down_proj": "model-00079-of-00122.safetensors",
+ "model.language_model.layers.38.post_attention_layernorm.weight": "model-00079-of-00122.safetensors",
+ "model.language_model.layers.39.self_attn.q_proj.weight": "model-00079-of-00122.safetensors",
+ "model.language_model.layers.39.self_attn.k_proj.weight": "model-00079-of-00122.safetensors",
+ "model.language_model.layers.39.self_attn.v_proj.weight": "model-00079-of-00122.safetensors",
+ "model.language_model.layers.39.self_attn.o_proj.weight": "model-00079-of-00122.safetensors",
+ "model.language_model.layers.39.self_attn.q_norm.weight": "model-00079-of-00122.safetensors",
+ "model.language_model.layers.39.self_attn.k_norm.weight": "model-00079-of-00122.safetensors",
+ "model.language_model.layers.39.input_layernorm.weight": "model-00079-of-00122.safetensors",
+ "model.language_model.layers.39.mlp.gate.weight": "model-00079-of-00122.safetensors",
+ "model.language_model.layers.39.mlp.shared_expert.gate_proj.weight": "model-00079-of-00122.safetensors",
+ "model.language_model.layers.39.mlp.shared_expert.up_proj.weight": "model-00079-of-00122.safetensors",
+ "model.language_model.layers.39.mlp.shared_expert.down_proj.weight": "model-00079-of-00122.safetensors",
+ "model.language_model.layers.39.mlp.shared_expert_gate.weight": "model-00079-of-00122.safetensors",
+ "model.language_model.layers.39.mlp.experts.gate_up_proj": "model-00080-of-00122.safetensors",
+ "model.language_model.layers.39.mlp.experts.down_proj": "model-00081-of-00122.safetensors",
+ "model.language_model.layers.39.post_attention_layernorm.weight": "model-00081-of-00122.safetensors",
+ "model.language_model.layers.40.linear_attn.in_proj_qkv.weight": "model-00081-of-00122.safetensors",
+ "model.language_model.layers.40.linear_attn.in_proj_z.weight": "model-00081-of-00122.safetensors",
+ "model.language_model.layers.40.linear_attn.in_proj_b.weight": "model-00081-of-00122.safetensors",
+ "model.language_model.layers.40.linear_attn.in_proj_a.weight": "model-00081-of-00122.safetensors",
+ "model.language_model.layers.40.linear_attn.conv1d.weight": "model-00081-of-00122.safetensors",
+ "model.language_model.layers.40.linear_attn.dt_bias": "model-00081-of-00122.safetensors",
+ "model.language_model.layers.40.linear_attn.A_log": "model-00081-of-00122.safetensors",
+ "model.language_model.layers.40.linear_attn.norm.weight": "model-00081-of-00122.safetensors",
+ "model.language_model.layers.40.linear_attn.out_proj.weight": "model-00081-of-00122.safetensors",
+ "model.language_model.layers.40.input_layernorm.weight": "model-00081-of-00122.safetensors",
+ "model.language_model.layers.40.mlp.gate.weight": "model-00081-of-00122.safetensors",
+ "model.language_model.layers.40.mlp.shared_expert.gate_proj.weight": "model-00081-of-00122.safetensors",
+ "model.language_model.layers.40.mlp.shared_expert.up_proj.weight": "model-00081-of-00122.safetensors",
+ "model.language_model.layers.40.mlp.shared_expert.down_proj.weight": "model-00081-of-00122.safetensors",
+ "model.language_model.layers.40.mlp.shared_expert_gate.weight": "model-00081-of-00122.safetensors",
+ "model.language_model.layers.40.mlp.experts.gate_up_proj": "model-00082-of-00122.safetensors",
+ "model.language_model.layers.40.mlp.experts.down_proj": "model-00083-of-00122.safetensors",
+ "model.language_model.layers.40.post_attention_layernorm.weight": "model-00083-of-00122.safetensors",
+ "model.language_model.layers.41.linear_attn.in_proj_qkv.weight": "model-00083-of-00122.safetensors",
+ "model.language_model.layers.41.linear_attn.in_proj_z.weight": "model-00083-of-00122.safetensors",
+ "model.language_model.layers.41.linear_attn.in_proj_b.weight": "model-00083-of-00122.safetensors",
+ "model.language_model.layers.41.linear_attn.in_proj_a.weight": "model-00083-of-00122.safetensors",
+ "model.language_model.layers.41.linear_attn.conv1d.weight": "model-00083-of-00122.safetensors",
+ "model.language_model.layers.41.linear_attn.dt_bias": "model-00083-of-00122.safetensors",
+ "model.language_model.layers.41.linear_attn.A_log": "model-00083-of-00122.safetensors",
+ "model.language_model.layers.41.linear_attn.norm.weight": "model-00083-of-00122.safetensors",
+ "model.language_model.layers.41.linear_attn.out_proj.weight": "model-00083-of-00122.safetensors",
+ "model.language_model.layers.41.input_layernorm.weight": "model-00083-of-00122.safetensors",
+ "model.language_model.layers.41.mlp.gate.weight": "model-00083-of-00122.safetensors",
+ "model.language_model.layers.41.mlp.shared_expert.gate_proj.weight": "model-00083-of-00122.safetensors",
+ "model.language_model.layers.41.mlp.shared_expert.up_proj.weight": "model-00083-of-00122.safetensors",
+ "model.language_model.layers.41.mlp.shared_expert.down_proj.weight": "model-00083-of-00122.safetensors",
+ "model.language_model.layers.41.mlp.shared_expert_gate.weight": "model-00083-of-00122.safetensors",
+ "model.language_model.layers.41.mlp.experts.gate_up_proj": "model-00084-of-00122.safetensors",
+ "model.language_model.layers.41.mlp.experts.down_proj": "model-00085-of-00122.safetensors",
+ "model.language_model.layers.41.post_attention_layernorm.weight": "model-00085-of-00122.safetensors",
+ "model.language_model.layers.42.linear_attn.in_proj_qkv.weight": "model-00085-of-00122.safetensors",
+ "model.language_model.layers.42.linear_attn.in_proj_z.weight": "model-00085-of-00122.safetensors",
+ "model.language_model.layers.42.linear_attn.in_proj_b.weight": "model-00085-of-00122.safetensors",
+ "model.language_model.layers.42.linear_attn.in_proj_a.weight": "model-00085-of-00122.safetensors",
+ "model.language_model.layers.42.linear_attn.conv1d.weight": "model-00085-of-00122.safetensors",
+ "model.language_model.layers.42.linear_attn.dt_bias": "model-00085-of-00122.safetensors",
+ "model.language_model.layers.42.linear_attn.A_log": "model-00085-of-00122.safetensors",
+ "model.language_model.layers.42.linear_attn.norm.weight": "model-00085-of-00122.safetensors",
+ "model.language_model.layers.42.linear_attn.out_proj.weight": "model-00085-of-00122.safetensors",
+ "model.language_model.layers.42.input_layernorm.weight": "model-00085-of-00122.safetensors",
+ "model.language_model.layers.42.mlp.gate.weight": "model-00085-of-00122.safetensors",
+ "model.language_model.layers.42.mlp.shared_expert.gate_proj.weight": "model-00085-of-00122.safetensors",
+ "model.language_model.layers.42.mlp.shared_expert.up_proj.weight": "model-00085-of-00122.safetensors",
+ "model.language_model.layers.42.mlp.shared_expert.down_proj.weight": "model-00085-of-00122.safetensors",
+ "model.language_model.layers.42.mlp.shared_expert_gate.weight": "model-00085-of-00122.safetensors",
+ "model.language_model.layers.42.mlp.experts.gate_up_proj": "model-00086-of-00122.safetensors",
+ "model.language_model.layers.42.mlp.experts.down_proj": "model-00087-of-00122.safetensors",
+ "model.language_model.layers.42.post_attention_layernorm.weight": "model-00087-of-00122.safetensors",
+ "model.language_model.layers.43.self_attn.q_proj.weight": "model-00087-of-00122.safetensors",
+ "model.language_model.layers.43.self_attn.k_proj.weight": "model-00087-of-00122.safetensors",
+ "model.language_model.layers.43.self_attn.v_proj.weight": "model-00087-of-00122.safetensors",
+ "model.language_model.layers.43.self_attn.o_proj.weight": "model-00087-of-00122.safetensors",
+ "model.language_model.layers.43.self_attn.q_norm.weight": "model-00087-of-00122.safetensors",
+ "model.language_model.layers.43.self_attn.k_norm.weight": "model-00087-of-00122.safetensors",
+ "model.language_model.layers.43.input_layernorm.weight": "model-00087-of-00122.safetensors",
+ "model.language_model.layers.43.mlp.gate.weight": "model-00087-of-00122.safetensors",
+ "model.language_model.layers.43.mlp.shared_expert.gate_proj.weight": "model-00087-of-00122.safetensors",
+ "model.language_model.layers.43.mlp.shared_expert.up_proj.weight": "model-00087-of-00122.safetensors",
+ "model.language_model.layers.43.mlp.shared_expert.down_proj.weight": "model-00087-of-00122.safetensors",
+ "model.language_model.layers.43.mlp.shared_expert_gate.weight": "model-00087-of-00122.safetensors",
+ "model.language_model.layers.43.mlp.experts.gate_up_proj": "model-00088-of-00122.safetensors",
+ "model.language_model.layers.43.mlp.experts.down_proj": "model-00089-of-00122.safetensors",
+ "model.language_model.layers.43.post_attention_layernorm.weight": "model-00089-of-00122.safetensors",
+ "model.language_model.layers.44.linear_attn.in_proj_qkv.weight": "model-00089-of-00122.safetensors",
+ "model.language_model.layers.44.linear_attn.in_proj_z.weight": "model-00089-of-00122.safetensors",
+ "model.language_model.layers.44.linear_attn.in_proj_b.weight": "model-00089-of-00122.safetensors",
+ "model.language_model.layers.44.linear_attn.in_proj_a.weight": "model-00089-of-00122.safetensors",
+ "model.language_model.layers.44.linear_attn.conv1d.weight": "model-00089-of-00122.safetensors",
+ "model.language_model.layers.44.linear_attn.dt_bias": "model-00089-of-00122.safetensors",
+ "model.language_model.layers.44.linear_attn.A_log": "model-00089-of-00122.safetensors",
+ "model.language_model.layers.44.linear_attn.norm.weight": "model-00089-of-00122.safetensors",
+ "model.language_model.layers.44.linear_attn.out_proj.weight": "model-00089-of-00122.safetensors",
+ "model.language_model.layers.44.input_layernorm.weight": "model-00089-of-00122.safetensors",
+ "model.language_model.layers.44.mlp.gate.weight": "model-00089-of-00122.safetensors",
+ "model.language_model.layers.44.mlp.shared_expert.gate_proj.weight": "model-00089-of-00122.safetensors",
+ "model.language_model.layers.44.mlp.shared_expert.up_proj.weight": "model-00089-of-00122.safetensors",
+ "model.language_model.layers.44.mlp.shared_expert.down_proj.weight": "model-00089-of-00122.safetensors",
+ "model.language_model.layers.44.mlp.shared_expert_gate.weight": "model-00089-of-00122.safetensors",
+ "model.language_model.layers.44.mlp.experts.gate_up_proj": "model-00090-of-00122.safetensors",
+ "model.language_model.layers.44.mlp.experts.down_proj": "model-00091-of-00122.safetensors",
+ "model.language_model.layers.44.post_attention_layernorm.weight": "model-00091-of-00122.safetensors",
+ "model.language_model.layers.45.linear_attn.in_proj_qkv.weight": "model-00091-of-00122.safetensors",
+ "model.language_model.layers.45.linear_attn.in_proj_z.weight": "model-00091-of-00122.safetensors",
+ "model.language_model.layers.45.linear_attn.in_proj_b.weight": "model-00091-of-00122.safetensors",
+ "model.language_model.layers.45.linear_attn.in_proj_a.weight": "model-00091-of-00122.safetensors",
+ "model.language_model.layers.45.linear_attn.conv1d.weight": "model-00091-of-00122.safetensors",
+ "model.language_model.layers.45.linear_attn.dt_bias": "model-00091-of-00122.safetensors",
+ "model.language_model.layers.45.linear_attn.A_log": "model-00091-of-00122.safetensors",
+ "model.language_model.layers.45.linear_attn.norm.weight": "model-00091-of-00122.safetensors",
+ "model.language_model.layers.45.linear_attn.out_proj.weight": "model-00091-of-00122.safetensors",
+ "model.language_model.layers.45.input_layernorm.weight": "model-00091-of-00122.safetensors",
+ "model.language_model.layers.45.mlp.gate.weight": "model-00091-of-00122.safetensors",
+ "model.language_model.layers.45.mlp.shared_expert.gate_proj.weight": "model-00091-of-00122.safetensors",
+ "model.language_model.layers.45.mlp.shared_expert.up_proj.weight": "model-00091-of-00122.safetensors",
+ "model.language_model.layers.45.mlp.shared_expert.down_proj.weight": "model-00091-of-00122.safetensors",
+ "model.language_model.layers.45.mlp.shared_expert_gate.weight": "model-00091-of-00122.safetensors",
+ "model.language_model.layers.45.mlp.experts.gate_up_proj": "model-00092-of-00122.safetensors",
+ "model.language_model.layers.45.mlp.experts.down_proj": "model-00093-of-00122.safetensors",
+ "model.language_model.layers.45.post_attention_layernorm.weight": "model-00093-of-00122.safetensors",
+ "model.language_model.layers.46.linear_attn.in_proj_qkv.weight": "model-00093-of-00122.safetensors",
+ "model.language_model.layers.46.linear_attn.in_proj_z.weight": "model-00093-of-00122.safetensors",
+ "model.language_model.layers.46.linear_attn.in_proj_b.weight": "model-00093-of-00122.safetensors",
+ "model.language_model.layers.46.linear_attn.in_proj_a.weight": "model-00093-of-00122.safetensors",
+ "model.language_model.layers.46.linear_attn.conv1d.weight": "model-00093-of-00122.safetensors",
+ "model.language_model.layers.46.linear_attn.dt_bias": "model-00093-of-00122.safetensors",
+ "model.language_model.layers.46.linear_attn.A_log": "model-00093-of-00122.safetensors",
+ "model.language_model.layers.46.linear_attn.norm.weight": "model-00093-of-00122.safetensors",
+ "model.language_model.layers.46.linear_attn.out_proj.weight": "model-00093-of-00122.safetensors",
+ "model.language_model.layers.46.input_layernorm.weight": "model-00093-of-00122.safetensors",
+ "model.language_model.layers.46.mlp.gate.weight": "model-00093-of-00122.safetensors",
+ "model.language_model.layers.46.mlp.shared_expert.gate_proj.weight": "model-00093-of-00122.safetensors",
+ "model.language_model.layers.46.mlp.shared_expert.up_proj.weight": "model-00093-of-00122.safetensors",
+ "model.language_model.layers.46.mlp.shared_expert.down_proj.weight": "model-00093-of-00122.safetensors",
+ "model.language_model.layers.46.mlp.shared_expert_gate.weight": "model-00093-of-00122.safetensors",
+ "model.language_model.layers.46.mlp.experts.gate_up_proj": "model-00094-of-00122.safetensors",
+ "model.language_model.layers.46.mlp.experts.down_proj": "model-00095-of-00122.safetensors",
+ "model.language_model.layers.46.post_attention_layernorm.weight": "model-00095-of-00122.safetensors",
+ "model.language_model.layers.47.self_attn.q_proj.weight": "model-00095-of-00122.safetensors",
+ "model.language_model.layers.47.self_attn.k_proj.weight": "model-00095-of-00122.safetensors",
+ "model.language_model.layers.47.self_attn.v_proj.weight": "model-00095-of-00122.safetensors",
+ "model.language_model.layers.47.self_attn.o_proj.weight": "model-00095-of-00122.safetensors",
+ "model.language_model.layers.47.self_attn.q_norm.weight": "model-00095-of-00122.safetensors",
+ "model.language_model.layers.47.self_attn.k_norm.weight": "model-00095-of-00122.safetensors",
+ "model.language_model.layers.47.input_layernorm.weight": "model-00095-of-00122.safetensors",
+ "model.language_model.layers.47.mlp.gate.weight": "model-00095-of-00122.safetensors",
+ "model.language_model.layers.47.mlp.shared_expert.gate_proj.weight": "model-00095-of-00122.safetensors",
+ "model.language_model.layers.47.mlp.shared_expert.up_proj.weight": "model-00095-of-00122.safetensors",
+ "model.language_model.layers.47.mlp.shared_expert.down_proj.weight": "model-00095-of-00122.safetensors",
+ "model.language_model.layers.47.mlp.shared_expert_gate.weight": "model-00095-of-00122.safetensors",
+ "model.language_model.layers.47.mlp.experts.gate_up_proj": "model-00096-of-00122.safetensors",
+ "model.language_model.layers.47.mlp.experts.down_proj": "model-00097-of-00122.safetensors",
+ "model.language_model.layers.47.post_attention_layernorm.weight": "model-00097-of-00122.safetensors",
+ "model.language_model.layers.48.linear_attn.in_proj_qkv.weight": "model-00097-of-00122.safetensors",
+ "model.language_model.layers.48.linear_attn.in_proj_z.weight": "model-00097-of-00122.safetensors",
+ "model.language_model.layers.48.linear_attn.in_proj_b.weight": "model-00097-of-00122.safetensors",
+ "model.language_model.layers.48.linear_attn.in_proj_a.weight": "model-00097-of-00122.safetensors",
+ "model.language_model.layers.48.linear_attn.conv1d.weight": "model-00097-of-00122.safetensors",
+ "model.language_model.layers.48.linear_attn.dt_bias": "model-00097-of-00122.safetensors",
+ "model.language_model.layers.48.linear_attn.A_log": "model-00097-of-00122.safetensors",
+ "model.language_model.layers.48.linear_attn.norm.weight": "model-00097-of-00122.safetensors",
+ "model.language_model.layers.48.linear_attn.out_proj.weight": "model-00097-of-00122.safetensors",
+ "model.language_model.layers.48.input_layernorm.weight": "model-00097-of-00122.safetensors",
+ "model.language_model.layers.48.mlp.gate.weight": "model-00097-of-00122.safetensors",
+ "model.language_model.layers.48.mlp.shared_expert.gate_proj.weight": "model-00097-of-00122.safetensors",
+ "model.language_model.layers.48.mlp.shared_expert.up_proj.weight": "model-00097-of-00122.safetensors",
+ "model.language_model.layers.48.mlp.shared_expert.down_proj.weight": "model-00097-of-00122.safetensors",
+ "model.language_model.layers.48.mlp.shared_expert_gate.weight": "model-00097-of-00122.safetensors",
+ "model.language_model.layers.48.mlp.experts.gate_up_proj": "model-00098-of-00122.safetensors",
+ "model.language_model.layers.48.mlp.experts.down_proj": "model-00099-of-00122.safetensors",
+ "model.language_model.layers.48.post_attention_layernorm.weight": "model-00099-of-00122.safetensors",
+ "model.language_model.layers.49.linear_attn.in_proj_qkv.weight": "model-00099-of-00122.safetensors",
+ "model.language_model.layers.49.linear_attn.in_proj_z.weight": "model-00099-of-00122.safetensors",
+ "model.language_model.layers.49.linear_attn.in_proj_b.weight": "model-00099-of-00122.safetensors",
+ "model.language_model.layers.49.linear_attn.in_proj_a.weight": "model-00099-of-00122.safetensors",
+ "model.language_model.layers.49.linear_attn.conv1d.weight": "model-00099-of-00122.safetensors",
+ "model.language_model.layers.49.linear_attn.dt_bias": "model-00099-of-00122.safetensors",
+ "model.language_model.layers.49.linear_attn.A_log": "model-00099-of-00122.safetensors",
+ "model.language_model.layers.49.linear_attn.norm.weight": "model-00099-of-00122.safetensors",
+ "model.language_model.layers.49.linear_attn.out_proj.weight": "model-00099-of-00122.safetensors",
+ "model.language_model.layers.49.input_layernorm.weight": "model-00099-of-00122.safetensors",
+ "model.language_model.layers.49.mlp.gate.weight": "model-00099-of-00122.safetensors",
+ "model.language_model.layers.49.mlp.shared_expert.gate_proj.weight": "model-00099-of-00122.safetensors",
+ "model.language_model.layers.49.mlp.shared_expert.up_proj.weight": "model-00099-of-00122.safetensors",
+ "model.language_model.layers.49.mlp.shared_expert.down_proj.weight": "model-00099-of-00122.safetensors",
+ "model.language_model.layers.49.mlp.shared_expert_gate.weight": "model-00099-of-00122.safetensors",
+ "model.language_model.layers.49.mlp.experts.gate_up_proj": "model-00100-of-00122.safetensors",
+ "model.language_model.layers.49.mlp.experts.down_proj": "model-00101-of-00122.safetensors",
+ "model.language_model.layers.49.post_attention_layernorm.weight": "model-00101-of-00122.safetensors",
+ "model.language_model.layers.50.linear_attn.in_proj_qkv.weight": "model-00101-of-00122.safetensors",
+ "model.language_model.layers.50.linear_attn.in_proj_z.weight": "model-00101-of-00122.safetensors",
+ "model.language_model.layers.50.linear_attn.in_proj_b.weight": "model-00101-of-00122.safetensors",
+ "model.language_model.layers.50.linear_attn.in_proj_a.weight": "model-00101-of-00122.safetensors",
+ "model.language_model.layers.50.linear_attn.conv1d.weight": "model-00101-of-00122.safetensors",
+ "model.language_model.layers.50.linear_attn.dt_bias": "model-00101-of-00122.safetensors",
+ "model.language_model.layers.50.linear_attn.A_log": "model-00101-of-00122.safetensors",
+ "model.language_model.layers.50.linear_attn.norm.weight": "model-00101-of-00122.safetensors",
+ "model.language_model.layers.50.linear_attn.out_proj.weight": "model-00101-of-00122.safetensors",
+ "model.language_model.layers.50.input_layernorm.weight": "model-00101-of-00122.safetensors",
+ "model.language_model.layers.50.mlp.gate.weight": "model-00101-of-00122.safetensors",
+ "model.language_model.layers.50.mlp.shared_expert.gate_proj.weight": "model-00101-of-00122.safetensors",
+ "model.language_model.layers.50.mlp.shared_expert.up_proj.weight": "model-00101-of-00122.safetensors",
+ "model.language_model.layers.50.mlp.shared_expert.down_proj.weight": "model-00101-of-00122.safetensors",
+ "model.language_model.layers.50.mlp.shared_expert_gate.weight": "model-00101-of-00122.safetensors",
+ "model.language_model.layers.50.mlp.experts.gate_up_proj": "model-00102-of-00122.safetensors",
+ "model.language_model.layers.50.mlp.experts.down_proj": "model-00103-of-00122.safetensors",
+ "model.language_model.layers.50.post_attention_layernorm.weight": "model-00103-of-00122.safetensors",
+ "model.language_model.layers.51.self_attn.q_proj.weight": "model-00103-of-00122.safetensors",
+ "model.language_model.layers.51.self_attn.k_proj.weight": "model-00103-of-00122.safetensors",
+ "model.language_model.layers.51.self_attn.v_proj.weight": "model-00103-of-00122.safetensors",
+ "model.language_model.layers.51.self_attn.o_proj.weight": "model-00103-of-00122.safetensors",
+ "model.language_model.layers.51.self_attn.q_norm.weight": "model-00103-of-00122.safetensors",
+ "model.language_model.layers.51.self_attn.k_norm.weight": "model-00103-of-00122.safetensors",
+ "model.language_model.layers.51.input_layernorm.weight": "model-00103-of-00122.safetensors",
+ "model.language_model.layers.51.mlp.gate.weight": "model-00103-of-00122.safetensors",
+ "model.language_model.layers.51.mlp.shared_expert.gate_proj.weight": "model-00103-of-00122.safetensors",
+ "model.language_model.layers.51.mlp.shared_expert.up_proj.weight": "model-00103-of-00122.safetensors",
+ "model.language_model.layers.51.mlp.shared_expert.down_proj.weight": "model-00103-of-00122.safetensors",
+ "model.language_model.layers.51.mlp.shared_expert_gate.weight": "model-00103-of-00122.safetensors",
+ "model.language_model.layers.51.mlp.experts.gate_up_proj": "model-00104-of-00122.safetensors",
+ "model.language_model.layers.51.mlp.experts.down_proj": "model-00105-of-00122.safetensors",
+ "model.language_model.layers.51.post_attention_layernorm.weight": "model-00105-of-00122.safetensors",
+ "model.language_model.layers.52.linear_attn.in_proj_qkv.weight": "model-00105-of-00122.safetensors",
+ "model.language_model.layers.52.linear_attn.in_proj_z.weight": "model-00105-of-00122.safetensors",
+ "model.language_model.layers.52.linear_attn.in_proj_b.weight": "model-00105-of-00122.safetensors",
+ "model.language_model.layers.52.linear_attn.in_proj_a.weight": "model-00105-of-00122.safetensors",
+ "model.language_model.layers.52.linear_attn.conv1d.weight": "model-00105-of-00122.safetensors",
+ "model.language_model.layers.52.linear_attn.dt_bias": "model-00105-of-00122.safetensors",
+ "model.language_model.layers.52.linear_attn.A_log": "model-00105-of-00122.safetensors",
+ "model.language_model.layers.52.linear_attn.norm.weight": "model-00105-of-00122.safetensors",
+ "model.language_model.layers.52.linear_attn.out_proj.weight": "model-00105-of-00122.safetensors",
+ "model.language_model.layers.52.input_layernorm.weight": "model-00105-of-00122.safetensors",
+ "model.language_model.layers.52.mlp.gate.weight": "model-00105-of-00122.safetensors",
+ "model.language_model.layers.52.mlp.shared_expert.gate_proj.weight": "model-00105-of-00122.safetensors",
+ "model.language_model.layers.52.mlp.shared_expert.up_proj.weight": "model-00105-of-00122.safetensors",
+ "model.language_model.layers.52.mlp.shared_expert.down_proj.weight": "model-00105-of-00122.safetensors",
+ "model.language_model.layers.52.mlp.shared_expert_gate.weight": "model-00105-of-00122.safetensors",
+ "model.language_model.layers.52.mlp.experts.gate_up_proj": "model-00106-of-00122.safetensors",
+ "model.language_model.layers.52.mlp.experts.down_proj": "model-00107-of-00122.safetensors",
+ "model.language_model.layers.52.post_attention_layernorm.weight": "model-00107-of-00122.safetensors",
+ "model.language_model.layers.53.linear_attn.in_proj_qkv.weight": "model-00107-of-00122.safetensors",
+ "model.language_model.layers.53.linear_attn.in_proj_z.weight": "model-00107-of-00122.safetensors",
+ "model.language_model.layers.53.linear_attn.in_proj_b.weight": "model-00107-of-00122.safetensors",
+ "model.language_model.layers.53.linear_attn.in_proj_a.weight": "model-00107-of-00122.safetensors",
+ "model.language_model.layers.53.linear_attn.conv1d.weight": "model-00107-of-00122.safetensors",
+ "model.language_model.layers.53.linear_attn.dt_bias": "model-00107-of-00122.safetensors",
+ "model.language_model.layers.53.linear_attn.A_log": "model-00107-of-00122.safetensors",
+ "model.language_model.layers.53.linear_attn.norm.weight": "model-00107-of-00122.safetensors",
+ "model.language_model.layers.53.linear_attn.out_proj.weight": "model-00107-of-00122.safetensors",
+ "model.language_model.layers.53.input_layernorm.weight": "model-00107-of-00122.safetensors",
+ "model.language_model.layers.53.mlp.gate.weight": "model-00107-of-00122.safetensors",
+ "model.language_model.layers.53.mlp.shared_expert.gate_proj.weight": "model-00107-of-00122.safetensors",
+ "model.language_model.layers.53.mlp.shared_expert.up_proj.weight": "model-00107-of-00122.safetensors",
+ "model.language_model.layers.53.mlp.shared_expert.down_proj.weight": "model-00107-of-00122.safetensors",
+ "model.language_model.layers.53.mlp.shared_expert_gate.weight": "model-00107-of-00122.safetensors",
+ "model.language_model.layers.53.mlp.experts.gate_up_proj": "model-00108-of-00122.safetensors",
+ "model.language_model.layers.53.mlp.experts.down_proj": "model-00109-of-00122.safetensors",
+ "model.language_model.layers.53.post_attention_layernorm.weight": "model-00109-of-00122.safetensors",
+ "model.language_model.layers.54.linear_attn.in_proj_qkv.weight": "model-00109-of-00122.safetensors",
+ "model.language_model.layers.54.linear_attn.in_proj_z.weight": "model-00109-of-00122.safetensors",
+ "model.language_model.layers.54.linear_attn.in_proj_b.weight": "model-00109-of-00122.safetensors",
+ "model.language_model.layers.54.linear_attn.in_proj_a.weight": "model-00109-of-00122.safetensors",
+ "model.language_model.layers.54.linear_attn.conv1d.weight": "model-00109-of-00122.safetensors",
+ "model.language_model.layers.54.linear_attn.dt_bias": "model-00109-of-00122.safetensors",
+ "model.language_model.layers.54.linear_attn.A_log": "model-00109-of-00122.safetensors",
+ "model.language_model.layers.54.linear_attn.norm.weight": "model-00109-of-00122.safetensors",
+ "model.language_model.layers.54.linear_attn.out_proj.weight": "model-00109-of-00122.safetensors",
+ "model.language_model.layers.54.input_layernorm.weight": "model-00109-of-00122.safetensors",
+ "model.language_model.layers.54.mlp.gate.weight": "model-00109-of-00122.safetensors",
+ "model.language_model.layers.54.mlp.shared_expert.gate_proj.weight": "model-00109-of-00122.safetensors",
+ "model.language_model.layers.54.mlp.shared_expert.up_proj.weight": "model-00109-of-00122.safetensors",
+ "model.language_model.layers.54.mlp.shared_expert.down_proj.weight": "model-00109-of-00122.safetensors",
+ "model.language_model.layers.54.mlp.shared_expert_gate.weight": "model-00109-of-00122.safetensors",
+ "model.language_model.layers.54.mlp.experts.gate_up_proj": "model-00110-of-00122.safetensors",
+ "model.language_model.layers.54.mlp.experts.down_proj": "model-00111-of-00122.safetensors",
+ "model.language_model.layers.54.post_attention_layernorm.weight": "model-00111-of-00122.safetensors",
+ "model.language_model.layers.55.self_attn.q_proj.weight": "model-00111-of-00122.safetensors",
+ "model.language_model.layers.55.self_attn.k_proj.weight": "model-00111-of-00122.safetensors",
+ "model.language_model.layers.55.self_attn.v_proj.weight": "model-00111-of-00122.safetensors",
+ "model.language_model.layers.55.self_attn.o_proj.weight": "model-00111-of-00122.safetensors",
+ "model.language_model.layers.55.self_attn.q_norm.weight": "model-00111-of-00122.safetensors",
+ "model.language_model.layers.55.self_attn.k_norm.weight": "model-00111-of-00122.safetensors",
+ "model.language_model.layers.55.input_layernorm.weight": "model-00111-of-00122.safetensors",
+ "model.language_model.layers.55.mlp.gate.weight": "model-00111-of-00122.safetensors",
+ "model.language_model.layers.55.mlp.shared_expert.gate_proj.weight": "model-00111-of-00122.safetensors",
+ "model.language_model.layers.55.mlp.shared_expert.up_proj.weight": "model-00111-of-00122.safetensors",
+ "model.language_model.layers.55.mlp.shared_expert.down_proj.weight": "model-00111-of-00122.safetensors",
+ "model.language_model.layers.55.mlp.shared_expert_gate.weight": "model-00111-of-00122.safetensors",
+ "model.language_model.layers.55.mlp.experts.gate_up_proj": "model-00112-of-00122.safetensors",
+ "model.language_model.layers.55.mlp.experts.down_proj": "model-00113-of-00122.safetensors",
+ "model.language_model.layers.55.post_attention_layernorm.weight": "model-00113-of-00122.safetensors",
+ "model.language_model.layers.56.linear_attn.in_proj_qkv.weight": "model-00113-of-00122.safetensors",
+ "model.language_model.layers.56.linear_attn.in_proj_z.weight": "model-00113-of-00122.safetensors",
+ "model.language_model.layers.56.linear_attn.in_proj_b.weight": "model-00113-of-00122.safetensors",
+ "model.language_model.layers.56.linear_attn.in_proj_a.weight": "model-00113-of-00122.safetensors",
+ "model.language_model.layers.56.linear_attn.conv1d.weight": "model-00113-of-00122.safetensors",
+ "model.language_model.layers.56.linear_attn.dt_bias": "model-00113-of-00122.safetensors",
+ "model.language_model.layers.56.linear_attn.A_log": "model-00113-of-00122.safetensors",
+ "model.language_model.layers.56.linear_attn.norm.weight": "model-00113-of-00122.safetensors",
+ "model.language_model.layers.56.linear_attn.out_proj.weight": "model-00113-of-00122.safetensors",
+ "model.language_model.layers.56.input_layernorm.weight": "model-00113-of-00122.safetensors",
+ "model.language_model.layers.56.mlp.gate.weight": "model-00113-of-00122.safetensors",
+ "model.language_model.layers.56.mlp.shared_expert.gate_proj.weight": "model-00113-of-00122.safetensors",
+ "model.language_model.layers.56.mlp.shared_expert.up_proj.weight": "model-00113-of-00122.safetensors",
+ "model.language_model.layers.56.mlp.shared_expert.down_proj.weight": "model-00113-of-00122.safetensors",
+ "model.language_model.layers.56.mlp.shared_expert_gate.weight": "model-00113-of-00122.safetensors",
+ "model.language_model.layers.56.mlp.experts.gate_up_proj": "model-00114-of-00122.safetensors",
+ "model.language_model.layers.56.mlp.experts.down_proj": "model-00115-of-00122.safetensors",
+ "model.language_model.layers.56.post_attention_layernorm.weight": "model-00115-of-00122.safetensors",
+ "model.language_model.layers.57.linear_attn.in_proj_qkv.weight": "model-00115-of-00122.safetensors",
+ "model.language_model.layers.57.linear_attn.in_proj_z.weight": "model-00115-of-00122.safetensors",
+ "model.language_model.layers.57.linear_attn.in_proj_b.weight": "model-00115-of-00122.safetensors",
+ "model.language_model.layers.57.linear_attn.in_proj_a.weight": "model-00115-of-00122.safetensors",
+ "model.language_model.layers.57.linear_attn.conv1d.weight": "model-00115-of-00122.safetensors",
+ "model.language_model.layers.57.linear_attn.dt_bias": "model-00115-of-00122.safetensors",
+ "model.language_model.layers.57.linear_attn.A_log": "model-00115-of-00122.safetensors",
+ "model.language_model.layers.57.linear_attn.norm.weight": "model-00115-of-00122.safetensors",
+ "model.language_model.layers.57.linear_attn.out_proj.weight": "model-00115-of-00122.safetensors",
+ "model.language_model.layers.57.input_layernorm.weight": "model-00115-of-00122.safetensors",
+ "model.language_model.layers.57.mlp.gate.weight": "model-00115-of-00122.safetensors",
+ "model.language_model.layers.57.mlp.shared_expert.gate_proj.weight": "model-00115-of-00122.safetensors",
+ "model.language_model.layers.57.mlp.shared_expert.up_proj.weight": "model-00115-of-00122.safetensors",
+ "model.language_model.layers.57.mlp.shared_expert.down_proj.weight": "model-00115-of-00122.safetensors",
+ "model.language_model.layers.57.mlp.shared_expert_gate.weight": "model-00115-of-00122.safetensors",
+ "model.language_model.layers.57.mlp.experts.gate_up_proj": "model-00116-of-00122.safetensors",
+ "model.language_model.layers.57.mlp.experts.down_proj": "model-00117-of-00122.safetensors",
+ "model.language_model.layers.57.post_attention_layernorm.weight": "model-00117-of-00122.safetensors",
+ "model.language_model.layers.58.linear_attn.in_proj_qkv.weight": "model-00117-of-00122.safetensors",
+ "model.language_model.layers.58.linear_attn.in_proj_z.weight": "model-00117-of-00122.safetensors",
+ "model.language_model.layers.58.linear_attn.in_proj_b.weight": "model-00117-of-00122.safetensors",
+ "model.language_model.layers.58.linear_attn.in_proj_a.weight": "model-00117-of-00122.safetensors",
+ "model.language_model.layers.58.linear_attn.conv1d.weight": "model-00117-of-00122.safetensors",
+ "model.language_model.layers.58.linear_attn.dt_bias": "model-00117-of-00122.safetensors",
+ "model.language_model.layers.58.linear_attn.A_log": "model-00117-of-00122.safetensors",
+ "model.language_model.layers.58.linear_attn.norm.weight": "model-00117-of-00122.safetensors",
+ "model.language_model.layers.58.linear_attn.out_proj.weight": "model-00117-of-00122.safetensors",
+ "model.language_model.layers.58.input_layernorm.weight": "model-00117-of-00122.safetensors",
+ "model.language_model.layers.58.mlp.gate.weight": "model-00117-of-00122.safetensors",
+ "model.language_model.layers.58.mlp.shared_expert.gate_proj.weight": "model-00117-of-00122.safetensors",
+ "model.language_model.layers.58.mlp.shared_expert.up_proj.weight": "model-00117-of-00122.safetensors",
+ "model.language_model.layers.58.mlp.shared_expert.down_proj.weight": "model-00117-of-00122.safetensors",
+ "model.language_model.layers.58.mlp.shared_expert_gate.weight": "model-00117-of-00122.safetensors",
+ "model.language_model.layers.58.mlp.experts.gate_up_proj": "model-00118-of-00122.safetensors",
+ "model.language_model.layers.58.mlp.experts.down_proj": "model-00119-of-00122.safetensors",
+ "model.language_model.layers.58.post_attention_layernorm.weight": "model-00119-of-00122.safetensors",
+ "model.language_model.layers.59.self_attn.q_proj.weight": "model-00119-of-00122.safetensors",
+ "model.language_model.layers.59.self_attn.k_proj.weight": "model-00119-of-00122.safetensors",
+ "model.language_model.layers.59.self_attn.v_proj.weight": "model-00119-of-00122.safetensors",
+ "model.language_model.layers.59.self_attn.o_proj.weight": "model-00119-of-00122.safetensors",
+ "model.language_model.layers.59.self_attn.q_norm.weight": "model-00119-of-00122.safetensors",
+ "model.language_model.layers.59.self_attn.k_norm.weight": "model-00119-of-00122.safetensors",
+ "model.language_model.layers.59.input_layernorm.weight": "model-00119-of-00122.safetensors",
+ "model.language_model.layers.59.mlp.gate.weight": "model-00119-of-00122.safetensors",
+ "model.language_model.layers.59.mlp.shared_expert.gate_proj.weight": "model-00119-of-00122.safetensors",
+ "model.language_model.layers.59.mlp.shared_expert.up_proj.weight": "model-00119-of-00122.safetensors",
+ "model.language_model.layers.59.mlp.shared_expert.down_proj.weight": "model-00119-of-00122.safetensors",
+ "model.language_model.layers.59.mlp.shared_expert_gate.weight": "model-00119-of-00122.safetensors",
+ "model.language_model.layers.59.mlp.experts.gate_up_proj": "model-00120-of-00122.safetensors",
+ "model.language_model.layers.59.mlp.experts.down_proj": "model-00121-of-00122.safetensors",
+ "model.language_model.layers.59.post_attention_layernorm.weight": "model-00121-of-00122.safetensors",
+ "lm_head.weight": "model-00122-of-00122.safetensors",
+ "model.language_model.norm.weight": "model-00122-of-00122.safetensors"
+ }
+}
\ No newline at end of file
diff --git a/preprocessor_config.json b/preprocessor_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..2ea84a437d448ff71b08df68fdd949d5cc4ebb64
--- /dev/null
+++ b/preprocessor_config.json
@@ -0,0 +1,21 @@
+{
+ "size": {
+ "longest_edge": 16777216,
+ "shortest_edge": 65536
+ },
+ "patch_size": 16,
+ "temporal_patch_size": 2,
+ "merge_size": 2,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "processor_class": "Qwen3VLProcessor",
+ "image_processor_type": "Qwen2VLImageProcessorFast"
+}
\ No newline at end of file
diff --git a/processor_config.json b/processor_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..7ad6acdf4203f22b7b990e36ccc3a1fe38563d5e
--- /dev/null
+++ b/processor_config.json
@@ -0,0 +1,63 @@
+{
+ "image_processor": {
+ "data_format": "channels_first",
+ "do_convert_rgb": true,
+ "do_normalize": true,
+ "do_rescale": true,
+ "do_resize": true,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_processor_type": "Qwen2VLImageProcessorFast",
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "merge_size": 2,
+ "patch_size": 16,
+ "resample": 3,
+ "rescale_factor": 0.00392156862745098,
+ "size": {
+ "longest_edge": 16777216,
+ "shortest_edge": 65536
+ },
+ "temporal_patch_size": 2
+ },
+ "processor_class": "Qwen3VLProcessor",
+ "video_processor": {
+ "data_format": "channels_first",
+ "default_to_square": true,
+ "do_convert_rgb": true,
+ "do_normalize": true,
+ "do_rescale": true,
+ "do_resize": true,
+ "do_sample_frames": true,
+ "fps": 2,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "max_frames": 768,
+ "merge_size": 2,
+ "min_frames": 4,
+ "patch_size": 16,
+ "resample": 3,
+ "rescale_factor": 0.00392156862745098,
+ "return_metadata": false,
+ "size": {
+ "longest_edge": 25165824,
+ "shortest_edge": 4096
+ },
+ "temporal_patch_size": 2,
+ "video_processor_type": "Qwen3VLVideoProcessor"
+ }
+}
diff --git a/tokenizer.json b/tokenizer.json
new file mode 100644
index 0000000000000000000000000000000000000000..67741b04f23bfdb46501f748ce27865ec82eccfb
--- /dev/null
+++ b/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:87a7830d63fcf43bf241c3c5242e96e62dd3fdc29224ca26fed8ea333db72de4
+size 19989343
diff --git a/tokenizer_config.json b/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..a068e2468cff426a9b105006e74e044030a6faf4
--- /dev/null
+++ b/tokenizer_config.json
@@ -0,0 +1,32 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|im_end|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": true,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "processor_class": "Qwen3VLProcessor",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}