diff --git a/.eval_results/wildclawbench.yaml b/.eval_results/wildclawbench.yaml new file mode 100644 index 0000000000000000000000000000000000000000..d2a436daf675159d5669545c6d6e2bccb0a6a9f4 --- /dev/null +++ b/.eval_results/wildclawbench.yaml @@ -0,0 +1,9 @@ +- dataset: + id: internlm/WildClawBench + task_id: overall + value: 53.5 + date: "2026-05-22" + source: + url: https://internlm.github.io/WildClawBench + name: WildClawBench + user: internlm \ No newline at end of file diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000000000000000000000000000000000000..267f26f30a6b89e92de6c0d7d27ccaf881c224fe --- /dev/null +++ b/.gitattributes @@ -0,0 +1,37 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text +figures/Nex-N2-Benchmark-white.png filter=lfs diff=lfs merge=lfs -text diff --git a/README.md b/README.md new file mode 100644 index 0000000000000000000000000000000000000000..9ab81189a8a3e9b80f4ed858daee2439c0e28433 --- /dev/null +++ b/README.md @@ -0,0 +1,191 @@ +--- +license: apache-2.0 +pipeline_tag: text-generation +library_name: transformers +--- + +
+ +
+ +--- + +
+🤗 Model   |    +🔀 OpenRouter (Enjoy two weeks free starting June 9!)   |    +💻 Github   |    +🧭 ModelScope   |    +🚀 Nex-AGI +
+ +# Nex-N2 + +**An agentic model with Agentic Thinking.** + +Today, we are officially releasing and open-sourcing our next-generation model, **Nex-N2** — an agent model built for real-world productivity scenarios. With first-tier coding and agentic capabilities, Nex-N2 keeps driving complex, long-horizon tasks forward in real environments to deliver stable, end-to-end results. + +Over the past year, a paradigm shift led by Vibe Coding and Harness Engineering has been redefining the limits of LLM agents. From dialogue, to reasoning, to agents that execute long-horizon tasks with environmental feedback, the tasks models must handle keep growing harder, the contexts longer, and the environments more realistic. The core of next-generation model competition is no longer *whether a model can think*, but whether it can reliably and efficiently turn thinking into actions that are executable, verifiable, and iterable. + +Rather than treating reasoning, tool use, and environment execution as separate capabilities, Nex-N2 unifies them through an **Agentic Thinking** framework that connects requirement understanding, task planning, code implementation, environmental feedback, evaluation and debugging, and continuous iteration into a single closed loop. The framework has two parts: + +- **Adaptive Thinking** lets the model decide on its own when to think and how deeply — executing simple actions quickly while reasoning thoroughly on critical decisions. +- **Coherent Thinking** carries one consistent reasoning paradigm across general reasoning and diverse agentic tasks, staying consistent across tasks and modalities to enable stable capability transfer. + +Across real agentic workflows — agentic coding, deep research, tool calling, and terminal execution — Nex-N2 reaches first-tier performance, with substantial gains over the previous-generation Nex-N1 on multiple authoritative benchmarks. In real productivity scenarios such as OpenClaw one-person-company workflows, end-to-end game development, and web and multimodal generation, it likewise demonstrates outstanding usability, robustness, and stability. + +## Open Source + +In keeping with our commitment to open source, we are releasing both **Nex-N2-Pro** and **Nex-N2-mini** as open-source models starting today. + +- **Nex-N2-Pro:** [Hugging Face](https://huggingface.co/nex-agi/Nex-N2-Pro) | [ModelScope](https://www.modelscope.cn/models/nex-agi/Nex-N2-Pro) +- **Nex-N2-mini:** [Hugging Face](https://huggingface.co/nex-agi/Nex-N2-mini) | [ModelScope](https://www.modelscope.cn/models/nex-agi/Nex-N2-mini) +- **Early Access:** [SiliconFlow](https://cloud.siliconflow.cn/me/models?target=nex-agi%2FNex-N2-Pro) + +We welcome developers and enterprises to integrate and try Nex-N2 and share their feedback. + +## Performance + +We evaluate Nex-N2 in real agentic workflows along three directions — agentic tasks, coding tasks, and general tasks — covering benchmarks across tool calling, search-based decision-making, software engineering, and terminal execution. Nex-N2-Pro delivers strong performance that keeps pace with top-tier models such as GPT-5.5 and Opus 4.7: it excels at coding (e.g., 75.3 on Terminal-Bench 2.1) and long-horizon tasks (1585 on GDPval), and shows especially strong generalization and competitiveness on newer benchmarks like SWE-Atlas and DeepSWE. On general capability and core reasoning, it stands on par with leading frontier models. + +![Nex-N2 Benchmark Overview](./figures/Nex-N2-Benchmark-white.png) + +Nex-N2 ships in two variants, both post-trained on the Qwen3.5 series: **Nex-N2-Pro** (built on `Qwen3.5-397B-A17B`) and **Nex-N2-mini** (built on `Qwen3.5-35B-A3B-Base`), covering different latency and quality trade-offs. The table below reports their scores alongside leading proprietary and open models across our full evaluation suite. + +| Benchmark | **Nex-N2-mini** | **Nex-N2-Pro** | GPT-5.5 | Opus 4.7 | Kimi-K2.6 | GLM-5.1 | MiniMax M3 | DeepSeek-V4-Pro | +| --- | --- | --- | --- | --- | --- | --- | --- | --- | +| **Agent** | | | | | | | | | +| BrowseComp | 74.1 | 83.7 | 84.4 | 79.8 | 83.2 | 79.3 | 83.5 | 83.4 | +| GDPval | 1402 | 1585 | 1769 | 1753 | 1481 | 1535 | - | 1554 | +| Toolathlon | 33.3 | 51.9 | 55.6 | 52.8 | 50.0 | 40.7 | - | 51.8 | +| WildClawBench | 47.7 | 53.5 | 58.2 | 62.2 | - | 48.2 | - | 43.7 | +| WideSearch | 62.0 | 75.6 | - | - | 80.8 | - | - | - | +| TAU3 | 65.9 | 71.1 | - | - | - | 70.6 | - | - | +| **Coding & SWE** | | | | | | | | | +| SWE-Bench Pro | 50.2 | 58.8 | 58.6 | 64.3 | 58.6 | 58.4 | 59.0 | 55.4 | +| Terminal-Bench 2.1 | 60.7 | 75.3 | 83.4 | 69.7 | - | 58.7 | 66.0 | 72.0 | +| DeepSWE | 8.0 | 33.6 | 70 | 54 | 24 | 18 | - | 8 | +| SWE-Bench Verified | 74.4 | 80.8 | 82.9 | 87.6 | 80.2 | - | 80.5 | 80.6 | +| SWE Atlas QnA | 31.5 | 37.9 | 45.4 | 45.2 | - | - | 37.9 | - | +| SWE Atlas RF | 30.0 | 32.9 | 44.8 | 48.6 | - | - | - | - | +| SWE Atlas TW | 23.3 | 40.0 | 42.6 | 38.2 | - | - | 30.8 | - | +| **General & Reasoning** | | | | | | | | | +| GPQA Diamond | 82.6 | 90.7 | 93.6 | 94.2 | 90.5 | 86.2 | - | 90.1 | +| IFEval | 89.1 | 94.0 | - | - | 94.5 | 94.5 | - | 91.9 | +| Apex | 9.4 | 36.5 | - | - | 24.0 | 11.5 | - | 38.3 | + +## Usage + +### Local Deployment + +> **Note:** For the best performance with Nex-series models, we recommend serving them with our customized `sglang` fork. + +First, install our `sglang` fork: + +```bash +# Use the customized `sglang` fork +git clone https://github.com/nex-agi/sglang.git +cd sglang + +# Install the python packages +pip install --upgrade pip +pip install -e "python" +``` + +#### Nex-N2-Pro + +Launch the server (example on two 8× H100 servers with CUDA 13.0): + +```bash +# Multi-node (2 nodes). Run the same command on every node with: +# = 0 on the head node, 1 on the other node +# = IP of the head node (reachable from all others) +python -m sglang.launch_server \ + --model-path /path/to/your/model \ + --tp 16 \ + --nnodes 2 \ + --node-rank \ + --dist-init-addr :20000 \ + --reasoning-parser qwen3 \ + --tool-call-parser qwen3_coder \ + --mamba-scheduler-strategy extra_buffer +``` + +#### Nex-N2-mini + +Launch the server (example on one 2× H100 server with CUDA 13.0): + +```bash +python -m sglang.launch_server \ + --model-path /path/to/your/model \ + --tp 2 \ + --reasoning-parser qwen3 \ + --tool-call-parser qwen3_coder \ + --mamba-scheduler-strategy extra_buffer +``` + +### Docker Deployment + +We also provide a prebuilt Docker image with our customized `sglang` fork preinstalled: **`nexagi/sglang:v0.5.12`**. The launch command is the same as above. + +#### Nex-N2-Pro + +```bash +# Multi-node (2 nodes). Run the same command on every node with: +# = 0 on the head node, 1 on the other node +# = IP of the head node (reachable from all others) +docker run --gpus all --shm-size 32g --network host \ + -v /path/to/your/model:/model \ + nexagi/sglang:v0.5.12 \ + python3 -m sglang.launch_server \ + --model-path /model \ + --tp 16 \ + --nnodes 2 \ + --node-rank \ + --dist-init-addr :20000 \ + --host 0.0.0.0 --port 30000 \ + --reasoning-parser qwen3 \ + --tool-call-parser qwen3_coder \ + --mamba-scheduler-strategy extra_buffer +``` + +#### Nex-N2-mini + +Single node with 2× H100: + +```bash +docker run --gpus all --shm-size 32g --ipc=host \ + -p 30000:30000 \ + -v /path/to/your/model:/model \ + nexagi/sglang:v0.5.12 \ + python3 -m sglang.launch_server \ + --model-path /model \ + --tp 2 \ + --host 0.0.0.0 --port 30000 \ + --reasoning-parser qwen3 \ + --tool-call-parser qwen3_coder \ + --mamba-scheduler-strategy extra_buffer +``` + +### Recommended Sampling Parameters + +For the best generation quality, we recommend the following sampling parameters: + +- `temperature`: 0.7 +- `top_p`: 0.95 +- `top_k`: 40 + +### Function Calling + +Nex-series models support robust function-calling capabilities. To enable function calling, add the `--tool-call-parser qwen3_coder` flag when launching the server: + +```bash +python -m sglang.launch_server --model-path /path/to/your/model --tool-call-parser qwen3_coder +``` + +### Reasoning Parser + +Nex-series models emit explicit reasoning traces. Add the `--reasoning-parser qwen3` flag to parse the reasoning content separately from the final response. It can be combined with the function-calling parser above: + +```bash +python -m sglang.launch_server --model-path /path/to/your/model --tool-call-parser qwen3_coder --reasoning-parser qwen3 +``` diff --git a/chat_template.jinja b/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..fa6e277226175ea9373a9bb9da91418ce5005539 --- /dev/null +++ b/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if reasoning_content %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/config.json b/config.json new file mode 100644 index 0000000000000000000000000000000000000000..9ac001fffca37672df5c90305d5f648cc1c0588d --- /dev/null +++ b/config.json @@ -0,0 +1,143 @@ +{ + "architectures": [ + "Qwen3_5MoeForConditionalGeneration" + ], + "dtype": "bfloat16", + "hidden_size": 4096, + "image_token_id": 248056, + "model_type": "qwen3_5_moe", + "text_config": { + "attention_bias": false, + "attention_dropout": 0.0, + "attn_output_gate": true, + "bos_token_id": null, + "dtype": "bfloat16", + "eos_token_id": 248044, + "full_attention_interval": 4, + "head_dim": 256, + "hidden_act": "silu", + "hidden_size": 4096, + "initializer_range": 0.02, + "layer_types": [ + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention" + ], + "linear_conv_kernel_dim": 4, + "linear_key_head_dim": 128, + "linear_num_key_heads": 16, + "linear_num_value_heads": 64, + "linear_value_head_dim": 128, + "mamba_ssm_dtype": "float32", + "max_position_embeddings": 262144, + "mlp_only_layers": [], + "model_type": "qwen3_5_moe_text", + "moe_intermediate_size": 1024, + "mtp_num_hidden_layers": 1, + "mtp_use_dedicated_embeddings": false, + "num_attention_heads": 32, + "num_experts": 512, + "num_experts_per_tok": 10, + "num_hidden_layers": 60, + "num_key_value_heads": 2, + "output_router_logits": false, + "pad_token_id": null, + "partial_rotary_factor": 0.25, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "mrope_interleaved": true, + "mrope_section": [ + 11, + 11, + 10 + ], + "partial_rotary_factor": 0.25, + "rope_theta": 10000000, + "rope_type": "default" + }, + "router_aux_loss_coef": 0.001, + "shared_expert_intermediate_size": 1024, + "tie_word_embeddings": false, + "use_cache": true, + "vocab_size": 248320 + }, + "tie_word_embeddings": false, + "transformers_version": "5.2.0", + "video_token_id": 248057, + "vision_config": { + "deepstack_visual_indexes": [], + "depth": 27, + "dtype": "bfloat16", + "hidden_act": "gelu_pytorch_tanh", + "hidden_size": 1152, + "in_channels": 3, + "initializer_range": 0.02, + "intermediate_size": 4304, + "model_type": "qwen3_5_moe", + "num_heads": 16, + "num_position_embeddings": 2304, + "out_hidden_size": 4096, + "patch_size": 16, + "spatial_merge_size": 2, + "temporal_patch_size": 2 + }, + "vision_end_token_id": 248054, + "vision_start_token_id": 248053 +} diff --git a/figures/NEX_logo.svg b/figures/NEX_logo.svg new file mode 100644 index 0000000000000000000000000000000000000000..a6bb9337e66d6976e3816377741ee33dfb399f2b --- /dev/null +++ b/figures/NEX_logo.svg @@ -0,0 +1,7 @@ + + + + + + + diff --git a/figures/Nex-N2-Benchmark-white.png b/figures/Nex-N2-Benchmark-white.png new file mode 100644 index 0000000000000000000000000000000000000000..edaab6dbc5ce3e26cd6332b048cd9e4ff5d091cb --- /dev/null +++ b/figures/Nex-N2-Benchmark-white.png @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3fba33987e529cc9fffe491128389f7c162bab9b6cc0199cdab60c3c349a0a93 +size 589852 diff --git a/model-00001-of-00122.safetensors b/model-00001-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..cf7121a8d1a4474ed7c150a548d44851c6bc1d97 --- /dev/null +++ b/model-00001-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d9c6b016494d82f42e57f5c28d9ddffd5af8c81cf26c977dd36bdd864bda91ef +size 3211703200 diff --git a/model-00002-of-00122.safetensors b/model-00002-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..838bccba7740d895a841206dc5547385ec4bb04b --- /dev/null +++ b/model-00002-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:39755f3246369adf0d8e253c3954e2b12da3bba655cdbc95b6c140ffcf385025 +size 8589934736 diff --git a/model-00003-of-00122.safetensors b/model-00003-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..a9fe6e8f8bf4b31a5b6c6d1caafe128616d7e4de --- /dev/null +++ b/model-00003-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0f9a4df1d8d7a0900d76f31bdb1cd73a8eeee831777d452f50561daa394cb0e8 +size 4560382680 diff --git a/model-00004-of-00122.safetensors b/model-00004-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..487a1ed86d37c270870af9499eef59e3bb022841 --- /dev/null +++ b/model-00004-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:87299367bd7fa2917179e1af18058234d9101419789e3e71cfc463d348ac1db9 +size 8589934736 diff --git a/model-00005-of-00122.safetensors b/model-00005-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..4473cd82da5de5989feb8f0819a9179decf37277 --- /dev/null +++ b/model-00005-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1550371623ae1753a6d080bbab426c2e0a67cf1031f32913f4a04efb4f268c24 +size 4560382680 diff --git a/model-00006-of-00122.safetensors b/model-00006-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..0835d694fc717c182477e3f2b6f67bb0546f5832 --- /dev/null +++ b/model-00006-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8e04efc7481e5342b28c093ce0ef0077e25b3b24da0e5fb4ca9a310c660bf057 +size 8589934736 diff --git a/model-00007-of-00122.safetensors b/model-00007-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..c2d23ad9e1993f88cd8d51d22a84f8406dbfdbf7 --- /dev/null +++ b/model-00007-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:773cfa0af38128557108749b91ee961f497be20ce113fc1115e182d10398a22f +size 4534070088 diff --git a/model-00008-of-00122.safetensors b/model-00008-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..4898b79d549b43abc9619ead46d8b29816359a11 --- /dev/null +++ b/model-00008-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4e1ced164923558b72a80b72a9b8baab5f5cde777130578c4b8b0e9e4e9e0a44 +size 8589934736 diff --git a/model-00009-of-00122.safetensors b/model-00009-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..b965d2986ba6375cd3e0c955a70ea7d2748697fd --- /dev/null +++ b/model-00009-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c9e9ac0530ca9ee24088094ad1f2ed4b51a4b4f305703606dca2c93772572593 +size 4560382680 diff --git a/model-00010-of-00122.safetensors b/model-00010-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..b7138736a3c60baec3794467766ced02a6ec3f2d --- /dev/null +++ b/model-00010-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:20a32c4b0d3c1bf2dd36cfe5fd23a290a56e076b9bddcd8ed1bf0512f1731ad2 +size 8589934736 diff --git a/model-00011-of-00122.safetensors b/model-00011-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..53eeb58f2eb088f5b230eb766cf82a512487739e --- /dev/null +++ b/model-00011-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7fdf5a5f564003852482c2dd805f71c4cd0148a2863fc061c35b92ae2f874ee3 +size 4560382680 diff --git a/model-00012-of-00122.safetensors b/model-00012-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..6f405fc313d298ae4d21a153292421f0016aa8d6 --- /dev/null +++ b/model-00012-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c806c8ddb98ffbf1574ce658f335948e189da93a0d47059c7e71022675d660c2 +size 8589934736 diff --git a/model-00013-of-00122.safetensors b/model-00013-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..f568da0d4234d0c5dcad056cb6b09c02a27d88ff --- /dev/null +++ b/model-00013-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fb65d906542b45eedbb0f796db57be4cb071930efa8d7c57966ecce8112ba6a3 +size 4560382680 diff --git a/model-00014-of-00122.safetensors b/model-00014-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..f16723c24df79a39732d35c74dc2485add17cfa8 --- /dev/null +++ b/model-00014-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c276f507d63b241a46805566c08fede804c4408252655b41908a782df5625027 +size 8589934736 diff --git a/model-00015-of-00122.safetensors b/model-00015-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..3e38fbad493134100002788bf7775f1219f9aa1d --- /dev/null +++ b/model-00015-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:832c42d23c4d03acc69a46ded7c206750a70afc2ba0935ce80a3d7e9fbbaf7fe +size 4534070088 diff --git a/model-00016-of-00122.safetensors b/model-00016-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..d10667f4b5a11cb5f905ff360c72beb604f7df8c --- /dev/null +++ b/model-00016-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:52c33531f26055a4ca69da5070379f3bd4b7e8f4daabec0ca00e26764f239517 +size 8589934736 diff --git a/model-00017-of-00122.safetensors b/model-00017-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..0f27564df779c8a11596b8adf736cc4c8fefda64 --- /dev/null +++ b/model-00017-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c264e1214dd10553d6524ba8d93d9086816651c604b0edbbfd42cef0b6b796c9 +size 4560382680 diff --git a/model-00018-of-00122.safetensors b/model-00018-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..271c6d546fc6a54c8570fdb8a8c8e5c7134b8b19 --- /dev/null +++ b/model-00018-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:81c4bd4d0a85bd48c678e7cd1ba86ebbbe427a842f4e99635c0d166a9764dcde +size 8589934736 diff --git a/model-00019-of-00122.safetensors b/model-00019-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..93016dd7970145f8b9d06354b0335f24bd41db41 --- /dev/null +++ b/model-00019-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fcbb2b7bb39a810fae67c53ad84a9f4e4f8fae482bd509a23a36f37c5f72107b +size 4560382680 diff --git a/model-00020-of-00122.safetensors b/model-00020-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..12cab1e01886242385b0969636dc179c0d182bc1 --- /dev/null +++ b/model-00020-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b9bd28a2b254d44f725d2f544011c1f9325441419c06f92b75f7346fa12d2a0f +size 8589934736 diff --git a/model-00021-of-00122.safetensors b/model-00021-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..0e0e025e03942cd22154e11081e73304ae7b1feb --- /dev/null +++ b/model-00021-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2c1ac48ba53225932cf34b9d40b41b9b8342ad2ee9aae9bce91ae9aeb93c9765 +size 4560382624 diff --git a/model-00022-of-00122.safetensors b/model-00022-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..13564e4fcb47fd6861f4202a7548d0e7c33dddb1 --- /dev/null +++ b/model-00022-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3f09d8da0e8338adcbe74c86a0bc13740f55e68574a6687ac495af86f97b3657 +size 8589934736 diff --git a/model-00023-of-00122.safetensors b/model-00023-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..4f3ca28dc2a7b3e93340ef85ddfda722810e086d --- /dev/null +++ b/model-00023-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2e0e2ad64c866dc1c6cbf6220d05a058582b5994c7cde402ecd26dada7f06672 +size 4534070104 diff --git a/model-00024-of-00122.safetensors b/model-00024-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..3969053b234b4b810e51fdd5daccdbe10f0e7ae2 --- /dev/null +++ b/model-00024-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:67e45fe71206ccb6f335f54fe0e331517678475744d787840a2b069d0a85f822 +size 8589934736 diff --git a/model-00025-of-00122.safetensors b/model-00025-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..3d79407d3766c9449d05897b9fff135ad7ae29fe --- /dev/null +++ b/model-00025-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8b741f4f99015e6692304c054fd2d0ba6933d8366662504b836fc935c5f3f502 +size 4560382696 diff --git a/model-00026-of-00122.safetensors b/model-00026-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..456dff697a08e051c38dc9d129f33fe6102dfdf2 --- /dev/null +++ b/model-00026-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0684065b05b6d21a3d905deb793da18c29be8ddb0139eaa63d39c28ee0ad638f +size 8589934736 diff --git a/model-00027-of-00122.safetensors b/model-00027-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..72612ade9ae358c4e266e1cdf423f19ecf5d2a45 --- /dev/null +++ b/model-00027-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ad8259eff54d6184549549b00adfb6708a20c9bc05db698d9375405cc0fa2d08 +size 4560382696 diff --git a/model-00028-of-00122.safetensors b/model-00028-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..d503f56a4570226e7d220bf9686486454f2efa2c --- /dev/null +++ b/model-00028-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:69675e113b50a831697e5d1c7343511b398027843598915eabc634cb8ed38acc +size 8589934736 diff --git a/model-00029-of-00122.safetensors b/model-00029-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..9b0dfd241e48b3c2f1a61ef6c761f77ce8378a68 --- /dev/null +++ b/model-00029-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4c0ba63b2e81197304620dd80b8867dd23da64420f2aa2c1871d660e0cebc812 +size 4560382696 diff --git a/model-00030-of-00122.safetensors b/model-00030-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..178e828fcd0439e79599710d8e385b874f037766 --- /dev/null +++ b/model-00030-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d9c187ca41082b743d71d0a9e0ea5cc9ebf00a5b87a28c48177bad1b8ec5f8a8 +size 8589934736 diff --git a/model-00031-of-00122.safetensors b/model-00031-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..3a434173e11bbd1c27c1e51765ea516ac0cae8f0 --- /dev/null +++ b/model-00031-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c59a133f05d8e9adbf5c70190a1eda883f98097b5596e7a2dea41dedadc17d0e +size 4534070104 diff --git a/model-00032-of-00122.safetensors b/model-00032-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..b394b96a0ba66146ddd01b43557e2d5091f65c28 --- /dev/null +++ b/model-00032-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:822c9d521ef7552ee3f1f4cadbc96f5d9fb127920ed5ffc0f61f2a2e3327ae5a +size 8589934736 diff --git a/model-00033-of-00122.safetensors b/model-00033-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..688f49005c33a4c56285835543042f16923d8b85 --- /dev/null +++ b/model-00033-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:71ecae56174f3c7dce1f56fe05c7d8ad0f361d50c4d6fdaf536ddc49219f6415 +size 4560382696 diff --git a/model-00034-of-00122.safetensors b/model-00034-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..0133bf9c45c8b48d42668638d405f3613208610d --- /dev/null +++ b/model-00034-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:94b12f986c694bd930e46c5db9daf8824147dfa5cddc54237212a0cc7afaa226 +size 8589934736 diff --git a/model-00035-of-00122.safetensors b/model-00035-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..bfe5155fefa7d7700af88f97ea97018c00471384 --- /dev/null +++ b/model-00035-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:62c8d6a342c084bbe6b322f85dc8b0068d145b825c66d8a9b45bd735dfa90bb2 +size 4560382696 diff --git a/model-00036-of-00122.safetensors b/model-00036-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..8116f1368bda59d8c8c5df3b5db1e21cc9927a91 --- /dev/null +++ b/model-00036-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:03fca81caf611a9bdc19acba34b594e5f4893f820a3d13e4d136ba66fd858e95 +size 8589934736 diff --git a/model-00037-of-00122.safetensors b/model-00037-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..7b08fdddf2d9e055f7f4b0661239d2ff601a337e --- /dev/null +++ b/model-00037-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:904e9b94e0a3199932e43fa5b28dbe7ee01785ff9e354b15129a0ddc5db85c9e +size 4560382696 diff --git a/model-00038-of-00122.safetensors b/model-00038-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..bc98aed82ea6a0ee23877e75ebd753418db85399 --- /dev/null +++ b/model-00038-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6c2ffcd57a045e7d680629481c9d8e70a444e18b9a440efed48a80dc01ed6d51 +size 8589934736 diff --git a/model-00039-of-00122.safetensors b/model-00039-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..51f45ac2e7d6f8aa309636d8b8ec40a80e938fa4 --- /dev/null +++ b/model-00039-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5d4d970b2ddad62e5a13dd453e22366c4839eff5252da864e7dd15a29fa3c2b3 +size 4534070104 diff --git a/model-00040-of-00122.safetensors b/model-00040-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..56720fc9c8474a8b5c5c2ff9e4e71a263fd0847e --- /dev/null +++ b/model-00040-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f4b019b26dfb32f3e56ff0188aa2643cb349169ee96b405d6d744624abf9059e +size 8589934736 diff --git a/model-00041-of-00122.safetensors b/model-00041-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..dd13d0591d2f0f58f98ea60fa9ef32608812dddc --- /dev/null +++ b/model-00041-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:95f7bc9dceea0763bed6fb11cf3b05fecf6538d771cc26e170217d8894110da2 +size 4560382696 diff --git a/model-00042-of-00122.safetensors b/model-00042-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..c53e4ea57d563cbe9f70f4f375cffe2f3a0915e3 --- /dev/null +++ b/model-00042-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ab2d54cbff0deec4cefa4a4dd35ff3bc7969077348a35961fc903427693fd78b +size 8589934736 diff --git a/model-00043-of-00122.safetensors b/model-00043-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..3dcd651c7bbb4c7f473f3e9d744879c859beb53b --- /dev/null +++ b/model-00043-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c98687161e665d6c84997bcfc76bb458e91247aa8bfd80894b1ebc39708f8793 +size 4560382696 diff --git a/model-00044-of-00122.safetensors b/model-00044-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..6b6b0ee82cc33a8256b896d8d77edc26cb1872c1 --- /dev/null +++ b/model-00044-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fdb82a56042540faffe7c9e75345754b65d5f0cccd4b7749e7788230aa2798fe +size 8589934736 diff --git a/model-00045-of-00122.safetensors b/model-00045-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..5c4eb548eddbafcedef71ac280741b407f47941e --- /dev/null +++ b/model-00045-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7fc631273ca3f9e1dd93739ca397b11fcf39b2f5cbfff41165d29370c44b6fb4 +size 4560382696 diff --git a/model-00046-of-00122.safetensors b/model-00046-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..b25b2a364da0692bed3a9da6e82b7e9b23f76a03 --- /dev/null +++ b/model-00046-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a4ba7e7a354ed8de1521d68ad50dad92eac524ea1c7eba35ec96963b03ca08e1 +size 8589934736 diff --git a/model-00047-of-00122.safetensors b/model-00047-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..6a1acad931bb66feb63fca09a3cc50e80e25019b --- /dev/null +++ b/model-00047-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b4fe54f368199c986ba1eecce072ca2937d75571992305909ca23f72d978a667 +size 4534070104 diff --git a/model-00048-of-00122.safetensors b/model-00048-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..6300cf4fba842fa97aae8f984ab63a4997282beb --- /dev/null +++ b/model-00048-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:265a324ce0b454dd4ff552536b945bde8c49782955ef940a083cb446edd75a28 +size 8589934736 diff --git a/model-00049-of-00122.safetensors b/model-00049-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..a5ad8e569211151f8a597633a300f86fdb70061b --- /dev/null +++ b/model-00049-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4654cc5b6ba41067e08c520dec26058be070c8549458aa16b51bf7274d53c5f2 +size 4560382696 diff --git a/model-00050-of-00122.safetensors b/model-00050-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..2074f1f337b6dfaabd630cd95583a8ee97d763e2 --- /dev/null +++ b/model-00050-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9038f6c1f501fb652c09fa4d89ef031a03e2b92eadb9ef6db3c0ef2cbefb65ed +size 8589934736 diff --git a/model-00051-of-00122.safetensors b/model-00051-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..856ddfca66b05df29dfe8bcfc97f3ca95885299f --- /dev/null +++ b/model-00051-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0a2c672f15b18c544b02e388d46e0820bb33a60240adb8a9a3a58d2053c3885b +size 4560382696 diff --git a/model-00052-of-00122.safetensors b/model-00052-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..e11a1bb02335c47566e178366bb3ff3e9096ae6e --- /dev/null +++ b/model-00052-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5dfc41110867f18ac9b3232577f8c0bfae1b8b9354047ba867350e17f1a89010 +size 8589934736 diff --git a/model-00053-of-00122.safetensors b/model-00053-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..ba2a642ec8774f7a37613479b27d55d1e1c604cd --- /dev/null +++ b/model-00053-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:78e0aa3a16e5f19501ea7712049a7e93b8446cd3b8c7477b2393867240505eda +size 4560382696 diff --git a/model-00054-of-00122.safetensors b/model-00054-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..9725821fd4d57de2a5227db4486cf3d07abd843f --- /dev/null +++ b/model-00054-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2aa372adfd3d9bf04c9f93c11f9aa5a902ad7a7e89c9862d8c003c9f81238950 +size 8589934736 diff --git a/model-00055-of-00122.safetensors b/model-00055-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..655c1a8188bae1e1955d8b67acb8138c03269b2f --- /dev/null +++ b/model-00055-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:54218882fe198282baf1249065d2af643da96de792674d516f5deb2361f66e97 +size 4534070104 diff --git a/model-00056-of-00122.safetensors b/model-00056-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..953a0583567e8072bd79875365e2e05a1be0d253 --- /dev/null +++ b/model-00056-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2d75e82b6488c59b973219cf4a22a7efdc2283f15def131e7dc94fa6959bad9c +size 8589934736 diff --git a/model-00057-of-00122.safetensors b/model-00057-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..e41f2cc7cfa9acdb9969f3c0ab96b195537193d1 --- /dev/null +++ b/model-00057-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:68b18f6a33ac8b64a7fb64735ba3f301b8ebea16e40e0e611a9c2a7ffed1624a +size 4560382696 diff --git a/model-00058-of-00122.safetensors b/model-00058-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..3c372b886eac4adab3067f56a121644e512f3ad3 --- /dev/null +++ b/model-00058-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:15901b8959c3ab9e996276b3cc72cd7a1b93ddc268fbfba1d2013e516812c2e4 +size 8589934736 diff --git a/model-00059-of-00122.safetensors b/model-00059-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..e7045c15535442afe004a79be828b2667c1d87ed --- /dev/null +++ b/model-00059-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:259080c561d563ec7b6828b40a92df8b1219cabcc700331d2f03e8e965913047 +size 4560382696 diff --git a/model-00060-of-00122.safetensors b/model-00060-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..406193194bf1b0b30ed256d85ec3a136a76e3643 --- /dev/null +++ b/model-00060-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:40cf83ed518da1663ebd7596a714abdbe48bc3353ed95635db1f78478c07e1d4 +size 8589934736 diff --git a/model-00061-of-00122.safetensors b/model-00061-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..07261535912b0875daa65ca6cffdcf6004dbf826 --- /dev/null +++ b/model-00061-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3ef8102b9173839f4f155f66fe1d4f2b1deb84532b4928f35edfbfa2114f429e +size 4560382696 diff --git a/model-00062-of-00122.safetensors b/model-00062-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..9602f156f795156173b9b6c48c12e56f165adbdd --- /dev/null +++ b/model-00062-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4c2fcec62f166edc784e74f6f06da7c84f87b982c850a7a989118ec9cdcb63d9 +size 8589934736 diff --git a/model-00063-of-00122.safetensors b/model-00063-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..1ad0994609b684b1c18cdee9eda6bdc40af0dcf6 --- /dev/null +++ b/model-00063-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:021fb94eecb4809b2530015fb626175ceb3a7f1459c759b9f7c41d4eeac860a0 +size 4534070104 diff --git a/model-00064-of-00122.safetensors b/model-00064-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..e08b121c7149348b5a6844ef0f562f19d43b4e7b --- /dev/null +++ b/model-00064-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cb9ab1c6ab6170393e095b5be8f462430bba54ace42cd46d8014a7479c29cb48 +size 8589934736 diff --git a/model-00065-of-00122.safetensors b/model-00065-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..edf87a989e3c930ff25b8610dea1dd20312fff31 --- /dev/null +++ b/model-00065-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9a4ea84c2da8a3b8ffed3e053013c19d89d4e8a1230ebf10149179007aad01d6 +size 4560382696 diff --git a/model-00066-of-00122.safetensors b/model-00066-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..d95b92837dafb97542ebcb955dad6e541f641600 --- /dev/null +++ b/model-00066-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e154396bf53a852c2fea54c2d7b34f4ff5b64b58b22878ba7b7bd333ed044d52 +size 8589934736 diff --git a/model-00067-of-00122.safetensors b/model-00067-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..9fd06c84ba9bd5e56c3354725b268df7b51c5cac --- /dev/null +++ b/model-00067-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:224311110f7697094d4e21cf9288388b272db3e4639664d24ad2aae4afb3da53 +size 4560382696 diff --git a/model-00068-of-00122.safetensors b/model-00068-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..b8483bc2eaf5a11d0fc6c1ec25a20a6f8978f666 --- /dev/null +++ b/model-00068-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:803fa29d4d0ad36b31ecc267ee9383f135fa5453e84f9fcc2add28752451b0a4 +size 8589934736 diff --git a/model-00069-of-00122.safetensors b/model-00069-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..c4867c876315fe31cc497ae84cd3995c4edab589 --- /dev/null +++ b/model-00069-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:57261653b487be2fd6b0ee12008d73b53abb6db241d1934dae3b2b1164cf190e +size 4560382696 diff --git a/model-00070-of-00122.safetensors b/model-00070-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..69b6fe36d7b03c5d3d503c0ecc40c407edce5f7a --- /dev/null +++ b/model-00070-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ce911bc0a8daf95997d979549c56f5b3807b89573a0e65b623add70f769e8833 +size 8589934736 diff --git a/model-00071-of-00122.safetensors b/model-00071-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..fa02d511cf2b7e7df13e907f672f0cfcd14527c1 --- /dev/null +++ b/model-00071-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d5d8b2090ad2d4596a8216af5ed2d4a96f96b32dfe9f9da6b8e0c51080eb8a9f +size 4534070104 diff --git a/model-00072-of-00122.safetensors b/model-00072-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..beef3a66ced0ae5269335048580a4cf77d81ee09 --- /dev/null +++ b/model-00072-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8a9b2fa600977d1e7c54f164ef8cef3303497d424205d8ea2987e7e10c3a9ece +size 8589934736 diff --git a/model-00073-of-00122.safetensors b/model-00073-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..20051e37997fa3dac746d657e8f93ac93d399d24 --- /dev/null +++ b/model-00073-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e98407709c01299e24fef344b96661ab2840eb16f0aca733e40d4645ca5abb9d +size 4560382696 diff --git a/model-00074-of-00122.safetensors b/model-00074-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..1708d5fb1081c3c8bbf6e69e66d12921f0e4223a --- /dev/null +++ b/model-00074-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:444fc2a3ad73a22e7d433116f0e62288258b27f90a9311721178de92ec467ae1 +size 8589934736 diff --git a/model-00075-of-00122.safetensors b/model-00075-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..947076d93b70022d0ccfdc031bda345ceb779b0b --- /dev/null +++ b/model-00075-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d044c30b084273532a285220e369e810186a83f2fe2e3f6726cb66e3447eefdb +size 4560382696 diff --git a/model-00076-of-00122.safetensors b/model-00076-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..8dac99c5e03da7998d51b6f9b5e0bcb812781358 --- /dev/null +++ b/model-00076-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e715b93cc55d982fa3c27dddd40e9eecd890b29a851019022de589cdc0e1cf27 +size 8589934736 diff --git a/model-00077-of-00122.safetensors b/model-00077-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..ad53fd64ca39ef23a676bd078e7f044c03d4b1da --- /dev/null +++ b/model-00077-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0f08fdc7209c0ef4f3fe4c0a3352c71f5bcdc7c40103e7194396561eecf4cff7 +size 4560382696 diff --git a/model-00078-of-00122.safetensors b/model-00078-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..0778a0bcb86c20f905864d7cd079616a0db6bb7d --- /dev/null +++ b/model-00078-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9d6fba8694dd808e2de9851ef884b126fd0cb6c45cb16930878c39ce479a3cfa +size 8589934736 diff --git a/model-00079-of-00122.safetensors b/model-00079-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..f453a3e261da81086cf610514723409274fe7673 --- /dev/null +++ b/model-00079-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:11c2f68a8e7bef42f3e40e13bcae4d1629e5efeb829cfdeeaf937400d7516690 +size 4534070104 diff --git a/model-00080-of-00122.safetensors b/model-00080-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..7003d3504b596cf6ad71f44673ba8ff46a80e04f --- /dev/null +++ b/model-00080-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:adc8814ad5dcb07fb139c22d09f5bc75125303c170a3fe94f310d26abb8f1b29 +size 8589934736 diff --git a/model-00081-of-00122.safetensors b/model-00081-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..7570822dda025d651e6453dc426ab1f06d7ae2f5 --- /dev/null +++ b/model-00081-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4206626be0f2ee3a23d3fc24f26cd5126fb4f37408a7122852dd2524fca57a5a +size 4560382696 diff --git a/model-00082-of-00122.safetensors b/model-00082-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..e603057eb3a8cf5ba8a5d8256d9597a988144a39 --- /dev/null +++ b/model-00082-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:91ebd1e9e6d129e11f72c615f67b2978c26c025be9371c2db63d8ee766d98a4a +size 8589934736 diff --git a/model-00083-of-00122.safetensors b/model-00083-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..e6877224750dfd902151244a3573100a08151994 --- /dev/null +++ b/model-00083-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:09b68aec8d557b6e5f40c2a333b77a601695e3f1cd6f1a88811c3a8be185f791 +size 4560382696 diff --git a/model-00084-of-00122.safetensors b/model-00084-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..c40d1acc1b7383a7e24423308cbfcbf8854e4cb7 --- /dev/null +++ b/model-00084-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e28971de2e4cf864ef76af31aaf91c87fd53da2a206afecc656407d1707acf3f +size 8589934736 diff --git a/model-00085-of-00122.safetensors b/model-00085-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..daf1071727763e6a540e621e05d61732c24458aa --- /dev/null +++ b/model-00085-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0e2f32a44c5c605d92daed095a4138e577fe83765cea032c06ca6bcc96036d05 +size 4560382696 diff --git a/model-00086-of-00122.safetensors b/model-00086-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..a91fdb7da321443d1f8e95dd7e5b1d9a7b726247 --- /dev/null +++ b/model-00086-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bf93ed3b6a65143e0162e13ff0733711578f5e4e0ba530639ba452174312ae8b +size 8589934736 diff --git a/model-00087-of-00122.safetensors b/model-00087-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..4035dd079f3ca9d8821b0d5c5e95062c0e81f757 --- /dev/null +++ b/model-00087-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:262a3ef71560a3233b3ce67eb43d85e90da8a3b9f932d828684a6b9e263a5a70 +size 4534070104 diff --git a/model-00088-of-00122.safetensors b/model-00088-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..59f04f73c6255e3ac2c963d927bcfc7e0273c1da --- /dev/null +++ b/model-00088-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:01ace51ce36b7703d4e2e29e91c53911947c6e0c9bd6cab2f814c4c02517916e +size 8589934736 diff --git a/model-00089-of-00122.safetensors b/model-00089-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..844711f0d1c642557e539cf8c19f8f6a7b5a537c --- /dev/null +++ b/model-00089-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7e763b7bc133cd666a49c41d395f87e1d4240f1225f95426514772b11890c104 +size 4560382696 diff --git a/model-00090-of-00122.safetensors b/model-00090-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..975c9d90b742a3a407dbb077f9951f91331147ec --- /dev/null +++ b/model-00090-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2133085caceda97be43965513f6712712be1a6ecf5e417c0d69d4d1ae8f2eb5c +size 8589934736 diff --git a/model-00091-of-00122.safetensors b/model-00091-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..a12a99306ace3bc38c2c7aabd5281d3c06c4d34b --- /dev/null +++ b/model-00091-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:47dc2294299acd86c9a263484cbbd26040f1cbcf588b434f459824bf3911cefb +size 4560382696 diff --git a/model-00092-of-00122.safetensors b/model-00092-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..06c7c4555e34948414cc15bf0bafeaf851324c99 --- /dev/null +++ b/model-00092-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:926e4f6c949d6d08d265f46c1f1ebf3183feae0d87eb954e64c4d118ceccdcc3 +size 8589934736 diff --git a/model-00093-of-00122.safetensors b/model-00093-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..22887d3f6a8e356c5c1a9a8584b19e10464d5e85 --- /dev/null +++ b/model-00093-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:079d2ea7458c88e99a16864de94c2ac96b4d2d36e34e9f8bf9b13e1c89983d57 +size 4560382696 diff --git a/model-00094-of-00122.safetensors b/model-00094-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..2301dd311641cceebe8e38516658daf81399542b --- /dev/null +++ b/model-00094-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3f89363b228cbe06e2d95eb176b0235b3999aa2d3748993ea06b492befd37af7 +size 8589934736 diff --git a/model-00095-of-00122.safetensors b/model-00095-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..d2878e57c46be4c7195c5d9f9e8069bb47683143 --- /dev/null +++ b/model-00095-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:846bfddf1a397be85dd2cb15806d8bf34221779aed1989d5592e09ada88bfc4e +size 4534070104 diff --git a/model-00096-of-00122.safetensors b/model-00096-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..9b3ea91a35cbd43f1638de1703812d605255d02b --- /dev/null +++ b/model-00096-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:83384cadda52ed9184c622fe3dc226e91bef64a43de626f9a096f91dde380e1a +size 8589934736 diff --git a/model-00097-of-00122.safetensors b/model-00097-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..f89a04b3f6e1bbab8272113265e797339f9f734a --- /dev/null +++ b/model-00097-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:03e037877ade47ed158e2a02e5b52163e6815bf74628f08991c6f21cfb8bd12a +size 4560382696 diff --git a/model-00098-of-00122.safetensors b/model-00098-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..52f7e0398885cc211f2a0b73e796d73ff793ea37 --- /dev/null +++ b/model-00098-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6f032cba3820c49dd4e7210d058f948b2f8e98e68c40a9ec97e1149a84280c5f +size 8589934736 diff --git a/model-00099-of-00122.safetensors b/model-00099-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..6fc8789bed710f71a9d90d9afe43eab9ba5d6aad --- /dev/null +++ b/model-00099-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d9e87c6892764f64c93aac3d8f923e85b23213ed73bd8559cfe24d4d7a7037c8 +size 4560382696 diff --git a/model-00100-of-00122.safetensors b/model-00100-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..376ebc115c86fea3298c6857677a9c1f7b8ac2ed --- /dev/null +++ b/model-00100-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c596dfa8e3267717cda36f8033f51b54c6556245901db256d3c77c393abf3f24 +size 8589934736 diff --git a/model-00101-of-00122.safetensors b/model-00101-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..9b428e890104b9b74cf5529d2617b5c4ea9a790d --- /dev/null +++ b/model-00101-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:630449860245457b4d84447de71d3a95cd43a096989887931fc636d4c4231b75 +size 4560382696 diff --git a/model-00102-of-00122.safetensors b/model-00102-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..f8f0d7464a05e15cd3f94c601dcdaf03a2e2dffd --- /dev/null +++ b/model-00102-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:39d7f825b5337c88155f7cd4266e4e70b31af65557834bb79eaafcf7498776fc +size 8589934736 diff --git a/model-00103-of-00122.safetensors b/model-00103-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..7f0e542556683ba0b536dc34d7d49065c6ca48c8 --- /dev/null +++ b/model-00103-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1f232c57b4d4b41514f5c93e6659b610e2ef444d0cf796c8a09d7468fdded807 +size 4534070104 diff --git a/model-00104-of-00122.safetensors b/model-00104-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..5970abe534baa49aff03461f1e7b7ce6bfaaab86 --- /dev/null +++ b/model-00104-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ddd85eac7ad60dacad31ffe6dd8186bc0b01d2a894aad5a6be8b83f0ea8a8c38 +size 8589934736 diff --git a/model-00105-of-00122.safetensors b/model-00105-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..fefe50ca3e97b6da2f79f35943b34068f7b6fbea --- /dev/null +++ b/model-00105-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e281c94b8d7905a15500b1bd4fe8e8ac1d478e13544bca6982dd09251a3f0103 +size 4560382696 diff --git a/model-00106-of-00122.safetensors b/model-00106-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..28d263366319c013dc20dff217362ecc20566de2 --- /dev/null +++ b/model-00106-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:48b98398d9e8cf98a28ecea47eeddbe6621bb6ced42034f016119791a9eed134 +size 8589934736 diff --git a/model-00107-of-00122.safetensors b/model-00107-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..cd6adb93324aa6f3402141c88dbe7cd68d7d2ed0 --- /dev/null +++ b/model-00107-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ae341f273195777f7af296d1ddddc8809295b802327ae1db6d5f5efa25c37d34 +size 4560382696 diff --git a/model-00108-of-00122.safetensors b/model-00108-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..cb851dbffa0a073ab0865f63cb749b7619831be3 --- /dev/null +++ b/model-00108-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bf5b8774e59433951d6c29f2de4155c8a90619ca6db4eb9a34b3da83d3550382 +size 8589934736 diff --git a/model-00109-of-00122.safetensors b/model-00109-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..e54ab4f030f8449d5442388d91af464d36aa0c71 --- /dev/null +++ b/model-00109-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:91bdab0a21226a28c9a1bb34f44fa4942a74b5f986e5552787047765340651e1 +size 4560382696 diff --git a/model-00110-of-00122.safetensors b/model-00110-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..f4e0adfb48a0707158651c7f9b3f99a16d99c6ec --- /dev/null +++ b/model-00110-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2f2d5a7f943b6d31c7e245492fadbfdfa6f075399e2a149a7fb8eae6ebb912f9 +size 8589934736 diff --git a/model-00111-of-00122.safetensors b/model-00111-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..8aeff6bffc0221f4f39e38f74b2d416490a40c8f --- /dev/null +++ b/model-00111-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0a23fe120a1a0cf735eedb6dba6005756e2ece3736f3b6ebb95104567885f878 +size 4534070104 diff --git a/model-00112-of-00122.safetensors b/model-00112-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..e547ebadf93d4d0770d8fa7578a029dc4d4d48d5 --- /dev/null +++ b/model-00112-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2326b5bca2b5c0a9aec149f4b6e13f44852da16a38961c70a7517087d404d999 +size 8589934736 diff --git a/model-00113-of-00122.safetensors b/model-00113-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..eb96f618a9f3367e7d256995086caca5dd5f9dc9 --- /dev/null +++ b/model-00113-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:61af199a6fead8deda248cdf525c71683c9f2334c0ed3f4ae826b988e266b5f6 +size 4560382696 diff --git a/model-00114-of-00122.safetensors b/model-00114-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..e964cc8c04a3496a906234af08d4ca9468166ab2 --- /dev/null +++ b/model-00114-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:59670ec39aba4bd98278694e2aa3e46a0116f65d4281851d15750d93ed61d0c0 +size 8589934736 diff --git a/model-00115-of-00122.safetensors b/model-00115-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..ea0c7eff3f1ffce208cf642ca0a9fb4150a4d6fa --- /dev/null +++ b/model-00115-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f7f5e1efe783dd970d58ebef046e5f4aa2cab914527254ef204c9d3ad24e0293 +size 4560382696 diff --git a/model-00116-of-00122.safetensors b/model-00116-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..46a3487cd8caa89dc182c0bf1af7e30d2e89134e --- /dev/null +++ b/model-00116-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1c4a98091d80d059c58972b21ff5ef30e71683355294fd6e9117deed278e31cc +size 8589934736 diff --git a/model-00117-of-00122.safetensors b/model-00117-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..527f0937ccb2f3c28be6f59d12544caaec730265 --- /dev/null +++ b/model-00117-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cd57f2a7ca004adffe526c3284c155b1ae862429a47e6da7ab2481cbce635c2d +size 4560382696 diff --git a/model-00118-of-00122.safetensors b/model-00118-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..2e7b7602e47c6f533fa70b1bad3716e2a721547e --- /dev/null +++ b/model-00118-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e14c1bb30bf23f19e66861d3d17c27ee0703a2c1a74cddb236cd8bc9a66bfc98 +size 8589934736 diff --git a/model-00119-of-00122.safetensors b/model-00119-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..d84eb7eabd0a9edabdffab671151e3c6d5e34583 --- /dev/null +++ b/model-00119-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0b3cfbd10b1070b748a219a2f33c6cefba66530bfaa30dd179489b368f615e13 +size 4534070104 diff --git a/model-00120-of-00122.safetensors b/model-00120-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..1504193f0f31a55034974e3482c384ca1a4e34bd --- /dev/null +++ b/model-00120-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:796bd42c249d3cf5ed758584b02860ec8789e37318cd3bf9eef13218d57c1ab6 +size 8589934736 diff --git a/model-00121-of-00122.safetensors b/model-00121-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..0fd355f64feb78a85a91578a2b7158bff63a1765 --- /dev/null +++ b/model-00121-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f69722260fa747cbea37adf5d57c8259bd6a682b9ea82cb77b17889906b180f3 +size 4294975760 diff --git a/model-00122-of-00122.safetensors b/model-00122-of-00122.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..99929e67f4bf04169c2f0361c18ed83884aff159 --- /dev/null +++ b/model-00122-of-00122.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9f4043bb20f024a6a25bc89376703e3d3a6a8456e07ee90aa03d9ac16982976a +size 2034245840 diff --git a/model.safetensors.index.json b/model.safetensors.index.json new file mode 100644 index 0000000000000000000000000000000000000000..13dba71ba5feadcd979f7ea64d5533432b5ac27f --- /dev/null +++ b/model.safetensors.index.json @@ -0,0 +1,1378 @@ +{ + "metadata": { + "total_size": 793604721632 + }, + "weight_map": { + "model.language_model.embed_tokens.weight": "model-00001-of-00122.safetensors", + "model.visual.patch_embed.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.patch_embed.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.pos_embed.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.0.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.0.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.0.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.0.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.0.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.0.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.0.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.0.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.0.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.0.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.0.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.0.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.1.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.1.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.1.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.1.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.1.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.1.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.1.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.1.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.1.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.1.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.1.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.1.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.2.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.2.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.2.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.2.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.2.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.2.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.2.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.2.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.2.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.2.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.2.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.2.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.3.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.3.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.3.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.3.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.3.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.3.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.3.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.3.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.3.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.3.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.3.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.3.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.4.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.4.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.4.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.4.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.4.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.4.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.4.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.4.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.4.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.4.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.4.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.4.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.5.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.5.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.5.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.5.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.5.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.5.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.5.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.5.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.5.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.5.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.5.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.5.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.6.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.6.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.6.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.6.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.6.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.6.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.6.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.6.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.6.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.6.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.6.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.6.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.7.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.7.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.7.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.7.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.7.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.7.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.7.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.7.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.7.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.7.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.7.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.7.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.8.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.8.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.8.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.8.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.8.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.8.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.8.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.8.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.8.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.8.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.8.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.8.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.9.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.9.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.9.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.9.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.9.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.9.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.9.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.9.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.9.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.9.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.9.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.9.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.10.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.10.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.10.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.10.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.10.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.10.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.10.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.10.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.10.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.10.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.10.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.10.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.11.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.11.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.11.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.11.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.11.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.11.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.11.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.11.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.11.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.11.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.11.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.11.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.12.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.12.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.12.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.12.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.12.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.12.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.12.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.12.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.12.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.12.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.12.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.12.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.13.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.13.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.13.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.13.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.13.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.13.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.13.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.13.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.13.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.13.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.13.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.13.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.14.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.14.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.14.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.14.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.14.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.14.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.14.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.14.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.14.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.14.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.14.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.14.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.15.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.15.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.15.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.15.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.15.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.15.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.15.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.15.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.15.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.15.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.15.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.15.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.16.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.16.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.16.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.16.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.16.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.16.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.16.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.16.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.16.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.16.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.16.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.16.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.17.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.17.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.17.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.17.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.17.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.17.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.17.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.17.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.17.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.17.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.17.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.17.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.18.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.18.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.18.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.18.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.18.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.18.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.18.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.18.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.18.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.18.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.18.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.18.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.19.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.19.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.19.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.19.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.19.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.19.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.19.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.19.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.19.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.19.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.19.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.19.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.20.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.20.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.20.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.20.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.20.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.20.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.20.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.20.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.20.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.20.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.20.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.20.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.21.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.21.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.21.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.21.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.21.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.21.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.21.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.21.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.21.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.21.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.21.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.21.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.22.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.22.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.22.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.22.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.22.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.22.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.22.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.22.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.22.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.22.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.22.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.22.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.23.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.23.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.23.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.23.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.23.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.23.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.23.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.23.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.23.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.23.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.23.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.23.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.24.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.24.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.24.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.24.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.24.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.24.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.24.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.24.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.24.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.24.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.24.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.24.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.25.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.25.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.25.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.25.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.25.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.25.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.25.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.25.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.25.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.25.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.25.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.25.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.26.norm1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.26.norm1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.26.norm2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.26.norm2.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.26.attn.qkv.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.26.attn.qkv.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.26.attn.proj.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.26.attn.proj.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.26.mlp.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.26.mlp.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.blocks.26.mlp.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.blocks.26.mlp.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.visual.merger.norm.weight": "model-00001-of-00122.safetensors", + "model.visual.merger.norm.bias": "model-00001-of-00122.safetensors", + "model.visual.merger.linear_fc1.weight": "model-00001-of-00122.safetensors", + "model.visual.merger.linear_fc1.bias": "model-00001-of-00122.safetensors", + "model.visual.merger.linear_fc2.weight": "model-00001-of-00122.safetensors", + "model.visual.merger.linear_fc2.bias": "model-00001-of-00122.safetensors", + "model.language_model.layers.0.linear_attn.in_proj_qkv.weight": "model-00001-of-00122.safetensors", + "model.language_model.layers.0.linear_attn.in_proj_z.weight": "model-00001-of-00122.safetensors", + "model.language_model.layers.0.linear_attn.in_proj_b.weight": "model-00001-of-00122.safetensors", + "model.language_model.layers.0.linear_attn.in_proj_a.weight": "model-00001-of-00122.safetensors", + "model.language_model.layers.0.linear_attn.conv1d.weight": "model-00001-of-00122.safetensors", + "model.language_model.layers.0.linear_attn.dt_bias": "model-00001-of-00122.safetensors", + "model.language_model.layers.0.linear_attn.A_log": "model-00001-of-00122.safetensors", + "model.language_model.layers.0.linear_attn.norm.weight": "model-00001-of-00122.safetensors", + "model.language_model.layers.0.linear_attn.out_proj.weight": "model-00001-of-00122.safetensors", + "model.language_model.layers.0.input_layernorm.weight": "model-00001-of-00122.safetensors", + "model.language_model.layers.0.mlp.gate.weight": "model-00001-of-00122.safetensors", + "model.language_model.layers.0.mlp.shared_expert.gate_proj.weight": "model-00001-of-00122.safetensors", + "model.language_model.layers.0.mlp.shared_expert.up_proj.weight": "model-00001-of-00122.safetensors", + "model.language_model.layers.0.mlp.shared_expert.down_proj.weight": "model-00001-of-00122.safetensors", + "model.language_model.layers.0.mlp.shared_expert_gate.weight": "model-00001-of-00122.safetensors", + "model.language_model.layers.0.mlp.experts.gate_up_proj": "model-00002-of-00122.safetensors", + "model.language_model.layers.0.mlp.experts.down_proj": "model-00003-of-00122.safetensors", + "model.language_model.layers.0.post_attention_layernorm.weight": "model-00003-of-00122.safetensors", + "model.language_model.layers.1.linear_attn.in_proj_qkv.weight": "model-00003-of-00122.safetensors", + "model.language_model.layers.1.linear_attn.in_proj_z.weight": "model-00003-of-00122.safetensors", + "model.language_model.layers.1.linear_attn.in_proj_b.weight": "model-00003-of-00122.safetensors", + "model.language_model.layers.1.linear_attn.in_proj_a.weight": "model-00003-of-00122.safetensors", + "model.language_model.layers.1.linear_attn.conv1d.weight": "model-00003-of-00122.safetensors", + "model.language_model.layers.1.linear_attn.dt_bias": "model-00003-of-00122.safetensors", + "model.language_model.layers.1.linear_attn.A_log": "model-00003-of-00122.safetensors", + "model.language_model.layers.1.linear_attn.norm.weight": "model-00003-of-00122.safetensors", + "model.language_model.layers.1.linear_attn.out_proj.weight": "model-00003-of-00122.safetensors", + "model.language_model.layers.1.input_layernorm.weight": "model-00003-of-00122.safetensors", + "model.language_model.layers.1.mlp.gate.weight": "model-00003-of-00122.safetensors", + "model.language_model.layers.1.mlp.shared_expert.gate_proj.weight": "model-00003-of-00122.safetensors", + "model.language_model.layers.1.mlp.shared_expert.up_proj.weight": "model-00003-of-00122.safetensors", + "model.language_model.layers.1.mlp.shared_expert.down_proj.weight": "model-00003-of-00122.safetensors", + "model.language_model.layers.1.mlp.shared_expert_gate.weight": "model-00003-of-00122.safetensors", + "model.language_model.layers.1.mlp.experts.gate_up_proj": "model-00004-of-00122.safetensors", + "model.language_model.layers.1.mlp.experts.down_proj": "model-00005-of-00122.safetensors", + "model.language_model.layers.1.post_attention_layernorm.weight": "model-00005-of-00122.safetensors", + "model.language_model.layers.2.linear_attn.in_proj_qkv.weight": "model-00005-of-00122.safetensors", + "model.language_model.layers.2.linear_attn.in_proj_z.weight": "model-00005-of-00122.safetensors", + "model.language_model.layers.2.linear_attn.in_proj_b.weight": "model-00005-of-00122.safetensors", + "model.language_model.layers.2.linear_attn.in_proj_a.weight": "model-00005-of-00122.safetensors", + "model.language_model.layers.2.linear_attn.conv1d.weight": "model-00005-of-00122.safetensors", + "model.language_model.layers.2.linear_attn.dt_bias": "model-00005-of-00122.safetensors", + "model.language_model.layers.2.linear_attn.A_log": "model-00005-of-00122.safetensors", + "model.language_model.layers.2.linear_attn.norm.weight": "model-00005-of-00122.safetensors", + "model.language_model.layers.2.linear_attn.out_proj.weight": "model-00005-of-00122.safetensors", + "model.language_model.layers.2.input_layernorm.weight": "model-00005-of-00122.safetensors", + "model.language_model.layers.2.mlp.gate.weight": "model-00005-of-00122.safetensors", + "model.language_model.layers.2.mlp.shared_expert.gate_proj.weight": "model-00005-of-00122.safetensors", + "model.language_model.layers.2.mlp.shared_expert.up_proj.weight": "model-00005-of-00122.safetensors", + "model.language_model.layers.2.mlp.shared_expert.down_proj.weight": "model-00005-of-00122.safetensors", + "model.language_model.layers.2.mlp.shared_expert_gate.weight": "model-00005-of-00122.safetensors", + "model.language_model.layers.2.mlp.experts.gate_up_proj": "model-00006-of-00122.safetensors", + "model.language_model.layers.2.mlp.experts.down_proj": "model-00007-of-00122.safetensors", + "model.language_model.layers.2.post_attention_layernorm.weight": "model-00007-of-00122.safetensors", + "model.language_model.layers.3.self_attn.q_proj.weight": "model-00007-of-00122.safetensors", + "model.language_model.layers.3.self_attn.k_proj.weight": "model-00007-of-00122.safetensors", + "model.language_model.layers.3.self_attn.v_proj.weight": "model-00007-of-00122.safetensors", + "model.language_model.layers.3.self_attn.o_proj.weight": "model-00007-of-00122.safetensors", + "model.language_model.layers.3.self_attn.q_norm.weight": "model-00007-of-00122.safetensors", + "model.language_model.layers.3.self_attn.k_norm.weight": "model-00007-of-00122.safetensors", + "model.language_model.layers.3.input_layernorm.weight": "model-00007-of-00122.safetensors", + "model.language_model.layers.3.mlp.gate.weight": "model-00007-of-00122.safetensors", + "model.language_model.layers.3.mlp.shared_expert.gate_proj.weight": "model-00007-of-00122.safetensors", + "model.language_model.layers.3.mlp.shared_expert.up_proj.weight": "model-00007-of-00122.safetensors", + "model.language_model.layers.3.mlp.shared_expert.down_proj.weight": "model-00007-of-00122.safetensors", + "model.language_model.layers.3.mlp.shared_expert_gate.weight": "model-00007-of-00122.safetensors", + "model.language_model.layers.3.mlp.experts.gate_up_proj": "model-00008-of-00122.safetensors", + "model.language_model.layers.3.mlp.experts.down_proj": "model-00009-of-00122.safetensors", + "model.language_model.layers.3.post_attention_layernorm.weight": "model-00009-of-00122.safetensors", + "model.language_model.layers.4.linear_attn.in_proj_qkv.weight": "model-00009-of-00122.safetensors", + "model.language_model.layers.4.linear_attn.in_proj_z.weight": "model-00009-of-00122.safetensors", + "model.language_model.layers.4.linear_attn.in_proj_b.weight": "model-00009-of-00122.safetensors", + "model.language_model.layers.4.linear_attn.in_proj_a.weight": "model-00009-of-00122.safetensors", + "model.language_model.layers.4.linear_attn.conv1d.weight": "model-00009-of-00122.safetensors", + "model.language_model.layers.4.linear_attn.dt_bias": "model-00009-of-00122.safetensors", + "model.language_model.layers.4.linear_attn.A_log": "model-00009-of-00122.safetensors", + "model.language_model.layers.4.linear_attn.norm.weight": "model-00009-of-00122.safetensors", + "model.language_model.layers.4.linear_attn.out_proj.weight": "model-00009-of-00122.safetensors", + "model.language_model.layers.4.input_layernorm.weight": "model-00009-of-00122.safetensors", + "model.language_model.layers.4.mlp.gate.weight": "model-00009-of-00122.safetensors", + "model.language_model.layers.4.mlp.shared_expert.gate_proj.weight": "model-00009-of-00122.safetensors", + "model.language_model.layers.4.mlp.shared_expert.up_proj.weight": "model-00009-of-00122.safetensors", + "model.language_model.layers.4.mlp.shared_expert.down_proj.weight": "model-00009-of-00122.safetensors", + "model.language_model.layers.4.mlp.shared_expert_gate.weight": "model-00009-of-00122.safetensors", + "model.language_model.layers.4.mlp.experts.gate_up_proj": "model-00010-of-00122.safetensors", + "model.language_model.layers.4.mlp.experts.down_proj": "model-00011-of-00122.safetensors", + "model.language_model.layers.4.post_attention_layernorm.weight": "model-00011-of-00122.safetensors", + "model.language_model.layers.5.linear_attn.in_proj_qkv.weight": "model-00011-of-00122.safetensors", + "model.language_model.layers.5.linear_attn.in_proj_z.weight": "model-00011-of-00122.safetensors", + "model.language_model.layers.5.linear_attn.in_proj_b.weight": "model-00011-of-00122.safetensors", + "model.language_model.layers.5.linear_attn.in_proj_a.weight": "model-00011-of-00122.safetensors", + "model.language_model.layers.5.linear_attn.conv1d.weight": "model-00011-of-00122.safetensors", + "model.language_model.layers.5.linear_attn.dt_bias": "model-00011-of-00122.safetensors", + "model.language_model.layers.5.linear_attn.A_log": "model-00011-of-00122.safetensors", + "model.language_model.layers.5.linear_attn.norm.weight": "model-00011-of-00122.safetensors", + "model.language_model.layers.5.linear_attn.out_proj.weight": "model-00011-of-00122.safetensors", + "model.language_model.layers.5.input_layernorm.weight": "model-00011-of-00122.safetensors", + "model.language_model.layers.5.mlp.gate.weight": "model-00011-of-00122.safetensors", + "model.language_model.layers.5.mlp.shared_expert.gate_proj.weight": "model-00011-of-00122.safetensors", + "model.language_model.layers.5.mlp.shared_expert.up_proj.weight": "model-00011-of-00122.safetensors", + "model.language_model.layers.5.mlp.shared_expert.down_proj.weight": "model-00011-of-00122.safetensors", + "model.language_model.layers.5.mlp.shared_expert_gate.weight": "model-00011-of-00122.safetensors", + "model.language_model.layers.5.mlp.experts.gate_up_proj": "model-00012-of-00122.safetensors", + "model.language_model.layers.5.mlp.experts.down_proj": "model-00013-of-00122.safetensors", + "model.language_model.layers.5.post_attention_layernorm.weight": "model-00013-of-00122.safetensors", + "model.language_model.layers.6.linear_attn.in_proj_qkv.weight": "model-00013-of-00122.safetensors", + "model.language_model.layers.6.linear_attn.in_proj_z.weight": "model-00013-of-00122.safetensors", + "model.language_model.layers.6.linear_attn.in_proj_b.weight": "model-00013-of-00122.safetensors", + "model.language_model.layers.6.linear_attn.in_proj_a.weight": "model-00013-of-00122.safetensors", + "model.language_model.layers.6.linear_attn.conv1d.weight": "model-00013-of-00122.safetensors", + "model.language_model.layers.6.linear_attn.dt_bias": "model-00013-of-00122.safetensors", + "model.language_model.layers.6.linear_attn.A_log": "model-00013-of-00122.safetensors", + "model.language_model.layers.6.linear_attn.norm.weight": "model-00013-of-00122.safetensors", + "model.language_model.layers.6.linear_attn.out_proj.weight": "model-00013-of-00122.safetensors", + "model.language_model.layers.6.input_layernorm.weight": "model-00013-of-00122.safetensors", + "model.language_model.layers.6.mlp.gate.weight": "model-00013-of-00122.safetensors", + "model.language_model.layers.6.mlp.shared_expert.gate_proj.weight": "model-00013-of-00122.safetensors", + "model.language_model.layers.6.mlp.shared_expert.up_proj.weight": "model-00013-of-00122.safetensors", + "model.language_model.layers.6.mlp.shared_expert.down_proj.weight": "model-00013-of-00122.safetensors", + "model.language_model.layers.6.mlp.shared_expert_gate.weight": "model-00013-of-00122.safetensors", + "model.language_model.layers.6.mlp.experts.gate_up_proj": "model-00014-of-00122.safetensors", + "model.language_model.layers.6.mlp.experts.down_proj": "model-00015-of-00122.safetensors", + "model.language_model.layers.6.post_attention_layernorm.weight": "model-00015-of-00122.safetensors", + "model.language_model.layers.7.self_attn.q_proj.weight": "model-00015-of-00122.safetensors", + "model.language_model.layers.7.self_attn.k_proj.weight": "model-00015-of-00122.safetensors", + "model.language_model.layers.7.self_attn.v_proj.weight": "model-00015-of-00122.safetensors", + "model.language_model.layers.7.self_attn.o_proj.weight": "model-00015-of-00122.safetensors", + "model.language_model.layers.7.self_attn.q_norm.weight": "model-00015-of-00122.safetensors", + "model.language_model.layers.7.self_attn.k_norm.weight": "model-00015-of-00122.safetensors", + "model.language_model.layers.7.input_layernorm.weight": "model-00015-of-00122.safetensors", + "model.language_model.layers.7.mlp.gate.weight": "model-00015-of-00122.safetensors", + "model.language_model.layers.7.mlp.shared_expert.gate_proj.weight": "model-00015-of-00122.safetensors", + "model.language_model.layers.7.mlp.shared_expert.up_proj.weight": "model-00015-of-00122.safetensors", + "model.language_model.layers.7.mlp.shared_expert.down_proj.weight": "model-00015-of-00122.safetensors", + "model.language_model.layers.7.mlp.shared_expert_gate.weight": "model-00015-of-00122.safetensors", + "model.language_model.layers.7.mlp.experts.gate_up_proj": "model-00016-of-00122.safetensors", + "model.language_model.layers.7.mlp.experts.down_proj": "model-00017-of-00122.safetensors", + "model.language_model.layers.7.post_attention_layernorm.weight": "model-00017-of-00122.safetensors", + "model.language_model.layers.8.linear_attn.in_proj_qkv.weight": "model-00017-of-00122.safetensors", + "model.language_model.layers.8.linear_attn.in_proj_z.weight": "model-00017-of-00122.safetensors", + "model.language_model.layers.8.linear_attn.in_proj_b.weight": "model-00017-of-00122.safetensors", + "model.language_model.layers.8.linear_attn.in_proj_a.weight": "model-00017-of-00122.safetensors", + "model.language_model.layers.8.linear_attn.conv1d.weight": "model-00017-of-00122.safetensors", + "model.language_model.layers.8.linear_attn.dt_bias": "model-00017-of-00122.safetensors", + "model.language_model.layers.8.linear_attn.A_log": "model-00017-of-00122.safetensors", + "model.language_model.layers.8.linear_attn.norm.weight": "model-00017-of-00122.safetensors", + "model.language_model.layers.8.linear_attn.out_proj.weight": "model-00017-of-00122.safetensors", + "model.language_model.layers.8.input_layernorm.weight": "model-00017-of-00122.safetensors", + "model.language_model.layers.8.mlp.gate.weight": "model-00017-of-00122.safetensors", + "model.language_model.layers.8.mlp.shared_expert.gate_proj.weight": "model-00017-of-00122.safetensors", + "model.language_model.layers.8.mlp.shared_expert.up_proj.weight": "model-00017-of-00122.safetensors", + "model.language_model.layers.8.mlp.shared_expert.down_proj.weight": "model-00017-of-00122.safetensors", + "model.language_model.layers.8.mlp.shared_expert_gate.weight": "model-00017-of-00122.safetensors", + "model.language_model.layers.8.mlp.experts.gate_up_proj": "model-00018-of-00122.safetensors", + "model.language_model.layers.8.mlp.experts.down_proj": "model-00019-of-00122.safetensors", + "model.language_model.layers.8.post_attention_layernorm.weight": "model-00019-of-00122.safetensors", + "model.language_model.layers.9.linear_attn.in_proj_qkv.weight": "model-00019-of-00122.safetensors", + "model.language_model.layers.9.linear_attn.in_proj_z.weight": "model-00019-of-00122.safetensors", + "model.language_model.layers.9.linear_attn.in_proj_b.weight": "model-00019-of-00122.safetensors", + "model.language_model.layers.9.linear_attn.in_proj_a.weight": "model-00019-of-00122.safetensors", + "model.language_model.layers.9.linear_attn.conv1d.weight": "model-00019-of-00122.safetensors", + "model.language_model.layers.9.linear_attn.dt_bias": "model-00019-of-00122.safetensors", + "model.language_model.layers.9.linear_attn.A_log": "model-00019-of-00122.safetensors", + "model.language_model.layers.9.linear_attn.norm.weight": "model-00019-of-00122.safetensors", + "model.language_model.layers.9.linear_attn.out_proj.weight": "model-00019-of-00122.safetensors", + "model.language_model.layers.9.input_layernorm.weight": "model-00019-of-00122.safetensors", + "model.language_model.layers.9.mlp.gate.weight": "model-00019-of-00122.safetensors", + "model.language_model.layers.9.mlp.shared_expert.gate_proj.weight": "model-00019-of-00122.safetensors", + "model.language_model.layers.9.mlp.shared_expert.up_proj.weight": "model-00019-of-00122.safetensors", + "model.language_model.layers.9.mlp.shared_expert.down_proj.weight": "model-00019-of-00122.safetensors", + "model.language_model.layers.9.mlp.shared_expert_gate.weight": "model-00019-of-00122.safetensors", + "model.language_model.layers.9.mlp.experts.gate_up_proj": "model-00020-of-00122.safetensors", + "model.language_model.layers.9.mlp.experts.down_proj": "model-00021-of-00122.safetensors", + "model.language_model.layers.9.post_attention_layernorm.weight": "model-00021-of-00122.safetensors", + "model.language_model.layers.10.linear_attn.in_proj_qkv.weight": "model-00021-of-00122.safetensors", + "model.language_model.layers.10.linear_attn.in_proj_z.weight": "model-00021-of-00122.safetensors", + "model.language_model.layers.10.linear_attn.in_proj_b.weight": "model-00021-of-00122.safetensors", + "model.language_model.layers.10.linear_attn.in_proj_a.weight": "model-00021-of-00122.safetensors", + "model.language_model.layers.10.linear_attn.conv1d.weight": "model-00021-of-00122.safetensors", + "model.language_model.layers.10.linear_attn.dt_bias": "model-00021-of-00122.safetensors", + "model.language_model.layers.10.linear_attn.A_log": "model-00021-of-00122.safetensors", + "model.language_model.layers.10.linear_attn.norm.weight": "model-00021-of-00122.safetensors", + "model.language_model.layers.10.linear_attn.out_proj.weight": "model-00021-of-00122.safetensors", + "model.language_model.layers.10.input_layernorm.weight": "model-00021-of-00122.safetensors", + "model.language_model.layers.10.mlp.gate.weight": "model-00021-of-00122.safetensors", + "model.language_model.layers.10.mlp.shared_expert.gate_proj.weight": "model-00021-of-00122.safetensors", + "model.language_model.layers.10.mlp.shared_expert.up_proj.weight": "model-00021-of-00122.safetensors", + "model.language_model.layers.10.mlp.shared_expert.down_proj.weight": "model-00021-of-00122.safetensors", + "model.language_model.layers.10.mlp.shared_expert_gate.weight": "model-00021-of-00122.safetensors", + "model.language_model.layers.10.mlp.experts.gate_up_proj": "model-00022-of-00122.safetensors", + "model.language_model.layers.10.mlp.experts.down_proj": "model-00023-of-00122.safetensors", + "model.language_model.layers.10.post_attention_layernorm.weight": "model-00023-of-00122.safetensors", + "model.language_model.layers.11.self_attn.q_proj.weight": "model-00023-of-00122.safetensors", + "model.language_model.layers.11.self_attn.k_proj.weight": "model-00023-of-00122.safetensors", + "model.language_model.layers.11.self_attn.v_proj.weight": "model-00023-of-00122.safetensors", + "model.language_model.layers.11.self_attn.o_proj.weight": "model-00023-of-00122.safetensors", + "model.language_model.layers.11.self_attn.q_norm.weight": "model-00023-of-00122.safetensors", + "model.language_model.layers.11.self_attn.k_norm.weight": "model-00023-of-00122.safetensors", + "model.language_model.layers.11.input_layernorm.weight": "model-00023-of-00122.safetensors", + "model.language_model.layers.11.mlp.gate.weight": "model-00023-of-00122.safetensors", + "model.language_model.layers.11.mlp.shared_expert.gate_proj.weight": "model-00023-of-00122.safetensors", + "model.language_model.layers.11.mlp.shared_expert.up_proj.weight": "model-00023-of-00122.safetensors", + "model.language_model.layers.11.mlp.shared_expert.down_proj.weight": "model-00023-of-00122.safetensors", + "model.language_model.layers.11.mlp.shared_expert_gate.weight": "model-00023-of-00122.safetensors", + "model.language_model.layers.11.mlp.experts.gate_up_proj": "model-00024-of-00122.safetensors", + "model.language_model.layers.11.mlp.experts.down_proj": "model-00025-of-00122.safetensors", + "model.language_model.layers.11.post_attention_layernorm.weight": "model-00025-of-00122.safetensors", + "model.language_model.layers.12.linear_attn.in_proj_qkv.weight": "model-00025-of-00122.safetensors", + "model.language_model.layers.12.linear_attn.in_proj_z.weight": "model-00025-of-00122.safetensors", + "model.language_model.layers.12.linear_attn.in_proj_b.weight": "model-00025-of-00122.safetensors", + "model.language_model.layers.12.linear_attn.in_proj_a.weight": "model-00025-of-00122.safetensors", + "model.language_model.layers.12.linear_attn.conv1d.weight": "model-00025-of-00122.safetensors", + "model.language_model.layers.12.linear_attn.dt_bias": "model-00025-of-00122.safetensors", + "model.language_model.layers.12.linear_attn.A_log": "model-00025-of-00122.safetensors", + "model.language_model.layers.12.linear_attn.norm.weight": "model-00025-of-00122.safetensors", + "model.language_model.layers.12.linear_attn.out_proj.weight": "model-00025-of-00122.safetensors", + "model.language_model.layers.12.input_layernorm.weight": "model-00025-of-00122.safetensors", + "model.language_model.layers.12.mlp.gate.weight": "model-00025-of-00122.safetensors", + "model.language_model.layers.12.mlp.shared_expert.gate_proj.weight": "model-00025-of-00122.safetensors", + "model.language_model.layers.12.mlp.shared_expert.up_proj.weight": "model-00025-of-00122.safetensors", + "model.language_model.layers.12.mlp.shared_expert.down_proj.weight": "model-00025-of-00122.safetensors", + "model.language_model.layers.12.mlp.shared_expert_gate.weight": "model-00025-of-00122.safetensors", + "model.language_model.layers.12.mlp.experts.gate_up_proj": "model-00026-of-00122.safetensors", + "model.language_model.layers.12.mlp.experts.down_proj": "model-00027-of-00122.safetensors", + "model.language_model.layers.12.post_attention_layernorm.weight": "model-00027-of-00122.safetensors", + "model.language_model.layers.13.linear_attn.in_proj_qkv.weight": "model-00027-of-00122.safetensors", + "model.language_model.layers.13.linear_attn.in_proj_z.weight": "model-00027-of-00122.safetensors", + "model.language_model.layers.13.linear_attn.in_proj_b.weight": "model-00027-of-00122.safetensors", + "model.language_model.layers.13.linear_attn.in_proj_a.weight": "model-00027-of-00122.safetensors", + "model.language_model.layers.13.linear_attn.conv1d.weight": "model-00027-of-00122.safetensors", + "model.language_model.layers.13.linear_attn.dt_bias": "model-00027-of-00122.safetensors", + "model.language_model.layers.13.linear_attn.A_log": "model-00027-of-00122.safetensors", + "model.language_model.layers.13.linear_attn.norm.weight": "model-00027-of-00122.safetensors", + "model.language_model.layers.13.linear_attn.out_proj.weight": "model-00027-of-00122.safetensors", + "model.language_model.layers.13.input_layernorm.weight": "model-00027-of-00122.safetensors", + "model.language_model.layers.13.mlp.gate.weight": "model-00027-of-00122.safetensors", + "model.language_model.layers.13.mlp.shared_expert.gate_proj.weight": "model-00027-of-00122.safetensors", + "model.language_model.layers.13.mlp.shared_expert.up_proj.weight": "model-00027-of-00122.safetensors", + "model.language_model.layers.13.mlp.shared_expert.down_proj.weight": "model-00027-of-00122.safetensors", + "model.language_model.layers.13.mlp.shared_expert_gate.weight": "model-00027-of-00122.safetensors", + "model.language_model.layers.13.mlp.experts.gate_up_proj": "model-00028-of-00122.safetensors", + "model.language_model.layers.13.mlp.experts.down_proj": "model-00029-of-00122.safetensors", + "model.language_model.layers.13.post_attention_layernorm.weight": "model-00029-of-00122.safetensors", + "model.language_model.layers.14.linear_attn.in_proj_qkv.weight": "model-00029-of-00122.safetensors", + "model.language_model.layers.14.linear_attn.in_proj_z.weight": "model-00029-of-00122.safetensors", + "model.language_model.layers.14.linear_attn.in_proj_b.weight": "model-00029-of-00122.safetensors", + "model.language_model.layers.14.linear_attn.in_proj_a.weight": "model-00029-of-00122.safetensors", + "model.language_model.layers.14.linear_attn.conv1d.weight": "model-00029-of-00122.safetensors", + "model.language_model.layers.14.linear_attn.dt_bias": "model-00029-of-00122.safetensors", + "model.language_model.layers.14.linear_attn.A_log": "model-00029-of-00122.safetensors", + "model.language_model.layers.14.linear_attn.norm.weight": "model-00029-of-00122.safetensors", + "model.language_model.layers.14.linear_attn.out_proj.weight": "model-00029-of-00122.safetensors", + "model.language_model.layers.14.input_layernorm.weight": "model-00029-of-00122.safetensors", + "model.language_model.layers.14.mlp.gate.weight": "model-00029-of-00122.safetensors", + "model.language_model.layers.14.mlp.shared_expert.gate_proj.weight": "model-00029-of-00122.safetensors", + "model.language_model.layers.14.mlp.shared_expert.up_proj.weight": "model-00029-of-00122.safetensors", + "model.language_model.layers.14.mlp.shared_expert.down_proj.weight": "model-00029-of-00122.safetensors", + "model.language_model.layers.14.mlp.shared_expert_gate.weight": "model-00029-of-00122.safetensors", + "model.language_model.layers.14.mlp.experts.gate_up_proj": "model-00030-of-00122.safetensors", + "model.language_model.layers.14.mlp.experts.down_proj": "model-00031-of-00122.safetensors", + "model.language_model.layers.14.post_attention_layernorm.weight": "model-00031-of-00122.safetensors", + "model.language_model.layers.15.self_attn.q_proj.weight": "model-00031-of-00122.safetensors", + "model.language_model.layers.15.self_attn.k_proj.weight": "model-00031-of-00122.safetensors", + "model.language_model.layers.15.self_attn.v_proj.weight": "model-00031-of-00122.safetensors", + "model.language_model.layers.15.self_attn.o_proj.weight": "model-00031-of-00122.safetensors", + "model.language_model.layers.15.self_attn.q_norm.weight": "model-00031-of-00122.safetensors", + "model.language_model.layers.15.self_attn.k_norm.weight": "model-00031-of-00122.safetensors", + "model.language_model.layers.15.input_layernorm.weight": "model-00031-of-00122.safetensors", + "model.language_model.layers.15.mlp.gate.weight": "model-00031-of-00122.safetensors", + "model.language_model.layers.15.mlp.shared_expert.gate_proj.weight": "model-00031-of-00122.safetensors", + "model.language_model.layers.15.mlp.shared_expert.up_proj.weight": "model-00031-of-00122.safetensors", + "model.language_model.layers.15.mlp.shared_expert.down_proj.weight": "model-00031-of-00122.safetensors", + "model.language_model.layers.15.mlp.shared_expert_gate.weight": "model-00031-of-00122.safetensors", + "model.language_model.layers.15.mlp.experts.gate_up_proj": "model-00032-of-00122.safetensors", + "model.language_model.layers.15.mlp.experts.down_proj": "model-00033-of-00122.safetensors", + "model.language_model.layers.15.post_attention_layernorm.weight": "model-00033-of-00122.safetensors", + "model.language_model.layers.16.linear_attn.in_proj_qkv.weight": "model-00033-of-00122.safetensors", + "model.language_model.layers.16.linear_attn.in_proj_z.weight": "model-00033-of-00122.safetensors", + "model.language_model.layers.16.linear_attn.in_proj_b.weight": "model-00033-of-00122.safetensors", + "model.language_model.layers.16.linear_attn.in_proj_a.weight": "model-00033-of-00122.safetensors", + "model.language_model.layers.16.linear_attn.conv1d.weight": "model-00033-of-00122.safetensors", + "model.language_model.layers.16.linear_attn.dt_bias": "model-00033-of-00122.safetensors", + "model.language_model.layers.16.linear_attn.A_log": "model-00033-of-00122.safetensors", + "model.language_model.layers.16.linear_attn.norm.weight": "model-00033-of-00122.safetensors", + "model.language_model.layers.16.linear_attn.out_proj.weight": "model-00033-of-00122.safetensors", + "model.language_model.layers.16.input_layernorm.weight": "model-00033-of-00122.safetensors", + "model.language_model.layers.16.mlp.gate.weight": "model-00033-of-00122.safetensors", + "model.language_model.layers.16.mlp.shared_expert.gate_proj.weight": "model-00033-of-00122.safetensors", + "model.language_model.layers.16.mlp.shared_expert.up_proj.weight": "model-00033-of-00122.safetensors", + "model.language_model.layers.16.mlp.shared_expert.down_proj.weight": "model-00033-of-00122.safetensors", + "model.language_model.layers.16.mlp.shared_expert_gate.weight": "model-00033-of-00122.safetensors", + "model.language_model.layers.16.mlp.experts.gate_up_proj": "model-00034-of-00122.safetensors", + "model.language_model.layers.16.mlp.experts.down_proj": "model-00035-of-00122.safetensors", + "model.language_model.layers.16.post_attention_layernorm.weight": "model-00035-of-00122.safetensors", + "model.language_model.layers.17.linear_attn.in_proj_qkv.weight": "model-00035-of-00122.safetensors", + "model.language_model.layers.17.linear_attn.in_proj_z.weight": "model-00035-of-00122.safetensors", + "model.language_model.layers.17.linear_attn.in_proj_b.weight": "model-00035-of-00122.safetensors", + "model.language_model.layers.17.linear_attn.in_proj_a.weight": "model-00035-of-00122.safetensors", + "model.language_model.layers.17.linear_attn.conv1d.weight": "model-00035-of-00122.safetensors", + "model.language_model.layers.17.linear_attn.dt_bias": "model-00035-of-00122.safetensors", + "model.language_model.layers.17.linear_attn.A_log": "model-00035-of-00122.safetensors", + "model.language_model.layers.17.linear_attn.norm.weight": "model-00035-of-00122.safetensors", + "model.language_model.layers.17.linear_attn.out_proj.weight": "model-00035-of-00122.safetensors", + "model.language_model.layers.17.input_layernorm.weight": "model-00035-of-00122.safetensors", + "model.language_model.layers.17.mlp.gate.weight": "model-00035-of-00122.safetensors", + "model.language_model.layers.17.mlp.shared_expert.gate_proj.weight": "model-00035-of-00122.safetensors", + "model.language_model.layers.17.mlp.shared_expert.up_proj.weight": "model-00035-of-00122.safetensors", + "model.language_model.layers.17.mlp.shared_expert.down_proj.weight": "model-00035-of-00122.safetensors", + "model.language_model.layers.17.mlp.shared_expert_gate.weight": "model-00035-of-00122.safetensors", + "model.language_model.layers.17.mlp.experts.gate_up_proj": "model-00036-of-00122.safetensors", + "model.language_model.layers.17.mlp.experts.down_proj": "model-00037-of-00122.safetensors", + "model.language_model.layers.17.post_attention_layernorm.weight": "model-00037-of-00122.safetensors", + "model.language_model.layers.18.linear_attn.in_proj_qkv.weight": "model-00037-of-00122.safetensors", + "model.language_model.layers.18.linear_attn.in_proj_z.weight": "model-00037-of-00122.safetensors", + "model.language_model.layers.18.linear_attn.in_proj_b.weight": "model-00037-of-00122.safetensors", + "model.language_model.layers.18.linear_attn.in_proj_a.weight": "model-00037-of-00122.safetensors", + "model.language_model.layers.18.linear_attn.conv1d.weight": "model-00037-of-00122.safetensors", + "model.language_model.layers.18.linear_attn.dt_bias": "model-00037-of-00122.safetensors", + "model.language_model.layers.18.linear_attn.A_log": "model-00037-of-00122.safetensors", + "model.language_model.layers.18.linear_attn.norm.weight": "model-00037-of-00122.safetensors", + "model.language_model.layers.18.linear_attn.out_proj.weight": "model-00037-of-00122.safetensors", + "model.language_model.layers.18.input_layernorm.weight": "model-00037-of-00122.safetensors", + "model.language_model.layers.18.mlp.gate.weight": "model-00037-of-00122.safetensors", + "model.language_model.layers.18.mlp.shared_expert.gate_proj.weight": "model-00037-of-00122.safetensors", + "model.language_model.layers.18.mlp.shared_expert.up_proj.weight": "model-00037-of-00122.safetensors", + "model.language_model.layers.18.mlp.shared_expert.down_proj.weight": "model-00037-of-00122.safetensors", + "model.language_model.layers.18.mlp.shared_expert_gate.weight": "model-00037-of-00122.safetensors", + "model.language_model.layers.18.mlp.experts.gate_up_proj": "model-00038-of-00122.safetensors", + "model.language_model.layers.18.mlp.experts.down_proj": "model-00039-of-00122.safetensors", + "model.language_model.layers.18.post_attention_layernorm.weight": "model-00039-of-00122.safetensors", + "model.language_model.layers.19.self_attn.q_proj.weight": "model-00039-of-00122.safetensors", + "model.language_model.layers.19.self_attn.k_proj.weight": "model-00039-of-00122.safetensors", + "model.language_model.layers.19.self_attn.v_proj.weight": "model-00039-of-00122.safetensors", + "model.language_model.layers.19.self_attn.o_proj.weight": "model-00039-of-00122.safetensors", + "model.language_model.layers.19.self_attn.q_norm.weight": "model-00039-of-00122.safetensors", + "model.language_model.layers.19.self_attn.k_norm.weight": "model-00039-of-00122.safetensors", + "model.language_model.layers.19.input_layernorm.weight": "model-00039-of-00122.safetensors", + "model.language_model.layers.19.mlp.gate.weight": "model-00039-of-00122.safetensors", + "model.language_model.layers.19.mlp.shared_expert.gate_proj.weight": "model-00039-of-00122.safetensors", + "model.language_model.layers.19.mlp.shared_expert.up_proj.weight": "model-00039-of-00122.safetensors", + "model.language_model.layers.19.mlp.shared_expert.down_proj.weight": "model-00039-of-00122.safetensors", + "model.language_model.layers.19.mlp.shared_expert_gate.weight": "model-00039-of-00122.safetensors", + "model.language_model.layers.19.mlp.experts.gate_up_proj": "model-00040-of-00122.safetensors", + "model.language_model.layers.19.mlp.experts.down_proj": "model-00041-of-00122.safetensors", + "model.language_model.layers.19.post_attention_layernorm.weight": "model-00041-of-00122.safetensors", + "model.language_model.layers.20.linear_attn.in_proj_qkv.weight": "model-00041-of-00122.safetensors", + "model.language_model.layers.20.linear_attn.in_proj_z.weight": "model-00041-of-00122.safetensors", + "model.language_model.layers.20.linear_attn.in_proj_b.weight": "model-00041-of-00122.safetensors", + "model.language_model.layers.20.linear_attn.in_proj_a.weight": "model-00041-of-00122.safetensors", + "model.language_model.layers.20.linear_attn.conv1d.weight": "model-00041-of-00122.safetensors", + "model.language_model.layers.20.linear_attn.dt_bias": "model-00041-of-00122.safetensors", + "model.language_model.layers.20.linear_attn.A_log": "model-00041-of-00122.safetensors", + "model.language_model.layers.20.linear_attn.norm.weight": "model-00041-of-00122.safetensors", + "model.language_model.layers.20.linear_attn.out_proj.weight": "model-00041-of-00122.safetensors", + "model.language_model.layers.20.input_layernorm.weight": "model-00041-of-00122.safetensors", + "model.language_model.layers.20.mlp.gate.weight": "model-00041-of-00122.safetensors", + "model.language_model.layers.20.mlp.shared_expert.gate_proj.weight": "model-00041-of-00122.safetensors", + "model.language_model.layers.20.mlp.shared_expert.up_proj.weight": "model-00041-of-00122.safetensors", + "model.language_model.layers.20.mlp.shared_expert.down_proj.weight": "model-00041-of-00122.safetensors", + "model.language_model.layers.20.mlp.shared_expert_gate.weight": "model-00041-of-00122.safetensors", + "model.language_model.layers.20.mlp.experts.gate_up_proj": "model-00042-of-00122.safetensors", + "model.language_model.layers.20.mlp.experts.down_proj": "model-00043-of-00122.safetensors", + "model.language_model.layers.20.post_attention_layernorm.weight": "model-00043-of-00122.safetensors", + "model.language_model.layers.21.linear_attn.in_proj_qkv.weight": "model-00043-of-00122.safetensors", + "model.language_model.layers.21.linear_attn.in_proj_z.weight": "model-00043-of-00122.safetensors", + "model.language_model.layers.21.linear_attn.in_proj_b.weight": "model-00043-of-00122.safetensors", + "model.language_model.layers.21.linear_attn.in_proj_a.weight": "model-00043-of-00122.safetensors", + "model.language_model.layers.21.linear_attn.conv1d.weight": "model-00043-of-00122.safetensors", + "model.language_model.layers.21.linear_attn.dt_bias": "model-00043-of-00122.safetensors", + "model.language_model.layers.21.linear_attn.A_log": "model-00043-of-00122.safetensors", + "model.language_model.layers.21.linear_attn.norm.weight": "model-00043-of-00122.safetensors", + "model.language_model.layers.21.linear_attn.out_proj.weight": "model-00043-of-00122.safetensors", + "model.language_model.layers.21.input_layernorm.weight": "model-00043-of-00122.safetensors", + "model.language_model.layers.21.mlp.gate.weight": "model-00043-of-00122.safetensors", + "model.language_model.layers.21.mlp.shared_expert.gate_proj.weight": "model-00043-of-00122.safetensors", + "model.language_model.layers.21.mlp.shared_expert.up_proj.weight": "model-00043-of-00122.safetensors", + "model.language_model.layers.21.mlp.shared_expert.down_proj.weight": "model-00043-of-00122.safetensors", + "model.language_model.layers.21.mlp.shared_expert_gate.weight": "model-00043-of-00122.safetensors", + "model.language_model.layers.21.mlp.experts.gate_up_proj": "model-00044-of-00122.safetensors", + "model.language_model.layers.21.mlp.experts.down_proj": "model-00045-of-00122.safetensors", + "model.language_model.layers.21.post_attention_layernorm.weight": "model-00045-of-00122.safetensors", + "model.language_model.layers.22.linear_attn.in_proj_qkv.weight": "model-00045-of-00122.safetensors", + "model.language_model.layers.22.linear_attn.in_proj_z.weight": "model-00045-of-00122.safetensors", + "model.language_model.layers.22.linear_attn.in_proj_b.weight": "model-00045-of-00122.safetensors", + "model.language_model.layers.22.linear_attn.in_proj_a.weight": "model-00045-of-00122.safetensors", + "model.language_model.layers.22.linear_attn.conv1d.weight": "model-00045-of-00122.safetensors", + "model.language_model.layers.22.linear_attn.dt_bias": "model-00045-of-00122.safetensors", + "model.language_model.layers.22.linear_attn.A_log": "model-00045-of-00122.safetensors", + "model.language_model.layers.22.linear_attn.norm.weight": "model-00045-of-00122.safetensors", + "model.language_model.layers.22.linear_attn.out_proj.weight": "model-00045-of-00122.safetensors", + "model.language_model.layers.22.input_layernorm.weight": "model-00045-of-00122.safetensors", + "model.language_model.layers.22.mlp.gate.weight": "model-00045-of-00122.safetensors", + "model.language_model.layers.22.mlp.shared_expert.gate_proj.weight": "model-00045-of-00122.safetensors", + "model.language_model.layers.22.mlp.shared_expert.up_proj.weight": "model-00045-of-00122.safetensors", + "model.language_model.layers.22.mlp.shared_expert.down_proj.weight": "model-00045-of-00122.safetensors", + "model.language_model.layers.22.mlp.shared_expert_gate.weight": "model-00045-of-00122.safetensors", + "model.language_model.layers.22.mlp.experts.gate_up_proj": "model-00046-of-00122.safetensors", + "model.language_model.layers.22.mlp.experts.down_proj": "model-00047-of-00122.safetensors", + "model.language_model.layers.22.post_attention_layernorm.weight": "model-00047-of-00122.safetensors", + "model.language_model.layers.23.self_attn.q_proj.weight": "model-00047-of-00122.safetensors", + "model.language_model.layers.23.self_attn.k_proj.weight": "model-00047-of-00122.safetensors", + "model.language_model.layers.23.self_attn.v_proj.weight": "model-00047-of-00122.safetensors", + "model.language_model.layers.23.self_attn.o_proj.weight": "model-00047-of-00122.safetensors", + "model.language_model.layers.23.self_attn.q_norm.weight": "model-00047-of-00122.safetensors", + "model.language_model.layers.23.self_attn.k_norm.weight": "model-00047-of-00122.safetensors", + "model.language_model.layers.23.input_layernorm.weight": "model-00047-of-00122.safetensors", + "model.language_model.layers.23.mlp.gate.weight": "model-00047-of-00122.safetensors", + "model.language_model.layers.23.mlp.shared_expert.gate_proj.weight": "model-00047-of-00122.safetensors", + "model.language_model.layers.23.mlp.shared_expert.up_proj.weight": "model-00047-of-00122.safetensors", + "model.language_model.layers.23.mlp.shared_expert.down_proj.weight": "model-00047-of-00122.safetensors", + "model.language_model.layers.23.mlp.shared_expert_gate.weight": "model-00047-of-00122.safetensors", + "model.language_model.layers.23.mlp.experts.gate_up_proj": "model-00048-of-00122.safetensors", + "model.language_model.layers.23.mlp.experts.down_proj": "model-00049-of-00122.safetensors", + "model.language_model.layers.23.post_attention_layernorm.weight": "model-00049-of-00122.safetensors", + "model.language_model.layers.24.linear_attn.in_proj_qkv.weight": "model-00049-of-00122.safetensors", + "model.language_model.layers.24.linear_attn.in_proj_z.weight": "model-00049-of-00122.safetensors", + "model.language_model.layers.24.linear_attn.in_proj_b.weight": "model-00049-of-00122.safetensors", + "model.language_model.layers.24.linear_attn.in_proj_a.weight": "model-00049-of-00122.safetensors", + "model.language_model.layers.24.linear_attn.conv1d.weight": "model-00049-of-00122.safetensors", + "model.language_model.layers.24.linear_attn.dt_bias": "model-00049-of-00122.safetensors", + "model.language_model.layers.24.linear_attn.A_log": "model-00049-of-00122.safetensors", + "model.language_model.layers.24.linear_attn.norm.weight": "model-00049-of-00122.safetensors", + "model.language_model.layers.24.linear_attn.out_proj.weight": "model-00049-of-00122.safetensors", + "model.language_model.layers.24.input_layernorm.weight": "model-00049-of-00122.safetensors", + "model.language_model.layers.24.mlp.gate.weight": "model-00049-of-00122.safetensors", + "model.language_model.layers.24.mlp.shared_expert.gate_proj.weight": "model-00049-of-00122.safetensors", + "model.language_model.layers.24.mlp.shared_expert.up_proj.weight": "model-00049-of-00122.safetensors", + "model.language_model.layers.24.mlp.shared_expert.down_proj.weight": "model-00049-of-00122.safetensors", + "model.language_model.layers.24.mlp.shared_expert_gate.weight": "model-00049-of-00122.safetensors", + "model.language_model.layers.24.mlp.experts.gate_up_proj": "model-00050-of-00122.safetensors", + "model.language_model.layers.24.mlp.experts.down_proj": "model-00051-of-00122.safetensors", + "model.language_model.layers.24.post_attention_layernorm.weight": "model-00051-of-00122.safetensors", + "model.language_model.layers.25.linear_attn.in_proj_qkv.weight": "model-00051-of-00122.safetensors", + "model.language_model.layers.25.linear_attn.in_proj_z.weight": "model-00051-of-00122.safetensors", + "model.language_model.layers.25.linear_attn.in_proj_b.weight": "model-00051-of-00122.safetensors", + "model.language_model.layers.25.linear_attn.in_proj_a.weight": "model-00051-of-00122.safetensors", + "model.language_model.layers.25.linear_attn.conv1d.weight": "model-00051-of-00122.safetensors", + "model.language_model.layers.25.linear_attn.dt_bias": "model-00051-of-00122.safetensors", + "model.language_model.layers.25.linear_attn.A_log": "model-00051-of-00122.safetensors", + "model.language_model.layers.25.linear_attn.norm.weight": "model-00051-of-00122.safetensors", + "model.language_model.layers.25.linear_attn.out_proj.weight": "model-00051-of-00122.safetensors", + "model.language_model.layers.25.input_layernorm.weight": "model-00051-of-00122.safetensors", + "model.language_model.layers.25.mlp.gate.weight": "model-00051-of-00122.safetensors", + "model.language_model.layers.25.mlp.shared_expert.gate_proj.weight": "model-00051-of-00122.safetensors", + "model.language_model.layers.25.mlp.shared_expert.up_proj.weight": "model-00051-of-00122.safetensors", + "model.language_model.layers.25.mlp.shared_expert.down_proj.weight": "model-00051-of-00122.safetensors", + "model.language_model.layers.25.mlp.shared_expert_gate.weight": "model-00051-of-00122.safetensors", + "model.language_model.layers.25.mlp.experts.gate_up_proj": "model-00052-of-00122.safetensors", + "model.language_model.layers.25.mlp.experts.down_proj": "model-00053-of-00122.safetensors", + "model.language_model.layers.25.post_attention_layernorm.weight": "model-00053-of-00122.safetensors", + "model.language_model.layers.26.linear_attn.in_proj_qkv.weight": "model-00053-of-00122.safetensors", + "model.language_model.layers.26.linear_attn.in_proj_z.weight": "model-00053-of-00122.safetensors", + "model.language_model.layers.26.linear_attn.in_proj_b.weight": "model-00053-of-00122.safetensors", + "model.language_model.layers.26.linear_attn.in_proj_a.weight": "model-00053-of-00122.safetensors", + "model.language_model.layers.26.linear_attn.conv1d.weight": "model-00053-of-00122.safetensors", + "model.language_model.layers.26.linear_attn.dt_bias": "model-00053-of-00122.safetensors", + "model.language_model.layers.26.linear_attn.A_log": "model-00053-of-00122.safetensors", + "model.language_model.layers.26.linear_attn.norm.weight": "model-00053-of-00122.safetensors", + "model.language_model.layers.26.linear_attn.out_proj.weight": "model-00053-of-00122.safetensors", + "model.language_model.layers.26.input_layernorm.weight": "model-00053-of-00122.safetensors", + "model.language_model.layers.26.mlp.gate.weight": "model-00053-of-00122.safetensors", + "model.language_model.layers.26.mlp.shared_expert.gate_proj.weight": "model-00053-of-00122.safetensors", + "model.language_model.layers.26.mlp.shared_expert.up_proj.weight": "model-00053-of-00122.safetensors", + "model.language_model.layers.26.mlp.shared_expert.down_proj.weight": "model-00053-of-00122.safetensors", + "model.language_model.layers.26.mlp.shared_expert_gate.weight": "model-00053-of-00122.safetensors", + "model.language_model.layers.26.mlp.experts.gate_up_proj": "model-00054-of-00122.safetensors", + "model.language_model.layers.26.mlp.experts.down_proj": "model-00055-of-00122.safetensors", + "model.language_model.layers.26.post_attention_layernorm.weight": "model-00055-of-00122.safetensors", + "model.language_model.layers.27.self_attn.q_proj.weight": "model-00055-of-00122.safetensors", + "model.language_model.layers.27.self_attn.k_proj.weight": "model-00055-of-00122.safetensors", + "model.language_model.layers.27.self_attn.v_proj.weight": "model-00055-of-00122.safetensors", + "model.language_model.layers.27.self_attn.o_proj.weight": "model-00055-of-00122.safetensors", + "model.language_model.layers.27.self_attn.q_norm.weight": "model-00055-of-00122.safetensors", + "model.language_model.layers.27.self_attn.k_norm.weight": "model-00055-of-00122.safetensors", + "model.language_model.layers.27.input_layernorm.weight": "model-00055-of-00122.safetensors", + "model.language_model.layers.27.mlp.gate.weight": "model-00055-of-00122.safetensors", + "model.language_model.layers.27.mlp.shared_expert.gate_proj.weight": "model-00055-of-00122.safetensors", + "model.language_model.layers.27.mlp.shared_expert.up_proj.weight": "model-00055-of-00122.safetensors", + "model.language_model.layers.27.mlp.shared_expert.down_proj.weight": "model-00055-of-00122.safetensors", + "model.language_model.layers.27.mlp.shared_expert_gate.weight": "model-00055-of-00122.safetensors", + "model.language_model.layers.27.mlp.experts.gate_up_proj": "model-00056-of-00122.safetensors", + "model.language_model.layers.27.mlp.experts.down_proj": "model-00057-of-00122.safetensors", + "model.language_model.layers.27.post_attention_layernorm.weight": "model-00057-of-00122.safetensors", + "model.language_model.layers.28.linear_attn.in_proj_qkv.weight": "model-00057-of-00122.safetensors", + "model.language_model.layers.28.linear_attn.in_proj_z.weight": "model-00057-of-00122.safetensors", + "model.language_model.layers.28.linear_attn.in_proj_b.weight": "model-00057-of-00122.safetensors", + "model.language_model.layers.28.linear_attn.in_proj_a.weight": "model-00057-of-00122.safetensors", + "model.language_model.layers.28.linear_attn.conv1d.weight": "model-00057-of-00122.safetensors", + "model.language_model.layers.28.linear_attn.dt_bias": "model-00057-of-00122.safetensors", + "model.language_model.layers.28.linear_attn.A_log": "model-00057-of-00122.safetensors", + "model.language_model.layers.28.linear_attn.norm.weight": "model-00057-of-00122.safetensors", + "model.language_model.layers.28.linear_attn.out_proj.weight": "model-00057-of-00122.safetensors", + "model.language_model.layers.28.input_layernorm.weight": "model-00057-of-00122.safetensors", + "model.language_model.layers.28.mlp.gate.weight": "model-00057-of-00122.safetensors", + "model.language_model.layers.28.mlp.shared_expert.gate_proj.weight": "model-00057-of-00122.safetensors", + "model.language_model.layers.28.mlp.shared_expert.up_proj.weight": "model-00057-of-00122.safetensors", + "model.language_model.layers.28.mlp.shared_expert.down_proj.weight": "model-00057-of-00122.safetensors", + "model.language_model.layers.28.mlp.shared_expert_gate.weight": "model-00057-of-00122.safetensors", + "model.language_model.layers.28.mlp.experts.gate_up_proj": "model-00058-of-00122.safetensors", + "model.language_model.layers.28.mlp.experts.down_proj": "model-00059-of-00122.safetensors", + "model.language_model.layers.28.post_attention_layernorm.weight": "model-00059-of-00122.safetensors", + "model.language_model.layers.29.linear_attn.in_proj_qkv.weight": "model-00059-of-00122.safetensors", + "model.language_model.layers.29.linear_attn.in_proj_z.weight": "model-00059-of-00122.safetensors", + "model.language_model.layers.29.linear_attn.in_proj_b.weight": "model-00059-of-00122.safetensors", + "model.language_model.layers.29.linear_attn.in_proj_a.weight": "model-00059-of-00122.safetensors", + "model.language_model.layers.29.linear_attn.conv1d.weight": "model-00059-of-00122.safetensors", + "model.language_model.layers.29.linear_attn.dt_bias": "model-00059-of-00122.safetensors", + "model.language_model.layers.29.linear_attn.A_log": "model-00059-of-00122.safetensors", + "model.language_model.layers.29.linear_attn.norm.weight": "model-00059-of-00122.safetensors", + "model.language_model.layers.29.linear_attn.out_proj.weight": "model-00059-of-00122.safetensors", + "model.language_model.layers.29.input_layernorm.weight": "model-00059-of-00122.safetensors", + "model.language_model.layers.29.mlp.gate.weight": "model-00059-of-00122.safetensors", + "model.language_model.layers.29.mlp.shared_expert.gate_proj.weight": "model-00059-of-00122.safetensors", + "model.language_model.layers.29.mlp.shared_expert.up_proj.weight": "model-00059-of-00122.safetensors", + "model.language_model.layers.29.mlp.shared_expert.down_proj.weight": "model-00059-of-00122.safetensors", + "model.language_model.layers.29.mlp.shared_expert_gate.weight": "model-00059-of-00122.safetensors", + "model.language_model.layers.29.mlp.experts.gate_up_proj": "model-00060-of-00122.safetensors", + "model.language_model.layers.29.mlp.experts.down_proj": "model-00061-of-00122.safetensors", + "model.language_model.layers.29.post_attention_layernorm.weight": "model-00061-of-00122.safetensors", + "model.language_model.layers.30.linear_attn.in_proj_qkv.weight": "model-00061-of-00122.safetensors", + "model.language_model.layers.30.linear_attn.in_proj_z.weight": "model-00061-of-00122.safetensors", + "model.language_model.layers.30.linear_attn.in_proj_b.weight": "model-00061-of-00122.safetensors", + "model.language_model.layers.30.linear_attn.in_proj_a.weight": "model-00061-of-00122.safetensors", + "model.language_model.layers.30.linear_attn.conv1d.weight": "model-00061-of-00122.safetensors", + "model.language_model.layers.30.linear_attn.dt_bias": "model-00061-of-00122.safetensors", + "model.language_model.layers.30.linear_attn.A_log": "model-00061-of-00122.safetensors", + "model.language_model.layers.30.linear_attn.norm.weight": "model-00061-of-00122.safetensors", + "model.language_model.layers.30.linear_attn.out_proj.weight": "model-00061-of-00122.safetensors", + "model.language_model.layers.30.input_layernorm.weight": "model-00061-of-00122.safetensors", + "model.language_model.layers.30.mlp.gate.weight": "model-00061-of-00122.safetensors", + "model.language_model.layers.30.mlp.shared_expert.gate_proj.weight": "model-00061-of-00122.safetensors", + "model.language_model.layers.30.mlp.shared_expert.up_proj.weight": "model-00061-of-00122.safetensors", + "model.language_model.layers.30.mlp.shared_expert.down_proj.weight": "model-00061-of-00122.safetensors", + "model.language_model.layers.30.mlp.shared_expert_gate.weight": "model-00061-of-00122.safetensors", + "model.language_model.layers.30.mlp.experts.gate_up_proj": "model-00062-of-00122.safetensors", + "model.language_model.layers.30.mlp.experts.down_proj": "model-00063-of-00122.safetensors", + "model.language_model.layers.30.post_attention_layernorm.weight": "model-00063-of-00122.safetensors", + "model.language_model.layers.31.self_attn.q_proj.weight": "model-00063-of-00122.safetensors", + "model.language_model.layers.31.self_attn.k_proj.weight": "model-00063-of-00122.safetensors", + "model.language_model.layers.31.self_attn.v_proj.weight": "model-00063-of-00122.safetensors", + "model.language_model.layers.31.self_attn.o_proj.weight": "model-00063-of-00122.safetensors", + "model.language_model.layers.31.self_attn.q_norm.weight": "model-00063-of-00122.safetensors", + "model.language_model.layers.31.self_attn.k_norm.weight": "model-00063-of-00122.safetensors", + "model.language_model.layers.31.input_layernorm.weight": "model-00063-of-00122.safetensors", + "model.language_model.layers.31.mlp.gate.weight": "model-00063-of-00122.safetensors", + "model.language_model.layers.31.mlp.shared_expert.gate_proj.weight": "model-00063-of-00122.safetensors", + "model.language_model.layers.31.mlp.shared_expert.up_proj.weight": "model-00063-of-00122.safetensors", + "model.language_model.layers.31.mlp.shared_expert.down_proj.weight": "model-00063-of-00122.safetensors", + "model.language_model.layers.31.mlp.shared_expert_gate.weight": "model-00063-of-00122.safetensors", + "model.language_model.layers.31.mlp.experts.gate_up_proj": "model-00064-of-00122.safetensors", + "model.language_model.layers.31.mlp.experts.down_proj": "model-00065-of-00122.safetensors", + "model.language_model.layers.31.post_attention_layernorm.weight": "model-00065-of-00122.safetensors", + "model.language_model.layers.32.linear_attn.in_proj_qkv.weight": "model-00065-of-00122.safetensors", + "model.language_model.layers.32.linear_attn.in_proj_z.weight": "model-00065-of-00122.safetensors", + "model.language_model.layers.32.linear_attn.in_proj_b.weight": "model-00065-of-00122.safetensors", + "model.language_model.layers.32.linear_attn.in_proj_a.weight": "model-00065-of-00122.safetensors", + "model.language_model.layers.32.linear_attn.conv1d.weight": "model-00065-of-00122.safetensors", + "model.language_model.layers.32.linear_attn.dt_bias": "model-00065-of-00122.safetensors", + "model.language_model.layers.32.linear_attn.A_log": "model-00065-of-00122.safetensors", + "model.language_model.layers.32.linear_attn.norm.weight": "model-00065-of-00122.safetensors", + "model.language_model.layers.32.linear_attn.out_proj.weight": "model-00065-of-00122.safetensors", + "model.language_model.layers.32.input_layernorm.weight": "model-00065-of-00122.safetensors", + "model.language_model.layers.32.mlp.gate.weight": "model-00065-of-00122.safetensors", + "model.language_model.layers.32.mlp.shared_expert.gate_proj.weight": "model-00065-of-00122.safetensors", + "model.language_model.layers.32.mlp.shared_expert.up_proj.weight": "model-00065-of-00122.safetensors", + "model.language_model.layers.32.mlp.shared_expert.down_proj.weight": "model-00065-of-00122.safetensors", + "model.language_model.layers.32.mlp.shared_expert_gate.weight": "model-00065-of-00122.safetensors", + "model.language_model.layers.32.mlp.experts.gate_up_proj": "model-00066-of-00122.safetensors", + "model.language_model.layers.32.mlp.experts.down_proj": "model-00067-of-00122.safetensors", + "model.language_model.layers.32.post_attention_layernorm.weight": "model-00067-of-00122.safetensors", + "model.language_model.layers.33.linear_attn.in_proj_qkv.weight": "model-00067-of-00122.safetensors", + "model.language_model.layers.33.linear_attn.in_proj_z.weight": "model-00067-of-00122.safetensors", + "model.language_model.layers.33.linear_attn.in_proj_b.weight": "model-00067-of-00122.safetensors", + "model.language_model.layers.33.linear_attn.in_proj_a.weight": "model-00067-of-00122.safetensors", + "model.language_model.layers.33.linear_attn.conv1d.weight": "model-00067-of-00122.safetensors", + "model.language_model.layers.33.linear_attn.dt_bias": "model-00067-of-00122.safetensors", + "model.language_model.layers.33.linear_attn.A_log": "model-00067-of-00122.safetensors", + "model.language_model.layers.33.linear_attn.norm.weight": "model-00067-of-00122.safetensors", + "model.language_model.layers.33.linear_attn.out_proj.weight": "model-00067-of-00122.safetensors", + "model.language_model.layers.33.input_layernorm.weight": "model-00067-of-00122.safetensors", + "model.language_model.layers.33.mlp.gate.weight": "model-00067-of-00122.safetensors", + "model.language_model.layers.33.mlp.shared_expert.gate_proj.weight": "model-00067-of-00122.safetensors", + "model.language_model.layers.33.mlp.shared_expert.up_proj.weight": "model-00067-of-00122.safetensors", + "model.language_model.layers.33.mlp.shared_expert.down_proj.weight": "model-00067-of-00122.safetensors", + "model.language_model.layers.33.mlp.shared_expert_gate.weight": "model-00067-of-00122.safetensors", + "model.language_model.layers.33.mlp.experts.gate_up_proj": "model-00068-of-00122.safetensors", + "model.language_model.layers.33.mlp.experts.down_proj": "model-00069-of-00122.safetensors", + "model.language_model.layers.33.post_attention_layernorm.weight": "model-00069-of-00122.safetensors", + "model.language_model.layers.34.linear_attn.in_proj_qkv.weight": "model-00069-of-00122.safetensors", + "model.language_model.layers.34.linear_attn.in_proj_z.weight": "model-00069-of-00122.safetensors", + "model.language_model.layers.34.linear_attn.in_proj_b.weight": "model-00069-of-00122.safetensors", + "model.language_model.layers.34.linear_attn.in_proj_a.weight": "model-00069-of-00122.safetensors", + "model.language_model.layers.34.linear_attn.conv1d.weight": "model-00069-of-00122.safetensors", + "model.language_model.layers.34.linear_attn.dt_bias": "model-00069-of-00122.safetensors", + "model.language_model.layers.34.linear_attn.A_log": "model-00069-of-00122.safetensors", + "model.language_model.layers.34.linear_attn.norm.weight": "model-00069-of-00122.safetensors", + "model.language_model.layers.34.linear_attn.out_proj.weight": "model-00069-of-00122.safetensors", + "model.language_model.layers.34.input_layernorm.weight": "model-00069-of-00122.safetensors", + "model.language_model.layers.34.mlp.gate.weight": "model-00069-of-00122.safetensors", + "model.language_model.layers.34.mlp.shared_expert.gate_proj.weight": "model-00069-of-00122.safetensors", + "model.language_model.layers.34.mlp.shared_expert.up_proj.weight": "model-00069-of-00122.safetensors", + "model.language_model.layers.34.mlp.shared_expert.down_proj.weight": "model-00069-of-00122.safetensors", + "model.language_model.layers.34.mlp.shared_expert_gate.weight": "model-00069-of-00122.safetensors", + "model.language_model.layers.34.mlp.experts.gate_up_proj": "model-00070-of-00122.safetensors", + "model.language_model.layers.34.mlp.experts.down_proj": "model-00071-of-00122.safetensors", + "model.language_model.layers.34.post_attention_layernorm.weight": "model-00071-of-00122.safetensors", + "model.language_model.layers.35.self_attn.q_proj.weight": "model-00071-of-00122.safetensors", + "model.language_model.layers.35.self_attn.k_proj.weight": "model-00071-of-00122.safetensors", + "model.language_model.layers.35.self_attn.v_proj.weight": "model-00071-of-00122.safetensors", + "model.language_model.layers.35.self_attn.o_proj.weight": "model-00071-of-00122.safetensors", + "model.language_model.layers.35.self_attn.q_norm.weight": "model-00071-of-00122.safetensors", + "model.language_model.layers.35.self_attn.k_norm.weight": "model-00071-of-00122.safetensors", + "model.language_model.layers.35.input_layernorm.weight": "model-00071-of-00122.safetensors", + "model.language_model.layers.35.mlp.gate.weight": "model-00071-of-00122.safetensors", + "model.language_model.layers.35.mlp.shared_expert.gate_proj.weight": "model-00071-of-00122.safetensors", + "model.language_model.layers.35.mlp.shared_expert.up_proj.weight": "model-00071-of-00122.safetensors", + "model.language_model.layers.35.mlp.shared_expert.down_proj.weight": "model-00071-of-00122.safetensors", + "model.language_model.layers.35.mlp.shared_expert_gate.weight": "model-00071-of-00122.safetensors", + "model.language_model.layers.35.mlp.experts.gate_up_proj": "model-00072-of-00122.safetensors", + "model.language_model.layers.35.mlp.experts.down_proj": "model-00073-of-00122.safetensors", + "model.language_model.layers.35.post_attention_layernorm.weight": "model-00073-of-00122.safetensors", + "model.language_model.layers.36.linear_attn.in_proj_qkv.weight": "model-00073-of-00122.safetensors", + "model.language_model.layers.36.linear_attn.in_proj_z.weight": "model-00073-of-00122.safetensors", + "model.language_model.layers.36.linear_attn.in_proj_b.weight": "model-00073-of-00122.safetensors", + "model.language_model.layers.36.linear_attn.in_proj_a.weight": "model-00073-of-00122.safetensors", + "model.language_model.layers.36.linear_attn.conv1d.weight": "model-00073-of-00122.safetensors", + "model.language_model.layers.36.linear_attn.dt_bias": "model-00073-of-00122.safetensors", + "model.language_model.layers.36.linear_attn.A_log": "model-00073-of-00122.safetensors", + "model.language_model.layers.36.linear_attn.norm.weight": "model-00073-of-00122.safetensors", + "model.language_model.layers.36.linear_attn.out_proj.weight": "model-00073-of-00122.safetensors", + "model.language_model.layers.36.input_layernorm.weight": "model-00073-of-00122.safetensors", + "model.language_model.layers.36.mlp.gate.weight": "model-00073-of-00122.safetensors", + "model.language_model.layers.36.mlp.shared_expert.gate_proj.weight": "model-00073-of-00122.safetensors", + "model.language_model.layers.36.mlp.shared_expert.up_proj.weight": "model-00073-of-00122.safetensors", + "model.language_model.layers.36.mlp.shared_expert.down_proj.weight": "model-00073-of-00122.safetensors", + "model.language_model.layers.36.mlp.shared_expert_gate.weight": "model-00073-of-00122.safetensors", + "model.language_model.layers.36.mlp.experts.gate_up_proj": "model-00074-of-00122.safetensors", + "model.language_model.layers.36.mlp.experts.down_proj": "model-00075-of-00122.safetensors", + "model.language_model.layers.36.post_attention_layernorm.weight": "model-00075-of-00122.safetensors", + "model.language_model.layers.37.linear_attn.in_proj_qkv.weight": "model-00075-of-00122.safetensors", + "model.language_model.layers.37.linear_attn.in_proj_z.weight": "model-00075-of-00122.safetensors", + "model.language_model.layers.37.linear_attn.in_proj_b.weight": "model-00075-of-00122.safetensors", + "model.language_model.layers.37.linear_attn.in_proj_a.weight": "model-00075-of-00122.safetensors", + "model.language_model.layers.37.linear_attn.conv1d.weight": "model-00075-of-00122.safetensors", + "model.language_model.layers.37.linear_attn.dt_bias": "model-00075-of-00122.safetensors", + "model.language_model.layers.37.linear_attn.A_log": "model-00075-of-00122.safetensors", + "model.language_model.layers.37.linear_attn.norm.weight": "model-00075-of-00122.safetensors", + "model.language_model.layers.37.linear_attn.out_proj.weight": "model-00075-of-00122.safetensors", + "model.language_model.layers.37.input_layernorm.weight": "model-00075-of-00122.safetensors", + "model.language_model.layers.37.mlp.gate.weight": "model-00075-of-00122.safetensors", + "model.language_model.layers.37.mlp.shared_expert.gate_proj.weight": "model-00075-of-00122.safetensors", + "model.language_model.layers.37.mlp.shared_expert.up_proj.weight": "model-00075-of-00122.safetensors", + "model.language_model.layers.37.mlp.shared_expert.down_proj.weight": "model-00075-of-00122.safetensors", + "model.language_model.layers.37.mlp.shared_expert_gate.weight": "model-00075-of-00122.safetensors", + "model.language_model.layers.37.mlp.experts.gate_up_proj": "model-00076-of-00122.safetensors", + "model.language_model.layers.37.mlp.experts.down_proj": "model-00077-of-00122.safetensors", + "model.language_model.layers.37.post_attention_layernorm.weight": "model-00077-of-00122.safetensors", + "model.language_model.layers.38.linear_attn.in_proj_qkv.weight": "model-00077-of-00122.safetensors", + "model.language_model.layers.38.linear_attn.in_proj_z.weight": "model-00077-of-00122.safetensors", + "model.language_model.layers.38.linear_attn.in_proj_b.weight": "model-00077-of-00122.safetensors", + "model.language_model.layers.38.linear_attn.in_proj_a.weight": "model-00077-of-00122.safetensors", + "model.language_model.layers.38.linear_attn.conv1d.weight": "model-00077-of-00122.safetensors", + "model.language_model.layers.38.linear_attn.dt_bias": "model-00077-of-00122.safetensors", + "model.language_model.layers.38.linear_attn.A_log": "model-00077-of-00122.safetensors", + "model.language_model.layers.38.linear_attn.norm.weight": "model-00077-of-00122.safetensors", + "model.language_model.layers.38.linear_attn.out_proj.weight": "model-00077-of-00122.safetensors", + "model.language_model.layers.38.input_layernorm.weight": "model-00077-of-00122.safetensors", + "model.language_model.layers.38.mlp.gate.weight": "model-00077-of-00122.safetensors", + "model.language_model.layers.38.mlp.shared_expert.gate_proj.weight": "model-00077-of-00122.safetensors", + "model.language_model.layers.38.mlp.shared_expert.up_proj.weight": "model-00077-of-00122.safetensors", + "model.language_model.layers.38.mlp.shared_expert.down_proj.weight": "model-00077-of-00122.safetensors", + "model.language_model.layers.38.mlp.shared_expert_gate.weight": "model-00077-of-00122.safetensors", + "model.language_model.layers.38.mlp.experts.gate_up_proj": "model-00078-of-00122.safetensors", + "model.language_model.layers.38.mlp.experts.down_proj": "model-00079-of-00122.safetensors", + "model.language_model.layers.38.post_attention_layernorm.weight": "model-00079-of-00122.safetensors", + "model.language_model.layers.39.self_attn.q_proj.weight": "model-00079-of-00122.safetensors", + "model.language_model.layers.39.self_attn.k_proj.weight": "model-00079-of-00122.safetensors", + "model.language_model.layers.39.self_attn.v_proj.weight": "model-00079-of-00122.safetensors", + "model.language_model.layers.39.self_attn.o_proj.weight": "model-00079-of-00122.safetensors", + "model.language_model.layers.39.self_attn.q_norm.weight": "model-00079-of-00122.safetensors", + "model.language_model.layers.39.self_attn.k_norm.weight": "model-00079-of-00122.safetensors", + "model.language_model.layers.39.input_layernorm.weight": "model-00079-of-00122.safetensors", + "model.language_model.layers.39.mlp.gate.weight": "model-00079-of-00122.safetensors", + "model.language_model.layers.39.mlp.shared_expert.gate_proj.weight": "model-00079-of-00122.safetensors", + "model.language_model.layers.39.mlp.shared_expert.up_proj.weight": "model-00079-of-00122.safetensors", + "model.language_model.layers.39.mlp.shared_expert.down_proj.weight": "model-00079-of-00122.safetensors", + "model.language_model.layers.39.mlp.shared_expert_gate.weight": "model-00079-of-00122.safetensors", + "model.language_model.layers.39.mlp.experts.gate_up_proj": "model-00080-of-00122.safetensors", + "model.language_model.layers.39.mlp.experts.down_proj": "model-00081-of-00122.safetensors", + "model.language_model.layers.39.post_attention_layernorm.weight": "model-00081-of-00122.safetensors", + "model.language_model.layers.40.linear_attn.in_proj_qkv.weight": "model-00081-of-00122.safetensors", + "model.language_model.layers.40.linear_attn.in_proj_z.weight": "model-00081-of-00122.safetensors", + "model.language_model.layers.40.linear_attn.in_proj_b.weight": "model-00081-of-00122.safetensors", + "model.language_model.layers.40.linear_attn.in_proj_a.weight": "model-00081-of-00122.safetensors", + "model.language_model.layers.40.linear_attn.conv1d.weight": "model-00081-of-00122.safetensors", + "model.language_model.layers.40.linear_attn.dt_bias": "model-00081-of-00122.safetensors", + "model.language_model.layers.40.linear_attn.A_log": "model-00081-of-00122.safetensors", + "model.language_model.layers.40.linear_attn.norm.weight": "model-00081-of-00122.safetensors", + "model.language_model.layers.40.linear_attn.out_proj.weight": "model-00081-of-00122.safetensors", + "model.language_model.layers.40.input_layernorm.weight": "model-00081-of-00122.safetensors", + "model.language_model.layers.40.mlp.gate.weight": "model-00081-of-00122.safetensors", + "model.language_model.layers.40.mlp.shared_expert.gate_proj.weight": "model-00081-of-00122.safetensors", + "model.language_model.layers.40.mlp.shared_expert.up_proj.weight": "model-00081-of-00122.safetensors", + "model.language_model.layers.40.mlp.shared_expert.down_proj.weight": "model-00081-of-00122.safetensors", + "model.language_model.layers.40.mlp.shared_expert_gate.weight": "model-00081-of-00122.safetensors", + "model.language_model.layers.40.mlp.experts.gate_up_proj": "model-00082-of-00122.safetensors", + "model.language_model.layers.40.mlp.experts.down_proj": "model-00083-of-00122.safetensors", + "model.language_model.layers.40.post_attention_layernorm.weight": "model-00083-of-00122.safetensors", + "model.language_model.layers.41.linear_attn.in_proj_qkv.weight": "model-00083-of-00122.safetensors", + "model.language_model.layers.41.linear_attn.in_proj_z.weight": "model-00083-of-00122.safetensors", + "model.language_model.layers.41.linear_attn.in_proj_b.weight": "model-00083-of-00122.safetensors", + "model.language_model.layers.41.linear_attn.in_proj_a.weight": "model-00083-of-00122.safetensors", + "model.language_model.layers.41.linear_attn.conv1d.weight": "model-00083-of-00122.safetensors", + "model.language_model.layers.41.linear_attn.dt_bias": "model-00083-of-00122.safetensors", + "model.language_model.layers.41.linear_attn.A_log": "model-00083-of-00122.safetensors", + "model.language_model.layers.41.linear_attn.norm.weight": "model-00083-of-00122.safetensors", + "model.language_model.layers.41.linear_attn.out_proj.weight": "model-00083-of-00122.safetensors", + "model.language_model.layers.41.input_layernorm.weight": "model-00083-of-00122.safetensors", + "model.language_model.layers.41.mlp.gate.weight": "model-00083-of-00122.safetensors", + "model.language_model.layers.41.mlp.shared_expert.gate_proj.weight": "model-00083-of-00122.safetensors", + "model.language_model.layers.41.mlp.shared_expert.up_proj.weight": "model-00083-of-00122.safetensors", + "model.language_model.layers.41.mlp.shared_expert.down_proj.weight": "model-00083-of-00122.safetensors", + "model.language_model.layers.41.mlp.shared_expert_gate.weight": "model-00083-of-00122.safetensors", + "model.language_model.layers.41.mlp.experts.gate_up_proj": "model-00084-of-00122.safetensors", + "model.language_model.layers.41.mlp.experts.down_proj": "model-00085-of-00122.safetensors", + "model.language_model.layers.41.post_attention_layernorm.weight": "model-00085-of-00122.safetensors", + "model.language_model.layers.42.linear_attn.in_proj_qkv.weight": "model-00085-of-00122.safetensors", + "model.language_model.layers.42.linear_attn.in_proj_z.weight": "model-00085-of-00122.safetensors", + "model.language_model.layers.42.linear_attn.in_proj_b.weight": "model-00085-of-00122.safetensors", + "model.language_model.layers.42.linear_attn.in_proj_a.weight": "model-00085-of-00122.safetensors", + "model.language_model.layers.42.linear_attn.conv1d.weight": "model-00085-of-00122.safetensors", + "model.language_model.layers.42.linear_attn.dt_bias": "model-00085-of-00122.safetensors", + "model.language_model.layers.42.linear_attn.A_log": "model-00085-of-00122.safetensors", + "model.language_model.layers.42.linear_attn.norm.weight": "model-00085-of-00122.safetensors", + "model.language_model.layers.42.linear_attn.out_proj.weight": "model-00085-of-00122.safetensors", + "model.language_model.layers.42.input_layernorm.weight": "model-00085-of-00122.safetensors", + "model.language_model.layers.42.mlp.gate.weight": "model-00085-of-00122.safetensors", + "model.language_model.layers.42.mlp.shared_expert.gate_proj.weight": "model-00085-of-00122.safetensors", + "model.language_model.layers.42.mlp.shared_expert.up_proj.weight": "model-00085-of-00122.safetensors", + "model.language_model.layers.42.mlp.shared_expert.down_proj.weight": "model-00085-of-00122.safetensors", + "model.language_model.layers.42.mlp.shared_expert_gate.weight": "model-00085-of-00122.safetensors", + "model.language_model.layers.42.mlp.experts.gate_up_proj": "model-00086-of-00122.safetensors", + "model.language_model.layers.42.mlp.experts.down_proj": "model-00087-of-00122.safetensors", + "model.language_model.layers.42.post_attention_layernorm.weight": "model-00087-of-00122.safetensors", + "model.language_model.layers.43.self_attn.q_proj.weight": "model-00087-of-00122.safetensors", + "model.language_model.layers.43.self_attn.k_proj.weight": "model-00087-of-00122.safetensors", + "model.language_model.layers.43.self_attn.v_proj.weight": "model-00087-of-00122.safetensors", + "model.language_model.layers.43.self_attn.o_proj.weight": "model-00087-of-00122.safetensors", + "model.language_model.layers.43.self_attn.q_norm.weight": "model-00087-of-00122.safetensors", + "model.language_model.layers.43.self_attn.k_norm.weight": "model-00087-of-00122.safetensors", + "model.language_model.layers.43.input_layernorm.weight": "model-00087-of-00122.safetensors", + "model.language_model.layers.43.mlp.gate.weight": "model-00087-of-00122.safetensors", + "model.language_model.layers.43.mlp.shared_expert.gate_proj.weight": "model-00087-of-00122.safetensors", + "model.language_model.layers.43.mlp.shared_expert.up_proj.weight": "model-00087-of-00122.safetensors", + "model.language_model.layers.43.mlp.shared_expert.down_proj.weight": "model-00087-of-00122.safetensors", + "model.language_model.layers.43.mlp.shared_expert_gate.weight": "model-00087-of-00122.safetensors", + "model.language_model.layers.43.mlp.experts.gate_up_proj": "model-00088-of-00122.safetensors", + "model.language_model.layers.43.mlp.experts.down_proj": "model-00089-of-00122.safetensors", + "model.language_model.layers.43.post_attention_layernorm.weight": "model-00089-of-00122.safetensors", + "model.language_model.layers.44.linear_attn.in_proj_qkv.weight": "model-00089-of-00122.safetensors", + "model.language_model.layers.44.linear_attn.in_proj_z.weight": "model-00089-of-00122.safetensors", + "model.language_model.layers.44.linear_attn.in_proj_b.weight": "model-00089-of-00122.safetensors", + "model.language_model.layers.44.linear_attn.in_proj_a.weight": "model-00089-of-00122.safetensors", + "model.language_model.layers.44.linear_attn.conv1d.weight": "model-00089-of-00122.safetensors", + "model.language_model.layers.44.linear_attn.dt_bias": "model-00089-of-00122.safetensors", + "model.language_model.layers.44.linear_attn.A_log": "model-00089-of-00122.safetensors", + "model.language_model.layers.44.linear_attn.norm.weight": "model-00089-of-00122.safetensors", + "model.language_model.layers.44.linear_attn.out_proj.weight": "model-00089-of-00122.safetensors", + "model.language_model.layers.44.input_layernorm.weight": "model-00089-of-00122.safetensors", + "model.language_model.layers.44.mlp.gate.weight": "model-00089-of-00122.safetensors", + "model.language_model.layers.44.mlp.shared_expert.gate_proj.weight": "model-00089-of-00122.safetensors", + "model.language_model.layers.44.mlp.shared_expert.up_proj.weight": "model-00089-of-00122.safetensors", + "model.language_model.layers.44.mlp.shared_expert.down_proj.weight": "model-00089-of-00122.safetensors", + "model.language_model.layers.44.mlp.shared_expert_gate.weight": "model-00089-of-00122.safetensors", + "model.language_model.layers.44.mlp.experts.gate_up_proj": "model-00090-of-00122.safetensors", + "model.language_model.layers.44.mlp.experts.down_proj": "model-00091-of-00122.safetensors", + "model.language_model.layers.44.post_attention_layernorm.weight": "model-00091-of-00122.safetensors", + "model.language_model.layers.45.linear_attn.in_proj_qkv.weight": "model-00091-of-00122.safetensors", + "model.language_model.layers.45.linear_attn.in_proj_z.weight": "model-00091-of-00122.safetensors", + "model.language_model.layers.45.linear_attn.in_proj_b.weight": "model-00091-of-00122.safetensors", + "model.language_model.layers.45.linear_attn.in_proj_a.weight": "model-00091-of-00122.safetensors", + "model.language_model.layers.45.linear_attn.conv1d.weight": "model-00091-of-00122.safetensors", + "model.language_model.layers.45.linear_attn.dt_bias": "model-00091-of-00122.safetensors", + "model.language_model.layers.45.linear_attn.A_log": "model-00091-of-00122.safetensors", + "model.language_model.layers.45.linear_attn.norm.weight": "model-00091-of-00122.safetensors", + "model.language_model.layers.45.linear_attn.out_proj.weight": "model-00091-of-00122.safetensors", + "model.language_model.layers.45.input_layernorm.weight": "model-00091-of-00122.safetensors", + "model.language_model.layers.45.mlp.gate.weight": "model-00091-of-00122.safetensors", + "model.language_model.layers.45.mlp.shared_expert.gate_proj.weight": "model-00091-of-00122.safetensors", + "model.language_model.layers.45.mlp.shared_expert.up_proj.weight": "model-00091-of-00122.safetensors", + "model.language_model.layers.45.mlp.shared_expert.down_proj.weight": "model-00091-of-00122.safetensors", + "model.language_model.layers.45.mlp.shared_expert_gate.weight": "model-00091-of-00122.safetensors", + "model.language_model.layers.45.mlp.experts.gate_up_proj": "model-00092-of-00122.safetensors", + "model.language_model.layers.45.mlp.experts.down_proj": "model-00093-of-00122.safetensors", + "model.language_model.layers.45.post_attention_layernorm.weight": "model-00093-of-00122.safetensors", + "model.language_model.layers.46.linear_attn.in_proj_qkv.weight": "model-00093-of-00122.safetensors", + "model.language_model.layers.46.linear_attn.in_proj_z.weight": "model-00093-of-00122.safetensors", + "model.language_model.layers.46.linear_attn.in_proj_b.weight": "model-00093-of-00122.safetensors", + "model.language_model.layers.46.linear_attn.in_proj_a.weight": "model-00093-of-00122.safetensors", + "model.language_model.layers.46.linear_attn.conv1d.weight": "model-00093-of-00122.safetensors", + "model.language_model.layers.46.linear_attn.dt_bias": "model-00093-of-00122.safetensors", + "model.language_model.layers.46.linear_attn.A_log": "model-00093-of-00122.safetensors", + "model.language_model.layers.46.linear_attn.norm.weight": "model-00093-of-00122.safetensors", + "model.language_model.layers.46.linear_attn.out_proj.weight": "model-00093-of-00122.safetensors", + "model.language_model.layers.46.input_layernorm.weight": "model-00093-of-00122.safetensors", + "model.language_model.layers.46.mlp.gate.weight": "model-00093-of-00122.safetensors", + "model.language_model.layers.46.mlp.shared_expert.gate_proj.weight": "model-00093-of-00122.safetensors", + "model.language_model.layers.46.mlp.shared_expert.up_proj.weight": "model-00093-of-00122.safetensors", + "model.language_model.layers.46.mlp.shared_expert.down_proj.weight": "model-00093-of-00122.safetensors", + "model.language_model.layers.46.mlp.shared_expert_gate.weight": "model-00093-of-00122.safetensors", + "model.language_model.layers.46.mlp.experts.gate_up_proj": "model-00094-of-00122.safetensors", + "model.language_model.layers.46.mlp.experts.down_proj": "model-00095-of-00122.safetensors", + "model.language_model.layers.46.post_attention_layernorm.weight": "model-00095-of-00122.safetensors", + "model.language_model.layers.47.self_attn.q_proj.weight": "model-00095-of-00122.safetensors", + "model.language_model.layers.47.self_attn.k_proj.weight": "model-00095-of-00122.safetensors", + "model.language_model.layers.47.self_attn.v_proj.weight": "model-00095-of-00122.safetensors", + "model.language_model.layers.47.self_attn.o_proj.weight": "model-00095-of-00122.safetensors", + "model.language_model.layers.47.self_attn.q_norm.weight": "model-00095-of-00122.safetensors", + "model.language_model.layers.47.self_attn.k_norm.weight": "model-00095-of-00122.safetensors", + "model.language_model.layers.47.input_layernorm.weight": "model-00095-of-00122.safetensors", + "model.language_model.layers.47.mlp.gate.weight": "model-00095-of-00122.safetensors", + "model.language_model.layers.47.mlp.shared_expert.gate_proj.weight": "model-00095-of-00122.safetensors", + "model.language_model.layers.47.mlp.shared_expert.up_proj.weight": "model-00095-of-00122.safetensors", + "model.language_model.layers.47.mlp.shared_expert.down_proj.weight": "model-00095-of-00122.safetensors", + "model.language_model.layers.47.mlp.shared_expert_gate.weight": "model-00095-of-00122.safetensors", + "model.language_model.layers.47.mlp.experts.gate_up_proj": "model-00096-of-00122.safetensors", + "model.language_model.layers.47.mlp.experts.down_proj": "model-00097-of-00122.safetensors", + "model.language_model.layers.47.post_attention_layernorm.weight": "model-00097-of-00122.safetensors", + "model.language_model.layers.48.linear_attn.in_proj_qkv.weight": "model-00097-of-00122.safetensors", + "model.language_model.layers.48.linear_attn.in_proj_z.weight": "model-00097-of-00122.safetensors", + "model.language_model.layers.48.linear_attn.in_proj_b.weight": "model-00097-of-00122.safetensors", + "model.language_model.layers.48.linear_attn.in_proj_a.weight": "model-00097-of-00122.safetensors", + "model.language_model.layers.48.linear_attn.conv1d.weight": "model-00097-of-00122.safetensors", + "model.language_model.layers.48.linear_attn.dt_bias": "model-00097-of-00122.safetensors", + "model.language_model.layers.48.linear_attn.A_log": "model-00097-of-00122.safetensors", + "model.language_model.layers.48.linear_attn.norm.weight": "model-00097-of-00122.safetensors", + "model.language_model.layers.48.linear_attn.out_proj.weight": "model-00097-of-00122.safetensors", + "model.language_model.layers.48.input_layernorm.weight": "model-00097-of-00122.safetensors", + "model.language_model.layers.48.mlp.gate.weight": "model-00097-of-00122.safetensors", + "model.language_model.layers.48.mlp.shared_expert.gate_proj.weight": "model-00097-of-00122.safetensors", + "model.language_model.layers.48.mlp.shared_expert.up_proj.weight": "model-00097-of-00122.safetensors", + "model.language_model.layers.48.mlp.shared_expert.down_proj.weight": "model-00097-of-00122.safetensors", + "model.language_model.layers.48.mlp.shared_expert_gate.weight": "model-00097-of-00122.safetensors", + "model.language_model.layers.48.mlp.experts.gate_up_proj": "model-00098-of-00122.safetensors", + "model.language_model.layers.48.mlp.experts.down_proj": "model-00099-of-00122.safetensors", + "model.language_model.layers.48.post_attention_layernorm.weight": "model-00099-of-00122.safetensors", + "model.language_model.layers.49.linear_attn.in_proj_qkv.weight": "model-00099-of-00122.safetensors", + "model.language_model.layers.49.linear_attn.in_proj_z.weight": "model-00099-of-00122.safetensors", + "model.language_model.layers.49.linear_attn.in_proj_b.weight": "model-00099-of-00122.safetensors", + "model.language_model.layers.49.linear_attn.in_proj_a.weight": "model-00099-of-00122.safetensors", + "model.language_model.layers.49.linear_attn.conv1d.weight": "model-00099-of-00122.safetensors", + "model.language_model.layers.49.linear_attn.dt_bias": "model-00099-of-00122.safetensors", + "model.language_model.layers.49.linear_attn.A_log": "model-00099-of-00122.safetensors", + "model.language_model.layers.49.linear_attn.norm.weight": "model-00099-of-00122.safetensors", + "model.language_model.layers.49.linear_attn.out_proj.weight": "model-00099-of-00122.safetensors", + "model.language_model.layers.49.input_layernorm.weight": "model-00099-of-00122.safetensors", + "model.language_model.layers.49.mlp.gate.weight": "model-00099-of-00122.safetensors", + "model.language_model.layers.49.mlp.shared_expert.gate_proj.weight": "model-00099-of-00122.safetensors", + "model.language_model.layers.49.mlp.shared_expert.up_proj.weight": "model-00099-of-00122.safetensors", + "model.language_model.layers.49.mlp.shared_expert.down_proj.weight": "model-00099-of-00122.safetensors", + "model.language_model.layers.49.mlp.shared_expert_gate.weight": "model-00099-of-00122.safetensors", + "model.language_model.layers.49.mlp.experts.gate_up_proj": "model-00100-of-00122.safetensors", + "model.language_model.layers.49.mlp.experts.down_proj": "model-00101-of-00122.safetensors", + "model.language_model.layers.49.post_attention_layernorm.weight": "model-00101-of-00122.safetensors", + "model.language_model.layers.50.linear_attn.in_proj_qkv.weight": "model-00101-of-00122.safetensors", + "model.language_model.layers.50.linear_attn.in_proj_z.weight": "model-00101-of-00122.safetensors", + "model.language_model.layers.50.linear_attn.in_proj_b.weight": "model-00101-of-00122.safetensors", + "model.language_model.layers.50.linear_attn.in_proj_a.weight": "model-00101-of-00122.safetensors", + "model.language_model.layers.50.linear_attn.conv1d.weight": "model-00101-of-00122.safetensors", + "model.language_model.layers.50.linear_attn.dt_bias": "model-00101-of-00122.safetensors", + "model.language_model.layers.50.linear_attn.A_log": "model-00101-of-00122.safetensors", + "model.language_model.layers.50.linear_attn.norm.weight": "model-00101-of-00122.safetensors", + "model.language_model.layers.50.linear_attn.out_proj.weight": "model-00101-of-00122.safetensors", + "model.language_model.layers.50.input_layernorm.weight": "model-00101-of-00122.safetensors", + "model.language_model.layers.50.mlp.gate.weight": "model-00101-of-00122.safetensors", + "model.language_model.layers.50.mlp.shared_expert.gate_proj.weight": "model-00101-of-00122.safetensors", + "model.language_model.layers.50.mlp.shared_expert.up_proj.weight": "model-00101-of-00122.safetensors", + "model.language_model.layers.50.mlp.shared_expert.down_proj.weight": "model-00101-of-00122.safetensors", + "model.language_model.layers.50.mlp.shared_expert_gate.weight": "model-00101-of-00122.safetensors", + "model.language_model.layers.50.mlp.experts.gate_up_proj": "model-00102-of-00122.safetensors", + "model.language_model.layers.50.mlp.experts.down_proj": "model-00103-of-00122.safetensors", + "model.language_model.layers.50.post_attention_layernorm.weight": "model-00103-of-00122.safetensors", + "model.language_model.layers.51.self_attn.q_proj.weight": "model-00103-of-00122.safetensors", + "model.language_model.layers.51.self_attn.k_proj.weight": "model-00103-of-00122.safetensors", + "model.language_model.layers.51.self_attn.v_proj.weight": "model-00103-of-00122.safetensors", + "model.language_model.layers.51.self_attn.o_proj.weight": "model-00103-of-00122.safetensors", + "model.language_model.layers.51.self_attn.q_norm.weight": "model-00103-of-00122.safetensors", + "model.language_model.layers.51.self_attn.k_norm.weight": "model-00103-of-00122.safetensors", + "model.language_model.layers.51.input_layernorm.weight": "model-00103-of-00122.safetensors", + "model.language_model.layers.51.mlp.gate.weight": "model-00103-of-00122.safetensors", + "model.language_model.layers.51.mlp.shared_expert.gate_proj.weight": "model-00103-of-00122.safetensors", + "model.language_model.layers.51.mlp.shared_expert.up_proj.weight": "model-00103-of-00122.safetensors", + "model.language_model.layers.51.mlp.shared_expert.down_proj.weight": "model-00103-of-00122.safetensors", + "model.language_model.layers.51.mlp.shared_expert_gate.weight": "model-00103-of-00122.safetensors", + "model.language_model.layers.51.mlp.experts.gate_up_proj": "model-00104-of-00122.safetensors", + "model.language_model.layers.51.mlp.experts.down_proj": "model-00105-of-00122.safetensors", + "model.language_model.layers.51.post_attention_layernorm.weight": "model-00105-of-00122.safetensors", + "model.language_model.layers.52.linear_attn.in_proj_qkv.weight": "model-00105-of-00122.safetensors", + "model.language_model.layers.52.linear_attn.in_proj_z.weight": "model-00105-of-00122.safetensors", + "model.language_model.layers.52.linear_attn.in_proj_b.weight": "model-00105-of-00122.safetensors", + "model.language_model.layers.52.linear_attn.in_proj_a.weight": "model-00105-of-00122.safetensors", + "model.language_model.layers.52.linear_attn.conv1d.weight": "model-00105-of-00122.safetensors", + "model.language_model.layers.52.linear_attn.dt_bias": "model-00105-of-00122.safetensors", + "model.language_model.layers.52.linear_attn.A_log": "model-00105-of-00122.safetensors", + "model.language_model.layers.52.linear_attn.norm.weight": "model-00105-of-00122.safetensors", + "model.language_model.layers.52.linear_attn.out_proj.weight": "model-00105-of-00122.safetensors", + "model.language_model.layers.52.input_layernorm.weight": "model-00105-of-00122.safetensors", + "model.language_model.layers.52.mlp.gate.weight": "model-00105-of-00122.safetensors", + "model.language_model.layers.52.mlp.shared_expert.gate_proj.weight": "model-00105-of-00122.safetensors", + "model.language_model.layers.52.mlp.shared_expert.up_proj.weight": "model-00105-of-00122.safetensors", + "model.language_model.layers.52.mlp.shared_expert.down_proj.weight": "model-00105-of-00122.safetensors", + "model.language_model.layers.52.mlp.shared_expert_gate.weight": "model-00105-of-00122.safetensors", + "model.language_model.layers.52.mlp.experts.gate_up_proj": "model-00106-of-00122.safetensors", + "model.language_model.layers.52.mlp.experts.down_proj": "model-00107-of-00122.safetensors", + "model.language_model.layers.52.post_attention_layernorm.weight": "model-00107-of-00122.safetensors", + "model.language_model.layers.53.linear_attn.in_proj_qkv.weight": "model-00107-of-00122.safetensors", + "model.language_model.layers.53.linear_attn.in_proj_z.weight": "model-00107-of-00122.safetensors", + "model.language_model.layers.53.linear_attn.in_proj_b.weight": "model-00107-of-00122.safetensors", + "model.language_model.layers.53.linear_attn.in_proj_a.weight": "model-00107-of-00122.safetensors", + "model.language_model.layers.53.linear_attn.conv1d.weight": "model-00107-of-00122.safetensors", + "model.language_model.layers.53.linear_attn.dt_bias": "model-00107-of-00122.safetensors", + "model.language_model.layers.53.linear_attn.A_log": "model-00107-of-00122.safetensors", + "model.language_model.layers.53.linear_attn.norm.weight": "model-00107-of-00122.safetensors", + "model.language_model.layers.53.linear_attn.out_proj.weight": "model-00107-of-00122.safetensors", + "model.language_model.layers.53.input_layernorm.weight": "model-00107-of-00122.safetensors", + "model.language_model.layers.53.mlp.gate.weight": "model-00107-of-00122.safetensors", + "model.language_model.layers.53.mlp.shared_expert.gate_proj.weight": "model-00107-of-00122.safetensors", + "model.language_model.layers.53.mlp.shared_expert.up_proj.weight": "model-00107-of-00122.safetensors", + "model.language_model.layers.53.mlp.shared_expert.down_proj.weight": "model-00107-of-00122.safetensors", + "model.language_model.layers.53.mlp.shared_expert_gate.weight": "model-00107-of-00122.safetensors", + "model.language_model.layers.53.mlp.experts.gate_up_proj": "model-00108-of-00122.safetensors", + "model.language_model.layers.53.mlp.experts.down_proj": "model-00109-of-00122.safetensors", + "model.language_model.layers.53.post_attention_layernorm.weight": "model-00109-of-00122.safetensors", + "model.language_model.layers.54.linear_attn.in_proj_qkv.weight": "model-00109-of-00122.safetensors", + "model.language_model.layers.54.linear_attn.in_proj_z.weight": "model-00109-of-00122.safetensors", + "model.language_model.layers.54.linear_attn.in_proj_b.weight": "model-00109-of-00122.safetensors", + "model.language_model.layers.54.linear_attn.in_proj_a.weight": "model-00109-of-00122.safetensors", + "model.language_model.layers.54.linear_attn.conv1d.weight": "model-00109-of-00122.safetensors", + "model.language_model.layers.54.linear_attn.dt_bias": "model-00109-of-00122.safetensors", + "model.language_model.layers.54.linear_attn.A_log": "model-00109-of-00122.safetensors", + "model.language_model.layers.54.linear_attn.norm.weight": "model-00109-of-00122.safetensors", + "model.language_model.layers.54.linear_attn.out_proj.weight": "model-00109-of-00122.safetensors", + "model.language_model.layers.54.input_layernorm.weight": "model-00109-of-00122.safetensors", + "model.language_model.layers.54.mlp.gate.weight": "model-00109-of-00122.safetensors", + "model.language_model.layers.54.mlp.shared_expert.gate_proj.weight": "model-00109-of-00122.safetensors", + "model.language_model.layers.54.mlp.shared_expert.up_proj.weight": "model-00109-of-00122.safetensors", + "model.language_model.layers.54.mlp.shared_expert.down_proj.weight": "model-00109-of-00122.safetensors", + "model.language_model.layers.54.mlp.shared_expert_gate.weight": "model-00109-of-00122.safetensors", + "model.language_model.layers.54.mlp.experts.gate_up_proj": "model-00110-of-00122.safetensors", + "model.language_model.layers.54.mlp.experts.down_proj": "model-00111-of-00122.safetensors", + "model.language_model.layers.54.post_attention_layernorm.weight": "model-00111-of-00122.safetensors", + "model.language_model.layers.55.self_attn.q_proj.weight": "model-00111-of-00122.safetensors", + "model.language_model.layers.55.self_attn.k_proj.weight": "model-00111-of-00122.safetensors", + "model.language_model.layers.55.self_attn.v_proj.weight": "model-00111-of-00122.safetensors", + "model.language_model.layers.55.self_attn.o_proj.weight": "model-00111-of-00122.safetensors", + "model.language_model.layers.55.self_attn.q_norm.weight": "model-00111-of-00122.safetensors", + "model.language_model.layers.55.self_attn.k_norm.weight": "model-00111-of-00122.safetensors", + "model.language_model.layers.55.input_layernorm.weight": "model-00111-of-00122.safetensors", + "model.language_model.layers.55.mlp.gate.weight": "model-00111-of-00122.safetensors", + "model.language_model.layers.55.mlp.shared_expert.gate_proj.weight": "model-00111-of-00122.safetensors", + "model.language_model.layers.55.mlp.shared_expert.up_proj.weight": "model-00111-of-00122.safetensors", + "model.language_model.layers.55.mlp.shared_expert.down_proj.weight": "model-00111-of-00122.safetensors", + "model.language_model.layers.55.mlp.shared_expert_gate.weight": "model-00111-of-00122.safetensors", + "model.language_model.layers.55.mlp.experts.gate_up_proj": "model-00112-of-00122.safetensors", + "model.language_model.layers.55.mlp.experts.down_proj": "model-00113-of-00122.safetensors", + "model.language_model.layers.55.post_attention_layernorm.weight": "model-00113-of-00122.safetensors", + "model.language_model.layers.56.linear_attn.in_proj_qkv.weight": "model-00113-of-00122.safetensors", + "model.language_model.layers.56.linear_attn.in_proj_z.weight": "model-00113-of-00122.safetensors", + "model.language_model.layers.56.linear_attn.in_proj_b.weight": "model-00113-of-00122.safetensors", + "model.language_model.layers.56.linear_attn.in_proj_a.weight": "model-00113-of-00122.safetensors", + "model.language_model.layers.56.linear_attn.conv1d.weight": "model-00113-of-00122.safetensors", + "model.language_model.layers.56.linear_attn.dt_bias": "model-00113-of-00122.safetensors", + "model.language_model.layers.56.linear_attn.A_log": "model-00113-of-00122.safetensors", + "model.language_model.layers.56.linear_attn.norm.weight": "model-00113-of-00122.safetensors", + "model.language_model.layers.56.linear_attn.out_proj.weight": "model-00113-of-00122.safetensors", + "model.language_model.layers.56.input_layernorm.weight": "model-00113-of-00122.safetensors", + "model.language_model.layers.56.mlp.gate.weight": "model-00113-of-00122.safetensors", + "model.language_model.layers.56.mlp.shared_expert.gate_proj.weight": "model-00113-of-00122.safetensors", + "model.language_model.layers.56.mlp.shared_expert.up_proj.weight": "model-00113-of-00122.safetensors", + "model.language_model.layers.56.mlp.shared_expert.down_proj.weight": "model-00113-of-00122.safetensors", + "model.language_model.layers.56.mlp.shared_expert_gate.weight": "model-00113-of-00122.safetensors", + "model.language_model.layers.56.mlp.experts.gate_up_proj": "model-00114-of-00122.safetensors", + "model.language_model.layers.56.mlp.experts.down_proj": "model-00115-of-00122.safetensors", + "model.language_model.layers.56.post_attention_layernorm.weight": "model-00115-of-00122.safetensors", + "model.language_model.layers.57.linear_attn.in_proj_qkv.weight": "model-00115-of-00122.safetensors", + "model.language_model.layers.57.linear_attn.in_proj_z.weight": "model-00115-of-00122.safetensors", + "model.language_model.layers.57.linear_attn.in_proj_b.weight": "model-00115-of-00122.safetensors", + "model.language_model.layers.57.linear_attn.in_proj_a.weight": "model-00115-of-00122.safetensors", + "model.language_model.layers.57.linear_attn.conv1d.weight": "model-00115-of-00122.safetensors", + "model.language_model.layers.57.linear_attn.dt_bias": "model-00115-of-00122.safetensors", + "model.language_model.layers.57.linear_attn.A_log": "model-00115-of-00122.safetensors", + "model.language_model.layers.57.linear_attn.norm.weight": "model-00115-of-00122.safetensors", + "model.language_model.layers.57.linear_attn.out_proj.weight": "model-00115-of-00122.safetensors", + "model.language_model.layers.57.input_layernorm.weight": "model-00115-of-00122.safetensors", + "model.language_model.layers.57.mlp.gate.weight": "model-00115-of-00122.safetensors", + "model.language_model.layers.57.mlp.shared_expert.gate_proj.weight": "model-00115-of-00122.safetensors", + "model.language_model.layers.57.mlp.shared_expert.up_proj.weight": "model-00115-of-00122.safetensors", + "model.language_model.layers.57.mlp.shared_expert.down_proj.weight": "model-00115-of-00122.safetensors", + "model.language_model.layers.57.mlp.shared_expert_gate.weight": "model-00115-of-00122.safetensors", + "model.language_model.layers.57.mlp.experts.gate_up_proj": "model-00116-of-00122.safetensors", + "model.language_model.layers.57.mlp.experts.down_proj": "model-00117-of-00122.safetensors", + "model.language_model.layers.57.post_attention_layernorm.weight": "model-00117-of-00122.safetensors", + "model.language_model.layers.58.linear_attn.in_proj_qkv.weight": "model-00117-of-00122.safetensors", + "model.language_model.layers.58.linear_attn.in_proj_z.weight": "model-00117-of-00122.safetensors", + "model.language_model.layers.58.linear_attn.in_proj_b.weight": "model-00117-of-00122.safetensors", + "model.language_model.layers.58.linear_attn.in_proj_a.weight": "model-00117-of-00122.safetensors", + "model.language_model.layers.58.linear_attn.conv1d.weight": "model-00117-of-00122.safetensors", + "model.language_model.layers.58.linear_attn.dt_bias": "model-00117-of-00122.safetensors", + "model.language_model.layers.58.linear_attn.A_log": "model-00117-of-00122.safetensors", + "model.language_model.layers.58.linear_attn.norm.weight": "model-00117-of-00122.safetensors", + "model.language_model.layers.58.linear_attn.out_proj.weight": "model-00117-of-00122.safetensors", + "model.language_model.layers.58.input_layernorm.weight": "model-00117-of-00122.safetensors", + "model.language_model.layers.58.mlp.gate.weight": "model-00117-of-00122.safetensors", + "model.language_model.layers.58.mlp.shared_expert.gate_proj.weight": "model-00117-of-00122.safetensors", + "model.language_model.layers.58.mlp.shared_expert.up_proj.weight": "model-00117-of-00122.safetensors", + "model.language_model.layers.58.mlp.shared_expert.down_proj.weight": "model-00117-of-00122.safetensors", + "model.language_model.layers.58.mlp.shared_expert_gate.weight": "model-00117-of-00122.safetensors", + "model.language_model.layers.58.mlp.experts.gate_up_proj": "model-00118-of-00122.safetensors", + "model.language_model.layers.58.mlp.experts.down_proj": "model-00119-of-00122.safetensors", + "model.language_model.layers.58.post_attention_layernorm.weight": "model-00119-of-00122.safetensors", + "model.language_model.layers.59.self_attn.q_proj.weight": "model-00119-of-00122.safetensors", + "model.language_model.layers.59.self_attn.k_proj.weight": "model-00119-of-00122.safetensors", + "model.language_model.layers.59.self_attn.v_proj.weight": "model-00119-of-00122.safetensors", + "model.language_model.layers.59.self_attn.o_proj.weight": "model-00119-of-00122.safetensors", + "model.language_model.layers.59.self_attn.q_norm.weight": "model-00119-of-00122.safetensors", + "model.language_model.layers.59.self_attn.k_norm.weight": "model-00119-of-00122.safetensors", + "model.language_model.layers.59.input_layernorm.weight": "model-00119-of-00122.safetensors", + "model.language_model.layers.59.mlp.gate.weight": "model-00119-of-00122.safetensors", + "model.language_model.layers.59.mlp.shared_expert.gate_proj.weight": "model-00119-of-00122.safetensors", + "model.language_model.layers.59.mlp.shared_expert.up_proj.weight": "model-00119-of-00122.safetensors", + "model.language_model.layers.59.mlp.shared_expert.down_proj.weight": "model-00119-of-00122.safetensors", + "model.language_model.layers.59.mlp.shared_expert_gate.weight": "model-00119-of-00122.safetensors", + "model.language_model.layers.59.mlp.experts.gate_up_proj": "model-00120-of-00122.safetensors", + "model.language_model.layers.59.mlp.experts.down_proj": "model-00121-of-00122.safetensors", + "model.language_model.layers.59.post_attention_layernorm.weight": "model-00121-of-00122.safetensors", + "lm_head.weight": "model-00122-of-00122.safetensors", + "model.language_model.norm.weight": "model-00122-of-00122.safetensors" + } +} \ No newline at end of file diff --git a/preprocessor_config.json b/preprocessor_config.json new file mode 100644 index 0000000000000000000000000000000000000000..2ea84a437d448ff71b08df68fdd949d5cc4ebb64 --- /dev/null +++ b/preprocessor_config.json @@ -0,0 +1,21 @@ +{ + "size": { + "longest_edge": 16777216, + "shortest_edge": 65536 + }, + "patch_size": 16, + "temporal_patch_size": 2, + "merge_size": 2, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "processor_class": "Qwen3VLProcessor", + "image_processor_type": "Qwen2VLImageProcessorFast" +} \ No newline at end of file diff --git a/processor_config.json b/processor_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ad6acdf4203f22b7b990e36ccc3a1fe38563d5e --- /dev/null +++ b/processor_config.json @@ -0,0 +1,63 @@ +{ + "image_processor": { + "data_format": "channels_first", + "do_convert_rgb": true, + "do_normalize": true, + "do_rescale": true, + "do_resize": true, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_processor_type": "Qwen2VLImageProcessorFast", + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "merge_size": 2, + "patch_size": 16, + "resample": 3, + "rescale_factor": 0.00392156862745098, + "size": { + "longest_edge": 16777216, + "shortest_edge": 65536 + }, + "temporal_patch_size": 2 + }, + "processor_class": "Qwen3VLProcessor", + "video_processor": { + "data_format": "channels_first", + "default_to_square": true, + "do_convert_rgb": true, + "do_normalize": true, + "do_rescale": true, + "do_resize": true, + "do_sample_frames": true, + "fps": 2, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "max_frames": 768, + "merge_size": 2, + "min_frames": 4, + "patch_size": 16, + "resample": 3, + "rescale_factor": 0.00392156862745098, + "return_metadata": false, + "size": { + "longest_edge": 25165824, + "shortest_edge": 4096 + }, + "temporal_patch_size": 2, + "video_processor_type": "Qwen3VLVideoProcessor" + } +} diff --git a/tokenizer.json b/tokenizer.json new file mode 100644 index 0000000000000000000000000000000000000000..67741b04f23bfdb46501f748ce27865ec82eccfb --- /dev/null +++ b/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:87a7830d63fcf43bf241c3c5242e96e62dd3fdc29224ca26fed8ea333db72de4 +size 19989343 diff --git a/tokenizer_config.json b/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..a068e2468cff426a9b105006e74e044030a6faf4 --- /dev/null +++ b/tokenizer_config.json @@ -0,0 +1,32 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": true, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "processor_class": "Qwen3VLProcessor", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +}