WuChengyue commited on Apr 13

Commit

c79aa4d

verified ·

1 Parent(s): ee08626

Upload folder using huggingface_hub

Browse files

Files changed (18) hide show

.gitattributes +1 -0
README.md +157 -3
added_tokens.json +25 -0
chat_template.jinja +7 -0
config.json +171 -0
configuration.py +190 -0
convert_weights.py +78 -0
generation_config.json +11 -0
merges.txt +0 -0
model-00001-of-00002.safetensors +3 -0
model-00002-of-00002.safetensors +3 -0
model.safetensors.index.json +833 -0
modeling.py +0 -0
preprocessor_config.json +19 -0
special_tokens_map.json +25 -0
tokenizer.json +3 -0
tokenizer_config.json +204 -0
vocab.json +0 -0

.gitattributes CHANGED Viewed

@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text

 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text
+tokenizer.json filter=lfs diff=lfs merge=lfs -text

README.md CHANGED Viewed

@@ -1,3 +1,157 @@
----
-license: apache-2.0
----

+---
+license: apache-2.0
+language:
+- en
+base_model:
+- Qwen/Qwen2.5-VL-3B-Instruct
+tags:
+- diffusion
+- vlm
+- block-diffusion
+- parallel-decoding
+---
+# Fast-dVLM (3B) — Efficient Block-Diffusion VLM via Direct Conversion from Autoregressive VLM
+[[Paper](https://arxiv.org/abs/2604.06832)] [[Project Page](https://nvlabs.github.io/Fast-dLLM/fast_dvlm/)] [[Code](https://github.com/NVlabs/Fast-dLLM)] [[Fast-dLLM v2](https://huggingface.co/Efficient-Large-Model/Fast_dLLM_1.5B)]
+## Introduction
+Vision-language models (VLMs) predominantly rely on autoregressive decoding, which generates tokens one at a time and fundamentally limits inference throughput. This limitation is especially acute in **physical AI scenarios** such as robotics and autonomous driving, where VLMs are deployed on edge devices at batch size one.
+**Fast-dVLM** is a block-diffusion-based VLM that enables **KV-cache-compatible parallel decoding** and **speculative block decoding** for inference acceleration. Built on **Qwen2.5-VL-3B-Instruct**, Fast-dVLM directly converts the pretrained AR VLM into a block-diffusion model in a single stage, leveraging the already multimodally aligned VLM.
+### Key Highlights
+- **Lossless Quality**: Matches the AR baseline (Qwen2.5-VL-3B) across **11 multimodal benchmarks** (74.0 avg).
+- **Up to 6.18x Speedup**: With SGLang integration and FP8 quantization.
+- **2.63x Tokens/NFE**: With self-speculative block decoding.
+- **Direct Conversion**: Single-stage AR-to-diffusion conversion outperforms two-stage approach (73.3 vs 60.2 avg).
+### Key Techniques
+- **Block-Size Annealing**: Curriculum that progressively increases the block size during training.
+- **Causal Context Attention**: Noisy tokens attend bidirectionally within blocks (N2N), to clean tokens from preceding blocks (N2C), while clean tokens follow causal attention (C2C).
+- **Auto-Truncation Masking**: Prevents cross-turn leakage in multi-turn dialogue.
+- **Vision-Efficient Concatenation**: Vision embeddings included only in the clean stream, reducing peak memory by 15% and training time by 14.2%.
+---
+## Model Overview
+| Property | Value |
+|---|---|
+| **Type** | Block Diffusion Vision-Language Model |
+| **Base Model** | `Qwen/Qwen2.5-VL-3B-Instruct` |
+| **Architecture** | Transformer w/ M-RoPE, SwiGLU, RMSNorm, GQA |
+| **Text Layers** | 36 |
+| **Vision Depth** | 32 |
+| **Text Hidden Size** | 2048 |
+| **Attention Heads** | 16 (Q), 2 (KV, GQA) |
+| **Block Diffusion Size** | 32 |
+---
+## Quickstart
+```python
+from transformers import AutoModelForCausalLM, AutoTokenizer, AutoProcessor
+from qwen_vl_utils import process_vision_info
+model_name = "Efficient-Large-Model/Fast_dVLM_3B"
+model = AutoModelForCausalLM.from_pretrained(
+    model_name,
+    torch_dtype="auto",
+    device_map="auto",
+    trust_remote_code=True,
+)
+tokenizer = AutoTokenizer.from_pretrained(model_name)
+processor = AutoProcessor.from_pretrained(model_name, use_fast=False)
+processor.tokenizer = tokenizer
+prompt = "Describe this image in detail."
+messages = [
+    {
+        "role": "user",
+        "content": [
+            {"type": "image", "image": "https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen-VL/assets/demo.jpeg"},
+            {"type": "text", "text": prompt},
+        ],
+    }
+]
+text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
+image_inputs, video_inputs = process_vision_info(messages)
+inputs = processor(
+    text=[text],
+    images=image_inputs,
+    videos=video_inputs,
+    padding=True,
+    return_tensors="pt",
+).to(model.device)
+mask_id = tokenizer.encode("|<MASK>|")[0]
+generated_ids = model.generate(
+    input_ids=inputs.input_ids,
+    tokenizer=tokenizer,
+    pixel_values=inputs.pixel_values,
+    image_grid_thw=inputs.image_grid_thw,
+    mask_id=mask_id,
+    max_tokens=512,
+)
+generated_ids = [
+    output_ids[len(input_ids):] for input_ids, output_ids in zip(inputs.input_ids, generated_ids)
+]
+response = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
+print(response)
+```
+---
+## Benchmark Results
+Fast-dVLM matches the AR baseline on 11 multimodal benchmarks while achieving 2.63x Tokens/NFE with speculative decoding.
+| Model | AI2D | ChartQA | DocVQA | GQA | MMBench | MMMU | POPE | RWQA | SEED2+ | TextVQA | Avg | MMMU-Pro-V | Tok/NFE |
+|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
+| Qwen2.5-VL-3B | 80.8 | 84.0 | 93.1 | 59.0 | 76.9 | 47.3 | 86.2 | 65.1 | 68.6 | 79.1 | 74.0 | 26.3 | 1.00 |
+| **Fast-dVLM (MDM)** | 79.7 | 82.8 | 92.1 | 63.0 | 74.2 | 44.6 | 88.6 | 65.1 | 67.2 | 76.1 | 73.3 | 21.4 | 1.95 |
+| **Fast-dVLM (spec.)** | 79.7 | 83.1 | 92.9 | 63.3 | 74.3 | 46.6 | 88.6 | 65.1 | 67.2 | 79.3 | **74.0** | 24.6 | **2.63** |
+### Inference Acceleration
+| Setting | MMMU-Pro-V | TPS | SpeedUp |
+|---|---|---|---|
+| AR baseline | 26.3 | 56.7 | 1.00x |
+| Fast-dVLM (MDM, t=0.9) | 21.4 | 82.2 | 1.45x |
+| + Spec. decoding (linear) | 24.6 | 112.7 | 1.98x |
+| + SGLang serving | 24.1 | 319.0 | 5.63x |
+| + SmoothQuant-W8A8 (FP8) | 23.8 | **350.3** | **6.18x** |
+---
+## Citation
+If you use Fast-dVLM in your research, please cite:
+```bibtex
+@misc{wu2026fastdvlmefficientblockdiffusionvlm,
+      title={Fast-dVLM: Efficient Block-Diffusion VLM via Direct Conversion from Autoregressive VLM},
+      author={Chengyue Wu and Shiyi Lan and Yonggan Fu and Sensen Gao and Jin Wang and Jincheng Yu and Jose M. Alvarez and Pavlo Molchanov and Ping Luo and Song Han and Ligeng Zhu and Enze Xie},
+      year={2026},
+      eprint={2604.06832},
+      archivePrefix={arXiv},
+      primaryClass={cs.CL},
+      url={https://arxiv.org/abs/2604.06832},
+}
+```
+---
+## License
+Released under **Apache 2.0**, following the base Qwen2.5-VL license.

added_tokens.json ADDED Viewed

	@@ -0,0 +1,25 @@

+{
+  "</tool_call>": 151658,
+  "<tool_call>": 151657,
+  "<|box_end|>": 151649,
+  "<|box_start|>": 151648,
+  "<|endoftext|>": 151643,
+  "<|file_sep|>": 151664,
+  "<|fim_middle|>": 151660,
+  "<|fim_pad|>": 151662,
+  "<|fim_prefix|>": 151659,
+  "<|fim_suffix|>": 151661,
+  "<|im_end|>": 151645,
+  "<|im_start|>": 151644,
+  "<|image_pad|>": 151655,
+  "<|object_ref_end|>": 151647,
+  "<|object_ref_start|>": 151646,
+  "<|quad_end|>": 151651,
+  "<|quad_start|>": 151650,
+  "<|repo_name|>": 151663,
+  "<|video_pad|>": 151656,
+  "<|vision_end|>": 151653,
+  "<|vision_pad|>": 151654,
+  "<|vision_start|>": 151652,
+  "|<MASK>|": 151665
+}

chat_template.jinja ADDED Viewed

	@@ -0,0 +1,7 @@

+{% set image_count = namespace(value=0) %}{% set video_count = namespace(value=0) %}{% for message in messages %}{% if loop.first and message['role'] != 'system' %}<|im_start|>system
+You are a helpful assistant.<|im_end|>
+{% endif %}<|im_start|>{{ message['role'] }}
+{% if message['content'] is string %}{{ message['content'] }}<|im_end|>
+{% else %}{% for content in message['content'] %}{% if content['type'] == 'image' or 'image' in content or 'image_url' in content %}{% set image_count.value = image_count.value + 1 %}{% if add_vision_id %}Picture {{ image_count.value }}: {% endif %}<|vision_start|><|image_pad|><|vision_end|>{% elif content['type'] == 'video' or 'video' in content %}{% set video_count.value = video_count.value + 1 %}{% if add_vision_id %}Video {{ video_count.value }}: {% endif %}<|vision_start|><|video_pad|><|vision_end|>{% elif 'text' in content %}{{ content['text'] }}{% endif %}{% endfor %}<|im_end|>
+{% endif %}{% endfor %}{% if add_generation_prompt %}<|im_start|>assistant
+{% endif %}

config.json ADDED Viewed

	@@ -0,0 +1,171 @@

+{
+  "always_mask_im_end": true,
+  "anneal_block_size": true,
+  "architectures": [
+    "Fast_dVLMForConditionalGeneration"
+  ],
+  "attention_dropout": 0.0,
+  "auto_map": {
+    "AutoConfig": "configuration.Fast_dVLMConfig",
+    "AutoModel": "modeling.Fast_dVLMForConditionalGeneration",
+    "AutoModelForCausalLM": "modeling.Fast_dVLMForConditionalGeneration"
+  },
+  "bd_size": 32,
+  "block_causal_no_dynamic": false,
+  "complementary_mask": true,
+  "dtype": "bfloat16",
+  "enable_efficient_vision_embed": false,
+  "entropy_loss": false,
+  "entropy_loss_weight": 1.0,
+  "eos_token_id": 151645,
+  "flexible_bd_size": false,
+  "hidden_act": "silu",
+  "hidden_size": 2048,
+  "image_token_id": 151655,
+  "initializer_range": 0.02,
+  "intermediate_size": 11008,
+  "max_position_embeddings": 128000,
+  "max_window_layers": 70,
+  "minimum_noise_level": 0.001,
+  "model_type": "fast_dvlm",
+  "num_attention_heads": 16,
+  "num_hidden_layers": 36,
+  "num_key_value_heads": 2,
+  "pad_token_id": 151643,
+  "rms_norm_eps": 1e-06,
+  "rope_scaling": {
+    "mrope_section": [
+      16,
+      24,
+      24
+    ],
+    "rope_type": "default",
+    "type": "default"
+  },
+  "rope_theta": 1000000.0,
+  "sliding_window": 32768,
+  "text_config": {
+    "architectures": [
+      "Fast_dVLMForConditionalGeneration"
+    ],
+    "attention_dropout": 0.0,
+    "auto_map": {
+      "AutoConfig": "configuration.Fast_dVLMConfig",
+      "AutoModel": "modeling.Fast_dVLMForConditionalGeneration",
+      "AutoModelForCausalLM": "modeling.Fast_dVLMForConditionalGeneration"
+    },
+    "bd_size": 8,
+    "block_causal_no_dynamic": false,
+    "bos_token_id": 151643,
+    "complementary_mask": true,
+    "dtype": "float32",
+    "entropy_loss": false,
+    "entropy_loss_weight": 1.0,
+    "eos_token_id": 151645,
+    "hidden_act": "silu",
+    "hidden_size": 2048,
+    "image_token_id": null,
+    "initializer_range": 0.02,
+    "intermediate_size": 11008,
+    "layer_types": [
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention",
+      "full_attention"
+    ],
+    "max_position_embeddings": 128000,
+    "max_window_layers": 70,
+    "minimum_noise_level": 0.001,
+    "model_type": "fast_dvlm_for_causal_lm",
+    "num_attention_heads": 16,
+    "num_hidden_layers": 36,
+    "num_key_value_heads": 2,
+    "rms_norm_eps": 1e-06,
+    "rope_scaling": {
+      "mrope_section": [
+        16,
+        24,
+        24
+      ],
+      "rope_type": "default",
+      "type": "default"
+    },
+    "rope_theta": 1000000.0,
+    "sliding_window": null,
+    "tie_word_embeddings": true,
+    "use_block_causal_mask": false,
+    "use_cache": true,
+    "use_sliding_window": false,
+    "video_token_id": null,
+    "vision_end_token_id": 151653,
+    "vision_start_token_id": 151652,
+    "vision_token_id": 151654,
+    "vocab_size": 151936
+  },
+  "transformers_version": "4.57.1",
+  "use_block_causal_mask": true,
+  "use_cache": true,
+  "use_sliding_window": false,
+  "video_token_id": 151656,
+  "vision_config": {
+    "depth": 32,
+    "dtype": "float32",
+    "fullatt_block_indexes": [
+      7,
+      15,
+      23,
+      31
+    ],
+    "hidden_act": "silu",
+    "hidden_size": 1280,
+    "in_channels": 3,
+    "in_chans": 3,
+    "initializer_range": 0.02,
+    "intermediate_size": 3420,
+    "model_type": "fast_dvlm",
+    "num_heads": 16,
+    "out_hidden_size": 2048,
+    "patch_size": 14,
+    "spatial_merge_size": 2,
+    "spatial_patch_size": 14,
+    "temporal_patch_size": 2,
+    "tokens_per_second": 2,
+    "window_size": 112
+  },
+  "vision_end_token_id": 151653,
+  "vision_start_token_id": 151652,
+  "vision_token_id": 151654,
+  "vocab_size": 151936
+}

configuration.py ADDED Viewed

	@@ -0,0 +1,190 @@

+# limitations under the License.
+from transformers.configuration_utils import PretrainedConfig, layer_type_validation
+from transformers.modeling_rope_utils import rope_config_validation
+class Fast_dVLMVisionConfig(PretrainedConfig):
+    model_type = "fast_dvlm"
+    base_config_key = "vision_config"
+    def __init__(
+        self,
+        depth=32,
+        hidden_size=3584,
+        hidden_act="silu",
+        intermediate_size=3420,
+        num_heads=16,
+        in_channels=3,
+        patch_size=14,
+        spatial_merge_size=2,
+        temporal_patch_size=2,
+        tokens_per_second=4,
+        window_size=112,
+        out_hidden_size=3584,
+        fullatt_block_indexes=[7, 15, 23, 31],
+        initializer_range=0.02,
+        **kwargs,
+    ):
+        super().__init__(**kwargs)
+        self.depth = depth
+        self.hidden_size = hidden_size
+        self.hidden_act = hidden_act
+        self.intermediate_size = intermediate_size
+        self.num_heads = num_heads
+        self.in_channels = in_channels
+        self.patch_size = patch_size
+        self.spatial_merge_size = spatial_merge_size
+        self.temporal_patch_size = temporal_patch_size
+        self.tokens_per_second = tokens_per_second
+        self.window_size = window_size
+        self.fullatt_block_indexes = fullatt_block_indexes
+        self.out_hidden_size = out_hidden_size
+        self.initializer_range = initializer_range
+class Fast_dVLMTextConfig(PretrainedConfig):
+    model_type = "fast_dvlm_for_causal_lm"
+    base_config_key = "text_config"
+    keys_to_ignore_at_inference = ["past_key_values"]
+    base_model_tp_plan = {
+        "layers.*.self_attn.q_proj": "colwise",
+        "layers.*.self_attn.k_proj": "colwise",
+        "layers.*.self_attn.v_proj": "colwise",
+        "layers.*.self_attn.o_proj": "rowwise",
+        "layers.*.mlp.gate_proj": "colwise",
+        "layers.*.mlp.up_proj": "colwise",
+        "layers.*.mlp.down_proj": "rowwise",
+    }
+    base_model_pp_plan = {
+        "embed_tokens": (["input_ids"], ["inputs_embeds"]),
+        "layers": (["hidden_states", "attention_mask"], ["hidden_states"]),
+        "norm": (["hidden_states"], ["hidden_states"]),
+    }
+    def __init__(
+        self,
+        vocab_size=152064,
+        hidden_size=8192,
+        intermediate_size=29568,
+        num_hidden_layers=80,
+        num_attention_heads=64,
+        num_key_value_heads=8,
+        hidden_act="silu",
+        max_position_embeddings=32768,
+        initializer_range=0.02,
+        rms_norm_eps=1e-05,
+        use_cache=True,
+        tie_word_embeddings=False,
+        rope_theta=1000000.0,
+        use_sliding_window=False,
+        sliding_window=4096,
+        max_window_layers=80,
+        layer_types=None,
+        attention_dropout=0.0,
+        rope_scaling=None,
+        image_token_id=None,
+        video_token_id=None,
+        bd_size=8,
+        self_spec_inference_mode=None,
+        block_length=None,
+        use_block_causal_mask=False,
+        complementary_mask=True,
+        minimum_noise_level=1e-3,
+        entropy_loss=False,
+        entropy_loss_weight=1.0,
+        block_causal_no_dynamic=False,
+        **kwargs,
+    ):
+        self.vocab_size = vocab_size
+        self.max_position_embeddings = max_position_embeddings
+        self.hidden_size = hidden_size
+        self.intermediate_size = intermediate_size
+        self.num_hidden_layers = num_hidden_layers
+        self.num_attention_heads = num_attention_heads
+        self.use_sliding_window = use_sliding_window
+        self.sliding_window = sliding_window if self.use_sliding_window else None
+        self.max_window_layers = max_window_layers
+        # for backward compatibility
+        if num_key_value_heads is None:
+            num_key_value_heads = num_attention_heads
+        self.num_key_value_heads = num_key_value_heads
+        self.hidden_act = hidden_act
+        self.initializer_range = initializer_range
+        self.rms_norm_eps = rms_norm_eps
+        self.use_cache = use_cache
+        self.rope_theta = rope_theta
+        self.attention_dropout = attention_dropout
+        self.rope_scaling = rope_scaling
+        self.bd_size = bd_size
+        self.layer_types = layer_types
+        self.use_block_causal_mask = use_block_causal_mask
+        self.complementary_mask = complementary_mask
+        self.minimum_noise_level = minimum_noise_level
+        self.entropy_loss = entropy_loss
+        self.entropy_loss_weight = entropy_loss_weight
+        self.block_causal_no_dynamic = block_causal_no_dynamic
+        self.self_spec_inference_mode = self_spec_inference_mode
+        self.block_length = block_length
+        if self.layer_types is None:
+            self.layer_types = [
+                "sliding_attention"
+                if self.sliding_window is not None and i >= self.max_window_layers
+                else "full_attention"
+                for i in range(self.num_hidden_layers)
+            ]
+        layer_type_validation(self.layer_types)
+        # Validate the correctness of rotary position embeddings parameters
+        # BC: if there is a 'type' field, move it to 'rope_type'.
+        # and change type from 'mrope' to 'default' because `mrope` does default RoPE calculations
+        # one can set it to "linear"/"dynamic" etc. to have scaled RoPE
+        # TODO: @raushan update config in the hub
+        if self.rope_scaling is not None and "type" in self.rope_scaling:
+            if self.rope_scaling["type"] == "mrope":
+                self.rope_scaling["type"] = "default"
+            self.rope_scaling["rope_type"] = self.rope_scaling["type"]
+        rope_config_validation(self, ignore_keys={"mrope_section"})
+        self.image_token_id = image_token_id
+        self.video_token_id = video_token_id
+        super().__init__(tie_word_embeddings=tie_word_embeddings, **kwargs)
+class Fast_dVLMConfig(PretrainedConfig):
+    model_type = "fast_dvlm"
+    sub_configs = {"vision_config": Fast_dVLMVisionConfig, "text_config": Fast_dVLMTextConfig}
+    keys_to_ignore_at_inference = ["past_key_values"]
+    def __init__(
+        self,
+        text_config=None,
+        vision_config=None,
+        image_token_id=151655,
+        video_token_id=151656,
+        enable_efficient_vision_embed=False,
+        **kwargs,
+    ):
+        if isinstance(vision_config, dict):
+            self.vision_config = self.sub_configs["vision_config"](**vision_config)
+        elif vision_config is None:
+            self.vision_config = self.sub_configs["vision_config"]()
+        if isinstance(text_config, dict):
+            self.text_config = self.sub_configs["text_config"](**text_config)
+        elif text_config is None:
+            # For BC use all kwargs to init `TextConfig`
+            self.text_config = self.sub_configs["text_config"](**kwargs)
+        self.image_token_id = image_token_id
+        self.video_token_id = video_token_id
+        self.enable_efficient_vision_embed = enable_efficient_vision_embed
+        super().__init__(**kwargs)
+__all__ = ["Fast_dVLMConfig", "Fast_dVLMTextConfig"]

convert_weights.py ADDED Viewed

	@@ -0,0 +1,78 @@

+"""One-time weight conversion: rename checkpoint keys to match Fast_dVLM model layout.
+Checkpoint naming          →  Model naming
+─────────────────────────     ──────────────────────────
+model.layers.*             →  model.language_model.layers.*
+model.embed_tokens.*       →  model.language_model.embed_tokens.*
+model.norm.*               →  model.language_model.norm.*
+visual.*                   →  model.visual.*
+lm_head.*                  →  lm_head.*  (unchanged)
+Usage:
+    python convert_weights.py
+"""
+import json
+import os
+import re
+from pathlib import Path
+from safetensors.torch import load_file, save_file
+def rename_key(key: str) -> str:
+    if key.startswith("visual."):
+        return "model." + key
+    if re.match(r"^model\.(?!language_model\.|visual\.)", key):
+        return re.sub(r"^model\.", "model.language_model.", key)
+    return key
+def main():
+    model_dir = Path(__file__).parent
+    with open(model_dir / "model.safetensors.index.json") as f:
+        index = json.load(f)
+    old_weight_map = index["weight_map"]
+    shard_files = sorted(set(old_weight_map.values()))
+    print(f"Found {len(shard_files)} shard file(s): {shard_files}")
+    new_weight_map = {}
+    for shard_file in shard_files:
+        shard_path = model_dir / shard_file
+        # Resolve symlinks to read from the real file
+        real_path = shard_path.resolve()
+        print(f"\nProcessing {shard_file} (reading from {real_path}) ...")
+        tensors = load_file(str(real_path))
+        renamed = {}
+        changes = 0
+        for old_key, tensor in tensors.items():
+            new_key = rename_key(old_key)
+            if old_key != new_key:
+                changes += 1
+                if changes <= 5:
+                    print(f"  {old_key}  →  {new_key}")
+                elif changes == 6:
+                    print("  ... (more renames omitted)")
+            renamed[new_key] = tensor
+            new_weight_map[new_key] = shard_file
+        # Remove symlink if it is one, then write the real file
+        if shard_path.is_symlink():
+            shard_path.unlink()
+        save_file(renamed, str(shard_path))
+        print(f"  Renamed {changes} keys, saved {len(renamed)} tensors to {shard_file}")
+    index["weight_map"] = new_weight_map
+    with open(model_dir / "model.safetensors.index.json", "w") as f:
+        json.dump(index, f, indent=2)
+    print("\nUpdated model.safetensors.index.json")
+    print("Done!")
+if __name__ == "__main__":
+    main()

generation_config.json ADDED Viewed

	@@ -0,0 +1,11 @@

+{
+  "do_sample": true,
+  "eos_token_id": [
+    151645,
+    151643
+  ],
+  "pad_token_id": 151643,
+  "repetition_penalty": 1.05,
+  "temperature": 1e-06,
+  "transformers_version": "4.57.1"
+}

merges.txt ADDED Viewed

The diff for this file is too large to render. See raw diff

model-00001-of-00002.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:39c53a724fe49244ad33b7bff5116546c2de9cc9812b18d60cf54be407a23c53
+size 4997756632

model-00002-of-00002.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:e0b3bab852d86b93d9f284494e9eaff0bf8963919175e3c237d040f935ff59f9
+size 3133920160

model.safetensors.index.json ADDED Viewed

	@@ -0,0 +1,833 @@

+{
+  "metadata": {
+    "total_parameters": 3754622976,
+    "total_size": 8131575808
+  },
+  "weight_map": {
+    "model.language_model.embed_tokens.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.0.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.0.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.0.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.0.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.0.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.1.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.1.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.1.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.1.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.1.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.1.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.1.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.10.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.10.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.10.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.10.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.10.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.10.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.10.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.10.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.10.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.11.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.11.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.11.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.11.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.11.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.11.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.11.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.11.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.11.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.12.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.12.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.12.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.12.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.12.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.12.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.12.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.12.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.12.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.12.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.12.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.12.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.13.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.13.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.13.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.13.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.13.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.13.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.13.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.13.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.13.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.13.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.13.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.13.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.14.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.14.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.14.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.14.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.14.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.14.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.14.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.14.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.14.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.14.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.14.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.14.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.15.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.15.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.15.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.15.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.15.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.15.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.15.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.15.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.15.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.15.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.16.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.16.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.16.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.16.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.16.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.16.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.16.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.16.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.16.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.16.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.16.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.17.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.17.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.17.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.17.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.17.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.17.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.17.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.17.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.17.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.17.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.17.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.17.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.18.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.18.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.18.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.18.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.18.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.18.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.18.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.18.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.18.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.18.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.18.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.18.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.19.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.19.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.19.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.19.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.19.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.19.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.19.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.19.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.2.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.2.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.2.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.2.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.3.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.3.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.3.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.3.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.3.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.3.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.4.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.4.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.4.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.4.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.4.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.4.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.5.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.5.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.5.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.5.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.5.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.5.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.6.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.6.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.6.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.6.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.6.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.6.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.7.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.7.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.7.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.7.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.7.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.7.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.8.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.8.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.8.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.8.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.8.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.8.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.8.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.8.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.8.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.8.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.9.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.9.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.9.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.9.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.9.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.9.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.9.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.9.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.9.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "model.language_model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.0.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.0.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.0.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.0.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.0.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.0.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.0.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.0.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.0.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.0.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.0.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.1.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.1.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.1.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.1.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.1.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.1.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.1.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.1.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.1.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.1.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.1.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.1.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.10.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.10.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.10.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.10.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.10.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.10.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.10.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.10.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.10.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.10.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.10.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.10.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.11.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.11.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.11.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.11.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.11.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.11.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.11.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.11.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.11.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.11.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.11.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.11.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.12.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.12.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.12.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.12.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.12.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.12.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.12.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.12.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.12.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.12.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.12.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.12.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.13.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.13.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.13.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.13.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.13.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.13.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.13.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.13.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.13.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.13.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.13.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.13.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.14.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.14.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.14.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.14.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.14.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.14.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.14.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.14.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.14.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.14.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.14.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.14.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.15.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.15.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.15.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.15.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.15.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.15.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.15.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.15.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.15.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.15.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.15.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.15.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.16.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.16.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.16.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.16.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.16.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.16.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.16.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.16.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.16.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.16.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.16.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.16.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.17.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.17.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.17.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.17.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.17.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.17.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.17.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.17.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.17.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.17.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.17.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.17.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.18.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.18.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.18.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.18.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.18.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.18.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.18.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.18.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.18.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.18.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.18.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.18.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.19.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.19.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.19.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.19.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.19.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.19.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.19.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.19.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.19.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.19.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.19.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.19.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.2.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.2.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.2.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.2.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.2.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.2.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.2.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.2.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.2.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.2.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.20.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.20.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.20.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.20.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.20.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.20.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.20.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.20.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.20.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.20.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.20.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.20.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.21.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.21.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.21.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.21.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.21.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.21.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.21.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.21.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.21.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.21.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.21.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.21.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.22.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.22.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.22.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.22.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.22.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.22.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.22.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.22.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.22.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.22.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.22.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.22.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.23.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.23.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.23.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.23.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.23.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.23.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.23.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.23.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.23.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.23.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.23.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.23.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.24.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.24.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.24.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.24.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.24.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.24.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.24.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.24.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.24.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.24.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.24.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.24.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.25.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.25.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.25.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.25.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.25.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.25.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.25.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.25.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.25.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.25.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.25.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.25.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.26.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.26.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.26.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.26.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.26.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.26.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.26.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.26.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.26.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.26.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.26.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.26.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.27.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.27.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.27.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.27.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.27.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.27.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.27.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.27.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.27.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.27.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.27.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.27.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.28.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.28.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.28.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.28.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.28.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.28.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.28.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.28.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.28.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.28.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.28.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.28.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.29.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.29.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.29.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.29.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.29.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.29.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.29.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.29.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.29.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.29.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.29.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.29.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.3.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.3.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.3.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.3.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.3.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.3.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.3.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.3.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.3.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.3.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.3.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.3.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.30.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.30.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.30.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.30.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.30.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.30.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.30.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.30.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.30.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.30.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.30.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.30.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.31.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.31.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.31.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.31.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.31.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.31.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.31.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.31.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.31.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.31.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.31.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.31.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.4.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.4.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.4.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.4.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.4.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.4.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.4.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.4.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.4.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.4.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.4.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.4.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.5.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.5.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.5.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.5.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.5.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.5.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.5.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.5.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.5.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.5.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.5.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.5.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.6.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.6.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.6.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.6.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.6.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.6.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.6.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.6.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.6.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.6.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.6.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.6.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.7.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.7.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.7.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.7.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.7.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.7.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.7.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.7.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.7.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.7.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.7.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.7.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.8.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.8.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.8.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.8.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.8.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.8.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.8.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.8.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.8.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.8.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.8.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.8.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.9.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.9.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.9.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.9.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.9.mlp.down_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.9.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.9.mlp.gate_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.9.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.9.mlp.up_proj.bias": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.9.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.9.norm1.weight": "model-00001-of-00002.safetensors",
+    "model.visual.blocks.9.norm2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.merger.ln_q.weight": "model-00001-of-00002.safetensors",
+    "model.visual.merger.mlp.0.bias": "model-00001-of-00002.safetensors",
+    "model.visual.merger.mlp.0.weight": "model-00001-of-00002.safetensors",
+    "model.visual.merger.mlp.2.bias": "model-00001-of-00002.safetensors",
+    "model.visual.merger.mlp.2.weight": "model-00001-of-00002.safetensors",
+    "model.visual.patch_embed.proj.weight": "model-00001-of-00002.safetensors",
+    "lm_head.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.19.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.19.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.19.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.20.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.20.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.20.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.20.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.20.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.20.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.20.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.20.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.20.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.20.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.20.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.20.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.21.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.21.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.21.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.21.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.21.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.21.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.21.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.21.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.21.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.21.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.21.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.21.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.22.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.22.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.22.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.22.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.22.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.22.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.22.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.22.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.22.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.22.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.22.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.22.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.23.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.23.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.23.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.23.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.23.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.23.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.23.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.23.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.23.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.23.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.23.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.23.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.24.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.24.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.24.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.24.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.24.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.24.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.24.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.24.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.24.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.24.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.24.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.24.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.25.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.25.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.25.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.25.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.25.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.25.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.25.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.25.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.25.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.25.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.25.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.25.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.26.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.26.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.26.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.26.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.26.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.26.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.26.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.26.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.26.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.26.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.26.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.26.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.27.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.27.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.27.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.27.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.27.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.27.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.27.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.27.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.27.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.27.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.27.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.27.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.28.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.28.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.28.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.28.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.28.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.28.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.28.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.28.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.28.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.28.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.28.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.28.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.29.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.29.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.29.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.29.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.29.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.29.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.29.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.29.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.29.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.29.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.29.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.29.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.30.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.30.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.30.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.30.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.30.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.30.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.30.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.30.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.30.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.30.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.30.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.30.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.31.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.31.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.31.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.31.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.31.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.31.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.31.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.31.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.31.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.31.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.31.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.31.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.32.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.32.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.32.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.32.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.32.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.32.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.32.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.32.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.32.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.32.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.32.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.32.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.33.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.33.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.33.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.33.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.33.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.33.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.33.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.33.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.33.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.33.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.33.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.33.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.34.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.34.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.34.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.34.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.34.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.34.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.34.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.34.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.34.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.34.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.34.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.34.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.35.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.35.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.35.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.35.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.35.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.35.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.35.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.35.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.35.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.35.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.35.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "model.language_model.layers.35.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "model.language_model.norm.weight": "model-00002-of-00002.safetensors"
+  }
+}

modeling.py ADDED Viewed

The diff for this file is too large to render. See raw diff

preprocessor_config.json ADDED Viewed

	@@ -0,0 +1,19 @@

+{
+  "min_pixels": 3136,
+  "max_pixels": 12845056,
+  "patch_size": 14,
+  "temporal_patch_size": 2,
+  "merge_size": 2,
+  "image_mean": [
+    0.48145466,
+    0.4578275,
+    0.40821073
+  ],
+  "image_std": [
+    0.26862954,
+    0.26130258,
+    0.27577711
+  ],
+  "image_processor_type": "Qwen2VLImageProcessor",
+  "processor_class": "Qwen2_5_VLProcessor"
+}

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,25 @@

+{
+  "additional_special_tokens": [
+    {
+      "content": "|<MASK>|",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false
+    }
+  ],
+  "eos_token": {
+    "content": "<|im_end|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": {
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  }
+}

tokenizer.json ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:cb2105b66192c5a532e2a098dc899df86eca233b4faa48461211e4312c8b3568
+size 11422081

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,204 @@

+{
+  "add_bos_token": false,
+  "add_prefix_space": false,
+  "added_tokens_decoder": {
+    "151643": {
+      "content": "<|endoftext|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151644": {
+      "content": "<|im_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151645": {
+      "content": "<|im_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151646": {
+      "content": "<|object_ref_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151647": {
+      "content": "<|object_ref_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151648": {
+      "content": "<|box_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151649": {
+      "content": "<|box_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151650": {
+      "content": "<|quad_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151651": {
+      "content": "<|quad_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151652": {
+      "content": "<|vision_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151653": {
+      "content": "<|vision_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151654": {
+      "content": "<|vision_pad|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151655": {
+      "content": "<|image_pad|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151656": {
+      "content": "<|video_pad|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151657": {
+      "content": "<tool_call>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151658": {
+      "content": "</tool_call>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151659": {
+      "content": "<|fim_prefix|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151660": {
+      "content": "<|fim_middle|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151661": {
+      "content": "<|fim_suffix|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151662": {
+      "content": "<|fim_pad|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151663": {
+      "content": "<|repo_name|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151664": {
+      "content": "<|file_sep|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151665": {
+      "content": "|<MASK>|",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    }
+  },
+  "additional_special_tokens": [
+    "|<MASK>|"
+  ],
+  "bos_token": null,
+  "clean_up_tokenization_spaces": false,
+  "eos_token": "<|im_end|>",
+  "errors": "replace",
+  "extra_special_tokens": {},
+  "model_max_length": 131072,
+  "pad_token": "<|endoftext|>",
+  "padding_side": "right",
+  "split_special_tokens": false,
+  "tokenizer_class": "Qwen2Tokenizer",
+  "unk_token": null
+}

vocab.json ADDED Viewed

The diff for this file is too large to render. See raw diff