3g1l-vaktros commited on Jan 3

Commit

cd4e6d3

verified ·

1 Parent(s): b3fcefe

Initial SynthForm-8B upload

Browse files

Files changed (22) hide show

.gitattributes +1 -0
added_tokens.json +28 -0
chat_template.jinja +120 -0
config.json +67 -0
generation_config.json +14 -0
merges.txt +0 -0
model-00001-of-00004.safetensors +3 -0
model-00002-of-00004.safetensors +3 -0
model-00003-of-00004.safetensors +3 -0
model-00004-of-00004.safetensors +3 -0
model.safetensors.index.json +758 -0
optimizer.pt +3 -0
preprocessor_config.json +39 -0
rng_state.pth +3 -0
scheduler.pt +3 -0
special_tokens_map.json +31 -0
tokenizer.json +3 -0
tokenizer_config.json +241 -0
trainer_state.json +534 -0
training_args.bin +3 -0
video_preprocessor_config.json +41 -0
vocab.json +0 -0

.gitattributes CHANGED Viewed

@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text

 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text
+tokenizer.json filter=lfs diff=lfs merge=lfs -text

added_tokens.json ADDED Viewed

	@@ -0,0 +1,28 @@

+{
+  "</think>": 151668,
+  "</tool_call>": 151658,
+  "</tool_response>": 151666,
+  "<think>": 151667,
+  "<tool_call>": 151657,
+  "<tool_response>": 151665,
+  "<|box_end|>": 151649,
+  "<|box_start|>": 151648,
+  "<|endoftext|>": 151643,
+  "<|file_sep|>": 151664,
+  "<|fim_middle|>": 151660,
+  "<|fim_pad|>": 151662,
+  "<|fim_prefix|>": 151659,
+  "<|fim_suffix|>": 151661,
+  "<|im_end|>": 151645,
+  "<|im_start|>": 151644,
+  "<|image_pad|>": 151655,
+  "<|object_ref_end|>": 151647,
+  "<|object_ref_start|>": 151646,
+  "<|quad_end|>": 151651,
+  "<|quad_start|>": 151650,
+  "<|repo_name|>": 151663,
+  "<|video_pad|>": 151656,
+  "<|vision_end|>": 151653,
+  "<|vision_pad|>": 151654,
+  "<|vision_start|>": 151652
+}

chat_template.jinja ADDED Viewed

	@@ -0,0 +1,120 @@

+{%- if tools %}
+    {{- '<|im_start|>system\n' }}
+    {%- if messages[0].role == 'system' %}
+        {%- if messages[0].content is string %}
+            {{- messages[0].content }}
+        {%- else %}
+            {%- for content in messages[0].content %}
+                {%- if 'text' in content %}
+                    {{- content.text }}
+                {%- endif %}
+            {%- endfor %}
+        {%- endif %}
+        {{- '\n\n' }}
+    {%- endif %}
+    {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within <tools></tools> XML tags:\n<tools>" }}
+    {%- for tool in tools %}
+        {{- "\n" }}
+        {{- tool | tojson }}
+    {%- endfor %}
+    {{- "\n</tools>\n\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\n<tool_call>\n{\"name\": <function-name>, \"arguments\": <args-json-object>}\n</tool_call><|im_end|>\n" }}
+{%- else %}
+    {%- if messages[0].role == 'system' %}
+        {{- '<|im_start|>system\n' }}
+        {%- if messages[0].content is string %}
+            {{- messages[0].content }}
+        {%- else %}
+            {%- for content in messages[0].content %}
+                {%- if 'text' in content %}
+                    {{- content.text }}
+                {%- endif %}
+            {%- endfor %}
+        {%- endif %}
+        {{- '<|im_end|>\n' }}
+    {%- endif %}
+{%- endif %}
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- for message in messages %}
+    {%- if message.role == "user" %}
+        {{- '<|im_start|>' + message.role + '\n' }}
+        {%- if message.content is string %}
+            {{- message.content }}
+        {%- else %}
+            {%- for content in message.content %}
+                {%- if content.type == 'image' or 'image' in content or 'image_url' in content %}
+                    {%- set image_count.value = image_count.value + 1 %}
+                    {%- if add_vision_id %}Picture {{ image_count.value }}: {% endif -%}
+                    <|vision_start|><|image_pad|><|vision_end|>
+                {%- elif content.type == 'video' or 'video' in content %}
+                    {%- set video_count.value = video_count.value + 1 %}
+                    {%- if add_vision_id %}Video {{ video_count.value }}: {% endif -%}
+                    <|vision_start|><|video_pad|><|vision_end|>
+                {%- elif 'text' in content %}
+                    {{- content.text }}
+                {%- endif %}
+            {%- endfor %}
+        {%- endif %}
+        {{- '<|im_end|>\n' }}
+    {%- elif message.role == "assistant" %}
+        {{- '<|im_start|>' + message.role + '\n' }}
+        {%- if message.content is string %}
+            {{- message.content }}
+        {%- else %}
+            {%- for content_item in message.content %}
+                {%- if 'text' in content_item %}
+                    {{- content_item.text }}
+                {%- endif %}
+            {%- endfor %}
+        {%- endif %}
+        {%- if message.tool_calls %}
+            {%- for tool_call in message.tool_calls %}
+                {%- if (loop.first and message.content) or (not loop.first) %}
+                    {{- '\n' }}
+                {%- endif %}
+                {%- if tool_call.function %}
+                    {%- set tool_call = tool_call.function %}
+                {%- endif %}
+                {{- '<tool_call>\n{"name": "' }}
+                {{- tool_call.name }}
+                {{- '", "arguments": ' }}
+                {%- if tool_call.arguments is string %}
+                    {{- tool_call.arguments }}
+                {%- else %}
+                    {{- tool_call.arguments | tojson }}
+                {%- endif %}
+                {{- '}\n</tool_call>' }}
+            {%- endfor %}
+        {%- endif %}
+        {{- '<|im_end|>\n' }}
+    {%- elif message.role == "tool" %}
+        {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
+            {{- '<|im_start|>user' }}
+        {%- endif %}
+        {{- '\n<tool_response>\n' }}
+        {%- if message.content is string %}
+            {{- message.content }}
+        {%- else %}
+            {%- for content in message.content %}
+                {%- if content.type == 'image' or 'image' in content or 'image_url' in content %}
+                    {%- set image_count.value = image_count.value + 1 %}
+                    {%- if add_vision_id %}Picture {{ image_count.value }}: {% endif -%}
+                    <|vision_start|><|image_pad|><|vision_end|>
+                {%- elif content.type == 'video' or 'video' in content %}
+                    {%- set video_count.value = video_count.value + 1 %}
+                    {%- if add_vision_id %}Video {{ video_count.value }}: {% endif -%}
+                    <|vision_start|><|video_pad|><|vision_end|>
+                {%- elif 'text' in content %}
+                    {{- content.text }}
+                {%- endif %}
+            {%- endfor %}
+        {%- endif %}
+        {{- '\n</tool_response>' }}
+        {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
+            {{- '<|im_end|>\n' }}
+        {%- endif %}
+    {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+    {{- '<|im_start|>assistant\n' }}
+{%- endif %}

config.json ADDED Viewed

	@@ -0,0 +1,67 @@

+{
+  "architectures": [
+    "Qwen3VLForConditionalGeneration"
+  ],
+  "dtype": "bfloat16",
+  "eos_token_id": 151645,
+  "image_token_id": 151655,
+  "max_length": null,
+  "model_type": "qwen3_vl",
+  "pad_token_id": 151643,
+  "text_config": {
+    "attention_bias": false,
+    "attention_dropout": 0.0,
+    "bos_token_id": 151643,
+    "dtype": "bfloat16",
+    "eos_token_id": 151645,
+    "head_dim": 128,
+    "hidden_act": "silu",
+    "hidden_size": 4096,
+    "initializer_range": 0.02,
+    "intermediate_size": 12288,
+    "max_position_embeddings": 8192,
+    "model_type": "qwen3_vl_text",
+    "num_attention_heads": 32,
+    "num_hidden_layers": 36,
+    "num_key_value_heads": 8,
+    "rms_norm_eps": 1e-06,
+    "rope_scaling": {
+      "mrope_interleaved": true,
+      "mrope_section": [
+        24,
+        20,
+        20
+      ],
+      "rope_type": "default"
+    },
+    "rope_theta": 5000000,
+    "use_cache": true,
+    "vocab_size": 151936
+  },
+  "tie_word_embeddings": false,
+  "transformers_version": "4.57.1",
+  "video_token_id": 151656,
+  "vision_config": {
+    "deepstack_visual_indexes": [
+      8,
+      16,
+      24
+    ],
+    "depth": 27,
+    "dtype": "bfloat16",
+    "hidden_act": "gelu_pytorch_tanh",
+    "hidden_size": 1152,
+    "in_channels": 3,
+    "initializer_range": 0.02,
+    "intermediate_size": 4304,
+    "model_type": "qwen3_vl",
+    "num_heads": 16,
+    "num_position_embeddings": 2304,
+    "out_hidden_size": 4096,
+    "patch_size": 16,
+    "spatial_merge_size": 2,
+    "temporal_patch_size": 2
+  },
+  "vision_end_token_id": 151653,
+  "vision_start_token_id": 151652
+}

generation_config.json ADDED Viewed

	@@ -0,0 +1,14 @@

+{
+  "do_sample": true,
+  "eos_token_id": [
+    151645,
+    151645,
+    151643
+  ],
+  "max_length": 8192,
+  "pad_token_id": 151643,
+  "temperature": 0.7,
+  "top_k": 20,
+  "top_p": 0.8,
+  "transformers_version": "4.57.1"
+}

merges.txt ADDED Viewed

The diff for this file is too large to render. See raw diff

model-00001-of-00004.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:20a60c9afd3b0b64f7901b53d03b0de4af89f2ec8893766592fe85c3ac6d05dd
+size 4998056552

model-00002-of-00004.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:cbd60b12941af75e905dcab6c74c0152b9593d868273bd524e3540af1e529f1c
+size 4915962464

model-00003-of-00004.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:911e426bd2bac3f24697dfe4b74fe5f185faf1262e1378f2e6cec59167538f1f
+size 4915962496

model-00004-of-00004.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:1dcc860577e794b392a586cec30df0e8d2fd0604a6b4658be24125298f6e1740
+size 2704357976

model.safetensors.index.json ADDED Viewed

	@@ -0,0 +1,758 @@

+{
+  "metadata": {
+    "total_parameters": 8767123696,
+    "total_size": 17534247392
+  },
+  "weight_map": {
+    "lm_head.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.embed_tokens.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.0.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.0.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.0.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.0.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.0.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.0.self_attn.k_norm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.0.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.0.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.0.self_attn.q_norm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.0.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.0.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.1.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.1.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.1.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.1.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.1.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.1.self_attn.k_norm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.1.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.1.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.1.self_attn.q_norm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.1.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.1.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.10.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.10.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.10.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.10.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.10.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.10.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.10.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.10.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.10.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.10.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.10.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.11.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.11.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.11.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.11.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.11.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.11.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.11.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.11.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.11.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.11.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.11.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.12.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.12.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.12.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.12.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.12.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.12.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.12.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.12.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.12.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.12.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.12.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.13.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.13.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.13.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.13.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.13.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.13.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.13.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.13.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.13.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.13.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.13.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.14.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.14.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.14.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.14.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.14.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.14.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.14.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.14.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.14.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.14.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.14.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.15.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.15.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.15.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.15.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.15.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.15.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.15.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.15.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.15.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.15.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.15.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.16.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.16.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.16.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.16.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.16.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.16.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.16.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.16.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.16.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.16.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.16.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.17.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.17.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.17.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.17.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.17.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.17.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.17.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.17.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.17.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.17.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.17.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.18.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.18.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.18.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.18.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.18.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.18.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.18.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.18.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.18.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.18.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.18.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.19.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.19.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.19.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.19.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.19.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.19.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.19.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.19.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.19.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.19.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.19.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.2.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.2.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.2.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.2.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.2.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.2.self_attn.k_norm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.2.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.2.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.2.self_attn.q_norm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.2.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.2.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.20.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.20.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.20.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.20.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.20.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.20.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.20.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.20.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.20.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.20.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.20.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.21.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.21.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.21.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.21.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.21.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.21.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.21.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.21.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.21.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.21.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.22.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.22.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.22.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.22.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.22.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.22.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.22.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.22.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.22.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.22.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.22.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.23.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.23.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.23.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.23.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.23.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.23.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.23.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.23.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.23.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.23.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.23.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.24.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.24.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.24.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.24.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.24.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.24.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.24.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.24.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.24.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.24.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.24.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.25.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.25.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.25.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.25.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.25.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.25.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.25.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.25.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.25.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.25.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.25.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.26.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.26.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.26.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.26.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.26.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.26.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.26.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.26.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.26.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.26.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.26.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.27.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.27.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.27.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.27.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.27.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.27.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.27.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.27.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.27.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.27.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.27.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.28.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.28.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.28.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.28.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.28.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.28.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.28.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.28.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.28.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.28.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.28.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.29.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.29.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.29.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.29.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.29.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.29.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.29.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.29.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.29.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.29.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.29.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.3.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.3.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.3.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.3.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.3.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.3.self_attn.k_norm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.3.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.3.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.3.self_attn.q_norm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.3.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.3.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.30.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.30.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.30.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.30.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.30.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.30.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.30.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.30.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.30.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.30.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.30.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.31.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.31.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.31.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.31.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.31.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.31.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.31.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.31.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.31.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.31.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.31.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.32.input_layernorm.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.32.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.32.mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.32.mlp.up_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.32.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.32.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.32.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.32.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.32.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.32.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.32.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.language_model.layers.33.input_layernorm.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.33.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.33.mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.33.mlp.up_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.33.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.33.self_attn.k_norm.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.33.self_attn.k_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.33.self_attn.o_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.33.self_attn.q_norm.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.33.self_attn.q_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.33.self_attn.v_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.34.input_layernorm.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.34.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.34.mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.34.mlp.up_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.34.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.34.self_attn.k_norm.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.34.self_attn.k_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.34.self_attn.o_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.34.self_attn.q_norm.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.34.self_attn.q_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.34.self_attn.v_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.35.input_layernorm.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.35.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.35.mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.35.mlp.up_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.35.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.35.self_attn.k_norm.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.35.self_attn.k_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.35.self_attn.o_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.35.self_attn.q_norm.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.35.self_attn.q_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.35.self_attn.v_proj.weight": "model-00004-of-00004.safetensors",
+    "model.language_model.layers.4.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.4.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.4.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.4.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.4.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.4.self_attn.k_norm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.4.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.4.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.4.self_attn.q_norm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.4.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.4.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.5.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.5.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.5.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.5.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.5.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.5.self_attn.k_norm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.5.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.5.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.5.self_attn.q_norm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.5.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.5.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.6.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.6.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.6.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.6.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.6.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.6.self_attn.k_norm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.6.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.6.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.6.self_attn.q_norm.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.6.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.6.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.language_model.layers.7.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.7.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.7.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.7.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.7.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.7.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.7.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.7.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.7.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.7.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.7.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.8.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.8.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.8.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.8.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.8.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.8.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.8.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.8.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.8.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.8.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.8.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.9.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.9.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.9.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.9.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.9.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.9.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.9.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.9.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.9.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.9.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.layers.9.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.language_model.norm.weight": "model-00004-of-00004.safetensors",
+    "model.visual.blocks.0.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.0.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.0.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.0.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.0.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.0.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.0.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.0.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.0.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.0.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.0.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.0.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.1.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.1.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.1.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.1.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.1.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.1.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.1.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.1.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.1.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.1.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.1.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.1.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.10.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.10.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.10.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.10.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.10.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.10.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.10.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.10.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.10.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.10.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.10.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.10.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.11.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.11.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.11.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.11.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.11.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.11.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.11.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.11.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.11.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.11.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.11.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.11.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.12.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.12.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.12.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.12.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.12.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.12.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.12.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.12.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.12.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.12.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.12.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.12.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.13.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.13.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.13.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.13.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.13.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.13.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.13.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.13.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.13.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.13.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.13.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.13.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.14.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.14.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.14.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.14.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.14.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.14.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.14.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.14.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.14.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.14.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.14.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.14.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.15.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.15.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.15.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.15.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.15.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.15.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.15.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.15.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.15.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.15.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.15.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.15.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.16.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.16.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.16.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.16.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.16.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.16.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.16.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.16.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.16.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.16.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.16.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.16.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.17.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.17.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.17.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.17.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.17.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.17.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.17.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.17.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.17.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.17.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.17.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.17.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.18.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.18.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.18.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.18.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.18.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.18.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.18.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.18.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.18.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.18.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.18.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.18.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.19.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.19.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.19.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.19.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.19.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.19.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.19.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.19.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.19.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.19.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.19.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.19.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.2.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.2.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.2.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.2.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.2.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.2.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.2.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.2.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.2.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.2.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.2.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.2.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.20.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.20.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.20.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.20.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.20.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.20.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.20.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.20.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.20.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.20.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.20.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.20.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.21.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.21.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.21.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.21.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.21.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.21.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.21.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.21.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.21.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.21.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.21.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.21.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.22.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.22.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.22.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.22.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.22.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.22.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.22.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.22.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.22.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.22.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.22.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.22.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.23.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.23.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.23.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.23.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.23.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.23.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.23.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.23.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.23.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.23.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.23.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.23.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.24.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.24.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.24.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.24.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.24.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.24.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.24.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.24.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.24.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.24.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.24.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.24.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.25.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.25.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.25.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.25.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.25.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.25.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.25.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.25.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.25.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.25.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.25.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.25.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.26.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.26.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.26.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.26.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.26.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.26.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.26.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.26.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.26.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.26.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.26.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.26.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.3.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.3.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.3.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.3.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.3.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.3.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.3.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.3.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.3.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.3.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.3.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.3.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.4.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.4.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.4.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.4.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.4.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.4.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.4.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.4.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.4.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.4.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.4.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.4.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.5.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.5.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.5.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.5.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.5.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.5.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.5.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.5.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.5.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.5.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.5.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.5.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.6.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.6.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.6.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.6.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.6.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.6.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.6.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.6.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.6.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.6.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.6.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.6.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.7.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.7.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.7.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.7.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.7.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.7.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.7.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.7.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.7.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.7.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.7.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.7.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.8.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.8.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.8.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.8.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.8.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.8.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.8.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.8.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.8.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.8.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.8.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.8.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.9.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.9.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.9.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.9.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.9.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.9.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.9.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.9.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.9.norm1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.9.norm1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.9.norm2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.blocks.9.norm2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.deepstack_merger_list.0.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.deepstack_merger_list.0.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.deepstack_merger_list.0.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.deepstack_merger_list.0.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.deepstack_merger_list.0.norm.bias": "model-00001-of-00004.safetensors",
+    "model.visual.deepstack_merger_list.0.norm.weight": "model-00001-of-00004.safetensors",
+    "model.visual.deepstack_merger_list.1.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.deepstack_merger_list.1.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.deepstack_merger_list.1.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.deepstack_merger_list.1.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.deepstack_merger_list.1.norm.bias": "model-00001-of-00004.safetensors",
+    "model.visual.deepstack_merger_list.1.norm.weight": "model-00001-of-00004.safetensors",
+    "model.visual.deepstack_merger_list.2.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.deepstack_merger_list.2.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.deepstack_merger_list.2.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.deepstack_merger_list.2.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.deepstack_merger_list.2.norm.bias": "model-00001-of-00004.safetensors",
+    "model.visual.deepstack_merger_list.2.norm.weight": "model-00001-of-00004.safetensors",
+    "model.visual.merger.linear_fc1.bias": "model-00001-of-00004.safetensors",
+    "model.visual.merger.linear_fc1.weight": "model-00001-of-00004.safetensors",
+    "model.visual.merger.linear_fc2.bias": "model-00001-of-00004.safetensors",
+    "model.visual.merger.linear_fc2.weight": "model-00001-of-00004.safetensors",
+    "model.visual.merger.norm.bias": "model-00001-of-00004.safetensors",
+    "model.visual.merger.norm.weight": "model-00001-of-00004.safetensors",
+    "model.visual.patch_embed.proj.bias": "model-00001-of-00004.safetensors",
+    "model.visual.patch_embed.proj.weight": "model-00001-of-00004.safetensors",
+    "model.visual.pos_embed.weight": "model-00001-of-00004.safetensors"
+  }
+}

optimizer.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:ddeff108118da3c15d392cf5d7d4f70c38e72e884d6dec93026f463d6eac43c2
+size 21541096448

preprocessor_config.json ADDED Viewed

	@@ -0,0 +1,39 @@

+{
+  "crop_size": null,
+  "data_format": "channels_first",
+  "default_to_square": true,
+  "device": null,
+  "disable_grouping": null,
+  "do_center_crop": null,
+  "do_convert_rgb": true,
+  "do_normalize": true,
+  "do_pad": null,
+  "do_rescale": true,
+  "do_resize": true,
+  "image_mean": [
+    0.5,
+    0.5,
+    0.5
+  ],
+  "image_processor_type": "Qwen2VLImageProcessorFast",
+  "image_std": [
+    0.5,
+    0.5,
+    0.5
+  ],
+  "input_data_format": null,
+  "max_pixels": null,
+  "merge_size": 2,
+  "min_pixels": null,
+  "pad_size": null,
+  "patch_size": 16,
+  "processor_class": "Qwen3VLProcessor",
+  "resample": 3,
+  "rescale_factor": 0.00392156862745098,
+  "return_tensors": null,
+  "size": {
+    "longest_edge": 16777216,
+    "shortest_edge": 65536
+  },
+  "temporal_patch_size": 2
+}

rng_state.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:2b66e3cc7c452b707ddac5caf0aa17618afb9bc1a0333600a22c4afb353f3165
+size 14244

scheduler.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:695abc6d3c1337f2f896bea27a403c0a68c07b5184742eb2c7b5c5a70c412dea
+size 1064

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,31 @@

+{
+  "additional_special_tokens": [
+    "<|im_start|>",
+    "<|im_end|>",
+    "<|object_ref_start|>",
+    "<|object_ref_end|>",
+    "<|box_start|>",
+    "<|box_end|>",
+    "<|quad_start|>",
+    "<|quad_end|>",
+    "<|vision_start|>",
+    "<|vision_end|>",
+    "<|vision_pad|>",
+    "<|image_pad|>",
+    "<|video_pad|>"
+  ],
+  "eos_token": {
+    "content": "<|im_end|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": {
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  }
+}

tokenizer.json ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4
+size 11422654

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,241 @@

+{
+  "add_bos_token": false,
+  "add_prefix_space": false,
+  "added_tokens_decoder": {
+    "151643": {
+      "content": "<|endoftext|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151644": {
+      "content": "<|im_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151645": {
+      "content": "<|im_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151646": {
+      "content": "<|object_ref_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151647": {
+      "content": "<|object_ref_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151648": {
+      "content": "<|box_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151649": {
+      "content": "<|box_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151650": {
+      "content": "<|quad_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151651": {
+      "content": "<|quad_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151652": {
+      "content": "<|vision_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151653": {
+      "content": "<|vision_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151654": {
+      "content": "<|vision_pad|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151655": {
+      "content": "<|image_pad|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151656": {
+      "content": "<|video_pad|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151657": {
+      "content": "<tool_call>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151658": {
+      "content": "</tool_call>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151659": {
+      "content": "<|fim_prefix|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151660": {
+      "content": "<|fim_middle|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151661": {
+      "content": "<|fim_suffix|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151662": {
+      "content": "<|fim_pad|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151663": {
+      "content": "<|repo_name|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151664": {
+      "content": "<|file_sep|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151665": {
+      "content": "<tool_response>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151666": {
+      "content": "</tool_response>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151667": {
+      "content": "<think>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151668": {
+      "content": "</think>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    }
+  },
+  "additional_special_tokens": [
+    "<|im_start|>",
+    "<|im_end|>",
+    "<|object_ref_start|>",
+    "<|object_ref_end|>",
+    "<|box_start|>",
+    "<|box_end|>",
+    "<|quad_start|>",
+    "<|quad_end|>",
+    "<|vision_start|>",
+    "<|vision_end|>",
+    "<|vision_pad|>",
+    "<|image_pad|>",
+    "<|video_pad|>"
+  ],
+  "bos_token": null,
+  "chat_template": "{%- if tools %}\n    {{- '<|im_start|>system\\n' }}\n    {%- if messages[0].role == 'system' %}\n        {%- if messages[0].content is string %}\n            {{- messages[0].content }}\n        {%- else %}\n            {%- for content in messages[0].content %}\n                {%- if 'text' in content %}\n                    {{- content.text }}\n                {%- endif %}\n            {%- endfor %}\n        {%- endif %}\n        {{- '\\n\\n' }}\n    {%- endif %}\n    {{- \"# Tools\\n\\nYou may call one or more functions to assist with the user query.\\n\\nYou are provided with function signatures within <tools></tools> XML tags:\\n<tools>\" }}\n    {%- for tool in tools %}\n        {{- \"\\n\" }}\n        {{- tool | tojson }}\n    {%- endfor %}\n    {{- \"\\n</tools>\\n\\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\\n<tool_call>\\n{\\\"name\\\": <function-name>, \\\"arguments\\\": <args-json-object>}\\n</tool_call><|im_end|>\\n\" }}\n{%- else %}\n    {%- if messages[0].role == 'system' %}\n        {{- '<|im_start|>system\\n' }}\n        {%- if messages[0].content is string %}\n            {{- messages[0].content }}\n        {%- else %}\n            {%- for content in messages[0].content %}\n                {%- if 'text' in content %}\n                    {{- content.text }}\n                {%- endif %}\n            {%- endfor %}\n        {%- endif %}\n        {{- '<|im_end|>\\n' }}\n    {%- endif %}\n{%- endif %}\n{%- set image_count = namespace(value=0) %}\n{%- set video_count = namespace(value=0) %}\n{%- for message in messages %}\n    {%- if message.role == \"user\" %}\n        {{- '<|im_start|>' + message.role + '\\n' }}\n        {%- if message.content is string %}\n            {{- message.content }}\n        {%- else %}\n            {%- for content in message.content %}\n                {%- if content.type == 'image' or 'image' in content or 'image_url' in content %}\n                    {%- set image_count.value = image_count.value + 1 %}\n                    {%- if add_vision_id %}Picture {{ image_count.value }}: {% endif -%}\n                    <|vision_start|><|image_pad|><|vision_end|>\n                {%- elif content.type == 'video' or 'video' in content %}\n                    {%- set video_count.value = video_count.value + 1 %}\n                    {%- if add_vision_id %}Video {{ video_count.value }}: {% endif -%}\n                    <|vision_start|><|video_pad|><|vision_end|>\n                {%- elif 'text' in content %}\n                    {{- content.text }}\n                {%- endif %}\n            {%- endfor %}\n        {%- endif %}\n        {{- '<|im_end|>\\n' }}\n    {%- elif message.role == \"assistant\" %}\n        {{- '<|im_start|>' + message.role + '\\n' }}\n        {%- if message.content is string %}\n            {{- message.content }}\n        {%- else %}\n            {%- for content_item in message.content %}\n                {%- if 'text' in content_item %}\n                    {{- content_item.text }}\n                {%- endif %}\n            {%- endfor %}\n        {%- endif %}\n        {%- if message.tool_calls %}\n            {%- for tool_call in message.tool_calls %}\n                {%- if (loop.first and message.content) or (not loop.first) %}\n                    {{- '\\n' }}\n                {%- endif %}\n                {%- if tool_call.function %}\n                    {%- set tool_call = tool_call.function %}\n                {%- endif %}\n                {{- '<tool_call>\\n{\"name\": \"' }}\n                {{- tool_call.name }}\n                {{- '\", \"arguments\": ' }}\n                {%- if tool_call.arguments is string %}\n                    {{- tool_call.arguments }}\n                {%- else %}\n                    {{- tool_call.arguments | tojson }}\n                {%- endif %}\n                {{- '}\\n</tool_call>' }}\n            {%- endfor %}\n        {%- endif %}\n        {{- '<|im_end|>\\n' }}\n    {%- elif message.role == \"tool\" %}\n        {%- if loop.first or (messages[loop.index0 - 1].role != \"tool\") %}\n            {{- '<|im_start|>user' }}\n        {%- endif %}\n        {{- '\\n<tool_response>\\n' }}\n        {%- if message.content is string %}\n            {{- message.content }}\n        {%- else %}\n            {%- for content in message.content %}\n                {%- if content.type == 'image' or 'image' in content or 'image_url' in content %}\n                    {%- set image_count.value = image_count.value + 1 %}\n                    {%- if add_vision_id %}Picture {{ image_count.value }}: {% endif -%}\n                    <|vision_start|><|image_pad|><|vision_end|>\n                {%- elif content.type == 'video' or 'video' in content %}\n                    {%- set video_count.value = video_count.value + 1 %}\n                    {%- if add_vision_id %}Video {{ video_count.value }}: {% endif -%}\n                    <|vision_start|><|video_pad|><|vision_end|>\n                {%- elif 'text' in content %}\n                    {{- content.text }}\n                {%- endif %}\n            {%- endfor %}\n        {%- endif %}\n        {{- '\\n</tool_response>' }}\n        {%- if loop.last or (messages[loop.index0 + 1].role != \"tool\") %}\n            {{- '<|im_end|>\\n' }}\n        {%- endif %}\n    {%- endif %}\n{%- endfor %}\n{%- if add_generation_prompt %}\n    {{- '<|im_start|>assistant\\n' }}\n{%- endif %}\n",
+  "clean_up_tokenization_spaces": false,
+  "eos_token": "<|im_end|>",
+  "errors": "replace",
+  "extra_special_tokens": {},
+  "model_max_length": 262144,
+  "pad_token": "<|endoftext|>",
+  "processor_class": "Qwen3VLProcessor",
+  "split_special_tokens": false,
+  "tokenizer_class": "Qwen2Tokenizer",
+  "unk_token": null
+}

trainer_state.json ADDED Viewed

	@@ -0,0 +1,534 @@

+{
+  "best_global_step": null,
+  "best_metric": null,
+  "best_model_checkpoint": null,
+  "epoch": 1.4624954262714964,
+  "eval_steps": 500,
+  "global_step": 500,
+  "is_hyper_param_search": false,
+  "is_local_process_zero": true,
+  "is_world_process_zero": true,
+  "log_history": [
+    {
+      "entropy": 0.5018481526523828,
+      "epoch": 0.029271862422246615,
+      "grad_norm": 53.5,
+      "learning_rate": 1.8000000000000001e-06,
+      "loss": 0.9524,
+      "mean_token_accuracy": 0.8672725282609463,
+      "num_tokens": 178219.0,
+      "step": 10
+    },
+    {
+      "entropy": 0.4691743772476912,
+      "epoch": 0.05854372484449323,
+      "grad_norm": 213.0,
+      "learning_rate": 3.8000000000000005e-06,
+      "loss": 0.7404,
+      "mean_token_accuracy": 0.8850074164569378,
+      "num_tokens": 364483.0,
+      "step": 20
+    },
+    {
+      "entropy": 0.4770399186760187,
+      "epoch": 0.08781558726673985,
+      "grad_norm": 15.5,
+      "learning_rate": 5.8e-06,
+      "loss": 0.4118,
+      "mean_token_accuracy": 0.9136587515473366,
+      "num_tokens": 544552.0,
+      "step": 30
+    },
+    {
+      "entropy": 0.4692947888746858,
+      "epoch": 0.11708744968898646,
+      "grad_norm": 11.9375,
+      "learning_rate": 7.800000000000002e-06,
+      "loss": 0.2463,
+      "mean_token_accuracy": 0.9470756828784943,
+      "num_tokens": 717853.0,
+      "step": 40
+    },
+    {
+      "entropy": 0.4310881284996867,
+      "epoch": 0.14635931211123307,
+      "grad_norm": 37.75,
+      "learning_rate": 9.800000000000001e-06,
+      "loss": 0.1406,
+      "mean_token_accuracy": 0.967316172271967,
+      "num_tokens": 892769.0,
+      "step": 50
+    },
+    {
+      "entropy": 0.47044283971190454,
+      "epoch": 0.1756311745334797,
+      "grad_norm": 5.90625,
+      "learning_rate": 9.997902051783373e-06,
+      "loss": 0.1637,
+      "mean_token_accuracy": 0.9594391070306301,
+      "num_tokens": 1062544.0,
+      "step": 60
+    },
+    {
+      "entropy": 0.4564293924719095,
+      "epoch": 0.20490303695572631,
+      "grad_norm": 8.8125,
+      "learning_rate": 9.990652145366113e-06,
+      "loss": 0.1078,
+      "mean_token_accuracy": 0.9732326805591583,
+      "num_tokens": 1238635.0,
+      "step": 70
+    },
+    {
+      "entropy": 0.48633960634469986,
+      "epoch": 0.23417489937797292,
+      "grad_norm": 3.296875,
+      "learning_rate": 9.978231889316302e-06,
+      "loss": 0.1079,
+      "mean_token_accuracy": 0.9725632824003696,
+      "num_tokens": 1422527.0,
+      "step": 80
+    },
+    {
+      "entropy": 0.5045951271429658,
+      "epoch": 0.26344676180021953,
+      "grad_norm": 4.96875,
+      "learning_rate": 9.960654151103846e-06,
+      "loss": 0.1129,
+      "mean_token_accuracy": 0.971237526088953,
+      "num_tokens": 1604412.0,
+      "step": 90
+    },
+    {
+      "entropy": 0.5754191160202027,
+      "epoch": 0.29271862422246614,
+      "grad_norm": 3.546875,
+      "learning_rate": 9.937937141385323e-06,
+      "loss": 0.1192,
+      "mean_token_accuracy": 0.9681814014911652,
+      "num_tokens": 1785808.0,
+      "step": 100
+    },
+    {
+      "entropy": 0.6233104987069964,
+      "epoch": 0.32199048664471275,
+      "grad_norm": 16.875,
+      "learning_rate": 9.91010439513761e-06,
+      "loss": 0.1532,
+      "mean_token_accuracy": 0.9626872226595878,
+      "num_tokens": 1963662.0,
+      "step": 110
+    },
+    {
+      "entropy": 0.592149405926466,
+      "epoch": 0.3512623490669594,
+      "grad_norm": 7.3125,
+      "learning_rate": 9.87718474727549e-06,
+      "loss": 0.1171,
+      "mean_token_accuracy": 0.9693892918527126,
+      "num_tokens": 2138861.0,
+      "step": 120
+    },
+    {
+      "entropy": 0.5508204206824303,
+      "epoch": 0.380534211489206,
+      "grad_norm": 11.875,
+      "learning_rate": 9.839212302778493e-06,
+      "loss": 0.0928,
+      "mean_token_accuracy": 0.9756750777363777,
+      "num_tokens": 2314376.0,
+      "step": 130
+    },
+    {
+      "entropy": 0.5581824988126755,
+      "epoch": 0.40980607391145263,
+      "grad_norm": 5.4375,
+      "learning_rate": 9.796226401357884e-06,
+      "loss": 0.1213,
+      "mean_token_accuracy": 0.9697595350444317,
+      "num_tokens": 2494288.0,
+      "step": 140
+    },
+    {
+      "entropy": 0.5680775640532374,
+      "epoch": 0.43907793633369924,
+      "grad_norm": 3.390625,
+      "learning_rate": 9.748271576700476e-06,
+      "loss": 0.1081,
+      "mean_token_accuracy": 0.9728541418910026,
+      "num_tokens": 2682554.0,
+      "step": 150
+    },
+    {
+      "entropy": 0.5555528217926622,
+      "epoch": 0.46834979875594585,
+      "grad_norm": 28.875,
+      "learning_rate": 9.69539751033141e-06,
+      "loss": 0.1001,
+      "mean_token_accuracy": 0.972498145699501,
+      "num_tokens": 2855437.0,
+      "step": 160
+    },
+    {
+      "entropy": 0.5888866983354092,
+      "epoch": 0.49762166117819245,
+      "grad_norm": 6.0625,
+      "learning_rate": 9.637658980143771e-06,
+      "loss": 0.091,
+      "mean_token_accuracy": 0.9761380776762962,
+      "num_tokens": 3034970.0,
+      "step": 170
+    },
+    {
+      "entropy": 0.6018309678882361,
+      "epoch": 0.5268935236004391,
+      "grad_norm": 5.09375,
+      "learning_rate": 9.575115803648303e-06,
+      "loss": 0.0946,
+      "mean_token_accuracy": 0.9742907010018825,
+      "num_tokens": 3208412.0,
+      "step": 180
+    },
+    {
+      "entropy": 0.6276524242013692,
+      "epoch": 0.5561653860226857,
+      "grad_norm": 2.75,
+      "learning_rate": 9.507832776002069e-06,
+      "loss": 0.0982,
+      "mean_token_accuracy": 0.9730873227119445,
+      "num_tokens": 3395494.0,
+      "step": 190
+    },
+    {
+      "entropy": 0.6615390798076988,
+      "epoch": 0.5854372484449323,
+      "grad_norm": 4.46875,
+      "learning_rate": 9.43587960288023e-06,
+      "loss": 0.1392,
+      "mean_token_accuracy": 0.965959795564413,
+      "num_tokens": 3573674.0,
+      "step": 200
+    },
+    {
+      "entropy": 0.6626946024596692,
+      "epoch": 0.6147091108671789,
+      "grad_norm": 20.125,
+      "learning_rate": 9.359330828260477e-06,
+      "loss": 0.1367,
+      "mean_token_accuracy": 0.9644782721996308,
+      "num_tokens": 3749797.0,
+      "step": 210
+    },
+    {
+      "entropy": 0.6417636029422283,
+      "epoch": 0.6439809732894255,
+      "grad_norm": 7.71875,
+      "learning_rate": 9.278265757194983e-06,
+      "loss": 0.0971,
+      "mean_token_accuracy": 0.9736645758152008,
+      "num_tokens": 3927226.0,
+      "step": 220
+    },
+    {
+      "entropy": 0.6675109906122089,
+      "epoch": 0.6732528357116722,
+      "grad_norm": 20.375,
+      "learning_rate": 9.1927683736498e-06,
+      "loss": 0.1292,
+      "mean_token_accuracy": 0.9648571148514747,
+      "num_tokens": 4107295.0,
+      "step": 230
+    },
+    {
+      "entropy": 0.6541570518165827,
+      "epoch": 0.7025246981339188,
+      "grad_norm": 11.875,
+      "learning_rate": 9.102927253496926e-06,
+      "loss": 0.1156,
+      "mean_token_accuracy": 0.9699708484113216,
+      "num_tokens": 4286908.0,
+      "step": 240
+    },
+    {
+      "entropy": 0.6058449555188418,
+      "epoch": 0.7317965605561654,
+      "grad_norm": 6.78125,
+      "learning_rate": 9.008835472749085e-06,
+      "loss": 0.0923,
+      "mean_token_accuracy": 0.9739408694207669,
+      "num_tokens": 4467461.0,
+      "step": 250
+    },
+    {
+      "entropy": 0.6178297221660614,
+      "epoch": 0.761068422978412,
+      "grad_norm": 5.25,
+      "learning_rate": 8.910590511132339e-06,
+      "loss": 0.0817,
+      "mean_token_accuracy": 0.9773662097752094,
+      "num_tokens": 4646737.0,
+      "step": 260
+    },
+    {
+      "entropy": 0.6829405203461647,
+      "epoch": 0.7903402854006586,
+      "grad_norm": 3.40625,
+      "learning_rate": 8.808294151096436e-06,
+      "loss": 0.092,
+      "mean_token_accuracy": 0.9755907997488975,
+      "num_tokens": 4821010.0,
+      "step": 270
+    },
+    {
+      "entropy": 0.6392896398901939,
+      "epoch": 0.8196121478229053,
+      "grad_norm": 4.65625,
+      "learning_rate": 8.702052372367496e-06,
+      "loss": 0.0871,
+      "mean_token_accuracy": 0.9771530278027057,
+      "num_tokens": 4999440.0,
+      "step": 280
+    },
+    {
+      "entropy": 0.7133271377533674,
+      "epoch": 0.8488840102451518,
+      "grad_norm": 12.3125,
+      "learning_rate": 8.591975242152293e-06,
+      "loss": 0.1063,
+      "mean_token_accuracy": 0.9715632744133472,
+      "num_tokens": 5171265.0,
+      "step": 290
+    },
+    {
+      "entropy": 0.6667846977710724,
+      "epoch": 0.8781558726673985,
+      "grad_norm": 3.71875,
+      "learning_rate": 8.478176801107872e-06,
+      "loss": 0.1216,
+      "mean_token_accuracy": 0.9661677174270153,
+      "num_tokens": 5338761.0,
+      "step": 300
+    },
+    {
+      "entropy": 0.7178533673286438,
+      "epoch": 0.907427735089645,
+      "grad_norm": 8.6875,
+      "learning_rate": 8.360774945194666e-06,
+      "loss": 0.1041,
+      "mean_token_accuracy": 0.9715993881225586,
+      "num_tokens": 5515062.0,
+      "step": 310
+    },
+    {
+      "entropy": 0.7344689719378948,
+      "epoch": 0.9366995975118917,
+      "grad_norm": 3.5,
+      "learning_rate": 8.239891303535457e-06,
+      "loss": 0.0974,
+      "mean_token_accuracy": 0.9735251195728779,
+      "num_tokens": 5696911.0,
+      "step": 320
+    },
+    {
+      "entropy": 0.7144436400383711,
+      "epoch": 0.9659714599341384,
+      "grad_norm": 6.15625,
+      "learning_rate": 8.1156511124068e-06,
+      "loss": 0.0817,
+      "mean_token_accuracy": 0.9768537104129791,
+      "num_tokens": 5869301.0,
+      "step": 330
+    },
+    {
+      "entropy": 0.6643564581871033,
+      "epoch": 0.9952433223563849,
+      "grad_norm": 7.25,
+      "learning_rate": 7.988183085493362e-06,
+      "loss": 0.1041,
+      "mean_token_accuracy": 0.971296526491642,
+      "num_tokens": 6044424.0,
+      "step": 340
+    },
+    {
+      "entropy": 0.6510233766846842,
+      "epoch": 1.0234174899377972,
+      "grad_norm": 9.375,
+      "learning_rate": 7.85761928053969e-06,
+      "loss": 0.0824,
+      "mean_token_accuracy": 0.9768819661883564,
+      "num_tokens": 6217116.0,
+      "step": 350
+    },
+    {
+      "entropy": 0.6857636030763388,
+      "epoch": 1.0526893523600438,
+      "grad_norm": 5.0625,
+      "learning_rate": 7.72409496253747e-06,
+      "loss": 0.0949,
+      "mean_token_accuracy": 0.9749896325170994,
+      "num_tokens": 6387512.0,
+      "step": 360
+    },
+    {
+      "entropy": 0.6679304147139191,
+      "epoch": 1.0819612147822906,
+      "grad_norm": 2.8125,
+      "learning_rate": 7.5877484635900876e-06,
+      "loss": 0.0958,
+      "mean_token_accuracy": 0.9742133662104606,
+      "num_tokens": 6573367.0,
+      "step": 370
+    },
+    {
+      "entropy": 0.6774611625820398,
+      "epoch": 1.1112330772045371,
+      "grad_norm": 12.9375,
+      "learning_rate": 7.448721039599616e-06,
+      "loss": 0.1029,
+      "mean_token_accuracy": 0.972662803530693,
+      "num_tokens": 6751810.0,
+      "step": 380
+    },
+    {
+      "entropy": 0.6481307320296764,
+      "epoch": 1.1405049396267837,
+      "grad_norm": 19.375,
+      "learning_rate": 7.307156723924742e-06,
+      "loss": 0.0842,
+      "mean_token_accuracy": 0.9763316512107849,
+      "num_tokens": 6940710.0,
+      "step": 390
+    },
+    {
+      "entropy": 0.6626342430710792,
+      "epoch": 1.1697768020490305,
+      "grad_norm": 3.640625,
+      "learning_rate": 7.1632021781612305e-06,
+      "loss": 0.0834,
+      "mean_token_accuracy": 0.9770378485321999,
+      "num_tokens": 7120616.0,
+      "step": 400
+    },
+    {
+      "entropy": 0.689614738151431,
+      "epoch": 1.199048664471277,
+      "grad_norm": 7.59375,
+      "learning_rate": 7.017006540199501e-06,
+      "loss": 0.0962,
+      "mean_token_accuracy": 0.9729363858699799,
+      "num_tokens": 7295346.0,
+      "step": 410
+    },
+    {
+      "entropy": 0.731178673915565,
+      "epoch": 1.2283205268935236,
+      "grad_norm": 56.25,
+      "learning_rate": 6.8687212697167685e-06,
+      "loss": 0.1229,
+      "mean_token_accuracy": 0.9676964573562146,
+      "num_tokens": 7473599.0,
+      "step": 420
+    },
+    {
+      "entropy": 0.6449350535869598,
+      "epoch": 1.25759238931577,
+      "grad_norm": 15.5,
+      "learning_rate": 6.718499991263776e-06,
+      "loss": 0.0794,
+      "mean_token_accuracy": 0.9775209553539753,
+      "num_tokens": 7666324.0,
+      "step": 430
+    },
+    {
+      "entropy": 0.6695770636200905,
+      "epoch": 1.2868642517380169,
+      "grad_norm": 10.4375,
+      "learning_rate": 6.566498335108719e-06,
+      "loss": 0.1376,
+      "mean_token_accuracy": 0.9635490447282791,
+      "num_tokens": 7842308.0,
+      "step": 440
+    },
+    {
+      "entropy": 0.6306964188814164,
+      "epoch": 1.3161361141602634,
+      "grad_norm": 13.4375,
+      "learning_rate": 6.412873776003224e-06,
+      "loss": 0.0804,
+      "mean_token_accuracy": 0.9786465026438236,
+      "num_tokens": 8027201.0,
+      "step": 450
+    },
+    {
+      "entropy": 0.6525185916572809,
+      "epoch": 1.34540797658251,
+      "grad_norm": 9.4375,
+      "learning_rate": 6.2577854700374326e-06,
+      "loss": 0.073,
+      "mean_token_accuracy": 0.9785589501261711,
+      "num_tokens": 8198350.0,
+      "step": 460
+    },
+    {
+      "entropy": 0.6055996913462878,
+      "epoch": 1.3746798390047568,
+      "grad_norm": 4.375,
+      "learning_rate": 6.101394089753215e-06,
+      "loss": 0.091,
+      "mean_token_accuracy": 0.9752737417817116,
+      "num_tokens": 8384460.0,
+      "step": 470
+    },
+    {
+      "entropy": 0.6333212267607451,
+      "epoch": 1.4039517014270033,
+      "grad_norm": 4.25,
+      "learning_rate": 5.9438616576863085e-06,
+      "loss": 0.0817,
+      "mean_token_accuracy": 0.9772769220173358,
+      "num_tokens": 8555391.0,
+      "step": 480
+    },
+    {
+      "entropy": 0.6566504757851362,
+      "epoch": 1.4332235638492499,
+      "grad_norm": 6.34375,
+      "learning_rate": 5.785351378509875e-06,
+      "loss": 0.0844,
+      "mean_token_accuracy": 0.9760506093502045,
+      "num_tokens": 8734253.0,
+      "step": 490
+    },
+    {
+      "entropy": 0.6695024535059929,
+      "epoch": 1.4624954262714964,
+      "grad_norm": 11.9375,
+      "learning_rate": 5.626027469953345e-06,
+      "loss": 0.1066,
+      "mean_token_accuracy": 0.9704300530254841,
+      "num_tokens": 8910777.0,
+      "step": 500
+    }
+  ],
+  "logging_steps": 10,
+  "max_steps": 1026,
+  "num_input_tokens_seen": 0,
+  "num_train_epochs": 3,
+  "save_steps": 100,
+  "stateful_callbacks": {
+    "TrainerControl": {
+      "args": {
+        "should_epoch_stop": false,
+        "should_evaluate": false,
+        "should_log": false,
+        "should_save": true,
+        "should_training_stop": false
+      },
+      "attributes": {}
+    }
+  },
+  "total_flos": 4.353167433816843e+17,
+  "train_batch_size": 1,
+  "trial_name": null,
+  "trial_params": null
+}

training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:8bf9d7f4c5883f4caa37390e8adc4eb0802edcfe7cd685261d66188794f70edd
+size 5816

video_preprocessor_config.json ADDED Viewed

	@@ -0,0 +1,41 @@

+{
+  "crop_size": null,
+  "data_format": "channels_first",
+  "default_to_square": true,
+  "device": null,
+  "do_center_crop": null,
+  "do_convert_rgb": true,
+  "do_normalize": true,
+  "do_rescale": true,
+  "do_resize": true,
+  "do_sample_frames": true,
+  "fps": 2,
+  "image_mean": [
+    0.5,
+    0.5,
+    0.5
+  ],
+  "image_std": [
+    0.5,
+    0.5,
+    0.5
+  ],
+  "input_data_format": null,
+  "max_frames": 768,
+  "merge_size": 2,
+  "min_frames": 4,
+  "num_frames": null,
+  "pad_size": null,
+  "patch_size": 16,
+  "processor_class": "Qwen3VLProcessor",
+  "resample": 3,
+  "rescale_factor": 0.00392156862745098,
+  "return_metadata": false,
+  "size": {
+    "longest_edge": 25165824,
+    "shortest_edge": 4096
+  },
+  "temporal_patch_size": 2,
+  "video_metadata": null,
+  "video_processor_type": "Qwen3VLVideoProcessor"
+}

vocab.json ADDED Viewed

The diff for this file is too large to render. See raw diff