brainworkup commited on
Commit
f1725aa
·
verified ·
1 Parent(s): a32292f

Upload LFM2.5-VL-3B-MLX-oQ8e via oMLX

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
README.md ADDED
@@ -0,0 +1,18 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ library_name: mlx
3
+ tags:
4
+ - mlx
5
+ - oq
6
+ - quantized
7
+ ---
8
+
9
+ # LFM2.5-VL-3B-MLX-oQ8e
10
+
11
+ This model was quantized using [oQ](https://github.com/jundot/omlx) (oMLX v0.6.2) mixed-precision quantization.
12
+
13
+ ## Quantization details
14
+
15
+ - **Model type**: lfm2_vl
16
+ - **Bits**: 8
17
+ - **Group size**: 64
18
+ - **Format**: MLX safetensors
chat_template.jinja ADDED
@@ -0,0 +1,127 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {# <|tool_list_start|> detection hint for mlx_lm #}
2
+
3
+ {{- bos_token -}}
4
+ {%- set preserve_thinking = preserve_thinking | default(false) -%}
5
+
6
+ {%- macro format_arg_value(arg_value) -%}
7
+ {%- if arg_value is string -%}
8
+ {{- "'" + (arg_value | replace("\\", "\\\\") | replace("'", "\\'") | replace("\n", "\\n") | replace("\r", "\\r")) + "'" -}}
9
+ {%- elif arg_value is mapping or arg_value is iterable -%}
10
+ {{- arg_value | tojson -}}
11
+ {%- else -%}
12
+ {{- arg_value | string -}}
13
+ {%- endif -%}
14
+ {%- endmacro -%}
15
+
16
+ {%- macro parse_content(content) -%}
17
+ {%- if content is string -%}
18
+ {{- content -}}
19
+ {%- elif content is mapping -%}
20
+ {{- content | tojson -}}
21
+ {%- elif content is iterable -%}
22
+ {%- set _ns = namespace(result="") -%}
23
+ {%- for item in content -%}
24
+ {%- if item is string -%}
25
+ {%- set _ns.result = _ns.result + item -%}
26
+ {%- elif item is mapping and item.get("type") == "image" -%}
27
+ {%- set _ns.result = _ns.result + "<image>" -%}
28
+ {%- elif item is mapping and item.get("type") == "text" -%}
29
+ {%- set _ns.result = _ns.result + ((item.get("text") or "") | string) -%}
30
+ {%- else -%}
31
+ {%- set _ns.result = _ns.result + (item | tojson) -%}
32
+ {%- endif -%}
33
+ {%- endfor -%}
34
+ {{- _ns.result -}}
35
+ {%- endif -%}
36
+ {%- endmacro -%}
37
+
38
+ {%- macro render_tool_calls(tool_calls) -%}
39
+ {%- set tool_calls_ns = namespace(tool_calls=[]) -%}
40
+ {%- for tool_call in tool_calls -%}
41
+ {%- set func = tool_call["function"] if "function" in tool_call else tool_call -%}
42
+ {%- set func_name = func["name"] -%}
43
+ {%- set func_args = func.get("arguments") -%}
44
+ {%- set args_ns = namespace(arg_strings=[]) -%}
45
+ {%- if func_args is mapping -%}
46
+ {%- for arg_name, arg_value in func_args.items() -%}
47
+ {%- set args_ns.arg_strings = args_ns.arg_strings + [arg_name + "=" + format_arg_value(arg_value)] -%}
48
+ {%- endfor -%}
49
+ {%- elif func_args is string and (func_args | trim) not in ["", "{}", "null"] -%}
50
+ {{- raise_exception("Tool call arguments must be a mapping, got a JSON-encoded string: parse arguments with json.loads() before applying the chat template") -}}
51
+ {%- endif -%}
52
+ {%- set tool_calls_ns.tool_calls = tool_calls_ns.tool_calls + [func_name + "(" + (args_ns.arg_strings | join(", ")) + ")"] -%}
53
+ {%- endfor -%}
54
+ {{- "<|tool_call_start|>[" + (tool_calls_ns.tool_calls | join(", ")) + "]<|tool_call_end|>" -}}
55
+ {%- endmacro -%}
56
+
57
+ {%- set ns = namespace(system_prompt="", last_user_index=-1) -%}
58
+ {%- if messages and messages[0]["role"] == "system" -%}
59
+ {%- if messages[0].get("content") -%}
60
+ {%- set ns.system_prompt = parse_content(messages[0]["content"]) -%}
61
+ {%- endif -%}
62
+ {%- set messages = messages[1:] -%}
63
+ {%- endif -%}
64
+ {%- if tools -%}
65
+ {%- set ns.system_prompt = ns.system_prompt + ("\n" if ns.system_prompt else "") + "List of tools: [" -%}
66
+ {%- for tool in tools -%}
67
+ {%- if tool is not string -%}
68
+ {%- set tool = tool | tojson -%}
69
+ {%- endif -%}
70
+ {%- set ns.system_prompt = ns.system_prompt + tool -%}
71
+ {%- if not loop.last -%}
72
+ {%- set ns.system_prompt = ns.system_prompt + ", " -%}
73
+ {%- endif -%}
74
+ {%- endfor -%}
75
+ {%- set ns.system_prompt = ns.system_prompt + "]" -%}
76
+ {%- endif -%}
77
+ {%- if ns.system_prompt -%}
78
+ {{- "<|im_start|>system\n" + ns.system_prompt + "<|im_end|>\n" -}}
79
+ {%- endif -%}
80
+ {%- for message in messages -%}
81
+ {%- if message["role"] == "user" -%}
82
+ {%- set ns.last_user_index = loop.index0 -%}
83
+ {%- endif -%}
84
+ {%- endfor -%}
85
+ {%- for message in messages -%}
86
+ {{- "<|im_start|>" + message.role + "\n" -}}
87
+ {%- if message.role == "assistant" -%}
88
+ {%- generation -%}
89
+ {%- set keep_thinking = preserve_thinking or loop.index0 > ns.last_user_index -%}
90
+ {%- set thinking = message.thinking or message.reasoning or message.reasoning_content -%}
91
+ {%- set thinking = thinking if thinking is string else "" -%}
92
+ {%- if thinking and keep_thinking -%}
93
+ {{- "<think>" + thinking + "</think>" -}}
94
+ {%- endif -%}
95
+ {%- set _cfm_tag = "CONTINUE_FINAL_MESSAGE_TAG " -%}
96
+ {%- set _has_cfm = false -%}
97
+ {%- set content = "" -%}
98
+ {%- if message.get("content") -%}
99
+ {%- set content = parse_content(message.content) -%}
100
+ {%- endif -%}
101
+ {%- if not keep_thinking and "</think>" in content -%}
102
+ {%- set content = content.split("</think>")[-1] | trim -%}
103
+ {%- endif -%}
104
+ {%- if content.endswith(_cfm_tag) -%}
105
+ {%- set _has_cfm = true -%}
106
+ {%- set _trunc_len = (content | length) - (_cfm_tag | length) -%}
107
+ {%- set content = content[:_trunc_len] -%}
108
+ {%- endif -%}
109
+ {{- content -}}
110
+ {%- if message.tool_calls -%}
111
+ {{- render_tool_calls(message.tool_calls) -}}
112
+ {%- endif -%}
113
+ {%- if _has_cfm -%}
114
+ {{- _cfm_tag -}}
115
+ {%- endif -%}
116
+ {{- "<|im_end|>\n" -}}
117
+ {%- endgeneration -%}
118
+ {%- else %}
119
+ {%- if message.get("content") -%}
120
+ {{- parse_content(message["content"]) -}}
121
+ {%- endif -%}
122
+ {{- "<|im_end|>\n" -}}
123
+ {%- endif %}
124
+ {%- endfor -%}
125
+ {%- if add_generation_prompt -%}
126
+ {{- "<|im_start|>assistant\n" -}}
127
+ {%- endif -%}
config.json ADDED
@@ -0,0 +1,204 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Lfm2VlForConditionalGeneration"
4
+ ],
5
+ "auto_map": {},
6
+ "bos_token_id": 124894,
7
+ "do_image_splitting": true,
8
+ "do_resize": true,
9
+ "downsample_factor": 2,
10
+ "dtype": "bfloat16",
11
+ "encoder_patch_size": 16,
12
+ "eos_token_id": [
13
+ 124900
14
+ ],
15
+ "freeze_language_model": false,
16
+ "freeze_multi_modal_projector": false,
17
+ "freeze_vision_tower": false,
18
+ "generation_config": {
19
+ "_from_model_config": true,
20
+ "bos_token_id": 124894,
21
+ "eos_token_id": [
22
+ 124900
23
+ ],
24
+ "output_attentions": false,
25
+ "output_hidden_states": false,
26
+ "pad_token_id": 124893,
27
+ "transformers_version": "5.8.1",
28
+ "use_cache": true
29
+ },
30
+ "image_token_id": 124907,
31
+ "image_token_index": 124907,
32
+ "keep_trainable_parameters_fp32": true,
33
+ "language_model_lr_multiplier": 1.0,
34
+ "lfm2_attention_backend": "flash_varlen",
35
+ "lfm2_attention_fusion": "fused_linear",
36
+ "lfm2_flash_varlen_blhd_fastpath": false,
37
+ "lfm2_frozen_input_grad_only_linear": true,
38
+ "lfm2_mlp_fusion": "triton_swiglu",
39
+ "lfm2_rmsnorm_fusion": "none",
40
+ "lfm2_short_conv_frozen_recompute_in_proj": 0,
41
+ "lfm2_torch_compile_clone_outputs": false,
42
+ "lfm2_torch_compile_disable_cudagraphs": true,
43
+ "lfm2_torch_compile_dynamic": true,
44
+ "lfm2_torch_compile_fullgraph": false,
45
+ "lfm2_torch_compile_layers": "none",
46
+ "lfm2_torch_compile_mlp": false,
47
+ "lfm2_torch_compile_mode": "reduce-overhead",
48
+ "lfm2_vl_direct_image_merge_by_shape": true,
49
+ "lfm2_vl_forward_dtype": "bf16",
50
+ "lfm2_vl_frozen_vision_chunk_size": 2048,
51
+ "lfm2_vl_grouped_image_projector": true,
52
+ "lfm2_vl_grouped_vision_by_patch_count": false,
53
+ "lfm2_vl_grouped_vision_by_shape": true,
54
+ "lfm2_vl_inplace_image_merge": true,
55
+ "lfm2_vl_siglip_packed_vision": true,
56
+ "lfm2_vl_torch_compile_vision_encoder": true,
57
+ "lfm2_vl_torch_compile_vision_encoder_mode": "whole",
58
+ "lm_head_loss_mask_only": true,
59
+ "max_image_tokens": 256,
60
+ "max_num_patches": 1024,
61
+ "max_pixels_tolerance": 2.0,
62
+ "max_tiles": 10,
63
+ "min_image_tokens": 64,
64
+ "min_tiles": 1,
65
+ "model_type": "lfm2_vl",
66
+ "pad_token_id": 124893,
67
+ "projector_bias": true,
68
+ "projector_hidden_act": "gelu",
69
+ "projector_hidden_size": 2048,
70
+ "projector_lr_multiplier": 1.0,
71
+ "projector_use_layernorm": false,
72
+ "siglip2_layernorm_fusion": "liger",
73
+ "text_config": {
74
+ "block__name_mlp": "parallel_mlp_merged",
75
+ "block_auto_adjust_ff_dim": false,
76
+ "block_dim": 2048,
77
+ "block_ffn_dim_multiplier": 1.0,
78
+ "block_ffn_te_autocast": false,
79
+ "block_ffn_use_quantized_params": false,
80
+ "block_mlp_init_scale": 1.0,
81
+ "block_multiple_of": 256,
82
+ "block_norm_eps": 1e-05,
83
+ "block_out_init_scale": 1.0,
84
+ "block_use_swiglu": true,
85
+ "block_use_xavier_init": true,
86
+ "bos_token_id": 124894,
87
+ "conv_L_cache": 3,
88
+ "conv_bias": false,
89
+ "conv_dim": 2048,
90
+ "conv_use_xavier_init": true,
91
+ "dtype": "bfloat16",
92
+ "eos_token_id": 124900,
93
+ "full_attn_idxs": null,
94
+ "hidden_size": 2048,
95
+ "initializer_range": 0.02,
96
+ "intermediate_size": 10752,
97
+ "layer_types": [
98
+ "conv",
99
+ "conv",
100
+ "full_attention",
101
+ "conv",
102
+ "conv",
103
+ "full_attention",
104
+ "conv",
105
+ "conv",
106
+ "conv",
107
+ "full_attention",
108
+ "conv",
109
+ "conv",
110
+ "conv",
111
+ "full_attention",
112
+ "conv",
113
+ "conv",
114
+ "conv",
115
+ "full_attention",
116
+ "conv",
117
+ "conv",
118
+ "conv",
119
+ "full_attention",
120
+ "conv",
121
+ "conv",
122
+ "full_attention",
123
+ "conv",
124
+ "conv",
125
+ "full_attention",
126
+ "conv",
127
+ "conv"
128
+ ],
129
+ "lfm2_attention_backend": "flash_varlen",
130
+ "lfm2_flash_varlen_blhd_fastpath": false,
131
+ "lfm2_frozen_input_grad_only_linear": true,
132
+ "max_position_embeddings": 128000,
133
+ "mm_config_image_embedder": {
134
+ "activation_checkpointing_layer_stride": 0,
135
+ "attn_implementation": "sdpa",
136
+ "cuda_sync_points": [],
137
+ "downsample": 2,
138
+ "encoder_load_balance": false,
139
+ "hidden_dim": 2048,
140
+ "hidden_state_index": -1,
141
+ "layer_norm": false,
142
+ "max_batch_size": 1024,
143
+ "pretrained_model_name_or_path": "google/siglip2-so400m-patch16-naflex",
144
+ "set_activation_checkpointing": false,
145
+ "use_image_special_tokens": true,
146
+ "use_pooling_head": false,
147
+ "use_slice_special_tokens": false,
148
+ "use_torch_pixel_unshuffle": false
149
+ },
150
+ "model_type": "lfm2",
151
+ "norm_eps": 1e-05,
152
+ "num_attention_heads": 32,
153
+ "num_heads": 32,
154
+ "num_hidden_layers": 30,
155
+ "num_key_value_heads": 8,
156
+ "output_softcap": 0.0,
157
+ "pad_token_id": 124893,
158
+ "rope_parameters": {
159
+ "rope_theta": 1000000.0,
160
+ "rope_type": "default"
161
+ },
162
+ "tie_word_embeddings": true,
163
+ "use_cache": true,
164
+ "use_pos_enc": true,
165
+ "vocab_size": 128000,
166
+ "architectures": [
167
+ "Lfm2ForCausalLM"
168
+ ],
169
+ "tie_embedding": true,
170
+ "rope_theta": 1000000.0,
171
+ "block_ff_dim": 10752
172
+ },
173
+ "tie_word_embeddings": true,
174
+ "tile_size": 512,
175
+ "transformers_version": "5.8.1",
176
+ "use_image_special_tokens": true,
177
+ "use_thumbnail": true,
178
+ "vision_config": {
179
+ "attention_dropout": 0.0,
180
+ "dtype": "bfloat16",
181
+ "hidden_act": "gelu_pytorch_tanh",
182
+ "hidden_size": 1152,
183
+ "intermediate_size": 4304,
184
+ "layer_norm_eps": 1e-06,
185
+ "model_type": "siglip2_vision_model",
186
+ "num_attention_heads": 16,
187
+ "num_channels": 3,
188
+ "num_hidden_layers": 27,
189
+ "num_patches": 256,
190
+ "patch_size": 16,
191
+ "vision_use_head": false
192
+ },
193
+ "vision_tower_lr_multiplier": 1.0,
194
+ "quantization": {
195
+ "group_size": 64,
196
+ "bits": 8,
197
+ "mode": "affine"
198
+ },
199
+ "quantization_config": {
200
+ "group_size": 64,
201
+ "bits": 8,
202
+ "mode": "affine"
203
+ }
204
+ }
generation_config.json ADDED
@@ -0,0 +1,12 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_from_model_config": true,
3
+ "bos_token_id": 124894,
4
+ "eos_token_id": [
5
+ 124900
6
+ ],
7
+ "output_attentions": false,
8
+ "output_hidden_states": false,
9
+ "pad_token_id": 124893,
10
+ "transformers_version": "5.8.1",
11
+ "use_cache": true
12
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:009d47ddf0e46cb9b4f21927d651b52025c214cac55e91b54dea4cfe1fe4a262
3
+ size 3718720615
oq_imatrix_report.json ADDED
@@ -0,0 +1,270 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "enabled": true,
3
+ "cache_path": "/Users/joey/.omlx/models/.oqe_imatrix/LFM2.5-VL-3B-MLX-bf16-2ce80a0c5d89-s128-l512.npz",
4
+ "cache_reused": false,
5
+ "entry_count": 166,
6
+ "calib_dataset": "oqe_code_multilingual",
7
+ "collection": {
8
+ "dataset": "oqe_code_multilingual",
9
+ "requested_samples": 128,
10
+ "seq_length": 512,
11
+ "adaptive": true,
12
+ "adaptive_step_samples": 128,
13
+ "adaptive_max_samples": 1024,
14
+ "available_samples": 1024,
15
+ "micro_batch_size": 20,
16
+ "micro_batches": 7,
17
+ "batch_plan": {
18
+ "micro_batch_size": 20,
19
+ "estimated_sample_bytes": 4194304,
20
+ "capture_budget_bytes": 85014265,
21
+ "system_available_bytes": 14748483584,
22
+ "metal_available_bytes": 30569588942,
23
+ "live_available_bytes": 14748483584,
24
+ "model_bytes": 6247057036,
25
+ "remaining_available_bytes": 8501426548,
26
+ "fits_one_sample": true,
27
+ "hidden_size": 2048,
28
+ "num_experts": 0,
29
+ "top_k": 1,
30
+ "gemma4_state_bytes": 0,
31
+ "num_hidden_layers": 30,
32
+ "num_kv_shared_layers": 0,
33
+ "per_layer_input_size": 0
34
+ },
35
+ "processed_samples": 128,
36
+ "installed_modules": 331,
37
+ "capture_module_classes": {
38
+ "Linear": 331
39
+ },
40
+ "switch_capture_modules": 0,
41
+ "requires_expert_counts": false,
42
+ "coverage_sufficient": true,
43
+ "collection_sufficient": true,
44
+ "coverage": {
45
+ "has_expert_counts": false,
46
+ "expert_modules": 0,
47
+ "total_experts": 0,
48
+ "active_experts": 0,
49
+ "zero_count_experts": 0,
50
+ "active_ratio": 1.0,
51
+ "min_count": 0,
52
+ "p05_count": 0.0,
53
+ "p10_count": 0.0,
54
+ "median_count": 0.0,
55
+ "max_count": 0,
56
+ "min_required_count": 16,
57
+ "required_percentile": 5
58
+ },
59
+ "rounds": [
60
+ {
61
+ "processed_samples": 128,
62
+ "coverage_sufficient": true,
63
+ "collection_sufficient": true,
64
+ "coverage": {
65
+ "has_expert_counts": false,
66
+ "expert_modules": 0,
67
+ "total_experts": 0,
68
+ "active_experts": 0,
69
+ "zero_count_experts": 0,
70
+ "active_ratio": 1.0,
71
+ "min_count": 0,
72
+ "p05_count": 0.0,
73
+ "p10_count": 0.0,
74
+ "median_count": 0.0,
75
+ "max_count": 0,
76
+ "min_required_count": 16,
77
+ "required_percentile": 5
78
+ }
79
+ }
80
+ ]
81
+ },
82
+ "expert_coverage": {
83
+ "has_expert_counts": false,
84
+ "expert_modules": 0,
85
+ "total_experts": 0,
86
+ "active_experts": 0,
87
+ "zero_count_experts": 0,
88
+ "active_ratio": 1.0,
89
+ "min_count": 0,
90
+ "p05_count": 0.0,
91
+ "p10_count": 0.0,
92
+ "median_count": 0.0,
93
+ "max_count": 0,
94
+ "min_required_count": 16,
95
+ "required_percentile": 5
96
+ },
97
+ "applied": [
98
+ "language_model.model.layers.0.conv.in_proj",
99
+ "language_model.model.layers.0.conv.out_proj",
100
+ "language_model.model.layers.0.feed_forward.w1",
101
+ "language_model.model.layers.0.feed_forward.w2",
102
+ "language_model.model.layers.0.feed_forward.w3",
103
+ "language_model.model.layers.1.conv.in_proj",
104
+ "language_model.model.layers.1.conv.out_proj",
105
+ "language_model.model.layers.1.feed_forward.w1",
106
+ "language_model.model.layers.1.feed_forward.w2",
107
+ "language_model.model.layers.1.feed_forward.w3",
108
+ "language_model.model.layers.10.conv.in_proj",
109
+ "language_model.model.layers.10.conv.out_proj",
110
+ "language_model.model.layers.10.feed_forward.w1",
111
+ "language_model.model.layers.10.feed_forward.w2",
112
+ "language_model.model.layers.10.feed_forward.w3",
113
+ "language_model.model.layers.11.conv.in_proj",
114
+ "language_model.model.layers.11.conv.out_proj",
115
+ "language_model.model.layers.11.feed_forward.w1",
116
+ "language_model.model.layers.11.feed_forward.w2",
117
+ "language_model.model.layers.11.feed_forward.w3",
118
+ "language_model.model.layers.12.conv.in_proj",
119
+ "language_model.model.layers.12.conv.out_proj",
120
+ "language_model.model.layers.12.feed_forward.w1",
121
+ "language_model.model.layers.12.feed_forward.w2",
122
+ "language_model.model.layers.12.feed_forward.w3",
123
+ "language_model.model.layers.13.feed_forward.w1",
124
+ "language_model.model.layers.13.feed_forward.w2",
125
+ "language_model.model.layers.13.feed_forward.w3",
126
+ "language_model.model.layers.13.self_attn.k_proj",
127
+ "language_model.model.layers.13.self_attn.out_proj",
128
+ "language_model.model.layers.13.self_attn.q_proj",
129
+ "language_model.model.layers.13.self_attn.v_proj",
130
+ "language_model.model.layers.14.conv.in_proj",
131
+ "language_model.model.layers.14.conv.out_proj",
132
+ "language_model.model.layers.14.feed_forward.w1",
133
+ "language_model.model.layers.14.feed_forward.w2",
134
+ "language_model.model.layers.14.feed_forward.w3",
135
+ "language_model.model.layers.15.conv.in_proj",
136
+ "language_model.model.layers.15.conv.out_proj",
137
+ "language_model.model.layers.15.feed_forward.w1",
138
+ "language_model.model.layers.15.feed_forward.w2",
139
+ "language_model.model.layers.15.feed_forward.w3",
140
+ "language_model.model.layers.16.conv.in_proj",
141
+ "language_model.model.layers.16.conv.out_proj",
142
+ "language_model.model.layers.16.feed_forward.w1",
143
+ "language_model.model.layers.16.feed_forward.w2",
144
+ "language_model.model.layers.16.feed_forward.w3",
145
+ "language_model.model.layers.17.feed_forward.w1",
146
+ "language_model.model.layers.17.feed_forward.w2",
147
+ "language_model.model.layers.17.feed_forward.w3",
148
+ "language_model.model.layers.17.self_attn.k_proj",
149
+ "language_model.model.layers.17.self_attn.out_proj",
150
+ "language_model.model.layers.17.self_attn.q_proj",
151
+ "language_model.model.layers.17.self_attn.v_proj",
152
+ "language_model.model.layers.18.conv.in_proj",
153
+ "language_model.model.layers.18.conv.out_proj",
154
+ "language_model.model.layers.18.feed_forward.w1",
155
+ "language_model.model.layers.18.feed_forward.w2",
156
+ "language_model.model.layers.18.feed_forward.w3",
157
+ "language_model.model.layers.19.conv.in_proj",
158
+ "language_model.model.layers.19.conv.out_proj",
159
+ "language_model.model.layers.19.feed_forward.w1",
160
+ "language_model.model.layers.19.feed_forward.w2",
161
+ "language_model.model.layers.19.feed_forward.w3",
162
+ "language_model.model.layers.2.feed_forward.w1",
163
+ "language_model.model.layers.2.feed_forward.w2",
164
+ "language_model.model.layers.2.feed_forward.w3",
165
+ "language_model.model.layers.2.self_attn.k_proj",
166
+ "language_model.model.layers.2.self_attn.out_proj",
167
+ "language_model.model.layers.2.self_attn.q_proj",
168
+ "language_model.model.layers.2.self_attn.v_proj",
169
+ "language_model.model.layers.20.conv.in_proj",
170
+ "language_model.model.layers.20.conv.out_proj",
171
+ "language_model.model.layers.20.feed_forward.w1",
172
+ "language_model.model.layers.20.feed_forward.w2",
173
+ "language_model.model.layers.20.feed_forward.w3",
174
+ "language_model.model.layers.21.feed_forward.w1",
175
+ "language_model.model.layers.21.feed_forward.w2",
176
+ "language_model.model.layers.21.feed_forward.w3",
177
+ "language_model.model.layers.21.self_attn.k_proj",
178
+ "language_model.model.layers.21.self_attn.out_proj",
179
+ "language_model.model.layers.21.self_attn.q_proj",
180
+ "language_model.model.layers.21.self_attn.v_proj",
181
+ "language_model.model.layers.22.conv.in_proj",
182
+ "language_model.model.layers.22.conv.out_proj",
183
+ "language_model.model.layers.22.feed_forward.w1",
184
+ "language_model.model.layers.22.feed_forward.w2",
185
+ "language_model.model.layers.22.feed_forward.w3",
186
+ "language_model.model.layers.23.conv.in_proj",
187
+ "language_model.model.layers.23.conv.out_proj",
188
+ "language_model.model.layers.23.feed_forward.w1",
189
+ "language_model.model.layers.23.feed_forward.w2",
190
+ "language_model.model.layers.23.feed_forward.w3",
191
+ "language_model.model.layers.24.feed_forward.w1",
192
+ "language_model.model.layers.24.feed_forward.w2",
193
+ "language_model.model.layers.24.feed_forward.w3",
194
+ "language_model.model.layers.24.self_attn.k_proj",
195
+ "language_model.model.layers.24.self_attn.out_proj",
196
+ "language_model.model.layers.24.self_attn.q_proj",
197
+ "language_model.model.layers.24.self_attn.v_proj",
198
+ "language_model.model.layers.25.conv.in_proj",
199
+ "language_model.model.layers.25.conv.out_proj",
200
+ "language_model.model.layers.25.feed_forward.w1",
201
+ "language_model.model.layers.25.feed_forward.w2",
202
+ "language_model.model.layers.25.feed_forward.w3",
203
+ "language_model.model.layers.26.conv.in_proj",
204
+ "language_model.model.layers.26.conv.out_proj",
205
+ "language_model.model.layers.26.feed_forward.w1",
206
+ "language_model.model.layers.26.feed_forward.w2",
207
+ "language_model.model.layers.26.feed_forward.w3",
208
+ "language_model.model.layers.27.feed_forward.w1",
209
+ "language_model.model.layers.27.feed_forward.w2",
210
+ "language_model.model.layers.27.feed_forward.w3",
211
+ "language_model.model.layers.27.self_attn.k_proj",
212
+ "language_model.model.layers.27.self_attn.out_proj",
213
+ "language_model.model.layers.27.self_attn.q_proj",
214
+ "language_model.model.layers.27.self_attn.v_proj",
215
+ "language_model.model.layers.28.conv.in_proj",
216
+ "language_model.model.layers.28.conv.out_proj",
217
+ "language_model.model.layers.28.feed_forward.w1",
218
+ "language_model.model.layers.28.feed_forward.w2",
219
+ "language_model.model.layers.28.feed_forward.w3",
220
+ "language_model.model.layers.29.conv.in_proj",
221
+ "language_model.model.layers.29.conv.out_proj",
222
+ "language_model.model.layers.29.feed_forward.w1",
223
+ "language_model.model.layers.29.feed_forward.w2",
224
+ "language_model.model.layers.29.feed_forward.w3",
225
+ "language_model.model.layers.3.conv.in_proj",
226
+ "language_model.model.layers.3.conv.out_proj",
227
+ "language_model.model.layers.3.feed_forward.w1",
228
+ "language_model.model.layers.3.feed_forward.w2",
229
+ "language_model.model.layers.3.feed_forward.w3",
230
+ "language_model.model.layers.4.conv.in_proj",
231
+ "language_model.model.layers.4.conv.out_proj",
232
+ "language_model.model.layers.4.feed_forward.w1",
233
+ "language_model.model.layers.4.feed_forward.w2",
234
+ "language_model.model.layers.4.feed_forward.w3",
235
+ "language_model.model.layers.5.feed_forward.w1",
236
+ "language_model.model.layers.5.feed_forward.w2",
237
+ "language_model.model.layers.5.feed_forward.w3",
238
+ "language_model.model.layers.5.self_attn.k_proj",
239
+ "language_model.model.layers.5.self_attn.out_proj",
240
+ "language_model.model.layers.5.self_attn.q_proj",
241
+ "language_model.model.layers.5.self_attn.v_proj",
242
+ "language_model.model.layers.6.conv.in_proj",
243
+ "language_model.model.layers.6.conv.out_proj",
244
+ "language_model.model.layers.6.feed_forward.w1",
245
+ "language_model.model.layers.6.feed_forward.w2",
246
+ "language_model.model.layers.6.feed_forward.w3",
247
+ "language_model.model.layers.7.conv.in_proj",
248
+ "language_model.model.layers.7.conv.out_proj",
249
+ "language_model.model.layers.7.feed_forward.w1",
250
+ "language_model.model.layers.7.feed_forward.w2",
251
+ "language_model.model.layers.7.feed_forward.w3",
252
+ "language_model.model.layers.8.conv.in_proj",
253
+ "language_model.model.layers.8.conv.out_proj",
254
+ "language_model.model.layers.8.feed_forward.w1",
255
+ "language_model.model.layers.8.feed_forward.w2",
256
+ "language_model.model.layers.8.feed_forward.w3",
257
+ "language_model.model.layers.9.feed_forward.w1",
258
+ "language_model.model.layers.9.feed_forward.w2",
259
+ "language_model.model.layers.9.feed_forward.w3",
260
+ "language_model.model.layers.9.self_attn.k_proj",
261
+ "language_model.model.layers.9.self_attn.out_proj",
262
+ "language_model.model.layers.9.self_attn.q_proj",
263
+ "language_model.model.layers.9.self_attn.v_proj"
264
+ ],
265
+ "missing": [
266
+ "language_model.model.embed_tokens"
267
+ ],
268
+ "mismatched": [],
269
+ "zero_count_experts": 0
270
+ }
processor_config.json ADDED
@@ -0,0 +1,31 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "image_processor": {
3
+ "do_image_splitting": false,
4
+ "do_normalize": true,
5
+ "do_pad": true,
6
+ "do_rescale": true,
7
+ "do_resize": true,
8
+ "downsample_factor": 2,
9
+ "encoder_patch_size": 16,
10
+ "image_mean": [
11
+ 0.5,
12
+ 0.5,
13
+ 0.5
14
+ ],
15
+ "image_processor_type": "Lfm2VlNumpyImageProcessor",
16
+ "image_std": [
17
+ 0.5,
18
+ 0.5,
19
+ 0.5
20
+ ],
21
+ "max_image_tokens": 256,
22
+ "max_num_patches": 1024,
23
+ "max_pixels_tolerance": 2.0,
24
+ "min_image_tokens": 64,
25
+ "patch_size": 16,
26
+ "rescale_factor": 0.00392156862745098,
27
+ "tile_size": 512,
28
+ "use_thumbnail": false
29
+ },
30
+ "processor_class": "Lfm2VlProcessor"
31
+ }
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8096ecb9f54599d756c8de728a598a340bc1e43c0deb77ddd62456c38349fcee
3
+ size 17905750
tokenizer_config.json ADDED
@@ -0,0 +1,18 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "bos_token": "<|startoftext|>",
4
+ "clean_up_tokenization_spaces": false,
5
+ "eos_token": "<|im_end|>",
6
+ "is_local": true,
7
+ "legacy": false,
8
+ "local_files_only": true,
9
+ "max_length": null,
10
+ "model_max_length": 1000000000000000019884624838656,
11
+ "pad_to_multiple_of": null,
12
+ "pad_token": "<|pad|>",
13
+ "pad_token_type_id": 0,
14
+ "padding_side": "left",
15
+ "processor_class": "Lfm2VlProcessor",
16
+ "tokenizer_class": "TokenizersBackend",
17
+ "use_default_system_prompt": false
18
+ }