ivanfioravanti commited on 7 days ago

Commit

a342e4b

verified ·

1 Parent(s): 578d548

Upload folder using huggingface_hub

Browse files

This view is limited to 50 files because it contains too many changes. See raw diff

Files changed (50) hide show

.gitattributes +1 -0
README.md +31 -0
added_tokens.json +63 -0
chat_template.jinja +247 -0
config.json +875 -0
configuration_minimax_m3_vl.py +111 -0
generation_config.json +8 -0
image_processor.py +223 -0
model-00001-of-00058.safetensors +3 -0
model-00002-of-00058.safetensors +3 -0
model-00003-of-00058.safetensors +3 -0
model-00004-of-00058.safetensors +3 -0
model-00005-of-00058.safetensors +3 -0
model-00006-of-00058.safetensors +3 -0
model-00007-of-00058.safetensors +3 -0
model-00008-of-00058.safetensors +3 -0
model-00009-of-00058.safetensors +3 -0
model-00010-of-00058.safetensors +3 -0
model-00011-of-00058.safetensors +3 -0
model-00012-of-00058.safetensors +3 -0
model-00013-of-00058.safetensors +3 -0
model-00014-of-00058.safetensors +3 -0
model-00015-of-00058.safetensors +3 -0
model-00016-of-00058.safetensors +3 -0
model-00017-of-00058.safetensors +3 -0
model-00018-of-00058.safetensors +3 -0
model-00019-of-00058.safetensors +3 -0
model-00020-of-00058.safetensors +3 -0
model-00021-of-00058.safetensors +3 -0
model-00022-of-00058.safetensors +3 -0
model-00023-of-00058.safetensors +3 -0
model-00024-of-00058.safetensors +3 -0
model-00025-of-00058.safetensors +3 -0
model-00026-of-00058.safetensors +3 -0
model-00027-of-00058.safetensors +3 -0
model-00028-of-00058.safetensors +3 -0
model-00029-of-00058.safetensors +3 -0
model-00030-of-00058.safetensors +3 -0
model-00031-of-00058.safetensors +3 -0
model-00032-of-00058.safetensors +3 -0
model-00033-of-00058.safetensors +3 -0
model-00034-of-00058.safetensors +3 -0
model-00035-of-00058.safetensors +3 -0
model-00036-of-00058.safetensors +3 -0
model-00037-of-00058.safetensors +3 -0
model-00038-of-00058.safetensors +3 -0
model-00039-of-00058.safetensors +3 -0
model-00040-of-00058.safetensors +3 -0
model-00041-of-00058.safetensors +3 -0
model-00042-of-00058.safetensors +3 -0

.gitattributes CHANGED Viewed

@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text

 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text
+tokenizer.json filter=lfs diff=lfs merge=lfs -text

README.md ADDED Viewed

	@@ -0,0 +1,31 @@

+---
+pipeline_tag: image-text-to-text
+license: other
+license_name: minimax-community
+license_link: LICENSE
+library_name: mlx
+tags:
+- multimodal
+- moe
+- agent
+- coding
+- video
+- mlx
+base_model: MiniMaxAI/MiniMax-M3
+---
+# mlx-community/MiniMax-M3-4bit
+This model was converted to MLX format from [`MiniMaxAI/MiniMax-M3`](https://huggingface.co/MiniMaxAI/MiniMax-M3)
+using mlx-vlm version **0.6.3**.
+Refer to the [original model card](https://huggingface.co/MiniMaxAI/MiniMax-M3) for more details on the model.
+## Use with mlx
+```bash
+pip install -U mlx-vlm
+```
+```bash
+python -m mlx_vlm.generate --model mlx-community/MiniMax-M3-4bit --max-tokens 100 --temperature 0.0 --prompt "Describe this image." --image <path_to_image>
+```

added_tokens.json ADDED Viewed

	@@ -0,0 +1,63 @@

+{
+  "]!p~[": 200000,
+  "<fim_prefix>": 200001,
+  "<fim_middle>": 200002,
+  "<fim_suffix>": 200003,
+  "<fim_pad>": 200004,
+  "<reponame>": 200005,
+  "<filename>": 200006,
+  "<gh_stars>": 200007,
+  "<issue_start>": 200008,
+  "<issue_comment>": 200009,
+  "<issue_closed>": 200010,
+  "<jupyter_start>": 200011,
+  "<jupyter_text>": 200012,
+  "<jupyter_code>": 200013,
+  "<jupyter_output>": 200014,
+  "<empty_output>": 200015,
+  "<commit_before>": 200016,
+  "<commit_msg>": 200017,
+  "<commit_after>": 200018,
+  "]~b]": 200019,
+  "[e~[": 200020,
+  "]!d~[": 200021,
+  "<function_call>": 200022,
+  "<code_interpreter>": 200023,
+  "]<]speech[>[": 200024,
+  "]<]image[>[": 200025,
+  "]<]video[>[": 200026,
+  "]<]start of speech[>[": 200027,
+  "]<]end of speech[>[": 200028,
+  "]<]start of image[>[": 200029,
+  "]<]end of image[>[": 200030,
+  "]<]start of video[>[": 200031,
+  "]<]end of video[>[": 200032,
+  "]<]vision pad[>[": 200033,
+  "]~!b[": 200034,
+  "<jupyter_error>": 200035,
+  "<add_file>": 200036,
+  "<delete_file>": 200037,
+  "<rename_file>": 200038,
+  "<edit_file>": 200039,
+  "<commit_message>": 200040,
+  "<empty_source_file>": 200041,
+  "<repo_struct>": 200042,
+  "<code_context>": 200043,
+  "<file_content>": 200044,
+  "<source_files>": 200045,
+  "<pr_start>": 200046,
+  "<review_comment>": 200047,
+  "<filepath>": 200048,
+  "<file_sep>": 200049,
+  "<think>": 200050,
+  "</think>": 200051,
+  "<tool_call>": 200052,
+  "</tool_call>": 200053,
+  "]<]frame[>[": 200054,
+  "]<]start of frame[>[": 200055,
+  "]<]end of frame[>[": 200056,
+  "<|content_altered_placeholder|>": 200057,
+  "]<]minimax[>[": 200058,
+  "<mm:think>": 200059,
+  "</mm:think>": 200060
+}

chat_template.jinja ADDED Viewed

	@@ -0,0 +1,247 @@

+{# ---------- special token variables ---------- #}
+{%- set ns_token               = ']<]minimax[>['                  -%}
+{%- set bod_token              = ']~!b['                          -%}
+{%- set bos_token              = ']~b]'                           -%}
+{%- set eos_token              = '[e~['                           -%}
+{%- set toolcall_begin_token   = ns_token ~ '<tool_call>'         -%}
+{%- set toolcall_end_token     = ns_token ~ '</tool_call>'        -%}
+{%- set think_begin_token      = '<mm:think>'                     -%}
+{%- set think_end_token        = '</mm:think>'                    -%}
+{%- set image_token            = ']<]image[>['                    -%}
+{%- set video_token            = ']<]video[>['                    -%}
+{#- Thinking mode: "enabled" / "disabled" / "adaptive" / not defined -#}
+{#- Recursive XML renderer for tool_call arguments ======================== -#}
+{#- None values are intentionally skipped in mapping iteration so that
+    `<key>null</key>` (which would round-trip to the literal string "null")
+    never appears in the rendered tool_call. The convention is: omit the
+    field entirely. The top-level `_args` loop applies the same rule.
+    The `val is none` branch below is a safety net only — upstream cleaning
+    (drop_none_in_tool_arguments) should ensure no None ever reaches here. -#}
+{%- macro to_xml(val, ns) -%}
+{%- if val is mapping -%}
+{%- for k, v in val.items() if v is not none -%}
+{{ ns }}<{{ k }}>{{ to_xml(v, ns) }}{{ ns }}</{{ k }}>
+{%- endfor -%}
+{%- elif val is iterable and val is not string -%}
+{%- for item in val -%}
+{{ ns }}<item>{{ to_xml(item, ns) }}{{ ns }}</item>
+{%- endfor -%}
+{%- elif val is none -%}
+{#- Should be unreachable when upstream cleaning is applied. -#}
+{%- elif val is boolean -%}
+{{ val | tojson }}
+{%- else -%}
+{{ val }}
+{%- endif -%}
+{%- endmacro -%}
+{#- Tool Rendering Functions ============================================== -#}
+{%- macro render_tool_namespace(namespace_name, tool_list) -%}
+{%- for tool in tool_list -%}
+<tool>{{ tool.function | tojson(ensure_ascii=False) }}</tool>
+{% endfor -%}
+{%- endmacro -%}
+{%- macro visible_text(content) -%}
+    {%- if content is string -%}
+        {{ content }}
+    {%- elif content is iterable and content is not mapping -%}
+        {%- for item in content -%}
+            {%- if item is mapping and item.type == 'text' -%}
+                {{- item.text }}
+            {%- elif item is mapping and item.type == 'image' -%}
+                {{- image_token }}
+            {%- elif item is mapping and item.type == 'video' -%}
+                {{- video_token}}
+            {%- elif item is string -%}
+                {{- item }}
+            {%- endif -%}
+        {%- endfor -%}
+    {%- elif content is none -%}
+        {{- '' }}
+    {%- else -%}
+        {{- content }}
+    {%- endif -%}
+{%- endmacro -%}
+{#- System Message Construction ============================================ -#}
+{%- macro build_system_message(system_message) -%}
+    {%- if system_message and system_message.content -%}
+        {{- visible_text(system_message.content) }}
+    {%- else -%}
+        {{- 'Your model version is MiniMax-M3, developed by MiniMax. Knowledge cutoff: January 2026. Founded in early 2022, MiniMax is a global AI foundation model company committed to advancing the frontiers of AI towards AGI.' }}
+    {%- endif -%}
+    {#- Thinking mode instructions -#}
+    {{- '\n\n<thinking_instructions>\n' }}
+    {{- 'You have a thinking capability that allows you to reason step by step before responding. When thinking is enabled, wrap your reasoning in ' ~ think_begin_token ~ think_end_token ~ ' tags before your response. When thinking is disabled, begin your response directly after the ' ~ think_end_token ~ ' prefix. When thinking is adaptive, decide on your own whether to think for the current turn.\n' }}
+    {%- if thinking_mode is defined -%}
+        {%- if thinking_mode == "enabled" -%}
+            {{- 'Current thinking mode: enabled. You MUST think step by step before every response, including after receiving function/tool results.\n' }}
+        {%- elif thinking_mode == "disabled" -%}
+            {{- 'Current thinking mode: disabled. Do not output any thinking process.\n' }}
+        {%- elif thinking_mode == "adaptive" -%}
+            {{- 'Current thinking mode: adaptive. You are encouraged to think for complex decision-making, multi-step reasoning, or when analyzing function/tool results.\n' }}
+        {%- endif -%}
+    {%- else -%}
+        {{- 'Current thinking mode: adaptive. You are encouraged to think for complex decision-making, multi-step reasoning, or when analyzing function/tool results.\n' }}
+    {%- endif -%}
+    {{- '</thinking_instructions>' }}
+{%- endmacro -%}
+{%- macro build_developer_message(developer_message) -%}
+    {%- if developer_message and developer_message.content -%}
+        {{- visible_text(developer_message.content) }}
+    {%- else -%}
+        {%- if model_identity is not defined -%}
+            {%- set model_identity = "You are a helpful assistant." -%}
+        {%- endif -%}
+        {{- model_identity }}
+    {%- endif -%}
+{%- endmacro -%}
+{#- Main Template Logic ================================================= -#}
+{#- Role mapping: root -> system sp (high priority), system/developer -> developer sp (low priority) -#}
+{%- set system_message = none -%}
+{%- set developer_message = none -%}
+{%- set conversation_messages = messages -%}
+{%- if messages and messages[0].role == "root" -%}
+    {%- set system_message = messages[0] -%}
+    {%- set conversation_messages = messages[1:] -%}
+    {%- if conversation_messages and conversation_messages[0].role in ["system", "developer"] -%}
+        {%- set developer_message = conversation_messages[0] -%}
+        {%- set conversation_messages = conversation_messages[1:] -%}
+    {%- endif -%}
+{%- elif messages and messages[0].role in ["system", "developer"] -%}
+    {%- set developer_message = messages[0] -%}
+    {%- set conversation_messages = messages[1:] -%}
+{%- endif -%}
+{#- Render system sp (higher priority, root role only) -#}
+{{- bod_token ~ bos_token ~ 'system' ~ '\n' }}
+{{- build_system_message(system_message) }}
+{{- eos_token ~ '\n' }}
+{#- Render developer sp (lower priority: system/developer role + tools) -#}
+{{- bos_token ~ 'developer' ~ '\n' }}
+{{- build_developer_message(developer_message) }}
+{%- if tools -%}
+    {{- '\n\n' ~ '# Tools' ~ '\n' ~ 'You may call one or more tools to assist with the user query.\nHere are the tools available in JSONSchema format:' ~ '\n' }}
+    {{- '\n' ~ '<tools>' ~ '\n' }}
+    {{- render_tool_namespace("functions", tools) }}
+    {{- '</tools>' ~ '\n\n' }}
+    {{- 'To call tools, wrap all invocations in a single ' ~ toolcall_begin_token ~ toolcall_end_token ~ ' block. Parameter values containing nested objects or arrays are recursively expanded into XML elements. Example:\n' }}
+    {{- '\n' ~ toolcall_begin_token ~ '\n' }}
+    {{- ns_token + '<invoke name="tool-name-1">' }}
+    {{- ns_token + '<param-1>value-1' + ns_token + '</param-1>' }}
+    {{- ns_token + '<param-2>' }}
+    {{- ns_token + '<item>' }}
+    {{- ns_token + '<key-a>val-a' + ns_token + '</key-a>' }}
+    {{- ns_token + '<key-b>val-b' + ns_token + '</key-b>' }}
+    {{- ns_token + '</item>' }}
+    {{- ns_token + '</param-2>' }}
+    {{- ns_token + '</invoke>\n' }}
+    {{- ns_token + '<invoke name="tool-name-2">' }}
+    {{- ns_token + '<param-1>value-1' + ns_token + '</param-1>' }}
+    {{- ns_token + '</invoke>\n' }}
+    {{- toolcall_end_token }}
+{%- endif -%}
+{{- eos_token ~ '\n' }}
+{#- Render messages -#}
+{%- set last_tool_call = namespace(name=none) -%}
+{%- for message in conversation_messages -%}
+    {%- if message.role == 'assistant' -%}
+        {{- bos_token ~ 'ai' ~ '\n' }}
+        {%- set reasoning_content = '' %}
+        {%- set content = visible_text(message.content) %}
+        {%- if message.reasoning_content is string %}
+            {%- set reasoning_content = message.reasoning_content %}
+        {%- else %}
+            {%- if think_end_token in content %}
+                {%- set reasoning_content = content.split(think_end_token)[0].strip('\n').split(think_begin_token)[-1].strip('\n') %}
+                {%- set content = content.split(think_end_token)[-1].strip('\n') %}
+            {%- endif %}
+        {%- endif %}
+        {%- if reasoning_content -%}
+            {#- Render thinking for every assistant turn (all-turn visible) -#}
+            {{- think_begin_token ~ reasoning_content ~ think_end_token }}
+        {%- else -%}
+            {#- No thinking rendered → prefix with think_end_token -#}
+            {{- think_end_token }}
+        {%- endif -%}
+        {%- if content -%}
+            {{- content }}
+        {%- endif -%}
+        {%- if message.tool_calls -%}
+            {{- toolcall_begin_token ~ '\n' }}
+            {%- for tool_call in message.tool_calls -%}
+                {%- if tool_call.function -%}
+                    {%- set tool_call = tool_call.function -%}
+                {%- endif -%}
+{{- ns_token + '<invoke name="' + tool_call.name + '">' }}
+{%- set _args = tool_call.arguments -%}
+{%- for k, v in _args.items() if v is not none %}
+{{- ns_token + '<' + k + '>' -}}
+{{- to_xml(v, ns_token) -}}
+{{- ns_token + '</' + k + '>' }}
+{%- endfor -%}
+{{- ns_token + '</invoke>' ~ '\n' }}
+            {%- endfor -%}
+            {{- toolcall_end_token }}
+            {%- if message.tool_calls[-1].function -%}
+                {%- set last_tool_call.name = message.tool_calls[-1].function.name -%}
+            {%- else -%}
+                {%- set last_tool_call.name = message.tool_calls[-1].name -%}
+            {%- endif -%}
+        {%- else -%}
+            {%- set last_tool_call.name = none -%}
+        {%- endif -%}
+        {{- eos_token ~ '\n' }}
+    {%- elif message.role == 'tool' -%}
+        {%- if last_tool_call.name is none -%}
+            {{- raise_exception("Message has tool role, but there was no previous assistant message with a tool call!") }}
+        {%- endif -%}
+        {%- if loop.first or (conversation_messages[loop.index0 - 1].role != 'tool') -%}
+            {{- bos_token ~ 'tool' }}
+        {%- endif -%}
+        {{- '\n<response>' }}
+        {%- if message.content is string -%}
+            {{- message.content }}
+        {%- else -%}
+            {%- for tr in message.content -%}
+                {%- if tr is mapping and tr.type is defined and tr.type == 'image' -%}
+                    {{- image_token }}
+                {%- elif tr is mapping and tr.type is defined and tr.type == 'video' -%}
+                    {{- video_token }}
+                {%- else -%}
+                    {{- tr.output if tr.output is defined else (tr.text if tr.type == 'text' and tr.text is defined else tr) }}
+                {%- endif -%}
+            {%- endfor -%}
+        {%- endif -%}
+        {{- '</response>' }}
+        {%- if loop.last or (conversation_messages[loop.index0 + 1].role != 'tool') -%}
+            {{- eos_token ~ '\n' -}}
+        {%- endif -%}
+    {%- elif message.role == 'user' -%}
+        {{- bos_token ~ 'user' ~ '\n' }}
+        {{- visible_text(message.content) }}
+        {{- eos_token ~ '\n' }}
+    {%- endif -%}
+{%- endfor -%}
+{#- Generation prompt -#}
+{%- if add_generation_prompt -%}
+{{- bos_token ~ 'ai' ~ '\n' }}
+{%- if thinking_mode is defined and thinking_mode == "disabled" -%}
+    {{- think_end_token }}
+{%- elif thinking_mode is defined and thinking_mode == "adaptive" -%}
+    {#- adaptive: no prefix, let model decide -#}
+{%- elif thinking_mode is defined and thinking_mode == "enabled" -%}
+    {#- enabled or not defined: default to think -#}
+    {{- think_begin_token }}
+{%- else -%}
+    {#- adaptive: no prefix, let model decide -#}
+{%- endif -%}
+{%- endif -%}

config.json ADDED Viewed

	@@ -0,0 +1,875 @@

+{
+    "architectures": [
+        "MiniMaxM3SparseForConditionalGeneration"
+    ],
+    "auto_map": {
+        "AutoConfig": "configuration_minimax_m3_vl.MiniMaxM3VLConfig"
+    },
+    "do_sample": true,
+    "eos_token_id": 200020,
+    "generation_config": {
+        "bos_token_id": 200019,
+        "do_sample": true,
+        "eos_token_id": 200020,
+        "temperature": 1.0,
+        "top_p": 0.95,
+        "transformers_version": "4.46.1"
+    },
+    "image_grid_pinpoints": "[(336, 336), (336, 672), (336, 1008), (336, 1344), (336, 1680), (336, 2016), (672, 336), (672, 672), (672, 1008), (672, 1344), (672, 1680), (672, 2016), (1008, 336), (1008, 672), (1008, 1008), (1008, 1344), (1008, 1680), (1008, 2016), (1344, 336), (1344, 672), (1344, 1008), (1344, 1344), (1344, 1680), (1344, 2016), (1680, 336), (1680, 672), (1680, 1008), (1680, 1344), (1680, 1680), (1680, 2016), (2016, 336), (2016, 672), (2016, 1008), (2016, 1344), (2016, 1680), (2016, 2016)]",
+    "image_seq_length": 576,
+    "image_token_index": 200025,
+    "img_token_compression_config": {
+        "image_token_compression_method": "patch_merge",
+        "spatial_merge_size": 2,
+        "temporal_patch_size": 2
+    },
+    "model_type": "minimax_m3_vl",
+    "multimodal_projector_bias": true,
+    "num_reward_heads": 0,
+    "process_image_mode": "dynamic_res",
+    "projector_hidden_act": "gelu",
+    "projector_hidden_size": 6144,
+    "quantization": {
+        "group_size": 64,
+        "bits": 4,
+        "mode": "affine",
+        "language_model.model.layers.3.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.4.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.5.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.6.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.7.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.8.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.9.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.10.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.11.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.12.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.13.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.14.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.15.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.16.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.17.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.18.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.19.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.20.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.21.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.22.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.23.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.24.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.25.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.26.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.27.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.28.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.29.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.30.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.31.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.32.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.33.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.34.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.35.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.36.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.37.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.38.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.39.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.40.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.41.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.42.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.43.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.44.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.45.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.46.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.47.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.48.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.49.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.50.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.51.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.52.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.53.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.54.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.55.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.56.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.57.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.58.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.59.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        }
+    },
+    "quantization_config": {
+        "group_size": 64,
+        "bits": 4,
+        "mode": "affine",
+        "language_model.model.layers.3.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.4.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.5.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.6.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.7.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.8.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.9.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.10.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.11.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.12.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.13.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.14.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.15.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.16.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.17.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.18.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.19.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.20.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.21.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.22.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.23.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.24.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.25.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.26.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.27.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.28.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.29.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.30.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.31.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.32.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.33.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.34.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.35.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.36.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.37.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.38.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.39.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.40.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.41.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.42.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.43.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.44.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.45.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.46.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.47.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.48.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.49.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.50.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.51.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.52.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.53.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.54.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.55.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.56.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.57.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.58.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        },
+        "language_model.model.layers.59.block_sparse_moe.gate": {
+            "group_size": 64,
+            "bits": 8,
+            "mode": "affine"
+        }
+    },
+    "temperature": 1.0,
+    "text_config": {
+        "hidden_size": 6144,
+        "intermediate_size": 3072,
+        "num_hidden_layers": 60,
+        "num_attention_heads": 64,
+        "num_key_value_heads": 4,
+        "head_dim": 128,
+        "vocab_size": 200064,
+        "max_position_embeddings": 1048576,
+        "rms_norm_eps": 1e-06,
+        "use_gemma_norm": true,
+        "attention_output_gate": false,
+        "rope_theta": 5000000,
+        "rotary_dim": 64,
+        "partial_rotary_factor": 0.5,
+        "hidden_act": "swigluoai",
+        "use_qk_norm": true,
+        "tie_word_embeddings": false,
+        "dense_intermediate_size": 12288,
+        "shared_intermediate_size": 3072,
+        "num_local_experts": 128,
+        "num_experts_per_tok": 4,
+        "n_shared_experts": 1,
+        "scoring_func": "sigmoid",
+        "use_routing_bias": true,
+        "moe_layer_freq": [
+            0,
+            0,
+            0,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1,
+            1
+        ],
+        "qk_norm_type": "per_head",
+        "num_mtp_modules": 7,
+        "num_nextn_predict_layers": 1,
+        "swiglu_alpha": 1.702,
+        "swiglu_limit": 7.0,
+        "routed_scaling_factor": 2.0,
+        "sparse_attention_config": {
+            "use_sparse_attention": true,
+            "sparse_index_dim": 128,
+            "sparse_num_index_heads": 4,
+            "sparse_topk_blocks": 16,
+            "sparse_block_size": 128,
+            "sparse_disable_index_value": [
+                0,
+                0,
+                0,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1
+            ],
+            "sparse_score_type": "max",
+            "sparse_init_block": 0,
+            "sparse_local_block": 1,
+            "sparse_attention_freq": [
+                0,
+                0,
+                0,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1,
+                1
+            ]
+        },
+        "architectures": [
+            "MiniMaxM3SparseForCausalLM"
+        ]
+    },
+    "top_p": 0.95,
+    "transformers_version": "4.52.4",
+    "video_token_index": 200026,
+    "vision_config": {
+        "hidden_size": 1280,
+        "num_attention_heads": 16,
+        "num_hidden_layers": 32,
+        "intermediate_size": 5120,
+        "patch_size": 14,
+        "image_size": 2016,
+        "projection_dim": 6144,
+        "position_embedding_type": "rope",
+        "rope_mode": "3d",
+        "rope_theta": 10000.0,
+        "attention_dropout": 0.0,
+        "hidden_act": "gelu",
+        "initializer_factor": 1.0,
+        "initializer_range": 0.02,
+        "layer_norm_eps": 1e-05,
+        "model_type": "clip_vision_model",
+        "num_channels": 3,
+        "vocab_size": 32000,
+        "img_token_compression_config": {
+            "image_token_compression_method": "patch_merge",
+            "spatial_merge_size": 2,
+            "temporal_patch_size": 2
+        },
+        "vision_segment_max_frames": 4
+    },
+    "vision_feature_layer": -1,
+    "vision_feature_select_strategy": "full"
+}

configuration_minimax_m3_vl.py ADDED Viewed

	@@ -0,0 +1,111 @@

+"""HuggingFace configs for the MiniMax VL family (M2 VL / M3 VL).
+This file is bundled into every converted HF checkpoint so that loading via
+``AutoConfig.from_pretrained(..., trust_remote_code=True)`` works without any
+runtime dependency on sglang or other internal packages — only stock
+``transformers`` is required.
+The class definitions intentionally mirror
+``sglang.srt.configs.minimax_vl``; if either side changes, keep them in sync.
+The file is named ``configuration_minimax_m3_vl.py`` (matching the legacy
+``model_type="minimax_m3_vl"`` and the converter's ``auto_map`` entry) so
+that ckpts produced by this converter remain loadable by older sglang versions
+that only know the ``MiniMaxM3VL*`` names. The canonical class is
+``MiniMaxM3VLConfig``; ``MiniMaxM3VLConfig`` is a thin BC alias whose only
+purpose is to be referenced from ``auto_map``.
+"""
+from typing import Optional
+from transformers.configuration_utils import PretrainedConfig
+from transformers.models.auto import CONFIG_MAPPING
+def _coerce_sub_config(
+    sub_config: Optional[dict], default_model_type: str
+) -> Optional[PretrainedConfig]:
+    """Convert a config dict to a ``PretrainedConfig`` instance.
+    If ``model_type`` is registered in HF ``CONFIG_MAPPING`` the corresponding
+    config class is used; otherwise we fall back to a generic
+    ``PretrainedConfig`` so all dict keys still become real attributes (M3's
+    text backbone uses ``model_type="minimax_m2"`` which is not in
+    ``CONFIG_MAPPING``).
+    """
+    if not isinstance(sub_config, dict):
+        return sub_config
+    model_type = sub_config.get("model_type", default_model_type)
+    cls = CONFIG_MAPPING.get(model_type, PretrainedConfig)
+    return cls(**sub_config)
+class MiniMaxVLBaseConfig(PretrainedConfig):
+    """Base config shared by every MiniMax VL variant.
+    Handles vision/text sub-config coercion. Concrete subclasses only need to
+    declare a unique ``model_type`` string.
+    """
+    def __init__(
+        self,
+        vision_config: Optional[dict] = None,
+        text_config: Optional[dict] = None,
+        image_token_index: int = 200025,
+        video_token_index: int = 200026,
+        image_seq_length: int = 576,
+        process_image_mode: str = "dynamic_res",
+        projector_hidden_act: str = "gelu",
+        multimodal_projector_bias: bool = True,
+        vision_feature_layer: int = -1,
+        vision_feature_select_strategy: str = "full",
+        img_token_compression_config: Optional[dict] = None,
+        image_grid_pinpoints: Optional[str] = None,
+        **kwargs,
+    ):
+        self.vision_config = _coerce_sub_config(vision_config, "clip_vision_model")
+        self.text_config = _coerce_sub_config(text_config, "mixtral")
+        self.image_token_index = image_token_index
+        self.video_token_index = video_token_index
+        self.image_seq_length = image_seq_length
+        self.process_image_mode = process_image_mode
+        self.projector_hidden_act = projector_hidden_act
+        self.multimodal_projector_bias = multimodal_projector_bias
+        self.vision_feature_layer = vision_feature_layer
+        self.vision_feature_select_strategy = vision_feature_select_strategy
+        self.img_token_compression_config = img_token_compression_config or {}
+        self.image_grid_pinpoints = image_grid_pinpoints
+        super().__init__(**kwargs)
+    def __post_init__(self, **kwargs):
+        super().__post_init__(**kwargs)
+        if hasattr(self, "vision_config"):
+            self.vision_config = _coerce_sub_config(self.vision_config, "clip_vision_model")
+        if hasattr(self, "text_config"):
+            self.text_config = _coerce_sub_config(self.text_config, "mixtral")
+class MiniMaxM2VLConfig(MiniMaxVLBaseConfig):
+    """MiniMax M2 VL: vision tower + M2 (Mixtral-style MoE) text backbone."""
+    model_type = "minimax_m2_vl"
+class MiniMaxM3VLConfig(MiniMaxVLBaseConfig):
+    """MiniMax M3 VL: vision tower + M3 (mixed sparse/dense MoE) text backbone."""
+    model_type = "minimax_m3_vl"
+class MiniMaxM2MiniVLConfig(MiniMaxM2VLConfig):
+    """Legacy alias kept so old ``model_type="minimax_m2_mini_vl"`` ckpts load."""
+    model_type = "minimax_m2_mini_vl"
+class MiniMaxM3VLConfig(MiniMaxM3VLConfig):
+    """Legacy alias kept so old ``model_type="minimax_m3_vl"`` ckpts load."""
+    model_type = "minimax_m3_vl"

generation_config.json ADDED Viewed

	@@ -0,0 +1,8 @@

+{
+  "bos_token_id": 200019,
+  "do_sample": true,
+  "eos_token_id": 200020,
+  "temperature": 1.0,
+  "top_p": 0.95,
+  "transformers_version": "4.46.1"
+}

image_processor.py ADDED Viewed

	@@ -0,0 +1,223 @@

+# Copyright 2023-2024 SGLang Team
+# Licensed under the Apache License, Version 2.0 (the "License");
+"""
+MiniMax VL family HuggingFace-compatible Processor, ImageProcessor, VideoProcessor.
+"""
+import math
+from typing import List, Tuple
+import torch
+from torchvision.transforms import InterpolationMode
+from transformers import BatchFeature
+from transformers.image_processing_utils_fast import (
+    BaseImageProcessorFast,
+    group_images_by_shape,
+    reorder_images,
+)
+from transformers.image_utils import PILImageResampling, SizeDict
+from transformers.processing_utils import (
+    ImagesKwargs,
+    Unpack,
+)
+from transformers.utils import TensorType
+MAX_RATIO = 200
+def round_by_factor(number: int, factor: int) -> int:
+    return round(number / factor) * factor
+def ceil_by_factor(number: int, factor: int) -> int:
+    return math.ceil(number / factor) * factor
+def floor_by_factor(number: int, factor: int) -> int:
+    return math.floor(number / factor) * factor
+def smart_resize(
+    height: int,
+    width: int,
+    factor: int = 28,
+    min_pixels: int = 4 * 28 * 28,
+    max_pixels: int = 451584,
+) -> tuple[int, int]:
+    if max(height, width) / min(height, width) > MAX_RATIO:
+        raise ValueError(
+            f"absolute aspect ratio must be smaller than {MAX_RATIO}, "
+            f"got {max(height, width) / min(height, width)}"
+        )
+    h_bar = max(factor, round_by_factor(height, factor))
+    w_bar = max(factor, round_by_factor(width, factor))
+    if h_bar * w_bar > max_pixels:
+        beta = math.sqrt((height * width) / max_pixels)
+        h_bar = floor_by_factor(height / beta, factor)
+        w_bar = floor_by_factor(width / beta, factor)
+    elif h_bar * w_bar < min_pixels:
+        beta = math.sqrt(min_pixels / (height * width))
+        h_bar = ceil_by_factor(height * beta, factor)
+        w_bar = ceil_by_factor(width * beta, factor)
+    return h_bar, w_bar
+# ==============================================================================
+# MiniMax M3 VL Image Processor Fast (Fast Mode - Torch based)
+# ==============================================================================
+class MiniMaxM3VLImageProcessorKwargs(ImagesKwargs, total=False):
+    patch_size: int
+    temporal_patch_size: int
+    merge_size: int
+    max_pixels: int
+class MiniMaxM3VLImageProcessor(BaseImageProcessorFast):
+    do_resize = True
+    resample = PILImageResampling.BICUBIC
+    size = {"height": 672, "width": 672}  # required by base class validation, not used as resize bound
+    default_to_square = False
+    do_rescale = True
+    rescale_factor = 1 / 255
+    do_normalize = True
+    image_mean = [0.48145466, 0.4578275, 0.40821073]
+    image_std = [0.26862954, 0.26130258, 0.27577711]
+    do_convert_rgb = True
+    patch_size = 14
+    temporal_patch_size = 2
+    merge_size = 2
+    max_pixels = 451584             # 672*672
+    valid_kwargs = MiniMaxM3VLImageProcessorKwargs
+    model_input_names = ["pixel_values", "image_grid_thw"]
+    def __init__(self, **kwargs: Unpack[MiniMaxM3VLImageProcessorKwargs]):
+        super().__init__(**kwargs)
+    def preprocess(
+        self, images, **kwargs: Unpack[MiniMaxM3VLImageProcessorKwargs]
+    ) -> BatchFeature:
+        return super().preprocess(images, **kwargs)
+    def _preprocess(
+        self,
+        images: List[torch.Tensor],
+        do_resize: bool,
+        size: SizeDict,
+        resample: PILImageResampling | InterpolationMode | int | None,
+        do_rescale: bool,
+        rescale_factor: float,
+        do_normalize: bool,
+        image_mean: float | List[float] | None,
+        image_std: float | List[float] | None,
+        patch_size: int,
+        temporal_patch_size: int,
+        merge_size: int,
+        max_pixels: int,
+        disable_grouping: bool | None,
+        return_tensors: str | TensorType | None,
+        **kwargs,
+    ) -> BatchFeature:
+        grouped_images, grouped_images_index = group_images_by_shape(
+            images, disable_grouping=disable_grouping
+        )
+        resized_images_grouped = {}
+        factor = patch_size * merge_size
+        for shape, stacked_images in grouped_images.items():
+            height, width = stacked_images.shape[-2:]
+            if do_resize:
+                resized_height, resized_width = smart_resize(
+                    height, width, factor=factor,
+                    max_pixels=max_pixels,
+                )
+                stacked_images = self.resize(
+                    stacked_images,
+                    size=SizeDict(height=resized_height, width=resized_width),
+                    resample=resample,
+                )
+            resized_images_grouped[shape] = stacked_images
+        resized_images = reorder_images(resized_images_grouped, grouped_images_index)
+        grouped_images, grouped_images_index = group_images_by_shape(
+            resized_images, disable_grouping=disable_grouping
+        )
+        processed_images_grouped = {}
+        processed_grids = {}
+        for shape, stacked_images in grouped_images.items():
+            resized_height, resized_width = stacked_images.shape[-2:]
+            patches = self.rescale_and_normalize(
+                stacked_images,
+                do_rescale,
+                rescale_factor,
+                do_normalize,
+                image_mean,
+                image_std,
+            )
+            if patches.ndim == 4:
+                patches = patches.unsqueeze(1)
+            if patches.shape[1] % temporal_patch_size != 0:
+                repeats = patches[:, -1:].repeat(
+                    1,
+                    temporal_patch_size - (patches.shape[1] % temporal_patch_size),
+                    1,
+                    1,
+                    1,
+                )
+                patches = torch.cat([patches, repeats], dim=1)
+            batch_size, grid_t, channel = patches.shape[:3]
+            grid_t = grid_t // temporal_patch_size
+            grid_h, grid_w = resized_height // patch_size, resized_width // patch_size
+            patches = patches.view(
+                batch_size,
+                grid_t,
+                temporal_patch_size,
+                channel,
+                grid_h // merge_size,
+                merge_size,
+                patch_size,
+                grid_w // merge_size,
+                merge_size,
+                patch_size,
+            )
+            patches = patches.permute(0, 1, 4, 7, 5, 8, 3, 2, 6, 9)
+            flatten_patches = patches.reshape(
+                batch_size,
+                grid_t * grid_h * grid_w,
+                channel * temporal_patch_size * patch_size * patch_size,
+            )
+            processed_images_grouped[shape] = flatten_patches
+            processed_grids[shape] = [[grid_t, grid_h, grid_w]] * batch_size
+        processed_images = reorder_images(
+            processed_images_grouped, grouped_images_index
+        )
+        processed_grids = reorder_images(processed_grids, grouped_images_index)
+        pixel_values = torch.cat(processed_images, dim=0)
+        image_grid_thw = torch.tensor(processed_grids, dtype=torch.long)
+        return BatchFeature(
+            data={"pixel_values": pixel_values, "image_grid_thw": image_grid_thw},
+            tensor_type=return_tensors,
+        )
+    def get_number_of_image_patches(self, height: int, width: int, images_kwargs=None):
+        images_kwargs = images_kwargs or {}
+        patch_size = images_kwargs.get("patch_size", self.patch_size)
+        merge_size = images_kwargs.get("merge_size", self.merge_size)
+        max_pixels = images_kwargs.get("max_pixels", self.max_pixels)
+        resized_height, resized_width = smart_resize(
+            height, width, factor=patch_size * merge_size,
+            max_pixels=max_pixels,
+        )
+        grid_h, grid_w = resized_height // patch_size, resized_width // patch_size
+        return grid_h * grid_w

model-00001-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:85d6eae8bc2c8bed69f6aa550e6f3eb086ac9ba24883736fbc90cdfda257a332
+size 5297839185

model-00002-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:8b1413a8e197ad93d03634234217bfb6c7ae156580489f32eac6348bb2caad11
+size 4172005217

model-00003-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:f8c485b0e2671a26779208fdf6d90fa37212ac8ae4376e668fed95a295e76943
+size 4172005211

model-00004-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:21fa43d181dd80ee1809363e69337765314b14ef9c59c77a062e6e245a95aee0
+size 4172005149

model-00005-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:57333d815a49a81c99dc002197d681ab7b656793186f256b1c47ed902fe3906e
+size 4172005217

model-00006-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:e056500ef74711ef2fbb7c7dbfdd542c331ed72e011eb83880797754711003e8
+size 4172005213

model-00007-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:0163719e881fa75636d7eff282c7ff5f41327d35e370263f9004fc64ec80f13b
+size 4172005217

model-00008-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:f5cea2893fd833a6cee2d2ca01cf7ad3388f797de369a5d97847efd801234c0f
+size 4172005242

model-00009-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:2e39a0d6967a6f7b69301dae33b9f77482d8891388ec43b061cdef5bebd51ee8
+size 4172005263

model-00010-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:3eaca5ba7116485855c7909ab6cc1701bec3d72124f66057e996765b2d6d57ad
+size 4172005247

model-00011-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:da5ec603c3c2e5eead90fb58959493f10cfd49c88b89a9e284bf519ff4b63f30
+size 4172005259

model-00012-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:5ee0af22322bc69d858f394dd954b44a94e5179c6dea857b75581c3abbc6b9c1
+size 4172005245

model-00013-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:9084506c8375bad74bd66ebbe9973b45dcf5dfac8c1e904ad22629368c0994e5
+size 4172005203

model-00014-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:82b6ba4ddcfaf554f4f75c9a4e54a54c6b6f3257c90640adf9361934bd5b59d8
+size 4172005257

model-00015-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:7d04969a85a1965733db5fb7e4f63b8edbd217051a127199b0b2542a99a6b3f1
+size 4172005263

model-00016-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:775fef001d59acf33c1a0b36686ea10fadbbc23e5a72b270d16679ddf32951c1
+size 4172005259

model-00017-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:7d64b69dabb551ec39682449a8f9210df3186169f5a4fb89ea7e319a49a970d8
+size 4172005247

model-00018-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:7c5288b060e4f447670f20ceaee19edacf38d2f5cce8e3ddffae1478c99555c7
+size 4172005259

model-00019-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:9cace5efab8c76e3a467f955c5c36ba8d074f8be838a33b5884ab49c708cb23b
+size 4172005259

model-00020-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:4e9152eb6d04209a6f54b459900e017db2cb097c955a19288a5ef29e78c3d8cf
+size 4172005255

model-00021-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:1a0814b6c766e76b1be3627dbc61e7303250ac17e8048be87b9eec30669b6195
+size 4172005257

model-00022-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:9d12bebd43618ebea8f802e9100c3f29a195ee9f976d8752ca25f3bbdbff4286
+size 4172005259

model-00023-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:0af07d8bc4580a0ed6e9485118ef14d9f9575317d057590922e5b1d14273f01c
+size 4172005255

model-00024-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:adcb39b5dfd8667f093b7231fee589372abaacc95cb478fa183c04eedf9c6f0a
+size 4172005259

model-00025-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:5f4281c0647ef7e77070153692d6f10520efe6280ab918baa80670ea982c5a5b
+size 4172005225

model-00026-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:e4765bedb19193134d8d9518f31118281ab32b3f6846905a7091f861e514ba74
+size 4172005257

model-00027-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:a4501c6bc2ffc694ae8c103fea6ef36a87642411323551c6f4eb22d7455c9d25
+size 4172005263

model-00028-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:2f0271e6723537b2be83c2c9bf9fe66cdd9216dab35808feaf7b983fa7199306
+size 4172005223

model-00029-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:56dc1666f2ac875d63937d0a6efc5d4c49c1d4393ee828993f01ea66ac4b16cb
+size 4172005257

model-00030-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:f98e7b3f0f5bd7e6216ba2e842dfd0900c8d365f32e6820b42f494dabb4b62b2
+size 4172005235

model-00031-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:fda7f306868f825a06d6d4c3ba79d5592fa0dd3a66fed5a3c01b90aec299cca4
+size 4172005263

model-00032-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:1546fda15dcb7724be074d3ba9172b5caccf50737f3544cccdb66494402d74d5
+size 4172005259

model-00033-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:99ec5110da1fec971c1569819d923abb375ac9c6bcb4e976e125c7536a6b15cb
+size 4172005257

model-00034-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:346a858960a809be48d0e5571c24a0525d93a75f032c3802085c50a6ed69d3e1
+size 4172005201

model-00035-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:0d2fa0ff96e104bb3d36823a85087fdfe9d6562b58d649b2be83bf349cb07c89
+size 4172005259

model-00036-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:c618dc1d0261fc2f8fa027902294f763efba8a59a75097fdceeee137ec311e0b
+size 4172005257

model-00037-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:1702f4d9a89cb81be07ece1ff9787e4caecf1cb76dfaab5f4925c0bec576d7cf
+size 4172005263

model-00038-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:667fae9fbd06e3adfd8cc658b4356fcb0dbc92dbf17e377083f32055d401c1dc
+size 4172005173

model-00039-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:11eaf7e8fc0121384727d9a1c312a600df532a6a9a360f1cc96c0d12c874cbfc
+size 4172005263

model-00040-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:680a2bd9abfa32b84a1fcb5bf7aa8d182cbe25fc98e1ba4d4512aaed56a2c898
+size 4172005167

model-00041-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:a537b70147547604918d429726e480bc7bcc9ee5fc9f308fcc41d209b43c4fc8
+size 4172005259

model-00042-of-00058.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:d7c877fb402497f234d399b0d3defd4e4fef6988a9a3ecbb016f7d128c3e6c5a
+size 4172005257