Image-Text-to-Text
MLX
Safetensors
Japanese
English
Chinese
unlimited-ocr
ocr
document-parsing
japanese
quantized
conversational
custom_code
Instructions to use tokimoa/unlimited-ocr-mlx-bf16 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- MLX
How to use tokimoa/unlimited-ocr-mlx-bf16 with MLX:
# Make sure mlx-vlm is installed # pip install --upgrade mlx-vlm from mlx_vlm import load, generate from mlx_vlm.prompt_utils import apply_chat_template from mlx_vlm.utils import load_config # Load the model model, processor = load("tokimoa/unlimited-ocr-mlx-bf16") config = load_config("tokimoa/unlimited-ocr-mlx-bf16") # Prepare input image = ["http://images.cocodataset.org/val2017/000000039769.jpg"] prompt = "Describe this image." # Apply chat template formatted_prompt = apply_chat_template( processor, config, prompt, num_images=1 ) # Generate output output = generate(model, processor, formatted_prompt, image) print(output) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- LM Studio
Unlimited-OCR (MLX bf16, verified)
Baiduの Unlimited-OCR(3.3B・DeepSeek-V2系MoE+MLA+deepencoder構成のドキュメントパースモデル)を、公式重みからMLX形式に変換したものです。日本語ビジネス文書での検証済みで公開しています。
ページ画像から、レイアウト検出ボックス(<|det|>種別 [x1,y1,x2,y2]<|/det|>)付きで読み順どおりのテキスト(表はHTML)を出力します。
なぜ公開するか
公開時点で存在した本モデルの既存MLX変換を同一プロトコルで検証したところ、現行mlx-vlmでロードできないもの(model_type改名)や、トークナイザ不整合により出力がbyte-BPE片のまま文字化けするものを確認しました。本リポジトリは公式重みから変換し、下記の検証を通した上で公開しています。
変換品質の検証(tokimoa)
日本語ビジネス文書5種(請求書・議事録・契約条項・チェックシート・英日混在技術文書、正解文字列59項目)で検証:
- 正解文字列カバレッジ 57/59(残る2件は記号の置換〔波ダッシュ→ASCII~、×→X〕のみで、金額・氏名・条文等の内容誤りはゼロ)
- 同一入力の反復で出力完全一致(決定論的)
実測速度(M4 Max 36GB)
- 生成: 224 tok/s / ピークメモリ: 8.7GB(MoEのアクティブパラメータが小さいため高速)
使い方
チャットテンプレートではなく、素のプロンプトに <image> トークンを含める形式です:
# pip install mlx-vlm (0.6.7で動作確認)
from mlx_vlm import load, generate
model, processor = load("tokimoa/unlimited-ocr-mlx-bf16")
out = generate(model, processor, "<image>document parsing.",
image=["page.png"], max_tokens=4096, temperature=0.0)
print(out.text)
複数ページは "<image>Multi page parsing."(上流README準拠)。
変換情報
- 変換元:
baidu/Unlimited-OCR(公式重み) - 変換:
mlx-vlm 0.6.7convert(量子化なし・6.3GB) - 変換者: tokimoa
ライセンス
MIT(元モデルに準拠)
- Downloads last month
- 50
Model size
3B params
Tensor type
BF16
·
Hardware compatibility
Log In to add your hardware
Quantized
Model tree for tokimoa/unlimited-ocr-mlx-bf16
Base model
baidu/Unlimited-OCR