OCR llama.cpp
https://huggingface.co/blog/ggml-org/using-ocr-models-with-llama-cpp Critères : Licence libre Tourne sur CPU Document FR ROI Full-document JSON/md
Collection11 items • Updated • 20Note GGUF de modèles pouvant faire de l'OCR (GGLM)
GLAM Extraction Leaderboard
📊4GLAM document extraction leaderboard (POC)
Note Benchmark autour des capacités d'extraction en JSON
numind/NuExtract3-GGUF
Image-Text-to-Text • 4B • Updated • 8.46k • 42Note Licence : apache-2.0 + Complétion de template plus poussée que les autres modèles + Peut formater en JSON les résultats .md d'autres modèles - Lent sur CPU (4B)
lightonai/LightOnOCR-2-1B
Image-Text-to-Text • 1B • Updated • 270k • • 836Note Licence : apache-2.0
-
mradermacher/LightOnOCR-2-1B-GGUF
0.6B • Updated • 414 • 7
Note Licence : apache-2.0 x Modèle générique pouvant réaliser des tâches d'OCR (pas fait pour cet usage) - Beaucoup trop gros pour tourner sur CPU (24B)
Note Licence : Modified MIT x Modèle générique pouvant réaliser des tâches d'OCR (pas fait pour cet usage) - Beaucoup trop gros pour tourner sur CPU (128B)
tencent/HunyuanOCR
Image-Text-to-Text • 1B • Updated • 938k • 827Note Licence : Tencent⚠️
ggml-org/HunyuanOCR-GGUF
0.5B • Updated • 8.64k • 14Note Licence : Tencent⚠️
prithivMLmods/HunyuanOCR-1.5-GGUF-Updated
Image-Text-to-Text • 0.5B • Updated • 3.17k • 4Note Licence : apache-2.0 (différente du modèle source ???)
baidu/Unlimited-OCR
Image-Text-to-Text • 3B • Updated • 1.29M • 4.34kNote Licence : MIT - Lit assez mal le texte manuscrit testé
sahilchachra/Unlimited-OCR-GGUF
Image-Text-to-Text • 3B • Updated • 7.79k • 148Note Licence : MIT
baidu/Qianfan-OCR
Image-Text-to-Text • 5B • Updated • 52.5k • 1.21kNote Serait meilleur que Unlimited-OCR sur la capacité de lecture
-
Reza2kn/Qianfan-OCR-GGUF
Image-Text-to-Text • 4B • Updated • 1.32k • 16 -
ATH-MaaS/OvisOCR2
Image-Text-to-Text • 0.9B • Updated • 239k • • 483
Abiray/OvisOCR2-GGUF
Image-Text-to-Text • 0.8B • Updated • 4.46k • 28Note à tester à nouveau
-
deepseek-ai/DeepSeek-OCR-2
Image-Text-to-Text • 3B • Updated • 742k • 1.11k
SandLogicTechnologies/DeepSeek-OCR-2-GGUF
Image-to-Text • 3B • Updated • 1.34k • 2Note Licence : MIT + Très rapide sur CPU + Meilleur en ROI - Mauvais sur la complétion d'un JSON de document complet
Form Field VLM Demo
📋3Detect and understand fields in a form page
Note Détection de champs (demo)
jbarrow/FFDetr
Updated • 5Note Détection de champs
pdf-net/ffdetr-filled
Object Detection • UpdatedNote Détection de champs (vides et remplis)
-
dots-studio/dots.ocr
Image-Text-to-Text • 3B • Updated • 1.1M • 1.34k
polymer/dots.mocr-GGUF
Image-to-Text • 2B • Updated • 67Note Licence : apache-2.0 + Résultats full-document .md comparables à LightOnOCR + bbox + Typage des zones du document (ex: image / tableau / liste / titre)
mradermacher/dots.ocr-i1-GGUF
Image-to-Text • 2B • Updated • 789 • 3Note tests infructueux avec llama.cpp
-
Qwen/Qwen3-VL-4B-Instruct-GGUF
Image-Text-to-Text • 4B • Updated • 170k • 65
unsloth/Qwen3-VL-2B-Instruct-GGUF
Image-Text-to-Text • 2B • Updated • 64.7k • 45Note Licence : apache-2.0 + Bon en ROI + Bon .md full-document - Très inconsistant sur la complétion de JSON d'un document entier
-
Qwen/Qwen3-VL-2B-Instruct-GGUF
Image-Text-to-Text • 2B • Updated • 132k • 60
FireRedTeam/FireRed-OCR
Image-to-Text • 2B • Updated • 2.39k • 167Note à tester
tiiuae/Falcon-OCR
Image-to-Text • 0.3B • Updated • 5.54k • 158Note à tester
PaddlePaddle/PaddleOCR-VL-1.6-GGUF
0.5B • Updated • 92.8k • 79Note Licence : apache2.0 + Très rapide / léger (0.5B) + Performant en full-document .md + Meilleur en ROI (0.4s pour lire un identifiant manuscrit) + Lit très bien le manuscrit - Pas fiable sur les cases à cocher
infly/Infinity-Parser2-Pro
Image-Text-to-Text • 35B • Updated • 7.56k • 98Note Licence : apache-2.0 - Beaucoup trop gros pour tourner sur CPU (128B)
-
prithivMLmods/Infinity-Parser2-Flash-GGUF
Image-Text-to-Text • 2B • Updated • 1.54k • 2
Note Modèles Datalab, spécialisés dans le traitement de document
datalab-to/chandra-ocr-2
Image-Text-to-Text • 5B • Updated • 1.81M • 541Note Licence : openrail
-
prithivMLmods/chandra-ocr-2-GGUF
Image-Text-to-Text • 5B • Updated • 11.4k • 42
datalab-to/surya-ocr-2-gguf
Image-Text-to-Text • 0.6B • Updated • 722k • 21Note Licence : openrail + Taux de confiance - Utilisation prévue avec un SDK → modèle pas vraiment générique
datalab-to/lift
Image-Text-to-Text • 10B • Updated • 158k • • 202Note Licence : openrail + Sortie JSON structurée (similaire à NuExtract3) - Trop lourd pour du CPU (10B)
prithivMLmods/lift-GGUF
Image-Text-to-Text • 9B • Updated • 2.75k • 8Note Licence : openrail + Sortie JSON structurée (similaire à NuExtract3) - Trop lourd pour du CPU (9B)
LiquidAI/LFM2.5-VL-450M-GGUF
Image-Text-to-Text • 0.4B • Updated • 22.7k • 71Note Licence : lfm1.0 (limite certaines utilisations commerciales) + Ultra rapide sur CPU (instantané sur une ROI) - Mauvais en full-document .md / JSON
LiquidAI/LFM2.5-VL-1.6B-GGUF
Image-Text-to-Text • 1B • Updated • 36.8k • 109Note Licence : lfm1.0 (limite certaines utilisations commerciales) + Toujours rapide même si plus gros que la version 450M (document complet traité en 26s sur CPU) + Plus de capacités que la version 450M (exemple : renvoyer un JSON complet) - Le JSON n'est pas consistant (tous les critères ne sont pas respectés) - Toujours mauvais pour lire un champ complet LightOnOCR-2-1B (modèle de taille équivalente) semble plus efficace
ggml-org/GLM-OCR-GGUF
0.9B • Updated • 33.1k • 111Note Licence : MIT - Ne relève pas les cases à cocher