LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs? Paper • 2605.08985 • Published May 9 • 24
Seeing is Improving: Visual Feedback for Iterative Text Layout Refinement Paper • 2603.22187 • Published Mar 23 • 1
Dolphin-v2: Universal Document Parsing via Scalable Anchor Prompting Paper • 2602.05384 • Published Feb 5 • 1
LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR Paper • 2601.14251 • Published Jan 20 • 31
The Character Error Vector: Decomposable errors for page-level OCR evaluation Paper • 2604.06160 • Published Apr 7 • 1
Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context Paper • 2605.13831 • Published May 13 • 90
PaddleOCR-VL-1.6: Expanding the Frontier of Document Parsing with Under-Optimized Region Refinement and Progressive Post-Training Paper • 2606.03264 • Published Jun 2 • 27
Where to cut, how deep: BPE and Unigram-LM on chemistry SMILES Paper • 2607.05691 • Published 26 days ago • 4
MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding Paper • 2603.22458 • Published Mar 23 • 139
CommonForms: A Large, Diverse Dataset for Form Field Detection Paper • 2509.16506 • Published Sep 20, 2025 • 22
GutenOCR: A Grounded Vision-Language Front-End for Documents Paper • 2601.14490 • Published Jan 20 • 38