multimodal
updated
Image-Text-to-Text
• 2B • Updated • 2.08M
• 1.44k
Qwen/Qwen2.5-VL-7B-Instruct
Image-Text-to-Text
• 8B • Updated • 5.67M
• • 1.73k
google/gemma-3-27b-it-qat-q4_0-gguf
Image-Text-to-Text
• 27B • Updated • 372
• 406
google/paligemma2-3b-mix-224
Image-Text-to-Text
• 3B • Updated • 22.1k
• 65
HuggingFaceTB/SmolVLM2-256M-Video-Instruct
Image-Text-to-Text
• 0.3B • Updated • 39.8k
• 115
unsloth/Qwen2.5-VL-3B-Instruct-GGUF
Image-Text-to-Text
• 3B • Updated • 16.8k
• 30
Image-Text-to-Text
• 0.9B • Updated • 107k
• 85
14B • Updated • 1.83k
• 104
FastVLM: Efficient Vision Encoding for Vision Language Models
Paper
• 2412.13303
• Published • 77
Feature Extraction
• 0.9B • Updated • 89.4k
• 345
Qwen/Qwen3-VL-4B-Instruct
Image-Text-to-Text
• 4B • Updated • 3.41M
• • 485
PaddlePaddle/PaddleOCR-VL
Image-Text-to-Text
• 1.0B • Updated • 7.73k
• 1.66k
Image-Text-to-Text
• 3B • Updated • 434
• 117
Viewer
• Updated • 1.19k • 271
• 50
nvidia/NVIDIA-Nemotron-Parse-v1.2
Image-Text-to-Text
• 0.9B • Updated • 57.8k
• 72