multimodal
updated
Image-Text-to-Text
• 2B • Updated • 2.01M
• 1.44k
Qwen/Qwen2.5-VL-7B-Instruct
Image-Text-to-Text
• 8B • Updated • 6.1M
• • 1.73k
google/gemma-3-27b-it-qat-q4_0-gguf
Image-Text-to-Text
• 27B • Updated • 383
• 405
google/paligemma2-3b-mix-224
Image-Text-to-Text
• 3B • Updated • 20.4k
• 62
HuggingFaceTB/SmolVLM2-256M-Video-Instruct
Image-Text-to-Text
• 0.3B • Updated • 42.4k
• 115
unsloth/Qwen2.5-VL-3B-Instruct-GGUF
Image-Text-to-Text
• 3B • Updated • 17.5k
• 30
Image-Text-to-Text
• 0.9B • Updated • 111k
• 85
14B • Updated • 1.89k
• 104
FastVLM: Efficient Vision Encoding for Vision Language Models
Paper
• 2412.13303
• Published • 77
Feature Extraction
• 0.9B • Updated • 103k
• 343
Qwen/Qwen3-VL-4B-Instruct
Image-Text-to-Text
• 4B • Updated • 3.3M
• • 482
PaddlePaddle/PaddleOCR-VL
Image-Text-to-Text
• 1.0B • Updated • 8.32k
• 1.66k
Image-Text-to-Text
• 3B • Updated • 393
• 117
Viewer
• Updated • 1.19k • 284
• 50
nvidia/NVIDIA-Nemotron-Parse-v1.2
Image-Text-to-Text
• 0.9B • Updated • 59.8k
• 71