A Strong Baseline for Evaluating Vision Encoders
in Multimodal Large Language Models

Yilin Yang1,*  ·  Jun-Tao Tang2,*  ·  Kengyi Wang3 ·  Siyuan Su3  ·  Gaoyong Luo4  ·  Mingda Chen1,†

1School of Artificial Intelligence, Shanghai Jiao Tong University
2Nanjing University  ·  3Fudan University  ·  4Independent Researcher
*Equal contribution.   †Corresponding author.

Paper: arXiv 2610.05413 Paper PDF GitHub code Model zoo checkpoints BibTeX citation

Overview

This repository hosts the downstream MLLM checkpoints accompanying A Strong Baseline for Evaluating Vision Encoders in Multimodal Large Language Models.

Model Zoo

This Model Zoo covers the 70 visual encoders used in our paper: 43 language-supervised, 22 self-supervised, and 5 discrete tokenizers. The current release provides both pretraining and finetuning checkpoints for all 65 continuous vision encoders with each of the three main language backbones.

Training data

  • Pretrain Data — LCS-558K: the image–text alignment dataset from LLaVA-Pretrain, using blip_laion_cc_sbu_558k.json. This dataset is used for MLLM projector training.
  • Finetuning Data — LLaVA-v1.5 mix665k (filtered): the LLaVA-v1.5 instruction mixture, using llava_v1_5_mix665k_drop_ge8kchars.json. The training configuration removes 395 examples with at least 8,000 characters of conversation text.

Downloads

  • Encoder weights links to the original upstream vision encoder or visual tokenizer. Each encoder name links to its model or project page. Use these frozen encoder weights together with the corresponding Stage 1 projector or Stage 2 MLLM checkpoint, preserving the architecture, feature layer and preprocessing specified by that run's config.json.
    • For Hugging Face models, retain the associated configuration and processor files. Web-SSL MAE 3B has sharded weights; its link opens the complete model repository.
    • DINOv3 requires acceptance of the upstream model's terms and authentication. The RAEv2 DINOv3-L (k=7) entry uses the same DINOv3-L/16 backbone with the project's k=7 intermediate-layer readout; its download is the backbone used to construct that representation.
  • projector downloads the pretraining mm_projector.bin;
  • finetuned opens the finetuned checkpoint directory, including model weights, configuration, and language-tokenizer files. The frozen vision encoder must be supplied separately using the matching architecture and weights recorded in config.json. Pretraining projector weights alone are not instruction-tuned MLLMs.

Qwen/Qwen2.5-1.5B-Instruct

Base LLM Vision Encoder / Tokenizer Encoder weights Stage 1 Pretrained weights Stage 2 Finetuned weights
Qwen2.5-1.5B-Instruct PE-Core-G/14 (448) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-G/14 (378) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-G/14 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP-2.5B ViT-G/14 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 ViT-G/16 (384) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 ViT-G/16 (256) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-H/14 (378) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP-2.5B ViT-H/14 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP-v1.2 ViT-H/14 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct OpenAI CLIP ViT-L/14 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-L/14 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP-2.5B ViT-L/14 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP-400M ViT-L/14 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 So400m/l14 (384) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 So400m/l14 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 So400m/l16 (512) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 So400m/l16 (384) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 So400m/l16 (256) encoder projector finetuned
Qwen2.5-1.5B-Instruct PE-Lang-L/14 (448) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 ViT-L/16 (512) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 ViT-L/16 (384) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 ViT-L/16 (256) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-M/16 (384) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-M/16 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2-mT5 ViT-M/16 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-B/16 (384) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-B/16 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-B/32 (384) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-B/32 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2-mT5 ViT-B/32 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP-2.5B ViT-B/16 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP-2.5B ViT-B/32 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP-400M ViT-B/16 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP-400M ViT-B/32 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct PE-Core-B/16 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 ViT-B/16 (512) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 ViT-B/16 (384) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 ViT-B/16 (256) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 ViT-B/16 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct SigLIP2 ViT-B/32 (256) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-S/16 (384) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2 ViT-S/16 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct MetaCLIP 2-mT5 ViT-S/16 (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct Web-SSL MAE 3B (224) encoder files projector finetuned
Qwen2.5-1.5B-Instruct DINOv2 ViT-G/14 encoder projector finetuned
Qwen2.5-1.5B-Instruct Web-SSL DINO 1B (224) encoder files projector finetuned
Qwen2.5-1.5B-Instruct Web-SSL MAE 1B (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct Pixio ViT-H/16 encoder projector finetuned
Qwen2.5-1.5B-Instruct I-JEPA ViT-H/14 encoder projector finetuned
Qwen2.5-1.5B-Instruct DINOv2 ViT-L/14 encoder projector finetuned
Qwen2.5-1.5B-Instruct DINOv3 ViT-L/16 encoder projector finetuned
Qwen2.5-1.5B-Instruct Pixio ViT-L/16 encoder projector finetuned
Qwen2.5-1.5B-Instruct RAEv2 DINOv3-L (k=7) DINOv3 backbone projector finetuned
Qwen2.5-1.5B-Instruct Web-SSL MAE 300M (224) encoder projector finetuned
Qwen2.5-1.5B-Instruct EUPE ConvNeXt-B encoder projector finetuned
Qwen2.5-1.5B-Instruct DINOv2 ViT-B/14 encoder projector finetuned
Qwen2.5-1.5B-Instruct DINO ViT-B/8 encoder projector finetuned
Qwen2.5-1.5B-Instruct DINO ViT-B/16 encoder projector finetuned
Qwen2.5-1.5B-Instruct EUPE ViT-B encoder projector finetuned
Qwen2.5-1.5B-Instruct Pixio ViT-B/16 encoder projector finetuned
Qwen2.5-1.5B-Instruct DINOv2 ViT-S/14 encoder projector finetuned
Qwen2.5-1.5B-Instruct DINO ViT-S/16 encoder projector finetuned
Qwen2.5-1.5B-Instruct EUPE ViT-S encoder projector finetuned
Qwen2.5-1.5B-Instruct DINO ViT-S/8 encoder projector finetuned
Qwen2.5-1.5B-Instruct EUPE ViT-T encoder projector finetuned

Qwen3-1.7B

Base LLM Vision Encoder / Tokenizer Encoder weights Stage 1 Pretrained weights Stage 2 Finetuned weights
Qwen3-1.7B PE-Core-G/14 (448) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-G/14 (378) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-G/14 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP-2.5B ViT-G/14 (224) encoder projector finetuned
Qwen3-1.7B SigLIP2 ViT-G/16 (384) encoder projector finetuned
Qwen3-1.7B SigLIP2 ViT-G/16 (256) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-H/14 (378) encoder projector finetuned
Qwen3-1.7B MetaCLIP-2.5B ViT-H/14 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP-v1.2 ViT-H/14 (224) encoder projector finetuned
Qwen3-1.7B OpenAI CLIP ViT-L/14 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-L/14 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP-2.5B ViT-L/14 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP-400M ViT-L/14 (224) encoder projector finetuned
Qwen3-1.7B SigLIP2 So400m/l14 (384) encoder projector finetuned
Qwen3-1.7B SigLIP2 So400m/l14 (224) encoder projector finetuned
Qwen3-1.7B SigLIP2 So400m/l16 (512) encoder projector finetuned
Qwen3-1.7B SigLIP2 So400m/l16 (384) encoder projector finetuned
Qwen3-1.7B SigLIP2 So400m/l16 (256) encoder projector finetuned
Qwen3-1.7B PE-Lang-L/14 (448) encoder projector finetuned
Qwen3-1.7B SigLIP2 ViT-L/16 (512) encoder projector finetuned
Qwen3-1.7B SigLIP2 ViT-L/16 (384) encoder projector finetuned
Qwen3-1.7B SigLIP2 ViT-L/16 (256) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-M/16 (384) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-M/16 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2-mT5 ViT-M/16 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-B/16 (384) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-B/16 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-B/32 (384) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-B/32 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2-mT5 ViT-B/32 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP-2.5B ViT-B/16 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP-2.5B ViT-B/32 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP-400M ViT-B/16 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP-400M ViT-B/32 (224) encoder projector finetuned
Qwen3-1.7B PE-Core-B/16 (224) encoder projector finetuned
Qwen3-1.7B SigLIP2 ViT-B/16 (512) encoder projector finetuned
Qwen3-1.7B SigLIP2 ViT-B/16 (384) encoder projector finetuned
Qwen3-1.7B SigLIP2 ViT-B/16 (256) encoder projector finetuned
Qwen3-1.7B SigLIP2 ViT-B/16 (224) encoder projector finetuned
Qwen3-1.7B SigLIP2 ViT-B/32 (256) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-S/16 (384) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2 ViT-S/16 (224) encoder projector finetuned
Qwen3-1.7B MetaCLIP 2-mT5 ViT-S/16 (224) encoder projector finetuned
Qwen3-1.7B Web-SSL MAE 3B (224) encoder files projector finetuned
Qwen3-1.7B DINOv2 ViT-G/14 encoder projector finetuned
Qwen3-1.7B Web-SSL DINO 1B (224) encoder files projector finetuned
Qwen3-1.7B Web-SSL MAE 1B (224) encoder projector finetuned
Qwen3-1.7B Pixio ViT-H/16 encoder projector finetuned
Qwen3-1.7B I-JEPA ViT-H/14 encoder projector finetuned
Qwen3-1.7B DINOv2 ViT-L/14 encoder projector finetuned
Qwen3-1.7B DINOv3 ViT-L/16 encoder projector finetuned
Qwen3-1.7B Pixio ViT-L/16 encoder projector finetuned
Qwen3-1.7B RAEv2 DINOv3-L (k=7) DINOv3 backbone projector finetuned
Qwen3-1.7B Web-SSL MAE 300M (224) encoder projector finetuned
Qwen3-1.7B EUPE ConvNeXt-B encoder projector finetuned
Qwen3-1.7B DINOv2 ViT-B/14 encoder projector finetuned
Qwen3-1.7B DINO ViT-B/8 encoder projector finetuned
Qwen3-1.7B DINO ViT-B/16 encoder projector finetuned
Qwen3-1.7B EUPE ViT-B encoder projector finetuned
Qwen3-1.7B Pixio ViT-B/16 encoder projector finetuned
Qwen3-1.7B DINOv2 ViT-S/14 encoder projector finetuned
Qwen3-1.7B DINO ViT-S/16 encoder projector finetuned
Qwen3-1.7B EUPE ViT-S encoder projector finetuned
Qwen3-1.7B DINO ViT-S/8 encoder projector finetuned
Qwen3-1.7B EUPE ViT-T encoder projector finetuned

SmolLM2-1.7B-Instruct

Base LLM Vision Encoder / Tokenizer Encoder weights Stage 1 Pretrained weights Stage 2 Finetuned weights
SmolLM2-1.7B-Instruct PE-Core-G/14 (448) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-G/14 (378) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-G/14 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP-2.5B ViT-G/14 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 ViT-G/16 (384) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 ViT-G/16 (256) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-H/14 (378) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP-2.5B ViT-H/14 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP-v1.2 ViT-H/14 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct OpenAI CLIP ViT-L/14 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-L/14 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP-2.5B ViT-L/14 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP-400M ViT-L/14 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 So400m/l14 (384) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 So400m/l14 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 So400m/l16 (512) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 So400m/l16 (384) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 So400m/l16 (256) encoder projector finetuned
SmolLM2-1.7B-Instruct PE-Lang-L/14 (448) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 ViT-L/16 (512) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 ViT-L/16 (384) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 ViT-L/16 (256) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-M/16 (384) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-M/16 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2-mT5 ViT-M/16 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-B/16 (384) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-B/16 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-B/32 (384) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-B/32 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2-mT5 ViT-B/32 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP-2.5B ViT-B/16 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP-2.5B ViT-B/32 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP-400M ViT-B/16 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP-400M ViT-B/32 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct PE-Core-B/16 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 ViT-B/16 (512) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 ViT-B/16 (384) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 ViT-B/16 (256) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 ViT-B/16 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct SigLIP2 ViT-B/32 (256) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-S/16 (384) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2 ViT-S/16 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct MetaCLIP 2-mT5 ViT-S/16 (224) encoder projector finetuned
SmolLM2-1.7B-Instruct Web-SSL MAE 3B (224) encoder files projector finetuned
SmolLM2-1.7B-Instruct DINOv2 ViT-G/14 encoder projector finetuned
SmolLM2-1.7B-Instruct Web-SSL DINO 1B (224) encoder files projector finetuned
SmolLM2-1.7B-Instruct Web-SSL MAE 1B (224) encoder projector finetuned
SmolLM2-1.7B-Instruct Pixio ViT-H/16 encoder projector finetuned
SmolLM2-1.7B-Instruct I-JEPA ViT-H/14 encoder projector finetuned
SmolLM2-1.7B-Instruct DINOv2 ViT-L/14 encoder projector finetuned
SmolLM2-1.7B-Instruct DINOv3 ViT-L/16 encoder projector finetuned
SmolLM2-1.7B-Instruct Pixio ViT-L/16 encoder projector finetuned
SmolLM2-1.7B-Instruct RAEv2 DINOv3-L (k=7) DINOv3 backbone projector finetuned
SmolLM2-1.7B-Instruct Web-SSL MAE 300M (224) encoder projector finetuned
SmolLM2-1.7B-Instruct EUPE ConvNeXt-B encoder projector finetuned
SmolLM2-1.7B-Instruct DINOv2 ViT-B/14 encoder projector finetuned
SmolLM2-1.7B-Instruct DINO ViT-B/8 encoder projector finetuned
SmolLM2-1.7B-Instruct DINO ViT-B/16 encoder projector finetuned
SmolLM2-1.7B-Instruct EUPE ViT-B encoder projector finetuned
SmolLM2-1.7B-Instruct Pixio ViT-B/16 encoder projector finetuned
SmolLM2-1.7B-Instruct DINOv2 ViT-S/14 encoder projector finetuned
SmolLM2-1.7B-Instruct DINO ViT-S/16 encoder projector finetuned
SmolLM2-1.7B-Instruct EUPE ViT-S encoder projector finetuned
SmolLM2-1.7B-Instruct DINO ViT-S/8 encoder projector finetuned
SmolLM2-1.7B-Instruct EUPE ViT-T encoder projector finetuned

Citation

If you use RAVEL or this model zoo, please cite:

@misc{yang2026strong,
  title={A Strong Baseline for Evaluating Vision Encoders in Multimodal Large Language Models},
  author={Yang, Yilin and Tang, Jun-Tao and Wang, Kengyi and Su, Siyuan and Luo, Gaoyong and Chen, Mingda},
  year={2026},
  eprint={2610.05413},
  archivePrefix={arXiv},
  primaryClass={cs.CV},
  url={https://arxiv.org/abs/2610.05413}
}
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Paper for 336labs/VisionEncoder-to-MLLM-ModelZoo