{ "architecture": "OpenVision2TextDecoder", "fusion_style": "concat", "width": 768, "depth": 12, "num_heads": 12, "mlp_dim": 3072, "vocab_size": 32000, "vision_width": 1024, "layer_norm_eps": 1e-06, "pad_id": 0, "bos_id": 1, "eos_id": 2, "weights_file": "caption_decoder.safetensors", "modeling_file": "modeling_openvision2_decoder.py", "tokenizer": "bert wordpiece (bert_base_vocab_bos_eos.txt), lowercase, [PAD]=0 [bos]=1 [eos]=2" }