Yanqing0327's picture
Add caption text decoder (encoder + decoder = full OpenVision2 generative model)
14fe0b8 verified
Raw
History Blame Contribute Delete
464 Bytes
{
"architecture": "OpenVision2TextDecoder",
"fusion_style": "concat",
"width": 768,
"depth": 12,
"num_heads": 12,
"mlp_dim": 3072,
"vocab_size": 32000,
"vision_width": 1024,
"layer_norm_eps": 1e-06,
"pad_id": 0,
"bos_id": 1,
"eos_id": 2,
"weights_file": "caption_decoder.safetensors",
"modeling_file": "modeling_openvision2_decoder.py",
"tokenizer": "bert wordpiece (bert_base_vocab_bos_eos.txt), lowercase, [PAD]=0 [bos]=1 [eos]=2"
}