Yanqing0327's picture
Add caption text decoder (encoder + decoder = full OpenVision2 generative model)
796a445 verified
Raw
History Blame Contribute Delete
465 Bytes
{
"architecture": "OpenVision2TextDecoder",
"fusion_style": "concat",
"width": 1024,
"depth": 24,
"num_heads": 16,
"mlp_dim": 4096,
"vocab_size": 32000,
"vision_width": 1280,
"layer_norm_eps": 1e-06,
"pad_id": 0,
"bos_id": 1,
"eos_id": 2,
"weights_file": "caption_decoder.safetensors",
"modeling_file": "modeling_openvision2_decoder.py",
"tokenizer": "bert wordpiece (bert_base_vocab_bos_eos.txt), lowercase, [PAD]=0 [bos]=1 [eos]=2"
}