Image-Text-to-Text
Transformers
GGUF
miniart_vision
text-generation
multimodal
vision
reasoning
lm-studio
ollama
clip
slm
conversational
File size: 416 Bytes
c6efb08
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
{
  "_name_or_path": "Dev4285/MiniArt-2.0",
  "architectures": [
    "MiniArtForConditionalGeneration"
  ],
  "model_type": "miniart_vision",
  "text_config": {
    "hidden_size": 1024,
    "num_attention_heads": 16,
    "num_hidden_layers": 24,
    "vocab_size": 32000
  },
  "vision_config": {
    "hidden_size": 768,
    "image_size": 224,
    "patch_size": 16
  },
  "torch_dtype": "bfloat16"
}