AntonV HF Staff commited on
Commit
9f6c373
·
verified ·
1 Parent(s): b6b5f9a

Use pretrained first 2 text layers and 2 vision blocks

Browse files
config.json CHANGED
@@ -4,9 +4,9 @@
4
  "HyperCLOVAXVisionV2ForConditionalGeneration"
5
  ],
6
  "audio_projector_type": "mlp",
7
- "dtype": "float32",
8
  "eos_token_id": 128001,
9
- "hidden_size": 32,
10
  "ignore_index": -100,
11
  "image_end_token_id": 128057,
12
  "image_start_token_id": 128056,
@@ -24,22 +24,23 @@
24
  ],
25
  "attention_bias": false,
26
  "attention_dropout": 0.0,
27
- "attention_multiplier": 0.25,
28
  "bos_token_id": 128000,
 
29
  "embedding_multiplier": 1.0,
30
  "eos_token_id": 128001,
31
- "head_dim": 16,
32
  "hidden_act": "silu",
33
- "hidden_size": 32,
34
  "initializer_range": 0.006,
35
- "intermediate_size": 64,
36
  "logits_scaling": 1.0,
37
  "max_position_embeddings": 131072,
38
  "mlp_bias": false,
39
  "model_type": "hyperclovax",
40
- "num_attention_heads": 2,
41
  "num_hidden_layers": 2,
42
- "num_key_value_heads": 1,
43
  "pad_token_id": 0,
44
  "pretraining_tp": 1,
45
  "resid_pdrop": 0.2,
@@ -71,19 +72,18 @@
71
  "Qwen2_5_VisionTransformerPretrainedModel"
72
  ],
73
  "depth": 2,
74
- "fullatt_block_indexes": [
75
- 1
76
- ],
77
  "hidden_act": "silu",
78
- "hidden_size": 32,
79
  "in_channels": 3,
80
  "in_chans": 3,
81
  "initializer_range": 0.02,
82
- "intermediate_size": 64,
83
  "max_num_grids": -1,
84
  "model_type": "qwen2_5_vl_vision",
85
- "num_heads": 2,
86
- "out_hidden_size": 32,
87
  "patch_size": 14,
88
  "rope_parameters": {
89
  "rope_theta": 10000.0,
 
4
  "HyperCLOVAXVisionV2ForConditionalGeneration"
5
  ],
6
  "audio_projector_type": "mlp",
7
+ "dtype": "bfloat16",
8
  "eos_token_id": 128001,
9
+ "hidden_size": 5120,
10
  "ignore_index": -100,
11
  "image_end_token_id": 128057,
12
  "image_start_token_id": 128056,
 
24
  ],
25
  "attention_bias": false,
26
  "attention_dropout": 0.0,
27
+ "attention_multiplier": 0.08838834764831845,
28
  "bos_token_id": 128000,
29
+ "dtype": "bfloat16",
30
  "embedding_multiplier": 1.0,
31
  "eos_token_id": 128001,
32
+ "head_dim": 128,
33
  "hidden_act": "silu",
34
+ "hidden_size": 5120,
35
  "initializer_range": 0.006,
36
+ "intermediate_size": 24192,
37
  "logits_scaling": 1.0,
38
  "max_position_embeddings": 131072,
39
  "mlp_bias": false,
40
  "model_type": "hyperclovax",
41
+ "num_attention_heads": 40,
42
  "num_hidden_layers": 2,
43
+ "num_key_value_heads": 8,
44
  "pad_token_id": 0,
45
  "pretraining_tp": 1,
46
  "resid_pdrop": 0.2,
 
72
  "Qwen2_5_VisionTransformerPretrainedModel"
73
  ],
74
  "depth": 2,
75
+ "dtype": "bfloat16",
76
+ "fullatt_block_indexes": [],
 
77
  "hidden_act": "silu",
78
+ "hidden_size": 1280,
79
  "in_channels": 3,
80
  "in_chans": 3,
81
  "initializer_range": 0.02,
82
+ "intermediate_size": 3456,
83
  "max_num_grids": -1,
84
  "model_type": "qwen2_5_vl_vision",
85
+ "num_heads": 16,
86
+ "out_hidden_size": 5120,
87
  "patch_size": 14,
88
  "rope_parameters": {
89
  "rope_theta": 10000.0,
model-00001-of-00003.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2e40eedd111044e0a4e7596cf6a2b6badef53d118082405163ed611c964493f6
3
+ size 1313341592
model-00002-of-00003.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:62b7b6cb3bb010c493216decf7b9f014cb1f3a8c6c8eccb7baf17caef85ab147
3
+ size 1808804408
model-00003-of-00003.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f01efde7f673c7255a306d8130dd74faebc64fea1677c7d723333c9e5ee397f5
3
+ size 1482301776
model.safetensors.index.json ADDED
@@ -0,0 +1,61 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "metadata": {
3
+ "total_parameters": 2302220544,
4
+ "total_size": 4604441088
5
+ },
6
+ "weight_map": {
7
+ "model.language_model.lm_head.weight": "model-00001-of-00003.safetensors",
8
+ "model.language_model.model.embed_tokens.weight": "model-00002-of-00003.safetensors",
9
+ "model.language_model.model.layers.0.input_layernorm.weight": "model-00002-of-00003.safetensors",
10
+ "model.language_model.model.layers.0.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
11
+ "model.language_model.model.layers.0.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
12
+ "model.language_model.model.layers.0.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
13
+ "model.language_model.model.layers.0.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
14
+ "model.language_model.model.layers.0.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
15
+ "model.language_model.model.layers.0.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
16
+ "model.language_model.model.layers.0.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
17
+ "model.language_model.model.layers.0.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
18
+ "model.language_model.model.layers.1.input_layernorm.weight": "model-00003-of-00003.safetensors",
19
+ "model.language_model.model.layers.1.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
20
+ "model.language_model.model.layers.1.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
21
+ "model.language_model.model.layers.1.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
22
+ "model.language_model.model.layers.1.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
23
+ "model.language_model.model.layers.1.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
24
+ "model.language_model.model.layers.1.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
25
+ "model.language_model.model.layers.1.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
26
+ "model.language_model.model.layers.1.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
27
+ "model.language_model.model.norm.weight": "model-00003-of-00003.safetensors",
28
+ "model.vision_model.blocks.0.attn.proj.bias": "model-00003-of-00003.safetensors",
29
+ "model.vision_model.blocks.0.attn.proj.weight": "model-00003-of-00003.safetensors",
30
+ "model.vision_model.blocks.0.attn.qkv.bias": "model-00003-of-00003.safetensors",
31
+ "model.vision_model.blocks.0.attn.qkv.weight": "model-00003-of-00003.safetensors",
32
+ "model.vision_model.blocks.0.mlp.down_proj.bias": "model-00003-of-00003.safetensors",
33
+ "model.vision_model.blocks.0.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
34
+ "model.vision_model.blocks.0.mlp.gate_proj.bias": "model-00003-of-00003.safetensors",
35
+ "model.vision_model.blocks.0.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
36
+ "model.vision_model.blocks.0.mlp.up_proj.bias": "model-00003-of-00003.safetensors",
37
+ "model.vision_model.blocks.0.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
38
+ "model.vision_model.blocks.0.norm1.weight": "model-00003-of-00003.safetensors",
39
+ "model.vision_model.blocks.0.norm2.weight": "model-00003-of-00003.safetensors",
40
+ "model.vision_model.blocks.1.attn.proj.bias": "model-00003-of-00003.safetensors",
41
+ "model.vision_model.blocks.1.attn.proj.weight": "model-00003-of-00003.safetensors",
42
+ "model.vision_model.blocks.1.attn.qkv.bias": "model-00003-of-00003.safetensors",
43
+ "model.vision_model.blocks.1.attn.qkv.weight": "model-00003-of-00003.safetensors",
44
+ "model.vision_model.blocks.1.mlp.down_proj.bias": "model-00003-of-00003.safetensors",
45
+ "model.vision_model.blocks.1.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
46
+ "model.vision_model.blocks.1.mlp.gate_proj.bias": "model-00003-of-00003.safetensors",
47
+ "model.vision_model.blocks.1.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
48
+ "model.vision_model.blocks.1.mlp.up_proj.bias": "model-00003-of-00003.safetensors",
49
+ "model.vision_model.blocks.1.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
50
+ "model.vision_model.blocks.1.norm1.weight": "model-00003-of-00003.safetensors",
51
+ "model.vision_model.blocks.1.norm2.weight": "model-00003-of-00003.safetensors",
52
+ "model.vision_model.merger.ln_q.weight": "model-00003-of-00003.safetensors",
53
+ "model.vision_model.merger.mlp.0.bias": "model-00003-of-00003.safetensors",
54
+ "model.vision_model.merger.mlp.0.weight": "model-00003-of-00003.safetensors",
55
+ "model.vision_model.merger.mlp.2.bias": "model-00003-of-00003.safetensors",
56
+ "model.vision_model.merger.mlp.2.weight": "model-00003-of-00003.safetensors",
57
+ "model.vision_model.patch_embed.proj.weight": "model-00003-of-00003.safetensors",
58
+ "model.vision_projector.bias": "model-00003-of-00003.safetensors",
59
+ "model.vision_projector.weight": "model-00003-of-00003.safetensors"
60
+ }
61
+ }