mjschock commited on
Commit
06c127c
·
unverified ·
1 Parent(s): 494f5dd
Files changed (1) hide show
  1. configuration_mobilevlm.py +0 -128
configuration_mobilevlm.py DELETED
@@ -1,128 +0,0 @@
1
- from typing import List, Optional
2
- from transformers import PretrainedConfig
3
-
4
- config = {
5
- "_name_or_path": "mtgv/MobileVLM-1.7B",
6
- "architectures": [
7
- "MobileLlamaForCausalLM"
8
- ],
9
- "bos_token_id": 1,
10
- "eos_token_id": 2,
11
- "freeze_mm_mlp_adapter": False,
12
- "hidden_act": "silu",
13
- "hidden_size": 2048,
14
- "image_aspect_ratio": "pad",
15
- "image_grid_pinpoints": None,
16
- "initializer_range": 0.02,
17
- "intermediate_size": 5632,
18
- "max_position_embeddings": 2048,
19
- "max_sequence_length": 2048,
20
- "mm_hidden_size": 1024,
21
- "mm_projector_type": "ldpnet",
22
- "mm_use_im_patch_token": False,
23
- "mm_use_im_start_end": False,
24
- "mm_vision_select_feature": "patch",
25
- "mm_vision_select_layer": -2,
26
- "mm_vision_tower": "openai/clip-vit-large-patch14-336",
27
- "model_type": "mobilevlm",
28
- "num_attention_heads": 16,
29
- "num_hidden_layers": 24,
30
- "num_key_value_heads": 16,
31
- "pad_token_id": 0,
32
- "pretraining_tp": 1,
33
- "rms_norm_eps": 1e-06,
34
- "rope_scaling": None,
35
- "rope_theta": 10000.0,
36
- "tie_word_embeddings": False,
37
- "torch_dtype": "bfloat16",
38
- "transformers_version": "4.33.1",
39
- "tune_mm_mlp_adapter": False,
40
- "use_cache": True,
41
- "use_mm_proj": True,
42
- "vision_tower_type": "clip",
43
- "vocab_size": 32000
44
- }
45
-
46
- class MobileVLMConfig(PretrainedConfig):
47
- model_type = "mobilevlm"
48
-
49
- def __init__(
50
- self,
51
- # _name_or_path: str = config["_name_or_path"],
52
- architectures: Optional[List[str]] = config["architectures"],
53
- bos_token_id: Optional[int] = config["bos_token_id"],
54
- eos_token_id: Optional[int] = config["eos_token_id"],
55
- freeze_mm_mlp_adapter: Optional[bool] = config["freeze_mm_mlp_adapter"],
56
- hidden_act: Optional[str] = config["hidden_act"],
57
- hidden_size: Optional[int] = config["hidden_size"],
58
- image_aspect_ratio: Optional[str] = config["image_aspect_ratio"],
59
- image_grid_pinpoints: Optional[bool] = config["image_grid_pinpoints"],
60
- initializer_range: Optional[float] = config["initializer_range"],
61
- intermediate_size: Optional[int] = config["intermediate_size"],
62
- max_position_embeddings: Optional[int] = config["max_position_embeddings"],
63
- max_sequence_length: Optional[int] = config["max_sequence_length"],
64
- mm_hidden_size: Optional[int] = config["mm_hidden_size"],
65
- mm_projector_type: Optional[str] = config["mm_projector_type"],
66
- mm_use_im_patch_token: Optional[bool] = config["mm_use_im_patch_token"],
67
- mm_use_im_start_end: Optional[bool] = config["mm_use_im_start_end"],
68
- mm_vision_select_feature: Optional[str] = config["mm_vision_select_feature"],
69
- mm_vision_select_layer: Optional[int] = config["mm_vision_select_layer"],
70
- mm_vision_tower: Optional[str] = config["mm_vision_tower"],
71
- # model_type: Optional[str] = config["model_type"],
72
- num_attention_heads: Optional[int] = config["num_attention_heads"],
73
- num_hidden_layers: Optional[int] = config["num_hidden_layers"],
74
- num_key_value_heads: Optional[int] = config["num_key_value_heads"],
75
- pad_token_id: Optional[int] = config["pad_token_id"],
76
- pretraining_tp: Optional[int] = config["pretraining_tp"],
77
- rms_norm_eps: Optional[float] = config["rms_norm_eps"],
78
- rope_scaling: Optional[float] = config["rope_scaling"],
79
- rope_theta: Optional[float] = config["rope_theta"],
80
- tie_word_embeddings: Optional[bool] = config["tie_word_embeddings"],
81
- # torch_dtype: Optional[str] = config["torch_dtype"],
82
- transformers_version: Optional[str] = config["transformers_version"],
83
- tune_mm_mlp_adapter: Optional[bool] = config["tune_mm_mlp_adapter"],
84
- use_cache: Optional[bool] = config["use_cache"],
85
- use_mm_proj: Optional[bool] = config["use_mm_proj"],
86
- vision_tower_type: Optional[str] = config["vision_tower_type"],
87
- vocab_size: Optional[int] = config["vocab_size"],
88
- **kwargs,
89
- ):
90
- # self._name_or_path = _name_or_path
91
- self.architectures = architectures
92
- self.bos_token_id = bos_token_id
93
- self.eos_token_id = eos_token_id
94
- self.freeze_mm_mlp_adapter = freeze_mm_mlp_adapter
95
- self.hidden_act = hidden_act
96
- self.hidden_size = hidden_size
97
- self.image_aspect_ratio = image_aspect_ratio
98
- self.image_grid_pinpoints = image_grid_pinpoints
99
- self.initializer_range = initializer_range
100
- self.intermediate_size = intermediate_size
101
- self.max_position_embeddings = max_position_embeddings
102
- self.max_sequence_length = max_sequence_length
103
- self.mm_hidden_size = mm_hidden_size
104
- self.mm_projector_type = mm_projector_type
105
- self.mm_use_im_patch_token = mm_use_im_patch_token
106
- self.mm_use_im_start_end = mm_use_im_start_end
107
- self.mm_vision_select_feature = mm_vision_select_feature
108
- self.mm_vision_select_layer = mm_vision_select_layer
109
- self.mm_vision_tower = mm_vision_tower
110
- # self.model_type = model_type
111
- self.num_attention_heads = num_attention_heads
112
- self.num_hidden_layers = num_hidden_layers
113
- self.num_key_value_heads = num_key_value_heads
114
- self.pad_token_id = pad_token_id
115
- self.pretraining_tp = pretraining_tp
116
- self.rms_norm_eps = rms_norm_eps
117
- self.rope_scaling = rope_scaling
118
- self.rope_theta = rope_theta
119
- self.tie_word_embeddings = tie_word_embeddings
120
- # self.torch_dtype = torch_dtype
121
- self.transformers_version = transformers_version
122
- self.tune_mm_mlp_adapter = tune_mm_mlp_adapter
123
- self.use_cache = use_cache
124
- self.use_mm_proj = use_mm_proj
125
- self.vision_tower_type = vision_tower_type
126
- self.vocab_size = vocab_size
127
-
128
- super().__init__(**kwargs)