lkhphuc commited on
Commit
def4178
·
1 Parent(s): 3b0a0d5

Add exported weights

Browse files
anyup.py CHANGED
@@ -76,53 +76,6 @@ class ResBlock(nn.Module):
76
  # LearnedFeatureUnification (from layers/feature_unification.py)
77
  # ---------------------------------------------------------------------------
78
 
79
- compute_basis_size = {
80
- "gauss_deriv": lambda order, mirror: ((order + 1) * (order + 2))
81
- // (1 if mirror else 2)
82
- }
83
-
84
-
85
- def herme_vander_torch(z, m):
86
- He0 = z.new_ones(z.shape)
87
- if m == 0:
88
- return He0[:, None]
89
- H = [He0, z]
90
- for n in range(1, m):
91
- H.append(z * H[-1] - n * H[-2])
92
- return torch.stack(H, 1)
93
-
94
-
95
- def gauss_deriv(
96
- max_order,
97
- device,
98
- dtype,
99
- kernel_size,
100
- sigma=None,
101
- include_negations=False,
102
- scale_magnitude=True,
103
- ):
104
- sigma = (kernel_size // 2) / 1.645 if sigma is None else sigma
105
- if kernel_size % 2 == 0:
106
- raise ValueError("ksize must be odd")
107
- half = kernel_size // 2
108
- x = torch.arange(-half, half + 1, dtype=dtype, device=device)
109
- z = x / sigma
110
- g = torch.exp(-0.5 * z**2) / (sigma * (2.0 * torch.pi) ** 0.5)
111
- He = herme_vander_torch(z, max_order)
112
- derivs_1d = [
113
- (((-1) ** n) / (sigma**n) if scale_magnitude else (-1) ** n) * He[:, n] * g
114
- for n in range(max_order + 1)
115
- ]
116
- bank = []
117
- for o in range(max_order + 1):
118
- for i in range(o + 1):
119
- K = torch.outer(derivs_1d[o - i], derivs_1d[i])
120
- bank.append(K)
121
- if include_negations:
122
- bank.append(-K)
123
- return torch.stack(bank, 0)
124
-
125
-
126
  class LearnedFeatureUnification(nn.Module):
127
  def __init__(
128
  self,
@@ -133,26 +86,9 @@ class LearnedFeatureUnification(nn.Module):
133
  super().__init__()
134
  self.out_channels = out_channels
135
  self.kernel_size = kernel_size
136
- if init_gaussian_derivatives:
137
- order = 0
138
- while compute_basis_size["gauss_deriv"](order, False) < out_channels:
139
- order += 1
140
- print(
141
- f"FeatureUnification: initializing with Gaussian derivative basis of order {order}"
142
- )
143
- self.basis = nn.Parameter(
144
- gauss_deriv(
145
- order,
146
- device="cpu",
147
- dtype=torch.float32,
148
- kernel_size=kernel_size,
149
- scale_magnitude=False,
150
- )[:out_channels, None]
151
- )
152
- else:
153
- self.basis = nn.Parameter(
154
- torch.randn(out_channels, 1, kernel_size, kernel_size)
155
- )
156
 
157
  def forward(self, features: torch.Tensor) -> torch.Tensor:
158
  b, c, h, w = features.shape
 
76
  # LearnedFeatureUnification (from layers/feature_unification.py)
77
  # ---------------------------------------------------------------------------
78
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
79
  class LearnedFeatureUnification(nn.Module):
80
  def __init__(
81
  self,
 
86
  super().__init__()
87
  self.out_channels = out_channels
88
  self.kernel_size = kernel_size
89
+ self.basis = nn.Parameter(
90
+ torch.randn(out_channels, 1, kernel_size, kernel_size)
91
+ )
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
92
 
93
  def forward(self, features: torch.Tensor) -> torch.Tensor:
94
  b, c, h, w = features.shape
config.json CHANGED
@@ -7,8 +7,7 @@
7
  "AutoModelForCausalLM": "modeling_falcon_perception.FalconPerceptionForSegmentation"
8
  },
9
  "model_type": "falcon_perception",
10
- "torch_dtype": "bfloat16",
11
-
12
  "dim": 1024,
13
  "n_layers": 28,
14
  "n_heads": 16,
@@ -19,38 +18,27 @@
19
  "norm_eps": 1e-05,
20
  "max_seq_len": 8192,
21
  "rope_theta": 10000,
22
-
23
  "channel_size": 3,
24
  "spatial_patch_size": 16,
25
  "temporal_patch_size": 1,
26
-
27
  "do_segmentation": true,
28
  "segm_out_dim": 256,
29
  "num_segm_layers": 3,
30
-
31
  "coord_enc_dim": 512,
32
  "coord_dec_dim": 8192,
33
  "coord_out_dim": 2048,
34
  "coord_token_id": 240,
35
-
36
  "size_enc_dim": 512,
37
  "size_dec_dim": 8192,
38
  "size_out_dim": 2048,
39
  "size_token_id": 241,
40
-
41
  "seg_token_id": 262,
42
- "img_id": 227,
43
  "eos_id": 11,
 
44
  "image_cls_token_id": 244,
45
- "image_mask_token_id": 243,
46
  "image_reg_1_token_id": 245,
47
  "image_reg_2_token_id": 246,
48
  "image_reg_3_token_id": 247,
49
  "image_reg_4_token_id": 248,
50
- "img_start_id": 229,
51
- "img_end_id": 230,
52
- "img_row_sep_id": 228,
53
- "vid_start_id": 231,
54
- "vid_end_id": 232,
55
- "frame_sep_id": 233
56
- }
 
7
  "AutoModelForCausalLM": "modeling_falcon_perception.FalconPerceptionForSegmentation"
8
  },
9
  "model_type": "falcon_perception",
10
+ "torch_dtype": "float32",
 
11
  "dim": 1024,
12
  "n_layers": 28,
13
  "n_heads": 16,
 
18
  "norm_eps": 1e-05,
19
  "max_seq_len": 8192,
20
  "rope_theta": 10000,
 
21
  "channel_size": 3,
22
  "spatial_patch_size": 16,
23
  "temporal_patch_size": 1,
 
24
  "do_segmentation": true,
25
  "segm_out_dim": 256,
26
  "num_segm_layers": 3,
 
27
  "coord_enc_dim": 512,
28
  "coord_dec_dim": 8192,
29
  "coord_out_dim": 2048,
30
  "coord_token_id": 240,
 
31
  "size_enc_dim": 512,
32
  "size_dec_dim": 8192,
33
  "size_out_dim": 2048,
34
  "size_token_id": 241,
 
35
  "seg_token_id": 262,
 
36
  "eos_id": 11,
37
+ "img_id": 227,
38
  "image_cls_token_id": 244,
 
39
  "image_reg_1_token_id": 245,
40
  "image_reg_2_token_id": 246,
41
  "image_reg_3_token_id": 247,
42
  "image_reg_4_token_id": 248,
43
+ "img_end_id": 230
44
+ }
 
 
 
 
 
configuration_falcon_perception.py CHANGED
@@ -31,20 +31,14 @@ class FalconPerceptionConfig(PretrainedConfig):
31
  size_out_dim: int = 2048,
32
  size_token_id: int = 241,
33
  seg_token_id: int = 262,
34
- img_id: int = 227,
35
  eos_id: int = 11,
 
36
  image_cls_token_id: int = 244,
37
- image_mask_token_id: int = 243,
38
  image_reg_1_token_id: int = 245,
39
  image_reg_2_token_id: int = 246,
40
  image_reg_3_token_id: int = 247,
41
  image_reg_4_token_id: int = 248,
42
- img_start_id: int = 229,
43
  img_end_id: int = 230,
44
- img_row_sep_id: int = 228,
45
- vid_start_id: int = 231,
46
- vid_end_id: int = 232,
47
- frame_sep_id: int = 233,
48
  **kwargs,
49
  ):
50
  self.dim = dim
@@ -72,18 +66,12 @@ class FalconPerceptionConfig(PretrainedConfig):
72
  self.size_out_dim = size_out_dim
73
  self.size_token_id = size_token_id
74
  self.seg_token_id = seg_token_id
75
- self.img_id = img_id
76
  self.eos_id = eos_id
 
77
  self.image_cls_token_id = image_cls_token_id
78
- self.image_mask_token_id = image_mask_token_id
79
  self.image_reg_1_token_id = image_reg_1_token_id
80
  self.image_reg_2_token_id = image_reg_2_token_id
81
  self.image_reg_3_token_id = image_reg_3_token_id
82
  self.image_reg_4_token_id = image_reg_4_token_id
83
- self.img_start_id = img_start_id
84
  self.img_end_id = img_end_id
85
- self.img_row_sep_id = img_row_sep_id
86
- self.vid_start_id = vid_start_id
87
- self.vid_end_id = vid_end_id
88
- self.frame_sep_id = frame_sep_id
89
  super().__init__(**kwargs)
 
31
  size_out_dim: int = 2048,
32
  size_token_id: int = 241,
33
  seg_token_id: int = 262,
 
34
  eos_id: int = 11,
35
+ img_id: int = 227,
36
  image_cls_token_id: int = 244,
 
37
  image_reg_1_token_id: int = 245,
38
  image_reg_2_token_id: int = 246,
39
  image_reg_3_token_id: int = 247,
40
  image_reg_4_token_id: int = 248,
 
41
  img_end_id: int = 230,
 
 
 
 
42
  **kwargs,
43
  ):
44
  self.dim = dim
 
66
  self.size_out_dim = size_out_dim
67
  self.size_token_id = size_token_id
68
  self.seg_token_id = seg_token_id
 
69
  self.eos_id = eos_id
70
+ self.img_id = img_id
71
  self.image_cls_token_id = image_cls_token_id
 
72
  self.image_reg_1_token_id = image_reg_1_token_id
73
  self.image_reg_2_token_id = image_reg_2_token_id
74
  self.image_reg_3_token_id = image_reg_3_token_id
75
  self.image_reg_4_token_id = image_reg_4_token_id
 
76
  self.img_end_id = img_end_id
 
 
 
 
77
  super().__init__(**kwargs)
model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:17b7e908aee8afc1ade0af64e5107d2dc63bb9a287acc407041c3ef5e4278f26
3
  size 2529523048
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d842c991349d997852c99ebf0dc6d368fc70b73c658d117a3088132a6cbb68ca
3
  size 2529523048
model_args.json CHANGED
@@ -7,10 +7,8 @@
7
  "dim": 1024,
8
  "eos_id": 11,
9
  "ffn_dim": 3072,
10
- "frame_sep_id": 233,
11
  "head_dim": 128,
12
  "image_cls_token_id": 244,
13
- "image_mask_token_id": 243,
14
  "image_reg_1_token_id": 245,
15
  "image_reg_2_token_id": 246,
16
  "image_reg_3_token_id": 247,
@@ -35,7 +33,5 @@
35
  "size_token_id": 241,
36
  "spatial_patch_size": 16,
37
  "temporal_patch_size": 1,
38
- "vid_end_id": 232,
39
- "vid_start_id": 231,
40
  "vocab_size": 65536
41
  }
 
7
  "dim": 1024,
8
  "eos_id": 11,
9
  "ffn_dim": 3072,
 
10
  "head_dim": 128,
11
  "image_cls_token_id": 244,
 
12
  "image_reg_1_token_id": 245,
13
  "image_reg_2_token_id": 246,
14
  "image_reg_3_token_id": 247,
 
33
  "size_token_id": 241,
34
  "spatial_patch_size": 16,
35
  "temporal_patch_size": 1,
 
 
36
  "vocab_size": 65536
37
  }
tokenizer.json CHANGED
@@ -4752,7 +4752,32 @@
4752
  }
4753
  ]
4754
  },
4755
- "post_processor": null,
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
4756
  "decoder": {
4757
  "type": "ByteLevel",
4758
  "add_prefix_space": true,
 
4752
  }
4753
  ]
4754
  },
4755
+ "post_processor": {
4756
+ "type": "TemplateProcessing",
4757
+ "single": [
4758
+ {
4759
+ "Sequence": {
4760
+ "id": "A",
4761
+ "type_id": 0
4762
+ }
4763
+ }
4764
+ ],
4765
+ "pair": [
4766
+ {
4767
+ "Sequence": {
4768
+ "id": "A",
4769
+ "type_id": 0
4770
+ }
4771
+ },
4772
+ {
4773
+ "Sequence": {
4774
+ "id": "B",
4775
+ "type_id": 1
4776
+ }
4777
+ }
4778
+ ],
4779
+ "special_tokens": {}
4780
+ },
4781
  "decoder": {
4782
  "type": "ByteLevel",
4783
  "add_prefix_space": true,
tokenizer_config.json CHANGED
@@ -13,7 +13,26 @@
13
  "end_of_turn_token": "<|end_of_turn|>",
14
  "end_of_video_token": "<|end_of_video|>",
15
  "eos_token": "<|end_of_text|>",
16
- "extra_special_tokens": {
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
17
  "absence_token": "<|absence|>",
18
  "caption_token": "<|CAPTION|>",
19
  "coord_token": "<|coord|>",
@@ -59,24 +78,6 @@
59
  "start_of_video_token": "<|start_of_video|>",
60
  "task_sep_token": "<|task_sep|>"
61
  },
62
- "frame_sep_token": "<|frame_sep|>",
63
- "image_cls_token": "<|image_cls|>",
64
- "image_mask_token": "<|image_mask_token|>",
65
- "image_reg_1_token": "<|image_reg_1|>",
66
- "image_reg_2_token": "<|image_reg_2|>",
67
- "image_reg_3_token": "<|image_reg_3|>",
68
- "image_reg_4_token": "<|image_reg_4|>",
69
- "image_reg_5_token": "<|image_reg_5|>",
70
- "image_reg_6_token": "<|image_reg_6|>",
71
- "image_reg_7_token": "<|image_reg_7|>",
72
- "image_reg_8_token": "<|image_reg_8|>",
73
- "image_row_sep_token": "<|image_row_sep|>",
74
- "image_token": "<|image|>",
75
- "model_input_names": [
76
- "input_ids",
77
- "attention_mask"
78
- ],
79
- "model_max_length": 1000000000000000019884624838656,
80
  "object_token": "<|object|>",
81
  "ocr_doc_parser_token": "<|OCR_DOC_PARSER|>",
82
  "ocr_grounding_token": "<|OCR_GROUNDING|>",
@@ -97,5 +98,5 @@
97
  "start_of_turn_token": "<|start_of_turn|>",
98
  "start_of_video_token": "<|start_of_video|>",
99
  "task_sep_token": "<|task_sep|>",
100
- "tokenizer_class": "PreTrainedTokenizerFast"
101
  }
 
13
  "end_of_turn_token": "<|end_of_turn|>",
14
  "end_of_video_token": "<|end_of_video|>",
15
  "eos_token": "<|end_of_text|>",
16
+ "frame_sep_token": "<|frame_sep|>",
17
+ "image_cls_token": "<|image_cls|>",
18
+ "image_mask_token": "<|image_mask_token|>",
19
+ "image_reg_1_token": "<|image_reg_1|>",
20
+ "image_reg_2_token": "<|image_reg_2|>",
21
+ "image_reg_3_token": "<|image_reg_3|>",
22
+ "image_reg_4_token": "<|image_reg_4|>",
23
+ "image_reg_5_token": "<|image_reg_5|>",
24
+ "image_reg_6_token": "<|image_reg_6|>",
25
+ "image_reg_7_token": "<|image_reg_7|>",
26
+ "image_reg_8_token": "<|image_reg_8|>",
27
+ "image_row_sep_token": "<|image_row_sep|>",
28
+ "image_token": "<|image|>",
29
+ "is_local": true,
30
+ "model_input_names": [
31
+ "input_ids",
32
+ "attention_mask"
33
+ ],
34
+ "model_max_length": 1000000000000000019884624838656,
35
+ "model_specific_special_tokens": {
36
  "absence_token": "<|absence|>",
37
  "caption_token": "<|CAPTION|>",
38
  "coord_token": "<|coord|>",
 
78
  "start_of_video_token": "<|start_of_video|>",
79
  "task_sep_token": "<|task_sep|>"
80
  },
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
81
  "object_token": "<|object|>",
82
  "ocr_doc_parser_token": "<|OCR_DOC_PARSER|>",
83
  "ocr_grounding_token": "<|OCR_GROUNDING|>",
 
98
  "start_of_turn_token": "<|start_of_turn|>",
99
  "start_of_video_token": "<|start_of_video|>",
100
  "task_sep_token": "<|task_sep|>",
101
+ "tokenizer_class": "TokenizersBackend"
102
  }