hf-transformers-bot commited on
Commit
ce8a384
·
verified ·
1 Parent(s): ec76e9b

Update tiny models for GlmImageVisionModel

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
chat_template.jinja ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- for m in messages -%}
2
+ {%- if m.content is string -%}
3
+ {{ m.content }}
4
+ {%- else -%}
5
+ {%- for item in m.content -%}
6
+ {%- if item.type == 'image' or item.get('image') is not none -%}
7
+ <|dit_token_16384|><|image|><|dit_token_16385|>
8
+ {%- elif item.type == 'text' -%}
9
+ {{ item.text }}
10
+ {%- endif -%}
11
+ {%- endfor -%}
12
+ {%- endif -%}
13
+ {%- endfor -%}
config.json ADDED
@@ -0,0 +1,22 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "GlmImageVisionModel"
4
+ ],
5
+ "attention_bias": true,
6
+ "attention_dropout": 0.0,
7
+ "depth": 2,
8
+ "dtype": "float32",
9
+ "hidden_act": "gelu",
10
+ "hidden_size": 32,
11
+ "image_size": 128,
12
+ "in_channels": 3,
13
+ "initializer_range": 0.02,
14
+ "intermediate_size": 22,
15
+ "layer_norm_eps": 1e-06,
16
+ "model_type": "glm_image_vision",
17
+ "num_heads": 16,
18
+ "patch_size": 16,
19
+ "spatial_merge_size": 1,
20
+ "temporal_patch_size": 1,
21
+ "transformers_version": "5.16.0.dev0"
22
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c030ba2a95aa68a518d36d39bfc1d6f75a4ab2cd8ac5b94404ce8d08a606e82a
3
+ size 155456
preprocessor_config.json ADDED
@@ -0,0 +1,30 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "crop_size": {
3
+ "longest_edge": 128,
4
+ "shortest_edge": 128
5
+ },
6
+ "do_convert_rgb": true,
7
+ "do_normalize": true,
8
+ "do_rescale": true,
9
+ "do_resize": true,
10
+ "image_mean": [
11
+ 0.48145466,
12
+ 0.4578275,
13
+ 0.40821073
14
+ ],
15
+ "image_processor_type": "GlmImageImageProcessor",
16
+ "image_std": [
17
+ 0.26862954,
18
+ 0.26130258,
19
+ 0.27577711
20
+ ],
21
+ "merge_size": 2,
22
+ "patch_size": 14,
23
+ "resample": 3,
24
+ "rescale_factor": 0.00392156862745098,
25
+ "size": {
26
+ "longest_edge": 128,
27
+ "shortest_edge": 128
28
+ },
29
+ "temporal_patch_size": 2
30
+ }
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d771c9659fd2c65c0ef8a8daf9d9f9f07b53f89ce164cc832a28137db604d01d
3
+ size 23765636
tokenizer_config.json ADDED
@@ -0,0 +1,44 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "bos_token": "<|dit_token_16384|>",
4
+ "clean_up_tokenization_spaces": false,
5
+ "do_lower_case": false,
6
+ "eos_token": "<|dit_token_16385|>",
7
+ "extra_special_tokens": [
8
+ "<|endoftext|>",
9
+ "[MASK]",
10
+ "[gMASK]",
11
+ "[sMASK]",
12
+ "<sop>",
13
+ "<eop>",
14
+ "<|system|>",
15
+ "<|user|>",
16
+ "<|assistant|>",
17
+ "<|observation|>",
18
+ "<|begin_of_image|>",
19
+ "<|end_of_image|>",
20
+ "<|begin_of_video|>",
21
+ "<|end_of_video|>",
22
+ "<|image|>",
23
+ "<|video|>"
24
+ ],
25
+ "grid_bos_token": "<sop>",
26
+ "grid_eos_token": "<eop>",
27
+ "image_token": "<|image|>",
28
+ "is_local": true,
29
+ "local_files_only": false,
30
+ "model_input_names": [
31
+ "input_ids",
32
+ "attention_mask"
33
+ ],
34
+ "model_max_length": 65536,
35
+ "model_specific_special_tokens": {
36
+ "grid_bos_token": "<sop>",
37
+ "grid_eos_token": "<eop>",
38
+ "image_token": "<|image|>"
39
+ },
40
+ "pad_token": "<|dit_token_16385|>",
41
+ "padding_side": "left",
42
+ "remove_space": false,
43
+ "tokenizer_class": "TokenizersBackend"
44
+ }