milan400 commited on
Commit
473ddeb
·
verified ·
1 Parent(s): c18ad68

Upload tokenizer

Browse files
Files changed (3) hide show
  1. special_tokens_map.json +22 -4
  2. tokenizer.json +9 -9
  3. tokenizer_config.json +11 -6
special_tokens_map.json CHANGED
@@ -1,6 +1,24 @@
1
  {
2
- "bos_token": "<|startoftext|>",
3
- "eos_token": "<|endoftext|>",
4
- "pad_token": "<|endoftext|>",
5
- "unk_token": "<unk>"
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
6
  }
 
1
  {
2
+ "bos_token": {
3
+ "content": "<|startoftext|>",
4
+ "lstrip": false,
5
+ "normalized": true,
6
+ "rstrip": false,
7
+ "single_word": false
8
+ },
9
+ "eos_token": {
10
+ "content": "<|im_end|>",
11
+ "lstrip": false,
12
+ "normalized": false,
13
+ "rstrip": false,
14
+ "single_word": false
15
+ },
16
+ "pad_token": "<|im_end|>",
17
+ "unk_token": {
18
+ "content": "<unk>",
19
+ "lstrip": false,
20
+ "normalized": true,
21
+ "rstrip": false,
22
+ "single_word": false
23
+ }
24
  }
tokenizer.json CHANGED
@@ -9,7 +9,7 @@
9
  "single_word": false,
10
  "lstrip": false,
11
  "rstrip": false,
12
- "normalized": false,
13
  "special": true
14
  },
15
  {
@@ -18,7 +18,7 @@
18
  "single_word": false,
19
  "lstrip": false,
20
  "rstrip": false,
21
- "normalized": false,
22
  "special": true
23
  },
24
  {
@@ -27,7 +27,7 @@
27
  "single_word": false,
28
  "lstrip": false,
29
  "rstrip": false,
30
- "normalized": false,
31
  "special": true
32
  },
33
  {
@@ -2132,17 +2132,17 @@
2132
  },
2133
  "content": " "
2134
  },
2135
- {
2136
- "type": "ByteFallback"
2137
- },
2138
- {
2139
- "type": "Fuse"
2140
- },
2141
  {
2142
  "type": "Strip",
2143
  "content": " ",
2144
  "start": 1,
2145
  "stop": 0
 
 
 
 
 
 
2146
  }
2147
  ]
2148
  },
 
9
  "single_word": false,
10
  "lstrip": false,
11
  "rstrip": false,
12
+ "normalized": true,
13
  "special": true
14
  },
15
  {
 
18
  "single_word": false,
19
  "lstrip": false,
20
  "rstrip": false,
21
+ "normalized": true,
22
  "special": true
23
  },
24
  {
 
27
  "single_word": false,
28
  "lstrip": false,
29
  "rstrip": false,
30
+ "normalized": true,
31
  "special": true
32
  },
33
  {
 
2132
  },
2133
  "content": " "
2134
  },
 
 
 
 
 
 
2135
  {
2136
  "type": "Strip",
2137
  "content": " ",
2138
  "start": 1,
2139
  "stop": 0
2140
+ },
2141
+ {
2142
+ "type": "ByteFallback"
2143
+ },
2144
+ {
2145
+ "type": "Fuse"
2146
  }
2147
  ]
2148
  },
tokenizer_config.json CHANGED
@@ -1,9 +1,10 @@
1
  {
 
2
  "added_tokens_decoder": {
3
  "0": {
4
  "content": "<unk>",
5
  "lstrip": false,
6
- "normalized": false,
7
  "rstrip": false,
8
  "single_word": false,
9
  "special": true
@@ -11,7 +12,7 @@
11
  "1": {
12
  "content": "<|startoftext|>",
13
  "lstrip": false,
14
- "normalized": false,
15
  "rstrip": false,
16
  "single_word": false,
17
  "special": true
@@ -19,7 +20,7 @@
19
  "2": {
20
  "content": "<|endoftext|>",
21
  "lstrip": false,
22
- "normalized": false,
23
  "rstrip": false,
24
  "single_word": false,
25
  "special": true
@@ -1850,13 +1851,17 @@
1850
  }
1851
  },
1852
  "bos_token": "<|startoftext|>",
 
1853
  "clean_up_tokenization_spaces": false,
1854
- "eos_token": "<|endoftext|>",
1855
  "legacy": true,
1856
  "model_max_length": 4096,
1857
- "pad_token": "<|endoftext|>",
 
1858
  "sp_model_kwargs": {},
 
 
1859
  "tokenizer_class": "LlamaTokenizer",
1860
  "unk_token": "<unk>",
1861
- "use_default_system_prompt": true
1862
  }
 
1
  {
2
+ "add_prefix_space": true,
3
  "added_tokens_decoder": {
4
  "0": {
5
  "content": "<unk>",
6
  "lstrip": false,
7
+ "normalized": true,
8
  "rstrip": false,
9
  "single_word": false,
10
  "special": true
 
12
  "1": {
13
  "content": "<|startoftext|>",
14
  "lstrip": false,
15
+ "normalized": true,
16
  "rstrip": false,
17
  "single_word": false,
18
  "special": true
 
20
  "2": {
21
  "content": "<|endoftext|>",
22
  "lstrip": false,
23
+ "normalized": true,
24
  "rstrip": false,
25
  "single_word": false,
26
  "special": true
 
1851
  }
1852
  },
1853
  "bos_token": "<|startoftext|>",
1854
+ "chat_template": "{% if messages[0]['role'] == 'system' %}{% set system_message = messages[0]['content'] %}{% endif %}{% if system_message is defined %}{{ system_message }}{% endif %}{% for message in messages %}{% set content = message['content'] %}{% if message['role'] == 'user' %}{{ '<|im_start|>user\\n' + content + '<|im_end|>\\n<|im_start|>assistant\\n' }}{% elif message['role'] == 'assistant' %}{{ content + '<|im_end|>' + '\\n' }}{% endif %}{% endfor %}",
1855
  "clean_up_tokenization_spaces": false,
1856
+ "eos_token": "<|im_end|>",
1857
  "legacy": true,
1858
  "model_max_length": 4096,
1859
+ "pad_token": "<|im_end|>",
1860
+ "padding_side": "right",
1861
  "sp_model_kwargs": {},
1862
+ "spaces_between_special_tokens": false,
1863
+ "split_special_tokens": false,
1864
  "tokenizer_class": "LlamaTokenizer",
1865
  "unk_token": "<unk>",
1866
+ "use_default_system_prompt": false
1867
  }