ljcamargo commited on
Commit
68bb59f
·
verified ·
1 Parent(s): 583779f

Upload folder using huggingface_hub

Browse files
Files changed (2) hide show
  1. special_tokens_map.json +130 -0
  2. tokenizer_config.json +133 -0
special_tokens_map.json ADDED
@@ -0,0 +1,130 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "pad_token": "<|pad|>",
3
+ "bos_token": "<|startoftext|>",
4
+ "eos_token": "<|endoftext|>",
5
+ "unk_token": "<|unk|>",
6
+ "additional_special_tokens": [
7
+ "<|im_start|>",
8
+ "<|im_end|>",
9
+ "<|tool_call_start|>",
10
+ "<|tool_call_end|>",
11
+ "<|tool_response_start|>",
12
+ "<|tool_response_end|>",
13
+ "<|reasoning_start|>",
14
+ "<|reasoning_end|>",
15
+ "<|fim_prefix|>",
16
+ "<|fim_middle|>",
17
+ "<|fim_suffix|>",
18
+ "<|fim_pad|>",
19
+ "<|repo_name|>",
20
+ "<|file_sep|>",
21
+ "<|lang:all|>",
22
+ "<|lang:amu|>",
23
+ "<|lang:amu0|>",
24
+ "<|lang:azg|>",
25
+ "<|lang:azn0|>",
26
+ "<|lang:azz|>",
27
+ "<|lang:cco|>",
28
+ "<|lang:cco0|>",
29
+ "<|lang:chd|>",
30
+ "<|lang:chf|>",
31
+ "<|lang:chf0|>",
32
+ "<|lang:chq|>",
33
+ "<|lang:cle|>",
34
+ "<|lang:cnl|>",
35
+ "<|lang:cnt|>",
36
+ "<|lang:coz|>",
37
+ "<|lang:cpa|>",
38
+ "<|lang:crn|>",
39
+ "<|lang:cso|>",
40
+ "<|lang:cta|>",
41
+ "<|lang:ctp|>",
42
+ "<|lang:ctp0|>",
43
+ "<|lang:ctu|>",
44
+ "<|lang:cuc|>",
45
+ "<|lang:cut|>",
46
+ "<|lang:cux|>",
47
+ "<|lang:de|>",
48
+ "<|lang:en-US|>",
49
+ "<|lang:eng|>",
50
+ "<|lang:es-MX|>",
51
+ "<|lang:fr|>",
52
+ "<|lang:hch|>",
53
+ "<|lang:hus|>",
54
+ "<|lang:huv|>",
55
+ "<|lang:hve0|>",
56
+ "<|lang:jac|>",
57
+ "<|lang:kek|>",
58
+ "<|lang:knj|>",
59
+ "<|lang:lac|>",
60
+ "<|lang:maa|>",
61
+ "<|lang:maj|>",
62
+ "<|lang:mam|>",
63
+ "<|lang:maq|>",
64
+ "<|lang:mau|>",
65
+ "<|lang:maz|>",
66
+ "<|lang:maz0|>",
67
+ "<|lang:mco|>",
68
+ "<|lang:mco0|>",
69
+ "<|lang:meh|>",
70
+ "<|lang:mfy|>",
71
+ "<|lang:mib|>",
72
+ "<|lang:mie|>",
73
+ "<|lang:mig|>",
74
+ "<|lang:mim0|>",
75
+ "<|lang:mix|>",
76
+ "<|lang:mmc|>",
77
+ "<|lang:mxv0|>",
78
+ "<|lang:nch|>",
79
+ "<|lang:nlv0|>",
80
+ "<|lang:ntp|>",
81
+ "<|lang:ocu|>",
82
+ "<|lang:ots|>",
83
+ "<|lang:pei|>",
84
+ "<|lang:pia|>",
85
+ "<|lang:pmq|>",
86
+ "<|lang:poi|>",
87
+ "<|lang:poi0|>",
88
+ "<|lang:pt-BR|>",
89
+ "<|lang:pua|>",
90
+ "<|lang:quc|>",
91
+ "<|lang:sei|>",
92
+ "<|lang:spa|>",
93
+ "<|lang:stp|>",
94
+ "<|lang:tar0|>",
95
+ "<|lang:toj|>",
96
+ "<|lang:top|>",
97
+ "<|lang:tpp|>",
98
+ "<|lang:tpx|>",
99
+ "<|lang:tpx0|>",
100
+ "<|lang:trs|>",
101
+ "<|lang:trs0|>",
102
+ "<|lang:tsz|>",
103
+ "<|lang:tzh|>",
104
+ "<|lang:tzo|>",
105
+ "<|lang:unk|>",
106
+ "<|lang:var|>",
107
+ "<|lang:yaq|>",
108
+ "<|lang:yua|>",
109
+ "<|lang:zai|>",
110
+ "<|lang:zam|>",
111
+ "<|lang:zoc|>",
112
+ "<|lang:zoq|>",
113
+ "<|reserved_0|>",
114
+ "<|reserved_1|>",
115
+ "<|reserved_2|>",
116
+ "<|reserved_3|>",
117
+ "<|reserved_4|>",
118
+ "<|reserved_5|>",
119
+ "<|reserved_6|>",
120
+ "<|reserved_7|>",
121
+ "<|reserved_8|>",
122
+ "<|reserved_9|>",
123
+ "<|reserved_10|>",
124
+ "<|reserved_11|>",
125
+ "<|reserved_12|>",
126
+ "<|reserved_13|>",
127
+ "<|reserved_14|>",
128
+ "<|reserved_15|>"
129
+ ]
130
+ }
tokenizer_config.json ADDED
@@ -0,0 +1,133 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "bos_token": "<|startoftext|>",
4
+ "eos_token": "<|endoftext|>",
5
+ "extra_special_tokens": [
6
+ "<|im_start|>",
7
+ "<|im_end|>",
8
+ "<|tool_call_start|>",
9
+ "<|tool_call_end|>",
10
+ "<|tool_response_start|>",
11
+ "<|tool_response_end|>",
12
+ "<|reasoning_start|>",
13
+ "<|reasoning_end|>",
14
+ "<|fim_prefix|>",
15
+ "<|fim_middle|>",
16
+ "<|fim_suffix|>",
17
+ "<|fim_pad|>",
18
+ "<|repo_name|>",
19
+ "<|file_sep|>",
20
+ "<|lang:all|>",
21
+ "<|lang:amu|>",
22
+ "<|lang:amu0|>",
23
+ "<|lang:azg|>",
24
+ "<|lang:azn0|>",
25
+ "<|lang:azz|>",
26
+ "<|lang:cco|>",
27
+ "<|lang:cco0|>",
28
+ "<|lang:chd|>",
29
+ "<|lang:chf|>",
30
+ "<|lang:chf0|>",
31
+ "<|lang:chq|>",
32
+ "<|lang:cle|>",
33
+ "<|lang:cnl|>",
34
+ "<|lang:cnt|>",
35
+ "<|lang:coz|>",
36
+ "<|lang:cpa|>",
37
+ "<|lang:crn|>",
38
+ "<|lang:cso|>",
39
+ "<|lang:cta|>",
40
+ "<|lang:ctp|>",
41
+ "<|lang:ctp0|>",
42
+ "<|lang:ctu|>",
43
+ "<|lang:cuc|>",
44
+ "<|lang:cut|>",
45
+ "<|lang:cux|>",
46
+ "<|lang:de|>",
47
+ "<|lang:en-US|>",
48
+ "<|lang:eng|>",
49
+ "<|lang:es-MX|>",
50
+ "<|lang:fr|>",
51
+ "<|lang:hch|>",
52
+ "<|lang:hus|>",
53
+ "<|lang:huv|>",
54
+ "<|lang:hve0|>",
55
+ "<|lang:jac|>",
56
+ "<|lang:kek|>",
57
+ "<|lang:knj|>",
58
+ "<|lang:lac|>",
59
+ "<|lang:maa|>",
60
+ "<|lang:maj|>",
61
+ "<|lang:mam|>",
62
+ "<|lang:maq|>",
63
+ "<|lang:mau|>",
64
+ "<|lang:maz|>",
65
+ "<|lang:maz0|>",
66
+ "<|lang:mco|>",
67
+ "<|lang:mco0|>",
68
+ "<|lang:meh|>",
69
+ "<|lang:mfy|>",
70
+ "<|lang:mib|>",
71
+ "<|lang:mie|>",
72
+ "<|lang:mig|>",
73
+ "<|lang:mim0|>",
74
+ "<|lang:mix|>",
75
+ "<|lang:mmc|>",
76
+ "<|lang:mxv0|>",
77
+ "<|lang:nch|>",
78
+ "<|lang:nlv0|>",
79
+ "<|lang:ntp|>",
80
+ "<|lang:ocu|>",
81
+ "<|lang:ots|>",
82
+ "<|lang:pei|>",
83
+ "<|lang:pia|>",
84
+ "<|lang:pmq|>",
85
+ "<|lang:poi|>",
86
+ "<|lang:poi0|>",
87
+ "<|lang:pt-BR|>",
88
+ "<|lang:pua|>",
89
+ "<|lang:quc|>",
90
+ "<|lang:sei|>",
91
+ "<|lang:spa|>",
92
+ "<|lang:stp|>",
93
+ "<|lang:tar0|>",
94
+ "<|lang:toj|>",
95
+ "<|lang:top|>",
96
+ "<|lang:tpp|>",
97
+ "<|lang:tpx|>",
98
+ "<|lang:tpx0|>",
99
+ "<|lang:trs|>",
100
+ "<|lang:trs0|>",
101
+ "<|lang:tsz|>",
102
+ "<|lang:tzh|>",
103
+ "<|lang:tzo|>",
104
+ "<|lang:unk|>",
105
+ "<|lang:var|>",
106
+ "<|lang:yaq|>",
107
+ "<|lang:yua|>",
108
+ "<|lang:zai|>",
109
+ "<|lang:zam|>",
110
+ "<|lang:zoc|>",
111
+ "<|lang:zoq|>",
112
+ "<|reserved_0|>",
113
+ "<|reserved_1|>",
114
+ "<|reserved_2|>",
115
+ "<|reserved_3|>",
116
+ "<|reserved_4|>",
117
+ "<|reserved_5|>",
118
+ "<|reserved_6|>",
119
+ "<|reserved_7|>",
120
+ "<|reserved_8|>",
121
+ "<|reserved_9|>",
122
+ "<|reserved_10|>",
123
+ "<|reserved_11|>",
124
+ "<|reserved_12|>",
125
+ "<|reserved_13|>",
126
+ "<|reserved_14|>",
127
+ "<|reserved_15|>"
128
+ ],
129
+ "model_max_length": 4096,
130
+ "pad_token": "<|pad|>",
131
+ "tokenizer_class": "TokenizersBackend",
132
+ "unk_token": "<|unk|>"
133
+ }