Upload tokenizer.json with huggingface_hub
Browse files- tokenizer.json +102 -109
tokenizer.json
CHANGED
|
@@ -5,15 +5,6 @@
|
|
| 5 |
"added_tokens": [
|
| 6 |
{
|
| 7 |
"id": 0,
|
| 8 |
-
"content": "<unk>",
|
| 9 |
-
"single_word": false,
|
| 10 |
-
"lstrip": false,
|
| 11 |
-
"rstrip": false,
|
| 12 |
-
"normalized": false,
|
| 13 |
-
"special": true
|
| 14 |
-
},
|
| 15 |
-
{
|
| 16 |
-
"id": 1,
|
| 17 |
"content": "<pad>",
|
| 18 |
"single_word": false,
|
| 19 |
"lstrip": false,
|
|
@@ -22,7 +13,7 @@
|
|
| 22 |
"special": true
|
| 23 |
},
|
| 24 |
{
|
| 25 |
-
"id":
|
| 26 |
"content": "<bos>",
|
| 27 |
"single_word": false,
|
| 28 |
"lstrip": false,
|
|
@@ -31,7 +22,7 @@
|
|
| 31 |
"special": true
|
| 32 |
},
|
| 33 |
{
|
| 34 |
-
"id":
|
| 35 |
"content": "<eos>",
|
| 36 |
"single_word": false,
|
| 37 |
"lstrip": false,
|
|
@@ -93,104 +84,106 @@
|
|
| 93 |
"model": {
|
| 94 |
"type": "WordLevel",
|
| 95 |
"vocab": {
|
| 96 |
-
"
|
| 97 |
-
"
|
| 98 |
-
"
|
| 99 |
-
"
|
| 100 |
-
"
|
| 101 |
-
"
|
| 102 |
-
"
|
| 103 |
-
"
|
| 104 |
-
"
|
| 105 |
-
"
|
| 106 |
-
"
|
| 107 |
-
"
|
| 108 |
-
"
|
| 109 |
-
"
|
| 110 |
-
"
|
| 111 |
-
"
|
| 112 |
-
"
|
| 113 |
-
"
|
| 114 |
-
"
|
| 115 |
-
"
|
| 116 |
-
"
|
| 117 |
-
"
|
| 118 |
-
"
|
| 119 |
-
"
|
| 120 |
-
"
|
| 121 |
-
"
|
| 122 |
-
"
|
| 123 |
-
"
|
| 124 |
-
"
|
| 125 |
-
"
|
| 126 |
-
"
|
| 127 |
-
"
|
| 128 |
-
"
|
| 129 |
-
"
|
| 130 |
-
"
|
| 131 |
-
"
|
| 132 |
-
"
|
| 133 |
-
"
|
| 134 |
-
"
|
| 135 |
-
"
|
| 136 |
-
"
|
| 137 |
-
"
|
| 138 |
-
"
|
| 139 |
-
"
|
| 140 |
-
"
|
| 141 |
-
"
|
| 142 |
-
"
|
| 143 |
-
"
|
| 144 |
-
"
|
| 145 |
-
"
|
| 146 |
-
"
|
| 147 |
-
"
|
| 148 |
-
"
|
| 149 |
-
"
|
| 150 |
-
"
|
| 151 |
-
"
|
| 152 |
-
"
|
| 153 |
-
"
|
| 154 |
-
"
|
| 155 |
-
"
|
| 156 |
-
"
|
| 157 |
-
"
|
| 158 |
-
"
|
| 159 |
-
"
|
| 160 |
-
"
|
| 161 |
-
"
|
| 162 |
-
"
|
| 163 |
-
"
|
| 164 |
-
"
|
| 165 |
-
"
|
| 166 |
-
"
|
| 167 |
-
"
|
| 168 |
-
"
|
| 169 |
-
"
|
| 170 |
-
"
|
| 171 |
-
"
|
| 172 |
-
"
|
| 173 |
-
"
|
| 174 |
-
"
|
| 175 |
-
"
|
| 176 |
-
"
|
| 177 |
-
"
|
| 178 |
-
"
|
| 179 |
-
"
|
| 180 |
-
"
|
| 181 |
-
"
|
| 182 |
-
"
|
| 183 |
-
"
|
| 184 |
-
"
|
| 185 |
-
"
|
| 186 |
-
"
|
| 187 |
-
"
|
| 188 |
-
"
|
| 189 |
-
"
|
| 190 |
-
"
|
| 191 |
-
"
|
| 192 |
-
"
|
| 193 |
-
"
|
|
|
|
|
|
|
| 194 |
},
|
| 195 |
"unk_token": "<unk>"
|
| 196 |
}
|
|
|
|
| 5 |
"added_tokens": [
|
| 6 |
{
|
| 7 |
"id": 0,
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 8 |
"content": "<pad>",
|
| 9 |
"single_word": false,
|
| 10 |
"lstrip": false,
|
|
|
|
| 13 |
"special": true
|
| 14 |
},
|
| 15 |
{
|
| 16 |
+
"id": 1,
|
| 17 |
"content": "<bos>",
|
| 18 |
"single_word": false,
|
| 19 |
"lstrip": false,
|
|
|
|
| 22 |
"special": true
|
| 23 |
},
|
| 24 |
{
|
| 25 |
+
"id": 2,
|
| 26 |
"content": "<eos>",
|
| 27 |
"single_word": false,
|
| 28 |
"lstrip": false,
|
|
|
|
| 84 |
"model": {
|
| 85 |
"type": "WordLevel",
|
| 86 |
"vocab": {
|
| 87 |
+
",": 0,
|
| 88 |
+
"the": 1,
|
| 89 |
+
".": 2,
|
| 90 |
+
"of": 3,
|
| 91 |
+
"and": 4,
|
| 92 |
+
"to": 5,
|
| 93 |
+
"a": 6,
|
| 94 |
+
"in": 7,
|
| 95 |
+
"\"": 8,
|
| 96 |
+
"that": 9,
|
| 97 |
+
"was": 10,
|
| 98 |
+
"is": 11,
|
| 99 |
+
"for": 12,
|
| 100 |
+
"on": 13,
|
| 101 |
+
"with": 14,
|
| 102 |
+
"as": 15,
|
| 103 |
+
"it": 16,
|
| 104 |
+
"he": 17,
|
| 105 |
+
"his": 18,
|
| 106 |
+
"at": 19,
|
| 107 |
+
"by": 20,
|
| 108 |
+
"i": 21,
|
| 109 |
+
";": 22,
|
| 110 |
+
"be": 23,
|
| 111 |
+
"from": 24,
|
| 112 |
+
"<bos>": 25,
|
| 113 |
+
"<eos>": 26,
|
| 114 |
+
"not": 27,
|
| 115 |
+
")": 28,
|
| 116 |
+
"but": 29,
|
| 117 |
+
"(": 30,
|
| 118 |
+
"this": 31,
|
| 119 |
+
"had": 32,
|
| 120 |
+
"which": 33,
|
| 121 |
+
"have": 34,
|
| 122 |
+
"are": 35,
|
| 123 |
+
":": 36,
|
| 124 |
+
"they": 37,
|
| 125 |
+
"an": 38,
|
| 126 |
+
"or": 39,
|
| 127 |
+
"were": 40,
|
| 128 |
+
"her": 41,
|
| 129 |
+
"said": 42,
|
| 130 |
+
"their": 43,
|
| 131 |
+
"has": 44,
|
| 132 |
+
"we": 45,
|
| 133 |
+
"all": 46,
|
| 134 |
+
"who": 47,
|
| 135 |
+
"one": 48,
|
| 136 |
+
"she": 49,
|
| 137 |
+
"you": 50,
|
| 138 |
+
"“": 51,
|
| 139 |
+
"”": 52,
|
| 140 |
+
"been": 53,
|
| 141 |
+
"will": 54,
|
| 142 |
+
"more": 55,
|
| 143 |
+
"him": 56,
|
| 144 |
+
"when": 57,
|
| 145 |
+
"so": 58,
|
| 146 |
+
"its": 59,
|
| 147 |
+
"would": 60,
|
| 148 |
+
"there": 61,
|
| 149 |
+
"no": 62,
|
| 150 |
+
"after": 63,
|
| 151 |
+
"my": 64,
|
| 152 |
+
"if": 65,
|
| 153 |
+
"out": 66,
|
| 154 |
+
"also": 67,
|
| 155 |
+
"about": 68,
|
| 156 |
+
"them": 69,
|
| 157 |
+
"up": 70,
|
| 158 |
+
"into": 71,
|
| 159 |
+
"two": 72,
|
| 160 |
+
"what": 73,
|
| 161 |
+
"new": 74,
|
| 162 |
+
"first": 75,
|
| 163 |
+
"some": 76,
|
| 164 |
+
"can": 77,
|
| 165 |
+
"time": 78,
|
| 166 |
+
"than": 79,
|
| 167 |
+
"other": 80,
|
| 168 |
+
"our": 81,
|
| 169 |
+
"me": 82,
|
| 170 |
+
"only": 83,
|
| 171 |
+
"over": 84,
|
| 172 |
+
"could": 85,
|
| 173 |
+
"may": 86,
|
| 174 |
+
"?": 87,
|
| 175 |
+
"any": 88,
|
| 176 |
+
"/": 89,
|
| 177 |
+
"then": 90,
|
| 178 |
+
"people": 91,
|
| 179 |
+
"like": 92,
|
| 180 |
+
"now": 93,
|
| 181 |
+
"such": 94,
|
| 182 |
+
"do": 95,
|
| 183 |
+
"us": 96,
|
| 184 |
+
"very": 97,
|
| 185 |
+
"made": 98,
|
| 186 |
+
"these": 99
|
| 187 |
},
|
| 188 |
"unk_token": "<unk>"
|
| 189 |
}
|