Dihya-5M / tokenizer.json
ainouche-abderahmane's picture
Upload folder using huggingface_hub
d435fba verified
Raw
History Blame Contribute Delete
5.65 kB
{
"version": "1.0",
"truncation": null,
"padding": null,
"added_tokens": [
{
"id": 0,
"content": "[PAD]",
"single_word": false,
"lstrip": false,
"rstrip": false,
"normalized": false,
"special": true
},
{
"id": 1,
"content": "[UNK]",
"single_word": false,
"lstrip": false,
"rstrip": false,
"normalized": false,
"special": true
}
],
"normalizer": null,
"pre_tokenizer": {
"type": "Sequence",
"pretokenizers": [
{
"type": "ByteLevel",
"add_prefix_space": false,
"trim_offsets": true,
"use_regex": false
},
{
"type": "Split",
"pattern": {
"Regex": "[\\s\\S]"
},
"behavior": "Isolated",
"invert": false
}
]
},
"post_processor": {
"type": "TemplateProcessing",
"single": [
{
"Sequence": {
"id": "A",
"type_id": 0
}
}
],
"pair": [
{
"Sequence": {
"id": "A",
"type_id": 0
}
},
{
"Sequence": {
"id": "B",
"type_id": 1
}
}
],
"special_tokens": {}
},
"decoder": {
"type": "ByteLevel",
"add_prefix_space": true,
"trim_offsets": true,
"use_regex": true
},
"model": {
"type": "WordLevel",
"vocab": {
"[PAD]": 0,
"[UNK]": 1,
"Ā": 2,
"ā": 3,
"Ă": 4,
"ă": 5,
"Ą": 6,
"ą": 7,
"Ć": 8,
"ć": 9,
"Ĉ": 10,
"ĉ": 11,
"Ċ": 12,
"ċ": 13,
"Č": 14,
"č": 15,
"Ď": 16,
"ď": 17,
"Đ": 18,
"đ": 19,
"Ē": 20,
"ē": 21,
"Ĕ": 22,
"ĕ": 23,
"Ė": 24,
"ė": 25,
"Ę": 26,
"ę": 27,
"Ě": 28,
"ě": 29,
"Ĝ": 30,
"ĝ": 31,
"Ğ": 32,
"ğ": 33,
"Ġ": 34,
"!": 35,
"\"": 36,
"#": 37,
"$": 38,
"%": 39,
"&": 40,
"'": 41,
"(": 42,
")": 43,
"*": 44,
"+": 45,
",": 46,
"-": 47,
".": 48,
"/": 49,
"0": 50,
"1": 51,
"2": 52,
"3": 53,
"4": 54,
"5": 55,
"6": 56,
"7": 57,
"8": 58,
"9": 59,
":": 60,
";": 61,
"<": 62,
"=": 63,
">": 64,
"?": 65,
"@": 66,
"A": 67,
"B": 68,
"C": 69,
"D": 70,
"E": 71,
"F": 72,
"G": 73,
"H": 74,
"I": 75,
"J": 76,
"K": 77,
"L": 78,
"M": 79,
"N": 80,
"O": 81,
"P": 82,
"Q": 83,
"R": 84,
"S": 85,
"T": 86,
"U": 87,
"V": 88,
"W": 89,
"X": 90,
"Y": 91,
"Z": 92,
"[": 93,
"\\": 94,
"]": 95,
"^": 96,
"_": 97,
"`": 98,
"a": 99,
"b": 100,
"c": 101,
"d": 102,
"e": 103,
"f": 104,
"g": 105,
"h": 106,
"i": 107,
"j": 108,
"k": 109,
"l": 110,
"m": 111,
"n": 112,
"o": 113,
"p": 114,
"q": 115,
"r": 116,
"s": 117,
"t": 118,
"u": 119,
"v": 120,
"w": 121,
"x": 122,
"y": 123,
"z": 124,
"{": 125,
"|": 126,
"}": 127,
"~": 128,
"ġ": 129,
"Ģ": 130,
"ģ": 131,
"Ĥ": 132,
"ĥ": 133,
"Ħ": 134,
"ħ": 135,
"Ĩ": 136,
"ĩ": 137,
"Ī": 138,
"ī": 139,
"Ĭ": 140,
"ĭ": 141,
"Į": 142,
"į": 143,
"İ": 144,
"ı": 145,
"IJ": 146,
"ij": 147,
"Ĵ": 148,
"ĵ": 149,
"Ķ": 150,
"ķ": 151,
"ĸ": 152,
"Ĺ": 153,
"ĺ": 154,
"Ļ": 155,
"ļ": 156,
"Ľ": 157,
"ľ": 158,
"Ŀ": 159,
"ŀ": 160,
"Ł": 161,
"ł": 162,
"¡": 163,
"¢": 164,
"£": 165,
"¤": 166,
"¥": 167,
"¦": 168,
"§": 169,
"¨": 170,
"©": 171,
"ª": 172,
"«": 173,
"¬": 174,
"Ń": 175,
"®": 176,
"¯": 177,
"°": 178,
"±": 179,
"²": 180,
"³": 181,
"´": 182,
"µ": 183,
"¶": 184,
"·": 185,
"¸": 186,
"¹": 187,
"º": 188,
"»": 189,
"¼": 190,
"½": 191,
"¾": 192,
"¿": 193,
"À": 194,
"Á": 195,
"Â": 196,
"Ã": 197,
"Ä": 198,
"Å": 199,
"Æ": 200,
"Ç": 201,
"È": 202,
"É": 203,
"Ê": 204,
"Ë": 205,
"Ì": 206,
"Í": 207,
"Î": 208,
"Ï": 209,
"Ð": 210,
"Ñ": 211,
"Ò": 212,
"Ó": 213,
"Ô": 214,
"Õ": 215,
"Ö": 216,
"×": 217,
"Ø": 218,
"Ù": 219,
"Ú": 220,
"Û": 221,
"Ü": 222,
"Ý": 223,
"Þ": 224,
"ß": 225,
"à": 226,
"á": 227,
"â": 228,
"ã": 229,
"ä": 230,
"å": 231,
"æ": 232,
"ç": 233,
"è": 234,
"é": 235,
"ê": 236,
"ë": 237,
"ì": 238,
"í": 239,
"î": 240,
"ï": 241,
"ð": 242,
"ñ": 243,
"ò": 244,
"ó": 245,
"ô": 246,
"õ": 247,
"ö": 248,
"÷": 249,
"ø": 250,
"ù": 251,
"ú": 252,
"û": 253,
"ü": 254,
"ý": 255,
"þ": 256,
"ÿ": 257
},
"unk_token": "[UNK]"
}
}