{ "version": "1.0", "truncation": null, "padding": null, "added_tokens": [ { "id": 0, "content": "[PAD]", "single_word": false, "lstrip": false, "rstrip": false, "normalized": false, "special": true }, { "id": 1, "content": "[UNK]", "single_word": false, "lstrip": false, "rstrip": false, "normalized": false, "special": true } ], "normalizer": null, "pre_tokenizer": { "type": "Sequence", "pretokenizers": [ { "type": "ByteLevel", "add_prefix_space": false, "trim_offsets": true, "use_regex": false }, { "type": "Split", "pattern": { "Regex": "[\\s\\S]" }, "behavior": "Isolated", "invert": false } ] }, "post_processor": { "type": "TemplateProcessing", "single": [ { "Sequence": { "id": "A", "type_id": 0 } } ], "pair": [ { "Sequence": { "id": "A", "type_id": 0 } }, { "Sequence": { "id": "B", "type_id": 1 } } ], "special_tokens": {} }, "decoder": { "type": "ByteLevel", "add_prefix_space": true, "trim_offsets": true, "use_regex": true }, "model": { "type": "WordLevel", "vocab": { "[PAD]": 0, "[UNK]": 1, "Ā": 2, "ā": 3, "Ă": 4, "ă": 5, "Ą": 6, "ą": 7, "Ć": 8, "ć": 9, "Ĉ": 10, "ĉ": 11, "Ċ": 12, "ċ": 13, "Č": 14, "č": 15, "Ď": 16, "ď": 17, "Đ": 18, "đ": 19, "Ē": 20, "ē": 21, "Ĕ": 22, "ĕ": 23, "Ė": 24, "ė": 25, "Ę": 26, "ę": 27, "Ě": 28, "ě": 29, "Ĝ": 30, "ĝ": 31, "Ğ": 32, "ğ": 33, "Ġ": 34, "!": 35, "\"": 36, "#": 37, "$": 38, "%": 39, "&": 40, "'": 41, "(": 42, ")": 43, "*": 44, "+": 45, ",": 46, "-": 47, ".": 48, "/": 49, "0": 50, "1": 51, "2": 52, "3": 53, "4": 54, "5": 55, "6": 56, "7": 57, "8": 58, "9": 59, ":": 60, ";": 61, "<": 62, "=": 63, ">": 64, "?": 65, "@": 66, "A": 67, "B": 68, "C": 69, "D": 70, "E": 71, "F": 72, "G": 73, "H": 74, "I": 75, "J": 76, "K": 77, "L": 78, "M": 79, "N": 80, "O": 81, "P": 82, "Q": 83, "R": 84, "S": 85, "T": 86, "U": 87, "V": 88, "W": 89, "X": 90, "Y": 91, "Z": 92, "[": 93, "\\": 94, "]": 95, "^": 96, "_": 97, "`": 98, "a": 99, "b": 100, "c": 101, "d": 102, "e": 103, "f": 104, "g": 105, "h": 106, "i": 107, "j": 108, "k": 109, "l": 110, "m": 111, "n": 112, "o": 113, "p": 114, "q": 115, "r": 116, "s": 117, "t": 118, "u": 119, "v": 120, "w": 121, "x": 122, "y": 123, "z": 124, "{": 125, "|": 126, "}": 127, "~": 128, "ġ": 129, "Ģ": 130, "ģ": 131, "Ĥ": 132, "ĥ": 133, "Ħ": 134, "ħ": 135, "Ĩ": 136, "ĩ": 137, "Ī": 138, "ī": 139, "Ĭ": 140, "ĭ": 141, "Į": 142, "į": 143, "İ": 144, "ı": 145, "IJ": 146, "ij": 147, "Ĵ": 148, "ĵ": 149, "Ķ": 150, "ķ": 151, "ĸ": 152, "Ĺ": 153, "ĺ": 154, "Ļ": 155, "ļ": 156, "Ľ": 157, "ľ": 158, "Ŀ": 159, "ŀ": 160, "Ł": 161, "ł": 162, "¡": 163, "¢": 164, "£": 165, "¤": 166, "¥": 167, "¦": 168, "§": 169, "¨": 170, "©": 171, "ª": 172, "«": 173, "¬": 174, "Ń": 175, "®": 176, "¯": 177, "°": 178, "±": 179, "²": 180, "³": 181, "´": 182, "µ": 183, "¶": 184, "·": 185, "¸": 186, "¹": 187, "º": 188, "»": 189, "¼": 190, "½": 191, "¾": 192, "¿": 193, "À": 194, "Á": 195, "Â": 196, "Ã": 197, "Ä": 198, "Å": 199, "Æ": 200, "Ç": 201, "È": 202, "É": 203, "Ê": 204, "Ë": 205, "Ì": 206, "Í": 207, "Î": 208, "Ï": 209, "Ð": 210, "Ñ": 211, "Ò": 212, "Ó": 213, "Ô": 214, "Õ": 215, "Ö": 216, "×": 217, "Ø": 218, "Ù": 219, "Ú": 220, "Û": 221, "Ü": 222, "Ý": 223, "Þ": 224, "ß": 225, "à": 226, "á": 227, "â": 228, "ã": 229, "ä": 230, "å": 231, "æ": 232, "ç": 233, "è": 234, "é": 235, "ê": 236, "ë": 237, "ì": 238, "í": 239, "î": 240, "ï": 241, "ð": 242, "ñ": 243, "ò": 244, "ó": 245, "ô": 246, "õ": 247, "ö": 248, "÷": 249, "ø": 250, "ù": 251, "ú": 252, "û": 253, "ü": 254, "ý": 255, "þ": 256, "ÿ": 257 }, "unk_token": "[UNK]" } }