{ "version": "1.0", "truncation": null, "padding": null, "added_tokens": [ { "id": 0, "content": "", "single_word": false, "lstrip": false, "rstrip": false, "normalized": false, "special": true }, { "id": 1, "content": "", "single_word": false, "lstrip": false, "rstrip": false, "normalized": false, "special": true }, { "id": 2, "content": "", "single_word": false, "lstrip": false, "rstrip": false, "normalized": false, "special": true }, { "id": 3, "content": "", "single_word": false, "lstrip": false, "rstrip": false, "normalized": false, "special": true } ], "normalizer": null, "pre_tokenizer": { "type": "Split", "pattern": { "Regex": "[\\s\\S]" }, "behavior": "Isolated", "invert": false }, "post_processor": { "type": "TemplateProcessing", "single": [ { "SpecialToken": { "id": "", "type_id": 0 } }, { "Sequence": { "id": "A", "type_id": 0 } }, { "SpecialToken": { "id": "", "type_id": 0 } } ], "pair": [ { "Sequence": { "id": "A", "type_id": 0 } }, { "Sequence": { "id": "B", "type_id": 1 } } ], "special_tokens": { "": { "id": "", "ids": [ 2 ], "tokens": [ "" ] }, "": { "id": "", "ids": [ 1 ], "tokens": [ "" ] } } }, "decoder": { "type": "Fuse" }, "model": { "type": "WordLevel", "vocab": { "": 0, "": 1, "": 2, "": 3, "a": 4, "b": 5, "c": 6, "d": 7, "e": 8, "f": 9, "g": 10, "h": 11, "i": 12, "j": 13, "k": 14, "l": 15, "m": 16, "n": 17, "o": 18, "p": 19, "q": 20, "r": 21, "s": 22, "t": 23, "u": 24, "v": 25, "w": 26, "x": 27, "y": 28, "z": 29, "A": 30, "B": 31, "C": 32, "D": 33, "E": 34, "F": 35, "G": 36, "H": 37, "I": 38, "J": 39, "K": 40, "L": 41, "M": 42, "N": 43, "O": 44, "P": 45, "Q": 46, "R": 47, "S": 48, "T": 49, "U": 50, "V": 51, "W": 52, "X": 53, "Y": 54, "Z": 55, "ɣ": 56, "Ɣ": 57, "ɛ": 58, "Ɛ": 59, "č": 60, "Č": 61, "ǧ": 62, "Ǧ": 63, "ḍ": 64, "Ḍ": 65, "ḥ": 66, "Ḥ": 67, "ṛ": 68, "Ṛ": 69, "ṣ": 70, "Ṣ": 71, "ṭ": 72, "Ṭ": 73, "ẓ": 74, "Ẓ": 75, "é": 76, "è": 77, "ê": 78, "ë": 79, "à": 80, "â": 81, "î": 82, "ï": 83, "ô": 84, "ù": 85, "û": 86, "ç": 87, "É": 88, "È": 89, "Ê": 90, "Ë": 91, "À": 92, "Â": 93, "Î": 94, "Ï": 95, "Ô": 96, "Ù": 97, "Û": 98, "Ç": 99, "0": 100, "1": 101, "2": 102, "3": 103, "4": 104, "5": 105, "6": 106, "7": 107, "8": 108, "9": 109, " ": 110, ".": 111, ",": 112, "?": 113, "!": 114, "«": 115, "»": 116, "-": 117, "—": 118, ":": 119, ";": 120, "'": 121, "\"": 122, "/": 123, "(": 124, ")": 125, "[": 126, "]": 127, "{": 128, "}": 129, "%": 130, "*": 131, "+": 132, "=": 133, "_": 134, "~": 135, "–": 136, "…": 137, "\n": 138, "\t": 139, "ⴰ": 140, "ⴱ": 141, "ⴳ": 142, "ⴷ": 143, "ⴹ": 144, "ⴻ": 145, "ⴼ": 146, "ⴽ": 147, "ⵀ": 148, "ⵃ": 149, "ⵄ": 150, "ⵅ": 151, "ⵇ": 152, "ⵉ": 153, "ⵊ": 154, "ⵍ": 155, "ⵎ": 156, "ⵏ": 157, "ⵓ": 158, "ⵔ": 159, "ⵕ": 160, "ⵙ": 161, "ⵚ": 162, "ⵛ": 163, "ⵜ": 164, "ⵟ": 165, "ⵡ": 166, "ⵢ": 167, "ⵣ": 168, "ⵥ": 169, "ⵖ": 170 }, "unk_token": "" } }