{ "version": "1.0", "truncation": null, "padding": null, "added_tokens": [ { "id": 0, "content": "", "single_word": false, "lstrip": false, "rstrip": false, "normalized": false, "special": true }, { "id": 1, "content": "", "single_word": false, "lstrip": false, "rstrip": false, "normalized": false, "special": true }, { "id": 2, "content": "", "single_word": false, "lstrip": false, "rstrip": false, "normalized": false, "special": true }, { "id": 3, "content": "", "single_word": false, "lstrip": false, "rstrip": false, "normalized": false, "special": true } ], "normalizer": null, "pre_tokenizer": { "type": "Split", "pattern": { "Regex": "[\\s\\S]" }, "behavior": "Isolated", "invert": false }, "post_processor": { "type": "TemplateProcessing", "single": [ { "SpecialToken": { "id": "", "type_id": 0 } }, { "Sequence": { "id": "A", "type_id": 0 } }, { "SpecialToken": { "id": "", "type_id": 0 } } ], "pair": [ { "SpecialToken": { "id": "", "type_id": 0 } }, { "Sequence": { "id": "A", "type_id": 0 } }, { "SpecialToken": { "id": "", "type_id": 0 } }, { "SpecialToken": { "id": "", "type_id": 1 } }, { "Sequence": { "id": "B", "type_id": 1 } }, { "SpecialToken": { "id": "", "type_id": 1 } } ], "special_tokens": { "": { "id": "", "ids": [ 3 ], "tokens": [ "" ] }, "": { "id": "", "ids": [ 2 ], "tokens": [ "" ] } } }, "decoder": { "type": "Fuse" }, "model": { "type": "WordLevel", "vocab": { "": 0, "": 1, "": 2, "": 3, "a": 4, "b": 5, "c": 6, "d": 7, "e": 8, "f": 9, "g": 10, "h": 11, "i": 12, "j": 13, "k": 14, "l": 15, "m": 16, "n": 17, "o": 18, "p": 19, "q": 20, "r": 21, "s": 22, "t": 23, "u": 24, "v": 25, "w": 26, "x": 27, "y": 28, "z": 29, "A": 30, "B": 31, "C": 32, "D": 33, "E": 34, "F": 35, "G": 36, "H": 37, "I": 38, "J": 39, "K": 40, "L": 41, "M": 42, "N": 43, "O": 44, "P": 45, "Q": 46, "R": 47, "S": 48, "T": 49, "U": 50, "V": 51, "W": 52, "X": 53, "Y": 54, "Z": 55, "0": 56, "1": 57, "2": 58, "3": 59, "4": 60, "5": 61, "6": 62, "7": 63, "8": 64, "9": 65, "č": 66, "Č": 67, "ğ": 68, "Ğ": 69, "Ǧ": 70, "ǧ": 71, "ḍ": 72, "Ḍ": 73, "ṭ": 74, "Ṭ": 75, "ṣ": 76, "Ṣ": 77, "ẓ": 78, "Ẓ": 79, "ṛ": 80, "Ṛ": 81, "ḥ": 82, "Ḥ": 83, "ɛ": 84, "Ɛ": 85, "ɣ": 86, "Ɣ": 87, "é": 88, "è": 89, "ê": 90, "à": 91, "â": 92, "î": 93, "ô": 94, "û": 95, "ë": 96, "ï": 97, " ": 98, ".": 99, ",": 100, "!": 101, "?": 102, ":": 103, ";": 104, "-": 105, "'": 106, "\"": 107, "(": 108, ")": 109, "[": 110, "]": 111, "/": 112, "\\": 113, "_": 114, "+": 115, "=": 116, "%": 117, "«": 118, "»": 119, "–": 120, "—": 121, "\n": 122 }, "unk_token": "" } }