{ "tokenizer_class": "SrnaTokenizer", "auto_map": { "AutoTokenizer": ["tokenization_srna.SrnaTokenizer", null] }, "add_prefix_space": false, "added_tokens_decoder": { "248044": { "content": "[PAD]", "lstrip": false, "normalized": false, "rstrip": false, "single_word": false, "special": true }, "248047": { "content": "", "lstrip": false, "normalized": false, "rstrip": false, "single_word": false, "special": true }, "248048": { "content": "", "lstrip": false, "normalized": false, "rstrip": false, "single_word": false, "special": true }, "248049": { "content": "", "lstrip": false, "normalized": false, "rstrip": false, "single_word": false, "special": true }, "248050": { "content": "", "lstrip": false, "normalized": false, "rstrip": false, "single_word": false, "special": true } }, "clean_up_tokenization_spaces": false, "errors": "replace", "model_max_length": 50001, "pad_token": "[PAD]", "split_special_tokens": false, "unk_token": null, "add_bos_token": false, "boc_token": "", "eoc_token": "", "cap_token": "", "up_token": "", "case_compression": true, "script_compression": true, "omit_tags": false, "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+" }