Upload tokenizer

Files changed (3) hide show

sentencepiece.bpe.model CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:a801c63cf0822cc3a880177fd5895196337d7e3813edde88c428061c263354a4
-size 240461

 version https://git-lfs.github.com/spec/v1
+oid sha256:34727325a68a6a1e8580bf1e33934313f5f232bc92448d5ff77a5a850f25dbaa
+size 240462

special_tokens_map.json CHANGED Viewed

@@ -1,71 +1,12 @@
 {
   "additional_special_tokens": [
-    "ar_AR",
-    "cs_CZ",
-    "de_DE",
-    "en_XX",
-    "es_XX",
-    "et_EE",
-    "fi_FI",
-    "fr_XX",
-    "gu_IN",
-    "hi_IN",
-    "it_IT",
-    "ja_XX",
-    "kk_KZ",
-    "ko_KR",
-    "lt_LT",
-    "lv_LV",
-    "my_MM",
-    "ne_NP",
-    "nl_XX",
-    "ro_RO",
-    "ru_RU",
-    "si_LK",
-    "tr_TR",
-    "vi_VN",
-    "zh_CN"
   ],
-  "bos_token": {
-    "content": "<s>",
-    "lstrip": false,
-    "normalized": false,
-    "rstrip": false,
-    "single_word": false
-  },
-  "cls_token": {
-    "content": "<s>",
-    "lstrip": false,
-    "normalized": false,
-    "rstrip": false,
-    "single_word": false
-  },
-  "eos_token": {
-    "content": "</s>",
-    "lstrip": false,
-    "normalized": false,
-    "rstrip": false,
-    "single_word": false
-  },
-  "pad_token": {
-    "content": "<pad>",
-    "lstrip": false,
-    "normalized": false,
-    "rstrip": false,
-    "single_word": false
-  },
-  "sep_token": {
-    "content": "</s>",
-    "lstrip": false,
-    "normalized": false,
-    "rstrip": false,
-    "single_word": false
-  },
-  "unk_token": {
-    "content": "<unk>",
-    "lstrip": false,
-    "normalized": false,
-    "rstrip": false,
-    "single_word": false
-  }
 }

 {
   "additional_special_tokens": [
+    "ቊ",
+    "ar_AR"
   ],
+  "bos_token": "<s>",
+  "cls_token": "<s>",
+  "eos_token": "</s>",
+  "pad_token": "<pad>",
+  "sep_token": "</s>",
+  "unk_token": "<unk>"
 }

tokenizer_config.json CHANGED Viewed

@@ -234,31 +234,8 @@
     }
   },
   "additional_special_tokens": [
-    "ar_AR",
-    "cs_CZ",
-    "de_DE",
-    "en_XX",
-    "es_XX",
-    "et_EE",
-    "fi_FI",
-    "fr_XX",
-    "gu_IN",
-    "hi_IN",
-    "it_IT",
-    "ja_XX",
-    "kk_KZ",
-    "ko_KR",
-    "lt_LT",
-    "lv_LV",
-    "my_MM",
-    "ne_NP",
-    "nl_XX",
-    "ro_RO",
-    "ru_RU",
-    "si_LK",
-    "tr_TR",
-    "vi_VN",
-    "zh_CN"
   ],
   "bos_token": "<s>",
   "clean_up_tokenization_spaces": true,
@@ -272,5 +249,6 @@
   "src_lang": "ar_AR",
   "tgt_lang": "cs_CZ",
   "tokenizer_class": "MBartTokenizer",
   "unk_token": "<unk>"
 }

     }
   },
   "additional_special_tokens": [
+    "ቊ",
+    "ar_AR"
   ],
   "bos_token": "<s>",
   "clean_up_tokenization_spaces": true,
   "src_lang": "ar_AR",
   "tgt_lang": "cs_CZ",
   "tokenizer_class": "MBartTokenizer",
+  "tokenizer_file": null,
   "unk_token": "<unk>"
 }