Upload 5 files

Files changed (3) hide show

added_tokens.json ADDED Viewed

+{
+  "</s>": 2,
+  "<s>": 1,
+  "<unk>": 0
+}

tokenization_internlm.py CHANGED Viewed

@@ -65,6 +65,13 @@ class InternLMTokenizer(PreTrainedTokenizer):
         **kwargs,
     ):
         self.sp_model_kwargs = {} if sp_model_kwargs is None else sp_model_kwargs
         super().__init__(
             bos_token=bos_token,
             eos_token=eos_token,
@@ -73,14 +80,6 @@ class InternLMTokenizer(PreTrainedTokenizer):
             clean_up_tokenization_spaces=clean_up_tokenization_spaces,
             **kwargs,
         )
-        self.vocab_file = vocab_file
-        self.add_bos_token = add_bos_token
-        self.add_eos_token = add_eos_token
-        self.decode_with_prefix_space = decode_with_prefix_space
-        self.sp_model = spm.SentencePieceProcessor(**self.sp_model_kwargs)
-        self.sp_model.Load(vocab_file)
-        self._no_prefix_space_tokens = None
         """ Initialisation"""
     @property

         **kwargs,
     ):
         self.sp_model_kwargs = {} if sp_model_kwargs is None else sp_model_kwargs
+        self.vocab_file = vocab_file
+        self.add_bos_token = add_bos_token
+        self.add_eos_token = add_eos_token
+        self.decode_with_prefix_space = decode_with_prefix_space
+        self.sp_model = spm.SentencePieceProcessor(**self.sp_model_kwargs)
+        self.sp_model.Load(vocab_file)
+        self._no_prefix_space_tokens = None
         super().__init__(
             bos_token=bos_token,
             eos_token=eos_token,
             clean_up_tokenization_spaces=clean_up_tokenization_spaces,
             **kwargs,
         )
         """ Initialisation"""
     @property

tokenizer_config.json CHANGED Viewed

@@ -1,4 +1,31 @@
 {
   "auto_map": {
     "AutoTokenizer": [
       "tokenization_internlm.InternLMTokenizer",
@@ -11,5 +38,6 @@
   "model_max_length": 1000000000000000019884624838656,
   "pad_token": "</s>",
   "tokenizer_class": "InternLMTokenizer",
   "unk_token": "<unk>"
 }

 {
+  "added_tokens_decoder": {
+    "0": {
+      "content": "<unk>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "1": {
+      "content": "<s>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "2": {
+      "content": "</s>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    }
+  },
+  "additional_special_tokens": [],
   "auto_map": {
     "AutoTokenizer": [
       "tokenization_internlm.InternLMTokenizer",
   "model_max_length": 1000000000000000019884624838656,
   "pad_token": "</s>",
   "tokenizer_class": "InternLMTokenizer",
+  "tokenizer_file": null,
   "unk_token": "<unk>"
 }