Transformers
tobiges commited on
Commit
76017f9
·
verified ·
1 Parent(s): 57cf339

Upload processor

Browse files
Files changed (2) hide show
  1. processing_action_tokenizer.py +10 -10
  2. tokenizer.json +0 -0
processing_action_tokenizer.py CHANGED
@@ -3,7 +3,7 @@ from typing import ClassVar
3
 
4
  import numpy as np
5
  from scipy.fft import dct, idct
6
- from tokenizers import Tokenizer, pre_tokenizers
7
  from tokenizers.models import BPE
8
  from tokenizers.trainers import BpeTrainer
9
  from transformers import PreTrainedTokenizerFast
@@ -171,15 +171,15 @@ class UniversalActionProcessor(ProcessorMixin):
171
 
172
  # Train BPE tokenizer
173
  tokenizer = Tokenizer(BPE())
174
- # tokenizer.pre_tokenizer = pre_tokenizers.ByteLevel(
175
- # add_prefix_space=False, use_regex=False, trim_offsets=False
176
- # )
177
- # tokenizer.decoder = decoders.ByteLevel(
178
- # add_prefix_space=False, trim_offsets=False, use_regex=False
179
- # )
180
- # tokenizer.post_processor = processors.ByteLevel(
181
- # add_prefix_space=False, trim_offsets=False, use_regex=False
182
- # )
183
 
184
  # Set up the entire range of possible tokens as the initial alphabet
185
  alphabet = [chr(i) for i in range(256)]
 
3
 
4
  import numpy as np
5
  from scipy.fft import dct, idct
6
+ from tokenizers import Tokenizer, decoders, pre_tokenizers, processors
7
  from tokenizers.models import BPE
8
  from tokenizers.trainers import BpeTrainer
9
  from transformers import PreTrainedTokenizerFast
 
171
 
172
  # Train BPE tokenizer
173
  tokenizer = Tokenizer(BPE())
174
+ tokenizer.pre_tokenizer = pre_tokenizers.ByteLevel(
175
+ add_prefix_space=False, use_regex=False, trim_offsets=False
176
+ )
177
+ tokenizer.decoder = decoders.ByteLevel(
178
+ add_prefix_space=False, trim_offsets=False, use_regex=False
179
+ )
180
+ tokenizer.post_processor = processors.ByteLevel(
181
+ add_prefix_space=False, trim_offsets=False, use_regex=False
182
+ )
183
 
184
  # Set up the entire range of possible tokens as the initial alphabet
185
  alphabet = [chr(i) for i in range(256)]
tokenizer.json CHANGED
The diff for this file is too large to render. See raw diff