Transformers
tobiges commited on
Commit
1076637
·
verified ·
1 Parent(s): a6fb4cc

Upload processor

Browse files
Files changed (2) hide show
  1. processing_action_tokenizer.py +9 -9
  2. tokenizer.json +0 -0
processing_action_tokenizer.py CHANGED
@@ -171,15 +171,15 @@ class UniversalActionProcessor(ProcessorMixin):
171
 
172
  # Train BPE tokenizer
173
  tokenizer = Tokenizer(BPE())
174
- # tokenizer.pre_tokenizer = pre_tokenizers.ByteLevel(
175
- # add_prefix_space=False, use_regex=False, trim_offsets=False
176
- # )
177
- # tokenizer.decoder = decoders.ByteLevel(
178
- # add_prefix_space=False, trim_offsets=False, use_regex=False
179
- # )
180
- # tokenizer.post_processor = processors.ByteLevel(
181
- # add_prefix_space=False, trim_offsets=False, use_regex=False
182
- # )
183
 
184
  # Set up the entire range of possible tokens as the initial alphabet
185
  alphabet = [chr(i) for i in range(256)]
 
171
 
172
  # Train BPE tokenizer
173
  tokenizer = Tokenizer(BPE())
174
+ tokenizer.pre_tokenizer = pre_tokenizers.ByteLevel(
175
+ add_prefix_space=False, use_regex=False, trim_offsets=False
176
+ )
177
+ tokenizer.decoder = decoders.ByteLevel(
178
+ add_prefix_space=False, trim_offsets=False, use_regex=False
179
+ )
180
+ tokenizer.post_processor = processors.ByteLevel(
181
+ add_prefix_space=False, trim_offsets=False, use_regex=False
182
+ )
183
 
184
  # Set up the entire range of possible tokens as the initial alphabet
185
  alphabet = [chr(i) for i in range(256)]
tokenizer.json CHANGED
The diff for this file is too large to render. See raw diff