Transformers
tobiges commited on
Commit
bf6bf2f
·
verified ·
1 Parent(s): c343f91

Upload processor

Browse files
Files changed (2) hide show
  1. processing_action_tokenizer.py +10 -11
  2. tokenizer.json +0 -0
processing_action_tokenizer.py CHANGED
@@ -171,17 +171,16 @@ class UniversalActionProcessor(ProcessorMixin):
171
 
172
  # Train BPE tokenizer
173
  tokenizer = Tokenizer(BPE())
174
- tokenizer.pre_tokenizer = pre_tokenizers.ByteLevel(
175
- add_prefix_space=False, use_regex=False, trim_offsets=False
176
- )
177
- tokenizer.pre_tokenizer.pre_tokenize_str
178
- tokenizer.decoder = decoders.ByteLevel(
179
- add_prefix_space=False, trim_offsets=False, use_regex=False
180
- )
181
- tokenizer.dec
182
- tokenizer.post_processor = processors.ByteLevel(
183
- add_prefix_space=False, trim_offsets=False, use_regex=False
184
- )
185
 
186
  # Set up the entire range of possible tokens as the initial alphabet
187
  alphabet = [chr(i) for i in range(256)]
 
171
 
172
  # Train BPE tokenizer
173
  tokenizer = Tokenizer(BPE())
174
+ # tokenizer.pre_tokenizer = pre_tokenizers.ByteLevel(
175
+ # add_prefix_space=False, use_regex=False, trim_offsets=False
176
+ # )
177
+ # tokenizer.decoder = decoders.ByteLevel(
178
+ # add_prefix_space=False, trim_offsets=False, use_regex=False
179
+ # )
180
+ # tokenizer.decoder.decode()
181
+ # tokenizer.post_processor = processors.ByteLevel(
182
+ # add_prefix_space=False, trim_offsets=False, use_regex=False
183
+ # )
 
184
 
185
  # Set up the entire range of possible tokens as the initial alphabet
186
  alphabet = [chr(i) for i in range(256)]
tokenizer.json CHANGED
The diff for this file is too large to render. See raw diff