Transformers
tobiges commited on
Commit
f37e40e
·
verified ·
1 Parent(s): 47dacbd

Upload processor

Browse files
Files changed (2) hide show
  1. processing_action_tokenizer.py +2 -2
  2. tokenizer.json +0 -0
processing_action_tokenizer.py CHANGED
@@ -145,7 +145,7 @@ class UniversalActionProcessor(ProcessorMixin):
145
 
146
  # Train BPE tokenizer
147
  tokenizer = Tokenizer(BPE())
148
- tokenizer.pre_tokenizer = pre_tokenizers.ByteLevel(add_prefix_space=False)
149
  tokenizer.decoder = decoders.ByteLevel()
150
  tokenizer.post_processor = processors.ByteLevel(trim_offsets=False)
151
 
@@ -157,7 +157,7 @@ class UniversalActionProcessor(ProcessorMixin):
157
  show_progress=True,
158
  special_tokens=[],
159
  initial_alphabet=pre_tokenizers.ByteLevel.alphabet(),
160
- max_token_length=2*action_dim,
161
  )
162
  tokenizer.train_from_iterator(
163
  _token_iter(), trainer=trainer, length=len(dct_tokens)
 
145
 
146
  # Train BPE tokenizer
147
  tokenizer = Tokenizer(BPE())
148
+ tokenizer.pre_tokenizer = pre_tokenizers.ByteLevel(add_prefix_space=False, use_regex=False)
149
  tokenizer.decoder = decoders.ByteLevel()
150
  tokenizer.post_processor = processors.ByteLevel(trim_offsets=False)
151
 
 
157
  show_progress=True,
158
  special_tokens=[],
159
  initial_alphabet=pre_tokenizers.ByteLevel.alphabet(),
160
+ max_token_length=128,
161
  )
162
  tokenizer.train_from_iterator(
163
  _token_iter(), trainer=trainer, length=len(dct_tokens)
tokenizer.json CHANGED
The diff for this file is too large to render. See raw diff