Transformers
tobiges commited on
Commit
57cf339
·
verified ·
1 Parent(s): bf6bf2f

Upload processor

Browse files
Files changed (2) hide show
  1. processing_action_tokenizer.py +3 -4
  2. tokenizer.json +0 -0
processing_action_tokenizer.py CHANGED
@@ -3,7 +3,7 @@ from typing import ClassVar
3
 
4
  import numpy as np
5
  from scipy.fft import dct, idct
6
- from tokenizers import Tokenizer, decoders, pre_tokenizers, processors
7
  from tokenizers.models import BPE
8
  from tokenizers.trainers import BpeTrainer
9
  from transformers import PreTrainedTokenizerFast
@@ -177,7 +177,6 @@ class UniversalActionProcessor(ProcessorMixin):
177
  # tokenizer.decoder = decoders.ByteLevel(
178
  # add_prefix_space=False, trim_offsets=False, use_regex=False
179
  # )
180
- # tokenizer.decoder.decode()
181
  # tokenizer.post_processor = processors.ByteLevel(
182
  # add_prefix_space=False, trim_offsets=False, use_regex=False
183
  # )
@@ -191,8 +190,8 @@ class UniversalActionProcessor(ProcessorMixin):
191
  special_tokens=[],
192
  # initial_alphabet=pre_tokenizers.ByteLevel.alphabet(),
193
  initial_alphabet=alphabet,
194
- max_token_length=256,
195
- # max_token_length=10_000,
196
  )
197
  tokenizer.train_from_iterator(
198
  _token_iter(), trainer=trainer, length=len(dct_tokens)
 
3
 
4
  import numpy as np
5
  from scipy.fft import dct, idct
6
+ from tokenizers import Tokenizer, pre_tokenizers
7
  from tokenizers.models import BPE
8
  from tokenizers.trainers import BpeTrainer
9
  from transformers import PreTrainedTokenizerFast
 
177
  # tokenizer.decoder = decoders.ByteLevel(
178
  # add_prefix_space=False, trim_offsets=False, use_regex=False
179
  # )
 
180
  # tokenizer.post_processor = processors.ByteLevel(
181
  # add_prefix_space=False, trim_offsets=False, use_regex=False
182
  # )
 
190
  special_tokens=[],
191
  # initial_alphabet=pre_tokenizers.ByteLevel.alphabet(),
192
  initial_alphabet=alphabet,
193
+ # max_token_length=256,
194
+ max_token_length=10_000,
195
  )
196
  tokenizer.train_from_iterator(
197
  _token_iter(), trainer=trainer, length=len(dct_tokens)
tokenizer.json CHANGED
The diff for this file is too large to render. See raw diff