Transformers
tobiges commited on
Commit
563321d
·
verified ·
1 Parent(s): 644a6a3

Upload processor

Browse files
Files changed (2) hide show
  1. processing_action_tokenizer.py +3 -2
  2. tokenizer.json +0 -0
processing_action_tokenizer.py CHANGED
@@ -150,13 +150,14 @@ class UniversalActionProcessor(ProcessorMixin):
150
  tokenizer.post_processor = processors.ByteLevel(trim_offsets=False)
151
 
152
  # Set up the entire range of possible tokens as the initial alphabet
153
- # alphabet = [chr(i) for i in range(max_token - min_token + 1)]
154
  trainer = BpeTrainer(
155
  vocab_size=vocab_size,
156
  min_frequency=2,
157
  show_progress=True,
158
  special_tokens=[],
159
- initial_alphabet=pre_tokenizers.ByteLevel.alphabet(),
 
160
  max_token_length=10000,
161
  )
162
  tokenizer.train_from_iterator(
 
150
  tokenizer.post_processor = processors.ByteLevel(trim_offsets=False)
151
 
152
  # Set up the entire range of possible tokens as the initial alphabet
153
+ alphabet = [chr(i) for i in range(max_token - min_token + 1)]
154
  trainer = BpeTrainer(
155
  vocab_size=vocab_size,
156
  min_frequency=2,
157
  show_progress=True,
158
  special_tokens=[],
159
+ # initial_alphabet=pre_tokenizers.ByteLevel.alphabet(),
160
+ initial_alphabet=alphabet,
161
  max_token_length=10000,
162
  )
163
  tokenizer.train_from_iterator(
tokenizer.json CHANGED
The diff for this file is too large to render. See raw diff