Transformers
tobiges commited on
Commit
131328b
·
verified ·
1 Parent(s): 7feecd8

Upload processor

Browse files
processing_action_tokenizer.py CHANGED
@@ -159,14 +159,14 @@ class UniversalActionProcessor(ProcessorMixin):
159
  tokenizer.decoder = decoders.ByteLevel()
160
  tokenizer.post_processor = processors.ByteLevel(trim_offsets=False)
161
 
162
- alphabet = [chr(i) for i in range(256)]
163
  trainer = BpeTrainer(
164
  vocab_size=vocab_size,
165
  min_frequency=2,
166
  show_progress=True,
167
  special_tokens=[],
168
- # initial_alphabet=pre_tokenizers.ByteLevel.alphabet(),
169
- initial_alphabet=alphabet,
170
  # max_token_length=256,
171
  max_token_length=10_000,
172
  )
 
159
  tokenizer.decoder = decoders.ByteLevel()
160
  tokenizer.post_processor = processors.ByteLevel(trim_offsets=False)
161
 
162
+ # alphabet = [chr(i) for i in range(256)]
163
  trainer = BpeTrainer(
164
  vocab_size=vocab_size,
165
  min_frequency=2,
166
  show_progress=True,
167
  special_tokens=[],
168
+ initial_alphabet=pre_tokenizers.ByteLevel.alphabet(),
169
+ # initial_alphabet=alphabet,
170
  # max_token_length=256,
171
  max_token_length=10_000,
172
  )
processor_config.json CHANGED
@@ -7,5 +7,5 @@
7
  "processor_class": "UniversalActionProcessor",
8
  "scale": 10.0,
9
  "time_horizon": 50,
10
- "vocab_size": 1024
11
  }
 
7
  "processor_class": "UniversalActionProcessor",
8
  "scale": 10.0,
9
  "time_horizon": 50,
10
+ "vocab_size": 2048
11
  }
tokenizer.json CHANGED
The diff for this file is too large to render. See raw diff