Transformers
tobiges commited on
Commit
cc0bbab
·
verified ·
1 Parent(s): e1ac134

Upload processor

Browse files
processing_action_tokenizer.py CHANGED
@@ -119,6 +119,7 @@ class UniversalActionProcessor(ProcessorMixin):
119
  max_token = int(np.around(np.concatenate(dct_tokens) * scale).max())
120
  min_token = int(np.around(np.concatenate(dct_tokens) * scale).min())
121
  min_vocab_size = max_token - min_token
 
122
 
123
  assert (
124
  min_vocab_size <= vocab_size
@@ -129,6 +130,10 @@ class UniversalActionProcessor(ProcessorMixin):
129
  f"size {vocab_size}, consider increasing vocab size"
130
  )
131
 
 
 
 
 
132
  # Make token iterator for BPE training
133
  def _token_iter():
134
  while dct_tokens:
@@ -163,7 +168,7 @@ class UniversalActionProcessor(ProcessorMixin):
163
  tokenizer.post_processor = processors.ByteLevel(trim_offsets=False)
164
 
165
  # Set up the entire range of possible tokens as the initial alphabet
166
- alphabet = [chr(i) for i in range(max_token - min_token + 1)]
167
  trainer = BpeTrainer(
168
  vocab_size=vocab_size,
169
  min_frequency=2,
 
119
  max_token = int(np.around(np.concatenate(dct_tokens) * scale).max())
120
  min_token = int(np.around(np.concatenate(dct_tokens) * scale).min())
121
  min_vocab_size = max_token - min_token
122
+ print(f"Min token: {min_token}, Max token: {max_token}, Min vocab size: {min_vocab_size}")
123
 
124
  assert (
125
  min_vocab_size <= vocab_size
 
130
  f"size {vocab_size}, consider increasing vocab size"
131
  )
132
 
133
+ assert min_token >= -128 + 10, f"Min token {min_token} is less than -128 + 10 (for buffer space)"
134
+ assert max_token < 128 - 10, f"Max token {max_token} is greater than 128 - 10 (for buffer space)"
135
+ min_token = -128
136
+
137
  # Make token iterator for BPE training
138
  def _token_iter():
139
  while dct_tokens:
 
168
  tokenizer.post_processor = processors.ByteLevel(trim_offsets=False)
169
 
170
  # Set up the entire range of possible tokens as the initial alphabet
171
+ alphabet = [chr(i) for i in range(256)]
172
  trainer = BpeTrainer(
173
  vocab_size=vocab_size,
174
  min_frequency=2,
processor_config.json CHANGED
@@ -3,7 +3,7 @@
3
  "auto_map": {
4
  "AutoProcessor": "processing_action_tokenizer.UniversalActionProcessor"
5
  },
6
- "min_token": -71,
7
  "processor_class": "UniversalActionProcessor",
8
  "scale": 10.0,
9
  "time_horizon": null,
 
3
  "auto_map": {
4
  "AutoProcessor": "processing_action_tokenizer.UniversalActionProcessor"
5
  },
6
+ "min_token": -128,
7
  "processor_class": "UniversalActionProcessor",
8
  "scale": 10.0,
9
  "time_horizon": null,
tokenizer.json CHANGED
The diff for this file is too large to render. See raw diff