Instructions to use tobiges/behavior_fast with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use tobiges/behavior_fast with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("tobiges/behavior_fast", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Upload processor
Browse files- processing_action_tokenizer.py +6 -1
- processor_config.json +1 -1
- tokenizer.json +0 -0
processing_action_tokenizer.py
CHANGED
|
@@ -119,6 +119,7 @@ class UniversalActionProcessor(ProcessorMixin):
|
|
| 119 |
max_token = int(np.around(np.concatenate(dct_tokens) * scale).max())
|
| 120 |
min_token = int(np.around(np.concatenate(dct_tokens) * scale).min())
|
| 121 |
min_vocab_size = max_token - min_token
|
|
|
|
| 122 |
|
| 123 |
assert (
|
| 124 |
min_vocab_size <= vocab_size
|
|
@@ -129,6 +130,10 @@ class UniversalActionProcessor(ProcessorMixin):
|
|
| 129 |
f"size {vocab_size}, consider increasing vocab size"
|
| 130 |
)
|
| 131 |
|
|
|
|
|
|
|
|
|
|
|
|
|
| 132 |
# Make token iterator for BPE training
|
| 133 |
def _token_iter():
|
| 134 |
while dct_tokens:
|
|
@@ -163,7 +168,7 @@ class UniversalActionProcessor(ProcessorMixin):
|
|
| 163 |
tokenizer.post_processor = processors.ByteLevel(trim_offsets=False)
|
| 164 |
|
| 165 |
# Set up the entire range of possible tokens as the initial alphabet
|
| 166 |
-
alphabet = [chr(i) for i in range(
|
| 167 |
trainer = BpeTrainer(
|
| 168 |
vocab_size=vocab_size,
|
| 169 |
min_frequency=2,
|
|
|
|
| 119 |
max_token = int(np.around(np.concatenate(dct_tokens) * scale).max())
|
| 120 |
min_token = int(np.around(np.concatenate(dct_tokens) * scale).min())
|
| 121 |
min_vocab_size = max_token - min_token
|
| 122 |
+
print(f"Min token: {min_token}, Max token: {max_token}, Min vocab size: {min_vocab_size}")
|
| 123 |
|
| 124 |
assert (
|
| 125 |
min_vocab_size <= vocab_size
|
|
|
|
| 130 |
f"size {vocab_size}, consider increasing vocab size"
|
| 131 |
)
|
| 132 |
|
| 133 |
+
assert min_token >= -128 + 10, f"Min token {min_token} is less than -128 + 10 (for buffer space)"
|
| 134 |
+
assert max_token < 128 - 10, f"Max token {max_token} is greater than 128 - 10 (for buffer space)"
|
| 135 |
+
min_token = -128
|
| 136 |
+
|
| 137 |
# Make token iterator for BPE training
|
| 138 |
def _token_iter():
|
| 139 |
while dct_tokens:
|
|
|
|
| 168 |
tokenizer.post_processor = processors.ByteLevel(trim_offsets=False)
|
| 169 |
|
| 170 |
# Set up the entire range of possible tokens as the initial alphabet
|
| 171 |
+
alphabet = [chr(i) for i in range(256)]
|
| 172 |
trainer = BpeTrainer(
|
| 173 |
vocab_size=vocab_size,
|
| 174 |
min_frequency=2,
|
processor_config.json
CHANGED
|
@@ -3,7 +3,7 @@
|
|
| 3 |
"auto_map": {
|
| 4 |
"AutoProcessor": "processing_action_tokenizer.UniversalActionProcessor"
|
| 5 |
},
|
| 6 |
-
"min_token": -
|
| 7 |
"processor_class": "UniversalActionProcessor",
|
| 8 |
"scale": 10.0,
|
| 9 |
"time_horizon": null,
|
|
|
|
| 3 |
"auto_map": {
|
| 4 |
"AutoProcessor": "processing_action_tokenizer.UniversalActionProcessor"
|
| 5 |
},
|
| 6 |
+
"min_token": -128,
|
| 7 |
"processor_class": "UniversalActionProcessor",
|
| 8 |
"scale": 10.0,
|
| 9 |
"time_horizon": null,
|
tokenizer.json
CHANGED
|
The diff for this file is too large to render.
See raw diff
|
|
|