Instructions to use tobiges/behavior_fast with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use tobiges/behavior_fast with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("tobiges/behavior_fast", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Upload processor
Browse files- processing_action_tokenizer.py +10 -10
- tokenizer.json +0 -0
processing_action_tokenizer.py
CHANGED
|
@@ -3,7 +3,7 @@ from typing import ClassVar
|
|
| 3 |
|
| 4 |
import numpy as np
|
| 5 |
from scipy.fft import dct, idct
|
| 6 |
-
from tokenizers import Tokenizer, pre_tokenizers
|
| 7 |
from tokenizers.models import BPE
|
| 8 |
from tokenizers.trainers import BpeTrainer
|
| 9 |
from transformers import PreTrainedTokenizerFast
|
|
@@ -171,15 +171,15 @@ class UniversalActionProcessor(ProcessorMixin):
|
|
| 171 |
|
| 172 |
# Train BPE tokenizer
|
| 173 |
tokenizer = Tokenizer(BPE())
|
| 174 |
-
|
| 175 |
-
|
| 176 |
-
|
| 177 |
-
|
| 178 |
-
|
| 179 |
-
|
| 180 |
-
|
| 181 |
-
|
| 182 |
-
|
| 183 |
|
| 184 |
# Set up the entire range of possible tokens as the initial alphabet
|
| 185 |
alphabet = [chr(i) for i in range(256)]
|
|
|
|
| 3 |
|
| 4 |
import numpy as np
|
| 5 |
from scipy.fft import dct, idct
|
| 6 |
+
from tokenizers import Tokenizer, decoders, pre_tokenizers, processors
|
| 7 |
from tokenizers.models import BPE
|
| 8 |
from tokenizers.trainers import BpeTrainer
|
| 9 |
from transformers import PreTrainedTokenizerFast
|
|
|
|
| 171 |
|
| 172 |
# Train BPE tokenizer
|
| 173 |
tokenizer = Tokenizer(BPE())
|
| 174 |
+
tokenizer.pre_tokenizer = pre_tokenizers.ByteLevel(
|
| 175 |
+
add_prefix_space=False, use_regex=False, trim_offsets=False
|
| 176 |
+
)
|
| 177 |
+
tokenizer.decoder = decoders.ByteLevel(
|
| 178 |
+
add_prefix_space=False, trim_offsets=False, use_regex=False
|
| 179 |
+
)
|
| 180 |
+
tokenizer.post_processor = processors.ByteLevel(
|
| 181 |
+
add_prefix_space=False, trim_offsets=False, use_regex=False
|
| 182 |
+
)
|
| 183 |
|
| 184 |
# Set up the entire range of possible tokens as the initial alphabet
|
| 185 |
alphabet = [chr(i) for i in range(256)]
|
tokenizer.json
CHANGED
|
The diff for this file is too large to render.
See raw diff
|
|
|