Instructions to use tobiges/behavior_fast with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use tobiges/behavior_fast with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("tobiges/behavior_fast", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Upload processor
Browse files- processing_action_tokenizer.py +3 -4
- tokenizer.json +0 -0
processing_action_tokenizer.py
CHANGED
|
@@ -3,7 +3,7 @@ from typing import ClassVar
|
|
| 3 |
|
| 4 |
import numpy as np
|
| 5 |
from scipy.fft import dct, idct
|
| 6 |
-
from tokenizers import Tokenizer,
|
| 7 |
from tokenizers.models import BPE
|
| 8 |
from tokenizers.trainers import BpeTrainer
|
| 9 |
from transformers import PreTrainedTokenizerFast
|
|
@@ -177,7 +177,6 @@ class UniversalActionProcessor(ProcessorMixin):
|
|
| 177 |
# tokenizer.decoder = decoders.ByteLevel(
|
| 178 |
# add_prefix_space=False, trim_offsets=False, use_regex=False
|
| 179 |
# )
|
| 180 |
-
# tokenizer.decoder.decode()
|
| 181 |
# tokenizer.post_processor = processors.ByteLevel(
|
| 182 |
# add_prefix_space=False, trim_offsets=False, use_regex=False
|
| 183 |
# )
|
|
@@ -191,8 +190,8 @@ class UniversalActionProcessor(ProcessorMixin):
|
|
| 191 |
special_tokens=[],
|
| 192 |
# initial_alphabet=pre_tokenizers.ByteLevel.alphabet(),
|
| 193 |
initial_alphabet=alphabet,
|
| 194 |
-
max_token_length=256,
|
| 195 |
-
|
| 196 |
)
|
| 197 |
tokenizer.train_from_iterator(
|
| 198 |
_token_iter(), trainer=trainer, length=len(dct_tokens)
|
|
|
|
| 3 |
|
| 4 |
import numpy as np
|
| 5 |
from scipy.fft import dct, idct
|
| 6 |
+
from tokenizers import Tokenizer, pre_tokenizers
|
| 7 |
from tokenizers.models import BPE
|
| 8 |
from tokenizers.trainers import BpeTrainer
|
| 9 |
from transformers import PreTrainedTokenizerFast
|
|
|
|
| 177 |
# tokenizer.decoder = decoders.ByteLevel(
|
| 178 |
# add_prefix_space=False, trim_offsets=False, use_regex=False
|
| 179 |
# )
|
|
|
|
| 180 |
# tokenizer.post_processor = processors.ByteLevel(
|
| 181 |
# add_prefix_space=False, trim_offsets=False, use_regex=False
|
| 182 |
# )
|
|
|
|
| 190 |
special_tokens=[],
|
| 191 |
# initial_alphabet=pre_tokenizers.ByteLevel.alphabet(),
|
| 192 |
initial_alphabet=alphabet,
|
| 193 |
+
# max_token_length=256,
|
| 194 |
+
max_token_length=10_000,
|
| 195 |
)
|
| 196 |
tokenizer.train_from_iterator(
|
| 197 |
_token_iter(), trainer=trainer, length=len(dct_tokens)
|
tokenizer.json
CHANGED
|
The diff for this file is too large to render.
See raw diff
|
|
|