Mask Generation
Transformers
Safetensors
falcon_perception
text-generation
falcon
segmentation
vision-language
open-vocabulary
custom_code
Eval Results
Instructions to use tiiuae/Falcon-Perception with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use tiiuae/Falcon-Perception with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("mask-generation", model="tiiuae/Falcon-Perception", trust_remote_code=True)# Load model directly from transformers import AutoModelForCausalLM model = AutoModelForCausalLM.from_pretrained("tiiuae/Falcon-Perception", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
Add exported weights
Browse files- anyup.py +3 -67
- config.json +4 -16
- configuration_falcon_perception.py +2 -14
- model.safetensors +1 -1
- model_args.json +0 -4
- tokenizer.json +26 -1
- tokenizer_config.json +21 -20
anyup.py
CHANGED
|
@@ -76,53 +76,6 @@ class ResBlock(nn.Module):
|
|
| 76 |
# LearnedFeatureUnification (from layers/feature_unification.py)
|
| 77 |
# ---------------------------------------------------------------------------
|
| 78 |
|
| 79 |
-
compute_basis_size = {
|
| 80 |
-
"gauss_deriv": lambda order, mirror: ((order + 1) * (order + 2))
|
| 81 |
-
// (1 if mirror else 2)
|
| 82 |
-
}
|
| 83 |
-
|
| 84 |
-
|
| 85 |
-
def herme_vander_torch(z, m):
|
| 86 |
-
He0 = z.new_ones(z.shape)
|
| 87 |
-
if m == 0:
|
| 88 |
-
return He0[:, None]
|
| 89 |
-
H = [He0, z]
|
| 90 |
-
for n in range(1, m):
|
| 91 |
-
H.append(z * H[-1] - n * H[-2])
|
| 92 |
-
return torch.stack(H, 1)
|
| 93 |
-
|
| 94 |
-
|
| 95 |
-
def gauss_deriv(
|
| 96 |
-
max_order,
|
| 97 |
-
device,
|
| 98 |
-
dtype,
|
| 99 |
-
kernel_size,
|
| 100 |
-
sigma=None,
|
| 101 |
-
include_negations=False,
|
| 102 |
-
scale_magnitude=True,
|
| 103 |
-
):
|
| 104 |
-
sigma = (kernel_size // 2) / 1.645 if sigma is None else sigma
|
| 105 |
-
if kernel_size % 2 == 0:
|
| 106 |
-
raise ValueError("ksize must be odd")
|
| 107 |
-
half = kernel_size // 2
|
| 108 |
-
x = torch.arange(-half, half + 1, dtype=dtype, device=device)
|
| 109 |
-
z = x / sigma
|
| 110 |
-
g = torch.exp(-0.5 * z**2) / (sigma * (2.0 * torch.pi) ** 0.5)
|
| 111 |
-
He = herme_vander_torch(z, max_order)
|
| 112 |
-
derivs_1d = [
|
| 113 |
-
(((-1) ** n) / (sigma**n) if scale_magnitude else (-1) ** n) * He[:, n] * g
|
| 114 |
-
for n in range(max_order + 1)
|
| 115 |
-
]
|
| 116 |
-
bank = []
|
| 117 |
-
for o in range(max_order + 1):
|
| 118 |
-
for i in range(o + 1):
|
| 119 |
-
K = torch.outer(derivs_1d[o - i], derivs_1d[i])
|
| 120 |
-
bank.append(K)
|
| 121 |
-
if include_negations:
|
| 122 |
-
bank.append(-K)
|
| 123 |
-
return torch.stack(bank, 0)
|
| 124 |
-
|
| 125 |
-
|
| 126 |
class LearnedFeatureUnification(nn.Module):
|
| 127 |
def __init__(
|
| 128 |
self,
|
|
@@ -133,26 +86,9 @@ class LearnedFeatureUnification(nn.Module):
|
|
| 133 |
super().__init__()
|
| 134 |
self.out_channels = out_channels
|
| 135 |
self.kernel_size = kernel_size
|
| 136 |
-
|
| 137 |
-
|
| 138 |
-
|
| 139 |
-
order += 1
|
| 140 |
-
print(
|
| 141 |
-
f"FeatureUnification: initializing with Gaussian derivative basis of order {order}"
|
| 142 |
-
)
|
| 143 |
-
self.basis = nn.Parameter(
|
| 144 |
-
gauss_deriv(
|
| 145 |
-
order,
|
| 146 |
-
device="cpu",
|
| 147 |
-
dtype=torch.float32,
|
| 148 |
-
kernel_size=kernel_size,
|
| 149 |
-
scale_magnitude=False,
|
| 150 |
-
)[:out_channels, None]
|
| 151 |
-
)
|
| 152 |
-
else:
|
| 153 |
-
self.basis = nn.Parameter(
|
| 154 |
-
torch.randn(out_channels, 1, kernel_size, kernel_size)
|
| 155 |
-
)
|
| 156 |
|
| 157 |
def forward(self, features: torch.Tensor) -> torch.Tensor:
|
| 158 |
b, c, h, w = features.shape
|
|
|
|
| 76 |
# LearnedFeatureUnification (from layers/feature_unification.py)
|
| 77 |
# ---------------------------------------------------------------------------
|
| 78 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 79 |
class LearnedFeatureUnification(nn.Module):
|
| 80 |
def __init__(
|
| 81 |
self,
|
|
|
|
| 86 |
super().__init__()
|
| 87 |
self.out_channels = out_channels
|
| 88 |
self.kernel_size = kernel_size
|
| 89 |
+
self.basis = nn.Parameter(
|
| 90 |
+
torch.randn(out_channels, 1, kernel_size, kernel_size)
|
| 91 |
+
)
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 92 |
|
| 93 |
def forward(self, features: torch.Tensor) -> torch.Tensor:
|
| 94 |
b, c, h, w = features.shape
|
config.json
CHANGED
|
@@ -7,8 +7,7 @@
|
|
| 7 |
"AutoModelForCausalLM": "modeling_falcon_perception.FalconPerceptionForSegmentation"
|
| 8 |
},
|
| 9 |
"model_type": "falcon_perception",
|
| 10 |
-
"torch_dtype": "
|
| 11 |
-
|
| 12 |
"dim": 1024,
|
| 13 |
"n_layers": 28,
|
| 14 |
"n_heads": 16,
|
|
@@ -19,38 +18,27 @@
|
|
| 19 |
"norm_eps": 1e-05,
|
| 20 |
"max_seq_len": 8192,
|
| 21 |
"rope_theta": 10000,
|
| 22 |
-
|
| 23 |
"channel_size": 3,
|
| 24 |
"spatial_patch_size": 16,
|
| 25 |
"temporal_patch_size": 1,
|
| 26 |
-
|
| 27 |
"do_segmentation": true,
|
| 28 |
"segm_out_dim": 256,
|
| 29 |
"num_segm_layers": 3,
|
| 30 |
-
|
| 31 |
"coord_enc_dim": 512,
|
| 32 |
"coord_dec_dim": 8192,
|
| 33 |
"coord_out_dim": 2048,
|
| 34 |
"coord_token_id": 240,
|
| 35 |
-
|
| 36 |
"size_enc_dim": 512,
|
| 37 |
"size_dec_dim": 8192,
|
| 38 |
"size_out_dim": 2048,
|
| 39 |
"size_token_id": 241,
|
| 40 |
-
|
| 41 |
"seg_token_id": 262,
|
| 42 |
-
"img_id": 227,
|
| 43 |
"eos_id": 11,
|
|
|
|
| 44 |
"image_cls_token_id": 244,
|
| 45 |
-
"image_mask_token_id": 243,
|
| 46 |
"image_reg_1_token_id": 245,
|
| 47 |
"image_reg_2_token_id": 246,
|
| 48 |
"image_reg_3_token_id": 247,
|
| 49 |
"image_reg_4_token_id": 248,
|
| 50 |
-
"
|
| 51 |
-
|
| 52 |
-
"img_row_sep_id": 228,
|
| 53 |
-
"vid_start_id": 231,
|
| 54 |
-
"vid_end_id": 232,
|
| 55 |
-
"frame_sep_id": 233
|
| 56 |
-
}
|
|
|
|
| 7 |
"AutoModelForCausalLM": "modeling_falcon_perception.FalconPerceptionForSegmentation"
|
| 8 |
},
|
| 9 |
"model_type": "falcon_perception",
|
| 10 |
+
"torch_dtype": "float32",
|
|
|
|
| 11 |
"dim": 1024,
|
| 12 |
"n_layers": 28,
|
| 13 |
"n_heads": 16,
|
|
|
|
| 18 |
"norm_eps": 1e-05,
|
| 19 |
"max_seq_len": 8192,
|
| 20 |
"rope_theta": 10000,
|
|
|
|
| 21 |
"channel_size": 3,
|
| 22 |
"spatial_patch_size": 16,
|
| 23 |
"temporal_patch_size": 1,
|
|
|
|
| 24 |
"do_segmentation": true,
|
| 25 |
"segm_out_dim": 256,
|
| 26 |
"num_segm_layers": 3,
|
|
|
|
| 27 |
"coord_enc_dim": 512,
|
| 28 |
"coord_dec_dim": 8192,
|
| 29 |
"coord_out_dim": 2048,
|
| 30 |
"coord_token_id": 240,
|
|
|
|
| 31 |
"size_enc_dim": 512,
|
| 32 |
"size_dec_dim": 8192,
|
| 33 |
"size_out_dim": 2048,
|
| 34 |
"size_token_id": 241,
|
|
|
|
| 35 |
"seg_token_id": 262,
|
|
|
|
| 36 |
"eos_id": 11,
|
| 37 |
+
"img_id": 227,
|
| 38 |
"image_cls_token_id": 244,
|
|
|
|
| 39 |
"image_reg_1_token_id": 245,
|
| 40 |
"image_reg_2_token_id": 246,
|
| 41 |
"image_reg_3_token_id": 247,
|
| 42 |
"image_reg_4_token_id": 248,
|
| 43 |
+
"img_end_id": 230
|
| 44 |
+
}
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
configuration_falcon_perception.py
CHANGED
|
@@ -31,20 +31,14 @@ class FalconPerceptionConfig(PretrainedConfig):
|
|
| 31 |
size_out_dim: int = 2048,
|
| 32 |
size_token_id: int = 241,
|
| 33 |
seg_token_id: int = 262,
|
| 34 |
-
img_id: int = 227,
|
| 35 |
eos_id: int = 11,
|
|
|
|
| 36 |
image_cls_token_id: int = 244,
|
| 37 |
-
image_mask_token_id: int = 243,
|
| 38 |
image_reg_1_token_id: int = 245,
|
| 39 |
image_reg_2_token_id: int = 246,
|
| 40 |
image_reg_3_token_id: int = 247,
|
| 41 |
image_reg_4_token_id: int = 248,
|
| 42 |
-
img_start_id: int = 229,
|
| 43 |
img_end_id: int = 230,
|
| 44 |
-
img_row_sep_id: int = 228,
|
| 45 |
-
vid_start_id: int = 231,
|
| 46 |
-
vid_end_id: int = 232,
|
| 47 |
-
frame_sep_id: int = 233,
|
| 48 |
**kwargs,
|
| 49 |
):
|
| 50 |
self.dim = dim
|
|
@@ -72,18 +66,12 @@ class FalconPerceptionConfig(PretrainedConfig):
|
|
| 72 |
self.size_out_dim = size_out_dim
|
| 73 |
self.size_token_id = size_token_id
|
| 74 |
self.seg_token_id = seg_token_id
|
| 75 |
-
self.img_id = img_id
|
| 76 |
self.eos_id = eos_id
|
|
|
|
| 77 |
self.image_cls_token_id = image_cls_token_id
|
| 78 |
-
self.image_mask_token_id = image_mask_token_id
|
| 79 |
self.image_reg_1_token_id = image_reg_1_token_id
|
| 80 |
self.image_reg_2_token_id = image_reg_2_token_id
|
| 81 |
self.image_reg_3_token_id = image_reg_3_token_id
|
| 82 |
self.image_reg_4_token_id = image_reg_4_token_id
|
| 83 |
-
self.img_start_id = img_start_id
|
| 84 |
self.img_end_id = img_end_id
|
| 85 |
-
self.img_row_sep_id = img_row_sep_id
|
| 86 |
-
self.vid_start_id = vid_start_id
|
| 87 |
-
self.vid_end_id = vid_end_id
|
| 88 |
-
self.frame_sep_id = frame_sep_id
|
| 89 |
super().__init__(**kwargs)
|
|
|
|
| 31 |
size_out_dim: int = 2048,
|
| 32 |
size_token_id: int = 241,
|
| 33 |
seg_token_id: int = 262,
|
|
|
|
| 34 |
eos_id: int = 11,
|
| 35 |
+
img_id: int = 227,
|
| 36 |
image_cls_token_id: int = 244,
|
|
|
|
| 37 |
image_reg_1_token_id: int = 245,
|
| 38 |
image_reg_2_token_id: int = 246,
|
| 39 |
image_reg_3_token_id: int = 247,
|
| 40 |
image_reg_4_token_id: int = 248,
|
|
|
|
| 41 |
img_end_id: int = 230,
|
|
|
|
|
|
|
|
|
|
|
|
|
| 42 |
**kwargs,
|
| 43 |
):
|
| 44 |
self.dim = dim
|
|
|
|
| 66 |
self.size_out_dim = size_out_dim
|
| 67 |
self.size_token_id = size_token_id
|
| 68 |
self.seg_token_id = seg_token_id
|
|
|
|
| 69 |
self.eos_id = eos_id
|
| 70 |
+
self.img_id = img_id
|
| 71 |
self.image_cls_token_id = image_cls_token_id
|
|
|
|
| 72 |
self.image_reg_1_token_id = image_reg_1_token_id
|
| 73 |
self.image_reg_2_token_id = image_reg_2_token_id
|
| 74 |
self.image_reg_3_token_id = image_reg_3_token_id
|
| 75 |
self.image_reg_4_token_id = image_reg_4_token_id
|
|
|
|
| 76 |
self.img_end_id = img_end_id
|
|
|
|
|
|
|
|
|
|
|
|
|
| 77 |
super().__init__(**kwargs)
|
model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 2529523048
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:d842c991349d997852c99ebf0dc6d368fc70b73c658d117a3088132a6cbb68ca
|
| 3 |
size 2529523048
|
model_args.json
CHANGED
|
@@ -7,10 +7,8 @@
|
|
| 7 |
"dim": 1024,
|
| 8 |
"eos_id": 11,
|
| 9 |
"ffn_dim": 3072,
|
| 10 |
-
"frame_sep_id": 233,
|
| 11 |
"head_dim": 128,
|
| 12 |
"image_cls_token_id": 244,
|
| 13 |
-
"image_mask_token_id": 243,
|
| 14 |
"image_reg_1_token_id": 245,
|
| 15 |
"image_reg_2_token_id": 246,
|
| 16 |
"image_reg_3_token_id": 247,
|
|
@@ -35,7 +33,5 @@
|
|
| 35 |
"size_token_id": 241,
|
| 36 |
"spatial_patch_size": 16,
|
| 37 |
"temporal_patch_size": 1,
|
| 38 |
-
"vid_end_id": 232,
|
| 39 |
-
"vid_start_id": 231,
|
| 40 |
"vocab_size": 65536
|
| 41 |
}
|
|
|
|
| 7 |
"dim": 1024,
|
| 8 |
"eos_id": 11,
|
| 9 |
"ffn_dim": 3072,
|
|
|
|
| 10 |
"head_dim": 128,
|
| 11 |
"image_cls_token_id": 244,
|
|
|
|
| 12 |
"image_reg_1_token_id": 245,
|
| 13 |
"image_reg_2_token_id": 246,
|
| 14 |
"image_reg_3_token_id": 247,
|
|
|
|
| 33 |
"size_token_id": 241,
|
| 34 |
"spatial_patch_size": 16,
|
| 35 |
"temporal_patch_size": 1,
|
|
|
|
|
|
|
| 36 |
"vocab_size": 65536
|
| 37 |
}
|
tokenizer.json
CHANGED
|
@@ -4752,7 +4752,32 @@
|
|
| 4752 |
}
|
| 4753 |
]
|
| 4754 |
},
|
| 4755 |
-
"post_processor":
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 4756 |
"decoder": {
|
| 4757 |
"type": "ByteLevel",
|
| 4758 |
"add_prefix_space": true,
|
|
|
|
| 4752 |
}
|
| 4753 |
]
|
| 4754 |
},
|
| 4755 |
+
"post_processor": {
|
| 4756 |
+
"type": "TemplateProcessing",
|
| 4757 |
+
"single": [
|
| 4758 |
+
{
|
| 4759 |
+
"Sequence": {
|
| 4760 |
+
"id": "A",
|
| 4761 |
+
"type_id": 0
|
| 4762 |
+
}
|
| 4763 |
+
}
|
| 4764 |
+
],
|
| 4765 |
+
"pair": [
|
| 4766 |
+
{
|
| 4767 |
+
"Sequence": {
|
| 4768 |
+
"id": "A",
|
| 4769 |
+
"type_id": 0
|
| 4770 |
+
}
|
| 4771 |
+
},
|
| 4772 |
+
{
|
| 4773 |
+
"Sequence": {
|
| 4774 |
+
"id": "B",
|
| 4775 |
+
"type_id": 1
|
| 4776 |
+
}
|
| 4777 |
+
}
|
| 4778 |
+
],
|
| 4779 |
+
"special_tokens": {}
|
| 4780 |
+
},
|
| 4781 |
"decoder": {
|
| 4782 |
"type": "ByteLevel",
|
| 4783 |
"add_prefix_space": true,
|
tokenizer_config.json
CHANGED
|
@@ -13,7 +13,26 @@
|
|
| 13 |
"end_of_turn_token": "<|end_of_turn|>",
|
| 14 |
"end_of_video_token": "<|end_of_video|>",
|
| 15 |
"eos_token": "<|end_of_text|>",
|
| 16 |
-
"
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 17 |
"absence_token": "<|absence|>",
|
| 18 |
"caption_token": "<|CAPTION|>",
|
| 19 |
"coord_token": "<|coord|>",
|
|
@@ -59,24 +78,6 @@
|
|
| 59 |
"start_of_video_token": "<|start_of_video|>",
|
| 60 |
"task_sep_token": "<|task_sep|>"
|
| 61 |
},
|
| 62 |
-
"frame_sep_token": "<|frame_sep|>",
|
| 63 |
-
"image_cls_token": "<|image_cls|>",
|
| 64 |
-
"image_mask_token": "<|image_mask_token|>",
|
| 65 |
-
"image_reg_1_token": "<|image_reg_1|>",
|
| 66 |
-
"image_reg_2_token": "<|image_reg_2|>",
|
| 67 |
-
"image_reg_3_token": "<|image_reg_3|>",
|
| 68 |
-
"image_reg_4_token": "<|image_reg_4|>",
|
| 69 |
-
"image_reg_5_token": "<|image_reg_5|>",
|
| 70 |
-
"image_reg_6_token": "<|image_reg_6|>",
|
| 71 |
-
"image_reg_7_token": "<|image_reg_7|>",
|
| 72 |
-
"image_reg_8_token": "<|image_reg_8|>",
|
| 73 |
-
"image_row_sep_token": "<|image_row_sep|>",
|
| 74 |
-
"image_token": "<|image|>",
|
| 75 |
-
"model_input_names": [
|
| 76 |
-
"input_ids",
|
| 77 |
-
"attention_mask"
|
| 78 |
-
],
|
| 79 |
-
"model_max_length": 1000000000000000019884624838656,
|
| 80 |
"object_token": "<|object|>",
|
| 81 |
"ocr_doc_parser_token": "<|OCR_DOC_PARSER|>",
|
| 82 |
"ocr_grounding_token": "<|OCR_GROUNDING|>",
|
|
@@ -97,5 +98,5 @@
|
|
| 97 |
"start_of_turn_token": "<|start_of_turn|>",
|
| 98 |
"start_of_video_token": "<|start_of_video|>",
|
| 99 |
"task_sep_token": "<|task_sep|>",
|
| 100 |
-
"tokenizer_class": "
|
| 101 |
}
|
|
|
|
| 13 |
"end_of_turn_token": "<|end_of_turn|>",
|
| 14 |
"end_of_video_token": "<|end_of_video|>",
|
| 15 |
"eos_token": "<|end_of_text|>",
|
| 16 |
+
"frame_sep_token": "<|frame_sep|>",
|
| 17 |
+
"image_cls_token": "<|image_cls|>",
|
| 18 |
+
"image_mask_token": "<|image_mask_token|>",
|
| 19 |
+
"image_reg_1_token": "<|image_reg_1|>",
|
| 20 |
+
"image_reg_2_token": "<|image_reg_2|>",
|
| 21 |
+
"image_reg_3_token": "<|image_reg_3|>",
|
| 22 |
+
"image_reg_4_token": "<|image_reg_4|>",
|
| 23 |
+
"image_reg_5_token": "<|image_reg_5|>",
|
| 24 |
+
"image_reg_6_token": "<|image_reg_6|>",
|
| 25 |
+
"image_reg_7_token": "<|image_reg_7|>",
|
| 26 |
+
"image_reg_8_token": "<|image_reg_8|>",
|
| 27 |
+
"image_row_sep_token": "<|image_row_sep|>",
|
| 28 |
+
"image_token": "<|image|>",
|
| 29 |
+
"is_local": true,
|
| 30 |
+
"model_input_names": [
|
| 31 |
+
"input_ids",
|
| 32 |
+
"attention_mask"
|
| 33 |
+
],
|
| 34 |
+
"model_max_length": 1000000000000000019884624838656,
|
| 35 |
+
"model_specific_special_tokens": {
|
| 36 |
"absence_token": "<|absence|>",
|
| 37 |
"caption_token": "<|CAPTION|>",
|
| 38 |
"coord_token": "<|coord|>",
|
|
|
|
| 78 |
"start_of_video_token": "<|start_of_video|>",
|
| 79 |
"task_sep_token": "<|task_sep|>"
|
| 80 |
},
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 81 |
"object_token": "<|object|>",
|
| 82 |
"ocr_doc_parser_token": "<|OCR_DOC_PARSER|>",
|
| 83 |
"ocr_grounding_token": "<|OCR_GROUNDING|>",
|
|
|
|
| 98 |
"start_of_turn_token": "<|start_of_turn|>",
|
| 99 |
"start_of_video_token": "<|start_of_video|>",
|
| 100 |
"task_sep_token": "<|task_sep|>",
|
| 101 |
+
"tokenizer_class": "TokenizersBackend"
|
| 102 |
}
|