AkieTokenizer
Tokenizer SentencePiece do projeto AKIE — 32.000 tokens, treinado em
corpus português (ClassiCC-PT). Convenção de tokens especiais estilo
Llama (<s>/</s>/<pad>/<unk>) + tokens de chat próprios do
projeto (<|user|>, </|user|>, <|assistant|>, </|assistant|>,
<think>, </think>).
from transformers import AutoTokenizer
tok = AutoTokenizer.from_pretrained("IuriCerqueira/AkieTokenizer")
len(tok) == 32000. IDs especiais: bos=2, eos=3, pad=0, unk=1.
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support