AkieTokenizer

Tokenizer SentencePiece do projeto AKIE — 32.000 tokens, treinado em corpus português (ClassiCC-PT). Convenção de tokens especiais estilo Llama (<s>/</s>/<pad>/<unk>) + tokens de chat próprios do projeto (<|user|>, </|user|>, <|assistant|>, </|assistant|>, <think>, </think>).

from transformers import AutoTokenizer
tok = AutoTokenizer.from_pretrained("IuriCerqueira/AkieTokenizer")

len(tok) == 32000. IDs especiais: bos=2, eos=3, pad=0, unk=1.

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support