File size: 543 Bytes
d08611a
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
---
license: apache-2.0
---

# AkieTokenizer

Tokenizer SentencePiece do projeto AKIE — 32.000 tokens, treinado em
corpus português (ClassiCC-PT). Convenção de tokens especiais estilo
Llama (`<s>`/`</s>`/`<pad>`/`<unk>`) + tokens de chat próprios do
projeto (`<|user|>`, `</|user|>`, `<|assistant|>`, `</|assistant|>`,
`<think>`, `</think>`).

```python
from transformers import AutoTokenizer
tok = AutoTokenizer.from_pretrained("IuriCerqueira/AkieTokenizer")
```

`len(tok) == 32000`. IDs especiais: `bos=2`, `eos=3`, `pad=0`, `unk=1`.