BPE-tokenizer / README.md
eraycancelik's picture
Update README.md
907315d verified
|
Raw
History Blame Contribute Delete
1.47 kB
---
language:
- tr
tags:
- tokenizer
- bpe
- turkish
license: unknown
---
# Türkçe BPE Tokenizer
Türkçe Wikipedia'dan (resmi MediaWiki API üzerinden, `action=query&generator=random`) toplanan bir korpus üzerinde eğitilmiş BPE (Byte-Pair Encoding) tokenizer.
## Eğitim Detayları
- **Yöntem**: BPE (Hugging Face `tokenizers` kütüphanesi)
- **Pre-tokenizer**: Whitespace
- **Hedef vocab boyutu**: 256.000
- **Gerçekleşen vocab boyutu**: 78.431 (korpus boyutu hedefe göre daha küçük kaldığı için trainer daha düşük bir vocab'da yakınsadı)
- **Özel tokenlar**: `[UNK]`, `[PAD]`, `[BOS]`, `[EOS]`
- **Korpus kaynağı**: tr.wikipedia.org resmi API, rastgele makaleler (`grnnamespace=0`, düz metin `explaintext=1`)
## Kullanım
```python
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained("eraycancelik/BPE-tokenizer")
ids = tokenizer("merhaba dünya")
print(ids)
```
## Bilinen Sınırlamalar
- Vocab boyutu, korpusun küçüklüğü nedeniyle hedeflenen 256K'nın oldukça altında kaldı; daha büyük/çeşitli bir korpusla yeniden eğitim, alt-kelime parçalanma kalitesini artırabilir.
- `Whitespace` pre-tokenizer + eksik bir decoder yapılandırması nedeniyle decode edilen metinde kelime-içi ekstra boşluklar görülebilir (örn. "merhaba" → "mer ha ba"); üretim kullanımından önce `ByteLevel` veya `Metaspace` tipi bir pre-tokenizer/decoder ile yeniden değerlendirilmesi önerilir.