| --- |
| language: |
| - tr |
| tags: |
| - tokenizer |
| - bpe |
| - turkish |
| license: unknown |
| --- |
| |
| # Türkçe BPE Tokenizer |
|
|
| Türkçe Wikipedia'dan (resmi MediaWiki API üzerinden, `action=query&generator=random`) toplanan bir korpus üzerinde eğitilmiş BPE (Byte-Pair Encoding) tokenizer. |
|
|
| ## Eğitim Detayları |
|
|
| - **Yöntem**: BPE (Hugging Face `tokenizers` kütüphanesi) |
| - **Pre-tokenizer**: Whitespace |
| - **Hedef vocab boyutu**: 256.000 |
| - **Gerçekleşen vocab boyutu**: 78.431 (korpus boyutu hedefe göre daha küçük kaldığı için trainer daha düşük bir vocab'da yakınsadı) |
| - **Özel tokenlar**: `[UNK]`, `[PAD]`, `[BOS]`, `[EOS]` |
| - **Korpus kaynağı**: tr.wikipedia.org resmi API, rastgele makaleler (`grnnamespace=0`, düz metin `explaintext=1`) |
|
|
| ## Kullanım |
|
|
| ```python |
| from transformers import AutoTokenizer |
| |
| tokenizer = AutoTokenizer.from_pretrained("eraycancelik/BPE-tokenizer") |
| ids = tokenizer("merhaba dünya") |
| print(ids) |
| ``` |
|
|
| ## Bilinen Sınırlamalar |
|
|
| - Vocab boyutu, korpusun küçüklüğü nedeniyle hedeflenen 256K'nın oldukça altında kaldı; daha büyük/çeşitli bir korpusla yeniden eğitim, alt-kelime parçalanma kalitesini artırabilir. |
| - `Whitespace` pre-tokenizer + eksik bir decoder yapılandırması nedeniyle decode edilen metinde kelime-içi ekstra boşluklar görülebilir (örn. "merhaba" → "mer ha ba"); üretim kullanımından önce `ByteLevel` veya `Metaspace` tipi bir pre-tokenizer/decoder ile yeniden değerlendirilmesi önerilir. |
|
|