--- language: - tr tags: - tokenizer - bpe - turkish license: unknown --- # Türkçe BPE Tokenizer Türkçe Wikipedia'dan (resmi MediaWiki API üzerinden, `action=query&generator=random`) toplanan bir korpus üzerinde eğitilmiş BPE (Byte-Pair Encoding) tokenizer. ## Eğitim Detayları - **Yöntem**: BPE (Hugging Face `tokenizers` kütüphanesi) - **Pre-tokenizer**: Whitespace - **Hedef vocab boyutu**: 256.000 - **Gerçekleşen vocab boyutu**: 78.431 (korpus boyutu hedefe göre daha küçük kaldığı için trainer daha düşük bir vocab'da yakınsadı) - **Özel tokenlar**: `[UNK]`, `[PAD]`, `[BOS]`, `[EOS]` - **Korpus kaynağı**: tr.wikipedia.org resmi API, rastgele makaleler (`grnnamespace=0`, düz metin `explaintext=1`) ## Kullanım ```python from transformers import AutoTokenizer tokenizer = AutoTokenizer.from_pretrained("eraycancelik/BPE-tokenizer") ids = tokenizer("merhaba dünya") print(ids) ``` ## Bilinen Sınırlamalar - Vocab boyutu, korpusun küçüklüğü nedeniyle hedeflenen 256K'nın oldukça altında kaldı; daha büyük/çeşitli bir korpusla yeniden eğitim, alt-kelime parçalanma kalitesini artırabilir. - `Whitespace` pre-tokenizer + eksik bir decoder yapılandırması nedeniyle decode edilen metinde kelime-içi ekstra boşluklar görülebilir (örn. "merhaba" → "mer ha ba"); üretim kullanımından önce `ByteLevel` veya `Metaspace` tipi bir pre-tokenizer/decoder ile yeniden değerlendirilmesi önerilir.