BPE-tokenizer / README.md
eraycancelik's picture
Update README.md
907315d verified
|
Raw
History Blame Contribute Delete
1.47 kB
metadata
language:
  - tr
tags:
  - tokenizer
  - bpe
  - turkish
license: unknown

Türkçe BPE Tokenizer

Türkçe Wikipedia'dan (resmi MediaWiki API üzerinden, action=query&generator=random) toplanan bir korpus üzerinde eğitilmiş BPE (Byte-Pair Encoding) tokenizer.

Eğitim Detayları

  • Yöntem: BPE (Hugging Face tokenizers kütüphanesi)
  • Pre-tokenizer: Whitespace
  • Hedef vocab boyutu: 256.000
  • Gerçekleşen vocab boyutu: 78.431 (korpus boyutu hedefe göre daha küçük kaldığı için trainer daha düşük bir vocab'da yakınsadı)
  • Özel tokenlar: [UNK], [PAD], [BOS], [EOS]
  • Korpus kaynağı: tr.wikipedia.org resmi API, rastgele makaleler (grnnamespace=0, düz metin explaintext=1)

Kullanım

from transformers import AutoTokenizer

tokenizer = AutoTokenizer.from_pretrained("eraycancelik/BPE-tokenizer")
ids = tokenizer("merhaba dünya")
print(ids)

Bilinen Sınırlamalar

  • Vocab boyutu, korpusun küçüklüğü nedeniyle hedeflenen 256K'nın oldukça altında kaldı; daha büyük/çeşitli bir korpusla yeniden eğitim, alt-kelime parçalanma kalitesini artırabilir.
  • Whitespace pre-tokenizer + eksik bir decoder yapılandırması nedeniyle decode edilen metinde kelime-içi ekstra boşluklar görülebilir (örn. "merhaba" → "mer ha ba"); üretim kullanımından önce ByteLevel veya Metaspace tipi bir pre-tokenizer/decoder ile yeniden değerlendirilmesi önerilir.