turkce-bpe-tokenizer
Bu repo, sifirdan (from-scratch) yazdigim bir byte-level BPE (Byte-Pair Encoding) tokenizer'in ciktisini icerir. Egitim ve kod, Karpathy'nin minbpe reposundaki yaklasimi ve HuggingFace LLM Course Chapter 6.5'teki adim adim egitim algoritmasini temel aliyor.
Ozellikler
- Vocab boyutu: 512 (256 ogrenilmis merge + 256 temel byte)
- Yontem: Byte-level BPE (GPT-2/GPT-4 tarzi regex on-isleme + byte tabanli temel vocab)
- Egitim metni: Istanbul'un tarihi uzerine yazdigim ozgun bir Turkce metin
- Dosyalar:
benim_bpe_tokenizerim.model- ogrenilen merge kurallaribenim_bpe_tokenizerim.vocab- insan-okunur vocab dokumu
Kullanim
from huggingface_hub import hf_hub_download
model_path = hf_hub_download(repo_id="nursimakgul/turkce-bpe-tokenizer", filename="benim_bpe_tokenizerim.model")
def load_tokenizer(model_path):
merges = {}
vocab = {i: bytes([i]) for i in range(256)}
with open(model_path, "r", encoding="utf-8") as f:
header = f.readline()
assert header.strip() == "bpe v1"
for line in f:
a, b, idx = map(int, line.split())
merges[(a, b)] = idx
vocab[idx] = vocab[a] + vocab[b]
return merges, vocab
merges, vocab = load_tokenizer(model_path)
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support