--- library_name: transformers tags: - bpe - tokenizer - marvel - turkish - custom-tokenizer --- # Custom BPE Tokenizer ## Model Özeti Bu model, büyük dil modellerinin Türkçe metinleri ve özellikle Marvel evreni terminolojisini daha verimli okuyabilmesi için eğitilmiş özel bir **BPE (Byte-Pair Encoding)** Tokenizer modelidir. Gazi Üniversitesi Teknoloji Fakültesi Bilgisayar Mühendisliği bölümü projeleri kapsamında, sıfırdan yapılandırılmış ve spesifik bir alan üzerinde eğitilmiştir. ## Model Detayları ### Model Açıklaması Standart tokenizer'lar genel verilerle eğitildiği için özel isimlerde (Örn: "Adamantium", "Wakanda", "Latveria") parçalama hataları yapabilir. Bu BPE Tokenizer, doğrudan Marvel evrenine ait Türkçe metinler üzerinden eğitilerek bu spesifik terminolojiyi tek parça veya en mantıklı alt-kelime öbekleri halinde tanımak üzere optimize edilmiştir. - **Geliştirici:** Ege Ertekin - **Model Türü:** Byte-Pair Encoding Tokenizer - **Dil:** Türkçe - **Kütüphane:** `tokenizers`, `transformers` - **Sözlük Boyutu:** 10.000 ## Kullanım Amacı ### Doğrudan Kullanım Bu tokenizer, `Egertekin/marvel-domain-dataset` veya benzeri Türkçe çizgi roman/fantastik evren veri setleri kullanılarak Unsloth veya Hugging Face Transformers üzerinden fine-tune edilece temel dil modellerinde metin işleme aracı olarak kullanılmalıdır. ## Eğitim Detayları ### Eğitim Verisi Tokenizer, tamamen Hugging Face Hub üzerinde bulunan [Egertekin/marvel-domain-dataset](https://huggingface.co/datasets/Egertekin/marvel-domain-dataset) veri seti kullanılarak eğitilmiştir. Bu veri setindeki Wikipedia tabanlı organik metinler ve manuel olarak girilip çoğaltılan soru-cevap çiftleri, eğitim derlemi olarak kullanılmıştır. ### Eğitim Prosedürü Model, Hugging Face `tokenizers` kütüphanesindeki `BpeTrainer` kullanılarak eğitilmiştir. Eğitim sırasında modele bilinmeyen kelimeler için `[UNK]` ve doldurma işlemleri için `[PAD]` gibi özel token'lar tanımlanmıştır. - **Özel Tokenler:** `[PAD]`, `[UNK]`, `[CLS]`, `[SEP]`, `[MASK]` - **Ön-İşleme:** `ByteLevel(add_prefix_space=False)` ## Başlangıç Tokenizer'ı projenizde kullanmak için aşağıdaki Python kodunu çalıştırabilirsiniz: ```python from transformers import PreTrainedTokenizerFast # Tokenizer'ı Hugging Face üzerinden yükleme tokenizer = PreTrainedTokenizerFast.from_pretrained("Egertekin/custom-bpe-tokenizer") # Örnek kullanım ornek_metin = "Wolverine'in iskeleti Adamantium ile kaplıdır." tokenlar = tokenizer.tokenize(ornek_metin) print(tokenlar)