Egertekin's picture
Update README.md
9b71db6 verified
|
Raw
History Blame Contribute Delete
2.65 kB
---
library_name: transformers
tags:
- bpe
- tokenizer
- marvel
- turkish
- custom-tokenizer
---
# Custom BPE Tokenizer
## Model Özeti
Bu model, büyük dil modellerinin Türkçe metinleri ve özellikle Marvel evreni terminolojisini daha verimli okuyabilmesi için eğitilmiş özel bir **BPE (Byte-Pair Encoding)** Tokenizer modelidir.
Gazi Üniversitesi Teknoloji Fakültesi Bilgisayar Mühendisliği bölümü projeleri kapsamında, sıfırdan yapılandırılmış ve spesifik bir alan üzerinde eğitilmiştir.
## Model Detayları
### Model Açıklaması
Standart tokenizer'lar genel verilerle eğitildiği için özel isimlerde (Örn: "Adamantium", "Wakanda", "Latveria") parçalama hataları yapabilir. Bu BPE Tokenizer, doğrudan Marvel evrenine ait Türkçe metinler üzerinden eğitilerek bu spesifik terminolojiyi tek parça veya en mantıklı alt-kelime öbekleri halinde tanımak üzere optimize edilmiştir.
- **Geliştirici:** Ege Ertekin
- **Model Türü:** Byte-Pair Encoding Tokenizer
- **Dil:** Türkçe
- **Kütüphane:** `tokenizers`, `transformers`
- **Sözlük Boyutu:** 10.000
## Kullanım Amacı
### Doğrudan Kullanım
Bu tokenizer, `Egertekin/marvel-domain-dataset` veya benzeri Türkçe çizgi roman/fantastik evren veri setleri kullanılarak Unsloth veya Hugging Face Transformers üzerinden fine-tune edilece temel dil modellerinde metin işleme aracı olarak kullanılmalıdır.
## Eğitim Detayları
### Eğitim Verisi
Tokenizer, tamamen Hugging Face Hub üzerinde bulunan [Egertekin/marvel-domain-dataset](https://huggingface.co/datasets/Egertekin/marvel-domain-dataset) veri seti kullanılarak eğitilmiştir. Bu veri setindeki Wikipedia tabanlı organik metinler ve manuel olarak girilip çoğaltılan soru-cevap çiftleri, eğitim derlemi olarak kullanılmıştır.
### Eğitim Prosedürü
Model, Hugging Face `tokenizers` kütüphanesindeki `BpeTrainer` kullanılarak eğitilmiştir. Eğitim sırasında modele bilinmeyen kelimeler için `[UNK]` ve doldurma işlemleri için `[PAD]` gibi özel token'lar tanımlanmıştır.
- **Özel Tokenler:** `[PAD]`, `[UNK]`, `[CLS]`, `[SEP]`, `[MASK]`
- **Ön-İşleme:** `ByteLevel(add_prefix_space=False)`
## Başlangıç
Tokenizer'ı projenizde kullanmak için aşağıdaki Python kodunu çalıştırabilirsiniz:
```python
from transformers import PreTrainedTokenizerFast
# Tokenizer'ı Hugging Face üzerinden yükleme
tokenizer = PreTrainedTokenizerFast.from_pretrained("Egertekin/custom-bpe-tokenizer")
# Örnek kullanım
ornek_metin = "Wolverine'in iskeleti Adamantium ile kaplıdır."
tokenlar = tokenizer.tokenize(ornek_metin)
print(tokenlar)