File size: 2,645 Bytes
a47a32d
 
9b71db6
 
 
 
 
 
a47a32d
 
9b71db6
a47a32d
9b71db6
 
a47a32d
9b71db6
a47a32d
9b71db6
a47a32d
9b71db6
 
a47a32d
9b71db6
 
 
 
 
a47a32d
9b71db6
a47a32d
9b71db6
 
a47a32d
9b71db6
a47a32d
9b71db6
 
a47a32d
9b71db6
 
a47a32d
9b71db6
 
a47a32d
9b71db6
 
a47a32d
9b71db6
 
a47a32d
9b71db6
 
a47a32d
9b71db6
 
 
a47a32d
9b71db6
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
---
library_name: transformers
tags:
- bpe
- tokenizer
- marvel
- turkish
- custom-tokenizer
---

# Custom BPE Tokenizer

## Model Özeti
Bu model, büyük dil modellerinin Türkçe metinleri ve özellikle Marvel evreni terminolojisini daha verimli okuyabilmesi için eğitilmiş özel bir **BPE (Byte-Pair Encoding)** Tokenizer modelidir. 

Gazi Üniversitesi Teknoloji Fakültesi Bilgisayar Mühendisliği bölümü projeleri kapsamında, sıfırdan yapılandırılmış ve spesifik bir alan üzerinde eğitilmiştir.

## Model Detayları

### Model Açıklaması
Standart tokenizer'lar genel verilerle eğitildiği için özel isimlerde (Örn: "Adamantium", "Wakanda", "Latveria") parçalama hataları yapabilir. Bu BPE Tokenizer, doğrudan Marvel evrenine ait Türkçe metinler üzerinden eğitilerek bu spesifik terminolojiyi tek parça veya en mantıklı alt-kelime öbekleri halinde tanımak üzere optimize edilmiştir.

- **Geliştirici:** Ege Ertekin
- **Model Türü:** Byte-Pair Encoding Tokenizer
- **Dil:** Türkçe
- **Kütüphane:** `tokenizers`, `transformers`
- **Sözlük Boyutu:** 10.000

## Kullanım Amacı

### Doğrudan Kullanım
Bu tokenizer, `Egertekin/marvel-domain-dataset` veya benzeri Türkçe çizgi roman/fantastik evren veri setleri kullanılarak Unsloth veya Hugging Face Transformers üzerinden fine-tune edilece temel dil modellerinde metin işleme aracı olarak kullanılmalıdır.

## Eğitim Detayları

### Eğitim Verisi
Tokenizer, tamamen Hugging Face Hub üzerinde bulunan [Egertekin/marvel-domain-dataset](https://huggingface.co/datasets/Egertekin/marvel-domain-dataset) veri seti kullanılarak eğitilmiştir. Bu veri setindeki Wikipedia tabanlı organik metinler ve manuel olarak girilip çoğaltılan soru-cevap çiftleri, eğitim derlemi olarak kullanılmıştır.

### Eğitim Prosedürü
Model, Hugging Face `tokenizers` kütüphanesindeki `BpeTrainer` kullanılarak eğitilmiştir. Eğitim sırasında modele bilinmeyen kelimeler için `[UNK]` ve doldurma işlemleri için `[PAD]` gibi özel token'lar tanımlanmıştır.

- **Özel Tokenler:** `[PAD]`, `[UNK]`, `[CLS]`, `[SEP]`, `[MASK]`
- **Ön-İşleme:** `ByteLevel(add_prefix_space=False)`

## Başlangıç
Tokenizer'ı projenizde kullanmak için aşağıdaki Python kodunu çalıştırabilirsiniz:

```python
from transformers import PreTrainedTokenizerFast

# Tokenizer'ı Hugging Face üzerinden yükleme
tokenizer = PreTrainedTokenizerFast.from_pretrained("Egertekin/custom-bpe-tokenizer")

# Örnek kullanım
ornek_metin = "Wolverine'in iskeleti Adamantium ile kaplıdır."
tokenlar = tokenizer.tokenize(ornek_metin)

print(tokenlar)