Instructions to use Egertekin/custom-bpe-tokenizer with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Egertekin/custom-bpe-tokenizer with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Egertekin/custom-bpe-tokenizer", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| library_name: transformers | |
| tags: | |
| - bpe | |
| - tokenizer | |
| - marvel | |
| - turkish | |
| - custom-tokenizer | |
| # Custom BPE Tokenizer | |
| ## Model Özeti | |
| Bu model, büyük dil modellerinin Türkçe metinleri ve özellikle Marvel evreni terminolojisini daha verimli okuyabilmesi için eğitilmiş özel bir **BPE (Byte-Pair Encoding)** Tokenizer modelidir. | |
| Gazi Üniversitesi Teknoloji Fakültesi Bilgisayar Mühendisliği bölümü projeleri kapsamında, sıfırdan yapılandırılmış ve spesifik bir alan üzerinde eğitilmiştir. | |
| ## Model Detayları | |
| ### Model Açıklaması | |
| Standart tokenizer'lar genel verilerle eğitildiği için özel isimlerde (Örn: "Adamantium", "Wakanda", "Latveria") parçalama hataları yapabilir. Bu BPE Tokenizer, doğrudan Marvel evrenine ait Türkçe metinler üzerinden eğitilerek bu spesifik terminolojiyi tek parça veya en mantıklı alt-kelime öbekleri halinde tanımak üzere optimize edilmiştir. | |
| - **Geliştirici:** Ege Ertekin | |
| - **Model Türü:** Byte-Pair Encoding Tokenizer | |
| - **Dil:** Türkçe | |
| - **Kütüphane:** `tokenizers`, `transformers` | |
| - **Sözlük Boyutu:** 10.000 | |
| ## Kullanım Amacı | |
| ### Doğrudan Kullanım | |
| Bu tokenizer, `Egertekin/marvel-domain-dataset` veya benzeri Türkçe çizgi roman/fantastik evren veri setleri kullanılarak Unsloth veya Hugging Face Transformers üzerinden fine-tune edilece temel dil modellerinde metin işleme aracı olarak kullanılmalıdır. | |
| ## Eğitim Detayları | |
| ### Eğitim Verisi | |
| Tokenizer, tamamen Hugging Face Hub üzerinde bulunan [Egertekin/marvel-domain-dataset](https://huggingface.co/datasets/Egertekin/marvel-domain-dataset) veri seti kullanılarak eğitilmiştir. Bu veri setindeki Wikipedia tabanlı organik metinler ve manuel olarak girilip çoğaltılan soru-cevap çiftleri, eğitim derlemi olarak kullanılmıştır. | |
| ### Eğitim Prosedürü | |
| Model, Hugging Face `tokenizers` kütüphanesindeki `BpeTrainer` kullanılarak eğitilmiştir. Eğitim sırasında modele bilinmeyen kelimeler için `[UNK]` ve doldurma işlemleri için `[PAD]` gibi özel token'lar tanımlanmıştır. | |
| - **Özel Tokenler:** `[PAD]`, `[UNK]`, `[CLS]`, `[SEP]`, `[MASK]` | |
| - **Ön-İşleme:** `ByteLevel(add_prefix_space=False)` | |
| ## Başlangıç | |
| Tokenizer'ı projenizde kullanmak için aşağıdaki Python kodunu çalıştırabilirsiniz: | |
| ```python | |
| from transformers import PreTrainedTokenizerFast | |
| # Tokenizer'ı Hugging Face üzerinden yükleme | |
| tokenizer = PreTrainedTokenizerFast.from_pretrained("Egertekin/custom-bpe-tokenizer") | |
| # Örnek kullanım | |
| ornek_metin = "Wolverine'in iskeleti Adamantium ile kaplıdır." | |
| tokenlar = tokenizer.tokenize(ornek_metin) | |
| print(tokenlar) |