PEGE - Türkçe LLM

Kendi Türkçe büyük dil modelini eğit ve RLHF ile geliştir.

Kurulum

pip install -r requirements.txt

Kullanım

1. Veri Hazırla

Makalelerini data/ klasörüne TXT olarak at.

2. Modeli Eğit

cd src
python train.py

3. Konuş ve Öğret

python chat.py

Chat Komutları:

  • /good - Cevabı beğendin, model öğrenir
  • /bad - Cevabı beğenmedin, model yeniden dener
  • /retry - Farklı bir cevap iste
  • /clear - Konuşma geçmişini temizle
  • /quit - Çıkış

Proje Yapısı

pege/
├── data/           # Eğitim verisi (TXT dosyaları)
├── src/
│   ├── config.py   # Model ayarları
│   ├── model.py    # Transformer mimarisi
│   ├── tokenizer.py # Türkçe tokenizer
│   ├── dataset.py  # Veri işleme
│   ├── train.py    # Eğitim kodu
│   └── chat.py     # Konuşma arayüzü
├── models/         # Kaydedilmiş modeller
├── checkpoints/    # Eğitim checkpoint'leri
└── feedback.jsonl  # RLHF geri bildirimlerin

Model Mimarisi

  • 512 embedding boyutu
  • 8 attention head
  • 6 transformer katmanı
  • 2048 FFN boyutu
  • 50.000 vocabulary boyutu

GPU İstemiyorsan

CPU'da da çalışır ama yavaş olur. Küçük veri ile başla (100MB).

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Space using alpege01/PEGEAI 1