README / README.md
judotens's picture
Update README.md
5db3f3e verified
|
Raw
History Blame Contribute Delete
1.67 kB
# LLM - LARGE LANGUAGE MODEL BAHASA INDONESIA
**INTISARI** adalah proyek riset dan pengembangan model bahasa Indonesia yang dibangun **from scratch**, dengan fokus pada model kecil yang tetap mampu menghasilkan bahasa yang natural dan koheren.
Pendekatan INTISARI bukan mengejar dataset sebesar mungkin, tetapi **tiny, high-quality dataset** yang dirancang dan dikurasi secara ketat. Data yang lebih terkontrol membantu menjaga konsistensi pola bahasa, konteks, dan perilaku model, sehingga kualitas dapat ditingkatkan tanpa harus terus memperbesar ukuran dataset.
## Preview
**[https://intisari.flatseek.io](https://intisari.flatseek.io)**
### Model
- **Base** β€” mempelajari fondasi dan pola bahasa Indonesia dari awal.
- **Instruct** β€” mengembangkan Base agar mampu memahami dan mengikuti instruksi.
- **Chat** β€” mengoptimalkan kemampuan percakapan yang natural, koheren, dan kontekstual.
### Pengembangan
INTISARI mengeksplorasi:
- **Tiny high-quality datasets** β€” memprioritaskan kualitas dan konsistensi data dibanding jumlah.
- **Synthetic data** β€” menghasilkan data terkontrol untuk target kemampuan tertentu.
- **Data curation** β€” menjaga kualitas, variasi, dan koherensi dataset.
- **Pretraining** β€” membangun kemampuan bahasa dari nol.
- **Instruction & conversational tuning** β€” mengembangkan Base menjadi Instruct dan Chat.
- **Iterative evaluation** β€” menguji dataset dan strategi training secara berulang.
- **Efficient inference** β€” mempertahankan model agar tetap praktis dijalankan dengan sumber daya terbatas.
> **Small data. Small models. High quality.**
>
> **Indonesian language intelligence, built from scratch.**