File size: 1,665 Bytes
7c1103f 7b8e334 5db3f3e 7b8e334 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 | # LLM - LARGE LANGUAGE MODEL BAHASA INDONESIA
**INTISARI** adalah proyek riset dan pengembangan model bahasa Indonesia yang dibangun **from scratch**, dengan fokus pada model kecil yang tetap mampu menghasilkan bahasa yang natural dan koheren.
Pendekatan INTISARI bukan mengejar dataset sebesar mungkin, tetapi **tiny, high-quality dataset** yang dirancang dan dikurasi secara ketat. Data yang lebih terkontrol membantu menjaga konsistensi pola bahasa, konteks, dan perilaku model, sehingga kualitas dapat ditingkatkan tanpa harus terus memperbesar ukuran dataset.
## Preview
**[https://intisari.flatseek.io](https://intisari.flatseek.io)**
### Model
- **Base** β mempelajari fondasi dan pola bahasa Indonesia dari awal.
- **Instruct** β mengembangkan Base agar mampu memahami dan mengikuti instruksi.
- **Chat** β mengoptimalkan kemampuan percakapan yang natural, koheren, dan kontekstual.
### Pengembangan
INTISARI mengeksplorasi:
- **Tiny high-quality datasets** β memprioritaskan kualitas dan konsistensi data dibanding jumlah.
- **Synthetic data** β menghasilkan data terkontrol untuk target kemampuan tertentu.
- **Data curation** β menjaga kualitas, variasi, dan koherensi dataset.
- **Pretraining** β membangun kemampuan bahasa dari nol.
- **Instruction & conversational tuning** β mengembangkan Base menjadi Instruct dan Chat.
- **Iterative evaluation** β menguji dataset dan strategi training secara berulang.
- **Efficient inference** β mempertahankan model agar tetap praktis dijalankan dengan sumber daya terbatas.
> **Small data. Small models. High quality.**
>
> **Indonesian language intelligence, built from scratch.** |