| # LLM - LARGE LANGUAGE MODEL BAHASA INDONESIA |
|
|
| **INTISARI** adalah proyek riset dan pengembangan model bahasa Indonesia yang dibangun **from scratch**, dengan fokus pada model kecil yang tetap mampu menghasilkan bahasa yang natural dan koheren. |
|
|
| Pendekatan INTISARI bukan mengejar dataset sebesar mungkin, tetapi **tiny, high-quality dataset** yang dirancang dan dikurasi secara ketat. Data yang lebih terkontrol membantu menjaga konsistensi pola bahasa, konteks, dan perilaku model, sehingga kualitas dapat ditingkatkan tanpa harus terus memperbesar ukuran dataset. |
|
|
| ## Preview |
| **[https://intisari.flatseek.io](https://intisari.flatseek.io)** |
|
|
|
|
| ### Model |
|
|
| - **Base** β mempelajari fondasi dan pola bahasa Indonesia dari awal. |
| - **Instruct** β mengembangkan Base agar mampu memahami dan mengikuti instruksi. |
| - **Chat** β mengoptimalkan kemampuan percakapan yang natural, koheren, dan kontekstual. |
|
|
| ### Pengembangan |
|
|
| INTISARI mengeksplorasi: |
|
|
| - **Tiny high-quality datasets** β memprioritaskan kualitas dan konsistensi data dibanding jumlah. |
| - **Synthetic data** β menghasilkan data terkontrol untuk target kemampuan tertentu. |
| - **Data curation** β menjaga kualitas, variasi, dan koherensi dataset. |
| - **Pretraining** β membangun kemampuan bahasa dari nol. |
| - **Instruction & conversational tuning** β mengembangkan Base menjadi Instruct dan Chat. |
| - **Iterative evaluation** β menguji dataset dan strategi training secara berulang. |
| - **Efficient inference** β mempertahankan model agar tetap praktis dijalankan dengan sumber daya terbatas. |
|
|
| > **Small data. Small models. High quality.** |
| > |
| > **Indonesian language intelligence, built from scratch.** |