# LLM - LARGE LANGUAGE MODEL BAHASA INDONESIA **INTISARI** adalah proyek riset dan pengembangan model bahasa Indonesia yang dibangun **from scratch**, dengan fokus pada model kecil yang tetap mampu menghasilkan bahasa yang natural dan koheren. Pendekatan INTISARI bukan mengejar dataset sebesar mungkin, tetapi **tiny, high-quality dataset** yang dirancang dan dikurasi secara ketat. Data yang lebih terkontrol membantu menjaga konsistensi pola bahasa, konteks, dan perilaku model, sehingga kualitas dapat ditingkatkan tanpa harus terus memperbesar ukuran dataset. ## Preview **[https://intisari.flatseek.io](https://intisari.flatseek.io)** ### Model - **Base** — mempelajari fondasi dan pola bahasa Indonesia dari awal. - **Instruct** — mengembangkan Base agar mampu memahami dan mengikuti instruksi. - **Chat** — mengoptimalkan kemampuan percakapan yang natural, koheren, dan kontekstual. ### Pengembangan INTISARI mengeksplorasi: - **Tiny high-quality datasets** — memprioritaskan kualitas dan konsistensi data dibanding jumlah. - **Synthetic data** — menghasilkan data terkontrol untuk target kemampuan tertentu. - **Data curation** — menjaga kualitas, variasi, dan koherensi dataset. - **Pretraining** — membangun kemampuan bahasa dari nol. - **Instruction & conversational tuning** — mengembangkan Base menjadi Instruct dan Chat. - **Iterative evaluation** — menguji dataset dan strategi training secara berulang. - **Efficient inference** — mempertahankan model agar tetap praktis dijalankan dengan sumber daya terbatas. > **Small data. Small models. High quality.** > > **Indonesian language intelligence, built from scratch.**