File size: 1,665 Bytes
7c1103f
7b8e334
 
 
 
 
5db3f3e
 
 
 
7b8e334
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
# LLM - LARGE LANGUAGE MODEL BAHASA INDONESIA

**INTISARI** adalah proyek riset dan pengembangan model bahasa Indonesia yang dibangun **from scratch**, dengan fokus pada model kecil yang tetap mampu menghasilkan bahasa yang natural dan koheren.

Pendekatan INTISARI bukan mengejar dataset sebesar mungkin, tetapi **tiny, high-quality dataset** yang dirancang dan dikurasi secara ketat. Data yang lebih terkontrol membantu menjaga konsistensi pola bahasa, konteks, dan perilaku model, sehingga kualitas dapat ditingkatkan tanpa harus terus memperbesar ukuran dataset.

## Preview
**[https://intisari.flatseek.io](https://intisari.flatseek.io)**


### Model

- **Base** β€” mempelajari fondasi dan pola bahasa Indonesia dari awal.
- **Instruct** β€” mengembangkan Base agar mampu memahami dan mengikuti instruksi.
- **Chat** β€” mengoptimalkan kemampuan percakapan yang natural, koheren, dan kontekstual.

### Pengembangan

INTISARI mengeksplorasi:

- **Tiny high-quality datasets** β€” memprioritaskan kualitas dan konsistensi data dibanding jumlah.
- **Synthetic data** β€” menghasilkan data terkontrol untuk target kemampuan tertentu.
- **Data curation** β€” menjaga kualitas, variasi, dan koherensi dataset.
- **Pretraining** β€” membangun kemampuan bahasa dari nol.
- **Instruction & conversational tuning** β€” mengembangkan Base menjadi Instruct dan Chat.
- **Iterative evaluation** β€” menguji dataset dan strategi training secara berulang.
- **Efficient inference** β€” mempertahankan model agar tetap praktis dijalankan dengan sumber daya terbatas.

> **Small data. Small models. High quality.**
>
> **Indonesian language intelligence, built from scratch.**