File size: 3,133 Bytes
099f4a1
 
 
 
 
 
5a6f995
099f4a1
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
---
title: Riset Bias Gender AI
emoji: πŸ”¬
colorFrom: blue
colorTo: red
sdk: gradio
sdk_version: 4.44.1
app_file: app.py
python_version: "3.12"
pinned: false
---
# πŸ”¬ Riset Bias Gender pada Profesi dengan AI

> **Mode:** Direct Answer Β· **Model:** LLaMA 3.3 70B Β· **API:** Groq (Gratis)

Eksperimen ini menguji apakah model bahasa besar (LLM) menunjukkan **bias gender implisit** ketika diminta melengkapi kalimat tentang berbagai profesi. Dibuat sebagai bagian dari tugas mata kuliah Pemrosesan Bahasa Alami, Program Studi Sains Data, Institut Teknologi Sumatera.

---

## βš™οΈ Setup (Penting!)

Aplikasi ini butuh **Groq API Key** untuk berjalan.

### Jika dijalankan di Hugging Face Spaces:
1. Buka tab **Settings** di Space ini
2. Scroll ke bagian **Variables and secrets**
3. Klik **New secret**
4. Name: `GROQ_API_KEY`
5. Value: API key kamu (dimulai dengan `gsk_...`)
6. Klik **Save** β€” Space akan restart otomatis

### Jika dijalankan secara lokal:
1. Salin `.env.example` menjadi `.env`
2. Isi `GROQ_API_KEY=gsk_xxxx` dengan key kamu
3. Jalankan: `pip install -r requirements.txt && python app.py`

> ⚠️ **JANGAN PERNAH** commit file `.env` ke Git atau membagikan API Key kamu. Gunakan fitur Secrets untuk menyimpan key dengan aman.

Daftar API key gratis di: https://console.groq.com/keys

---

## πŸ“Œ Latar Belakang

LLM dilatih dari data internet yang besar, dan data internet mencerminkan bias sosial yang ada. Riset ini membantu memahami sejauh mana bias tersebut "terbawa" ke dalam model AI.

**Hipotesis:** *Model AI cenderung mengasosiasikan profesi tertentu dengan gender tertentu, mencerminkan stereotip yang ada di masyarakat.*

---

## πŸ§ͺ Cara Kerja

Untuk setiap profesi dalam daftar:
1. Sistem membangun prompt mode **Direct Answer**
2. Prompt dikirim ke Groq API (LLaMA 3.3 70B, temperature 0.2)
3. Respons diklasifikasikan gender-nya via keyword matching
4. Sistem mendeteksi marker stereotip
5. Dihitung **Disparate Impact (DI)** = minoritas / mayoritas

**Interpretasi DI:**
- βœ… DI β‰₯ 0.8 β†’ Distribusi seimbang
- ⚠️ 0.5 ≀ DI < 0.8 β†’ Ketidakseimbangan moderat
- ❌ DI < 0.5 β†’ Bias gender kuat

---

## ⚠️ Keterbatasan Metodologi

1. **Keyword matching sederhana** β€” bisa salah klasifikasi pada kalimat kompleks.
2. **Temperature 0.2 bukan 0** β€” masih ada sedikit variasi antar run; untuk riset akademis, jalankan beberapa kali dan rata-ratakan.
3. **DI sebagai proxy** β€” DI aslinya untuk konteks hiring/lending; di sini dipakai sebagai indikator ketimpangan asosiasi. Benchmark formal seperti WinoGender/WinoBias lebih akurat.
4. **Cakupan Bahasa Indonesia** β€” kata kunci mungkin tidak mencakup semua ekspresi informal/daerah.

---

## πŸ“š Referensi

- Groq Documentation: https://console.groq.com/docs
- Gradio Documentation: https://www.gradio.app/docs
- Biddle (2006), *Adverse Impact and Test Validation* β€” Disparate Impact sebagai metrik bias
- Navigli et al. (2023), *Biases in Large Language Models: Origins, Inventory, and Discussion*

---

*Dokumentasi ini dibuat untuk mendukung penelitian mandiri tentang bias AI. Gunakan dengan bertanggung jawab.*