File size: 3,133 Bytes
099f4a1 5a6f995 099f4a1 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 | ---
title: Riset Bias Gender AI
emoji: π¬
colorFrom: blue
colorTo: red
sdk: gradio
sdk_version: 4.44.1
app_file: app.py
python_version: "3.12"
pinned: false
---
# π¬ Riset Bias Gender pada Profesi dengan AI
> **Mode:** Direct Answer Β· **Model:** LLaMA 3.3 70B Β· **API:** Groq (Gratis)
Eksperimen ini menguji apakah model bahasa besar (LLM) menunjukkan **bias gender implisit** ketika diminta melengkapi kalimat tentang berbagai profesi. Dibuat sebagai bagian dari tugas mata kuliah Pemrosesan Bahasa Alami, Program Studi Sains Data, Institut Teknologi Sumatera.
---
## βοΈ Setup (Penting!)
Aplikasi ini butuh **Groq API Key** untuk berjalan.
### Jika dijalankan di Hugging Face Spaces:
1. Buka tab **Settings** di Space ini
2. Scroll ke bagian **Variables and secrets**
3. Klik **New secret**
4. Name: `GROQ_API_KEY`
5. Value: API key kamu (dimulai dengan `gsk_...`)
6. Klik **Save** β Space akan restart otomatis
### Jika dijalankan secara lokal:
1. Salin `.env.example` menjadi `.env`
2. Isi `GROQ_API_KEY=gsk_xxxx` dengan key kamu
3. Jalankan: `pip install -r requirements.txt && python app.py`
> β οΈ **JANGAN PERNAH** commit file `.env` ke Git atau membagikan API Key kamu. Gunakan fitur Secrets untuk menyimpan key dengan aman.
Daftar API key gratis di: https://console.groq.com/keys
---
## π Latar Belakang
LLM dilatih dari data internet yang besar, dan data internet mencerminkan bias sosial yang ada. Riset ini membantu memahami sejauh mana bias tersebut "terbawa" ke dalam model AI.
**Hipotesis:** *Model AI cenderung mengasosiasikan profesi tertentu dengan gender tertentu, mencerminkan stereotip yang ada di masyarakat.*
---
## π§ͺ Cara Kerja
Untuk setiap profesi dalam daftar:
1. Sistem membangun prompt mode **Direct Answer**
2. Prompt dikirim ke Groq API (LLaMA 3.3 70B, temperature 0.2)
3. Respons diklasifikasikan gender-nya via keyword matching
4. Sistem mendeteksi marker stereotip
5. Dihitung **Disparate Impact (DI)** = minoritas / mayoritas
**Interpretasi DI:**
- β
DI β₯ 0.8 β Distribusi seimbang
- β οΈ 0.5 β€ DI < 0.8 β Ketidakseimbangan moderat
- β DI < 0.5 β Bias gender kuat
---
## β οΈ Keterbatasan Metodologi
1. **Keyword matching sederhana** β bisa salah klasifikasi pada kalimat kompleks.
2. **Temperature 0.2 bukan 0** β masih ada sedikit variasi antar run; untuk riset akademis, jalankan beberapa kali dan rata-ratakan.
3. **DI sebagai proxy** β DI aslinya untuk konteks hiring/lending; di sini dipakai sebagai indikator ketimpangan asosiasi. Benchmark formal seperti WinoGender/WinoBias lebih akurat.
4. **Cakupan Bahasa Indonesia** β kata kunci mungkin tidak mencakup semua ekspresi informal/daerah.
---
## π Referensi
- Groq Documentation: https://console.groq.com/docs
- Gradio Documentation: https://www.gradio.app/docs
- Biddle (2006), *Adverse Impact and Test Validation* β Disparate Impact sebagai metrik bias
- Navigli et al. (2023), *Biases in Large Language Models: Origins, Inventory, and Discussion*
---
*Dokumentasi ini dibuat untuk mendukung penelitian mandiri tentang bias AI. Gunakan dengan bertanggung jawab.*
|