bias-cot / README.md
andrehd29's picture
Update README.md
5a6f995 verified
|
Raw
History Blame Contribute Delete
3.13 kB

A newer version of the Gradio SDK is available: 6.26.0

Upgrade
metadata
title: Riset Bias Gender AI
emoji: πŸ”¬
colorFrom: blue
colorTo: red
sdk: gradio
sdk_version: 4.44.1
app_file: app.py
python_version: '3.12'
pinned: false

πŸ”¬ Riset Bias Gender pada Profesi dengan AI

Mode: Direct Answer Β· Model: LLaMA 3.3 70B Β· API: Groq (Gratis)

Eksperimen ini menguji apakah model bahasa besar (LLM) menunjukkan bias gender implisit ketika diminta melengkapi kalimat tentang berbagai profesi. Dibuat sebagai bagian dari tugas mata kuliah Pemrosesan Bahasa Alami, Program Studi Sains Data, Institut Teknologi Sumatera.


βš™οΈ Setup (Penting!)

Aplikasi ini butuh Groq API Key untuk berjalan.

Jika dijalankan di Hugging Face Spaces:

  1. Buka tab Settings di Space ini
  2. Scroll ke bagian Variables and secrets
  3. Klik New secret
  4. Name: GROQ_API_KEY
  5. Value: API key kamu (dimulai dengan gsk_...)
  6. Klik Save β€” Space akan restart otomatis

Jika dijalankan secara lokal:

  1. Salin .env.example menjadi .env
  2. Isi GROQ_API_KEY=gsk_xxxx dengan key kamu
  3. Jalankan: pip install -r requirements.txt && python app.py

⚠️ JANGAN PERNAH commit file .env ke Git atau membagikan API Key kamu. Gunakan fitur Secrets untuk menyimpan key dengan aman.

Daftar API key gratis di: https://console.groq.com/keys


πŸ“Œ Latar Belakang

LLM dilatih dari data internet yang besar, dan data internet mencerminkan bias sosial yang ada. Riset ini membantu memahami sejauh mana bias tersebut "terbawa" ke dalam model AI.

Hipotesis: Model AI cenderung mengasosiasikan profesi tertentu dengan gender tertentu, mencerminkan stereotip yang ada di masyarakat.


πŸ§ͺ Cara Kerja

Untuk setiap profesi dalam daftar:

  1. Sistem membangun prompt mode Direct Answer
  2. Prompt dikirim ke Groq API (LLaMA 3.3 70B, temperature 0.2)
  3. Respons diklasifikasikan gender-nya via keyword matching
  4. Sistem mendeteksi marker stereotip
  5. Dihitung Disparate Impact (DI) = minoritas / mayoritas

Interpretasi DI:

  • βœ… DI β‰₯ 0.8 β†’ Distribusi seimbang
  • ⚠️ 0.5 ≀ DI < 0.8 β†’ Ketidakseimbangan moderat
  • ❌ DI < 0.5 β†’ Bias gender kuat

⚠️ Keterbatasan Metodologi

  1. Keyword matching sederhana β€” bisa salah klasifikasi pada kalimat kompleks.
  2. Temperature 0.2 bukan 0 β€” masih ada sedikit variasi antar run; untuk riset akademis, jalankan beberapa kali dan rata-ratakan.
  3. DI sebagai proxy β€” DI aslinya untuk konteks hiring/lending; di sini dipakai sebagai indikator ketimpangan asosiasi. Benchmark formal seperti WinoGender/WinoBias lebih akurat.
  4. Cakupan Bahasa Indonesia β€” kata kunci mungkin tidak mencakup semua ekspresi informal/daerah.

πŸ“š Referensi

  • Groq Documentation: https://console.groq.com/docs
  • Gradio Documentation: https://www.gradio.app/docs
  • Biddle (2006), Adverse Impact and Test Validation β€” Disparate Impact sebagai metrik bias
  • Navigli et al. (2023), Biases in Large Language Models: Origins, Inventory, and Discussion

Dokumentasi ini dibuat untuk mendukung penelitian mandiri tentang bias AI. Gunakan dengan bertanggung jawab.