--- title: Riset Bias Gender AI emoji: ๐Ÿ”ฌ colorFrom: blue colorTo: red sdk: gradio sdk_version: 4.44.1 app_file: app.py python_version: "3.12" pinned: false --- # ๐Ÿ”ฌ Riset Bias Gender pada Profesi dengan AI > **Mode:** Direct Answer ยท **Model:** LLaMA 3.3 70B ยท **API:** Groq (Gratis) Eksperimen ini menguji apakah model bahasa besar (LLM) menunjukkan **bias gender implisit** ketika diminta melengkapi kalimat tentang berbagai profesi. Dibuat sebagai bagian dari tugas mata kuliah Pemrosesan Bahasa Alami, Program Studi Sains Data, Institut Teknologi Sumatera. --- ## โš™๏ธ Setup (Penting!) Aplikasi ini butuh **Groq API Key** untuk berjalan. ### Jika dijalankan di Hugging Face Spaces: 1. Buka tab **Settings** di Space ini 2. Scroll ke bagian **Variables and secrets** 3. Klik **New secret** 4. Name: `GROQ_API_KEY` 5. Value: API key kamu (dimulai dengan `gsk_...`) 6. Klik **Save** โ€” Space akan restart otomatis ### Jika dijalankan secara lokal: 1. Salin `.env.example` menjadi `.env` 2. Isi `GROQ_API_KEY=gsk_xxxx` dengan key kamu 3. Jalankan: `pip install -r requirements.txt && python app.py` > โš ๏ธ **JANGAN PERNAH** commit file `.env` ke Git atau membagikan API Key kamu. Gunakan fitur Secrets untuk menyimpan key dengan aman. Daftar API key gratis di: https://console.groq.com/keys --- ## ๐Ÿ“Œ Latar Belakang LLM dilatih dari data internet yang besar, dan data internet mencerminkan bias sosial yang ada. Riset ini membantu memahami sejauh mana bias tersebut "terbawa" ke dalam model AI. **Hipotesis:** *Model AI cenderung mengasosiasikan profesi tertentu dengan gender tertentu, mencerminkan stereotip yang ada di masyarakat.* --- ## ๐Ÿงช Cara Kerja Untuk setiap profesi dalam daftar: 1. Sistem membangun prompt mode **Direct Answer** 2. Prompt dikirim ke Groq API (LLaMA 3.3 70B, temperature 0.2) 3. Respons diklasifikasikan gender-nya via keyword matching 4. Sistem mendeteksi marker stereotip 5. Dihitung **Disparate Impact (DI)** = minoritas / mayoritas **Interpretasi DI:** - โœ… DI โ‰ฅ 0.8 โ†’ Distribusi seimbang - โš ๏ธ 0.5 โ‰ค DI < 0.8 โ†’ Ketidakseimbangan moderat - โŒ DI < 0.5 โ†’ Bias gender kuat --- ## โš ๏ธ Keterbatasan Metodologi 1. **Keyword matching sederhana** โ€” bisa salah klasifikasi pada kalimat kompleks. 2. **Temperature 0.2 bukan 0** โ€” masih ada sedikit variasi antar run; untuk riset akademis, jalankan beberapa kali dan rata-ratakan. 3. **DI sebagai proxy** โ€” DI aslinya untuk konteks hiring/lending; di sini dipakai sebagai indikator ketimpangan asosiasi. Benchmark formal seperti WinoGender/WinoBias lebih akurat. 4. **Cakupan Bahasa Indonesia** โ€” kata kunci mungkin tidak mencakup semua ekspresi informal/daerah. --- ## ๐Ÿ“š Referensi - Groq Documentation: https://console.groq.com/docs - Gradio Documentation: https://www.gradio.app/docs - Biddle (2006), *Adverse Impact and Test Validation* โ€” Disparate Impact sebagai metrik bias - Navigli et al. (2023), *Biases in Large Language Models: Origins, Inventory, and Discussion* --- *Dokumentasi ini dibuat untuk mendukung penelitian mandiri tentang bias AI. Gunakan dengan bertanggung jawab.*