Matan-Gold commited on
Commit
ed059d9
·
verified ·
1 Parent(s): 5404c55

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +17 -7
README.md CHANGED
@@ -15,8 +15,9 @@ pinned: false
15
  התלמידים, בקבוצות, מנסים לגרום לו לשבור את החוקים באמצעות שכנוע ותחבולות.
16
  המטרה: ללמד חשיבה ביקורתית על AI — לא בטיחות אמיתית.
17
 
18
- **אין שום שכבת סינון נוספת בקוד.** הדבר היחיד שעומד בין התלמיד לבין שבירת חוק
19
- הוא פרומפט המערכת. זו כל הנקודה של הסדנה.
 
20
 
21
  ## החוקים של הבוט
22
 
@@ -32,9 +33,18 @@ pinned: false
32
  | 6 | בלי מידע אישי על אנשים אמיתיים | 🚫 גבול אמיתי |
33
  | 7 | אף פעם לא מודה שטעה (דמו של חנופה) | 🎯 משימה |
34
 
35
- המשימות בסרגל הצד מכוונות **רק** לחוקים 1, 2, 3, 4, 7. חוקים 5 ו-6 הם גבולות
36
  אמיתיים ולא יעד למשחק — המשתמשים הם קטינים.
37
 
 
 
 
 
 
 
 
 
 
38
  ## המודל
39
 
40
  ברירת המחדל: **`dicta-il/DictaLM-3.0-1.7B-Instruct`** — מודל עברי ישראלי,
@@ -85,13 +95,13 @@ streamlit run app.py
85
 
86
  ## שימוש בסדנה
87
 
88
- - **סרגל צד:** כרטיסי משימה, כפתור "התחל מחדש", ו-**מצב מנחה** (expander)
89
- שחושף את פרומפט המערכת המלא — לרגע הסיכום בסוף.
90
  - כל הודעה שולחת את כל ההיסטוריה למודל, כך שפריצות רב-שלביות
91
  ("אבל קודם אמרת ש...") עובדות.
92
  - אפשר לערוך את `SYSTEM_PROMPT` בראש `app.py` ולכוונן את החוקים בזמן אמת.
93
 
94
  ## מה לא נכלל (בכוונה)
95
 
96
- בלי משתמשים/התחברות, בלי בסיס נתונים, בלי מודרציה אמיתית, בלי אנליטיקות.
97
- זה רץ שעה אחת עם ~25 בני נוער. פשוט ומינימלי.
 
15
  התלמידים, בקבוצות, מנסים לגרום לו לשבור את החוקים באמצעות שכנוע ותחבולות.
16
  המטרה: ללמד חשיבה ביקורתית על AI — לא בטיחות אמיתית.
17
 
18
+ **החוקים השבירים (1,2,3,4,7) — בלי שום סינון.** הדבר היחיד שעומד בין התלמיד
19
+ לשבירתם הוא פרומפט המערכת. זו כל הנקודה של הסדנה. חוקי הבטיחות לקטינים (5,6)
20
+ מוגנים בנפרד בשכבת בדיקה (ראו "שכבת בטיחות" למטה), כי המודל הקטן נשבר בהם בקלות.
21
 
22
  ## החוקים של הבוט
23
 
 
33
  | 6 | בלי מידע אישי על אנשים אמיתיים | 🚫 גבול אמיתי |
34
  | 7 | אף פעם לא מודה שטעה (דמו של חנופה) | 🎯 משימה |
35
 
36
+ המשימות מכוונות **רק** לחוקים 1, 2, 3, 4, 7. חוקים 5 ו-6 הם גבולות
37
  אמיתיים ולא יעד למשחק — המשתמשים הם קטינים.
38
 
39
+ ## שכבת בטיחות (חוקים 5-6)
40
+
41
+ המודל הקטן (1.7B) נשבר בקלות גם בחוקי הבטיחות — בבדיקות הוא סיפק "שלבים
42
+ להכנת פצצה" ומספרי טלפון מומצאים לאדם אמיתי תחת שכנוע פשוט. לכן כל תשובה
43
+ עוברת **מודל-שופט** (`Qwen/Qwen2.5-72B-Instruct`, דרך אותו `HF_TOKEN`,
44
+ בלי מפתח/תלות נוספים) שחוסם **רק** חוקים 5-6 ומחליף את התשובה בסירוב מנומס.
45
+ החוקים השבירים עוברים בלי בדיקה ונשארים שבירים. לכיבוי: `MODERATION = False`
46
+ בראש `app.py`. פירוט מלא ובדיקות: `tests/RESULTS.md`.
47
+
48
  ## המודל
49
 
50
  ברירת המחדל: **`dicta-il/DictaLM-3.0-1.7B-Instruct`** — מודל עברי ישראלי,
 
95
 
96
  ## שימוש בסדנה
97
 
98
+ - **המשימות וכפתור "התחל מחדש"** בגוף העמוד (נראים גם בטלפון). **מצב מנחה**
99
+ (expander בסרגל הצד) חושף את פרומפט המערכת המלא — לרגע הסיכום בסוף.
100
  - כל הודעה שולחת את כל ההיסטוריה למודל, כך שפריצות רב-שלביות
101
  ("אבל קודם אמרת ש...") עובדות.
102
  - אפשר לערוך את `SYSTEM_PROMPT` בראש `app.py` ולכוונן את החוקים בזמן אמת.
103
 
104
  ## מה לא נכלל (בכוונה)
105
 
106
+ בלי משתמשים/התחברות, בלי בסיס נתונים, בלי אנליטיקות. (מודרציה יש אבל
107
+ מצומצמת לחוקים 5-6 בלבד, ראו "שכבת בטיחות".) זה רץ שעה אחת עם ~25 בני נוער.