clawdia-chan/prompt-guard-v2
Viewer • Updated • 536 • 8
Fine-tuned DeBERTa-v3-base for prompt injection and jailbreak detection.
| Category | Count |
|---|---|
| prompt_injection | 80+ |
| jailbreak | 70+ |
| flip_attack | 30+ |
| encoding_attack | 50+ |
| indirect_injection | 40+ |
| role_override | 30+ |
| privilege_escalation | 20+ |
| agent_chaining | 20+ |
| memory_poisoning | 15+ |
| vector_poisoning | 15+ |
| xss_attempt | 15+ |
| sql_injection | 10+ |
| benign | 119 |
from transformers import AutoModelForSequenceClassification, AutoTokenizer
model_name = "clawdia-chan/balanced-deberta"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForSequenceClassification.from_pretrained(model_name)