AgentShield-Bench
Collection
Agent security benchmark for tool-calling and MCP environments — dataset, classifiers, secure agent pipeline, and interactive evaluation. • 7 items • Updated
Guardrailed ToolCallingAgent pipeline combining four security classifiers as pre-execution guardrails.
User Input + Untrusted Content
|
v
+---------------------------+
| Content Trust Classifier | --> untrusted? sanitize / block
+---------------------------+
|
v
+---------------------------+
| Prompt Injection Classifier| --> injection? reject / escalate
+---------------------------+
|
v
+---------------------------+
| Policy Decision Model | --> allow / deny / escalate
+---------------------------+
|
v
+---------------------------+
| Tool Risk Classifier | --> per tool-call risk scoring
+---------------------------+
|
v
Safe Task Execution
| Component | Model |
|---|---|
| Prompt Injection | alirezaaminzadeh/agentshield-prompt-injection-classifier |
| Tool Risk | alirezaaminzadeh/agentshield-tool-risk-classifier |
| Content Trust | alirezaaminzadeh/agentshield-content-trust-classifier |
| Policy Decision | alirezaaminzadeh/agentshield-policy-decision-model |
Interactive evaluation: AgentShield-Bench Space
Apache 2.0