Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification Paper • 2607.01793 • Published 26 days ago • 7
BraveGuard: From Open-World Threats to Safer Computer-Use Agents Paper • 2606.01166 • Published Jun 2 • 5
BraveGuard: From Open-World Threats to Safer Computer-Use Agents Paper • 2606.01166 • Published Jun 2 • 5
AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents Paper • 2604.02947 • Published Apr 3 • 19
AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents Paper • 2604.02947 • Published Apr 3 • 19