Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures Paper • 2609.29429 • Published 2 days ago • 2
HarmProfile: Characterizing Harmful Distributions in Frontier LLMs Paper • 2608.14577 • Published Jun 11 • 20
Agent Skills in the Wild: An Empirical Study of Security Vulnerabilities at Scale Paper • 2601.10338 • Published Jan 15 • 9