Large Language Models Generate Harmful Responses Using a Distinct Mechanism, Shared Across Harm Types Paper • 2604.09544 • Published Aug 24 • 7
Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming Paper • 2606.31227 • Published Jun 30 • 12
Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training Paper • 2608.26730 • Published about 1 month ago • 154