Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO Paper • 2606.09701 • Published Jun 8 • 1 • 1
GPT-Red: Automated Red Teaming via Self-Play at Scale Paper • 2607.26115 • Published 11 days ago • 8 • 3