PsychoSafe: Eliciting Psychologically-Informed Refusals in Large Language Models Paper • 2606.09697 • Published Jun 8 • 7
Emergent Languages in Populations of Language Model Agents: From Token Efficiency to Oversight Evasion Paper • 2605.31170 • Published May 29 • 8
SommBench: Assessing Sommelier Expertise of Language Models Paper • 2603.12117 • Published Mar 12 • 1
Mirmir Collection Contains the DFM-Mimir datasets from v1 and onwards. • 3 items • Updated 28 days ago
DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data Paper • 2608.13517 • Published Aug 13 • 33
DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data Paper • 2608.13517 • Published Aug 13 • 33
The Arbiter Agent: Continually Monitoring Multi-Agent Conversations to Detect Emergent Misalignment Paper • 2606.10747 • Published Jun 9 • 13