FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents Paper • 2608.18423 • Published 3 days ago • 15
Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness Paper • 2608.09900 • Published 12 days ago • 13
Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory Paper • 2608.07169 • Published 15 days ago • 50
PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning Paper • 2608.01837 • Published 19 days ago • 38
AISPA: User-Centric System Prompt Auditing for Large Language Model Applications Paper • 2607.28617 • Published 23 days ago • 37