RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests Paper • 2608.27831 • Published 5 days ago • 23
Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training Paper • 2608.26730 • Published 9 days ago • 149
LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes Paper • 2609.03796 • Published 2 days ago • 203
SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation Paper • 2608.18565 • Published 17 days ago • 116
LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers Paper • 2608.06867 • Published 29 days ago • 111
UniMoMo: Expert Merging-Based MoE Acceleration for Large Recommendation Models Paper • 2608.08627 • Published 27 days ago • 14
Evidence-RL: Towards Evidence-intensive Visual Reasoning Paper • 2608.08021 • Published 28 days ago • 16
SkillJack: Persistent Skill Backdoors in Self-Evolving Agents Paper • 2608.03509 • Published Aug 4 • 24