WEFT: Scaling Tool-Use Post-Training for General-Purpose Agents Paper • 2609.36887 • Published 8 days ago • 19
Equal Ranking Quality, Different Decisions: Measuring and Reducing Order Dependence in LLM Scorers Paper • 2608.26762 • Published 11 days ago • 19
Diptych: Scoped, AI-Interpreted Comparison for Reference Listening in Music Production Paper • 2609.39963 • Published 7 days ago • 20
Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers Paper • 2610.00531 • Published 7 days ago • 56
RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations Paper • 2610.01780 • Published 6 days ago • 271
Scaling Properties of Same-Family On-Policy Distillation Paper • 2609.32722 • Published 11 days ago • 324
Beyond Dyadic Memory: Interaction-Aware Multimodal Memory with Adaptive Agentic Retrieval for Multi-Party Spoken Conversations Paper • 2609.32522 • Published 11 days ago • 81
PanoVLN: Towards Effective Panoramic Vision-and-Language Navigation Paper • 2609.34759 • Published 9 days ago • 167
VoxMem: Benchmarking Multimodal Memory in Large Audio Language Models Paper • 2609.32607 • Published 11 days ago • 154