RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations Paper • 2610.01780 • Published 5 days ago • 256
Covert Assistance: Helpful LLM Agents Evade Oversight in Multi-Agent Systems Paper • 2609.39050 • Published 6 days ago • 13
Dream4ACT: A Shared Visual Action Interface for Multi-Embodiment Video-Action Modeling Paper • 2609.40153 • Published 6 days ago • 8
Smaller Models, Better Rejects: Preference Distillation Scaling Paper • 2609.38987 • Published 6 days ago • 21
Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous Multi-Agent LLMs Paper • 2609.32259 • Published 7 days ago • 81
AutoDataBench: A Data-centric Testbed for Accelerating Auto Research Paper • 2609.40097 • Published 6 days ago • 39
Predictive Credit: Measuring What Scientific Explanations Add to Experimental Forecasts Paper • 2610.00314 • Published 7 days ago • 97