RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations Paper • 2610.01780 • Published 5 days ago • 259
Where Does Retrieval-Based Open-Ended Evaluation Fail? Automatic Taxonomy Induction from Long-Form Medical Answer Factuality Verification Paper • 2609.30467 • Published 12 days ago • 11
Dream4ACT: A Shared Visual Action Interface for Multi-Embodiment Video-Action Modeling Paper • 2609.40153 • Published 6 days ago • 8
Scaling Properties of Same-Family On-Policy Distillation Paper • 2609.32722 • Published 10 days ago • 323
Fractional State Space Transition for Long Sequence Modeling Paper • 2609.36314 • Published 8 days ago • 10
WorldLine: Action-Driven Visual Simulation for Robotic Manipulation Paper • 2609.38059 • Published 7 days ago • 32
HybridCUA: Learning to Orchestrate GUI and CLI for Computer-Use Agents Paper • 2609.38008 • Published 7 days ago • 47