Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval Paper • 2608.06060 • Published 1 day ago • 25
BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation Paper • 2608.05042 • Published 3 days ago • 7
ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts Paper • 2607.28993 • Published 8 days ago • 6
SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks Paper • 2608.02023 • Published 5 days ago • 152