Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence Paper • 2608.10720 • Published 1 day ago • 9
Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents Paper • 2607.28227 • Published 14 days ago • 302
CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization Paper • 2607.25659 • Published 16 days ago • 83
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM Paper • 2607.27205 • Published 15 days ago • 139
Self-Supervised Learning of Structured Dynamics from Videos Paper • 2607.21576 • Published 21 days ago • 20
ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU Paper • 2607.19191 • Published 22 days ago • 311
ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video Paper • 2607.17790 • Published 24 days ago • 5
HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement Paper • 2607.18217 • Published 24 days ago • 61
ABot-N1: Toward a General Visual Language Navigation Foundation Model Paper • 2607.10383 • Published 30 days ago • 102
LATO.2: Factorized 3D Mesh Generation with Vertex and Topology Flow Paper • 2607.10623 • Published Jul 12 • 16
MemSlides: A Hierarchical Memory Driven Agent Framework for Personalized Slide Generation with Multi-turn Local Revision Paper • 2606.17162 • Published Jun 15 • 178
Skill-MAS: Evolving Meta-Skill for Automatic Multi-Agent Systems Paper • 2606.18837 • Published Jun 17 • 58