TRACE: Trajectory-robust Admission with Evidence Ordering for Efficient GUI Agents Paper • 2609.10297 • Published 6 days ago • 2
ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs Paper • 2606.31982 • Published Jun 30
STMI: Segmentation-Guided Token Modulation with Cross-Modal Hypergraph Interaction for Multi-Modal Object Re-Identification Paper • 2603.00695 • Published Feb 28 • 3
VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text? Paper • 2602.04802 • Published Feb 4 • 2
Unity is Strength: Unifying Convolutional and Transformeral Features for Better Person Re-Identification Paper • 2412.17239 • Published Dec 23, 2024 • 2
Sigma: Siamese Mamba Network for Multi-Modal Semantic Segmentation Paper • 2404.04256 • Published Apr 5, 2024 • 6