marcelosantoskuw/paper_015153151_visual_question_answering Visual Question Answering • Updated Aug 21 • 5
In-Context Learning for Robots: Methods and Applications Paper • 2609.36012 • Published 8 days ago • 389
AutoRef: Harness Optimization for Agentic Multi-Reference Image Generation Paper • 2609.35530 • Published 8 days ago • 21
Beyond the Timeline: Augmenting Long-Video Memory with Grounded Entity Biographies Paper • 2609.38155 • Published 7 days ago • 114
TakalaWang/Discussion-Phi-4-multimodal-instruct-audio-dimp-reasoning Text Generation • 6B • Updated May 15, 2025 • 154 • 5
gabrielamarques/paper_015384925_visual_question_answering Visual Question Answering • Updated Aug 21 • 6
TRACE: Temporal Audit and Condition-aware Evaluation of Streaming Video Understanding Paper • 2609.30670 • Published 11 days ago • 11
Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models Paper • 2609.26637 • Published 14 days ago • 26
RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling Paper • 2609.22947 • Published 17 days ago • 43
SpeakerMem-R1: Speaker-Centered Dual-Track Memory for Multi-Party Dialogue Paper • 2609.26780 • Published 14 days ago • 103
yjyjyj98/thinkmorph-interleaved_reasoning-multimodal_reward-beta0.04_attnFixed-SFT_NEW-yes_bbox_ckpt200 11B • Updated Apr 5 • 10 • 2