etri-vilab/MultiHopSpatial-Qwen3-VL-4B-Instruct Image-Text-to-Text • 4B • Updated 17 days ago • 119 • 2
etri-vilab/MultiHopSpatial-Qwen3-VL-8B-Instruct Image-Text-to-Text • 9B • Updated 17 days ago • 71 • 1
etri-vilab/MultiHopSpatial-Qwen3-VL-32B-Instruct Image-Text-to-Text • 33B • Updated 17 days ago • 69 • 1
MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model Paper • 2603.18892 • Published Mar 19 • 2