MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model
-
etri-vilab/MultihopSpatial
Viewer ⢠Updated ⢠15.8k ⢠4.29k ⢠5 -
etri-vilab/MultiHopSpatial-Qwen3-VL-4B-Instruct
Image-Text-to-Text ⢠4B ⢠Updated ⢠19 ⢠2 -
etri-vilab/MultiHopSpatial-Qwen3-VL-8B-Instruct
Image-Text-to-Text ⢠9B ⢠Updated ⢠9 ⢠1 -
etri-vilab/MultiHopSpatial-Qwen3-VL-32B-Instruct
Image-Text-to-Text ⢠33B ⢠Updated ⢠15 ⢠1