Learning to Localize Objects Improves Spatial Reasoning in Visual-LLMs

Benchmark Model Rank Results
video-question-answering-on-activitynet-qaLocVLM-Vid-B+#23Accuracy: 38.2
video-question-answering-on-activitynet-qaLocVLM-Vid-B#24Accuracy: 37.4
visual-question-answering-on-vqa-v2-test-dev-1LocVLM-L#10Accuracy: 56.2
visual-question-answering-on-vqa-v2-val-1LocVLM-L#4Accuracy: 55.9