V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs

Benchmark Model Rank Results
visual-question-answering-on-mm-vetSEAL (7B)#155GPT-4 score: 27.7Params: 7B
visual-question-answering-on-v-benchSEAL#3Accuracy: 75.39