V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-mm-vet
SEAL (7B)
#155
GPT-4 score: 27.7
Params: 7B
visual-question-answering-on-v-bench
SEAL
#3
Accuracy: 75.39
Rank counts only results with a code link.