Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-mm-vet
Mipha-3B+
–
GPT-4 score: 35.1
Rank counts only results with a code link.