Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge

Benchmark Model Rank Results
visual-question-answering-on-mm-vetMipha-3B+GPT-4 score: 35.1