FOCUS: Internal MLLM Representations for Efficient Fine-Grained Visual Question Answering

Benchmark Model Rank Results
visual-question-answering-on-v-benchLLaVA-OneVision7B w. FOCUSAccuracy: 92.15