FOCUS: Internal MLLM Representations for Efficient Fine-Grained Visual Question Answering
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-v-bench
LLaVA-OneVision7B w. FOCUS
–
Accuracy: 92.15
Rank counts only results with a code link.