List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-mm-vet
SoM-LLaVA-1.5-T
#92
GPT-4 score: 37.2
visual-question-answering-on-mm-vet
SoM-LLaVA-1.5
#105
GPT-4 score: 35.9
Rank counts only results with a code link.