List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs

Benchmark Model Rank Results
visual-question-answering-on-mm-vetSoM-LLaVA-1.5-T#92GPT-4 score: 37.2
visual-question-answering-on-mm-vetSoM-LLaVA-1.5#105GPT-4 score: 35.9