An Empirical Study of Scaling Instruct-Tuned Large Multimodal Models
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-mm-vet
LLaVA-65B (Data Mixing)
#96
GPT-4 score: 36.4
Rank counts only results with a code link.