DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception

Benchmark Model Rank Results
visual-question-answering-on-mm-vetLLaVA-1.5 + DenseFusion-1M (Vicuna-7B)#86GPT-4 score: 37.8
visual-question-answering-on-mm-vetLLaVA-S^2 + DenseFusion-1M (Vicuna-7B)#89GPT-4 score: 37.5