DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-mm-vet
LLaVA-1.5 + DenseFusion-1M (Vicuna-7B)
#86
GPT-4 score: 37.8
visual-question-answering-on-mm-vet
LLaVA-S^2 + DenseFusion-1M (Vicuna-7B)
#89
GPT-4 score: 37.5
Rank counts only results with a code link.