ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-mm-vet
ConvLLaVA
#55
GPT-4 score: 45.9
Params: 7B
Rank counts only results with a code link.