ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models

Benchmark Model Rank Results
visual-question-answering-on-mm-vetConvLLaVA#55GPT-4 score: 45.9Params: 7B