MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-mm-vet
MaVEn
–
GPT-4 score: 30.4
Params: 7.2B
Rank counts only results with a code link.