MouSi: Poly-Visual-Expert Vision-Language Models
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-mm-vet
LayoutLMv3+ConvNeXt+CLIP
#82
GPT-4 score: 38.4
Params: 7.9B
Rank counts only results with a code link.