MouSi: Poly-Visual-Expert Vision-Language Models

Benchmark Model Rank Results
visual-question-answering-on-mm-vetLayoutLMv3+ConvNeXt+CLIP#82GPT-4 score: 38.4Params: 7.9B