InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model

Benchmark Model Rank Results
visual-question-answering-on-mm-vetInternLM-XComposer2#43GPT-4 score: 51.2
visual-question-answering-on-mm-vet-v2IXC2-VL-7B#11GPT-4 score: 42.5±0.3