Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate

Benchmark Model Rank Results
visual-question-answering-on-mm-vetMini-Gemini (+MoCa)#67GPT-4 score: 42.9
visual-question-answering-on-mm-vetLLaVA-v1.5 (+MoCa)#129GPT-4 score: 32.2