Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-mm-vet
Mini-Gemini (+MoCa)
#67
GPT-4 score: 42.9
visual-question-answering-on-mm-vet
LLaVA-v1.5 (+MoCa)
#129
GPT-4 score: 32.2
Rank counts only results with a code link.