Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement

Benchmark Model Rank Results
visual-question-answering-on-mm-vetLLaVA-1.5-7B (+ SIMA)#139GPT-4 score: 31.6Params: 7B