Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-mm-vet
LLaVA-1.5-7B (+ SIMA)
#139
GPT-4 score: 31.6
Params: 7B
Rank counts only results with a code link.