Enhancing Large Vision Language Models with Self-Training on Image Comprehension
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-mm-vet
LLaVA-v1.6 (7B, w/ STIC)
#59
GPT-4 score: 45.0
Params: 7B
visual-question-answering-on-mm-vet
LLaVA-v1.5 (7B, w/ STIC)
#126
GPT-4 score: 32.6
Params: 7B
Rank counts only results with a code link.