Enhancing Large Vision Language Models with Self-Training on Image Comprehension

Benchmark Model Rank Results
visual-question-answering-on-mm-vetLLaVA-v1.6 (7B, w/ STIC)#59GPT-4 score: 45.0Params: 7B
visual-question-answering-on-mm-vetLLaVA-v1.5 (7B, w/ STIC)#126GPT-4 score: 32.6Params: 7B