VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment

Benchmark Model Rank Results
visual-question-answering-on-mm-vetLLaVA-Next-Mistral-7b (+ DPO w/ VLFeedback)GPT-4 score: 44.2
visual-question-answering-on-mm-vetLLaVA-Next-Vicuna-7b (+ DPO w/ VLFeedback)GPT-4 score: 44.1
visual-question-answering-on-mm-vetQwen-VL-Chat (+ SFT (GPT-4V in VLFeedback))GPT-4 score: 50.7
visual-question-answering-on-mm-vetSilkie (Qwen-VL-Chat + DPO w/ VLFeedback)GPT-4 score: 49.9