| Benchmark | Model | Rank | Results |
|---|---|---|---|
| visual-question-answering-on-mm-vet | LLaVA-Next-Mistral-7b (+ DPO w/ VLFeedback) | – | GPT-4 score: 44.2 |
| visual-question-answering-on-mm-vet | LLaVA-Next-Vicuna-7b (+ DPO w/ VLFeedback) | – | GPT-4 score: 44.1 |
| visual-question-answering-on-mm-vet | Qwen-VL-Chat (+ SFT (GPT-4V in VLFeedback)) | – | GPT-4 score: 50.7 |
| visual-question-answering-on-mm-vet | Silkie (Qwen-VL-Chat + DPO w/ VLFeedback) | – | GPT-4 score: 49.9 |