ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models

Benchmark Model Rank Results
visual-question-answering-on-mm-vetLLaVA-1.5-7B (VG-S)#72GPT-4 score: 40.4
visual-question-answering-on-mm-vetLLaVA-1.5-7B (DC-S)#81GPT-4 score: 38.5