MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Benchmark Model Rank Results
spatial-reasoning-on-embspatial-benchMiniGPT4#5Generation: 23.54
video-question-answering-on-mvbenchMiniGPT4#22Avg.: 18.8
visual-question-answering-on-benchlmmMiniGPT4-13B#9GPT-3.5 score: 34.93
visual-question-answering-on-mm-vetMiniGPT-4-14B#161GPT-4 score: 24.4±0.4Params: 14B
visual-question-answering-on-mm-vetMiniGPT-4-8B#164GPT-4 score: 22.1±0.1Params: 8B
visual-question-answering-vqa-on-5miniGPT4#2Overall Accuracy: 51.0
visual-question-answering-vqa-on-core-mmMiniGPT-v2#13Overall score: 10.43Deductive: 11.02Abductive: 13.28