MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning

Benchmark Model Rank Results
image-classification-on-coloninst-v1-seenMiniGPT-v2 (w/ LoRA, w/o extra data)#12Accuray: 91.49
image-classification-on-coloninst-v1-seenMiniGPT-v2 (w/ LoRA, w/ extra data)#14Accuray: 90.00
image-classification-on-coloninst-v1-unseenMiniGPT-v2 (w/ LoRA, w/o extra data)#11Accuray: 77.93
image-classification-on-coloninst-v1-unseenMiniGPT-v2 (w/ LoRA, w/ extra data)#13Accuray: 76.82
natural-language-visual-grounding-onMiniGPT-v2#16Accuracy (%): 5.7
referring-expression-generation-on-coloninstMiniGPT-v2 (w/ LoRA, w/o extra data)#13Accuray: 94.69
referring-expression-generation-on-coloninstMiniGPT-v2 (w/ LoRA, w/ extra data)#15Accuray: 87.65
referring-expression-generation-on-coloninst-1MiniGPT-v2 (w/ LoRA, w/o extra data)#10Accuray: 72.05
referring-expression-generation-on-coloninst-1MiniGPT-v2 (w/ LoRA, w/ extra data)#12Accuray: 70.23
visual-question-answering-on-benchlmmMiniGPTv2-7B#10GPT-3.5 score: 30.1