Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models

Benchmark Model Rank Results
image-classification-on-coloninst-v1-seenMGM-2B (w/o LoRA, w/ extra data)#7Accuray: 93.24
image-classification-on-coloninst-v1-seenMGM-2B (w/o LoRA, w/o extra data)#10Accuray: 92.97
image-classification-on-coloninst-v1-unseenMGM-2B (w/o LoRA, w/o extra data)#7Accuray: 78.99
image-classification-on-coloninst-v1-unseenMGM-2B (w/o LoRA, w/ extra data)#9Accuray: 78.69
referring-expression-generation-on-coloninstMGM-2B (w/o LoRA, w/ extra data)#4Accuray: 98.75
referring-expression-generation-on-coloninstMGM-2B (w/o LoRA, w/o extra data)#6Accuray: 98.17
referring-expression-generation-on-coloninst-1MGM-2B (w/o LoRA, w/ extra data)#6Accuray: 74.30
referring-expression-generation-on-coloninst-1MGM-2B (w/o LoRA, w/o extra data)#14Accuray: 69.81
visual-question-answering-on-mm-vetMini-Gemini-HD-BS#27GPT-4 score: 60.8
visual-question-answering-on-mm-vetMini-Gemini-HD#32GPT-4 score: 59.3
visual-question-answering-on-mm-vetMini-Gemini#38GPT-4 score: 53.0