MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices

Benchmark Model Rank Results
image-classification-on-coloninst-v1-seenMobileVLM-1.7B (w/ LoRA, w/ extra data)#3Accuray: 93.64
image-classification-on-coloninst-v1-seenMobileVLM-1.7B (w/o LoRA, w/ extra data)#8Accuray: 93.02
image-classification-on-coloninst-v1-unseenMobileVLM-1.7B (w/ LoRA, w/ extra data)#3Accuray: 80.44
image-classification-on-coloninst-v1-unseenMobileVLM-1.7B (w/o LoRA, w/ extra data)#8Accuray: 78.75
referring-expression-generation-on-coloninstMobileVLM-1.7B (w/ LoRA, w/ extra data)#7Accuray: 97.87
referring-expression-generation-on-coloninstMobileVLM-1.7B (w/o LoRA, w/ extra data)#8Accuray: 97.78
referring-expression-generation-on-coloninst-1MobileVLM-1.7B (w/ LoRA, w/ extra data)#2Accuray: 78.03
referring-expression-generation-on-coloninst-1MobileVLM-1.7B (w/o LoRA, w/ extra data)#7Accuray: 73.14