Efficient Multimodal Learning from Data-centric Perspective

Benchmark Model Rank Results
image-classification-on-coloninst-v1-seenBunny-v1.0-3B (w/ LoRA, w/ extra data)#11Accuray: 92.47
image-classification-on-coloninst-v1-seenBunny-v1.0-3B (w/ LoRA, w/o extra data)#13Accuray: 91.16
image-classification-on-coloninst-v1-unseenBunny-v1.0-3B (w/ LoRA, w/ extra data)#4Accuray: 79.50
image-classification-on-coloninst-v1-unseenBunny-v1.0-3B (w/ LoRA, w/o extra data)#14Accuray: 75.50
referring-expression-generation-on-coloninstBunny-v1.0-3B (w/ LoRA, w/o extra data)#11Accuray: 96.61
referring-expression-generation-on-coloninstBunny-v1.0-3B (w/ LoRA, w/ extra data)#12Accuray: 96.02
referring-expression-generation-on-coloninst-1Bunny-v1.0-3B (w/ LoRA, w/ extra data)#4Accuray: 75.08
referring-expression-generation-on-coloninst-1Bunny-v1.0-3B (w/ LoRA, w/o extra data)#15Accuray: 69.45