MIMIC-IT: Multi-Modal In-Context Instruction Tuning

Benchmark Model Rank Results
visual-question-answering-on-mm-vetOtter-9B (MPT-7B)#159GPT-4 score: 24.7±0.3Params: 9B
visual-question-answering-on-mm-vetOtter-9B (LLaMA)#160GPT-4 score: 24.6±0.2Params: 9B
visual-question-answering-on-mm-vet-v2Otter-9B#16GPT-4 score: 23.2±0.1Params: 9B