MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale

Benchmark Model Rank Results
visual-question-answering-on-mm-vetMAmmoTH-VL-8B#24GPT-4 score: 62.3
visual-question-answering-on-mm-vetMAmmoTH-VL-8B (SI)#29GPT-4 score: 60.6