Improving Multi-modal Large Language Model through Boosting Vision Capabilities

Benchmark Model Rank Results
visual-question-answering-on-mm-vetArcanaGPT-4 score: 34.8