Improving Multi-modal Large Language Model through Boosting Vision Capabilities
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-mm-vet
Arcana
–
GPT-4 score: 34.8
Rank counts only results with a code link.