LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents

Benchmark Model Rank Results
visual-question-answering-on-mm-vetLLaVA-Plus-13B (All Tools, V1.3, 336px)#113GPT-4 score: 35.0±0.0Params: 13B
visual-question-answering-on-mm-vetLLaVA-Plus-7B (All Tools)#156GPT-4 score: 27.5±0.3Params: 7B