Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models

Benchmark Model Rank Results
visual-question-answering-on-mm-vetLLaVA-1.5+CoS#88GPT-4 score: 37.6