Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-mm-vet
GPT-4o +text rationale +IoT
–
GPT-4 score: 72.2
Rank counts only results with a code link.