Kosmos-2: Grounding Multimodal Large Language Models to the World
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-vip-bench
Kosmos-2 (Discrete Token)
#13
GPT-4 score (bbox): 26.9
Rank counts only results with a code link.