Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-vip-bench
Shikra-7B (Coordinates)
#12
GPT-4 score (bbox): 33.7
Rank counts only results with a code link.