Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models
Open paper
Benchmark
Model
Rank
Results
natural-language-visual-grounding-on
Groma
#18
Accuracy (%): 5.2
Rank counts only results with a code link.