Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models

Benchmark Model Rank Results
natural-language-visual-grounding-onGroma#18Accuracy (%): 5.2