Towards Semantic Equivalence of Tokenization in Multimodal LLM

Benchmark Model Rank Results
visual-question-answering-on-mm-vetSETOKIM (13B)GPT-4 score: 48.7Params: 13B