Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification

Benchmark Model Rank Results
visual-question-answering-on-mm-vetDynamic-LLaVA-13B#90GPT-4 score: 37.3
visual-question-answering-on-mm-vetDynamic-LLaVA-7B#130GPT-4 score: 32.2