Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-mm-vet
Dynamic-LLaVA-13B
#90
GPT-4 score: 37.3
visual-question-answering-on-mm-vet
Dynamic-LLaVA-7B
#130
GPT-4 score: 32.2
Rank counts only results with a code link.