Efficient Large Multi-modal Models via Visual Context Compression
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-mm-vet
LLaVolta
#147
GPT-4 score: 30.7
Rank counts only results with a code link.