Efficient Large Multi-modal Models via Visual Context Compression

Benchmark Model Rank Results
visual-question-answering-on-mm-vetLLaVolta#147GPT-4 score: 30.7