TokenPacker: Efficient Visual Projector for Multimodal LLM

Benchmark Model Rank Results
visual-question-answering-on-mm-vetLLaVA-TokenPacker (Vicuna-13B)#117GPT-4 score: 34.1
visual-question-answering-on-mm-vetLLaVA-TokenPacker (Vicuna-7B)#150GPT-4 score: 29.6