VisionZip: Longer is Better but Not Necessary in Vision Language Models

Benchmark Model Rank Results
visual-question-answering-on-mm-vetVisionZip (Retain 128 Tokens, fine-tuning)#124GPT-4 score: 32.9
visual-question-answering-on-mm-vetVisionZip (Retain 192 Tokens, fine-tuning)#127GPT-4 score: 32.6
visual-question-answering-on-mm-vetVisionZip (Retain 128 Tokens)#128GPT-4 score: 32.6
visual-question-answering-on-mm-vetVisionZip (Retain 192 Tokens)#137GPT-4 score: 31.7
visual-question-answering-on-mm-vetVisionZip (Retain 64 Tokens)#138GPT-4 score: 31.7
visual-question-answering-on-mm-vetVisionZip (Retain 64 Tokens, fine-tuning)#149GPT-4 score: 30.2