FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression

Benchmark Model Rank Results
visual-question-answering-on-mm-vetFocusLLaVAGPT-4 score: 41.3