Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models

Benchmark Model Rank Results
visual-question-answering-on-mm-vetLLaVA-HR-X#108GPT-4 score: 35.5