Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models

Benchmark Model Rank Results
visual-question-answering-on-mm-vetDragonfly (Llama3-8B)#106GPT-4 score: 35.9