Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding

Benchmark Model Rank Results
visual-question-answering-on-mm-vetPIIP-LLaVA (Vicuna-7B, ConvNeXt-L, CLIP-L )#60GPT-4 score: 44.7Params: 7B