Making Large Language Models Better Data Creators

Benchmark Model Rank Results
visual-question-answering-on-vip-benchViP-LLaVA-13B (Visual Prompt)#4GPT-4 score (bbox): 48.3GPT-4 score (human): 48.2