Gamified crowd-sourcing of high-quality data for visual fine-tuning

Benchmark Model Rank Results
visual-question-answering-on-mm-vetMiniCPM-Llama3-V-2.5-8B (finetuned on GAP-VQA train)GPT-4 score: 51.789
visual-question-answering-on-mm-vetQwen2-VL-2B (finetuned on GAP-VQA train)GPT-4 score: 52.43
visual-question-answering-on-mm-vetQwen2-VL-7B (finetuned on GAP-VQA train)GPT-4 score: 64.954