SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models

Benchmark Model Rank Results
described-object-detection-on-descriptionSPHINX-7B#6Intra-scenario FULL mAP: 10.6Intra-scenario PRES mAP: 11.4
visual-question-answering-on-benchlmmSphinx-V2-1K#2GPT-3.5 score: 57.43
visual-question-answering-on-mm-vetSPHINX-2k#74GPT-4 score: 40.2
visual-question-answering-vqa-on-core-mmSPHINX v2#2Overall score: 39.48Deductive: 42.17Abductive: 49.85