| factual-inconsistency-detection-in-chart-1 | LLaVA-1.5-13B | #4 | Kendall's Tau-c: 0.057 |
| factual-inconsistency-detection-in-chart-2 | LLaVA-1.5-13B | #2 | Kendall's Tau-c: 0.214 |
| factual-inconsistency-detection-in-chart-3 | LLaVA-1.5-13B | #3 | Kendall's Tau-c: 0.002 |
| image-classification-on-coloninst-v1-seen | LLaVA-v1.5 (w/ LoRA, w/ extra data) | #6 | Accuray: 93.33 |
| image-classification-on-coloninst-v1-seen | LLaVA-v1.5 (w/ LoRA, w/o extra data) | #9 | Accuray: 92.97 |
| image-classification-on-coloninst-v1-unseen | LLaVA-v1.5
(w/ LoRA, w/ extra data) | #2 | Accuray: 80.89 |
| image-classification-on-coloninst-v1-unseen | LLaVA-v1.5
(w/ LoRA, w/o extra data) | #6 | Accuray: 79.10 |
| referring-expression-generation-on-coloninst | LLaVA-v1.5
(w/ LoRA, w/ extra data) | #2 | Accuray: 99.32 |
| referring-expression-generation-on-coloninst | LLaVA-v1.5
(w/ LoRA, w/o extra data) | #5 | Accuray: 98.58 |
| referring-expression-generation-on-coloninst-1 | LLaVA-v1.5
(w/ LoRA, w/ extra data) | #9 | Accuray: 72.88 |
| referring-expression-generation-on-coloninst-1 | LLaVA-v1.5
(w/ LoRA, w/o extra data) | #11 | Accuray: 70.38 |
| spatial-reasoning-on-6-dof-spatialbench | LLaVA-1.5 | #3 | Total: 27.2Position-rel: 30.9Position-abs: 24.5… |
| visual-instruction-following-on-llava-bench | LLaVA-v1.5-13B | #4 | avg score: 70.7 |
| visual-instruction-following-on-llava-bench | LLaVA-v1.5-7B | #5 | avg score: 63.4 |
| visual-question-answering-on-benchlmm | LLaVA-1.5-13B | #3 | GPT-3.5 score: 55.53 |
| visual-question-answering-on-mm-vet | LLaVA-1.5-13B | #99 | GPT-4 score: 36.3±0.2Params: 13B |
| visual-question-answering-on-mm-vet | LLaVA-1.5-7B | #143 | GPT-4 score: 31.1±0.2Params: 7B |
| visual-question-answering-on-mm-vet-v2 | LLaVA-v1.5-13B | #14 | GPT-4 score: 33.2±0.1Params: 13B |
| visual-question-answering-on-mm-vet-v2 | LLaVA-v1.5-7B | #15 | GPT-4 score: 28.3±0.2Params: 7B |
| visual-question-answering-on-vip-bench | LLaVA-1.5-13B (Coordinates) | #5 | GPT-4 score (bbox): 47.1 |
| visual-question-answering-on-vip-bench | LLaVA-1.5-13B (Visual Prompt) | #8 | GPT-4 score (bbox): 41.8GPT-4 score (human): 42.9 |
| visual-question-answering-vqa-on-5 | LLaVA-1.5 | #3 | Overall Accuracy: 44.5 |
| visual-question-answering-vqa-on-core-mm | LLaVA-1.5 | #5 | Overall score: 32.62Deductive: 30.94Abductive: 47.91… |