PaLI-X: On Scaling up a Multilingual Vision and Language Model

Benchmark Model Rank Results
chart-question-answering-on-chartqaPaLI-X (Single-task FT w/ OCR)#51:1 Accuracy: 72.3
chart-question-answering-on-chartqaPaLI-X (Single-task FT)#61:1 Accuracy: 70.9
chart-question-answering-on-chartqaPaLI-X (Multi-task FT)#71:1 Accuracy: 70.6
fine-grained-image-recognition-on-ovenPaLI-X#1Accuracy: 23.1
temporal-casual-qa-on-next-qaPaLI-X#1WUPS: 38.3
visual-question-answering-on-docvqa-testPaLI-X (Single-task FT w/ OCR)#12ANLS: 0.868
visual-question-answering-on-docvqa-testPaLI-X (Multi-task FT)#19ANLS: 0.809
visual-question-answering-on-docvqa-testPaLI-X (Single-task FT)#20ANLS: 0.80
visual-question-answering-on-ok-vqaPaLI-X (Single-task FT)#2Accuracy: 66.1
visual-question-answering-vqa-on-infographicvqaPaLI-X (Single-task FT w/ OCR)#7ANLS: 54.8
visual-question-answering-vqa-on-infographicvqaPaLI-X (Multi-task FT)#9ANLS: 50.7
visual-question-answering-vqa-on-infographicvqaPaLI-X (Single-task FT)#10ANLS: 49.2
visual-question-answering-vqa-on-infoseekPaLI-X#2Accuracy: 24