Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?

Benchmark Model Rank Results
visual-question-answering-vqa-on-infoseekCLIP + FiD#3Accuracy: 20.9
visual-question-answering-vqa-on-infoseekCLIP + PaLM (540B)#4Accuracy: 20.4
visual-question-answering-vqa-on-infoseekPaLI#5Accuracy: 19.7