Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-vqa-on-infoseek
CLIP + FiD
#3
Accuracy: 20.9
visual-question-answering-vqa-on-infoseek
CLIP + PaLM (540B)
#4
Accuracy: 20.4
visual-question-answering-vqa-on-infoseek
PaLI
#5
Accuracy: 19.7
Rank counts only results with a code link.