Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding

Benchmark Model Rank Results
chart-question-answering-on-chartqaPix2Struct-large#181:1 Accuracy: 58.6
chart-question-answering-on-chartqaPix2Struct-base#191:1 Accuracy: 56.0
visual-question-answering-on-docvqa-testPix2Struct-large#22ANLS: 0.766
visual-question-answering-on-docvqa-testPix2Struct-base#24ANLS: 0.721
visual-question-answering-vqa-on-infographicvqaPix2Struct-large#14ANLS: 40
visual-question-answering-vqa-on-infographicvqaPix2Struct-base#15ANLS: 38.2