| visual-entailment-on-snli-ve-test | UNITER (Large) | #6 | Accuracy: 78.98 |
| visual-entailment-on-snli-ve-val | UNITER | #8 | Accuracy: 78.98 |
| visual-question-answering-on-vcr-q-a-test | UNITER-large (10 ensemble) | #2 | Accuracy: 79.8 |
| visual-question-answering-on-vcr-q-a-test | UNITER (Large) | #3 | Accuracy: 77.3 |
| visual-question-answering-on-vcr-q-ar-test | UNITER (Large) | #2 | Accuracy: 62.8 |
| visual-question-answering-on-vcr-qa-r-test | UNITER-large (ensemble of 10 models) | #2 | Accuracy: 83.4 |
| visual-question-answering-on-vcr-qa-r-test | UNITER (Large) | #3 | Accuracy: 80.8 |
| visual-question-answering-on-vqa-v2-test-dev | UNITER (Large) | #18 | Accuracy: 73.24 |
| visual-question-answering-on-vqa-v2-test-std | UNITER (Large) | #16 | overall: 73.4 |
| visual-reasoning-on-nlvr2-test | UNITER (Large) | #11 | Accuracy: 79.5 |
| zero-shot-cross-modal-retrieval-on-flickr30k | UNITER | #18 | Image-to-text R@1: 80.7Image-to-text R@5: 95.7… |