Implicit Differentiable Outlier Detection Enable Robust Deep Multimodal Analysis

Benchmark Model Rank Results
cross-modal-retrieval-on-coco-2014VK-OOD#10Text-to-image R@1: 62.9Text-to-image R@5: 84.8
visual-question-answering-on-ok-vqaVK-OOD#13Accuracy: 52.4
visual-question-answering-on-vqa-v2-test-devVK-OOD#15Accuracy: 77.9
visual-reasoning-on-nlvr2-devVK-OOD#7Accuracy: 84.6
zero-shot-cross-modal-retrieval-on-flickr30kVK-OOD#13Image-to-text R@1: 89.0Image-to-text R@5: 99.2