Multimodal Adaptive Distillation for Leveraging Unimodal Encoders for Vision-Language Tasks

Benchmark Model Rank Results
visual-entailment-on-snli-ve-testMAD (Single Model, Formerly CLIP-TD)Accuracy: 80.32
visual-question-answering-on-vcr-q-a-testMAD (Single Model, Formerly CLIP-TD)Accuracy: 79.6