Multimodal Adaptive Distillation for Leveraging Unimodal Encoders for Vision-Language Tasks
Open paper
Benchmark
Model
Rank
Results
visual-entailment-on-snli-ve-test
MAD (Single Model, Formerly CLIP-TD)
–
Accuracy: 80.32
visual-question-answering-on-vcr-q-a-test
MAD (Single Model, Formerly CLIP-TD)
–
Accuracy: 79.6
Rank counts only results with a code link.