OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework

Benchmark Model Rank Results
image-captioning-on-coco-captionsOFA#2BLEU-4: 44.9CIDER: 154.9METEOR: 32.5SPICE: 26.6
object-categorization-on-gritOFA_Large#2Categorization (ablation): 22.6
self-supervised-image-classification-on-1OFA (Large)#22Top 1 Accuracy: 85.6%Number of Params: 473M
text-summarization-on-gigawordOFA#4ROUGE-1: 39.81ROUGE-2: 20.66ROUGE-L: 37.11
visual-entailment-on-snli-ve-testOFA#1Accuracy: 91.2
visual-entailment-on-snli-ve-valOFA#1Accuracy: 91.0
visual-question-answering-on-vqa-v2-test-dev-1OFA#3Accuracy: 82.0
visual-question-answering-on-vqa-v2-test-std-1OFA#2number: 71.44other: 73.35overall: 81.98yes/no: 94.66