Unifying Vision-and-Language Tasks via Text Generation

Benchmark Model Rank Results
image-captioning-on-flickr30k-captions-testVL-T5#5CIDEr: 2.6SPICE: 2.0
image-captioning-on-nocaps-valVL-T5#3CIDEr: 4.4SPICE: 5.3
visual-question-answering-on-vcr-q-a-testVL-T5#5Accuracy: 75.3
visual-question-answering-on-vcr-q-ar-testVL-T5#4Accuracy: 58.9
visual-question-answering-on-vcr-qa-r-testVL-T5#5Accuracy: 77.8