Lyrics: Boosting Fine-grained Language-Vision Alignment and Comprehension via Semantic-aware Visual Objects

Benchmark Model Rank Results
image-captioning-on-cocoLyricsCIDEr: 121.1
image-captioning-on-nocaps-entireLyricsCIDEr: 126.8
visual-question-answering-on-gqa-test-devLyricsAccuracy: 62.4
visual-question-answering-on-ok-vqaLyricsAccuracy: 58.2
visual-question-answering-on-vqa-v2-test-devLyricsAccuracy: 81.2