Vision Transformers are Parameter-Efficient Audio-Visual Learners

Benchmark Model Rank Results
audio-visual-question-answering-music-avqa-v2LAVISH#4Accuracy: 73.18
audio-visual-question-answering-on-music-avqaLAVISH#3Acc: 77.08