Vision Transformers are Parameter-Efficient Audio-Visual Learners
Open paper
Benchmark
Model
Rank
Results
audio-visual-question-answering-music-avqa-v2
LAVISH
#4
Accuracy: 73.18
audio-visual-question-answering-on-music-avqa
LAVISH
#3
Acc: 77.08
Rank counts only results with a code link.