Learning to Answer Questions in Dynamic Audio-Visual Scenarios

Benchmark Model Rank Results
audio-visual-question-answering-music-avqa-v2AVST#5Accuracy: 71.02
audio-visual-question-answering-on-music-avqaST-AVQA#4Acc: 71.52