Meerkat: Audio-Visual Large Language Model for Grounding in Space and Time

Benchmark Model Rank Results
audio-visual-question-answering-music-avqa-v2Meerkat#1Accuracy: 79.15