MAAS: Multi-modal Assignation for Active Speaker Detection

Benchmark Model Rank Results
audio-visual-active-speaker-detection-on-ava-activespeakerMAAS-TAN#11validation mean average precision: 88.8%
audio-visual-active-speaker-detection-on-ava-activespeakerMAAS-LAN#13validation mean average precision: 85.1%