Multi-Task Learning for Audio Visual Active Speaker Detection

Benchmark Model Rank Results
audio-visual-active-speaker-detection-on-ava-activespeaker3D-ResNet-GRU–validation mean average precision: 84.0%