Audio-Visual Activity Guided Cross-Modal Identity Association for Active Speaker Detection

Benchmark Model Rank Results
audio-visual-active-speaker-detection-on-ava-activespeakerGSCMIA#9validation mean average precision: 92.86%