UniCon: Unified Context Network for Robust Active Speaker Detection

Benchmark Model Rank Results
audio-visual-active-speaker-detection-on-ava-activespeakerUniCon–validation mean average precision: 92.0%