LoCoNet: Long-Short Context Network for Active Speaker Detection

Benchmark Model Rank Results
audio-visual-active-speaker-detection-on-ava-activespeakerLoCoNet#3validation mean average precision: 95.2%