Naver at ActivityNet Challenge 2019 -- Task B Active Speaker Detection (AVA)

Benchmark Model Rank Results
audio-visual-active-speaker-detection-on-ava-activespeakerVGG-{LSTM+TCN} (ensemble)–validation mean average precision: 87.8%