Active Speaker Detection as a Multi-Objective Optimization with Uncertainty-based Multimodal Fusion

Benchmark Model Rank Results
audio-visual-active-speaker-detection-on-ava-activespeakerSA-uncertainty Fusion–validation mean average precision: 91.9%