Multi-Task Learning for Audio Visual Active Speaker Detection
Open paper
Benchmark
Model
Rank
Results
audio-visual-active-speaker-detection-on-ava-activespeaker
3D-ResNet-GRU
–
validation mean average precision: 84.0%
Rank counts only results with a code link.