Learning Long-Term Spatial-Temporal Graphs for Active Speaker Detection

Benchmark Model Rank Results
audio-visual-active-speaker-detection-on-avaSPELL+#4validation mean average precision: 94.9%
audio-visual-active-speaker-detection-on-avaSPELL#5validation mean average precision: 94.2%
node-classification-on-avaASDNet [ASDNet_ICCV2021]#1mAP: 93.5
node-classification-on-avaTalkNet [tao2021someone]#2mAP: 92.3
node-classification-on-avaUniCon [zhang2021unicon]#3mAP: 92
node-classification-on-avaMAAS-TAN [MAAS2021]#4mAP: 88.8