Temporal and cross-modal attention for audio-visual zero-shot learning

Benchmark Model Rank Results
gzsl-video-classification-on-activitynet-gzslTCaF#2HM: 12.20ZSL: 7.96
gzsl-video-classification-on-activitynet-gzsl-1TCaF#3HM: 10.71ZSL: 7.91
gzsl-video-classification-on-ucf-gzsl-clsTCaF#2HM: 50.78ZSL: 44.64
gzsl-video-classification-on-ucf-gzsl-mainTCaF#2HM: 31.72ZSL: 24.81
gzsl-video-classification-on-vggsound-gzslTCaF#2HM: 8.77ZSL: 7.41
gzsl-video-classification-on-vggsound-gzsl-1TCaF#2HM: 7.33ZSL: 6.06