Audio-visual Generalised Zero-shot Learning with Cross-modal Attention and Language

Benchmark Model Rank Results
gzsl-video-classification-on-activitynet-gzslAVCA#3HM: 9.92
gzsl-video-classification-on-activitynet-gzsl-1AVCA#2HM: 12.13ZSL: 9.13
gzsl-video-classification-on-ucf-gzsl-clsAVCA#3HM: 41.34ZSL: 37.72
gzsl-video-classification-on-ucf-gzsl-mainAVCA#3HM: 27.15ZSL: 20.0
gzsl-video-classification-on-vggsound-gzslAVCA#3HM: 8.31ZSL: 6.91
gzsl-video-classification-on-vggsound-gzsl-1AVCA#3HM: 6.31ZSL: 6.00