Boosting Audio-visual Zero-shot Learning with Large Language Models

Benchmark Model Rank Results
gzsl-video-classification-on-activitynet-gzslKDA#1HM: 17.95ZSL: 11.85
gzsl-video-classification-on-activitynet-gzsl-1KDA#1HM: 19.67ZSL: 14.00
gzsl-video-classification-on-ucf-gzsl-clsKDA#1HM: 54.84ZSL: 52.66
gzsl-video-classification-on-ucf-gzsl-mainKDA#1HM: 41.10ZSL: 28.05
gzsl-video-classification-on-vggsound-gzslKDA#1HM: 9.78ZSL: 8.32
gzsl-video-classification-on-vggsound-gzsl-1KDA#1HM: 10.45ZSL: 8.43