Glance and Focus: Memory Prompting for Multi-Event Video Question Answering

Benchmark Model Rank Results
question-answering-on-egotaskqaGF(sup)#2Direct: 44.27
question-answering-on-egotaskqaGF(uns)#3Direct: 43.06
video-question-answering-on-agqa-2-0-balancedGF (sup) - Faster RCNN#1Average Accuracy: 55.08
video-question-answering-on-agqa-2-0-balancedGF (uns) - S3D#3Average Accuracy: 53.33
video-question-answering-on-agqa-2-0-balancedAIO - ViT#7Average Accuracy: 48.59
video-question-answering-on-next-qaGF#33Accuracy: 58.83
video-question-answering-on-situatedGF(sup)#5Average Accuracy: 53.94
video-question-answering-on-situatedGF(uns)#6Average Accuracy: 53.86