Revealing Single Frame Bias for Video-and-Language Learning

Benchmark Model Rank Results
video-question-answering-on-activitynet-qaSingularity-temporal#16Accuracy: 44.1
video-question-answering-on-activitynet-qaSingularity#18Accuracy: 43.1
video-question-answering-on-msrvtt-mcSingularity-temporal#4Accuracy: 93.7
video-question-answering-on-msrvtt-mcSingularity#6Accuracy: 92.1
video-question-answering-on-msrvtt-qaSingularity-temporal#11Accuracy: 43.9
video-question-answering-on-msrvtt-qaSingularity#12Accuracy: 43.5
video-retrieval-on-activitynetSingularity#17text-to-video R@1: 47.1text-to-video R@5: 75.5
video-retrieval-on-didemoSingularity#15text-to-video R@1: 53.9text-to-video R@5: 79.4
video-retrieval-on-msr-vtt-1kaSingularity#31text-to-video R@1: 41.5text-to-video R@5: 68.7text-to-video R@10: 77
video-retrieval-on-ssv2-label-retrievalSingularity-temporal#4text-to-video R@1: 47.4text-to-video R@5: 75.9text-to-video R@10: 84
video-retrieval-on-ssv2-template-retrievalSingularity-temporal#4text-to-video R@1: 77.6text-to-video R@10: 98.9text-to-video R@5: 96
zero-shot-video-retrieval-on-activitynetSingularity-temporal-5M#9text-to-video R@1: 30.8text-to-video R@5: 55.9
zero-shot-video-retrieval-on-activitynetSingularity-temporal-17M#11text-to-video R@1: 30.6text-to-video R@5: 55.6
zero-shot-video-retrieval-on-didemoSingularity-17M#10text-to-video R@1: 37.1text-to-video R@5: 61.7
zero-shot-video-retrieval-on-didemoSingularity-5M#11text-to-video R@1: 36.9text-to-video R@5: 61.1
zero-shot-video-retrieval-on-msr-vttSingularity-17M#18text-to-video R@1: 34.0text-to-video R@5: 56.7
zero-shot-video-retrieval-on-msr-vttSingularity-5M#21text-to-video R@1: 28.4text-to-video R@5: 50.2