ViLA: Efficient Video-Language Alignment for Video Question Answering

Benchmark Model Rank Results
video-question-answering-on-next-qaViLA (3B)#21Accuracy: 75.6
video-question-answering-on-next-qaViLA (3B, 4 frames)#24Accuracy: 74.4
video-question-answering-on-starVLAP (4 frames)#1Average Accuracy: 67.1