ViLA: Efficient Video-Language Alignment for Video Question Answering
Open paper
Benchmark
Model
Rank
Results
video-question-answering-on-next-qa
ViLA (3B)
#21
Accuracy: 75.6
video-question-answering-on-next-qa
ViLA (3B, 4 frames)
#24
Accuracy: 74.4
video-question-answering-on-star
VLAP (4 frames)
#1
Average Accuracy: 67.1
Rank counts only results with a code link.