SViTT: Temporal Learning of Sparse Video-Text Transformers
Open paper
Benchmark
Model
Rank
Results
video-question-answering-on-agqa-2-0-balanced
SViTT
#4
Average Accuracy: 52.7
Rank counts only results with a code link.