SViTT: Temporal Learning of Sparse Video-Text Transformers

Benchmark Model Rank Results
video-question-answering-on-agqa-2-0-balancedSViTT#4Average Accuracy: 52.7