| Benchmark | Model | Rank | Results |
|---|---|---|---|
| video-question-answering-on-activitynet-qa | Text + Text (no Multimodal Pretext Training) | #19 | Accuracy: 41.4 |
| video-question-answering-on-how2qa | Text + Text (no Multimodal Pretext Training) | #1 | Accuracy: 93.2 |
| video-question-answering-on-ivqa | Text + Text (no Multimodal Pretext Training) | #1 | Accuracy: 40.2 |