MMTF: Multi-Modal Temporal Fusion for Commonsense Video Question Answering

Benchmark Model Rank Results
video-question-answering-on-agqa-2-0-balancedMMTFAverage Accuracy: 44.36