A Simple LLM Framework for Long-Range Video Question-Answering

Benchmark Model Rank Results
zero-shot-video-question-answer-on-egoschemaLLoVi (GPT-3.5)#10Accuracy: 57.6
zero-shot-video-question-answer-on-egoschemaLLoVi (7B)#11Accuracy: 50.8
zero-shot-video-question-answer-on-egoschema-1LLoVi (GPT-3.5)#17Accuracy: 50.3
zero-shot-video-question-answer-on-egoschema-1LLoVi (7B)#23Accuracy: 33.5
zero-shot-video-question-answer-on-intentqaLLoVi (GPT-4)#6Accuracy: 64.0
zero-shot-video-question-answer-on-intentqaLLoVi (7B)#10Accuracy: 53.6
zero-shot-video-question-answer-on-next-gqaLLoVi (GPT-4)#4Acc@GQA: 26.8
zero-shot-video-question-answer-on-next-gqaLLoVi (7B)#7Acc@GQA: 11.2
zero-shot-video-question-answer-on-next-qaLLoVi (GPT-4)#12Accuracy: 67.7
zero-shot-video-question-answer-on-next-qaLLoVi (7B)#21Accuracy: 54.3