Moment Sampling in Video LLMs for Long-Form Video QA

Benchmark Model Rank Results
zero-shot-video-question-answer-on-egoschema-subsetGPT-4o with MS–Accuracy: 73.6
zero-shot-video-question-answer-on-intentqaGPT-4o with MS–Accuracy: 77.3
zero-shot-video-question-answer-on-next-qaGPT-4o with MS–Accuracy: 77.4