LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding

Benchmark Model Rank Results
video-question-answering-on-mvbenchLongVU (7B)#4Avg.: 66.9
zero-shot-video-question-answer-on-egoschema-1LongVU (7B)#4Accuracy: 67.6
zero-shot-video-question-answer-on-video-mme-1LongVU (7B)#8Accuracy (%): 60.6