LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
Open paper
Benchmark
Model
Rank
Results
video-question-answering-on-mvbench
LongVU (7B)
#4
Avg.: 66.9
zero-shot-video-question-answer-on-egoschema-1
LongVU (7B)
#4
Accuracy: 67.6
zero-shot-video-question-answer-on-video-mme-1
LongVU (7B)
#8
Accuracy (%): 60.6
Rank counts only results with a code link.