Long Context Transfer from Language to Vision

Benchmark Model Rank Results
video-question-answering-on-ovbenchLongVA (7B)#7AVG: 43.6
visual-question-answering-vqa-on-vlm2-benchLongVA-7B#7GC-mat: 14.29GC-trk: 19.18OC-cpr: 26.67OC-cnt: 42.53
zero-shot-video-question-answer-on-next-qaLongVA(32 frames)#13Accuracy: 67.1