mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models

Benchmark Model Rank Results
video-question-answering-on-mvbenchmPLUG-Owl3(7B)#8Avg.: 59.5
video-question-answering-on-next-qamPLUG-Owl3(8B)#17Accuracy: 78.6
video-question-answering-on-tvbenchmPLUG-Owl3#16Average Accuracy: 42.2
visual-question-answering-on-mm-vetmPLUG-Owl3#76GPT-4 score: 40.1
visual-question-answering-vqa-on-vlm2-benchmPLUG-Owl3-7B#5GC-mat: 17.37GC-trk: 18.26OC-cpr: 49.17OC-cnt: 62.97