CogVLM: Visual Expert for Pretrained Language Models

Benchmark Model Rank Results
fs-mevqa-on-smeGLM-4V#5BLEU-4: 14.45METEOR: 17.53ROUGE-L: 24.28CIDEr: 127.37
long-context-understanding-on-mmneedleCogVLM2-Llama-3#71 Image, 4*4 Stitching, Exact Accuracy: 0.9
long-context-understanding-on-mmneedleCogVLM-17B#91 Image, 4*4 Stitching, Exact Accuracy: 0.1
visual-question-answering-on-mm-vetGLM4 Vision#18GPT-4 score: 63.9
visual-question-answering-on-mm-vetCogVLM(Vicuna-7B)#39GPT-4 score: 52.8Params: 17B
visual-question-answering-on-mm-vet-v2CogVLM-Chat#10GPT-4 score: 45.1±0.2
visual-question-answering-vqa-on-core-mmCogVLM-Chat#4Overall score: 37.16Deductive: 36.75Abductive: 47.88