CogAgent: A Visual Language Model for GUI Agents

Benchmark Model Rank Results
natural-language-visual-grounding-onCogAgent#13Accuracy (%): 47.4
visual-question-answering-on-mm-vetCogAgent#40GPT-4 score: 52.8Params: 18B
visual-question-answering-on-mm-vet-v2CogAgent-Chat#13GPT-4 score: 34.7±0.2