Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-mm-vet
LLaVA1.5-13B-MDA
–
GPT-4 score: 39.90
Params: 13B
visual-question-answering-on-mm-vet
LLaVA1.5-7B-MDA
–
GPT-4 score: 35.20
Params: 7B
Rank counts only results with a code link.