MMFuser: Multimodal Multi-Layer Feature Fuser for Fine-Grained Vision-Language Understanding
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-mm-vet
LLaVA-1.5-13B (+ MMFuser)
#95
GPT-4 score: 36.6
Rank counts only results with a code link.