Small Language Model Meets with Reinforced Vision Vocabulary
Open paper
Benchmark
Model
Rank
Results
visual-question-answering-on-mm-vet
Vary-toy
–
GPT-4 score: 29.0
Params: 1.8B
Rank counts only results with a code link.