Frozen Transformers in Language Models Are Effective Visual Encoder Layers
Open paper
Benchmark
Model
Rank
Results
question-answering-on-sqa3d
LM4VisualEncoding
#4
AnswerExactMatch (Question Answering): 48.09
Rank counts only results with a code link.