Frozen Transformers in Language Models Are Effective Visual Encoder Layers

Benchmark Model Rank Results
question-answering-on-sqa3dLM4VisualEncoding#4AnswerExactMatch (Question Answering): 48.09