Could Giant Pretrained Image Models Extract Universal Representations?

Benchmark Model Rank Results
action-recognition-in-videos-on-kinetics-400-1Frozen Backbone, SwinV2-G-ext22K (Video-Swin)Top-1 Accuracy: 81.7
instance-segmentation-on-coco-minivalFrozen Backbone, SwinV2-G-ext22K (HTC)mask AP: 51.6
object-detection-on-coco-minivalFrozen Backbone, SwinV2-G-ext22K (HTC)box AP: 59.3
semantic-segmentation-on-ade20kFrozen Backbone, SwinV2-G-ext22K (Mask2Former)Validation mIoU: 57.6