Global Context Vision Transformers

Benchmark Model Rank Results
image-classification-on-imagenetGC ViT-B#303Top 1 Accuracy: 84.5%Number of params: 90MGFLOPs: 14.8
image-classification-on-imagenetGC ViT-S#356Top 1 Accuracy: 84.0%Number of params: 51MGFLOPs: 8.5
image-classification-on-imagenetGC ViT-T#419Top 1 Accuracy: 83.4%Number of params: 28MGFLOPs: 4.7
image-classification-on-imagenetGC ViT-XT#569Top 1 Accuracy: 82.0%Number of params: 20MGFLOPs: 2.6
image-classification-on-imagenetGC ViT-XXT#700Top 1 Accuracy: 79.8%Number of params: 12MGFLOPs: 2.1
semantic-segmentation-on-ade20kGC ViT-B#139Validation mIoU: 49Params (M): 125GFLOPs (512 x 512): 1348
semantic-segmentation-on-ade20kGC ViT-S#146Validation mIoU: 48.3Params (M): 84GFLOPs (512 x 512): 1163
semantic-segmentation-on-ade20kGC ViT-T#170Validation mIoU: 46.5Params (M): 58GFLOPs (512 x 512): 947