TransNeXt: Robust Foveal Visual Perception for Vision Transformers

Benchmark Model Rank Results
domain-generalization-on-imagenet-aTransNeXt-Base (IN-1K supervised, 384)#14Top-1 accuracy %: 61.6Number of params: 89.7M
domain-generalization-on-imagenet-aTransNeXt-Small (IN-1K supervised, 384)#15Top-1 accuracy %: 58.3Number of params: 49.7M
domain-generalization-on-imagenet-aTransNeXt-Base (IN-1K supervised, 224)#18Top-1 accuracy %: 50.6Number of params: 89.7M
domain-generalization-on-imagenet-aTransNeXt-Small (IN-1K supervised, 224)#20Top-1 accuracy %: 47.1Number of params: 49.7M
image-classification-on-imagenetTransNeXt-Base (IN-1K supervised, 384)#165Top 1 Accuracy: 86.2%Number of params: 89.7MGFLOPs: 56.3
image-classification-on-imagenetTransNeXt-Small (IN-1K supervised, 384)#179Top 1 Accuracy: 86.0%Number of params: 49.7MGFLOPs: 32.1
image-classification-on-imagenetTransNeXt-Small (IN-1K supervised, 224)#294Top 1 Accuracy: 84.7%Number of params: 49.7MGFLOPs: 10.3
image-classification-on-imagenetTransNeXt-Tiny (IN-1K supervised, 224)#359Top 1 Accuracy: 84.0%Number of params: 28.2MGFLOPs: 5.7
image-classification-on-imagenetTransNeXt-Micro (IN-1K supervised, 224)#517Top 1 Accuracy: 82.5%Number of params: 12.8MGFLOPs: 2.7
object-detection-on-coco-minivalTransNeXt-Base (IN-1K pretrain, DINO 1x)#42box AP: 57.1
object-detection-on-coco-minivalTransNeXt-Small (IN-1K pretrain, DINO 1x)#44box AP: 56.6
object-detection-on-coco-minivalTransNeXt-Tiny (IN-1K pretrain, DINO 1x)#48box AP: 55.7
semantic-segmentation-on-ade20kTransNeXt-Base (IN-1K pretrain, Mask2Former, 512)#56Validation mIoU: 54.7Params (M): 109
semantic-segmentation-on-ade20kTransNeXt-Small (IN-1K pretrain, Mask2Former, 512)#66Validation mIoU: 54.1Params (M): 69
semantic-segmentation-on-ade20kTransNeXt-Tiny (IN-1K pretrain, Mask2Former, 512)#79Validation mIoU: 53.4Params (M): 47.5