DaViT: Dual Attention Vision Transformers

Benchmark Model Rank Results
image-classification-on-imagenetDaViT-G#4Top 1 Accuracy: 90.4%Number of params: 1437MGFLOPs: 1038
image-classification-on-imagenetDaViT-H#6Top 1 Accuracy: 90.2%Number of params: 362MGFLOPs: 334
image-classification-on-imagenetDaViT-L (ImageNet-22k)#82Top 1 Accuracy: 87.5%Number of params: 196.8MGFLOPs: 103
image-classification-on-imagenetDaViT-B (ImageNet-22k)#115Top 1 Accuracy: 86.9%Number of params: 87.9MGFLOPs: 46.4
image-classification-on-imagenetDaViT-B#296Top 1 Accuracy: 84.6%Number of params: 87.9MGFLOPs: 15.5
image-classification-on-imagenetDaViT-T#484Top 1 Accuracy: 82.8%Number of params: 28.3M
instance-segmentation-on-coco-minivalDaViT-T (Mask R-CNN, 36 epochs)#54mask AP: 44.3
object-detection-on-coco-minivalDaViT-T (Mask R-CNN, 36 epochs)#82box AP: 49.9
semantic-segmentation-on-ade20kDaViT-B#129Validation mIoU: 49.4
semantic-segmentation-on-ade20kDaViT-T#173Validation mIoU: 46.3
semantic-segmentation-on-ade20k-valDaViT-S (UperNet)#59mIoU: 48.8
semantic-segmentation-on-ade20k-valDaViT-B (UperNet)#66mIoU: 46.3