DAT++: Spatially Dynamic Vision Transformer with Deformable Attention

Benchmark Model Rank Results
image-classification-on-imagenetDAT-B++ (384x384)#183Top 1 Accuracy: 85.9%Number of params: 94MGFLOPs: 49.7
image-classification-on-imagenetDAT-B++ (224x224)#274Top 1 Accuracy: 84.9%Number of params: 93MGFLOPs: 16.6
image-classification-on-imagenetDAT-S++#298Top 1 Accuracy: 84.6%Number of params: 53MGFLOPs: 9.4
image-classification-on-imagenetDAT-T++#369Top 1 Accuracy: 83.9%Number of params: 24MGFLOPs: 4.3
object-detection-on-coco-2017DAT-S++#4AP: 50.2
object-detection-on-coco-2017DAT-T++#5AP: 49.2
semantic-segmentation-on-ade20kDAT-B++#93Validation mIoU: 51.5
semantic-segmentation-on-ade20kDAT-S++#96Validation mIoU: 51.2
semantic-segmentation-on-ade20kDAT-T++#112Validation mIoU: 50.3