Rethinking and Improving Relative Position Encoding for Vision Transformer

Benchmark Model Rank Results
image-classification-on-imagenetDeiT-B with iRPE-K#522Top 1 Accuracy: 82.4%Number of params: 87MGFLOPs: 35.368
image-classification-on-imagenetDeiT-S with iRPE-QKV#617Top 1 Accuracy: 81.4%GFLOPs: 9.770
image-classification-on-imagenetDeiT-S with iRPE-QK#635Top 1 Accuracy: 81.1%GFLOPs: 9.412
image-classification-on-imagenetDeiT-S with iRPE-K#648Top 1 Accuracy: 80.9%Number of params: 22MGFLOPs: 9.318
image-classification-on-imagenetDeiT-Ti with iRPE-K#923Top 1 Accuracy: 73.7%Number of params: 6MGFLOPs: 2.568
object-detection-on-coco-minivalDETR-ResNet50 with iRPE-K (300 epochs)#156box AP: 42.3
object-detection-on-coco-minivalDETR-ResNet50 with iRPE-K (150 epochs)#174box AP: 40.8