Advancing Plain Vision Transformer Towards Remote Sensing Foundation Model

Benchmark Model Rank Results
object-detection-in-aerial-images-on-dior-rViTAE-B + RVSA-ORCN#4mAP: 71.05
object-detection-in-aerial-images-on-dior-rViT-B + RVSA-ORCN#5mAP: 70.85
object-detection-in-aerial-images-on-dotaViTAE-B + RVSA-ORCN#11mAP: 81.24%
object-detection-in-aerial-images-on-dotaViT-B + RVSA-ORCN#13mAP: 81.01%
semantic-segmentation-on-isaidViTAE-B + RVSA-UperNet#13mIoU: 64.49
semantic-segmentation-on-isaidViT-B + RVSA-UperNet#16mIoU: 63.85
semantic-segmentation-on-isprs-potsdamViTAE-B + RVSA -UperNet#9Overall Accuracy: 91.22
semantic-segmentation-on-isprs-potsdamViT-B + RVSA-UperNet#13Overall Accuracy: 90.77
semantic-segmentation-on-lovedaViTAE-B + RVSA-UperNet#12Category mIoU: 52.44
semantic-segmentation-on-lovedaViT-B + RVSA-UperNet#15Category mIoU: 51.95