SpectFormer: Frequency and Attention is what you need in a Vision Transformer

Benchmark Model Rank Results
object-detection-on-coco-val2017SpectFormer-B (Mask R-CNN)–box AP: 46.9AP50: 68.8AP75: 51.8
object-detection-on-coco-val2017SpectFormer-B (RetinaNet)–box AP: 46.0AP50: 66.4AP75: 49.7APS: 29.5APM: 49.7APL: 61.1
object-detection-on-coco-val2017SpectFormer-H-S (Cascade Mask R-CNN 3x)–box AP: 51.5AP50: 70.2AP75: 56.3
object-detection-on-coco-val2017SpectFormer-H-S (GFL 3x)–box AP: 50.3AP50: 70.0AP75: 55.2