Uniform Masking: Enabling MAE Pre-training for Pyramid-based Vision Transformers with Locality

Benchmark Model Rank Results
object-detection-on-coco-minivalUM-MAE(HTC++, Swin-L, IN1K)#39box AP: 57.4