Multi-Scale Vision Longformer: A New Vision Transformer for High-Resolution Image Encoding

Benchmark Model Rank Results
image-classification-on-imagenetViL-Medium-D#427Top 1 Accuracy: 83.3%Number of params: 39.7MGFLOPs: 8.7
image-classification-on-imagenetViL-Base-D#438Top 1 Accuracy: 83.2%Number of params: 55.7MGFLOPs: 13.4
image-classification-on-imagenetViL-Medium-W#470Top 1 Accuracy: 82.9%Number of params: 39.8M
image-classification-on-imagenetViL-Small#562Top 1 Accuracy: 82%Number of params: 24.6MGFLOPs: 4.86
image-classification-on-imagenetViL-Base-W#573Top 1 Accuracy: 81.9%Number of params: 79MGFLOPs: 6.74
image-classification-on-imagenetViL-Tiny-RPB#847Top 1 Accuracy: 76.7%Number of params: 6.7MGFLOPs: 1.3
instance-segmentation-on-coco-minivalMask R-CNN (ViL Base, multi-scale, 3x lr)#45mask AP: 45.7AP75: 49.9
instance-segmentation-on-coco-minivalMask R-CNN (ViL Base, 1x lr)#46mask AP: 45.1AP50: 67.2AP75: 49.3
object-detection-on-coco-minivalRetinaNet (ViL-Base, multi-scale, 3x)#124box AP: 44.7AP75: 47.6APS: 29.9APM: 48APL: 58.1
object-detection-on-coco-minivalRetinaNet (ViL-Base)#132box AP: 44.3AP50: 65.5AP75: 47.1APS: 28.9APM: 47.9APL: 58.3