EVA: Exploring the Limits of Masked Visual Representation Learning at Scale

Benchmark Model Rank Results
action-classification-on-kinetics-400EVA#13Acc@1: 89.7
action-classification-on-kinetics-600EVA#11Top-1 Accuracy: 89.8%
action-classification-on-kinetics-700EVA#7Top-1 Accuracy: 82.9%
image-classification-on-imagenetEVA#13Top 1 Accuracy: 89.7%Number of params: 1000M
instance-segmentation-on-cocoEVA#3mask AP: 55.5AP50: 80.0APS: 36.3APM: 58.0APL: 72.4
instance-segmentation-on-coco-minivalEVA#4mask AP: 55.0AP50: 79.4AP75: 60.9APL: 72.0APM: 58.4APS: 37.6
instance-segmentation-on-lvis-v1-0-valEVA#2mask AP: 55.0
object-detection-on-cocoEVA#7box mAP: 64.7AP50: 81.9AP75: 71.7APS: 48.5APM: 67.7APL: 77.9
object-detection-on-coco-minivalEVA#9box AP: 64.5AP50: 82.1AP75: 70.8APS: 49.4APM: 68.4APL: 78.5
object-detection-on-coco-oEVA#1Average mAP: 57.8Effective Robustness: 28.86
object-detection-on-lvis-v1-0-valEVA#4box AP: 62.2box APr: 55.1
semantic-segmentation-on-ade20kEVA#6Validation mIoU: 62.3Params (M): 1074
semantic-segmentation-on-ade20k-valEVA#3mIoU: 61.5
semantic-segmentation-on-coco-stuff-testEVA#2mIoU: 53.4