Hiera: A Hierarchical Vision Transformer without the Bells-and-Whistles

Benchmark Model Rank Results
action-classification-on-kinetics-400Hiera-H (no extra data)#27Acc@1: 87.8
action-classification-on-kinetics-600Hiera-H (no extra data)#15Top-1 Accuracy: 88.8
action-classification-on-kinetics-700Hiera-H (no extra data)#11Top-1 Accuracy: 81.1
action-recognition-in-videos-on-somethingHiera-L (no extra data)#7Top-1 Accuracy: 76.5
action-recognition-on-ava-v2-2Hiera-H (K700 PT+FT)#2mAP: 43.3
image-classification-on-imagenetHiera-H#118Top 1 Accuracy: 86.9%
image-classification-on-inaturalistHiera-H (448px)#2Top 1 Accuracy: 83.8
image-classification-on-inaturalist-2018Hiera-H (448px)#4Top-1 Accuracy: 87.3%
image-classification-on-inaturalist-2019Hiera-H (448px)#1Top-1 Accuracy: 88.5
image-classification-on-places365-standardHiera-H (448px)#2Top 1 Accuracy: 60.6
instance-segmentation-on-coco-minivalHeira-L#32mask AP: 48.6
object-detection-on-coco-minivalHiera-L#52box AP: 55