DINOv2: Learning Robust Visual Features without Supervision

Benchmark Model Rank Results
depth-estimation-on-nyu-depth-v2DINOv2 (ViT-g/14 frozen, w/ DPT decoder)#2RMS: 0.279
domain-generalization-on-imagenet-cDINOv2 (ViT-g/14, frozen model, linear eval)#1mean Corruption Error (mCE): 28.2Number of params: 1100M
domain-generalization-on-imagenet-cDINOv2 (ViT-L/14, frozen model, linear eval)#4mean Corruption Error (mCE): 31.5Number of params: 307M
domain-generalization-on-imagenet-cDINOv2 (ViT-B/14, frozen model, linear eval)#19mean Corruption Error (mCE): 42.7Number of params: 85M
domain-generalization-on-imagenet-cDINOv2 (ViT-S/14, frozen model, linear eval)#31mean Corruption Error (mCE): 54.4Number of params: 21M
fine-grained-image-classification-on-oxford-1DINOv2 (ViT-g/14, frozen model, linear eval)#1Accuracy: 96.7
image-classification-on-cifar-10DINOv2 (ViT-g/14, frozen model, linear eval)#2Percentage correct: 99.5
image-retrieval-on-amstertimeDINOv2 distilled (ViT-L/14 frozen)#1mAP: 50.0
image-retrieval-on-amstertimeDINOv2 (ViT-g/14 frozen)#2mAP: 46.7
image-retrieval-on-amstertimeDINOv2 distilled (ViT-B/14 frozen)#3mAP: 45.6
image-retrieval-on-amstertimeDINOv2 distilled (ViT-S/14 frozen)#4mAP: 43.5
monocular-depth-estimation-on-kitti-eigenDINOv2 (ViT-g/14 frozen, w/ DPT decoder)#36absolute relative error: 0.0652RMSE: 2.1128Sq Rel: 0.1797
monocular-depth-estimation-on-nyu-depth-v2DINOv2 (ViT-g/14 frozen, w/ DPT decoder)#33absolute relative error: 0.0907RMSE: 0.279log 10: 0.0371
self-supervised-image-classification-on-1DINOv2 (ViT-g/14, 448)#1Top 1 Accuracy: 88.9%Number of Params: 1100M
self-supervised-image-classification-on-1DINOv2 (ViT-g/14)#3Top 1 Accuracy: 88.5%Number of Params: 1100M
self-supervised-image-classification-on-imagenetDINOv2 (ViT-g/14 @448)#2Top 1 Accuracy: 86.7%Number of Params: 1100M
self-supervised-image-classification-on-imagenetDINOv2 (ViT-g/14)#3Top 1 Accuracy: 86.5%Number of Params: 1100M
self-supervised-image-classification-on-imagenetDINOv2 distilled (ViT-L/14)#4Top 1 Accuracy: 86.3%Number of Params: 307M
self-supervised-image-classification-on-imagenetDINOv2 distilled (ViT-B/14)#6Top 1 Accuracy: 84.5%Number of Params: 85M
self-supervised-image-classification-on-imagenetDINOv2 distilled (ViT-S/14)#17Top 1 Accuracy: 81.1%Number of Params: 21M
semantic-segmentation-on-ade20kDINOv2 (ViT-g/14 frozen model, w/ ViT-Adapter + Mask2former)#13Validation mIoU: 60.2Params (M): 1080
semantic-segmentation-on-fine-grained-grassDINOv2#8mIoU: 47.57
visual-place-recognition-on-17-placesDINOv2#5Recall@1: 61.82
visual-place-recognition-on-baidu-mallDINOv2#6Recall@1: 49.21
visual-place-recognition-on-gardens-pointDINOv2#5Recall@1: 71.50
visual-place-recognition-on-hawkinsDINOv2#6Recall@1: 27.97
visual-place-recognition-on-laurel-cavernsDINOv2#3Recall@1: 40.18
visual-place-recognition-on-mid-atlanticDINOv2#6Recall@1: 24.75
visual-place-recognition-on-nardo-airDINOv2#2Recall@1: 73.24
visual-place-recognition-on-nardo-air-rDINOv2#6Recall@1: 71.83
visual-place-recognition-on-oxford-robotcar-4DINOv2#5Recall@1: 39.79
visual-place-recognition-on-pittsburgh-30kDINOv2#18Recall@1: 78.32
visual-place-recognition-on-st-luciaDINOv2#9Recall@1: 78.62
visual-place-recognition-on-vp-airDINOv2#2Recall@1: 45.23