| depth-estimation-on-nyu-depth-v2 | DINOv2 (ViT-g/14 frozen, w/ DPT decoder) | #2 | RMS: 0.279 |
| domain-generalization-on-imagenet-c | DINOv2 (ViT-g/14, frozen model, linear eval) | #1 | mean Corruption Error (mCE): 28.2Number of params: 1100M |
| domain-generalization-on-imagenet-c | DINOv2 (ViT-L/14, frozen model, linear eval) | #4 | mean Corruption Error (mCE): 31.5Number of params: 307M |
| domain-generalization-on-imagenet-c | DINOv2 (ViT-B/14, frozen model, linear eval) | #19 | mean Corruption Error (mCE): 42.7Number of params: 85M |
| domain-generalization-on-imagenet-c | DINOv2 (ViT-S/14, frozen model, linear eval) | #31 | mean Corruption Error (mCE): 54.4Number of params: 21M |
| fine-grained-image-classification-on-oxford-1 | DINOv2 (ViT-g/14, frozen model, linear eval) | #1 | Accuracy: 96.7 |
| image-classification-on-cifar-10 | DINOv2 (ViT-g/14, frozen model, linear eval) | #2 | Percentage correct: 99.5 |
| image-retrieval-on-amstertime | DINOv2 distilled (ViT-L/14 frozen) | #1 | mAP: 50.0 |
| image-retrieval-on-amstertime | DINOv2 (ViT-g/14 frozen) | #2 | mAP: 46.7 |
| image-retrieval-on-amstertime | DINOv2 distilled (ViT-B/14 frozen) | #3 | mAP: 45.6 |
| image-retrieval-on-amstertime | DINOv2 distilled (ViT-S/14 frozen) | #4 | mAP: 43.5 |
| monocular-depth-estimation-on-kitti-eigen | DINOv2 (ViT-g/14 frozen, w/ DPT decoder) | #36 | absolute relative error: 0.0652RMSE: 2.1128Sq Rel: 0.1797… |
| monocular-depth-estimation-on-nyu-depth-v2 | DINOv2 (ViT-g/14 frozen, w/ DPT decoder) | #33 | absolute relative error: 0.0907RMSE: 0.279log 10: 0.0371… |
| self-supervised-image-classification-on-1 | DINOv2 (ViT-g/14, 448) | #1 | Top 1 Accuracy: 88.9%Number of Params: 1100M |
| self-supervised-image-classification-on-1 | DINOv2 (ViT-g/14) | #3 | Top 1 Accuracy: 88.5%Number of Params: 1100M |
| self-supervised-image-classification-on-imagenet | DINOv2 (ViT-g/14 @448) | #2 | Top 1 Accuracy: 86.7%Number of Params: 1100M |
| self-supervised-image-classification-on-imagenet | DINOv2 (ViT-g/14) | #3 | Top 1 Accuracy: 86.5%Number of Params: 1100M |
| self-supervised-image-classification-on-imagenet | DINOv2 distilled (ViT-L/14) | #4 | Top 1 Accuracy: 86.3%Number of Params: 307M |
| self-supervised-image-classification-on-imagenet | DINOv2 distilled (ViT-B/14) | #6 | Top 1 Accuracy: 84.5%Number of Params: 85M |
| self-supervised-image-classification-on-imagenet | DINOv2 distilled (ViT-S/14) | #17 | Top 1 Accuracy: 81.1%Number of Params: 21M |
| semantic-segmentation-on-ade20k | DINOv2 (ViT-g/14 frozen model, w/ ViT-Adapter + Mask2former) | #13 | Validation mIoU: 60.2Params (M): 1080 |
| semantic-segmentation-on-fine-grained-grass | DINOv2 | #8 | mIoU: 47.57 |
| visual-place-recognition-on-17-places | DINOv2 | #5 | Recall@1: 61.82 |
| visual-place-recognition-on-baidu-mall | DINOv2 | #6 | Recall@1: 49.21 |
| visual-place-recognition-on-gardens-point | DINOv2 | #5 | Recall@1: 71.50 |
| visual-place-recognition-on-hawkins | DINOv2 | #6 | Recall@1: 27.97 |
| visual-place-recognition-on-laurel-caverns | DINOv2 | #3 | Recall@1: 40.18 |
| visual-place-recognition-on-mid-atlantic | DINOv2 | #6 | Recall@1: 24.75 |
| visual-place-recognition-on-nardo-air | DINOv2 | #2 | Recall@1: 73.24 |
| visual-place-recognition-on-nardo-air-r | DINOv2 | #6 | Recall@1: 71.83 |
| visual-place-recognition-on-oxford-robotcar-4 | DINOv2 | #5 | Recall@1: 39.79 |
| visual-place-recognition-on-pittsburgh-30k | DINOv2 | #18 | Recall@1: 78.32 |
| visual-place-recognition-on-st-lucia | DINOv2 | #9 | Recall@1: 78.62 |
| visual-place-recognition-on-vp-air | DINOv2 | #2 | Recall@1: 45.23 |