| image-classification-on-imagenet | dBOT ViT-H (CLIP as Teacher) | #56 | Top 1 Accuracy: 88.2% |
| image-classification-on-imagenet | dBOT ViT-L (CLIP as Teacher) | #71 | Top 1 Accuracy: 87.8% |
| image-classification-on-imagenet | dBOT ViT-B (CLIP as Teacher) | #204 | Top 1 Accuracy: 85.7% |
| instance-segmentation-on-coco | dBOT ViT-L (CLIP) | #25 | mask AP: 48.8 |
| instance-segmentation-on-coco | dBOT ViT-L | #28 | mask AP: 48.3 |
| instance-segmentation-on-coco | dBOT ViT-B | #35 | mask AP: 46.3 |
| instance-segmentation-on-coco | dBOT ViT-B (CLIP) | #36 | mask AP: 46.2 |
| object-detection-on-coco | dBOT ViT-L (CLIP) | #38 | box mAP: 56.8 |
| object-detection-on-coco | dBOT ViT-L | #44 | box mAP: 56.1 |
| object-detection-on-coco | dBOT ViT-B (CLIP) | #58 | box mAP: 53.6 |
| object-detection-on-coco | dBOT ViT-B | #61 | box mAP: 53.5 |
| self-supervised-image-classification-on-1 | dBOT (ViT-H/14) | #6 | Top 1 Accuracy: 88.0%Number of Params: 632M |
| semantic-segmentation-on-ade20k | dBOT ViT-L (CLIP) | #40 | Validation mIoU: 56.2 |
| semantic-segmentation-on-ade20k | dBOT ViT-L | #47 | Validation mIoU: 55.2 |
| semantic-segmentation-on-ade20k | dBOT ViT-B (CLIP) | #82 | Validation mIoU: 52.9 |
| semantic-segmentation-on-ade20k | dBOT ViT-B | #106 | Validation mIoU: 50.8 |