| 3d-point-cloud-classification-on-modelnet40-c | OmniVec | – | Error Rate: 0.156 |
| 3d-point-cloud-classification-on-scanobjectnn | OmniVec | – | Overall Accuracy: 96.1 |
| action-classification-on-kinetics-400 | OmniVec | – | Acc@1: 91.1 |
| action-classification-on-moments-in-time-2 | OmniVec | – | Top 1 Accuracy: 49.8 |
| action-recognition-in-videos-on-ucf101 | OmniVec | – | 3-fold Accuracy: 99.6 |
| audio-classification-on-audioset | OmniVec | – | Test mAP: 0.548 |
| audio-classification-on-esc-50 | OmniVec | – | Top-1 Accuracy: 98.4PRE-TRAINING DATASET: Multiple… |
| audio-tagging-on-audioset | OmniVec (audio+visual) | – | mean average precision: 0.552 |
| audio-tagging-on-audioset | OmniVec (audio-only) | – | mean average precision: 0.548 |
| fine-grained-image-classification-on-oxford-1 | OmniVec | – | Accuracy: 99.2 |
| image-classification-on-inaturalist-2018 | OmniVec | – | Top-1 Accuracy: 93.8 |
| image-classification-on-places365 | OmniVec(ViT) | – | Top 1 Accuracy: 63.5 |
| semantic-segmentation-on-nyu-depth-v2 | OmniVec | – | Mean IoU: 60.8 |
| semantic-segmentation-on-s3dis-area5 | OmniVec | – | mIoU: 75.9 |
| text-summarization-on-dialogsum | OmniVec | – | Rouge1: 46.91Rouge2: 21.22RougeL: 40.19BertScore: 71.91 |
| video-retrieval-on-msr-vtt-1ka | OmniVec | – | text-to-video R@10: 89.4 |
| video-retrieval-on-msr-vtt-1ka | OmniVec (pretrained) | – | text-to-video R@10: 78.6 |
| video-retrieval-on-youcook2 | OmniVec | – | text-to-video R@10: 70.8 |
| video-retrieval-on-youcook2 | OmniVec (pretrained) | – | text-to-video R@10: 64.2 |