| action-classification-on-kinetics-400 | MViTv2-L (ImageNet-21k pretrain) | #43 | Acc@1: 86.1Acc@5: 97.0 |
| action-classification-on-kinetics-400 | MViT-B (train from scratch) | #179 | FLOPs (G) x views: 225x5 |
| action-classification-on-kinetics-600 | MViTv2-L (ImageNet-21k pretrain) | #19 | Top-1 Accuracy: 87.9Top-5 Accuracy: 97.9 |
| action-classification-on-kinetics-600 | MViTv2-L (train from scratch) | #24 | Top-1 Accuracy: 85.5 |
| action-classification-on-kinetics-600 | MViTv2-B (train from scratch) | #54 | Top-5 Accuracy: 97.2 |
| action-classification-on-kinetics-600 | MViT-L (train from scratch) | #55 | GFLOPs: 206x5 |
| action-classification-on-kinetics-700 | MViTv2-L (ImageNet-21k pretrain) | #15 | Top-1 Accuracy: 79.4Top-5 Accuracy: 94.9 |
| action-classification-on-kinetics-700 | MoViNet-A6 | #16 | Top-1 Accuracy: 79.4 |
| action-classification-on-kinetics-700 | MViTv2-B | #17 | Top-1 Accuracy: 76.6Top-5 Accuracy: 93.2 |
| action-recognition-in-videos-on-something | MViTv2-L (IN-21K + Kinetics400 pretrain) | #21 | Top-1 Accuracy: 73.3Top-5 Accuracy: 94.1Parameters: 213.1 |
| action-recognition-in-videos-on-something | MViT-B (IN-21K + Kinetics400 pretrain) | #25 | Top-1 Accuracy: 72.1GFLOPs: 225x3 |
| action-recognition-in-videos-on-something | MViTv2-B (IN-21K + Kinetics400 pretrain) | #100 | Top-5 Accuracy: 93.4Parameters: 51.1 |
| action-recognition-in-videos-on-something | MViT-L (IN-21K + Kinetics400 pretrain) | #103 | GFLOPs: 2828x3 |
| action-recognition-on-ava-v2-2 | MViTv2-L (IN21k, K700) | #17 | mAP: 34.4 |
| image-classification-on-imagenet | MViTv2-H (512 res, ImageNet-21k pretrain) | #29 | Top 1 Accuracy: 88.8%Number of params: 667MGFLOPs: 763.5 |
| image-classification-on-imagenet | MViTv2-L (384 res, ImageNet-21k pretrain) | #47 | Top 1 Accuracy: 88.4%Number of params: 218MGFLOPs: 140.7 |
| image-classification-on-imagenet | MViTv2-H (mageNet-21k pretrain) | #61 | Top 1 Accuracy: 88%Number of params: 667MGFLOPs: 120.6 |
| image-classification-on-imagenet | MViTv2-L (384 res) | #154 | Top 1 Accuracy: 86.3%Number of params: 218MGFLOPs: 140.2 |
| image-classification-on-imagenet | MViTv2-T | #535 | Top 1 Accuracy: 82.3%Number of params: 24MGFLOPs: 4.7 |
| instance-segmentation-on-coco-minival | MViTv2-L (Cascade Mask R-CNN, multi-scale, IN21k pre-train) | #21 | mask AP: 50.5 |
| instance-segmentation-on-coco-minival | MViTv2-H (Cascade Mask R-CNN, single-scale, IN21k pre-train) | #33 | mask AP: 48.5 |
| instance-segmentation-on-coco-minival | MViTv2-L (Cascade Mask R-CNN, single-scale) | #37 | mask AP: 47.1 |
| instance-segmentation-on-coco-minival | MViT-L (Mask R-CNN, single-scale) | #42 | mask AP: 46.2 |
| object-detection-on-coco-minival | MViTv2-L (Cascade Mask R-CNN, multi-scale, IN21k pre-train) | #34 | box AP: 58.7 |
| object-detection-on-coco-minival | MViTv2-H (Cascade Mask R-CNN, single-scale, IN21k pre-train) | #46 | box AP: 56.1 |
| object-detection-on-coco-minival | MViTv2-L (Cascade Mask R-CNN, single-scale) | #57 | box AP: 54.3 |
| object-detection-on-coco-minival | MViT-L (Mask R-CNN, single-scale, IN21k pre-train) | #64 | box AP: 52.7 |
| object-detection-on-coco-o | MViTV2-H
(Cascade Mask R-CNN) | #16 | Average mAP: 30.9Effective Robustness: 5.62 |