Object-Region Video Transformers

Benchmark Model Rank Results
action-recognition-in-videos-on-somethingORViT Mformer-L (ORViT blocks)#40Top-1 Accuracy: 69.5Top-5 Accuracy: 91.5Parameters: N/AGFLOPs: N/A
action-recognition-in-videos-on-somethingORViT Mformer (ORViT blocks)#49Top-1 Accuracy: 67.9Top-5 Accuracy: 90.5Parameters: N/AGFLOPs: N/A
action-recognition-on-ava-v2-2ORViT MViT-B, 16x4 (K400 pretraining)#32mAP: 26.6
action-recognition-on-diving-48ORViT TimeSformer#4Accuracy: 88.0
action-recognition-on-epic-kitchens-100ORViT Mformer-L (ORViT blocks)#12Action@1: 45.7Verb@1: 68.4Noun@1: 58.7