Learning Video Representations from Large Language Models

Benchmark Model Rank Results
action-recognition-on-charades-egoLaViLa (Finetuned, TimeSformer-L)#1mAP: 36.1
action-recognition-on-charades-egoLaViLa (Zero-shot, TimeSformer-L)#5mAP: 28.9
action-recognition-on-epic-kitchens-100LaViLa (TimeSformer-L)#5Action@1: 51Verb@1: 72Noun@1: 62.9
egocentric-activity-recognition-on-egtea-1LaViLa (Finetuned, TimeSformer-L)#1Average Accuracy: 81.75Mean class accuracy: 76