DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos

Benchmark Model Rank Results
natural-language-moment-retrieval-on-madDeCafNet#2R@1,IoU=0.1: 13.25R@1,IoU=0.3: 10.96R@1,IoU=0.5: 7.06
natural-language-moment-retrieval-on-tacosDeCafNet#3R@1,IoU=0.3: 57.36R@1,IoU=0.5: 46.79R@5,IoU=0.1: 81.05
natural-language-queries-on-ego4dDeCafNet-100%#2R@1 Mean(0.3 and 0.5): 18.86R@1 IoU=0.3: 22.21R@1 IoU=0.5: 15.52
natural-language-queries-on-ego4dDeCafNet-50%#3R@1 Mean(0.3 and 0.5): 17.93R@1 IoU=0.3: 20.81R@1 IoU=0.5: 15.04
natural-language-queries-on-ego4dDeCafNet-50% (no NaQ)#5R@1 Mean(0.3 and 0.5): 15.32R@1 IoU=0.3: 18.10R@1 IoU=0.5: 12.55
temporal-sentence-grounding-on-charades-staDeCafNet#1R1@0.7: 47.55R1@0.5: 68.79R5@0.7: 72.96R5@0.5: 91.53
temporal-sentence-grounding-on-ego4d-goalstepDeCafNet-100%#1R@1,IoU=0.3: 23.20R@1,IoU=0.5: 19.40R@5,IoU=0.3: 51.38
temporal-sentence-grounding-on-ego4d-goalstepDeCafNet-50%#2R@1,IoU=0.3: 21.29R@1,IoU=0.5: 17.46R@5,IoU=0.3: 47.27