Affordance Grounding from Demonstration Video to Target Image

Benchmark Model Rank Results
video-to-image-affordance-grounding-on-epicAfformer#1KLD: 0.97SIM: 0.56AUC-J: 0.88
video-to-image-affordance-grounding-on-opraAfformer (ViTDet-B encoder)#1KLD: 1.51Top-1 Action Accuracy: 52.27
video-to-image-affordance-grounding-on-opraAfformer (ResNet-50-FPN encoder)#2KLD: 1.55Top-1 Action Accuracy: 52.14
video-to-image-affordance-grounding-on-opra-1Afformer#1KLD: 1.05SIM: 0.53AUC-J: 0.89