PACS: A Dataset for Physical Audiovisual CommonSense Reasoning

Benchmark Model Rank Results
physical-commonsense-reasoning-on-physicalHuman#1With Audio (Acc %): 96.3 ± 2.1Without Audio (Acc %): 90.5 ± 3.1
physical-commonsense-reasoning-on-physicalMerlot Reserve (Large)#2With Audio (Acc %): 70.1 ± 1.0Without Audio (Acc %): 68.4 ± 0.7
physical-commonsense-reasoning-on-physicalCLIP/AudioCLIP#3With Audio (Acc %): 60.0 ± 0.9Without Audio (Acc %): 56.3 ± 0.7
physical-commonsense-reasoning-on-physicalLate Fusion#4With Audio (Acc %): 55.0 ± 1.1Without Audio (Acc %): 52.5 ± 1.6
physical-commonsense-reasoning-on-physicalMajority#5With Audio (Acc %): 50.4Without Audio (Acc %): 50.4
physical-commonsense-reasoning-on-physicalUNITER (Large)#6Without Audio (Acc %): 60.6 ± 2.2