Cooperative Learning of Audio and Video Models from Self-Supervised Synchronization
Open paper
Benchmark
Model
Rank
Results
audio-classification-on-esc-50
AVTS
–
Top-1 Accuracy: 82.3
self-supervised-action-recognition-on-hmdb51-1
AVTS
–
Top-1 Accuracy: 61.6
self-supervised-action-recognition-on-ucf101-1
AVTS
–
3-fold Accuracy: 89.0
Rank counts only results with a code link.