Exploring Train and Test-Time Augmentations for Audio-Language Learning
Open paper
Benchmark
Model
Rank
Results
audio-captioning-on-audiocaps
AL-MixGen
–
SPIDEr: 0.466
CIDEr: 0.755
SPICE: 0.177
text-to-audio-retrieval-on-audiocaps
AL-MixGen + Multi-TTA
–
R@1: 34.7
R@10: 83.3
Rank counts only results with a code link.