Exploring Train and Test-Time Augmentations for Audio-Language Learning

Benchmark Model Rank Results
audio-captioning-on-audiocapsAL-MixGenSPIDEr: 0.466CIDEr: 0.755SPICE: 0.177
text-to-audio-retrieval-on-audiocapsAL-MixGen + Multi-TTAR@1: 34.7R@10: 83.3