AudioCaps: Generating Captions for Audios in The Wild

Benchmark Model Rank Results
audio-captioning-on-audiocapsTopDown-AlignedAtt (1NN)SPIDEr: 0.369CIDEr: 0.593SPICE: 0.144