EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning

Benchmark Model Rank Results
audio-captioning-on-audiocapsEnCLAP-large#7SPIDEr: 0.4954CIDEr: 0.8029SPICE: 0.1879METEOR: 0.2554
audio-captioning-on-audiocapsEnCLAP-base#8SPIDEr: 0.4829CIDEr: 0.7795SPICE: 0.1863METEOR: 0.2473