EnCLAP++: Analyzing the EnCLAP Framework for Optimizing Automated Audio Captioning Performance

Benchmark Model Rank Results
audio-captioning-on-audiocapsEnCLAP++-large#3SPIDEr: 0.510CIDEr: 0.823SPICE: 0.197METEOR: 0.269FENSE: 0.665
audio-captioning-on-audiocapsEnCLAP++-base#6SPIDEr: 0.501CIDEr: 0.815SPICE: 0.188METEOR: 0.257FENSE: 0.661