Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding

Benchmark Model Rank Results
audio-captioning-on-audiocapsLOAE#5SPIDEr: 0.505CIDEr: 0.816SPICE: 0.193METEOR: 0.267FENSE: 0.664
audio-captioning-on-clothoLOAE#2SPIDEr: 0.330CIDEr: 0.513SPICE: 0.147METEOR: 0.197FENSE: 0.538