Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
Open paper
Benchmark
Model
Rank
Results
audio-captioning-on-audiocaps
LOAE
#5
SPIDEr: 0.505
CIDEr: 0.816
SPICE: 0.193
METEOR: 0.267
FENSE: 0.664
…
audio-captioning-on-clotho
LOAE
#2
SPIDEr: 0.330
CIDEr: 0.513
SPICE: 0.147
METEOR: 0.197
FENSE: 0.538
…
Rank counts only results with a code link.