Enhancing Retrieval-Augmented Audio Captioning with Generation-Assisted Multimodal Querying and Progressive Learning
Open paper
Benchmark
Model
Rank
Results
audio-captioning-on-audiocaps
MQ-Cap
–
SPIDEr: 0.519
CIDEr: 0.845
SPICE: 0.194
BLEU-4: 0.301
METEOR: 0.266
audio-captioning-on-clotho
MQ-Cap
–
SPIDEr: 0.319
CIDEr: 0.496
SPICE: 0.143
BLEU-4: 18.1
METEOR: 0.192
Rank counts only results with a code link.