Enhancing Retrieval-Augmented Audio Captioning with Generation-Assisted Multimodal Querying and Progressive Learning

Benchmark Model Rank Results
audio-captioning-on-audiocapsMQ-CapSPIDEr: 0.519CIDEr: 0.845SPICE: 0.194BLEU-4: 0.301METEOR: 0.266
audio-captioning-on-clothoMQ-CapSPIDEr: 0.319CIDEr: 0.496SPICE: 0.143BLEU-4: 18.1METEOR: 0.192