LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport

Benchmark Model Rank Results
audio-captioning-on-audiocapsLAVCap#2SPIDEr: 0.517CIDEr: 0.849SPICE: 0.185BLEU-4: 0.297METEOR: 0.262