LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport
Open paper
Benchmark
Model
Rank
Results
audio-captioning-on-audiocaps
LAVCap
#2
SPIDEr: 0.517
CIDEr: 0.849
SPICE: 0.185
BLEU-4: 0.297
METEOR: 0.262
…
Rank counts only results with a code link.