EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
Open paper
Benchmark
Model
Rank
Results
audio-captioning-on-audiocaps
EnCLAP-large
#7
SPIDEr: 0.4954
CIDEr: 0.8029
SPICE: 0.1879
METEOR: 0.2554
audio-captioning-on-audiocaps
EnCLAP-base
#8
SPIDEr: 0.4829
CIDEr: 0.7795
SPICE: 0.1863
METEOR: 0.2473
Rank counts only results with a code link.