Improving Text-To-Audio Models with Synthetic Captions
Open paper
Benchmark
Model
Rank
Results
audio-generation-on-audiocaps
Tango-AF&AC-FT-AC
#19
FAD: 2.54
FD: 17.19
IS: 11.04
CLAP_LAION: 0.527
text-to-music-generation-on-musiccaps
TANGO-AF
#6
FAD: 2.21
FD_openl3: 270.32
FD: 22.69
KL_passt: 0.94
IS: 2.79
…
Rank counts only results with a code link.