Improving Text-To-Audio Models with Synthetic Captions

Benchmark Model Rank Results
audio-generation-on-audiocapsTango-AF&AC-FT-AC#19FAD: 2.54FD: 17.19IS: 11.04CLAP_LAION: 0.527
text-to-music-generation-on-musiccapsTANGO-AF#6FAD: 2.21FD_openl3: 270.32FD: 22.69KL_passt: 0.94IS: 2.79