AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining

Benchmark Model Rank Results
audio-generation-on-audiocapsAudioLDM2-large#8FD_openl3: 158.04FAD: 2.02FD: 26.18KL_passt: 1.68IS: 8.55
audio-generation-on-audiocapsAudioLDM 2-AC-Large#11FAD: 1.42CLAP_LAION: 0.243
text-to-music-generation-on-musiccapsAudioLDM2-large#7FAD: 2.93FD_openl3: 190.16FD: 16.34KL_passt: 1.00IS: 2.59
text-to-music-generation-on-musiccapsAudioLDM 2-Full#8FAD: 3.13KL_passt: 1.20
text-to-music-generation-on-musiccapsAudioLDM2-music#18FD_openl3: 354.05KL_passt: 1.53