ETTA: Elucidating the Design Space of Text-to-Audio Models

Benchmark Model Rank Results
audio-generation-on-audiocapsETTA-FT-AC-100k#1FD_openl3: 61.79FAD: 2.03FD: 10.10KL_passt: 1.13IS: 14.29
audio-generation-on-audiocapsETTA#5FD_openl3: 80.13FAD: 2.51FD: 13.12KL_passt: 1.22IS: 14.36
text-to-music-generation-on-musiccapsETTA#4FAD: 1.91FD_openl3: 92.18FD: 10.06KL_passt: 0.84IS: 3.32