MeLFusion: Synthesizing Music from Image and Language Cues using Diffusion Models
Open paper
Benchmark
Model
Rank
Results
text-to-music-generation-on-musiccaps
MeLFusion (image-conditioned)
#1
FAD: 1.12
FD: 22.65
KL_passt: 0.89
Rank counts only results with a code link.