MeLFusion: Synthesizing Music from Image and Language Cues using Diffusion Models

Benchmark Model Rank Results
text-to-music-generation-on-musiccapsMeLFusion (image-conditioned)#1FAD: 1.12FD: 22.65KL_passt: 0.89